什么是 核岭回归(KRR)?

核岭回归(KRR)是一种监督回归方法,它最小化平方预测误差与 RKHS Norm Penalty,并通过训练样本 Kernel Evaluation 的加权展开生成预测。

快速了解

全称Kernel Ridge Regression
规范文档官方规范

工作原理

用 Representer Theorem 得到有限解

RKHS 上的 Regularized Empirical-risk Problem 看似无限维,但在 Generalized Representer Theorem 条件下,Minimizer 可写成 f(.) = sum_i alpha_i k(x_i, .),从而把估计问题化为依附于训练样本的有限 Coefficient。

Generalized Representer Theorem覆盖一类广泛 Loss 与 Strictly Increasing Regularizer。它只保证 Expansion Form,不会证明所选 Kernel 正确、任意 Objective 都有唯一解,或所得模型具有足够统计质量。

一致地求解正则化 Kernel System

对 Squared Loss 和一种常见 Objective Scaling,一阶条件给出 (K + lambda I) alpha = y。另一些资料会把 Loss 除以 n,从而得到 (K + n lambda I) alpha = y;在统一这种约定前,不同 Library 的参数不能直接比较。

应使用稳定 Factorization 或 Iterative Solver,而不是显式求逆。正 lambda 会改善 Conditioning,但重复样本、极端 Kernel 参数、未缩放 Target 与过小正则仍会造成不稳定系数。Intercept 和 Sample Weight 也必须遵循明确 Objective。

分别验证泛化、成本与不确定性

精确拟合需要保存 n by n Kernel Matrix,预测通常还要把每个 Query 与保留的训练 Reference 比较。应在每个 Training Fold 内联合选择预处理、Kernel 参数与 Regularization,并用 Held-out Error 和运行成本对照 Linear Ridge、Mean 与 Tree-based Baseline。

当前 scikit-learn KernelRidge 文档明确区分 KRR 与 Gaussian Process Regression。匹配假设后两者可得到相似 Mean Prediction,但 KRR 本身不会提供经过校准的 Predictive Distribution。

主要特点

  • 最小化 Squared Loss 与 RKHS Norm Penalty
  • 以训练样本 Kernel Expansion 表示预测
  • 把拟合化为 Dual Coefficient 的正则化线性系统
  • 通过所选 Positive-definite Kernel 表达非线性函数
  • 精确实现通常承担二次存储与 Reference-dependent 预测成本
  • 输出点估计而不会自动给出预测不确定性

常见用途

  1. 在中小型数据上拟合平滑非线性关系
  2. 为 Gaussian Process Mean 建立确定性 Kernel Baseline
  3. 使用分子、序列或 Graph Kernel 预测连续 Target
  4. 验证非线性 Geometry 是否优于 Linear Ridge Regression
  5. 评测 Kernel Regression 的 Nyström 或 Random-feature Approximation

示例

loading...
Loading code...

常见问题

核岭回归与线性 Ridge Regression 有什么区别?

Linear Ridge 学习原始 Feature 上的系数;KRR 学习训练样本上的系数并计算 Kernel Expansion,因此可以表达非线性函数。使用 Linear Kernel 且 Objective Convention 一致时,两者预测等价。

核岭回归中的 Lambda 控制什么?

Lambda 惩罚 RKHS Norm 并稳定 Kernel System。较大取值通常让函数更平滑、系数更小,较小取值更贴合训练数据;必须确认实现在线性系统中使用 `lambda` 还是 `n lambda`。

核岭回归等同于 Gaussian Process Regression 吗?

不等同。在 Kernel、Noise 与 Regularization Convention 匹配时,两者 Mean Prediction 可以一致;Gaussian Process Regression 还定义概率 Prior 与 Posterior Uncertainty,普通 KRR 只是正则化点估计器。

核岭回归能预测未见输入吗?

可以。先应用冻结的预处理,再计算新输入到保留训练 Reference 或拟合近似基的 Kernel,并与存储 Coefficient 相乘。改变 Reference 或 Kernel 参数就等于改变模型。

核岭回归如何扩展到稠密 Gram Matrix 以外?

Nyström Factor、Random Fourier Feature、Iterative Solver 与 Block Kernel Product 都能降低成本。每种方法会改变近似或优化误差,应对照 Exact Model 比较留出预测、内存、延迟与困难切片。

相关术语

相关文章