什么是 核岭回归(KRR)?
核岭回归(KRR)是一种监督回归方法,它最小化平方预测误差与 RKHS Norm Penalty,并通过训练样本 Kernel Evaluation 的加权展开生成预测。
快速了解
| 全称 | Kernel Ridge Regression |
|---|---|
| 规范文档 | 官方规范 |
工作原理
用 Representer Theorem 得到有限解
RKHS 上的 Regularized Empirical-risk Problem 看似无限维,但在 Generalized Representer Theorem 条件下,Minimizer 可写成 f(.) = sum_i alpha_i k(x_i, .),从而把估计问题化为依附于训练样本的有限 Coefficient。
Generalized Representer Theorem覆盖一类广泛 Loss 与 Strictly Increasing Regularizer。它只保证 Expansion Form,不会证明所选 Kernel 正确、任意 Objective 都有唯一解,或所得模型具有足够统计质量。
一致地求解正则化 Kernel System
对 Squared Loss 和一种常见 Objective Scaling,一阶条件给出 (K + lambda I) alpha = y。另一些资料会把 Loss 除以 n,从而得到 (K + n lambda I) alpha = y;在统一这种约定前,不同 Library 的参数不能直接比较。
应使用稳定 Factorization 或 Iterative Solver,而不是显式求逆。正 lambda 会改善 Conditioning,但重复样本、极端 Kernel 参数、未缩放 Target 与过小正则仍会造成不稳定系数。Intercept 和 Sample Weight 也必须遵循明确 Objective。
分别验证泛化、成本与不确定性
精确拟合需要保存 n by n Kernel Matrix,预测通常还要把每个 Query 与保留的训练 Reference 比较。应在每个 Training Fold 内联合选择预处理、Kernel 参数与 Regularization,并用 Held-out Error 和运行成本对照 Linear Ridge、Mean 与 Tree-based Baseline。
当前 scikit-learn KernelRidge 文档明确区分 KRR 与 Gaussian Process Regression。匹配假设后两者可得到相似 Mean Prediction,但 KRR 本身不会提供经过校准的 Predictive Distribution。
主要特点
- 最小化 Squared Loss 与 RKHS Norm Penalty
- 以训练样本 Kernel Expansion 表示预测
- 把拟合化为 Dual Coefficient 的正则化线性系统
- 通过所选 Positive-definite Kernel 表达非线性函数
- 精确实现通常承担二次存储与 Reference-dependent 预测成本
- 输出点估计而不会自动给出预测不确定性
常见用途
- 在中小型数据上拟合平滑非线性关系
- 为 Gaussian Process Mean 建立确定性 Kernel Baseline
- 使用分子、序列或 Graph Kernel 预测连续 Target
- 验证非线性 Geometry 是否优于 Linear Ridge Regression
- 评测 Kernel Regression 的 Nyström 或 Random-feature Approximation
示例
Loading code...常见问题
核岭回归与线性 Ridge Regression 有什么区别?
Linear Ridge 学习原始 Feature 上的系数;KRR 学习训练样本上的系数并计算 Kernel Expansion,因此可以表达非线性函数。使用 Linear Kernel 且 Objective Convention 一致时,两者预测等价。
核岭回归中的 Lambda 控制什么?
Lambda 惩罚 RKHS Norm 并稳定 Kernel System。较大取值通常让函数更平滑、系数更小,较小取值更贴合训练数据;必须确认实现在线性系统中使用 `lambda` 还是 `n lambda`。
核岭回归等同于 Gaussian Process Regression 吗?
不等同。在 Kernel、Noise 与 Regularization Convention 匹配时,两者 Mean Prediction 可以一致;Gaussian Process Regression 还定义概率 Prior 与 Posterior Uncertainty,普通 KRR 只是正则化点估计器。
核岭回归能预测未见输入吗?
可以。先应用冻结的预处理,再计算新输入到保留训练 Reference 或拟合近似基的 Kernel,并与存储 Coefficient 相乘。改变 Reference 或 Kernel 参数就等于改变模型。
核岭回归如何扩展到稠密 Gram Matrix 以外?
Nyström Factor、Random Fourier Feature、Iterative Solver 与 Block Kernel Product 都能降低成本。每种方法会改变近似或优化误差,应对照 Exact Model 比较留出预测、内存、延迟与困难切片。