什么是 深度核学习(Deep Kernel Learning)?
深度核学习(Deep Kernel Learning)是一种把有效核应用于神经网络表示的建模方法,通常将学习到的特征与高斯过程推断结合起来。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
在有效核内部学习表示
只要 k_base 是半正定核,把它与确定性特征映射复合后仍然得到有效核。训练可以通过 GP 边缘似然或近似变分目标,同时优化网络参数、核超参数与似然参数。
Wilson 等人把深度架构、可扩展高斯过程与结构化核插值结合起来。论文结果只支持其研究的数据集与实现,不能据此宣称 DKL 在所有任务上都优于标准 GP 或神经网络。
控制几何结构、坍缩与可辨识性
特征尺度与核长度尺度可以互相补偿,因此参数可能难以辨识。表达力强的网络可能把不同输入映射到相近位置、拉伸无关方向,或学习捷径,使后验方差看起来很小。初始化、归一化、先验或约束,以及对特征几何的监控都很重要。
冻结预训练特征提取器后接 GP,与端到端 DKL 回答的问题不同。冻结方案主要隔离最后核模型中的不确定性;联合训练让特征适配目标,却会增加数据泄漏、优化耦合和消融验证需求。
验证完整推断流水线
特征映射之后,精确 GP 推断仍然难以扩展,因此大型 DKL 系统通常加入诱导变量、结构化插值或迭代矩阵方法。GPyTorch DKL 示例展示框架特定的集成方式,其默认配置并不构成部署保证。
预处理、预训练模型选择、早停、诱导位置和超参数都必须在训练折内拟合。应与相同神经编码器加简单预测头,以及固定特征上的核进行比较,并评测适当评分、校准、适用时的覆盖率、准确率、延迟、内存、特征漂移和域内外切片。
主要特点
- 把学习到的神经表示与有效基础核组合
- 让协方差几何适配预测目标
- 可使用精确、变分或结构化高斯过程推断
- 不会自动建模神经网络权重的不确定性
- 耦合特征学习、核超参数和似然拟合
- 需要针对泄漏、坍缩、校准和规模做消融
常见用途
- 对图像、信号或表格数据进行带学习表示的回归
- 结合任务特定特征与概率输出进行分类
- 为高维观测构建科学代理模型
- 在冻结编码器后使用高斯过程预测头迁移学习
- 比较神经、核与混合不确定性模型
示例
Loading code...常见问题
深度核学习与标准高斯过程有什么区别?
标准 GP 直接在原始或人工特征上应用核;DKL 先学习神经表示,再在该空间应用核。它获得更灵活的几何结构,也增加了优化耦合、可辨识性问题和捷径学习风险。
深度核学习属于贝叶斯神经网络吗?
默认不属于。多数 DKL 系统对神经特征提取器做点估计,只在 GP 层执行贝叶斯推断。若要表示网络权重的不确定性,需要额外的后验或集成方法,并重新解释计算成本与输出。
为什么 DKL 可能过度自信?
学习表示可能把遥远输入压缩到相近位置、隐藏分布变化,或把外推特征映射到核认为熟悉的区域;近似推断与超参数拟合还会增加误差。不能只看域内似然,还要在偏移切片验证校准和决策。
神经特征提取器应该冻结还是联合训练?
冻结编码器便于归因并可降低优化成本;联合训练能让几何结构适配任务,但会增加泄漏和过拟合风险。应在训练与验证数据内完成模型选择,并与相同编码器加简单预测头的基线比较。
深度核学习如何扩展到大规模数据?
特征提取会增加神经计算,而精确 GP 头仍有稠密三次训练成本。大型系统会采用诱导变量、结构化核插值、共轭梯度或其他近似,并同时报告准确率、校准、延迟与内存。