什么是 稀疏高斯过程(Sparse Gaussian Process)?

稀疏高斯过程(Sparse Gaussian Process)是一类近似方法,它通过较小的诱导变量集合或结构化特征表示高斯过程,而不在稠密协方差计算中保留每个训练函数值。

快速了解

规范文档官方规范

工作原理

通过诱导变量表示全局依赖

设诱导变量为 u、训练函数值为 f,低秩项 Qff = Kfu Kuu^-1 Kuf 会通过较小矩阵传递协方差。纯低秩替代可能低估剩余变异,因此不同方法会以不同方式保留或修正 Kff - Qff。

Quiñonero-Candela 与 Rasmussen用统一视角整理早期稀疏近似,并区分各方法修改的是先验还是后验。这个选择首先是统计假设,而不仅是计算优化。

优化变分后验与证据下界

变分诱导变量方法引入可处理的 q(u),再通过精确 GP 条件分布推导 q(f)。Titsias为高斯回归推导了变分目标,其中迹修正项惩罚低秩表示丢失的协方差信息。后续随机变分方法可对大数据和非高斯似然使用小批量、自然梯度或常规优化。

全批量回归常见成本约为 O(nm^2 + m^3),核心变分矩阵占用 O(m^2) 存储;真实成本仍随批处理、输出数、核结构与实现而变化。

把近似质量当作需要测量的性质

增加诱导变量会提高容量,却不能保证位置有效或优化稳定。可以从代表性输入或覆盖感知摘要初始化,只在训练折内优化位置,并监控坍缩、重复点和多随机种子差异。白化可改善条件数,但不会改变所表达的后验族。

应在可行子集上与精确 GP 比较,也要对照简单的可扩展基线。测量预测对数似然、校准、区间覆盖率和宽度、残差、延迟、内存,以及远离诱导支撑区域的切片。看似狭窄的后验可能来自近似误差,而不是证据充分。

主要特点

  • 用较小表示替代对全部观测的稠密依赖
  • 通常通过诱导变量和交叉协方差进行投影
  • 在明确近似下缓解精确推断的三次复杂度
  • 可借助变分目标支持小批量优化
  • 会引入近似、位置选择与优化误差
  • 必须针对相关基线验证预测和不确定性

常见用途

  1. 在观测规模超出精确 GP 能力时进行概率回归
  2. 处理需要不确定性估计的大型时空数据
  3. 用随机变分推断训练非高斯 GP 模型
  4. 为多输出或深度核系统提供可扩展 GP 层
  5. 比较不同诱导预算与精确子集的误差和成本

示例

loading...
Loading code...

常见问题

稀疏高斯过程如何降低计算成本?

它通过 `m` 个诱导变量或其他结构化表示传递协方差,不再分解完整的 `n x n` 训练协方差矩阵。常见全批量诱导方法约需 `O(nm² + m³)`,具体预算仍取决于似然、批处理、输出数和结构。

稀疏高斯过程等于只使用数据子集训练吗?

不等于。部分早期近似接近子集方法,但变分 Sparse GP 会保留全部观测的似然贡献,只通过诱导变量概括潜在依赖;诱导位置也不必是实际观测输入。

稀疏 GP 应该使用多少诱导变量?

不存在通用比例。应逐步增加预算,直到样本外预测评分、校准、覆盖率与关键切片相对计算和内存趋于稳定;还要检查位置与优化,因为大量重复或位置不当的变量仍会欠拟合。

稀疏 GP 能否使用小批量训练?

随机变分 GP 可把似然项按观测分解,从而用小批量更新并保留全局诱导参数。但这不会让所有核运算都变成线性复杂度,偏置批次或不稳定的变分优化仍会损害结果。

稀疏性能够保证高斯过程不确定性可靠吗?

不能。不确定性仍以核、似然、变分族、诱导表示、超参数和数据为条件。应与可行的精确子集比较,并验证适当评分、区间覆盖率、宽度、分布变化行为和下游决策。

相关术语

相关文章