什么是 高斯过程(Gaussian Process)?

高斯过程(Gaussian Process)是一种随机过程,其在任意有限输入集合上的函数值都服从由均值函数和协方差函数指定的联合多元高斯分布。

快速了解

规范文档官方规范

工作原理

定义一致的函数值概率分布

对输入 x1 ... xn,GP 要求 [f(x1), ..., f(xn)] 服从多元正态分布,其中均值项为 m(xi),协方差项为 k(xi, xj)。核必须对每个有限输入集合生成半正定协方差矩阵。Williams 与 Rasmussen展示了函数空间高斯先验,以及在超参数固定时通过矩阵运算完成预测的方法。

区分潜在函数与未来观测的条件分布

在高斯观测噪声下,条件化会给出后验均值与潜在函数方差;未来观测还要额外加入观测噪声方差,因此潜在可信带与预测区间并不是同一个对象。Stan User's Guide区分了协方差核与对角噪声,并展示潜变量和边缘化两种表达。为数值稳定加入的 Jitter 不能被悄悄解释成实测噪声。

分别验证核假设、数值计算与不确定性

精确 GP 回归通常需要分解 n x n 协方差矩阵,时间复杂度为三次方,存储为二次方。稀疏、诱导点、基函数、状态空间或结构化核近似用假设和精度换规模。应检查 Cholesky 失败、条件数、超参数敏感性、先验与后验抽样、残差结构、Log Predictive Density、区间覆盖率和宽度,以及代表性分布变化;狭窄的 GP 后验并不自动意味着校准良好。

主要特点

  • 为每个有限输入集合定义一致高斯分布
  • 由均值函数和半正定协方差核指定
  • 输出联合后验均值、方差与交叉协方差
  • 区分潜在函数不确定性与观测噪声
  • 对平滑性、距离和稳定性包含强假设
  • 精确协方差计算过贵时需要结构或近似

常见用途

  1. 在观测有限时执行概率回归
  2. 作为贝叶斯优化的代理模型
  3. 用于空间插值与地统计预测
  4. 用结构化核建模时间序列或动态系统
  5. 对科学模拟器做不确定性感知校准

示例

loading...
Loading code...

常见问题

为什么高斯过程被称为函数分布?

一次抽样会为所有输入分配相互一致的值,因此可以把该抽样视为一个函数。实际计算只会物化有限个函数值,而它们在指定均值和核的前提下服从联合多元高斯分布。

高斯过程回归是非参数模型吗?

通常称为非参数模型,因为模型容量可以随观测增长,而不是由一个固定长度系数向量限定。但它仍包含核与似然超参数、先验假设,以及近似方法可能引入的大量参数。

核函数在高斯过程中起什么作用?

核定义不同输入处函数值的先验协方差,其几何决定哪些点共享信息,并编码平滑性、周期性、各向异性、可加性或平稳性等假设。数学上方便的核仍可能严重错设。

为什么精确高斯过程难以扩展到大数据?

精确推断通常要对稠密协方差矩阵做 Cholesky 分解,时间随观测数三次增长,内存随其二次增长。结构化矩阵、稀疏近似、诱导点或状态空间表达可以降低成本。

高斯过程方差等于真实预测误差吗?

不等于。后验方差以模型、核、超参数、似然和数据为条件;模型错设或分布变化可能导致过度自信。应检查适当评分、经验覆盖率、区间宽度、残差和代表性样本外切片。

相关术语

相关文章

深度学习基础:优化、架构与评测方法

严谨介绍神经网络、自动微分、优化算法、CNN、序列模型、Transformer、生成模型、数据泄漏、正则化和可复现评测。区分示意公式与生产决策,补充数据切分、标签质量、失败分析、分布偏移、推理成本、隐私边界、模型血缘、线上观测、灰度验证、成本核算、部署治理和回滚要求,不使用未经验证的性能断言或硬性工具推荐。

2026-07-19

Embedding 内容分析:文本聚类、分类与语义去重

Embedding 内容分析如何用于文本聚类、分类、语义去重和主题发现?本文从内容身份、向量契约、任务边界与决策策略出发,讲解余弦阈值校准、聚类与分类评测、人工复核、漂移监控和删除传播,并提供可运行的 Go 示例,帮助团队构建可审计、可回滚的生产级内容智能管线。内容覆盖多语言切片、错误成本与来源权限,适用于知识库、内容平台、搜索和编辑治理。

2026-09-18

Mamba 与状态空间模型:机制、演进与工程选型

深入理解 Mamba 与状态空间模型:从递推、离散化和选择性扫描,到 Mamba-2 SSD、Mamba-3、固定状态、精确回忆、混合架构与完整模型基准契约;明确线性复杂度不等于固定吞吐,帮助团队按质量、延迟、显存、内核和真实负载完成架构选型,并建立可复现的质量回归、长度泛化、数值稳定性与回滚门禁。

2026-04-22