什么是 深层高斯过程(Deep Gaussian Process)?

深层高斯过程(Deep Gaussian Process)是一种层级概率模型,它组合多个高斯过程映射,让每一层接收上一层带有不确定性的潜在输出,而不是固定的确定性表示。

快速了解

规范文档官方规范

工作原理

让分布经过随机函数层传播

以两层模型为例,可写成 h = f1(x)、y = f2(h) + noise,其中 f1 与 f2 分别服从 GP 先验。每个条件层虽然是高斯分布,非线性组合后的边缘分布通常不再是高斯分布;如果只把均值传给下一层,就会丢失不确定性和跨层依赖。

原始 Deep Gaussian Processes 论文使用变分推断表达这种层级结构。增加深度会提高表示灵活性,也会改变可辨识性与优化难度,不能据此推导更深模型一定预测更好。

近似相互耦合的后验

常见 DGP 会为每一层配置诱导变量,并优化证据下界。双重随机变分推断一方面对观测使用小批量,另一方面采样潜在路径;它避免确定性矩匹配,却引入 Monte Carlo 与变分误差。完整近似预算包括每层诱导点数量、变分协方差结构、样本数和优化器行为。

双重随机变分 DGP 方法提高了深层模型的可扩展性,但没有让后验推断变成精确计算。报告结果时必须同时说明估计器、采样数、诱导配置与收敛诊断。

识别层坍缩并验证不确定性

隐藏层可能坍缩为接近常数的映射,与另一层重复,或携带最终层完全忽略的方差。应检查潜在均值和方差、有效 Kernel Length Scale、诱导覆盖、梯度范数,以及不同初始化的敏感性;并在相同划分与预算下比较单层 GP、深度核和非概率基线。

预测对数密度、校准、区间覆盖率与宽度、残差切片、外推、延迟和内存需要分别测量。变分族和数据不同,多层组合可能放大、压窄或扭曲后验不确定性;模型深度本身不提供校准保证。

主要特点

  • 组合多个随机高斯过程映射
  • 为中间潜在表示保留不确定性
  • 非线性组合后通常产生非高斯边缘分布
  • 通常依赖变分推断与诱导变量
  • 能够表达非平稳和输入相关行为
  • 会引入层坍缩、不可辨识与近似风险

常见用途

  1. 具有层级非线性结构的概率回归
  2. 中等规模数据上的不确定性感知表示学习
  3. 单一固定 Kernel 难以表达的非平稳系统
  4. 多保真或分层科学代理建模
  5. 研究深度、近似与校准之间的关系

示例

loading...
Loading code...

常见问题

深层高斯过程与深度核学习有什么区别?

DGP 在每一层放置随机 GP 映射,并对带不确定性的隐藏表示积分;深度核学习通常先使用确定性神经网络特征映射,再应用一个 GP Kernel。因此,两者的后验近似、不确定性语义、优化方式和失败模式均不同。

深层高斯过程为什么难以精确推断?

每个隐藏输出都会成为下一层 GP 的随机输入。对非线性组合积分时,潜在函数与观测相互耦合,不再具备标准 GP 回归的闭式高斯后验。

DGP 的双重随机变分推断是什么?

它一边对观测使用随机小批量,一边通过潜在 GP 层进行 Monte Carlo 采样,并优化变分下界。这样可提高扩展能力,但仍保留变分偏差、采样方差与诱导变量近似误差。

如何发现深层高斯过程发生层坍缩?

检查隐藏均值是否接近常数、方差是否消失或被后层忽略、不同层是否学习重复映射、诱导点是否失去覆盖,以及结果是否对随机种子高度敏感。归因于深度前应先比较更浅模型。

深层高斯过程能保证更好的不确定性估计吗?

不能。其不确定性仍以先验、Kernel、似然、变分族、诱导表示、采样和优化为条件。必须相对简单基线验证适当评分、校准、区间覆盖、分布变化切片与下游决策。

相关术语

相关文章