什么是 深层高斯过程(Deep Gaussian Process)?
深层高斯过程(Deep Gaussian Process)是一种层级概率模型,它组合多个高斯过程映射,让每一层接收上一层带有不确定性的潜在输出,而不是固定的确定性表示。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
让分布经过随机函数层传播
以两层模型为例,可写成 h = f1(x)、y = f2(h) + noise,其中 f1 与 f2 分别服从 GP 先验。每个条件层虽然是高斯分布,非线性组合后的边缘分布通常不再是高斯分布;如果只把均值传给下一层,就会丢失不确定性和跨层依赖。
原始 Deep Gaussian Processes 论文使用变分推断表达这种层级结构。增加深度会提高表示灵活性,也会改变可辨识性与优化难度,不能据此推导更深模型一定预测更好。
近似相互耦合的后验
常见 DGP 会为每一层配置诱导变量,并优化证据下界。双重随机变分推断一方面对观测使用小批量,另一方面采样潜在路径;它避免确定性矩匹配,却引入 Monte Carlo 与变分误差。完整近似预算包括每层诱导点数量、变分协方差结构、样本数和优化器行为。
双重随机变分 DGP 方法提高了深层模型的可扩展性,但没有让后验推断变成精确计算。报告结果时必须同时说明估计器、采样数、诱导配置与收敛诊断。
识别层坍缩并验证不确定性
隐藏层可能坍缩为接近常数的映射,与另一层重复,或携带最终层完全忽略的方差。应检查潜在均值和方差、有效 Kernel Length Scale、诱导覆盖、梯度范数,以及不同初始化的敏感性;并在相同划分与预算下比较单层 GP、深度核和非概率基线。
预测对数密度、校准、区间覆盖率与宽度、残差切片、外推、延迟和内存需要分别测量。变分族和数据不同,多层组合可能放大、压窄或扭曲后验不确定性;模型深度本身不提供校准保证。
主要特点
- 组合多个随机高斯过程映射
- 为中间潜在表示保留不确定性
- 非线性组合后通常产生非高斯边缘分布
- 通常依赖变分推断与诱导变量
- 能够表达非平稳和输入相关行为
- 会引入层坍缩、不可辨识与近似风险
常见用途
- 具有层级非线性结构的概率回归
- 中等规模数据上的不确定性感知表示学习
- 单一固定 Kernel 难以表达的非平稳系统
- 多保真或分层科学代理建模
- 研究深度、近似与校准之间的关系
示例
Loading code...常见问题
深层高斯过程与深度核学习有什么区别?
DGP 在每一层放置随机 GP 映射,并对带不确定性的隐藏表示积分;深度核学习通常先使用确定性神经网络特征映射,再应用一个 GP Kernel。因此,两者的后验近似、不确定性语义、优化方式和失败模式均不同。
深层高斯过程为什么难以精确推断?
每个隐藏输出都会成为下一层 GP 的随机输入。对非线性组合积分时,潜在函数与观测相互耦合,不再具备标准 GP 回归的闭式高斯后验。
DGP 的双重随机变分推断是什么?
它一边对观测使用随机小批量,一边通过潜在 GP 层进行 Monte Carlo 采样,并优化变分下界。这样可提高扩展能力,但仍保留变分偏差、采样方差与诱导变量近似误差。
如何发现深层高斯过程发生层坍缩?
检查隐藏均值是否接近常数、方差是否消失或被后层忽略、不同层是否学习重复映射、诱导点是否失去覆盖,以及结果是否对随机种子高度敏感。归因于深度前应先比较更浅模型。
深层高斯过程能保证更好的不确定性估计吗?
不能。其不确定性仍以先验、Kernel、似然、变分族、诱导表示、采样和优化为条件。必须相对简单基线验证适当评分、校准、区间覆盖、分布变化切片与下游决策。