什么是 变分推断(Variational Inference)?

变分推断(Variational Inference)是一类通过求解优化问题,用可处理的参数化分布近似难以计算的目标分布的方法。

快速了解

规范文档官方规范

工作原理

从后验恒等式推导优化目标

对于联合密度 p(x,z) 和近似 q(z),有 log p(x) = ELBO(q) + KL(q(z) || p(z|x))。由于 KL 非负,最大化 E_q[log p(x,z) - log q(z)] 会收紧对数证据下界,并在所选分布族内最小化反向 KL。Blei、Kucukelbir 与 McAuliffe 的综述系统推导了这一优化视角。真实证据通常不可得,因此 ELBO 数值本身不能显示剩余近似缺口。

有意识地选择变分族与梯度估计器

平均场 VI 将隐变量因子化,扩展性好,但无法表示后验相关性;结构化协方差、混合或 Normalizing Flow 能提高表达力,也会增加优化与内存成本。部分共轭模型可用坐标上升;黑盒 VI 则使用蒙特卡洛梯度、控制变量,并在可行时使用重参数化。Black Box Variational Inference减少了模型特定推导,但随机梯度方差与局部最优仍是工程问题。

把优化失败与近似失败分开诊断

应使用多个初始化,检查 ELBO 轨迹、梯度方差,以及样本和矩是否有限;再在小问题上与精确结果或可信采样基线比较后验和后验预测摘要。真实后验多峰或强相关时,反向 KL 往往偏向一个高密度区域并低估方差。还需直接验证下游 Log Loss、覆盖率、校准与决策,优化器收敛不等于后验正确。

主要特点

  • 使用选定的可处理分布族近似目标分布
  • 把概率推断转化为数值优化问题
  • 常通过最大化 ELBO 等价地最小化反向 KL
  • 支持随机梯度、小批量与摊销推断
  • 会引入由变分族与散度共同决定的近似偏差
  • 需要分别诊断优化过程和预测质量

常见用途

  1. 扩展隐变量模型与层次模型的后验推断
  2. 使用摊销隐变量推断训练变分自编码器
  3. 近似贝叶斯神经网络的权重后验
  4. 在重复采样昂贵时服务可复用近似后验
  5. 在速度和内存预算下比较更丰富的变分族

示例

loading...
Loading code...

常见问题

变分推断解决什么问题?

当精确归一化和积分不可行时,VI 用于近似后验或其他困难的条件分布。它把直接计算替换为在给定分布族上的优化,得到可用于期望和预测的可处理代理。

变分推断中的 ELBO 是什么?

证据下界为 `E_q[log p(x,z) - log q(z)]`。对数证据等于 ELBO 加 `KL(q || posterior)`,因此最大化 ELBO 会在所选变分族内最小化该反向 KL 缺口。

ELBO 越高就代表模型越好吗?

只有在受控比较下才成立。使用相同联合模型、数据、变分族、估计器和数值约定时,更高 ELBO 表示优化后的下界更紧;跨数据缩放、目标或估计器时原始数值未必可比,预测质量仍需直接评测。

变分推断与 MCMC 有什么区别?

VI 为可处理近似求解优化问题,通常更快且更易扩展;MCMC 构造目标分布为稳态的随机链,理论上可渐近接近目标,但成本与诊断难度较高。两者都可能失败,必须针对实际模型验证。

为什么平均场变分推断可能低估不确定性?

因子化假设删除了后验相关性,而反向 KL 会强烈惩罚把概率质量放在目标低密度区域。最优解可能集中于一个模式且过窄。更丰富的变分族可能改善,但仍需与可信参考和预测检查比较。

相关术语

相关文章