什么是 拉普拉斯近似(Laplace Approximation)?
拉普拉斯近似(Laplace Approximation)是在一个众数处用高斯分布局部近似光滑概率分布,并由该点附近的曲率确定协方差的方法。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
从有效 MAP 解与曲率开始
应联合拟合似然与先验,保留各自缩放,并验证所选点确实是有意义的局部最优。在 theta_MAP 附近对数后验被近似为二次函数,高斯协方差等于负 Hessian 的逆。如果 Hessian 不定、奇异或被任意正则项主导,直接构造的协方差就无效。阻尼、广义高斯牛顿或 Fisher 近似都会改变所表示对象,必须记录。
把参数范围与曲率结构视为方法的一部分
Laplace Redux区分四项实践选择:哪些权重拥有后验、保存何种曲率结构、如何选择先验精度,以及怎样把后验映射到预测。最后一层和对角变体降低成本,但会舍弃依赖关系;完整或结构化曲率保留更多几何信息,也消耗更多内存与计算。这些变体不是同一固定后验的可互换实现。
同时检验局部拟合与后验预测
在缩小问题上把二次近似与精确结果或采样结果比较,检查先验精度和阻尼敏感性,并确认协方差因子有限且为正;随后用严格适当评分、覆盖率、校准和偏移切片评估后验预测。窄高斯只能说明局部曲率较强,也可能漏掉另一个合理模式,因此数值稳定和窄区间都不能证明全局后验准确。
主要特点
- 在后验众数处建立高斯近似
- 使用二阶局部曲率定义后验精度
- 可以在正则化确定性模型拟合后应用
- 包含完整、对角、结构化、子网络和最后一层变体
- 无法忠实表示远距离多峰、强偏态或重尾
- 需要版本化先验、曲率、阻尼与预测映射选择
常见用途
- 为预训练神经网络增加局部后验不确定性
- 近似贝叶斯逻辑回归的参数协方差
- 使用近似证据比较先验精度或模型选择
- 在有限计算预算下构建不确定性感知预测
- 把局部贝叶斯近似与 VI 和集成基线比较
示例
Loading code...常见问题
拉普拉斯近似如何工作?
先找到后验众数,再在该点对对数后验做二阶展开,把局部负曲率的逆解释为高斯协方差。预测时对这一近似高斯积分或采样,而不是只使用众数。
拉普拉斯近似与变分推断有什么区别?
拉普拉斯近似根据众数与曲率拟合局部高斯,常可在普通 MAP 训练后应用;VI 则在指定散度目标下优化所选分布族的参数。两者都是近似,但几何、成本和失败模式不同。
为什么使用最后一层拉普拉斯近似?
只对最后一层建模会显著降低曲率存储和计算成本,也可直接复用固定特征提取器。但它无法表示学习特征中的未知,因此速度优势对应着更窄的不确定性声明。
拉普拉斯近似会在哪些情况下失效?
它可能错误表示多峰、偏态、重尾、弱可识别或不光滑后验。神经网络对称性与平坦方向也会使曲率估计困难。应在代表性缩小问题上与采样或其他近似比较。
协方差为正就能证明拉普拉斯模型可信吗?
不能。正协方差只证明局部高斯在数值上有效。可信结果还需要合理的先验与似然、稳定曲率估计、后验预测检查、严格适当评分、覆盖率和真实分布偏移评测。