什么是 后验预测分布(Posterior Predictive Distribution)?

后验预测分布(Posterior Predictive Distribution)是在未知模型量的后验分布上,对新结果或复制结果的条件似然进行积分后得到的概率分布。

快速了解

规范文档官方规范

工作原理

在结果尺度上边缘化未知量

先从后验积分或采样多个合理参数,再对每组参数生成或评估条件结果;对 p(y*|x*,theta) 加权平均后得到后验预测混合。Plug-in 预测 p(y*|x*,theta_hat) 会遗漏参数未知,潜函数分布则可能不包含观测噪声。API 和制品中应保留这些身份,不能把所有区间都统称为置信区间。

用复制数据批判模型

当前 Stan 用户指南通过模拟复制数据,并把决策相关统计量与观测数据比较来定义后验预测检查。应按领域检查位置、离散程度、尾部、零值、依赖关系与关键切片。模型可以正确复现均值却漏掉方差或极端值。后验预测类 p 值是诊断量,通常不是服从均匀分布的频率学派 p 值。

把模型检查与未来表现分开

PyMC 预测工作流区分在原观测输入上的复制结果与新输入上的未来预测。复用观测输入有助于发现模型与数据冲突,但不是未参与建模的泛化测试。未来预测仍需使用按时间、实体或人群合理切分的留出集,报告严格适当评分、覆盖率和蒙特卡洛误差,并在先验、似然、特征或人群变化后重测。

主要特点

  • 以观测数据为条件,在后验未知上进行平均
  • 输出结果分布,而不仅是模型参数分布
  • 可以组合参数未知与建模后的观测变异
  • 支持预测、区间构造和模型批判
  • 依赖先验、似然、推断、输入和人群假设
  • 除后验预测检查外仍需要样本外评测

常见用途

  1. 生成未来计数或连续结果的概率分布
  2. 为决策规划构造后验预测区间
  3. 检查复制数据能否复现尾部、离散程度或依赖
  4. 比较贝叶斯模型与 Plug-in 点估计预测器
  5. 把参数未知传播到下游期望成本计算

示例

loading...
Loading code...

常见问题

后验预测分布表示什么?

它表示在后验模型未知上平均之后,未来结果或复制结果可能如何分布。它是以观测数据为条件的结果分布,而不只是参数分布。

后验分布与后验预测分布有什么区别?

后验分布描述观测数据之后的未知参数或潜变量;后验预测分布把该后验通过似然映射到结果尺度,因此可以在参数未知之外加入观测变异。

可信区间与预测区间有什么区别?

可信区间可以总结后验参数或潜函数;后验预测区间总结未来观测结果,通常同时包含潜在均值未知与建模后的观测噪声,因此往往更宽。

后验预测检查能证明模型正确吗?

不能。它可以暴露模型无法复现的特征,但多个错误模型也可能复现相同摘要。应使用多项领域相关检查、计算诊断、敏感性分析和未参与建模的预测评测。

后验预测样本能当作独立测试数据吗?

不能。它们由拟合模型生成并继承模型假设,适合模型批判和决策模拟。真实泛化证据必须来自按时间、实体或人群合理留出的实际观测。

相关术语

相关文章