什么是 不确定性量化(Uncertainty Quantification)?
不确定性量化(Uncertainty Quantification)是在明确数据、模型和部署语境下,定义、估计、验证并使用模型预测或衍生决策中不确定性的学科,常缩写为 UQ。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
先定义不确定性目标,再选择方法
首先明确关心的目标量,以及预测时能够获得的信息。偶然不确定性描述在该观测契约下仍未解决的结果变异;认知不确定性描述在既定模型与证据集下,对预测机制或参数的未知。两者是条件性分类而非绝对属性:增加传感器、改变标签、扩展模型族或补充数据,都可能让变异在类别间移动。Hullermeier 与 Waegeman 的综述系统讨论了机器学习预测中的这些边界。
让估计器与不确定性声明匹配
概率似然模型、分位数回归、贝叶斯近似、深度集成、蒙特卡洛 Dropout 和保形预测,输出对象与依赖假设并不相同。成员分歧可以反映不同拟合结果的敏感性,但不是完整后验;保形集合在可交换性条件下追求边际覆盖,却不能解释单个样本为何困难。至少与一个简单基线比较,并记录估计器纳入和遗漏了哪些随机性、模型变化或残差过程。
分别验证分布、区间和决策
预测分布使用 Log Loss、Brier Score 等严格适当评分;区间或集合检查经验覆盖率与宽度;概率声明检查可靠性;实际决策则检查下游效用。还需按代表性切片评测,并在真实分布偏移下重复验证。Uncertainty Quantification 360 综述强调不同指标检验不同性质,单一标量不能证明不确定性可用。阈值应在验证集冻结,授权、安全和回滚规则应保持在估计器之外。
主要特点
- 明确目标量、条件信息和携带不确定性的输出对象
- 区分未解决的结果变异与对学习机制的未知
- 公开估计器假设以及未覆盖的不确定性来源
- 用不同证据验证分布、区间、校准和决策
- 要求代表性切片,并在部署条件变化后重新验证
- 把不确定性区间连接到拒答、人工复核、Fallback 或数据采集
常见用途
- 为需求量、持续时间或传感器预测报告预测区间
- 把不确定的分类结果或生成式回答路由到人工复核
- 依据模型分歧优先标注信息价值更高的样本
- 同时比较模型版本的点预测质量与概率质量
- 在分布和模型变化下制定风险感知的 Fallback 策略
示例
Loading code...常见问题
不确定性与置信度有什么区别?
不确定性是在明确条件信息下,对未知结果、参数、模型或决策提出的性质声明;置信度常常只是一个分数或非正式标签。只有定义目标并在代表性数据上验证数值含义后,才能把置信分数当作不确定性信息。
偶然不确定性和认知不确定性总能唯一分开吗?
不能。划分取决于观测过程、标签、模型族、先验知识与可用证据。在一种传感器或模型下看似不可约的变异,增加信息后可能变得可预测;模型设定错误也可能被误认为数据噪声。
模型校准良好,就拥有完整的不确定性估计吗?
不是。校准只检查特定分布上概率声明的频率性质,不能证明模型覆盖所有不确定性来源、在偏移后仍然校准,或能做出高效决策。还应分别检查锐度、覆盖率、严格适当评分、关键切片和决策成本。
应该选择哪种不确定性量化方法?
从所需输出与保证出发,而不是按方法热度选择。似然或分位数模型适合分布预测,集成与贝叶斯近似用于观察模型敏感性,保形方法则在假设下追求有限样本覆盖。应按部署协议与简单基线比较。
生产环境应如何监控不确定性?
对模型、估计器、参考数据与阈值做版本化;记录不确定性输出及其触发动作;标签到达后按重要切片检查严格适当评分、覆盖率与决策结果;模型、Prompt、特征、人群或政策变化后重新验证。