什么是 置信度校准(Confidence Calibration)?
置信度校准(Confidence Calibration)是让模型声明的概率,在已定义的预测目标、标签、评测人群与协议下,与真实结果出现频率保持一致的属性和处理过程。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
先测量概率含义,再修改分数
使用 Reliability Diagram 比较每个分箱的平均预测概率与真实频率,并同时报告各箱样本数;再补充 Brier Score 或 Log Loss 等 Proper Scoring Rule、区分能力指标和任务错误。Expected Calibration Error 是常用摘要,但会受分箱边界、样本量以及 Top-label、Classwise 或 Marginal 定义影响。AISTATS 校准评测框架说明了为什么不同校准定义和估计器回答的是不同问题。
拟合校准器时隔离评测标签
Post-hoc 方法把冻结模型分数映射为概率。Temperature Scaling 用一个正温度缩放多分类 Logit;Platt 风格 Sigmoid Calibration 与 Isotonic Regression 则具有不同的函数形状和数据假设。校准器应在与模型训练集、最终测试集都隔离的数据上拟合,再把基础模型、校准器、标签映射和预处理共同冻结。当前 scikit-learn 文档使用留出或交叉验证预测,原因是训练集预测会让映射偏向过度自信。
把上线漂移视为新的校准问题
校准依赖数据分布。基础发生率、语言、设备、Prompt、模型、检索策略、标签定义或评审人群变化,都可能让旧映射失效,即使整体准确率看似稳定。应按关键切片监控可靠性和决策成本,保留未校准基线,并只使用代表性标签重新校准。校准概率可以支持阈值与期望成本决策,但授权、安全规则和高影响人工复核仍应由外部确定性控制执行。
主要特点
- 在明确协议下让概率数值与真实结果频率对齐
- 不同于准确率、排序质量、不确定性估计和事实正确性
- 需要能够代表目标决策人群的独立校准数据
- 可采用 Temperature Scaling、Sigmoid、Isotonic 或任务专属映射
- 需结合可靠性图、Proper Score、样本支持度和部署切片评测
- 模型、Prompt、标签、基础发生率或数据分布变化后可能失效
常见用途
- 将分类概率映射到带明确错误成本的业务阈值
- 依据人工标签校准 Reward Model 或 LLM Judge 的成对概率
- 把不确定的文档、图像或语音预测路由给人工复核
- 比较模型发布版本时区分概率质量与准确率
- 监控领域、语言、Prompt 或策略变化后的过度自信
示例
Loading code...常见问题
模型经过校准是什么意思?
在明确的人群与事件定义下,所有预测概率为 p 的事件应约有 p 的比例实际发生或预测正确。这是群体频率陈述,不代表任意单条预测都拥有已知且确定的正确概率。
校准良好的模型一定准确吗?
不一定。始终输出基础发生率的模型可能校准,却几乎没有区分能力。应分别报告准确率或任务损失、排序质量、校准和业务结果,不能让单个指标替代全部质量维度。
Temperature Scaling 和 Isotonic Regression 有什么区别?
Temperature Scaling 使用一个正数缩放 Logit,并保持类别排序;Isotonic Regression 学习更灵活的单调阶梯函数,可拟合更多形状,但需要更多代表性校准数据,也可能制造概率 Tie。
LLM 口述的置信度能直接当成校准概率吗?
不能直接使用。口述百分比、Token Likelihood、自评分或 Judge Score 都有不同生成机制。团队必须定义目标事件,收集代表性结果,测量可靠性与 Proper Score,并在模型或 Prompt 变化后重新验证。
什么时候需要重新训练校准映射?
模型、Prompt、预处理、标签、人群、语言结构、基础发生率或决策策略变化时,以及监控发现可靠性漂移时,都应重新评测。使用新的代表性标签,并确保最终测试数据没有参与校准器拟合。