什么是 期望校准误差(ECE)?
期望校准误差(ECE)是一种分箱估计量,用于汇总各组预测中平均模型置信度与真实准确率或事件发生频率之间的加权绝对差异。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
比较发布版本前先固定估计器身份
记录被校准的事件、作为 Confidence 的分数、评测人群与时间窗口、箱数与分箱方式、边界归属、权重、空箱策略,以及计算的是 Top-label、Classwise、Marginal 还是任务专属校准。《On Calibration of Modern Neural Networks》中的常见公式会把最大类别概率放入等宽箱,但这套实现不是所有概率输出的通用定义。
检查可靠性分布,不要只相信一个标量
分箱同时引入 Bias 与 Variance。箱太少会掩盖局部过度自信,箱太多则容易出现高噪声或空组;Top-label ECE 还可能忽略非获胜类别概率,并掩盖稀有类别或语言切片故障。应绘制平均置信度与真实频率,附每箱样本数、区间、Signed Gap 和关键切片。AISTATS 校准评测框架说明了不同校准定义和估计器为何不能直接混用。
结合业务效用和 Proper Score 使用
使用 Brier Score 或 Log Loss 评估完整概率分布,并分别报告准确率、排序、Abstention 和业务损失。候选版本必须共享冻结标签、分箱、模型输出定义和 Bootstrap 或重复采样的不确定性。不要复制通用 ECE 阈值:可接受误差取决于样本支持度、决策代价、子群风险,以及部署数据是否仍匹配评测分布。
主要特点
- 按分箱汇总置信度与真实频率的加权绝对差
- 结果依赖箱数、边界、权重和空箱处理
- 未声明其他变体时通常只评估最大类别置信度
- 无区分能力但匹配基础发生率的模型也可能取得低值
- 不是 Proper Scoring Rule,不能替代准确率或业务损失
- 必须结合可靠性图、样本数、不确定性和切片分析
常见用途
- 在冻结协议下汇总分类器的可靠性
- 发现模型、Prompt 或领域变化后的过度自信
- 在相同留出预测上比较 Post-hoc 校准器
- 根据裁决标签审计 LLM 答案置信度或 Judge 概率
- 监控进入自动化或人工复核路由的高置信度分箱
示例
Loading code...常见问题
期望校准误差如何计算?
先把预测放入明确的置信度分箱,计算每箱平均置信度与真实准确率,再取绝对差并按该箱样本占比加权。发布结果时还要说明箱边界、边界归属、空箱处理和 Confidence 定义。
ECE 低就说明模型准确吗?
不能。模型始终输出基础发生率也可能校准良好,却缺乏区分能力。应把 ECE 与任务准确率或损失、Proper Probability Score、排序指标和业务结果共同报告。
为什么改变分箱数量会改变 ECE?
ECE 用有限分组近似真实校准关系。粗分箱会平均掉局部错误,细分箱会放大采样噪声并产生空组。只有使用完全相同且已记录的分箱协议,发布版本之间才可比较。
ECE 和 Brier Score 有什么区别?
ECE 是依赖分箱的观测校准差摘要。Brier Score 对每个概率与结果计算严格 Proper Score,同时包含 Calibration、Resolution 和结果不确定性。二者不能互相替代。
生产环境应该使用多大的 ECE 阈值?
不存在通用阈值。限制应来自代表性样本支持、决策代价、高置信度错误、子群表现和同协议基线。即使总体 ECE 很小,关键业务切片失败仍应阻断发布。