什么是 布里尔分数(Brier Score)?
布里尔分数(Brier Score)是一种严格 Proper Scoring Rule,通过计算预测概率分布与二元结果或 One-hot 类别向量之间的平均平方距离,评价概率预测质量。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
必须相对明确基线解释分数
原始 Brier 数值没有通用优良阈值。应在完全相同的样本上,与经验基础发生率、当前生产模型或其他获批预测进行比较。Brier Skill Score 常写成 1 - candidate_score / reference_score:正值表示优于该参考,零表示持平,负值表示更差。参考人群、事件窗口和标签完整性都属于结果身份。
不要把 Brier Score 简化成纯校准指标
该分数同时包含概率可靠性、区分能力与结果不确定性。当前 scikit-learn 校准文档明确提醒:Aggregate Brier Loss 下降可能来自区分能力提升,即使校准变差。诊断发布版本时,应在适用时使用 Murphy Decomposition,并结合 Reliability Diagram、ECE、区分指标和任务错误。
固定概率与标签契约
校验概率有限、类别顺序、归一化、样本权重、事件期限和延迟标签完整性。评估 LLM 或 Judge 置信度时,还要定义开放回答如何映射为结果,以及置信度如何获得;Token Likelihood 与口述百分比不能互换。记录模型、Prompt、校准器、数据集、语言和切片身份,并在分布或策略变化后重算。当前 scikit-learn API明确记录了二分类、多分类、标签顺序与缩放行为。
主要特点
- 根据真实结果评估完整概率预测
- 在概率与结果空间定义正确时属于严格 Proper Scoring Rule
- 以平方方式惩罚高置信度错误
- 聚合值同时包含 Reliability、Resolution 与 Outcome Uncertainty
- 存在必须显式声明的二分类与多分类缩放约定
- 需要参考分数、任务指标、切片和标签完整性检查
常见用途
- 评估二元风险、欺诈、故障或成功概率
- 评价多分类概率向量而不只检查 Top-1 标签
- 在冻结样本上比较校准前后的模型发布版本
- 审计 Reward Model、LLM Judge 或回答口述置信度
- 计算相对基础发生率或生产参考预测的 Skill Score
示例
Loading code...常见问题
布里尔分数如何计算?
对二元事件,计算每个正事件预测概率与 0 或 1 结果的平方差,再求平均。对多分类预测,则对已声明类别向量的每一维计算平方差、按样本求和后再平均。
多少 Brier Score 算好?
没有通用阈值。应在相同样本与缩放口径下,和基础发生率、当前生产版本或其他获批参考预测比较,并同时检查类别分布、关键切片、不确定性和具体错误代价。
Brier Score 是校准指标吗?
它是受校准影响的 Proper Probability Score,但聚合值也包含 Resolution 和结果不确定性。如果问题只关注概率是否匹配真实频率,还需使用 Reliability Diagram、ECE 或另一项明确的校准估计器。
为什么不同工具的 Brier Score 范围不同?
二分类常用 `(p-y)^2`,范围为 0 到 1;原始多分类形式对全部类别平方误差求和,范围为 0 到 2;部分实现会将特定情形缩放二分之一。必须发布精确公式和选项。
Brier Score 能评估 LLM 置信度吗?
可以,但每个答案必须映射到明确裁决事件,Confidence 也必须是针对该事件的概率。应保留 Prompt、模型、置信度提取方式、答案归一化、标签策略和切片,不能未经验证改用 Token Likelihood。