什么是 布里尔分数(Brier Score)?

布里尔分数(Brier Score)是一种严格 Proper Scoring Rule,通过计算预测概率分布与二元结果或 One-hot 类别向量之间的平均平方距离,评价概率预测质量。

快速了解

规范文档官方规范

工作原理

必须相对明确基线解释分数

原始 Brier 数值没有通用优良阈值。应在完全相同的样本上,与经验基础发生率、当前生产模型或其他获批预测进行比较。Brier Skill Score 常写成 1 - candidate_score / reference_score:正值表示优于该参考,零表示持平,负值表示更差。参考人群、事件窗口和标签完整性都属于结果身份。

不要把 Brier Score 简化成纯校准指标

该分数同时包含概率可靠性、区分能力与结果不确定性。当前 scikit-learn 校准文档明确提醒:Aggregate Brier Loss 下降可能来自区分能力提升,即使校准变差。诊断发布版本时,应在适用时使用 Murphy Decomposition,并结合 Reliability Diagram、ECE、区分指标和任务错误。

固定概率与标签契约

校验概率有限、类别顺序、归一化、样本权重、事件期限和延迟标签完整性。评估 LLM 或 Judge 置信度时,还要定义开放回答如何映射为结果,以及置信度如何获得;Token Likelihood 与口述百分比不能互换。记录模型、Prompt、校准器、数据集、语言和切片身份,并在分布或策略变化后重算。当前 scikit-learn API明确记录了二分类、多分类、标签顺序与缩放行为。

主要特点

  • 根据真实结果评估完整概率预测
  • 在概率与结果空间定义正确时属于严格 Proper Scoring Rule
  • 以平方方式惩罚高置信度错误
  • 聚合值同时包含 Reliability、Resolution 与 Outcome Uncertainty
  • 存在必须显式声明的二分类与多分类缩放约定
  • 需要参考分数、任务指标、切片和标签完整性检查

常见用途

  1. 评估二元风险、欺诈、故障或成功概率
  2. 评价多分类概率向量而不只检查 Top-1 标签
  3. 在冻结样本上比较校准前后的模型发布版本
  4. 审计 Reward Model、LLM Judge 或回答口述置信度
  5. 计算相对基础发生率或生产参考预测的 Skill Score

示例

loading...
Loading code...

常见问题

布里尔分数如何计算?

对二元事件,计算每个正事件预测概率与 0 或 1 结果的平方差,再求平均。对多分类预测,则对已声明类别向量的每一维计算平方差、按样本求和后再平均。

多少 Brier Score 算好?

没有通用阈值。应在相同样本与缩放口径下,和基础发生率、当前生产版本或其他获批参考预测比较,并同时检查类别分布、关键切片、不确定性和具体错误代价。

Brier Score 是校准指标吗?

它是受校准影响的 Proper Probability Score,但聚合值也包含 Resolution 和结果不确定性。如果问题只关注概率是否匹配真实频率,还需使用 Reliability Diagram、ECE 或另一项明确的校准估计器。

为什么不同工具的 Brier Score 范围不同?

二分类常用 `(p-y)^2`,范围为 0 到 1;原始多分类形式对全部类别平方误差求和,范围为 0 到 2;部分实现会将特定情形缩放二分之一。必须发布精确公式和选项。

Brier Score 能评估 LLM 置信度吗?

可以,但每个答案必须映射到明确裁决事件,Confidence 也必须是针对该事件的概率。应保留 Prompt、模型、置信度提取方式、答案归一化、标签策略和切片,不能未经验证改用 Token Likelihood。

相关术语

相关文章