什么是 分类准确率(Classification Accuracy)?

分类准确率(Classification Accuracy)是评测样本中,预测硬标签与已声明参考标签完全一致的样本比例。

快速了解

规范文档官方规范

工作原理

与正确的无技能基线比较

对类别不均衡的单标签数据,多数类预测器即使找不到任何少数类,也可能得到很高准确率。应同时报告该基线、完整[混淆矩阵](https://qubittool.com/zh/glossary/confusion-matrix)和逐类召回率。如果两类错误成本不同,比起让每个正确标签具有同等价值,成本加权决策指标可能更贴近真实目标。

定义一条样本怎样才算正确

普通单标签 Accuracy 让每条评测样本拥有一票,Sample Weight 会改变目标量。多标签任务中,当前 scikit-learn API采用 Subset Accuracy:一条样本的整组标签必须完全匹配。Token、Span、文档、会话和用户级准确率即使公式相同,回答的也是不同问题。

保护独立评测边界

使用稳定样本 ID 关联预测与标签,保留无效输出和拒答,按真正需要泛化的实体或时间边界切分数据,并在模型选择后冻结测试集。比较发布版本时还应提供置信区间或成对不确定性。训练集准确率、发生泄漏的留出集,或标签尚未成熟的数据都不能证明生产泛化。

主要特点

  • 计算硬标签完全匹配占评测样本或总权重的比例
  • 使用所有类别,但默认让每次正确预测拥有相同价值
  • 对输出分数的二分类器依赖决策阈值
  • 可能被高频多数类主导
  • 常见多标签实现采用整组标签完全匹配语义
  • 不衡量排序质量、概率校准或不对称错误成本

常见用途

  1. 在类别均衡时把单标签分类器与简单基线比较
  2. 标签契约冻结后跟踪路由标签完全命中率
  3. 在相同操作阈值下比较确定性分类器
  4. 测量明确多标签输出的 Exact-set 正确性
  5. 与逐类错误和不确定性一起报告粗粒度摘要

示例

loading...
Loading code...

常见问题

分类准确率如何计算?

用硬标签完全匹配的样本数量或总权重除以全部评测样本或总权重。还要公开标签集合、采样单位、权重、阈值、无效输出策略与置信区间,确保分母和指标含义可以复现。

为什么高分类准确率可能误导?

某类占绝大多数时,把每条样本都预测成多数类也可能得到高分,却完全漏掉少数类。应与多数类基线比较,并检查混淆矩阵、逐类召回率、精确率、支持度和实际决策成本。

多标签 Subset Accuracy 是什么?

只有一条样本的完整预测标签集合与参考集合完全一致时,才把它计为正确。这比逐标签平均正确率更严格,因此报告必须写明多标签口径,不能只给一个没有定义的 Accuracy。

分类准确率能评价预测概率吗?

不能。准确率评价 Argmax 或阈值之后的硬标签。两个模型可以拥有完全相同的标签和准确率,却给出含义完全不同的概率。概率质量应使用 Log Loss 或 Brier Score,排序则使用 ROC-AUC 或 PR 分析。

生产评测还应与准确率一起报告什么?

至少包括基线、混淆矩阵、逐类指标、样本支持度、不确定性、关键切片、阈值与拒答行为、标签成熟度、漂移检查,以及每类错误造成的真实运营后果。

相关术语

相关文章