什么是 分类准确率(Classification Accuracy)?
分类准确率(Classification Accuracy)是评测样本中,预测硬标签与已声明参考标签完全一致的样本比例。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
与正确的无技能基线比较
对类别不均衡的单标签数据,多数类预测器即使找不到任何少数类,也可能得到很高准确率。应同时报告该基线、完整[混淆矩阵](https://qubittool.com/zh/glossary/confusion-matrix)和逐类召回率。如果两类错误成本不同,比起让每个正确标签具有同等价值,成本加权决策指标可能更贴近真实目标。
定义一条样本怎样才算正确
普通单标签 Accuracy 让每条评测样本拥有一票,Sample Weight 会改变目标量。多标签任务中,当前 scikit-learn API采用 Subset Accuracy:一条样本的整组标签必须完全匹配。Token、Span、文档、会话和用户级准确率即使公式相同,回答的也是不同问题。
保护独立评测边界
使用稳定样本 ID 关联预测与标签,保留无效输出和拒答,按真正需要泛化的实体或时间边界切分数据,并在模型选择后冻结测试集。比较发布版本时还应提供置信区间或成对不确定性。训练集准确率、发生泄漏的留出集,或标签尚未成熟的数据都不能证明生产泛化。
主要特点
- 计算硬标签完全匹配占评测样本或总权重的比例
- 使用所有类别,但默认让每次正确预测拥有相同价值
- 对输出分数的二分类器依赖决策阈值
- 可能被高频多数类主导
- 常见多标签实现采用整组标签完全匹配语义
- 不衡量排序质量、概率校准或不对称错误成本
常见用途
- 在类别均衡时把单标签分类器与简单基线比较
- 标签契约冻结后跟踪路由标签完全命中率
- 在相同操作阈值下比较确定性分类器
- 测量明确多标签输出的 Exact-set 正确性
- 与逐类错误和不确定性一起报告粗粒度摘要
示例
Loading code...常见问题
分类准确率如何计算?
用硬标签完全匹配的样本数量或总权重除以全部评测样本或总权重。还要公开标签集合、采样单位、权重、阈值、无效输出策略与置信区间,确保分母和指标含义可以复现。
为什么高分类准确率可能误导?
某类占绝大多数时,把每条样本都预测成多数类也可能得到高分,却完全漏掉少数类。应与多数类基线比较,并检查混淆矩阵、逐类召回率、精确率、支持度和实际决策成本。
多标签 Subset Accuracy 是什么?
只有一条样本的完整预测标签集合与参考集合完全一致时,才把它计为正确。这比逐标签平均正确率更严格,因此报告必须写明多标签口径,不能只给一个没有定义的 Accuracy。
分类准确率能评价预测概率吗?
不能。准确率评价 Argmax 或阈值之后的硬标签。两个模型可以拥有完全相同的标签和准确率,却给出含义完全不同的概率。概率质量应使用 Log Loss 或 Brier Score,排序则使用 ROC-AUC 或 PR 分析。
生产评测还应与准确率一起报告什么?
至少包括基线、混淆矩阵、逐类指标、样本支持度、不确定性、关键切片、阈值与拒答行为、标签成熟度、漂移检查,以及每类错误造成的真实运营后果。