什么是 选择性预测(Selective Prediction)?

选择性预测(Selective Prediction)是一种把预测器与选择函数组合的决策框架:系统只接收部分输入并自动预测,对其余输入执行拒绝、转交或升级。

快速了解

规范文档官方规范

工作原理

同时度量 Coverage 与 Selective Risk

Coverage 是被系统接收并自动预测的案例比例。Selective Risk 是已接收案例上的平均指定损失;在零一分类中就是错误率。应扫描阈值得到 Risk-Coverage Curve,并报告与工作量和伤害绑定的运行点。AURC 可以汇总曲线,但依赖基础预测器、损失、有限样本估计器和 Coverage Grid。Population AURC 研究给出了这些估计边界的形式化说明。

把拒绝路径作为系统的一部分设计

只有 Fallback 可用、有权限、及时且更安全时,Abstention 才有价值。选择阈值前先定义队列容量、评审专业性、截止时间、升级、重试与无人响应行为,并计入错误接收、错误转交、人工复核、延迟和悬而未决的成本。来自另一模型或人群的 Confidence Cutoff 没有稳定业务含义。

在分布漂移与关键切片上评测

使用防泄漏留出案例,把模型、分数、阈值、损失和 Fallback 冻结为同一个发布契约。按类别、语言、来源、难度、用户群和时间窗口报告 Coverage 与 Risk;Aggregate 改善可能掩盖系统性转交或危险接收。SelectiveNet展示了联合优化预测与拒绝,但其 Benchmark 结果不能提供另一工作负载的生产阈值或公平性保证。

主要特点

  • 把预测器与明确的接收或转交选择函数组合
  • 权衡自动化 Coverage 与已接收案例上的损失
  • 使用 Risk-Coverage 曲线和运行点,而非单一准确率
  • 区分置信排序质量与概率校准
  • 要求 Fallback 路径有界、可观测且通过容量测试
  • 必须评测分布漂移和不同切片上的不均衡转交

常见用途

  1. 把不确定的文档抽取字段转交给专家复核
  2. 延后高风险医疗、金融或合规预测
  3. 把端侧小模型的困难案例发送给更强云端模型
  4. 证据缺失或冲突时让 AI 助手明确 Abstain
  5. 在人工复核预算内维持已声明的接收案例风险目标

示例

loading...
Loading code...

常见问题

选择性预测和置信度校准有什么区别?

校准判断概率数值是否匹配真实频率;选择性预测判断一个分数是否足以排序或区分案例,从而接收一部分并转交其余部分。两种能力可以一强一弱,因此必须分别评测。

Coverage 和 Selective Risk 分别是什么?

Coverage 是自动接收的输入占比;Selective Risk 是这些已接收案例上的指定损失,例如错误率。二者必须共同报告,因为靠转交几乎全部请求取得低风险没有实际运营价值。

选择性预测的阈值应该怎样确定?

应在代表性留出数据上,根据完整 Risk-Coverage Curve、错误代价、复核容量、延迟和关键切片确定。把分数和阈值与发布版本共同冻结,上线后监控漂移,不要复制通用 Confidence Cutoff。

拒绝预测一定比直接预测安全吗?

不一定。转交可能延误处理、压垮复核人员、造成服务不均,或落入不安全默认路径。必须测试队列上限、截止时间、评审错误、升级不可用和最终未解决结果。

分布漂移后如何评估选择性预测?

在时间、语言、来源和用户群等偏移切片上重算 Coverage、Selective Risk、AURC、错误接收、错误转交及 Fallback 结果。在一个分布上认证的阈值不会自动保持相同风险。

相关术语

相关文章