什么是 概念瓶颈模型(CBM)?

概念瓶颈模型(CBM)是一类把输入映射为明确的人类可解释概念变量,再从这些概念计算目标预测的架构,从而形成可检查并可能由用户修正的中间接口。

快速了解

规范文档官方规范

工作原理

定义概念契约

选择领域用户能够一致标注、且在目标决策时点真实可用的概念,并说明每个变量是二值、类别、有序、连续还是带不确定性,同时定义标注指引和缺失值策略。原始 Concept Bottleneck Models 论文形式化了输入到概念、概念到标签的两阶段结构,并评估对预测概念进行干预的效果。

选择独立、顺序或联合训练

独立训练让两个阶段都使用真实概念;顺序训练先拟合概念预测器,再用其预测概念训练任务头;联合训练同时优化概念损失与任务损失。不同方案会权衡任务准确率、概念忠实度、对概念误差的稳健性和干预便利性。任何残差输入路径或不受约束的潜变量通道都必须公开,因为它会削弱瓶颈主张。

分别评测概念、任务与干预

报告概念区分能力、校准、子群误差、缺失标签行为、任务性能和概念分布偏移下的稳健性。使用现实的纠正策略测量干预收益,并与随机纠正或同成本策略比较。还要检验声明的概念集是否足以支持目标,以及概念相关或带逻辑约束时干预效果是否仍然合理。

主要特点

  • 在原始输入与目标预测之间放置命名概念变量
  • 支持检查并受控修正中间概念值
  • 可采用独立、顺序、联合或混合目标训练
  • 要求明确概念 Schema、标签、不确定性与缺失值处理
  • 必须审计概念不完整、泄漏、捷径和旁路
  • 把概念质量、任务质量与干预效用作为独立指标

常见用途

  1. 让临床人员在诊断输出前复核模型预测的医学发现
  2. 调试哪些语义属性驱动视觉分类结果
  3. 在维护决策前修正传感器或部件状态概念
  4. 比较面向人机协作的不同概念标注方案
  5. 检验目标任务能否通过可审计语义接口完成

示例

loading...
Loading code...

常见问题

什么样的模型才是真正的概念瓶颈模型?

目标预测必须由声明的概念表示计算,而不是在一个不受约束的预测器旁边额外展示概念分数。如果原始特征或潜在残差绕过概念接口,架构就属于混合模型,必须明确说明,因为纠正概念未必能控制完整决策路径。

CBM 的独立、顺序与联合训练有什么区别?

独立训练用真实概念拟合任务头;顺序训练用冻结第一阶段产生的预测概念拟合任务头;联合训练同时优化概念与目标损失。三者面对的训练测试错配和任务概念权衡不同,不说明训练协议就不能直接比较结果。

概念瓶颈模型中的概念泄漏是什么?

概念泄漏是学习到的概念表示携带了超出声明语义的目标信息,例如连续概念分数编码了类别内部细节,或标注过程留下目标线索。此时高任务准确率会夸大语义忠实性,需要通过瓶颈容量控制、对抗测试与干预行为诊断。

概念干预应怎样评测?

先定义由谁纠正、能观察哪些概念、怎样处理不确定性和依赖关系,以及现实纠正预算。测量目标改善、有害变化、子群影响和校准,并与随机或同成本干预比较。一次性纠正全部概念的 Oracle 结果只是上界,不是日常运行效果。

CBM 能保证解释准确且完整吗?

不能。概念集可能漏掉决定性信息,标签可能有噪声,预测概念可能失准,任务头还可能利用概念间相关性。CBM 提供的是一个可以检验忠实度与效用的结构化接口,不会自动让完整决策过程变得正确、因果或可理解。

相关术语