什么是 概念激活向量测试(TCAV)?

概念激活向量测试(TCAV)是一种事后可解释方法:它在模型激活空间中学习人类定义概念的方向,并测量目标输出沿该方向具有局部敏感性的样本比例。

快速了解

全称Testing with Concept Activation Vectors
规范文档官方规范

工作原理

构造可复现的概念实验

先固定模型检查点、网络层、目标输出、概念定义、具有代表性的正样本,以及多组独立抽样的随机反例。所有样本必须经过相同预处理并提取同一种激活表示。原始 TCAV 论文用线性分类器区分概念激活与随机激活;留出集分隔准确率只是概念方向质量检查,不是最终 TCAV 结论。

计算方向敏感性并重复实验

把线性分隔器法向量作为 CAV,再对每个目标样本计算目标 Logit 或分数关于所选激活的梯度,梯度与 CAV 的点积就是局部方向导数。统计符合约定符号的样本比例,使用多组随机集与多个种子重复,并与随机概念比较,报告置信区间或预先声明的显著性检验。

审计概念有效性与结论范围

结果会受到层、概念图片、随机分布、概念相关性、类别子集、梯度饱和与 CAV 朝向影响。应检查概念集多样性、训练测试分离、随机对照、多重检验策略、效应稳定性和替代层。TCAV 证明的是模型对学习方向的局部敏感性,不能证明概念被唯一表示、具有全局重要性或被模型因果使用。

主要特点

  • 把用户定义概念表示为指定网络层激活空间中的方向
  • 通过概念样本和明确的随机反例拟合概念方向
  • 测量目标分数的方向导数,而不是原始激活强度
  • 汇总目标样本满足约定导数符号的比例
  • 需要多组随机集、种子变化与统计对照
  • 建立局部概念敏感性,而不是贡献百分比或因果关系

常见用途

  1. 检验图像分类器是否对纹理、颜色或形状概念敏感
  2. 比较不同层、类别与模型检查点的概念敏感性
  3. 审计医学模型是否响应具有临床意义的形态
  4. 在定向消融或反事实测试前筛选可疑捷径
  5. 跟踪微调是否改变模型对预定义概念的敏感性

示例

loading...
Loading code...

常见问题

TCAV 分数究竟表示什么?

在声明的目标样本集、网络层、分数函数和 CAV 朝向下,它表示目标分数沿概念方向的方向导数为正的样本比例。分数为 0.8 只说明 80% 样本满足该符号条件,不表示概念导致了预测,也不表示概念贡献了每次预测的 80%。

概念激活向量怎样学习?

实验在同一网络层收集概念样本和随机反例的激活,拟合线性分隔器,并按明确符号约定把法向量作为概念方向。原始协议会使用多组随机集重复这一过程,因为单个方便选取的基线可能让方向与 TCAV 分数不稳定。

CAV 分类器准确率高就足以验证 TCAV 吗?

不够。高准确率只说明所选激活能区分提供的概念样本与随机样本,并不证明概念集有代表性、目标输出对该方向敏感,也不保证结论能经受其他随机集、层、种子、相关概念和留出目标样本的检验。

TCAV 与线性探针有什么区别?

两者都可能在冻结激活上拟合线性边界,但估计目标不同。线性探针报告标签能否从表征中解码;TCAV 把边界法向量当作概念方向,再评估目标分数的方向导数。任何一种方法单独使用都不能证明模型因果依赖被解码的概念。

TCAV 能证明某个概念导致了预测吗?

不能。TCAV 是学习到的激活方向上的局部敏感性测试,相关概念、离流形方向、梯度饱和与下游冗余路径都会影响解释。因果结论需要受控的概念或激活干预、行为测量、负对照和替代路径检验。

相关术语