什么是 概念白化(Concept Whitening)?
概念白化(Concept Whitening)是一种内生可解释技术,它用白化与学习到的正交旋转替换模型中的归一化层,使选定潜在坐标轴在训练期间与预定义的人类可解释概念对齐。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
白化潜在表征
在选定网络层上,根据训练批次或维护的统计量估计激活均值与协方差,中心化特征,再应用协方差逆平方根变换。按该估计器计算,输出近似具有零均值与单位协方差。Concept Whitening 论文利用这种归一化后的旋转自由度,把潜在轴朝用户指定概念定向。
使用概念监督旋转坐标轴
任何正交旋转都会保持单位协方差,因此可以优化旋转矩阵,让指定坐标对其概念样本产生强响应。训练可交替执行任务参数更新、白化统计更新与概念批次上的旋转更新。概念数据、轴分配、更新计划以及概念是否重叠都属于模型规格,而不是事后展示选项。
检验轴纯度与下游使用
在实体级留出集上评测概念区分、校准、非目标概念交叉激活、跨种子稳定性、任务性能与概念占比偏移稳健性,并在等预算下与普通归一化及事后探针比较。还要干预对齐坐标测试下游效应,同时检查其他坐标或后续层能否重构同一概念、携带标签泄漏。
主要特点
- 直接改变模型训练,而不是只分析冻结检查点
- 使用协方差统计中心化并白化选定潜在特征
- 学习正交旋转,把概念分配给指定坐标轴
- 需要带标签概念样本和明确的轴分配
- 旋转后保持去相关,但不保证统计独立
- 需要留出集纯度、泄漏、稳定性和干预评测
常见用途
- 训练具有可检查概念坐标的视觉分类器
- 监控选定语义属性是否在优化过程中形成
- 比较内生概念对齐与事后概念探针
- 审计分配到不同坐标轴的相关概念是否串扰
- 为下游干预实验构建候选概念控制变量
示例
Loading code...常见问题
概念白化与普通白化有什么区别?
普通白化会中心化特征并把协方差变换为单位矩阵,但坐标朝向仍是任意的。概念白化进一步用带标签概念样本学习正交旋转,让指定坐标与声明语义对齐。因此,概念目标与监督数据是该方法不可缺少的组成部分。
概念白化与 TCAV 有什么区别?
TCAV 分析冻结模型,事后拟合概念方向并检验目标沿该方向的敏感性;概念白化则改变训练过程,使指定表征轴主动朝概念对齐。两者都依赖概念样本,但一个诊断已有空间,另一个刻意构造对齐空间。
白化会让不同概念统计独立吗?
不会。单位协方差只消除了白化样本上的估计线性二阶相关,不能排除非线性依赖、混杂、标签泄漏或语义重叠。概念轴仍可能共同激活,后续层也能重新组合它们;独立性需要更强假设与专门检验。
概念相关或不完整时会发生什么?
相关概念可能争夺互相正交的坐标轴或彼此泄漏,不完整词表则会让任务相关变化残留在未分配坐标中。应报告概念共现结构、跨轴激活、任务与概念权衡及替代概念集结果,而不是把每个坐标当作隔离的真实因素。
怎样验证概念白化模型?
使用实体级留出切分检验概念区分、校准、串扰、跨种子稳定性、任务质量与分布偏移稳健性;再与相同架构的普通归一化版本和事后探针公平比较。最后通过坐标干预测量下游影响,并排查旁路或重构路径。