什么是 因果擦洗(Causal Scrubbing)?
因果擦洗(Causal Scrubbing)是一种机制可解释性方法:把明确的计算假设转换为重采样干预,按照该假设规定的等价关系替换内部激活,再检验模型是否保留相关行为。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
测试前写清抽象与具体对应关系
先声明抽象变量、依赖关系、模型组件、词元位置、输入分布和行为指标,再定义每个抽象节点下哪些输入等价,以及由哪个具体激活实现它。因果擦洗方法要求干预遵循这份解释,不能在看到结果后挑选方便的供体。
执行由假设许可的重采样消融
对每个待测节点,从在假设要求保留的抽象信息上相同的输入中采样供体,替换对应激活后继续模型计算。应跨供体、样本与随机种子重复,并在同一指标下比较原模型、无限制重采样、随机或均值消融及替代假设。聚合前保留节点、位置和等价类粒度。
非对称解读保持与退化
若行为显著退化,说明被测试的对应关系在该干预下不充分,或实现存在错误;若行为保持,只说明结果与假设相容,还可能存在更粗粒度、冗余或完全不同的机制。结论取决于供体覆盖、等价类质量、指标灵敏度,以及重采样激活是否仍处于现实分布。
主要特点
- 从明确的抽象计算假设与模型对应关系出发
- 定义许可内部重采样干预的输入等价类
- 用符合假设约束的供体输入替换具体激活
- 通过预先声明的行为指标测量保持或退化
- 需要供体、消融、替代假设与分布对照
- 可以证伪或支持被测解释,但不能建立唯一性
常见用途
- 检验候选回路是否只计算其声称的抽象变量
- 检查模型组件在假设定义的等价类内是否可互换
- 在匹配干预下比较互相竞争的机制解释
- 根据擦洗后行为损失定位假设遗漏的依赖
- 把非正式回路图转换为可复现的内部干预契约
示例
Loading code...常见问题
通过因果擦洗测试究竟证明了什么?
它说明模型在由某一假设、解释映射、数据集与指标共同生成的重采样干预下,保留了被测行为。这是与该解释相容的证据,但不能证明解释唯一、最小、完整,也不能自动外推到测试分布之外;结论必须连同干预范围一起报告。
因果擦洗与激活修补有什么区别?
激活修补常检验把干净运行的某个激活写入受损运行后,能否恢复行为指标;因果擦洗先提出明确抽象假设,再通过其中的等价关系系统选择供体。前者是内部干预原语,后者是由重采样干预组成的假设检验协议,研究问题和证据范围并不相同。
因果擦洗怎样选择供体输入?
供体必须在待测节点应表示的抽象信息上与原输入相同,并在假设要求时满足父节点相关约束。规则应在查看结果前固定,不能为了保持性能临时挑供体。若等价类样本稀少、覆盖偏斜或包含泄漏,测试力度会下降,必须单独报告。
正确假设为什么也可能无法通过因果擦洗?
具体组件映射可能写错,重采样激活可能落到分布外,指标可能混入无关行为,或抽象假设遗漏了实现所需的依赖。失败因此拒绝的是当前整套对应关系,并为修正提供线索,但不会自动指出究竟是哪一条假设、供体规则或实现出错。
因果擦洗等同于观察数据上的因果推断吗?
不等同。它对已知模型计算执行受控内部重采样,用于检验机制抽象;经典因果推断常面对真实系统中的部分可观测性、处理分配和可识别性假设,用观察或实验数据估计效应。两者共享因果语言,但研究对象、假设和结论范围不同。