什么是 激活修补?
激活修补是在两个受控模型运行之间替换指定内部激活,并测量该替换如何改变预定义输出行为的因果干预方法。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
构造严格受控的成对运行
选择干净输入和受损输入时,应尽量只改变待研究变量,同时保持句法、长度和无关语义稳定。缓存两个运行的内部激活,再替换单个位置或定义明确的一组位置。修补对象可以是残差流位置、注意力输出、MLP 输出、注意力头、神经元或学习到的特征方向。
测量行为恢复或破坏程度
指标可以是目标词元与干扰词元的 logit 差、概率、损失、排序或任务分数。只有干净与受损运行之间存在有意义差距时才适合归一化恢复率,并应同时报告原始值。模型编辑研究中的因果追踪把输入受损与隐藏状态恢复结合起来定位事实关联,体现了大量激活修补实验所使用的基本干预模式。
控制离流形状态和组件交互
修补后的激活可能形成模型自然运行中不会出现的状态,相关组件也可能互相替代。应比较加噪与去噪方向、不同受损方案、重采样或均值基线、多种指标和负对照位置。单点扫描会漏掉交互,分组或路径修补虽能测试组合,却会扩大搜索空间,仍不能保证得到完整电路。
主要特点
- 在两个受控模型运行之间传递指定内部激活
- 支持恢复行为的去噪实验和破坏行为的加噪实验
- 必须明确受损方式、修补位置、替换来源和输出指标
- 可在层、词元、注意力头、神经元或特征粒度执行
- 提供特定干预下的因果定位,而不是自动给出完整解释
- 对离流形状态、冗余、组件交互和基线选择敏感
常见用途
- 定位模型在哪些内部状态中表示主体、关系或答案信号
- 检验哪些词元位置和层参与传递受控行为
- 比较候选注意力头、MLP 或稀疏自编码器特征
- 通过定向干预验证机制可解释性电路假设
- 为更深入分析或谨慎模型编辑筛选关键组件
示例
Loading code...常见问题
去噪激活修补与加噪激活修补有什么区别?
去噪修补把干净激活放入受损运行,观察目标行为恢复多少;加噪修补把受损激活放入干净运行,观察行为消失多少。由于冗余、非线性交互和离流形状态,两种方向可能产生不对称结果,不能互相替代,因此应并列报告原始效应和实验方向。
激活修补与消融有什么区别?
消融通常移除组件,或用零、均值、重采样激活等通用基线替换它。激活修补使用某个具体对照运行产生的状态,能够保留更多结构化信息,并检验这一运行相关状态是否会改变选定行为。不同替换基线回答的问题不同,结论不能直接混用。
较高的修补分数能确定模型的完整电路吗?
不能。它只说明替换所选状态在当前实验中产生较大效应。模型还可能有冗余通路,多个组件可能相互作用,一个修补值也可能同时携带多个变量。电路结论需要组合干预、对照和更广覆盖,并检验候选组件之间的替代与协同关系。
应该怎样选择受损输入?
应改变目标因果变量,同时尽量匹配句法、长度、分词和任务难度等无关属性。最好采用多个受损输入族,并验证干净与受损指标差确实来自目标行为,而不是宽泛的分布偏移;还应设置不相关属性变化作为负对照,并复查结论。
激活修补适合使用哪些评价指标?
指标应直接对应研究假设,例如目标与干扰词元的 logit 差、任务损失、概率或排序。报告干净、受损和修补后的原始值,说明任何归一化分母,并检查合理替代指标下结论是否一致,防止归一化掩盖很小的原始差异。