什么是 机制可解释性?
机制可解释性是识别训练后模型的内部表征、组件及其交互,并通过干预检验所提出机制能否因果解释特定行为的研究方法。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
从模型组件建立候选电路
分析可从残差流方向、注意力头、MLP 输出、单个神经元或稀疏字典恢复的特征开始。归因和可视化用于定位与行为相关的组件,电路假设则需要说明这些组件如何跨词元位置和层相互作用。Transformer Circuits 框架给出了研究这类计算的一套代表性术语和方法。
用干预检验因果主张
消融会移除或替换组件,激活修补会在受控运行之间传递内部状态,反事实输入则检验候选计算是否真正跟随目标变量。可靠实验应比较多种基线、尽量保持无关状态不变、预先定义输出指标并设置负对照。定位结果说明某处在特定干预下重要,但不会自动给出最小或完整算法。
为每个解释标明适用范围
机制结论依赖检查点、架构、提示分布、词元位置、干预方式和评价指标。特征可能是分布式的或处于叠加表征中,看似连贯的单元也可能随上下文发生拆分、合并或换义。报告应写明目标行为、数据、组件粒度、因果效应、不确定性和失败案例。可解释性证据能支持调试和风险分析,但不能证明模型安全或拥有某种意图。
主要特点
- 通过内部表征与计算解释明确定义的模型行为
- 从激活、权重、特征和信息流建立模型电路假设
- 严格区分相关性定位与因果干预证据
- 把结论限定在检查点、提示分布、位置和指标范围内
- 使用多种基线、对照、反事实与复现检验稳健性
- 不预设神经元、注意力头或学习特征天然对应人类概念
常见用途
- 追踪模型完成事实回忆或算法任务时使用的内部计算
- 检验可疑特征或电路是否导致特定错误输出
- 比较相关模型检查点实现同一任务的机制差异
- 诊断脆弱捷径、上下文依赖和意外特征交互
- 为模型编辑、监控或安全评估建立可审计假设
示例
Loading code...常见问题
机制可解释性与可解释人工智能有什么区别?
可解释人工智能还包括输出层解释、特征归因、示例、代理模型和面向用户的理由。机制可解释性更聚焦模型内部表征与计算,希望用因果实验说明模型组件如何实现某项具体行为,而不只提供一个看起来合理的输出解释。两者可以组合,但所回答的问题和证据标准不同。
找到与行为相关的神经元就算解释了模型吗?
不算。相关神经元可能只记录结果、与其他组件共享信息,或只在少数上下文中有效。更强的解释需要受控干预、不同基线、负对照,以及在具有代表性的输入上复现,才能判断它是否真正参与目标计算,还要检查移除后其他组件是否会补偿。
机制可解释性中的模型电路是什么?
模型电路是对一组组件及其交互如何实现某项明确计算的假设。组件可以是注意力头、MLP、残差流方向、神经元或学习到的特征。合格的电路应能预测干预结果,而不只是概括一张激活图;组件边界和行为指标也必须随假设一起定义。
机制可解释性能证明模型安全吗?
不能。一次分析只覆盖选定行为、提示、组件和指标,未测试机制与分布偏移仍可能存在。机制证据可以发现风险、改进监控和检验安全假设,但仍需结合行为评估、威胁建模和部署控制,并把未覆盖场景明确记录为剩余风险。
应怎样验证一项机制解释?
先定义行为和指标,再定位候选组件并对其进行干预,比较多种合理基线,加入负对照,并在留出的提示族或检查点上测试。还应报告效应大小、剩余未解释行为、对实验设计的敏感性以及机制失效案例;只有多类证据一致时,结论才更可信。