什么是 直接 Logit 归因?

直接 Logit 归因是一种机制可解释性方法,把各残差流组件的输出投影到指定反嵌入方向或 Logit 差方向,以估计每个组件对该输出指标的直接加和贡献。

快速了解

规范文档官方规范

工作原理

分解残差流中的加和项

在固定词元位置,把最终残差状态表示为 Embedding、Attention Head 输出、MLP 输出与相关偏置之和。Transformer Circuits 数学框架明确给出了这种残差流视角。比较分数前应决定按 Block、Attention Layer、Head、Neuron 还是其他组件分组,不能混用粒度。

投影到预先声明的输出方向

分析单个目标词元时使用其反嵌入向量;做对比任务时使用目标减干扰词元的反嵌入方向。对每个组件应用明确记录的最终归一化近似后求内积。TransformerLens提供残差分解和 Logit 归因接口,但仍须核对 Tensor 位置与归一化约定。

区分直接证据与因果影响

正分表示组件在当前分解下直接提高指定 Logit 指标,负分表示降低指标。接近零的直接分数不代表组件无关,因为它可能改变后续 Query、Key、Value、Gate 或 MLP Feature。应跨提示、位置、基线和种子比较,再用路径修补、激活修补或消融检验下游因果效应。

主要特点

  • 利用残差流加和结构分配有符号的直接输出贡献
  • 把组件投影到单词元或目标减干扰词元的反嵌入方向
  • 可按层、Attention Head、MLP、Neuron 或 Embedding 分解
  • 必须明确最终归一化、偏置和词元位置的处理方式
  • 不包含经由后续组件传播的间接效应
  • 提供归因证据,而不是完整或唯一的因果回路

常见用途

  1. 寻找直接支持某个目标词元的 Attention Head 或 MLP Block
  2. 比较各组件对目标与干扰词元 Logit 差的正负贡献
  3. 追踪不同深度的残差写入如何累积到最终指标
  4. 为路径修补或精确激活干预选择候选发送组件
  5. 检查组件贡献是否能跨提示和词元位置稳定复现

示例

loading...
Loading code...

常见问题

直接 Logit 归因分数表示什么?

它是在明确归一化约定下,某个残差流组件沿指定输出方向的有符号投影。正值支持目标词元相对干扰词元,负值则抑制该指标。分数大小依赖指标、词元位置和尺度,不能跨不兼容的提示或实验设置直接比较,也不能脱离原始输出解释。

直接 Logit 归因与 Logit Lens 有什么区别?

Logit Lens 把各层累积残差状态解码为完整词表分布,用来观察预测随深度的轨迹;DLA 则把一个最终 Logit 或 Logit 差拆成 Attention Head、MLP 等写入项的直接贡献。前者追踪状态,后者分解指定输出方向。

DLA 应该怎样处理 LayerNorm?

LayerNorm 的尺度依赖所有残差项之和,因此并非全局线性。常见做法是把最终运行得到的归一化尺度应用到各组件,或使用明确实现该近似的库函数。必须验证各贡献与偏置之和能重建所选最终指标,并公开采用的约定。

DLA 接近零的组件仍可能重要吗?

可能。DLA 只捕获组件对输出方向的直接投影;组件即使没有直接写入目标方向,也可能显著改变后续 Attention Pattern、MLP Gate 或其他特征。路径修补、激活修补和消融才能检验这些经下游组件传递的间接影响。

较大的 DLA 分数能证明组件具有因果作用吗?

不能。该分数是在选定分解下得到的代数归因,相关组件可能向相同方向写入信号。要建立因果重要性,需要直接干预组件或路径,使用匹配对照与替代指标,并确认效应能在发现提示之外的数据上重复,避免把共线贡献当成唯一机制。

相关术语

相关文章