什么是 Logit Lens(词表投影视角)?
Logit Lens(词表投影视角)是一种无需额外训练的可解释性方法:把语言模型中间层的残差流状态送入该模型最终归一化与反嵌入矩阵,生成可跨层观察的词表 Logit 或概率分布。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
把中间状态投影到词表空间
先在明确的 Hook 点捕获残差流,例如 Block 前或 Block 后,并固定词元位置;再应用检查点输出头使用的同一组最终 LayerNorm 或 RMSNorm 与反嵌入矩阵。Logit Lens 的原始介绍采用这种直接投影,不为每一层另行训练转换器。
比较轨迹而不是孤立词元
应跨层检查 Top Token 排名、目标 Token Logit、熵和相对最终分布的散度,并固定 Tokenizer、归一化、Logit 尺度与温度。还要比较正确提示与对照提示、多个词元位置、随机或未训练基线以及重复样本。单个看似合理的解码词元证据很弱,因为词表投影会同时暴露许多相关方向。
处理基底错配与因果边界
后续层可能在最终输出前旋转、细化或抵消方向,因此直接反嵌入早期残差状态会混合真实信号与基底错配。Tuned Lens 通过逐层学习转换器减轻错配,但会引入探针训练混杂。两种 Lens 都不能证明必要性或充分性;因果依赖仍需通过激活修补、消融或其他受控干预检验。
主要特点
- 复用检查点最终归一化与反嵌入,不额外训练探针
- 把指定中间残差状态映射为词表 Logit 或概率
- 必须固定 Hook 点、词元位置、归一化和 Tokenizer 约定
- 可观察词元排名、熵、Logit 或散度的逐层轨迹
- 可能受到中间层与输出层基底错配影响,早期层尤为明显
- 只提供观察性证据,不能单独证明模型因果使用该信号
常见用途
- 观察候选下一词元预测如何随模型深度演化
- 比较正确提示与对照提示的残差流解码轨迹
- 定位目标词元开始可见或随后被抑制的层
- 为激活修补或消融实验筛选候选组件
- 检验单个样例中的解释能否在受控数据集上复现
示例
Loading code...常见问题
Logit Lens 投影的究竟是什么?
它投影的是指定词元位置上的中间残差流向量。该向量经过检查点最终归一化与反嵌入后形成词表 Logit。结果取决于 Hook 位于 Block 前还是后,也取决于归一化、残差加法和输出头约定,因此报告必须写明精确抓取点。
Logit Lens 是否需要额外训练?
不需要训练单独探针,它直接复用模型最终输出变换,因此运行快,也不会引入学习型探针的容量。不过,无需训练不代表投影无偏:中间状态可能尚未处于最终反嵌入所期待的基底,尤其早期层结果可能主要反映这种错配而非稳定预测。
为什么早期层的 Logit Lens 预测可能误导?
早期残差状态中的特征可能被后续层旋转、组合、抑制或抵消。过早套用最终解码器,可能暴露基底错配或相关词元方向,而不是稳定预测。跨样本、跨层的完整轨迹,以及与对照提示和最终分布的比较,比单个醒目词元更可信。
Logit Lens 与 Tuned Lens 有什么区别?
Logit Lens 在每层直接应用最终输出接口;Tuned Lens 会先为每层学习一个仿射转换器,通常通过匹配最终模型分布来训练。后者可能改善校准并减轻基底错配,但也新增训练数据、优化超参数与探针带入信息的混杂,必须在留出集评价。
Logit Lens 能证明某一层导致了答案吗?
不能。它只表明某个词元相关方向在特定投影下可见。若要检验因果使用,需要在保持其他计算受控的条件下干预候选激活,再测量预先声明的行为指标。激活修补、消融或引导能提供更强证据,但仍需排查替代路径与数据偏差。