什么是 Tuned Lens(调优透镜)?
Tuned Lens(调优透镜)是一种可解释性方法:为模型每一层训练独立仿射转换器,使中间残差状态经模型反嵌入后得到的分布接近最终词元分布。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
为每一层训练独立转换器
在训练语料上收集中间残差状态与冻结模型的最终输出分布。对第 l 层学习仿射映射 A_l h_l + b_l,再应用检查点的最终归一化与反嵌入。Tuned Lens使用蒸馏目标,通常以交叉熵或 Kullback-Leibler 散度匹配模型最终分布,而不是拟合人工任务标签。
在留出提示与基线上评价
转换器训练、超参数选择和最终评价样本必须互相隔离。应按层与提示分组报告留出集散度、熵、校准、目标 Token 排名和种子波动,并与原始 Logit Lens、恒等或均值基线及容量匹配控制比较。若转换器记住了语料规律,它可能预测准确,却没有忠实揭示某次激活。
谨慎解释转换后的轨迹
更准确地预测最终分布,只支持“学习到的仿射映射能够解码该层”,不代表模型自身执行了这项映射。转换器可能旋转特征、恢复分散在多个维度的相关性,或注入自身先验。它适合生成假设和诊断;关于真实计算的主张仍需激活修补、消融或其他受控干预验证。
主要特点
- 为每个被分析的模型层学习不同仿射转换器
- 训练转换器时保持来源语言模型完全冻结
- 通常蒸馏模型最终下一词元分布,而非拟合任务标签
- 相较原始 Logit Lens 可减轻中间层到输出层的基底错配
- 需要留出数据、容量控制、校准检查和随机种子报告
- 仍是学习型观察探针,不能建立模型因果使用关系
常见用途
- 追踪模型最终词元分布从哪些层开始可被恢复
- 比较不同提示或检查点的中间预测轨迹
- 诊断不确定性、候选答案或事实信息在哪些层被解决
- 为因果干预生成候选层与词元位置
- 审计原始 Logit Lens 模式在学习型基底修正后是否保留
示例
Loading code...常见问题
Tuned Lens 解决了什么问题?
不同深度的表征基底会变化,最终反嵌入可能无法直接解码早期残差状态。Tuned Lens 为每层学习仿射映射,使该状态更能预测最终分布。它缓解的是解码基底错配,不代表已经消除了模型真实计算与探针解释之间的差异。
Tuned Lens 的转换器怎样训练?
先冻结语言模型,在训练语料上收集中间状态和模型最终词元分布,再让每层仿射转换器最小化交叉熵或 KL 散度等蒸馏损失。转换器训练、超参数选择与最终评价提示必须严格分离,并记录模型版本、Hook 点和归一化约定。
Tuned Lens 会加入激活中不存在的信息吗?
仿射映射不能凭空还原任意缺失信息,但学习到的偏置和旋转可以编码语料级先验,并放大跨维度分布的相关性。因此,容量过高或控制不足的探针可能预测很好,却不匹配模型自身计算;需要容量匹配基线与分组留出评价来排除混杂。
应该怎样评价 Tuned Lens 的质量?
应报告相对最终分布的留出集散度、熵、校准、目标 Token 排名、样本量与随机种子波动,并按层和提示组拆分;同时比较原始 Logit Lens 及简单或容量匹配控制。不能用最终测试集挑选转换器检查点、超参数或解释结论。
Tuned Lens 轨迹能解释模型为什么作答吗?
不能单独做到。它表明训练后的转换器能从每层恢复什么,并可形成有价值的机制假设。若要解释某状态或组件的因果贡献,还需要在合适控制下直接干预它,并在代表性数据上检验预先声明的行为指标,同时排查替代计算路径。