什么是 Patchscopes(表征修补框架)?

Patchscopes(表征修补框架)是一类可配置的可解释性实验:从来源运行提取隐藏表征,可选转换后写入目标运行的指定层与位置,再通过目标模型行为进行解码。

快速了解

规范文档官方规范

工作原理

定义来源到目标的完整配置

记录来源模型及版本、来源提示、层、词元位置、激活类型、转换函数、目标模型、目标提示、目标层、目标位置和解码规则。Patchscopes 论文提出这一模块化配置,并展示词表投影、属性提取、实体描述和跨模型检查可怎样表达为相关的修补设置。

在受控目标提示中修补并解码

先运行来源模型并捕获指定隐藏状态,只在维度或基底不兼容时进行有记录的转换;再把目标上下文运行到插入点,替换目标状态并继续生成。官方项目页给出词元身份、属性、实体与跨模型示例。实验应比较多种目标提示、层、位置、温度和解码约束。

检验激活是否提供额外证据

必须加入无修补、零向量、打乱激活、仅输入与知识错配对照。近期激活言语化研究发现,解码模型可能根据可见提示或自身参数知识作答,而非读取目标激活。因此,应测量相对对照的增量信息、提示变化稳健性、来源与目标模型兼容性及下游因果相关性,再把生成文本视为解释。

主要特点

  • 把来源运行的指定隐藏表征写入目标运行
  • 允许在来源与目标表征空间之间执行可选转换
  • 把目标提示和模型生成用作可配置解码接口
  • 可检查词元身份、属性、上下文化或跨模型映射
  • 必须用基线区分激活证据与提示和模型先验
  • 生成的是候选解释,不保证天然忠实

常见用途

  1. 解码不同模型层隐藏状态中的词元身份
  2. 用自然语言描述最终层之前表示的候选实体信息
  3. 比较兼容模型检查点中同一概念的表征
  4. 检验更强目标模型能否解码较小来源模型的状态
  5. 使用无修补与知识错配对照审计激活言语化

示例

loading...
Loading code...

常见问题

一个可复现的 Patchscope 需要记录什么?

需要记录来源模型、提示、层、位置和激活类型,可选的来源到目标转换,以及目标模型、提示、层、位置、解码和评价规则。任何一项缺失都可能改变实际干预对象,使不同实验得到的自然语言解释无法公平比较或可靠复现。

Patchscopes 与激活修补有什么区别?

激活修补通常询问一次替换能否在匹配运行中恢复或改变任务指标;Patchscopes 把另行设计的目标上下文当作解码接口,还可以跨提示或跨模型写入状态。因果定位只是其中一种配置,读取词元、属性与自然语言描述也是独立用途。

Patchscopes 是否需要训练探针?

不一定。同模型配置可以使用恒等转换和精心设计的目标提示;跨模型或维度不匹配时可能需要学习映射。无论是否训练,都要在留出数据上测量目标提示敏感性、目标模型先验和映射误差,不能把无需额外训练等同于无偏或天然忠实。

Patchscope 生成的自然语言解释会失真吗?

会。目标模型可能从可见提示推断答案,或调用自身参数中的知识,而不是读取来源激活。应加入无修补、零向量、打乱激活、仅输入与知识错配对照,并测量相对这些基线的增量信息;语言流畅和任务准确都不能单独证明忠实性。

Patchscopes 能证明来源模型在想什么吗?

不能。它揭示的是配置后的目标计算在接收来源激活后能够解码什么,只支持当前设置下的表征假设,不是内部推理的完整说明。若要提出更强结论,还需对相关状态执行因果干预,并在行为层指标和不同数据分布上持续复测。

相关术语