什么是 线性探针(Linear Probing)?
线性探针(Linear Probing)是一种表征分析方法:冻结来源模型,以其内部激活为特征训练线性分类器或回归器,并在明确的数据、特征、优化与评价协议下测量指定信息是否可以被线性解码。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
定义表征与线性读出器
需要明确模型检查点、组件、层、词元位置、池化规则、预处理、目标标签和线性模型。来源模型保持冻结,只训练读出器。线性分类器检验类别能否被超平面分开,线性回归器检验连续目标能否由加权和预测。特征标准化、截距、正则化与类别权重都是实验协议的一部分。
设计切分、基线与控制任务
切分应以可能泄漏的真实单元为边界,例如文档、模板、说话人、受试者或序列,而不是随机拆分高度相关的行。按需要与多数类、仅元数据、原始输入、随机特征和未训练模型基线比较。Hewitt 与 Liang提出控制任务和选择性,用于区分有用语言结构与探针记忆任意标签的能力。
把结论限制在证据范围内
留出集性能只能证明目标在某个分布和协议下可解码,不能证明该表征必要、充分、唯一定位或被模型下游计算实际使用。还应检查置信区间、随机种子、正则化扫描、样本效率曲线和分布外分组。若要声称因果使用,需要追加激活修补、消融或引导等受控干预,并测量任务行为。
主要特点
- 把冻结模型的内部激活作为受约束线性读出器的特征
- 必须明确层、词元位置、池化、标签与正则化选择
- 依赖能够抵抗泄漏的训练、验证和测试切分
- 需要简单基线、控制任务和不确定性估计
- 测量线性可解码性,而不是唯一表征或模型实际使用
- 可比较不同层、检查点、数据集与训练阶段
常见用途
- 比较任务相关信息从哪一层开始可以被线性解码
- 监控预训练或微调过程中内部表征的变化
- 检查嵌入是否暴露人口属性、风格或领域信息
- 为成本更高的因果干预筛选候选层与组件
- 审计探针结果能否经受分组切分与控制任务检验
示例
Loading code...常见问题
线性探针成功究竟证明了什么?
它证明在指定模型、激活位置、线性读出器和评价分布下,目标可以从所选激活中被解码。它不证明信息只存在于该位置,也不证明模型生成输出时实际使用了这项信息,更不能单独证明该表征导致了目标行为;结论必须附带协议和适用范围。
为什么线性探针必须按组切分数据?
同一文档、模板、人物或序列产生的激活往往高度相关。随机按行切分可能把近重复样本放到训练集和测试集两侧,形成泄漏并虚高准确率。按真实泄漏单元分组,才能更可信地估计模型对未见实体、表达方式或上下文的泛化能力。
控制任务与探针选择性是什么?
控制任务在保留干扰结构的同时分配任意标签,用来检查探针是否凭容量记住训练样本,而不是恢复目标属性。选择性通常比较真实任务与控制任务的表现差。它能提供关于探针容量的重要证据,但不能替代分组切分、基线、置信区间和干预验证。
所有层的线性探针都应使用同一正则化吗?
不应机械固定,也不能在测试集上挑选。应仅用验证集调节正则化,公开搜索范围、最终取值、样本量和种子波动;比较不同层时保持等价的调参预算。若结论只在某个极端参数下出现,就可能反映优化或容量选择,而不是稳定表征。
怎样让线性探针结果支持因果结论?
先用探针定位候选表征,再在合适对照下直接改变该表征并测量任务行为。激活修补、消融或激活引导可以检验改变候选信号是否改变输出;即便干预有效,也要预先定义评价指标、替代路径以及必要性或充分性的判定标准,避免过度归因。