什么是 激活引导?

激活引导是在不更新模型权重的前提下,于推理时沿选定方向或子空间修改模型内部激活,以增强、减弱或控制某项可测量行为的干预方法。

快速了解

规范文档官方规范

工作原理

估计与目标行为相关的方向

常见对比法收集匹配的正例与反例激活,再计算两组均值之差。其他方法可以使用线性探针、主方向、稀疏自编码器特征或优化向量。训练提示和评估提示必须分离,并控制词汇与格式线索,才能判断方向学到的是目标属性还是数据集伪影。

在推理时施加内部干预

实现时需要选择模型组件、层、词元位置、调度方式、归一化和系数。Activation Addition展示了不改变权重、直接向 Transformer 激活添加对比向量的方法;Representation Engineering则研究用于监控和控制的群体层表征。层与强度扫描是必要实验,而不是表面调参。

同时评估目标效果与连带变化

先在留出和对抗提示上测量目标行为,再检查任务质量、错误拒绝、事实性、校准、风格泄漏、多语言迁移、延迟和采样交互。还应在同一评价集上与提示词、解码控制和微调比较。引导向量能够暴露或影响某种表征,但不能证明它必要、充分、完全解耦或安全。

主要特点

  • 不更新模型权重,而是在推理时改变内部激活
  • 使用与目标行为相关的方向、特征或子空间
  • 必须明确层、词元位置、调度方式和引导强度
  • 方向可来自对比数据、探针或学习到的特征字典
  • 效果依赖提示和上下文,并可能产生连带能力变化
  • 部署前必须评估行为、质量、稳健性与安全性

常见用途

  1. 检验内部表征能否因果影响某项目标行为
  2. 在受控模型实验中调整风格或行为倾向
  3. 比较推理时控制、提示词和权重微调的效果
  4. 分析目标收益与无关能力变化之间的权衡
  5. 构建表征监控和行为控制的研究原型

示例

loading...
Loading code...

常见问题

激活引导与微调有什么区别?

微调通过优化更新模型参数,会产生新的检查点或适配器;激活引导保持权重不变,只在推理时修改指定内部状态。引导便于快速试验,但会增加运行时干预逻辑,而且跨提示稳定性可能弱于训练后的行为改变,还需额外管理层位、强度和版本契约。

激活引导与激活修补有什么区别?

激活修补通常从一个受控对照运行传入激活,用于检验因果定位;激活引导则把选定方向或子空间应用到许多新输入,以影响行为。前者主要是解释性干预,后者主要是控制性干预,具体实验可以存在交叉,但评价指标和结论范围应分别说明。

怎样构造激活引导向量?

常见方法是在选定层上计算匹配正例与反例的平均激活差,也可使用探针权重、主方向、优化向量或稀疏自编码器特征。必须在留出数据上确认向量捕获的是目标行为,而不是词汇和格式线索,并与随机方向及简单基线比较,复查泛化。

引导向量应该加在哪一层、使用多大强度?

不存在通用正确答案。需要在验证集上扫描层、词元位置、生成步骤和强度,记录激活尺度与干预约定,再综合目标提升和质量、安全副作用选择运行点,不能只选择最强目标分数;模型或提示分布变化后还应重新校准,并保留回退点。

激活引导能保证模型对齐或安全吗?

不能。引导可能在分布变化后失效,被上下文覆盖,或损害无关能力。与安全行为相关的方向也不等于完整因果机制。生产使用仍需要对抗评估、持续监控、访问控制和回退策略,并把引导失效纳入事件响应演练,持续定期复测。

相关术语