什么是 激活引导?
激活引导是在不更新模型权重的前提下,于推理时沿选定方向或子空间修改模型内部激活,以增强、减弱或控制某项可测量行为的干预方法。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
估计与目标行为相关的方向
常见对比法收集匹配的正例与反例激活,再计算两组均值之差。其他方法可以使用线性探针、主方向、稀疏自编码器特征或优化向量。训练提示和评估提示必须分离,并控制词汇与格式线索,才能判断方向学到的是目标属性还是数据集伪影。
在推理时施加内部干预
实现时需要选择模型组件、层、词元位置、调度方式、归一化和系数。Activation Addition展示了不改变权重、直接向 Transformer 激活添加对比向量的方法;Representation Engineering则研究用于监控和控制的群体层表征。层与强度扫描是必要实验,而不是表面调参。
同时评估目标效果与连带变化
先在留出和对抗提示上测量目标行为,再检查任务质量、错误拒绝、事实性、校准、风格泄漏、多语言迁移、延迟和采样交互。还应在同一评价集上与提示词、解码控制和微调比较。引导向量能够暴露或影响某种表征,但不能证明它必要、充分、完全解耦或安全。
主要特点
- 不更新模型权重,而是在推理时改变内部激活
- 使用与目标行为相关的方向、特征或子空间
- 必须明确层、词元位置、调度方式和引导强度
- 方向可来自对比数据、探针或学习到的特征字典
- 效果依赖提示和上下文,并可能产生连带能力变化
- 部署前必须评估行为、质量、稳健性与安全性
常见用途
- 检验内部表征能否因果影响某项目标行为
- 在受控模型实验中调整风格或行为倾向
- 比较推理时控制、提示词和权重微调的效果
- 分析目标收益与无关能力变化之间的权衡
- 构建表征监控和行为控制的研究原型
示例
Loading code...常见问题
激活引导与微调有什么区别?
微调通过优化更新模型参数,会产生新的检查点或适配器;激活引导保持权重不变,只在推理时修改指定内部状态。引导便于快速试验,但会增加运行时干预逻辑,而且跨提示稳定性可能弱于训练后的行为改变,还需额外管理层位、强度和版本契约。
激活引导与激活修补有什么区别?
激活修补通常从一个受控对照运行传入激活,用于检验因果定位;激活引导则把选定方向或子空间应用到许多新输入,以影响行为。前者主要是解释性干预,后者主要是控制性干预,具体实验可以存在交叉,但评价指标和结论范围应分别说明。
怎样构造激活引导向量?
常见方法是在选定层上计算匹配正例与反例的平均激活差,也可使用探针权重、主方向、优化向量或稀疏自编码器特征。必须在留出数据上确认向量捕获的是目标行为,而不是词汇和格式线索,并与随机方向及简单基线比较,复查泛化。
引导向量应该加在哪一层、使用多大强度?
不存在通用正确答案。需要在验证集上扫描层、词元位置、生成步骤和强度,记录激活尺度与干预约定,再综合目标提升和质量、安全副作用选择运行点,不能只选择最强目标分数;模型或提示分布变化后还应重新校准,并保留回退点。
激活引导能保证模型对齐或安全吗?
不能。引导可能在分布变化后失效,被上下文覆盖,或损害无关能力。与安全行为相关的方向也不等于完整因果机制。生产使用仍需要对抗评估、持续监控、访问控制和回退策略,并把引导失效纳入事件响应演练,持续定期复测。