什么是 离策略评估(Off-Policy Evaluation)?
离策略评估(Off-Policy Evaluation)是在不先部署目标策略的情况下,使用另一条 Behavior Policy 或 Logging Policy 采集的历史结果,估计 Target Policy 期望价值的方法。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
识别首先依赖 Consistency 与 Overlap
日志奖励必须对应记录的动作和稳定的 Outcome Definition,Logging Propensity 必须真实描述该动作如何从合格集合中被选出。Target Policy 在相关上下文中可能选择的每个动作都需要正的日志概率。隐藏覆盖、候选缺失、Interference、未记录混杂和决策后特征都会在选择估计器之前破坏结论。
估计器选择是 Bias-Variance 决策
在 Propensity 正确且 Support 成立时,IPS 可以无偏但方差可能极高;Direct Method 能向少见动作泛化,却继承 Reward Model Bias。Dudik、Langford 与 Li把 Doubly Robust Estimation 引入上下文策略评估:在其他假设成立时,只要奖励模型或倾向模型之一正确,修正项就能保持无偏。Weight Clipping、Self-normalization 与模型复用都会改变有限样本行为,必须披露。
先评估估计器,再相信策略排名
最终测试前应冻结 Target Policy;Nuisance Model 可能过拟合时采用 Cross-fitting;同时报告置信区间、Effective Sample Size、最大和尾部 Weight、Support Violation 及关键切片结果。生产使用前要通过模拟或随机 Ground Truth 比较估计器。Open Bandit Dataset and Pipeline用于提高真实日志评测的可复现性;一个基准上的优势仍不能证明新部署分布可靠。
主要特点
- 使用 Behavior Policy 的结果评估另一条策略
- 依赖决策时上下文、动作、奖励和 Logging Propensity
- 要求 Consistency、Support 与正确时序假设
- 包含 Direct Method、IPS、SNIPS 与 Doubly Robust
- 在 Reward Model Bias 与 Importance Weight Variance 之间取舍
- 必须报告不确定性与权重诊断,而非只有点估计
常见用途
- 在线实验前筛选推荐策略
- 使用随机流量日志比较上下文老虎机策略
- 离线估计路由策略的质量与成本取舍
- 在探索概率已记录时审计治疗策略
- 为受控灰度发布选择风险更低的候选方案
示例
Loading code...常见问题
离策略评估需要记录哪些数据?
Contextual Bandit 记录通常需要决策时上下文、合格动作集、所选动作、Logging Policy 下的动作概率、观测奖励与归因窗口,以及策略和特征版本。序贯强化学习 OPE 还需要有序 Transition、终止状态和 Horizon 语义。
离策略评估为什么需要 Overlap?
日志只能识别 Logging Policy 曾经有机会选择的动作结果。若 Target Policy 在某个上下文选择的动作日志概率为零,没有任何 Importance Weight 或 Reward Correction 能在不增加建模假设的情况下重建缺失证据。
Doubly Robust 为什么叫双重稳健?
在完整识别条件下,只要奖励模型或倾向模型其中之一正确,估计器就可以保持一致,而不是要求两个 Nuisance Model 都正确。它无法抵御 Support Violation、错误结果时序、依赖,或两个模型同时错设。
确定性 Logging Policy 能支持 OPE 吗?
它通常只能支持自身已经覆盖的目标决策,除非可信的结构假设或外部随机数据提供额外识别。事后估计一个 Propensity,并不能为日志系统从未选择的动作创造 Overlap。
离策略评估可以替代线上 A/B 测试吗?
通常应把它用于筛选和降低候选风险,而不是无条件替代。OPE 对 Overlap、模型误差、日志缺陷和分布偏移都很敏感。高影响变更仍应经过带安全门禁和回滚能力的受控灰度或实验。