什么是 离策略评估(Off-Policy Evaluation)?

离策略评估(Off-Policy Evaluation)是在不先部署目标策略的情况下,使用另一条 Behavior Policy 或 Logging Policy 采集的历史结果,估计 Target Policy 期望价值的方法。

快速了解

规范文档官方规范

工作原理

识别首先依赖 Consistency 与 Overlap

日志奖励必须对应记录的动作和稳定的 Outcome Definition,Logging Propensity 必须真实描述该动作如何从合格集合中被选出。Target Policy 在相关上下文中可能选择的每个动作都需要正的日志概率。隐藏覆盖、候选缺失、Interference、未记录混杂和决策后特征都会在选择估计器之前破坏结论。

估计器选择是 Bias-Variance 决策

在 Propensity 正确且 Support 成立时,IPS 可以无偏但方差可能极高;Direct Method 能向少见动作泛化,却继承 Reward Model Bias。Dudik、Langford 与 Li把 Doubly Robust Estimation 引入上下文策略评估:在其他假设成立时,只要奖励模型或倾向模型之一正确,修正项就能保持无偏。Weight Clipping、Self-normalization 与模型复用都会改变有限样本行为,必须披露。

先评估估计器,再相信策略排名

最终测试前应冻结 Target Policy;Nuisance Model 可能过拟合时采用 Cross-fitting;同时报告置信区间、Effective Sample Size、最大和尾部 Weight、Support Violation 及关键切片结果。生产使用前要通过模拟或随机 Ground Truth 比较估计器。Open Bandit Dataset and Pipeline用于提高真实日志评测的可复现性;一个基准上的优势仍不能证明新部署分布可靠。

主要特点

  • 使用 Behavior Policy 的结果评估另一条策略
  • 依赖决策时上下文、动作、奖励和 Logging Propensity
  • 要求 Consistency、Support 与正确时序假设
  • 包含 Direct Method、IPS、SNIPS 与 Doubly Robust
  • 在 Reward Model Bias 与 Importance Weight Variance 之间取舍
  • 必须报告不确定性与权重诊断,而非只有点估计

常见用途

  1. 在线实验前筛选推荐策略
  2. 使用随机流量日志比较上下文老虎机策略
  3. 离线估计路由策略的质量与成本取舍
  4. 在探索概率已记录时审计治疗策略
  5. 为受控灰度发布选择风险更低的候选方案

示例

loading...
Loading code...

常见问题

离策略评估需要记录哪些数据?

Contextual Bandit 记录通常需要决策时上下文、合格动作集、所选动作、Logging Policy 下的动作概率、观测奖励与归因窗口,以及策略和特征版本。序贯强化学习 OPE 还需要有序 Transition、终止状态和 Horizon 语义。

离策略评估为什么需要 Overlap?

日志只能识别 Logging Policy 曾经有机会选择的动作结果。若 Target Policy 在某个上下文选择的动作日志概率为零,没有任何 Importance Weight 或 Reward Correction 能在不增加建模假设的情况下重建缺失证据。

Doubly Robust 为什么叫双重稳健?

在完整识别条件下,只要奖励模型或倾向模型其中之一正确,估计器就可以保持一致,而不是要求两个 Nuisance Model 都正确。它无法抵御 Support Violation、错误结果时序、依赖,或两个模型同时错设。

确定性 Logging Policy 能支持 OPE 吗?

它通常只能支持自身已经覆盖的目标决策,除非可信的结构假设或外部随机数据提供额外识别。事后估计一个 Propensity,并不能为日志系统从未选择的动作创造 Overlap。

离策略评估可以替代线上 A/B 测试吗?

通常应把它用于筛选和降低候选风险,而不是无条件替代。OPE 对 Overlap、模型误差、日志缺陷和分布偏移都很敏感。高影响变更仍应经过带安全门禁和回滚能力的受控灰度或实验。

相关术语

相关文章