什么是 逆倾向评分(Inverse Propensity Scoring)?

逆倾向评分(Inverse Propensity Scoring)是一种重要性加权估计器:把每个已观测结果乘以 Target Action Probability 与 Logging 或 Assignment Probability 的比值,用于评估目标策略或治疗方案。

快速了解

规范文档官方规范

工作原理

Logging Propensity 是决策时概率

分母必须表示已部署 Logger 使用决策时可见信息,从合格动作集合中分配已记录动作的概率。动作后特征、新策略版本概率,或业务规则覆盖前的模型分数都不等价。应在不可变事件中保存候选资格、所选动作、最终概率、策略版本、上下文版本、奖励窗口和覆盖原因。

Overlap 决定哪些问题可以评估

若 pi(a|x) > 0 而 mu(a|x) = 0,Target Policy 询问的是证据中从未出现的动作。很小但非零的 Propensity 也会产生极端权重和高方差。Counterfactual Risk Minimization说明 Propensity-weighted Objective 如何利用 Logged Bandit Feedback 学习,同时也把方差控制纳入优化问题。

点估计必须配套权重与不确定性诊断

应同时报告普通 IPS、Self-Normalized IPS(SNIPS)、Effective Sample Size、最大及高分位权重、Support Violation 和关键切片结果。SNIPS 往往降低方差,但有限样本下通常有偏;Clipping 同样引入偏差。需要预先声明阈值,按正确依赖单元使用 Bootstrap 或其他方法估计不确定性,并与 Direct Method 或 Doubly Robust 结果比较。

主要特点

  • 使用 Target 与 Logging Action Probability 的比值
  • 只在明确识别假设下校正选择偏差
  • 要求被评估的每个 Target Action 都满足正 Overlap
  • 可能理论无偏却具有不可用的高方差
  • 包含普通 IPS 与 Self-Normalized IPS 变体
  • 依赖不可变的决策时 Propensity 与权重诊断

常见用途

  1. 在线实验前筛选推荐策略
  2. 使用探索流量评估 Contextual Bandit 候选
  3. 从随机分配日志估计治疗方案
  4. 把审核或路由决策重加权到 Target Policy
  5. 审计弱 Overlap 如何改变策略排名

示例

loading...
Loading code...

常见问题

IPS 中的 Propensity 到底是什么?

在策略评估中,它是 Logging Policy 在给定决策时上下文和合格动作后,选择已记录动作的概率。在因果推断中,它通常表示给定 Treatment 前协变量后的治疗概率。这个概率必须对应真实分配机制。

IPS 与 SNIPS 有什么区别?

普通 IPS 用原始记录数除加权奖励和,在假设成立时可以无偏。SNIPS 用观测权重之和作分母,通常能稳定尺度和方差,但一般会引入有限样本偏差。

可以用估计的 Propensity 替代缺失日志概率吗?

只有在更强的建模与因果假设下才可能,而且不确定性必须包含 Propensity Estimation。拟合模型无法重建随机证据,也不能为生产系统从未选择的动作创造正 Overlap;使用 Treatment 后输入还会使估计失效。

应该如何处理极端 IPS 权重?

首先排查候选资格、策略版本和日志缺陷,再报告原始权重分布与 Effective Sample Size。Clipping 或 Stabilization 只能作为已声明并经过敏感性分析的偏差-方差取舍,不能作为静默清理。

稳定的 IPS 结果能证明 Target Policy 可以安全上线吗?

不能。稳定性不能证明 Consistency、无隐藏混杂、奖励归因正确或未来分布稳定。IPS 应用于缩小候选范围,之后仍需带 Guardrail、监控和回滚的受控实验或灰度。

相关术语