什么是 逆倾向评分(Inverse Propensity Scoring)?
逆倾向评分(Inverse Propensity Scoring)是一种重要性加权估计器:把每个已观测结果乘以 Target Action Probability 与 Logging 或 Assignment Probability 的比值,用于评估目标策略或治疗方案。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
Logging Propensity 是决策时概率
分母必须表示已部署 Logger 使用决策时可见信息,从合格动作集合中分配已记录动作的概率。动作后特征、新策略版本概率,或业务规则覆盖前的模型分数都不等价。应在不可变事件中保存候选资格、所选动作、最终概率、策略版本、上下文版本、奖励窗口和覆盖原因。
Overlap 决定哪些问题可以评估
若 pi(a|x) > 0 而 mu(a|x) = 0,Target Policy 询问的是证据中从未出现的动作。很小但非零的 Propensity 也会产生极端权重和高方差。Counterfactual Risk Minimization说明 Propensity-weighted Objective 如何利用 Logged Bandit Feedback 学习,同时也把方差控制纳入优化问题。
点估计必须配套权重与不确定性诊断
应同时报告普通 IPS、Self-Normalized IPS(SNIPS)、Effective Sample Size、最大及高分位权重、Support Violation 和关键切片结果。SNIPS 往往降低方差,但有限样本下通常有偏;Clipping 同样引入偏差。需要预先声明阈值,按正确依赖单元使用 Bootstrap 或其他方法估计不确定性,并与 Direct Method 或 Doubly Robust 结果比较。
主要特点
- 使用 Target 与 Logging Action Probability 的比值
- 只在明确识别假设下校正选择偏差
- 要求被评估的每个 Target Action 都满足正 Overlap
- 可能理论无偏却具有不可用的高方差
- 包含普通 IPS 与 Self-Normalized IPS 变体
- 依赖不可变的决策时 Propensity 与权重诊断
常见用途
- 在线实验前筛选推荐策略
- 使用探索流量评估 Contextual Bandit 候选
- 从随机分配日志估计治疗方案
- 把审核或路由决策重加权到 Target Policy
- 审计弱 Overlap 如何改变策略排名
示例
Loading code...常见问题
IPS 中的 Propensity 到底是什么?
在策略评估中,它是 Logging Policy 在给定决策时上下文和合格动作后,选择已记录动作的概率。在因果推断中,它通常表示给定 Treatment 前协变量后的治疗概率。这个概率必须对应真实分配机制。
IPS 与 SNIPS 有什么区别?
普通 IPS 用原始记录数除加权奖励和,在假设成立时可以无偏。SNIPS 用观测权重之和作分母,通常能稳定尺度和方差,但一般会引入有限样本偏差。
可以用估计的 Propensity 替代缺失日志概率吗?
只有在更强的建模与因果假设下才可能,而且不确定性必须包含 Propensity Estimation。拟合模型无法重建随机证据,也不能为生产系统从未选择的动作创造正 Overlap;使用 Treatment 后输入还会使估计失效。
应该如何处理极端 IPS 权重?
首先排查候选资格、策略版本和日志缺陷,再报告原始权重分布与 Effective Sample Size。Clipping 或 Stabilization 只能作为已声明并经过敏感性分析的偏差-方差取舍,不能作为静默清理。
稳定的 IPS 结果能证明 Target Policy 可以安全上线吗?
不能。稳定性不能证明 Consistency、无隐藏混杂、奖励归因正确或未来分布稳定。IPS 应用于缩小候选范围,之后仍需带 Guardrail、监控和回滚的受控实验或灰度。