什么是 策略学习?

策略学习是估计一条从处理前上下文映射到行动的规则,以最大化可识别的期望回报或福利目标,并可同时满足容量、成本、风险或公平约束。

快速了解

规范文档官方规范

工作原理

优化决策目标,而不是预测准确率

目标通常是 V(pi)=E[Y(pi(X))],或扣除行动成本后的净福利,而不是 CATE 均方误差。把策略限制为浅层树、评分阈值或预算规则,可提升可解释性与统计可靠性。Athey 与 Wager 系统研究了观测数据中的策略学习、双重稳健评分、约束与遗憾保证。

诚实价值估计需要分离策略选择与评估

结果模型与倾向模型可构造逆倾向或双重稳健的候选策略价值。交叉拟合降低干扰估计过拟合,独立留出集或有效的策略学习程序则避免在同一份噪声上选择并汇报策略。必须与全不处理、全处理、当前规则和简单规则比较,并报告不确定性,而不是只展示最高点估计。

运营约束属于策略问题本身

预算、人员、处理成本、安全排除、最低收益、公平约束与行动可用性都会改变最优规则。上线前需验证学习策略所选行动的重叠,审查不受支持的群体;上线后监控行动率、实际结果、漂移和约束违规。较高的离线价值估计不等于可以无限制自动决策。

主要特点

  • 把处理前上下文映射为行动,而不只预测结果
  • 在声明的策略类中优化期望策略价值或净福利
  • 可纳入预算、成本、安全与公平约束
  • 常用倾向与结果模型估计离线策略价值
  • 需要与简单运营基线做诚实比较
  • 把因果估计连接到可部署的决策规则

常见用途

  1. 把有限留存优惠分配给净收益为正的用户
  2. 在人力与安全约束下选择患者触达对象
  3. 限制通知总量的同时选择产品干预
  4. 比较学习策略与全处理、全不处理及当前规则
  5. 构建可供人工审核的可解释处理树

示例

loading...
Loading code...

常见问题

策略学习与 CATE 估计有什么区别?

CATE 估计描述条件处理对比如何变化;策略学习则在约束内选择行动以最大化价值函数。准确的效应估计可以支持策略,但预测最好的模型未必产生最好的决策规则,尤其是在存在成本、预算或不对称伤害时。

策略学习与强化学习相同吗?

不同。因果策略学习经常研究一次性的离线处理决策,没有连续状态动力学或在线探索;强化学习通常从交互数据中优化行动序列。二者在价值、重叠与评估方法上有交集,但必须分别声明假设与目标估计量。

能否从观测数据中学习处理策略?

可以,但要求处理版本、结果、时间顺序、条件可交换性、正值性与依赖假设可信。倾向与结果模型可支持双重稳健价值估计,但任何策略算法都不能消除隐藏混杂,也不能为历史中几乎未采取的行动创造支持。

策略学习应如何处理预算约束?

应把预算或行动率限制纳入优化,或在验证数据上选择满足限制的阈值。评估时需使用真实运行约束下的净价值并计入处理成本,还要检查在不确定性与人群漂移下是否继续满足容量和公平要求。

学习策略上线前应如何评估?

使用留出或交叉拟合的策略价值与不确定性,并与全不处理、全处理、当前规则和简单规则比较;同时审查重叠与分组行为,条件允许时进行前瞻性验证。上线后还需设置护栏、结果监控、漂移检查与回滚标准。

相关术语