什么是 动态处理方案?

动态处理方案是一组预先规定的序贯决策规则,它在每个决策时点把当时可获得的信息映射为处理动作,使后续动作能够随个体反应和历史变化而调整。

快速了解

规范文档官方规范

工作原理

每个阶段都需要可观测的裁剪规则

一套方案可以让所有合格对象先接受初始选择,对无反应者强化处理,并在出现毒性时降级。每个裁剪变量都必须在对应动作前可用,不能包含未来反应。规则还应定义缺失测量、并列结果、禁忌、延迟观测,以及开发数据中罕见或从未出现的历史如何处理。

估计的是整套方案的价值

序贯多重分配随机试验会在多个阶段随机化处理,并可嵌入多套 DTR。观察性数据则依赖一致性、序贯可交换性、正值性和有效时间顺序,并可采用 G 计算、逆概率加权、边际结构模型、Q-learning 或双重稳健价值估计。Chakraborty 与 Murphy系统综述了 DTR 的设计与分析。

部署检查必须超越离线价值

应使用诚实的不确定性估计,把学习或预设方案与当前实践及简单静态策略比较,并逐阶段检查动作支持度、亚组安全、删失、依从性、测量延迟和干扰模型敏感性。当建议会影响真实用户时,还需要前瞻验证、人工覆盖、决策日志、漂移监控和回滚标准。

主要特点

  • 定义一组依赖历史的序贯处理规则
  • 每次决策只使用动作前已获得的信息
  • 目标是整套自适应策略的价值
  • 可预先规定,也可在受限策略类中学习
  • 要求逐阶段满足可交换性与动作支持度
  • 必须处理缺失、延迟和不安全状态

常见用途

  1. 在毒性约束下为无反应患者强化治疗
  2. 根据学习者掌握程度动态调整教学支持
  3. 使用近期活跃历史选择用户留存干预
  4. 在序贯随机试验中比较嵌入的自适应策略
  5. 为纵向观察数据定义依从方案处理策略

示例

loading...
Loading code...

常见问题

动态处理方案与普通治疗计划有什么区别?

普通计划可能只描述大致顺序,把适应性调整留给临场判断。DTR 定义可执行规则,包括合格人群、决策时点、可观测裁剪变量、可选动作,以及对每种受支持历史应选择的动作。

动态处理方案与单阶段策略学习有什么区别?

单阶段策略学习把基线情境映射为一次动作。DTR 包含多条规则,因为早期动作会改变后续历史与选择;其价值取决于完整序列、逐阶段支持度、依从性、删失及每个裁剪变量的时间位置。

动态处理方案等同于强化学习吗?

不等同。DTR 研究可以使用 Q-learning 等思想,但通常从固定实验或观察数据中估计有限且受约束的动作序列,部署时不在线探索。强化学习更广泛地处理交互式状态转移、长时域以及探索与利用权衡。

可以从观察性数据估计动态处理方案吗?

可以,但方案必须定义清楚,并且一致性、序贯可交换性、正值性、时间、测量和删失假设可信。G 方法与双重稳健估计器能够估计方案价值,却不能恢复数据中从未出现的动作或历史。

如何验证动态处理方案?

应使用留出数据或适当交叉拟合的价值估计与不确定性,比较静态策略和当前实践,检查逐阶段重叠与亚组安全,压力测试缺失或延迟观测,并通过人工覆盖和回滚控制开展前瞻评估。

相关术语