什么是 条件平均处理效应?

条件平均处理效应(Conditional Average Treatment Effect,CATE)是在给定 Treatment 前协变量时,Treatment 与 Comparator 下 Potential Outcome 差值的期望,常写作 `tau(x)=E[Y(1)-Y(0)|X=x]`。

快速了解

规范文档官方规范

工作原理

选择 Learner 之前先定义 Conditioning Set

只能使用 Treatment 前可得变量,并声明 Effect Scale、Horizon、Target Population,以及 X 表示科学上的 Modifier 还是部署 Score。对 Mediator、Treatment 后 Engagement 或 Selection Variable 做条件化,可能改变或偏置 Estimand。过细的 X 还会提高方差与 Overlap 要求。

Identification 与 Estimation 是两个层次

Randomized Assignment 能在两组都有支持的区域识别 Conditional Contrast;观察性研究还需要可辩护的 Adjustment Set 与 Conditional Exchangeability。Künzel 等人把 S、T、X-learner 组织为利用 Base Regressor 估计 CATE 的方法。R-learner、DR-learner 与 Causal Forest 提供不同 Bias-Variance Trade-off,但都不能证明识别假设。

不能假装 Counterfactual Label 存在

因为每行缺少一个 Potential Outcome,普通 Per-row Prediction Error 不可用。应在 Randomized Holdout 或有效 Pseudo-outcome 上检查 Grouped-effect Calibration、Best Linear Projection 或 Heterogeneity Test;以 Targeting 为目标时使用 RATE、Qini 等 Ranking Metric,并把 Policy Value 与 Treat-all、Treat-none 比较。同时报告不确定性、Subgroup Support、跨 Fold 稳定性与部署人群 Transport。

主要特点

  • 在 Treatment 前协变量上对平均因果 Contrast 做条件化
  • 把 Subgroup Effect 推广为可能连续的 Effect Surface
  • 只有在人群定义与权重一致时才可平均为 ATE
  • 不是单个个体可直接观测的 Treatment Effect
  • 需要相关协变量区域内的 Identification 与 Overlap
  • 可通过 Meta-learner、Orthogonal Learner 或 Causal Forest 估计

常见用途

  1. 估计哪些用户分层能从产品 Intervention 中获益
  2. 比较不同临床 Risk Profile 的 Treatment Benefit
  3. 为受容量约束的 Intervention Policy 排序候选对象
  4. 检验 Average Treatment Effect 是否掩盖受害群体
  5. 为确认性后续实验生成 Subgroup Hypothesis

示例

loading...
Loading code...

常见问题

CATE 与 ATE 有什么区别?

ATE 对声明的 Target Population 求 Treatment Contrast 平均;CATE 在 `X=x` 或协变量区域内求平均。把同一个 CATE 对同一个目标分布积分可得到 ATE,但改变特征、Population、Scale 或 Weight 后,二者关系也会改变。

预测 CATE 就是 Individual Treatment Effect 吗?

不是。它是共享已测量特征的 Unit 的估计 Conditional Mean Effect。真实的 `Y_i(1),Y_i(0)` Pair 不会被同时观测,因此个体因果 Effect 需要更强结构假设,也不能像普通 Label 一样验证。

哪种 CATE Learner 最好?

不存在统一最优方法。S、T、X、R、DR-learner 与 Causal Forest 在 Treatment Imbalance、Outcome Complexity、Effect 的 Smoothness 或 Sparsity、Overlap 与样本量上表现不同。应预先声明候选方案,并用 Honest Validation 与决策相关指标比较。

观察性数据可以估计 CATE 吗?

可以,但需要定义清晰的 Treatment、Consistency、Conditional Exchangeability、Positivity、有效时序与测量,以及 Estimator 特定条件。灵活 Machine Learning 可以降低函数形式误差,却不能消除 Unmeasured Confounding 或创造无支持比较。

如何验证 CATE Model?

应使用 Held-out 或 Cross-fitted Estimate、Grouped Calibration、Heterogeneity 与 Ranking Test、Policy Value、不确定性区间、Overlap Diagnostic、Fold 与 Seed 稳定性和外部 Transport Check,避免用不存在的个体 Counterfactual Effect 声称 Per-row Accuracy。

相关术语