什么是 条件平均处理效应?
条件平均处理效应(Conditional Average Treatment Effect,CATE)是在给定 Treatment 前协变量时,Treatment 与 Comparator 下 Potential Outcome 差值的期望,常写作 `tau(x)=E[Y(1)-Y(0)|X=x]`。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
选择 Learner 之前先定义 Conditioning Set
只能使用 Treatment 前可得变量,并声明 Effect Scale、Horizon、Target Population,以及 X 表示科学上的 Modifier 还是部署 Score。对 Mediator、Treatment 后 Engagement 或 Selection Variable 做条件化,可能改变或偏置 Estimand。过细的 X 还会提高方差与 Overlap 要求。
Identification 与 Estimation 是两个层次
Randomized Assignment 能在两组都有支持的区域识别 Conditional Contrast;观察性研究还需要可辩护的 Adjustment Set 与 Conditional Exchangeability。Künzel 等人把 S、T、X-learner 组织为利用 Base Regressor 估计 CATE 的方法。R-learner、DR-learner 与 Causal Forest 提供不同 Bias-Variance Trade-off,但都不能证明识别假设。
不能假装 Counterfactual Label 存在
因为每行缺少一个 Potential Outcome,普通 Per-row Prediction Error 不可用。应在 Randomized Holdout 或有效 Pseudo-outcome 上检查 Grouped-effect Calibration、Best Linear Projection 或 Heterogeneity Test;以 Targeting 为目标时使用 RATE、Qini 等 Ranking Metric,并把 Policy Value 与 Treat-all、Treat-none 比较。同时报告不确定性、Subgroup Support、跨 Fold 稳定性与部署人群 Transport。
主要特点
- 在 Treatment 前协变量上对平均因果 Contrast 做条件化
- 把 Subgroup Effect 推广为可能连续的 Effect Surface
- 只有在人群定义与权重一致时才可平均为 ATE
- 不是单个个体可直接观测的 Treatment Effect
- 需要相关协变量区域内的 Identification 与 Overlap
- 可通过 Meta-learner、Orthogonal Learner 或 Causal Forest 估计
常见用途
- 估计哪些用户分层能从产品 Intervention 中获益
- 比较不同临床 Risk Profile 的 Treatment Benefit
- 为受容量约束的 Intervention Policy 排序候选对象
- 检验 Average Treatment Effect 是否掩盖受害群体
- 为确认性后续实验生成 Subgroup Hypothesis
示例
Loading code...常见问题
CATE 与 ATE 有什么区别?
ATE 对声明的 Target Population 求 Treatment Contrast 平均;CATE 在 `X=x` 或协变量区域内求平均。把同一个 CATE 对同一个目标分布积分可得到 ATE,但改变特征、Population、Scale 或 Weight 后,二者关系也会改变。
预测 CATE 就是 Individual Treatment Effect 吗?
不是。它是共享已测量特征的 Unit 的估计 Conditional Mean Effect。真实的 `Y_i(1),Y_i(0)` Pair 不会被同时观测,因此个体因果 Effect 需要更强结构假设,也不能像普通 Label 一样验证。
哪种 CATE Learner 最好?
不存在统一最优方法。S、T、X、R、DR-learner 与 Causal Forest 在 Treatment Imbalance、Outcome Complexity、Effect 的 Smoothness 或 Sparsity、Overlap 与样本量上表现不同。应预先声明候选方案,并用 Honest Validation 与决策相关指标比较。
观察性数据可以估计 CATE 吗?
可以,但需要定义清晰的 Treatment、Consistency、Conditional Exchangeability、Positivity、有效时序与测量,以及 Estimator 特定条件。灵活 Machine Learning 可以降低函数形式误差,却不能消除 Unmeasured Confounding 或创造无支持比较。
如何验证 CATE Model?
应使用 Held-out 或 Cross-fitted Estimate、Grouped Calibration、Heterogeneity 与 Ranking Test、Policy Value、不确定性区间、Overlap Diagnostic、Fold 与 Seed 稳定性和外部 Transport Check,避免用不存在的个体 Counterfactual Effect 声称 Per-row Accuracy。