什么是 因果森林?
因果森林(Causal Forest)是一类基于 Forest 的 Estimator,通过构建自适应协变量邻域估计 Conditional Average Treatment Effect,其分裂与推断围绕 Treatment-effect Variation,而不是只优化 Outcome Prediction。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
Tree 学习自适应 Treatment-effect Neighborhood
每棵 Tree 使用与目标量异质性相关的准则递归切分 Covariate Space。经过大量 Subsampled Tree 后,与 Query Point 反复落入同一 Leaf 的记录会获得更高 Forest Weight;最终 CATE 来自这些加权邻居上的 Local Estimating Equation。GRF Algorithm Reference详细说明了这种 Adaptive Nearest-neighbor 视角与 Treatment-specific Split。
Honesty 与 Orthogonalization 处理不同偏差
Honesty 使用不同 Observation 选择 Split 和填充 Leaf,从而降低 Adaptive Estimation Bias,但会牺牲数据效率。现代实现还可利用 Out-of-bag Nuisance Prediction 对 Outcome 与 Treatment 做 Residualization,采用类似 R-learner 的 Orthogonalization,降低对 First-stage Error 的敏感性。两者都不能修复 Unmeasured Confounding、弱 Overlap 或定义不清的 Intervention。
把 Forest 当作 Effect Model 验证
Outcome RMSE 与 Feature Importance 不能证明 CATE 准确。应使用 Out-of-bag 或 Held-out Grouped Calibration、Best Linear Projection、Heterogeneity 或 Rank-weighted Test、Policy-value Evaluation、Variance Estimate,并检查不同 Seed 与 Tuning 的稳定性。还要审计 Local Neighborhood 内的 Treatment Count、无支持预测、Cluster 或 Time Dependence,以及发现的异质性是否可 Transport。
主要特点
- 直接针对 Conditional Average Treatment Effect 而非只预测 Outcome
- 利用 Ensemble 构造自适应 Local Covariate Neighborhood
- 可通过 Honesty 分离 Split Selection 与 Effect Estimation
- 常利用 Nuisance Prediction 对 Treatment 与 Outcome 做 Orthogonalization
- 在特定条件下支持 Out-of-bag Effect 与统计推断
- 仍依赖 Causal Identification、Overlap 与 Transportability
常见用途
- 在实验中探索高维 Treatment-effect Heterogeneity
- 无需预设所有 Interaction 即估计 CATE
- 为容量受限的 Treatment Policy 排序 Unit
- 检验 Baseline Feature 是否预测增量产品影响
- 为新确认性实验生成可解释 Subgroup Hypothesis
示例
Loading code...常见问题
Causal Forest 与 Random Forest 有什么区别?
Random Forest 通常最小化 Outcome Prediction Error;Causal Forest 针对 Local Treatment Contrast,使用 Treatment-aware Split 与 Estimating Equation,并可能对 Nuisance Component 做 Orthogonalization。把 Treatment 当普通特征输入预测器再做两次预测差值,是另一类 Estimator。
Causal Forest 中的 Honesty 是什么?
Honesty 指选择 Tree Partition 的 Observation 与估计 Leaf Effect 的 Observation 相互分离。它能降低 Adaptive Bias,并在明确条件下支持推断,但会减少每项任务可用的有效数据,在很小样本中可能损害表现。
Causal Forest 会估计 Individual Treatment Effect 吗?
它在 Feature Vector 上估计 CATE,也就是 Learned Local Population 的平均值。单个 Unit 的两个真实 Potential Outcome 仍不可同时观测。把输出称为精确个体 Effect,会混淆 Personalized Prediction 与可识别的 Person-level Truth。
观察性数据可以使用 Causal Forest 吗?
可以,但前提是 Treatment、Outcome、Timing、Adjustment Set、Conditional Exchangeability、Positivity 与依赖假设可信。Propensity 与 Outcome Nuisance Model 可以改善估计,但 Forest 本身无法诊断或消除 Hidden Confounding。
如何评价 Causal Forest Prediction?
应检查 Out-of-bag 或 Held-out Grouped Effect、Calibration 与 Heterogeneity Test、Rank-weighted Effect 或 Policy Value、Confidence Interval、Overlap Diagnostic,以及跨 Seed 与 Tuning 的稳定性。普通 Outcome Accuracy 与漂亮的 Subgroup Plot 并不充分。