什么是 因果森林?

因果森林(Causal Forest)是一类基于 Forest 的 Estimator,通过构建自适应协变量邻域估计 Conditional Average Treatment Effect,其分裂与推断围绕 Treatment-effect Variation,而不是只优化 Outcome Prediction。

快速了解

规范文档官方规范

工作原理

Tree 学习自适应 Treatment-effect Neighborhood

每棵 Tree 使用与目标量异质性相关的准则递归切分 Covariate Space。经过大量 Subsampled Tree 后,与 Query Point 反复落入同一 Leaf 的记录会获得更高 Forest Weight;最终 CATE 来自这些加权邻居上的 Local Estimating Equation。GRF Algorithm Reference详细说明了这种 Adaptive Nearest-neighbor 视角与 Treatment-specific Split。

Honesty 与 Orthogonalization 处理不同偏差

Honesty 使用不同 Observation 选择 Split 和填充 Leaf,从而降低 Adaptive Estimation Bias,但会牺牲数据效率。现代实现还可利用 Out-of-bag Nuisance Prediction 对 Outcome 与 Treatment 做 Residualization,采用类似 R-learner 的 Orthogonalization,降低对 First-stage Error 的敏感性。两者都不能修复 Unmeasured Confounding、弱 Overlap 或定义不清的 Intervention。

把 Forest 当作 Effect Model 验证

Outcome RMSE 与 Feature Importance 不能证明 CATE 准确。应使用 Out-of-bag 或 Held-out Grouped Calibration、Best Linear Projection、Heterogeneity 或 Rank-weighted Test、Policy-value Evaluation、Variance Estimate,并检查不同 Seed 与 Tuning 的稳定性。还要审计 Local Neighborhood 内的 Treatment Count、无支持预测、Cluster 或 Time Dependence,以及发现的异质性是否可 Transport。

主要特点

  • 直接针对 Conditional Average Treatment Effect 而非只预测 Outcome
  • 利用 Ensemble 构造自适应 Local Covariate Neighborhood
  • 可通过 Honesty 分离 Split Selection 与 Effect Estimation
  • 常利用 Nuisance Prediction 对 Treatment 与 Outcome 做 Orthogonalization
  • 在特定条件下支持 Out-of-bag Effect 与统计推断
  • 仍依赖 Causal Identification、Overlap 与 Transportability

常见用途

  1. 在实验中探索高维 Treatment-effect Heterogeneity
  2. 无需预设所有 Interaction 即估计 CATE
  3. 为容量受限的 Treatment Policy 排序 Unit
  4. 检验 Baseline Feature 是否预测增量产品影响
  5. 为新确认性实验生成可解释 Subgroup Hypothesis

示例

loading...
Loading code...

常见问题

Causal Forest 与 Random Forest 有什么区别?

Random Forest 通常最小化 Outcome Prediction Error;Causal Forest 针对 Local Treatment Contrast,使用 Treatment-aware Split 与 Estimating Equation,并可能对 Nuisance Component 做 Orthogonalization。把 Treatment 当普通特征输入预测器再做两次预测差值,是另一类 Estimator。

Causal Forest 中的 Honesty 是什么?

Honesty 指选择 Tree Partition 的 Observation 与估计 Leaf Effect 的 Observation 相互分离。它能降低 Adaptive Bias,并在明确条件下支持推断,但会减少每项任务可用的有效数据,在很小样本中可能损害表现。

Causal Forest 会估计 Individual Treatment Effect 吗?

它在 Feature Vector 上估计 CATE,也就是 Learned Local Population 的平均值。单个 Unit 的两个真实 Potential Outcome 仍不可同时观测。把输出称为精确个体 Effect,会混淆 Personalized Prediction 与可识别的 Person-level Truth。

观察性数据可以使用 Causal Forest 吗?

可以,但前提是 Treatment、Outcome、Timing、Adjustment Set、Conditional Exchangeability、Positivity 与依赖假设可信。Propensity 与 Outcome Nuisance Model 可以改善估计,但 Forest 本身无法诊断或消除 Hidden Confounding。

如何评价 Causal Forest Prediction?

应检查 Out-of-bag 或 Held-out Grouped Effect、Calibration 与 Heterogeneity Test、Rank-weighted Effect 或 Policy Value、Confidence Interval、Overlap Diagnostic,以及跨 Seed 与 Tuning 的稳定性。普通 Outcome Accuracy 与漂亮的 Subgroup Plot 并不充分。

相关术语