什么是 G 计算(G-computation)?
G 计算(G-computation)是一种因果标准化方法:为目标人群中的每个单位预测各项干预下的结果,再按同一个目标协变量分布平均这些预测,从而估计干预特异的平均结果与效应。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
把所有干预标准化到同一个人群
对每个目标单位固定基线协变量,分别生成所有处理策略下的预测;再用完全相同的目标权重平均每一列,才能得到可比较的干预均值。如果一项处理使用已处理人群,另一项使用未处理人群,就会重新引入人群构成差异,而不是估计共同人群上的因果对比。
结果模型误差与正值性是两类不同风险
灵活回归可以降低模型设定错误,但稀疏的处理-协变量组合会迫使模型外推。应检查重叠与反事实预测范围,纳入适合结果的交互或 Learner,在推断程序允许时 Cross-fit,并与加权或 Doubly Robust 结果比较。Snowden 等人的实践指南给出了清晰实施步骤。
纵向 G 公式处理不断演化的历史
当处理和混杂随时间变化,且既往处理又影响后续混杂时,普通协变量调整可能阻断因果路径或引入偏差。参数化 G 公式会建模连续的数据生成过程,并在持续或动态策略下模拟协变量与结果轨迹;它同时增加模型、删失、支持度和 Monte Carlo 要求,必须用观测数据诊断验证。
主要特点
- 通过标准化估计每项干预下的平均结果
- 对所有干预使用同一个目标协变量分布
- 主要依赖条件结果模型的反事实预测
- 要求一致性、可交换性、正值性与有效测量
- 可通过参数化 G 公式扩展到纵向策略
- 需要重叠、模型、校准与不确定性诊断
常见用途
- 把处理效应标准化到全部合格用户
- 从单次处理结果模型估计调整后风险
- 比较 G 计算、加权与双重稳健估计
- 在时间变化混杂下模拟持续处理策略
- 把分层结果转换为部署人群上的效应
示例
Loading code...常见问题
G 计算如何估计因果效应?
先估计给定处理与协变量的条件结果,再为每个目标单位生成各干预下的预测,随后在同一目标人群上平均每项干预的预测并比较标准化均值。因果解释仍取决于识别假设。
G 计算与逆概率加权有什么区别?
G 计算建立结果模型并标准化预测;逆概率加权建立处理分配模型并重加权观测结果。两者分别容易受到各自 Nuisance Model 错误的影响;双重稳健估计在额外条件下结合两者。
使用机器学习能让 G 计算无偏吗?
不能。灵活 Learner 可以降低结果模型误差,却无法消除未测混杂、处理定义含糊、测量误差、干扰或正值性违背。统计推断还可能需要样本拆分、合适方差估计或 Bootstrap。
什么是参数化 G 公式?
它是纵向扩展,用模型模拟指定处理策略下随时间变化的协变量与结果。当混杂不断演化且受既往处理影响时很有价值,但它依赖一系列正确模型与充分数据支持。
应如何检查 G 计算分析?
应检查协变量与处理重叠、预测范围、观测与预测结果、处理交互、目标人群权重、Bootstrap 不确定性,以及对模型选择的敏感性;同时比较兼容估计器,避免把缺乏支持的外推当成观测证据。