什么是 因果发现(Causal Discovery)?
因果发现(Causal Discovery)是在明确图结构、采样、条件独立、潜变量、干预和数据生成机制假设后,从数据中学习可识别因果结构特征的任务。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
不同算法家族依赖不同假设
PC 通常要求无环、因果 Markov、Faithfulness、正确的条件独立检验和因果充分性;FCI 放宽因果充分性,可以输出部分祖先图。评分方法还依赖评分与搜索条件,函数模型则借助线性非高斯或加性噪声等限制获得方向。Glymour、Zhang 与 Spirtes系统综述了约束、评分和函数模型方法的适用边界。
诚实的输出往往是等价类
在标准假设下,CPDAG 表示具有相同骨架与非屏蔽碰撞点的一组 DAG;存在潜在混杂或选择时,PAG 表示一组祖先图共享的结构特征。圆端点或无向端点表示方向尚未识别,并非实现缺陷。如果直接返回一张全定向图,可能把数据无法支持的方向误报为因果事实。
图恢复需要稳定性与外部验证
条件独立检验误差、弱信号、混合数据类型、测量误差、选择、环、分布偏移和隐藏原因都可能改变结果。应结合背景约束、时间顺序、Bootstrap 或子采样稳定性、多种可辩护算法、已知真值的合成基准,以及可实施的干预。发现的边是待审查与检验的假设,不能自动授权策略或调整。
主要特点
- 学习结构特征,而不是估计一个预先指定的效应
- 包含约束、评分、函数、混合与连续优化方法
- 依赖因果 Markov、Faithfulness、图和采样假设
- 可能返回 CPDAG 或 PAG,而不是唯一 DAG
- 必须区分潜在混杂、观测邻接与因果方向
- 需要稳定性、领域、时间与干预证据验证
常见用途
- 为科学审查生成候选因果图
- 发现既有 DAG 与条件独立数据之间的矛盾
- 选择最能区分竞争方向的后续干预
- 比较结构在不同环境或时间窗口中的稳定性
- 在已知真图的模拟系统中评测结构学习算法
示例
Loading code...常见问题
因果发现能从观测数据恢复真实 DAG 吗?
在没有强额外假设时通常不能唯一恢复。Markov 等价的多张 DAG 可以蕴含同样的观测条件独立关系。函数限制、时间顺序、背景知识、多环境或干预可定向更多边,但每个新方向都会继承相应假设。
PC、FCI 与 GES 有什么区别?
PC 是约束方法,通常假定已测变量之间不存在潜在混杂;FCI 也是约束方法,但允许潜在混杂并可输出 PAG;GES 是评分方法,在等价类空间中用惩罚拟合分数搜索。三者的假设与输出语义并不相同。
因果发现为什么返回 CPDAG 或 PAG?
因为数据可能只能确定多张因果图共有的结构。CPDAG 编码一组 Markov 等价 DAG;PAG 还表示与潜在混杂或选择相容的不确定性。在获得额外证据前,含糊端点应继续保持含糊。
NOTEARS 消除了因果发现的假设吗?
没有。NOTEARS 把无环结构学习转化为连续优化,改变的是搜索方式,而不是消除因果假设。结果仍取决于模型类别、损失、正则化、无环、采样、潜变量与可识别性条件。
应如何验证因果发现得到的图?
应核查数据定义与时序,检验图蕴含的独立关系,评估 Bootstrap 与跨环境稳定性,比较假设兼容的算法,加入可辩护的背景约束,在已知真值的模拟中评测,并尽可能使用定向干预。仅有预测拟合不足以验证。