什么是 断点回归设计?

断点回归设计是一种准实验设计:当处理分配或处理概率在已知阈值处不连续,而处理与未处理潜在结果随运行变量连续时,它可以识别断点附近的局部因果效应。

快速了解

规范文档官方规范

工作原理

识别来自断点处的连续性

在精确 RDD 中,处理效应是条件结果在断点 c 左右极限之差。设计要求结果的其他原因不在同一阈值跳跃、分配规则稳定、处理版本一致且无相关干扰。Imbens 与 Lemieux系统总结了设计逻辑、图形分析、局部估计、带宽选择与有效性检查。

局部多项式与带宽控制偏差方差取舍

通常在断点两侧分别拟合局部线性或低阶多项式,并给更靠近断点的样本更高权重。窄带宽降低平滑函数近似偏差,却提高方差;宽带宽增加精度,却要求更远区域仍满足函数近似。应报告稳健偏差校正区间,以及对合理带宽、核函数、阶数、Donut Exclusion 和协变量调整的敏感性,避免使用全局高阶多项式。

操纵与同步变化会破坏设计

需要检查运行变量密度、堆积、排序激励、处理前协变量连续性、处理概率跳跃、安慰剂结果和虚假断点。密度不连续是诊断信号而非完整有效性裁决,密度平滑也不能排除阈值处同时发生的隐藏政策变化。必须记录真实分配流程,并把结论限制在有支持的局部人群。

主要特点

  • 利用运行变量或分配变量的已知阈值
  • 通过断点左右极限差估计局部效应
  • 区分精确分配与模糊处理依从
  • 在局部近似偏差与抽样方差之间取舍
  • 要求连续性、不可精准排序和无同步干预
  • 局部解释较强但不能自动外推到总体

常见用途

  1. 评价基于考试或风险评分阈值的资格规则
  2. 衡量年龄或收入门槛政策的局部效果
  3. 处理依从不完全时估计断点局部效应
  4. 审计用户是否操纵产品资格评分
  5. 比较不同带宽与安慰剂阈值下的结果

示例

loading...
Loading code...

常见问题

精确断点回归与模糊断点回归有什么区别?

精确 RDD 中,跨过断点会确定性改变处理;模糊 RDD 中,只会改变处理概率,因此阈值资格充当工具变量,并在额外 IV 假设下用结果跳跃与处理跳跃之比识别局部顺从者效应。

为什么带宽选择对 RDD 很重要?

窄带宽比较更相似的单位并降低平滑函数近似偏差,却减少样本量;宽带宽提高精度,但要求断点更远处仍能可信近似。应结合数据驱动选择、稳健区间和多组合理带宽敏感性检查。

密度检验通过能证明不存在阈值操纵吗?

不能。运行变量密度跳跃可以暴露排序,但密度平滑不能证明单位没有影响分数,也不能排除其他机制在断点同步变化。应结合制度知识、堆积检查、协变量连续性和分配流程审计。

断点回归结果能外推到远离阈值的人群吗?

不能自动外推。主要目标量属于阈值附近单位,模糊设计还进一步局限于顺从者。向其他分数区域推广需要额外结构假设、多个阈值数据或专门的可迁移性设计,并应与局部结论分开报告。

为什么 RDD 应避免全局高阶多项式?

高阶全局多项式可能振荡、过度利用远端样本、产生不稳定的边界估计,并导致置信区间覆盖不良。采用两侧分开的局部线性或二次拟合,配合透明带宽和稳健偏差校正,通常更容易诊断与论证。

相关术语