什么是 协变量偏移(Covariate Shift)?

协变量偏移(Covariate Shift)是一种分布变化假设:源域与目标域的输入边缘分布不同,即 `P_source(X) != P_target(X)`,但条件目标关系保持稳定,即 `P_source(Y|X) = P_target(Y|X)`。

快速了解

规范文档官方规范

工作原理

先声明不变量,再选择校正方法

协变量偏移假设在包含所有相关输入后,条件标签机制保持稳定。观测错误率变化并不能识别这一子类型;标签偏移、概念漂移、遗漏变量和测量方式变化都可能产生相似现象。应明确源域与目标域人群、特征表示、标签政策和时间边界,再收集足够目标标签,在关键切片检验该不变量。

估计并诊断密度比

直接估计两个高维密度通常不稳定。实践中可以直接估计密度比,或训练经过校准的源域/目标域判别器,再结合采样先验修正把后验 Odds 转成密度比。Sugiyama 等人的研究推导了面向协变量偏移适配的直接重要性估计方法。无论使用哪种估计器,都要检查支持覆盖、极端权重、裁剪敏感性和有效样本量。

验证加权后的决策,而不只验证检测器

可在损失和目标风险估计中使用权重,但不能让最终目标测试标签泄漏到模型选择。条件允许时,应比较未加权基线、加权候选与目标域有标签验证估计,并按切片报告权重分布和有效样本量。权重裁剪能降低方差,却会引入偏差并改变估计目标,因此裁剪阈值必须写入发布契约,不能当作无影响的数据清理。

主要特点

  • 改变 `P(X)`,同时假设 `P(Y|X)` 保持不变
  • 要求目标域有显著概率的区域都得到源域支持
  • 通过密度比重加权源域训练或评测样本
  • 极端权重会导致高方差和较低有效样本量
  • 不能仅凭无标签边缘分布漂移确认
  • 需要目标域标签检查,因为不变量失效会使校正无效

常见用途

  1. 地域或获客渠道结构变化后适配模型
  2. 校正已知抽样选择差异造成的评测偏差
  3. 把训练数据重加权到明确的部署目标人群
  4. 诊断部署错误是否集中在源域支持稀疏区域
  5. 在目标域相似切片比较加权与未加权发布候选

示例

loading...
Loading code...

常见问题

协变量偏移和概念漂移有什么区别?

协变量偏移假设条件目标机制 `P(Y|X)` 稳定,只有输入占比 `P(X)` 变化;概念漂移则改变 `P(Y|X)`。在支持集重叠时,重要性加权可以校正前者,却无法恢复已经改变的目标关系。

没有目标域标签能检测协变量偏移吗?

可以在没有目标标签时检测观测输入差异,并估计源域与目标域密度比;但仅凭输入无法验证定义所需的 `P_source(Y|X) = P_target(Y|X)`。因此仍需目标标签或结果证据。

为什么重要性加权要求支持集重叠?

权重只能改变已经观测到的源域样本贡献。如果目标域重要区域在源域没有样本,其密度比近似无界,对应目标损失无法识别。此时需要新数据、更强建模假设、拒绝预测或缩小运行范围。

协变量偏移中的有效样本量说明什么?

有效样本量通过 `(sum w)^2 / sum(w^2)` 概括权重集中程度。少数权重占主导时,它会远低于原始行数,提示风险估计方差高、训练不稳定;但它不能证明条件机制不变量成立。

重要性权重应该裁剪吗?

裁剪可以控制方差和优化不稳定,却会引入偏差并改变近似目标。应在目标域相似留出数据上比较多个有依据的上限,报告裁剪值和有效样本量,不能用裁剪掩盖支持集缺失。

相关术语