什么是 标签偏移(Label Shift)?
标签偏移(Label Shift)是一种分布变化假设:源域与目标域的类别先验不同,即 `P_source(Y) != P_target(Y)`,但类别条件输入分布保持稳定,即 `P_source(X|Y) = P_target(X|Y)`。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
通过稳定测量通道识别类别先验
Black Box Shift Estimation 把固定分类器当作带噪标签测量通道。先在源域有标签留出集估计混淆矩阵 P(prediction|Y),再测量无标签目标域预测频率,最后求解线性系统得到目标类别先验。Lipton、Wang 与 Smola 的论文建立了 BBSE 方法及其假设。如果混淆矩阵奇异或近似奇异,就无法通过该分类器识别这些类别。
区分类别先验校正与概率校准
在模型和假设允许时,可以用估计的类别先验比重加权源域样本,或校正 Posterior Odds。它不会自动校准分数、修复排序错误,也不能证明 P(X|Y) 稳定。Soft Estimator 使用预测概率而非硬类别,还需要这些分数满足相应校准或矩条件。必须记录分类器 Revision、阈值规则、标签映射、源域先验和估计方法。
验证可行性与下游效用
检查估计先验非负、总和为一,并在抽样不确定性和合理切片下保持稳定。查看混淆矩阵条件数或 Bootstrap 敏感性;类别预测特征相似时,求逆会放大噪声。应在代表性目标标签上比较校正与未校正决策,包括稀有类别和成本敏感结果。即使先验估计在数学上可行,只要不变量假设错误,产品表现仍可能变差。
主要特点
- 改变 `P(Y)`,同时假设 `P(X|Y)` 保持不变
- 把稳定分类器混淆矩阵用作标签测量通道
- 在可识别条件下从无标签目标预测估计类别先验
- 类别具有相似预测特征时容易数值不稳定
- 不覆盖新增类别、重新标注或类别内输入变化
- 校正后的决策仍需目标域有标签验证
常见用途
- 疾病或欺诈发生率变化时调整分类器
- 在目标标签充足前估计目标域类别结构
- 基于有依据的先验偏移模型重加权评测或训练
- 结合已知源域混淆矩阵诊断预测占比变化
- 检验先验校正是否改善成本敏感目标决策
示例
Loading code...常见问题
标签偏移和协变量偏移有什么区别?
标签偏移改变类别先验 `P(Y)`,同时假设类别条件输入 `P(X|Y)` 稳定;协变量偏移改变 `P(X)`,同时假设 `P(Y|X)` 稳定。二者的校正和证据要求不同,单凭预测占比变化无法识别。
没有目标域标签能估计标签偏移吗?
在 `P(X|Y)` 稳定的假设下,可以用固定分类器的源域混淆矩阵与无标签目标预测频率识别目标先验。矩阵必须能区分类别且保持稳定;仍需目标标签验证假设和下游决策。
为什么 BBSE 会得到负的类别先验?
抽样噪声、病态混淆矩阵、类别条件输入变化、新类别或处理管线不一致,都可能让无约束求逆得到不可行结果。不要直接截断负值;应诊断违约、量化不确定性,并只在有依据时使用有约束估计器。
标签偏移等于标签定义变化吗?
不等于。标签偏移保留标签空间和类别内输入分布,只改变类别占比。重命名、合并、拆分类别或调整标注标准会改变目标语义,需要迁移数据集与模型,不能只做先验校正。
如何评估标签偏移校正?
使用代表性目标标签比较校正前后的损失、校准、决策成本和各类别错误。报告先验估计不确定性、矩阵条件、分类器 Revision 与关键切片。类别先验估计看似改善,不等于生产决策已经改善。