什么是 分布偏移(Distribution Shift)?
分布偏移(Distribution Shift)是模型开发或评测所依据的联合数据生成分布,与部署时实际遇到的分布发生变化。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
区分主要分布分解假设
《动手学深度学习》分布偏移章节区分输入分布、标签分布和概念变化。协变量偏移假设 P(Y|X) 稳定而 P(X) 变化;标签偏移假设 P(X|Y) 稳定而 P(Y) 变化;概念漂移改变 P(Y|X),并常按时间观察。它们是对 P(X,Y) 分解的诊断假设,不能从一条监控曲线直接得出。
让无标签与有标签证据承担不同结论
无标签检验可以比较特征、Embedding、预测或分数分布,适合提前预警;但由于没有真实结果,它不能证明任务损失已经变化。要估计性能漂移并区分有害与无害变化,需要延迟标签、抽样裁决或可执行业务结果。Failing Loudly 研究比较了实用的双样本检测方法,但检测能力仍取决于样本量、表示、偏移类型和效应大小。
把每个告警连接到诊断与动作
围绕决策相关的少量原始特征、学习表示、预测占比、不确定性信号和有标签结果,按重要切片监控。既保留固定基线以观察长期变化,也比较近期窗口以捕捉局部事故。需要处理重复检验,要求告警具有持续性或足够效应量,并将其路由到调查、Fallback、阈值复核、补采标签或重训练。对每次告警自动重训练,可能把脏数据、标签缺陷或对抗流量吸收到模型中。
主要特点
- 比较两个明确人群、环境或时间窗口,而非抽象讨论数据变化
- 覆盖输入、标签、条件关系或多个因素共同变化
- 依赖版本化参考集、稳定特征语义与足够样本支持
- 用无标签信号提前预警,用有标签结果估计真实影响
- 必须检查决策相关切片,不能只看全局平均值
- 需要明确处置策略,因为统计显著性不等于业务严重度
常见用途
- 在地域、设备或获客渠道变化后监控分类模型
- 应用发布后检测 Embedding 与请求模式变化
- 诊断类别先验或条件错误行为是否已经改变
- 为模型运维定义回滚、Fallback、标注和重训练触发条件
- 审计季节、政策、语言和传感器变化下的模型质量
示例
Loading code...常见问题
分布偏移和数据漂移有什么区别?
分布偏移泛指两个明确环境中的 `P(X,Y)` 发生变化;数据漂移在工程语境中常指可观测输入或模型输出分布变化。不同团队用法并不统一,因此监控契约应直接写明变量、人群、统计量和时间窗口,不能只依赖「漂移」一词。
检测到输入漂移能证明模型准确率下降吗?
不能。无标签检测器只能说明被监控表示的变化超过阈值;变化维度可能与决策无关,真正有害的变化也可能藏在未监控切片。应通过延迟标签、抽样裁决、可执行结果或有充分依据的代理指标估计影响。
如何选择分布偏移的参考分布?
选择能代表模型获批运行条件的版本化人群,并确保特征定义和预处理与生产一致。保留固定发布基线以便跨期比较,同时增加近期窗口捕捉局部事故;季节或政策制度不同的数据不应无解释地混为一个参考集。
哪种指标最适合检测分布偏移?
不存在通用最佳指标。应按数据类型与决策风险选择:类别可用比例检验,标量可用 KS 或 Wasserstein,高维表示使用经过验证的双样本方法。同时报告效应量、样本支持、检测功效和重复检验策略。
每次分布偏移告警都应该触发重训练吗?
不应该。先检查数据质量、Schema、预处理、关键切片、标签与业务影响。正确动作可能是不处理、继续调查、调整阈值、Fallback、回滚、定向标注或重训练。自动重训练可能学习脏数据或对抗流量。