什么是 伪标签(Pseudo-Labeling)?

伪标签(Pseudo-Labeling)是一种把模型或 Teacher 对无标签样本的部分预测当作临时 Target,并在后续优化步骤中使用这些样本的训练技术。

快速了解

规范文档官方规范

工作原理

版本化 Teacher、目标与筛选策略

记录 Teacher Checkpoint、预处理、Label Map、Temperature 或 Calibrator、Hard/Soft Target 规则、Threshold、类别策略、数据来源、Augmentation、Weight、刷新频率与停止条件。

当前 scikit-learn SelfTrainingClassifier 文档提供 Threshold 与 Top-k 筛选,并明确指出阈值策略依赖校准良好的分类器。

控制确认偏差,同时公开覆盖率

伪标签与确认偏差研究在对应图像分类设置中展示了错误模型预测如何在训练中被强化。应跟踪接纳数量、Score Distribution、每类 Coverage、在有标签审计样本上估计的 Precision、不同增强或 Teacher 的分歧,以及拒绝原因。极高阈值可能通过静默丢弃困难类别和人群来改善表面 Precision。

评测完整自训练闭环

在相同有标签集合、无标签池、模型族和计算预算下,比较纯有标签模型、单轮 Pseudo-Labeling、迭代 Self-Training 与另一种半监督基线。最终测试集必须独立于 Teacher 筛选。报告任务质量、Calibration、少数类 Recall、伪标签 Precision 与 Coverage、Open-set 行为、轮次、计算成本和跨 Seed 方差;新接纳标签降低留出效用时应停止或回滚。

主要特点

  • 把模型预测作为无标签记录的临时 Hard 或 Soft Target
  • 可以单轮执行,也可以形成 Teacher-Student 自训练循环
  • 按 Confidence、Agreement、类别或其他策略筛选和加权样本
  • 把目标生成数据与最终未触碰评测标签分离
  • 可能通过确认偏差与类别不平衡放大早期错误
  • 需要在分布偏移下同时报告伪标签 Precision 与 Coverage

常见用途

  1. 扩充小规模有标签图像、文本或语音数据集
  2. 使用更大同域无标签池适配模型
  3. 让 Student 学习更强 Teacher 或 Teacher Ensemble
  4. 在人工复核前筛选自动生成训练目标
  5. 在固定标注预算下评测标签效率曲线

示例

loading...
Loading code...

常见问题

Hard Pseudo-Label 与 Soft Pseudo-Label 有什么区别?

Hard Pseudo-Label 通常只保留 Argmax 类别;Soft Target 则保留概率或 Logit,表达类别间相对不确定性。Temperature、Calibration、Weight 与 Loss 实现会改变 Soft Target 语义;两种形式都不会因为通过阈值就变成 Ground Truth。

伪标签与自监督学习相同吗?

不同。伪标签由模型估计外部任务目标,例如无标签图像的类别;自监督 Target 来自数据自身关系,例如被遮盖 Token 的原始值。两者都可能自动生成 Target,但错误来源、假设和评测契约并不相同。

伪标签置信度阈值应该怎样选择?

应针对冻结 Teacher 和目标结果,在代表性有标签开发集上选择,并按类别、人群与来源检查 Precision、Coverage、Calibration 和处理容量。Checkpoint、预处理、人群或 Label Map 变化后要重新验证,不能复制其他模型的通用阈值。

如何降低伪标签的确认偏差?

可按证据采用可靠的有标签 Warm Start、校准或 Agreement 筛选、类别平衡配额、Soft Weight、有效增强、独立 Teacher、周期重标注和留出停止条件。这些只是缓解措施;还要公开拒绝覆盖率与审计样本,避免靠忽略困难人群获得低误差。

伪标签能替代人工评测吗?

不能。同一模型族可能复制相同盲区,高置信预测也可能系统性错误。定义目标、审计生成标签、评测关键切片与未知类别、选择停止条件和支持发布决策,仍需要人工标签或可执行结果。

相关术语

相关文章