什么是 半监督学习(Semi-Supervised Learning)?
半监督学习(Semi-Supervised Learning)是一种同时使用有标签样本与无标签样本,改进已声明预测任务的机器学习设置。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
先声明有标签与无标签数据契约
周志华的弱监督综述区分了归纳式半监督与 Transductive Learning,并解释 Cluster 与 Manifold 假设。工程契约应记录人群、分析单位、目标标签、采集时间、预处理、重复策略、类别支持,以及未来测试记录是否出现在无标签池中;无标签数据不能暗中携带测试标签、未来信息或未授权内容。
让无标签目标对应可检验假设
生成式方法建模输入与标签结构,图方法按明确相似度传播标签,Consistency Regularization 要求有效扰动保持预测,Pseudo-Labeling 则把筛选后的模型预测转成训练目标。FixMatch把弱增强上的高置信伪标签与强增强一致性结合,但它的 Benchmark 结果只属于对应数据集、架构、阈值和增强策略,不能直接写成生产收益承诺。
用有标签基线证明增量价值
保留代表性且未触碰的有标签测试集,在相同架构、优化预算和标签子集下比较是否加入无标签数据。报告任务指标、Calibration、类别与人群切片、可测时的伪标签覆盖率和精度、计算成本,以及跨标签切分和 Seed 的方差。主动加入分布外无标签样本、类别不平衡、增强语义破坏和分布偏移,不能默认更多无标签行一定更好。
主要特点
- 把同一目标任务的有标签集合与无标签集合共同用于训练
- 依赖输入结构或扰动与目标标签之间的明确假设
- 包含生成式、图传播、一致性、低密度与伪标签方法
- 可以面向未来输入做归纳,也可以只处理固定无标签集合
- 可能放大类别错配、泄漏、来源偏移和高置信模型错误
- 需要有标签基线与未触碰的代表性评测集
常见用途
- 专家标签稀缺时训练图像或文档分类器
- 使用同域无标签录音改进语音或传感器模型
- 结合少量审核样本与更大生产近似数据池
- 在固定标注预算下比较一致性方法与伪标签方法
- 正式标注前验证新采集无标签数据是否提供增量价值
示例
Loading code...常见问题
更多无标签数据一定能提升半监督学习吗?
不一定。无标签样本只有在方法假设确实连接其结构与目标时才有帮助。域外记录、未知类别、重复、泄漏或破坏语义的增强,都会把决策边界推向错误方向。每个 SSL 候选都应与纯有标签基线比较,并分别改变无标签来源和数量。
半监督学习与自监督学习有什么区别?
半监督学习把人工标注和无标签样本共同用于一个已声明目标任务;自监督学习从数据自身构造预训练目标,例如遮盖 Token 或成对视图,再把表示迁移到一个或多个下游任务。同一管线可以先做自监督预训练,再做半监督适配。
主动学习属于半监督学习吗?
两者用不同方式解决标签瓶颈。主动学习向 Oracle 请求选中记录的真实标签,普通半监督学习则在不获取真实标签的情况下使用无标签记录。它们可以组合,但必须分别报告标签查询、标注成本和剩余无标签目标。
怎样评测半监督学习?
冻结代表性有标签测试集、标签预算、无标签池、模型与计算预算,在多个 Split 和 Seed 上与纯有标签基线比较。报告任务质量、Calibration、类别与人群切片、伪标签诊断、运行成本,以及无标签池混入偏移或未知类别时的行为。
验证集或测试集能否作为无标签池?
只有明确的 Transductive Protocol 才能暴露不含标签的测试输入,而且结果不能证明对未来记录的归纳能力。验证标签不能被无限复用于 SSL 策略和最终结论。生产评测应保持实体、来源和时间边界,并让最终结果始终未触碰。