什么是 弱监督学习(Weak Supervision)?

弱监督学习(Weak Supervision)是一组使用不完整、粗粒度、含噪、不确定或由不完美来源生成的训练信号,而不是依赖大规模逐样本完全验证标签的学习设置。

快速了解

规范文档官方规范

工作原理

先分类监督信号弱在哪里

周志华的分类法把弱监督分为 Incomplete、Inexact 与 Inaccurate。半监督学习处理一种不完整标签场景,Multiple Instance Learning 使用粗粒度 Bag Label,Noisy-label Learning 则处理不可靠 Target。Programmatic Rule 只是重要来源家族之一,不是弱监督的全部定义。应记录每个来源的作用范围、输出空间、Abstain 行为、来源、成本与预期失败模式。

把来源聚合当作估计问题

Snorkel 系统论文从 Labeling Function 的一致与冲突中估计未知准确率和部分依赖,再为判别模型生成概率标签。结果依赖来源多样性、Overlap、条件依赖假设、类别平衡与 Identifiability。应与 Majority Vote、简单规则和有监督基线比较;重复或近重复来源不能伪装成独立证据。

同时评测标签质量与最终模型效用

在未触碰 Gold Set 上报告每个来源的 Coverage、Precision、Recall、Abstention、Conflict、类别与人群表现,以及来源变更后的稳定性;再在独立测试集上评估聚合标签 Calibration 与 End Model。版本化来源代码、Prompt、模型 Revision、知识快照和生成标签;人工复核高影响冲突,并监控来源或人群漂移是否使旧准确率估计失效。

主要特点

  • 覆盖不完整、粗粒度和不准确三类监督信号
  • 可以使用规则、知识库、Crowd、传感器、Prompt 或已有模型
  • 允许来源投票、Abstain、重叠、冲突并随数据切片变化
  • 可先把弱来源聚合成概率标签,再训练 End Model
  • 容易受到相关错误、来源重复、偏差和漂移影响
  • 仍需要独立 Gold Label 支持开发与最终评测

常见用途

  1. 把领域专家规则编码为文本分类训练信号
  2. 用知识库匹配生成含噪关系抽取标签
  3. 从文档级或 Bag-level Annotation 学习实例预测
  4. 在统一标签契约下组合标注者、模型与启发式规则
  5. 在定向人工标注前快速启动训练数据集

示例

loading...
Loading code...

常见问题

弱监督学习与半监督学习相同吗?

不同。半监督学习是同时存在有标签与无标签样本的不完整监督设置;弱监督是更宽泛的上位概念,还包括粗粒度标签、噪声标签、Distant Supervision、Crowd 和程序化来源。同一流程可以同时属于两者,但需要声明不同假设。

弱监督学习必须使用 Labeling Function 或 Snorkel 吗?

不必。Labeling Function 与 Snorkel 实现的是 Programmatic Weak Supervision。更广义领域还包括 Bag-level Label、Partial Label、含噪标注者、Distant Supervision 等信号。应说明确切来源和聚合方式,不能把 Weak Supervision 当成完整协议。

弱标签为什么不能只做多数投票?

来源可能具有不同 Accuracy、Coverage、类别行为和相关性。五条复制规则不是五份独立观测,高覆盖弱规则也可能压过精准专家规则。Majority Vote 是必要基线,但学习式聚合必须在独立标签上证明增量,并公开依赖假设。

Label Model 能消除所有弱标签噪声吗?

不能。它只是在一套来源行为模型下估计潜在标签。共享盲区、未观测依赖、类别支持缺失、恶意来源和人群偏移都会留下系统性错误。应保留来源 Lineage,检查冲突与切片,并用 Gold Data 同时验证生成标签和 End Model。

弱监督学习需要多少人工标注数据?

没有通用数量。应建立用于来源设计的代表性开发集,以及严格未触碰的最终测试集,并覆盖关键类别、来源和风险。随着标签增加绘制不确定性与学习曲线,在目标决策获得足够证据时停止,而不是追求固定记录配额。

相关术语

相关文章