什么是 主动学习(Active Learning)?
主动学习(Active Learning)是一种监督学习过程,由学习器在明确标注预算和评测协议下,选择哪些未标注样本或查询需要获得标签。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
定义闭环与真实标注预算
首先建立防泄漏的种子集、未参与采集的评测集,以及版本化未标注池。每轮训练或更新模型,只为符合资格的候选评分,选择批量、收集带血缘的标签、处理裁决并记录成本,再进入重训练。剑桥大学 Machine Learning Group 的资料覆盖了统计与贝叶斯主动学习基础。预算应包含专家时间、分歧、失败查询、延迟和模型重训练,而不仅是标签数量。
平衡信息量、代表性与批量多样性
最小置信度、Margin、Entropy、Query-by-Committee、BALD、期望模型变化和期望错误下降定义了不同效用。不确定性可能选中噪声离群点或重复边界样本,密度与 Core-set 方法也可能选择有代表性但模型早已掌握的样本。当前 scikit-activeml 文档区分信息量、代表性和混合策略,也区分 Top-k 与多样批量。任何选择都应与随机采样做消融比较。
在不发生选择泄漏的前提下评估自适应过程
应在固定、代表性测试集上,绘制性能和决策成本相对于累计标注成本的曲线,并跨随机种子重复完整采集轨迹。主动选择的标签不是 IID 评测样本,会扭曲类别占比与概率校准。还需跟踪类别和子群覆盖、重复率、标注者分歧、跳过样本和池分布变化;边际价值低于预设阈值时停止,不能因为所选集合自身得分良好就结束。
主要特点
- 在模型拟合、采集评分、标注和数据集更新之间循环
- 运行于明确的池式、流式或查询合成设置
- 可以组合不确定性、分歧、期望价值和代表性
- 要求明确标注成本、批量、资格与停止策略
- 会产生必须与评测数据隔离的自适应选择偏差
- 必须在重复学习曲线上优于随机或当前采集基线
常见用途
- 为医疗或科学数据优先分配昂贵专家标签
- 为文档或图像分类选择多样化边界样本
- 用有限标注预算把模型适配到新领域
- 为排序或推荐系统采集偏好判断
- 在新数据模式出现时维护生产分类器
示例
Loading code...常见问题
主动学习如何降低标注成本?
它把有限预算分配给预期比被动采样更能改善目标决策的样本,但节省并非自动成立。必须以总标注与重训练成本为横轴,在学习曲线上与随机或当前采集方式比较。
主动学习只使用不确定性采样就够了吗?
通常不够。高不确定性可能来自错标、分布外或重复样本。批量系统常结合信息量、多样性、代表性、资格和成本,并用受控消融检验每个组成是否产生真实增益。
主动学习中的冷启动问题是什么?
初始标签过少时,模型与不确定性分数可能不可靠,早期查询会强化错误边界。应使用多样种子集,在有依据时加入先验知识,并保留随机或表示采样基线,再信任模型驱动采集。
主动学习会产生有偏训练数据吗?
会。已标注集由自适应策略选择,并非 IID 抽样,可能扭曲类别占比和概率校准。可行时应保存查询倾向与血缘,而且不能把采集集合自身当作唯一性能估计。
主动学习闭环应该何时停止?
根据预先声明的总预算、未参与采集评测集上的边际增益、目标风险达成、候选池耗尽或不可接受的标注延迟停止。反复查看噪声增益并择机停止也应被显式控制。