什么是 自监督学习(Self-Supervised Learning)?
自监督学习(Self-Supervised Learning)是一种从原始数据的结构、上下文、变换或多个视图中构造监督信号,而不要求每条训练样本都具备人工任务标签的学习范式。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
明确目标究竟从哪里产生
跨领域自监督综述把表示学习目标归纳为生成式、对比式与混合式家族。语言模型可以预测遮盖或未来 Token,视觉方法可以重建图像块或比较变换视图,语音与多模态系统还能利用时间或配对观测关系。这些 Target 来自机械构造,不是经过认证的语义标签。
防止前置任务奖励捷径
BERT展示 Masked-language Pretraining,SimCLR则说明 Augmentation 组合和 Contrastive Objective 如何塑造视觉表示。每种设计都编码了一组 Invariance 假设。应审计 Mask 是否泄漏答案、Crop 是否删除类别关键信息、Negative Pair 是否包含语义匹配、Batch 是否暴露实例身份,以及 Teacher-Student 系统是否收敛为常量特征。
评测迁移价值,而不是只看预训练损失
冻结数据、Encoder Revision、预处理和下游 Split,在明确计算预算下比较随机初始化、有监督基线、冻结 Linear Probe、参数匹配的 Fine-tuning 与任务专属训练。报告多个下游任务、标签预算、类别与人群切片、鲁棒性、检索或表示诊断,以及完整管线成本。一次有利的 Linear Probe 只证明特定表示与协议,不代表通用能力。
主要特点
- 从原始数据结构构造预测目标,而不是逐条依赖人工任务标签
- 包含 Masked、Autoregressive、Contrastive、Predictive 与 Teacher-Student 目标
- 通常先学习可复用表示,再执行下游微调或 Probe
- 通过 Mask、上下文、增强、配对与采样编码假设
- 可能因 Shortcut、表示坍塌、泄漏或域错配而失败
- 需要超越预训练目标的下游迁移与风险评测
常见用途
- 从大规模文本语料预训练语言表示
- 在少标签适配前学习图像或视频 Encoder
- 从无转写音频中学习语音表示
- 对齐图像与文本等配对模态
- 验证领域原始数据能否改善下游迁移
示例
Loading code...常见问题
自监督学习与无监督学习相同吗?
自监督学习常被归入广义无监督范畴,因为预训练记录不需要逐条人工任务标签;它的独特机制是从输入或关联视图构造明确预测目标,并优化类似监督学习的损失。历史术语存在重叠,因此判断方法时应说明实际目标函数。
自监督学习与伪标签有什么区别?
自监督 Target 由数据关系机械生成,例如被遮盖 Token 的原始身份,或两个增强视图是否来自同一实例;Pseudo-Label 则是模型对外部目标类别或数值的估计。伪标签可能对任务判断错误,并在后续训练中强化模型自身错误。
自监督学习能完全消除标注数据吗?
通常不能。预训练可能降低下游标签需求,但任务选择、迁移调参、质量测量、人群切片和高影响发布决策仍需要标签或可执行结果。节省比例取决于数据、目标、模型、任务和预算,必须通过学习曲线而不是通用数字证明。
自监督学习为什么会发生表示坍塌?
部分目标允许许多输入映射到近乎相同表示的平凡解。Contrastive Negative、Predictor Asymmetry、Stop-gradient、Centering、方差或协方差约束及 Teacher Update 都是方法特定缓解手段。不能只看组件是否存在,还要监控特征方差、秩、相似度分布和迁移质量。
怎样评测自监督表示?
在代表性下游任务、标签预算、领域与切片上比较冻结 Probe 和受控 Fine-tuning,并加入随机初始化与有监督基线、多 Seed、鲁棒性和检索诊断、计算与数据成本、隐私与记忆检查,同时固定预处理和 Checkpoint Revision。