什么是 合成数据(Synthetic Data)?
合成数据(Synthetic Data)是由规则、仿真、统计模型或生成模型产生,而非直接观测目标事件所得的数据,用于在明确任务中补充或替代真实记录。
快速了解
| 创建时间 | 1990 年代(概念),2022-2026 年(规模化 LLM 生成) |
|---|---|
| 规范文档 | 官方规范 |
工作原理
生成方法决定数据契约
Rule 与 Simulator 编码显式机制,Statistical Synthesis 从源数据估计分布,GAN 和 VAE 学习生成分布,Language Model 则可生成 Instruction、Response、Critique 或变体。每个发布制品都应记录 Generator、来源 Revision、Prompt 或仿真配置、Random Seed、Filter、准入规则与合成血缘。
分别评测保真度、覆盖与任务效用
边缘分布相似不能证明相关性、稀有事件、时间动力学或因果关系得到保留。应检查 Schema、精确与近重复、分布和切片覆盖、下游效用、Calibration 与失败率。用于模型训练时,应在未触碰的真实 Holdout 上,以相同预算比较 Real-Only、Synthetic-Only 与 Mixed-Data 方案。
隐私与使用权不会自动成立
用个人或专有记录训练的生成器,可能通过直接复制、成员推断攻击或模型反演攻击暴露信息。
只有在适用场景与攻击模型下无法识别个人,合成值才可能被视为匿名。正式的差分隐私需要端到端机制和 Privacy Budget;生成过程本身不会消除 Consent、License、Copyright 或 Provider Terms 义务。
反馈回路会扭曲来源分布
反复用模型生成样本替代原始观测,可能丢失低概率事件并累积近似误差,这类场景被研究为 Model Collapse,但并非所有合成数据都会失败。应保留真实参考数据,标记合成来源,通过实验选择混合比例,独立评测每一代数据,并在多样性或真实留出集效用下降时停止。
主要特点
- 由生成过程产生,而不是从目标事件直接观测
- 可以来自规则、仿真、统计合成或生成模型
- 允许定向构造场景,但不保证符合真实基础率
- 需要记录来源数据、生成器、配置、过滤器和版本
- 需要权衡保真度、效用、覆盖、隐私风险、生成和审阅成本
- 可能放大偏差、记忆源数据、丢失分布长尾或累积反馈误差
常见用途
- 为经过人工或规则复核的模型训练集生成候选指令与回答
- 仿真难以安全大规模采集的稀有或危险场景
- 为软件和数据流水线生成符合 Schema 的测试 Fixture
- 在保留真实数据对照组的前提下补充代表性不足的切片
- 经过显式隐私风险评测后共享具有统计效用的记录
示例
Loading code...常见问题
合成数据和真实数据训练效果一样好吗?
不存在通用排序。生成器与过滤规则如果补充了有效覆盖,合成数据可能改善限定任务;它也可能遗漏稀有事件或重复生成器错误。应在相同预算下比较 Real-Only、Synthetic-Only 与 Mixed Training,并使用未触碰的真实分布和关键切片评测。
如何评测合成数据质量?
先明确用途,再检查 Schema、重复、血缘、分布与稀有切片覆盖,并在真实 Holdout 上测量下游效用和 Calibration。关键样例需要人工复核或可执行 Oracle。边缘分布相似或文本流畅,都不能单独证明标签有效或关系真实。
什么是合成数据导致的模型坍缩?
Model Collapse 是在多代模型递归使用模型输出训练时研究到的退化过程,近似误差可能持续累积,低概率区域先消失。它并非由每一条合成样本触发。团队应保留原始数据、记录血缘,并让每种混合方案接受真实留出集检验。
合成数据天然匿名且可以合法复用吗?
不是。数据或生成器输出仍可能通过复制、关联、Membership Inference 或 Model Inversion 暴露训练个体。是否匿名取决于具体环境和攻击模型下能否识别个人;来源权利、Consent、License、Provider Terms 与 Formal Privacy Guarantee 也必须分别审查。
合成数据应该替代真实训练数据吗?
只有特定用途的证据支持时才应替代。真实数据负责锚定目标分布,并暴露生成器可能遗漏的事件;合成数据可以增加可控覆盖或减少对敏感记录的访问。混合比例应按版本记录并通过实验选择,不能套用统一百分比。