什么是 合成数据(Synthetic Data)?

合成数据(Synthetic Data)是由规则、仿真、统计模型或生成模型产生,而非直接观测目标事件所得的数据,用于在明确任务中补充或替代真实记录。

快速了解

创建时间1990 年代(概念),2022-2026 年(规模化 LLM 生成)
规范文档官方规范

工作原理

生成方法决定数据契约

Rule 与 Simulator 编码显式机制,Statistical Synthesis 从源数据估计分布,GAN 和 VAE 学习生成分布,Language Model 则可生成 Instruction、Response、Critique 或变体。每个发布制品都应记录 Generator、来源 Revision、Prompt 或仿真配置、Random Seed、Filter、准入规则与合成血缘。

分别评测保真度、覆盖与任务效用

边缘分布相似不能证明相关性、稀有事件、时间动力学或因果关系得到保留。应检查 Schema、精确与近重复、分布和切片覆盖、下游效用、Calibration 与失败率。用于模型训练时,应在未触碰的真实 Holdout 上,以相同预算比较 Real-Only、Synthetic-Only 与 Mixed-Data 方案。

隐私与使用权不会自动成立

用个人或专有记录训练的生成器,可能通过直接复制、成员推断攻击或模型反演攻击暴露信息。

只有在适用场景与攻击模型下无法识别个人,合成值才可能被视为匿名。正式的差分隐私需要端到端机制和 Privacy Budget;生成过程本身不会消除 Consent、License、Copyright 或 Provider Terms 义务。

反馈回路会扭曲来源分布

反复用模型生成样本替代原始观测,可能丢失低概率事件并累积近似误差,这类场景被研究为 Model Collapse,但并非所有合成数据都会失败。应保留真实参考数据,标记合成来源,通过实验选择混合比例,独立评测每一代数据,并在多样性或真实留出集效用下降时停止。

主要特点

  • 由生成过程产生,而不是从目标事件直接观测
  • 可以来自规则、仿真、统计合成或生成模型
  • 允许定向构造场景,但不保证符合真实基础率
  • 需要记录来源数据、生成器、配置、过滤器和版本
  • 需要权衡保真度、效用、覆盖、隐私风险、生成和审阅成本
  • 可能放大偏差、记忆源数据、丢失分布长尾或累积反馈误差

常见用途

  1. 为经过人工或规则复核的模型训练集生成候选指令与回答
  2. 仿真难以安全大规模采集的稀有或危险场景
  3. 为软件和数据流水线生成符合 Schema 的测试 Fixture
  4. 在保留真实数据对照组的前提下补充代表性不足的切片
  5. 经过显式隐私风险评测后共享具有统计效用的记录

示例

loading...
Loading code...

常见问题

合成数据和真实数据训练效果一样好吗?

不存在通用排序。生成器与过滤规则如果补充了有效覆盖,合成数据可能改善限定任务;它也可能遗漏稀有事件或重复生成器错误。应在相同预算下比较 Real-Only、Synthetic-Only 与 Mixed Training,并使用未触碰的真实分布和关键切片评测。

如何评测合成数据质量?

先明确用途,再检查 Schema、重复、血缘、分布与稀有切片覆盖,并在真实 Holdout 上测量下游效用和 Calibration。关键样例需要人工复核或可执行 Oracle。边缘分布相似或文本流畅,都不能单独证明标签有效或关系真实。

什么是合成数据导致的模型坍缩?

Model Collapse 是在多代模型递归使用模型输出训练时研究到的退化过程,近似误差可能持续累积,低概率区域先消失。它并非由每一条合成样本触发。团队应保留原始数据、记录血缘,并让每种混合方案接受真实留出集检验。

合成数据天然匿名且可以合法复用吗?

不是。数据或生成器输出仍可能通过复制、关联、Membership Inference 或 Model Inversion 暴露训练个体。是否匿名取决于具体环境和攻击模型下能否识别个人;来源权利、Consent、License、Provider Terms 与 Formal Privacy Guarantee 也必须分别审查。

合成数据应该替代真实训练数据吗?

只有特定用途的证据支持时才应替代。真实数据负责锚定目标分布,并暴露生成器可能遗漏的事件;合成数据可以增加可控覆盖或减少对敏感记录的访问。混合比例应按版本记录并通过实验选择,不能套用统一百分比。

相关工具

相关术语

相关文章