什么是 扩散模型?
扩散模型是一类生成模型:它学习从带噪数据回到数据分布的逆向去噪转移。具体输出取决于检查点、噪声计划、参数化、采样器、条件输入和推理设置。
快速了解
| 全称 | 扩散概率模型 |
|---|---|
| 创建时间 | 2015 年(初始概念)、2020 年(Ho 等人提出 DDPM)、2022 年(Stable Diffusion 公开发布) |
| 规范文档 | 官方规范 |
工作原理
常见形式先定义一个逐步加噪的前向过程,再训练网络估计逆向转移。推理时,采样器从噪声开始,重复应用学习到的转移。DDPM、DDIM 和其他求解器的更新规则与模型评估次数不同,并非通用质量排名。潜在扩散在编码表示而非像素上去噪,能降低许多管线的工作量,但也引入编码器、解码器和表示误差的约束。 应评测带日期的检查点与完整管线,而不是笼统评测「扩散模型」。固定 Prompt、Seed、预处理、分辨率、调度器、引导、硬件和指标,再度量任务质量、多样性、延迟、峰值内存、成本、安全失败和许可证合规性。模型权重、训练数据、Prompt、参考图与输出可能分别适用不同权利和隐私义务。
主要特点
- 迭代去噪过程,逐步将噪声转化为连贯数据
- 基于马尔可夫链理论,具有数学上可处理的训练目标
- 潜在空间扩散可能降低计算量,但会引入编码器和解码器限制
- 支持通过文本提示、图像或其他模态进行条件生成
- 质量、多样性和 Prompt 遵循取决于带日期的检查点与推理配置
- 可以使用文本、图像或其他条件输入,且需按目标任务评测其效果
常见用途
- 按 Prompt 遵循、构图和政策合规性评测的文生图
- 按 Mask 泄漏和身份保持评测的图像编辑与局部重绘
- 按几何与内容保持进行任务专用检查的图生图流程
- 单独评测时间一致性和延迟的视频或音频生成管线
- 具备来源、权利审查和人工批准控制的创意生产系统
示例
Loading code...常见问题
扩散模型和 GAN 有什么区别?
扩散模型通过迭代去噪更新生成;GAN 则训练生成器与判别器的对抗博弈。它们的质量、多样性、训练行为、延迟和内存占用会随架构、数据集、检查点、任务和时间变化。公平比较需固定任务、预处理、计算预算、指标和失败分析,不能把任一家族视为普遍更优。
扩散模型中的'引导尺度'是什么意思?
无分类器引导中的尺度会组合有条件与无条件预测,在条件遵循、多样性和伪影之间权衡。有效范围因管线而异,取决于检查点、调度器、分辨率、Prompt、参数化和指标。应使用固定评测集调优并记录配置,不存在通用默认值。
什么是负面提示,它们如何工作?
部分文本条件管线接受负面条件,但其语义和效果会随模型与接口改变。它不是可靠的安全控制,也不能保证某个概念一定不出现。应在代表性案例上测试,并在高风险场景使用独立的政策、审核、来源记录和人工复核控制。
什么是潜空间扩散,为什么它很重要?
潜在扩散在编码表示而非像素上去噪,再将其解码到输出域。它可能降低特定管线的计算量,但压缩、重建误差、潜变量缩放和解码器行为都会成为质量契约的一部分。应测量实际检查点与硬件配置,而非依赖固定速度或内存数字。
图像生成应该使用多少推理步骤?
步数控制模型评估次数,通常会改变延迟、成本和输出行为。其影响与检查点、采样器、时间步计划、分辨率、引导和目标指标耦合。应在固定 Seed 和 Prompt 下扫描一个小范围,选择达到既定质量与安全阈值的最低成本设置。