什么是 文生图?
文生图是一类把自然语言 Prompt 及可选控制条件映射为一个或多个合成图像样本的生成式 AI 任务。
快速了解
| 全称 | 文本生成图像(Text-to-Image Generation) |
|---|---|
| 创建时间 | 2021 年(DALL-E)、2022 年(Stable Diffusion、Midjourney 公开发布) |
工作原理
文生图描述的是任务,不是某一种模型架构或产品。系统接收文本条件,可能先改写或扩展 Prompt,再把条件转换成模型特定表示,生成图像或视觉 Token,最后解码为图像资产。Diffusion 与 Latent Diffusion 系统通常从随机噪声出发,迭代预测通向图像的路径;自回归系统按序预测离散视觉 Token;Flow Matching 与混合系统则学习从简单分布到视觉数据的其他变换。Transformer、U-Net、Text Encoder、Autoencoder 与多模态模型只是不同实现可以组合的组件,并非任务定义的必备条件。纯 Text-to-Image 只以文本和系统默认值为输入;一旦流程要求 Reference Image、Mask、Pose、Depth Map、Layout 或 Identity Asset,就更接近可控生成或图像编辑,即使文本仍是输入之一。Prompt 语法同样依赖模型,Negative Prompt、Guidance Scale、Token Weight 与 Style Keyword 都不是跨模型保证。由于生成具有概率性,生产 Run 应绑定原始与 Effective Prompt、Model 和 Checkpoint Revision、Text Encoder 或 Tokenizer、Seed 或 Random State、Scheduler 或 Sampler、Step Count、Guidance Policy、尺寸、Precision、Runtime、Hardware、Safety Policy Revision、输入资产 Hash 与输出 Hash。只固定 Seed,无法保证跨模型、Library、Accelerator、Precision 或 Kernel 得到完全相同的结果。评测必须把 Visual Quality 与 Prompt Alignment 分开,并细分检查 Object、Count、Color、Spatial Relation、Attribute Binding、Text Rendering、Identity Consistency 与 Required Omission。Diversity、Latency、Cost、Failure Rate、Accessibility 和 Human Preference 也是独立维度;单一 FID、CLIPScore、VLM Judge 或排行榜无法证明全部能力。生产验收应使用版本化 Prompt Suite、多 Seed、任务特定 Acceptance Rule、人工标注切片与独立安全检查。Training Data Provenance 与 License、用户输入隐私、身份仿冒与欺骗风险、Harmful Bias、输出审核、Retention 和 Incident Response 仍由系统负责。Content Credentials 或 Watermark 可以传达来源信号,但不能证明图像真实、未经修改、权属合法或安全;没有这些信号,也不能证明图像由人类创作。
主要特点
- 定义文本条件图像生成任务,而不是特定 Model、Vendor 或 Diffusion 架构
- 可由 Diffusion、Latent Diffusion、自回归视觉 Token、Flow Matching 或混合目标实现
- 输出具有概率性,生成身份取决于 Effective Prompt、Model Revision、Random State、Runtime 与推理配置
- Negative Prompt、Guidance、Reference Asset、Mask 与 Adapter 等控制能力依赖具体模型,不能跨模型直接迁移
- 需要分别评测 Visual Quality、Prompt Alignment、Composition、Text Rendering、Diversity、安全、Latency 与 Cost
- 生产使用需要数据权利审查、输入隐私、内容审核、Provenance、人工批准与发布后监控
常见用途
- 根据版本化 Creative Brief 生成概念图与设计备选方案
- 生成经过品牌、权利、无障碍与人工审核门禁的营销或编辑草稿
- 创建带 Label、Provenance 与下游验证记录的合成视觉数据
- 按对象、数量、属性、空间关系、文字、偏见和不安全内容切片评测图像模型
- 构建固定制品、限制输入、保留审计记录并具备回滚门禁的可复现生图服务
示例
Loading code...常见问题
文生图和 Diffusion Model 是同一个概念吗?
不是。文生图是根据文本条件生成图像的任务,Diffusion 与 Latent Diffusion 是重要实现族,但自回归视觉 Token、Flow Matching 和混合系统也能完成同一任务。因此应把任务、模型架构、Checkpoint 与产品名称分别记录。
文生图系统如何把 Prompt 转换成图像?
系统先把 Prompt 转为条件表示,再与生成过程结合,并把生成表示解码为像素。有些系统迭代变换噪声,有些系统预测视觉 Token。Provider 还可能在返回图像前改写 Prompt、执行 Safety Policy、对候选结果排序或加入其他控制条件。
相同 Prompt 和 Seed 一定能复现同一张图吗?
不一定。Seed 只控制一部分随机性,Model 或 Checkpoint Revision、Prompt Rewrite、Text Encoder、Scheduler、Step Count、Precision、Library Version、Hardware、Kernel 与 Safety Policy 变化都可能改变结果。可复现测试必须固定完整生成身份,并在声明的容差内比较。
应该如何评测文生图质量?
使用版本化 Prompt Suite 并运行多个 Seed,分别测量 Prompt Alignment、对象、数量、颜色、空间关系、属性绑定、文字渲染、身份一致性、视觉缺陷、Diversity、安全、Latency 与 Cost。自动指标和 VLM Judge 必须用任务特定人工标签校准,不能压缩成一个通用总分。
Watermark 或 Content Credentials 能证明生成图像可信安全吗?
不能。它们可以提供来源或编辑历史信号,但不能证明事实准确、获得本人同意、版权归属明确或使用场景安全。生产系统仍需执行输入权利检查、Privacy Control、身份仿冒和滥用策略、输出审核、人工复核、Retention 与 Incident Response。