什么是 文生图?

文生图是一类把自然语言 Prompt 及可选控制条件映射为一个或多个合成图像样本的生成式 AI 任务。

快速了解

全称文本生成图像(Text-to-Image Generation)
创建时间2021 年(DALL-E)、2022 年(Stable Diffusion、Midjourney 公开发布)

工作原理

文生图描述的是任务,不是某一种模型架构或产品。系统接收文本条件,可能先改写或扩展 Prompt,再把条件转换成模型特定表示,生成图像或视觉 Token,最后解码为图像资产。Diffusion 与 Latent Diffusion 系统通常从随机噪声出发,迭代预测通向图像的路径;自回归系统按序预测离散视觉 Token;Flow Matching 与混合系统则学习从简单分布到视觉数据的其他变换。Transformer、U-Net、Text Encoder、Autoencoder 与多模态模型只是不同实现可以组合的组件,并非任务定义的必备条件。纯 Text-to-Image 只以文本和系统默认值为输入;一旦流程要求 Reference Image、Mask、Pose、Depth Map、Layout 或 Identity Asset,就更接近可控生成或图像编辑,即使文本仍是输入之一。Prompt 语法同样依赖模型,Negative Prompt、Guidance Scale、Token Weight 与 Style Keyword 都不是跨模型保证。由于生成具有概率性,生产 Run 应绑定原始与 Effective Prompt、Model 和 Checkpoint Revision、Text Encoder 或 Tokenizer、Seed 或 Random State、Scheduler 或 Sampler、Step Count、Guidance Policy、尺寸、Precision、Runtime、Hardware、Safety Policy Revision、输入资产 Hash 与输出 Hash。只固定 Seed,无法保证跨模型、Library、Accelerator、Precision 或 Kernel 得到完全相同的结果。评测必须把 Visual Quality 与 Prompt Alignment 分开,并细分检查 Object、Count、Color、Spatial Relation、Attribute Binding、Text Rendering、Identity Consistency 与 Required Omission。Diversity、Latency、Cost、Failure Rate、Accessibility 和 Human Preference 也是独立维度;单一 FID、CLIPScore、VLM Judge 或排行榜无法证明全部能力。生产验收应使用版本化 Prompt Suite、多 Seed、任务特定 Acceptance Rule、人工标注切片与独立安全检查。Training Data Provenance 与 License、用户输入隐私、身份仿冒与欺骗风险、Harmful Bias、输出审核、Retention 和 Incident Response 仍由系统负责。Content Credentials 或 Watermark 可以传达来源信号,但不能证明图像真实、未经修改、权属合法或安全;没有这些信号,也不能证明图像由人类创作。

主要特点

  • 定义文本条件图像生成任务,而不是特定 Model、Vendor 或 Diffusion 架构
  • 可由 Diffusion、Latent Diffusion、自回归视觉 Token、Flow Matching 或混合目标实现
  • 输出具有概率性,生成身份取决于 Effective Prompt、Model Revision、Random State、Runtime 与推理配置
  • Negative Prompt、Guidance、Reference Asset、Mask 与 Adapter 等控制能力依赖具体模型,不能跨模型直接迁移
  • 需要分别评测 Visual Quality、Prompt Alignment、Composition、Text Rendering、Diversity、安全、Latency 与 Cost
  • 生产使用需要数据权利审查、输入隐私、内容审核、Provenance、人工批准与发布后监控

常见用途

  1. 根据版本化 Creative Brief 生成概念图与设计备选方案
  2. 生成经过品牌、权利、无障碍与人工审核门禁的营销或编辑草稿
  3. 创建带 Label、Provenance 与下游验证记录的合成视觉数据
  4. 按对象、数量、属性、空间关系、文字、偏见和不安全内容切片评测图像模型
  5. 构建固定制品、限制输入、保留审计记录并具备回滚门禁的可复现生图服务

示例

loading...
Loading code...

常见问题

文生图和 Diffusion Model 是同一个概念吗?

不是。文生图是根据文本条件生成图像的任务,Diffusion 与 Latent Diffusion 是重要实现族,但自回归视觉 Token、Flow Matching 和混合系统也能完成同一任务。因此应把任务、模型架构、Checkpoint 与产品名称分别记录。

文生图系统如何把 Prompt 转换成图像?

系统先把 Prompt 转为条件表示,再与生成过程结合,并把生成表示解码为像素。有些系统迭代变换噪声,有些系统预测视觉 Token。Provider 还可能在返回图像前改写 Prompt、执行 Safety Policy、对候选结果排序或加入其他控制条件。

相同 Prompt 和 Seed 一定能复现同一张图吗?

不一定。Seed 只控制一部分随机性,Model 或 Checkpoint Revision、Prompt Rewrite、Text Encoder、Scheduler、Step Count、Precision、Library Version、Hardware、Kernel 与 Safety Policy 变化都可能改变结果。可复现测试必须固定完整生成身份,并在声明的容差内比较。

应该如何评测文生图质量?

使用版本化 Prompt Suite 并运行多个 Seed,分别测量 Prompt Alignment、对象、数量、颜色、空间关系、属性绑定、文字渲染、身份一致性、视觉缺陷、Diversity、安全、Latency 与 Cost。自动指标和 VLM Judge 必须用任务特定人工标签校准,不能压缩成一个通用总分。

Watermark 或 Content Credentials 能证明生成图像可信安全吗?

不能。它们可以提供来源或编辑历史信号,但不能证明事实准确、获得本人同意、版权归属明确或使用场景安全。生产系统仍需执行输入权利检查、Privacy Control、身份仿冒和滥用策略、输出审核、人工复核、Retention 与 Incident Response。

相关工具

相关术语

相关文章