截至 2026 年 7 月 19 日: 图片模型名称、接口、价格、限制和许可证变化很快。本文提供的是评测方法,不是永久榜单。发布文章或做采购决策前,应核对供应商当前的模型卡、API Schema、价目表、服务条款和地区可用性。

核心要点

  • “最好的图片模型”是依赖工作负载的结论,不是稳定事实。
  • Benchmark 数字只有和完整 Harness、模型快照一起出现才有意义。
  • 文字渲染、构图、编辑、安全、许可证和成本需要分开测试。
  • 本地部署可能减少供应商传输或按量费用,但不会自动消除总运营成本和隐私义务。
  • 生产选择要同时比较质量和失败恢复;好看的图片如果无法修正、追溯或删除,也可能不适合上线。

先定义工作负载,再谈模型名称

在查看供应商对比前,先写一份工作负载契约:

维度 示例证据
输出 宽高比、分辨率、格式、透明通道、静态/动画、生成/编辑
Prompt 语言、布局约束、文字、计数对象、负向约束
参考图 数量、使用权、身份/风格保持要求
审核 人工验收标准、升级路径、禁止内容
运营 QPS、并发、超时、重试、幂等、存储和流量
治理 地域、保留期、训练使用、审计权限、许可证和署名

这样可以避免把创意预览产品、API 和自托管权重当成同一种产品比较。

建立固定版本的对比矩阵

不要从画风或延迟推断私有架构。只记录可观察行为及其证据来源:

字段 应记录
系统身份 供应商、模型 ID/权重、修订版、Endpoint 或产品套餐
能力 输入模态、图片尺寸、编辑操作、输出格式
限制 限流、并发、Prompt 长度、参考图数量、内容策略
许可证 代码、权重、输出、训练数据、托管条款、商标和再分发
数据处理 地域、保留、训练使用、删除路径、子处理者
证据 模型卡、API Schema、条款、价目表、实测 Fixture、访问日期

Midjourney、Flux、GPT Image 或 Seedream 等名称可以帮助检索,但名称本身不能确定稳定的模型版本、许可证或能力集合。

可复现的质量 Harness

使用小型、版本化的 Fixture 集,而不是一张展示图。至少覆盖:

  1. 构图:对象计数、相对位置、遮挡、景深和负向约束。
  2. 文字:多语言、标点、换行、小字号标签和旋转文字。
  3. 参考图:身份、配色、姿势、产品几何和受控风格变化。
  4. 编辑:蒙版边界、背景替换、扩图和连续编辑。
  5. 安全与拒答:良性边界、禁止请求和误拒答复核。
  6. 鲁棒性:改写 Prompt、种子变化、长 Prompt、重试和暂时性故障。

保存 Prompt、可用时的种子、输入 Hash、模型修订、参数、输出 Hash、延迟时间戳、错误类别和评测标准。原始素材应存放在经过批准的位置,并设置访问与保留控制。

为什么不能只看标题分数

FID 衡量特定设置下的分布相似性;CLIP 类分数依赖编码器和 Prompt;偏好率依赖采样、评审指令和比较集合。它们都不能直接衡量品牌一致性、法律安全、文字正确性或可编辑性。发布分数时应同时给出数据集修订、分辨率、采样器、种子策略、评测器、不确定性和日期。

把文字与布局分开评测

对带文字的图片,分别测量精确字符串匹配、字符错误率、行序、文字框重叠和目标显示尺寸下的可读性。人工“看起来正确”应与 OCR 结果分开报告。每种语言和文字方向都要有样本,不能把英文结果直接外推到中文、阿拉伯文或混合脚本。

布局可以使用结构化评分:

text
composition_score =
  weighted(object_count, relative_position, text_legibility, edit_boundary)

权重是项目决策,不是通用 Benchmark。应使用已接受和已拒绝的样本校准权重,并报告评测者之间的分歧。

编辑、安全与来源

生产流程不只有第一次生成质量。还应测试系统是否:

  • 在编辑小区域时保持主体身份和未编辑区域;
  • 在生成和编辑路径中一致地执行审核与拒答;
  • 在下载、转换和再次上传时保留或清除元数据;
  • 支持删除、访问复核和事件调查;
  • 为参考图和输出提供清晰的来源与许可证路径。

生成图片、用户参考图、检索资产和模型元数据都应视为不可信输入。授权和内容策略必须在服务边界执行,Prompt 或界面选项不是安全控制。

成本与延迟:测量完整工作流

用带日期的成本台账替代静态“单张价格表”:

text
total_cost =
  provider_or_compute
  + retries_and_failed_jobs
  + storage_and_egress
  + moderation_and_review
  + engineering_and_operations
  + hardware_amortization

每次运行记录首个结果时间、端到端延迟、吞吐、并发、排队时间、分辨率、质量设置、重试和失败类别。本地权重可以没有供应商单价,但在利用率低或人工复核多时总成本可能更高;订阅在一个工作流中便宜,也可能不适合自动化批处理。

本地、托管和 API 的取舍

部署方式 优势 必须核对
托管应用 快速探索,通常带编辑器 保留、训练使用、导出、席位、地域和自动化限制
托管 API 易自动化,有版本化请求和用量遥测 Schema 稳定性、价目表、重试、数据处理、审核和 SLA
本地或私有运行时 可控制网络路径和运行环境 权重许可证、显存、Kernel、更新、安全、能耗和支持

“开源”不能代替阅读确切的权重许可证。权重、代码、适配器、输出和训练数据可能分别适用不同条款。

把测量结果变成可审查的决策

决策记录至少应包含:

  1. 工作负载契约和代表性 Fixture 集。
  2. 固定的系统、日期、参数和失败样本。
  3. 质量、文字、编辑、安全、延迟、成本、隐私和许可证结果。
  4. 不确定性、评测器校准,以及 Prompt/种子变化的敏感性。
  5. 模型、价格、策略或合同变化时的回滚路径和重新评测触发条件。

使用“在这个文字切片上通过”“在这个并发下达到延迟目标”等条件化表述,不要在没有边界的情况下写“最佳”或“生产就绪”。

总结

图片模型选型最持久的能力不是记住一张榜单,而是建立一个固定版本、可重复、能暴露取舍的实验,并保护用户数据和权利。模型或合同发生变化后可以重新运行同一方法,这比未经来源支持的分数、固定价格或普适推荐更可辩护。

待读者核验的来源