截至 2026 年 7 月 19 日: 图片模型名称、接口、价格、限制和许可证变化很快。本文提供的是评测方法,不是永久榜单。发布文章或做采购决策前,应核对供应商当前的模型卡、API Schema、价目表、服务条款和地区可用性。
核心要点
- “最好的图片模型”是依赖工作负载的结论,不是稳定事实。
- Benchmark 数字只有和完整 Harness、模型快照一起出现才有意义。
- 文字渲染、构图、编辑、安全、许可证和成本需要分开测试。
- 本地部署可能减少供应商传输或按量费用,但不会自动消除总运营成本和隐私义务。
- 生产选择要同时比较质量和失败恢复;好看的图片如果无法修正、追溯或删除,也可能不适合上线。
先定义工作负载,再谈模型名称
在查看供应商对比前,先写一份工作负载契约:
| 维度 | 示例证据 |
|---|---|
| 输出 | 宽高比、分辨率、格式、透明通道、静态/动画、生成/编辑 |
| Prompt | 语言、布局约束、文字、计数对象、负向约束 |
| 参考图 | 数量、使用权、身份/风格保持要求 |
| 审核 | 人工验收标准、升级路径、禁止内容 |
| 运营 | QPS、并发、超时、重试、幂等、存储和流量 |
| 治理 | 地域、保留期、训练使用、审计权限、许可证和署名 |
这样可以避免把创意预览产品、API 和自托管权重当成同一种产品比较。
建立固定版本的对比矩阵
不要从画风或延迟推断私有架构。只记录可观察行为及其证据来源:
| 字段 | 应记录 |
|---|---|
| 系统身份 | 供应商、模型 ID/权重、修订版、Endpoint 或产品套餐 |
| 能力 | 输入模态、图片尺寸、编辑操作、输出格式 |
| 限制 | 限流、并发、Prompt 长度、参考图数量、内容策略 |
| 许可证 | 代码、权重、输出、训练数据、托管条款、商标和再分发 |
| 数据处理 | 地域、保留、训练使用、删除路径、子处理者 |
| 证据 | 模型卡、API Schema、条款、价目表、实测 Fixture、访问日期 |
Midjourney、Flux、GPT Image 或 Seedream 等名称可以帮助检索,但名称本身不能确定稳定的模型版本、许可证或能力集合。
可复现的质量 Harness
使用小型、版本化的 Fixture 集,而不是一张展示图。至少覆盖:
- 构图:对象计数、相对位置、遮挡、景深和负向约束。
- 文字:多语言、标点、换行、小字号标签和旋转文字。
- 参考图:身份、配色、姿势、产品几何和受控风格变化。
- 编辑:蒙版边界、背景替换、扩图和连续编辑。
- 安全与拒答:良性边界、禁止请求和误拒答复核。
- 鲁棒性:改写 Prompt、种子变化、长 Prompt、重试和暂时性故障。
保存 Prompt、可用时的种子、输入 Hash、模型修订、参数、输出 Hash、延迟时间戳、错误类别和评测标准。原始素材应存放在经过批准的位置,并设置访问与保留控制。
为什么不能只看标题分数
FID 衡量特定设置下的分布相似性;CLIP 类分数依赖编码器和 Prompt;偏好率依赖采样、评审指令和比较集合。它们都不能直接衡量品牌一致性、法律安全、文字正确性或可编辑性。发布分数时应同时给出数据集修订、分辨率、采样器、种子策略、评测器、不确定性和日期。
把文字与布局分开评测
对带文字的图片,分别测量精确字符串匹配、字符错误率、行序、文字框重叠和目标显示尺寸下的可读性。人工“看起来正确”应与 OCR 结果分开报告。每种语言和文字方向都要有样本,不能把英文结果直接外推到中文、阿拉伯文或混合脚本。
布局可以使用结构化评分:
composition_score =
weighted(object_count, relative_position, text_legibility, edit_boundary)
权重是项目决策,不是通用 Benchmark。应使用已接受和已拒绝的样本校准权重,并报告评测者之间的分歧。
编辑、安全与来源
生产流程不只有第一次生成质量。还应测试系统是否:
- 在编辑小区域时保持主体身份和未编辑区域;
- 在生成和编辑路径中一致地执行审核与拒答;
- 在下载、转换和再次上传时保留或清除元数据;
- 支持删除、访问复核和事件调查;
- 为参考图和输出提供清晰的来源与许可证路径。
生成图片、用户参考图、检索资产和模型元数据都应视为不可信输入。授权和内容策略必须在服务边界执行,Prompt 或界面选项不是安全控制。
成本与延迟:测量完整工作流
用带日期的成本台账替代静态“单张价格表”:
total_cost =
provider_or_compute
+ retries_and_failed_jobs
+ storage_and_egress
+ moderation_and_review
+ engineering_and_operations
+ hardware_amortization
每次运行记录首个结果时间、端到端延迟、吞吐、并发、排队时间、分辨率、质量设置、重试和失败类别。本地权重可以没有供应商单价,但在利用率低或人工复核多时总成本可能更高;订阅在一个工作流中便宜,也可能不适合自动化批处理。
本地、托管和 API 的取舍
| 部署方式 | 优势 | 必须核对 |
|---|---|---|
| 托管应用 | 快速探索,通常带编辑器 | 保留、训练使用、导出、席位、地域和自动化限制 |
| 托管 API | 易自动化,有版本化请求和用量遥测 | Schema 稳定性、价目表、重试、数据处理、审核和 SLA |
| 本地或私有运行时 | 可控制网络路径和运行环境 | 权重许可证、显存、Kernel、更新、安全、能耗和支持 |
“开源”不能代替阅读确切的权重许可证。权重、代码、适配器、输出和训练数据可能分别适用不同条款。
把测量结果变成可审查的决策
决策记录至少应包含:
- 工作负载契约和代表性 Fixture 集。
- 固定的系统、日期、参数和失败样本。
- 质量、文字、编辑、安全、延迟、成本、隐私和许可证结果。
- 不确定性、评测器校准,以及 Prompt/种子变化的敏感性。
- 模型、价格、策略或合同变化时的回滚路径和重新评测触发条件。
使用“在这个文字切片上通过”“在这个并发下达到延迟目标”等条件化表述,不要在没有边界的情况下写“最佳”或“生产就绪”。
总结
图片模型选型最持久的能力不是记住一张榜单,而是建立一个固定版本、可重复、能暴露取舍的实验,并保护用户数据和权利。模型或合同发生变化后可以重新运行同一方法,这比未经来源支持的分数、固定价格或普适推荐更可辩护。