截至 2026 年 7 月 19 日: 视频模型名称、能力、限制、价格和条款变化很快。本文提供的是对比协议,不是永久榜单。采购或发布前,应固定供应商、模型或产品修订版、Endpoint、地区、套餐、访问日期,并为每项结论保留来源。
核心要点
- “最好的视频模型”是工作负载相关结论,不是稳定的市场事实。
- 时序连贯、音频、参考控制、编辑、版权、安全和成本需要分别测试。
- 最大时长或分辨率只有和 Endpoint 及其条件一起记录才有意义。
- 公开输出行为不能揭示私有架构。
- 应优化“可验收镜头率”和可恢复工作流,而不是生成尝试次数。
先定义生产工作负载
在比较 Seedance、Sora、Veo 或其他系统前,先写工作负载契约:
| 维度 | 应记录的证据 |
|---|---|
| 镜头 | 时长、画幅、分辨率、帧率、运镜 |
| 内容 | 对象计数、动作、对白、字幕、品牌元素 |
| 参考素材 | 图片、身份、产品、场景、使用权和保留 |
| 音频 | 环境音、音乐、语音、语言、时间对齐和授权 |
| 审核 | 验收标准、禁止内容、人工升级 |
| 交付 | API 或应用、队列目标、存储、编码和流量 |
| 治理 | 地区、训练使用、删除、署名、肖像和合同 |
这样可以把创意应用、生产 API 和私有工作流分开,即使它们使用相近的品牌名称。
建立固定版本的证据矩阵
| 字段 | 应记录 |
|---|---|
| 身份 | 供应商、模型 ID/修订版、套餐、Endpoint、地区、访问日期 |
| 能力 | 支持的时长、尺寸、画幅、参考素材、音频和编辑 |
| 限制 | 限流、并发、队列、Prompt、文件大小和审核行为 |
| 商务条款 | 价目表、额度、超额、货币、税费和批处理规则 |
| 权利 | 输入许可、输出条款、肖像、署名和训练使用 |
| 证据 | 模型卡、API Schema、服务条款、实测 Fixture、变更日志 |
不要把供应商营销标签转换成技术事实。如果来源没有说明上限,应写“未公开规定”,并在实际允许的接口上测量。
评估时序连贯,而不是只看单帧
Fixture 至少包含:
- 一个主体经过运镜、遮挡和镜头变化的连续动作。
- 带对象计数和空间关系的多对象场景。
- 手、脸、布料、烟雾、液体、反射和接触点。
- 跨镜头、跨编辑保持一致的角色或产品。
- 长 Prompt、改写、种子变化、重试和失败任务。
使用评分表分别记录身份保持、动作完成、空间一致、物理合理、文字稳定和异常伪影,并报告评测者分歧与分母。没有 Fixture 和评分规则的星级只是观点,不是 Benchmark。
音频、参考素材与编辑
音频应独立评测:
- 语音、口型、音效和镜头变化的时间对齐;
- 语言、发音、音乐权利和替换能力;
- 音频是原生生成、同步生成还是后期添加;
- 音频生成失败或被审核时的降级行为。
对参考素材记录确切接口接受的数量和类型、身份漂移、产品几何变化,以及上传来源的使用权。编辑测试应覆盖蒙版、扩图、镜头延长、重新编码和连续编辑。一次生成成功不能证明多镜头工作流稳定。
安全、版权与来源
Prompt、参考图、生成视频、元数据和检索资产都应视为不可信输入。测试:
- 字幕或参考媒体中的 Prompt Injection;
- 人脸和声音的同意与肖像控制;
- 版权音乐、Logo 和第三方视频;
- 生成、编辑、下载和再次上传路径中的审核一致性;
- 元数据保留、来源追踪、删除和事件调查。
商用权取决于当前条款和用户输入,不取决于模型声誉。标识义务随法域和服务角色变化;没有具体规则来源时,不要声称所有平台或所有输出都必须采用同一种水印。
成本与延迟:核算完整工作流
使用带日期的账本:
cost_per_accepted_shot =
(generation + retries + failed_jobs + audio
+ storage + egress + moderation + human_review)
/ accepted_shots
记录首个预览时间、端到端完成时间、排队延迟、并发、重试、审核结果、存储时长、编码和交付。低廉的每秒价格在可验收率低或复核成本高时可能失去优势。订阅额度、API 计费和地区税费应分开建模。
比较部署方式
| 方式 | 优势 | 必须核对 |
|---|---|---|
| 托管应用 | 快速创作迭代 | 导出、保留、席位、自动化、地区和权利 |
| 托管 API | 易自动化,有用量遥测 | Schema、价目表、队列、重试、数据处理、SLA |
| 私有流水线 | 可控制网络和工作流 | 模型许可证、硬件、运行时、安全、更新和支持 |
不要把私有或开放权重流水线自动理解为免费、安全或不受限制商用。硬件、能耗、存储、工程、监控和许可证审核都属于决策成本。
可执行的评测 Harness
for system in pinned_systems:
outputs = run_fixture(system, manifest)
score_temporal_and_audio(outputs)
score_references_and_edits(outputs)
record_policy_latency_cost_and_failures(outputs)
review_rights_privacy_and_deletion(system)
Manifest 应包含 Prompt、输入 Hash、获准素材、参数、模型修订、评测器版本和保留策略。原始媒体应存放在获准位置,遥测中的身份信息应脱敏或 Hash。
决策门禁
- 适用性:确认地区、角色、权利、政策和合同。
- 基线:对固定版本系统运行相同 Fixture 和评分规则。
- 试点:测试代表性流量、重试、队列、复核和导出。
- 发布:定义可验收率、预算、事件路径和回滚。
- 复核:模型、套餐、Endpoint、政策或地区变化后重新评测。
总结
AI 视频选型的持久能力不是记住哪家“获胜”,而是建立一个固定版本的实验,让时序失败、音频取舍、权利、隐私、成本和恢复路径可见。当供应商更换模型名称、接口、价格或可用地区时,这套方法仍然可以复用。