截至 2026 年 7 月 19 日: 视频模型名称、能力、限制、价格和条款变化很快。本文提供的是对比协议,不是永久榜单。采购或发布前,应固定供应商、模型或产品修订版、Endpoint、地区、套餐、访问日期,并为每项结论保留来源。

核心要点

  • “最好的视频模型”是工作负载相关结论,不是稳定的市场事实。
  • 时序连贯、音频、参考控制、编辑、版权、安全和成本需要分别测试。
  • 最大时长或分辨率只有和 Endpoint 及其条件一起记录才有意义。
  • 公开输出行为不能揭示私有架构。
  • 应优化“可验收镜头率”和可恢复工作流,而不是生成尝试次数。

先定义生产工作负载

在比较 Seedance、Sora、Veo 或其他系统前,先写工作负载契约:

维度 应记录的证据
镜头 时长、画幅、分辨率、帧率、运镜
内容 对象计数、动作、对白、字幕、品牌元素
参考素材 图片、身份、产品、场景、使用权和保留
音频 环境音、音乐、语音、语言、时间对齐和授权
审核 验收标准、禁止内容、人工升级
交付 API 或应用、队列目标、存储、编码和流量
治理 地区、训练使用、删除、署名、肖像和合同

这样可以把创意应用、生产 API 和私有工作流分开,即使它们使用相近的品牌名称。

建立固定版本的证据矩阵

字段 应记录
身份 供应商、模型 ID/修订版、套餐、Endpoint、地区、访问日期
能力 支持的时长、尺寸、画幅、参考素材、音频和编辑
限制 限流、并发、队列、Prompt、文件大小和审核行为
商务条款 价目表、额度、超额、货币、税费和批处理规则
权利 输入许可、输出条款、肖像、署名和训练使用
证据 模型卡、API Schema、服务条款、实测 Fixture、变更日志

不要把供应商营销标签转换成技术事实。如果来源没有说明上限,应写“未公开规定”,并在实际允许的接口上测量。

评估时序连贯,而不是只看单帧

Fixture 至少包含:

  1. 一个主体经过运镜、遮挡和镜头变化的连续动作。
  2. 带对象计数和空间关系的多对象场景。
  3. 手、脸、布料、烟雾、液体、反射和接触点。
  4. 跨镜头、跨编辑保持一致的角色或产品。
  5. 长 Prompt、改写、种子变化、重试和失败任务。

使用评分表分别记录身份保持、动作完成、空间一致、物理合理、文字稳定和异常伪影,并报告评测者分歧与分母。没有 Fixture 和评分规则的星级只是观点,不是 Benchmark。

音频、参考素材与编辑

音频应独立评测:

  • 语音、口型、音效和镜头变化的时间对齐;
  • 语言、发音、音乐权利和替换能力;
  • 音频是原生生成、同步生成还是后期添加;
  • 音频生成失败或被审核时的降级行为。

对参考素材记录确切接口接受的数量和类型、身份漂移、产品几何变化,以及上传来源的使用权。编辑测试应覆盖蒙版、扩图、镜头延长、重新编码和连续编辑。一次生成成功不能证明多镜头工作流稳定。

安全、版权与来源

Prompt、参考图、生成视频、元数据和检索资产都应视为不可信输入。测试:

  • 字幕或参考媒体中的 Prompt Injection;
  • 人脸和声音的同意与肖像控制;
  • 版权音乐、Logo 和第三方视频;
  • 生成、编辑、下载和再次上传路径中的审核一致性;
  • 元数据保留、来源追踪、删除和事件调查。

商用权取决于当前条款和用户输入,不取决于模型声誉。标识义务随法域和服务角色变化;没有具体规则来源时,不要声称所有平台或所有输出都必须采用同一种水印。

成本与延迟:核算完整工作流

使用带日期的账本:

text
cost_per_accepted_shot =
  (generation + retries + failed_jobs + audio
   + storage + egress + moderation + human_review)
  / accepted_shots

记录首个预览时间、端到端完成时间、排队延迟、并发、重试、审核结果、存储时长、编码和交付。低廉的每秒价格在可验收率低或复核成本高时可能失去优势。订阅额度、API 计费和地区税费应分开建模。

比较部署方式

方式 优势 必须核对
托管应用 快速创作迭代 导出、保留、席位、自动化、地区和权利
托管 API 易自动化,有用量遥测 Schema、价目表、队列、重试、数据处理、SLA
私有流水线 可控制网络和工作流 模型许可证、硬件、运行时、安全、更新和支持

不要把私有或开放权重流水线自动理解为免费、安全或不受限制商用。硬件、能耗、存储、工程、监控和许可证审核都属于决策成本。

可执行的评测 Harness

text
for system in pinned_systems:
    outputs = run_fixture(system, manifest)
    score_temporal_and_audio(outputs)
    score_references_and_edits(outputs)
    record_policy_latency_cost_and_failures(outputs)
    review_rights_privacy_and_deletion(system)

Manifest 应包含 Prompt、输入 Hash、获准素材、参数、模型修订、评测器版本和保留策略。原始媒体应存放在获准位置,遥测中的身份信息应脱敏或 Hash。

决策门禁

  1. 适用性:确认地区、角色、权利、政策和合同。
  2. 基线:对固定版本系统运行相同 Fixture 和评分规则。
  3. 试点:测试代表性流量、重试、队列、复核和导出。
  4. 发布:定义可验收率、预算、事件路径和回滚。
  5. 复核:模型、套餐、Endpoint、政策或地区变化后重新评测。

总结

AI 视频选型的持久能力不是记住哪家“获胜”,而是建立一个固定版本的实验,让时序失败、音频取舍、权利、隐私、成本和恢复路径可见。当供应商更换模型名称、接口、价格或可用地区时,这套方法仍然可以复用。

待读者核验的来源