什么是 文本生成视频(Text-to-Video)?

文本生成视频(Text-to-Video)是一类把自然语言 Prompt 及可选控制条件映射为合成帧序列的生成式 AI 任务,画面内容及其随时间发生的变化由模型联合生成。

快速了解

创建时间2022 年(早期研究),2024-2026 年(生产系统)

工作原理

文本生成视频描述的是输入输出任务,不等同于某种架构、产品或通用 Prompt 语法。纯文生视频只接收文本和系统默认值;加入参考图片、源视频、Mask、Pose、Depth Map、身份素材、首尾帧、Camera Path 或音轨后,任务会变成可控视频生成、Image-to-Video、Video-to-Video、插帧、编辑或其他多模态流程。通过脚本、数字人及库存素材编排成片也不是同一个生成任务。音频并非文生视频的必备输出,联合生成同步声音属于独立能力。

系统通常先编码 Prompt,再以 Pixel、连续 Latent Patch 或离散 Visual Token 表示视频,完成条件生成后解码为帧序列。生成器可以采用 3D U-Net、Diffusion Transformer、Flow Matching、自回归或 Masked-token Transformer,也可以组合多种训练目标。Spatial/Temporal Attention、卷积、压缩、超分辨率、插帧和后处理的组合因实现而异,都不是任务定义的必要条件。

视频比单张图片多出时间轴。某一帧视觉合理,并不能证明主体身份、物体数量、属性、光照、Camera Motion、动作顺序、因果关系或几何结构能在整个序列中保持一致。常见失败包括 Flicker、Identity Drift、Motion Collapse、物体重复或消失、镜头运动与主体运动混淆、人体结构异常、画面文字不可读、动作逆序、接触关系不合理,以及长时序延展中的重复。即使每个局部片段看起来可信,自回归续写或多镜头拼接仍可能累积误差。

可复现的生成记录应绑定 Model ID 与不可变 Model Revision,文本、视频和音频 Encoder 或 Tokenizer Revision,原始 Prompt 与服务端改写后的 Effective Prompt,模型支持时的 Negative Prompt,Seed 或 Random State,Sampler 或 Scheduler,Step Count 与 Guidance Policy,Frame Count、FPS、Duration、Resolution、Aspect Ratio、Precision、Runtime、Kernel 与 Hardware,所有控制素材的 Hash 与 License,后处理、插帧、Upscaling、Codec 与 Audio 设置,Safety Policy Revision,以及最终 Asset Hash。只记录相同 Prompt 和 Seed 不能保证输出一致,以上任一字段、服务端改写、非确定性 Kernel 或审核策略变化都可能改变结果。

评测必须把单帧视觉质量、Prompt Alignment 和时序行为分开。版本化 Prompt Suite 应覆盖主体与背景一致性、物体数量、颜色与属性绑定、动作顺序、运动幅度与平滑度、Camera Control、闪烁、转场、物理与常识、人体结构、画面文字、Diversity,以及生成音频时的 Audio-Video Sync。生产验收还要测量安全性、Latency、Cost、失败与重试率、编码完整性和 Accessibility。FVD、CLIP 类相似度、单个 VLM Judge、单个 Seed 或单一排行榜总分都不能证明具体业务可用;应组合多个 Seed、任务级 Acceptance Rule、校准后的自动指标、对抗切片与 Human Review。

生产使用还需要核验 Training Data Provenance 与 License、输入素材权利、肖像与声音 Consent、Privacy 与 Retention、未成年人保护、Impersonation 与误导语境风险、Harmful Bias、生成前后审核、披露、升级处置和 Incident Response。Watermark 与 C2PA Content Credentials 可以携带 Provenance 信号,但不能证明事实准确、获得同意、拥有版权或上下文安全;缺少 Provenance 也不能证明内容由人类创作。只有权利、策略、时序质量和预期语义通过对应场景要求的审查后,生成片段才应进入发布流程。

主要特点

  • 任务而非架构 — Diffusion、Flow Matching、离散 Visual Token、自回归与混合目标都可以实现文生视频
  • 时空联合生成 — 模型需要同时表示帧内外观与跨帧变化,而不是独立合成多张图片
  • 控制条件改变任务 — 参考素材、Mask、Keyframe、Camera Path 或源视频会形成可控生成或编辑流程
  • 控制项依赖模型 — Frame Count、FPS、Guidance、Negative Prompt、Camera 语法、Duration 与 Audio 支持都不是通用保证
  • 时序失败面 — Identity Drift、Flicker、动作顺序错误、Motion Collapse 与长时序重复可能和精美单帧同时出现
  • 媒体治理契约 — 生成身份、权利、Consent、内容审核、Provenance 与 Human Approval 都属于生产边界

常见用途

  1. 影视预可视化 — 在投入拍摄资源前探索构图、主体运动、光照与镜头语言
  2. 合成 B-roll 与概念素材 — 在不要求精确身份、真实事件或产品声明时生成可审查候选片段
  3. 广告创意原型 — 快速测试方向,同时把品牌、权利、披露与人工批准门禁放在模型之外
  4. 教育与模拟草稿 — 生成明确标注的场景示意,并单独核验事实与物理正确性
  5. 游戏与动画构思 — 在确定性制作与连续性处理前原型化环境、动作、转场或 Cutscene 节点

示例

loading...
Loading code...

常见问题

文生视频与图生视频、视频编辑有什么区别?

纯文生视频只从文本和系统默认值推导画面与运动;图生视频使用输入图片锚定视觉内容,Video-to-Video 与编辑则转换已有视频、Mask、Motion 或结构。一个产品可以同时提供这些模式,但它们的输入、可复现记录、权利核验和评测标准并不相同。

相同 Prompt 和 Seed 能复现同一段视频吗?

不能只依赖这两个字段。复现还取决于不可变的 Model 与 Tokenizer Revision、改写后的 Effective Prompt、Scheduler、Steps、Guidance、Frame Count、FPS、Resolution、Precision、Runtime、Kernel、Hardware、控制素材、后处理和 Safety Policy。即使可见配置相同,部分加速或分布式 Kernel 仍可能是非确定性的。

应该如何评测文生视频模型?

应使用版本化 Prompt Suite 与多个 Seed,分别评测视觉质量、Prompt Alignment、物体与属性绑定、动作顺序、主体和背景一致性、运动、Flicker、Camera Control、物理与常识,并在适用时检查音画同步;再加入安全、Latency、Cost、失败率与 Human Review。FVD、文本视频相似度或单个 Judge 无法覆盖全部维度。

文生视频模型能理解物理规律并保持长视频一致吗?

模型学习的是外观与运动的统计模式,不是保证正确的 Physics Simulator 或 Narrative State Machine。片段可能视觉可信,却违反 Object Permanence、Causality、Contact、人体结构或动作顺序。自回归延展与多镜头拼接会放大 Identity Drift、重复和连续性错误,因此长输出必须做分段与端到端审查。

发布 AI 生成视频前需要哪些控制?

需要核验训练与输入素材权利、肖像和声音 Consent、Privacy、Retention、未成年人保护、Impersonation 风险与使用语境;审核 Prompt、控制素材、画面、动作、文字和音频;保存 Asset Hash 与生成记录;在支持时附加 Provenance,并为高影响用途设置人工批准。C2PA 或 Watermark 记录的是信号,不代表真实、同意、版权或安全。

相关术语

相关文章