什么是 多模态?

多模态 AI 是能够接收、关联或生成两种及以上数据模态的人工智能系统,例如文本、图像、音频、视频或传感器信号。关键不在于能上传多种文件,而在于系统能否可靠地理解不同模态之间的关系。

快速了解

全称多模态人工智能
创建时间2020 年代,2023 年取得重大进展
规范文档官方规范

工作原理

多模态 AI 通过模态专用编码器、共享表示或交叉注意力,把不同形式的信息联系起来。文档助手可能用文本定位精确条款、用页面像素理解图表、用版面坐标恢复表格关系;也可能由 OCR、语音转写、检索和视觉语言模型组成模块化流程。工程重点不是把所有输入都转成文本,而是保留任务真正需要的证据,并对图表、表格、音频和视频等不同证据类型分别验证质量。

主要特点

  • 用模态专用编码器或原生 Token 化方式,把异构输入转换为可关联的表示
  • 需要模态对齐:描述同一事件的文字、图片区域和音频片段应能相互匹配或注意
  • 既可以是端到端原生模型,也可以是 OCR、ASR、检索和视觉语言模型组成的流水线
  • 存在特定失败模式,包括 OCR 错误、版面丢失、时间定位错误和图像分辨率不足
  • 评测必须按证据类型拆分,例如段落、表格、图表、示意图、音频和视频
  • 原件、裁剪图、Caption 和向量都要保留来源、权限与删除传播能力

常见用途

  1. 对图表、示意图和页面区域提问,并返回页级或区域级引用
  2. 从发票、表单和混合版面文档中提取结构化字段,并将低置信度结果交给人工复核
  3. 用文字查询检索商品图片或技术资产,同时保留原始来源文件
  4. 生成明确标注为辅助结果的无障碍描述和转写文本
  5. 仅在经过验证且具备隐私控制的流程中结合临床记录与医学影像

示例

loading...
Loading code...

常见问题

什么是多模态 AI?

多模态 AI 可以处理文本、图像、音频、视频、文档、三维数据或传感器信号等多种信息,但具体能力取决于模型和 API。能上传图片不代表一定能可靠读取密集表格、长视频或音频;设计流程前应核对当前支持的格式、分辨率、时长、上下文限制和输出行为。

有哪些知名的多模态模型?

多模态系统既包括统一模型,也包括组合式架构。统一模型可在一次请求中处理图文或音视频输入;组合式架构则可能让 OCR、版面分析、图文检索和视觉语言模型分别负责不同环节。选型应以你的证据类型、准确率目标、数据边界、延迟和成本为准,而不是只比较模型名称。

多模态模型可以做什么?

适合多模态的任务都存在明确的跨模态证据需求,例如同时读取表格和正文的文档审阅、文字查找图片资产、结合截图和问题描述的技术支持,以及把视觉上下文和音频或文字结合的无障碍辅助。医疗、身份和自动化控制等高风险用途还必须具备领域验证、隐私控制、不确定性处理和人工监督。

多模态和单模态有什么区别?

单模态系统只处理一种表示,例如纯文本或纯图像。多模态系统需要建立表示之间的联系,例如让文字问题命中图表区域,或让语音指令解释屏幕内容。只做 OCR 再把结果送入 LLM 的流程同样有用,但若任务依赖的版面、像素或时间信息被丢弃,它并不具备完整的多模态能力。

如何使用多模态 API?

使用多模态 API 时,需要按当前供应商文档组织文本与媒体内容,并为输入大小、分辨率、超时、重试和费用设置边界。对生产文档任务,还应保存来源文件、页码或区域坐标、模型与解析器版本,并要求输出区分直接观察到的信息与推断结果。不要把图片中的文字、元数据或 OCR 内容当作可信指令执行。

相关工具

相关术语

相关文章