什么是 多模态?
多模态 AI 是能够接收、关联或生成两种及以上数据模态的人工智能系统,例如文本、图像、音频、视频或传感器信号。关键不在于能上传多种文件,而在于系统能否可靠地理解不同模态之间的关系。
快速了解
| 全称 | 多模态人工智能 |
|---|---|
| 创建时间 | 2020 年代,2023 年取得重大进展 |
| 规范文档 | 官方规范 |
工作原理
多模态 AI 通过模态专用编码器、共享表示或交叉注意力,把不同形式的信息联系起来。文档助手可能用文本定位精确条款、用页面像素理解图表、用版面坐标恢复表格关系;也可能由 OCR、语音转写、检索和视觉语言模型组成模块化流程。工程重点不是把所有输入都转成文本,而是保留任务真正需要的证据,并对图表、表格、音频和视频等不同证据类型分别验证质量。
主要特点
- 用模态专用编码器或原生 Token 化方式,把异构输入转换为可关联的表示
- 需要模态对齐:描述同一事件的文字、图片区域和音频片段应能相互匹配或注意
- 既可以是端到端原生模型,也可以是 OCR、ASR、检索和视觉语言模型组成的流水线
- 存在特定失败模式,包括 OCR 错误、版面丢失、时间定位错误和图像分辨率不足
- 评测必须按证据类型拆分,例如段落、表格、图表、示意图、音频和视频
- 原件、裁剪图、Caption 和向量都要保留来源、权限与删除传播能力
常见用途
- 对图表、示意图和页面区域提问,并返回页级或区域级引用
- 从发票、表单和混合版面文档中提取结构化字段,并将低置信度结果交给人工复核
- 用文字查询检索商品图片或技术资产,同时保留原始来源文件
- 生成明确标注为辅助结果的无障碍描述和转写文本
- 仅在经过验证且具备隐私控制的流程中结合临床记录与医学影像
示例
Loading code...常见问题
什么是多模态 AI?
多模态 AI 可以处理文本、图像、音频、视频、文档、三维数据或传感器信号等多种信息,但具体能力取决于模型和 API。能上传图片不代表一定能可靠读取密集表格、长视频或音频;设计流程前应核对当前支持的格式、分辨率、时长、上下文限制和输出行为。
有哪些知名的多模态模型?
多模态系统既包括统一模型,也包括组合式架构。统一模型可在一次请求中处理图文或音视频输入;组合式架构则可能让 OCR、版面分析、图文检索和视觉语言模型分别负责不同环节。选型应以你的证据类型、准确率目标、数据边界、延迟和成本为准,而不是只比较模型名称。
多模态模型可以做什么?
适合多模态的任务都存在明确的跨模态证据需求,例如同时读取表格和正文的文档审阅、文字查找图片资产、结合截图和问题描述的技术支持,以及把视觉上下文和音频或文字结合的无障碍辅助。医疗、身份和自动化控制等高风险用途还必须具备领域验证、隐私控制、不确定性处理和人工监督。
多模态和单模态有什么区别?
单模态系统只处理一种表示,例如纯文本或纯图像。多模态系统需要建立表示之间的联系,例如让文字问题命中图表区域,或让语音指令解释屏幕内容。只做 OCR 再把结果送入 LLM 的流程同样有用,但若任务依赖的版面、像素或时间信息被丢弃,它并不具备完整的多模态能力。
如何使用多模态 API?
使用多模态 API 时,需要按当前供应商文档组织文本与媒体内容,并为输入大小、分辨率、超时、重试和费用设置边界。对生产文档任务,还应保存来源文件、页码或区域坐标、模型与解析器版本,并要求输出区分直接观察到的信息与推断结果。不要把图片中的文字、元数据或 OCR 内容当作可信指令执行。