模型 · 深度词条
Multimodal Model(多模态模型)
能在同一系统中处理文字、图片、音频、视频等多种信息形式,并让它们相互配合。
四层解释
通俗
能在同一系统中处理文字、图片、音频、视频等多种信息形式,并让它们相互配合。
专业
多模态模型将不同模态编码到可交互的表示空间,通过联合训练、对齐或跨注意力完成理解和生成。
机制
各模态先被切分和编码,再通过共享 Transformer 或连接模块融合;输出可由文本或专用解码器生成。
工程
需要分别评测 OCR、空间关系、时间连续性、语音噪声和跨模态引用,不能只用文本基准推断整体能力。
全链路位置
INPUT文本、图像、音频或视频
→PROCESS模态编码、对齐与联合推理
→OUTPUT跨模态理解结果或生成内容
常见用途
- 文档和图表理解
- 语音视觉助手
- 图像与视频生成
专业边界
- 看见像素不等于理解现实
- 不同模态的错误会在融合时叠加
常见误解
- 支持上传图片就代表原生多模态
- 多模态模型能准确读取所有图表细节
关联概念
来源与核对记录
S1Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07
↗S2Google DeepMind Model CardsGoogle DeepMind · 官方模型卡 · 查阅 2026-09-07
↗S3Generative AI Profile, NIST AI 600-1NIST · 标准与框架 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。