模型 · 深度词条

Multimodal Model(多模态模型)

能在同一系统中处理文字、图片、音频、视频等多种信息形式,并让它们相互配合。

深度词条核对 2026-09-073 条来源

四层解释

通俗

能在同一系统中处理文字、图片、音频、视频等多种信息形式,并让它们相互配合。

专业

多模态模型将不同模态编码到可交互的表示空间,通过联合训练、对齐或跨注意力完成理解和生成。

机制

各模态先被切分和编码,再通过共享 Transformer 或连接模块融合;输出可由文本或专用解码器生成。

工程

需要分别评测 OCR、空间关系、时间连续性、语音噪声和跨模态引用,不能只用文本基准推断整体能力。

全链路位置

INPUT文本、图像、音频或视频
PROCESS模态编码、对齐与联合推理
OUTPUT跨模态理解结果或生成内容

常见用途

  • 文档和图表理解
  • 语音视觉助手
  • 图像与视频生成

专业边界

  • 看见像素不等于理解现实
  • 不同模态的错误会在融合时叠加

常见误解

  • 支持上传图片就代表原生多模态
  • 多模态模型能准确读取所有图表细节

关联概念

来源与核对记录

S1
Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07
S2
Google DeepMind Model CardsGoogle DeepMind · 官方模型卡 · 查阅 2026-09-07
S3
Generative AI Profile, NIST AI 600-1NIST · 标准与框架 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。