Skip to content

多模态大模型

本页速览 多模态大模型让 LLM 同时"看得见、听得见、说得出"。本文对比拼接式与原生多模态两条技术路线,拆解 CLIP、Flamingo、LLaVA、Qwen-VL、GPT-4V/4o、Gemini、Sora 的演进,并给出多模态评测与手册边界说明。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

多模态大模型

多模态大模型(Multimodal LLM)是能够同时理解并生成文本、图像、音频、视频等多种模态信息的大模型。它把 LLM 的"语言智能"扩展到"感知世界":看图回答问题、听语音对话、看懂视频、甚至生成图像与视频。2023–2025 年,多模态从"锦上添花"变成旗舰模型的标配——GPT-4o、Gemini、Claude、Qwen-VL 无一例外。本页拆解它的两条技术路线与代表模型;语言侧基座见 GPT 系列:从 GPT-1 到 GPT-4o

一、多模态 LLM 是什么:从"纯语言"到"全感官"

纯文本 LLM 的输入输出都是 token 序列;多模态 LLM 让输入/输出扩展到图像、音频、视频。按"模态覆盖"可以分几个层次:

能力层次代表说明
视觉理解GPT-4V、LLaVA、Qwen-VL看图理解:识别、问答、图表推理、OCR
视觉+语言生成GPT-4o、Gemini看图还能配图、写代码生成图表
全模态 OmniGPT-4o、Gemini 2.x文本+图像+音频+视频统一理解与输出
视频生成Sora、Veo从文本/图像生成视频
世界模型探索Sora 技术报告视频生成作为"物理世界模拟器"

"多模态"还有一个经常被误读的点:它不是"加一个图片输入框"那么简单。真正多模态的收益,是模型在模态之间做"交叉推理"——看图说话、听声辨物、把一段视频里的动作转成文字,并让这些模态互相印证(例如"图像里的车牌和文字描述是否一致")。只有输入、没有交叉推理的多模态是"多通道"而非"多模态"。评估一个多模态模型,应重点看"跨模态一致性"类任务(图像与文本是否互证、音频与字幕是否对齐),而不是只看单模态各自的表现。

二、两条技术路线:拼接式 vs 原生多模态

1. 拼接式(Modular / Adapter):视觉编码器 + 投影层 + LLM

路线:"视觉编码器把图像变成向量,投影层把向量映射到 LLM 的 token 空间,LLM 接着生成。"

图像 → [视觉编码器 CLIP ViT] → 图像向量 → [投影层 Projector] → LLM token 空间

文本 → [tokenizer] → token ──────────────────────────────────→ [LLM] → 文本输出
  • 优点:复用成熟的文本 LLM,不重训基座;开发快、可插拔(换 LLM 或换视觉编码器都容易);
  • 缺点:视觉与语言共享的信息有限,图像细节(微小物体、空间关系、时间变化)容易丢失;推理开销要加载完整视觉骨干。

代表:CLIP + 投影 + Vicuna/Qwen 结构的 LLaVA、Qwen-VL、以及最初的 GPT-4V 思路。

2. 原生多模态(Native / Omni):统一 token 空间

路线:把图像、音频、视频全部 token 化,与文本 token 一起在同一 Transformer 中端到端训练,模态间共享注意力。

  • 优点:模态间对齐更好,支持真正的"多模态推理"与流畅的跨模态交互(看图说话、听音辨物);
  • 缺点:训练数据与算力需求大,工程复杂。

代表:GPT-4o(一个模型处理文本+视觉+音频+视频)、Gemini 1.5/2.x。

对比维度拼接式(Modular)原生多模态(Native)
结构编码器 + 投影 + LLM统一 token 空间端到端
开发成本低(复用文本 LLM)高(重新预训练)
视觉细节保持一般更好
跨模态推理受限
代表LLaVA、Qwen-VL、早期 GPT-4VGPT-4o、Gemini

两条路线不是非此即彼

现实中的模型常常是"混合体":Qwen-VL 用视觉编码器但训练得足够深;GPT-4o 被称为原生多模态但内部细节未公开。判断标准看"模态对齐深度"而非营销话术。

到 2025 年,"拼接式 vs 原生"的争论已经淡化——因为两者在实践中融合。即便是被归为原生多模态的模型,也可能在内部保留视觉编码器模块;而拼接式模型通过加深训练,也能获得接近原生的对齐质量。真正有区分度的指标是:模态是否共享注意力与训练信号、跨模态推理是否需要外部组件。选型时关注"多模态评测分数 + 实际业务效果",而非营销口径。

三、代表模型演进:一部多模态编年史

时间模型关键点
2021.01CLIP图像-文本对比学习,4 亿对数据,视觉编码器的事实标准
2022.04Flamingo冻结视觉编码器 + 冻结 LLM,Perceiver 重采样 + gated cross-attention
2023.04LLaVA最简单的拼接方案:线性投影 + 视觉指令微调,开源爆款
2023.08Qwen-VL中文多模态开源,后续 Qwen2-VL(2024.8)大幅提升
2023.09GPT-4VGPT-4 的视觉版开放 API,多模态进入闭源旗舰
2023.12Gemini 1.0Google 原生多模态路线启动
2024.02Gemini 1.5 Pro百万级 token 上下文,支持长视频理解
2024.05GPT-4o全模态实时语音对话,多模态免费化
2024.02/12Sora视频生成"世界模拟器",从预告到正式开放
2025GPT-5、Gemini 2.x、Claude 4多模态 + 推理 + Agent 全面融合

1. CLIP:多模态的"视觉基础件"

CLIP(2021)用 4 亿对"图像-文本"做对比学习:拉近匹配的图文对、推远不匹配的,得到对齐的图文表示。它成了几乎所有拼接式多模态模型的视觉编码器,也让"文本检索图像、图像检索文本"成为通用能力。

2. Flamingo:冻结模型的优雅拼接

DeepMind 的 Flamingo(2022)证明:不必动 LLM 与视觉编码器的权重,只需在中间加一个"重采样器(Perceiver Resampler)+ 门控交叉注意力",就能让冻结的 LLM 学会看图说话——用极少的新增参数获得视觉能力。

3. LLaVA:开源的"最简单路线"

LLaVA(2023)把方案做到极简:CLIP ViT + 线性投影 + Vicuna(基于 Llama 的对话模型),再用 GPT-4 生成的指令数据做视觉-语言指令微调(见下文)。它用最低成本证明了"拼接式 + 指令微调"的有效性,成为开源多模态的爆款基座。

4. Qwen-VL:开源多模态的中文代表

阿里 Qwen-VL 系列(2023.8 → Qwen2-VL 2024.8 → Qwen2.5-VL 2025.1)在文档理解、OCR、视频理解、中文场景上表现突出,配合 Llama 与开源生态 的权重开放策略,成为企业本地化多模态的首选之一。

5. GPT-4V / GPT-4o:闭源旗舰的两次跃迁

  • GPT-4V(2023.9):给 GPT-4 加视觉输入,能读图表、看截图、识别手写并推理;
  • GPT-4o(2024.5):全模态实时语音(平均响应约 320ms),一个模型同时"看 + 听 + 说",把多模态带进大众日常。

多模态模型的能力边界值得清醒认识:它们擅长"描述与理解",但在"精确空间推理"(几何题、制图)、"时序因果"(视频中事件的因果)、"细粒度数量比较"(两个物体谁大多少)上仍明显弱于人类。任何宣称"多模态已超越人类"的说法都需要用评测集验证。对于高风险应用(医疗影像、自动驾驶),多模态模型只能作为"辅助筛查",最终判断必须有人工复核。

6. Gemini:原生多模态 + 超长上下文

Google Gemini 从 1.0(2023.12)开始就走原生多模态路线;Gemini 1.5 Pro(2024.2)把上下文推到约 100 万 token,能对整段视频、整本书做理解;Gemini 2.x 进一步打通多模态 + Agent。多模态与长上下文(见 上下文与长文本)在 Gemini 上合流。

7. Sora:视频生成与"世界模拟器"

Sora(2024)是 OpenAI 的视频生成模型,能从文本/图像生成高保真视频。它的意义不只是"文生视频":OpenAI 把它定位为理解物理世界动态的"世界模拟器"——如果视频生成学会了"物体如何运动、光影如何变化",这本身就是对世界建模的一种路径(该论断处于探索阶段,以官方发布为准)。

回顾编年史,可以提炼出两次结构性转折。第一次转折是 2021–2022 年的"表示对齐":CLIP 与 Flamingo 证明"视觉编码器 + 语言模型"可以低成本获得视觉语言能力,多模态从"不可能"变为"可行"。第二次转折是 2023–2024 年的"全模态原生":GPT-4o 与 Gemini 把音频、视频纳入统一 token 空间,交互从"看图回答"升级为"实时对话"。下一步的候选转折是"多模态推理与生成闭环":模型不仅理解图像,还能生成并自我校验图像(如 Sora 类世界模拟),以及把多模态感知接入 Agent 的执行循环(见 基于 LLM 的 Agent)。每一次转折的共同点,都是"模态之间的对齐与协同"更进一层。

顺着这个编年史再看一次模型谱系,会得到一个实用结论:闭源看 GPT-4o / Gemini,开源看 Qwen-VL / LLaVA,研究看 CLIP / Flamingo 系。闭源提供最强体验与托管便利,开源提供私有化与定制,研究系提供机制可解释性。三者不是竞争而是分工,选型时应同时评估"能力、成本、可控性"三个维度,而不是只比榜单分数。

四、视觉-语言指令微调:让模型"听话地看图"

多模态模型和文本模型一样,需要对齐才能"好用"。视觉-语言指令微调(Visual Instruction Tuning) 是其中的关键一步:

阶段数据目的
预训练对齐大规模图文对学习图文表示对齐
视觉指令微调图像 + 指令 + 回答(如 LLaVA 用 GPT-4 生成的约 158k 条指令数据)学会"按指令看图回答"
偏好/安全对齐多模态偏好对、红队样本有用性、诚实性、安全性(见 对齐:RLHF 与 DPO

数据生成套路:用强文本模型(GPT-4)生成图像的区域描述、推理问题、格式约束,再喂给小模型微调——"以强教弱"的数据蒸馏是多模态模型快速成长的常见手段。

多模态标注比文本标注贵得多(图像描述、区域标注需要专业标注员),因此合成数据与蒸馏成为关键手段:用强模型生成图像描述、用程序生成图表问答对、用仿真生成视频片段。数据质量对多模态模型的影响甚至超过模型规模,这使"数据工程"在多模态团队中的权重显著高于纯文本团队。数据资源与基准见 数据集与基准档案

五、多模态评测:比纯文本难在哪

评测集考察内容难点
MMMU大学级多学科图像问答需要专业推理 + 视觉细节
MMBench / Seed-Bench多模态能力清单覆盖广、细粒度
MM-Vet视觉理解综合强调真实任务
POPE对象幻觉检测看模型是否编造图像中没有的物体
BLINK / MathVista感知 + 数学推理挑战"看图推理"上限

多模态评测指标很多,但落地时更重要的是"及格线"思维:为每个关键能力设一条明确的及格线,而不是追求总分。例如:文档理解类的"版面结构还原率"、视觉问答类的"幻觉率上限"、视频理解类的"时间顺序正确率"。及格线的来源是业务要求(如客服场景要求幻觉率低于某个阈值),而不是论文里的 SOTA。这个思路与 评估实战 的 golden set 方法一致:多模态项目最该做的,是先定义"什么算通过",再谈"能得多少分"。指标满天飞但不知及格线在哪,是很多多模态项目翻车的共同原因。

多模态评测的两个老大难:幻觉(模型"看到"了不存在的物体)与图文关联不足(大图小目标、空间关系错误)。多模态评测的方法论与工具见 评测与基准

多模态模型不是"会看图的搜索引擎"

它们看的是"像素分布",不是"语义数据库"。复杂图表、手写体、微小物体的识别仍有明显失败率;在医疗影像、自动驾驶等高风险场景,必须人审兜底。

六、多模态的技术细节

1. 视觉编码:从像素到 token

无论拼接式还是原生多模态,图像都要先变成模型能处理的"token 序列":

步骤做法效果
Patch 化把图像切成 14×14/16×16 的小块每块一个 token 位
线性嵌入每个 Patch 映射到向量视觉 token
位置编码记录 Patch 的空间位置保持空间结构
多分辨率高分辨率图分块(如 Qwen-VL 的分辨率增强)支持文档/细粒度识别

注意:图像 token 数量随分辨率暴涨(一张 1024×1024 图约 4096 个 patch),这也是"视觉开销"远高于文字的根源。视觉编码底层就是 Transformer 架构详解 中讲的注意力机制在图像上的应用。

2. CLIP:对比学习的核心

要素细节
数据4 亿图像-文本对
目标图文匹配对打分高、不匹配对打分低(InfoNCE 对比损失)
技巧超大 batch(数万对)保证负样本丰富
产物对齐的视觉与文本编码器
零样本能力用文本提示做分类("一张猫的照片")

CLIP 视觉编码器 + 投影层 + LLM,就是 LLaVA 这类拼接式模型的骨架。

3. 多模态训练数据与流程

阶段数据目的
对比预训练海量图文对图文表示对齐
视觉-语言预训练图文 + 描述文本模型学会"看图说话"
指令微调图像+指令+回答(GPT-4 蒸馏生成)按指令作答
偏好对齐多模态偏好对安全与有用性(见 对齐:RLHF 与 DPO

数据是模态对齐的命门:图文噪声大、指令数据贵、视频数据尤其稀缺。数据集档案见 数据集与基准档案

4. 音频与视频的 token 化

  • 音频:通常先做语音识别成文本,或直接用音频 tokenizer(如 EnCodec 类方案)把音频切成离散 token;
  • 视频:按帧抽图走视觉编码,再叠时间轴注意力;长视频依赖上下文压缩(见 上下文与长文本);
  • 统一 token 空间:GPT-4o、Gemini 把文本/图像/音频/视频 token 放进同一个词表与注意力,这是"原生多模态"的工程本质。

5. 为什么多模态比纯文本难

多模态训练与推理的难度不只是"模态更多",而是几个结构性困难:其一,数据不对齐——图文对、视频-文本对天然存在噪声(图片与描述不完全匹配),跨模态对齐信号远弱于文本内部的序列信号;其二,信息密度不均——一张图包含的信息量换算成 token 可以抵几百个词,但模型却要平等对待每个 token,视觉细节容易被稀释;其三,评测难——"回答是否正确"在文本里相对客观,而"看懂了图没有"很难自动判定,幻觉与感知错误的边界模糊。这些困难解释了为什么多模态能力曲线滞后于纯文本模型,也解释了为什么"CLIP 式对比学习 + 指令微调"的组合至今仍是主流配方。评测难点与对应方法见 评测与基准

多模态的关键不是"多",是"对齐"

拼接式先对齐图文表示,原生式在统一 token 空间里对齐所有模态。模态越多,对齐难度与数据需求越大;没有对齐的多模态只是"多输入通道",不是"多模态智能"。

七、边界:与"多模态手册"的分工

本手册(《大模型手册》)与本系列另一套 《多模态手册》 的边界:

主题归属
多模态大模型:LLM 为中心,文本+图像/音频/视频的理解与生成本页(《大模型手册》案例视角)
视觉-语言对齐机制、指令微调、多模态评测本页 + 大模型手册相关概念页
通用多模态表示学习(对比学习、跨模态嵌入)、图像/音频/视频的底层建模《多模态手册》
生成模型底层:扩散模型(Diffusion)、VAE、GAN 与文生图/文生视频机制《多模态手册》
语音识别/合成、音视频信号处理的经典技术《多模态手册》

一句话:本页讲"LLM 长出眼睛耳朵"的故事与技术选型;多模态手册讲"眼睛耳朵本身怎么工作"。做多模态应用选型,两册配合阅读。

八、多模态的未来趋势

  1. 全模态 Omni 成标配:GPT-4o、Gemini 2.x 之后,"一个模型同时处理文本/图像/音频/视频"成为旗舰基准线;
  2. 多模态 + Agent:视觉 Agent(看懂屏幕、操作界面)、音频 Agent(实时会议、客服)把多模态接进任务闭环(见 基于 LLM 的 Agent);
  3. 视频生成走向"可控生成":从"生成一段像样的视频"到"精确控制内容与物理规律";
  4. 多模态评测标准化:幻觉率、时空一致性、指令跟随将成为行业准入门槛。

多模态的未来还有一个"基础设施"维度:训练与推理成本。视觉 token 是文本 token 的数十倍,音频/视频更高,这让"全模态"模型的使用成本远高于纯文本。行业正在从三个方向降本:更紧凑的视觉编码(更少 token 表达更多信息)、模态蒸馏(用大模型教小模型)、以及"按需激活模态"(只处理输入里真实出现的模态)。理解这些成本结构,是做多模态选型的前提。

对从业者的时间线建议:现阶段应重点掌握"多模态理解 + RAG + Agent"的组合(文档智能、视觉问答),这是落地最成熟的方向;"多模态生成"(图/视频)更多是内容创作场景,投资回报取决于业务形态。至于"世界模型"类研究,观察为主、谨慎投入。把成熟度分层看待,是避免多模态选型踩坑的实用心态。

一句话总结多模态的现状:理解已成熟、生成在追赶、世界模型是远方——按这个心智模型安排你的投入节奏。

一句话记住多模态

多模态 LLM = 语言大脑 + 感知器官:拼接式先让模型"看见"(CLIP + 投影 + LLM),原生多模态再让模型"看懂并交流"(GPT-4o、Gemini);下一步是让模型"会动手"(Agent)。

九、多模态应用与落地实践

1. 典型应用场景

场景输入 → 输出代表模型
文档理解扫描件/PDF → 结构化数据GPT-4o、Qwen2.5-VL
截图问答报错截图 → 解决方案GPT-4o、Gemini
图像检索自然语言 → 图片CLIP 系 embedding
实时语音助手语音 → 语音GPT-4o
长视频理解视频 → 摘要/问答Gemini 1.5+
视觉 Agent屏幕 → 操作Operator 类(见 基于 LLM 的 Agent
文生图/视频文本 → 图像/视频Sora、Veo 等

2. 文档理解:多模态落地最热场景

企业知识大量躺在 PDF、扫描件、表格里,多模态模型让"看文档"取代"解析文档":

  • 优势:直接读版面(表格、公式、印章)、跳过 OCR 流水线;
  • 工程要点:高分辨率分块(文档切块再拼),与 RAG 结合(见 RAG:检索增强生成);
  • 风险:复杂版面仍会看错,需人工抽检。

3. 多模态模型选型表

需求推荐理由
最强视觉推理GPT-4o / Gemini复杂图表、长视频
中文文档理解Qwen2.5-VL中文 OCR/版面强
开源私有化Qwen-VL / LLaVA权重开放
实时语音GPT-4o延迟低、全模态
图像检索 embeddingCLIP / SigLIP图文对齐
视频生成Sora / Veo质量领先

4. 常见误区

误区正确姿势
以为多模态"什么图都看得懂"复杂版面/小目标仍会失败,必须抽检
用视觉模型做 OCROCR 是子能力,结构化抽取要专项设计
多模态 = 图 + 文即可音频/视频对齐同样重要
只信榜单用自建多模态评测集(见 评测与基准
忽视隐私图像/语音含大量个人信息,合规先行

5. 高频问题速答

问题速答
GPT-4o 和 GPT-4V 的区别?4o 是原生全模态实时,4V 是拼接式早期视觉版
开源多模态选哪个?Qwen2.5-VL 综合最强之一
图像 token 多贵?一张高分辨率图约数千 token,要计入成本
多模态评测用什么?MMMU、MMBench、POPE(幻觉)等组合
视频理解怎么做?抽帧 + 长上下文(Gemini 路线)
和纯文本模型怎么配合?多模态做感知,文本模型做规划,常组合进 Agent

一句话记住多模态落地

先明确"哪种模态解决哪个业务问题",再选路线(拼接式 vs 原生)与模型。多模态的成本与失败率都高于纯文本,用评测集守住质量底线。

十、多模态的关键论文与评测资源

1. 关键论文速览

论文 / 工作年份一句话贡献
CLIP2021图文对比学习,视觉编码器标准件
Flamingo2022冻结模型 + 交叉注意力的优雅拼接
LLaVA2023最简拼接 + 视觉指令微调
InstructBLIP2023指令微调的多模态基础模型
Qwen-VL / Qwen2-VL2023–2024中文开源多模态标杆
GPT-4V / GPT-4o2023–2024闭源旗舰多模态与全模态
Gemini 1.0 / 1.52023–2024原生多模态 + 百万级上下文
Sora2024视频生成作为世界模拟器

2. 评测资源清单

评测集考察适合判断
MMMU大学多学科视觉问答学科推理上限
MMBench能力细项清单能力画像
MM-Vet综合视觉理解整体能力
POPE对象幻觉幻觉风险
SEED-Bench多模态能力广覆盖选型参考
MathVista视觉数学推理图表数理
BLINK人类感知基线细粒度感知

3. 评测陷阱与建议

  • 视觉输入难标准化:同一问题不同分辨率/裁剪结果差异大,评测需固定输入规范;
  • 幻觉是硬伤:POPE 类评测应纳入选型门槛;
  • 指令偏差:模型对 prompt 风格敏感,评测集应覆盖真实用户问法;
  • 成本:视觉评测 token 开销大,控制批次与重试。

对选型者的一句话:多模态榜单的分数差在 2~3 分内通常不构成决策依据,因为提示风格、输入规范与评测集版本都会影响分数;真正重要的是在你自己业务数据上的表现。

十一、多模态工程的常见陷阱

陷阱表现对策
分辨率不匹配小字/细粒度识别失败高分辨率分块 + 文档专项模型
输入顺序乱多图对应关系错乱固定图像编号与顺序约定
缓存误用图片 hash 变化未失效缓存键包含图像内容 hash
过度 OCR把版面当纯文本丢语义结构保留 + 版面理解
隐私合规图像/语音含个人信息脱敏 + 合规评估先行
成本失控大图 token 爆炸压缩、分块、路由到小模型

5. 视觉 RAG:多模态与检索的结合

一个正在普及的落地形态是"视觉 RAG":把图像、表格、截图也纳入知识库,用多模态 embedding(如 CLIP 系)做检索,再交给多模态生成模型作答。典型场景包括:以图纸为核心的知识库("这个接口在图纸哪里")、包含大量截图的运维手册、需要比对历史票据的审核系统。工程上要注意:图像 embedding 与文本 embedding 可能不在同一空间,需要统一的"多模态向量化"方案;图像检索的 top-k 召回率通常低于文本,重排环节更重要。视觉 RAG 与标准 RAG 的差异,本质上仍是"模态对齐"问题——更多细节见 RAG:检索增强生成

多模态落地的验收清单

上线前跑三类测试:①能力测试(自建视觉 golden set);②幻觉测试(POPE 类);③成本测试(每请求 token 与延迟)。三类全过才敢上线。

十二、延伸阅读

参考资料