外观
多模态大模型
多模态大模型(Multimodal LLM)是能够同时理解并生成文本、图像、音频、视频等多种模态信息的大模型。它把 LLM 的"语言智能"扩展到"感知世界":看图回答问题、听语音对话、看懂视频、甚至生成图像与视频。2023–2025 年,多模态从"锦上添花"变成旗舰模型的标配——GPT-4o、Gemini、Claude、Qwen-VL 无一例外。本页拆解它的两条技术路线与代表模型;语言侧基座见 GPT 系列:从 GPT-1 到 GPT-4o。
一、多模态 LLM 是什么:从"纯语言"到"全感官"
纯文本 LLM 的输入输出都是 token 序列;多模态 LLM 让输入/输出扩展到图像、音频、视频。按"模态覆盖"可以分几个层次:
| 能力层次 | 代表 | 说明 |
|---|---|---|
| 视觉理解 | GPT-4V、LLaVA、Qwen-VL | 看图理解:识别、问答、图表推理、OCR |
| 视觉+语言生成 | GPT-4o、Gemini | 看图还能配图、写代码生成图表 |
| 全模态 Omni | GPT-4o、Gemini 2.x | 文本+图像+音频+视频统一理解与输出 |
| 视频生成 | Sora、Veo | 从文本/图像生成视频 |
| 世界模型探索 | Sora 技术报告 | 视频生成作为"物理世界模拟器" |
"多模态"还有一个经常被误读的点:它不是"加一个图片输入框"那么简单。真正多模态的收益,是模型在模态之间做"交叉推理"——看图说话、听声辨物、把一段视频里的动作转成文字,并让这些模态互相印证(例如"图像里的车牌和文字描述是否一致")。只有输入、没有交叉推理的多模态是"多通道"而非"多模态"。评估一个多模态模型,应重点看"跨模态一致性"类任务(图像与文本是否互证、音频与字幕是否对齐),而不是只看单模态各自的表现。
二、两条技术路线:拼接式 vs 原生多模态
1. 拼接式(Modular / Adapter):视觉编码器 + 投影层 + LLM
路线:"视觉编码器把图像变成向量,投影层把向量映射到 LLM 的 token 空间,LLM 接着生成。"
图像 → [视觉编码器 CLIP ViT] → 图像向量 → [投影层 Projector] → LLM token 空间
↓
文本 → [tokenizer] → token ──────────────────────────────────→ [LLM] → 文本输出- 优点:复用成熟的文本 LLM,不重训基座;开发快、可插拔(换 LLM 或换视觉编码器都容易);
- 缺点:视觉与语言共享的信息有限,图像细节(微小物体、空间关系、时间变化)容易丢失;推理开销要加载完整视觉骨干。
代表:CLIP + 投影 + Vicuna/Qwen 结构的 LLaVA、Qwen-VL、以及最初的 GPT-4V 思路。
2. 原生多模态(Native / Omni):统一 token 空间
路线:把图像、音频、视频全部 token 化,与文本 token 一起在同一 Transformer 中端到端训练,模态间共享注意力。
- 优点:模态间对齐更好,支持真正的"多模态推理"与流畅的跨模态交互(看图说话、听音辨物);
- 缺点:训练数据与算力需求大,工程复杂。
代表:GPT-4o(一个模型处理文本+视觉+音频+视频)、Gemini 1.5/2.x。
| 对比维度 | 拼接式(Modular) | 原生多模态(Native) |
|---|---|---|
| 结构 | 编码器 + 投影 + LLM | 统一 token 空间端到端 |
| 开发成本 | 低(复用文本 LLM) | 高(重新预训练) |
| 视觉细节保持 | 一般 | 更好 |
| 跨模态推理 | 受限 | 强 |
| 代表 | LLaVA、Qwen-VL、早期 GPT-4V | GPT-4o、Gemini |
两条路线不是非此即彼
现实中的模型常常是"混合体":Qwen-VL 用视觉编码器但训练得足够深;GPT-4o 被称为原生多模态但内部细节未公开。判断标准看"模态对齐深度"而非营销话术。
到 2025 年,"拼接式 vs 原生"的争论已经淡化——因为两者在实践中融合。即便是被归为原生多模态的模型,也可能在内部保留视觉编码器模块;而拼接式模型通过加深训练,也能获得接近原生的对齐质量。真正有区分度的指标是:模态是否共享注意力与训练信号、跨模态推理是否需要外部组件。选型时关注"多模态评测分数 + 实际业务效果",而非营销口径。
三、代表模型演进:一部多模态编年史
| 时间 | 模型 | 关键点 |
|---|---|---|
| 2021.01 | CLIP | 图像-文本对比学习,4 亿对数据,视觉编码器的事实标准 |
| 2022.04 | Flamingo | 冻结视觉编码器 + 冻结 LLM,Perceiver 重采样 + gated cross-attention |
| 2023.04 | LLaVA | 最简单的拼接方案:线性投影 + 视觉指令微调,开源爆款 |
| 2023.08 | Qwen-VL | 中文多模态开源,后续 Qwen2-VL(2024.8)大幅提升 |
| 2023.09 | GPT-4V | GPT-4 的视觉版开放 API,多模态进入闭源旗舰 |
| 2023.12 | Gemini 1.0 | Google 原生多模态路线启动 |
| 2024.02 | Gemini 1.5 Pro | 百万级 token 上下文,支持长视频理解 |
| 2024.05 | GPT-4o | 全模态实时语音对话,多模态免费化 |
| 2024.02/12 | Sora | 视频生成"世界模拟器",从预告到正式开放 |
| 2025 | GPT-5、Gemini 2.x、Claude 4 | 多模态 + 推理 + Agent 全面融合 |
1. CLIP:多模态的"视觉基础件"
CLIP(2021)用 4 亿对"图像-文本"做对比学习:拉近匹配的图文对、推远不匹配的,得到对齐的图文表示。它成了几乎所有拼接式多模态模型的视觉编码器,也让"文本检索图像、图像检索文本"成为通用能力。
2. Flamingo:冻结模型的优雅拼接
DeepMind 的 Flamingo(2022)证明:不必动 LLM 与视觉编码器的权重,只需在中间加一个"重采样器(Perceiver Resampler)+ 门控交叉注意力",就能让冻结的 LLM 学会看图说话——用极少的新增参数获得视觉能力。
3. LLaVA:开源的"最简单路线"
LLaVA(2023)把方案做到极简:CLIP ViT + 线性投影 + Vicuna(基于 Llama 的对话模型),再用 GPT-4 生成的指令数据做视觉-语言指令微调(见下文)。它用最低成本证明了"拼接式 + 指令微调"的有效性,成为开源多模态的爆款基座。
4. Qwen-VL:开源多模态的中文代表
阿里 Qwen-VL 系列(2023.8 → Qwen2-VL 2024.8 → Qwen2.5-VL 2025.1)在文档理解、OCR、视频理解、中文场景上表现突出,配合 Llama 与开源生态 的权重开放策略,成为企业本地化多模态的首选之一。
5. GPT-4V / GPT-4o:闭源旗舰的两次跃迁
- GPT-4V(2023.9):给 GPT-4 加视觉输入,能读图表、看截图、识别手写并推理;
- GPT-4o(2024.5):全模态实时语音(平均响应约 320ms),一个模型同时"看 + 听 + 说",把多模态带进大众日常。
多模态模型的能力边界值得清醒认识:它们擅长"描述与理解",但在"精确空间推理"(几何题、制图)、"时序因果"(视频中事件的因果)、"细粒度数量比较"(两个物体谁大多少)上仍明显弱于人类。任何宣称"多模态已超越人类"的说法都需要用评测集验证。对于高风险应用(医疗影像、自动驾驶),多模态模型只能作为"辅助筛查",最终判断必须有人工复核。
6. Gemini:原生多模态 + 超长上下文
Google Gemini 从 1.0(2023.12)开始就走原生多模态路线;Gemini 1.5 Pro(2024.2)把上下文推到约 100 万 token,能对整段视频、整本书做理解;Gemini 2.x 进一步打通多模态 + Agent。多模态与长上下文(见 上下文与长文本)在 Gemini 上合流。
7. Sora:视频生成与"世界模拟器"
Sora(2024)是 OpenAI 的视频生成模型,能从文本/图像生成高保真视频。它的意义不只是"文生视频":OpenAI 把它定位为理解物理世界动态的"世界模拟器"——如果视频生成学会了"物体如何运动、光影如何变化",这本身就是对世界建模的一种路径(该论断处于探索阶段,以官方发布为准)。
回顾编年史,可以提炼出两次结构性转折。第一次转折是 2021–2022 年的"表示对齐":CLIP 与 Flamingo 证明"视觉编码器 + 语言模型"可以低成本获得视觉语言能力,多模态从"不可能"变为"可行"。第二次转折是 2023–2024 年的"全模态原生":GPT-4o 与 Gemini 把音频、视频纳入统一 token 空间,交互从"看图回答"升级为"实时对话"。下一步的候选转折是"多模态推理与生成闭环":模型不仅理解图像,还能生成并自我校验图像(如 Sora 类世界模拟),以及把多模态感知接入 Agent 的执行循环(见 基于 LLM 的 Agent)。每一次转折的共同点,都是"模态之间的对齐与协同"更进一层。
顺着这个编年史再看一次模型谱系,会得到一个实用结论:闭源看 GPT-4o / Gemini,开源看 Qwen-VL / LLaVA,研究看 CLIP / Flamingo 系。闭源提供最强体验与托管便利,开源提供私有化与定制,研究系提供机制可解释性。三者不是竞争而是分工,选型时应同时评估"能力、成本、可控性"三个维度,而不是只比榜单分数。
四、视觉-语言指令微调:让模型"听话地看图"
多模态模型和文本模型一样,需要对齐才能"好用"。视觉-语言指令微调(Visual Instruction Tuning) 是其中的关键一步:
| 阶段 | 数据 | 目的 |
|---|---|---|
| 预训练对齐 | 大规模图文对 | 学习图文表示对齐 |
| 视觉指令微调 | 图像 + 指令 + 回答(如 LLaVA 用 GPT-4 生成的约 158k 条指令数据) | 学会"按指令看图回答" |
| 偏好/安全对齐 | 多模态偏好对、红队样本 | 有用性、诚实性、安全性(见 对齐:RLHF 与 DPO) |
数据生成套路:用强文本模型(GPT-4)生成图像的区域描述、推理问题、格式约束,再喂给小模型微调——"以强教弱"的数据蒸馏是多模态模型快速成长的常见手段。
多模态标注比文本标注贵得多(图像描述、区域标注需要专业标注员),因此合成数据与蒸馏成为关键手段:用强模型生成图像描述、用程序生成图表问答对、用仿真生成视频片段。数据质量对多模态模型的影响甚至超过模型规模,这使"数据工程"在多模态团队中的权重显著高于纯文本团队。数据资源与基准见 数据集与基准档案。
五、多模态评测:比纯文本难在哪
| 评测集 | 考察内容 | 难点 |
|---|---|---|
| MMMU | 大学级多学科图像问答 | 需要专业推理 + 视觉细节 |
| MMBench / Seed-Bench | 多模态能力清单 | 覆盖广、细粒度 |
| MM-Vet | 视觉理解综合 | 强调真实任务 |
| POPE | 对象幻觉检测 | 看模型是否编造图像中没有的物体 |
| BLINK / MathVista | 感知 + 数学推理 | 挑战"看图推理"上限 |
多模态评测指标很多,但落地时更重要的是"及格线"思维:为每个关键能力设一条明确的及格线,而不是追求总分。例如:文档理解类的"版面结构还原率"、视觉问答类的"幻觉率上限"、视频理解类的"时间顺序正确率"。及格线的来源是业务要求(如客服场景要求幻觉率低于某个阈值),而不是论文里的 SOTA。这个思路与 评估实战 的 golden set 方法一致:多模态项目最该做的,是先定义"什么算通过",再谈"能得多少分"。指标满天飞但不知及格线在哪,是很多多模态项目翻车的共同原因。
多模态评测的两个老大难:幻觉(模型"看到"了不存在的物体)与图文关联不足(大图小目标、空间关系错误)。多模态评测的方法论与工具见 评测与基准。
多模态模型不是"会看图的搜索引擎"
它们看的是"像素分布",不是"语义数据库"。复杂图表、手写体、微小物体的识别仍有明显失败率;在医疗影像、自动驾驶等高风险场景,必须人审兜底。
六、多模态的技术细节
1. 视觉编码:从像素到 token
无论拼接式还是原生多模态,图像都要先变成模型能处理的"token 序列":
| 步骤 | 做法 | 效果 |
|---|---|---|
| Patch 化 | 把图像切成 14×14/16×16 的小块 | 每块一个 token 位 |
| 线性嵌入 | 每个 Patch 映射到向量 | 视觉 token |
| 位置编码 | 记录 Patch 的空间位置 | 保持空间结构 |
| 多分辨率 | 高分辨率图分块(如 Qwen-VL 的分辨率增强) | 支持文档/细粒度识别 |
注意:图像 token 数量随分辨率暴涨(一张 1024×1024 图约 4096 个 patch),这也是"视觉开销"远高于文字的根源。视觉编码底层就是 Transformer 架构详解 中讲的注意力机制在图像上的应用。
2. CLIP:对比学习的核心
| 要素 | 细节 |
|---|---|
| 数据 | 4 亿图像-文本对 |
| 目标 | 图文匹配对打分高、不匹配对打分低(InfoNCE 对比损失) |
| 技巧 | 超大 batch(数万对)保证负样本丰富 |
| 产物 | 对齐的视觉与文本编码器 |
| 零样本能力 | 用文本提示做分类("一张猫的照片") |
CLIP 视觉编码器 + 投影层 + LLM,就是 LLaVA 这类拼接式模型的骨架。
3. 多模态训练数据与流程
| 阶段 | 数据 | 目的 |
|---|---|---|
| 对比预训练 | 海量图文对 | 图文表示对齐 |
| 视觉-语言预训练 | 图文 + 描述文本 | 模型学会"看图说话" |
| 指令微调 | 图像+指令+回答(GPT-4 蒸馏生成) | 按指令作答 |
| 偏好对齐 | 多模态偏好对 | 安全与有用性(见 对齐:RLHF 与 DPO) |
数据是模态对齐的命门:图文噪声大、指令数据贵、视频数据尤其稀缺。数据集档案见 数据集与基准档案。
4. 音频与视频的 token 化
- 音频:通常先做语音识别成文本,或直接用音频 tokenizer(如 EnCodec 类方案)把音频切成离散 token;
- 视频:按帧抽图走视觉编码,再叠时间轴注意力;长视频依赖上下文压缩(见 上下文与长文本);
- 统一 token 空间:GPT-4o、Gemini 把文本/图像/音频/视频 token 放进同一个词表与注意力,这是"原生多模态"的工程本质。
5. 为什么多模态比纯文本难
多模态训练与推理的难度不只是"模态更多",而是几个结构性困难:其一,数据不对齐——图文对、视频-文本对天然存在噪声(图片与描述不完全匹配),跨模态对齐信号远弱于文本内部的序列信号;其二,信息密度不均——一张图包含的信息量换算成 token 可以抵几百个词,但模型却要平等对待每个 token,视觉细节容易被稀释;其三,评测难——"回答是否正确"在文本里相对客观,而"看懂了图没有"很难自动判定,幻觉与感知错误的边界模糊。这些困难解释了为什么多模态能力曲线滞后于纯文本模型,也解释了为什么"CLIP 式对比学习 + 指令微调"的组合至今仍是主流配方。评测难点与对应方法见 评测与基准。
多模态的关键不是"多",是"对齐"
拼接式先对齐图文表示,原生式在统一 token 空间里对齐所有模态。模态越多,对齐难度与数据需求越大;没有对齐的多模态只是"多输入通道",不是"多模态智能"。
七、边界:与"多模态手册"的分工
本手册(《大模型手册》)与本系列另一套 《多模态手册》 的边界:
| 主题 | 归属 |
|---|---|
| 多模态大模型:LLM 为中心,文本+图像/音频/视频的理解与生成 | 本页(《大模型手册》案例视角) |
| 视觉-语言对齐机制、指令微调、多模态评测 | 本页 + 大模型手册相关概念页 |
| 通用多模态表示学习(对比学习、跨模态嵌入)、图像/音频/视频的底层建模 | 《多模态手册》 |
| 生成模型底层:扩散模型(Diffusion)、VAE、GAN 与文生图/文生视频机制 | 《多模态手册》 |
| 语音识别/合成、音视频信号处理的经典技术 | 《多模态手册》 |
一句话:本页讲"LLM 长出眼睛耳朵"的故事与技术选型;多模态手册讲"眼睛耳朵本身怎么工作"。做多模态应用选型,两册配合阅读。
八、多模态的未来趋势
- 全模态 Omni 成标配:GPT-4o、Gemini 2.x 之后,"一个模型同时处理文本/图像/音频/视频"成为旗舰基准线;
- 多模态 + Agent:视觉 Agent(看懂屏幕、操作界面)、音频 Agent(实时会议、客服)把多模态接进任务闭环(见 基于 LLM 的 Agent);
- 视频生成走向"可控生成":从"生成一段像样的视频"到"精确控制内容与物理规律";
- 多模态评测标准化:幻觉率、时空一致性、指令跟随将成为行业准入门槛。
多模态的未来还有一个"基础设施"维度:训练与推理成本。视觉 token 是文本 token 的数十倍,音频/视频更高,这让"全模态"模型的使用成本远高于纯文本。行业正在从三个方向降本:更紧凑的视觉编码(更少 token 表达更多信息)、模态蒸馏(用大模型教小模型)、以及"按需激活模态"(只处理输入里真实出现的模态)。理解这些成本结构,是做多模态选型的前提。
对从业者的时间线建议:现阶段应重点掌握"多模态理解 + RAG + Agent"的组合(文档智能、视觉问答),这是落地最成熟的方向;"多模态生成"(图/视频)更多是内容创作场景,投资回报取决于业务形态。至于"世界模型"类研究,观察为主、谨慎投入。把成熟度分层看待,是避免多模态选型踩坑的实用心态。
一句话总结多模态的现状:理解已成熟、生成在追赶、世界模型是远方——按这个心智模型安排你的投入节奏。
一句话记住多模态
多模态 LLM = 语言大脑 + 感知器官:拼接式先让模型"看见"(CLIP + 投影 + LLM),原生多模态再让模型"看懂并交流"(GPT-4o、Gemini);下一步是让模型"会动手"(Agent)。
九、多模态应用与落地实践
1. 典型应用场景
| 场景 | 输入 → 输出 | 代表模型 |
|---|---|---|
| 文档理解 | 扫描件/PDF → 结构化数据 | GPT-4o、Qwen2.5-VL |
| 截图问答 | 报错截图 → 解决方案 | GPT-4o、Gemini |
| 图像检索 | 自然语言 → 图片 | CLIP 系 embedding |
| 实时语音助手 | 语音 → 语音 | GPT-4o |
| 长视频理解 | 视频 → 摘要/问答 | Gemini 1.5+ |
| 视觉 Agent | 屏幕 → 操作 | Operator 类(见 基于 LLM 的 Agent) |
| 文生图/视频 | 文本 → 图像/视频 | Sora、Veo 等 |
2. 文档理解:多模态落地最热场景
企业知识大量躺在 PDF、扫描件、表格里,多模态模型让"看文档"取代"解析文档":
- 优势:直接读版面(表格、公式、印章)、跳过 OCR 流水线;
- 工程要点:高分辨率分块(文档切块再拼),与 RAG 结合(见 RAG:检索增强生成);
- 风险:复杂版面仍会看错,需人工抽检。
3. 多模态模型选型表
| 需求 | 推荐 | 理由 |
|---|---|---|
| 最强视觉推理 | GPT-4o / Gemini | 复杂图表、长视频 |
| 中文文档理解 | Qwen2.5-VL | 中文 OCR/版面强 |
| 开源私有化 | Qwen-VL / LLaVA | 权重开放 |
| 实时语音 | GPT-4o | 延迟低、全模态 |
| 图像检索 embedding | CLIP / SigLIP | 图文对齐 |
| 视频生成 | Sora / Veo | 质量领先 |
4. 常见误区
| 误区 | 正确姿势 |
|---|---|
| 以为多模态"什么图都看得懂" | 复杂版面/小目标仍会失败,必须抽检 |
| 用视觉模型做 OCR | OCR 是子能力,结构化抽取要专项设计 |
| 多模态 = 图 + 文即可 | 音频/视频对齐同样重要 |
| 只信榜单 | 用自建多模态评测集(见 评测与基准) |
| 忽视隐私 | 图像/语音含大量个人信息,合规先行 |
5. 高频问题速答
| 问题 | 速答 |
|---|---|
| GPT-4o 和 GPT-4V 的区别? | 4o 是原生全模态实时,4V 是拼接式早期视觉版 |
| 开源多模态选哪个? | Qwen2.5-VL 综合最强之一 |
| 图像 token 多贵? | 一张高分辨率图约数千 token,要计入成本 |
| 多模态评测用什么? | MMMU、MMBench、POPE(幻觉)等组合 |
| 视频理解怎么做? | 抽帧 + 长上下文(Gemini 路线) |
| 和纯文本模型怎么配合? | 多模态做感知,文本模型做规划,常组合进 Agent |
一句话记住多模态落地
先明确"哪种模态解决哪个业务问题",再选路线(拼接式 vs 原生)与模型。多模态的成本与失败率都高于纯文本,用评测集守住质量底线。
十、多模态的关键论文与评测资源
1. 关键论文速览
| 论文 / 工作 | 年份 | 一句话贡献 |
|---|---|---|
| CLIP | 2021 | 图文对比学习,视觉编码器标准件 |
| Flamingo | 2022 | 冻结模型 + 交叉注意力的优雅拼接 |
| LLaVA | 2023 | 最简拼接 + 视觉指令微调 |
| InstructBLIP | 2023 | 指令微调的多模态基础模型 |
| Qwen-VL / Qwen2-VL | 2023–2024 | 中文开源多模态标杆 |
| GPT-4V / GPT-4o | 2023–2024 | 闭源旗舰多模态与全模态 |
| Gemini 1.0 / 1.5 | 2023–2024 | 原生多模态 + 百万级上下文 |
| Sora | 2024 | 视频生成作为世界模拟器 |
2. 评测资源清单
| 评测集 | 考察 | 适合判断 |
|---|---|---|
| MMMU | 大学多学科视觉问答 | 学科推理上限 |
| MMBench | 能力细项清单 | 能力画像 |
| MM-Vet | 综合视觉理解 | 整体能力 |
| POPE | 对象幻觉 | 幻觉风险 |
| SEED-Bench | 多模态能力广覆盖 | 选型参考 |
| MathVista | 视觉数学推理 | 图表数理 |
| BLINK | 人类感知基线 | 细粒度感知 |
3. 评测陷阱与建议
- 视觉输入难标准化:同一问题不同分辨率/裁剪结果差异大,评测需固定输入规范;
- 幻觉是硬伤:POPE 类评测应纳入选型门槛;
- 指令偏差:模型对 prompt 风格敏感,评测集应覆盖真实用户问法;
- 成本:视觉评测 token 开销大,控制批次与重试。
对选型者的一句话:多模态榜单的分数差在 2~3 分内通常不构成决策依据,因为提示风格、输入规范与评测集版本都会影响分数;真正重要的是在你自己业务数据上的表现。
十一、多模态工程的常见陷阱
| 陷阱 | 表现 | 对策 |
|---|---|---|
| 分辨率不匹配 | 小字/细粒度识别失败 | 高分辨率分块 + 文档专项模型 |
| 输入顺序乱 | 多图对应关系错乱 | 固定图像编号与顺序约定 |
| 缓存误用 | 图片 hash 变化未失效 | 缓存键包含图像内容 hash |
| 过度 OCR | 把版面当纯文本丢语义 | 结构保留 + 版面理解 |
| 隐私合规 | 图像/语音含个人信息 | 脱敏 + 合规评估先行 |
| 成本失控 | 大图 token 爆炸 | 压缩、分块、路由到小模型 |
5. 视觉 RAG:多模态与检索的结合
一个正在普及的落地形态是"视觉 RAG":把图像、表格、截图也纳入知识库,用多模态 embedding(如 CLIP 系)做检索,再交给多模态生成模型作答。典型场景包括:以图纸为核心的知识库("这个接口在图纸哪里")、包含大量截图的运维手册、需要比对历史票据的审核系统。工程上要注意:图像 embedding 与文本 embedding 可能不在同一空间,需要统一的"多模态向量化"方案;图像检索的 top-k 召回率通常低于文本,重排环节更重要。视觉 RAG 与标准 RAG 的差异,本质上仍是"模态对齐"问题——更多细节见 RAG:检索增强生成。
多模态落地的验收清单
上线前跑三类测试:①能力测试(自建视觉 golden set);②幻觉测试(POPE 类);③成本测试(每请求 token 与延迟)。三类全过才敢上线。
十二、延伸阅读
- GPT 系列:从 GPT-1 到 GPT-4o——GPT-4V/4o 的语言基座
- Llama 与开源生态——Qwen-VL 等开源多模态家族
- 对齐:RLHF 与 DPO——多模态模型的安全对齐
- 评测与基准——多模态评测方法论
- 上下文与长文本——Gemini 百万 token 背后的机制
- 基于 LLM 的 Agent——多模态与 Agent 的合流
- 前沿进展——多模态原生与视频生成前沿
参考资料
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision(CLIP, 2021)——CLIP 论文(arXiv)
- Alayrac et al. Flamingo: a Visual Language Model for Few-Shot Learning(2022)——Flamingo 论文(arXiv)
- Liu et al. Visual Instruction Tuning(LLaVA, 2023)——LLaVA 论文(arXiv)
- OpenAI. GPT-4V(ision) system card(2023)——GPT-4V 技术报告(arXiv)
- OpenAI. Hello GPT-4o(2024.5)——GPT-4o 官方发布
- Google. Introducing Gemini: our largest and most capable AI model(2023.12)——Gemini 1.0 官方博客
- Google. Introducing Gemini 1.5, our next-generation multimodal AI model(2024.2)——Gemini 1.5 官方博客
- OpenAI. Sora: Creating video from text(2024)——Sora 技术说明
- Yue et al. MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark(2023)——MMMU 评测集论文(arXiv)