外观
前沿进展
一句话定位:本页是"2023-2025 年大模型前沿的九大趋势综述"——每项趋势给出演化脉络、代表论文/模型、发生了什么、以及一句话判断。它不追求穷尽,而是让你读完能回答"这半年有什么大事、它们的来龙去脉是什么、对我的工作意味着什么"。
一、怎么读"前沿"
- 这是地图的"前沿"格的展开:与论文地图配合,正文基于截至 2025 年中的公开资料,时效性内容以官方发布为准。
- 前沿信息的半衰期很短:数字(benchmark 分数、参数量)几个月就过时;趋势(范式怎么演化)至少影响两三年。本页帮你抓的是后者。
- 判断标准是"范式是否成立":一篇论文是"一次实验结果"还是"新范式起点"?比如 FlashAttention 是范式(IO 感知),某个新注意力变体可能只是一次实验。用判断论文好坏的标准套一下,能省很多时间。
- 追更的方法见阅读纪律与 FAQ的追 arXiv 一节。
二、九大趋势逐项
1. 推理时扩展:从"预训练规模"到"推理时算力"(o1、test-time compute)
演化脉络:测试时计算的想法并不新——AlphaGo 的蒙特卡洛树搜索(2016)本质就是"用更多推理算力换更优答案";但在语言模型上,它长期让位于"预训练规模"。OpenAI 于 2024 年 9 月发布 o1,首次把"强化学习 + 思维链 + 推理时搜索/反思"产品化——模型在回答前先"思考",思考越久(test-time compute 越多)正确率越高。o3(2024 年底预告)延续此路线。开源侧,DeepSeek-R1(2025 年 1 月)用纯强化学习(GRPO)复现了"推理涌现",并公开了完整技术报告与权重。
- 代表论文/模型:OpenAI o1(官方博客,无 arXiv)、DeepSeek-R1(2025)。
- 一句话判断:这是继预训练规模之后第四条可扩展维度——"推理时扩展定律"正在成形,把规模法则从"训练算力"扩展到"推理算力",也改变了成本结构(推理更贵)与评测方式(有思考 vs 无思考要分开测)。
- 对从业者的启示:如果你的业务涉及数学、代码、逻辑类高价值问题,"要不要用推理型模型"是一个成本决策:思考越久正确率越高,但单次成本可能高一个数量级。评测时务必把"thinking"与"non-thinking"两种模式分开测,否则结论会失真。
为什么重要
2022 年前,"更强 = 预训练更大"。o1 证明同一权重可以靠"思考预算"换能力。这对产品的影响是直接的经济账:要不要为一条回答多花 10 倍推理成本换取更高正确率?这个权衡将成为每个 LLM 应用的日常决策。
2. 长上下文与百万 token
演化脉络:上下文窗口从 GPT-3 的 2k 一路涨到 GPT-4 Turbo 的 128k、Claude 的 200k,Gemini 1.5 落地百万 token(1M)。技术底座是三层:位置编码外推(ALiBi、YaRN、NTK-aware)、高效注意力(FlashAttention 系列)、长文本训练数据上采样。2024 年后,"大海捞针"(Needle-in-a-Haystack)评测表明模型能"记住"长文本里的关键信息,但工程挑战(成本、检索、长程事实提取)仍在。
- 代表论文/模型:Gemini 1.5 技术报告(2024)、YaRN(2023)、LongLoRA(2023)、FlashAttention(2022)。
- 一句话判断:"放得进去"已解决,"用得起来"是新的战场;长上下文与 RAG 是互补而非替代——前者适合"整段读",后者适合"大海捞针"(见上下文与长文本)。
- 对从业者的启示:选方案时先想清楚任务类型:整本书/整份合同的分析用长上下文,知识库问答用 RAG;同时记住长上下文意味着注意力与 KV Cache 成本随长度线性上升——不是免费午餐。
3. MoE 大规模化:稀疏激活成为主流性价比选择
演化脉络:MoE 从 GShard(2020)与 Switch Transformer(2021)的实验室演示,到 GLaM 证明"等算力更强",再到 Mixtral 8×7B(2023.12,总 46.7B/激活约 12.9B)把稀疏化带到开源;DeepSeek-V3(2024.12)以 671B 总参/37B 激活、约 1/10 的训练成本追平同级稠密模型;传闻 GPT-4 也采用约 8 专家架构。2025 年 Qwen3-MoE、Llama 4 等进一步把 MoE 推到主流。
- 代表论文/模型:Mixtral of Experts(2024)、DeepSeek-V3(2024)、Switch Transformers(2021)。
- 一句话判断:MoE 把"总参数=能力上限"改写为"激活参数=计算成本、总参数=知识容量",成为大参数量下的性价比标准答案;代价是显存(全部专家都要驻留)与部署复杂度(见MoE 与超大规模模型与MoE 稀疏专家模型)。
- 对从业者的启示:选基座模型时看"激活参数"而不是"总参数";部署 MoE 前先算显存账(全部专家驻留 + KV Cache),必要时要上专家并行或 CPU offload。
4. 多模态原生:从"拼接"到"原生"
演化脉络:CLIP(2021)先解决了"图文对齐"问题,Flamingo/LLaVA 走"视觉编码器 + 投影 + LLM"的拼接路线;GPT-4V(2023)把视觉接入对话;2024 年 GPT-4o、Gemini 走向原生多模态(同一模型处理文本/图像/音频,实时交互),Sora 把"视频生成作为世界模拟器"推上头条;开源侧 Qwen2.5-VL、InternVL 等快速跟进,多模态评测(如 MMMU)成为独立赛道。
- 代表论文/模型:GPT-4o(官方博客,无 arXiv)、Gemini 1.5(2024)、Sora 技术报告(2024)、CLIP(2021)。
- 一句话判断:模态边界正在消失:统一 token 化 + 统一训练目标是大方向;"原生"目前更多体现在架构与交互,其对齐与安全复杂度也同步上升(见多模态大模型)。
- 对从业者的启示:产品需要图片/语音输入时,优先选原生多模态 API,别自己拼 CLIP+LLM 链路——后者在多轮对话与对齐上的调试成本远高于文本场景。
5. Agent 与工具使用:从"对话"到"做事"
演化脉络:ReAct(2022)立起"推理+行动交错"的范式;Toolformer(2023)让模型学会自选工具;2023 年 function calling 成为 API 标配,AutoGPT 证明"LLM 循环调工具"可行但不可靠;2024 年 MCP(Model Context Protocol,2024 年 11 月)把"工具/记忆/资源"标准化;Devin 展示"AI 软件工程师"产品形态;多智能体协作(MetaGPT 等)进入工程实践。
- 代表论文/模型:ReAct(2022)、Toolformer(2023)、MetaGPT(2023)。
- 一句话判断:Agent 的瓶颈已从"能不能调工具"转移到"可靠性、记忆、评估与成本控制";提示注入与失控风险是部署时的硬门槛(见基于 LLM 的 Agent)。
- 对从业者的启示:Agent 上线前先做三件事:工具白名单与权限最小化、提示注入测试、单任务成本上限;评估用"任务完成率"而不是"对话流畅度"。
6. Mamba 与状态空间模型:挑战注意力复杂度
演化脉络:状态空间模型(SSM)从 S4(2021)开始被认真研究;Mamba(2023.12)用选择性状态空间模型(S6)把序列建模做到线性复杂度、且硬件友好,在长序列上可超过同规模 Transformer;随后 Mamba-2(SSD 统一注意力与 SSM)、Jamba(Mamba+Transformer 混合)、Zamba 等出现。混合架构(注意力管检索/局部、SSM 管长程压缩)成为最务实的路线。
- 代表论文/模型:Mamba(2023)、Mamba-2(2024)、Jamba(2024)。
- 一句话判断:"纯注意力"未必是终局,混合架构正在成为实用答案;但目前最强商用/开源模型仍是 Transformer 系,"替代"言之尚早,"混合"已是现实(见Transformer 架构详解)。
- 对从业者的启示:超长序列 + 成本敏感的场景可以试验 Mamba 系或混合模型;但工具链(微调、量化、推理引擎)的支持程度目前仍是 Transformer 最优,选型要算生态账。
7. 量化与高效推理:把大模型装进单卡
演化脉络:量化从训练后 PTQ(GPTQ、AWQ)到 4-bit(GGUF/llama.cpp 生态)再到 FP8/FP4 训练推理一体化;QLoRA 让单卡 24GB 微调 65B 成为可能;推理引擎(vLLM 的 PagedAttention、SGLang、TensorRT-LLM)把吞吐提了一个数量级;"稀疏激活 + 量化 + 连续批处理"组合拳成为部署标准配置。
- 代表论文/模型:QLoRA(2023)、PagedAttention/vLLM(2023)。
- 一句话判断:量化与批处理已让"开源大模型本地跑"成为常规操作,成本不再是开源路线的主要阻碍;精度损失在大多数任务 <1%(见部署与服务化与推理基础)。
- 对从业者的启示:部署标准流程已是"量化 + 连续批处理 + 推理引擎"三件套;但"<1% 损失"只在常规任务成立,敏感场景(数学、事实抽取)必须做量化前后回归测试。
8. 开源追平闭源
演化脉络:GPT-2(2019)开源但模型小;Llama 1(2023.2)打开局面;Llama 2(2023.7)开源权重 + 商用许可;Llama 3(2024,8B/70B/405B,15T+ token)把开源上限推到 405B;Mistral/Mixtral、Qwen 系列、DeepSeek-V3/R1、GLM 等持续追近 GPT-4/Claude 梯队;2025 年起,部分榜单(数学、代码)上开源已可与闭源打平甚至超越。
- 代表论文/模型:Llama 3(2024)、Llama 2(2023)、DeepSeek-V3(2024)。
- 一句话判断:开源与闭源的差距正在从"能力"转移到"安全与产品化"——权重开放让审查、微调、本地化成为可能,也带来滥用与投毒的新议题(见Llama 与开源生态与安全与风险)。
- 对从业者的启示:开源让"私有化部署 + 领域微调"成为可行路线,数据不出域是硬需求时的首选;但要建立配套的合规与安全审查流程,别把"开源"当"免费"。
9. 评测新范式:从"刷榜"到"能测出真能力"
演化脉络:GLUE/SuperGLUE 时代结束后,MMLU/GSM8K/HumanEval 成为标杆,但很快被指出饱和与数据污染(contamination);社区转向:①人类盲评聚合(Chatbot Arena 的 Elo);②LLM-as-a-judge(模型互相打分,但存在位置/自我偏好偏差);③能力分层评测(数学、代码、长文本、工具使用分开测);④推理时扩展相关的新基准(如 AIME、GPQA)。
- 代表论文/模型:Chatbot Arena(2023,LMSYS)、MT-Bench(2023)。
- 一句话判断:"单一基准分数"正在失去意义,"评估体系"成为工程与研究的独立学科;任何 SOTA 声明都要追问评测协议与数据污染(见评测与基准与评测实战)。
- 对从业者的启示:自建评测别只跟榜单:用 Arena 风格人类盲评 + LLM-as-a-judge + 自建 golden set 三件套,并定期换新题防污染。
三、趋势一览表
| 趋势 | 代表论文/模型 | 一句话判断 | 站内展开 |
|---|---|---|---|
| 推理时扩展 | o1、o3、DeepSeek-R1 | 第四条可扩展维度,改变成本与评测结构 | 规模法则 |
| 长上下文 | Gemini 1.5(1M)、YaRN、FlashAttention | 装得进去 ≠ 用得好,与 RAG 互补 | 上下文与长文本 |
| MoE 大规模化 | Mixtral、DeepSeek-V3 | 激活参数决定成本,稀疏成主流 | MoE、MoE 案例 |
| 多模态原生 | GPT-4o、Gemini、Sora | 模态边界消失,统一 token 化 | 多模态大模型 |
| Agent 与工具 | ReAct、MCP、Devin | 瓶颈在可靠性/记忆/评估/安全 | Agent |
| Mamba/SSM | Mamba、Mamba-2、Jamba | 线性复杂度可行,混合架构是务实答案 | Transformer |
| 量化推理 | QLoRA、vLLM、GPTQ/AWQ | 本地部署成为常规,成本不再是阻碍 | 部署 |
| 开源追平闭源 | Llama 3、Qwen、DeepSeek | 差距转移至安全与产品化 | Llama 生态 |
| 评测新范式 | Chatbot Arena、MT-Bench | 评估成为独立学科,告别单一分数 | 评测 |
四、前沿时间线(2023-2025 关键节点)
把九个趋势压进一条时间线,看它们如何交织:
| 时间 | 事件 | 归属趋势 |
|---|---|---|
| 2023.03 | GPT-4 发布(多模态输入、考试级水平) | 能力上限 / 多模态 |
| 2023.07 | Llama 2 开源权重 + 商用许可 | 开源追平 |
| 2023.09 | vLLM 开源(PagedAttention) | 量化推理 / 系统 |
| 2023.12 | Mixtral 8×7B 与 Mamba 同期发布 | MoE / SSM |
| 2024.02 | Gemini 1.5(100 万 token)、Sora 公布 | 长上下文 / 多模态 |
| 2024.03 | Claude 3、Jamba(Mamba+Transformer 混合) | 开源 / 混合架构 |
| 2024.05 | GPT-4o(原生多模态、实时语音) | 多模态原生 |
| 2024.07 | Llama 3 405B 开源(15T+ token) | 开源追平 |
| 2024.09 | OpenAI o1 发布 | 推理时扩展 |
| 2024.12 | DeepSeek-V3(671B/37B 激活,低成本训练) | MoE 大规模化 |
| 2025.01 | DeepSeek-R1(纯 RL 推理模型,开源) | 推理时扩展 + 开源 |
| 2025 年中 | 数学/代码等榜单上开源与闭源打平(以官方发布为准) | 开源追平 |
读这条时间线可以发现一个规律:2023 年的"模型发布"在 2024 年变成"系统+模型双线发布",2025 年变成"模型+方法+权重全开源"——开放程度与工程复杂度同步上升,这正是开源追平闭源的力量。
五、趋势之间的相互关系
九大趋势不是孤立的,它们互相咬合:
| 关系 | 说明 |
|---|---|
| 推理时扩展 ↔ 开源追平 | DeepSeek-R1 把 test-time 从闭源方向变成开源标杆,两者互相加速 |
| 长上下文 ↔ 量化推理 | FlashAttention 让长上下文可行;量化与 KV Cache 优化让长上下文成本可承受 |
| MoE ↔ 开源追平 | DeepSeek-V3 用 MoE 把训练成本打到约 1/10,是开源追平闭源的关键筹码 |
| 多模态 ↔ Agent | 多模态 Agent(看屏幕、操作浏览器)把两个趋势合成一个产品形态 |
| 评测新范式 ↔ 其他全部 | 每个趋势都带来新评测需求,评测反过来暴露新问题(如 o1 的推理成本评估) |
六、按角色关注哪些趋势
不必九个都追,按你的角色聚焦:
| 角色 | 优先关注 | 次要关注 |
|---|---|---|
| 算法工程师 / 应用开发 | 量化推理、长上下文、Agent、开源追平 | 推理时扩展(API 可用性) |
| 研究者 | 推理时扩展、Mamba/SSM、评测新范式 | MoE 大规模化 |
| 产品 / 非算法 | 开源追平、Agent、多模态原生 | 其他(了解即可) |
| 部署 / SRE | 量化推理、MoE(显存与调度) | 长上下文 |
七、一篇前沿论文怎么读(示例:DeepSeek-R1)
前沿论文读法与经典论文完全一样,只是多了"时效性"变量:先判断值不值得读,再决定读到多深。以 DeepSeek-R1 为例走一遍:
text
拿到论文:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL
第一遍(15 分钟):判断要不要精读
├─ 摘要:用纯强化学习(GRPO)激励推理能力,无监督微调,开源权重
├─ 图表:AIME/GPQA 分数对比、R1-Zero 的反思行为示例
├─ 结论:推理时扩展可以被开源复现
└─ 判断:里程碑级(公开权重 + 完整技术报告),值得第二遍
第二遍(1 小时):理解机制
├─ 方法:GRPO 替代 PPO(去掉 critic,用组内相对优势),冷启动数据 + 两阶段 RL
├─ 消融:RL 与 RLVR(可验证奖励)各自贡献什么;R1-Zero 为什么不稳定
├─ 局限:对"可验证答案"的任务依赖强,格式化奖励可能过度拟合
└─ 产出:能一句话说清"GRPO 为什么省显存、为什么比 PPO 更适合推理训练"
第三遍(可选):找改进点
├─ 追问:蒸馏到小模型为什么仍然有效?RL 能复制到代码/Agent 场景吗?
├─ 改进假设:把 GRPO 用于工具调用训练
└─ 产出:一页 related work + 一个可验证假设这套流程的依据在判断论文好坏与三遍读法:第一遍解决"读不读",第二遍解决"读多透",第三遍解决"往哪走"。前沿论文最大的陷阱是"第一遍就精读"——把不值得读的论文花了两小时。
八、如何持续跟上前沿
- 订阅 arXiv 摘要(cs.CL + cs.LG),每周扫一遍标题(方法见阅读纪律与 FAQ)。
- 跟住 4~6 个实验室/作者:OpenAI、DeepMind、Anthropic、Meta AI、斯坦福/伯克利/清华/北大等(
@作者的 X/GitHub)。 - 看模型发布而不是看宣传:新模型发布时读其技术报告与评测卡,而不是读自媒体标题。
- 回读本页:每季度回来对照一次"九大趋势"有没有新增、有没有反转——把论文地图和本页一起更新,就是你个人的前沿坐标系。
- 新模型档案查主流模型档案,数据集的时效性以官方发布为准。
关于"前沿焦虑"
不必读全所有新论文。前沿的正确打开方式是"每条支流每周只盯 1~2 篇里程碑",其余靠综述(survey)与二手中转。判断一篇是否值得精读的标准,见阅读纪律与 FAQ的"怎么判断论文好坏"。
延伸阅读
- 阅读路径 —— 前沿之外的基础清单,先打地基再追新
- 论文地图 —— 本页趋势在时间线中的位置
- 规模法则 —— 推理时扩展的理论背景
- MoE 与超大规模模型 —— MoE 趋势的完整案例
- 多模态大模型 —— 多模态趋势的完整案例
- 基于 LLM 的 Agent —— Agent 趋势的完整案例
参考资料
本页引用的关键原文与官方资料(真实链接):
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(2025) —— 推理时扩展的开源样本
- OpenAI. Learning to Reason with LLMs(o1 发布博客,2024) —— o1 官方说明
- Team Gemini. Gemini 1.5(2024) —— 百万上下文
- DeepSeek-V3 Technical Report(2024) —— MoE 大规模化
- Gu & Dao. Mamba(2023) —— 状态空间模型
- Dao & Gu. Mamba-2(2024) —— SSD 统一框架
- Dettmers et al. QLoRA(2023) —— 4-bit 高效微调
- Kwon et al. PagedAttention / vLLM(2023) —— 推理吞吐优化
- Touvron et al. Llama 3(2024) —— 开源追平闭源
- Chiang et al. Chatbot Arena(2024) —— 人类盲评聚合
- Zheng et al. MT-Bench / LLM-as-a-judge(2023) —— 评测新范式
- OpenAI. Video Generation Models as World Simulators(Sora,2024) —— 视频生成技术报告