Skip to content

论文地图

本页速览 把大模型几十年的关键论文按时间线与主题排成一张地图:前 Transformer 时代、架构革命、规模时代、对齐时代、应用与系统、前沿,每篇一行给出年份、一句话贡献与重要性。

论文地图

一句话定位:本页是一张"大模型论文的地图"——按时间线纵向展开、按主题横向切片,让你一眼看出哪篇是源头、哪篇是里程碑、哪些组成了同一条技术支流。有了坐标再读论文,就不会在两千篇 arXiv 里迷路。

一、为什么需要一张地图

读论文最大的成本不是"读",而是"决定读哪篇"。地图帮你解决三个问题:

  1. 知道源头在哪:比如 LoRA 的源头可以追溯到"低秩近似"思想与 Adapter(2019);理解源头才能判断一篇新论文是创新还是炒冷饭。
  2. 知道论文之间怎么继承:GPT-3 依赖 GPT-2 与 Scaling Laws 的信念;InstructGPT 依赖 RLHF;DPO 是对 RLHF 的简化。地图把这条"引用链"画出来。
  3. 知道自己的位置:你是做应用的,就盯"应用与系统"这条支流;做对齐的,盯"对齐时代"。

地图的通俗叙事版(不含论文细节)见演进简史,两页配合阅读效果最好。

二、地图总览:六大时代

时代大致时间主题词一句话概括对应栏目
前 Transformer 时代1950s–2016统计、表示、循环从 n-gram 到神经网络表示,注意力作为"插件"出现演进简史
架构革命2017–2018自注意力、预训练Transformer 出现,GPT 与 BERT 确立两条预训练路线Transformer 架构详解
规模时代2019–2021规模法则、few-shot参数量与数据量指数级上涨,"越大越好"成为信念规模法则
对齐时代2022–2023RLHF、指令遵循从"会生成"到"听话",ChatGPT 破圈对齐
应用与系统2021–2024微调、检索、加速让大模型"用得起来":LoRA、RAG、FlashAttentionRAG
前沿2024–2025推理扩展、原生多模态推理时扩展、长上下文、MoE 规模化、开源追平闭源前沿进展

三、逐时代地图

3.1 前 Transformer 时代(1950s–2016)

年份论文 / 工作一句话贡献重要性
1948Shannon《通信的数学理论》信息论奠基,"预测下一个符号"成为语言建模的理论根源头
1980s–90sn-gram 统计语言模型用词序列频率估计概率,马尔可夫假设源头
2003Bengio et al. A Neural Probabilistic Language Model用神经网络学习词表示与条件概率,神经语言模型开端里程碑
2013Mikolov et al. Distributed Representations of Words and PhrasesWord2Vec:词向量训练技术,表示学习爆发里程碑
2014Sutskever et al. Sequence to Sequence Learning编码器-解码器框架,端到端序列建模里程碑
2014Bahdanau et al. Neural Machine Translation by Jointly Learning to Align第一次把注意力(attention)用于翻译里程碑
2015–2016RNN/LSTM 语言模型与机器翻译系统循环网络成为主力,但难以并行、难以长程记忆背景

一句话记住这个时代

这个时代的核心矛盾是**"序列无法并行 + 记忆窗口太短"**。Transformer 恰好同时解决了这两个问题——所以它一来,时代就翻篇了。

时代小结:这个时代的遗产是"表示学习"(Word2Vec)与"序列建模"(Seq2Seq、注意力)两大思想,注意力当时只是翻译系统里的辅助插件。它留下的教训很明确:序列难以并行、记忆窗口太短,而后来 Transformer 的成功,恰恰是因为它同时拆掉了这两堵墙。

3.2 架构革命(2017–2018)

年份论文一句话贡献重要性
2017Vaswani et al. Attention Is All You NeedTransformer:自注意力 + 多头 + 位置编码,可并行、可长程源头(一切从这里开始)
2018Radford et al. Improving Language Understanding by Generative Pre-Training(GPT-1)生成式预训练 + 微调,解码器路线开山里程碑
2018Peters et al. Deep Contextualized Word Representations(ELMo)上下文相关的词向量,双向 LSTM过渡
2018Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers掩码语言模型 + 双向编码器,理解任务霸主里程碑
2019Dai et al. Transformer-XL片段级循环 + 相对位置编码,长上下文早期尝试支流

两条路线的分叉点

解码器路线(GPT) 单向、自回归、擅长生成、可做 few-shot;编码器路线(BERT) 双向、掩码、擅长理解、需要微调。2023 年以后,解码器路线基本胜出——但 BERT 的遗产(双向表示、嵌入、检索)至今活着。详见GPT 系列BERT 与编码器家族

时代小结:Transformer 的贡献不只是"一种新架构",而是同时点亮了"预训练+微调"与"自注意力"两个范式。GPT 与 BERT 的分叉(单向解码器 vs 双向编码器)决定了此后五年的路线之争,而两者的预训练目标(自回归 vs 掩码)至今仍是语言建模的核心概念。

3.3 规模时代(2019–2021)

年份论文一句话贡献重要性
2019Radford et al. Language Models are Unsupervised Multitask Learners(GPT-2)1.5B 参数 + WebText,证明零样本迁移里程碑
2019Liu et al. RoBERTa用更多数据与更久训练把 BERT 榨干工程
2019Raffel et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5)统一"文本到文本"范式,编码器-解码器代表支流
2020Kaplan et al. Scaling Laws for Neural Language Models损失随参数/数据/算力幂律下降,规模化的"理论执照"里程碑
2020Brown et al. Language Models are Few-Shot Learners(GPT-3)175B + few-shot,规模法则的实证宣言里程碑
2020Lewis et al. Retrieval-Augmented Generation(RAG)检索增强生成,知识外挂里程碑(应用支线)
2020Lepikhin et al. GShard条件计算的稀疏专家模型,MoE 奠基源头(MoE)
2020Dosovitskiy et al. An Image is Worth 16x16 Words(ViT)Transformer 统一视觉支流
2021Fedus et al. Switch Transformers简化 MoE 路由,一万亿参数训练可行里程碑(MoE)
2021Chen et al. Evaluating Large Language Models Trained on Code(Codex)代码生成 + GitHub Copilot 背后里程碑(应用)
2021Radford et al. Learning Transferable Visual Models From Natural Language Supervision(CLIP)图文对比学习,多模态早期范式源头(多模态)
2021Hu et al. LoRA: Low-Rank Adaptation of Large Language Models参数高效微调,低秩更新里程碑(应用)

时代小结:规模法则把"感觉上越大越好"变成"定量可预测的幂律",GPT-3 用 175B 参数实证了 few-shot 能力。同期三条支流被铺开:MoE(GShard/Switch)为后来稀疏化奠基、ViT 把 Transformer 带入视觉、Codex 证明代码是绝佳训练语料。这一时代的主旋律是"加量"——加参数、加数据、加算力。

3.4 对齐时代(2022–2023)

年份论文 / 工作一句话贡献重要性
2022Ouyang et al. Training Language Models to Follow Instructions with Human Feedback(InstructGPT)SFT→RM→PPO 三步 RLHF,让模型"听话"里程碑
2022Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models思维链提示,激发推理能力里程碑
2022Hoffmann et al. Training Compute-Optimal Large Language Models(Chinchilla)计算最优配比(约 1:20),纠正"越大越好"里程碑
2022Wang et al. Self-Consistency Improves Chain of Thought Reasoning多数投票聚合多条思维链支流
2022Bai et al. Constitutional AI用 AI 反馈替代人类反馈做对齐支流
2022Wang et al. Self-Instruct让模型自生成指令数据支流
2022.11ChatGPTInstructGPT 技术 + 对话产品化,破圈事件里程碑(产品)
2023Ouyang 团队 + OpenAI GPT-4 Technical Report多模态、考试水平,业界能力上限里程碑
2023Touvron et al. Llama: Open and Efficient Foundation Language Models开源模型回归,社区生态引爆点里程碑
2023Rafailov et al. Direct Preference Optimization(DPO)免奖励模型的偏好学习,简化 RLHF里程碑
2023Dettmers et al. QLoRA4-bit 量化 + LoRA,单卡可微调 65B里程碑(工程)
2023Touvron et al. Llama 2开源 + 商用许可 + 对话模型权重里程碑
2023Jiang et al. Mistral 7B小模型打平大模型的工程胜利支流
2023Jiang et al. Mixtral of Experts稀疏 MoE 开源化(8×7B)里程碑(MoE)

时代小结:InstructGPT 证明"会生成"与"会听话"是两回事,RLHF 从此成为对齐的默认选项;ChatGPT 把技术产品化并破圈,Llama 则把权重开源引爆社区。这一时代的主题词从"能力"转向"可控",代价是引入了"对齐税"(对齐后部分基准分数略降)——直到后来人们发现,对齐与能力可以互相促进。

3.5 应用与系统(2021–2024)

年份论文一句话贡献重要性
2022Dao et al. FlashAttentionIO 感知的精确注意力,显存 O(n²)→O(n)里程碑(系统)
2022Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models推理+行动交错,Agent 范式奠基里程碑(Agent)
2023Schick et al. Toolformer让模型学会自己调用工具支流(Agent)
2023Kwon et al. Efficient Memory Management for Large Language Model Serving with PagedAttention(vLLM)分页 KV Cache,推理吞吐量级提升里程碑(系统)
2023Peng et al. LongLoRA高效扩展上下文(如 4k→32k)支流(长文本)
2023Peng et al. YaRNRoPE 长度外推的实用方法支流(长文本)
2023Dao et al. FlashAttention-2并行化与更好的分块,再快约 2 倍系统
2023Hong et al. MetaGPT多智能体协作软件公司支流(Agent)

时代小结:当模型与对齐都到位后,"用得起、跑得快"成为主线:LoRA 让微调平民化、FlashAttention 让长上下文成为可能、PagedAttention(vLLM)让推理吞吐量级提升、ReAct 为 Agent 立起范式。这个时代提醒我们:模型论文决定天花板,系统论文决定地板——多数工程场景的瓶颈是系统而非模型。

3.6 前沿(2024–2025)

年份论文 / 工作一句话贡献重要性
2023.12Gu & Dao Mamba: Linear-Time Sequence Modeling with Selective State Spaces状态空间模型,线性复杂度、硬件友好里程碑(架构新方向)
2024.02Gemini 1.5 技术报告百万级上下文窗口落地里程碑(长文本)
2024.03OpenAI Sora 技术报告视频生成作为世界模拟器支流(多模态)
2024.03AI21 JambaMamba+Transformer 混合架构开源支流
2024.05OpenAI GPT-4o原生多模态 + 实时交互里程碑(产品)
2024Touvron et al. / Meta Llama 38B/70B/405B,15T token,开源追平闭源里程碑(开源)
2024.09OpenAI o1推理时扩展:思考链 + 强化学习里程碑(推理范式)
2024.12DeepSeek DeepSeek-V3671B 总参/37B 激活,极低成本训练里程碑(MoE)
2025.01DeepSeek DeepSeek-R1纯 RL 训练推理模型,开源平替 o1 级能力里程碑(推理+开源)

时代小结:2024-2025 的关键词是"第四维扩展":推理时扩展(o1)用推理算力换能力,把规模法则从"训练算力"延伸到"推理算力";MoE 用稀疏激活把成本打下来;开源模型用"更小、更多数据、更高效训练"逼近甚至打平闭源。地图的"前沿"格,正以月为单位被改写。

地图是"截至 2025 年中"的快照

前沿这格每天都在变。地图的价值是结构(六个时代、四条主题支流),不是里面最新那条记录的时效。跟上更新的方法见前沿进展阅读纪律与 FAQ的追 arXiv 一节。

四、主题切片:四大支流

如果按"主题"而不是按"时间"看,论文构成四条支流。精读时建议沿支流走,而不是按年代扫:

主题支流关键论文(按时间)一句话主线站内展开
架构Attention → GPT-1 → BERT → GPT-2 → FlashAttention → Mamba从"注意力是全部"到"注意力+状态空间混合"Transformer精读
规模Scaling Laws → GPT-3 → Chinchilla → MoE 系列从"参数越多越好"到"计算最优"到"激活稀疏"规模法则MoE
对齐RLHF(2017) → InstructGPT → Constitutional AI → DPO → o1 式 RL从"让模型听话"到"让模型会推理"对齐
应用系统RAG → LoRA → ReAct → vLLM → 长上下文让大模型"用得起、用得上、跑得快"RAG多模态

五、综述与进一步资源

地图上的每一条支流都有对应的综述(survey)论文,是"站在巨人的肩膀上扫地图"最快的方式:

此外,检索增强生成、Agent、推理等专题均有近年综述,可在 arXiv 搜索 "survey + 关键词" 找到——注意优先选近半年内更新、引用数高的版本

怎么用综述

综述适合"先读"而非"精读":花一个下午过一遍综述,把地图画进脑子里,再按需回到具体论文。注意综述的信息有时滞,写综述的团队也可能有立场——最终判断回到原文。

六、从地图读出的四个大判断

看完整张地图,有四个跨时代的判断值得记住:

  1. 解码器路线最终胜出。 2018 年 GPT 与 BERT 平分秋色,到 2023 年解码器一统天下,连理解任务的标杆(如 MT-Bench、IFEval)也由解码器模型统治。双向表示的遗产并没有消失——它们进入了检索编码器、嵌入与评估(见编码器家族)。
  2. 能力来自预训练规模,对齐负责组织能力。 InstructGPT 的 1.3B 能赢 GPT-3 的 175B,不是因为对齐制造了能力,而是因为它把 175B 已有的能力"组织"得更好。没有规模,无从对齐——这解释了为什么对齐研究总是锚定在最大模型上。
  3. 系统论文决定能力能否落地。 FlashAttention、PagedAttention 这类论文不如"新模型"光鲜,但长上下文、低成本推理、单卡微调都建立在它们之上。看地图时别只盯"模型"那几条支流。
  4. 开源让研究闭环。 Llama 之后,每个突破几乎都有开源版本跟进,社区从"只读论文"变成"读论文 + 跑模型 + 复现"。DeepSeek-R1 甚至把"推理时扩展"这个闭源方向做成开源标杆。

七、怎么维护自己的地图

地图不是静态的,建议每读一篇新论文都做一次"地图操作":

text
□ 定位:这篇论文属于哪个时代、哪条支流?(查本站地图)
□ 归类:源头 / 里程碑 / 支流 / 综述?
□ 关系:它继承了什么,启发了什么?(查引用与被引)
□ 更新:如果是里程碑,补充进你自己的"前沿"格
□ 归档:把卡片笔记挂到对应支流下(见[卡片笔记法](/papers/faq))

个人地图 = 本站地图 + 你自己的笔记。三个月后回看,你会有自己的"大模型技术演化史"。

八、从地图到路线

  1. 先横后纵:先花 10 分钟看第二节总览,明确你在哪条支流。
  2. 选里程碑:每条支流选 2~3 个标"里程碑"的论文去精读(清单见阅读路径)。
  3. 顺藤摸瓜:读完里程碑后,用它正文里的 Related Work 和引用链继续拓——地图是活的,越读越密。
  4. 对照精读页经典论文精读已经替你精读了地图上最重要的一批节点,作为"坐标校准器"使用。

延伸阅读

参考资料

本页引用的关键论文(真实 arXiv 链接,按主题分组):