外观
论文地图
一句话定位:本页是一张"大模型论文的地图"——按时间线纵向展开、按主题横向切片,让你一眼看出哪篇是源头、哪篇是里程碑、哪些组成了同一条技术支流。有了坐标再读论文,就不会在两千篇 arXiv 里迷路。
一、为什么需要一张地图
读论文最大的成本不是"读",而是"决定读哪篇"。地图帮你解决三个问题:
- 知道源头在哪:比如 LoRA 的源头可以追溯到"低秩近似"思想与 Adapter(2019);理解源头才能判断一篇新论文是创新还是炒冷饭。
- 知道论文之间怎么继承:GPT-3 依赖 GPT-2 与 Scaling Laws 的信念;InstructGPT 依赖 RLHF;DPO 是对 RLHF 的简化。地图把这条"引用链"画出来。
- 知道自己的位置:你是做应用的,就盯"应用与系统"这条支流;做对齐的,盯"对齐时代"。
地图的通俗叙事版(不含论文细节)见演进简史,两页配合阅读效果最好。
二、地图总览:六大时代
| 时代 | 大致时间 | 主题词 | 一句话概括 | 对应栏目 |
|---|---|---|---|---|
| 前 Transformer 时代 | 1950s–2016 | 统计、表示、循环 | 从 n-gram 到神经网络表示,注意力作为"插件"出现 | 演进简史 |
| 架构革命 | 2017–2018 | 自注意力、预训练 | Transformer 出现,GPT 与 BERT 确立两条预训练路线 | Transformer 架构详解 |
| 规模时代 | 2019–2021 | 规模法则、few-shot | 参数量与数据量指数级上涨,"越大越好"成为信念 | 规模法则 |
| 对齐时代 | 2022–2023 | RLHF、指令遵循 | 从"会生成"到"听话",ChatGPT 破圈 | 对齐 |
| 应用与系统 | 2021–2024 | 微调、检索、加速 | 让大模型"用得起来":LoRA、RAG、FlashAttention | RAG |
| 前沿 | 2024–2025 | 推理扩展、原生多模态 | 推理时扩展、长上下文、MoE 规模化、开源追平闭源 | 前沿进展 |
三、逐时代地图
3.1 前 Transformer 时代(1950s–2016)
| 年份 | 论文 / 工作 | 一句话贡献 | 重要性 |
|---|---|---|---|
| 1948 | Shannon《通信的数学理论》 | 信息论奠基,"预测下一个符号"成为语言建模的理论根 | 源头 |
| 1980s–90s | n-gram 统计语言模型 | 用词序列频率估计概率,马尔可夫假设 | 源头 |
| 2003 | Bengio et al. A Neural Probabilistic Language Model | 用神经网络学习词表示与条件概率,神经语言模型开端 | 里程碑 |
| 2013 | Mikolov et al. Distributed Representations of Words and Phrases | Word2Vec:词向量训练技术,表示学习爆发 | 里程碑 |
| 2014 | Sutskever et al. Sequence to Sequence Learning | 编码器-解码器框架,端到端序列建模 | 里程碑 |
| 2014 | Bahdanau et al. Neural Machine Translation by Jointly Learning to Align | 第一次把注意力(attention)用于翻译 | 里程碑 |
| 2015–2016 | RNN/LSTM 语言模型与机器翻译系统 | 循环网络成为主力,但难以并行、难以长程记忆 | 背景 |
一句话记住这个时代
这个时代的核心矛盾是**"序列无法并行 + 记忆窗口太短"**。Transformer 恰好同时解决了这两个问题——所以它一来,时代就翻篇了。
时代小结:这个时代的遗产是"表示学习"(Word2Vec)与"序列建模"(Seq2Seq、注意力)两大思想,注意力当时只是翻译系统里的辅助插件。它留下的教训很明确:序列难以并行、记忆窗口太短,而后来 Transformer 的成功,恰恰是因为它同时拆掉了这两堵墙。
3.2 架构革命(2017–2018)
| 年份 | 论文 | 一句话贡献 | 重要性 |
|---|---|---|---|
| 2017 | Vaswani et al. Attention Is All You Need | Transformer:自注意力 + 多头 + 位置编码,可并行、可长程 | 源头(一切从这里开始) |
| 2018 | Radford et al. Improving Language Understanding by Generative Pre-Training(GPT-1) | 生成式预训练 + 微调,解码器路线开山 | 里程碑 |
| 2018 | Peters et al. Deep Contextualized Word Representations(ELMo) | 上下文相关的词向量,双向 LSTM | 过渡 |
| 2018 | Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers | 掩码语言模型 + 双向编码器,理解任务霸主 | 里程碑 |
| 2019 | Dai et al. Transformer-XL | 片段级循环 + 相对位置编码,长上下文早期尝试 | 支流 |
两条路线的分叉点
解码器路线(GPT) 单向、自回归、擅长生成、可做 few-shot;编码器路线(BERT) 双向、掩码、擅长理解、需要微调。2023 年以后,解码器路线基本胜出——但 BERT 的遗产(双向表示、嵌入、检索)至今活着。详见GPT 系列与BERT 与编码器家族。
时代小结:Transformer 的贡献不只是"一种新架构",而是同时点亮了"预训练+微调"与"自注意力"两个范式。GPT 与 BERT 的分叉(单向解码器 vs 双向编码器)决定了此后五年的路线之争,而两者的预训练目标(自回归 vs 掩码)至今仍是语言建模的核心概念。
3.3 规模时代(2019–2021)
| 年份 | 论文 | 一句话贡献 | 重要性 |
|---|---|---|---|
| 2019 | Radford et al. Language Models are Unsupervised Multitask Learners(GPT-2) | 1.5B 参数 + WebText,证明零样本迁移 | 里程碑 |
| 2019 | Liu et al. RoBERTa | 用更多数据与更久训练把 BERT 榨干 | 工程 |
| 2019 | Raffel et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5) | 统一"文本到文本"范式,编码器-解码器代表 | 支流 |
| 2020 | Kaplan et al. Scaling Laws for Neural Language Models | 损失随参数/数据/算力幂律下降,规模化的"理论执照" | 里程碑 |
| 2020 | Brown et al. Language Models are Few-Shot Learners(GPT-3) | 175B + few-shot,规模法则的实证宣言 | 里程碑 |
| 2020 | Lewis et al. Retrieval-Augmented Generation(RAG) | 检索增强生成,知识外挂 | 里程碑(应用支线) |
| 2020 | Lepikhin et al. GShard | 条件计算的稀疏专家模型,MoE 奠基 | 源头(MoE) |
| 2020 | Dosovitskiy et al. An Image is Worth 16x16 Words(ViT) | Transformer 统一视觉 | 支流 |
| 2021 | Fedus et al. Switch Transformers | 简化 MoE 路由,一万亿参数训练可行 | 里程碑(MoE) |
| 2021 | Chen et al. Evaluating Large Language Models Trained on Code(Codex) | 代码生成 + GitHub Copilot 背后 | 里程碑(应用) |
| 2021 | Radford et al. Learning Transferable Visual Models From Natural Language Supervision(CLIP) | 图文对比学习,多模态早期范式 | 源头(多模态) |
| 2021 | Hu et al. LoRA: Low-Rank Adaptation of Large Language Models | 参数高效微调,低秩更新 | 里程碑(应用) |
时代小结:规模法则把"感觉上越大越好"变成"定量可预测的幂律",GPT-3 用 175B 参数实证了 few-shot 能力。同期三条支流被铺开:MoE(GShard/Switch)为后来稀疏化奠基、ViT 把 Transformer 带入视觉、Codex 证明代码是绝佳训练语料。这一时代的主旋律是"加量"——加参数、加数据、加算力。
3.4 对齐时代(2022–2023)
| 年份 | 论文 / 工作 | 一句话贡献 | 重要性 |
|---|---|---|---|
| 2022 | Ouyang et al. Training Language Models to Follow Instructions with Human Feedback(InstructGPT) | SFT→RM→PPO 三步 RLHF,让模型"听话" | 里程碑 |
| 2022 | Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models | 思维链提示,激发推理能力 | 里程碑 |
| 2022 | Hoffmann et al. Training Compute-Optimal Large Language Models(Chinchilla) | 计算最优配比(约 1:20),纠正"越大越好" | 里程碑 |
| 2022 | Wang et al. Self-Consistency Improves Chain of Thought Reasoning | 多数投票聚合多条思维链 | 支流 |
| 2022 | Bai et al. Constitutional AI | 用 AI 反馈替代人类反馈做对齐 | 支流 |
| 2022 | Wang et al. Self-Instruct | 让模型自生成指令数据 | 支流 |
| 2022.11 | ChatGPT | InstructGPT 技术 + 对话产品化,破圈事件 | 里程碑(产品) |
| 2023 | Ouyang 团队 + OpenAI GPT-4 Technical Report | 多模态、考试水平,业界能力上限 | 里程碑 |
| 2023 | Touvron et al. Llama: Open and Efficient Foundation Language Models | 开源模型回归,社区生态引爆点 | 里程碑 |
| 2023 | Rafailov et al. Direct Preference Optimization(DPO) | 免奖励模型的偏好学习,简化 RLHF | 里程碑 |
| 2023 | Dettmers et al. QLoRA | 4-bit 量化 + LoRA,单卡可微调 65B | 里程碑(工程) |
| 2023 | Touvron et al. Llama 2 | 开源 + 商用许可 + 对话模型权重 | 里程碑 |
| 2023 | Jiang et al. Mistral 7B | 小模型打平大模型的工程胜利 | 支流 |
| 2023 | Jiang et al. Mixtral of Experts | 稀疏 MoE 开源化(8×7B) | 里程碑(MoE) |
时代小结:InstructGPT 证明"会生成"与"会听话"是两回事,RLHF 从此成为对齐的默认选项;ChatGPT 把技术产品化并破圈,Llama 则把权重开源引爆社区。这一时代的主题词从"能力"转向"可控",代价是引入了"对齐税"(对齐后部分基准分数略降)——直到后来人们发现,对齐与能力可以互相促进。
3.5 应用与系统(2021–2024)
| 年份 | 论文 | 一句话贡献 | 重要性 |
|---|---|---|---|
| 2022 | Dao et al. FlashAttention | IO 感知的精确注意力,显存 O(n²)→O(n) | 里程碑(系统) |
| 2022 | Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models | 推理+行动交错,Agent 范式奠基 | 里程碑(Agent) |
| 2023 | Schick et al. Toolformer | 让模型学会自己调用工具 | 支流(Agent) |
| 2023 | Kwon et al. Efficient Memory Management for Large Language Model Serving with PagedAttention(vLLM) | 分页 KV Cache,推理吞吐量级提升 | 里程碑(系统) |
| 2023 | Peng et al. LongLoRA | 高效扩展上下文(如 4k→32k) | 支流(长文本) |
| 2023 | Peng et al. YaRN | RoPE 长度外推的实用方法 | 支流(长文本) |
| 2023 | Dao et al. FlashAttention-2 | 并行化与更好的分块,再快约 2 倍 | 系统 |
| 2023 | Hong et al. MetaGPT | 多智能体协作软件公司 | 支流(Agent) |
时代小结:当模型与对齐都到位后,"用得起、跑得快"成为主线:LoRA 让微调平民化、FlashAttention 让长上下文成为可能、PagedAttention(vLLM)让推理吞吐量级提升、ReAct 为 Agent 立起范式。这个时代提醒我们:模型论文决定天花板,系统论文决定地板——多数工程场景的瓶颈是系统而非模型。
3.6 前沿(2024–2025)
| 年份 | 论文 / 工作 | 一句话贡献 | 重要性 |
|---|---|---|---|
| 2023.12 | Gu & Dao Mamba: Linear-Time Sequence Modeling with Selective State Spaces | 状态空间模型,线性复杂度、硬件友好 | 里程碑(架构新方向) |
| 2024.02 | Gemini 1.5 技术报告 | 百万级上下文窗口落地 | 里程碑(长文本) |
| 2024.03 | OpenAI Sora 技术报告 | 视频生成作为世界模拟器 | 支流(多模态) |
| 2024.03 | AI21 Jamba | Mamba+Transformer 混合架构开源 | 支流 |
| 2024.05 | OpenAI GPT-4o | 原生多模态 + 实时交互 | 里程碑(产品) |
| 2024 | Touvron et al. / Meta Llama 3 | 8B/70B/405B,15T token,开源追平闭源 | 里程碑(开源) |
| 2024.09 | OpenAI o1 | 推理时扩展:思考链 + 强化学习 | 里程碑(推理范式) |
| 2024.12 | DeepSeek DeepSeek-V3 | 671B 总参/37B 激活,极低成本训练 | 里程碑(MoE) |
| 2025.01 | DeepSeek DeepSeek-R1 | 纯 RL 训练推理模型,开源平替 o1 级能力 | 里程碑(推理+开源) |
时代小结:2024-2025 的关键词是"第四维扩展":推理时扩展(o1)用推理算力换能力,把规模法则从"训练算力"延伸到"推理算力";MoE 用稀疏激活把成本打下来;开源模型用"更小、更多数据、更高效训练"逼近甚至打平闭源。地图的"前沿"格,正以月为单位被改写。
四、主题切片:四大支流
如果按"主题"而不是按"时间"看,论文构成四条支流。精读时建议沿支流走,而不是按年代扫:
| 主题支流 | 关键论文(按时间) | 一句话主线 | 站内展开 |
|---|---|---|---|
| 架构 | Attention → GPT-1 → BERT → GPT-2 → FlashAttention → Mamba | 从"注意力是全部"到"注意力+状态空间混合" | Transformer、精读 |
| 规模 | Scaling Laws → GPT-3 → Chinchilla → MoE 系列 | 从"参数越多越好"到"计算最优"到"激活稀疏" | 规模法则、MoE |
| 对齐 | RLHF(2017) → InstructGPT → Constitutional AI → DPO → o1 式 RL | 从"让模型听话"到"让模型会推理" | 对齐 |
| 应用系统 | RAG → LoRA → ReAct → vLLM → 长上下文 | 让大模型"用得起、用得上、跑得快" | RAG、多模态 |
五、综述与进一步资源
地图上的每一条支流都有对应的综述(survey)论文,是"站在巨人的肩膀上扫地图"最快的方式:
- A Survey of Large Language Models(赵鑫等,2023) —— LLM 全景综述:架构、预训练、适配、评测、安全五大板块,适合整页地图一次过
- A Survey of Transformers(Tay et al., 2022) —— Transformer 全家族:注意力变体、架构变体、应用,架构支流的百科全书
- A Survey on Evaluation of Large Language Models(2023) —— 评测综述:任务分类、基准盘点、评测方法,评测支流的入口
此外,检索增强生成、Agent、推理等专题均有近年综述,可在 arXiv 搜索 "survey + 关键词" 找到——注意优先选近半年内更新、引用数高的版本。
怎么用综述
综述适合"先读"而非"精读":花一个下午过一遍综述,把地图画进脑子里,再按需回到具体论文。注意综述的信息有时滞,写综述的团队也可能有立场——最终判断回到原文。
六、从地图读出的四个大判断
看完整张地图,有四个跨时代的判断值得记住:
- 解码器路线最终胜出。 2018 年 GPT 与 BERT 平分秋色,到 2023 年解码器一统天下,连理解任务的标杆(如 MT-Bench、IFEval)也由解码器模型统治。双向表示的遗产并没有消失——它们进入了检索编码器、嵌入与评估(见编码器家族)。
- 能力来自预训练规模,对齐负责组织能力。 InstructGPT 的 1.3B 能赢 GPT-3 的 175B,不是因为对齐制造了能力,而是因为它把 175B 已有的能力"组织"得更好。没有规模,无从对齐——这解释了为什么对齐研究总是锚定在最大模型上。
- 系统论文决定能力能否落地。 FlashAttention、PagedAttention 这类论文不如"新模型"光鲜,但长上下文、低成本推理、单卡微调都建立在它们之上。看地图时别只盯"模型"那几条支流。
- 开源让研究闭环。 Llama 之后,每个突破几乎都有开源版本跟进,社区从"只读论文"变成"读论文 + 跑模型 + 复现"。DeepSeek-R1 甚至把"推理时扩展"这个闭源方向做成开源标杆。
七、怎么维护自己的地图
地图不是静态的,建议每读一篇新论文都做一次"地图操作":
text
□ 定位:这篇论文属于哪个时代、哪条支流?(查本站地图)
□ 归类:源头 / 里程碑 / 支流 / 综述?
□ 关系:它继承了什么,启发了什么?(查引用与被引)
□ 更新:如果是里程碑,补充进你自己的"前沿"格
□ 归档:把卡片笔记挂到对应支流下(见[卡片笔记法](/papers/faq))个人地图 = 本站地图 + 你自己的笔记。三个月后回看,你会有自己的"大模型技术演化史"。
八、从地图到路线
- 先横后纵:先花 10 分钟看第二节总览,明确你在哪条支流。
- 选里程碑:每条支流选 2~3 个标"里程碑"的论文去精读(清单见阅读路径)。
- 顺藤摸瓜:读完里程碑后,用它正文里的 Related Work 和引用链继续拓——地图是活的,越读越密。
- 对照精读页:经典论文精读已经替你精读了地图上最重要的一批节点,作为"坐标校准器"使用。
延伸阅读
- 阅读路径 —— 从地图选完论文后,拿到按目标的阅读顺序
- 经典论文精读 —— 地图上最重要节点的逐篇精读
- 前沿进展 —— 地图"前沿"格的最新填充,按趋势组织
- 演进简史 —— 地图的通俗叙事版
- GPT 系列:从 GPT-1 到 GPT-4o —— 架构革命到对齐时代的主线案例
参考资料
本页引用的关键论文(真实 arXiv 链接,按主题分组):
- Bengio et al. A Neural Probabilistic Language Model(2003) —— JMLR 官网版本
- Mikolov et al. Distributed Representations of Words and Phrases(2013) —— Word2Vec
- Bahdanau et al. Neural Machine Translation by Jointly Learning to Align and Translate(2014) —— 注意力机制源头
- Sutskever et al. Sequence to Sequence Learning with Neural Networks(2014) —— 编码器-解码器框架
- Peters et al. Deep Contextualized Word Representations(2018) —— ELMo
- Liu et al. RoBERTa(2019) —— 更强的 BERT
- Raffel et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(2019) —— T5
- Dai et al. Transformer-XL(2019) —— 长上下文早期尝试
- Fedus et al. Switch Transformers(2021) —— 万亿参数 MoE
- Chen et al. Evaluating Large Language Models Trained on Code(2021) —— Codex
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision(2021) —— CLIP
- Touvron et al. Llama(2023) —— Llama 1
- Jiang et al. Mistral 7B(2023) —— Mistral 7B
- Kwon et al. PagedAttention / vLLM(2023) —— 分页 KV Cache
- Peng et al. LongLoRA(2023) —— 高效扩展上下文
- Touvron et al. Llama 2(2023) —— Llama 2
- Team Gemini. Gemini 1.5: Unlocking multimodal understanding across millions of tokens(2024) —— 百万上下文
- Gu & Dao. Mamba(2023) —— 状态空间模型
- DeepSeek-AI. DeepSeek-V3 Technical Report(2024) —— MoE 大规模化
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(2025) —— 推理时扩展的开源样本