外观
阅读路径
一句话定位:本页是一张"读什么、按什么顺序读、每篇读到多深"的决策表。它把散落在 arXiv 上的论文整理成三条可执行的路线,无论你是两小时入门还是计划做研究,都能从这里拿到起点。
一、先立两个原则
1. 先横向再纵向
先读"覆盖面广"的里程碑论文建立坐标系(见论文地图),再对其中一两篇做纵向精读(见经典论文精读)。一上来就死磕某篇 2025 年新论文,往往既读不懂,也浪费了建立全局观的机会。
为什么这个顺序有效?因为新论文默认你是"知道上下文的人":它假设你读过 Transformer、知道 RLHF、认得 MoE。没有横向坐标系时,新论文的每一句话都在引用你不知道的东西;有了坐标系后,新论文的增量信息只有薄薄一层。读论文的成本是"上下文",而上下文来自横向积累。
2. 每篇明确"读多深"
同一篇论文,入门读摘要+结论,工程读方法+实验,研究读推导+复现。给每篇定深度,比硬啃全文更高效。深度的完整分级(三遍读法)见阅读纪律与 FAQ,这里先给一个判断准则:
| 你的目标 | 建议深度 | 对应遍数 |
|---|---|---|
| 了解趋势、能聊天 | 摘要 + 引言 + 结论 | 第一遍 |
| 判断能否用于业务 | 方法 + 实验 + 消融 + 局限 | 第二遍 |
| 提出改进、做研究 | 全文 + 推导 + 复现 | 第三遍 |
二、核心必读清单(约 12 篇)
下表是本站认定的"必读主线",覆盖从架构到系统到对齐的完整链路。注:按 spec 口径合并计数约 12 篇;下表按论文逐篇列示(RLHF 与 DPO 合并为一组,共 13 行)。每篇的精读版在经典论文精读。
| # | 论文(年份) | 一句话为什么必读 | 读法:重点章节 | 读完能回答 |
|---|---|---|---|---|
| 1 | Attention Is All You Need(2017) | Transformer 一切的起点,自注意力+多头+位置编码 | 摘要、§3 模型架构、§5 训练与结果 | 自注意力为什么能替代 RNN? |
| 2 | GPT-1(2018) | 第一次"生成式预训练+微调",解码器路线开山 | 摘要、§3 框架、表 1 结果 | 预训练+微调为什么省数据? |
| 3 | GPT-2(2019) | 证明"预训练即可零样本迁移",引出规模信念 | 摘要、§2 方法、§4 结果 | 零样本是怎么"顺带"发生的? |
| 4 | BERT(2019) | 双向编码器+掩码语言模型,理解任务的统治范式 | 摘要、§3 预训练目标、§4 消融 | 双向为什么对理解更重要? |
| 5 | GPT-3(2020) | 175B 参数 + few-shot,规模法则的实证宣言 | 摘要、§2 方法、§3.9 局限、§3 结果 | few-shot 的效果随规模怎么变? |
| 6 | Scaling Laws(2020) | 损失随参数/数据/算力幂律下降,指导"钱花在哪" | 摘要、§3 幂律、§4 迁移、图 1-4 | 加参数还是加数据? |
| 7 | Chinchilla(2022) | 计算最优配比:参数与 token 约 1:20,纠正"越大越好" | 摘要、§4 最优比例、表 3 对比 | 为什么 70B 能赢 280B? |
| 8 | InstructGPT(2022) | RLHF 三步法,ChatGPT 的技术母本 | 摘要、§3 方法(SFT/RM/PPO)、§4 人类评估 | 模型怎么从"会说话"变"听话"? |
| 9 | RLHF(2017)与 DPO(2023) | 一组:偏好学习从"训练奖励模型"到"直接用偏好" | RLHF:§2 方法;DPO:§3 推导、表 1 | 为什么 DPO 能省掉奖励模型? |
| 10 | LoRA(2021) | 参数高效微调,低秩更新,微调成本降低 10000 倍 | 摘要、§3.1 低秩参数化、§4 实验表 | 低秩假设为什么成立? |
| 11 | FlashAttention(2022) | 注意力 IO 感知优化,显存 O(n²)→线性,长上下文前提 | 摘要、§3 算法、§5 加速比表 | 注意力瓶颈在算力还是显存带宽? |
| 12 | Chain-of-Thought(2022) | 大模型推理能力的钥匙,提示工程的分水岭 | 摘要、§2 方法、GSM8K 表、§4 消融 | 为什么小模型用 CoT 没用? |
| 13 | RAG(2020) | RAG 范式开山,幻觉缓解与知识注入的经典解 | 摘要、§3 模型(RAG-seq/token)、§4 实验 | 知识"外挂"比"内记"好在哪? |
怎么读这张表
不必按编号顺序全读。入门:先读 1、5、8、10;工程:重点读 10、11、13;研究:通读 6、7、9。每条主线的内部顺序见第六节依赖图。
三、三条路线:具体清单与阅读顺序
路线 A:两小时快速入门
目标:建立"Transformer 怎么工作 + 大模型为什么强 + 怎么让它听话"的骨架,能跟人聊、能看博客不迷路。
text
步骤 1(40 分钟):Attention Is All You Need → 只读摘要、引言、结论 + 看《The Illustrated Transformer》图解
步骤 2(30 分钟):GPT-1 → GPT-2 摘要对比,理解"解码器 + 预训练"路线
步骤 3(30 分钟):GPT-3 摘要 + 局限节,理解"规模 + few-shot"
步骤 4(20 分钟):InstructGPT 摘要 + 图 1,理解 RLHF 三步
产出:能说出"自注意力、因果掩码、预训练、few-shot、RLHF"各一句话这条路线的要求:不要求读懂公式,但要求每篇都能回答"问题/方法/效果"三句话。如果某个概念卡住(比如因果掩码),去查Transformer 架构详解或术语表,别硬扛。
路线 B:工程落地
目标:能判断"某篇论文方法能不能搬到我的业务",并动手微调/部署。
text
前置:先走完路线 A
步骤 1:LoRA 精读方法 + 实验 → 对照实践页[微调实战:LoRA 全流程](/practice/fine-tuning-practice)
步骤 2:RAG 论文精读 §3-§4 → 对照[case-studies RAG](/case-studies/rag)与[RAG 实战](/practice/rag-in-practice)
步骤 3:FlashAttention 读摘要 + 算法 → 理解长上下文与推理加速(配合[推理基础](/concepts/inference-fundamentals))
步骤 4:Chinchilla 读摘要 + 最优比例 → 理解"先加数据还是先加参数"
步骤 5:CoT 读方法 + GSM8K 结果 → 提示工程依据(配合[提示工程](/concepts/prompting))
产出:能给项目选"微调 vs RAG vs 提示"路线,并说出论文依据这条路线的要求:每篇都要读"消融 + 超参数 + 局限",并写下"迁移到我的场景的风险清单"。建议每读完一篇,就去实践指南对应的实践页看一眼工程化的落地方式——论文给原理,实践页给坑。
路线 C:做研究 / 追前沿
目标:站在 2025 年能读最新 arXiv、能提出并验证改进点。
text
前置:走完路线 A + B
步骤 1:通读 Scaling Laws 全文(含附录)与 Chinchilla §4 推导
步骤 2:RLHF 原始论文(Christiano 2017)→ InstructGPT → DPO 递进读,理解偏好学习的演化
步骤 3:选一个自己方向(对齐/系统/应用)从[前沿进展](/papers/frontier)反向追踪论文的引用链
步骤 4:复现一篇(建议 LoRA 或 FlashAttention 的最小实现),建立"读+写"闭环
产出:能写出一页纸的 related work,并提出一个可验证的改进假设这条路线的要求:读论文不是终点,写才是。每篇第三遍精读都要产出:机制解释、未做实验清单、改进假设。改进假设哪怕不验证,也要写下来——三个月后回看,你会惊讶自己的进步。
三条路线对比
| 维度 | 路线 A 入门 | 路线 B 工程 | 路线 C 研究 |
|---|---|---|---|
| 适合人群 | 初学者、产品/非算法岗 | 算法工程师、应用开发 | 研究生、研究员 |
| 总耗时 | 2 小时 | 2~3 周(每天 1 小时) | 持续进行 |
| 精读篇数 | 4 篇摘要级 | 6~8 篇精读 | 15+ 篇 + 持续跟踪 |
| 关键动作 | 看图解、抓概念 | 复现实验、写评估 | 推导、复现、提出假设 |
| 产出物 | 三句话笔记 | 迁移风险清单 | related work + 改进假设 |
| 检验标准 | 能答"为什么 GPT 系列成功" | 能上线一个基于论文方法的功能 | 能写 related work、能答辩 |
| 对应页面 | 经典论文精读 | 精读 + 前沿进展 + practice 模块 | 论文地图 + 前沿进展 |
四、按目标场景选论文:速查表
不知道从哪篇开始?按你的当下目标直接查:
| 你的场景 | 先读这些 | 配套页面 |
|---|---|---|
| 想理解 Transformer 与注意力 | 1、11 | Transformer 架构详解 |
| 想搞懂"为什么模型越大越强" | 6、7、5 | 规模法则 |
| 想做微调(SFT/LoRA) | 10、2 | 微调:SFT 与参数高效微调、微调实战 |
| 想理解对齐与 RLHF/DPO | 8、9 | 对齐:RLHF 与 DPO |
| 想做 RAG 或减少幻觉 | 13、12 | RAG 案例、RAG 实战 |
| 想优化推理/部署性能 | 11、3 | 推理基础、部署实战 |
| 想做评测/评估 | 6、7 | 评测与基准、评估实战 |
| 要面试算法岗 | 1、5、8、10、11、13 精读 | 面试题库 |
五、每篇论文"读哪些章节"的通用模板
不同论文结构不同,但大多数遵循 IMRaD 结构(引言-方法-结果-讨论)。一份通用取舍表:
| 章节 | 入门读者 | 工程读者 | 研究读者 |
|---|---|---|---|
| Abstract + 图表摘要 | 必读 | 必读 | 必读 |
| Introduction | 必读 | 必读 | 必读(重点看"gap"论证) |
| Related Work | 可跳过 | 略读 | 必读(找引用链) |
| Method | 只看图 | 精读 + 公式 | 精读 + 推导 |
| Experiments | 只看主表 | 精读消融 + 超参 | 精读 + 对照复现 |
| Limitations/Discussion | 必读 | 必读(判断迁移性) | 必读(找改进点) |
针对本栏目核心清单的具体取舍,已在第二节表格的"读法"列给出。三遍读法的完整流程见阅读纪律与 FAQ。
为什么"Limitations"对所有人都必读
很多读者跳过局限,恰恰丢了最值钱的信息。局限节通常包含:方法在什么条件下失效、作者没做什么实验、以及作者对未来工作的提示——这三者分别是工程迁移的边界、改进点的来源、趋势判断的线索。
六、依赖关系:推荐的前后顺序
论文之间有清晰的继承链,按依赖读事半功倍:
text
Attention Is All You Need ─┬─→ GPT-1 → GPT-2 → GPT-3 ─┬─→ InstructGPT → DPO
└─→ BERT ──────────────────┘
↓
Scaling Laws ←─ Chinchilla ←─ InstructGPT(理解"对齐的成本")
Attention ──→ FlashAttention(理解"同一架构如何加速")
GPT-3 ──→ RAG(理解"参数化知识 vs 检索知识")
GPT-3 ──→ CoT(理解"提示如何激发推理")一句话总结:架构先于规模,规模先于对齐,应用最后。任何路线都建议先读 Transformer 架构详解作为地基,再回到这份清单。
七、每篇论文的三个配套材料
单读论文原文效率有限,给清单里每篇配三件套:官方代码 / 图解或博客 / 本站精读页。先看图解建立直觉,再读原文核对细节,最后动手跑代码。
| # | 论文 | 图解/博客 | 官方代码或实现 | 本站精读 |
|---|---|---|---|---|
| 1 | Attention | The Illustrated Transformer | The Annotated Transformer | 精读 |
| 2 | GPT-1 | OpenAI 博客 | 社区实现(Hugging Face 仓库) | 精读 |
| 3 | GPT-2 | OpenAI 博客 | OpenAI/gpt-2 | 精读 |
| 4 | BERT | Jay Alammar 图解 | google-research/bert | 精读 |
| 5 | GPT-3 | OpenAI 博客 + 第三方长文解读 | 商业 API,无开源权重 | 阅读路径清单 |
| 6 | Scaling Laws | OpenAI 博客 | 无官方代码(可复现实验) | 精读 |
| 7 | Chinchilla | DeepMind 博客 | 无官方代码 | 精读 |
| 8 | InstructGPT | OpenAI 博客 | 商业 API,无开源权重 | 精读 |
| 9 | RLHF/DPO | 多篇图解(搜 "DPO explained") | Hugging Face TRL 实现 | 精读 |
| 10 | LoRA | HF PEFT 文档 | microsoft/LoRA | 精读 |
| 11 | FlashAttention | 论文博客 + 视频讲解 | Dao-AILab/flash-attention | 精读 |
| 12 | CoT | 多篇中文解读 | google-research/chain-of-thought | 精读 |
| 13 | RAG | HF 博客 | facebookresearch/rag | 精读 |
材料使用的顺序
图解(20 分钟)→ 原文精读(1~2 小时)→ 跑代码或读官方实现(可选)。不要反过来:一上来啃代码往往迷失在工程细节里。先有机制,再看实现。
八、路线 B 的 8 周执行计划(示例)
路线 B 最容易"有清单没行动"。给一份可照抄的 8 周计划(每周 4~5 小时):
| 周 | 主题 | 精读论文 | 实践动作 | 产出 |
|---|---|---|---|---|
| W1 | 架构地基 | Attention(第二遍) | 读Transformer 架构详解 | 三句话笔记 |
| W2 | 预训练范式 | GPT-1、GPT-2 | 浏览 gpt-2 官方代码 | 卡片 ×1 |
| W3 | 规模法则 | Scaling Laws、Chinchilla | 用 1:20 估算自己的数据需求 | 配比笔记 |
| W4 | 对齐 | InstructGPT | 读对齐概念页 | 卡片 ×1 |
| W5 | 微调 | LoRA | 跑一个 LoRA 微调 demo(见微调实战) | 迁移风险清单 |
| W6 | 检索 | RAG | 搭最小 RAG demo(见RAG 实战) | 卡片 ×1 |
| W7 | 推理 | FlashAttention、CoT | 做一次长上下文/提示对比实验 | 测评笔记 |
| W8 | 收口 | 回顾 8 周 + 前沿选读 | 更新个人地图 + 写总结 | 个人论文地图 |
计划的弹性
W5/W6 的 demo 如果时间不够,可以推迟到第 9 周——论文阅读的节奏可以断,但精读的质量不能打折。宁可 8 周读完 6 篇精读,也不要 8 周吞下 20 篇摘要。
九、时间预算与阅读节奏
"读论文"最大的敌人是没时间。给三档预算安排:
| 可用时间 | 每周建议 | 一个月能完成 |
|---|---|---|
| 每天 20 分钟 | 2 篇摘要级 + 周末 1 篇精读 | 路线 A + 路线 B 前 3 步 |
| 每天 1 小时 | 2 篇精读 + 1 张卡片笔记 | 路线 B 全部 + 部分前沿 |
| 每天 2 小时+ | 3 篇精读 + 1 个复现实验 | 路线 B + 路线 C 起步 |
时间不够时的"保底动作"
每周再忙,也请保持一个动作:扫一遍 arXiv 标题,选 1 篇读摘要(5 分钟)。这个动作维持的是"趋势敏感度",断了再捡回来很难。完整的追更方法见阅读纪律与 FAQ第六节。
十、从清单到精读:常见问题
问:清单 13 篇太多了,先精读哪几篇? 答:按你的场景查第四节。没有明确场景就按"1→5→8→10"四篇入门——这四篇覆盖架构、规模、对齐、应用四条主线的最小骨架。
问:精读一篇大概多久? 答:第一遍 15 分钟、第二遍 1~2 小时、第三遍半天到几天。路线 B 的精读只做到第二遍 + 局限分析即可。
问:读英文原文很吃力怎么办? 答:第一遍允许配翻译工具,但笔记必须用英文术语原文(如 self-attention、ablation),否则以后查文献、面试都对不上号。术语速查见术语表。
问:读完就忘怎么办? 答:不是记性问题,是缺产出物。用卡片笔记法每篇写五段卡,并把它放进你自己的论文地图。
常见误区
把"读了 50 篇摘要"当成"读过论文"。 摘要级阅读只能建立谈资,不能建立判断力。清单里至少要有 5~8 篇做到"精读 + 笔记"级别,否则面试官问"这篇的消融证明了什么"时你会卡住。
延伸阅读
- 论文地图 —— 本页清单的横向展开:把每篇放回时间线与主题坐标系
- 经典论文精读 —— 本页必读清单中 11 篇的逐篇精读(背景/方法/实验/局限)
- 前沿进展 —— 清单之外的新方向:o1、Mamba、MoE 规模化等
- 阅读纪律与 FAQ —— 三遍读法、笔记法、判断论文好坏的完整方法论
- 演进简史 —— 论文时间线的通俗叙事版,适合入门时对照阅读
参考资料
以下为必读清单论文的官方原文链接(arXiv),可直接获取全文:
- Vaswani et al. Attention Is All You Need(2017) —— Transformer 开山论文
- Radford et al. Improving Language Understanding by Generative Pre-Training(2018) —— GPT-1(OpenAI 官方 PDF,未正式发表到 arXiv)
- Radford et al. Language Models are Unsupervised Multitask Learners(2019) —— GPT-2
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers(2019) —— BERT
- Brown et al. Language Models are Few-Shot Learners(2020) —— GPT-3
- Kaplan et al. Scaling Laws for Neural Language Models(2020) —— 规模法则
- Hoffmann et al. Training Compute-Optimal Large Language Models(2022) —— Chinchilla
- Ouyang et al. Training Language Models to Follow Instructions with Human Feedback(2022) —— InstructGPT
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models(2021) —— LoRA
- Dao et al. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness(2022) —— FlashAttention
- Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(2022) —— CoT
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(2020) —— RAG