Skip to content

阅读路径

本页速览 从每年数千篇 arXiv 里筛出必读清单:约 12 篇核心必读论文、三条路线(两小时入门/工程落地/做研究)的具体文章清单与阅读顺序、每篇"读哪些章节"的读法,以及按目标场景选论文的速查表。

阅读路径

一句话定位:本页是一张"读什么、按什么顺序读、每篇读到多深"的决策表。它把散落在 arXiv 上的论文整理成三条可执行的路线,无论你是两小时入门还是计划做研究,都能从这里拿到起点。

一、先立两个原则

1. 先横向再纵向

先读"覆盖面广"的里程碑论文建立坐标系(见论文地图),再对其中一两篇做纵向精读(见经典论文精读)。一上来就死磕某篇 2025 年新论文,往往既读不懂,也浪费了建立全局观的机会。

为什么这个顺序有效?因为新论文默认你是"知道上下文的人":它假设你读过 Transformer、知道 RLHF、认得 MoE。没有横向坐标系时,新论文的每一句话都在引用你不知道的东西;有了坐标系后,新论文的增量信息只有薄薄一层。读论文的成本是"上下文",而上下文来自横向积累。

2. 每篇明确"读多深"

同一篇论文,入门读摘要+结论,工程读方法+实验,研究读推导+复现。给每篇定深度,比硬啃全文更高效。深度的完整分级(三遍读法)见阅读纪律与 FAQ,这里先给一个判断准则:

你的目标建议深度对应遍数
了解趋势、能聊天摘要 + 引言 + 结论第一遍
判断能否用于业务方法 + 实验 + 消融 + 局限第二遍
提出改进、做研究全文 + 推导 + 复现第三遍

二、核心必读清单(约 12 篇)

下表是本站认定的"必读主线",覆盖从架构到系统到对齐的完整链路。:按 spec 口径合并计数约 12 篇;下表按论文逐篇列示(RLHF 与 DPO 合并为一组,共 13 行)。每篇的精读版在经典论文精读

#论文(年份)一句话为什么必读读法:重点章节读完能回答
1Attention Is All You Need(2017)Transformer 一切的起点,自注意力+多头+位置编码摘要、§3 模型架构、§5 训练与结果自注意力为什么能替代 RNN?
2GPT-1(2018)第一次"生成式预训练+微调",解码器路线开山摘要、§3 框架、表 1 结果预训练+微调为什么省数据?
3GPT-2(2019)证明"预训练即可零样本迁移",引出规模信念摘要、§2 方法、§4 结果零样本是怎么"顺带"发生的?
4BERT(2019)双向编码器+掩码语言模型,理解任务的统治范式摘要、§3 预训练目标、§4 消融双向为什么对理解更重要?
5GPT-3(2020)175B 参数 + few-shot,规模法则的实证宣言摘要、§2 方法、§3.9 局限、§3 结果few-shot 的效果随规模怎么变?
6Scaling Laws(2020)损失随参数/数据/算力幂律下降,指导"钱花在哪"摘要、§3 幂律、§4 迁移、图 1-4加参数还是加数据?
7Chinchilla(2022)计算最优配比:参数与 token 约 1:20,纠正"越大越好"摘要、§4 最优比例、表 3 对比为什么 70B 能赢 280B?
8InstructGPT(2022)RLHF 三步法,ChatGPT 的技术母本摘要、§3 方法(SFT/RM/PPO)、§4 人类评估模型怎么从"会说话"变"听话"?
9RLHF(2017)与 DPO(2023)一组:偏好学习从"训练奖励模型"到"直接用偏好"RLHF:§2 方法;DPO:§3 推导、表 1为什么 DPO 能省掉奖励模型?
10LoRA(2021)参数高效微调,低秩更新,微调成本降低 10000 倍摘要、§3.1 低秩参数化、§4 实验表低秩假设为什么成立?
11FlashAttention(2022)注意力 IO 感知优化,显存 O(n²)→线性,长上下文前提摘要、§3 算法、§5 加速比表注意力瓶颈在算力还是显存带宽?
12Chain-of-Thought(2022)大模型推理能力的钥匙,提示工程的分水岭摘要、§2 方法、GSM8K 表、§4 消融为什么小模型用 CoT 没用?
13RAG(2020)RAG 范式开山,幻觉缓解与知识注入的经典解摘要、§3 模型(RAG-seq/token)、§4 实验知识"外挂"比"内记"好在哪?

怎么读这张表

不必按编号顺序全读。入门:先读 1、5、8、10;工程:重点读 10、11、13;研究:通读 6、7、9。每条主线的内部顺序见第六节依赖图。

三、三条路线:具体清单与阅读顺序

路线 A:两小时快速入门

目标:建立"Transformer 怎么工作 + 大模型为什么强 + 怎么让它听话"的骨架,能跟人聊、能看博客不迷路。

text
步骤 1(40 分钟):Attention Is All You Need → 只读摘要、引言、结论 + 看《The Illustrated Transformer》图解
步骤 2(30 分钟):GPT-1 → GPT-2 摘要对比,理解"解码器 + 预训练"路线
步骤 3(30 分钟):GPT-3 摘要 + 局限节,理解"规模 + few-shot"
步骤 4(20 分钟):InstructGPT 摘要 + 图 1,理解 RLHF 三步
产出:能说出"自注意力、因果掩码、预训练、few-shot、RLHF"各一句话

这条路线的要求:不要求读懂公式,但要求每篇都能回答"问题/方法/效果"三句话。如果某个概念卡住(比如因果掩码),去查Transformer 架构详解术语表,别硬扛。

路线 B:工程落地

目标:能判断"某篇论文方法能不能搬到我的业务",并动手微调/部署。

text
前置:先走完路线 A
步骤 1:LoRA 精读方法 + 实验 → 对照实践页[微调实战:LoRA 全流程](/practice/fine-tuning-practice)
步骤 2:RAG 论文精读 §3-§4 → 对照[case-studies RAG](/case-studies/rag)与[RAG 实战](/practice/rag-in-practice)
步骤 3:FlashAttention 读摘要 + 算法 → 理解长上下文与推理加速(配合[推理基础](/concepts/inference-fundamentals))
步骤 4:Chinchilla 读摘要 + 最优比例 → 理解"先加数据还是先加参数"
步骤 5:CoT 读方法 + GSM8K 结果 → 提示工程依据(配合[提示工程](/concepts/prompting))
产出:能给项目选"微调 vs RAG vs 提示"路线,并说出论文依据

这条路线的要求:每篇都要读"消融 + 超参数 + 局限",并写下"迁移到我的场景的风险清单"。建议每读完一篇,就去实践指南对应的实践页看一眼工程化的落地方式——论文给原理,实践页给坑。

路线 C:做研究 / 追前沿

目标:站在 2025 年能读最新 arXiv、能提出并验证改进点。

text
前置:走完路线 A + B
步骤 1:通读 Scaling Laws 全文(含附录)与 Chinchilla §4 推导
步骤 2:RLHF 原始论文(Christiano 2017)→ InstructGPT → DPO 递进读,理解偏好学习的演化
步骤 3:选一个自己方向(对齐/系统/应用)从[前沿进展](/papers/frontier)反向追踪论文的引用链
步骤 4:复现一篇(建议 LoRA 或 FlashAttention 的最小实现),建立"读+写"闭环
产出:能写出一页纸的 related work,并提出一个可验证的改进假设

这条路线的要求:读论文不是终点,才是。每篇第三遍精读都要产出:机制解释、未做实验清单、改进假设。改进假设哪怕不验证,也要写下来——三个月后回看,你会惊讶自己的进步。

三条路线对比

维度路线 A 入门路线 B 工程路线 C 研究
适合人群初学者、产品/非算法岗算法工程师、应用开发研究生、研究员
总耗时2 小时2~3 周(每天 1 小时)持续进行
精读篇数4 篇摘要级6~8 篇精读15+ 篇 + 持续跟踪
关键动作看图解、抓概念复现实验、写评估推导、复现、提出假设
产出物三句话笔记迁移风险清单related work + 改进假设
检验标准能答"为什么 GPT 系列成功"能上线一个基于论文方法的功能能写 related work、能答辩
对应页面经典论文精读精读 + 前沿进展 + practice 模块论文地图 + 前沿进展

四、按目标场景选论文:速查表

不知道从哪篇开始?按你的当下目标直接查:

你的场景先读这些配套页面
想理解 Transformer 与注意力1、11Transformer 架构详解
想搞懂"为什么模型越大越强"6、7、5规模法则
想做微调(SFT/LoRA)10、2微调:SFT 与参数高效微调微调实战
想理解对齐与 RLHF/DPO8、9对齐:RLHF 与 DPO
想做 RAG 或减少幻觉13、12RAG 案例RAG 实战
想优化推理/部署性能11、3推理基础部署实战
想做评测/评估6、7评测与基准评估实战
要面试算法岗1、5、8、10、11、13 精读面试题库

五、每篇论文"读哪些章节"的通用模板

不同论文结构不同,但大多数遵循 IMRaD 结构(引言-方法-结果-讨论)。一份通用取舍表:

章节入门读者工程读者研究读者
Abstract + 图表摘要必读必读必读
Introduction必读必读必读(重点看"gap"论证)
Related Work可跳过略读必读(找引用链)
Method只看图精读 + 公式精读 + 推导
Experiments只看主表精读消融 + 超参精读 + 对照复现
Limitations/Discussion必读必读(判断迁移性)必读(找改进点)

针对本栏目核心清单的具体取舍,已在第二节表格的"读法"列给出。三遍读法的完整流程见阅读纪律与 FAQ

为什么"Limitations"对所有人都必读

很多读者跳过局限,恰恰丢了最值钱的信息。局限节通常包含:方法在什么条件下失效、作者没做什么实验、以及作者对未来工作的提示——这三者分别是工程迁移的边界、改进点的来源、趋势判断的线索。

六、依赖关系:推荐的前后顺序

论文之间有清晰的继承链,按依赖读事半功倍:

text
Attention Is All You Need ─┬─→ GPT-1 → GPT-2 → GPT-3 ─┬─→ InstructGPT → DPO
                           └─→ BERT ──────────────────┘

Scaling Laws ←─ Chinchilla ←─ InstructGPT(理解"对齐的成本")
Attention ──→ FlashAttention(理解"同一架构如何加速")
GPT-3 ──→ RAG(理解"参数化知识 vs 检索知识")
GPT-3 ──→ CoT(理解"提示如何激发推理")

一句话总结:架构先于规模,规模先于对齐,应用最后。任何路线都建议先读 Transformer 架构详解作为地基,再回到这份清单。

七、每篇论文的三个配套材料

单读论文原文效率有限,给清单里每篇配三件套:官方代码 / 图解或博客 / 本站精读页。先看图解建立直觉,再读原文核对细节,最后动手跑代码。

#论文图解/博客官方代码或实现本站精读
1AttentionThe Illustrated TransformerThe Annotated Transformer精读
2GPT-1OpenAI 博客社区实现(Hugging Face 仓库)精读
3GPT-2OpenAI 博客OpenAI/gpt-2精读
4BERTJay Alammar 图解google-research/bert精读
5GPT-3OpenAI 博客 + 第三方长文解读商业 API,无开源权重阅读路径清单
6Scaling LawsOpenAI 博客无官方代码(可复现实验)精读
7ChinchillaDeepMind 博客无官方代码精读
8InstructGPTOpenAI 博客商业 API,无开源权重精读
9RLHF/DPO多篇图解(搜 "DPO explained")Hugging Face TRL 实现精读
10LoRAHF PEFT 文档microsoft/LoRA精读
11FlashAttention论文博客 + 视频讲解Dao-AILab/flash-attention精读
12CoT多篇中文解读google-research/chain-of-thought精读
13RAGHF 博客facebookresearch/rag精读

材料使用的顺序

图解(20 分钟)→ 原文精读(1~2 小时)→ 跑代码或读官方实现(可选)。不要反过来:一上来啃代码往往迷失在工程细节里。先有机制,再看实现。

八、路线 B 的 8 周执行计划(示例)

路线 B 最容易"有清单没行动"。给一份可照抄的 8 周计划(每周 4~5 小时):

主题精读论文实践动作产出
W1架构地基Attention(第二遍)Transformer 架构详解三句话笔记
W2预训练范式GPT-1、GPT-2浏览 gpt-2 官方代码卡片 ×1
W3规模法则Scaling Laws、Chinchilla用 1:20 估算自己的数据需求配比笔记
W4对齐InstructGPT对齐概念页卡片 ×1
W5微调LoRA跑一个 LoRA 微调 demo(见微调实战迁移风险清单
W6检索RAG搭最小 RAG demo(见RAG 实战卡片 ×1
W7推理FlashAttention、CoT做一次长上下文/提示对比实验测评笔记
W8收口回顾 8 周 + 前沿选读更新个人地图 + 写总结个人论文地图

计划的弹性

W5/W6 的 demo 如果时间不够,可以推迟到第 9 周——论文阅读的节奏可以断,但精读的质量不能打折。宁可 8 周读完 6 篇精读,也不要 8 周吞下 20 篇摘要。

九、时间预算与阅读节奏

"读论文"最大的敌人是没时间。给三档预算安排:

可用时间每周建议一个月能完成
每天 20 分钟2 篇摘要级 + 周末 1 篇精读路线 A + 路线 B 前 3 步
每天 1 小时2 篇精读 + 1 张卡片笔记路线 B 全部 + 部分前沿
每天 2 小时+3 篇精读 + 1 个复现实验路线 B + 路线 C 起步

时间不够时的"保底动作"

每周再忙,也请保持一个动作:扫一遍 arXiv 标题,选 1 篇读摘要(5 分钟)。这个动作维持的是"趋势敏感度",断了再捡回来很难。完整的追更方法见阅读纪律与 FAQ第六节。

十、从清单到精读:常见问题

问:清单 13 篇太多了,先精读哪几篇? 答:按你的场景查第四节。没有明确场景就按"1→5→8→10"四篇入门——这四篇覆盖架构、规模、对齐、应用四条主线的最小骨架。

问:精读一篇大概多久? 答:第一遍 15 分钟、第二遍 1~2 小时、第三遍半天到几天。路线 B 的精读只做到第二遍 + 局限分析即可。

问:读英文原文很吃力怎么办? 答:第一遍允许配翻译工具,但笔记必须用英文术语原文(如 self-attention、ablation),否则以后查文献、面试都对不上号。术语速查见术语表

问:读完就忘怎么办? 答:不是记性问题,是缺产出物。用卡片笔记法每篇写五段卡,并把它放进你自己的论文地图

常见误区

把"读了 50 篇摘要"当成"读过论文"。 摘要级阅读只能建立谈资,不能建立判断力。清单里至少要有 5~8 篇做到"精读 + 笔记"级别,否则面试官问"这篇的消融证明了什么"时你会卡住。

延伸阅读

  • 论文地图 —— 本页清单的横向展开:把每篇放回时间线与主题坐标系
  • 经典论文精读 —— 本页必读清单中 11 篇的逐篇精读(背景/方法/实验/局限)
  • 前沿进展 —— 清单之外的新方向:o1、Mamba、MoE 规模化等
  • 阅读纪律与 FAQ —— 三遍读法、笔记法、判断论文好坏的完整方法论
  • 演进简史 —— 论文时间线的通俗叙事版,适合入门时对照阅读

参考资料

以下为必读清单论文的官方原文链接(arXiv),可直接获取全文: