外观
阅读纪律与 FAQ
一句话定位:本页是把"读论文"从一次性冲动变成可持续习惯的操作手册——三遍读法、读不懂的对策、论文好坏的判断标准、卡片笔记法、追 arXiv 的流程,全部给可执行的动作。
一、怎么读一篇论文:三遍读法
这是 Karpathy 在 2019 年随笔 与学界通用的做法,三层递进,每层都有明确产出:
text
第一遍(15 分钟):抓骨架 —— 目标是"这篇讲了什么"
├─ 读 标题 → 摘要 → 图表 → 结论
├─ 快速翻方法节的图表与公式标题(不细读)
└─ 产出:能回答"问题、方法、效果"三句话
第二遍(1~2 小时):抠细节 —— 目标是"能不能复现/应用"
├─ 精读 方法节 + 实验节 + 消融
├─ 划出 关键公式、超参数、数据集、评测协议
└─ 产出:能回答"核心创新是什么、与基线差在哪、局限是什么"
第三遍(半天~几天):挑骨头 —— 目标是"能不能改进"
├─ 反向推导公式、找出论文的隐藏假设
├─ 设计"如果…会怎样"的对照实验
└─ 产出:能回答"这篇论文的改进方向"并写成笔记每一遍的检查清单
| 遍数 | 读完要能回答 | 答不出来怎么办 |
|---|---|---|
| 第一遍 | 问题是什么?方法是什么?效果如何? | 回到摘要和图表,10 分钟内必须能答出三句话,否则放回待读池 |
| 第二遍 | 核心创新?基线差在哪?消融证明了什么?局限? | 对照经典论文精读的同篇精读,看自己漏了哪层 |
| 第三遍 | 隐藏假设?没做的实验?我的改进点? | 和读过这篇的同行聊一次,或写下来过几天再读 |
什么时候该停
第一遍 15 分钟就发现"跟我的方向无关"——停,不丢人。不是每篇论文都值得第三遍。判断标准见第三节。
二、读不懂怎么办
读不懂是常态,不是障碍。按症状对症下药:
| 症状 | 真实原因 | 对策 |
|---|---|---|
| 摘要都看不懂 | 缺领域背景 | 先读对应概念页(如Transformer 架构详解、术语表),再回来 |
| 公式推不动 | 数学基础断层 | 跳公式读文字 + 看别人的推导笔记;公式不是论文的主体 |
| 图看不懂 | 不了解评测/数据 | 先读实验设置的文字说明,图配文字一起看 |
| 方法理解不了 | 缺乏直觉 | 找图解博客、讲课视频(Karpathy/HF 课程,见精选资源清单) |
| 读了就忘 | 没有产出物 | 逼自己写一页卡片笔记(见第四节),有产出才记得住 |
| 太长了读不完 | 目标不明确 | 回到阅读路径给这篇定"读多深",只读该读的章节 |
| 术语满天飞 | 没查术语就硬读 | 先扫一遍术语表,或者每遇陌生术语查一次,三次就熟 |
| 不知道它为什么重要 | 缺坐标系 | 去论文地图看它处在哪条支流、继承了谁 |
阅读前的 5 分钟准备
读不懂往往是因为没做准备。打开全文前花 5 分钟:
text
□ 这篇论文来自哪个机构/实验室?这决定可信度与资源水平
□ 它在[论文地图](/papers/map)的哪条支流?前置概念有哪些?
□ 我从标题能猜到什么问题?写下来
□ 我准备读到第几遍?定目标
□ 需要哪些前置材料(图解/视频/概念页)?先打开最错误的读法
从第一页的第一个公式开始"线性阅读",读两个小时卡在第三节。论文不是小说,是参考手册——先看地图(摘要+图表)再决定去哪层。这是从这里开始就强调的纪律。
三、怎么判断论文好坏
给论文打分的检查清单(每项 0/1 分,得分越高越值得精读):
| 维度 | 好论文的标志 | 坏论文的标志 |
|---|---|---|
| 问题 | 问题真实、普遍、有明确痛点 | 问题是为方法硬造出来的 |
| 方法 | 方法简洁,与问题强对应,有动机 | 方法花哨,是多个 trick 的拼接 |
| 实验 | 有公平基线与完整消融,公开代码/数据 | 只对比 SOTA 数字,没有消融,不公开代码 |
| 数字 | 报告置信区间/多次运行,说明评测协议 | 只报最好的一次,数字不可复现 |
| 诚实 | 认真写 Limitations,承认失败实验 | 回避局限,把负结果藏起来 |
| 影响 | 后续工作大量引用,范式级贡献 | 发布后无人问津,或只是炒作 |
LLM 领域的五个特有陷阱
大模型论文还有五类"领域特色问题",判断时单独检查:
| 陷阱 | 现象 | 怎么识别 |
|---|---|---|
| 数据污染 | 训练语料混入测试集(如 GSM8K 原题),分数虚高 | 查论文是否讨论 contamination,用新题重测 |
| 评测泄漏 | 用 API 模型当 judge,或基准集被反复刷 | 看评测协议、judge 的设置与偏差讨论 |
| 算力不透明 | 关键实验用了隐藏规模/隐藏预算 | 看算力描述、ablation 是否在同规模下做 |
| 提示工程掩盖 | 提升来自精心构造的 prompt 而非方法本身 | 看消融里"标准 prompt vs 论文 prompt"对比 |
| 商业化先行 | 论文滞后于产品(如部分闭源报告),证据不完整 | 看是否只给摘要级证据、缺消融 |
一条特别提醒
LLM 论文的"好"与"火"是两回事。 有的论文因为结论劲爆(如"涌现能力")被疯狂转发,但其实验证据可能很薄;有的论文平平无奇却因为提供了开源模型/数据成为基石。判断时先看"它给社区留下了什么可复用的东西"。
四、如何做笔记:卡片法
一个长期有效的格式——每篇论文一张卡,五段式。五个字段分别对应"问题/方法/数字/局限/我的场景",既是读后总结,也是未来检索的索引:
text
[论文卡] 题目:FlashAttention(Dao et al., 2022)
├─ 问题:注意力 O(n²) 显存,瓶颈在 IO 不在算力
├─ 方法:tiling 在 SRAM 上算 + 反向重算,精确 softmax
├─ 数字:加速约 2~4 倍(PyTorch 标准实现对比),显存 O(n²)→O(n)
├─ 局限:只优化标准注意力形态,不降算力复杂度
└─ 我的场景:长上下文 RAG 检索是否可受益 → 待验证再给一篇偏"概念型"的示例,展示两种写法:
text
[论文卡] 题目:Chinchilla(Hoffmann et al., 2022)
├─ 问题:Scaling Laws 只说了"损失随规模下降",没说参数和数据怎么配
├─ 方法:固定算力搜索最优 (N, D) 组合;结论约 1:20(每参数约 20 token)
├─ 数字:70B/1.4T 赢 Gopher 280B/300B;400+ 任务平均更优
├─ 局限:损失最优 ≠ 推理成本最优;能力涌现与损失不直接挂钩
└─ 我的场景:选基座模型时用 1:20 估算数据需求 → 已写入选型 checklist三条笔记纪律:
- 用自己的话写,禁止复制摘要。写不出来 = 没读懂。
- 每张卡只回答五个问题,多写不写(五段式见上)。
- 给卡片打标签(#架构 #对齐 #系统…),积累 30 张后按标签回看,你会看到自己的理解地图。
卡片怎么用起来
卡片不是收藏品。每周用 10 分钟做"卡片回看":挑一张旧的,尝试向自己复述;如果复述不出,说明那篇需要重读第二遍。能复述的才是你的,写下来的只是候选。
笔记工具随意:Obsidian、Notion、纯 Markdown 目录都行——工具不重要,产出物结构才重要。
五、阅读日志模板:每周 10 分钟的仪表盘
卡片是"每篇论文"的记录,日志是"每周投入产出"的记录。写日志能防止"读了白读"——因为日志强迫你回答三个问题:投入了什么、产出了什么、留下什么疑问。
text
[周志] 2025-W26(6.23–6.29)
├─ 本周精读:Chinchilla(第三遍)、RAG(第二遍)
├─ 本周摘要阅读:arXiv 14 篇(2 篇进待读池)
├─ 卡片产出:2 张(#规模 #检索)
├─ 新的疑问:
│ ① Chinchilla 的 1:20 在合成数据时代还成立吗?
│ ② RAG 的 chunk 大小对忠实度的影响有没有系统性实验?
├─ 下周计划:精读 DPO(第二遍)+ 跑一个检索最小实验
└─ 一句话总结:这周最大的认知更新是……三条使用规则:
- 固定时间写:每周日 10 分钟,养成习惯比内容完美重要。
- 疑问是最值钱的部分:疑问会积累成你下一个项目/研究的方向——别让它们流失。
- 每月回看一次"一句话总结"列:你会看见认知的变化,这是坚持下去最大的正反馈。
六、只看博客不读论文,行不行
分情况回答:
- 入门阶段:行。 博客、图解、课程视频是很好的"前读"材料,能帮你降低第一道门槛。
- 从业阶段:不行。 博客是二手信息:可能过时、可能失真、可能没有失败细节。判断一个方法能不能上生产,必须回到原文看消融、看局限、看评测协议。
- 一个折中: 用博客建立直觉,用论文验证判断——先博客后原文,而不是二选一。
博客与论文的适用边界:
| 问题 | 用博客解决 | 必须读论文 |
|---|---|---|
| "这个方法大概是什么" | 适合 | — |
| "这个方法能提升多少、为什么" | — | 适合(看消融与评测协议) |
| "它在我数据上会不会有效" | — | 适合(看局限与假设条件) |
| "最近有什么新东西" | 适合(作为线索) | 线索之后跟原文 |
反过来说
"只读论文不读博客"也一样低效。论文不教工程直觉(怎么调超参、怎么避坑),这部分靠实践指南与社区博客补。两手都要硬。
七、如何追 arXiv
arXiv 每天上百篇新论文,直接刷必淹。给出可执行的筛选流程:
text
订阅(每天 5 分钟)
├─ 关注分类:cs.CL(计算语言学)+ cs.LG(机器学习)
├─ 订阅关键词:Large Language Model / LLM / RLHF / Reasoning
├─ 过滤标准:只看标题 + 摘要,1 分钟判断是否进"待读池"
└─ 工具:arxiv-sanity、Hugging Face Papers、Papers with Code 的 daily feed
跟作者(每两周 10 分钟)
├─ 盯住 4~6 个实验室/作者(OpenAI、DeepMind、Anthropic、Meta AI 与目标院校)
├─ 用 X/GitHub/Google Scholar 的"作者关注"收更新
└─ 看到新论文先看是不是"里程碑级"再决定精读
每周归档(30 分钟)
├─ 本周待读池 → 按[阅读路径](/papers/paths)三路线分档
├─ 精读 1~2 篇,其余入"已读摘要"清单
└─ 更新你自己的[论文地图](/papers/map)工具与技巧速查
| 工具 | 用途 | 技巧 |
|---|---|---|
| arXiv | 论文源 | 用 cs.CL/cs.LG 分类订阅,或用 rss |
| arxiv-sanity / arxiv-sanity-lite | 论文排序与相似推荐 | 给关注的论文打 star,让它学你的口味 |
| Hugging Face Papers | 每日精选 | 每天只花 2 分钟过标题,进"待读池" |
| Papers with Code | 复现状态与代码 | 判断"可复现性"最快入口 |
| Google Scholar | 引文追踪 | 盯"被引"的爆炸增长,发现热点的最快方式 |
| X / GitHub | 作者动态 | 关注作者本人才是前沿的一手渠道 |
从一篇论文顺藤摸瓜:引用链方法
找到一篇好论文后,用两条引用链把它变成一批论文:
text
向后追(它引用了谁)→ 找思想源头:读它的 Related Work,按图索骥到奠基论文
向前追(谁引用了它)→ 找后续进展:在 Google Scholar / Semantic Scholar 看"Cited by"
横向找(同组同主题)→ 找完整脉络:同一团队同一方向的系列工作实践建议:每篇精读论文至少做一次"向后追"(搞清楚它站在谁的肩膀上),做研究时再做"向前追"。这比漫无目的地刷 arXiv 高效一个数量级。
别掉进"追更焦虑"
arXiv 是流水线不是书架:绝大多数新论文不值得精读。用"第三节判断标准"过滤——一周精读 1~2 篇已是专业研究者的节奏,剩下的读摘要就够了。
八、复现建议
复现是检验"读懂了"的唯一标准,但复现成本差异巨大:
| 复现级别 | 内容 | 成本 | 建议 |
|---|---|---|---|
| 概念复现 | 小规模玩具实现(如用 nanoGPT 复现"小模型损失下降") | 小时级 | 强烈推荐,入门必做 |
| 方法复现 | 复现 LoRA/FlashAttention 的最小版本 | 天级 | 进阶必做 |
| 完整复现 | 复现论文全部实验 | 周~月级 + 算力 | 只在做研究时做 |
| 百万级复现 | 复现 70B/1.4T 训练 | 不可行 | 不现实,读其技术报告即可 |
复现常见失败与排查
| 失败现象 | 最可能原因 | 排查方向 |
|---|---|---|
| 损失不降 | 学习率/数据格式错误 | 先跑通官方最小示例,再改自己的数据 |
| 效果比论文差很多 | 数据集/超参/评测协议不一致 | 逐项核对论文的"实验设置"清单 |
| 显存爆炸 | batch size 或序列长度超了 | 减小 batch/长度,或走 LoRA/量化路线 |
| 跑起来结果不稳 | 随机种子、采样参数未固定 | 固定种子,多跑几次报均值与方差 |
| 代码与论文对不上 | 官方代码迭代过 | 以论文为准,代码只当参考实现 |
具体路径:先用从零构建一个大模型的 nanoGPT 练手(几小时能跑),再复现一篇方法论文(推荐 LoRA,见微调实战)。"读 + 写"闭环一次,胜过读十篇。
九、高频问答速查
以下是关于读论文最常见的 10 个问题,一页速查:
| # | 问题 | 一句话答案 | 详见 |
|---|---|---|---|
| 1 | 每天只有 15 分钟怎么读? | 只做第一遍(抓骨架),保证趋势敏感度不断 | 第六节 |
| 2 | 论文里的数学推导必须读懂吗? | 不必;先抓机制与直觉,推导是第三遍的事 | 第二节 |
| 3 | 怎么判断哪篇论文重要? | 看被引数 + 是否开源 + 团队与实验可信度 | 第三节 |
| 4 | 需要订期刊/会议吗? | 不需要,arXiv + 会议官方收录就够了 | 第六节 |
| 5 | 英文读得慢怎么办? | 先过术语表再读;经典论文反复读 | 第二节 |
| 6 | 读多少篇算入门? | 精读 30 篇并写 30 张卡片,可达到"能讲透" | 第四节 |
| 7 | 论文视频/讲座能代替吗? | 视频建直觉、论文建证据,两者互补不替代 | 第五节 |
| 8 | 要不要读综述(survey)? | 要;先读综述建立领域地图,再读论文 | 论文地图 |
| 9 | 怎么验证自己真懂了? | 费曼法:不用笔记向别人讲清楚五段卡 | 第四节 |
| 10 | 总是读了就忘怎么办? | 间隔重复 + 卡片回看,产出物是记忆的锚 | 第四节 |
十、一条纪律
阅读纪律总纲
读论文是为了建立判断力,不是为了攒数量。 每周问自己三个问题:
- 这周我读透了几篇(不是读了几篇)?
- 我能不能用自己的话讲清楚它的机制与边界?
- 它对我的业务/研究产生了什么可验证的影响? 三问皆否,说明读得不够深——回到三遍读法,重读,而不是刷下一篇。
最后补一句心理建设
读论文的挫败感(读不懂、读完就忘、被前沿甩下)是系统性的,不是你个人的问题。方法论(本页)+ 节奏(每周固定时间)+ 产出物(卡片)三件套能显著缓解它。读过 100 篇的人也不是每篇都懂——他们只是更擅长决定"哪篇值得懂"。
延伸阅读
- 从这里开始 —— 栏目总入口,论文阅读的三重价值
- 阅读路径 —— 读完方法论后回去定你的路线与清单
- 经典论文精读 —— 用本页的方法去精读的第一批对象
- 论文地图 —— 建立坐标系,让笔记卡片有地方归位
- 精选资源清单 —— 图解、课程、复现仓库等补充弹药
参考资料
以下为方法论相关的真实公开资源:
- Karpathy. A Recipe for Training Neural Networks(2019) —— 三遍读法的原始出处之一,"读论文的工程态度"
- Karpathy. Let's build GPT(2023) —— 边写代码边精读 GPT 论文,复现式学习的范本
- arXiv —— 论文第一发布地;配合
cs.CL/cs.LG分类订阅 - arxiv-sanity(Karpathy) —— arXiv 论文筛选与排序工具
- Hugging Face Papers —— 每日精选论文榜单,适合快速过标题
- Papers with Code —— 论文 + 代码 + 复现状态聚合,判断"可复现性"最快入口