Skip to content

阅读纪律与 FAQ

本页速览 读 LLM 论文的完整方法论:三遍读法及每遍检查清单、读不懂的应对清单、判断论文好坏的标准(含 LLM 领域特有陷阱)、卡片笔记法、只看博客行不行、用 arXiv 持续跟进的工具与技巧、复现建议与排错。

阅读纪律与 FAQ

一句话定位:本页是把"读论文"从一次性冲动变成可持续习惯的操作手册——三遍读法、读不懂的对策、论文好坏的判断标准、卡片笔记法、追 arXiv 的流程,全部给可执行的动作。

一、怎么读一篇论文:三遍读法

这是 Karpathy 在 2019 年随笔 与学界通用的做法,三层递进,每层都有明确产出:

text
第一遍(15 分钟):抓骨架 —— 目标是"这篇讲了什么"
├─ 读 标题 → 摘要 → 图表 → 结论
├─ 快速翻方法节的图表与公式标题(不细读)
└─ 产出:能回答"问题、方法、效果"三句话

第二遍(1~2 小时):抠细节 —— 目标是"能不能复现/应用"
├─ 精读 方法节 + 实验节 + 消融
├─ 划出 关键公式、超参数、数据集、评测协议
└─ 产出:能回答"核心创新是什么、与基线差在哪、局限是什么"

第三遍(半天~几天):挑骨头 —— 目标是"能不能改进"
├─ 反向推导公式、找出论文的隐藏假设
├─ 设计"如果…会怎样"的对照实验
└─ 产出:能回答"这篇论文的改进方向"并写成笔记

每一遍的检查清单

遍数读完要能回答答不出来怎么办
第一遍问题是什么?方法是什么?效果如何?回到摘要和图表,10 分钟内必须能答出三句话,否则放回待读池
第二遍核心创新?基线差在哪?消融证明了什么?局限?对照经典论文精读的同篇精读,看自己漏了哪层
第三遍隐藏假设?没做的实验?我的改进点?和读过这篇的同行聊一次,或写下来过几天再读

什么时候该停

第一遍 15 分钟就发现"跟我的方向无关"——停,不丢人。不是每篇论文都值得第三遍。判断标准见第三节。

二、读不懂怎么办

读不懂是常态,不是障碍。按症状对症下药:

症状真实原因对策
摘要都看不懂缺领域背景先读对应概念页(如Transformer 架构详解术语表),再回来
公式推不动数学基础断层跳公式读文字 + 看别人的推导笔记;公式不是论文的主体
图看不懂不了解评测/数据先读实验设置的文字说明,图配文字一起看
方法理解不了缺乏直觉找图解博客、讲课视频(Karpathy/HF 课程,见精选资源清单
读了就忘没有产出物逼自己写一页卡片笔记(见第四节),有产出才记得住
太长了读不完目标不明确回到阅读路径给这篇定"读多深",只读该读的章节
术语满天飞没查术语就硬读先扫一遍术语表,或者每遇陌生术语查一次,三次就熟
不知道它为什么重要缺坐标系论文地图看它处在哪条支流、继承了谁

阅读前的 5 分钟准备

读不懂往往是因为没做准备。打开全文前花 5 分钟:

text
□ 这篇论文来自哪个机构/实验室?这决定可信度与资源水平
□ 它在[论文地图](/papers/map)的哪条支流?前置概念有哪些?
□ 我从标题能猜到什么问题?写下来
□ 我准备读到第几遍?定目标
□ 需要哪些前置材料(图解/视频/概念页)?先打开

最错误的读法

从第一页的第一个公式开始"线性阅读",读两个小时卡在第三节。论文不是小说,是参考手册——先看地图(摘要+图表)再决定去哪层。这是从这里开始就强调的纪律。

三、怎么判断论文好坏

给论文打分的检查清单(每项 0/1 分,得分越高越值得精读):

维度好论文的标志坏论文的标志
问题问题真实、普遍、有明确痛点问题是为方法硬造出来的
方法方法简洁,与问题强对应,有动机方法花哨,是多个 trick 的拼接
实验有公平基线与完整消融,公开代码/数据只对比 SOTA 数字,没有消融,不公开代码
数字报告置信区间/多次运行,说明评测协议只报最好的一次,数字不可复现
诚实认真写 Limitations,承认失败实验回避局限,把负结果藏起来
影响后续工作大量引用,范式级贡献发布后无人问津,或只是炒作

LLM 领域的五个特有陷阱

大模型论文还有五类"领域特色问题",判断时单独检查:

陷阱现象怎么识别
数据污染训练语料混入测试集(如 GSM8K 原题),分数虚高查论文是否讨论 contamination,用新题重测
评测泄漏用 API 模型当 judge,或基准集被反复刷看评测协议、judge 的设置与偏差讨论
算力不透明关键实验用了隐藏规模/隐藏预算看算力描述、ablation 是否在同规模下做
提示工程掩盖提升来自精心构造的 prompt 而非方法本身看消融里"标准 prompt vs 论文 prompt"对比
商业化先行论文滞后于产品(如部分闭源报告),证据不完整看是否只给摘要级证据、缺消融

一条特别提醒

LLM 论文的"好"与"火"是两回事。 有的论文因为结论劲爆(如"涌现能力")被疯狂转发,但其实验证据可能很薄;有的论文平平无奇却因为提供了开源模型/数据成为基石。判断时先看"它给社区留下了什么可复用的东西"。

四、如何做笔记:卡片法

一个长期有效的格式——每篇论文一张卡,五段式。五个字段分别对应"问题/方法/数字/局限/我的场景",既是读后总结,也是未来检索的索引:

text
[论文卡] 题目:FlashAttention(Dao et al., 2022)
├─ 问题:注意力 O(n²) 显存,瓶颈在 IO 不在算力
├─ 方法:tiling 在 SRAM 上算 + 反向重算,精确 softmax
├─ 数字:加速约 2~4 倍(PyTorch 标准实现对比),显存 O(n²)→O(n)
├─ 局限:只优化标准注意力形态,不降算力复杂度
└─ 我的场景:长上下文 RAG 检索是否可受益 → 待验证

再给一篇偏"概念型"的示例,展示两种写法:

text
[论文卡] 题目:Chinchilla(Hoffmann et al., 2022)
├─ 问题:Scaling Laws 只说了"损失随规模下降",没说参数和数据怎么配
├─ 方法:固定算力搜索最优 (N, D) 组合;结论约 1:20(每参数约 20 token)
├─ 数字:70B/1.4T 赢 Gopher 280B/300B;400+ 任务平均更优
├─ 局限:损失最优 ≠ 推理成本最优;能力涌现与损失不直接挂钩
└─ 我的场景:选基座模型时用 1:20 估算数据需求 → 已写入选型 checklist

三条笔记纪律:

  1. 用自己的话写,禁止复制摘要。写不出来 = 没读懂。
  2. 每张卡只回答五个问题,多写不写(五段式见上)。
  3. 给卡片打标签(#架构 #对齐 #系统…),积累 30 张后按标签回看,你会看到自己的理解地图。

卡片怎么用起来

卡片不是收藏品。每周用 10 分钟做"卡片回看":挑一张旧的,尝试向自己复述;如果复述不出,说明那篇需要重读第二遍。能复述的才是你的,写下来的只是候选。

笔记工具随意:Obsidian、Notion、纯 Markdown 目录都行——工具不重要,产出物结构才重要

五、阅读日志模板:每周 10 分钟的仪表盘

卡片是"每篇论文"的记录,日志是"每周投入产出"的记录。写日志能防止"读了白读"——因为日志强迫你回答三个问题:投入了什么、产出了什么、留下什么疑问。

text
[周志] 2025-W26(6.23–6.29)
├─ 本周精读:Chinchilla(第三遍)、RAG(第二遍)
├─ 本周摘要阅读:arXiv 14 篇(2 篇进待读池)
├─ 卡片产出:2 张(#规模 #检索)
├─ 新的疑问:
│  ① Chinchilla 的 1:20 在合成数据时代还成立吗?
│  ② RAG 的 chunk 大小对忠实度的影响有没有系统性实验?
├─ 下周计划:精读 DPO(第二遍)+ 跑一个检索最小实验
└─ 一句话总结:这周最大的认知更新是……

三条使用规则:

  1. 固定时间写:每周日 10 分钟,养成习惯比内容完美重要。
  2. 疑问是最值钱的部分:疑问会积累成你下一个项目/研究的方向——别让它们流失。
  3. 每月回看一次"一句话总结"列:你会看见认知的变化,这是坚持下去最大的正反馈。

六、只看博客不读论文,行不行

分情况回答:

  • 入门阶段:行。 博客、图解、课程视频是很好的"前读"材料,能帮你降低第一道门槛。
  • 从业阶段:不行。 博客是二手信息:可能过时、可能失真、可能没有失败细节。判断一个方法能不能上生产,必须回到原文看消融、看局限、看评测协议。
  • 一个折中: 用博客建立直觉,用论文验证判断——先博客后原文,而不是二选一

博客与论文的适用边界:

问题用博客解决必须读论文
"这个方法大概是什么"适合
"这个方法能提升多少、为什么"适合(看消融与评测协议)
"它在我数据上会不会有效"适合(看局限与假设条件)
"最近有什么新东西"适合(作为线索)线索之后跟原文

反过来说

"只读论文不读博客"也一样低效。论文不教工程直觉(怎么调超参、怎么避坑),这部分靠实践指南与社区博客补。两手都要硬。

七、如何追 arXiv

arXiv 每天上百篇新论文,直接刷必淹。给出可执行的筛选流程:

text
订阅(每天 5 分钟)
├─ 关注分类:cs.CL(计算语言学)+ cs.LG(机器学习)
├─ 订阅关键词:Large Language Model / LLM / RLHF / Reasoning
├─ 过滤标准:只看标题 + 摘要,1 分钟判断是否进"待读池"
└─ 工具:arxiv-sanity、Hugging Face Papers、Papers with Code 的 daily feed

跟作者(每两周 10 分钟)
├─ 盯住 4~6 个实验室/作者(OpenAI、DeepMind、Anthropic、Meta AI 与目标院校)
├─ 用 X/GitHub/Google Scholar 的"作者关注"收更新
└─ 看到新论文先看是不是"里程碑级"再决定精读

每周归档(30 分钟)
├─ 本周待读池 → 按[阅读路径](/papers/paths)三路线分档
├─ 精读 1~2 篇,其余入"已读摘要"清单
└─ 更新你自己的[论文地图](/papers/map)

工具与技巧速查

工具用途技巧
arXiv论文源cs.CL/cs.LG 分类订阅,或用 rss
arxiv-sanity / arxiv-sanity-lite论文排序与相似推荐给关注的论文打 star,让它学你的口味
Hugging Face Papers每日精选每天只花 2 分钟过标题,进"待读池"
Papers with Code复现状态与代码判断"可复现性"最快入口
Google Scholar引文追踪盯"被引"的爆炸增长,发现热点的最快方式
X / GitHub作者动态关注作者本人才是前沿的一手渠道

从一篇论文顺藤摸瓜:引用链方法

找到一篇好论文后,用两条引用链把它变成一批论文:

text
向后追(它引用了谁)→ 找思想源头:读它的 Related Work,按图索骥到奠基论文
向前追(谁引用了它)→ 找后续进展:在 Google Scholar / Semantic Scholar 看"Cited by"
横向找(同组同主题)→ 找完整脉络:同一团队同一方向的系列工作

实践建议:每篇精读论文至少做一次"向后追"(搞清楚它站在谁的肩膀上),做研究时再做"向前追"。这比漫无目的地刷 arXiv 高效一个数量级。

别掉进"追更焦虑"

arXiv 是流水线不是书架:绝大多数新论文不值得精读。用"第三节判断标准"过滤——一周精读 1~2 篇已是专业研究者的节奏,剩下的读摘要就够了。

八、复现建议

复现是检验"读懂了"的唯一标准,但复现成本差异巨大:

复现级别内容成本建议
概念复现小规模玩具实现(如用 nanoGPT 复现"小模型损失下降")小时级强烈推荐,入门必做
方法复现复现 LoRA/FlashAttention 的最小版本天级进阶必做
完整复现复现论文全部实验周~月级 + 算力只在做研究时做
百万级复现复现 70B/1.4T 训练不可行不现实,读其技术报告即可

复现常见失败与排查

失败现象最可能原因排查方向
损失不降学习率/数据格式错误先跑通官方最小示例,再改自己的数据
效果比论文差很多数据集/超参/评测协议不一致逐项核对论文的"实验设置"清单
显存爆炸batch size 或序列长度超了减小 batch/长度,或走 LoRA/量化路线
跑起来结果不稳随机种子、采样参数未固定固定种子,多跑几次报均值与方差
代码与论文对不上官方代码迭代过以论文为准,代码只当参考实现

具体路径:先用从零构建一个大模型的 nanoGPT 练手(几小时能跑),再复现一篇方法论文(推荐 LoRA,见微调实战)。"读 + 写"闭环一次,胜过读十篇。

九、高频问答速查

以下是关于读论文最常见的 10 个问题,一页速查:

#问题一句话答案详见
1每天只有 15 分钟怎么读?只做第一遍(抓骨架),保证趋势敏感度不断第六节
2论文里的数学推导必须读懂吗?不必;先抓机制与直觉,推导是第三遍的事第二节
3怎么判断哪篇论文重要?看被引数 + 是否开源 + 团队与实验可信度第三节
4需要订期刊/会议吗?不需要,arXiv + 会议官方收录就够了第六节
5英文读得慢怎么办?先过术语表再读;经典论文反复读第二节
6读多少篇算入门?精读 30 篇并写 30 张卡片,可达到"能讲透"第四节
7论文视频/讲座能代替吗?视频建直觉、论文建证据,两者互补不替代第五节
8要不要读综述(survey)?要;先读综述建立领域地图,再读论文论文地图
9怎么验证自己真懂了?费曼法:不用笔记向别人讲清楚五段卡第四节
10总是读了就忘怎么办?间隔重复 + 卡片回看,产出物是记忆的锚第四节

十、一条纪律

阅读纪律总纲

读论文是为了建立判断力,不是为了攒数量。 每周问自己三个问题:

  1. 这周我读透了几篇(不是读了几篇)?
  2. 我能不能用自己的话讲清楚它的机制与边界?
  3. 它对我的业务/研究产生了什么可验证的影响? 三问皆否,说明读得不够深——回到三遍读法,重读,而不是刷下一篇。

最后补一句心理建设

读论文的挫败感(读不懂、读完就忘、被前沿甩下)是系统性的,不是你个人的问题。方法论(本页)+ 节奏(每周固定时间)+ 产出物(卡片)三件套能显著缓解它。读过 100 篇的人也不是每篇都懂——他们只是更擅长决定"哪篇值得懂"。

延伸阅读

参考资料

以下为方法论相关的真实公开资源: