Skip to content

经典论文精读

本页速览 逐篇精读改变大模型走向的 11 篇经典论文:Attention Is All You Need、GPT-1/2、BERT、Scaling Laws、Chinchilla、InstructGPT、LoRA、FlashAttention、CoT、RAG,每篇给出背景问题、核心方法、关键实验数字、局限与延伸。

经典论文精读

一句话定位:本页是把"改变了大模型走向的 11 篇论文"逐篇拆开看内脏——每篇都回答五个问题:要解决什么(背景与问题)、怎么解决(核心方法)、凭什么信(关键实验与数字)、哪里不行(局限)、下一步看什么(延伸)。

一、怎么用这份精读

  1. 当坐标校准器用:在论文地图上定位,在阅读路径里选深度,再回到本页精读。
  2. 按主线顺序读:推荐 1→4→5→8→7 走一遍"架构→规模→对齐"主线,再补应用与系统三篇。
  3. 不要只读本页:本页是"导读 + 要点核对表",精读的定义是回去读原文。完整的三遍读法见阅读纪律与 FAQ

怎么用"关键实验与数字"

数字会过时,但"数字的口径"不会:GPT-2 的 1.5B 是参数量、BLEU 41.8 是 WMT'14 英法(EN-FR)单模型、CoT 的 56.9% 是 PaLM 540B 上的 GSM8K 准确率。读数字时永远问一句"这个数在什么设置下取得的"。

二、架构基石(4 篇)

1. Attention Is All You Need(2017,Vaswani et al., Google Brain)

维度内容
背景与问题RNN/LSTM 必须逐步处理序列:无法并行(训练慢)、长距离依赖难建模(信息要"传"很多步)。当时注意力只是 RNN 的辅助插件。
核心方法提出纯注意力架构 Transformer:①缩放点积注意力(softmax(QK^T/√d_k)·V);②多头注意力让不同头关注不同子空间;③正弦/可学习位置编码注入顺序;④编码器-解码器 + 残差 + LayerNorm + 前馈层。完全抛弃循环与卷积。
关键实验与数字机器翻译 WMT'14 英德(EN-DE):单模型 BLEU 28.4,超过此前最佳结果(含集成模型)约 2 个 BLEU;英法(EN-FR):单模型 BLEU 41.8,超过此前最佳单模型(41.0)。训练成本:8 张 P100 训练 3.5 天,远低于当时最佳系统的训练耗时。
局限①注意力复杂度 O(n²·d),长序列显存爆炸(三年后 FlashAttention 才解决);②位置编码外推能力弱;③论文用 encoder-decoder,GPT 后续证明"只要解码器"更省。
延伸Transformer 架构详解;图解:The Illustrated Transformer;代码:The Annotated Transformer

精读要点:为什么除以 √d_k?因为点积随维度线性增长,不缩放时 softmax 会进入饱和区、梯度趋零,√d_k 让方差保持为 1。当年的行业质疑是"去掉 RNN 真的可以吗"——论文用 3.5 天训练时间和更高的 BLEU 回答了它。另一个细节:位置编码用正弦函数,论文说"相对位置信息也能学到"——但后来证明正弦式与学习式都不如 RoPE/ALiBi 能外推,这直接引出了上下文与长文本这一整章。读这篇时把注意力公式徒手推导一遍(Q·Kᵀ → softmax → V),是理解一切后续工作的起点。

2. GPT-1:Improving Language Understanding by Generative Pre-Training(2018,Radford et al., OpenAI)

维度内容
背景与问题2018 年前,监督学习需要大量标注数据;无标注文本遍地都是却没人系统性使用。论文问:能不能先用无监督文本预训练,再小成本微调?
核心方法两阶段:①生成式预训练——用标准语言模型目标(预测下一个词)在无标注语料上训练 Transformer 解码器;②判别式微调——在下游任务上加一个线性输出层微调。任务输入统一改写为 token 序列(textual entailment 等),实现"同架构多任务"。
关键实验与数字12 层解码器、117M 参数,BooksCorpus 预训练;在 12 个 NLP 任务(含自然语言推理、问答、分类)中 9 个取得当时 SOTA;为下游任务设计的辅助目标可再提 1~2 个点。
局限①单向注意力:只能看左边,理解类任务上限;②"预训练+微调"仍是每任务一个模型;③参数量小,无涌现能力。
延伸与 BERT(同篇阅读对比)见BERT 与编码器家族;GPT 系列全览见GPT 系列;训练数据问题见分词与词表

精读要点:名字里的"生成式"指预训练阶段用语言建模目标,"预训练 + 微调"的组合拳才是本文真正的遗产。关键设计是把不同任务统一成 token 序列(如把蕴含任务拼成 "premise + hypothesis"),同一套参数即可处理所有任务——这是"任务统一"思想的开端。今天的提示工程本质上也是"把任务表达成文本",血缘可追溯到这篇。注意它的局限:单向下文做不了真正的双向理解,这正是 BERT 的突破口。

3. GPT-2:Language Models are Unsupervised Multitask Learners(2019,Radford et al., OpenAI)

维度内容
背景与问题微调时代每个任务都要标注数据与单独模型。论文进一步追问:语言模型能不能自己就"什么都会一点"——即零样本(zero-shot)完成任务?
核心方法不做任务改写、不做微调:用更大模型 + 更大数据(WebText,从 Reddit 高赞外链抓取约 40GB 文本)纯预训练,靠提示条件化(conditioning on context)让模型完成任务;引入 Byte-Pair Encoding(BPE)处理未登录词。
关键实验与数字1.5B 参数、48 层(当时最大公开语言模型);零样本在 8 个语言任务中 7 个取得 SOTA,如 CoQA F1 55、Summarization ROUGE 36.4;在 LAMBADA 上困惑度从 99.8 降至 8.6。
局限①性能明显弱于监督微调(差距仍大);②零样本 = "碰运气"式任务条件化,不稳定;③生成质量好但事实性差(预示了后来的幻觉问题,见幻觉)。
延伸少样本路线被 GPT-3 接力(见阅读路径清单);提示条件的机制在语言建模推理基础展开

精读要点:本文是"少即是多"的实验场:不做任何任务适配,纯粹靠 prompt 条件化,模型自动把任务当作条件概率问题。值得记住的细节是 WebText 的数据收集法(按 Reddit 高赞外链抓取约 40GB 文本)——数据配比第一次成为论文的主角。发布时因安全顾虑暂缓开源、后逐步放开,是大模型时代"负责任发布"的第一次公开讨论。它的 BPE 词表处理未登录词的做法,是分词与词表的标准答案。

4. BERT:Pre-training of Deep Bidirectional Transformers for Language Understanding(2019,Devlin et al., Google)

维度内容
背景与问题GPT 单向,ELMo 是浅层双向拼接,都是"单向左看"。论文指出:理解类任务需要真正的双向上下文
核心方法两个预训练目标:①掩码语言建模(MLM)——随机遮 15% 的 token 让模型预测;②下一句预测(NSP)——判断两句是否相邻。用 Transformer 编码器同时看左右,再做任务微调。
关键实验与数字BERT-Large:340M 参数、24 层、1024 hidden、16 头;在 GLUE 平均 80.5(超过此前 SOTA 约 7 个点)、SQuAD v1.1 F1 93.2、SQuAD v2.0 83.1。消融证明:双向是最大增益来源,NSP 贡献较小。
局限①掩码只在预训练,推理不掩码,训练-推理不一致;②编码器不能自回归生成,做不了生成任务;③MLM 每步只监督 15% 的 token,训练效率低;④参数量 340M 在今日标准很小,但 2019 是"大模型"。
延伸BERT 家族与 RoBERTa/ALBERT/DistilBERT 演进见BERT 与编码器家族;与 GPT 路线对比见语言建模

精读要点:两个预训练目标里,MLM 是主力,NSP 后来被证明几乎无用(RoBERTa 去掉 NSP 反而更强)。MLM 的掩码细节值得细读:15% 掩码中 80% 换成 [MASK]、10% 换随机词、10% 保持不变——这是为缓解"预训练掩码、推理不掩码"的不一致。理解类任务被 BERT 家族统治了近三年,直到 2022 年后解码器模型靠规模与对齐重新夺回理解类 SOTA;而今天的检索编码器(embedding 模型)仍大量使用双向架构——BERT 的遗产没有消失,只是换了个位置

三、规模法则(2 篇)

5. Scaling Laws for Neural Language Models(2020,Kaplan et al., OpenAI)

维度内容
背景与问题大家都直觉"模型越大越好",但没人知道:损失随参数量/数据量/算力按什么规律变化?钱应该花在加参数还是加数据?
核心方法系统性扫描不同规模(参数量约 7.7×10⁷~1.5×10⁹,即约 0.77 亿~15 亿)的 Transformer 语言模型,拟合出三条幂律:L(N)≈(N_c/N)^α_N、L(D)≈(D_c/D)^α_D、L(C)≈(C_c/C)^α_C;性能主要受 N、D、C 三个量控制,架构细节次要;引入"迁移"经验律。
关键实验与数字幂律指数 α_N≈0.076、α_D≈0.095、α_C≈0.050(数量级约 0.1);模型大小收益递减、数据收益递减,但三者可以"预算转移":算力翻 10 倍时,最优模型应增大约 5.5 倍参数 + 1.8 倍数据。
局限①只到约 10 亿参数规模,外推到 175B 未必成立(后来证明方向对、系数需修正);②早期版本低估了数据的重要性(被 Chinchilla 纠正);③没覆盖对齐与能力涌现这些"损失之外"的现象。
延伸规模法则页面完整展开;与 Chinchilla 对比见下一篇;对训练预算的现实含义见预训练:数据与目标

精读要点:最反直觉的结论是"架构细节对性能次要"——层数、头数、深度宽度比在合理范围内影响很小,N、D、C 三个规模量才是主宰。这给了团队一个明确分工:调架构不如加规模。论文还给出"性能随数据量按幂律提升但收益递减",以及迁移经验的预测(小模型上的规律可外推到千倍大模型)。阅读时注意:实验窗口只有约 15 亿参数,外推是"信念"而非"证明"——Chinchilla 正是修正了它对数据维度的低估。

6. Chinchilla: Training Compute-Optimal Large Language Models(2022,Hoffmann et al., DeepMind)

维度内容
背景与问题社区按 Kaplan 的结论狂加参数(Gopher 280B、GPT-3 175B),但都训得"数据不足"。论文质疑:在固定算力预算下,参数与训练 token 的配比到底该是多少?
核心方法重新做算力-最优扫描:固定总算力 C,搜索最优的 N 与 D 组合。结论:参数与数据按约 1:20 的 token 数配比(每 1 个参数约配 20 个 token)。依据该配比训练 70B/1.4T token 的模型(Chinchilla)。
关键实验与数字Chinchilla(70B、1.4T token)在 400+ 评测任务上平均优于 Gopher(280B、300B token),同等算力下"更小但更久训练"完胜"更大但欠训练";印证 70B 模型损失可与 540B 模型相当(数据补足时)。
局限①"计算最优"是损失层面最优,不考虑推理成本、部署、涌现能力(推理时小模型不吃亏,能力时不好说);②1:20 是经验规律,不同数据质量下会漂移;③只回答"预训练预算",没回答对齐后训练。
延伸规模法则里"先加数据还是先加参数"的实践结论;对 MoE 的性价比讨论见MoE 稀疏专家模型

精读要点:1:20 的推导方法值得细读:固定总算力 C,把损失建模为参数 N 和数据 D 的函数 F(N, D),求使损失最小的 (N, D) 组合。结论是社区普遍"训练不足"——当时的旗舰模型 GPT-3(175B/300B token,约 1:1.7)、Gopher(280B/300B,约 1:1)都远未配足数据,按 1:20 应训 1.4T 以上。这篇论文的实操影响极大:此后所有大模型训练都按计算最优配比规划数据,"数据稀缺"成为比"参数稀缺"更真实的瓶颈。它也是预训练:数据与目标的核心依据。

四、对齐与指令(1 篇)

7. InstructGPT:Training Language Models to Follow Instructions with Human Feedback(2022,Ouyang et al., OpenAI)

维度内容
背景与问题GPT-3 能生成但不"听话":不遵循指令、不诚实、有毒。目标转向对齐——让模型对"帮助性、诚实性、安全性"负责。
核心方法RLHF 三步:①SFT——用人工写的指令-回答对(约 1.3 万条)监督微调;②RM——训练奖励模型,对人类偏好比较(约 3.3 万条对比对)打分;③PPO——以 RM 为奖励、以 KL 惩罚约束的强化学习优化策略。
关键实验与数字人类评估中,1.3B 的 InstructGPT 输出比 175B 的 GPT-3 更受偏好(胜率约 70%+);用户反馈的真实 API 评估同样更优;同时"对齐税"很小:在 SQuAD 等传统基准上平均仅下降约 0.4%(某些任务还上升)。
局限①依赖人工标注,成本高、规模受限;②模型"迎合"而非"正确"(过度拒绝、谄媚);③PPO 训练不稳定、实现复杂——这直接催生了 DPO;④只对齐文本输出,不覆盖工具使用、多模态。
延伸RLHF 原理与 DPO 对比见对齐:RLHF 与 DPO;产品化故事见ChatGPT 与对话模型;对齐失效的案例见安全与风险

精读要点:核心洞察是对齐是在"组织"已有能力,而不是"创造"能力——175B 的 GPT-3 已经"知道"该怎么做,只是不知道如何被要求。工程细节都值得抠:SFT 只用约 1.3 万条数据(数据质量远大于数量)、RM 用约 3.3 万条人类对比对、PPO 里加 KL 惩罚防止策略偏离初始化太远。"对齐税"(传统基准略降)后来被证明可通过更好的数据与多任务缓解。ChatGPT 就是这套技术加对话产品的直接产物,故事见ChatGPT 与对话模型

五、应用与系统(3 篇)

8. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(2020,Lewis et al., Facebook AI)

维度内容
背景与问题纯参数化模型把知识"记"在权重里:知识截止、更新昂贵、事实易错。论文问:能不能让模型从外部语料库检索,把知识外挂?
核心方法RAG:检索器(DPR 密集检索)+ 生成器(BART-large)联合训练。两种解码策略:RAG-sequence(每篇文档生成完整序列)与 RAG-token(每一步按文档分布采样 token)。文档作为条件与输入拼接,端到端可训。
关键实验与数字Open-domain QA:Natural Questions 上 RAG-sequence 超过纯参数化 T5-11B;在 FEVER(事实验证)等任务上刷新 SOTA;检索器与生成器联合训练带来额外收益。
局限①检索质量是天花板,检索不到就生成不出来;②两阶段延迟高于纯生成;③对"开放域闲聊"等不需知识的任务帮助有限;④生成器仍会无视检索结果编造——RAG 不是幻觉的万能药(见幻觉)。
延伸范式演进(Naive/Advanced/Modular RAG)见case-studies RAG;工程落地见RAG 实战;与长上下文、微调的对比见上下文与长文本

精读要点:RAG 把知识存储从"参数内"移到"参数外"。两大设计选择值得细读:检索器用 DPR(双塔密集检索)而非 BM25,因为要端到端可微;解码用 RAG-sequence(每篇文档生成整段)与 RAG-token(每一步按文档分布采样)——前者在开放域 QA 上更稳,后者更适合逐步引用。它的局限预示了所有 RAG 系统的共性难题:检索质量是天花板、生成器可能无视检索结果。RAG 至今仍是减少幻觉的主力方案(见幻觉),但形态已从 naive 演进到 advanced/modular。

9. LoRA: Low-Rank Adaptation of Large Language Models(2021,Hu et al., Microsoft)

维度内容
背景与问题全参微调 175B 模型:每个下游任务要存一整套新权重(每份约 350GB),显存与存储都不可行。能否"只学增量"?
核心方法冻结预训练权重 W₀,学一个低秩增量 ΔW = B·A(A、B 为低秩矩阵,秩 r≪d)。前向时 W = W₀ + (α/r)·BA。推理时可把增量合并回 W₀,无额外延迟
关键实验与数字GPT-3 175B 上可训练参数量从 175B 降到约 4.6M(减少约 10000 倍);RoBERTa 在 GLUE 上效果与全参微调相当或更好(如 MRPC 上超过);秩 r 在 1~64 内对性能不敏感(矩阵分解可低至 r=1 仍有效)。
局限①低秩假设本身限制了能学到的表示空间(复杂任务可能不够);②超参(r、α、target_modules)要调;③论文范围是"适配",不覆盖从零预训练。
延伸原理与超参见微调:SFT 与参数高效微调;端到端实战见微调实战:LoRA 全流程;QLoRA 量化版见前沿进展

精读要点:低秩假设有实验支撑:对预训练权重的更新做 SVD,发现主奇异值极少——增量确实落在低秩子空间。实操结论值得记:秩 r 在 1~64 之间性能几乎不变(论文在 GPT-3 上的实验),所以"r 越大越稳"是常见误解;α 控制缩放,实践中常保持 α/r 恒定。LoRA 的意义不只省显存——它让"一个底座 + 多个适配器"成为可能,直接催生了 QLoRA、DoRA 等一整个参数高效微调家族,也是微调:SFT 与参数高效微调的理论地基。

10. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness(2022,Dao et al., Stanford)

维度内容
背景与问题注意力 O(n²) 显存:n=64k 时单张 fp32 注意力矩阵(64k×64k)就要约 16GB。瓶颈不只是算力,更是显存(HBM)带宽——标准实现把 S 和 P 写回 HBM 再读回。
核心方法IO 感知的精确注意力:①tiling——把 Q、K、V 分块,在 SRAM 片上计算;②recompute——反向传播时重新算注意力矩阵,避免存 O(n²) 中间量;③用精确 softmax 的在线更新技巧保持结果与标准注意力逐位近似一致。
关键实验与数字显存占用从 O(n²) 降到 O(n);相比 PyTorch 标准注意力,端到端训练加速:BERT-large 约 15%、GPT-2 约 3 倍、Long-Range Arena 约 2.4 倍(注意力算子本身最高约 7.6 倍,随序列长度增加更明显)。
局限①只优化"标准注意力"形态,对稀疏/线性注意力不直接适用;②工程实现依赖 GPU 架构细节;③本身不降低注意力算力复杂度(仍是 O(n²) 计算)。
延伸注意力复杂度与长上下文的工程挑战见上下文与长文本;推理时 KV Cache 优化见推理基础;FlashAttention-2 与 PagedAttention 见前沿进展

精读要点:颠覆性洞察是"瓶颈在 IO 不在 FLOPs":标准实现把中间矩阵 S、P 写回 HBM 再读回,而 HBM 带宽远慢于片上 SRAM。两个技术支柱:tiling(分块让 SRAM 装得下)与 recompute(反向传播重算注意力,省掉 O(n²) 中间存储)。它保持的是"精确"注意力(与标准实现数值一致),不是近似——因此可以无痛替换任何注意力。FA-2 进一步优化并行与分块,再快约 2 倍。读这篇时顺手理解 KV Cache,就打通了推理基础

11. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(2022,Wei et al., Google)

维度内容
背景与问题大模型在数学、多步推理上表现差:直接问"答案是什么"只会得到直觉性错误。论文发现:让模型先"想"再"答",推理能力被显著激发。
核心方法思维链提示:在少样本示例中给出"中间推理步骤"(few-shot CoT);或直接拼一句"Let's think step by step"(zero-shot CoT 的雏形)。推理步骤不是训练出来的,而是提示引导出来的。
关键实验与数字PaLM 540B 上 GSM8K(小学数学题)准确率从约 17.9% 提升到约 56.9%;在多学科考试基准也大幅提升。规模门槛:约 100B 以下模型 CoT 增益很小甚至为负——这是"涌现能力"的经典证据。
局限①对模型规模敏感,小模型无效;②思维链可能"自信地错"——推理过程看似合理但结论错误;③增益在需要严谨性(如数学)上最明显,常识推理上有限。
延伸CoT 与 self-consistency 的工程用法见提示工程提示工程实践;涌现能力的争议见规模法则

精读要点:"涌现"是本文最受争议也最重要的观察:CoT 在约 100B 参数以下没有增益甚至有害,之上突然显著提升。这暗示推理能力不是训练目标直接教的,而是规模足够后"被揭示"的。few-shot CoT 的示例写法有讲究——要给出完整的"一步步思考"过程;后来 zero-shot CoT("Let's think step by step")被证明更省事。它的后续:self-consistency 用多次采样 + 多数投票进一步提升,思维树 ToT 扩展搜索空间。注意边界:CoT 提升的是"过程"而非"结论正确性"——推理看似合理但结论错误的情况不少。

六、跨论文串讲:一条主线

这 11 篇连起来,就是大模型的完整叙事——"解码器 + 规模 + 对齐"

text
Attention(2017)给了"可并行、可长程"的骨架
   → GPT-1/2(2018-2019)确立"解码器 + 预训练"路线
   → Scaling Laws(2020)给出"加参数"的理论许可
   → GPT-3 实证(2020)让规模信念扩散(精读见[阅读路径](/papers/paths))
   → InstructGPT(2022)把"会生成"变成"会听话"
   → Chinchilla(2022)纠正配比:数据与参数同样重要
   → RAG/LoRA/CoT/FlashAttention(2020-2022)解决"用得起、用得上、跑得快"

三组对照关系值得记住:

对照结论
GPT(单向解码器)vs BERT(双向编码器)生成任务与理解任务的路线分叉,解码器最终胜出
Scaling Laws(加参数)vs Chinchilla(加数据)同一算力下,参数与 token 约 1:20 才是最优
RLHF(InstructGPT,训奖励模型)vs 提示(CoT,引导推理)一个改权重、一个改上下文,可叠加使用

七、11 篇的推荐精读顺序

11 篇不必按编号硬读,按下面的组合更高效(编号对应本页各节):

阶段建议组合理由
第一步1(Attention)+ 2(GPT-1)先把架构骨架立起来
第二步4(BERT)+ 3(GPT-2)两条路线正面照镜子
第三步5(Scaling)+ 6(Chinchilla)规模主线:先信念后修正
第四步7(InstructGPT)规模到对齐的转折点
第五步11(CoT)+ 8(RAG)应用侧:提示与检索
第六步9(LoRA)+ 10(FlashAttention)系统侧:微调与加速

组合内可以对照读(例如 1 与 10 的"同一注意力如何从架构变系统"),组合间的顺序不可逆:没有架构的规模是空中楼阁,没有规模的对齐无从谈起。

八、论文间的引用关系

精读的价值在于看清"谁站在谁的肩膀上":

论文站在谁的肩膀上启发了谁
AttentionBahdanau 注意力、Seq2Seq几乎所有后续论文
GPT-1Attention(删掉 encoder)GPT-2/3、整个解码器家族
BERTAttention + ELMoRoBERTa、T5、编码器家族
Scaling LawsGPT-2/3 的规模观察Chinchilla、一切训练预算规划
ChinchillaScaling Laws现代训练配比标准
InstructGPTRLHF(2017)+ GPT-3ChatGPT、DPO、宪法 AI
LoRAAdapter(2019)QLoRA、PEFT 家族
FlashAttention算法与系统交叉FA-2、PagedAttention
CoTGPT-3 的 few-shotself-consistency、ToT、o1
RAGDPR、BARTAdvanced RAG、多模态检索

顺藤摸瓜的起点

读完成这张表,你就有了 10 条"引用链"。从任意一篇点进它的被引,就进入了论文地图的拓张模式——地图是活的。

九、面试中的常见追问

这 11 篇几乎覆盖了算法岗面试的高频题(完整题库见面试题库):

论文面试官可能追问回答要点
Attention为什么除以 √d_k?多头为何有效?防 softmax 饱和;多头看不同子空间
GPT-2零样本与 few-shot 的区别?prompt 即任务描述,few-shot 加示例
BERTNSP 有必要吗?RoBERTa 证明可去掉,MLM 才是主力
Scaling Laws加数据还是加参数?看当前 N:D 配比,参照 1:20
Chinchilla什么是计算最优?固定算力下求 (N, D) 最优组合
InstructGPTRLHF 三步各做什么?SFT→RM→PPO,KL 惩罚防止跑偏
LoRAr 与 α 怎么设?r 1~64 几乎无差,α/r 保持恒定
FlashAttention为什么省显存?IO 感知:tiling + recompute
CoT小模型为什么无效?能力涌现存在规模门槛
RAG检索不到怎么办?混合检索、查询改写、重排序

十、精读后的下一步

  1. 去读原文:本页是导航图,逐节对照原文(链接见下方参考资料)。
  2. 沿引用链拓展:从每篇"延伸"列的站内页 + Related Work 继续走。
  3. 做笔记:用阅读纪律与 FAQ的卡片法,为每篇建立"问题/方法/数字/局限/我的场景"五段卡。
  4. 接上前沿:这些是 2022 年前的地基,2023-2025 的新进展见前沿进展

延伸阅读

参考资料

11 篇精读论文的官方原文(真实 arXiv 链接):