外观
演进简史
一句话定位:大语言模型不是 2020 年代凭空出现的产品,而是近八十年里"用统计与神经网络让机器学会语言"这条主线的必然终点。本文给出完整时间线、三次范式跃迁与技术路线图,帮你把"GPT 很厉害"的直观感受,替换为"它为什么必然出现、下一步会走向哪里"的判断。
一、时间线总览
按"思想萌芽 → 统计时代 → 神经时代 → 预训练时代 → 规模与对齐时代"五个阶段列出关键节点:
| 年代 | 事件 | 一句话意义 |
|---|---|---|
| 1948 | Shannon 发表《通信的数学理论》,提出信息熵 | 为"用概率描述语言"提供数学语言,统计语言模型的起点 |
| 1951 | Shannon 提出 N-gram 语言模型 | 第一个可计算的"预测下一个词"模型 |
| 1966 | ELIZA 聊天机器人(Weizenbaum) | 早期"对话程序",纯规则匹配,与学习无关 |
| 1980s | 反向传播算法(Rumelhart 等 1986)普及 | 神经网络可训练,深度学习的发动机 |
| 1997 | Hochreiter & Schmidhuber 提出 LSTM | 长序列记忆的经典架构,序列建模的统治工具直到 2017 |
| 2003 | Bengio 等人发表《A Neural Probabilistic Language Model》 | 神经语言模型开山之作:用神经网络取代 n-gram 计数 |
| 2013 | Word2Vec(Mikolov 等) | 词向量让"语义相似性"可计算,表征学习的先声 |
| 2014 | Seq2Seq(Sutskever 等)与注意力机制引入机器翻译(Bahdanau 等) | 序列建模 + 注意力,为 Transformer 铺路 |
| 2017 | Vaswani 等发表《Attention Is All You Need》 | Transformer 诞生:抛弃循环,纯注意力架构,可大规模并行 |
| 2018.6 | GPT-1(OpenAI,1.17 亿参数) | 生成式预训练 + 判别式微调,解码器路线确立 |
| 2018.10 | BERT(Google,3.4 亿参数) | 掩码语言建模 + 编码器,横扫 11 项 NLP 基准 |
| 2019.2 | GPT-2(OpenAI,15 亿参数) | 更大规模 + 零样本,展示"预训练即能力" |
| 2019.10 | T5(Google,最多 110 亿参数) | 编码器-解码器 + text-to-text 统一框架 |
| 2020.5 | GPT-3(OpenAI,1750 亿参数) | 规模法则的实证:few-shot 靠提示不靠微调 |
| 2020.1/2022.3 | Scaling Laws(Kaplan 等)/ Chinchilla(DeepMind) | 损失随规模幂律下降;数据与参数约 1:20 的最优配比 |
| 2021–2022 | GShard / Switch Transformer / GLaM / LaMDA / PaLM | MoE 稀疏化与超大规模(PaLM 5400 亿参数) |
| 2022.3 | InstructGPT(OpenAI) | RLHF 对齐里程碑:让模型"按指令做事" |
| 2022.11.30 | ChatGPT 发布 | 对齐 + 对话产品化,上线 5 天破百万用户,引爆全球 |
| 2023.2–7 | Llama 1 / Llama 2(Meta)开源 | 开源生态起点,本地部署成为可能 |
| 2023.3 | GPT-4(OpenAI) | 多模态输入 + 多项考试人类前 10%,能力上限上探 |
| 2023.12 | Gemini(Google)/ Mixtral(Mistral AI) | 闭源多模态对标 + 开源 MoE 高效推理 |
| 2024 | GPT-4o(原生多模态实时)、Llama 3、DeepSeek-V3、Sora | 实时多模态、开源追平闭源、MoE 大规模化、视频生成 |
| 2024.9–2025 | o1 系列(推理时扩展)、DeepSeek-R1 开源复现 | 把"思考时间"加入能力公式,新一维扩展轴 |
| 2024–2025 | RAG 工程化、Agent(工具调用)产品化 | 从"更强的模型"转向"更强的系统" |
时间线与参数以公开发布为准;GPT-4 参数量官方未公布,本文不写具体数字。
1. 中国大模型发展线(2019–2025)
中国的大模型起步稍晚但节奏紧密,与全球主线条基本平行(详见Llama 与开源生态与MoE 与超大规模模型):
| 年代 | 事件 | 意义 |
|---|---|---|
| 2019 | Google 提出 ALBERT(轻量 BERT,参数共享降显存) | 高效预训练探索 |
| 2021 | 百度文心(ERNIE)系列迭代 | 产业模型起步 |
| 2022 | 智谱推出 GLM-130B 开源;阿里通义千问立项 | 开源 + 产业双线推进 |
| 2023 | 文心一言、通义千问、ChatGLM、百川、智谱等集中发布 | "百模大战",中文大模型生态成型 |
| 2024 | Qwen 开源系列、DeepSeek-V2/V3 发布 | 开源模型追平闭源、MoE 效率领先 |
| 2025 | DeepSeek-R1 开源并复现推理时扩展 | 以开源姿态推动全球对"思考模型"的关注 |
全球 vs 中国:读时间线的一个视角
中国的追赶重点先后是:模型可用性(2022–2023,解决"有没有")→ 开源与效率(2024,解决"用得起")→ 前沿方法(2025,参与"怎么造")。这个节奏与前沿进展中"开源追平闭源"的判断互相印证。
二、三次范式跃迁
近八十年的历史可以压缩成三次跃迁。理解这三次跃迁,就理解了"为什么是现在"。
1. 第一次跃迁:从规则到统计(1940s–1980s)
在统计方法之前,语言处理的主流是人工规则:语言学家与程序员手写语法规则、词典、转换规则(如 ELIZA、早期的机器翻译)。这套路线的问题显而易见:规则写不完,语言永远有新例外。
Shannon 的信息论与 N-gram 带来了第一次转向:用语料中的统计频率替代人工规则。核心思想是:语言是可以被概率描述的,最好的"下一个词"猜测来自语料中相似上下文的统计。这一思想直接遗传给了今天的所有语言模型——P(wₙ|w₁,…,wₙ₋₁) 这个目标,从 1951 年延续到 2025 年,一个字没改。详见语言建模。
2. 第二次跃迁:从统计到神经(2003–2017)
统计模型的硬伤是数据稀疏:n-gram 窗口一长,组合数爆炸,大多数词序列在语料中从未出现。Bengio 2003 年给出解药:用神经网络把词映射为连续向量,让"相似语义"共享统计强度——没见过的句子也能算出合理概率。
此后十年是神经方法的全面铺开:Word2Vec(词向量)、LSTM(长序列)、Seq2Seq(序列到序列)、注意力机制(软对齐)。到 2014–2016 年,神经机器翻译已全面取代统计机器翻译。注意,这个阶段模型仍需针对每个任务专门训练——"一个模型通吃所有任务"的种子(预训练)尚未发芽。
3. 第三次跃迁:预训练 + 规模 + 对齐(2017 至今)
第三次跃迁包含三个互相强化的推力:
| 推力 | 代表 | 内容 |
|---|---|---|
| 架构 | Transformer(2017) | 纯注意力、可并行、可扩展,让"训练千亿参数"从不可能变为可能 |
| 规模 | GPT-3 / 规模法则(2020) | 损失随参数、数据、计算量幂律下降;涌现能力随规模出现 |
| 对齐 | InstructGPT / ChatGPT(2022) | 预训练模型"会说话但不好用",RLHF 让它"听指挥、说人话" |
跃迁的完成标志是 2022 年底 ChatGPT:它同时占满了三个推力——Transformer 架构 + 大规模预训练 + 深度对齐,并以对话产品形态触达大众。此前的跃迁改变的是"模型的构造方式",这一次跃迁改变的是"人类使用智能的方式"。
为什么跃迁是一次又一次,而不是连续爬坡
因为每次跃迁都是一次"维度切换":从写规则到数统计,是换个答案来源;从统计到神经,是换一套模型族;从神经到预训练+规模,是换一个"能力生成机制"(学到的表征 + 规模放大 + 对齐整形)。同一维度内的进步是爬坡(GPT-2→GPT-3),跨维度才是跃迁(统计→神经→规模+对齐)。
三、关键技术路线图
围绕"Transformer 时代的模型形态",四条路线并行演化。理解这个分岔,就能读懂 GPT 系列、BERT 与编码器家族等案例页的家族关系。
1. 四条路线对比
| 路线 | 架构 | 训练目标 | 代表模型 | 特长 |
|---|---|---|---|---|
| 解码器路线(Decoder-only) | 单向自回归 Transformer | 预测下一个词 | GPT-1/2/3/4、Llama、Qwen、DeepSeek | 生成;LLM 时代的主流 |
| 编码器路线(Encoder-only) | 双向 Transformer | 掩码语言建模(MLM) | BERT、RoBERTa、ELECTRA | 理解(分类、检索、embedding) |
| 编码器-解码器(Encoder-Decoder) | 编码器读入 + 解码器生成 | text-to-text | T5、BART、FLAN-T5 | 理解 + 生成的平衡(翻译、摘要) |
| 混合 / 下一代 | 稀疏专家(MoE)、状态空间等 | 各种 | Mixtral、DeepSeek-V3、Mamba | 效率与长序列(见MoE) |
2. 为什么解码器赢了
2019 年前是编码器(BERT)的天下——理解任务基准全面领先。2020 年后形势逆转,解码器成为事实标准。原因有三个:
- 生成覆盖理解:一个能生成的任务模型,天然能做理解(让它"回答"即可),而理解模型难以覆盖生成;
- 预训练目标统一:next-token prediction 无需标注、无限语料,比 MLM 更适合规模法则(见规模法则);
- 对齐与对话:RLHF、多轮对话、工具调用都自然建立在"自回归生成 + 指令"的解码器形态上。
text
GPT 路线 = 解码器架构 + 海量预训练 + 规模放大 + 对齐(RLHF)3. 编码器路线的遗产
解码器赢了今天的市场,但编码器路线留下了三项遗产,至今仍在活跃使用:
| 遗产 | 用途 | 代表 |
|---|---|---|
| 文本向量化(embedding) | 检索、聚类、语义相似度计算的输入特征 | BERT、E5、bge(见RAG的检索环节) |
| 双向理解的基准 | 分类、抽取、信息检索等"理解优先"任务仍常用 | RoBERTa、ELECTRA |
| 训练方法学 | 掩码建模、对比学习等预训练技巧被多模态等领域继承 | 视觉-语言模型的对齐头 |
把BERT 与编码器家族单独读一遍就会发现:它没有"死",而是从"主角"变成了"基础设施"。
四、从时间线中读出的三条规律
1. 简单目标 × 巨大规模 = 复杂能力
三次跃迁没有改变那个"简单到朴素"的训练目标——预测下一个词。改变的是规模(数据与参数)和架构效率(Transformer 的并行性)。历史反复证明:在这个领域,"更聪明的目标函数"远不如"更大的数据 + 更好的规模"来得有效——这是规模法则反复强调的定量结论。
2. 能力来自"代理任务"的间接涌现
从 Word2Vec(预测邻居词却学到了语义结构)到 GPT(预测下一个词却学会了推理),模型的"真正能力"从来不是训练任务直接要求的,而是压缩数据时被迫学到的结构。历史提醒我们:LLM 能做什么、不能做什么,往往要到规模到位后才知道,无法靠设计图纸完全预测。这也是什么是大语言模型中"能力层"一章的来历。
3. 每一次"破圈"都靠"应用形态"而非单纯能力
2003 年神经语言模型就存在,但大众感知是从 ChatGPT 才开始的。同理,BERT 的能力 2018 年就存在,但被开发者使用、被产品消费,是后续几年的事。模型能力 → 产品形态 → 大众接受之间存在漫长的传导链。看今天的历史,别忘了:每一个"突然爆火"背后,都有一段更长的、不为人知的积累线。
4. 时间线上的两个未解之争
历史不等于定论,两个争论至今开放,读时间线时保持批判:
| 争论 | 两方观点 | 为什么重要 |
|---|---|---|
| 涌现是真实能力,还是度量假象? | 一派认为推理等能力随规模"跳升"(相变);另一派认为只要换更平滑的度量,跳升就消失,只是"非连续性度量"的产物 | 决定"能力是不是规模的必然结果",也决定我们是否该期待更大的模型自动更强;详见规模法则 |
| 规模增长是否可持续? | 乐观派相信"更大的数据 + 更大的模型"继续有效;怀疑派指出高质量文本数据见顶(数据墙)、合成数据与推理时扩展可能改变规则 | 决定算力与数据的投入方向;推理时扩展、MoE 与合成数据是当前三条替代路径,见前沿进展 |
这两个争论没有标准答案,但追问它们本身就是读懂时间线的能力——历史提供的不是结论,而是问题的谱系。
五、如何继续追踪这条时间线
历史不止于 2025 年。追踪演进有三个入口:
| 入口 | 内容 | 本站对应 |
|---|---|---|
| 论文地图 | 按时间线与主题把关键论文排成地图 | 论文地图 |
| 案例页 | 每个模型家族的深度拆解 | GPT 系列、ChatGPT 与对话模型、Llama 与开源生态、MoE 与超大规模模型、多模态大模型 |
| 前沿追踪 | 2023–2025 的趋势综述与代表论文 | 前沿进展 |
建议阅读顺序
先读什么是大语言模型建立概念,再回到本页把时间线串起来,然后按你感兴趣的支线(架构→Transformer 架构详解;规模→规模法则;对齐→对齐)深入。历史的意义不是背诵日期,而是让你在读到任何新模型时,能回答:它站在哪条路线上,它把哪一步往前推了。
1. 从时间线到一手文献
时间线只是索引,真正值得读的是索引指向的论文。按兴趣方向给出"第一篇读什么"的建议:
| 兴趣方向 | 第一篇 | 为什么先读它 |
|---|---|---|
| 架构 | Attention Is All You Need | 所有现代架构的共同地基,论文地图的起点 |
| 规模 | Scaling Laws / Chinchilla | 定量的主线,解释"越大越好"与"1:20 配比" |
| 对齐 | InstructGPT | RLHF 范式的原点,ChatGPT 的直接前身 |
| 生成范式 | GPT-3 | 少样本(few-shot)范式的确立 |
| 开源生态 | Llama 论文与发布公告 | 开源追平闭源这条线的起点 |
| 推理时扩展 | DeepSeek-R1 技术报告 | 2024 之后最新维度,论文与新模型一手信息 |
读论文的地基
直接读论文门槛较高,建议先具备语言建模与Transformer的概念,再按经典论文精读的"背景→方法→实验→局限"四段法精读。
延伸阅读
- 什么是大语言模型 —— 本页时间线的"终点":定义三层面与能力盘点
- Transformer 架构详解 —— 2017 年那次跃迁的完整机制拆解
- 规模法则 —— 2020 年之后的定量主线:模型为何越大越好
- 对齐 —— 2022 年的决定性一步:RLHF 与 DPO
- 论文地图 —— 把本页时间线换成"论文视角"的完整地图
- GPT 系列:从 GPT-1 到 GPT-4o —— 解码器路线的家族史
参考资料
- Shannon. A Mathematical Theory of Communication(1948) —— 信息熵与信息论的奠基之作,统计语言模型的源头
- Bengio et al. A Neural Probabilistic Language Model(2003) —— 神经语言模型开山论文
- Vaswani et al. Attention Is All You Need(2017) —— Transformer 原始论文,第三次跃迁的架构基石
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers(2018) —— 编码器路线代表作,横扫 NLP 基准
- Brown et al. Language Models are Few-Shot Learners(2020) —— GPT-3,规模时代的开幕
- Ouyang et al. Training Language Models to Follow Instructions with Human Feedback(InstructGPT,2022) —— RLHF 对齐的原始论文
- OpenAI · Introducing ChatGPT(2022) —— ChatGPT 发布说明,第三次跃迁的公众化时刻
- Google DeepMind · Introducing Gemini(2023) —— 多模态大模型时代的代表发布