Skip to content

演进简史

本页速览 从 1948 年信息论到 2025 年多模态与 Agent,大语言模型近八十年的演进:N-gram、神经语言模型、Transformer、GPT/BERT、规模法则、RLHF 与 ChatGPT 的三次范式跃迁。

演进简史

一句话定位:大语言模型不是 2020 年代凭空出现的产品,而是近八十年里"用统计与神经网络让机器学会语言"这条主线的必然终点。本文给出完整时间线、三次范式跃迁与技术路线图,帮你把"GPT 很厉害"的直观感受,替换为"它为什么必然出现、下一步会走向哪里"的判断。

一、时间线总览

按"思想萌芽 → 统计时代 → 神经时代 → 预训练时代 → 规模与对齐时代"五个阶段列出关键节点:

年代事件一句话意义
1948Shannon 发表《通信的数学理论》,提出信息熵为"用概率描述语言"提供数学语言,统计语言模型的起点
1951Shannon 提出 N-gram 语言模型第一个可计算的"预测下一个词"模型
1966ELIZA 聊天机器人(Weizenbaum)早期"对话程序",纯规则匹配,与学习无关
1980s反向传播算法(Rumelhart 等 1986)普及神经网络可训练,深度学习的发动机
1997Hochreiter & Schmidhuber 提出 LSTM长序列记忆的经典架构,序列建模的统治工具直到 2017
2003Bengio 等人发表《A Neural Probabilistic Language Model》神经语言模型开山之作:用神经网络取代 n-gram 计数
2013Word2Vec(Mikolov 等)词向量让"语义相似性"可计算,表征学习的先声
2014Seq2Seq(Sutskever 等)与注意力机制引入机器翻译(Bahdanau 等)序列建模 + 注意力,为 Transformer 铺路
2017Vaswani 等发表《Attention Is All You Need》Transformer 诞生:抛弃循环,纯注意力架构,可大规模并行
2018.6GPT-1(OpenAI,1.17 亿参数)生成式预训练 + 判别式微调,解码器路线确立
2018.10BERT(Google,3.4 亿参数)掩码语言建模 + 编码器,横扫 11 项 NLP 基准
2019.2GPT-2(OpenAI,15 亿参数)更大规模 + 零样本,展示"预训练即能力"
2019.10T5(Google,最多 110 亿参数)编码器-解码器 + text-to-text 统一框架
2020.5GPT-3(OpenAI,1750 亿参数)规模法则的实证:few-shot 靠提示不靠微调
2020.1/2022.3Scaling Laws(Kaplan 等)/ Chinchilla(DeepMind)损失随规模幂律下降;数据与参数约 1:20 的最优配比
2021–2022GShard / Switch Transformer / GLaM / LaMDA / PaLMMoE 稀疏化与超大规模(PaLM 5400 亿参数)
2022.3InstructGPT(OpenAI)RLHF 对齐里程碑:让模型"按指令做事"
2022.11.30ChatGPT 发布对齐 + 对话产品化,上线 5 天破百万用户,引爆全球
2023.2–7Llama 1 / Llama 2(Meta)开源开源生态起点,本地部署成为可能
2023.3GPT-4(OpenAI)多模态输入 + 多项考试人类前 10%,能力上限上探
2023.12Gemini(Google)/ Mixtral(Mistral AI)闭源多模态对标 + 开源 MoE 高效推理
2024GPT-4o(原生多模态实时)、Llama 3、DeepSeek-V3、Sora实时多模态、开源追平闭源、MoE 大规模化、视频生成
2024.9–2025o1 系列(推理时扩展)、DeepSeek-R1 开源复现把"思考时间"加入能力公式,新一维扩展轴
2024–2025RAG 工程化、Agent(工具调用)产品化从"更强的模型"转向"更强的系统"

时间线与参数以公开发布为准;GPT-4 参数量官方未公布,本文不写具体数字。

1. 中国大模型发展线(2019–2025)

中国的大模型起步稍晚但节奏紧密,与全球主线条基本平行(详见Llama 与开源生态MoE 与超大规模模型):

年代事件意义
2019Google 提出 ALBERT(轻量 BERT,参数共享降显存)高效预训练探索
2021百度文心(ERNIE)系列迭代产业模型起步
2022智谱推出 GLM-130B 开源;阿里通义千问立项开源 + 产业双线推进
2023文心一言、通义千问、ChatGLM、百川、智谱等集中发布"百模大战",中文大模型生态成型
2024Qwen 开源系列、DeepSeek-V2/V3 发布开源模型追平闭源、MoE 效率领先
2025DeepSeek-R1 开源并复现推理时扩展以开源姿态推动全球对"思考模型"的关注

全球 vs 中国:读时间线的一个视角

中国的追赶重点先后是:模型可用性(2022–2023,解决"有没有")→ 开源与效率(2024,解决"用得起")→ 前沿方法(2025,参与"怎么造")。这个节奏与前沿进展中"开源追平闭源"的判断互相印证。

二、三次范式跃迁

近八十年的历史可以压缩成三次跃迁。理解这三次跃迁,就理解了"为什么是现在"。

1. 第一次跃迁:从规则到统计(1940s–1980s)

在统计方法之前,语言处理的主流是人工规则:语言学家与程序员手写语法规则、词典、转换规则(如 ELIZA、早期的机器翻译)。这套路线的问题显而易见:规则写不完,语言永远有新例外。

Shannon 的信息论与 N-gram 带来了第一次转向:用语料中的统计频率替代人工规则。核心思想是:语言是可以被概率描述的,最好的"下一个词"猜测来自语料中相似上下文的统计。这一思想直接遗传给了今天的所有语言模型——P(wₙ|w₁,…,wₙ₋₁) 这个目标,从 1951 年延续到 2025 年,一个字没改。详见语言建模

2. 第二次跃迁:从统计到神经(2003–2017)

统计模型的硬伤是数据稀疏:n-gram 窗口一长,组合数爆炸,大多数词序列在语料中从未出现。Bengio 2003 年给出解药:用神经网络把词映射为连续向量,让"相似语义"共享统计强度——没见过的句子也能算出合理概率。

此后十年是神经方法的全面铺开:Word2Vec(词向量)、LSTM(长序列)、Seq2Seq(序列到序列)、注意力机制(软对齐)。到 2014–2016 年,神经机器翻译已全面取代统计机器翻译。注意,这个阶段模型仍需针对每个任务专门训练——"一个模型通吃所有任务"的种子(预训练)尚未发芽。

3. 第三次跃迁:预训练 + 规模 + 对齐(2017 至今)

第三次跃迁包含三个互相强化的推力:

推力代表内容
架构Transformer(2017)纯注意力、可并行、可扩展,让"训练千亿参数"从不可能变为可能
规模GPT-3 / 规模法则(2020)损失随参数、数据、计算量幂律下降;涌现能力随规模出现
对齐InstructGPT / ChatGPT(2022)预训练模型"会说话但不好用",RLHF 让它"听指挥、说人话"

跃迁的完成标志是 2022 年底 ChatGPT:它同时占满了三个推力——Transformer 架构 + 大规模预训练 + 深度对齐,并以对话产品形态触达大众。此前的跃迁改变的是"模型的构造方式",这一次跃迁改变的是"人类使用智能的方式"

为什么跃迁是一次又一次,而不是连续爬坡

因为每次跃迁都是一次"维度切换":从写规则到数统计,是换个答案来源;从统计到神经,是换一套模型族;从神经到预训练+规模,是换一个"能力生成机制"(学到的表征 + 规模放大 + 对齐整形)。同一维度内的进步是爬坡(GPT-2→GPT-3),跨维度才是跃迁(统计→神经→规模+对齐)。

三、关键技术路线图

围绕"Transformer 时代的模型形态",四条路线并行演化。理解这个分岔,就能读懂 GPT 系列BERT 与编码器家族等案例页的家族关系。

1. 四条路线对比

路线架构训练目标代表模型特长
解码器路线(Decoder-only)单向自回归 Transformer预测下一个词GPT-1/2/3/4、Llama、Qwen、DeepSeek生成;LLM 时代的主流
编码器路线(Encoder-only)双向 Transformer掩码语言建模(MLM)BERT、RoBERTa、ELECTRA理解(分类、检索、embedding)
编码器-解码器(Encoder-Decoder)编码器读入 + 解码器生成text-to-textT5、BART、FLAN-T5理解 + 生成的平衡(翻译、摘要)
混合 / 下一代稀疏专家(MoE)、状态空间等各种Mixtral、DeepSeek-V3、Mamba效率与长序列(见MoE

2. 为什么解码器赢了

2019 年前是编码器(BERT)的天下——理解任务基准全面领先。2020 年后形势逆转,解码器成为事实标准。原因有三个:

  1. 生成覆盖理解:一个能生成的任务模型,天然能做理解(让它"回答"即可),而理解模型难以覆盖生成;
  2. 预训练目标统一:next-token prediction 无需标注、无限语料,比 MLM 更适合规模法则(见规模法则);
  3. 对齐与对话:RLHF、多轮对话、工具调用都自然建立在"自回归生成 + 指令"的解码器形态上。
text
GPT 路线 = 解码器架构 + 海量预训练 + 规模放大 + 对齐(RLHF)

3. 编码器路线的遗产

解码器赢了今天的市场,但编码器路线留下了三项遗产,至今仍在活跃使用:

遗产用途代表
文本向量化(embedding)检索、聚类、语义相似度计算的输入特征BERT、E5、bge(见RAG的检索环节)
双向理解的基准分类、抽取、信息检索等"理解优先"任务仍常用RoBERTa、ELECTRA
训练方法学掩码建模、对比学习等预训练技巧被多模态等领域继承视觉-语言模型的对齐头

BERT 与编码器家族单独读一遍就会发现:它没有"死",而是从"主角"变成了"基础设施"。

四、从时间线中读出的三条规律

1. 简单目标 × 巨大规模 = 复杂能力

三次跃迁没有改变那个"简单到朴素"的训练目标——预测下一个词。改变的是规模(数据与参数)和架构效率(Transformer 的并行性)。历史反复证明:在这个领域,"更聪明的目标函数"远不如"更大的数据 + 更好的规模"来得有效——这是规模法则反复强调的定量结论。

2. 能力来自"代理任务"的间接涌现

从 Word2Vec(预测邻居词却学到了语义结构)到 GPT(预测下一个词却学会了推理),模型的"真正能力"从来不是训练任务直接要求的,而是压缩数据时被迫学到的结构。历史提醒我们:LLM 能做什么、不能做什么,往往要到规模到位后才知道,无法靠设计图纸完全预测。这也是什么是大语言模型中"能力层"一章的来历。

3. 每一次"破圈"都靠"应用形态"而非单纯能力

2003 年神经语言模型就存在,但大众感知是从 ChatGPT 才开始的。同理,BERT 的能力 2018 年就存在,但被开发者使用、被产品消费,是后续几年的事。模型能力 → 产品形态 → 大众接受之间存在漫长的传导链。看今天的历史,别忘了:每一个"突然爆火"背后,都有一段更长的、不为人知的积累线。

4. 时间线上的两个未解之争

历史不等于定论,两个争论至今开放,读时间线时保持批判:

争论两方观点为什么重要
涌现是真实能力,还是度量假象?一派认为推理等能力随规模"跳升"(相变);另一派认为只要换更平滑的度量,跳升就消失,只是"非连续性度量"的产物决定"能力是不是规模的必然结果",也决定我们是否该期待更大的模型自动更强;详见规模法则
规模增长是否可持续?乐观派相信"更大的数据 + 更大的模型"继续有效;怀疑派指出高质量文本数据见顶(数据墙)、合成数据与推理时扩展可能改变规则决定算力与数据的投入方向;推理时扩展、MoE 与合成数据是当前三条替代路径,见前沿进展

这两个争论没有标准答案,但追问它们本身就是读懂时间线的能力——历史提供的不是结论,而是问题的谱系。

五、如何继续追踪这条时间线

历史不止于 2025 年。追踪演进有三个入口:

入口内容本站对应
论文地图按时间线与主题把关键论文排成地图论文地图
案例页每个模型家族的深度拆解GPT 系列ChatGPT 与对话模型Llama 与开源生态MoE 与超大规模模型多模态大模型
前沿追踪2023–2025 的趋势综述与代表论文前沿进展

建议阅读顺序

先读什么是大语言模型建立概念,再回到本页把时间线串起来,然后按你感兴趣的支线(架构→Transformer 架构详解;规模→规模法则;对齐→对齐)深入。历史的意义不是背诵日期,而是让你在读到任何新模型时,能回答:它站在哪条路线上,它把哪一步往前推了

1. 从时间线到一手文献

时间线只是索引,真正值得读的是索引指向的论文。按兴趣方向给出"第一篇读什么"的建议:

兴趣方向第一篇为什么先读它
架构Attention Is All You Need所有现代架构的共同地基,论文地图的起点
规模Scaling Laws / Chinchilla定量的主线,解释"越大越好"与"1:20 配比"
对齐InstructGPTRLHF 范式的原点,ChatGPT 的直接前身
生成范式GPT-3少样本(few-shot)范式的确立
开源生态Llama 论文与发布公告开源追平闭源这条线的起点
推理时扩展DeepSeek-R1 技术报告2024 之后最新维度,论文与新模型一手信息

读论文的地基

直接读论文门槛较高,建议先具备语言建模Transformer的概念,再按经典论文精读的"背景→方法→实验→局限"四段法精读。

延伸阅读

参考资料