外观
GPT 系列:从 GPT-1 到 GPT-4o
GPT(Generative Pre-trained Transformer)是 OpenAI 从 2018 年起迭代的一族基于 Transformer 解码器(decoder-only)的生成式语言模型,它用"预训练 + 微调/对齐 + 规模"三步走,把"预测下一个词"从学术技巧变成了通用人工智能的基座。本页按代拆解 GPT-1 → GPT-4o 的完整演进;架构与训练机制的底层知识见 Transformer 架构详解 与 语言建模:下一词预测范式,更宏观的历史坐标见 演进简史。
一、GPT 路线:一句话总结
GPT 的每一次版本迭代,都遵循同一条主线——解码器架构 + 更大规模 + 更懂人类意图:
路线:Transformer Decoder
+ 海量文本自回归预训练(预测下一个 token)
+ 按规模扩展(Scaling)
+ 对齐人类偏好(RLHF / 指令微调)
+ 模态扩展(图像 / 音频 / 视频)这条路线与 BERT 代表的"编码器 + 双向 + 理解"路线分道扬镳(对比见 BERT 与编码器家族),并在 2020 年代成为大模型的主流形态。理解 GPT 系列的逻辑,就等于理解了大模型半部历史。
| 维度 | GPT 路线的选择 | 对比路线 |
|---|---|---|
| 架构 | 解码器(decoder-only),自回归 | 编码器(BERT,双向)、编码器-解码器(T5) |
| 训练目标 | 预测下一个 token | 掩码预测(MLM) |
| 能力来源 | 规模 + 数据 + 对齐 | 深度双向上下文 |
| 产出形态 | 生成式(续写、对话、代码) | 理解式(分类、抽取、检索表示) |
| 代表里程碑 | GPT-3 / ChatGPT / GPT-4o | BERT / T5 / 检索模型 |
下面按时间线逐代拆解。
二、第一代:GPT-1(2018)——"生成式预训练 + 微调"的范式起点
1. 背景与论文
2018 年,NLP 的主流是"为每个任务单独训练模型",上下文感知的词向量(如 ELMo、Word2Vec)刚开始流行。OpenAI 的 Radford 等人发表了《Improving Language Understanding by Generative Pre-Training》,提出用语言建模作为预训练任务,再对下游任务做轻量微调——这就是"Generative Pre-Training"(GPT)名字的由来。论文没有发到 arXiv 正式版,以 OpenAI 官网技术报告形式公开。
2. 规格与关键创新
| 项目 | 规格 |
|---|---|
| 发布时间 | 2018 年 6 月 |
| 参数量 | 约 1.17 亿(12 层解码器,768 维) |
| 训练数据 | BookCorpus(约 7000 本未出版书籍,约 5GB) |
| 预训练目标 | 自回归"预测下一个 token" |
| 微调方式 | 任务自适应输入变换 + 有监督微调 |
| 词表 | 约 4 万(BPE) |
关键创新有三点:
- 两阶段范式:无监督预训练(在书籍语料上做语言建模)→ 有监督微调(在下游任务上做分类/推理/问答)。预训练学通用语言知识,微调只学任务格式。
- 任务输入变换(Traversal-Style):把分类、文本蕴含、相似度、问答统一转成"带分隔符的文本序列",用同一个解码器输出,避免了为每个任务改架构。
- Transformer 解码器:舍弃 RNN,用自注意力 + 因果掩码,训练可高度并行。
3. 效果与意义
GPT-1 在 12 个任务中的 9 个上超越了当时用 ELMo + 手工特征工程的 SOTA(含 GLUE 上平均提升约 4 分以上)。它的意义在于确立了三件事:decoder-only 可行、语言建模是万能的预训练任务、微调是廉价的任务适配方式——这三件事后来被 GPT 系列放大到极致。
为什么选择 decoder-only?
当时学界主流认为"双向编码器(如 BERT)才能做理解,解码器只能生成"。GPT-1 证明:只要预训练数据够多,单向解码器在理解任务上也不落下风,而且天然支持生成——这为后来的"一个模型解决所有问题"埋下伏笔。
三、第二代:GPT-2(2019)——零样本与"危险言论"
1. 背景与论文
2019 年 2 月,OpenAI 发布《Language Models are Unsupervised Multitask Learners》,并提出一个激进主张:语言模型本身就是多任务学习器(unsupervised multitask learner)——只要预训练足够好,无需针对任务微调,给一个自然语言条件就能做翻译、摘要、问答。
2. 规格与关键创新
| 项目 | 规格 |
|---|---|
| 发布时间 | 2019 年 2 月(因"安全"原因先放出小模型,约 8 个月后放全文) |
| 参数量 | 15 亿(48 层,1600 维,词表 50257) |
| 训练数据 | WebText:约 800 万个 Reddit 高赞外链网页(约 40GB 文本) |
| 预训练目标 | 同 GPT-1,但纯自回归、不做任何微调(零样本) |
| 分词 | Byte-level BPE(按字节切分,解决未登录词与多语言问题) |
关键创新:
- 零样本多任务:不做微调、不做 few-shot,仅用"提示 + 分隔符"描述任务,模型直接执行(如翻译:
"英语: ... 法语: ...")。 - Byte-level BPE:把分词粒度降到字节级,任何文本(emoji、代码、小语种)都能切分,词表固定为 50257。
- 数据质量至上:WebText 用 Reddit 外链过滤高质量网页,首次把"数据质量"提到与模型大小同等的地位(这一原则在 预训练:数据与目标 中有系统展开)。
3. 分阶段发布与"AI 安全"争议
OpenAI 以"模型太强、可能被滥用(生成假新闻)"为由,最初只发布小版本,8 个月后才公开完整权重。这一做法引发巨大争论:"能力本身是否危险" vs "不公开的后果是社区无法研究对齐"。今天回看,GPT-2 的"危险"更多是营销与自我约束的姿态,但它是第一次把大模型的潜在风险与发布策略摆上台面——这一主题演化为 安全与风险 一整章的内容。
4. 意义
GPT-2 证明:不微调、仅靠规模和数据,模型也能完成多任务;"提示本身是输入的一部分"这一观念由此扎根。它在 LAMBADA、WikiText、阅读理解等基准上的表现与当时的专才模型相当,为 GPT-3 的 few-shot 铺路。
四、第三代:GPT-3(2020)——规模即能力
1. 背景与论文
2020 年 5 月,Brown 等人发表《Language Models are Few-Shot Learners》,把参数从 15 亿直接拉到 1750 亿,并正式提出 In-Context Learning(上下文学习):不更新任何参数,仅通过给模型几个示例(few-shot),就能完成新任务。
2. 规格
| 项目 | 规格 |
|---|---|
| 发布时间 | 2020 年 5 月(论文);API 同年逐步开放 |
| 参数量 | 1750 亿(96 层,12288 维),同时发布 8 个不同规模的版本 |
| 训练数据 | Common Crawl(过滤后)、WebText2、Books1/2、Wikipedia,合计约 3000 亿 token(约 45TB 文本) |
| 训练计算 | 约 3640 PFLOPS-days |
| 词表 | 50257(Byte-level BPE) |
3. 关键创新
- Few-shot In-Context Learning:任务不需要微调,把示例写进输入即可:
输入: "翻译成中文:Apple → 苹果;Orange → 橙子;Banana →"
输出: "香蕉"- 规模法则的实证:GPT-3 用同一套架构、同一套数据,只放大规模,能力随参数持续提升——这与 规模法则 页中的幂律曲线完全吻合,也验证了"涌现能力"(emergent abilities)的存在。
- 能力爆发点:175B 模型在算术、代码、阅读理解、翻译上接近当时的微调 SOTA;在 SUPERGLUE 上达到 71.8%(未到人类水平),但 zero-shot/few-shot 的"通用性"首次向公众证明"大模型不用训练就能干活"。
4. 局限与启示
GPT-3 暴露的问题同样重要:会一本正经编造事实(幻觉)、有毒性偏见、数学推理不稳、输出与人类意图错位(让它写摘要它可能写成续写)。这些问题的答案指向同一个方向:仅靠预训练,模型"能力"有了,但"意图"没有对齐——这正是下一阶段 InstructGPT 要解决的。
"能力 ≠ 对齐"
GPT-3 的教训是:模型越大,错得越自信。规模只解决"会不会",不解决"要不要";对齐(alignment)是把能力导向人类意图的关键一环。
五、对齐时代:InstructGPT 与 ChatGPT(2022)
1. InstructGPT:RLHF 三步
2022 年 3 月,Ouyang 等人发表《Training language models to follow instructions with human feedback》,提出 RLHF(基于人类反馈的强化学习) 三步流水线(详见 对齐:RLHF 与 DPO):
① 收集人类写的指令-回答对 → SFT 微调出初版助手
② 让人类对多个回答排序 → 训练奖励模型(RM)学会"哪个更好"
③ 用 PPO 强化学习最大化奖励,同时加 KL 惩罚防止跑偏关键实证:只有 13 亿参数的 InstructGPT-1.3B,在人类评估中胜过了 1750 亿的 GPT-3——对齐让"小模型"都比"大而野"的模型更讨人喜欢。这条"对齐杠杆"后来被证明与"规模杠杆"同样关键。
2. ChatGPT:产品化的引爆点
2022 年 11 月 30 日,OpenAI 发布 ChatGPT(基于 GPT-3.5 系列,把 RLHF 进一步用在对话场景,配套对话式数据与安全护栏),上线 5 天用户破百万,两个月月活破亿,成为史上增长最快的消费应用。ChatGPT 的故事、技术栈与产品影响独立成页:ChatGPT 与对话模型。
3. 对齐时代的意义
InstructGPT/ChatGPT 证明:同样的底座,对齐与否决定它是"续写机器"还是"通用助手"。此后"预训练 + SFT + RLHF/DPO"成为所有主流大模型(Llama、Qwen、Claude、Gemini 等)的标配后训练流水线,见 微调:SFT 与参数高效微调。
这里要澄清一个常被讨论的代价——"对齐税"(alignment tax):为了安全与合规,模型在标准基准上可能略降分。InstructGPT 时代这一现象明显,后来的研究(DPO、Safe RLHF 等)努力降低对齐税(见 对齐:RLHF 与 DPO)。理解"对齐会带来小代价、却换来可用性"的权衡,就能理解为什么所有商用模型都愿意付出这笔税——没有对齐的能力,无法交付给真实用户。
六、第四代:GPT-4(2023)——多模态与"考试怪兽"
1. 发布与技术报告
2023 年 3 月 14 日,OpenAI 发布 GPT-4,随附《GPT-4 Technical Report》(发布于 arXiv)。报告中刻意不披露参数量、训练数据与算力(业界传闻为 MoE 架构、总参数约 1.8T,未经 OpenAI 证实,以官方发布为准),转而用大量能力基准与安全评测来论证模型质量。
2. 关键能力
| 维度 | GPT-4 的表现 |
|---|---|
| 多模态输入 | 接受图像 + 文本(识别图表、截图、手写内容并推理) |
| 考试水平 | Uniform Bar Exam 前 10%、SAT Math 700+、多项 AP 满分(逼近人类) |
| 标准基准 | MMLU 5-shot 约 86%(此前 GPT-3.5 约 70%) |
| 上下文 | 发布时 8K,后续扩展 32K 与 128K |
| 推理稳定性 | 相比 GPT-3.5,事实性、指令遵循、越狱难度显著提升 |
| 参数规模 | 未公开(传闻 MoE,约 1.8T 总参数) |
3. 启示
- 多模态是下一代输入:GPT-4V(视觉版)让"看图做题"成为现实,见 多模态大模型。
- 评测转向"人类任务":用律师考试、SAT 等真实考试评估大模型,取代传统 NLP benchmark——这催生了 评测与基准 页中的"人类考试类基准"浪潮。
- MoE 传闻:如果 GPT-4 确为稀疏专家模型,说明"激活参数 << 总参数"已是旗舰模型的内部选择,见 MoE 与超大规模模型。
- 安全评测前置:技术报告用大量篇幅讲红队测试与安全护栏,对齐从"事后补丁"变成"训练内建"。
七、第五代:GPT-4o(2024)——原生多模态与实时交互
1. 发布
2024 年 5 月 13 日,OpenAI 发布 GPT-4o("o" = omni,全模态),随附 System Card。它把文本、图像、音频、视频统一进同一个模型(原生多模态),并开放给所有用户免费使用。
2. 关键创新
| 项目 | 规格 |
|---|---|
| 发布时间 | 2024 年 5 月 |
| 输入模态 | 文本 / 图像 / 音频 / 视频(统一 token 空间) |
| 输出模态 | 文本 / 图像(DALL·E 集成)/ 音频(TTS) |
| 实时性 | 语音对话平均响应约 320ms,接近人类对话节奏 |
| 交互范式 | 语音对话、打断、情感表达、实时视觉理解 |
| 成本 | API 定价比 GPT-4 显著降低,且对免费用户开放 |
3. 意义
GPT-4o 把大模型从"打字界面"推进到"对话界面":实时语音、视觉理解、情绪识别在同一个模型内完成,延迟从秒级压到亚秒级。它同时验证了两条路线:原生多模态(不再需要 CLIP 拼接)与"能力平权"(顶级模型免费开放)。这也让 ChatGPT 与对话模型 的产品形态再次进化。
4. 序列的延续(2024 下半年后)
GPT-4o 之后,OpenAI 的序列分化出两条支线:o 系列(o1/o3,推理时扩展,2024 年 9 月起,训练时用强化学习教模型"慢思考",见 前沿进展)与 GPT-5 系列(2025 年 8 月发布,统一推理与多模态)。这两条支线的细节以官方发布为准,本页聚焦到 GPT-4o。
八、技术共性:解码器、上下文与工程细节
前面按代讲了"发生了什么",这一节补上贯穿各代的工程共性——它们是 GPT 系列能稳定迭代的底层原因。
1. 解码器架构的四个工程支点
| 支点 | 作用 | 与 GPT 系列的关系 |
|---|---|---|
| 因果掩码 | 保证自回归(每个位置只看左侧) | 预训练与推理行为一致,天然适合生成 |
| KV Cache | 缓存历史注意力键值,生成时免重算 | 决定生成速度与并发成本(见 推理基础) |
| 位置编码 | 表达 token 顺序 | GPT-2/3 用绝对位置嵌入,后期普遍用 RoPE 类外推方案 |
| 层归一化与残差 | 稳定深层训练 | 从 Post-Norm 走向 Pre-Norm,支撑超深网络扩展 |
2. 上下文窗口的演进
| 模型 | 上下文窗口 |
|---|---|
| GPT-2 | 1024 |
| GPT-3 | 2048 |
| GPT-3.5 / text-davinci-003 | 4096 |
| GPT-4 | 8K → 32K → 128K |
| GPT-4o | 128K |
| o1 / o3 | 128K~200K+(以官方发布为准) |
上下文窗口每代扩张的驱动力不是架构革命,而是位置编码外推与注意力工程(FlashAttention、稀疏注意力)的累积,详见 上下文与长文本。
注意力的计算成本随序列长度平方增长:上下文从 2K 扩到 128K,单次前向的注意力计算量增加约 4096 倍——这正是长上下文模型必须依赖 FlashAttention 级内存优化、稀疏注意力与 KV cache 管理的原因。GPT 系列的每个版本都在"上下文长度"与"推理成本"之间重新取舍:GPT-4 从 8K 起步、逐步开放 32K/128K,就是先用较短窗口保证推理经济性,再靠工程优化逐步放开。对使用者而言,长上下文不是免费的:把上百页文档整体塞进上下文,远比用 RAG 只带相关片段昂贵,这也是 RAG:检索增强生成 能在长上下文时代继续存在的原因。
3. API 与模型代号:产品层如何演进
| 时间 | 模型代号 | 说明 |
|---|---|---|
| 2020–2021 | davinci / text-davinci-001 | GPT-3 基础 API |
| 2022 | text-davinci-002 / 003 | 对齐后的指令模型(InstructGPT 产品化) |
| 2023.3 | gpt-3.5-turbo、gpt-4 | 对话优化的价格革命与旗舰能力 |
| 2023.11 | gpt-4-turbo(128K) | 长上下文 + 大幅降价 |
| 2024.5 | gpt-4o | 全模态 + 免费开放 |
4. 训练流水线的三段式规格
GPT 系列的后训练流水线已标准化为三段式:预训练 → SFT → RLHF。三个阶段的输入输出与主要成本:
| 阶段 | 输入 | 输出 | 主要成本 |
|---|---|---|---|
| 预训练 | 数万亿 token 网页/书籍/代码 | base model(会续写) | 数千万~数亿美元 GPU 算力 |
| SFT | 数万~数十万条指令-回答对 | 指令跟随模型 | 单机~小集群 |
| RLHF | 人类偏好排序 + 奖励模型 | 对齐助手 | 中等算力 + 大量人工标注 |
5. 三个不变与三个变化
三个不变:
- 自回归目标不变:从 GPT-1 到 GPT-4o,核心目标始终是"预测下一个 token",架构的每次调整都服务于让这个目标训得更好、用得更好;
- 规模杠杆不变:参数、数据、算力始终是能力的第一推动力(见 规模法则);
- 两阶段范式不变:"预训练 + 后训练(微调/对齐)"的骨架从未改变。
三个变化:
- 对齐从"可选"变"必选":InstructGPT 之后,没有对齐的 base model 几乎无法作为产品交付;
- 模态从"纯文本"变"全模态":GPT-4V/4o 让输入不再限于文字;
- 能力从"单轮"变"多步":o 系列的推理时扩展让模型从"快答"走向"慢想",Agent 与工具使用成为新战场(见 基于 LLM 的 Agent)。
6. 数据与参数的配比教训
GPT-3 训练时遵循"更多参数更好"的直觉:用约 3000 亿 token 支撑 1750 亿参数。2022 年的 Chinchilla 论文指出,在固定计算预算下参数与数据应大致按 1:20 配比——即 1750 亿参数需要约 3.5 万亿 token 才能发挥全部潜力,GPT-3 的"数据欠配"意味着它没有把参数吃到极限。后续模型的训练数据普遍从数千亿 token 提升到数万亿 token,正是对这条教训的修正。这对实践者的启示很直接:在加参数之前,先确认数据规模是否配得上参数。小团队做微调时同理——与其盲目增大模型,不如先把数据质量与覆盖做足。这条配比逻辑与更多扩展细节见 规模法则。
这条教训也解释了 GPT 系列后训练的重心变化:当预训练数据的边际收益递减时,对齐与指令微调成了更便宜的"能力杠杆"——InstructGPT 的 13 亿参数模型能胜过 1750 亿的 GPT-3,本质上是把有限算力从"堆参数"转移到了"调行为"上。参数、数据、对齐三者如何组合,是每一个大模型项目都要回答的成本题。
九、安全、评测与生态影响
1. GPT 系列与评测基准的互动
每一次 GPT 换代都会重塑评测格局:GPT-1/2 时代用 GLUE 等传统基准;GPT-3 催生"few-shot 评估"观念;InstructGPT 后人类评估与"偏好率"成为核心指标;GPT-4 则把律师考试、SAT、MMLU 等真实考试推上前台,引发"考试型基准"浪潮(方法体系见 评测与基准)。评测与模型的博弈(榜单污染、数据泄漏)也因此成为公开议题,完整评测版图见 数据集与基准档案。
2. 安全与争议史
| 事件 | 时间 | 争议焦点 |
|---|---|---|
| GPT-2 分阶段发布 | 2019 | "能力即危险" vs "不公开妨碍对齐研究" |
| GPT-3 偏见与幻觉报告 | 2020 | 大模型的社会偏见、错误事实 |
| ChatGPT 越狱热潮 | 2022–2023 | 提示注入、DAN 类越狱、内容滥用 |
| GPT-4 红队测试 | 2023 | 安全评测前置是否足够 |
| 训练数据版权诉讼 | 2023 起 | 大规模爬取与版权合规(以司法结果为准) |
3. 对行业的范式带动
GPT 系列在多数时间点不是孤立的冠军,而是"行业能力标尺":每次换代都会带动评测基准、训练范式、产品形态与开源生态的连锁升级——2023 年的多模态、2024 年的 MoE 与推理模型、2025 年的 Agent 化,几乎都能在 GPT 的版本迭代中找到影子。完整坐标体系见 主流模型档案 与 论文地图。
看懂 GPT 系列只需记住一张图
预训练给"知识",SFT 给"格式",RLHF 给"意愿"——GPT 每一代升级都在这三者的配比上做文章,外加一个"规模旋钮"(参数与数据)和一个"模态旋钮"(输入输出范围)。
十、实践视角:怎么选、怎么用 GPT 类模型
讲完历史与机制,落到实践:今天要用 GPT 类模型,有哪几条路、各自的成本与坑。
1. 使用方式的决策表
| 方式 | 做法 | 成本 | 适用 |
|---|---|---|---|
| 直接调用 API | 提示工程 + 流式输出 | 按 token 付费 | 快速验证、通用助手 |
| RAG | 外部知识检索 + 生成 | 加检索/存储成本 | 知识库、私有数据 |
| 微调(LoRA) | 定制风格/格式/领域行为 | 一次性训练 | 行为类问题(见 微调:SFT 与参数高效微调) |
| 蒸馏 | 用 GPT 答案训练小模型 | 一次性 | 高并发、低成本 |
| 开源替代 | 换 Llama / Qwen / DeepSeek | 算力投入 | 数据敏感、长期降本 |
2. 一次对话的 token 账本
一次问答的成本 ≈ (输入 token + 输出 token) × 单价
输入:系统提示 + 历史对话 + 用户消息 + 检索片段
输出:max_tokens 上限内实际生成的 token控成本三招:①裁剪冗余历史(见 上下文与长文本);②简单任务走小模型(gpt-4o-mini 类);③设 max_tokens 与预算熔断。
3. 什么时候选开源、什么时候选 GPT
| 判断维度 | 选 GPT 系 | 选开源 |
|---|---|---|
| 能力上限 | 最强推理/多模态 | 略逊但够用 |
| 数据安全 | 依赖供应商 | 完全私有化 |
| 成本曲线 | 按量付费 | 一次投入 |
| 生态/工具 | 官方 API 生态 | HF 社区生态 |
| 合规 | 需审查数据出境 | 需自查权重合规 |
4. 常见误区与反模式
| 误区 | 正确姿势 |
|---|---|
| 把 GPT 当数据库查事实 | 用 RAG/搜索 + 要求引用 |
| 用微调教新知识 | 那是 RAG 的活 |
| 迷信最新代号 | 按任务评测选型 |
| 只调温度调不好输出 | 先改提示与示例 |
| 上下文无脑塞满 | 裁剪、摘要、路由 |
没有"最好"的模型,只有"最合适"的
GPT 系列是能力标尺,不是万能答案。选择模型的正道是:定义任务 → 建评测集 → 多模型对比 → 按成本/安全/延迟加权。评测方法见 评估实战。
十一、总览表与路线总结
1. 一代一张表的浓缩版
| 代号 | 时间 | 参数量 | 关键数据 | 关键创新 | 一句话意义 |
|---|---|---|---|---|---|
| GPT-1 | 2018.6 | 约 1.17 亿 | BookCorpus(约 5GB) | 生成式预训练 + 微调 | 确立 decoder-only 与两阶段范式 |
| GPT-2 | 2019.2 | 15 亿 | WebText(约 40GB) | 零样本多任务、Byte-level BPE | 证明"语言模型即多任务学习器" |
| GPT-3 | 2020.5 | 1750 亿 | 约 3000 亿 token | few-shot 上下文学习、规模即能力 | 大模型概念确立、涌现能力出圈 |
| InstructGPT | 2022.3(论文) | 13 亿(主打实验) | 13k 指令 + 33k 偏好对 | RLHF 三步(SFT→RM→PPO) | 对齐范式确立,小模型胜大模型 |
| ChatGPT | 2022.11 | GPT-3.5 系列 | 对话数据 + RLHF | 对话产品化 + 安全护栏 | LLM 从技术变为大众产品 |
| GPT-4 | 2023.3 | 未公开(传闻 MoE ~1.8T) | 未公开 | 多模态输入、考试级能力 | 能力跃迁 + 多模态 + 安全前置 |
| GPT-4o | 2024.5 | 未公开 | 未公开 | 原生多模态、实时语音 | 交互范式从打字变为对话 |
2. 五个里程碑启示
- 架构不换、规模换能力(GPT-1 → GPT-3):同样的 decoder + next-token prediction,参数 ×1500 后涌现出翻译、代码、推理能力——规模法则是最确定的杠杆。
- 对齐是第二条杠杆(GPT-3 → InstructGPT):13B 对齐模型胜过 175B 未对齐模型,说明"意愿"和"能力"一样重要。
- 产品是第三条杠杆(InstructGPT → ChatGPT):技术先到位,产品化(对话界面 + 免费 + 护栏)才引爆大众市场。
- 模态扩展是第四步(GPT-4 → GPT-4o):从纯文本到"全模态原生",输入/输出的自由度持续放宽。
- 每一次升级都在放大同一个配方:解码器 + 规模 + 数据质量 + 对齐 + 模态,这五件套共同定义了 "GPT 路线"。
一句话记住 GPT 系列
GPT 路线 = decoder-only 架构 + 规模与数据 + RLHF 对齐 + 模态扩展;它每一步都只做好一件事,却通过"叠加"实现了范式级跃迁。
十二、常见问题速答
| 问题 | 速答 |
|---|---|
| GPT-1 有多少参数? | 约 1.17 亿,12 层解码器 |
| GPT-2 为什么词表是 50257? | Byte-level BPE 的固定词表,覆盖任意文本 |
| GPT-3 训练数据多大? | 约 3000 亿 token(Common Crawl、Books、WebText2、维基) |
| ChatGPT 和 InstructGPT 的区别? | 同一套 RLHF 技术,ChatGPT 在对话场景做 SFT/偏好训练并产品化 |
| GPT-4 为什么不说参数量? | OpenAI 出于竞争与安全考虑不公开(以官方发布为准) |
| GPT-4o 的 o 是什么意思? | Omni(全模态),一个模型处理文本/图像/音频/视频 |
| o1 和 GPT-4o 怎么分工? | o1 强化推理(慢思考),4o 强调实时多模态(快交互) |
| 上下文窗口多大? | GPT-4 起 8K/32K/128K,4o 128K,o 系列更长(以官方为准) |
| ChatGPT 免费吗? | 基础版免费,Plus/Team 付费解锁更强模型与功能 |
| GPT 会取代 BERT 吗? | 生成场景取代,检索/分类/蒸馏仍大量用编码器 |
| 用 GPT 要做什么准备? | 提示工程 + 评测集 + 成本预算,再考虑 RAG/微调 |
| 会不会越用越笨? | 模型本身不变;产品层可用 RAG/反馈闭环改善体验 |
补记:OpenAI 的命名(GPT-3.5、GPT-4、GPT-4o、o1、GPT-5)并不完全按代数递增,同一代内部还有大量小版本(turbo、mini、omni 等),使用时应以官方 API 文档的模型代号与参数为准。这种命名风格也提醒我们:评估模型靠实测而非代号——同一代号在不同时间可能指向不同权重,历史记录与评测基线都要随版本更新。
遇到新的 GPT 版本怎么办
先看官方发布说明与系统卡(System Card),再做三件事:①跑自己的 golden set 对比上一版;②确认上下文/定价/速率变化;③评估安全与合规差异。版本迭代期,评测集是唯一可信的尺子。
十三、延伸阅读
- 演进简史——把 GPT 放进 1940s–2020s 的完整时间线
- Transformer 架构详解——GPT 赖以起家的自注意力机制
- 对齐:RLHF 与 DPO——InstructGPT 以来的对齐技术详解
- ChatGPT 与对话模型——GPT 系列产品化的完整故事
- 多模态大模型——GPT-4V/4o 的多模态路线拆解
- MoE 与超大规模模型——GPT-4 传闻架构背后的稀疏专家技术
- 经典论文精读——GPT-1/2/3、InstructGPT 论文的逐篇精读
参考资料
- Radford et al. Improving Language Understanding by Generative Pre-Training(GPT-1, 2018)——GPT-1 原始论文(OpenAI 官方 PDF)
- Radford et al. Language Models are Unsupervised Multitask Learners(GPT-2, 2019)——GPT-2 论文与发布说明
- Brown et al. Language Models are Few-Shot Learners(GPT-3, 2020)——GPT-3 论文(arXiv)
- Ouyang et al. Training language models to follow instructions with human feedback(InstructGPT, 2022)——RLHF 原始论文(arXiv)
- OpenAI. Introducing ChatGPT(2022.11.30)——ChatGPT 官方发布博客
- OpenAI. GPT-4 Technical Report(2023)——GPT-4 技术报告(arXiv)
- OpenAI. Hello GPT-4o(2024.5.13)——GPT-4o 官方发布博客