Skip to content

GPT 系列:从 GPT-1 到 GPT-4o

本页速览 GPT 系列定义了"生成式预训练 + 规模 + 对齐"的整条大模型技术路线。本文按代拆解 GPT-1 到 GPT-4o 的参数、数据、关键创新与历史意义,并给出每代里程碑的启示与总览表。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

GPT 系列:从 GPT-1 到 GPT-4o

GPT(Generative Pre-trained Transformer)是 OpenAI 从 2018 年起迭代的一族基于 Transformer 解码器(decoder-only)的生成式语言模型,它用"预训练 + 微调/对齐 + 规模"三步走,把"预测下一个词"从学术技巧变成了通用人工智能的基座。本页按代拆解 GPT-1 → GPT-4o 的完整演进;架构与训练机制的底层知识见 Transformer 架构详解语言建模:下一词预测范式,更宏观的历史坐标见 演进简史

一、GPT 路线:一句话总结

GPT 的每一次版本迭代,都遵循同一条主线——解码器架构 + 更大规模 + 更懂人类意图

路线:Transformer Decoder
      + 海量文本自回归预训练(预测下一个 token)
      + 按规模扩展(Scaling)
      + 对齐人类偏好(RLHF / 指令微调)
      + 模态扩展(图像 / 音频 / 视频)

这条路线与 BERT 代表的"编码器 + 双向 + 理解"路线分道扬镳(对比见 BERT 与编码器家族),并在 2020 年代成为大模型的主流形态。理解 GPT 系列的逻辑,就等于理解了大模型半部历史。

维度GPT 路线的选择对比路线
架构解码器(decoder-only),自回归编码器(BERT,双向)、编码器-解码器(T5)
训练目标预测下一个 token掩码预测(MLM)
能力来源规模 + 数据 + 对齐深度双向上下文
产出形态生成式(续写、对话、代码)理解式(分类、抽取、检索表示)
代表里程碑GPT-3 / ChatGPT / GPT-4oBERT / T5 / 检索模型

下面按时间线逐代拆解。

二、第一代:GPT-1(2018)——"生成式预训练 + 微调"的范式起点

1. 背景与论文

2018 年,NLP 的主流是"为每个任务单独训练模型",上下文感知的词向量(如 ELMo、Word2Vec)刚开始流行。OpenAI 的 Radford 等人发表了《Improving Language Understanding by Generative Pre-Training》,提出用语言建模作为预训练任务,再对下游任务做轻量微调——这就是"Generative Pre-Training"(GPT)名字的由来。论文没有发到 arXiv 正式版,以 OpenAI 官网技术报告形式公开。

2. 规格与关键创新

项目规格
发布时间2018 年 6 月
参数量约 1.17 亿(12 层解码器,768 维)
训练数据BookCorpus(约 7000 本未出版书籍,约 5GB)
预训练目标自回归"预测下一个 token"
微调方式任务自适应输入变换 + 有监督微调
词表约 4 万(BPE)

关键创新有三点:

  1. 两阶段范式:无监督预训练(在书籍语料上做语言建模)→ 有监督微调(在下游任务上做分类/推理/问答)。预训练学通用语言知识,微调只学任务格式。
  2. 任务输入变换(Traversal-Style):把分类、文本蕴含、相似度、问答统一转成"带分隔符的文本序列",用同一个解码器输出,避免了为每个任务改架构。
  3. Transformer 解码器:舍弃 RNN,用自注意力 + 因果掩码,训练可高度并行。

3. 效果与意义

GPT-1 在 12 个任务中的 9 个上超越了当时用 ELMo + 手工特征工程的 SOTA(含 GLUE 上平均提升约 4 分以上)。它的意义在于确立了三件事:decoder-only 可行、语言建模是万能的预训练任务、微调是廉价的任务适配方式——这三件事后来被 GPT 系列放大到极致。

为什么选择 decoder-only?

当时学界主流认为"双向编码器(如 BERT)才能做理解,解码器只能生成"。GPT-1 证明:只要预训练数据够多,单向解码器在理解任务上也不落下风,而且天然支持生成——这为后来的"一个模型解决所有问题"埋下伏笔。

三、第二代:GPT-2(2019)——零样本与"危险言论"

1. 背景与论文

2019 年 2 月,OpenAI 发布《Language Models are Unsupervised Multitask Learners》,并提出一个激进主张:语言模型本身就是多任务学习器(unsupervised multitask learner)——只要预训练足够好,无需针对任务微调,给一个自然语言条件就能做翻译、摘要、问答。

2. 规格与关键创新

项目规格
发布时间2019 年 2 月(因"安全"原因先放出小模型,约 8 个月后放全文)
参数量15 亿(48 层,1600 维,词表 50257)
训练数据WebText:约 800 万个 Reddit 高赞外链网页(约 40GB 文本)
预训练目标同 GPT-1,但纯自回归、不做任何微调(零样本)
分词Byte-level BPE(按字节切分,解决未登录词与多语言问题)

关键创新:

  1. 零样本多任务:不做微调、不做 few-shot,仅用"提示 + 分隔符"描述任务,模型直接执行(如翻译:"英语: ... 法语: ...")。
  2. Byte-level BPE:把分词粒度降到字节级,任何文本(emoji、代码、小语种)都能切分,词表固定为 50257。
  3. 数据质量至上:WebText 用 Reddit 外链过滤高质量网页,首次把"数据质量"提到与模型大小同等的地位(这一原则在 预训练:数据与目标 中有系统展开)。

3. 分阶段发布与"AI 安全"争议

OpenAI 以"模型太强、可能被滥用(生成假新闻)"为由,最初只发布小版本,8 个月后才公开完整权重。这一做法引发巨大争论:"能力本身是否危险" vs "不公开的后果是社区无法研究对齐"。今天回看,GPT-2 的"危险"更多是营销与自我约束的姿态,但它是第一次把大模型的潜在风险与发布策略摆上台面——这一主题演化为 安全与风险 一整章的内容。

4. 意义

GPT-2 证明:不微调、仅靠规模和数据,模型也能完成多任务;"提示本身是输入的一部分"这一观念由此扎根。它在 LAMBADA、WikiText、阅读理解等基准上的表现与当时的专才模型相当,为 GPT-3 的 few-shot 铺路。

四、第三代:GPT-3(2020)——规模即能力

1. 背景与论文

2020 年 5 月,Brown 等人发表《Language Models are Few-Shot Learners》,把参数从 15 亿直接拉到 1750 亿,并正式提出 In-Context Learning(上下文学习):不更新任何参数,仅通过给模型几个示例(few-shot),就能完成新任务。

2. 规格

项目规格
发布时间2020 年 5 月(论文);API 同年逐步开放
参数量1750 亿(96 层,12288 维),同时发布 8 个不同规模的版本
训练数据Common Crawl(过滤后)、WebText2、Books1/2、Wikipedia,合计约 3000 亿 token(约 45TB 文本)
训练计算约 3640 PFLOPS-days
词表50257(Byte-level BPE)

3. 关键创新

  1. Few-shot In-Context Learning:任务不需要微调,把示例写进输入即可:
输入: "翻译成中文:Apple → 苹果;Orange → 橙子;Banana →"
输出: "香蕉"
  1. 规模法则的实证:GPT-3 用同一套架构、同一套数据,只放大规模,能力随参数持续提升——这与 规模法则 页中的幂律曲线完全吻合,也验证了"涌现能力"(emergent abilities)的存在。
  2. 能力爆发点:175B 模型在算术、代码、阅读理解、翻译上接近当时的微调 SOTA;在 SUPERGLUE 上达到 71.8%(未到人类水平),但 zero-shot/few-shot 的"通用性"首次向公众证明"大模型不用训练就能干活"。

4. 局限与启示

GPT-3 暴露的问题同样重要:会一本正经编造事实(幻觉)、有毒性偏见、数学推理不稳、输出与人类意图错位(让它写摘要它可能写成续写)。这些问题的答案指向同一个方向:仅靠预训练,模型"能力"有了,但"意图"没有对齐——这正是下一阶段 InstructGPT 要解决的。

"能力 ≠ 对齐"

GPT-3 的教训是:模型越大,错得越自信。规模只解决"会不会",不解决"要不要";对齐(alignment)是把能力导向人类意图的关键一环。

五、对齐时代:InstructGPT 与 ChatGPT(2022)

1. InstructGPT:RLHF 三步

2022 年 3 月,Ouyang 等人发表《Training language models to follow instructions with human feedback》,提出 RLHF(基于人类反馈的强化学习) 三步流水线(详见 对齐:RLHF 与 DPO):

① 收集人类写的指令-回答对 → SFT 微调出初版助手
② 让人类对多个回答排序 → 训练奖励模型(RM)学会"哪个更好"
③ 用 PPO 强化学习最大化奖励,同时加 KL 惩罚防止跑偏

关键实证:只有 13 亿参数的 InstructGPT-1.3B,在人类评估中胜过了 1750 亿的 GPT-3——对齐让"小模型"都比"大而野"的模型更讨人喜欢。这条"对齐杠杆"后来被证明与"规模杠杆"同样关键。

2. ChatGPT:产品化的引爆点

2022 年 11 月 30 日,OpenAI 发布 ChatGPT(基于 GPT-3.5 系列,把 RLHF 进一步用在对话场景,配套对话式数据与安全护栏),上线 5 天用户破百万,两个月月活破亿,成为史上增长最快的消费应用。ChatGPT 的故事、技术栈与产品影响独立成页:ChatGPT 与对话模型

3. 对齐时代的意义

InstructGPT/ChatGPT 证明:同样的底座,对齐与否决定它是"续写机器"还是"通用助手"。此后"预训练 + SFT + RLHF/DPO"成为所有主流大模型(Llama、Qwen、Claude、Gemini 等)的标配后训练流水线,见 微调:SFT 与参数高效微调

这里要澄清一个常被讨论的代价——"对齐税"(alignment tax):为了安全与合规,模型在标准基准上可能略降分。InstructGPT 时代这一现象明显,后来的研究(DPO、Safe RLHF 等)努力降低对齐税(见 对齐:RLHF 与 DPO)。理解"对齐会带来小代价、却换来可用性"的权衡,就能理解为什么所有商用模型都愿意付出这笔税——没有对齐的能力,无法交付给真实用户。

六、第四代:GPT-4(2023)——多模态与"考试怪兽"

1. 发布与技术报告

2023 年 3 月 14 日,OpenAI 发布 GPT-4,随附《GPT-4 Technical Report》(发布于 arXiv)。报告中刻意不披露参数量、训练数据与算力(业界传闻为 MoE 架构、总参数约 1.8T,未经 OpenAI 证实,以官方发布为准),转而用大量能力基准与安全评测来论证模型质量。

2. 关键能力

维度GPT-4 的表现
多模态输入接受图像 + 文本(识别图表、截图、手写内容并推理)
考试水平Uniform Bar Exam 前 10%、SAT Math 700+、多项 AP 满分(逼近人类)
标准基准MMLU 5-shot 约 86%(此前 GPT-3.5 约 70%)
上下文发布时 8K,后续扩展 32K 与 128K
推理稳定性相比 GPT-3.5,事实性、指令遵循、越狱难度显著提升
参数规模未公开(传闻 MoE,约 1.8T 总参数)

3. 启示

  1. 多模态是下一代输入:GPT-4V(视觉版)让"看图做题"成为现实,见 多模态大模型
  2. 评测转向"人类任务":用律师考试、SAT 等真实考试评估大模型,取代传统 NLP benchmark——这催生了 评测与基准 页中的"人类考试类基准"浪潮。
  3. MoE 传闻:如果 GPT-4 确为稀疏专家模型,说明"激活参数 << 总参数"已是旗舰模型的内部选择,见 MoE 与超大规模模型
  4. 安全评测前置:技术报告用大量篇幅讲红队测试与安全护栏,对齐从"事后补丁"变成"训练内建"。

七、第五代:GPT-4o(2024)——原生多模态与实时交互

1. 发布

2024 年 5 月 13 日,OpenAI 发布 GPT-4o("o" = omni,全模态),随附 System Card。它把文本、图像、音频、视频统一进同一个模型(原生多模态),并开放给所有用户免费使用。

2. 关键创新

项目规格
发布时间2024 年 5 月
输入模态文本 / 图像 / 音频 / 视频(统一 token 空间)
输出模态文本 / 图像(DALL·E 集成)/ 音频(TTS)
实时性语音对话平均响应约 320ms,接近人类对话节奏
交互范式语音对话、打断、情感表达、实时视觉理解
成本API 定价比 GPT-4 显著降低,且对免费用户开放

3. 意义

GPT-4o 把大模型从"打字界面"推进到"对话界面":实时语音、视觉理解、情绪识别在同一个模型内完成,延迟从秒级压到亚秒级。它同时验证了两条路线:原生多模态(不再需要 CLIP 拼接)与"能力平权"(顶级模型免费开放)。这也让 ChatGPT 与对话模型 的产品形态再次进化。

4. 序列的延续(2024 下半年后)

GPT-4o 之后,OpenAI 的序列分化出两条支线:o 系列(o1/o3,推理时扩展,2024 年 9 月起,训练时用强化学习教模型"慢思考",见 前沿进展)与 GPT-5 系列(2025 年 8 月发布,统一推理与多模态)。这两条支线的细节以官方发布为准,本页聚焦到 GPT-4o。

八、技术共性:解码器、上下文与工程细节

前面按代讲了"发生了什么",这一节补上贯穿各代的工程共性——它们是 GPT 系列能稳定迭代的底层原因。

1. 解码器架构的四个工程支点

支点作用与 GPT 系列的关系
因果掩码保证自回归(每个位置只看左侧)预训练与推理行为一致,天然适合生成
KV Cache缓存历史注意力键值,生成时免重算决定生成速度与并发成本(见 推理基础
位置编码表达 token 顺序GPT-2/3 用绝对位置嵌入,后期普遍用 RoPE 类外推方案
层归一化与残差稳定深层训练从 Post-Norm 走向 Pre-Norm,支撑超深网络扩展

2. 上下文窗口的演进

模型上下文窗口
GPT-21024
GPT-32048
GPT-3.5 / text-davinci-0034096
GPT-48K → 32K → 128K
GPT-4o128K
o1 / o3128K~200K+(以官方发布为准)

上下文窗口每代扩张的驱动力不是架构革命,而是位置编码外推与注意力工程(FlashAttention、稀疏注意力)的累积,详见 上下文与长文本

注意力的计算成本随序列长度平方增长:上下文从 2K 扩到 128K,单次前向的注意力计算量增加约 4096 倍——这正是长上下文模型必须依赖 FlashAttention 级内存优化、稀疏注意力与 KV cache 管理的原因。GPT 系列的每个版本都在"上下文长度"与"推理成本"之间重新取舍:GPT-4 从 8K 起步、逐步开放 32K/128K,就是先用较短窗口保证推理经济性,再靠工程优化逐步放开。对使用者而言,长上下文不是免费的:把上百页文档整体塞进上下文,远比用 RAG 只带相关片段昂贵,这也是 RAG:检索增强生成 能在长上下文时代继续存在的原因。

3. API 与模型代号:产品层如何演进

时间模型代号说明
2020–2021davinci / text-davinci-001GPT-3 基础 API
2022text-davinci-002 / 003对齐后的指令模型(InstructGPT 产品化)
2023.3gpt-3.5-turbo、gpt-4对话优化的价格革命与旗舰能力
2023.11gpt-4-turbo(128K)长上下文 + 大幅降价
2024.5gpt-4o全模态 + 免费开放

4. 训练流水线的三段式规格

GPT 系列的后训练流水线已标准化为三段式:预训练 → SFT → RLHF。三个阶段的输入输出与主要成本:

阶段输入输出主要成本
预训练数万亿 token 网页/书籍/代码base model(会续写)数千万~数亿美元 GPU 算力
SFT数万~数十万条指令-回答对指令跟随模型单机~小集群
RLHF人类偏好排序 + 奖励模型对齐助手中等算力 + 大量人工标注

5. 三个不变与三个变化

三个不变

  1. 自回归目标不变:从 GPT-1 到 GPT-4o,核心目标始终是"预测下一个 token",架构的每次调整都服务于让这个目标训得更好、用得更好;
  2. 规模杠杆不变:参数、数据、算力始终是能力的第一推动力(见 规模法则);
  3. 两阶段范式不变:"预训练 + 后训练(微调/对齐)"的骨架从未改变。

三个变化

  1. 对齐从"可选"变"必选":InstructGPT 之后,没有对齐的 base model 几乎无法作为产品交付;
  2. 模态从"纯文本"变"全模态":GPT-4V/4o 让输入不再限于文字;
  3. 能力从"单轮"变"多步":o 系列的推理时扩展让模型从"快答"走向"慢想",Agent 与工具使用成为新战场(见 基于 LLM 的 Agent)。

6. 数据与参数的配比教训

GPT-3 训练时遵循"更多参数更好"的直觉:用约 3000 亿 token 支撑 1750 亿参数。2022 年的 Chinchilla 论文指出,在固定计算预算下参数与数据应大致按 1:20 配比——即 1750 亿参数需要约 3.5 万亿 token 才能发挥全部潜力,GPT-3 的"数据欠配"意味着它没有把参数吃到极限。后续模型的训练数据普遍从数千亿 token 提升到数万亿 token,正是对这条教训的修正。这对实践者的启示很直接:在加参数之前,先确认数据规模是否配得上参数。小团队做微调时同理——与其盲目增大模型,不如先把数据质量与覆盖做足。这条配比逻辑与更多扩展细节见 规模法则

这条教训也解释了 GPT 系列后训练的重心变化:当预训练数据的边际收益递减时,对齐与指令微调成了更便宜的"能力杠杆"——InstructGPT 的 13 亿参数模型能胜过 1750 亿的 GPT-3,本质上是把有限算力从"堆参数"转移到了"调行为"上。参数、数据、对齐三者如何组合,是每一个大模型项目都要回答的成本题。

九、安全、评测与生态影响

1. GPT 系列与评测基准的互动

每一次 GPT 换代都会重塑评测格局:GPT-1/2 时代用 GLUE 等传统基准;GPT-3 催生"few-shot 评估"观念;InstructGPT 后人类评估与"偏好率"成为核心指标;GPT-4 则把律师考试、SAT、MMLU 等真实考试推上前台,引发"考试型基准"浪潮(方法体系见 评测与基准)。评测与模型的博弈(榜单污染、数据泄漏)也因此成为公开议题,完整评测版图见 数据集与基准档案

2. 安全与争议史

事件时间争议焦点
GPT-2 分阶段发布2019"能力即危险" vs "不公开妨碍对齐研究"
GPT-3 偏见与幻觉报告2020大模型的社会偏见、错误事实
ChatGPT 越狱热潮2022–2023提示注入、DAN 类越狱、内容滥用
GPT-4 红队测试2023安全评测前置是否足够
训练数据版权诉讼2023 起大规模爬取与版权合规(以司法结果为准)

这一主题的系统展开见 安全与风险幻觉:成因与缓解

3. 对行业的范式带动

GPT 系列在多数时间点不是孤立的冠军,而是"行业能力标尺":每次换代都会带动评测基准、训练范式、产品形态与开源生态的连锁升级——2023 年的多模态、2024 年的 MoE 与推理模型、2025 年的 Agent 化,几乎都能在 GPT 的版本迭代中找到影子。完整坐标体系见 主流模型档案论文地图

看懂 GPT 系列只需记住一张图

预训练给"知识",SFT 给"格式",RLHF 给"意愿"——GPT 每一代升级都在这三者的配比上做文章,外加一个"规模旋钮"(参数与数据)和一个"模态旋钮"(输入输出范围)。

十、实践视角:怎么选、怎么用 GPT 类模型

讲完历史与机制,落到实践:今天要用 GPT 类模型,有哪几条路、各自的成本与坑。

1. 使用方式的决策表

方式做法成本适用
直接调用 API提示工程 + 流式输出按 token 付费快速验证、通用助手
RAG外部知识检索 + 生成加检索/存储成本知识库、私有数据
微调(LoRA)定制风格/格式/领域行为一次性训练行为类问题(见 微调:SFT 与参数高效微调
蒸馏用 GPT 答案训练小模型一次性高并发、低成本
开源替代换 Llama / Qwen / DeepSeek算力投入数据敏感、长期降本

2. 一次对话的 token 账本

一次问答的成本 ≈ (输入 token + 输出 token) × 单价
输入:系统提示 + 历史对话 + 用户消息 + 检索片段
输出:max_tokens 上限内实际生成的 token

控成本三招:①裁剪冗余历史(见 上下文与长文本);②简单任务走小模型(gpt-4o-mini 类);③设 max_tokens 与预算熔断。

3. 什么时候选开源、什么时候选 GPT

判断维度选 GPT 系选开源
能力上限最强推理/多模态略逊但够用
数据安全依赖供应商完全私有化
成本曲线按量付费一次投入
生态/工具官方 API 生态HF 社区生态
合规需审查数据出境需自查权重合规

4. 常见误区与反模式

误区正确姿势
把 GPT 当数据库查事实用 RAG/搜索 + 要求引用
用微调教新知识那是 RAG 的活
迷信最新代号按任务评测选型
只调温度调不好输出先改提示与示例
上下文无脑塞满裁剪、摘要、路由

没有"最好"的模型,只有"最合适"的

GPT 系列是能力标尺,不是万能答案。选择模型的正道是:定义任务 → 建评测集 → 多模型对比 → 按成本/安全/延迟加权。评测方法见 评估实战

十一、总览表与路线总结

1. 一代一张表的浓缩版

代号时间参数量关键数据关键创新一句话意义
GPT-12018.6约 1.17 亿BookCorpus(约 5GB)生成式预训练 + 微调确立 decoder-only 与两阶段范式
GPT-22019.215 亿WebText(约 40GB)零样本多任务、Byte-level BPE证明"语言模型即多任务学习器"
GPT-32020.51750 亿约 3000 亿 tokenfew-shot 上下文学习、规模即能力大模型概念确立、涌现能力出圈
InstructGPT2022.3(论文)13 亿(主打实验)13k 指令 + 33k 偏好对RLHF 三步(SFT→RM→PPO)对齐范式确立,小模型胜大模型
ChatGPT2022.11GPT-3.5 系列对话数据 + RLHF对话产品化 + 安全护栏LLM 从技术变为大众产品
GPT-42023.3未公开(传闻 MoE ~1.8T)未公开多模态输入、考试级能力能力跃迁 + 多模态 + 安全前置
GPT-4o2024.5未公开未公开原生多模态、实时语音交互范式从打字变为对话

2. 五个里程碑启示

  1. 架构不换、规模换能力(GPT-1 → GPT-3):同样的 decoder + next-token prediction,参数 ×1500 后涌现出翻译、代码、推理能力——规模法则是最确定的杠杆。
  2. 对齐是第二条杠杆(GPT-3 → InstructGPT):13B 对齐模型胜过 175B 未对齐模型,说明"意愿"和"能力"一样重要。
  3. 产品是第三条杠杆(InstructGPT → ChatGPT):技术先到位,产品化(对话界面 + 免费 + 护栏)才引爆大众市场。
  4. 模态扩展是第四步(GPT-4 → GPT-4o):从纯文本到"全模态原生",输入/输出的自由度持续放宽。
  5. 每一次升级都在放大同一个配方:解码器 + 规模 + 数据质量 + 对齐 + 模态,这五件套共同定义了 "GPT 路线"。

一句话记住 GPT 系列

GPT 路线 = decoder-only 架构 + 规模与数据 + RLHF 对齐 + 模态扩展;它每一步都只做好一件事,却通过"叠加"实现了范式级跃迁。

十二、常见问题速答

问题速答
GPT-1 有多少参数?约 1.17 亿,12 层解码器
GPT-2 为什么词表是 50257?Byte-level BPE 的固定词表,覆盖任意文本
GPT-3 训练数据多大?约 3000 亿 token(Common Crawl、Books、WebText2、维基)
ChatGPT 和 InstructGPT 的区别?同一套 RLHF 技术,ChatGPT 在对话场景做 SFT/偏好训练并产品化
GPT-4 为什么不说参数量?OpenAI 出于竞争与安全考虑不公开(以官方发布为准)
GPT-4o 的 o 是什么意思?Omni(全模态),一个模型处理文本/图像/音频/视频
o1 和 GPT-4o 怎么分工?o1 强化推理(慢思考),4o 强调实时多模态(快交互)
上下文窗口多大?GPT-4 起 8K/32K/128K,4o 128K,o 系列更长(以官方为准)
ChatGPT 免费吗?基础版免费,Plus/Team 付费解锁更强模型与功能
GPT 会取代 BERT 吗?生成场景取代,检索/分类/蒸馏仍大量用编码器
用 GPT 要做什么准备?提示工程 + 评测集 + 成本预算,再考虑 RAG/微调
会不会越用越笨?模型本身不变;产品层可用 RAG/反馈闭环改善体验

补记:OpenAI 的命名(GPT-3.5、GPT-4、GPT-4o、o1、GPT-5)并不完全按代数递增,同一代内部还有大量小版本(turbo、mini、omni 等),使用时应以官方 API 文档的模型代号与参数为准。这种命名风格也提醒我们:评估模型靠实测而非代号——同一代号在不同时间可能指向不同权重,历史记录与评测基线都要随版本更新。

遇到新的 GPT 版本怎么办

先看官方发布说明与系统卡(System Card),再做三件事:①跑自己的 golden set 对比上一版;②确认上下文/定价/速率变化;③评估安全与合规差异。版本迭代期,评测集是唯一可信的尺子。

十三、延伸阅读

参考资料