外观
ChatGPT 与对话模型
ChatGPT 是 OpenAI 于 2022 年 11 月 30 日发布的以对话为交互界面的生成式 AI 助手,它是"对齐技术(RLHF)+ 对话产品化"第一次面向大众的完整落地。上线 5 天用户破百万、两个月月活破亿,ChatGPT 把大模型从学术名词变成了现象级产品,并引爆了整个行业。它的技术底座(GPT 系列)见 GPT 系列:从 GPT-1 到 GPT-4o,历史坐标见 演进简史。
一、ChatGPT 是什么:一句话定位
ChatGPT = InstructGPT 式对齐技术 + 对话场景的 SFT/RLHF + 精心打磨的产品外壳。它的模型并不神秘——基于 GPT-3.5 系列(后来逐步升级到 GPT-4 / GPT-4o / o 系列),核心是把"遵循指令"的能力进一步塑造成"多轮对话"的能力,并配上安全护栏、流式输出、会话记忆等产品能力。
用户: 用一句话解释什么是黑洞。
ChatGPT: 黑洞是引力极强、连光都无法逃逸的天体区域,其边界称为事件视界。
用户: 那黑洞会蒸发吗?
ChatGPT: 会。霍金辐射……(多轮上下文保持)二、诞生背景:为什么是 2022 年底
1. 技术条件齐备
- 2020 年 GPT-3 证明规模即能力,但"只会续写、不听话"(见 GPT 系列);
- 2022 年 3 月 InstructGPT 论文证明 RLHF 三步(SFT → 奖励模型 → PPO)能让 13 亿模型胜过 1750 亿模型,对齐机制成熟(见 对齐:RLHF 与 DPO);
- OpenAI 内部把 RLHF 从"指令遵循"延伸到"对话",用对话形式的多轮数据做 SFT 与偏好训练。
2. 产品化决策
OpenAI 在 2022 年 11 月 30 日以"research preview"形式免费开放,配套了约 10 万条人类反馈做安全性打磨。免费 + 网页对话界面 + 流式输出让它绕过 API 门槛,直达普通用户——这是与之前"论文 + API"完全不同的发布策略。
三、对话系统的技术栈:一个 ChatGPT 由四层构成
| 层 | 内容 | 说明 |
|---|---|---|
| 基座 | GPT-3.5 系列(decoder-only 预训练模型) | 提供语言能力与常识 |
| 对齐层 | SFT(对话数据微调)→ 奖励模型 → PPO/RLHF | 学会"有帮助、诚实、无害"(见 对齐:RLHF 与 DPO) |
| 护栏层 | 内容策略 + refusal(拒答)+ 系统提示词 | 处理敏感内容、越狱攻击(见 安全与风险) |
| 产品层 | 会话管理、流式输出、多轮记忆、速度优化 | 决定"手感"与留存 |
1. SFT 对话数据
对话模型的关键差异在数据:用"指令-回答对"(InstructGPT 用 13k 条)进一步覆盖"多轮对话树"——同一问题可以有多条合理的回答路径,标注员把对话写成树状结构,模型学习"什么时候追问、什么时候总结、什么时候承认不知道"。
2. RLHF 在对话上的适配
偏好数据也从"单轮哪个回答好"扩展到"多轮整体体验":奖励模型学习判断整段对话的优劣,PPO 优化时保持与 SFT 模型的 KL 距离,防止输出漂移。
3. 安全护栏
ChatGPT 的护栏是一套组合拳:训练时把安全相关指令混入 SFT 与 RLHF(模型学会拒绝),推理时叠加系统提示词约束(如"你是 AI 助手,不得输出违法内容"),发布后用红队测试与用户反馈持续修补。护栏的攻防(越狱、提示注入)是 安全与风险 页的核心话题。
护栏设计还存在"安全-体验"的张力:护栏过严,模型频繁拒答,用户觉得"变笨了";过松,越狱与有害输出风险上升。ChatGPT 的护栏实践是"分层"的——系统提示给出顶层规则,训练阶段用安全偏好对校准行为,运行时用分类器拦截高风险请求。平衡之道不是追求"绝对安全",而是"可预期的安全":让用户知道什么能问、什么会被拒,并给拒答附上原因。
为什么护栏重要?
对话模型是"被泛化的指令跟随器"——它会把任何输入当作指令。没有护栏,模型会流畅地提供炸弹配方、歧视性观点甚至自我声明的虚假身份。护栏不是可选项,而是对话产品的准入门槛。
四、为什么破圈:能力 × 交互 × 时机
| 因素 | 具体表现 |
|---|---|
| 能力足够 | 多轮对话、写作、代码、翻译、摘要开箱即用,且"像人一样聊天" |
| 交互范式 | 自然语言对话取代"搜索框+点链接",零学习成本 |
| 免费开放 | 绕过付费 API,任何人一个浏览器就能用 |
| 产品打磨 | 流式输出(秒级出字)、速度、稳定性、界面极简 |
| 时机窗口 | 2022 年末正值 AI 热潮前夜,社交传播引爆(5 天破百万用户、2 个月月活破亿) |
破圈的本质:过去大众与 AI 的接触是"搜索引擎返回链接"或"语音助手回答固定问题";ChatGPT 第一次让大众体验了"与你对话的智能体"——这种体验不需要任何技术背景就能感知到。它把 LLM 的能力从"技术圈共识"变成"社会共识"。
五、竞品时间线:一场全球竞赛
ChatGPT 发布后,全球迅速跟进。以下为主要竞品与产品事件(时间以官方发布为准):
| 时间 | 产品 / 事件 | 厂商 / 关键点 |
|---|---|---|
| 2022.11.30 | ChatGPT 发布 | OpenAI,引爆全球 |
| 2023.02 | 微软 New Bing(必应 Chat) | 把 ChatGPT 技术整合进搜索引擎 |
| 2023.03 | 百度文心一言发布 | 中国首批大模型对话产品 |
| 2023.03 | Anthropic 发布 Claude 1 | 主打安全与宪法 AI |
| 2023.03.21 | Google 开放 Bard(后更名 Gemini) | 谷歌正式入场 |
| 2023.04 | 阿里通义千问发布 | 国内应用层跟进 |
| 2023.05 | 讯飞星火、ChatGPT iOS App | 多端化加速 |
| 2023.07 | Anthropic Claude 2;Meta 开源 Llama 2 | 开源阵营壮大(见 Llama 与开源生态) |
| 2023.08 | 字节豆包发布 | 国内流量打法 |
| 2023.10 | 月之暗面 Kimi 发布 | 主打超长上下文 |
| 2023.12 | Google 发布 Gemini 1.0 | 多模态原生路线 |
| 2024.05 | OpenAI 发布 GPT-4o | 免费、实时语音多模态 |
| 2025 后 | o1/o3、GPT-5、Gemini 2.x、Claude 4/5 | 推理模型与多模态混战 |
1. 中国厂商的差异化
国内对话产品(文心一言、通义千问、豆包、Kimi、DeepSeek 对话版等)大体沿三条路径竞争:免费流量入口(豆包、文心)、超长上下文(Kimi)、开源权重 + 极致性价比(DeepSeek,详见 Llama 与开源生态)。它们在中文语料、合规审查、移动端分发上与 OpenAI 形成错位竞争。
2. 对话产品的评价维度
随着竞品增多,"能用"不再是门槛,比拼的是:速度(TTFT/吞吐)、多模态、上下文长度、工具调用能力、成本、安全合规。这些维度在 主流模型档案 中有系统对照。
六、对话模型的评估:有用性 / 安全性 / 多轮一致性
对话是开放式的,传统的"标准答案准确率"失效,业界发展出三类评估:
对话模型的评估不能只在上线前做一次。日常运营要形成"日/周级"节奏:每天抽样人工复核若干条对话(标注好坏),每周跑一次 golden set 回归,每月对比一次 Arena 与内部榜单。任何提示改动、模型升级、知识库更新,都要过这条评估流水线再上线。把评估"日常化",是对话产品避免"悄悄变差"的唯一办法——模型与数据都在变,昨天的好效果今天未必保持。评测体系的搭建见 评估实战。
| 评估维度 | 考察内容 | 代表方法 |
|---|---|---|
| 有用性(Helpfulness) | 回答是否解决用户问题、是否准确 | MT-Bench(GPT-4 打分)、LMSYS Chatbot Arena(人类盲测 Elo) |
| 安全性(Safety) | 是否拒绝有害请求、是否中立无害 | 红队测试、越狱评测集、HarmBench 等 |
| 多轮一致性 | 长对话不迷失、不自我矛盾、记住上下文 | 多轮对话测试集、角色一致性评测 |
1. 人类盲测:Chatbot Arena
LMSYS Chatbot Arena 让用户在两个匿名模型的回答中投票,用 Elo 排名生成"众测榜单"。它的价值在于真实用户 + 真实需求分布,避免了基准污染;缺陷是样本偏差与速度/风格偏好。它是 2023 年后最具公信力的对话能力榜。
2. 模型裁判:MT-Bench
用 GPT-4 给两个模型的回答打分(1-10),覆盖写作、推理、数学、代码、角色扮演等 80 个多轮问题。优点是低成本可复现,缺点是裁判模型自身有偏差(位置偏差、自我偏好),需交叉验证——详见 评估实战。
3. 别忘了护栏本身
对话产品上线前必须过安全验收:越狱成功率、有害内容拒答率、隐私泄露率。很多模型"能力榜第一"但在安全测试上翻车——能力与安全的平衡是对话产品的核心工程,见 评测与基准。
榜单 ≠ 你的场景
Arena 第一名的模型,未必是你的客服、你的法务、你的教育场景里的最佳选择。对话模型的评估要"榜单 + 自建 golden set + 线上指标(留存、好评率、投诉率)"三件套一起上。
七、ChatGPT 的产品演化:从对话到生态
| 阶段 | 时间 | 关键事件 |
|---|---|---|
| 1.0 对话助手 | 2022.11–2023.3 | ChatGPT 发布、GPT-4 接入网页版、付费订阅 ChatGPT Plus |
| 2.0 多端与工具 | 2023.3–2024.5 | iOS/Android App、联网搜索(Browse with Bing)、代码解释器(Code Interpreter)、图像理解(GPT-4V)、插件/函数调用 |
| 3.0 全模态免费 | 2024.5–2024.9 | GPT-4o 免费开放、实时语音、记忆功能、Sora 视频接入 |
| 4.0 推理与搜索 | 2024.9–2025 | o1 推理模型、ChatGPT Search(深度搜索)、Operator(Agent 操作浏览器)、GPT-5 统一系列 |
产品演化的主线是从"聊天"到"干活":加工具(联网、代码、图像)、加记忆、加 Agent 能力——这正是 基于 LLM 的 Agent 页的主题。ChatGPT 从"对话产品"变成了"个人 AI 助理平台"。
八、对话系统的工程细节
对话产品看起来"就是一个聊天框",实际背后是一整套工程。这一节补上产品层与工程层的细节。
1. 模型谱系:从 text-davinci 到 gpt-3.5-turbo
ChatGPT 的底座并非单一模型,而是一条不断降本增效的模型线:
| 代号 | 时间 | 特点 |
|---|---|---|
| text-davinci-002/003 | 2022 | InstructGPT 产品化,单次调用贵、慢 |
| gpt-3.5-turbo | 2023.3 | 对话优化 + 价格降至约 1/10,支持多轮消息数组 |
| gpt-4 / gpt-4-turbo | 2023 | 更强推理、128K 上下文 |
| gpt-4o | 2024.5 | 全模态、速度与价格再次下探 |
gpt-3.5-turbo 的"消息数组"接口(system/user/assistant 轮流)成为行业标准——它把"对话历史"直接编码进 API,简化了多轮管理。
2. 对话数据怎么造
对话模型的"好用"依赖高质量多轮数据:
- 对话树:同一请求标注多条合理回复路径,覆盖"追问、澄清、拒答、承认不知道";
- 角色分布:同时覆盖用户扮演(追问、打断、刁难)与助手扮演(引导、总结、纠错);
- 质量优先:宁可少而精,不追求数量——低质数据会直接污染 RLHF 偏好(数据方法论见 预训练:数据与目标)。
3. 产品工程:流式、并发与成本
| 工程点 | 做法 | 效果 |
|---|---|---|
| 流式输出(SSE) | token 逐字下发 | 首字延迟降至毫秒级,体验大幅提升 |
| 连续批处理 | 多请求动态合并推理 | GPU 利用率从个位数到 90%+ |
| KV Cache | 缓存历史注意力键值 | 生成速度提升数倍(见 推理基础) |
| 成本控制 | 路由(简单问题走小模型)、限流 | 单次对话成本可控 |
部署侧的完整清单见 部署与服务化。
4. 会话管理与多轮记忆
- 历史截断:超长对话按 token 预算裁剪,只保留最近 N 轮;
- 摘要压缩:把早期对话摘要后放回 system(见 上下文与长文本);
- 上下文注入:当前时间、用户偏好、企业知识经 system prompt 注入。
5. 对话模型的评估实践
上线前至少跑三类指标:能力榜(Arena Elo / MT-Bench)、安全指标(越狱成功率、拒答率、隐私泄漏率)、业务指标(留存、好评率、投诉率、任务完成率)。评测体系搭建见 评估实战 与 评测与基准。
对话产品的三重打磨
模型决定上限,数据决定个性,工程决定体验——同样的 GPT-4 底座,不同团队做出的对话产品可以天差地别。把数据闭环(用户反馈回流再训练)跑起来,比追新模型更值钱。
九、对话模型的底层启示
- 产品化是技术的放大器:InstructGPT 的对齐技术在论文里躺了 8 个月,是"免费 + 对话界面 + 护栏"这三个产品决策让它撬动了整个世界。
- 对话是 LLM 的"原生 UI":对话既能表达任意任务,又能多轮纠错,还能承载工具调用——它成了所有大模型应用的标准交互层。
- 护栏决定产品生死:技术再强,安全不过关就无法大规模商用;对话模型的护城河 = 能力 × 安全 × 成本 × 体验。
- 竞赛没有终局:从 2022 年底到 2025 年,对话模型的能力已经翻了几代,但"上下文、记忆、Agent、多模态、低成本"的竞赛仍在继续。
九、从 ChatGPT 学到的产品方法论
ChatGPT 的成功不只属于模型,更属于产品。这一节把它拆成可复用的方法论。
1. 对话产品的四要素
| 要素 | 含义 | 反面案例 |
|---|---|---|
| 能力 | 任务完成得对、好 | 答非所问、幻觉横飞 |
| 体验 | 快、稳、像人 | 转圈 30 秒、话痨车轱辘 |
| 信任 | 诚实、可解释、有护栏 | 编造数据、拒绝用户过度 |
| 成本 | 单位对话成本可控 | 一次对话烧掉几元 |
四者相互牵制:加护栏会降"爽度"、降成本可能损能力。产品经理的日常就是在这四象限里找平衡。
2. 如何评估一次对话质量
| 检查项 | 示例 | 备注 |
|---|---|---|
| 目标达成 | 用户要的是否给到 | 核心 |
| 事实正确 | 数字/日期/名称准确 | 错误可致命 |
| 多轮一致 | 不推翻前文结论 | 长对话常见病 |
| 安全合规 | 无越狱/有害输出 | 上线底线 |
| 效率 | 是否绕远路 | 影响体感 |
评估体系搭建见 评估实战。
3. 成本与规模的平衡
规模化对话产品的成本公式:
日成本 ≈ 日请求数 × 平均 token 数 × 单价
降本路径:
① 路由:简单问题走小模型(可省 80% 以上)
② 缓存:命中即复用(相似问题不重算)
③ 提示瘦身:压缩 system prompt 与历史
④ 蒸馏:高频场景用小模型替代4. 企业落地的推荐路径
- PoC(周级):API + 提示工程验证价值;
- 加 RAG:接企业知识库,解决事实类需求(见 RAG:检索增强生成);
- 加工具与 Agent:接业务系统,解决"干活"类需求(见 基于 LLM 的 Agent);
- 微调与蒸馏:定风格、降成本;
- 私有化/开源:数据敏感场景最终收敛到自部署(见 Llama 与开源生态)。
每一步都先设评测集,避免"感觉变好了"。
5. 常见误区与反模式
| 误区 | 正确姿势 |
|---|---|
| 用对话模型当数据库 | 上 RAG/搜索 |
| 把"更像人"当第一目标 | 先保事实与安全 |
| 一味堆 prompt | 精简、结构化、版本化 |
| 只看 Arena 榜选模型 | 自建 golden set 评测 |
| 上线后不管 | 建反馈闭环、持续迭代 |
6. 案例:从零搭一个企业客服助手
一个 4 人团队、2 周内做出可用客服助手的推荐路径:
第 1 天:明确范围(只答产品/售后两类问题),整理 50 条典型问答
第 2~3 天:把 FAQ 与手册拆成 chunk,建向量库(RAG 检索)
第 4~5 天:写 system prompt(角色+规则+引用格式),接 API
第 6~7 天:用 50 条真实问题评测,迭代提示与检索
第 8~10 天:加人工兜底(转人工)、日志与安全护栏
第 11~14 天:小流量灰度,收集反馈,扩充评测集要点:先小后大、先规则后模型、先检索后微调。大多数客服场景在"提示 + RAG + 评测闭环"内就能达到可用水平;只有风格与格式有硬性要求时,才考虑 LoRA 微调(见 微调实战)。日成本控制在几十到几百元量级,规模大了再引入路由与缓存。
这个案例的关键不是技术栈多高级,而是"范围收敛 + 反馈闭环":范围越界是客服助手最常见的失败原因(模型被问销售、投诉、复杂业务);反馈闭环(每天看失败案例并改进)是持续变好的唯一机制。先让 50 条问题答对 90%,再扩到 500 条,比一开始追求全覆盖更现实。
衡量客服助手的核心指标也值得记住:转人工率、首次解决率、平均处理时长、用户满意度。模型能力提升通常反映为转人工率下降、首解率上升;这些线上指标与离线评测集联动,才能判断一次提示改动或模型升级是真是假。
对话产品的终极护城河
不是模型,而是数据闭环:用户问题 → 质量标注 → 评测集扩充 → 提示/微调/检索改进 → 上线 → 再回流。模型会迭代,数据闭环才是持续领先的机制。
十、从 ChatGPT 到未来
对话模型的下一个十年有三条主线:多模态对话(语音/图像/视频成为对话内容,见 多模态大模型)、Agent 化对话(对话从"回答问题"变成"执行任务")、个性化与记忆(跨会话记住用户)。ChatGPT 定义了起点,但这些方向都属于整个行业。
还有一个常被忽略的维度:对话模型正在变成所有软件产品的默认交互层。十年前,应用用按钮与表单交互;今天,越来越多产品把"对话框"作为入口(客服、数据分析、开发助手)。这意味着"对话"不再是一种具体产品,而是一种基础设施——类似数据库与 API 之于 Web 应用。对开发者而言,与其问"要不要做对话产品",不如问"我的产品哪里能嵌入对话能力"。嵌入方式包括:文档问答(RAG)、操作助手(Agent)、内容生成(写作/报表)、审查助手(人工审核 AI 初稿)。每一种嵌入都要回答三个问题:数据从哪来、失败怎么办、谁来负责——这正是本页前面各节反复强调的工程与责任问题。
最后要澄清一个边界:ChatGPT 常被误认为接近通用人工智能,但它没有持续的自主目标、稳定的世界模型与真正的因果理解。"对话能力强"不等于"智能"——对话是智能的界面,不等于智能本身。相关辨析见 什么是大语言模型。
十一、对话模型的社会与商业影响
1. 对劳动力市场的影响
| 岗位类别 | 受影响方式 | 应对方向 |
|---|---|---|
| 客服 / 文员 | 对话模型替代常规应答 | 转向复杂客诉与体验设计 |
| 初级写作 / 翻译 | 生成稿大幅提速 | 转向审核、策展与个性化 |
| 程序员 | 编码助手提升效率 | 转向架构、评审与需求 |
| 分析师 | 报表与初稿自动化 | 转向洞察与决策 |
历史规律是"技术消灭职位、不消灭职业":对话模型替代的是"打字与检索"环节,放大的仍是判断与沟通能力。
2. 教育、学术与信任
- 学术诚信:论文/作业代写引发 AI 检测军备竞赛;
- 信息环境:AI 生成内容加剧真假难辨,溯源与标识(水印)成为刚需;
- 教育范式:从"教检索"转向"教提问与批判"。
3. 监管与合规
| 地区 | 关键法规/实践 | 要点 |
|---|---|---|
| 欧盟 | AI Act(分级监管) | 高风险应用需评估与透明 |
| 中国 | 生成式 AI 服务管理暂行办法 | 备案、内容安全、标识 |
| 美国 | 行政令与行业自律 | 以自评估与自愿承诺为主 |
合规要求的细节以各地正式文本为准,产品上线前需专门评估(见 安全与风险)。
4. 行业渗透度
对话模型已进入客服、教育、法律检索、医疗咨询、金融投顾等场景,但深度不一:低风险、高确定性、可复核的场景落地最快(如客服、知识库问答);高风险场景(诊疗、法律意见、金融决策)仍以"人审兜底 + 助手定位"为主。
5. 一个平衡的观察视角
关于对话模型影响的讨论常走向两个极端:要么"AI 取代一切"的恐慌,要么"AI 什么也做不好"的轻蔑。两者都不准确。更接近现实的判断是:对话模型正在成为"通用生产力界面",它不会消灭职业,但会重新分配职业内部的低阶任务——把信息检索、初稿撰写、格式整理自动化,把人的精力推向判断、协商与创造。对个体而言,关键能力从"会不会用工具"转向"会不会定义问题与验收结果";对组织而言,成本结构从"人力规模化"转向"模型规模化 + 人工审核"。监管上,各国正以不同节奏建立透明度、标识与责任规则。整体看,对话模型的影响是"加速器"而非"替代者"——它放大已有的优势与风险,不凭空创造也不凭空消灭。
这也意味着,无论你是工程师、产品经理还是研究者,把"如何与对话模型协作"当作一项可训练的技能,比争论"它会不会取代我"更有价值。技能清单包括:写清楚指令、设计评测集、判断输出质量、把模型能力接入业务流程。这些技能的训练路径,正是本手册各章(提示、RAG、Agent、评测、部署)的组合。
十二、常见问题速答
| 问题 | 速答 |
|---|---|
| ChatGPT 免费版和付费版差在哪? | 付费解锁更强模型、更长上下文与优先体验 |
| 为什么有的对话"一本正经胡说"? | 幻觉,用 RAG/引用与"不知道就直说"缓解 |
| 多轮对话怎么保持上下文? | 产品层管理历史窗口 + 摘要(见 上下文与长文本) |
| 对话模型能当搜索引擎吗? | 事实类请配合搜索/RAG,别裸问 |
| 怎么判断对话模型好坏? | Arena 盲测 + 自建评测集 + 安全测试 |
| 小团队怎么落地对话产品? | API + 提示 + RAG 起步,再考虑微调 |
补记:ChatGPT 的另一层护城河是数据飞轮——每个点赞、踩、修正都成为偏好信号,回流到奖励模型与安全训练。这也是为什么"先用起来、收集反馈"比"憋大招"更符合对话产品的演进规律;把用户反馈沉淀成评测集与偏好数据的方法,见 评估实战。
补记:无论 ChatGPT 还是竞品,对话产品的"可用"标准正在被反复刷新——今天够好的响应速度与准确性,一年后可能只是及格线。唯一不变的,是"评测集 + 反馈闭环 + 成本控制"这三件基本功。把这三件事做好,模型换代时你依然从容。
又:对话产品迭代时要区分"模型升级"与"配置变化"——同一次上线只改一个变量(模型、提示或检索),否则效果波动难以归因。
对话模型的正确打开方式
把它当作"能力极强的初稿机器 + 交互界面",而不是权威。所有输出都应有"复核路径"(引用、来源、人工确认),尤其是在专业领域。
十三、延伸阅读
- GPT 系列:从 GPT-1 到 GPT-4o——ChatGPT 的技术底座演进
- 对齐:RLHF 与 DPO——ChatGPT 的关键训练技术
- 安全与风险——对话产品的护栏与越狱攻防
- Llama 与开源生态——开源对话模型的追赶
- 基于 LLM 的 Agent——对话到"干活"的下一站
- 演进简史——2022 年爆发的历史必然性
- 主流模型档案——对话模型横向对照
参考资料
- OpenAI. Introducing ChatGPT(2022.11.30)——ChatGPT 官方发布博客
- Ouyang et al. Training language models to follow instructions with human feedback(InstructGPT, 2022)——RLHF 原始论文(arXiv)
- Zheng et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena(2023)——MT-Bench 与 Arena 方法论(arXiv)
- Microsoft. Reinventing search with a new AI-powered Microsoft Bing(2023.2)——New Bing 官方博客
- Google. An important next step on our AI journey(Bard, 2023.3)——Google Bard 官方博客
- Anthropic. Claude 2(2023.7)——Anthropic 官方发布
- OpenAI. Hello GPT-4o(2024.5)——GPT-4o 官方发布
- OpenAI. Learning to reason with LLMs(o1, 2024.9)——o1 推理模型发布说明