外观
主流模型档案
本页是主流大语言模型的速查档案:家族、发布时间、参数量、上下文、开源情况与亮点,附分类维度、许可速查与"怎么选模型"决策表。模型规格与版本迭代极快,本页数据截至 2025 年 8 月,一切以官方发布为准;闭源模型参数多未公开,标注"未公开"。
模型档案会过时
GPT-4o 曾领先,如今已有 o 系列与 GPT-5;Llama 从 2 代到 4 代只用了两年。本页只能当"入门地图",采购或选型前务必查官方最新文档(见文末参考资料)。评测分数请参考评测与基准的批判性视角,不要只盯榜单。
一、模型总表
按家族列出代表版本。标注"开源"表示开放权重(注意各家许可不同);参数量为官方公布或行业共识值,未公开处如实标注。
| 家族 | 代表版本 | 发布时间 | 参数量 | 上下文 | 开源 | 亮点 |
|---|---|---|---|---|---|---|
| GPT(OpenAI) | GPT-3 | 2020-05 | 175B | 2k | 否 | 首次证明大规模少样本能力 |
| GPT-4 | 2023-03 | 未公开(传闻 MoE) | 8k/32k | 否 | 考试级能力、多模态 | |
| GPT-4o | 2024-05 | 未公开 | 128k | 否 | 原生多模态、低延迟实时交互 | |
| o1 | 2024-09 | 未公开 | 200k | 否 | 推理时扩展(test-time scaling) | |
| GPT-5 | 2025-08 | 未公开 | 约 400k | 否 | 推理与工具使用原生融合 | |
| Claude(Anthropic) | Claude 3 系列 | 2024-03 | 未公开 | 200k | 否 | 长文本与安全策略出色 |
| Claude 3.7 Sonnet | 2025-02 | 未公开 | 200k | 否 | 混合推理(可控制思考预算) | |
| Claude 4 | 2025-05 | 未公开 | 200k | 否 | 编码与 Agent 场景强化 | |
| Gemini(Google) | Gemini 1.5 Pro | 2024-05 | 未公开 | 100 万 | 否 | 百万 token 级原生长上下文 |
| Gemini 2.5 Pro | 2025-03 | 未公开 | 100 万 | 否 | 推理 + 多模态 + 超长上下文 | |
| Llama(Meta) | Llama 2 | 2023-07 | 7B/13B/70B | 4k | 开源 | 首个大规模可商用开源模型 |
| Llama 3.1 | 2024-07 | 8B/70B/405B | 128k | 开源 | 405B 开源旗舰 + 128k 上下文 | |
| Llama 4 Scout | 2025-04 | 109B 总 / 17B 激活(MoE) | 约 1000 万 | 开源 | 开源 MoE、超长上下文 | |
| Qwen(阿里) | Qwen2.5 | 2024-09 | 0.5B~72B | 128k | 开源 | 全尺寸覆盖,中文+代码强 |
| Qwen3 | 2025-04 | 0.6B~32B(dense)+ MoE 版 | 约 256k | 开源 | 混合推理(可开关思考模式) | |
| DeepSeek | DeepSeek-V3 | 2024-12 | 671B 总 / 37B 激活(MoE) | 128k | 开源(MIT) | 开源 MoE 性价比标杆 |
| DeepSeek-R1 | 2025-01 | 671B + 蒸馏小模型 | 128k | 开源(MIT) | 首个追平闭源的开源推理模型 | |
| Mistral / Mixtral | Mistral 7B | 2023-09 | 7B | 32k | 开源(Apache 2.0) | 小模型高效率的代表 |
| Mixtral 8x7B | 2023-12 | 46.7B 总 / 12.9B 激活(MoE) | 32k | 开源(Apache 2.0) | 首个出圈的开源 MoE | |
| Mistral Large | 2024-02 | 约 123B | 32k | 否 | 欧洲闭源旗舰 | |
| Gemma(Google) | Gemma 3 | 2025-03 | 1B/4B/12B/27B | 约 128k | 开源 | 轻量级多模态,边缘友好 |
| GLM(智谱) | GLM-4-9B | 2024-06 | 9B | 128k | 开源 | 中文对话与工具调用 |
| GLM-4.5 | 2025-02 | 未公开 | 约 128k | 否 | 中文综合能力旗舰 | |
| Phi(微软) | Phi-4 | 2024-12 | 14B | 约 16k | 开源(MIT) | "教科书级数据"小模型 |
| Command R(Cohere) | Command R+ | 2024-04 | 104B | 128k | 开源(CC-BY-NC 非商用) | RAG 场景专门优化 |
| Grok(xAI) | Grok-1 | 2024-03 | 314B(MoE) | 8k | 开源 | 当时最大的开源权重 |
| Kimi(月之暗面) | Kimi K2 | 2025-07 | 173B(MoE) | 约 256k | 开源(Apache 2.0) | 超长上下文 + Agent 场景 |
| 文心(百度) | ERNIE 4.5 | 2025-06 | 未公开 | 约 128k | 否 | 中文生态与多模态 |
读表须知
- "参数量"与"上下文"是变化最快的两列:Llama 3.1 发布后社区普遍用它做基准,Qwen3/DeepSeek 又刷新开源性价比。2. 开源许可差异很大:MIT(Phi、DeepSeek、Mistral、Qwen3 部分)最宽松,Llama 社区许可与 Gemma 条款有附加条件,Command R 仅限非商用。3. 未公开参数的闭源模型,能力只能靠评测与实测判断。
二、按维度分类
| 维度 | 类别 | 代表模型 | 说明 |
|---|---|---|---|
| 开源 vs 闭源 | 闭源 API | GPT-4o / GPT-5、Claude 4、Gemini 2.5 Pro、GLM-4.5 | 能力领先、零运维,但受控、按量计费、数据出境需评估 |
| 开源权重 | Llama 3.1、Qwen3、DeepSeek-V3/R1、Mistral、Gemma、Phi、Kimi K2 | 可控、可私有化,能力紧随其后(2024 后差距快速缩小) | |
| 架构 | dense(稠密) | Llama 3.1、Qwen2.5、Gemma、Phi | 全参参与计算,小到中规模主流 |
| MoE(稀疏) | Mixtral、DeepSeek-V3、Llama 4、Qwen3-MoE、Kimi K2 | 总参数大但每次只激活一部分,性价比高 | |
| 模态 | 文本 | Llama 3.1、DeepSeek-R1、Phi-4 | 纯文本推理 |
| 多模态 | GPT-4o、Gemini、Qwen2.5-VL、GLM-4V、Gemma 3 | 图/音/视频 + 文本联合理解 | |
| 推理模式 | 通用即时 | GPT-4o、Claude、Qwen3(可关思考) | 低延迟,日常任务 |
| 推理强化 | o1/o3、DeepSeek-R1、Claude 3.7/4、Gemini 2.5 Pro | 长思考链,数学/代码/复杂推理更强但更慢更贵 |
三、家族速览
每个家族的一段话档案,帮助建立"谁是谁、强在哪"的全局观。
OpenAI GPT 系列:2018 年 GPT-1 提出"生成式预训练 + 微调"范式,GPT-3(2020)把规模推到 175B 并证明少样本能力,InstructGPT/ChatGPT(2022)引入 RLHF 对齐,GPT-4(2023)实现多模态与考试级能力,o 系列(2024)开创推理时扩展,GPT-5(2025)把推理与工具使用原生融合。始终是行业技术风向标。详见GPT 系列。
Anthropic Claude:由前 OpenAI 对齐研究团队创立,以"宪法 AI"与安全对齐著称;Claude 3 之后在长文本、编码、Agent 场景长期位居第一梯队,Claude 3.7 的混合推理(可调思考预算)与 Claude Code 工具深受工程师欢迎。
Google Gemini:DeepMind 与 Google Brain 合并后的原生多模态旗舰;Gemini 1.5 率先把上下文窗口推到百万 token,2.5 Pro 在推理与多模态理解上追平第一梯队。同源开源的 Gemma 面向轻量部署。
Meta Llama:开源生态的事实标准。Llama 2(2023)率先大规模可商用,Llama 3.1(2024)发布 405B 开源 dense 旗舰与 128k 上下文,Llama 4 转向 MoE 与千万级上下文;社区围绕它形成了微调、量化、部署的完整生态。详见Llama 与开源生态。
阿里 Qwen:全尺寸(0.5B~72B)开源覆盖最全的中文模型家族;Qwen2.5 是开源微调与部署的最热门基座之一,Qwen3 加入混合推理(可开关思考模式),配套 Qwen2.5-Coder / Qwen2.5-VL 覆盖代码与多模态。
DeepSeek:以"极致的工程性价比"闻名:V2 验证 MoE + MLA 架构,V3(671B 总/37B 激活)以远低于同级闭源的训练成本达到第一梯队,R1 首次让开源推理模型追平闭源;训练细节公开最完整,MIT 许可最宽松。
Mistral / Mixtral:欧洲开源代表,Apache 2.0 许可最为宽松;Mistral 7B 以高效著称,Mixtral 8x7B 是首个出圈的开源 MoE,Mistral Large 是闭源旗舰,在欧洲数据合规(GDPR)场景有优势。详见MoE 与超大规模模型。
Google Gemma:基于 Gemini 技术的轻量开放模型,1B~27B 覆盖边缘到中端,Gemma 3 支持多模态与长上下文,适合消费级硬件与移动端。
智谱 GLM:国内最早开源的中文对话模型之一(ChatGLM-6B),GLM-4 系列在中文对话、工具调用与 Agent 场景成熟,GLM-4.5 为中文综合旗舰。
微软 Phi:以小博大——用"教科书级"高质量数据训练 1B~14B 小模型,Phi-4 在代码与数学上媲美大它数倍的模型,MIT 许可,适合资源受限环境。
Cohere Command R:面向企业 RAG 场景优化(检索引用、多语言、工具调用),Command R+ 104B 是少数专门做"检索增强"的模型,但许可为非商用。
xAI Grok:主打实时数据(X 平台)与产品生态,Grok-1 曾以 314B MoE 成为最大开源权重,Grok-2/3 转向闭源并进入推理第一梯队。
月之暗面 Kimi:以超长上下文起家(最早把 200k 上下文商用化),Kimi K2(2025.7)开源 173B MoE 并面向 Agent 场景。
百度文心 ERNIE:文心一言背后的旗舰,中文生态完整(搜索、云、智能体),ERNIE 4.5 主打多模态与中文理解,闭源 API。
四、生态与许可速查
选型前的"许可体检表"——开放权重 ≠ 可以随便商用:
| 模型 | 许可类型 | 可商用 | 关键备注 |
|---|---|---|---|
| GPT / Claude / Gemini / GLM-4.5 / ERNIE | 闭源 API | 按量付费 | 受服务条款约束,数据出境需评估 |
| Llama 系列 | Llama 社区许可 | 可(月活超 7 亿需另行申请) | 禁止用其输出训练竞争模型等条款 |
| Qwen2.5 / Qwen3 部分 | Apache 2.0 | 可 | 部分衍生版本可能有附加说明 |
| DeepSeek-V3 / R1 | MIT | 可 | 最宽松的一档 |
| Mistral / Mixtral | Apache 2.0 | 可 | 最宽松的一档 |
| Gemma 系列 | Gemma 许可 | 可(有条件) | 禁止若干受限用途,需读条款 |
| GLM-4-9B 等开源部分 | Apache 2.0 | 可 | 闭源旗舰不在此列 |
| Phi 系列 | MIT | 可 | 最宽松的一档 |
| Command R+ | CC-BY-NC | 否(仅非商用) | 商用需联系 Cohere |
| Grok-1 | Apache 2.0 | 可 | Grok-2/3 闭源 |
| Kimi K2 | Apache 2.0 | 可 | 需确认最新条款 |
五、怎么选模型
没有"最好的模型",只有"适合场景的模型"。选型四步:定场景 → 定约束(预算/部署/数据合规)→ 短名单 → 实测。下表给出常见场景的推荐起点。
| 场景 | 推荐 | 理由 |
|---|---|---|
| 通用对话 / 写作(无部署顾虑) | GPT-4o / Claude 4 / Gemini 2.5 Flash | 综合能力强、生态工具成熟 |
| 代码生成与审查 | Claude 4 / GPT-5(闭源);Qwen2.5-Coder(开源) | 代码评测长期领先 |
| 数学与复杂推理 | o1 / Gemini 2.5 Pro(闭源);DeepSeek-R1(开源) | 推理时扩展擅长多步推导 |
| 超长文档(10 万+ token) | Gemini 2.5 Pro / GPT-5(闭源);Kimi K2 / Llama 3.1 405B(开源) | 原生长上下文窗口 |
| 中文业务落地 | Qwen3 / GLM-4.5 / DeepSeek | 中文语料占比高、中文生态完善 |
| 私有数据 + RAG | Command R+ / Qwen3 / Llama 3.1 | 检索友好或开源可控可私有化 |
| 本地部署(消费级显卡 8~16GB) | Qwen3-8B / Gemma 3 12B / Phi-4 | 量化后显存可承受,详见部署与服务化 |
| 开源微调基座 | Llama 3.1 8B / Qwen2.5-7B(中小);DeepSeek-V3(大) | 社区生态、工具链与许可最成熟 |
| 成本敏感的高并发推理 | DeepSeek-V3(MoE)/ 小模型量化版 | 激活参数少、单 token 成本低 |
| 边缘 / 端侧设备 | Llama 3.2 1B/3B / Qwen3-0.6B / Gemma 3 1B | 毫秒级延迟、低显存 |
1. 三个选型案例
案例 A:中型企业"内部知识库问答"(中文文档、需私有部署、预算有限) → 选 Qwen3-32B(或 Qwen2.5-14B)+ vLLM + 自建 RAG。理由:开源可私有化,中文理解强,14B/32B 量化后显存可行(2~4 张卡),社区中文资料与工具链最全。闭源 API 走不通的"数据不出内网"约束,开源权重是唯一解。
案例 B:代码助手产品(高并发、低延迟、允许走 API) → 选 Claude 4 或 GPT-5 API + prompt 缓存。理由:代码能力第一梯队,API 免去 GPU 运维;把"延迟敏感"的小请求路由到小模型(如 GPT-4o mini 或开源 8B),大模型只处理复杂任务——模型分级路由是省成本的核心手段。
案例 C:科研团队的数学/推理评测 → 选 DeepSeek-R1(开源,可复现、可私有化跑评测)或 o3 API。理由:推理基准表现顶级;开源版本方便记录完整实验环境,符合学术可复现要求。
选型铁律
三个常见误区
- 参数越大越好:上下文长度、任务类型、延迟预算都会改变最优解,7B 模型配 RAG 常常胜过 405B 硬扛。
- 开源=免费:GPU、带宽、运维人力都是成本,开源只是"成本结构"不同。
- 看多模态就选全模态:如果只用文本,为多模态能力付钱是浪费;选"够用"而非"最全"。
六、如何获取与运行
| 路线 | 适用 | 做法 |
|---|---|---|
| 闭源 API | 无部署条件、追求能力上限、快速上线 | 各官方平台注册拿 Key(OpenAI/Anthropic/Google/智谱/月之暗面等),或用 OpenRouter 等聚合平台统一接入 |
| 开源权重 | 私有化、微调、成本优化 | Hugging Face Hub 下载 → vLLM(服务化)/ llama.cpp(CPU 边缘)/ Ollama(本地体验) |
| 混合 | 分级路由 | 简单任务走小模型/开源,复杂任务走闭源 API |
完整的显存估算、量化、并发指标与部署步骤见部署与服务化,工具选型见框架与工具选型。
七、保持更新
模型市场的节奏以"月"为单位:本页档案在你读到的时候可能已经落后。建议固定几个信息源每周扫一遍:
- 官方渠道:OpenAI / Anthropic / Google / Meta 的官方博客与模型文档(见参考资料);
- 社区榜单:LMArena 与 Hugging Face 趋势榜,看新模型实测口碑;
- 论文:arXiv 与前沿进展,看技术路线的下一步;
- 工具链:vLLM / llama.cpp 的 release notes,新模型支持通常最先出现在这里。
延伸阅读
- GPT 系列:从 GPT-1 到 GPT-4o —— GPT 家族完整演进
- Llama 与开源生态 —— 开源模型的竞赛史
- MoE 与超大规模模型 —— Mixtral、DeepSeek-V3 等 MoE 档案
- ChatGPT 与对话模型 —— Claude/Gemini/文心/通义等时间线
- 上下文与长文本 —— 各模型上下文窗口背后的技术
- 框架与工具选型 —— 定了模型后怎么搭工具链
- 部署与服务化 —— 显存估算、量化与推理优化
参考资料
- OpenAI 模型文档: https://platform.openai.com/docs/models
- Anthropic 模型文档: https://docs.anthropic.com/en/docs/about-claude/models/overview
- Google DeepMind Gemini: https://deepmind.google/models/gemini/
- Meta Llama 官方: https://www.llama.com/
- Qwen(阿里)GitHub: https://github.com/QwenLM/Qwen3
- DeepSeek-V3 GitHub: https://github.com/deepseek-ai/DeepSeek-V3
- DeepSeek-R1 GitHub: https://github.com/deepseek-ai/DeepSeek-R1
- Mistral AI 官方: https://mistral.ai/
- Google Gemma: https://ai.google.dev/gemma
- 智谱 GLM GitHub: https://github.com/THUDM/GLM-4
- 微软 Phi-4(HF): https://huggingface.co/microsoft/phi-4
- Kimi K2 GitHub: https://github.com/MoonshotAI/Kimi-K2
- Hugging Face 模型仓库: https://huggingface.co/models