Skip to content

主流模型档案

本页速览 主流大模型速查档案:GPT、Claude、Gemini、Llama、Qwen、DeepSeek、Mistral、Gemma、GLM、Phi 等家族的规格、许可与亮点对比,含"怎么选模型"决策表与选型案例。

本页含时效性内容,数据截止于 2025-08;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

主流模型档案

本页是主流大语言模型的速查档案:家族、发布时间、参数量、上下文、开源情况与亮点,附分类维度、许可速查与"怎么选模型"决策表。模型规格与版本迭代极快,本页数据截至 2025 年 8 月,一切以官方发布为准;闭源模型参数多未公开,标注"未公开"。

模型档案会过时

GPT-4o 曾领先,如今已有 o 系列与 GPT-5;Llama 从 2 代到 4 代只用了两年。本页只能当"入门地图",采购或选型前务必查官方最新文档(见文末参考资料)。评测分数请参考评测与基准的批判性视角,不要只盯榜单。

一、模型总表

按家族列出代表版本。标注"开源"表示开放权重(注意各家许可不同);参数量为官方公布或行业共识值,未公开处如实标注。

家族代表版本发布时间参数量上下文开源亮点
GPT(OpenAI)GPT-32020-05175B2k首次证明大规模少样本能力
GPT-42023-03未公开(传闻 MoE)8k/32k考试级能力、多模态
GPT-4o2024-05未公开128k原生多模态、低延迟实时交互
o12024-09未公开200k推理时扩展(test-time scaling)
GPT-52025-08未公开约 400k推理与工具使用原生融合
Claude(Anthropic)Claude 3 系列2024-03未公开200k长文本与安全策略出色
Claude 3.7 Sonnet2025-02未公开200k混合推理(可控制思考预算)
Claude 42025-05未公开200k编码与 Agent 场景强化
Gemini(Google)Gemini 1.5 Pro2024-05未公开100 万百万 token 级原生长上下文
Gemini 2.5 Pro2025-03未公开100 万推理 + 多模态 + 超长上下文
Llama(Meta)Llama 22023-077B/13B/70B4k开源首个大规模可商用开源模型
Llama 3.12024-078B/70B/405B128k开源405B 开源旗舰 + 128k 上下文
Llama 4 Scout2025-04109B 总 / 17B 激活(MoE)约 1000 万开源开源 MoE、超长上下文
Qwen(阿里)Qwen2.52024-090.5B~72B128k开源全尺寸覆盖,中文+代码强
Qwen32025-040.6B~32B(dense)+ MoE 版约 256k开源混合推理(可开关思考模式)
DeepSeekDeepSeek-V32024-12671B 总 / 37B 激活(MoE)128k开源(MIT)开源 MoE 性价比标杆
DeepSeek-R12025-01671B + 蒸馏小模型128k开源(MIT)首个追平闭源的开源推理模型
Mistral / MixtralMistral 7B2023-097B32k开源(Apache 2.0)小模型高效率的代表
Mixtral 8x7B2023-1246.7B 总 / 12.9B 激活(MoE)32k开源(Apache 2.0)首个出圈的开源 MoE
Mistral Large2024-02约 123B32k欧洲闭源旗舰
Gemma(Google)Gemma 32025-031B/4B/12B/27B约 128k开源轻量级多模态,边缘友好
GLM(智谱)GLM-4-9B2024-069B128k开源中文对话与工具调用
GLM-4.52025-02未公开约 128k中文综合能力旗舰
Phi(微软)Phi-42024-1214B约 16k开源(MIT)"教科书级数据"小模型
Command R(Cohere)Command R+2024-04104B128k开源(CC-BY-NC 非商用)RAG 场景专门优化
Grok(xAI)Grok-12024-03314B(MoE)8k开源当时最大的开源权重
Kimi(月之暗面)Kimi K22025-07173B(MoE)约 256k开源(Apache 2.0)超长上下文 + Agent 场景
文心(百度)ERNIE 4.52025-06未公开约 128k中文生态与多模态

读表须知

  1. "参数量"与"上下文"是变化最快的两列:Llama 3.1 发布后社区普遍用它做基准,Qwen3/DeepSeek 又刷新开源性价比。2. 开源许可差异很大:MIT(Phi、DeepSeek、Mistral、Qwen3 部分)最宽松,Llama 社区许可与 Gemma 条款有附加条件,Command R 仅限非商用。3. 未公开参数的闭源模型,能力只能靠评测与实测判断。

二、按维度分类

维度类别代表模型说明
开源 vs 闭源闭源 APIGPT-4o / GPT-5、Claude 4、Gemini 2.5 Pro、GLM-4.5能力领先、零运维,但受控、按量计费、数据出境需评估
开源权重Llama 3.1、Qwen3、DeepSeek-V3/R1、Mistral、Gemma、Phi、Kimi K2可控、可私有化,能力紧随其后(2024 后差距快速缩小)
架构dense(稠密)Llama 3.1、Qwen2.5、Gemma、Phi全参参与计算,小到中规模主流
MoE(稀疏)Mixtral、DeepSeek-V3、Llama 4、Qwen3-MoE、Kimi K2总参数大但每次只激活一部分,性价比高
模态文本Llama 3.1、DeepSeek-R1、Phi-4纯文本推理
多模态GPT-4o、Gemini、Qwen2.5-VL、GLM-4V、Gemma 3图/音/视频 + 文本联合理解
推理模式通用即时GPT-4o、Claude、Qwen3(可关思考)低延迟,日常任务
推理强化o1/o3、DeepSeek-R1、Claude 3.7/4、Gemini 2.5 Pro长思考链,数学/代码/复杂推理更强但更慢更贵

三、家族速览

每个家族的一段话档案,帮助建立"谁是谁、强在哪"的全局观。

OpenAI GPT 系列:2018 年 GPT-1 提出"生成式预训练 + 微调"范式,GPT-3(2020)把规模推到 175B 并证明少样本能力,InstructGPT/ChatGPT(2022)引入 RLHF 对齐,GPT-4(2023)实现多模态与考试级能力,o 系列(2024)开创推理时扩展,GPT-5(2025)把推理与工具使用原生融合。始终是行业技术风向标。详见GPT 系列

Anthropic Claude:由前 OpenAI 对齐研究团队创立,以"宪法 AI"与安全对齐著称;Claude 3 之后在长文本、编码、Agent 场景长期位居第一梯队,Claude 3.7 的混合推理(可调思考预算)与 Claude Code 工具深受工程师欢迎。

Google Gemini:DeepMind 与 Google Brain 合并后的原生多模态旗舰;Gemini 1.5 率先把上下文窗口推到百万 token,2.5 Pro 在推理与多模态理解上追平第一梯队。同源开源的 Gemma 面向轻量部署。

Meta Llama:开源生态的事实标准。Llama 2(2023)率先大规模可商用,Llama 3.1(2024)发布 405B 开源 dense 旗舰与 128k 上下文,Llama 4 转向 MoE 与千万级上下文;社区围绕它形成了微调、量化、部署的完整生态。详见Llama 与开源生态

阿里 Qwen:全尺寸(0.5B~72B)开源覆盖最全的中文模型家族;Qwen2.5 是开源微调与部署的最热门基座之一,Qwen3 加入混合推理(可开关思考模式),配套 Qwen2.5-Coder / Qwen2.5-VL 覆盖代码与多模态。

DeepSeek:以"极致的工程性价比"闻名:V2 验证 MoE + MLA 架构,V3(671B 总/37B 激活)以远低于同级闭源的训练成本达到第一梯队,R1 首次让开源推理模型追平闭源;训练细节公开最完整,MIT 许可最宽松。

Mistral / Mixtral:欧洲开源代表,Apache 2.0 许可最为宽松;Mistral 7B 以高效著称,Mixtral 8x7B 是首个出圈的开源 MoE,Mistral Large 是闭源旗舰,在欧洲数据合规(GDPR)场景有优势。详见MoE 与超大规模模型

Google Gemma:基于 Gemini 技术的轻量开放模型,1B~27B 覆盖边缘到中端,Gemma 3 支持多模态与长上下文,适合消费级硬件与移动端。

智谱 GLM:国内最早开源的中文对话模型之一(ChatGLM-6B),GLM-4 系列在中文对话、工具调用与 Agent 场景成熟,GLM-4.5 为中文综合旗舰。

微软 Phi:以小博大——用"教科书级"高质量数据训练 1B~14B 小模型,Phi-4 在代码与数学上媲美大它数倍的模型,MIT 许可,适合资源受限环境。

Cohere Command R:面向企业 RAG 场景优化(检索引用、多语言、工具调用),Command R+ 104B 是少数专门做"检索增强"的模型,但许可为非商用。

xAI Grok:主打实时数据(X 平台)与产品生态,Grok-1 曾以 314B MoE 成为最大开源权重,Grok-2/3 转向闭源并进入推理第一梯队。

月之暗面 Kimi:以超长上下文起家(最早把 200k 上下文商用化),Kimi K2(2025.7)开源 173B MoE 并面向 Agent 场景。

百度文心 ERNIE:文心一言背后的旗舰,中文生态完整(搜索、云、智能体),ERNIE 4.5 主打多模态与中文理解,闭源 API。

四、生态与许可速查

选型前的"许可体检表"——开放权重 ≠ 可以随便商用

模型许可类型可商用关键备注
GPT / Claude / Gemini / GLM-4.5 / ERNIE闭源 API按量付费受服务条款约束,数据出境需评估
Llama 系列Llama 社区许可可(月活超 7 亿需另行申请)禁止用其输出训练竞争模型等条款
Qwen2.5 / Qwen3 部分Apache 2.0部分衍生版本可能有附加说明
DeepSeek-V3 / R1MIT最宽松的一档
Mistral / MixtralApache 2.0最宽松的一档
Gemma 系列Gemma 许可可(有条件)禁止若干受限用途,需读条款
GLM-4-9B 等开源部分Apache 2.0闭源旗舰不在此列
Phi 系列MIT最宽松的一档
Command R+CC-BY-NC否(仅非商用)商用需联系 Cohere
Grok-1Apache 2.0Grok-2/3 闭源
Kimi K2Apache 2.0需确认最新条款

五、怎么选模型

没有"最好的模型",只有"适合场景的模型"。选型四步:定场景 → 定约束(预算/部署/数据合规)→ 短名单 → 实测。下表给出常见场景的推荐起点。

场景推荐理由
通用对话 / 写作(无部署顾虑)GPT-4o / Claude 4 / Gemini 2.5 Flash综合能力强、生态工具成熟
代码生成与审查Claude 4 / GPT-5(闭源);Qwen2.5-Coder(开源)代码评测长期领先
数学与复杂推理o1 / Gemini 2.5 Pro(闭源);DeepSeek-R1(开源)推理时扩展擅长多步推导
超长文档(10 万+ token)Gemini 2.5 Pro / GPT-5(闭源);Kimi K2 / Llama 3.1 405B(开源)原生长上下文窗口
中文业务落地Qwen3 / GLM-4.5 / DeepSeek中文语料占比高、中文生态完善
私有数据 + RAGCommand R+ / Qwen3 / Llama 3.1检索友好或开源可控可私有化
本地部署(消费级显卡 8~16GB)Qwen3-8B / Gemma 3 12B / Phi-4量化后显存可承受,详见部署与服务化
开源微调基座Llama 3.1 8B / Qwen2.5-7B(中小);DeepSeek-V3(大)社区生态、工具链与许可最成熟
成本敏感的高并发推理DeepSeek-V3(MoE)/ 小模型量化版激活参数少、单 token 成本低
边缘 / 端侧设备Llama 3.2 1B/3B / Qwen3-0.6B / Gemma 3 1B毫秒级延迟、低显存

1. 三个选型案例

案例 A:中型企业"内部知识库问答"(中文文档、需私有部署、预算有限) → 选 Qwen3-32B(或 Qwen2.5-14B)+ vLLM + 自建 RAG。理由:开源可私有化,中文理解强,14B/32B 量化后显存可行(2~4 张卡),社区中文资料与工具链最全。闭源 API 走不通的"数据不出内网"约束,开源权重是唯一解。

案例 B:代码助手产品(高并发、低延迟、允许走 API) → 选 Claude 4 或 GPT-5 API + prompt 缓存。理由:代码能力第一梯队,API 免去 GPU 运维;把"延迟敏感"的小请求路由到小模型(如 GPT-4o mini 或开源 8B),大模型只处理复杂任务——模型分级路由是省成本的核心手段

案例 C:科研团队的数学/推理评测 → 选 DeepSeek-R1(开源,可复现、可私有化跑评测)或 o3 API。理由:推理基准表现顶级;开源版本方便记录完整实验环境,符合学术可复现要求。

选型铁律

  1. 先跑通再优化:先用 API 验证效果,再考虑自建;2. 用你自己的数据实测:公开榜单与你的任务不一定同分布;3. 成本看 token 总账:闭源 API 的调用量 vs 开源自建的 GPU 折旧,要算总账;4. 参考框架与工具选型决定配套工具,参考部署与服务化估算资源。

三个常见误区

  • 参数越大越好:上下文长度、任务类型、延迟预算都会改变最优解,7B 模型配 RAG 常常胜过 405B 硬扛。
  • 开源=免费:GPU、带宽、运维人力都是成本,开源只是"成本结构"不同。
  • 看多模态就选全模态:如果只用文本,为多模态能力付钱是浪费;选"够用"而非"最全"。

六、如何获取与运行

路线适用做法
闭源 API无部署条件、追求能力上限、快速上线各官方平台注册拿 Key(OpenAI/Anthropic/Google/智谱/月之暗面等),或用 OpenRouter 等聚合平台统一接入
开源权重私有化、微调、成本优化Hugging Face Hub 下载 → vLLM(服务化)/ llama.cpp(CPU 边缘)/ Ollama(本地体验)
混合分级路由简单任务走小模型/开源,复杂任务走闭源 API

完整的显存估算、量化、并发指标与部署步骤见部署与服务化,工具选型见框架与工具选型

七、保持更新

模型市场的节奏以"月"为单位:本页档案在你读到的时候可能已经落后。建议固定几个信息源每周扫一遍:

  1. 官方渠道:OpenAI / Anthropic / Google / Meta 的官方博客与模型文档(见参考资料);
  2. 社区榜单LMArena 与 Hugging Face 趋势榜,看新模型实测口碑;
  3. 论文:arXiv 与前沿进展,看技术路线的下一步;
  4. 工具链:vLLM / llama.cpp 的 release notes,新模型支持通常最先出现在这里。

延伸阅读

参考资料