外观
什么是大语言模型
一句话定义:大语言模型(Large Language Model, LLM)是基于海量文本预训练的、以"预测下一个词"为基本任务、参数量通常在十亿级以上的神经网络语言模型——它看起来像"聊天机器人",但本质上是一个被训练到极致的下一个词预测器。它的能力不是凭空设计出来的,而是规模(参数量与数据量)、数据(海量且多样的文本)与对齐(让输出符合人类偏好)三者叠加的结果。
先记住一个反差
LLM 的训练任务极其简单——"猜下一个词";LLM 展现出的能力却极其丰富——写代码、做推理、按指令办事、处理多轮对话。简单任务 × 巨大规模 = 复杂能力,这正是大语言模型最反直觉、也最核心的事实,也是本书反复回到的母题。
一、定义三层面
一句话定义只回答了"它是什么",要真正理解 LLM,需要从三个层面分别看:它做什么(实用层)、它怎么做(机制层)、它能做到什么(能力层)。
1. 实用层:一个"文本进、文本出"的接口
从使用者的角度看,LLM 是一个接收文本、返回文本的函数。你输入一段指令(prompt),它输出一段补全(completion):
text
输入(prompt): 请用一句话解释什么是注意力机制。
输出(completion): 注意力机制让模型在预测每个词时,动态地关注输入序列中相关的部分。
输入: def fibonacci(n): # 让模型补全代码
输出: if n <= 1: return n
return fibonacci(n-1) + fibonacci(n-2)实用层决定了 LLM 的产品形态:问答、写作、编程助手、翻译、摘要、对话……这些在接口上全是同一件事——文本到文本的映射。这也是它被称为"基础模型(foundation model)"的原因:一个模型接上不同的提示与工具,就能变出无数应用。
2. 机制层:一个"预测下一个词"的自回归模型
剥开接口,LLM 的内部机制只有一个核心动作:给定前文,预测下一个 token 的概率分布。所谓 token 是模型处理的最小文本单元(可能是一个词、半个词或一个字符),见分词与词表。
用概率语言描述,语言模型是在估计一段文本出现的概率:
text
P(w₁, w₂, …, wₙ) = P(w₁) · P(w₂|w₁) · P(w₃|w₁,w₂) · … · P(wₙ|w₁,…,wₙ₋₁)即把整段文本的概率按链式法则拆成一次次条件概率,每次只预测下一个词。训练时,模型读海量文本,反复做同一件事:看到前文、预测下一个词、与真实的下一个词比对、更新参数让预测更准。这个"最大化真实文本概率"的目标,就是语言建模范式。它简单到可以用一句话说清,却是在Transformer 架构上才真正规模化的——因为 Transformer 让"并行处理整个序列 + 捕捉长距离依赖"第一次变得可行。
为什么"预测下一个词"能学到知识?
这是初学 LLM 时最大的疑问。直觉是:想准确预测下一个词,模型必须先理解前文。要预测"牛顿发现__之后创立了微积分",模型必须"知道"牛顿、万有引力、微积分这些概念及其关系。当训练文本覆盖人类知识的绝大部分书面表达时,压缩这些文本的最优方式,就是把这些"知识"编码进模型的参数里。预测下一个词是代理任务(surrogate task)——表面上在学语言,实际上在学世界知识的结构。详见语言建模。
3. 能力层:涌现出任务解决能力
机制层只承诺"预测下一个词",能力层展示的是模型最终能做到的事——远超"填空"本身:
| 能力 | 表现 | 依赖的机制 |
|---|---|---|
| 语言理解 | 读懂指令、摘要、分类、情感分析 | 预训练中积累的语言与知识表征 |
| 文本生成 | 续写、创作、翻译、改写 | 自回归采样(见推理基础) |
| 上下文学习(in-context learning) | 给几个示例后"现学现做"新任务 | 上下文窗口内的模式匹配,无需改参数 |
| 指令遵循 | 按"帮我写…""用 JSON 格式…"等要求执行 | 后训练阶段的对齐(SFT + RLHF,见对齐) |
| 推理(涌现) | 数学、逻辑、代码调试,随规模增长而出现 | 规模法则驱动的涌现(见规模法则) |
"上下文学习"与"指令遵循"尤其值得注意:这两种能力都不是预训练任务直接要求的,而是规模放大后浮现、对齐训练后强化的。这正是大模型区别于传统模型的关键——能力清单无法在设计时完全预知。
二、继承关系:从统计语言模型到 LLM
LLM 不是横空出世,而是三代语言模型的直接后代:
| 代际 | 代表 | 核心思想 | 局限 |
|---|---|---|---|
| 统计语言模型 | N-gram(1950s–2000s) | 用前面 n-1 个词的共现频率估计下一个词 | 数据稀疏,窗口短,无法泛化到未见过的词序列 |
| 神经语言模型 | Bengio 2003 神经网络语言模型 → RNN/LSTM | 用神经网络把词映射为向量、对任意长度的前文建模 | 序列化处理慢,长距离依赖仍困难,规模有限 |
| 大语言模型 | Transformer 预训练大模型(2018 至今) | 海量数据 + 大规模并行架构 + 参数规模放大 | 训练成本高、幻觉、对齐难 |
关键转折点有两个:2003 年 Bengio 提出神经语言模型(用神经网络替代计数),以及 2017 年 Transformer 与 2018 年 GPT/BERT 的预训练范式(先在海量语料上预训练、再适配下游任务)。到 2020 年 GPT-3 证明"模型足够大时,任务可以靠提示解决而无需微调","大语言模型"作为一个独立概念正式成立。完整脉络见演进简史。
1. 一脉相承的一个例子
用一个例子看三代模型如何逼近同一个目标。任务是预测句子 "The cat sat on the ____" 的下一个词:
| 模型 | 它怎么"猜" | 结果 |
|---|---|---|
| N-gram(统计) | 在语料里数"on the"后面最常跟什么词 | 常跟物,但无法利用更远的上文,且未出现的搭配概率为零 |
| 神经语言模型(Bengio/RNN) | 把词映射为向量,相似语义共享统计 | 能泛化到没见过的搭配,但受序列长度限制 |
| LLM(Transformer) | 对整个前文做注意力,综合语境与知识 | 能根据"cat、sat、on"推断出"mat/rug"等合理词,还能考虑世界常识 |
三代模型的目标函数一模一样(最大化真实文本概率),差异全在表示能力(从计数表到连续向量再到深度表征)与建模范围(从 n 个词到整段上下文)。这就是"继承"的真正含义:不是换了问题,而是换了解决同一问题的工具。
三、核心能力盘点
把"能用"的能力和"好用"的能力分开,LLM 的能力地图如下:
| 能力域 | 代表能力 | 典型表现 | 难度 |
|---|---|---|---|
| 语言类 | 理解、生成、改写、翻译、摘要 | 稳定可用,中英文皆可 | ★ |
| 知识类 | 记忆事实、常识推理 | 强大但会过期、会出错 | ★★ |
| 推理类 | 数学、逻辑、代码 | 随规模与推理时扩展增强 | ★★★ |
| 交互类 | 指令遵循、多轮对话、角色扮演 | 依赖对齐质量 | ★★ |
| 工具类 | 调用函数、使用搜索/计算器/浏览器 | 依赖外部编排(见基于 LLM 的 Agent) | ★★★ |
| 多模态类 | 看图、听音、生成图像 | 原生多模态模型正在普及 | ★★★ |
text
能力的"涌现"曲线(示意,非真实数据):
能力水平
│ ● 推理(涌现,临界点之后跳升)
│ ●
│ ● 语言理解(平滑上升)
│ ●
│ ●
└──────────────────────────────────────→ 模型规模能力不是免费的
"能力越强"通常意味着"参数越多、训练数据越多、成本越高",且强能力与高成本经常是一起出现的。评测上"高分"与生产上"好用"之间还有评估的鸿沟,见评测与基准。
1. 能力分层的实用含义
把能力按"成熟度"再切一刀,会直接影响工程选型:
| 分层 | 代表能力 | 生产可用性 | 实践含义 |
|---|---|---|---|
| 成熟层 | 翻译、摘要、改写、结构化抽取 | 高,接近可直接上线 | 拿来即用,主要工作是提示与评测 |
| 发展层 | 代码生成、数学推理、多步规划 | 中,需要护栏与验证 | 配合测试、沙箱与人工抽检使用 |
| 试验层 | 复杂长程任务、自主 Agent | 低,可靠性不足 | 先小规模试点,逐步放宽(见基于 LLM 的 Agent) |
同样一个模型,不同能力处于不同成熟层——它翻译很可靠、自主规划却不可靠。成熟的做法是:按任务选层、按层配护栏,而不是"模型很聪明"就全权委托。这个"能力分层思维"贯穿总体架构解剖的"应用"环节。
四、关键构成要素
一个 LLM 是五个要素的共同产物,缺一不可:
| 要素 | 说明 | 示例量级(以 2025 年主流为参考) | 相关页面 |
|---|---|---|---|
| 参数量 | 模型可学习参数的数量,决定容量 | 十亿级到千亿级(如 Llama-3-405B);也有 MoE 总参数更大、激活参数更少 | 规模法则、MoE |
| 训练数据 | 预训练语料,决定知识范围与质量 | 数万亿 token(多语言、代码、数学、书籍混合) | 预训练 |
| 架构 | 多为 Decoder-only Transformer | 自回归 + 因果掩码 + 位置编码 | Transformer 架构详解 |
| 对齐 | 让输出符合人类偏好(帮助、诚实、安全) | SFT + RLHF / DPO 等后训练 | 对齐 |
| 上下文窗口 | 一次能"看到"的文本长度 | 几千到几十万 token 不等 | 上下文与长文本 |
记忆口诀
大模型 = 大参数 × 大数据 × 好架构 × 好对齐 × 长上下文。面试被问"大模型为什么大"时,把五个要素逐一说一遍,再落到"规模、数据、对齐三者叠加"这一句。
五、一个最小示例:亲手跑一次 next-token 生成
把抽象落回代码。用 Hugging Face transformers 加载一个开源小模型(GPT-2 small,约 1.24 亿参数;完整版 GPT-2 为 15 亿参数),做一次"预测下一个词":
python
# 前置:pip install transformers (首次运行会自动下载模型权重)
from transformers import AutoModelForCausalLM, AutoTokenizer
# ① 加载一个开源小模型(GPT-2 small,1.24 亿参数,足够演示"下一个词预测")
model_name = "gpt2"
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# ② 输入前文(中文模型需换成中文基座,此处用英文便于验证)
prompt = "The capital of France is"
inputs = tokenizer(prompt, return_tensors="pt")
# ③ 模型输出每个候选 token 的概率,取最高者为"预测的下一个词"
outputs = model.generate(**inputs, max_new_tokens=1)
print(tokenizer.decode(outputs[0]))
# 期望输出:... France is Paris ← 模型"预测"出了 Paris试试把 prompt 换成 "2 + 2 ="、"Once upon a time",观察模型每次只往前走一个 token,输出是逐词滚动生成的——这就是自回归。想理解这个过程背后的采样、温度等机制,见推理基础;想从零训练一个更小的模型,见从零构建一个大模型。
动手建议
用你电脑上能跑的最小的中文模型(如 Qwen2.5-0.5B)重复上面的代码,把 max_new_tokens 改成 50,观察一段完整续写。十分钟的亲手实验,胜过十遍阅读——你会立刻理解"预测下一个词"与"写出整段话"的关系。
1. 从示例到生产:三层跃升
上面这个 demo 只有 30 行代码,而生产系统相差三个数量级。理解这条鸿沟,能帮你校准"示例"与"工程"之间的距离:
| 层面 | 最小示例(上面这段) | 生产系统 | 差距来源 |
|---|---|---|---|
| 模型 | 小模型(1 亿参数) | 大模型(百亿~千亿参数,或 API) | 规模与能力(见规模法则) |
| 交互 | 单次补全,无记忆 | 多轮对话、工具调用、系统提示 | 上下文管理(见上下文与长文本) |
| 交付 | 命令行打印 | 低延迟、高并发、带评测与监控的服务 | 部署工程(见部署与服务化) |
示例的价值在于亲手确认机制,生产的地基在于系统化工程。不要因为"示例这么简单"就低估生产,也不要因为"生产很复杂"就跳过示例。
六、大模型为什么有效:三个实证刻度
"规模、数据、对齐三者叠加"不是口号,是可以被反复观察到的实证链条。三个刻度依次展示了规模的威力、对齐的破圈、能力的极限:
| 刻度 | 事件 | 意义 |
|---|---|---|
| GPT-3 少样本(2020) | 1750 亿参数的 GPT-3 在不微调的情况下,仅靠提示中几个示例(few-shot)就在多项任务上接近甚至追平当时微调的最优结果 | 证明"规模本身带来能力",任务适配可以靠提示而非训练;见GPT 系列 |
| ChatGPT 破圈(2022.11) | 以 InstructGPT 的 RLHF 技术为内核的对话产品上线 5 天即破百万用户,两月达亿级 | 证明"能力 + 对齐 + 对话交互"能跨越专业边界,让普通人直接使用;见ChatGPT 与对话模型 |
| GPT-4 考试(2023) | GPT-4 在美国律师资格考试(Uniform Bar Exam)等多项考试中进入人类前 10% 水平 | 证明模型在"需要推理与综合知识的任务"上达到专家级表现,也把"评估 LLM"本身变成一门学问(见评测与基准) |
这三步对应本书反复强调的三条主线:规模(GPT-3)→ 对齐(ChatGPT)→ 能力的边界与评测(GPT-4)。
1. 三个刻度之后:2024–2025 的新维度
2024 年之后的进展,可以看作在这三个刻度上各自再加了一维:
| 维度 | 新增内容 | 代表 | 指向页面 |
|---|---|---|---|
| 规模维度 | 推理时扩展(test-time scaling):把"思考时间"也算进规模 | o1 系列、DeepSeek-R1 | 前沿进展 |
| 对齐维度 | 从文本对齐走向多模态与工具行为对齐 | GPT-4o、Gemini | 多模态大模型 |
| 评测维度 | 从基准分数走向长上下文、Agent 任务与安全评测 | LongBench、Agent 基准 | 评测与基准 |
这些新维度不推翻"规模、数据、对齐"的框架,而是把框架里每一块的内容持续更新——这也解释了为什么本手册要在前沿进展和主流模型档案中持续跟进。
七、权衡与边界
大模型的能力地图之外,还有一张"不可靠地图"。诚实面对边界,才能用好它:
| 边界 | 表现 | 缓解方向 | 相关页面 |
|---|---|---|---|
| 幻觉(hallucination) | 一本正经地编造事实、引用不存在的论文 | 检索增强(RAG)、事实性评测、提示约束 | 幻觉、RAG |
| 成本 | 训练与推理的算力、显存、电费、API 费用 | 量化、蒸馏、MoE 稀疏化、按需选模型 | 部署与服务化 |
| 评估困难 | 生成式输出的"对错"难以自动判定,榜单易被刷分 | 多维评测、LLM-as-a-judge、人工抽检 | 评测与基准 |
| 知识过期 | 预训练数据有截止日期,无法知道训练后的事 | RAG、实时搜索工具、定期更新模型 | 上下文与长文本 |
| 安全与偏差 | 有害输出、隐私、偏见放大、被提示注入利用 | 对齐训练、护栏、内容审核 | 安全与风险 |
两个常见误判
- "LLM 会撒谎"是误解:模型没有"撒谎"的意图,它只是在优化"下一个词的概率"——幻觉是统计机器对不确定性的不当自信,不是人格缺陷。
- "LLM 什么都懂"是更大的误解:它是"语言分布压缩器",擅长语言形态的知识,不擅长需要世界实时状态、精确计算与真实因果的任务。把它当数据库用、当计算器用、当真相源用,都会失望。
1. 使用 LLM 的三条原则
面对上述边界,成熟的工程用法可以浓缩为三条原则:
- 给模型提供事实,而不是让它回忆事实:知识性任务优先考虑检索增强(RAG)或工具调用,让模型"基于给定材料回答",见幻觉与RAG。
- 为关键决策设计验证:对需要精确性的输出(代码、数字、结构化数据),用规则校验、单元测试或人工抽检兜底,而不是信任模型的自信。
- 把评测当产品的一部分:上线前定义"什么算答对",上线后持续采样回归,让模型的每一次改动可度量,见评测与基准。
一句话总结
LLM 是一个以语言为接口、由规模与对齐塑造、在可接受边界内使用的通用能力引擎。把它当"聪明的同事"用,而不当"全能的数据库"用,是这一页最想传递的态度。
八、本书如何展开
这一页是全书概念的总入口。建议按学习路径继续:先读演进简史建立时间线,用总体架构解剖建立全站地图,然后顺着语言建模 → Transformer 架构详解 → 预训练 → 对齐的主线深入。遇到任何名词,随时回术语表。
延伸阅读
- 语言建模 —— 本页"机制层"的完整展开:下一词预测范式、困惑度与交叉熵
- Transformer 架构详解 —— 让"海量文本预训练"可行的架构革命,QKV 与多头注意力
- 规模法则 —— "为什么模型越大越好"的定量回答,与涌现能力的讨论
- 对齐 —— "帮助性、诚实性、安全性"如何通过 RLHF/DPO 进入模型
- 演进简史 —— 从 N-gram 到 ChatGPT 的三次范式跃迁
- 推理基础 —— 自回归采样、温度与 top-p,理解模型"怎么说话"
参考资料
- Brown et al. Language Models are Few-Shot Learners(GPT-3,NeurIPS 2020) —— 1750 亿参数与 few-shot 能力的原始论文,第一个实证刻度
- OpenAI · Introducing ChatGPT(2022.11) —— ChatGPT 发布说明,第二个实证刻度
- OpenAI · GPT-4 Technical Report(2023) —— 考试前 10% 等能力的官方报告,第三个实证刻度
- Vaswani et al. Attention Is All You Need(2017) —— Transformer 架构原始论文,全部现代 LLM 的地基
- Kaplan et al. Scaling Laws for Neural Language Models(2020) —— "损失随规模幂律下降"的定量研究
- Hugging Face · Transformers 官方文档 —— 本页示例代码使用的库;模型与分词器规格以官方发布为准