Skip to content

什么是大语言模型

本页速览 大语言模型是基于海量文本预训练、以"预测下一个词"为基本任务、参数量通常在十亿级以上的神经网络语言模型,其能力来自规模、数据与对齐三者的叠加。

什么是大语言模型

一句话定义:大语言模型(Large Language Model, LLM)是基于海量文本预训练的、以"预测下一个词"为基本任务、参数量通常在十亿级以上的神经网络语言模型——它看起来像"聊天机器人",但本质上是一个被训练到极致的下一个词预测器。它的能力不是凭空设计出来的,而是规模(参数量与数据量)、数据(海量且多样的文本)与对齐(让输出符合人类偏好)三者叠加的结果。

先记住一个反差

LLM 的训练任务极其简单——"猜下一个词";LLM 展现出的能力却极其丰富——写代码、做推理、按指令办事、处理多轮对话。简单任务 × 巨大规模 = 复杂能力,这正是大语言模型最反直觉、也最核心的事实,也是本书反复回到的母题。

一、定义三层面

一句话定义只回答了"它是什么",要真正理解 LLM,需要从三个层面分别看:它做什么(实用层)、它怎么做(机制层)、它能做到什么(能力层)

1. 实用层:一个"文本进、文本出"的接口

从使用者的角度看,LLM 是一个接收文本、返回文本的函数。你输入一段指令(prompt),它输出一段补全(completion):

text
输入(prompt):  请用一句话解释什么是注意力机制。
输出(completion): 注意力机制让模型在预测每个词时,动态地关注输入序列中相关的部分。

输入:  def fibonacci(n):        # 让模型补全代码
输出:      if n <= 1: return n
            return fibonacci(n-1) + fibonacci(n-2)

实用层决定了 LLM 的产品形态:问答、写作、编程助手、翻译、摘要、对话……这些在接口上全是同一件事——文本到文本的映射。这也是它被称为"基础模型(foundation model)"的原因:一个模型接上不同的提示与工具,就能变出无数应用。

2. 机制层:一个"预测下一个词"的自回归模型

剥开接口,LLM 的内部机制只有一个核心动作:给定前文,预测下一个 token 的概率分布。所谓 token 是模型处理的最小文本单元(可能是一个词、半个词或一个字符),见分词与词表

用概率语言描述,语言模型是在估计一段文本出现的概率:

text
P(w₁, w₂, …, wₙ) = P(w₁) · P(w₂|w₁) · P(w₃|w₁,w₂) · … · P(wₙ|w₁,…,wₙ₋₁)

即把整段文本的概率按链式法则拆成一次次条件概率,每次只预测下一个词。训练时,模型读海量文本,反复做同一件事:看到前文、预测下一个词、与真实的下一个词比对、更新参数让预测更准。这个"最大化真实文本概率"的目标,就是语言建模范式。它简单到可以用一句话说清,却是在Transformer 架构上才真正规模化的——因为 Transformer 让"并行处理整个序列 + 捕捉长距离依赖"第一次变得可行。

为什么"预测下一个词"能学到知识?

这是初学 LLM 时最大的疑问。直觉是:想准确预测下一个词,模型必须先理解前文。要预测"牛顿发现__之后创立了微积分",模型必须"知道"牛顿、万有引力、微积分这些概念及其关系。当训练文本覆盖人类知识的绝大部分书面表达时,压缩这些文本的最优方式,就是把这些"知识"编码进模型的参数里。预测下一个词是代理任务(surrogate task)——表面上在学语言,实际上在学世界知识的结构。详见语言建模

3. 能力层:涌现出任务解决能力

机制层只承诺"预测下一个词",能力层展示的是模型最终能做到的事——远超"填空"本身:

能力表现依赖的机制
语言理解读懂指令、摘要、分类、情感分析预训练中积累的语言与知识表征
文本生成续写、创作、翻译、改写自回归采样(见推理基础
上下文学习(in-context learning)给几个示例后"现学现做"新任务上下文窗口内的模式匹配,无需改参数
指令遵循按"帮我写…""用 JSON 格式…"等要求执行后训练阶段的对齐(SFT + RLHF,见对齐
推理(涌现)数学、逻辑、代码调试,随规模增长而出现规模法则驱动的涌现(见规模法则

"上下文学习"与"指令遵循"尤其值得注意:这两种能力都不是预训练任务直接要求的,而是规模放大后浮现、对齐训练后强化的。这正是大模型区别于传统模型的关键——能力清单无法在设计时完全预知。

二、继承关系:从统计语言模型到 LLM

LLM 不是横空出世,而是三代语言模型的直接后代:

代际代表核心思想局限
统计语言模型N-gram(1950s–2000s)用前面 n-1 个词的共现频率估计下一个词数据稀疏,窗口短,无法泛化到未见过的词序列
神经语言模型Bengio 2003 神经网络语言模型 → RNN/LSTM用神经网络把词映射为向量、对任意长度的前文建模序列化处理慢,长距离依赖仍困难,规模有限
大语言模型Transformer 预训练大模型(2018 至今)海量数据 + 大规模并行架构 + 参数规模放大训练成本高、幻觉、对齐难

关键转折点有两个:2003 年 Bengio 提出神经语言模型(用神经网络替代计数),以及 2017 年 Transformer 与 2018 年 GPT/BERT 的预训练范式(先在海量语料上预训练、再适配下游任务)。到 2020 年 GPT-3 证明"模型足够大时,任务可以靠提示解决而无需微调","大语言模型"作为一个独立概念正式成立。完整脉络见演进简史

1. 一脉相承的一个例子

用一个例子看三代模型如何逼近同一个目标。任务是预测句子 "The cat sat on the ____" 的下一个词:

模型它怎么"猜"结果
N-gram(统计)在语料里数"on the"后面最常跟什么词常跟物,但无法利用更远的上文,且未出现的搭配概率为零
神经语言模型(Bengio/RNN)把词映射为向量,相似语义共享统计能泛化到没见过的搭配,但受序列长度限制
LLM(Transformer)对整个前文做注意力,综合语境与知识能根据"cat、sat、on"推断出"mat/rug"等合理词,还能考虑世界常识

三代模型的目标函数一模一样(最大化真实文本概率),差异全在表示能力(从计数表到连续向量再到深度表征)与建模范围(从 n 个词到整段上下文)。这就是"继承"的真正含义:不是换了问题,而是换了解决同一问题的工具。

三、核心能力盘点

把"能用"的能力和"好用"的能力分开,LLM 的能力地图如下:

能力域代表能力典型表现难度
语言类理解、生成、改写、翻译、摘要稳定可用,中英文皆可
知识类记忆事实、常识推理强大但会过期、会出错★★
推理类数学、逻辑、代码随规模与推理时扩展增强★★★
交互类指令遵循、多轮对话、角色扮演依赖对齐质量★★
工具类调用函数、使用搜索/计算器/浏览器依赖外部编排(见基于 LLM 的 Agent★★★
多模态类看图、听音、生成图像原生多模态模型正在普及★★★
text
能力的"涌现"曲线(示意,非真实数据):

能力水平
  │                                    ● 推理(涌现,临界点之后跳升)
  │                            ●
  │                    ●   语言理解(平滑上升)
  │            ●
  │    ●
  └──────────────────────────────────────→ 模型规模

能力不是免费的

"能力越强"通常意味着"参数越多、训练数据越多、成本越高",且强能力与高成本经常是一起出现的。评测上"高分"与生产上"好用"之间还有评估的鸿沟,见评测与基准

1. 能力分层的实用含义

把能力按"成熟度"再切一刀,会直接影响工程选型:

分层代表能力生产可用性实践含义
成熟层翻译、摘要、改写、结构化抽取高,接近可直接上线拿来即用,主要工作是提示与评测
发展层代码生成、数学推理、多步规划中,需要护栏与验证配合测试、沙箱与人工抽检使用
试验层复杂长程任务、自主 Agent低,可靠性不足先小规模试点,逐步放宽(见基于 LLM 的 Agent

同样一个模型,不同能力处于不同成熟层——它翻译很可靠、自主规划却不可靠。成熟的做法是:按任务选层、按层配护栏,而不是"模型很聪明"就全权委托。这个"能力分层思维"贯穿总体架构解剖的"应用"环节。

四、关键构成要素

一个 LLM 是五个要素的共同产物,缺一不可:

要素说明示例量级(以 2025 年主流为参考)相关页面
参数量模型可学习参数的数量,决定容量十亿级到千亿级(如 Llama-3-405B);也有 MoE 总参数更大、激活参数更少规模法则MoE
训练数据预训练语料,决定知识范围与质量数万亿 token(多语言、代码、数学、书籍混合)预训练
架构多为 Decoder-only Transformer自回归 + 因果掩码 + 位置编码Transformer 架构详解
对齐让输出符合人类偏好(帮助、诚实、安全)SFT + RLHF / DPO 等后训练对齐
上下文窗口一次能"看到"的文本长度几千到几十万 token 不等上下文与长文本

记忆口诀

大模型 = 大参数 × 大数据 × 好架构 × 好对齐 × 长上下文。面试被问"大模型为什么大"时,把五个要素逐一说一遍,再落到"规模、数据、对齐三者叠加"这一句。

五、一个最小示例:亲手跑一次 next-token 生成

把抽象落回代码。用 Hugging Face transformers 加载一个开源小模型(GPT-2 small,约 1.24 亿参数;完整版 GPT-2 为 15 亿参数),做一次"预测下一个词":

python
# 前置:pip install transformers  (首次运行会自动下载模型权重)
from transformers import AutoModelForCausalLM, AutoTokenizer

# ① 加载一个开源小模型(GPT-2 small,1.24 亿参数,足够演示"下一个词预测")
model_name = "gpt2"
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)

# ② 输入前文(中文模型需换成中文基座,此处用英文便于验证)
prompt = "The capital of France is"
inputs = tokenizer(prompt, return_tensors="pt")

# ③ 模型输出每个候选 token 的概率,取最高者为"预测的下一个词"
outputs = model.generate(**inputs, max_new_tokens=1)
print(tokenizer.decode(outputs[0]))
# 期望输出:... France is Paris    ← 模型"预测"出了 Paris

试试把 prompt 换成 "2 + 2 =""Once upon a time",观察模型每次只往前走一个 token,输出是逐词滚动生成的——这就是自回归。想理解这个过程背后的采样、温度等机制,见推理基础;想从零训练一个更小的模型,见从零构建一个大模型

动手建议

用你电脑上能跑的最小的中文模型(如 Qwen2.5-0.5B)重复上面的代码,把 max_new_tokens 改成 50,观察一段完整续写。十分钟的亲手实验,胜过十遍阅读——你会立刻理解"预测下一个词"与"写出整段话"的关系。

1. 从示例到生产:三层跃升

上面这个 demo 只有 30 行代码,而生产系统相差三个数量级。理解这条鸿沟,能帮你校准"示例"与"工程"之间的距离:

层面最小示例(上面这段)生产系统差距来源
模型小模型(1 亿参数)大模型(百亿~千亿参数,或 API)规模与能力(见规模法则
交互单次补全,无记忆多轮对话、工具调用、系统提示上下文管理(见上下文与长文本
交付命令行打印低延迟、高并发、带评测与监控的服务部署工程(见部署与服务化

示例的价值在于亲手确认机制,生产的地基在于系统化工程。不要因为"示例这么简单"就低估生产,也不要因为"生产很复杂"就跳过示例。

六、大模型为什么有效:三个实证刻度

"规模、数据、对齐三者叠加"不是口号,是可以被反复观察到的实证链条。三个刻度依次展示了规模的威力、对齐的破圈、能力的极限:

刻度事件意义
GPT-3 少样本(2020)1750 亿参数的 GPT-3 在不微调的情况下,仅靠提示中几个示例(few-shot)就在多项任务上接近甚至追平当时微调的最优结果证明"规模本身带来能力",任务适配可以靠提示而非训练;见GPT 系列
ChatGPT 破圈(2022.11)以 InstructGPT 的 RLHF 技术为内核的对话产品上线 5 天即破百万用户,两月达亿级证明"能力 + 对齐 + 对话交互"能跨越专业边界,让普通人直接使用;见ChatGPT 与对话模型
GPT-4 考试(2023)GPT-4 在美国律师资格考试(Uniform Bar Exam)等多项考试中进入人类前 10% 水平证明模型在"需要推理与综合知识的任务"上达到专家级表现,也把"评估 LLM"本身变成一门学问(见评测与基准

这三步对应本书反复强调的三条主线:规模(GPT-3)→ 对齐(ChatGPT)→ 能力的边界与评测(GPT-4)

1. 三个刻度之后:2024–2025 的新维度

2024 年之后的进展,可以看作在这三个刻度上各自再加了一维

维度新增内容代表指向页面
规模维度推理时扩展(test-time scaling):把"思考时间"也算进规模o1 系列、DeepSeek-R1前沿进展
对齐维度从文本对齐走向多模态与工具行为对齐GPT-4o、Gemini多模态大模型
评测维度从基准分数走向长上下文、Agent 任务与安全评测LongBench、Agent 基准评测与基准

这些新维度不推翻"规模、数据、对齐"的框架,而是把框架里每一块的内容持续更新——这也解释了为什么本手册要在前沿进展主流模型档案中持续跟进。

七、权衡与边界

大模型的能力地图之外,还有一张"不可靠地图"。诚实面对边界,才能用好它:

边界表现缓解方向相关页面
幻觉(hallucination)一本正经地编造事实、引用不存在的论文检索增强(RAG)、事实性评测、提示约束幻觉RAG
成本训练与推理的算力、显存、电费、API 费用量化、蒸馏、MoE 稀疏化、按需选模型部署与服务化
评估困难生成式输出的"对错"难以自动判定,榜单易被刷分多维评测、LLM-as-a-judge、人工抽检评测与基准
知识过期预训练数据有截止日期,无法知道训练后的事RAG、实时搜索工具、定期更新模型上下文与长文本
安全与偏差有害输出、隐私、偏见放大、被提示注入利用对齐训练、护栏、内容审核安全与风险

两个常见误判

  • "LLM 会撒谎"是误解:模型没有"撒谎"的意图,它只是在优化"下一个词的概率"——幻觉是统计机器对不确定性的不当自信,不是人格缺陷。
  • "LLM 什么都懂"是更大的误解:它是"语言分布压缩器",擅长语言形态的知识,不擅长需要世界实时状态、精确计算与真实因果的任务。把它当数据库用、当计算器用、当真相源用,都会失望。

1. 使用 LLM 的三条原则

面对上述边界,成熟的工程用法可以浓缩为三条原则:

  1. 给模型提供事实,而不是让它回忆事实:知识性任务优先考虑检索增强(RAG)或工具调用,让模型"基于给定材料回答",见幻觉RAG
  2. 为关键决策设计验证:对需要精确性的输出(代码、数字、结构化数据),用规则校验、单元测试或人工抽检兜底,而不是信任模型的自信。
  3. 把评测当产品的一部分:上线前定义"什么算答对",上线后持续采样回归,让模型的每一次改动可度量,见评测与基准

一句话总结

LLM 是一个以语言为接口、由规模与对齐塑造、在可接受边界内使用的通用能力引擎。把它当"聪明的同事"用,而不当"全能的数据库"用,是这一页最想传递的态度。

八、本书如何展开

这一页是全书概念的总入口。建议按学习路径继续:先读演进简史建立时间线,用总体架构解剖建立全站地图,然后顺着语言建模Transformer 架构详解预训练对齐的主线深入。遇到任何名词,随时回术语表

延伸阅读

  • 语言建模 —— 本页"机制层"的完整展开:下一词预测范式、困惑度与交叉熵
  • Transformer 架构详解 —— 让"海量文本预训练"可行的架构革命,QKV 与多头注意力
  • 规模法则 —— "为什么模型越大越好"的定量回答,与涌现能力的讨论
  • 对齐 —— "帮助性、诚实性、安全性"如何通过 RLHF/DPO 进入模型
  • 演进简史 —— 从 N-gram 到 ChatGPT 的三次范式跃迁
  • 推理基础 —— 自回归采样、温度与 top-p,理解模型"怎么说话"

参考资料