外观
LLM 与相邻概念
一句话定位:大语言模型是深度学习家族里、以语言建模为训练范式的一种具体应用形态;它上承 NLP 的全部遗产,下启 Agent 与 RAG 等新系统,但它的边界远小于"通用人工智能"。本文把 LLM 放进概念坐标系里,逐个厘清"谁包含谁、谁依赖谁、谁被误认为谁"。
一、一张总表
| 概念 | 一句话 | 与 LLM 的关系 | 常见误解 |
|---|---|---|---|
| 自然语言处理(NLP) | 让机器处理人类语言的研究领域 | LLM 是 NLP 的当前主力实现方式 | 以为"NLP = LLM",其实 NLP 还包括分词、句法、词向量、知识图谱等更多分支 |
| 深度学习(DL) | 用多层神经网络做表征学习的技术家族 | LLM 是深度学习在文本上的应用形态之一 | 以为"深度学习 = LLM",其实 DL 还包括 CNN、RNN、强化学习智能体等 |
| 统计语言模型 | 用统计方法估计文本概率(N-gram 等) | LLM 的直系祖先,思想继承、实现换代 | 以为两者无关,其实"预测下一个词"一脉相承 |
| 基础模型(Foundation Model) | 在大规模数据上预训练、可适配多任务的大模型(含非文本) | LLM 是基础模型的文本分支(还有视觉、多模态等) | 把"基础模型"当作 LLM 的同义词 |
| Agent(智能体) | 由 LLM 做大脑、配工具与规划循环的系统 | LLM 是 Agent 的核心组件/基座 | 以为"用 LLM 就等于做 Agent",其实 Agent 需要编排、工具与记忆 |
| RAG 系统 | LLM + 外部检索,用检索结果辅助生成 | RAG 是 LLM 的一种增强范式 | 以为 RAG 是另一类模型,其实它是围绕 LLM 搭建的系统 |
| 通用人工智能(AGI) | 在所有任务上达到人类水平的一般智能 | LLM 是通向 AGI 的候选路线之一,远非 AGI 本身 | 把"ChatGPT 很聪明"等同于"AGI 已实现" |
一个判断工具
遇到概念混淆,先问三个问题:它是模型还是系统?它是家族还是个体?它想解决什么问题? LLM 是"模型、个体、语言任务";Agent 是"系统、由 LLM 组成、任务执行";DL 是"家族、LLM 属于它";AGI 是"目标、不是具体产品"。三个问题问完,大多数混淆自动消解。
二、LLM vs 传统 NLP
1. 范式差异
传统 NLP 是"任务分解 + 特征工程":把语言理解拆成分词、词性标注、句法分析、命名实体识别等子任务,每个任务单独建模、单独标注数据。LLM 是"统一范式 + 少样本适配":一个模型、一套预训练目标,下游任务靠提示(prompting)、少样本示例甚至零样本完成。
| 维度 | 传统 NLP | LLM 时代 |
|---|---|---|
| 任务形态 | 每个任务一个模型 | 一个模型解决几乎所有文本任务 |
| 数据依赖 | 每个任务需要大量标注数据 | 预训练用无标注语料,下游少标注或不标注 |
| 语言单元 | 词(word)为主 | token(子词)为主 |
| 上下文 | 局部特征(窗口、句法树) | 长上下文 + 注意力 |
| 代表方法 | CRF、SVM、LSTM+Attention、BERT 微调 | 生成式预训练 + 提示/对齐 |
| 升级方式 | 换模型、加特征 | 加数据、加参数、换提示 |
传统 NLP 的成果没有被丢弃,而是被吸收进了 LLM 的"隐形知识":分词、句法、实体识别这些能力,预训练后的 LLM 大多内化了。如今仍在独立的传统 NLP 工作,主要存在于三类场景:资源稀缺语言、需要精确结构化输出的任务(表格抽取、信息检索打分)、以及对可解释性有硬要求的场景。
一个具体的例子能说明差异。命名实体识别(NER)在传统 NLP 中是典型的序列标注任务:用 BIO 标签把"小明昨天去了北京"标成"小明=人名、北京=地点",需要专门的标注数据与模型。而 LLM 的用法是直接提问:"提取这句话中的人名和地名",模型几秒给出答案,且能零样本适配新的实体类型。代价是:传统方法稳定、可控、便宜,LLM 灵活、通用、但偶尔漂移。生产系统常见搭配是"LLM 打底 + 规则/小模型兜底"。
2. 为什么说"LLM 成了 2020 年代 NLP 的代名词"
一个值得注意的现象:2020 年之后,主流 NLP 会议(ACL、EMNLP、NAACL)的投稿主题、工业界岗位、学术招聘,几乎都被 LLM 主导。原因有三:
- 能力覆盖面:LLM 在绝大多数语言任务上的表现追平或超过了此前的专用模型,旧任务清单被"一个模型通吃"替代;
- 工程统一:团队只需维护一条"数据 + 预训练 + 对齐 + 推理"流水线,而不是为每个任务各维护一套标注与模型(对比总体架构解剖中的生命周期);
- 人才市场:岗位 JD 从"NLP 工程师"转向"大模型算法工程师",技能树从"特征工程"转向"提示、微调、评测、RAG/Agent 编排",见求职与 JD。
用词要小心
"LLM 取代了 NLP"是夸张的说法。更准确的是:LLM 取代了"NLP 领域的大部分应用层实现",但 NLP 作为一门研究语言本质的学科(语言结构、语义、语用、多语种、低资源)依然独立存在——只是它的多数产出如今以"给 LLM 提供数据、评测与约束"的形式出现。
三、LLM vs 深度学习
1. 深度学习是一个大得多的家族
深度学习(Deep Learning, DL)是用多层神经网络从数据中自动学习表征的技术家族。它的成员包括:
| DL 分支 | 代表 | 处理对象 |
|---|---|---|
| 卷积网络(CNN) | ResNet、EfficientNet | 图像、视频、语音 |
| 循环网络(RNN/LSTM/GRU) | 早期机器翻译、语音识别 | 序列数据 |
| Transformer | GPT、BERT、Llama、视觉 Transformer | 文本为主,扩展到视觉/音频/多模态 |
| 生成式模型 | GAN、扩散模型(Stable Diffusion) | 图像、音频生成 |
| 强化学习(RL) | AlphaGo、RLHF 中的 PPO | 决策序列 |
LLM 是深度学习的一个应用形态:它使用深度学习的工具(神经网络、反向传播、大规模分布式训练),但它有自己的范式特征——预训练语言建模 + 对齐。反过来,深度学习的大部分内容与 LLM 无关:图像分类、目标检测、语音合成、推荐系统、强化学习博弈,都不是 LLM。
text
人工智能(AI)
└─ 机器学习(ML)
├─ 传统方法:决策树、SVM、贝叶斯
└─ 深度学习(DL)
├─ CNN → 视觉
├─ RNN → 序列
├─ Transformer
│ ├─ 文本预训练 → 大语言模型(LLM)★ 本手册主题
│ ├─ 视觉 Transformer(ViT)→ 视觉
│ └─ 多模态 Transformer → 多模态大模型
├─ 扩散模型 → 图像生成
└─ 强化学习 → 游戏、控制2. 一个易被忽视的继承点
LLM 的几乎所有"底层肌肉"都来自深度学习的历史积累:反向传播(1980s)、词嵌入(2013 Word2Vec)、注意力机制(2014 机器翻译引入)、残差连接与批归一化(2015 ResNet)、序列建模(LSTM)。LLM 不是 DL 的例外,而是 DL 在"语言建模 + 超大规模"方向上的集大成者。理解这一点,就能理解为什么很多深度学习时代的技巧(学习率调度、梯度裁剪、分布式并行)在大模型训练中原封不动地复用,见预训练。
四、LLM vs 统计语言模型
统计语言模型是 LLM 的直系祖先,二者共享同一个核心目标:估计文本序列的概率。区别在实现与规模:
| 维度 | 统计语言模型(N-gram 等) | 神经语言模型 / LLM |
|---|---|---|
| 概率来源 | 语料中 n-gram 的计数频率 | 神经网络对下一个 token 的预测 |
| 泛化 | 未出现的 n-gram 概率为零(需平滑) | 词在向量空间中共享表征,可泛化 |
| 上下文长度 | n(通常 ≤ 5) | 数千到数十万 token |
| 参数量 | 词表×n 的计数表 | 十亿级到千亿级 |
| 本质能力 | 局部共现统计 | 在预测下一个词的代理任务中压缩世界知识 |
统计语言模型"预测下一个词"的思想被 LLM 完整继承,这正是语言建模与演进简史反复强调的连续性。区别只在于:统计模型是在"数数",神经模型是在"理解"——前者记住共现频率,后者把频率压缩成可组合的知识表征。
五、LLM vs 基础模型(Foundation Model)
"基础模型"是 2021 年斯坦福团队在论文 On the Opportunities and Risks of Foundation Models 中提出的概念:在大规模数据上预训练、可作为无数下游任务起点的模型。它与 LLM 的关系是属种关系:
text
基础模型(Foundation Models)
├─ 文本:大语言模型(LLM)—— GPT、Llama、Qwen、DeepSeek
├─ 视觉:CLIP、SAM、视觉 Transformer
├─ 音频:语音识别/生成基础模型
├─ 代码:Codex、CodeLlama(通常也算 LLM 的变体)
└─ 多模态:GPT-4o、Gemini、LLaVA(见[多模态大模型](/case-studies/multimodal-llm))关键区别:基础模型是"能力供给者"(提供通用的表征与生成能力),LLM 是其中以语言为核心、目前最成熟的一个分支。日常口语中两者经常混用("基础模型公司"往往指做 LLM 的公司),但在严格讨论时,记住"LLM ⊂ 基础模型"即可。基础模型共享的三个特征——预训练、规模、可适配性——正是什么是大语言模型中"关键构成要素"的出处。
六、LLM vs Agent:LLM + 工具 = Agent 系统的基座
这是概念辨析中最容易出错的点:LLM 和 Agent 不是同一层的东西。
- LLM 是模型:接收文本、输出文本,没有"行动"的能力,不能查网页、不能调用 API、不能记日志(除非通过文本模拟)。
- Agent 是系统:以 LLM 为"大脑",外接工具(function calling)、记忆、规划循环,形成一个"感知 → 思考 → 行动 → 观察"的闭环。
text
Agent 系统的典型循环(ReAct 模式):
用户请求 ──→ LLM(大脑)──→ 决定调用工具
↑ │
│ 工具执行(搜索/代码/API)
│ │
└── 观察结果 ─────┘
(把工具输出喂回 LLM,继续推理)| 维度 | LLM | 基于 LLM 的 Agent |
|---|---|---|
| 本质 | 单一模型 | 模型 + 工具 + 记忆 + 控制循环 |
| 是否行动 | 只输出文本 | 可调用外部工具、执行动作 |
| 是否有状态 | 无(每次独立) | 有记忆(对话历史/长期记忆) |
| 出错影响 | 输出不对 | 动作不对,可能引发连锁后果 |
| 代表 | GPT-4、Llama | AutoGPT、Devin、Manus 等 |
一句话记法
"LLM 是大脑,Agent 是大脑+手+脚+记事本"。没有 LLM,Agent 没有推理核心;没有工具与循环,LLM 只是会说话的模型。Agent 的完整展开见基于 LLM 的 Agent;它与"智能体手册"的边界、风险(提示注入、失控、成本)在该页有专门说明。
七、LLM vs RAG 系统
RAG(Retrieval-Augmented Generation,检索增强生成)是围绕 LLM 搭建的一种系统范式,不是另一类模型:它把 LLM 的生成能力与外部知识库的检索能力组合起来。
text
RAG 流程(简化):
用户问题 ──→ 检索器:在知识库/向量库中找到相关片段
│
└──→ 提示组装:问题 + 相关片段 ──→ LLM ──→ 带依据的回答| 维度 | 裸 LLM | RAG 系统 |
|---|---|---|
| 知识来源 | 预训练时学到的静态知识 | 动态注入外部文档/数据库 |
| 知识时效 | 训练截止日期之前 | 可随时更新索引 |
| 可溯源 | 难(不知道知识来自哪) | 可给出检索依据(引用来源) |
| 幻觉缓解 | 有限 | 显著(答案被检索内容约束) |
| 适用 | 通用问答、创作 | 私有知识、实时信息、需要引用的场景 |
关键辨析:RAG 不改变 LLM 本身(模型权重不变),改变的是"给模型喂什么输入"。它与微调(改模型)是两条互补的适配路线,取舍详见RAG与上下文与长文本中的"长上下文 vs RAG"权衡。
八、LLM vs AGI:为什么"LLM ≠ 通用智能"
这是最重要也最容易被炒作带偏的辨析。AGI(通用人工智能)指的是在所有认知任务上达到或超过人类水平的通用智能。LLM 离它还有多重结构性距离:
| 维度 | LLM 现状 | AGI 的要求 | 差距 |
|---|---|---|---|
| 任务范围 | 语言为主,扩展至多模态 | 语言+感知+行动+规划+社交… | 大(见多模态大模型的边界) |
| 世界模型 | 语言统计中隐含的"影子世界" | 对物理世界因果的真实建模 | 大 |
| 学习方式 | 一次性预训练 + 有限的持续学习 | 终身学习、样本高效 | 大 |
| 主动性与目标 | 无内在目标,只会"遵从指令" | 自主设定并追求目标 | 大 |
| 可靠性 | 幻觉、不稳定、无校准的自信 | 高度可靠、可验证 | 大 |
| 对齐 | 帮助/诚实/安全仍需人工调教 | 价值对齐内化 | 待解 |
为什么会有"LLM 接近 AGI"的错觉
因为语言是人类思维的最大载体,一个在语言上表现优秀且能接工具的模型,容易让人产生"它有思想"的错觉。但语言流利 ≠ 理解(模型可以完美模拟观点而不持有观点),任务全能 ≠ 通用(它是"样本覆盖下的模式匹配",不是"任意新任务的适应性智能")。把 LLM 的能力当成 AGI 的前兆可以(这是合理的乐观),把它当成 AGI 的已实现(这是危险的误判)——安全后果见安全与风险。
九、为什么 2020 年代 LLM 成了 NLP 的代名词
回到开篇的观察,用一句话收束:LLM 之所以在 2020 年代"接管"NLP,不是因为它消灭了 NLP 的问题,而是因为它提供了一条统一的、可规模化的解决路径——预训练 + 对齐 + 提示适配。这条路径的三个优势(能力覆盖面广、工程统一、人才与生态集中)压倒了传统"任务专用模型"路线。但这不意味着边界消失:
- 在系统层,LLM 只是组件——Agent、RAG、评测、部署各自仍是完整工程,见总体架构解剖;
- 在研究层,NLP 的开放问题(低资源语言、长文档、忠实性、可解释性)不仅没消失,反而成为 LLM 时代的新课题,见前沿进展;
- 在能力层,LLM 与 AGI 之间隔着的不是"再大一点",而是学习方式、世界模型与可靠性的质变。
一张图收尾
DL ⊃ Transformer ⊃ LLM ⊂ 基础模型;LLM 是 NLP 的实现主力;LLM + 工具 + 记忆 = Agent 基座;LLM + 检索 = RAG 系统;LLM 是通向 AGI 的候选路线之一。 记住这四句话,概念坐标系就立住了。
十、综合判断题:十个场景
把辨析落到场景,检验是否真的分清了这些概念。每个场景先自己判断属于哪一类、该用什么技术,再对答案:
| 场景 | 正确归类 | 判据 |
|---|---|---|
| 做一个情感分析 API | NLP 任务,可用 LLM 提示或专用小模型 | 任务定义是 NLP 的,实现手段可以多种 |
| 用 BERT 做文本向量化检索 | 编码器模型,属于深度学习而非 LLM(无生成能力) | 看架构与训练目标,不是看"深度" |
| 让模型上网查资料再回答 | RAG 或 Agent(LLM + 检索/工具) | 有外部动作 = 系统而非裸模型 |
| 让模型自己规划任务并操作软件 | Agent | 有规划循环与工具执行 |
| 判断"模型是否终将超越人类" | AGI 讨论 | 涉及一般智能的定义,不是具体工程 |
| 用 n-gram 统计文本 | 统计语言模型 | 计数频率,无神经网络 |
| 微调 Llama 做法律问答 | LLM + 微调 | 模型本身是 LLM,微调是适配手段 |
| 图像 + 文本联合问答 | 多模态基础模型 | 超出纯 LLM,见多模态大模型 |
| 对话机器人(不接外部工具) | LLM(对话形态) | 无外部动作,仍是模型应用 |
| 公司说自己是"做基础模型的" | 基础模型 / LLM 厂商 | 属种关系,口语混用正常 |
做题的收获:多数场景不是"要么 LLM、要么别的",而是"LLM 处于哪一层、配什么系统"。能准确说出"这个场景 = LLM + 某种系统",概念辨析就毕业了。
延伸阅读
- 什么是大语言模型 —— 本页辨析的"本体",定义三层面与能力盘点
- 演进简史 —— 统计语言模型 → 神经语言模型 → 大模型的三次范式跃迁
- 语言建模 —— LLM 与统计语言模型共享的"预测下一个词"地基
- 基于 LLM 的 Agent —— "LLM 是大脑"的完整系统化展开
- RAG:检索增强生成 —— LLM + 检索的系统范式与微调/长上下文的取舍
- 安全与风险 —— "LLM 不是通用智能"在安全层面的含义
参考资料
- Bommasani et al. On the Opportunities and Risks of Foundation Models(2021) —— "基础模型"概念的原始出处,定义了预训练 + 规模 + 可适配三大特征
- Brown et al. Language Models are Few-Shot Learners(GPT-3,2020) —— "语言模型即任务解决者"的里程碑,少样本范式起点
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models(2022) —— 推理 + 行动交错,Agent 循环的典型范式
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(2020) —— RAG 原始论文,"LLM + 检索"的来源
- Bengio et al. A Neural Probabilistic Language Model(2003) —— 神经语言模型开山之作,LLM 与统计语言模型的分水岭
- OpenAI · 关于 AGI 的定义与讨论(官方文档) —— 以 OpenAI 章程中对 AGI 的谨慎定义为例,说明行业如何界定"通用智能"