Skip to content

LLM 与相邻概念

本页速览 大语言模型与 NLP、深度学习、统计语言模型、基础模型、Agent、RAG 系统、AGI 的边界辨析:谁是谁的子集,谁是谁的应用形态,哪些"通用智能"的期望其实落空。

LLM 与相邻概念

一句话定位:大语言模型是深度学习家族里、以语言建模为训练范式的一种具体应用形态;它上承 NLP 的全部遗产,下启 Agent 与 RAG 等新系统,但它的边界远小于"通用人工智能"。本文把 LLM 放进概念坐标系里,逐个厘清"谁包含谁、谁依赖谁、谁被误认为谁"。

一、一张总表

概念一句话与 LLM 的关系常见误解
自然语言处理(NLP)让机器处理人类语言的研究领域LLM 是 NLP 的当前主力实现方式以为"NLP = LLM",其实 NLP 还包括分词、句法、词向量、知识图谱等更多分支
深度学习(DL)用多层神经网络做表征学习的技术家族LLM 是深度学习在文本上的应用形态之一以为"深度学习 = LLM",其实 DL 还包括 CNN、RNN、强化学习智能体等
统计语言模型用统计方法估计文本概率(N-gram 等)LLM 的直系祖先,思想继承、实现换代以为两者无关,其实"预测下一个词"一脉相承
基础模型(Foundation Model)在大规模数据上预训练、可适配多任务的大模型(含非文本)LLM 是基础模型的文本分支(还有视觉、多模态等)把"基础模型"当作 LLM 的同义词
Agent(智能体)由 LLM 做大脑、配工具与规划循环的系统LLM 是 Agent 的核心组件/基座以为"用 LLM 就等于做 Agent",其实 Agent 需要编排、工具与记忆
RAG 系统LLM + 外部检索,用检索结果辅助生成RAG 是 LLM 的一种增强范式以为 RAG 是另一类模型,其实它是围绕 LLM 搭建的系统
通用人工智能(AGI)在所有任务上达到人类水平的一般智能LLM 是通向 AGI 的候选路线之一,远非 AGI 本身把"ChatGPT 很聪明"等同于"AGI 已实现"

一个判断工具

遇到概念混淆,先问三个问题:它是模型还是系统?它是家族还是个体?它想解决什么问题? LLM 是"模型、个体、语言任务";Agent 是"系统、由 LLM 组成、任务执行";DL 是"家族、LLM 属于它";AGI 是"目标、不是具体产品"。三个问题问完,大多数混淆自动消解。

二、LLM vs 传统 NLP

1. 范式差异

传统 NLP 是"任务分解 + 特征工程":把语言理解拆成分词、词性标注、句法分析、命名实体识别等子任务,每个任务单独建模、单独标注数据。LLM 是"统一范式 + 少样本适配":一个模型、一套预训练目标,下游任务靠提示(prompting)、少样本示例甚至零样本完成。

维度传统 NLPLLM 时代
任务形态每个任务一个模型一个模型解决几乎所有文本任务
数据依赖每个任务需要大量标注数据预训练用无标注语料,下游少标注或不标注
语言单元词(word)为主token(子词)为主
上下文局部特征(窗口、句法树)长上下文 + 注意力
代表方法CRF、SVM、LSTM+Attention、BERT 微调生成式预训练 + 提示/对齐
升级方式换模型、加特征加数据、加参数、换提示

传统 NLP 的成果没有被丢弃,而是被吸收进了 LLM 的"隐形知识":分词、句法、实体识别这些能力,预训练后的 LLM 大多内化了。如今仍在独立的传统 NLP 工作,主要存在于三类场景:资源稀缺语言、需要精确结构化输出的任务(表格抽取、信息检索打分)、以及对可解释性有硬要求的场景

一个具体的例子能说明差异。命名实体识别(NER)在传统 NLP 中是典型的序列标注任务:用 BIO 标签把"小明昨天去了北京"标成"小明=人名、北京=地点",需要专门的标注数据与模型。而 LLM 的用法是直接提问:"提取这句话中的人名和地名",模型几秒给出答案,且能零样本适配新的实体类型。代价是:传统方法稳定、可控、便宜,LLM 灵活、通用、但偶尔漂移。生产系统常见搭配是"LLM 打底 + 规则/小模型兜底"。

2. 为什么说"LLM 成了 2020 年代 NLP 的代名词"

一个值得注意的现象:2020 年之后,主流 NLP 会议(ACL、EMNLP、NAACL)的投稿主题、工业界岗位、学术招聘,几乎都被 LLM 主导。原因有三:

  1. 能力覆盖面:LLM 在绝大多数语言任务上的表现追平或超过了此前的专用模型,旧任务清单被"一个模型通吃"替代;
  2. 工程统一:团队只需维护一条"数据 + 预训练 + 对齐 + 推理"流水线,而不是为每个任务各维护一套标注与模型(对比总体架构解剖中的生命周期);
  3. 人才市场:岗位 JD 从"NLP 工程师"转向"大模型算法工程师",技能树从"特征工程"转向"提示、微调、评测、RAG/Agent 编排",见求职与 JD

用词要小心

"LLM 取代了 NLP"是夸张的说法。更准确的是:LLM 取代了"NLP 领域的大部分应用层实现",但 NLP 作为一门研究语言本质的学科(语言结构、语义、语用、多语种、低资源)依然独立存在——只是它的多数产出如今以"给 LLM 提供数据、评测与约束"的形式出现。

三、LLM vs 深度学习

1. 深度学习是一个大得多的家族

深度学习(Deep Learning, DL)是用多层神经网络从数据中自动学习表征的技术家族。它的成员包括:

DL 分支代表处理对象
卷积网络(CNN)ResNet、EfficientNet图像、视频、语音
循环网络(RNN/LSTM/GRU)早期机器翻译、语音识别序列数据
TransformerGPT、BERT、Llama、视觉 Transformer文本为主,扩展到视觉/音频/多模态
生成式模型GAN、扩散模型(Stable Diffusion)图像、音频生成
强化学习(RL)AlphaGo、RLHF 中的 PPO决策序列

LLM 是深度学习的一个应用形态:它使用深度学习的工具(神经网络、反向传播、大规模分布式训练),但它有自己的范式特征——预训练语言建模 + 对齐。反过来,深度学习的大部分内容与 LLM 无关:图像分类、目标检测、语音合成、推荐系统、强化学习博弈,都不是 LLM。

text
人工智能(AI)
└─ 机器学习(ML)
   ├─ 传统方法:决策树、SVM、贝叶斯
   └─ 深度学习(DL)
      ├─ CNN → 视觉
      ├─ RNN → 序列
      ├─ Transformer
      │  ├─ 文本预训练 → 大语言模型(LLM)★ 本手册主题
      │  ├─ 视觉 Transformer(ViT)→ 视觉
      │  └─ 多模态 Transformer → 多模态大模型
      ├─ 扩散模型 → 图像生成
      └─ 强化学习 → 游戏、控制

2. 一个易被忽视的继承点

LLM 的几乎所有"底层肌肉"都来自深度学习的历史积累:反向传播(1980s)、词嵌入(2013 Word2Vec)、注意力机制(2014 机器翻译引入)、残差连接与批归一化(2015 ResNet)、序列建模(LSTM)。LLM 不是 DL 的例外,而是 DL 在"语言建模 + 超大规模"方向上的集大成者。理解这一点,就能理解为什么很多深度学习时代的技巧(学习率调度、梯度裁剪、分布式并行)在大模型训练中原封不动地复用,见预训练

四、LLM vs 统计语言模型

统计语言模型是 LLM 的直系祖先,二者共享同一个核心目标:估计文本序列的概率。区别在实现与规模:

维度统计语言模型(N-gram 等)神经语言模型 / LLM
概率来源语料中 n-gram 的计数频率神经网络对下一个 token 的预测
泛化未出现的 n-gram 概率为零(需平滑)词在向量空间中共享表征,可泛化
上下文长度n(通常 ≤ 5)数千到数十万 token
参数量词表×n 的计数表十亿级到千亿级
本质能力局部共现统计在预测下一个词的代理任务中压缩世界知识

统计语言模型"预测下一个词"的思想被 LLM 完整继承,这正是语言建模演进简史反复强调的连续性。区别只在于:统计模型是在"数数",神经模型是在"理解"——前者记住共现频率,后者把频率压缩成可组合的知识表征。

五、LLM vs 基础模型(Foundation Model)

"基础模型"是 2021 年斯坦福团队在论文 On the Opportunities and Risks of Foundation Models 中提出的概念:在大规模数据上预训练、可作为无数下游任务起点的模型。它与 LLM 的关系是属种关系

text
基础模型(Foundation Models)
├─ 文本:大语言模型(LLM)—— GPT、Llama、Qwen、DeepSeek
├─ 视觉:CLIP、SAM、视觉 Transformer
├─ 音频:语音识别/生成基础模型
├─ 代码:Codex、CodeLlama(通常也算 LLM 的变体)
└─ 多模态:GPT-4o、Gemini、LLaVA(见[多模态大模型](/case-studies/multimodal-llm))

关键区别:基础模型是"能力供给者"(提供通用的表征与生成能力),LLM 是其中以语言为核心、目前最成熟的一个分支。日常口语中两者经常混用("基础模型公司"往往指做 LLM 的公司),但在严格讨论时,记住"LLM ⊂ 基础模型"即可。基础模型共享的三个特征——预训练、规模、可适配性——正是什么是大语言模型中"关键构成要素"的出处。

六、LLM vs Agent:LLM + 工具 = Agent 系统的基座

这是概念辨析中最容易出错的点:LLM 和 Agent 不是同一层的东西

  • LLM 是模型:接收文本、输出文本,没有"行动"的能力,不能查网页、不能调用 API、不能记日志(除非通过文本模拟)。
  • Agent 是系统:以 LLM 为"大脑",外接工具(function calling)、记忆、规划循环,形成一个"感知 → 思考 → 行动 → 观察"的闭环。
text
Agent 系统的典型循环(ReAct 模式):

用户请求 ──→ LLM(大脑)──→ 决定调用工具
                ↑                 │
                │             工具执行(搜索/代码/API)
                │                 │
                └── 观察结果 ─────┘
              (把工具输出喂回 LLM,继续推理)
维度LLM基于 LLM 的 Agent
本质单一模型模型 + 工具 + 记忆 + 控制循环
是否行动只输出文本可调用外部工具、执行动作
是否有状态无(每次独立)有记忆(对话历史/长期记忆)
出错影响输出不对动作不对,可能引发连锁后果
代表GPT-4、LlamaAutoGPT、Devin、Manus 等

一句话记法

"LLM 是大脑,Agent 是大脑+手+脚+记事本"。没有 LLM,Agent 没有推理核心;没有工具与循环,LLM 只是会说话的模型。Agent 的完整展开见基于 LLM 的 Agent;它与"智能体手册"的边界、风险(提示注入、失控、成本)在该页有专门说明。

七、LLM vs RAG 系统

RAG(Retrieval-Augmented Generation,检索增强生成)是围绕 LLM 搭建的一种系统范式,不是另一类模型:它把 LLM 的生成能力与外部知识库的检索能力组合起来。

text
RAG 流程(简化):
用户问题 ──→ 检索器:在知识库/向量库中找到相关片段

                  └──→ 提示组装:问题 + 相关片段 ──→ LLM ──→ 带依据的回答
维度裸 LLMRAG 系统
知识来源预训练时学到的静态知识动态注入外部文档/数据库
知识时效训练截止日期之前可随时更新索引
可溯源难(不知道知识来自哪)可给出检索依据(引用来源)
幻觉缓解有限显著(答案被检索内容约束)
适用通用问答、创作私有知识、实时信息、需要引用的场景

关键辨析:RAG 不改变 LLM 本身(模型权重不变),改变的是"给模型喂什么输入"。它与微调(改模型)是两条互补的适配路线,取舍详见RAG上下文与长文本中的"长上下文 vs RAG"权衡。

八、LLM vs AGI:为什么"LLM ≠ 通用智能"

这是最重要也最容易被炒作带偏的辨析。AGI(通用人工智能)指的是在所有认知任务上达到或超过人类水平的通用智能。LLM 离它还有多重结构性距离:

维度LLM 现状AGI 的要求差距
任务范围语言为主,扩展至多模态语言+感知+行动+规划+社交…大(见多模态大模型的边界)
世界模型语言统计中隐含的"影子世界"对物理世界因果的真实建模
学习方式一次性预训练 + 有限的持续学习终身学习、样本高效
主动性与目标无内在目标,只会"遵从指令"自主设定并追求目标
可靠性幻觉、不稳定、无校准的自信高度可靠、可验证
对齐帮助/诚实/安全仍需人工调教价值对齐内化待解

为什么会有"LLM 接近 AGI"的错觉

因为语言是人类思维的最大载体,一个在语言上表现优秀且能接工具的模型,容易让人产生"它有思想"的错觉。但语言流利 ≠ 理解(模型可以完美模拟观点而不持有观点),任务全能 ≠ 通用(它是"样本覆盖下的模式匹配",不是"任意新任务的适应性智能")。把 LLM 的能力当成 AGI 的前兆可以(这是合理的乐观),把它当成 AGI 的已实现(这是危险的误判)——安全后果见安全与风险

九、为什么 2020 年代 LLM 成了 NLP 的代名词

回到开篇的观察,用一句话收束:LLM 之所以在 2020 年代"接管"NLP,不是因为它消灭了 NLP 的问题,而是因为它提供了一条统一的、可规模化的解决路径——预训练 + 对齐 + 提示适配。这条路径的三个优势(能力覆盖面广、工程统一、人才与生态集中)压倒了传统"任务专用模型"路线。但这不意味着边界消失:

  • 系统层,LLM 只是组件——Agent、RAG、评测、部署各自仍是完整工程,见总体架构解剖
  • 研究层,NLP 的开放问题(低资源语言、长文档、忠实性、可解释性)不仅没消失,反而成为 LLM 时代的新课题,见前沿进展
  • 能力层,LLM 与 AGI 之间隔着的不是"再大一点",而是学习方式、世界模型与可靠性的质变。

一张图收尾

DL ⊃ Transformer ⊃ LLM ⊂ 基础模型;LLM 是 NLP 的实现主力;LLM + 工具 + 记忆 = Agent 基座;LLM + 检索 = RAG 系统;LLM 是通向 AGI 的候选路线之一。 记住这四句话,概念坐标系就立住了。

十、综合判断题:十个场景

把辨析落到场景,检验是否真的分清了这些概念。每个场景先自己判断属于哪一类、该用什么技术,再对答案:

场景正确归类判据
做一个情感分析 APINLP 任务,可用 LLM 提示或专用小模型任务定义是 NLP 的,实现手段可以多种
用 BERT 做文本向量化检索编码器模型,属于深度学习而非 LLM(无生成能力)看架构与训练目标,不是看"深度"
让模型上网查资料再回答RAG 或 Agent(LLM + 检索/工具)有外部动作 = 系统而非裸模型
让模型自己规划任务并操作软件Agent有规划循环与工具执行
判断"模型是否终将超越人类"AGI 讨论涉及一般智能的定义,不是具体工程
用 n-gram 统计文本统计语言模型计数频率,无神经网络
微调 Llama 做法律问答LLM + 微调模型本身是 LLM,微调是适配手段
图像 + 文本联合问答多模态基础模型超出纯 LLM,见多模态大模型
对话机器人(不接外部工具)LLM(对话形态)无外部动作,仍是模型应用
公司说自己是"做基础模型的"基础模型 / LLM 厂商属种关系,口语混用正常

做题的收获:多数场景不是"要么 LLM、要么别的",而是"LLM 处于哪一层、配什么系统"。能准确说出"这个场景 = LLM + 某种系统",概念辨析就毕业了。

延伸阅读

参考资料