外观
术语表
本页收录大语言模型领域的核心术语,按主题分为八组:基础与范式、架构与机制、分词与表示、训练与对齐、推理与采样、推理优化与部署、应用、评测与安全。每条给出中文名 + 英文全称 + 一句话解释,并尽量附带站内关联页面。文末附"易混淆辨析"。
使用建议
术语不必按顺序读。建议先读「基础与范式」建立词汇骨架,然后按需查阅。加粗的站内链接指向该术语的深入讨论页;遇到英文缩写先看括号里的全称。
一、基础与范式
大语言模型(large language model, LLM) 基于海量文本、以"预测下一个词"为核心任务预训练、参数量通常在十亿级以上的神经网络语言模型,其能力来自规模、数据与对齐三者的叠加。详见什么是大语言模型。
语言模型(language model) 对文本序列概率分布 P(w₁…wₙ) 建模的模型,以"预测下一个词"为代理任务;从 N-gram、神经语言模型到 LLM 一脉相承。详见语言建模:下一词预测范式。
下一词预测(next-token prediction) 把序列概率分解为逐 token 条件概率之积、训练时最大化真实下一个 token 概率的目标;预训练与推理生成共用同一套机制。详见语言建模。
预训练(pretraining) 在海量无标注语料上训练基础语言能力的阶段,自监督、无标签,只需"下一个词预测"。详见预训练:数据与目标。
后训练(post-training) 预训练之后所有阶段的统称:指令微调(SFT)、偏好对齐(RLHF/DPO)等,把"会续写文本"的模型改造成"会听从指令"的助手。详见对齐。
微调(fine-tuning) 在预训练权重基础上继续训练,使模型适配特定任务、风格或领域;分为全参微调与参数高效微调(PEFT)。详见微调:SFT 与参数高效微调。
对齐(alignment) 让模型输出符合人类意图(帮助性、诚实性、安全性)的过程,主流方法为 RLHF 与 DPO。详见对齐:RLHF 与 DPO。
上下文学习(in-context learning, ICL) 不更新权重、仅通过提示中的指令与示例让模型现场完成任务的能力,是"少样本"背后的核心机制。详见提示工程。
零样本 / 少样本(zero-shot / few-shot) 不给示例直接提问(零样本)或给少量示例再提问(少样本)的任务完成方式;GPT-3 首次系统证明了大规模模型的少样本能力。详见提示工程。
规模法则(scaling law) 模型损失随参数量、数据量、计算量按幂律下降的实证规律;Chinchilla 进一步给出"参数与数据约 1:20"的计算最优配比。详见规模法则。
涌现能力(emergent ability) 小模型不具备、跨过某规模阈值后突然出现的能力(算术、代码、思维链等);其是否"真涌现"存在争议,可能与评测指标选择有关。详见规模法则。
幻觉(hallucination) 模型生成看似合理但并非事实的内容。模型学的是"像人话的序列"而非"事实数据库",缓解手段包括 RAG、引用来源、人工复核。详见幻觉:成因与缓解。
二、架构与机制
Transformer 2017 年提出的完全基于注意力、抛弃循环的序列架构,并行性强、长程依赖建模好,是 BERT、GPT 与一切 LLM 的地基。详见Transformer 架构详解。
注意力机制(attention) 按"相关性权重"聚合序列信息的机制:对查询 q,用 q 与各键 k 的点积(除以 √d 缩放)做 softmax 得到权重,再对值 v 加权求和。详见Transformer 架构详解。
自注意力(self-attention) 查询、键、值均来自同一序列的注意力,让每个 token 都能关注上下文中的其他 token;多头注意力并行捕捉不同子空间的关系。详见Transformer。
QKV 注意力计算的三个向量角色:查询(query)"我要找什么"、键(key)"我能匹配什么"、值(value)"匹配上了给出什么"。详见Transformer。
位置编码(positional encoding) 给不含顺序信息的并行注意力补充 token 位置的手段:正余弦、可学习向量、相对位置编码等;RoPE 是当前主流。详见Transformer。
RoPE(旋转位置编码) 把位置信息编码为旋转矩阵作用在 Q/K 上的位置编码,对长文本外推性较好,Llama、Qwen、DeepSeek 等主流模型标配。详见上下文与长文本。
KV Cache(键值缓存) 自回归解码时缓存历史 token 的键值对、避免重复计算注意力的推理优化;它让"每生成一个 token 只做一次注意力",同时也是显存与长上下文的主要瓶颈。详见推理基础:自回归与采样。
MoE(混合专家,mixture of experts) 把 FFN 替换为多个"专家"+ 路由器的稀疏架构,每个 token 只激活部分专家,在总参数量不变的前提下显著降低计算量。详见MoE 稀疏专家模型。
上下文窗口(context window) 模型一次能处理的输入 + 输出最大 token 数;从 GPT-2 的 1024 到 Gemini 的 100 万 token,是 2023-2025 年增长最快的规格之一。详见上下文与长文本。
三、分词与表示
分词器(tokenizer) 把文本切成 token 序列(以及逆操作)的组件,主流算法为 BPE、WordPiece、Unigram、SentencePiece。详见分词与词表。
Token(词元) 模型处理文本的基本单位,约 0.7 个英文词或 1 个汉字;计费、上下文窗口都以 token 计。详见分词与词表。
BPE(字节对编码,byte-pair encoding) 从字符/字节开始反复合并最高频相邻对的子词分词算法,GPT 系列的标准分词方法,词表规模从数千到约 10 万不等。详见分词与词表。
嵌入(embedding) 把离散 token(或任意对象)映射为稠密向量的表示层,语义相近的对象向量相近;是向量检索与"向量数据库"的基础。详见分词与词表。
词表(vocabulary) 分词器可产生的全部 token 集合,决定模型的最小语言单位与词表开销;如 GPT-2 约 5 万、Llama 3.2 万、GPT-4 约 10 万。详见分词与词表。
四、训练与对齐
SFT(监督微调,supervised fine-tuning) 用"指令-回答"对做监督学习,让模型学会遵循指令、匹配目标格式;是 RLHF 流程的第一步,也可独立使用。详见微调。
RLHF(基于人类反馈的强化学习) InstructGPT 开创的三步流程:SFT → 用人类偏好训练奖励模型 → 用 PPO 强化学习优化策略,让模型行为对齐人类偏好。详见对齐。
奖励模型(reward model, RM) 对人类偏好数据训练的打分模型,在 RLHF 中为策略输出提供奖励信号;打分能力决定对齐效果上限。详见对齐。
PPO(近端策略优化) RLHF 常用的强化学习算法,通过裁剪策略更新幅度保证训练稳定,并配合 KL 惩罚避免模型偏离 SFT 起点过远。详见对齐。
DPO(直接偏好优化) 直接用"好/坏回答"偏好对微调模型,把 RLHF 的奖励建模 + 强化学习两步合并进一个分类式损失,无需奖励模型,开源社区主流。详见对齐。
PEFT(参数高效微调,parameter-efficient fine-tuning) 只训练少量新增/额外参数、冻结原权重的一族微调方法:LoRA、QLoRA、Adapter、Prompt Tuning 等,大幅降低显存与存储成本。详见微调。
LoRA(低秩适配,low-rank adaptation) 把权重更新约束为低秩分解 W = W₀ + BA 的 PEFT 方法,只训练两个小矩阵,单卡可跑,是开源微调的事实标准。详见微调。
QLoRA 对基座做 4-bit 量化后再训练 LoRA 的变体,把 65B 模型的微调显存需求压到约 48GB,让小显存用户也能微调大模型。详见微调。
灾难性遗忘(catastrophic forgetting) 微调新任务/新知识时模型忘掉原有能力与知识的现象;缓解手段包括数据混合、低学习率、正则化与 LoRA 等参数化约束。详见微调。
五、推理与采样
自回归生成(autoregressive generation) 逐 token 预测、把新 token 拼回输入再预测下一个的生成方式,是 GPT 系列的核心,也是推理延迟的主要来源。详见推理基础。
贪心解码(greedy decoding) 每一步都取概率最高 token 的确定性解码,结果稳定但容易重复、平庸,适合事实类任务。详见推理基础。
温度(temperature) 采样前把 logits 除以 T 再 softmax 的参数:T 低更确定(事实/代码),T 高更多样(创意/头脑风暴),通常取 0.1~1.0。详见推理基础。
top-k 只从概率最高的 k 个 token 中采样的截断策略,与 top-p 组合使用以控制生成质量与多样性。详见推理基础。
top-p(核采样,nucleus sampling) 从累积概率达到 p 的最小候选集采样的策略,候选数量自适应,比 top-k 更符合分布形状,ChatGPT 默认风格。详见推理基础。
困惑度(perplexity) 语言模型对文本拟合程度的指标,等于每个 token 平均负对数似然的指数;值越低说明模型对该序列"越不意外"。详见语言建模。
思维链(chain-of-thought, CoT) 提示模型"先一步步推理再作答"的技术,显著提升数学、逻辑等推理任务表现;配合自一致性(self-consistency)采样更强。详见提示工程。
提示工程(prompt engineering) 设计指令、角色、示例、输出约束来引导模型输出的技术,分零样本提示、少样本提示、CoT 等模式。详见提示工程。
系统提示(system prompt) 对话结构中固定不变的顶层指令,用于设定角色、行为准则与全局约束,作用优先级通常高于用户消息。详见提示工程。
六、推理优化与部署
量化(quantization) 把权重/激活从 FP16/FP32 压缩到 INT8/INT4 的压缩手段,显存约减半、推理变快,精度损失通常可控,是部署优化的首选。详见部署与服务化。
GPTQ / AWQ / GGUF 三种主流量化方案:GPTQ 与 AWQ 面向 GPU 服务化推理,GGUF 是 llama.cpp 的量化格式(CPU/边缘设备友好)。详见部署。
vLLM 基于 PagedAttention 的高吞吐推理引擎,支持连续批处理、流式输出与 OpenAI 兼容接口,是开源部署的事实标准。详见部署与服务化。
连续批处理(continuous batching) 动态地把处于不同完成阶段的请求拼进同一批次、随时插入新请求,把 GPU 利用率从"等一批全部结束"中解放出来。详见部署。
PagedAttention 借鉴操作系统分页思想管理 KV cache 的显存方案,消除碎片、支持近乎零浪费的内存共享,是 vLLM 的核心创新。详见部署。
TTFT(首 token 延迟,time to first token) 从请求发出到收到第一个输出 token 的时间,主要取决于 prefill 阶段(对输入做并行注意力)的速度。详见部署。
TPOT(每输出 token 时间,time per output token) 生成一个输出 token 的平均时间,由 decode 阶段速度决定;TTFT 与 TPOT 共同决定交互体验。详见部署。
投机解码(speculative decoding) 用小模型草稿 + 大模型验证的方式,一次前向推进多个 token,在保持输出的同时无损加速推理。详见部署。
七、应用
RAG(检索增强生成,retrieval-augmented generation) 先检索再生成的范式:把私有、实时、长尾知识检索进上下文再让模型作答,缓解幻觉与知识截止问题,并支持溯源。详见RAG:检索增强生成。
Agent(智能体) 以 LLM 为大脑、通过"规划-行动-观察"循环调用工具完成多步任务的系统;工具调用与记忆是两大支柱。详见基于 LLM 的 Agent。
函数调用(function calling / tool calling) 让模型输出"调用哪个工具、传什么参数"的结构化结果,宿主执行工具后把结果回传给模型继续推理;Agent 的基座能力。详见基于 LLM 的 Agent。
MCP(模型上下文协议,Model Context Protocol) Anthropic 提出的开放协议,统一"LLM 应用 ↔ 工具/数据源"的连接方式,被视为"工具调用的 USB-C"接口标准。详见基于 LLM 的 Agent。
提示注入(prompt injection) 攻击者把恶意指令藏进模型会读取的外部内容(网页、文档、工具输出),诱导模型违背原定任务,是 LLM 应用特有的安全威胁。详见安全与风险。
结构化输出(structured output / JSON mode) 约束模型输出为合法 JSON、表格等格式的技术(few-shot 示例、schema 约束、JSON mode),是工程化落地的刚需。详见提示工程。
八、评测与安全
基准(benchmark) 由固定数据集与评分规则构成的评测集,用于横向比较模型能力;MMLU、GSM8K、HumanEval 是当前三大主流基准。详见评测与基准。
MMLU 覆盖 57 个学科、约 1.6 万道多选题的综合知识基准,长期是"大模型排行榜"的头号指标,也常被指责存在数据污染。详见评测与基准。
GSM8K 约 8 千道小学/初中数学应用题,测试链式推理与多步算术能力,配 CoT 提示使用。详见评测与基准。
HumanEval 164 道 Python 函数补全题,用 pass@k 评估代码生成能力,是"代码模型"的事实标尺。详见评测与基准。
pass@k 采样 k 次中至少一次通过测试的概率指标,反映模型能力上限而非单次表现,是代码与数学评测的标准指标。详见评测与基准。
LLM-as-a-judge 用强模型(如 GPT-4)给模型输出打分,替代人工评测的做法;便宜、可扩展,但有位置偏好、自我偏好、冗长偏好等偏差,需校准。详见评估实战。
数据污染(data contamination) 评测样本混入训练数据导致分数虚高的现象,是榜单可信度的最大威胁,防御手段包括去重与分阶段发布。详见评测与基准。
MT-Bench 80 道多轮开放问题 + 强模型打分的对话质量基准,是 Chatbot Arena 与 LLaMA 系对话模型评估的重要参考。详见评测与基准。
易混淆辨析
预训练 / 后训练 / 微调
预训练在海量无标注语料上训练通用语言能力(自监督、无标签);后训练是预训练之后的所有阶段,其中微调用带标签数据适配具体任务。对终端用户而言,"微调"常特指 SFT 与 LoRA 这类适配手段,与预训练(换模型)和后训练对齐(改行为)区分开。
SFT / RLHF / DPO
三者都是"让模型更听话"的对齐手段,层级不同:SFT 用指令-回答对做监督学习(教"怎么做");RLHF 通过奖励模型 + PPO 强化学习优化(教"什么好");DPO 是 RLHF 的简化替代,直接用偏好对微调,无需奖励模型,成本更低。
temperature / top-p / top-k
temperature 改变整个概率分布的陡峭程度(全局缩放 logits);top-k 硬性截断到概率最高的 k 个候选;top-p 按累积概率动态保留候选集。三者都控制"随机性",但作用维度不同:温度管"形状",top-k/top-p 管"候选范围"。通常先设温度再配合 top-p 使用。
RAG / 微调 / 提示工程
LLM 落地的"三件套"解决不同问题:提示工程改输入(零成本,简单任务);RAG 加知识(事实、私有、实时问题);微调改行为(风格、格式、领域行为)。知识类问题用 RAG,行为类问题用微调——"用微调喂知识"是常见误区。
延伸阅读
- 什么是大语言模型 —— 全站概念的起点,本表多数术语的完整解释
- 总体架构解剖 —— 各术语在"数据→训练→部署→应用"生命周期中的位置
- 从零构建一个大模型 —— 用 1M~1B 参数亲手实践本表核心概念
- 数据集与基准档案 —— 本表提到的 MMLU、GSM8K、HumanEval 等基准的详细档案
- 主流模型档案 —— 各模型家族的规格速查
- 精选资源清单 —— 深入学习的外部资源地图
参考资料
- Hugging Face Transformers 术语表(官方解释): https://huggingface.co/docs/transformers/glossary
- OpenAI API 文档(采样参数 temperature/top-p 等说明): https://platform.openai.com/docs
- Vaswani et al., "Attention Is All You Need", 2017: https://arxiv.org/abs/1706.03762
- Ouyang et al., "Training Language Models to Follow Instructions with Human Feedback", 2022: https://arxiv.org/abs/2203.02155