什么是大语言模型
大语言模型是基于海量文本预训练、以"预测下一个词"为基本任务、参数量通常在十亿级以上的神经网络语言模型,其能力来自规模、数据与对齐三者的叠加。
LARGE LANGUAGE MODEL HANDBOOK
从下一词预测到通用智能的系统化知识 —— 语言建模 · Transformer 架构 · 预训练与对齐 · 评测 · RAG 与 Agent · 工程部署 · 职业路径
50+ 篇内容不是要你通读的图书馆,而是可以按需组合的路线图
只读十篇的话,读这些
大语言模型是基于海量文本预训练、以"预测下一个词"为基本任务、参数量通常在十亿级以上的神经网络语言模型,其能力来自规模、数据与对齐三者的叠加。
导读Transformer 是全部现代大语言模型的骨架。本文从 Attention Is All You Need 出发,系统拆解 self-attention 的 QKV 计算、缩放点积、多头注意力、位置编码(绝对/相对/RoPE/ALiBi)、残差与 LayerNorm(Pre-Norm)、FFN(GELU/SwiGLU)、因果掩码与 KV Cache,并给出复杂度与三种架构形态的对比。
核心知识多模态大模型让 LLM 同时"看得见、听得见、说得出"。本文对比拼接式与原生多模态两条技术路线,拆解 CLIP、Flamingo、LLaVA、Qwen-VL、GPT-4V/4o、Gemini、Sora 的演进,并给出多模态评测与手册边界说明。
经典案例基于 LLM 的 Agent 让大模型从"回答问题"升级为"完成任务":大脑 + 工具 + 记忆 + 规划循环。本文拆解 ReAct 模式、function calling 与 MCP、短期/长期记忆、多 Agent 协作、代表案例与风险边界。
经典案例ChatGPT 把 RLHF 对齐技术产品化为大众对话助手,是大模型破圈的第一引爆点。本文拆解它的诞生背景、对话系统技术栈、破圈原因、竞品时间线、对话评估方法与产品演化。
经典案例GPT 系列定义了"生成式预训练 + 规模 + 对齐"的整条大模型技术路线。本文按代拆解 GPT-1 到 GPT-4o 的参数、数据、关键创新与历史意义,并给出每代里程碑的启示与总览表。
经典案例Meta 的 Llama 系列打开了大模型的"开源窗口",催生了微调、量化、推理部署的完整开源生态链。本文拆解 Llama 1/2/3 演进、开源生态链、中国开源模型(Qwen/DeepSeek/Baichuan/ChatGLM/Yi)与开源闭源之争。
经典案例混合专家(MoE)用"稀疏激活"打破参数量与计算量的强绑定,让万亿级总参数成为可能。本文拆解 MoE 的路由/负载均衡机制,梳理 GShard→Switch→GLaM→Mixtral→DeepSeek-V3 的里程碑,并对比激活参数与部署挑战。
经典案例RAG 通过"先检索、后生成"把外部知识接入大模型,解决知识截止、幻觉与私有数据三大难题。本文拆解 RAG 动机、索引/检索/生成三阶段流程、Naive/Advanced/Modular 演进、检索器与评测,以及与微调、长上下文的选型对比。
经典案例按模块浏览,或直接搜索
大语言模型是基于海量文本预训练、以"预测下一个词"为基本任务、参数量通常在十亿级以上的神经网络语言模型,其能力来自规模、数据与对齐三者的叠加。
本手册的三条学习路径——求职冲刺、系统精进、案头速查——分别对应不同目标人群与时间预算,给出每周安排、页面清单与检验标准,是全站的总入口地图。
从 1948 年信息论到 2025 年多模态与 Agent,大语言模型近八十年的演进:N-gram、神经语言模型、Transformer、GPT/BERT、规模法则、RLHF 与 ChatGPT 的三次范式跃迁。
大模型系统的完整生命周期地图:数据工程→预训练→后训练→评测→部署推理→应用→反馈回流,逐环节拆解输入输出与关键问题,并映射到本站每个模块的页面。
大语言模型与 NLP、深度学习、统计语言模型、基础模型、Agent、RAG 系统、AGI 的边界辨析:谁是谁的子集,谁是谁的应用形态,哪些"通用智能"的期望其实落空。
大模型安全是"能力越强、责任越大"的工程命题。本文梳理安全对齐目标、七类风险、越狱与提示注入的攻击面、红队与防御体系,辨析开源 vs 闭源的安全争议,并给出 AI 安全研究脉络(对齐、可解释性、监管)的地图。
对齐是让模型"既聪明又靠谱"的后训练阶段。本文拆解 InstructGPT 的 SFT→奖励模型→PPO 三步、KL 惩罚机制,讲清 DPO 为什么可以不需要奖励模型,并对比 RLHF/DPO/RLAIF/宪法 AI 等方法的取舍,最后讨论对齐税与弱到强泛化。
分词把连续文本切成模型处理的最小单元 token,是语言建模真正的"输入语言"。本文系统对比字符/词/BPE/WordPiece/Unigram/SentencePiece 方案,手把手讲清 BPE 算法,并说明词表大小、特殊 token、多语言/代码/数字影响及 token 与成本换算。
规模法则揭示"损失随参数、数据、计算量的增加按幂律下降",把"堆规模"变成可预测的工程决策。本文讲透 Kaplan 2020 的三条幂律、Chinchilla 2022 的 1:20 计算最优配比、涌现能力之争、推理时扩展这一"第四维度"及对实践的指导。
幻觉是大模型"一本正经地胡说八道"的现象,是生成式 AI 信任问题的核心。本文系统讲清幻觉的分类(事实性/忠实性、知识/推理)、五类成因、数据到评测的分层缓解体系、RAG 的作用边界,以及"AI 撒谎 vs 幻觉"的意图辨析。
评测是回答"模型到底行不行"的唯一途径。本文梳理 LLM 评测难在哪、三类评测体系(内在指标/任务基准/人类与模型评判)、能力分层评估、基准污染问题与榜单的正确读法,以及离线与在线评估如何构成闭环。
上下文窗口决定模型一次能"看"多长。本文讲清上下文窗口的构成、位置编码外推的本质(RoPE/ALiBi/YaRN/NTK-aware)、注意力 O(n²) 与 KV Cache 的工程挑战(FlashAttention)、长上下文训练配比与测试时扩展,并用大海捞针等评测梳理长上下文的真实边界及与 RAG 的权衡。
提示是与大模型交互的编程接口。本文讲透提示的组成要素(角色/指令/上下文/示例/输出格式)、零样本与少样本、思维链与 self-consistency、结构化输出,给出系统性提示设计方法论与安全边界,并回答"什么时候提示够了、该微调了"。
推理阶段决定了模型"怎么说话"。本文拆解自回归生成循环、KV Cache 的预填充/解码两阶段,对比贪心、温度采样、top-k、top-p、min-p 与 beam search 等解码策略,并给出 temperature/top_p/惩罚项在不同场景下的实践建议。
微调是在预训练基座上用有监督数据继续训练,把"会生成"变成"会按指令干活"。本文系统讲清 SFT 的数据与目标、全参微调与 LoRA/QLoRA/Adapter/P-Tuning 的对比、LoRA 低秩分解原理,以及灾难性遗忘与数据质量等关键工程问题。
语言建模是全部大语言模型的地基:把"预测下一个词"当作代理任务,估计文本序列的概率分布。本文讲清从 N-gram 到神经语言模型再到预训练范式的继承链、条件概率分解、困惑度与交叉熵,以及"为什么预测下个词能学到知识"。
预训练是 LLM 的第一阶段:在万亿级 token 语料上做下一词预测,把"语言与世界知识"写进参数。本文讲透训练目标与损失、数据全流程(采集/清洗/去重/过滤/配比)、数据质量即模型质量、学习率与批次等训练动态,并引出规模法则与后训练。
MoE(混合专家)用"路由器 + 一组专家 FFN"实现激活稀疏:总参数量大而每个 token 只激活一小部分,以更少计算换取更大容量。本文讲清动机、路由与负载均衡、GShard 到 DeepSeek-V3 的里程碑、专家并行通信,以及推理部署的显存与带宽挑战。
Transformer 是全部现代大语言模型的骨架。本文从 Attention Is All You Need 出发,系统拆解 self-attention 的 QKV 计算、缩放点积、多头注意力、位置编码(绝对/相对/RoPE/ALiBi)、残差与 LayerNorm(Pre-Norm)、FFN(GELU/SwiGLU)、因果掩码与 KV Cache,并给出复杂度与三种架构形态的对比。
多模态大模型让 LLM 同时"看得见、听得见、说得出"。本文对比拼接式与原生多模态两条技术路线,拆解 CLIP、Flamingo、LLaVA、Qwen-VL、GPT-4V/4o、Gemini、Sora 的演进,并给出多模态评测与手册边界说明。
基于 LLM 的 Agent 让大模型从"回答问题"升级为"完成任务":大脑 + 工具 + 记忆 + 规划循环。本文拆解 ReAct 模式、function calling 与 MCP、短期/长期记忆、多 Agent 协作、代表案例与风险边界。
BERT 用"掩码语言建模 + 双向编码器"重新定义了 NLP 的预训练范式。本文拆解 BERT 的 MLM/NSP 机制、与 GPT 的路线分歧、RoBERTa/ALBERT/DistilBERT 家族演进、T5 的 text-to-text 框架,以及 BERT 遗产在 LLM 时代的位置。
ChatGPT 把 RLHF 对齐技术产品化为大众对话助手,是大模型破圈的第一引爆点。本文拆解它的诞生背景、对话系统技术栈、破圈原因、竞品时间线、对话评估方法与产品演化。
GPT 系列定义了"生成式预训练 + 规模 + 对齐"的整条大模型技术路线。本文按代拆解 GPT-1 到 GPT-4o 的参数、数据、关键创新与历史意义,并给出每代里程碑的启示与总览表。
Meta 的 Llama 系列打开了大模型的"开源窗口",催生了微调、量化、推理部署的完整开源生态链。本文拆解 Llama 1/2/3 演进、开源生态链、中国开源模型(Qwen/DeepSeek/Baichuan/ChatGLM/Yi)与开源闭源之争。
混合专家(MoE)用"稀疏激活"打破参数量与计算量的强绑定,让万亿级总参数成为可能。本文拆解 MoE 的路由/负载均衡机制,梳理 GShard→Switch→GLaM→Mixtral→DeepSeek-V3 的里程碑,并对比激活参数与部署挑战。
RAG 通过"先检索、后生成"把外部知识接入大模型,解决知识截止、幻觉与私有数据三大难题。本文拆解 RAG 动机、索引/检索/生成三阶段流程、Naive/Advanced/Modular 演进、检索器与评测,以及与微调、长上下文的选型对比。
为什么大模型从业者必须读论文?本页讲清论文阅读的三重价值与三个认知层次,给出两小时入门、工程落地、做研究三条路线的选择逻辑,介绍论文栏目六页地图,列出常见误区与时间安排,并附一句最重要的阅读建议。
逐篇精读改变大模型走向的 11 篇经典论文:Attention Is All You Need、GPT-1/2、BERT、Scaling Laws、Chinchilla、InstructGPT、LoRA、FlashAttention、CoT、RAG,每篇给出背景问题、核心方法、关键实验数字、局限与延伸。
把大模型几十年的关键论文按时间线与主题排成一张地图:前 Transformer 时代、架构革命、规模时代、对齐时代、应用与系统、前沿,每篇一行给出年份、一句话贡献与重要性。
2023-2025 大模型前沿趋势综述:推理时扩展(o1)、长上下文与百万 token、MoE 大规模化、多模态原生、Agent 与工具使用、Mamba 状态空间模型、量化与高效推理、开源追平闭源、评测新范式,逐项给出演化脉络、代表论文/模型与一句话判断。
读 LLM 论文的完整方法论:三遍读法及每遍检查清单、读不懂的应对清单、判断论文好坏的标准(含 LLM 领域特有陷阱)、卡片笔记法、只看博客行不行、用 arXiv 持续跟进的工具与技巧、复现建议与排错。
从每年数千篇 arXiv 里筛出必读清单:约 12 篇核心必读论文、三条路线(两小时入门/工程落地/做研究)的具体文章清单与阅读顺序、每篇"读哪些章节"的读法,以及按目标场景选论文的速查表。
从显存估算公式(权重+KV cache+激活)、量化(GPTQ/AWQ/GGUF)、continuous batching 到 TTFT/TPOT 指标、GPU 选型与 vLLM 部署示例,讲透"把模型从笔记本搬到生产"的完整链路与决策方法。
列出 LLM 工程里反复出现、代价高昂的十大陷阱——榜单迷信、数据污染、评估过拟合、幻觉当 bug、提示越写越长、盲目微调、忽略成本、上下文塞爆、安全忽略、把 LLM 当数据库,逐个给出现象、成因与正确姿势。
沿着 nanoGPT 路线,用最小可运行的 PyTorch 代码走通"数据→分词→模型→训练→采样"的完整闭环:亲手训练一个能说莎士比亚语的小型 GPT,并拿到从 1M 到 1B 参数的扩展清单与四步验收标准。
按"模型库→训练→推理→编排→向量库→评估"六层拆解 LLM 工具链,每层给出场景驱动的选型决策表,并给出"别被框架绑架"的选型原则与三条自研判断标准。
搭建"公开基准 + 自建 golden set + LLM-as-a-judge + 回归测试 + 线上评估"的分层评估体系:给出批量评估代码、judge 的实现与偏差控制、成本控制方法,把"模型好不好"变成可量化、可回归的工程指标。
从提示模板设计模式到结构化输出、从系统性调提示方法论到版本管理与回归测试,再到"提示 vs 微调 vs RAG"的决策树:把提示工程从"玄学"变成可复现、可度量的工程能力。
用 LoRA 走完"数据准备→基座选择→LoRA 配置→训练监控→合并导出→评估对比"的完整微调流程,给出 QLoRA 显存估算表、常用工具对比与常见失败排错,并明确"微调不如提示"的判断标准。
用"文档解析→chunking→embedding→向量库→混合检索→重排序→生成→评测"的端到端流程搭一个能上线的 RAG 系统,并用 chunk 实验、HyDE、失败模式表和评测指标把检索质量变成可度量、可优化的工程。
大模型岗位面试高频题全库:基础与 Transformer、训练、对齐、推理、应用、手撕与开放题共 40 题,每题附参考答案要点,配"如何回答不知道的题"与一周/一月两档面试准备路线。
大模型求职版图全景:算法工程师(大模型方向)、NLP、训练/推理优化、AI 应用、Agent、评测、数据工程七类岗位的职责、核心技能与薪资区间对比,配岗位技能雷达与决策清单,并给出 career 模块五页内容地图。
大模型岗简历的黄金结构(项目背景→技术难点→方案→量化结果)与证据链写法;微调、RAG、Agent、评测、部署五类项目怎么写;"做过什么"vs"能讲多深";常见简历错误与能力自查表。
按岗位类型整理的 JD 模板与关键词雷达:算法工程师(大模型方向)、NLP、训练、推理优化、AI 应用、Agent、评测、数据工程八类岗位的职责与要求共性,附 JD 通用骨架与高频技能词总榜。
把 JD 高频要求(Transformer/注意力、预训练、RLHF/DPO、LoRA、评测、RAG、Agent、推理优化、工程能力)逐一映射到知识点与本站页面,每个知识点给出"面试怎么问",附五档自评表与补课清单生成方法。
大模型学习与工程化的高质量资源地图:入门课程、官方文档、经典图解、开源项目、模型仓库与社区榜单,每条附链接与推荐指数,并按学习目标给出组合建议。
大语言模型核心术语速查:覆盖模型范式、架构机制、训练对齐、推理部署、应用与评测的 50+ 术语,每条附一句话解释与站内关联页面。
大模型全链路数据档案:预训练语料、后训练指令数据与主流评测基准的规模、用途、获取方式与许可注意,覆盖 Common Crawl 到 MT-Bench、C-Eval 的完整图谱。
主流大模型速查档案:GPT、Claude、Gemini、Llama、Qwen、DeepSeek、Mistral、Gemma、GLM、Phi 等家族的规格、许可与亮点对比,含"怎么选模型"决策表与选型案例。