外观
精选资源清单
本页是大模型学习与工程化的精选资源地图,按类别组织:入门课程、官方文档与博客、必读论文与图解、开源模型与权重、开源工程与框架、书籍、社区与榜单、中文资源。每条资源给出一句话说明与推荐指数(★ 越多越值得优先投入),文末附"按目标组合资源"决策表。
怎么用这张表
先看「入门课程」建立动手手感,再读「必读论文与图解」打通原理,工程实践阶段回到「开源工程与框架」挑选工具。所有链接均为真实官方/权威地址,直接点击即可。
一、入门课程与视频
课程是性价比最高的起点:花几十小时跟着做,胜过看几百篇零散博客。下面按"从原理到工程"的推进顺序排列。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| Andrej Karpathy《Neural Networks: Zero to Hero》 | 从反向传播讲到 GPT,亲手实现并训练小型 Transformer,公认的 LLM 入门天花板 | 课程主页 | ★★★★★ |
| 斯坦福 CS224n《NLP with Deep Learning》 | 经典 NLP 课程,Transformer 与语言模型的理论底子,讲义免费 | 课程主页 | ★★★★ |
| 斯坦福 CS25《Transformers United》 | 专题研讨课,Transformer 架构从原理到各行业应用 | 课程主页 | ★★★ |
| Hugging Face 免费课程 | 官方出品,配合 Transformers 库动手学,附证书,含 NLP/RL/扩散/Agent 多条线 | 学习中心 | ★★★★★ |
| 李宏毅《生成式 AI》系列 | 中文友好的 LLM 入门课,讲原理也讲推理与多模态,含大量直观演示 | 课程主页 | ★★★★ |
| deeplearning.ai 短课程 | 吴恩达出品:提示工程、RAG、微调、Agent 等 1~2 小时小课,快速上手 | 课程列表 | ★★★★ |
重点路线:Karpathy 三件套
nn-zero-to-hero 视频课程 + nanoGPT(约 300 行可训练的迷你 GPT)+ Let's build GPT 讲解视频,构成一条"从零手写大模型"的完整路线。建议配合本手册的从零构建一个大模型边看边做:看完视频理解原理,动手改 nanoGPT 跑通 Shakespeare 数据集,你就已经超过大多数只刷 API 的从业者。
二、官方文档与博客
官方文档是最权威、最不会过时的一手资料:模型规格、API 参数、许可条款都以官方为准。第三方博客写错了没有责任,官方文档错了会被全网纠正。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| OpenAI 平台文档 | API、模型规格、提示与函数调用官方说明,采样参数的定义出处 | 官方文档 | ★★★★★ |
| OpenAI 博客 | GPT-4o、o1、GPT-5 等发布公告与技术解读 | 官方博客 | ★★★★ |
| Anthropic 文档 | Claude 模型、提示工程与 Agent 指南,Claude Code 等工具说明 | 官方文档 | ★★★★★ |
| Anthropic 研究博客 | RLHF、幻觉、可解释性(circuits)等深度长文,行业标杆级分析 | 研究博客 | ★★★★ |
| Google DeepMind 博客 | Gemini、Gemma 与多模态前沿研究 | 官方博客 | ★★★★ |
| Hugging Face 博客 | 大量优质技术拆解:LLM 训练、量化、评估、长上下文,中文读者友好 | 官方博客 | ★★★★★ |
| Hugging Face 文档 | Transformers / PEFT / TRL / Datasets 等库的权威手册 | 官方文档 | ★★★★★ |
| lmsys 团队博客 | MT-Bench、Vicuna、长文本评测等开源研究一手资料 | 团队博客 | ★★★ |
读文档的正确姿势
不要从头到尾背文档。遇到问题再查:查"采样参数怎么设"看 OpenAI 文档,查"LoRA 怎么配"看 PEFT 文档,查"许可条款"看模型官方主页。文档是字典,不是教材。
三、必读论文与图解精读
论文是知识的源头,但直接啃论文门槛高。先用图解建立直觉,再回到论文原文,效率最高。完整的论文阅读路线见本手册论文阅读路径与论文地图。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| Jay Alammar《The Illustrated Transformer》 | 注意力机制最著名的可视化图解,入门必读,配动画式讲解 | 阅读文章 | ★★★★★ |
| Harvard NLP《The Annotated Transformer》 | 论文逐段精读 + 可运行 PyTorch 代码,理解"怎么实现"的最佳入口 | 阅读文章 | ★★★★★ |
| arXiv | 全部论文的原始出处(Attention Is All You Need、Scaling Laws、Chinchilla、LoRA、FlashAttention 等) | arXiv 官网 | ★★★★★ |
| Papers with Code | 论文 + 代码 + 榜单一站式检索,看"谁能复现"很方便 | 官网 | ★★★★ |
| Hugging Face Papers | 每日论文推荐与社区讨论,追前沿的省力入口 | 论文站 | ★★★ |
别掉进"收藏即学会"的陷阱
图解文章和论文清单最大的风险是只收藏不读。给自己定个规矩:每收藏 1 篇,必须 24 小时内读完并写 3 行笔记(它解决了什么问题 / 核心方法一句话 / 我能在哪用上)。阅读纪律详见阅读纪律与 FAQ。
四、开源模型与权重
想真正"拥有"一个模型、做微调和私有化部署,就离不开开放权重生态。这里的核心是 Hugging Face Hub,它是模型、数据集、评测的全球枢纽。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| Hugging Face Hub | 全球最大的模型/数据集/应用仓库,权重下载与社区协作的主阵地 | Hub 主页 | ★★★★★ |
| Llama(Meta) | Llama 3.1/4 官方主页与社区许可说明 | 官网 | ★★★★★ |
| Qwen(阿里) | 通义千问全系列权重与文档,中文生态最完善的开源家族 | GitHub | ★★★★★ |
| DeepSeek(深度求索) | DeepSeek-V3/R1 权重、训练细节与技术报告 | GitHub | ★★★★★ |
| Mistral AI | Mistral 7B、Mixtral 等欧洲开源模型,Apache 2.0 许可宽松 | 官网 | ★★★★ |
| Gemma(Google) | 轻量级开放模型系列,边缘与消费级硬件友好 | 官方页 | ★★★★ |
| Ollama | 一行命令本地运行开源模型的桌面工具,新手友好的入口 | GitHub | ★★★★★ |
怎么把开源模型跑起来
入门顺序建议:Ollama(最简单)→ llama.cpp(理解量化)→ vLLM(生产部署)。先 ollama run qwen3:8b 体验本地推理,再深入部署与服务化学显存估算与量化。
权重 ≠ 开源协议宽松
"开放权重"并不等于可随意商用:Llama 有 Llama 社区许可、Gemma 有 Gemma 条款、Command R 是 CC-BY-NC 非商用。商用前务必核对各模型许可。选型与许可速查见主流模型档案。
五、开源工程与框架
工程工具按职责分为四层:训练、推理、评测、应用编排。先想清楚任务再选工具,不要因为流行就全上。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| vLLM | 高吞吐 LLM 推理引擎,PagedAttention + 连续批处理,生产部署事实标准 | GitHub | ★★★★★ |
| llama.cpp | CPU/边缘设备上运行 GGUF 量化模型,本地部署首选 | GitHub | ★★★★★ |
| DeepSpeed | 微软分布式训练框架,ZeRO 显存优化,大模型训练标配 | GitHub | ★★★★ |
| Megatron-LM | NVIDIA 大规模训练框架,张量/流水线并行参考实现 | GitHub | ★★★★ |
| Hugging Face Transformers | 模型加载与使用的通用接口库,一切实验的起点 | GitHub | ★★★★★ |
| PEFT | 参数高效微调(LoRA/QLoRA/Adapter)官方库 | GitHub | ★★★★★ |
| TRL | 对齐训练(SFT/DPO/PPO)官方库 | GitHub | ★★★★★ |
| LLaMA-Factory | 一键式微调工具,支持 LoRA/QLoRA/DPO/多模态,零代码 WebUI | GitHub | ★★★★★ |
| Axolotl | 基于 YAML 配置的微调框架,可复现性好,社区配置多 | GitHub | ★★★★ |
| lm-evaluation-harness | EleutherAI 通用评测框架,跑 MMLU/GSM8K/HumanEval 等基准 | GitHub | ★★★★★ |
| OpenCompass | 上海 AI Lab 评测框架,中文基准丰富,榜单服务成熟 | GitHub | ★★★★ |
| LangChain | 最流行的 LLM 应用编排框架,Agent 与工具生态庞大 | GitHub | ★★★★ |
| LlamaIndex | 以数据索引为核心的 RAG 框架,文档问答场景顺手 | GitHub | ★★★★ |
| Dify | 可视化 LLM 应用平台,内置 RAG/Agent/工作流,非程序员友好 | GitHub | ★★★★ |
| 任务 | 推荐工具 |
|---|---|
| 训练 / 微调 / 对齐 | Transformers + PEFT + TRL,或 LLaMA-Factory / Axolotl(省心) |
| 推理 / 部署 | vLLM(GPU 服务化)、llama.cpp(CPU/边缘)、Ollama(本地体验) |
| 评测 | lm-evaluation-harness(通用)、OpenCompass(中文丰富) |
| 应用编排 / RAG / Agent | LangChain、LlamaIndex、Dify |
别被框架绑架
工具选型先想清楚问题:训练用 PEFT/TRL/LLaMA-Factory,推理用 vLLM/llama.cpp,评测用 lm-eval-harness,应用编排再考虑 LangChain/LlamaIndex。完整选型对照与场景决策见框架与工具选型。
六、书籍
书适合系统性啃完,是博客碎片信息的最佳替代。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| Sebastian Raschka《Build a Large Language Model (From Scratch)》 | 从零实现并训练一个小型 GPT 的最佳书籍,配全量代码,2024 年出版 | 出版社主页 | ★★★★★ |
| Raschka《Machine Learning with PyTorch and Scikit-Learn》 | 入门 PyTorch 的前置读物 | 出版社主页 | ★★★ |
| Karpathy《llm.c》 | 用纯 C/CUDA 复刻 GPT-2 训练的可读实现,不是书但胜似书 | GitHub | ★★★★ |
免费替代方案
Raschka 书的配套代码与视频可在其 GitHub 仓库 免费获取;Karpathy 的 nanoGPT 与 llm.c 是"一本书"级的动手资源——预算有限的话,Karpathy 视频 + nanoGPT 已经能覆盖书的 80% 内容。
七、社区与榜单
社区解决"信息差"问题:新模型发布、新技巧、踩坑经验都在这里最先出现。榜单解决"选哪个模型"问题,但只能当参考。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| LMArena(原 LMSYS Chatbot Arena) | 众包盲评的模型对战榜单,最接近真实偏好的公开评测 | 官网 | ★★★★★ |
| HF Open LLM Leaderboard | 开源模型标准化基准榜单(已归档,历史参考仍有价值) | 榜单页 | ★★★ |
| r/LocalLLaMA | 本地部署开源模型的活跃社区,新模型与新量化技巧更新极快 | 社区页 | ★★★★ |
| Weights & Biases | 实验追踪平台,也是大量优秀 LLM 实验报告的发源地 | 官网 | ★★★ |
| Simon Willison's Weblog | LLM 工程与产品化实践的高质量独立博客,观点犀利 | 博客 | ★★★★ |
| OpenRouter | 聚合多家模型 API 的统一入口,对比模型实测很方便 | 官网 | ★★★★ |
榜单仅供参考
Chatbot Arena 排名随新模型发布频繁变动,Open LLM Leaderboard 已停止更新。榜单分数受评测集选择、提示写法、数据污染影响——同一模型用不同评测口径可能排名迥异。参考榜单时注意:看"你的任务类型"对应的子榜单,不要只看综合分。详见评测与基准。
八、中文资源
中文社区在过去两年沉淀了大量高质量教程与整理,对中文读者尤其友好。
| 资源 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| Datawhale | 国内最大的开源学习社区之一,LLM 系列教程持续更新(含 LLM 原理与实战) | GitHub | ★★★★ |
| Awesome-LLM | 大模型学习资源大全(论文/课程/工具/榜单),持续维护 | GitHub | ★★★★ |
| llm-course(mlabonne) | 结构化 LLM 学习路线:从数学基础到微调部署,附代码 | GitHub | ★★★★ |
| 李宏毅《生成式 AI》 | 见「入门课程」分类,中文讲解质量最高的一档 | 课程主页 | ★★★★★ |
九、实践与实验平台
看十遍不如跑一遍。这几个平台能让你无硬件门槛地动手:
| 平台 | 一句话说明 | 链接 | 推荐 |
|---|---|---|---|
| Google Colab | 免费 GPU 笔记本,跑 nanoGPT / 小模型实验的首选 | 官网 | ★★★★★ |
| Kaggle | 数据竞赛 + 免费 GPU 额度(每周约 30 小时) | 官网 | ★★★★ |
| Hugging Face Spaces | 一行部署模型 Demo,分享作品很方便 | 官网 | ★★★★ |
十、按目标组合资源
| 目标 | 必看(按顺序) | 补充 |
|---|---|---|
| 求职面试(3~6 个月) | Karpathy 视频 → The Illustrated Transformer → HF 课程 → 本站学习路径 | 配合本手册面试题库做输出 |
| 快速做应用(1~2 周) | deeplearning.ai 短课程 → HF 文档 → Ollama → LangChain/LlamaIndex 文档 | 用 Dify 免代码搭第一个 Demo |
| 开源微调 + 私有化部署 | Transformers → PEFT → LLaMA-Factory → vLLM → llama.cpp | 参考微调实战与部署 |
| 做研究 / 读论文 | The Annotated Transformer → arXiv → HF Papers | 阅读纪律见论文 FAQ |
延伸阅读
- 论文阅读路径 —— 把上面的论文资源落成可执行的阅读清单
- 阅读纪律与 FAQ —— 只看博客不读论文行不行、怎么追 arXiv
- 学习路径 —— 三条路线的资源配比建议
- 数据集与基准档案 —— 预训练语料与评测基准的详细档案
- 主流模型档案 —— 上面各开源模型的规格速查
参考资料
- Karpathy 课程主页: https://karpathy.ai/zero-to-hero.html
- Hugging Face 学习中心: https://huggingface.co/learn
- 斯坦福 CS224n: https://web.stanford.edu/class/cs224n/
- 书籍官网(Build a Large Language Model): https://www.manning.com/books/build-a-large-language-model-from-scratch
- LMArena: https://lmarena.ai/