Skip to content

面试题库

本页速览 大模型岗位面试高频题全库:基础与 Transformer、训练、对齐、推理、应用、手撕与开放题共 40 题,每题附参考答案要点,配"如何回答不知道的题"与一周/一月两档面试准备路线。

面试题库

先记住这一页的一句话:面试不是考你记住了多少,而是考你能在压力下把"为什么"讲多深——所以本库每题都给出"参考答案要点"而不是背诵稿,要点背后的原理请回对应页面精读。 本库按主题组织 40 题,覆盖大模型岗面试的七个板块。

用法

① 先按知识点拆解自评,再回来刷题;② 遮住答案自己先答,再对照要点,讲不出的就是缺口;③ 每题能脱离本页讲满 3 分钟(含一个例子),才算过。

一、面试结构全景:一轮一轮在考什么

大模型岗面试的常见结构(公司差异大,但骨架一致):

轮次考察内容对应本库章节本库建议
笔试/代码轮手撕代码(算法 + LLM 相关实现)七、手撕题高频题反复练
基础八股轮Transformer、训练、推理原理二~五讲"为什么"而非背诵
项目深挖轮简历项目的取舍、坑、量化八、开放题 + 简历分析准备 20 分钟深度讲解
系统设计轮RAG/Agent 端到端设计八、开放题讲清权衡与指标
HR 轮动机、稳定性、薪资诚实 + 有明确选择逻辑

二、基础与 Transformer(8 题)

1. 写出缩放点积注意力的公式,并解释每一步

要点

Attention(Q, K, V) = softmax( Q·Kᵀ / √d_k ) · V
  • Q(查询)决定"我要找什么",K(键)决定"我身上有什么可被找",V(值)决定"找到我后给出什么";
  • Q·Kᵀ 计算所有键值对的相关性分数(点积越大越相关);
  • 除以 √d_k 缩放(见下题);softmax 归一化成权重;加权求和 ·V 得到输出。
  • 关联:Transformer 架构详解

2. 为什么注意力要除以 √d_k?

要点

  • 点积 q·k 的方差随维度 d_k 增大而增大(约等于 d_k),数值变大后 softmax 进入饱和区,梯度趋于 0,训练变慢甚至不收敛;
  • 除以 √d_k 后方差恢复为 O(1),softmax 处于梯度良好区域;
  • 一句话:控制方差,保住梯度

3. 多头注意力的作用是什么?

要点

  • 单头注意力只有一个注意力模式;多头把 Q/K/V 分别投影到多个低维子空间,每个头可以关注不同关系(语法、指代、长程依赖);
  • 各头结果拼接后再线性投影,实现特征互补;
  • 类似 CNN 的多通道直觉;多头并行计算开销与单头几乎相同(总计算量不变)。

4. Transformer 的位置编码有哪些?RoPE 外推不了怎么办?

要点

  • 注意力本身是置换等变的,必须注入位置信息:绝对位置编码(sin/cos)、可学习位置嵌入、相对位置编码、RoPE(旋转位置编码)、ALiBi(注意力线性偏置);
  • RoPE 用旋转矩阵把位置信息编码进 Q/K,外推(超过训练长度)时因旋转频率超出学习分布而性能骤降;
  • 解法:位置插值(线性/NTK-aware 插值、YaRN)在推理时把位置坐标压缩回训练范围;训练时用长文本上采样扩展窗口;或者干脆用 RAG 代替硬撑长上下文(见上下文与长文本)。

5. 什么是 KV cache?为什么推理时需要?

要点

  • 自回归解码时,生成第 t+1 个 token 需要注意力到前 t 个 token;每个 token 的 K、V 与自身位置相关,与后续查询无关,可缓存复用
  • 不缓存则每步重算全部前缀的 Q/K/V,计算量随序列长度平方级增长;
  • KV cache 以显存换算力:缓存 2 × batch × layers × heads × head_dim × seq_len × 2 字节(FP16);
  • 代价:长序列下显存线性膨胀,需要 PagedAttention、量化、上限约束等手段(见推理基础)。

6. Decoder-only / Encoder-only / Encoder-Decoder 的区别?

要点

  • Encoder-only(BERT):双向注意力,擅长理解/分类/检索,不擅长生成;
  • Decoder-only(GPT/Llama/Qwen):因果掩码自回归,既能理解也能生成,是当代主流;
  • Encoder-Decoder(T5):编码后解码,翻译/摘要等序列到序列任务强;
  • 为什么 Decoder-only 胜出:统一目标、简单可扩展、规模化效果好(详细讨论见语言建模)。

7. self-attention 的复杂度是多少?长上下文为什么贵?

要点

  • 时间 O(n²·d)(n 为序列长度),显存 O(n²)——每个 token 都要与所有 token 交互;
  • 长上下文下:计算、KV cache 显存、二次注意力矩阵都线性/平方级膨胀;
  • 缓解:FlashAttention(IO 优化、不存完整矩阵)、稀疏/滑动窗口注意力、长上下文位置插值、以及业务上用 RAG 而非硬塞全文

8. Pre-Norm 与 Post-Norm 的区别?

要点

  • Post-Norm(原始 Transformer):先残差再加 LayerNorm,梯度在深层易不稳,需要 warmup;
  • Pre-Norm(现代主流,GPT/Llama):先 LayerNorm 再残差,训练更稳定,可去 warmup;
  • 代价:Pre-Norm 理论上限略低于 Post-Norm,但工程上更省事,成为事实标准。

三、训练(6 题)

9. 预训练的目标是什么?和微调有什么区别?

要点

  • 预训练目标 = 下一词预测(自回归语言建模),在海量无标注文本上最大化条件概率;
  • 预训练学通用语言能力与知识;微调(SFT)用指令-回答数据适配具体任务/风格;
  • 关键区别:数据(无标注 vs 有标注指令)、目标(语言建模 vs 指令跟随)、规模与成本差异巨大;
  • 预训练常被比作"读万卷书",微调是"学一项技能"(见微调)。

10. 什么是困惑度(perplexity)?和交叉熵什么关系?

要点

  • Perplexity = exp(交叉熵) = 2^交叉熵,衡量模型对一段文本的平均"不确定程度";
  • 直觉:perplexity 约等于模型平均每个位置在多少个候选词之间犹豫;
  • 只在同一分词器、同一语料分布下可比较;perplexity 与下游任务表现并不总是正相关,是"烟囱指标"而非"疗效指标"。

11. 数据配比怎么定?代码/数学数据加多了会怎样?

要点

  • 配比决定能力结构:通用文本给语言能力,代码给推理/结构化思维,数学给严谨推理,多语言给语种覆盖;
  • 代码/数学数据上采样 → 推理能力提升,但可能损伤对话自然度与语言风格;
  • 配比需要实验验证:用**混合实验(ablation)**在小规模模型上先测,再放大;领域数据过度上采样会导致领域过拟合、通用能力退化;
  • 资源:数据集与基准档案

12. 讲讲规模法则与 Chinchilla 的结论

要点

  • Kaplan(2020):测试损失随模型参数 N、数据量 D、算力 C 幂律下降;
  • Chinchilla(2022):计算最优配比下,token 数 ≈ 20 × 参数数(如 70B 模型约需 1.4T token);
  • 启示:算力固定时,数据与参数应同步增长,别只堆参数;实际工程常"过度训练"小模型或"欠训练"大模型以迁就算力与推理成本;
  • 涌现能力存在争议:是能力突变还是指标平滑(见规模法则)。

13. 数据并行、张量并行、流水线并行、ZeRO 各解决什么问题?

要点

  • 数据并行(DP/FSDP):每卡一份完整模型,切数据——解决"数据太多跑不完",但单卡装不下模型时无效;
  • 张量并行(TP):把单层权重按维度切开分布到多卡,层内通信密集,适合单机多卡(NVLink);
  • 流水线并行(PP):按层切分,各卡负责一段层,减少通信但引入气泡(bubble);
  • ZeRO:把优化器状态/梯度/参数分片,数据并行下也能装超大模型,通信量随分档增加;
  • 组合拳:PP + TP 管模型装不下,DP 管数据多,ZeRO 管显存(详见框架与工具选型)。

14. 训练不收敛/损失异常怎么排查?

要点

  • 先看数据:batch 里是否有污染/NaN、标签是否对齐、分词是否异常;
  • 再看数值:loss 是否为 NaN(学习率过大、混合精度溢出 → 调小 LR / 换 BF16、加 grad clip);
  • 看动态:loss 平台期(LR 调度、数据重复、模型容量不足)、震荡(LR 过大、batch 过小);
  • 工程面:梯度检查(gradient check)、断点恢复是否一致、是否静默溢出;
  • 铁律:先复现,再归因;每次只改一个变量。

四、对齐(5 题)

15. RLHF 的完整流程是什么?

要点

  • 三步:① SFT——用高质量指令-回答数据微调基座;② 训练奖励模型(RM)——收集人类对多个回答的偏好排序,训一个给"回答打分"的模型;③ PPO 强化学习——让 SFT 模型在"被 RM 打分高"的方向上继续优化,同时用 KL 惩罚约束它别偏离 SFT 模型太远;
  • 关键点:偏好数据规模(通常远小于 SFT 数据)、RM 与策略模型同源、PPO 需要 ref 模型算 KL;
  • 参见对齐:RLHF 与 DPO

16. 奖励模型怎么训练?数据从哪来?

要点

  • 数据:人类对同一 prompt 的多个回答排序(如 A > B > C),来自标注团队;
  • 训练:把排序转成两两对比对,用 Bradley-Terry 模型(成对 softmax 概率)拟合,损失是排序正确率的负对数似然;
  • 陷阱:奖励模型会过度优化(reward hacking),人类评分本身有噪声与偏差;奖励模型规模常与策略模型同量级。

17. PPO 目标里 clip 和 KL 惩罚是干什么的?

要点

  • 策略更新用重要性采样比率 r = π_θ(a|s)/π_old(a|s)
  • clip:把比率裁剪到 [1-ε, 1+ε],防止策略一步更新过大导致训练崩溃(PPO 稳定性的核心);
  • KL 惩罚:让新策略不要偏离参考策略(SFT/ref 模型)太远,防止语言崩塌(越说越不像人话);
  • 三者合起来:朝高奖励方向走,但步子小、别走丢。

18. DPO 和 RLHF 的区别?为什么 DPO 不需要奖励模型?

要点

  • DPO(Direct Preference Optimization)直接从偏好对(chosen/rejected)优化策略,隐式地用一个"奖励函数"(策略与参考策略的 log 比)替代显式 RM;
  • 数学直觉:最优策略下奖励可以写成 r(x,y) ∝ log(π_θ/π_ref),把奖励代入 Bradley-Terry 损失直接得到策略损失;
  • 区别:DPO 无 RM 训练环节、无强化学习循环,更简单、更便宜、更稳;但显式 RM 可以离线迭代、可解释,RLHF 上限未必低于 DPO;
  • 实践:DPO 对偏好数据质量敏感,需要防过拟合(详见对齐)。

19. 什么是"对齐税"?为什么对齐会让模型变笨?

要点

  • 对齐税(alignment tax):对齐(SFT/RLHF)后,模型在部分基准(尤其推理、事实性任务)上分数下降的现象;
  • 原因:对齐数据分布窄、压缩了原始预训练分布;优化目标是"讨好人"而非"最大化正确性";KL 约束下能力被"挤"掉;
  • 缓解:用更强的基座做对齐、控制对齐数据配比、DPO 等低干扰方法、对齐后用评测回归防过度优化。

五、推理(5 题)

20. KV cache 的显存怎么估算?

要点

  • 公式:KV 显存 ≈ 2(K 和 V)× num_layers × num_kv_heads × head_dim × seq_len × batch × 字节数
  • 例:7B 模型(32 层、32 头、head_dim 128,FP16),序列 2048、batch 1:2×32×32×128×2048×2 B ≈ 1.07 GB
  • 注意:多头分组(GQA,如 Llama 的 KV heads < query heads)能显著压缩;长序列下 KV cache 往往比权重还占显存。

21. 量化是什么?GPTQ / AWQ / GGUF 的区别?

要点

  • 量化:把权重/激活从 FP16 降到 INT8/INT4,用更低精度换更小显存与更快推理,代价是精度损失;
  • GPTQ:训练后量化(PTQ),按 Hessian 加权逐层最小化量化误差,适合 GPU 部署;
  • AWQ:按激活分布保护重要权重通道,效果/速度均衡,同样适合 GPU;
  • GGUF:llama.cpp 生态的量化格式(Q4_K_M 等),面向 CPU/边缘部署;
  • 一般经验:INT8 损失很小,INT4 需评测验证;量化后务必用业务评测集回归(见部署与服务化)。

22. continuous batching 解决什么问题?

要点

  • 传统静态批处理:等一个 batch 全部完成才调度下一个,短请求被长请求拖累,GPU 利用率低;
  • continuous batching:步进级动态调度——每个解码步完成后立即把完成的请求移出、塞入新请求,让 GPU 一直"满员";
  • 配合 PagedAttention(KV cache 分页管理、消除显存碎片与预留浪费)可实现数倍吞吐提升;vLLM 即此路线的代表实现。

23. 7B 模型 FP16 推理需要多少显存?训练呢?

要点

  • 推理:权重 7B × 2 字节 ≈ 14 GB(FP16),加上 KV cache 与激活,建议 1 张 24GB 卡起步;INT4 量化后权重约 3.5–4 GB;
  • 训练(全参 FP16):需要 权重 14GB + 梯度 14GB + Adam 优化器状态 28GB ≈ 56GB,再加激活与通信冗余,单张 A100(80G) 勉强、通常需多卡或 ZeRO/QLoRA
  • QLoRA:基座权重冻结为 4bit(约 3.5GB)+ 少量 LoRA 参数 + 优化器只对 LoRA 参数,单卡 24GB 可训 7B
  • 一句话:推理看权重+KV,训练看参数×约 20 字节(FP16+Adam)

24. TTFT / TPOT / 吞吐是什么?延迟高怎么排查?

要点

  • TTFT(Time To First Token):首 token 延迟,反映 prefill 阶段,长 prompt 下变大;
  • TPOT(Time Per Output Token):每个输出 token 的间隔,反映 decode 阶段;
  • 吞吐:每秒处理 token 数(tokens/s),batch 越大吞吐越高但单请求延迟变差;
  • 排查:先用压测分解 prefill/decode 各占多少 → 看是否显存不足导致 batch 受限 → 看是否量化/算子未生效 → 看长上下文是否 KV 爆炸 → 检查网络/调度层;每步用 profiling(如 torch profiler、nsys)定位瓶颈。

六、应用(6 题)

25. 完整讲一遍 RAG 流程

要点

  • 动机:知识截止、幻觉、私有数据、可溯源;
  • 三阶段:索引(文档解析 → chunking → embedding → 向量库)→ 检索(向量检索 + BM25 混合 → 重排序)→ 生成(拼接上下文与问题,带引用生成);
  • 关键细节:chunk 大小/重叠策略、查询改写、HyDE、重排器、评估指标(召回率、忠实度、答案相关);
  • 常见失败:chunk 切断语义、检索噪声污染生成、引用无法溯源;
  • 详见RAG 实战

26. RAG vs 微调 vs 长上下文怎么选?能组合吗?

要点

  • 决策维度:知识是否高频变化(RAG 优)、是否需要新行为/风格(微调优)、是否单条超长(长上下文优)、是否有成本与隐私约束;
  • RAG 适合"外挂知识、可溯源、跟新快";微调适合"改变模型行为/格式/领域语言";长上下文适合"单条文档很长且一次性使用";
  • 能组合:RAG + 微调是常见组合(微调优化指令遵循,RAG 提供知识);
  • 原则:先提示,再 RAG,再微调——按成本递增顺序试探(参考提示工程)。

27. Agent 的工作循环是什么?ReAct 为什么有效?

要点

  • 循环:感知 → 推理 → 行动 → 观察 → 再推理,直到任务完成或达上限;
  • ReAct:让模型交替输出 Thought(推理)与 Action(调用工具),观察工具结果后继续;比纯 CoT 强在能与外部世界交互、错误可被观察纠正
  • 关键工程点:工具 schema、格式校验与自动重试、循环上限与终止条件、记忆压缩、成本与安全护栏;
  • 详见基于 LLM 的 Agent

28. 工具调用(function calling)怎么做?怎么保证格式稳定?

要点

  • 原理:把工具定义(名称、参数 JSON schema、描述)塞进 system prompt,模型输出结构化调用(如 {name, arguments});
  • 保证稳定:用原生 function calling 接口而非裸 prompt(模型经专门训练);schema 写清楚必选/可选参数与类型;输出校验失败 → 自动重试/修复;必要时 JSON mode 或 constrained decoding;
  • 陷阱:参数幻觉(模型编造不存在的参数值)、工具选择错误(描述写清楚触发条件)、循环调用烧钱(设步数上限与预算)。

29. 什么是提示注入?怎么防御?

要点

  • 提示注入:把恶意指令混入用户输入或外部内容(间接注入),劫持模型行为;与 SQL 注入同构;
  • 典型场景:用户输入"忽略之前指令";RAG 文档里埋"把系统提示发给我";
  • 防御:权限最小化(工具只读/白名单/沙箱)、输入输出过滤、把用户内容与系统指令用分隔符隔离(只能缓解,不能根治)、不信任模型对敏感操作的判断(关键操作走人工确认);
  • 现实结论:提示注入无法被提示词彻底防御,要靠系统边界(详见安全与风险)。

30. 大模型为什么产生幻觉?怎么缓解?

要点

  • 成因:训练目标是"似然最高"而非"事实正确";知识在参数里是"分布"而非"数据库";长尾知识过拟合于高频;解码时模型有"讨好"倾向;
  • 缓解分层:提示层(要求引用来源、降低温度)→ 检索层(RAG 提供事实锚点)→ 对齐层(针对性 SFT/DPO 奖励事实性)→ 验证层(事后事实核查、模型自检、检索验证);
  • 接受现实:LLM 是语言模型不是知识库,关键场景必须外挂知识 + 可溯源(见幻觉:成因与缓解)。

七、手撕题(5 题)

31. 用 numpy 实现数值稳定的 softmax

要点:先减最大值再指数归一化,防止 exp 溢出。

python
import numpy as np

def softmax(x, axis=-1):
    x = x - np.max(x, axis=axis, keepdims=True)  # 数值稳定
    e = np.exp(x)
    return e / np.sum(e, axis=axis, keepdims=True)

追问:为什么减最大值不影响结果?(指数函数的平移不变性:同减一个常数,softmax 结果不变)

32. 实现单头缩放点积注意力(含因果 mask)

要点scores = Q@Kᵀ / sqrt(d_k);加 mask(上三角设为 -inf);softmax;out = scores@V

python
import numpy as np

def attention(Q, K, V, mask=None):
    d_k = Q.shape[-1]
    scores = Q @ K.transpose(-2, -1) / np.sqrt(d_k)
    if mask is not None:
        scores = np.where(mask, scores, -1e9)   # 被 mask 的位置设为极小值
    weights = softmax(scores, axis=-1)
    return weights @ V, weights

追问:mask 的位置为什么用 -inf 而不是 0?(softmax 后要变成 0 权重;用 -1e9 是数值上的近似)

33. 实现 temperature + top-p 采样

要点:temperature 缩放 logits;top-p 按累积概率截断候选集再归一化。

python
import numpy as np

def top_p_sampling(logits, temperature=1.0, top_p=0.9, rng=None):
    rng = rng or np.random.default_rng()
    logits = logits / temperature
    probs = softmax(logits)
    order = np.argsort(probs)[::-1]
    sorted_probs = probs[order]
    cumsum = np.cumsum(sorted_probs)
    keep = cumsum - sorted_probs <= top_p        # 累积概率不超过 top_p
    keep_idx = order[keep]
    probs = np.zeros_like(probs)
    probs[keep_idx] = sorted_probs[keep]
    probs /= probs.sum()
    return rng.choice(len(probs), p=probs)

追问:temperature 为 0 怎么办?top-p 与 top-k 的关系?(实践中常组合使用,min-p 是 2024 年后流行的替代)

34. LoRA 前向与参数合并

要点:LoRA 只训练增量 ΔW = B·A(A 高斯初始化、B 零初始化),推理时可合并回原权重。

python
import numpy as np

# 前向:h = W0 @ x + (alpha/r) * B @ A @ x
def lora_forward(W0, A, B, x, alpha, r):
    return W0 @ x + (alpha / r) * (B @ (A @ x))

# 合并:直接得到微调后的权重
def merge(W0, A, B, alpha, r):
    return W0 + (alpha / r) * (B @ A)

追问:为什么 B 零初始化?为什么推理时能合并?(训练只影响增量,合并不改变输出,只是省去推理时的额外分支)

35. 带 KV cache 的自回归生成循环(伪代码)

要点:prefill 阶段算全量 KV 并产出第一个 token;之后每步只对"最新 token"算 Q,与缓存 KV 拼接后注意力。

python
def generate(model, tokens, max_len, cache=None):
    # prefill:处理全部输入,得到 KV cache 和第一个输出 token
    logits, cache = model(tokens, cache=None)
    next_tok = sample(logits[-1])
    outputs = [next_tok]
    for _ in range(max_len):
        # decode:只输入最新 token,KV 自动拼接
        logits, cache = model(next_tok, cache=cache)
        next_tok = sample(logits[-1])
        outputs.append(next_tok)
    return outputs

追问:为什么 decode 阶段只输入一个 token?(历史 token 的 K/V 已在 cache 中,无需重算);cache 显存上限怎么设?(长度上限 + 溢出策略)

八、开放题(5 题)

36. 给我讲一个你踩过的坑

要点(答题框架):

  • 结构化讲:背景 → 我做了什么 → 哪里错了 → 怎么发现的 → 怎么解决 → 沉淀了什么
  • 首选"数据/评测"类坑(如评测集泄漏、数据配比不当),比"环境装不上"更有区分度;
  • 关键:讲复盘而不是讲辛苦;承认错误 + 展示方法论,是面试官最想看到的成长信号。

37. 设计一个企业知识库问答系统(系统设计)

要点(答题框架):

  • 需求澄清:文档规模/格式、更新频率、并发、准确性要求、私有化还是云;
  • 架构:文档接入与解析 → chunking → embedding + 向量库 → 检索(混合 + 重排)→ 生成(带引用)→ 评测与监控;
  • 关键取舍:RAG vs 微调(知识更新频繁用 RAG);本地部署 vs API(成本与合规);向量库选型(FAISS/Milvus/pgvector 按规模);
  • 指标:召回率、忠实度、TTFT/吞吐、成本;先说指标,再设计系统——面试官看的是你有没有评估意识。

38. 怎么证明你的微调/RAG 方案真的有效?

要点

  • 基线先行:提示词方案(baseline)vs 微调方案,同一评测集;
  • 评测集要干净:公开基准 + 业务自建集,防数据污染(先查微调数据与评测集是否重叠);
  • 多维度:目标指标提升之外,还要看通用能力是否退化(对齐税检查);
  • 统计意义说话:样本量够不够、置信区间、A/B 是否显著;
  • 生产环境:线上 A/B + 用户反馈闭环(详见评估实战)。

39. 你怎么跟进最新论文?最近在关注什么?

要点

  • 渠道:arXiv(订阅关键词/跟作者)、X/Twitter 与 HF 论文榜、顶级会议(NeurIPS/ICML/ACL)、开源社区动态;
  • 方法:每周固定时间,先读摘要/标题筛一遍,精读 1–2 篇,做卡片笔记(问题/方法/结果/局限);
  • 说真话:诚实报出最近真读过的 1–2 篇并讲出你的判断,比报十个标题强一百倍;
  • 参考阅读路径阅读纪律与 FAQ

40. 反问面试官的问题清单

要点

  • 团队与技术:现在团队用什么基座?评测体系建到什么程度?当前最大的技术挑战是什么?
  • 工作内容:这个岗位前三个月最需要解决的问题是什么?团队怎么分工模型/数据/评测?
  • 成长与期望:团队对"半年内做出什么"有预期吗?有没有做新方向(Agent/多模态)的机会?
  • 为什么问这些:反向验证JD 与实际工作的落差(见模块导读与岗位版图的提醒),并展示你重视结果与判断力。

九、如何回答"不知道"的题

场景正确姿势
完全没听过承认 + 尝试归类:"我不了解这个具体方法,但它听起来属于 XX 方向,我理解它是要解决 XX 问题,能给我 30 秒推理吗"
概念知道但讲不透讲清楚你会的部分 + 明确边界:"我理解到这一步,更深的细节我没有实操验证过,不敢乱说"
需要推导说思路再动笔:"我先给思路:这题本质是 XX,我打算分三步……"——比闷头写强
追问到极限优雅收敛:"这个问题我需要查证/复现才能负责任地回答,我记下来回去验证"

诚实是最高级的策略

面试官绝大多数时候考的不是你有没有听过,而是你怎么对待未知。编造当场被抓的代价远大于"我暂时答不上来,我的推断是……"。

十、面试准备路线

1 个月版(标准节奏,每天 2–3 小时)

主题对应本站
W1Transformer 与推理基础:精读原理 + 手撕 attention/softmaxTransformer推理基础
W2训练与对齐:预训练/规模法则/RLHF/DPO预训练对齐
W3应用与评测:RAG、Agent、评测体系RAG 实战评估实战
W4项目深挖 + 模拟面试 + 手撕巩固本页开放题 + 简历分析

1 周版(紧急冲刺,每天 4–6 小时)

重点
D1本页基础 8 题 + 手撕 31–33(刷熟)
D2训练 6 题 + 对齐 5 题(讲出"为什么")
D3推理 5 题 + 应用 6 题
D4手撕 34–35 + 项目深挖:把简历最强的项目按四段式讲 3 遍
D5系统设计题(知识库问答)过一遍 + 模拟面试
D6复盘错题,补薄弱板块,准备反问清单

最后两天别学新知识

面试前 48 小时停止输入新内容,只做两件事:把已会的讲顺、把简历项目的故事讲圆。临时抱佛脚的新概念,90% 会在追问下露馅。

十一、延伸阅读

站内继续读

参考资料