本文基于八股精(AI算法与模型研发)约 3908 条 2025-2026 年 AI 算法与模型研发岗位的真实面试记录,对 20 个高频知识点 的出现次数与代表真题进行统计分析,并按知识模块聚类解读,帮助求职者分清复习优先级、高效备战面试。

一、Transformer 架构基础:绝对的核心战场
核心结论:Transformer 及其注意力机制是整个面试考察的"地基",几乎每场大模型相关面试都会触及,且考察深度远超"背概念",普遍要求手写公式、推导原理、解释设计动机。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| Transformer | 100 |
| 注意力机制 | 78 |
| 多头注意力机制 | 19 |
| 位置编码 | 19 |
Transformer 以 100 次高居榜首,注意力机制以 78 次紧随其后,两者合计远超其他知识点,属于核心必考第一梯队。
真题示例:
- Transformer:阐述 decoder-only 结构中,从输入 prompt 到输出 token 的整个处理过程;Transformer 相较于 RNN、LSTM,为什么能实现更好的并行化?
- 注意力机制:Self-Attention 中为什么要除以 √dk?能否用其他值 a 代替?请从数学原理角度说明。
- 多头注意力:MHA 带来的真正表达增益是什么?为什么它不仅仅是并行执行多次单头注意力?
- 位置编码:Transformer 为何需要位置编码?主流大模型(如 LLaMA、GPT)使用的 RoPE 相比绝对/相对位置编码有何优势?
避坑/得分点:
- 除以 √dk 的问题几乎年年出现,只答"防止梯度消失"不够,要能推导:Q·K 点积的方差随 dk 线性增长,除以 √dk 是为了让 softmax 输入保持单位方差,避免落入饱和区。
- 多头注意力不要答成"多跑几次取平均",得分点在子空间表示能力------不同头在不同特征子空间捕捉不同类型的依赖关系。
- 位置编码要能区分绝对编码(正弦、可学习)与相对编码(RoPE 的旋转矩阵思想),并说清 RoPE 在外推长度上的优势。
二、大模型架构与推理机制:从"会背"到"懂工程"
核心结论 :面试官不再满足于架构名词,而是深入 KV Cache、MoE 路由、温度系数等推理与工程细节,考察你是否真正跑过、调过模型。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 大语言模型 | 35 |
| 混合专家模型(MoE) | 25 |
| 模型训练 | 13 |
| 自回归生成 | 3 |
真题示例:
- 大语言模型:为什么推理阶段缓存 K 和 V,却不缓存 Q?温度系数取值过大或过小时分别对输出有什么影响?
- MoE:与 Dense 模型相比,收益主要体现在哪些方面?代价是什么?路由模块怎样决定 token 分配给哪些专家?什么原因会导致专家负载严重不均?
- 模型训练:从头梳理大模型完整生命周期(训练、微调、量化、剪枝、蒸馏、部署、分布式);解释"灾难性遗忘"现象及解决方法。
- 自回归生成:Decoder 自回归生成阶段存在大量重复计算,哪些环节可通过 KV Cache 节省算力?详述优化原理。
避坑/得分点:
- "缓存 KV 不缓存 Q"是高频陷阱题:因果注意力下,历史 token 的 K、V 会被后续每一步复用,而每步只需当前 token 的 Q,答反了直接暴露理解深度不足。
- MoE 的收益(同算力下扩大参数量、稀疏激活)与代价(路由不稳、负载均衡、通信开销、显存占用)要成对回答,只说好处会显得没实操经验。
- 自回归生成出现次数虽仅 3 次,但其真题与 KV Cache 强绑定,而 KV Cache 又在大模型、注意力等多个知识点中反复出现,建议合并进 Transformer 主线复习,不宜因排名低而完全跳过。
三、参数高效微调:LoRA 一家的"连环考"
核心结论 :微调相关知识点合计出现次数极高(低秩适应 42 + 模型微调 25 + LoRA 17 + 参数高效微调 17 = 101 次),与 Transformer 并列最热主题。LoRA 是绝对主角,考察从原理、数学、rank 选择到实操踩坑,层层递进。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 低秩适应 | 42 |
| 模型微调 | 25 |
| LoRA | 17 |
| 参数高效微调 | 17 |
真题示例:
- LoRA 和全参数微调的核心区别是什么?在显存和训练效率上各有什么优劣?
- 如何理解"低秩"(为什么秩 r 远小于原矩阵维度 d)?低秩分解为什么能逼近全参数微调效果?LoRA 的权重是怎么初始化的?
- 在大模型微调场景中,为何选择 LoRA 而非 QLoRA 或其他方案?结合实操经历说明 rank 值的选择依据;合并 adapter 权重时是否遇到过梯度爆炸,如何解决?
- 除了 LoRA,还有哪些微调方法?讲解 prefix-tuning 和 P-tuning 的实现原理,以及它们为解决什么问题而提出。
避坑/得分点:
- 初始化是高频细节题:A 用高斯/Kaiming 初始化、B 初始化为零矩阵,保证训练起点等价于原模型,答不出这一点说明只看过博客没看过代码。
- "为什么低秩有效"要结合大模型参数更新的内在低维性(intrinsic dimension)来答,而非只说"参数少"。
- 面试官常追问 QLoRA(4-bit 量化 + 分页优化器)与 LoRA 的取舍,准备好显存、精度、训练速度三个维度的对比即可。
四、强化学习与偏好对齐:从 RLHF 到 DPO/GRPO 的技术演进线
核心结论 :对齐技术是 2025-2026 年最明显的"新增热点",强化学习以 61 次位列第三,且真题普遍要求对比多个算法(PPO vs DPO vs GRPO),单点记忆已经不够用。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 强化学习 | 61 |
| PPO 算法 | 21 |
| DPO | 14 |
| 监督微调(SFT) | 12 |
真题示例:
- 为什么大模型的偏好对齐不能直接用偏好数据做 SFT,而需要强化学习?
- 请对比 RLHF、PPO、DPO 的技术差异、优缺点及适用场景;PPO 和 DPO 在对齐阶段的主要区别是什么?
- PPO 损失函数中,clip 已能限制策略更新幅度,为何还要取原始目标值与 clip 结果的较小值?仅保留 clip 会有什么问题?
- GRPO 相比 PPO 的优缺点是什么?对比 GRPO 和 DPO 的损失函数形式,解释 GRPO 在训练稳定性上的优势。
- 强化学习中如何设计 Reward?什么场景用模型生成(RM),什么场景用规则定义?
- SFT:若用 SFT 提升大模型能力,如何设计数据集与微调流程?SFT 和 DPO 分别在什么场景下使用?
避坑/得分点:
- 建议把 SFT → RLHF/PPO → DPO → GRPO 串成一条技术演进线复习:DPO 省去显式奖励模型、直接用偏好对优化;GRPO 用组内相对优势替代 value 模型。理解"每一步在解决上一步的什么痛点",对比类真题自然迎刃而解。
- PPO 取 min 的设计(悲观下界,防止策略朝错误方向过度更新)是区分"背过"和"懂"的关键题,务必吃透。
- Reward 设计题要结合业务场景:数学/代码等可验证任务用规则奖励,开放对话用奖励模型,能举出真实项目例子加分明显。
五、训练机制与损失函数:传统机器学习功底仍在考
核心结论:损失函数(29 次)、层归一化(13 次)、过拟合(9 次)属于"传统 ML + 大模型"的交叉地带,题目常常一边问 BN/LN 区别,一边追问大模型训练中的具体应用。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 损失函数 | 29 |
| 层归一化 | 13 |
| 过拟合 | 9 |
真题示例:
- SFT 会对哪部分计算 loss?为什么(只算 response 部分,prompt 不计损失)?
- 逻辑回归为什么用交叉熵损失而不用 MSE?
- LayerNorm 和 BatchNorm 在训练时梯度计算有何本质区别?BN 在训练阶段与推理阶段的实现逻辑有何不同?Transformer 中 Pre-Norm 和 Post-Norm 的设计差异及对训练稳定性的影响?
- 小样本场景下,如何解决 LoRA 微调中的过拟合或欠拟合?强化学习中 reward 持续上升但验证集效果下降,有哪些解决思路?
避坑/得分点:
- 归一化不要停留在"BN 按 batch、LN 按特征"的表层对比,要答出 LLM 用 LN/Pre-Norm 的深层原因:序列长度可变、batch 维统计不稳定、推理时无法依赖 batch 统计量。
- "reward 上升但验证效果下降"本质是奖励欺骗/过拟合奖励模型,答出 KL 惩罚、早停、验证集监控、RM 集成等思路即可拿到大部分分数。
六、推荐系统:算法岗的另一条主线
核心结论 :推荐系统以 43 次位列第五,是大模型之外独立的考察主线,真题聚焦链路设计 与生成式推荐新范式。
出现次数数据 :推荐系统 43 次(素材中该方向仅此一个知识点,更细粒度维度样本不足,不做展开)。
真题示例:
- 召回在整个推荐链路中的作用和必要性是什么?
- 生成式推荐相对于传统推荐,解决了哪些传统推荐无法解决的问题?
- 设计电商首页 Feed 流推荐系统,说明召回、粗排、精排、重排各环节的目标、可选模型及评估指标。
避坑/得分点:
- 系统设计题要按"漏斗"讲:召回(多路、高吞吐)→ 粗排(轻量模型截断)→ 精排(CTR/CVR 多目标)→ 重排(多样性、打散、业务规则),每层配一个评估指标(如召回率、AUC、NDCG、多样性指标)。
- "生成式推荐"是 2025-2026 的新增考点,可关注其解决冷启动、长尾兴趣建模、跨域迁移等问题的思路,答出新范式理解即是差异化亮点。
备考建议
- 核心必考(出现次数 ≥ 40):Transformer(100)、注意力机制(78)、强化学习(61)、推荐系统(43)、低秩适应(42)。这五项建议投入 60% 以上复习时间,且必须练到能手写公式、白板推导的程度。
- 高频选考(出现次数 13-35):大语言模型(35)、损失函数(29)、模型微调(25)、MoE(25)、PPO(21)、多头注意力(19)、位置编码(19)、LoRA(17)、参数高效微调(17)、DPO(14)、模型训练(13)、层归一化(13)。逐项准备"原理 + 对比 + 实操"三段式答案。
- 了解即可但不可裸考(出现次数 < 13):监督微调(12)、过拟合(9)、自回归生成(3)。出现次数低不代表不会考------它们常作为高频题的追问出现(如 SFT 损失计算、KV Cache),建议挂靠到对应主线知识点一起复习。
- 用"对比表格"组织对齐类知识:RLHF/PPO/DPO/GRPO、LoRA/QLoRA/prefix-tuning/P-tuning、MHA/MQA/GQA、BN/LN、Pre-Norm/Post-Norm------素材中大量真题以"A 与 B 的区别"形式出现,整理对比表是性价比最高的复习方式。
- 准备至少一个可深挖的项目故事:真题中频繁出现"结合实操经历""你是否做过对比实验"类追问(如 LoRA rank 选择、梯度爆炸排查),提前梳理一个能讲清"问题---方案---结果---反思"的项目,比多背十个概念更有用。
数据来源于八股精(AI算法与模型研发)约 3908 条真实面试记录,覆盖 2025-2026;结论基于统计,仅供参考。