【面试】AI算法工程师_空白自测版本

文章目录

面试题库(120题·空白自测版)

覆盖岗位:AI Agent算法工程师 / 大模型应用工程师 / NLP方向应用工程师 / 算法工程师(大模型、视觉、部署方向)


一、大模型基础原理(1-20)

(0)Transformer架构简述

之前的Transformer:

输入->位置嵌入编码->Encoder->Decoder->输出

(1)简述 Transformer 架构,Encoder 和 Decoder 的区别。

transformer架构由Encode, Decoder堆叠而成,核心是self-attention(自注意力机制)和Feedward(前馈神经网络)构成。

Encode是双向的,适用于理解式任务(如Bert)。Decoder是单向的,适用于生成式任务(比如GPT和Lamma等)。目前主流的NLP任务都已经被Decoder-only为主要架构的生成式任务统一了。

(2)Self-Attention 的计算公式,为什么要除以 √dk?

self-attention的计算公式: Attention(Q, K, V)=softmax(QK^T / √dk) V。其中Q^T会随着√dk变大而变大,而会逐渐的趋近与dk,所以要除一下,让方差趋近于1附近,让梯度保持健康。

(3)Multi-Head Attention 的作用是什么?

  • 把QKV投影到各自的子空间做attention再拼接,
  • 让模型从不同子空间关注不同位置的信息,比如有的head关注语法,有的关注语义。
  • 计算量与单头接近(因为每头的维度缩小),但是表达能力更强。

(4)位置编码有哪些方式?RoPE 的原理是什么?

位置编码的作用:是Transformer里边用来告诉模型(每个词在句子中的顺序位置应该是什么),因为Transformer的核心(自注意力机制)本身不知道顺序。

因为Self-attention本质计算:

Attention(Q, K, V)=softmax(QK^T / √dk) V

它关注的是Token和Token之间的关系,但是没有Token的先后顺序。

  • 绝对位置编码:sinusoidal(正余弦),learned(可学习)
  • 相对位置编码:T5 relative bias, Alibi
  • RoPE(旋转位置编码):通过旋转矩阵把绝对位置信息以相对形式注入Q/K,使内积结果只依赖相对位置。优点:外推性好,支持上下文扩展。
(5)LayerNorm 和 RMSNorm 的区别?

LayerNorm和RMSNorm都是Transformer大模型中归一化技术,作用是:稳定训练,让神经网络每一层输出的数据分布更稳定,从而更容易训练,更深。它们经常出现在LLM(GPT,LLAMA,Qwen,Claude)的Transformer Block中。

如果直接用Transformer的每一层输出,x = [10.2, 0.5, -8.3, 4.7],下一层接收到这么大的数值差异,训练时梯度容易,爆炸,小时,收敛慢等。

  • LayerNorm对每个样本按特征维度做减均值除标准差,再缩放平移。
  • RMSNorm去掉减均值这一步,只用均方根归一化。计算量更小,速度更快,效果相当,LLAMA系列都用RMSNorm
  1. Pre-norm 和 Post-norm 的区别?哪个更适合深层模型?

  2. KV Cache 原理,为什么能加速推理?

  3. MQA / GQA 的原理和区别?

  4. Flash Attention 的原理和收益?

  5. 大模型训练的三阶段:预训练、SFT、RLHF 分别是什么?

  6. LoRA 的原理,为什么能减少训练参数?

  7. QLoRA 相比 LoRA 的改进是什么?

  8. PPO 和 DPO 的区别?

  9. 解码策略 Greedy / Beam / Top-k / Top-p / Temperature 的区别?

  10. 大模型幻觉问题的原因和缓解方法?

  11. 扩展上下文窗口的方法有哪些?

  12. 什么是大模型的涌现能力?

  13. MoE(Mixture of Experts)架构原理?

  14. 大模型常见评测指标有哪些?

  15. 大模型的 Bias 和 Toxicity 问题如何缓解?


二、RAG 检索增强生成(21-40)

  1. RAG 的基本流程是什么?

  2. 为什么用 RAG 而不是直接微调?

  3. Chunking 分块策略有哪些?

  4. Embedding 模型如何选择?

  5. 向量数据库 FAISS / Milvus / Chroma 的对比?

  6. 向量相似度度量:余弦、点积、欧氏,怎么选?

  7. HNSW 索引原理?

  8. RAG 检索召回率低的原因和优化方法?

  9. 什么是混合检索(稀疏 + 稠密)?

  10. Rerank 重排的作用和常用模型?

  11. Query 改写 / 扩展有哪些方法?

  12. Parent-Child Chunking 是什么?

  13. 多路召回如何融合?

  14. RAG 中如何规避幻觉?

  15. 知识库更新策略有哪些?

  16. RAG 中表格和图片如何处理?

  17. 如何评估 RAG 系统?RAGAS 指标有哪些?

  18. 长文本 RAG 怎么做?

  19. Self-RAG / Corrective RAG 是什么?

  20. Embedding 维度选择的 trade-off?


三、Agent 与 LangChain/LangGraph(41-65)

  1. Agent 的核心组件有哪些?

  2. ReAct 模式的原理?

  3. Plan-Execute 模式与 ReAct 的区别?

  4. LangChain 的核心概念:Chain / Agent / Tool / Memory?

  5. LangGraph 的 StateGraph 是什么?

  6. LangChain 的 LCEL 是什么?

  7. Tool Calling / Function Calling 的原理?

  8. 多 Agent 协作架构有哪些模式?

  9. Agent 的短期记忆 vs 长期记忆?

  10. Agent Memory 的常见实现方式?

  11. Agent 任务分解策略有哪些?

  12. Agent 异常恢复机制如何设计?

  13. Agent 状态管理怎么做?

  14. LangGraph 的 Checkpoint 机制?

  15. ReAct / Plan-Execute / Reflexion 三者对比?

  16. LangChain 中 Agent 有哪些类型(旧 AgentExecutor)?

  17. 如何开发自定义 Tool?

  18. Agent 循环终止条件怎么设计?

  19. 多 Agent 之间如何通信?

  20. Reflexion 反思机制怎么实现?

  21. LangGraph 如何实现 Human-in-the-loop?

  22. Tool 输出如何结构化?

  23. Agent 如何并发执行?

  24. LangGraph 的条件边怎么用?

  25. Agent 推理成本与响应速度如何优化?


四、提示词工程(66-75)

  1. Few-shot 提示的原理和注意点?

  2. Chain-of-Thought (CoT) 思维链是什么?

  3. Zero-shot CoT 和 Few-shot CoT 区别?

  4. Self-Consistency 是什么?

  5. 什么是提示注入攻击,如何防御?

  6. System Prompt 如何设计?

  7. 角色扮演提示的作用和风险?

  8. 提示词鲁棒性如何提升?

  9. 如何让 LLM 输出结构化 JSON?

  10. Prompt 模板如何工程化管理?


五、模型部署与工程化(76-90)

  1. vLLM 的核心原理 PagedAttention 是什么?

  2. Continuous Batching 是什么?

  3. Ollama 的原理和定位?

  4. 模型量化有哪些方法?INT8 / GPTQ / AWQ / GGUF 区别?

  5. KV Cache 量化的作用?

  6. 如何用 Docker 部署大模型服务?

  7. 如何用 FastAPI 封装模型服务?

  8. Speculative Decoding(推测解码)原理?

  9. TensorRT-LLM 是什么?

  10. 张量并行(TP)和流水线并行(PP)的区别?

  11. 流式输出如何实现?

  12. 模型服务如何扛高并发?

  13. 知识蒸馏原理?

  14. 大模型推理优化手段总结?

  15. 模型加载与显存管理要点?


六、NLP 基础(91-100)

  1. 文本分类有哪些方法?

  2. 命名实体识别(NER)怎么做?

  3. 信息抽取有哪些子任务,怎么做?

  4. 抽取式摘要和生成式摘要的区别?

  5. BERT 的原理?

  6. 文本相似度怎么计算?

  7. 分词算法 BPE / WordPiece / SentencePiece 区别?

  8. 困惑度 PPL 是什么?

  9. 文本纠错怎么做?

  10. 多模态理解的基本原理?


七、计算机视觉(101-115)

  1. YOLO 系列的演进要点?

  2. 目标检测评价指标 mAP 怎么算?

  3. U-Net 分割的原理?

  4. 语义分割、实例分割、全景分割区别?

  5. OCR 的基本流程?

  6. 模型轻量化有哪些方法?

  7. QAT(量化感知训练)和 PTQ 的区别?

  8. 知识蒸馏在 CV 中怎么用?

  9. 模型端侧部署要点?

  10. 数据增强方法有哪些?

  11. SAM 分割大模型原理?

  12. DETR 原理和贡献?

  13. Anchor-free 检测原理?

  14. NMS 原理和改进?

  15. IoU / GIoU / CIoU / DIoU / Focal Loss 各是什么?


八、Python / PyTorch / 深度学习基础(116-120)

  1. PyTorch autograd 自动求导原理?

  2. DataLoader 和分布式训练要点?

  3. 梯度消失和爆炸原因及解决?

  4. 过拟合如何处理?

  5. 优化器 SGD / Adam / AdamW 区别?


自测使用建议

  • 先不看答案通答一遍,标记"卡壳/空白"的题号。
  • 每个题尝试口头讲满 2 分钟(模拟面试)。
  • 重点重练卡壳题,第二天复述巩固。
  • 划重点:报考哪个岗位重点刷哪个模块(详见带答案版"复习建议")。
相关推荐
wu_jing_sheng08 分钟前
哨兵卫星数据下载工具:基于CDSE的PySide6桌面应用开发实践
人工智能
小唔w10 分钟前
2026年AI培训行业观察:主流学习渠道一览
人工智能·学习
美狐美颜sdk12 分钟前
直播APP开发技术架构解析:从音视频流到第三方美颜SDK接入的完整方案
大数据·人工智能·音视频·美颜sdk·美颜api
wabs66613 分钟前
关于图论【A*算法 | 卡码网127.骑士的攻击的思考】
数据结构·算法·图论·卡码网·广搜的改进版
CIO_Alliance20 分钟前
AI认知系列(3)| 数据、算法、算力、场景四要素协同
人工智能·算法·ipaas·系统集成·企业cio联盟·企业级ai化转型
技术传感器28 分钟前
让 Hermes 自动完成一个软件需求:从 Issue 到 PR 的 AI 开发流水线
人工智能·架构·aigc·需求分析·issue
啥都想学点的研究生29 分钟前
一篇文章讲清楚:机器学习的相关概念
人工智能·机器学习
Capricorn198836 分钟前
知芽研究问题看板无法推进?从孵化区到笔记的机制排查指南
大数据·论文阅读·人工智能·笔记·学习方法·论文笔记
Wang's Blog1 小时前
AI Agent白手起家76:使用 CrewAI 搭建多智能体营销策略生成器
人工智能