本文基于八股精约 2828 条 AI应用开发与Agent方向的真实面试记录(覆盖 2025-2026 年),对 20 个高频知识点 进行了统计与聚类分析。数据清晰显示:RAG 相关内容以绝对优势成为第一考点,Agent 架构与大模型工程能力紧随其后。以下按 6 大知识模块逐一拆解,帮你在有限复习时间里把分拿稳。

模块一:RAG 检索增强生成------无可争议的第一主战场
核心结论 :如果把 20 个知识点按出现次数排座次,RAG 生态承包了半壁江山。面试官不会只问"什么是 RAG",而是沿着索引 → 分块 → 检索 → 重排 → 生成 → 评估的全链路层层深挖,任何一环答不上来都可能暴露项目经验的水分。
出现次数数据:
| 知识点 | 出现次数 | 梯队 |
|---|---|---|
| 检索增强生成 | 107 | 断层领先 |
| RAG | 40 | 核心必考 |
| 向量数据库 | 28 | 核心必考 |
| 信息检索 | 26 | 核心必考 |
| 文档分块 | 6 | 高频选考 |
| RAG评估 | 2 | 了解即可 |
合计约 209 次 提及,占全部样本考点相当大的比重。「检索增强生成」单点 107 次,是第二名的近 3 倍,考察频次遥遥领先。
真题示例:
- 能否详细解释 RAG 从索引阶段到召回、再到生成的完整过程?
- RAG 的核心流程、知识库构建方式、检索实现方式与提示词编写方法是什么?若检索未命中或知识库无匹配内容,应如何处理?
- 如何设计一个基于向量数据库的 RAG 系统?针对线上高并发、低延迟场景如何做选型?
- 假设 Embedding 模型支持输入几十 MB 的完整文档,还有必要分块吗?分块导致的语义割裂如何解决?
- RAG 项目如何评测,有哪些维度和指标?
避坑/得分点:
- 别背流程图,要讲工程细节。"未检索到结果怎么办"这类兜底问题(拒答、降级、提示用户)是区分背书和实战的分水岭。
- 向量数据库选型要能说出具体考量维度:召回精度、QPS/延迟、成本、元数据过滤能力、是否需要混合检索。
- 分块策略要能对比:固定长度、按语义/标题切分、滑动窗口 + overlap,并能说明"即使 Embedding 支持超长输入,分块仍有必要"------因为检索粒度与噪声控制的问题依然存在。
- 评估维度建议从**检索侧(召回率、MRR)与生成侧(忠实度、答案相关性)**两条线回答,自动化工具可提 RAGAS 类方案。
模块二:Agent 架构与实现范式------从"会用"到"会设计"
核心结论 :面试官越来越关注你对 Agent 的系统性理解:什么是合格的 Agent、为什么工程落地常常退化为 Workflow、ReAct 范式的原理与局限。这一块考的是架构思维,不是名词解释。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| ReAct | 11 |
| Agent架构 | 10 |
| 智能体 | 5 |
| Agent编排 | 5 |
| 工作流 | 2 |
真题示例:
- 为什么很多 Agent 最终会以 Workflow 形式实现,而非完全自由规划?
- 你认为一个 Agent 的最小可行版本(MVP)应包含哪些核心组成部分?系统架构分几层、各层功能是什么?
- 什么是 ReAct?它的"思考-行动-观察"循环和工具调用流程是怎样的?ReAct、Plan、Reflection 三种范式的区别与适用场景?
- 推理链路含 3 个工具调用且高频请求导致延迟高,你会从哪些方向做工程优化?
- Agent 依靠什么逻辑完成工具的识别与择优调用------工具名称还是功能描述?
避坑/得分点:
- "为什么 Agent 常落地为 Workflow"是高频陷阱题,好的回答应涉及可控性、延迟、成本、幻觉风险四个维度,而不是简单说"技术不成熟"。
- ReAct 必答串行执行导致效率低的问题,优化方向可以谈并行工具调用、Prompt Caching、减少推理步数。
- Agent 编排题常结合 LangGraph(Node/Edge 的角色)考察,建议提前梳理一个框架的落地细节。
- 金融等高风险场景要能答出超时、失败重试、幂等与人工兜底策略。
模块三:大模型基础与推理机制------原理题的"深水区"
核心结论:这个模块的问题明显更偏原理层:Function Call 的完整流程、长上下文遗忘的成因、KV Cache、温度/top-p/top-k 参数。能答到原理层的候选人,会被直接归入"基础扎实"一档。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 大语言模型 | 18 |
| 大型语言模型推理 | 4 |
真题示例:
- 请描述大模型函数调用(Function Call)的完整流程,如何将自然语言语义转化为结构化参数?
- 为什么 LLM 在长上下文对话中容易"信息遗忘"?有哪些缓解机制?
- 为什么反思模块要用大模型实现,而不是规则?
- 讲解 VLLM 的 KV Cache 原理;温度值、top-p、top-k 分别是什么,各场景下的最佳设置?
- CoT 是什么,为什么效果好,有什么缺点?
避坑/得分点:
- Function Call 要讲清模型输出结构化工具调用 → 系统执行 → 结果回填 → 二次生成的闭环,别只说"模型会调 API"。
- 参数题给不出场景化建议是常见失分点:如确定性任务(抽取、分类)用低温度,创造性生成适当放宽。
- "反思为什么不用规则"这类对比题,答题框架是:规则的覆盖面有限、语言任务的模糊性、大模型的泛化与自我纠错能力,同时诚实承认规则在确定性场景更快更稳。
模块四:大模型幻觉------生产环境的"送命题"
核心结论 :幻觉相关题目几乎都带一个前提------"不能只靠加一句提示词解决,请给完整落地方案"。这是面试官在筛选做过生产系统的人,答"优化 Prompt"直接出局。
出现次数数据 :大模型幻觉 13 次。
真题示例:
- 如何处理大模型的幻觉问题?要落地生产环境,不能仅通过"请基于事实回答"这类提示词解决,请说明完整方案。
- 除了调整 Prompt,还有哪些方法可以降低 AI 幻觉的发生概率?
- 当大模型产生错误回答或幻觉时,工程和算法层面有哪些规避手段?
避坑/得分点:
- 建议按分层防御组织答案:数据层(RAG 提供事实依据)、模型层(微调、约束解码)、输出层(引用溯源、事实校验、置信度过滤)、产品层(拒答机制、人工审核兜底)。
- 能主动提"幻觉无法根除,只能降低概率 + 控制影响面",是加分的成熟认知。
- 把幻觉与 RAG 评估打通回答(如忠实度指标 Faithfulness),体现知识体系化。
模块五:多智能体系统与 Agent 记忆------进阶设计题集中地
核心结论 :多智能体(Multi-Agent)与记忆设计是资深岗位的分水岭考点,题目普遍要求结合你自己的项目架构作答,纯理论复述很难过关。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 多智能体系统 | 13 |
| Agent记忆 | 5 |
真题示例:
- 请详细描述你项目中 Multi-Agent 三层架构(Router → Manager → Sub-Agent)的设计逻辑。
- 多 LLM Agent 协同相比单 Agent 有哪些优势?又会引入哪些新的复杂性?单 Agent 与多 Agent 的设计权衡是什么?
- 你会如何设计 Agent 的长期记忆写回策略、衰减策略与冲突消解机制?
- Agent 系统中记忆通常如何分层?为什么不能仅靠聊天历史实现记忆?
避坑/得分点:
- 多 Agent 的"新复杂性"是必答项:通信开销、状态一致性、错误传播、成本与延迟放大------只讲优势不讲代价会被追问到卡壳。
- 记忆分层建议答:短期(会话上下文/缓存)→ 中期(摘要)→ 长期(向量库/结构化存储),并说明写回时机与冲突消解(新值覆盖、置信度加权、时间衰减)。
- 这类题最好绑定简历项目提前准备一套自己的架构叙述,面试官明显在验证真实性。
模块六:提示词工程与上下文管理------高频选考,性价比最高
核心结论 :提示词工程以 25 次的独立出现次数位居前列,且常与长文本、上下文压缩组合出题。这块知识门槛不高但区分度大------能否讲出 Token 成本与信息密度,直接反映工程素养。
出现次数数据:
| 知识点 | 出现次数 |
|---|---|
| 提示词工程 | 25 |
| 上下文压缩 | 4 |
| 长文本处理 | 2 |
| 大语言模型上下文窗口 | 2 |
真题示例:
- 微调(Fine-tune)与提示词(Prompt)的区别是什么?
- 输入 1 万 token 的游戏重点信息 vs 几十万 token 的全部信息,生成效果有何差别?
- 多轮对话全量拼接历史会消耗大量 Token,你会如何优化?具体如何实现上下文压缩?
- 持续向知识库添加内容导致 Prompt 越来越长,可能引发哪些问题?
- 前端上下文超出模型窗口限制时,通常有哪些解决方案?
避坑/得分点:
- "长输入 vs 精炼输入"这道题要答出长上下文中的注意力稀释/"迷失在中间"现象、成本与延迟、噪声干扰三点。
- 上下文压缩的具体手段要能落地:历史摘要、滑动窗口保留近 N 轮、关键信息抽取、按需检索代替全量拼接。
- Fine-tune vs Prompt 的经典对比:知识注入/风格对齐用微调,任务指令与快速迭代用 Prompt,成本与时效性是关键权衡。
备考建议
- 核心必考(优先投入 60% 精力) :检索增强生成(107 次)、RAG(40 次)、向量数据库(28 次)、信息检索(26 次)、提示词工程(25 次)。这五项合计出现约 226 次,是出现次数梯队的第一集团,任何一项被问倒都很难通过。建议围绕一个完整 RAG 项目把全链路细节吃透。
- 高频选考(投入 25% 精力):大语言模型(18 次)、多智能体系统(13 次)、大模型幻觉(13 次)、ReAct(11 次)、Agent架构(10 次)。这一梯队出现次数在 10-18 次区间,题目偏设计与原理,需要结合项目经验准备个性化答案,尤其是 Multi-Agent 架构与幻觉落地方案。
- 了解即可(投入 15% 精力):文档分块(6 次)、智能体(5 次)、Agent记忆(5 次)、Agent编排(5 次)、上下文压缩(4 次)、大型语言模型推理(4 次)、工作流(2 次)、长文本处理(2 次)、RAG评估(2 次)、大语言模型上下文窗口(2 次)。样本内出现次数较低,但多为大题的追问点,掌握概念与主流方案即可,不必过度深挖。
- 按"链路"复习而非按"名词"复习:数据显示题目高度场景化(如"检索未命中怎么办""延迟高如何优化"),建议以 RAG 链路和 Agent 执行链路为主线,把 20 个知识点串成两张流程图,每个节点自问"这里出了工程问题我怎么处理"。
- 准备 1-2 个可深挖的项目叙述:多智能体、Agent 记忆、编排类真题普遍以"请描述你项目中的......"开头,简历上的每个架构决策(为什么选这个向量库、为什么分三层)都要能说出权衡理由。
数据来源于八股精(AI应用开发与Agent)约 2828 条真实面试记录,覆盖 2025-2026;结论基于统计,仅供参考。