大模型基础概念
Temperature、top p、top k 参数分别作用是什么?生产环境如何配置?
-
Temperature(温度)控制:
模型的"脑洞"越低,严谨标准答案越高;"脑洞"越大,开放性越强。
-
Top K 与 Top P:
(a) Top K:固定选择概率最高的前 K 个词。
(b) Top P:按累计概率动态选词。
-
线上业务应用:
(a) 做问答、查资料:调低温度,保证准确。
(b) 写文案、聊天:调高温度。
© 配置建议:一般优先使用 Top P 配置。
什么是大模型幻觉?产生的根本原因是什么?
幻觉就是大模型瞎编内容,看着很专业,逻辑很通顺,但实际是假的。
根本原因是模型只是概率模型,不是真的懂知识。遇到它不知道的内容,为了把话说完整,就会自己编造信息。
什么是embedding?它在AI应用中承担什么作用?
Embedding 就是把文字转变成一串数字向量。语义差不多的文字,数字向量就很接近。它最大的作用是让电脑能读懂文本语义,实现模糊匹配。语义搜索是 RAG 知识库问答的核心基础。
余弦相似度是什么?为什么向量检索普遍使用余弦相似度?
余弦相似度就是看两个向量的方向像不像,我们做文本匹配只关心语义是否一致,不在乎文字长短。所以用余弦相似度最合适,比普通的距离算法更精准、抗干扰。
基础微调、SFT监督微调、LoRA微调三者区别,各自适用场景?
全量微调是改模型所有参数,效果最好但贵、慢、耗资源;SFT是微调模型听话能力,让模型严格按照指令输出;LoRA是轻量化微调,只改少量参数,成本低、速度快,我们企业做垂直场景定制基本都用LoRA。
对比RAG微调,分别有哪些优缺点?项目中如何选择?
-
RAG:
不用训练,直接续知识库,知识能随时更新,基本不瞎编,适合企业查资料问答场景。
-
微调:
是把能力固化到模型中,响应更快,做任务更稳,但知识改变不了,成本高还会产生幻觉。
日常项目优先 RAG 固定流,固定标准化业务,再叠加微调。
什么是函数调用Function Calling,底层实现逻辑是什么
函数调用就是让大模型不再只会纯文字聊天,能够调用我们写的接口工具查数据、做计算。
其底层逻辑是:
- 我们提前告诉模型有哪些工具、怎么用。
- 模型识别用户需求后,自动生成调用参数。
- 程序帮它执行。
- 最后模型整合结果回答用户。
流式输出SSE是什么?和WebSocket相比?AI对话场景如何选择?
SSE 是基于 HTTP 的单向推送,专门用来做大模型打字机流式输出,轻量又稳定,不用自己维护连接。WebSocket 是双向通信,适合实时聊天互动场景。所以 AI 对话一律用 SSE,简单稳定。
什么是思维链 CoT,Few-Shot、Zero-Shot 是什么,如何落地使用?
CoT 就是让模型一步步思考再答题,解决逻辑推理、算术不准的问题。
Zero-shot 就是直接下指令,不用例子。
Few-shot 就是给几个标准答案案例,让模型照着学。
项目里复杂任务都会搭配 CoT + Few-shot,效果提升明显。
什么是自一致性?Self-consistency能解决模型哪些问题?
自一致性就是让模型多算几遍、多给出几个答案,选重复最多、最靠谱的那个。专门解决模型做题、推理偶尔出错、答案不稳定的问题,代价是调用成本变高、耗时变长。
本地部署大模型Ollma的优势,适合什么业务场景
ollama可以一键在本地部署开源大模型,数据不用上传外网,安全保密,还不用花API调用费,延迟也低。主要适合企业涉密内网项目、私有化部署、成本敏感的本地AI服务。
什么是MoE混合专家模型,相比稠密模型的优势
MoE专家模型就是把大模型拆成多个小专家,每次只用对应的几个专家干活,不用全量计算。对比创通稠密模型,参数更大,能力更强,但推理成本更低,现在主流大模型基本都是MoE架构
模型API调用出现超时,限流,业务层面如何处理
- 指数退避重试
- 熔断降级:基于Sentinel/Resilience4j,,接口频繁报错时触发熔断,返回兜底文案,防止雪崩。
- 限流适配:本地流量削峰
- 多模型路由
- 超时优化:分级设置超时时间,流式接口延长超时。
- 缓存兜底:高频问题缓存结果,避免重复调用AI。
什么是prompt注入攻击?有哪些典型攻击方式?
提示词注入就是用户故意输入特殊指令,篡改我们给模型设定的规则,让模型泄密、乱输出。常见的就是让模型忽略之前的指令,泄露数据。
防护方式:分隔符隔离输入,输入内容清洗、敏感词过滤、权限校验。