LLM面试相关汇总

(1)大模型加速基础知识:

https://blog.eimoon.com/p/optimizing-llm-inference/

存在问题:

1.模型参数大

  • 模型量化

2.上下文长,KV cache存储要求高

  • **PagedAttention:**分片存储
  • 相同前缀共享kv cache
  • KV cache优化:MQA/GQA
  1. decode是逐个解码,频繁访问kv cache
  • 推测解码
  1. 批处理长短不一
  • 连续批处理

其他策略:

模型并行

(2)大模型训练

lora,Q lora

Q lora

由于 LoRA 微调时不需要更新原本的模型参数,可以对它们进行 8bit 甚至 4bit 量化存储,节省显存、加速训练

https://zhuanlan.zhihu.com/p/649776098

(3)大模型量化

https://segmentfault.com/a/1190000047522881

LLM 的实际部署过程中,常见的量化方案包括:

  • W4A16(GPTQ、AWQ) :权重量化为 INT4,激活保持 FP16/BF16。
  • W8A16 : 权重量化为 INT8,激活保持 FP16/BF16。
  • W8A8(SmoothQuant): 权重和激活均量化为 INT8。
  • KV​ Cache INT8 :缓解长上下文显存开销。

GPTQ 量化的优点:

  • 无须重新训练(仅需少量校准数据)。
  • 量化精度接近全精度,4bit GPTQ 能维持 LLaMA、OPT 等模型接近 FP16 的性能。
  • 速度快,实用性强,已成为主流 LLM 低比特推理方法。

GPTQ 量化的缺点:

  • 量化过程涉及 Hessian 矩阵近似和逐元素优化,计算复杂度较高。
  • 一般只量化权重,激活量化效果不佳(通常保持 FP16)。
相关推荐
杨运交3 小时前
[060][调度模块]Redisson vs Redis 原生锁:两种分布式锁实现深度对比
数据库·redis·分布式
FungLeo3 小时前
Node 后端实战 · 列表查询到底怎么写?一个通用 DSL 封装,过滤分页排序一次搞定
数据库·node.js·serverless·dsl 封装·通用列表查询
何以解忧,唯有..4 小时前
深入理解与应对:Redis 缓存雪崩、击穿、穿透三大经典问题
redis·缓存·mybatis
抓蛙师4 小时前
多租户 tenant_id SQL 注入漏洞分析与应急响应报告
数据库·sql
ACP广源盛139246256734 小时前
Qwen3.8‑2.4T 开源落地@ACP#国产 MoE 私有化部署下 GSV2221 视频转换芯片机遇分析
大数据·数据库·人工智能
七牛开发者5 小时前
为什么 Go 很适合 AI 辅助开发?
数据库·人工智能·python·elasticsearch·log4j
何以解忧,唯有..7 小时前
数据库索引失效的常见情况与优化策略
数据库·sql·oracle
这个DBA有点耶7 小时前
分布式数据库到底该不该上?从判断标准到架构选型的实战思考
数据库·架构·dba
启雀AI8 小时前
培训平台移动端离线学习方案设计与实现:视频缓存、断点续传与进度同步的工程实践
android·学习·缓存·音视频·企业lms
01_ice8 小时前
MySQL库和表的操作
数据库·mysql