- KV Cache
- int量化
- PagedAttention
- GQA
- Speculative Decoding
常见的LLM推理加速解决方案
transformer_WSZ2023-12-04 15:51
相关推荐
桃西西呀17 小时前
Spring AI Alibaba 之七:我没写一行 tracing 埋点,Agent 每一步却被 Micrometer 看得清清楚楚桃西西呀17 小时前
Spring AI Alibaba 之八:我让 Agent 直接执行 shell 命令,它却读到了目录里的密钥,沙箱到底防住了什么MoonOut19 小时前
LLM | OpenAI 兼容模式 与 Anthropic 协议的区别架构师那点事儿20 小时前
Agent Skill: 视频/PPT 内容提取 Skill —— 从 0 到 1 诞生记 + 使用指南lucas_AI20 小时前
CPSE:只给 3 篇范文,让 LLM 学会你的 478 字段抽取 schema,还不许动接口AINative软件工程21 小时前
LLM 应用的 Adaptive Batching 工程实践:动态合批把吞吐提升 3 倍,但延迟的坑你踩过吗范中勤1 天前
LLM 动态加载与多用户缓存架构技术文档流浪0011 天前
大模型技术全景(二十):RAG 文本分块策略与语义完整性10年前端老司机1 天前
你的RAG检索正在“高效地重复废话”:一文彻底搞懂MMR算法stereohomology1 天前
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览