- KV Cache
- int量化
- PagedAttention
- GQA
- Speculative Decoding
常见的LLM推理加速解决方案
transformer_WSZ2023-12-04 15:51
相关推荐
leeyi35 分钟前
Langfuse 集成源码:batch 协议、media 上传与 mock 测试(第89篇-E75)修远客38 分钟前
风格进化:让Agent越来越懂你 — 从"工具"到"助手"的关键跃迁武子康1 小时前
Pi Extension 写完不等于可用:从类型检查到真实 Runtime 的证据阶梯一只积极向上的小咸鱼2 小时前
分词器tokenizerAINative软件工程3 小时前
LLM Token Budget 工程实践:给每个请求设上限,让成本和质量都在掌控中魔术师Grace16 小时前
大模型到底怎么分类?从“聊天模型”走到 Agent 模型选型京东云开发者18 小时前
让AI真正参与工作!JoyDesk已上线京东云XLYcmy19 小时前
小红书 算法一面 七程序猿DD20 小时前
OctaFuse Gateway 2.6.0:完善 Vertex AI 鉴权、图片计费与日常调试XLYcmy21 小时前
小红书 算法一面 八