- KV Cache
- int量化
- PagedAttention
- GQA
- Speculative Decoding
常见的LLM推理加速解决方案
transformer_WSZ2023-12-04 15:51
相关推荐
音视频牛哥10 分钟前
从 LLM、VLA、LLA、SLIM 到实时音视频感知底座:具身智能真正需要的不只是大模型我是小邵31 分钟前
长对话先收口:用“工作记忆 vs 长期记忆“管理 AI 上下文liulilittle38 分钟前
麻将结算全链路语义(SETTLE_SEMANTICS)武子康1 小时前
vLLM 的 token 预算还有余量,为什么请求仍被抢占?liulilittle3 小时前
麻将服务器崩溃补偿与异常处理语义(CRASH_SEMANTICS)liulilittle3 小时前
麻将 UI 层可观察行为(UI_BEHAVIOR)liulilittle4 小时前
麻将节点间路由转发链:失败回退与错误传播语义(ROUTE_SEMANTICS)liulilittle5 小时前
mock 框架架构liulilittle5 小时前
C++ 引擎接口到 mock 的映射(INTERFACE_MAP)