技术栈

radixattention

Briwisdom
7 天前
架构·vllm·sglang·pagedattention·radixattention
LLM 推理引擎架构:vLLM / SGLang 的核心设计副标题: PagedAttention 借用 OS 虚拟内存思想管理 KV Cache,Continuous Batching 让 GPU 不再等人,RadixAttention 进一步用前缀树实现"相同前缀不重算"——三层递进,拆解推理引擎的底层逻辑
enjoy编程
6 个月前
注意力机制·flashattention·kv cache·pd分离·pagedattention·epd分离·radixattention
Spring AI 大模型工程核心:效率的极限博弈大模型工程实践,本质是算力、显存与通信的极限优化。其核心在于四大支柱:总结:现代大模型工程已进化为“算子+并行+调度+缓存”的综合体系,掌握这些核心技术,是构建高性能、低成本服务的关键。
我是有底线的