技术栈

ring attention

thesky123456
40 分钟前
大模型·服务化·chunked prefill·长上下文推理·kv卸载·ring attention·序列并行
27届大模型面试准备(七十四):大模型长上下文推理与服务化工程——分块 Prefill、KV 卸载与 Ring Attention引言A13 讲了长上下文的"原理与位置编码",A29 讲了高效注意力,A69 讲了 PD 分离。本篇把这三块在工程服务化层面串起来:当用户输入 32K、128K 甚至百万 token 时,推理服务怎么不爆显存、不卡首包、还能扛住吞吐。这是长文档问答、代码仓库级理解、4MRAG 长多跳推理的必过工程关。
我是有底线的