技术栈
chunked prefill
thesky123456
17 天前
大模型
·
服务化
·
chunked prefill
·
长上下文推理
·
kv卸载
·
ring attention
·
序列并行
27届大模型面试准备(七十四):大模型长上下文推理与服务化工程——分块 Prefill、KV 卸载与 Ring Attention
引言A13 讲了长上下文的"原理与位置编码",A29 讲了高效注意力,A69 讲了 PD 分离。本篇把这三块在工程服务化层面串起来:当用户输入 32K、128K 甚至百万 token 时,推理服务怎么不爆显存、不卡首包、还能扛住吞吐。这是长文档问答、代码仓库级理解、4MRAG 长多跳推理的必过工程关。
thesky123456
21 天前
大模型
·
抢占
·
连续批处理
·
推理调度
·
请求优先级
·
弹性扩缩容
·
chunked prefill
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性
前面(五十九)讲了推理引擎内核、(五十四)讲了成本与吞吐、(六十一)讲了可观测性。本文站在它们之上讲"调度层":当一堆请求涌进来,引擎内部怎么排队、怎么决定谁先跑、GPU 不够了怎么弹性扩缩、高优请求怎么不被长尾拖死。这是推理服务从"能跑"到"生产级稳"的关键一跳。
我是有底线的