长上下文的成本结构与「甜点区间」——从推理引擎的物理约束看 200K/256K/400K摘要:1M 上下文是当前大模型最具营销力、也最容易被误读的指标。本文不讨论「能不能支持 1M」,而是讨论一个更实质的问题:在真实推理成本与能力衰减的双重约束下,什么长度是高效工作的甜点区间。 文中全部数值来自笔者从零实现的纯 CPU 推理引擎 llmx(目标模型 Qwen3.6-35B-A3B,40 层、词表 248320、GGUF Q4_K_XL 量化),以及公开的注意力复杂度结论。核心论点是:解码器的成本由「每 token 必须搬运的字节数」决定,而这个字节数在权重项上是常数、在上下文项上是线性的;当