技术栈
v4.1-flash
Together_CZ
2 小时前
缓存
·
llm
·
compression
·
kv cache
·
deepseek
·
v4.1-flash
·
推动 kv 缓存压缩的极限
DeepSeek-V4.1-Flash:Pushing the Limits of KV Cache Compression——推动 KV 缓存压缩的极限
长时程智能体(long-horizon agents)的广泛应用,使模型工作负载越来越“输入密集”。虽然稀疏注意力等先前工作已经大幅降低了长上下文计算成本,但真正的瓶颈转移到了:
我是有底线的