大模型推理加速新方向:中科曙光 ParaCache 用存储换计算

8 月 28 日,在贵阳举行的 2026 中国国际大数据产业博览会(数博会)期间,中科曙光发布了一款面向大模型推理的词元加速方案 ParaCache。官方说法很直白:让大模型少做重复计算。

这个热点本质是什么

要理解 ParaCache,得先知道推理为什么贵。大模型生成回答时,每算一个 token 都要把前面所有 token 的中间状态(即 KV Cache,键值缓存)存在显存里。上下文越长、并发越高,KV Cache 占的显存就越夸张------长上下文场景下,显存里可能塞满了缓存而不是模型本身。HBM 又贵又少,这成了推理成本下不去的核心瓶颈之一。据报道,信通院报告显示 2025 年全球大模型推理计算量较上年提升超过 100 倍。

先补一个背景概念:大模型回答一句话,前半段叫 prefill------把整个 prompt 从头算一遍,把中间状态存成 KV Cache;后半段叫 decode------每吐一个 token 算一次。同一个 prompt 在大量请求里反复出现时,prefill 就在反复白算,这是推理成本里最浪费的部分。ParaCache 的思路是把它当成存储问题来解决:

  • 把 KV Cache 从"只活在显存里"变成四级缓存体系:GPU HBM → CPU 内存 → 本地 SSD → 分布式共享存储;
    • 通过全局统一的数据视图和元数据管理,让缓存按"热度"自动流转:热数据留在 HBM 快速响应,冷数据下沉到低成本层(据官方介绍);
    • 跨请求、跨计算节点复用已算好的结果 ,减少重复的 prefill 计算------官方的说法是"以存代算"。
      实测数据(据报道):单轮对话的首词元时延(TTFT,即用户提问后到 AI 吐出第一个字的时间)最高可降低 98.5%,高并发场景下词元吞吐量最大提升 27 倍。

这个方向和行业里已有的尝试一脉相承:vLLM 的 prefix caching、PagedAttention,开源的 LMCache(面向 vLLM/SGLang 的 KV Cache 缓存层,据其项目介绍),NVIDIA 也在做全局 KV Cache 存储方案。变的是国内厂商把它做成了软硬结合的产品化方案,从"堆 GPU"转向"存算协同"------本质还是那笔账:GPU 算力贵,能省一次 prefill 就省一次。

对普通开发者意味着什么

如果只是调 API,你感知不到 ParaCache 本身,但你会感知到它的结果:TTFT 是用户等第一个字的体感,吞吐量直接决定并发成本。各家大模型 API 价格战打到今天,"词元经济"拼的就是谁能在同样算力下产出更多 token。

对做私有化部署的团队,这个方向提示了一件事:推理成本优化已经不止是调参,而是基础设施层面的事。模型能力卷到头之后,工程效率就是新的竞争点。对做 AI 应用的人来说,成本结构里推理占比越大,这类优化越值得关注;如果只是偶尔调接口,感受主要来自 API 价格的变化。

怎么用、怎么选、有哪些坑

ParaCache 是厂商方案,普通人接触不到内部实现,但 KV Cache 优化的通用手段可以自己上手,尤其是 vLLM 这类推理框架自带的能力:

bash 复制代码
vllm serve Qwen/Qwen2.5-7B-Instruct \
  --gpu-memory-utilization 0.9 \
    --max-model-len 32768 \
      --enable-prefix-caching
      ```
几个要点:

- **`--enable-prefix-caching` 开启前缀缓存**:对固定 system prompt、RAG 模板、多轮对话这类"前面内容反复出现"的场景收益最大,因为 prefill 阶段的计算被直接复用;每次 prompt 都完全不同的场景收益有限;
- - **`--gpu-memory-utilization` 给 KV Cache 留足显存**:设得太低,缓存放不下,长上下文直接崩或者反复重算;设得太高,模型加载都可能失败,需要压测着调;
- - **开源替代可以关注 LMCache**:面向 vLLM/SGLang 的 KV Cache 缓存层,支持跨引擎复用缓存(据其项目介绍),适合自己搭服务的人研究;
- - **冷热分层有代价**:KV Cache 下沉到 SSD 意味着走存储带宽,延迟和吞吐的收益不是所有场景都有,官方那个 98.5% 是理想环境实测,生产环境要拿自己的并发模型重新测;
- - **压测要用自己的场景**:长上下文加高并发是 KV Cache 压力最大的组合,优化前后用同一个压测脚本对比 TTFT 和吞吐,别只看厂商给的单点数据。
还有个现实问题:这类"存算协同"方案往往和特定硬件、特定推理框架绑定,选型时先确认兼容性,别为了一张架构图推翻现有技术栈。

一句话总结:大模型推理的战场正在从"模型能力"转向"工程效率",对做部署、做成本优化的人来说,KV Cache 怎么管,会成为接下来成本竞争的关键变量。你怎么看,评论区聊聊。
相关推荐
MobotStone10 小时前
做了几个 Agent 项目后,我发现:真正拉开 AI 产品经理差距的,不是技术
人工智能·架构
孟健10 小时前
Qwen3.8-27B 本地推理实测:从 14 tok/s 到 159 tok/s 的投机解码调优
人工智能·llm·ai编程
思无邪6610 小时前
用 AI 做 JS 逆向:从抓包到复现的完整方法论
开发语言·javascript·人工智能
KeyAction666610 小时前
AI改写战争规则,也在改写商业规则:体系对抗时代已经到来
大数据·人工智能
小蒋观天下10 小时前
专项方案:大场景港口AI安防、多干扰环境下的算法调优与落地实操
人工智能·深度学习·算法·安全·机器学习·计算机视觉·ai大模型
冬奇Lab10 小时前
一天一个开源项目(第231篇):MiniMind —— 花3块钱、2小时,从零训练一个 64M 参数的大语言模型
人工智能·开源·资讯
揽秀亭长11 小时前
视频转脚本有哪些方法?5种方案技术拆解
人工智能·音视频
冬奇Lab11 小时前
LLM 驱动的自动化测试系列(07):移动端自动化(三)——Mobile-Agent-v3 与自研 GUI-Owl 模型路线
android·人工智能·测试
乃嘿仔11 小时前
AI 热点日报 · 2026-10-08
人工智能·chatgpt
Qyr9911 小时前
2026年全球二极管模组行业市场规模全景研判:竞争格局与发展趋势全解析
大数据·人工智能