大模型推理加速新方向:中科曙光 ParaCache 用存储换计算

8 月 28 日,在贵阳举行的 2026 中国国际大数据产业博览会(数博会)期间,中科曙光发布了一款面向大模型推理的词元加速方案 ParaCache。官方说法很直白:让大模型少做重复计算。

这个热点本质是什么

要理解 ParaCache,得先知道推理为什么贵。大模型生成回答时,每算一个 token 都要把前面所有 token 的中间状态(即 KV Cache,键值缓存)存在显存里。上下文越长、并发越高,KV Cache 占的显存就越夸张------长上下文场景下,显存里可能塞满了缓存而不是模型本身。HBM 又贵又少,这成了推理成本下不去的核心瓶颈之一。据报道,信通院报告显示 2025 年全球大模型推理计算量较上年提升超过 100 倍。

先补一个背景概念:大模型回答一句话,前半段叫 prefill------把整个 prompt 从头算一遍,把中间状态存成 KV Cache;后半段叫 decode------每吐一个 token 算一次。同一个 prompt 在大量请求里反复出现时,prefill 就在反复白算,这是推理成本里最浪费的部分。ParaCache 的思路是把它当成存储问题来解决:

  • 把 KV Cache 从"只活在显存里"变成四级缓存体系:GPU HBM → CPU 内存 → 本地 SSD → 分布式共享存储;
    • 通过全局统一的数据视图和元数据管理,让缓存按"热度"自动流转:热数据留在 HBM 快速响应,冷数据下沉到低成本层(据官方介绍);
    • 跨请求、跨计算节点复用已算好的结果 ,减少重复的 prefill 计算------官方的说法是"以存代算"。
      实测数据(据报道):单轮对话的首词元时延(TTFT,即用户提问后到 AI 吐出第一个字的时间)最高可降低 98.5%,高并发场景下词元吞吐量最大提升 27 倍。

这个方向和行业里已有的尝试一脉相承:vLLM 的 prefix caching、PagedAttention,开源的 LMCache(面向 vLLM/SGLang 的 KV Cache 缓存层,据其项目介绍),NVIDIA 也在做全局 KV Cache 存储方案。变的是国内厂商把它做成了软硬结合的产品化方案,从"堆 GPU"转向"存算协同"------本质还是那笔账:GPU 算力贵,能省一次 prefill 就省一次。

对普通开发者意味着什么

如果只是调 API,你感知不到 ParaCache 本身,但你会感知到它的结果:TTFT 是用户等第一个字的体感,吞吐量直接决定并发成本。各家大模型 API 价格战打到今天,"词元经济"拼的就是谁能在同样算力下产出更多 token。

对做私有化部署的团队,这个方向提示了一件事:推理成本优化已经不止是调参,而是基础设施层面的事。模型能力卷到头之后,工程效率就是新的竞争点。对做 AI 应用的人来说,成本结构里推理占比越大,这类优化越值得关注;如果只是偶尔调接口,感受主要来自 API 价格的变化。

怎么用、怎么选、有哪些坑

ParaCache 是厂商方案,普通人接触不到内部实现,但 KV Cache 优化的通用手段可以自己上手,尤其是 vLLM 这类推理框架自带的能力:

bash 复制代码
vllm serve Qwen/Qwen2.5-7B-Instruct \
  --gpu-memory-utilization 0.9 \
    --max-model-len 32768 \
      --enable-prefix-caching
      ```
几个要点:

- **`--enable-prefix-caching` 开启前缀缓存**:对固定 system prompt、RAG 模板、多轮对话这类"前面内容反复出现"的场景收益最大,因为 prefill 阶段的计算被直接复用;每次 prompt 都完全不同的场景收益有限;
- - **`--gpu-memory-utilization` 给 KV Cache 留足显存**:设得太低,缓存放不下,长上下文直接崩或者反复重算;设得太高,模型加载都可能失败,需要压测着调;
- - **开源替代可以关注 LMCache**:面向 vLLM/SGLang 的 KV Cache 缓存层,支持跨引擎复用缓存(据其项目介绍),适合自己搭服务的人研究;
- - **冷热分层有代价**:KV Cache 下沉到 SSD 意味着走存储带宽,延迟和吞吐的收益不是所有场景都有,官方那个 98.5% 是理想环境实测,生产环境要拿自己的并发模型重新测;
- - **压测要用自己的场景**:长上下文加高并发是 KV Cache 压力最大的组合,优化前后用同一个压测脚本对比 TTFT 和吞吐,别只看厂商给的单点数据。
还有个现实问题:这类"存算协同"方案往往和特定硬件、特定推理框架绑定,选型时先确认兼容性,别为了一张架构图推翻现有技术栈。

一句话总结:大模型推理的战场正在从"模型能力"转向"工程效率",对做部署、做成本优化的人来说,KV Cache 怎么管,会成为接下来成本竞争的关键变量。你怎么看,评论区聊聊。
相关推荐
MartinYeung520 分钟前
[论文学习]激活差异揭示后门:SAE架构对比研究
人工智能·学习·架构
小猴子爱上树22 分钟前
跨境电商AI批量图片翻译工具,视频字幕翻译免费试用
人工智能·python·音视频
开开心心就好22 分钟前
电子教鞭工具支持画框写字插图片功能齐全
android·开发语言·前端·javascript·人工智能·pdf·html
APItesterCris23 分钟前
告别人工盯品:借助 OpenClaw 搭建商品自动监控与数据分析系统(完整实操)
大数据·数据库·数据仓库·自动化
Dovis(誓平步青云)29 分钟前
拍视频前先把镜头想清楚:做一个分镜取景辅助器
android·java·服务器·javascript·人工智能
高洁0133 分钟前
Teacher Forcing技术解析
人工智能·python·深度学习·transformer·知识图谱
MartinYeung541 分钟前
[论文分析]使大型语言模型智能体与理性和道德偏好对齐:一种监督微调方法
人工智能·机器学习·语言模型
AI服务老曹43 分钟前
车牌识别算法接入AI视频分析平台的流程和误报优化
人工智能·算法·音视频
GrowthRadar1 小时前
CNC柔性自动化工程验收标准:专业协作机器人集成商的四大核心技术能力
人工智能·机器人·自动化