哪些推理框架支持 N‑Gram Engram 表offload(卸载)到SSD

截至 2026年9月,随着 DeepSeek 密集发布包含 Engram 架构的新模型(如最新推出的 DeepSeek-V4.1-Flash,其中包含高达 197B 的 N-Gram 记忆表),开源推理框架生态对 Engram 的支持正在迎来爆发期。 1 将 Engram 表 offload(卸载)到 SSD 硬盘或 CPU RAM(主机内存),是这一代架构的核心技术红利。因为 Engram 的查表索引仅由输入 Token 决定(与模型中间层的激活值无关),这意味着推理引擎可以在 Attention 层还没计算时,就提前计算出哈希值,并异步地从 SSD/DRAM 中预取(Prefetch)向量,从而完全隐藏存储延迟。 2, 3 目前对该特性提供支持、或处于前沿推进中的推理框架主要包括:


1. llama.cpp (支持最成熟,完美支持本地 SSD Offload)

在开源社区中,llama.cpp 是最早也是目前最完善支持将 Engram 模块完全 offload 到 SSD 的框架。 4, 5

  • 技术实现:通过 mmap 技术(内存映射文件),llama.cpp 可以将巨型的 Engram 权重文件(如 GGUF 格式中的 PLE/Engram Tensor)直接映射到本地的 NVMe SSD 上。 5
  • 优势:它利用了 SSD 级别的多线程并发读取和流式管道(Streaming Pipeline)。在本地消费级硬件(如单张 24G 显存显卡,配合高速固态硬盘)上,用户可以成功运行带巨型 Engram 表的模型,显存占用大幅下降(例如从 120GB 内存占用骤降至 90GB 以下),极大地解放了本地部署的门槛。 2, 5

2. vLLM (原生支持 CPU Offload,SSD 分层缓存推进中)

作为企业级推理的标杆,vLLM 在 DeepSeek 官方发布新模型后,已实现 Day 0 级别的原生支持。 1

  • 技术实现:目前 vLLM 官方首发支持 Engram CPU Offloading。它利用主机 Pinned Memory(锁页内存)与 GPU 之间的 PCIe 高速通道进行异步预取(Async Prefetching)。 1, 2, 4
  • SSD 支持进展:由于大规模分布式推理(如 DP Sharding for Engram)的需求,社区正在联合推进将 vLLM 的存储层与 NVMe 驱动(如通过英伟达的 ICMSP 存储层技术)对接。目前运行超大参数模型时,通常建议结合系统层的 Swap 或 NVMe 分层缓存(Multi-Level Cache Hierarchy),将"温数据"放 DRAM,"冷数据"放 SSD。 3, 6, 7, 8

3. SGLang (CPU/内存优化完备,SSD 支持开发中)

高性能推理框架 SGLang 也在积极跟进 Engram 的落地。

  • 技术实现:SGLang 已经合成了专门的 C++ 算子内核(如 engram_precompute_cpu、engram_projection_cpu 等)来优化 CPU 端的哈希计算与提取。
  • 状态:目前 SGLang 官方版本优先确保了 Pure CPU/Host Memory 上的高效查表推理,而针对本地高并发 SSD 的直接非阻塞 I/O 吞吐优化(利用 io_uring 等技术直接读盘)仍处于实验性开发分支(Experimental Branches)中。 9, 10, 11

💡 核心部署建议:

如果打算在自己的设备上把 Engram 表甩给 SSD 运行,需要注意:

  1. 硬盘速度至关重要:Engram 表即便能通过异步预取隐藏延迟,但也需要每 Token 级别 MB 级的吞吐量。必须使用 PCIe 4.0 或 5.0 的高速 NVMe M.2 SSD,传统的 SATA SSD 或机械硬盘会导致严重的 I/O 阻塞。 2, 8, 11
  2. 量化(Quantization)搭配:即便 offload 到 SSD,社区(如 Unsloth 或 Meituan LongCat 团队)也更推荐对 N-gram 表进行一定的量化(如 FP4 或 INT8),进一步缩减表格体积,从而将原本需要数十 GB 的 SSD 读取带宽降低 2-4 倍。 2, 4

1 https://x.com 2 https://www.reddit.com 3 https://generativeai.pub 4 https://github.com 5 https://www.reddit.com 6 https://github.com 7 https://www.jdon.com 8 https://arxiv.org 9 https://github.com 10 https://github.com 11 https://github.com

相关推荐
孟健9 小时前
Gemini 4 Argon 对比 GPT-6 Astra:百万 Token 输出很诱人,但我劝你先别迁编程工作流
人工智能·llm·ai编程
柒和远方12 小时前
LangSmith RAG 量化评估:从"感觉还行"到"数据说话"
langchain·llm·测试
银河技术13 小时前
TB级文本去重实战:从单机 OOM 到 Spark / Ray 分布式架构的工程演进
分布式·微服务·重构·架构·spark·llm·rag
流浪00114 小时前
大模型技术全景(十三):记忆管理 Memory
llm·memory·记忆
XLYcmy1 天前
AI 时代,MOM(制造运营管理系统)该如何演进? 下
ai·llm·agent·智能制造·数字孪生·mom·harness
大鹏的NLP博客1 天前
理解 Jev:让大模型从“生成”走向“判断”
llm·jev
SharpCJ1 天前
Koog(1) —— JVM 下的 Agent 框架
llm·agent
桃西西呀1 天前
用 Laya 把出海 App 的几百条混语评价拆成可统计的判断
人工智能·llm·ai编程
sg_knight1 天前
ZCode Bug 定位实战:把报错丢给 ZCode,它是怎么修的
llm·bug·agent·ai编程·glm·智谱·zcode