哪些推理框架支持 N‑Gram Engram 表offload(卸载)到SSD

截至 2026年9月,随着 DeepSeek 密集发布包含 Engram 架构的新模型(如最新推出的 DeepSeek-V4.1-Flash,其中包含高达 197B 的 N-Gram 记忆表),开源推理框架生态对 Engram 的支持正在迎来爆发期。 1 将 Engram 表 offload(卸载)到 SSD 硬盘或 CPU RAM(主机内存),是这一代架构的核心技术红利。因为 Engram 的查表索引仅由输入 Token 决定(与模型中间层的激活值无关),这意味着推理引擎可以在 Attention 层还没计算时,就提前计算出哈希值,并异步地从 SSD/DRAM 中预取(Prefetch)向量,从而完全隐藏存储延迟。 2, 3 目前对该特性提供支持、或处于前沿推进中的推理框架主要包括:


1. llama.cpp (支持最成熟,完美支持本地 SSD Offload)

在开源社区中,llama.cpp 是最早也是目前最完善支持将 Engram 模块完全 offload 到 SSD 的框架。 4, 5

  • 技术实现:通过 mmap 技术(内存映射文件),llama.cpp 可以将巨型的 Engram 权重文件(如 GGUF 格式中的 PLE/Engram Tensor)直接映射到本地的 NVMe SSD 上。 5
  • 优势:它利用了 SSD 级别的多线程并发读取和流式管道(Streaming Pipeline)。在本地消费级硬件(如单张 24G 显存显卡,配合高速固态硬盘)上,用户可以成功运行带巨型 Engram 表的模型,显存占用大幅下降(例如从 120GB 内存占用骤降至 90GB 以下),极大地解放了本地部署的门槛。 2, 5

2. vLLM (原生支持 CPU Offload,SSD 分层缓存推进中)

作为企业级推理的标杆,vLLM 在 DeepSeek 官方发布新模型后,已实现 Day 0 级别的原生支持。 1

  • 技术实现:目前 vLLM 官方首发支持 Engram CPU Offloading。它利用主机 Pinned Memory(锁页内存)与 GPU 之间的 PCIe 高速通道进行异步预取(Async Prefetching)。 1, 2, 4
  • SSD 支持进展:由于大规模分布式推理(如 DP Sharding for Engram)的需求,社区正在联合推进将 vLLM 的存储层与 NVMe 驱动(如通过英伟达的 ICMSP 存储层技术)对接。目前运行超大参数模型时,通常建议结合系统层的 Swap 或 NVMe 分层缓存(Multi-Level Cache Hierarchy),将"温数据"放 DRAM,"冷数据"放 SSD。 3, 6, 7, 8

3. SGLang (CPU/内存优化完备,SSD 支持开发中)

高性能推理框架 SGLang 也在积极跟进 Engram 的落地。

  • 技术实现:SGLang 已经合成了专门的 C++ 算子内核(如 engram_precompute_cpu、engram_projection_cpu 等)来优化 CPU 端的哈希计算与提取。
  • 状态:目前 SGLang 官方版本优先确保了 Pure CPU/Host Memory 上的高效查表推理,而针对本地高并发 SSD 的直接非阻塞 I/O 吞吐优化(利用 io_uring 等技术直接读盘)仍处于实验性开发分支(Experimental Branches)中。 9, 10, 11

💡 核心部署建议:

如果打算在自己的设备上把 Engram 表甩给 SSD 运行,需要注意:

  1. 硬盘速度至关重要:Engram 表即便能通过异步预取隐藏延迟,但也需要每 Token 级别 MB 级的吞吐量。必须使用 PCIe 4.0 或 5.0 的高速 NVMe M.2 SSD,传统的 SATA SSD 或机械硬盘会导致严重的 I/O 阻塞。 2, 8, 11
  2. 量化(Quantization)搭配:即便 offload 到 SSD,社区(如 Unsloth 或 Meituan LongCat 团队)也更推荐对 N-gram 表进行一定的量化(如 FP4 或 INT8),进一步缩减表格体积,从而将原本需要数十 GB 的 SSD 读取带宽降低 2-4 倍。 2, 4

1 https://x.com 2 https://www.reddit.com 3 https://generativeai.pub 4 https://github.com 5 https://www.reddit.com 6 https://github.com 7 https://www.jdon.com 8 https://arxiv.org 9 https://github.com 10 https://github.com 11 https://github.com

相关推荐
武子康1 小时前
SGLang 回答慢,时间究竟花在了哪里?
人工智能·llm·agent
2601_962297482 小时前
基于LangChain+LLM大模型+机器学习的恶意域名(流量)智能检测系统
机器学习·langchain·llm·恶意域名·流量检测
流浪0012 小时前
大模型技术全景(八):MCP,大模型的“万能插头“——一次集成处处运行
llm
AINative软件工程3 小时前
LLM 应用的测试替身工程实践:用 Fake/Stub/Mock 让 AI 代码真正跑起来 CI
单元测试·llm·ai编程
武子康17 小时前
小智的 MQTT 已连接,为什么还不能说话?从音频通道看协议选择
人工智能·llm·agent
tachibana221 小时前
什么是 Function Calling ?
数据库·人工智能·ai·llm·agent
武子康1 天前
让 SGLang 按 JSON 回答,怎样少写一些补救代码
人工智能·llm·agent
Darling噜啦啦1 天前
Text2SQL 实战:自然语言直连数据库,让 AI 自动写 SQL 完成 CRUD 与多表联查
llm·sql server
Darling噜啦啦1 天前
LLM 结构化输出进阶:withStructuredOutput 一行封装 Tool Call,从流式输出到 MySQL 落地
langchain·llm