Strata 的工作原理

Strata 是一个高性能推理引擎,目标是在单张消费级显卡(≥12GB VRAM)+ ≥32GB 系统内存 + SSD 的家用 PC 上运行 1250 亿参数的 MoE 模型(Qwen3.8-Flash-Next),达到 60--95 tokens/s 的生成速度

一句话总结

GPU 做每个 token 都要做的密集部分 + 热门专家,CPU 与 GPU 并行算冷门专家(专家全驻留 RAM),SSD 只放 n-gram 表,再用 MTP + prompt lookup 投机解码一次产出多个 token------通过把整个 PC 变成推理流水线,把 125B 模型塞进了 12GB 显卡。

核心思想:三级分层卸载

模型是 MoE 架构:48 层、共 24,576 个专家,但每个 token 只激活约 10 个专家------所以不需要把所有专家都放进显存

Strata 把工作分摊到三个硬件层级:

  • GPU(VRAM) :存放每个 token 都需要的部分------attention 与 DeltaNet mixer、门控残差权重、路由器(router)、共享专家、输出头、MTP 草稿层、KV cache(长上下文时部分从 RAM 流式读取),以及一个自适应专家缓存 ,剩余显存全部用来装最常用专家(每多 1GB 显存约多放 ~700 个专家) 3
  • 系统 RAM :pin 住全部 24,576 个专家。当路由选中了不在 GPU 缓存中的专家时,CPU 用 AVX-512/AVX2 内核就地计算,与 GPU 并行,互不等待。低内存模式下可只保留 GPU 放不下的那部分专家
  • SSD:存放 28.8GB 的 n-gram 查找表,每 token 只读几行,走 OS 页缓存

同一套引擎既编译为 NVIDIA CUDA 也可编译为 AMD HIP

专家放置与取回路径

  • ExpertCache 维护 (layer, expert) → VRAM 槽位的驻留表,并按每层配额分配槽位,防止靠前的层垄断显存
  • 缓存未命中时走 ExpertSource/FileExpertSource:RAM 驻留专家由 PinnedArena 管理(可用大页、可部分注册给 CUDA 做 DMA),非驻留的从 SSD 按区间加载
  • resident_stage_swaps 负责 GPU 缓存与 RAM 之间的专家换入换出

执行流程:

重叠执行与 CUDA Graph

  • session_token() 串行调度 48 层的前向传播;由于残差链严格串行,CPU 专家计算通过解耦的 host 线程与 GPU 的非 MoE 块(attention 等)重叠,用 doorbell 异步协议隐藏 CPU 延迟
  • SessionState 预先分配 KV cache、GDN 循环状态、激活缓冲和 PLE 状态(session_bytes/session_init),token 路径上零分配
  • SessionGraphs 为每层捕获 CUDA graph,消除 kernel launch 开销(每层 kernel 很小,launch 开销是主要瓶颈)

投机解码("先猜后验")

  • 模型自带的 MTP 层每次最多起草 3 个 token,一次 48 层前向即可验证全部草稿,平均每次接受 2.4--3.2 个 token,加速 1.6--1.8×
  • Prompt lookup :当回复与上下文重复(代码编辑、引用文本)时,SuffixDrafter 从前文中起草最多 5 个 token;DraftPolicy 只在实测接受率和成本划算时启用(代码编辑快 6--11%,其他场景不变)
  • 关键性质:草稿只是猜测,大模型验证决定每个词,输出质量完全不变。

长上下文预填充

  • 以最多 8,192 token 的大块做 prefill,吞吐超 1,000 tok/s;下一层专家在 attention 运行的同时经 PCIe 流式传输到 GPU
  • 会话有缓存(conversation cache),后续消息只读新增部分,秒级开始
相关推荐
2501_926978331 小时前
给自指系统接一个外部锚 —— 一个关于「用 AI 观察自己」的方法
人工智能·经验分享·笔记·机器学习·ai写作
不悔哥1 小时前
小智AI聊天机器人:ESP32上的开源语音助手拆解
人工智能·机器人·开源
枯木◊靠推文躺平版1 小时前
2026 企业级 AI 办公平台选型指南:如何评估可落地的办公 AI 能力
大数据·人工智能
空奈qwq2 小时前
ANN 全连接神经网络进阶:从反向传播到完整实战
人工智能·深度学习·神经网络
Dawson Zhu2 小时前
《Agentic Design Patterns》第 4 章导读:反思(Reflection)
人工智能·语言模型·架构·aigc·agi
llqbzllll2 小时前
Spring AI 工具调用不是反射一下就结束:用 2.0.1 跑通失败恢复与调用上限
人工智能·后端
北冥有鱼被烹2 小时前
砷化镓与磷化铟:光模块的地基——从化学键到AI缺货潮的底层逻辑
人工智能·python
xiaohaiAIgeo2 小时前
【2026年】通风柜合规检查清单:安全评估打分项解析
人工智能·安全·科普知识
回眸&啤酒鸭3 小时前
【回眸】Space-Bunny-Alpha 智能场景应用实战指南
人工智能