自包含推理一体机四层架构拆解:128G 统一内存、256K 上下文与实测口径

现在有一类设备,把推理引擎、计量网关、任务沙箱、智能体编排四层软件预置进一台 1.2 公斤的小机器,通电、接网、登录就能用,不用自己搭环境。这篇文章拆它的分层结构,重点是参数口径和容易踩的坑,所有性能数字都标清来源和边界。

1. 硬件底座:为什么一直强调「统一内存」

参数清单先放着,方便后面逐条对应:

  • 整机 150×150×50.5 毫米,约 1.2 公斤,240 瓦外置电源
  • 20 核 Arm CPU,与 GPU 同封装
  • 128 GB 统一内存、4 TB 固态盘
  • 1 个万兆电口加 2 个 QSFP
  • 标称 FP4 稀疏峰值 1 PFLOP、内存带宽 273 GB/s

两个数字要会读:

  • FP4 稀疏峰值:4 位精度加上权重一半为零可跳过,两个条件叠加才等于标称值。真实模型达不到,只能当量级参考,别拿它算有效算力。
  • 273 GB/s 带宽:比高端显卡的独占显存低一档。decode 阶段每写一个 token 都要把权重完整过一遍,带宽低就直接反映在「写」的速度上。

统一内存的意义在于「不用搬」。独立显存装不下大模型时,要么切分并行,要么把权重在两块内存之间搬来搬去。CPU 和 GPU 共用 128 GB 之后,模型可以整块放进同一块内存。厂商标称单机 200B、双机 405B 是上限,同样 128 GB 能装下多少参数,取决于模型结构和量化精度,参数量不能直接换算。

2. 推理层:prefill 和 decode 是两种活

prefill 阶段把输入整篇读进来,一次算完,瓶颈在算力;decode 阶段逐个 token 往外写,每次都要过一遍全部权重,瓶颈在内存带宽。这两个阶段吃的东西不一样,所以评价这类设备不能只问「快不快」,得分开问「读多快」和「写多快」。

预热值钱到什么程度,看一组对比:一个 144K 的长提示,热路径下端到端 2.44 秒读完;同一件事冷启动要 51.8 秒。21 倍的差距。也就是说长文档场景里,常驻加预热是刚需,不是优化项。

推理层的预置配置是 35B 主力档加 256K 上下文,模型打包成只读镜像,控制台一键安装与切换。

吞吐实测(厂商自有设备,时间窗口 2026-08-05 至 08-27):

  • 35B 主力档,单机,单流 84.1 tok/s,4 并发总吞吐 213.2
  • 27B 档,单机,单流 28.2,4 并发 71.1
  • 122B 档,单机,单流 26.8,4 并发 55.0
  • 284B 档,双机互联 TP=2,1M 上下文,真实交互 39.1

口径边界,几条都得说清楚:

  • 前三档是单机,284B 那档要两台机器直连才跑得动
  • 公开口径只压到 4 并发,这是测量天花板,不是容量上限
  • 284B 档另有一个 88.9,只在输出长度可预测的测试里成立,开放问答拿不到
  • 4 并发相对单流的增量在一倍半左右,说明并发扩展性还行,但不构成 SLA
  • 量化口径为 4 位浮点,284B 档用官方 8 位权重;跨三周实测,非服务等级承诺

KV 缓存池的情况:256K 上下文之外,池子能放 141 万 token,约等于 5.4 个 256K。上限测试里 5 路各 25 万 token 全部跑完,内存峰值 59.0 GiB,没有发生一次抢占。

语音这一档,合成加识别在机器上跑通了,处理一段录音的时间比录音本身长一点,实时率约 1.25。会后转写可以,会中实时字幕不行。

3. 治理层:一个开关管住出域

所有请求都从治理网关过一道,这层做计量、脱敏、准入、配额和应用归因,对外给一个 OpenAI 兼容入口。

关键点在于路由开关只有一处。走本机模型还是走云端模型由它决定,所以不用去审计每个应用怎么写的代码,看这一处配置就能判断数据会不会出域。出厂状态是只挂本机模型、云端路由关闭,保持这个状态推理和素材都留在整机内。

需要提醒的是反向情况:开启云端路由或接入远程纳管之后,相应的数据和纳管元数据会出域。涉密场景按纯本地闭环交付。判断标准就是这几项的实际配置,不是宣传口径。

4. 执行层:沙箱

智能体要跑代码、读写文件、调外部工具,这些动作得有个地方落地,沙箱就是它的执行环境。这一层和推理层解耦:模型负责想,沙箱负责做,权限和隔离策略收在沙箱侧。

5. 应用层:业务侧唯一看到的一层

从智能体广场取现成能力,用画布式编排配交互,挂上技能和知识库,对话即入口。产出的字段、清单、报告可以导出 Word、Excel、PDF。这层对下面的要求只有两条:推理稳定、用量可计量。

6. 自己压一遍:压测与验收步骤

  1. 固定提示集:短问答、144K 长文、混合各一组,记录输入和输出 token 数
  2. 测单流:连续发 100 次请求,记录首 token 时延、单 token 时延、端到端耗时
  3. 压并发:从 2 路加到 8 路,找出总吞吐拐点,别直接照抄 4 并发这个数
  4. 冷热对比:清掉缓存后再跑一遍长提示,比较首 token 和总耗时
  5. KV 上限:多路长上下文同时挂,盯内存峰值和有没有触发抢占
  6. 治理核对:路由开关状态、是否纳管、脱敏规则、配额上限
  7. 导出验证:Word、Excel、PDF 各导一份,检查字段完整性
  8. 语音:用一段真实录音测实时率,确认能不能满足场景

7. 几个容易踩的坑

  • 拿 FP4 稀疏峰值当有效算力
  • 拿峰值吞吐去和集群比,比完觉得不划算就放下
  • 忽略冷启动,把冷路径的体验当成常态
  • 把公开的 4 并发当成容量上限
  • 把统一内存的带宽当成显存带宽来预期
  • 开了云端路由或远程纳管,还以为数据不出域

小结

这台机器的定位可以压成三句:装得下、整机内闭环、容量固定。判定它该干什么活,先看材料敢不敢放进去、输入长不长、回答长不长,再问它快不快。

装得下,本身就是一种能力。

相关推荐
一心同学1 小时前
Hermes架构拆解之Agent Loop
人工智能·agent·loop·hermes
七夜zippoe1 小时前
Agent 上下文工程:Token 管理、上下文压缩与分层记忆设计
ai·agent·token·上下文压缩·分层记忆
DevNo1 小时前
我用AI工具辅助看盘的三段记录
人工智能
IT_陈寒1 小时前
React的useEffect依赖项居然骗了我三年
前端·人工智能·后端
HRaitest1 小时前
【架构拆解】从“外挂插件”到“原生基座”:2026 新一代全链路 AI 招聘系统底层技术演进
人工智能·ai·求职招聘
小尹哥-程序员1 小时前
第4集:让AI学会看文档:Spring AI RAG入门实战
java·人工智能·spring
“AI国潮设计-小江”1 小时前
【SDXL实战】Python自动化生成3D潮汕美食IP,附ComfyUI工作流与商用变现思路
开发语言·人工智能·python·prompt·aigc
墨染天姬1 小时前
[AI]BERT 详解:从起源到实战
人工智能
qyr67891 小时前
全球无硅导热垫片市场调研分析
大数据·人工智能·能源·无硅导热垫片