现在有一类设备,把推理引擎、计量网关、任务沙箱、智能体编排四层软件预置进一台 1.2 公斤的小机器,通电、接网、登录就能用,不用自己搭环境。这篇文章拆它的分层结构,重点是参数口径和容易踩的坑,所有性能数字都标清来源和边界。
1. 硬件底座:为什么一直强调「统一内存」
参数清单先放着,方便后面逐条对应:
- 整机 150×150×50.5 毫米,约 1.2 公斤,240 瓦外置电源
- 20 核 Arm CPU,与 GPU 同封装
- 128 GB 统一内存、4 TB 固态盘
- 1 个万兆电口加 2 个 QSFP
- 标称 FP4 稀疏峰值 1 PFLOP、内存带宽 273 GB/s
两个数字要会读:
- FP4 稀疏峰值:4 位精度加上权重一半为零可跳过,两个条件叠加才等于标称值。真实模型达不到,只能当量级参考,别拿它算有效算力。
- 273 GB/s 带宽:比高端显卡的独占显存低一档。decode 阶段每写一个 token 都要把权重完整过一遍,带宽低就直接反映在「写」的速度上。
统一内存的意义在于「不用搬」。独立显存装不下大模型时,要么切分并行,要么把权重在两块内存之间搬来搬去。CPU 和 GPU 共用 128 GB 之后,模型可以整块放进同一块内存。厂商标称单机 200B、双机 405B 是上限,同样 128 GB 能装下多少参数,取决于模型结构和量化精度,参数量不能直接换算。
2. 推理层:prefill 和 decode 是两种活
prefill 阶段把输入整篇读进来,一次算完,瓶颈在算力;decode 阶段逐个 token 往外写,每次都要过一遍全部权重,瓶颈在内存带宽。这两个阶段吃的东西不一样,所以评价这类设备不能只问「快不快」,得分开问「读多快」和「写多快」。
预热值钱到什么程度,看一组对比:一个 144K 的长提示,热路径下端到端 2.44 秒读完;同一件事冷启动要 51.8 秒。21 倍的差距。也就是说长文档场景里,常驻加预热是刚需,不是优化项。
推理层的预置配置是 35B 主力档加 256K 上下文,模型打包成只读镜像,控制台一键安装与切换。
吞吐实测(厂商自有设备,时间窗口 2026-08-05 至 08-27):
- 35B 主力档,单机,单流 84.1 tok/s,4 并发总吞吐 213.2
- 27B 档,单机,单流 28.2,4 并发 71.1
- 122B 档,单机,单流 26.8,4 并发 55.0
- 284B 档,双机互联 TP=2,1M 上下文,真实交互 39.1
口径边界,几条都得说清楚:
- 前三档是单机,284B 那档要两台机器直连才跑得动
- 公开口径只压到 4 并发,这是测量天花板,不是容量上限
- 284B 档另有一个 88.9,只在输出长度可预测的测试里成立,开放问答拿不到
- 4 并发相对单流的增量在一倍半左右,说明并发扩展性还行,但不构成 SLA
- 量化口径为 4 位浮点,284B 档用官方 8 位权重;跨三周实测,非服务等级承诺
KV 缓存池的情况:256K 上下文之外,池子能放 141 万 token,约等于 5.4 个 256K。上限测试里 5 路各 25 万 token 全部跑完,内存峰值 59.0 GiB,没有发生一次抢占。
语音这一档,合成加识别在机器上跑通了,处理一段录音的时间比录音本身长一点,实时率约 1.25。会后转写可以,会中实时字幕不行。
3. 治理层:一个开关管住出域
所有请求都从治理网关过一道,这层做计量、脱敏、准入、配额和应用归因,对外给一个 OpenAI 兼容入口。
关键点在于路由开关只有一处。走本机模型还是走云端模型由它决定,所以不用去审计每个应用怎么写的代码,看这一处配置就能判断数据会不会出域。出厂状态是只挂本机模型、云端路由关闭,保持这个状态推理和素材都留在整机内。
需要提醒的是反向情况:开启云端路由或接入远程纳管之后,相应的数据和纳管元数据会出域。涉密场景按纯本地闭环交付。判断标准就是这几项的实际配置,不是宣传口径。
4. 执行层:沙箱
智能体要跑代码、读写文件、调外部工具,这些动作得有个地方落地,沙箱就是它的执行环境。这一层和推理层解耦:模型负责想,沙箱负责做,权限和隔离策略收在沙箱侧。
5. 应用层:业务侧唯一看到的一层
从智能体广场取现成能力,用画布式编排配交互,挂上技能和知识库,对话即入口。产出的字段、清单、报告可以导出 Word、Excel、PDF。这层对下面的要求只有两条:推理稳定、用量可计量。
6. 自己压一遍:压测与验收步骤
- 固定提示集:短问答、144K 长文、混合各一组,记录输入和输出 token 数
- 测单流:连续发 100 次请求,记录首 token 时延、单 token 时延、端到端耗时
- 压并发:从 2 路加到 8 路,找出总吞吐拐点,别直接照抄 4 并发这个数
- 冷热对比:清掉缓存后再跑一遍长提示,比较首 token 和总耗时
- KV 上限:多路长上下文同时挂,盯内存峰值和有没有触发抢占
- 治理核对:路由开关状态、是否纳管、脱敏规则、配额上限
- 导出验证:Word、Excel、PDF 各导一份,检查字段完整性
- 语音:用一段真实录音测实时率,确认能不能满足场景
7. 几个容易踩的坑
- 拿 FP4 稀疏峰值当有效算力
- 拿峰值吞吐去和集群比,比完觉得不划算就放下
- 忽略冷启动,把冷路径的体验当成常态
- 把公开的 4 并发当成容量上限
- 把统一内存的带宽当成显存带宽来预期
- 开了云端路由或远程纳管,还以为数据不出域
小结
这台机器的定位可以压成三句:装得下、整机内闭环、容量固定。判定它该干什么活,先看材料敢不敢放进去、输入长不长、回答长不长,再问它快不快。
装得下,本身就是一种能力。