Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试

Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。

在能力方面,Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化,同时支持 MTP(Multi-Token Prediction)等推理加速技术,可结合 vLLM、SGLang 等主流推理引擎进行部署。

1. 登录 GPUStack 选择推理后端

测试环境:

  • 8 × H20-141G

2. 添加版本

点击 添加版本(Add Version)

镜像名称:

bash 复制代码
vllm/vllm-openai:nightly

3. 点击部署,开始部署

Node 0 参数

bash 复制代码
--trust-remote-code
--tokenizer-mode=inkling
--kernel-config.enable_flashinfer_autotune=False
--tensor-parallel-size=8
--data-parallel-size=2
--data-parallel-size-local=1
--enable-expert-parallel
--data-parallel-rpc-port=13389
--data-parallel-address=10.91.3.213
--data-parallel-hybrid-lb
--max-model-len=131072
--max-num-seqs=10
--enable-auto-tool-choice
--tool-call-parser=inkling
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
--reasoning-parser=inkling

环境变量:

bash 复制代码
PYPI_PACKAGES_INSTALL=scipy==1.18.0 -i https://mirrors.aliyun.com/pypi/simple/

Node 1 参数

bash 复制代码
--trust-remote-code
--tokenizer-mode=inkling
--kernel-config.enable_flashinfer_autotune=False
--tensor-parallel-size=8
--data-parallel-size=2
--data-parallel-size-local=1
--data-parallel-start-rank 1
--enable-expert-parallel
--data-parallel-rpc-port=13389
--data-parallel-address=10.91.3.213
--data-parallel-hybrid-lb
--max-model-len=131072
--max-num-seqs=10
--enable-auto-tool-choice
--tool-call-parser=inkling
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
--reasoning-parser=inkling

环境变量:

bash 复制代码
PYPI_PACKAGES_INSTALL=scipy==1.18.0 -i https://mirrors.aliyun.com/pypi/simple/

模型进入 Running 状态后,可以直接通过 GPUStack 试验场进行交互测试。

在默认配置下,Inkling 输出速度达到 80+ Tokens/s,能够正常完成多轮文本对话,并支持思考过程解析。

同时支持原生多模态能力。

4. 测评

测试配置:

  • Input Length:64K
  • Output Length:3K
  • Requests:10

测试结果如下:

指标 结果
Output Token Throughput 56.10 tok/s
Peak Output Throughput 78.00 tok/s
Total Token Throughput 1253.09 tok/s
Mean TTFT 92.77s
Mean TPOT 97.09 ms/token

在长上下文输入场景下,Inkling 可以稳定完成 64K 上下文推理任务,并保持持续输出能力。

相关推荐
fthux4 小时前
装闭 RenoPit 源码解析(04):装修图纸和合同文件上传处理流程
人工智能·ai·开源·github·open source·renopit
带娃的IT创业者6 小时前
Kimi-K3 开源背后:2.8 万亿参数的“暴力美学”与智能体的新拐点
人工智能·开源·大模型·智能体·开源模型·kimi-k3·moonshot ai
运维开发王义杰7 小时前
DefectDojo 里的 curl 高危漏洞修不修?剖析 C/C++ 依赖陷阱与 Web3 真实攻防
ai
众人皆醒我独醉7 小时前
Token:AI 世界的基本粒子——不是"字",是统计上最优的"字符组合"
后端·面试·llm
DigitalOcean8 小时前
AI 应用成本怎么算?从推理费用到完整 TCO 拆解
llm·agent
(╹◡╹)8 小时前
05.RK3588部署Qwen3-VL - 模型量化
ai
liulilittle9 小时前
MOE路由:路由(logits: top-k/8)
c++·人工智能·算法·机器学习·llm
Eloudy9 小时前
从 vega 64 到 MI 100 ,AMD GPU 的裂变历史
人工智能·深度学习·gpu
VIP_CQCRE9 小时前
用 Ace Data Cloud 快速接入 OpenAI Chat Completions API:兼容官方格式,更适合开发者落地
ai·大模型·openai·api·ace data cloud
JaydenAI10 小时前
[基于OpenEvals的自动化评估-07]评估Agent输出文本的质量[下篇]
ai·langchain·agent·evaluation·openevals