Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。
在能力方面,Inkling 面向通用智能、Agent、工具调用以及复杂推理任务进行了优化,同时支持 MTP(Multi-Token Prediction)等推理加速技术,可结合 vLLM、SGLang 等主流推理引擎进行部署。
1. 登录 GPUStack 选择推理后端
测试环境:
- 8 × H20-141G
2. 添加版本
点击 添加版本(Add Version)
镜像名称:
bash
vllm/vllm-openai:nightly
3. 点击部署,开始部署
Node 0 参数
bash
--trust-remote-code
--tokenizer-mode=inkling
--kernel-config.enable_flashinfer_autotune=False
--tensor-parallel-size=8
--data-parallel-size=2
--data-parallel-size-local=1
--enable-expert-parallel
--data-parallel-rpc-port=13389
--data-parallel-address=10.91.3.213
--data-parallel-hybrid-lb
--max-model-len=131072
--max-num-seqs=10
--enable-auto-tool-choice
--tool-call-parser=inkling
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
--reasoning-parser=inkling
环境变量:
bash
PYPI_PACKAGES_INSTALL=scipy==1.18.0 -i https://mirrors.aliyun.com/pypi/simple/
Node 1 参数
bash
--trust-remote-code
--tokenizer-mode=inkling
--kernel-config.enable_flashinfer_autotune=False
--tensor-parallel-size=8
--data-parallel-size=2
--data-parallel-size-local=1
--data-parallel-start-rank 1
--enable-expert-parallel
--data-parallel-rpc-port=13389
--data-parallel-address=10.91.3.213
--data-parallel-hybrid-lb
--max-model-len=131072
--max-num-seqs=10
--enable-auto-tool-choice
--tool-call-parser=inkling
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
--reasoning-parser=inkling
环境变量:
bash
PYPI_PACKAGES_INSTALL=scipy==1.18.0 -i https://mirrors.aliyun.com/pypi/simple/
模型进入 Running 状态后,可以直接通过 GPUStack 试验场进行交互测试。
在默认配置下,Inkling 输出速度达到 80+ Tokens/s,能够正常完成多轮文本对话,并支持思考过程解析。
同时支持原生多模态能力。
4. 测评
测试配置:
- Input Length:64K
- Output Length:3K
- Requests:10
测试结果如下:
| 指标 | 结果 |
|---|---|
| Output Token Throughput | 56.10 tok/s |
| Peak Output Throughput | 78.00 tok/s |
| Total Token Throughput | 1253.09 tok/s |
| Mean TTFT | 92.77s |
| Mean TPOT | 97.09 ms/token |
在长上下文输入场景下,Inkling 可以稳定完成 64K 上下文推理任务,并保持持续输出能力。