Inkling模型调研

thinkingmachines/Inkling · Hugging Face

一、基础信息

Inkling 是一种通用的多模态模型,能够接受文本、图像和音频输入,并生成文本输出。它旨在用于英语及其他语言,以及跨多种编程语言。该模型设计用于开发基于人工智能的应用,包括代理和工具使用系统、编码助手、聊天机器人以及检索增强生成系统,适用于通用对话、指令跟随及其他自然语言和多模态任务。它以开放权重发布,支持下游开发者的研究、微调和第三方产品集成。

**语言:**英语,具备跨多种语言的通用能力。

二、 Inkling 在这些里面的使用

Inkling supports local deployment using the following open-source libraries:

SGLang (recipe, PR)

vLLM (recipe, PR)

TokenSpeed (recipe, PR)

Unsloth (recipe, PR)

Huggingface (recipe, PR)

API access is also available through third party inference providers.

Inkling 是 NVIDIA 的一个模型参考实现/优化库 ,核心代码已经在 vllm 仓库里(vllm/models/inkling/),而这里的文档说的是它在不同推理框架里怎么部署。

SGLang --- 你上面这段文档提到的 recipe 和 PR (pull request) 说明 SGLang 已经有人提了 PR 把 Inkling 模型集成进去了。SGLang 专注于低延迟推理。

vLLM --- Inkling 原本就在 vllm 仓库里,是集成最深的。vllm 的 vllm/models/inkling/ 目录就是直接的模型实现。

TokenSpeed --- 另一个高性能推理框架,也通过 PR 支持了 Inkling 的部署。

Unsloth --- 专注于 LoRA / QLoRA 微调的工具库,支持 Inkling 做微调。

Hugging Face --- Inkling 也可以用 HF 的 transformers 库加载和运行,但不会走那些高度优化的 CUDA/Triton kernel,性能差很多。

总结来说,Inkling 是一套模型实现代码 (主流大模型(LLaMA、Qwen 等)在 H100/B200 上的 attention 实现通常走的是"通用路径"------FlashAttention 搭配 PyTorch 原生的 QKV 投影和 RoPE。NVIDIA 认为这条路径没有吃到自家硬件的全部红利,所以他们自己写了一套从底层 kernel 到模型层层的完整实现,完全针对 H100(Hopper)和 B200(Blackwell)定制),然后它跟不同的推理框架都做好了集成------可以用 vllm 跑、用 SGLang 跑、用 Unsloth 微调、或者直接在 HuggingFace 里加载。每个框架对应的 recipe 就告诉你具体怎么拉起它。

相关推荐
SLD_Allen7 小时前
AI Agent可观测性:破解多步推理的“黑盒”困局
人工智能·可用性测试·观测
薛定谔的猫19827 小时前
Llama-Factory微调 Qwen2.5-3B 模型 合并与导出(二)
人工智能·llama-factory微调
kongba0077 小时前
《Prompting》使用经验逐条总结
人工智能
QXWZ_IA7 小时前
**电力登高作业高空失保实时监管:千寻智能安全带高挂低用监测方案**
人工智能·科技·算法·能源·智能硬件
nuo5342027 小时前
2026-07-20 AI 新闻汇总
人工智能
是Yu欸8 小时前
AI跨模态鉴伪技术实测
人工智能·安全·ai作画·aigc·合合信息·ai-native·waic
声网8 小时前
Vercel 发布 AI SDK 5,引入语音 API;Ollama 新版本支持多模态交互 丨日报
人工智能
蓝速科技8 小时前
蓝速科技 AI 双屏翻译机:私模工艺与 AB 麦算法实测解析
人工智能·科技
声网8 小时前
阿里小号停止续费,10 月底下架 App;音频技术公司 Bragi 联合 OpenAI 为第三方耳机引入 GPT 语音助手丨日报
人工智能