thinkingmachines/Inkling · Hugging Face
一、基础信息
Inkling 是一种通用的多模态模型,能够接受文本、图像和音频输入,并生成文本输出。它旨在用于英语及其他语言,以及跨多种编程语言。该模型设计用于开发基于人工智能的应用,包括代理和工具使用系统、编码助手、聊天机器人以及检索增强生成系统,适用于通用对话、指令跟随及其他自然语言和多模态任务。它以开放权重发布,支持下游开发者的研究、微调和第三方产品集成。
**语言:**英语,具备跨多种语言的通用能力。
二、 Inkling 在这些里面的使用
Inkling supports local deployment using the following open-source libraries:
SGLang (recipe, PR)
vLLM (recipe, PR)
TokenSpeed (recipe, PR)
Unsloth (recipe, PR)
Huggingface (recipe, PR)
API access is also available through third party inference providers.
Inkling 是 NVIDIA 的一个模型参考实现/优化库 ,核心代码已经在 vllm 仓库里(vllm/models/inkling/),而这里的文档说的是它在不同推理框架里怎么部署。
SGLang --- 你上面这段文档提到的 recipe 和 PR (pull request) 说明 SGLang 已经有人提了 PR 把 Inkling 模型集成进去了。SGLang 专注于低延迟推理。
vLLM --- Inkling 原本就在 vllm 仓库里,是集成最深的。vllm 的 vllm/models/inkling/ 目录就是直接的模型实现。
TokenSpeed --- 另一个高性能推理框架,也通过 PR 支持了 Inkling 的部署。
Unsloth --- 专注于 LoRA / QLoRA 微调的工具库,支持 Inkling 做微调。
Hugging Face --- Inkling 也可以用 HF 的 transformers 库加载和运行,但不会走那些高度优化的 CUDA/Triton kernel,性能差很多。
总结来说,Inkling 是一套模型实现代码 (主流大模型(LLaMA、Qwen 等)在 H100/B200 上的 attention 实现通常走的是"通用路径"------FlashAttention 搭配 PyTorch 原生的 QKV 投影和 RoPE。NVIDIA 认为这条路径没有吃到自家硬件的全部红利,所以他们自己写了一套从底层 kernel 到模型层层的完整实现,完全针对 H100(Hopper)和 B200(Blackwell)定制),然后它跟不同的推理框架都做好了集成------可以用 vllm 跑、用 SGLang 跑、用 Unsloth 微调、或者直接在 HuggingFace 里加载。每个框架对应的 recipe 就告诉你具体怎么拉起它。