Inkling模型调研

thinkingmachines/Inkling · Hugging Face

一、基础信息

Inkling 是一种通用的多模态模型,能够接受文本、图像和音频输入,并生成文本输出。它旨在用于英语及其他语言,以及跨多种编程语言。该模型设计用于开发基于人工智能的应用,包括代理和工具使用系统、编码助手、聊天机器人以及检索增强生成系统,适用于通用对话、指令跟随及其他自然语言和多模态任务。它以开放权重发布,支持下游开发者的研究、微调和第三方产品集成。

**语言:**英语,具备跨多种语言的通用能力。

二、 Inkling 在这些里面的使用

Inkling supports local deployment using the following open-source libraries:

SGLang (recipe, PR)

vLLM (recipe, PR)

TokenSpeed (recipe, PR)

Unsloth (recipe, PR)

Huggingface (recipe, PR)

API access is also available through third party inference providers.

Inkling 是 NVIDIA 的一个模型参考实现/优化库 ,核心代码已经在 vllm 仓库里(vllm/models/inkling/),而这里的文档说的是它在不同推理框架里怎么部署。

SGLang --- 你上面这段文档提到的 recipe 和 PR (pull request) 说明 SGLang 已经有人提了 PR 把 Inkling 模型集成进去了。SGLang 专注于低延迟推理。

vLLM --- Inkling 原本就在 vllm 仓库里,是集成最深的。vllm 的 vllm/models/inkling/ 目录就是直接的模型实现。

TokenSpeed --- 另一个高性能推理框架,也通过 PR 支持了 Inkling 的部署。

Unsloth --- 专注于 LoRA / QLoRA 微调的工具库,支持 Inkling 做微调。

Hugging Face --- Inkling 也可以用 HF 的 transformers 库加载和运行,但不会走那些高度优化的 CUDA/Triton kernel,性能差很多。

总结来说,Inkling 是一套模型实现代码 (主流大模型(LLaMA、Qwen 等)在 H100/B200 上的 attention 实现通常走的是"通用路径"------FlashAttention 搭配 PyTorch 原生的 QKV 投影和 RoPE。NVIDIA 认为这条路径没有吃到自家硬件的全部红利,所以他们自己写了一套从底层 kernel 到模型层层的完整实现,完全针对 H100(Hopper)和 B200(Blackwell)定制),然后它跟不同的推理框架都做好了集成------可以用 vllm 跑、用 SGLang 跑、用 Unsloth 微调、或者直接在 HuggingFace 里加载。每个框架对应的 recipe 就告诉你具体怎么拉起它。

相关推荐
IvanCodes7 小时前
RAG 实战教程(一):RAG 工作原理与完整流程——分片、索引、召回、重排和生成
人工智能·后端·agent
今天AI了吗7 小时前
合规场景下的 AI 推理可解释性:Attention 可视化与推理路径追踪的工程实践
人工智能
周末程序猿8 小时前
浅析大模型推理十二篇之KV Cache
人工智能
鱼樱前端8 小时前
用 AI 做内容变收入
前端·人工智能·ai编程
Dawson Zhu9 小时前
基于Palantir Foundry构建半导体制造AI友好型数据中台:从良率分析场景谈起
人工智能·语言模型·架构·制造·agi
fthux9 小时前
装闭 RenoPit 源码解析(04):装修图纸和合同文件上传处理流程
人工智能·ai·开源·github·open source·renopit
weixin_4462608510 小时前
从被动镜像到主动智能体:面向网络物理人工智能的整体论数字孪生(HDT-Net)
网络·人工智能
秋枫要学习10 小时前
你的鼠标,正在被 AI 抢走
人工智能·计算机外设
满怀冰雪11 小时前
19-图像数据处理:PaddleVision Transform 实战
人工智能·深度学习·计算机视觉·paddle