Inkling模型调研

thinkingmachines/Inkling · Hugging Face

一、基础信息

Inkling 是一种通用的多模态模型,能够接受文本、图像和音频输入,并生成文本输出。它旨在用于英语及其他语言,以及跨多种编程语言。该模型设计用于开发基于人工智能的应用,包括代理和工具使用系统、编码助手、聊天机器人以及检索增强生成系统,适用于通用对话、指令跟随及其他自然语言和多模态任务。它以开放权重发布,支持下游开发者的研究、微调和第三方产品集成。

**语言:**英语,具备跨多种语言的通用能力。

二、 Inkling 在这些里面的使用

Inkling supports local deployment using the following open-source libraries:

SGLang (recipe, PR)

vLLM (recipe, PR)

TokenSpeed (recipe, PR)

Unsloth (recipe, PR)

Huggingface (recipe, PR)

API access is also available through third party inference providers.

Inkling 是 NVIDIA 的一个模型参考实现/优化库 ,核心代码已经在 vllm 仓库里(vllm/models/inkling/),而这里的文档说的是它在不同推理框架里怎么部署。

SGLang --- 你上面这段文档提到的 recipe 和 PR (pull request) 说明 SGLang 已经有人提了 PR 把 Inkling 模型集成进去了。SGLang 专注于低延迟推理。

vLLM --- Inkling 原本就在 vllm 仓库里,是集成最深的。vllm 的 vllm/models/inkling/ 目录就是直接的模型实现。

TokenSpeed --- 另一个高性能推理框架,也通过 PR 支持了 Inkling 的部署。

Unsloth --- 专注于 LoRA / QLoRA 微调的工具库,支持 Inkling 做微调。

Hugging Face --- Inkling 也可以用 HF 的 transformers 库加载和运行,但不会走那些高度优化的 CUDA/Triton kernel,性能差很多。

总结来说,Inkling 是一套模型实现代码 (主流大模型(LLaMA、Qwen 等)在 H100/B200 上的 attention 实现通常走的是"通用路径"------FlashAttention 搭配 PyTorch 原生的 QKV 投影和 RoPE。NVIDIA 认为这条路径没有吃到自家硬件的全部红利,所以他们自己写了一套从底层 kernel 到模型层层的完整实现,完全针对 H100(Hopper)和 B200(Blackwell)定制),然后它跟不同的推理框架都做好了集成------可以用 vllm 跑、用 SGLang 跑、用 Unsloth 微调、或者直接在 HuggingFace 里加载。每个框架对应的 recipe 就告诉你具体怎么拉起它。

相关推荐
troy12811 小时前
告别 Copilot?Codex、Claude Code、DeepSeek Harness、Kimi、ChatGPT 哪个更适合本地化部署,更有性价比?
人工智能·python·开源软件
AI的探索之旅11 小时前
97 个 OpenCV 实例(二十九):三相机联合标定,把三只眼睛绑在一起
人工智能·opencv·计算机视觉
Data-Miner11 小时前
商品ABC分类分析怎么用AI做?脚本复用+图表可编辑的一次完整实操
人工智能·数据分析·excel
suaizai_11 小时前
MCP协议实战:将工具迁移至进程外
人工智能
weixin_4462608511 小时前
RAFT:面向故障排查智能体的有状态检索增强框架
人工智能
YOLO_DATA11 小时前
无人机高速公路道路缺陷数据集 道路损伤数据集 公路裂缝识别 AI大疆数据集 10798期
人工智能·深度学习·yolo·机器学习·cnn
一木 之林11 小时前
深度学习-图像分类到目标检测与SSD-129-134集精讲
人工智能·深度学习
蓝速科技11 小时前
会议室门牌签到功能选型与落地指南丨蓝速科技
大数据·运维·数据库·人工智能·科技
人工智能AI技术12 小时前
Agent Harness工程组件漫谈:拆解带文件读取能力的子Agent项目分析助手
人工智能