Inkling模型调研

thinkingmachines/Inkling · Hugging Face

一、基础信息

Inkling 是一种通用的多模态模型,能够接受文本、图像和音频输入,并生成文本输出。它旨在用于英语及其他语言,以及跨多种编程语言。该模型设计用于开发基于人工智能的应用,包括代理和工具使用系统、编码助手、聊天机器人以及检索增强生成系统,适用于通用对话、指令跟随及其他自然语言和多模态任务。它以开放权重发布,支持下游开发者的研究、微调和第三方产品集成。

**语言:**英语,具备跨多种语言的通用能力。

二、 Inkling 在这些里面的使用

Inkling supports local deployment using the following open-source libraries:

SGLang (recipe, PR)

vLLM (recipe, PR)

TokenSpeed (recipe, PR)

Unsloth (recipe, PR)

Huggingface (recipe, PR)

API access is also available through third party inference providers.

Inkling 是 NVIDIA 的一个模型参考实现/优化库 ,核心代码已经在 vllm 仓库里(vllm/models/inkling/),而这里的文档说的是它在不同推理框架里怎么部署。

SGLang --- 你上面这段文档提到的 recipe 和 PR (pull request) 说明 SGLang 已经有人提了 PR 把 Inkling 模型集成进去了。SGLang 专注于低延迟推理。

vLLM --- Inkling 原本就在 vllm 仓库里,是集成最深的。vllm 的 vllm/models/inkling/ 目录就是直接的模型实现。

TokenSpeed --- 另一个高性能推理框架,也通过 PR 支持了 Inkling 的部署。

Unsloth --- 专注于 LoRA / QLoRA 微调的工具库,支持 Inkling 做微调。

Hugging Face --- Inkling 也可以用 HF 的 transformers 库加载和运行,但不会走那些高度优化的 CUDA/Triton kernel,性能差很多。

总结来说,Inkling 是一套模型实现代码 (主流大模型(LLaMA、Qwen 等)在 H100/B200 上的 attention 实现通常走的是"通用路径"------FlashAttention 搭配 PyTorch 原生的 QKV 投影和 RoPE。NVIDIA 认为这条路径没有吃到自家硬件的全部红利,所以他们自己写了一套从底层 kernel 到模型层层的完整实现,完全针对 H100(Hopper)和 B200(Blackwell)定制),然后它跟不同的推理框架都做好了集成------可以用 vllm 跑、用 SGLang 跑、用 Unsloth 微调、或者直接在 HuggingFace 里加载。每个框架对应的 recipe 就告诉你具体怎么拉起它。

相关推荐
Joshua-a8 小时前
工程数学-理解卷积的含义_线性时不变系统的冲激响应与卷积
人工智能·深度学习
song5018 小时前
React Native for OpenHarmony 实战:三方库 react-native-css-transformer 的鸿蒙化适配指南
css·人工智能·深度学习·react native·transformer
老金带你玩AI13 小时前
ChatGPT dots,到底能替你操多少心?
人工智能
AliCloudROS14 小时前
计算巢 X DeepSeek Harness — 云端智能体工作台
人工智能·阿里云
深蓝AI14 小时前
GitHub的Push一年涨4.9倍:AI Agent为什么逼它重做Git存储?
人工智能·github
stereohomology14 小时前
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览
人工智能·llm
运维行者_14 小时前
网络性能监控怎么做?从自动发现到根因分析的4个环节
运维·服务器·网络·人工智能·支持向量机
Su米苏15 小时前
Spring AI 中MCP 与普通 @Tool的区别
java·人工智能·spring
美狐美颜sdk15 小时前
直播APP源码可以直接接入视频美颜sdk吗?技术方案详解
android·人工智能·音视频·美颜sdk·直播美颜sdk
问商十三载15 小时前
AI引擎生成式优化实践:刑事辩护律师团队IP构建
大数据·人工智能