lmdeploy v0.16.0正式发布:Intern-S2-Mobius、GLM-5.2、Hy3、FP8优化与服务端重构全面升级

2026年8月19日,lmdeploy v0.16.0 正式发布。本次版本围绕模型支持、推理性能、服务端架构、缓存机制、量化能力、CUDA 13.0 构建支持以及稳定性修复等方向进行了集中更新。

从更新内容来看,v0.16.0 不仅新增了 Intern-S2-Mobius、GLM-5.2、Hy3 等模型或能力支持,还带来了面向 Hopper 架构的 FP8 GEMM 优化、原生 BF16 与 FP8 GEMM 内核、TurboMind ViT 支持、SSM 前缀缓存优化、引导解码性能改进,以及 OpenAI 兼容服务端接口的进一步模块化重构。

对于关注大模型部署、推理加速、多模态模型服务、FP8 推理优化和高并发服务稳定性的开发者来说,lmdeploy v0.16.0 是一次覆盖面较广的版本升级。


一、版本核心信息

项目 内容
版本号 v0.16.0
发布时间 2026年8月19日
更新重点 新模型支持、TurboMind ViT、FP8 优化、SSM 前缀缓存、服务端重构、CUDA 13.0、稳定性修复
主要方向 推理性能、模型适配、服务接口、缓存机制、量化与通信能力

本次更新可以归纳为五个核心方向:

  • 扩展模型与模型架构支持
  • 优化 GPU 推理算子与 FP8 路径
  • 加强多模态模型的视觉编码支持
  • 重构服务端接口和请求处理流程
  • 修复 CUDA、KV Cache、分布式通信和请求校验相关问题

二、新特性:模型支持能力进一步扩展

lmdeploy v0.16.0 在模型支持层面增加了多项重要能力,覆盖 MoE 架构、多模态模型、GLM 系列模型以及 Hy3 相关支持。

1、支持 Intern-S2-Mobius

v0.16.0 新增了对 Intern-S2-Mobius 的支持。

同时,本次版本也针对 Intern-S2-Mobius 增加了相关架构能力,包括:

  • Intern-S2-Mobius Meta-MoE 支持
  • MoE Gate v2 支持
  • CP Attention 修复

其中,Meta-MoE、MoE Gate v2 与注意力机制修复共同构成了此次对 Intern-S2-Mobius 适配的重要部分。对于使用该模型架构进行部署和推理的场景,v0.16.0 提供了更完整的支持能力。


2、支持 GLM-5.2

本次更新新增了对 GLM-5.2 的支持。

除模型适配外,v0.16.0 还对 GLM-5.2 服务性能进行了优化。也就是说,此次版本并非仅完成基础接入,还同步包含了 GLM-5.2 的服务端性能优化内容。

相关更新包括:

  • 新增 GLM-5.2 支持
  • 优化 GLM-5.2 Serving 性能

对于计划在 lmdeploy 中使用 GLM-5.2 的开发者,本次升级带来了从模型支持到服务性能优化的一组更新。


3、增加 Hy3 支持、MTP 与 FP8 优化

v0.16.0 新增了 Hy3 支持,同时增加了 MTP 以及 FP8 相关优化。

此次更新涉及的内容包括:

  • 新增 Hy3 支持
  • 新增 MTP
  • 增加 FP8 优化

Hy3、MTP 与 FP8 优化被放在同一项更新中,体现出该版本在新能力接入与推理精度、性能路径优化方面的同步推进。


4、TurboMind 新增 ViT 支持

多模态模型部署是本次版本的重要更新方向之一。

lmdeploy v0.16.0 为 TurboMind 增加了 ViT 支持,用于 InternVL 和 Qwen VL 模型。

本次更新明确包含:

  • TurboMind ViT 支持
  • InternVL 模型支持相关的视觉编码能力
  • Qwen VL 模型支持相关的视觉编码能力

ViT 是视觉模型中的关键组成部分。此次 TurboMind 增加 ViT 支持,意味着 InternVL 和 Qwen VL 模型在视觉部分的推理支持能力得到扩展。


三、性能优化:BF16、FP8、GEMM 与 CUDA Graph 持续推进

v0.16.0 在性能层面的更新较为集中,重点覆盖 SM90、Hopper、FP8 GEMM、量化、CUDA Graph 和引导解码等方向。


1、增加 SM90 原生 BF16 与 FP8 GEMM 内核

本次版本加入了面向 SM90 的原生 BF16 和 FP8 GEMM 内核。

更新内容包括:

  • SM90 Native BF16 GEMM Kernels
  • SM90 Native FP8 GEMM Kernels
  • Fused-SiLU Quantization
  • Linear Test Harness

其中,SM90 原生 BF16 和 FP8 GEMM 内核是本次 GPU 推理算子优化的重要内容。

此外,还新增了融合 SiLU 量化,以及 Linear 测试框架相关内容。

整理如下:

优化项 更新内容
BF16 新增 SM90 原生 BF16 GEMM 内核
FP8 新增 SM90 原生 FP8 GEMM 内核
量化 新增 Fused-SiLU Quantization
测试 新增 Linear Test Harness

2、PyTorch 增加 Hopper 优化的 Gluon Blocked FP8 GEMM

lmdeploy v0.16.0 在 PyTorch 路径中增加了面向 Hopper 的优化型 Gluon Blocked FP8 GEMM。

更新内容为:

  • PyTorch 新增优化后的 Gluon Blocked FP8 GEMM
  • 该优化面向 Hopper 架构

FP8 推理路径持续成为本次更新中的重要组成部分。除 SM90 原生 FP8 GEMM 内核外,PyTorch 路径也增加了 Hopper 相关的 FP8 GEMM 优化。


3、PyTorch Decode CUDA Graph 支持可选 torch.compile

在 PyTorch 推理路径中,v0.16.0 增加了可选的 torch.compile 支持,用于 Decode CUDA Graph。

对应更新为:

  • Decode CUDA Graph 增加可选 torch.compile
  • 该能力位于 PyTorch 路径

这项更新将 torch.compile 与 Decode CUDA Graph 相关流程结合,作为可选优化能力提供。


4、根据已选择算子推导 CUDA Step 元数据

v0.16.0 对 PyTorch 的 CUDA Step 元数据处理进行了重构。

更新内容为:

  • CUDA Step Metadata 由已选择的算子推导
  • 该能力位于 PyTorch 路径

相比固定或独立处理方式,此次更新将 CUDA Step 元数据与选定算子关联起来,属于 PyTorch 推理执行流程中的重构内容。


5、引导解码性能优化

本次版本对 Guided Decoding 进行了性能优化,涉及异步 D2H 拷贝与 xgrammar v0.2.1。

更新内容包括:

  • 使用异步 D2H Copy 优化 Guided Decoding
  • 升级或使用 xgrammar v0.2.1

引导解码场景下,异步 D2H Copy 与 xgrammar v0.2.1 是本次性能优化的两个明确重点。


四、缓存优化:SSM Prefix Cache 持续改进

缓存能力是大模型服务性能体系中的重要组成部分。v0.16.0 对 SSM Prefix Cache 进行了多项优化和修复。


1、优化并模块化 SSM 前缀缓存

本次更新对 SSM Prefix Cache 进行了优化和模块化调整。

对应内容包括:

  • 优化 SSM Prefix Caching
  • 模块化 SSM Prefix Caching

这项更新表明 SSM 前缀缓存不仅获得性能层面的改进,也在实现结构上进行了整理。


2、支持非对齐 SSM 前缀缓存

v0.16.0 增加了 SSM Prefix Cache Non Aligned 相关支持。

更新内容为:

  • SSM Prefix Cache Non Aligned

这意味着 SSM 前缀缓存增加了非对齐相关处理能力。


3、缓存使用情况直接上报

在缓存可观测性方面,本次版本对缓存使用量上报进行了重构。

更新内容为:

  • 直接报告 Cache Usage

相较于此前的处理方式,v0.16.0 将缓存使用情况进行直接上报。


五、服务端架构调整:接口拆分与请求流程重构

除了底层推理与模型支持,lmdeploy v0.16.0 还对服务端代码结构和接口流程进行了较多重构。

此次重构涉及 API Server、Chat Completions、请求预处理和生成流程等多个部分。


1、拆分 API Server Endpoints

v0.16.0 对 API Server Endpoints 进行了拆分。

更新内容为:

  • Split API Server Endpoints

该项调整属于服务端接口结构重构的一部分。


2、Chat Completions Endpoint 拆分为独立包

本次版本进一步对 Chat Completions Endpoint 进行拆分,将其拆分为独立包。

更新内容为:

  • Split Chat Completions Endpoint Into a Package

从 API Server Endpoints 拆分,到 Chat Completions Endpoint 进一步拆分为包,v0.16.0 对服务端接口的模块化结构进行了连续调整。


3、请求预处理与生成流程分离

v0.16.0 对 Serving 请求流程进行了重构,将请求预处理与生成过程分离。

更新内容为:

  • Separate Request Preprocessing From Generation

请求预处理和生成流程被明确拆开,是本次服务端架构调整中的重要内容。


4、Chat Completions 新增 completion_tokens_details

本次版本为 Chat Completions 增加了 usage.completion_tokens_details。

更新内容为:

  • Chat Completions 新增 usage.completion_tokens_details

该字段属于使用量相关输出内容。


5、Anthropic Thinking Blocks 输出签名

v0.16.0 修复了 Anthropic Thinking Blocks 的签名输出问题。

更新内容为:

  • 为 Anthropic Thinking Blocks Emit Signatures

这项修复针对 Anthropic Thinking Blocks 的签名输出能力。


六、稳定性修复:CUDA、请求校验、KV Cache 与通信问题

本次版本包含多项 Bug Fix,涉及 PyTorch CUDA Stream、服务端请求校验、Ray 多进程输出、TurboMind CUDA 调用、分离式部署通信、KV Cache 量化和 CUDA IPC 通信等内容。


1、修复 PyTorch H2D 输入生命周期问题

v0.16.0 修复了 PyTorch 中 H2D 输入在跨 CUDA Stream 场景下的生命周期问题。

更新内容为:

  • Fix PyTorch H2D Input Lifetime Across CUDA Streams

这项修复针对 H2D 输入和 CUDA Streams 的交互问题。


2、拒绝空或假值 Prompt 输入

服务端请求处理方面,本次版本修复了 format_prompts 和 AsyncEngine.generate 对空或假值 Prompt 输入的处理问题。

更新内容包括:

  • format_prompts 拒绝空 Prompt 输入
  • AsyncEngine.generate 拒绝空 Prompt 输入
  • 拒绝 falsy Prompt Input

该修复加强了 Prompt 输入处理的有效性。


3、强化 Serving 请求校验

除空 Prompt 修复外,v0.16.0 还进一步强化了服务请求校验。

更新内容为:

  • Harden Serving Request Validation

这项更新与空输入拒绝处理共同构成了服务端请求校验能力的增强。


4、修复 Ray 多进程重复输出问题

本次版本修复了 Ray MP Duplicate Output 问题。

更新内容为:

  • Fix Ray MP Duplicate Output

该修复针对 Ray 多进程场景下的重复输出问题。


5、TurboMind 根据 CUDA Runtime 版本分发 cuMemcpyBatchAsync

v0.16.0 修复了 TurboMind 中 cuMemcpyBatchAsync 的分发问题。

更新内容为:

  • 根据 CUDA Runtime Version Dispatch cuMemcpyBatchAsync

该修复将 cuMemcpyBatchAsync 的分发逻辑与 CUDA Runtime 版本关联。


6、分离式部署 P2P ZMQ 请求改用 JSON

在 Disaggregated 相关场景中,v0.16.0 将 P2P ZMQ Requests 的序列化方式由 pickle 替换为 JSON。

更新内容为:

  • Disagg P2P ZMQ Requests 使用 JSON
  • 不再使用 pickle

该项修复明确改变了 P2P ZMQ 请求的数据序列化方式。


7、修复 Int4 KV Cache 量化范围问题

本次版本修复了 Int4 KV Cache Quantization Range 问题。

问题出现的条件为:

  • Packed Head Width 不是 2 的幂

更新内容为:

  • 修复 Packed Head Width 非 2 的幂时的 Int4 KV Cache 量化范围问题

KV Cache 量化是推理部署中的重要能力,本次修复针对特定 Packed Head Width 条件下的量化范围处理。


8、修复 CUDA IPC 下 allgather 与 allgather2d 问题

v0.16.0 修复了 CUDA IPC 场景中 allgather 和 allgather2d 的相关问题。

问题出现的条件为:

  • Byte Width 不是 uint 的整数倍

更新内容为:

  • 修复 CUDA IPC 下 allgather 问题
  • 修复 CUDA IPC 下 allgather2d 问题
  • 修复 Byte Width 非 uint 整数倍时的问题

该修复涉及 CUDA IPC 通信路径中的数据宽度处理。


七、文档与测试更新

lmdeploy v0.16.0 同步更新了模型支持文档、思考模式相关文档与测试覆盖内容。


1、更新近期模型支持文档

本次版本更新了 Recent Model Support 相关文档。

更新内容为:

  • 更新近期模型支持说明

结合 Intern-S2-Mobius、GLM-5.2、Hy3 以及多模态能力相关更新,模型支持文档也进行了同步调整。


2、补充 Qwen3.8 preserve_thinking 文档与测试

v0.16.0 增加了对 Qwen3.8 preserve_thinking 的文档和测试覆盖。

更新内容包括:

  • 文档覆盖 Qwen3.8 preserve_thinking
  • 测试覆盖 Qwen3.8 preserve_thinking

3、移除不存在的 enable-metrics 参数说明

本次文档更新中,移除了 metrics 和 spec_decoding 指南内不存在的 enable-metrics 参数。

更新内容为:

  • 从 metrics 指南中移除不存在的 enable-metrics
  • 从 spec_decoding 指南中移除不存在的 enable-metrics

这项更新用于保证文档中的参数说明与实际能力保持一致。


八、CUDA 13.0 与构建发布能力更新

v0.16.0 增加了 CUDA 13.0 相关支持,覆盖依赖升级、Docker 构建和发布流程。

更新内容包括:

  • 升级至 cu130
  • 支持 CUDA 13.0 Docker Builds
  • 支持 CUDA 13.0 Docker Publishing

其中,cu130 升级以及 CUDA 13.0 Docker 构建、发布支持,是本次基础环境更新的重要内容。


九、测试与持续集成更新

除了功能、性能和服务端改动,本次版本也调整了测试配置与持续集成流程。

更新内容包括:

  • 更新 TurboMind Qwen3.5 配置
  • 更新 DeepSeekV4-Flash 配置
  • 调整评测 Gate Benchmark 数据集
  • 减少评测运行时间
  • 扩展评测覆盖范围
  • 移除旧模型
  • 重构接口测试用例
  • 文档格式化预提交钩子改用 Python 3.12

其中,评测数据集调整的目标包括:

  • 降低运行时间
  • 扩大覆盖范围

接口测试相关更新包括:

  • 移除旧模型
  • 重构 Interface Testcase

此外,文档格式化相关的预提交钩子也切换到了 Python 3.12。


十、lmdeploy v0.16.0 更新内容汇总

为了便于快速查看,以下对 v0.16.0 的完整更新内容进行归纳。

新特性

  • 支持 Intern-S2-Mobius
  • 支持 GLM-5.2
  • 增加 Intern-S2-Mobius Meta-MoE 支持
  • 增加 MoE Gate v2
  • 修复 CP Attention
  • TurboMind 增加 ViT 支持
  • 支持 InternVL 的 ViT 推理相关能力
  • 支持 Qwen VL 的 ViT 推理相关能力
  • 增加 Hy3 支持
  • 增加 MTP
  • 增加 FP8 优化

性能与架构改进

  • 直接上报缓存使用情况
  • 增加 SM90 原生 BF16 GEMM 内核
  • 增加 SM90 原生 FP8 GEMM 内核
  • 增加 Fused-SiLU Quantization
  • 增加 Linear Test Harness
  • 拆分 API Server Endpoints
  • 根据已选择算子推导 PyTorch CUDA Step Metadata
  • 优化并模块化 SSM Prefix Caching
  • Guided Decoding 使用异步 D2H Copy 优化
  • 使用 xgrammar v0.2.1
  • 将 Chat Completions Endpoint 拆分为独立包
  • Chat Completions 增加 usage.completion_tokens_details
  • PyTorch 增加面向 Hopper 的优化型 Gluon Blocked FP8 GEMM
  • Decode CUDA Graph 增加可选 torch.compile
  • 支持 SSM Prefix Cache Non Aligned
  • 优化 GLM-5.2 Serving
  • 将请求预处理与生成流程分离

Bug 修复

  • 修复 PyTorch H2D 输入跨 CUDA Streams 生命周期问题
  • 修复 format_prompts 对空或假值 Prompt 输入的处理
  • 修复 AsyncEngine.generate 对空或假值 Prompt 输入的处理
  • 修复 Ray MP Duplicate Output
  • 根据 CUDA Runtime Version 分发 cuMemcpyBatchAsync
  • 分离式部署的 P2P ZMQ Requests 使用 JSON 替代 pickle
  • 修复 Anthropic Thinking Blocks 的签名输出
  • 修复 Packed Head Width 非 2 的幂时 Int4 KV Cache 量化范围问题
  • 强化 Serving 请求校验
  • 修复 CUDA IPC 下 Byte Width 非 uint 整数倍时的 allgather 和 allgather2d 问题

文档、构建与测试

  • 更新近期模型支持文档
  • 增加 Qwen3.8 preserve_thinking 文档与测试覆盖
  • 移除 metrics 与 spec_decoding 指南中不存在的 enable-metrics 参数
  • 升级至 cu130
  • 更新 TurboMind Qwen3.5 配置
  • 文档格式化预提交钩子使用 Python 3.12
  • 支持 CUDA 13.0 Docker 构建与发布
  • 更新 DeepSeekV4-Flash 配置
  • 调整评测 Gate Benchmark 数据集以减少运行时间并扩展覆盖范围
  • 移除旧模型并重构接口测试用例
  • 完成 v0.16.0 版本号升级

十一、总结

代码地址:github.com/InternLM/lmdeploy

lmdeploy v0.16.0 的更新覆盖了模型支持、推理性能、多模态视觉编码、FP8 路径、SSM 前缀缓存、服务端模块化、请求校验、KV Cache 量化、CUDA IPC 通信以及 CUDA 13.0 构建发布等多个方面。

其中,Intern-S2-Mobius、GLM-5.2、Hy3、TurboMind ViT 支持构成了模型能力扩展的重要部分;SM90 原生 BF16 与 FP8 GEMM、Hopper 优化 FP8 GEMM、Fused-SiLU Quantization、Decode CUDA Graph 可选 torch.compile 则体现了推理性能路径的持续优化。

同时,服务端的 API Endpoints 拆分、Chat Completions 包化、请求预处理与生成分离、usage.completion_tokens_details 增加,以及请求校验强化,也让 v0.16.0 在服务端结构与请求处理方面完成了进一步调整。

从完整更新列表来看,lmdeploy v0.16.0 是一个同时覆盖新模型接入、底层性能优化、服务端重构、缓存能力增强和稳定性修复的综合版本。

相关推荐
阿部多瑞 ABU4 小时前
文化吞并的动力学:泛二次元帝国的圈层扩张、话语收编与舆论场重构
大数据·人工智能·重构
智塑未来7 小时前
高端仿真软件落地的隐藏壁垒:底层适配与专业服务商格局重构
人工智能·重构
AI_Auto9 小时前
读懂数字化转型 | “人货场“重构:传统零售和数字化零售,本质上是两套逻辑
重构·零售
新芒2 天前
AI Agent进入独立站:店匠Shoplazza主Agent Athena如何重构经营?
人工智能·重构
Keystone_Onion2 天前
跨境供应链重构:基于美国海外仓网格化布局的中大件逆向物流解决方案
重构
小白说大模型2 天前
LLM集成数据库的幻觉治理:当AI给出的SQL建议是错的
数据库·人工智能·sql·oracle·重构·开源
智慧物业老杨2 天前
业主大会投票系统的技术重构:从合规失守到可信架构
重构·架构
悟天特斯2 天前
智慧楼宇自控系统重构:从传统BA到AI自适应控制的架构演进
人工智能·物联网·重构·架构
科技云报道2 天前
【重磅】瑞数信息发布《2026Bots & Agents自动化威胁报告》,重构AI Agent时代安全认知
人工智能·重构·自动化