


2026年8月19日,lmdeploy v0.16.0 正式发布。本次版本围绕模型支持、推理性能、服务端架构、缓存机制、量化能力、CUDA 13.0 构建支持以及稳定性修复等方向进行了集中更新。
从更新内容来看,v0.16.0 不仅新增了 Intern-S2-Mobius、GLM-5.2、Hy3 等模型或能力支持,还带来了面向 Hopper 架构的 FP8 GEMM 优化、原生 BF16 与 FP8 GEMM 内核、TurboMind ViT 支持、SSM 前缀缓存优化、引导解码性能改进,以及 OpenAI 兼容服务端接口的进一步模块化重构。
对于关注大模型部署、推理加速、多模态模型服务、FP8 推理优化和高并发服务稳定性的开发者来说,lmdeploy v0.16.0 是一次覆盖面较广的版本升级。
一、版本核心信息
| 项目 | 内容 |
|---|---|
| 版本号 | v0.16.0 |
| 发布时间 | 2026年8月19日 |
| 更新重点 | 新模型支持、TurboMind ViT、FP8 优化、SSM 前缀缓存、服务端重构、CUDA 13.0、稳定性修复 |
| 主要方向 | 推理性能、模型适配、服务接口、缓存机制、量化与通信能力 |
本次更新可以归纳为五个核心方向:
- 扩展模型与模型架构支持
- 优化 GPU 推理算子与 FP8 路径
- 加强多模态模型的视觉编码支持
- 重构服务端接口和请求处理流程
- 修复 CUDA、KV Cache、分布式通信和请求校验相关问题
二、新特性:模型支持能力进一步扩展
lmdeploy v0.16.0 在模型支持层面增加了多项重要能力,覆盖 MoE 架构、多模态模型、GLM 系列模型以及 Hy3 相关支持。
1、支持 Intern-S2-Mobius
v0.16.0 新增了对 Intern-S2-Mobius 的支持。
同时,本次版本也针对 Intern-S2-Mobius 增加了相关架构能力,包括:
- Intern-S2-Mobius Meta-MoE 支持
- MoE Gate v2 支持
- CP Attention 修复
其中,Meta-MoE、MoE Gate v2 与注意力机制修复共同构成了此次对 Intern-S2-Mobius 适配的重要部分。对于使用该模型架构进行部署和推理的场景,v0.16.0 提供了更完整的支持能力。
2、支持 GLM-5.2
本次更新新增了对 GLM-5.2 的支持。
除模型适配外,v0.16.0 还对 GLM-5.2 服务性能进行了优化。也就是说,此次版本并非仅完成基础接入,还同步包含了 GLM-5.2 的服务端性能优化内容。
相关更新包括:
- 新增 GLM-5.2 支持
- 优化 GLM-5.2 Serving 性能
对于计划在 lmdeploy 中使用 GLM-5.2 的开发者,本次升级带来了从模型支持到服务性能优化的一组更新。
3、增加 Hy3 支持、MTP 与 FP8 优化
v0.16.0 新增了 Hy3 支持,同时增加了 MTP 以及 FP8 相关优化。
此次更新涉及的内容包括:
- 新增 Hy3 支持
- 新增 MTP
- 增加 FP8 优化
Hy3、MTP 与 FP8 优化被放在同一项更新中,体现出该版本在新能力接入与推理精度、性能路径优化方面的同步推进。
4、TurboMind 新增 ViT 支持
多模态模型部署是本次版本的重要更新方向之一。
lmdeploy v0.16.0 为 TurboMind 增加了 ViT 支持,用于 InternVL 和 Qwen VL 模型。
本次更新明确包含:
- TurboMind ViT 支持
- InternVL 模型支持相关的视觉编码能力
- Qwen VL 模型支持相关的视觉编码能力
ViT 是视觉模型中的关键组成部分。此次 TurboMind 增加 ViT 支持,意味着 InternVL 和 Qwen VL 模型在视觉部分的推理支持能力得到扩展。
三、性能优化:BF16、FP8、GEMM 与 CUDA Graph 持续推进
v0.16.0 在性能层面的更新较为集中,重点覆盖 SM90、Hopper、FP8 GEMM、量化、CUDA Graph 和引导解码等方向。
1、增加 SM90 原生 BF16 与 FP8 GEMM 内核
本次版本加入了面向 SM90 的原生 BF16 和 FP8 GEMM 内核。
更新内容包括:
- SM90 Native BF16 GEMM Kernels
- SM90 Native FP8 GEMM Kernels
- Fused-SiLU Quantization
- Linear Test Harness
其中,SM90 原生 BF16 和 FP8 GEMM 内核是本次 GPU 推理算子优化的重要内容。
此外,还新增了融合 SiLU 量化,以及 Linear 测试框架相关内容。
整理如下:
| 优化项 | 更新内容 |
|---|---|
| BF16 | 新增 SM90 原生 BF16 GEMM 内核 |
| FP8 | 新增 SM90 原生 FP8 GEMM 内核 |
| 量化 | 新增 Fused-SiLU Quantization |
| 测试 | 新增 Linear Test Harness |
2、PyTorch 增加 Hopper 优化的 Gluon Blocked FP8 GEMM
lmdeploy v0.16.0 在 PyTorch 路径中增加了面向 Hopper 的优化型 Gluon Blocked FP8 GEMM。
更新内容为:
- PyTorch 新增优化后的 Gluon Blocked FP8 GEMM
- 该优化面向 Hopper 架构
FP8 推理路径持续成为本次更新中的重要组成部分。除 SM90 原生 FP8 GEMM 内核外,PyTorch 路径也增加了 Hopper 相关的 FP8 GEMM 优化。
3、PyTorch Decode CUDA Graph 支持可选 torch.compile
在 PyTorch 推理路径中,v0.16.0 增加了可选的 torch.compile 支持,用于 Decode CUDA Graph。
对应更新为:
- Decode CUDA Graph 增加可选 torch.compile
- 该能力位于 PyTorch 路径
这项更新将 torch.compile 与 Decode CUDA Graph 相关流程结合,作为可选优化能力提供。
4、根据已选择算子推导 CUDA Step 元数据
v0.16.0 对 PyTorch 的 CUDA Step 元数据处理进行了重构。
更新内容为:
- CUDA Step Metadata 由已选择的算子推导
- 该能力位于 PyTorch 路径
相比固定或独立处理方式,此次更新将 CUDA Step 元数据与选定算子关联起来,属于 PyTorch 推理执行流程中的重构内容。
5、引导解码性能优化
本次版本对 Guided Decoding 进行了性能优化,涉及异步 D2H 拷贝与 xgrammar v0.2.1。
更新内容包括:
- 使用异步 D2H Copy 优化 Guided Decoding
- 升级或使用 xgrammar v0.2.1
引导解码场景下,异步 D2H Copy 与 xgrammar v0.2.1 是本次性能优化的两个明确重点。
四、缓存优化:SSM Prefix Cache 持续改进
缓存能力是大模型服务性能体系中的重要组成部分。v0.16.0 对 SSM Prefix Cache 进行了多项优化和修复。
1、优化并模块化 SSM 前缀缓存
本次更新对 SSM Prefix Cache 进行了优化和模块化调整。
对应内容包括:
- 优化 SSM Prefix Caching
- 模块化 SSM Prefix Caching
这项更新表明 SSM 前缀缓存不仅获得性能层面的改进,也在实现结构上进行了整理。
2、支持非对齐 SSM 前缀缓存
v0.16.0 增加了 SSM Prefix Cache Non Aligned 相关支持。
更新内容为:
- SSM Prefix Cache Non Aligned
这意味着 SSM 前缀缓存增加了非对齐相关处理能力。
3、缓存使用情况直接上报
在缓存可观测性方面,本次版本对缓存使用量上报进行了重构。
更新内容为:
- 直接报告 Cache Usage
相较于此前的处理方式,v0.16.0 将缓存使用情况进行直接上报。
五、服务端架构调整:接口拆分与请求流程重构
除了底层推理与模型支持,lmdeploy v0.16.0 还对服务端代码结构和接口流程进行了较多重构。
此次重构涉及 API Server、Chat Completions、请求预处理和生成流程等多个部分。
1、拆分 API Server Endpoints
v0.16.0 对 API Server Endpoints 进行了拆分。
更新内容为:
- Split API Server Endpoints
该项调整属于服务端接口结构重构的一部分。
2、Chat Completions Endpoint 拆分为独立包
本次版本进一步对 Chat Completions Endpoint 进行拆分,将其拆分为独立包。
更新内容为:
- Split Chat Completions Endpoint Into a Package
从 API Server Endpoints 拆分,到 Chat Completions Endpoint 进一步拆分为包,v0.16.0 对服务端接口的模块化结构进行了连续调整。
3、请求预处理与生成流程分离
v0.16.0 对 Serving 请求流程进行了重构,将请求预处理与生成过程分离。
更新内容为:
- Separate Request Preprocessing From Generation
请求预处理和生成流程被明确拆开,是本次服务端架构调整中的重要内容。
4、Chat Completions 新增 completion_tokens_details
本次版本为 Chat Completions 增加了 usage.completion_tokens_details。
更新内容为:
- Chat Completions 新增 usage.completion_tokens_details
该字段属于使用量相关输出内容。
5、Anthropic Thinking Blocks 输出签名
v0.16.0 修复了 Anthropic Thinking Blocks 的签名输出问题。
更新内容为:
- 为 Anthropic Thinking Blocks Emit Signatures
这项修复针对 Anthropic Thinking Blocks 的签名输出能力。
六、稳定性修复:CUDA、请求校验、KV Cache 与通信问题
本次版本包含多项 Bug Fix,涉及 PyTorch CUDA Stream、服务端请求校验、Ray 多进程输出、TurboMind CUDA 调用、分离式部署通信、KV Cache 量化和 CUDA IPC 通信等内容。
1、修复 PyTorch H2D 输入生命周期问题
v0.16.0 修复了 PyTorch 中 H2D 输入在跨 CUDA Stream 场景下的生命周期问题。
更新内容为:
- Fix PyTorch H2D Input Lifetime Across CUDA Streams
这项修复针对 H2D 输入和 CUDA Streams 的交互问题。
2、拒绝空或假值 Prompt 输入
服务端请求处理方面,本次版本修复了 format_prompts 和 AsyncEngine.generate 对空或假值 Prompt 输入的处理问题。
更新内容包括:
- format_prompts 拒绝空 Prompt 输入
- AsyncEngine.generate 拒绝空 Prompt 输入
- 拒绝 falsy Prompt Input
该修复加强了 Prompt 输入处理的有效性。
3、强化 Serving 请求校验
除空 Prompt 修复外,v0.16.0 还进一步强化了服务请求校验。
更新内容为:
- Harden Serving Request Validation
这项更新与空输入拒绝处理共同构成了服务端请求校验能力的增强。
4、修复 Ray 多进程重复输出问题
本次版本修复了 Ray MP Duplicate Output 问题。
更新内容为:
- Fix Ray MP Duplicate Output
该修复针对 Ray 多进程场景下的重复输出问题。
5、TurboMind 根据 CUDA Runtime 版本分发 cuMemcpyBatchAsync
v0.16.0 修复了 TurboMind 中 cuMemcpyBatchAsync 的分发问题。
更新内容为:
- 根据 CUDA Runtime Version Dispatch cuMemcpyBatchAsync
该修复将 cuMemcpyBatchAsync 的分发逻辑与 CUDA Runtime 版本关联。
6、分离式部署 P2P ZMQ 请求改用 JSON
在 Disaggregated 相关场景中,v0.16.0 将 P2P ZMQ Requests 的序列化方式由 pickle 替换为 JSON。
更新内容为:
- Disagg P2P ZMQ Requests 使用 JSON
- 不再使用 pickle
该项修复明确改变了 P2P ZMQ 请求的数据序列化方式。
7、修复 Int4 KV Cache 量化范围问题
本次版本修复了 Int4 KV Cache Quantization Range 问题。
问题出现的条件为:
- Packed Head Width 不是 2 的幂
更新内容为:
- 修复 Packed Head Width 非 2 的幂时的 Int4 KV Cache 量化范围问题
KV Cache 量化是推理部署中的重要能力,本次修复针对特定 Packed Head Width 条件下的量化范围处理。
8、修复 CUDA IPC 下 allgather 与 allgather2d 问题
v0.16.0 修复了 CUDA IPC 场景中 allgather 和 allgather2d 的相关问题。
问题出现的条件为:
- Byte Width 不是 uint 的整数倍
更新内容为:
- 修复 CUDA IPC 下 allgather 问题
- 修复 CUDA IPC 下 allgather2d 问题
- 修复 Byte Width 非 uint 整数倍时的问题
该修复涉及 CUDA IPC 通信路径中的数据宽度处理。
七、文档与测试更新
lmdeploy v0.16.0 同步更新了模型支持文档、思考模式相关文档与测试覆盖内容。
1、更新近期模型支持文档
本次版本更新了 Recent Model Support 相关文档。
更新内容为:
- 更新近期模型支持说明
结合 Intern-S2-Mobius、GLM-5.2、Hy3 以及多模态能力相关更新,模型支持文档也进行了同步调整。
2、补充 Qwen3.8 preserve_thinking 文档与测试
v0.16.0 增加了对 Qwen3.8 preserve_thinking 的文档和测试覆盖。
更新内容包括:
- 文档覆盖 Qwen3.8 preserve_thinking
- 测试覆盖 Qwen3.8 preserve_thinking
3、移除不存在的 enable-metrics 参数说明
本次文档更新中,移除了 metrics 和 spec_decoding 指南内不存在的 enable-metrics 参数。
更新内容为:
- 从 metrics 指南中移除不存在的 enable-metrics
- 从 spec_decoding 指南中移除不存在的 enable-metrics
这项更新用于保证文档中的参数说明与实际能力保持一致。
八、CUDA 13.0 与构建发布能力更新
v0.16.0 增加了 CUDA 13.0 相关支持,覆盖依赖升级、Docker 构建和发布流程。
更新内容包括:
- 升级至 cu130
- 支持 CUDA 13.0 Docker Builds
- 支持 CUDA 13.0 Docker Publishing
其中,cu130 升级以及 CUDA 13.0 Docker 构建、发布支持,是本次基础环境更新的重要内容。
九、测试与持续集成更新
除了功能、性能和服务端改动,本次版本也调整了测试配置与持续集成流程。
更新内容包括:
- 更新 TurboMind Qwen3.5 配置
- 更新 DeepSeekV4-Flash 配置
- 调整评测 Gate Benchmark 数据集
- 减少评测运行时间
- 扩展评测覆盖范围
- 移除旧模型
- 重构接口测试用例
- 文档格式化预提交钩子改用 Python 3.12
其中,评测数据集调整的目标包括:
- 降低运行时间
- 扩大覆盖范围
接口测试相关更新包括:
- 移除旧模型
- 重构 Interface Testcase
此外,文档格式化相关的预提交钩子也切换到了 Python 3.12。
十、lmdeploy v0.16.0 更新内容汇总
为了便于快速查看,以下对 v0.16.0 的完整更新内容进行归纳。
新特性
- 支持 Intern-S2-Mobius
- 支持 GLM-5.2
- 增加 Intern-S2-Mobius Meta-MoE 支持
- 增加 MoE Gate v2
- 修复 CP Attention
- TurboMind 增加 ViT 支持
- 支持 InternVL 的 ViT 推理相关能力
- 支持 Qwen VL 的 ViT 推理相关能力
- 增加 Hy3 支持
- 增加 MTP
- 增加 FP8 优化
性能与架构改进
- 直接上报缓存使用情况
- 增加 SM90 原生 BF16 GEMM 内核
- 增加 SM90 原生 FP8 GEMM 内核
- 增加 Fused-SiLU Quantization
- 增加 Linear Test Harness
- 拆分 API Server Endpoints
- 根据已选择算子推导 PyTorch CUDA Step Metadata
- 优化并模块化 SSM Prefix Caching
- Guided Decoding 使用异步 D2H Copy 优化
- 使用 xgrammar v0.2.1
- 将 Chat Completions Endpoint 拆分为独立包
- Chat Completions 增加 usage.completion_tokens_details
- PyTorch 增加面向 Hopper 的优化型 Gluon Blocked FP8 GEMM
- Decode CUDA Graph 增加可选 torch.compile
- 支持 SSM Prefix Cache Non Aligned
- 优化 GLM-5.2 Serving
- 将请求预处理与生成流程分离
Bug 修复
- 修复 PyTorch H2D 输入跨 CUDA Streams 生命周期问题
- 修复 format_prompts 对空或假值 Prompt 输入的处理
- 修复 AsyncEngine.generate 对空或假值 Prompt 输入的处理
- 修复 Ray MP Duplicate Output
- 根据 CUDA Runtime Version 分发 cuMemcpyBatchAsync
- 分离式部署的 P2P ZMQ Requests 使用 JSON 替代 pickle
- 修复 Anthropic Thinking Blocks 的签名输出
- 修复 Packed Head Width 非 2 的幂时 Int4 KV Cache 量化范围问题
- 强化 Serving 请求校验
- 修复 CUDA IPC 下 Byte Width 非 uint 整数倍时的 allgather 和 allgather2d 问题
文档、构建与测试
- 更新近期模型支持文档
- 增加 Qwen3.8 preserve_thinking 文档与测试覆盖
- 移除 metrics 与 spec_decoding 指南中不存在的 enable-metrics 参数
- 升级至 cu130
- 更新 TurboMind Qwen3.5 配置
- 文档格式化预提交钩子使用 Python 3.12
- 支持 CUDA 13.0 Docker 构建与发布
- 更新 DeepSeekV4-Flash 配置
- 调整评测 Gate Benchmark 数据集以减少运行时间并扩展覆盖范围
- 移除旧模型并重构接口测试用例
- 完成 v0.16.0 版本号升级
十一、总结
代码地址:github.com/InternLM/lmdeploy
lmdeploy v0.16.0 的更新覆盖了模型支持、推理性能、多模态视觉编码、FP8 路径、SSM 前缀缓存、服务端模块化、请求校验、KV Cache 量化、CUDA IPC 通信以及 CUDA 13.0 构建发布等多个方面。
其中,Intern-S2-Mobius、GLM-5.2、Hy3、TurboMind ViT 支持构成了模型能力扩展的重要部分;SM90 原生 BF16 与 FP8 GEMM、Hopper 优化 FP8 GEMM、Fused-SiLU Quantization、Decode CUDA Graph 可选 torch.compile 则体现了推理性能路径的持续优化。
同时,服务端的 API Endpoints 拆分、Chat Completions 包化、请求预处理与生成分离、usage.completion_tokens_details 增加,以及请求校验强化,也让 v0.16.0 在服务端结构与请求处理方面完成了进一步调整。
从完整更新列表来看,lmdeploy v0.16.0 是一个同时覆盖新模型接入、底层性能优化、服务端重构、缓存能力增强和稳定性修复的综合版本。