PAI支持一键部署Qwen3.8-Flash-Next、GLM-5.3等最新开源模型

模型介绍

近日,Qwen3.8-Flash-Next 和 GLM5.3 相继发布。PAI 支持一键部署 Qwen3.8-Flash-Next、GLM-5.3 和 GLM-5.3-Flash-BF16。

  • Qwen3.8-Flash-Next :主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 显著降低了训练与推理成本,但在编码和办公任务上却具有更强的能力。

  • GLM-5.3:与 GLM-5.2 相比,在复杂编码和长时程任务方面表现更佳,在 Z.ai 内部代码基准测试中,GLM-5.3性能比 GLM-5.2 提升了 50%。

  • GLM-5.3-Flash:GLM-5.3-Flash 是 GLM-5.3 的精简版,在编码和智能体基准测试中可与 Claude Opus 4.8 相媲美。

一键部署 Qwen3.8-Flash-Next 模型

  1. 在 PAI-Model Gallery 模型广场找到Qwen3.8-Flash-Next 模型,或通过链接直达该模型:
  1. 在模型详情页右上角点击「部署」,选择计算资源后,即可一键完成云上部署。
  • Qwen3.8-Flash-Next 支持 vLLM 高性能部署框架 / SGLang 高性能部署框架,支持单机部署,需 4*GPU 或以上资源;

  • Qwen3.8-Flash-Next-NVFP4 支持 SGLang 高性能部署框架,支持单机部署,需 2*GPU 或以上资源;

  1. 部署成功后,在服务页面可以点击"查看调用信息"获取调用的调用地址和 Token,想了解服务调用方式可以点击模型详情页,查看调用方式说明。

一键部署 GLM-5.3/GLM-5.3-Flash 模型

  1. 在 PAI-Model Gallery 模型广场找到GLM-5.3/GLM-5.3-Flash 模型,或通过链接直达该模型:
  1. 在模型详情页右上角点击「部署」,选择计算资源后,即可一键完成云上部署。
  • GLM-5.3/GLM-5.3-BF16 支持 SGLang 高性能部署框架,支持单机/分布式部署,需 8*GPU 或以上资源;

  • GLM-5.3-Flash 支持 vLLM 高性能部署框架 / SGLang 高性能部署框架,支持单机部署,需 8*GPU 或以上资源;

  • GLM-5.3-Flash-BF16 支持 SGLang 高性能部署框架,支持单机部署,需 8*GPU 或以上资源;

  1. 部署成功后,在服务页面可以点击"查看调用信息"获取调用的调用地址和 Token,想了解服务调用方式可以点击模型详情页,查看调用方式说明。

Model Gallery 是阿里云人工智能平台 PAI 的产品组件,它集成了国内外 AI 开源社区中优质的预训练模型,涵盖了 LLM、AIGC、CV、NLP 等各个领域。通过 PAI 对这些模型的适配,用户可以以零代码方式实现从训练到部署再到推理的全过程,简化了模型的开发流程,为开发者和企业用户带来了更快、更高效、更便捷的 AI 开发和应用体验。

PAI-Model Gallery 访问地址:pai.console.aliyun.com/#/quick-sta...

✅ 零代码一键部署 ✅ 自动适配云资源 ✅ 开箱即用API ✅ 全流程运维托管 ✅ 企业级安全 数据不出域

更多模型支持

PAI-Model Gallery 持续提供开源社区热门模型的快速部署、微调、蒸馏、评测实践,模型覆盖Qwen、Wan、DeepSeek、GLM、Kimi、MiniMax等优秀开源模型,同时还提供 Qwen3-235B-A22B-PAI-optimized、Qwen3-Next-80B-A3B-Instruct-FP8-PAI-optimized、DeepSeek-R1-0528-PAI-optimized 等 PAI 优化版本模型,内置了 PAI 优化版的 EP+PD 分离部署等模板,性能更优。

联系我们

欢迎各位小伙伴持续关注使用 PAI-Model Gallery,平台会不断上线 SOTA 模型,如果您有任何模型需求,也可以联系我们。您可通过搜索钉钉群号(77450028832),加入 PAI-Model Gallery 用户交流群。

相关推荐
SleepNW_POV1 小时前
家居科普|床垫溜边塌陷成因解析与边缘加固床垫选购指南
人工智能·科技·智能家居·睡眠
ovO1 小时前
DeepSeek Harness 源码解读(八):文件、命令、审批与沙箱如何协作
开源·agent
FII工业富联科技服务1 小时前
从 Vera Rubin NVL72 拆解高密度 AI 液冷:GPU 的热到底怎么被带走?
大数据·人工智能
磐时信息技术1 小时前
SASETalk | 当智能驾驶驶入未知场景:谈谈关于SOTIF、AI安全与工程落地的思考
人工智能·安全·预期功能安全·sotif
147API1 小时前
蒸馏模型量化上线前,先查精度退化和算子兼容
大数据·人工智能·深度学习·机器学习·蒸馏
ovO2 小时前
DeepSeek Harness 源码解读(六):Provider、Consumer 与能力接缝
开源·agent
橙时数据 FineInsight2 小时前
AI 能回答数据问题,但能解释业务原因吗?
大数据·人工智能·数据分析·指标平台·fineinsight
CTA终结者2 小时前
示例、拆解和练习,要连成一条量化补课线
人工智能·python
Omics Pro2 小时前
Arc研究所Cell|全新虚拟细胞官方基准评测框架
大数据·人工智能·深度学习·算法·机器学习