Day-0支持|摩尔线程完成智谱GLM-5.3-Flash极速适配

近日,智谱上线并开源GLM-5.3-Flash (320B-A18B) 。摩尔线程快速响应,基于AI训推一体智算卡MTT S5000及MUSA软件栈,实现对该模型的极速适配与高效运行 ,标志着国产算力在超大规模多模态模型支持上迈出关键一步。

全球前沿性能,匿名公测登顶双榜

作为GLM-5系列的首个原生多模态模型,GLM-5.3-Flash总参数为320B,激活参数仅18B,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在自研Z.ai Code Bench体感评估中,其编程表现与Claude Opus 4.8相当。

此前,该模型以代号**Ox-Alpha(社区昵称"牛来")**在OpenCode和OpenRouter进行匿名公测,凭借出色的推理速度与智能表现,迅速成为当周最受欢迎的模型,创下双平台调用量新高。

全栈技术闭环,极速打通推理全链路

GLM-5.3-Flash发布当日,摩尔线程工程团队迅速完成模型架构拆解、核心技术分析与典型算子梳理。针对其混合架构中线性注意力采用的KDA机制,团队基于MATE算子优化引擎,快速完成了状态矩阵更新、分块并行扫描等全新算子形态的定制实现与深度调优,并与SGLang-MUSA缓存管理体系深度协同、无缝打通,充分释放了KDA在长上下文推理中的效率优势。

KDA机制的核心创新在于,将传统注意力中随推理长度线性增长的KV Cache,转化为固定规模状态矩阵的增量更新------显存占用不再随序列变长而膨胀,从根本上大幅缓解了长上下文的显存压力。这一前沿架构特性与MTT S5000的高算力密度形成深度协同,为GLM-5.3-Flash超长上下文能力在国产算力平台上的高效、稳定运行提供了坚实支撑。

软硬协同,夯实国产算力底座

本次极速适配充分验证了MTT S5000智算卡的高算力密度与稳定性,展现了MUSA架构"适配---部署---优化"工程体系的高效成熟。摩尔线程以自主软硬件协同能力,为国产AI算力底座建设提供了有力支撑。

未来,摩尔线程将与智谱持续深化软硬件协同,在多模态理解与生成、超长上下文处理及超大规模模型落地等领域展开联合探索,降低前沿AI接入成本,加速AGI技术的产业化规模普惠。

GLM-5.3-Flash开源地址:

https://huggingface.co/zai-org/GLM-5.3-Flash

开发者可下载镜像进行开箱体验:

registry.mthreads.com/mcconline/inference/sglang:v0.5.17-s5000-4.3.5-torch2.9.1-20260827-glm

相关推荐
摩尔线程14 小时前
MTT AIBOOK实战手册丨快速体验DeepSeek Harness:从开箱启动到工作区上手
摩尔线程
摩尔线程16 天前
摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级
开源·摩尔线程
摩尔线程20 天前
摩尔线程发布Mooncake MUSA预编译包 加速国产GPU PD分离落地
摩尔线程
摩尔线程22 天前
摩尔线程LiteGS入选ECCV 2026 高质量3DGS训练迎来效率突破
3d·摩尔线程
摩尔线程2 个月前
Day-0支持|摩尔线程率先完成腾讯Hy3大模型适配
开源·摩尔线程
摩尔线程3 个月前
五大能力升级|MTT AIBOOK推送AIOS 1.4.1版本,核心场景流畅度提升30%
摩尔线程
摩尔线程3 个月前
摩尔线程 × 中科院计算所丨DeferredGS全栈国产化适配落地
摩尔线程
摩尔线程3 个月前
喜报|摩尔线程MTT S5000(PH100芯片)通过国家《安全可靠测评》
人工智能·摩尔线程
Mike_6663 个月前
摩尔线程AB100安装torch环境
人工智能·深度学习·ffmpeg·aarch64·摩尔线程·musa