GLM-5.3-Flash 发布:追平 Opus 4.8 的智力,1/40 的价格,跑在国产芯片上

今天,智谱上线并开源了 GLM-5.3-Flash(320B-A18B)------GLM-5 系列第一个原生多模态模型。

官方通报浓缩成一句:Artificial Analysis 综合智能指数 57 分,与 Claude Opus 4.8 持平;限时折扣价 4.5 美分一个任务,是 Opus 4.8 的 1/40。

翻译一下:你之前按奢侈品价格省着用的那种智力,现在按民用电价供电。

前沿智能要不要绑定前沿价格?这是智谱今天想撬动的行业默认设定。

先看官方公告原文:

公告不长,但有三条容易被略过的背景信息值得标出:

  • MIT 许可证。 320B-A18B 直接以 MIT 协议发布------主流开源协议里限制最少的一档,商用、修改、再分发均不设附加条件。「开源」在这里不是一个需要打折理解的词。
  • 1M token 上下文窗口。 和「原生多模态」并列写在公告第一行卖点里,百万级上下文是出厂配置,不是后挂的长文本方案。
  • 发布即全渠道在线。 公告原话是「现已可在所有官方平台获取」:HuggingFace 权重、API、Coding Plan、ZCode、chat.z.ai 同步就位,没有渐进放量。

传播速度也是背景的一部分:公告于当晚 22:12 发出,一个半小时后浏览量 96 万、点赞 1.1 万。

前沿智能,一直是奢侈品定价

过去两年,行业里有一条不成文的等式:前沿智力 = 前沿价格

独立开发者不敢让 Agent 跑过夜------一觉醒来,账单可能比房租贵。

创业团队把「上不上旗舰模型」当成融资级别的架构决策。

重度用户人均一套省钱秘籍:截断上下文、控制轮数、能降级就降级。

姿势各不相同,本质是同一件事:按 token 计费的智力,得省着用。

牛来,原来是它

发布前有个插曲。

智谱以匿名模型「Ox-Alpha」把 GLM-5.3-Flash 放上 OpenCode 和 OpenRouter 收集真实反馈,中文社区给它起了个名字:牛来

它当周就成为双平台最受欢迎的模型,创下 OpenCode 和 OpenRouter 调用量新高。

也就是说,不少人在不知道它是谁、不知道多少钱的情况下已经用过了,体感是「这模型又强又便宜」。

还有个当时没人知道的细节:这些流量全部由国产芯片承载。

性能:贴着 Opus 4.8 打

先看硬数据。

GLM-5.3-Flash:320B 总参数,18B 激活,45 层,GLM-5 系列首个原生多模态模型。

AA 综合智能指数(v4.1.1)57 分,进入全球前沿模型区间,与 Anthropic 最受欢迎的 Claude Opus 4.8 持平;4.5 美分/任务的折扣价,此前这个智力水平大约要 10 倍价格才买得到。

编码与 Agent 基准全面超过参数量大它一倍的 GLM-5.2:DeepSWE v1.1 63.4 vs 46.2,AutomationBench 48.8 vs 26.2。

对 Opus 4.8 则是贴身缠斗:DeepSWE 63.4 vs 58.0,Toolathlon Verified 78.4 vs 76.2,AutomationBench 48.8 vs 41.0,多项反超;自研 Z.ai Code Bench 体感评估里,max effort 下 29.0 vs 29.5,几乎打平。

一个模型,能力追平头部旗舰,价格是它的四十分之一。中间的差价不是补贴,是架构。

架构:为 1/40 的价格而生

三个关键词。

混合注意力。 首个采用稀疏注意力 + 线性注意力混合架构的开源前沿模型:线性注意力靠递归捕获局部依赖,稀疏注意力用轻量级索引器召回全局上下文,长上下文的服务成本被结构性压低。

IndexPool。 通过加权池化,把索引器的 4 个缓存向量压成 1 个,专门削减 1M token 上下文下索引器的时延和内存开销。

mHC(流形约束超连接)。 进一步提升模型的 scaling 效率。

再算一笔总账:总参数与 GLM-4.5 相当(320B vs 355B),但激活参数 32B→18B,层数 92→45,几乎减半;叠加最新的 30T token 多模态预训练语料。

结果是:对比 GLM-5.3,注意力计算量降 3.01 倍,KV 缓存降 4.44 倍;在 GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 的对比里,单 token 注意力计算量最低。

克制地说,短板也有:KV 缓存仍略高于 Kimi-K3 和 DeepSeek-V4-Flash,官方承认这是下一步的优化方向。

视觉进编码循环,编码进专业工作

第一个案例,已经超出「编程」的字面范畴。

不给任何外部素材,GLM-5.3-Flash 在 Blender 里自主运行 16 个小时,搭出一套约 400 平方米的专业主厨自宅与测试厨房。

几何、材质、光照、空间关系要在所有视角下保持一致------把世界知识变成可检验的 3D 结构,Coding 成了模型表达并验证自己所知的代理。

第二个案例,闭环到像素。

在 ZCode 里,Browser Use Agent 和 Computer Use Agent 让模型在代码、浏览器、图形界面之间协同:自己写、自己渲染、自己看、自己改。

很多问题只有渲染出来、交互起来才会暴露------视觉能力原生内置后,模型能自己判断什么时候该「看一眼」。

第三个案例,生成即可交付。

金融:从有来源的金融研究、报告生成到建模分析全流程跑通,参考依据可追溯。

法律:审查合同的费用、账户与责任条款,按律师惯例批注留痕;起草律师函、合同与诉讼文书,格式符合实务规范。

专业工作基准 GDPval-AA v2 拿到 1773 分,是全部对比模型(含 Opus 4.8 的 1582、GPT-5.6 Terra 的 1571)里最高的;OfficeQA Pro 62.4,比 Opus 4.8 的 48.9 高出一截。

诚实注脚:BabyVision 等纯视觉感知基准上,与 GPT-5.6 Terra(61.6)、Gemini 3.7 Flash(70.9)仍有差距------它的视觉强项在「带工具的推理与编码」,不是裸眼感知。

真正值得记录的三件事

比模型本身更值得说的是这三件。

第一,国产芯片跑前沿模型,被大规模验证了。

过去一周,Ox-Alpha 的全部流量由国产芯片集群承载------数万张国产加速卡,自研高带宽互联。为克服单卡算力与内存的限制,智谱在 SGLang 基础上构建了专用推理引擎:生产级 EPD(Encode--Prefill--Decode)分离式架构、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split。

对比同一硬件上的初始基线,端到端服务性能提升 3 倍,硬件效率和单 token 成本达到与主流英伟达 GPU 相当的水平。

彩蛋是:这套推理引擎的开发本身,被 GLM-5.3 驱动的 infra agent 大幅加速------帮工程师写算子、诊断性能瓶颈、改进部署栈。模型优化系统,系统承载模型。

第二,前沿智能的价格锚被重设了。

主公告发出十分钟后,Z.ai 团队的 Zixuan Li 补发了官方定价:GLM-5.3-Flash 通过官方 Z.ai API 即享五折,为期两周------并明确写了「该折扣也适用于第三方模型聚合商」。

落到账单上的数字:折后输入 0.075、输出0.075、输出 0.075、输出0.25、缓存输入 0.015。放进同一张图里看更直观------ClaudeSonnet5的输出标价0.015。放进同一张图里看更直观------Claude Sonnet 5 的输出标价 0.015。放进同一张图里看更直观------ClaudeSonnet5的输出标价10,GPT-5.6 Terra 标到 12,最便宜的Gemini3.7Flash也要12,最便宜的 Gemini 3.7 Flash 也要 12,最便宜的Gemini3.7Flash也要7.5;GLM-5.3-Flash 即便按原价(输出 $0.5)也只是这些数字的零头,缓存输入折后更是只剩最低竞品的十分之一。

4.5 美分买到一个此前要 10 倍价格的任务智力。能力-成本曲线被推到新位置之后,所有「旗舰模型」的定价都需要重新解释。

第三,权重开源。

320B-A18B 的权重以 MIT 许可证放在 HuggingFace,SGLang、vLLM、TokenSpeed 开箱可跑。1/40 的价格锚,加上一张几乎没有使用门槛的开源协议,留给 API 定价者的缓冲区不多了。

如何上手

官方博客的结论适合放在最后:前沿智能不必伴随前沿成本------这不是某一个技巧,而是架构、语料、基础设施三层协同的结果,而这套 recipe 正被用于更大的模型。

如果你还在按 token 省着用旗舰模型,不妨把这个开源模型加进默认选项,试一周。

参考

文中图表均截取自以上官方发布材料。

相关推荐
皮皮虾❀3 小时前
钉钉AI服务商×教育行业:AI现代产业学院共建一体化实战——从“高校AI教学缺平台”到“校企共建AI产业学院培养数字化人才
人工智能·钉钉
火山引擎开发者社区3 小时前
【议程来了】火山引擎开发者社区技术日・NVIDIA 独家赞助-成都站
人工智能
三声三视3 小时前
从崩溃日志到 AI 技能:tri-god 蒸馏实战
人工智能·ai·aigc·agent
ZGIAI3 小时前
ZGI Workflow 并发控制:保护下游接口
人工智能·架构
richard_first4 小时前
Transformer 与大语言模型:第9章 LayerNorm 归一化层
人工智能·深度学习·机器学习·transformer
ZGIAI4 小时前
知识库有结果,不等于召回率合格
人工智能·架构
东小西4 小时前
【SAA实战】第 1 篇:ReactAgent 入门——先撸个"会调工具的助手"跑起来
java·人工智能·spring
兴通物联科技4 小时前
SMT PCB 微小 DataMatrix 码扫不动问题分析 兴通 XT8601B 600 万像素工业读码器落地实践
大数据·人工智能·单片机·嵌入式硬件·算法·计算机视觉
LorryJovens4 小时前
【LAAP的数字生命哲学】基于ARIS的人类社会观的安全架构和伦理框架
人工智能