智谱开源 GLM-5.3-Flash 拆解:320B 只激活 18B 的混合注意力架构与十万张国产卡

匿名霸榜的模型,揭开了自己的面纱

八月二十日深夜,OpenRouter 上悄然出现一个没有署名的模型,代号 Ox-Alpha,中文社区习惯叫它牛来。它没有官方文档,没有宣传稿件,只有一个简洁的接口描述和一段免责声明。开发者们抱着试一试的心态把请求打进去,很快发现它在代码生成与长任务处理上出奇地稳定。没有宣传的接口,靠真实口碑在圈子里传开了。

六天时间,这个匿名模型在 OpenCode 与 OpenRouter 双双登上模型用量榜首,累计处理了四十二万亿个 Token。OpenCode 平台的统计口径把这一数字挂在了榜单最显眼的位置,OpenRouter 的单日调用纪录也被它亲手刷新。一个没有身份的模型,硬是用真实流量完成了自己的亮相。榜单数据不会说谎,调用量就是开发者用脚投票的结果。

当外界还在根据分词器指纹和探针猜测它的出身时,智谱在八月二十六日晚认领了这个孩子。牛来就是 GLM-5.3-Flash,总参数三千二百亿、激活参数仅一百八十亿的混合专家模型。它是 GLM-5 系列首款原生多模态成员。匿名测试不只是营销手段,更是一次真实负载下的公开压力验证。谜底揭晓那一刻,此前的猜测都有了答案。

这场揭晓把行业里关于神秘模型的讨论,从猜测阶段直接推进到了技术拆解阶段。开发者终于可以打开权重文件,看清这套架构到底长什么样。而模型背后的国产算力叙事,也让这场发布从单纯的模型更新变成了国产芯片能力的一次集中亮相。一篇文章讲清楚架构、算力与价格,正是接下来要做的事。

要理解 GLM-5.3-Flash 的意义,需要先把它放进大模型价格战的大背景里看。过去几个月,各家厂商反复压低每百万 Token 的报价,竞争从参数规模转向了单位成本。智谱这次带着十万张国产卡和四十分之一的价差进场,把价格战推到了新台阶。竞争重点已经从谁能做出更强的模型,变成谁能以更低成本把强模型跑起来。

为什么先匿名,再揭晓

匿名上线的玩法,在传统的大模型圈子里并不常见。过去的发布流程总是先官宣再开放接口,媒体评测与社区反馈都发生在身份公开之后。Ox-Alpha 把顺序整个倒了过来,先让真实开发者在不知道厂商的前提下调用,用实际效果说话,再在流量高峰过后揭晓谜底。这种反常规的打法,反而制造了最大的传播势能。

这样做的第一个好处,是拿到了毫无偏见的真实反馈。开发者不知道模型的来路,就不会带上对某个实验室的预期滤镜,评测全凭任务效果说话。智谱事后披露,正是这批不带滤镜的调用,让团队看到了模型在真实编码与智能体任务里的长处与短板。这些反馈比任何内部评测都更贴近真实使用场景。

第二个好处更加实际,匿名期间的每一笔调用都是真实的负载压测。服务端能不能扛住长上下文带来的持续压力,在大流量面前一目了然。四十二万亿 Token 的流量不是宣传稿能吹出来的数字,每一笔都来自真实开发者的真实请求,含金量远比内部压测要高。系统稳定性经受了实打实的考验。

智谱同时披露,Ox-Alpha 测试期间的全部线上流量,以及 GLM-5.3-Flash 发布后的线上服务,都由十万张国产加速芯片承载。这是国产算力第一次大规模直接服务全球真实负载。此前关于每天百万亿 Token 算力供给从何而来的争论,在这场实验后有了一个可验证的答案。国产芯片在如此量级的服务里证明了自己的可靠性。

揭晓当天,模型权重按照 MIT 协议在 Hugging Face 开放,编码平台 ZCode 与 GLM Coding Plan 同步接入,API 也向全球开发者开放。从匿名到公开,从黑盒到白盒,只隔了一个晚上。对于开发者而言,多了一个可以本地部署、可以商用、可以二次开发的前沿选择。这套开放的姿态,把受众从体验者扩大到了部署者,也让接入门槛降到了零。

这种先匿名后揭晓的打法,后来被很多行业评论概括为盲测式发布。它的核心逻辑是把产品交付给真实用户检验,而不是交给营销团队包装。当身份揭晓的那一刻到来,所有已经发生的口碑都不需要再解释,数据本身就是最好的发布稿。对智谱来说,这次实验既验证了模型能力,也验证了工程与运营能力。

三百二十亿参数,每次只唤醒一百八十亿

GLM-5.3-Flash 的架构核心,是把稀疏化做到了极致的混合专家设计。模型总参数三千二百亿,但处理每一个 Token 时只会激活其中一百八十亿的参数,层数从 GLM-4.5 的九十二层收缩到四十五层。参数量与激活量的巨大落差,正是成本得以压缩的结构根源。这套取舍的逻辑,一句话就能说清,花小钱办大事。

与传统稠密模型相比,稀疏 MoE 的思路是把一个大模型拆成多个专家子网络,每次推理只按路由结果唤醒少数几个。这样既保留了模型容量带来的知识广度,又把单次推理的计算量压到很小。GLM-5.3-Flash 在编码与长任务上的表现,说明这种取舍没有以牺牲能力为代价。路由机制的学习质量,决定了专家分工的合理程度。

模型使用三十万亿 Token 的多模态语料完成预训练,支持约一百万 Token 的上下文窗口,可以接收文本、图像与视频输入并输出文本。多模态能力第一次以原生身份进入 GLM-5 系列,不像过去那样通过外部适配器拼装。视觉通道成为模型自身能力的一部分,而非附加功能。原生多模态的意义,在于跨模态推理发生在模型内部。

在 Artificial Analysis Intelligence Index 上,GLM-5.3-Flash 拿到五十七分,与 Claude Opus 4.8 持平,高于 GLM-5.2 与 DeepSeek V4 Pro 正式版的五十三分。完整版 GLM-5.3 的得分是六十分。Flash 版本并非用来冲击能力上限,而是要在保住较强性能的同时压低价格。它瞄准的,是绝大多数任务都用不到最顶配算力的现实。这个定位正好补上了开源里缺的那一档,让预算有限的团队也有了可靠选择。

模型在具体的智能体评测里也有亮眼表现,DeepSWE v1.1 拿到六十三点四分,AutomationBench 拿到四十八点八分,Toolathlon Verified 拿到七十八点四分。这些分数说明它在真实代码仓库里定位问题、修改代码的能力,已经进入一线开源模型的行列。这些成绩不再是账面参数的好看。编码与智能体场景,正是当前 AI 落地最密集的两块阵地。

对大多数开发者来说,这套参数配比意味着两件事。第一,模型的能力密度很高,一百八十亿激活参数就能支撑起接近旗舰的表现。第二,部署成本大幅下降,显存占用与推理延迟都被压缩到了单机可承担的区间,这让自托管变得更加现实。小团队用得起、用得上,才是开源模型真正的生命力所在。

混合注意力,把长上下文的开销降下来

注意力机制是 Transformer 的算力黑洞,序列越长,计算量越接近平方级增长。GLM-5.3-Flash 给出的解法,是稀疏注意力与线性注意力的混合架构。稀疏注意力只让部分 Token 参与完整的注意力计算,线性注意力则把复杂度从平方级压到线性级,两者各司其职。混合架构的目标,是保证长程建模能力的同时把开销压下来。

智谱称这是首个采用这种混合架构的开源前沿模型,并搭配了流形约束超连接这一设计。流形约束的目标,是在不同注意力分支之间维持稳定的几何结构,避免混合方案在训练和推理时出现特征漂移。从公开数据看,这套组合把注意力计算量较 GLM-5.3 下降了约三倍。架构创新最终都要落到算力账单的节省上。

KV 缓存是长上下文服务最烧显存的环节,每多一个 Token,就要多存一份键值对。混合架构让 KV 缓存缩小了四点四倍,这直接决定了一百万 Token 上下文能否经济化部署。缓存变小意味着同样的显存可以装下更长的上下文,或者同样的上下文可以用更少的机器来服务。显存就是金钱,缓存压缩的每一分都在降低单位成本。

对一个把价格打到行业低位、把上下文开到一百万的模型来说,架构上的每一分节省都会放大成服务成本的差距。注意力计算量降三倍、KV 缓存缩四点四倍,这两组数字背后是推理成本的结构性下降。这不是靠压缩精度换来的表面功夫。在规模效应显著的推理服务里,这些倍数关系就是实打实的毛利差距。

混合注意力方案的工程难度,藏在两种机制的衔接处。稀疏分支与线性分支的输出需要对齐、合并,还要保证梯度顺畅流动。智谱用流形约束超连接把这些环节串起来,既维持了数学上的稳定性,也让训练过程不至于因为分支复杂而难以收敛。模型结构越精巧,背后的工程打磨越费功夫。

长上下文是今年大模型竞争的主战场,各家都在把窗口推向一百万甚至更远。窗口拉长的同时,缓存成本也在指数级上升。GLM-5.3-Flash 的混合注意力方案,给长上下文的经济化部署提供了一条经过真实流量验证的路径,这比单纯堆窗口数字更有工程价值。真正决定胜负的,不是窗口有多长,而是跑得起的窗口有多长。

视觉第一次走进代码执行的闭环

GLM-5.3-Flash 的多模态能力,不止停留在看图说话。智谱把它接进了编程智能体的工作循环,模型可以先看网页、图形界面、游戏或三维场景的实际渲染结果,再根据看到的反馈继续修改代码。视觉在这里变成了执行回路的一部分,而不只是输入格式的扩展。这个设计的想象力,在于它重新定义了智能体感知世界的方式。

为了让模型具备自我视觉判断的能力,智谱构建了一套面向视觉编码的数据合成流程。训练数据的构造模拟真实的前端开发场景,让模型学会观察界面变化、定位渲染异常并尝试修正。这部分能力在纯文本编码评测里很难体现,却在真实开发中价值显著。数据合成策略,往往是能力能否练出来的关键。

在前端场景中,团队还引入了环境反馈强化学习,并用真实用户流程的 Agent 验证校准模型对图形界面与交互结果的判断。模型不再只盯着代码文本,而是把界面渲染结果当成可观察的信号。写错了一处样式,看一眼截图就能发现偏差并自行修正。这种闭环,正把编码智能体推向眼见为实。

官方给出的案例是,模型连续运行十六小时,在 Blender 里搭出了一套四百平方米的厨房场景。这种长时程的视觉驱动任务,对模型的上下文管理、视觉理解与自我纠错能力都是综合考验。视觉进代码闭环,正在把多模态模型从演示推向生产。长时间无人干预的自主任务,正是智能体走向真实工作的必经门槛。

传统上视觉模型与编码模型是两条独立的路线,视觉负责理解画面,编码负责生成代码。GLM-5.3-Flash 把两者揉进了同一个模型,让视觉判断成为编码循环的反馈信号。这种融合意味着未来智能体可以真正看懂界面、看懂渲染结果。多模态与编码的合流,是今年智能体技术里值得关注的趋势之一。

十万张国产卡,扛住了全球流量

比模型本身更值得注意的,是它背后那套国产算力底座。单颗国产加速芯片在计算能力与显存容量上都有限制,直接照搬英伟达生态的部署方案走不通。智谱基于 SGLang 为 GLM-5.3-Flash 开发了专用推理引擎,针对模型架构特点做了多项针对性优化。把现成方案换成自研方案,本身就是一项不小的工程投入。

线性注意力与稀疏注意力的混合结构,带来了混合的 KV 缓存管理需求。推理引擎针对这一特点重新设计了缓存分配与调度策略,让两种注意力分支共享显存时不会互相挤占。长上下文场景下的预填充与解码阶段,也按照各自的计算特征做了不同的优化路径。软件每优化一步,硬件投入就能省下一大块。

在集群层面,智谱采用了编码、预填充与解码分离的 EPD 架构。多模态编码、提示词预填充与逐 Token 解码被拆成可以独立调度和扩展的工作池,哪个环节成为瓶颈,就单独扩容哪个池子。这种解耦让大规模集群的利用率不再被单一环节拖累。弹性扩缩容的前提,是把计算流程拆成可以独立伸缩的单元。

按照智谱披露的数字,这套系统运行在数万颗国产加速芯片之上。相比最初在同一硬件上的基线版本,端到端推理性能提升了三倍,每 Token 成本与硬件效率达到与主流英伟达 GPU 相当的水平。国产芯片第一次在真实规模的前沿模型服务中证明了自己。效率追平进口硬件,靠的正是这套针对性的软件栈。

十万张国产卡的叙事,同时回答了行业里两个悬而未决的问题。一是国产算力能不能撑起全球级的前沿模型服务,这场实验给出了正面答案。二是大模型价格还能压到多低,当算力底座不再依赖进口芯片,成本结构就有了根本性变化的可能。芯片自主与模型降价,在一场实验里形成了正向循环。

需要注意的是,国产芯片集群并非简单的数量堆叠。十万张卡要协同工作,互联带宽、调度策略与容错机制缺一不可。智谱通过自研高带宽互联网络把芯片连成整体,再用 EPD 架构与定制推理引擎把集群利用率顶上去,这整套工程能力才是这场实验的真正看点。规模是表象,互联与调度才是硬功夫。

价格撕开的新口子

价格是 GLM-5.3-Flash 最直白的竞争力。按智谱公布的标准定价,GLM-5.3-Flash 约为 GLM-5.3 的十分之一,限时折扣期内低至二十分之一。官方给出的对照是 Opus 4.8 的四十分之一,对应的口径是完成同一任务的成本,而非 Token 价表的直接比值。价格数字一旦公开,就成了行业里绕不开的参照系,同行定价不得不跟着它走。

落到具体数字上,模型每百万 Token 输入零点八元、输出二点八元、缓存命中零点二三元。这个价位与 Claude Opus 4.8 的差价已经不是一个数量级的问题,而是接近一个数量级的差距。对于高频调用、大流量上线的应用团队来说,这是实打实的成本账。同样的预算,能调用的 Token 数量直接翻了几个跟头。

把价格打到这个位置,靠的不是压缩能力,而是前面几节说的架构与算力组合拳。稀疏激活降低了单次推理的计算量,混合注意力压低了长上下文成本,国产算力底座改变了单位算力的采购价格。三层结构叠加,才有了四十分之一这个数字。每一项单独看都是优化,合起来就成了行业级的价格冲击。

行业里有一个流传很广的观察,说前沿模型正在进入用得起、用得起的阶段。GLM-5.3-Flash 把这一趋势又往前推了一步,它的出现说明前沿能力与低价并非互斥,架构创新和算力自主可以同时兑现。价格战的第一枪,这次由国产模型先打响。当低价与高能力同时出现,市场格局的重排就只是时间问题。

对价格敏感的开发者来说,这套定价策略还带来一个连锁效应。过去为了省钱而退而求其次选小模型的人,现在可以用接近小模型的成本调用前沿模型。任务质量与成本的取舍被重新平衡,很多之前因为太贵而搁置的 AI 方案,突然变得可以落地了。价格每降一个数量级,都会解锁一批过去算不过账的场景。

本地部署与 API 调用的真实路径

对开发者而言,GLM-5.3-Flash 的价值既在云端也在本地。权重已经按照 MIT 协议开放,可以通过 SGLang、vLLM、KTransformers 与 TokenSpeed 等框架在本地或自有集群中部署。下面给出一条可以直接上手的 API 调用路径,以及一份 SGLang 启动命令。两条路径分别对应没有算力和有算力两种团队,按需选择即可,门槛都不高。照着文档走一遍,就能完成首次接入。

复制代码
from openai import OpenAI

client = OpenAI(
    api_key="你的密钥",
    base_url="https://api.z.ai/api/paas/v4",
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[
        {"role": "user", "content": "用 Python 写一个读 CSV 并统计每列空值的函数"},
    ],
    max_tokens=1024,
)

print(resp.choices[0].message.content)

python -m sglang.launch_server \
    --model-path zai-org/GLM-5.3-Flash \
    --tp 8 \
    --host 0.0.0.0 \
    --port 30000 \
    --mem-fraction-static 0.88 \
    --max-running-requests 128

上面的 Python 片段演示了通过 OpenAI 兼容接口调用 GLM-5.3-Flash 的最小路径。密钥与地址在智谱开放平台申请后填入即可。SGLang 启动命令则面向本地部署场景,张量并行度与显存占用比例需要按实际 GPU 数量调整,代码本身可以直接执行。两条路径都基本可用,接上数据就能跑起来,第一次上手也能完成联调。

本地部署的价值在于数据不出域。对于有合规要求的团队,把模型跑在自己的机器上,意味着训练与推理数据都不必离开内网。MIT 协议还允许把模型集成进商业产品,这让它在企业服务、内部工具与垂直应用里都有落地的空间。自托管加上宽松协议,等于同时解决了数据隐私与商业化两个顾虑。

这场揭晓改变了什么

回到开头那个问题,为什么一个匿名模型能在六天里掀起这么大的动静。答案藏在真实流量里,四十二万亿 Token 的调用量不是任何营销能买来的,它证明开发者确实需要这样一个便宜又强悍的选项。身份揭晓只是把已经发生的口碑固定了下来。流量与口碑互为印证,构成了一场几乎无法复制的发布实验。

从行业视角看,GLM-5.3-Flash 至少改变了三件事。第一,开源前沿模型有了新的性价比标杆,MIT 协议把商用门槛降到了零。第二,混合注意力架构在开源模型里第一次得到大规模验证,长上下文的成本结构被重新定义。第三,国产算力完成了从配角到主角的第一次全球级亮相。这三件事互相咬合,构成了一个完整的行业信号。

对开发者来说,选择变多了是最大的实际利好。过去想用前沿能力只能买最贵的 API,现在同样的任务可以用四十分之一的成本完成,还能把权重搬回自己的机房。工具链、部署框架与社区生态都在围绕这些新模型快速生长,选择成本还在继续下降。生态的繁荣,又会反过来吸引更多开发者投入进来。

模型能力的下一个分水岭,正在从谁的模型更聪明,变成谁把同样的活跑得更便宜、更稳、更可控。GLM-5.3-Flash 用一场匿名实验和一份厚道的价格单,给这个转向提供了新的注脚。下一个匿名登场的模型会是谁,值得期待。但无论下一个是谁,这场盲测式发布留下的方法论,都已经成了行业的标准动作。

相关推荐
观测云18 分钟前
Spring AI + Spring AI Alibaba 接入观测云最佳实践
人工智能·spring
今天的砖头有点烫手啊24 分钟前
用 Agent 做 Excel 报表自动化:从每月加班到一键生成
人工智能·ai agent
xierui12312324 分钟前
长时间运行的AI Agent 如何安全停机:预算、熔断、人工接管与状态回读
人工智能·软件工程
GEO_youxuan25 分钟前
2026年3C重卡充电桩排名推荐:认证与功率解析
人工智能
一次旅行28 分钟前
2026‑08‑28 AI产业深度解读|生成视频模型迭代、AI安全全线收紧、国产大模型生态加速落地
人工智能·安全
weixin_3077791331 分钟前
AI生成代码的隐患与治理:人工审查流程及提示词驱动的修复策略
开发语言·人工智能·算法
Java后端的Ai之路35 分钟前
09、Python组合模式
开发语言·人工智能·python·docker·组合模式
像风一样自由202037 分钟前
15.Milvus是什么?为什么RAG系统经常使用它?
postgresql·大模型·milvus·rag·智能体
lvts_cs37 分钟前
如何评估化工产业规划的质量
大数据·人工智能·动态规划