
"
牛来终于认领了,真正的考验才刚刚开始。实测比参数和榜单更接近答案。
------ 子昕
大家好,我是子昕。
前几天,OpenRouter 上突然多了一个匿名模型,provider 只写着 stealth,名字叫 Ox Alpha。中文社区很快给它起了一个外号,牛来。
它没有发布会,没有公司名字,也没有一份完整的技术报告,只有一组很夸张的规格。100 万 token 上下文,文本、图片、视频都能输入,推理默认打开,而且免费。
模型上线后很快冲到 OpenRouter 使用榜第一。按平台截至昨天的公开数据,Ox Alpha 处理了 27.2T token,DeepSeek V4 Flash 是 12.3T,前者超过后者两倍。OpenCode 那边也把它放进了免费预览,开发者一窝蜂接进去跑代码和 Agent 任务。
这几天,社区一直在猜它是谁。有人拿 tokenizer 的切分结果对照,有人比较视频输入消耗的 token,还有人盯着接口报错和参数行为。几条线索最后都指向智谱的 GLM 系列。
昨天,智谱在回应媒体询问时确认了这件事。Ox Alpha 就是 GLM 系列的新版本,随后正式发布并开源,名字叫 GLM-5.3-Flash。
「牛来终于认领了。」
我领了一张智谱的 GLM Coding Plan 7 天体验卡,直接用官方 ZCode,把之前测 Qwen 3.8 Max 和 Kimi K3 的三个场景重新跑了一遍。
这篇就讲这次实测。官方参数和榜单放在前面,结论还是以我真正操作到的结果为准。
📌 本文看点
01
模型参数与价格
02
三个真实场景实测
03
和竞品放在一起看
01
FACTS
GLM-5.3-Flash 到底是什么
先把和开发者最相关的硬信息说清楚。
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B,激活参数 18B,上下文窗口 1M,最大输出约 13.1 万 token。输入支持文字、图片和视频,输出仍然是文字,也支持工具调用。
它的架构目标很明确,就是把长上下文和多模态能力做得更便宜。官方第一次在 GLM 系列里把稀疏注意力和线性注意力放在同一个模型里,又加入 mHC 和 IndexPool。用普通话说,模型尽量少算一些无关位置,同时把需要找回来的全局信息留住。

官方架构图给出的对比是,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低约 3.01 倍,KV Cache 大小降低约 4.44 倍。对于需要长时间运行的编码 Agent,这些数字比总参数更接近成本问题。
训练侧,智谱称它使用了 30T token 的多模态预训练语料。官方把它放进了 Terminal Bench、DeepSWE、AutomationBench、HLE w/ Tools 和 GDPval-AA 等测试里,公开图中 GLM-5.3-Flash 的分数分别是 84.3、63.4、48.8、55.3 和 1773。
Artificial Analysis 的 Intelligence Index,智谱博客写的是 57 分,并把它放在前沿模型和低成本的交叉位置。这里要留个口径,榜单分数来自特定测试条件,不能直接换算成一个项目交付成功率。

价格也很有吸引力。
为了和 DeepSeek V4 Pro 放在同一张表里,我统一按官方 API 每百万 token 的美元价格来算。
| 模型 | 缓存命中输入 | 未命中缓存输入 | 输出 |
|---|---|---|---|
| GLM-5.3-Flash,Z.ai | $0.03 | $0.15 | $0.50 |
| DeepSeek V4 Pro,低峰 | $0.022 | $0.66 | $1.98 |
| DeepSeek V4 Pro,高峰 | $0.044 | $1.32 | $3.96 |
DeepSeek V4 Pro 的低峰价格已经是输入 0.66 美元、输出 1.98 美元,高峰时再翻一倍。普通输入和输出,GLM-5.3-Flash 大约便宜 4 倍;缓存命中这一项,DeepSeek 的低峰价反而更低。长会话大量复用前缀时,这个差异要算进去。
OpenRouter 页面还能看到部分 provider 的限时折扣价,GLM-5.3-Flash 的输入是 0.075 美元,输出 0.25 美元,缓存读取 0.015 美元。这个价格属于另一条分发渠道,不能和 DeepSeek 官方 API 的价格直接相加或比较。
GLM Coding Plan 现在每天限量发放 10,000 张 7 天体验卡。我这次就是从体验卡进入 ZCode,再把三个真实可操作的场景交给它。
领取 7 天体验卡

规格上,两边的上下文窗口都是 1M。
DeepSeek V4 Pro 的最大输出约 384K,GLM-5.3-Flash 约 131K,长文档一次生成时 DeepSeek 留出的空间更大。
GLM 的优势在原生图片和视频输入,我上一篇测 V4 Pro 时,Codex 入口读不了 Drive Mad 录屏,所以没有游戏这一项。DeepSeek 后来把视觉能力单独放在 V4-Flash-Vision-Exp 上。
公开榜单也不适合直接排座次。上一篇记录的 V4 Pro 在 Terminal Bench 2.1 是 87.9,DeepSWE 是 62.7;GLM 官方图里对应数字是 84.3 和 63.4。两边的 Harness、运行时间和评测方都不完全一样,下面还是看同一组真实场景里发生了什么。
02
METHOD
这次怎么测
三个场景和之前两篇文章保持一致,分别是纯前端视频工作台、带候补流程的实时票务系统、根据 Drive Mad 玩法视频复刻的物理驾驶游戏。
我关心模型生成页面以后,能不能把功能、状态和交互收在一起。视频工作台要看时间轴和参数修改,票务系统要看支付、退款和候补能不能继续,游戏要看操作反馈和关卡难度。
下面按场景说,做成什么和哪里没做成都会写。
03
VIDEO STUDIO
视频工作台有一个地方赢了
Pulse Studio 的要求不低。它需要素材库、视频预览、多轨时间轴、字幕、配音、音乐、片段修剪、参数检查器和本地操作,不能只做一个上传加播放的页面。

GLM 版可以上传素材,也能裁剪片段。最让我意外的是,移动轨道素材时确实有吸附功能。Qwen 3.8 Max 和 Kimi K3 那两版都没有把这个细节做出来,这里 GLM 领先了一步。
但这个优势没有把整体体验救起来。
页面样式有明显的 AI 味,文字会互相遮挡,布局也有错乱。
裁剪完成以后,素材会自动漂到轨道开头,原来的位置没有保住。变速和渐变参数改了也不生效,等于控件在页面上,功能没有跟上。
轨道移动本身也不稳定。素材拖起来经常跑到意料之外的位置,三个模型在这件事上差不多,谁都没有做得很顺。
「GLM 做出了一个可以操作的雏形,吸附是亮点,时间轴状态和参数响应不太行。」
这些问题属于功能问题,不是再调一点颜色就能解决。
04
TICKETING
票务系统卡在支付这一步
SeatFlow 这次最能说明"页面能跑"和"业务能走完"之间的差距。
项目本身可以启动,基本的功能没问题。
浏览器里的主流程却卡住了。

💡 完成锁座后发起支付,页面直接报错,后续流程全部被挡住。
这个支付错误把后面的 MockPay、出票、退款、核销和候补全挡住了。
票务系统最重要的状态链没有走完,后面的功能也没办法测。

几个交互细节也暴露了状态设计的问题。我的待支付订单里只能继续支付,没有取消订单。

销售看板入口可以进入,但看不到候补队列。

候补页面同样是空的,后台没有可看的队列。

点击整单退款以后,页面才提示演出已经开始不能退,按钮本身仍然可以点。

演出列表和详情页的状态也对不上。列表显示售票中,点进详情还能继续选座,下一步又告诉我已经停售。用户要多点几次才知道到底能不能买,这不是复杂业务才会出现的问题,前端状态没有跟上后端状态就会这样。



Qwen 3.8 Max 和 Kimi K3 的同一场景,我都走通过锁座、支付、出票、退款和候补的主要流程。
GLM 这次停在支付报错,页面数量说明不了差距,关键要看状态有没有继续往后推进。
而且这个系统页面的 AI 味儿更严重。
05
GAME TEST
游戏反而最像一个成品
Drive Mad 这个场景,我是直接把玩法视频交给 GLM,让它根据视频复刻前进、后退、越障和空中姿态控制。
三个场景里,这个游戏反而是我最满意的一个。整体复刻得比较像,前进和后退控制基本正常,车辆在空中的旋转和落地反馈也能玩。场景数量不算多,设计仍然单一,但至少从头操作到后面,不会一上来就坏掉。
它的问题出在操控调校。前进键按得太快,车子会在空中继续加速旋转,姿态很快失控。按得太慢又爬不上坡,障碍也跨不过去。我一直卡在第三关,原因不是按键失灵,是速度和物理反馈之间没有调到一个舒服的区间。
这和 Kimi K3 的游戏版本有点像,整体能玩,场景单一,细节还需要打磨。GLM 的版本更灵活,灵活到有时会把车甩飞。三个场景里,它依然是最接近要求的一项。
∞
THE END
写在最后
把三项测试放在一起,GLM-5.3-Flash 给我的感觉很两极。
原生多模态、百万上下文、公开权重、API 价格低,还有 7 天体验卡,开发者可以很容易把真实任务丢进去。它至少根据视频做出了一个可玩的游戏,也做出了带吸附的时间轴。
但参数和榜单没有替它完成最后一轮验收。视频工作台的控件没有都生效,票务系统在支付环节直接中断,游戏则需要反复调操控。
三个项目都说明同一件事,模型能把第一版做出来,状态一致性、交互细节和失败后的修复仍然需要人盯。
和 Qwen 3.8 Max、Kimi K3 放在一起看,GLM 在视频工作台的吸附上有一个明确亮点,素材移动本身三个模型都不稳定;票务系统这次没有走完主流程,跟之前两个模型有一定的差距;游戏完成度接近 Kimi K3,操控难度更高,也没有形成明显优势。
DeepSeek V4 Pro 的结果可以拿来做一个更直接的参照。同样的票务系统,我上一篇走到了支付、出票、退款和核销,候补在接受资格去支付时才报错;GLM 这次在支付入口就停了。
视频工作台则是另一种差别,两边的速度、转场和拖拽都有问题,GLM 多做出了轨道吸附。这个对照说明,GLM 的优势目前更集中在多模态入口和价格,复杂后端的状态推进还不如 DeepSeek。
「有用,但谈不上全面领先。」
它把前沿模型的试用成本压得很低,适合拿真实任务快速验证;准备把结果交给别人用时,仍然要把测试和人工验收留出来。
如果这篇对你有帮助,欢迎关注「子昕 AI 编程」,也顺手点个赞、在看,或者转发给同样在折腾 AI 编程工具的朋友。
END
我是子昕,专注AI工具,Al编程、Al提效等技术分享。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。