牛来原来是智谱,GLM-5.3-Flash 实测有惊喜也有硬伤

"

牛来终于认领了,真正的考验才刚刚开始。实测比参数和榜单更接近答案。

------ 子昕

大家好,我是子昕。

前几天,OpenRouter 上突然多了一个匿名模型,provider 只写着 stealth,名字叫 Ox Alpha。中文社区很快给它起了一个外号,牛来。

它没有发布会,没有公司名字,也没有一份完整的技术报告,只有一组很夸张的规格。100 万 token 上下文,文本、图片、视频都能输入,推理默认打开,而且免费。

模型上线后很快冲到 OpenRouter 使用榜第一。按平台截至昨天的公开数据,Ox Alpha 处理了 27.2T token,DeepSeek V4 Flash 是 12.3T,前者超过后者两倍。OpenCode 那边也把它放进了免费预览,开发者一窝蜂接进去跑代码和 Agent 任务。

这几天,社区一直在猜它是谁。有人拿 tokenizer 的切分结果对照,有人比较视频输入消耗的 token,还有人盯着接口报错和参数行为。几条线索最后都指向智谱的 GLM 系列。

昨天,智谱在回应媒体询问时确认了这件事。Ox Alpha 就是 GLM 系列的新版本,随后正式发布并开源,名字叫 GLM-5.3-Flash。

「牛来终于认领了。」

我领了一张智谱的 GLM Coding Plan 7 天体验卡,直接用官方 ZCode,把之前测 Qwen 3.8 Max 和 Kimi K3 的三个场景重新跑了一遍。

这篇就讲这次实测。官方参数和榜单放在前面,结论还是以我真正操作到的结果为准。

📌 本文看点

01

模型参数与价格

02

三个真实场景实测

03

和竞品放在一起看

01

FACTS

GLM-5.3-Flash 到底是什么

先把和开发者最相关的硬信息说清楚。

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B,激活参数 18B,上下文窗口 1M,最大输出约 13.1 万 token。输入支持文字、图片和视频,输出仍然是文字,也支持工具调用。

它的架构目标很明确,就是把长上下文和多模态能力做得更便宜。官方第一次在 GLM 系列里把稀疏注意力和线性注意力放在同一个模型里,又加入 mHC 和 IndexPool。用普通话说,模型尽量少算一些无关位置,同时把需要找回来的全局信息留住。

官方架构图给出的对比是,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低约 3.01 倍,KV Cache 大小降低约 4.44 倍。对于需要长时间运行的编码 Agent,这些数字比总参数更接近成本问题。

训练侧,智谱称它使用了 30T token 的多模态预训练语料。官方把它放进了 Terminal Bench、DeepSWE、AutomationBench、HLE w/ Tools 和 GDPval-AA 等测试里,公开图中 GLM-5.3-Flash 的分数分别是 84.3、63.4、48.8、55.3 和 1773。

Artificial Analysis 的 Intelligence Index,智谱博客写的是 57 分,并把它放在前沿模型和低成本的交叉位置。这里要留个口径,榜单分数来自特定测试条件,不能直接换算成一个项目交付成功率。

价格也很有吸引力。

为了和 DeepSeek V4 Pro 放在同一张表里,我统一按官方 API 每百万 token 的美元价格来算。

模型 缓存命中输入 未命中缓存输入 输出
GLM-5.3-Flash,Z.ai $0.03 $0.15 $0.50
DeepSeek V4 Pro,低峰 $0.022 $0.66 $1.98
DeepSeek V4 Pro,高峰 $0.044 $1.32 $3.96

DeepSeek V4 Pro 的低峰价格已经是输入 0.66 美元、输出 1.98 美元,高峰时再翻一倍。普通输入和输出,GLM-5.3-Flash 大约便宜 4 倍;缓存命中这一项,DeepSeek 的低峰价反而更低。长会话大量复用前缀时,这个差异要算进去。

OpenRouter 页面还能看到部分 provider 的限时折扣价,GLM-5.3-Flash 的输入是 0.075 美元,输出 0.25 美元,缓存读取 0.015 美元。这个价格属于另一条分发渠道,不能和 DeepSeek 官方 API 的价格直接相加或比较。

GLM Coding Plan 现在每天限量发放 10,000 张 7 天体验卡。我这次就是从体验卡进入 ZCode,再把三个真实可操作的场景交给它。

领取 7 天体验卡

规格上,两边的上下文窗口都是 1M。

DeepSeek V4 Pro 的最大输出约 384K,GLM-5.3-Flash 约 131K,长文档一次生成时 DeepSeek 留出的空间更大。

GLM 的优势在原生图片和视频输入,我上一篇测 V4 Pro 时,Codex 入口读不了 Drive Mad 录屏,所以没有游戏这一项。DeepSeek 后来把视觉能力单独放在 V4-Flash-Vision-Exp 上。

公开榜单也不适合直接排座次。上一篇记录的 V4 Pro 在 Terminal Bench 2.1 是 87.9,DeepSWE 是 62.7;GLM 官方图里对应数字是 84.3 和 63.4。两边的 Harness、运行时间和评测方都不完全一样,下面还是看同一组真实场景里发生了什么。

02

METHOD

这次怎么测

三个场景和之前两篇文章保持一致,分别是纯前端视频工作台、带候补流程的实时票务系统、根据 Drive Mad 玩法视频复刻的物理驾驶游戏。

我关心模型生成页面以后,能不能把功能、状态和交互收在一起。视频工作台要看时间轴和参数修改,票务系统要看支付、退款和候补能不能继续,游戏要看操作反馈和关卡难度。

下面按场景说,做成什么和哪里没做成都会写。

03

VIDEO STUDIO

视频工作台有一个地方赢了

Pulse Studio 的要求不低。它需要素材库、视频预览、多轨时间轴、字幕、配音、音乐、片段修剪、参数检查器和本地操作,不能只做一个上传加播放的页面。

GLM 版可以上传素材,也能裁剪片段。最让我意外的是,移动轨道素材时确实有吸附功能。Qwen 3.8 Max 和 Kimi K3 那两版都没有把这个细节做出来,这里 GLM 领先了一步。

但这个优势没有把整体体验救起来。

页面样式有明显的 AI 味,文字会互相遮挡,布局也有错乱。

裁剪完成以后,素材会自动漂到轨道开头,原来的位置没有保住。变速和渐变参数改了也不生效,等于控件在页面上,功能没有跟上。

轨道移动本身也不稳定。素材拖起来经常跑到意料之外的位置,三个模型在这件事上差不多,谁都没有做得很顺。

「GLM 做出了一个可以操作的雏形,吸附是亮点,时间轴状态和参数响应不太行。」

这些问题属于功能问题,不是再调一点颜色就能解决。

04

TICKETING

票务系统卡在支付这一步

SeatFlow 这次最能说明"页面能跑"和"业务能走完"之间的差距。

项目本身可以启动,基本的功能没问题。

浏览器里的主流程却卡住了。

💡 完成锁座后发起支付,页面直接报错,后续流程全部被挡住。

这个支付错误把后面的 MockPay、出票、退款、核销和候补全挡住了。

票务系统最重要的状态链没有走完,后面的功能也没办法测。

几个交互细节也暴露了状态设计的问题。我的待支付订单里只能继续支付,没有取消订单。

销售看板入口可以进入,但看不到候补队列。

候补页面同样是空的,后台没有可看的队列。

点击整单退款以后,页面才提示演出已经开始不能退,按钮本身仍然可以点。

演出列表和详情页的状态也对不上。列表显示售票中,点进详情还能继续选座,下一步又告诉我已经停售。用户要多点几次才知道到底能不能买,这不是复杂业务才会出现的问题,前端状态没有跟上后端状态就会这样。

Qwen 3.8 Max 和 Kimi K3 的同一场景,我都走通过锁座、支付、出票、退款和候补的主要流程。

GLM 这次停在支付报错,页面数量说明不了差距,关键要看状态有没有继续往后推进。

而且这个系统页面的 AI 味儿更严重。

05

GAME TEST

游戏反而最像一个成品

Drive Mad 这个场景,我是直接把玩法视频交给 GLM,让它根据视频复刻前进、后退、越障和空中姿态控制。

三个场景里,这个游戏反而是我最满意的一个。整体复刻得比较像,前进和后退控制基本正常,车辆在空中的旋转和落地反馈也能玩。场景数量不算多,设计仍然单一,但至少从头操作到后面,不会一上来就坏掉。

它的问题出在操控调校。前进键按得太快,车子会在空中继续加速旋转,姿态很快失控。按得太慢又爬不上坡,障碍也跨不过去。我一直卡在第三关,原因不是按键失灵,是速度和物理反馈之间没有调到一个舒服的区间。

这和 Kimi K3 的游戏版本有点像,整体能玩,场景单一,细节还需要打磨。GLM 的版本更灵活,灵活到有时会把车甩飞。三个场景里,它依然是最接近要求的一项。

THE END

写在最后

把三项测试放在一起,GLM-5.3-Flash 给我的感觉很两极。

原生多模态、百万上下文、公开权重、API 价格低,还有 7 天体验卡,开发者可以很容易把真实任务丢进去。它至少根据视频做出了一个可玩的游戏,也做出了带吸附的时间轴。

但参数和榜单没有替它完成最后一轮验收。视频工作台的控件没有都生效,票务系统在支付环节直接中断,游戏则需要反复调操控。

三个项目都说明同一件事,模型能把第一版做出来,状态一致性、交互细节和失败后的修复仍然需要人盯。

和 Qwen 3.8 Max、Kimi K3 放在一起看,GLM 在视频工作台的吸附上有一个明确亮点,素材移动本身三个模型都不稳定;票务系统这次没有走完主流程,跟之前两个模型有一定的差距;游戏完成度接近 Kimi K3,操控难度更高,也没有形成明显优势。

DeepSeek V4 Pro 的结果可以拿来做一个更直接的参照。同样的票务系统,我上一篇走到了支付、出票、退款和核销,候补在接受资格去支付时才报错;GLM 这次在支付入口就停了。

视频工作台则是另一种差别,两边的速度、转场和拖拽都有问题,GLM 多做出了轨道吸附。这个对照说明,GLM 的优势目前更集中在多模态入口和价格,复杂后端的状态推进还不如 DeepSeek。

「有用,但谈不上全面领先。」

它把前沿模型的试用成本压得很低,适合拿真实任务快速验证;准备把结果交给别人用时,仍然要把测试和人工验收留出来。

如果这篇对你有帮助,欢迎关注「子昕 AI 编程」,也顺手点个赞、在看,或者转发给同样在折腾 AI 编程工具的朋友。

END

我是子昕,专注AI工具,Al编程、Al提效等技术分享。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关推荐
OpenTiny社区1 小时前
Naive UI × GenUI SDK:自定义物料库搭建实战
前端·ai编程
kyriewen1 小时前
我拿 4 个真实前端任务试了 GLM-5.3 Flash:代码一遍跑通,账单 4 分钱
前端·程序员·ai编程
zhangfeng11332 小时前
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50
机构师2 小时前
AI编程实战:效率与成本,AI 编程的 ROI 怎么算
人工智能·prompt·ai编程·deepseek
Flynt2 小时前
上周我在OpenRouter上用了个匿名模型,结果账单告诉我它是国产的
llm·ai编程·chatglm (智谱)
京东云开发者2 小时前
上游给空、下游拿到 -1,我把故障一直追到了 commons-beanutils 的构造函数
java·ai编程
掘金酱3 小时前
🔥 AI 时代,Token 就是你的数字燃料!晒账单,赢好礼!
前端·人工智能·ai编程
小虎AI生活4 小时前
从古茗案例看 FDE 思维落地:让一个 AI Agent 驻守最烦的岗位,中小公司也能干
ai编程
plainGeekDev4 小时前
Agent Prompt 怎么写:三个真实案例讲透
agent·ai编程·claude