GLM5.3Flash 我“忍”你很久,今天“曝光”你!

这几天忍着不发,可憋死我了!

今天终于可以"曝光"它了!Ox 模型到底是谁,想必大家已经知道了。

没错,主角就是 GLM5.3Flash,搞了一个星期的前戏,今天终于迎来高潮了!

我有一段时间天天"怼"GLM,年初的时候甚至骂过它"若只"!

但是我也说过很多次,GLM 国内综合实力最强,实战能力最强!这一点没毛病啊,老粉应该很清楚。

今天我就给大家盘一盘这个 Flash,好的坏的,我都会说!吹牛逼这种事情,全网会有很多人干,我就只展示我的测试结果,表达我的观点。

这一次,我的测试量还是非常大的!

先快速给大家提炼一些关键信息,方便大家吃瓜!

~ 马甲模型 Ox Alpha 刷爆了 OpenRouter 和 OpenCode 的历史榜单!

~ 能力对标 Opus 4.8,价格嘛 1/40!!!(DS 要颤抖了)

~ 模型不大,只有 320B,能力超 GLM5.2,AA 大概 57 分(DS 又被压一头)

~ 全新架构,原生多模态啊,100 万上下文!!!

~ 全国产卡推理

~ 上线即开源

核心基准数据如下:

看到这些信息,我的脑中一闪而过的是:一直斩杀别人的 DS 的斩杀线来了!

当然,我是一个挑剔的人,我立马就能发现它的一些问题!

上周,我是冲着 GLM5.5 去的,神神秘秘地给我忽悠到 GLM5.3Flash 了。当时我就很奇怪,这模型,你说它是小模型嘛,又有点强,你说大模型,好像又没有那么高智商。

好了,那些杂七杂八的说完了,我们可以回归模型本身了!我们使用一个模型,核心关注点主要是"性能"和"价格",价格基本清楚了,非常香,性能就成为最关键的变量了

GLM5.3Flash 到底怎么样,优点是什么,缺点是什么?我们就一点一点来看吧,看完了就知道了。

因为这次是一个原生多模态,所以我先给大家看一个非常明显的对比。

甲维斯的车库

这个例子,因为涉及到了多模态能力,所以之前 DeepSeek 和 GLM 都无法参赛!现在它们可以参赛了,而且刚好都是新鲜出炉。

这个题目的内容如下:

我在网上看到一个很有意思的例子,就是有人做了一个在线车库,可以快速切换车库中的各种车辆,以及显示这个载具的数据,中间显示具体的内容,可以通过鼠标拖动查看不同角度,然后可以切换涂漆,可以切换视角,可以自动旋转展示!网页配色,布局,内容我希望你尽可能还原参考图 2.png,不同之处在于车库里的车子,以及骑车的人,以及车库的名字。车子我希望你做一辆自行车,一辆电瓶车,一辆机车,一辆三蹦子,一辆五菱宏光,一辆特斯拉,一辆小米,一辆保时捷,一套钢铁侠的经典战甲。具体型号你自己定,要主流的型号。骑车开车的人物根据参考图 1.jpg 的头部形象进行设计,做一个 3D Q 版卡通形象。车库的主人是 Jarvis。我的需求就是这样,细节你来完成,我只负责验收。使用单个 HTML 和前端技术完成,只输出最终结果页面。

然后这个题目是有两张参考图:

这是非常综合的一个例子!会考网页复刻能力、3D 建模能力,以及一些世界知识、物理知识!

下面就直接上结果了。

GLM5.3Flash 的结果:

GLM5.2 的结果:

DeepSeek-V4-Flash-Vision-Exp 的结果:

这个对比结果应该很清晰。

GLM5.2 当时应该通过外置的视觉模型,抓取了一些简单的视觉信息,就开始开发了。所以整个颜色和内容都是对不上的。

DS 和 GLM5.3 这两位都有了原生多模态。所以整体还原度都不错。这两个在布局的还原度上都已经很高了。

差别主要在细节和建模!

GLM5.3 的建模和渲染效果明显比 DS 要好很多!

另外 DS 的左上角的配色莫名其妙多了 4 种,右下角的旋转控件也变了样式,还有整个页面的背景色,以及一些其他控件的颜色都有比较大的漂移。

左下角的鼠标图标和拖动提示也没有复刻出来!

从这个例子来看,GLM5.3Flash,虽然后缀有个 Flash,但是它还是挺厉害的。没想到它的 3D 建模能力好像也增强了。

浮屿世界

说起 3D 建模,我还让它帮我做了一个新的 Demo------《浮屿世界》

这个创意来自一个区块链游戏 Decentraland。用多边形、低饱和、治愈温度风格构建一个虚拟世界。主角可以在世界里任意游走!

我在原先的基础上加了 "每一个人都是一座孤岛" 的概念,让它设计了很多悬浮在天空中的岛屿。这个理念落地做得还是比较好的。虽然没法和产品级的游戏相比,但是作为一个原型设计工具,已经非常够用了。

它一次就创建了所有内容,而且主角是可以行走和跳跃的。里面包含了日夜、四季、天气的轮转。左上角有操作提示,右下角有探索情况。

我发现它还设计了交互功能,进入每个岛屿会显示岛屿的名字,然后还设计了一个可以交互的物品。比如椅子可以坐下!它的交互 UI 还是 Claude 风格的,深得我心!

天文机械表

这个题目既考脑力,又考视觉呈现能力,还考网页制作能力!这个例子我已经说过很多次了,详细的考点,以及提示词,都有介绍过,在网站上也有贴。

我就直接上结果了:

我记得测试 GLM5.3 以及 GLM5.2 的时候,这个例子设计得都不错,各方面表现都不错。但是就是月相的呈现部分有比较明显的问题,而这点恰恰是比较重要的考点。

这一次,月相部分也完整地画出来了!

这个例子中的四五个考点,基本都做到了!

它这次的成功并非偶然:

从运行记录可以看到,它已经做了很多次多维度的验证了,而且还多次截图验证。

这个题目本来是考模型的注意力,现在好了,Agent 流程化处理,每次抓一个点优化,自然是给你整得好好的了。这个过程很好地体现了一点:GLM 在智能体流程和后训练的优化上已经非常成熟了。

有些模型它是不会想这么多的,即便它也有智能体,但是它并不会做这么多验证,即便做了,最后也还是有各种问题。

复刻游戏

《超级玛丽》和《坦克大战》已经成为我的必测项目了。

这都是老游戏,但是 AI 在复刻这些老游戏的时候,表现其实并不好。我最早测试的一批模型,结果非常拉跨。只有 Fable 5 一下子惊艳了我,然后后来新出的一些模型表现也稍微好了一些!

坦克大战的结果如下:

地图和玩法基本复刻了,打墙和敌方坦克的逻辑,有些小 Bug。整体来说还不错,能看能玩。看来它是听劝,去好好抄了一下。

超级玛丽:

它的画面风格和坦克大战一样,还原度不算高。但是地图和玩法的还原度非常高。

奔跑的惯性、加速跳高、隐藏蘑菇、冲刺夺旗,这些细节做得非常到位。

这就很神奇了。

理论上它只是 GLM5.3 的快速轻量版,为什么效果比 GLM5.3 还好呢?可能是全新架构和视觉能力加持的缘故。

3D 台球

我同样也测试了开放题"3D 台球"。这个题目我不提供任何需求细节。我只是说"我想开发一个 3D 台球,你有什么想法"。然后跟它稍微探讨一下,主要是按它的思路来实现。

这个例子整体结果也不错!

建模灯光这些都不错。

然后来看一下顶视图:

其它都问题不大,就是这个"球袋"的建模差点意思。第一个版建模是那种 1/4 圆,我提醒它优化一下,然后它就搞出来奇形怪状的洞口。这个点位的建模很多模型都搞不好,目前只有 Fable 5 和 Opus 5 默认建模不错,然后可以在你的提示下进行优化。

赛博朋克版清明上河图

这一题考基础常识、概念融合、创意、空间感、审美这些。本来这个题目是应该放在第一个的,为什么放在靠后的位置呢?主要是 GLM5.3Flash 在这个主题上并不是特别亮眼。

具体效果如下:

其实这个版本在描绘这个场景的时候,细节方面已经非常到位了,各种人物,飞行器,建筑都有,而且细节很充分。

但是空间感和色彩对比方面做得比较差,导致很多东西都叠在一起了。

另外还有两个比较明显的 Bug:一个是天空中的飞行器出现了倒着飞的情况,另一个是里面的人物行为特别抽象。

所有人物好像挂在空中一样,腿都是飘在空中左右摇摆的,那画面,晚上我都不敢多看。

这种可能就是模型参数的局限性了,当然即便是参数如 K3,它的最终表现也一般。这个例子的难度可能不仅仅在参数,还有很多其他东西。

射击游戏

因为我拿到这个模型之后,时间和 Token 非常充沛,所以我就多测了一些东西。包括上面的浮屿世界,以及下面的这个射击游戏。

我让它模仿 CF 或者 CS 开发了一个射击游戏:

这个首页看起来啊完成度还挺高的,有好多功能点!

但是......它的游戏画面和建模......极其抽象:

无论是建模,还是材质,以及操控,都不是太好!

这个例子比 K3 和 Opus 5 都要差太多了!

排查问题

关于 OpenCode + Git + DSH 在用户目录运行,把系统卡死,硬盘耗尽的问题。这个问题其实最先是 GLM5.3Flash 找出来的。

这个问题,它整整花了一个小时:

它的运行日志也非常有意思:

关键发现,

意外结果,

重大发现,

突破性进展,

决定性发现,

元凶找到了

非常关键的发现,

反转了,

我的失误!

破案了!

实锤了,

真凶落网!

全部查清了,

意外!

人赃并获!

经过层层排查,最终的关键问题给排查出来了。从这个例子来看,它确实脑力有限,但是策略非常好。 它其实也走了很多错误的方向,但是在不断的复盘中和尝试中,终于找对了方向。

这个例子,如果大家有兴趣,我可以另起一篇,把它完整的思考过程给大家分享出来。过程还是挺有意义的。

这个例子,K3 失败了,GPT-5.6 失败了,DS Flash 失败了,Opus 5 成功了。Opus 5 只用了 13 分钟左右,几乎没有走任何弯路,一个 A/B 测试就锁定路径问题了。

例子大概就是这些了,因为例子比较多,我并没有展示执行过程。GLM5.3Flash 的执行过程还是非常有节奏的。

下面是我对这个模型的首测结论:

我们可能没有等来一个更大的模型,而是等来了一个更全面、更快、更实用、更便宜的模型!

当时我还不知道这个模型具体叫什么,也不知道它的尺寸,只是写了一个初步的感受。

现在它的全貌基本清晰了:

这只是一个 320B(激活 18B)的"小模型",

DS Flash 是一个 284B,激活 13B 的模型!

智谱的意图已经很清晰了,这个模型不是去打榜的,而是奔着性价比去的,第一个要对标和干翻的肯定就是 DS Flash,更准确地来说是要对标现在的 DeepSeek-V4-Flash-Vision-Exp!

卧槽,DS 这个名字实在是太长了,本来已经很长了,现在加上 Vision Exp 简直了!

DS Flash 我之前详细地测试过,Vision Exp 测得并不多,因为之前对 DS Pro 比较失望,后续模型我就没有太大动力去搞了。

从我自身的感受来看,GLM5.3Flash 在前端、3D 建模等方面肯定是比 DSV 厉害,而 Agent 工作流大家都不错,现在大家都有视觉能力了,都可以有视觉反馈验证了,这部分在形式上差不多。但是深入分析的能力还是 GLM5.3Flash 略胜一筹。

GLM5.3Flash 的问题是,它的 Token 速度本身也不算慢,但是它每个例子消耗的时间非常多。按理说它是一个 Flash 模型,应该特别快才对,但是我实际使用过程中,发现它的处理时间特别长。好多例子,都是半个小时起步。一个需求跑 1 小时也很常见。

由于我拿到这个模型的时候只有开启和关闭选项,开启的情况应该是对应 Max,所以可能和 Max 也有一定的关联!

但是整体来说,就是 GLM5.x 系列模型处理时间都比较久,相比而言,Opus 系列的模型,处理效率是非常高的,Token 的利用率也极高。

总而言之言而总之,这个模型的能力是没问题的,作为一个多模态 Flash 模型,有这个水平,已经很屌了,很多效果其实比 GLM5.3 好的,因为它有多模态。再配上它这个价格就非常香了。

我还没有具体看到价格,我获取到的信息是这样的:模型定价为 1/10 的 GLM-5.3,限时折扣为 1/20 的 GLM-5.3,1/40 的 Opus 4.8,定价低于 DS-V4-Flash,限时折扣定价远低于 DS-V4-Flash 的谷时价格

这么一来,GLM5 套餐太贵买不起的话,直接搞个 API 也挺香的!

API 价格降低 10 倍的话,理论上套餐的用量也应该翻十倍才对,如果真的能如此,那套餐的性价比也就不错了。

看来年初赌 GLM 赌对了,它在综合能力、性价比、上限下限等方面,已经妥妥地拿下国产第一的交椅了。

刚刚看到,智谱也开始玩重置了,而且套餐配额 ×3,API 对折,看来用上国产芯片之后,算力充沛了不少。

做个最终总结

不管外面怎么传,核心就这些:

论能力肯定没法和顶级模型比,同时速度比较慢,慢得不像 Flash,但是下限高,各方面能力都不错,重点------便宜!这不是一个打榜模型,奔着实用来的

相关推荐
宣宣猪的小花园.1 小时前
【控制理论】系统为什么会“有记忆”:从输入输出理解动态过程
人工智能·嵌入式硬件·机器学习
cui_ruicheng1 小时前
LangChain 应用开发(十二):Agent 中间件与内置中间件
人工智能·python·中间件·langchain
智圣新创011 小时前
存量数字化校园效能升级:智圣新创数据治理及一表通平台实现填报减负与数据价值双升
大数据·人工智能·物联网
课件帮1 小时前
教师数字分身+AI协同备课:2026课件帮如何重构教学内容生产?
人工智能·重构
cxr8281 小时前
skills迁移备份
人工智能·智能体
俊哥V1 小时前
AI一周事件 · 2026年8月12日—8月25日
人工智能·ai
prog_61031 小时前
【笔记】用cursor手搓cursor(九)
人工智能·笔记·大语言模型·agent
ai小陈1 小时前
PyTorch多GPU分布式训练实战:从单卡脚本迁移到DDP
服务器·人工智能·pytorch·分布式·深度学习·ai·gpu算力
sdzhyt1 小时前
从劳动仲裁看智能体如何真正走进政务一线?
大数据·人工智能