GLM-5.3 vs Fable 5 vs GPT-5.6 Sol:6 项基准横评,743B 国产编程模型的正面硬刚

最好的国产编程模型,保质期只剩下 20 天。

7 月底大家还在说 Kimi K3 是开源天花板,8 月 13 日 DeepSeek V4 Pro 正式版带着 DeepSWE 62.7 的成绩登场,结果第二天,智谱就把 GLM-5.3 端了上来。官方口径很简单粗暴:编程能力较 GLM-5.2 提升 50%,编程与智能体能力接近 Claude Fable 5,体感超过其他国产模型。

注意一个细节:这次 GLM-5.3 的参数量和 GLM-5.2 几乎一样,都是 743B 级别,所有提升全部来自后训练------同样的基座,两个月不到,硬生生把分数推高了一截。而它的对手们,Kimi K3 是 2.8T,Qwen3.8 Max 是 2.4T。

这周的大模型圈已经卷到「一天一个新旗舰」:有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克说 4.7 马上就来;DeepSeek V4 Pro 正式版多项 benchmark 直指 Fable 5;智谱则把 GLM-5.3 端了上来。四个国产/开源主力(K3、V4 Pro 0813、GLM-5.3)在三天内轮番登场,往年一个季度的发布节奏,现在压缩到了一周。

我花了半天把智谱官方公布的 9 项基准、独立评测和第三方复测全部拉出来交叉核对,下面这份横评,说清楚 GLM-5.3 到底强在哪、弱在哪、以及你该不该换。

先看总表:9 项基准,GLM-5.3 拿到了什么

以下数据来自智谱官方发布(2026-08-14),对比对象为各家官方公布分数:

基准 GLM-5.2 GLM-5.3 Fable 5 GPT-5.6 Sol Kimi K3
Terminal-Bench 3.0(终端真实任务) 4.6 28.3 - 34.6 -
DeepSWE v1.1(长程软件工程) 46.2 66.9 - 72.7 -
AutomationBench(跨应用工作流) 26.2 48.2 46.2 45.8 46.7
Agents' Last Exam(智能体长程任务) 23.8 28.5 - - -
GDPval-AA v2(44 种职业任务) - 1769 1743 1730 -
HLE w/ Tools(最难推理+工具) 54.7 62.5 - - -
CyberGym(漏洞验证) 77.2 84.5 83.8* 83.6 80.0
ExploitBench(漏洞利用链) 24.4 54.4 78.0 76.5 -
ExploitGym(2 小时利用任务数) 29 105 181 216 -

* Fable 5 的 CyberGym 分数由智谱官方提供(83.8)。

表格读出来的故事很清楚:GLM-5.3 不是全面超越,而是「三场赢、三场追、三场输」。AutomationBench、GDPval-AA v2、CyberGym 三项直接领先闭源旗舰;Terminal-Bench、DeepSWE 大幅跃升但还差 GPT-5.6 Sol 一截;ExploitBench、ExploitGym 翻倍增长但差距依旧明显。这是一次「定向突击」式的升级,主攻方向就是编程与智能体。

维度一:编程能力------从 4.6 到 28.3 的质变

先看最炸裂的一项:Terminal-Bench 3.0。这个基准把模型丢进真实 shell 环境,给 600 轮交互和 10 小时超时,看它能不能完成真实终端任务。GLM-5.2 只拿了 4.6,GLM-5.3 直接干到 28.3------6 倍提升。这不是常规迭代,是能力的档位切换。

我在本地复现了一个 Terminal-Bench 风格的典型任务:让模型在仓库里定位一个 flaky 测试并修复:

bash 复制代码
cd /repo && python -m pytest tests/test_checkout.py -x -q
# 期望行为:模型自己 grep 日志、定位竞态条件、改代码、重跑测试直到绿

GLM-5.2 在这个任务里会陷入「反复重跑测试却找不到根因」的循环,GLM-5.3 则能沿着调用栈往下查,主动打开相关源码文件做交叉比对。体感上,这已经不是「补全代码的模型」,而是「会自己 debug 的模型」。

DeepSWE v1.1 从 46.2 升到 66.9 同理。这个基准考察的是数万行代码、上百个文件之间的持续修改能力------前端改完改后端、改完 A 模块记得同步 B 模块的接口。智谱官方说部分训练任务相当于资深工程师连续数天的工作量,从分数涨幅看,这个说法不算夸张。

独立的 KingBench 3 测试(固定可复现的编程+模拟任务集,第三方 MindStudio 跑)给出了更直观的参照:GLM-5.3 得分 91.25%(73/80),超过 Opus 5、Kimi K3、Qwen3.8 Max,与 Fable 5 基本持平。而 GLM-5.2 在同一测试里是 75%。两个月,同一个基座,涨了 16 个百分点。

还有一个容易被忽略但很关键的指标:Token 效率。智谱自研的 Z.ai Code Bench(内部基准,无法第三方复现,这点后面说)在 High 档位下,GLM-5.3 以约 5 万输出 token 完成 31.4% 的任务,Claude Opus 4.8 用 12 万 token 才完成 29.5%。在最高难度档位,GLM-5.3 用 7.5 万 token 完成 34.5%,而 GLM-5.2 花 9.6 万 token 只完成 23.4%;Fable 5 的 39.5% 依然是天花板,但代价是更多的 token。同样的活,GLM-5.3 的 token 开销不到 Opus 4.8 的一半------按 token 计费的时代,这个差距就是实打实的成本差距。

维度二:智能体与长程任务------真正领先闭源旗舰的地方

如果说编程是「追平」,那 Agent 能力就是 GLM-5.3 真正拉开差距的战场。

AutomationBench 测的是跨应用工作流编排:让模型自己决定调用哪些工具、按什么顺序执行、出错怎么恢复。GLM-5.3 拿 48.2,超过 Kimi K3 的 46.7、Fable 5 的 46.2 和 GPT-5.6 Sol 的 45.8------这是开源模型首次在这类基准上同时压过三家闭源/商用旗舰

GDPval-AA v2 是 OpenAI 提出的评估,覆盖 44 种职业的真实高价值知识工作,智谱拿到 1769 分,超过 Fable 5 的 1743 和 GPT-5.6 Sol 的 1730。这个基准的特色是「不是考你知不知道,而是考你干不干得动」------模拟真实办公环境里的长任务执行,分数越高说明模型越能当「数字员工」用。官方给出的用例很具体:让模型在数万行代码、上百个文件、多个相互依赖的系统之间持续推进,前端开发、Bug 修复、代码重构都能在极少人工干预下推进到可交付状态。

HLE w/ Tools 从 54.7 升到 62.5,说明推理能力没有因为专攻编程而退化,反而在工具辅助下变强了------这是「带工具的推理」路线被验证的又一个信号。

当然也有短板:Agents' Last Exam 只从 23.8 升到 28.5,相比 GPT-5.6 Sol 官方公布的 53.6(OpenAI 自家评测口径)差距明显。智谱官方也承认这个基准「仍有提升空间」------长程多轮任务里,GLM-5.3 的执行稳定性还不足以挑战 GPT-5.6 Sol。

维度三:网络安全能力------意外「涌现」的加分项

这次发布最意外的是安全能力。智谱在训练环境里引入了漏洞发现数据后,GLM-5.3 在白盒代码审查、漏洞发现任务中的表现直接持平行业标杆 Mythos 5,官方称已在真实代码库中识别出 2436 个安全漏洞。

看数据更清楚:

text 复制代码
CyberGym(漏洞验证):    GLM-5.3 84.5 > Mythos 5 83.8 > GPT-5.6 Sol 83.6 > Kimi K3 80.0
ExploitBench(利用链):   GLM-5.3 54.4(vs Mythos 5 78.0、GPT-5.6 Sol 76.5)
ExploitGym(2h 任务数):  GLM-5.3 105(vs Mythos 5 181、GPT-5.6 Sol 216)

结论是「守强攻弱」:漏洞发现 能力已经摸到头部水平,但漏洞利用(ExploitBench、ExploitGym)还差得远。智谱把这解释为「优势集中在漏洞利用链前端」,并且为了安全评估,权重要等两周后才开放------这个节奏是合理的,一个能自己挖 0day 的模型,直接放权重确实需要谨慎。

对普通开发者来说,这个能力有个实际用途:让 GLM-5.3 帮你做代码安全审计。把 PR diff 丢给它,让它找注入点、越权路径、不安全的反序列化:

bash 复制代码
# 实测场景:让模型审计一个登录接口的 PR
git diff origin/main...HEAD | head -200 > /tmp/pr.diff
# 期望输出:指出 SQL 拼接、越权判断缺失、异常处理吞错等问题

实测比通用模型的「看出来像是有问题」要具体得多------它会直接指出哪一行、什么条件下存在注入风险,并给出修复建议。

维度四:后训练 Scaling------743B 凭什么打 2.8T

这次升级最值得关注的技术细节是:GLM-5.3 和 GLM-5.2 是同一个基座。智谱官方技术博客的原话是「Scaling post-training is all we did」------全部提升来自后训练。

具体做法是三条线:IndexShare(数据共享/索引体系)、SAO(训练环境规模化),以及新一代 Slime 框架(异步强化学习,Megatron 训练 + SD Lang 做 rollout)。训练环境从「孤立编程题」扩展到「发现问题→分析方案→实施→验证→交付」的完整工作流,部分任务的工作量相当于资深工程师连续数天的工作量,模型需要使用真实的计算集群、存储系统、内部文档与代码库完成任务。

这意味着什么?模型能力的上限可能还没被摸到。 智谱官方自己说「可能我们还远未开发出这个基座的智能上界」。对开发者来说,这是利好------同一个基座还能继续涨;对闭源厂商来说,这是压力------开源阵营的后训练效率正在快速追平「堆参数」路线。

可用性:现在能用什么,要等什么

GLM-5.3 的开放节奏是分阶段的,别搞混:

渠道 状态 说明
GLM Coding Plan ✅ 已上线 8/14 13:00 全员额度重置,订阅用户可直接用
ZCode / AutoClaw ✅ 已上线 智谱官方编程工具 + 效率工具
TraeWork / 扣子 / Qoder 等 ✅ 抢先体验 TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等编码平台
API ⏳ 即将上线 官方文档已更新模型页(1M 上下文、128K 最大输出),上线后开放调用示例
开放权重 ⏳ 约两周后 需先完成安全评估与加固

值得注意的反差:DeepSeek 前一天刚上调 V4 系定价,GLM-5.3 这边却走「Coding Plan 订阅 + 额度重置」的普惠路线。在国产 API 涨价的背景下,模型能力商品化 + 价格竞争的白热化,对开发者来说是好消息。

独立评测者的质疑:官方数字要打折看

官方数据漂亮,但有三点必须泼冷水:

  1. Z.ai Code Bench 是内部基准。 「编程能力提升 50%」这个核心宣传数字来自智谱自研、无法第三方复现的评测。虽然 Terminal-Bench、DeepSWE 这些公开基准的涨幅能交叉验证方向,但 50% 这个具体数字只能当参考,不能当结论。

  2. ExploitGym 的差距被宣传口径掩盖了。 发布会上「涌现安全能力」的叙事很响,但完整看数据,GLM-5.3 在漏洞利用上与 Mythos 5、GPT-5.6 Sol 的差距是数量级的(105 vs 181/216)。如果只看 CyberGym 一项,会得出「安全能力持平」的错误印象。

  3. 模型还没完全开放。 现在只有 GLM Coding Plan 订阅用户能用,API 即将上线,权重两周后开源。第三方大规模复测要等权重开放后才能做------在这之前,所有「体感超过 Kimi K3」的说法都来自官方和少量内测用户。

选型建议

按场景对号入座,直接说结论:

你的主要场景 怎么选 依据
编程体感优先、在乎 Token 成本 GLM-5.3 公开基准涨幅 + Token 效率(5 万 vs 12 万)双优势,Coding Plan 订阅即可用
终端/系统级长程任务 暂缓,等 API 上线复测 Terminal-Bench 28.3 进步巨大,但 GPT-5.6 Sol 34.6 仍领先
安全审计、漏洞排查 GLM-5.3 值得试 CyberGym 84.5 领先,白盒代码审查持平 Mythos 5
追求绝对能力的上限 Fable 5 / GPT-5.6 Sol 最高难度任务(Code Bench 39.5%)和 ExploitGym 仍是闭源旗舰的主场
本地部署 等两周 权重 8 月底开源,743B 的量化部署方案到时候才有定论

三条趋势观察:

  1. 后训练 Scaling 正在改写「参数越大越强」的定律。 GLM-5.3 用 743B 基座在多个基准上压过 2.8T 的 Kimi K3,说明高质量长程 RL 数据的边际收益,可能比堆参数更大。这对中小团队是利好------不需要万卡集群也能追上前沿。

  2. 国产旗舰的竞争焦点已从「模型本身」转向「编程与 Agent 执行」。 从 Kimi K3 到 DeepSeek V4 Pro 0813 再到 GLM-5.3,宣传口径全在 Coding、工具调用、长程任务上。模型能力的商品化速度,比大多数人预期的快。

  3. 「对标 Fable 5」成了开源模型的基本配置,但真正拉开差距的是 Token 效率。 各家都能在某个基准上追平闭源旗舰,可 GLM-5.3 这种「一半 token 干同样的活」的能力,才是对开发者账单真正有意义的指标。

最后说句实在的:所有基准都是纸面数据,而且 GLM-5.3 现在还没开放 API 和权重,第三方复测样本有限。如果急着用,先拿 Coding Plan 试一周;如果不急,等 8 月底权重开放后,自己拉下来跑一遍比看任何横评都靠谱。

延伸阅读:智谱GLM-5.2深度实测:1M上下文+MIT协议

1张草图换1个前端页面------GLM-5V-Turbo视觉编程实测

DeepSeek 涨价 3 倍后换谁?5 款国产模型 API 成本实测

📌 系列文章

测了 4 款模型才发现差距这么大。关注我 👆 第一时间获取更多AI工具深度横评。

相关推荐
兮动人1 天前
DeepSeek 把模型的“马具“开源了:拆解 Harness
gpt·deepseek·harness·dsh
王莹月2 天前
全店商品图风格怎么统一?生图API 用 nano banana pro 批量出同一套视觉
gpt·ai·chatgpt·ai作画·aigc·agi
抱抱宝3 天前
Agent-study项目教程(03):手写 Mini-ReAct Agent(不依赖框架)
javascript·人工智能·gpt·react.js·prompt·agent
抱抱宝3 天前
大模型应用开发教程08 | 构建完整 RAG 应用(Chroma/FAISS 实战)
人工智能·gpt·prompt·agent
晨航3 天前
做一张商品场景图,Nano Banana Pro、Nano Banana 2和GPT Image 2谁更能打?
人工智能·gpt·aigc
xywww1684 天前
真实后台页实测:Opus 5 看图写前端的可用边界在哪
linux·服务器·前端·数据库·人工智能·gpt
回眸&啤酒鸭4 天前
【回眸】GPT-5.6 Luna 深度评测
大数据·人工智能·gpt