智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御

智谱发布 GLM-5.3 当天,股价却跌了 3.6%,讨论热度远不如此前几代旗舰亮相。这不是模型没变强,而是国产 AI 进入深水区后,光靠跑分已无法撬动市场神经。

核心机制:后训练 Scaling 而非基座重训

GLM-5.3 与 5.2 使用完全相同的基座权重,所有性能提升全部来自后训练。智谱构建了一套端到端的任务环境合成流水线,引入数十倍的长程任务环境,部分任务的工作量相当于一名资深工程师数天的工作,模型需要自主定位瓶颈、实施优化、运行实验并完成可量化结果。

为防止强化学习中的奖励作弊,团队引入了"验证器三关"机制:给定正确解必须给奖励、给空跑必须不给奖励、给未完成任务也必须不给奖励。只有三个条件同时通过的验证器才能投入使用,确保训练信号真正可信。

##核心机制:后训练Scalin

要点一:编程能力领跑开源

在 DeepSWE v1.1 基准上,GLM-5.3 得分从 46.2 跃升至 66.9;Terminal Bench 3.0 和 Agents' Last Exam (CLI) 等公开榜单均为开源第一。内部自研评测显示代码综合能力较 5.2 提升约 50%。

要点二:涌现的网络安全能力

CyberGym 白盒漏洞发现任务中,GLM-5.3 得分 84.5%,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%),显著高于 5.2 的 77.2%。ExploitBench 深度推理得分 54.4%,是 5.2 的两倍以上,但仍落后于 Mythos 5 的 78.0%。

真实案例方面,一个名为 Neo 的 AI Agent 两个月内管理 4 台服务器、6 万个邮箱发出超 1.8 万封钓鱼邮件,面对碎片化攻击线索,GLM-5.3 帮助安全研究人员还原完整攻击链。模型站在哪一边,取决于掌握它的人。

##要点二:涌现的网络安全能力C

要点三:开源许可与安全审查门槛

GLM-5.3 支持本地部署、微调及商业化,仅当年营业额超过 100 亿美元的机构拟将其作为外部模型服务提供时,才须进行安全审查。GLM-5.3-Flash 版本也已上线 Hugging Face。

判断

GLM-5.3 证明了一件事:在基座不变的前提下,通过高质量任务环境和严格验证机制做后训练 Scaling,仍能逼近闭源旗舰水平。开源之盾的价值不在于取代商业模型,而在于让防守方不再被动。对开发者而言,现在是用最低成本拿到前沿智能的最佳窗口期;对行业而言,当最强能力可以被本地运行,护城河将从模型本身转向部署与定制。

参考文献

1 GLM 5.3: Scaling with post-training, intuitively explained. www.baseten.co/blog/glm-53 2 GLM-5.3:前沿编程能力与涌现的网络安全能力. www.zhipuai.cn/zh/research... 3 GLM-5.3:前沿编程与涌现的网络安全能力 - 知乎. zhuanlan.zhihu.com/p/207160056... 4 智谱发布GLM-5.3:开源的"安全之盾". finance.sina.com.cn/stock/t/202... 5 更强的GLM-5.3,为什么没有刷屏?-钛媒体官方网站. www.tmtpost.com/8112832.htm... 6 更强的GLM-5.3,为什么没有刷屏?. m.36kr.com/p/395025710... 7 GLM-5.3 - 智谱AI开放文档. docs.bigmodel.cn/cn/guide/mo... 8 智谱正式发布GLM-5.3:编程能力最强开源模型|glm|网络安全|高吞吐量内核_网易订阅. www.163.com/dy/article/...

相关推荐
Setsuna_F_Seiei9 小时前
前端转型 Agent 开发 06 之 Agent Memory 记忆系统(让 Agent 更智能,更懂你)
前端·agent·ai编程
zhangzeyuaaa10 小时前
Ruby 多线程、GVL(GIL)与 Mutex 完全指南
开发语言·前端·ruby
默_笙10 小时前
🌊 向量库和 ES 都查不出"关系",我只好给奶茶建了一张人脉网
前端·javascript
优选资讯10 小时前
标签打印软件怎么对接 Excel 数据
前端·excel
一个风轻云淡11 小时前
GCC 和 GDB命令简单解读
java·linux·前端
u01110267512 小时前
图片处理接口如何统一错误信息 前端提示与后端错误码设计
前端·状态模式
福兮说12 小时前
浏览器里把 iPhone 的 HEIC 转成 JPG:Chrome 解不开、转完大了七成、拍摄时间全丢,六个坑实测
前端·javascript·图像处理·chrome·ios·iphone·heic
libokaifa12 小时前
把语音模型塞进手机:sherpa-onnx 在 Android 上的 ASR / TTS
前端
deli00713 小时前
DLA 枝晶生长实测:5000 个粒子集体停摆之后,分形维数收敛到 1.70
前端
IT_陈寒13 小时前
Redis卡顿的锅,这次真不是大key的错
前端·人工智能·后端