【LLM】GLM-5.3-Flash模型

note

  • GLM-5.3-Flash模型:320B总参数,19B激活参数。在编码和智能体评估方面,GLM-5.3-Flash 的表现接近 Claude Opus 4.8 的水平。
  • 基准上 MVBench 约 77.8,MMVU 约 80.5,属 Flash 级多模态视频理解可用水平,但不支持音频输入
  • GLM-5.3-Flash 在多个方面进行了架构改进。首次引入了混合式架构,结合了稀疏注意力机制和线性注意力机制,从而显著降低了长上下文服务的成本,同时保留了精确的长上下文处理能力。此外,采用了 Manifold-Constrained Hyper-Connections(mHC)技术,进一步提升了扩展效率。结合最新的 30T 令牌多模态预训练语料库,这些改进使得 GLM-5.3-Flash 能够在较少的计算资源下实现更强大的性能。

文章目录

一、模型架构

二、效果

MVBench 和 MMVU:我们使用的参数设置为温度=1.0,top_p=0.95,最大上下文长度为 256K 个令牌。对于那些原生支持视频输入的模型,比如 Gemini 3.7 Flash,我们可以直接将原始视频作为输入进行评估。而对于那些不支持视频输入的模型,我们会采用默认的 1 帧每秒的提取策略。如果提取出的帧数超过 API 的最大限制,我们会在整个视频范围内进行均匀采样,直到达到这个最大帧数限制为止。

Reference

1 https://docs.z.ai/guides/vlm/glm-5.3-flash

2 https://huggingface.co/zai-org/GLM-5.3-Flash

3 GLM-5.3: Frontier Coding with Emergent Cyber Capabilities:https://z.ai/blog/glm-5.3

相关推荐
东姬AI9 小时前
语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步
ai·数字人·多模态·视频生成·语音大模型
梦在远山后10 小时前
Electron 与 FastAPI 如何完成流式 Agent 对话
python·langchain·agent
咕泡科技10 小时前
咕泡科技FDE系列最新产品重磅发布!
人工智能·大模型·ai落地·fde·前沿部署工程师
犀利豆10 小时前
为什么全世界的 AI 都画不好一只骑自行车的鹈鹕
人工智能·llm·aigc
浩瀚地学11 小时前
deepagents学习打卡day04
python·agent
wangruofeng11 小时前
9 款主流 AI Agent CLI 对比:安装、版本查询与升级命令
aigc·agent·ai编程
智码看视界11 小时前
开源大模型前沿:科研智能体——Intern-S2-397B ,本地可跑的科学文献 Agent
科研·agent·intern-s2-397b·书生-s2·科学多模态大模型·apache 2.0
墨心@11 小时前
实验 2-6 豆包版复现分析:Agent Skills 从论文生成演示文稿
自然语言处理·nlp·agent·智能体·datawhale共学
机械改造鹅12 小时前
拆解 prime-agent 系列——(2)Python runtime 与 kernel
agent
武子康12 小时前
Codex 后台任务结束了,为什么还不能直接接着用?
人工智能·llm·agent