GLM-5.3-Flash 已上线 DigitalOcean AI 推理云平台:3200 亿参数、每 Token 仅激活 180 亿参数,支持 100 万 Token 上下文与原生图像/视频输入。DigitalOcean 调用价格低至每百万输入 Token 0.15 美元,并支持统一 API、多模型路由与模型评估。
Z.ai 最新发布的 GLM-5.3-Flash 现已上线 DigitalOcean Inference Engine(推理引擎) ,开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference) 调用,无需自己部署和维护 GPU 推理集群。
如果你之前关注过 OpenRouter 和 OpenCode 上那个没有公开身份的 Ox Alpha,现在谜底也揭晓了:它就是 GLM-5.3-Flash。正式发布之后,这款模型在架构、长上下文和 Agent 能力上的定位也更加清晰。
GLM-5.3-Flash 采用 3200 亿参数 MoE(混合专家)架构 ,但每生成一个 Token 仅激活约 180 亿参数 。它同时也是 GLM-5 系列中首款原生多模态模型 ,可以直接接收文本、图片和视频输入,并支持最高 100 万 Token 上下文。
更值得关注的是价格。目前 GLM-5.3-Flash 在 DigitalOcean 无服务器推理上的价格为每百万输入 Token 0.15 美元、输出 Token 0.50 美元。相比 GLM-5.2 的 1.40/4.40 美元,输入和输出价格都下降了接近 90%。
而且,DigitalOcean 并不是只提供一个 GLM-5.3-Flash API。开发者还可以通过同一套 API 接入平台上的 70 多款模型,并将 GLM-5.3-Flash 加入 Inference Router,与 Claude、GPT、DeepSeek、Qwen、Kimi 等模型一起,根据任务、成本和延迟选择更合适的模型。
对于正在做 AI Coding、Agent、长文档处理或者多模态应用的团队来说,这让 GLM-5.3-Flash 不只是一个值得测试的新模型,也可以成为现有多模型架构中的一个高性价比节点。
3200 亿参数,但每个 Token 只激活 180 亿
GLM-5.3-Flash 是一个 Mixture-of-Experts(MoE,混合专家)模型。
它拥有约 3200 亿总参数 ,但处理每个 Token 时只会激活其中约 180 亿参数。
这个数字甚至比此前 GLM-4.5 系列的 320 亿激活参数还要低。
对推理服务来说,这一点非常重要。3200 亿总参数、每个 Token 只激活 180 亿"意味着:模型拥有 3200 亿参数的总容量,但每次推理只调用其中一部分专家网络。这样做的核心好处是,可以在保留大模型容量的同时,把每个 Token 的实际计算量压下来。
模型总参数量决定了它能够容纳多大的知识和能力,而每次真正参与计算的激活参数,则会直接影响推理所需的算力、显存带宽以及最终成本。
GLM-5.3-Flash 更进一步的地方,在于它针对长上下文推理重新设计了 Attention 架构。
根据 Z.ai 官方介绍,模型采用了稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)结合的混合架构:
- Linear Attention 负责处理局部依赖关系;
- Sparse Attention 则通过轻量级索引器检索全局上下文中真正相关的信息。
为了进一步减少 100 万 Token 上下文下的内存和延迟开销,GLM-5.3-Flash 还引入了 IndexPool,将四个 Indexer Key Vector 压缩为一个。
根据 Z.ai 公布的数据,与 GLM-5.3 相比,这套架构可以让 Attention 计算量降低约 3 倍 ,KV Cache 大小减少约 4.4 倍。
简单来说,GLM-5.3-Flash 并不是单纯把大模型"做小一点",而是在模型结构层面专门针对长上下文和低成本推理做了优化。
这也是它名字里"Flash"真正重要的地方。
100 万 Token 上下文,更适合代码库和长周期 Agent
GLM-5.3-Flash 支持最高 1,048,576 Token,也就是约 100 万 Token 的上下文窗口。
对于普通聊天应用来说,这么大的上下文可能用不上。但在 AI Coding 和 Agent 场景中,情况完全不同。
例如让一个 Coding Agent 修改真实项目,它可能需要同时读取:
- 大量源代码文件
- README 和项目文档
- API 定义
- 数据库 Schema
- 测试代码
- Git Diff
- 编译和运行日志
- Agent 此前几十轮的工具调用结果
如果上下文窗口太小,Agent 就需要不断压缩、裁剪或者重新检索这些信息。一旦关键代码或者早期任务状态被丢掉,后面的判断就容易出现偏差。
100 万 Token 上下文意味着,可以让模型在一次任务过程中保留更多代码、文档和历史信息。
除了 Coding Agent,这种能力也比较适合:
- 大型技术文档分析
- 企业知识库
- 合同与财务文档处理
- 研究资料分析
- 长周期 Agent 工作流
- 大型代码仓库理解
当然,100 万 Token 并不意味着每个请求都应该塞进去 100 万 Token。长上下文仍然会增加延迟和推理费用。
真正重要的是,当任务确实需要完整上下文时,应用不必因为模型窗口太小而被迫提前裁剪大量信息。
GLM-5 系列首款原生多模态模型
相比 GLM-5.2,GLM-5.3-Flash 还有一个很明显的变化:
它不再只是文本模型。
GLM-5.3-Flash 是 Z.ai 在 GLM-5 系列中的首款原生多模态模型,可以同时接收:
文本、图片和视频。
DigitalOcean 无服务器推理中提供的 GLM-5.3-Flash API 同样支持文本、图像和视频输入。
这使得它能够处理一些传统纯文本 Agent 很难完成的任务。
例如,Coding Agent 不仅可以读取代码,还可以查看:
- UI 截图
- 网页页面
- 数据图表
- 设计稿
- 视频内容
- 软件运行结果
Z.ai 甚至展示了一些更加复杂的 Agent 工作流:模型读取设计图之后,通过代码调用 Blender、build123d 等工具生成 3D 场景或者 CAD 模型,随后再查看渲染结果,根据视觉反馈继续修改自己的代码。
这里比较值得关注的并不是"AI 能不能做 3D 建模"本身,而是背后的 Agent 工作方式发生了变化:
模型可以执行任务,然后真正"看见"自己的执行结果,再决定下一步做什么。
这对于 Computer Use、Browser Agent、设计自动化以及需要视觉反馈的 AI Agent 来说,会比单纯的文字输入更加实用。
AI Coding 和 Agent 能力提升明显
从 Z.ai 公布的 Benchmark 来看,GLM-5.3-Flash 的重点也非常明确:AI Coding 和 Agent。
几个比较值得关注的数据如下:
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 |
| DeepSWE v1.1 | 63.4 | 46.2 |
| Toolathlon Verified | 78.4 | 59.9 |
| AutomationBench | 48.8 | 26.2 |
| Agents' Last Exam | 26.3 | 20.4 |
数据来自 Z.ai 官方公布的 GLM-5.3-Flash Benchmark。
其中比较明显的是 DeepSWE v1.1。
GLM-5.3-Flash 从 GLM-5.2 的 46.2 分提高到了 63.4 分,说明它在真实软件工程任务上的提升并不只是几个百分点。
AutomationBench 的变化甚至更大,从 26.2 提升到了 48.8。
这类 Benchmark 更值得 Agent 开发者关注,因为它测试的不只是"一次回答一道编程题",而是模型在复杂环境里进行规划、使用工具、观察结果、继续执行任务的能力。
当然,Benchmark 并不能直接等同于生产环境体验。
不同 Coding Agent 框架、System Prompt、工具权限、推理参数甚至代码运行环境,都可能明显影响最终结果。
因此,更适合生产环境的做法不是看到某个 Benchmark 第一名就直接换模型,而是使用自己的真实任务进行测试。
这一点恰好也是 DigitalOcean 这次提供 GLM-5.3-Flash 时比较有意思的地方,后面我们还会提到它的 Model Evaluations。
每百万输入 Token 仅 0.15 美元
如果说能力提升只是 GLM-5.3-Flash 的一半,那么另一半就是价格。
目前 GLM-5.3-Flash 在 DigitalOcean 无服务器推理上的价格为:
| 模型 | 输入 / 百万 Token | 输出 / 百万 Token |
|---|---|---|
| GLM-5.3-Flash | 0.15 美元 | 0.50 美元 |
| GLM-5.2 | 1.40 美元 | 4.40 美元 |
另外,GLM-5.3-Flash 的 Prompt Cache Read 价格目前为每百万 Token 0.15 美元。
相比 GLM-5.2,GLM-5.3-Flash 的输入价格下降约 89% ,输出价格下降约 89%。
这对于 Agent 场景尤其重要。
普通聊天可能只调用模型一次,但一个 Agent 为了完成任务,可能需要连续进行几十次甚至数百次模型调用。
它可能先分析任务,再搜索文件,然后读取代码、修改代码、运行测试、读取错误日志、再次修改......
调用次数一旦上去,每百万 Token 几美元和几毛钱之间的差距就会迅速放大。
也正因为如此,GLM-5.3-Flash 更适合一种越来越常见的需求:
不一定每次都追求最强的旗舰模型,而是希望找到一个能够承担大量日常 Agent 任务,同时成本足够低的模型。
一个 API,可以同时接入 70 多款模型
如果应用只准备使用 GLM-5.3-Flash,一个 Serverless Inference API 就已经够用了。
但实际生产环境往往不会这么简单。
一个 AI 产品里可能同时存在:
- 简单文本分类
- 内容摘要
- 图片理解
- 长上下文分析
- Coding
- Tool Calling
- 深度推理
- Agent 自动化
这些任务全部交给同一个模型,通常并不是最优解。
DigitalOcean 推理平台目前提供 70 多款模型,覆盖 OpenAI、Claude、DeepSeek、Qwen、Kimi、GLM、Llama、Nemotron 等多个模型系列。
对于应用开发者来说,一个比较直接的好处是:
可以使用同一套 API 接入这些模型。
不需要为了测试一个新模型,就重新对接一个平台、维护另一套 SDK 和鉴权逻辑。
而如果业务已经开始同时使用多个模型,还可以进一步使用 DigitalOcean Inference Router(推理路由器)。
例如:
简单分类和格式转换 → 低成本模型
日常 Coding 和 Agent → GLM-5.3-Flash
超复杂代码任务 → 更强的旗舰模型
长文档任务 → 长上下文模型
DigitalOcean Inference Router 可以根据成本、延迟或者任务类型,把不同请求分配给更加合适的模型。
这样 GLM-5.3-Flash 就不一定需要成为应用里"唯一的模型",而可以成为整个 AI 推理架构中的一个重要节点。
尤其考虑到它目前每百万输入 Token 0.15 美元、输出 0.50 美元的价格,它很适合承担大量对能力有一定要求、但又没必要每次调用最贵模型的任务。
不确定哪个模型最好?还可以让多个模型一起回答
除了推理路由之外,DigitalOcean 现在还有一种更特别的多模型用法:Model Synthesis(多模型融合)。
它的逻辑和路由不太一样。
推理路由是:
从多个模型中选择一个模型处理这次请求。
而 Model Synthesis 则是:
让多个模型同时处理同一个问题,再由一个更高层的模型综合不同结果,最终给出一个答案。
DigitalOcean 当前支持最多选择 8 个分析模型并行处理请求,再由一个顶层模型生成最终结果。
例如,在一个复杂研究任务中,可以同时让 GLM-5.3-Flash、Qwen、DeepSeek 和 Claude 分别分析问题,再综合它们的结果。
当然,这种方法因为一次请求实际上调用了多个模型,所以成本和延迟都会明显高于普通单模型推理,并不适合所有场景。
它更适合高价值、低频率、对答案质量要求比较高的复杂分析和研究任务。
在 DigitalOcean 上,不需要自己部署 3200 亿参数模型
虽然 GLM-5.3-Flash 每次只激活 180 亿参数,但不要把"18B Active Parameters"理解成它就是一个普通 18B 模型。
它仍然拥有 3200 亿总参数。
如果自己部署,模型权重、KV Cache、长上下文、多 GPU 并行、推理框架、量化、并发调度以及高可用都需要自己处理。
而且,对于支持图片和视频输入的多模态模型,生产部署还会涉及额外的编码和推理链路。
DigitalOcean 这次提供的是 Serverless Inference(无服务器推理)。
也就是说,开发者不需要:
- 自己租用和配置多张 GPU
- 下载和维护模型权重
- 部署 vLLM / SGLang 等推理框架
- 配置 Tensor Parallel
- 处理 GPU 扩缩容
- 维护多模态推理服务
- 为低谷期闲置的 GPU 持续付费
直接通过 API 调用,按照实际 Token 使用量计费即可。
DigitalOcean 中国区企业用户如果需要测试 GLM-5.3-Flash、评估 Token 成本、迁移现有 OpenAI API 应用,或者规划无服务器推理、推理路由器与 GPU 部署方案,也可以联系 DigitalOcean 中国区战略合作伙伴卓普云 AI Droplet(aidroplet.com)获取中文技术支持。