GLM 5.3 已上线 DigitalOcean AI 推理云平台:Agent 任务的高性价比底座来了

GLM-5.3-Flash 已上线 DigitalOcean AI 推理云平台:3200 亿参数、每 Token 仅激活 180 亿参数,支持 100 万 Token 上下文与原生图像/视频输入。DigitalOcean 调用价格低至每百万输入 Token 0.15 美元,并支持统一 API、多模型路由与模型评估。

Z.ai 最新发布的 GLM-5.3-Flash 现已上线 DigitalOcean Inference Engine(推理引擎) ,开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference) 调用,无需自己部署和维护 GPU 推理集群。

如果你之前关注过 OpenRouter 和 OpenCode 上那个没有公开身份的 Ox Alpha,现在谜底也揭晓了:它就是 GLM-5.3-Flash。正式发布之后,这款模型在架构、长上下文和 Agent 能力上的定位也更加清晰。

GLM-5.3-Flash 采用 3200 亿参数 MoE(混合专家)架构 ,但每生成一个 Token 仅激活约 180 亿参数 。它同时也是 GLM-5 系列中首款原生多模态模型 ,可以直接接收文本、图片和视频输入,并支持最高 100 万 Token 上下文

更值得关注的是价格。目前 GLM-5.3-Flash 在 DigitalOcean 无服务器推理上的价格为每百万输入 Token 0.15 美元、输出 Token 0.50 美元。相比 GLM-5.2 的 1.40/4.40 美元,输入和输出价格都下降了接近 90%。

而且,DigitalOcean 并不是只提供一个 GLM-5.3-Flash API。开发者还可以通过同一套 API 接入平台上的 70 多款模型,并将 GLM-5.3-Flash 加入 Inference Router,与 Claude、GPT、DeepSeek、Qwen、Kimi 等模型一起,根据任务、成本和延迟选择更合适的模型。

对于正在做 AI Coding、Agent、长文档处理或者多模态应用的团队来说,这让 GLM-5.3-Flash 不只是一个值得测试的新模型,也可以成为现有多模型架构中的一个高性价比节点。

3200 亿参数,但每个 Token 只激活 180 亿

GLM-5.3-Flash 是一个 Mixture-of-Experts(MoE,混合专家)模型

它拥有约 3200 亿总参数 ,但处理每个 Token 时只会激活其中约 180 亿参数

这个数字甚至比此前 GLM-4.5 系列的 320 亿激活参数还要低。

对推理服务来说,这一点非常重要。3200 亿总参数、每个 Token 只激活 180 亿"意味着:模型拥有 3200 亿参数的总容量,但每次推理只调用其中一部分专家网络。这样做的核心好处是,可以在保留大模型容量的同时,把每个 Token 的实际计算量压下来

模型总参数量决定了它能够容纳多大的知识和能力,而每次真正参与计算的激活参数,则会直接影响推理所需的算力、显存带宽以及最终成本。

GLM-5.3-Flash 更进一步的地方,在于它针对长上下文推理重新设计了 Attention 架构。

根据 Z.ai 官方介绍,模型采用了稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)结合的混合架构

  • Linear Attention 负责处理局部依赖关系;
  • Sparse Attention 则通过轻量级索引器检索全局上下文中真正相关的信息。

为了进一步减少 100 万 Token 上下文下的内存和延迟开销,GLM-5.3-Flash 还引入了 IndexPool,将四个 Indexer Key Vector 压缩为一个。

根据 Z.ai 公布的数据,与 GLM-5.3 相比,这套架构可以让 Attention 计算量降低约 3 倍 ,KV Cache 大小减少约 4.4 倍

简单来说,GLM-5.3-Flash 并不是单纯把大模型"做小一点",而是在模型结构层面专门针对长上下文和低成本推理做了优化。

这也是它名字里"Flash"真正重要的地方。

100 万 Token 上下文,更适合代码库和长周期 Agent

GLM-5.3-Flash 支持最高 1,048,576 Token,也就是约 100 万 Token 的上下文窗口

对于普通聊天应用来说,这么大的上下文可能用不上。但在 AI Coding 和 Agent 场景中,情况完全不同。

例如让一个 Coding Agent 修改真实项目,它可能需要同时读取:

  • 大量源代码文件
  • README 和项目文档
  • API 定义
  • 数据库 Schema
  • 测试代码
  • Git Diff
  • 编译和运行日志
  • Agent 此前几十轮的工具调用结果

如果上下文窗口太小,Agent 就需要不断压缩、裁剪或者重新检索这些信息。一旦关键代码或者早期任务状态被丢掉,后面的判断就容易出现偏差。

100 万 Token 上下文意味着,可以让模型在一次任务过程中保留更多代码、文档和历史信息。

除了 Coding Agent,这种能力也比较适合:

  • 大型技术文档分析
  • 企业知识库
  • 合同与财务文档处理
  • 研究资料分析
  • 长周期 Agent 工作流
  • 大型代码仓库理解

当然,100 万 Token 并不意味着每个请求都应该塞进去 100 万 Token。长上下文仍然会增加延迟和推理费用。

真正重要的是,当任务确实需要完整上下文时,应用不必因为模型窗口太小而被迫提前裁剪大量信息。

GLM-5 系列首款原生多模态模型

相比 GLM-5.2,GLM-5.3-Flash 还有一个很明显的变化:

它不再只是文本模型。

GLM-5.3-Flash 是 Z.ai 在 GLM-5 系列中的首款原生多模态模型,可以同时接收:

文本、图片和视频。

DigitalOcean 无服务器推理中提供的 GLM-5.3-Flash API 同样支持文本、图像和视频输入。

这使得它能够处理一些传统纯文本 Agent 很难完成的任务。

例如,Coding Agent 不仅可以读取代码,还可以查看:

  • UI 截图
  • 网页页面
  • 数据图表
  • 设计稿
  • 视频内容
  • 软件运行结果

Z.ai 甚至展示了一些更加复杂的 Agent 工作流:模型读取设计图之后,通过代码调用 Blender、build123d 等工具生成 3D 场景或者 CAD 模型,随后再查看渲染结果,根据视觉反馈继续修改自己的代码。

这里比较值得关注的并不是"AI 能不能做 3D 建模"本身,而是背后的 Agent 工作方式发生了变化:

模型可以执行任务,然后真正"看见"自己的执行结果,再决定下一步做什么。

这对于 Computer Use、Browser Agent、设计自动化以及需要视觉反馈的 AI Agent 来说,会比单纯的文字输入更加实用。

AI Coding 和 Agent 能力提升明显

Z.ai 公布的 Benchmark 来看,GLM-5.3-Flash 的重点也非常明确:AI Coding 和 Agent。

几个比较值得关注的数据如下:

Benchmark GLM-5.3-Flash GLM-5.2
Terminal-Bench 2.1 84.3 81.0
DeepSWE v1.1 63.4 46.2
Toolathlon Verified 78.4 59.9
AutomationBench 48.8 26.2
Agents' Last Exam 26.3 20.4

数据来自 Z.ai 官方公布的 GLM-5.3-Flash Benchmark

其中比较明显的是 DeepSWE v1.1

GLM-5.3-Flash 从 GLM-5.2 的 46.2 分提高到了 63.4 分,说明它在真实软件工程任务上的提升并不只是几个百分点。

AutomationBench 的变化甚至更大,从 26.2 提升到了 48.8

这类 Benchmark 更值得 Agent 开发者关注,因为它测试的不只是"一次回答一道编程题",而是模型在复杂环境里进行规划、使用工具、观察结果、继续执行任务的能力。

当然,Benchmark 并不能直接等同于生产环境体验。

不同 Coding Agent 框架、System Prompt、工具权限、推理参数甚至代码运行环境,都可能明显影响最终结果。

因此,更适合生产环境的做法不是看到某个 Benchmark 第一名就直接换模型,而是使用自己的真实任务进行测试。

这一点恰好也是 DigitalOcean 这次提供 GLM-5.3-Flash 时比较有意思的地方,后面我们还会提到它的 Model Evaluations

每百万输入 Token 仅 0.15 美元

如果说能力提升只是 GLM-5.3-Flash 的一半,那么另一半就是价格。

目前 GLM-5.3-Flash 在 DigitalOcean 无服务器推理上的价格为:

模型 输入 / 百万 Token 输出 / 百万 Token
GLM-5.3-Flash 0.15 美元 0.50 美元
GLM-5.2 1.40 美元 4.40 美元

另外,GLM-5.3-Flash 的 Prompt Cache Read 价格目前为每百万 Token 0.15 美元

相比 GLM-5.2,GLM-5.3-Flash 的输入价格下降约 89% ,输出价格下降约 89%

这对于 Agent 场景尤其重要。

普通聊天可能只调用模型一次,但一个 Agent 为了完成任务,可能需要连续进行几十次甚至数百次模型调用。

它可能先分析任务,再搜索文件,然后读取代码、修改代码、运行测试、读取错误日志、再次修改......

调用次数一旦上去,每百万 Token 几美元和几毛钱之间的差距就会迅速放大。

也正因为如此,GLM-5.3-Flash 更适合一种越来越常见的需求:

不一定每次都追求最强的旗舰模型,而是希望找到一个能够承担大量日常 Agent 任务,同时成本足够低的模型。

一个 API,可以同时接入 70 多款模型

如果应用只准备使用 GLM-5.3-Flash,一个 Serverless Inference API 就已经够用了。

但实际生产环境往往不会这么简单。

一个 AI 产品里可能同时存在:

  • 简单文本分类
  • 内容摘要
  • 图片理解
  • 长上下文分析
  • Coding
  • Tool Calling
  • 深度推理
  • Agent 自动化

这些任务全部交给同一个模型,通常并不是最优解。

DigitalOcean 推理平台目前提供 70 多款模型,覆盖 OpenAI、Claude、DeepSeek、Qwen、Kimi、GLM、Llama、Nemotron 等多个模型系列。

对于应用开发者来说,一个比较直接的好处是:

可以使用同一套 API 接入这些模型。

不需要为了测试一个新模型,就重新对接一个平台、维护另一套 SDK 和鉴权逻辑。

而如果业务已经开始同时使用多个模型,还可以进一步使用 DigitalOcean Inference Router(推理路由器)

例如:

简单分类和格式转换 → 低成本模型

日常 Coding 和 Agent → GLM-5.3-Flash

超复杂代码任务 → 更强的旗舰模型

长文档任务 → 长上下文模型

DigitalOcean Inference Router 可以根据成本、延迟或者任务类型,把不同请求分配给更加合适的模型。

这样 GLM-5.3-Flash 就不一定需要成为应用里"唯一的模型",而可以成为整个 AI 推理架构中的一个重要节点。

尤其考虑到它目前每百万输入 Token 0.15 美元、输出 0.50 美元的价格,它很适合承担大量对能力有一定要求、但又没必要每次调用最贵模型的任务。

不确定哪个模型最好?还可以让多个模型一起回答

除了推理路由之外,DigitalOcean 现在还有一种更特别的多模型用法:Model Synthesis(多模型融合)

它的逻辑和路由不太一样。

推理路由是:

从多个模型中选择一个模型处理这次请求。

而 Model Synthesis 则是:

让多个模型同时处理同一个问题,再由一个更高层的模型综合不同结果,最终给出一个答案。

DigitalOcean 当前支持最多选择 8 个分析模型并行处理请求,再由一个顶层模型生成最终结果。

例如,在一个复杂研究任务中,可以同时让 GLM-5.3-Flash、Qwen、DeepSeek 和 Claude 分别分析问题,再综合它们的结果。

当然,这种方法因为一次请求实际上调用了多个模型,所以成本和延迟都会明显高于普通单模型推理,并不适合所有场景。

它更适合高价值、低频率、对答案质量要求比较高的复杂分析和研究任务。

在 DigitalOcean 上,不需要自己部署 3200 亿参数模型

虽然 GLM-5.3-Flash 每次只激活 180 亿参数,但不要把"18B Active Parameters"理解成它就是一个普通 18B 模型。

它仍然拥有 3200 亿总参数

如果自己部署,模型权重、KV Cache、长上下文、多 GPU 并行、推理框架、量化、并发调度以及高可用都需要自己处理。

而且,对于支持图片和视频输入的多模态模型,生产部署还会涉及额外的编码和推理链路。

DigitalOcean 这次提供的是 Serverless Inference(无服务器推理)

也就是说,开发者不需要:

  • 自己租用和配置多张 GPU
  • 下载和维护模型权重
  • 部署 vLLM / SGLang 等推理框架
  • 配置 Tensor Parallel
  • 处理 GPU 扩缩容
  • 维护多模态推理服务
  • 为低谷期闲置的 GPU 持续付费

直接通过 API 调用,按照实际 Token 使用量计费即可。

DigitalOcean 中国区企业用户如果需要测试 GLM-5.3-Flash、评估 Token 成本、迁移现有 OpenAI API 应用,或者规划无服务器推理、推理路由器与 GPU 部署方案,也可以联系 DigitalOcean 中国区战略合作伙伴卓普云 AI Droplet(aidroplet.com)获取中文技术支持。

相关推荐
HIT_Weston42 分钟前
190、【Agent】【OpenCode】TuiThreadCmd(alias)
人工智能·agent·opencode
DeepAgent1 小时前
AI Agent 工程实践(34):企业 AI Agent 架构
数据库·人工智能·agent
QuZhengRong1 小时前
【AI】Agent 全栈进阶|Agent 设计模式
人工智能·学习·设计模式·llm·agent
阿里云大数据AI技术2 小时前
使用 PAI ,一行命令跑起来云端 DeepSeek Agent
人工智能·agent·deepseek
leeyi4 小时前
数据库迁移不翻车:golang-migrate 实战,143 个 DDL 有序执行(第97篇-E83)
go·aigc·agent
AINative软件工程4 小时前
LLM 应用的 Rate Limit 工程实践:令牌桶、滑动窗口与 API 配额管理的生产设计
llm
慕易8355 小时前
我把 LangGraph 官方 Demo 扩成了生产级多 Agent 系统,这 3 个"反直觉"设计救了整个项目
agent
今日无bug5 小时前
MCP 入门实战:Tool 和 LLM 解耦?跨进程跨语言调用工具原来是这么回事
llm·agent·mcp
星火10245 小时前
【从 0 到 1 动手造 Agent】02、确定性铁笼 LangGraph
人工智能·后端·agent