AI Agent如何降本?从五层技术栈到三种推理服务

近日,在白鲸出海主办的全球 AI 出海大会上,卓普云科技解决方案架构师丁可受邀发表主题演讲《AI Agent 落地的 5 层技术栈:Serverless vs Dedicated,全球部署的两种姿势怎么选》。他从 AI Agent 带来的推理成本压力出发,系统介绍了 DigitalOcean AI 原生云的五层技术栈,以及企业从产品原型走向全球规模化部署时选择推理服务的实践路径。

注:卓普云是DigitalOcean中国区独家战略合作伙伴,由DigitalOcean股东Access Technology Venture投资创建。主要负责DigitalOcean在中国地区的商务合作、技术支持等。

Agent 工作流正在放大推理成本

丁可在演讲开场指出,随着 AI 应用从单次模型调用转向 Agent 工作流,推理账单正在快速增长。一方面,智能体会在任务执行过程中反复调用模型;另一方面,如果应用将所有任务都交给同一个前沿模型处理,大量简单请求也会按照高规格模型的费率计费。

他举了多个行业信号:

  • Uber 在 4 个月内耗尽年度 AI 编码预算,随后不得不设置每人每月 1500 美元的使用上限;
  • Walmart 为内部 Code Puppy Agent 设置 Token 限制,但员工仍会反复提出相似问题;
  • Priceline 员工报告 Cursor 续费价格上涨 4 至 5 倍。与此同时,单模型硬编码可能导致 80% 以上的任务按照前沿模型费率付费。

丁可认为,AI Agent 的成本问题不能只靠寻找更便宜的单一模型解决。企业需要从基础设施、部署方式、模型路由、缓存策略和多模型协作等多个层面共同优化。

从基础设施到托管智能体:AI 原生云的五层技术栈

围绕 AI Agent 的开发和运行,丁可介绍了 DigitalOcean AI 原生云的五层技术栈。

第一层是基础设施,包括全球数据中心、GPU 集群、液冷设施和高速网络。第二层是核心云平台,覆盖 Kubernetes、CPU/GPU 云主机、VPC、RDMA 网络、对象存储、块存储、文件存储和函数服务。第三层是本次演讲重点介绍的推理引擎,包括无服务器推理、专属推理、推理路由、模型合成、模型库、多模态能力和模型评估。

第四层是数据与学习,涵盖数据库服务、pgvector、Weaviate 向量数据库和知识库服务。第五层则是托管智能体,包括智能体运行、沙箱、工具调用和路由代理。五层能力在同一平台上集成,开发者可以根据业务阶段逐步组合,而不必在一开始就搭建完整的 AI 基础设施。

在全球部署方面,DigitalOcean 目前拥有 13 个区域、20 个数据中心和 200 多个网络 PoP,并提供 NVIDIA H100、H200、B300、A100、L40S,以及 AMD MI300、MI325X、MI350X、MI355X 等 GPU 云资源。丁可表示,全球基础设施与统一云平台是 AI 应用进入不同市场、降低用户访问延迟的基础。

推理引擎连接模型、算力与应用

在五层技术栈中,推理引擎承担了连接模型与应用的核心作用。DigitalOcean 的推理引擎同时提供模型库、无服务器推理、专属推理、批量推理、推理路由、模型评估和模型演练等能力,并支持 OpenAI、Anthropic、GLM、Mistral、Llama、MiniMax、Gemma、DeepSeek、Kimi、Qwen 等模型,以及用户自行上传模型。

在底层推理优化方面,该平台采用 vLLM、KV Cache、Prefix Cache、推测解码和内核优化等技术,以改善 Token 生成速度、缓存利用率和总体性价比。

三种推理服务,分别解决不同阶段的问题

丁可随后重点比较了 Serverless Inference(无服务器推理)、Dedicated Inference(专用推理) 和 Inference Router(推理路由器) 三种服务。

Serverless Inference 适合突发流量、产品原型、多模型调用和运维人员较少的团队。它按 Token 计费,没有最低使用承诺,并提供非高峰时段优惠。开发者可以一键调用 30 多个模型,通过兼容 OpenAI 和 Anthropic 的接口接入,并与其他云资源统一部署和计费。其典型用户是初创团队、产品原型和流量波动较大的业务。

Dedicated Inference 面向稳定高吞吐、自带模型、需要可预测延迟或 VPC 私有端点的业务。它预留 GPU 资源。这个推理服务有专属 GPU、vLLM 与 LLM-d 推理栈、公开或私有端点,以及缓存感知路由,这是它的主要优势。

Inference Router 适合 Agent 工作流、多任务场景、成本优化和多模型应用。它位于应用和模型之间,根据任务自动选择模型,并通过统一 API 返回结果。Router 不额外收费,只需一行代码即可接入。

基于三种服务的特点,丁可给出的演进路径是:先用 Serverless 快速验证产品,再用 Router 优化单位推理成本,最后将规模化、稳定负载迁移到 Dedicated。而且,这三种服务共享同一套 API,可以减少迁移时的应用改造。

从原型到规模化的六项实践建议

在服务选择之后,丁可进一步给出了六项推理实践建议。

第一,使用 Serverless 起步,以零运维和按 Token 付费的方式快速验证产品;当流量稳定后,再通过相同 API 契约迁移至 Dedicated。

第二,引入 Router 选择模型。其 30B MoE 路由模型可在约 200 毫秒内完成决策,避免 80% 以上的任务都按前沿模型费率处理。DigitalOcean 的客户 LawVo 通过该方案将推理成本降低了 40% 以上。

第三,在规模化阶段启用专属推理,以获得更低的单位成本、更稳定的性能、更灵活的自有模型与资源配置,以及满足安全合规需要的数据保存能力。DigitalOcean 的客户 Character.ai ,在使用了 DigitalOcean 云平台之后,其成本降低了 50%。

第四,对非实时任务利用非高峰时段和批量推理。DigitalOcean 在晚 11 点至凌晨 4 点提供更低的非高峰价格;异步批量推理提供 24 小时 SLA,价格可降低 50%,适合数据处理和模型评估等任务。

第五,对复杂任务采用 Model Synthesis,让多个模型分别承担规划、生成、评审和结果合成。

第六,持续监控每百万 Token 成本、首 Token 延迟(TTFT)、P50/P99 延迟、缓存命中率和模型调用分布,并结合 Router 的实时排名定期调整模型选择与配置。

丁可将这套实践概括为一个原则:不要为不需要的能力付费,要使用合适的模型、部署模式和缓存策略。

推理路由:在约 200 毫秒内完成模型选择

在详细介绍推理路由(Inference Router)时,丁可表示,Router 使用 30B MoE 分类模型分析任务复杂度,并在约 200 毫秒内选择模型。简单任务可以交给 7B 模型,中等任务可以选择 34B 模型,复杂任务则路由至 70B 以上的前沿模型。

除任务复杂度外,Router 还会根据每百万 Token 成本以及 TTFT、P50、P99 延迟对模型进行实时排名。企业可以设置成本、延迟或质量优先级,在达到质量要求的模型中选择更合适的方案。

Router 还可以与 Dedicated Inference 的前缀缓存感知路由结合,在决策时考虑不同实例的缓存状态。应用侧仍然接收统一格式的响应,因此无需因底层模型变化而重构业务逻辑。

降低"推理税":让重复前缀真正命中缓存

完成模型路由后,演讲进入 Agent 工作流中的重复计算问题。丁可将这部分额外支出称为"推理税"。在多轮 Agent 请求中,系统提示词、工具定义和对话历史会反复出现,80% 至 97% 的输入 Token 可能是跨请求重复的前缀;输入 Token 数量通常又是输出 Token 的 3 至 10 倍。

Prefix Caching 的作用,是缓存 Transformer 已经计算完成的 Key/Value 矩阵。后续请求拥有相同前缀时,只需计算新增 Token。Dedicated Inference 可通过 vLLM PagedAttention 为所有模型提供这项能力。

但仅有缓存并不足以保证命中。普通负载均衡可能把后续请求分配到没有对应缓存的实例。DigitalOcean 的缓存感知路由会维护各实例的缓存状态索引:请求到达后先计算前缀哈希,再优先路由至已经缓存该前缀的实例;若没有命中,则分配到空闲实例并预热缓存。

实际案例数据显示,DigitalOcean的缓存感知路由维护每个实例的缓存状态索引,将相同前缀的请求路由到已有缓存的实例,命中率75%+。Serverless的Anthropic/OpenAI模型原生支持Prefix Caching,Dedicated通过vLLM PagedAttention支持所有模型。缓存命中的前缀按降低费率计费,结合75%+命中率,有效输入成本降低40-60%,TTFT降低60-80%。

Model Synthesis:从选择一个模型走向多模型协作

在路由和缓存之后,丁可介绍了Model Synthesis(模型合成)。它不是 MoE 模型内部的专家路由,而是一种跨模型的外部编排方式:将复杂任务拆成多个子任务,交给不同模型处理,再合成为统一结果。

该流程分为四个阶段。Planner 负责分析任务、生成执行计划和任务依赖关系;Generator 并行执行子任务,并将简单与复杂工作分配给相应模型;Critic 负责检查结果、识别错误和不一致,对不合格结果重新生成或升级模型;Synthesizer 最终将所有子任务输出整合成完整答案。

Inference Router 与 Model Synthesis 的作用并不相同。Router 在单次请求中选择一个模型,Synthesis 则让多个模型共同完成一个任务。两者可以结合使用:Synthesis 内部的每个子调用,都可以通过 Router 选择模型。

模型合成的效果:GLM 5.2 与 Kimi K2.6 组合兼顾质量和成本

丁可最后展示了基于 DRACO Benchmark、100 个任务的测试结果。在开源模型组合中,由 GLM 5.2 与 Kimi K2.6 组成的方案取得 65.65% 的质量得分,单任务成本为 0.83 美元,性价比得分为 79.1。

作为对比,Fable 5 单模型的质量得分为 62.21%,单任务成本为 1.59 美元,性价比为 39.1。GLM 5.2 与 Kimi K2.6 的组合在质量上高出 3.44 个百分点,同时成本降低约 48%。GPT-5 单模型的质量得分约为 64%,单任务成本约为 2 美元以上,性价比约为 32。

测试中质量最高的组合是 Fable 5 与 GPT-5.6,得分达到 69.01%。不过,从开源模型的成本与效果平衡来看,GLM 5.2 与 Kimi K2.6 是最佳性价比组合。测试还显示,两模型协作的效果优于三模型组合;在合成器选择上,GLM 5.2 表现最强,DeepSeek V4 Pro 其次,Kimi K2.6 再次。

丁可表示,从 Serverless、Router、Dedicated,到 Prefix Caching 和 Model Synthesis,这套推理实践的目标并非固定使用某一种模型或部署方式,而是根据业务阶段和任务特点进行持续调度与优化。对于全球化 AI 团队而言,真正需要建立的能力,正在从"选择一个模型"转向"以统一平台组织模型、算力、数据与智能体工作流"。

如需进一步了解无服务器推理的性价比与部署详情,可直接咨询DigitalOcean中国区战略合作伙伴卓普云aidroplet.com

相关推荐
Erishen5 小时前
🚀 用 React Three Fiber 造一个会说话的 3D 数字人:从密钥安全到 Serverless 10 秒极限的踩坑全记录
架构·开源·agent
百工蜂Agent5 小时前
Claude Code 整体架构与设计
llm·agent
简单风6 小时前
给 Claude Code 装个仪表盘:钱花多少、上下文剩多少、Git 状态一眼看清
agent
leeyi7 小时前
把软件装进不能上网的机房——一套建好了、还没上过战场的交付工程(第101篇)
docker·aigc·agent
SelectDB8 小时前
为什么 JSON 正在成为分析数据库新的竞争点?
数据库·json·agent
机械改造鹅8 小时前
从零开始拆解Pi系列——(7)Extension API
agent
plainGeekDev9 小时前
Agent代码审查与批量修复流水线
agent·ai编程·claude
桃西西呀9 小时前
上下文窗口都卷到 100 万了,大模型为什么还在为"位置"发愁?
人工智能·llm·ai编程
然我9 小时前
模型不是 Agent:从零实现一个最小 Agent Loop
前端·人工智能·agent