2026年AI API Gateway怎么选?我整理了6种方案的费用、稳定性和适用场景
给项目加一个 AI 接口并不难,难的是上线后还能按预算完成任务:模型版本有没有变化,晚高峰是否限流,输出被截断后该不该重试,图片和视频任务又怎么结算?
我在整理可选方案时,最先发现一个容易混淆的问题:AI API Gateway 虽然都叫"AI 网关",实际交付的可能是模型聚合服务、调用管理平台,也可能是一套需要自己部署的软件。"统一入口"并不意味着模型、参数和收费方式都统一,只看目录里有多少模型,很容易忽略真实使用成本。
这次我把 OpenRouter、Crazyrouter、硅基流动、Vercel AI Gateway、Cloudflare AI Gateway 和 LiteLLM 放在一起,按实际选型时最关心的六个问题整理:能完成什么任务、总共花多少钱、等待多久、失败怎么办、迁移有多难、数据由谁管理。产品说明与费用条件来自文末官方资料,查阅日期为 2026 年 10 月 6 日。由于没有做同一条件下的跨平台付费推理测试,下面不会给出速度或成功率排名。
1. 先分清买到的是什么:模型服务、网关管理,还是自建软件
假设你要开发一个"读取产品资料、回答问题、生成宣传图"的应用。至少涉及文本模型、向量检索或重排序、图片生成三条调用路径。
一种方案是分别申请各家服务,再由项目自己管理 Key、协议与账单。另一种方案是采用托管聚合入口。还有一种方案是在已有模型账户前加一个管理网关。它们的价值和责任并不相同。
| 方案类型 | 代表对象与本文范围 | 用户主要得到什么 | 用户还需要承担什么 |
|---|---|---|---|
| 托管模型聚合 | OpenRouter、Crazyrouter | 模型目录、统一接入与服务方管理 | 核对目标模型、费用、路由和数据政策 |
| 托管推理服务 | 硅基流动的公共 API 服务 | 可直接调用的模型推理与多模态 API | 核对版本、限额、功能和账户条件 |
| 托管网关与开发平台 | Vercel AI Gateway、Cloudflare AI Gateway | 模型接入、观测与调用治理,具体结算路径取决于产品与配置 | 判断是否适配现有技术栈、上游账户及治理需求 |
| 自托管网关 | LiteLLM 的自建 Proxy 方案 | 可自主部署的统一接口与管理层 | 自备上游凭证,负责基础设施、升级与可用性 |
分类只是为了明确交付方式,不代表这些产品只能做表格中的事情。例如,硅基流动还提供私有化方案;LiteLLM 也有不同版本与服务选项。36

图1:方案定位对比。图中"适合"是候选筛选建议,不是产品排名;详细功能与套餐条件以官方资料为准。
2. 我更关心这六个问题,而不是"支持几百个模型"
| 用户真正关心的问题 | 要比较的维度 | 应留下的证据 |
|---|---|---|
| 我需要的任务能做吗? | 目标模型、版本、上下文、输入输出模态、工具与结构化输出 | 模型标识、能力说明、业务样本结果 |
| 最后会扣多少钱? | 输入、输出、缓存、平台费、附加功能与重试费用 | 同一批任务的用量记录与账单 |
| 用户要等多久? | 首个有效内容耗时、完整结束耗时、排队与并发 | 相同模型与负载条件下的时间分布 |
| 出错后能恢复吗? | 限流、超时、重试、备用提供商、备用模型 | 错误分类、请求ID、恢复流程和SLA条款 |
| 现有项目能接吗? | 协议、模型命名、流式事件、SDK与工具调用 | 项目必要功能的迁移验收记录 |
| 数据和权限怎么管? | 日志保留、训练使用、数据流向、子账号、预算与审计 | 政策文件、配置与可导出的管理记录 |
模型目录中的"有"不等于你的账户"能用",更不等于某个功能"能用"。同一个模型,可能存在版本、服务方、上下文限制和功能支持差异。
"官方正品通道"也需要具体证据。可检查运营主体、上游来源说明、版本标识、适用条款,以及必要时合同中的承诺。仅凭模型回答"我是谁",或一道算术题的答案,不能证明调用链来源或授权关系。
3. 六款方案怎么比较:价值与限制放在一起看
OpenRouter:需要反复比较模型和上游提供商时

OpenRouter 官网首页截图,访问日期:2026 年 10 月 6 日。
OpenRouter 的价值在于用统一入口接触多个模型,并结合提供商选择与路由配置开展实验。2026 年 10 月 6 日查阅的 Pricing 页面列出 Standard 方案有 500+ 模型、80+ 提供商;这些是官方目录口径,不是本文逐一测试的可用数量。1
费用应拆开看。页面列出 Standard 平台费为 5.5%,Business 为 8%;BYOK(自带上游 API Key)另有条件。这些规则不能直接换算成"每个模型都比官方贵 10%--30%"。正式预算应核对具体模式、充值与结算规则。1
如果你主要做模型对比、评估不同提供商,值得把它放入候选。但需要确认支付方式、部署区域的访问体验、数据政策与路由条件。Pricing 页面将合同 SLA 列在 Enterprise 方案中,不能默认普通套餐享有同样承诺。1
Crazyrouter:一个项目需要文本、图片、视频和音频时

Crazyrouter 官方介绍文档截图,访问日期:2026 年 10 月 6 日。
Crazyrouter 官方文档介绍了通过一个 Key 接入文本、图片、视频、音频,以及向量与重排序服务的方式,并提供 OpenAI 兼容接口、Anthropic 原生接口等不同接入路径。2
对同时调用多个模态的项目,集中管理入口有助于减少逐家接入工作。但"一把 Key"不代表"一种请求体":普通聊天、图片生成和异步视频任务仍可能使用不同端点、参数与返回结构。
文档区分国际入口与东亚入口,并说明不同协议客户端的 URL 写法。2 这为区域测试提供了候选路径,但不能直接据此得出"国内一定更快"的结论。应从应用实际部署位置测量。
选择前重点核对目标模型当前是否开放、版本标识、计费单位、失败扣费、退款条件,以及工具调用和结构化输出的适用范围。我没有采用"统一便宜30%--50%"这类说法,因为没有同一批任务的账单,就无法支持这种结论。
硅基流动:以国产和开源模型推理为主要需求时

硅基流动官方平台简介截图,访问日期:2026 年 10 月 6 日。
硅基流动的官方资料包含语言、语音、图片、视频和向量场景,并说明兼容 OpenAI、Anthropic 对话协议。3 因此,将它概括成"只做国产文本模型"不完整。
如果项目主要采用国产或开源模型,可以比较其公共 API 服务;若需要专属资源或私有化交付,则应另行评估对应产品,不能把公共 API 价格套到企业方案上。
要确认的是具体模型版本、输出能力、认证要求和速率限制。存在 SLA 相关说明,也不等于所有账户、所有模型都默认具备同一个百分比承诺。正式采购需要核对适用套餐和条款。3
Vercel AI Gateway:已有 AI SDK 或 Next.js 项目时

Vercel AI Gateway 官方文档截图,访问日期:2026 年 10 月 6 日。
Vercel AI Gateway 与其开发工具和调用观测体系衔接较紧密,适合把接入体验、部署流程与费用一起评估,而不是只比较一项 Token 单价。4
官方 Pricing 文档说明 Token 按提供商标价计费,网关不加价,也不收 Token 平台费;但部分自定义报表、团队级治理和 Trace Drains 等能力有额外费用。4 "Token 零加价"不等于"整个应用零附加成本"。
免费层每月5美元额度也有条件:只支持部分模型、限额较低;购买额度转为付费层后,月度免费额度不再适用。BYOK 可在付费层使用,自带凭证失败后的系统凭证回退还可能产生额度消耗。4
已有相关技术栈的团队可以优先验证接入;其他团队则应比较迁移成本、附加功能费用和账户条件,不能只看免费额度。
Cloudflare AI Gateway:已有上游模型,想补齐观测与流量治理时

Cloudflare AI Gateway 官方文档截图,访问日期:2026 年 10 月 6 日。
Cloudflare AI Gateway 官方文档强调分析、日志、缓存、限流,以及重试和模型回退等功能。5 如果问题是"已经能调用模型,但看不清调用和错误",它是值得评估的一类管理入口。
它的价值不应只用"模型目录数量"描述。要确认的是你的上游、认证方式、端点和路由能否接入,以及治理功能是否满足项目。
缓存尤其需要结合业务设计。依赖最新资料、用户身份或动态上下文的请求,不能只因为问题文字相同就复用历史答案。网关功能与上游推理应分别核算,也不能把"增加一层代理"直接换算成所有应用固定增加多少毫秒。
LiteLLM:部署自主性重要,且团队能够维护网关时

LiteLLM AI Gateway 官方文档截图,访问日期:2026 年 10 月 6 日。
LiteLLM Proxy 提供统一接口、用量跟踪以及按虚拟 Key 或用户设置预算的能力,文档还包含部署、路由、限流和日志管理等内容。6
这里比较的是自托管方案。它适合希望控制入口、配置和管理记录的团队,但开源软件并不替你承担高可用部署、版本升级、密钥管理与故障值班。
自托管也不自动意味着数据留在内网。如果网关继续调用外部模型,上游仍会收到请求内容。应分别判断"网关在哪里运行"和"模型在哪里推理",并区分开源与企业功能的版本边界。
4. 费用对比:算一次合格任务,而不是只看一次请求
文本通常按 Token 计费,图片可能按张数、尺寸或质量计费,视频可能与时长、分辨率及任务模式有关。把它们硬放进同一个"每百万 Token"表中,会失去可比性。

图2:成本口径示意,不是厂商报价或实测折扣。失败尝试、附加功能和维护投入都可能改变实际成本。
先建立一张针对自己工作负载的账单表:
| 成本项 | 同口径比较时要确认什么 |
|---|---|
| 输入与输出 | 同模型版本、相近输入长度与输出要求,分别核算 |
| 缓存 | 区分网关响应缓存与模型提示词缓存,核对命中条件及收费 |
| 图片或视频 | 固定尺寸、质量、时长、分辨率及任务模式 |
| 重试与回退 | 统计所有尝试,不能只保存最后成功的一次 |
| 平台与附加能力 | 确认充值或平台费、日志、报表、治理、存储和支付费用 |
| 自建与迁移 | 服务器、维护工时、升级、接入测试与回滚准备 |
一个有用的计算口径是:
text
每个合格任务成本 =
(模型与多模态费用 + 平台及附加费用 + 所有重试费用 + 分摊维护费用)
÷ 通过业务验收的任务数
例如,某方案在100次业务任务中产生100元总费用,有90次通过验收,那么每个合格任务约为1.11元。另一方案产生110元费用,有99次通过验收,同口径下也约为1.11元。这是假设演算;它说明更低的请求单价未必带来更低的业务成本。
充值赠送额度可以降低试用成本,但必须记录有效期、模型限制和使用条件。长期预算应另算优惠结束后的支出。
5. 速度与稳定性:用同一任务测,保留失败样本
对流式聊天,用户关心的是多久看到第一段有效内容、多久得到完整结果;对图片和视频,用户更关心任务多久完成,以及排队、轮询和下载是否顺利。
至少区分三个指标:
| 指标 | 适合什么场景 | 常见误判 |
|---|---|---|
| 首个有效内容耗时 | 流式聊天 | 把心跳、角色字段或空事件当成首字 |
| 完整任务耗时 | 文本、图片、视频 | 只算提交成功,不算等待和取回结果 |
| 业务任务通过率 | 所有生产任务 | 只看HTTP 200,忽略截断、格式错误或答案不合格 |
测试时固定模型与版本、任务输入、部署位置、并发、输出要求和缓存条件。轮换测试不同候选,尽量覆盖同一时间段;样本充足时,再观察中位数和 P95(约95%的请求耗时不超过该值)。展示耗时的同时披露超时与失败比例,不能删掉失败请求后只给出漂亮的均值。
稳定性还要拆成三件事:重试同一个请求,换同模型的上游提供商,换一个备用模型。前两者也可能改变计费或服务行为,最后一种则明确改变了能力条件,需要重新验收。产品支持回退机制,不等于已经证明长期故障率更低。
6. 图片和视频怎么比:覆盖、接口与结果要分开
如果"配图"也是应用功能,就需要在多模态维度继续比较。这里整理的是能力核对方法,不包含跨平台的生成效果样本。
| 用户需求 | 比较任务 | 验收重点 |
|---|---|---|
| 文生图 | 同模型版本、提示词、尺寸与生成参数 | 内容要求、尺寸、耗时、计费与失败情况 |
| 参考图编辑 | 同参考图、修改要求和支持的参数 | 主体与局部修改是否符合要求 |
| 图片理解 | 同图片、问题和输出格式 | 细节识别、字段完整性与答案正确性 |
| 视频生成 | 同输入、时长、分辨率及模式 | 创建、轮询、取回结果、有效期和费用 |
| 商用素材生产 | 核对模型与平台适用条款 | 使用授权、输入素材权利和数据政策 |
图片理解与图片生成是两种能力。能把图片放进聊天请求,不足以证明能够生成或编辑图片。官方目录中出现图片或视频,也不足以证明每个模型都支持相同格式。
比较效果时应先明确问题:若比较网关转发与兼容性,尽量固定同一个模型;若比较不同模型产出,就应标成"模型效果比较",不能把结果差异全部归因于网关。出图具有随机性,单张样本也不适合支撑普遍质量排名。
7. 迁移验收:改入口之前,列出项目依赖的行为
已有项目从 OpenRouter 或其他入口迁移时,修改初始化配置只是开始。应该先列出必须保留的能力:
| 项目依赖 | 迁移验收条件 |
|---|---|
| 普通问答 | 返回结构正确,正常结束,结果符合任务 |
| 流式输出 | 内容能完整拼接,断流和错误能被识别 |
| 工具调用 | 参数、调用标识与工具结果回传能完成受控循环 |
| 结构化输出 | JSON可解析,必填字段和类型正确 |
| 图片与视频 | 输入方式、任务状态、结果取回与计费可对齐 |
| 用量统计 | 输入、输出、缓存等字段含义明确,缺失值不填0 |
| 错误处理 | 区分认证失败、限流、超时,并限制重试次数 |
下面的 JavaScript 片段只演示普通文本问答的分层判断,不发起网络调用,也不能替代流式、工具或多模态验收:
javascript
function judgeText(status, raw, acceptAnswer) {
if (status < 200 || status >= 300) return 'http_' + status;
let data;
try { data = JSON.parse(raw); }
catch { return 'invalid_json'; }
const choice = data?.choices?.[0];
if (typeof choice?.message?.content !== 'string') {
return 'schema_mismatch';
}
if (choice.finish_reason !== 'stop') return 'incomplete';
return acceptAnswer(choice.message.content.trim())
? 'pass' : 'answer_mismatch';
}
// 构造的本地输入;不是任何厂商的实测响应。
console.log(judgeText(
200,
JSON.stringify({
choices: [{ message: { content: '4' }, finish_reason: 'stop' }]
}),
answer => answer === '4'
)); // pass
这里的 stop 仅适用于本例普通文本任务。工具调用等待工具执行时,会采用不同的结束状态,不能照搬。模型来源、授权与版本也不能靠这段判断证明。
上线时集中配置入口与模型映射,先切换少量可撤销任务,保留原入口的回滚条件。涉及创建订单、修改工单或发送消息的流程,还需要业务幂等控制:超时不一定代表操作没有完成,不能无条件重放整条链路。
8. 如果让我先缩小候选,我会这样分
如果主要比较文本模型和上游提供商,我会先评估 OpenRouter;如果一个应用同时涉及文本、图片、视频、音频,我会把 Crazyrouter 与其他具备目标能力的方案一起验证;国产与开源模型为主的项目,则可以先比较硅基流动的具体服务。
已有 AI SDK 或 Next.js 工程时,我会评估 Vercel AI Gateway 的接入和完整费用;已经使用 Cloudflare 服务,或者想补齐流量观测,可以验证 Cloudflare AI Gateway;需要自主部署入口且团队能承担运维,再考虑 LiteLLM。
这些只是缩小范围的起点。真正决定前,我会给每个候选留下一份简短记录:必要功能是否通过、合格任务成本是多少、限流和回退如何处理、数据发往哪里、什么情况下回滚。这样得到的结果,才和自己的用户体验、预算及维护能力有关。
资料来源
- OpenRouter Pricing:模型与提供商目录、平台费、BYOK、套餐与合同SLA条件。
- Crazyrouter 官方文档:多模态接入范围、区域入口与协议路径说明。
- 硅基流动平台简介:API模态、对话协议与产品矩阵。
- Vercel AI Gateway Pricing:Token计费、免费额度、BYOK与附加能力费用。
- Cloudflare AI Gateway Overview:分析、日志、缓存、限流、重试与回退。
- LiteLLM Proxy 文档:统一接口、部署、预算与管理能力。
以上内容是我根据公开资料做的选型整理,不是跨平台推理效果、速度或稳定性实测。产品功能和费用可能变化,最终仍需结合自己的账户条件、业务样本和账单验证。