网关的功能介绍通常长这样:"多模型路由、Token计量、预算管控、安全防护、全链路审计......"------一堆名词,读完记不住,因为不知道这些功能什么时候起作用。
换一个组织方式:按时间线看。一家企业的AI流量每天在经历五种时刻------管理员配置时、平时持续运行时、出事时、月底结算时、业务扩张时。每个时刻,网关都在做具体的事。这篇文章就把MAI Gateway的核心功能按这五个时刻拆开,每件事讲清楚触发条件、执行动作、产出结果。
看完你会得到一张"网关工作时刻表"------什么时刻网关替你做了什么,一目了然。
时刻一:配置时------管理员能做的事
这是治理的起点。管理员在管理端完成四类配置,决定了后续所有时刻的规则。
1. 配置模型目录
做什么: 录入全企业可用的模型清单------公共大模型API(OpenAI、Anthropic、Google、通义千问、DeepSeek、智谱GLM、MiniMax、Kimi等)、私有模型、云端算力、本地GPU推理服务。每条记录含协议、密钥、单价、启停状态。
关键细节: 可见范围按组织、项目、角色设置------限制某个部门只能用指定模型,从目录层就拦住,不靠自觉。
产出: 路由的"菜单"。此后应用调用什么模型、按什么价格计量,全部引用这份目录。
2. 配置令牌
做什么: 为每个应用、每个Agent、每个内部工具创建独立令牌,设定有效期(建议不超过90天)、模型范围、RPM/TPM频率上限、IP黑白名单,并绑定责任人。
关键细节: 绑定责任人必须绑"人"而不是"系统账号"------出事时审计要找的是能负责的人。
产出: 调用的"门禁卡"。此后每次请求的身份、权限、边界全部由令牌定义。
3. 配置预算
做什么: 设四级预算------组织→部门→项目→令牌,控制指标覆盖金额、Token数量、RPM、TPM、并发数;设三级阈值(80%提醒→95%紧急告警→100%熔断);设熔断动作(限速/阻断/临时扩容/模型降级);设告警通知对象(写具体责任人,不写泛化群组)。
产出: 消耗的"天花板"。此后超支在发生前就被拦截,而不是月底看账单。
4. 配置路由与安全策略
做什么: 路由侧设权重/主备/成本/自定义策略及延迟阈值、报错下线阈值;安全侧设PII检测规则、注入检测、脱敏策略、敏感任务的路由映射(指向本地GPU推理)。
产出: 流量的"分诊规则"和数据出网的"安检标准"。
时刻二:平时------网关持续自动做的事
配置完成后,每次调用经过链路:鉴权 → 预算校验 → 安全检测 → 路由决策 → 上游调用 → 计量留痕。这条链路每天自动执行,企业感知不到它的存在------直到出事才知道它多值钱。
1. 每次调用:鉴权+校验
触发: 应用带令牌发起请求。动作: 校验凭证有效性、模型范围、频率限制、IP名单,四级预算毫秒级核额。产出: 合法调用放行,越界调用当场拒绝。
2. 每次出网:内容安检
触发: 请求即将发往外部模型。动作: Prompt过提示词注入检测和PII识别------手机号、身份证号、银行卡号识别后三档处置(脱敏放行/阻断/转本地模型)。产出: 出网内容合规,敏感数据不出域。
3. 每次调度:智能路由
触发: 请求通过安检进入调度。动作: 按策略选择链路------权重路由分摊多供应商流量;成本路由把简单任务送去低价模型;主备路由保持热备。产出: 单位任务成本更低,供应商依赖更弱。
4. 每次响应:计量留痕
触发: 上游返回结果。动作: 记录输入/输出Token、模型单价、费用、Trace ID、耗时、响应状态、路由链路。产出: 六维费用归集(供应商/模型/部门/项目/用户/令牌)和可追溯的完整审计链。
5. 持续巡检:链路健康监测
触发: 实时。动作: 监测各链路延迟与错误率;GPU纳管模块同步监控GPU节点在线状态、利用率、显存、温度、归属。产出: 链路健康度数据,为自动摘除和容量规划提供依据。
时刻三:出事时------网关自动做的事
这是网关真正的"考试时刻"。四类典型事件,网关的响应全部自动:
事件1:上游供应商故障
检测: 链路延迟超阈值或连续报错(建议阈值3-5次)。动作: 故障链路自动临时下线,流量秒级切到备用链路;恢复后自动重新加入。产出: 业务无感知------客服对话不中断、Agent任务不失败。
事件2:令牌泄露/被盗刷
检测: 异常调用模式(异常IP、异常时段、异常频率)在审计面板被标记并告警。动作: 管理端撤销企业令牌即时生效;供应商原始Key在网关侧禁用换新------止血动作从"打电话给供应商"变成"点一个按钮"。 产出: 损失窗口从"数天"压缩到"分钟"。反面对照:某3人初创团队密钥泄露,48小时被刷8.2万美元,项目破产。
事件3:预算击穿(Agent循环失控等)
检测: 消耗到达80%/95%/100%阈值。动作: 逐级响应------提醒责任人→紧急告警→熔断(限速/阻断/降级,Agent场景选"阻断",任务可重跑、钱不能重付)。产出: 最坏情况锁定在预算额度内。反面对照:Meta员工30天刷掉60.2万亿Token、折算成本超1亿美元------就是没有这道闸门的结果。
事件4:敏感数据即将出网
检测: Prompt中命中PII规则。动作: 自动脱敏放行、阻断或转本地模型。产出: 合规事故在技术层被拦截,不依赖员工自觉。
时刻四:月底------结算时能做的事
平时积累的计量数据,在结算时刻变成管理产出:
1. 自动分摊报表。 费用按部门/项目/用户/令牌/模型/供应商六个维度自动归集,月末直接出分摊报表------财务不再对着一堆供应商总账单发呆。Gartner数据显示企业AI成本平均超支175%,而超支说不清来源的第一原因就是没有归集维度。
2. 账单核对。 计量口径与供应商账单逐条核对,差异即异常------多扣的、错算的、被盗刷的,都从核对中浮出水面。
3. 异常识别与费用归因。 环比突增自动标记(例如某部门环比+400%),下钻到令牌看单次调用的Token消耗------上下文越滚越长的Agent、失控重试的脚本,十分钟定位。
4. 预算复盘。 各级预算执行率、熔断记录、告警记录汇总,为下月预算基线提供数据。
时刻五:扩张时------增长过程中能做的事
1. 加应用: 新应用接入=创建新令牌+配预算,OpenAI兼容接口替换Base URL和API Key即可,业务代码零改动。接入成本趋近于零。
2. 加模型: 供应商上新模型,目录加一条记录、路由策略调一下权重------全企业立即可用,所有应用无需改动。
3. 加容量: 集群无状态设计,按表扩容------2副本约450并发、4副本约1500、8副本约3000、16-20副本约7500。单机基准:安全并发约450在途请求、吞吐848 req/s、网关侧p99<30ms、5轮压测0%错误率。架构不推倒重来。
4. 加GPU: S系列一体机扩展本地算力,GPU纳管面板统一监控;敏感任务路由本地、MaaS自营的能力随算力解锁。
5. 加组织: 多子公司、多集群场景,旗舰版统一治理框架下扩展,定制BI承载集团级成本视图。
五个时刻串起来:一张时刻表
| 时刻 | 谁在动作 | 网关做的事 | 关键产出 |
|---|---|---|---|
| 配置时 | 管理员 | 建目录、发令牌、设预算、定策略 | 治理规则上线 |
| 平时 | 网关自动 | 鉴权、安检、路由、计量、巡检 | 每次调用有序、可追溯 |
| 出事时 | 网关自动 | 故障切换、令牌止血、预算熔断、敏感拦截 | 损失被锁死在最小窗口 |
| 月底 | 财务/管理员 | 分摊、核对、归因、复盘 | AI成本成为可管理科目 |
| 扩张时 | 架构师 | 加应用/模型/容量/GPU/组织 | 规模化不推倒重来 |
这张表回答了一个被普遍误解的问题:AI网关不是"接入工具",而是"运行制度"。 接入只发生在配置时的几个小时;网关真正的价值在平时、出事时、月底、扩张时------每一个不需要人盯着的时刻。
传统API网关的工作时刻表只有两行:配置时、平时。AI网关把出事时、月底、扩张时三行补齐------补的这三行,正是企业AI从"能用"走到"可治理"的距离。
结语
API网关能做什么?配置时管准入,平时管转发。
MAI Gateway能做什么?配置时建规则,平时自动执行,出事时自动止血,月底自动算账,扩张时按表生长。
功能名词会迭代,但这张工作时刻表不会过时------判断任何AI网关产品的成色,就看出事时它替你做了多少事。 出事时还需要人肉打电话、翻日志、猜原因的,是转发器;出事时自动检测、自动切换、自动拦截、自动告警的,才是治理网关。
Token as a Managed Asset------让每一次模型调用,都进入企业的财务、权责与审计闭环。
魔芋AI · MOYU AI · MAI Gateway · 企业级大模型治理网关
统一治理 AI 调用,构筑可预算、可归集、可审计、稳运行的企业大模型底座