MAI Gateway(魔芋企业AI网关)支持本地模型。网关可以统一处理接口、鉴权、配额、安全和日志。模型权重加载、推理进程和显存调度仍由模型服务负责。
大模型网关负责管理调用,本地推理平台负责运行模型。两者配合使用,职责才清楚。
本地模型与云模型有什么差别
| 对比项 | 云模型API | 本地模型 |
|---|---|---|
| 服务地址 | 由外部供应商提供 | 由企业内部推理服务提供 |
| 密钥 | 使用供应商密钥 | 使用内部鉴权或网关Token |
| 数据流向 | 请求发送到外部服务 | 请求可留在企业网络内 |
| 资源容量 | 受供应商限额影响 | 受GPU、显存和并发能力影响 |
| 费用口径 | 按供应商Token价格结算 | 计算硬件、运维和资源占用 |
| 运维责任 | 供应商负责模型服务 | 企业负责版本、引擎和资源状态 |
云模型和本地模型的调用方式不同,业务系统需要的字段却很接近,包括模型名、消息、参数、响应和用量。MAI Gateway在两者之间提供统一入口,应用只使用网关地址、企业Token和模型别名。
本地模型怎样接入网关
网关是私有化部署的,管理员可以在MAI Gateway中配置模型、供应商、服务地址、类型、计费方式和启用状态,再通过模型别名提供给业务系统。
一次调用会经过企业Token鉴权、额度检查、输入防护、模型路由、输出过滤和日志记录。若本地接口采用OpenAI兼容格式,应用迁移通常更简单。接口字段不同,则需要完成参数与响应适配。
MAI Gateway能管哪些核心功能
统一接口负责隐藏不同模型的地址和密钥。模型管理负责维护厂商、供应商、价格和状态。连接监控记录健康情况、近期延迟和平均成功率。
权限管理把Token绑定到用户、项目和权限范围。配额可以按日、月和总量设置,还能配置预警阈值。
成本中心按部门和项目统计Token消耗、费用趋势、余额、预测与排行。
安全部分包括IP规则、输入防护、输出过滤和数据脱敏。API日志可以按Trace ID、Token、用户、模型和状态检索。告警支持指标、阈值、评估窗口、静默期、邮件和钉钉通知。
MAI Gateway资料还列出GPU设备、显存、利用率、温度和趋势监控。
这些指标能帮助定位资源异常,无法替代模型发布、自动扩容和质量评测。
支持本地模型不等于零成本
本地部署减少了外部API费用,却增加了GPU、机房、推理引擎和运维支出。网关可以记录调用量并按内部价格核算项目成本,但成本高低仍由模型规模、量化方式、并发率和设备利用率决定。
MAI Gateway不负责训练模型,也不负责启动推理服务。它把已经运行的模型接入企业管理体系,让接口、权限、费用、安全和审计有统一记录。