技术栈
模型路由
Summer-Bright
7 天前
人工智能
·
安全
·
ai网关
·
模型路由
Stripe 75亿美元收下OpenRouter、Nvidia让harness打败模型 —— AI软件简报 08.19-08.23
每期覆盖 3-4 天的 AI 软件动态。个人视角,不追求面面俱到。周三、日更新。8月19到23日这几天,AI 软件圈最意外的不是又发了哪个新模型,而是一个支付公司花了75亿美元,买下了一个"模型中转站"。同一天,另一个金融科技公司也上线了自己的模型路由器。两周之内,谁掌握 AI 调用入口,成了支付巨头眼中最值钱的东西。这周还有一件事颠覆了我原来的判断:决定 AI 强弱的,可能已经不是模型本身,而是套在模型外面那层壳。
ZGi.ai
8 天前
aiagent
·
模型路由
·
多模型接入
·
zgi
·
模型网关
ZGI 模型网关:统一接入与路由大模型
企业接入多个大模型后,可以通过模型网关统一管理供应商、访问凭据、默认模型和路由策略。Agent 与 Workflow 调用一个稳定入口,具体使用哪个模型由配置决定。模型发生切换时,还要检查输出结构、工具调用、延迟和失败处理,避免业务流程跟着接口变化反复修改。
ZGi.ai
16 天前
网络
·
人工智能
·
大模型评测
·
多模型
·
模型路由
·
zgi
·
模型网关
多模型回答不稳定:路由规则与评测方法
多模型接入解决了可选模型不足的问题,也带来了回答质量、响应速度和调用成本的波动。稳定路由需要一组真实任务样本,把质量、延迟、失败和成本分开记录,再按任务类型制定规则。仅凭模型榜单或一次体验,很难支撑线上选择。
thesky123456
18 天前
缓存
·
llmops
·
智能体
·
模型路由
·
成本工程
·
预算控制
·
小模型分工
智能体面试准备(二十六):Agent 成本工程——模型路由、缓存、预算控制与大小模型分工
上一篇《多模态 Agent》让 Agent 看得懂图、听得见话,但随之而来一个很现实的问题:每张图几百 token、每段视频上万 token、每轮对话都调一次大模型,账单会爆炸。这是 B 系列第二十六篇,也是本系列收官前的最后一块拼图。成本工程(Cost Engineering)是 2025 年之后 Agent 落地最被甲方在意的主题——模型能力再强,跑一个月烧掉一家公司也白搭。它和 B20 可观测性(成本归因)、A25 推理服务化(单位 token 成本)、B13 记忆(避免重复计算)都强相关。本文按"
__土块__
3 个月前
系统稳定性
·
健康检查
·
rag系统
·
ai工程
·
模型路由
·
静默故障
·
降级策略
多模型路由上线后静默降级故障复盘:从健康检查失效到动态权重补偿
2026年4月,我们上线了一套多模型路由系统,用于在RAG问答链路中根据查询复杂度、成本预算和SLA要求动态选择底层模型(如通义千问、DeepSeek、GLM等)。初期灰度阶段表现稳定,但在全量发布后第3天,监控大盘出现异常:
梦想画家
4 个月前
模型路由
多LLM智能路由调度:让大模型应用兼顾成本、速度与效果的核心方案
在大模型商业化落地过程中,单一LLM(大语言模型)始终难以适配复杂多样的业务需求:高端模型推理能力出众,但调用成本高、响应速度慢;轻量化模型响应迅速、成本低廉,却在复杂任务中表现不佳。多LLM智能路由调度能力,可自动将用户请求精准匹配至最优模型,全程对用户无感,同时支持调试、异常兜底与灵活配置,彻底解决大模型应用中成本失控、效果不稳定、响应不及时的核心痛点,是企业级AI应用规模化落地的必备核心能力。
码农垦荒笔记
5 个月前
agent成本优化
·
模型路由
·
token优化
2026 Agent Token 成本优化实战:Prompt Caching + 模型路由组合降本 80%
据 InformationWeek 2026 年 3 月报道,企业级 AI Agent 的持续运营成本已达 $3,200–$13,000/月,其中 Token 消耗占比高达 60%–80%。随着 Agent 从 demo 走向生产,Token 成本正在成为制约规模化部署的最大障碍。
我是有底线的