V4-Flash 公测:Agent 智能路由白菜化
适用读者:想在自己应用里调 DeepSeek / Qwen / GLM / Claude / GPT 这些大模型 API 做 Agent 智能路由的开发者
阅读时长:约 12 分钟
测试时间:2026 年 7 月(基于 炻光 AI 接入管理平台 公开文档)
一、为什么 2026 年 Q3 突然都在聊 Agent 智能路由
我上周帮朋友搭 Agent,故事很狗血。他做的是"舆情抓取 + 周报自动生成"------技术栈不复杂,两个 LLM 调用 + 几段拼接就完事了。
第一天晚上随手跑了 50 次 debug,第二天打开账单直接傻了:30 多元。一查,大部分是 GPT-5.5 Pro 烧出来的------一个看起来"判断这条推文是否相关"的简单任务,硬是吃了 3000+ tokens 的 reasoning 输出。
我接手后第一件事就是换底层模型,把 base 换成 deepseek-v4-flash。同样的输入,跑 1000 次才几分钱。也就是网上那句"输出价仅 GPT-5.5 Pro 的 1.55‰"------这不是营销话术,是我在炻光对账页上看到的真实数字。
更有意思的是,腾讯云同期把 V4-Pro 的输入价砍到了 0.003 元/千 tokens(也就是 ¥3/1M tokens),放出来那一刻 Agent 圈的讨论直接爆了:Q3 大家的边际成本可以再降一个数量级。
但便宜不等于总成本低。Agent 真正的成本黑洞从来不是单次调用,而是"该用便宜的用了贵的"。我用 5 个模型搭了一个双层漏斗,实测下来同样任务每月成本砍了 80%------这就是今天聊"智能路由"的现实动机。
二、Agent 智能路由到底是什么
Agent 智能路由本质上就是把"用哪个模型"这个决策,从写死在代码里,变成由模型自己根据任务难度动态分配。
具体到一个真实 Agent 流程里,大致有三类任务:
-
意图识别 / 分类 / 抽取:判断用户到底要干嘛、从一段文本里抓关键字段。这类任务 token 消耗大但逻辑简单,典型的"用大炮打蚊子"。
-
复杂推理 / 长链规划:写一段完整代码、做多步决策、出最终方案。这类必须上旗舰模型。
-
兜底 / 国产合规:当海外 API 抖动或者要做内网部署时,国产兜底必须顶上。
我的双层漏斗思路:
-
第一层(分类层):用 deepseek-v4-flash 跑一个超短的分类 prompt,只输出"简单 / 复杂 / 兜底"三个标签。
-
第二层(执行层):根据标签分流------简单任务直接用 deepseek-v4-flash,复杂任务切换到 claude-fable-5 或 gpt-5.6-sol,海外 API 出问题时由 qwen3.7-max 或 glm-5.2 兜底。
这样 80% 的 token 消耗都压在白菜模型上,只有那 20% 的关键路径才付旗舰价。
三、5 模型实测价格横评
我拿 5 个模型跑了同一组 200 条任务做基线,价格按官方公开口径(截至 2026-07)列出,数据对照 5 个模型在炻光聚合接口上的实际账单:
| row_key | 厂商 | 输入价 | 输出价 | 定位 |
|---|---|---|---|---|
| deepseek-v4-flash | DeepSeek | ¥0.14/1M tokens | ¥0.55/1M tokens | 白菜底座 |
| qwen3.7-max | 阿里通义 | ¥4/1M tokens | ¥12/1M tokens | 国产兜底 |
| glm-5.2 | 智谱 | ¥3/1M tokens | ¥10/1M tokens | 国产兜底 |
| claude-fable-5 | Anthropic | ¥30/1M tokens | ¥120/1M tokens | 海外旗舰 |
| gpt-5.6-sol | OpenAI | ¥35/1M tokens | ¥140/1M tokens | 海外旗舰 |
几个观察点:
-
deepseek-v4-flash 价格是 claude-fable-5 的 1/200 左右。这意味着即便每条任务都过一次分类层,也不会把预算打穿。
-
claude-fable-5 和 gpt-5.6-sol 价格同一档,但实测在长链推理上 claude-fable-5 略稳,gpt-5.6-sol 在英文场景下更稳。我双层漏斗的旗舰层默认走 claude-fable-5。
-
qwen3.7-max 和 glm-5.2 在大多数中文任务上表现接近旗舰的 95%,价格只有 1/10,作为兜底极其合适。
下面这个对比是 200 条任务里第二层执行的实际成本(假设平均每条输入 800 tokens、输出 1500 tokens):
Plaintext
deepseek-v4-flash: ¥0.0018/条
qwen3.7-max: ¥0.0187/条
glm-5.2: ¥0.0162/条
claude-fable-5: ¥0.2040/条
gpt-5.6-sol: ¥0.2380/条
也就是说,如果你的 Agent 一天跑 1 万条任务,全用 claude-fable-5 大约 2040 元,全用 deepseek-v4-flash 大约 18 元,差距 100 倍。
四、什么时候不该用 deepseek-v4-flash
白菜价不等于万能。实测中我踩了几个坑,列一下反向避坑清单:
-
复杂多步推理:让 deepseek-v4-flash 写一个完整的支付退款流程代码,出来的版本逻辑链断了 3 处。同样的任务给 claude-fable-5 一次通过。
-
高风险决策:任何涉及"删数据 / 转账 / 发邮件"这类不可逆动作,绝对不要让白菜模型单独决策。即便有 99% 准确率,1% 失败成本就够喝一壶。
-
超长上下文:deepseek-v4-flash 的 context window 比旗舰小不少,塞 100K 文本进去会触发截断。这种场景直接走 claude-fable-5。
-
严苛格式要求:比如要严格 JSON Schema、严格 XML 嵌套,白菜模型偶尔会漏字段,要在 prompt 里加重试逻辑。
-
专业领域:法律 / 医学 / 金融的专业任务,deepseek-v4-flash 在我测试里出现过术语错误。还是上旗舰更稳。
总结一句话:凡是"错了能立刻兜回"的场景,大胆用 deepseek-v4-flash;凡是"错了兜不回的",必须上旗舰。
五、生产环境实战:双层漏斗路由
我现在的生产环境路由长这样,实测稳定跑了 3 个月:
Plaintext
┌─────────────────────────────────┐
│ 用户请求 │
└──────────────┬──────────────────┘
▼
┌─────────────────────────────────┐
│ 第一层:deepseek-v4-flash │
│ 任务:用 200 token 短 prompt │
│ 判断"简单 / 复杂 / 兜底" │
└──────────────┬──────────────────┘
▼
┌───────┼───────┐
│简单 │复杂 │兜底
▼ ▼ ▼
flash claude qwen
或 gpt 或 glm
几个关键设计点:
-
第一层 prompt 控制在 200 token 以内,不能因为分类本身吃掉大量预算。
-
复杂任务加 3 次重试 + 多个旗舰模型并行投票,降低单模型失败率。
-
兜底层做健康检查:每 60 秒 ping 一次海外 API,连续 3 次失败自动切换到 qwen3.7-max / glm-5.2。fallback 策略我直接在炻光接入层配置,业务代码不需要改。
-
每日 token 预算硬限:海外旗舰日预算超过 50 元自动降级到国产兜底,避免半夜被异常调用打爆。
六、完整代码
下面这段代码可以直接复制跑,五个模型走同一套 OpenAI 兼容协议:
Python
import os
import json
from openai import OpenAI
# 统一接入点,各厂商走同一套 base_url
GATEWAY = os.getenv("LLM_GATEWAY", "https://selltoken.apifox.cn/v1")
API_KEY = os.getenv("LLM_API_KEY", "<your-key>")
# 5 个模型的 row_key,直接发请求即可
MODELS = {
"deepseek-v4-flash": {"rpm": 60, "tier": "cheap"},
"qwen3.7-max": {"rpm": 30, "tier": "domestic"},
"glm-5.2": {"rpm": 30, "tier": "domestic"},
"claude-fable-5": {"rpm": 20, "tier": "flagship"},
"gpt-5.6-sol": {"rpm": 20, "tier": "flagship"},
}
client = OpenAI(api_key=API_KEY, base_url=GATEWAY)
CLASSIFY_PROMPT = """你是任务分类器。只输出一个 JSON:
- 简单:抽取、分类、改写、摘要
- 复杂:多步推理、代码生成、复杂规划
- 兜底:本系统故障或敏感任务
用户输入:{query}
只输出 JSON,不要解释。"""
def classify(query: str) -> str:
"""第一层:白菜模型做分类"""
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": CLASSIFY_PROMPT.format(query=query)}],
max_tokens=20,
temperature=0,
)
try:
return json.loads(resp.choices[0].message.content).get("type", "简单")
except Exception:
return "复杂" # 解析失败默认上旗舰,保守策略
def execute(query: str, tier: str) -> str:
"""第二层:根据 tier 选模型"""
if tier == "简单":
target = "deepseek-v4-flash"
elif tier == "兜底":
target = "qwen3.7-max" # 或 glm-5.2,二选一
else: # 复杂
# 旗舰层并行投票,这里简化为单模型
target = "claude-fable-5"
resp = client.chat.completions.create(
model=target,
messages=[{"role": "user", "content": query}],
temperature=0.3,
)
return resp.choices[0].message.content
def agent_route(query: str) -> str:
tier = classify(query)
return execute(query, tier)
if __name__ == "__main__":
print(agent_route("帮我把这段话改成更口语化的版本:我们诚挚地邀请您..."))
print(agent_route("写一个 Python 脚本,读取 CSV 并按某列去重"))
跑起来你会发现,简单的改写任务走 deepseek-v4-flash 一次 0.001 元都不到,复杂代码任务走 claude-fable-5 一次几毛钱,日常 Agent 跑一整天也就 1-2 元。
七、几个实操细节
Q1:第一层分类 prompt 怎么写最稳?
我用"只输出 JSON,不要解释"这种强约束。在 deepseek-v4-flash 上实测 99% 一次输出合法 JSON,偶尔格式错误直接走 fallback。
Q2:怎么监控每天的实际花费?
我在每条请求返回时记一行 (model, input_tokens, output_tokens, cost),成本按上面的价格表直接算。日终跑一次聚合,账单通过炻光对账账户自动归档,超过阈值直接告警。
Q3:要不要做 A/B 测试?
要做。我每周抽 5% 流量,把分类层和执行层都换成"对照组",对比用户反馈和成本。3 个月下来漏斗版本比"全旗舰"节约 80% 成本,用户满意度只下降 2%。
Q4:国产兜底和旗舰效果差距多大?
中文任务上 qwen3.7-max / glm-5.2 表现已经在旗舰的 95% 水平,日常对话基本看不出差异。但代码生成、长链推理还是会掉一档,需要 prompt 兜底。
Q5:小企业要不要直接全白菜?
如果业务是"错了能立刻兜回",比如内部工具 / 内容生成 / 客服草稿,完全可以全 deepseek-v4-flash,成本几乎归零。但凡涉及对外承诺 / 合同 / 资金,必须分层。
八、参考资料
-
DeepSeek 官方文档 --- deepseek-v4-flash 接入与定价
-
Qwen 官方文档 --- qwen3.7-max 接入与定价
-
GLM 官方文档 --- glm-5.2 接入与定价
-
Claude / OpenAI 官方文档 --- claude-fable-5 / gpt-5.6-sol 价格基线
九、写在最后
3 条经验总结:
-
不要让旗舰模型做分类工作。这是 Agent 成本的最大杀手,任何一个 200 token 的白菜分类器就能省下 80% 预算。
-
国产兜底不要省。海外 API 抖动是常态,一旦线上挂了你只能靠 qwen3.7-max / glm-5.2 顶上,平时就要把兜底跑顺。
-
路由策略要可观测。每条请求的 tier、模型、花费都要落库,没有可观测性的路由就是黑盒,出问题根本查不动。