大家好,我是老刘
暑假过完,神兽们开学。
老刘盘点了一下手头的家当:或买或赠攒了不少订阅,还有一堆测试过的免费大模型provider。眼看着好几个快到期,就这么放着吃灰属实心疼。

本着为了一盘醋也要吃顿饺子的原则,老刘决定集中把这些订阅榨干。
方法说起来很简单:把不同供应商的同款模型,用Cloudflare AI Gateway的动态路由,绑成一个虚拟模型。

绑完之后就突击用,往死里用。
听着像折腾?但是实际上老刘打算后续都这样使用了。
单个用到底有多难受
免费模型429是家常便饭
免费模型最大的问题,是你根本没法连续干活。
大多数免费provider标的rpm看着挺美,实际用起来完全是另一回事。基本上一两轮对话就开始频繁429,运气好点能撑到第三轮,然后就得中断工作切换下一个模型。
把本来完全自动化的流程变成了时不时需要人工干预。
低档位订阅一轮长对话烧光5小时额度
付费的低档位token plan也没好到哪去。
额度按5小时窗口算,一轮长对话下来基本就把这个窗口耗光了。这个坑老刘之前专门写过一篇:
Qwen 3.8 max干了20分钟没干完,免费模型3分17秒搞定,问题出在哪?
这里还有个搞笑的插曲。老刘当时把5小时额度用光之后,官方很快就修复了这个bug。
解决方案很简单:取消5小时限制,只保留周限额。

额度没变,问题不见了。程序员的智慧。
单个平台到底啥水平
说实话,大部分免费模型其实不具备在实际开发中使用的能力。
核心就是前面说的,完全达不到官方宣称的rpm。
拿老刘最近常用的glm-5.3 flash举例。我在三个平台上都有在用z.ai、b.ai和Vercel。单拎出来任何一个,基本都没办法坚持完成一个独立功能点的开发,写到一半必被限流。

每个平台单看,都像那种试用期员工,简历漂亮,干活第一天就请假。
绑在一起之后就变成老员工了
把三个平台的glm-5.3 flash绑成一个虚拟模型之后,情况明显不一样了。
道理不复杂。每个平台的限流是独立计算的,A平台429了,网关自动把请求路由到B平台,B不行还有C,等C用完了,A的限制也过了。对使用端来说,看到的始终是一个模型,但底下是三个独立的额度池在轮流使用。

实际体验就是:基本可以连续用挺长时间不出问题,一个功能从开到收尾,中间不用停下来等冷却。
免费资源的单位价值很低,但它们的额度是相互独立的。单用一个,你拿到的是一份经常断供的额度;绑在一起,你拿到的是一份还算稳定的额度。模型没变,可用性完全两个档次。
你也可以这么干
如果你和老刘一样,手头有一堆快到期的订阅,或者收藏了一堆免费provider,别让它们吃灰。
找一个本地或者在线的网关,把同模型、跨平台的额度组织起来。Cloudflare AI Gateway是一个选择,自己搭一个本地网关也不复杂,核心就三件事:
第一,按模型分组 不同供应商的同款模型绑成一个虚拟模型,别混着绑。
第二,配好故障转移 一个provider返回429或者超时,自动切下一个,别把错误直接抛给使用端。
第三,优先消耗快过期的 快到期的订阅排在路由前面,先用先到期,主打一个颗粒归仓。
既能提升使用体验,也能提高利用率,一举两得。
在这里再提醒一下,不建议不同模型混合在一起,很有可能抵挡模型接不住前面的上下文。
最后问一句:你手头有多少吃灰的订阅和免费额度?评论区晒一晒,看看谁才是囤额度界的天花板。
🤝 如果看到这里的同学对客户端或者Flutter开发感兴趣,欢迎联系老刘,我们互相学习。
🎁 私信免费领老刘整理的《Flutter开发手册》,覆盖90%应用开发场景。可以作为Flutter学习的知识地图。
💬 : laoliu_dev
📂 老刘也把自己历史文章整理在GitHub仓库里,方便大家查阅。