六天前我写过一篇,说 13 个免费大模型入口一个月挂了 4 个。这几天入口又加了几个,我把现在全部 21 个挨个调了一遍。
结果是:能用的 9 个,正在限流的 5 个,已经死透的 7 个。
但这次真正有用的不是这几个数字。是我在核对数据的时候发现,自己差点把一个活着的判成死的。

先看名单
同一道题、同样参数,2026 年 8 月 17 日实测:
能用(9 个)
| 入口 | 耗时 |
|---|---|
| Cerebras oss-120b | 593ms |
| NVIDIA Ultra-550B | 1343ms |
| 智谱 GLM-4-Flash | 1590ms |
| Mistral Large | 1687ms |
| Cloudflare oss-120b | 1764ms |
| Cerebras 上的 GLM-4.7 | 1938ms |
| OpenRouter Nemotron | 2358ms |
| NVIDIA Nemotron-49B | 4058ms |
| Kimi k2.6 | 10311ms |
正在限流(5 个):Mistral 上的 GLM-5.2、Gemini Flash-Lite、NVIDIA MiniMax-M3、Groq oss-120b、智谱 GLM-4.7-Flash。这五个我每个都隔 12 秒重试了三次,仍然被限。
已经死了(7 个):火山 GLM-5.2(账户欠费)、GitHub GPT-4.1 和 GPT-4o-mini(服务已退役)、Groq 的 Llama-3.3-70B(模型 ID 不存在了)、OpenRouter 的 Llama-3.3(免费档撤了)、ModelScope 的 DeepSeek-V4(模型下架)、SambaNova(要求绑支付方式)。
Cloudflare 是这批里的新面孔,Workers AI 上的 gpt-oss-120b,1.7 秒,能用。
我差点写错的那一条
第一轮扫描跑完,Cerebras 上的 GLM-4.7 被我的脚本判成了失败。我准备把它写进「挂掉」那一列的时候,顺手去看了眼原始返回,发现它其实成功了。
问题出在我的判定逻辑上:我看的是 content 字段有没有内容。而这个模型是推理模型,它把 1358 个字符的思考过程放在了 reasoning 字段里,content 里只有 40 个字,加上我第一轮给的 max_tokens 太小,正文被挤没了,于是 content 是空的。
一个活得好好的模型,因为返回结构不一样,被我判了死刑。
这件事有两个可用的结论。
对写代码的人:判断一次调用成功与否,只看 content 是不够的,推理模型可能把内容放在 reasoning 或 reasoning_content 里。我 8 月 10 日那篇写过智谱的思考模型会吃掉 token 预算,现在再补一条:它还可能把内容放在你没读的那个字段里。
对看测评的人:任何一份「哪些能用哪些不能用」的清单,包括我这份,都取决于测的人怎么判定「能用」。判定逻辑差一点,结论就差一个模型。
比名单更有用的一件事
把这 21 个入口按「实际跑的是哪个模型」重新排一次,会看到一个之前没注意到的结构。

同一个模型现在往往挂在好几个平台上,而各平台的可用性完全不同:
gpt-oss-120b 有三个入口。Cerebras 593 毫秒能用,Cloudflare 1764 毫秒能用,Groq 限流。
Nemotron-3-Ultra-550B 有两个入口,NVIDIA 和 OpenRouter,都能用。
GLM-4.7 有两个入口。Cerebras 上的能用,智谱自家的反而在限流。
GLM-5.2 有两个入口,火山欠费停服,Mistral 限流,两个都用不了。
Llama-3.3-70B 有三个入口,Groq 模型 ID 失效、OpenRouter 免费档撤了、SambaNova 要绑卡,全军覆没。
这组对比里最反直觉的是 GLM-4.7:智谱是这个模型的东家,但今天它自家的免费入口在限流,而 Cerebras 托管的那份能用。
所以「某个模型今天能不能白嫖」这个问题问错了。该问的是「这个模型在哪一家还能白嫖」。
这意味着你该怎么配
如果你在项目里挂免费模型,这次数据给出的最实际的建议是:同一个模型,配多个平台的入口。
理由很直接。上面五组里,凡是只有一个入口的模型,它挂了你就没有备份;而 gpt-oss-120b 有三个入口,今天 Groq 限流,Cerebras 和 Cloudflare 照样能顶上,你的程序甚至不会感知到异常。
这比「多配几个不同的模型」更有效。因为不同模型意味着不同的输出风格、不同的参数、不同的返回结构,切换过去很可能要改代码;而同一个模型换个平台,请求体基本不用动。
具体到这次的数据,我会这么排:
**gpt-oss-120b 走 Cerebras,备 Cloudflare。**Cerebras 593 毫秒是全场最快,Cloudflare 作为新入口目前很稳。Groq 那个入口留着,它限流是常态但恢复也快。
**要国内直连不走代理,智谱 GLM-4-Flash 仍然是最靠谱的兜底。**1590 毫秒,永久免费,我上一篇统计过它在两万五千次真实调用里成功率 98.2%。
**Kimi 恢复了。**它在我八月初的生产日志里成功率只有 0.3%,几乎全废,这次测能正常返回,10 秒虽然慢但活着。
**别再往 Llama-3.3-70B 上花时间。**三个入口全没了。

几句边界
这是一个账号、一个时间点的快照,2026 年 8 月 17 日。限流那五个明天可能就好了,能用那九个明天可能就限了,这类清单的保质期以天计。
限流和已死的区分基于报错内容:报余额不足、服务退役、模型不存在、要求付费的归为已死;报 429、rate limit、访问量过大的归为限流,并且每个都重试了三次。这个分法有主观成分,比如火山那个欠费,充值之后就能复活,严格说它不是「死」,是「我这个账号欠费了」。
另外我只测了「能不能返回结果」,没测质量,也没跑穿额度看上限。能调通和好用是两件事。
想自己核一遍的话,判定逻辑记得同时读 content 和 reasoning,max_tokens 给到 1200 以上,别像我第一轮那样把活的判成死的。