21 个免费大模型入口,实测只有 9 个能用

六天前我写过一篇,说 13 个免费大模型入口一个月挂了 4 个。这几天入口又加了几个,我把现在全部 21 个挨个调了一遍。

结果是:能用的 9 个,正在限流的 5 个,已经死透的 7 个。

但这次真正有用的不是这几个数字。是我在核对数据的时候发现,自己差点把一个活着的判成死的。

先看名单

同一道题、同样参数,2026 年 8 月 17 日实测:

能用(9 个)

入口 耗时
Cerebras oss-120b 593ms
NVIDIA Ultra-550B 1343ms
智谱 GLM-4-Flash 1590ms
Mistral Large 1687ms
Cloudflare oss-120b 1764ms
Cerebras 上的 GLM-4.7 1938ms
OpenRouter Nemotron 2358ms
NVIDIA Nemotron-49B 4058ms
Kimi k2.6 10311ms

正在限流(5 个):Mistral 上的 GLM-5.2、Gemini Flash-Lite、NVIDIA MiniMax-M3、Groq oss-120b、智谱 GLM-4.7-Flash。这五个我每个都隔 12 秒重试了三次,仍然被限。

已经死了(7 个):火山 GLM-5.2(账户欠费)、GitHub GPT-4.1 和 GPT-4o-mini(服务已退役)、Groq 的 Llama-3.3-70B(模型 ID 不存在了)、OpenRouter 的 Llama-3.3(免费档撤了)、ModelScope 的 DeepSeek-V4(模型下架)、SambaNova(要求绑支付方式)。

Cloudflare 是这批里的新面孔,Workers AI 上的 gpt-oss-120b,1.7 秒,能用。

我差点写错的那一条

第一轮扫描跑完,Cerebras 上的 GLM-4.7 被我的脚本判成了失败。我准备把它写进「挂掉」那一列的时候,顺手去看了眼原始返回,发现它其实成功了。

问题出在我的判定逻辑上:我看的是 content 字段有没有内容。而这个模型是推理模型,它把 1358 个字符的思考过程放在了 reasoning 字段里,content 里只有 40 个字,加上我第一轮给的 max_tokens 太小,正文被挤没了,于是 content 是空的。

一个活得好好的模型,因为返回结构不一样,被我判了死刑。

这件事有两个可用的结论。

对写代码的人:判断一次调用成功与否,只看 content 是不够的,推理模型可能把内容放在 reasoningreasoning_content 里。我 8 月 10 日那篇写过智谱的思考模型会吃掉 token 预算,现在再补一条:它还可能把内容放在你没读的那个字段里。

对看测评的人:任何一份「哪些能用哪些不能用」的清单,包括我这份,都取决于测的人怎么判定「能用」。判定逻辑差一点,结论就差一个模型。

比名单更有用的一件事

把这 21 个入口按「实际跑的是哪个模型」重新排一次,会看到一个之前没注意到的结构。

同一个模型现在往往挂在好几个平台上,而各平台的可用性完全不同:

gpt-oss-120b 有三个入口。Cerebras 593 毫秒能用,Cloudflare 1764 毫秒能用,Groq 限流。

Nemotron-3-Ultra-550B 有两个入口,NVIDIA 和 OpenRouter,都能用。

GLM-4.7 有两个入口。Cerebras 上的能用,智谱自家的反而在限流

GLM-5.2 有两个入口,火山欠费停服,Mistral 限流,两个都用不了。

Llama-3.3-70B 有三个入口,Groq 模型 ID 失效、OpenRouter 免费档撤了、SambaNova 要绑卡,全军覆没。

这组对比里最反直觉的是 GLM-4.7:智谱是这个模型的东家,但今天它自家的免费入口在限流,而 Cerebras 托管的那份能用。

所以「某个模型今天能不能白嫖」这个问题问错了。该问的是「这个模型在哪一家还能白嫖」。

这意味着你该怎么配

如果你在项目里挂免费模型,这次数据给出的最实际的建议是:同一个模型,配多个平台的入口。

理由很直接。上面五组里,凡是只有一个入口的模型,它挂了你就没有备份;而 gpt-oss-120b 有三个入口,今天 Groq 限流,Cerebras 和 Cloudflare 照样能顶上,你的程序甚至不会感知到异常。

这比「多配几个不同的模型」更有效。因为不同模型意味着不同的输出风格、不同的参数、不同的返回结构,切换过去很可能要改代码;而同一个模型换个平台,请求体基本不用动。

具体到这次的数据,我会这么排:

**gpt-oss-120b 走 Cerebras,备 Cloudflare。**Cerebras 593 毫秒是全场最快,Cloudflare 作为新入口目前很稳。Groq 那个入口留着,它限流是常态但恢复也快。

**要国内直连不走代理,智谱 GLM-4-Flash 仍然是最靠谱的兜底。**1590 毫秒,永久免费,我上一篇统计过它在两万五千次真实调用里成功率 98.2%。

**Kimi 恢复了。**它在我八月初的生产日志里成功率只有 0.3%,几乎全废,这次测能正常返回,10 秒虽然慢但活着。

**别再往 Llama-3.3-70B 上花时间。**三个入口全没了。

几句边界

这是一个账号、一个时间点的快照,2026 年 8 月 17 日。限流那五个明天可能就好了,能用那九个明天可能就限了,这类清单的保质期以天计。

限流和已死的区分基于报错内容:报余额不足、服务退役、模型不存在、要求付费的归为已死;报 429、rate limit、访问量过大的归为限流,并且每个都重试了三次。这个分法有主观成分,比如火山那个欠费,充值之后就能复活,严格说它不是「死」,是「我这个账号欠费了」。

另外我只测了「能不能返回结果」,没测质量,也没跑穿额度看上限。能调通和好用是两件事。

想自己核一遍的话,判定逻辑记得同时读 contentreasoningmax_tokens 给到 1200 以上,别像我第一轮那样把活的判成死的。

相关推荐
正经教主43 分钟前
AI提示词工程(高阶)第15课:ReAct模式与工具调用
人工智能
SixHateSeven1 小时前
用 TRAE 自动生成股票分析报告,从敲命令到一句话搞定
人工智能
安逸Ai1 小时前
多模态模型是什么?文本、图像、音频如何统一理解?
人工智能
张张123y1 小时前
Hermes Agent 是什么?它能做什么,以及如何部署到飞书
人工智能·python·飞书
架构小何1 小时前
从检索到可靠执行:Context System 赋能灵巧手Agent工程落地实践
人工智能
H_Peak1 小时前
Tines 3B 模型本地部署与调用实战指南
人工智能
paopao_djshddhdj1 小时前
钉钉千问:企业级AI助手,赋能组织智能升级
人工智能·钉钉
学习计算机科学与技术1 小时前
VSCode 源码解读
人工智能
laboratory agent开发1 小时前
企业智能体上线后效果难以衡量:评估体系怎么搭
大数据·人工智能