9 月大模型榜单:第一名又换了,但开发者该看的不是它

9 月头两周,五家厂商发了六个旗舰:Anthropic 的 Claude Fable 5.1(9 月 2 日)、阿里的 Qwen3.8-Max-0902(9 月 2 日)、Meta 的 Muse Spark 1.3 和谷歌的 Gemini 3.8 Flash(9 月 3 日)、OpenAI 的 GPT-6 Astra(当地时间 9 月 3 日),中间歇了不到一周,DeepSeek V4.1 Flash(9 月 10 日)压轴。

发布季一到,榜单就成了流量密码。我把三份最有存在感的榜单翻了一遍,看到一个每次发布季都重演、但每次都有人当真的场面:三份榜单,三个第一。LMArena 综合榜的头名是 7 月就发布的 Claude Fable 5;Artificial Analysis 智能指数的头名是 Claude Fable 5.1;各类聚合转述榜里"登顶"的是 GPT-6 Astra------而它登顶前三天,LMArena 综合榜的前 20 里根本没有它。

榜单是声望指标,不是选型指标。 开发者从榜上要拿走的不是"谁第一",是三列数据------分项能力、成本、可得性。这篇文章拆给你看:第一名是怎么被三份榜单造出三个答案的,以及哪三列才是选型的真凭据。

版本基准:榜单快照为 LMArena(2026-09-13 与 09-16)与 Artificial Analysis Intelligence Index v4.2(2026-09-07),发布事件与定价核自各厂商官方公告。榜单实时变动,一切以当日官网为准。

两周六个旗舰,三个第一

先看这轮发布潮都落了什么牌,每一条都核过官方公告:

日期 模型 厂商 一句话定位
9-02 Claude Fable 5.1 Anthropic 官方称"迄今最强的编码与知识工作模型",缓存读取降价 75%
9-02 Qwen3.8-Max-0902 阿里 2.4T 参数 MoE 旗舰的月度迭代,Max 级首次官宣将开源
9-03 Muse Spark 1.3 Meta AA 指数 53 分,与 7 月的 Claude Fable 5 并列第 4
9-03 Gemini 3.8 Flash 谷歌 DeepSWE 工程榜 74% 领先组里最便宜的一个
9-03 GPT-6 Astra OpenAI 官方称"全球最智能、对齐程度最高",上下文 105 万 token
9-10 DeepSeek V4.1 Flash DeepSeek 552B 参数 MoE、全新 CED 架构,权重 MIT 开源,官方称性能全面超越 V4 Pro

然后是榜单。同一批模型,三份榜单给出三个第一:

  • LMArena 综合榜(9 月 13 日快照):头名是 claude-fable-5,Elo 1506------一个 7 月 1 日发布的模型。前 10 名里 Anthropic 占 7 席。GPT-6 Astra 不在前 20。
  • AA 智能指数 v4.2(9 月 7 日快照):头名是 Claude Fable 5.1(57 分),GPT-6 Astra 第二(55 分)。
  • 聚合转述榜:GPT-6 Astra 登顶的标题满天飞。这个说法也没错------9 月 16 日再看 LMArena 的机构分页,GPT-6 Astra 确实排到了第一,领先第二名 4.4 分。代价是那行小字:投票数才 10.4K------对比 GPT-5.5 的 81.3K------名次置信区间宽到 1-6 名。

三个第一都是真的,也都当不得选型依据。想知道为什么,得看每份榜的第一名是怎么产生的。

第一名是怎么产生的:一半靠投票,一半靠刷题

两份主流榜单,两套世界观。

LMArena 是众包盲测:402 个模型、28 家厂商、累计 1180 万次真人匿名投票,按 Elo 积分排座次。可信度来自"真人盲测",毛病也来自"真人"------投票量决定置信度,而投票量需要时间。9 月 13 日快照里有个扎眼的细节:排第一的 claude-fable-5 攒了两个多月、30.1K 张票;9 月 2 日刚发的 fable-5.1-max 只有 5.8K 张票,压在 #5。同一个系列,新版压不过旧版------不是新版弱,是新版没票。Meta 那对 Muse Spark 是同款剧情:9 月 3 日刚发的 1.3 只有 4.7K 张票,压在 #8;可排 #4 的 1.2 也才 3.2K 张票,置信区间宽到 ±11------榜面前排有一半是"票还没攒够"的座次。

这就是我说的声望指标:众包榜的名次里,一半是模型水平,一半是曝光时长。发布第一天就冲去读榜,读到的是别人两个月的投票积累。

AA 走另一条路:固定基准评测,聚合十项基准(数学、科学、编程、多步推理等)打综合分。没有真人情绪,分数可以复现。但它有另一类坑------口径会升级。9 月 4 日 AA 把指数从 v4.1 升到 v4.2,调整了任务组成与权重,Claude Fable 5.1 的分数从发布报道时的 66 分变成 57 分。模型一行权重没动,账面掉了 9 分。AA 自己提示 v4.2 与旧版不可直接比较,但转发的标题不管这些,"暴跌 9 分"比"口径调整"有流量多了。

至于各类聚合榜、自建榜,多数是前两者的搬运再拌上自家权重。读它们之前,先找到"评分从哪来"那行小字。说个我自己这次的遭遇:回源核查时 arena.ai 官网直接被 Cloudflare 拦在门外,甩给我一页"Attention Required";不死心换了个榜单聚合站,还是同一页拦截。最后是从转载其官方数据的快照站拿的数。你看,连榜单第一手数据的可得性,本身就是个工程问题。

同一批模型,名次对不上账

把三份榜的名次横过来对,才见真章。这张表我自己整理的,四个数据列四个快照日期,也是本文最想让你带走的东西:

模型(厂商) LMArena 综合¹ AA 指数² AA WebDev³ AA DeepSWE⁴
Claude Fable 5.1(Anthropic) #5 #1(57 分) #2(1762) 未上榜
GPT-6 Astra(OpenAI) 前 20 外,9-16 冲至 #1 #2(55 分) #1(1797) 74%(领先组)
Claude Opus 5(Anthropic) #10 #3(54 分) #3(1688) 74%(领先组)
Gemini 3.8 Flash(谷歌) #9(初步数据) #10(47 分) 1567 74%(领先组)
Kimi K3(月之暗面) #17 #8(50 分) #5(1674) 69%
GLM-5.3(智谱) #19 #9(49 分) 1609 69%
Qwen3.8-Max(阿里) 前 20 外 #10(47 分) #6(1670) 57%
DeepSeek V4.1 Flash(DeepSeek) 前 20 外 未收录 未收录 未收录

¹ 2026-09-13 快照;Arena 按推理档位分条目(-max/-high 是同一模型的不同档),表中取该模型最高档位名次。² 2026-09-07,v4.2 口径。³ 编码分项 Elo,09-05 更新。⁴ 工程任务通过率,09-03 更新。

对着表说三个观察。

第一,国产模型的名次在两榜之间差出 8 到 10 位。 Kimi K3 在 AA 排 #8,到 LMArena 掉到 #17;GLM-5.3 从 #9 掉到 #19;Qwen3.8-Max 在 AA 勉强挂住 #10,在 LMArena 干脆不在前 20。哪家"更准"没有答案------两家的题和投票人群完全不同------但"某某国产模型全球前十"这种标题,先问一句哪个榜、哪个快照,再决定信几成。顺带一个反差:LMArena 前 20 里仅有的两个非闭源模型,kimi-k3-max(#17)和 glm-5.3-max(#19),全是国产。闭源旗舰的声望场里,开源模型能挤进前 20,这件事本身比名次更有信息量。

第二,总分差 2 分,分项可能换了天下。 AA 综合分 Fable 5.1 只比 GPT-6 Astra 高 2 分,看着咬得死。但拆开看:编码分项 WebDev 上 Astra 反超 35 分排第一;工程任务 DeepSWE 上 Astra 有 74% 的成绩,Fable 5.1 干脆未上榜。做编码工具链的团队如果只读总分,会把这两个模型的排位读反。

第三,最新的模型永远在榜外。 DeepSeek V4.1 Flash 9 月 10 日发布,AA 快照(9-07)和 LMArena 快照(9-13)都没来得及收它,四个数据列全是"未收录"。第三方自建榜倒是收得飞快,已经把它排到国产第 2 了------收得快和口径硬,你只能挑一头。追新模型看榜,等于看后视镜开车。

别读总分,读三列

那榜单对开发者就没用了吗?不是。把总分那一列关掉,留这三列,每一列都能直接进选型文档。

列一:分项能力。 你做的应用吃哪个分项,就看哪个分项。做编码助手和代码 Agent 的,WebDev 和 DeepSWE 比 57 对 55 的总分诚实得多:DeepSWE 的领先组是 Astra、Opus 5、Gemini 3.8 Flash 三个并列 74%,国产旗舰 GLM-5.3 和 Kimi K3 都在 69%------差 5 个点,不是差一个时代。做通用对话、知识工作的,再看综合分和各自的长文本、多模态能力。

列二:成本。 AA 有一列"综合任务成本",跑完基准上的一道题要花多少美元,比每百万 token 报价更贴近真实体感(口径:AA 综合任务成本,非 token 单价):

模型 AA 综合任务成本 DeepSWE 工程任务成本
GPT-5.6 Luna $0.10 $0.61
GLM-5.3 Flash $0.18 $0.24
GLM-5.3 $1.26 $3.99
Kimi K3 $1.58 $4.65
GPT-6 Astra $2.57 $6.52
Gemini 3.8 Flash --- $2.36
Claude Fable 5.1 $6.12 ---
Claude Opus 5 --- $11.84

Fable 5.1 一道题 6.12,GLM−5.3Flash一道题6.12,GLM-5.3 Flash 一道题 6.12,GLM−5.3Flash一道题0.18,34 倍。能力差多少?AA 综合分 57 对 46。再往深看一层:GPT-6 Astra 的 API 定价是输入 10/输出10 / 输出 10/输出50(每百万 token),上一代 GPT-5.6 Sol 输入还是 $5------旗舰第一次把涨价涨成了翻倍,而它在 AA 总分上比第一名还低 2 分。旗舰的溢价买的不是那 2 分,是上限场景的保险;日常任务让便宜模型扛,是这个表最直接的读法。

列三:可得性。 榜单不回答"你能不能用",这一列得自己盘:DeepSeek V4.1 Flash 权重 MIT 开放下载,GLM-5.3 是 753B 参数 + MIT 协议,Qwen3.8-Max 官宣将开源(Max 级第一次);而 Astra、Fable 5.1、Gemini 3.8 Flash 全部闭源 API,Astra 还是分阶段开放(先受信组织,数日内才轮到 Plus/Pro 与 API、AWS)。企业落地的老约束在这儿一条没变:要私有化的团队,榜单前十的门只开了一半------能进前十还开源的,就是国产那几个。

谁该跟榜走,谁该把总榜关掉

最后给工程落点,分两拨人。

做尝鲜、做研究、做竞品分析的,跟榜走没毛病。 总榜名次就是声望排序,用它度量"这家厂商现在站在哪",比任何新闻稿都准。LMArena 前 10 被 Anthropic 拿走 7 席,这个事实对判断 Claude 系在西方用户群体里的口碑,比 50 篇软文都有用。只是记住你在读的是声望,不是能力差距。

做生产选型的,把总榜关掉,用上面三列。 给个我自己在用的例子:「手搓企业智能体」系列七集,IT 服务台 Agent 从对话、工具、记忆到工作流全部跑在 DeepSeek 上,中间一次都没换过模型。为什么?服务台场景一轮对话十几次工具调用,成本列的权重远大于能力列------一个 69% 和 74% 的 DeepSWE 差距,用户在这边感知不到,但账单感知得到;再加上它是 MIT 开源,哪天要私有化部署,门是开着的。同样的逻辑反过来:如果你在做代码 Agent 或高价值复杂任务,为 Astra、Fable 5.1 这个档位付溢价,是对"失控的那一次调用"买保险------这两件事不矛盾,矛盾的是用一个总榜名次同时决策这两件事。

9 月这轮发布季的模型,哪个值得单独跑一次 Java 接入实测?我有自己的答案了,留给「望远镜·首测」。榜单下个月还会换第一,三列数据的读法不会过时。

相关推荐
空 白II9 小时前
9.17 大语言模型研究简报:openAI 公开模型失配报告框架
openai·大语言模型
AIGCmagic社区9 小时前
OpenWAM把世界动作模型预训练拆成可替换的受控实验
人工智能·aigc·具身智能
“AI国潮设计-小江”9 小时前
【SDXL实战】Python自动化生成3D潮汕美食IP,附ComfyUI工作流与商用变现思路
开发语言·人工智能·python·prompt·aigc
Evanfu021610 小时前
商业短剧上传 AI 工具前,要检查哪些安全与删除规则?
自然语言处理·aigc·音视频·视频·机器翻译·自动翻译
板面华仔1 天前
针对AIGC汽车造型领域的Lora微调(一)
lora·aigc·cv
TomEval1 天前
【测AI】第02篇:Python 环境搭建与基础语法速通
人工智能·python·功能测试·aigc
ServBay1 天前
Claude 突然不偷懒了?实测抓包到的 Opus 5.2,成卷王了
aigc·ai编程·claude
殷紫川1 天前
ZCode 把整个 Git 仓库加密上传到了阿里云 OSS:一次客户端逆向的完整复盘
llm·aigc
leeyi1 天前
Agent 要用 API key,但明文一次都不能进模型——Secret Runtime 落地实录(第110篇)
后端·aigc·agent
ClouGence1 天前
J人狂喜,P人救星:AI 帮你搞定十一假期旅行计划,一键生成共享网页
openai·agent