
9 月头两周,五家厂商发了六个旗舰:Anthropic 的 Claude Fable 5.1(9 月 2 日)、阿里的 Qwen3.8-Max-0902(9 月 2 日)、Meta 的 Muse Spark 1.3 和谷歌的 Gemini 3.8 Flash(9 月 3 日)、OpenAI 的 GPT-6 Astra(当地时间 9 月 3 日),中间歇了不到一周,DeepSeek V4.1 Flash(9 月 10 日)压轴。
发布季一到,榜单就成了流量密码。我把三份最有存在感的榜单翻了一遍,看到一个每次发布季都重演、但每次都有人当真的场面:三份榜单,三个第一。LMArena 综合榜的头名是 7 月就发布的 Claude Fable 5;Artificial Analysis 智能指数的头名是 Claude Fable 5.1;各类聚合转述榜里"登顶"的是 GPT-6 Astra------而它登顶前三天,LMArena 综合榜的前 20 里根本没有它。
榜单是声望指标,不是选型指标。 开发者从榜上要拿走的不是"谁第一",是三列数据------分项能力、成本、可得性。这篇文章拆给你看:第一名是怎么被三份榜单造出三个答案的,以及哪三列才是选型的真凭据。
版本基准:榜单快照为 LMArena(2026-09-13 与 09-16)与 Artificial Analysis Intelligence Index v4.2(2026-09-07),发布事件与定价核自各厂商官方公告。榜单实时变动,一切以当日官网为准。
两周六个旗舰,三个第一
先看这轮发布潮都落了什么牌,每一条都核过官方公告:
| 日期 | 模型 | 厂商 | 一句话定位 |
|---|---|---|---|
| 9-02 | Claude Fable 5.1 | Anthropic | 官方称"迄今最强的编码与知识工作模型",缓存读取降价 75% |
| 9-02 | Qwen3.8-Max-0902 | 阿里 | 2.4T 参数 MoE 旗舰的月度迭代,Max 级首次官宣将开源 |
| 9-03 | Muse Spark 1.3 | Meta | AA 指数 53 分,与 7 月的 Claude Fable 5 并列第 4 |
| 9-03 | Gemini 3.8 Flash | 谷歌 | DeepSWE 工程榜 74% 领先组里最便宜的一个 |
| 9-03 | GPT-6 Astra | OpenAI | 官方称"全球最智能、对齐程度最高",上下文 105 万 token |
| 9-10 | DeepSeek V4.1 Flash | DeepSeek | 552B 参数 MoE、全新 CED 架构,权重 MIT 开源,官方称性能全面超越 V4 Pro |
然后是榜单。同一批模型,三份榜单给出三个第一:
- LMArena 综合榜(9 月 13 日快照):头名是 claude-fable-5,Elo 1506------一个 7 月 1 日发布的模型。前 10 名里 Anthropic 占 7 席。GPT-6 Astra 不在前 20。
- AA 智能指数 v4.2(9 月 7 日快照):头名是 Claude Fable 5.1(57 分),GPT-6 Astra 第二(55 分)。
- 聚合转述榜:GPT-6 Astra 登顶的标题满天飞。这个说法也没错------9 月 16 日再看 LMArena 的机构分页,GPT-6 Astra 确实排到了第一,领先第二名 4.4 分。代价是那行小字:投票数才 10.4K------对比 GPT-5.5 的 81.3K------名次置信区间宽到 1-6 名。
三个第一都是真的,也都当不得选型依据。想知道为什么,得看每份榜的第一名是怎么产生的。
第一名是怎么产生的:一半靠投票,一半靠刷题
两份主流榜单,两套世界观。
LMArena 是众包盲测:402 个模型、28 家厂商、累计 1180 万次真人匿名投票,按 Elo 积分排座次。可信度来自"真人盲测",毛病也来自"真人"------投票量决定置信度,而投票量需要时间。9 月 13 日快照里有个扎眼的细节:排第一的 claude-fable-5 攒了两个多月、30.1K 张票;9 月 2 日刚发的 fable-5.1-max 只有 5.8K 张票,压在 #5。同一个系列,新版压不过旧版------不是新版弱,是新版没票。Meta 那对 Muse Spark 是同款剧情:9 月 3 日刚发的 1.3 只有 4.7K 张票,压在 #8;可排 #4 的 1.2 也才 3.2K 张票,置信区间宽到 ±11------榜面前排有一半是"票还没攒够"的座次。
这就是我说的声望指标:众包榜的名次里,一半是模型水平,一半是曝光时长。发布第一天就冲去读榜,读到的是别人两个月的投票积累。
AA 走另一条路:固定基准评测,聚合十项基准(数学、科学、编程、多步推理等)打综合分。没有真人情绪,分数可以复现。但它有另一类坑------口径会升级。9 月 4 日 AA 把指数从 v4.1 升到 v4.2,调整了任务组成与权重,Claude Fable 5.1 的分数从发布报道时的 66 分变成 57 分。模型一行权重没动,账面掉了 9 分。AA 自己提示 v4.2 与旧版不可直接比较,但转发的标题不管这些,"暴跌 9 分"比"口径调整"有流量多了。
至于各类聚合榜、自建榜,多数是前两者的搬运再拌上自家权重。读它们之前,先找到"评分从哪来"那行小字。说个我自己这次的遭遇:回源核查时 arena.ai 官网直接被 Cloudflare 拦在门外,甩给我一页"Attention Required";不死心换了个榜单聚合站,还是同一页拦截。最后是从转载其官方数据的快照站拿的数。你看,连榜单第一手数据的可得性,本身就是个工程问题。
同一批模型,名次对不上账
把三份榜的名次横过来对,才见真章。这张表我自己整理的,四个数据列四个快照日期,也是本文最想让你带走的东西:
| 模型(厂商) | LMArena 综合¹ | AA 指数² | AA WebDev³ | AA DeepSWE⁴ |
|---|---|---|---|---|
| Claude Fable 5.1(Anthropic) | #5 | #1(57 分) | #2(1762) | 未上榜 |
| GPT-6 Astra(OpenAI) | 前 20 外,9-16 冲至 #1 | #2(55 分) | #1(1797) | 74%(领先组) |
| Claude Opus 5(Anthropic) | #10 | #3(54 分) | #3(1688) | 74%(领先组) |
| Gemini 3.8 Flash(谷歌) | #9(初步数据) | #10(47 分) | 1567 | 74%(领先组) |
| Kimi K3(月之暗面) | #17 | #8(50 分) | #5(1674) | 69% |
| GLM-5.3(智谱) | #19 | #9(49 分) | 1609 | 69% |
| Qwen3.8-Max(阿里) | 前 20 外 | #10(47 分) | #6(1670) | 57% |
| DeepSeek V4.1 Flash(DeepSeek) | 前 20 外 | 未收录 | 未收录 | 未收录 |
¹ 2026-09-13 快照;Arena 按推理档位分条目(-max/-high 是同一模型的不同档),表中取该模型最高档位名次。² 2026-09-07,v4.2 口径。³ 编码分项 Elo,09-05 更新。⁴ 工程任务通过率,09-03 更新。
对着表说三个观察。
第一,国产模型的名次在两榜之间差出 8 到 10 位。 Kimi K3 在 AA 排 #8,到 LMArena 掉到 #17;GLM-5.3 从 #9 掉到 #19;Qwen3.8-Max 在 AA 勉强挂住 #10,在 LMArena 干脆不在前 20。哪家"更准"没有答案------两家的题和投票人群完全不同------但"某某国产模型全球前十"这种标题,先问一句哪个榜、哪个快照,再决定信几成。顺带一个反差:LMArena 前 20 里仅有的两个非闭源模型,kimi-k3-max(#17)和 glm-5.3-max(#19),全是国产。闭源旗舰的声望场里,开源模型能挤进前 20,这件事本身比名次更有信息量。
第二,总分差 2 分,分项可能换了天下。 AA 综合分 Fable 5.1 只比 GPT-6 Astra 高 2 分,看着咬得死。但拆开看:编码分项 WebDev 上 Astra 反超 35 分排第一;工程任务 DeepSWE 上 Astra 有 74% 的成绩,Fable 5.1 干脆未上榜。做编码工具链的团队如果只读总分,会把这两个模型的排位读反。
第三,最新的模型永远在榜外。 DeepSeek V4.1 Flash 9 月 10 日发布,AA 快照(9-07)和 LMArena 快照(9-13)都没来得及收它,四个数据列全是"未收录"。第三方自建榜倒是收得飞快,已经把它排到国产第 2 了------收得快和口径硬,你只能挑一头。追新模型看榜,等于看后视镜开车。
别读总分,读三列
那榜单对开发者就没用了吗?不是。把总分那一列关掉,留这三列,每一列都能直接进选型文档。
列一:分项能力。 你做的应用吃哪个分项,就看哪个分项。做编码助手和代码 Agent 的,WebDev 和 DeepSWE 比 57 对 55 的总分诚实得多:DeepSWE 的领先组是 Astra、Opus 5、Gemini 3.8 Flash 三个并列 74%,国产旗舰 GLM-5.3 和 Kimi K3 都在 69%------差 5 个点,不是差一个时代。做通用对话、知识工作的,再看综合分和各自的长文本、多模态能力。
列二:成本。 AA 有一列"综合任务成本",跑完基准上的一道题要花多少美元,比每百万 token 报价更贴近真实体感(口径:AA 综合任务成本,非 token 单价):
| 模型 | AA 综合任务成本 | DeepSWE 工程任务成本 |
|---|---|---|
| GPT-5.6 Luna | $0.10 | $0.61 |
| GLM-5.3 Flash | $0.18 | $0.24 |
| GLM-5.3 | $1.26 | $3.99 |
| Kimi K3 | $1.58 | $4.65 |
| GPT-6 Astra | $2.57 | $6.52 |
| Gemini 3.8 Flash | --- | $2.36 |
| Claude Fable 5.1 | $6.12 | --- |
| Claude Opus 5 | --- | $11.84 |
Fable 5.1 一道题 6.12,GLM−5.3Flash一道题0.18,34 倍。能力差多少?AA 综合分 57 对 46。再往深看一层:GPT-6 Astra 的 API 定价是输入 10/输出50(每百万 token),上一代 GPT-5.6 Sol 输入还是 $5------旗舰第一次把涨价涨成了翻倍,而它在 AA 总分上比第一名还低 2 分。旗舰的溢价买的不是那 2 分,是上限场景的保险;日常任务让便宜模型扛,是这个表最直接的读法。
列三:可得性。 榜单不回答"你能不能用",这一列得自己盘:DeepSeek V4.1 Flash 权重 MIT 开放下载,GLM-5.3 是 753B 参数 + MIT 协议,Qwen3.8-Max 官宣将开源(Max 级第一次);而 Astra、Fable 5.1、Gemini 3.8 Flash 全部闭源 API,Astra 还是分阶段开放(先受信组织,数日内才轮到 Plus/Pro 与 API、AWS)。企业落地的老约束在这儿一条没变:要私有化的团队,榜单前十的门只开了一半------能进前十还开源的,就是国产那几个。
谁该跟榜走,谁该把总榜关掉
最后给工程落点,分两拨人。
做尝鲜、做研究、做竞品分析的,跟榜走没毛病。 总榜名次就是声望排序,用它度量"这家厂商现在站在哪",比任何新闻稿都准。LMArena 前 10 被 Anthropic 拿走 7 席,这个事实对判断 Claude 系在西方用户群体里的口碑,比 50 篇软文都有用。只是记住你在读的是声望,不是能力差距。
做生产选型的,把总榜关掉,用上面三列。 给个我自己在用的例子:「手搓企业智能体」系列七集,IT 服务台 Agent 从对话、工具、记忆到工作流全部跑在 DeepSeek 上,中间一次都没换过模型。为什么?服务台场景一轮对话十几次工具调用,成本列的权重远大于能力列------一个 69% 和 74% 的 DeepSWE 差距,用户在这边感知不到,但账单感知得到;再加上它是 MIT 开源,哪天要私有化部署,门是开着的。同样的逻辑反过来:如果你在做代码 Agent 或高价值复杂任务,为 Astra、Fable 5.1 这个档位付溢价,是对"失控的那一次调用"买保险------这两件事不矛盾,矛盾的是用一个总榜名次同时决策这两件事。
9 月这轮发布季的模型,哪个值得单独跑一次 Java 接入实测?我有自己的答案了,留给「望远镜·首测」。榜单下个月还会换第一,三列数据的读法不会过时。