GPT-6 拿下模型众测第一:我拆完 30 个主题的实时榜单,「最强 AI」得看你问哪个场景

GPT-6 发布两周,你大概已经看腻了跑分。这几天小破站上线了一个更野的东西------「B站AI无限竞技场」:UP主出题、100 多个大模型下场、30 多个主题轮番对战,算是一场给 AI 的「民间大考」。

结果不出所料:GPT-6 Astra 目前总榜第一,16 场被测、10 场夺冠,榜首率 62.5%。

但把这个榜单从头到尾拆完之后,我反而觉得「最强 AI」这三个字得重新拆开看:30 多个主题里,GPT-6 只拿下了 10 个,剩下 20 个单项被 GLM-5.3、Claude、DeepSeek、Qwen,甚至一个没进总榜前九的 Seed-2.0 pro 分走了。写代码它确实是横,但换个考法、换个场景,排行榜就换了人间。

这篇文章我把榜单数据全部拆开:GPT-6 到底赢在哪、输在哪,以及作为开发者该怎么用这个榜。

一、先看这个「民间大考」怎么玩

它和传统 benchmark 的区别,一句话:出题人不是实验室,是 UP主。

  • 考题是真实任务:修祖传屎山代码、用百字人话需求复刻 B 站首页、写量化策略、参加全国高考、当相亲媒婆;
  • 排名规则很简单:按「获得榜首次数」由高到低排,不是分数加权;
  • 榜单是活的:UP主每发一期新视频,榜单实时刷新。

平台在页脚也把口径说得很直白:数据源于 UP主公开测评视频,测评结果均由 UP主独立产出,平台仅作收录与展示。

严谨性当然不如学术 benchmark------没有控制变量,没有显著性检验。但它测的东西恰好是跑分测不到的:真实场景里的表现。这跟我们的日常其实更像:没有人给你的 PR 打 OSWorld 分,老板只会问「这个需求今天能不能上」。

二、GPT-6 的主场:代码

先看它赢下的 10 个主题的成色:10 个里 8 个是编程开发类。

GPT-6 夺冠主题 出题UP主 参战模型数
GTA5 的 19.8 亿次 if 循环修复 人工大黑 24
无机酸的 bench 无机酸-_- 22
屎山论剑·模型擂台战 Token就是词元 14
程序员阿江的编程 bench 程序员阿江-Relakkes 14
百字人话开发 B 站首页 圣徒城的小诺 10
阿滋卡班的 bench 我是阿滋卡班 9
挺进地牢游戏生成测试 Likely7Ai 4
AI 白模生成视频横测 DeepWhite深白色 3

(另有 AI 模型大比拼、神烦老狗的 Benchmark 两个主题,篇幅所限不展开。)

重点拆两场。

第一场,GTA5 屎山修复------参战规模最大的代码赛,24 个模型。

GTA5 里有一段 19.8 亿次 if 循环的祖传屎山代码,是出了名的性能杀手。UP主人工大黑把修复任务丢给 24 个模型,比谁修得又快又好。这种活最像「接手一个没人敢动的祖传模块」:长逻辑要拆得动,代码要真落地。GPT-6 拿下第一。这位UP主还出过一张二次元考卷,拿冷门番梗考模型的长尾知识记忆,同样收录在竞技场里。

第二场,百字人话开发 B 站首页------前端最对口的一场。

UP主圣徒城的小诺的考题是:只给一百字左右的「人话」需求描述,让 10 个模型复刻 B 站首页。真实需求本来就是模糊、充满歧义的,模型得先猜对意图,再把工程和 UI 都落地。GPT-6 又是第一。

顺带一提,UP主Likely7Ai 还专门给 GPT-6 Astra 做过一场实测------网页复刻、Blender 动画、游戏生成三连,原片收录在竞技场里。

对写代码的人来说,这个信号很实在:拿着模糊需求产出能用代码这件事,GPT-6 目前是这批模型里最能打的一个,而且是被 14~24 个对手同场比出来的,不是哪一家的自卖自夸。

三、但同一个出题人换了张考卷,名次就变了

竞技场里最有意思的一组对照,来自 UP主「Token就是词元」------他一个人出了三场代码赛:

场次 考法 GPT-6 名次 冠军
屎山论剑·模型擂台战 模型 PK 对决修 BUG 第 1(14 模型) GPT-6
祖传BUG挑战赛-逐鹿中原季 分组积分、淘汰晋级 第 5(16 模型) Claude Fable 5.1
屎山考核·祖传代码统考 同一套考卷统一打分 未上榜 GLM-5.3(12 分)

同一个出题人、同为代码任务:擂台赛上 GPT-6 是冠军;换成积分淘汰赛,它排到第 5,前面站着 Claude Fable 5.1、Claude Opus 5、DeepSeek V4 Pro 和 Doubao Seed 2.1;到了统一打分的统考,它干脆没出现在榜单上,GLM-5.3 以 12 分夺冠。

倒不是 GPT-6 不行,是考法一变,名次就跟着变。擂台赛拼上限,统考拼稳定性。模型能力不是一个标量,是一组向量,这事在跑分榜上看不见,在同一个人出的三张考卷上一目了然。

密室逃脱那边是同一个剧本。UP主AGI-Eval评测出了 270 关,同一套考题按难度分梯度:低难度段,GPT-6 的线索串联表现最优;等关卡进入高难度的多层线索嵌套,它的优势开始缩减,被 Claude Opus 4.6 反超。考卷没换,难度升了一档,名次又变了。

四、离开代码区,就是别人的主场

再看 GPT-6 没拿下的主题------基本每个赛道都有不同的王:

主题 参战模型 榜首
AI 量化测评·谁是搞钱王? 14 Qwen3.8-Max(GPT-6 第 2)
如果让 AI 参加全国高考? 36 Claude Opus 5
AI 博弈论·囚徒困境 6 Seed-2.0 pro
AI 进军网文圈 6 Gemini 3.8 Flash
AI 麻将大赛 14 DeepSeek-V4-Flash
AI 五子棋国际邀请赛 8 Doubao-Seed-Evolving
向量数据库测试 20 Claude Fable 5.1

几个值得咂摸的细节:

  • 总榜第二是 GLM-5.3:3 个榜首、16 场被测,出场次数和 GPT-6 一样多,榜首率 18.75% 对 62.5%。国产模型里目前走得最均衡的一个。
  • Claude Fable 5.1 的榜首率有 33.33%(9 场被测 3 次夺冠),比 GLM-5.3 还高,其中祖传BUG挑战赛那场,就是在 GPT-6 最擅长的代码区完成的反杀。
  • Seed-2.0 pro 拿下囚徒困境:这个模型甚至没进总榜前九。多轮博弈、预判对手行为这种任务,跟跑分基本是两回事。
  • 挑战者区还挂着一排「被测很多次但还没开张」的名字:Kimi K3 被测 13 次、Grok 4.6 被测 11 次、MiniMax M3 被测 10 次,榜首次数都是 0。

五、开发者怎么用这个榜

三个实操判断:

1. 别按总榜选模型,按你的场景看单项。 总榜第一适合围观,单项第一才适合装进工具链。日常主活是写代码、修屎山,GPT-6 目前众测最强;但如果你做的是量化、知识密集或者长文本任务,先看对应赛道的冠军再掏钱。

2. 同一场景内也要看考法。 UP主Token就是词元那三场就是最好的例子:自由发挥类任务 GPT-6 强,统一评分的「考试型」任务就要另说。你的工作更像哪种,就重点看哪种。

3. 这个榜是活的,值得收藏。 UP主持续上新题,榜单实时刷新,今天的名次下周可能就变。与其等季度跑分报告,不如把这个页面收着按期看。

写在最后

跑分回答「谁跑得快」,这种民间大考回答「谁在你的场景里好用」。前者从来不缺,后者一直没人做,现在UP主们拿 100 多个模型、30 多种真实任务把它补上了。

留个问题:你日常干活的主力模型是哪个?有没有哪个模型「逆袭」或「翻车」的场景让你印象最深?评论区聊聊。

想看实时榜单的,打开小破站搜「AI竞技场」就能直达

(数据快照取自发布当日的实时榜单,榜单持续更新中,以页面最新数据为准。)


相关推荐
Είναι η κοπέλα11 小时前
显存计算与模型选择:你的显卡能跑多大的模型
人工智能·pytorch·python·开源·conda
ROSF686811 小时前
2026 仿石漆乳液供应商:市场布局与行业发展态势梳理
大数据·人工智能·python
Ada's11 小时前
Skill is all you need
人工智能
Dawson Zhu11 小时前
《Agentic Design Patterns》第 1 章导读:提示词链(Prompt Chaining)
人工智能·语言模型·架构·aigc·agi
DP DPharness11 小时前
StudyMate 从安装到第一节课的完整操作路径
人工智能·websocket·网络协议·智能手机·dpharness
lingchen190612 小时前
MATLAB 单引号 `‘` 和双引号 `“`
人工智能
hhzz12 小时前
【YOLO 入门到精通 04】理解任务与模型家族:7 大 CV 任务与 YOLO26 选型指南
人工智能·python·深度学习·yolo·计算机视觉
Web3_Basketball12 小时前
用 cost-per-success 做模型选型评测
ai编程
2501_9336707912 小时前
医药市场分析岗位适合应用统计学学生吗,需要考什么证
人工智能
feiyu_gao12 小时前
Mindcraft:从个人实践到可复用模式集
架构·aigc·ai编程