GPT-6 发布两周,你大概已经看腻了跑分。这几天小破站上线了一个更野的东西------「B站AI无限竞技场」:UP主出题、100 多个大模型下场、30 多个主题轮番对战,算是一场给 AI 的「民间大考」。
结果不出所料:GPT-6 Astra 目前总榜第一,16 场被测、10 场夺冠,榜首率 62.5%。
但把这个榜单从头到尾拆完之后,我反而觉得「最强 AI」这三个字得重新拆开看:30 多个主题里,GPT-6 只拿下了 10 个,剩下 20 个单项被 GLM-5.3、Claude、DeepSeek、Qwen,甚至一个没进总榜前九的 Seed-2.0 pro 分走了。写代码它确实是横,但换个考法、换个场景,排行榜就换了人间。
这篇文章我把榜单数据全部拆开:GPT-6 到底赢在哪、输在哪,以及作为开发者该怎么用这个榜。
一、先看这个「民间大考」怎么玩
它和传统 benchmark 的区别,一句话:出题人不是实验室,是 UP主。
- 考题是真实任务:修祖传屎山代码、用百字人话需求复刻 B 站首页、写量化策略、参加全国高考、当相亲媒婆;
- 排名规则很简单:按「获得榜首次数」由高到低排,不是分数加权;
- 榜单是活的:UP主每发一期新视频,榜单实时刷新。
平台在页脚也把口径说得很直白:数据源于 UP主公开测评视频,测评结果均由 UP主独立产出,平台仅作收录与展示。
严谨性当然不如学术 benchmark------没有控制变量,没有显著性检验。但它测的东西恰好是跑分测不到的:真实场景里的表现。这跟我们的日常其实更像:没有人给你的 PR 打 OSWorld 分,老板只会问「这个需求今天能不能上」。
二、GPT-6 的主场:代码
先看它赢下的 10 个主题的成色:10 个里 8 个是编程开发类。
| GPT-6 夺冠主题 | 出题UP主 | 参战模型数 |
|---|---|---|
| GTA5 的 19.8 亿次 if 循环修复 | 人工大黑 | 24 |
| 无机酸的 bench | 无机酸-_- | 22 |
| 屎山论剑·模型擂台战 | Token就是词元 | 14 |
| 程序员阿江的编程 bench | 程序员阿江-Relakkes | 14 |
| 百字人话开发 B 站首页 | 圣徒城的小诺 | 10 |
| 阿滋卡班的 bench | 我是阿滋卡班 | 9 |
| 挺进地牢游戏生成测试 | Likely7Ai | 4 |
| AI 白模生成视频横测 | DeepWhite深白色 | 3 |
(另有 AI 模型大比拼、神烦老狗的 Benchmark 两个主题,篇幅所限不展开。)
重点拆两场。
第一场,GTA5 屎山修复------参战规模最大的代码赛,24 个模型。
GTA5 里有一段 19.8 亿次 if 循环的祖传屎山代码,是出了名的性能杀手。UP主人工大黑把修复任务丢给 24 个模型,比谁修得又快又好。这种活最像「接手一个没人敢动的祖传模块」:长逻辑要拆得动,代码要真落地。GPT-6 拿下第一。这位UP主还出过一张二次元考卷,拿冷门番梗考模型的长尾知识记忆,同样收录在竞技场里。
第二场,百字人话开发 B 站首页------前端最对口的一场。
UP主圣徒城的小诺的考题是:只给一百字左右的「人话」需求描述,让 10 个模型复刻 B 站首页。真实需求本来就是模糊、充满歧义的,模型得先猜对意图,再把工程和 UI 都落地。GPT-6 又是第一。
顺带一提,UP主Likely7Ai 还专门给 GPT-6 Astra 做过一场实测------网页复刻、Blender 动画、游戏生成三连,原片收录在竞技场里。
对写代码的人来说,这个信号很实在:拿着模糊需求产出能用代码这件事,GPT-6 目前是这批模型里最能打的一个,而且是被 14~24 个对手同场比出来的,不是哪一家的自卖自夸。
三、但同一个出题人换了张考卷,名次就变了
竞技场里最有意思的一组对照,来自 UP主「Token就是词元」------他一个人出了三场代码赛:
| 场次 | 考法 | GPT-6 名次 | 冠军 |
|---|---|---|---|
| 屎山论剑·模型擂台战 | 模型 PK 对决修 BUG | 第 1(14 模型) | GPT-6 |
| 祖传BUG挑战赛-逐鹿中原季 | 分组积分、淘汰晋级 | 第 5(16 模型) | Claude Fable 5.1 |
| 屎山考核·祖传代码统考 | 同一套考卷统一打分 | 未上榜 | GLM-5.3(12 分) |
同一个出题人、同为代码任务:擂台赛上 GPT-6 是冠军;换成积分淘汰赛,它排到第 5,前面站着 Claude Fable 5.1、Claude Opus 5、DeepSeek V4 Pro 和 Doubao Seed 2.1;到了统一打分的统考,它干脆没出现在榜单上,GLM-5.3 以 12 分夺冠。
倒不是 GPT-6 不行,是考法一变,名次就跟着变。擂台赛拼上限,统考拼稳定性。模型能力不是一个标量,是一组向量,这事在跑分榜上看不见,在同一个人出的三张考卷上一目了然。
密室逃脱那边是同一个剧本。UP主AGI-Eval评测出了 270 关,同一套考题按难度分梯度:低难度段,GPT-6 的线索串联表现最优;等关卡进入高难度的多层线索嵌套,它的优势开始缩减,被 Claude Opus 4.6 反超。考卷没换,难度升了一档,名次又变了。
四、离开代码区,就是别人的主场
再看 GPT-6 没拿下的主题------基本每个赛道都有不同的王:
| 主题 | 参战模型 | 榜首 |
|---|---|---|
| AI 量化测评·谁是搞钱王? | 14 | Qwen3.8-Max(GPT-6 第 2) |
| 如果让 AI 参加全国高考? | 36 | Claude Opus 5 |
| AI 博弈论·囚徒困境 | 6 | Seed-2.0 pro |
| AI 进军网文圈 | 6 | Gemini 3.8 Flash |
| AI 麻将大赛 | 14 | DeepSeek-V4-Flash |
| AI 五子棋国际邀请赛 | 8 | Doubao-Seed-Evolving |
| 向量数据库测试 | 20 | Claude Fable 5.1 |
几个值得咂摸的细节:
- 总榜第二是 GLM-5.3:3 个榜首、16 场被测,出场次数和 GPT-6 一样多,榜首率 18.75% 对 62.5%。国产模型里目前走得最均衡的一个。
- Claude Fable 5.1 的榜首率有 33.33%(9 场被测 3 次夺冠),比 GLM-5.3 还高,其中祖传BUG挑战赛那场,就是在 GPT-6 最擅长的代码区完成的反杀。
- Seed-2.0 pro 拿下囚徒困境:这个模型甚至没进总榜前九。多轮博弈、预判对手行为这种任务,跟跑分基本是两回事。
- 挑战者区还挂着一排「被测很多次但还没开张」的名字:Kimi K3 被测 13 次、Grok 4.6 被测 11 次、MiniMax M3 被测 10 次,榜首次数都是 0。
五、开发者怎么用这个榜
三个实操判断:
1. 别按总榜选模型,按你的场景看单项。 总榜第一适合围观,单项第一才适合装进工具链。日常主活是写代码、修屎山,GPT-6 目前众测最强;但如果你做的是量化、知识密集或者长文本任务,先看对应赛道的冠军再掏钱。
2. 同一场景内也要看考法。 UP主Token就是词元那三场就是最好的例子:自由发挥类任务 GPT-6 强,统一评分的「考试型」任务就要另说。你的工作更像哪种,就重点看哪种。
3. 这个榜是活的,值得收藏。 UP主持续上新题,榜单实时刷新,今天的名次下周可能就变。与其等季度跑分报告,不如把这个页面收着按期看。
写在最后
跑分回答「谁跑得快」,这种民间大考回答「谁在你的场景里好用」。前者从来不缺,后者一直没人做,现在UP主们拿 100 多个模型、30 多种真实任务把它补上了。
留个问题:你日常干活的主力模型是哪个?有没有哪个模型「逆袭」或「翻车」的场景让你印象最深?评论区聊聊。
想看实时榜单的,打开小破站搜「AI竞技场」就能直达
(数据快照取自发布当日的实时榜单,榜单持续更新中,以页面最新数据为准。)