GPT-6 拿下模型众测第一:我拆完 30 个主题的实时榜单,「最强 AI」得看你问哪个场景

GPT-6 发布两周,你大概已经看腻了跑分。这几天小破站上线了一个更野的东西------「B站AI无限竞技场」:UP主出题、100 多个大模型下场、30 多个主题轮番对战,算是一场给 AI 的「民间大考」。

结果不出所料:GPT-6 Astra 目前总榜第一,16 场被测、10 场夺冠,榜首率 62.5%。

但把这个榜单从头到尾拆完之后,我反而觉得「最强 AI」这三个字得重新拆开看:30 多个主题里,GPT-6 只拿下了 10 个,剩下 20 个单项被 GLM-5.3、Claude、DeepSeek、Qwen,甚至一个没进总榜前九的 Seed-2.0 pro 分走了。写代码它确实是横,但换个考法、换个场景,排行榜就换了人间。

这篇文章我把榜单数据全部拆开:GPT-6 到底赢在哪、输在哪,以及作为开发者该怎么用这个榜。

一、先看这个「民间大考」怎么玩

它和传统 benchmark 的区别,一句话:出题人不是实验室,是 UP主

  • 考题是真实任务:修祖传屎山代码、用百字人话需求复刻 B 站首页、写量化策略、参加全国高考、当相亲媒婆;
  • 排名规则很简单:按「获得榜首次数」由高到低排,不是分数加权;
  • 榜单是活的:UP主每发一期新视频,榜单实时刷新。

平台在页脚也把口径说得很直白:数据源于 UP主公开测评视频,测评结果均由 UP主独立产出,平台仅作收录与展示。

严谨性当然不如学术 benchmark------没有控制变量,没有显著性检验。但它测的东西恰好是跑分测不到的:真实场景里的表现。这跟我们的日常其实更像:没有人给你的 PR 打 OSWorld 分,老板只会问「这个需求今天能不能上」。

二、GPT-6 的主场:代码

先看它赢下的 10 个主题的成色:10 个里 8 个是编程开发类。

GPT-6 夺冠主题 出题UP主 参战模型数
GTA5 的 19.8 亿次 if 循环修复 人工大黑 24
无机酸的 bench 无机酸-_- 22
屎山论剑·模型擂台战 Token就是词元 14
程序员阿江的编程 bench 程序员阿江-Relakkes 14
百字人话开发 B 站首页 圣徒城的小诺 10
阿滋卡班的 bench 我是阿滋卡班 9
挺进地牢游戏生成测试 Likely7Ai 4
AI 白模生成视频横测 DeepWhite深白色 3

(另有 AI 模型大比拼、神烦老狗的 Benchmark 两个主题,篇幅所限不展开。)

重点拆两场。

第一场,GTA5 屎山修复------参战规模最大的代码赛,24 个模型。

GTA5 里有一段 19.8 亿次 if 循环的祖传屎山代码,是出了名的性能杀手。UP主人工大黑把修复任务丢给 24 个模型,比谁修得又快又好。这种活最像「接手一个没人敢动的祖传模块」:长逻辑要拆得动,代码要真落地。GPT-6 拿下第一。这位UP主还出过一张二次元考卷,拿冷门番梗考模型的长尾知识记忆,同样收录在竞技场里。

第二场,百字人话开发 B 站首页------前端最对口的一场。

UP主圣徒城的小诺的考题是:只给一百字左右的「人话」需求描述,让 10 个模型复刻 B 站首页。真实需求本来就是模糊、充满歧义的,模型得先猜对意图,再把工程和 UI 都落地。GPT-6 又是第一。

顺带一提,UP主Likely7Ai 还专门给 GPT-6 Astra 做过一场实测------网页复刻、Blender 动画、游戏生成三连,原片收录在竞技场里。

对写代码的人来说,这个信号很实在:拿着模糊需求产出能用代码这件事,GPT-6 目前是这批模型里最能打的一个,而且是被 14~24 个对手同场比出来的,不是哪一家的自卖自夸。

三、但同一个出题人换了张考卷,名次就变了

竞技场里最有意思的一组对照,来自 UP主「Token就是词元」------他一个人出了三场代码赛:

场次 考法 GPT-6 名次 冠军
屎山论剑·模型擂台战 模型 PK 对决修 BUG 第 1(14 模型) GPT-6
祖传BUG挑战赛-逐鹿中原季 分组积分、淘汰晋级 第 5(16 模型) Claude Fable 5.1
屎山考核·祖传代码统考 同一套考卷统一打分 未上榜 GLM-5.3(12 分)

同一个出题人、同为代码任务:擂台赛上 GPT-6 是冠军;换成积分淘汰赛,它排到第 5,前面站着 Claude Fable 5.1、Claude Opus 5、DeepSeek V4 Pro 和 Doubao Seed 2.1;到了统一打分的统考,它干脆没出现在榜单上,GLM-5.3 以 12 分夺冠。

倒不是 GPT-6 不行,是考法一变,名次就跟着变。擂台赛拼上限,统考拼稳定性。模型能力不是一个标量,是一组向量,这事在跑分榜上看不见,在同一个人出的三张考卷上一目了然。

密室逃脱那边是同一个剧本。UP主AGI-Eval评测出了 270 关,同一套考题按难度分梯度:低难度段,GPT-6 的线索串联表现最优;等关卡进入高难度的多层线索嵌套,它的优势开始缩减,被 Claude Opus 4.6 反超。考卷没换,难度升了一档,名次又变了。

四、离开代码区,就是别人的主场

再看 GPT-6 没拿下的主题------基本每个赛道都有不同的王:

主题 参战模型 榜首
AI 量化测评·谁是搞钱王? 14 Qwen3.8-Max(GPT-6 第 2)
如果让 AI 参加全国高考? 36 Claude Opus 5
AI 博弈论·囚徒困境 6 Seed-2.0 pro
AI 进军网文圈 6 Gemini 3.8 Flash
AI 麻将大赛 14 DeepSeek-V4-Flash
AI 五子棋国际邀请赛 8 Doubao-Seed-Evolving
向量数据库测试 20 Claude Fable 5.1

几个值得咂摸的细节:

  • 总榜第二是 GLM-5.3:3 个榜首、16 场被测,出场次数和 GPT-6 一样多,榜首率 18.75% 对 62.5%。国产模型里目前走得最均衡的一个。
  • Claude Fable 5.1 的榜首率有 33.33%(9 场被测 3 次夺冠),比 GLM-5.3 还高,其中祖传BUG挑战赛那场,就是在 GPT-6 最擅长的代码区完成的反杀。
  • Seed-2.0 pro 拿下囚徒困境:这个模型甚至没进总榜前九。多轮博弈、预判对手行为这种任务,跟跑分基本是两回事。
  • 挑战者区还挂着一排「被测很多次但还没开张」的名字:Kimi K3 被测 13 次、Grok 4.6 被测 11 次、MiniMax M3 被测 10 次,榜首次数都是 0。

五、开发者怎么用这个榜

三个实操判断:

1. 别按总榜选模型,按你的场景看单项。 总榜第一适合围观,单项第一才适合装进工具链。日常主活是写代码、修屎山,GPT-6 目前众测最强;但如果你做的是量化、知识密集或者长文本任务,先看对应赛道的冠军再掏钱。

2. 同一场景内也要看考法。 UP主Token就是词元那三场就是最好的例子:自由发挥类任务 GPT-6 强,统一评分的「考试型」任务就要另说。你的工作更像哪种,就重点看哪种。

3. 这个榜是活的,值得收藏。 UP主持续上新题,榜单实时刷新,今天的名次下周可能就变。与其等季度跑分报告,不如把这个页面收着按期看。

写在最后

跑分回答「谁跑得快」,这种民间大考回答「谁在你的场景里好用」。前者从来不缺,后者一直没人做,现在UP主们拿 100 多个模型、30 多种真实任务把它补上了。

留个问题:你日常干活的主力模型是哪个?有没有哪个模型「逆袭」或「翻车」的场景让你印象最深?评论区聊聊。

想看实时榜单的,打开小破站搜「AI竞技场」就能直达

(数据快照取自发布当日的实时榜单,榜单持续更新中,以页面最新数据为准。)


相关推荐
jimmyleeee1 小时前
大模型安全之十六:AI Security Posture Management
人工智能·安全
人工智能AI技术1 小时前
2026老后端转AI Agent:技术体检+完整复习路线
人工智能
七牛云行业应用1 小时前
2026 年 9 月 Coding Agent Harness 选型完整指南:30 个工具、SDK 与运行时
人工智能·agent·ai编程
梧桐凰1 小时前
AI 时代测试工程师的武器库:实战工具指南
人工智能·功能测试·测试用例
武子康1 小时前
小智服务端怎样组织 ASR、LLM、TTS?先追本次连接实际使用的对象
人工智能·llm·agent
猫哥随身wifi1 小时前
随身WiFi 怎么选?2026 主流品牌随身 WiFi 对比与选购避坑参考
网络·人工智能·5g·智能手机
ai_finder1 小时前
买卖点预警系统是怎么工作的?从自然语言到盯盘任务的一次工程拆解
人工智能·科技·microsoft·金融
老纪的技术唠嗑局1 小时前
GPT-6 Astra 发布,Codex 支持”近乎”无限上下文了?
人工智能
IT古董1 小时前
《FDE前沿部署工程师实战教程》15 - 企业Agent治理体系:模型、Prompt、Knowledge、Tool与版本管理
人工智能·agent·fde