实测GPT-5.6,跑分赢了,却输给了Fable 5

预热了这么久的GPT-5.6,终于全量开放了。

OpenAI凌晨一点开直播,宣告GPT-5.6开始在ChatGPT、Codex、API全球滚动上线,24小时内逐步全量。

这场发布大家等了不是一天两天,社区的期待值早就拉满了。

Anthropic也一直盯着呢,GPT刚发没多久,A社直接宣布重置所有用户的 5 小时和每周token用量限制。

说来也巧,我昨晚刚把Fable 5的额度跑干,正搁那儿熬夜蹲5.6呢,结果对面突然把额度全还回来了------好家伙,这不就是冲着新模型来的么。

贴脸开大,自己比比看,谁怕谁啊!

真的太横了,那我们也不绕弯子,今天就聊聊------

GPT-5.6、Claude Fable 5 孰强弱。

◈OpenAI:赢了,还便宜一半

先看官方的说法。

发布会上的图,GPT-5.6 Sol全面领先:Terminal-Bench 2.1领先Claude Mythos 5约 4 个点,Agents' Last Exam直接甩开Fable 5十几个点。

最狠的是DeepSWE 1.1,Sol分数最高,单任务成本约8美元,不到Fable 5的一半。

不过吧,官方的图听听就好------每一场发布会,官方都是赢的。

还有两个更值得看的角度。

一是纵向对比自己:OpenAI 自家的AGI Index上,5.5是43%,5.6 Sol直接跳到60%,比5.3→5.4→5.5每次几个点的挤牙膏大得多。

二是横向看第三方,Artificial Analysis 的首批数据当天就出来了。

智能榜(Intelligence Index v4.1)上,Fable 5依然是60分的榜一,GPT-5.6 Sol 以59分贴脸追平,只差1分。

成本这边,按 AA 的口径,单个Index任务Sol (max) 花1.04 美元,比Fable 5 (with fallback)便宜一大半。

Coding Agent榜上,Codex + Sol 以80分登顶,击败Claude Code + Fable 5的77分。

怪不得 Anthropic 连夜送额度,这确实是打到家门口了。

◈我的体感:日常还行,但花钱太猛

跑分之外说点实在的,我昨晚拿它干了几个小时活。

背景是这样:我之前用Fable 5升级过一个项目,上线后真实用户评价挺不错。

做那个项目的过程中,Fable 5给我的感受是特别能理解我------我说个大概,它就能举一反三,很多没明说的意图它自己就补上了。

这次实测,我重置了Codex的额度,专门把那个项目丢给GPT-5.6接着干。

活儿不算复杂------

实测一下新模型的价格,然后把新模型上线到我的线上服务。

结果跑了没一会儿,我就感觉不对劲。它有点笨,方法还特别死板,每走一步都要停下来核对半天。

就这么个活儿,它足足跑了一个多小时。。

同样的活儿,Fable 5大概十分钟就干完了,而且非常完美。

可能差的那口气在上下文吧------虽然模型自己梳理过一遍,但它对项目的来龙去脉吃得没那么透。

但换到日常任务。查东西、跑循环,它又非常顺,快、稳、不废话。

另外有个不吐不快的------额度掉得是真快。

我测之前特意重置了额度,20倍的Pro,就跑了「调研GPT5.6社区风评」、「梳理上述那个项目」这俩任务,眼看着消耗了80%的5小时使用限制。。

官方吹的「单任务成本减半」,我是不相信的。

所以我目前的结论是------

  1. 通用任务,5.6 完全能打;

  2. 深度项目协作,至少首日体感还没到Fable 5的流畅度;

  3. 额度消耗太快了。

当然这只是一个人的一晚上,不算数,这几天我会去社区把大家的体感收一圈,深度实测后再跟大家分享。

◈这次真正的新信息,其实就四条

模型之外,发布会的信息量大部分是预热期发过的旧闻了。

过滤下来,真正的新东西是三条。

  1. Codex改名ChatGPT Work。定位是给不写代码的人用的Agent工作台,主要功能与之前大致相同,前端UI有小幅优化。
  1. 桌面App大一统。新版ChatGPT桌面App全球上线,Chat/Work/Codex/Scheduled/Sites五个入口合体,成为独立的Codex App并入,老App改名ChatGPT Classic。
  1. GPT-5.4将于7月23日下线(仅剩的低价大杯模型啊!),从发布到退役不到半年。
  1. Sites:聊天里直接发网站。你的工作成果可以直接变成可交互的网站,一个URL分享出去,从干活到交付上线一条龙。

最后讲个好玩的。

此前GPT 5.5张口闭口的哥布林口癖,这次OpenAI官方给收了。

他们在发布会上放了张统计图------词频从 0.405% 降到 0.032%,柱子上还趴着一只官方画的小妖精。。。

好了,以上就是今天全部内容啦,你用的5.6体感如何?

评论区一起聊聊呀~

相关推荐
周末程序猿3 分钟前
LLM智能路由实践:通过 Harness 工程节约模型成本
人工智能·agent
冬奇Lab6 分钟前
代码库知识库系列(04):三种 Chunking 策略对比——AST 精确分割反而输了?
人工智能
宋哥转AI40 分钟前
深入理解 AI Agent 02|混合检索与重排序实战:BM25、RRF 与 Cross-Encoder 的工程实践
人工智能
LaughingZhu44 分钟前
Product Hunt 每日热榜 | 2026-08-01
人工智能·深度学习·神经网络·搜索引擎·百度
小燕子~~1 小时前
PS 怎么调整图片尺寸?4 种方法避免拉伸变形与放大失真
图像处理·人工智能·ai·aigc·photoshop
小K讲AI营销1 小时前
AI 链定价逻辑切换:用“估值透支“框架重估一个月跌三成
人工智能
龙山云仓1 小时前
八一亮剑 · 造化进行时(AI-类人)
人工智能
小赵AI手记2 小时前
技术拆解(十五)具身智能:RT-2为什么能听懂“灭绝动物”?VLM知识如何变成动作
人工智能·机器人
就是一顿骚操作2 小时前
全球 AI 大事件新闻汇总 2026-08-01
大数据·人工智能
阿童木写作2 小时前
Python实现亚马逊商品图批量智能抠图教程
人工智能·python