今天早上看到 Claude Opus 5 发布,我感觉Claude 这个账号,确实该续上了。
大家好,我是子昕,一个干了10年的 Java 后端。
我上一次真正深度使用 Claude,还是 Opus 4.7。后面的 Opus 4.8、Fable 5,包括今天刚发布的 Opus 5,我都没有放进真实项目里认真跑过。
说出来其实有点尴尬。
我一边在做 AI 编程自媒体,一边看着 Claude 接连发布 Opus 4.8、Fable 5 和 Opus 5,Fable 5 甚至被很多人称为目前最强的模型,但我对它们的了解,主要还是来自官方资料、榜单和别人的评测。
榜单我能看,参数我也能整理,可这跟自己真正用过是两回事。别人已经在拿 Fable 5、Opus 5 跑真实项目,我还在外面看热闹,这事确实有点说不过去了。
为什么我一直没有续 Claude
原因很简单,公司给我们提供了 Codex。
我现在工作中接近100%的 AI 编程任务,用的都是 GPT-5.6 Sol。真实的 Java 后端需求、复杂调用链排查、代码修改、问题定位,GPT-5.6 已经足够强,而且公司提供额度,我没有理由放着不用,再自己花钱养一套 Claude。
所以看到 Opus 5 发布,我并没有产生什么"GPT 不能用了""工作要全部切到 Claude"的焦虑。
就算 Opus 5 在部分任务上更强,这一点差距也不会让我的后端工作突然发生翻天覆地的变化。公司项目里,GPT-5.6 依然会是我的主力。
真正让我越来越想续回 Claude 的,是工作之外的另外两件事。
第一件是写作。
GPT-5.6 写代码很强,但写文章,我是真的经常不满意。最明显的问题就是人味太差,AI 味和机构腔太重。
不管怎么强调真实、个人感和口语化,它写着写着还是会回到熟悉的模板里,每句话都很正确,连在一起就是不像一个真人在说话。
到目前为止,我依然觉得 Opus 4.6 是写作最好的模型。这个判断就是我自己长期写文章时最直接的感受。
第二件是我最近正在探索 AI 出海。
我还处在找方向、验证关键词、做 MVP 的阶段,已经上线了两个练手网站。实话实说,目前基本都没有流量,就是我拿来学习和验证想法的产品。
功能上,GPT-5.6 可以把网站做出来。但到了产品落地页和前端设计,它的审美经常达不到我愿意直接上线的标准。
有些第一版不能说功能不能用,但那个 UI 真的就是一坨屎,我自己都不愿意把它发到线上。
我试过把别人做得特别好的产品页直接发给它,让它照着复刻。
参考已经摆在面前了,最后做出来还是差着一截。布局能对上,组件也都有,但整体气质、留白、层级和细节就是不对。
为了改善这个问题,我还在网上找了不少提升前端效果的 Skills。用了以后确实会好一点,但离我真正满意依然有距离。
这也是我为什么一直惦记 Claude。Opus 4.6、4.7 的时候,我亲自拿 Claude 和 GPT 做过前端对比,Claude 确实更稳。现在做个人产品,这部分能力我又需要了。
Opus 5这次到底强在哪
先搞清楚 Anthropic 对 Opus 5 的定位:接近 Fable 5 的前沿能力,但价格只有一半。
API 输入价格是每百万 Token 5 美元,输出25美元,和 Opus 4.8 保持一致;Fable 5 是输入10美元、输出50美元。GPT-5.6 Sol 则是输入5美元、输出30美元。
也就是说,Opus 5 的输入价格和 GPT-5.6 Sol 一样,输出还便宜5美元;和 Fable 5 相比,输入、输出都是正好一半。
在 Claude 聊天里,Opus 5 对所有付费计划都支持100万 Token 上下文;放到 Claude Code 里也支持100万,但 Pro 用户需要开启 usage credits。
它还有一个 Fast Mode,速度大约提升到2.5倍,代价是价格也翻倍。需要快速出结果时可以开,但日常一直挂着跑,额度肯定也扛不住。
能力上,这次最明显的提升是更会把事情做完。

这张综合评测表更能说明 Opus 5 现在的位置。
Frontier-Bench 上,Opus 5 是43.3%,Fable 5 是33.7%;
AutomationBench 是26.0%对17.4%;
OSWorld 是70.6%对66.1%。
但它也不是每项都赢:DeepSWE 上 GPT-5.6 Sol 最高,FrontierCode 上 Fable 5 只领先0.1%。
所以更准确的说法不是"Opus 5 全面超过谁",而是它已经在很多真实任务上进入第一梯队,而且各有胜负。
官方放出的案例里,有一个细节我很在意:Opus 5 修开源软件的 Bug,不只修掉表面报错,还找到了社区原补丁遗漏的边界问题。另一个模型只把症状压下去,就告诉用户已经修好了。
这正好对应我平常最看重的能力。
后端开发真正麻烦的从来不是写一个函数,而是顺着调用链找到根因,知道一个改动会影响哪些模块,方案有没有漏掉并发、数据量和后续扩展。老系统撑不住新业务时,也不是改几行代码,而是要重新审视架构,再决定怎么改造。
Opus 5 这次重点提升的判断、验证、根因分析和长任务执行,确实很对我的胃口。
前端也是一样。
Anthropic 这次专门强调了 Opus 5 的视觉输出,早期测试里有人提到,它会自己打开页面,在桌面和手机尺寸下检查,发现内容掉到首屏外、按钮跑出屏幕以后再修掉。
OpenAI 也说 GPT-5.6 的设计判断有明显提升,但至少在我已经上线的两个网站里,这个提升还没有达到我的标准。Opus 5 能不能解决我现在做落地页时的审美问题,我得自己跑过才知道。
Opus 5、Fable 5和GPT-5.6怎么选
先看一个粗略位置。Artificial Analysis 的综合指数里,Opus 5、Fable 5、GPT-5.6 Sol 分别是61、60、59分,三者最大只差2分,基本已经站在同一梯队。

这张图说明 Opus 5 已经逼近顶级模型,但它不能直接替我们做选择,因为综合分会把具体场景、价格和额度都压平。
Fable 5 在 Anthropic 的产品层级里仍然高于 Opus,面向最难、最长、可以持续几天的研究、编程和异步 Agent 任务。不过产品层级更高,不等于每一项评测都稳赢;至少在这张综合榜单里,Opus 5 还领先1分。
在 API 里,Fable 5 是 Opus 5 的两倍价格。订阅里也不是所有人都能随便用:Max 用户最多可以把每周额度的50%用在 Fable 5 上,Pro 用户则要从一开始使用额外的 usage credits。
Opus 5 更像日常真正拿来干活的主力。它是 Claude Pro 能直接使用的最强模型,也是 Max 的默认模型。编程、Agent、电脑操作、根因排查、代码审查都已经逼近 Fable 5,价格和额度却舒服得多。
GPT-5.6 Sol 依然是非常强的工程模型。
OpenAI 自己公布的数据里,它在 Coding Agent、DeepSWE 和 Terminal-Bench 这些编程评测上仍然处于第一梯队,有些成绩还超过 Fable 5。对大型代码库、复杂后端任务和长时间工程执行,我自己的实际使用也证明了它足够可靠。
从评审角度看,我现在对三者的预期也不一样。
GPT-5.6 更适合顺着真实工程链路往下追,然后把代码改完;Opus 5 这次强调的是判断、根因分析和交付前验证;Fable 5 则把能力上限放在最难、最长、需要反复推翻错误判断的任务上。
只有第一条是我长期使用后的体感,后两条还要等我自己验证。
额度也不能只看 API 单价。Codex Plus 使用 GPT-5.6 Sol 时,官方给出的范围是每5小时大约15到90条本地消息,任务越复杂、上下文越长,消耗越快,另外还可能有周限制。
OpenAI 目前还提供 Pro 5x 和20x档。Claude 同样有5小时窗口和周额度,所以真正选模型时,公司有没有提供账号、自己用什么套餐,往往比每百万 Token 差几美元更现实。
所以这三者不是简单的第一、第二、第三。
如果主要做公司里的后端开发,尤其已经有 Codex 额度,GPT-5.6 Sol 没必要换掉。
如果是个人开发者,要做完整产品、前端页面、设计还原,又希望兼顾复杂代码和 Agent 执行,Opus 5 可能是现在最值得认真看的模型。
如果遇到特别难的架构设计、超长任务或者其他模型始终解决不了的问题,而且不太在意价格,再考虑 Fable 5。
至于我自己的安排,已经比较明确了。
公司的后端项目继续优先用 GPT-5.6。Claude 主要用在我自己的出海产品、前端设计和公众号写作上;公司项目里遇到复杂方案,也可以让 Claude 做一次独立审查,和 GPT-5.6 互相验证。等 GPT-5.6 额度用完,Claude 也能接着干活。
今天这篇不是 Opus 5 实测,我也不会装成已经用过以后给它下结论。
但看到 Opus 5 把能力推到接近 Fable 5,价格又压回 Opus 这一档,我确实觉得,继续站在外面看已经不太合适了。
Claude 这个账号,我准备重新续上。
后面我会把 Opus 5、Fable 5 真正放进自己的 Java 项目、架构方案和个人产品里使用。什么时候能形成值得写的结论,真用出东西了,再和大家聊。
至少下一次再说哪个 Claude 最强时,我希望这个判断不只是来自榜单。
如果这篇对你有帮助,欢迎关注「子昕AI编程」,也顺手点个赞、在看,或者转发给同样在折腾 AI 编程工具的朋友。