北京时间 7 月 25 日凌晨,Anthropic 正式发布了 Claude Opus 5。

图源:Anthropic 官方发布

图源:Anthropic 官方发布
现在 Claude.ai 和 Claude Code 都已经能用了。Claude Max 直接把它设成了默认模型,Claude Pro 也能用上目前最强的 Opus。

图源:Claude.ai
官网文章和 System Card 我大概扫了一遍,benchmark 一张接一张,看得人眼花。
但最后大家只要记住一件事情就好了。
Claude Opus 5 的能力接近 Fable 5 ,但价格只要一半。
小马拉大车了属于是。

图源:Anthropic 官方发布
Opus 5 的 API 价格是每百万输入 Token 5 美元、输出 Token 25 美元,和 Opus 4.8 完全一样。
Fable 5 是 10 美元和 50 美元。刚好贵一倍。
价格砍半,能力到底留下了多少?
在 CursorBench 3.2 上,Opus 5 开到 max effort 后,距离 Fable 5 的峰值不到 0.5%,每个任务的成本只有一半。

图源:Anthropic 官方发布
Frontier-Bench v0.1 更夸张。Opus 5 在更低的单任务成本下,成绩超过 Opus 4.8 两倍。

图源:Anthropic 官方发布
知识性的工作也差不多。
ARC-AGI 3 测的是模型面对新问题时的解题能力,Opus 5 的得分是第二名的三倍。

图源:Anthropic 官方发布
Zapier 的 AutomationBench 测的是模型能不能从头到尾把业务任务做完。同样的任务成本下,Opus 5 的通过率大约是第二名的 1.5 倍。哪怕只开最低 effort,它完成的任务也比其他模型多。

图源:Anthropic 官方发布
在 OSWorld 2.0 上,Opus 5 也压过了其他模型。它用略高于 Fable 5 三分之一的成本,超过了 Fable 5 的最好成绩。

图源:Anthropic 官方发布
当然,这些大多是官方评测,Frontier-Bench 还是 Anthropic 的内部测试。放进真实项目里到底如何,还得实际用起来,或者看看大家的测评,或者看看其他厂商的压力便知。
这次 Opus 5 有一个地方我还挺喜欢的,它会自己想办法验证结果。
官方给了几个例子。
-
Frontier-Bench 让它根据一张机械零件图,写代码重建 3D FreeCAD 模型。偏偏评测环境又没给它直接看图的工具。Opus 5 自己写了一套计算机视觉流程,从原始像素里提取几何形状,然后把零件重建出来。相同设置下,它连续做成了,其他模型试了五次都没解出来。
-
还有一个开源包管理器的真实 Bug。社区补丁漏掉了一个边界情况,Opus 5 找到根本原因后顺手补上了。另一个模型只修了表面,然后就说问题已经解决了。
-
另一个例子来自一家交易公司。工程师让它给新交易所做市场数据源,现场又没有实时数据可供验证。Opus 5 干脆自己搭了测试框架,检查代码有没有正确解析交易所数据。
现在模型跑长时任务已经不稀奇了,怕就怕它写完之后一拍屁股告诉你:任务完成了,或者出现幻觉,或者随便做了做就敷衍了事儿的交差。
不过 Opus 5 这次给我的感觉,是它知道怎么给自己擦屁股。
而且 Anthropic 在最新的提示词文档里专门说了,以前给旧模型加的最后再验证一次,或者找个 SubAgent 复查之类的提示,可以直接删掉。
因为 Opus 5 自己就会检查,再写一遍,它可能会自己查起来没完了。。。
官方这次还放了两个视觉 Demo,做的都不错。
第一个是能操作的风洞。可以调风速、转动车身,看气流怎么绕过不同物体。

图源:Anthropic 官方演示
第二个是 3D 交互式动物细胞。点不同结构,右边会给出解释,还能切开看内部。

图源:Anthropic 官方演示
这俩 Demo 都能直接交互,完成度还是挺高的。
前段时间大家都在卷前端,Opus 5 这次也跟上了。
然后是价格之外的一些参数。
Opus 5 的上下文窗口是 1M Token,最大输出 128k Token。thinking 默认开启,effort 从 low、medium、high、xhigh 一直到 max。
普通任务用 low 和 medium 就行,难题再上 xhigh 或 max。
它还提供 Fast mode,速度大约是默认模式的 2.5 倍,价格也正好翻倍。
2.5 倍的速度听起来很爽,双倍价格也是真的贵。
开发者通过 API 调用时,模型名就是 claude-opus-5。

图源:Anthropic 官方发布
Claude Code 负责人 Boris Cherny 也专门提了一句:Opus 5 是目前最不容易被提示词注入所影响的 Claude 模型。

图源:Boris Cherny
还有网友把 Opus 5、Fable 5、GPT-5.6 和 Kimi 3 放在一起跑了个视觉效果对比。
从这张图看,Opus 5 的效果是最逼真的。当然这就是网友的一次测试,大家看个乐呵就行。

图源:网友测试
安全这块 A 社也提到了。
在自动行为审计里,Opus 5 的 misaligned behavior 得分是 2.3,是最近几款 Claude 模型里最低的。
简单来说,这版 Opus 更守规矩了,欺骗行为更少,也更不容易被诱导去做高风险操作。

图源:Anthropic 官方发布

图源:Anthropic 官方发布
网络安全方面,Anthropic 明确说他们没有专门拿相关任务训练 Opus 5。
不过 Opus 5 找漏洞的能力已经接近 Mythos 5 了。但真到了找开发漏洞,或者把漏洞做成攻击利用这一步,差距还很大。

图源:Anthropic 官方发布
反正模型已经上线了,吹再多也没用,我在考虑要不要重新搞一下 Claude Code 试试看了。
Fable 5 发布才一个多月,A 社就弄了个半价的 Opus 5 出来,还直接塞进 Claude Max 当默认模型。
现在压力来到了 OpenAI 这边。
话说 GPT-5.6 Sol 要不要也来个重置?
义父 Tibo ,你在哪呢?
资料来源: