等了这么久,Anthropic 终于交出了新一代旗舰模型。
凌晨,Anthropic 正式发布 Claude Fable 5.1 和 Claude Mythos 5.1。
官方原话:世界上最先进的编码和知识工作模型。

从官方公布的数据看,Fable 5.1在智能体编程、电脑操作、业务流程、知识工作和长期任务上,全面超过上一代Fable 5。

Claude Fable 5.1 和 Claude Mythos 5.1,底层还是同一个模型。
两者的主要区别是安全限制和开放范围。
Fable 5.1 是面向普通用户、开发者和企业的公开版本,目前已经登陆 Claude 各个平台,也可以通过 API、AWS、Google Cloud 和 Microsoft Azure 使用。
Mythos 5.1 则是一个限制更少的专业版本,主要面向经过审核的网络安全人员和生命科学研究者。
普通用户目前能够接触到的,主要还是 Fable 5.1。

这次更新从我们最关心的点开始:能力、价格、稳定性、应用。
◈一、跑分:把 GPT-5.6 Sol 甩开一截
先看数据。
最能打的还是编码。Terminal-Bench 4.0(在真实终端环境里完成编码任务):
Fable 5.1 得分 55.8%,上一代 Fable 5 是 42.0%,GPT-5.6 Sol 只有 37.3%。

专业版 Mythos 5.1 更夸张, 飙到了60.9%,因为它的护栏更松,不被安全规则打断。
CursorBench 3.2.0(在 Cursor 里从零写完代码任务):
73.4%,比 Fable 5 的 70.5%、Opus 5 的 70.0%、GPT-5.6 Sol 的 67.2% 都高,是目前跑过这个测试的所有模型里最高的。

知识工作同样领先。GDPval-AA v2(模拟真实白领工作):
1853 分,比 GPT-5.6 Sol 的 1711 分高出一截。最难的综合考试 Humanity's Last Exam,带工具 65.0% 通过率,上一代是 63.8%。

还有一组数字值得单独看:科研场景 Terminal-Bench-Science 0.1,Fable 5.1 拿了 52.6%,直接是上一代 24.7% 的两倍多。
◈二、同样的活,便宜 25%
基础定价与 Fable 5 相同,每百万 Tokens,输入10美元、输出50美元。

真正大幅降价的是"缓存读取"。
缓存读取费用降低了 75% 。
缓存命中价格的下降使得 Fable 5.1 真正成为工作中的主力模型。

缓存读取是 agent 类工作的大头,模型反复读同一段上下文,读一次付一次钱,现在便宜了一大截。
同样的工作负载,总成本比 Fable 5 降约 25%;越是重上下文、重工具调用的活儿,省得越多,最多省 45%。
对天天跑 AI 编码的人来说,账单上将会明显可见。
企业客户还有个大礼包:新系统 Enterprise Frontier Safeguards(EFS),可以让数据存在客户自己的云基础设施里,而不是 Anthropic 的服务器上,达到零数据保留级别的隐私,同时防滥用检测照常工作。

官方说和 100 多家企业客户、亚马逊 AWS、谷歌云、微软 Azure 一起开发的,秋季起分阶段上线。在那之前,合格客户可以直接用零数据保留的 Fable 5.1。
以前企业担心对话数据会被 AI 公司看到,现在数据根本不过 Anthropic 的手。
◈三、长任务干得更久更稳
长任务中的稳定性进一步提升,也是这次更新的重点。
我们都知道短任务已经难不倒大模型了,真正拉开差距的:
目标不跑偏、进度记得住、做完了还会回头检查。
MongoDB 的工程师让它做一个复杂原型:它先翻遍相关服务的代码和文档,给出一个可扩展的设计,然后自己连续跑了好几个小时,实现、验证一把抓。

整个项目大约三天,工程师晚上下班,早上回来就看到 Claude 又完成了一个阶段,还附上可视化说明和验证结果。
Ramp 那边更狠:Fable 5.1 在没人看管的情况下连续跑了 38 小时,发现之前一个机器学习实验的结果其实被错误标签污染了,自己修正数据、又开了六组并行实验跑了一夜,最后带着结论和下一步计划回来。

和长任务能力一起升级的,还有它的业务范围。
Canva 的盲测里,它的文字比上一代更好懂、更贴写作要求;

Glean 测了知识问答、深度研究、内容起草这些活儿,测试者偏爱 5.1 答案的比例大约是上一代的两倍;

不过这些仍然是Anthropic公布的合作伙伴案例,具体的实测还是要看大家的使用效果。
◈四、更大的野心:模型开始参与科研
最值得看的其实是科研这块。
蛋白质设计测试里,Mythos 5.1 用开源的蛋白质设计工具给 12 个靶点设计结合剂,官方称有效率接近 50%(行业常见水平是 10%-15%),其中三个靶点的结合亲和力做到竞赛最佳设计的 10 倍,结果还送进外部实验室验证过。

Fable 5.1 则用 NASA 三十多年前的麦哲伦号雷达数据,训练神经网络做出金星三分之一表面的新地形图,分辨率从 10-20 公里提到 2-3 公里,高度精度也提升了。

还有 Mythos 5.1 给七个开源生物模型写了定制 GPU 内核,推理最高提速 2.5 倍、输出完全不变。

全基因组分析这类任务 GPU 成本估计能降 30%-60%。
这种事平时要性能工程师团队干几周,它几天就搞定了。
◈五、能力越强,Anthropic 管得反而越细
8 月,OpenAI 因为模型在安全评估中触到最高风险等级、还发生过逃出测试环境的事故,官宣暂停了最强模型的训练;
Anthropic 自己上个月也披露过类似的评测事故,并在昨天发文复盘。

模型越来越强,安全就成为所有头部公司的难题。
这次 Anthropic 主要做了三件事。
第一,让模型护栏更懂事。网络安全场景的误报减少 60%,生物学的良性请求误报降了 85%。
以前动不动拦错正常请求的毛病改了不少,正常问医、做防御性安全工作的用户不会再被误伤。
第二,能力边界划得很清楚。Fable 5.1 现在可以帮着发现软件漏洞,但生成漏洞利用、渗透测试这类活仍然被限制;
更强的网络安全和生命科学能力,只通过审核制开放给专家(也就是开头说的 Mythos 5.1),普通用户碰不到。
第三,防滥用加了码。新 API 账号不能手动编辑模型之前的对话,同时按欧盟 AI 法案要求,模型输出都加了不可见水印。
◈最后
8月中下旬,外界一直在猜,Anthropic 和 OpenAI 谁会先发布下一代旗舰模型。
现在,Anthropic 率先把 Fable 5.1 交了出来,下一步就看 OpenAI 会不会很快跟进。
不过还有好的消息:就在官方发布新模型后不久,Anthropic 还重置了所有用户的5小时和每周使用额度。
等了这么久,Fable 5.1 终于落地,额度也回满了,家人们快去蹬起来!