Anthropic 正式发布 Fable 5.1:更强、更便宜,超越GPT-5.6 Sol

等了这么久,Anthropic 终于交出了新一代旗舰模型。

凌晨,Anthropic 正式发布 Claude Fable 5.1 和 Claude Mythos 5.1。

官方原话:世界上最先进的编码和知识工作模型。

从官方公布的数据看,Fable 5.1在智能体编程、电脑操作、业务流程、知识工作和长期任务上,全面超过上一代Fable 5。

Claude Fable 5.1 和 Claude Mythos 5.1,底层还是同一个模型。

两者的主要区别是安全限制和开放范围。

Fable 5.1 是面向普通用户、开发者和企业的公开版本,目前已经登陆 Claude 各个平台,也可以通过 API、AWS、Google Cloud 和 Microsoft Azure 使用。

Mythos 5.1 则是一个限制更少的专业版本,主要面向经过审核的网络安全人员和生命科学研究者。

普通用户目前能够接触到的,主要还是 Fable 5.1。

这次更新从我们最关心的点开始:能力、价格、稳定性、应用。

◈一、跑分:把 GPT-5.6 Sol 甩开一截

先看数据。

最能打的还是编码。Terminal-Bench 4.0(在真实终端环境里完成编码任务):

Fable 5.1 得分 55.8%,上一代 Fable 5 是 42.0%,GPT-5.6 Sol 只有 37.3%。

专业版 Mythos 5.1 更夸张, 飙到了60.9%,因为它的护栏更松,不被安全规则打断。

CursorBench 3.2.0(在 Cursor 里从零写完代码任务):

73.4%,比 Fable 5 的 70.5%、Opus 5 的 70.0%、GPT-5.6 Sol 的 67.2% 都高,是目前跑过这个测试的所有模型里最高的。

知识工作同样领先。GDPval-AA v2(模拟真实白领工作):

1853 分,比 GPT-5.6 Sol 的 1711 分高出一截。最难的综合考试 Humanity's Last Exam,带工具 65.0% 通过率,上一代是 63.8%。

还有一组数字值得单独看:科研场景 Terminal-Bench-Science 0.1,Fable 5.1 拿了 52.6%,直接是上一代 24.7% 的两倍多。

◈二、同样的活,便宜 25%

基础定价与 Fable 5 相同,每百万 Tokens,输入10美元、输出50美元。

真正大幅降价的是"缓存读取"。

缓存读取费用降低了 75% 。

缓存命中价格的下降使得 Fable 5.1 真正成为工作中的主力模型。

缓存读取是 agent 类工作的大头,模型反复读同一段上下文,读一次付一次钱,现在便宜了一大截。

同样的工作负载,总成本比 Fable 5 降约 25%;越是重上下文、重工具调用的活儿,省得越多,最多省 45%。

对天天跑 AI 编码的人来说,账单上将会明显可见。

企业客户还有个大礼包:新系统 Enterprise Frontier Safeguards(EFS),可以让数据存在客户自己的云基础设施里,而不是 Anthropic 的服务器上,达到零数据保留级别的隐私,同时防滥用检测照常工作。

官方说和 100 多家企业客户、亚马逊 AWS、谷歌云、微软 Azure 一起开发的,秋季起分阶段上线。在那之前,合格客户可以直接用零数据保留的 Fable 5.1。

以前企业担心对话数据会被 AI 公司看到,现在数据根本不过 Anthropic 的手。

◈三、长任务干得更久更稳

长任务中的稳定性进一步提升,也是这次更新的重点。

我们都知道短任务已经难不倒大模型了,真正拉开差距的:

目标不跑偏、进度记得住、做完了还会回头检查。

MongoDB 的工程师让它做一个复杂原型:它先翻遍相关服务的代码和文档,给出一个可扩展的设计,然后自己连续跑了好几个小时,实现、验证一把抓。

整个项目大约三天,工程师晚上下班,早上回来就看到 Claude 又完成了一个阶段,还附上可视化说明和验证结果。

Ramp 那边更狠:Fable 5.1 在没人看管的情况下连续跑了 38 小时,发现之前一个机器学习实验的结果其实被错误标签污染了,自己修正数据、又开了六组并行实验跑了一夜,最后带着结论和下一步计划回来。

和长任务能力一起升级的,还有它的业务范围。

Canva 的盲测里,它的文字比上一代更好懂、更贴写作要求;

Glean 测了知识问答、深度研究、内容起草这些活儿,测试者偏爱 5.1 答案的比例大约是上一代的两倍;

不过这些仍然是Anthropic公布的合作伙伴案例,具体的实测还是要看大家的使用效果。

◈四、更大的野心:模型开始参与科研

最值得看的其实是科研这块。

蛋白质设计测试里,Mythos 5.1 用开源的蛋白质设计工具给 12 个靶点设计结合剂,官方称有效率接近 50%(行业常见水平是 10%-15%),其中三个靶点的结合亲和力做到竞赛最佳设计的 10 倍,结果还送进外部实验室验证过。

Fable 5.1 则用 NASA 三十多年前的麦哲伦号雷达数据,训练神经网络做出金星三分之一表面的新地形图,分辨率从 10-20 公里提到 2-3 公里,高度精度也提升了。

还有 Mythos 5.1 给七个开源生物模型写了定制 GPU 内核,推理最高提速 2.5 倍、输出完全不变。

全基因组分析这类任务 GPU 成本估计能降 30%-60%。

这种事平时要性能工程师团队干几周,它几天就搞定了。

◈五、能力越强,Anthropic 管得反而越细

8 月,OpenAI 因为模型在安全评估中触到最高风险等级、还发生过逃出测试环境的事故,官宣暂停了最强模型的训练;

Anthropic 自己上个月也披露过类似的评测事故,并在昨天发文复盘。

模型越来越强,安全就成为所有头部公司的难题。

这次 Anthropic 主要做了三件事。

第一,让模型护栏更懂事。网络安全场景的误报减少 60%,生物学的良性请求误报降了 85%。

以前动不动拦错正常请求的毛病改了不少,正常问医、做防御性安全工作的用户不会再被误伤。

第二,能力边界划得很清楚。Fable 5.1 现在可以帮着发现软件漏洞,但生成漏洞利用、渗透测试这类活仍然被限制;

更强的网络安全和生命科学能力,只通过审核制开放给专家(也就是开头说的 Mythos 5.1),普通用户碰不到。

第三,防滥用加了码。新 API 账号不能手动编辑模型之前的对话,同时按欧盟 AI 法案要求,模型输出都加了不可见水印。

◈最后

8月中下旬,外界一直在猜,Anthropic 和 OpenAI 谁会先发布下一代旗舰模型。

现在,Anthropic 率先把 Fable 5.1 交了出来,下一步就看 OpenAI 会不会很快跟进。

不过还有好的消息:就在官方发布新模型后不久,Anthropic 还重置了所有用户的5小时和每周使用额度。

等了这么久,Fable 5.1 终于落地,额度也回满了,家人们快去蹬起来!

相关推荐
jianqiang.xue2 小时前
ESP-IDF保姆级入门22|WiFi联网与网络编程全解:STA/AP双模式/TCP-UDP Socket/HTTP服务端/自动重连,掌握工业级可靠网络通信
人工智能·stm32·单片机·mcu·物联网·51单片机·iot
zzzzzz3102 小时前
picoclaw:从“迷你部署代理”看轻量化项目该怎样被理解
人工智能·开源·github
BYSJMG4 小时前
计算机毕设选题做什么好?基于大数据的用户健身行为数据分析与可视化系统,Hadoop+Spark处理
大数据·人工智能·hadoop·数据分析·spark·课程设计
知见漫记8 小时前
AI 桌面 Agent 本地执行能力技术对照:沙箱机制与权限模式拆解
大数据·人工智能
数商云企9 小时前
2026年陕西软件开发首选数商云企AI微入口小程序定制方案
人工智能·小程序
吴佳浩9 小时前
FDE:从系统落地工程师,演变为企业 AI 能力的知识架构师
人工智能·llm·ai编程
吴佳浩9 小时前
从 OpenClaw、Codex 到 Hermes,看懂 AI Agent 架构为什么正在收敛
人工智能·llm·agent
hanbon9 小时前
标书制作流程与技巧:从读标到装订
人工智能·招投标·ai写标书·技术标
知识分享小能手9 小时前
深度学习学习教程,从入门到精通,深度学习中的正则化 — 完整知识点与代码示例(7)
人工智能·深度学习·学习