Claude Fable 5.1 发布,一个模型两种安全档,账单最多省 45%

北京时间 9 月 2 日凌晨两点多,我躺在床上正准备睡,手一滑刷到了 Anthropic 的发布帖,一口气两个名字,Claude Fable 5.1 和 Claude Mythos 5.1。

官方的定语不长,编码和知识工作领域最先进的模型。说实话这种话这两年我见得太多了,本来打算扫一眼就去睡。

结果往官方公告里没翻几行,我人就坐起来了。

这两个模型,是同一个模型。

就是字面意思的同一个。Fable 5.1 和 Mythos 5.1 共用同一套权重,差别全在安全层上。Fable 5.1 走大众路线,Claude 应用、Claude Code、API、各家云平台,全量开放。Mythos 5.1 走审核制,只给 Project Glasswing 计划里通过审核的组织,具体分两条通道,网络安全的 CVP,和跟美国政府一起建的生命科学 LSVP,初期只限美国组织,顺便它还是 Claude Security 背后的模型。

懒得看字的,宝玉做了一分半钟的介绍视频,看完再回来接着聊。

这套玩法其实不是 5.1 才发明的。6 月的 Fable 5 和 Mythos 5 就是同一个底模配两种访问层级,5.1 等于把它跑成了常规迭代。但每次看到我还是会觉得有点意思,权重不动,靠安全层区分受众,安全侧的能力升级不用重训就能跟进。

代价也摆在那里,安全层本身,是吃性能的。

这个看分数的时候会撞见一个特别妙的细节,先卖个关子。

先看分数。

最猛的是 Terminal-Bench-Science 0.1,从 24.7 涨到 52.6,翻倍还多。这个基准考察的是在终端里干科学研究的活,装环境、跑实验、处理数据。这一项参赛选手全体趴着,Opus 5 是 29.0,GPT-5.6 Sol 是 22.4,Fable 5.1 一个比另外俩加起来还高。官方给它的定位也写得明白,「面向长时间运行的智能体编码、知识工作与研究」,主打的就是这个。

AutomationBench 从 17.1 到 31.4,也接近翻倍,方向一致。GDPval、OSWorld、CursorBench 这些也都涨,只是没这么夸张,官方原图放在上面了,感兴趣可以自己对着看。

然后,就是刚才卖的那个关子。

Terminal-Bench 4.0 上,Mythos 5.1 拿了 60.9,比 Fable 5.1 的 55.8 还高。

???

两个版本共用同一套权重,防护更少的那版反而多考了五分。官方解释得很直白,Fable 版的网络安全防护会提前介入,拦掉一部分动作,差距来自这里,他们还预计随着防护更新,差距会缩小。

你想想看这件事的含义。安全层有性能税,行业里大家心照不宣,但从来没人把账摊开过。这次同一套权重、同一个基准、同一篇发布文,差的这五分就是那层防护的价格,明码标价。

我还是挺佩服这个坦诚的。

官方的分数看完了,再看第三方的。评测机构 Artificial Analysis 参与了 Fable 5.1 的发布前评测,max 努力档下,它在对方的智能指数拿到 66,登顶。

不过同一条帖子里还压着半句实话,这个放到聊钱的时候说。

分数聊完,聊钱。

定价没变, 10/MTok输入、10/MTok 输入、 10/MTok输入、50/MTok 输出,和 Fable 5 一模一样。降价藏在缓存里,缓存读取从 0.1 倍输入价砍到 0.025 倍,$0.25/MTok,官方口径整体降 75%。

为啥这笔账对智能体用户特别大?长任务的会话动辄几十轮,每一轮都要重读一遍前面的上下文,缓存命中越高,重读的部分就越便宜。落到实际负载上,官方说常规任务整体便宜约 25%,高度智能体化的任务最高便宜约 45%。

第三方口径可以对照着看。Artificial Analysis 测下来,max 档的单任务成本反而比 Fable 5 高 20%,缓存那 75% 的降价,没兜住思考变多的开销。省钱是真的,前提是你的任务吃得下低 effort 和缓存命中,这也是后面 Thariq 那条建议值钱的地方。

The Verge 的报道点破了背景,Anthropic 在回应客户的三重批评,价格、数据保留、过度安全限制。这次三件事都接了招,价格靠缓存降价,安全靠降误报,网络安全防护的误报介入少了约 60%,生物安全防护在良性医学问题上的触发少了 85%,Fable 5.1 可以找到漏洞但不写利用代码。数据保留给了个叫 EFS 的方案,今年秋天分阶段推出,数据留在客户自己的云上。

模型行为也有三处变化,来自 Claude Devs 的发布帖。长任务里能更久地自主推进,更善于主动报告自己卡住了,写作风格更自然。

卡住会喊人这件事,我想单独说说。以前的模型卡住了容易硬编,硬着头皮给你编一个,现在会喊人。对无人值守的智能体来说,这是止损能力,跑废 38 小时和跑成 38 小时,中间差的往往就是这一下。

官方公告里最像论文的,是三个真实案例。

我按离谱程度排个序,纯属个人趣味。

先是省钱。它给七个开源生物学模型写了 GPU 内核,最高加速 2.5 倍,基因组分析的 GPU 成本降了 30 到 60 个百分点。写 GPU 内核这个活,属于工程师看了会沉默的那种。

然后是蛋白设计。设计的结合剂在 12 个靶点上命中率约 50%,行业常见水平是 10 到 15 个百分点。在 EGFR、尼帕病毒 G 蛋白、15-PGDH 三个靶点上,亲和力比 Adaptyv Bio 竞赛的最优解高约 10 倍。

最离谱的是,它给金星画了张新地图。用麦哲伦号的雷达数据重建高程图,分辨率 2 到 3 公里,此前的公开数据是 10 到 20 公里,高程精度最高提升 25%,以 CC 协议公开发布。

一张另一颗行星的新地图,CC 协议,谁都能用。

客户的反馈也挑几条。Millennium 的人说,一个多年没人解释得了的百万分之一概率崩溃,Fable 5.1 第一个找到了,一路追到第三方库的缺陷上。这段在 Hacker News 上还有人接话,网友 jumploops 的评论说,不管你怎么看 LLM 生成的代码,这样的故事让他相信软件再也不会像从前那样漏洞百出了。Ramp 的 38 小时无人值守,前面说过了。Cognition 的 Walden Yan 更直接,Devin 里的 Opus 5 流量发布当天就切过来。Browserbase 给了个数字,10 分钟左右完成的任务占比 82%,Opus 5 是 74%,Fable 5 是 57%。

客户的反馈之外,民间也已经玩起来了。网友 Mia 做了个狠实验,一条 prompt 让 Fable 5.1 造 100 个 HTML 文件,规则就三条,好看、零重复设计、创造力全开。她的原话是,这是她这类实验里效果最好的一次,超过其他所有模型,前端尤其强,几乎没有坏文件。

我从她的清单里摘了几个作品。螺旋星系粒子观测、生成式故障人像、能弹的 synthwave 合成器、像素画板,四个页面四种气质,全部是同一条 prompt 的产物。

这里面还有一个我必须单独拎出来讲讲的,Spectrum Palette Studio,一个完整能用的取色板工作室。选基准色相,挑和谐规则,类似色、互补色、三角、分裂互补、单色五种,调色板实时组装出来,每种颜色带对比度比值,下面还有组件实时预览和能直接粘贴的 CSS。取色平面用拖拽调色相饱和度,滑杆调明度,方向键还能微调。

这是一个设计工具的完整度,不是一张静态页面的完整度。它也是那条 prompt 的产物。

顺手再安利一个,元素周期表。118 个元素经典长式排布,悬停任意一格,能看到这个元素的玻尔模型,拖动温度滑杆,物质会跟着熔化沸腾,类别和物态两种着色随便切。上一秒还是取色板工具,下一秒就是化学可视化,同一条 prompt 的产品光谱就是这么宽。

炫技向的也有,全息卡画廊。一套六张元素主题的收藏卡,鼠标扫过卡片,全息光泽会追着视线流动,点一下还能翻面读卡背的背景故事。这个静态截图对不起它,直接放动图。

跳跃之门是另一种炫法。第一视角往曲速隧道里钻,星光被引力拉成流线,越钻越快。动效这东西,截图和录屏是两种生物,录屏压到 6MB,直接放。

压轴留给北极光。伊纳里湖上空的一片天,绿色是氧原子在 120 公里高空被太阳风撞出来的,更高处的紫色是更稀薄的空气给的回应,无风的夜里,湖面把整片天空还了回去。角落里还摆着一排观测数据,坐标、气温、地磁指数、发射线波长,像模像样。在线看北极光,也就这么回事了。

100 个文件连同 prompts 都放在她的合集页里,感兴趣的可以自己去翻。

聊点实在的,如果你是调 API 的。

模型 ID 是 claude-fable-5-1 和 claude-mythos-5-1,默认 1M token 上下文,最大输出 128K,自适应思考常开,关不掉。

有两处破坏性变化要处理。一处是 tool_choice,any 和 tool 两个取值不再支持,传了直接报 400,auto 和 none 照旧,要保证输出严格符合 schema,走 strict tool use 或 structured outputs。另一处是思考块回放,思考块只有产生它的模型或更新的模型能读,回放给更早的模型会被直接丢弃,而且 API 会校验思考块之前的内容没被改动,8 月 31 日之后新建的账号,改了系统提示词、工具定义或更早的消息再回放,直接报 400。迁移顺序反了就是生产事故预定。

合规层面注意,两个模型都要求 30 天数据保留,不支持零数据保留,除非 Anthropic 特批。输出文本自带水印,代码执行工具生成的图片和视频经 Files API 取回时带 C2PA 内容凭证,这两个不用改代码。

也有好消息。新开了对话中途调 effort 的 beta,一条 role 为 system 的消息带上 output_config.effort,就能调后续轮次的努力档位,而且不破坏 prompt cache。X 上 Thariq 的实测建议值得抄,验证需求少、边缘用例少的任务直接用低 effort,省钱不伤质量。

最后说说评论区,这才是真正的好戏。

官方帖子五万多赞,但 Hacker News 上那个 956 分、893 条评论的帖子,信息密度高得多。

最热的一条来自 Anthropic 员工 felixrieseberg,六十多条回复。他的观点和基准无关,说 Fable 5.1 的写作风格进步很大,听起来不那么「Claude 味」了,风格指令的执行也更稳。还补了一句预期,数学上那些突然冒出来的突破,很快会在其他科学领域成批出现。这和 Claude Devs 帖子里「写作风格更自然」对上了,官方口径和员工口径难得一致。

唱反调的也有,而且账算得扎实。网友 GodelNumbering 指出,缓存读取降到 $0.25,等于 Fable 5.1 的缓存读取只要 Opus 5 的一半,这给「Anthropic 原定价没赚到钱」的说法添了证据。他后半段更尖锐,把 Terminal-Bench-Science 拿掉,Fable 5.1 相对 Opus 5 的提升只剩一点几个百分点,高一个档位的模型卖这个涨幅,前沿是不是停了?

这个问题官方没回答,评论区也吵不出结果。

全场最欢乐的是 Simon Willison,对,就是那个 Simon。他拿 Fable 画鹈鹕,effort 从 low 一路画到 xhigh,最后上 max 档,跑了将近 14 分钟,6 万多个输出 token,花了 $3.30。他还把推理过程贴了出来,模型在认真纠结要不要给鹈鹕戴自行车头盔,担心头盔和头顶的冠羽抢视觉空间。

评论区全程哈哈哈。

吐槽派的火力集中在 token 上。tarr11 说他上周刚退了 Pro Max 订阅,codex 输出更简洁,毕竟人也是有 token 上限的。madrox 说他现在更关心 token 预算而不是更强的模型,靠 AI 吃饭的人需要可预测的开销。这两条放一起看挺有意思,模型在变便宜,用户的焦虑一分没少。

顺带说个题外话,这次我把 AIHOT 上这个事件的报道时间线完整捋了一遍,13 条报道、12 个信源,从第一条到最后一条隔了六个多小时。

北京时间凌晨 2 点 18 分,Testing Catalog 抢到首发,两条帖子把上线消息和分数一起抖了出来。11 分钟后官方 RSS 更新,Claude Platform 的开发者版本说明上线。2 点 30 分 @claudeai 官号官宣,2 点 38 分 Claude Devs 确认 Claude Code 可用。凌晨 3 点,Claude Code 负责人 Boris Cherny 给出定位,Fable 5.1 是他迄今最强的模型,编码、数据分析、computer use、设计、演示文稿和最难的长时间智能体工作,他都拿它在干。

早上 4 点 TechCrunch 定调「成本更低、限制更少」,6 点半 The Verge 点破回应批评的背景,IT 之家几乎同一分钟出了中文稿。到早上 8 点 37 分,Thariq 发了实测建议,这条时间线才算收尾。爆料抢首发,官方十分钟跟上,内部人背书,媒体定调,实测收尾,模型发布的传播路径已经成熟得像流水线。留给观望者的窗口,满打满算一个工作日。

回到最开头那句话。

这两个模型是同一个模型。但同一个脑子,正在被拆成两种命运,一种全平台撒开跑,一种锁在审核制里给特定的人用,而拉开这两者差距的那层安全防护,第一次有了每百万 token 的价格。

我一直觉得,AI 安全这个话题聊了这么多年,大多停留在「要不要做」的争吵上。这次发布把它变成了一个工程问题,防护值多少钱、误报率降多少、性能税收几个点,全是可以在表格里量化、在下一个版本里迭代的东西。吵理念的时代可能真的在过去,算账的时代开始了。

至于我,普通用户没什么好犹豫的,Claude 订阅直接用,Claude Code 里换个模型名就能感受差别。API 用户先改 tool_choice 和思考块回放的兼容性,再切流量。我的下一个动作,是拿一个跑超过一小时的长任务,实测它「卡住会喊人」的那个特性。

毕竟那天晚上,我最终也没睡成。

相关推荐
Dawson Zhu3 小时前
Agent 工具体系:从 MCP 协议到层次化工具发现
人工智能·语言模型·架构·aigc·agi
殷紫川3 小时前
用AI能写出高考满分作文吗?
aigc
虎虎(_ _)。゜zzZ3 小时前
FastAPI-lifespan生命周期管理实战
mysql·aigc·fastapi·大模型部署·lifespan·python异步
plainGeekDev4 小时前
软件工程术语库·编码与设计篇
aigc·ai编程
leeyi4 小时前
微前端:14 个子应用是怎么做到不散架的——DeepFlux 前端工程拆解(第102篇)
前端·aigc·agent
全栈弄潮儿4 小时前
真实案例:用 AI 快速定位一次代码问题
aigc·openai·ai编程
9i编程4 小时前
6. 对SKILL进行一次全新尝试,改为框架+细节方式的实践及验证:admin-web联调与bug修复
人工智能·openai·ai编程
Lambert2814 小时前
同一个 Agent,用 Spring AI 2.0 和 AgentScope Java 各实现一遍:差的不止代码量
openai·ai编程
桃西西呀4 小时前
AI 为什么一本正经地胡说八道?3 个底层原因 + 2 个防坑法
人工智能·llm·ai编程