Anthropic 推出 Claude Fable 5.1 与 Mythos 5.1:同一模型,两套安全策略,缓存读取降价 75%
关键词:Claude Fable 5.1、Claude Mythos 5.1、Anthropic、Terminal-Bench、缓存定价、Agent 模型
目录
- 一、导语:为什么这条消息值得关注
- [二、Fable 与 Mythos 到底是什么关系?](#二、Fable 与 Mythos 到底是什么关系?)
- 三、核心能力拆解
- [3.1 基准测试表现:全面超越前代与竞品](#3.1 基准测试表现:全面超越前代与竞品)
- [3.2 定价策略:缓存读取降价 75% 的工程意义](#3.2 定价策略:缓存读取降价 75% 的工程意义)
- [3.3 与现有方案的关键差异](#3.3 与现有方案的关键差异)
- 四、实际影响与适用场景
- 五、如何快速上手
- 六、冷静视角:边界、风险与未解问题
- 总结
摘要
Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1 与 Claude Mythos 5.1。二者共享同一套底层模型权重,区别仅在于安全护栏的严格程度:Fable 5.1 面向公众开放,Mythos 5.1 通过 Project Glasswing 邀请制面向企业级高敏感场景。
本次发布最值得关注的两个技术信号:一是 Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,较前代 24.7% 实现翻倍,并在全部 7 个基准测试中领先竞品;二是缓存读取价格从 1/MTok 降至 0.25/MTok,降幅达 75%,典型工作负载成本可降低约 25%,高度 Agent 化工作负载可降低约 45%。
文章还梳理了 Fable 5.1 与 Opus 5、Sonnet 5、GPT-5.6 Sol 的关键差异,分析了其对个人开发者、企业团队及生态的实际影响,并提供了快速上手的代码示例。同时,作者也冷静指出了延迟较慢、基础定价仍偏高、Mythos 访问受限、基准测试局限性等边界与风险,建议读者先在小规模场景验证实际表现。
一、导语:为什么这条消息值得关注
2026 年 9 月 1 日,Anthropic 正式发布了 Claude Fable 5.1 与 Claude Mythos 5.1 两款模型。这并非两个独立模型,而是同一套底层权重、两套安全策略的产品线拆分。最值得关注的变化有三点:Terminal-Bench-Science 0.1 上 Fable 5.1 得分 52.6%,较 Fable 5 的 24.7% 实现翻倍;缓存读取价格从 1/MTok 降至 0.25/MTok,降幅达 75%;Mythos 5.1 采用邀请制访问,面向企业级高敏感场景。
对开发者而言,这意味着在 Agent 工作流中调用 Claude 的成本可能下降 25%~45%;对企业而言,双轨安全策略提供了更细粒度的合规选择;对研究者而言,Fable 5.1 在科学推理基准上的跃升值得深入分析。

(上图:Claude Fable 5.1 与 Claude Mythos 5.1 官方发布视觉)
二、Fable 与 Mythos 到底是什么关系?
先澄清一个常见的误解:Fable 5.1 和 Mythos 5.1 不是两个不同的模型。它们共享完全相同的底层模型权重,区别仅在于安全护栏的严格程度。
- Claude Fable 5.1:面向公众开放,内置标准安全防护,适用于通用开发、科研、内容创作等场景。通过 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 均可调用。
- Claude Mythos 5.1:通过 "Project Glasswing" 项目邀请制开放,安全护栏更宽松,允许模型在网络安全、生物等敏感领域展现更高能力,主要面向企业级客户。
这种"同一模型、两套策略"的设计,本质上是 Anthropic 在能力开放与安全合规之间的工程权衡。Fable 面向大众市场,Mythos 面向需要更高能力但能承担合规风险的企业客户。
三、核心能力拆解
3.1 基准测试表现:全面超越前代与竞品
Fable 5.1 在多个关键基准上实现了显著提升。以下是官方公布的对比数据:
| 基准测试 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1(代理科研) | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0(代理编程) | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2(知识工作) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0(计算机操作) | 77.9% | 72.9% | 75.4% | --- |
| Humanity's Last Exam(多学科推理) | 60.9% | 57.8% | 56.6% | --- |
| AutomationBench(业务工作流) | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0(代理编程) | 73.4% | 70.5% | 70.0% | 67.2% |

(上图:Claude AI 品牌标识)
几个关键观察:
-
Terminal-Bench-Science 0.1 的跃升最为显著:从 24.7% 到 52.6%,增幅超过 110%。这个基准测试衡量的是模型在代理式科学研究中的能力,包括文献检索、实验设计、数据分析等环节。Fable 5.1 的表现不仅远超 Fable 5,也大幅领先 Opus 5(29.0%)和 GPT-5.6 Sol(22.4%)。
-
Terminal-Bench 4.0 同样亮眼:55.8% 的得分较 Fable 5 的 42.0% 提升了 13.8 个百分点,相对增幅约 33%。值得注意的是,Mythos 5.1 在这个基准上达到了 60.9%,说明更宽松的安全策略确实能释放更多能力。
-
全面领先竞品:在全部 7 个基准测试中,Fable 5.1 均取得最高分,且优势幅度从 1.4 个百分点(GDPval-AA v2)到 28 个百分点(Terminal-Bench-Science 0.1)不等。
Anthropic 同时指出,Terminal-Bench-Science 0.1 的公开排行榜(使用 Claude Code harness,每任务 3 次运行)显示 Opus 5 为 30.0%、Fable 5 为 21.4%,而 Anthropic 内部复现结果为 29.0% 和 24.7%,均在误差范围内。这表明不同测试环境可能导致分数差异,但 Fable 5.1 的领先优势是稳健的。
3.2 定价策略:缓存读取降价 75% 的工程意义
Fable 5.1 的定价结构与 Fable 5 保持一致,但缓存读取(Cache Reads)价格大幅下调:
| 计费项 | Fable 5.1 价格 | 变化 |
|---|---|---|
| 基础输入 | $10 / MTok | 不变 |
| 5 分钟缓存写入 | $12.50 / MTok | 不变 |
| 1 小时缓存写入 | $20 / MTok | 不变 |
| 缓存读取 | $0.25 / MTok | 降低 75% |
| 输出 | $50 / MTok | 不变 |
缓存读取价格从 1/MTok 降至 0.25/MTok,降幅达 75%。这个变化的工程意义在于:
- 典型工作负载成本降低约 25%:对于常规对话和代码生成任务,缓存命中率通常在 30%~50% 之间,缓存读取降价直接拉低整体成本。
- 高度 Agent 化工作负载成本降低约 45%:Agent 工作流通常涉及大量上下文复用(如多轮工具调用、长对话历史、系统提示词重复),缓存命中率可达 60%~80%,因此受益更大。
Anthropic 特别提到,缓存读取价格现在是基础输入价格的 0.025 倍,而其他 Claude 模型的这一比例为 0.1 倍。这意味着在 Fable 5.1 上,复用已处理上下文的边际成本极低,这对于构建长上下文 Agent 应用是一个重要利好。
3.3 与现有方案的关键差异
| 特性 | Claude Fable 5.1 | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 上下文窗口 | 1M | 1M | 1M | --- |
| 最大输出 | 128K | 128K | 128K | --- |
| 输入/输出定价 | 10/50 | 5/25 | 2/10 | --- |
| 思考模式 | 自适应(始终开启) | 自适应 | 自适应 | --- |
| 延迟 | 较慢 | 中等 | 快 | --- |
| 默认 effort | high | high | high | --- |
| 知识截止 | 2026 年 6 月 | 2026 年 5 月 | 2026 年 1 月 | --- |
关键差异点:
-
Fable 5.1 比 Opus 5 贵一倍,但能力更强:在 Terminal-Bench-Science 0.1 上,Fable 5.1(52.6%)几乎是 Opus 5(29.0%)的两倍。对于科研、复杂推理等场景,额外的成本投入可能带来更高的产出质量。
-
知识截止更新:Fable 5.1 的知识截止为 2026 年 6 月,比 Opus 5(5 月)和 Sonnet 5(1 月)更新,这意味着它能更好地理解近期的技术发展和事件。
-
自适应思考始终开启:与 Opus 5 和 Sonnet 5 一样,Fable 5.1 采用自适应思考模式,模型会根据任务复杂度自动决定思考深度,无需手动配置。
四、实际影响与适用场景
对个人开发者
- 能不能上手:Fable 5.1 已通过 Claude API 全面开放,注册即可使用。同时支持 Amazon Bedrock、Google Cloud、Microsoft Foundry 等云平台。
- 学习成本 :API 接口与 Fable 5 完全兼容,只需将模型 ID 从
claude-fable-5改为claude-fable-5-1即可切换。 - 成本考量:如果你的工作流涉及大量上下文复用(如多轮对话、长代码文件分析),缓存读取降价 75% 将显著降低使用成本。
对企业/团队
- 能否替代现有方案:对于已在使用 Fable 5 或 Opus 5 的团队,Fable 5.1 在能力上全面超越,且缓存成本更低,是自然升级选择。
- 接入成本与风险:API 兼容意味着迁移成本极低。但需注意 Fable 5.1 的延迟较 Opus 5 更慢,对于实时性要求高的场景需评估是否可接受。
- 合规选择:如果团队涉及网络安全、生物等敏感领域,可申请 Project Glasswing 获取 Mythos 5.1 的访问权限,获得更高能力输出。
对生态
- 填补的空白:Fable 5.1 在科学推理基准上的跃升,填补了 Claude 系列在科研辅助场景的能力短板。此前 Opus 5 在 Terminal-Bench-Science 0.1 上仅 29.0%,与 Fable 5 差距不大,而 Fable 5.1 直接将这一数字提升至 52.6%。
- 可能冲击的对象:在代理式科研和编程场景,Fable 5.1 的表现已显著领先 GPT-5.6 Sol,可能对 OpenAI 在科研辅助工具市场的份额形成压力。
五、如何快速上手
Fable 5.1 的调用方式与 Fable 5 完全一致,只需更改模型 ID:
python
from anthropic import Anthropic
client = Anthropic(api_key="your-api-key")
message = client.messages.create(
model="claude-fable-5-1",
max_tokens=1024,
messages=[
{"role": "user", "content": "请帮我分析这段代码的性能瓶颈"}
]
)
print(message.content[0].text)
如果使用 Claude Code CLI:
bash
# 设置默认模型为 Fable 5.1
claude config set default_model claude-fable-5-1
# 或直接指定模型运行
claude --model claude-fable-5-1 "帮我重构这个模块"
环境要求:
- Python 3.8+ 或 Node.js 18+
- anthropic SDK 最新版本(
pip install -U anthropic) - 有效的 Anthropic API Key
六、冷静视角:边界、风险与未解问题
尽管 Fable 5.1 在各项基准上表现亮眼,但仍需关注以下几点:
-
延迟问题:官方明确标注 Fable 5.1 的延迟为"较慢"(Slower),相比 Opus 5 的"中等"(Moderate)和 Sonnet 5 的"快"(Fast)。对于需要快速响应的交互式应用,这可能成为瓶颈。建议在对延迟不敏感的场景(如批量代码审查、离线数据分析)优先使用。
-
成本仍高于 Opus 5:虽然缓存读取降价 75%,但基础输入和输出价格(10/50)仍是 Opus 5(5/25)的两倍。对于缓存命中率低的场景(如一次性问答、短对话),Fable 5.1 的单位成本反而更高。需要根据实际工作负载的缓存命中率来评估性价比。
-
Mythos 5.1 的访问限制:Mythos 5.1 目前仅通过 Project Glasswing 邀请制开放,普通开发者无法直接体验其完整能力。这意味着 60.9% 的 Terminal-Bench 4.0 得分对大多数用户来说是"看得见摸不着"的。
-
基准测试的局限性:所有基准测试均在受控环境下进行,实际生产环境中的表现可能因任务复杂度、上下文长度、工具调用频率等因素而有所不同。建议在实际应用中先进行小规模测试,验证 Fable 5.1 在你特定场景下的表现。
-
安全策略的权衡:Fable 5.1 的标准安全护栏可能在某些边缘场景过度限制模型能力。如果你的应用场景涉及网络安全分析、生物信息学等敏感领域,可能需要考虑申请 Mythos 5.1 的访问权限。
总结
Claude Fable 5.1 与 Mythos 5.1 的发布,标志着 Anthropic 在能力与安全的平衡上采取了更精细的策略。同一模型权重、两套安全护栏的设计,既满足了大众市场对高性能模型的需求,又为企业级敏感场景提供了合规路径。
Fable 5.1 在 Terminal-Bench-Science 0.1 上 52.6% 的得分和缓存读取 75% 的降价,是本次发布最值得关注的两个技术信号。前者表明 Claude 在代理式科研场景的能力已显著领先竞品,后者则大幅降低了长上下文 Agent 应用的使用门槛。
谁应该关注:正在构建 Agent 工作流的开发者、需要科学推理辅助的研究者、以及对缓存成本敏感的企业团队。
下一步怎么看:建议先在小规模场景测试 Fable 5.1 的实际表现,特别是缓存命中率和工作负载成本的真实变化。对于涉及敏感领域的团队,可关注 Project Glasswing 的申请通道,评估 Mythos 5.1 的额外能力是否值得合规投入。
#Claude #Anthropic #Fable51 #Mythos51 #Agent模型 #大模型基准测试 #缓存定价