Claude Fable 5.1 API 接入指南:模型标识、五级定价策略、effort 参数与缓存 TTL 配置详解

Claude Fable 5.1 发布于 2026 年 9 月 1 日。接进去要知道的东西,其实就是三个数字加一个选择,而真正影响账单的是后者。这篇是查阅用的参考,不是评测------想看它和 Opus 5 的成本之争,去这篇

标识符

字段
模型 ID claude-fable-5-1
上下文窗口 1M token
最大输出 128K token
Thinking Adaptive,常驻开启
默认 effort high
可靠知识截止 2026 年 6 月

Adaptive thinking 在这个模型上关不掉。做预算时这一条要留意,因为 thinking 产生的 token 按输出计费,走的是 50 那一行,不是 10 那一行。

五档费率

Anthropic 每个模型公布五档费率,多数文章只引其中一档。单位是美元每百万 token:

Fable 5.1 Fable 5 Opus 5 Sonnet 5
基础输入 10 10 5 2
5 分钟缓存写 12.50 12.50 6.25 2.50
1 小时缓存写 20 20 10 4
缓存读 0.25 1.00 0.50 0.20
输出 50 50 25 10

把两列 Fable 对着看,五个数里有四个纹丝不动。

effort 不改单价,改的是 token 数量

算成本最容易在这一步出错。effort 不是价格档位,上面那些费率在任何 effort 下都成立。effort 改变的是模型在给出答案之前写多少东西。

Artificial Analysis 参与了 Anthropic 的发布前评测。他们实测,Fable 5.1 在 max effort 下的输出 token 约为 Fable 5 的 1.7 倍。输出走 50 那一行。缓存读取虽然便宜了 75%,他们量出来的每任务成本还是高了 20%:3.76 对 Fable 5 的 $3.14。

所以预算上记住一条:调高 effort,涨的是用量,不是单价。在意成本的话先把 effort 封顶,再谈别的优化。

缓存:真正省钱的那部分

缓存读取 0.25,是基础输入 10 的四十分之一。省下来的钱随复用次数放大,所以同一个费率变化落到不同负载上差别极大。

拿一段 100 万 token 的前缀------代码库、文档集,或者一段很长的 system prompt。写入一次,读回 N 次:

读取次数 Fable 5.1 Fable 5 不用缓存
1 $12.75 $13.50 $20.00
10 $15.00 $22.50 $110.00
100 $37.50 $112.50 $1,010.00
500 $137.50 $512.50 $5,010.00

假设只写一次 5 分钟缓存,期间不过期。「不用缓存」一列,是把同样的内容完整传 N+1 次、按每百万 token $10 算出来的。

读 1 次时两个版本差距在 6% 以内,读 100 次时 Fable 5.1 只要 Fable 5 的三分之一。表里这几行用的是同一个模型,唯一的变量是你回头用了这段缓存上下文多少次。去数缓存命中次数,别数请求数。

TTL 这个选择

Anthropic 卖两种缓存写入时长:5 分钟每百万 token 12.50,1 小时 20。选哪个,牵动的金额比这次降价本身还大。

5 分钟这个时限没听上去那么紧。Anthropic 的 prompt caching 文档写得很明确:「缓存每次被使用时都会免费续期。」只要有请求写入或读取了这个条目,生命周期就从那一刻重新开始算。持续命中同一段前缀的 agent,光靠读取就能把 5 分钟的条目一直续着,只付一次写入费。

钱是漏在空档里的。规划、等一次慢工具返回、有人在看 diff,只要安静超过五分钟,条目就过期,下一次调用重新付写入费。这样跑一小时,最坏是 12 × 12.50 = **150** ,而 1 小时档写一次是 $20

同一段前缀,一小时最多能差出 $130。差多少取决于你的流量形态,跟选哪个模型无关。

从 Fable 5 迁过来

要改的是一个字符串。基础费率、上下文窗口、输出上限、默认 effort 全都没变,所以换掉模型 ID 就是全部迁移动作:

复制代码
- model="claude-fable-5"
+ model="claude-fable-5-1"

换完之后有两件事要复查,因为 diff 里看不出来:

  • 输出预算。单价一样,但同档 effort 下 token 更多。如果你的告警阈值是照 Fable 5 的输出量标定的,换完会响。

  • 知识截止的假设。2026 年 6 月比 Fable 5 的截止更靠后,那些为了绕开过时的库版本知识而写的提示词,现在可能已经多余,甚至会起反作用。

除了价格,Anthropic 还说改了什么

Claude Fable 产品页讲的是行为,不是跑分。它写道 Fable 5.1「不走看似省事的捷径,修问题的根因而不是症状,并在工作过程中持续同步进展」。

有两次护栏调整很容易混为一谈,不少文章也确实混了。2026 年 8 月 7 日,Anthropic 调整的是 Fable 5 的生物学护栏,称该更新「在我们的各产品界面上,让生物学相关的降级回退减少了约 85%」。另一件事在 9 月 1 日的发布公告里:Anthropic 说在网络安全方面,Fable 5.1「最新的护栏拦下的误报比之前少 60%」。所以「误报变少」确实是 5.1 这次发布的说法,但指的是网络安全那一侧,和 8 月那次生物学调整不是一回事,两个数字也不能叠着算。

通过 Ofox 调用

Fable 5.1 已于 2026 年 9 月 3 日进入 Ofox 目录 ,ID 是 anthropic/claude-fable-5.1。别名 claude-fable-5-1------也就是 Anthropic 自己的模型 ID------同样可用,所以从 Anthropic 直连迁过来,除了加服务商前缀之外不用改字符串。

同一把 Key 还能跑 anthropic/claude-fable-5anthropic/claude-opus-5anthropic/claude-sonnet-5,都按 Anthropic 官方定价计费,不加价。四个都支持两种协议:

协议 base URL
OpenAI 兼容 https://api.ofox.io/v1
Anthropic 原生 https://api.ofox.io/anthropic

走原生那条能拿到 Messages API。Ofox 文档在这条路径上明确列了 extended thinking 和工具调用,没有单独提缓存参数,所以第一次重复调用先确认返回里的 usage.cache_read_input_tokens 不为 0,再按上面那笔 TTL 的账算。

复制代码
import anthropic

client = anthropic.Anthropic(
    base_url="https://api.ofox.io/anthropic",
    api_key="<OFOX_API_KEY>",
)

message = client.messages.create(
    model="anthropic/claude-fable-5.1",
    max_tokens=1024,
    messages=[{"role": "user", "content": "总结一下这个代码库。"}],
)

五档费率全部与 Anthropic 官方定价一致、不加价,所以这篇里的每个数字都能直接套用。真正决定这笔便宜下来的缓存读取对你值不值钱的,仍是缓存命中率------先在自己的流量上量一遍,再假定那 25% 会落到你头上。

费率与规格于 2026 年 9 月 3 日核对自 Anthropic 定价文档、模型总览、产品页与发布公告;每任务成本数据来自 Artificial Analysis,同日取得;Ofox 目录与协议 base URL 同日核对自线上 /v1/models 接口及 Ofox 文档。

相关推荐
今天会营业1 小时前
7、缓存菜品
缓存
zww89491111 小时前
相册印刷项目实战指南:从设计到成品的完整技术流程
java·小程序·eclipse
程序猫.1 小时前
双指针问题
java·数据结构·算法
云烟成雨TD1 小时前
LlamaIndex 系列【18】关键词检索(Keyword Search):TF-IDF 算法
ai·agent·llamaindex
拾光Ծ1 小时前
【MySQL】复合查询、表的连接
java·数据库·sql·mysql
MetaLite1 小时前
Java通用枚举驱动下拉框-元数据接口与前端契约
java·前端·状态模式
文子越来越强2 小时前
线程池使用总结
java
SimonKing2 小时前
Java 图片处理还在用 ImageIO?这个库让你代码从 30 行变 3 行
java·后端·程序员
ddshub_cc2 小时前
Claude Fable 5.1 Prompt Engineering:长程任务与编程 Agent 怎么写提示
ai·prompt·api·ai编程·claude·claude code·fable 5.1