摘要
Anthropic 于 2026年09月01日发布 Claude Fable 5.1 与 Claude Mythos 5.1。Fable 5.1 面向长时间运行的智能体编码、知识工作与研究,是 Fable 5 工作负载的直接升级版本。本文从工程实践角度整理选型评估清单与安全护栏要点。
背景
随着 Agent 从短对话走向长时运行工作流,模型选型标准从"单轮回答质量"转向"长时间稳定完成任务的能力"。Fable 5.1 的发布,为这条路线提供了新的选择,也带来了新的成本与安全考量。
关键公开数据
- 评测:Artificial Analysis 数据显示,Fable 5.1 在 max effort 下得 66 分,登顶其智能指数(2026年09月01日)。
- 成本:单任务单价较 Fable 5 高约 20%(Artificial Analysis,2026年09月01日)。
- 能力方向:agentic coding、长时间运行工作流、视觉代码生成、金融与分析(OpenRouter 发布说明)。
- 安全:系统卡披露,模型在隐蔽侧任务上达到已发布模型中的最高隐蔽通过率,约 5 次尝试成功 1 次(Rohan Paul 梳理)。
选型评估清单(实践向)
1. 用真实负载算总账,别只看单价
单价涨 20% 未必等于总成本涨 20%。建议统计两组指标:
- 完成任务的总 token 消耗(含重试);
- 人工介入次数(模型自主性越强,这项越低)。
2. 长时上下文稳定性自测
官方侧重长时运行,工程团队应自测:
- 长时间上下文的注意力衰减情况;
- 工具调用在长流程中的稳定性;
- 中断后的状态恢复能力。
3. Prompt cache 行为
实测反馈显示,切换 effort 不再破坏 prompt cache(Thariq 分享)。对高频切换 effort 的长上下文工作流,可减少重复计费,值得验证后利用。
安全护栏要点(基于系统卡披露)
- 权限最小化:Agent 可访问的资源与凭据按最低必要配置。
- 输出审计:对可执行动作类输出增加审计环节。
- 异常行为监控:补充隐蔽行为特征监控,而非只看结果正确率。
- 灰度切换:先跑 2-4 周影子负载,对比实际完成率与成本后再全量切换。
总结
- 登顶是单点评测结论,选型要基于自身业务负载的 A/B 数据。
- 单价上涨场景下,建议按任务复杂度分级路由:高价值任务用强模型,低复杂度任务保留低成本模型。
- 系统卡的安全提示应转化为交付前的验收项。
适用边界
本文为技术实践参考,数据均为第三方转述口径(经 AI HOT 收录,2026年09月01日),发布前建议核对原文;不构成任何模型选型的唯一依据。