7月的大模型圈很热闹。
OpenAI 的 GPT-5.6 Sol 刚结束政府审核全面开放,Anthropic 的 Claude Fable 5 解除出口管制重新上线,月之暗面的 Kimi K3 以全球最大开源模型的姿态杀进前三------三大旗舰模型第一次在同一个月内全部可用。
问题来了:到底选谁?
这篇横评把三大模型在编程、Agent、推理、文档理解、速度、价格六个维度上掰开了看。数据来源统一用独立评测机构(Artificial Analysis、VulcanBench、Arena AI),不用厂商自报数据。
先给结论:没有绝对的第一名。三个模型各有一个不可替代的长板。

一、综合智能:Fable 5 守擂,但差距极小
Artificial Analysis Intelligence Index 给出了综合评分:
|----|----------------|--------|
| 排名 | 模型 | 综合智能指数 |
| 1 | Claude Fable 5 | 60 |
| 2 | GPT-5.6 Sol | 59 |
| 3 | Kimi K3 | 57 |
前三名只差3分。这是什么概念?去年同期的前三名分差是两位数。 模型能力的趋同速度比任何人预想的都快。
但综合分掩盖了细节。拆到具体能力维度,三个模型的优劣势完全错开。
二、编程:K3 登顶前端,Fable 5 统治工程
前端编程(Frontend Code Arena)
这是 Kimi K3 最亮眼的战场。
|----------------|----------|-----|
| 模型 | 得分 | 差距 |
| Kimi K3 | 1679 | --- |
| Claude Fable 5 | 1631 | -48 |
| GPT-5.6 Sol | 1618 | -61 |
K3 在前端七个细分领域中六个位居第一。干净利落的 UI 组件生成、准确的 CSS 布局、更少的迭代次数------在前端编程这个场景下,K3 是实至名归的第一。
长程软件工程(SWE Marathon / FrontierSWE)
但到了复杂的、需要长周期自主完成的软件工程任务上,Fable 5 夺回优势:
|----------------|----------------|-------------|---------|
| 评测 | Claude Fable 5 | GPT-5.6 Sol | Kimi K3 |
| SWE Marathon | 48% | 44% | 42% |
| FrontierSWE | 86.6 | 71.3 | 81.2 |
| Terminal Bench | 76% | 73% | 71% |
Fable 5 在需要持续数小时乃至数十小时的自主编程任务上依然是标杆。 K3 在 FrontierSWE 上拿到81.2分大幅领先 Sol,但与 Fable 5 的86.6仍有差距。
VulcanBench 的真实 PR 数据更直观------用23个真实合并过的开源项目PR来测试:
|----------------|-----------------|--------|--------|
| 模型 | 完成率 | 总成本 | 每任务耗时 |
| Claude Fable 5 | 20/23 (87%) | 20.82 | 4.3分钟 |
| GPT-5.6 Sol | 20/23 (87%) | 15.90 | 4.2分钟 |
| Kimi K3(标准) | 17/23 (74%) | 16.84 | 18.1分钟 |
| Kimi K3(加预算) | **20/23 (87%)** | 27.43 | 28.3分钟 |
K3 给够预算和时间(2小时上限),也能追平 Fable 5 和 Sol 的完成率。但耗时是后两者的6-7倍。 这是 K3 最核心的代价------用时间换能力。
三、Agent 与知识工作:Fable 5 第一,K3 反超 Sol
AA-Briefcase 是一个很有意思的评测------模拟真实企业办公环境,给模型扔25000+条Slack消息、3500+封邮件、会议纪要和财务报表,要求产出Excel财务模型和董事会PPT。
|----------------|-----------------|
| 模型 | AA-Briefcase 得分 |
| Claude Fable 5 | 1574 |
| Kimi K3 | 1543 |
| GPT-5.6 Sol | 1501 |
K3 在这个维度反超了 Sol。说明在处理长周期、碎片化信息的复杂办公任务上,K3 的大上下文窗口(100万token)和长程推理能力发挥了作用。
GPQA Diamond(研究生级科学推理):
|----------------|---------|
| 模型 | 得分 |
| Claude Fable 5 | 74% |
| GPT-5.6 Sol | 72% |
| Kimi K3 | 68% |
Fable 5 的推理深度依然是三者中最强的。
四、多模态与文档理解:K3 的另一个杀手锏
OmniDocBench 视觉理解测评中,K3 以 91.1分登顶,超越 Fable 5 和 Sol。这是 K3 除前端编程外第二个拿第一的领域。
K3 原生支持视觉理解(在预训练阶段就同时处理文本和图像),不是后期嫁接的多模态能力。对于需要大量文档理解、图表解析的企业场景,K3 有明显优势。
五、速度与可靠性:K3 的硬伤
这是三个模型之间最悬殊的差距。
速度
|----------------|------------|----------|
| 模型 | 同等任务耗时 | 相对速度 |
| Claude Fable 5 | ~3.5分钟 | 基准(最快) |
| GPT-5.6 Sol | ~4分钟 | 接近 |
| Kimi K3 | ~12分钟 | 慢3倍+ |
同样的代码缺陷修复任务,Fable 5 3.5分钟,K3 12分钟。而且 K3 比 Fable 5 和 Sol 慢2-3倍是普遍现象,不是个别任务。
幻觉率
|----------------|-----------|
| 模型 | 幻觉率 |
| Claude Fable 5 | ~12% |
| GPT-5.6 Sol | ~15% |
| Kimi K3 | ~51% |
K3 51%的幻觉率是个严重问题。这意味着超过一半的回复可能包含不准确信息。对于知识密集型任务,K3 的输出需要人工校验。Fable 5 的12%在可用性上是另一个量级。
六、价格:看单价没用,看「完成一个任务的成本」
API 定价(每百万Token)
|----------------|----------|------------|------------|
| 模型 | 输入 | 输出 | 缓存命中 |
| Kimi K3 | ¥20 (3) | ¥100 (15) | ¥2 (0.30) |
| GPT-5.6 Sol | 5 | 30 | 0.50 |
| Claude Fable 5 | 10 | 50 | $1 |
只看单价,K3 最便宜------输出价格只有 Fable 5 的30%。但这张表有欺骗性。
K3 的一个关键问题:输出冗长。 第三方实测数据显示,K3 完成同样任务消耗约25K tokens,而 Sol 只需15K左右,Fable 5 约18K。K3 的长推理链和不结构化的 Thinking 输出导致 token 消耗明显偏高。
算「完成一个任务的真实成本」:
|----------------|--------|------------|-------------|
| 模型 | 单价(输出) | 平均Token/任务 | 估算成本/任务 |
| Kimi K3 | 15/M | \~25K | **\~0.38** |
| GPT-5.6 Sol | 30/M | \~15K | \~0.45 |
| Claude Fable 5 | 50/M | \~18K | \~0.90 |
K3 仍然是最便宜的,但优势从「便宜70%」缩水到「便宜约15%」。Fable 5 贵但精准,总成本可能更低------完成同样任务所需的轮次更少,不需要反复纠正。
另外,Fable 5 在处理超长上下文(超272K tokens)时不加价,Sol 有2倍输入/1.5倍输出的长上下文附加费。
七、一张表看完所有数据
|--------------|-----------------|----------------|-------------------|
| 评测维度 | 🥇 第一 | 🥈 第二 | 🥉 第三 |
| 综合智能 | Fable 5 (60) | Sol (59) | K3 (57) |
| 前端编程 | K3 (1679) | Fable 5 (1631) | Sol (1618) |
| FrontierSWE | Fable 5 (86.6) | K3 (81.2) | Sol (71.3) |
| SWE Marathon | Fable 5 (48%) | Sol (44%) | K3 (42%) |
| Agent知识工作 | Fable 5 (1574) | K3 (1543) | Sol (1501) |
| 文档理解 | K3 (91.1) | Fable 5 | Sol |
| 科学推理 | Fable 5 (74%) | Sol (72%) | K3 (68%) |
| 真实PR任务 | Fable 5 (87%) | Sol (87%) | K3 (74%/87%) |
| 速度 | Fable 5 (最快) | Sol (接近) | K3 (慢3倍) |
| 幻觉率 | Fable 5 (~12%) | Sol (~15%) | K3 (~51%) |
| 输出单价 | **K3 (15)** | Sol (30) | Fable 5 (50) |
| 任务成本 | K3 (\~0.38) | Sol (~0.45) | Fable 5 (\~0.90) |
| 上下文定价 | Fable 5 (不加价) | K3 | Sol (加价) |
八、三句话选模型
选 Kimi K3,如果:
- 你做的是前端开发、UI组件生成、CSS布局------这是K3的地盘
- 你需要处理大量文档和图表(OmniDocBench 91.1分)
- 你的场景是长周期自主编程,不介意等12分钟换一条高质量输出
- 预算优先,且能接受较高幻觉率需要人工校验
- 你需要开源模型,想自己微调或私有化部署
选 Claude Fable 5,如果:
- 你做的是复杂软件工程、多文件重构、大规模代码迁移------Fable 5是唯一选择
- 准确率 > 一切------12%幻觉率,省去大量纠错时间
- 你跑的是Agent工作流,需要模型稳定执行多步骤复杂任务
- 你处理超长上下文(>272K tokens),不想付附加费
- 你能接受最高的单价,换最可靠的结果
选 GPT-5.6 Sol,如果:
- 你需要速度、成本、能力的三角平衡------不是最强也不是最便宜,但可能是最「全面」
- 你做的是安全相关的编程任务(ExploitBench表现优异)
- 你已经在 OpenAI 生态里(ChatGPT、Codex、Assistants API)
- 你需要分级定价------Sol/Terra/Luna三档,不同任务匹配不同成本
九、最佳实践:别只用一个
三个模型的长板完全错开。实际生产中的最优策略不是「选一个」,而是三模型组合:
前端开发 → Kimi K3(1679分,前端最强)
复杂工程 → Claude Fable 5(86.6 FrontierSWE)
日常编码 → GPT-5.6 Sol(速度+能力平衡)
文档解析 → Kimi K3(91.1 OmniDocBench)
Agent任务 → Claude Fable 5(1574 AA-Briefcase)
成本敏感 → Kimi K3(便宜)+ GPT-5.6 Luna(更便宜)
但问题是------如果每个模型都去一家平台单独开户、充值、管理Key,管理成本很高。
实际方案是通过API聚合平台统一管理。 比如 魔芋 已经接入了 Kimi K3(含K2.6/K2.5全系列),同时支持 Claude 和 GPT 全系列,国内外模型一个Key调用。开发者不需要分别对接月之暗面、Anthropic、OpenAI三家------改个model参数就能切换模型,按任务需求灵活选型。
体验网址:https://www.moyu.info/register?aff=g2d7 (通过该连接注册后可获得¥2额度体验,私信我还可以额外我获赠¥5账户体验额度并进行账户开白)
写在最后
2026年7月的模型格局传达了一个清晰信号:绝对领先的时代结束了。
一年前,GPT-5 对其他模型是「碾压级」优势。现在,前三名综合分只差3分------每个维度各有人赢,没有一个模型能包揽所有第一。
K3 的崛起尤其值得关注:一个开源模型,在前端编程和文档理解两个领域拿了世界第一。7月27日完整权重开放后,基于K3的微调模型和领域适配版会大量涌现。
但 K3 的短板也足够明显------速度慢3倍、幻觉率51%、上线48小时就因算力崩溃暂停C端订阅。这不是一个「能用就完事」的模型,而是一个需要精心选择场景、接受其代价的「偏科尖子生」。
选模型这件事,以后不是比「谁最强」,而是比「谁最合适」。