
评测背景
晓天衡宇评测社区大语言模型 8 月榜单迎来三款新模型入榜:Claude Opus 5、 Gemini 3.6-Flash 和 DeepSeek-V4 Flash。
榜单从智能体、代码、通用、推理四个维度,并基于 20+ 主流评测基准,对国内外主流大语言模型进行了全面评测,现公布晓天衡宇大语言模型 8 月评测榜单。
本文基于本期榜单结果,重点解读三款模型入榜带来的榜单变化。完整 36 个模型的排名与得分,欢迎访问晓天衡宇评测社区查看。
榜单概览

图中仅展示当前榜单前 10 名,完整榜单欢迎点击阅读原文查看。
核心结论
结论 1:Claude Opus 5 入榜即登顶,Anthropic 包揽前两名
本期榜单中,Claude Opus 5 以 71.27 分位列第一。相较上期榜首 Claude Fable 5(70.72 分),Claude Opus 5 进一步刷新了榜单最高分纪录。
Claude Opus 5 与 Claude Fable 5 分差仅 0.55 分。两款模型各有优势,能力侧重点并不相同:Claude Opus 5 主要在智能体与推理维度领先; Claude Fable 5 在代码与通用上仍略胜一筹。
结论 2:Gemini 3.6-Flash 与 DeepSeek-V4 Flash 位居中游,能力结构相近、定位路径不同
Gemini 3.6-Flash 与 DeepSeek-V4 Flash 分别以 64.13 分、64.06 分位列第 14、15 名,分差仅 0.07 分。两者智能体与代码维度的差距均不足 0.4 分,推理维度相差 0.82 分;主要差异来自通用维度,Gemini 3.6-Flash 领先 2.41 分。
从能力结构看,两款模型均以推理见长:DeepSeek-V4 Flash 推理得分 74.68 ,Gemini 3.6-Flash 为 73.86 分,推理均为各自四个维度中得分最高的一项。
差异在于二者相对自身的优化方向:Gemini 3.6-Flash 延续 Flash 系列的速度优先路线,DeepSeek-V4 Flash 相较 DeepSeek-V4 Pro(Max),则以更小参数规模取得更高综合分。
结论 3:效率分化明显,三款模型路线各异
三款模型效率定位各有差异:
-
Gemini 3.6-Flash 以 213.5 Tokens/s 的推理速度大幅领先,以速度优先;
-
DeepSeek-V4 Flash 以 1.25 元的 API 价格和 938 元的推理成本,成为 60 分以上模型中成本最低的选手;
-
Claude Opus 5 则以 55.1 Tokens/s 的速度处于榜单中下,综合能力居首,但推理速度处于中下游。
评测体系
本榜单基于智能体、代码、通用、推理四大能力维度进行综合评估,并根据各维度权重计算综合得分。
其中,智能体占比最高,为 35%;代码和推理各占 25%;通用占 15%。

模型迭代对比
三款新模型从能力结构上看,具体提升体现在哪些方面?我们通过四大维度得分对比来给出答案。
Claude Opus 5:四维全面提升,智能体与工程能力是最大亮点

Claude Opus 5 智能体能力提升最为显著,以 59.63 分成为当前榜单中智能体维度最高分。
相较前代 Claude Opus 4.8 ,Claude Opus 5 总分提升 3.88 分 至 71.27 分,四个维度全部实现正增长。
它的优势集中在智能体与软件工程能力上: SWE-Multilingual 提升 8.91 分,反映了自主代码修复与仓库级工程能力的明显增强;DeepPlanning(Shopping)提升 10.9 分,体现出工具调用与长链路任务规划、复杂场景决策能力的强化。
个别项目如 IMO-Bench-Gold 小幅回落,但幅度有限,不改变其综合能力显著增强的大方向。
Gemini 3.6-Flash:四项能力均衡小幅提升

相较前代 Gemini 3.5 Flash ,Gemini 3.6-Flash 总分提升 1.28 分至 64.13 分,四个维度均有小幅正增长。其中智能体与代码相对明显,通用基本持平。
Gemini 3.6-Flash 提升最大的是 DeepPlanning(Shopping)子维度,提升 7.73 分,在复杂场景下的任务规划与决策能力有所强化;HLE 等个别子维度小幅回落。
DeepSeek-V4 Flash:小参数实现更高得分,通用、智能体与推理提升明显

DeepSeek-V4 Flash 的提升集中在通用、智能体与推理,代码提升相对较低。
DeepSeek-V4 Flash 总分 64.06 ,较 DeepSeek-V4 Pro (Max) 高出 1.63 分。
对比 DeepSeek-V4 Pro (Max) ,DeepSeek-V4 Flash 的优势集中在 HaluEval 与 IMO-Bench-Gold 子维度,即输出抗幻觉能力以及数学推理能力有所增强。
衡量终端环境下工程执行能力的 Terminal-Bench-Pro 等个别子维度则略有回落。
注:由于 DeepSeek-V4 Flash 为系列首款 Flash 模型,本文以其同代 DeepSeek-V4 Pro (Max) 作为能力参照基准。
效率表现对比
Claude Opus 5:综合能力居首,效率稳定发挥

Claude Opus 5 的推理速度为 55.1 Tokens/s,处于整体中下水平,较前代略有下降;API 价格维持 70 元不变,Token 消耗与推理成本小幅上升。
整体来看,Claude Opus 5 适合对能力要求较高、对响应速度不敏感的场景。
Gemini 3.6-Flash:速度全场第一,成本与消耗较前代下降

Gemini 3.6-Flash 以 213.5 Tokens/s 的推理速度位列当前第一,较前代 Gemini 3.5 Flash 进一步提升。
同时,它的 Token 消耗仅 12 MTokens,为全场最低;API 价格 21.6 元、推理成本 6480 元,均低于前代。能力提升的同时,实现了速度、成本、Token 消耗三项指标的同步改善。
DeepSeek-V4 Flash:成本显著降低,速度跻身第一梯队

DeepSeek-V4 Flash API 价格仅 1.25 元,推理成本仅 938 元。它的推理速度 115.9 Tokens/s 位列全场第四,较参照基准实现明显提升。
虽然其 Token 消耗高于 V4 Pro (Max),但由于 API 单价大幅下降,推理成本反而从 6825 元降至 938 元。
注:本文中的 API 价格为输入与输出价格按 3:1 加权计算的综合单价,单位为元/百万 Tokens 。
综合判断
综合来看,三款新模型呈现出不同的能力与效率取向:
Claude Opus 5 综合能力领先本期榜单,优势集中在智能体与复杂任务处理能力。相较前代 Claude Opus 4.8 在多步规划、工具调用和软件工程任务上均有明显增强;但推理速度处于中下水平,更适合对任务完成质量要求较高、对响应时延不敏感的场景。
Gemini 3.6-Flash 在能力提升的同时保持高效率表现,智能体与代码能力有所增强,推理速度、Token 消耗均具优势,适合目标明确、流程清晰且强调响应效率的应用场景。
DeepSeek-V4 Flash 则展现出较强的成本竞争力,在较小参数规模下实现较高综合得分,通用、智能体与推理能力均有提升,结合较低 API 价格和推理成本,更适合调用规模较大、成本约束较强的场景。
注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。
写在最后
最新 8 月大语言模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据:
