
评测背景
随着大模型逐步具备联网搜索、代码执行等能力,科学推理评测所考查的对象也开始从单一模型扩展到模型与工具组成的完整系统。模型不仅要理解问题,还要判断何时检索资料、如何筛选证据,以及怎样将工具返回的信息转化为可靠结论。
前沿科学推理评测集(Frontier Scientific Reasoning Benchmark,简称 FSR-Bench)正是围绕这一变化构建的高难度评测基准。它包含 867 道题,覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科,其中纯文本题 425 道、多模态题 442 道。每道题分别在开启原生工具和不开启原生工具两种配置下评测,并同时考察作答过程与最终答案。
本次更新聚焦 Qwen3.8-Max 在 FSR-Bench 中的最新表现,重点观察其在榜单中的相对位置,以及过程分、题型和工具配置等不同维度下的表现。
榜单概览
本期结果显示,Qwen3.8-Max 在 FSR-Bench 的两套配置中均进入前十。开启原生工具的 Qwen3.8-Max(w.Tool)以 50.61 分位列第 5,未开启工具时以 38.35 分位列第 8。
注:主榜将开启工具与不开启工具的配置放在同一张榜单中,开启工具的模型以"w.Tool"标识,同一模型的两种配置会被视为两个独立条目,下表仅展示前 20 名。

点击访问晓天衡宇评测社区,查看完整榜单、排行榜规则、评测集详情、详细得分榜单。
评测设计与方法
FSR-Bench(Frontier Scientific Reasoning Benchmark)包含 867 道前沿科学问题,覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科,其中纯文本题 425 道、多模态题 442 道。评测分别在不开原生工具和开启原生工具两种配置下进行,两种配置合并在同一榜单,开启工具的模型以 w.Tool 标识。由于各模型使用自身实际可用的原生工具体系,该结果用于观察不同完整系统配置下的科学问题求解表现,而非比较统一工具条件下的模型能力。
FSR-Bench 对每道题的作答过程和最终结果分别评分,均采用 100 分制;其中过程分关注推理过程的完整性与合理性,结果分关注最终答案的准确性及任务完成情况。每道题由 Qwen3.7-Max、GPT-5.6 Luna 和 Claude Sonnet 5 三个裁判模型独立评分,最终取平均值。主榜按"所有题 · 结果分"排序,过程分、纯文本题及开/不开工具等指标作为分项观察口径。
详细评测规则、输入输出格式及判分标准,请前往晓天衡宇垂直领域评测榜单查看。
分析与结论
Qwen3.8-Max 进入榜单前列,与领先模型差距已缩小
从"所有题·结果分"看,Qwen3.8-Max(w.Tool)以 50.61 分位列主榜第 5。与排名第 4 的 GPT-5.6 Sol (medium) 相差 7.59 分,略高于第 6 名 Claude Fable 5(w.Tool)的 49.97 分,领先 0.64 分。
从 Qwen 系列内部看提升更加明显:Qwen3.8-Max(w.Tool)比 Qwen3.7-Plus(w.Tool)高 12.18 分,也比 Qwen3.6-Plus(w.Tool)高 29.21 分。
整体来看,Qwen3.8-Max 在本期综合科学推理评测中已经进入榜单前列,而不只是停留在中部梯队。
纯文本科学推理表现更突出,推理过程质量值得关注
从细分成绩来看,Qwen3.8-Max(w.Tool)在纯文本题上的结果分达到 66.65,过程分达到 74.93,展现出较强的纯文本科学推理能力:在以知识理解、问题拆解和逻辑推演为主的科学问题中,Qwen3.8-Max 能够形成质量较高的分析与推理过程。
在所有题中,Qwen3.8-Max(w.Tool)的过程分为 61.89,同样高于 50.61 的结果分。过程分较高说明 Qwen3.8-Max 的表现不仅体现在最终作答结果上,也体现在知识调用、证据组织和推理展开等解题环节,为处理复杂科学问题提供了较为扎实的过程基础。
不同工具配置下均保持较好表现,原生工具进一步提升成绩
Qwen3.8-Max 在两种配置下均进入榜单前十。未开启工具时得分为 38.35 分,排名第 8;开启原生工具后提升至 50.61 分,排名升至第 5。
即使未开启工具,Qwen3.8-Max 仍保持在榜单前列;在此基础上,原生工具配置进一步提升了它的科学问题求解表现。
由于 FSR-Bench 并非统一工具条件下的严格控制实验,不同模型实际可使用的原生工具体系存在差异。因此,这里的 12.26 分更适合用于描述 Qwen3.8-Max 两套完整系统配置之间的表现变化,而不应直接解释成工具本身带来的净能力提升。
综合判断
Qwen3.8-Max 在本期综合科学推理评测中表现较为突出:两种工具配置均进入榜单前十,开启工具后进一步进入前五;同时,过程分也呈现出较好的表现。本次评测更值得关注的是 Qwen3.8-Max 的能力结构:能够形成完整的科学问题分析过程,并在原生工具参与下进一步提升整体表现。
与此同时,过程分与结果分、纯文本与多模态题之间仍存在一定差异,说明模型在不同信息形态和任务环节中的表现并不完全一致。这些差异也为进一步观察模型的科学推理能力提供了更多维度。
总体来看,Qwen3.8-Max 已经展现出较强的综合科学问题求解能力,尤其是在知识密集型任务和工具协同场景下表现突出;而如何进一步缩小过程与结果、文本与多模态之间的差距,将是其后续能力提升的重要方向。
注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。
写在最后
最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据
