FSR-Bench 前沿科学推理榜单发布:GPT-5.5 居首,“会推理”未必“能答对”

评测背景

当大模型开始具备联网搜索、代码执行和数据分析能力,我们对模型科学推理能力的评价标准也在发生变化。真实的科研与专业分析中,模型不仅要理解问题,还要判断何时检索资料、如何筛选证据、是否需要运行代码,以及怎样把工具返回的信息转化为可靠结论。

前沿科学推理评测集(Frontier Scientific Reasoning Benchmark,简称 FSR-Bench)正是围绕这一变化构建的高难度评测基准。它包含 867 道题,覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科,其中纯文本题 425 道、多模态题 442 道。每道题分别在开启原生工具和不开启原生工具两种配置下评测,并同时考察作答过程与最终答案。

本次晓天衡宇 FSR-Bench 榜单覆盖国内外主流大模型的 28 个评测配置。我们从学科类别、题型形态和工具使用等维度组织题目,采用过程分与结果分双维度评分,考查大模型对高难度前沿科学问题的专业理解、跨模态分析、证据整合、工具调用与答案推导能力。

榜单概览

主榜将开启工具与不开启工具的配置放在同一张榜单中,开启工具的模型以"w.Tool"标识,同一模型的两种配置会被视为两个独立条目,下表仅展示前 20 名。

点击访问晓天衡宇评测社区,查看完整榜单、排行榜规则、评测集详情、详细得分榜单。

核心结论

结论 1:GPT-5.5 开工具位居总榜第一,榜单呈现明显梯队分化

在"所有题·结果分"主榜中,GPT-5.5(xhigh,w.Tool)以 64.70 分排名第一,GPT 5.6 Sol(low,w.Tool)以 60.40 分位列第二;两款模型不开工具时分别获得 60.20 分和 55.20 分,四个配置包揽总榜前四。第二十名Seed 2.1 Pro(w.Tool)的结果分仅为16.15 分。

这说明本次评测中各模型在前沿科学推理任务上的表现存在较大差异。

结论 2:过程分普遍高于结果分,推理完整不等于答案正确

在本次评测的模型配置中,所有模型的过程分都高于结果分。

其中,GPT 5.6 Sol(low,w.Tool)的过程分为 74.20,高于 GPT-5.5(xhigh,w.Tool)的 73.60;但其结果分为 60.40,低于 GPT-5.5(xhigh,w.Tool)的 64.70。说明,模型可能给出结构完整、表述专业的推理过程,却仍在计算或答案环节表现不如推理过程。

结论 3:纯文本题得分整体高于所有题,多模态题对模型要求更高

在本次评测的模型配置中,大部分模型的纯文本题结果分高于"所有题"结果分。GPT-5.5(xhigh,w.Tool)两项得分分别为 70.70 分和 64.70 分,Gemini 3.5 Flash(w.Tool) 分别为 45.10 分和 36.00 分,Gemini 3.1 Pro Preview(w.Tool) 分别为 37.50 分和 24.10 分。

这表明,在本次评测的多数开工具配置中,纯文本题结果分高于"所有题"结果分,含图片或图表的题目可能构成额外压力。

结论 4:工具整体带来得分提升,但不同模型的工具收益差异显著

在具有完整开关工具配对成绩的 14 款模型中,13 款开启工具后结果分上升,平均结果分由 24.67 分提高至 31.65 分,增加 6.98 分。

Claude Fable 5、Claude Sonnet 5 和 Claude Opus 4.8 分别提高 26.34 分、24.95 分和 18.57 分;Gemini 3.5 Flash 和 Gemini 3.1 Pro 则仅提高 0.80 分和 0.30 分,Qwen3.6-Plus 反而下降 1.00 分。

这说明,多数模型在开工具配置下获得了更高的结果分,但不能仅凭是否开启工具预测模型成绩。

评测设计

晓天衡宇本次评测基于 FSR-Bench (Frontier Scientific Reasoning Benchmark),数据集共包含 867 道高难度前沿科学问题,覆盖化学、医疗、地理、天文、数学、物理、生物和金融 8 个学科。其中纯文本题 425 道,多模态题 442 道,后者包含科学图像、图表等视觉信息。

评测在两种配置下分别进行:不开原生工具与开启原生工具。开工具 / 不开工具合并在同一个榜单,开工具的模型名带 (w.Tool) 后缀,不开工具默认不带后缀。

不同模型的工具能力有所不同------GPT 系列主要使用原生搜索,Claude、Gemini 及部分 Qwen 配置同时支持搜索与代码执行,其他模型多以搜索工具为主。这一设计回答的不是"给所有模型装上完全相同的工具后会怎样",而是"各模型在自身实际可用的原生工具体系中,能否提高科学问题的完成质量"。

评测方法

双维度评分

FSR-Bench对每道题的作答过程和最终结果分别采用100分制独立评分。这一设计下,模型即便最终答案错误,仍可因推理路径合理获得较高的过程分,反之,猜对答案但推理过程存在缺陷的模型,过程分则会暴露其不足。

其中,过程分评估推理链的完整性与质量,主要考察作答过程是否完整、合理,能否正确使用知识、证据和工具;结果分评估最终答案的正确性,判断答案是否准确、是否满足题目要求。

裁判机制

每道题由三个裁判模型独立评分,取三者平均值作为最终得分。

三个裁判模型分别为Qwen3.7-Max、GPT-5.6 Luna和Claude Sonnet 5。三裁判取平均的设计旨在降低单一裁判模型的评分偏好对结果的影响,使评分更加稳健。

排名与观测口径

主榜仅使用"所有题·结果分"排序。其余指标作为分项观察口径,不与主榜结果混排。

所有题的过程分榜单用于分析模型是否形成了较高质量的解题过程,纯文本题榜单用于观察模型在不含视觉输入题目上的科学推理表现;开工具与不开工具配置的对比,用于观察两套完整系统配置下的表现差异。

分析与结论

榜首优势明显,主榜呈现出较清晰的分数层次

从"所有题·结果分"看,GPT-5.5(xhigh,w.Tool)以 64.70 分位列第一,GPT 5.6 Sol(low,w.Tool)以 60.40 分排名第二,两者相差 4.30 分。不开工具时,GPT-5.5(xhigh)和 GPT 5.6 Sol(low)仍分别以 60.20 分和 55.20 分位列第三、第四。这两款 GPT 模型的四个配置包揽主榜前四。

第五名 Claude Fable 5(w.Tool)为 49.97 分,与第四名相差 5.23 分;第六名 Qwen3.7-Plus(w.Tool)为 38.43 分,与第五名相差 11.54 分。第六至第十名集中在 35.04---38.43 分之间,最大分差仅 3.39 分,构成较为接近的中部区间。

28 个"模型×工具配置"条目的平均结果分为 28.16,最高分与平均分相差 36.54 分。这表明,高难度前沿科学推理能力目前仍集中在少数模型上,尚未在本次参评模型中普遍形成。

过程质量与最终答案正确性并不完全一致

FSR-Bench分别评估过程分和结果分:过程分关注推理链是否完整、分析是否合理,结果分关注最终答案是否正确。两者独立评分,可以区分"分析看起来合理"和"真正得到正确结论"这两种不同的能力。

过程分与结果分的排名并不总是一致。开工具后,GPT 5.6 Sol(low,w.Tool)的所有题过程分为74.20,高于GPT-5.5(xhigh,w.Tool)的73.60;但两者的结果分分别为60.40和64.70,排名顺序发生反转。在纯文本题中,GPT 5.6 Sol(low,w.Tool)的过程分为78.70,同样略高于GPT-5.5(xhigh,w.Tool)的78.10,而结果分分别为 65.20 和 70.70,排名再次反转。这说明过程质量更高的模型配置,未必能更准确地抵达正确答案。

在开工具配置中,所有模型的过程分都高于结果分。两者差距从 GPT-5.5(xhigh,w.Tool)的 8.90 分到 Kimi-K3(w.Tool)的 27.60 分不等。这说明,部分模型能够形成结构完整、术语准确的分析,却可能在精确计算、证据引用、条件处理、单位换算或结论收敛环节出现错误。

工具整体提升得分,但不同模型的工具收益差异明显

在具有完整开关工具配对成绩的 14 款模型中,13 款模型开启工具后的结果分上升,平均结果分由 24.67 分提高至 31.65 分,平均增加 6.98 分。

不同模型的工具收益差异明显。Claude Fable 5 从 23.63 分升至 49.97 分,增加 26.34 分;Claude Sonnet 5 增加 24.95 分;Claude Opus 4.8 增加 18.57 分,Claude 系列包揽工具增益前三。相比之下,GPT-5.5 和 GPT 5.6 Sol 分别提高 4.50 分和 5.20 分;Gemini 3.5 Flash、Kimi-K3 和 Gemini 3.1 Pro 分别只提高 0.80 分、0.44 分和 0.30 分;Qwen3.6-Plus 开启工具后反而下降 1.00 分。

这说明,开工具并不意味着模型能够稳定获得更高分,模型还需要正确判断调用时机、提出有效的检索或代码请求、辨别外部信息质量,并将工具输出准确整合进最终答案。

纯文本题与"所有题"得分差异明显,影响因模型而异

FSR-Bench包含 425 道纯文本题和 442 道含图片或图表的多模态题。在总榜前二十名中,有十八款模型配置的纯文本题得分高于所有题得分,仅有两款例外。

具体来看,GPT-5.5(xhigh,w.Tool)的纯文本题结果分为 70.70,所有题结果分为 64.70,相差 6.00 分;Gemini 3.5 Flash(w.Tool)分别为 45.10 分和 36.00 分,相差 9.10 分;Gemini 3.1 Pro Preview(w.Tool)分别为 37.50 分和 24.10 分,相差 13.40 分。

仅有的两款例外来自Claude系列:Claude Fable 5(w.Tool)的所有题结果分反超纯文本题 0.64 分,Claude Sonnet 5(w.Tool)反超 2.32 分,差距均很微弱。

这说明,当模型需要同时理解专业文本、图片、图表和数值关系时,任务难度通常会进一步上升。Claude系列两款模型在多模态题上的表现并未出现明显下滑,说明多模态题的额外压力并非对所有模型同等显著,少数模型已展现出较好的跨模态整合能力。

模型在不同学科各有所长,没有全面领先

从总榜前 20 个模型配置的学科结果分看,八个学科的最高分全部来自 GPT-5.5 和 GPT 5.6 Sol 的相关配置。其中,GPT-5.5(xhigh,w.Tool)在地理、数学和金融上排名第一,GPT-5.5(xhigh)在天文上排名第一;GPT 5.6 Sol(low,w.Tool)则在化学、医疗、物理和生物上取得最高分。两款模型各领先四个学科,但具体优势对应的工具配置并不完全相同。

Gemini 3.5 Flash(w.Tool)虽然总榜仅排名第八,但化学成绩达到 64.10 分,在总榜前20个配置中位列第三;Kimi-K3不开工具配置总榜排名第十八,医疗成绩却达到 35.87 分,位列第六。相反,Claude Fable 5(w.Tool)以 49.97 分排名总榜第五,并在数学和金融上分别以 70.39 分和68.88分位列第四和第三,但其生物成绩仅为16.16分,在总榜前 20 个配置中排名第十九。这说明,综合排名靠后的模型仍可能在特定学科具备相对优势,而总榜靠前的模型也可能存在十分明显的学科短板。

开工具与不开工具配置之间的成绩差异也因学科而异。GPT-5.5(xhigh,w.Tool)相较 GPT-5.5(xhigh),化学、数学和物理结果分分别高出 10.10 分、7.50 分和 7.10 分,但天文和生物分别低 1.60 分和 1.70 分。GPT 5.6 Sol(low,w.Tool)相较 GPT 5.6 Sol(low),化学和数学分别高出 12.10 分和 10.00 分,但天文和金融分别低 4.80 分和 0.50 分。Gemini 3.5 Flash(w.Tool)相较 Gemini 3.5 Flash,化学、数学和生物分别高出 5.20 分、9.00 分和 2.10 分,但医疗、地理、天文、物理和金融均有所下降。可见,即使模型在开工具配置下的"所有题·结果分"更高,各学科成绩的变化方向和幅度也不完全一致。

总体而言,主榜排名概括了模型在 867 道题上的综合表现,但无法完整反映其在各学科、各题型和不同工具配置下的具体差异。综合得分较高的模型可能在某些学科明显失分,排名靠后的模型也可能在特定学科进入前列。

综合判断

从本次 FSR-Bench 评测结果来看,前沿大模型已经能够在部分高难度科学问题中形成较完整的分析,并借助工具提高最终得分,但这种能力在不同模型、学科和题型之间存在明显差异。

GPT-5.5在所有题结果分上取得最高分,GPT 5.6 Sol在过程分上略占优势,过程分普遍高于结果分,说明即便模型能够形成结构完整、表述流畅的分析过程,在精确计算、证据引用和最终结论收敛等环节仍可能出现偏差,分析过程的完整并不等同于结论的准确。Claude系列在开启工具后得分提升最为明显。加入图片和图表后,多数模型的得分有所下降,说明多模态推理仍是当前多数模型的薄弱环节。

注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。

写在最后

最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据

👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~

相关推荐
程序喵大人2 小时前
【C++进阶】STL算法与函数对象 - 02 sort为什么需要随机访问迭代器
开发语言·c++·算法
hanlin032 小时前
动态规划专练:力扣第121、122题
笔记·算法·leetcode
To_OC2 小时前
LC 74 搜索二维矩阵:换皮的二分查找,我居然一开始没看出来
javascript·算法·leetcode
文心快码BaiduComate2 小时前
文心快码荣获“中国优秀软件产品”,实力再获国家级认可
算法·代码规范
玖玥拾2 小时前
LeetCode 189 轮转数组
算法·leetcode
ZhangShao06072 小时前
题解:CF2249B
c++·算法
小玮看世界2 小时前
[Python]线段树与二分法
数据结构·算法
鹿角片ljp3 小时前
LeetCode 15. 三数之和 | 排序 + 双指针超详细复盘
算法
Tisfy5 小时前
LeetCode 3345.最小可整除数位乘积 I:暴力枚举(从n开始尝试)
数学·算法·leetcode·题解·枚举