突破 30 分!国内团队结合DeepSeek-R1与 X-Master,打破AI 评测纪录!

"人类最后的考试",被一支国内团队打破了纪录。

最近,国内团队在一场"人类最后的考试"中取得了历史性突破。由上海交通大学和深势科技联合研发的X-Master系统,在这场覆盖数学、物理、生物医药等100多个学科的高难度测试中,首次突破30分大关,以32.1分的成绩刷新了全球纪录。

可能很多人还不了解这个测试的分量。人类最后的考试(HLE),是今年初由AI安全中心和Scale AI联手推出的超难测试集。之所以被叫做"人类最后的考试",也在于这个大模型测试的难度是公认的天花板级别。

它由500多家机构的1000多名学者共同出题,包含3000多道研究生以上难度的题目。这次突破的核心是DeepSeek-R1模型与X-Master智能体的结合。

DeepSeek-R1在数学和编程领域本就表现突出。而X-Master则模拟人类研究者的动态问题解决过程,能在内部推理和外部工具调用之间高效切换。

比如遇到生物学问题时,它会自动生成代码调用专业数据库,通过实验数据验证推理结果。这种工具增强的推理模式,让模型在处理复杂问题时更接近人类专家的思维方式。

在TRQA-lit生物学专项测试中,它的准确率达到67.4%,远超同类模型。数学题上,它能通过分步推导解决高难度证明题;物理题中,它甚至能结合图像信息分析量子力学现象。

更重要的是,这套系统通过多智能体工作流X-Masters,将多个求解器的方案进行整合优化,最终输出最优解。通过分散-堆叠式的设计,它在面对开放性问题时也能保持较高的准确率。

HLE最初发布时,所有AI模型的成绩都不到10%,哪怕到现在,也鲜有模型的测试成绩超过20分。此前OpenAI的o1模型在HLE中仅得9.1分,谷歌Gemini 2.5 Pro也只有18.8分,而X-Master的32.1分几乎是它们的两倍。

更值得关注的是,上海交大团队采用的是完全开源的技术方案,所有模型和数据集都可在GitHub上获取。

这些成果背后,是国内团队在基础研究和工程化应用上的双重突破。论文作者栏,四位共同一作Jingyi Chai、Shuo Tang、Rui Ye、Yuwen Du都来自上海交大人工智能研究院,由陈思衡副教授指导。深势科技创始人张林峰也亲自署名支持。

在攀登AI高峰的路上,中国研究者正从跟跑者变为领跑者。这场"人类最后的考试"不仅是技术的较量,更是开源生态与闭源垄断的博弈。国内团队正以开放姿态推动技术普惠。

未来,随着HLE测试难度的持续升级,AI模型的挑战才刚刚开始。但可以预见,开源生态将成为推动技术进步的核心力量。

相关推荐
多恩Stone12 小时前
【3D AICG 系列-6】OmniPart 训练流程梳理
人工智能·pytorch·算法·3d·aigc
江瀚视野12 小时前
多家银行向甲骨文断贷,巨头甲骨文这是怎么了?
大数据·人工智能
ccLianLian12 小时前
计算机基础·cs336·损失函数,优化器,调度器,数据处理和模型加载保存
人工智能·深度学习·计算机视觉·transformer
asheuojj12 小时前
2026年GEO优化获客效果评估指南:如何精准衡量TOP5关
大数据·人工智能·python
多恩Stone12 小时前
【RoPE】Flux 中的 Image Tokenization
开发语言·人工智能·python
callJJ12 小时前
Spring AI ImageModel 完全指南:用 OpenAI DALL-E 生成图像
大数据·人工智能·spring·openai·springai·图像模型
铁蛋AI编程实战12 小时前
2026 大模型推理框架测评:vLLM 0.5/TGI 2.0/TensorRT-LLM 1.8/DeepSpeed-MII 0.9 性能与成本防线对比
人工智能·机器学习·vllm
23遇见12 小时前
CANN ops-nn 仓库高效开发指南:从入门到精通
人工智能
SAP工博科技12 小时前
SAP 公有云 ERP 多工厂多生产线数据统一管理技术实现解析
大数据·运维·人工智能
芷栀夏12 小时前
CANN ops-math:异构计算场景下基础数学算子的深度优化与硬件亲和设计解析
人工智能·cann