突破 30 分!国内团队结合DeepSeek-R1与 X-Master,打破AI 评测纪录!

"人类最后的考试",被一支国内团队打破了纪录。

最近,国内团队在一场"人类最后的考试"中取得了历史性突破。由上海交通大学和深势科技联合研发的X-Master系统,在这场覆盖数学、物理、生物医药等100多个学科的高难度测试中,首次突破30分大关,以32.1分的成绩刷新了全球纪录。

可能很多人还不了解这个测试的分量。人类最后的考试(HLE),是今年初由AI安全中心和Scale AI联手推出的超难测试集。之所以被叫做"人类最后的考试",也在于这个大模型测试的难度是公认的天花板级别。

它由500多家机构的1000多名学者共同出题,包含3000多道研究生以上难度的题目。这次突破的核心是DeepSeek-R1模型与X-Master智能体的结合。

DeepSeek-R1在数学和编程领域本就表现突出。而X-Master则模拟人类研究者的动态问题解决过程,能在内部推理和外部工具调用之间高效切换。

比如遇到生物学问题时,它会自动生成代码调用专业数据库,通过实验数据验证推理结果。这种工具增强的推理模式,让模型在处理复杂问题时更接近人类专家的思维方式。

在TRQA-lit生物学专项测试中,它的准确率达到67.4%,远超同类模型。数学题上,它能通过分步推导解决高难度证明题;物理题中,它甚至能结合图像信息分析量子力学现象。

更重要的是,这套系统通过多智能体工作流X-Masters,将多个求解器的方案进行整合优化,最终输出最优解。通过分散-堆叠式的设计,它在面对开放性问题时也能保持较高的准确率。

HLE最初发布时,所有AI模型的成绩都不到10%,哪怕到现在,也鲜有模型的测试成绩超过20分。此前OpenAI的o1模型在HLE中仅得9.1分,谷歌Gemini 2.5 Pro也只有18.8分,而X-Master的32.1分几乎是它们的两倍。

更值得关注的是,上海交大团队采用的是完全开源的技术方案,所有模型和数据集都可在GitHub上获取。

这些成果背后,是国内团队在基础研究和工程化应用上的双重突破。论文作者栏,四位共同一作Jingyi Chai、Shuo Tang、Rui Ye、Yuwen Du都来自上海交大人工智能研究院,由陈思衡副教授指导。深势科技创始人张林峰也亲自署名支持。

在攀登AI高峰的路上,中国研究者正从跟跑者变为领跑者。这场"人类最后的考试"不仅是技术的较量,更是开源生态与闭源垄断的博弈。国内团队正以开放姿态推动技术普惠。

未来,随着HLE测试难度的持续升级,AI模型的挑战才刚刚开始。但可以预见,开源生态将成为推动技术进步的核心力量。

相关推荐
星越华夏7 小时前
计算机视觉:YOLOv12安装环境
人工智能·yolo·计算机视觉
Yolanda948 小时前
【人工智能】《从零搭建AI问答助手项目(九):Prompt优化》
人工智能·prompt
wj3055853788 小时前
课程 9:模型测试记录与 Prompt 策略
linux·人工智能·python·comfyui
小和尚同志8 小时前
深入使用 skill-creator:结合真实生产级实践
人工智能·aigc
DevSecOps选型指南8 小时前
安全419专访悬镜安全 | 穿越周期在 AI 浪潮中定义数字供应链安全新范式
人工智能
沪漂阿龙8 小时前
面试题详解:GraphRAG 全面解析——知识图谱增强 RAG、Local Search、Global Search、社区摘要、工程落地与评估指标一次讲透
人工智能·知识图谱
WangN28 小时前
Unitree RL Lab 学习笔记【通识】
人工智能·机器学习
haina20198 小时前
海纳AI亮相《科创中国》,解码招聘“智”变之路
人工智能·ai面试·ai招聘
阿星AI工作室9 小时前
刘润年中大课笔记:一句话说清AI落地之战的本质
大数据·人工智能·创业创新·商业
qingfeng154159 小时前
企业微信机器人开发:如何实现自动化与智能运营?
人工智能·python·机器人·自动化·企业微信