名列前茅!百度文心大模型4.5及X1在中国信通院“方升”大模型基准测试中表现优异

中国人工智能产业发展联盟(以下简称"AIIA")紧密跟踪大模型和智能体的技术发展与行业应用动态,构建并发布了"方升"(FactTesting)大模型基准测试体系,自2024年以来已对国内外开源与闭源大模型开展了6轮能力监测,累计测试了200余个大模型,持续跟踪其技术演进与表现,为行业技术选型与能力评估提供了重要依据。2025年,评测范围进一步扩展至多模态理解、文生图、文生视频等领域,并率先开展智能体测试的研究与实践,初步构建了智能体测试验证平台,为产业界提供全面的技术评估参考。

2025年4月9日,在南京召开的中国人工智能产业发展联盟第十四次全体会议上,中国人工智能产业发展联盟正式发布"方升"大模型基准测试结果(2025年1季度)。

"方升"大模型基准测试结果发布现场

在权威发布环节,AIIA 总体组组长、中国信通院人工智能研究所所长魏凯发布了"方升"人工智能基准测试结果及测试观察。在大语言模型测试结果中,文心大模型4.5在基础能力结果、文心大模型X1在推理能力结果中均名列前茅。

大语言模型-基础能力测试结果

大语言模型-推理能力测试结果

3月16日,百度正式发布文心大模型4.5和文心大模型X1。

文心大模型4.5 是百度自主研发的新一代原生多模态基础大模型,通过多个模态联合建模实现协同优化,多模态理解能力优秀;具备更精进的语言能力,理解、生成、逻辑、记忆能力全面提升,去幻觉、逻辑推理、代码能力显著提升。

文心大模型X1具备更强的理解、规划、反思、进化能力,并支持多模态,**是首个自主运用工具的深度思考模型。**作为能力更全面的深度思考模型,文心大模型X1兼备准确、创意和文采,在中文知识问答、文学创作、文稿写作、日常对话、逻辑推理、复杂计算及工具调用等方面表现尤为出色。

文心一言官网

目前,两款模型已在文心一言官网上线,免费向用户开放。(yiyan.baidu.com

2025是大模型技术全面迭代的一年,百度将在人工智能、数据中心、云基础设施上更大胆地投入,打造更好、更智能的下一代模型。

----------END----------

推荐阅读

飞桨新一代框架3.0正式发布:加速大模型时代的技术创新与产业应用

即刻体验!文心大模型X1现面向企业用户全面开放!

一篇论文,看见百度广告推荐系统在大模型时代的革新

前沿多模态模型开发与应用实战3:DeepSeek-VL2多模态理解大模型算法解析与功能抢先体验

秒哒首发即爆发!上线首日吸引2万用户,打造3万应用!

相关推荐
交通上的硅基思维1 天前
人工智能安全:风险、机制与治理框架研究
人工智能·安全·百度
人工智能AI技术1 天前
手搓一个AI搜索引擎:基于百度DeepSearch框架的实战开发笔记
人工智能·百度
陈思杰系统思考Jason2 天前
系统思考与敏捷的区别
百度·微信·微信公众平台·新浪微博·微信开放平台
zhangfeng11333 天前
千帆平台目前不支持用户自助上传自定义词表(vocabulary)进行训练 Post-pretrain 阶段 SFT都不支持
人工智能·百度
wei_shuo3 天前
「源力觉醒 创作者计划」_百度开源文心 4.5 系列开源大模型:ERNIE-4.5-VL-28B-A3B-Paddle vs DeepSeek-R1 多维度测评分析
百度·开源·文心大模型·gitcode
数据猿3 天前
我参与了百度文心App AI群聊内测,提前感受到了社交AI的革命
人工智能·百度
大力财经3 天前
性能超越DeepSeek-OCR2,百度发布并开源新一代SOTA OCR模型
百度
小朱笼包3 天前
小程序实现对接百度AI大模型,通过websocket连接进行百度实时语音识别,将返回的文字调用AI大模型API获得返回的消息内容进行文字转语音朗诵并操作
人工智能·websocket·百度·小程序·语音识别
陈思杰系统思考Jason3 天前
系统思考:以客户为中心
百度·微信·微信公众平台·新浪微博·微信开放平台
陈思杰系统思考Jason4 天前
系统思考:创造价值并非卖时间
百度·微信·微信公众平台·新浪微博·微信开放平台