DeepSeek 逼出谷歌新推理模型:40 分优势超 GPT4.5 登顶竞技场,支持原生多模态,但依然败给了 “竹竿问题”

又双叒,抢在 OpenAI 直播之前,谷歌 Gemini 2.5 系列来了。

首个版本 Pro Experimental 一登场就抢下大模型竞技场第一名,并且整整比 GPT-4.5 高出 40 分!

Gemini 2.5 同样是推理模型,用 Jeff Dean 的说法是:

这是我们最智能的模型,具有令人印象深刻的高级推理和编码能力。

Be like,给出一段提示词:

帮我制作一款吸引人的无尽跑酷游戏。屏幕上要有关键操作说明。使用 p5js,不要用 HTML。我喜欢像素风格的恐龙和有趣的背景。

1 分钟左右,就能得到:


谷歌 "最先进复杂任务模型"

谷歌介绍,相较于 Gemini 2.0 Flash Thinking 这个谷歌首个推理模型,Gemini 2.5 在基础模型和后训练技术上都有改进。

不仅是在大模型竞技场上一举拿下高分,在各种推理、数学、科学、编程基准上,Gemini 2.5 Pro 都表现出色,属于是编程能跟 Claude 3.7 Sonnet 掰手腕,数学能跟 Grok 3 相媲美。

更详细测试结果看这里:

Gemini 2.5 Pro 的上下文窗口是 1M tokens,并且支持原生多模态:可以理解庞大数据集并处理来自不同信息源的复杂问题,包括文本、音频、图像、视频,甚至是整个代码库。

在推理能力之外,谷歌官方还强调了一把 Gemini 2.5 Pro 的编程性能:

2.5 pro 擅长创造视觉上引人注目的 Web 应用程序和智能体代码。

谷歌 DeepMind 研究员们也释出了更多案例,比如把 "六边形内旋转小球" 这事整得更加酷炫:

视频详情

p.s. 距离谷歌上新 Gemini 2.0 家族,也不过一个多月时间,怕不是让 DeepSeek 给逼急了(doge)。

目前,Gemini 2.5 Pro 已经面向 Gemini Advanced 付费用户开放,开放人员也可以在 Google AI Studio 中试用。谷歌表示,未来几周内还将在 Vertex AI 上推出该模型。

不过,当我们拿最新大模型难题 "竹竿问题" 测试 Gemini 2.5 Pro 时,它并没能顺利通关。

试玩地址:
aistudio.google.com/app/prompts...

参考链接:
blog.google/technology/...

欢迎在评论区留下你的想法!

--- 完 ---

相关推荐
揽秀亭长几秒前
视频转脚本怎么处理更高效?四种工具的工作流程与适用场景分析
人工智能·音视频·语音识别
大虾别跑3 分钟前
ai-daily-2026-10-10
人工智能
鲲穹AI种草7 分钟前
小红书 AI 创作工具怎么选,多款工具实际使用情况整理
人工智能·文案创作
龙亘川10 分钟前
城市运管服平台下综合办公数字化建设实践与思考
大数据·人工智能·智慧城市·开源软件·数据可视化
IT_陈寒11 分钟前
Vue的数组更新把我坑惨了
前端·人工智能·后端
呆呆槑_Xiong12 分钟前
2026年GEO优化服务商怎么选?从AI用户增长看企业品牌可见度
人工智能
杨文说AI与数字化13 分钟前
拆开 Agent 的账单:为什么“判断”这一层值得一个专用模型
人工智能
2601_9653053914 分钟前
工厂扬尘噪声在线监测设备安装需要什么条件?从点位、供电到联网的工程清单
人工智能
天远数科16 分钟前
零信任架构实战:基于天远风控经营异常预警构建自动化电子签章前置合规网关
运维·人工智能·架构·自动化
染指111018 分钟前
141.Agent-多Agent框架-编写并使用Skills
人工智能·语言模型·langchain·skill·agents