刚刚,谷歌发布了Gemini 3.1 Pro,同时Google AI Studio也已经支持全栈应用开发。

Shadow:刚刚,谷歌发布了Gemini 3.1 Pro 模型,多项指标再次领先,非常适合用于开发算法、复杂编程以及需要多步工作流执行的Agent场景。在机器学习研发挑战中,该模型将微调脚本的耗时从 300 秒极限压缩至 47 秒 ------ 不仅宣告了'手动调优'时代的落幕,甚至比顶尖人类专家(94 秒)还快了一倍。

以下为详细介绍:

1. Gemini 3.1 Pro

Gemini 3.1 Pro 是 Google Gemini 3 系列模型的最新迭代版本,是目前 Google 处理复杂任务最先进的原生多模态推理模型。它不仅能理解文本、音频、图像和视频,还能深度解析整个代码库,专为解决现实世界的复杂问题、强化逻辑推理、激发创造力以及进行战略规划而设计。

2. 在哪里可以使用?

Gemini 3.1 Pro 通过以下多种渠道分发,用户无需特定硬件即可使用:

  • Gemini App:面向普通用户的交互界面。
  • Google AI Studio & Gemini API:面向开发者进行快速开发和原型设计。
  • Google Cloud / Vertex AI:提供企业级的托管服务。
  • NotebookLM:用于深度学习和文档分析。
  • Google Antigravity:特定的分发渠道之一。

我第一时间在Google AI Studio测试了下:制作一个记忆操作系统。

在生成过程提示可能的操作:Enjoy these tips while you wait

思考时间明显比Gemini 3 Pro更长。

注意一个细节,开始支持全栈应用的开发了,我看到框架已经使用express。

如果你想尝试vibe coding更多的应用,可以查阅最新书籍:

(私信加入读者群)

3. 性能提升(对比 Gemini 3 Pro)

根据谷歌的介绍 Gemini 3.1 Pro 在多个核心维度上较前代 Gemini 3 Pro 有了质的飞跃:

  • 抽象推理能力的跨越式增长 :在 ARC-AGI-2 (抽象推理拼图)测试中,得分从 31.1% 飙升至 77.1% ,展示了极强的逻辑推演能力。
  • 代理执行与搜索能力(Agentic Performance)
    • BrowseComp

      (代理搜索任务)得分从 59.2% 提升至 85.9%

    • APEX-Agents

      (长程专业任务)得分从 18.4% 几乎翻倍至 33.5%

    • MCP Atlas

      (多步工作流)从 54.1% 提升至 69.2%

  • 编程与学术推理
    • LiveCodeBench Pro

      (竞赛编程)Elo 分数从 2439 提升至 2887

    • Humanity's Last Exam

      (学术推理)在无工具模式下从 37.5% 提升至 44.4%

  • 长文本与多模态理解
    • MRCR v2

      (长上下文性能)在 128k 平均值上从 77.0% 优化至 84.9%

    • 模型支持高达 100 万(1M)token 的超大输入上下文窗口。

  • 安全性与情境意识 :在"深思模式"(Deep Think mode)下,模型表现出更强的情境意识,在某些挑战(如 Context size mod)中达到了近 100% 的成功率。

欢迎加入社群交流

讲座:Gemini黑客松4000+灵感拆解

更多:storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Pro-Model-Card.pdf

相关推荐
@Mr_LiuYang3 分钟前
状态栏动态上下文信息追加到Agent --《深入理解 AI Agent :设计原理与工程实践》实验2-8
人工智能·大模型·动态上下文·状态栏信息追加
碳基猿30 分钟前
新媒体运营的终局:从“内容创作”走向“运营系统竞争”
人工智能·新媒体运营·产品运营·新媒体矩阵·多账号管理·矩阵分发·矩阵运营方法论
阿里云大数据AI技术35 分钟前
阿里云 EMR Daft AI Function:用 DataFrame 表达式搞定大模型调用与多模态向量化
人工智能·spark
jerryinwuhan41 分钟前
鱼苗投放检测系统设计
人工智能
阿里云大数据AI技术1 小时前
官宣|Apache Fluss 毕业成为顶级项目,湖流一体开启 Agentic Lake 全面实时化时代
人工智能·flink
敲代码的玉米C1 小时前
测试一直在写你的真实数据根
前端·人工智能·架构
Mr.huang1 小时前
自注意力机制(Self‑Attention)
人工智能·深度学习
品牌测评2 小时前
大模型推理算力平台推荐分享|六家平台计费与架构拆解
大数据·人工智能·架构
武汉万象奥科2 小时前
8路AHD摄像头同时输出演示,万象奥科RK3576 AHD硬件方案
人工智能·计算机视觉
LedgerNinja2 小时前
WEEX 真实情况如何?交易平台如何判断是否可靠
大数据·人工智能·区块链