Google发布Gemma 3 多模态多语言大模型

传送锚点

Google正式推出Gemma家族的最新力作Gemma 3,这标志着开源AI领域又一次重要突破。Gemma 3不仅继承了前代模型的优秀基因,更在多模态理解、多语言支持以及超长上下文处理方面实现了飞跃,为开发者和研究者提供了前所未有的强大工具。

Gemma 3核心亮点

Gemma 3系列模型提供了10亿、40亿、120亿及270亿参数四种规模,以满足不同应用场景的需求。其中,40亿、120亿和270亿参数的模型首次实现了多模态功能,能够同时处理图像和文本输入,而10亿参数版本则专注于纯文本处理。

该系列模型的上下文窗口长度显著提升,10亿参数版本支持32k tokens,其余版本更是达到了惊人的128k tokens。这意味着Gemma 3能够理解和生成更长的复杂内容,极大地扩展了其在文档分析、长篇对话等领域的应用潜力。此外,40亿、120亿和270亿参数的模型还支持超过140种语言,展现出卓越的全球化适应能力。

技术革新深度解析

Gemma 3的核心能力提升得益于一系列精妙的技术创新。

长上下文处理 为了实现128k tokens的超长上下文,Google优化了模型的预训练策略,在不从头训练的情况下,将部分模型从32k序列高效扩展至128k。这包括将旋转位置编码RoPE的基频从Gemma 2的10k提升到1M,并按8倍因子进行缩放。KV缓存管理也进行了优化,采用了Gemma 2的滑动窗口交错注意力机制,将局部层与全局层的交错比例调整为5比1,并将窗口大小缩减至1024 tokens,在节省内存的同时保持了性能。

多模态融合 Gemma 3采用SigLIP作为图像编码器,将图像转化为语言模型可处理的tokens。其输入图像固定为896x896像素。为应对非方形或高分辨率图像,模型在推理时引入了"pan and scan"算法,通过自适应裁剪图片区域,实现了对图像细节的更精细捕捉。

在注意力机制方面,Gemma 3对文本输入采用单向注意力,而图像输入则采用无掩码的双向注意力,确保对视觉内容的全面理解。

多语言能力增强 为增强多语言覆盖,Gemma 3的预训练数据集将多语言数据量翻倍。同时,采用了与Gemini 2.0相同的SentencePiece分词器,包含26.2万词条。此分词器显著改进了中文、日文和韩文文本的编码效率,即使英语和代码的token计数略有增加,整体收益也十分可观。

性能表现与未来展望

在LMSys Chatbot Arena的Elo评分中,Gemma 3 27B IT模型取得了1339分的成绩,位列前十,其表现与o1-preview相当,并超越了其他非思维链的开源模型。值得一提的是,Gemma-3-4B-IT的性能超越了前代Gemma-2-27B IT,而Gemma-3-27B-IT在多项基准测试中甚至击败了闭源模型Gemini 1.5-Pro。这充分展示了Gemma 3在推理、数学和多模态能力上的强大实力,同时作为开源模型,其开放性使得先进AI技术更加触手可及。

Hugging Face平台已对Gemma 3提供全面支持,用户可以在Hugging Face Hub上找到所有模型变体,并利用transformers库进行快速推理。此外,模型还支持MLX用于Apple Silicon设备以及llama.cpp的GGUF文件,方便在低资源设备上部署。Hugging Face Endpoints也提供了一键部署选项,加速了Gemma 3的应用落地。

这份发布不仅是Google在开源AI领域的又一重磅贡献,更是推动通用人工智能技术普惠化的重要一步。Gemma 3的出现,无疑将激发更多创新应用,加速AI技术在各行各业的融合与发展。

相关推荐
GitCode官方11 小时前
基于昇腾 MindSpeed LLM 玩转 DeepSeekV4-Flash 模型的预训练复现部署
人工智能·开源·atomgit
大刘讲IT11 小时前
AI重塑企业信息价值标准:从“系统供给”到“用户定义”的企业数字化新范式
人工智能·经验分享·ai·制造
流年似水~11 小时前
MCP协议实战:从零搭建一个让Claude能“看见“数据库的工具服务
数据库·人工智能·程序人生·ai·ai编程
jay神11 小时前
VisDrone2019-DET 无人机小目标检测数据集
人工智能·深度学习·yolo·目标检测·计算机视觉·毕业设计·无人机
乔江seven11 小时前
【李沐 | 动手学深度学习】17 深度学习硬件:CPU 和 GPU
人工智能·深度学习·深度学习硬件·cpu和gpu
深海鱼在掘金11 小时前
深入浅出 LangChain —— 第二章:环境搭建与快速上手
人工智能·typescript·langchain
qq_4112624212 小时前
四博 AI 机械臂台灯智能音箱方案
人工智能·智能音箱
qq_4112624212 小时前
基于 ESP32-S3 + VB6824 的四博三模联网 AI 智能音箱方案设计
人工智能·智能音箱
qq_4112624212 小时前
四博 AI 双目智能音箱技术方案
人工智能·智能音箱
甲维斯12 小时前
测一波MiMo 2.5 Pro,看看真实实力!
人工智能