Unified-IO 2 模型: 通过视觉、语言、音频和动作扩展自回归多模态模型。给大家提前预演了GPT5?

每周跟踪AI热点新闻动向和震撼发展 想要探索生成式人工智能的前沿进展吗?订阅我们的简报,深入解析最新的技术突破、实际应用案例和未来的趋势。与全球数同行一同,从行业内部的深度分析和实用指南中受益。不要错过这个机会,成为AI领域的领跑者。点击订阅,与未来同行! 订阅:https://rengongzhineng.io/

首个自回归的多模态模型,能够理解和生成图像、文本、音频和动作。为了统一不同的模态,将输入和输出------图像、文本、音频、动作、方框等,标记化到一个共享的语义空间中,然后使用单一的编码器-解码器变换模型来处理它们。由于训练如此多样化的模态极其困难,提出了各种架构改进以稳定模型。从零开始训练的模型,在一个大型多模态预训练语料库上进行训练,该语料库来源于多种渠道,使用多模态去噪目标混合。为了学习广泛的技能,比如遵循多模态指令,构建并微调了一个由120个现有数据集组成的集合,其中包括提示和增强。通过单一的统一模型,统一输入输出 2 在 GRIT 基准测试中实现了最先进的性能,并在包括图像生成与理解、文本理解、视频和音频理解以及机器人操控等30多个基准测试中取得了强有力的成绩。

它基于区区70亿参数构建,并经过大量多模态数据的精心训练(包括10亿图像-文本配对、1万亿文本标记,以及大量的视频、图像和3D内容)。在超过35个不同的基准测试中表现出色,统一输入输出 2 不仅仅是人工智能领域的一步,而是一大跃进,展示了多模态训练在理解和生成复杂、跨媒介内容方面的巨大潜力。

所有模型发布给研究社区。

详细的区看看: https://unified-io-2.allenai.org/https://github.com/allenai/unified-io-2

相关推荐
HRTOS6 分钟前
HRTOS应用示例:信号量机制详解
c语言·人工智能·嵌入式硬件·51单片机
鲲穹AI种草9 分钟前
AI 证件照制作处理,多款证件照工具能力客观记录
人工智能·证件照
西柚小萌新12 分钟前
【LLM&&AI应用开发 八股文】--RAG的分块策略
人工智能
商业白皮书14 分钟前
企业大模型应用可获得哪些安全防护能力?Amazon Bedrock Guardrails 从内容过滤到规则验证搭建 AI 安全护栏
网络·人工智能·安全
Yan-英杰15 分钟前
从“投屏“到“办公“,ToDesk鸿蒙版4.8.0.0补齐远控“进入→处理→离开“全流程
服务器·人工智能·爬虫·机器学习·ai开发工具
CCYe、22 分钟前
企业AI网关中的密钥生命周期:从一把Key走天下到自动轮换
网络·人工智能·安全
小蒋观天下27 分钟前
2026交通安防AI摄像头完整选型指南
大数据·人工智能
Alter123035 分钟前
算力决定下限,存力决定上限:Gartner魔力象限背后的AI存储暗战
大数据·人工智能
为自己_带盐43 分钟前
AI驱动历史项目安全审查
人工智能·安全
2601_954811821 小时前
AI科学实验室MHS标准解读:AI智能体如何统一控制实验室设备接口
人工智能·python