符号诞生之前:视觉通用智能如何开启 AGI 的物理进化之路

符号诞生之前:视觉通用智能如何开启 AGI 的物理进化之路

由全球多家顶尖学术机构、科研高校以及前沿工业界实验室共同合作发表名为《Visual General Intelligence: Pathways and Perspectives in the AGI Era》白皮书,它探讨了视觉通用智能(VGI) 作为实现通用人工智能(AGI) 潜在路径的可能性。研究者们认为,视觉模态 不仅是传感器输入,更是捕捉世界结构的核心智能功能 ,其演化历史远早于语言。文中提出了多种观点,包括将生成式视频模型 视为视觉基础模型,以及强调具身智能 在物理世界中感知与行动的重要性。不同于目前的语言中心模型,VGI 旨在通过预测、想象和重建 等机制,从视觉经验中自主提取知识。该研究不仅关注模型规模的扩展 ,还探讨了持续学习物理结构恢复 以及多模态融合 对构建全面智能系统的关键作用。总之,这一议程试图理清视觉在人工智能时代应追求的原则,以实现超越人类水平的通用认知能力

在人工智能(AI)的发展中,视觉通用智能(VGI)与传统大语言模型(LLMs)区别

在人工智能(AI)的发展中,视觉通用智能(VGI)与传统大语言模型(LLMs)在数据本质、智能起源、物理理解、感知交互以及学习机制上存在着本质区别

  1. 智能的演化起点与历史底蕴不同

    • LLMs 依赖于极年轻的人类文化产物:人类的高级语言和文字系统在生命的进化史上是极近期才出现的现象。大语言模型处理的是高度抽象、已被人类高度压缩过并符号化的人类经验。
    • VGI 扎根于更底层的世界感知智能:复杂的视觉系统(如眼睛)在生物进化史上可以追溯到大约 5 亿年前的寒武纪,是生物体与物理世界互动、捕获世界结构的最底层和最基础的智能功能。在智能系统能够用语言描述世界之前,它必须首先发现并发现世界的底层物理结构。
  2. 信息载体与符号化层级的差异

    • LLMs 拥有天然的符号化分级结构:LLMs 建立在人类预设的词义、短语、句子和文档等清晰的符号层级之上,利用子词 Token 进行高效的表征与推理。
    • VGI 缺乏天然的符号单元:视觉数据高维、密集且高度连续,像素由于过于底层而无法作为智能的感知基元,而图像补丁(Patches)也仅仅是工程上的便利,而非真正的语义抽象。这导致视觉学习无法依赖现有的符号压缩层,必须自主探索如何过滤和压缩信息,其学习成本极高,通常需要比语言预训练高出 1,000 到 10,000 倍的有效计算和数据处理,才能自然浮现出正确的视觉抽象。
  3. 对物理世界规律的表征与理解深度

    • LLMs 难以触及语言之外的物理世界:语言是人类对经验的抽象,但物理世界的许多精细规律、材料属性和动态交互(例如面团对擀面杖的反应、花朵盛开并枯萎的过程)在文字中鲜有详细描述。单纯依赖文本统计预测的 LLMs 无法真正感知这些未命名的世界结构。
    • VGI 致力于恢复真实的物理结构与动力学:仅仅预测像素或生成逼真的视频并不等同于真正理解物理。VGI 的目标是恢复物理世界的组合结构(包括实体、几何、材质等内在属性,光照和姿态等外在属性,以及物体的支持与包含关系等)。它需要建模并理解质量、摩擦力、关节轴等不可见物理变量,以便支持干预、编辑、模拟和验证。
  4. 感知模式:被动输入 vs. 主动具身交互

    • LLMs 的旁观者模式:传统的 LLMs 通常以被动的形式接收和处理预先收集、分块好的静态文本序列。
    • VGI 的主动具身特性:VGI 往往与具身智能(Embodied AI)紧密结合。智能体不只是被动的观察者,而是可以通过主动改变视点、移动、甚至通过推、拉、提起物体等物理干预行为来消除感知歧义,从而获取常规被动观测无法得到的物理和几何属性。在这种闭环中,视觉指导行动,而行动的反馈和结果反过来不断修正、完善视觉世界模型。经典生物视觉研究也证实了感知与自发行动耦合的重要性(如 Held 和 Hein 的猫动作实验)。
  5. 学习机制:静态冻结 vs. 持续生命周期学习

    • LLMs 的单次训练与冻结:当前的 LLMs 通常在静态数据集上完成一次性预训练后即被部署为固定模型,无法随着现实世界的发展实时、动态地重新组织理解,只能依靠后续的数据重训。
    • VGI 追求在整个"视觉生命周期"中持续进化:VGI 强调在智能体自身的运转过程中进行连续、无监督、无需重新打乱历史数据的学习。它由相互作用的感知、空间与动态世界模型、多尺度存储及行动接口组成,使模型能在运转过程中检测新奇事件、保留有用知识并实现稳定持续的自我提升。

九大核心观点

在人工智能进入通用人工智能(AGI)时代的关键节点,白皮书《Visual General Intelligence: Pathways and Perspectives in the AGI Era》汇总了来自不同顶尖研究机构的学者对视觉通用智能(VGI) 的核心探索和观点。白皮书中展示的九大核心观点(对应章节 2.1 至 2.9)从不同的侧面描绘了如何从视觉经验中培育出通用智能,并阐明了计算机视觉应当追求的底层原理:

1. 视频模型是视觉基石模型 (Video models are visual foundation models)

  • 提出者:Robert Geirhos (Google DeepMind)
  • 核心内容大规模训练 + 生成式目标是让视频模型演变为像 LLM 那样能够统一整个视觉领域的关键。
  • 核心逻辑
    • 传统的图像分类(如 ImageNet)太容易让模型通过利用纹理或背景等局部"捷径"混过关。而生成式目标则是一项极具挑战的任务,它逼迫模型掌握物体、背景、纹理、几何、光影等一切世界的内在元素,从而学到真正有意义的世界规律。
    • 视频生成是许多视觉任务最通用的框架,静止图像可以被看作其特例。实验(如 Veo 3)表明,先进的生成式视频模型在无特定任务训练下,已能作为视觉基石模型,通过"图生视频"以零样本(Zero-shot)方式解决边缘检测、目标分割、图像编辑、超分辨率甚至迷宫和图遍历等视觉推理任务。

2. 创造力是检验 VGI 的核心测试 (Creativity as a Test of Visual General Intelligence)

  • 提出者:Aditi Raghunathan (Carnegie Mellon University)
  • 核心内容 :智能不能仅局限于寻找单一正确答案的任务。在面对开放式、有约束的视觉任务时,模型能否表现出**"算法创造力"**是检验 VGI 的核心测试。
  • 核心逻辑
    • 视觉创造力包括组合创造力(在熟悉元素间建立新联系)与探索性创造力(在物理、几何、语义或任务约束下构建新模式)。
    • 视觉创造力需要全局的协调与规划。评估视觉创造力应该关注三个重要属性:连贯性 (满足物理、几何与语义约束)、结构多样性 (输出实质不同的多样化方案而非表面的颜色/纹理变化)和原创性(相对于训练数据的独创性)。
    • 研究表明,相比传统的"预测下一Token",基于无教师训练(teacherless training)和扩散模型等"多Token方法"能更有效地表达高层布局规划,生成更具结构多样性与原创性的解决方案。

3. 在"生命周期"中持续进化、自主学习的系统 (A learning system that learns from one datum)

  • 提出者:Yuki M. Asano (University of Technology Nuremberg)
  • 核心内容 :目前的视觉系统是被动且训练完就被冻结的。真正的 VGI 应该像生物那样,在整个**"视觉生命周期"中连续、无监督且自主地学习**并重构对世界的理解。
  • 核心逻辑
    • 生物在能够用语言描述世界之前,就已经通过持续的感官体验和物理相互作用,自发发现了世界的深层结构(如物体的持久存在性、运动、遮挡与包容关系)。
    • 一个稳健的人工视觉大脑应该由感知系统、空间和动态世界模型、多尺度存储系统以及任务行动接口等多个相互作用、更新频率不同的子系统组成。语言应当是后续用来查询和引导已对齐物理世界的交互界面,不应是视觉系统最核心的组织原则。

4. 视觉智能将是多模态、生成式且高效的 (Intelligence will be multimodal, generative, and efficient)

  • 提出者:Deva Ramanan 等 (Carnegie Mellon University)
  • 核心内容 :实用的视觉智能(尤其在具身智能/机器人领域)不能仅靠视觉,而应走向多模态原生融合、全生成式建模与极致计算能效
  • 核心逻辑
    • 视觉包含了高维、极其丰富的物理世界信息,必须本体感觉、触觉等其他多模态信号进行原始信号级别的预训练融合。
    • 生成式建模(如视频扩散/流模型)是自监督学习的天然进化,未来将彻底取代显式表征学习(如DINO和JEPA)。
    • 由于视频生成的能耗和计算成本极其高昂,未来必须通过重新融入递归机制(以维持长视频一致记忆)、3D 空间结构和多尺度处理等经典概念来提升能效,并且依靠强化学习和多样性数据策展,而非无节制地扩展数据规模。

5. 视觉智能推动科学发现 (Visual Intelligence and Discovery)

  • 提出者:David Fouhey (New York University)
  • 核心内容 :科学发现是检验 VGI 的独特阵地。VGI 的科学应用面临数据高度受限、缺乏传统基准真值,且必须通过物理学与跨模态先验来校准的挑战。
  • 核心逻辑
    • 科学领域的关键数据(如历史观测、特定生物演化标本)往往无法重复收集,导致数据量极度受限。
    • 科学观测往往没有现成的真值排行榜,验证过程需要长期地将模型的估计结果与已有的物理学公式或跨仪器观测进行交叉校验(例如通过原子物理学将太阳冕区的热结构预测与 X 射线观测对齐)。
    • 科学仪器往往自带非物理系统性误差(伪影),模型必须能够深度分离出真实信号,并支持针对此类系统误差的可编辑剔除。

6. 构建空间 AI 的持久表征与高效硬件结构 (What is the Computational Structure of Spatial AI?)

  • 提出者:Andrew J. Davison (Imperial College London)
  • 核心内容 :空间 AI(Spatial AI)的核心是让设备在极端受限的硬件条件下,构建出**高品质、任务无关且持久自适应的环境表征(如密集场景图、物理属性)**以支持通用交互。
  • 核心逻辑
    • 空间 AI 的前身是 SLAM(即时定位与地图构建),解决的核心问题是如何在有限算力和内存预算内,从多传感器流中实时构建持久表征,并实现在有限资源内无漂移地更新 3D 地图、物体层级场景图及动力学属性。
    • 未来的芯片处理器趋势是高度并行的细粒度核心、内存与计算单元就近 geographic 地融合(Tile 布局)并使用异步、低位宽传输。因此,算法必须能够在这种多核局部互连的图结构硬件上,通过异步消息传递(如信念传播算法)来执行推理和学习,使得软件计算图在芯片地理布局上对齐,最终实现类似生物大脑般的高能效。

7. 视觉智能本质上是具身智能 (Visual Intelligence is Embodied Intelligence)

  • 提出者:Yilun Du (Harvard University)
  • 核心内容具身化 不仅是视觉的下游应用,更是其核心检验标准:智能体必须通过主动交互与选择视角来校准、丰富其世界模型。
  • 核心逻辑
    • 静态的被动观测极易产生感知歧义,而具身智能体可以通过物理干预(如推、拉、提)来揭示隐藏属性(如关节连接、质地稳定度),甚至主动寻找Surprisal(惊讶度)最高、信息量最大、能验证模型假说的视点进行探索。
    • 系统在生成式世界模型上将感知转化为对场景隐状态的推理,并将决策表征为预测未来的视觉轨迹,再由底层控制器将其落地为具体运动。通过对比"实际观测"与"模型预测",利用发生的预测失败(Failure)来触发有针对性的数据收集与世界模型迭代,构建主动闭环系统。

8. 通过"代码程序"恢复物理世界的底层组合结构 (Seeing the Physical World via Code)

  • 提出者:Shangzhe Wu & Jiajun Wu (University of Cambridge / Stanford University)
  • 核心内容 :视觉不是单纯的像素预测,其本质是逆向还原物理世界的组合代码(Code),必须将连续的特征与离散的符号关系紧密结合。
  • 核心逻辑
    • 一个真正理解物理的世界模型必须解构出世界的底层物理结构:包括实体、内在属性(几何、材质、质量、摩擦力)、外在属性(位姿、光照)以及动力学关系。仅仅追求视觉生成质量(Perceptual Quality)的像素级模型无法验证其是否真正掌握了质量、触点、摩擦力等参数,一旦面临介入和模拟需求就会失效。
    • 物理世界是高度组合、递归的(由部件构成物体,由物体构成场景)。作者主张使用神经符号化表征:将离散的关系结构写成具有逻辑的、可执行验证的"代码程序"形式(利用嵌套、循环与参数约束),而将无法用语言精准命名的连续几何和纹理留给神经网络嵌入。
    • 代码具有"可编译和可运行测试"的独特性,借助 LLM 代理(LLM agents)作为结构代码的创作者,便能在接收到物理引擎的仿真渲染反馈或实际视觉不一致后,持续修正、优化该 3D 物理资产和结构代码,实现极强的零样本泛化能力。

9. 走向视觉原生的交互智能 (From Visual Models to Vision-Native Intelligence)

  • 提出者:Zhuang Liu (Princeton University)
  • 核心内容 :视觉绝不能仅是 LLM 旁边的"小挂件"。VGI 应当是视觉原生的,需要探索自适应视觉抽象、主动视觉机制和高多样性的数据策展。
  • 核心逻辑
    • 人类大量的空间、关系与行为推理过程天然不适合被强行文本Token化。
    • 视觉数据不像人类早已创造并高度压缩好的文字那样拥有天然的符号层级;由于像素太底层、图像 Patches 又只是工程上的凑合,视觉模型必须依靠更海量的计算(可能需要比语言大出 1,000 到 10,000 倍的有效计算和数据处理)才能自主孕育出正确的抽象。
    • 一个优秀的视觉原生智能系统的检验核心是自适应的视觉抽象:它能够对环境中不重要的、与任务无关的区域保持粗糙表征,而能主动识别、并自发将计算资源向任务关键区域分配细粒度表征(自主决定何时看、朝哪看以及需要看多深)。

总结:通往 AGI 的三力合一路径

在白皮书的最后,Hirokatsu Kataoka 等人指出了这些观点的汇聚方向:视觉通用智能并不旨在取代大语言模型,而是为机器智能提供一个独立、扎根于真实物理世界的底层基石。他们提出,VGI 的最终涌现极有可能通过以下三大互补性学习目标的融合而实现:

  1. 序列预测 (Sequential Prediction):在漫长的时间线和多变的环境中,强迫模型预测未来的视觉演化,以此逼迫模型学习物理规律和因果世界模型。
  2. 开放式生成 (Open-ended Generation):将生成作为机器的"想象力"和"内部模拟器",使智能体能够在其构建的虚拟替代场景中自我博弈、测试假说、生成反事实并持续进化。
  3. 结构重建 (Reconstruction):通过解决超分辨率、逆向渲染、快速 3D/4D 重建等不完备观测问题,逼迫模型学习空间、距离、深度以及三维物理一致性等隐藏规则。

这三大基石相互配合,共同推动机器视觉系统从传统的"单一视觉任务执行器"向"具有自我适应、持续学习和具身交互的通用智能系统"进化。


此白皮书发布机构包含以下 14 家 研究机构和企事业单位: 日本产业技术综合研究所 (AIST) (National Institute of Advanced Industrial Science and Technology), 牛津大学视觉几何组 (VGG) (Visual Geometry Group, University of Oxford), 剑桥大学 (University of Cambridge), 哈佛大学 (Harvard University), 斯坦福大学 (Stanford University), 普林斯顿大学 (Princeton University), 卡内基梅隆大学 (Carnegie Mellon University), 纽约大学 (New York University), 伦敦帝国理工学院 (Imperial College London), 纽伦堡技术大学 (University of Technology Nuremberg), 筑波大学 (University of Tsukuba), OpenAI, 谷歌 DeepMind (Google DeepMind), CADDi 公司 (CADDi)

https://arxiv.org/pdf/2608.25924

相关推荐
Henry-SAP1 小时前
GPT-6Astra开启AI自主执行新时代
人工智能·云原生·sap·erp
手写码匠1 小时前
华为云Flexus+DeepSeek征文|DeepSeek 应用监控告警体系实战:从“用户投诉才知道“到“故障前就发现“
人工智能·深度学习·算法·aigc
小宋10212 小时前
大模型成本怎么控制:Token统计、缓存与模型路由实战
人工智能·缓存
阿里云大数据AI技术2 小时前
DataWorks Data Agent 实战课堂(七):数据治理 Agent——AI 驱动的自动化治理
人工智能·agent
天一生水water2 小时前
基于重构的无监督/单类时间序列异常检测
人工智能·深度学习·重构·transformer
知识分享小能手2 小时前
深度学习学习教程,从入门到精通,数值计算 — 知识点详解(4)
人工智能·深度学习·学习
三声三视2 小时前
审计清单函数名写成 def?tri-checklist 的 diff 解析在 Python 改名场景下悄悄翻车
人工智能·ai·skillhub·tri-checklist·tri-skills
嘟嘟嘟95272 小时前
Kubernetes 引入 KYAML:更安全的 YAML 子集
人工智能·架构·开源
智购科技自动售货机厂家2 小时前
2026自动售货机设备清洁效果自动验证:从图像比对到评分算法的工程实践~YH
人工智能·算法·计算机视觉