写在前面:
社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~
AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。
论文:GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture(GigaBrain Team,arXiv 2026)
发布时间:2026 年 8 月 16 日(arXiv v1)
作者:GigaBrain Team(Angen Ye ... Zheng Zhu,共 58 人,按字母序)
核心一句话:以"理解---预测---动作"三系统架构 + 3.73 万小时异构具身数据 + 一阶段对齐训练,GigaBrain-0.7 在零样本、后训练与经验强化三段评测上全面超过 π0.5 与前代 GigaBrain。
配套资源
- 项目主页:https://gigaai.cc/blog/gigabrain07
- 代码仓库:https://github.com/open-gigaai/giga-brain-0
- 模型权重:论文声明"全部训练代码与预训练权重将公开发布",截至撰稿时代码仓库已建立、权重待随发布放出。
核心关键词
- VLA(视觉-语言-动作)模型:把多模态理解与连续动作生成统一进一个基础模型,是当前通用具身智能的主流范式,GigaBrain-0.7 即在其上扩展。
- 三系统架构:System 2 负责理解与规划、System 3 负责预测与评估、System 1 负责动作与控制,三者通过语义/视觉/价值接口协同、各自保留专用目标。
- 一阶段对齐训练:视觉-语言理解、层次化任务预测、离散动作、连续动作在同一个 VLA 预训练阶段联合优化,刻意打破多阶段流水线的优化割裂。
- 异构具身数据金字塔:真机 + UMI + EGO + 仿真 + 世界模型生成,共 37,256.98 小时、16 种本体,强调跨源对齐而非单纯堆量。
- Mixture-of-Transformers(MoT):VLM 主干与 Action Expert 并行交错、共享注意力;VL 流走因果自注意,Action Expert 双向注意 VL 与自身。
- Soft Knowledge Insulation(Soft KI):用 α_KI 衰减而非阻断连续动作梯度回传到 VLM 主干,保住语义能力的同时允许受控适应。
- 世界价值模型(GigaWorld-1):System 3 同时预测未来观测(子目标图)与任务进度价值,给出二值优势 A_t,用于后训练条件与经验强化。
带着问题阅读
- 把"理解---预测---动作"拆成三个系统,相比把所有事塞进一个 VLA,到底换来了什么?
- 37K 小时异构数据里真机只占一半多,UMI/EGO 这些人类数据凭什么能帮到机器人?
- System 3 的子目标图与价值信号分别管什么、能否叠加?
- 一阶段训练为什么不会让连续动作损失毁掉 VLM 的语义能力?
- 零样本"开箱即用"是真涌现还是评测偏宽?后训练和经验强化还能再提多少?
- 经验驱动 RL 用世界模型的价值当回报,离线 + 在线两段如何把四个任务做到 100%?
一、核心导读
Vision-Language-Action(VLA)模型已经成了通用机器人控制的主导范式:把预训练视觉-语言模型(VLM)改造成"看图听话→输出动作"的策略。但当数据量和模型容量继续往上推,瓶颈已经不是"再多收一些轨迹、再把网络做大"那么简单------机器人数据横跨不同本体、动作空间与执行条件,没有恰当的对齐,数据多样性带来的可能是干扰而非可迁移知识;而在模型侧,多数 VLA 仍停留在"观察→动作"的被动预测,缺乏对未来状态的预判和对行为进展的评估。
GigaBrain-0.7 给出的回答是一条系统化路线:用三系统架构 把"理解---预测---动作"拆开协同,用一阶段对齐训练 避免多阶段流水线的优化割裂,用3.73 万小时异构具身数据 + 约 2.72 亿视觉-语言样本做底,再把世界模型从"数据引擎"升级为贯穿全生命周期的"预测与评估器"。结果是:在自研 Maker H01 人形与主流 AgileX PiPER/PiPER-X 双臂上,零样本即可执行多样化指令、甚至做未见物体的折衣与抓取;任务后训练后在六个语言跟随任务和一组复杂操作上整体超过 π0.5;经验驱动 RL 进一步把四个高难度任务从平均 30% 推到 100%。
全文的主线很清晰:异构数据的规模 × 三系统的协同,是"涌现具身能力"的两个杠杆。读者要抓住的也是这条主线------不是某一个模块多强,而是数据、架构、训练范式三者一起被重新组织后,能力曲线在多个评测段同时抬升。
二、问题背景:这篇工作站在什么技术拐点上
2.1 VLA 架构的三条路线:动作从哪来、怎么和 VLM 耦合
把论文的相关工作梳理一下,现有 VLA 在"动作如何产生、如何与 VLM 耦合"上大致分三家族,GigaBrain-0.7 的设计选择正落在这条谱系的一个明确位置。
第一类是自回归 VLM-as-Actor:把连续动作离散成 token,直接在 VLM 的语言建模头里逐 token 预测。RT-2、OpenVLA 是开创者;FAST 用频域压缩、VQ-BeT/ActionCodec 学紧凑离散码、Galaxea G0.5 用跨本体动作分词器把推理与动作放进同一条自回归流。它的好处是语言跟随能力天然继承,坏处是控制频率、动作维度、预测时域一上去,逐 token 解码就很贵。
第二类是串行级联(VLM + 独立动作头):VLM 当多模态上下文编码器,外挂一个单独参数化的动作解码器/Action Expert,通过显式特征接口取 VLM 表示。GR00T N1、Gemini Robotics、Qwen-RobotManip 属于这一脉(例如 Qwen-RobotManip 用一个 flow-matching DiT 块交叉注意 VLM 最后一层)。它让动作模块专精连续控制,但有效性强烈依赖 VLM→动作头那条接口暴露了多少信息------通常是最后一层隐状态,可能丢掉细粒度操作所需的分布式空间特征。
第三类是并行 Mixture-of-Transformers(MoT):保留专用连续 Action Expert,但通过 MoT 架构把它和 VLM 主干深度耦合。π0 用块级因果交互 + flow-matching 动作头开创了这条线,π0.5/π0.7、GigaBrain-0、Wall-OSS-0.5、HyVLA-0.5、Xiaomi-Robotics-0/1 都在此列,差别在注意力路由与梯度耦合的程度。GigaBrain-0.7 沿用并行 VLM--Action Expert 方向,但在其上引入了"理解/规划"和"预测/评估"两个额外的功能接口------也就是 System 2 与 System 3。
2.2 训练范式:多阶段 vs 一阶段,以及 RL 后训练谱系
架构之外,VLA 在"理解与动作如何被引入与优化"上也分裂明显。一边是分阶段 :π0.5 在广预训练用离散动作 token、后训练再上 flow-matching Action Expert;Xiaomi-Robotics-0 先联合训练 VLM 再冻结 VLM 训 DiT;Xiaomi-Robotics-1 在 10 万小时 UMI 上预训练再对齐到机器人本体。另一边是一阶段联合:GigaBrain-0、Wall-OSS-0.5、Qwen-RobotManip、LingBot-VLA 2.0 都把视觉-语言与动作目标放进同一预训练阶段。GigaBrain-0.7 选的是后者,并把它推到"通用视觉-语言监督 + 层次化任务预测 + 离散动作 + 连续动作"四目标的同阶段联合。
后训练与强化学习则是一条独立谱系:纯模仿学习受限于演示分布与复合误差;策略梯度路线(VLA-RL、SimpleVLA-RL、Z1 的 GRPO)难在大 VLA 与真机上稳定扩展;更实用的几条都偏离线/价值/偏好------AWR 做优势加权回归,π0.6* 的 RECAP 用优势条件策略从演示+在线经验+专家纠正中学习,GigaBrain-0.5M* 的 RAMP 用世界模型预测的未来状态与价值去条件策略,HyVLA-0.5 的 FlowPRO 做无评论家/无奖励的偏好优化。GigaBrain-0.7 的经验驱动 RL(离线 AWR 式 + 在线 actor-critic 带人类纠正)正是接在这条谱系上,且把 System 3 的价值直接当回报来源。
理解了这两条谱系,就能看懂 GigaBrain-0.7 的定位:架构上选并行 MoT 但加两个功能系统,训练上选一阶段联合但把世界模型升格为全生命周期的预测/评估器。这正是它区别于 π0.5(分阶段、靠人工/ VLM 评估动作质量)和 GigaBrain-0.5M*(世界模型只做单次条件)的地方。
三、核心思路:作者的解法主线
GigaBrain-0.7 的核心思想可以用一句话概括:把"理解、预测、动作"解耦成三个各有专用目标的系统,再用结构化接口把它们串成一个覆盖"预训练→后训练→经验强化"全生命周期的学习回路。 这张总览图把这条主线一次说清。

如上图所示,System 2(理解与规划)解释当前与历史视觉观测、跟踪任务进展、把长程指令分解为可执行子任务;System 3(预测与评估)用世界模型预测未来视觉状态(子目标图)并估计状态价值,为 System 1 提供两路互补的条件;System 1(动作与控制)把当前观测、短期记忆、子任务指令、机器人状态与预测信号融在一起,经离散与连续两条并行动作通路生成可执行动作。三者之外,架构还暴露了离线/在线经验强化的接口,把感知、预测、动作与后续策略改进连成闭环。
这条主线里有三个关键判断值得记住:第一,解耦不是各干各的 ------三个系统保留各自目标(理解、预测、动作),但通过语义、视觉、价值接口持续通信,避免"统一架构牺牲专用性"或"级联架构接口过窄"两个极端。第二,世界模型不只是数据引擎 ------GigaBrain-0 已经用世界模型生成数据,GigaBrain-0.5M* 已经用它做单次策略条件,而 0.7 让它在后训练里持续提供子目标图与价值、在推理时提供"正进展"引导、在经验 RL 里当回报来源,参与全生命周期。第三,一阶段对齐是用 Soft KI 撑住的------把连续动作损失和 VLM 理解目标放在同阶段,本会互相污染,Soft Knowledge Insulation 用一个 α_KI 把动作梯度衰减而非阻断地送回主干,是这条路线能成立的关键工程件。后面方法与实验都围绕这三个判断展开。
四、方法展开:沿着论文原始逻辑往下看
4.1 数据:异构金字塔与统一处理
GigaBrain-0.7 的数据层是一个明确的"金字塔":以真机轨迹为主体,叠加 UMI 手持演示、EGO 第一人称人类视频、仿真与世界模型生成数据,并用约 2.72 亿视觉-语言样本做语义支撑。清洗后的轨迹语料构成如下表。
| 数据类型 | 时长(小时) | 占比 |
|---|---|---|
| Real Robot(真机) | 20,535.65 | 55.12% |
| UMI | 8,251.83 | 22.15% |
| EGO | 2,862.36 | 7.68% |
| Simulation(仿真) | 1,453.92 | 3.90% |
| WM(世界模型生成) | 4,153.22 | 11.15% |
| 合计 | 37,256.98 | 100.00% |
这张构成表已经透露了作者的数据观:真机只占刚过一半,剩下近一半靠 UMI/EGO/仿真/世界模型补------也就是说,他们押注的是"异构对齐"而非"真机堆量"。下图把整个训练语料的规模、本体、采集设备、原子动作与任务/环境分布做了一张总览。

异构数据要能用,统一处理是前提。所有轨迹先转成 LeRobot v3.0 格式、映射到统一机器人表示,再经过语言指令重写、子任务标注与多级质量控制。真机数据的处理链如下图:异构机器人数据 → LeRobot v3.0 → 统一机器人表示 → 指令重写与子任务标注 → 多级质控 → 训练。
真机 20,535.65 小时横跨 16 种机器人本体,按帧占比看分布极不均衡------自研 Maker H01 人形独占 43.82%,Maker M01 占 20.14%,Agibot-G1 占 18.30%,AgileX 占 8.65%,其余 12 种合计不到 10%。
| 机器人类型 | Episodes | Frames | 帧占比 |
|---|---|---|---|
| Maker H01 | 866,864 | 910,496,160 | 43.82% |
| Maker M01 | 319,964 | 418,534,560 | 20.14% |
| Agibot-G1 | 226,675 | 380,282,116 | 18.30% |
| AgileX | 133,101 | 179,727,199 | 8.65% |
| Ark | 30,559 | 35,960,476 | 1.73% |
| Galaxea R1 Lite | 27,793 | 35,058,414 | 1.69% |
| Franka | 87,148 | 25,149,233 | 1.21% |
| UR5 | 57,210 | 25,007,639 | 1.20% |
| Realman RMC-AIDA-L | 19,419 | 17,087,665 | 0.82% |
| Dexmal DOS-W1 | 12,043 | 16,122,952 | 0.78% |
| Agibot-G2 | 6,092 | 15,641,535 | 0.75% |
| TienKung | 11,218 | 7,598,429 | 0.37% |
| Galbot G1 | 5,452 | 5,175,924 | 0.25% |
| Ark-mobile | 4,295 | 4,318,879 | 0.21% |
| Unitree G1edu | 1,411 | 910,983 | 0.04% |
| AI2 Alphabot 2 | 857 | 764,907 | 0.04% |
UMI 与 EGO 两类人类数据各有处理重点。UMI 流水线把多相机观测、6 自由度手柄位姿与夹爪状态做时间对齐、轨迹与模态质量过滤,再重定向到 Maker H01 末端坐标系,最后用仿真与采样真机回放验证。

EGO 流水线则对第一人称操作视频做交互与视频质量过滤,必要时补手部姿态与手-物关系,并把 EgoDex、EgoVerse、WiYH 与自采数据统一标准化。

UMI 与 EGO 的内部构成如下表,能看出自采数据(Maker U01、Maker E01)在其中占主导,外部数据集为补充。
| 数据类型 | 数据集 | 时长(小时) |
|---|---|---|
| UMI | 自采 Maker U01 | 6,876.25 |
| UMI | Jianzhi 10K | 1,375.58 |
| UMI 合计 | --- | 8,251.83 |
| EGO | EgoDex | 724.84 |
| EGO | EgoVerse | 835.77 |
| EGO | WiYH | 165.38 |
| EGO | 自采 Maker E01 | 1,136.37 |
| EGO 合计 | --- | 2,862.36 |
一个值得注意的工程细节:统一处理里用了 GLM-5.1 做指令重写、Qwen3.6-27B 做子任务标注,并用 q01/q99 分位过滤、静止段去除、末端位姿修正与基于损失的数据筛选。这些步骤决定了"异构"能否真的"对齐"------后面数据规模实验会证明,UMI/EGO 的增益在跨源对齐后才显现。
4.2 架构:三系统与 Mixture-of-Transformers
GigaBrain-0.7 的架构图把三系统与它们的接口一次画清,是本节的总纲。

System 2(理解与规划) 用 PaliGemma2(3B)作 VLM 主干,做视觉-语言理解、时序上下文建模、任务进展跟踪,并通过层次化提示(hierarchical prompts)把长程指令分解为可执行子任务------也就是 Embodied Chain-of-Thought 的思路。System 1(动作与控制) 同样以 PaliGemma2(3B)为主干,外加一个 0.5B 的 Action Expert,用 Mixture-of-Transformers 双流并行耦合,经 flow matching 生成连续动作块;它还内置时序-空间块做短期视觉记忆,并用本体感知状态接口(含关节状态、Robot ID 与有效性掩码)适配不同自由度与控制模式。System 3(预测与评估) 是独立的 GigaWorld-1(5B)世界价值模型,预测未来观测(子目标图 g_t)与任务进度价值 V_t,输出二值优势 A_t。
System 1 的核心是 MoT 的双流注意力。VL 流走因果自注意,Action Expert 则对"VL+AE"的拼接键值做双向注意,两流各有独立 FFN:
O l V L = C a u s a l A t t n l ( H l V L ; H l V L ) , O l A E = A t t n l ( H l A E ; H l V L , H l A E ) O_l^{\mathrm{VL}}=\mathrm{CausalAttn}_l(H_l^{\mathrm{VL}};\,H_l^{\mathrm{VL}}),\quad O_l^{\mathrm{AE}}=\mathrm{Attn}_l(H_l^{\mathrm{AE}};\,H_l\^{\\mathrm{VL}},\\,H_l\^{\\mathrm{AE}}) OlVL=CausalAttnl(HlVL;HlVL),OlAE=Attnl(HlAE;HlVL,HlAE)
H l + 1 V L = F F N l V L ( O l V L ) , H l + 1 A E = F F N l A E ( O l A E ) H_{l+1}^{\mathrm{VL}}=\mathrm{FFN}^{\mathrm{VL}}l(O_l^{\mathrm{VL}}),\quad H{l+1}^{\mathrm{AE}}=\mathrm{FFN}^{\mathrm{AE}}_l(O_l^{\mathrm{AE}}) Hl+1VL=FFNlVL(OlVL),Hl+1AE=FFNlAE(OlAE)
这套设计的要点是"强耦合但分工":Action Expert 能在每一层都看到 VL 的中间表示(而不是只看最后一层),同时两流各有参数不互相覆盖。架构选型实验会验证:这种逐层交错的双流耦合,比"最后一层交叉注意"或"逐层交叉注意"都更能在难任务上保持成功率,代价是推理略慢。System 1 还同时保留离散(next-token prediction,NTP)与连续(flow matching)两条动作通路------前者保语言跟随与子任务预测,后者保高频连续控制,二者在训练中联合优化。
4.3 训练:一阶段预训练 + 世界模型 + 后训练 + 经验强化
训练分四个阶段,且全生命周期都能看到 System 3 的参与。下图是经验强化流水线(监督微调 → 离线强化 → 在线强化),它其实是后两阶段(后训练 SFT + 经验 RL)的可视化,但也框出了整个"从演示到自驱进化"的回路。
阶段一:VLA 一阶段预训练。 联合优化 VLM 主干、连续动作专家与多模态理解目标。离散侧用 NTP 损失(M 为子任务/token 数, m j m_j mj 为掩码):
L N T P = − E ∑ j = 1 M m j log p θ ( y j ∣ c , y \< j ) \mathcal{L}_{\mathrm{NTP}}=-\mathbb{E}\left\\sum_{j=1}\^{M} m_j\\log p_\\theta(y_j\\mid c,\\,y_{\
连续侧用 flow matching,先在动作块上做线性插值路径 a t : t + H τ = τ a t : t + H + ( 1 − τ ) ϵ , τ ∈ 0 , 1 a_{t:t+H}^{\tau}=\tau a_{t:t+H}+(1-\tau)\epsilon,\ \tau\in0,1 at:t+Hτ=τat:t+H+(1−τ)ϵ, τ∈0,1,再让速度网络拟合:
L F M = E a , ϵ , τ ∥ v θ ( a t : t + H τ , c , τ ) − ( a t : t + H − ϵ ) ∥ 2 2 \mathcal{L}{\mathrm{FM}}=\mathbb{E}{a,\epsilon,\tau}\left\\left\\\|v_\\theta(a_{t:t+H}\^{\\tau},\\,c,\\,\\tau)-(a_{t:t+H}-\\epsilon)\\right\\\|_2\^2\\right LFM=Ea,ϵ,τ vθ(at:t+Hτ,c,τ)−(at:t+H−ϵ) 22
总目标就是两者相加:
L V L A = L N T P + L F M \mathcal{L}{\mathrm{VLA}}=\mathcal{L}{\mathrm{NTP}}+\mathcal{L}_{\mathrm{FM}} LVLA=LNTP+LFM
关键在于,连续动作损失本会经共享参数回传污染 VLM 主干、引发灾难性遗忘。Soft Knowledge Insulation 的做法不是阻断,而是把回传到 VL 主干的 FM 梯度乘一个衰减系数:
∇ θ V L L V L A = ∇ θ V L L N T P + α K I ∇ θ V L L F M , 0 < α K I < 1 \nabla_{\theta_{\mathrm{VL}}}\mathcal{L}{\mathrm{VLA}}=\nabla{\theta_{\mathrm{VL}}}\mathcal{L}{\mathrm{NTP}}+\alpha{\mathrm{KI}}\,\nabla_{\theta_{\mathrm{VL}}}\mathcal{L}{\mathrm{FM}},\quad 0<\alpha{\mathrm{KI}}<1 ∇θVLLVLA=∇θVLLNTP+αKI∇θVLLFM,0<αKI<1
这把"一阶段联合"从"互相污染"变成"受控适应"------既让主干学到具身控制所需的特征偏置,又不丢通用视觉-语言能力。预训练阶段还做了时序上下文监督(随机丢弃历史帧)与层次化任务监督(两种模式),并在多本体上统一优化。
阶段二:世界模型预训练。 在 GigaWorld-1 上分两步:先做以机器人为中心的视频预训练,预测子目标图(未来视频末帧);再训价值学习,得到世界价值模型(同样用 MoT),输出任务进度估计 V t V_t Vt。训好后 System 3 在后续阶段冻结。
阶段三:世界模型驱动的 VLA 后训练。 System 3 冻结,向后训练中的 System 1 提供子目标图 g t g_t gt 与价值优势 A t A_t At。后训练上下文把基础上下文与这两路信号拼在一起:
c t p o s t = ( c t b a s e , g t , A t ) c_t^{\mathrm{post}}=(c_t^{\mathrm{base}},\,g_t,\,A_t) ctpost=(ctbase,gt,At)
其中优势由价值差给出二值化结果------只有当预测的未来价值高于当前价值(即"在向成功推进")时取 1:
A t = 1 V t + δ t − V t \> 0 ∈ { 0 , 1 } A_t=\mathbb{1}\!\leftV_{t+\\delta_t}-V_t\>0\\right\in\{0,1\} At=1Vt+δt−Vt\>0∈{0,1}
为防止策略过度依赖其中一路信号,训练时对子目标图做 0.50、对价值做 0.15 的条件丢弃,组合出四种条件态;推理时则固定条件在"正进展"上引导连续动作生成,不做显式的候选动作打分或选择。相比 π0.7 与 π0.6* 依赖人工标注或 VLM 推理来评估动作质量,GigaBrain-0.7 的评估来自世界模型对未来轨迹的想象,更细粒度也更贴近真实 rollout 结果;相比 GigaBrain-0.5M*,它还把未来预测时域延长到动作块长度之外,在复杂任务上更稳。
阶段四:经验驱动强化学习。 这是 fig07 的主体。先用部署策略采真实机器人 rollout(含成功、失败、纠正经验),用进度导出回报与价值估计,做离线优势加权精修;再把精修后的策略重新部署采在线轨迹,在困难状态引入人类纠正。离线段用 AWR 式优势加权,在线段用 actor-critic 结合人类纠正。其在线优势与闭环更新可写成:
A ~ t = G t − V ~ t \tilde{A}_t=G_t-\tilde{V}_t A~t=Gt−V~t
π ( k ) ⟶ D r o l l o u t ( k ) ⟶ Update ( π ( k ) , D r o l l o u t ( k ) ) ⟶ π ( k + 1 ) \pi^{(k)}\;\longrightarrow\;\mathcal{D}{\mathrm{rollout}}^{(k)}\;\longrightarrow\;\operatorname{Update}\!\left(\pi^{(k)},\,\mathcal{D}{\mathrm{rollout}}^{(k)}\right)\;\longrightarrow\;\pi^{(k+1)} π(k)⟶Drollout(k)⟶Update(π(k),Drollout(k))⟶π(k+1)
要点是:失败与部分进展也能提供训练信号(离线段不需要新交互),而在线段的纠正恰好出现在"更新后策略分布暴露出的困难状态"上------这两段会在实验里把四个高难度任务稳步推到 100%。
五、实验与证据:结果能支撑到什么程度
实验在 AgileX PiPER/PiPER-X(低成本双臂桌面平台)与自研 Maker H01(带头、腰、双臂的人形)上做,刻意拉开自由度、控制接口、相机配置与工作空间几何的差异,以压测跨本体泛化。真机对比基线为 π0.5、GigaBrain-0.1、Xiaomi-Robotics-1、Galaxea G0.5;视觉-语言基准还纳入 Xiaomi-Robotics-0、G0.5-base、Spirit-v1.5、Wall-OSS-0.5、Hy-Embodied-0.5-VLA-UMI。每个任务通常 10--20 次试验,以成功率为主指标,并区分训练分布内(ID)与分布外(OOD)。
5.1 架构选型:为什么是 PaliGemma2 + 双流 MoT
在研究数据规模前,作者先固定 System 1 的配置。先用同一双流 VLA 形式比 PaliGemma2、Qwen3.5、Gemma 4 三个主干:
| 主干 | 模型规模 | Clean Desk | Fruit Picking | Shirt Folding |
|---|---|---|---|---|
| PaliGemma2 | 3.5B | 50% | 88% | 30% |
| Qwen3.5 | 5B | 60% | 12% | 0% |
| Gemma 4 | 8.5B | 100%* | 92% | 0% |
*Gemma 4 的 Clean Desk 在有限范围位置泛化设置下评测。结论很反直觉:加大主干并没有带来一致的更强机器人表现------Gemma 4 在结构化任务上强,但 PaliGemma2 是唯一在折衣上拿到非零成功率的,且在水果操作上仍有竞争力。于是后续以 PaliGemma2 为主干。
固定主干后再比三种 VLM--动作专家耦合:双流、最后一层交叉注意、多层交叉注意。
| 架构 | Clean Desk | Fruit Picking | Shirt Folding | 训练 s/步 | 推理 s |
|---|---|---|---|---|---|
| Dual Stream(双流) | 50% | 88% | 30% | 4.93 | 0.221 |
| Last-Layer Cross Attention | 20% | 40% | 0% | 4.65 | 0.073 |
| Multi-Layer Cross Attention | 20% | 36% | 0% | 6.59 | 0.108 |
这是一个清晰的能力---效率折衷:把动作专家限在 VLM 最终表示上推理最快但能力最弱;多层交叉注意更贵却没带来收益;双流在三个任务上全最强(含折衣非零),代价是推理略慢。GigaBrain-0.7 据此采用 PaliGemma2 双流作为默认 System 1。这两张表也提示读者:主干参数量与耦合方式都不是"越大越好",而是要和训练动力学、动作表征一起看。
5.2 异构数据规模效应
固定架构后看数据。下图把三组规模实验合在一张三联图里:(a) 总预训练数据量↑ → 验证损失持续↓,且不同量级间的差距贯穿整个优化过程;(b) 机器人数据量↑ → 真机性能↑,且对更难的可变形物任务(折衣)依赖更陡;© 在 3000 小时机器人数据基础上加等量 UMI 或 EGO,两者都优于纯机器人,三者组合最强。

这里有两个判断值得点出。第一,规模化的收益不止于训练目标 ------折衣这种小尺度下几乎不可靠的行为,随数据量变大才"变可靠",作者把这直接读作"能力随规模涌现"。第二,UMI/EGO 的增益在后训练后仍在,说明它们改的是预训练先验的质量,而非只给基线策略一点即时提升。不同源还互补:机器人给本体专属控制监督,UMI 给近手视角与运动接口的操作经验,EGO 拓宽第一人称人类交互的多样性------这正支撑了"数据金字塔"的动机:有效规模化不只靠轨迹数,更靠把异构物理经验拉进同一训练表示。
5.3 时序上下文:消歧重复状态
很多操作任务里会出现"视觉相似但处于不同阶段"的重复状态,单帧策略会陷在重复动作循环里。下图做了一组定性对照:无时序上下文时策略反复回到相似交互状态、陷入循环;有时序上下文时,近期历史帮它区分这些状态、跳出循环继续推进任务。

这组图是定性的,但它说明时序建模对闭环操作的价值不止"记更长的上下文",还在于消解执行中局部歧义------当下视觉观察相似、但所需的后续行为不同时,历史是唯一的判别线索。
5.4 System 3:预测与评估的拆解
System 3 同时预测未来视觉观测与未来状态价值,用价值差估出候选动作轨迹的优势。下图展示:当想象的未来轨迹走向失败时,估计的优势显著下降;当轨迹恢复到成功执行模式时,优势回升。这说明模型确实捕捉到了"价值相关的未来变化",能区分失败轨迹与推进轨迹。

为拆开子目标图与价值各自的作用,作者比了 Base / +SubImage / +Value / +SubImage+Value 四种配置,在折衣(PiPER)、礼物包装(PiPER-X)、方块分拣(H01)上同时报成功率、平均任务分与完成时间(因为成功率在易任务上会饱和)。

结果很有层次:折衣四配置都 100% 成功,但任务分从 Base 的 68.3% 升到 +SubImage 81.7%、+Value 85.0%、+Both 88.3%,完成时间从 107s 降到 83/79/75s------成功率饱和后,System 3 仍在改善中间进展与执行效率。礼物包装更明显:Base 完不成,+SubImage 20%、+Value 60%、+Both 80%,任务分从 61.1% 升到 96.7%。方块分拣则更混合:成功率 40%→50%/45%/55%,联合配置拿到最高任务分(55.0%→87.5%)。综合看,子目标图与价值是互补的:子目标图引导"下一步做什么",价值帮判"当前轨迹是否在向好推进";二者叠加在最难的礼物包装上最强。这也回应了一个常见质疑------System 3 不只抬成功率,更抬"在不完美中间状态下的推进质量"。
5.5 基础模型开箱即用:零样本语言跟随与复杂操作
这一组评测直接看预训练后、未做任务专属适应的策略能否"开箱即用"。下图是同一预训练策略在 PiPER 与 H01 上、ID 与 OOD 设置下的多任务语言跟随。

ID 设置下策略能执行涉及物体选择、场景整理与多步操作的多样化指令跟随行为------说明异构预训练产出了"可执行的通用策略",而非只是给后训练一个更好的初始化。接着是受控 OOD 评测,不是只换外观,而是换任务相关的物体实例、空间布置、场景与已学技能的组合。下图是 OOD 语言跟随的两个代表 rollout。

如上图所示,上图 PiPER 评测的辣椒实例不在训练数据里、两个目标容器也从未在同任务里一起采过且相对位置随机化;下图 H01 评测的葡萄、场景与任务组合都不在 H01 训练数据里。策略仍能听指令、选对目标、完成操作------这是对"目标理解、空间接地、组合泛化"的定性证据。复杂操作上,下图给的是更长程、需持续交互的任务的零样本表现。

再下图是 OOD 复杂操作的 rollout,重点是衣物实例与可变形状态的双重泛化------评测衣物不在训练数据里、初始状态高度非结构化,而布料几何在操作中连续变化,策略无法靠固定形状或重放记忆。
预训练策略能跨未见衣物实例与大幅可变形物状态变化重用交互结构,而非只记外观。但 OOD 复杂操作仍明显更难,ID--OOD 差距提示跨任务分布与跨本体的鲁棒泛化仍是继续规模化的方向。作者把这整组结果读作"异构预训练带来的涌现具身能力"的一个表征------这一点读者可以保留一份审慎:定性 rollout 强,但缺乏这组零样本的量化成功率表(早期草稿里的零样本量化表在本版被注释掉,正文只给了定性 rollout 与 ID/OOD 概念区分),所以"开箱即用"的强度更偏定性证据。
5.6 任务后训练:语言跟随与复杂操作
后训练在目标平台上用任务专属演示微调,分语言跟随与复杂操作两类。语言跟随六任务覆盖颜色判别、目标选择与方向推理。下图是两平台的总览柱状对比。
量化结果如下两表(每格为成功率%,最优加粗)。
AgileX PiPER:
| 模型 | Button Push | Spoon Grasping | Bowl Pick-Place | Tableware Pick-Place | Fork Pick-Place | Wood Block Pick-Place | 平均 |
|---|---|---|---|---|---|---|---|
| π0.5 | 100.0 | 100.0 | 90.0 | 87.5 | 75.0 | 80.0 | 88.8 |
| GigaBrain-0.1 | 66.7 | 77.8 | 85.0 | 72.2 | 80.0 | 75.0 | 76.1 |
| G0.5 | 88.9 | 94.4 | 50.0 | 100.0 | 85.0 | 70.0 | 81.4 |
| Xiaomi-Robotics-1 | 66.7 | 83.3 | 50.0 | 98.6 | 75.0 | 60.0 | 72.3 |
| GigaBrain-0.7 | 100.0 | 100.0 | 95.0 | 88.9 | 85.0 | 80.0 | 91.5 |
Maker H01:
| 模型 | Button Push | Spoon Grasping | Bowl Pick-Place | Tableware Pick-Place | Fork Pick-Place | Wood Block Pick-Place | 平均 |
|---|---|---|---|---|---|---|---|
| π0.5 | 66.7 | 34.4 | 100.0 | 66.7 | 83.3 | 100.0 | 75.2 |
| GigaBrain-0.1 | 44.4 | 34.4 | 100.0 | 55.6 | 83.3 | 100.0 | 69.6 |
| G0.5 | 72.2 | 12.5 | 25.0 | 31.9 | 12.5 | 0.0 | 25.7 |
| Xiaomi-Robotics-1 | 100.0 | 31.3 | 100.0 | 50.0 | 70.8 | 0.0 | 58.7 |
| GigaBrain-0.7 | 100.0 | 56.3 | 100.0 | 61.1 | 87.5 | 100.0 | 84.2 |
PiPER 上 GigaBrain-0.7 一致优于前代、与 π0.5 持平或更优,增益在需要把语言接地到目标或方向的行为上最明显;H01 更难但同趋势------平均从 GigaBrain-0.1 的 69.6% 升到 84.2%,Button Push 与 Spoon Grasping 提升尤大。G0.5 在 H01 上几乎崩(Spoon 12.5%、Wood Block 0%),印证跨本体转移是真挑战而非 GigaBrain 专属短板。
下面五张是语言跟随的代表 rollout,分别覆盖颜色、目标与空间关系三类接地,跨 PiPER 与 H01。




这些 rollout 说明:后训练策略是把指令里的区分(颜色、目标、左右)反映到目标选择与执行上,而非重放固定轨迹;同一行为在 PiPER 与 H01 两个本体上都成立。
复杂操作覆盖需持续接触、多段执行、可变形物或工具使用的任务。两平台总览如下。

量化结果如下两表。
AgileX PiPER:
| 模型 | Cube Sorting | Play-Dough Kneading | Tableware Arranging | Household Item Storage | Rice Sweeping | 平均 |
|---|---|---|---|---|---|---|
| π0.5 | 95.0 | 95.0 | 77.8 | 95.0 | 20.0 | 76.6 |
| GigaBrain-0.1 | 90.0 | 95.0 | 38.9 | 75.0 | 25.0 | 64.8 |
| G0.5 | 45.0 | 20.0 | 38.9 | 85.0 | 0.0 | 37.8 |
| Xiaomi-Robotics-1 | 35.0 | 85.0 | 44.4 | 75.0 | 5.0 | 48.9 |
| GigaBrain-0.7 | 95.0 | 100.0 | 94.4 | 95.0 | 40.0 | 84.9 |
Maker H01:
| 模型 | Cube Sorting | Play-Dough Kneading | Tableware Arranging | Household Item Storage | Food Prep. & Heating | Dish Cleanup & Washing | Rice Sweeping | 平均 |
|---|---|---|---|---|---|---|---|---|
| π0.5 | 8.3 | 50.0 | 51.1 | 91.7 | 50.0 | 40.0 | 25.0 | 45.2 |
| GigaBrain-0.1 | 20.8 | 41.7 | 45.6 | 79.2 | 40.0 | 50.0 | 25.0 | 43.2 |
| G0.5 | 0.0 | 0.0 | 27.8 | 0.0 | 20.0 | 10.0 | 0.0 | 8.3 |
| Xiaomi-Robotics-1 | 8.3 | 20.8 | 34.4 | 54.2 | 30.0 | 40.0 | 41.7 | 32.8 |
| GigaBrain-0.7 | 41.7 | 79.2 | 75.6 | 91.7 | 85.0 | 100.0 | 45.8 | 74.1 |
两本体上 GigaBrain-0.7 一致改进并保持与 π0.5 竞争或更强。PiPER 在结构化任务上差距不大(强基线已高),增益在需更多持续接触或多段执行的任务上更清;H01 上差距显著拉大、覆盖更广技能(可变形物、食物相关、多段清理)。下图是四个代表 rollout,跨可变形物、工具、整理与分拣。




但要注意:多个接触密集型任务远未饱和(米饭清扫 PiPER 40%/H01 45.8%),说明复杂物理交互仍需更多数据与经验后训练。
5.7 经验驱动强化学习:从 30% 到 100%
最后看模型能否靠"自己执行产生的经验"继续提升。从任务专属 SFT 策略出发,走 fig07 的三段:SFT 基线 → 离线 RL → 在线 RL(带人类纠正)。四个任务互补:礼物包装(PiPER-X,长程多段)、轴承安装(H01,更长序列)、连杆安装(PiPER,精密对齐插入)、扎带穿引收紧(PiPER-X,细长物精密接触)。四任务的代表执行见下图。

三段成功率如下表。
| 任务 | SFT 基线 | 离线 RL | 在线 RL |
|---|---|---|---|
| Link Installation(PiPER) | 20% | 40% | 100% |
| Gift Box Packing(PiPER-X) | 80% | 90% | 100% |
| Cable Tie Insertion and Tying(PiPER-X) | 0% | 40% | 100% |
| Bearing Installation(H01) | 20% | 60% | 100% |
平均成功率从 SFT 的 30.0% 升到离线 RL 的 57.5%、再到在线 RL 的 100%。两个规律值得记:离线段的增益取决于起点策略能力 ------礼物包装已 80% 只升到 90%,而轴承/扎带各涨 40 个点;在线段的最大增益出现在需解决精密对齐/插入/穿线临界状态的两个任务上(连杆与扎带都从 40% 直接到 100%)。原因是:离线精修改变策略后,在线 rollout 恰好在更新后的策略分布暴露出的困难状态上采到样本,让人类纠正能精准投放在最需要的地方。这整段说明演示与部署经验是互补的:SFT 给物理执行所需的初始化,离线 RL 从 rollout 质量差异中学,在线 RL 用改进后策略自身的经验与纠正继续推。要注意"100%"是在四个任务的既定试验数上达到,并非无限泛化保证。
5.8 标准化基准与仿真评测
除真机外,作者在 MiMo-Embodied(具身视觉-语言)与三个仿真基准(RoboTwin 2.0、EBench、RoboColiseum)上评。MiMo-Embodied 分空间理解(8 项)与可供性(5 项)两组。为公平对比,GigaBrain-0.7 报的是"MiMo 数据并入后续训练前"的检查点。
| 模型 | Spatial Avg. | Affordance Avg. | Overall |
|---|---|---|---|
| Xiaomi-Robotics-0 | .1372 | .0687 | .1108 |
| Spirit-v1.5 | .3524 | .2995 | .3320 |
| Wall-OSS-0.5 | .2273 | .0367 | .1540 |
| G0.5-base | .3890 | .3956 | .3916 |
| Hy-Embodied-0.5-VLA-UMI | .2532 | .0000 | .1558 |
| GigaBrain-0.7 | .5215 | .3669 | .4621 |
GigaBrain-0.7 在并入 MiMo 前就拿到对比中最强的总体与空间理解均分。把 MiMo 数据并入同一 VLA 预训练混合、继续联合优化(不引入单独 VLM 适应阶段)后,最终检查点总体分进一步到 0.5704------但因为此时训练混合已与 MiMo 评测集不 disjoint,作者把这 0.5704 当作"持续预训练诊断"而非留出基准结果,发布权重对应这个 MiMo 增强后的阶段。可供性里 G0.5-base 仍强(细粒度点级可供性 VABench-Point 是 GigaBrain-0.7 的弱项)。
仿真侧先看 RoboTwin 2.0(双臂,官方 Co-Train 协议:一个策略在 50 任务上联合后训练、每任务 50 条干净演示,再评 Easy 干净与 Hard 域随机)。
| 模型 | 方法 | Easy | Hard | Overall |
|---|---|---|---|---|
| π0 | Single | 46.42 | 16.34 | 31.38 |
| Xiaomi-Robotics-0 | Co-Train | 62.9 | 18.2 | 40.55 |
| X-VLA | Co-Train | 68.0 | 20.9 | 44.45 |
| X-WAM | Co-Train | 70.0 | 25.8 | 47.90 |
| π0.5 | Co-Train | 70.7 | 46.0 | 58.35 |
| GigaBrain-0.7 | Co-Train | 66.8 | 67.9 | 67.35 |
GigaBrain-0.7 总体最强、Hard 设第一。几个模型在干净环境下更高,但 0.7 在域随机化后仍强,凸显作为单一多任务策略对视觉/环境变化的鲁棒性。完整官方榜单快照见下图。

EBench 把仿真扩到移动操作、长程执行与灵巧精密交互。在所比公开 VLA 模型里,GigaBrain-0.7 在成功率与综合任务分上都最强。
| 模型 | SR (%) | Score |
|---|---|---|
| π0 | 23.59 | 37 |
| X-VLA | 23.72 | 35 |
| InternVLA-A1* | 23.90 | 36 |
| π0.5 | 28.08 | 42 |
| GigaBrain-0.7 | 33.30 | 46.1 |
*InternVLA-A1 结果取自 Qwen-RobotManip 报告的 EBench 评测,非当前榜单。完整官方榜单快照见下图(含 Qwen-RobotManip 等未在正文比的方法)。

RoboColiseum 用基于重建的 Real2Sim2Real 流程,评四个维度:指令跟随、空间推理、鲁棒性、通用操作。GigaBrain-0.7 在四维上都最强,空间推理优势尤显。
| 模型 | Instruction Following | Spatial Reasoning | Robustness | General Manipulation |
|---|---|---|---|---|
| π0 | .3680 | .1300 | .3130 | .3470 |
| Xiaomi-Robotics-0 | .6460 | .2230 | .5460 | .3070 |
| GR00T N1.7 | .6460 | .2490 | .5380 | .4380 |
| π0.5 | .7460 | .3560 | .6130 | .5820 |
| ACoT-VLA | .7570 | .3970 | .6220 | .4770 |
| GigaBrain-0.7 | .8166 | .4729 | .6800 | .6092 |
四维各自的官方榜单快照见下图(均为 2026-08-15 截取,在线榜单会随新提交变化)。



综合三个仿真体制,GigaBrain-0.7 一致强:RoboTwin 2.0 总体与 Hard 第一、EBench 公开模型最强、RoboColiseum 四维全领先。这些结果说明大规模异构预训练的收益能跨本体、跨任务结构、跨评测域迁移。实现也将集成进 XPolicyLab,提供跨基准的统一训练/推理/部署流程。
六、这篇工作的边界与可复现性
证据很强,但也有几条边界要诚实标出。
评测覆盖与统计强度。 真机每任务通常 10--20 次试验,方差不可忽视;零样本"开箱即用"在本版正文以定性 rollout 为主(早期草稿的零样本量化成功率表被注释掉),故"开箱即用"更像定性证据而非量化结论。OOD 复杂操作与 H01 上的差距表明跨任务分布与跨本体的鲁棒泛化仍未解决。
未充分披露的细节。 后训练用到的任务专属演示数量在正文未逐任务给出(早期草稿有"每任务演示数"的占位但本版被注释),复现后训练对比时缺这条信息。模型权重与训练代码"将公开",截至撰稿时尚未随论文同时放出,复现需等发布。
评测口径需辨析。 MiMo-Embodied 的 0.5704 是 MiMo 数据并入训练混合后的"持续预训练诊断",不是留出基准------作者已明确标注,但读者引用时勿当 held-out 分数。VABench-Point(细粒度点级可供性)是 GigaBrain-0.7 的明显弱项(.0433 vs G0.5-base .2267),说明场景级空间理解强、但点级交互定位仍待补。VSI-Bench 因需视频输入而被排除,视频时序理解未评。
仿真与榜单的时点性。 三仿真榜均为 2026-08-15 截取的时点快照,在线榜单会随新提交变化,复现需对齐时点。仿真到真实的分布差距客观存在,RoboColiseum 的 Real2Sim2Real 已尽量逼近但仍非真机。
工程约束。 Soft KI 的 α_KI、条件丢弃率(子目标 0.50/价值 0.15)、System 3 冻结策略等都是关键超参,正文给了定性但未全给数值复现表。双流 MoT 推理比交叉注意慢(0.221s vs 0.073s),部署需权衡。
七、总结:这篇工作给后续研究与产品什么启发
GigaBrain-0.7 的核心贡献不是单点最强,而是把"数据---架构---训练范式"三者一起重组:异构数据金字塔 + 三系统解耦协同 + 一阶段对齐 + 世界模型全生命周期参与。可迁移的启发有三条。
第一,"解耦 + 接口"可能比"大一统"更可控。三系统各自保留专用目标、靠语义/视觉/价值接口通信,既避开了统一架构牺牲专用性、又避开了级联架构接口过窄。这对后续做多系统具身基础模型是个可复用的组织原则------关键不在"几个系统",而在"接口暴露什么信息、梯度怎么流"。
第二,世界模型的价值在于"全生命周期参与"而非单次条件。把它从数据引擎升格为后训练的条件源、推理时的正进展引导、经验 RL 的回报来源,是其区别于 π0.7/GigaBrain-0.5M* 的实质。后续做"预测---评估---动作"闭环时,可沿用"子目标图管方向、价值管是否在推进"的分工。
第三,"演示 + 部署经验"的分层强化是可落地的自驱进化范式。SFT 给初始化、离线 RL 从 rollout 质量差异学、在线 RL 用更新后策略分布暴露的困难状态做精准人类纠正------这套把人从"全程监督"降到"困难状态介入"的范式,产品化时可直接对应"部署→采数据→离线精修→在线纠错"的持续迭代回路。
局限也很明确:跨本体(尤其人形)泛化、接触密集任务、点级可供性、评测量化口径都待补。继续方向是把三系统做更紧的端到端协同优化、延长 System 3 预测时域并接入 System 2 规划、以及把"部署经验→模型改进"做成可扩展的自进化闭环。
八、术语与概念速查
本段是读实验/消融时的查阅表,收对比方法、方法变体、基准与评测概念,不重复正文方法章已展开的核心概念。
| 类别 | 术语 | 一句话定位 |
|---|---|---|
| 对比基线(真机) | π0.5 | 分阶段 VLA,广预训练用离散动作 token、后训练上 flow-matching,异构共训练;GigaBrain-0.7 的主对标 |
| 对比基线(真机) | GigaBrain-0.1 | GigaBrain 系列前代,PaliGemma2 主干 |
| 对比基线(真机) | Xiaomi-Robotics-1 | 10 万小时 UMI 预训练 + 后训练对齐到机器人 |
| 对比基线(真机) | Galaxea G0.5 | 学到的跨本体动作分词器,自回归 VLM-as-Actor;H01 上弱 |
| 对比基线(VLM 基准) | Xiaomi-Robotics-0 | VLM-DiT MoT,先联合训 VLM 再冻结训 DiT |
| 对比基线(VLM 基准) | G0.5-base | G0.5 的基础 VLM 版;可供性与 VABench-Point 强 |
| 对比基线(VLM 基准) | Spirit-v1.5 | 串行级联 VLM-动作头 |
| 对比基线(VLM 基准) | Wall-OSS-0.5 | 层级 VL/Action Experts,单阶段梯度桥接共训练 |
| 对比基线(VLM 基准) | Hy-Embodied-0.5-VLA-UMI | HyVLA-0.5 的 UMI 变体,可供性近乎全 0 |
| 仿真对比 | π0 / X-VLA / X-WAM / InternVLA-A1 / GR00T N1.7 / ACoT-VLA | 三个仿真榜上的公开对照方法 |
| 前代/方法源 | GigaBrain-0 | 世界模型作数据引擎 + Embodied CoT + Knowledge Insulation |
| 前代/方法源 | GigaBrain-0.5M* | RAMP,世界模型预测的未来状态与价值做单次策略条件 + 人在环 |
| RL 方法 | AWR | 优势加权回归,离线/离策略经验;GigaBrain-0.7 离线段用 |
| RL 方法 | RECAP(π0.6*) | 从演示+在线经验+专家纠正的优势条件学习 |
| RL 方法 | FlowPRO(HyVLA-0.5) | 无评论家/无奖励的 PRO 离线偏好优化 |
| 训练工具 | LeRobot v3.0 | 统一轨迹格式;GigaBrain-0.7 数据标准化的载体 |
| 训练工具 | GLM-5.1 / Qwen3.6-27B | 指令重写 / 子任务标注的 LLM 辅助 |
| 评测概念 | ID / OOD | 训练分布内 / 分布外(换物体实例、布置、场景、技能组合) |
| 评测概念 | Co-Train / Single(RoboTwin) | 多任务联合后训练单策略 / 每任务单独微调一策略 |
| 评测概念 | Easy / Hard(RoboTwin) | 干净仿真 / 域随机化 |
| 评测概念 | SR / Score(EBench) | 总体任务成功率 / 任务进展综合分 |
| 评测概念 | Real2Sim2Real(RoboColiseum) | 基于重建的仿真评测,逼近真实视觉分布 |
九、拓展思考:值得继续扩展研究与思考的创新点
机制改进:三系统的端到端协同优化。 现在三系统靠结构化接口通信、各自保留专用目标,是一种"协调但解耦"的设计。自然下一步是让三系统通过端到端联合优化与迭代互精修做更紧的协同适应------但要避免重蹈"统一架构牺牲专用性"的覆辙,关键课题是设计能让预测/评估梯度安全回流到动作与理解、又不破坏各自目标的机制(Soft KI 是一个现成范式可推广到系统间)。
评测扩展:延长预测时域 + 接入规划 + 量化零样本。 System 3 当前预测时域已超出动作块长度并带来收益,但仍有限。把它进一步延长并与 System 2 的层次化规划深度耦合,可能支撑更长程的多段任务推理与更有信息的动作选择。同时,零样本"开箱即用"应补回量化成功率表(ID/OOD 全任务),把"涌现"从定性叙事变成可追踪的曲线。
可复现性:补全后训练超参与权重放出。 逐任务的后训练演示数、α_KI、条件丢弃率、System 3 冻结时点等应整理成复现表随权重放出;MiMo 的"持续预训练诊断 vs 留出基准"口径要在后续工作里分离报告,避免 0.5704 被误用。
工程落地:部署→采数据→离线精修→在线纠错的持续回路。 经验驱动 RL 的三段(SFT→离线→在线)天然对应产品部署的持续改进:机器人上线后采 rollout,离线段用世界模型价值当回报做无需新交互的精修,在线段只在困难状态请人介入。产品形态上,可探索"世界模型即在线评估器"------用 System 3 对部署策略做实时质量监测与自动难例挖掘,把人力从"全程监督"降到"难例纠错"。
方向收敛的判断。 这条路线的终极目标是"自主具身智能体":能自主策展 rollout 数据、精修策略与世界模型、并扩展胜任行为分布的可扩展自进化范式。GigaBrain-0.7 把"理解---预测---动作---经验改进"四件事首次放进一个协调系统,但闭环还远未自动化------世界模型与策略的相互迭代(类似 World-VLA-Loop 的思路)能否在本架构上跑通、跑到多大体量、能否跨本体,是后续最值得追的主线。
。** 逐任务的后训练演示数、α_KI、条件丢弃率、System 3 冻结时点等应整理成复现表随权重放出;MiMo 的"持续预训练诊断 vs 留出基准"口径要在后续工作里分离报告,避免 0.5704 被误用。
工程落地:部署→采数据→离线精修→在线纠错的持续回路。 经验驱动 RL 的三段(SFT→离线→在线)天然对应产品部署的持续改进:机器人上线后采 rollout,离线段用世界模型价值当回报做无需新交互的精修,在线段只在困难状态请人介入。产品形态上,可探索"世界模型即在线评估器"------用 System 3 对部署策略做实时质量监测与自动难例挖掘,把人力从"全程监督"降到"难例纠错"。
方向收敛的判断。 这条路线的终极目标是"自主具身智能体":能自主策展 rollout 数据、精修策略与世界模型、并扩展胜任行为分布的可扩展自进化范式。GigaBrain-0.7 把"理解---预测---动作---经验改进"四件事首次放进一个协调系统,但闭环还远未自动化------世界模型与策略的相互迭代(类似 World-VLA-Loop 的思路)能否在本架构上跑通、跑到多大体量、能否跨本体,是后续最值得追的主线。