写在前面:
社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~
AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。
论文:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence(清华大学智能产业研究院(AIR)/ Z-Trans AI,arXiv 2026)
发布时间:2026 年 8 月 17 日(arXiv v1)
作者:Xin Ding、Liang Mi、Mingzhe Huang、...、Ting Cao(共 15 人)
核心一句话:冻结 π0.5 与 GR00T N1.5 基座策略、只在线演化「代码化运行时 Critic + 恢复技能」的闭环 harness,就把 LIBERO-Pro 推到 90.8%、RoboCasa 推到 93.6%,并带来 11.1× 推理加速------证明具身 harness 的自演化本身就是一条 scaling 路径。
配套资源
核心关键词
- 闭环具身 harness(Closed-Loop Embodied Harness):相对「事后反思」的开环 agent,把治理下沉到动作频率------执行 unfolding 时就用轻量 Critic 触发恢复,而不是回合结束后才复盘。
- 可演化 harness H = { C , R , T } \mathcal{H}=\{C,R,\mathcal{T}\} H={C,R,T} :整篇唯一会被更新的是这组代码资产------运行时 Critic C C C、恢复剧本 R R R、异构工具集 T \mathcal{T} T;基座 VLA/WAM 全程冻结。
- 三时间尺度循环:动作频率的 Critic 治理环、rollout-batch 的候选优化环、迭代级的验证门控技能更新环,三者时间尺度分离、协同推进。
- 双智能体(Orchestrator + Evolutionary) :在线 Orchestrator A o r c h A_{orch} Aorch 固定多模态推理、只裁决模式切换;离线 Evolutionary A e v o A_{evo} Aevo 负责诊断---修复---泛化三步。
- VLA 重入契约 Ψ ( s t ) \Psi(s_t) Ψ(st) :恢复后必须同时满足「失败已清除」与「接触稳定性 > γ >\gamma >γ」才允许把控制权交回冻结基座,防止二次失败。
- 分层因果诊断 L ∗ L^* L∗:自顶向下逐层定位根因(评估→Critic→状态→规划→恢复→参数),「高层逻辑能解决就绝不改底层参数」,保证最小干预。
- Aha Moment(机器人顿悟时刻):当 agent 识别并解决那个「决定性物理瓶颈」时,成功率出现非线性的陡升,是 harness 自演化涌现的标志性现象。
带着问题阅读
- 为什么「事后反思」的具身 agent 救不了执行过程?闭环到底要闭在什么频率上、谁来做那个毫秒级决策?
- 基座策略冻结、只演化 harness,凭什么能把成功率推到基座能力上限------演化的究竟是代码 Critic 还是模型权重?
- 一个错误的修复怎么避免「按下葫芦浮起瓢」?分层因果诊断如何保证改的是根因、而非症状?
- 自演化会不会过拟合到几颗失败种子?held-out 验证如何挡住「自欺式提升」、又如何防止数据反复回灌?
- 跨任务的零样本迁移凭什么成立------恢复技能是某种图像模板/回放轨迹,还是物体相对几何与通用物理谓词?
- 20.6× 的 rollout 吞吐从哪来?Z-Infra 到底把什么从 agent 逻辑里解耦了,才让大规模试错成为可能?
一、核心导读
具身智能当下有两条主流路线:一条是端到端的视觉-语言-动作(VLA)基座策略,靠堆数据、堆模型把泛化能力往上推;另一条是「基座之上套一层 agent harness」,用大模型做规划、记忆、工具调用、验证与恢复来补基座的窟窿。前者的痛点很清楚------数据贵、物理分布会漂移、长程任务里一个微小执行误差就会级联放大,端到端策略很难从「演示复现」走到「真实可靠」。后者更被寄予厚望,但 Zetta 的作者抓住了一个被多数人忽略的硬矛盾:现有具身 agent harness 几乎都是开环的------它在 rollout 时按固定技能执行,等一整个 episode 结束后才去反思,而物理交互要求决策必须跟上快速变化的机器人-环境状态,这个频率远超今天的大模型 agent 能在线推理的速度。事后反思无法在执行 unfolding 时治理它,这就是「语义-物理鸿沟」。

如上图所示,Zetta 给出的回答是一个闭环具身 harness:保持基座策略冻结,转而在线演化「代码化的运行时 Critic」与「恢复技能」。这套思路的核心是把治理从「回合级事后反思」下沉到「动作频率级在线治理」------轻量 Critic 在执行中以动作频率扫描轨迹,一旦发现偏离就触发恢复;而这些被验证过的失败,会在离线阶段被蒸馏成可复用的 Critic 与恢复技能,回合往复地把 harness 往上迭代。三件事被组织成三个时间尺度分离的循环:动作频率的治理环、rollout-batch 的候选优化环、迭代级的验证门控技能更新环。为了支撑这种规模的反复试错与回放,作者另造了一套 rollout 基础设施 Z-Infra,把 agent 逻辑从异构的模型/工具/仿真器/机器人资源里解耦出来。
结果上,这套「冻结基座 + 自演化 harness」在 LIBERO-Pro 上把成功率推到 90.8%、在 RoboCasa 上推到 93.6%(均为当前 rollout 预算下的 SOTA),相对冻结基座分别从 34.5%→90.8%、73.6%→93.6%;学到的技能可零样本迁移到同族任务,并出现清晰的机器人「Aha Moment」;配合 Z-Infra,相对开环 agent-in-the-loop 基线拿到 11.1× 推理加速、20.6× 的有效 rollout 吞吐。作者据此主张:具身 harness 的自演化本身是一条 scaling 路径,不必非得动基座权重。需要提前点明的是,这套结论目前全部建立在仿真(LIBERO/RoboCasa 的 MuJoCo)之上,代码也尚未释出------它证明的是「机制可行且能 scale」,真实机器人迁移是作者自己列出的下一步。下文沿论文原始逻辑拆解这套机制与证据,并标注哪些是作者明确声称、哪些是基于文本的技术推断。
二、问题背景:作者到底想解决什么
作者把要解决的全部问题浓缩成三个挑战,分别对应三条设计原则;这三条原则随后贯穿整个方法。原论文 §2.2 把挑战与原则并列提出,这里先讲清「现状哪里坏了」,原则的实现留到方法章节逐条对应。
2.1 开环语义-物理鸿沟:事后反思跟不上毫秒级物理
第一条挑战(C1)直指开环 agent 的根本失配。基座 VLA 已经能在演示任务上复现,但真实部署暴露一个持续鸿沟:数据昂贵、物理分布漂移、长程任务里小执行误差会级联。于是在基座之上加 agent harness 来补窟窿,成为主流。可问题在于,多数具身 agent 是「episodic」的------它们也许能在一次 trial 内恢复,却很少把执行轨迹转化为受治理的长期改进;即便有反思,也是 episode 结束后的 post-hoc 反思。而物理交互要求决策跟上快速变化的机器人-环境状态,这个频率远超今天大模型 agent 在线推理的速度。事后反思无法在执行 unfolding 时治理它------等大模型想明白,物理已经错了。对应的解法原则是「高频状态治理」:把治理下沉到动作频率,用一个轻量、可演化的运行时 Critic 在执行中就做偏离检测与恢复触发,而不是把决策权整体交给一个慢速的大模型 agent。
2.2 过参数化修复的泛化陷阱:改得越猛、过拟合越深
第二条挑战(C2)针对的是「修 bug」这件事本身。当一个失败被定位,最自然的反应是写一个修复 patch。但作者指出一个过参数化修复的泛化陷阱:如果修复是针对某一颗失败种子「量身定制」的过参数化补丁,它在那一颗种子上会成功,却几乎一定会过拟合------换一颗种子、换一个任务就崩。这与大模型 agent 在数字域里「 verbal 反馈、迭代修订」就能work 的情形不同,因为具身世界是连续的、状态空间巨大、评测昂贵。对应的解法原则是「分层因果诊断下的最小干预」:先定位真正的根因层,再在尽可能高的抽象层做最小修复,避免一上来就动底层参数。
2.3 专家在环调试的扩展性瓶颈:人力顶不住
第三条挑战(C3)是工程层面的扩展性。具身 agent 的调试天然依赖「专家在环」------人来标注失败、设计恢复、验证迁移。这在几颗种子上可行,但只要任务数和种子数一上去,人力就成了硬瓶颈,self-evolution 的吞吐直接被卡死。对应的解法原则是「自动化演化泛化」:把单种子的修复抽象成版本化、可合并的 harness 包,再用一套严格的 held-out 泛化协议挡住自欺式提升。三条挑战---三条原则的对应关系,构成了后续 Phase I/II/III 与 Z-Infra 全部设计的动机底座。
三、核心思路:用一句主线串起来
把 Zetta 浓缩成一句话主线:冻结基座策略 π \pi π,用一个固定不变的多模态 Orchestrator A o r c h A_{orch} Aorch 在线裁决、一组离线 Evolutionary Agent A e v o A_{evo} Aevo 离线演化,唯一被更新的是代码化 harness H = { C , R , T } \mathcal{H}=\{C,R,\mathcal{T}\} H={C,R,T},三者通过三个时间尺度分离的循环协同,并由 Z-Infra 支撑大规模反复试错。

如上图所示,系统在「在线执行」与「离线演化」之间持续循环。左侧并行 rollout:动作策略执行任务,被可演化 harness H = { C , R , T } \mathcal{H}=\{C,R,\mathcal{T}\} H={C,R,T} 在线监视,所有干预都在 Orchestrator Agent 的高层裁决之下;rollout 被划分为成功与失败轨迹。右侧 Reflection & Evolve 是三阶段离线演化:Phase I 把失败聚类到成功参考基线下做画像;Phase II 做因果诊断定位根因层 L ∗ L^* L∗,再做最小 harness 修复更新 C / R / T C/R/\mathcal{T} C/R/T;Phase III 把种子级修复泛化为统一、版本化的 harness 包 H m e r g e d \mathcal{H}_{merged} Hmerged 回灌执行环。这张总览图支撑的是「闭环」这一核心主张------它同时回答了开环鸿沟(左半的在线 Critic)与泛化陷阱(右半的三阶段演化),而把扩展性瓶颈留给 Z-Infra 单独承担。
四、方法展开:沿着论文原始逻辑拆解
4.1 双智能体治理与可演化 harness
Zetta 的形式化从一个双智能体治理结构开始。基座动作策略 π = π ( s t , g ; θ ) \pi=\pi(s_t,g;\theta) π=π(st,g;θ),梯度 ∇ θ = 0 \nabla\theta=0 ∇θ=0------也就是说基座权重全程冻结 , π \pi π 只负责生成名义动作。其上是固定不变的多模态推理算子 Orchestrator Agent A o r c h A_{orch} Aorch(论文里以 Claude/GPT 这类前沿模型为例),它审计实时证据、批准模式切换,逻辑恒定。再往上是离线优化力 Evolutionary Agent A e v o A_{evo} Aevo,由诊断 A d i a g A_{diag} Adiag、修复 A r e p r A_{repr} Arepr、泛化 A g e n A_{gen} Agen 三个子 agent 组成,从失败 rollout 数据迭代改进 harness。
被演化的对象只有一个------harness,定义为:
公式(1):
H = { C , R , T } \mathcal{H} = \{C, R, \mathcal{T}\} H={C,R,T}
其中 C C C 是运行时 Critic:以动作频率扫描轨迹 τ 0 : t \tau_{0:t} τ0:t,产出结构化提案; R R R 是恢复剧本:把因果失败机制映射到结构化恢复策略库; T \mathcal{T} T 是异构工具集:规划器、抓取检测器、阻抗控制器等可在演化中生成/合成的可执行工具。Critic 的提案形如:
公式(2):
P t = C ( τ 0 : t ) = ⟨ e t , σ ^ t ⟩ P_t = C(\tau_{0:t}) = \langle e_t, \hat{\sigma}_t \rangle Pt=C(τ0:t)=⟨et,σ^t⟩
e t e_t et 是可审计的失败证据, σ ^ t \hat{\sigma}_t σ^t 是建议的执行模式。这里要特别注意一个权威层级:Critic 只产出提案、不执行动作、也不宣布成功------执行与成功的最终决定权在 Orchestrator。Orchestrator 的裁决函数为:
公式(3):
σ t = A o r c h ( P t , R , T , K ) \sigma_t = \mathcal{A}_{orch}(P_t, R, \mathcal{T}, \mathcal{K}) σt=Aorch(Pt,R,T,K)
σ t \sigma_t σt 为最终操作模式( σ t = 0 \sigma_t=0 σt=0 走 VLA/WAM, σ t > 0 \sigma_t>0 σt>0 调用专门工具), K \mathcal{K} K 是任务知识上下文。这一设计的意味在于:在线治理的高频决策不交给慢速大模型,而是交给轻量 Critic;大模型只在离线 Reflection & Evolve 阶段被调用,在线 rollout 跑的是「纯 VLA + 轻量 Critic」。这正是后文 11.1× 加速的来源。离线演化则由 A e v o A_{evo} Aevo 推进:
公式(4):
H ( k + 1 ) ← A e v o ( D f a i l ( k ) , H ( k ) ) \mathcal{H}^{(k+1)} \leftarrow \mathcal{A}{evo}(\mathcal{D}{fail}^{(k)}, \mathcal{H}^{(k)}) H(k+1)←Aevo(Dfail(k),H(k))
整篇的优化目标是最大化期望成功率,但只对 H \mathcal{H} H 优化、对 π \pi π 与 A o r c h A_{orch} Aorch 冻结:
公式(5):
max H J ( H ) = E g , s 0 ∼ D Success ( τ ) ∣ π , A o r c h , H \max_{\mathcal{H}} J(\mathcal{H}) = \mathbb{E}_{g, s_0 \sim \mathcal{D}} \left \\text{Success}(\\tau) \\mid \\pi, \\mathcal{A}_{orch}, \\mathcal{H} \\right HmaxJ(H)=Eg,s0∼DSuccess(τ)∣π,Aorch,H
这个目标函数本身就界定了 Zetta 的立场:它不追求训出一个更强的基座,而是追求在给定基座天花板下、把 harness 自演化到能逼近这个天花板。这个「逼近基座能力上限」的措辞是作者的明确主张;至于逼近的极限在哪里、何时饱和,论文未给出刻画,是后文要讨论的边界。
4.2 Phase I:经验性失败画像与基线(Loop 1)
Phase I 对应动作频率的 Critic 治理环(Loop 1),任务是给后续诊断准备「干净、可对齐的证据」。首先做确定性路由与有效性判定:只有传感器数据与视频完整的 rollout 才算有效,基础设施故障被隔离出去:
公式(6):
V = { s e e d j ∈ D d e v ∣ Valid ( s e e d j ) = True } \mathcal{V} = \{ seed_j \in \mathcal{D}_{dev} \mid \text{Valid}(seed_j) = \text{True} \} V={seedj∈Ddev∣Valid(seedj)=True}
每条有效轨迹被表示成一个 append-only 的多模态时间序列:
公式(7):
τ ( j ) = { ( s t , a t , μ t , ϕ t ) } t = 0 T \tau^{(j)} = \{ (s_t, a_t, \mu_t, \phi_t) \}_{t=0}^T τ(j)={(st,at,μt,ϕt)}t=0T
其中 μ t \mu_t μt 是里程碑完成情况、 ϕ t \phi_t ϕt 是 physio-auxiliary 信号(物理辅助量)。之所以要这么表示,是为了把「语义进度」与「物理状态」同时记录下来------后续诊断既看任务里程碑、也看接触/稳定性等物理量。画像阶段产出一个「成功参考索引」:对每个里程碑 μ \mu μ,聚合所有成功轨迹在该里程碑处的状态,定义出「名义分布」:
公式(8):
I s u c c ( μ ) = { s t ∣ τ ∈ V s u c c , μ t = μ } I_{succ}(\mu) = \{ s_t \mid \tau \in \mathcal{V}_{succ}, \mu_t = \mu \} Isucc(μ)={st∣τ∈Vsucc,μt=μ}
这个 I s u c c I_{succ} Isucc 是后续判断「状态是否偏离健康分布」的参照系。失败画像则定位到一个关键量------「首个缺失里程碑」:
公式(9):
m ∗ = min { m k ∈ M ∣ m k ∉ { μ t } t = 0 T } m^* = \min \{ m_k \in M \mid m_k \notin \{ \mu_t \}_{t=0}^T \} m∗=min{mk∈M∣mk∈/{μt}t=0T}
即轨迹里第一个没被观测到的语义里程碑。 m ∗ m^* m∗ 用于粗粒度失败聚类、把诊断范围收窄。这一节在论证中的作用是:给「失败」一个可对齐、可比较的结构化表示------有了成功参考分布和首个缺失里程碑,后续才能做聚类与因果定位,否则失败只是一堆不可比的黑盒轨迹。
4.3 Phase II Stage 1:失败聚类与因果诊断
进入 rollout-batch 候选优化环(Loop 2)的第一步,是把失败按机制聚类、再自顶向下定位根因。聚类用的锚点是「最早可观测偏离」:
公式(10):
t E O D = min { t ∣ dist ( s t , s t r e f ) > ϵ , s t r e f ∈ I s u c c ( μ t ) } t_{EOD} = \min \{ t \mid \text{dist}(s_t, s_t^{ref}) > \epsilon,\; s_t^{ref} \in I_{succ}(\mu_t) \} tEOD=min{t∣dist(st,stref)>ϵ,stref∈Isucc(μt)}
即状态分布首次偏离健康参考分布的时间步。以 t E O D t_{EOD} tEOD 为锚把失败聚成机制类,每类选一个 medoid 种子代表。诊断时作者强调一个「单视图锚定观测协议」(Single-View Grounded Observation Protocol)------只用主视图、且所有观测都锚定到真实状态,来消除多视图幻觉,避免诊断 agent 看着想象出来的多视角画面下结论。
诊断本身是自顶向下的层级因果定位。诊断层集合 L \mathcal{L} L 从高到低为:评估 L e v a l L_{eval} Leval → Critic L c r i t L_{crit} Lcrit → 状态 L s t a t e L_{state} Lstate → 规划 L p l a n L_{plan} Lplan → 恢复 L r e c v L_{recv} Lrecv → 参数 L p a r a m L_{param} Lparam。根因层定义为:
公式(11):
L ∗ = arg max L ∈ L { IsRootCause ( L ) ∣ Evidence from τ , Primary View } L^* = \arg\max_{L \in \mathcal{L}} \{ \text{IsRootCause}(L) \mid \text{Evidence from } \tau, \text{Primary View} \} L∗=argL∈Lmax{IsRootCause(L)∣Evidence from τ,Primary View}
这条层级顺序承载了「最小干预」原则的核心约束:如果高层逻辑能解决失败,就绝不修改低层参数 。换言之,先问是不是评估/Critic 的判断出了问题,再问状态估计,再到规划,最后才动恢复与参数。这样做有两个好处:一是保住基座与底层参数的完整性(不动 θ \theta θ),二是避免「哪里痛贴哪里」的症状式修复。这是对 C2 泛化陷阱的直接回应------根因层越高、修复越抽象,越不容易过拟合到某颗种子。
4.4 Phase II Stage 2:Critic 引导的 harness 修复与验证
定位到 L ∗ L^* L∗ 后, A r e p r A_{repr} Arepr 生成一个修复 patch H p a t c h = { C ∗ , R ∗ , T ∗ } H_{patch}=\{C^*,R^*,\mathcal{T}^*\} Hpatch={C∗,R∗,T∗}。这里有一个非常关键的设计------VLA 重入契约。恢复动作做完不等于可以立刻把控制权交回冻结基座;必须先证明失败已被清除、且当前接触稳定:
公式(12):
Ψ ( s t ) = 1 ( FailureCleared ) ∧ 1 ( Stability ( s t ) > γ ) \Psi(s_t) = \mathbb{1}(\text{FailureCleared}) \land \mathbb{1}(\text{Stability}(s_t) > \gamma) Ψ(st)=1(FailureCleared)∧1(Stability(st)>γ)
Ψ ( s t ) \Psi(s_t) Ψ(st) 为真才允许重入 VLA。这条契约的意义在于防止二次失败:如果恢复后状态仍不稳就交回基座,基座会在一个已经偏的状态上继续 nominal 动作,把恢复成果毁掉。修复是否成立,由一个两步闭环验证协议判定------诊断回放(用同一 seed/RNG 重放,隔离修复贡献)加 fresh rollout(全新种子验证非记忆):
公式(13):
Success ( H p a t c h ) = 1 ( μ T , n e w = m g o a l ∧ ∀ t ∈ Intv , Adjudicated by A o r c h ) \text{Success}(\mathcal{H}{patch}) = \mathbb{1}(\mu{T, new} = m_{goal} \land \forall t \in \text{Intv}, \text{Adjudicated by } \mathcal{A}_{orch}) Success(Hpatch)=1(μT,new=mgoal∧∀t∈Intv,Adjudicated by Aorch)
即 patch 通过验证,当且仅当任务到达目标里程碑 m g o a l m_{goal} mgoal、且区间内所有干预都被 Orchestrator 正确裁决。这里「诊断回放 + fresh rollout」两步是 Zetta 区别于单纯回放式修复的关键:前者隔离出修复的真实贡献(同 seed 同 RNG,变量只有 patch),后者排除「只是记住了这颗种子」的可能。
4.5 Phase III:harness 合并、打包与泛化
通过验证的 patch 仍是种子级的。Phase III(对应迭代级验证门控技能更新环,Loop 3)把它抽象、合并、泛化为统一版本化 harness:
公式(14):
H m e r g e d = Consolidate ( { H p a t c h , j ∣ s e e d j ∈ K i } ) \mathcal{H}{merged} = \text{Consolidate} \left( \{ \mathcal{H}{patch, j} \mid seed_j \in K_i \} \right) Hmerged=Consolidate({Hpatch,j∣seedj∈Ki})
合并时三类资产各有策略:Critic 用逻辑 OR 做统一(Unification),恢复做集成(Integration),工具做扩展(Expansion)。合并后的 H m e r g e d \mathcal{H}_{merged} Hmerged 被打包成一个版本化 harness 包------SKILL.md + tools/ + plans/ + params/,即「技能=可复用 Critic + 恢复 + 工具」的代码资产。泛化要过两道关。第一道是历史回归:合并 harness 必须在它来源的失败簇 K i K_i Ki 上 100% 解决原始失败:
公式(15):
∀ s e e d j ∈ K i , Success ( s e e d j ∣ H m e r g e d ) = 1 \forall seed_j \in K_i,\; \text{Success}(seed_j \mid \mathcal{H}_{merged}) = 1 ∀seedj∈Ki,Success(seedj∣Hmerged)=1
第二道是 held-out 泛化,用一批从未参与演化的隔离种子衡量相对冻结基座的成功率提升:
公式(16):
Δ S R = S R ( D h e l d − o u t ∣ H m e r g e d ) − S R ( D h e l d − o u t ∣ π V L A ) \Delta SR = SR(\mathcal{D}{held-out} \mid \mathcal{H}{merged}) - SR(\mathcal{D}{held-out} \mid \pi{VLA}) ΔSR=SR(Dheld−out∣Hmerged)−SR(Dheld−out∣πVLA)
只有 Δ S R > 0 \Delta SR>0 ΔSR>0 才算泛化成立。这里还有一个「动态过渡协议」防数据泄漏:一旦某颗 held-out 种子失败被纳入开发集重新演化,就必须换一批全新的未见种子再做评估,避免同一批 held-out 被反复回灌、演化为「针对 held-out 的过拟合」。Phase III 整体是对 C3(专家在环扩展性)的回应------把人力调试替换成自动化的「合并---打包---验证---过渡」流水线。
4.6 Z-Infra:具身 Agent 的 rollout 基础设施
三阶段演化要反复试错、回放、重跑,吞吐就是硬瓶颈。Z-Infra 是作者专门为「自演化具身 agent」造的 rollout 基础设施,把 agent 逻辑从异构执行资源里解耦。原论文 §3 给出三层架构。

如上图所示,三层分别是:Control Plane 作为协调中枢,含 Gateway、会话注册表、心跳容错与负载均衡;Environment Worker 层 做会话级生命周期管理(CREATE→RUNNING→TERMINATED),并以「资源共享组」把 MuJoCo 模型编译一次后 fork 出多个槽位,C++ 控制器释放 GIL 以并行跑物理与渲染;Rollout Worker 层做 GPU 常驻批量推理,含调度器(按兼容性组 FCFS、带路由 token)、模型分区(VLM 与 Action Expert 拆成独立进程、用 CUDA IPC 通信)、可选量化运行时(W8A8/W4A16/W4A8 按模块)。整套构建在 Ray 之上,用 5 条有界 Ray Channel 承载控制流与数据流。
编程模型是 sessions/episodes/steps 三级,对外暴露一批可跨会话批量的核心 API 原语(原论文 §3.4,Table 1):
| API Primitive | 功能 |
|---|---|
create_sessions(requests) |
批量创建会话,带 env_family/env_config/lease_seconds,返回含 session_id 的 SessionHandle |
renew_sessions(session_ids) |
为活跃会话续租 |
close_sessions(session_ids) |
关闭会话并释放资源(幂等) |
reset(session_ids, reset_spec) |
以 task_id/seed/instruction 开新 episode,返回 episode_id 与初始观测 |
observe(session_ids) |
无副作用读取当前观测 |
action_step(session_ids, actions) |
执行动作,返回观测/reward/terminated/truncated |
policy_step(session_ids, policy_req) |
原子 observe→inference→step,返回带已执行动作的步结果 |
policy_infer(session_ids, policy_req) |
仅推理不步进,供 agent 后处理 |
run_episode(session_ids, episode_req) |
在 worker 内跑完整 episode,返回摘要(步数/reward/停止原因) |
policy_step 是这套编程模型的关键原语:它把「观测→推理→步进」做成一个跨 Agent/Gateway/EnvWorker/RolloutWorker 的原子调用(原论文 §3.4 的 Listing 1 给出了其伪代码),从而让 agent 逻辑不必关心模型放哪、环境跑在哪。两个工程优化直接决定了后文的吞吐数字:模型分区 把 π0.5 的 VLM 与 Action Expert 拆成独立进程经 CUDA IPC 通信,在 200ms SLO 下拿到 53% 平均推理延迟下降、2.4× goodput;量化运行时在 RTX 4090 上对 π0.5 用 W8A8(前缀 MLP)拿到 1.18--1.32× 推理加速且无成功率损失。这两条把「自演化需要海量 rollout」从一句口号变成可工程兑现的吞吐。
五、实验与证据:结果能支撑到什么程度
5.1 实验设置
硬件上,操控实验在 8×NVIDIA RTX 4090 上做,Z-Infra 性能评估(§5.7)则在 8×A100 上做------两套硬件分工明确,读者比对数字时要注意这一区别。基座策略全程冻结:LIBERO-Pro 用 π0.5(Physical Intelligence),RoboCasa 用 GR00T N1.5(NVIDIA)。评测协议强调 dev/held-out 分离:RoboCasa 每个任务 50 颗 dev 种子 + 50 颗与之不相交的 held-out 种子;LIBERO-Pro 用 50 颗 Parent dev 种子(排除 seeds 1--20),迭代到 dev 成功率 ≥50% 后,在 seeds 1--20 上做 held-out 评估。两个基准的任务标识对照如下(原论文附录 A/B):
| RoboCasa ID | 官方任务名 | RoboCasa ID | 官方任务名 |
|---|---|---|---|
| T1 | NavigateKitchen | T10 | OpenCabinet |
| T2 | TurnOnMicrowave | T11 | CloseFridge |
| T3 | PickPlaceCounterToStove | T12 | SlideDishwasherRack |
| T4 | PickPlaceSinkToCounter | T13 | TurnOnElectricKettle |
| T5 | PickPlaceDrawerToCounter | T14 | OpenStandMixerHead |
| T6 | PickPlaceCounterToCabinet | T15 | CloseBlenderLid |
| T7 | PickPlaceToasterToCounter | T16 | OpenDrawer |
| T8 | TurnOnSinkFaucet | T17 | CloseToasterOvenDoor |
| T9 | CoffeeSetupMug | T18 | TurnOffStove |
| ID | LIBERO-Goal 指令 | ID | LIBERO-10(Long) 指令 |
|---|---|---|---|
| Task 0 | open the middle drawer of the cabinet | Task 0 | put both the alphabet soup and the tomato sauce in the basket |
| Task 1 | put the bowl on the stove | Task 1 | put both the cream cheese box and the butter in the basket |
| Task 2 | put the wine bottle on top of the cabinet | Task 2 | turn on the stove and put the moka pot on it |
| Task 3 | open the top drawer and put the bowl inside | Task 3 | put the black bowl in the bottom drawer of the cabinet and close it |
| Task 4 | put the bowl on top of the cabinet | Task 4 | put the white mug on the left plate and put the yellow and white mug on the right plate |
| Task 5 | push the plate to the front of the stove | Task 5 | pick up the book and place it in the back compartment of the caddy |
| Task 6 | put the cream cheese in the bowl | Task 6 | put the white mug on the plate and put the chocolate pudding to the right of the plate |
| Task 7 | turn on the stove | Task 7 | put both the alphabet soup and the cream cheese box in the basket |
| Task 8 | put the bowl on the plate | Task 8 | put both moka pots on the stove |
| Task 9 | put the wine bottle on the rack | Task 9 | put the yellow and white mug in the microwave and close it |
LIBERO-Pro 在原 LIBERO 之上加了受控扰动:「T」=任务/指令重定向(把指令指向另一个合法目标物或目标条件),「S」=位置交换(相关物体初始位置被打乱、指令不变)。评测覆盖 LIBERO-Goal 与 LIBERO-10(文中简称 Long)两套各 10 个任务,T/S 两种扰动,共 40 个任务-设定对。
5.2 Aha Moment:顿悟式跃迁
作者把演化中最醒目的现象命名为「Aha Moment」------成功率在一个 checkpoint 处出现非线性陡升。其机制解释是:v0 是冻结基座(Pure-VLA)基线,v1 是早期「症状式修复」(比如加个 staging 或局部 gate),成功率停滞不动;真正的 Aha 发生在 v2,即 agent 识别并解决了那个决定性物理瓶颈(如抓取保持 grasp retention、或语义接近 semantic approach),执行可靠性随之骤升。

如上图所示,LIBERO-Pro 上 Goal-T2(把酒瓶放进碗里)从 15%→95%、Goal-S6(把奶油奶酪放进碗里)从 5%→90%、Goal-T8 从 5%→60%。下图是 RoboCasa 上的同类现象:TurnOnElectricKettle 88%→94%、SlideDishwasherRack 76%→94%、CloseToasterOvenDoor 82%→96%;其 L2-v0→L2-v1 的平段被解释为「早期候选修复过拟合个别失败」的时期,到 L2-v2 识别出关键物理瓶颈(如末端执行器对齐 EEF alignment、或居中接触 centered contact)才陡升。

这两组图真正要支撑的是「顿悟来自识别决定性瓶颈、而非堆叠补丁」这一因果判断。从证据强度看,它能说明 v1→v2 的跃迁与「解决特定物理瓶颈」相关;但「Aha 是否在别的任务上同样可复现、是否对种子敏感」论文只给了若干代表性案例,尚未给出系统性分布刻画------这是证据较强、但尚未完备的地方。
5.3 LIBERO-Pro:累积 scaling 与零样本迁移
LIBERO-Pro 上的累积 scaling 如下图所示,分别是 Goal-T(指令重定向)与 Goal-S(位置交换)两种扰动下、十个任务的平均表现,每个点是选定的某个累积 harness 版本,基座全程冻结。

如图上半(Goal-T)平均从 31.0%→92.5%,下半(Goal-S)从 38.0%→89.0%。这张图支撑的是「同任务累积 scaling」的主张------在不动基座的前提下,单靠 harness 累积演化就能把成功率大幅推高。跨任务迁移则更值得注意:作者在 Goal-T8 上发现的三个累积 Critic--Recovery 能力,被零样本迁移到 Goal-T2、Goal-T6、Goal-S3。

如上图所示,曲线是各累积栈在固定种子上的完整评测,阴影为 Wilson 95% 置信区间,右侧框是对应失败与恢复机制的示意而非额外迁移测量。其中 Goal-S3 出现 9/20→20/20 的跃迁。下图是从 Goal-S5 源任务迁移到 Goal-S3、S4、S9 的对照,四支在同一任务内用相同固定种子、策略 RNG、checkpoint 与执行预算。

这两张迁移图真正要证明的是「迁移靠的是物体相对几何与通用物理谓词、而非任务特定模板」------这是作者对 C2 泛化陷阱的核心反证。从证据看,固定种子+Wilson CI 的对照设计能说明迁移不是随机噪声;但「为何恰好是 T8/S5 这两个源任务可迁移」、以及迁移失败的案例,论文未系统披露。
5.4 RoboCasa:累积 scaling 与零样本迁移
RoboCasa 上 18 个 Atomic-Seen 任务的累积反思 scaling 如下图:宏平均从冻结父 harness 的 73.56%,经四轮全局修复到 78.71%→84.85%→90.54%→93.56%,每个 checkpoint 保留此前已验证的 Critic/恢复/工具能力。

零样本迁移分两组。第一组是 PnP(Pick-and-Place)类:在 PnP-Stove 上逐轮加入「物体相对预抓取对齐、抓取丢失后有界重抓、稳定放置」,然后把累积 checkpoint 零样本(不再跑训练/演化环)用到 PnP-Sink、PnP-Cabinet、PnP-Toaster。

如上图所示,PnP-Sink 58%→82%、PnP-Cabinet 62%→80%、PnP-Toaster 72%→90%,宏平均 64%→84%(+20pp)。第二组是铰接交互类:在 TurnOffStove 上逐轮加入「目标定位、避碰预接触接近、稳定 EEF--目标接触」,再零样本迁移到 TurnOnSinkFaucet、OpenCabinet、TurnOnMicrowave。

如上图所示,铰接交互宏平均 64%→80%(+16pp)。两组迁移共同支撑「恢复技能可复用」的主张------其逻辑是 PnP 类共享「抓取-搬运-放置」的物体相对几何,铰接类共享「定位-接近-接触」的结构,所以同源技能能迁移。右侧面板给出的是 Critic 识别的失败签名与对应恢复,便于读者核对「修的确实是根因机制」。
5.5 基准对比
两个基准的对比结果如下。RoboCasa 18 个 Atomic-Seen 任务上,Pure VLA(GR00T)宏平均 73.56%,Zetta 提到 93.56%。
| Method | T1 | T2 | T3 | T4 | T5 | T6 | T7 | T8 | T9 | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| Pure VLA (GR00T) | 78 | 74 | 78 | 58 | 48 | 62 | 72 | 74 | 70 | 73.56 |
| Zetta | 96 | 92 | 94 | 96 | 86 | 80 | 96 | 96 | 86 | 93.56 |
| Method | T10 | T11 | T12 | T13 | T14 | T15 | T16 | T17 | T18 | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| Pure VLA (GR00T) | 62 | 92 | 76 | 88 | 96 | 50 | 90 | 82 | 74 | 73.56 |
| Zetta | 94 | 98 | 94 | 94 | 100 | 100 | 94 | 96 | 92 | 93.56 |
LIBERO-Pro 四个设定上,π0.5 对 Zetta 的对比(Task 0--9 逐项成功率%):
| Setting | Method | T0 | T1 | T2 | T3 | T4 | T5 | T6 | T7 | T8 | T9 | Avg |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Goal (T) | π0.5 | 0.0 | 95.0 | 10.0 | 0.0 | 100.0 | 0.0 | 20.0 | 80.0 | 5.0 | 0.0 | 31.0 |
| Goal (T) | Zetta | 80.0 | 100.0 | 95.0 | 80.0 | 100.0 | 100.0 | 95.0 | 95.0 | 80.0 | 100.0 | 92.5 |
| Goal (S) | π0.5 | 0.0 | 60.0 | 0.0 | 45.0 | 0.0 | 0.0 | 0.0 | 100.0 | 100.0 | 75.0 | 38.0 |
| Goal (S) | Zetta | 90.0 | 65.0 | 80.0 | 85.0 | 95.0 | 95.0 | 100.0 | 100.0 | 100.0 | 80.0 | 89.0 |
| LIBERO-10 (T) | π0.5 | 5.0 | 95.0 | 95.0 | 0.0 | 0.0 | 80.0 | 85.0 | 75.0 | 65.0 | 0.0 | 50.0 |
| LIBERO-10 (T) | Zetta | 35.0 | 95.0 | 100.0 | 0.0 | 25.0 | 100.0 | 95.0 | 80.0 | 100.0 | 0.0 | 63.0 |
| LIBERO-10 (S) | π0.5 | 0.0 | 35.0 | 0.0 | 0.0 | 5.0 | 50.0 | 0.0 | 0.0 | 0.0 | 0.0 | 9.0 |
| LIBERO-10 (S) | Zetta | 90.0 | 50.0 | 95.0 | 75.0 | 15.0 | 65.0 | 5.0 | 0.0 | 0.0 | 5.0 | 40.0 |
整体看,LIBERO-Pro 四设定宏平均从 32.00%→71.13%(+39.13pp),其中 Goal-T 31.0→92.5、Goal-S 38.0→89.0、LIBERO-10(T) 50.0→63.0、LIBERO-10(S) 9.0→40.0。摘要里 90.8% 即 Goal-T 与 Goal-S 的平均((92.5+89.0)/2≈90.8)。需要诚实指出的证据边界:在 LIBERO-10(S) 上,Task 7/8 两项 Zetta 与 π0.5 同为 0.0%------并非所有任务都被 harness 救起来,长程+位置交换设定仍是硬骨头;这正好对应作者「逼近基座能力上限」而非「无限提升」的措辞。
5.6 案例研究:一个 PnP 回合里的 Critic--恢复干预序列
把视角从统计均值拉回到单次 episode,能看清「闭环」到底长什么样。作者用 PnP-Stove 作代表,给出一次回合里 Critic--恢复干预的序列:VLA 先抓取并搬运物体;Critic 检测到抓取丢失,触发 re-approach 恢复;一个非法重抓位姿触发 GraspGen 合成可行抓取;接近目标时,最后一个 Critic 调用稳定 CAP 放置;每次局部修复后,只有当恢复状态被验证才把控制权交回 nominal VLA。

如上图所示,这张序列图支撑的是「干预是有界、可验证的」而非「无限重启」------它直接对应 §4.4 的 VLA 重入契约 Ψ ( s t ) \Psi(s_t) Ψ(st)。原论文附录 C 给出了 PnP-Stove 的精简 Critic--恢复技能伪代码(Algorithm 1):核心循环是「执行一个 VLA 或恢复动作块→收集状态窗 W t W_t Wt→Critic 出提案 P t P_t Pt→若官方任务谓词满足则成功;若正常进展则续跑冻结 VLA;若抓取失败/不稳则冻结不安全运动、释放、重置并取一个不等于失败记忆 M M M 的新抓取;若搬运停滞但抓取稳则切到精细对齐;若已支撑放置则释放并撤退;Orchestrator 批准每次干预与每次回归名义执行」。这套技能之所以能迁移,是因为它的 Critic 与恢复都由物体相对几何和通用物理谓词定义,而非某个炉灶特定的图像模板或回放轨迹------相关 PnP 任务只要重绑定活体物体与目标容器即可复用同一套抓取/搬运/放置恢复逻辑。

第二个案例是 LIBERO-Pro Goal-S5,如上图所示刻画了「失败前沿」随提升轮次前移的过程:父 VLA 在没有及时恢复交接时耗尽执行预算;后续轮次依次引入保持门控的交接(retention-gated handoff)、接触门控的抓取恢复(contact-gated grasp recovery)、有界的重抓重试(bounded re-grasp retry)。每一项都解决此前暴露的失败、并暴露一个更后段的瓶颈,直到保持搬运恢复、满足官方炉前关系。关键的方法论点是:Round 2 与 Round 3 用同一环境 seed 与策略 RNG,从而直接隔离出 carry-retry 机制的贡献;同 seed 相邻轮次的对照同样验证了保持交接与接触门控抓取两项加成的贡献。原论文附录 D 给出 Goal-T2(PutWineBottleInBowl)的同类伪代码(Algorithm 2),结构与 Algorithm 1 同构------预抓取恢复、保持物体 Critic(区分成功搬运与空/滑抓取)、放置恢复(对齐活体碗、降至容纳确立、释放后撤退不扰动已放物)。两个案例合在一起,暴露的是两种互补的组合性:RoboCasa 在一个长程 episode 内在线组合多个专门恢复,LIBERO-Pro 在外循环迭代间组合被提升的 Critic--恢复技能;两者的共同机理都是「定位最早未解决失败→施加有界修复→验证修复状态后才让执行前进」。
5.7 Z-Infra 性能评估
最后看 Z-Infra 本身的吞吐与延迟。作者在 8×A100、相同模型 checkpoint 与动作预算下,跨并发度 1/8/16/32/64 在 LIBERO Goal 上评测。

如上图所示,延迟方面:Z-Infra 从并发 8 的 39s 升到并发 32 的 57s(+46%),再到并发 64 的 95s;而「Ours w/o Z-Infra」从 34s@c8 爆炸到 112s@c16(3.3×);RPent 因 agent-in-the-loop 设计在每个决策点都要调 LLM API,固有高延迟(392s→513s)。两基线在并发>16 后均 OOM。吞吐方面如下图:Z-Infra 从 12.18 ep/min@c8 升到 32.8@c32(2.7×),并发 16 时 22.09 ep/min------是 Ours w/o Z-Infra(2.88)的 7.7×、RPent(1.72)的 12.8×;并发 64 饱和于 35.1 ep/min。

汇总几个关键数字:相对 RPent,推理延迟降 91% 即 11.1× 加速、每回合延迟降 11.9×;有效 rollout 吞吐从 1.7→35.1 ep/min 即 20.6×。这些数字支撑的是「自演化需要海量 rollout,而 Z-Infra 把这个吞吐兑现到了工程层面」------但要注意,吞吐收益部分来自「在线只跑纯 VLA + 轻量 Critic、大模型只在离线 Reflection & Evolve 调用」这一设计选择,并非纯粹的基础设施魔法。
六、这篇工作的边界与可复现性
作者明确承认的局限很少。 论文没有专门的 limitations 章节,唯一的展望来自结论:把 Zetta 与 Z-Infra 扩展到真实机器人------在真机上做大规模并行 rollout 采集与自演化、弥合 sim-to-real、并把真实机器人环境作为与仿真并列的一等 worker 接入 Z-Infra。这等于自认当前工作仍是 sim-only。
基于文本可推断的边界 ,需与作者声称区分开来:其一,全部实验在 LIBERO/RoboCasa 的 MuJoCo 仿真上完成,sim-to-real 未被触及,「逼近基座能力上限」是在仿真基座天花板上成立的。其二,系统对前沿 LLM/VLM 质量有依赖------Orchestrator A o r c h A_{orch} Aorch 与 Evolutionary A e v o A_{evo} Aevo 的诊断/修复/泛化质量直接受所用大模型能力制约,论文未刻画这一依赖的鲁棒性。其三,演化需要相当的 rollout 预算,而「在冻结 VLA 天花板下的 scaling 极限在哪里、何时饱和」未被定量刻画------曲线是单调上升的,但没有给出饱和拐点。其四,Aha Moment 的陡升存在种子敏感性风险,论文只给了若干代表性案例而非系统分布。其五,零样本迁移的「失败案例」未系统披露,读者无法判断迁移失败的形态。
可复现性 :项目主页 https://air-embodied-brain.github.io/zetta 是活跃的官方入口;但源代码在 LaTeX 源里是被注释掉的 (https://github.com/air-embodied-brain/zetta 未释出),也没有权重或数据释出声明。硬件门槛不低:操控实验 8×RTX 4090、Z-Infra 性能评估 8×A100。基座 π0.5 与 GR00T N1.5 本身是外部模型。综合看,机制层面可被理解和复现思路,但端到端复现受限于代码未开源与基座可得性------这是当前最大的复现缺口,也是作者后续释出代码后才能真正兑现的承诺。
七、如果继续研究/落地,应该关注什么
第一,scaling 的天花板与基座协同。论文证明 harness 自演化能逼近冻结基座天花板,但没回答「逼近之后怎么办」。一个自然的问题演化方向是:当 harness 演化饱和,是否需要周期性把验证过的恢复数据反哺基座做微调(co-evolve),还是保持纯 harness 路线、换更强的冻结基座再演化一轮。这关系到「harness 路线 vs 基座路线」在长程上是否收敛。
第二,真机一等公民 worker 与 sim-to-real 。作者已把「真机作为一等 worker 接入 Z-Infra」列为下一步,但这背后有一组硬问题:真机 reset 成本、安全约束、接触稳定性判定在真机上的可靠性。VLA 重入契约 Ψ ( s t ) \Psi(s_t) Ψ(st) 在真机上的 γ \gamma γ 阈值标定会比仿真更敏感,值得单独研究。
第三,harness 演化与技能库体系的关系 。Zetta 的 H m e r g e d \mathcal{H}_{merged} Hmerged 打包成 SKILL.md + tools/ + plans/ + params/,本质是一个可演化技能库;这与 ASPIRE/EmbodiSkill/VASO 等「从失败与反思中发现可复用程序/概念/技能」的路线有结构性亲缘,可对照研究「代码化 Critic」相对「形式化可验证技能」(VASO)在安全保证上的权衡。
第四,Z-Infra 作为具身推理服务的工程价值。模型分区 + 量化运行时 + 持久 worker + 动态批量化这一套,本身就是一个面向 VLA 服务的推理优化栈,与 Oxygen(统一 KV cache 管理)、Embodied.cpp(异构便携运行时)等可组合;落地时可作为「具身模型服务层」单独产品化,而不必绑定在自演化流程里。
第五,评测扩展。当前 held-out 是 per-task 不相交种子;更可信的泛化证据应包括跨扰动类型、跨基准、跨具身形态的 held-out,以及对「迁移失败案例」的系统披露。Aha Moment 也需要从案例上升到分布性的统计刻画。
八、术语与概念速查
| 术语 | 解释 |
|---|---|
| π0.5 | Physical Intelligence 的 VLA,本文 LIBERO-Pro 的冻结基座策略 |
| GR00T N1.5 | NVIDIA 的人形机器人 VLA,本文 RoboCasa 的冻结基座策略 |
| Pure-VLA(基线) | 仅用冻结基座策略、无 harness 的对照,对应 v0 / L2-v0 |
| RPent / HarnessVLA | 开环 agent-in-the-loop 基线(每个决策点调 LLM API),本文主要吞吐/延迟对照 |
| Ours w/o Z-Infra | 去掉 Z-Infra 的消融基线,用于隔离基础设施贡献 |
| LIBERO-Pro | 在原 LIBERO 上加受控扰动(T=指令重定向,S=位置交换)的鲁棒评测基准,含 Goal 与 LIBERO-10(Long) 两套各 10 任务 |
| RoboCasa | 大规模日常任务仿真基准,本文用 18 个 Atomic-Seen 任务 |
| Z-Infra | Zetta 配套的 rollout 基础设施,三层(Control Plane / Environment Worker / Rollout Worker),构建于 Ray |
| W8A8 / W4A16 | 模型量化精度(权 8-bit/激活 8-bit 等),Z-Infra 按模块可选,π0.5 在 4090 上 W8A8 前缀 MLP 拿 1.18--1.32× 加速无成功率损失 |
| EOD(Earliest Observable Divergence) | 最早可观测偏离时间步 t E O D t_{EOD} tEOD,失败聚类的锚点(§4.3) |
| First Missing Milestone m ∗ m^* m∗ | 轨迹里首个未被观测到的语义里程碑,用于粗粒度失败聚类(§4.2) |
九、拓展思考:值得继续扩展研究与思考的创新点
机制层面,最值得追问的是「Aha Moment 的因果结构」。如果顿悟真的来自「识别决定性物理瓶颈」,那么是否可以预先用一套瓶颈探测(如 ActProbe 式的 action-space 探针)把瓶颈定位前移,从而让 Aha 提前发生、而非等演化跑够轮次?这会把「涌现」改造成「可触发的发现」,并可能降低 rollout 预算。另一个机制方向是 Critic 的表示------当前 Critic 是代码化的、人/agent 可读,这种可审计性是优点,但也限制了 Critic 的表达力;是否能在「可审计代码 Critic」与「可微 Critic」之间找到一个混合表示,既保留最小干预的可解释性、又获得梯度式的优化效率。
评测层面,现有 held-out 协议防住了单任务过拟合,但尚未防住「对 held-out 协议本身过拟合」。一个更严格的设定是:用一批从未参与演化的「跨基准」任务做 zero-shot(如 LIBERO 演化出的技能直接测 RoboCasa 同构子任务),这比 per-task 不相交种子更能检验「物体相对几何」这一迁移假设的普适性。此外,Aha Moment 应被建模为一个可被统计检验的事件(如成功率分布的变点检测),而非只展示代表性曲线。
可复现性层面 ,代码未释出是当前最大缺口。一个有价值的社区贡献是把 Zetta 的「Critic--恢复技能包」格式(SKILL.md + tools/ + plans/ + params/)标准化成一个开放技能包协议,使得不同基座(π0.5、GR00T、OpenVLA)之上可以共享与交换演化出的技能------这会把 Zetta 从「一个系统」变成「一个生态」,也让「冻结基座 + 可移植技能」成为一条可被多方共建的 scaling 路径。
工程落地层面,Z-Infra 的三层解耦提示了一个产品形态:把「具身模型服务层」(Rollout Worker 的模型分区+量化+动态批量)从自演化流程里拆出来,作为通用 VLA 推理服务单独交付。其价值不限于自演化------任何需要高并发 VLA 推理的场景(数据采集、批量评测、在线部署)都能受益,且与 Oxygen(KV cache)、Embodied.cpp(便携运行时)等正交可组合。
产品形态层面 ,如果「冻结基座 + 自演化 harness」成立,那么具身产品的迭代重心会从「重训基座」转向「运营技能库」------即厂商交付一个冻结基座,客户的差异化能力来自各自演化出的 Critic--恢复技能包。这会重塑具身智能的商业分工:基座方、技能库运营方、基础设施方三者分离,类似 LLM 时代「基座模型---中间件---应用」的分层。Zetta 的 H m e r g e d \mathcal{H}_{merged} Hmerged 版本化与动态过渡协议,已经具备这种「技能库运营」的雏形。