RSIAgent 拆解:不更新模型参数,Agent 靠环境自探索把开源模型推过 GPT-6 Astra,Scaling Experience 的递归自提升

一、反直觉的数字:分数涨了,参数没动

2026年9月15日,机器之心报道了Aether AI的RSIAgent。

同一时间,arXiv挂出了论文2609.

15364。

RSIAgent在OSWorld 2.

0上拿到78.

98%的Partial Score。

这个数字超过了GPT-6 Astra的72.

60%。

在Agents' Last Exam上,RSIAgent达到84.

82%。

GPT-6 Astra在同一基准上是82.

26%。

最反直觉的地方在于:底层模型参数一个都没更新。

RSIAgent不是新模型,而是一套训练无关的多智能体框架。

它把Kimi-K3和GLM-5.

3这些开源模型推过了闭源旗舰。

Aether AI给出的解释只有一句话:不Scale Model,Scale Experience。

本文拆解这套框架的三层设计:递归闭环、两阶段探索、可演化记忆。

先给结论:环境经验正在成为比模型参数更便宜的杠杆。

这个判断决定了RSIAgent的一切设计选择。

后文先用数字坐实反直觉,再逐层拆机制。

读者可以直接跳到代码骨架看最小闭环。

完整阅读可以理解Scaling Experience的完整版图。

二、Scaling Experience:另一条规模化路径

过去几年,大模型的能力跃迁几乎都围绕Scaling一词。

Scaling Law说的是:模型越大、数据越多,能力越强。

这条路径本质上是先训练、再部署。

模型进入新软件、新工具、新环境后,往往需要重新收集数据并额外训练。

Aether AI想试另一种Scaling:不继续Scale Model,而是Scale Experience。

模型参数先不动,让Agent自己进入环境探索、试错、验证。

再把得到的经验不断积累下来。

RSIAgent就是这套思路在数字环境里的具体实践。

它把Agent与环境的交互过程,变成一种持续学习过程。

核心是让Agent自己决定学什么、自己验证结果。

这与人类的学习范式高度一致:先广泛试错,再沉淀经验。

Scaling Experience的隐含假设是环境比数据更便宜。

真实环境能给出可验证的反馈,这是离线数据没有的。

模型部署后不再变强,是旧范式的最大浪费。

RSIAgent把部署后的每一次交互都变成训练素材。

这让Agent的能力边界随时间持续外扩。

参数规模决定了能力的起点,经验决定了能力的增量。

两者不是替代关系,而是不同杠杆。

对于算力有限的开源社区,经验杠杆尤其重要。

三、递归闭环:三个Agent与一份会演化的记忆

RSIAgent围绕一份不断演化的Memory,构建了多智能体递归闭环。

闭环由三个角色组成:curriculum agent、actor agent、verifier agent。

curriculum agent决定下一步应该探索什么。

actor agent进入环境执行任务并积累经验。

verifier agent根据真实环境反馈,判断结果是否可靠。

有效知识被持续写入Memory。

Agent不再只是被动完成任务,而是能自主选择学习方向。

它能获取经验,并不断扩展自己的环境知识。

这套闭环可以无限迭代:每一轮探索都成为下一轮的输入。

记忆不是历史经验的简单存储,而是逐步成为环境的因果结构。

这正是递归自我提升(RSI)的含义。

三个角色的分工值得单独说明。

curriculum agent像老师,负责设计学习课程。

actor agent像学生,负责动手执行任务。

verifier agent像考官,负责验收结果是否真实有效。

三者缺一不可,任何一方的偏差都会污染记忆。

课程设计偏了,探索会浪费在无效区域。

执行不完整,经验会缺失关键动作。

验证不可靠,错误结论会被当成真理沉淀。

RSIAgent的Memory沉淀的是因果关系。

它记录动作、条件、结果三者之间的稳定联系。

这种结构化记忆比原始轨迹更可复用。

后续任务可以直接查询因果链,而不是重放完整轨迹。

四、Broad-to-Deep:两阶段自探索策略

RSIAgent采用Broad-to-Deep的两阶段自探索策略。

Broad阶段是广泛递归自探索,用于发现多样的环境结构。

它先快速建立整体能力覆盖,类似预训练阶段。

Deep阶段是聚焦深度自探索,用于挖掘难点、隐藏约束和边界条件。

它围绕关键难点进行针对性强化,类似后训练阶段。

Broad和Deep各有不可替代的作用。

消融实验证明:移除任何一方,都会大幅影响探索的广度或深度。

两阶段策略让RSIAgent既覆盖了环境的整体面貌,又啃下了硬骨头。

Broad探索采用并行方式,一次性探索多条路线。

Deep探索则聚焦单一难点,直到发现隐藏规则。

这个设计很像人类学习:先泛读建立框架,再精读攻克难点。

两阶段的比例不是固定不变的。

任务越陌生,Broad阶段占比越高。

任务越熟悉,Deep阶段占比越高。

curriculum agent会动态调整两阶段的节奏。

它根据记忆的覆盖度决定何时切换。

这种自适应调度避免了探索资源的浪费。

实验数据支持了这个设计。

移除Broad阶段,环境覆盖出现明显空洞。

移除Deep阶段,难点任务的成功率停滞不前。

两个阶段叠加,才拿到OSWorld 2.

0的78.

98%。

这是Scaling Experience的第二个关键机制。

五、数据:开源模型如何反超闭源旗舰

RSIAgent的评测数据是本文的核心证据。

基于GLM-5.

3,RSIAgent把OSWorld 2.

0从71.

97%提升到78.

98%。

这个分数大幅超过GPT-6 Astra的72.

60%。

基于Kimi-K3,同样的策略也带来了显著提升。

在Agents' Last Exam的Near-term分项上,RSIAgent达到84.

82%。

GPT-6 Astra在同一分项上是82.

26%。

这意味着即使不更新模型参数,Agent也能突破底层模型的能力边界。

团队还把RSIAgent应用到GameCraft-Bench的自主游戏开发任务。

在mechanics、depth、visuals、art和overall quality上都带来提升。

这证明主动探索与自我进化机制,能迁移到不同类型的交互环境。

两组数字放在一起看更有意思。

OSWorld 2.

0考验的是真实桌面环境的操作能力。

Agents' Last Exam考验的是开放式智能体任务的难度上限。

一个偏执行,一个偏推理,两个方向都涨了。

这说明经验积累不是单一能力的提升,而是整体能力的抬升。

RL训练过的模型通常只擅长训练时见过的任务分布。

RSIAgent的经验记忆则能泛化到新环境。

因为它沉淀的是因果关系,而不是任务答案。

因果知识可以迁移到结构相似的新环境。

这是Scaling Experience最被低估的价值。

六、RSI轮次:探索越多,进化越明显

RSIAgent最直观的效果随轮次累积而放大。

简单任务经过少量RSI轮次就能快速收敛。

复杂任务需要更多轮主动探索,才能逐步发现隐藏变量。

部分初始成功率只有0到40%的任务,最终可以提升到100%。

这个进化曲线接近人类学习的幂律特征。

先期投入回报低,越过临界点后快速拉升。

对工程实践来说,这意味着要留足探索轮次预算。

过早中断RSI循环,会错过能力质变点。

轮次预算应该按任务复杂度动态分配。

简单任务给少量轮次,复杂任务给大量轮次。

curriculum agent会根据收敛速度调整节奏。

收敛快说明探索有效,可以加快进度。

收敛慢说明遇到瓶颈,需要切换探索策略。

RSIAgent的论文给出了轮次与分数的对应关系。

这个数据可以直接用来设计自己的探索预算。

需要注意的是,轮次增加也会带来成本。

每轮探索都调用底层模型与环境交互。

预算管理要在能力收益与推理成本之间平衡。

先跑小规模实验找到曲线拐点,再放大投入。

七、一个可运行的闭环骨架

下面是RSIAgent核心闭环的最小Python骨架。

它演示了curriculum、actor、verifier三角色的协作方式。

复制代码
```python
import json
from dataclasses import dataclass, field
from typing import List

@dataclass
class Experience:
    action: str
    condition: str
    outcome: str
    valid: bool = False

@dataclass
class Memory:
    items: List[Experience] = field(default_factory=list)

    def store(self, exp: Experience) -> None:
        if exp.valid:
            self.items.append(exp)

    def retrieve(self, condition: str) -> List[Experience]:
        return [e for e in self.items if e.condition == condition]

class CurriculumAgent:
    def next_task(self, memory: Memory, round_no: int) -> str:
        explored = {e.condition for e in memory.items}
        if round_no < 5:
            return "broad:sample_unseen"
        missing = self._hard_cases(memory)
        return f"deep:{missing}" if missing else "broad:expand"

    def _hard_cases(self, memory: Memory) -> str:
        failed = [e for e in memory.items if e.outcome == "failed"]
        return failed[-1].condition if failed else ""

class ActorAgent:
    def run(self, task: str) -> Experience:
        condition = task.split(":")[-1]
        success = "unseen" not in condition
        return Experience(
            action=f"try_{task}",
            condition=condition,
            outcome="success" if success else "failed",
        )

class VerifierAgent:
    def verify(self, exp: Experience) -> bool:
        return exp.outcome == "success" and len(exp.action) > 3

def rsi_loop(rounds: int = 12) -> Memory:
    memory = Memory()
    curriculum = CurriculumAgent()
    actor = ActorAgent()
    verifier = VerifierAgent()
    for r in range(rounds):
        task = curriculum.next_task(memory, r)
        exp = actor.run(task)
        exp.valid = verifier.verify(exp)
        memory.store(exp)
        print(f"round={r} task={task} valid={exp.valid} total={len(memory.items)}")
    return memory

if __name__ == "__main__":
    memory = rsi_loop()
    print(json.dumps(
        [e.__dict__ for e in memory.items],
        ensure_ascii=False,
        indent=2,
    ))
```

真实实现里,actor调用的是真实环境接口。

verifier读取的是环境的真实反馈,而不是字符串判断。

记忆沉淀的是动作、条件、结果之间的因果关系。

这个骨架的价值在于:展示了RSI三角色循环的最小形态。

运行它会看到curriculum从broad逐步切到deep。

你可以把它当脚手架,替换成真实环境的API调用。

替换actor的实现,环境反馈就能进入记忆。

替换verifier的实现,验收标准就能自定义。

骨架本身不依赖任何外部库,可直接运行。

八、Scaling Experience的工程启示

RSIAgent给Agent工程带来的第一个启示:参数不是唯一杠杆。

在模型推理成本高企的今天,环境经验是可以复用的资产。

第二个启示:验证器是整个闭环的守门人。

没有可靠的环境反馈,经验沉淀就是噪音积累。

第三个启示:课程设计决定了探索效率。

Broad-to-Deep的分阶段策略,比随机探索收敛快得多。

第四个启示:记忆需要结构化。

RSIAgent沉淀的不是原始轨迹,而是可复用的因果关系。

这与传统的RAG记忆有本质区别。

RAG检索的是相似文本,RSIAgent复用的是动作条件结果的因果链。

工程落地时,先回答三个问题。

第一个问题:你的环境能不能给出可验证的反馈。

第二个问题:你的记忆能不能结构化表达因果关系。

第三个问题:你的课程能否动态调整探索方向。

三个答案都是肯定,RSIAgent的思路就值得移植。

如果反馈不可靠,先补验证器,再谈经验积累。

这是整套机制的地基。

九、与RAG记忆和RL训练的边界

RSIAgent经常被拿来和RAG、RL对比,三者的边界需要澄清。

RAG解决的是知识检索问题,记忆的是文档片段。

RSIAgent解决的是环境适应问题,记忆的是因果知识。

RAG的检索结果是静态文本,RSIAgent的记忆是可执行规则。

RL解决的是策略优化问题,通过奖励信号调参。

RSIAgent解决的是经验积累问题,通过验证信号沉淀记忆。

RL要更新模型参数,RSIAgent完全不动参数。

RL需要大量轨迹采样,RSIAgent每轮探索都直接沉淀。

RL的奖励设计是难点,RSIAgent的验证器是难点。

两者可以互补:先RSIAgent积累环境知识,再用RL微调模型。

这种组合在论文中被视为未来方向。

边界清晰后,选型就不容易混淆。

需要实时问答能力,用RAG。

需要交互环境中的持续进化,用RSIAgent。

需要特定策略的最优解,用RL。

三者的组合正在成为生产级Agent的标准配置。

十、因果智能的更大版图

RSIAgent只是Aether AI因果路线的数字环境载体。

Causal-Copilot探索如何让Agent自主完成因果分析。

C-World构建开放式工具使用环境,让Agent持续测试并收集经验。

Auto-scaling Continuous Memory研究如何让经验沉淀为可扩展的长期记忆。

Hybrid Self-Evolving Structured Memory进一步统一这些能力。

StructAgent把这些能力统一到长程数字智能体中。

无论数字智能体调用工具,还是机器人在物理世界操作。

本质都是同一个问题:一次行动如何改变环境。

这些变化又由哪些真正的因果机制决定。

RSIAgent让Agent从被动训练走向主动因果发现与学习。

它主动识别真正影响结果的变量。

它理解行动与结果之间的因果结构。

这比从历史数据学习相关性更进一步。

因果知识具有更强的迁移性。

换一个相似环境,因果结构依然成立。

这是RSIAgent能泛化到游戏环境的原因之一。

Aether AI的版图显示,这条路还很长。

但RSIAgent证明了数字环境是因果学习的最佳试验场。

十一、落地清单与三个长期坑

如果你想把RSIAgent的思路用到自己的Agent系统,建议按序落地。

第一步:为Agent接入真实环境的可验证反馈通道。

第二步:实现curriculum、actor、verifier三角色,而不是一个全能Agent。

第三步:设计结构化记忆,明确动作条件结果的schema。

第四步:先用小环境验证闭环,再扩展到复杂任务。

第五步:监控每轮探索的成功率与记忆增长曲线。

第六步:根据收敛速度动态调整Broad与Deep的比例。

三个长期坑要特别注意。

第一个坑:验证器不可靠时,经验会污染记忆。

错误结论一旦沉淀,后续探索全部建立在沙地上。

第二个坑:Broad阶段不足,Deep探索会陷入局部最优。

没见过全貌就深挖,容易在错误区域浪费轮次。

第三个坑:记忆无限增长后,检索成本会吃掉收益。

需要为记忆设计衰减、归档或压缩机制。

RSIAgent的论文给出了这些问题的部分答案。

更完整的工程答案,还需要社区继续迭代。

先跑通最小闭环,再逐条解决三个坑。

这是把Scaling Experience搬进自己系统的最稳路径。

十二、结语:经验正在成为新的规模轴

Scaling Model统治了AI过去五年的叙事。

Scaling Experience正在成为新的候选答案。

RSIAgent用一组反直觉的数字证明了可行性。

开源模型不动参数,也能在基准上反超闭源旗舰。

这不是模型之间的竞争,而是范式之间的竞争。

对开发者而言,这意味着新的机会窗口。

算力不再是能力的唯一门票,环境与验证设计同样重要。

会设计探索闭环的团队,可以用小模型做出大结果。

这个判断值得每一个做Agent的人认真对待。

本文的拆解到此结束,代码骨架可以直接复用。

如果你在移植过程中踩到坑,欢迎对照本文的三个坑自查。

Scaling Experience的故事才刚刚开始。

相关推荐
Seoyoneh1 小时前
云客服系统架构设计实战:从接入层到AI质检的全链路技术拆解
人工智能·信息与通信
JarmanYuo1 小时前
YOLO 涨点研究(十二):具身 CV 进阶篇——Sim2Real 域随机化与真机部署
人工智能·pytorch·python·yolo·计算机视觉
AI职业加油站1 小时前
算力底座建设落地:机器学习工程师证书的政策背景与应用价值
大数据·人工智能·职场发展
架构谨制@涛哥1 小时前
知识工程-4.超越RAG:OKF会如何取代矢量数据库吗?
人工智能·软件工程·软件构建·知识图谱
孙启超1 小时前
【AI开发之Rust】第 6 课:结构体、枚举与方法 —— 开始定义自己的类型
开发语言·人工智能·后端·ai·rust
懒羊羊吃辣条1 小时前
Apache IoTDB 实战测试文档+TimechoDB+Workbench+TS file Viewer+Grafana
人工智能·深度学习·时间序列
正经教主1 小时前
【大纲】FDE 前沿部署工程师学习系列教程
人工智能·fde
xsd202411181 小时前
熔炼炉烟尘AI视觉识别:炉前浓烟/淡烟/无烟三分类实时监测
人工智能
irislinAmelia1 小时前
Day11文章_多路视频流加权公平调度与令牌桶QoS
c语言·人工智能