XSKILL: Continual Learning from Experience and Skills in Multimodal Agents

它关注的核心问题是:一个已经训练好的多模态 Agent,能不能不更新模型参数,仅仅通过不断做任务,就像人一样积累经验、形成技能,并在之后的任务中越来越会用工具?


一、先用一句话讲完整篇论文的故事

现在的多模态 Agent 虽然有很多工具,但每次做任务都像"失忆的新手";作者发现,真正可复用的知识其实有两种不同粒度------"什么时候该怎么做"的 Experience,以及"这类问题整体怎么做"的 Skill------而且这两种知识必须和视觉状态绑定。因此,XSKILL 让 Agent 从过去的成功/失败轨迹中形成"经验库 + 技能手册",以后遇到新任务时再根据当前图片动态取用和改写它们。

我觉得理解这句话,基本就理解了这篇论文 70% 的内容。


二、研究背景:为什么现在开始研究"让 Agent 从经历中学习"?

1. 多模态 Agent 已经从"看图"走向"操作"

以前的视觉模型更像:

图片 → 看懂 → 回答。

现在的 Multimodal Agent 更像:

图片 → 思考 → 裁剪图片 → 放大 → 写 Python → 搜索图片 → 搜网页 → 阅读网页 → 再推理 → 回答。

也就是论文所说的从被动视觉理解发展为主动的 thinking with images / agentic multimodal reasoning

例如给 Agent 一张非常小的商品图片问:

"这个角落里的玩偶原型是什么动物?"

模型可能需要:

  1. 发现图片倒过来了;
  2. rotate;
  3. 发现目标太小;
  4. crop;
  5. reverse image search;
  6. 打开网页;
  7. 从网页里找到答案。

所以真正的难题已经不只是:

"模型认不认识这个动物?"

而是:

"模型知不知道什么时候该调用什么工具,以及工具之间应该如何组织?"

论文认为目前多模态 Agent 的两个突出问题就是 tool-use inefficiencytool orchestration inflexibility


2. 另一个背景:Agent 每完成一个任务,基本就"忘了"

这是一个非常关键的背景。

现在的大部分 Agent 本质上还是 episodic / stateless

做完 Task A → 结束

做 Task B → 又重新开始思考

即使它昨天在 Task A 里已经发现:

"这种倒置图片应该先旋转再做 OCR。"

今天遇到另一张倒置图片,它仍然可能重新犯一遍错。

因此很多研究开始做:

  • Agent Memory
  • Learning from Experience
  • Workflow Memory
  • Skill Learning
  • Self-Evolving Agent

目的都是:

把一次任务产生的 trajectory 转换为下一次任务能够使用的知识。

参数训练当然也能做到,比如 RL 或持续 fine-tuning。

但它的问题是成本高,而且:

工具集一变,环境一变,又可能需要重新训练。

因此一个很诱人的方向是:

Frozen Model + External Knowledge

模型参数不变,Agent 的"脑子外面"不断长出一个经验库。


三、Challenge:为什么"把以前的经验存下来"并没有想象中那么简单?

这是我认为论文真正需要理解的部分。

作者其实在说:

问题不在于 Agent 没有 Memory,而在于以前对 Memory 的表示方式太粗糙了。

这里至少存在三个层面的矛盾。


Challenge 1:Agent 需要"稳定流程",但也需要"临场判断"

假设你教一个新人使用 Photoshop。

一种知识是:

打开图片 → 检查方向 → 裁剪 ROI → 增强 → 分析。

这是一个 Workflow

但真实任务中还需要另一种知识:

如果文字倒置,先旋转。

如果目标很小,不要直接 image search,要先 crop。

如果 OCR 和肉眼看到的不一致,要回看原图。

如果颜色不确定,不要凭视觉判断,应该检查 HSV。

这些知识非常零碎,却极其重要。

于是出现一个内在矛盾:

只存 Workflow

优点:

结构稳定,容易复用。

缺点:

太粗。

它告诉你:

"做图像分析的时候可以 crop。"

却没有告诉你:

"什么时候特别应该 crop?"


只存 Experience

比如:

"目标很小时,先 crop。"

优点:

很灵活。

缺点:

太局部。

几十条经验堆在一起,并不会自然变成:

"解决这类问题的完整 SOP"。

所以作者的 Challenge 实际上可以概括成:

Agent 的 tool use 同时需要稳定的全局 procedure 和灵活的局部 decision,但单一形式的 memory 很难同时满足两者。

这也是后面 Skill + Experience 双流设计的逻辑来源。


四、Challenge 2:多模态经验不是纯文本知识

这是这篇论文比普通 Agent Memory 更重要的一点。

过去很多 Experience Learning 方法存的是:

Query 文本 + trajectory 文本。

比如:

"模型调用 crop,然后调用 image search,最后成功。"

问题在于:

为什么当时要 crop?

真正触发 crop 的原因,很可能不是用户说了:

"请裁剪图片。"

而是:

图片里的目标特别小。

同理:

"为什么 rotate?"

原因可能是:

图片是倒置的。

"为什么增强亮度?"

因为:

当前区域太暗。

所以动作的触发条件其实存在于:

visual observation \text{visual observation} visual observation

而不完全存在于:

textual trajectory \text{textual trajectory} textual trajectory

作者称这是 visual-semantic gap

如果只根据文字 log 提炼经验:

rotate image

模型可能不知道什么情况下该 rotate。

真正好的经验应该是:

When the image is upside-down → rotate it before recognition.

于是论文认为:

多模态 Agent 的经验不应该只是语言层面的记忆,而应该是"视觉状态 → 决策"的记忆。

作者明确批评现有方法过度依赖文本 trajectory,因此无法可靠地根据当前视觉状态召回和适配过去的知识。

这一点,我认为是这篇论文最值得注意的地方之一。


五、Finding:作者真正"看到别人没看到的东西"是什么?

如果严格按照你给的 Finding 定义,我不会说:

"作者提出了 Experience Bank 和 Skill Library。"

因为这是 technical contribution

真正的 Finding 应该更往前一步。

我认为这篇论文的核心 Finding 是:

Agent 从 trajectory 中需要学习的不是一种统一的"Memory",而是两种互补知识:一种负责稳定地"怎么完成这类任务",另一种负责根据当前视觉条件决定"此时具体该怎么办"。

也就是:

$$

\boxed{
\text{Reusable Agent Knowledge}

\text{Skill}

\text{Experience}

}

其中: #### Skill 回答: > **"这类任务一般应该怎么做?"** 属于: task-level \\text{task-level} task-level *** ** * ** *** #### Experience 回答: > **"遇到这个具体情况时应该怎么办?"** 属于: action-level \\text{action-level} action-level 论文自己给出的定义也非常清楚:Skill 是包含 workflow 和 reusable tool templates 的任务级指导,而 Experience 是 condition-action 形式的 action-level tactical knowledge。 *** ** * ** *** ### 更深一层的 Finding 我认为作者真正有价值的 worldview 是: > **Agent 的持续学习,不一定意味着更新 neural network weights;也可以理解为不断改善"外部可执行知识"。** 也就是说传统 continual learning 是: Experience→Parameter Update→Better Model \\text{Experience} \\rightarrow \\text{Parameter Update} \\rightarrow \\text{Better Model} Experience→Parameter Update→Better Model XSKILL 则变成: Experience→Knowledge Extraction→Better External Memory→Better Agent \\text{Experience} \\rightarrow \\text{Knowledge Extraction} \\rightarrow \\text{Better External Memory} \\rightarrow \\text{Better Agent} Experience→Knowledge Extraction→Better External Memory→Better Agent 这是一个相当重要的思路变化。 模型可能完全 frozen,但是 Agent system 并不是 frozen。 *** ** * ** *** ## 六、一个很好的类比:Skill 是"驾校教材",Experience 是"老司机经验" 假设你在学开车。 #### Skill: 驾校教材告诉你: > 变道流程: > > 看后视镜 → 打转向灯 → 判断距离 → 变道。 这是稳定 SOP。 *** ** * ** *** #### Experience: 老司机告诉你: > "下雨天旁边有大货车时,别只看后视镜,要留更大距离。" 这是: condition→action \\text{condition} \\rightarrow \\text{action} condition→action *** ** * ** *** 只学驾校教材: > 很规范,但是不够灵活。 只听老司机经验: > 有很多诀窍,却可能没有完整操作框架。 最好的驾驶员是: > **SOP + 情境经验。** XSKILL 就是在让 Agent 同时拥有这两套知识。 *** ** * ** *** ## 七、方法:XSKILL 到底是怎么运行的? 整套框架在论文 Figure 2 中被非常清楚地分成两个阶段: Phase I: Knowledge Accumulation \\boxed{ Phase\\ I:\\ Knowledge\\ Accumulation } Phase I: Knowledge Accumulation 以及 Phase II: Solve New Tasks \\boxed{ Phase\\ II:\\ Solve\\ New\\ Tasks } Phase II: Solve New Tasks Figure 2 左边负责"学习",右边负责"使用知识"。 *** ** * ** *** ## 八、Phase I:Agent 怎么从过去的任务中"长经验"? 假设一个训练任务是: > 给一张图片,找到其中某个隐藏文字。 ### Step 1:同一个任务做 N 次 Rollout 不是只让 Agent 做一次。 而是: Ti→τi(1),τi(2),...,τi(N) T_i \\rightarrow \\tau_i\^{(1)},\\tau_i\^{(2)},...,\\tau_i\^{(N)} Ti→τi(1),τi(2),...,τi(N) 论文实验设置中: N=4 N=4 N=4 于是可能出现: #### Rollout 1 直接 OCR → 错。 #### Rollout 2 crop → OCR → 对。 #### Rollout 3 增强对比度 → crop → OCR → 对。 #### Rollout 4 直接 image search → 错。 为什么要这样做? 因为如果只有一条成功轨迹: > 很难知道成功到底是偶然还是有规律。 但如果成功和失败都存在,就能问: > **成功轨迹和失败轨迹最大的区别是什么?** 论文每个训练任务都会执行多次独立 rollout,再共同分析这些轨迹。 *** ** * ** *** ## 九、Step 2:Visually-Grounded Rollout Summary 这一步不是普通 trajectory summary。 MLLM(_{kb}) 同时看到: * Query * 图片 * trajectory * tool calls * intermediate images * ground truth 然后总结: > 哪个动作做了什么? > > > 为什么这么做? > > > 当时图片是什么状态? > > > 这个视觉证据如何改变了后续决策? 例如: > Image upside-down > > > ↓ > > > Agent rotates > > > ↓ > > > OCR becomes readable 而不是简单记录: > "调用 rotate。" 论文特别强调,summary 会保留**视觉证据与 reasoning decision 的联系**。例如倒置图像触发 rotation、低对比度图像触发 enhancement。 这实际上是在学习: Visual State→Action \\text{Visual State} \\rightarrow \\text{Action} Visual State→Action *** ** * ** *** ## 十、Step 3:Cross-Rollout Critique ------ 从"做题记录"变成真正的 Experience 然后系统比较: Successful RolloutsvsFailed Rollouts \\text{Successful Rollouts} \\quad vs\\quad \\text{Failed Rollouts} Successful RolloutsvsFailed Rollouts 问: > 为什么这个成功了? > > 为什么那个失败了? 例如: 成功: > Crop → Search → correct 失败: > Original image → Search → no result 那么可以总结成 Experience: > **When the target object occupies only a small portion of the image, crop the relevant region before reverse image search.** 这比记住: > "Task 27 先 crop 后 search" 有用得多。 作者把 Experience 强制限制得很短,最多 64 words,并要求它能够跨相似任务泛化。 因此 Experience 的本质不是 trajectory compression。 而是: Trajectory→Causal Lesson \\boxed{ Trajectory \\rightarrow Causal\\ Lesson } Trajectory→Causal Lesson 这是一个很关键的区别。 *** ** * ** *** ## 十一、Step 4:与此同时,生成 Skill 另一条知识流负责总结: > "这类任务整体怎么做?" 系统从成功 trajectory 中抽象: #### Workflow 例如: Detect orientation→Normalize→Crop ROI→Search→Verify Detect\\ orientation \\rightarrow Normalize \\rightarrow Crop\\ ROI \\rightarrow Search \\rightarrow Verify Detect orientation→Normalize→Crop ROI→Search→Verify 同时保存: #### Tool Template 例如: ```text img.rotate([angle]) img.crop([bbox]) ``` 具体对象名称会变成 placeholder。 比如不是: > crop the dolphin 而变成: > crop \[TARGET\] 因此 Skill 更像一份可复用的: > **SKILL.md / SOP 文档。** 论文中 Skill 被保存为 Markdown,而 Experience 则作为 JSON condition-action entries 存储。 *** ** * ** *** ## 十二、Step 5:Knowledge Consolidation ------ 不是无限往 Memory 里塞东西 这是一个很实用的设计。 假设 Experience Bank 已经有: > E1:目标小时先 crop。 又来了: > E27:对象很小的时候应该先放大或者 crop。 如果全部保留,Memory 会越来越乱。 所以 XSKILL 会做: Similarity Check→Merge \\text{Similarity Check} \\rightarrow \\text{Merge} Similarity Check→Merge 实验中 cosine similarity 超过: θsim=0.70 \\theta_{sim}=0.70 θsim=0.70 就考虑合并。 Experience 最大规模为 120 条;Skill 文档超过约 1000 words 时也会触发 refinement,删除过于具体、重复或质量低的内容。 所以整个过程可以理解成: > Experience ≠ 日记 > > > Experience = 不断被编辑的"智慧库"。 *** ** * ** *** ## 十三、Phase II:来了一个新问题以后怎么办? 假设新的图片任务来了: > "找出角落两个 mascot 的 prototype。" 这里作者没有直接: Query→Retrieval Query \\rightarrow Retrieval Query→Retrieval 而是多做了几层。 *** ** * ** *** ### Step 1:Task Decomposition 先分析这个问题可能包含哪些技术挑战。 例如当前图片可能: * upside-down * object 很小 * 需要 external visual knowledge 于是分解成: g1=image orientation g_1=\\text{image orientation} g1=image orientation g2=small object extraction g_2=\\text{small object extraction} g2=small object extraction g3=visual search g_3=\\text{visual search} g3=visual search 为什么? 因为完整 Query: > "两个 mascot 的 prototype 是什么?" 与: > "small object crop before image search" 在 embedding 空间里未必特别相似。 所以作者不是检索: > **过去有没有一样的问题?** 而是检索: > **解决这个问题需要哪些方法学知识?** 论文认为 decomposition 能提高多方面经验的 retrieval coverage。 这是一个挺值得借鉴的 RAG 思路。 *** ** * ** *** ## 十四、Step 2:Retrieve Experience 每个 subtask: gi g_i gi 分别去 Experience Bank 中找 top-k。 实验里: k=3 k=3 k=3 得到类似: > E1:图像方向异常时先规范方向。 > E2:对象小时先 crop。 > E3:未知视觉实体可使用 image search。 *** ** * ** *** ## 十五、Step 3:Experience Rewrite 作者发现另一个问题: > Retrieved experience 是通用的。 例如: > "When orientation is abnormal, normalize the image." 但当前任务明确是一张: > upside-down image。 因此它重新改写为: > "当前图片上下颠倒,建议先旋转 180°,再进行目标识别。" 也就是: General Experience→Task Specific Advice General\\ Experience \\rightarrow Task\\ Specific\\ Advice General Experience→Task Specific Advice 关键的是这个 rewrite 也看图片,而不只是看 Query。 *** ** * ** *** ## 十六、Step 4:Skill Adaptation 完整的 Skill 可能有 1000 words。 但当前问题只需要其中: > orientation normalization > > > crop > > > reverse image search 于是系统把无关部分删掉。 同时把刚刚检索到的 Experiences 融进 Skill: ##

K_{adapted}

f(K,E,q,I)

得到这次任务专属的一小份操作指南。 *** ** * ** *** ## 十七、Step 5:把知识作为"参考"注入 Agent,而不是硬控制 Agent 这个细节我认为很好。 作者没有说: > 必须按照 Skill 第 1、2、3 步执行。 而是在 prompt 中告诉 Agent: > 这些是过去有帮助的经验,可以参考;如果当前情况不同,也可以采用自己的办法。 这叫: > **non-prescriptive injection** 原因是: 如果 Memory 太强: Agent→RigidWorkflowExecutor Agent \\rightarrow Rigid Workflow Executor Agent→RigidWorkflowExecutor 反而会失去自主推理能力。 作者希望: Prior Knowledge+Current Reasoning Prior\\ Knowledge + Current\\ Reasoning Prior Knowledge+Current Reasoning 共同工作。 *** ** * ** *** ## 十八、把整个 XSKILL 压缩成一张"脑图" 你可以把论文的核心流程记成: Past Tasks \\boxed{ Past\\ Tasks } Past Tasks ↓ Multiple Rollouts Multiple\\ Rollouts Multiple Rollouts ↓ 成功与失败比较 ↓ 两条知识流: Skill=Global SOP \\boxed{ Skill = Global\\ SOP } Skill=Global SOP Experience=Local Tactical Rule \\boxed{ Experience = Local\\ Tactical\\ Rule } Experience=Local Tactical Rule ↓ 去重 / 合并 / 泛化 ↓ 新任务 ↓ Task Decomposition ↓ Retrieve Experience ↓ Visual Context Rewrite ↓ Adapt Skill ↓ Prompt Agent ↓ New Trajectory ↓ 再进入知识积累过程 论文还会记录实际使用过的知识形成 usage history,为未来进一步更新知识库提供反馈。 所以它实际上是一个闭环: Experience→Knowledge→Action→New Experience→⋯ Experience \\rightarrow Knowledge \\rightarrow Action \\rightarrow New\\ Experience \\rightarrow \\cdots Experience→Knowledge→Action→New Experience→⋯ *** ** * ** *** ## 十九、实验:作者到底证明了什么? 作者用了五个 benchmark,覆盖三类任务: #### Visual Agentic Tool Use * VisualToolBench * TIR-Bench #### Multimodal Search * MMSearch-Plus * MMBrowseComp #### Comprehensive * AgentVista 工具包括: * Python Code Interpreter * Web Search * Image Search * Visit webpage 主要 backbone 则包括 Gemini-2.5-Pro、Gemini-3-Flash、GPT-5-mini 和 o4-mini。 *** ** * ** *** ## 二十、结论 1:XSKILL 的提升不是小模型/单 benchmark 偶然现象 在 Table 2 里,相比单纯给 Agent Tools: | Backbone | Tools Avg | XSKILL Avg | 提升 | |----------------|----------:|-----------:|----------:| | Gemini-2.5-Pro | 23.87 | 28.63 | +4.76 | | Gemini-3-Flash | 33.63 | 40.34 | **+6.71** | | GPT-5-mini | 20.61 | 23.19 | +2.58 | | o4-mini | 19.56 | 23.72 | +4.16 | 尤其值得注意: #### Gemini-3-Flash + TIR-Bench Agent-KB: 36.62 36.62 36.62 XSKILL: 47.75 47.75 47.75 提升: +11.13 \\boxed{+11.13} +11.13 这也是论文强调的最显著结果之一。 这说明: > **仅仅给工具不够,"如何使用工具的外部知识"本身可以产生明显收益。** *** ** * ** *** ## 二十一、实验中最重要的 Finding:Skill 和 Experience 真的是两种不同能力 我认为这是实验部分最值得看的地方。 ### Skill 的作用:让 Agent "少犯低级操作错误" 论文比较 Experience Only 和 Skill Only。 整体 tool execution error: 29.9%→15.3% 29.9\\% \\rightarrow 15.3\\% 29.9%→15.3% Syntax Error: 20.3%→11.4% 20.3\\% \\rightarrow 11.4\\% 20.3%→11.4% Tool Name Error: 2.85%→0.32% 2.85\\% \\rightarrow 0.32\\% 2.85%→0.32% 为什么? 因为 Skill 中包含: > 标准 workflow > > > tool template > > > code pattern 所以模型不需要每次临时发明: > Python 应该怎么写? > > > 工具叫什么? > > > 参数怎么传? 这证明了作者前面的判断: Skill→Execution Robustness \\boxed{ Skill \\rightarrow Execution\\ Robustness } Skill→Execution Robustness *** ** * ** *** ## 二十二、Experience 的作用却完全不同:它改变 Agent 的"工具选择策略" 例如 VisualToolBench。 Skill Only 时 Code Interpreter 使用率: 65.96% 65.96\\% 65.96% Experience Only: 74.49% 74.49\\% 74.49% Skill + Experience: 76.97% 76.97\\% 76.97% 在 MMSearch-Plus 中更加明显。 Code Interpreter: 7.94%Skill Only 7.94\\% \\quad Skill\\ Only 7.94%Skill Only 变成: 13.21%Experience Only 13.21\\% \\quad Experience\\ Only 13.21%Experience Only 而 Image Search: 17.87%→24.63% 17.87\\% \\rightarrow 24.63\\% 17.87%→24.63% 也就是说 Experience 会告诉模型: > 这个场景不要傻搜网页,应该先用 Python。 或者: > 这个任务最关键的是视觉实体,不应该只 Web Search,应该 Image Search。 所以: Experience→Flexible Tool Selection \\boxed{ Experience \\rightarrow Flexible\\ Tool\\ Selection } Experience→Flexible Tool Selection 而不是单纯降低代码错误。 *** ** * ** *** ## 二十三、这是整篇论文最漂亮的实验逻辑 前面的 Finding 是: > Skill 和 Experience 是两种互补知识。 后面的实验刚好看到: Skill→少犯执行错误 Skill \\rightarrow \\text{少犯执行错误} Skill→少犯执行错误 而 Experience→改变策略性工具选择 Experience \\rightarrow \\text{改变策略性工具选择} Experience→改变策略性工具选择 这就形成了非常完整的: Challenge→Finding→Design→Behavioral Evidence Challenge \\rightarrow Finding \\rightarrow Design \\rightarrow Behavioral\\ Evidence Challenge→Finding→Design→Behavioral Evidence 而不只是: > "我的模块加进去分数涨了。" 这是我认为这篇论文实验设计比较好的地方。 *** ** * ** *** ## 二十四、消融还有一个很值得注意的发现:知识质量 \> Retrieval 技巧 Full: 30.49 30.49 30.49 去掉 Experience Manager: 26.40 26.40 26.40 下降: −4.09 -4.09 −4.09 去掉 Skill Manager: 26.87 26.87 26.87 下降: −3.62 -3.62 −3.62 但是: 去掉 Task Decomposition: −1.28 -1.28 −1.28 去掉 Task Adaptation: −1.52 -1.52 −1.52 这暗示一个很有意思的 engineering insight: > **在 Memory Agent 中,"存进去的东西是不是好知识",可能比"怎么检索它"更加重要。** 也就是:

Knowledge\ Quality

Retrieval\ Sophistication

至少在这组实验中如此。 这点对做 Agent Memory/RAG 的研究非常值得关注。 *** ** * ** *** ## 二十五、Rollout 越多为什么越好? 作者尝试: N=1,2,3,4 N=1,2,3,4 N=1,2,3,4 总体性能持续增长。 原因并不是"test-time 多采样"这么简单。 这里 rollout 是用来**构建知识库**的。 更多 rollout 意味着: > 同一道问题能看到更多不同 solution paths。 于是 Cross-Rollout Critique 更容易发现: #### Commonality > 成功的 rollout 都做了 crop。 #### Contrast > 失败 rollout 都直接 search 原图。 最终抽出来的 Experience 才更像真正的 causal lesson。 论文也观察到随着 rollout 数增加,Average@4 和 Pass@4 都提高,而且 Pass@4 增长更明显。 *** ** * ** *** ## 二十六、一个很漂亮的 Case Study 论文第 26--27 页给了一个非常直观的例子。 问题: > "汽车上第二个 'GOOD' 所在区域是什么颜色?" 正确答案: > Purple。 Tool-only Agent: > 看一眼 → Red。 而 XSKILL 的知识告诉 Agent: > 不要主观判断颜色。 于是 Agent: 1. 定位第二个 GOOD; 2. Crop ROI; 3. pixel sampling; 4. 发现 RGB 结果仍然不够清晰; 5. 转到 HSV; 6. 得到: Hue=258.1∘ Hue=258.1\^\\circ Hue=258.1∘ 因为紫色/紫罗兰大致处于: 240∘−300∘ 240\^\\circ-300\^\\circ 240∘−300∘ 最后得到: > Purple。 这个例子很好地说明: XSKILL 并没有"记住答案是 Purple"。 它记住的是: > **颜色判断不确定时,要从主观视觉判断转成可验证的定量分析。** 这才是真正可迁移的 knowledge。 *** ** * ** *** ## 二十七、Zero-shot Transfer:学到的不是 benchmark-specific trick 作者还有一个很重要的实验。 例如: VisualToolBench VisualToolBench VisualToolBench 积累的 knowledge: 直接给 TIR−Bench TIR-Bench TIR−Bench 使用。 或者: MMSearchPlus→MMBrowseComp MMSearchPlus \\rightarrow MMBrowseComp MMSearchPlus→MMBrowseComp 没有在 target benchmark 上重新积累经验。 结果 XSKILL 仍然通常能优于其他 Experience Learning baseline,对 Agent-KB 平均还能领先约 2--3 个点。 这个结果支持作者的一个重要 claim: > Knowledge consolidation 删除具体 case 信息以后,留下的确实可能是跨任务的 reasoning principle。 例如: > "small target → crop" 不属于任何 dataset。 它属于: > Visual Reasoning itself。 *** ** * ** *** ## 二十八、但论文有一个非常值得注意的"负结果" 这一点我强烈建议阅读论文时不要忽略。 作者把 Gemini-3-Flash 积累的知识转移给: * Qwen3-VL-235B * Qwen3-VL-32B 结果并不是全面提升。 例如 VisualToolBench: #### Qwen3-VL-235B Tools: Average@4=11.80 Average@4=11.80 Average@4=11.80 XSKILL: 11.52 11.52 11.52 反而下降。 但: Pass@4:19.62→20.56 Pass@4: 19.62 \\rightarrow 20.56 Pass@4:19.62→20.56 #### Qwen3-VL-32B Average@4: 11.09→10.28 11.09 \\rightarrow 10.28 11.09→10.28 下降。 但 Pass@4: 18.69→19.43 18.69 \\rightarrow 19.43 18.69→19.43 上升。 作者对此的解释非常有意思: > XSKILL 会鼓励模型更多地探索、更多地调用工具。 强模型能够: > 理解这些经验,并正确执行。 弱一点的模型可能: > 收到了很好的建议,但执行不出来。 于是出现: More Exploration⇒Higher Pass@4 More\\ Exploration \\Rightarrow Higher\\ Pass@4 More Exploration⇒Higher Pass@4 但同时: Poorer Execution⇒Lower Average@4 Poorer\\ Execution \\Rightarrow Lower\\ Average@4 Poorer Execution⇒Lower Average@4 这说明: > **Knowledge transfer 不是免费的,外部知识的有效性依赖 base model 本身的执行能力。** 作者也明确指出,基础模型具有足够能力,是知识迁移成功的重要条件。 我认为这是论文中非常有研究价值的 secondary finding。 *** ** * ** *** ## 二十九、必要关键术语总结 | 英文 | 中文 + 我的解释 | |-----------------------------------|-------------------------------------------------------------------------------------| | **Multimodal Agent** | **多模态智能体**:不仅理解文本,还能处理图像,并主动调用 Python、搜索、浏览器等工具完成任务。 | | **Tool Use** | **工具使用**:Agent 调用外部能力,例如 crop、Python、Web Search。关键不仅是"会不会用",还包括"什么时候用"。 | | **Tool Orchestration** | **工具编排**:多个工具按照合适顺序组合。例如 Rotate → Crop → Image Search → Visit,而不是胡乱调用。 | | **Trajectory / Rollout** | **执行轨迹 / 一次尝试**:Agent 从看到问题直到给出答案的完整行为序列。一次任务做 4 遍,就有 4 个 rollouts。 | | **Experience** | **经验**:action-level 的情境规则,近似"如果发生 X,建议做 Y"。例如"目标小时先 crop 再搜图"。 | | **Skill** | **技能**:task-level 的结构化 SOP,包括 Workflow、Tool Template 和常见陷阱。例如"视觉实体识别"的完整处理流程。 | | **Visually-Grounded Knowledge** | **视觉落地/视觉锚定知识**:经验不仅来自 trajectory 文本,还明确和图像状态绑定。例如不是简单记住"rotate",而是"图像倒置 → rotate"。 | | **Cross-Rollout Critique** | **跨轨迹批判/对比分析**:比较同一问题不同成功失败尝试,从差异中找到导致结果不同的原因。 | | **Knowledge Consolidation** | **知识整合**:合并重复经验、删除低质量经验、把具体 case 泛化成可复用规律。 | | **Task Decomposition** | **任务分解**:不是直接用整个问题检索经验,而是拆成"方向问题、目标过小、信息检索"等方法学子任务。 | | **Experience Rewrite** | **经验改写**:把通用经验根据当前图片改成当前任务能直接使用的建议。 | | **Skill Adaptation** | **技能适配**:从完整 Skill 文档中只保留当前任务真正相关的 workflow,同时融入 Experience。 | | **Non-parametric Learning** | **非参数式学习**:模型权重不变,学习结果存到外部 knowledge base 中。XSKILL 的核心就是这种范式。 | | **Zero-shot Cross-task Transfer** | **零样本跨任务迁移**:在 A benchmark 学到的经验,不在 B 上训练,直接拿去解决 B。 | | **Average@4** | 每个任务运行 4 次,统计这四次总体平均成功率,更偏向衡量"稳定性"。 | | **Pass@4** | 4 次里面只要有一次成功,该任务就算通过,更偏向衡量"有没有能力找到正确路径"。 | *** ** * ** *** ## 三十、如果站在研究者角度,我会怎么概括它的核心价值? 我会把这篇论文概括为三个层次。 #### 第一层:表面贡献 提出: XSKILL \\boxed{XSKILL} XSKILL 包含: Skill Library+Experience Bank Skill\\ Library + Experience\\ Bank Skill Library+Experience Bank *** ** * ** *** #### 第二层:真正的技术思想 把 Agent Knowledge 分成: Task Level Procedure \\boxed{ Task\\ Level\\ Procedure } Task Level Procedure 和: Action Level Tactical Knowledge \\boxed{ Action\\ Level\\ Tactical\\ Knowledge } Action Level Tactical Knowledge 并证明二者产生不同的行为效果: Skill→Reliable Execution Skill \\rightarrow Reliable\\ Execution Skill→Reliable Execution Experience→Adaptive Tool Selection Experience \\rightarrow Adaptive\\ Tool\\ Selection Experience→Adaptive Tool Selection *** ** * ** *** #### 第三层:更深的研究思想 这篇论文真正想推动的是: Agent Learning≠Model Training \\boxed{ Agent\\ Learning \\neq Model\\ Training } Agent Learning=Model Training 过去我们习惯: > 想让模型进步 → Fine-tune / RL。 这篇工作体现的是另一条路线: > **冻结模型,让外部知识系统自己进化。** Agent 的"能力"于是可以理解为: ##

\text{Agent Capability}

\text{Base Model}

\text{Tools}

\text{Accumulated Knowledge}

$$

而不是只有:

Model Weights \text{Model Weights} Model Weights


三十一、最后给你一个"论文故事版"总结

可以把 XSKILL 想象成一个刚入行的医生。

普通 Agent 每天来看病:

今天见到一个病例,费很大劲解决了。

第二天:

忘了昨天发生过什么,再从头想一遍。

于是作者问:

为什么不让这个医生写下自己学到的东西?

但马上又发现:

光写"病例记录"没有用。

真正值得保存的是两类东西。

一本:

《诊疗手册》------Skill

告诉你:

一类疾病整体怎么诊断。

另一份:

《临床经验笔记》------Experience

告诉你:

"遇到这个迹象时,要特别检查这个地方。"

更重要的是,医生不能只记:

"昨天做了 CT。"

而应该记住:

"因为昨天影像中出现了某种异常,所以应该做 CT。"

也就是:

Observation→Decision Observation \rightarrow Decision Observation→Decision

这就是 XSKILL 所强调的 visually grounded experience

随着病例越来越多:

相似经验合并,错误经验删除,具体病例被抽象成一般原则。

于是这个医生的模型参数虽然一天都没有更新,

但他的:

经验库越来越成熟,技能手册越来越完善。

因此,他真的"越来越会做事"。

这就是这篇论文想实现的:

Continually Improving Agent Without Parameter Updates \boxed{ Continually\ Improving\ Agent \ Without\ Parameter\ Updates } Continually Improving Agent Without Parameter Updates

作者最终也把 XSKILL 定位成一种无需参数重新训练、依靠可审计外部知识实现持续进化的多模态 Agent 框架。

如果只记住这篇论文的一个 Finding,我建议记这一句:

多模态 Agent 真正值得从历史 trajectory 中学习的,不是"过去怎么做过",而是两种视觉条件化的可复用规律:稳定的任务级 Skill,以及灵活的动作级 Experience;前者让 Agent 做得稳,后者让 Agent 选得对。

相关推荐
学习星球15 分钟前
6G核心网架构深度解析——AI Native时代的网络变革
网络·人工智能·5g·架构·go·信息与通信
NeoGressAI外贸数字化18 分钟前
外贸建站:新手怎么自建独立站完整指南
java·人工智能
给AI剪纸的打工人21 分钟前
OpenCode怎么接第三方API?自定义Provider与Responses配置实战
linux·数据库·人工智能
auto_go21 分钟前
大模型实战指南(12)——端侧 AI 助手实战:Ollama + 工具调用,让本地模型真正帮你干活
人工智能·深度学习·机器学习
java1234_小锋23 分钟前
YOLO26 计算机视觉 - YOLO26图片与视频推理 & 摄像头与实时检测
人工智能·yolo·计算机视觉·机器视觉·yolo26
冬奇Lab29 分钟前
企业知识库系列(04):HyperGraphRAG 实测——超图结构的多跳推理
人工智能·开源
Golden小狗种自己的花[哇]29 分钟前
书接上回(Convolution)
人工智能·深度学习
海盗123430 分钟前
AI新闻日报_2026-08-26——Vera Rubin 实测 30 倍吞吐跃升、Ilya SSI 持续学习模型或本周亮相、开源模型调用首超闭源
人工智能
裕晟资质规划32 分钟前
西安政务信息化项目涉密系统集成资质准入解析:甲级/乙级承接边界、等保差异与合规承接路径
大数据·运维·数据库·人工智能·安全·政务