谷歌 WikiSkill 论文深读:模型可以换,经验留下来,9B 反超 27B
调研日期:2026-09-28 · 论文:WikiSkill,arXiv 2608.27454,Google Research + 弗吉尼亚理工 2026-08 发布
公众号上读到一篇讲「谷歌 WikiSkill」的文章:一个 90 亿参数模型,带上从任务成败中反复修订的技能,在五项基准上平均 47.4%,跑赢了没有技能加持的 270 亿参数模型(39.4%)------**模型权重没变,做事的方法变了。**这类"把经验沉淀成 Agent 技能"的论文这几年很热,但 WikiSkill 的价值在于它真正把"经验"做成了可独立、持续更新的知识层。我把论文全文核对了一遍,这篇是完整解读。
一、核心结论:经验果然「存得下来、能反超、还能继承」
论文来自 Google Research 与弗吉尼亚理工大学,2026-08-27 发布(arXiv 2608.27454),标题即《WikiSkill: Compiling Agent Experience into Persistent...》。一句话:先针对不同任务离线演化技能,再让 Agent 带着这些方法接受测试。
| 观测 | 数据 |
|---|---|
| 9B 带技能 vs 27B 无技能 | 47.4% vs 39.4%(5 基准平均) |
| 9B 无技能(自身对照) | 未达标基线 |
| 27B 也带技能 | 63.3%(更强模型同样受益) |
| Qwen 系列增益 | 4B +12.3、9B +17.5、27B +23.9 个百分点 |
| 电子表格(最突出) | 27B 从 40.8% → 81.7%(约两倍) |
研究覆盖数学推理、网页搜索、电子表格、长文档问答、文本家务模拟五类;技能按每项基准分别演化,训练/验证/测试互不重叠,每种配置从空技能集跑三次取平均。
二、经验三层结构:Raw → Wiki → Skills
论文把"积累经验"落成了三层明确存储:
| 层级 | 存什么 | 谁用 |
|---|---|---|
| Raw | 不可改写的执行轨迹(供回溯) | 演化环节查证 |
| Wiki | 错误模式、有效策略、修改历史(持续整理) | 提议者分析、维护 |
| Skills | 当前采用的完整工作方法(SKILL.md + 脚本 + 参考) | 执行 Agent |
三个 Agent 分工:执行者 按当前技能做任务;维护者 对照成功/失败轨迹,检查具体操作与错误原因;提议者查阅 Wiki + 原始记录,基于标准答案与成败摘要提出修改。默认配置里,执行 Agent 用 Skills,Wiki 供演化分析。
三、"技能会退、教训不退"的迭代机制
论文最有意思的一段是:在 ALFWorld 文本家务模拟里,Qwen 反复取物、检查、移动,一直不推进。第 0 轮提了个宽泛的"目标导向行动"技能,验证没提高即被拒;第 1 轮参考失败记录改成更具体的防循环规则("不要把物品放回原来的位置")通过验证;第 4 轮再补充"同一物品同一操作只执行一次"。
规则管理很清晰:每轮只对单个技能做新增或局部修改,放独立验证集评估,分数必须严格超过历史最佳才接受 ;打平或下降就回退。但 Wiki 不随技能回滚------修改内容、验证分数、接受/拒绝结果都保留,为下一轮留下线索。这解释了为什么网页搜索任务里 28% 的获准修改出现在第 5--7 轮:前期积累仍能催生有效新方法。
四、经验真能跨"模型传"吗?既能,也会传错
论文做了直接交换实验,双向都有结论:
| 任务·执行模型 | 自身技能 | 换用其它模型技能 |
|---|---|---|
| ALFWorld · Qwen-9B | 63.4% | 用 27B 技能 70.2% |
| 数学 · Gemma-31B | 56.7% | 用 4B 技能 73.1% |
| 表格 · Gemini-Flash | 无技能 50.5% | 用 4B 技能 18.1%(明显倒退) |
长文档问答里更典型:4B 用自己演化的技能从 30.2% -> 28.5%,同一套技能交给 27B 却从 42.1% 升到 52.9%。"发现有用方法"和"把方法执行到位"是两种能力。但表格任务的负迁移也提醒:4B 为了避免错误发展出的单行 Python、字符串转换等具体补丁,反而限制了 Gemini 用完整脚本------经验含可复用方法和为某模型量身定做的补丁,换执行者必须重新验证。
五、局限性(论文自己的坦诚)
- 验证集每项只有 10--40 题,距离真实工作长期稳定进化还有距离
- 实验把当前技能全文直接放进 prompt,没检验技能库扩大后的检索与触发
- 只接受立即提分的修改,可能放弃有助于后续改进的铺垫
- Wiki 无自动修剪机制,长期运行怎么处置冗余/过期知识未知
- 成本不低:每轮仅维护 Wiki + 提修改就约 11--21 次模型调用
- 数小时、数百次环境操作的超长任务尚未覆盖
关联与启发
WikiSkill 的"Raw→Wiki→Skill"三层结构,和我一直在做的人持久化知识库思路高度同构:都主张"先把经验编译成独立、持续更新的知识,再沉淀为可复用技能"。Karpathy 的 LLM Wiki 思路(保留已整理知识,让后续工作接着前面积累往下做)在这篇论文里有了更工程化的落地。
一句话结论
WikiSkill(arXiv 2608.27454,Google + 弗吉尼亚理工)用「原始轨迹 → 经验 Wiki → 执行技能」三层结构 + 三 Agent 分工 + 严格验证/回退,把 Agent 经验首次做成可查证、可继承、可跨模型复用的知识资产,9B 反超 27B 实证了"经验本身也是竞争力";但离生产级还有检索、修剪、长任务、成本四道坎------方向正确,价值在"经验货币化"这个命题。
局限
- 依据是论文 + 多篇知乎/技术博客交叉,未复现实验(无 GPU 环境跑 9B/27B)
- 未做本机 demo(论文为研究性工作,无可直接运行的可复现工程包)
- 具体单任务数据来自论文表,非本机实测
下一篇预告:我把 WikiSkill 的「Raw→Wiki→Skill」理念映射到日常 Agent 工作流,写一份普通人也能用上的「Agent 经验沉淀」落地模板。