【TMLR 2025】Tree Search:树搜索驱动的语言模型智能体,在真实网页环境中显式探索与多步规划|从网页智能体推理时搜索视角

摘要

本文解读 TMLR 2025 论文《Tree Search for Language Model Agents》。该论文提出推理时树搜索算法 ,通过融合best-first 搜索多模态价值函数环境回溯重放 ,让语言模型智能体在真实网页环境中显式探索与多步规划,其特别之处在于这是首个在真实网页任务上被证明有效的树搜索算法 。实验表明VisualWebArena 上 GPT-4o 智能体成功率相对提升 39.7%、达到 26.4% 新 SOTA,且性能随测试时算力单调增长,为 LLM Agent 的测试时计算(test-time compute)扩展提供了重要范本。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Tree Search for Language Model Agents
标题(中文) 树搜索驱动的语言模型智能体:在真实网页环境中显式探索与多步规划
作者 Jing Yu Koh · Stephen McAleer · Daniel Fried · Ruslan Salakhutdinov
机构 卡内基梅隆大学(Carnegie Mellon University)
会议 TMLR 2025
arXiv https://arxiv.org/abs/2407.01476
项目网站 https://github.com/kohjingyu/search-agents

背景与动机

在 WebArena 与 VisualWebArena 两大真实网页基准上,人类完成任务的成功率高达 78% 与 89%,而最先进的语言模型智能体通常不足 20%。为什么差距这么大? 现有智能体本质上是贪心执行:只根据当前网页观察预测下一步动作,一旦某一步出错,错误就会随步数累积且难以纠正(论文称之为 compounding error)。

与游戏场景不同,网页环境的动作空间极大(每个页面都有大量可交互元素),且没有明确的奖励与终局条件,因此搜索一直难以直接套用。但搜索本身在 AI 历史上战功卓著:1997 年 Deep Blue 用大规模并行树搜索击败国际象棋世界冠军,2016 年 AlphaGo 用神经网络 + 蒙特卡洛树搜索达到围棋超人类水平,2019 年 Pluribus 在多人扑克中运用搜索。本文的核心洞察是:把同样思路搬到网页智能体上------在真实环境空间中构建搜索树,用价值函数引导探索、剪枝与回溯。

值得注意的基线对比(论文附录完整版):SteP 依赖网站特定规则(35.8%)、AutoWebGLM 靠课程式训练(18.2%)、AgentOccam 靠输入空间工程(43.1%),这些方法都与搜索正交------搜索可以叠加在它们之上进一步提分。

研究主线:从问题到结论

图 7:研究主线------从贪心执行的错误累积问题,到 best-first 树搜索设计,再到 VWA/WA 全基线提升与测试时算力缩放结论(Mermaid 流程图)

基准/方法设计

系统由三个组件构成:

  1. 基座智能体 f_\\phi:任意现成的 LM agent,给定观察 o_t 预测动作 a_t;核采样(温度 1.0、top-p 0.95)提供多样化的候选分支。
  2. 价值函数 f_v:多模态 LM 估计当前状态达成目标的期望奖励 \\mathbb{E}\[R(s_t)\] \\in \[0,1\],输入任务指令与轨迹截图,输出 success / failure / on-track(取值 1 / 0 / 0.5),并对 20 条思维链路径取平均(自一致性)。
  3. best-first 搜索器:维护 frontier 最大优先队列,每轮弹出最高分状态、打分、展开 b 个候选动作、回溯重放,直至价值超过阈值 \\theta 或预算 c 耗尽。

图 1:本文搜索算法总览------每轮从 frontier 弹出最优状态 s_p、用价值函数打分,再展开 b 个候选分支;蓝色虚线箭头表示回溯

分类全景

图 8:相关工作全景------网页智能体、LLM 推理时搜索与经典搜索三条线的代表工作(Mermaid 分类图)

方法细节

四个核心设计要素:

  1. 自一致性价值函数:20 条 CoT 路径平均打分(三值 0/0.5/1 + 平均),比单次打分更细粒度、更可靠。
  2. 动作分支采样:每次执行前采样 20 个动作输出,聚合计数取 top-b(本文 b{=}5)作为搜索分支------把语言模型的随机性变成可枚举的候选集。
  3. 环境重置回溯:回溯时重置环境并重放动作序列,而非点击浏览器返回键------这样能保留滚动位置与已输入文本,回溯保真度更高。
  4. 终止与提交:当 v_p \\geq \\theta(疑似找到目标)或预算耗尽(s \\geq c,本文 c{=}20)时,导航到全局最优状态 \\hat{s}_t 并执行。

一个值得注意的工程细节:价值函数调用比动作预测便宜约 2 倍(动作预测的 few-shot 示例与页面表示消耗更多输入 token),因此搜索把测试时算力花在评估而非生成上,性价比更高。

实验设计与结果

评测协议:搜索智能体仅允许 5 步动作(深度 d{=}5、宽度 b{=}5、预算 c{=}20),对比公开方法普遍允许的 30 步;价值函数用 GPT-4o 搭配 20 路自一致性;成功率(SR)为指标,报告相对提升 \\Delta

基准 模型(步数上限) 无搜索 +搜索 相对提升
VisualWebArena GPT-4o + SoM(5 步) 18.9% 26.4% +39.7%
VisualWebArena Llama-3-70B + captions(5 步) 7.6% 16.7% +119.7%
WebArena GPT-4o(5 步) 15.0% 19.2% +28.0%
WebArena Llama-3-70B(5 步) 7.6% 10.1% +32.3%
参考 公开无搜索基线(30 步) 9.8%--19.8% --- ---

图 2:搜索预算 c 与成功率------200 个 VWA 任务子集上成功率随预算增加而提升(c{=}0 表示不搜索)

图 3:与轨迹级重排对比------重排方法在 n{=}7 左右平台期(30%),明显低于搜索 c{\\geq}5 的表现

附录消融与定性案例(论文附录织入):

  • 价值函数消融 (200 任务子集):无搜索 24.5%,LLaVA + 自一致性 30.0%,GPT-4o 无自一致性 28.5%,GPT-4o + 5 路 32.5%,GPT-4o + 20 路 37.0%,真实奖励上限 43.5%------价值函数质量直接决定搜索收益。
  • 深度 × 宽度消融d{=}5, b{=}5 最强(37.0%),仅放大单一维度提升有限。
  • 难度分解:medium 难度任务相对提升最大(+75%,12.7% → 22.2%),easy 与 hard 分别为 +24% 与 +47%。
  • 站点分解:VWA 的 Classifieds(+44%)与 Shopping(+45%)、WA 的 CMS(+50%)提升最显著。
  • 定性案例:VWA 任务 #48(分类信息)、#96(购物)、WA 任务 #14(CMS)中,搜索通过多分支探索与价值剪枝,救回了贪心执行必然失败的轨迹。

图 4:VWA Classifieds 任务 #48------贪心执行首个采样动作(上排)失败,搜索探索多分支后选中成功轨迹

图 5:VWA Shopping 任务 #96------搜索剪掉低价值轨迹(淡色节点),识别被坏采样掩盖的成功路径

图 6:WebArena CMS 任务 #14------首步展开 4 个候选分支,沿 3→5→6→10 找到最高价值 0.68 的成功轨迹

结果对比总结

图 9:结果对比总结------四条基线与搜索后的成功率及相对提升幅度(Mermaid 流程图)

关键发现

  1. 首个在真实网页任务上有效的树搜索 :VisualWebArena 上 GPT-4o + SoM 从 18.9% 提升至 26.4%(相对 +39.7%),刷新当时 SOTA;WebArena 上 15.0% → 19.2%(+28.0%)。
  2. 模型无关、即插即用:GPT-4o、Llama-3-70B-Instruct、GPT-4o-mini 全部获得提升(+28.0% 至 +119.7%),无需重训或微调基座模型。
  3. 性能随测试时算力单调增长:预算从 c{=}5c{=}20,成功率从 +30.6% 提升至 +51.0% 相对增益(24.5% → 37.0%,200 任务子集)。
  4. 价值函数是核心杠杆:GPT-4o + 20 路自一致性(37.0%)大幅优于 LLaVA(30.0%)与无自一致性(28.5%),真实奖励上限 43.5% 表明仍有提升空间。
  5. 优于轨迹级重排:重排方法 7 条轨迹即达平台期(30%),不如搜索 c{\\geq}5;搜索能中途剪枝与回溯,是根本优势。
  6. 弱模型收益更大:Llama-3-70B 配合搜索在 VWA 达 16.7%,接近不用搜索的顶级多模态模型------是低成本迭代的可复现基线。

局限性

  1. 搜索慢:预算 c{=}20 意味着每步最多展开 20 个状态,LM 调用量最高放大 20 倍;回溯需重置环境并重放动作序列,额外开销显著。
  2. 破坏性动作:真实部署中下单、删除等不可逆操作需限制------可在价值函数中集成分类器阻止展开,或借助世界模型在模拟中搜索。
  3. 领域特定价值函数:当前针对网页截图设计,迁移到软件工程等新领域需重新适配(如加入代码执行轨迹);作者展望将搜索推广到编程(SWE)与 Excel 等离线、非破坏性环境,或引入 MCTS 等更高级的搜索算法。

常见问题(FAQ)

提出推理时 best-first 树搜索:在真实网页环境空间中构建搜索树,用多模态价值函数引导探索与回溯,首个在真实网页任务上证明有效的树搜索算法。

为什么现有网页智能体成功率低?

贪心执行导致错误累积:智能体只根据当前观察预测下一步,一步出错难以纠正;网页动作空间巨大且无明确奖励,进一步加剧了规划难度。

价值函数如何实现?

用多模态 LM 输入任务指令 + 轨迹截图,输出 success / failure / on-track(1/0/0.5),并对 20 条思维链路径取平均(自一致性)得到细粒度分数。

搜索参数如何设置?

默认深度 d{=}5、宽度 b{=}5、预算 c{=}20、阈值 \\theta,上限 5 步动作;预算越大成功率越高(c{=}20 时相对 +51.0%)。

方法需要重新训练模型吗?

不需要。搜索完全在推理时进行,与模型权重无关,可叠加在任何现有 agent 上(GPT-4o、Llama-3、GPT-4o-mini 均验证有效)。

搜索的主要代价是什么?

速度与成本:预算 20 时 LM 调用量最高放大 20 倍,回溯还需重置环境重放;真实部署需设置破坏性动作限制并权衡参数。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
白拾9 天前
【COLM 2025】AIOS:LLM 智能体操作系统,内核化资源管理与调度|从智能体系统架构视角
资源调度·aios 论文分享·llm agent·智能体操作系统·colm 2025
一晌小贪欢9 个月前
【Python办公】用 Selenium 自动化网页批量录入
开发语言·python·selenium·自动化·python3·python学习·网页自动化
淘小白_TXB21961 年前
Python网页自动化Selenium中文文档
python·selenium·自动化·网页自动化