从ReAct到IterResearch

ReAct的痛点

ReAct 的核心局限:每一轮工具调用和返回结果都被完整地追加到消息历史中。完成一个需要 20 步工具调用的研究任务,上下文会积累几万甚至十几万 token,极容易超出模型窗口限制,且越到后期模型越难「记住」最初的任务目标。

IterResearch 的解法

把 Deep Research 建模为马尔可夫决策过程(MDP),核心创新是引入「常量工作空间」。在 MDP 框架下,Agent 每一时刻的决策只依赖于当前的状态(State),而不需要完整的历史。

不再把完整的对话历史传给模型,而是维护一个结构化的状态文档,每步更新这个文档:

json 复制代码
{
  "research_question": "比较 2024 年中美两国电动车政策对特斯拉和比亚迪的影响",
  "confirmed_facts": [
    {
      "fact": "中国 2024 年新能源补贴延续至 2025 年",
      "source": "工信部政策文件"
    },
    {
      "fact": "美国 IRA 法案对在华生产电动车征收 100% 关税",
      "source": "白宫官网"
    }
  ],
  "pending_questions": [
    "比亚迪 2024 年海外销量数据",
    "特斯拉上海工厂受关税影响的具体测算"
  ],
  "search_history": [
    "中国电动车补贴政策 2024",
    "US IRA EV tariff China"
  ],
  "current_focus": "查询比亚迪 2024 年出口数据"
}

每步模型只看这个状态文档 + 最近一次工具返回,而不是完整的历史对话。工具的原始响应处理完即丢弃,只把提取的关键事实写入 confirmed_facts。这样无论任务做了多少步,传给模型的上下文长度始终接近常量,从根本上解决了上下文爆炸问题。

推理过程

IterResearch 采取的是 「读取-修改-覆盖」 策略:

  1. Read(读取) :模型读取当前的「状态文档」。

  2. Think & Act(思考与行动) :模型输出 <think><tool_call>

  3. Execute & Observe(执行与观察) :系统运行工具,获得原始结果(比如 5000 字的网页内容)。

  4. Refine(更新状态 - 关键一步)

    • 重点 :系统不再把 5000 字原文塞进对话历史。
    • 而是启动一个 小模型(或再次调用主模型) ,要求它:"根据刚才的搜索结果,更新上面的「状态文档」,把新知识填入「事实集」,把已解决的「盲区」划掉"。
  5. Clean Slate(清空重置) :下一轮开始时,清空 之前的中间推理过程,只给模型发送更新后的「状态文档」

相关推荐
AI绘画哇哒哒1 小时前
【建议收藏!】35岁后端血泪忠告,这3类人别硬转Agent(过来人亲述)
java·人工智能·后端·ai·程序员·大模型·agent
NeilCarmack1 小时前
Deepseek-harness增加桌面版端序列:第 1 讲 · 命令解析:`pnpm dsh desktop` 的第一步
人工智能·agent·ai agent
你是一个铁憨憨2 小时前
从 GIS 到 Spatial Agent:MCP 如何重新定义 GIS 的 AI 入口
arcgis·ai·agent·mcp·spatial
星野云联AIoT技术洞察3 小时前
Dify 适合什么 AI 应用项目:Workflow、RAG、Agent 与自研系统的边界
agent·workflow·llmops·dify·rag·ai agent·ai应用开发
闲猫7 小时前
LangGraph / Capabilities / Fault tolerance
python·agent·langgraph
ryan_9967 小时前
一次讲清 A2A 协议与 MCP 边界:从 Agent Card 到 Task 生命周期
agent·mcp·a2a·json-rpc·agent通信
安逸sgr8 小时前
AI 应用怎么评测?离线评测、人工评估和线上反馈如何结合?
人工智能·ai·大模型·agent·智能体
demo007x9 小时前
DSH harness 中的上下文管理探秘
程序员·agent·deepseek
MicrosoftReactor11 小时前
技术速递|GitHub Copilot App 入门指南:管理你的工作
ai·github·copilot·agent
七夜zippoe11 小时前
OpenClaw 边缘部署实战:IoT 场景下的轻量级 Agent 集群与离线自治
agent·集群·lot·轻量级·边缘部署·openclaw