激活3B的搜索智能体拿下82.2分:Iris开源,为什么上下文管理比堆参数更值钱

深夜的工位上,你给一个号称"深度搜索"的智能体抛出一道问题:某研究团队的三位核心作者,此前分别在哪些实验室做过什么方向的工作,后来为什么聚到一起。这个答案要跨过四五个网页才能拼出来。智能体开始工作了:打开第一个链接,把标题和正文摘要记进上下文;打开第二个,发现线索不对,又记了一笔;打开第三个,顺着引用又跳转......二十分钟后,它还在翻第 87 个页面,屏幕右侧的工具调用记录已经滚出好几屏,最早找到的那条关键证据,早就被淹没在中间。你等得起,但它上下文里的显存配额等不起。等它终于停下来,给出的答案里混着三条过时信息,因为那些页面早在第十轮就被它自己挤出了有效窗口。

如果这个过程能推倒重来,你多半不会去换一个更大的模型------更大的模型意味着更高的调用成本,也扛不住无限膨胀的搜索历史。真正该改的是它整理笔记的方式。同样的模型,换一套对搜索历史的处理策略,成绩波动可能比换一个基座模型还大。小红书 AllSpark 团队开源的两个搜索智能体,正好用一组对照实验把这件事讲透了:上下文管理,比堆参数更值钱。

一、Iris 是谁:总参差一个数量级,分差只有 6.4

2026 年,搜索智能体正处在一场转向里:从"框架编排"转向"端到端训练"。过去大家把搜索工具用提示词串起来,让模型边调 API 边组织回答,模型本身并不懂得怎么搜;现在更多团队开始为搜索行为本身训练模型,把"怎么搜、什么时候该放弃、哪些证据值得保留"直接内化成权重。Iris 是这场转向里第一个拿到同量级开源标杆成绩的模型组。

9 月 3 日论文挂上 arXiv,几天后 AllSpark Research 把两个搜索智能体的权重放到了 Hugging Face。小的 Iris-mini 从 Qwen3.6-35B-A3B 后训练而来,总参数 350 亿、推理时激活 30 亿;大的 Iris-pro 基座是 Qwen3.5-397B-A17B,总参数 3970 亿、激活 170 亿。两个都是混合专家结构,上下文窗口 256K,权重按 Apache 2.0 协议放出,配套的评测 harness 也一并开源,方便任何人原样复现基准。

论文报了四个基准:BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE。BrowseComp 是公认公认最难啃的搜索基准之一,要求模型从整个公开互联网里找出一条藏在多轮检索之后的答案;HLE 是前沿数学与科学问题集;DeepSearchQA 则按检索能否答对来计分。开启上下文管理之后,Iris-mini 的成绩是 82.2、84.8、86.9、52.3;Iris-pro 是 88.6、85.1、92.9、56.4。两个模型都在各自的参数档位里拿下了开源搜索智能体的最好成绩。

评测基准 Iris-mini(35B/3B) Iris-pro(397B/17B) 差距
BrowseComp 82.2 88.6 6.4
BrowseComp-ZH 84.8 85.1 0.3
DeepSearchQA(F1) 86.9 92.9 6.0
HLE 52.3 56.4 4.1

二、一个反常的数字:中文榜上 35B 几乎打平 397B

表格里最不符合直觉的是 BrowseComp-ZH 这一行:350 亿参数的小模型拿 84.8,3970 亿参数的大模型拿 85.1,只差 0.3 分。同一对模型在英文 BrowseComp 上的差距却有 6.4 分。翻译成大白话:到了中文搜索这个战场,参数规模几乎没换来什么东西。对一个习惯用"更大就是更强"来衡量模型的行业来说,这个数字本身就是一条新闻。

团队在论文里给了一个解释方向:搜索智能体的瓶颈正在从"知道得多"转向"记得住"。英文页面结构规整、实体名密集,能力差距直接体现在知识广度上;中文检索路径更弯,同样一条信息要跨过不同的表述习惯才能拼起来,这时候决定胜负的不是参数量,而是谁能在几百轮工具调用里把已经找到的证据组织好、不弄丢、不重复。这也是 Iris 论文把上下文管理当成核心卖点的原因------不是工程师闲着没事做优化,而是它真的决定了模型能力的上限。

三、上下文管理实验:全留着、全清空、摘要续跑

论文里最扎实的一组对照,是同一个模型配三种上下文管理策略。什么都不做,让几百轮搜索历史全部留在上下文里;discard-all,上下文一超阈值就把积累的工具调用历史全清掉、从原问题重新开始;retry,把已经排除掉的线索先压成摘要、再继续往下走。

python 复制代码
# 三种上下文管理策略的简化示意
def run_agent(question, policy):
    history = []
    while not converged(history):
        step = model(question, history)
        history.append(step)
        if len(history) > MAX_STEPS:
            if policy == "discard_all":
                history = []              # 全清空,从原问题重来
            elif policy == "retry":
                history = [summarize(history)]  # 线索压成摘要继续
    return answer(history)

结论很直白:开了上下文管理,两个模型都涨分,而且 Iris-mini 涨得比 Iris-pro 多。对小模型来说,管住那条越滚越长的搜索历史,比把参数堆上去更有效。细想一下也不意外:小模型预算更紧张,上下文被无效历史占满时,真正有用的信息很快就排不进去了;而大模型靠记忆扛得住,浪费得起。论文的原话是,推理时上下文管理的价值超过大多数系统之间的性能差距------同一个模型换个上下文策略,成绩波动比你换一个基座模型还大。这也是为什么 Iris 的成绩都按开启和关闭两套口径分别报告,两个数字之间,隔着的就是这套策略的贡献。

四、数据构造:把"背题"这条路彻底堵死

比跑分更值得看的是数据怎么造出来的。搜索智能体最怕的不是不会检索,而是靠背答案蒙对:训练数据里出现过的题目,模型记住了,考场上照着抄,分数虚高,一换真实场景就露馅。市面上不少搜索评测就是被这种数据污染拖垮的,考题泄了,分数自然好看。Iris 的数据构造,第一步就是把这条造假之路堵死。

团队从一个种子页面和它的外链里提炼实体图,沿着实体链编写多跳问题,保证答案要跳过好几个页面才能拼出来。关键一步是改写:把问题里所有非答案实体改写成描述性指代。不问"A 公司的创始人 X",而问"那位提出某某方法、曾在某实验室任职的研究者"。字符串匹配在这种问题下彻底失效,模型没法靠检索关键词碰巧命中答案,必须真的理解语义去搜,才能把问题里的描述和页面里的实体对上。这一招直接抬高了作弊的门槛:想背题,先得背下整张实体关系网。

数据还得过两道闸。先保留"闭卷答不出、给了证据能答对"的题目,天然排除那些本来就能背的;然后在轨迹层按正确性、搜索简并度和搜索深度过滤,再在回合层用一套从数据里归纳出来的评分准则过滤,最后才进入监督微调。这套流程保证了喂给模型的是真正需要检索能力的高质量样本,而不是随手可得的网页摘要。

五、SFT-RL 攀升:把最难的错题回喂下一版教材

Iris 的训练是一个交替循环,论文给它起了个形象的名字:SFT-RL 攀升。监督微调和真实搜索环境里的强化学习轮流进行,每一轮 RL 里最难解决、且解决得最高效的回放,会被回喂给下一轮监督训练------相当于把最值钱的错题整理进下一版教材,模型在一个更接近现实的搜索环境里反复迭代,越攀越高。

这套循环对小模型尤其重要。Iris-mini 的参数只有 35B、激活 3B,天然缺乏大模型的记忆广度,靠的正是这种"错了就回炉"的训练方式,把搜索轨迹里的关键动作逐步内化成自己的行为习惯。论文里小模型涨分幅度大于大模型,训练方法的功劳不亚于模型本身。换句话说,Iris-mini 的成绩不是白捡的,是用更聪明的数据流换来的。

六、工程细节:断点续传与集群内联评判

论文里还有两个容易被忽略的工程决定。一是奖励评判器和观察摘要器直接跑在训练集群里,省掉了跨集群通信的开销;二是过长的 RL 回放会在请求级别被中断,下一步从"已提交的前缀"恢复。搜索智能体的轨迹动辄几百轮工具调用,没有断点续传机制,一次中断就要重头再算,算力浪费会非常可观。这两个决定看起来是工程细节,恰恰是让 SFT-RL 攀升能真正跑起来的前提。

七、检索轨迹的复利效应:为什么小模型能追上大模型

还有一个值得展开的细节:Iris 的上下文管理不是一次性生效的开关,而是贯穿整个检索过程的行为约束。每一次工具调用结束后,模型都要决定这段历史是原样保留、压缩成摘要,还是干脆丢弃。这个决定每轮都在做,几百轮下来,累积出的差距远比单轮看起来大。论文里把这种效应叫做检索轨迹的复利:好的策略让每一轮的上下文都保持干净,后面的检索站在更扎实的证据上继续;差的策略让每一轮都在消耗前面攒下的信息,越搜越笨。

这正是"上下文管理比堆参数更值钱"这句话的工程含义。堆参数解决的是单步能力,上下文管理解决的是整条轨迹的效率。对于动辄几十上百轮工具调用的搜索任务,后者对最终答案质量的影响,往往超过前者的边际提升。小模型之所以能追平大模型,靠的正是把每一轮检索的边界条件都收拾干净。

八、落地与边界:你要部署的是哪一只

对想自己跑一套深度搜索的开发者来说,Iris-mini 是这次发布里最实际的东西。激活 3B 的搜索智能体,意味着中等规模显卡就能起步,配上论文里那套上下文管理策略,单机就能跑起来,Apache 2.0 的授权也留足了商用空间。上手之前记得先跑官方评测 harness 复现一轮基准,用实测数据确认它在你自己的任务上的表现,而不是只信自报分数。

该泼的冷水也要泼:所有成绩目前都是团队自报,还没有第三方榜单或独立复测背书;训练流水线代码标注"即将放出",数据与训练配方没有明确时间表;基座依赖 Qwen 系,能力上限有一部分是继承来的。跑分数字过几个月就会过时,但"上下文管理比堆参数更值钱"这条工程判断,大概会用得比模型本身久。下一次再遇到搜索智能体"越搜越笨",你会知道,问题多半不在模型,而在它身后那条没人整理的搜索历史。

相关推荐
Dawson Zhu1 小时前
基于 OKF 知识图谱的 Text2SQL 领域知识注入实践——半导体晶圆厂数据资产知识库 MVP 剖析
人工智能·语言模型·架构·aigc·agi
宣宣猪的小花园.1 小时前
【机器学习】损失函数与梯度下降:机器如何通过“犯错”不断变好
人工智能·算法·机器学习
jsl_jsl_jsl1 小时前
《Agent 是怎么“思考”的:ReAct 循环与流式 SSE 的完整实现》
人工智能
sarasuki1 小时前
失败重试:Agent 中指数退避的正确姿势
人工智能·设计模式·agent
sxwuyanzu1 小时前
DeepSeek冲IPO-谁在为它付钱-公众号发布稿
大数据·人工智能·科技
一切皆是因缘际会1 小时前
科技的赋能
人工智能
甲维斯1 小时前
RSI“真“”来了,OpenAI和Anthropic把人类逼到墙角!
人工智能
大模型码小白1 小时前
告别造假数据,直接连数据库查真实时序数据喂给 TimechoAI 大模型
java·数据库·人工智能·microsoft·架构
IvorySQL1 小时前
PostgreSQL 日报|建库策略致备库静默丢数据(9 月 12 日)
数据库·人工智能·postgresql