DeepSeek总结的Nanbeige4.1-3B:一个具备推理、对齐与行动能力的小型通用模型

原文地址:https://arxiv.org/html/2602.13367v1

Nanbeige4.1-3B:一个具备推理、对齐与行动能力的小型通用模型

北贝大语言模型实验室,BOSS直聘


📄 摘要

我们推出了 Nanbeige4.1-3B ,一个统一的通才语言模型,仅用 3B 参数便同时实现了强大的智能体行为代码生成通用推理 能力。据我们所知,这是首个在一个模型中实现如此多功能性的开源小语言模型(SLM)

为了提升推理能力和偏好对齐,我们结合了点式(point-wise)和配对式(pair-wise)奖励建模,确保生成高质量、符合人类偏好的回复。在代码生成方面,我们在强化学习中设计了复杂度感知奖励 ,同时优化正确性与效率。在深度搜索方面,我们进行了复杂的数据合成,并在训练中引入轮次级别的监督。这使得模型能够进行稳定的长时程工具交互,让 Nanbeige4.1-3B 能够可靠地执行多达 600 轮工具调用,以解决复杂问题。

大量实验结果表明,Nanbeige4.1-3B 显著优于此前同规模模型,如 Nanbeige4-3B-2511 和 Qwen3-4B,甚至在与更大规模模型(如 Qwen3-30B-A3B)的比较中也展现出卓越性能。我们的结果表明,小型模型可以同时实现广泛的能力和强大的专业化,重新定义了 3B 参数模型的潜力。

模型权重下载: https://huggingface.co/Nanbeige/Nanbeige4.1-3B


🖼️ 图 1:Nanbeige4-3B-Thinking 与 Qwen 模型系列的性能对比

(预印本)

arXiv:2602.13367v1 cs.AI 2026年2月13日


1️⃣ 引言

近期小语言模型的进展表明,紧凑型模型能够在数学推理或代码生成等专业任务上实现令人印象深刻的性能 21, 19。尽管规模小,这些模型通过在架构、训练数据和训练算法上的创新,实现了具有竞争力的表现,使其在实际应用中非常高效。

然而,大多数现有的小语言模型呈现出能力碎片化的现象:专注于推理的模型通常在长时程交互(如深度搜索)方面表现不佳 17,而专注于代码或智能体的模型通常缺乏强大的通用推理能力,如创意写作或人类偏好对齐 24。因此,在 3B 规模上构建一个真正统一的通才模型仍然是一个开放的挑战,并引出一个实际问题:在不损害现有优势的前提下,一个 3B 模型作为通才能够被推到多远?

在这项工作中,我们提出了 Nanbeige4.1-3B,一个在推理、编码和智能体行为方面都非常强大的通用小语言模型。它建立在 Nanbeige4-3B 21 的基础上。对于通用推理,我们通过整合点式奖励信号扩展了之前配对视偏好建模,确保回复既在孤立评估中表现良好,又能在直接比较中被偏好。对于代码生成,我们超越了以正确性为唯一目标的做法,明确奖励算法效率,鼓励生成不仅功能正确而且计算效率高的解决方案。对于智能体行为,我们强调长时程规划。我们通过维基图随机游走构建高质量的训训练数据,并在交互轮次和完整轨迹两个层面定义奖励,使模型能够因数百步的规划和执行而获得奖励。

在整个训练过程中,我们采用了精心的监督微调数据混合和多阶段强化学习 15 来保持这些领域之间的平衡。

通过上述方法,我们训练出了一个具有异常广泛和稳定能力轮廓的模型。在推理和编码任务上,Nanbeige4.1-3B 持续超越现有的开源小语言模型(如 Qwen3-4B 和 Qwen3-8B),并显示出对 Nanbeige4-3B-Thinking-2511 的明显改进。更值得注意的是,Nanbeige4.1-3B 展现了在通用小语言模型中罕见的深度搜索长时程智能体行为。虽然 Qwen3-4B 和 Qwen3-8B 等模型在几轮交互后就无法维持有意义的探索,但 Nanbeige4.1-3B 通过扩展的工具交互,可靠地解决了复杂的搜索导向任务。在这一领域,一个通才型 3B 模型获得了与数十亿规模的专用搜索导向模型相当的深度搜索能力,并接近 100B+ 通用大模型的搜索性能。这些结果表明,当训练目标和信用分配正确对齐时,紧凑的通才模型也能实现长时程智能体能力。

我们开源 Nanbeige4.1-3B 以支持对高效、具备智能体能力的语言模型的研究。除了模型权重本身,我们希望这次发布有助于社区理解如何在严格的容量限制下联合训练推理、编码和长时程行为。


2️⃣ 方法

在本节中,我们介绍了用于装备紧凑型 3B 模型以具备广泛通才能力的方法。我们首先描述如何为通用推理、长时程搜索(智能体行为)和代码生成分别优化模型,重点关注针对每种能力定制的训练信号和奖励结构的设计。然后我们详细说明如何通过这些异构目标的数据混合多阶段训练进行整合,使模型在严格的容量限制下既能保持领域特定优势,又能成为一个统一的通用模型。

2.1 通用能力

在本节中,我们详细阐述了对 Nanbeige4.1 通用能力的优化。我们的改进集中在两个关键方面:改进监督微调阶段的数据构建策略,以及通过点式和配对式强化学习的渐进式整合来升级通用强化学习训练范式。

2.1.1 监督微调

Nanbeige4.1-3B 基于 Nanbeige4-3B-Base 21 构建,采用了增强的监督微调方案,重点关注数据分布、长度缩放和训练数据质量。

  • 数据混合重构:与之前的 Nanbeige4-3B-2511 版本相比,我们增加了代码相关数据的比例,并引入了更高比例的数学和通用领域的难题。这种转变鼓励更强的推理深度,并提高了在困难基准上的鲁棒性。
  • 上下文长度扩展:我们通过引入第三个阶段(256k tokens)来扩展之前的两阶段课程(32k → 64k),以更好地支持复杂推理和长时程场景。在最终的 256k 阶段,我们采用了专门的数据混合,旨在增强智能体和推理能力,包括代码(27%)、深度搜索(26%)、STEM(23%)、工具使用(13%)和通用领域(10%)。
  • 解决方案优化与思维链重构:我们进一步优化了最初在 Nanbeige4-3B-2511 中引入的解决方案优化和思维链重构框架。具体来说,我们在解决方案优化循环中增加了优化迭代次数,允许更强的批评-修订循环产生更高质量的最终解决方案。此外,我们训练了一个能力更强的思维链重构模型,以从优化后的答案中生成更清晰、更忠实的推理轨迹。

如表 1 所示,这些改进在各项基准测试中带来了显著的提升。Nanbeige4.1-3B-SFT 在编码、数学和对齐指标上表现出持续的改进,为后续的强化学习阶段奠定了更坚实的基础。


表 1:从 Nanbeige4-3B-SFT 到 Nanbeige4.1-3B-SFT 的性能提升

领域 基准 Nanbeige4-3B-SFT Nanbeige4.1-3B-SFT
代码 LCB V6 45.5 62.0 +16.5
LCB Pro Medium 1.8 22.8 +21.0
数学 Hmmt Nov 60.7 74.3 +13.6
Imo-Answer-Bench 34.8 48.9 +14.1
对齐 Arena-Hard V2 45.5 60.2 +14.7
Multi-Challenge 42.6 44.4 +1.8

2.1.2 点式强化学习

监督微调后,我们仍然在 Nanbeige4.1-3B-SFT 中观察到一些退化问题,如重复和冗余思考,这在之前的工作中也有报道 5。为了解决这些问题并为强化学习建立更稳定的基础,我们引入了点式强化学习阶段

我们训练一个通用的奖励模型来评估生成的响应,遵循之前的工作 15。该模型在精心筛选的大规模人类偏好数据上进行训练。我们发现训练好的奖励模型自然地抑制了过度冗余、重复和低可读性的答案。然后我们执行 GRPO 14 来优化 Nanbeige4.1-3B-SFT,每个提示采样 8 个生成结果,并使用通用奖励模型对每个响应进行评分作为训练信号。

通过点式强化学习,我们显著减少了格式错误和冗余推理。在 LiveCodeBench-v6 上,点式强化学习大幅提高了长度稳定性,将过长截断率从 5.27% 降低到 0.38%。如表 2 所示,它还将 Arena-Hard V2 从 60.2 提升到 66.6,其中困难提示子集从 46.1 提升到 54.1。这些增益体现在更一致、结构良好的输出和高质量的代码呈现上。

2.1.3 配对式强化学习

尽管点式强化学习训练提供了有效的对齐信号,但高质量偏好数据的数量有限,限制了进一步的改进。为了解决这个问题,我们引入了配对式强化学习,以充分利用来自强-弱模型比较的偏好信息,并进一步提升模型性能。

我们在涵盖代码生成和 LMArena 风格对话(单轮和多轮)的配对比较数据上训练一个配对奖励模型。我们用强模型和弱模型生成响应对,然后应用与 Nanbeige4 相同的检查表过滤策略来推导可靠的胜负标签 21。遵循框架 18,我们通过添加交换一致性正则化器来减轻位置偏差,该正则化器定义为预测的响应对奖励差值与交换对奖励差值的否定之间的均方误差。

然后我们执行配对式强化学习,将奖励制定为一个二元结果,基于生成的输出是否优于参考答案。对于多轮场景,我们将完整的对话历史连接到配对奖励模型的输入中。

如表 2 所示,经过配对式强化学习后,Nanbeige4.1-3B 实现了全面的性能突破。通过深入挖掘多轮对话中的上下文信息,对齐指标显示出显著增益,Multi-Challenge 从 47.72 增加到 55.14。此外,配对式强化学习显著提升了 Arena-Hard V2 基准的性能,从 66.6 提高到 73.8,展示了其在优化对齐方面的有效性。这些结果证实了配对式强化学习能够锐化偏好边界,为各种基准的整体改进提供必要的信息性监督信号。


表 2:通过通用强化学习训练(监督微调 → 点式强化学习 → 配对式强化学习)的改进

领域 基准 监督微调 点式强化学习 配对式强化学习
代码 LCB V6 62.0 66.0 +4.0 65.6 -0.4
对齐 Arena-Hard V2 60.2 66.6 +6.4 73.8 +7.2
Multi-Challenge 44.4 47.7 +3.3 55.1 +7.4

2.2 深度搜索能力

在本节中,我们主要关注增强模型的深度搜索能力,特别是在数据流程和分阶段训练过程上。深度搜索被定义为一种以检索为中心的任务,在复杂的多跳推理和极长上下文设置下运行。在这种范式中,模型迭代地与环境交互以获取信息,使它们能够解决具有挑战性的搜索问题。

2.2.1 数据构建

为了增强基础模型的搜索能力,我们构建了一个大规模、复杂的搜索数据集,其中包括大量源自维基百科实体关系图的多跳问答对,以及经过多阶段严格筛选的高质量长程搜索轨迹。整个数据构建流程如图 2 所示。为了促进进一步研究,我们已在 HuggingFace 上开源了构建的数据集 [1](#1)

时间感知的头实体选择与随机游走问题合成。为确保合成问答数据的时效性和复杂性,我们首先从维基百科中提取过去六个月内更新过的信息量丰富的头实体。遵循 20 的框架,我们构建实体关系图,并执行条件随机游走以提取预定义长度的关系路径。这些链及其详细的时间上下文,随后被输入到一个强大的 LLM 中以合成复杂的问题。

轨迹合成与轮次级别判断。为了合成搜索轨迹,我们采用多个智能体框架来处理生成的查询,采样多样化的推理路径。然后从统一的智能体视角将这些轨迹映射为多轮工具调用序列。为了进一步保证合成数据的质量,我们实现了一个严格的轮次级别判断机制。具体来说,我们使用一个评判模型根据三个维度评估交互的每一步:逻辑合理性、工具调用准确性和信息增益。任何未达到这些标准的轮次都不会参与模型训练,或为模型提供负奖励。这种细粒度的筛选确保了最终的轨迹为监督微调和偏好对齐提供高保真信号。


图 2:深度搜索数据构建流程,包括复杂的多跳问答采样和长程推理轨迹的合成。

(图表说明:包含时间感知头实体选择、随机游走问题合成、轨迹合成与轮次级别判断等步骤)


2.2.2 初步性能

为了实证验证我们提出的数据构建流程的有效性,我们使用 Nanbeige4-3B-2511 作为基础模型进行了对照实验。具体来说,我们仅在通过第 2.2.1 节所述方法生成的合成多跳问答和搜索轨迹上训练模型,有意排除了其他开源数据。我们在一系列长时程基准上评估我们的模型,包括 GAIA 9、BrowseComp 16、BrowseComp-ZH 23、人类最后考试(HLE)12、SEAL-0 11、xBench-DeepSearch-2505 3 和 xBench-DeepSearch-2510 3。对于 HLE 和 GAIA,我们仅测试和报告纯文本子集的结果。此外,这些工具中明确禁用了 HuggingFace。

该模型在 Mindflow 框架 [2](#2) 内进行评估,使用一套工具:Serper [3](#3) 用于环境搜索,Jina [4](#4) 用于网页内容提取,以及 E2B Sandbox [5](#5) 作为安全沙箱环境。我们结果的分阶段比较分析如下:

定量结果总结在表 3 中。与基础模型相比,加入我们的合成数据在所有基准上都带来了显著的性能提升。值得注意的是,该模型在 xBench-DeepSearch-2505 上取得了巨大飞跃(从 33.0 提高到 76.0),这表明我们的数据合成流程有效地赋予了模型强大的多跳推理和长上下文搜索能力。


表 3:合成问答在搜索基准上的初步评估结果

基准 GAIA (纯文本) Browse Comp Browse Comp-ZH HLE (纯文本) SEAL-0 xBench DeepSearch-05 xBench DeepSearch-10
Nanbeige4-3B-2511 19.4 0.8 3.1 13.9 12.6 33.0 11.0
+ 合成问答 58.3 14.4 30.1 22.4 36.0 76.0 30.0

2.3 编码能力

在本节中,我们主要关注增强基础模型的编码能力,包括数据构建流程、分阶段训练策略和评估设置。

2.3.1 评判系统

我们构建了一个统一的评判系统,该体系在监督微调数据构建、强化学习数据构建以及后续的强化学习训练和评估中共享。它结合了一个用于基于执行的正确性检查的多语言沙箱,以及一个用于时间复杂度比较的专用指令评判模型。该指令模型专门针对在强化学习设置中进行快速复杂度评估而训练,能够高效地对模型生成解法的预测复杂度与参考最优界进行在线比较。


图 3:代码强化学习中的门控时间复杂度奖励设计。 只有当解决方案通过所有测试用例(PassRate = 1)时,时间奖励 R_time 才会被激活,评判系统通过比较预测的时间复杂度与参考最优界来提供在线反馈。

(图表说明:包含问题、模型、沙箱执行、评判系统、正确性奖励、时间奖励等模块)


2.3.2 数据构建

我们的数据构建包括两个部分:使用我们的评判系统筛选时间最优解的监督微调数据构建,以及采用基于策略的难度筛选以提高样本效率的强化学习数据构建。

  • 监督微调数据构建:我们的监督微调数据构建使用此评判系统从两个关键方面评估解决方案质量:(1)通过在沙箱中执行程序来评估功能正确性,(2)通过将执行信号与基于模型的复杂度分析相结合来评估时间复杂度。在数据生成过程中,我们为每个问题采样多个候选解决方案。然后由评判系统验证这些候选方案,我们保留那些被判断为对给定问题时间最优(或属于最佳复杂度类别)的方案。
  • 强化学习数据构建:每个强化学习样本包含问题陈述、测试用例、时间复杂度最优解以及相应的最优复杂度标签。最优解和复杂度是通过提示多个强大的大语言模型并让一个强大的大语言模型将候选方案合成为一个最佳解决方案而获得的,然后这些被用作奖励塑形和难度控制的监督信号。

在这两个阶段中,我们执行基于策略的筛选,为每个问题运行多个生成结果(n=8),并根据有多少个生成结果满足特定阶段的标准来选择样本。在第一阶段,我们使用基于难度的标准:如果策略可以在中等数量的生成结果中解决问题(我们在 8 次中保留成功解决次数 k 在 1, 5 区间的问题),则保留该问题。在第二阶段,我们使用基于复杂度的标准:我们统计有多少个生成结果产生的解决方案的估计时间复杂度满足目标界,并保留 8 次中复杂度满足要求的生成结果次数 k 在 1, 5 区间的问题。

2.3.3 分阶段训练过程

从通用强化学习检查点开始,我们进一步进行了两个阶段的代码强化学习。

  • 第一阶段 :我们使用通过率奖励优化解决方案的正确性,定义为每个问题通过的测试用例的比例。
  • 第二阶段 :在策略能够可靠地解决问题后,我们通过引入时间复杂度奖励 来进一步鼓励更高质量的解决方案,但该奖励仅在所有测试用例都通过时才激活;否则,奖励简化为仅正确性信号。具体来说,评判系统通过比较模型的输出与参考最优复杂度,并在适用时检查生成的解决方案是否匹配参考最优解,来提供在线反馈。

如图 3 所示,时间复杂度奖励仅对完全正确的解决方案激活。

奖励公式:
R = { R format + R correctness , PassRate < 1 R format + R correctness + R time , PassRate = 1 R = \begin{cases} R_{\text{format}} + R_{\text{correctness}}, & \text{PassRate} < 1 \\ R_{\text{format}} + R_{\text{correctness}} + R_{\text{time}}, & \text{PassRate} = 1 \end{cases} R={Rformat+Rcorrectness,Rformat+Rcorrectness+Rtime,PassRate<1PassRate=1

作为一个具体说明,附录 C 展示了 LiveCodeBench 案例研究,比较了时间奖励阶段前后模型的输出,突出了典型的复杂度类别改进。

2.3.4 训练动态

在两个阶段的代码强化学习过程中,我们观察到奖励信号和下游编码性能的持续改进。在第一阶段,正确性奖励(R_correctness)急剧增加,反映了在生成有效且正确的解决方案方面的快速提升。在第二阶段,R_correctness 的提升较为温和,而门控时间奖励(R_time)则显著上升,这表明一旦基本实现正确性,策略确实在优化时间复杂度。两阶段训练过程中的整体奖励和性能趋势如图 4 所示。


图 4:两阶段代码强化学习的训练动态。 我们追踪了整个训练过程中的奖励(包括第二阶段的门控 R_time)和 LiveCodeBench 性能,显示从第一阶段到第二阶段的持续改进。

(图表说明:两阶段代码强化学习的训练动态图,x轴为训练步数,y轴为性能/奖励)


2.4 Nanbeige4.1 的完整训练方案

Nanbeige4.1-3B 从 Nanbeige4-3B-Base 初始化,并通过结合大规模监督微调和级联强化学习的结构化后训练流程进行进一步优化。

我们首先进行扩展的监督微调,与之前的 Nanbeige4-3B-2511 版本相比,将最大上下文长度从 64K 增加到 256K。这个更长的上下文窗口对于支持长时程推理和多轮深度搜索规划至关重要。

在强化学习阶段,我们采用分阶段优化策略

  • 通用强化学习依次使用点式强化学习和配对式强化学习进行,以增强独立响应质量和对比偏好对齐。
  • 然后进行代码强化学习的两个阶段:一个最大化执行通过率的正确性阶段,随后是一个仅在完全正确时才激活效率奖励的门控时间复杂度阶段。
  • 最后,我们应用一个轻量级的智能体强化学习阶段来增强工具使用和搜索行为。

这种统一的训练方案使 Nanbeige4.1-3B 能够在严格的容量限制下保持强大的领域特定性能,同时成为一个良好平衡的通才模型。


3️⃣ 实验

我们的评估包括三个部分:通用推理、深度搜索智能体任务和现实世界的编码挑战。通用推理基准衡量核心能力边界。深度搜索任务评估在现实环境中进行长时程规划和工具增强的多步推理。现实世界的算法挑战提供了一个分布外的压力测试。

3.1 通用任务评估

对于通用推理能力,我们在五个主要类别上进行评估:代码、数学、科学、对齐和工具使用。

  • 代码:我们在 LiveCodeBench-V5、LiveCodeBench-V6 6 和 LiveCodeBench-Pro 22 上报告结果,以评估代码生成能力和在不断增加难度下基于执行的正确性。
  • 数学 :我们使用 IMO-Answer-Bench 8、HMMT 1 和 AIME-2026-I [6](#6) 来评估符号推理和竞赛级别的问题解决能力。
  • 科学:我们在 GPQA 13 和 HLE 12 上进行基准测试,以衡量多步科学推理和领域知识整合能力。
  • 对齐:我们使用 Arena-Hard-V2 7 和 Multi-Challenge 4 来评估偏好建模的鲁棒性和在对抗性或挑战性提示下的响应质量。
  • 工具使用:我们评估 BFCL 10 和 Tau2-Bench 2,测试函数调用的可靠性和多步工具使用能力。

对于比较的基线模型,我们包括同规模的开源模型(Qwen3-4B-2507)和我们之前的发布版本(Nanbeige4-3B-2511),以及更大的开源模型,包括 Qwen3-30B-A3B-2507、Qwen3-32B 和 Qwen3-Next-80B-A3B。这种设置使我们能够评估同规模的竞争力和跨规模的效率。

总体结果。表 4 显示,Nanbeige4.1-3B 在所有评估领域均显著优于 Qwen3-4B-2507 及其前身 Nanbeige4-3B-2511,证明了我们后训练策略的有效性。

更值得注意的是,尽管只有 3B 参数,Nanbeige4.1-3B 在大多数基准上(包括编码、对齐和工具使用任务)持续超越 30B-32B 级别的模型(Qwen3-30B-A3B-2507 和 Qwen3-32B)。在基于执行的编码基准上,如 LiveCodeBench-V6 和 LiveCodeBench-Pro-Medium,增益尤为显著,Nanbeige4.1-3B 取得了较大的绝对领先幅度。当与 Qwen3-Next-80B-A3B 相比时,Nanbeige4.1-3B 仍具竞争力并展现出互补优势:它在几个编码和对齐基准上领先,而 80B 模型在选定的数学和工具使用任务上保持优势。

这些结果表明,即使在显著较小的参数规模下,通过有针对性的后训练和面向智能体的优化,也能实现强大的跨领域推理性能。


表 4:代码、数学、科学、对齐和工具使用基准的评估结果

基准 Qwen3-4B 2507 Qwen3-32B Qwen3-30B A3B-2507 Qwen3-Next -80B-A3B Nanbeige4-3B 2511 Nanbeige4.1-3B
代码
LCB-V6 57.4 55.7 66.0 68.7 46.0 76.9
LCB-Pro-Easy 40.2 42.3 60.8 78.8 40.2 81.4
LCB-Pro-Medium 5.3 3.5 3.5 14.3 5.3 28.1
数学
AIME 2026 I 81.46 75.83 87.30 89.24 84.10 87.40
HMMT Nov 68.33 57.08 71.25 81.67 66.67 77.92
IMO-Answer-Bench 48.00 43.94 54.34 58.00 38.25 53.38
科学
GPQA 65.8 68.4 73.4 77.2 82.2 83.8
HLE (纯文本) 6.72 9.31 11.77 13.70 10.98 12.60
对齐
Arena-Hard-V2 34.9 56.0 60.2 62.3 60.0 73.2
Multi-Challenge 41.14 38.72 49.40 56.52 41.20 52.21
工具使用
BFCL-V4 44.87 47.90 48.60 50.51 53.80 56.50
Tau2-Bench 45.90 45.26 47.70 57.40 41.77 48.57

3.2 深度搜索任务评估

在本节中,我们对 Nanbeige4.1-3B 在深度搜索任务上的性能进行全面评估。我们通过与相当规模的通用基础模型、专门的搜索智能体模型以及显著更大规模的基础模型进行对比基准测试,来评估其处理复杂任务的能力。

3.2.1 实验设置与对比基线

所有实验设置与第 2.2.2 节相同。这些基准需要迭代检索、规划、工具交互和跨文档推理,反映了现实世界的自主智能体工作负载。为了全面定位 Nanbeige4.1-3B 的性能,我们对几类现有模型进行了多样化的比较。这包括配备工具的通用基础模型(例如,Qwen 系列模型)、专门的搜索智能体模型,如 MiroThinker-8B、AgentCPM-Explore-4B 和 Tongyi-DeepResearch-30B。我们还加入了超过 100B 参数的大规模开源基础模型进行比较,包括 Minimax-M2.1、GLM-4.6 和 DeepSeek-V3.2。

3.2.2 整体性能分析

表 5 展示了各种搜索智能体基准上的综合性能比较。

尽管"研究智能体"和"带工具的大型基础模型"通常在其各自类别中表现出强大的能力,特别是在 GAIA 和浏览任务上,但"带工具的小型基础模型"(Qwen3 系列)通常表现出较低的性能水平。

我们的模型 Nanbeige4.1-3B 与其基线 Nanbeige4-3B-2511 相比,性能有了显著的飞跃,并且在所有基准上都显著优于其他带工具的小型基础模型。更重要的是,Nanbeige4.1-3B 在几乎所有评估的基准上都取得了最先进的结果,包括 GAIA (69.90)、xBench-DeepSearch-05 (75.00) 和 SEAL-0 (41.44)。这些分数不仅超越了其在小模型类别中的直接竞争对手,而且使其与许多更大的"研究智能体"和"带工具的大型基础模型"的性能相媲美甚至超越。这一强劲表现凸显了 Nanbeige4.1-3B 在复杂搜索和智能体任务中的卓越效能,证明通过我们提出的方法,即使使用较小的模型规模也能有效地实现具有竞争力的能力。


表 5:各深度搜索基准的性能比较

基准 GAIA (纯文本) Browse Comp Browse Comp-ZH HLE (纯文本) SEAL-0 xBench DeepSearch-05 xBench DeepSearch-10
研究智能体
Tongyi-DeepResearch-30B 70.90 43.40 46.70 32.90 - 75.00 -
MiroThinker-v1.0-8B 66.40 31.10 40.20 21.50 40.40 60.60 -
AgentCPM-Explore-4B 63.90 25.00 29.00 19.10 40.00 70.00 -
带工具的大型基础模型
GLM-4.6-357B 71.90 45.10 49.50 30.40 - 70.00 -
Minimax-M2-230B 75.70 44.00 48.50 31.80 - 72.00 -
DeepSeek-V3.2-671B 63.50 67.60 65.00 40.80 38.50 71.00 -
带工具的小型基础模型
Qwen3-4B-2507 28.33 1.57 7.92 11.13 15.74 34.00 5.00
Qwen3-8B 19.53 0.79 5.15 10.24 6.34 31.00 2.00
Qwen3-14B 30.23 2.36 7.11 10.17 12.64 34.00 9.00
Qwen3-32B 30.17 3.15 7.34 9.26 8.15 39.00 8.00
Qwen3-30B-A3B-2507 31.63 1.57 4.12 14.81 9.24 25.00 10.00
Qwen3-Next-80B-A3B 34.02 5.60 8.25 9.26 18.18 27.00 6.00
我们的模型
Nanbeige4-3B-2511 19.42 0.79 3.09 13.89 12.61 33.00 11.00
Nanbeige4.1-3B 69.90 19.12 31.83 22.29 41.44 75.00 39.00

3.3 现实世界的算法挑战:LeetCode 周赛

除了精心设计的学术基准之外,我们还在来自近期 LeetCode 周赛 [7](#7) 的现实世界竞争性编程任务上进一步评估 Nanbeige4.1-3B,提供了对算法推理能力的实际分布外压力测试

我们将 Nanbeige4.1-3B 与不同规模的 Qwen 模型一起应用于标准竞争编程设置下的竞赛问题。生成的解决方案直接提交给官方 LeetCode 平台,性能通过最终通过率来衡量。


表 6:LeetCode 周赛 484--488 的通过率比较

基准 Qwen3-4B-2507 Qwen3-32B Qwen3-30B-A3B-2507 Nanbeige4.1-3B
LeetCode 通过率 (%) 55.0 50.0 65.0 85.0

如表 6 所示,Nanbeige4.1-3B 成功解决了 20 个问题中的 17 个,实现了 85.0% 的整体通过率。在虚拟参赛模式下,排名由正确性和时间效率决定,我们的模型在第 487 周周赛中获得第 1 名 ,在第 488 周周赛中获得第 3 名。与相似或显著更大规模的 Qwen3 模型相比,Nanbeige4.1-3B 在这些现实世界竞赛任务中展现出明显的性能优势。详细的问题陈述和代表性解决方案示例见附录 B。


4️⃣ 结论

在这项工作中,我们提出了 Nanbeige4.1-3B,一个统一的通才模型,在推理、编码和长时程搜索方面展现了先进的能力。我们通过整合点式和配对式奖励建模以实现精确的偏好对齐,优化代码生成以实现正确性和计算效率,并引入轮次和轨迹级别的信号以实现稳健的长时程智能体规划,从而实现了这一目标。因此,Nanbeige4.1-3B 在多样的基准测试和现实世界挑战中持续优于同类小型模型,并与更大的基线模型保持竞争力。

展望未来,我们旨在推动紧凑型模型在复杂编码和研究智能体场景中的边界。同时,我们专注于通过使任务能够以更短的输出更少的工具调用来解决,从而提高推理效率,同时探索架构创新以进一步增强紧凑型通才模型的潜力。


脚注:


  1. https://huggingface.co/datasets/Nanbeige/ToolMind-Web-QA ↩︎

  2. https://github.com/MiroMindAI/MiroThinker ↩︎

  3. https://serper.dev/ ↩︎

  4. https://jina.ai/ ↩︎

  5. https://e2b.dev/ ↩︎

  6. https://huggingface.co/datasets/MathArena/aime_2026_I ↩︎

  7. https://leetcode.cn/contest/ ↩︎

相关推荐
JJJennie77716 小时前
当AI开始学会欺骗
网络·人工智能
糖果店的幽灵16 小时前
大模型测评DeepEval快速入门-安全与通用指标详解
人工智能·安全·langgraph·大模型测评·deepeval
江畔柳前堤1 天前
roLabelImg 详细安装教程
开发语言·人工智能·后端·云原生
阿里云大数据AI技术1 天前
分链路差异化设计的DSP准实时数仓|钛动科技基于阿里云实时计算 Flink 版 + DLF Paimon + EMR Serverless StarRocks 的实践
人工智能·flink
陕西企来客1 天前
2026年7月AI智能搜索曝光趋势研判
大数据·人工智能·机器学习·ai智能搜索曝光
阿里云大数据AI技术1 天前
从算力到智能体,面向 Agentic AI 的基础设施演进
人工智能·agent
hangyuekejiGEO1 天前
GEO技术服务选型指南
大数据·人工智能·python
阿里云大数据AI技术1 天前
EMR Serverless Spark AI Function 的双维降本实践
人工智能·sql·spark
维基框架1 天前
GitHub源码处理提速 一趟扫描反而更慢
人工智能·github
冬奇Lab1 天前
代码库知识库系列(05):向量检索 vs 知识图谱——加了调用图并没有变更好
人工智能