Intern-S2-Preview:面向科学智能的智能体基础大模型
论文链接:https://arxiv.org/html/2608.13505v1
摘要
科学发现任务对AI系统提出全新要求:需要模型在多模态异构科学证据上完成深度推理、可与各类科研工具交互、支持超长任务迭代求解。本文完整介绍 Intern-S2-Preview 系列科学智能体基础模型,整套模型可完成多模态科学理解、知识生成、长时序复杂任务求解。
整套训练流程分为两大阶段:
- 多模态科学预训练:基于渲染科学文档、图文交错数据、全领域科学语料完成基础预训练;
- 统一后训练流水线:包含监督微调、多任务可扩展强化学习、黑白盒智能体强化学习、在线策略蒸馏四大模块。
同时配套全套工程优化方案:部分rollout带离线修正、自适应长度正则、在线推测解码、分组熵可控多任务优化、轨迹感知经验组装,大幅提升训练稳定性与吞吐效率。
模型架构两大核心创新
- Intern-S2-Preview-397B 主干内置升级时序模块,将长序列建模能力拓展至科学数值预测任务;
- 独立 Memory Decoder(记忆解码器)轻量化扩展模块,主干模型完全冻结仅新增4B参数分支,无需微调主干即可快速适配细分科研领域。在生物学评测集 Biology-Instructions 中,主干基线得分56.92,搭配 Intern-MemDec-4B 后提升至60.32。
实验结论
在科学、多模态、智能体、通用大模型全系列基准测试中,Intern-S2-Preview-397B 取得开源模型领先/同级最优结果;内置时序模块在 SciTS 时序理解与预测基准大幅超越通用文本/多模态大模型;记忆解码器可在不损失通用能力的前提下,精准提升细分学科专项性能。
1 引言
1.1 现有模型痛点
- 通用大语言模型:缺少科学模态、科研领域规范、工具可验证交互能力;
- 传统科学多模态模型:仅支持静态问答,无法完成长时序、多轮工具迭代的科研流程;
真实科研不只是单题作答,需要基于异构证据持续推理、自适应规划、多次调用工具与环境交互,现有模型均无法完整覆盖完整科研工作流,因此本文提出 Intern-S2-Preview,以 Intern-S2-Preview-397B 为主干模型,从静态科学问答升级为工具驱动迭代式科学求解智能体。
1.2 架构设计两大核心需求
- 科学时序信号处理:科研大量长数值时序数据(天文、神经、遥感、雷达、生物电信号),模型需要高效编码+未来数值预测双能力;
- 轻量化领域定制:传统全量微调主干会破坏模型通用推理、多模态、工具能力,本文设计外挂记忆分支方案,冻结主干仅训练小模块即可适配细分学科。
1.3 整体训练链路概述
- 持续预训练:融合文档布局、图文关联、大规模高质量科学图像检索数据;
- 后训练统一流水线:监督微调初始化指令跟随与工具调用能力 → 多任务强化学习提升推理准确度 → 黑白盒智能体RL学习代码/终端/科研工具交互 → 在线策略蒸馏融合所有专家能力得到统一主干模型。
1.4 评测范围
评测覆盖静态科学问答、流程化工具智能体任务两大类基准,验证模型同时具备通用知识、细分科学推理、多模态生成、工具交互四大能力;额外单独验证记忆解码器、时序模块两大分支的独立增益。
2 模型架构
Intern-S2-Preview-397B 包含主干大模型、内置时序编码器/预测分支两大原生组件;配套独立可插拔 Memory Decoder 记忆扩展模块(非主干原生结构)。
2.1 Memory Decoder 记忆解码器(外挂模块化扩展)
2.1.1 设计动机
科研领域长尾分布明显,细分生物、化学、材料等子领域持续迭代,直接微调397B主干会破坏模型原有通用推理、多模态、工具智能能力;记忆解码器采用并行分支架构,主干全程冻结,仅新增小参数模块注入领域知识,即插即用,无通用能力损耗。
推理融合逻辑
- 推理时主干模型与记忆解码器并行处理同一输入上下文,分别输出独立token概率分布;
- 轻量级token级路由网络根据两者隐藏状态、输出不确定性动态计算融合权重 λt∈0,1\lambda_t \in 0,1λt∈0,1;
- 最终输出分布:
pfinal(⋅∣ct)=(1−λt)pS2(⋅∣ct)+λtpmem(⋅∣ct)p_{\mathrm{final}}(\cdot\mid c_{t})=(1-\lambda_{t})p_{\mathrm{S2}}(\cdot\mid c_{t})+\lambda_{t}p_{\mathrm{mem}}(\cdot\mid c_{t})pfinal(⋅∣ct)=(1−λt)pS2(⋅∣ct)+λtpmem(⋅∣ct)
2.1.2 Memory Decoder 训练流程
- 构建领域SFT数据集 Dsft={(q(i),a(i))}i=1N\mathcal{D}{\mathrm{sft}}=\{(q^{(i)},a^{(i)})\}{i=1}^{N}Dsft={(q(i),a(i))}i=1N,基于输入前缀构建token级检索库;
- 检索得到教师分布 pretp_{\mathrm{ret}}pret,训练损失融合KL蒸馏损失+标准交叉熵损失:
Lmem(ct)=β LKL(ct)+(1−β)LCE(ct)\mathcal{L}{\mathrm{mem}}(c{t})=\beta\,\mathcal{L}{\mathrm{KL}}(c{t})+(1-\beta)\mathcal{L}{\mathrm{CE}}(c{t})Lmem(ct)=βLKL(ct)+(1−β)LCE(ct)
LKL(ct)=KL(pret(⋅∣ct)∥pmem(⋅∣ct)),LCE(ct)=−logpmem(yt∣ct)\mathcal{L}{\mathrm{KL}}(c{t})=\mathrm{KL}(p_{\mathrm{ret}}(\cdot\mid c_{t})\|p_{\mathrm{mem}}(\cdot\mid c_{t})),\quad\mathcal{L}{\mathrm{CE}}(c{t})=-\log p_{\mathrm{mem}}(y_{t}\mid c_{t})LKL(ct)=KL(pret(⋅∣ct)∥pmem(⋅∣ct)),LCE(ct)=−logpmem(yt∣ct)
β\betaβ 控制检索教师与标准答案监督权重平衡。
2.1.3 路由网络训练
训练时主干、记忆解码器全部冻结,仅优化路由网络,增加符号线性正则约束,区分通用样本与领域样本权重:
Lrouter(ct)=LCE(ct)+αs⋅stλt\mathcal{L}{\mathrm{router}}(c{t})=\mathcal{L}{\mathrm{CE}}(c{t})+\alpha_{s}\cdot s_{t}\lambda_{t}Lrouter(ct)=LCE(ct)+αs⋅stλt
- st<0s_t<0st<0:领域样本,抑制记忆权重过度放大;
- st>0s_t>0st>0:通用样本,鼓励降低记忆分支权重;
- αs\alpha_sαs:正则强度超参数。
2.1.4 生物学实验效果
仅加载 Intern-MemDec-4B 记忆模块后,Biology-Instructions 平均分由56.92提升至60.32,跨通用、化学、多模态基准性能几乎无衰减,实现定向领域增强。
2.2 时序模块(主干原生内置)
分为时序编码器(长序列理解)、**时序预测分支(数值生成预测)**两大子模块。
2.2.1 升级版时序编码器
对比上一代 Intern-S1-Pro 全方位优化:
- 处理流程:原始时序分块 → 压缩分块模块(归一化+CNN局部特征+Q-Former压缩)→ 通道Transformer建模通道依赖 → 时序Transformer全局时序建模;
- 性能提升:最大支持时序长度由24万步提升至30万步;同等长度推理提速5~6倍,显存占用仅为前代20%;
- 新增能力:支持高频短时信号、MHz级雷达信号建模,覆盖天文、神经、遥感、生物声学、雷达全时序科研场景。
2.2.2 时序生成预测分支
传统LLM将数值转为离散token生成会损失精度,本文设计专用数值预测分支:
- 融合LLM语义特征与时序编码器数值特征,通过Q-Former交叉注意力输入因果预测Transformer;
- 内置预测长度预判器,自动识别指令所需预测步长,支持任意预测窗口;
- 统一在多模态LLM框架内完成时序理解+预测,无需额外独立时序模型。
3 预训练阶段
预训练分为三大并行数据流水线:可视化预训练、PDF图文交错数据集构建、大规模科研图像检索增强,全部代码与数据处理管道开源配套XTuner训练框架。
3.1 可视化预训练(Visual Pre-training, VP)
传统文本抽取会丢失图表、公式、页面布局信息,VP直接对渲染后的PDF页面图像做自监督预训练。


- 流程:页面图像冻结视觉编码器提取特征 → 掩码去除空白区域 → 光栅序列化输入LLM自回归预测视觉隐向量;
- 损失函数:批次内对比式隐向量预测损失:
LVP=−1∣B∣∑t∈Blogptt\mathcal{L}{\mathrm{VP}}=-\frac{1}{|\mathcal{B}|}\sum{t\in\mathcal{B}}\log p_{tt}LVP=−∣B∣1t∈B∑logptt - 联合预训练总损失:交替输入文本、视觉样本联合优化
L=λtextLCE+λvisLVP\mathcal{L}=\lambda_{\mathrm{text}}\mathcal{L}{\mathrm{CE}}+\lambda{\mathrm{vis}}\mathcal{L}_{\mathrm{VP}}L=λtextLCE+λvisLVP
视觉编码器全程冻结,仅优化LLM主干、视觉投影层、预测头;无需OCR、标注配对数据,可海量无标注科学文档扩展。
3.2 PDF图文交错数据集构建流水线
原始PDF仅文本无法建模图表、公式与上下文关联,设计8步标准化处理管道:

- PDF布局解析:使用MinerU2.5-Pro提取文本块、标题、图表/公式视觉区域;
- 视觉单元裁剪:单独截取出图片、行间公式、表格三类视觉单元;
- 页面级交错序列构建:按阅读顺序重组「文本-图像-公式-表格」交替序列;
- 视觉增益过滤:对比纯文本PPL、图文混合PPL,仅保留加入视觉后困惑度显著下降的高价值页面;
- 文档级拼接:按原始PDF页码拼接过滤后页面;
- 长上下文分块:单块上限256k token,块间重叠512 token;
- 领域筛选:聚焦生命科学、化学、材料科学三大核心科研领域;
- 生成最终预训练交错语料库。
视觉增益过滤核心逻辑
Δ=PPL无图像−PPL含图像\Delta = \text{PPL}{\text{无图像}} - \text{PPL}{\text{含图像}}Δ=PPL无图像−PPL含图像
Δ\DeltaΔ 大于领域阈值才保留页面,过滤装饰图、无关配图,仅保留实验图、机理图、数据表、公式等有效视觉信息。
3.3 大规模科研图像检索增强流水线
为提升多模态图文匹配质量,搭建Milvus向量检索库扩充训练图像分布:
- 向量库构建
- 图像SHA256去重;
- 8B嵌入模型生成1024维图像向量;
- Milvus分片分集合存储,支持亿级图像高速检索;
- 在线双检索模式
- 图像输入:图像向量+caption文本向量联合跨模态检索;
- 文本输入:文本向量直接检索匹配科研图像;
- 检索后处理:重复过滤、重排模型打分、低分样本剔除,筛选高质量图像混入预训练数据。
4 后训练统一流水线
预训练模型进入四段式后训练:监督微调SFT → 多任务可扩展强化学习RL → 黑白盒智能体强化学习 → 在线策略蒸馏OPD。训练底层依赖XTuner训练引擎、LMDeploy推理引擎,智能体环境基于Lagent开源框架。
4.1 监督微调 SFT(第一阶段后训练)
- 数据混合集:通用对话、复杂指令跟随、安全对齐、代码、图文感知、工具调用、长时序智能体轨迹、全领域科学指令;
- 数据清洗:去重、低质过滤;复杂推理样本采用Intern-S1-Pro+主流开源模型拒绝采样生成,人工领域专家核验;
- 作用:为后续所有RL阶段提供稳定、高质量初始化基座。
4.2 多任务稳定可扩展强化学习
针对RL训练长推理、多任务异构、推理冗余、推理速度慢四大痛点,配套4套自研优化技术。
4.2.1 共址式部分Rollout+离线重要性修正
传统同步rollout会被超长推理样本拖慢GPU利用率,设计「暂停-恢复」共址架构,推理/训练共用GPU池。
- 运行逻辑
- LMDeploy持续填充推理请求,保证GPU满载;
- 收集足量完整轨迹后,暂停未完成长样本,保存前缀与元数据,GPU切换XTuner训练;
- 参数更新同步至推理引擎,暂停轨迹从保存前缀恢复生成;
- 离线偏差修正方案
- 记录每个token生成时的旧行为策略,计算重要性采样比率并截断:
ρˉi,t(θ)=clip(ρi,t(θ),1−ϵlowIS,1+ϵhighIS)\bar{\rho}{i,t}(\theta)=\operatorname{clip}\left(\rho{i,t}(\theta),1-\epsilon_{\mathrm{low}}^{\mathrm{IS}},1+\epsilon_{\mathrm{high}}^{\mathrm{IS}}\right)ρˉi,t(θ)=clip(ρi,t(θ),1−ϵlowIS,1+ϵhighIS) - Rollout R3路由复现:MoE模型记录推理时专家路由,训练阶段完全复现消除路由偏差;
- BKL双向KL掩码过滤数值计算异常token,消除训练/推理精度差异。
- 记录每个token生成时的旧行为策略,计算重要性采样比率并截断:
4.2.2 自适应长度正则(消除模型过度思考)
解决CoT模型简单问题冗余超长推理问题,不新增独立奖励,仅修正优势权重:
- 触发规则:仅当该query正向回复占比高于阈值 τ\tauτ 时启用;错误回复不做长度惩罚;
- 长度权重:短推理样本分配更高优势权重,长样本权重衰减,总正向优势总量保持稳定;
wi=α+(1−α)(1−Li−Lmin+Lmax+−Lmin++ϵ)γw_{i}=\alpha+(1-\alpha)\left(1-\frac{L_{i}-L_{\min}^{+}}{L_{\max}^{+}-L_{\min}^{+}+\epsilon}\right)^{\gamma}wi=α+(1−α)(1−Lmax+−Lmin++ϵLi−Lmin+)γ - 效果:同等全局奖励水平下,平均生成长度大幅缩短,推理效率提升。
4.2.3 在线自适应推测解码加速RL Rollout
固定草稿模型随训练迭代分布偏移,本文在线同步更新草稿模型,采用LK混合损失:
LLK(t,k)=λkDKL(pt,k ∥ qt,k)+(1−λk)DTV(pt,k,qt,k)\mathcal{L}{\mathrm{LK}}^{(t,k)}=\lambda{k}D_{\mathrm{KL}}\left(p_{t,k}\,\|\,q_{t,k}\right)+\left(1-\lambda_{k}\right)D_{\mathrm{TV}}\left(p_{t,k},q_{t,k}\right)LLK(t,k)=λkDKL(pt,k∥qt,k)+(1−λk)DTV(pt,k,qt,k)
λk\lambda_kλk 根据草稿接受率自适应调整,低接受率侧重KL分布对齐,高接受率侧重TV重叠最大化;最终Rollout生成2倍加速,整体RL流水线端到端提速1.7倍。
4.2.4 GEPO分组熵可控多任务优化
异构任务熵分布差异大,全局熵正则会破坏部分任务探索空间,GEPO按prompt分组平衡探索:
- 计算每组平均组熵 Hg(x)H_{\text{g}}(x)Hg(x);
- 低熵组正向优势衰减(防止过利用),高熵组负向优势衰减(避免过早压制探索);
- 无需额外标注、不新增rollout,原生兼容GRPO、RLOO分组RL框架。
4.2.5 统一RL损失函数
基于Leave-One-Out LOO优势,依次经过GEPO熵缩放、自适应长度正则,结合截断重要性权重、BKL数值掩码构建最终损失:
LRL(θ)=−E1G∑i=1G1∣yi∣∑t=1∣yi∣mi,tBKL sg\[ρˉi,t(θ)A~ilogπθ(yi,t∣si,t)]\mathcal{L}{\mathrm{RL}}(\theta)=-\mathbb{E}\left\\frac{1}{G}\\sum_{i=1}\^{G}\\frac{1}{\|y_{i}\|}\\sum_{t=1}\^{\|y_{i}\|}m_{i,t}\^{\\mathrm{BKL}}\\,\\operatorname{sg}\\left\[\\bar{\\rho}_{i,t}(\\theta)\\right\widetilde{A}{i}\log\pi_{\theta}(y_{i,t}\mid s_{i,t})\right]LRL(θ)=−E G1i=1∑G∣yi∣1t=1∑∣yi∣mi,tBKLsgρˉi,t(θ)A ilogπθ(yi,t∣si,t)
超参数配置:Muon优化器,学习率1e-6,权重衰减0.01,单批次8192条完整轨迹,8轮梯度累积,最大生成长度65536 token。
4.3 黑白盒统一智能体强化学习框架
面向代码、终端、自动化科研、软件工程长时序工具交互任务,设计 执行器×任务 双层解耦抽象架构,兼容所有主流代码智能体。
4.3.1 基础设施核心组件
- 统一沙箱调度:隔离终端、代码执行环境,统一资源回收;
- 智能体网关适配器:原生兼容白盒自研智能、OpenHands、Mini-SWE、Claude Code等黑盒Agent,仅需轻量适配层;
- Token级轨迹存储PrefixTree:分离语义交互轨迹与模型token概率、路由专家信息,训练时精准对齐每一步工具动作对应的模型输出token;
- 过程感知优势分配:除最终任务总分,对无效工具调用、重复报错、格式错误施加过程惩罚权重,仅抑制正向优势,不破坏失败样本学习信号。
4.3.2 智能体任务两大数据源
- 开源代码/终端任务集(归一化为统一执行环境+自动验证器)
| 数据集 | 任务数量 | 环境数量 |
|--------|----------|----------|
| SWE-smith | 59136 | 222 |
| SWE-Gym | 2438 | 2401 |
| R2E-Gym-V1 | 7480 | 8101 |
| SWE-rebench-V2 | 32100 | 32075 |
| Scale-SWE | 20200 | 19472 |
| Nemotron-Terminal-Synthetic | 80000 | 8 |
| ClawGym-Task | 13500 | 1 | - 自演化任务合成系统
- 社区技能构建状态图,兼容技能路径组合生成长短时序任务;
- 分层校验:语法校验→语义校验→执行可用性校验;
- 线上执行失败数据回流,动态调整技能采样权重,持续扩充任务难度与覆盖度。
4.3.3 验证器防泄漏机制
隔离打分环境与智能体运行环境,Gold测试用例、补丁、标准答案仅打分阶段加载,智能体运行阶段不可见,杜绝奖励黑客行为。
4.4 在线策略蒸馏 OPD(最终融合阶段)
分开训练两大专家策略:推理专家(通用+科学推理RL)、智能体专家(工具交互RL),通过OPD融合为统一主干模型。
- 前置预热:先用两大专家生成轨迹轻量SFT,缩小师生分布差异;
- 优化目标最小化学生到教师KL散度,仅传递采样token对数概率,不传输完整词表logit,大幅降低通信开销;
- 复用RL的截断重要性权重、BKL数值掩码,训练链路与前面推理RL完全复用基础设施。
5 模型评测实验
评测分为科学专项基准、多模态基准、智能体工具基准、通用能力基准、时序专项基准五大类,对比Qwen3.5-397B、DeepSeek-V4、GPT-5.5、Gemini-3.1-Pro、Claude Opus等主流开源/闭源模型。
5.1 评测基准全集
5.1.1 科学文本基准
Biology-Instructions、Mol-Instructions、MolecularIQ、SciReasoner、TOMG-Bench、MP20、ProteinBinder-9
5.1.2 科学多模态基准
XLRS-Bench(遥感)、MicroVQA(显微图像)、SFE(综合科学VQA)、ObsCrisis-Bench(气象灾害卫星图)
5.1.3 科学智能体基准
SciCode(科研代码)、SGI-Bench(全流程科研智能)、ResearchClawBench(自动复现论文实验)
5.1.4 通用&多模态通用基准
MMLU-Pro、SimpleQA-Verified、AdvancedIF、HMMT-2026竞赛数学、MMMU-Pro、ChartQAPro
5.1.5 代码/终端智能体基准
SkillsBench、Terminal-Bench 2.1、SWE-Bench Pro、多语言SWE、WildClawBench
5.1.6 时序专项基准
SciTS(时序理解+时序预测)、GIFT-Eval(通用时序零样本预测)
5.2 核心基准关键结果
5.2.1 科学基准核心优势
- 开源模型SOTA:Biology-Instructions(56.92)、Mol-Instructions(52.37)、SciReasoner(63.97);
- 分子/材料专项:MolecularIQ、TOMG-Bench、MP20、ProteinBinder-9开源最优;
- 遥感、显微多模态:XLRS-Bench、MicroVQA超越所有同规模开源模型。
5.2.2 通用能力
MMLU-Pro 89.75、MMMU-Pro 80.46、ChartQAPro 69.65,397B开源模型第一梯队。
5.2.3 时序模块消融实验
- SciTS时序理解:全面超越GPT、Gemini通用文本/多模态模型,对比Intern-S1(万亿参数)多数任务指标提升;
- SciTS时序预测:专用数值预测分支效果优于Moirai、TimeMoE、Chronos等独立时序基础模型,MAPE更低、100%预测成功率;零样本通用时序GIFT-Eval MASE=0.785。
5.2.4 Memory Decoder消融实验
仅外挂4B生物学记忆模块,Biology-Instructions平均分提升3.4分,MMLU、Mol-Instructions、显微VQA等跨领域性能几乎无衰减,验证模块化领域增强无对齐损失。
6 总结与未来工作
6.1 本文核心贡献
- 提出 Intern-S2-Preview-397B 科学智能体基础模型,完整覆盖多模态科学理解、数值时序建模、长时序工具交互科研全流程;
- 双模块化创新:原生升级时序编码预测分支、冻结主干可插拔Memory Decoder记忆扩展;
- 完整工业级训练流水线:可视化预训练、PDF图文数据管道、多任务稳定RL、大规模黑白盒智能体训练、在线蒸馏全套工程方案;
- 配套一整套训练加速与稳定优化:部分暂停恢复rollout、自适应长度正则、在线推测解码、GEPO多任务熵控制、过程感知智能体信用分配。
6.2 未来研究方向
- 更长跨度科研工作流可靠性优化;
- 扩充化学、材料、医学、地球科学专用Memory Decoder记忆模块;
- 强化科研任务自动验证器精度;
- 深度对接分子模拟、晶体计算、显微成像、遥感解译专业科研工具链。
开源资源汇总
- 论文原文:https://arxiv.org/html/2608.13505v1
- 模型权重:https://huggingface.co/internlm/Intern-S2-Preview
- 训练框架:XTuner、LMDeploy(https://github.com/InternLM/xtuner)
- 智能体开发框架:Lagent
- PDF解析工具:MinerU2.5-Pro
- 向量检索库:Milvus
- 支持智能体适配开源项目:OpenHands、Mini-SWE、OpenClaw等