开源大模型前沿:科研智能体——Intern-S2-397B ,本地可跑的科学文献 Agent

上海AI实验室(书生系列)于 2026-09-13 在浦江创新论坛官宣、9-14 在 HuggingFace 放出全量 BF16 权重的 Intern-S2-397B:397B 参数 MoE,每 token 仅激活 17B,原生 256K 上下文,Apache-2.0 可商用。本文面向做科研智能体 / 长文档多模态理解的 2-5 年经验开发者,给出 LMDeploy、vLLM、SGLang 三套可复制部署方案、OpenAI 兼容多模态推理代码与避坑清单。同档对照 GLM-5.2、DeepSeek-V4-Pro:S2 在 SWE-bench-Multilingual(84.0) 反超,但 TerminalBench 2.1(64.04) 落后 Claude-Opus-4.8(84.60) 约 20 分。


一、模型速览

项目 信息
发布方 上海人工智能实验室(InternLM 组织 / 书生系列)
发布时间 2026-09-13 浦江创新论坛官宣;FP8 权重 9-11、BF16 全量 9-14 上架 HuggingFace
参数量 397B(MoE,512 专家 / 每 token 激活 10 个);约 17B 激活/ token
上下文长度 原生 262,144 tokens(vLLM+YaRN 可扩至约 1M;文本评测 256K、多模态 64K)
许可证 Apache-2.0(可商用、可修改、可再分发)
模态 文本 + 图像输入,文本输出(视觉塔 27 层,patch 16)
定位 科学智能(Scientific AI)基座 + 长程科研 Agent,面向高校/科研院所与需数据本地化的企业研发

一句话定位:书生-S2 是首个把"可插拔领域记忆 + 直接读文献原始页面 + 长程 Agent RL"打包进 397B Apache-2.0 开源多模态基座的科研智能模型,适合"数据不能出机房"的生命科学/材料/化学团队,不适合个人玩家本地跑。

二、核心亮点

  1. 可插拔 Memory Decoder,换领域不重训 397B 本体 。领域知识做成独立记忆模块(如 Intern-MemDec-4B)挂载在冻结基座上;官方数据:挂载生物记忆后 Biology-Instructions 均分从 56.92 升至 60.32,通用能力基本无损(来源:官方模型卡 / ChengRang 评测,厂商自报)。这是"重训"和"外挂 RAG"之外的第三条路------知识存储与推理逻辑解耦。

  2. 直接学文献原始页面,不做 PDF 解析 。预训练阶段模型直接吃科学论文的原始页面(公式、示意图、数据表、引用关系同一表示空间联合学),官方称"解析即损失",因此能跨模态定位图文矛盾、做长链条科研推理(来源:HuggingFace 模型卡 internlm/Intern-S2-397B,官方说明)。

  3. 512 专家 / 10 激活 + 线性注意力隔层,端到端推理官方称提速近 4× 。架构为 Qwen3_5MoeForConditionalGeneration:60 层、隐藏维 4096、512 专家每 token 路由 10 个、每 4 层插入一层线性注意力(linear attention),1 个 MTP 层;基于该开源社区已熟的结构,vLLM / SGLang / LMDeploy 适配成本低(来源:模型卡 config、ai-tldr.dev 转述官方,厂商自报"近 4×"待独立复测)。

  4. 长程严谨推理对标闭源 :IMO-Proof、AdvancedMathBench 上官方称达到 Gemini 3.1 Pro 水平;FrontierScience-Olympiad 87.00 、HMMT-2026 93.56(来源:官方基准图,厂商自报,第三方复测截至 2026-09-15 为 0)。

三、部署实战

Intern-S2-397B 是机构级基础设施:BF16 全量约 806GB(188 个 safetensors 分片),FP8 约 406GB。消费级显卡请直接放弃本地部署幻想,本文以 8×H100(80GB) / 4×H200(141GB) 为准。社区 GGUF/llama.cpp 量化截至 2026-09-15 未见可靠发布,故 Ollama 暂不可用。

3.1 环境准备与模型下载

python 复制代码
# 方式 A:ModelScope 直下(国内直连,HTTP 200 实测可用)
pip install modelscope
modelscope download --model Shanghai_AI_Laboratory/Intern-S2-397B --local_dir ./Intern-S2-397B
​
# 方式 B:HuggingFace(海外)
pip install -U "huggingface_hub[cli]"
hf download internlm/Intern-S2-397B --local-dir ./Intern-S2-397B
​
# 推理框架(三选一,均 Day-0 支持)
pip install lmdeploy        # 官方首推,暴露 Anthropic 兼容 /v1/messages
pip install vllm            # vLLM >= 当天版本(Qwen3_5Moe 架构)
pip install sglang          # SGLang

显存预算:BF16 807GB 需 8×H100(80GB) 或 4×H200(141GB);FP8 406GB 仍需多卡。先算存储再下,别凭感觉。

3.2 启动本地推理服务

bash 复制代码
# LMDeploy(推荐,自带 Anthropic 兼容网关,便于接 Claude Code)
lmdeploy serve api_server ./Intern-S2-397B \
  --model-format fp8 \
  --tp 8 \
  --session-len 262144 \
  --server-port 23333
​
# 或 vLLM(OpenAI 兼容 /v1/chat/completions)
vllm serve internlm/Intern-S2-397B \
  --tensor-parallel-size 8 \
  --max-model-len 262144 \
  --dtype auto \
  --port 8000

3.3 推理代码(复制即跑,多模态 + 工具调用)

bash 复制代码
# pip install openai
from openai import OpenAI
​
# 指向本地 LMDeploy / vLLM 端点
client = OpenAI(
    base_url="http://localhost:23333/v1",  # vLLM 用 http://localhost:8000/v1
    api_key="EMPTY",
)
​
# 1) 多模态:把一篇带复杂图表的论文图丢进去,跨图文定位矛盾
resp = client.chat.completions.create(
    model="internlm/Intern-S2-397B",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text",
                 "text": "图3的实验数据和正文方法部分的参数设置是否一致?请指出矛盾点。"},
                {"type": "image_url",
                 "image_url": {"url": "https://example.com/paper_fig3.png"}},
            ],
        }
    ],
    max_tokens=2048,
    temperature=0.8,   # 官方推荐:temperature 0.8 / top_p 0.95 / top_k 50
    top_p=0.95,
    extra_body={"top_k": 50},
)
print(resp.choices[0].message.content)
​
# 2) 长链条科研规划(thinking 默认开启,可做多轮工具调用)
resp2 = client.chat.completions.create(
    model="internlm/Intern-S2-397B",
    messages=[
        {"role": "user",
         "content": "基于这篇方法,设计一个验证 XX 假设的湿实验方案,并列出所需仪器与对照。"}
    ],
    max_tokens=4096,
)
print(resp2.choices[0].message.content)

3.4 效果验证

python 复制代码
# 冒烟测试:返回 200 + 有 content 字段即成功
curl http://localhost:23333/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "internlm/Intern-S2-397B",
    "messages": [{"role": "user", "content": "用一句话解释什么是可插拔记忆解码器。"}],
    "max_tokens": 512
  }'
# 成功标志:HTTP 200,且 choices[0].message.content 非空、为连贯中文

⚠️ 避坑提醒

  • Claude Code 名字对不上 :README 写 ANTHROPIC_MODEL=intern-s2-397b,但未鉴权实测 /v1/messages 返回 400 "intern-s2-397b cannot be found";换成 intern-s2 才过模型表(卡在 401 鉴权)。照抄文档可能第一分钟撞墙------自托管用 LMDeploy 本地网关(127.0.0.1:23333)最稳。

  • 没有 GGUF/llama.cpp:截至 2026-09-15 社区无可靠量化权重,Ollama 跑不了,别浪费时间找。

  • 显存是硬门槛:806GB 不是营销数字,是 188 分片实测体积;FP8 406GB 也需 4×H200 起步。

  • 基准全是厂商自报、第三方复测为 0:TerminalBench 2.1 仅 64.04,比 Claude-Opus-4.8(84.60) 低约 20 分,长程 Agent 实测未独立验证,选型前用自己的任务复测。

四、性能测评

4.1 推理速度与显存表

指标 数值 来源
BF16 权重体积 ~806.9 GB(188 safetensors 分片) 社区实测分片加总(Agent搬砖局,2026-09-15)
FP8 权重体积 ~406 GB 官方模型卡 / 评测文
推荐部署硬件 8×H100(80GB) 或 4×H200(141GB) 官方文档(LMDeploy/vLLM/SGLang)
端到端推理提速 "近 4×" 官方自报(待独立复测)
上下文窗口 262,144 tokens(YaRN 可扩 ~1M) 模型卡 config(官方)

说明:表显存与体积均为文件级/官方口径,真实吞吐依赖并发、KV Cache 与框架版本,请以你的硬件实测为准。

4.2 生成质量分维度(厂商自报,第三方复测为 0)

维度 指标 S2-397B 同表对照 来源
知识推理 MMLU Pro 89.84 / 89.77 Gemini 3.1 Pro 91.00 官方基准图
指令遵循 AdvancedIF 71.57 GPT-5.5 76.20 官方基准图
数学竞赛 HMMT-2026 93.56 GPT-5.5 97.06 官方基准图
多模态 MMMU-Pro 81.72 GLM-5.2 83.99 官方基准图
科学 Olympiad FrontierScience-Olympiad 87.00 全场最高 官方 / ChengRang
终端 Agent TerminalBench 2.1 64.04 Claude-Opus-4.8 84.60 官方基准图
软件工程 SWE-bench-Pro 68.54 GLM-5.2 68.54(并列) 官方基准图
多语代码 SWE-bench-Multilingual 84.00 GLM-5.2 82.00 / Claude-Opus-4.8 77.00 官方基准图

4.3 同档模型对比表

模型 参数/激活 上下文 许可 TerminalBench 2.1 SWE-bench-Multilingual 定位
Intern-S2-397B 397B / 17B 256K Apache-2.0 64.04 84.00 科学多模态 Agent
GLM-5.2 744B / 40B 1M MIT 77.90 82.00 通用开源旗舰
DeepSeek-V4-Pro 1.6T / 49B 1M MIT 64.00 78.56 通用推理
Claude-Opus-4.8 闭源 --- 闭源 84.60 77.00 闭源旗舰

结论:选型看 workload------纯通用聊天/写代码,GLM-5.2 更轻量、终端 Agent 更强;科研长任务 + 敏感数据本地化,书生-S2 是开源阵营目前独一档(可插拔记忆 + 数据不出机房)。它和闭源旗舰的差距集中在 TerminalBench 这类"真干活的终端"指标,别被 SWE 长板误导。

五、使用建议

适用场景

  1. 生命科学/材料/化学团队读文献、做假设生成与实验设计(图文联合理解是它和普通聊天模型差异最大的场景)。

  2. 需要本地化处理未发表数据、数据合规要求强的企业研发部门(Apache-2.0 + 自部署 = 数据不出机房)。

  3. 科学智能体二次开发:挂载 Intern-MemDec-4B 等领域记忆模块,攒自己的"领域记忆库"。

  4. 数小时连续推理的竞赛数学 / 科研调研长任务。

不适用场景

  • 个人开发者 / 消费级显卡:跑不动,直接用在线体验 chat.intern-ai.org.cn 或官方 API。

  • 纯通用聊天编程:杀鸡用牛刀,GLM-5.2 / Qwen3.5 更轻、终端 Agent 更强。

  • 只认第三方权威榜单的团队:目前所有基准都是自报口径,第三方复测为 0。

  • 替代选型:通用 Agent 选 GLM-5.2(MIT、终端更强);端侧小模型选 MiniCPM5-2B / Spark-X2.5-4B。

调优提示

  1. 先选精度再选硬件:BF16(807GB) 与 FP8(406GB) 显存差近一倍,机构优先 FP8 + 8 卡起步。

  2. 采样参数按官方:temperature 0.8 / top_p 0.95 / top_k 50;thinking 默认开,长推理文本开到 256K、多模态开到 64K。

  3. 上下文别拉满:262K 拉满对显存压力极大,长文档任务先评估硬件余量,必要时 YaRN 扩窗但控制实际填充长度。

  4. 接 Claude Code 走自托管网关 :用 LMDeploy 暴露 127.0.0.1:23333 的 Anthropic 兼容 /v1/messages,别直接抄官方 API 的模型名(命名矛盾未修复前会 400)。


数据来源说明 :本文性能数据来自上海AI实验室官方模型卡(internlm/Intern-S2-397B)、官方基准图、ModelScope 镜像页、社区实测(Agent搬砖局分片加总、ChengRang 评测、ai-tldr.dev 转述),均已在正文标注来源;基准多为厂商发布值,第三方独立复测截至 2026-09-15 为 0,请以独立第三方复测为准。本文未做本机实测,所有速度/显存为文件级与官方口径,实际部署请以你的硬件为准。

相关推荐
墨心@1 小时前
实验 2-6 豆包版复现分析:Agent Skills 从论文生成演示文稿
自然语言处理·nlp·agent·智能体·datawhale共学
机械改造鹅1 小时前
拆解 prime-agent 系列——(2)Python runtime 与 kernel
agent
武子康1 小时前
Codex 后台任务结束了,为什么还不能直接接着用?
人工智能·llm·agent
DeepAgent2 小时前
AI Agent 入门指南(05):Agent 循环——观察、思考、行动
面试·agent
VIP_CQCRE4 小时前
把 Coze 接入 Ace Data Cloud:用 OpenAI Responses 协议快速扩展你的 AI Agent 模型能力
ai·大模型·agent·coze·acedatacloud
是Dream呀4 小时前
Harness 工程:让 Agent 真正把任务做完
人工智能·分布式·缓存·agent
Web3&Basketball5 小时前
Agent外传审计实战:3类失准事故拦截脚本
python·大模型·agent·性能调优·推理优化
武子康5 小时前
vLLM 的 token 预算还有余量,为什么请求仍被抢占?
人工智能·llm·agent
染指11106 小时前
120.Agent-LangChain核心组件-中间件-摘要中间件(SummarizationMiddleware)
人工智能·langchain·agent·agents