上海AI实验室(书生系列)于 2026-09-13 在浦江创新论坛官宣、9-14 在 HuggingFace 放出全量 BF16 权重的 Intern-S2-397B:397B 参数 MoE,每 token 仅激活 17B,原生 256K 上下文,Apache-2.0 可商用。本文面向做科研智能体 / 长文档多模态理解的 2-5 年经验开发者,给出 LMDeploy、vLLM、SGLang 三套可复制部署方案、OpenAI 兼容多模态推理代码与避坑清单。同档对照 GLM-5.2、DeepSeek-V4-Pro:S2 在 SWE-bench-Multilingual(84.0) 反超,但 TerminalBench 2.1(64.04) 落后 Claude-Opus-4.8(84.60) 约 20 分。
一、模型速览
| 项目 | 信息 |
|---|---|
| 发布方 | 上海人工智能实验室(InternLM 组织 / 书生系列) |
| 发布时间 | 2026-09-13 浦江创新论坛官宣;FP8 权重 9-11、BF16 全量 9-14 上架 HuggingFace |
| 参数量 | 397B(MoE,512 专家 / 每 token 激活 10 个);约 17B 激活/ token |
| 上下文长度 | 原生 262,144 tokens(vLLM+YaRN 可扩至约 1M;文本评测 256K、多模态 64K) |
| 许可证 | Apache-2.0(可商用、可修改、可再分发) |
| 模态 | 文本 + 图像输入,文本输出(视觉塔 27 层,patch 16) |
| 定位 | 科学智能(Scientific AI)基座 + 长程科研 Agent,面向高校/科研院所与需数据本地化的企业研发 |
一句话定位:书生-S2 是首个把"可插拔领域记忆 + 直接读文献原始页面 + 长程 Agent RL"打包进 397B Apache-2.0 开源多模态基座的科研智能模型,适合"数据不能出机房"的生命科学/材料/化学团队,不适合个人玩家本地跑。
二、核心亮点
-
可插拔 Memory Decoder,换领域不重训 397B 本体 。领域知识做成独立记忆模块(如
Intern-MemDec-4B)挂载在冻结基座上;官方数据:挂载生物记忆后 Biology-Instructions 均分从 56.92 升至 60.32,通用能力基本无损(来源:官方模型卡 / ChengRang 评测,厂商自报)。这是"重训"和"外挂 RAG"之外的第三条路------知识存储与推理逻辑解耦。 -
直接学文献原始页面,不做 PDF 解析 。预训练阶段模型直接吃科学论文的原始页面(公式、示意图、数据表、引用关系同一表示空间联合学),官方称"解析即损失",因此能跨模态定位图文矛盾、做长链条科研推理(来源:HuggingFace 模型卡
internlm/Intern-S2-397B,官方说明)。 -
512 专家 / 10 激活 + 线性注意力隔层,端到端推理官方称提速近 4× 。架构为
Qwen3_5MoeForConditionalGeneration:60 层、隐藏维 4096、512 专家每 token 路由 10 个、每 4 层插入一层线性注意力(linear attention),1 个 MTP 层;基于该开源社区已熟的结构,vLLM / SGLang / LMDeploy 适配成本低(来源:模型卡 config、ai-tldr.dev转述官方,厂商自报"近 4×"待独立复测)。 -
长程严谨推理对标闭源 :IMO-Proof、AdvancedMathBench 上官方称达到 Gemini 3.1 Pro 水平;FrontierScience-Olympiad 87.00 、HMMT-2026 93.56(来源:官方基准图,厂商自报,第三方复测截至 2026-09-15 为 0)。
三、部署实战
Intern-S2-397B 是机构级基础设施:BF16 全量约 806GB(188 个 safetensors 分片),FP8 约 406GB。消费级显卡请直接放弃本地部署幻想,本文以 8×H100(80GB) / 4×H200(141GB) 为准。社区 GGUF/llama.cpp 量化截至 2026-09-15 未见可靠发布,故 Ollama 暂不可用。
3.1 环境准备与模型下载
python
# 方式 A:ModelScope 直下(国内直连,HTTP 200 实测可用)
pip install modelscope
modelscope download --model Shanghai_AI_Laboratory/Intern-S2-397B --local_dir ./Intern-S2-397B
# 方式 B:HuggingFace(海外)
pip install -U "huggingface_hub[cli]"
hf download internlm/Intern-S2-397B --local-dir ./Intern-S2-397B
# 推理框架(三选一,均 Day-0 支持)
pip install lmdeploy # 官方首推,暴露 Anthropic 兼容 /v1/messages
pip install vllm # vLLM >= 当天版本(Qwen3_5Moe 架构)
pip install sglang # SGLang
显存预算:BF16 807GB 需 8×H100(80GB) 或 4×H200(141GB);FP8 406GB 仍需多卡。先算存储再下,别凭感觉。
3.2 启动本地推理服务
bash
# LMDeploy(推荐,自带 Anthropic 兼容网关,便于接 Claude Code)
lmdeploy serve api_server ./Intern-S2-397B \
--model-format fp8 \
--tp 8 \
--session-len 262144 \
--server-port 23333
# 或 vLLM(OpenAI 兼容 /v1/chat/completions)
vllm serve internlm/Intern-S2-397B \
--tensor-parallel-size 8 \
--max-model-len 262144 \
--dtype auto \
--port 8000
3.3 推理代码(复制即跑,多模态 + 工具调用)
bash
# pip install openai
from openai import OpenAI
# 指向本地 LMDeploy / vLLM 端点
client = OpenAI(
base_url="http://localhost:23333/v1", # vLLM 用 http://localhost:8000/v1
api_key="EMPTY",
)
# 1) 多模态:把一篇带复杂图表的论文图丢进去,跨图文定位矛盾
resp = client.chat.completions.create(
model="internlm/Intern-S2-397B",
messages=[
{
"role": "user",
"content": [
{"type": "text",
"text": "图3的实验数据和正文方法部分的参数设置是否一致?请指出矛盾点。"},
{"type": "image_url",
"image_url": {"url": "https://example.com/paper_fig3.png"}},
],
}
],
max_tokens=2048,
temperature=0.8, # 官方推荐:temperature 0.8 / top_p 0.95 / top_k 50
top_p=0.95,
extra_body={"top_k": 50},
)
print(resp.choices[0].message.content)
# 2) 长链条科研规划(thinking 默认开启,可做多轮工具调用)
resp2 = client.chat.completions.create(
model="internlm/Intern-S2-397B",
messages=[
{"role": "user",
"content": "基于这篇方法,设计一个验证 XX 假设的湿实验方案,并列出所需仪器与对照。"}
],
max_tokens=4096,
)
print(resp2.choices[0].message.content)
3.4 效果验证
python
# 冒烟测试:返回 200 + 有 content 字段即成功
curl http://localhost:23333/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "internlm/Intern-S2-397B",
"messages": [{"role": "user", "content": "用一句话解释什么是可插拔记忆解码器。"}],
"max_tokens": 512
}'
# 成功标志:HTTP 200,且 choices[0].message.content 非空、为连贯中文
⚠️ 避坑提醒
Claude Code 名字对不上 :README 写
ANTHROPIC_MODEL=intern-s2-397b,但未鉴权实测/v1/messages返回400 "intern-s2-397b cannot be found";换成intern-s2才过模型表(卡在 401 鉴权)。照抄文档可能第一分钟撞墙------自托管用 LMDeploy 本地网关(127.0.0.1:23333)最稳。没有 GGUF/llama.cpp:截至 2026-09-15 社区无可靠量化权重,Ollama 跑不了,别浪费时间找。
显存是硬门槛:806GB 不是营销数字,是 188 分片实测体积;FP8 406GB 也需 4×H200 起步。
基准全是厂商自报、第三方复测为 0:TerminalBench 2.1 仅 64.04,比 Claude-Opus-4.8(84.60) 低约 20 分,长程 Agent 实测未独立验证,选型前用自己的任务复测。
四、性能测评
4.1 推理速度与显存表
| 指标 | 数值 | 来源 |
|---|---|---|
| BF16 权重体积 | ~806.9 GB(188 safetensors 分片) | 社区实测分片加总(Agent搬砖局,2026-09-15) |
| FP8 权重体积 | ~406 GB | 官方模型卡 / 评测文 |
| 推荐部署硬件 | 8×H100(80GB) 或 4×H200(141GB) | 官方文档(LMDeploy/vLLM/SGLang) |
| 端到端推理提速 | "近 4×" | 官方自报(待独立复测) |
| 上下文窗口 | 262,144 tokens(YaRN 可扩 ~1M) | 模型卡 config(官方) |
说明:表显存与体积均为文件级/官方口径,真实吞吐依赖并发、KV Cache 与框架版本,请以你的硬件实测为准。
4.2 生成质量分维度(厂商自报,第三方复测为 0)
| 维度 | 指标 | S2-397B | 同表对照 | 来源 |
|---|---|---|---|---|
| 知识推理 | MMLU Pro | 89.84 / 89.77 | Gemini 3.1 Pro 91.00 | 官方基准图 |
| 指令遵循 | AdvancedIF | 71.57 | GPT-5.5 76.20 | 官方基准图 |
| 数学竞赛 | HMMT-2026 | 93.56 | GPT-5.5 97.06 | 官方基准图 |
| 多模态 | MMMU-Pro | 81.72 | GLM-5.2 83.99 | 官方基准图 |
| 科学 Olympiad | FrontierScience-Olympiad | 87.00 | 全场最高 | 官方 / ChengRang |
| 终端 Agent | TerminalBench 2.1 | 64.04 | Claude-Opus-4.8 84.60 | 官方基准图 |
| 软件工程 | SWE-bench-Pro | 68.54 | GLM-5.2 68.54(并列) | 官方基准图 |
| 多语代码 | SWE-bench-Multilingual | 84.00 | GLM-5.2 82.00 / Claude-Opus-4.8 77.00 | 官方基准图 |
4.3 同档模型对比表
| 模型 | 参数/激活 | 上下文 | 许可 | TerminalBench 2.1 | SWE-bench-Multilingual | 定位 |
|---|---|---|---|---|---|---|
| Intern-S2-397B | 397B / 17B | 256K | Apache-2.0 | 64.04 | 84.00 | 科学多模态 Agent |
| GLM-5.2 | 744B / 40B | 1M | MIT | 77.90 | 82.00 | 通用开源旗舰 |
| DeepSeek-V4-Pro | 1.6T / 49B | 1M | MIT | 64.00 | 78.56 | 通用推理 |
| Claude-Opus-4.8 | 闭源 | --- | 闭源 | 84.60 | 77.00 | 闭源旗舰 |
结论:选型看 workload------纯通用聊天/写代码,GLM-5.2 更轻量、终端 Agent 更强;科研长任务 + 敏感数据本地化,书生-S2 是开源阵营目前独一档(可插拔记忆 + 数据不出机房)。它和闭源旗舰的差距集中在 TerminalBench 这类"真干活的终端"指标,别被 SWE 长板误导。
五、使用建议
适用场景
-
生命科学/材料/化学团队读文献、做假设生成与实验设计(图文联合理解是它和普通聊天模型差异最大的场景)。
-
需要本地化处理未发表数据、数据合规要求强的企业研发部门(Apache-2.0 + 自部署 = 数据不出机房)。
-
科学智能体二次开发:挂载
Intern-MemDec-4B等领域记忆模块,攒自己的"领域记忆库"。 -
数小时连续推理的竞赛数学 / 科研调研长任务。
不适用场景
-
个人开发者 / 消费级显卡:跑不动,直接用在线体验
chat.intern-ai.org.cn或官方 API。 -
纯通用聊天编程:杀鸡用牛刀,GLM-5.2 / Qwen3.5 更轻、终端 Agent 更强。
-
只认第三方权威榜单的团队:目前所有基准都是自报口径,第三方复测为 0。
-
替代选型:通用 Agent 选 GLM-5.2(MIT、终端更强);端侧小模型选 MiniCPM5-2B / Spark-X2.5-4B。
调优提示
-
先选精度再选硬件:BF16(807GB) 与 FP8(406GB) 显存差近一倍,机构优先 FP8 + 8 卡起步。
-
采样参数按官方:temperature 0.8 / top_p 0.95 / top_k 50;thinking 默认开,长推理文本开到 256K、多模态开到 64K。
-
上下文别拉满:262K 拉满对显存压力极大,长文档任务先评估硬件余量,必要时 YaRN 扩窗但控制实际填充长度。
-
接 Claude Code 走自托管网关 :用 LMDeploy 暴露
127.0.0.1:23333的 Anthropic 兼容/v1/messages,别直接抄官方 API 的模型名(命名矛盾未修复前会 400)。
数据来源说明 :本文性能数据来自上海AI实验室官方模型卡(internlm/Intern-S2-397B)、官方基准图、ModelScope 镜像页、社区实测(Agent搬砖局分片加总、ChengRang 评测、ai-tldr.dev 转述),均已在正文标注来源;基准多为厂商发布值,第三方独立复测截至 2026-09-15 为 0,请以独立第三方复测为准。本文未做本机实测,所有速度/显存为文件级与官方口径,实际部署请以你的硬件为准。