一、模型速览
|-------|--------------------------------------------------------|
| 项目 | 信息 |
| 发布方 | 百川智能(Baichuan Inc.,中国) |
| 发布时间 | 2026-07-30(开源权重 + 技术报告) |
| 参数量 | 32B(稀疏 MoE:每 token 路由部分专家,约 3B 激活) |
| 上下文长度 | 原生 262,144 tokens(256K) |
| 许可证 | 百川开源协议 v2(允许商用,需署名 + 规模告知;比 Apache 多一条告知,比 OpenMDW 干净) |
| 模态 | 文本(中英强,中文尤佳;非多模态) |
| 定位 | 国产 32B 档 MoE,长上下文 + 中文/Agentic 私有化部署底座 |
一句话定位:Baichuan 5 32B-A3B 是百川用"32B 总参 + 3B 小激活 + 256K 长上下文"打造的国产 MoE,单卡 H100 能跑、中文与 Agentic 在 30B 档靠前,最适合要在国内合规框架下做长文档 Agent、又想用国产模型顶替海外同档(Qwen/Gemma/Nemotron)的团队。
二、核心亮点
- 3B 激活 / 32B 总参,把"国产小激活 MoE"压进单卡。Q4_0 量化约 19GB,单张 24GB 消费级卡(4090/3090)可跑、双卡更稳;BF16 约 64GB,单卡 H100 或双卡 24GB 也能服务(来源:百川官方模型卡 / Hugging Face 仓库)。激活参数与 Nemotron、Qwen 同档(均 ~3B),但总参更大(32B),容量更足。
- 256K 原生长上下文,国产长上下文基因。原生支持 256K,配合 GQA 与滑动窗口注意力,长文档/RAG/合同审阅场景稳(来源:Baichuan 5 技术报告)。对比 Mistral 4 22B 的 256K、Gemma 4 26B-A4B 的 256K,同属原生档;对比 Nemotron 的"理论 1M / 单卡 256K 封顶",Baichuan 标得更实诚。
- 中文与 Agentic 是它区别于海外同档的招牌。C-Eval / CMMLU 类中文基准显著强于同尺寸海外模型;SWE-bench Verified 53.0、IFBench 75.0,Agentic 编码接近 Nemotron、略低于 Qwen(来源:百川官方 model card 中文基准 + 社区复测汇总)。做中文客服、本地化 Agent、政务/金融内网时这是硬指标。
- 国产合规协议,比 OpenMDW 干净。百川开源协议 v2 允许商用,仅比 Apache-2.0 多一条"规模告知"义务,远没有 Nemotron 的 OpenMDW-1.1 那种规模/披露重条款;受国内数据合规要求的企业用着更顺(来源:百川官方许可页)。
三、部署实战
显存预算:BF16 全量约 64GB(单卡 H100 或双卡 24GB);Q4_K_M 约 28GB(单卡 48GB 或双 24GB);Q4_0 约 19GB(单卡 24GB 可跑)。Ollama 社区页已验证,生产优先官方 vLLM / SGLang。
3.1 环境准备与模型下载
bash
# 方式 A:Ollama(社区镜像,已验证页面,自动拉 Q4_K_M)
ollama run baichuan5:32b-a3b
# 方式 B:llama.cpp / GGUF(本地最省心,Q4_0 仅 ~19GB)
pip install -U "huggingface_hub[cli]"
hf download baichuan-inc/Baichuan-5-32B-A3B-GGUF \
--include "*Q4_0*" --local-dir ./baichuan5-32b-a3b-gguf
# 方式 C:vLLM(BF16 权重,单卡 H100 推荐)
pip install vllm
# 官方仓库:baichuan-inc/Baichuan-5-32B-A3B
3.2 启动本地推理服务
bash
# llama.cpp(Q4_0 ~19GB,单卡 24GB 可跑)
./llama-server \
-m ./baichuan5-32b-a3b-gguf/Baichuan-5-32B-A3B-Q4_0.gguf \
-c 262144 --host 0.0.0.0 --port 8080
# vLLM(单卡 H100,BF16)
vllm serve baichuan-inc/Baichuan-5-32B-A3B \
--tensor-parallel-size 1 \
--max-model-len 262144 \
--port 8000
3.3 推理代码(复制即跑,OpenAI 兼容工具调用 / Agent)
python
# pip install openai
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8080/v1", api_key="EMPTY") # vLLM 用 :8000
# 同一套 Agent 工作流,换 model 即可在中外同档模型间横评
tools = [{
"type": "function",
"function": {
"name": "query_orders",
"description": "按用户 ID 查询最近订单",
"parameters": {
"type": "object",
"properties": {"user_id": {"type": "string"}},
"required": ["user_id"],
},
},
}]
resp = client.chat.completions.create(
model="baichuan5:32b-a3b",
messages=[{"role": "user",
"content": "帮我查一下用户 U12345 的最近三笔订单,并总结金额趋势。"}],
tools=tools,
tool_choice="auto",
max_tokens=1024,
)
msg = resp.choices[0].message
if msg.tool_calls:
print("模型请求调用工具:", msg.tool_calls[0].function.name,
msg.tool_calls[0].function.arguments)
else:
print(msg.content)
3.4 效果验证
bash
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "baichuan5:32b-a3b",
"messages": [{"role": "user", "content": "用一句话解释 MoE 在这里如何降低推理成本。"}],
"max_tokens": 256
}'
# 成功标志:HTTP 200,choices[0].message.content 为连贯回答(或含 tool_calls)
⚠️ 避坑提醒
- MoE 显存看全量不是激活:激活 3B 但 32B 权重全量需载入,BF16 64GB;单卡 24GB 必须用 Q4_0 / Q4_K_M 量化。
- Ollama 是社区镜像:页面已验证但非百川官方;要可复现生产部署用官方 vLLM / SGLang 配方。
- 百川协议 v2 要署名 + 规模告知:商用前留好声明,大规模(如月活阈值)需告知百川,比 Apache 多一步但比 OpenMDW 省心。
- 非多模态:纯文本模型,图文需求选百川多模态兄弟版或 Qwen3.8-27B。
四、性能测评
4.1 推理速度与显存表
|-----------------|------------------------|----------------------|
| 指标 | 数值 | 来源 |
| 总参 / 激活 | 32B / 3B per token | 百川官方模型卡 |
| GGUF Q4_0 体积 | ~19 GB | Hugging Face 社区 GGUF |
| GGUF Q4_K_M 体积 | ~28 GB | Hugging Face 社区 GGUF |
| BF16 体积 | ~64 GB | 百川官方 |
| 本地最低 VRAM(Q4_0) | 24 GB(可跑,留 offload 余量) | 社区估算 |
| 上下文 | 256K 原生 | Baichuan 5 技术报告 |
| 许可 | 百川开源协议 v2(商用需署名+告知) | 百川官方 |
说明:本机未实测吞吐;上表速度相关项为官方/社区口径,真实 tok/s 依赖 GPU、并发与量化配置,请以你的硬件实测为准。
4.2 生成质量分维度(百川官方评测 harness,厂商自报)
|----------|--------------------|------|-----------------|
| 维度 | 指标 | 得分 | 来源 |
| 知识 | MMLU Pro | 83.0 | 百川官方 model card |
| 科学推理 | GPQA Diamond | 74.0 | 百川官方 model card |
| 软件工程 | SWE-bench Verified | 53.0 | 百川官方 model card |
| 工具调用 | PinchBench | 87.0 | 百川官方 model card |
| Agentic | IFBench | 75.0 | 社区复测汇总 |
| 终端 Agent | Terminal-Bench 2.1 | 45.0 | 社区复测汇总 |
| 中文综合 | C-Eval / CMMLU 均值 | 92.0 | 百川官方 model card |
4.3 同档模型对比表
|--------------------------------|------------------|-------------|-------------|----------|--------------------|--------------|------------|
| 模型 | 参数/激活 | 上下文 | 许可 | MMLU Pro | SWE-bench Verified | GPQA Diamond | PinchBench |
| Baichuan 5 32B-A3B | 32B / 3B | 256K | 百川 v2 | 83.0 | 53.0 | 74.0 | 87.0 |
| Qwen3.6-35B-A3B | 35B / 3B | 256K(1M 外推) | Apache-2.0 | 84.5 | 58.3 | 78.2 | 88.1 |
| Gemma 4 26B-A4B | 26B / 4B | 256K | Apache-2.0 | 80.1 | 44.0 | 68.5 | 82.0 |
| Nemotron 3.5 Lightning 30B-A3B | 30B / 3B | 256K(1M 理论) | OpenMDW-1.1 | 81.94 | 51.56 | 75.44 | 85.37 |
| Mistral 4 22B | 22B / 22B(dense) | 256K | Apache-2.0 | 82.0 | 49.5 | 72.0 | 86.0 |
注:Qwen / Gemma / Nemotron / Mistral 数据分别来自本系列同日两篇(Qwen、Gemma 官方)、2026-09-17 那篇(NVIDIA 官方)与同日第三篇(Mistral 官方)。基准多为厂商自报,第三方独立复测有限。
结论:32B 档里 Baichuan 5 32B-A3B 的最大卖点是"国产 + 3B 小激活 + 256K 原生长上下文 + 中文/Agentic 强",是海外同档(Qwen/Gemma/Nemotron)的国产替代优选;SWE-bench Verified 53.0 高于 Nemotron 的 51.56、低于 Qwen 的 58.3,编码略逊于最强同档。选型看 workload------要国产合规 + 长上下文中文 Agent 选 Baichuan 5;要最强同档推理选 Qwen;要单卡极致长程 Agent 选 Nemotron;要最省显存欧语多语选 Mistral 4 22B。
五、使用建议
适用场景
- 国内合规框架下的私有化部署:百川协议 v2 比 OpenMDW 干净,受数据合规要求的企业用着顺。
- 长文档 / RAG / 合同审阅:256K 原生上下文,中文长文理解稳。
- 中文客服 / 本地化 Agent:C-Eval / CMMLU 92.0,母语级中文能力。
- 单卡 H100 / 双卡 24GB 跑长上下文 Agent:3B 激活让显存和延迟可控。
不适用场景
- 追求"理论 1M 上下文":原生 256K,无 YaRN 1M 路径(要外推需自行配置)。
- 多模态需求:纯文本,图文选百川多模态版或 Qwen3.8-27B。
- 替代选型:最强 30B 推理选 Qwen3.6-35B-A3B;单卡长程 Agent 选 Nemotron 3.5 Lightning;最省合规选 Gemma 4 26B-A4B。
调优提示
- 精度按显卡选:单卡 24GB 用 Q4_0(~19GB);双 24GB / 单 48GB 用 Q4_K_M(~28GB);单卡 80GB 用 BF16。
- 开投机解码:vLLM / llama.cpp 支持草稿头,高并发吞吐提升明显。
- 上下文按 256K 填:原生支持,长会话靠 GQA 控 KV Cache。
- 合规留声明:商用前按百川协议 v2 加署名,跨规模阈值记得告知。
数据来源说明 :本文性能数据来自百川官方 model card(Hugging Face baichuan-inc/Baichuan-5-32B-A3B)、Baichuan 5 技术报告与开源协议 v2 说明,以及 Hugging Face 社区 GGUF 仓库与社区复测汇总;同档对照的 Qwen3.6-35B-A3B、Gemma 4 26B-A4B、Nemotron 3.5 Lightning 与 Mistral 4 22B 数据分别来自本系列同日两篇(Qwen、Gemma 官方)、2026-09-17 那篇(NVIDIA 官方)与同日第三篇(Mistral 官方)。基准多为厂商自报,第三方独立复测有限,请以独立复测为准。本文未做本机实测,所有速度/显存为官方与社区口径,实际部署请以你的硬件为准。