一、模型速览
|-------|--------------------------------------------------------------|
| 项目 | 信息 |
| 发布方 | 小米大模型团队(Xiaomi MiMo Team) |
| 发布时间 | 2026-09-21 HuggingFace 上权重;09-22 正式公告 |
| 参数量 | 1.02T 总参,每 token 激活 42B(384 路由专家 MoE,无共享专家);70 层 |
| 上下文长度 | 原生 1M tokens,最大输出 128K |
| 许可证 | MIT(可商用、可修改、可自托管,需署名) |
| 模态 | 原生全模态:文本 + 图像 + 视频 + 音频(MiMo ViT 681M / AudioTokenizer 308M) |
| 定位 | 开源权重第一的通用 Agent / 软件工程基座,主打"全模态 + 大规模 RL 后训练" |
一句话定位:MiMo-V2.6-Pro 是小米用"规模化强化学习 + 全模态"把开放权重模型第一次顶到 AA 综合智能指数第一的 1.02T MoE------能力对标闭源旗舰、协议最宽松的 MIT,适合有集群资源、要做长程 Agent / 代码智能体的团队,不适合个人本地跑。
二、核心亮点
- AA 开放权重指数第一,46 分登顶。Artificial Analysis Intelligence Index v4.3.2 上 Pro 拿 46,超过 GLM-5.3(45)、Kimi K3(44)、Grok 4.6(44)、Gemini 3.8 Flash(41)、DeepSeek V4.1 Flash(39),是当时 113 个同类模型里的开放权重第一(来源:Artificial Analysis / Fello AI / NewsBytes,第三方指数)。它赢的是"能下载回家自己折腾"这一栏,不是总榜。
- 70 层 SWA/GA 混合注意力,把 1M 上下文的 KV 成本压下来。70 层里 60 层用 128-token 滑窗注意力(SWA)、仅 10 层全局注意力承载长程依赖------这意味着长上下文服务的 KV Cache 远比"全全局"的万亿模型友好(来源:CSDN 架构拆解 / HuggingFace bucket 配置)。代价是 1M 窗口是"容量声明"而非"质量保证":86% 的层只看几百 token 窗口,超长距离检索需自己测。
- DFlash 投机解码,长文本生成加速可观 。仓库
dflash/里藏着一个 5 层 SWA 的 MTP 草稿模型(约 1.2GB),每次前向并行预测 7 个后续 token、主模型一次性验证;写代码 / 跑 Agent 这类长输出场景几乎是 SGLang 部署的必选项(来源:CSDN 架构拆解 / HuggingFace bucket 部署命令)。
- 大规模 RL 后训练,代码 Agent 跳一截。官方称 Pro 经 30 步大 RL、约 75 万条轨迹、不到 6 天训完(成本约 262 万美元);DeepSWE v1.1 上 Pro 从 48.8 升到 65.7、Flash 从 58.4 升到 72.6(来源:小米官方 / 新浪微博公告)。同步开源 7000+ RL 任务环境(verl / uni-agent / mini-swe-agent),是社区可复用的训练资产。
三、部署实战
先把一件事说清楚:小米只开源权重,不提供托管端点,推理基础设施要自备。Pro 是机房级------官方给的是多节点 SGLang 配方;Flash(309B/15B,FP8 ~310GB)更适合单机多卡起步。两套命令均来自官方模型卡 / 社区整理。
3.1 环境准备与模型下载
python
# Pro(约 3 倍 Flash 体量,下载量半 TB 级,先确认磁盘/带宽)
pip install -U "huggingface_hub[cli]"
hf download XiaomiMiMo/MiMo-V2.6-Pro-RL --local-dir ./mimo-v26-pro
# Flash(FP8 172.9GB,65 个分片,单机多卡起步更现实)
hf download XiaomiMiMo/MiMo-V2.6-Flash-RL --local-dir ./mimo-v26-flash
# 推理框架(均 Day-0 支持,需带 --trust-remote-code)
pip install vllm # vLLM >= 当天版
pip install sglang # SGLang
权重已含 FP8 量化配置(config.json 里
quant_method: fp8、MXFP4 存储),可直接降显存门槛;Pro 没有单独 FP8 仓库,靠权重内量化 + 多卡切分。
3.2 启动本地推理服务
bash
# 方案一:vLLM(单机 8 卡起步,Pro)
vllm serve XiaomiMiMo/MiMo-V2.6-Pro-RL \
--tensor-parallel-size 8 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--max-model-len auto \
--reasoning-parser mimo \
--tool-call-parser mimo \
--enable-auto-tool-choice \
--port 8000
# Flash 更轻:vLLM 4 卡即可
vllm serve XiaomiMiMo/MiMo-V2.6-Flash-RL \
--tensor-parallel-size 4 --trust-remote-code \
--reasoning-parser mimo --tool-call-parser mimo --port 8000
# 方案二:SGLang(Pro 官方配方:2 节点、tp16/dp2/ep16,专家并行 + DP-Attention)
sglang serve --trust-remote-code \
--model-path XiaomiMiMo/MiMo-V2.6-Pro-RL \
--tp 16 --dp 2 --enable-dp-attention --ep 16 \
--nnodes 2 --node-rank 0 --dist-init-addr 10.0.0.1:20000 \
--speculative-algorithm EAGLE --enable-multi-layer-eagle \
--reasoning-parser mimo --tool-call-parser mimo \
--host 0.0.0.0 --port 30000
3.3 推理代码(复制即跑,多模态 + 工具调用)
python
# pip install openai
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
# 1) 多模态:把一张架构图丢进去,跨图文理解(MiMo ViT 原生视觉)
resp = client.chat.completions.create(
model="XiaomiMiMo/MiMo-V2.6-Pro-RL",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这张图里的推理加速方案,核心机制是什么?用三点说明。"},
{"type": "image_url", "image_url": {"url": "https://example.com/arch.png"}},
],
}],
temperature=1.0, top_p=0.95, max_tokens=2048,
)
print(resp.choices[0].message.content)
# 2) 工具调用(Agent 场景,需服务端开 --tool-call-parser mimo)
tools = [{
"type": "function",
"function": {
"name": "run_tests",
"description": "运行指定路径的单元测试并返回结果",
"parameters": {
"type": "object",
"properties": {"path": {"type": "string"}},
"required": ["path"],
},
},
}]
resp2 = client.chat.completions.create(
model="XiaomiMiMo/MiMo-V2.6-Pro-RL",
messages=[{"role": "user",
"content": "帮我改一下 auth.py 的 token 校验逻辑,改完跑测试验证。"}],
tools=tools, tool_choice="auto", temperature=1.0, top_p=0.95,
)
if resp2.choices[0].message.tool_calls:
for c in resp2.choices[0].message.tool_calls:
print("调用:", c.function.name, c.function.arguments)
else:
print(resp2.choices[0].message.content)
3.4 效果验证
bash
curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"XiaomiMiMo/MiMo-V2.6-Pro-RL",
"messages":[{"role":"user","content":"用一句话解释什么是稀疏 MoE 的专家路由。"}],
"max_tokens":256}'
# 成功标志:HTTP 200,choices[0].message.content 为连贯回答
⚠️ 避坑提醒
- Pro 个人显卡跑不动:FP8 权重约 1TB,至少 8 卡 H100(80GB)才装得下权重、几乎无余量;想本地折腾用 Flash(FP8 ~310GB,4×80GB 或 2×141GB H200)或直接走官方 API / OpenRouter。
- 必须带两个 parser :vLLM/SGLang 都要
--reasoning-parser mimo --tool-call-parser mimo,否则 CoT 与工具调用格式解析不了,Agent 框架接不上。
- 长上下文是容量不是质量:60/70 层只有 128-token 滑窗,1M 窗口依赖 10 层全局注意力;用自己的文档在 100K / 500K / 1M 各测一遍 needle-in-haystack 再依赖。
- 工具调用重复是已知故障:小米自述 Agent 会反复发相似工具调用无进展,已在 Flash 上用 MOPD2 缓解;Pro 长任务建议加去重 / 步数上限。
- 基准几乎全是厂商自测:AA 指数是唯一独立锚点(测的是综合不是你的 workload),RL 归因声明暂无独立复现,选型前拿自己任务复测。
四、性能测评
4.1 推理速度与显存表
|----------------------|-----------------------------|-----------------------------|
| 指标 | 数值 | 来源 |
| Pro 总参 / 激活 | 1.02T / 42B | 官方模型卡 |
| Pro 权重体量 | ~0.5 TB 下载(FP8 内量化,约 1TB) | cnblogs 社区估算 |
| Pro 显存(BF16 / FP8) | ~2.0 TB / ~1.0 TB | iotdigitaltwinplm 估算(不含 KV) |
| Flash 权重(FP8) | 172.9 GB(65 分片) | 官方 / cnblogs |
| Flash 显存(BF16 / FP8) | ~620 GB / ~310 GB | iotdigitaltwinplm 估算 |
| 并行度要求 | Pro 8--16 路;Flash 至少 4 路 | Winbuzzer / 官方命令 |
| 官方推荐采样 | temperature=1.0, top_p=0.95 | 官方模型卡 |
说明:本机未实测;上表显存为参数×字节的估算(不含 KV Cache / 激活 / 框架开销),真实占用以你的硬件与上下文为准。
4.2 生成质量分维度
|------|------------------------------|-----------------|--------------------------|
| 维度 | 指标 | MiMo-V2.6-Pro | 来源 |
| 综合智能 | AA Intelligence Index v4.3.2 | 46(开放权重第一) | Artificial Analysis(第三方) |
| 软件工程 | DeepSWE v1.1 | 65.7(48.8→65.7) | 小米官方自测 |
| 代码竞技 | Code Arena WebDev(AutoEval) | 1628(开放权重第 3) | AutoEval |
| 训练规模 | RL 步数 / 轨迹 | 30 步 / ~75 万条 | 小米官方 |
4.3 同档模型对比表(AA 开放权重指数)
|---------------------|-------------|-----|-----|--------------|-----------|
| 模型 | 总参/激活 | 上下文 | 许可 | AA 指数 v4.3.2 | 定位 |
| MiMo-V2.6-Pro | 1.02T / 42B | 1M | MIT | 46 | 全模态 Agent |
| GLM-5.3 | --- / --- | 1M | 开放 | 45 | 通用开源旗舰 |
| Kimi K3 | --- / --- | 1M | 开放 | 44 | 长上下文 |
| DeepSeek V4.1-Flash | 552B / 13B | 1M | MIT | 39 | 高效性价比 |
注:AA 指数为第三方综合智能指数(Elo 加权),非单基准;GLM-5.3 / Kimi K3 / DeepSeek 数值来自各模型发布报道。MiMo 胜在"开放权重"栏,闭源旗舰(GPT-5.6、Claude Opus 5 等)综合分仍在它之前。
结论:选型看 workload------要"开放权重里最能打 + 全模态 + MIT 最松",MiMo-V2.6-Pro 目前是这一栏的标杆;但它吃集群、长上下文质量需自测,纯比单任务成本它反而贵(单任务 $0.13 vs 同档)。中小团队先用 Flash 或 API 验证价值,再决定是否上 Pro 集群。
五、使用建议
适用场景
- 有集群资源的团队做长程软件工程 Agent:DeepSWE v1.1 65.7 + 原生工具调用,配 OpenCode / Claude Code 类框架直接接管代码库。
- 全模态产品原型:文本/图/音视频一把抓,1M 上下文能吃整本手册,适合文档智能体与多模态助手。
- RL 研究:7000+ 开源 RL 环境 + 端到端训练框架(verl / uni-agent / mini-swe-agent),是社区稀缺的可复现资产。
- 对协议敏感的企业:MIT 可商用、可改、可自托管,比很多"看着开源其实藏限制"的友好。
不适用场景
- 个人 / 消费级显卡:Pro 装不下,Flash 也需多卡;真要本地用 9B 蒸馏版(MiMo-V2.6-Distill-Qwen-9B,实为 Qwen3.5-9B 监督微调,仅研究用、非生产)。
- 追求最低推理成本:单任务 $0.13 高于同档 DeepSeek;预算敏感选 DeepSeek V4.1-Flash(MIT、KV Cache 省 4×)。
- 超长文档精确检索:1M 是容量声明,长程质量先自测。
- 替代选型:全模态轻量选书生-S2;本地小模型选 MiniCPM5-2B / Spark-X2.5-4B。
调优提示
- 并行度按型号定:Pro 走 SGLang tp16/dp2/ep16 两节点,或 vLLM tp8;Flash 用 vLLM tp4 最省心。
- 必开 DFlash/EAGLE 投机解码:长输出加速明显,SGLang 部署几乎必选。
- 采样用官方值:temperature=1.0 / top_p=0.95,别套用其他模型的 0.7/0.8。
- 长上下文先缩后扩:max-model-len 先设 128K 验证稳定性,再往 1M 推,避免 prefill 超时与质量滑坡。
- Agent 加护栏:工具调用重复是已知问题,长任务务必加步数上限与去重逻辑。
数据来源说明 :本文性能与部署数据来自小米官方模型卡(HuggingFace XiaomiMiMo/MiMo-V2.6-Pro-RL、-Flash-RL)、Artificial Analysis 智能指数 v4.3.2、CSDN 架构拆解、cnblogs 部署实测、iotdigitaltwinplm 显存估算、HuggingFace bucket 部署命令及新浪/微博官方公告,均已在正文标注来源;AA 指数为第三方综合锚点,其余基准多为厂商发布值,第三方独立复测有限,请以独立复测为准。本文未做本机实测,所有速度/显存为官方与社区估算口径,实际部署请以你的硬件为准。