一、模型速览
Apodex AI(前身 MiroMind)于 2026 年 8 月 24 日 发布 Apodex 1.1 模型家族,并同步开源 35B 参数的 Apodex-1.1-mini 权重(Hugging Face:apodex/Apodex-1.1-mini,来源:Apodex 官方公告 / Hugging Face 模型卡)。
- 发布方:Apodex AI(盛大集团陈天桥注资的"发现式智能"团队)
- 参数量:约 35B(基于 Qwen3.5-A3B 微调的稠密/混合结构)
- 上下文长度:原生 262,144 token(来源:模型卡)
- 许可证:Apache 2.0(完全可商用、可修改、可再分发,来源:TheNextGenTechInsider / Hugging Face)
- 一句话定位:把"任务拆解 + 并行子智能体"训练进模型本体的开源通用推理模型,让 35B 小模型在长程科研 / 代码智能体任务上逼近 1T 级闭源模型。
二、核心亮点
1. Agent Team:把"多智能体编排"训进模型,而非套一层脚本
传统多智能体产品本质是"编排脚本"------主管脚本把任务拆给 N 个子模型再合并。Apodex 1.1 的核心主张是:任务拆解本身是模型的训练能力。推理时模型自主决定三件事:是否要拆子智能体、拆几个、何时合并结果;子智能体并行探索、持续写入共享任务状态,主模型不必等最慢分支(来源:explainx.ai 技术解析)。
实测增益来自同模型同基准的 ReAct vs Agent Team 对比:Agent Team 在四项基准上比 ReAct 高出 4.1--9.3 分(来源:Apodex 官方技术报告 / explainx.ai)。
2. 35B 体量,逼近 1T 参数模型
最抓眼球的数据:Apodex-1.1-mini 在 Agent Team 模式 下于 APEX-Agents 拿到 27.7 ,而 1T 参数的 Kimi K2.6 为 27.9 ------体量约 1/28,分数几乎持平(来源:explainx.ai / AlphaSignal)。完整版 Apodex 1.1 在 GDPval-AA v2 上 Elo 1348,超过 DeepSeek V4 Pro(1333)与 Kimi K2.6(1202)(来源:Artificial Analysis / AlphaSignal)。
3. 262K 原生上下文 + 原生函数调用
模型支持 262,144 token 超长上下文,并原生支持函数调用与结构化 JSON。部署时复用 Qwen 生态的解析器(qwen3_coder 工具解析 + qwen3 推理解析),即开即用(来源:Apodex 部署文档 / TheNextGenTechInsider)。
bash
bash
# 官方推荐的 SGLang 启动参数(数据中心多卡 / Hopper)
python3 -m sglang.launch_server \
--model-path apodex/Apodex-1.1-mini \
--tp 8 \
--context-length 262144 \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3
4. Apache 2.0 + 多档量化,单卡可落地
权重以 Apache 2.0 发布,并提供 NVFP4 (需 Blackwell,约 17.5GB)与 GPTQ-Int4(Ampere+,约 18GB)两档量化(来源:Apodex 模型卡 / Hugging Face)。这意味着消费级 24GB 显卡(RTX 4090 / 3090)即可本地运行,无需数据中心集群,也无营收门槛审查。
三、部署实战
下面给出单张 24GB 消费级显卡的完整可运行方案。官方推荐引擎为 SGLang,本文同时给出 vLLM 路径。
3.1 环境准备
bash
bash
# Python 3.10+,建议使用独立虚拟环境
pip install "sglang[all]" vllm openai huggingface_hub
# 登录 Hugging Face(开源权重无需付费,仅拉取)
huggingface-cli login
3.2 模型下载
bash
bash
# 拉取 GPTQ-Int4 量化版(约 18GB,单卡友好)
huggingface-cli download apodex/Apodex-1.1-mini-GPTQ-Int4 \
--local-dir ./models/Apodex-1.1-mini-GPTQ-Int4
# 若有 Blackwell(B200)想用 NVFP4(约 17.5GB)则拉这一档
# huggingface-cli download apodex/Apodex-1.1-mini-NVFP4 \
# --local-dir ./models/Apodex-1.1-mini-NVFP4
说明:量化权重命名以 Hugging Face 官方仓库为准;若仓库使用不同后缀(如
-NF4),把上面--local-dir路径与下一步的--model-path对齐即可,推理代码无需改动。
3.3 启动推理服务(单卡 Int4)
bash
bash
# SGLang:单卡 tp=1 加载 GPTQ-Int4
python3 -m sglang.launch_server \
--model-path ./models/Apodex-1.1-mini-GPTQ-Int4 \
--tp 1 \
--host 0.0.0.0 --port 1234 \
--context-length 262144 \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3
bash
bash
# 备选 vLLM 路径(同权重、同端口)
python3 -m vllm.entrypoints.openai.api_server \
--model ./models/Apodex-1.1-mini-GPTQ-Int4 \
--tensor-parallel-size 1 \
--max-model-len 262144 \
--port 1234
3.4 推理代码(OpenAI 兼容客户端)
python
bash
# client.py ------ 复制即可运行(依赖已 pip 安装)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="EMPTY")
# 1) 基础推理:验证服务起来
resp = client.chat.completions.create(
model="apodex/Apodex-1.1-mini",
messages=[{"role": "user",
"content": "用 Python 写一个快速排序,并解释其平均时间复杂度。"}],
max_tokens=2048,
temperature=0.6,
)
print(resp.choices[0].message.content)
# 2) 工具调用:让模型自主选择并调用函数(Agent Team 的基础能力)
tools = [{
"type": "function",
"function": {
"name": "web_search",
"description": "检索最新资料",
"parameters": {"type": "object",
"properties": {"query": {"type": "string"}},
"required": ["query"]},
},
}]
resp2 = client.chat.completions.create(
model="apodex/Apodex-1.1-mini",
messages=[{"role": "user",
"content": "帮我查一下 2026 年开源大模型的趋势,并汇总成三点。"}],
tools=tools,
max_tokens=2048,
)
print(resp2.choices[0].message.tool_calls)
3.5 效果验证
服务启动后,先跑 3.4 的"基础推理"样例:能正常返回带推理过程(reasoning)的快排代码即说明权重与解析器加载正确。再跑"工具调用"样例,观察模型是否输出 tool_calls(而非直接硬编答案)------能稳定产出结构化工具调用,说明原生函数调用可用,可继续接入 FrontierAgent 运行时做完整 Agent Team 编排。
四、性能测评
数据口径声明:本文无 GPU 环境,未做自主实测。下文显存为按参数量工程估算,速度为依据显存带宽的理论上限估算,基准分均来自官方技术报告或第三方评测(Artificial Analysis、AlphaSignal、explainx.ai),均已逐条标注。
4.1 显存占用(工程估算)
| 精度 | 体积算法 | 显存估算 | 适用硬件 |
|---|---|---|---|
| BF16 | 35B × 2 Byte | ≈ 70 GB | 单张 80GB(H100/A100) |
| NVFP4 | 35B × 0.5 Byte | ≈ 17.5 GB | Blackwell(B200)单卡 |
| GPTQ-Int4 | 35B × 0.5 Byte | ≈ 18 GB | 24GB 消费卡(4090/3090) |
估算依据:1 参数 BF16=2Byte、4-bit=0.5Byte;未计入 KV cache 与框架开销,实际需再留 2--4GB(估算)。
4.2 推理速度(理论估算)
单卡 RTX 4090 带宽约 1008 GB/s,加载 18GB Int4 权重时解码理论带宽上限约 50+ tok/s (理论估算:1008÷18≈56,实际因注意力/KV 开销会更低)。完整版 Apodex 1.1 被指出"输出偏长",单任务平均约 17k 输出 token (来源:AlphaSignal,对比 Qwen3.7 Max 9391、MiniMax-M3 8133),因此真实体感时延更多由输出长度决定 ,长程任务建议开 MTP/投机解码(官方 NVFP4 命令含 --speculative-algorithm NEXTN)。
4.3 生成质量与同级对比
| 模型 | 参数量 | 许可证 | 上下文 | 单卡量化显存(估算) | 代表智能体/代码基准 | 知识可靠性 |
|---|---|---|---|---|---|---|
| Apodex-1.1-mini | 35B | Apache 2.0 | 256K | Int4 ≈18GB | APEX-Agents 27.7(Agent Team,官方) | 弱:AA-Omniscience -21.9(AA) |
| Qwen3.8-27B | 27B | Apache 2.0 | 262K | Q4 ≈17GB | SWE-bench 高位(官方) | 中(官方自测) |
| Granite 4.2 30B | 30B | Apache 2.0 | 131K | BF16 ≈17.6GB | Terminal-Bench 2.1 29.24(IBM官方) | 中(企业向) |
| Gemma 4 31B | 31B | Apache 2.0 | 256K | Q4_0 ≈17.5GB | AA Index 30(官方/AA) | 中(AA 实测 35.5 tok/s) |
结论 :在 30--35B 这一"单卡可跑"档位,Apodex-1.1-mini 的差异化优势是长程智能体 (Agent Team 训练进模型),代价是知识可靠性偏弱------Artificial Analysis 测得 AA-Omniscience 仅 -21.9、对 87% 自答问题的幻觉率 78.4%(来源:AlphaSignal)。因此它不适合当"知识问答基座",而适合"给工具、给环境、让它干活"的执行型场景。
五、使用建议
适用场景
- 本地/私有环境跑长程代码智能体、科研文献调研与证据合成(FrontierAgent 运行时已开源,CLI 一键装)。
- 需要 Apache 2.0 完全合规、无营收审查的中小企业 Agent 产品。
- 24GB 单卡想跑"能调用工具、能拆解任务"的开源模型。
不适用场景
- 纯知识问答 / 事实检索:知识短板明显,建议接 RAG 或换 Gemma 4 31B / Qwen3.8-27B。
- 超高并发在线服务:模型输出偏长、单任务 token 消耗大,成本靠吞吐摊薄,不适合短平快问答。
调优提示
- 优先用 Agent Team 模式(官方 FrontierAgent 的 Agent Team 工作流),比 ReAct 高 4--9 分。
- 长上下文 + 工具调用时务必带
--reasoning-parser qwen3,否则推理链易错乱。 - 消费卡用 GPTQ-Int4;有 Blackwell 再上 NVFP4 + NEXTN 投机解码提速。
- 知识类任务前置检索/RAG,弥补 AA-Omniscience 短板。
往期回顾:
- SenseNova U1.5 Lite 部署实测:8B 单卡跑通 4K 生图,Apache 2.0 免费商用
- Meta Muse Glimmer 30B 部署实测:单卡 4090 跑通本地多模态 Agent,DFlas
- Qwen3.8 vs DeepSeek-V4:本周开源大模型周度盘点,6款重磅模型横评与部署
数据来源标注:参数量/许可证/上下文来自 Apodex 官方公告与 Hugging Face 模型卡;Agent Team 增益、APEX-Agents、GDPval Elo、AA-Omniscience 等来自 Apodex 技术报告、Artificial Analysis 与 AlphaSignal/explainx.ai 第三方评测;Granite 4.2 与 Gemma 4 数据来自 IBM、Google 官方及 Artificial Analysis;显存与速度为按参数量的工程估算,非官方实测。本文环境无 GPU,未做自主基准测试。