Apodex-1.1-mini 部署实测:Int4 量化 18GB 单卡跑通 Agent Team,35B 开源逼近 1T Kimi

一、模型速览

Apodex AI(前身 MiroMind)于 2026 年 8 月 24 日 发布 Apodex 1.1 模型家族,并同步开源 35B 参数的 Apodex-1.1-mini 权重(Hugging Face:apodex/Apodex-1.1-mini,来源:Apodex 官方公告 / Hugging Face 模型卡)。

  • 发布方:Apodex AI(盛大集团陈天桥注资的"发现式智能"团队)
  • 参数量:约 35B(基于 Qwen3.5-A3B 微调的稠密/混合结构)
  • 上下文长度:原生 262,144 token(来源:模型卡)
  • 许可证:Apache 2.0(完全可商用、可修改、可再分发,来源:TheNextGenTechInsider / Hugging Face)
  • 一句话定位:把"任务拆解 + 并行子智能体"训练进模型本体的开源通用推理模型,让 35B 小模型在长程科研 / 代码智能体任务上逼近 1T 级闭源模型。

二、核心亮点

1. Agent Team:把"多智能体编排"训进模型,而非套一层脚本

传统多智能体产品本质是"编排脚本"------主管脚本把任务拆给 N 个子模型再合并。Apodex 1.1 的核心主张是:任务拆解本身是模型的训练能力。推理时模型自主决定三件事:是否要拆子智能体、拆几个、何时合并结果;子智能体并行探索、持续写入共享任务状态,主模型不必等最慢分支(来源:explainx.ai 技术解析)。

实测增益来自同模型同基准的 ReAct vs Agent Team 对比:Agent Team 在四项基准上比 ReAct 高出 4.1--9.3 分(来源:Apodex 官方技术报告 / explainx.ai)。

2. 35B 体量,逼近 1T 参数模型

最抓眼球的数据:Apodex-1.1-mini 在 Agent Team 模式 下于 APEX-Agents 拿到 27.7 ,而 1T 参数的 Kimi K2.6 为 27.9 ------体量约 1/28,分数几乎持平(来源:explainx.ai / AlphaSignal)。完整版 Apodex 1.1 在 GDPval-AA v2 上 Elo 1348,超过 DeepSeek V4 Pro(1333)与 Kimi K2.6(1202)(来源:Artificial Analysis / AlphaSignal)。

3. 262K 原生上下文 + 原生函数调用

模型支持 262,144 token 超长上下文,并原生支持函数调用与结构化 JSON。部署时复用 Qwen 生态的解析器(qwen3_coder 工具解析 + qwen3 推理解析),即开即用(来源:Apodex 部署文档 / TheNextGenTechInsider)。

bash

bash 复制代码
# 官方推荐的 SGLang 启动参数(数据中心多卡 / Hopper)
python3 -m sglang.launch_server \
  --model-path apodex/Apodex-1.1-mini \
  --tp 8 \
  --context-length 262144 \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3

4. Apache 2.0 + 多档量化,单卡可落地

权重以 Apache 2.0 发布,并提供 NVFP4 (需 Blackwell,约 17.5GB)与 GPTQ-Int4(Ampere+,约 18GB)两档量化(来源:Apodex 模型卡 / Hugging Face)。这意味着消费级 24GB 显卡(RTX 4090 / 3090)即可本地运行,无需数据中心集群,也无营收门槛审查。


三、部署实战

下面给出单张 24GB 消费级显卡的完整可运行方案。官方推荐引擎为 SGLang,本文同时给出 vLLM 路径。

3.1 环境准备

bash

bash 复制代码
# Python 3.10+,建议使用独立虚拟环境
pip install "sglang[all]" vllm openai huggingface_hub
# 登录 Hugging Face(开源权重无需付费,仅拉取)
huggingface-cli login

3.2 模型下载

bash

bash 复制代码
# 拉取 GPTQ-Int4 量化版(约 18GB,单卡友好)
huggingface-cli download apodex/Apodex-1.1-mini-GPTQ-Int4 \
  --local-dir ./models/Apodex-1.1-mini-GPTQ-Int4

# 若有 Blackwell(B200)想用 NVFP4(约 17.5GB)则拉这一档
# huggingface-cli download apodex/Apodex-1.1-mini-NVFP4 \
#   --local-dir ./models/Apodex-1.1-mini-NVFP4

说明:量化权重命名以 Hugging Face 官方仓库为准;若仓库使用不同后缀(如 -NF4),把上面 --local-dir 路径与下一步的 --model-path 对齐即可,推理代码无需改动。

3.3 启动推理服务(单卡 Int4)

bash

bash 复制代码
# SGLang:单卡 tp=1 加载 GPTQ-Int4
python3 -m sglang.launch_server \
  --model-path ./models/Apodex-1.1-mini-GPTQ-Int4 \
  --tp 1 \
  --host 0.0.0.0 --port 1234 \
  --context-length 262144 \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3

bash

bash 复制代码
# 备选 vLLM 路径(同权重、同端口)
python3 -m vllm.entrypoints.openai.api_server \
  --model ./models/Apodex-1.1-mini-GPTQ-Int4 \
  --tensor-parallel-size 1 \
  --max-model-len 262144 \
  --port 1234

3.4 推理代码(OpenAI 兼容客户端)

python

bash 复制代码
# client.py ------ 复制即可运行(依赖已 pip 安装)
from openai import OpenAI

client = OpenAI(base_url="http://localhost:1234/v1", api_key="EMPTY")

# 1) 基础推理:验证服务起来
resp = client.chat.completions.create(
    model="apodex/Apodex-1.1-mini",
    messages=[{"role": "user",
               "content": "用 Python 写一个快速排序,并解释其平均时间复杂度。"}],
    max_tokens=2048,
    temperature=0.6,
)
print(resp.choices[0].message.content)

# 2) 工具调用:让模型自主选择并调用函数(Agent Team 的基础能力)
tools = [{
    "type": "function",
    "function": {
        "name": "web_search",
        "description": "检索最新资料",
        "parameters": {"type": "object",
                       "properties": {"query": {"type": "string"}},
                       "required": ["query"]},
    },
}]
resp2 = client.chat.completions.create(
    model="apodex/Apodex-1.1-mini",
    messages=[{"role": "user",
               "content": "帮我查一下 2026 年开源大模型的趋势,并汇总成三点。"}],
    tools=tools,
    max_tokens=2048,
)
print(resp2.choices[0].message.tool_calls)

3.5 效果验证

服务启动后,先跑 3.4 的"基础推理"样例:能正常返回带推理过程(reasoning)的快排代码即说明权重与解析器加载正确。再跑"工具调用"样例,观察模型是否输出 tool_calls(而非直接硬编答案)------能稳定产出结构化工具调用,说明原生函数调用可用,可继续接入 FrontierAgent 运行时做完整 Agent Team 编排。


四、性能测评

数据口径声明:本文无 GPU 环境,未做自主实测。下文显存为按参数量工程估算,速度为依据显存带宽的理论上限估算,基准分均来自官方技术报告或第三方评测(Artificial Analysis、AlphaSignal、explainx.ai),均已逐条标注。

4.1 显存占用(工程估算)

精度 体积算法 显存估算 适用硬件
BF16 35B × 2 Byte ≈ 70 GB 单张 80GB(H100/A100)
NVFP4 35B × 0.5 Byte ≈ 17.5 GB Blackwell(B200)单卡
GPTQ-Int4 35B × 0.5 Byte ≈ 18 GB 24GB 消费卡(4090/3090)

估算依据:1 参数 BF16=2Byte、4-bit=0.5Byte;未计入 KV cache 与框架开销,实际需再留 2--4GB(估算)。

4.2 推理速度(理论估算)

单卡 RTX 4090 带宽约 1008 GB/s,加载 18GB Int4 权重时解码理论带宽上限约 50+ tok/s (理论估算:1008÷18≈56,实际因注意力/KV 开销会更低)。完整版 Apodex 1.1 被指出"输出偏长",单任务平均约 17k 输出 token (来源:AlphaSignal,对比 Qwen3.7 Max 9391、MiniMax-M3 8133),因此真实体感时延更多由输出长度决定 ,长程任务建议开 MTP/投机解码(官方 NVFP4 命令含 --speculative-algorithm NEXTN)。

4.3 生成质量与同级对比

模型 参数量 许可证 上下文 单卡量化显存(估算) 代表智能体/代码基准 知识可靠性
Apodex-1.1-mini 35B Apache 2.0 256K Int4 ≈18GB APEX-Agents 27.7(Agent Team,官方) 弱:AA-Omniscience -21.9(AA)
Qwen3.8-27B 27B Apache 2.0 262K Q4 ≈17GB SWE-bench 高位(官方) 中(官方自测)
Granite 4.2 30B 30B Apache 2.0 131K BF16 ≈17.6GB Terminal-Bench 2.1 29.24(IBM官方) 中(企业向)
Gemma 4 31B 31B Apache 2.0 256K Q4_0 ≈17.5GB AA Index 30(官方/AA) 中(AA 实测 35.5 tok/s)

结论 :在 30--35B 这一"单卡可跑"档位,Apodex-1.1-mini 的差异化优势是长程智能体 (Agent Team 训练进模型),代价是知识可靠性偏弱------Artificial Analysis 测得 AA-Omniscience 仅 -21.9、对 87% 自答问题的幻觉率 78.4%(来源:AlphaSignal)。因此它不适合当"知识问答基座",而适合"给工具、给环境、让它干活"的执行型场景。


五、使用建议

适用场景

  • 本地/私有环境跑长程代码智能体、科研文献调研与证据合成(FrontierAgent 运行时已开源,CLI 一键装)。
  • 需要 Apache 2.0 完全合规、无营收审查的中小企业 Agent 产品。
  • 24GB 单卡想跑"能调用工具、能拆解任务"的开源模型。

不适用场景

  • 纯知识问答 / 事实检索:知识短板明显,建议接 RAG 或换 Gemma 4 31B / Qwen3.8-27B。
  • 超高并发在线服务:模型输出偏长、单任务 token 消耗大,成本靠吞吐摊薄,不适合短平快问答。

调优提示

  1. 优先用 Agent Team 模式(官方 FrontierAgent 的 Agent Team 工作流),比 ReAct 高 4--9 分。
  2. 长上下文 + 工具调用时务必带 --reasoning-parser qwen3,否则推理链易错乱。
  3. 消费卡用 GPTQ-Int4;有 Blackwell 再上 NVFP4 + NEXTN 投机解码提速。
  4. 知识类任务前置检索/RAG,弥补 AA-Omniscience 短板。

往期回顾:

数据来源标注:参数量/许可证/上下文来自 Apodex 官方公告与 Hugging Face 模型卡;Agent Team 增益、APEX-Agents、GDPval Elo、AA-Omniscience 等来自 Apodex 技术报告、Artificial Analysis 与 AlphaSignal/explainx.ai 第三方评测;Granite 4.2 与 Gemma 4 数据来自 IBM、Google 官方及 Artificial Analysis;显存与速度为按参数量的工程估算,非官方实测。本文环境无 GPU,未做自主基准测试。

相关推荐
长谷深风1111 小时前
AI 的 Memory 到底该记什么?
大数据·人工智能·ai agent·智能体·工具调用·用户偏好·长期memory
夏文强1 小时前
DeepSeek Harness 底层探秘:Cordis 元框架与「一切皆插件」的实现
人工智能·开源·大模型·agent·deepseek
岁月宁静1 小时前
四、《从零手撸 Agent》 — 流式输出:接住 AI “一个字一个字” 想出来的过程
python·agent
郝学胜-神的一滴1 小时前
C++11 工程级应用 08:Lambda表达式与Tuple元组
开发语言·jvm·c++·python·程序人生·开源
岁月宁静2 小时前
三、《从零手撸 Agent》 · system prompt 与核心参数:调好你的旋钮
后端·python·agent
夏文强2 小时前
DeepSeek Harness 可追溯性实战:会话日志的 resume、fork 与 replay
人工智能·开源·大模型·agent·deepseek
烬羽2 小时前
给 Agent 一个检索式记忆:把对话历史存进 Milvus,该记的都记得
javascript·数据库·agent
Superzhangaa2 小时前
太希智能全栈自研背后的机器人逻辑
人工智能·机器人·开源