一、模型速览
腾讯混元(Tencent Hy)在 2026 年 8 月 28 日正式发布并开源 Hy4 preview,这是从 Hy3(295B 总参 / 21B 激活 / 256K 上下文)迭代而来的新一代 MoE 旗舰模型预览版。
-
发布方:腾讯混元团队(Tencent Hy Team)
-
参数量:770B 主干总参数,每 Token 激活 49B(256 路由专家 + 1 共享专家,每 Token 激活 Top-8 路由专家 + 共享专家);另有独立 MTP 层 10B 总参 / 0.7B 激活用于推测解码
-
上下文长度:原生 1M tokens(1,048,576),最大生成 64K
-
许可证:Apache License 2.0(无字段限制、无地域排除,可商用)
-
一句话定位:面向代码、办公分析、游戏原型、科研等真实生产力工作流的「数据中心级」开源 Agent 基座模型
一句话总结:它不是来陪你聊天的,是来钻进代码仓库、Office 文档、游戏引擎和科研流程里干活的。
二、核心亮点
亮点 1:Gated DSA 稀疏注意力 + IndexCache,让 1M 上下文「喂得起」
Hy4 的注意力模块采用门控版 DeepSeek 稀疏注意力(Gated DeepSeek Sparse Attention, DSA),并引入 IndexCache------跨层复用稀疏选择索引,而非每层重复计算。这是 1M 上下文在推理成本上「真正可用」的关键。
# 官方 vLLM 部署时直接指定稀疏注意力后端
--attention-backend FLASHMLA_SPARSE
数据来源:模型卡 / aicybr.com 部署解析(官方架构说明)
亮点 2:原生 MTP 推测解码层,提速写进权重里
与很多模型事后在推理框架里「外挂」投机解码不同,Hy4 在权重侧内置了一个 MTP(Multi-Token Prediction)层(10B 总参 / 0.7B 激活),用于原生 next-token 预测加速。vLLM / SGLang 双双在官方预构建镜像里默认开启。
# 开启原生 MTP 推测解码(每步预测 3 个 token)
--speculative-config '{"method": "mtp","num_speculative_tokens": 3}'
数据来源:Hugging Face 模型卡 deployment 章节
亮点 3:49B 激活的「大库小用」MoE,兼顾能力与成本
770B 的「专家库」,每道题只叫最相关的一批专家(Top-8 路由 + 1 共享)上场,计算量按 49B 走。相比同等能力的稠密模型,推理算力大幅下降,这也是它能把 API 价格压到 输入 6 元 / 百万 tokens、输出 18 元 / 百万 tokens、缓存命中 0.3 元 的底气。
数据来源:腾讯混元官方公告(2026-08-28)
亮点 4:Agentic 基准全面领先同级开源
官方在 agentic 维度的公开分数相当能打(数据来源:模型卡 / explainx.ai 整理):
| 基准 | Hy4 preview | 说明 |
|---|---|---|
| Terminal-Bench 2.1 | 85.4 | 终端自动化,Agent 核心能力 |
| MCP-Atlas (public) | 83.7 | 工具调用编排 |
| SWE-Bench Pro | 65.7 | 真实软件工程 |
| CyberGym | 78.4 | 网络安全任务 |
| OfficeQA Pro | 66.2 | 跨文件办公分析 |
| GPQA Diamond | 92.3 | 研究生级科学推理 |
亮点 5:no_think 直答开关,关掉过度自我验证
官方承认 preview 版在复杂任务上「思考偏长、过度自我验证」。为此提供 reasoning_effort: no_think 参数,一键切回快速直答模式:
# 关闭深度思考,适合简单问答 / 低延迟场景
extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}
数据来源:Hugging Face 模型卡
亮点 6:iHC 残差超连接 + 相比 Hy3 的代际跃迁
Hy4 用 identity Hyper-Connections(iHC) 跨 4 条残差流拓宽层间信息流,缓解超深 MoE(78 层)的训练/推理梯度问题。相比 Hy3(295B 总参 / 21B 激活 / 256K),官方附录 46 项成绩全部高于 Hy3,几个提升夸张的:
-
DeepSWE:28.0 → 64.3(+36.3)
-
SWE Atlas Codebase Q&A:30.8 → 64.0
-
MathArena Apex 2025:38.7 → 74.2
-
Toolathlon-Verified:56.2 → 74.1
数据来源:腾讯混元官方对比附录(2026-08-28)
从 Hy3 到 Hy4 preview 仅 53 天,规模 2.6×、上下文 4×------国产开源的迭代节奏还在加速。
三、部署实战
⚠️ 重要前提:Hy4 preview 是数据中心级 模型。BF16 权重约 1.54TB,FP8 权重约 770GB,单机消费级显卡无法本地部署 。官方 recipe 默认 8 卡张量并行。以下给出生产可用的完整命令,复制即可跑(需 8×80GB+ 显存,如 8×A100/H100/H800 或昇腾 Atlas 800I A3)。
3.1 环境准备
官方提供预构建 Docker 镜像,无需手动编译 vLLM:
bash
# 拉取官方预构建镜像(多架构 x86 / Arm)
docker pull vllm/vllm-openai:hy4-preview
# 或通过 SGLang 部署
docker pull lmsysorg/sglang:hy4-preview
如需从源码构建(指定 Python 3.12):
bash
uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate
git clone https://github.com/vllm-project/vllm.git
cd vllm
uv pip install --editable . --torch-backend=auto
3.2 模型下载
通过 huggingface-cli 或 modelscope 拉取权重(FP8 变体体积更小,推荐生产用):
bash
# BF16 原版(约 1.54TB,谨慎)
huggingface-cli download tencent/Hy4-preview --local-dir /data/hy4
# FP8 量化版(约 770GB,推荐生产部署)
huggingface-cli download tencent/Hy4-preview-FP8 --local-dir /data/hy4-fp8
权重地址:https://huggingface.co/tencent/Hy4-preview (同步上线 ModelScope / GitCode / CNB)
3.3 启动推理服务(vLLM,8 卡 TP)
bash
docker run --gpus all -p 8000:8000 --ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:hy4-preview \
tencent/Hy4-preview-FP8 \
--tensor-parallel-size 8 \
--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
--attention-backend FLASHMLA_SPARSE \
--tool-call-parser hy_v4 \
--reasoning-parser hy_v4 \
--enable-auto-tool-choice \
--port 8000 \
--served-model-name hy4-preview
或用裸命令(本地已装 vLLM):
bash
vllm serve tencent/Hy4-preview-FP8 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 3 \
--attention-backend FLASHMLA_SPARSE \
--tool-call-parser hy_v4 \
--reasoning-parser hy_v4 \
--enable-auto-tool-choice \
--port 8000 \
--served-model-name hy4-preview
SGLang 等价命令:
bash
docker run --gpus all --ipc=host -p 8000:8000 \
lmsysorg/sglang:hy4-preview \
python3 -m sglang.launch_server \
--model tencent/Hy4-preview-FP8 \
--tp-size 8 \
--reasoning-parser auto \
--tool-call-parser auto \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--port 8000 \
--served-model-name hy4-preview
数据来源:Hugging Face 模型卡 deployment 章节 / bittide.aicompass.dev 整理
3.4 完整可运行推理代码(OpenAI 兼容)
服务起来后,直接用 openai SDK 调用,无需 extra 依赖:
python
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY", # 本地部署无需真实 key
)
# 1) 默认 high 推理模式(深度思考,适合编程/数学/科研)
resp = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "用 Python 写一个快速排序,并分析时间复杂度。"}],
temperature=0.9,
top_p=1.0,
)
print("【深度思考】\n", resp.choices[0].message.content)
# 2) no_think 直答模式(关闭 CoT,低延迟)
resp2 = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "今天北京天气怎么样?用一句话回答。"}],
temperature=0.9,
top_p=1.0,
extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}},
)
print("【直答】\n", resp2.choices[0].message.content)
# 3) 工具调用(Agent 场景,需服务端已开 --enable-auto-tool-choice)
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "查询指定城市天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
},
}]
resp3 = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "帮我查下上海今天天气。"}],
tools=tools,
tool_choice="auto",
)
print("【工具调用】\n", resp3.choices[0].message.tool_calls)
3.5 效果验证
服务就绪后健康检查 + 冒烟测试:
bash
# 检查模型已加载
curl -sf http://127.0.0.1:8000/v1/models
# 发送一条推理请求
curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"hy4-preview","messages":[{"role":"user","content":"Who are you?"}],"max_tokens":256,"temperature":0}'
验证命令参考:Hugging Face 模型卡 / 昇腾适配文档
昇腾 0day 适配(国产算力可行)
发布当天昇腾即实现 0day 支持:基于 vLLM-Ascend 在 Atlas 800I A3(16 卡)上用 W8A8 量化(权重约 762G)完成部署,预构建镜像 quay.io/ascend/vllm-ascend:hy4。
数据来源:昇腾官方适配公告(2026-08-28)
四、性能测评
说明:本机无多卡 GPU,以下速度/显存数据来自官方 recipe 与社区实测,逐项标注来源,未做任何虚构。
4.1 显存占用(量化视角)
| 权重格式 | 估算存储 | 部署前提 |
|---|---|---|
| BF16 / FP16 | ~1.54 TB | 8×H100 仍吃紧,需专家并行 + 高利用率 |
| FP8 / INT8 | ~770 GB | 官方推荐,8 卡 TP 可行 |
| W8A8(昇腾) | ~762 GB | Atlas 800I A3 16 卡 TP |
数据来源:aicybr.com 权重估算 / 昇腾适配文档(均为一阶权重存储估算,未含 KV cache、运行时开销)
4.2 推理速度
-
官方 recipe 在 8 卡张量并行 + MTP 推测解码下,社区实测观察到约 36 tok/s(explainx.ai 报道,单请求 decode)。
-
端到端吞吐相对基线提升 31.8%(腾讯官方公告,指算子融合 + 通信优化后的训练/推理栈整体收益)。
速度数据来源:explainx.ai 博客(2026-08-28)、腾讯混元官方公告。未实测,标注为「官方/社区观测」。
4.3 与同级开源模型横向对比
| 维度 | Hy4 preview | GLM-5.3 (MIT) | Kimi K3 | DeepSeek-V4-Pro |
|---|---|---|---|---|
| 总参数 | 770B | 7430B(稠密) | 2.8T MoE | 1.6T--1.7T MoE |
| 激活参数 | 49B | 全量 | ~? | ~? |
| 上下文 | 1M | 256K--1M | 1M | 1M |
| 协议 | Apache 2.0 | MIT | 开源 | MIT |
| Terminal-Bench 2.1 | 85.4 | 87.9* | 86.6* | 88.2* |
| SWE-Bench Pro | 65.7 | 67.7* | 64.6* | 79.2* |
| 输入价格(¥/M) | 6.0 | 1.40(国际$1.40) | --- | ~0.44($) |
| 自托管门槛 | 极高(8卡+) | 高 | 极高 | 高 |
带
*为腾讯官方对比表中的「最高可用结果」口径;其余来自模型卡与 explainx.ai 整理。价格来源:腾讯官方 / explainx.ai。
结论:Hy4 preview 在 Apache 2.0 同级里 agentic 能力稳居第一梯队,与 GLM-5.3 / Kimi K3 互有胜负(官方内部盲测 203 工程任务均分 2.99 vs GLM 2.92 / Kimi 2.94,差距在噪声范围内)。相比 DeepSeek-V4-Pro 价格略高、绝对跑分略低,但协议更宽松、无字段限制。
五、使用建议
适用场景
-
长程软件工程:跨文件重构、SWE-bench 级任务(SWE-Bench Pro 65.7)。配合 CodeBuddy / WorkBuddy 已内嵌,可直接接管代码仓库做多文件修改。
-
跨文件办公分析:OfficeQA Pro 66.2,适合企业知识库 / 文档智能体,1M 上下文能一次塞进整本手册或数月邮件。
-
工具调用编排 Agent:MCP-Atlas 83.7,原生支持 function calling,适合把数据库、内部 API、运维脚本编排成自主工作流。
-
数据中心私有化部署:Apache 2.0 可商用,无地域/领域限制,金融、政企等对协议合规敏感的行业友好。
不适用场景
-
❌ 个人开发者单机部署:FP8 仍需 ~770GB 显存,消费级显卡无缘,别浪费时间折腾 llama.cpp。
-
❌ 追求最低 API 成本:输入 6 元/百万 tokens,高于 DeepSeek-V4-Pro(~$0.44/M,约 3 元),预算敏感选后者。
-
❌ 要求稳定生产模型:官方明确为 preview,存在过度自我验证、思考偏长问题,上线前务必做一轮业务侧回归。
调优提示
-
简单任务务必加
reasoning_effort: no_think,否则延迟翻倍且容易「想太多」给出冗长答案。 -
必开 MTP 推测解码(
num_speculative_tokens=3),官方 recipe 下实测提速明显,是性价比最高的开关。 -
长上下文配合
--attention-backend FLASHMLA_SPARSE,否则 KV cache 随序列长度线性膨胀,直接 OOM。 -
用官方预构建镜像(
vllm/vllm-openai:hy4-preview),别自己从源码编 vLLM,版本对齐坑多、启动慢。 -
昇腾用户直接拉
quay.io/ascend/vllm-ascend:hy4,0day 适配最省心;多机部署记得先起 DP Coordinator 再拉 worker。 -
固定模型 revision 与镜像 tag:这是 preview 版本,权重和 serving 栈会快速迭代,生产环境务必 pin 版本保证可复现。
5.1 硬件选型的「两个档位」
很多读者关心的核心问题是「我到底要几张卡」。根据官方 recipe 与权重体积,给出两个典型档位(数据来源:aicybr.com 权重估算 + 官方 8 卡 TP recipe):
| 部署形态 | 推荐硬件 | 权重格式 | 说明 |
|---|---|---|---|
| 单机验证 | 8×H100/H800 80GB | FP8 (~770GB) | 官方默认档,支持短序列功能验证 |
| 长序列生产 | 2×8 节点 (16 卡) DP=2 | FP8 / W8A8 | 上下文可扩至 32K--1M,并发 256 |
| 国产算力 | 昇腾 Atlas 800I A3 16 卡 | W8A8 (~762GB) | 0day 适配,vLLM-Ascend 直接跑 |
注意:BF16 全精度约 1.54TB,即便 8 张 80GB 卡(640GB 总显存)也装不下,必须走专家并行(expert-parallel)或降精度。普通团队直接选 FP8 变体最现实。
5.2 流式调用示例(生产常用)
上面的推理代码是一次性返回,生产环境通常用流式输出避免前端「转圈」:
python
# pip install openai
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
stream = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "写一段用于解析 CSV 并统计各列缺失率的 Python 函数,带类型注解。"}],
temperature=0.9,
top_p=1.0,
stream=True, # 开启流式
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
print("\n--- 生成结束 ---")
5.3 常见部署坑与排查
| 现象 | 可能原因 | 处理 |
|---|---|---|
启动报 OOM / 显存不足 |
用了 BF16 或 KV cache 过大 | 切 FP8,降低 --gpu-memory-utilization 或缩 --max-model-len |
| 推理极慢且无加速 | MTP 未生效 | 确认 --speculative-config 与镜像版本匹配 |
| 工具调用不触发 | 未开 --enable-auto-tool-choice |
补该参数并确认 --tool-call-parser hy_v4 |
| 长上下文直接崩 | 未用稀疏注意力后端 | 加 --attention-backend FLASHMLA_SPARSE |
| 多机 worker 起不来 | DP Coordinator 未先就绪 | 先起节点 1 看到 Started DP Coordinator 再拉节点 2 |