开源大模型追踪:腾讯混元Hy4preview,FP8 770GB 落地企业私有化,Apache 2.0 无字段限制

一、模型速览

腾讯混元(Tencent Hy)在 2026 年 8 月 28 日正式发布并开源 Hy4 preview,这是从 Hy3(295B 总参 / 21B 激活 / 256K 上下文)迭代而来的新一代 MoE 旗舰模型预览版。

  • 发布方:腾讯混元团队(Tencent Hy Team)

  • 参数量:770B 主干总参数,每 Token 激活 49B(256 路由专家 + 1 共享专家,每 Token 激活 Top-8 路由专家 + 共享专家);另有独立 MTP 层 10B 总参 / 0.7B 激活用于推测解码

  • 上下文长度:原生 1M tokens(1,048,576),最大生成 64K

  • 许可证:Apache License 2.0(无字段限制、无地域排除,可商用)

  • 一句话定位:面向代码、办公分析、游戏原型、科研等真实生产力工作流的「数据中心级」开源 Agent 基座模型

一句话总结:它不是来陪你聊天的,是来钻进代码仓库、Office 文档、游戏引擎和科研流程里干活的。

二、核心亮点

亮点 1:Gated DSA 稀疏注意力 + IndexCache,让 1M 上下文「喂得起」

Hy4 的注意力模块采用门控版 DeepSeek 稀疏注意力(Gated DeepSeek Sparse Attention, DSA),并引入 IndexCache------跨层复用稀疏选择索引,而非每层重复计算。这是 1M 上下文在推理成本上「真正可用」的关键。

复制代码
# 官方 vLLM 部署时直接指定稀疏注意力后端
复制代码
--attention-backend FLASHMLA_SPARSE

数据来源:模型卡 / aicybr.com 部署解析(官方架构说明)

亮点 2:原生 MTP 推测解码层,提速写进权重里

与很多模型事后在推理框架里「外挂」投机解码不同,Hy4 在权重侧内置了一个 MTP(Multi-Token Prediction)层(10B 总参 / 0.7B 激活),用于原生 next-token 预测加速。vLLM / SGLang 双双在官方预构建镜像里默认开启。

复制代码
# 开启原生 MTP 推测解码(每步预测 3 个 token)
复制代码
--speculative-config '{"method": "mtp","num_speculative_tokens": 3}'

数据来源:Hugging Face 模型卡 deployment 章节

亮点 3:49B 激活的「大库小用」MoE,兼顾能力与成本

770B 的「专家库」,每道题只叫最相关的一批专家(Top-8 路由 + 1 共享)上场,计算量按 49B 走。相比同等能力的稠密模型,推理算力大幅下降,这也是它能把 API 价格压到 输入 6 元 / 百万 tokens、输出 18 元 / 百万 tokens、缓存命中 0.3 元 的底气。

数据来源:腾讯混元官方公告(2026-08-28)

亮点 4:Agentic 基准全面领先同级开源

官方在 agentic 维度的公开分数相当能打(数据来源:模型卡 / explainx.ai 整理):

基准 Hy4 preview 说明
Terminal-Bench 2.1 85.4 终端自动化,Agent 核心能力
MCP-Atlas (public) 83.7 工具调用编排
SWE-Bench Pro 65.7 真实软件工程
CyberGym 78.4 网络安全任务
OfficeQA Pro 66.2 跨文件办公分析
GPQA Diamond 92.3 研究生级科学推理

亮点 5:no_think 直答开关,关掉过度自我验证

官方承认 preview 版在复杂任务上「思考偏长、过度自我验证」。为此提供 reasoning_effort: no_think 参数,一键切回快速直答模式:

复制代码
# 关闭深度思考,适合简单问答 / 低延迟场景
复制代码
extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}

数据来源:Hugging Face 模型卡

亮点 6:iHC 残差超连接 + 相比 Hy3 的代际跃迁

Hy4 用 identity Hyper-Connections(iHC) 跨 4 条残差流拓宽层间信息流,缓解超深 MoE(78 层)的训练/推理梯度问题。相比 Hy3(295B 总参 / 21B 激活 / 256K),官方附录 46 项成绩全部高于 Hy3,几个提升夸张的:

  • DeepSWE:28.0 → 64.3(+36.3)

  • SWE Atlas Codebase Q&A:30.8 → 64.0

  • MathArena Apex 2025:38.7 → 74.2

  • Toolathlon-Verified:56.2 → 74.1

数据来源:腾讯混元官方对比附录(2026-08-28)

从 Hy3 到 Hy4 preview 仅 53 天,规模 2.6×、上下文 4×------国产开源的迭代节奏还在加速。

三、部署实战

⚠️ 重要前提:Hy4 preview 是数据中心级 模型。BF16 权重约 1.54TB,FP8 权重约 770GB,单机消费级显卡无法本地部署 。官方 recipe 默认 8 卡张量并行。以下给出生产可用的完整命令,复制即可跑(需 8×80GB+ 显存,如 8×A100/H100/H800 或昇腾 Atlas 800I A3)。

3.1 环境准备

官方提供预构建 Docker 镜像,无需手动编译 vLLM:

bash 复制代码
# 拉取官方预构建镜像(多架构 x86 / Arm)
docker pull vllm/vllm-openai:hy4-preview
​
# 或通过 SGLang 部署
docker pull lmsysorg/sglang:hy4-preview

如需从源码构建(指定 Python 3.12):

bash 复制代码
uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate
git clone https://github.com/vllm-project/vllm.git
cd vllm
uv pip install --editable . --torch-backend=auto

3.2 模型下载

通过 huggingface-cli 或 modelscope 拉取权重(FP8 变体体积更小,推荐生产用):

bash 复制代码
# BF16 原版(约 1.54TB,谨慎)
huggingface-cli download tencent/Hy4-preview --local-dir /data/hy4
​
# FP8 量化版(约 770GB,推荐生产部署)
huggingface-cli download tencent/Hy4-preview-FP8 --local-dir /data/hy4-fp8

权重地址:https://huggingface.co/tencent/Hy4-preview (同步上线 ModelScope / GitCode / CNB)

3.3 启动推理服务(vLLM,8 卡 TP)

bash 复制代码
docker run --gpus all -p 8000:8000 --ipc=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:hy4-preview \
  tencent/Hy4-preview-FP8 \
  --tensor-parallel-size 8 \
  --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
  --attention-backend FLASHMLA_SPARSE \
  --tool-call-parser hy_v4 \
  --reasoning-parser hy_v4 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy4-preview

或用裸命令(本地已装 vLLM):

bash 复制代码
vllm serve tencent/Hy4-preview-FP8 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 3 \
  --attention-backend FLASHMLA_SPARSE \
  --tool-call-parser hy_v4 \
  --reasoning-parser hy_v4 \
  --enable-auto-tool-choice \
  --port 8000 \
  --served-model-name hy4-preview

SGLang 等价命令:

bash 复制代码
docker run --gpus all --ipc=host -p 8000:8000 \
  lmsysorg/sglang:hy4-preview \
  python3 -m sglang.launch_server \
  --model tencent/Hy4-preview-FP8 \
  --tp-size 8 \
  --reasoning-parser auto \
  --tool-call-parser auto \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --port 8000 \
  --served-model-name hy4-preview

数据来源:Hugging Face 模型卡 deployment 章节 / bittide.aicompass.dev 整理

3.4 完整可运行推理代码(OpenAI 兼容)

服务起来后,直接用 openai SDK 调用,无需 extra 依赖:

python 复制代码
# pip install openai
from openai import OpenAI
​
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY",  # 本地部署无需真实 key
)
​
# 1) 默认 high 推理模式(深度思考,适合编程/数学/科研)
resp = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "用 Python 写一个快速排序,并分析时间复杂度。"}],
    temperature=0.9,
    top_p=1.0,
)
print("【深度思考】\n", resp.choices[0].message.content)
​
# 2) no_think 直答模式(关闭 CoT,低延迟)
resp2 = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "今天北京天气怎么样?用一句话回答。"}],
    temperature=0.9,
    top_p=1.0,
    extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}},
)
print("【直答】\n", resp2.choices[0].message.content)
​
# 3) 工具调用(Agent 场景,需服务端已开 --enable-auto-tool-choice)
tools = [{
    "type": "function",
    "function": {
        "name": "get_weather",
        "description": "查询指定城市天气",
        "parameters": {
            "type": "object",
            "properties": {"city": {"type": "string"}},
            "required": ["city"],
        },
    },
}]
resp3 = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "帮我查下上海今天天气。"}],
    tools=tools,
    tool_choice="auto",
)
print("【工具调用】\n", resp3.choices[0].message.tool_calls)

3.5 效果验证

服务就绪后健康检查 + 冒烟测试:

bash 复制代码
# 检查模型已加载
curl -sf http://127.0.0.1:8000/v1/models
​
# 发送一条推理请求
curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"hy4-preview","messages":[{"role":"user","content":"Who are you?"}],"max_tokens":256,"temperature":0}'

验证命令参考:Hugging Face 模型卡 / 昇腾适配文档

昇腾 0day 适配(国产算力可行)

发布当天昇腾即实现 0day 支持:基于 vLLM-Ascend 在 Atlas 800I A3(16 卡)上用 W8A8 量化(权重约 762G)完成部署,预构建镜像 quay.io/ascend/vllm-ascend:hy4。

数据来源:昇腾官方适配公告(2026-08-28)

四、性能测评

说明:本机无多卡 GPU,以下速度/显存数据来自官方 recipe 与社区实测,逐项标注来源,未做任何虚构。

4.1 显存占用(量化视角)

权重格式 估算存储 部署前提
BF16 / FP16 ~1.54 TB 8×H100 仍吃紧,需专家并行 + 高利用率
FP8 / INT8 ~770 GB 官方推荐,8 卡 TP 可行
W8A8(昇腾) ~762 GB Atlas 800I A3 16 卡 TP

数据来源:aicybr.com 权重估算 / 昇腾适配文档(均为一阶权重存储估算,未含 KV cache、运行时开销)

4.2 推理速度

  • 官方 recipe 在 8 卡张量并行 + MTP 推测解码下,社区实测观察到约 36 tok/s(explainx.ai 报道,单请求 decode)。

  • 端到端吞吐相对基线提升 31.8%(腾讯官方公告,指算子融合 + 通信优化后的训练/推理栈整体收益)。

速度数据来源:explainx.ai 博客(2026-08-28)、腾讯混元官方公告。未实测,标注为「官方/社区观测」。

4.3 与同级开源模型横向对比

维度 Hy4 preview GLM-5.3 (MIT) Kimi K3 DeepSeek-V4-Pro
总参数 770B 7430B(稠密) 2.8T MoE 1.6T--1.7T MoE
激活参数 49B 全量 ~? ~?
上下文 1M 256K--1M 1M 1M
协议 Apache 2.0 MIT 开源 MIT
Terminal-Bench 2.1 85.4 87.9* 86.6* 88.2*
SWE-Bench Pro 65.7 67.7* 64.6* 79.2*
输入价格(¥/M) 6.0 1.40(国际$1.40) --- ~0.44($)
自托管门槛 极高(8卡+) 高 极高 高

带 * 为腾讯官方对比表中的「最高可用结果」口径;其余来自模型卡与 explainx.ai 整理。价格来源:腾讯官方 / explainx.ai。

结论:Hy4 preview 在 Apache 2.0 同级里 agentic 能力稳居第一梯队,与 GLM-5.3 / Kimi K3 互有胜负(官方内部盲测 203 工程任务均分 2.99 vs GLM 2.92 / Kimi 2.94,差距在噪声范围内)。相比 DeepSeek-V4-Pro 价格略高、绝对跑分略低,但协议更宽松、无字段限制。

五、使用建议

适用场景

  • 长程软件工程:跨文件重构、SWE-bench 级任务(SWE-Bench Pro 65.7)。配合 CodeBuddy / WorkBuddy 已内嵌,可直接接管代码仓库做多文件修改。

  • 跨文件办公分析:OfficeQA Pro 66.2,适合企业知识库 / 文档智能体,1M 上下文能一次塞进整本手册或数月邮件。

  • 工具调用编排 Agent:MCP-Atlas 83.7,原生支持 function calling,适合把数据库、内部 API、运维脚本编排成自主工作流。

  • 数据中心私有化部署:Apache 2.0 可商用,无地域/领域限制,金融、政企等对协议合规敏感的行业友好。

不适用场景

  • ❌ 个人开发者单机部署:FP8 仍需 ~770GB 显存,消费级显卡无缘,别浪费时间折腾 llama.cpp。

  • ❌ 追求最低 API 成本:输入 6 元/百万 tokens,高于 DeepSeek-V4-Pro(~$0.44/M,约 3 元),预算敏感选后者。

  • ❌ 要求稳定生产模型:官方明确为 preview,存在过度自我验证、思考偏长问题,上线前务必做一轮业务侧回归。

调优提示

  1. 简单任务务必加 reasoning_effort: no_think,否则延迟翻倍且容易「想太多」给出冗长答案。

  2. 必开 MTP 推测解码(num_speculative_tokens=3),官方 recipe 下实测提速明显,是性价比最高的开关。

  3. 长上下文配合 --attention-backend FLASHMLA_SPARSE,否则 KV cache 随序列长度线性膨胀,直接 OOM。

  4. 用官方预构建镜像(vllm/vllm-openai:hy4-preview),别自己从源码编 vLLM,版本对齐坑多、启动慢。

  5. 昇腾用户直接拉 quay.io/ascend/vllm-ascend:hy4,0day 适配最省心;多机部署记得先起 DP Coordinator 再拉 worker。

  6. 固定模型 revision 与镜像 tag:这是 preview 版本,权重和 serving 栈会快速迭代,生产环境务必 pin 版本保证可复现。

5.1 硬件选型的「两个档位」

很多读者关心的核心问题是「我到底要几张卡」。根据官方 recipe 与权重体积,给出两个典型档位(数据来源:aicybr.com 权重估算 + 官方 8 卡 TP recipe):

部署形态 推荐硬件 权重格式 说明
单机验证 8×H100/H800 80GB FP8 (~770GB) 官方默认档,支持短序列功能验证
长序列生产 2×8 节点 (16 卡) DP=2 FP8 / W8A8 上下文可扩至 32K--1M,并发 256
国产算力 昇腾 Atlas 800I A3 16 卡 W8A8 (~762GB) 0day 适配,vLLM-Ascend 直接跑

注意:BF16 全精度约 1.54TB,即便 8 张 80GB 卡(640GB 总显存)也装不下,必须走专家并行(expert-parallel)或降精度。普通团队直接选 FP8 变体最现实。

5.2 流式调用示例(生产常用)

上面的推理代码是一次性返回,生产环境通常用流式输出避免前端「转圈」:

python 复制代码
# pip install openai
from openai import OpenAI
​
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
​
stream = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role": "user", "content": "写一段用于解析 CSV 并统计各列缺失率的 Python 函数,带类型注解。"}],
    temperature=0.9,
    top_p=1.0,
    stream=True,  # 开启流式
)
for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
print("\n--- 生成结束 ---")

5.3 常见部署坑与排查

现象 可能原因 处理
启动报 OOM / 显存不足 用了 BF16 或 KV cache 过大 切 FP8,降低 --gpu-memory-utilization 或缩 --max-model-len
推理极慢且无加速 MTP 未生效 确认 --speculative-config 与镜像版本匹配
工具调用不触发 未开 --enable-auto-tool-choice 补该参数并确认 --tool-call-parser hy_v4
长上下文直接崩 未用稀疏注意力后端 加 --attention-backend FLASHMLA_SPARSE
多机 worker 起不来 DP Coordinator 未先就绪 先起节点 1 看到 Started DP Coordinator 再拉节点 2
相关推荐
分布式存储与RustFS1 小时前
图床搬到自己的对象存储:PicGo 加 S3 插件的完整配置
运维·云原生·开源·对象存储·分布式存储·s3·性能基准
对象存储与RustFS3 小时前
自建对象存储的第一个决定:单机就够,还是必须上分布式
后端·rust·开源
分布式存储与RustFS4 小时前
在 Kubernetes 里跑对象存储的三个方案:Helm、Operator、以及什么时候别用 K8s
运维·云原生·开源·对象存储·分布式存储·s3·性能基准
OpenCSG5 小时前
OpenCSG Agentic-27B 正式开源:27B Dense 模型,Agent 执行能力实现全面跃升
人工智能·开源·opencsg
OpenCSG6 小时前
CSGLite v0.9.82 开源版本更新
开源
caoerzhong6 小时前
跨境海外仓怎么管:JeeWMS 开源 Java 仓库管理系统打通头程、海外仓与尾程
java·开发语言·开源
鬓戈6 小时前
开源中文输入法技术调研与自建方案
学习·开源
liferecords6 小时前
笔记本硬跑 744B 大模型:GitHub 上的『蜂鸟』把 SSD 当显存用
人工智能·开源·大模型·推理优化
ting94520006 小时前
深度拆解|Dif.Sh 开源特性开关(Feature Flags)技术架构与工程落地全解析
人工智能·架构·开源