
目录
模型介绍
Hy4 preview 是腾讯混元团队(Tencent Hy Team)研发的新一代混合专家(MoE)旗舰模型。模型总参数量为 770B,其中每个 token 激活 49B 参数。主干网络包含 78 层,其中第一层使用标准稠密 FFN,其余 77 层替换为 MoE,每层包含 256 个路由专家和 1 个共享专家;每个 token 激活 top-8 路由专家以及共享专家。除主干网络外,模型还内置了 1 层原生 MTP(Multi-Token Prediction,多 token 预测)层(总参数量 10B,激活 0.7B),用于投机解码(speculative decoding)。
架构方面,受 DeepSeek 和 GLM 启发,注意力模块采用带门控的 DeepSeek 稀疏注意力(Gated DSA),并结合 IndexCache 实现跨层稀疏索引复用。残差通路采用 iHC(identity Hyper-Connections,恒等超连接) 以扩展层间信息流动。
模型规格
下表仅列出主干网络参数,不含 MTP 层。
| 属性 | 数值 |
|---|---|
| 架构 | 混合专家(MoE) |
| 总参数量 | 770B |
| 激活参数量 | 49B |
| 层数 | 78 |
| 隐藏层维度 | 6144 |
| 注意力类型 | Gated DSA |
| 注意力头数 | 64 |
| Query 压缩维度 | 2048 |
| Key-Value 压缩维度 | 512 |
| Indexer 头数 / 头维度 | 32 / 128 |
| Indexer top-k | 2048 |
| 残差流数量 | 4 |
| 路由专家数 | 256 |
| 共享专家数 | 1 |
| 每 token 激活路由专家数 | 8 |
| MoE 中间维度 | 2048 |
| FFN 中间维度 | 18432 |
| 上下文长度 | 1M |
| 词表大小 | 120832 |
新一代旗舰
我们从三个方面扩展了 Hy4 preview:模型规模、上下文长度和训练数据。更强的预训练和规模显著更大的后训练叠加,带来了又一次能力跃升------这是我们测得的历代最强代际提升,足以让 Hy4 preview 站上开源模型的前沿。

为生产力而生
我们与腾讯内部各领域的顶尖专家合作------如软件工程师、游戏开发者、金融分析师和安全专家------并围绕他们实际交付的工作构建训练数据。最终模型在这些团队日常任务上走得更远:
软件工程:在理解、规划、调试和验证长周期开发任务上表现更好,前端工作的视觉审美和交互质量也有进一步提升。
办公与分析:能将分散在多个文件中的杂乱上下文转化为可共享的成果------文档、表格和演示文稿------在数据分析、公式和金融建模上具有更高的精度。
游戏开发:能将单个提示词转化为可玩的原型,并能流畅地与游戏引擎协作,让开发者可以在多轮对话中持续打磨复杂项目。
科学研究:在困难研究问题上具备更强的理解、推理和问题求解能力,在 AI 研究、分子动力学、凝聚态物理和纯数学等领域均有扎实进展。
我们还持续与腾讯产品(如 CodeBuddy 和 WorkBuddy)协同设计 Hy4 preview,使模型的进步能体现在用户实际工作中。为验证这一点,我们进行了一次盲测并排对比评估:163 位内部专家对 203 个工程任务的模型输出进行了评分。Hy4 preview 以微弱优势领先 GLM 5.3(平均分 2.99 对 2.92,胜率 46.8% / 平局 12.8% / 败率 40.4%)和 Kimi K3(2.99 对 2.94,胜率 51.2% / 平局 7.9% / 败率 40.9%)。
基准测试附录

已知局限
这是 Hy4 的早期版本。预训练和后训练都还有很大的提升空间,并且我们带着一些已知问题发布------其中包括在复杂任务上花费超出必要时间的推理,以及倾向于过度验证自身工作的倾向。我们会持续快速迭代解决这些问题。与 Hy3 preview 一样,我们宁愿尽早发布并听取反馈------正是这种做法让 Hy3 变得更好,也是我们让 Hy4 走向成熟的方式。我们还将继续与腾讯的产品和内部专家紧密合作,在推动模型智能边界的同时,让模型变得更丰富、更实惠。
新闻
- 🔥 我们在 Hugging Face、ModelScope、GitCode 和 CNB 上开源了 Hy4 preview 和 Hy4 preview-FP8 模型权重。
模型链接
| 模型名称 | 描述 | Hugging Face | ModelScope | GitCode | CNB |
|---|---|---|---|---|---|
| Hy4 preview | 指令模型 | 🤗 模型 | 模型 | 模型 | 模型 |
| Hy4 preview-FP8 | FP8 量化指令模型 | 🤗 模型 | 模型 | 模型 | 模型 |
快速开始
先用 vLLM 或 SGLang 部署 Hy4 preview,然后调用 OpenAI 兼容 API:
python
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="hy4-preview",
messages=[
{"role": "user", "content": "Hello! Can you briefly introduce yourself?"},
],
temperature=0.9,
top_p=1.0,
)
print(response.choices[0].message.content)
推荐参数 :
temperature=0.9、top_p=1.0。推理模式 :默认为
"high"(深度思维链),适合数学、编程、推理等复杂任务。如需直接回答,传入extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}。
如何启动 API 服务器,请参阅下面的 部署 部分。
部署
对于生产环境部署,我们推荐使用 vLLM 或 SGLang。请参考:
vLLM
使用官方预构建镜像 vllm/vllm-openai:hy4-preview:
bash
docker run --gpus all \
-p 8000:8000 \
--ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 \
--tensor-parallel-size 8 \
--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
--attention-backend FLASHMLA_SPARSE \
--tool-call-parser hy_v4 \
--reasoning-parser hy_v4 \
--enable-auto-tool-choice \
--port 8000 \
--served-model-name hy4-preview
SGLang
使用官方预构建镜像 lmsysorg/sglang:hy4-preview(多架构,支持 x86 和 Arm):
bash
docker pull lmsysorg/sglang:hy4-preview
docker run --gpus all --ipc=host -p 8000:8000 lmsysorg/sglang:hy4-preview \
python3 -m sglang.launch_server \
--model tencent/Hy4-preview-FP8 \
--tp-size 8 \
--reasoning-parser auto \
--tool-call-parser auto \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--port 8000 \
--served-model-name hy4-preview
微调
Hy4 preview 提供了完整的模型微调流程。详细文档请参阅:微调指南
量化
我们提供了 AngelSlim,一个更易用、更全面、更高效的大模型压缩工具包。AngelSlim 支持面向大规模多模态模型的全面压缩工具套件,包括常用量化算法、低比特量化和投机采样等。
许可证
Hy4 preview 采用 Apache License 2.0 发布。详见 LICENSE。
联系我们
如有任何问题或建议,欢迎通过邮件联系我们的研发和产品团队:
📧 hunyuan_opensource@tencent.com
Hy4 preview 由腾讯混元团队(Tencent Hy Team)开发。