【腾讯混元雪耻归来】 Hy4 preview:770B 参数 MoE 旗舰模型,1M 上下文全面开源

🖥️ 官方网站 | 💬 GitHub


目录


模型介绍

Hy4 preview 是腾讯混元团队(Tencent Hy Team)研发的新一代混合专家(MoE)旗舰模型。模型总参数量为 770B,其中每个 token 激活 49B 参数。主干网络包含 78 层,其中第一层使用标准稠密 FFN,其余 77 层替换为 MoE,每层包含 256 个路由专家和 1 个共享专家;每个 token 激活 top-8 路由专家以及共享专家。除主干网络外,模型还内置了 1 层原生 MTP(Multi-Token Prediction,多 token 预测)层(总参数量 10B,激活 0.7B),用于投机解码(speculative decoding)。

架构方面,受 DeepSeek 和 GLM 启发,注意力模块采用带门控的 DeepSeek 稀疏注意力(Gated DSA),并结合 IndexCache 实现跨层稀疏索引复用。残差通路采用 iHC(identity Hyper-Connections,恒等超连接) 以扩展层间信息流动。

模型规格

下表仅列出主干网络参数,不含 MTP 层。

属性 数值
架构 混合专家(MoE)
总参数量 770B
激活参数量 49B
层数 78
隐藏层维度 6144
注意力类型 Gated DSA
注意力头数 64
Query 压缩维度 2048
Key-Value 压缩维度 512
Indexer 头数 / 头维度 32 / 128
Indexer top-k 2048
残差流数量 4
路由专家数 256
共享专家数 1
每 token 激活路由专家数 8
MoE 中间维度 2048
FFN 中间维度 18432
上下文长度 1M
词表大小 120832

新一代旗舰

我们从三个方面扩展了 Hy4 preview:模型规模、上下文长度和训练数据。更强的预训练和规模显著更大的后训练叠加,带来了又一次能力跃升------这是我们测得的历代最强代际提升,足以让 Hy4 preview 站上开源模型的前沿。

为生产力而生

我们与腾讯内部各领域的顶尖专家合作------如软件工程师、游戏开发者、金融分析师和安全专家------并围绕他们实际交付的工作构建训练数据。最终模型在这些团队日常任务上走得更远:

软件工程:在理解、规划、调试和验证长周期开发任务上表现更好,前端工作的视觉审美和交互质量也有进一步提升。

办公与分析:能将分散在多个文件中的杂乱上下文转化为可共享的成果------文档、表格和演示文稿------在数据分析、公式和金融建模上具有更高的精度。

游戏开发:能将单个提示词转化为可玩的原型,并能流畅地与游戏引擎协作,让开发者可以在多轮对话中持续打磨复杂项目。

科学研究:在困难研究问题上具备更强的理解、推理和问题求解能力,在 AI 研究、分子动力学、凝聚态物理和纯数学等领域均有扎实进展。

我们还持续与腾讯产品(如 CodeBuddy 和 WorkBuddy)协同设计 Hy4 preview,使模型的进步能体现在用户实际工作中。为验证这一点,我们进行了一次盲测并排对比评估:163 位内部专家对 203 个工程任务的模型输出进行了评分。Hy4 preview 以微弱优势领先 GLM 5.3(平均分 2.99 对 2.92,胜率 46.8% / 平局 12.8% / 败率 40.4%)和 Kimi K3(2.99 对 2.94,胜率 51.2% / 平局 7.9% / 败率 40.9%)。

基准测试附录

已知局限

这是 Hy4 的早期版本。预训练和后训练都还有很大的提升空间,并且我们带着一些已知问题发布------其中包括在复杂任务上花费超出必要时间的推理,以及倾向于过度验证自身工作的倾向。我们会持续快速迭代解决这些问题。与 Hy3 preview 一样,我们宁愿尽早发布并听取反馈------正是这种做法让 Hy3 变得更好,也是我们让 Hy4 走向成熟的方式。我们还将继续与腾讯的产品和内部专家紧密合作,在推动模型智能边界的同时,让模型变得更丰富、更实惠。

新闻

模型链接

模型名称 描述 Hugging Face ModelScope GitCode CNB
Hy4 preview 指令模型 🤗 模型 模型 模型 模型
Hy4 preview-FP8 FP8 量化指令模型 🤗 模型 模型 模型 模型

快速开始

先用 vLLMSGLang 部署 Hy4 preview,然后调用 OpenAI 兼容 API:

python 复制代码
from openai import OpenAI

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Hello! Can you briefly introduce yourself?"},
    ],
    temperature=0.9,
    top_p=1.0,
)
print(response.choices[0].message.content)

推荐参数temperature=0.9top_p=1.0

推理模式 :默认为 "high"(深度思维链),适合数学、编程、推理等复杂任务。如需直接回答,传入 extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}

如何启动 API 服务器,请参阅下面的 部署 部分。

部署

对于生产环境部署,我们推荐使用 vLLMSGLang。请参考:

vLLM

使用官方预构建镜像 vllm/vllm-openai:hy4-preview

bash 复制代码
docker run --gpus all \
  -p 8000:8000 \
  --ipc=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 \
    --tensor-parallel-size 8 \
    --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' \
    --attention-backend FLASHMLA_SPARSE \
    --tool-call-parser hy_v4 \
    --reasoning-parser hy_v4 \
    --enable-auto-tool-choice \
    --port 8000 \
    --served-model-name hy4-preview

SGLang

使用官方预构建镜像 lmsysorg/sglang:hy4-preview(多架构,支持 x86 和 Arm):

bash 复制代码
docker pull lmsysorg/sglang:hy4-preview

docker run --gpus all --ipc=host -p 8000:8000 lmsysorg/sglang:hy4-preview \
  python3 -m sglang.launch_server \
    --model tencent/Hy4-preview-FP8 \
    --tp-size 8 \
    --reasoning-parser auto \
    --tool-call-parser auto \
    --speculative-algorithm NEXTN \
    --speculative-num-steps 3 \
    --speculative-eagle-topk 1 \
    --speculative-num-draft-tokens 4 \
    --port 8000 \
    --served-model-name hy4-preview

微调

Hy4 preview 提供了完整的模型微调流程。详细文档请参阅:微调指南

量化

我们提供了 AngelSlim,一个更易用、更全面、更高效的大模型压缩工具包。AngelSlim 支持面向大规模多模态模型的全面压缩工具套件,包括常用量化算法、低比特量化和投机采样等。

许可证

Hy4 preview 采用 Apache License 2.0 发布。详见 LICENSE

联系我们

如有任何问题或建议,欢迎通过邮件联系我们的研发和产品团队:

📧 hunyuan_opensource@tencent.com


Hy4 preview 由腾讯混元团队(Tencent Hy Team)开发。

相关推荐
冬奇Lab42 分钟前
一天一个开源项目(第208篇):Kaneo - 极简自托管项目管理工具
开源
luckystar513~1 小时前
Hermes 实战 :系列收官/生产化——安全审计与运维
运维·人工智能·安全·agent·智能体开发·hermes实战·智能体网关
Mickey Q1 小时前
【深度学习】数值稳定性和模型初始化
人工智能·深度学习
冬奇Lab1 小时前
Code Agent 解剖(20):从零扩展——给 agent 加一个新工具
人工智能·开源
论文复现现场1 小时前
RTX 4090 24GB 能跑 Qwen3.8-27B 吗?单卡显存计算与云端部署指南
人工智能·python·云计算·llama·gpu算力
七牛云行业应用1 小时前
Harness Engineering 是什么:从“写提示词“到“设计 Agent 边界“的工程方法论
人工智能·agent·ai编程
科技拓维者1 小时前
短视频配音音效去哪里找比较好?短视频创作者音效指南
人工智能·音视频
cjy0001111 小时前
2026AI 产品如何从一次性 Demo 变成可重复使用的业务工具?
前端·人工智能·fde
大模型码小白1 小时前
AI大模型接入SDK:人工智能核心概念与发展史
大数据·运维·人工智能·安全·prompt