腾讯 Hy4 开源:770B 旗舰,和一句“它参与了自己的训练“

8 月 28 日,腾讯混元发布并开源新一代旗舰 Hy4 preview:770B 总参数、49B 激活、1M 上下文、Apache 2.0 协议。官方推特只有一句话的姿态:"去用它,告诉我们哪里有问题。"

这场发布有两处反常。

第一,别家旗舰发布都附一整页 SWE-bench / Terminal-Bench 表格,Hy4 的官方新闻稿里没有公开基准跑分表------唯一的评测数据是一场腾讯内部的盲测。

第二,新闻稿里藏着一句很少有大厂敢写的话:Hy4 preview "参与了它自己的开发过程"------包括训练方法、数据策略和推理系统的优化。这不是措辞夸张,是明确的"递归自我改进"主张。

这篇文章把能查证的数据全部摆出来:内部盲测的 2.99 分、第三方榜单上的 65.7%,以及那句"自训练"声明到底该怎么读。


懒人版:30 秒看完结论

你想知道的 一句话回答
规格是什么 770B 总参 / 49B 激活 MoE,1M 上下文,Apache 2.0 开源,170 个权重文件
跑分多少 官方没发公开跑分表;唯一第三方数据是 SWE-bench Pro 65.7%(总榜第 7、开源权重第 2)
赢了 GLM-5.3 和 Kimi K3 吗 腾讯内部盲测 2.99 vs 2.92(GLM-5.3)vs 2.94(Kimi K3)------⚠️ 内部评测,险胜 0.05~0.07 分
"参与自己的训练"是营销吗 半真半实验:官方自报"自主优化推理系统,吞吐 +31.8%",baseline 未披露,无第三方验证
多少钱 输入 ¥6 / 输出 ¥18 每百万 tokens(国际价 $0.834/$2.501),缓存命中 ¥0.3
便宜吗 比 GLM-5.3(≈¥10/¥31)便宜约 40%;比 GLM-5.3-Flash(≈¥1/¥3.6)贵 6 倍------旗舰价,不是性价比价
白嫖窗口 WorkBuddy / CodeBuddy 上免费两周;Hy3 免费延长到 9 月 30 日

一、163 位专家的盲测:赢是赢了,赢多少要看清

先看官方给的核心评测:腾讯组织了一场内部盲测,163 位专家评审、203 项真实工程任务,结果------

  • Hy4 preview:2.99 / 4.00
  • GLM-5.3:2.92
  • Kimi K3:2.94

Hy4 胜出。但两个细节必须放大:

第一,胜负差距是 0.05~0.07 分。 官方新闻稿自己的措辞是"略微领先"(slightly ahead)------4 分制下不到 0.1 分的差距,翻译成体感就是"互有胜负"。"开源第一梯队"成立,"碾压友商"不成立,这个距离读者应该知道。

第二,评审是腾讯自己的 163 位专家。 ⚠️ 这是厂商内部评测:任务集未公开,评审全部来自腾讯,GLM 和 Kimi 的调用配置(思考档位、工具环境)也未披露。按老规矩,这类数据只能当"方向性参考",不能当选型依据。对比一周前智谱发 GLM-5.3-Flash 时的做法------直接上 Terminal-Bench、DeepSWE、HLE 一整页公开基准------腾讯这次选择了完全不同的评测叙事:不比公开榜,比"真实生产力任务的专家体感"。

这个选择本身是个信号:公开基准在 2026 年的信任度已经低到连大厂发布都开始绕开它了。


二、唯一的第三方硬数据:SWE-bench Pro 65.7%,开源第 2

官方不发跑分,第三方榜单替它发了。BenchLM 的 SWE-bench Pro 榜单(2026 年 8 月 28 日数据验证,覆盖 65 个模型)上,Hy4 preview 的位置是:

排名 模型 厂商 权重 分数
1 Claude Mythos 5 Anthropic 闭源 80.3%
2 Claude Fable 5 Anthropic 闭源 80%
3 Claude Opus 5 Anthropic 闭源 79.2%
6 Qwen3.8 Max 阿里 开源权重 67.7%
7 Hy4 preview 腾讯 开源权重 65.7%
8 Ornith-1.5-397B Ornith 开源权重 65.1%
9 Grok 4.5 xAI 闭源 64.7%
10 GPT-5.6 Sol OpenAI 闭源 64.6%

三个读数:

  1. 开源阵营第 2,仅次于 Qwen3.8 Max(差 2 个点),压过 Grok 4.5 和 GPT-5.6 Sol------"开源第一梯队"的说法成立。
  2. 和闭源前沿有 14 个点的断层。Claude 三兄弟在 80% 一档,所有开源模型在 68% 以下。开源追赶闭源的故事在 coding 这个单项上还没发生。
  3. ⚠️ 这个榜单本身要打折读:BenchLM 编辑注明各厂商分数的 setup(脚手架、工具预算、重试策略)不完全可比,差距小的时候只能看方向;OpenAI 7 月的审计还估计这个基准约 30% 的任务有问题。没有任何单一基准能决定选型,SWE-bench Pro 也不例外。

另外注意:上代 Hy3 发布时公布的 SWE-Bench 分数是 74.4%,看着比 Hy4 的 65.7% 高------但那是不同口径的榜单(SWE-bench 系列有 Verified / Pro 多个难度不同的 split),不能横比。别被"越更新分数越低"的错觉骗了。


三、整场发布最大胆的一句话:"它参与了自己的训练"

新闻稿后半段有一段容易被快讯略过的内容,值得全文转述:

Hy4 preview 参与了自身的开发过程------首次参与训练方法、数据策略、评测框架和底层算子的自动化优化。模型提出方案、运行实验、根据结果迭代,产出的代码、日志和反馈进入下一轮探索。这建立了一个早期阶段的递归自我改进循环

还有一条配套声明:Hy4 preview 自主分析了推理系统的瓶颈 ,对算子融合和通信优化做了多轮迭代,端到端吞吐相比 baseline 提升 31.8%

怎么读这两段?

激进的部分:"递归自我改进"(recursive self-improvement)是 AI 安全讨论里最敏感的词之一。一家大厂在官方发布里明确使用它,且描述的是自家模型优化自家训练管线和推理栈------这在一年前的旗舰发布里还只存在于实验室 talk。哪怕只是"早期阶段",措辞上的跨越是真实的。

要打折的部分:⚠️ +31.8% 是官方自报数据,baseline 是什么(vLLM 默认配置?自家上一版推理栈?)没有披露,无第三方复现。而且"模型提出方案、跑实验"的自动化程度有多高------是模型自主循环,还是工程师大量在环------新闻稿的表述留足了模糊空间。把它理解为"AI 辅助的基础设施优化,效率增益显著"是稳妥的;理解为"模型开始自我进化"就过度演绎了。

但即便打折,这也是 2026 年开源发布里第一次有厂商把这个方向写进正式新闻稿。方向比数字重要。


四、"为生产力而生"的定位,和一笔价格账

Hy4 的定位词是"生产力"------不是 agent,不是推理,是生产力。具体拆开是四块:

  • 软件工程:长上下文开发任务的理解、规划、调试、验证,前端视觉质量
  • 办公:复杂工作环境理解、金融分析、跨文档协同,覆盖"信息处理 → 文档/表格/演示文稿产出"全流程
  • 游戏开发:一句自然语言生成可玩原型,与游戏引擎协作,多轮迭代复杂项目(腾讯的老本行)
  • 科研:AI 研发、分子动力学、凝聚态物理、基础数学

这个定位和它的训练数据是绑定死的:官方明说训练数据由腾讯软件工程、游戏、金融、安全领域的专家"共创",并且和 CodeBuddy、WorkBuddy 两款内部产品深度共同设计。翻译一下:这不是先做模型再找场景,是拿着自家产品的真实工作流喂出来的模型。

价格账本(每百万 tokens):

模型 输入 输出 备注
Hy4 preview ¥6 ¥18 缓存命中 ¥0.3
GLM-5.3 ≈¥10 ≈¥31 $1.40/$4.40
GLM-5.3-Flash ≈¥1.1 ≈¥3.6 $0.15/$0.50,发布期五折更低
上代 Hy3 ¥1 ¥4 快慢融合小旗舰

三个读数:比同级开源旗舰 GLM-5.3 便宜约 40%,"实惠"在旗舰圈内成立;比 Flash 档模型贵 6 倍,别拿它当性价比模型用;比自家上代贵 6 倍,旗舰定位上移明显。

想零成本试的话:WorkBuddy 和 CodeBuddy 上免费两周 ,Hy3 的免费期也延长到了 9 月 30 日。API 走腾讯云 TokenHub 或 OpenRouter。部署侧的细节:思考档位只有 highno_think 两档------能彻底关思考,但没有中间档。


五、大棋局:8 月开源大战,和"preview-first"的行业新常态

把时间线拉远看这场发布:

  • 4 月 23 日:Hy3 preview(295B-A21B)匿名亮相
  • 7 月 6 日:Hy3 正式发布,¥1/¥4 定价主打性价比
  • 8 月 14 日:智谱 GLM-5.3 发布(开源编程旗舰)
  • 8 月 26 日:智谱 GLM-5.3-Flash 认领匿名模型 Ox Alpha
  • 8 月 28 日:Hy4 preview 发布,直接对标 GLM-5.3 / Kimi K3
  • 近期:官方预告 Hy4 系列下一批模型即将上线

两个行业信号:

"preview-first"成了 2026 年旗舰发布的标准动作。 智谱用匿名模型在 OpenRouter 公测 6 天才认领,腾讯直接把 "preview" 写进正式型号名、公开征求反馈。共同逻辑:公开基准信任崩塌后,厂商改为让真实用户在发布前就完成大规模摩擦测试------跑分可以被质疑,10 万开发者的体感很难集体造假。

模型-产品共研成了大厂的差异化武器。 智谱绑定 Coding Plan 和 ZCode,腾讯绑定 CodeBuddy/WorkBuddy/元宝/ima。开源权重是获客入口,真正的护城河是"模型和自家生产力产品的协同迭代"。另外别忘了财报背景:腾讯此前明确说过训练混元是资本支出项------770B 的 Apache 2.0 全开源,等于把这笔资本支出的一部分直接赠送给全社会,换生态位。


六、总结

Hy4 preview 是一份"三明治"式的发布:

  • 可验证的:770B-A49B、1M 上下文、Apache 2.0、SWE-bench Pro 65.7% 开源第 2、比 GLM-5.3 便宜 40% 的旗舰定价、两周免费窗口。这些构成了它"开源第一梯队"的底座,成色扎实。
  • 要打折的:内部盲测险胜 GLM-5.3/Kimi K3 的 0.05 分------方向有参考价值,数字没有。
  • 要盯住的:"递归自我改进"和 +31.8% 自优化吞吐。这是全篇最值得持续追踪的声明------如果后续有第三方复现或技术报告披露细节,它就是大事;如果再无下文,就当一次措辞实验。

对开发者的建议很直接:这两周免费,别刷帖子了,拿你手头最的真实工程任务去 WorkBuddy/CodeBuddy 跑一遍。preview 的意思就是------腾讯自己也想知道它到底几斤几两。

数据来源:腾讯官方新闻稿(tencent.com,2026-08-28)、Hugging Face 模型卡 tencent/Hy4-preview(Apache 2.0,配置细节)、BenchLM SWE-bench Pro 榜单(2026-08-28 验证,含其编辑审计说明)、腾讯混元官方 X 账号、IT之家/央广网/新浪财经/财联社/中新经纬(2026-08-28 发布报道)、新京报(Hy3 定价,2026-07-06)、businessanalytics(Hy3 SWE-Bench 74.4%,口径未注明)。内部盲测与吞吐提升均为腾讯自报口径,未经独立验证。

相关推荐
TunerT_TQ17 分钟前
Meta|Flow 源码结构解析:一个大型 JavaScript 静态类型检查项目的工程化实践
meta·开源·github
一切皆是因缘际会18 分钟前
智能革新
人工智能·科技
Csvn23 分钟前
评测集不是“一堆问题”,是“测试资产”——30 条结构化评测集(E02)
人工智能·agent
尘中远27 分钟前
7大开源Agent源码对比解读——会话管理
ai·开源·agent·codex·harness
OpenBayes28 分钟前
Qwen3.8-27B-FP8 降低大模型部署门槛,开启高效多模态智能体验;MiniMax H3-1K 发布千段视频测试数据集,全面评估 AI 视频生成能力
人工智能·深度学习·计算机视觉·自然语言处理·语音识别·多模态大模型
小小测试开发30 分钟前
RAG评测指标实战:忠实度、上下文精确率/召回率从原理到CI落地
android·人工智能·spring boot·ci/cd
Easy_API30 分钟前
OpenAI三周内第二次降价,GPT-5.6 Sol砍了20%到33
大数据·前端·人工智能·gpt·深度学习
小K讲AI营销32 分钟前
智谱配售314亿港元:融资通道切换
大数据·人工智能
陕西企来客37 分钟前
2026年8月木铝门窗适合哪些住宅?材质性能与维护解析
人工智能·材质·木铝门窗