DeepSeek 提出 mHC,改造何恺明残差连接

DeepSeek 提出 mHC,改造何恺明残差连接

大模型实验室 Lab4AI 论文阅读

✔️ 研究背景

深度学习中,残差连接 是 ResNet、Transformer 等架构(含 LLM)的基础,其恒等映射特性保障了大规模训练的稳定性与效率。Hyper-Connections(HC)通过扩展残差流宽度、多样化连接模式提升模型性能,但因连接无约束,破坏了恒等映射特性,导致训练不稳定、扩展性受限,且存在显著内存访问与通信开销,这一问题限制了 HC 在大规模训练中的实际应用,形成研究缺口。

✔️ 研究目的

本文解决 HC 架构存在的训练不稳定性、扩展性差及系统开销大的核心问题,同时保留 HC 扩展残差连接带来的性能优势,提出一种兼顾稳定性、扩展性与效率的通用残差连接框架,支撑大规模深度学习模型(尤其是 LLM)的高效训练。

✔️ 核心贡献

提出 Manifold-Constrained Hyper-Connections(mHC)框架,通过将 HC 的残差映射投影到双随机矩阵流形(Birkhoff 多面体),恢复恒等映射特性,保障信号传播稳定性;

对输入 / 输出映射施加非负约束,避免信号抵消,同时通过核融合、选择性重计算、DualPipe 通信重叠等基础设施优化,降低系统开销;

实证验证 mHC 在大规模预训练中的有效性,为深度网络拓扑架构设计提供新视角,推动基础模型的演进。

✔️ 研究方法

  • 1)核心方法论:采用 Sinkhorn-Knopp 算法将残差映射 H_res 熵投影到双随机矩阵流形,对 H_pre 和 H_post 用 Sigmoid 函数施加非负约束;
  • 2)基础设施优化:基于 TileLang 实现混合精度核融合,通过选择性重计算降低内存占用,扩展 DualPipe 调度实现通信与计算重叠;
  • 3)实验设计:在 3B 至 27B 参数的语言模型上进行预训练实验,对比基线、HC 和 mHC 的稳定性、下游任务性能及缩放特性。

✔️ 研究结果

  • 1)稳定性提升:mHC 在 27B 模型训练中消除 HC 的损失突增现象,梯度范数保持稳定(对比 HC 的 3000 倍信号增益峰值,mHC 最大增益仅 1.6 倍)。
  • 2)性能优势:在推理、阅读理解、数学问题解决等任务上全面优于基线和 HC,27B 模型在 BBH 上较 HC 提升 2.1%;
  • 3)扩展性与效率:支持模型规模与训练数据量的高效扩展,n=4 时仅增加 6.7% 时间开销,显著降低内存访问与通信成本。
相关推荐
中杯可乐多加冰4 分钟前
从 SDK 到桌面应用:我用科沃斯八界把视觉、导航和机械臂接起来
人工智能·机器人·sdk·具身智能·科沃斯·八界创造者计划·科沃斯八界
创世虚拟世界6 分钟前
我做了一个 3D 虚拟世界基底,基于这个再做 3D 虚拟世界或者元宇宙,会事半功倍
javascript·人工智能·3d·gitee·虚拟现实
AI职业加油站7 分钟前
AI 校招现状:大模型应用工程师证书,助力简历能力证明
大数据·运维·人工智能·学习·职场发展
知几蜗牛24 分钟前
GPT-6 与 Intelligent UI:从回答到可审计操作的产品迁移
人工智能
蟕初的梦想24 分钟前
Claude Haiku 5.5 效能实测与场景应用指南
数据库·人工智能·大模型
liron7129 分钟前
技术的诞生与演化--技术自举及其冷启动
人工智能·深度学习·神经网络·自然语言处理
知几蜗牛32 分钟前
Java 17 视觉识别结果的金额与字段门禁实现
人工智能
嘻嘻的AI日记33 分钟前
人工合规审查有盲区,智能合规如何补足文件风险识别短板
人工智能
UBIX泛联34 分钟前
机器人展风采,存储筑根基——泛联应邀参展电子科技大学70周年校庆展
人工智能·机器人·ai算力基础设施
知几蜗牛38 分钟前
Python + JSON Schema 实现工单结构化输出与本地复核
人工智能