【Datawhale2607】llm-algo-leetcode task02 基础算子


文章目录

  • 前言
  • 一、RMSNorm
    • [1.1 归一化技术的演进史](#1.1 归一化技术的演进史)
    • [1.2 RMSNorm 数学公式](#1.2 RMSNorm 数学公式)
  • 总结

前言


一、RMSNorm

1.1 归一化技术的演进史

  • 归一化的核心目的只有一个:让数据分布稳定,防止梯度消失或爆炸
技术 核心逻辑 痛点 (为什么大模型不用它)
BatchNorm Batch 维度上计算均值和方差。 强依赖 Batch Size。大模型训练时,受限于显存,Batch Size 通常很小 (如 1 或 2),导致统计量极不准确,训练崩溃。
LayerNorm 特征维度 (Hidden Dim) 上计算均值和方差。公式: y = x − μ σ 2 + ϵ ⊙ γ + β y = \frac{x - \mu}{\sqrt{\sigma^2 + \epsilon}} \odot \gamma + \beta y=σ2+ϵ x−μ⊙γ+β 计算均值 μ \mu μ 和方差 σ 2 \sigma^2 σ2 需要额外的计算开销和同步操作。在千亿参数模型中,这成为了不可忽视的瓶颈。
RMSNorm (当前霸主) 假设均值已经接近 0 ,直接去掉减去均值的步骤,只用均方根 (RMS) 缩放。公式: y = x RMS ( x ) ⊙ γ y = \frac{x}{\text{RMS}(x)} \odot \gamma y=RMS(x)x⊙γ 几乎没有缺点。LLaMA、Gemma、Qwen 等现代大模型实测表明:去掉均值计算,效果几乎无损,但速度显著提升

1.2 RMSNorm 数学公式

  • 给定输入 x ∈ R d x \in \mathbb{R}^d x∈Rd,在实践中,形状通常是 [batch, seq_len, hidden_dim],然后在最后一个维度 hidden_dim 上做归一化。

Step 1: 计算均方根 (RMS)

RMS ( x ) = 1 d ∑ i = 1 d x i 2 + ϵ \text{RMS}(x) = \sqrt{ \frac{1}{d} \sum_{i=1}^{d} x_i^2 + \epsilon } RMS(x)=d1i=1∑dxi2+ϵ

  • 注: ϵ \epsilon ϵ 是防止分母为 0 的平滑项。 ,可以是 1e-6

Step 2: 归一化并缩放 (Scale)

y = x RMS ( x ) ⊙ γ y = \frac{x}{\text{RMS}(x)} \odot \gamma y=RMS(x)x⊙γ

  • *注: γ \gamma γ (即 weight) 是形状为 [hidden_dim] 的可学习参数。
  • 注:RMSNorm 没有偏置项 Bias!

总结

相关推荐
火山引擎开发者社区5 分钟前
从个人提效到组织能力:卓驭科技基于 ArkClaw 的企业级 AI 落地实践
人工智能
月诸清酒5 分钟前
55k Star 开源工具 Orca:Coding Agents 中控台
人工智能
huashengzsj6 分钟前
2026年WordPress建站公司推荐:哪些服务商更适合长期运营网站?
大数据·人工智能·云计算
今天AI了吗6 分钟前
从“金鱼脑”到“大象记忆”:AI Agent 短期记忆与长期记忆的存储与检索全解
数据库·人工智能·python·sql·rust
cd_9492172111 分钟前
具身大脑成机器人产业核心底座,星源智技术落地与产业布局解析
人工智能·microsoft·机器人
tqs_1234519 分钟前
AI后端服务高性能架构:GPU独立部署、算力解耦、弹性伸缩实战
人工智能·架构
whcyhhh23 分钟前
头歌实践教学平台:数据科学与大数据技术导论(十八4)
大数据·开发语言·python
编码者卢布24 分钟前
【Azure Developer】通过 API 获取 Azure VM 信息实践指南 Part 2(Azure China)
python·flask·azure
MartinYeung525 分钟前
[论文学习]谄媚研究者驱动表演性错位:大语言模型“对齐伪装”成因的颠复性实证研究
人工智能·学习·语言模型
红色星际26 分钟前
新石器走进无人配送车下半场
大数据·人工智能