【Datawhale2607】llm-algo-leetcode task02 基础算子


文章目录

  • 前言
  • 一、RMSNorm
    • [1.1 归一化技术的演进史](#1.1 归一化技术的演进史)
    • [1.2 RMSNorm 数学公式](#1.2 RMSNorm 数学公式)
  • 总结

前言


一、RMSNorm

1.1 归一化技术的演进史

  • 归一化的核心目的只有一个:让数据分布稳定,防止梯度消失或爆炸
技术 核心逻辑 痛点 (为什么大模型不用它)
BatchNorm Batch 维度上计算均值和方差。 强依赖 Batch Size。大模型训练时,受限于显存,Batch Size 通常很小 (如 1 或 2),导致统计量极不准确,训练崩溃。
LayerNorm 特征维度 (Hidden Dim) 上计算均值和方差。公式: y = x − μ σ 2 + ϵ ⊙ γ + β y = \frac{x - \mu}{\sqrt{\sigma^2 + \epsilon}} \odot \gamma + \beta y=σ2+ϵ x−μ⊙γ+β 计算均值 μ \mu μ 和方差 σ 2 \sigma^2 σ2 需要额外的计算开销和同步操作。在千亿参数模型中,这成为了不可忽视的瓶颈。
RMSNorm (当前霸主) 假设均值已经接近 0 ,直接去掉减去均值的步骤,只用均方根 (RMS) 缩放。公式: y = x RMS ( x ) ⊙ γ y = \frac{x}{\text{RMS}(x)} \odot \gamma y=RMS(x)x⊙γ 几乎没有缺点。LLaMA、Gemma、Qwen 等现代大模型实测表明:去掉均值计算,效果几乎无损,但速度显著提升

1.2 RMSNorm 数学公式

  • 给定输入 x ∈ R d x \in \mathbb{R}^d x∈Rd,在实践中,形状通常是 [batch, seq_len, hidden_dim],然后在最后一个维度 hidden_dim 上做归一化。

Step 1: 计算均方根 (RMS)

RMS ( x ) = 1 d ∑ i = 1 d x i 2 + ϵ \text{RMS}(x) = \sqrt{ \frac{1}{d} \sum_{i=1}^{d} x_i^2 + \epsilon } RMS(x)=d1i=1∑dxi2+ϵ

  • 注: ϵ \epsilon ϵ 是防止分母为 0 的平滑项。 ,可以是 1e-6

Step 2: 归一化并缩放 (Scale)

y = x RMS ( x ) ⊙ γ y = \frac{x}{\text{RMS}(x)} \odot \gamma y=RMS(x)x⊙γ

  • *注: γ \gamma γ (即 weight) 是形状为 [hidden_dim] 的可学习参数。
  • 注:RMSNorm 没有偏置项 Bias!

总结

相关推荐
FII工业富联科技服务2 小时前
从人机共舞到工业精密操作:机器人如何突破动作控制与场景适应?
人工智能·机器人·机器翻译模型
serdes212 小时前
56G PAM4 SerDes RX 32 路时间交织 SAR ADC 顶层与采样前端
人工智能
科技苑7 小时前
Python简单网络爬虫教程
爬虫·python
小和尚同志7 小时前
小黑插图 Skill:从 11.7k star 的 Codex 专属,到 Claude Code 能用的平替
人工智能·aigc
高洁017 小时前
孪生不止在工厂:能源、医疗与农业
人工智能·深度学习·transformer·知识图谱·tornado
外域速览7 小时前
智谱50亿美元押注AI自训练
大数据·人工智能
人工智能培训7 小时前
孪生不止在工厂:能源、医疗与农业
大数据·人工智能
米小虾8 小时前
让模型说"我不知道",比让它答对更难:放弃文本生成能换来什么
人工智能
新新学长搞科研8 小时前
【SPIE出版】2026年人工智能、新材料与新能源国际学术会议(AINMNE 2026)
人工智能·新能源·新材料
野生技术架构师8 小时前
2026 Java 面试全套总结,八股 + 场景 + AI 相关面试考点
java·人工智能·面试