RMSNorm函数

复制代码
def rmsnorm(x):
    ms = sum(xi * xi for xi in x) / len(x)
    scale = (ms + 1e-5) ** -0.5
    return [xi * scale for xi in x]

这段代码实现的是未包含可学习缩放参数(gamma)的 RMSNorm (均方根层归一化)函数。使用 LaTeX 格式展示其数学功能如下:

text{RMSNorm}(x_i) = x_i cdot frac{1}{sqrt{frac{1}{n} sum_{j=1}^{n} x_j^2 + epsilon}}

代码与公式的对应关系说明:

x_i:输入向量中的第 i 个元素(对应代码中的 xi)。

n:输入向量的长度(对应代码中的 len(x))。

frac{1}{n} sum_{j=1}^{n} x_j^2:输入向量元素的平方均值(对应代码中的 ms = sum(xi * xi for xi in x) / len(x))。

epsilon:极小常数,代码中硬编码为 1e-5(对应公式中的 epsilon),用于防止分母为零。

frac{1}{sqrt{dots + epsilon}}:均方根的倒数(对应代码中的 scale = (ms + 1e-5) ** -0.5)。

x_i cdot text{scale}:最终归一化后的输出(对应代码中的 xi \* scale for xi in x)。

💡 与标准 RMSNorm 的区别:

标准的 RMSNorm 公式在归一化之后,还会乘以一个可学习的缩放参数 gamma(即 odot boldsymbol{gamma}),用于恢复模型的表达能力。而你提供的这段代码省略了 gamma 的乘法操作,通常在实际的深度学习框架中,这个乘法操作会在调用此基础函数之后单独完成。

标准RMSNorm(均方根层归一化)的数学公式使用 LaTeX 格式展示如下:

text{RMSNorm}(mathbf{x}) = frac{mathbf{x}}{sqrt{frac{1}{n} sum_{i=1}^{n} x_i^2 + epsilon}} odot boldsymbol{gamma}

或者使用更紧凑的均方根(RMS)符号表示:

text{RMSNorm}(mathbf{x}) = frac{mathbf{x}}{text{RMS}(mathbf{x})} odot boldsymbol{gamma}

其中,均方根的计算公式为:

text{RMS}(mathbf{x}) = sqrt{frac{1}{n} sum_{i=1}^{n} x_i^2 + epsilon}

公式符号说明:

mathbf{x}:输入向量。

n:输入向量 mathbf{x} 的特征维度大小。

x_i:输入向量中的第 i 个元素。

epsilon:一个极小的正常数(例如 10^{-6}),用于防止分母为零,保证数值计算的稳定性。

odot:逐元素相乘(Hadamard 乘积)。

boldsymbol{gamma}:可学习的缩放参数向量(其维度与 mathbf{x} 相同,通常初始化为全 1 向量),用于恢复模型在归一化过程中损失的表达能力。

需要我对比一下 RMSNorm 和 LayerNorm 在数学形式上的差异吗?

相关推荐
2401_832298101 小时前
AI安全与全球治理:构建可控可信的智能发展新秩序
人工智能
Akir.weiwen1 小时前
跨层禁止:机器如何拦截非法语义绑定
人工智能·设计规范·语义
xiakq1 小时前
2026 年八大 LLM API 横评:DeepSeek V4 vs GPT-4o vs Claude vs Gemini
人工智能·gpt·ai·claude
u0103055271 小时前
Java图像处理实战指南
人工智能·1024程序员节
铃木之影1 小时前
Java 版本 RAG 示例(Spring AI + Milvus)
java·人工智能·spring
小马过河R1 小时前
AI Coding应用上线安全实践指南
人工智能·安全·安全架构·engineering·ai coding·harness
@Mr_LiuYang1 小时前
《深入理解 AI Agent:设计原理与工程实践 》实验2-1 本地大模型服务部署与工具调用
人工智能·大模型·本地化部署·深入理解ai agent
tudousisi2221 小时前
P4447 [AHOI2018初中组] 分组 题解复盘
算法
SNAKEpc121381 小时前
OpenGL(十一)- 变换管线
c语言·c++·算法·矩阵·图形渲染