技术栈
adam
XLYcmy
6 天前
深度学习
·
llm
·
sgd
·
adam
·
deepseek
·
mla
·
adamw
小红书 算法一面 八
# DeepSeek R1的MLA:KV缓存的低秩压缩革命MLA(Multi-Head Latent Attention,多头潜在注意力)是DeepSeek R1前3层采用的核心创新机制,其**通过低秩联合压缩技术将KV缓存大小降低90%以上**,同时保持与标准多头注意力(MHA)相当的性能,为长上下文推理与高吞吐量部署提供了关键支撑。
星马梦缘
2 个月前
人工智能
·
机器学习
·
优化器
·
sgd
·
adam
·
rmsprop
机器学习与模式识别 第十二章 自适应学习优化器 考点压缩
综合来源:Lecture 12 PDF(25页)、课堂笔记(CSDN)占位图ri=ri+(∂E∂wi)2r_i = r_i + \left(\frac{\partial E}{\partial w_i}\right)^2ri=ri+(∂wi∂E)2
All The Way North-
3 个月前
transformer
·
优化器
·
数学原理
·
adam
·
权重衰减
·
adamw
·
对比分析
AdamW 深度解析:从数学原理到 PyTorch 实现,对比分析AdamW与Adam
正式 AdamW 之前,推荐先看看我写的这几篇文章:AdamW 的全称是 Adam with Decoupled Weight Decay。
东经116度
10 个月前
人工智能
·
深度学习
·
优化器
·
adam
·
adagrad
·
动量优化器
·
rmsprop
深度学习优化器详解
动量优化器 - Momentum Optimizer - 无标准缩写 - /moʊˈmɛntəm ˈɒptɪmaɪzər/
cpuimage
1 年前
深度学习
·
优化器
·
adam
深度学习优化器算法巧思速览
这一篇博文想写很久了,一直没有下笔,核心原因也是有一些待办的思路在攻关验证。我们先从一个核心的问题出发,
@Mr_LiuYang
1 年前
深度学习
·
优化算法
·
adam
·
optimizer
·
学习率调整
深度学习pytorch之19种优化算法(optimizer)解析
提示:有谬误请指正本博客详细介绍了多种常见的深度学习优化算法,包括经典的LBFGS 、Rprop 、Adagrad、RMSprop 、Adadelta 、ASGD 、Adamax、Adam、AdamW、NAdam、RAdam以及SparseAdam等,通过对这些算法的公式和参数说明进行详细解析,博客旨在为机器学习工程师和研究人员提供清晰的理论指导,帮助读者选择合适的优化算法提升模型训练效率。
住在天上的云
2 年前
笔记
·
深度学习
·
算法
·
动手学深度学习
·
adam
【深度学习笔记】优化算法——Adam算法
🏷sec_adam本章我们已经学习了许多有效优化的技术。 在本节讨论之前,我们先详细回顾一下这些技术:
又见阿郎
3 年前
优化算法
·
sgd
·
adam
聊聊神经网络的优化算法
优化算法主要用于调整神经网络中的超参数,使得训练数据集上的损失函数尽可能小。其核心逻辑是通过计算损失函数对参数的梯度(导数)来确定参数更新方向。
我是有底线的