技术栈
adamw
XLYcmy
3 天前
深度学习
·
llm
·
sgd
·
adam
·
deepseek
·
mla
·
adamw
小红书 算法一面 八
# DeepSeek R1的MLA:KV缓存的低秩压缩革命MLA(Multi-Head Latent Attention,多头潜在注意力)是DeepSeek R1前3层采用的核心创新机制,其**通过低秩联合压缩技术将KV缓存大小降低90%以上**,同时保持与标准多头注意力(MHA)相当的性能,为长上下文推理与高吞吐量部署提供了关键支撑。
All The Way North-
3 个月前
transformer
·
优化器
·
数学原理
·
adam
·
权重衰减
·
adamw
·
对比分析
AdamW 深度解析:从数学原理到 PyTorch 实现,对比分析AdamW与Adam
正式 AdamW 之前,推荐先看看我写的这几篇文章:AdamW 的全称是 Adam with Decoupled Weight Decay。
GoldenSpider.AI
9 个月前
人工智能
·
svd
·
muon
·
adamw
Muon 优化器:通过正交化动量矩阵革命性地加速 AI 大模型训练
在机器学习模型训练的漫长演进中,优化器始终是决定效率和性能的核心工具。长期以来,Adam 优化器及其变体 AdamW 一直占据着主流地位。然而,随着大型语言模型(LLM)的规模不断扩大,Adam 固有的内存消耗和效率瓶颈日益凸显。
我是有底线的