L2正则化,防止过拟合-历史补充

L2 正则化核心原理笔记

Ltotal=Ldata+Lreg

Ltotal: 正则化后的成本

Ldata:训练数据的成本

Lreg:正则化成本 目标是最小化 Ltotal

所以 Ldata+Lreg 要最小

所以要考虑 Ldata 和 Lreg 同时最小

所以 Ldata 最小会拉高 W Lreg 最小会拉低 W 两者相互制衡,最终找到平衡点

这就是 L2 正则化限制 W 预防过拟合的原理

L2 正则化完整推导与原理

一、核心作用

  1. 抑制模型过拟合:惩罚过大的参数权重,不让任意特征权重无限制变大;
  2. 让权重整体趋向更小,但不会压缩到 0;
  3. 优化稳定,梯度平滑,广泛用于线性回归、逻辑回归、神经网络。

二、数学公式推导

以普通最小二乘线性回归举例:

1. 原始损失(MSE)

2. 加入 L2 惩罚项的总损失

L2 正则是对所有权重参数做平方求和 ,乘以正则系数lambda;偏置项不做正则

特性 L2 正则 L1 正则 (Lasso)
惩罚形式 权重平方和 权重绝对值和
权重效果 全部缩小,不会等于 0 可将不重要特征权重压缩至 0,实现特征筛选
等高线 圆形 菱形
求解 处处可导,优化顺滑 存在不可导点,多用坐标下降
别名 岭回归 Lasso 回归

六、底层为什么能防过拟合

过拟合本质:模型记住训练集噪声,依靠极端大权重拟合随机误差。 L2 限制权重上限:

  1. 不允许参数极端偏大,模型无法精准贴合训练噪声;
  2. 强制模型依赖更多特征共同预测,而不是少数几个特征猛拉数值;
  3. 参数更平滑,泛化能力提升,在测试集表现更稳定。
相关推荐
YH552698419 分钟前
GPT‑5.6 Sol 原本支持 1M 上下文,Codex 现已放开此前限制,如何看待这次调整?
java·jvm·人工智能·gpt·算法·chatgpt
遥感知识服务2 小时前
从局部阈值、双极化到暗地表剔除:NASA OPERA DSWx-S1全球动态水体算法拆解
大数据·人工智能·深度学习·神经网络·算法·机器学习
晚风醉蝶2 小时前
1-13-TimSort
算法
ZJU_统一阿萨姆2 小时前
【算子开发】算子融合与Softmax_LayerNorm实现
人工智能·算法·语言模型·硬件架构
叩码以求索4 小时前
浅谈:前序遍历反转法求解N叉树的后序遍历
算法
北风toto5 小时前
中缀、前缀、后缀表达式
算法·软件设计师
听取WA声一片(无恶意)5 小时前
CSP-J/CSP-S 深度优先搜索(DFS)完全讲义
c++·算法·深度优先
码流怪侠6 小时前
2026年8月GitHub热榜深度拆解:Agent Skills席卷开源圈,一个“技能包“收割5万星
算法·程序员·github
hold?fish:palm6 小时前
30 两两交换链表中的节点
数据结构·算法·链表
Nil2086 小时前
leetcode 98验证二叉搜索树
算法·leetcode·职场和发展