线性回归 调试方法

调试方法

特征缩放

对于某些不具有比较性的样本特征 x i x_i xi (比如对其他的x来说 x i x_i xi 相当大或者相当小),梯度下降的过程可能会非常漫长,并且可能来回波动才能最后收敛到全局的最小值。

在这样的情况下,可以对 x i x_i xi 进行缩放(如 x i ≔ α x i x_i≔αx_i xi:=αxi 或者 x i = x i / α x_i=x_i/α xi=xi/α),使得 x i x_i xi 与其他的 x x x具有可比性,以增加梯度下降的效率。

**通常将 x x x缩放至⟦-1,1⟧**的区间内。(只表示一个大致的范围,这不是绝对的。)

均值归一

将 x i x_i xi 替换为 x i − μ i x_i−μ_i xi−μi 使得特征值具有为0的平均值(对 x 0 x_0 x0 不适用)
x i : = ( x i − μ i ) / s i x_i:=(x_i−μ_i)/s_i xi:=(xi−μi)/si

定义 μ i μ_i μi 为训练集 X X X 的平均值, s i = ∣ x i m a x − x i m i n ∣ s_i=|x_imax−x_imin | si=∣ximax−ximin∣, 表示 x i x_i xi 的取值范围(近似值),或者直接设置为 s i s_i si 的标准差。

学习率(Learning rate)

梯度下降调试的方法:

  1. 绘制 m i n J ( θ ) − b a t c h minJ(θ)-batch minJ(θ)−batch的图像

    原则:每一个batch之后 θ 的值都应该减小,这样的图像能够通过直观地表现变化率来表现梯度下降是否收敛(变化率为0)。

  2. 自动收敛测试

    如果 J ( θ ) J(θ) J(θ)在某一次迭代之后的下降值小于某个值 ε ε ε后,就能够判断算法已经达到了收敛。
    ε ε ε的值比较难取,所以通常采取1.中的方法进行观测。

常见的α过大的 m i n J ( θ ) − b a t c h minJ(θ)-batch minJ(θ)−batch的图像:

α过大,出现梯度爆炸,每次 J ( θ ) J(θ) J(θ)变化很大,导致代价函数无法收敛

α过小,梯度消失,每次 J ( θ ) J(θ) J(θ)变化很小,导致代价函数收敛速度过慢

相关推荐
散峰而望18 分钟前
【算法竞赛】C/C++ 的输入输出你真的玩会了吗?
c语言·开发语言·数据结构·c++·算法·github
躺不平的理查德19 分钟前
时间复杂度与空间复杂度备忘录
数据结构·算法
yaki_ya19 分钟前
yaki-C语言:从概念基础到内存解析---数组(array)完全指南
java·c语言·算法
刃神太酷啦20 分钟前
扒透 STL 底层!map/set 如何封装红黑树?迭代器逻辑 + 键值限制全手撕----《Hello C++ Wrold!》(23)--(C/C++)
java·c语言·javascript·数据结构·c++·算法·leetcode
挽星安1 小时前
代码随想录算法训练营第五十天|卡码网 99 岛屿数量、卡码网 100 最大岛屿的面积
算法
葫三生1 小时前
《论三生原理》系列构建文理同构的认知体系?
人工智能·科技·深度学习·算法·机器学习·transformer
多加点辣也没关系2 小时前
数据结构与算法|第六章:队列
数据结构·算法·队列
_深海凉_2 小时前
LeetCode热题100-分割回文串
算法·leetcode·职场和发展
我是无敌小恐龙3 小时前
Java基础入门Day10 | Object类、包装类、大数/日期类、冒泡排序与Arrays工具类 超详细总结
java·开发语言·数据结构·算法·贪心算法·排序算法·动态规划