首页 > 其他好文 > 详细

梯度弥散与梯度弥散

时间：2017-09-05 11:42:11 阅读：205 评论：0 收藏：0 [点我收藏+]

标签：tab 通过输出改变 log 有一个接下来 image logs

技术分享

问题描述

先来看看问题描述。

技术分享

当我们使用sigmoid funciton 作为激活函数时，随着神经网络hidden layer层数的增加，训练误差反而加大了，如上图所示。

下面以2层隐藏层神经网络为例，进行说明。

技术分享

结点中的柱状图表示每个神经元参数的更新速率(梯度)大小，有图中可以看出，layer2整体速度都要大于layer1.

我们又取每层layer中参数向量的长度来粗略的估计该层的更新速率，得到下图。

技术分享

可以看出，layer2的速率都要大于layer1.

然后我们继续加深神经网络的层数。

技术分享

可以得到下面的结论：

技术分享

靠近输出层的hidden layer 梯度大，参数更新快，所以很快就会收敛；

而靠近输入层的hidden layer 梯度小，参数更新慢，几乎就和初始状态一样，随机分布。

在上面的四层隐藏层网络结构中，第一层比第四层慢了接近100倍！！

这种现象就是梯度弥散（vanishing gradient problem）。而在另一种情况中，前面layer的梯度通过训练变大，而后面layer的梯度指数级增大，这种现象又叫做梯度爆炸(exploding gradient problem)。

总的来说，就是在这个深度网络中，梯度相当不稳定(unstable)。

直观说明

那么为何会出现这种情况呢？

现在我们来直观的说明一下。

技术分享

在上面的升级网络中，我们随意更新一个参数，加上一个Δw，(我们知道可以使用参数变化量来估计偏导数的大小)这个参数的更新会随着网络向前传播。

技术分享

而根据sigmoid的特点，它会将+∞～-∞之间的输入压缩到0～1之间。当input的值更新时，output会有很小的更新。

又因为上一层的输出将作为后一层的输入，而输出经过sigmoid后更新速率会逐步衰减，直到输出层只会有微乎其微的更新。

数学说明

如果上面的例子还不够清楚，下面我们来看看，不是很严密的数学证明。

技术分享

假设上面是一个三层hidden layer的神经网络，每一层只有一个neuron，我们下面的分析仅仅针对bias，w也是可以类比的。

C是损失函数。

每一层的输入为z，输出为a，其中有z = w*a + b。

上面的等式?c/?b1由每一层的导数乘上对应的w最后乘上?c/?a4组成。

我们给b1一个小的改变Δb1，它会在神经网络中起连锁反应，影响最后的C。

我们使用变化率?c/?b1～Δc/Δb1来估计梯度。接下来可以进行递推了。

先来计算Δb1对a1的影响。σ(z)为sigmoid函数。

技术分享

技术分享

结果正好是上面?c/?b1等式的第一项，然后影响下一层的输出。

技术分享

技术分享

将上面推导出来的两个式子联合起来，就得到b1对于z2的影响：

技术分享

再和?c/?b1等式对比一下，惊喜！！

然后的推导就是完全一样了，每个neuron的导数，乘上w，最终得到C的变化量：

技术分享

两边除以Δb1：

技术分享

sigmoid导数图像：

技术分享

sigmoid导数在0取得最大值1/4。

如果我们使用均值为0，方差为1的高斯分布初始化参数w，有|w| < 1,所以有：

技术分享

技术分享

可以看出随着网络层数的加深技术分享的term也会变多，最后的乘积会指数级衰减，

这就是梯度弥散的根本原因。

而有人要问在train的时候如果参数w变得足够大，就可能使|w|>1, 技术分享就不满足了。

的确这样不会有梯度弥散问题，根据我们之前的分析，当|W|>1时，会使后面的layer参数指数级增加，从而引发梯度爆炸。

解决方法

梯度不稳定的方法就是，使用其他激活函数替代sigmoid，比如Relu等等，这里就不细说了。

技术分享

技术分享

技术分享

参考文献：http://neuralnetworksanddeeplearning.com/chap5.html#the_vanishing_gradient_problem

梯度弥散与梯度弥散

标签：tab 通过输出改变 log 有一个接下来 image logs

原文地址：http://www.cnblogs.com/yangmang/p/7477802.html

踩

(0)

赞

(0)

举报

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行

更多

友情链接

兰亭集智国之画百度统计站长统计阿里云 chrome插件新版天听网

关于我们 - 联系我们 - 留言反馈

© 2014 mamicode.com 版权所有联系我们:gaon5@hotmail.com

迷上了代码！