深度学习中，为什么需要对数据进行归一化

使用gradient descent来训练模型的话都要在数据预处理步骤进行数据归一化。原因如下：根据反向传播公式：如果输入层 x 很大，在反向传播时候传递到输入层的梯度就会变得很大。梯度大，学习率就得非常小，否则会越过最优。在这种情况下，学习率的选择需要参考输入层数值大小，而直接将数据归一化操作，能很方便的选择学习率。而且受 x 和 w 的影响，各个梯度的数量级不相同，因此，它们需要的...

纸上得来终觉浅～

6752人浏览 · 2019-09-16 08:44:03

纸上得来终觉浅～ · 2019-09-16 08:44:03 发布

使用gradient descent来训练模型的话都要在数据预处理步骤进行数据归一化。原因如下：

根据反向传播公式：

如果输入层 x 很大，在反向传播时候传递到输入层的梯度就会变得很大。梯度大，学习率就得非常小，否则会越过最优。在这种情况下，学习率的选择需要参考输入层数值大小，而直接将数据归一化操作，能很方便的选择学习率。而且受 x 和 w 的影响，各个梯度的数量级不相同，因此，它们需要的学习率数量级也就不相同。对 w1 适合的学习率，可能相对于 w2 来说会太小，如果仍使用适合 w1 的学习率，会导致在 w2 方向上走的非常慢，会消耗非常多的时间，而使用适合 w2 的学习率，对 w1 来说又太大，搜索不到适合 w1 的解。

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐