权重衰减（weight decay）与学习率衰减（learning rate decay）

全栈程序员-用户IM • 2022年6月12日下午9:00 • 未分类

权重衰减（weight decay）与学习率衰减（learning rate decay）“微信公众号”1.权重衰减（weightdecay）L2正则化的目的就是为了让权重衰减到更小的值，在一定程度上减少模型过拟合的问题，所以权重衰减也叫L2正则化。1.1L2正则化与权重衰减系数L2正则化就是在代价函数后面再加上一个正则化项：其中C0代表原始的代价函数，后面那一项就是L2正则化项，它是这样来的：所有参数w的平方的和，除以训练集的样本大小n。λ就是正则项系数，权衡正则项与C0项的比…

大家好，又见面了，我是你们的朋友全栈君。

“微信公众号”

权重衰减（weight decay）与学习率衰减（learning rate decay）

1. 权重衰减（weight decay）

L2正则化的目的就是为了让权重衰减到更小的值，在一定程度上减少模型过拟合的问题，所以权重衰减也叫L2正则化。

1.1 L2正则化与权重衰减系数

L2正则化就是在代价函数后面再加上一个正则化项：

其中C0
代表原始的代价函数，后面那一项就是L2正则化项，它是这样来的：所有参数w的平方的和，除以训练集的样本大小n。λ就是正则项系数，权衡正则项与C0
项的比重。另外还有一个系数1/2
，1/2 1/211
经常会看到，主要是为了后面求导的结果方便，后面那一项求导会产生一个2，与1/2
相乘刚好凑整为1。系数λ
就是
权重衰减系数
。

1.2 为什么可以对权重进行衰减

我们对加入L2正则化后的代价函数进行推导，先求导：

可以发现L2正则化项对b的更新没有影响，但是对于w的更新有影响：

在不使用L2正则化时，求导结果中w前系数为1，现在w前面系数为1-ηλ/n，因为η、λ、n都是正的，所以1-ηλ/n小于1，它的效果是减小w，这也就是权重衰减（weight decay）的由来。当然考虑到后面的导数项，w最终的值可能增大也可能减小。

另外，需要提一下，对于基于mini-batch的随机梯度下降，w和b更新的公式跟上面给出的有点不同：

对比上面w的更新公式，可以发现后面那一项变了，变成所有导数加和，乘以η再除以m，m是一个mini-batch中样本的个数。

1.3 权重衰减（L2正则化）的作用

作用：权重衰减（L2正则化）可以避免模型过拟合问题。

思考： L2正则化项有让w变小的效果，但是为什么w变小可以防止过拟合呢？

原理：（1）从模型的复杂度上解释：更小的权值w，从某种意义上说，表示网络的复杂度更低，对数据的拟合更好（这个法则也叫做奥卡姆剃刀），而在实际应用中，也验证了这一点，L2正则化的效果往往好于未经正则化的效果。（2）从数学方面的解释：过拟合的时候，拟合函数的系数往往非常大，为什么？如下图所示，过拟合，就是拟合函数需要顾忌每一个点，最终形成的拟合函数波动很大。在某些很小的区间里，函数值的变化很剧烈。这就意味着函数在某些小区间里的导数值（绝对值）非常大，由于自变量值可大可小，所以只有系数足够大，才能保证导数值很大。而正则化是通过约束参数的范数使其不要太大，所以可以在一定程度上减少过拟合情况。

内容来自：
正则化方法：L1和L2 regularization、数据集扩增、dropout

2. 学习率衰减（learning rate decay）

在训练模型的时候，通常会遇到这种情况：我们平衡模型的训练速度和损失（loss）后选择了相对合适的学习率（learning rate），但是训练集的损失下降到一定的程度后就不在下降了，比如training loss一直在0.7和0.9之间来回震荡，不能进一步下降。如下图所示：

遇到这种情况通常可以通过适当降低学习率（learning rate）来实现。但是，降低学习率又会延长训练所需的时间。

学习率衰减（learning rate decay）就是一种可以平衡这两者之间矛盾的解决方案。学习率衰减的基本思想是：学习率随着训练的进行逐渐衰减。

学习率衰减基本有两种实现方法：

线性衰减。例如：每过5个epochs学习率减半。
指数衰减。例如：随着迭代轮数的增加学习率自动发生衰减，每过5个epochs将学习率乘以0.9998。具体算法如下：

decayed_learning_rate=learning_rate*decay_rate^(global_step/decay_steps)

其中decayed_learning_rate为每一轮优化时使用的学习率，learning_rate为事先设定的初始学习率，decay_rate为衰减系数，decay_steps为衰减速度。

Reference：

（1）学习率衰减部分内容和图片来自：
学习率衰减（learning rate decay）

（2）
神经网络学习率（learning rate）的衰减

发布者：全栈程序员-用户IM，转载请注明出处：https://javaforall.cn/131135.html原文链接：https://javaforall.cn

【正版授权，激活自己账号】： Jetbrains全家桶Ide使用，1年售后保障，每天仅需1毛

【官方授权正版激活】： 官方授权正版激活支持Jetbrains家族下所有IDE 使用个人JB账号...

学习

全栈程序员-用户IM

0 0

1310-全国-中国古代文学史（二）「建议收藏」

1310-全国-中国古代文学史（二）「建议收藏」1310-全国-中国古代文学史（二）总分：100一、单选题（共30题，共30分）1、苏舜钦的诗歌风格是（）(1分)A:豪犷雄放B:平淡瘦劲C:生新瘦硬D:沉博绝丽2、我国最早的话本小说总集是嘉靖年间洪楩编辑刊刻的《六十家小说》，又称为（）(1分)A:《古今小说》B:《清平山堂话本》C:《今古奇观》D:《型世言》3、徐渭《四声猿》中最杰出的一部作品是（）(1分)A:《狂鼓史渔阳三弄》B:《玉禅师翠乡一梦》C:《雌木兰替父从军》D:《女状元辞凰得凤》4、被称为“昆曲之

全栈程序员-用户IM
2022年5月18日
iostat 命令详解「建议收藏」

iostat 命令详解「建议收藏」概述iostat主要用于输出磁盘IO和CPU的统计信息。iostat属于sysstat软件包。可以用yuminstallsysstat直接安装。iostat用法用法：iostat[选项][<时间间隔>][<次数>]如下图：iostat用法命令参数：-c：显示CPU使用情况-d：显示磁盘使用情况-N：显示磁盘阵列(LVM)信息-n：显示NFS使用情况-k：以KB为单位显示-m：以M为单位显示-t.

全栈程序员-用户IM
2022年10月6日
tcp和udp的区别和使用场景_TCP跟UDP有什么不同

tcp和udp的区别和使用场景_TCP跟UDP有什么不同TCPTCP是一种面向有连接的传输层协议，能够对自己提供的连接实施控制。适用于要求可靠传输的应用，例如文件传输。UDPUDP是一种面向无连接的传输层协议，不会对自己提供的连接实施控制。适用于实时应用，例如：IP电话、视频会议、直播等。…

全栈程序员-用户IM
2022年9月20日
webstorm插件推荐_webstorm中文界面

webstorm插件推荐_webstorm中文界面1.activate-power-mode狂拽炫酷吊炸天装逼的插件，atom上的神器啊,抱着试一试的心态一搜,webstorm上居然也有了,安装之后可以在window->activate-power-mode中关闭震动以及开启彩色模式。2.TabNine可以记录用户习惯自动补全代码，牛逼3.ESLint代码检查插件4.RainbowBrackets彩虹色的括号，颜色可以自行调整，代码块看起来更清晰在这里插入图片描述5.CodeG.

全栈程序员-用户IM
2022年9月9日
latex中参考文献怎么弄进去_论文中的参考文献怎么标注右上角

latex中参考文献怎么弄进去_论文中的参考文献怎么标注右上角参考文献常见问题集1.请问如何将参考文献的计算器置零，然后再计数，格式大致是这样：1文12文2…1文12文2我是这样实现的：beginthebibliography99endthebibliography……beginthebibliography9999endthebibliography我的文本实在ScienticWorkplace中编辑的，建议你也使用这个软件，很…

全栈程序员-用户IM
2022年9月9日
SCSA—信息安全概述

SCSA—信息安全概述数字化时代威胁升级：攻击频发、传统安全防护逐渐失效、安全风险能见度低、缺乏自动化防御手段一、信息安全概述：1）信息安全：防止任何对数据进行未授权访问的措施，或者防止造成信息有意无意泄漏、破坏、丢失等问题的发生，让数据处于远离危险、免于威胁的状态或特性2）网络安全：计算机网络环境下的信息安全二、信息安全的脆弱性及常见安全攻击1.网络的开放性：互联网的美妙之处在于你与每一个相连，它的可怕之处在于每一个人与你相连2.协议栈的脆弱性及常见攻击1）协议栈的自身脆弱性：缺乏数据源验证机制、缺乏机密性保障机

全栈程序员-用户IM
2022年6月20日

权重衰减（weight decay）与学习率衰减（learning rate decay）

1. 权重衰减（weight decay）

1.1 L2正则化与权重衰减系数

1.2 为什么可以对权重进行衰减

1.3 权重衰减（L2正则化）的作用

2. 学习率衰减（learning rate decay）

相关推荐

1310-全国-中国古代文学史（二）「建议收藏」

iostat 命令详解「建议收藏」

tcp和udp的区别和使用场景_TCP跟UDP有什么不同

webstorm插件推荐_webstorm中文界面

latex中参考文献怎么弄进去_论文中的参考文献怎么标注右上角

SCSA—信息安全概述

发表回复