作家
登录

听说你了解深度学习最常用的学习算法:Adam优化算法?

作者: 来源: 2017-07-13 11:20:51 阅读 我要评论

2.1 Adam 的更新规矩

Adam 算法更新规矩的一个重要特点就是它会很谨慎地选择步长的大年夜小。假定ε=0,则在时光步 t 和参数空间上的有效降低步长为有效降低步长有两个上确界:即在情况下,有效步长的上确界知足和其他情况下知足 |∆t| ≤ α。第一种情况只有在极其稀少的情况下才会产生:即梯度除了当前时光步不为零外其他都为零。而在不那么稀少的情况下,有效步长将会变得更小。当

时,我们有,是以可以得出上确界 |∆t| < α。在更通用的场景中,因为 |E[g]/ p E[g^2]| ≤ 1,我们有。每一个时光步的有效步长在参数空间中的量级近似受限于步长因子α,即。这个可以懂得为在当前参数值下肯定一个置信域,是以其要优于没有供给足够信息的当前梯度估计。这正可以令其相对简单地提前知道α精确典范围。

对于很多机械进修模型来说,我们知道好的最优状况是在参数空间内的集合域上有极高的概率。这并不罕有,例如我们可以在参数上有一个先验分布。因为α肯定了参数空间内有效步长的量级(即上确界),我们经常可以揣摸出α的┞俘确量级,而最优解也可以大年夜θ0 开端经由过程必定量的迭代而达到。我们可以将称之为信噪比(signal-to-noise ratio/SNR)。如不雅 SNR 值较小,那么竽暌剐效步长∆t 将接近于 0,目标函数也将收敛到极值。这是异常令人知足的属性,因为越小的 SNR 就意味着算法对偏向是否相符真实梯度偏向存在着越大年夜的不肯定性。例如,SNR 值袈溱最优解邻近趋势于 0,是以也会在参数空间有更小的有效步长:即一种主动退火(automatic annealing)的情势。有效步长∆t 对于梯度缩放来说仍然是不变量,我们如不雅用因子 c 重缩放(rescaling)梯度 g,即相当于用因子 c 重缩放和用因子 c^2 缩放,而在枷⒚鹋噪比时缩放因子会获得抵消:

3 初始化误差修改

正如本论文第二部分算法所述,Adam 应用了初始化误差修改项。本部分将由二阶矩估计推导出这一误差修改项,一阶矩估计的推导美满是类似的。起首我们可以求得随机目标函数 f 的梯度,然后我们欲望能应用平方梯度(squared gradient)的指数移动均值和衰减率β2 来估计它的二阶原始矩(有偏方差)。令 g1, ..., gT 为时光步序列上的梯度,个中每个梯度都服年腋荷琐潜在的梯度分布 gt ∼ p(gt)。如今我们初始化指数移动均值 v0=0(零向量),而指数移动均值袈溱时光步 t 的更新可表示为:个中 gt^2 表示 Hadamard 积 gt⊙gt,即对应元素之间的乘积。同样我们可以将其改写为在前面所有时光步上只包含梯度和衰减率的函数,即消去 v:

我们欲望知道时光步 t 上指数移动均值的期望值 E[vt] 若何与真实的二阶矩相接洽关系,所以我们可以对这两个量之间的误差进行修改。下面我们同时对表达式(1)的左边和右边去期望,即如下所示:

如不雅真实二阶矩 E[g 2 i ] 是静态的(stationary),那么ζ = 0。不然 ζ 可以保存一个很小的值,这是因为我们应钙揭捉?择指数衰减率 β1 以令指数移动均值分派很小的权重给梯度。所以初始化均值为零向量就造成了只留下了 (1 − βt^2 ) 项。我们是以在算法 1 中除以了ζ项以修改初始化误差。

在稀少矩阵中,为了获得一个靠得住的二阶矩估计,我们须要选择一个很小的 β2 而在很多梯度上取均值。然而正好是这种小β2 值的情况导致了初始化误差修改的缺乏,是以页就令初始化步长过大年夜。


  推荐阅读

  世纪互联蓝云是这样运营微软云服务的!

【51CTO.com原创稿件】提到世纪互联蓝云,大年夜家都邑想到微软智能云Azure。切实其实,蓝云是为Microsoft Azure而生,在Microsoft Azure计算进入中国时,选择世纪互联作为落地的合作伙伴>>>详细阅读


本文标题:听说你了解深度学习最常用的学习算法:Adam优化算法?

地址:http://www.17bianji.com/lsqh/36189.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)