
深度进修经常须要大年夜量的时光和机算资本进行练习,这也是困扰深度进修算法开辟的重大年夜原因。固然我们可以采取分布式并行练习加快模型的进修,但所需的计算资本并没有涓滴削减。而唯有须要资本更少、令模型收敛更快的最优化算法,才能大年夜根本上加快机械的进修速度和效不雅,Adam 算法正为此而生!
Adam 优化算法是随机梯度降低算法的扩大式,比来其广泛用于深度进修应用中,尤其是计算机视觉和天然说话处理等义务。本文分为两部分,前一部分扼要介绍了 Adam 优化算法的特点和其在深度进修中的应用,后一部分大年夜 Adam 优化算法的原论文出发,具体解释和推导了它的算法过程和更新规矩。我们欲望读者在读完两部分后能懂得控制以下几点:
- Adam 算法是什么,它为优化深度进修模型带来了哪些优势。
- Adam 算法的道理机制是怎么样的,它与相干的 AdaGrad 和 RMSProp 办法有什么差别。
- Adam 算法应当若何调参,它常用的设备参数是怎么样的。
- Adam 的实现优化的过程和权重更新规矩
- Adam 的初始化误差修改的推导
- Adam 的扩大情势:AdaMax
什么是 Adam 优化算法?
Adam 是一种可以替代传统随机梯度降低过程的一阶优化算法,它能基于练习数据迭代地更新神经收集权重。Adam 最开端是由 OpenAI 的 Diederik Kingma 和多伦多大年夜学的 Jimmy Ba 在提交到 2015 年 ICLR 论文(Adam: A Method for Stochastic Optimization)中提出的。本文前后两部分都基于该论文的阐述和解释。
起首该算法名为「Adam」,其并不是首字母缩写,也不是人名。它的名称来源竽暌冠适应性矩估计(adaptive moment estimation)。在介绍这个算法时,原论文列举了将 Adam 优化算法应用在非凸优化问题中所获得的优势:
- 直截了本地实现
- 高效的计算
- 所需内存少
- 梯度对角缩放的不变性(第二部分将赐与证实)
- 合适解决含大年夜范围数据和参数的优化问题
- 实用于非稳态(non-stationary)目标
- 实用于解决包含很高噪声或稀少梯度的问题
- 超参数可以很直不雅地解释,并且根本上只需极少量的调参
Adam 优化算法的根本机制
Adam 算法和传统的随机梯度降低不合。随机梯度降低保持单一的进修率(即 alpha)更新所有的权重,进修率在练习过程中并不会改变。而 Adam 经由过程计算梯度的一阶矩估计和二阶矩估计而为不合的参数设计自力的自适应性进修率。
该表达式就对应相当于极其简单的迭代公式:
Adam 算法的提出者描述其为两种随机梯度降低扩大式的长处集合,即:
- 适应性梯度算法(AdaGrad)为每一个参数保存一个进修率以晋升在稀少梯度(即天然说话和计算机视觉问题)上的机能。
- 均方根传播(RMSProp)基于权重梯度比来量级的均值为每一个参数适应性地保存进修率。这意味着算法在非稳态和在线问题上有很有优良的机能。

Adam 算法同时获得了 AdaGrad 和 RMSProp 算法的长处。Adam 不仅如 RMSProp 算法那样基于一阶矩均值盘吮善?性参数进修率,它同时还充分应用了梯度的二阶矩均值(即竽暌剐偏方差/uncentered variance)。具体来说,算法计算了梯度的指数移动均值(exponential moving average),超参数 beta1 和 beta2 控制了这些移动均值的衰减率。
移动均值的初始值和 beta1、beta2 值接近于 1(推荐值),是以矩估计的误差接近于 0。该误差经由过程起首计算带误差的估计而后计算误差修改后的估计而获得晋升。如不雅对具体的实现细节和推导过程感兴趣,可以持续浏览该第二部分和原论文。
Adam 算法的高效性
Adam 在深度进修范畴内是十分风行的算法,因为它能很快地实现优良的结不雅。经验性结不雅证实 Adam 算法在实践中机能优良,相对于其他种类的随机优化算法具有很大年夜的优势。
在原论文中,作者经验性地证清楚明了 Adam 算法的收敛性相符理论性的分析。Adam 算法可以在 MNIST 手写字符辨认和 IMDB 情感分析数据集上应用优化 logistic 回归算法,也可以在 MNIST 数据集上应用于独裁感知机算法和在 CIFAR-10 图像辨认数据集上应用于卷积神经收集。他们总结道:「在应用大年夜型模型和数据集的情况下,我们证清楚明了 Adam 优化算法在解决局部深度进修问题上的高效性。」


Adam 优化算法和其他优化算法在独裁感知机模型中的比较
事实上,Insofar、RMSprop、Adadelta 和 Adam 算法都是比较类似的优化算法,他们都在类似的情景下都可以履行地异常好。然则 Adam 算法的误差修改令其在梯度变得稀少时要比 RMSprop 算法更快速和优良。Insofar 和 Adam 优化算法根本是最好的全局选择。同样在 CS231n 课程中,Adam 算法也推荐作为默认的优化算法。
推荐阅读
【51CTO.com原创稿件】提到世纪互联蓝云,大年夜家都邑想到微软智能云Azure。切实其实,蓝云是为Microsoft Azure而生,在Microsoft Azure计算进入中国时,选择世纪互联作为落地的合作伙伴>>>详细阅读
本文标题:听说你了解深度学习最常用的学习算法:Adam优化算法?
地址:http://www.17bianji.com/lsqh/36189.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示