作家
登录

听说你了解深度学习最常用的学习算法:Adam优化算法?

作者: 来源: 2017-07-13 11:20:51 阅读 我要评论

4. 收敛性分析

本论文应用了 Zinkevich 2003 年提出的在线进修框架分析了 Adam 算法的收敛性。

5. 相干研究工作

与 Adam 算法有直接接洽的优化办法是 RMSProp (Tieleman & Hinton, 2012; Graves, 2013) 和 AdaGrad (Duchi et al., 2011)。

6 实验

图 1:在 MNIST 图片集和有 1 万条词袋(BoW)特点向量的 IMDB 片子评论数据集上练习带有负对数似然函数的 Logistic 回归。

而接下来的第二部分我们可以大年夜原论文出发具体展开 Adam 算法的过程和更新规矩等。

图 2:在 MNIST 图片数据集上练习独裁神经收集。(a)图是应用了 dropout 随机正则化的神经收集。(b)图是应用肯定性损掉函数的神经收集。

图 3:卷积神经收集的练习损掉。左图表示前三个 epoch 的练习损掉,右图表示所有 45 个 epoch 上的练习损掉。

图 4:在变分自编码器(VAE)中带误差修改项(红色)和没有误差修改项(绿色)的损掉比较。

7 扩大

7.1 ADAMAX

在 Adam 中,单个权重的更新规矩是将其梯度与当前和以前梯度的 L^2 范数(标量)成反比例缩放。而我们可以将基于 L^2 范数的更新规矩泛化到基于 L^p 范数的更新规矩中。固然如许的变领会因为 p 的值较大年夜而在数值上变得不稳定,然则在特例中,我们令 p → ∞会得出一个极其稳定和R单的算法(见算法 2)。如今我们将推导这个算法,在应用 L^p 范数情况下,时光 t 下的步长和 vt^(1/p) 成反比例变更。

留意这里的衰减项等看法为 β2^p,而不是 β2。如今令 p → ∞,并定义

然后有:

个中初始值 u0 = 0。留意这里十分便利,在该情况下我们不须要修改初始化误差。同样 AdaMax 参数更新的量级要比 Adam 更简单,即|∆t| ≤ α。

【编辑推荐】

  1. 深度进修主动编码器还能用于数据生成?这篇文┞仿告诉你谜底
  2. 推荐体系重要算法总结及Youtube深度进修推荐算法实例概括
  3. 大年夜浅层模型到深度模型:概览机械进修优化算法
  4. 深度进修的祖先之见、局限性及其将来
  5. 情感计算是人机交互核心?谈深度进修在情感分析中的应用
【义务编辑:张子龙 TEL:(010)68476606】

  推荐阅读

  世纪互联蓝云是这样运营微软云服务的!

【51CTO.com原创稿件】提到世纪互联蓝云,大年夜家都邑想到微软智能云Azure。切实其实,蓝云是为Microsoft Azure而生,在Microsoft Azure计算进入中国时,选择世纪互联作为落地的合作伙伴>>>详细阅读


本文标题:听说你了解深度学习最常用的学习算法:Adam优化算法?

地址:http://www.17bianji.com/lsqh/36189.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)