作家
登录

LSTM、GRU与神经图灵机:详解深度学习最热门的循环神经网络

作者: 来源: 2017-07-10 11:53:43 阅读 我要评论

经由过程一种有效的基于梯度的算法,误差反向流动问题可以克服,因为该算法让收集架构可以强迫常量(是以不会有爆炸或消掉)误差流过特别单位的内部状况。这些单位可以削减「输入权重冲突(Input Weight Conflict)」和「输出权重冲突(Output Weight Conflict)」的影响。

输入权重冲突:如不雅输入长短零的,则同样的输入权重必须被同时用于存储特定的输入并忽视其它输入,那么这就将会经常收到有冲突的权重更新旌旗灯号。

这些旌旗灯号将会试图使该权重介入存储输入并保护该输入。这种冲突会使进修变得艰苦,并且须要一个对背景更敏感的机制来经由过程输入权重控制「写入操作(write operations)」。

输出权重冲突:只要一个单位的输出长短零的,那么这个单位的输出连接的权重就将吸引在序列处理过程中生成的有冲突的权重更新旌旗灯号。

NTM 实验

这些旌旗灯号将试图使正在输出的权重介入进来,获取存在在处理单位中信息,并且在不合的时光保护后续的单位免受正被馈送的单位的输出的干扰。

这些冲突并不特定于经久滞后(long-term lags),并且也可以同样影响到短期滞后(short-term lags)。值得留意的是,跟着滞后的增长,存储的信停战须被保护起来免受干扰,尤其是在进修的高等阶段。

收集架构:不合类型的单位都可能传递关于收集当缁ご态的有效信息。比如说,一个输入门(输出门)可能会应用来自其它记忆单位(memory cell)的输仁攀来决定是否存储(攫取)其记忆单位中的特定信息。

记忆单位包含门(gate)。门特定于它们调剂的连接。输入门是为了改┞俘输入权重冲突,而输出门是为了清除输出权重冲突。

门:具体来说,为了缓解输入和输出权重冲突以及干扰,我们惹人了一个乘法输入门单位来保护存储的记忆内容免受不相干输入的干扰,还惹人了一个乘法输出门单位来保护其它单位免受存储中当前不相干记忆内容的干扰。

LSTM 架构示例

LSTM 架构示例。这个 LSTM 收集带有 8 个输入单位、4 个输出单位和 2 个大年夜小为 2 的记忆单位模块。in1 是指输入门,out1 是指输出门,cell1 = block1 是指 block 1 的第一个记忆单位。来自 1997 年的《Long Short-Term Memory》

记忆单位模块:记忆单位共享同一个输入门和同一个输出门,构成一种名叫记忆单位模块(memory cell block)的构造。

记忆单位模块有利于信息存储;就像传统的神经收集一样,在单个单位内编码一个分布式输入可不是一件轻易的工作。一个大年夜小为 1 的记忆单位模块就是一个简单的记忆单位。

进修(Learning):一种推敲了由输入和输出门导致的修悛改的、乘法动态的及时轮回进修(RTRL/Real Time Recurrent Learning)的变体被用于确保经由过程记忆单位误差的内部状况反向传播达到「记忆单位收集输入(memory cell net inputs)」的非衰减误差(non-decaying error)不会在时光中被进一办法向传播。

猜测(Guessing):这种随机办法可以超出很多时光滞后算法。事实已经解释,之前的工作中所应用典范多长时光滞后义务可以经由过程简单的随机权重猜测获得比提出的算法更快的解决。

  • 拜见 S. Hochreiter 和 J. Schmidhuber《Long-Short Term Memory》:http://dl.acm.org/citation.cfm?id=1246450

LSTM 轮回神经收集最有意思的应用涌如今说话处理范畴。更周全的描述可参阅 Gers 的论文 :

  • F. Gers 和 J. Schmidhuber 2001 年的论文《LSTM Recurrent Networks Learn Simple Context Free and Context Sensitive Languages》:ftp://ftp.idsia.ch/pub/juergen/L-IEEE.pdf
  • F. Gers 2001 年的博士论文《Long Short-Term Memory in Recurrent Neural Networks》:http://www.felixgers.de/papers/phd.pdf

LSTM 有效的截断版本无法轻松解决类似于「强延迟的异或(strongly delayed XOR)」如许的问题。

每个记忆单位模块都须要一个输入门和一个输出门。并不必定须要其它轮回办法。

在记忆单位内穿过「常量误差传送带(Constant Error Carrousels)」的常量误差流可以获得与传统的前馈架构(会一次性获得全部输入串)一样的效不雅。

和其它前馈办法一样,LSTM 也有「regency」概念上的缺点。如不雅须要周详的计数时光步调,那么可能就须要额外的计数机制。

LSTM 的长处

该算法桥接长时光滞后的才能来自其架构的记忆单位中的常量误差反向传播。

LSTM 可以近似有噪声的问题域、分布式表征和持续值。

因为处理元素的多样性和反馈连接的,LSTM 中的连接比独裁感知器的连接复杂。

在问题域上对收集参数进行微调看起来是不须要的。

在每个权重和时光步的更新复杂度方面,LSTM 根本上就等于 BPTT。

LSTM 很强大年夜,在机械翻译等范畴实现了当缁ゎ佳的结不雅。

门控轮回单位神经收集

门控轮回单位神经收集已经在序列和时光数据上获得了成功的应用。

最合适语音辨认、天然说话处理和机械翻译。与 LSTM 一路,它们在长序列问题范畴表示优良。

门控(gating)被认为是在 LSTM 主题中,涉及到一个门控收集生成旌旗灯号来控制当前输入和之前记忆产生感化的方法,以更新当前的激活,大年夜而更新当前的收集状况。

门本身是自我加权的,会在全部进修阶段中根据一个算法有选择性地更新。

门收集会增长计算复杂度,大年夜而会增长参数化(parameterization),进而惹人额外的计算成本。

LSTM RNN 架构将简单 RNN 的计算用作内部记忆单位(状况)的中心候选项。门控轮回单位(GRU)RNN 将 LSTM RNN 模型的门控旌旗灯号削减到了 2 个。这两个门分别被称为更新门(update gate)和重置门(reset gate)。


  推荐阅读

  百度Web生态开花结果:Lavas等多项新技术帮助开发者效率提升

【51CTO.com原创稿件】在移动互联网时代,人们开端习惯经由过程一个个自力的App去解决问题,但弗成否定的是App也存在诸如占用空间大年夜、下载应用成本高等问题。基于此,百度、谷歌等搜刮>>>详细阅读


本文标题:LSTM、GRU与神经图灵机:详解深度学习最热门的循环神经网络

地址:http://www.17bianji.com/lsqh/36102.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)