作家
登录

LSTM、GRU与神经图灵机:详解深度学习最热门的循环神经网络

作者: 来源: 2017-07-10 11:53:43 阅读 我要评论

轮回神经收集(RNN/recurrent neural network)是一类人工神经收集,其可以经由过程为收集添加额外的权重来在收集图(network graph)中创建轮回,以便保持一个内部状况。

为神经收集添加状况的好处是它们将能在序列猜测问题中明白地进修和应用背景信息(context),这类问题包含带有次序或时光组件的问题。

在这篇文┞仿中,你将踏上懂得用于深度进修的轮回神经收集的路程。

在读完这篇文┞仿后,你将懂得:

  • 用于深度进修的顶级轮回神经收集的工作方法,个中包含 LSTM、GRU 和 NTM。
  • 顶级 RNN 与人工神经收集中更广泛的轮回(recurrence)研究的相干性。
  • RNN 研究如安在一系列高难度问题上实现了当缁ゎ佳的表示。

留意,我们并不会覆盖每一种可能的轮回神经收集,而是会重点存眷几种用于深度进修的轮回神经收集(LSTM、GRU 和 NTM)以及用于懂得它们的背景。

那就让我们开端吧!

概述

我们起首会设制揭捉?环神经收集范畴的场景;然后,我们精深刻懂得用于深度进修的 LSTM、GRU 和 NTM;之后我们会花点时光介绍一些与用于深度进修的 RNN 相干的高等主题。

  • 轮回神经收集
  • 完全轮回收集(Fully Recurrent Networks)
  • 递归神经收集(Recursive Neural Networks)
  • 神阅汗青紧缩器(Neural History Compressor)
  • 长短期记忆收集(LSTM)
  • 门控轮回单位(GRU)神经收集
  • 神经图灵机(NTM)

轮回神经收集

起首让我们设置场景。

人们广泛认为轮回(recurrence)是给收集拓扑构造供给一个记忆(memory)。

一种更好的看法是练习集包含一种样本——其带有一组用于轮回练习样本的输入。这是「传统的惯例」,比如传统的独裁感知器

X(i) -> y(i)

然则钙揭捉?练样本获得潦攀来自之前的样本的一组输入的弥补。这是「非传统的」,比如轮回神经收集

[X(i-1), X(i)] -> y(i)

和所有的前馈收集范式一样,问题的关键是若何将输入层连接到输出层(包含反馈激活),然后练习该构造使其收敛。

如今,让我们来看看几种不合的轮回神经收集,起首大年夜异常简单的概念开端

完全轮回收集

独裁感知器的分类构造获得了保存,但该架构中的每个元素与其它每个元素之间都有一个加权的连接,并且还有一个与其自身的反馈连接。

并不是所有这些连接都邑被练习,并且其误差导数的极端非线性意味着传统的反向传播无法起效,是以只能应用经由过程时光的反向传播(Backpropagation Through Time)办法或随机梯度降低(SGD)。

  • 别的,可参阅 Bill Willson 的┞放量积收集(Tensor Product Networks):http://www.cse.unsw.edu.au/~billw/cs9444/tensor-stuff/tensor-intro-04.html

LSTM 可以很好地泛化其所推敲的问题域。这是很重要的,因为有的义务无法用已有的轮回收集解决。

递归神经收集

轮回神经收集是递归收集的线性架构变体。

递归(recursion)可以促进分层特点空间中的分支,并且其所获得的收集架构可以在练习进行中模仿它。

其练习是经由过程子梯度办法(sub-gradient methods)应用随机梯度实现的。

神经图灵机架构

R. Socher 等人 2011 年的论文《Parsing Natural Scenes and Natural Language with Recursive Neural Networks》中应用 R 说话对其进行了具体的描述,参阅:http://machinelearning.wustl.edu/mlpapers/paper_files/ICML2011Socher_125.pdf

神阅汗青紧缩器

在 1991 年,Schmidhuber 起首申报了一种异常深度的进修器,其可以经由过程一种 RNN 层次的无监督预练习来在数百个神经层上履行功绩分派(credit assignment)。

每个 RNN 都是无监督练习的,可以猜测下一?输入。然后只有产生缺点的输入会被前馈,将新信息传送到该层次构造中的下一? RNN,然后以更慢的、自组织的时光标准进行处理。

事实注解不话苄信息损掉,只是会有紧缩。该 RNN stack 是数据的一个「深度生成模型(deep generative model)。这些数据可以根据其紧缩情势重建。

  • 参阅 J. Schmidhuber 等人 2014 年的论文《Deep Learning in Neural Networks: An Overview》:http://www2.econ.iastate.edu/tesfatsi/DeepLearningInNeuralNetworksOverview.JSchmidhuber2015.pdf

当误差被反向传播经由过程大年夜型构造时,非线性导数的极限(extremity)的计算会增长,会使功绩分派(credit assignment)艰苦甚至是弗成能,使得反向传播掉败。

长短期记忆收集

应用传统的经由过程时光的反向传播(BPTT)或及时轮回进修(RTTL/Real Time Recurrent Learning),在时光中反向流动的误差旌旗灯号往往会爆炸(explode)或消掉(vanish)

反向传播误差的时光演变指数式地依附于权重的大年夜小。权重爆炸可能会导致权重振荡,而权重消掉则可能导致进修弥应时光滞后并消费过多时光或根本不工作。

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)