2016年9月份,谷歌宣布了基于神经收集的翻译体系(GNMT),并传播鼓吹GNMT在多个重要说话对的翻译中将翻译误差降低了55%-85%以上,并将此翻译体系的技巧细节在论文(
Google’s Neural Machine Translation System: Bridging the Gap
between Human and Machine Translation

一般来说,NMT【神经收集翻译体系】平日会含用两个RNN【递归神经收集】,一个用来接收输入文本,另一个用来产生目标语句,与此同时,还会惹人当下风行的留意力机制【attention mechanism】使得体系处理长句子时更精确高效。但谷歌认为,平日如许的神经收集体系有三个弱点:
- 练习速度很慢并且须要巨大年夜的计算资本,因为数量浩瀚的参数,其翻译速度也远低于传统的基于短语的翻译体系【PBMT】。
- 对罕有词典处理很无力,而直接复制原词在很多情况下肯定不是一个好的解决办法。
- 在处理长句子的时刻会有漏翻的现象。
)在展示,在浏览之后收益匪浅。
二、概要
并且GNMT致力于解决以上的三个问题,在GNMT中,RNN应用的是8层(实际上Encoder是9层,输入层是双向LSTM。)含有残差连接的神经收集,残差连接可以赞助某些信息,比如梯度、地位信息等的传递。同时,attention层与decoder的底层以及encoder的顶层相连接,如图:
一、媒介

GNMT构造图
- 为懂得决翻译速度问题,谷歌在翻译过程中应用了低精度的算法(将模型中的部分参数限制为8bit)以及应用了TPU。
- 为了更好的处理低词频的词,谷歌在输入和输出中应用了sub-word units也叫wordpieces,(比如把’higher‘拆分成‘high’和‘er’,分别进行处理)
*在beamsearch中,谷歌参加了长度规范化和嘉奖处罚(coverage penalty)使对翻译过程中产生的长度不合的句子处理更高效并且削减模型的漏翻。
接下来就具体的看一下神奇的GNMT模型的细节。
三、模型构造
如上图所示,GNMT和平日的模型一样,拥有3个构成部分 -- 一个encoder,一个decoder,和一个attention network 。encoder将输入语句变成一系列的向量,每个向量代表原语句的一个词,decoder会应用这些向量以及其自身已经生成的词,生成下一?词。encoder和decoder经由过程attention network连接,这使得decoder可以在产生目标词时存眷原语句的不合部分。
此外,如我们所想,要使翻译体系有一个好的精确率,encoder和decoder的RNN收集都要足够深,以获取原句子和目标语句中不轻易被留意的细节,在谷歌的实验中,没增长一层,会使PPL降低约10%。
关于模型中的attention机制,采取了如下的公式来计算:

attention的公式
其实袈溱此我有一个疑问,这里最后的a i 是一个向量呢?照样一个标量(一个数值)。大年夜式中看似乎是一个标量,但我在之前懂得的是attention是一个跟输入语句单词数量等长的向量。
3.1残差连接
如膳绫擎提到的,独裁堆叠的LSTM收集平日会比层数少的收集有更好的机能,然而,简单的错层堆叠会造成练习的迟缓以及轻易受到剃度爆炸或梯度消掉的影响,在实验中,简单堆叠在4层工作优胜,6层简单堆叠机能还好的收集很少见,8层的就更罕有了,为懂得决这个问题,在模型中惹人了残差连接,如图,

将第i层的输入与第i层LSTM的隐状况一路,作为第i+1层LSTM的输入,

没有惹人残差连接的LSTM示意图

惹人残差连接的LSTM示意图
3.2Encoder的第一层双向LSTM
一句话的译文所须要的关键词可能在涌如今原文的任何地位,并且原文中的信息可能是大年夜右往左的,也可能分散并且分别在原文的不合地位,因为为了获得原文更多更周全的信息,双向RNN可能是个很好的选择,在本文的模型构造中,只在Encoder的第一层应用了双向RNN,其余的层仍然是单向RNN。

Bi-directions RNN示意图
可以看到,粉色的LSTM大年夜左往右的处理句子,绿色的LSTM大年夜右往左,二者的输出先是连接,然后再传给下一层的LSTM。
3.3模型的苹叫练习
这一部分主如果介绍模型在练习过程一一些加快的办法。
谷歌同时采取了数据平行和模型平行两种方法以加快练习,数据平行很直接,就是把模型复制并安排n份,每份的参数是共享的,每份练习时都以Batch的情势练习,即同时练习batch-size句话。在谷歌实验中,n平日是10,而batch-size平日是128,然后用Adam和SGD的办法来更新参数。
假设decoder RNN的输出是y t ,那在softmax层,概率向量p t 改为如许计算:

除了数据平行,实验中还采取了模型平行,即,将每一层收集安排在一个GPU上,如最上方的图所示,如许在Encoder的第一层双向RNN计算完之后,下一时光步不须要等本时光步完全运行完就可以开端,并行计算加快了练习速度。
推荐阅读
遵守各类数据隐私法中国新的收集安然法已经生效,这意味着全球范围内新增一个国际数据隐私法,这可能给跨国企业带来更多挑衅。企业可以在2018年再开端遵守欧盟的《一般数据保护条例》(GDP>>>详细阅读
本文标题:GNMT-谷歌的神经网络翻译系统
地址:http://www.17bianji.com/lsqh/35848.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示