所以,refinement之后模型的评测标准变成了下式:

refinement maximum-likelihood
r(Y, Y (i))就是GLEU值的计算部分。GLEU克服了BLEU在单句评测上的缺点,在本实验中,可以和BLEU值可以很好的合营工作。
为了进一步使练习稳定,谷歌对练习标准作了一个线性的结合,也就是下式:

Mixed maximum-likelihood
残差连接示意图
在实际的练习过程中,先应用O ml 的标准练习使模型收敛,然后应用O mixd 的标准进一步晋升模型的表示。
六、可量化的模型憾キ译过程中的量化
(坦白的说,我并不知道原文中 Quantizable Model and Quantized Inference 应当怎么翻译更好。)
这一部分重要讲的是,因为模型较深且计算量较大年夜,在翻译过程会产生一些问题,所以谷歌在不影响模型收敛和翻译效不雅的前提下,采取了一系列的优化办法。
带有残差连接的LSTM收集,有两个值是会赓续传递计算的,在时光偏向上传递的c i t 和在深度偏向上传递的x i t ,在实验中过程我们发明这些值都是异常小的,为了削减缺点的累积,所以在翻译的过程中,明白的┞封些值限制在[-δ,δ]之间,是以原LSTM的公式调剂如下:

6.1 modified equation
实验结不雅比较

6.2 完全的LSTM计算逻辑
在翻译的过程中,谷歌将6.1和6.2式中所有浮点数运算替代为8位或16位定点整数运算,个中的权重W像下式一样改用8位整数表示:

权重W的调剂
所有的c i t 和x i t 限制在[-δ,δ]之间且改用16位整数表示。
在6.2中的矩阵乘法(比如W 1 x t )改用8位定点整数乘法,而其他的所有运算,比如sigmoid,tanh,点乘,加法等,改用16位整数运算。
修改后的概率向量计算公式
将 logit v t ' 限制在[-γ,γ]之间且权重W s 和6.2式中的权重W同样应用8位整数表示并在运算过程中应用8位矩阵乘法。
但在softmax层和attention层不采取量化办法。
值得一提的是,除了将c i t 和x i t 限制在[-δ,δ]和将logit v t ' 限制在[-γ,γ],在 练习过程 一一向应用的是全精度的浮点数。个中γ取25.0,δ在练习刚开端取8.0然后逐渐变为1.0 。( 在翻译时,δ取1.0 。 )
在进行了这么多改进之后,谷歌传播鼓吹,在英-法,英-中,英-西等多个语对中,缺点率跟之前的PBMT体系比拟降低了60%,并且接军人类的平均翻译程度。

Log perplexity vs. steps
红线代表采取了量化办法的练习过程,蓝线代表通俗的练习,可以看到将一些值限制在必定范围内作为额外的筹划化办法可以改良模型的质量。
七、Decoder
在翻译的过程中,应用了惯例的beam search算法,但惹人了两个重要的优化筹划,即GNMT中的α和β值。
- α值的感化是对译句进行长度规范化,因为拔取一个句子的可能性是由比赛每个词典概率取log后相加获得的,这些个对数概率都是负值,是以某种程度上,长句会取得更小的对数概率,这显然是不合理的,是以须要对译句进行长度筹划化。
- β值的感化是促使模型更好的翻译全句,不漏翻。
关于α和β值实用的公式
个中s(Y,X)代表译文最终获得的分数,p i j 表示在翻译第j个词时其对应第i个词典attention值。
谷歌在文中还提抵站种优化办法:
Firstly, at each step, we>
推荐阅读
遵守各类数据隐私法中国新的收集安然法已经生效,这意味着全球范围内新增一个国际数据隐私法,这可能给跨国企业带来更多挑衅。企业可以在2018年再开端遵守欧盟的《一般数据保护条例》(GDP>>>详细阅读
本文标题:GNMT-谷歌的神经网络翻译系统
地址:http://www.17bianji.com/lsqh/35848.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示