
来源:由半导体行业不雅察翻译整顿自thenextplatform ,感谢。
在Google I/O 2016的主题演讲进入尾声时,谷歌的CEO皮采提到了一项他们这段时光在AI和机械进修上取得的结不雅,一款叫做Tensor Processing Unit(张量处理单位)的处理器,简称TPU。在这个月看来,第一代的TPU处理器已经由时。
在今天凌晨举办的谷歌I/O 2017大年夜会上,谷歌除了宣传了安卓8.0之外,更为重要的是侧重谈到了人工智能,于是第二代TPU也就应运而生。TPU是谷歌自立研发的一种转为AI运算办事的高机能处理器,其第一代产品已经在AlphaGo如许的人工智能傍边应用,主攻运算机能。
第二代TPU比拟较于初代主如果加深了人工智能在进修和推理方面的才能,至于机能的话,全新的谷歌TPU可以达到180TFLOPs的浮点机能,和传统的GPU比拟晋升15倍,更是CPU浮点机能的30倍。
别的谷歌还推出了一款叫做TPU pod的运算阵列,最多可以包含64颗二代TPU,也就是说浮点机能可以达到惊人的11.5PFLOPS。
大年夜名字上我们可以看出,TPU的灵感来源竽暌冠Google开源深度进修框架TensorFlow,所以今朝TPU照样只在Google内部应用的一种芯片。
TPU 出生
2011年,Google 意识到他们碰到了问题。他们开端卖力推敲应用深度进修收集了,这些统??算需求高,令他们的计算资本变得重要。Google 做了一笔计算,如不雅每位用户天天应用3分钟他们供给的基于深度进修语音辨认模型的语音搜刮办事,他们就必须把现有的数据中间扩大年夜两倍。他们须要更强大年夜、更高效的处理芯片。
他们须要什么样的芯片呢?中心处理器(CPU)可以或许异常高效地处理各类计算义务。但 CPU 的局限是一次只能处理相对来说很少量的义务。另一方面,图像处理单位(GPU) 在履行单个义务时效力较低,并且所能处理的义务范围更小。不过,GPU 的强大年夜之处在于它们可以或许同时履行很多义务。例如,如不雅你须要乘3个浮点数,CPU 会强过 GPU;但如不雅你须要做100万次3个浮点数的乘法,那么 GPU 会碾压 CPU。
GPU 是幻想的深度进修芯片,因为复杂的深度进修收集须要同时进行数百万次计算。Google 应用 Nvidia GPU,但这还不敷,他们想要更快的速度。他们须要更高效的芯片。单个 GPU 耗能不会很大年夜,然则如不雅 Google 的数百万台办事器日夜一向地运行,那么耗能会变成一个严重问题。
谷歌决定本身造更高效的芯片。
2016年5月,谷歌在I/O大年夜会上初次颁布了TPU(张量处理单位),并且称这款芯片已经在谷歌数据中间应用了一年之久,李世石大年夜战 AlphaGo 时,TPU 也在应用之中,并且谷歌将 TPU 称之为 AlphaGo 击败李世石的“机密兵器”。
恰是因为如斯,在相对简单和单一的设备上先辈行练习,然后将结不雅带入带更为复杂的情况中去,大年夜而获得更高层次的数据推理才能,这一迭代工程是必弗成少的。将来,英特尔推出的用于人工智能的GPU也将会采取这一迭代模式。英伟达的Volta GPU也是如斯。


该图显示了TPU上的内部构造,除了外挂的DDR3内存,捉崾登主机界面。指令大年夜主机发送到队列中(没有轮回)。这些激活控制逻辑可以根据指令多次运行雷同的指令。
TPU并非一款复杂的硬件,它看起来像是雷达应用的旌旗灯号处理引擎,而不是标准的X86衍生架构。Jouppi说,尽管它有浩瀚的矩阵乘法单位,然则它GPU更精于浮点单位的协处理。别的,须要留意的是,TPU没有任何存储的法度榜样,它可以直接大年夜主机发送指令。
TPU上的DRAM作为一个单位并交运行,因为须要获取更多的权重以馈送到矩阵乘法单位(算下来,吞吐量达到了64,000)。Jouppi并没有提到是他们是若何缩放(systolic)数据流的,但他表示,应用主机软件加快器都将成为瓶颈。
第一代TPU内部架构

256×256阵列缩放数据流引擎,经由矩阵乘法积聚后实现非线性输出
大年夜第二张图片可以看出,TPU有两个内存单位,以及一个用于模型中参数的外部DDR3 DRAM。参数进来后,可大年夜顶部加载到矩阵乘法单位中。同时,可以大年夜左边加载激活(或大年夜“神经元”输出)。那些以紧缩的方法进入矩阵单位以产生矩阵乘法,它可以在每个周期中进行64,000次累加。
毋庸置疑,谷歌可能应用了一些新的技能和技巧来加快TPU的机能和效力。例如,应用高带宽内存或混淆3D内存。然而,谷歌的问题在于保持分布式硬件的一致性。
可以或许进行数据 推理的第二代TPU
第一代的TPU只能用于深度进修的第一阶段,而新版则能让神经收集对数据做出推论。谷歌大年夜脑研究团队主管Jeff Dean表示:“我估计我们将更多的应用这些TPU来进行人工智能培训,让我们的实验周期变得加倍快速。”
“在设计第一代TPU产品的时刻,我们已经建立了一个相对完美和出色的研发团队进行芯片的设计研发,这些研发人员也根本上都介入到了第二代TPU的研发工程中去。大年夜研发的角度来看,第二代TPU相对于第一代来说,主如果大年夜整系一切的角度,晋升单芯片的机能,这比大年夜无到有的设计第一代TPU芯片来说要简单很多。所以我们才能有更多的精力去思虑若何晋升芯片的机能,若何将芯片更好的┞符合到体系中去,使芯片发挥更大年夜的感化。”Dean在演讲中表示。
对于哪些对于谷歌为什么不将芯片进行贸易化的仁攀来说,以上的内容大年夜概可以或许给出一个答复。跟着人工智能和神经进修技巧的赓续成长,TPU将可以或许在谷歌云上大年夜展拳脚,成为推动技巧进步的一大年夜力量。
推荐阅读
深度进修的核心问题就是一个异常难的优化问题。所以在神经收集惹人后的几十年间,深度神经收集的优化问题的艰苦性是阻碍它们成为主流的一个重要身分。并导致了它们在20世纪90年代到21世纪>>>详细阅读
地址:http://www.17bianji.com/lsqh/35381.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示