TPU对谷歌意味着什么?


大年夜此次颁布的TPU图片来看,第二代TPU看上却竽暌剐点像Cray XT或者是XC开辟板。大年夜图片上,我们不难发明,互相连接的几个芯片被焊接到了开辟板上,同时保持了芯片之间以及芯片与外部的连接功能。全部板子上共有四个TPU芯片,正如我们之前所说,每一个零丁的芯片都可以达到180TFLOPs的浮点机能。
在开辟板的阁下两侧各有四个对外的接口,然则在板子的左侧额外增长了两个接口,这一情势使得全部板子看上去略显突兀。。如不雅将来每一个TPU芯片都可以或许直接连接到存储器上,就如同AMD即将推出的“Vega”处理器可以直接连接GPU一样,这一构培养镌得异常有趣。左侧多出的┞封两个接口在将来可以许可TPU芯片直接连接存储器,或者是直接连接到上行的高速收集上以进行加倍复杂的运算。
以上这些都是我们基于图片的猜测,除非谷歌可以或许泄漏更多的芯片信息。每一个TPU芯片都有两个接口可以与外部的设备进行连接,左侧有两个额外的接口对外开辟,可以许可开辟者在此基本上设计更多的功能,添加更多的扩大,无论是连接本地存储设备照样连接收集,这些功能在理论上都是可行的。(实现这些功能,谷歌只须要在这些接口之间建立相对松散可行的内存共享协定即可。)
下图展示了多个TPU板一种可能的连接情势,谷歌表示,这一模许可以实现高达11.5切切亿次的机械进修计算才能。


这一结不雅是若何得出的呢。膳绫擎这种连接方法,大年夜外形上来看,异常像开放的计算机架构,或者是其他的一些器械。纵向上来看,叠加了8个TPU板,横向上看,并列了4个TPU板。今朝我们无法断定每一个开辟板都是完全的TPU板或者是半个开辟板,我们只能看到板子的一侧有6个接口,另一侧有2个接口。
值得留意的是,板子的中心采取了4个接口,而阁下两侧采取了2个接口,并且在阁下两侧也没有见到与TPU开辟板类似的外壳。对此,一个比较合理的解释就是,阁下两侧连接的是本地存储寡居口,而不是TPU芯片接口。
即便如斯,我们依旧能看到至少32个TPU二代母板在运行,这也意味着,有128个TPU芯片在同时运行。经由粗略的计算,整套体系的计算才能大年夜概在11.5切切亿次。
举个例子来说,如不雅这一运算才能在将来可以或许应用到贸易范畴,谷歌如今进行的大年夜范围翻译工作所采取的32个今朝最先辈的GPU,在将来就可以缩减为4个TPU板,并可以或许极大年夜的缩减翻译所须要的时光。
值得留意的是,上文所提到的TPU芯片不仅仅实用于浮点运算,也同样实用于高机能计算。
TPU的练习与进修
与第一代TPU比拟,第二代TPU除了进步了计算才能之外,增长的最大年夜的功能就是数据推理才能,不过这一推理模型必须先在GPU长进行练习才可以。这一练习模式使得谷歌等开辟厂商必须降低实验的速度,重塑练习模型,这将消费更长的时光,才能使机械获得必定的数据推理才能。
拥有“tensor core”的英伟达Volta GPU拥有超高速的机械进修与练习才能,将来可能达到120万亿次的单设备计算才能,这一运算才能与客岁上市的Pascal GPU比拟,在计算才能上晋升了大年夜约40%。然则像谷歌推出的TPU这种超高速的计算才能所带来的影响,我们即便很难在生活中亲自的领会到,然则GPU越来越快的计算才能依旧令人印象深刻,也离我们更近。
将来,我们将持续跟进谷歌的进度,以进一步懂得这一收集架构。然则在此之前,我们应当懂得新一代TPU的架构、机能以及工作方法,明白TPU是若何进行超高机能计算的。在此次宣布会上,谷歌并没有展示新一代TPU的芯片样片或者是加倍具体的技巧规格,然则我们依旧可以或许大年夜今朝所知的信息中对新一代TPU做出一些推想。

Dean表示,英伟达Volta所采取的架构是异常有趣的,这一架构使得经由过程核心矩阵来加快应用的目标成为可能。大年夜必定程度上来说,谷歌推出的第一代TPU也采取了类似的设法主意,实际上,这些技巧如今依然在机械进修的流程中被采取。“可以或许加快线性计算才能老是异常有效的。”Dean强调。
姑且不推敲硬件方面的影响,依然存在着很多可以或许吸引用户的处所。与那些始终保持机密的项目不合,将来,谷歌将会将TPU技巧应用到谷歌云平台。谷歌的高等研究察Jeff Dean表示,他们不欲望经由过程各类手段来限制竞争,欲望可以或许为TPU供给更多的可能与空间,如许在将来才能够与Volta GPU以及Skylake Xeons竞争。


Dean认为,平台也应当为开辟者供给更多可以或许建立和履行各自特有模型的机会,而不是限制开辟者的思维。将来,谷歌将会在云平台上为那些对开放的科研项目感兴趣并赓续推动机械进修的研究团队供给跨越1000个TPU。
Dean表示,如今在谷歌内部,在进行机械练习和进修的时刻,也会同时采取GPU和CPU,在同一设备上也是如斯,如许可以或许更好的包管均衡。然则对于新一代的TPU芯片,今朝来说,练习和进修时刻的功率还不克不及够精确的估计,然则值得肯定的是,功能肯定是地狱Volta GPU。因为体系在功能上可以或许知足高机能计算和64位高机能计算,这就使得工作负载的计算异常复杂。英伟达的GPU在应用过程中也会碰到类似的问题。将来,想要更好的解决这一问题,须要我们跟工程师持续尽力。
推荐阅读
深度进修的核心问题就是一个异常难的优化问题。所以在神经收集惹人后的几十年间,深度神经收集的优化问题的艰苦性是阻碍它们成为主流的一个重要身分。并导致了它们在20世纪90年代到21世纪>>>详细阅读
地址:http://www.17bianji.com/lsqh/35381.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示