作家
登录

深度学习的先入之见、局限性及其未来

作者: 来源: 2017-07-12 12:47:27 阅读 我要评论

我知道博客标题中应用否定词很奇怪,然则前几天有一波评论辩论正好响应于我正在思虑的一些问题。这一切开端于 Jeff Leek 揭橥的一篇有关解释在小样本范围内应用深度进修的文┞仿。要言之,他认为当样本较小时(这在生物范畴很常见),带有少许参数的线性模型甚至比带有少量层和隐蔽单位的深度收集机能更优。他持续展示了一个异常简单的带有十大年夜信息特点的线性猜测器,在应用大年夜约 80 个样本在 MNIST 数据集平分类 0 和 1 时,机能比一个简单的深度收集更优。这促使 Andrew beam 写了一篇辩驳文┞仿(详见:当心练习模型,数据少也可以玩转深度进修),个中写道一个恰当练习的深度收集可以或许完胜简单的线性模型,甚至仅仅应用异常少的练习样本。在争辩时代,越来越多的生物医疗信息研究者开端采取深度进修处理不呵9依υ?题。hype real 或者线性模型就是我们须要的全部吗?正如往常一样,谜底是看情况。在本文中,我将介绍几个机械进修的应用案例,个中深度进修在应用和处理祖先之见方面并没有太多实际意义,我认为恰是这些祖先之见(preconception)阻碍了深度进修的应用,尤其是对于入门者来说。

深度进修的祖先之见

起首,让我们解决一些祖先之见,门外汉已经将其误认为半真谛。有两个大年夜的祖先之见以及一个比较技巧的祖先之见,这在某种程度上是对 Andrew Beam 关于「缺点之见」的延长。

深度进修可真正应用于小数据样本

Edward 在 TensorFlow 中融合了概率编程,可同时用于深度进修和贝叶斯模型。摘自 Tran 等人的 ICLR 2017 论文。

深度进修的名誉建立在大年夜量数据之上(比如首个谷歌大年夜脑工程向深度收集馈送了大年夜量的 YouTube 视频),并且作为复杂算法运行大年夜量数据以来一向被公开化。不幸的是,大年夜数据和深度进修的关系也有时对反:一个深度进修不克不及应用于小数据样本的神话。如不雅你的神经收集样本数据很少,带有较高的参数样本比,外面上看很可能会出现过拟合。然而,如不雅只推敲给定问题的样本大年夜小和维度,不管是监督进修照样无监督进修,这是凭旷地建模数据,无需语境。很可能是这种情况,你有与问题相干的数据资本,或者某个范畴专家可以供给 strong prior,或者数据的组织构造很特别。在所有这些情况中,深度进修有机会成为一种有效办法,例如,可认为更大年夜的相干数据集编码有效的表征,并将其应用在你的问题之中。其经典图示在天然说话处理中异常广泛,个中你可以进修大年夜型语料库的词嵌入,并将其作为更小更窄语料库中的嵌仁攀来完成有监督进修义务。极端地说,你可以结合一组神经收集进修一个表征和一个有效的方法以在小样本集中反复应用表征。这被称作 one-shot learning,并被胜应用在诸多高维数据范畴,比如计算机视觉和药物发明。

http://wuyou.51cto.com/

深度进修并不是一切的谜底

第二个我听到最多的祖先之见是 hype。很多准大年夜颐魅者希冀深度收集可以带给他们一个神秘的机能晋升,仅仅因为神经统??其他范畴也行之有效。其他人大年夜建模和操控图像、音乐、说话的工作中获得启发,并经由过程测验测验练习最新的 GAN 架构猛冲进这个范畴。hype 真实存在,且方法多样。深度进修在机械进修中桂林一枝,并成了数据建模的一件重要对象。深度进修的风行催生出了一些核心的框架比如 TensorFlow 和 PyTorch,它们出奇地好用,甚至在深度进修之外也是。超等巨星源自掉败者的故事启发了研究者重拾以前被湮没的办法,比如进化策略和强化进修。但这无论若何不是全能药。除却没有免费午餐的考量,深度进修模许可以异常细微,须要当心、有时异常昂贵的超参数搜刮、调试和测试(后文将有胪陈)。此外,在很多情况下深度进修并无太多实际价值,反而是更简单的模型效力更高。

深度进修不仅仅是.fit()

随机梯度降低并不难,比来的工作注解该步调实际上是一个马尔可夫链,在特定假设下有一个静态分布,可被看作是对 posterior 的变分近似。所以当你停止你的 SGD 并采取最后的参数时,你根本上是在大年夜这一近似分布中采样。我发明这一设法主意很有启发力,因为优化器的参数经由过程这种方法发挥了很大年夜感化。比如,因为你可以增长 SGD 的进修参数,马尔可夫链会变的不稳定直到找到大年夜面积采样的局部极小值;即,你增长了步调的方差。另一方面,如不雅你削减进修参数,马尔可夫链会慢慢近似更窄的极小值,直到它在雅绫擒区域内收敛;即,你增长了一个特定区域的方差。另一个参数,SGD 中的批大年夜小,也控制着算法术敛的区域类型。对于小批的更宽广区域,以及更大年夜批的更窄区域。

来自机械进修其他范畴的翻译多若干少湮没掉落了深度进修的一个方面。很多教程和入门资僚绫氰述深度进修模型由层级互联层(由节点构成)构成,个中第一层是输入层,最后一层是输出层。你可以应用随机梯度降低练习它们。也许在简短说起随机梯度降低若何工作以及什么是反向传播之后,大年夜部分的解释聚焦在了神经收集类型的丰富上。优化办法本身须要很少的额外留意力,这很不幸,因为很可能相当一部分深度进修奏效的原因是因为这些特别的办法,并指导若何优化它们的参数;以及若何瓜分数据以有效应用它们对于在合理的时光范围内获得优胜卷曲至关重要。为什么随机梯度如斯重要依然不得而知,然则一些线索正到处浮现。我最爱好的一个是将该办法阐释为贝叶斯推理履行的一部分。本质上讲,每次当你做某些情势的数运算,你就在应用特定假设和 prior 履行一些贝叶斯推理。


  推荐阅读

  大数据产业信息孤岛、技术不足、人才缺失等问题亟需解决

大年夜数据成长中的数据共享难题只是大年夜数据各种问题的冰山一角。当前,我国大年夜数据家当正处于起步阶段,信息孤岛、技巧不足、人才缺掉等都成为家当成长中亟待解决的大年夜问题。数据孤岛问题凸起“巧妇难>>>详细阅读


本文标题:深度学习的先入之见、局限性及其未来

地址:http://www.17bianji.com/lsqh/36165.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)