
近几年,深度进修已经进入必定程度的狂热状况,人们正试图用这个技巧解决每一个问题。然而,深度进修真是全能的吗?浏览此文后,你便可以或许大年夜深层懂得为什么深度进修并不是想象的那般“神话”了。
写在前面
什么时刻不须要深度进修?
这篇博文的揭橥引起了范畴内的┞幅论,哈佛大年夜学药学院的生物医药信息学专业博士后 Andrew Beam 写了篇文┞仿来辩驳:《就算数据不敷大年夜,也能玩深度进修》(You can probably use deep learning even if your data isn’t that big)。Andrew Beam 指出,即使数据集很小,一个恰当练习的深度收集也能击败简单的线性模型。
如今,越来越多的生物信息学研究人员正在应用深度进修来解决各类各样的问题,如许的┞幅论愈演愈烈。这种炒作是真的吗?照样说线性模型就足够知足我们的所有需求呢?结论一如既往——要视情况而定。在这篇文┞仿中,作者摸索了一些机械进修的应用实例,在这些实例中应用深度进修并不明智。并且说清楚明了一些对深度进修的误会,作者认为恰是这些缺点的熟悉导致深度进修没有获得有效地应用,这种情况对于新手来说尤其轻易出现。
打破深度进修成见
起首,我们来看看很多外行者轻易产生的成见,其实是一些半真半假的单方面熟悉。重要有两点,个中的一点更具技巧性,我将具体解释。
深度进修在小样本集上也可以取得很好的效不雅
然而,这种大年夜数据 + 深度进修的配对不知为何被人误会为:深度进修不克不及应用于小样本。如不雅只有几个样例,将其输入具有高参数样本比例的神经收集似乎必定会走上过拟合的门路。然而,仅仅推敲给定问题的样本容量和维度,无论有监督照样无监督,几乎都是在真空中对数据进行建模,没有任何的高低文。
可能的数据情况是:你拥有与问题相干的数据源,或者该范畴的专家可以供给的强大年夜的先验常识,或者数据可以以异常特别的方法进行构建(例如,以图形或图像编码的情势)。所有的┞封些情况中,深度进修有机会成为一种可供选择的办法——例如,你可以编码较大年夜的相干数据集的有效表示,并将该表示应用到你的问题中。
这种典范的示例常见于天然说话处理,你可以进修大年夜型语料库中的词语嵌入,例如维诽谤科,然后将他们作为一个较小的、较窄的语料库嵌入到一个有监督义务中。极端情况下,你可以用一套神经收集进行结合进修特点表示,这是在小样本集中重用该表示的一种有效方法。这种办法被称作 “一次性进修”(one-shot learning),并且已经成功应用到包含计算机视觉和药物研发在内的具有高维数据的范畴。

近日,在深度进修范畴出现了一场热烈的┞幅论。这一切都要大年夜 Jeff Leek 在 Simply Stats 上揭橥了一篇题为《数据量不敷大年夜,别玩深度进修》(Don’t use deep learning your data isn’t that big)的博文开端。作者 Jeff Leek 在这篇博文中指出,当样本数据集很小时(这种情况在生物信息范畴很常见),即使有一些层和隐蔽单位,具有较少参数的线性模型的表示是优于深度收集的。为了证实本身的论点,Leek 举了一个基于 MNIST 数据库进行图像识其余例子,分辨 0 或者 1。他还表示,当在一个应用仅仅 80 个样本的 MNIST 数据集中进行 0 和 1 的分类时,一个简单的线性猜测器(逻辑回归)要比深度神经收集的猜测精确度更高。
深度进修不是一切的谜底
我听过最多的第二个成见就是过度宣传。很多尚未入门该范畴的人,仅仅因为深度神经统??其它范畴的出色表示,就等待它也能为他们带来神话般的表示晋升。其他人则大年夜深度进修在图像、音乐和说话(与仁攀类关系密切的三种数据类型)处理范畴的令人印象深刻的表示中受到启发,于是就脑筋发烧地钻入该范畴,迫在眉睫地测验测验练习最新的 GAN 构造。
但任何情况下也不克不及认为深度进修是全能良药。除了“世界没有免费的午餐”这点之外,深度进修模型是异常奥妙的,并且须要细心甚至异常耗时耗力的超参数搜刮、调剂,以及测试(文┞仿后续有更多讲解)。除此之外,在很多情况下,大年夜实践的角度来看,应用深度进修是没有意义的,更简单的模型反而能获得更好的效不雅。
深度进修不仅仅是.fit()
深度进修模型大年夜机械进修的其他范畴传来时,我认为还有别的一个方面经常被忽视。大年夜多半深度进修的教程和介绍材料都将模型描述为经由过程层次方法进行连接的节点层构成,个中第一层是输入,最后一层是输出,并且你可以用某种情势的随机梯度降低(SGD)办法来练习收集。有些材料会简单介绍随机梯度降低是若何工作的,以及什么是反向传播,但大年夜部分介绍重要存眷的是丰富的神经收集类型(卷积神经收集,轮回神经收集等等)。
而优化办法本身却很少受到存眷,这是很不幸的,因为深度进修为什么可以或许起到很大年夜的感化,绝大年夜部分原因就是这些特别的优化办法(具体阐述可以参考 Ferenc Huszár 的博客以及博客中引用的论文)。懂得若何优化参数,以及若何划分数据,大年夜而更有效地应用它们以便在合理时光内使收集获得优胜的收敛,是至关重要的。
深度进修是在大年夜数据的背景下火起来的(第一个谷歌大年夜脑项目向深度神经收集供给了大年夜量的 Youtube 视频),自负年夜那今后,绝大年夜部分的深度进修内容都是基于大年夜数据量中的复杂算法。
不过,为什么随机梯度降低如斯关键照样未知的,然则如今线索也正零碎出现。我偏向于将该办法算作是贝叶斯推理的一部分。本质上,在你进行某种情势的数值优化时,你都邑用特定的假设和先验来履行一些贝叶斯推理。其实有一个被称做概率数值计算(probabilistic numerics)的完全研究范畴,就是大年夜这个不雅点开端的。随机梯度降低也是如斯,最新的研究结不雅注解,该过程实际上是一个马尔科夫链,在特定假设下,可以看作是后向变分近似的稳态分布。
推荐阅读
【51CTO.com原创稿件】 为期三天的2017华为全联接大年夜会于9月5日-7日在上海新国际博览中间举办。51CTO为您>>>详细阅读
本文标题:给人工智能降点温:深度学习不是万能良药
地址:http://www.17bianji.com/lsqh/37217.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示