作家
登录

给人工智能降点温:深度学习不是万能良药

作者: 来源: 2017-09-07 15:02:59 阅读 我要评论

所以当你停止随机梯度降低,并采取最终的参数时,根本上是大年夜这个近似分布中抽样获得的。我认为这个设法主意很有启发性,因为如许一来,优化器的参数(这里是指进修率)就更有意义了。例如,当你增长随机梯度降低的进修参数时,马尔可夫链就会变得不稳定,直到它找到大年夜面积采样的局部最小值,如许一来,就增长了法度榜样的方差。

另一方面,如不雅削减进修参数,马尔科夫链可以慢慢的近似到狭义极小值,直到它收敛,如许就增长了某个特定区域的偏置。而另一个参数,随机梯度降低的批次大年夜小,也可以控制算法术敛的区域是什么类型,小的批次收敛到较大年夜区域,大年夜的批次收敛到较小区域。

随机梯度降低根据进修速度或批尺寸来选择较大年夜或狭义最小值

如许的复杂性意味着深度收集的优化器异常重要:它们是模型的核心部分,与层架构一样重要。这一点在机械进修典范多其他模型中并不常见。线性模型(甚至是正则化的,像 LASSO 算法)以及支撑向量机(SVM)都是凸优化问题,没有太多细微差别,并且只有一个最优解。这也就是为什么来自其它范畴的研究人员在应用诸如 scikit-learn 如许的对象时会认为困惑,因为他们发明找不到简单地供给.fit() 函数的 API(尽管如今有些对象,例如 skflow,试图将简单的收集置入.fit() 中,我认为这有点误导,因为深度进修的全部重点就是其灵活性)。

在什么情况下深度进修不是最幻想的呢?在我看来,以下情况中,深度进修更多是一种阻碍,而不是福音。

当然,这种大年夜肆吹捧在很多方面是真实存在的。深度进修在机械进修中的地位弗成小觑,也是数据建模办法库的重要对象。它的普及带动了诸如 tensorflow 和 pytorch 等很多重要框架的成长,它们即使是在深度进修之外也是十分有效的。掉败者崛起成为超等巨星的故事鼓励了很多研究察从新核阅以前的模糊算法,如进化算法和加强进修。

低预算或低投资问题

深度收集是十分灵活的模型,有多种多样的构造和节点模型、优化器以及正则化办法。根据应用处景,你的模型或许要有卷积层(层尺寸多宽?有没有池化操作?),或者轮回构造(有没有门控单位?);收集可能真的很深(hourglass,siamese,或其他构造?)照样只是具有很少的几个隐蔽层(有若干单位?);它可能应用整流线性单位或其他激活函数;它可能会或可能不会有随机丢弃(在哪一层中?用什么比例?),并且权重应当是正则化的(L1、L2,或者是某些更奇怪的┞俘则化办法?)。这只是一部分列表,还有很多其他类型的节点、连接,甚至损掉函数可以去测验测验。

即便只是练习大年夜型收集的一个实例,调剂很多超参数以及摸索框架的过程也是异常耗时的。谷歌比来传播鼓吹本身的 AutoML 办法可以主动找到最好的架构,令人印象深刻,但仍然须要跨越 800 个 GPU 全天候运行数周,这对于任何仁攀来说5滨都是遥弗成及的。关键在于练习深度收集时,在计算和调试部分都邑花费巨大年夜的价值。这种消费对于很多日常猜测问题并没有意义,并且调剂深度收集的投资回报率太低,即使是调剂小型收集。即使有足够的预算和投资,也没有来由不测验测验替代办法,哪怕作为基准测试。你可能会惊喜地发明,线性 SVM 就够用了。

解释和传达模型参数或特点对一般受众的重要性

深度收集也是很有名的黑匣子,它具有高猜测才能但可解释性不足。尽管比来有很多对象,诸如明显图(saliency maps)和激活差别(activation difference),它们对某些范畴而言是异常有效的,但它们不会完全被应用到所有的应用中。主如果,当你想要确保收集不会经由过程记住数据集或专注于特定的虚假特点来欺骗你时,这些对象就能很好地工作,但仍然难以大年夜每个特点的重要性解读出深度收集的┞符体决定计划。在这个范畴,没有什么可以或许真正地打败线性模型,因为进修获得的系数与锾螃有着直接的关系。当将这些解释传达给一般受众,并且他们须要基于此做出决定计划时,这就显得尤为重要。

例如,大夫须要结合各类不合的数据来确认诊断结不雅。变量和结不雅之间的关系袈浣简单、越直接,大夫就能更好地应用,而不是低估或高估实际值。此外,有些情况下,模型(尤其是深度收集)的精度并不像可解释性那样重要。例如,政策制订者可能想知道一些人口统计变量对于逝世亡率的影响,并且相较于猜测的精确性来说,可能对这种关系的直接近似更有兴趣。在这两种情况下,与更简单、更易渗入渗出的办法比拟,深度进修处于晦气地位。

建立因不雅机制

模许可解释性的极端情况是当我们试图建立一个机械模型,即实际捕获数据背后现象的模型。一个好的例子包含试图猜测两个分子(例如药物、蛋白质、核酸等)是否在特定的细胞情况中互相产生影响,或者假设特定的营销策略是否对发卖产生实际的影响。在这个范畴,根据专家看法,没有什么可以击败老式的贝叶斯办法,它们是我们表示并揣摸因不雅关系的最好方法。Vicarious 有一些很好的最新研究结不雅,解释为什么这个更有原则性的办法在视频游戏义务中比深度进修表示得更好。

进修“非构造化”特点

药物研发中的一次性进修收集,摘自 Altae-Tran et al. ACS Cent. Sci. 2017

这可能是具有争议性的。我发明深度进修善于的一个范畴是为特定义务找到有效的数据表示。一个很好的例子就是上述的词语嵌入。天然说话具有丰富而复杂的构造,与“高低文感知”(context-aware)收集邻近似:每个单词都可以经由过程向量来表示,而这个向量可以编码其经常出现的文本。在 NLP 义务中应用在大年夜型语料库中进修的单词嵌入,有时可以在另一个语料库的特定义务中晋升效不雅。然而,如不雅所评论辩论的语料库是完全非构造化的,它可能不会起到任何感化。

例如,假设你正在经由过程查看关键字的非构造化列表来对对象进行分类,因为关键字不是在任何特定构造中都邑应用的(比如在一个句子中),所以单词嵌入不会对这些情况有太大年夜赞助。在这种情况下,数据是一个真正的“词袋”(bag of words),这种表示很有可能足以知足义务所需。与此相反的是,如不雅你应用预练习的话,单词嵌入并不是那么消费时力,并且可以更好地捕获关键字的类似度。不过,我照样宁愿大年夜“词袋”表示开端,看看可否获得很好的猜测结不雅。毕竟,这个“词袋”的每个维度都比对应的词嵌入槽更轻易解读。


  推荐阅读

  51CTO带你去现场 2017华为全联接大会精彩图集

【51CTO.com原创稿件】 为期三天的2017华为全联接大年夜会于9月5日-7日在上海新国际博览中间举办。51CTO为您>>>详细阅读


本文标题:给人工智能降点温:深度学习不是万能良药

地址:http://www.17bianji.com/lsqh/37217.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)