
【编辑推荐】
- 大年夜TensorFlow到Theano:横向比较七大年夜深度进修框架
- 基于OpenGL ES 的深度进修框架编写
- LSTM、GRU与神经图灵机:详解深度进修最热点的轮回神经收集
- 深度进修主动编码器还能用于数据生成?这篇文┞仿告诉你谜底
- 推荐体系重要算法总结及Youtube深度进修推荐算法实例概括
这一复杂性意味着深度收集的优化器成了第一等级:它们是模型的核心部分,和层架构一致重要。这种情况在机械进修的其他很多模型中并不常见。线性模型和支撑向量机是凸优化问题,这些问题实际膳绫腔有太多差别,且只有一个真实谜底。这就是为什么其他范畴的人或者应用诸如 scikit-learn 等对象的人在没有找到带有.fit() 的异常简单的 API 时深感困惑。
深度进修的局限性
是以,什么时刻深度进修确切不合适一项义务?依我看,以下几个重要场景中深度进修并不实用。
低预算或低承诺问题
深度进修模型异常灵活,有大年夜量的架构和节点类型、优化器以及归一化策略。依附应用,你的模型也许会有卷积层或者轮回构造;它也许真的很深,或者仅有几个隐蔽层;它也许应用整流线性单位或者其他的激活函数;它或许有 dropout,或许没有,并且权重很可能被归一化。以上只是一个部分列表,还有很多其他的类型的节点、链接甚至损掉函数可以测验测验。有很多超参数可以微调,很多架构可以摸索,尽管练习一个大年夜型的神经收集异常耗时。谷歌比来宣传其 AutoML 流程可主动找到最佳架构,然则须要跨越 800 块 GPU 全力运转数周,这可不合适所有人去做。重点是练习深度统??计算和调试方面成本很高,这种费用对于很多日常猜测问题并没有任何意义,甚至调剂小型收集速度也太慢。即使有足够的预算和承诺,起首作为基准也没有来由不测验测验其他办法。你可能会惊喜地发明,线性支撑向量机才是你真正须要的全部。
向一个通俗听众解释和传达模型参数/特点重要性
深度收集之所以臭名昭著是因为它是一个黑箱,猜测才能强大年夜却无法被解释。即使比来有很多对象在一些范畴表示明显,它们并不会彻底转向全部的应用。这些对象在你想要确保收集是否欺骗你时工作优胜,这主如果经由过程存储数据集或者聚焦特定的假特点实现的。然则向深度收集的┞符体决定计划阐释预特点的重要性依然很艰苦吗?在这一范畴,因为进修系数与回应存在直接关系,没有什么可以真正打败线性模型。这在向一般听众传递这些阐释时尤其关键。例如,内科大夫须要整合所有类型的分散数据大年夜而做出诊断。变量与结不雅之间的关系袈浣简单和直接,内科大夫对其应用就越好,并且不会低估/高估其价值。进而,在很多案例中模型的精确度并没有理论阐释那么重要。例如,一个策略决定计划者也许想要知道人口统计的变量对逝世亡率的影响,并且比拟于猜测精度,他很可能对两者关系的直接近似值更感兴趣。在这两种案例中,相对于更简单、更深刻的办法,深度进修处于劣势。
建立因不雅机制
模型阐释的极端案例是试图建立一个机制模型,即,一个可以真正捕获数据背后的现象的模型。好的实例包含试图猜测两个分子是否在一个特定的细胞情况中交互?或者假设一个特定的市场策略若何对发卖产生实际影响。该领的专家认为,老式的贝叶斯办法弗成替代;它是我们进行因不雅表征和推理的最佳方法。Vicarious 比来在这方面有一些出色结不雅(https://www.vicarious.com/img/icml2017-schemas.pdf),证清楚明了为什么这一加倍原则性的办法可以在视频游戏义务中比深度进修泛化地更好。
大年夜「非构造」特点中进修
这个有待评论辩论。我发明深度进修善于的一个范畴是为一个特定义务找到数据的有效表征。一个比较好的示例是上述的的词嵌入。天然说话有着丰富而复杂的构造,其可经由过程「语境-意识」收集被近似:每个词可表征为一个向量,它编码了其被应用最多的语境。应用在天然说话处理义务的大年夜型语料库中进修的词嵌入有时可使另一个语料库中的特别义务获得晋升。然而,如不雅有问题的语料库是彻底非构造的,那么深度进修将毫无用武之地。例如,你正在经由过程查看关键词典非构造列表进行目标分类。因为关键词并不被用于任何特定构造,词嵌入并弗成能赞助太多。在这一情况中,数据是真正的词包,表征对于义务也充分。一个反方论点也许是词嵌入实际上并没有那么昂贵,如不雅应用预练习的词嵌入,你也许可以更好地捕获到关键词类似性。然而,我依然偏向于大年夜词包表征开端,并查看我是否可以或许获得好的猜测。毕竟,比拟于对应的词嵌入槽,词包的每一个维度更轻易阐释。
深度是将来
深度进修很热,资金充分,且成长飞快。当你在一个会议上读到一篇深度进修论文时,它可能是两三次迭代后的结不雅。这给我的上述不雅点提出了很大年夜的留意:不久的将来,深度进修也许在一些场景中依然超等有效。阐释深度进修的对象变得越来越好。比来的软件(比如 Edward)融合了贝叶斯建模和深度收集框架(详见:深度概率编程说话 Edward:融合了贝叶斯、深度进修和概率编程),借助概率编程和主动变分推理,量化了神经收集参数和R单贝叶斯推理的不肯定性。长远看,存在一个简化的建模词汇表,揭示深度收集可以具有的明显属性,大年夜而削减须要测试的事物的参数空间。是以,持续刷 arXiv 吧,没准一两个月这篇文┞仿已被迭代。
本文转自机械之心,原文来自hyperparameter.space,作者Pablo Cordero。
推荐阅读
大年夜数据成长中的数据共享难题只是大年夜数据各种问题的冰山一角。当前,我国大年夜数据家当正处于起步阶段,信息孤岛、技巧不足、人才缺掉等都成为家当成长中亟待解决的大年夜问题。数据孤岛问题凸起“巧妇难>>>详细阅读
本文标题:深度学习的先入之见、局限性及其未来
地址:http://www.17bianji.com/lsqh/36165.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示