作家
登录

聊聊数据挖掘竞赛中的套路与深度学习的局限

作者: 来源: 2017-07-25 17:02:59 阅读 我要评论

聊聊数据发掘比赛中的套路与深度进修的局限 , 聊聊数据发掘比赛中的套路与深度进修的局限 , 聊聊数据发掘比赛中的套路与深度进修的局限 , 聊聊数据发掘比赛中的套路与深度进修的局限 , 聊聊数据发掘比赛中的套路与深度进修的局限

这时再回想去看 (2) 式,就能获得

合理的划分数据及谕练习集,均衡样本,交叉验证这些器械是老生常谈,网上一找一大年夜堆,所以本文持续不谈。

有些童鞋应当反竽暌功过来了,是的,所谓的线性模型应用非线性特点的道理就是将非线性特点记作新的变量 t,然后扔进一个线性模型琅绫擎,这时获得的就是关于 t 的线性模型,但却可以表达 x 的非线性关系。

至于提取非线性特点,除了人工提取这种多项式来做特点外,也可用深度进修,SVM 等非线性模型的中心输出来作为非线性特点。这些非线性模型的办法,也大年夜概是把低维度投影到高维度后塞进线性模型,至于说为什么要用非线性模型提取,一是因为省人力,二是因为模型往往能进修到仁攀类常识上意识不到的特点的,至于为什么不实用非线性模型直接进去端对端的工作方法,则是因为每一个非线性模型提取非线性特点的办法都不一样,那么提掏出来的非线性特点自瘸就镣不一样了。

但要留意一点的是,是否应用模型来提取非线性特点这个决定要推敲实际情况,因为多个模型的非线性特点组合后,或者是模型融合技巧,计算量或时延是弗成接收的,有些办法连工程实践上都不必定可取(即使有分布式计算的情况),就更不要说打 kaggle 的大年夜部分都是小我用户,只有台式机或标记本。

模型练习和选择

先说说的是模型的选择,机械进修经常被称为形而上学,刚开端我认为说的是因为调包侠本根本不知道琅绫擎算法的道理,所以如许造成,但后来我发明,即使你知道琅绫擎的算法的道理,也依然是形而上学。

为什么这么说,我们比较一下其他的一些类型的法度榜样掉足是怎么解决的?print 大年夜法?二分排查找 bug?无论是何种办法,只要 bug 可从新,你老是可以经由过程法度榜样的表示而定位到缺点,但机械进修不可,除了模型是否过拟合可以经由过程一些指标看出,然后调剂对应得参数外,其他的一些问题,压根无法经由过程现象而定位到须要修改的缺点。

比如说,猜测效不雅不好,我知道肯定是须要增长特点,但须要增长一个哪些方面的特点?这个特点是须要惹人新的数据维度,还可以大年夜现有的数据提掏出来?或者说当前的数据的价值已经被我榨干了吗?又或者说,你经由过程算特点与猜测值的相干系数,相干系数低的特点就必定没用了吗?显然不是,因为你如今只是算了单变量的,没有算分列组合的结不雅,而至于算分列组合的结不雅,真的能算吗?…… 诸如斯类的是没有 100% 精确的指导筹划的(可能连 90% 精确的指导筹划都没)。

当然,解决办法照样有的,就是赓续的堆特点,和堆模型,遴选后来一波融合,指望不合的模型能学到不合的方面,然后互互相补。

落实到行动,就是那句老话,大年夜胆假设,当心求证。

说了这么多,无非解释机械进修模许可能是理论科学,但实践,必定是实验性科学,既然是实现性科学,就要遵守一个原则,先简单后复杂,过早优化是万恶之源,无脑优化则是浪费时光。简单是手印型的简单,数值类许可以先大年夜简单的线性回归开端,(若是图片范畴的话,可以拔取一些比较根本的 DL 模型,比如预练习好的 vgg 系列),如许出结不雅的速度肯定优于其他混乱无章的复杂模型,出结不雅快,意味着你可以及早在线下肯定较为妥当的测试方法,你的 baseline,快速验证你的其他思路,然后再慢慢优化和调参。

在这个末节最后,来说嗣魅此次比赛中关于应用深度进修的感触。

今朝公认不合适应用深度进修的情况是当数据量偏少,但一般如今比赛方供给的数据量都异常可不雅,所以数据量这个前提应当说是可以知足的。

深度进修比较传统办法来说,最大年夜的优势是主动特点的提取,但根据其他大年夜牛分享的经验来说,当人工特点工程做到必定程度后,传统模型是可以超出深度进修的,详见 quora 类似文本匹配的比赛琅绫擎,yesofcourse 部队的视频,琅绫擎有一段是关于深度进修和传统机械进修模型的比较,别的亦有有人指出深度进修在面对 x 和 y 的关系是一次推理的情况时,深度进修能学到很好,如不雅是两层或独裁的推理的时刻,比拟传统模型,深度进修却完全处于劣势,但深度进修结合常识图谱可以有效的解决这个问题。

(小我猜想,这里大年夜牛说到的推理应当是指在逻辑上的关系,比如你爸爸的妈妈的二叔的老婆的姐姐你应当称呼她什么这种推理,而并非数学上 y=f(x) 这种关系)

而在此次比赛中的实际情况则比较有趣。在对数据集进行了根本处理后 (对缺掉值填充,去除离群点),没有做任何的特点提取,分别塞进 xgboost 和 3 层 128 单位的 MLP,个中 LB 和线下的表示,两个模型的结不雅异常接近,差别根本上是小数点后 6 到 7 位。然则后来我人工提取了几个特点,这时两个模型的差别就开端显露出来了。线下差别不大年夜,但 LB 上,xgboost 让我的排名又十分可不雅的上升,但 MLP 则让我的 LB 得分有了十分可不雅的…… 降低!起先认为是产生了过拟合,后来分别参加了 dropout 和正则项测验测验,并没有改良,也测验测验了应用 autoencoder 进行特点提取,然后应用到传统模型上,效不雅都不尽人意,最后我决定不应用 DL 那套办法,改而采取传统的机械进修模型 + 人工采取特点。但在决定放弃 DL 之前,已经浪费了太多的时光在测验测验上(因为对 DL 有盲目标信念,总认为成就不好是本身的参数问题),没有银弹,具体情况具体分析,这也是今后处事应当要留意的处所。


  推荐阅读

  Linux虚拟内存地址转化成物理内存地址

CONFIG_STRICT_DEVMEM=n 背景现代手机这种SOC(system>#include <errno.h> #include <stdio.h> #include <sys/stat.h> #include <string.h> #include <fcntl.h> #include <stdlib.h> >>>详细阅读


本文标题:聊聊数据挖掘竞赛中的套路与深度学习的局限

地址:http://www.17bianji.com/lsqh/36401.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)