作家
登录

机器学习中容易犯下的错

作者: 来源: 2017-05-09 10:03:11 阅读 我要评论

媒介

在工程中,有多种办法来构建一个关键值存储,并且每个设计都对应用模式做了不合的假设。在统计建模,有各类算法来建立一个分类,每一个算法的对数据集有不合的假设。

在处理少量的数据时,尽量多的去测验测验更多的算法是合理的,并且去 选择最好的算法建立在实验成本低的情况下。然则,当我们碰着“大年夜数据”时,就须要对数据进行前期分析,然后响应的设计建模流程。(例如预处理、建模、优化算法、评价,产品化)

如今出现了很多的算法,并且有几十种办法来解决给定的建模问题。每个模型假设不合的器械,若何应用和验证哪些假设是否合理的其实并不明显。在工业中,大年夜多半大年夜颐魅者选择的建模算法,都是他们最熟悉的,而不是选择一个最合适数据的。接下来,我来分享一些经常我们会忽视并犯错的处所,感谢大年夜家斧正点评!( 注:标题就用英语,感到更切近机械进修算法的原意 )

应用 L1或L2去处罚 较大年夜系数是常用的方法去正则化线性或逻辑回归。然而,很多人不知道应用这些正则化之前特点标准化的重要性。

损掉函数 是一个机械进修算法的核心,损掉函数决定了最终优化后获得的参数以及模型本身。在不合的营业场景下,优化的目标应当是不合的。很多大年夜颐魅者练习和选择最好的模型,应用默认的损掉函数(比如:均方误差)。在实践中,现成的损掉函数很少与贸易目标相一致。以欺骗侦查为例。当试图检测讹诈交易,贸易目标是尽量削减讹诈损掉。现有的二元分类器的损掉函数同样衡量践言性和假阴性。为了与贸易目标一致,损掉函数不仅要处罚假阴性多于践言性, 但也处罚每个假阴性与美元金额的比例。

2. Use plain linear models for non-linear interaction(纯线性模型用于非线性互相感化)

这个同样是经常会犯的缺点。当结垢荷琐二分类问题,很多人就会直接想到Logistic回归, 原因很简单,因为逻辑回归效力高,实现轻易。然则,大年夜家往往都忽视了一点,逻辑回归本身就是一个线性模型,且非线性互相感化之间的猜测须要手动编码。然则,真实数据是否线性可分倒是我们未知的情况。因为高维数据下断定数据是否线性可分几乎是一个不实际的义务,所以小我的经验往往是先应用逻辑回归做一次分类,然则同时也会采取决定计划树,或者SVM等非线性模型来对该数据进行从新的分类比对。

返回讹诈检测,高阶交互特点如:“账单地址=发货地址和交易金额 < $50”须要优胜的模型机能。是以,人们应当爱好非线性模型,如SVM核函数或基于树的分类,有益于高阶交互特点。

3. Forget about outliers(忽视异常值)

异常值是个很有趣的工作,让你又爱又恨。根据高低文,他们要么值得特别存眷,要么完全忽视。以收入猜测为例。如不雅不雅察到不合平常的收入岑岭,这可能是一个好主意,要非分特别留意他们,找出什么原因引起的尖峰。但如不雅异常是因为机械误差,测量误差或其他造成则不实用,在将数据反馈到建模算法之前,滤除这些异常值是个好主意。

有些模型比其他更敏感异常值。例如,AdaBoost可以把这些异常值作为“难样本(Hard)”的情况下,把较大年夜的权重放在异常值,而决定计划树可以简单地计算每个异常值作为一个缺点分类。如不雅数据集包含了大年夜量的异常值,侧重的是,要么竽暌姑鲁棒的模型算法去针对异常值,要么滤除异常值。

注:参考他人一段话。

我记得之前在统计之都上看过一篇文┞仿对我启发很大年夜,说袈澍经我们都愿意把异常值直接给损掉落,然则我们却忘记了异常值并非缺点值,而同样是真实情况的表示,我们之所以认为异常,只是因为我们的数据量不足够大年夜罢了。文中还举了一个例子,说我们用计算机来模仿高斯分布,也一样会模仿出一些数据点落在N个标准差之外,而我们并不克不及嗣魅这是异常点,因为如不雅我们把这些点删除掉落,这就不是一个高斯分布了。所以异常值很多情况下非但不克不及损掉落,还须要引起我们的足够看重和分析。

然则我们又要留意这个异常值是否是缺点值,如不雅是缺点值,这个时刻我们就应当想办法把这些缺点值去掉落,因为这些缺点往往会影响我们实际的模型效不雅。如不雅当练习数据中包含一些异常值的时刻,我们就须要推敲模型的敏感性了,例如AdaBoost, Kmeans这种就属于对异常值很敏感的机械进修模型。

4. Use high variance model when n<<p(高方差模型应用情况)

支撑向量机是最风行的现有建模算法之一,其最强大年夜的功能之一是可以或许适应不合核函数的模型。SVM核函数可以被认为是一种办法,主动结合现有的特点去 形成一个更丰富的特点空间。因为这个简单,大年夜多半都邑在练习SVM模型的时刻默认应用核函数。然而,当数 据n<<p(样本数量 << 特点数量),常见于医疗数据等行业,更丰富的特点空间意味着有更高的风险过拟合数据。事实上,高方差模型应完全避免(n<<p)。

注: SVM核函数的一个关键概念就是维度晋升,如不雅当n << p的时刻,还依然采取SVM来选定模型,那么就必定会导致p进一步增长,于是导致特点的参数中自由变量增长,必定会对分类的效不雅产生很大年夜的影响。

5. L1/L2/… regularization without standardization(正则化前没有标准化)

返回讹诈检测,想象一个具有交易量特点的线性回归模型。没有正则化,如不雅交易金额单位为美元,拟合系数将是约100倍大年夜于 如不雅该单位是美分的 拟合系数。有正则化,因为L1 / L2处罚更大年夜的系数, 如不雅单位是美元 交易金额将受到处罚。是以,正规化是有成见的,往往偏向于处罚小范围特点。为了缓解这个问题,标准化的所有特点,并把它们作为一个预处理步调。

6. Use linear model without considering multi-collinear predictors(应用线性模型没有推敲共线猜测)


  推荐阅读

  如何在UEFI模式下安装Linux

此页面是免费浏览的,没有常人的外部告白;然而,我切实其实花了时光预备,网站托管也花了钱。如不雅您发明此页面帮到了您,请推敲进行小额借钱,以赞助保持网站的运行。感谢! 原著于 201>>>详细阅读


本文标题:机器学习中容易犯下的错

地址:http://www.17bianji.com/lsqh/35090.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)