在今朝只推敲办法的恰当性和猜测机能情况下,对每种办法的优缺点进内行简单的总结:
我们可以不雅察到,和线性回归一样,对数回归的输出值回归线也在区间 [0,1] 内。
对于任何新汽车的测量 V/S 和每英里油耗,我们可以猜测这辆汽车将应用主动变速器。这是不是精确得吓人?
决定计划树
决定计划树是我们要研究的第二种机械进修算法。它们被分成回归驶赝分类树,是以可以用于监督式进修问题。
无可否定,决定计划树是最直不雅的算法之一,因为它们模仿人们在多半情况下的决定计划方法。他们根本上做的是在每种情况下绘制所有可能路径的“地图”,并给出响应的结不雅。

图形表示有助于更好地舆解我们正在商量的内容。
你开端谷歌一些术语,如“机械进修模型”和“机械进修办法论”,但一段时光后,你发明本身完全迷掉在了不合算法之间,于是你预备放弃。

基于像膳绫擎如许的树,该算法可以根据响应标准中的值来决定在每个步调要采取的路径。算法所选择的划分标准以及每个级其余响应阈值的策略,取决于候选变量对于目标变量的信息量若干,以及哪个设置可以最小化所产生的猜测误差。
再举一个例子!
此次测验的数据集是 readingSkills。它包含学生的测验信息及测验分数。
我们将基于多重指标把学生分为两类,说母语者(nativeSpeaker = 1)或外国人(nativeSpeaker= 0),他们的测验分数、鞋码以及年纪都在指标范围内。
对于 R 中的实现,我们起重要安装 party 包:
聚类算法

我们可以看到,它应用的第一个分类标准是分数,因为它对于目标变量的猜测异常重要,鞋码则不在推敲典范围内,因为它没有供给任何与说话相干的有效的信息。

如今,如不雅我们多了一群新生,并且知道他们的年纪和测验分数,我们就可以猜测他们是不是说母语的人。
到今朝为止,我们都在评论辩论有监督进修的有关问题。如今,我们要持续研究聚类算法,它是无监督进修办法的子集。
是以,只做了一点修改......
说到聚类,如不雅我们有一些初始数据须要安排,我们会想建立一个组,如许一来,个一一些组的数据点就是雷同的,并且能与其他组的数据点区分开来。
我们将要进修的算法叫做 K-均值聚类(K-Means Clustering),也可以叫 K-Means 聚类,个中 k 表示产生的聚类的数量,这是最风行的聚类算法之一。
还记得我们前面用到的 Iris 数据集吗?这里我们将再次用到。
为了更好地研究,我们应用花瓣测量办法绘制出数据集的所稀有据点,如图所示:

仅仅基于花瓣的度量值,我们应用 3-均值聚类将数据点集合成三组。
接下来,只要将花瓣长度和花瓣宽度的值应用到定义的线性关系中,就可以对花萼长度进行猜测了。
那么3-均值,或更广泛来说,k-聚类算法是如何工作的呢?全部过程可以概括为几个简单的步调:
在线性回归中,我们测验测验在输入变量和目标变量之间构建一段关系,并将这种关系用条直线表示,我们平日将其称为回归线。
初始化步调:例如 K = 3 簇,这个算法为每个聚类中间随机选择三个数据点。
群集分派步调:该算法经由过程其余的数据点,并将个中的每一个分派给比来的群集。
重心移动步调:在集群分派后,每个簇的质心移动到属于组的所有点的平均值。
步调 2 和 3 反复多次,直到没有对集群分派作出更改为止。用 R 实现 k-聚类算法很简单,可以用下面的代码完成:

大年夜结不雅中,我们可以看到,该算法将数据分成三个组,由三种不合的色彩表示。我们也可以不雅察到这三个组是根据花瓣的大年夜小分的。更具体地说,红点代表小花瓣的花,绿点代表大年夜花瓣的花,蓝点代表中等大年夜小的花瓣的花。

在这一点上须要留意的是,在任何聚类中,对分组的解释都须要在范畴中的一些专业常识。在上一个例子中,如不雅你不是一个植物学家,你可能不会知道,k-均值做的是用花瓣大年夜小给花分组,与 Setosa、 Versicolo r和 Virginica 的差别无关!
是以,如不雅我们再次绘制数据,这一次由它们的物种着色,我们将看到集群中的类似性。

总结
那么,每种算法的优势是什么呢? 在处理实际生活中的问题时你钙揭捉?择哪一个呢?
起首,这里所提出的办法都是在实际操作中被验证为行之有效的算法 - 它们活着界各地的产品体系中被广泛应用,所以根据义务情况选用,能发挥十分强大年夜的感化。
推荐阅读
近日,网上宣布了一份申报——《2017 职场独身单身人群婚恋需求申报》,此申报引起了网友热议,它是由珍爱网和智联雇用合营出品的,主如果针对职场独身单身人群进行得线上抽样查询拜访,并且>>>详细阅读
本文标题:快速掌握机器学习,这3种算法你必须知道
地址:http://www.17bianji.com/lsqh/38718.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示