
一般对TF-IDF有效的奇怪值分化成分(components)是120-200个。更多的数量可能效不雅会有所改进但不是很明显,而计算机资本消费却很多。
TfidfVectorizer大年夜多半时刻比纯真计数效不雅要好。下面的参数设置在大年夜多半时刻都有很好的结不雅。
在进一步评价模型的机能今后,我们可以再做数据集的缩放,如许就可以评价线性模型了。归一化或者缩放后的特点可以用在机械进修模型上或者特点选择模块里。
一个中等程度的数据科学家天天都要处理大年夜量的数据。一些人说跨越60%到70%的时光都用于数据清理、数据处理合格局转化,以便于在之后应用机械进修模型。

特点选择有很多办法。最常用的办法之一是贪婪算法选择(正向或反向)。具体而言,选择一个特点,在一个固定的评价矩阵上练习一个模型,评价其机能,然后一个一个地往琅绫擎增长或移除特点,记录每一步的模型机能。最后选择机能得分最高时的那些特点。贪婪算法和其评价矩阵的AUC的一个例子见链接: https://github.com/abhishekkrthakur/greedyFeatureSelection。
须要留意的是,这个应用处非完美,必须根据请求进行修改。
其他更快的特点选择办法包含年腋荷琐模型中拔取最好的特点。我们可以根据一个逻辑回归模型的系数,或者练习一个随机丛林来选择最好的特点,然后把它们用在其它的机械进修模型里。

记得把估计值或者超参数的数量控制得尽量少,如许你才不会过拟合。

对稀少数据集,也可以用随机丛林分类器/随机丛林回归器或xgboost做特点选择。
大年夜正性稀少数据集里选择特点的其它风行办法还有基于卡方的特点选择,scikit-learn中即可应用。

这里,我们用卡方结合SelectKBest的办法大年夜数据中选择了20个特点。这个本身也是我们改进机械进修模型的超参数之一。
别忘了把任何中心过程产生的转化体转存起来。在验证集上你会要用它们来评价机能。
下一步(或者说,紧接着)重要的步调是模型选择+超参数优化。
一般来说,我们用下面的算法来选择机械进修模型:
- 分类
- 随机丛林
- GBM
- 逻辑回归
- 朴实贝叶斯
- 支撑向量机
- K比来邻法
- 回归
- 随机丛林
- GBM
- 线性回归
- Ridge
- Lasso
- SVR
我须要优化哪个参数?若何选择最好的参数?这些是人们经常会碰到的问题。没有大年夜量数据集上不合模型+参数的经验,无法获得这些问题的谜底。有经验的人又不肯意把他们的桥绫桥公之于众。荣幸的是,我有丰富的经验,同时愿意分享。让我们来看看不合模型下超参数的机密:

RS* =不好说合适的值是若干,在这些超参数里随机搜刮一下。
以我小我浅见(原文作者小我看法),上述的┞封些模型比其他模型好,无需评价其它模型。


膳绫擎的规矩和框架对我碰到的数据集而言运行优胜。当然,在特别复杂的情况下也掉败过。世界没有完美的器械,我们只能在进修中赓续改进,如同机械进修一样。
【编辑推荐】
- 和传统模式说袈滟见,看机械进修若何走向深度进修?
- TensorFlow产品经理:机械进修若何改变将来十年的软硬件?
- 机械进修K-means算法在Python中的实现
- Python赶超R说话,成为数据科学、机械进修平台中最热点的说话?
- 机械进修本来如斯有趣:若何用深度进修进行语音辨认
推荐阅读
【沙龙】51CTO诚邀您9月23号和多位技巧大年夜咖一路聊智能CDN的优化之路,抓紧时光哦! 除非你以前几年一向隐居,远离这个计算机的世界,不然你弗成能没有听过Hadoop。全名Apache Hadoop,>>>详细阅读
本文标题:解决机器学习问题有通法!看这一篇就够了
地址:http://www.17bianji.com/lsqh/37504.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示