作家
登录

技术 | 使用Python来学习数据科学的完整教程

作者: 来源: 2017-07-20 09:00:53 阅读 我要评论

接下来,我们将看看创建猜测模型。

在Python中构建一个猜测模型

如今,我们已经有对建模有效的数据,如今我们来看看python代码,在我们的数据集上创建一个猜测模型。Skicit-Learn(sklearn)是Python中最常用的机械进修库,我们将会借助它来建模。

既然,sklearn请求所有输入都是数字,所以我们应当对类别进行编码,将所有的分类变量转换为数值变量。这可以应用以下代码完成:

  1. from sklearn.preprocessing import LabelEncoder 
  2.  
  3. var_mod = ['Gender','Married','Dependents','Education','Self_Employed','Property_Area','Loan_Status'
  4.  
  5. le = LabelEncoder() 
  6.  
  7. for i in var_mod: 
  8.  
  9.     df[i] = le.fit_transform(df[i]) 
  10.  
  11. df.dtypes  

第三方库支撑,固然很多库供给3.X的支撑,但仍然有大年夜量库只能在2.X版本上运行。如不亚妹计算将Python用于特定的场景,如网页开辟,高度依附外部模块,你可能选择2.7版本会更好。

接下来,我们将导入所需的模块。然后我们将定义一个通用分类函数,它将模型作为输入,并肯定精确度和交叉验证得分。既然这是一个介绍性的文┞仿,我将不再赘述编码的细节。

  1. #Import models from scikit learn module: 
  2.  
  3. from sklearn.linear_model import LogisticRegression 
  4.  
  5. from sklearn.cross_validation import KFold   #For K-fold cross validation 
  6.  
  7. from sklearn.ensemble import RandomForestClassifier 
  8.  
  9. from sklearn.tree import DecisionTreeClassifier, export_graphviz 
  10.  
  11. from sklearn import metrics 
  12.  
  13. #Generic function for making a classification model and accessing performance: 
  14.  
  15. def classification_model(model, data, predictors, outcome): 
  16.  
  17.   #Fit the model: 
  18.  
  19.   model.fit(data[predictors],data[outcome]) 
  20.  
  21.   #Make predictions on training set
  22.  
  23.   predictions = model.predict(data[predictors]) 
  24.  
  25.   #Print accuracy 
  26.  
  27.   accuracy = metrics.accuracy_score(predictions,data[outcome]) 
  28.  
  29.   print "Accuracy : %s" % "{0:.3%}".format(accuracy) 
  30.  
  31.   #Perform k-fold cross-validation with 5 folds 
  32.  
  33.   kf = KFold(data.shape[0], n_folds=5) 
  34.  
  35.   error = [] 
  36.  
  37.   for train, test in kf: 
  38.  
  39.     # Filter training data 
  40.  
  41.     train_predictors = (data[predictors].iloc[train,:]) 
  42.  
  43.     # The target we're using to train the algorithm. 
  44.  
  45.     train_target = data[outcome].iloc[train] 
  46.  
  47.     # Training the algorithm using the predictors 

      推荐阅读

      JavaScript操作DOM的那些坑

    scrollTop为滚动条向下移动的距离,所有浏览器都支撑document.documentElement。 【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! js在操作DOM中存在着很多>>>详细阅读


    本文标题:技术 | 使用Python来学习数据科学的完整教程

    地址:http://www.17bianji.com/lsqh/36300.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)