作家
登录

技术 | 使用Python来学习数据科学的完整教程

作者: 来源: 2017-07-20 09:00:53 阅读 我要评论

and target. 
  •  
  •     model.fit(train_predictors, train_target) 
  •  
  •     #Record error from each cross-validation run 
  •  
  •       error.append(model.score(data[predictors].iloc[test,:],data[outcome].iloc[test])) 
  •  
  •   print "Cross-Validation Score : %s" % "{0:.3%}".format(np.mean(error)) 
  •  
  •   #Fit the model again so that it can be refered outside the function
  •  
  •   model.fit(data[predictors],data[outcome]) 
  • 逻辑回归

    我们来做第一个逻辑回归模型。一种办法是将所有变量都放入模型中,但这可能会导致过拟合。 简单来说,模型采取所有变量,有可能懂得数据的特定的复杂关系,并不克不及很好地推广。

    我们可以很轻易地做出一些直不雅的假设,获得贷款的机会会更高:

    应用Python来进行数据分析的原因有很多,以前一段时光经由过程比较SAS和R,有以下几点来由:

    • 开源免费
    • 强大年夜社区支撑
    • 易学
    • 成为数据科学和web产品分析的通用说话

    1.具有信用记录的申请人

    2.具有较高申请收入和综合收入的申请人

    3.高等教导程度的申请人

    4.具有高增长前景的城市地产

    我们用’Credit_History’做我们的第一个模型。

    1. outcome_var = 'Loan_Status' 
    2.  
    3. model = LogisticRegression() 
    4.  
    5. predictor_var = ['Credit_History'
    6.  
    7. classification_model(model, df,predictor_var,outcome_var)  

    精确度:80.945%,交叉验证得分:80.946%

    1. df.boxplot(column='ApplicantIncome'by = 'Education')  
    1. #We can try different combination of variables: 
    2.  
    3. predictor_var = ['Credit_History','Education','Married','Self_Employed','Property_Area'
    4.  
    5. classification_model(model, df,predictor_var,outcome_var) 

    精确度:80.945%交叉验证得分:80.946%

    一般来说,我们期望经由过程增长变量数量来进步精确度,但这是一个更具挑衅性的案例,精确度和交叉验证得分不受重要性较小的变量的影响。信用汗青是主导模式。我们如今有两个选择:

    1.特点工程:发掘新信息,尝尝试猜测。这个留给大年夜家去发挥创造力。

    2.更好的建模技巧。接下来我们来商量一下。

    决定计划树

    决定计划树是构建猜测模型的另一种办法,平日比逻辑回归模型具有更高的精度。

    1. model = DecisionTreeClassifier() 
    2.  
    3. predictor_var = ['Credit_History','Gender','Married','Education'
    4.  
    5. classification_model(model, df,predictor_var,outcome_var)  

    精确度:81.930%,交叉验证得分:76.656%

    这里,基于分类变量的模型不会受信用汗青产生影响。我们来测验测验几个数值型变量:

    精确度:92.345%交叉验证得分:71.009%

    1. table = df.pivot_table(values='LoanAmount'index='Self_Employed' ,columns='Education', aggfunc=np.median) 
    2.  
    3. # Define function to return value of this pivot_table 
    4.  
    5. def fage(x): 

        推荐阅读

        JavaScript操作DOM的那些坑

      scrollTop为滚动条向下移动的距离,所有浏览器都支撑document.documentElement。 【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! js在操作DOM中存在着很多>>>详细阅读


      本文标题:技术 | 使用Python来学习数据科学的完整教程

      地址:http://www.17bianji.com/lsqh/36300.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)