逻辑回归
我们来做第一个逻辑回归模型。一种办法是将所有变量都放入模型中,但这可能会导致过拟合。 简单来说,模型采取所有变量,有可能懂得数据的特定的复杂关系,并不克不及很好地推广。
我们可以很轻易地做出一些直不雅的假设,获得贷款的机会会更高:
应用Python来进行数据分析的原因有很多,以前一段时光经由过程比较SAS和R,有以下几点来由:
- 开源免费
- 强大年夜社区支撑
- 易学
- 成为数据科学和web产品分析的通用说话
1.具有信用记录的申请人
2.具有较高申请收入和综合收入的申请人
3.高等教导程度的申请人
4.具有高增长前景的城市地产
我们用’Credit_History’做我们的第一个模型。
- outcome_var = 'Loan_Status'
- model = LogisticRegression()
- predictor_var = ['Credit_History']
- classification_model(model, df,predictor_var,outcome_var)
精确度:80.945%,交叉验证得分:80.946%
- df.boxplot(column='ApplicantIncome', by = 'Education')
- #We can try different combination of variables:
- predictor_var = ['Credit_History','Education','Married','Self_Employed','Property_Area']
- classification_model(model, df,predictor_var,outcome_var)
精确度:80.945%交叉验证得分:80.946%
一般来说,我们期望经由过程增长变量数量来进步精确度,但这是一个更具挑衅性的案例,精确度和交叉验证得分不受重要性较小的变量的影响。信用汗青是主导模式。我们如今有两个选择:
1.特点工程:发掘新信息,尝尝试猜测。这个留给大年夜家去发挥创造力。
2.更好的建模技巧。接下来我们来商量一下。
决定计划树
决定计划树是构建猜测模型的另一种办法,平日比逻辑回归模型具有更高的精度。
- model = DecisionTreeClassifier()
- predictor_var = ['Credit_History','Gender','Married','Education']
- classification_model(model, df,predictor_var,outcome_var)
精确度:81.930%,交叉验证得分:76.656%
这里,基于分类变量的模型不会受信用汗青产生影响。我们来测验测验几个数值型变量:
精确度:92.345%交叉验证得分:71.009%
- table = df.pivot_table(values='LoanAmount', index='Self_Employed' ,columns='Education', aggfunc=np.median)
- # Define function to return value of this pivot_table
- def fage(x):
推荐阅读
scrollTop为滚动条向下移动的距离,所有浏览器都支撑document.documentElement。 【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! js在操作DOM中存在着很多>>>详细阅读
本文标题:技术 | 使用Python来学习数据科学的完整教程
地址:http://www.17bianji.com/lsqh/36300.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示