
我们可以看到大年夜学学历和非大年夜学学历的平均收入之间没有本质性差别。然则,高学历中高收入人数更多,这似乎是离群值。
如今,我们来看看变量LoanAmount的直方图和boxplot,应用以下敕令:
- df['LoanAmount'].hist(bins=50)
- df.boxplot(column='LoanAmount')
再次,有一些离群值。显然,ApplicantIncome和LoanAmount都须要必定量的数据清洗。 LoanAmount出缺掉值和离群值,同时,ApplicantIncome有一些离群值,接下来我们将分几个部分,做更深刻的懂得。
分类变量的分析
如今我们懂得ApplicantIncome和LoanIncome的分布,为了更具体地舆解分类变量,我们将应用Excel的透视表和交叉表。例如,我们来看根据信用记录获得贷款的机会,这可以在MS Excel中应用数据透视表来实现:

如今我们将看看应用Python生成类似洞察所需的步调。
- temp1 = df['Credit_History'].value_counts(ascending=True)
- temp2=df.pivot_table(values='Loan_Status',index=['Credit_History'],aggfunc=lambda x: x.map({'Y':1,'N':0}).mean())
- print 'Frequency Table for Credit History:'
- print temp1
- print '\nProbility of getting loan for each Credit History class:'
- print temp2
如今可以看到,我们获得一个类似MS Excel一样的透视表,这可以应用“matplotlib”库,用以下代码画条形图:
- import matplotlib.pyplot as plt
- fig = plt.figure(figsize=(8,4))
- ax1 = fig.add_subplot(121)
- ax1.set_xlabel('Credit_History')
- ax1.set_ylabel('Count of Applicants')
- ax1.set_title("Applicants by Credit_History")
- temp1.plot(kind='bar')
- ax2 = fig.add_subplot(122)
- temp2.plot(kind = 'bar')
- ax2.set_xlabel('Credit_History')
- ax2.set_ylabel('Probability of getting loan')
- ax2.set_title("Probability of getting loan by credit history")

这注解如不雅申请人有有效的信用记录,获得贷款的机会是没有有效信用记录的8倍。你可以经由过程已婚,自雇,栖身地区等绘制类似的图表。
或者,这两个图也可以经由过程将它们组合在堆叠图表中来进行可视化:
- temp3 = pd.crosstab(df['Credit_History'], df['Loan_Status'])
- temp3.plot(kind='bar', stacked=True, color=['red','blue'], grid=False)
随机丛林是解决分类问题的另一种算法。

还可以添加性别(类似于Excel中的数据透视表):
推荐阅读
scrollTop为滚动条向下移动的距离,所有浏览器都支撑document.documentElement。 【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! js在操作DOM中存在着很多>>>详细阅读
本文标题:技术 | 使用Python来学习数据科学的完整教程
地址:http://www.17bianji.com/lsqh/36300.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示