第二种方法,导入了math库的┞符个名称空间,即可以直接应用factorial()而不引用math。
提示:Google建议你应用第一种导入库方法,因为你将知道函数来自哪里。
以下是库列表,任何科学计算和数据分析会用到:
- NumPy:代表的是Numerical Python。NumPy最强大年夜的功能是n维数组。该库还包含根本的线性代数函数,傅里叶变换,随机数函数和与其他底层说话(如Fortran,C和C ++)集成的对象。
- SciPy:代表的是Scientific Python。SciPy建立在NumPy基本上。它是离散傅里叶变换,线性代数,优化和稀少矩阵等多种高等科学和工程模块最有效的库之一。
- Matplotlib:用于绘制各类各样的图形,大年夜直方图到线图、热力争。你可以应用ipython notebook中的Pylab功能(ipython notebook -pylab = inline)在线应用这些画图功能。如不雅忽视内联选项,pylab将ipython情况转换为与Matlab异常类似的情况。还可以应用Latex敕令在图像添加数学符号。
- Pandas:用于构造化数据的运算和操作。广泛用于数据整顿和预处理。相较而言,Pandas被添加到Python时光不久,其有助于进步Python在数据科学社区的应用。
- Scikit:用于机械进修。该库建立在NumPy,SciPy和matplotlib基本上,包含很多有效的机械进修和统计建模对象,例如分类,回归,聚类和降维。
- Statsmodels:用于统计建模。Statsmodels是一个Python中供给用户摸索数据、估计统计模型和履行统计测试的模组。可用于不合类型数据的描述性统计,统计测试,画图功能和结不雅统计。
- Seaborn:用于数据可视化。Seaborn是一个用于在Python中制造有吸引力和翔实的统计图形库。它是基于matplotlib。Seaborn旨在使可视化成为摸索和懂得数据的核心构成。
- Bokeh:用于在现代统??读器上创建交互式图表,仪表盘和数据应用法度榜样。它付与用户以D3.js的风格生成优雅简洁的图形。此外,它具有超大年夜型或流式数据集的高机能交互才能。
- Blaze:将Numpy和Pandas的才能扩大到分布式和流式传输数据集。它可以用于大年夜浩瀚来源(包含Bcolz,MongoDB,SQLAlchemy,Apache Spark,PyTables等)拜访数据。与Bokeh一路,Blaze可以作为在巨型数据块上创建有效可视化和仪表盘的强大年夜的对象。
- Scrapy:用于收集爬虫。它是获取特定模式数据的异常有效的框架。它大年夜网站首页url开端,然后发掘网站内的网页内容来收集信息。
- SymPy:用于符号计算。它具有大年夜根本算术符号到微积分,代数,离散数学和量子物理学的广泛才能。另一个有效的功能是将计算结不雅格局化为LaTeX代码。
- Requests:用于web拜访。它类似于标准python库urllib2,然则代码更轻易。你会发明与urllib2的奥妙差别,然则对于初学者来说,Requests可能更便利。
你可能须要的额外的看魏
- os用于操作体系和文件操作
- networkx和igraph为基于图的数据操作
- regular expressions用于在文本中查找特定模式的数据
- BeautifulSoup用于收集爬虫。它不如Scrapy,因为它只是单个网页中提守信息。
既然我们熟悉Python基本常识和库,那么我们可以经由过程Python深刻解决问题。做猜测模型过程中,我们会应用到一些功能强大年夜的看维也会碰到不合的数据构造。我们将带你进入三个关键阶段:
- 数据摸索 – 具体懂得我们的数据
- 数据清洗 – 清理数据,使其更合适统计建模
- 猜测建模 – 运行实际算法并获得结不雅
应用pandas进行数据摸索
为了进一步摸索我们的数据,给你介绍另一个动物(似乎Python还不敷!)- Pandas

Pandas是Python中最有好用的数据分析库之一(我知道这些名字听起来很奇怪,先如许!)促使越来越多半据科学界人士应用Python。如今我们将应用pandas大年夜Analytics Vidhya比赛中攫取数据集,进行摸索性分析,并构建我们的第一个基本分类算法来解决这个问题。
在数据加载之前,先懂得Pandas中2个关键数据构造 – Series和DataFrames。
Series及DataFrame介绍
Series可以懂得为1维标签/索引数组。你可以经由过程这些标签拜访series的各个元素。
Dataframe类似于Excel工作簿,列名称引用列,应用行号拜访行。本质差别在于dataframes中列名称和行号称为列和行索引。
Series和DataFrames构成了Pandas在Python中的核心数据模型。数据集起首被读入Dataframes,然后各类操作(例如分组、聚合等)可以异常轻易地应用于其列。
应用案例 – 贷款猜测问题
以下是变量的描述:
变量 描述 Loan_ID 贷款ID Gender 男/女 Married 已婚(Y/N) Dependents 赡养人数 Education 教导程度(Graduate/Under Graduate) Self_Employed 自雇人士(Y/N) ApplicantIncome 申报收入 CoapplicantIncome 综合收入 LoanAmount 贷款金额 Loan_Amount_Term 贷款月数 Credit_History 信用记录 Property_Area 房产地位(Urban/Semi Urban/Rural) Loan_Status 贷款赞成状况(Y/N)开端数据摸索
推荐阅读
scrollTop为滚动条向下移动的距离,所有浏览器都支撑document.documentElement。 【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! js在操作DOM中存在着很多>>>详细阅读
本文标题:技术 | 使用Python来学习数据科学的完整教程
地址:http://www.17bianji.com/lsqh/36300.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示