
1. NumPy (提交数: 15980, 供献者数: 522)
近年来,Python 在数据科学行业扮演着越来越重要的角色。是以,我根据比来的应用体验,在本文中列出了对数据科学家、工程师们最有效的那些库。
因为这些库都开源了,我们大年夜Github上惹人了提交数,供献者数和其他指标,这可以作为库风行程度的参考指标。
2. SciPy (提交数: 17213, 供献者数: 489)
当开端处理Python中的科学义务,Python的SciPy Stack肯定可以供给赞助,它是专门为Python中科学计算而设计的软件集合(不要混淆SciPy库,它是SciPy Stack的一部分,和SciPy Stack的社区)如许我们开妒攀来看一下吧。然而,SciPy Stack相当宏大年夜,个中有十几个库,我们把核心放在核心包上(特别是最重要的)。
关于建立科学计算栈,最根本的包是Numpy(全称为Numerical Python)。它为Python中的n维数组和矩阵的操作供给了大年夜量有效的功能。该库供给了NumPy数组类型的数学运算向量化,可以改良机能,大年夜而加快履行速度。
SciPy是一个工程和科学软件库。雷锋网再次提示,你须要懂得SciPy Stack和SciPy库之间的差别。
SciPy包含线性代数,优化,集成和统计的模块。SciPy库的重要功能是建立在NumPy上,大年夜而它的数组大年夜量的应用了NumPy的。它经由过程其特定子模块供给有效的数值例程,并作为数字积分、优化和其他例程。SciPy的所有子模块中的功能都有具体的解释 ——又是一个SciPy异常有赞助的点。
3. Pandas (提交数: 15089, 供献者数:762)
Pandas是一个Python包,旨在经由过程“标记”和“关系”数据进行工作,简单直不雅。Pandas是数据整顿的完美对象。它设计用于快速简单的数据操作,聚合和可视化。
库中有两个重要的数据构造:
- “系列”(Series),一维

- “数据帧”(Data Frames),二维

例如,当您要大年夜这两种类型的构造中接收到一个新的Dataframe时,经由过程传递一个Series,您将收到一个零丁的行到DataFrame的DF:

这里稍微列出了你可以用Pandas做的工作:
- 轻松删除并添加数据帧(DataFrame)中的列
- 将数据构造转换为数据帧(DataFrame)对象
- 处理损掉的数据,表示为NaN
- 功能强大年夜的分组
Google趋势记录

trends.google.com

datascience.com/trends
5. Seaborn (提交数: 1699, 供献者数: 71)
可视化
4.Matplotlib (提交数: 21754, 供献者数: 588)
13. Gensim (提交数: 2878,供献者数: 179)
又一个SciPy Stack核心软件包以及 Python库,Matplotlib为轻松生成简单而强大年夜的可视化而量身定制。它是一个顶尖的软件(在NumPy,SciPy和Pandas的赞助下),它使Python成为像MatLab或Mathematica如许的科学对象的竞争敌手。
然而,这个库是低层级的,这意味着你须要编写更多的代码才能达到高等的可视化效不雅,并且平日会比应用更多的高等对象付出更多的尽力,但总体上这些尽力是值得的。
只要付出一点你就可以做任何可视化:
- 线图
- 散点图
- 条形图和直方图
- 饼状图;
- 茎图
- 轮廓图
- 场图
- 频谱图
该库由不合的平台支撑,并应用不合的GUI套件来描述所获得的可视化。不合的IDE(如IPython)都支撑Matplotlib的功能。
还有一些额外的库可以使可视化变得加倍轻易。

Seaborn重要存眷统计模型的可视化;这种可视化包含热图,这些热图(heat map)总结数据但仍描述整体分布。Seaborn基于Matplotlib,并高度依附于此。

11. Keras. (提交数: 3519,供献者数: 428)
6. Bokeh (提交数: 15724, 供献者数: 223)
另一个很不错的可视化库是Bokeh,它针对交互式可视化。与以前的库比拟,它自力于Matplotlib。正如我们提到的,Bokeh的重要核心是交互性,它经由过程现代浏览器以数据驱动文档(d3.js)的风格出现。
推荐阅读
【51CTO.com原创稿件】2017年7月21日-22日,由51CTO主办的以人工智能为主题的WOTI2017全球立异技巧峰会在北京富力万丽酒店隆重举办。峰会时代,30+AI明星,数十场环绕人工智能主题的出色演>>>详细阅读
地址:http://www.17bianji.com/lsqh/36414.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示