
开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散
本文作者是一名地地道道的法度榜样员,最大年夜的乐趣就是爬各类网站。特别是在以前的一年迈,为了娱乐和利润而爬掉落了无数网站。大年夜小众到主流电子市廛再到消息媒体和文学博客,经由过程应用简单的对象(如BeautifulSoup缉获得了很多有趣且干净的数据—我也很爱好Chrome 的Headless模式。
In [5]:

本文,作者将分析大年夜Greek wine e-shop市廛(一个希腊葡萄酒网站)中获得的数据,来看看哪种葡萄酒最受迎接。
scraper本身相当简单,可以在GitHub页面(https://github.com/Florents-Tselai/greek-wines-analysis)找到。作者将侧重于经由过程应用标准的Python包对获得的数据(1125个独特的标签)做一些快速的摸索性分析。
scraper本身裸露了一个相当简单的API。起首,请求葡萄酒页面的数据,并将数据返回给nicedict,如下所示:
In [2]:

In [3]:

Out[3]:

然后,定义一些matplotlib。
In [4]:

加载由hou搜刮引擎优化fwine_gr.dump模块生成的数据转储,开辟者也可以在GitHub页面找到.json,.csv和.xlsx的数据集。
以下是所拥稀有据的视图:
In [6]:

Out[6]:

用np.nan调换空的字符串,使它们更轻易处理 Pandas。
In [7]:

重定名一些包含特别字符的列名,以便将它们用作本机DataFrame存储器。
In [8]:
把留意力转移到blends上,我们做了一些Numpy和Scikit-Learn来产生blends的矩阵。

我们还将恰当的类型分派给列:
In [9]:


让我们将color列值大年夜希腊语翻译成英语。

以下是数据集的色彩直方图。
In [11]:

以下是每种葡萄酒的简单指标分布情况:
In [12]:

如图所示,Average Rating列几乎为正态分布,μ值高达85以上。 Reddit上的Kroutoner说清楚明了为什么会产生这种情况(并改┞俘了作者以前的缺点):
典范的葡萄酒评级是50-100,而不是0-100。所以看起来似乎只有一半分布,实际上是一个几乎完全的分布。此外,90分以上的葡萄酒一般被认为效不雅更好,发卖也更好。这个事实改变了对数据的解释,也就是说大年夜多半葡萄酒被评为好,只有一小部分被评为异常好。
为了进一步推动,来看一下tags 列。

似乎每个标签列表可以给出有关葡萄酒的各类属性(品种,甜味等)的信息。接下来,作者将这些属性分开,将tags列元素大年夜list 转换为set列表元素,因为如许会使操作更简单。也就是说,不是在一个if x in -else-try-except-IndexError中,我们将应用set操作。
推荐阅读
开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散 【编辑推荐】Python薪资又涨了!这可咋办!Python脚本分析CPU应用情况比来租房有点烦!技恋人若何用Python找到称心如意的“小窝”>>>详细阅读
本文标题:我用Python爬了一个零售网站,分析了一千多种葡萄酒!
地址:http://www.17bianji.com/lsqh/39585.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示