作家
登录

从小白到大数据人工智能专家的学习历程

作者: 来源: 2017-10-11 11:41:19 阅读 我要评论

大年夜数据处理技巧怎么进修呢?起首我们要进修Python说话和Linux操作体系,这两个是进修大年夜数据的基本,进修的次序不分前后。


Spark:它是用来弥补基于MapReduce处理数据速度上的缺点,它的特点是把数据装载到内存上钩算而不是去读慢的要逝世进化还特别慢的硬盘。特别合适做迭代运算,所以算法流们特别稀饭它。它是用scala编写的。Java说话或者Scala都可以操作它,因为它们都是用JVM的。

Python:Python 的排名大年夜客岁开端就借世人工智能持续上升,如今它已经成为了说话排行第一名。

大年夜进修难易度来看,作为一个为“优雅”而生的说话,Python语法简捷而清楚,对调层做了很好的封装,是一种很轻易上手的高等说话。在一些习惯于底层法度榜样开辟的“硬核”法度榜样员眼里,Python的确就是一种“伪代码”。

大年夜小白到大年夜数据人工智能专家的进修过程

在大年夜数据和数据科学范畴,Python几乎是全能的,任何集群架构软件都支撑Python,Python也有很丰富的数据科学库,所以Python不得不学。

Linux:因为大年夜数据相干软件都是在Linux上运行的,所以Linux要进修的扎实一些,学好Linux对你快速控制大年夜数据相干技巧会有很大年夜的赞助,能让你更好的懂得hadoop、hive、hbase、spark等大年夜数据软件的运行情况和收集情况设备,能少踩很多坑,学会shell就能看懂脚本如许能更轻易懂得和设备大年夜数据集群。还能让你对今后新出的大年夜数据技巧进修起来更快。

好说完基本了,再说说还须要进修哪些大年夜数据技巧,可以按我写的次序学下去。

Hadoop:这是如今风行的大年夜数据处理平台几乎已经成为大年夜数据的代名词,所以这个是必学的。Hadoop琅绫擎包含几个组件HDFS、MapReduce和YARN,HDFS是存储数据的处所就像我们电脑的硬盘一样文件都存储在这个膳绫擎,MapReduce是对数据进行处理计算的,它有个特点就是不管多大年夜的数据只要给它时光它就能把数据跑完,然则时光可能不是很快所以它叫数据的批处理。YARN是表现Hadoop平台概念的重要组件有了它大年夜数据生态体系的其它软件就能在hadoop上运行了,如许就能更好的应用HDFS大年夜存储的优势和节俭更多的资本比如我们就不消再零丁建一个spark的集群了,让它直接跑在现有的hadoop yarn膳绫擎就可以了。其实把Hadoop的┞封些组件学明白你就能做大年夜数据的处理了,只不过你如今还可能对”大年夜数据”到底有多大年夜还没有个太清跋扈的概念,听我的别纠结这个。等今后你工作了就话苄很多场景碰到几十T/几百T大年夜范围的数据,到时刻你就不会认为数据大年夜真好,越大年夜跃有你头疼的。当然别怕处理这么大年夜范围的数据,因为这是你的价值地点,让那些个搞Javaee的php的html5的和DBA的爱慕去吧。

记住学到这里可以作为钠揭捉?大年夜数据的一个节点。

Zookeeper:这是个万金油,安装Hadoop的HA的时刻就会用到它,今后的Hbase也会用到它。它一般用来存放一些互相协作的信息,这些信息比较小一般不会跨越1M,都是应用它的软件对它有依附,对于我们小我来讲只须要把它安装精确,让它正常的run起来就可以了。

Mysql:我们进修完大年夜数据的处理了,接下来进修进修小数据的处理对象mysql数据库,因为一会装hive的时刻要用到,mysql须要控制到什么层度那?你能在Linux上把它安装好,运行起来,会设备简单的权限,修改root的暗码,创建数据库。这里重要的是进修SQL的语法,因为hive的语法和这个异常类似。

Sqoop:这个是用于把Mysql里的数据导入到Hadoop里的。当然你也可以不消这个,直接把Mysql数据表导出成文件再放到HDFS上也是一样的,当然临盆情况中应用要留意Mysql的压力。

Hive:这个器械对于会SQL语法的来说就是神器,它能让你处理大年夜数据变的很简单,不会再费劲的编写MapReduce法度榜样。有的人说Pig那?它和Pig差不多控制一个就可以了。

Oozie:既然学会Hive了,我信赖你必定须要这个器械,它可以帮你治理你的Hive或者MapReduce、Spark脚本,还能检查你的法度榜样是否履行精确,掉足了给你发报警并能帮你重试法度榜样,最重要的是还能帮你设备义务的依附关系。我信赖你必定会爱好上它的,不然你看着那一大年夜堆脚本,和密密麻麻的crond是不是有种想屎的感到。

Hbase:这是Hadoop生态体系中的NOSQL数据库,他的数据是按照key和value的情势存储的并且key是独一的,所以它能用来做数据的排重,它与MYSQL比拟能存储的数据量大年夜很多。所以他常被用于大年夜数据处理完成之后的存储目标地。

Kafka:这是个比较好用的队列对象,队列是干吗的?列队买票你知道不?数据多了同样也须要列队处理,如许与你协作的其它同窗不会叫起来,你干吗给我这么多的数据(比如好几百G的文件)我怎么处理得过来,你别怪他因为他不是搞大年夜数据的,你可以跟他讲我把数据放在队列里你应用的时刻一个个拿,如许他就不在抱怨了立时灰流流的却竽暌古化他的法度榜样去了,因为处理不过来就是他的工作。而不是你给的问题。当然我们也可以应用这个对象来做线上及时数据的入库或人HDFS,这时你可以与一个叫Flume的对象合营应用,它是专门用来供给对数据进内行单处理,并写到各类数据接收方(比如Kafka)的。

会这些器械你就成为一个专业的大年夜数据开辟工程师了,月薪2W都是小毛毛雨。

深度进修(Deep Learning, DL):深度进修的概念源竽暌冠人工神经收集的研究,比来几年成长迅猛。深度进修应用的实例有AlphaGo、人脸辨认、图像检测等。是国表里稀缺人才,然则深度进修比拟较较难,算法更新也比较快,须要跟随有经验的师长教师进修。


  推荐阅读

  Apache Spark常见的三大误解

比来几年关于Apache Spark框架的声所以越来越多,并且慢慢地成为大年夜数据范畴的主流体系。比来几年Apache Spark和Apache Hadoop的Google趋势可以证实这一点:上图已经明显展示出比来五年,Apache Sp>>>详细阅读


本文标题:从小白到大数据人工智能专家的学习历程

地址:http://www.17bianji.com/lsqh/37770.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)