4.猜测分析。如不雅你根据以前5年的信用卡汗青记录来进行分析,并且划分具有必定的持续性,则你可以高概率猜测来岁将与以前几年相差无几。此处须要留意的细节是,这并不是“猜测将来”,而是将来可能会产生的“概率”。在大年夜数据猜测分析中,数据科学家可能会应用类似机械进修、高等的统计过程(后文将对这些术语进话旧绍)等先辈的技巧去猜测气象、经济变更等。
【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路!
如不雅你初来乍到,大年夜数据看起来很吓人!根据你控制的根本理论,让我们专注于一些关键术语以此给你的约会对象、老板、家人或者任何一小我带来深刻的印象。
12. 数据发掘。数据发掘是指应用复杂的模式辨认技巧大年夜大年夜量数据中找到有意义的模式、提取看法。这与我们前文评论辩论的应用小我数据做分析的术语“分析”密切相干。为了提掏出有意义的模式,数据发掘者应用统计学(是呀,好老的数学)、机械进修算法和人工智能。

让我们开端吧:
1.算法。“算法”若何与大年夜数据相干?即使算法是一个通用术语,但大年夜数据分析使其在现代更受青睐和风行。
2.分析。岁终你可能会收到一份来自负用卡公司寄来的包含了全年所有交易记录的年关报表。如不雅你有兴趣进一步分析本身在食物、衣服、娱乐等方面具体花费占比呢?那你就是在做“分析”了。你正大年夜一堆原始数据中来汲取经验,以赞助本身为来年的花费做出决定计划。如不雅你正在针半数个城市人群对Twitter或Facebook的帖子做同样的演习呢?那我们就是在评论辩论大年夜数据分析了。大年夜数据分析的本质是应用大年夜量数据来进行揣摸和讲故事。大年夜数据分析有3种不合到的类型,接下来便持续本话题进行依次评论辩论。
3.描述性分析。方才如不雅你告诉我,客岁你的信用卡花费在食物上花费了25%、在服装上花费了35%、娱乐晃荡上花费了20%、剩下的就是杂七杂八的事项,这种就是描述性分析。当然你还可以参考更多的细节。
5.规范分析。沿用信用卡交易的案例,你可能想要找出哪方面的支撑(级食物、服装、娱乐等)对本身的┞符体支撑产生巨大年夜的影响。规范分析建立在猜测分析的基本之上,包含了“行动”记录(例如削减食物、服装、娱乐支撑),并分析所得结不雅来“规定”最佳类别以削减总体支撑。你可以测验测验将其发散到大年夜数据,并假想高管们若何经由过程查看各类行动的影响来做出数据驱动的决定计划。
6.批处理。固然批量数据处理在大年夜型机时代就早已出现,但大年夜数据交给它更多大年夜数据集处理,是以付与了批处理更多的意义。对于一段时光内收集到的一组事务,批量数据处理为处理大年夜量数据供给了一种有效的办法。后文将介绍的Hadoop就是专注于批量数据处理。
8. 云计算。显而易见云计算已经变得无所不在,所以本文可能无须赘述,但为了文┞仿的完全性照样佐以介绍。云计算的本质是在长途办事器上运行的软件和(/或)数据托管,并许可大年夜互联网上的任何处所进行拜访。
9. 集群计算。它是一种应用多台办事器的汇集资本的“集群”来进行计算的独特方法。在懂得了更多技巧之后,我们可能还会评论辩论节点、集群治理层、负载均衡和并行处赖寥。
11. 数据湖。当我第一次听到这个词典时刻,我真的认为有人在开愚人节的打趣。但它真的是个术语!数据湖是一个原始格局的企业级数据的大年夜型存储库。固然此处评论辩论的是数据湖,但有须要再一路评论辩论下数据仓库,因为数据湖和数据仓库在概念上是极其类似的,都是企业级数据的存储库,但在清理和与其他数据源集成之后的构造化格局上有所差别。数据仓库常用于惯例数据(但不完全)。据说数据湖可以或许让用户轻松拜访企业级数据,用户真正按需知道本身正在寻找的是什么、若何处理并让其智能化应用。
13.数据科学家。我们谈论的是一个如斯热点的职业!数据科学家们可以经由过程提取原始数据(难道是早年文所说的数据湖中提取的?),处理数据,然后提出新看法。数据科学家所需具备的一些技能与超人无异:分析、统计、计算机科学、创造力、故事讲述和懂得营业情况。难怪他们能获得如斯高的薪水待遇。
14.分布式文件体系。因为大年夜数据太大年夜而无法在单个体系长进行存储,分布式文件体系供给一种数据存储体系,便利跨多个存储设备进行大年夜量数据的存放,并有助于降低大年夜量数据存储的成本和复杂度。
15. ETL。ETL分别是extract,transform,load的首字母缩写,代表提取、转化和加载的过程。 它具体是指“提取”原始数据,经由过程数据清洗/润饰的方法进行“转化”以获得 “合适应用”的数据,进而“加载”到合适的存储库中供体系应用的┞符个过程。尽管ETL章一ㄅ念源竽暌冠数据仓库,但如今也实用于其它情景下的过程,例如在大年夜数据体系中大年夜外部数据源获取/吸法术据。
16. Hadoop。人们一想起大年夜数据就能急速想到Hadoop。 Hadoop(拥有可爱的大年夜象LOGO)是一个开源软件框架,重要构成部分是Hadoop分布式文件体系(HDFS),Hadoop安排了分布式硬件以支撑大年夜型数据集的存储、检嘶赝分析。如不雅你真的想给别人留下深刻的印象,还可以谈谈YARN(Yet Another Resource Schedule,另一个资本调剂器),正如其名,它也是一个资本调剂器。我由衷佩服这些为法度榜样定名的人。为Hadoop定名的Apache基金会还想出了Pig,Hive和Spark(没错,它们都是各类软件的名称)。这些名字难道不让你认为印象深刻吗?
17. 内存计算。一般来说,任何可以在不拜访I / O的情况下进行的计算估计会比须要拜访I/O的速度更快。内存内计算是一种可以或许将工作数据集完全转移到集群的集体内存中、并避免了将中心枷⒚鸫入磁盘的技巧。Apache Spark就是一种内存内计算体系,它与I / O比拟,在像Hadoop MapReduce如许的体系上绑定具有巨大年夜的优势。
推荐阅读
【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! CGI全称是“通用网关接口”(Common Gateway Interface), 它可以让一个客户端,大年夜网页浏览>>>详细阅读
本文标题:每个人都应该知道的25个大数据术语
地址:http://www.17bianji.com/lsqh/36303.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示