数据清洗(Data Cleansing):顾名思义,数据清洗涉及到检测并更正或者删除数据库中不精确的数据或记录,然跋文住「脏数据」。借助于主动化或者人工对象和算法,数据分析师可以或许更正并进一步丰富数据,以进步数据质量。请记住,脏数据会导致缺点的分析和糟糕的决定计划。
数据即办事(DaaS):我们有软件即办事(SaaS), 平台即办事(PaaS),如今我们又有 DaaS,它的意思是:数据即办事。经由过程给用户供给按需拜访的云端数据,DaaS 供给商可以或许赞助我们快速地获得高质量的数据。
数据虚拟化(Data virtualization):这是一种数据治理办法,它许可某个应用在不知道技巧细节(如数据存放在何处,以什么格局)的情况下可以或许采取并操作数据。例如,社交收集应用这个办法来存储我们的┞氛片。
脏数据(Dirty Data):既然大年夜数据这么吸惹人,那么人们也开端给数据加上其他的形容词来形成新的术语,例如黑数据(dark data)、脏数据(dirty data)、小数据(small data),以及如今的智能数据(smart data)。脏数据就是不干净的数据,换言之,就是不精确的、反复的以及不一致的数据。显然,你不会想着和脏数据搅在一路。所以,尽快地修改它。
模糊逻辑(Fuzzy logic):我们有若干次对一件工作是肯定的,例如 100% 精确?很稀少!我们的大年夜脑将数据聚合成部分的事实,这些事实进一步被抽象为某种可以或许决定我们决定计划的阈值。模糊逻辑是一种如许的计算方法,与像布尔代数等等中的「0」和「1」相反,它旨在经由过程逐渐清除部分事实来模仿人脑。
游戏化(Gamification):在一个典范的游戏中,你会有一个类似于分数一样的元素与别人竞争,并且还有明白的游戏规矩。大年夜数据中的游戏化就是应用这些概念来收集、分析数据或者激发玩家。
图数据库(Graph Databases):图数据应用节点和边如许的概念来代表人和营业以及他们之间的关系,以发掘社交媒体中的数据。是否曾经赞叹过亚马逊在你买一件产品的时刻告诉你的关于别人在买什么的信息?对,这就是图数据库。
Hadoop 用户体验(Hadoop User Experience /Hue):Hue 是一个可以或许让应用 Apache Hadoop 变得加倍轻易的开源接口。它是一款基于 web 的应用;它有一款分布式文件体系的文件浏览器;它有效于 MapReduce 的义务设计;它有可以或许调剂工作流的框架 Oozie;它有一个 shell、一个 Impala、一个 Hive UI 以及一组 Hadoop API。
高机能分析应用(HANA):这是 SAP 公司为大年夜数据传输和分析设计的一个软硬件内存平台。
HBase: 一个分布式的面向列的数据库。它应用 HDFS 作为其底层存储,既支撑应用 MapReduce 进行的批量计算,也支撑应用事物交互的批量计算。
负载均衡(Load balancing):为了实现最佳的结不雅和对体系的应用,将负载分发给多个计算机或者办事器。
神经收集(Neural Network):根据这个描述(http://neuralnetworksanddeeplearning.com/),神经收集是一个受生物学启发的异常漂亮的编程范式,它可以或许让计算机大年夜不雅察到的数据中进修。已经良久没有一小我会说一个编程范式很漂亮了。实际上,神经收集就是受实际生活中脑生物学启发的模型....... 与神经收集慎密接洽关系的一个术语就是深度进修。深度进修是神经收集一一系列进修技巧的集合。
元数据(Metadata):元数据就是可以或许描述其他数据的数据。元数据总结了数据的根本信息,这使得查找和应用特定的数据实例变得加倍轻易。例如,作者、数据的创建日期、修改日期以及大年夜小,这几项是根本的文档袈洫数据。除了文档文件之外,元数据还被用于图像、视频、电子表格和网页。
MongoDB:MongoDB 是一个面向文本数据模型的跨平台开源数据库,而不是传统的基于表格的关系数据库。这种数据库构造的重要设计目标是让构造化数据和非构造化数据在特定类型应用的┞符合更快、更轻易。
Mashup:荣幸的是,这个术语和我们在日常生活中应用的「mashup」一词有着邻近的含义,就是混搭的意思。本质上,mashup 是一个将不合的数据集归并到一个零丁应用中的办法(例如:将房地产数据与地舆地位数据、人口数据结合起来)。这确切可以或许让可视化变得很酷。
多维数据库(Multi-Dimensional Databases):这是一个为了数据在线分析处收成OLAP)和数据仓库优化而来的数据库。如不雅你不知道数据仓库是什么,我可以解释一下,数据仓库不是其余什么器械,它只是对多个数据源的数据做了集中存储。
多值数据库(MultiValue Databases):多值数据库是一种非关系型数据库,它可以或许直接懂得三维数据,这对直接操作 HTML 和 XML 字符串是很好的。
天然说话处收成Natural Language Processing):天然说话处理是被设计来让计算机加倍精确地舆解仁攀类日常说话的软件算法,可以或许让仁攀类加倍天然、加倍有效地和计算机交互。
模式辨认(Pattern Recognition):当算法须要在大年夜范围数据集或者在不合的数据集上肯定回归或者规律的时刻,就出现了模式辨认。它与机械进修和数据发掘慎密相连,甚至被认为是后两者的代名词。这种可见性可以赞助研究者发明一些深刻的规律或者获得一些可能被认为很荒诞的结论。
射频辨认(Radio Frequency Identification/RFID):射频辨认是一类应用非接触性无线射频电磁场来传输数据的传感器。跟着物联网的成长,RFID 标签可以或许被嵌入到任何可能的「器械琅绫擎」,这可以或许生成很多须要被分析的数据。迎接来到数据世界。
推荐阅读
国度成长改革委建议提案体系(摄/《中国信用》杂志记者 韩乾)小编提示习近平总书记强调,收集安然和信息化是“十三五”时代的重头戏,要在信息化成长上大年夜有作为。大年夜&ldq>>>详细阅读
本文标题:关于大数据,你应该知道的75个专业术语
地址:http://www.17bianji.com/lsqh/36560.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示