有各类各样的对象和策略可以简化采取和分析集群数据的过程。
数据存储曾经是大年夜数据的最大年夜挑衅。因为云计算基本举措措施的进步,存储数据不再是关键问题。如今,数据科学家所面对的最大年夜问题是数据收集。
集群化使得大年夜数据分析更轻易。然而,集群也给数据工程师带来了必须解决的问题。

什么是数据集群?
数据集群的概念可追溯到至少20年前。美国俄亥俄州立大年夜学计算机科学和工程系传授Anil Kumar Jain博士在他的白皮书之一中对这一术语进行了很好的描述:
“集群是模式(不雅察,数据项或特点向量)到组(集群)的无监督分类。集群问题在很多范畴和很多学科的研究人员那边都获得懂得决;这反竽暌钩了其广泛的吸引力和实用性,作为摸索性数据分析的步调之一。然而,集群的组合是一个艰苦的问题,不合社区的假设和背景差别使得有效的通用概念和办法的传递变得迟缓。“
换句话说,数据工程师应用集群来辨认原始数据中的趋势和模式。他们须要将其分化成群集。
数据集群的重要挑衅是什么?
自负年夜大年夜数据的概念出生以来,集群一向是一个挑衅。这个问题源竽暌冠数据量和处理限制。拉巴特大年夜学列出了大年夜数据集群的重要存眷点。
(1) 数量
大年夜多半收集上存储的数据量呈指数级增长。跟着数据量的增长,提取数据变得加倍艰苦。备份数据也可能放大年夜这些问题。
(2) 速度
数据生成的速度是数据科学家面对的另一个集群挑衅。这个问题不仅限于收集上的数据量。当收集以前所未竽暌剐的速度生成新数据时,他们将很难及时地提取它。
造成的问题是双重的:
- 新的模式将赓续地大年夜已知的数据集出现。数据分析师可能认为他们很难大年夜数据中得出精确的结论,而事实上,他们的分析更能代表他们所建模的问题。他们可能不知道什么时刻分析他们现有的数据集,以及何时等待收集更多的数据。
- 如不雅数据的创建速度比提取的它速度快,那么当他们试图收集数据时,趋势可能会产生变更。
跟着收集应用物联网(IoT)大年夜更多的设备收集数据,他们可以或许以更快的速度收集数据,问题将会越来越严重。
集群数据存储在很多不合的表单中,这使得很难进行精确的比较。有些数据以构造化格局存储,而其他数据集可能是完全非构造化的。
若何解决这些问题?
(2) 无监督分类算法
(1) K均值集群
K均值集群办法是一种基于分组的解决筹划,须要收集将对象分派给一个集群。这清除了单个对象可能经由过程涌如今多个数据集中而偏离分析的担心。
无监督分类算法是基于预定义参数归并异常大年夜的数据集的数据发掘对象。这是处理日益增长的数据量的一个很好的解决筹划,特别是应用强大年夜的Hadoop对象。
(3) COALA
(4) 降低维度
COALA应用实例级束缚来避免类似分组引起的问题。不须要知足100%的束缚前提。
每个数据有两个维度:
- 变量
- 实例
跟着变量数量的增长,总数据量呈指数增长。可以经由过程应用降低维度策略(也就是所谓的降维变换)来缓解问题。
肯定命据集群挑衅的新解决筹划
数据集群是解决存储大年夜量构造豢?浊构造化数据所带来典范多问题的解决筹划。然而,这不是一个靠得住的解决筹划,因为数据仍然须要尽可能快速精确地被拜访和分析。荣幸的是,有一些很好的对象和办法可以简化流程。
【编辑推荐】
- 大年夜数据对六大年夜范畴的挑衅
- 知足进级需求 东方金信打造银行资产托管大年夜数据平台
- 人工智能、大年夜数据与深度进修之间的关系和差别
- 若何让隐蔽在大年夜数据背后的价值发挥出来?
- 大年夜数据技巧:内包照样外包
(3) 品种
推荐阅读
昨天,以“携手共赢,创新存储力量”为主题的紫光西部数据“2017产品巡展暨合作伙伴大会”在北京正式启动。首批巡展将覆盖全国10余个城市,包括北京、南京、杭州、上海、济南、成都、西安、广州>>>详细阅读
本文标题:克服大数据集群的挑战
地址:http://www.17bianji.com/lsqh/36517.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示