可难解的是,在数据量过大年夜的情况下,不管是ETL照样MDM,都无法解决数据同一难题。加上大年夜数据集的宏大年夜范围以及对法度榜样员的苛将近求任何的可范围化数据同一项目都必须在很大年夜程度上实现主动化,不克不及依附手动编写的法度榜样。
数据同一在数据分析范呈攀里是个经久的挑衅,大年夜事数据分析的大年夜颐魅者欲望在数据分析之前,来自不合实体的数据可以或许在同一个处所出现出来。数据同一由七部分构成:1、获取数据 2、清洗数据 3、转换数据、4、模式集成 5、反复数据删除、6、分类 7、导出。

一般而言,企业实现数同一有两种办法,提取转换加载(ETL)和主数据治理(MDM)。
提取转换加载(ETL)具有灵活性的优势,合适不合的数据来源,使法度榜样员可以手工编写转换法度榜样,可以或许确保源数据模式与集中式数据仓库项目采取的全局模式匹配。但因为主动化程度低,提取转换加载带宽能跨越20个数据源没有若干家公司。
主数据治理(MDM),它与ETL类似的处地点于,预设一个“主记录”,每一个有专门的类别选项。如客户、部件和供给商等的所有文件相符主记录格局。但和ETL有所区其余是,MOM不是应用手动的定制脚本,而是依附一套“模糊归并”规矩,把所有不呵9依υ?件转换成主格局。
有名计算机科学家、Tamr结合开创人兼首席技巧官迈克尔·斯平日雷克(Michael Stonebraker)针对数据同一存在的限制难题,提出数据同一的七条原则。
一、所有的可范围化体系,都必须主动进行绝大年夜多半的操作。
二、模式为先(schema-first)的产品永远无律例模化。独一的选择是采取‘模式为后’(schema-last)的产品。
三、须要进行具体的域操作时,只有协作性的体系才可实现范围化。
四、为了实现可范围化,任何的同一计算必须在多个核心和多个处理器上运行。
五、尽管存在第四条原则,但真正的可扩大应用须要复杂性低于N ** 2的并行算法。
六、规矩体系实现是无律例模化的。只有机械进修体系才能将范围扩大到大年夜公司所须要的程度。
七、必须支撑及时增量同一。
【编辑推荐】
- 大年夜数据分析思路的4点心得
- 数据若何为新零售赋能?
- 大年夜数据情况下该若何优雅地设计数据分层
- 大年夜数据技巧在成长 挑衅与机会并存
- 物联网下:大年夜数据属于谁?
推荐阅读
向企业供给第三方收集基本举措措施和办事的收集即办事(NaaS)越来越受到迎接,这些第三方收集办事包含广域网连>>>详细阅读
本文标题:打破数据统一的七大原则
地址:http://www.17bianji.com/lsqh/36135.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示