作家
登录

大数据环境下该如何优雅地设计数据分层

作者: 来源: 2017-07-07 08:50:20 阅读 我要评论

  • DWD:这一层重要解决一些数据质量问题和数据的完全度问题。比如用户的材料信息来自于很多不合表,并且经常出现延迟丢数据等问题,为了便利各个应用方更好的应用数据,我们可以在这一层做一个樊篱。
  • DIM:这一层比较纯真,举个例子就明白,比如国度代码和国度名、地舆地位、中文名、国旗图片等信息就存在DIM层中。
  • TMP:每一层的计算都邑有很多临时表,专设一个DWTMP层来存储我们数据仓库的临时表。
  • 总结

    明细层(ODS, Operational Data Store,DWD: data warehouse detail)

    • 概念:是数据仓库的细节数据层,是对STAGE层数据进行沉淀,削减了采取的复杂性,同时ODS/DWD的信息模型组织重要遵守企业营业事务处理的情势,将各个专业数据进行集中,明细层跟stage层的粒度一致,属于分析的公共资本。
    • 数据生成方法:部分数据直接来自kafka,部分数据为接口层数据与汗青数据合成。 canal日记合成数据的方法待研究。
    • 评论辩论筹划:canal数据的合成方法为:天天把明细层的前天全量数据和昨天新数据合成一个新的数据表,覆盖旧表。同时应用汗青镜像,按周/按月/按年 存储一个汗青镜像到新表。
    • 日记存储方法:直接数据应用impala外表,parquet文件格局,canal合成数据为二次生成数据,建议应用内表,下面几层都是大年夜impala生成的数据,建议都用内表+静态/动态分区。
    • 日记删除方法:长久存储。
    • 表schema:一般按天创建分区,没有时光概念的按具体营业选择分区字段。
    • 库与表定名。库名:ods,表名:初步推敲格局为ods_日期_营业表名,待定。
    • 旧数据更新方法:直接覆盖。

    数据分层是数据仓库异常重要的一个环节,它决定的不仅仅是一个层次的问题,还直接影响到后续的血缘分析、特点主动生成、元数据治理等一系列的扶植。是以适于尽早推敲。

    别的,每一层的名字不必太过在意,本身按照爱好就好。

    本文分享了笔者本身对数据仓库的一些懂得和设法主意,不必定十分精确,有什愦问题可以多交换。

    初步估计在数据仓库方面,应当还会有三个主题分享:血缘分析、特点主动生成、元数据治理。分享完成之后,数据仓库相干的就告一段落了。

    参考: 
    1.《数据仓库》 
    2.《数据仓库对象箱》 
    3. Winston、Ruby的指导

     【义务编辑:张子龙 TEL:(010)68476606】

    【编辑推荐】

    1. 震动外国人的十组苹不雅大年夜数据
    2. 大年夜数据:机械进修专家带你实践LSTM说话模型
    3. 挨踢部落第二期:大年夜数据在医疗范畴的应用和实践
    4. 挨踢部落直播教室第一期:起航2017——拥抱大年夜数据
    5. 挨踢部落坐诊第三期:Python在大年夜数据处理上的优势分析
    【义务编辑:张子龙 TEL:(010)68476606】

      推荐阅读

      用Python做股市数据分析(一)

    apple["20d"] = np.round(apple["Close"].rolling(window = 20, center = False).mean(), 2) pandas_candlestick_ohlc(apple.loc['2016-01-04':'2016-08-07',:], otherseries = "20d") 这>>>详细阅读


    本文标题:大数据环境下该如何优雅地设计数据分层

    地址:http://www.17bianji.com/lsqh/36071.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)