总结
明细层(ODS, Operational Data Store,DWD: data warehouse detail)
- 概念:是数据仓库的细节数据层,是对STAGE层数据进行沉淀,削减了采取的复杂性,同时ODS/DWD的信息模型组织重要遵守企业营业事务处理的情势,将各个专业数据进行集中,明细层跟stage层的粒度一致,属于分析的公共资本。
- 数据生成方法:部分数据直接来自kafka,部分数据为接口层数据与汗青数据合成。 canal日记合成数据的方法待研究。
- 评论辩论筹划:canal数据的合成方法为:天天把明细层的前天全量数据和昨天新数据合成一个新的数据表,覆盖旧表。同时应用汗青镜像,按周/按月/按年 存储一个汗青镜像到新表。
- 日记存储方法:直接数据应用impala外表,parquet文件格局,canal合成数据为二次生成数据,建议应用内表,下面几层都是大年夜impala生成的数据,建议都用内表+静态/动态分区。
- 日记删除方法:长久存储。
- 表schema:一般按天创建分区,没有时光概念的按具体营业选择分区字段。
- 库与表定名。库名:ods,表名:初步推敲格局为ods_日期_营业表名,待定。
- 旧数据更新方法:直接覆盖。
数据分层是数据仓库异常重要的一个环节,它决定的不仅仅是一个层次的问题,还直接影响到后续的血缘分析、特点主动生成、元数据治理等一系列的扶植。是以适于尽早推敲。
别的,每一层的名字不必太过在意,本身按照爱好就好。
本文分享了笔者本身对数据仓库的一些懂得和设法主意,不必定十分精确,有什愦问题可以多交换。
初步估计在数据仓库方面,应当还会有三个主题分享:血缘分析、特点主动生成、元数据治理。分享完成之后,数据仓库相干的就告一段落了。
参考:
1.《数据仓库》
2.《数据仓库对象箱》
3. Winston、Ruby的指导
【编辑推荐】
- 震动外国人的十组苹不雅大年夜数据
- 大年夜数据:机械进修专家带你实践LSTM说话模型
- 挨踢部落第二期:大年夜数据在医疗范畴的应用和实践
- 挨踢部落直播教室第一期:起航2017——拥抱大年夜数据
- 挨踢部落坐诊第三期:Python在大年夜数据处理上的优势分析
推荐阅读
apple["20d"] = np.round(apple["Close"].rolling(window = 20, center = False).mean(), 2) pandas_candlestick_ohlc(apple.loc['2016-01-04':'2016-08-07',:], otherseries = "20d") 这>>>详细阅读
本文标题:大数据环境下该如何优雅地设计数据分层
地址:http://www.17bianji.com/lsqh/36071.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示