该Job应用了27个Map Task,没有应用Reduce,那么将会产生27个结不雅文件。
再看结不雅表中的数据:
- hive> select * from lxw_all_ids2 limit 10;
- OK
- 766CA2770527B257D332AA_cookie 1
- 5A0492DB0000C557A81383_cookie 28
- 8C06A5770F176E58301EEF_cookie 55
- 6498F47B0BCAFE5842B83A_cookie 82
- 6DA33CB709A23758428A44_cookie 109
- B766347B0D27925842AC2D_cookie 136
- 5794357B050C99584251AC_cookie 163
- 81D67A7B011BEA5842776C_cookie 190
- 9D2F8EB40AEA525792347D_cookie 217
- BD21077B09F9E25844D2C1_cookie 244
- hive> select count(1),count(distinct seq) from lxw_all_ids2;
- 253402337 253402337
limit 10只大年夜第一个结不雅文件,即MapTaskId为0的结不雅文件中拿了10条,这个Map中,start=1,increment=27,是以生成的ID如上所示。
count(1),count(distinct seq)的值雷同,解释seq没有反复值,你可以尝尝max(seq),结不雅必定大年夜于253402337,解释seq是”非持续独一数值型ID“.
【编辑推荐】
- 在 Apache Hive 中轻松生计的12个技能
- Apache Spark 内存治理详解
- 是豪杰照样狗熊?大年夜数据那些事之SparkSQL
- Hive的萌芽留意事项以及优化总结
- Spark法度榜样运行常见缺点解决办法以及优化
推荐阅读
没有人知足Java开辟人员这种已经“竭尽全力”改变世界的速度,每小我都欲望代码像消防水管里的水一样可以或许源源赓续地流出来,但没有人愿意供给给开辟人员更好地完成工作的前>>>详细阅读
本文标题:Hive、MapReduce、Spark分布式生成唯一数值型ID
地址:http://www.17bianji.com/lsqh/34744.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示