
Kafka的设计可以赞助用户解决很多架构汕9依υ?题,其具备的高机能、低耦合、高靠得住性、数据不损掉等特点,结合实际的应用体系应用处景,可以或许异常知足用户的需求。
8月28日,Kafka Summit大年夜会在旧金山召开,同一天Confluent宣布Kafka新的里程碑:KSQL——用于Apache Kafka的流数据SQL引擎。KSQL(点击查看demo)是分布式、可扩大、靠得住的和及时的,支撑多种流式操作,包含聚合(aggregate)、连接(join)、时光窗口(window)、会话(session)等等。它为Kafka的流处理供给了一个简单而完全的SQL界面,而不须要再用编程说话(如Java或Python)编写代码。
KSQL的两个核心概念是流(Stream)和表(Table),集成流和表,许可将代表当缁ご态的表与代表当前产闹事宜的流连接在一路。

在线数据集成:大年夜部分的数据处理都邑经历ETL过程,而如许的体系平日都是经由过程准时的批次功课来完成数据处理的,但批次功课所带来的延时在很多时刻是无法被接收的。经由过程应用KSQL和Kafka连接器,可以将批次数据集成改变成在线数据集成;
事实上,KSQL与关系型数据库中的SQL照样有很大年夜不合的。传统的SQL都是即时的一次性操作,不管是萌芽照样更新都是在当前的数据集长进行。KSQL的萌芽和更新是持续进行的,并且数据集可以源源赓续地增长。简言之,KSQL所做的其实是转换操作,也就是流式处理。
固然项目基于Apache 2.0协定开源,但今朝还处于开辟者预览阶段,不建议用于临盆集群中。在可预感的前提下,KSQL在及时`控、安然检测、在线数据集成、应用开辟等场景拥有极大年夜的潜力。
及时`控:经由过程KSQL自定义营业层面的度量指标,可以及时获得。底层的度量指标无法告诉用户应用法度榜样的实际施为,所以基于应用法度榜样生成的原始事沂攀来自定义度量指标可以更好地懂得应用法度榜样的运行状况。别的,可以经由过程KSQL为应用法度榜样定义某种标准,用于检查应用法度榜样在临盆情况中的行动是否达到预期;
安然检测:KSQL把事宜流转换成包含数值的时光序列数据,经由过程可视化对象把这些数据展示在UI上,可以检测到很多威逼安然的行动,比如讹诈、入侵等等;
应用开辟:对于复杂应用来说,应用Kafka的原生Streams API或许更合适。不过对于简荡竽暌功用,或者对于不爱好Java编程的仁攀来说,KSQL会是更好的选择。
Apache Kafka是一个分布式的、分区的、多复本的日记提交办事,应用Scala编写,以可程度扩大和高吞吐率而被广泛应用。Kafka最初是由LinkedIn开辟,痊愈2011岁首?年代开源,目标是为及时数据处理供给一个同一、高通量、低等待的平台。今朝,越来越多的开源分布式处理体系如Cloudera、Apache Storm、Spark都支撑与Kafka集成。
将来,项目筹划增长更多的特点,包含支撑更丰富的SQL语法,让KSQL成为临盆就绪的体系。信赖KSQL为处理Kafka数据而供给的简单完全的可交互式SQL接口,可以或许降低流式处理的门槛。
【编辑推荐】
- Spark Streaming vs. Kafka Stream 哪个更合适你
- Kafka和消息队列之间的超快速比较
- 浅谈分布式消息技巧Kafka
- SparkStreaming与Kafka整合碰到的问题及解决筹划
- Apache Kafka:大年夜数据的及时处理时代
推荐阅读
简介数据产品一向是 Airbnb 办事的重要构成部分,不过我们很早就意识到开辟一款数据产品的成本是很高的。例如,个性化搜刮排序可以让客户更轻易发明中意的房屋,智能订价可以让房主设定更>>>详细阅读
本文标题:KSQL,用于Apache Kafka的流数据SQL引擎
地址:http://www.17bianji.com/lsqh/37198.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示