flume写入mysql_mysql-flume-kafka-flume-hive

本文大致介绍通过flume与kafka的结合,将mysql数据抽取到hive中.

1.那么什么是flume呢?

Flume是Cloudera提供的一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统，Flume支持在日志系统中定制各类数据发送方，用于收集数据；同时，Flume提供对数据进行简单处理，并写到各种数据接受方(比如文本、HDFS、Hbase等)的能力

flume的数据流由事件(Event)贯穿始终.事件是Flume的基本数据单位，它携带日志数据(字节数组形式)并且携带有头信息，这些Event由Agent外部的Source生成，当Source捕获事件后会进行特定的格式化，然后Source会把事件推入(单个或多个)Channel中.你可以把Channel看作是一个缓冲区，它将保存事件直到Sink处理完该事件.Sink负责持久化日志或者把事件推向另一个Source

flume的一些核心概念

Client：Client生产数据，运行在一个独立的线程

Event：一个数据单元，消息头和消息体组成。(Events可以是日志记录、 avro 对象等。)

Flow： Event从源点到达目的点的迁移的抽象。

Agent：一个独立的Flume进程，包含组件Source、 Channel、 Sink。(Agent使用JVM 运行Flume。每台机器运行一个agent，但是可以在一个agent中包含

多个sources和sinks。)

Source：数据收集组件。(source从Client收集数据，传递给Channel)

Channel：中转Event的一个临时存储，

flume写入mysql_mysql-flume-kafka-flume-hive

悦读