Flume安装部署

下载地址

  1. http://www.apache.org/dyn/closer.lua/flume/1.9.0/apache-flume-1.9.0-bin.tar.gz

安装部署

  1. rz apache-flume-1.9.0-bin.tar.gz
  2. tar -xzvf /opt/software/apache-flume-1.9.0-bin.tar.gz -C /opt/module
  3. mv /opt/module/apache-flume-1.9.0-bin /opt/module/flume

删除lib目录下的guava-11.0.2.jar,以兼容Hadoop3.1.3

  1. rm /opt/module/flume/lib/guava-11.0.2.jar

Flume入门案例

监控端口数据

案例需求

实用一个Flume监听一个端口,收集该端口数据,并打印到控制台。

需求分析

image.png

实现步骤

  1. 安装netcat工具

    1. sudo yum install -y nc
  2. 判断44444端口是否被占用

    1. sudo netstat -nlp|grep 44444
    1. # 开服务端
    2. nc -lk 44444
    3. # 开客户端
    4. nc localhost 44444
  3. 创建Flume Agent配置文件flume-netcat-logger.conf

  4. 在flume目录下创建job文件夹并进入job文件夹

    1. cd /opt/module/flume
    2. mkdir job
    3. cd job
  5. 在job文件夹下创建flume agent配置文件flume-netcat-logger.conf

    1. vim flume-netcat-logget.conf
  6. 在flume-netcat-logger.conf文件中添加如下内容 ```java

    example.conf: A single-node Flume configuration

Name the components on this agent

a1.sources = r1 a1.sinks = k1 a1.channels = c1

Describe/configure the source

a1.sources.r1.type = netcat a1.sources.r1.bind = localhost a1.sources.r1.port = 44444

Describe the sink

a1.sinks.k1.type = logger

Use a channel which buffers events in memory

a1.channels.c1.type = memory a1.channels.c1.capacity = 1000 a1.channels.c1.transactionCapacity = 100

Bind the source and sink to the channel

a1.sources.r1.channels = c1 a1.sinks.k1.channel = c1

  1. 7. 运行
  2. ```java
  3. bin/flume-ng agent -n a1 -c conf/ -f job/net-flume-logger.conf -Dflume.root.logger=INFO,console

image.png

image.png

监控单个追加文件

案例需求

实时监控Hive日志,并上传到HDFS

需求分析

image.png

实现步骤

  1. Flume要想将数据输出到HDFS,依赖Hadoop相关的jar包

检查/etc/profile.d/my_env.sh文件,确定Hadoop和Java相关环境变量配置正确

  1. 创建flume-file-hdfs.conf文件

创建文件

  1. vim flume-file-hdfs.conf
  1. a1.sources = r1
  2. a1.sinks = k1
  3. a1.channels = c1
  4. a1.sources.r1.type = exec
  5. a1.sources.r1.command = tail -F /opt/module/hive/logs/hive.log
  6. a1.channels.type = memory
  7. a1.channels.cappacity = 1000
  8. a1.channels.c1.transactionCapacity = 100
  9. a1.sinks.k1.type = hdfs
  10. a1.sinks.k1.hdfs.path = hdfs://hadoop102:9820/flume/%Y%m%d/%H
  11. # 上传文件前缀
  12. a1.sinks.k1.hdfs.filePrefix = logs-
  13. # 是否按照时间滚动文件
  14. a1.sinks.k1.hdfs.round = true
  15. # 多少时间单位创建一个新的文件夹
  16. a1.sinks.k1.hdfs.roundValue = 1
  17. # 定义时间单位
  18. a1.sinks.k1.hdfs.roundUnit = hour
  19. # 是否使用本地时间戳
  20. a1.sinks.k1.hdfs.useLocalTimeStamp = true
  21. # 积攒多少event上传到hdfs一次
  22. a1.sinks.k1.hdfs.batchSize=100
  23. # 设置文件类型,可支持压缩
  24. a1.sinks.k1.hdfs.fileType = DataStream
  25. # 多久生成一个新的文件
  26. a1.sinks.k1.hdfs.rollInterval = 60
  27. # 设置每个文件的滚动大小
  28. a1.sinks.k1.hdfs.rollSize = 124217700
  29. # 文件的滚动与event的数量无关
  30. a1.sinks.k1.hdfs.rollCount = 0
  31. a1.sources.r1.channels = c1
  32. a1.sinks.k1.channel = c1
  1. 启动hadoop
    myhadoop.sh start
    

    监控目录下多个新文件

    监控目录下多个追加文件