2023_Spark_实验三十:测试Flume到Kafka

实验目的:测试Flume采集数据发送到Kafka

实验方法:通过centos7集群测试,将flume采集的数据放到kafka中

实验步骤:

一、 kafka可视化工具介绍

Kafka Tool是一个用于管理和使用Apache Kafka集群的GUI应用程序。 Kafka Tool提供了一个较为直观的UI可让用户快速查看Kafka集群中的对象以及存储在topic中的消息,提供了一些专门面向开发人员和管理员的功能,主要特性包括:

  • 快速查看所有Kafka集群信息,包括其brokers, topics and consumers

  • 查看分区中的消息内容并支持添加新消息

  • 查看消费者偏移量,支持查看Apache Storm Kafka Spout消费者偏移量

  • 以pretty-printed 格式显示JSON和XML消息

  • 添加和删除topic以及其他管理功能

  • 将单个消息从指定分区保存到本地硬盘驱动器

  • 支持用户编写自己的插件以查看自定义数据格式

  • 支持在Windows,Linux和Mac OS上运行

下载地址

这个软件的安装很简单,傻瓜式安装,直接下一步就可以,下载地址:Offset Explorer

下载并安装你对应的操作系统版本软件

二、启动zookeeper集群

bash 复制代码
zk.sh start  
# https://blog.csdn.net/pblh123/article/details/134730738  参考这个

三、启动kafka集群

bash 复制代码
kf.sh
# https://blog.csdn.net/pblh123/article/details/134730738  参考

通过kafkatools offset exploer 2.3 链接查看kafak

检查windows的hosts文件配置

四、启动flume

bash 复制代码
/opt/module/apache-flume-1.9.0-bin/bin/flume-ng agent -c conf -f /opt/module/apache-flume-1.9.0-bin/conf/kafka.conf -n a2 -Dflume.root.logger=INFO,console

五、启动消费者

bash 复制代码
# 创建kafka主题
/opt/module/kafka_2.12-3.0.0/bin/kafka-topics.sh --create --bootstrap-server hd1:9092 --replication-factor 3 --partitions 1 --topic RealDataTopic


# 启动消费者
/opt/module/kafka_2.12-3.0.0/bin/kafka-console-consumer.sh --bootstrap-server hd1:9092 --topic RealDataTopic --from-beginning

实验结果:flume采集数据到kafka链路跑通

相关推荐
better_liang25 分钟前
每日Java面试场景题知识点之-消息队列MQ核心场景与实战
java·面试·kafka·消息队列·rabbitmq·rocketmq·mq
rising start8 小时前
从客户端通信到分布式消息中间件
redis·分布式·kafka·rabbitmq·mq
一个儒雅随和的男子14 小时前
使用 Docker Compose 搭建 Kafka 集群
docker·kafka
得物技术14 小时前
HorizonVault 技术深潜:如何在 HDD 上做出 100GB/s+ 级大吞吐分布式存储|得物技术
大数据·后端·kafka
week@eight15 小时前
Linux - Kafka
linux·kafka
青云计划16 小时前
Kafka消息可靠性:从生产到消费的全链路不丢不重
kafka
Devin~Y16 小时前
大厂 Java 面试实录:Spring Boot微服务/Kafka/Redis/K8s可观测性 + RAG Agent(小Y社死版)
java·spring boot·redis·spring cloud·kafka·kubernetes·micrometer
yumgpkpm16 小时前
Hadoop(CDH6、CDP7)在Qwen3.7大模型训练中的作用,(含部署、运行操作步骤)
大数据·hive·hadoop·分布式·zookeeper·spark·kafka
ZPC82101 天前
DGX Spark 200G 跟 100G 设备的通讯协议
大数据·分布式·spark
南屹川2 天前
【大数据】大数据处理技术栈:从采集到分析的完整链路
大数据·人工智能·hadoop·flink·spark·数据处理