第二部分:数据生成==》采集==》分析==》迁移

一、启动hadoop、zookeeper、kafka

二、修改数据时间

三、将mysql中ad数据库中的各个表的数据写入到HDFS

四、将日志数据导入到HDFS中

1.第一台节点中

复制代码
cd /opt/module/flume/
bin/flume-ng agent --conf conf/ --name a1 -conf-file job/ad_log_to_kafka.conf -Dflume.root.logger=INFO,console

2.第二台节点中

复制代码
cd /opt/module/kafka/
bin/kafka-console-consumer.sh --bootstrap-server master:9092 --topic ad_log

3.第三台节点中

复制代码
cd /opt/module/flume/
bin/flume-ng agent --conf conf/ --name a1 -conf-file job/ad_Kafka_to_hdfs.conf -Dflume.root.logger=INFO,console

4.再开一台第一台节点

复制代码
cd /opt/module/bin/
./log.sh all 2026-06-22

查看HDFS中,数据是否上传

五、第一台节点中

http://第一台节点IP地址:12345/dolphinscheduler

账号 :admin

密码:dolphinscheduler123

操作后数据从hive中迁移到clickhouse。

1、第一台节点启动clickhouse

复制代码
 clickhouse-client  -m

show databases;
use ad_report;
show tables;
select * from dwd_ad_event_inc

可以看到清洗后的数据

相关推荐
TK泰妞19 分钟前
从零搭建高效可复用的提示词工作流
大数据·人工智能
兴通物联科技29 分钟前
对俄出口诚实标识 2026 时间节点与产线赋码采集技术方案
大数据·服务器·单片机·嵌入式硬件·深度学习·计算机视觉
数据小玩子39 分钟前
数据合规共治:工业园区多部门协同亩均效益智能评价方案
大数据·数据分析·精益工程
陕西企来客1 小时前
NAP 信息统一治理:构建生成式 AI 时代企业 GEO 增长的坚实底座-企来客科技NAP方法论-企来客科技NAP信息治理实战解析
大数据·人工智能·科技
CubeSandbox1 小时前
沙箱是选项,不是标配:花椒 Agent 平台的架构思考与 Cube 实践
大数据·人工智能·架构
重生之我是小技1 小时前
Selenium自动化爬虫怎么实现?Python实战与反爬应对指南
大数据
55873 生态系统1 小时前
55873 全域文明生态系统:技术价值矩阵与底层创新内核
大数据·人工智能·55873全域文明生态体系·55873操作系统
2601_962355231 小时前
深度解析279模式:【279模式的最新发展趋势2025】行业白皮书
大数据·人工智能·pygame
龙亘川2 小时前
数智赋能民生保障:亘川智城智慧民政系统构建民政一体化业务闭环
大数据·人工智能·智慧城市·开源软件·数据可视化·政务
智商网输送线配件供应2 小时前
广东自动化流水线配件滚筒输送线选型实战:小批量混批采购模式如何重构供应链效率
大数据·重构·自动化