第二部分:数据生成==》采集==》分析==》迁移

一、启动hadoop、zookeeper、kafka

二、修改数据时间

三、将mysql中ad数据库中的各个表的数据写入到HDFS

四、将日志数据导入到HDFS中

1.第一台节点中

复制代码
cd /opt/module/flume/
bin/flume-ng agent --conf conf/ --name a1 -conf-file job/ad_log_to_kafka.conf -Dflume.root.logger=INFO,console

2.第二台节点中

复制代码
cd /opt/module/kafka/
bin/kafka-console-consumer.sh --bootstrap-server master:9092 --topic ad_log

3.第三台节点中

复制代码
cd /opt/module/flume/
bin/flume-ng agent --conf conf/ --name a1 -conf-file job/ad_Kafka_to_hdfs.conf -Dflume.root.logger=INFO,console

4.再开一台第一台节点

复制代码
cd /opt/module/bin/
./log.sh all 2026-06-22

查看HDFS中,数据是否上传

五、第一台节点中

http://第一台节点IP地址:12345/dolphinscheduler

账号 :admin

密码:dolphinscheduler123

操作后数据从hive中迁移到clickhouse。

1、第一台节点启动clickhouse

复制代码
 clickhouse-client  -m

show databases;
use ad_report;
show tables;
select * from dwd_ad_event_inc

可以看到清洗后的数据

相关推荐
starzy19902 小时前
Flink基础之Session-Cluster原理详解:共享集群的利与弊
大数据·flink
starzy19902 小时前
Flink基础之Per-Job-Cluster原理详解:被 Application 取代的模式
java·大数据·flink
大大大大晴天9 小时前
每天认识一个组件:数据治理Apache Atlas
大数据
数字新视界10 小时前
2026模块化机房选型指南:行业市场发展趋势、占有率与竞争梯队分析报告解析
大数据·人工智能·物联网·数据中心·微模块机房·模块化机房·冷通道
姜穆澜12 小时前
OneID 从 0 到 1 完整生产案例(四)
大数据
OsDepK12 小时前
项目快速Git至仓库(完整版)
大数据·git·elasticsearch·搜索引擎
合米AI SOP系统13 小时前
传统产线如何快速上马落地 AI 防错?合米科技 AI SOP 7天即可上线。
大数据·人工智能·科技
思录Echo13 小时前
什么决定具身智能的最终走向?多技术路线与落地现实辨析
大数据·人工智能
xiaohaiAIgeo13 小时前
【2026年】AI监控加行为分析守护实验室安全
大数据·人工智能·科普知识
林墨聊AIGC14 小时前
动漫AI视频创作工具在哪找到的?2026年最新动漫AI视频平台与软件指南
大数据·人工智能·ai作画·aigc·音视频