三面技术(运维)

1、说下hdfs读写流程

2、hdfs写的流程中block 大小为何是128m

A:block大小设置原则:最小化寻址开销,减少网络传输.

3、为什么HDFS中块(block)不能设置太大,也不能设置太小?

4、HDFS中块(block)的大小为什么设置为128M?

hdfs中存储以块的形式存储在DataNode,block块大小可以通过

HADOOP_HOME/etc/hadoop/hdfs-site.xml中dfs.blocksize实现(设置时先stop集群,修改完restart集群)。在Hadoop2.x之后的版本中,文件块的默认大小是128M,老版本中默认是64M;

5、你懂spark嘛?说下spark执行流程

6、doris和clickhouse比较

clickhouse做数据分析的数据库,拓展性不如doris。doris可以通过增加

OLAP数据库选型指南:Doris与ClickHouse的深入对比与分析-腾讯云开发者社区-腾讯云

7.数据迁移怎么做的?(数据迁移的步骤,纯听他人口述)

1、mysql中建有orcle对应的表,mysql有些数据类型不一样,比如:vachar,把orclr存

0、先备份orcle数据库

1、建好对应的表字段

2、

3、迁移过来,要确保数据一致性和完整性 查:count(*)orcle 一般多少多少条 (测试数据用的200多万条,每天大概增量数据 10个 200-300万条 和全量数据有一千万)

4、看是否会漏字段,看新建字段是否 一张表:自己看字段是否相同

5、在orcle和mysql

需求分析:

评估数据量

数据库orcle数据库备份

建好对应表

看orcle对应的数据类型和mysql有什么不一样,和orcle不一样的对应存储

写sqoop配置(写sqoop配置)--检测:全量的数据是否同步--先检查临时表

相关推荐
xingyue_S1 小时前
LVS负载均衡群集(二)-- DR模式
运维·负载均衡·lvs
roman_日积跬步-终至千里2 小时前
【Nginx】Nginx 多协议负载均衡实战:StarRocks 与 MinIO 代理配置全解析
运维·nginx·负载均衡
lwhdjbcjdjd2 小时前
Nginx实战指南:反向代理与负载均衡的原理与配置
运维·nginx·负载均衡
wa的一声哭了2 小时前
Linux服务器配置ssh免密登陆多台服务器、服务器别名配置
linux·运维·服务器·网络·arm开发·python·ssh
qinyia2 小时前
Wisdom SSH:AI助手可用的运维工具详解,帮助理解提升人机合作效率
运维·服务器·人工智能·ssh
YongCheng_Liang2 小时前
openEuler 22.03 LTS 部署 ELK(Elasticsearch+Logstash+Kibana)完整教程
linux·运维·elk·elasticsearch
小坏讲微服务3 小时前
Spring Cloud Alibaba 2025.0.0 整合 ELK 实现日志
运维·后端·elk·spring cloud·jenkins
清浅儿3 小时前
Linux权限知识点
linux·运维·服务器
kyle~3 小时前
Linux---文件控制<fcntl.h> (file control, fcntl)
linux·运维·服务器
头发还没掉光光3 小时前
Linux多线程之自旋锁与读写锁
linux·运维·算法