数据仓库 - 转转 - 一面凉经

面试流程

自我介绍

Python 中,如何在数据清洗过程中应对内存不够的情况

如何避免,在使用Pandas处理大规模数据时,经常会遇到"SettingWithCopyWarning"警告

在Hive中,当您使用动态分区功能进行数据插入时,可能会遇到"too many dynamic partitions"错误,如何处理

在Apache Spark中,宽依赖(Wide Dependency)和窄依赖(Narrow Dependency)是两种不同类型的依赖关系,对性能分别有什么影响

在使用Kafka作为消息队列时,消费者出现重复消费的问题是比较常见的,分析原因,怎么处理

在使用Kafka拦截器(Interceptors)时,需要注意什么,以确保其正确性和效率

reduce 的阶段,长时间卡在99%,分析原因,如何排查

Spark 运行任务,出现小文件的问题,如何处理

数据治理过程中,需要下线重复指标,如何验证下游不会受到影响

Jenkins 如何避免多分支冲突

数仓设计中,如何设计 ODS 和 DWD 层的字段颗粒度

从 MySQL 导入数据至 Hive,使用 Scoop 如何解决数据不一致问题

DQC 告警如何判断

如何权衡小文件处理过程中的时间 、 空间 、 资源消耗

数据治理中,代码之外,哪些地方可以优化

看板口径整合,数据一致性如何保障

成果中的指标变化,数据计算方式和来源具体讲解

数据变化是如何评估的

思维题:设计一个高并发的日志采集和分析系统,要求使用 Flume、HDFS、Kafka,分析并详细讲解技术选型,在这个场景中,针对数据丢失的情况,如何做预防,设计一些方法思路

反问环节

相关推荐
真上帝的左手2 天前
27. 数据产品-数据中台架构规划
数据仓库·架构·数据分析·数据中台
省钱兄--zs2 天前
24小时自助健身房系统软件开发实战:从架构设计到部署全指南
java·数据仓库·spring boot·系统架构·需求分析
clorinda3 天前
Hive 窗口函数详解:让数据在分组中完成排名、累计和跨行计算
数据仓库·hive·hadoop
Sayai4 天前
ClickHouse WITH FILL 实战:监控大屏时间序列补零,附多粒度指标表与物化视图级联设计
大数据·运维·数据仓库·clickhouse·物化视图
躺柒5 天前
读数据架构知识体系指南16数据网格(上)
数据仓库·架构·数据分析·数据湖·数据架构·关系数据库
省钱兄--zs5 天前
北京24小时自助健身房系统软件开发实战:从架构设计到部署指南
java·数据仓库·spring boot·小程序·需求分析
躺柒7 天前
读数据架构知识体系指南14数据编织
大数据·数据仓库·数据分析·数据湖·数据编织
一隅论数智8 天前
给AI Agent一颗“私域大脑“:本体增强的工程化之路
大数据·运维·数据仓库·人工智能·笔记·学习·政务
CarIise12 天前
Spring Boot整合MyBatis与文件上传:从分层架构到文件上传下载实战
数据仓库·hive·hadoop
ha_lydms12 天前
MaxCompute中加密与解密函数
大数据·数据库·数据仓库·hadoop·dataworks·maxcompute·odps