hdfs中的小知识(hadoop hdfs hive)

FileinputFormat切片机制

(1)简单地按照文件的内容长度进行切片

(2)切片大小 ,默认等于block大小

(3)切片时不考虑数据集整体 ,而是逐个针对每一个文件单独切片

自定义InputFormat流程

(1)自定义一个类继承FileInputFormat

(2)改写RecordReader ,实现一次读取一个完整文件封装为KV

如何决定一个job的map和reduce的数量?

1)map数量 splitSize=max{minSize,min{maxSize,blockSize}}

map数量由处理的数据分成的block数量决定default_num = total_size / split_size;

2)reduce数量 reduce的数量job.setNumReduceTasks(x);x 为reduce的数量。不设置的话默认为 1

*** inputformat 是在mapreduce中产生的

相关推荐
yumgpkpm6 小时前
Acceldata ODP(Open Data Platform)3.3.6.4(RHEL9)保姆级完整安装手册
大数据·人工智能·hive·hadoop·kafka·hbase·cloudera
sunxunyong7 小时前
hs2偶发连接失败问题处理
hadoop
泡干脆面就番茄9 小时前
HDFS读写流程与MapReduce原理深度解析(面试高频考点)
hdfs·面试·mapreduce
陈年老古董10 小时前
Hive 函数学习笔记(上):单行函数与炸裂函数
hive·笔记·学习
陈年老古董15 小时前
Hive 分区表学习笔记:语法、操作、二级分区与动态分区
hive·笔记·学习
计算机毕业编程指导师15 小时前
大数据毕设选题推荐:基于Hadoop+Spark全球碳排放减排策略分析与可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·spark·毕业设计·碳排放减排
53488736abcdefg1 天前
Hive 入门&架构原理
hive·hadoop·架构
泡干脆面就番茄1 天前
Hadoop基础入门到实战:从Python理解MapReduce到HDFS架构与集群搭建
hadoop
磁场转动100万匹2 天前
Hive 学习第一天:搞懂它是什么,并搭好可用的环境
hive·hadoop·学习
磁场转动100万匹2 天前
Hive 学习第三天:HQL 查询精讲与内置函数实战
hive·hadoop·学习