hdfs中的小知识(hadoop hdfs hive)

FileinputFormat切片机制

(1)简单地按照文件的内容长度进行切片

(2)切片大小 ,默认等于block大小

(3)切片时不考虑数据集整体 ,而是逐个针对每一个文件单独切片

自定义InputFormat流程

(1)自定义一个类继承FileInputFormat

(2)改写RecordReader ,实现一次读取一个完整文件封装为KV

如何决定一个job的map和reduce的数量?

1)map数量 splitSize=max{minSize,min{maxSize,blockSize}}

map数量由处理的数据分成的block数量决定default_num = total_size / split_size;

2)reduce数量 reduce的数量job.setNumReduceTasks(x);x 为reduce的数量。不设置的话默认为 1

*** inputformat 是在mapreduce中产生的

相关推荐
wxchyy21 小时前
手把手教你入门云计算(二):这些技术改变了世界,你也能轻松掌握
hadoop·阿里云·docker·云原生·华为云·云计算·运维开发
BD_Marathon1 天前
Hadoop组成
大数据·hadoop·分布式
邀星月为媒1 天前
正式迁移 Gitee:core-site-hive 与 core-hive-agent 后续更新只认这两个地址
hive·hadoop·gitee
BD_Marathon1 天前
Hadoop常用端口号
java·大数据·hadoop
fastjson_2 天前
Hive 复杂数据类型
数据仓库·hive·hadoop
爱吃面的猫2 天前
大数据Hadoop之——集群环境搭建(了解)
大数据·hadoop·flume
一路向北finish2 天前
《Hadoop 高可用集群与 OpenStack Mitaka 控制节点部署全流程实操排坑指南》
大数据·linux·运维·服务器·hadoop·openstack
insertYam2 天前
[hadoop高可用架构]
大数据·hadoop·架构
hopsky2 天前
《Hive性能调优实战》核心内容详细解读
数据仓库·hive·hadoop
-今昭-4 天前
Hadoop HDFS 高可用实战指南
运维·hadoop·hdfs·负载均衡