Hadoop3.3.4伪分布式环境搭建

文章目录


前言

hadoop学习------伪分布式环境------普通用户搭建


一、准备

1. 下载Hadoop

2. 配置环境变量

shell 复制代码
vi ~/.bash_profile

# 增加如下配置
export HADOOP_HOME=/home/install/hadoop-3.3.4
export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATH

# 使配置生效
source ~/.bash_profile

3. 配置免密

二、Hadoop配置

配置的目录是$HADOOP_HOME/etc/hadop

1. hadoop-env.sh

修改JAVA_HOME,设置为JDK所在的位置

shell 复制代码
# Linux命令行输出 JDK 位置
echo $JAVA_HOME

2. hdfs-site.xml

xml 复制代码
<!--指定数据冗余份数-->
<property>
    <name>dfs.replication</name>
    <value>1</value>
</property>
<property>
    <name>dfs.http.address</name>
    <value>hadoop01:50070</value>
</property>

3. core-site.xml

xml 复制代码
 <!--hadoop01是机器名  hostname-->
<property>
    <name>fs.defaultFS</name>
    <value>hdfs://hadoop01:9000</value>
</property>
<!-- hadoop临时目录 -->
<property>
    <name>hadoop.tmp.dir</name>
    <value>/home/install/data/hadoop/HADOOP_TMP_DIR</value>
    <description>Abase for other temporary directories.</description>
</property>
<!--所有用户可访问-->
<property>
    <name>hadoop.proxyuser.hduser.groups</name>
    <value>*</value>
</property>
<!--设置buffer size-->
<property>
    <name>io.file.buffer.size</name>
    <value>131072</value>
</property>
<!--任何IP可访问-->
<property>
    <name>hadoop.proxyuser.hduser.hosts</name>
    <value>*</value>
</property>

4. mapred-site.xml

xml 复制代码
<property>
    <name>mapreduce.framework.name</name>
    <value>yarn</value>
</property>
<property>
    <name>mapreduce.job.counters.max</name>
    <value>1200000</value>
</property>
<property>
    <name>mapreduce.map.memory.mb</name>
    <value>4096</value>
</property>
<property>
    <name>mapreduce.reduce.memory.mb</name>
    <value>8192</value>
</property>
<property>
    <name>mapreduce.map.java.opts</name>
    <value>-Xmx3072m</value>
</property>
<property>
    <name>mapreduce.reduce.java.opts</name>
    <value>-Xmx6144m</value>
</property>

5. yarn-site.xml

xml 复制代码
<property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
</property>
<property>
    <name>yarn.resourcemanager.hostname</name>
    <value>hadoop01</value>
</property>
<property>
    <name>yarn.nodemanager.vmem-pmem-ratio</name>
    <value>4</value>
</property>
<property>
    <name>yarn.nodemanager.vmem-check-enabled</name>
    <value>false</value>
</property>
<property>
    <name>yarn.nodemanager.resource.memory-mb</name>
    <value>20480</value>
</property>
<property>
    <name>yarn.scheduler.minimum-allocation-mb</name>
    <value>1024</value>
</property>
<property>
    <name>yarn.scheduler.maximum-allocation-mb</name>
    <value>20480</value>
</property>

三、格式化

shell 复制代码
hadoop namenode -format

四、启动

shell 复制代码
# 懒一点的方式
start-all.sh

相关推荐
计算机毕业编程指导师5 分钟前
大数据可视化毕设:Hadoop+Spark交通分析系统从零到上线 毕业设计 选题推荐 毕设选题 数据分析 机器学习 数据挖掘
大数据·hadoop·python·计算机·spark·毕业设计·城市交通
计算机毕业编程指导师13 分钟前
【计算机毕设选题】基于Spark的车辆排放分析:2026年热门大数据项目 毕业设计 选题推荐 毕设选题 数据分析 机器学习 数据挖掘
大数据·hadoop·python·计算机·spark·毕业设计·车辆排放
talle202116 分钟前
Hive | 行列转换
数据仓库·hive·hadoop
珠海西格21 分钟前
远动通信装置为何是电网安全运行的“神经中枢”?
大数据·服务器·网络·数据库·分布式·安全·区块链
CTO Plus技术服务中1 小时前
分布式存储HBase开发与运维教程
运维·分布式·hbase
飞乐鸟2 小时前
Github 16.8k Star!推荐一款开源的高性能分布式对象存储系统!
分布式·开源·github
talle20213 小时前
Hive | json数据处理
hive·hadoop·json
CTO Plus技术服务中3 小时前
Hive开发与运维教程
数据仓库·hive·hadoop
panzer_maus3 小时前
分布式锁的概念
分布式
Lansonli4 小时前
大数据Spark(七十九):Action行动算子countByKey和countByValue使用案例
大数据·分布式·spark