Hadoop第2课(伪分布式集群的搭建)

jdk和hadoop安装包:

hadoop-2.9.2.t......等2个文件官方版下载丨最新版下载丨绿色版下载丨APP下载-123云盘

1、用XFTP发送hadoop安装包和jdk到/home/hadoop/目录下(hadoop用户的主目录)

2、解压jdk安装包到~目录

卸载jdk的命令:rpm -qa | grep -i java | xargs -n1 rpm -e --nodeps

cd /home/hadoop
tar -zxvf /home/hadoop/jdk-8u311-linux-x64.tar.gz

3、配置bashrc

vim ~/.bashrc

export JAVA_HOME=/home/hadoop/jdk1.8.0_311

export JRE_HOME=$JAVA_HOME/jre

export CLASSPATH=JAVA_HOME/lib:JAVA_HOME/jre/lib

export PATH=PATH:JAVA_HOME/bin:$JRE_HOME

保存后输入source ~/.bashrc

4、继续解压hadoop安装包到~目录

tar --zxvf hadoop-2.9.2.tar.gz

5、配置bashrc

vim .bashrc

export HADOOP_HOME=/home/hadoop/hadoop-2.9.2

export PATH=JAVA_HOME/bin:HADOOP_HOME/bin:HADOOP_HOME/sbin:PATH

source .bashrc

6、配置Hadoop配置文件,实现伪分布式;

Hadoop 配置文件很多,都位于 $HADOOP_HOME/etc/hadoop 下。

下面简单的描述一下几个重要的配置文件:

hadoop-env.sh:运行 Hadoop 要用的环境变量。

core-site.xml:核心配置项,包括 HDFS、MapReduce 和 YARN 常用的 I/O 设置等。

hdfs-site.xml:HDFS相关进程的配置项,包括 NameNode、SecondaryNameNode、DataNode等。

yarn-site.xml:YARN 相关进程的配置项,包括 ResourceManager、NodeManager 等。

mapred-site.xml:MapReduce 相关进程的配置项。

slaves:从节点配置文件,通常每行 1 个从节点主机名。

log4j.properties:系统日志、NameNode 审计日志、JVM 进程日志的配置项。

Hadoop伪分布式配置:

所有配置文件都在hadoop安装目录下的/etc/hadoop/里,所以先cd进去:

cd ~/hadoop-2.9.2/etc/hadoop

1.vim ./hadoop-env.sh

设置一项java安装目录即可:

export JAVA_HOME=/home/hadoop/jdk1.8.0_311

2.vim ./core-site.xml

复制代码
<configuration>
<property>
<name>fs.defaultFS</name>
    <value>hdfs://master:9000</value>
<!--配置hdfs NameNode的地址,9000是RPC通信的端口-->
</property>
<property>
    <name>hadoop.tmp.dir</name>
    <value>/home/hadoop/data/tmp</value>
<!--hadoop运行时产生的临时文件的存放目录-->
</property>
</configuration>

3.vim hdfs-site.xml

复制代码
<configuration>
<property>
<name>dfs.namenode.name.dir</name>
<value>/home/hadoop/data/dfs/name</value>
<!--配置namenode节点存储fsimage的目录位置-->
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/home/hadoop/data/dfs/data</value>
</property>
<property>
<name>dfs.replication</name>
<value>1</value>
<!--配置hdfs副本数量-->
</property>
<property>
<name>dfs.permissions</name>
<value>false</value>
<!--关闭hdfs的权限检查-->
</property>
<!--配置datanode 节点存储block的目录位置-->
</configuration>

4. vim mapred-site.xml

复制代码
<configuration>
<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
<!--指定运行mapreduce的环境为YARN-->
</property>
</configuration>

5.vim yarn-site.xml

复制代码
<configuration>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
<!--配置NodeManager执行MapReduce任务的方式为Shuffle混洗-->
</property>
</configuration>

6.vim slaves

该文件主要配置datanode角色的主机,目前我们属于伪分布式,因此只填写本机作为从节点即可

改为:master

7.创建三个用来存放文件

mkdir -p /home/hadoop/data/tmp

mkdir -p /home/hadoop/data/dfs/name

mkdir -p /home/hadoop/data/dfs/data

8. 启动Hadoop伪分布式集群并测试:

(1)格式化NameNode

hdfs namenode -format

(2)启动集群

start-all.sh

查看进程

jps

查看HDFS

浏览器输入网址:http://master:50070/

查看YARN

浏览器输入网址:http://master:8088/

测试集群:见课本

相关推荐
就玩一会_2 分钟前
Meta Muse 发布以来全梳理:从 Muse Spark 到个人 AI Agent
大数据·人工智能·spark
计算机毕业编程指导师11 分钟前
【计算机毕设】基于Hadoop的人口统计特征与肥胖风险关联分析的数据分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·数据分析·课程设计·肥胖风险
人工智能培训12 分钟前
智能博弈背景下中国AI国防建设的战略价值
大数据·人工智能·算法·重构·生活
小小龙学IT16 分钟前
etcd 深度解析:Go 分布式一致性 KV 存储与 Raft 共识实战
分布式·golang·etcd
计算机毕业编程指导师18 分钟前
【计算机毕业设计选题】基于Hadoop+Spark的乳腺癌数据分析与可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
hadoop·python·spark·毕业设计·课程设计·乳腺癌·计算机毕设
智圣新创0126 分钟前
智圣新创智慧学生社区平台:高校一站式学生社区育人效能转化的落地方法论
大数据·人工智能
大圣编蚕41 分钟前
OpenGL ES 教程:从零开始掌握 3D 渲染
大数据·elasticsearch·3d
袋鼠云数栈1 小时前
非结构化数据也能“周期调度“:离线开发BatchWorks的多模态数据同步实践
大数据·人工智能·多模态数据·离线开放
算了吧95691 小时前
GEO服务商选型指南:2026年企业评估框架与决策路径
大数据·人工智能·物联网
智塑未来1 小时前
App竞品数据平台选型指南:从入门到精通的全维度研判方法
大数据