Hadoop环境安装和集群创建

本文提供基于VMware安装CentOS 7及配置Hadoop伪分布式/集群的简要步骤。

一、环境准备

下载VMware并安装,CentOS 7标准版ISO可从官网获取。

主机网络配置:编辑Windows hosts文件,映射主机名与IP(如192.168.1.76 master)。

关闭防火墙:systemctl stop firewalld并禁用自启,使用Xshell连接主机(支持rz/sz传文件)。

二、JDK安装

解压JDK至指定目录,配置/etc/profile环境变量(JAVA_HOME、CLASSPATH、PATH)。若32位版本报错,建议重装64位JDK或执行yum install glibc.i686。

三、Hadoop配置

环境变量:在/etc/profile中设置HADOOP_HOME并生效。

核心文件:

hadoop-env.sh:指定JAVA_HOME路径。

core-site.xml:设置fs.defaultFS为hdfs://master:9000,hadoop.tmp.dir为数据目录。

hdfs-site.xml:设置dfs.replication(伪分布式设为1)。

yarn-site.xml:配置ResourceManager地址及辅助服务。

mapred-site.xml:指定mapreduce.framework.name为yarn。

主机映射:修改/etc/hosts,配置master/slave IP。

SSH免密:生成密钥对,将公钥复制到各节点authorized_keys。

从节点:修改slaves文件(伪分布式写localhost,集群写slave主机名),并同步到从节点。

四、启动与验证

格式化HDFS:hadoop namenode -format。

启动服务:执行start-all.sh(或分别启动HDFS和YARN)。

验证:jps查看进程(Master应有NameNode、SecondaryNameNode、ResourceManager;Slave有DataNode、NodeManager)。

Web访问:http://master:50070(HDFS)和http://master:18088(YARN)确认正常。

相关推荐
像豆芽一样优秀4 小时前
用 Codex + 阿里云 DataWorks MCP 实现数仓自动化
大数据·人工智能
峥嵘life4 小时前
2026华为AI码道 CodeArts 使用分享:Windows端 + 服务器CLI 实战总结
android·大数据·开发语言·python
卷毛的技术笔记4 小时前
RocketMQ事务消息:我把分布式事务这层窗户纸捅破了
java·分布式·后端·java-rocketmq
dfbz1234565 小时前
山茶油礼盒包装工程手记:材质、结构与工艺的参数化拆
大数据·人工智能·经验分享
huashengzsj5 小时前
经销商管理系统适合哪些行业使用?2026年知名的DMS经销商管理系统推荐
大数据
why-geo5 小时前
AI时代,AI入口流量会全面颠覆搜索引擎流量吗?
大数据·人工智能
Gl�ria5 小时前
Hadoop 集群高可用节点分布
hadoop
艾莉丝努力练剑5 小时前
【Git:综合复盘】Git 原理与使用
大数据·人工智能·git·elasticsearch·面试
IT研究室5 小时前
最新大数据毕业设计选题推荐-基于大数据的全球地震活动时空分布分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
计算机源码社5 小时前
基于Hadoop+Spark的商家优惠券营销效果数据分析与可视化-基于Python的商家优惠券营销效果检测与评估分析系统
大数据·hadoop·python·数据挖掘·spark·毕业设计·数据可视化