hadoop怎么安装:单机伪分布式完整实操教程
hadoop怎么安装的核心可行方案为Linux系统下单机伪分布式安装,适配绝大多数新手学习、本地测试场景,该方式无需多台服务器,仅需一台搭载CentOS7系统的主机,全程完成环境配置、组件安装、初始化验证,可正常运行Hadoop基础读写与计算任务,不适用于企业生产集群部署、大规模分布式数据处理场景。
hadoop安装前置环境配置
你需要先完成基础环境搭建,首先关闭CentOS7防火墙与SELinux,避免端口拦截导致服务异常,执行systemctlstopfirewalld、systemctldisablefirewalld关闭防火墙,修改/etc/selinux/config文件将SELINUX参数改为disabled,重启系统生效。随后安装JDK1.8版本,Hadoop3.x系列官方适配JDK1.8,高于或低于该版本均容易出现兼容报错,解压JDK压缩包后配置/etc/profile环境变量,刷新变量后通过java-version验证安装成功。
配置免密SSH登录是安装关键步骤,Hadoop启动进程需要本机免密授权,你需要执行ssh-keygen生成密钥,无需输入密码直接回车,再通过ssh-copy-idlocalhost将密钥同步到本机,完成后可通过sshlocalhost测试,无需密码即可登录本机终端即为配置成功。最后修改主机名与hosts映射,简化后续集群配置操作,编辑/etc/hosts文件,添加本机IP与自定义主机名的对应关系。
hadoop核心程序安装部署
你需选择稳定的Hadoop3.3.6版本,该版本为Apache软件基金会2022年发布的长期维护版本,漏洞修复完善、兼容性稳定,适合学习使用。将预下载的Hadoop压缩包解压至/usr/local目录,修改文件夹权限为当前用户所有,避免权限不足导致读写失败。随后编辑/etc/profile文件,新增HADOOP_HOME、PATH等核心环境变量,执行source/etc/profile刷新配置,输入hadoopversion可查看版本信息,证明程序部署完成。
Hadoop安装后必须修改核心配置文件,四个核心文件决定服务运行状态。core-site.xml文件需配置默认文件系统地址与临时文件存储目录,hdfs-site.xml设置副本数为1(伪分布式单副本即可),mapred-site.xml指定任务运行框架为YARN,yarn-site.xml配置资源调度服务参数。所有配置文件路径统一为Hadoop安装目录下的etc/hadoop文件夹,修改后无需即时重启,格式化系统后自动生效。
hadoop系统初始化与服务启动
格式化HDFS文件系统是安装的核心步骤,你需要执行hdfsnamenode-format命令,执行成功后终端会显示successfullyformatted标识,若出现报错多为临时目录残留文件未清理,删除残留文件后重新格式化即可。单次安装仅需格式化一次,重复格式化会清空系统数据、导致集群故障。
执行启动命令开启所有服务,先通过start-dfs.sh启动HDFS文件系统,再通过start-yarn.sh启动YARN调度框架。启动后输入jps命令查看进程,正常状态下会出现NameNode、DataNode、ResourceManager、NodeManager五个核心进程,进程齐全代表服务启动正常。
hadoop安装结果验证
可双重验证安装有效性。
- 终端验证:执行hadoopfs-mkdir/test创建测试目录,hadoopfs-put本地文件路径/test上传文件,无报错且可正常读取即为功能正常。
- 网页验证:浏览器访问本机50070端口可查看HDFS集群状态,8088端口可查看YARN任务调度页面。
该安装方式的适用边界明确,仅支持单机学习测试,无法支撑多节点数据备份、高并发数据处理,生产环境必须搭建多节点分布式集群,配置多副本存储与高可用机制。
安装全程最常见的错误为重复格式化NameNode,会造成集群节点ID冲突,直接导致HDFS服务无法启动,必须删除tmp目录与hdfs数据目录下的所有文件后重新格式化才能修复。
