1. Hadoop完全分布式环境搭建概述
第一次接触Hadoop集群部署的新手常会陷入各种配置文件的迷宫。三年前我带队实施某物流企业大数据平台时,曾用整整两天时间排查因主机名解析导致的DataNode注册失败问题。本文将基于这些实战经验,带你避开那些官方文档不会告诉你的"坑",从零构建一个可立即投入生产的Hadoop 3.x完全分布式集群。
完全分布式模式意味着每个Hadoop组件都运行在独立的物理节点上,这与伪分布式模式(所有进程在同一台机器)有本质区别。你需要准备至少3台节点(1个NameNode + 2个DataNode),生产环境建议5节点起步。以下是我们的测试集群规划:
| 节点类型 | 主机名 | IP地址 | 主要进程 |
|---|---|---|---|
| Master | hadoop101 | 192.168.1.101 | NameNode, ResourceManager |
| Slave1 | hadoop102 | 192.168.1.102 | DataNode, NodeManager |
| Slave2 | hadoop103 | 192.168.1.103 | DataNode, NodeManager |
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 基础环境准备
2.1 系统配置标准化
所有节点需统一使用CentOS 7.6+最小化安装。实测发现CentOS 8的防火墙规则会导致YARN容器通信异常,这是RedHat官方已知问题。关键配置步骤如下:
bash复制# 关闭SELinux(需重启生效)
sed -i 's/SELINUX=enforcing/SELINUX=disabled/g' /etc/selinux/config
# 关闭防火墙
systemctl stop firewalld
systemctl disable firewalld
# 配置hosts映射(所有节点相同)
cat >> /etc/hosts <<EOF
192.168.1.101 hadoop101
192.168.1.102 hadoop102
