1. 环境准备与基础配置
1.1 虚拟机环境搭建
在开始PySpark环境配置前,我们需要先搭建稳定的Linux基础环境。我选择VMware Workstation 15.5作为虚拟化平台,这个版本在兼容性和性能上都有不错的表现。安装时建议勾选"增强型键盘驱动程序"选项,这能避免后续在Linux系统中出现键盘映射问题。
CentOS 7是最适合大数据环境的Linux发行版之一,其长期支持周期和稳定性都是重要考量因素。安装时需注意:
- 选择"带GUI的服务器"安装模式(后续某些工具需要图形界面)
- 分区方案建议:/boot分配1GB,swap分区为内存的1.5倍(不超过8GB),剩余空间全部给/
- 安装完成后立即执行
yum update -y更新所有系统组件
提示:虚拟机内存建议至少分配4GB,处理器核心数设置为2个以上,否则后续Spark运行会非常卡顿。
1.2 网络配置实战
静态IP配置是大数据环境的基础要求,以下是详细操作步骤:
- 编辑网络配置文件:
bash复制vim /etc/sysconfig/network-scripts/ifcfg-ens33
关键参数配置示例:
code复制BOOTPROTO=static
ONBOOT=yes
IPADDR=192.168.1.100
NETMASK=255.255.255.0
GATEWAY=192.168.1.1
DNS1=8.8.8.8
- 配置开机网络激活:
bash复制echo "NETWORKING=yes" >> /etc/sysconfig/network
- 重启网络服务:
bash复制systemctl restart network
验证配置是否生效:
bash复制ping www.baidu.com
ifconfig | grep inet
常见问题排查:
- 如果ping不通外网,检查虚拟网络编辑器的NAT设置
- 主机和虚拟机互相ping不通时,检查防火墙状态和网络模式
- IP冲突会导致连接异常,建议在路由器端保留IP地址
1.3 系统优化配置
- 主机名修改:
bash复制hostnamectl set-hostname hadoop-master
- 配置hosts映射(伪分布式也需要):
bash复制echo "192.168.1.100 hadoop-master" >> /etc/hosts
- 关闭防火墙和SELinux:
bash复制systemctl stop firewalld
systemctl disable firewalld
setenforce 0
sed -i 's/SELINUX=enforcing/SELINUX=disabled/g' /etc/selinux/config
- 创建专用用户(推荐):
bash复制useradd hadoop
passwd hadoop
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Java环境与SSH配置
2.1 JDK深度配置
Hadoop和Spark都依赖Java环境,以下是JDK 1.8的详细安装步骤:
-
上传jdk-8u121-linux-x64.tar.gz到/opt目录
-
解压并设置软链接:
bash复制tar -zxvf jdk-8u121-linux-x64.tar.gz
ln -s jdk1.8.0_121 jdk
- 环境变量配置(/etc/profile末尾添加):
bash复制e
