1. 大数据平台服务启动顺序详解
在大数据平台运维工作中,服务启动顺序是确保系统稳定运行的关键。根据多年实战经验,我将分享CDH和HDP两大主流平台的标准化操作流程。
1.1 基础服务层启动逻辑
大数据平台的组件之间存在严格的依赖关系,必须按照从底层到应用的顺序启动:
-
ZooKeeper:作为分布式协调服务,必须先启动。它为HDFS、YARN等提供分布式锁、配置维护和命名服务。实际运维中,我们通常会先检查ZooKeeper集群的quorum状态:
bash复制echo stat | nc zk1.example.com 2181 | grep Mode -
HDFS:启动顺序为:
- JournalNode(如果启用HA)
- NameNode(包括standby节点)
- DataNode
重要提示:NameNode启动后必须等待至少3个DataNode报告后再继续后续操作,可通过
hdfs dfsadmin -report确认 -
YARN:启动顺序为:
- ResourceManager
- NodeManager
- JobHistory Server
1.2 数据处理层服务启动
-
HBase:依赖HDFS和ZooKeeper,启动顺序为:
- HMaster
- RegionServer
典型问题:RegionServer启动时报错"Can't get master address from ZooKeeper",通常是因为ZooKeeper连接超时,需要检查ZK连接字符串配置
-
Spark:在YARN模式下只需启动History Server,但需注意:
- 确保
spark.eventLog.dir指向的HDFS目录已创建 - 检查
spark.yarn.historyServer.address配置正确
- 确保
1.3 查询分析层服务
- Hive:启动顺序:
- Metastore服务(关键组件)
- HiveServer2
常见问题:Metastore连接数据库失败,需检查`javax.jdo.option.
