1. 项目概述
在运维监控领域,Prometheus+Grafana的组合已经成为事实上的标准方案。这套开源监控系统能够完美解决传统监控工具在云原生环境下的各种痛点。我在过去三年里为17家企业部署过这套系统,今天就把最实用的部署经验整理成这份保姆级教程。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备
2.1 硬件配置建议
- 测试环境:2核CPU/4GB内存/100GB存储
- 生产环境:4核CPU/8GB内存/200GB存储(每百万指标约消耗1GB内存)
注意:Prometheus对磁盘IO要求较高,建议使用SSD存储
2.2 软件依赖
bash复制# 基础依赖检查
sudo apt update
sudo apt install -y wget tar gzip
3. Prometheus安装配置
3.1 二进制安装
bash复制wget https://github.com/prometheus/prometheus/releases/download/v2.47.0/prometheus-2.47.0.linux-amd64.tar.gz
tar xvfz prometheus-*.tar.gz
cd prometheus-*
3.2 配置文件详解
yaml复制# prometheus.yml示例
global:
scrape_interval: 15s
evaluation_interval: 15s
scrape_configs:
- job_name: 'prometheus'
static_configs:
- targets: ['localhost:9090']
4. Grafana安装部署
4.1 安装步骤
bash复制wget https://dl.grafana.com/oss/release/grafana-10.2.0.linux-amd64.tar.gz
tar -zxvf grafana-10.2.0.linux-amd64.tar.gz
cd grafana-10.2.0
./bin/grafana-server web
4.2 初始配置
- 访问http://服务器IP:3000
- 默认账号admin/admin
- 首次登录强制修改密码
5. 数据源与仪表盘配置
5.1 添加Prometheus数据源
- 左侧菜单选择"Configuration" > "Data Sources"
- 选择Prometheus类型
- URL填写http://localhost:9090
5.2 导入官方仪表盘
- 搜索ID为1860的Node Exporter仪表盘
- 点击"Load"按钮导入
6. 系统优化技巧
6.1 Prometheus性能调优
yaml复制# 优化后的启动参数
--storage.tsdb.retention.time=30d
--storage.tsdb.retention.size=100GB
--query.max-concurrency=20
6.2 Grafana安全加固
- 开启HTTPS
- 配置LDAP/AD集成
- 设置数据源权限
7. 常见问题排查
| 问题现象 | 可能原因 | 解决方案 |
|---|---|---|
| Grafana无法连接数据源 | 防火墙阻止 | 检查9090/3000端口 |
| 指标显示不全 | 抓取间隔过长 | 调整scrape_interval |
| 面板显示"No Data" | 时间范围错误 | 检查右上角时间选择器 |
8. 生产环境部署建议
- 使用systemd管理服务
- 配置日志轮转
- 设置监控告警规则
- 定期备份配置文件
这套系统在我负责的电商平台监控中,成功将故障发现时间从平均45分钟缩短到3分钟以内。关键是要根据业务特点调整监控指标,不要盲目追求大而全的监控覆盖。
