做运维这几年,我越来越觉得,crontab 定时任务就像一栋大楼里的消防通道——平时根本想不起它,可一旦真出了事,你发现它早就堵死了,那种绝望感足够让人在凌晨三点对着服务器骂娘。
很多团队对定时任务的态度是“配完就算完事”,日志不查、执行状态不看,直到业务方跑来问“为什么昨天的报表没生成”“为什么凌晨的清算没跑”,才手忙脚乱地登录服务器手动补跑。更坑的是,有些任务失败是静默的:进程起了,数据错了,退出码还是 0。这种故障你连报警都收不到。
所以就有了今天这篇东西:用 Shell 写一个轻量级的 crontab 监控脚本,不依赖额外的监控系统,不需要部署 agent,只要目标机器上有 Shell 环境和基础命令,就能搭一套“任务执行状态哨兵”。这篇文章会完整拆解我的设计思路、核心代码、实测案例,以及我在这个过程中踩过的坑。标题里的“第61章”是我自己的系列笔记编号,内容上完全独立,你可以直接照着用。
1. 先想明白:crontab 任务到底为什么会“不执行”
写监控脚本之前,先得搞清楚我们要防的是什么。很多新手第一反应是“crontab 不执行 = cron 服务挂了”,但实际上我在生产环境里遇到的失败原因,远比这个复杂。
1.1 定时任务失效的第一现场:三种典型现象
我在实践中把定时任务“失效”归纳成三种现象,监控脚本的设计就是围绕这三种现象展开的:
- 任务完全没跑:cron 服务没起来、
crontab -e里语法写错、用户被锁定、服务器宕机后 cron 没自动恢复,都会导致这种结果。最隐蔽的情况是服务器时间被 NTP 强制校准,任务原定凌晨 2 点跑,结果时间跳变导致 cron 直接跳过。 - 任务跑了但中途失败:脚本依赖的数据库连不上、磁盘空间打满导致日志写不进去、上游数据文件还没生成,这些都会让脚本在执行中段异常退出。如果脚本没有写错误处理,crontab 的日志里通常只有一句
exit status 1。 - 任务“成功”了但结果是错的:这点最恶心。比如脚本里有个变量没初始化,Python 代码里
None被当成 0 参与运算,或者 Shell 脚本里$?取错了上一条命令的退出码。最终任务退出码是 0,但产生的数据是脏的。
1.2 那些“看起来正常”却实际失效的隐蔽场景
除了上面三种常规失败,还有几个我实际踩过、常规监控方案根本发现不了的场景,专门列出来提醒你:
- 同一分钟任务堆积:有个任务处理数据平均要 3 分钟,但 cron 设定的是每分钟执行一次。上一个进程还没跑完,下一个又起来了,两个进程同时操作同一个目录,产生数据竞争。表面看任务每次都执行了,实际上业务数据已经乱了。
- Cron 环境变量与交互 Shell 不一致:cron 默认只加载极少的 PATH 环境变量(通常是
/usr/bin:/bin),你手动source /etc/profile后能跑通的脚本,放到 crontab 里可能直接command not found。这种失败不会产生任何业务日志,只有去翻/var/log/cron才能看到只言片语。 - 执行用户不一致:root 的 crontab 和普通用户的 crontab 完全是两套。我在排查问题时经常发现,某台机器上的任务是配在 root 下的,但某天 someone 用普通用户登录后,顺手执行
crontab -e把任务加了进去,两者互不干扰,排查半天没头绪。
1.3 监控脚本的三大目标与一条红线
基于上面这些失败场景,我的监控脚本需要满足三个目标:
- 判活:能准确判断任务是否在预期时间窗口内执行过,而不是只盯着“当前有没有相关进程在跑”。
- 定位:任务失败时能给出初步的定位信息(日志路径、退出码、最近错误),帮人快速判断是环境问题、代码问题还是资源问题。
- 闭环:能自动重试一定次数,并在重试仍失败时通过多种渠道通知到人。
但我给自己定了一条红线:监控脚本绝不直接修改 crontab 配置、绝不擅自重启 cron 服务。原因很现实——自动恢复机制如果逻辑不严谨,容易引发“抖动叠加”:比如监控脚本误判任务失败后执行了恢复操作,结果把正在正常执行的任务杀掉,造成二次故障。监控的职责是发现问题、暴露问题、辅助定位,最终决策必须由人来下,这是自动化脚本的边界感。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 监控脚本的整体设计:日志兜底、判活中心与时间戳比对
明确了要防什么,接下来就是怎么搭这套哨兵系统。我没有用复杂的分布式监控框架,而是老老实实基于 Linux 自带的组件设计了一个轻量方案。
2.1 为什么选择“日志兜底 + 时间戳比对”而不是守护进程
市面上有很多进程守护工具,比如 systemd 的 timer、supervisor,甚至有人会在任务脚本里写死循环保证进程常驻。但我的场景是监控 crontab 这种周期型任务,它本身就不要求常驻。如果用守护进程去“拉活”,反而会改变任务原本的运行模型。
我的核心思路是“日志兜底 + 时间戳比对”:
- 每个被监控的任务,在执行时强制追加一个“结束标记”到统一的监控日志文件里。这个标记里包含任务名、PID、退出码、耗时。
- 监控脚本定期扫描这些日志文件,检查每个任务最近一次标记是否落在“预期执行时间窗口”内。
- 如果某个任务预期应该执行,但超过时间窗口还没有新标记,就认为任务异常。
这个方案的优点是:不侵入业务逻辑,业务脚本只需要在结尾多一行写入监控日志即可;不依赖常驻进程,监控脚本本身也放进 crontab,每 5 分钟跑一次,完全符合周期型任务的管理习惯。
2.2 监控脚本的目录布局与配置文件设计
先看一下我的监控脚本整体装在哪个位置,以及它的目录结构:
bash复制/opt/cron_monitor/
├── etc/
│ └── tasks.conf # 被监控任务的配置文件
├── log/
│ ├── monitor.log # 监控脚本自身的运行日志
│ └── heartbeat/ # 任务执行后写入的心跳标记文件
│ └── data_backup.mark
├── run/
│ └── monitor.sh # 主监控脚本
└── lib/
└── functions.sh # 公共函数库
为什么单独把配置文件和脚本拆开放?因为我希望以后新增被监控任务时,只改配置文件,不动脚本本体。这样即使脚本有更新逻辑,也不会影响已有任务的监控配置。
配置文件 tasks.conf 我用的是“空格分隔 + # 注释”的简单格式:
bash复制# 任务名 预期执行模式(每几分/几时) 心跳标记文件路径 日志文件路径 错误关键字
data_backup */30 |/opt/cron_monitor/log/heartbeat/data_backup.mark |/var/log/backup.log |ERROR,失败
report_gen 0 2 * * * |/opt/cron_monitor/log/heartbeat/report_gen.mark |/var/log/report_gen.log |Exception,error
这里面最关键的是第二列“预期执行模式”,我支持两种写法:
*/30表示每 30 分钟执行一次(步长格式)0 2 * * *表示标准 cron 表达式(分 时 日 月 周)
为什么必须要有这个预期模式?因为监控脚本除了判断“最近有没有心跳”,还要判断“这个心跳是不是在预期时间点附近产生的”。如果没有这个约束,一个每小时跑一次的任务,你没法判断“它 15 分钟前跑过一次”到底正不正常。
2.3 核心流程:监控脚本的完整生命周期
监控脚本本身每次运行的生命周期如下,我画了一个逻辑链路方便你理解(不涉及图表,直接用文字描述步骤):
- 解析配置:逐行读取
tasks.conf,把任务名、执行模式、心跳路径、日志路径、错误关键字解析成关联数组。 - 计算预期时间窗口:根据当前时间和配置的执行模式,计算出“这个任务最近一次应该在什么时候执行”。假设当前是
10:07,任务模式是*/30,那么最近一次预期执行时间应该是10:00,窗口可以放宽到10:05(多留 5 分钟漂移容忍)。 - 扫描心跳文件:读取每个任务对应的心跳标记文件,提取最后一行里的执行时间戳。
- 比对判定:如果心跳文件的最新时间戳 < 预期执行时间戳,说明任务没在预期窗口内执行,判定为失败。
- 补充检查:如果心跳存在但判定失败,或者心跳压根不存在,再尝试读取业务日志文件,保留最近的
ERROR/WARN关键字信息,便于定位。 - 触发告警:对判定失败的任务进行去重(防止每 5 分钟重复报警),执行告警函数(邮件、钉钉/企业微信机器人 Webhook)。
- 重试机制:对配置了“允许重试”的任务,自动执行一次指定的拉起命令,并写入重试记录。
- 记录自身日志:所有检测动作、判定结果、告警内容都追加到
monitor.log,方便回溯。
3. 核心代码实现:从检查函数到故障恢复
理论说太多容易飘,直接上代码。这部分是全文最核心的实战内容,每一段我都会讲清楚为什么这么写。
3.1 配置文件解析与任务配置规范
我选择用 Shell 数组来承载配置。虽然 Shell 的数组处理不如 Python 灵活,但它不依赖解释器,任何 Linux 发行版自带 Bash 就能跑。解析函数如下:
bash复制#!/usr/bin/env bash
# lib/functions.sh
CONFIG_FILE="/opt/cron_monitor/etc/tasks.conf"
# 定义全局任务索引数组
declare -A TASK_NAMES
declare -A TASK_SCHEDULES
declare -A TASK_HEARTBEATS
declare -A TASK_LOGS
declare -A TASK_KEYWORDS
declare -A TASK_RETRY_CMDS
# 解析配置文件
parse_config() {
local line task_name schedule heartbeat log_path keywords retry_cmd
local index=0
while IFS='|' read -r task_name schedule heartbeat log_path keywords retry_cmd; do
# 跳过空行和注释行
[[ -z "$task_name" ]] && continue
[[ "$task_name" =~ ^#.* ]] && continue
TASK_NAMES[$index]="$task_name"
TASK_SCHEDULES[$index]="$schedule"
TASK_HEARTBEATS[$index]="$heartbeat"
TASK_LOGS[$index]="$log_path"
TASK_KEYWORDS[$index]="$keywords"
TASK_RETRY_CMDS[$index]="$retry_cmd"
index=$((index + 1))
done < "$CONFIG_FILE"
}
这里我把分隔符定成 | 而不是空格,是因为任务名和日志路径里都可能包含空格,用 | 分隔可以避免字段错位。关于配置规范,我强烈建议每个任务独立一行,不要在配置里写临时性的调试内容,否则你排查问题时会从配置层面开始混乱。
3.2 单任务检查函数:比对时间戳、判断进程、解析错误日志
每个任务单独走一个检查函数,这样后续无论排查还是扩展都方便。核心代码如下:
bash复制# 检测单个任务是否在预期时间窗口内执行
check_task() {
local idx=$1
local name="${TASK_NAMES[$idx]}"
local schedule="${TASK_SCHEDULES[$idx]}"
local heartbeat_path="${TASK_HEARTBEATS[$idx]}"
local log_path="${TASK_LOGS[$idx]}"
local keywords="${TASK_KEYWORDS[$idx]}"
# 1. 计算预期执行时间戳(最近一个周期)
local expected_ts
expected_ts=$(calculate_expected_timestamp "$schedule")
if [[ -z "$expected_ts" ]]; then
log_msg "WARN" "任务 $name 的排期无法解析,跳过检查"
return 2
fi
# 2. 读取心跳文件的最新时间戳
local last_heartbeat_ts=0
if [[ -f "$heartbeat_path" ]]; then
# 心跳文件格式:timestamp task_name pid exit_code
last_heartbeat_ts=$(tail -1 "$heartbeat_path" | awk '{print $1}')
fi
# 3. 比对时间戳
local permitted_window_start=$(( expected_ts - 300 )) # 允许提前 5 分钟
local permitted_window_end=$(( expected_ts + 600 )) # 允许延后 10 分钟
if (( last_heartbeat_ts >= permitted_window_start && last_heartbeat_ts <= permitted_window_end )); then
log_msg "INFO" "任务 $name 最近一次心跳时间正常 (last=$last_heartbeat_ts)"
return 0
fi
# 4. 如果心跳时间不对,再尝试检查是否有相关进程还在运行(可能是长任务)
if process_is_running "$name"; then
log_msg "WARN" "任务 $name 心跳不在窗口内,但有相关进程正在运行,暂不判死"
return 3
fi
# 5. 心跳缺失且无进程,判定失败,收集错误关键字
log_msg "ERROR" "任务 $name 超过预期窗口未产生心跳,判定失败"
if [[ -n "$log_path" && -f "$log_path" ]]; then
if [[ -n "$keywords" ]]; then
local err_lines
err_lines=$(grep -E "$keywords" "$log_path" | tail -5)
[[ -n "$err_lines" ]] && log_msg "ERROR" "任务 $name 最近错误日志片段:
${err_lines}"
else
local last_lines
last_lines=$(tail -5 "$log_path")
log_msg "ERROR" "任务 $name 最后 5 行日志:
${last_lines}"
fi
fi
return 1
}
为什么容许时间窗口是“提前 5 分钟 + 延后 10 分钟”?因为 crontab 本身不保证秒级准时,尤其是系统负载高的时候,任务可能延迟几分钟才启动。如果窗口设置太窄,容易产生误报;太宽则失去了监控的意义。5 分钟提前、10 分钟延后是我在几十台服务器上实践后觉得比较均衡的数值,你可以根据自己的任务频率调整。
这里有个关键点:process_is_running 函数。有些任务执行时间本身就超过周期(比如上一节提到的“同一分钟任务堆积”),如果它正常在跑,你把它判死并触发告警反而误导运维。我通过检查进程命令行里是否包含任务名来初步判断:
bash复制# 判断任务是否有相关进程在运行(防止长任务误报)
process_is_running() {
local name=$1
local grep_result
grep_result=$(pgrep -f "$name" 2>/dev/null)
[[ -n "$grep_result" ]]
}
但要注意:pgrep -f 会匹配命令行中的任意字符段,如果任务名太短(比如 abc),容易误匹配到无关进程。我的解决方案是约定任务名必须包含完整的脚本路径片段,如 data_backup 对应 /opt/scripts/data_backup.sh,在配置里写入时就要带上路径。
3.3 告警机制与一键补偿:让故障真正闭环
告警是整个监控脚本最有价值的一环,不能只是简单 echo 一句。我在项目里接入了两种通道:钉钉/企业微信机器人 Webhook 和邮件,优先级上走“先增量后全量”的节奏,防止告警风暴。
bash复制# 发送告警消息(支持钉钉/企业微信机器人)
send_alert() {
local title=$1
local content=$2
# 告警去重文件目录
local dedup_dir="/tmp/cron_monitor_dedup"
mkdir -p "$dedup_dir"
# 用任务名+当前小时数作为去重维度,每小时内不重复告警
local dedup_key
dedup_key=$(echo -n "${title}" | md5sum | cut -c1-8)
local dedup_file="${dedup_dir}/${dedup_key}"
if [[ -f "$dedup_file" ]]; then
local last_send_ts
last_send_ts=$(cat "$dedup_file")
if (( $(date +%s) - last_send_ts < 3600 )); then
log_msg "INFO" "告警 [$title] 已在同一小时内发送过,跳过"
return 0
fi
fi
# 发送到钉钉机器人
if [[ -n "$DINGDING_WEBHOOK" ]]; then
local json_payload
json_payload=$(cat <<EOF
{"msgtype":"text","text":{"content":"[CronMonitor] ${title}
${content}"}}
EOF
)
curl -s -H "Content-Type: application/json" \
-d "$json_payload" "$DINGDING_WEBHOOK" \
>/dev/null 2>&1
fi
# 发送到企业微信机器人
if [[ -n "$WECOM_WEBHOOK" ]]; then
local wecom_payload
wecom_payload=$(cat <<EOF
{"msgtype":"text","text":{"content":"[CronMonitor] ${title}
${content}"}}
EOF
)
curl -s -H "Content-Type: application/json" \
-d "$wecom_payload" "$WECOM_WEBHOOK" \
>/dev/null 2>&1
fi
# 发送邮件
if [[ -n "$MAIL_TO" ]]; then
echo -e "Subject: [CronMonitor] ${title}\n\n${content}" | \
sendmail -f "cron_monitor@$(hostname)" "$MAIL_TO"
fi
# 记录去重时间戳
echo "$(date +%s)" > "$dedup_file"
log_msg "INFO" "已发送告警 [$title]"
}
关于告警去重,一开始我也没做,结果有一次某个任务连续失败,监控脚本每 5 分钟跑一次,结果一上午收到了几十条同质化告警,群里疯狂刷屏。后来我加了基于“任务名 + 小时”的去重,同一个任务在同一小时内只发一次告警。如果你希望更精细,可以把时间窗口缩短到 10 分钟,但我觉得 1 小时的冷却时间对绝大多数场景都够用。
对于允许重试的任务,retry_single_task 函数会在判定失败后尝试执行预定的拉起命令:
bash复制# 重试指定任务
retry_single_task() {
local idx=$1
local name="${TASK_NAMES[$idx]}"
local retry_cmd="${TASK_RETRY_CMDS[$idx]}"
if [[ -z "$retry_cmd" ]]; then
log_msg "INFO" "任务 $name 未配置重试命令,跳过自动恢复"
return 0
fi
local max_retries=3
local run_dir="/opt/cron_monitor/run"
local pid_file="${run_dir}/retry_${name//\//_}.pid"
# 防止并发触发重复重试
if [[ -f "$pid_file" ]] && kill -0 "$(cat "$pid_file")" 2>/dev/null; then
log_msg "WARN" "任务 $name 已有重试进程在运行,跳过本次重试"
return 0
fi
# 后台执行重试命令,避免阻塞监控主流程
nohup bash -c "
exec 1>>/opt/cron_monitor/log/retry.log 2>&1
for i in 1 2 3; do
echo \"[$(date '+%F %T')] 任务 $name 第 \${i} 次重试开始\"
eval '$retry_cmd' && { echo \"[$(date '+%F %T')] 任务 $name 第 \${i} 次重试成功\"; exit 0; }
sleep 5
done
echo \"[$(date '+%F %T')] 任务 $name 重试 3 次仍然失败\"
exit 1
" &
echo "$!" > "$pid_file"
}
重试函数里我用了 nohup ... & 的方式,把重试动作放到后台执行,避免监控脚本本身粘在一个任务的重试上太久。这里有个实践细节:重试操作一定要做并发控制,否则如果任务卡住了,监控每 5 分钟触发一次重试,会在短时间内拉起多个重复进程,反而加重故障。我用 pid_file 做互斥,如果上一次重试进程还在,就直接跳过。
4. 已上线环境实测:三起由监控脚本“捞出来”的典型故障
脚本写完后,我并没有急着全量接入,而是先在 3 台非核心服务器上试运行了 2 周。这期间监控脚本帮我发现了三起真实故障,下面逐个复盘。
4.1 案例一:磁盘空间打满导致任务静默跳过
那是一个跑报表的任务,平时每 30 分钟执行一次。监控脚本上线后第二天,我就收到了告警:report_gen 超过预期窗口未产生心跳。
最初我猜是脚本被误删了或者 crontab 配置变了,登录检查后发现 crontab 正常,手动执行脚本竟然报 No space left on device。再一查根分区,发现 /var/log 下有个日志文件已经涨到了 90 多 G,把整块盘打满了。
为什么任务会“静默跳过”?因为脚本里重定向 >> /var/log/report_gen.log 时,由于磁盘满无法写入,Shell 直接报了错;脚本里没有 set -o pipefail,后续命令继续执行但已经写不了日志,退出码恰好又是 0。如果我没上监控,这个故障可能要等到业务方第二天看报表时才会发现。
这个案例的价值在于,crontab 任务里“退出码为 0”不等于“任务成功”。监控脚本必须要有心跳标记做二次确认,不能只靠退出码判断。
4.2 案例二:执行用户缺少系统权限,日志毫无异常
另一个任务是在凌晨 3 点同步数据库备份到对象存储,监控脚本某天早上 7 点报了这个任务失败。我登录去查备份日志,发现日志里最后一条是 start sync at 03:00:12,后续完全没有报错或异常信息,看起来就像是任务“凭空消失”了。
后来通过 journalctl -u crond 和 /var/log/cron 一查,发现了真正的原因:这个任务在 crontab 里的执行用户被改成了 nobody(可能是之前某次维护误操作),而 nobody 用户没有权限读取备份目录下的密钥文件,导致任务启动后立刻因权限错误退出。
日志里为什么没有异常输出?因为脚本里访问密钥文件的那行命令被 2>/dev/null 吞掉了。这是我在实际运维中见过最多的一类错误:为了“保持日志干净”,把错误输出丢到 /dev/null,结果把唯一的排查线索也丢了。监控脚本的价值不在于能自动修复这种问题,而在于把“任务确实没跑成功”这个事实及时捅出来,逼着你去查。
4.3 案例三:任务跑完但没写心跳,“误报”背后的配置教训
监控上线第一周,我还遇到过一次“误报”:有个任务的心跳标记文件最近更新时间是 3 天前,但任务其实每天早上都在正常跑。我开始以为监控脚本计算时间戳的函数写得不对,后来发现是心跳写入代码根本没有被加载。
看这个任务的原始 crontab:
bash复制30 1 * * * /opt/scripts/purge_old_data.sh
我打开 purge_old_data.sh,发现脚本里面有判断逻辑:
bash复制if [[ -n "$SKIP_PURGE" ]]; then
echo "skip purge" >> /var/log/purge_old_data.log
exit 0
fi
由于 SKIP_PURGE 在环境里被设置了,脚本走的是“跳过”分支,根本没有走到脚本末尾的心跳写入语句。所以任务实际上执行了(产生了 skip 日志),但没有产生心跳标记,导致监控脚本误判。
这个案例告诉我:写监控脚本之前,必须梳理清楚被监控任务的“所有可能退出路径”。心跳标记应该放在任务真正完成的“唯一收口处”,或者至少放在脚本退出前必经的 trap EXIT 钩子里。从那以后,我给业务脚本统一加了一个收口函数,确保任何分支退出都会写心跳:
bash复制# 在业务脚本顶部定义
trap 'heartbeat_write $0 $? >> /opt/cron_monitor/log/heartbeat/data_backup.mark' EXIT
5. 反模式与避坑心得:监控脚本本身才是最需要自省的
这一章是我在踩了无数坑之后总结出的核心经验。监控脚本维护不好,不仅监控失效,还会成为新的故障源。
5.1 错误定位思路:为什么脚本报错要让任务继续“等待”
很多人在写业务脚本时,习惯在关键步骤之后添加 set -e,一旦出错立刻退出。但在监控场景下,我恰恰不建议这样。理由跟监控的核心目标有关:监控要能定位“卡在哪一步”。
如果脚本响应式地立即退出,那么日志里很可能只有一句笼统的报错,没有上下文。我比较喜欢的方式是分步记录:
bash复制log_msg "INFO" "步骤1: 开始拉取上游数据"
wget -q "$SOURCE_URL" -O /tmp/data.csv || { log_msg "ERROR" "步骤1: wget 拉取失败,退出码 $?"; exit 1; }
log_msg "INFO" "步骤1: 拉取完成"
log_msg "INFO" "步骤2: 开始写入临时表"
mysql -e "LOAD DATA..." || { log_msg "ERROR" "步骤2: MySQL 写入失败,退出码 $?"; exit 2; }
log_msg "INFO" "步骤2: 写入完成"
这样监控脚本在做日志排查时,能直接告诉你“任务挂在步骤2”,而不是含糊地告诉你“脚本不知道怎么回事就挂了”。如果某些步骤确实允许失败,可以考虑把 set -e 关掉,但必须明确记录这一步的失败状态。
5.2 监控脚本自身的可靠性保障
再引一个常被忽略的细节:监控脚本本身不要依赖 crontab 里的环境变量。举个例子,如果你在 ~/.bashrc 里设置了 PATH=/usr/local/bin:$PATH,crontab 里执行脚本时不会加载 .bashrc,可能导致脚本里依赖的命令(如 pgrep、curl)找不到。我的脚本头部固定写成:
bash复制#!/usr/bin/env bash
export PATH="/usr/local/bin:/usr/bin:/bin:/usr/sbin:/sbin"
export LANG=en_US.UTF-8
这是为了让脚本用到的命令只走系统默认路径,避免环境变量干扰。还有一点,监控脚本本身要写日志,如果日志目录不存在,开头就要创建:
bash复制mkdir -p /opt/cron_monitor/log/heartbeat /opt/cron_monitor/run /tmp/cron_monitor_dedup
最后是权限问题:监控脚本如果需要读取 /var/log/cron 或者检查其他用户的进程,建议以 root 运行;如果只是读取普通日志,可以降权到普通用户运行。但判断进程时要注意,pgrep -f 只能看到自己的权限范围内的进程,如果监控脚本是普通用户,它看不到 root 用户的进程,会造成误报。
5.3 进阶方向:一台机器监控多机、与自动化运维平台对接
写到这里,有朋友可能觉得这套脚本功能太单薄。实际上这套脚本的架构是支持扩展的,我在后续版本里做了两个方向的升级:
- 多机监控:在所有被监控机器上部署相同的脚本,然后在一台中央机器上写一个聚合脚本,通过 SSH 远程执行
/opt/cron_monitor/run/monitor.sh --check,把返回结果拉回中央机器统一展示。 - 与自动化运维平台对接:当监控脚本判定任务失败后,除了发告警,还可以通过 Webhook 调用平台的 API,自动创建一个“任务异常工单”,将任务名、失败原因、日志片段自动填充到工单描述里。运维人员在平台上点击“确认”,可以直接触发平台侧的任务补偿流程。
这些扩展都依赖一个基础前提:监控脚本的判定逻辑必须准确。如果监控本身误报率高,自动化对接就是在给运维制造噪音。所以我给这个脚本定了一个“稳定压倒一切”的原则——判定失败的标准宁严不松,告警去重宁可多拦不可遗漏。
写在最后:监控是手段,不是目的
我见过不少人把监控脚本写得极其华丽:彩色输出、全屏 dashboard、告警风暴……但等到真正出了故障才发现,连最基础的任务心跳都没记录全。我的理解是,监控脚本的第一要务不是“好看”,而是“可靠”。Shell 写的这套东西谈不上高大上,但它在一个又一个凌晨安静地守住了那些必须跑完的任务。
我个人在反复迭代中得到的最大经验是:监控脚本的配置和业务脚本要同步变更。每新增一个 crontab 任务,就顺手在配置文件里加一行监控规则,这个动作一定要养成肌肉记忆。否则等你想起来“这个任务好像该被监控”的时候,可能它已经悄悄失败好几天了。最后再分享一个不算技巧的小习惯:我会在每个季度的第一天手动检查一次监控脚本自身的运行日志,看看有没有“跳过检查”“解析失败”这类噪音记录——监控自己的监控,听起来有点套娃,但这一步真的能帮你提前发现很多隐患。
