1. Linux运维工程师的日常工具箱
作为一枚在Linux运维领域摸爬滚打多年的老鸟,我的工作笔记里记录着各种实用命令和故障排查技巧。今天就把这些压箱底的干货整理出来,特别适合刚入行的运维新人快速上手。
1.1 系统监控三板斧
top命令是查看系统负载的首选工具,但很多人不知道按"1"可以展开所有CPU核心的详情。我习惯用这个组合命令:
bash复制watch -n 2 'top -bn1 | head -20'
这能每2秒刷新一次精简版top信息,在排查性能问题时特别有用。
内存监控方面,free -h虽然直观,但更推荐smem工具:
bash复制sudo apt install smem
smem -rs pss | head -10
它能按PSS(实际占用物理内存)排序显示进程,比RSS指标更准确反映内存占用。
1.2 磁盘空间管理技巧
发现磁盘空间不足时,我常用的排查组合是:
bash复制# 查找大文件
find / -type f -size +100M -exec ls -lh {} + 2>/dev/null | sort -k5 -rh
# 按目录统计大小
du -h --max-depth=1 / | sort -h
注意:生产环境慎用根目录扫描,可能触发inode风暴
对于日志轮转,除了标准的logrotate,我更喜欢用cron+find的方案:
bash复制0 0 * * * find /var/log/app -type f -mtime +7 -name "*.log" -exec gzip {} \;
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 网络问题排查实战手册
2.1 连接状态分析
当出现网络连接问题时,我通常会按这个顺序排查:
bash复制# 1. 检查基础连通性
ping -c4 example.com
mtr -n example.com
# 2. 检查端口可用性
nc -zv example.com 443
telnet example.com 80
# 3. 分析连接状态
ss -tulnp | grep nginx
netstat -ano | grep TIME_WAIT | wc -l
2.2 TCP调优参数
在高
