磁盘满了一个小时之后的报警电话,和一块坏道扩散的机械盘引发的数据丢失事故,是我真正开始认真对待Linux磁盘管理的两个契机。早期我也觉得,磁盘管理不就是df -h看一眼、fdisk分个区、mount挂一下吗?直到线上系统因为inode耗尽写不进一个日志文件、因为忘记配置日志轮转导致根分区被撑爆、因为扩容时搞错了文件系统类型导致数据无法访问,我才意识到这套看似基础的操作背后藏着大量值得深挖的细节。
这篇内容写给所有Linux运维、后端开发、以及自己在家里或云服务器上折腾各种服务的同学。无论你是刚接触Linux的新手,还是有几年经验但没系统梳理过磁盘这块的从业者,都可以对照这篇内容把你的磁盘管理能力整理一遍——从最基础的查看命令,到分区格式化挂载,再到生产环境必用的LVM逻辑卷管理、磁盘满了的排查方法论、日常监控和故障速查,一次讲透。
1. 先搞懂Linux怎么看待磁盘
1.1 一切皆文件:设备文件与磁盘命名
Linux设计哲学里最核心的一句话叫"一切皆文件"。磁盘在Linux里同样被抽象成文件,放在/dev目录下。你执行ls -l /dev/sda,看到的其实是一个设备文件。
常见的命名规则你需要记在心里:
sd开头:走SCSI协议的硬盘,包括绝大多数SATA盘、USB盘、虚拟化环境里的虚拟磁盘,比如/dev/sda、/dev/sdb。vd开头:半虚拟化环境下的磁盘,比如某些虚拟化平台里看到的/dev/vda。nvme0n1开头:NVMe固态硬盘,比如/dev/nvme0n1,它下面的分区是/dev/nvme0n1p1这种带p的命名。
接口类型、驱动模块、总线类型都会影响设备名,所以不要死记硬背"第一块盘一定是sda"这种结论。我见过一台机器因为BIOS识别顺序变化,原本的/dev/sdb变成/dev/sda,导致/etc/fstab里按设备名挂载的分区挂不上,系统直接进了维护模式。这也是为什么后面我要强调:生产环境挂载磁盘务必使用UUID。
再看分区命名。MBR时代用/dev/sda1表示第一块盘的第一个分区,这很容易理解。但GPT分区表配合某些老工具时要注意,不同工具的分区编号规则不完全一样,parted和fdisk在个别场景下给出的分区名甚至会不同。遇到这种不一致,不要慌,先看lsblk确认。
1.2 磁盘管理的五个层级
我把磁盘管理拆解成五个层级,这样遇到任何问题都能定位到具体是哪一层出了问题:
- 物理磁盘:就是你买回来或者云平台上分配的那块盘,比如
/dev/sdb。 - 分区:把一块物理盘切成多个逻辑区域,比如
/dev/sdb1、/dev/sdb2。分区表类型决定了这块盘的寻址方式和容量上限。 - 文件系统:在分区之上建立的存储格式,比如ext4、xfs、btrfs,它决定了数据怎么组织、怎么读写。
- 挂载点:把文件系统接入到Linux目录树上的入口,比如
/data、/home。没有挂载,分区对系统来说就是一块看不见的"裸盘"。 - 逻辑卷(LVM层):在物理磁盘和文件系统之间加了一个虚拟化层,可以动态调整大小,这个后面单独讲。
可以做一个生活化类比:物理磁盘是一栋大楼,分区是隔出来的房间,文件系统是房间里的收纳规则,挂载点是房间的门牌号。LVM则是给这些房间装了可以推拉移动的隔断墙——今天这个房间小了,就把隔壁墙挪一挪,不需要拆楼重建。
很多新手容易混淆分区和文件系统的关系,以为"格式化就是分区"。其实分区是划分边界,格式化才是建立文件系统,两件事,两个命令,各自独立。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 摸清家底:最常用的磁盘查看命令
2.1 快速体检:df 和 du
df看的是整个文件系统的空间使用情况,du看的是目录或文件占用的空间,这两兄弟是磁盘排查的第一板斧,但很多人没用透。
先说df。日常最常用的是df -h,-h表示人类可读,自动转换成G、M单位。还有一个参数容易被忽略:df -i,查看inode使用情况。
inode是一个很容易被忽视的概念。Linux文件系统里,每个文件或目录都有一个inode号,里面记录着文件的元数据(权限、属主、大小、数据块指针等)。当你创建大量小文件时,即使磁盘空间还有几十G,inode用完了,系统会直接报"no space left on device",但实际上df -h看到空间是够的。这就是典型的"空间没满,inode先满了"的场景。
举个真实案例:某台日志采集服务器,因为采集程序异常,每分钟生成上万个几十字节的小文件,半天时间把inode耗尽了,应用写入全部失败。排查时用df -h看到空间还有60%,但df -i显示/var分区inode使用率100%。这就是为什么我强烈建议你把这句命令加进日常巡检脚本:
bash复制df -h && echo "--- inode check ---" && df -i
再说du。du -sh /data查看/data总大小,du -sh /data/* | sort -rh按大小倒序排出目录下所有子目录的占用,这是定位"哪个目录吃了空间"的最快路径。du -sh会递归统计所有子目录,大目录上会有点慢,可以用--max-depth控制深度,比如du -h --max-depth=2 /data | sort -rh。
df和du统计结果对不上的时候,大概率有两个原因:一是du还在递归扫描过程中,数据没统计完;二是有已删除但仍被进程占用的文件,这个锅不在du,反而df显示的是文件系统实际已分配的空间,更接近真实状态。后面第5章会专门讲这个坑。
2.2 物理盘与分区识别:lsblk、blkid、fdisk -l
df只能看到已经挂载的文件系统,新插上一块盘或者还没分区的盘,df是看不见的。这时候要用lsblk——列出所有块设备。
lsblk的输出非常直观,以树状结构展示磁盘和分区的关系。我最常用的组合是lsblk -f,-f会额外显示文件系统类型和UUID。
bash复制$ lsblk -f
NAME FSTYPE LABEL UUID MOUNTPOINT
sda
├─sda1 xfs a1b2c3d4-... /boot
└─sda2 LVM2_member e5f6a7b8-...
└─centos-root xfs c9d0e1f2-... /
看到这棵树,整个存储结构一眼就明白了:sda2是LVM物理卷,它之上建了逻辑卷centos-root挂载到根目录。UUID是文件系统的全局唯一标识符,比设备名稳定得多。
blkid直接查看设备属性和UUID,常用于写/etc/fstab之前拿UUID:
bash复制blkid /dev/sdb1
fdisk -l是另一个经典命令,列出所有磁盘的分区表信息。注意fdisk -l不带参数时列出所有盘,指定设备时只查那一块,比如fdisk -l /dev/sdb。
/proc/partitions也是一个值得瞄一眼的文件,内核视角的分区信息,某些底层排查场景(比如系统完全不识别某块盘)能用上。
bash复制cat /proc/partitions
搞清楚了DF看不清的新盘、lsblk的设备树、blkid的UUID,你在任何一台陌生Linux服务器上都能在30秒内摸清磁盘家底。这也是后续一切操作的地基。
3. 从新盘到可用:分区、格式化、挂载全流程
3.1 分区表选型:MBR还是GPT
拿到一块新盘,第一个选择是分区表格式:MBR还是GPT。这直接影响磁盘的容量上限和分区数量,选错了后面几乎没法无损改。
MBR(主引导记录)是传统格式,主分区最多4个,单盘容量上限2TB(严格说是2TiB左右)。GPT(GUID分区表)是现代格式,支持几乎无限的分区数量(实际受操作系统限制,通常128个),单盘容量轻松超过2TB,还带冗余分区表备份,更抗损坏。
我的选择标准非常直接:
- 磁盘小于2TB、主要用于兼容老系统时,MBR够用。
- 磁盘大于等于2TB,或者明确需要超过4个主分区,一律GPT。
现在新装系统、新数据盘,默认建议GPT,没必要跟MBR较劲。fdisk工具对GPT支持得也不错,但习惯上GT大容量盘用parted更稳妥。
有一个容易翻车的地方:UEFI启动的机器上系统盘必须是GPT,Legacy BIOS启动的机器用MBR更顺。如果你拿一块MBR磁盘装到UEFI启动的机器上做系统盘,大概率直接无法引导。
3.2 分区实战:用fdisk切一个数据盘
以一块500G的新数据盘/dev/sdb为例,跑一遍完整流程。
第一步,确认设备名。
bash复制lsblk
看到/dev/sdb存在且没有分区,再往下操作。注意操作前一定确认设备名,千万不要把/dev/sda(可能是系统盘)当成数据盘格式化了。我见过有人在生产服务器上把/dev/sda和/dev/sdb搞反,一条mkfs命令让整个系统报废。
第二步,分区。
bash复制fdisk /dev/sdb
进入交互模式后,依次按键:
n:新建分区p:主分区(primary)- 分区编号:默认1
- 起始扇区:默认回车(从第一个可用扇区开始)
- 结束扇区:默认回车(使用整块盘)
w:写入分区表并退出
如果整块盘只做一个分区,全程默认回车,然后按w即可。操作完成后执行partprobe /dev/sdb或重启系统,让内核重新读取分区表。对已挂载的盘操作分区表时要极其小心,先卸载再分。
第三步,格式化。
bash复制mkfs.xfs /dev/sdb1
文件系统选型上,RHEL/CentOS系默认xfs,Ubuntu/Debian系默认ext4。xfs擅长处理大文件和高并发写入,ext4更通用、社区资料更丰富、支持在线缩容(虽然我不推荐日常做缩容操作)。数据库、大数据存储这类大文件场景,xfs是稳妥选择;普通应用、虚拟化镜像、大量小文件场景,ext4照样很稳。
mkfs的速度取决于磁盘类型和容量,机械盘格式化500G大概需要几十秒到几分钟,SSD会快很多。格式化命令前务必再确认一遍设备名,这一步没有后悔药。
第四步,创建挂载点并挂载。
bash复制mkdir -p /data
mount /dev/sdb1 /data
df -h
df -h里能看到/dev/sdb1挂在/data下,就说明挂载成功了。
但这只是临时挂载,重启后系统不会自动挂载。持久化需要写入/etc/fstab。
3.3 永久挂载:fstab与UUID机制
/etc/fstab是Linux的自动挂载配置文件,系统启动时会逐行读取并按规则挂载。
先查看UUID:
bash复制blkid /dev/sdb1
输出形如:
code复制/dev/sdb1: UUID="8a2c9352-...-..." TYPE="xfs"
然后在/etc/fstab末尾添加一行:
code复制UUID=8a2c9352-...-... /data xfs defaults 0 0
各字段含义是:设备标识、挂载点、文件系统类型、挂载选项、是否dump备份(0不备份)、是否fsck检查(0不检查)。
写完以后务必执行验证:
bash复制mount -a
这条命令会按fstab重新挂载所有条目,如果配置有误,会当场暴露。全程不要重启,先mount -a验一遍再说。还有一个更稳妥的办法是用findmnt --verify检查fstab条目的正确性。
为什么强调用UUID而不是/dev/sdb1?因为设备名会漂移。内核枚举设备的顺序受总线发现顺序影响,拔插硬盘、增删设备后,/dev/sdb可能会变成/dev/sdc,而UUID绑定的是文件系统本身,永不改变。用UUID挂载,即使设备名变了,系统依然能正确找到那块盘。
注意:
fstab写错是Linux运维里最经典的翻车事故之一。挂载点不存在、UUID写错、文件系统类型写错,都会导致开机进入emergency模式。每次改完fstab,一定要mount -a实测,确认无误后再重启。
4. 生产环境必备:LVM逻辑卷管理
4.1 为什么需要LVM
传统分区方式有一个硬伤:分区大小在创建时就固定了。某次你把一个分区设成50G,后来数据涨到60G,唯一办法就是新增一块盘重新分区、迁移数据、修改挂载配置,动静巨大,线上系统根本不能接受。
LVM(Logical Volume Manager,逻辑卷管理)就是为了解决这个问题而生的。它把物理磁盘的块空间汇聚成一个资源池,再从这个池子里灵活切出任意大小的逻辑卷挂载给系统使用。空间不够了,就往池子里加物理磁盘,然后在线扩大逻辑卷——不需要迁移数据,不需要卸载文件系统。
类比一下:传统分区是砌好了固定的房间,改格局要拆墙;LVM是给每个房间都装了液压推拉墙,空间不够,遥控器按一下就能把墙往外挪。
4.2 核心概念:PV、VG、LV
LVM涉及三个核心概念,很多人学LVM卡在这里。
- PV(Physical Volume,物理卷):物理磁盘或分区被LVM初始化后的形态,相当于原材料。
- VG(Volume Group,卷组):多个PV汇聚成的资源池,相当于仓库。
- LV(Logical Volume,逻辑卷):从VG里切出来的逻辑分区,相当于仓库里划分的货架区,可以直接格式化挂载。
层级关系是:PV → VG → LV,一层包一层,往上再到文件系统。
还有一个单位PE(Physical Extent),LVM的最小存储单元。创建VG时可以指定PE大小(比如-s 16M表示每个PE 16MB),默认值因发行版而异(RHEL系通常是4MB)。PE大小影响空间分配粒度和扩容时的对齐,大多数场景默认值就够了,不用刻意改。
4.3 从零建立一个LVM卷组
假设有两块盘,/dev/sdb和/dev/sdc,各200G,要合并成一个LVM资源池并创建一个300G的逻辑卷挂到/data。
第一步,把物理盘初始化为PV。
bash复制pvcreate /dev/sdb /dev/sdc
pvs或pvdisplay查看PV信息。
第二步,创建VG。
bash复制vgcreate vg_data /dev/sdb /dev/sdc
vgs或vgdisplay查看VG信息,能看到Total PE数量,这就是你手上可分配的总空间。
第三步,创建LV。
bash复制lvcreate -L 300G -n lv_data vg_data
-L 300G指定大小,-n lv_data指定逻辑卷名,后面跟卷组名。也可以用-l 100%FREE把VG里全部剩余空间都分配给LV,但更推荐显式指定大小,剩余空间留给未来的扩展。
lvs或lvdisplay确认LV创建成功。设备路径会是/dev/vg_data/lv_data,注意这是逻辑路径,实际块设备在/dev/mapper/vg_data-lv_data,两个指向同一个地方。
第四步,格式化挂载。
bash复制mkfs.xfs /dev/vg_data/lv_data
mkdir -p /data
mount /dev/vg_data/lv_data /data
然后同样用UUID写入/etc/fstab:
bash复制blkid /dev/vg_data/lv_data
到这里,一个跨两块物理盘的300G逻辑卷就建好了。逻辑卷对上层应用来说就是一块普通磁盘,根本感知不到底层跨盘的存在。
4.4 在线扩容实战:LVM最爽的场景
现在体验LVM的核心优势。假设/data空间不够了,VG里还剩余100G,直接在系统运行的状态下扩大逻辑卷。
第一步,扩大LV。
bash复制lvextend -L +100G /dev/vg_data/lv_data
-L +100G表示增加100G。也可以lvextend -l +100%FREE把剩余空间全部添加进去。
第二步,扩展文件系统。这一步最考验功力,因为不同的文件系统命令不一样:
- xfs:
xfs_growfs /data - ext4:
resize2fs /dev/vg_data/lv_data
xfs用挂载点做参数,ext4用设备路径做参数,方向不要搞反。执行完后df -h检查确认空间已在线扩大,全程无需卸载、无需停机。
如果VG里的空间也不够了,那就先加物理盘:
bash复制pvcreate /dev/sdd
vgextend vg_data /dev/sdd
然后再走lvextend + xfs_growfs/resize2fs的流程。整个过程从"插入一块物理盘"到"文件系统扩容完成",五分钟内搞定。
注意:xfs文件系统支持在线扩容,但不支持在线缩容。ext4理论上支持缩容,但我强烈不建议在线上做缩容操作,风险远大于收益。设计存储时提前规划好容量,别指望靠缩容救急。
4.5 LVM快照:极简备份的实用技巧
LVM还有一个容易被低估的功能——快照(Snapshot)。它可以在秒级为逻辑卷创建一个一致性快照,原理是CoW(Copy-on-Write,写时复制)。创建快照时并不复制全部数据,只记录创建后发生变更的块,所以速度快、占空间小。
创建快照的命令:
bash复制lvcreate -L 10G -s -n lv_data_snap /dev/vg_data/lv_data
-s表示快照,-L 10G指定快照的存储空间上限。快照可以挂载到其他目录,用于导出数据或对比,也可以直接删除释放空间:
bash复制lvremove /dev/vg_data/lv_data_snap
快照不是备份,快照和原卷在同一个存储池里,物理盘坏了快照一样丢。但它在做重大操作前提供快速的回滚点,比如升级数据库前打个快照,操作出错几秒钟就能还原。
5. 磁盘满了:排查与清理方法论
5.1 定位空间占用大头
磁盘告警响起的时候,第一件事不是盲目删文件,而是定位空间到底被谁占了。
经典命令组合:
bash复制du -sh /* 2>/dev/null | sort -rh | head -20
一行命令把根目录下所有一级目录按占用大小倒序排出来,快速锁定大头。然后层层下钻:
bash复制du -sh /var/* 2>/dev/null | sort -rh | head -20
配合find直接搜大文件:
bash复制find /data -type f -size +500M -exec ls -lh {} \; 2>/dev/null
这条命令找出/data下所有大于500M的文件并显示详细信息。注意2>/dev/null把权限报错吞掉,否则刷屏严重。大型目录上,find会比du更快定位到具体文件,du适合看目录层面的分布。
5.2 被删但不释放:lsof排查法
这是磁盘排查里最隐蔽的坑。现象:df -h显示空间满了,但你删了好几个大文件后df -h居然还是满的。这时候排查方向大概率是:文件被删除,但某个进程还持有该文件的文件描述符。
Linux的文件删除机制是,只有当所有引用该文件的文件描述符都关闭后,文件数据块才会真正释放。进程打开着文件,你就把文件删了,进程依然可以继续读写这个"幽灵文件",空间自然不会释放。
定位方法:
bash复制lsof | grep deleted
输出中能直接看到持有已删除文件句柄的进程,类似:
code复制java 12345 app 3w REG 253,0 8589934592 123456 /data/app.log (deleted)
解决办法有两种。最干净的是重启或正常停止该进程,释放文件描述符。如果不能重启进程,可以用以下方式清空文件而不删除它:
bash复制: > /proc/12345/fd/3
这条命令把该进程的3号文件描述符指向的文件内容清空,进程还能继续写,空间立刻释放。注意前提是进程还会持续往这个文件写数据,清空后它会在原位置继续写;如果应用需要文件偏移量从0开始,清空可能引入日志错位,需要评估。
这个知识点在排查"删了文件但空间没减少"的问题时是决定性的一步,记住它。
5.3 inode耗尽:另一个"磁盘满了"
前面说过,df -i查inode使用率。当inode满了,创建任何文件都会得到No space left on device错误,但df -h看空间明明还有。
常见原因是邮件队列(/var/spool/postfix/maildrop)、sessioin临时文件(/tmp下的session)、或应用产生海量小文件。
定位哪个目录inode占用最多,循环看每个目录下文件数:
bash复制find / -xdev -type f | cut -d '/' -f 2 | sort | uniq -c | sort -rn | head -10
更简单的方式:用for循环逐个目录ls | wc -l。锁定是哪个目录后,要么清理过期文件,要么从应用层面改成批量归档而不是每请求一个小文件。
5.4 日志轮转:防止日志撑爆磁盘
很多"磁盘突然满了"的事故,元凶就是日志文件无节制增长。解决之道是配置日志轮转。
主流方案是logrotate。它按时间或大小对日志文件做切割、压缩和清理。配置文件在/etc/logrotate.conf和/etc/logrotate.d/目录下。一个典型配置示例:
code复制/data/app/logs/*.log {
daily
rotate 7
compress
missingok
notifempty
copytruncate
}
含义:每天轮转一次、保留7份历史、压缩历史日志、文件缺失不报错、空文件不轮转、轮转后截断原文件而不是改名。
copytruncate很重要,很多应用不支持日志文件被改名(会继续往旧inode写),copytruncate通过复制一份当前内容再清空原文件的方式,让应用无感知地完成轮转。
不要忘记systemd的journald日志也可能吃满空间,限制它的大小:
bash复制journalctl --vacuum-size=500M
journalctl --vacuum-time=7d
或者修改/etc/systemd/journald.conf中的SystemMaxUse参数。
6. 日常监控与体检:别等报警了才行动
6.1 十分钟实现磁盘告警脚本
磁盘管理最高级的姿势是不用人肉排查——让监控脚本替你发现异常。写一个简单的shell脚本,把磁盘和inode使用率超过阈值就告警:
bash复制#!/bin/bash
THRESHOLD=85
df -h | awk 'NR>1 {gsub("%","",$5); if($5+0 >= THRESHOLD) print $0}'
df -i | awk 'NR>1 {gsub("%","",$5); if($5+0 >= THRESHOLD) print $0}'
把THRESHOLD定义成变量,实际使用时可以改成从配置读取。告警方式可以是发邮件、调用接口、写日志等,根据公司基础设施来。脚本放入crontab每10分钟执行一次,基本能做到"磁盘快满的时候提前有感知"。
更严谨的写法是把阈值、排除项(比如网络文件系统、特殊挂载点)都做成配置,避免误报。比如排除掉tmpfs这类内存盘,它们满不满不影响磁盘空间。
6.2 磁盘健康体检:SMART自检
机械盘和SSD在彻底报废前,通常不是毫无征兆的。SMART(Self-Monitoring, Analysis and Reporting Technology)能查看硬盘内部记录的健康指标。
bash复制smartctl -H /dev/sda
输出里的SMART overall-health self-assessment test result: PASSED代表基本健康。详细看属性:
bash复制smartctl -a /dev/sda
重点关注几个指标:
Reallocated_Sector_Ct:重映射扇区数。数值持续增长说明盘片出现坏道,盘正在用备用扇区替换,超过一定阈值就该换盘了。Current_Pending_Sector:待映射扇区数。非零值通常意味着坏道正在发生。Raw_Read_Error_Rate:底层读错误率,持续上升也是亚健康信号。Power_On_Hours:通电时间,判断盘龄。
注意不同厂商、不同固件的SMART字段含义略有差异,数值的绝对大小不一定有统一标准,趋势比绝对值重要。建议定期(比如每周)记录Reallocated_Sector_Ct的数值,发现稳定增长就要警惕。
smartctl需要安装smartmontools包,服务器上默认可能没装。锐捷较大的生产环境,配合监控系统定期跑smartctl并把指标上报,是很好的机房巡检手段。SSD也有SMART属性,但含义和侧重点和机械盘不同,比如擦写次数、掉电保护计数等。
6.3 IO性能初诊:iostat看瓶颈
磁盘空间只是容量维度,性能维度同样重要。系统变慢、数据库延迟升高,可能是磁盘IO出现瓶颈。
iostat是最常用的IO性能工具:
bash复制iostat -x 1
每秒刷新一次,-x扩展显示。关键字段:
%util:设备忙绿时间占比。接近100%说明磁盘已经接近饱和。await:IO请求的平均等待时间(毫秒)。机械盘await几十毫秒算正常,SSD应该是个位数毫秒级。svctm:IO请求实际服务时间。虽然这个字段在新版本中有业务争议,但粗略判断磁盘能力还是能用。r/s、w/s:每秒读写请求数,看出IO频率。rkB/s、wkB/s:每秒读写吞吐量。
一个快速判断思路:%util高说明磁盘负荷大;await远高于svctm说明有大量排队,可能是负载过高或者磁盘能力不足。定位到是哪个进程在疯狂IO,可以用iostat配合iotop(如果安装了):
bash复制iotop -o
-o只显示正在IO的进程,瞬间就能抓到元凶。
7. 磁盘管理故障速查表
实操中常见的故障翻来覆去就是那么几种,我整理成一张速查表,遇到问题直接对照。
| 现象 | 可能原因 | 排查命令 | 解决思路 |
|---|---|---|---|
df -h显示磁盘满了,但删了大文件空间没变 |
文件被删除但被进程持有 | lsof | grep deleted |
重启持有进程,或> /proc/PID/fd/N清空 |
新建文件报no space,但df -h有空间 |
inode耗尽 | df -i |
查inode占用目录,删除大量小文件 |
| 开机进emergency mode | /etc/fstab配置错误 |
mount -a、findmnt --verify |
检查UUID/挂载点/文件系统类型,修正fstab |
盘存在但lsblk看不到分区 |
分区表损坏或驱动未识别 | dmesg | tail、cat /proc/partitions |
检查内核日志,确认设备是否注册 |
| 挂载时报unknown filesystem | 设备写入了错误文件系统或没有格式化 | blkid /dev/sdb1 |
确认设备是否正确,重新格式化(注意备份) |
扩容后df -h没变化 |
LV已扩展但文件系统未扩展 | lvs确认LV大小 |
xfs用xfs_growfs,ext4用resize2fs |
| LVM卷激活失败 | 系统启动时VG未激活 | vgscan、vgchange -ay |
执行vgscan发现卷组再vgchange -ay激活 |
| 磁盘IO高、应用慢 | 线缆老化/坏道/负载过高 | iostat -x 1、smartctl -a |
根据%util和await判断,替换硬件或优化负载 |
这张表参考价值最大的是第一行和第三行,前者是"空间层面的幽灵占用",后者是"最经典的fstab翻车现场",这两个场景在我工作中遇到的频率最高。
8. 实操心得与避坑总结
最后把我这些年摸爬滚打总结出来的几条磁盘管理经验分享给你。
第一,任何磁盘操作前先确认设备名,一条lsblk,十秒钟的事。格式化写错盘、分区表写错盘、扩容扩错盘,这些事故一旦发生,轻则服务中断,重则数据不可恢复,而事故原因往往只是手滑或者记错了盘符。把确认设备名变成习惯动作,能躲开八成以上的磁盘事故。
第二,fstab永远要用UUID。这是Linux运维的共识,但依然有人嫌麻烦,拿设备名直接写进去,结果一次拔盘就在重启时翻车。用blkid拿到UUID再写fstab,多花十秒钟,换来的是重启不焦虑。
第三,扩容前一定确认文件系统类型。xfs和ext4的扩容命令不同,xfs_growfs和resize2fs搞混了会直接报错,甚至在某些极端情况下损坏文件系统。我的习惯是扩容前先跑blkid和df -T把文件系统类型看清楚,再决定用哪个命令。
第四,监控要提前做,别等满了再救火。一个简单的df脚本加上阈值告警,比任何事后排查都高效。磁盘管理的最高境界不是出问题时快速修复,而是通过监控让问题在影响业务之前就被发现。
第五,不要依赖缩容。LVM给了你动态调整的能力,但那只对扩容友好。缩容操作不仅风险大,而且流程复杂,除非极端必要,不要在生产环境做在线缩容。提前规划好容量,多留点余量,比事后缩容稳妥得多。
我在实际运维里最深的一次体会,是帮某业务线排查一个"根分区莫名其妙满了"的问题,查了大半天,最后发现是一台采集机把日志写到了不常关注的目录,加上历史日志没有轮转,半年时间攒了几百G。从那以后,我在所有服务器上统一配置了logrotate和日志分级清理策略,把磁盘告警阈值从90%调到了80%,并且每月例行巡检磁盘健康状态。可以说,磁盘管理这件事,七八成的工作量是在正确的机制建设上——监控、轮转、赋予每一步操作以确定性。剩下两成才是具体问题出现时的排查修复。做好前七成,你就能避免大多数"半夜被报警电话叫醒"的经历。
