接手一个Linux系统,不管你打算装什么服务、跑什么应用,第一件事往往就是要处理用户和权限的问题。我刚入行那会儿觉得这玩意儿简单,不就是useradd加个用户嘛,直到有一次线上环境因为用户组配置失误,导致整个项目组的人写不了代码仓库,我才意识到用户与组管理远不止几条命令那么简单。这篇文章我把自己多年积累的实操经验梳理一遍,覆盖从底层配置文件到高频命令、从权限模型到真实排障的完整链路,希望能帮你省下一些弯路。
如果你是刚接触Linux的运维新手,或者对sudo授权、UID/GID机制、账号清理这些场景只有零散认识,这篇文章适合你。如果你是老手,也可以直接跳到第5节,看看那些容易翻车的排查案例。
1. 先搞清楚用户与组到底在管什么
1.1 为什么多用户系统需要"用户"和"组"这套机制
Linux天生就是多用户多任务的操作系统,这意味着同一台机器上可以同时有很多人使用,每个用户都有自己的文件、进程和运行环境。如果所有人都共用同一个身份,那系统就没法区分"这个文件是谁的""这个进程是谁启动的""谁有权杀谁",安全隔离和资源管控都无从谈起。所以内核设计了一套极其简洁的访问控制模型:一切资源归属某个用户,进程归属某个用户,用户之间通过权限位来互相约束。
这套机制的基础就是"用户"和"组"两个概念。用户代表一个独立的身份,可以登录、拥有自己的家目录、自己的环境变量。组则是用户的集合容器,主要目的是简化授权。举个例子,你不可能给100个用户逐个授予某个文件的读取权限,但你可以把这100个人加进同一个组,然后给组授权一次搞定。这就是组的核心价值:批量授权、降低管理成本。
在权限模型上,我们熟悉的rwx权限位就是围绕这套用户/组体系展开的。每个文件有三组权限,分别对应"属主用户""属组用户""其他用户",这正是用户与组管理的直接落点。所以当你开始做用户与组管理的时候,实际上是在设计这套系统的信任边界和资源分配方式。
1.2 UID、GID、属主、属组这几个核心术语一次讲透
刚接触这块的人最容易搞混的就是UID和GID。UID是User ID,即用户ID,是内核用来唯一标识用户的一个整数;GID是Group ID,即组ID,是唯一标识组的整数。系统内部完全靠数字来识别身份,用户名只是给人看的"外号"。你输入一个命令,系统会把用户名翻译成UID,然后在各种检查中都基于UID做判断。
这么说可能有点抽象。你可以把UID理解成身份证号,用户名理解成姓名。身份证号才是真正唯一的凭证,姓名可能有重名。Linux内核不关心你叫什么,它只看UID。所以两个用户即使用户名不同,如果UID相同,在内核看来就是同一个人。这也是为什么拷贝系统文件到新机器时,如果UID对不上,文件显示的用户名会变成一串数字——因为系统里没有这个UID对应的名字了。
组的机制类似,也分主组和附加组。主组也叫初始组,是用户创建时默认所属的组,在/etc/passwd里记录;附加组是额外加入的其他组,在/etc/group里记录。一个用户只能有一个主组,但可以加入多个附加组。这个设计意味着什么呢?意味着你可以用主组来定义用户的基本归属,用附加组来做灵活授权。比如你把一个开发者设为devs组的主组成员,同时加入docker组,他就同时拥有了两组对应的权限。管理的时候灵活度很高。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 配置文件是一切管理的根基,读懂它们才算入门
很多教程上来就教你敲命令,但忽略了真正的核心——配置文件。用户与组管理的所有状态最终都落在四个文件里:/etc/passwd、/etc/shadow、/etc/group、/etc/gshadow。命令只是操作这些文件的"快捷方式"而已。我自己的习惯是,任何时候遇到用户相关的问题,第一反应就是去读这两个文件,而不是猜命令行为。
注意:现在很多系统使用NSS(Name Service Switch)机制管理账户数据来源,可能包含LDAP、NIS等外部服务。这里我们讨论的是最常见的本地文件模式,也是新手必须掌握的基础。
2.1 /etc/passwd 文件里的7个字段到底代表什么
/etc/passwd是用户信息的核心数据库,每一行描述一个用户,用冒号分隔成7个字段。看一行典型的内容:
code复制root:x:0:0:root:/root:/bin/bash
从左到右这7个字段是:用户名、密码占位符、UID、GID、注释信息(GECOS)、家目录、登录Shell。
第一个字段是登录名,第二个字段是密码占位符,现在几乎都是"x"。为什么是"x"?因为真正的密码哈希已经被移到/etc/shadow里了,这里只保留一个占位标记。这样设计是出于安全考虑:/etc/passwd是所有人可读的,如果把哈希放里面,任何人都能拿去离线爆破。而/etc/shadow的权限是root专属,普通用户根本无法读取,暴力破解的难度就高多了。这个拆分是历史演进的结果,也是现代Linux安全基线的一部分。
UID和GID我在前面已经说过了,这里不再展开。GECOS字段存的是用户的备注信息,通常是全名、电话、部门之类的,日常用的不多,但可以用finger命令查看。家目录字段指定了用户登录后的起始目录,登录Shell字段则指定了用户使用的Shell程序。这两个字段直接决定了用户登录后落在哪里、使用什么解释器,后面创建用户时我们还得详细说。
2.2 /etc/shadow:密码哈希与密码策略的存放地
/etc/shadow存放的是用户加密密码和密码策略信息。它的权限通常设置为000或640 root:shadow,普通用户连读都读不了。一行记录的格式是这样的:
code复制username:$6$salt$hash:18000:0:99999:7:::
这9个字段分别是:用户名、密码哈希、最后一次修改密码的日期(从1970年1月1日算起的天数)、最小修改天数(两次改密之间须间隔多少天)、最大有效天数(密码多少天后必须修改)、提前警告天数、宽限期、账号失效日期、保留字段。
密码哈希部分我们常见$6$开头,表示SHA-512算法;$y$是yescrypt(新版本Fedora/RHEL系列),$1$是MD5(已经过时)。这一串是加密后的密文,包含了salt和hash。大家理解的时候不要试图去"解密"它,这本就是单向不可逆的算法。
除此之外,shadow文件还承担密码过期策略的职责。这里很容易踩坑:如果最大有效天数和警告天数配得不对,用户可能被迫频繁改密码,也可能一直没人催改密码。生产环境里我一般会通过chage命令做策略调整,后面实操部分会演示。如果你想查看某个用户的密码策略,chage -l username一次就能看全。
2.3 /etc/group 和 /etc/gshadow:组的定义与组密码
/etc/group记录组信息,格式分4个字段:组名、组密码占位符、GID、组成员列表(附加组成员,逗号分隔)。比如:
code复制sudo:x:27:alice,bob
这就说明sudo组的GID是27,alice和bob两个用户是这个组的附加成员。注意这里列出的成员是"附加组"成员,主组成员不会列出来,因为主组关系已经写在/etc/passwd里了。很多新手会疑惑:为什么我在usermod -aG里添加了用户,但/etc/group里看不到它的主组?原因就在于此——要看members列表得找附加组。
/etc/gshadow是组密码文件,里面存的是组密码哈希和组管理员信息。实际生产中组密码用得非常少,绝大多数场景都不需要给组设置密码。如果你的环境从来不用groupmod的密码功能,gshadow文件基本保持默认就行。
掌握这四个文件,你才算真正理解后面的所有命令。因为每条命令本质上都是通过这些文件落地的,某个命令异常,往往都能在上面找到线索。这也是排查用户问题时的第一抓手。
3. 实操:用户管理的核心命令详解
这一节我介绍的命令是最常用的,覆盖用户和组的增删改查。命令本身不难,难的是理解参数背后的影响,以及哪些坑必须要避开。我强烈建议你在测试环境或虚拟机上先练一遍,不要直接在线上服务器上手试。
3.1 创建用户:useradd 的完整用法和默认策略
创建用户的命令是useradd,基本用法是useradd username,但这样的默认行为可能不完全符合你的预期。不同发行版的useradd默认值来自/etc/default/useradd和/etc/login.defs两个配置。比如在CentOS上,默认创建用户时可能会自动创建同名的用户组并设置UID范围在1000-60000之间;在Ubuntu上可能还会启用额外的目录骨架。
我推荐在实际工作中显式声明关键选项,避免依赖默认值。比较常见的完整创建命令是:
bash复制useradd -u 1501 -g devops -G docker,web -s /bin/bash -d /home/webapp -m -k /etc/skel -c "Web Application User" webapp
逐项拆解:-u 1501指定UID,-g devops指定主组为devops组,-G docker,web指定附加组,-s /bin/bash指定登录Shell,-d /home/webapp指定家目录,-m表示创建家目录,-k /etc/skel表示从系统默认的/etc/skel目录复制模板文件,-c写入备注信息,最后的webapp是用户名。
命令跑完之后,系统会做几件事:写入/etc/passwd、生成/etc/shadow记录(初始密码为空)、修改/etc/group(如果用了附加组)、创建家目录、复制skel模板文件。这几件事一步到位,大大简化了管理工作。
这里要强调几个容易忽略的细节。
第一,用useradd创建的用户默认是锁定状态,因为还没有设置密码。你需要紧接着用passwd webapp来设置密码,用户才能登录。
第二,如果不指定主组,很多发行版会自动创建同名组,并把用户加进去,这是所谓UPG(User Private Group)方案。这个方案的好处是每个用户拥有独立的私有组,通过umask配合可以让新建文件默认拥有合理的权限。但如果你不想要这个行为,可以加-N参数,让用户归入users组。
第三,-m参数是否要加,取决于你是否需要这个用户拥有家目录。像一些纯服务账号,比如nginx、mysql,它们可能只需要一个运行身份,并不需要可交互的登录环境,这时可以不加-m,而且-s还可以设为/sbin/nologin,禁止用户登录。
bash复制useradd -r -s /sbin/nologin -d /var/lib/sshkeys sshkeys
这里的-r表示创建系统用户,UID会落在系统保留区间(通常是1-999),不会占用普通账号的UID范围。这是区分服务账号和普通用户账号的关键参数,生产环境要善用。
3.2 修改与删除用户:usermod 与 userdel 的正确姿势
用户创建之后,免不了要调整。调整用户属性的命令是usermod,它的参数基本上跟useradd一脉相承,用法很相似。比如要把用户webapp的主组从devops改成ops,同时加入deploy组:
bash复制usermod -g ops -aG deploy webapp
这里有一个极其重要的细节:-G参数如果不加-a,会先清空用户现有的所有附加组,再把你指定的组加进去,这会直接导致用户丢失原有的附加组权限,由此引发的权限问题很难排查。所以我的习惯是:凡是给用户添加附加组,一律使用-aG,除非我真的要重置附加组列表。
再比如修改用户的过期时间、密码警告期,可以用chage命令来调,也可以通过usermod的-e参数设置账户失效日期。usermod -e 2025-12-31 tempuser可以做一个临时账号,到期自动失效。
删除用户的命令是userdel,它有一个关键参数-r,表示连带删除用户的家目录和邮件目录。官方建议是如果要彻底清理,用userdel -r,但这里要非常谨慎:万一这个用户的家目录里有其他服务需要的文件,-r会把它们一并删掉且不经过回收站,事后找回来基本不可能。所以我个人的操作流程是:先用find / -user username扫一遍这个用户拥有的文件,确认哪些要保留、哪些要迁移,再决定是否用-r,或者干脆手动删除家目录。
另外,删除用户前最好先确认这个用户没有正在运行的进程。如果用户还有进程在跑,userdel会提示设备忙,虽然强制删除也可以给用户改名,但残留的进程和文件归属会变成无主用户,很容易成为后续安全隐患。稳妥做法是先kill进程,再删除用户。
3.3 组管理:groupadd、groupmod、groupdel 一条龙
组管理的命令相对简单,但同样有细节。创建组用groupadd,一般指定GID和名称就行:
bash复制groupadd -g 1700 devops
查看组信息可以用getent group devops或者grep devops /etc/group,两者效果类似。修改组名或GID用groupmod -n newname devops或groupmod -g 1800 devops。
这里提醒一点,修改组的GID要小心。假设devops组的GID从1700改成了1800,那么所有原来属组为1700的文件,其属组数字还是1700,但系统里已经找不到对应的组名了,文件属性就会显示为1700这一串数字而不是devops。这时你需要手动find和chgrp去修正这些文件,否则就会遗留一堆"无名所属"的文件。所以groupmod -g在生产环境要慎用,最好在业务低峰期操作。
删除组是groupdel,但有个限制:如果这个组是某个用户的主组,groupdel会直接拒绝删除。解决办法是先把这个用户的主组改掉,或者删除这个用户,再执行groupdel。另外,如果组是被某些文件文件的属组引用(哪怕组里已经没人了),删除后这些文件的属组也会变成无主数字。因此删除组前同样需要检查文件的属组归属。
4. 实战场景:从零搭建一套用户权限体系
前面讲了这么多命令和参数,接下来我拿一个典型场景把它们串起来。假设你是一个创业团队里唯一的运维工程师,需要为一台新上线的应用服务器搭建一套用户权限体系,包含5个开发、2个运维、1个外包临时人员,并且要求运维人员有sudo权限、开发人员只能操作应用目录、外包人员在一周后自动失效。这个场景在真实工作中非常典型,完整走一遍你就知道用户与组管理怎么落到了实处。
4.1 需求分析:搞清楚谁该在哪、权限怎么分
动手之前先做需求梳理,这一步决定了后续所有操作的合理性。我的思路是先划角色、再分组、再建用户、最后授权,流程清晰且不容易出错。
角色划分:运维人员需要拥有sudo权限,开发人员需要在应用目录下有读写权限,外包人员只需要临时访问权限且要限时失效。基于角色,我规划了三个组:devops(运维)、dev(开发)、temp(临时账号)。其中devops组的成员加入sudo组,dev组的成员对应用目录拥有读写权限,temp组用于临时账号的归集和出账。
目录规划:应用代码放在/data/webapp,日志放在/data/logs,数据备份放在/data/backup。这三个目录的属组要分配给dev组,这样开发人员可以自由读写应用代码和查看日志。备份目录只给运维人员读写,避免开发人员误删备份。运维人员在sudo组里,拥有全部root权限。
这里有几种方案可以选:用直接修改sudoers文件,或使用visudo;用ACL扩展权限,或用传统chmod;用符号链接,或直接调整目录结构。我最终选择了传统组授权配合sudo组管理,原因是这套方案简单透明,不引入额外的权限机制(ACL),团队后续接手的人看到组名就能理解权限设计。
4.2 落地实施:从创建组到逐级授权全流程
第一步,创建组:
bash复制groupadd devops
groupadd dev
groupadd temp
第二步,创建用户并加入对应组。需要说明的是,devops和dev这两个组的成员我设为附加组成员,而不是主组成员,这样灵活性更高。运维用户如果后面要调整角色,直接从附加组移除就行,不会影响主组归属。
bash复制useradd -m -s /bin/bash -G devops -c "Respo Zeng" respo
useradd -m -s /bin/bash -G dev -c "Alice" alice
useradd -m -s /bin/bash -G dev -c "Bob" bob
useradd -m -s /bin/bash -G temp -e 2025-12-31 -c "Temporary Contractor" carol
passwd respo
passwd alice
passwd bob
passwd carol
第三步,给运维用户加入sudo组,并确认sudo组在sudoers里有授权。大多数发行版默认都通过%sudo ALL=(ALL) ALL或%wheel ALL=(ALL) ALL开启了组授权。在CentOS默认的sudo组是wheel,在Ubuntu是sudo。实际用哪个组,要根据发行版来定,别想当然。
bash复制usermod -aG sudo respo
装好组之后,可以立刻用id respo和groups respo查看确认。我看到groups respo能同时列出respo、devops、sudo,就说明加入成功了。
第四步,配置应用目录的属组和权限:
bash复制mkdir -p /data/webapp
mkdir -p /data/logs
mkdir -p /data/backup
chown root:dev /data/webapp
chmod 2775 /data/webapp
chown root:dev /data/logs
chmod 2775 /data/logs
chown root:devops /data/backup
chmod 2770 /data/backup
这里的2775其实是2+775,前导的2表示设置SetGID位。为什么在/webapp目录上要设置SetGID位?这是整个配置里最容易被忽视、却最有价值的一点。设置了SetGID位之后,在这个目录下新建的文件会自动继承目录的属组,而不是创建者的主组。如果没有这个位,开发人员A在目录里新建了一个文件,这个文件的属组就是A的主组,其他开发人员如果不在A的主组里,可能就没权限写这个文件了。有了SetGID位,文件自动属于dev组,组内所有人都能按组权限读写配合,协作顺畅。
这一步做完之后,还可以顺便调整一下默认umask。在/etc/profile或/etc/login.defs里,将默认umask设为002或007,组内才能拥有相应的写权限。否则即使目录权限是对的,新建文件也可能因为没有组写权限而无法协作编辑。
第五步,验证权限。用一个开发账号alice在/data/webapp下创建测试文件,然后让bob去尝试修改,确认可以正常写入并互相访问。测试通过后再清理测试文件,整个权限体系就差不多成形了。
bash复制su - alice -c "touch /data/webapp/test.txt && echo ok"
su - bob -c "echo hello >> /data/webapp/test.txt"
ls -la /data/webapp/test.txt
如果一切正常,test.txt的属组应该是dev,bob可以追加内容。这就说明SetGID和组授权都生效了。
4.3 收尾:临时账号的策略配置与后期维护
临时账号carol我已经设置了-e 2025-12-31,到时间后账号自动失效,但它的家目录和文件还在系统里。后续如果要复用这个账号,usermod -e ""可以清除过期日期重新启用;如果确定不用了,需要清理时先扫描相关文件,确认无保留价值再删除。临时账号的密码策略也要单独关注,比如设置短生命周期:
bash复制chage -M 30 carol
这条命令强制carol每30天更换一次密码。临时账号的密码如果太长不换,风险控制就有问题了。
这套方案落地之后,团队的权限边界就非常清晰了:运维通过sudo拥有系统级管控能力;开发在/data/webapp下自由协作;备份目录只有运维能读写;临时账号到期自动消失,过时不候。整个方案没有用到一条复杂的高级特性,却足够稳健。生产环境里,我见过太多人一上来就ACL、sudoers花式配置,结果自己都忘了当初设了哪些规则。能用简单机制解决的,不要复杂化,这是我反复强调的运维原则。
5. 常见问题与排查技巧实录
用户与组管理容易出问题的地方,往往都在权限边界和身份映射上。我把这些年踩过的坑和排查思路总结成一个速查表,再挑几个典型场景详细说,方便你遇到问题的时候对照参考。
5.1 问题速查表
| 症状 | 可能原因 | 首选排查命令 | 解决办法 |
|---|---|---|---|
| 用户无法登录 | 密码未设置或账号过期 | passwd -S username |
重置密码或清除过期时间 |
| 文件权限明明改了还拒绝访问 | 属组不对或SetGID位缺失 | ls -ld / getfacl |
检查属主属组,补SetGID |
| 用户无法sudo | 未加入sudo或wheel组 | groups username |
usermod -aG sudo username |
| 删除用户时提示busy | 用户有进程在运行 | pgrep -u username |
先处理进程再删除 |
| 新建文件属组是用户主组,而非期望组 | 父目录没设SetGID | ls -ld /path |
chmod g+s /path |
| 用户文件显示为数字 | UID/GID在系统不存在 | id username |
查找原UID,匹配或调整 |
| passwd显示密码已过期 | 密码策略生效 | chage -l username |
查看策略并调整 |
| userdel后系统还有同名用户相关文件 | 未加-r或文件归其他用户 | find / -user username |
手动清理保留文件 |
5.2 经典场景排查:用户创建后无法登录
新手最常遇到的问题就是:刚用useradd创建用户,紧接着想登录,密码怎么输都不对。原因往往是useradd之后没有设置密码,系统默认该账号是锁定状态。此时用passwd username设置密码即可。
还有一种情况是密码已经设置,但Shell被设成了/sbin/nologin,这种用户本来就不允许交互式登录,你输入任何密码也进不去,因为登录验证阶段就被Shell拦截了。解决办法是usermod -s /bin/bash username,前提是这个用户确实需要交互式登录。
如果我遇到登录失败,习惯的第一步是用passwd -S username看账号状态,输出里会显示LK(锁定)、PS(可用)、EX(过期)等标识;再配合chage -l username查看详细策略,比如密码是否达到最大有效期、账号是否被设置失效日期。这两条命令能定位80%的登录问题。
5.3 经典场景排查:文件明明有权限,服务还是拒绝访问
这个问题的成因往往是"权限检查不只看文件权限位"。举两个真实案例。
第一个案例是Nginx。处理静态文件时报403,文件权限明明是644,属主也对,但工作进程是以nginx用户身份运行的,nginx用户是否拥有文件路径上所有目录的执行权限(x)?如果中间某个目录是700且属主是root,nginx用户根本进不去,就会报403。用namei -l /path/to/file可以一步步看路径上每一级的权限,快速定位断点。
第二个案例是应用目录协作冲突。前面提到过,如果父目录没有设置SetGID位,两个开发用户即使都在dev组,新文件的属组仍然是创建者的主组,另一方可能就无法修改。解决办法就是给协作目录设置SetGID。排查方法:ls -ld /data/webapp,如果权限位是drwxrwxr-x而不是drwxrwsr-x,说明g+s没了,补上就行。
5.4 经典场景排查:删除用户和组时的残留问题
userdel -r虽然能删除主目录,但用户可能还拥有其他路径下的文件,比如临时目录、挂载目录、共享目录里的旧文件。一旦用户被删除,这些文件的属主变成数字UID,时间一长,谁也不知道这些数字是哪个历史用户,清也不好清,留也留得提心吊胆。我建议在删除前用find / -uid <UID>扫描全盘,把文件列表导出留档,再决定是修改属主还是删除。
删除组时如果提示"cannot remove the primary group of user",说明有用户的主组还是这个组。你需要先把这些用户的主组改成其他组,或删除这些用户,之后才能删除组。
如果你在清理过程中发现用了userdel之后因为用户进程还在导致用户信息残留,可以试试先pkill -u username,再重新执行删除。如果还是不行,可能需要检查是否有子进程或systemd用户服务在运行。这种情况比较绕,但处理顺序无非就是"找进程、杀进程、删账号"三板斧。
6. 几个容易忽略但长期受益的小习惯
这里写几点我在日常操作中形成的习惯,不算是多么高深的技术,但确实帮我规避了很多麻烦。
第一,家目录权限规范化。默认useradd -m创建的家目录权限通常是755或700,取决于umask。如果是服务类账号,不需要给其他人任何权限,设为700最安全。如果是团队共享的开发账号,可以考虑把group权限打开。但整体原则是:权限越紧凑越好,不要图方便用777,因为777意味着任何人都能写,一旦目录里混入恶意文件,后果难料。
第二,给账号加备注。创建用户时多用-c参数写清楚这个账号是干嘛用的、对应的人是谁、联系方式是什么。系统里账号多了之后,备注就是救命信息。我遇到过一台机器上十几个service账号,没有备注,根本分不清哪个对应哪个服务,排查问题全靠猜。
第三,做好UID/GID迁移的映射记录。如果你需要把一台旧服务器的数据迁移到新服务器,最好在迁移前记录好所有用户的UID/GID映射。否则迁移后文件属主显示成了一串数字,你还得一个个查回去。生产环境我通常建议对所有涉及共享存储或归档备份的UID做固定分配,避开系统保留段和可能的冲突段。
第四,慎用千篇一律的"强密码"。很多公司的安全策略强制每90天改一次密码,但服务账号的密码不应该纳入这个策略,因为服务账号的密码是要写进脚本或配置文件的,如果自动过期会导致服务连接失败。对于服务账号,更好的做法是用密钥认证或者设置chage -M -1让密码永不过期,然后用密钥权限去把控安全。
这些习惯没有一个是复杂的,但做到了就能让一批机器变得干净、清晰、可维护。管理Linux系统,很多时候拼的不是高深的技巧,而是这些日积月累的规范操作。
写在最后
用户与组管理是整个Linux系统中最基础也最容易被轻忽的一环。基础并不意味着简单,它背后连接着权限模型、安全策略、多用户协作和系统审计。把用户、组、配置文件这三个核心层次吃透,再配合合理的授权策略和细致的排查习惯,你面对权限问题时就不会再有无从下手的感觉。
我个人在实际操作中的体会是,控制台前的从容都是靠平时踩坑换来的。每个诡异的权限错误,本质上都在告诉你某个底层机制你理解得还不够透。多读配置文件、多观察命令输出、多记录操作日志,时间久了自然会形成自己的排查直觉。希望这篇文章能帮你把这套基础打得比别人更扎实一点,少走一些弯路。
