刚用Linux那会儿,文本工具里我最懒得碰的就是cut。有字段想提取,直接awk一把梭不就行了,干嘛还要记cut的语法?后来在真实排障和写脚本时碰了几次钉子,才意识到cut这个命令虽然小,但在处理“提取文本列”这个需求时往往比awk更省事、也更不容易写错。它是coreutils自带的老牌文本切分工具,和grep、sed配合能构成完整的日志/配置清洗链路,也是Linux面试题里经常冷不丁冒出来的命令。
这篇不打算照着man把选项念一遍,而是想把cut的三种工作模式(按字段、按字符、按字节),以及实际项目里最常见的几个翻车点讲透,包括默认分隔符、连续空格、UTF-8中文、没有分隔符的行这些边界情况。不管你是刚开始接触Linux的初学者,还是已经在写运维脚本的老手,只要需要处理“定长列、分隔符列、快速截取字段”这类问题,这篇文章都应该能给你几个直接能抄的答案。
1. cut命令在文本工具链中的真实定位
1.1 为什么有了awk还要用cut
很多人一开始觉得awk能替代cut,这点我不太赞同。awk确实强大,正则、条件、数值运算、数组全都能做,但它不是“轻量级”的字段提取器。当你的需求只是从一行里取出某一列时,cut有两个不可忽视的优点:一是语法直观,几乎不用想就能写对;二是在管道里跑得轻,尤其处理几GB级别的日志时,少加载一个解析器能节省不少时间。
举一个我常用的判断标准:如果文本格式非常规则,分隔符固定,比如/etc/passwd、CSV、以冒号或竖线分割的配置文件,优先用cut;如果列之间有大量连续空格、字段顺序不固定,或者还要做进一步的条件筛选、数值统计,这时候才考虑awk。awk是“拿来处理复杂文本的”,cut是“拿来切固定格式的”。这俩不是替代关系,而是工具链里不同环节的配合关系。
另一个容易被忽略的点是,cut在处理“按宽度截取”时比awk简单太多。awk处理定长列往往要写substr,而cut直接-c1-8就把前8个字符取出来了。日志分析里经常遇到精确到秒的时间戳、固定格式的状态码等场景,cut明显顺手。
1.2 cut的三种切法:-f、-c、-b 到底怎么选
cut最核心的就是三个参数:-f、-c、-b。它们代表三种不同的“切法”:
-f(field):按字段切,配合-d指定分隔符。-c(character):按字符位置切。-b(byte):按字节位置切。
一句话概括使用场景:内容是“a:b:c”这种分隔符结构,用-f;内容是固定宽度的日志、表格,用-c;需要精确到字节、或者想处理二进制数据里的一小段,用-b。
需要注意,这三者一次只能指定一种,不能混用。比如cut -c1-3 -f1这种写法会直接报错,因为cut要求每次执行只使用一个列表类型。
先来一个最经典的例子,从/etc/passwd里提取用户名:
bash复制cut -d: -f1 /etc/passwd
这条命令的含义是:以冒号作为分隔符,把每一行切成若干字段,输出第1个字段。换成awk写法是:
bash复制awk -F: '{print $1}' /etc/passwd
结果一样,但cut的写法更“管道友好”,后面接sort、uniq、grep都很自然,不需要处理大括号里的引号。
如果后面还有类似/etc/group、/etc/shadow这种冒号分隔的配置文件,这套写法基本可以通用。还有一个常用于PATH变量的例子:
bash复制echo "$PATH" | cut -d: -f2
当系统里有多个目录装不同版本的软件时,这条命令能快速看清楚PATH里第二个路径是哪个,比肉眼盯着长字符串方便得多。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 默认分隔符与连续分隔符:cut最容易翻车的两件事
2.1 Tab才是默认分隔符
刚开始用cut的人最容易踩的第一个坑是:以为-d不写,cut会默认按空格切。不对,cut默认的分隔符是Tab键,不是空格。
为什么默认值是Tab?因为cut最初的设计场景之一就是处理Unix传统表格类文本,这类文本在历史上常用Tab作为字段分隔符。对于使用者的实际意义就是:只要处理的是空格分隔的文本,你必须显式写出-d' ',否则cut会认为整行没有分隔符,结果往往是直接把整行原样输出,让你一脸懵。
比如有一个文件内容是这样的:
bash复制alice 30 developer
bob 25 tester
想提取年龄那一列,写成cut -f2 file并不会得到30和25,而是会把两行原样打印出来。正确写法是:
bash复制cut -d' ' -f2 file
由于alice和30之间是两个空格,这个写法又会踩到接下来要说的连续空格问题。
2.2 多个连续空格导致空字段
很多日志、命令输出里的列并不是严格单空格分隔,而是对齐用的多个空格。cut是按“单个分隔符字符”来切的,它不会像awk默认那样把连续空白“压缩”成一个分隔符。
看这个例子:
bash复制echo "root docker admin" | cut -d' ' -f2
你可能会以为输出是docker,实际输出是一个空行。原因很简单:把这一行按空格切分时,字段的结构是root、空字符串、docker、空字符串、admin。因为两个空格中间夹着一个空的字段,所以-f2取到的是那个空字段,-f3才是docker。
处理这种场景有几种常见思路。第一种,如果确实是多个空格,而且中间的空字段确实不想要,可以先把连续空格压缩成单个空格:
bash复制echo "root docker admin" | tr -s ' ' | cut -d' ' -f2
tr -s ' '会把连续多个空格压成一个,这样cut再按单空格切就干净了。
第二种,直接换用awk。awk默认的字段分隔符是“连续空白”,它会自动忽略多余空格,awk '{print $2}'在这种场景下才是更省心的选择。所以,遇到来源不明的命令输出、人工对齐过的表格文本,我一般直接用awk,不跟cut较劲;只有确认分隔符就是单字符时,才放心让cut上。
2.3 没有分隔符的行会被原样输出
另一个很隐蔽的坑是cut对“无分隔符行”的处理策略。GNU cut的默认行为是:如果一行里根本没有出现你指定的分隔符,这行会被原样输出,不管你的字段列表选的是第几个字段。
举个例子:
bash复制printf "no-delimiter\n" | cut -d: -f1
这条命令输出的不是空行,而是no-delimiter。对,它会把整行直接打印出来。这个行为在写脚本时非常容易造成脏数据混入结果,尤其是处理带注释的配置文件或首行标题时。
如果想跳过所有没有分隔符的行,需要加-s参数:
bash复制cut -d: -f1 -s /etc/somefile
-s全称是--only-delimited,意思是只输出包含分隔符的行。实际生产里,我有一次处理导出的日志文件,文件里夹杂了几行注释,没有按预期格式来,结果统计出来的用户列表里莫名其妙多出了几行注释文本。当时排查了很久才发现是cut的“无分隔符原样输出”在作怪,加个-s就解决了。
3. 处理中文和UTF-8字符串时,字符与字节的边界别搞混
3.1 -b永远按字节算:切多字节字符会乱码
如果你用cut -b来处理包含中文的文本,大概率会得到乱码。因为中文在UTF-8编码下通常占3个字节,-b只认字节,不知道哪些字节凑在一起是一个字。
举个例子:
bash复制echo "你好世界" | cut -b1-2
在UTF-8环境里,输出结果不会是“你”,而是“你”字的前两个字节,通常会显示成类似�的乱码。要完整取出“你”,必须取满3个字节:
bash复制echo "你好世界" | cut -b1-3
这会正常输出“你”。但问题在于,你写脚本的时候还得自己数汉字占几个字节,遇到特殊字符或Emoji甚至可能占4个字节,靠-b数位置非常脆弱。
3.2 -c按字符算,但前提是locale对
和-b相对的-c,本意是按“字符”来切,在处理英文时和-b没区别,处理中文时看起来也正常。但这里有个隐藏前提:当前locale要能正确识别多字节字符。
在大多数现代Linux发行版里,默认locale是en_US.UTF-8或C.UTF-8,cut -c可以正确按字符处理中文字符。可如果你所在的容器、嵌入式系统,或者某些精简环境把locale设成了C或POSIX,cut -c1-1的行为就会退化到按单字节来,中文一样会乱码。
验证方法很简单,可以运行:
bash复制echo "你好世界" | LC_ALL=C cut -c1-1
在C语言环境下切第一个“字符”,结果很可能不是“你”,而是一个乱码字节。把LC_ALL换成C.UTF-8再跑一次,就能正确输出“你”:
bash复制echo "你好世界" | LC_ALL=C.UTF-8 cut -c1-1
所以,如果你的Linux环境处理中文时出现了奇怪的截断,先别急着怀疑cut,检查一下locale往往更快定位问题。
3.3 实操技巧:定长前缀里混着中文怎么办
实际生产中,我处理过一条日志,格式是“时间戳+中文用户名”,比如:
bash复制20250117225958张三 login
时间戳固定是14个字符,后面直接跟用户名。如果我想切出时间部分,可以写:
bash复制cut -c1-14
这里一定不要用-b,因为“张三”两个汉字占了6个字节,从第15个字节开始切会把用户名切碎。用-c按字符位置切,14个字符就刚好卡在时间戳和用户名之间。
如果文本不是纯中文,而是中日韩字符、全角符号混在一起,处理起来会更麻烦。cut本身没有“跳过几个全角字符”的概念,它只认字符位置,好在一般情况下,只要每行固定宽度、且以字符为单位,-c都能应付。
4. 多列提取、范围语法、输出分隔符的细节
4.1 先搞清楚cut能不能重排列
cut支持一次提取多个列,列表用逗号分隔:
bash复制echo "a:b:c:d" | cut -d: -f1,3
输出是:
bash复制a:c
还可以用横线表示区间:
bash复制cut -d: -f1-3 file
cut -d: -f3- file # 第3字段到行尾
cut -d: -f-3 file # 从开头到第3字段
这种范围语法对-c也适用,比如从一行里截取第2到第5个字符:
bash复制echo "abcdef" | cut -c2-5
输出bcde。使用范围语法时要注意,cut的列表是从1开始编号的,没有0字段,写-f0会直接报错。
这里有一个很多老手都会误会的点:cut能不能像awk那样把字段重排?比如输入是a:b:c,能不能输出c:a?答案是不能。cut对多个字段的范围提取,输出顺序永远按照字段在原始行中出现的顺序排列,而不是按照你命令里写的顺序。
也就是说:
bash复制echo "a:b:c" | cut -d: -f3,1
在GNU cut里,输出并不是c:a,而是a:c。如果你真的需要把第3列放到第1列前面,老老实实用awk:
bash复制echo "a:b:c" | awk -F: '{print $3, $1}'
这个坑我见过不止一次,很多脚本里想靠cut顺手调换列序,结果越调越乱,最后全部改成awk才恢复正常。
4.2 用--output-delimiter清洗输出分隔符
当cut提取多个字段时,默认会用输入时的分隔符来连接输出字段。比如:
bash复制echo "a:b:c" | cut -d: -f1,3
输出是a:c,中间的冒号还是原来的冒号。如果想把结果改成用空格或者箭头连接,可以用--output-delimiter:
bash复制echo "a:b:c" | cut -d: -f1,3 --output-delimiter=' '
输出变成a c。这个参数在处理配置文件时很有用,比如我想把/etc/passwd里的用户名和home目录提取出来,做一个“用户名 -> 目录”的清单:
bash复制cut -d: -f1,6 --output-delimiter=' -> ' /etc/passwd
输出会变成类似root -> /root的格式,后面再接sort或grep都很清楚。注意--output-delimiter是GNU扩展参数,在BusyBox的cut实现里不一定支持,跨系统写脚本时要留意。
4.3 没有反向索引:取最后一个字段的基本解法
另一个经常被问到的点是:cut怎么取最后一个字段?和Python、awk不同,cut不支持负数索引,你不能直接写-f-1来取最后列。
一个常用的技巧是用rev先把字符串反转,然后用cut取第一个字段,最后再反转回来:
bash复制echo "/data/log/app.log" | rev | cut -d/ -f1 | rev
输出结果是app.log。这个trick的原理不难理解:rev把字符串顺序完全颠倒,/data/log/app.log变成gol.ppa/gol/atad/,这时候/分隔后的第1个字段就是原来的文件名,取出来后再用rev反转成正常顺序。
如果你觉得这个写法绕,也可以直接改用awk:
bash复制echo "/data/log/app.log" | awk -F/ '{print $NF}'
awk的$NF代表当前行的最后一个字段,这在路径处理、文件名提取场景里非常常用。两种写法各有用处,如果只是偶尔取一次,rev+cut能少依赖一个工具;如果后面还要对字段做复杂判断,还是awk更实际。
5. 生产环境里的cut组合用法,以及和awk的取舍
5.1 什么样的命令输出适合用cut去截
生产环境里最常配合cut使用的场景,是那些分隔符明确、列结构稳定的命令输出。比如/proc/loadavg:
bash复制cat /proc/loadavg
它的输出通常是:
bash复制0.08 0.03 0.01 1/367 10428
前三个字段正好是1分钟、5分钟、15分钟的负载值,字段之间以单个空格分隔。这样的文本非常适合用cut提取:
bash复制cut -d' ' -f1 /proc/loadavg
取出来的就是当前1分钟负载。相比uptime再抓最后一串字符,这种方法稳定得多。
再比如ss -lntp这种输出,虽然列很多,但不同列之间可能存在对齐空格,直接cut不一定好切。我会先用tr -s ' '压缩连续空格,再交给cut处理,或者干脆用awk。所以关键判断点还是那句话:列之间是不是“单分隔符”结构。/proc/loadavg是,free和ps的输出很多时候不是。
5.2 遇到连续空格和列错位,不要硬扛cut,果断换awk
以ps -eo pid,comm为例,输出可能是:
bash复制 1 systemd
123 sshd
456 nginx
PID编号和命令名之间用了多个空格来对齐,直接cut -d' ' -f2会把第2列取成一个空字段,因为第1列PID结束后,第2个字符就是空格,连续多个空格被切成了多个空字段。这是典型的不适合用cut的场景,正确写法是awk:
bash复制ps -eo pid,comm | awk '{print $2}'
awk默认把连续空白当成一个分隔符,能直接跳过多个空格。不只是ps,free、df -h、ls -l这些命令的输出都普遍存在对齐空格问题,我一律建议用awk而不是cut来提取列。
那cut在“空格分隔”的文本里就完全没用了吗?也不是。如果文本是脚本自己生成的、能保证恰好一个空格分隔,那么cut -d' '完全可以胜任,而且比awk轻。关键是看数据来源是否可控,不可控的对齐文本就用awk,可控的严格空格文本才用cut。
5.3 可以直接抄的几个脚本片段
分享几个我在实际脚本里用过的cut组合,都属于即拿即用的类型。
从/proc/meminfo里取内存总量:
bash复制grep '^MemTotal:' /proc/meminfo | awk '{print $2}'
如果改用cut,需要先确定冒号后面紧跟的是空格,字段顺序为MemTotal:、数值、kB,直接切也是能切的,但awk更省心。
从access.log里统计出现最多的IP:
bash复制cut -d' ' -f1 /var/log/nginx/access.log | sort | uniq -c | sort -rn | head
Apache/Nginx默认日志格式的第一列就是客户端IP,单空格分隔,非常好的cut使用场景。
从一个带版本号的路径中截取版本:
bash复制echo "/opt/app-3.2.1/bin" | rev | cut -d/ -f1 | rev
得到app-3.2.1;如果只要版本号,可以继续用cut切割横线和点:
bash复制echo "/opt/app-3.2.1/bin" | rev | cut -d/ -f1 | rev | cut -d- -f2
输出3.2.1。这类写法在卸载旧版本、读取当前部署版本号时很常用。
6. 一次真实排错实录:从混合对齐的日志里提取中文用户名遇到的乱码和列偏移
6.1 现象是“有的行取对了,有的行取错了”
之前接手过一个数据处理脚本,逻辑非常简单:把一个包含中文用户名的日志文件按列拆开,提取用户名字段。刚开始用的命令是:
bash复制cut -b18-30 info.log
原因是开发那边说,用户名从第18个字节开始,长度固定。跑了几次之后发现,有的行输出完全正确,有的行却出现乱码,还有的行整行错位,后续统计全乱。
我先是怀疑文件编码不统一,用file命令检查后发现文件是UTF-8没错。接着怀疑是不是有特殊不可见字符,于是抽了一行看字节。
6.2 用hexdump和awk字段数对比定位了根因
先看正常行和异常行:
bash复制sed -n '1p' info.log | hexdump -C | head -n 5
sed -n '2p' info.log | hexdump -C | head -n 5
比对之后发现问题很明显:第1行是纯ASCII开头的日志,第2行开头直接就是中文用户名。第2行的第18个字节落在了一个中文汉字的中间,所以不管怎样按字节切都会乱码。
真正导致“列偏移”的另一个原因是行首有制表符,不同行的前缀宽度不一样。我用awk打印了每一行的字段数量:
bash复制awk '{print NF, $0}' info.log | head
发现第1行是9个字段,第2行却只有7个字段。再配合cat -A查看行尾和制表符:
bash复制head -n 3 info.log | cat -A
能清楚看到行首缩进有的是空格、有的是^I(制表符)。因为cut是按固定字节切分的,遇到行首缩进不一样的情况,同一字段的起始字节自然就对不上,这才是提取结果错位的真正原因。
6.3 修复方案:先规整对齐,再决定用-c还是用-b
确认根因后,做了两步处理。
第一步,去掉行首所有空白前缀,只保留自己要的列。可以用sed剥掉行首空白:
bash复制sed 's/^[[:space:]]*//' info.log
第二步,不再用-b数中文字节,改成用字段分隔符切列。因为日志里是有明确分隔符的,比如用竖线或连续空格:
bash复制sed 's/^[[:space:]]*//' info.log | tr -s ' ' | cut -d' ' -f2
这样既避免了行首缩进导致的错位,也不用操心中文占几个字节,字段的语义比固定偏移清晰得多。如果实在要按固定宽度切,也会加一个前提:先用sed统一行
