1. 为什么要单独聊聊 cut:它到底解决什么问题
1.1 列提取是最常见的文本处理需求
Linux 下面处理文本,绕不开三件事:查找、替换、提取。查找有 grep,替换有 sed,而提取列这件事,大家第一反应往往是 awk。但 awk 功能太强,有时候反而“杀鸡用牛刀”。如果你只是想把 /etc/passwd 里每行的用户名取出来,或者把日志里第 2 列、第 3 列单独拎出来,cut 其实是最直接、最轻量的选择。
我最早接触 cut 是在看别人写的部署脚本时,发现有人用 cut -d: -f1 /etc/passwd 来循环遍历系统用户。当时第一反应是这命令怎么这么安静,不声不响就把列给切了。后来自己排查日志、写自动化脚本时,cut 的使用频率越来越高,因为它够简单、够快,而且行为非常可预期。
cut 能做什么?简单说就是按“分隔符”或者按“字符/字节位置”把每一行切开,然后输出你想要的那几段。它不会像 awk 那样帮你做模式匹配、计算、格式化输出,它就老老实实切列。这种“单一职责”恰恰是它在脚本里最受欢迎的原因:你不需要考虑额外的语法开销,写出来就是很干净的管道命令。
1.2 cut 和 awk、sed 的分工区别
很多新手容易把 cut、awk、sed 搞混,因为看起来都能处理“行里的某个部分”。我个人的理解方式是这样的:
- sed 擅长“行编辑”,核心是替换、删除、插入,方向是“改”。
- awk 擅长“结构化分析”,核心是字段、模式、计算,方向是“算”。
- cut 擅长“简单裁剪”,核心就是按分隔符或固定位置把列切出来,方向是“取”。
所以如果只是“取出某一列”,用 awk 当然也行,但 awk 的字段默认按空白切分,遇到多空格、tab 混排时行为需要额外调试;而 cut 的 -d 明确指定分隔符,不会有那么多“惊喜”。反过来,如果你需要对字段做累加、求最大值、按条件过滤后再输出,那 awk 才是对的选择,cut 这时候就不够用了。
这不是说谁比谁高级,而是不同工具对应不同场景。我用 cut 的时候特别多,但它从来不是唯一方案,关键是要知道每个工具的边界在哪儿。下面从语法开始把 cut 完整拆开讲一遍。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. cut 命令的基础语法与核心选项
2.1 命令语法和 -f、-d、-c、-b 的含义
cut 的基本语法是:
bash复制cut OPTION... [FILE]...
如果不给文件名,默认从标准输入读。这个设计让它天生适合放在管道中间。
常用选项就这几个:
| 选项 | 含义 | 典型用法 |
|---|---|---|
-f |
field,按字段提取,配合 -d 使用 |
cut -f1,3 file |
-d |
delimiter,指定字段分隔符 | cut -d: -f1 file |
-c |
character,按字符位置提取 | cut -c1-10 file |
-b |
byte,按字节位置提取 | cut -b1-5 file |
--complement |
反向选择,输出没被选中的部分 | cut -f1 --complement file |
--output-delimiter |
指定输出时使用的分隔符 | cut -d: -f1,3 --output-delimiter='-' file |
-f 和 -d 是一对搭档:-d 告诉 cut 用什么符号把一行拆成多列,-f 告诉它要哪些列。默认的 -d 是制表符 TAB。所以如果你直接运行 cut -f1 file,它按 tab 切列,而不是按空格切列。这个默认行为经常让人踩坑,后面会细说。
-c 和 -b 的区别在于单位:-c 按字符,-b 按字节。对纯 ASCII 文本来说二者看起来一样;但遇到中文这类多字节字符时就有说法了。在 UTF-8 环境下,一个汉字通常占 3 个字节,cut -c 按字符切是安全的,cut -b 按字节切可能会把一个汉字劈成两半,输出乱码。所以处理中文文本时优先考虑 -c。
2.2 范围写法规则:n、n-、n-m、-m 的差别
不管是 -f、-c 还是 -b,后面的列表都支持同一种范围语法。这个语法看着简单,但经常有人写错:
| 写法 | 含义 |
|---|---|
1 |
只取第 1 列/字符 |
1,3 |
取第 1 和第 3 列/字符 |
1-3 |
取第 1 到第 3 列/字符(闭区间) |
1- |
从第 1 列/字符到行尾 |
-3 |
从行首到第 3 列/字符,等价于 1-3 |
1-3,7- |
取 1~3 和 7 到行尾,逗号分隔多个范围 |
这里有一个特别容易理解错的地方:-3 不是“倒数第 3 列”,而是“1 到 3”。想表达“最后几列”时,cut 没有原生语法,比如不能写 -f-1 来取最后一列,因为 -1 会被解析成“从第 1 列开始到第 1 列”,而不是倒数第一列。真要取最后一列,要么先用 rev 反转行再取,要么直接用 awk。这个限制我后面会专门讲。
另外,范围写错时 cut 不会报错,而是默默按它的规则解析。比如 cut -f-1 file 实际输出的是每一行的第 1 列,如果你本意想取最后一列,那就会得到不符合预期的结果,而且整个过程没有任何提示。
2.3 其他实用选项:--complement、--output-delimiter
--complement 的作用是取反。比如你有一个 CSV 文件,想丢掉第 2 列,只保留其他列:
bash复制cut -d, -f2 --complement data.csv
这个等价于手动写出除了第 2 列以外的所有列号。列数少时手动写也行,但列多了以后,--complement 能省很多事。它唯一的注意点是:--complement 的反选范围仍然受列数量影响,比如你写 -f2- 再配合 --complement,输出的就是第 1 列。
--output-delimiter 则用来改变输出分隔符。默认情况下,cut 输出多列时,仍然用输入时的分隔符把它们拼起来。如果你在用 -d: 提取之后想把输出改成逗号,就得加这个参数:
bash复制cut -d: -f1,3 --output-delimiter=, /etc/passwd
这个选项在把文件重排、重新拼 CSV 时非常有用。你可以把 -f 的列表顺序打乱来实现列重排,比如:
bash复制cut -d, -f3,1 --output-delimiter=, data.csv
这条命令会把原 CSV 的第 3 列放到前面,第 1 列放到后面。注意,cut 输出列的顺序会按照你在 -f 里写的顺序来,而不是按照文件中的原始顺序。这个细节在新手阶段容易被忽略,实际在脚本里是个很好用的隐藏技能。
3. 实战:用 cut 提取文本列的典型场景
3.1 场景一:按分隔符提取字段(-d + -f)
最常见的用法就是按分隔符提取字段。比如我有一个用户信息文件 users.txt,格式如下:
text复制1001:zhangsan:ops:2024-01-15
1002:lisi:dev:2024-02-20
1003:wangwu:dev:2024-03-11
现在要提取所有用户名,也就是第 2 列:
bash复制cut -d: -f2 users.txt
输出:
text复制zhangsan
lisi
wangwu
如果还想同时取出用户 ID 和用户名,顺序还要反过来:
bash复制cut -d: -f2,1 users.txt
输出会变成:
text复制zhangsan:1001
lisi:1002
wangwu:1003
因为 -f2,1 里先写了 2 再写 1,所以输出顺序也变成了先第 2 列再第 1 列。这里就能看出 --output-delimiter 的价值:
bash复制cut -d: -f2,1 --output-delimiter=' | ' users.txt
输出:
text复制zhangsan | 1001
lisi | 1002
wangwu | 1003
这种“重排列 + 换分隔符”的能力,能让 cut 在拼报告、整理数据时省掉大量临时脚本。
3.2 场景二:按字符位置截取中文字符(-c)
有时候文件没有明确分隔符,列是固定宽度对齐的,或者你按位置取字符。比如有一段文本:
text复制ABCDEFG
1234567
取前 3 个字符:
bash复制echo 'ABCDEFG' | cut -c1-3
输出 ABC。这个很好理解。但中文环境下要小心:如果文件是 UTF-8 编码,一个汉字占 3 个字节,-b 按字节切会切乱,-c 按字符切则安全。
举个例子:
bash复制echo '你好世界' | cut -c1-2
输出是 你好,这是对的。但如果你用:
bash复制echo '你好世界' | cut -b1-2
输出会是第一个汉字的前两个字节,在终端里大概率显示为乱码。所以在处理中文日志、中文配置文件时,我基本只用 -c 而不用 -b,除非我非常确定当前文本是纯 ASCII。
还有一个更隐蔽的问题:-c 的“字符”计数在不同 locale 下可能表现不同。LANG=C 时,cut 可能把一个多字节字符当成多个字节处理,导致 -c 行为异常。所以当你发现 cut -c 在中文文本上表现不对时,先检查一下环境变量:
bash复制echo $LANG
如果是 C 或 POSIX,建议换成 en_US.UTF-8 或 zh_CN.UTF-8 再试。
3.3 场景三:固定宽度日志的有效列裁剪(-b / -c 混用)
系统日志或者旧的报表文件经常是固定宽度格式。比如下面这种:
text复制20240115 12:30:45 [INFO] user login success
20240115 12:31:02 [WARN] disk space low
20240115 12:31:45 [ERROR] connection timeout
如果我想只取前面的日期部分和后面的大写级别部分,可以先用字符位置取日期:
bash复制cut -c1-8 log.txt
输出:
text复制20240115
20240115
20240115
想同时取日期和第 19~23 个字符([INFO] 里的 INFO),可以这么写:
bash复制cut -c1-8,19-23 log.txt
输出:
text复制20240115INFO
20240115WARN
20240115ERROR
这里两个范围之间没有分隔符,所以输出直接拼在一起了。如果你想加个空格分隔,就加 --output-delimiter:
bash复制cut -c1-8,19-23 --output-delimiter=' ' log.txt
输出:
text复制20240115 INFO
20240115 WARN
20240115 ERROR
这种写法在分析老式固定宽度文件时非常实用。比如银行对账单、某些设备导出的配置文件,没有 CSV 那么规整,但列位置固定,用 cut -c 比用 awk 的正则拆分简单太多了。
3.4 场景四:在管道和循环中组合使用 cut
cut 的真实威力往往不是单独使用,而是放在管道里和其他命令搭配。举几个我日常经常用的组合。
从 ps 输出中提取 PID:
bash复制ps -ef | grep nginx | grep -v grep | awk '{print $2}'
这个很多教程都这么写。但如果你不想用 awk,也可以用 cut 配合 tr 处理连续空格:
bash复制ps -ef | grep nginx | grep -v grep | tr -s ' ' | cut -d' ' -f2
tr -s ' ' 把多个连续空格压缩成一个,这样 cut 按单空格分隔就能切正确。
从 URL 列表中提取域名:
bash复制cat urls.txt | cut -d/ -f3
如果每行都是 https://example.com/path 这种格式,取 -d/ -f3 就能把域名拎出来。注意如果 URL 里有 http://,-d/ -f3 也能正确取到域名,因为按 / 切分后第 3 段就是域名部分。
在 for 循环里遍历用户:
bash复制for user in $(cut -d: -f1 /etc/passwd); do
echo "checking $user"
done
这个写法在写批量运维脚本时很常见。但有一个细节要留意:如果用户名里包含空格(虽然 passwd 文件里一般不会),for 循环会拆错。更稳妥的写法是用 while read:
bash复制cut -d: -f1 /etc/passwd | while read user; do
echo "checking $user"
done
这两种循环方式在处理“行内有空格”的数据时,表现完全不一样。for 按空格拆分,while read 按行读取,后者更安全。
4. 容易踩的坑与排查技巧
4.1 坑一:分隔符是空格时为什么切不干净
前面提到 cut 默认按 tab 分隔。如果你直接对以空格分隔的文件执行 cut -f1,会发现输出的是整行,因为整行里根本没有 tab,cut 认为“只有一列”。
处理空格分隔的文件时,正确做法是先压缩连续空格,或者明确指定分隔符。但 cut -d' ' 只能按单个空格切,遇到多个连续空格时会切出空列。举个例子:
bash复制echo 'a b c' | cut -d' ' -f2
输出是空行,因为第 2 列是第一个空格后面的空字符串,b 在第 3 列。这和 awk 不同,awk 默认会把连续空格当成一个分隔符处理。
所以我的建议是:遇到空格对齐的文本,优先用 awk '{print $2}',或者先用 tr -s ' ' 压缩空格再交给 cut。不要硬跟连续空格较劲,那是浪费时间。
4.2 坑二:多字符分隔符没有直接的“按分隔符切割”选项
cut 的 -d 只支持单字符分隔符。如果文件里用 -> 或者 || 这种多字符分隔符,cut 就没办法直接处理。比如:
text复制apple->red->fruit
banana->yellow->fruit
想取第 2 列,cut -d'->' -f2 是无效的,因为 -d 后面不是简单的 - 或者 >。在这类场景下,两种替代方案比较稳:
一是先用 sed 把多字符分隔符替换成单字符:
bash复制sed 's/->/|/g' file.txt | cut -d'|' -f2
二是直接用 awk:
bash复制awk -F'->' '{print $2}' file.txt
我个人的习惯是,一旦分隔符超过一个字符,就默认换 awk,不再纠结能不能用 cut 搞定。工具选型要顺势而为,不要逆着工具的特性硬写。
4.3 坑三:范围写错导致输出为空或整行输出
范围语法看着简单,但实际出错率不低。比如你写:
bash复制cut -f2-1 file
本意可能是“从第 2 列到第 1 列”?但 cut 的解析规则是:起始位置大于结束位置时,不会报错,而是输出空。因为它认为这个区间不存在。这类错误最坑的地方在于“静默失败”,没有报错、没有 warning,就是空输出。
反过来,如果你写 cut -f2 file 但文件只有 1 列,cut 也不会报错,而是输出整行?不对,这里要精确一点:如果 -f2 指定的列不存在,cut 默认什么都不输出。如果写 cut -f1 file 而文件只有 1 列,那输出整行。如果指定了 --only-delimited 这个隐藏的 GNU 参数,空行会不做处理,而非 GNU 版本不一定有。日常使用不用太纠结这个参数,但要知道列号取不到时,cut 不会给你“提示”。
排查这类问题的方法很简单:先用 cut -f1-10 之类的宽范围打印部分内容,确认到底有几列、分隔符长什么样。
4.4 坑四:文件没有换行符时 cut 的表现
cut 按行处理,遇到没有末尾换行符的文件,GNU cut 会正常处理,但某些平台上的实现可能表现不一致。比如:
bash复制printf 'a:b:c' | cut -d: -f2
GNU 环境会输出 b,但如果是某些最小化环境或 busybox 环境,行为可能有细微差异。这个问题在写嵌入式设备或者容器里的脚本时容易碰到。稳妥起见,如果数据源可能没有结尾换行符,可以先 echo 补一个:
bash复制printf 'a:b:c\n' | cut -d: -f2
这种“补换行”的习惯能避免很多跨平台兼容问题,尤其在剪贴板、变量拼接出来的字符串上做 cut 时。
4.5 坑五:cut -c 与中文编码的冲突
前面讲 -c 时提过 locale 的问题。这里再展开说一个我踩过的坑:在 LANG=C 环境下,cut -c1 对中文文本会把一个汉字的第一个字节当作一个字符输出,导致乱码。
比如:
bash复制echo '你好' | LANG=C cut -c1
输出是乱码,因为 -c 在这种 locale 下退化成按字节切。而:
bash复制echo '你好' | LANG=en_US.UTF-8 cut -c1
输出的是 你。
所以脚本里如果涉及中文文本,最好显式设置 UTF-8 locale,或者在脚本开头 export LC_ALL=en_US.UTF-8。不要默认环境一定没问题,生产环境里的 locale 配置五花八门,显式指定最保险。
5. cut 与 awk、sed 的选型建议(外加几个实用搭配)
5.1 什么场景该用 cut,什么场景该换 awk
虽然我文章开头夸了 cut 好用,但必须承认它有不少边界。整理一下我的选型原则:
| 场景 | 推荐工具 | 原因 |
|---|---|---|
| 按单字符分隔符取列 | cut | 语法简单,性能好 |
| 按多字符分隔符取列 | awk | cut 不支持多字符分隔符 |
| 按固定字符位置取列 | cut -c | 最直观 |
| 按固定字节位置取列 | cut -b | 适合处理二进制固定帧头 |
| 取“最后一列” | awk | cut 不支持负数索引 |
| 需要做条件过滤、统计 | awk | cut 只是裁剪工具 |
| 需要替换、删除整行内容 | sed | 行编辑专用 |
| 压缩连续空格再取列 | cut + tr | 组合使用也很快 |
如果你只是要在脚本里快速取一个字段,cut 是最优选择,因为它没有多余的计算逻辑,命令本身的开销极小。对大规模文本(几 GB 级别的日志)来说,cut 的性能优势和内存占用优势是实打实的。
5.2 实用搭配:cut + sort、cut + uniq、cut + paste
cut 单独用的场景很多,但和别的命令搭配起来效率更高。我分享几个自己常用的管道组合。
从日志里提取状态码并统计数量:
bash复制grep 'api/login' access.log | cut -d' ' -f9 | sort | uniq -c
这条命令把访问日志中每个请求的状态码取出来,排序后用 uniq -c 统计次数。如果 status code 在第 9 列,这个组合非常快。
从 CSV 中提取某列并去重:
bash复制cut -d, -f2 data.csv | sort -u
用 paste 把多个 cut 结果并成多列输出:
bash复制paste <(cut -d, -f1 data.csv) <(cut -d, -f3 data.csv)
这个写法其实等价于用 cut -f1,3 加 --output-delimiter,好处是你可以分别对两列做不同的处理,再合并。比如第一列转大写,第二列做截断,然后拼回去。
还有一个比较容易忽略的场景:cut 和 grep -v 一起做数据清洗。比如丢弃注释行:
bash复制grep -v '^#' config.ini | cut -d= -f2
这条命令把所有 # 开头的注释过滤掉,再把配置项的值取出来,很适合在部署脚本里动态读取配置。
5.3 进阶技巧:用 cut 做列重排和补列
前面已经提到,-f 的顺序决定输出列的顺序,所以可以拿 cut 做简单的列重排。比如把 CSV 从 id,name,score 重排成 score,name,id:
bash复制cut -d, -f3,2,1 --output-delimiter=, data.csv
注意 --output-delimiter 在 GNU cut 里是标准选项,但在 macOS 自带的 BSD cut 上可能不支持。跨平台写脚本时,要么检查版本,要么用 tr 把分隔符替换回去:
bash复制cut -d, -f3,2,1 data.csv | tr ',' ' '
不过用 tr 替换有个问题:如果数据本身的字段里也包含逗号,会连数据里的逗号一起替换。这种事在 CSV 解析里很常见,遇到带引号的 CSV 字段时,cut 基本处理不了,那就该上 Python 的 csv 模块或者 awk 的复杂模式了。cut 的优势是简单,不要滥用它去做复杂解析。
6. 最后再说一个工作中的实用细节
前面把语法和实战场景都过了一遍,最后分享一个我最近在脚本里用到的细节:用 cut 加变量处理时,一定要记住它默认输出带换行符,但如果你把结果赋值给 shell 变量,尾部换行符会被自动去掉。这个特性在处理多行提取时反而省事,但如果你需要保留行结构,记得别直接丢进变量里。
比如:
bash复制result=$(cut -d: -f1 /etc/passwd)
echo "$result"
这样取到的 result 是多行字符串,放进双引号里输出时能保留换行。但如果你不加引号:
bash复制echo $result
shell 会把所有换行符替换成空格,输出变成一行。这个问题和 cut 本身没关系,但几乎每个写脚本的人都会遇到一次。我自己的习惯是:凡是把命令输出赋给变量的场景,输出时一律加双引号,除非你有意要空格换行。
最后还有一个小技巧:如果你在调试 cut 的结果对不对,可以在前面加 xxd 看可见字符和不可见字符。比如怀疑分隔符是不是 tab:
bash复制echo -e 'a\tb\tc' | xxd | head
这样能直观地看到制表符 09 的位置,确认 cut 的 -d 参数没写错。调试文本处理问题,先看原始字节,比在终端里肉眼猜要高效得多。
cut 这个命令看着简单,真正用熟之后能帮你省下不少临时脚本的功夫。先从日常命令入手多试几次,慢慢就能找到“什么时候该用 cut,什么时候该换工具”的感觉了。
