在Linux下解压tar包,尤其是从网上下载的几十GB源码包或部署包时,最让人崩溃的往往不是解压本身慢,而是辛苦下载完成后执行tar -zxvf,屏幕上却弹出一堆看不懂的英文错误,什么not in gzip format、Unexpected EOF in archive、No space left on device……第一反应都是“文件损坏”或“文件不完整”。但说实话,我在服务器上排查过无数次这类问题,真正属于“文件字节损坏”的情况反而没有想象中多,更多时候是下载流程、磁盘空间、打包习惯这些外围环节出了问题。这篇文章把我在各种环境里踩过的坑、用过的诊断命令、以及能救回多少算多少的恢复技巧一次性写清楚,适合刚接触Linux的运维新手,也适合被某个坏包卡过一晚上的老手。
1. 为什么Linux下的tar解压报错常常被误判为"文件损坏"
1.1 tar格式本身是“顺序拼文件”,一旦错位就会连锁崩溃
很多人对tar的第一印象是“压缩包”,其实tar的原始设计根本不是压缩,它最早就是Unix里用来把一堆文件塞进磁带归档的工具。tar包的本质是一个接一个的512字节数据块:每个文件前面有一个512字节的文件头,里面记录文件名、权限、属主、文件大小等信息,后面紧接着的是文件内容,也同样按512字节切块,文件大小不足512字节的部分用零补齐。
这种“磁带归档”格式最大的特点是没有全局索引。也就是说,tar解压时只能从头往后顺序读,读到文件头才知道下一个文件是谁。如果你要解压第100个文件,tar也得先把前99个文件的数据块跳过。正因为这种纯顺序结构,哪怕文件中间只有一个字节被改坏,tar也可能在读完当前文件头之后,把错位的字节当成下一个“文件头”去解析,从那里开始所有文件名、大小、偏移量全部错乱,最终表现为一连串的Cannot open、Checksum error之类的报错。
GNU tar对文件头有一个校验机制:文件头的checksum字段是头块前512字节的计算结果。只要文件头损坏,tar立刻能发现并报tar: Skipping to next header或者Checksum error。但麻烦的是,如果损坏位置发生在文件内容的中间而不是文件头,tar在多数情况下是感知不到的,它只知道按文件头里记录的大小把内容块读完,内容里的错位要到下一个文件头校验时才会暴露。这也是为什么很多tar包损坏场景下,前面几个文件能正常解出来,后面才突然开始报错。
1.2 “损坏”和“不完整”是两类问题,处理思路完全不同
我在排查问题时,第一件事永远是搞清楚:这个包到底是损了,还是短了。
“损坏”指的是文件字节数没变,但某些bit被改写了。可能原因包括:网络传输时底层数据出错、内存/磁盘产生bit flip、从某个不靠谱的分区复制文件时出现坏道,或是在传输过程中用了文本模式导致二进制内容被改写。这类问题最麻烦,因为文件从大小上看完全正常,ls -l也看不出异常,只有校验和或解压过程才能暴露。
“不完整”则是指文件被截断了,字节数比原始文件少。最常见的原因是下载中断、磁盘写满、服务端生成tar包时源目录正在写入导致内容异常,或者scp/sftp传输时会话被掐断。这类问题相对好定位,因为文件大小往往和官网预期大小对不上,gzip -t会直接报unexpected end of file,tar层会报Unexpected EOF in archive。
把这两类问题分开,后续的恢复策略完全不同:损坏的包,基本只能用容错工具尽量扫出前面的文件;不完整的包,如果截断位置靠后,抢救出90%以上数据是完全可行的。后面第4章会专门讲这两类场景的恢复命令。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 先看懂这些典型报错:直接告诉你问题出在哪一层
2.1 gzip: stdin: not in gzip format——下载到的是“假”压缩包
这条报错大概是所有tar解压错误里最误导人的。表面上看是“gzip格式不对”,但实际原因绝大多数不是文件损坏,而是你下载到的根本不是那个压缩包。
我做运维这几年,在好几台新服务器上遇到过这种情况:从官网某个下载页复制链接,用wget拉下来一个.tar.gz文件,一解压就提示gzip: stdin: not in gzip format。用file一看,结果输出的是HTML document text。说白了,这个URL在无浏览器环境里返回的是一个404页面,或者一个带跳转逻辑的HTML提示页,只是文件名后缀刚好叫.tar.gz。可能是下载工具没有跟随跳转,也可能是CDN回源失败返回了错误页。
这种情况和“文件损坏”半毛钱关系都没有,处理方式就是换个正确的下载地址,或者用curl -L跟随重定向下载。wget默认也会跟随重定向,但如果服务器返回的是带Refresh头或JavaScript跳转的HTML,wget不会去执行,最后存下来的就是那个HTML文件。
另外还有一种历史遗留场景:通过FTP下载时,客户端把传输模式设成了ASCII,而tar.gz是二进制文件,在Windows到Unix之间经过换行符转换后,整个压缩包结构会被改得面目全非,解压时同样报not in gzip format。现在大多数人已经不用FTP了,但如果还是在用的话,务必检查传输模式,二进制文件必须用binary/image模式。
2.2 Unexpected EOF in archive——文件确实被截断了
这条报错是“不完整”最典型的信号。当tar包在解压过程中突然遇到文件结束,而它期望的是一段数据块时,GNU tar就会报Unexpected EOF in archive。这个错误可能出现在两个层级:
第一层,gzip压缩文件本身被截断。这种情况下你先看到的是gzip: stdin: unexpected end of file,紧跟着可能是tar: Child returned status 1。这说明.tar.gz文件在网络上传输时缺了尾部,压缩流还没走到正常的CRC校验结束位就断了。
第二层,gzip能正常解压,但解出来的tar流不完整。这多半是打包阶段出了问题,比如有人执行tar -czf的时候,源目录里的文件正被别的进程写入,tar读到某个文件时发现“内容比文件头记录的大小少”,它只能把已经读到的部分写进包,最后生成的tar归档本身就是残缺的。gzip层看起来是完整的,因为它压缩的是那个残缺tar流。
遇到Unexpected EOF,先用ls -l看文件大小,再和源站标注的Content-Length比一下。如果相差几KB或几十MB,基本可以断定是下载中断导致的截断。重新下载,或者用断点续传补全(第5章会讲),比在原文件上折腾划算得多。
2.3 Error writing to / No space left on device——磁盘不够不是包的问题
这个场景我在生产环境遇到过不止一次:明明包是好的,gzip -t也通过,解压了一半却报tar: test.log: Cannot write: No space left on device。很多人看到这个报错会以为tar包坏了,其实只是目标磁盘满了。
有个容易被忽略的细节:tar解压时是先把文件写到临时位置再替换,还是直接写目标路径,取决于tar版本和文件系统中的行为。但无论如何,磁盘满导致的报错通常会在写入具体文件时体现,而且tar会告诉你写的是哪个文件。这时候别去研究包,马上执行df -h看看目标挂载点的可用空间。
更要命的是,磁盘写满时tar可能已经写入了部分文件,但没写完整。解压中断后再看目标目录,你会看到一堆只有几KB或几十KB的残缺文件。排查时这些文件不要立即删,先确认哪些文件完整、哪些是半截,恢复工具也许还能救回一部分。
2.4 权限相关报错和乱码问题:看似损坏,实则是环境不匹配
“损坏”这个词用得多了,导致很多人把一些环境差异问题也归类到损坏里。最常见的两个:
第一个是tar: xxx: Cannot open: Permission denied。这通常不是文件损坏,而是解压时没有足够权限。tar在解包时会尝试还原文件头里记录的权限和属主,如果当前用户不是root,某些需要属主为root的文件会被拒绝写入。加上--no-same-owner选项可以跳过属主还原,按当前用户身份创建文件。另外,解压到只有可读权限的目录时,同样会报Permission denied。
第二个是“tar文件解压后乱码”。我见过很多Windows上打好的tar包,拿到Linux下一解压,中文文件名全成了乱码。这不代表压缩包损坏,而是文件名编码不一致:Windows常用GBK/GB18030编码,Linux默认UTF-8。tar包的文件名只是纯粹的字节序列,没有声明编码,解压时自然按原字节原样落盘。解决办法不是换一个解压工具,而是解压后用convmv批量转换文件名编码,例如:
bash复制convmv -f GBK -t UTF-8 -r --notest 解压后的目录/
这类“看似损坏”的情况,如果一开始就误入诊断死胡同,会把大量时间浪费在错误的恢复方向上。
3. 诊断实操:用file、gzip -t、tar自身把问题定位到具体环节
3.1 用file命令确认文件真实身份
拿到任何一个可疑包,第一件事不是解压,而是用file看它到底是什么:
bash复制file something.tar.gz
下面这个场景我反复遇到过很多次:某个部署包解压不了,file结果却显示ASCII text或HTML document,说明用户下载到一个假文件。系统能告诉你真实格式,就省去了后面所有对压缩层的猜测。
如果file输出是gzip compressed data, was "something.tar",说明文件确实是gzip压缩的tar归档,压缩层没问题。但要注意,file只看文件头部,并不能判断文件是否完整。一个被截断的gzip文件,只要头部完好,file照样能识别成gzip compressed data。所以file的用途是排除“假文件”和“格式不匹配”,完整性的判断还得靠后面的校验命令。
实际上,另一个容易被忽略的逻辑是:有些包根本不需要解压,你用tar -zxvf去解一个用tar -cjf打包的文件,就可能遇到unrecognized archive format之类的报错。这类问题的根源是压缩格式参数写错,而不是文件损坏。说到底,file命令在这个场景下能快速告诉你:这是一个什么压缩格式、是否值得继续抢救。
3.2 gzip -t:压缩层完整的唯一可靠测试
对于.tar.gz文件,先用gzip自带测试选项验证压缩流完整性:
bash复制gzip -t something.tar.gz
- 如果输出
gzip: something.tar.gz: unexpected end of file,说明压缩文件被截断,属于“不完整”。 - 如果输出
gzip: something.tar.gz: invalid compressed data--crc error,说明文件末尾的CRC32校验失败,这是典型的“内容损坏”,即某些字节在传输或存储中被改写了。 - 如果没有任何输出,退出码为0,说明压缩流本身是完整的,问题可能出在更深层的tar结构上。
gzip -t的原理是完整执行一次解压运算,并在数据流结束时比对CRC32校验码。CRC32是gzip自带的完整性检查,能抓住绝大多数数据损坏。但有个前提:它只能验证从文件头到正常结束标记之间的数据,如果文件被人为截断在某个位置,gzip -t会报unexpected end of file,这个信息直接告诉我们“文件不完整”。
这里多说一句:很多人都知道解压前跑gzip -t,但它对一个已损坏到无法解压的包来说,是一次代价不小的I/O操作。几十GB的文件跑一次要几分钟,如果在生产环境批量处理大量包,建议优先用ls -l比对文件大小,大小对得上再跑gzip -t。
3.3 tar -tvf只列出不解压,快速判断损坏影响范围
如果压缩层完整,或者遇到的是未压缩的.tar文件,下一步用tar -tvf去列出归档内容:
bash复制tar -tvf something.tar.gz
tar -tvf something.tar
-t表示只列出文件名,不执行真正的解压写入。这个命令最大的价值是:它能第一时间告诉你“损坏点大概在哪个文件附近”。GNU tar在读归档时是顺序扫描的,一旦遇到损坏,它通常会在报错前输出已经成功读取的文件名。例如:
text复制tar: something.tar.gz: Cannot open: No such file or directory
tar: Error is not recoverable: exiting now
如果前面已经列出了一串文件名,那至少说明这些文件的数据块是完整的,后续恢复可以从这里入手。需要留神的是,tar -tvf只读取文件头和目录项,并不会真正校验文件内容的每一个字节。换句话讲,即使文件内容损坏了,只要文件头没问题,tar -tvf也可能“正常列出”,所以-t是一个初筛手段,不是最终判定。真正要检查内容的时候,我会先gzip -dc解开后再跑tar --ignore-zeros -tvf,或者直接解压到临时目录,用文件系统层面的校验工具去验证。
3.4 没有校验值时,用文件大小先做初判
file和gzip -t都不能告诉你“这个包原本应该多大”,所以任何一次下载,都要尽量保留源站声明的Content-Length。如果你是从命令行下载的,可以用curl -I提前看响应头:
bash复制curl -sI -L https://example.com/package.tar.gz | grep -i content-length
下载完成后:
bash复制ls -l package.tar.gz
两个数字对不上,基本就是传输中断或服务端返回内容不一致。如果服务端本身没有提供可靠的Content-Length(比如某些动态生成文件的接口),那就只能靠官方网站发布的SHA256摘要来校验了。这也是我强烈建议“任何重要包下载后都顺手算一下sha256sum”的原因。没有校验值、没有大小预期,仅凭解压报错来猜“文件是不是坏了”,几乎等同于盲人摸象。
3.5 从崩溃点入手:把报错信息当日志看
GNU tar和gzip的报错信息虽然难看,但信息量其实不小,学会读报错,能少走很多弯路。我总结了一个最简单的对照表:
| 报错信息 | 问题层次 | 首要怀疑方向 |
|---|---|---|
gzip: stdin: not in gzip format |
压缩层 | 下载到非压缩文件、格式未匹配、假文件 |
gzip: stdin: unexpected end of file |
压缩层 | 压缩文件被截断、下载不完整 |
gzip: stdin: invalid compressed data--crc error |
压缩层 | 内容损坏、传输/存储出现bit错误 |
unrecognized archive format |
tar层 | 压缩格式参数选错,例如对bz2包用了-z |
Unexpected EOF in archive |
tar层 | tar归档不完整、gzip层正常但内容截断 |
A lone zero block |
tar层 | 归档末尾异常,通常可忽略或属于非致命问题 |
Cannot open: Permission denied |
权限层 | 目标目录/进程权限不足,与包是否损坏无关 |
Cannot write: No space left on device |
磁盘层 | 目标磁盘空间不足,与包是否损坏无关 |
把报错归入对应层级后,再决定下一步是重新下载、更换工具还是数据抢救。不要看到tar:开头就断定“包坏了”,这个前缀只是说明报错来自tar程序,并不代表根因在tar包里。
4. 补救路径:从最坏的文件里抢救出最好的数据
4.1 基本原则:先复制、再操作,别在原文件上多次折腾
拿到一个坏包,新手最容易犯的错就是反复在原文件上跑不同解压命令:tar -xvf不行,换tar -xzvf;不行,又换tar -xzf;再不行,又用bsdtar。每一次尝试都会增加原文件的读取负担,而且一旦某个工具“好心”地尝试修复并部分写入,原文件的后续救援会变得更复杂。
我的习惯是先做一份完整副本:
bash复制cp package.tar.gz package.tar.gz.bak
所有抢救操作都在package.tar.gz.bak上执行。这样即使某个激进工具把文件改得面目全非,原始文件还在,随时可以重新尝试其他恢复方法。这个习惯救过我一次:一个嵌入式项目的固件包被某个恢复软件改了一点,导致后续整个解压流程彻底失效,还好有个原始副本,我才能用更温和的方式抢救。
4.2 gzip解压层崩溃时,先分离压缩与归档恢复
压缩层和归档层是两层结构,这个认知在抢救数据时至关重要。file.tar.gz本质上是file.tar的压缩产物,用gzip把tar流压缩成了单一数据流。所以如果gzip层报unexpected end of file,我们依然有可能把前面已经成功解压的那部分tar流单独落盘:
bash复制gzip -dc package.tar.gz > package.tar 2>/dev/null
这条命令会把能解压的部分尽量解出来,写到package.tar,压缩文件损坏部分的报错被重定向到/dev/null。得到的是一个可能被截断的tar文件。接下来用容错参数提取:
bash复制tar --ignore-zeros -xvf package.tar
--ignore-zeros的作用是:让tar在读取归档时,遇到全零块不再把它当作“归档结束”信号,而是跳过并继续向后读取。正常情况下tar归档结束时有两个全零块,但如果归档被截断,可能没有结束块,也可能在截断位置之前出现过零填充区域,tar会误以为已经解压完毕。--ignore-zeros能容忍这种“提前出现的零块”,尽可能把零块后面的文件继续解出来。
需要说明的是,gzip -dc在解压过程中如果发现CRC错误,它会退出但不影响已经输出到package.tar的内容。也就是说,哪怕压缩层在最后损坏,前面数据仍然完整地进入了tar层。这个“先解压、后抢救”的两步法是我处理截断gz包时使用最多的招数。
4.3 bsdtar对坏包的容忍度比GNU tar高
GNU tar是Linux环境下的默认实现,但它在遇到损坏文件时的策略比较“死板”——遇到checksum错误或结构异常就立即退出。相比之下,bsdtar(基于libarchive库)在读取损坏归档时的容错性明显更强,能跳过一些GNU tar直接放弃的损坏区域。这不算bug,而是两个项目对错误处理的哲学不同:GNU tar更强调“宁缺毋滥”,担心继续解析会把错误扩散;bsdtar更倾向于尽量把能恢复的内容交付给用户。
安装:
bash复制# Debian/Ubuntu
sudo apt install libarchive-tools
# RHEL/CentOS
sudo dnf install bsdtar
用法和tar类似,而且bsdtar能自动识别压缩格式,不需要手动指定-z、-j等参数:
bash复制bsdtar -xvf package.tar.gz
我的经验是:如果GNU tar在某个文件上报Checksum error,别急着放弃,用bsdtar试试,有时候能得到完全不同的结果。但同样要提醒:bsdtar能恢复的前提是损坏区域之后的文件头仍然完整可解析,如果损坏发生在中间,后面的文件被错位覆盖,那么越往后恢复出来的文件越不靠谱。所以bsdtar解压出来的文件,最好逐个用内容特征或校验值验证一下,别无条件信任。
4.4 未压缩tar包被截断:用dd把文件“切”到最后一个完整数据块
如果遇到的是没有gzip压缩的.tar文件(或者通过4.2已经剥离出的package.tar),并且确认只是尾部截断,有概率可以用dd手动截取到最后一个完好的数据块。tar的块大小是512字节,所以恢复思路是:把文件截断到某一个块边界,让tar能顺利读到某个文件的结束位置。
先列出能看到哪些文件:
bash复制tar -tvf package.tar 2>&1 | tail -n 20
tar -tvf在遇到Unexpected EOF之前会输出一批文件名。假设最后一个能正常显示的文件是app/config.yml,那么这个文件在归档内的偏移位置大致可以通过前面所有文件的块数推算出来——但这套计算很繁琐。更实用的是借助tar自身的报错来定位:如果tar在读取app/config.yml时成功列出了它,说明它的文件头已经完整读到,数据块很可能也完整,只是后面紧接着的下一个文件头或结束块缺失了。
接下来用dd按块大小截断,先截到最后一个文件头之前的大致位置,再用--ignore-zeros解压:
bash复制# 假设用 ls -l 看到文件是 123456 字节,块数=123456/512=241
dd if=package.tar of=package_cut.tar bs=512 count=241
tar --ignore-zeros -xvf package_cut.tar
如果报错仍存在,尝试把count减小几个块(比如240、239),反复试探。这个过程比较“手工”,但经常能把最后一个完整文件的数据块抢救出来。有几点要注意:只适用于未压缩的tar流;不能用dd对一个gzip压缩文件按512块切,gzip层的数据块和tar层不是一个概念;如果文件有多个损坏点,这套方法会失效。
4.5 仅需部分文件时,只提取损坏点之前的内容
很多时候我们并不需要解压整个包,只是想从里面找回某个特定的配置文件或日志。如果损坏点之前还有多个文件,完全没必要让tar扫到最后的崩溃位置。
我通常先看tar -tf能列出多少文件,确认目标文件在列出的列表里,然后用精确的文件名提取:
bash复制tar --ignore-zeros -xvf package.tar 目标文件的完整路径
注意:即使只提取一个文件,tar仍然要从头扫描。所以如果目标文件位于损坏点之后,tar可能还没扫到它就报错了。这种情况下,先通过4.4的dd截断法把归档收缩到损坏点附近,再尝试提取损坏点之前的文件。
如果目标文件本身就在损坏点之后,那几乎只能将数据交给strings这样的工具做最后的文本抽取。比如包里是文本配置文件,可以用:
bash复制strings package.tar.gz | grep -A 10 "某个配置项的关键字"
这算不上“解压”,但能拿到肉眼可读的关键内容。对于源码包中的代码文件,strings同样有机会抽出部分字符串。这个方法只适用于文本类文件,二进制文件抽出来也没有意义。
5. 从源头避免:把“解压报错”扼杀在下载、传输和打包阶段
5.1 下载时用断点续传而不是反复重下
如果经常需要下载大体积tar包,wget和curl的断点续传应该是肌肉记忆级别的操作。
wget自带的-c参数就是断点续传:
bash复制wget -c https://example.com/package.tar.gz
curl用-C -指定从断点继续:
bash复制curl -L -C - -o package.tar.gz https://example.com/package.tar.gz
这里-C -表示自动从本地已有文件的大小处继续下载,不需要手动指定偏移量。两个工具在服务端不支持断点续传时都会报错,但绝大多数HTTP服务器都支持Range请求头,所以遇到传输中断,直接重跑续传命令通常就能补齐文件。
有个细节值得注意:续传之后务必重新比对Content-Length和本地文件大小。有些CDN在响应Range请求时返回的Content-Range可能和你预期不符,甚至直接返回200表示整个文件重新传输,这时候-c会把文件末尾追加一段重复数据,导致解压报错。
5.2 rsync比scp更适合跨机器传大压缩包
运维场景里,把压缩包从一台机器传到另一台机器,很多人第一反应是scp。但scp这工具一旦中断,对不起,整个文件全部作废,只能从头再传。传输几十GB的tar包时,这几乎是灾难性的。
rsync对断点续传和校验的支持好得多,这也是我强烈建议用它的原因。一个典型的传输命令:
bash复制rsync -avP --partial --append-verify user@remote:/path/to/package.tar.gz .
逐个解释参数:
-a:归档模式,保留权限、时间戳等属性。-v:输出详细信息。-P:等价于--partial --progress,显示传输进度,并保留传输中断时已下载的部分。--partial:即使中断,不在传输结束时删除临时文件。--append-verify:如果远程和本地都存在同名文件,会先追加传输缺失的部分,再对追加后的文件做完整校验,确保追加没有产生数据错位。
把这一步养成习惯之后,我再也没因为跨机传输中断而重新下过几十GB的包。此外,如果双方都是Linux,rsync天然支持通过SSH隧道加密,安全性足够满足绝大多数生产环境。
5.3 打包阶段的坑:源文件变化导致tar包自身“带病出身”
很多“解压损坏”的根因,不在下载和传输,而是源头打包时就生成了一个坏归档。
最经典的场景是:某台服务器上跑着定时任务,往一个目录里持续写日志,然后另有一个备份脚本对整个目录做tar -czf。tar在读取某个文件时,文件还在被进程写入,tar会在输出中打印类似file changed as we read it的警告。这种情况下,tar虽然能继续执行,但最终包内这个文件的内容可能只有打包瞬间的“快照”,和其他数据块组合起来就是不一致的归档。更糟的是,如果文件尺寸在tar读取后变了,tar写入的填充块数量和文件头记录的大小对不上,后面所有文件的位置偏移量都会出问题,解压时自然会出现损坏或EOF类错误。
我在备份脚本里通常这样做:
- 先同步一份快照目录,再在快照目录上打包,保证源目录在打包期间不发生变更。
- 如果实在无法做快照,就加上
--warning=no-file-changed,把警告压掉,但做好“这个包可能有问题”的心理准备。 - 打包完成后立刻执行
sha256sum,把校验值保存下来,作为发布或备份的完整性凭证。
一个实用的打包命令示例:
bash复制tar --exclude='*.log' --exclude='cache/' -czf app_$(date +%F).tar.gz /path/to/app
--exclude算是热词里被问得很多的一个选项,用--exclude能过滤掉不需要进包的日志和缓存目录,既减小包体积,也减少打包过程中日志文件还在被写入带来的风险。在生产环境的备份任务里,这是一个性价比极高的预防措施。
5.4 建立一条安全的处理链:先看类型、再查校验、最后解压
这几年的运维经验让我养成了一个固定的处理链,所有下载的压缩包都按这个流程走,几乎没有再被“解压报错”坑过:
bash复制file package.tar.gz
sha256sum package.tar.gz
gzip -t package.tar.gz
tar -tvf package.tar.gz
四个命令依次完成:确认文件格式、比对官方校验值、验证压缩流完整性、预览归档内容。全部通过之后才真正解压。如果其中任何一步失败,先根据报错类型定位到具体层级,再决定是重新下载、切换工具还是进入抢救流程。
对于经常处理大量安装包的人,把这段写成一个shell函数放进~/.bashrc会方便很多:
bash复制check_tar() {
echo "[1/4] file"
file "$1"
echo "[2/4] sha256sum"
sha256sum "$1"
echo "[3/4] gzip test"
gzip -t "$1"
echo "[4/4] tar list"
tar -tvf "$1"
}
以后拿到任何.tar.gz文件,直接执行check_tar package.tar.gz,就能在解压前完成大部分质量校验。如果文件是.tar.bz2或.tar.xz,把第三步改成bzip2 -t或xz -t即可,逻辑完全一样。
最后分享一个我个人的习惯:遇到损坏或截断的包,先别急着删,把副本留着,等彻底解压完再清理。有一次我从一个截断的gzip包里用gzip -dc救回了一个几乎完整的数据库导出文件,仅仅是因为没有在一开始的失败后直接把原始文件删掉。那些看起来“废了”的包,往往只是藏在某个字节之后的数据还没被足够多工具尝试过。这个工作流,帮我省下的不光是时间,还有很多个原本会加班的深夜。
