1. 先说结论:固态硬盘的“坏块”和机械硬盘根本不是一回事
拿到“电脑固态硬盘怎么检查是否损坏”这个问题,我先说一个最容易被带偏的误区:很多人习惯用检查机械硬盘的思路去检查固态硬盘,比如用扫坏道的软件哗啦哗啦全盘扫一遍,看到一个红点就紧张到睡不着。这个思路不能说完全没用,但对于固态硬盘来说,效率和准确率都非常低,甚至会误判。
固态硬盘的存储介质是NAND闪存,靠浮栅晶体管里的电子数量来保存数据,没有机械结构,不存在磁头划伤盘片、盘片出现物理坏道这类故障。所谓“坏块”,本质上是闪存里某些存储单元(Block/Page)已经无法可靠地保持电荷,导致读写数据时出现校验错误。这个数量会随着寿命消耗、擦写次数增加而缓慢上升,和机械硬盘那种“突然出现一片坏道”的故障模式完全不一样。
所以检查固态硬盘的健康状况,核心思路应该是两条线并行:一条是看主控和固件自己记录的SMART健康信息,这是硬盘自己的“体检报告”;另一条才是真正去读写数据验证是否有失效块。这篇文章我会把这两条线都讲透,包括用什么工具、看什么指标、多少数值算危险、以及SMART信息都读不到时还能怎么办。内容主要针对SATA固态和NVMe固态,Windows系统为主,Linux和macOS的基本原理一样,只是工具不同。
不管你是台式机用户、笔记本用户,还是帮同事朋友排查故障的半个运维,这篇内容都可以直接对照着操作。整个过程不需要拆机,不需要命令行基础,软件全部免费。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 第一步:用SMART信息给固态硬盘做“体检”
2.1 怎么看SMART:免费工具与Windows自带命令
SMART全称是Self-Monitoring, Analysis and Reporting Technology,自监测、分析和报告技术。固态硬盘的主控在运行时会持续记录一堆内部计数器和健康状态数据,这些数据不是给人直接看的原始寄存器,而是按照ATA/NVMe协议组织成标准化的SMART属性表。你要做的第一步,就是把这份“体检报告”读出来。
Windows下最简单的读取方式是用管理员身份打开命令提示符或PowerShell,输入:
powershell复制Get-PhysicalDisk | Get-StorageReliabilityCounter
这条命令可以直接显示每块物理磁盘的温升、读写错误、重映射扇区等基本信息。但说实话,这个输出太简略了,我只把它当快速确认硬盘能被系统识别的手段,真正的详细诊断还是要用图形化工具。
我长期在用的免费工具是CrystalDiskInfo(简称CDI)。它体积小、绿色免安装、界面直观,能直接读取SATA和NVMe固态的SMART信息,还带一个健康状态百分比。打开软件后,上方会列出所有物理硬盘,中间是SMART属性表格,每一项有当前值、最差值、阈值和原始值。
注意:CrystalDiskInfo显示“健康状态:良好”并不代表硬盘完全没问题。它的判断依据主要是几个关键属性的当前值是否低于阈值,对于某些早期故障,比如0E错误计数异常增长,健康状态可能仍然是“良好”,所以不能只看百分比,必须自己学会看那几个关键数字。
2.2 五个关键指标,学会了比任何工具都准
SMART属性列表里有几十项,但你真正需要盯住的其实就五六个。不同品牌、不同协议的固态,属性名称和ID会略有差异,但含义基本相通。
第一看05(Reallocated Sectors Count,重映射扇区计数)。这项记录的是由于坏块被主控重映射到备用区的扇区数量,原始值通常是一个十六进制数。只要这项非零,就说明已经有坏块出现了。少量非零(比如个位数)在闪存生命周期内可能属于出厂坏块的正常暴露,但如果持续增长,就要警惕了。
第二看C3(ECC错误率)或者叫硬件ECC校正计数。这项记录的是读取数据时发生错误后,靠纠错码修复的次数。数值偶尔跳动是正常现象,但如果增长非常快,说明闪存电荷保持能力在恶化,读取出错的频率在上升。
第三看0E(Media and Data Integrity Errors,媒体与数据完整性错误计数)。这项是NVMe协议新增的,在Intel、Solidigm、三星等品牌比较常见。它的重要性在于:只要非零,就代表有数据完整性层面的问题。很多硬盘厂商把0E非零视为售后换新的直接依据,同时还会配合03(Available Spare Space,备用空间百分比)一起看。如果0E持续增长,同时03的数值在下降,说明备用块正在被消耗,病情在进展。
第四看B1(Wear Leveling Count,磨损平均计数)。这项记录的是闪存块擦写次数的平均值,能侧面反映盘已经用掉了多少寿命。比如一块标称3000次P/E的盘,B1原始值300左右,相当于用了10%的寿命。这项主要是参考,数值高不代表马上坏,但能让你有个心理预期。
第五看F1(Total Host Writes,主机写入量)。这项记录的是电脑往硬盘里写入了多少数据,单位因厂商而异,有的按GB,有的按MB,有的按32MB为单位。结合盘的标称TBW(总写入字节数),可以算出一个大致的寿命消耗百分比:F1值(换算成TB)除以标称TBW,就是已经消耗的寿命比例。
举个实例:我手头有一块用了四年的500GB SATA固态,标称TBW是200TB,F1原始值换算后大约80TB,也就是消耗了40%的写入寿命,但05和0E都是0,C3偶尔跳动但幅度很小,健康状态依然很健康。这个例子说明:只要关键属性不出问题,写入量再大也不用慌。
2.3 SMART无法读取时的三步自救
有时候你会遇到更麻烦的情况:插上固态后系统能识别到盘,但CrystalDiskInfo里面显示不出SMART数据,或者直接报错。这时候按照三个步骤来排查。
第一步,确认接口和芯片组驱动。NVMe固态在老旧主板上如果不打NVMe驱动补丁,SMART读取会异常;SATA固态接在第三方SATA控制器(比如某些扩展卡)上,也可能读不到完整SMART。先把固态接到原生的SATA口或直连CPU的M.2插槽上再试。
第二步,换工具交叉验证。CrystalDiskInfo读不了的时候,试试各品牌自家的工具:三星魔术师(Samsung Magician)、西数仪表盘(Western Digital Dashboard)、铠侠SSD Utility、致态SMART Tool等。这些工具对自家产品做了深度适配,能读到通用工具读不到的信息。
第三步,判断是不是主控固件锁了。部分OEM盘的固件会禁用SMART指令,或者只开放极少属性。这种情况下,你看到的信息永远不完整,但这不代表盘有问题。判断方法是:把盘挂到别的电脑上,如果同样的工具能读出完整SMART,那就说明是你的主板或驱动问题;如果还是读不出,基本就是固件层面的限制。
3. 第二步:坏块检测的几种实操方案
3.1 全盘读取扫描:最接近“体检”的日常检查
既然固态的坏块不像机械硬盘那样物理可见,那我们换一种思路:直接读取全盘所有数据,让主控自己去校验。如果某个块的ECC都救不回来,主控会尝试重读、重映射,最终把这个块标记为坏块并记录到SMART里。
所以最贴近实际、对硬盘压力也最小的检测方式,就是全盘读取扫描。但这里必须先强调一句:不要直接在系统盘上做全盘扫描,因为扫描过程会占满整个磁盘的IO,系统会卡到没法用,而且如果中间有正在写入的文件,还可能产生数据不一致的隐患。
正确的操作方式是:准备一块移动硬盘或U盘,做一个Windows PE启动盘,从PE系统启动后,再用工具对指定固态做全盘读取。Windows PE下的工具我常用的是HD Tune Pro和DiskGenius,这两款都有独立的WinPE版本。
全盘读取扫描的原理很简单:工具逐扇区(或逐LBA)读取数据,不校验内容本身是否正确,只关心读取是否成功。如果某个扇区连续多次读取失败,工具就会把它标记为红色坏块。读取失败意味着主控在内部经过多轮重试和ECC纠错之后仍然无法返回正确数据,这个块的失效程度已经比较严重了。
提示:全盘读取扫描需要的时间很长。一块500GB固态,如果走SATA接口,最高读写速度550MB/s左右,理论上全盘读一遍也要接近20分钟;实际跑起来因为主控的纠错机制和发热降速,1TB盘全盘扫描花一两个小时很正常。这段时间内不要动电脑,也尽量不要给硬盘通电断电。
全盘扫描的结果怎么判读?理想情况下应该是整条全绿。偶尔出现一两个红色块,先不要急着判死刑,可能是扫描过程中接口松动、供电不稳或者温度过高导致的瞬时错误。处理方式是擦除整盘后用工具重新扫描,如果红块消失,说明之前是虚惊一场;如果同一个位置反复出现红块,那基本就是物理坏块没跑了。
3.2 HD Tune Pro错误扫描的具体用法
HD Tune Pro是老牌硬盘检测工具,虽然界面风格停留在XP时代,但功能一点不过时。它的错误扫描功能(Error Scan)可以用来做固态坏块的快速筛查。
打开HD Tune Pro,在顶部下拉框里选中目标固态,切到“错误扫描”选项卡,然后点“开始”按钮即可。扫描方式默认是快速扫描,只扫描整个盘的稀疏扇区,速度很快但精度有限;要真正全盘扫描,需要点开右下角的“扫描速度”设置,选择“慢速扫描”。
这里有一个很多人不知道的细节:HD Tune Pro扫描时,对固态硬盘和机械硬盘的处理策略不同。机械硬盘的扇区读取如果失败,工具会立即把该块标记为红色,因为机械盘的重试机制很简单;但固态硬盘的主控在读取失败后会执行内部重试和ECC纠错,整个过程可能需要几秒甚至更久。所以你在扫描时会看到某些块卡住很久,进度条停在某个百分比迟迟不动,这不一定代表死机了,很可能就是主控在内部死磕这个块。要不要等?我的建议是:如果一块卡住超过三分钟还没跳过,直接强杀扫描进程,然后记下卡住的位置,单独针对那个区域做小范围扫描确认。
HD Tune Pro还有一个有用的功能是“健康状态”选项卡,它会以图形方式展示SMART属性的历史变化趋势。比如C3的增长斜率,如果是一根陡峭的上升线,说明错误率增长很快;如果是一条缓慢的平线,问题不大。这个趋势图比单次的数值截图更有参考价值,排查故障时记得把历史趋势一并截图留存。
3.3 DiskGenius坏道检测和Victoria的适用场景
DiskGenius是国内用户很熟悉的分区管理工具,其实它也内置了坏道检测功能。打开DiskGenius,选中目标硬盘,点菜单栏的“硬盘” -> “坏道检测与修复”,可以把检测范围限制在某个分区、某个区间或者全盘。
DiskGenius的检测原理和HD Tune Pro类似,也是逐扇区读取测试,但它的界面做成了类似雷达图的可视化效果。扫描结束后,绿色格子代表正常,红色格子代表读取失败,同时会在右侧统计出具体数量。更进一步,DiskGenius还提供“尝试修复”按钮,但我要非常明确地告诉你:对于固态硬盘,千万不要点击这个修复功能。DiskGenius的修复原理是对坏道区域做写入测试,利用硬盘内部的备用扇区替换逻辑来重新映射。这个机制对机械硬盘偶尔有效,但固态硬盘的主控已有自己的一套坏块管理策略,你用软件强行触发写入测试,反而可能干扰主控的调度,甚至把原本还能挽救的块彻底写坏。
Victoria是另一款老牌磁盘检测工具,Windows版在英文社区比较火,功能和HD Tune Pro高度重叠,但有一个特色功能:可以关闭硬盘的读取缓存,强制每次读取都直接访问存储介质。这样做能提高坏块出镜率,但是扫描速度会慢了不止一倍,一般只建议在怀疑有坏块但常规扫描扫不出来时,作为二次确认手段使用。
我个人的工具组合拳很固定:日常用CrystalDiskInfo看SMART,怀疑坏块时先用DiskGenius做全盘扫描,扫出可疑区域后用HD Tune Pro对那个区间做慢速定向扫描,最终是否换盘的判断以SMART关键属性和DiskGenius的重复扫描结果为准。工具不在多,逻辑清晰就好。
4. 第三步:SMART都失效了,盘还能救吗
4.1 掉盘与不识别时的处理顺序
有些固态故障比坏块更棘手,直接表现为系统里找不到这块盘了,也就是常说的“掉盘”。这时候SMART信息自然也就读不出来了,坏块检测工具全都派不上用场。遇事别慌,按下面的顺序处理。
先把电脑彻底关机,拔掉电源线,把固态重新插拔一次。如果是M.2接口,清一下金手指上的氧化层和灰尘,重新固定好螺丝;如果是SATA盘,换一根数据线,换一个主板的SATA口。很多“掉盘”只是接触不良或者数据线老化,重新插拔就能解决。
然后找一个可用的Windows系统,打开磁盘管理(右键“此电脑” -> “管理” -> “磁盘管理”)。如果系统提示“初始化磁盘”或者“未分配”,说明主控已经能识别但分区表丢了。这时候不要急着格式化,先用DiskGenius扫描分区找回分区表,大概率能把数据找回来。
如果磁盘管理里根本看不到这块盘,进BIOS里看能不能识别到。BIOS能看到但系统看不到,说明主控层面已经无法正常完成初始化,这类情况大概率是固件崩溃或者主控故障,坏块已经不是主要矛盾了。BIOS也看不到,那基本就是硬件层面的故障,需要送修或者走售后换新。
4.2 量产工具重映射的工作原理和实操边界
在固态硬盘维修圈子里,量产工具(比如MPTool)是一套绕不开的软件。它的核心功能是让主控重新初始化闪存,重建坏块表,把出厂后新增的坏块也纳入管理。
量产工具的工作原理说穿了很直白:主控出厂时会扫描所有闪存块,把不合格的块写进坏块表(Bad Block Table),这些块以后永远不再使用。使用过程中产生的坏块,主控会在运行时动态更新坏块表,这个过程叫运行时重映射。而量产工具做的是让主控重新做一次全盘扫描,重新生成坏块表,相当于给硬盘做了一次“格式化级别的翻新”。
听起来很美好,但实操边界非常清晰:第一,量产工具必须匹配主控型号和闪存颗粒批次,混用会直接变砖;第二,量产会清空全盘数据,操作前必须确认数据已经备份;第三,量产工具只适用于主控还能被识别的盘,如果主控已经彻底死掉,连USB量产模式都进不去,那就没戏了。
所以我通常建议普通用户不碰量产工具,理由很现实:你花大量精力找到对应主控的量产软件,还不一定能匹配到正确的闪存配置参数,稍有不慎就会把一块还能救的盘彻底刷死。真正的实用场景是:这块盘已经过保、数据全部放弃、主控还能识别、你想把它当“实验室小白鼠”练手,那可以尝试一下。抱着“死马当活马医”的心态,反而会有惊喜。
5. 一次完整的排查复盘:从“卡顿”到“确诊”
5.1 故障现象描述
讲一个我自己实际经手的案例。同事的笔记本,用了大概两年的512GB SATA固态,系统是Win11,最近一个月频繁出现两个现象:一是开机明显变慢,原本15秒进桌面,变成要转圈三十多秒;二是在使用过程中偶尔会卡住几秒钟,鼠标能动但任何操作都没反应,过一会又恢复正常。
他把机器拿过来的时候,第一反应是怀疑系统中了病毒或者后台进程太多。我先用任务管理器看了CPU和内存占用,正常;又用火绒全盘杀毒,也没扫出东西。这时候把怀疑目标转向硬盘,才算正式开始走排查流程。
5.2 排查步骤与判断依据
第一步我先用CrystalDiskInfo读SMART信息。健康状态显示“注意(Caution)”,但更关键的数字是:05重映射扇区计数的原始值是0x1A(26),0E媒体与数据完整性错误计数的原始值是0x0F(15)。这已经是明确的坏块信号了,说明主控已经重映射了26个扇区,同时还记录了15次数据完整性错误。这个数据对一个用了两年的盘来说,绝对不正常。
第二步用DiskGenius做全盘坏道检测,扫描耗时40来分钟。结果出来了,整盘有7个红色块,分散在中后段区域,不算特别密集,但位置和SMART里的重映射数对得上。
第三步我做了排除干扰的验证:把这块硬盘挂到另一台测试机上,重跑了一次HD Tune Pro的错误扫描(慢速模式),结果同样在这几个位置附近出现了红色块。两次工具、两条路径、位置吻合,基本可以锁定坏块问题的真实性。
5.3 最终结论与处理建议
确认故障后,我的判断是:主控和固件还活着,坏块数量在持续增长但还没到崩溃级,但鉴于用户日常办公数据都在里面,建议立刻备份重要数据,然后走售后换新。这型号的固态还在保修期内,凭购买凭证直接申请了售后。换新盘后重装系统,同样的使用场景下,开机速度和卡顿问题全部消失。
这个案例里有两点值得提醒。第一,坏块问题不一定会表现为蓝屏或死机,更多时候就是“莫名的卡顿”和“开机变慢”,所以出现这类现象时,检查硬盘应该排在杀毒软件的前面。第二,SMART里的05和0E数值,哪怕只是十几二十几,也应该当一回事,别等到数值涨到几百上千再去处理。
6. 常见问题与排查技巧速查
| 问题 | 可能原因 | 建议处理方法 |
|---|---|---|
| SMART健康状态显示“注意” | 某个关键属性当前值低于阈值 | 看是哪个属性低于阈值,多为05/0E/C3,结合增长趋势判断 |
| 05重映射计数持续增长 | 坏块在批量出现,往往是颗粒品质恶化 | 备份数据,走售后,不建议继续使用 |
| 0E错误计数非零 | 数据完整性层面出现错误 | 非零即异常,持续增长则准备换盘 |
| C3错误率极高 | 闪存电荷保持能力下降 | 观察趋势,若持续上升则属于危险信号 |
| 全盘扫描发现少量红块 | 可能是瞬时错误或物理坏块 | 擦除后重新扫描,确认是否反复出现在同一位置 |
| 扫描过程中进度条长时间卡住不动 | 主控在执行内部多轮重试和纠错 | 不要强制断电,观察3-5分钟,仍不动则终止并记录位置 |
| 系统掉盘、读不出SMART | 接触不良、固件崩溃、主控故障 | 先换线换口,再试BIOS识别,最后考虑量产或售后 |
| 想用软件修复坏块 | 固态主控有自己的坏块管理机制 | 不要用机械硬盘的修复逻辑,软件修复弊大于利 |
几个排查技巧我再补充一下:
- 截图存档是排查工作中最有价值的习惯。SMART数据、扫描结果图,每次检测都截图留存,下次检测时对比变化趋势,比单次判断可靠得多。
- 固态硬盘的坏块趋势比绝对数值重要。05偶发十几个可能没事,但如果这个数值持续增长,性质就完全不同。
- 检测前先确保固件是最新的。厂商会通过固件更新优化坏块管理算法,某些早期批次的盘可以通过更新固件减缓坏块增长。
- 注意散热。很多固态在高温下更容易触发读写出错,温度超过60℃时错误率会明显上升。检测时如果发现温度偏高,先改善散热再重复扫描。
- 备份优先于诊断。任何坏块检测都可能加速故障演进,如果盘里还有重要数据,第一件事永远是备份到别的存储介质。
根据我这些年和各种固态硬盘打交道的经验,大部分用户根本不看SMART,直到盘彻底无法识别才追悔莫及。养成半年看一次CrystalDiskInfo的习惯,比装任何“硬盘检测大师”都管用。坏块本身不可怕,怕的是你发现不了它在慢慢扩散。
