S.M.A.R.T.(Self-Monitoring, Analysis and Reporting Technology,自我监测、分析及报告技术)不是硬盘厂承诺的"故障预言",而是盘内固件持续记录的运行遥测与异常日志。ATA/SATA 设备使用厂商定义的 256 字节属性条目,同一 ID 在不同品牌、型号、固件间可能含义不同;NVMe 则通过统一的 512 字节 SMART/Health Information Log 报告临界告警、剩余备用空间、寿命百分比、数据单位和错误统计等字段。因此,05、C5、C6 只存在于 ATA 世界;NVMe 上的"0E = Media and Data Integrity Errors"属于错误日志条目的 NVMe 属性映射,不能与 ATA 0E 或 ATA 05/C5/C6 混为一谈。
CrystalDiskInfo 适合 Windows 用户做快速盘点和状态查看,能显示通电小时数 09、通电次数 0C、05/C5/C6/BB 等 ATA 字段,也可读取部分 NVMe 字段,但 USB、RAID、外置盒和旧控制器可能降级为"Unknown",不能直接把界面空白当作健康。CrystalDiskInfo(CDI)由日本开发者 hiyohiyo(Crystal Dew World)维护,当前最新版本为 9.9.2,发布于2026 年 7 月 25 日。真正稳健的判读应同时看 Current/Worst/Threshold、RAW 的绝对数值、增长斜率、盘型元数据、自检状态和外部症状,并用趋势而非单点快照作决定。
Google 与 Backblaze 的实证研究共同划定了 SMART 的能力边界:Google 发现首次扫描错误后的 60 天内故障可能性上升 39 倍,却仍认为仅凭 SMART 不足以预测单个盘的故障;Backblaze 仅选取 05、187BB、188BC、197C5、198C6 作为运营换盘信号,并承认不同厂商的归一化值并不一致。把"健康度 100%"只视为当前固件判断,不视为新盘、零写入、无坏道或未来可靠;一旦盘开始报错,第一优先永远是保全可读取数据,而不是继续自检、修复、重装系统或反复重启。
机械硬盘最需要关注的S.M.A.R.T.属性包括重新分配扇区计数 (05 / Reallocated Sector Count)、重新分配事件计数 (C4)、无法修正的扇区总数 (C6)、当前待处理扇区计数 (Current Pending Sector)、命令超时 (Command Timeout)、读取错误率 (Read Error Rate) 。重新分配扇区计数记录硬盘发现坏扇区后,将数据重新分配到备用区域的次数。当前待处理扇区计数和无法修正的扇区总数数值持续增长说明硬盘处于持续恶化状态。命令超时表示硬盘未能及时响应主机命令的次数。读取错误率记录硬盘读取数据时发生错误的频率。
SATA SSD需重点关注的属性包括可用备用空间 (03 / Available Spare)、可用备用临界值 (04 / Available Spare Threshold)、使用百分比 (05 / Percentage Used)、媒体错误计数 (0E / Media and Data Integrity Errors)、物理层错误计数 (A8)、坏块计数 (A9) 。可用备用空间是可用剩余容量的百分比。可用备用临界值由厂商定义,用百分比显示。使用百分比是设备运用寿命百分比的估算。媒体错误计数是主控检测得到的未恢复的数据完整性错误次数。物理层错误计数和坏块计数也需要关注。
NVMe SSD的关键属性集包括严重警告 (Critical Warning)、温度 (Temperature)、可用备用空间 (Available Spare)、可用备用临界值 (Available Spare Threshold)、使用百分比 (Percentage Used)、数据单位读写 (Data Units Read/Written)、主机读写命令数 (Host Read/Write Commands)、通电时间 (Power-On Hours)、通电次数 (Power Cycles)、不安全关机次数 (Unsafe Shutdowns)、媒体和数据完整性错误 (Media and Data Integrity Errors) 。严重警告字段表示控制器状态的严重警告。温度是以"开"为单位的SSD温度信息。可用备用空间是可用剩余容量的百分比。可用备用临界值由厂商定义,用百分比显示。使用百分比是设备运用寿命百分比的估算。数据单位读写记录的是主机从SSD里读取或写入512字节数据单元的数量。主机读写命令数是主控收到的读取或写入命令数量。通电时间记录开机的小时数。通电次数是SSD的通电次数。不安全关机次数是非正常断电次数记录。媒体和数据完整性错误是主控检测得到的未恢复的数据完整性错误次数。
一、S.M.A.R.T. 不是"坏道预言",而是固件维护的设备遥测体系
S.M.A.R.T. 最初是为硬盘内部子系统提供持续监测和预警能力的一组数据结构、命令与算法。它记录的对象包括盘片或闪存介质、磁头/读通道、主轴电机、伺服寻道、接口协议、ECC(Error Correction Code,错误校正码)、温度和电源事件。固件可以离线采集背景数据,也可执行短自检、长自检等内部诊断;主机再使用 SMART RETURN STATUS 或相应的日志读取机制取得结果。需要注意,ATA 命令码、协议字段和厂商实现细节会随版本变化,本文只讨论通用的健康监测框架,不把某个固件版本的内部常数当成普适规范。
规范演进的主线大致是:早期 SFF-8035i、ATA-3 时代形成 SMART 基本框架,随后 T13 的 ATA/ATAPI Command Set(ATA/ACS)继续演进,SATA 设备沿用这一体系。ACS 规定了 SMART 数据结构、命令、自检、日志及属性条目布局,却没有把每个 RAW 字段都定义成所有厂商必须一致解释的开放标准。真正公开的主要是属性ID、名称、Current/Worst/Threshold、采集标志、在线/离线采集状态,以及规范要求的 SMART 数据结构。至于 RAW 中每字节如何拆成计数、温度、时间戳和标志位,大量属于厂商机密或型号专属定义。
"通过阈值"只表示当前属性未越线,不等于数据完整。 固件通常维护一个初始值为 100、200 或其他值的 Current,按内部算法向 1 递减;但厂商可定义反向属性,也可能使用完全不同的标尺。Threshold是盘内预置门限,而不是用户风险偏好。Worst 是盘寿命内见过的最差归一化值,适合观察历史最低点;Current 是当前值;两者都跨过 Threshold 只能说明该属性已触发盘内告警,不能反向证明其他属性正常。WD 的官方属性表明确把部分 ID 标成预故障、其余标成建议,但页面同时注明状态位属于典型情况、可能随实现变化。
预测价值来自风险分层,而不来自对单次故障的必然命中。 Google 的 FAST 2007 研究覆盖超过 10 万台消费级并行/串行 ATA 硬盘,收集期为 2005 年 12 月至 2006 年 8 月;论文发现扫描错误、重映射计数、离线重映射计数和预检计数与故障强相关,首次扫描错误后 60 天内故障可能性上升 39 倍,却明确指出大量故障盘没有这些信号,无法仅凭 SMART 预测单盘故障。这正说明 SMART 应被当作风险分层与处置触发条件,而不是寿命保证书。

日常使用防护规范
一是杜绝非法断电、强制关机,设备运行中避免震动、磕碰、移动,从源头减少物理坏道产生;二是严控运行温度,台式机、笔记本保持通风散热,避免密闭环境、高温环境运行;三是避免硬盘长期满负载运行,杜绝7×24小时不间断高负载读写;四是定期清理磁盘垃圾、整理磁盘碎片,保持磁盘读写顺畅;五是禁止使用劣质电源、劣质数据线,保证硬盘供电稳定;六是新硬盘优先完成4K对齐、固件升级,优化底层运行机制。
数据备份标准化规范
健康硬盘:重要数据每周备份1次,普通数据每月备份1次;C5轻微异常硬盘:每日增量备份核心数据,每周全盘备份;05轻度异常硬盘:实时增量备份,禁止存放唯一数据源;C6、0E异常高危硬盘:立即全盘备份,停止写入新数据,尽快更换。
二、ATA 与 NVMe 是两套报告体系,不能跨协议硬套 ID
ATA/SATA、SCSI/SAS 与 NVMe 的"SMART"是不同协议栈中承担相似监控目的的机制。Windows 上的 CrystalDiskInfo 可能把不同协议都显示在同一界面,但底层来源不同。把一个 NVMe 盘显示成"没有 05、C5、C6"并不能推出它缺少介质健康监测;正确做法是在 NVMe 健康日志中查看 Critical Warning、Available Spare、Available Spare Threshold、Percentage Used、Media and Data Integrity Errors、Error Information Log Entries 和 Unsafe Shutdowns 等字段。
ATA 属性表是 256 字节固定骨架,不是跨厂商语义表。 每条属性通常包括 ID、Current、Worst、Threshold、采集/失败状态字节和 48 位 RAW。所谓 48 位,不是所有厂商都用满,也不是所有数字都可按十进制扇区数直接读。例如 Hitachi 某些型号以分钟而非小时记录通电时间,IBM 某些型号在 RAW 结构中记录多个温度值;另有厂商把 12 位或其他宽度的时间字段、计数和状态复合成一个大数。smartmontools 文档明确警告:未掌握具体厂商和型号定义前,RAW 解释困难;归一化字段相对容易解释,但仍须结合型号规则。

NVMe 的字段标准化程度高于 ATA 属性,但仍不能覆盖控制器、NAND、电源和保护机制的全部故障。 NVM Express 的官方说明将 Critical Warning 视为主要健康指示:可用备用空间低于阈值、温度超出阈值或节流、可靠性降级、只读模式和掉电保护失效可经位图报告;设备自检提供短自检和长自检;错误日志页会记录错误、命令队列、受影响 LBA 和命名空间。其 512 字节健康日志还包含复合温度、可用备用空间及阈值、寿命百分比、通电小时数、通电次数、数据单位、不安全关机和错误日志条目数。因此,NVMe 监控应从"找 05/C5/C6"转为"检查严重警告位图与 0E 映射属性"。
三、S.M.A.R.T. 属性逐项全解:ID 只是入口,厂商定义才是语义
CrystalDiskInfo 列出的 ID、属性名和数值可作为快速筛查清单,但不能把属性名当法律条款。表内"正常"只表示一般工程语义;任何字段都应结合型号、固件、阈值、RAW 编码、趋势、SMART 总体状态和主机侧症状复核。

05、C5、C6 的转移关系是条件性的,不是固定队列。 典型机制是:盘读取某扇区失败或发现介质不稳定,先将其放入待处理状态,对应 C5;若后续重映射成功,结果计入 05,事件计入 C4,C5 可能清零;若盘固件在校验后认定不可修复,则可能出现 C6;若主机读时失败且错误暴露给上层,则可能同时影响 BB。实际顺序、计数单位和清零逻辑都由固件决定。C6 并非"突然关机专属成因":掉电可能造成写入不完整、元数据异常或物理冲击,但介质缺陷、磁头退化、伺服问题、ECC 不可纠正错误同样会产生 C6。相反,正常异常断电也未必留下 C6。

四、NVMe 的关键字段:0E 是统一健康日志在工具中的属性映射,不是 ATA 05 的等价物
NVMe 设备的 Critical Warning 是位图而非温度条或健康百分比。其字段包含可用备用空间低于阈值、温度超出阈值、NVM 子系统可靠性降级、处于只读状态,以及掉电保护电容/电池或易失缓存备份失败等状态。任一有效位都意味着设备已上报异常,应结合具体位与厂商手册处置,而不是把"0E 从零开始增加"当作唯一判据。
Media and Data Integrity Errors 的核心是不可恢复的数据完整性错误。 NVMe 错误日志条目的相关统计会汇总控制器检测到的不可恢复数据完整性错误,例如 ECC、CRC、LBA 标签或端到端校验失败;具体实现和错误分类仍取决于控制器。工具将日志中的 0E 显示为 S.M.A.R.T. 属性,只是图形界面的映射,并非所有 NVMe 控制器都用 0E 作为底层属性 ID。故不能说"ATA 0E 就是 NVMe Media and Data Integrity Errors",更不能在 NVMe 盘上机械寻找 ATA 05/C5/C6。
Percentage Used 是厂商模型下的磨损量表,不是剩余寿命的普适剩余百分比。 NVMe 规范将其描述为实际损耗的"油量表";它与主机写入、写放大、NAND 工艺、预留空间、固件寿命模型有关。Available Spare 表示当前可用备用空间,Available Spare Threshold 是触发告警的下限。两者结合才能区分"备用块减少"和"备用块低于风险阈值"。Data Units Read/Written 以 512 字节数据单位为粒度,读取量不含元数据,且规范定义中记录值使用千进制近似取整,故不应据此计算高精度字节数。

TBW 与 DWPD 用于容量规划,不能被 SMART 健康百分比替代。 TBW(Total Bytes Written,总写入字节数)是绝对写入寿命;DWPD(Drive Writes Per Day,每天整盘写入次数)以"容量 × DWPD × 保修天数"换算为总写入预算。二者都是厂商保证条件下的上限/参考,不等于安全余量承诺。企业盘可通过较低写入放大、更多预留空间和更强掉电保护达到更高 DWPD;消费盘即使 Percentage Used 较低,也可能因无电容、固件或主控问题突然失联。Samsung Magician 同时提供健康度、TBW 和真实性检查,说明原厂工具的价值在于结合型号规则,而不是简单多列几个数字。
五、厂商差异不是噪声,而是 SMART 解释的第一约束
Seagate、WD/HGST、Toshiba、Samsung、Intel、Micron、SanDisk、Kioxia 与 OEM 厂商往往复用同一 ID,但内部 RAW 结构和告警模型不同。即便是同一品牌,不同代际、容量、固件和主控也可能改变字段含义。因此,任何跨厂商统一阈值规则都只能是风险筛选,不能宣称"所有盘均适用"。
Seagate 的公开资料表明 RAW 结构常包含机密或复合信息。 一份 Seagate 属性规范中,属性 1 的 RAW 拆成读取扇区数和读取错误数,属性 4 的 RAW 低双字为起停次数,属性 5 使用当前重映射数和上次 SMART 重置后增量,归一化算法还依赖最小可用备用区;规范同时明确,除非特定字节已公开,RAW 内容视为不可判定。因此,用户把 Seagate 的 09、0C、05 的 RAW 直接与其他品牌等同解释,可能得到错误单位或错误对象。
WD/HGST 的预故障位有助于识别,却不能代替全盘风险。 WD 的官方表把 01、03、05 列为预故障,把 07、09、0A、0B、0C、C0、C1、C2、C4、C5、C6、C7 等列为建议;同时又注明状态位可能变化。这意味着工具若只因"建议位"未触发就显示绿色,并不能排除介质问题。HGST 与 WD 合并后的产品线仍需按具体固件确认;Hitachi 年代较早的型号还可能使用分钟制通电时间。
SATA SSD 的寿命 ID 尤其容易误读。 三星部分型号用 177(Wear_Leveling_Count),Intel/Solidigm 常见 233(Media_Wearout_Indicator),其他方案可能使用 173、231 等;同一"100"可能代表全新,也可能向下递减至不同下界。Samsung Magician 的 TBW/健康检查适合其支持的型号,但工具不支持或显示为 Unknown 时,应先检查 NVMe 协议映射和版本兼容。Micron Storage Executive 可查看 SMART 属性、运行短/扩展自检,并对超过阈值的属性给出警告;这再次说明"厂商工具 + 协议标准工具"应组合使用。
smartmontools 的驱动数据库是跨厂商解释的关键中间层。 smartctl 显示属性名、归一化值、Worst、Threshold、RAW 和 WHEN_FAILED;smartd 可持续监控并触发告警。它支持 ATA/SATA、SCSI/SAS、NVMe 及部分 RAID/USB 环境,但设备支持因操作系统和驱动成熟度而异。数据库会随版本更新,巡检前应使用匹配的 update-smart-drivedb,并在型号升级后复核属性解释。
六、判读方法:用四级证据建立"正常---注意---危险---立即隔离"的处置决策
第一层看设备可访问性,第二层看 Critical Warning/PASSED/FAILED,第三层看关键属性,第四层看趋势和主机症状。 若 CrystalDiskInfo 显示 Unknown,可能只是协议/USB/RAID 未穿透,不能判为健康;应改用 smartctl -x、厂商工具或接入不同控制器复测。若 SMART 总体为 FAILED、NVMe Critical Warning 非零、短/长自检失败,或盘已出现 I/O 超时、文件系统只读、无法挂载、异响,应直接进入数据保全流程。
归一化值和 RAW 值回答不同问题。 Current/Worst/Threshold 是固件给出的"是否已越过该属性的内部门限";RAW 是原始计数或复合结构,用于观察总量、增量和编码。例如 01 的 RAW 可能是一个很大的 ECC 纠错计数器,不能把它当成坏扇区数;C7 的 RAW 是 CRC 错误累计,单次跳升应优先检查链路;05 的 RAW 通常是重映射扇区数,但某些固件还可能包含增量字段。阈值本身也常是厂商黑箱:许多 SSD 寿命属性的 阈值为 0,盘仍可在"PASSED"状态下继续消耗寿命,因此阈值越线只是强告警,而不是唯一判据。

增长速率比绝对值更接近真实风险。 05 从 0 到 1 意味着已发生一次重映射,但若随后稳定,可能是局部扇区事件;数小时或数日内从几十持续增长,则更像盘体正在扩散。C5 可能由读异常触发,也可能在成功覆写后清零,因此只出现一次不应被当作永久坏道;相反,若 C5 长期存在且转成 C6,则介质风险更确定。C7 增长而盘读写正常、换线和接口后消失,更可能是传输链路问题;若换线后仍增长,则应怀疑控制器、电源或盘端接口。
建立基线是趋势判断的前提。 每个盘应记录型号、序列号、固件、接口、容量、09、0C、关键 RAW、温度、健康状态和采集时间;之后按日或周增量差分。增长率可用"最近 7 天增量/7 天"或"最近三次采样的最大斜率"表示。告警规则宜分层:例如 C5>0 或 C6>0 进入注意;05 单周增长≥2 或 C6 持续增长进入危险;Critical Warning、短/长自检失败或盘不可访问直接进入紧急。这样的规则仍只是工程建议,不是厂商保证。
七、CrystalDiskInfo 的正确使用法:先看元数据,再核对属性,最后看趋势
健康状态百分比与颜色是综合视图,不是原始 SMART 阈值。 CrystalDiskInfo 的主界面会显示"良好/警告/危险"或英文"Good/Caution/Bad",通常配合蓝/黄/红等视觉状态。健康度 100% 可能只是当前所有检查项处于工具定义的良好范围;二手盘、清零盘、固件修改盘或刚完成部分恢复的盘也可能显示 100%。因此,健康检查必须核对型号、序列号、固件、接口、容量、09、0C 和 SMART 全表,而不能只截图百分比。
具体巡检顺序建议为:第一,确认目标盘是 SATA HDD、SATA SSD 还是 NVMe;第二,核对型号、序列号、容量、固件,确认没有误把 USB 控制器或另一盘当作目标盘;第三,读取通电小时 09 与通电次数 0C,并与业务记录、采购时间、机房值班记录交叉核对;第四,查看温度及其是否接近该型号阈值;第五,检查 05、C5、C6、BB、C7、C0/C2 和 HDD 的 01/07/0A/0B;第六,对 NVMe 检查 Critical Warning、Available Spare、Percentage Used、0E 和错误日志条目数;第七,记录 RAW 值并导出或截图。
界面显示"-1""0""---/Unknown"各有含义,不能一概而论。 常见情况包括:属性不支持、控制器未穿透、工具数据库不识别、厂商未实现字段、48 位 RAW 编码被界面显示为补码或奇怪数字。CrystalDiskInfo 可以导出文本,巡检脚本应保存完整设备信息、属性表、自检结果和时间戳,而不仅是健康百分比。出现异常属性名或 RAW 时,先用 smartctl -i -x 或厂商工具复核,再查询该型号公开的属性文档。
CrystalDiskInfo 的功能边界应与其便利价值一起认识。 官网说明其支持部分 USB、Intel RAID 和 NVMe;最新邮件通知需要 .NET Framework 4.8 或更高版本,NVMe 支持需要 Windows 10/Server 2016 或更高版本。AAM(Automatic Acoustic Management,自动噪声管理)和 APM(Advanced Power Management,高级电源管理)可影响 HDD 性能与休眠策略,但错误设置可能增加起停或起旋负载,企业盘和 SSD 不应盲目调整。Shizuku Edition、Kurei Kei Edition 等主要是视觉主题和分发版本差异,不应假定其算法更"专业"。Windows 任务计划程序可设置开机或周期启动,但轮询频率过高会干扰硬盘休眠,通常每日一次到每周一次已足够,关键生产环境则应缩短间隔。
八、故障处置与数据抢救:先保全数据,再验证硬件,最后决定修复或弃盘
判定后第一个动作应是"允许写入还是只允许读取",而不是立即跑修复命令。 若盘仍可挂载但 05/C5/C6/BB/0E 已出现,或文件系统开始出现文件损坏、访问卡顿,先对重要数据执行文件级备份;若文件访问已不稳定,应改用块级只读镜像。不要在此阶段跑 chkdsk /f、fsck -y、RAID 强制重建、格式化、碎片整理或安全擦除,这些操作会写入元数据、覆盖空间并降低可恢复性。对 NVMe 也不应为了"修复"而盲目更新固件;更新前应完整备份,且只有厂商确认故障可能由固件引起时才执行。
HDD 异响或反复掉盘时,继续通电的边际收益迅速转为边际损失。 磁头撞击、盘片划伤、主轴卡滞、固件失联等问题在持续起旋、寻道和读取中会继续恶化。正确顺序是:立即停止应用程序和写负载;在 Linux live 环境中以只读方式再确认设备节点;若盘仍可被低层识别,使用 ddrescue 或 HDDSuperClone 分块复制,设置合理重试上限、日志文件和恢复点;若盘不再识别、有异响、不定时掉电,应断电并交由具备洁净间能力的专业机构评估。克隆目标盘容量必须不小于源盘逻辑容量,镜像写入前禁止挂载、分区或初始化。
块设备名不是序列号,备份清单必须锁定到具体盘。 每次克隆前重新核对 /dev/disk/by-id、smartctl -i 的序列号、容量和镜像输出路径。ddrescue 的日志文件用于断点续克隆;HDDSuperClone 提供不同读取策略和跳过机制。脚本不能自动跳过设备识别,更不能把未知设备默认当成目标。若源盘在几分钟内连续掉线,应停止自动重试,避免把瞬时错误放大成磁头损伤。
数据恢复成功率取决于故障类型,不存在"所有坏道都能救回"的承诺。 纯逻辑损坏、部分坏扇区、可读取的元数据通常成功率较高;磁头损坏、盘片划伤、固件区损坏、NAND 大量 ECC 不可纠正、控制器故障或无完整映射表的 SSD,成功率明显下降。恢复过程可能只能得到残缺文件、损坏压缩包或无法修复的数据库页。任何恢复机构若承诺 100% 成功、不提供故障评估、要求在不洁净环境开盘或拒绝说明风险,都应高度谨慎。
换盘、RMA 和送修前必须明确数据所有权。 保修换盘通常由厂商按序列号和故障判定执行;不要为了 RMA 自行擦除源盘后再证明故障。涉密数据应先在本地完成可恢复备份,再决定是否送修;厂商无法保证送修盘中的残留数据被安全删除。Micron Storage Executive 支持 sanitize、format 和 PSID revert,其中 PSID revert 会删除加密盘所有数据,并要求输入盘标签上的 32 位 PSID。企业盘退役必须使用与数据敏感度匹配的擦除/加密销毁流程,并保留处置凭证。
九、"SMART 正常"为何仍会突然坏:预测能力研究、误报与漏报边界
Google 的研究表明,SMART 能显著区分风险组,却不能可靠覆盖所有故障。 FAST 2007 研究使用超过 10 万台盘、样本覆盖 80--400GB、5400/7200rpm 的消费级硬盘;首次扫描错误后 60 天内故障概率提升 39 倍,论文同时指出温度和使用水平与故障的关联比既有认识更弱。这项研究年份较早,样本是 HDD,不能直接外推到当前 QLC/TLC SSD、PCIe 4.0/5.0 NVMe 或企业 SAS;但它确立的方法论仍然有效:SMART 是连续遥测,不是一次性命运判定。
Backblaze 的运营经验证明"少量强信号"可用于规模化换盘,但不能证明零值安全。 Backblaze 从 2014 年起采集约 4 万块盘的全部 SMART 数据,并选择 05、187BB、188BC、197C5、198C6 作为主动换盘指标;其逻辑是 187BB 非零就安排换盘,因为这些指标在其盘型中较一致且预测性好。这不等于普通用户必须采用"任何 BB>0 立刻报废"的规则:个人盘可能使用不同固件、不同接口,SMART 也可能被主板/USB 控制器改写或不完整报告。其结论的正确使用方式是"建立基线并复核趋势",而不是照抄阈值。

图 :Backblaze 2025 年机械硬盘故障率约为 1.3%,该数字是群体统计而非单盘寿命承诺。数据来源:Backblaze 2025 Drive Stats
误报来自"把偶发可恢复事件当永久故障"。 常见情形包括:C5 单次出现后成功覆写并清零;C7 因松动线缆或桥接芯片偶发跳变;SSD 的某些厂商字段出现大 RAW 但内部定义并非错误;温度传感器短时波动;通电小时、通电次数因固件或外置盒显示异常。处置时应保留原值、复测、检查链路、查看错误日志,并用文件访问和读写测试交叉验证。
漏报来自"固件未记录、未理解或来不及报告"的失效。 突发断电可能先造成文件系统元数据破坏,而 SMART 尚未来得及更新;PCB 元件、接口焊点、NAND 主控、缓存或固件 bug 可导致盘瞬间掉线;控制器报告可恢复错误不等于所有数据均正确到达应用层。SMART 主要观察盘内部状态,不替代端到端校验、文件系统校验和、应用层 CRC、数据库一致性检查或定期恢复演练。最稳健的架构仍是 3-2-1 备份、校验和、异地副本与定期恢复测试。
十、工具对比:CrystalDiskInfo 负责易用,smartmontools 负责可验证,厂商工具负责型号语义
CrystalDiskInfo 的优势是 Windows 上的快速可视化,短板是版本、控制器和自动化深度。 它适合个人电脑、工作站和少量服务器的巡检,可显示温度、09/0C、05/C5/C6/BB、部分 SSD 和 NVMe 字段,支持常驻告警、AAM/APM、文本导出及邮件通知。但它不是所有 USB/NVMe 环境的完整解码器,也不能替代脚本化日志、基线比较和跨版本型号数据库。

单一工具不是"越底层越好",而是需要交叉验证。 若 CrystalDiskInfo 显示 Good、smartctl 报 FAILED,应优先相信底层协议状态和盘自检;若 smartctl 没有型号规则,而厂商工具解码出异常,也应补充厂商证据;若盘已无法识别,再争论属性含义没有意义,重点是只读镜像和硬件检查。生产环境建议至少保留 smartd 日志和厂商工具截图两套证据。
十一、自动化监控:把"看到数字"升级为"持续采集、趋势告警与可审计留痕"
巡检频率应服从数据价值和故障代价。 家用电脑可每月一次 SMART 快照并保留 12 个月;工作站或小型 NAS 可每周一次,关键数据库每天一次;高写入 SSD 与高负载 HDD 应提高采集频率,但仍需避免轮询阻止盘休眠。RAID 阵列必须确认 HBA/控制器是否向 OS 暴露每个物理盘的 SMART,不能只监控阵列逻辑卷。
Linux 可使用 smartctl -x --json 或文本输出,将结果写入带日期的日志,再用定时任务解析 Critical Warning、关键属性 RAW、通电小时、温度和自检状态。Windows 可使用任务计划程序调用厂商 CLI,或定期启动 CrystalDiskInfo 导出;但 GUI 工具不适合直接承担无头服务器主监控。Docker 环境可考虑 Scrutiny 聚合多个 smartd 实例,仍需确认设备权限和 NVMe/USB 映射。
# 每日读取并追加关键字段;生产环境应改为按盘序列号归档
DEVICE='/dev/sda'
LOG='/var/log/smart/health.log'
mkdir -p /var/log/smart
{
echo "=== $(date -Iseconds) ${DEVICE} ==="
smartctl -H "$DEVICE"
smartctl -A "$DEVICE"
smartctl -l error "$DEVICE"
} >> "$LOG"
简化的 smartd.conf 风险规则示例(具体型号和告警脚本需自行实现)
-a 启用全部属性监控;-n standby 避免唤醒盘;-s 设置自检;-m 发送邮件
/dev/sda -a -n standby,48 -s L/../../6/03 -m ops@example.com -M exec /usr/local/sbin/smart_alert.sh
/dev/nvme0 -a -n standby,48 -m ops@example.com -M exec /usr/local/sbin/nvme_alert.sh
告警脚本应至少读取以下字段:ATA 的 05/197/198/187/188/199 RAW、SMART overall-health;NVMe 的 critical_warning、available_spare、percentage_used、media_errors、num_err_log_entries。比较当前 RAW 与上次记录的基线,输出增量、阈值等级、设备序列号和采集时间,而不是只打印健康百分比。对 SSD 再单独计算主机写入字节/周期、增长速率和 TBW 余量。
日志留存的目的不是堆数据,而是让趋势可解释。 每条记录应包含主机名、设备路径、序列号、型号、固件、协议、采样时间、健康状态、关键 RAW、温度和版本信息;同时保留 smartd/drive database 版本。建议 7 天细粒度、90 天每日、一年每月的轮转策略,并对备份和告警配置本身做版本管理。异常事件应从"属性异常"升级为工单,关联备份校验、盘替换和 RMA 编号。
十二、用户原始关注点的逐条校正与可执行巡检清单
09 就是通电小时数,但单位不是所有盘都一样。 多数 SATA 盘以小时累计,少数厂商/型号用分钟;显示成 10000 也不代表正好满 10000 小时。应结合采购日期和厂商解释。0C 是通电次数,不是机械磨损的等价指标;笔记本频繁休眠会放大它,企业盘频繁起停也可能提高,但它不能替代 05/C5/C6。
05、C5、C6 任一非零都值得记录,但不必在没有任何复核时立即判"盘已死"。 05 表示重映射扇区;C5 是待映射扇区;C6 是离线扫描中不可校正扇区。更严谨的决策是:非零即记录、复查和检查备份;持续上升则进入危险;伴随 I/O 错误、文件系统损坏或自检失败则立即只读克隆。若盘尚新且在保修期内,先截图完整 SMART 和错误信息,再联系厂商,不要自行执行高风险写入测试。
BB 不是 C6 的同义词。 05/C4/C5/C6 偏向介质与重映射过程,BB(187)偏向控制器向主机报告不可校正错误的统计;其 RAW 可能包含读、写、缓存或协议错误,取决于厂商。一个盘可以同时出现 C6 与 BB,也可能只有其一。真正需要统一核对的是错误日志、受影响 LBA、发生时间和主机 I/O 日志。
C6 并非主要由突然关机导致。 掉电可能造成写入中断、磁头异常归位和介质问题,但 C6 的规范语义是离线扫描中的不可校正扇区,成因包括介质退化、ECC 失败、磁头/伺服问题、接口和固件异常。反过来,异常关机也可能没有任何 C6 记录。对 C6 的正确反应是停止非必要写入、备份/镜像、检查 SMART 历史、查看错误日志和供电环境,而不是只把责任归于"上次没有正常关机"。
NVMe 0E 与 ATA 0E 不能混读。 在 NVMe 语境中,0E 常指 Media and Data Integrity Errors 这一健康日志统计在工具中的属性映射;它统计不可恢复的数据完整性错误。若从 0 开始持续增加,应视为高风险,并进一步看 Critical Warning、错误日志条目、LBA 和受影响命名空间。该值不是"C6 的 NVMe 等价 ID",NVMe 也不应被要求显示 ATA 05/C5/C6。
SSD "健康度 100%"不是新盘证明。 它可能表示当前磨损低、固件未触发告警、备用空间充足,也可能来自清零盘、二手盘或固件更新;同时,"健康度低"也不代表盘今天就会停止响应。巡检必须把健康度与 Percentage Used、Available Spare、TBW/写入量、Critical Warning 和错误计数共同判断。
十三、四大参数联动故障逻辑与硬盘故障分级体系
单一参数异常仅能反映硬盘局部故障,而05、C5、C6、0E四项参数的组合状态,可精准判定硬盘整体健康等级、故障类型、恶化速度与数据风险等级,形成标准化的硬盘故障分级体系,为运维处置、数据防护、设备更换提供明确依据。
3.1 正常健康状态(全参数=0)
判定标准:05=0、C5=0、C6=0、0E=0,CrystalDiskInfo评级为"良好"。
状态解析:硬盘介质完整、读写机制正常、纠错机制有效、数据存储稳定,无任何隐性与显性故障,通电损耗正常,温度、运行参数均处于标准区间,可正常存储重要数据、长期稳定使用,无需任何干预操作,仅需保持常规运维即可。
3.2 轻微预警状态(仅C5非0,其余为0)
判定标准:C5=1-10,05=0、C6=0、0E=0,软件评级多为"注意"。
故障逻辑:硬盘仅存在少量不稳定扇区,无永久性物理损坏,故障大概率为非法断电、文件系统错误等逻辑问题导致,处于最佳修复窗口期。
处置方案:优先备份重要数据,通过系统磁盘检测、碎片整理、分区修复等软件手段排查修复,修复后C5数值可清零,硬盘恢复健康状态,修复后可正常使用。
3.3 轻度老化状态(仅05非0,其余为0)
判定标准:05=1-5,C5=0、C6=0、0E=0,软件评级多为"良好/注意"。
故障逻辑:硬盘存在少量已修复物理坏道,硬件出现轻微老化,自我修复机制正常,备用扇区充足,无现存不稳定扇区与致命故障,日常使用无明显异常。
处置方案:无需立即更换硬盘,重点做好数据定期备份,避免硬盘高温、震动、过载运行,持续监测参数变化,若05数值长期稳定不增长,可正常使用;若持续递增,及时准备更换设备。
3.4 中度恶化状态(05+C5同时非0,C6=0、0E=0)
判定标准:05≥5、C5≥10,C6=0、0E=0,软件评级为"警告"。
故障逻辑:硬盘物理老化加速,旧坏道持续增多,新不稳定扇区不断产生,自我修复机制持续工作,备用扇区快速消耗,故障处于持续恶化阶段,数据风险显著提升。
处置方案:立即全盘备份所有重要数据,禁止存储核心业务数据、珍贵资料,降低硬盘读写负载,避免高温、断电、震动,持续监测参数,建议1-3个月内更换新硬盘,规避突发故障风险。
3.5 重度故障状态(C6非0,任意参数组合)
判定标准:C6≥1,无论05、C5数值多少,软件评级为"不良"。
故障逻辑:硬盘存在永久性、不可修复的物理坏道,硬件结构受损,纠错、重映射机制失效,属于不可逆致命故障,后续故障会持续爆发,无任何修复价值。
处置方案:紧急备份数据,立即停止使用,强制淘汰更换,禁止继续存放任何重要数据,仅可临时作为闲置文件存储,随时可能全盘报废。
3.6 隐性高危状态(0E非0,其余参数正常)
判定标准:0E≥1,05=0、C5=0、C6=0,多见于NVMe固态硬盘。
故障逻辑:硬盘介质数据完整性异常,后台存在隐性数据损坏风险,无显性故障表现,但数据存储安全性已无法保障,属于高风险隐性故障。
处置方案:立即全盘备份数据,更新硬盘最新固件,排查主板供电、散热问题,若0E数值持续增长,直接更换固态硬盘,避免隐性数据丢失。
3.7 终极报废状态(多参数同时暴涨)
判定标准:05、C5、C6、0E数值同步大幅增长,软件评级"不良"。
故障逻辑:硬盘硬件全面老化、介质严重损坏、读写机制彻底失效,濒临完全报废,随时可能出现掉盘、分区丢失、全盘数据损毁。
处置方案:立即断电停止使用,优先通过专业设备恢复数据,直接报废硬盘,无任何维修、继续使用的价值。
附录 A:术语速查与中英文对照
阅读工具界面、官方手册和英文资料时,最容易出错的不是概念本身,而是同一个词在不同语境下的指代差异。下表给出报告中出现的核心术语与其规范含义,便于长期查阅。

附录 B:常见疑问简答
为什么两块同型号盘的同一 ID 数值差异很大? 因为 RAW 值的编码方式、单位甚至统计范围都是厂商私有实现,同一 ID 在不同固件版本间都可能改变语义。可比性强的是同一块盘自身的历史趋势,而不是跨盘横向比较。
为什么刚买的盘 09 已经有几百小时? 可能是出厂测试、老化烤机、翻新盘或二手盘。应结合序列号、保修起算日与厂商查询结果判断;如与销售承诺不符,应尽早发起退换。
C5 变回 0 了,是不是已经自愈? C5 的下降有两种成因:一是该扇区被成功写入并覆盖后复测通过,二是它被成功重映射并计入 05。因此应同时核对 05 是否上升,而不是仅凭 C5 归零就判定恢复。
05 有数值但一切正常,可以不换盘吗? 可以继续观察,但必须满足三个条件:数值在多次采样中保持稳定、不存在 C5/C6 增长、已建立可验证的备份与镜像。05 稳定代表伤疤已封存,05 增长则代表损伤仍在扩散。
为什么有的盘没有温度读数? 可能是外置盒的桥接芯片不透传 SMART、USB 或 RAID 控制器未开放直通、或厂商未实现该属性。此时应改用支持直通的线缆/端口或厂商工具确认。
SMART 全绿却读不出文件,问题在哪? 常见成因包括文件系统元数据损坏、分区表错误、控制器或接口故障、内存与主板问题、线缆接触不良、加密或 BitLocker 状态异常。SMART 只覆盖设备自身遥测,不覆盖主机侧链路与文件系统。
自检通不过是否等于必须报废? 不等于,但必须停止写入并优先保全数据。自检失败代表固件在自测中遇到无法完成的区域,属于强风险信号,应进入镜像与替换流程,而非继续生产使用。
为什么要避免对疑似故障盘反复通电? 每次通电和寻道都可能加剧机械部件的磨损,也可能让处于临界状态的磁头与盘片进一步损伤。正确顺序是先做只读镜像,再在镜像副本上做文件系统修复与数据提取。
笔记本与台式机的温度阈值一样吗? 判读逻辑相同,但散热条件和负载曲线不同。笔记本、迷你主机与密闭机箱应参考同型号长期基线,而不是套用统一数字;相对自身基线的突变更有价值。
多久巡检一次合适? 个人电脑建议每月一次常规读取,每季度一次扩展自检;企业环境建议每日采集关键字段、每周汇总趋势、每月核对一次完整属性快照,并在任何告警出现后立即进入人工复核。
日常清单(每次开机或每周):
- CDI/NAS 能看到每块物理盘,没有新增 Unknown;
- 05、C5、C6、0E、BB、BC 均为 0 或稳定在基线;
- 温度相对工况未突然升高;
- 自动备份任务最近一次结果可验证;
- 重要数据至少有两份当前副本。
月度清单:
- 保存全屏 SMART 截图与巡检表;
- 比较 05/C5/C6、NVMe 0E 是否有斜率;
- 检查 C1/C7、通电小时和负载变化;
- 核对 SSD 写入量与可用备用空间;
- 抽样恢复一个备份文件,确认不是空成功。
季度清单:
- 对重要 HDD 安排短自检,NAS 安排数据校验;
- 对移动盘换直连复查,避免 USB 桥接误报;
- 核对散热风道、供电与振动;
- 检查备份的异地、离线或不可变副本;
- 按增长趋势、备份成熟度、保修与负载决定换盘。
告警分级响应表:
- 黄色:备份已完成,72 小时内复测; 适用于 C5 单次非零、C7 单独增长、温度偶发升高。
- 橙色:立即完成可验证备份,停止非必要写入,7 天内换盘; 适用于 05/C4 连续增长、C6 非零、NVMe 0E 稳定历史值但需确认。
- 红色:停机只读镜像,克隆到健康盘,更换并查保修; 适用于 05 快速增长、C5/C6 联动、0E 持续增长、Critical Warning 变化、机械异响或自检失败。
换新决策树: SMART 正常但盘有异响、掉盘、I/O 超时 → 仍换新;C5 出现但备份完整、盘稳定 → 先监测并准备新盘;C5 清除后不再增长且原厂扫描通过 → 可在有备份前提下观察;05/C6/0E 持续增长 → 立即撤离并换盘;阵列中预警盘 → 尽早维护窗口换盘;盘已坏到无法读取 → 先只读镜像/专业恢复,再讨论维修;退换或转卖前 → 先备份,再按厂商工具执行数据清除。
附录 C:常见误区澄清
- "健康状态良好就代表不会突然坏。" 错误。SMART 主要擅长渐发性问题,突发电子、机械、固件和 SSD 复合故障可能无明显前置信号。
- "RAW 值不为 0 就是坏了。" 错误。09 是小时,0C 是次数,C1/C4 是计数;WD 的 C3 RAW 还可能是厂商私有结构。4
- "C5 出现就必须立刻换盘。" 不准确。C5 是待处理状态,可能在成功写入后清除,但出现时仍应立即备份和持续观察。
- "机械盘和 SSD 看同样的属性。" 错误。SSD 没有 C1/C5/C6 等机械语义的一一对应,应看 NVMe 固定字段或厂商专用字段。
- "SSD 没有坏道概念,所以不用看 SMART。" 错误。SSD 有 NAND 坏块、ECC、数据路径和端到端完整性问题,0E、Available Spare、% Used 同样重要。
- "温度低就一定好。" 错误。过低温度可能影响机械润滑与结露,关键是处于制造商规格和环境稳定区间;NVMe 还应看 WCTEMP/CCTEMP。
- "通电时间越长越该换。" 错误。通电小时只代表使用量;一块稳定、有备份的旧盘可能比新购二手清零盘更可靠。
- "05 清零后继续用就修好了。" 错误。清零、重置 SMART 只是移除记录,不改变介质缺陷;任何可清零 SMART 的盘都应视为可疑。
- "C7 增长说明盘坏了。" 错误。C7 通常是数据线、端口、桥接或供电问题,应先更换连接部件。
- "只看一次快照就下结论。" 错误。阈值告警、首次部署的历史值和短期波动都可能有歧义;连续趋势才能判断是活跃劣化。
- "跑完扩展自检通过,就可以取消备份。" 错误。自检增加覆盖机会,但不能保证未来不发生突然故障。
- "USB 显示 Unknown 就说明硬盘损坏。" 错误。桥接芯片和 RAID 控制器可能不透明传 SMART,应改直连或用支持透传的工具验证。
- "NVMe 0E 就是 SSD 的物理坏道数。" 错误。0E 是媒体和数据完整性错误的汇总,可能来自 ECC、CRC、LBA/标签或内部路径问题。
- "Percentage Used 达到 100 就立即坏。" 不准确。Intel/NVM Express 明确说明它表示估计耐久度已消耗,并允许超过 100,不自动等于故障。6
- "一次全盘写入把 C5 清零,就是完成了数据恢复。" 错误。写入可能改变缺陷表,却无法恢复已损坏的旧内容;正确顺序应先备份再处理。
结语
稳健的硬盘健康管理应由三层组成:第一层是协议层,明确 ATA 属性表与 NVMe 健康日志的边界;第二层是判读层,把阈值、RAW 趋势、设备元数据和自检结果结合;第三层是运维层,以只读保全优先、备份优先和替换优先替代"尝试修复优先"。CrystalDiskInfo 是 Windows 上优秀的快速巡检入口,但长期体系应把它与 smartmontools、厂商工具、备份校验、趋势日志和自动化告警组合。最终目标不是给每块盘贴上"健康/故障"的静态标签,而是在数据价值、故障概率、访问风险与替换成本之间,持续作出可审计、可执行的决策。