跳转到内容

SMART 检测与硬盘健康监控

硬盘很少毫无征兆地突然死亡,多数情况下会先出现可观测的劣化信号。SMART 就是硬盘自己记录的这些信号。

关注这几项指标

硬盘会报告几十项 SMART 属性,但真正值得盯的只有少数几个:

指标含义该警惕的情况
重映射扇区数(Reallocated Sector Count)已经坏掉、被替换的扇区数量从 0 变成非 0,且持续增长
待定扇区数(Current Pending Sector)读取有问题、等待处理的扇区任何非 0 都应关注
不可修正错误(Offline Uncorrectable)无法纠正的读写错误非 0 意味着已有数据读不出来
通电时间(Power On Hours)累计运行时长用于判断盘龄,二手盘必看
温度当前温度长期高于 45 °C 需要改善风道

数值本身没有绝对阈值

不同厂商对这些计数的记录方式不完全一致。变化趋势比绝对值更有意义:一块盘的重映射扇区常年是 4,和一个月内从 0 涨到 40,是完全不同的两件事。

两种检测的区别

  • 短检测:几分钟完成,检查硬盘的关键部件和部分区域。适合频繁执行。
  • 长检测(完整表面扫描):读取全盘,能发现短检测漏掉的坏扇区。耗时数小时,对性能有影响。

建议的节奏是:短检测每周一次,长检测每月一次,安排在夜间或无人使用的时段。新买的盘和二手盘在放数据之前,先跑一次完整的长检测。

设置告警

检测本身不会主动提醒你。要让它有意义,必须把通知配起来:

  1. 在系统通知设置中配置一个能真正送达的渠道,邮件的配置方法见开启邮件通知
  2. 开启存储和硬盘相关的告警项。
  3. 发一条测试通知,确认能收到。没验证过的告警,和没配置一样。

发现异常之后

  1. 不要慌,但也不要忽略。 先确认这块盘上的数据在别处有备份。
  2. 跑一次长检测,看错误是否重现和增长。
  3. 计数持续增长,或出现不可修正错误 —— 准备换盘,见扩容与换盘
  4. 盘在保修期内,凭 SMART 记录通常可以申请更换。

另一类信号:日志里的报错

SMART 正常,不代表一切正常。数据线接触不良、扩展卡不稳定、供电不足,都会表现为系统日志中的 I/O 错误或磁盘掉线,而 SMART 可能一切健康。遇到「SMART 没问题但盘老是掉」的情况,优先怀疑线材、扩展卡和电源,见主板与扩展

检查结果

确认三件事:定期检测计划已启用、通知渠道已测试通过、每块盘的当前 SMART 关键指标已记录下来作为基线。有了基线,以后才能判断是不是在恶化。

延伸阅读

fnOS 非官方中文使用指南,与飞牛官方无隶属关系。