外观
SMART 检测与硬盘健康监控
硬盘很少毫无征兆地突然死亡,多数情况下会先出现可观测的劣化信号。SMART 就是硬盘自己记录的这些信号。
关注这几项指标
硬盘会报告几十项 SMART 属性,但真正值得盯的只有少数几个:
| 指标 | 含义 | 该警惕的情况 |
|---|---|---|
| 重映射扇区数(Reallocated Sector Count) | 已经坏掉、被替换的扇区数量 | 从 0 变成非 0,且持续增长 |
| 待定扇区数(Current Pending Sector) | 读取有问题、等待处理的扇区 | 任何非 0 都应关注 |
| 不可修正错误(Offline Uncorrectable) | 无法纠正的读写错误 | 非 0 意味着已有数据读不出来 |
| 通电时间(Power On Hours) | 累计运行时长 | 用于判断盘龄,二手盘必看 |
| 温度 | 当前温度 | 长期高于 45 °C 需要改善风道 |
数值本身没有绝对阈值
不同厂商对这些计数的记录方式不完全一致。变化趋势比绝对值更有意义:一块盘的重映射扇区常年是 4,和一个月内从 0 涨到 40,是完全不同的两件事。
两种检测的区别
- 短检测:几分钟完成,检查硬盘的关键部件和部分区域。适合频繁执行。
- 长检测(完整表面扫描):读取全盘,能发现短检测漏掉的坏扇区。耗时数小时,对性能有影响。
建议的节奏是:短检测每周一次,长检测每月一次,安排在夜间或无人使用的时段。新买的盘和二手盘在放数据之前,先跑一次完整的长检测。
设置告警
检测本身不会主动提醒你。要让它有意义,必须把通知配起来:
- 在系统通知设置中配置一个能真正送达的渠道,邮件的配置方法见开启邮件通知。
- 开启存储和硬盘相关的告警项。
- 发一条测试通知,确认能收到。没验证过的告警,和没配置一样。
发现异常之后
- 不要慌,但也不要忽略。 先确认这块盘上的数据在别处有备份。
- 跑一次长检测,看错误是否重现和增长。
- 计数持续增长,或出现不可修正错误 —— 准备换盘,见扩容与换盘。
- 盘在保修期内,凭 SMART 记录通常可以申请更换。
另一类信号:日志里的报错
SMART 正常,不代表一切正常。数据线接触不良、扩展卡不稳定、供电不足,都会表现为系统日志中的 I/O 错误或磁盘掉线,而 SMART 可能一切健康。遇到「SMART 没问题但盘老是掉」的情况,优先怀疑线材、扩展卡和电源,见主板与扩展。
检查结果
确认三件事:定期检测计划已启用、通知渠道已测试通过、每块盘的当前 SMART 关键指标已记录下来作为基线。有了基线,以后才能判断是不是在恶化。