家里的 NAS 有个很讨厌的特点:它平时太安静了。硬盘转着、灯亮着、共享目录能打开,你就默认它一切正常。直到某天开机变慢、复制文件卡住、或者干脆掉了一块盘,你才开始翻日志——而这时候往往已经晚了几个星期。
我自己踩过一次:一块 4T 盘的重映射扇区其实从两个月前就开始涨,NAS 的通知只发到了机器内部的邮件收件箱,我从来没打开过。等到 RAID 降级弹窗跳出来,才发现另一块盘的温度也常年偏高。那次没丢数据,纯属运气。
所以这篇不谈选购、不谈备份策略,只谈一件很少有人认真做完的事:把 NAS 的健康监控和告警配到位。整套东西一个下午能搞完,之后基本靠它自己盯着。
先分清"能用"和"安全"是两件事
大多数家用 NAS 出厂就是"够用"的配置:硬盘装上、阵列建好、共享开通,系统默认只在出大事的时候提醒你。问题是硬盘几乎从不猝死,它们几乎都是先有征兆——坏道慢慢增加、读写重试变多、寻道声音变化、温度一路走高。真正致命的不是故障本身,而是这段征兆期你完全不知情。
所以监控的目标不是"知道它坏了",而是"在它还能正常读写的时候就知道它快不行了"。这段窗口期通常有几周甚至几个月,足够你从容地买盘、迁数据、重建阵列。
硬盘健康:SMART 里真正值得看的几项
NAS 系统一般都内置了硬盘 SMART 检测,界面上会列一堆参数,看多了容易眼花。日常真正需要留意的其实是几个:
重映射扇区计数(Reallocated Sector Count)。这是硬盘把坏掉的扇区替换成备用扇区的次数。数值从 0 变成个位数,不必立刻慌,但要记下当前值;如果一两周内持续往上涨,就该准备换盘了。稳定不动的老盘,比数值虽小但一直在涨的新盘安全得多。
待映射扇区计数(Current Pending Sector)。这是"检测到有问题但还没处理"的扇区,比上一项更值得警惕。它长期非零,说明盘面已经开始出问题。
通电时间。家用 NAS 常年 7×24 运行,三五年下来轻松四万小时。这个数字本身不代表坏,但可以帮你判断"这块盘该进入重点观察名单了"。
设置上建议做两件事:把 SMART 快速检测设成每周自动跑一次,完整检测设成每月一次(放在半夜,避开你看影片和备份的时间段)。另外,如果你用的是 ZFS 或 Btrfs 这类带校验的文件系统,记得把数据擦洗(Scrub)也排进月度计划——它能提前发现静默的数据损坏,这是 SMART 查不出来的。
温度和风道,比很多人以为的更重要
硬盘长期在偏高温度下工作,寿命会明显缩短。一般来说,机械盘工作温度控制在 45 度以内比较稳妥,长期超过 50 度就该处理了。
家用环境里温度高,八成不是 NAS 本身的问题,而是摆放位置:塞在电视柜密闭隔间里、贴着墙角、压在路由器上面、或者干脆和一堆电源适配器挤在一起。处理办法很朴素——挪个位置,让前后进出风都留出空间,别让它吸自己吐出来的热风。夏天如果房间本身温度就高,把风扇模式从"静音"改成"智能/自动",多几分贝换十几度,很值。
顺手把温度告警阈值也设一下,比默认值调低几度,让它在真正过热之前就提醒你。
断电是最容易被忽略的杀手
相比硬盘老化,突然断电对家用 NAS 的威胁其实更现实。夏天空调跳闸、装修施工拉闸、老小区电压不稳,都可能让正在写入的 NAS 直接断电。轻则触发一次长时间的阵列校验,重则损坏文件系统元数据。
解决办法只有一个真正有效:加一台小 UPS。家用不需要多大,能撑五到十分钟就够——重点不是让 NAS 继续干活,而是让它有时间安全关机。
买回来别只插上就算完。要进 NAS 系统里把 UPS 用 USB 线连上、启用 UPS 支持,然后设置"电池模式持续 X 分钟后自动安全关机"。这一步不配,UPS 只是给你争取了几分钟无人值守的续命时间,断电依然是硬断。如果家里有多台设备(比如 NAS 加交换机加光猫),可以让 NAS 做主机、其他设备做从机,一起联动关机。
告警必须能推到你手机上
这是最关键、也最常被跳过的一步。前面所有监控做得再细,通知发不到你眼前,等于没做。
建议至少配两条通道:一条是邮件,用你每天会看的那个邮箱,注意在 NAS 里填好发信服务器(很多品牌需要用应用专用密码而不是登录密码,别忘了这点);另一条是即时推送,用官方手机 App 的推送,或者接一个你自己常用的消息机器人。两条通道互为备份,避免邮箱把它判成垃圾邮件后你彻底失联。
配完一定要点一次"发送测试通知",确认手机真的响了。同时把告警级别筛一下:硬盘、阵列、UPS、温度这几类必须推送;登录成功、备份完成之类的日常信息可以只留在日志里,否则通知太多,你很快就会习惯性忽略——那和没配是一样的。
每月十分钟的巡检习惯
自动监控解决的是"出事有人喊你",但有些趋势只有人看才看得出来。给自己留一个每月十分钟的固定动作:
打开存储管理,看一眼每块盘的 SMART 关键值,和上个月比有没有变化;看一眼阵列状态和可用容量,容量长期超过八成会明显影响性能,也会让快照和重建变得吃力;看一眼系统日志里有没有反复出现的读写重试或掉盘记录;再确认最近一次自动检测和数据擦洗真的跑完了,而不是因为超时被中断。
如果你愿意多花两分钟,把关键数字记在一个便签或表格里。半年后回头看,哪块盘在慢慢变差会一目了然,比任何单次检测都直观。
写在最后
家用 NAS 的可靠性,从来不只取决于买了什么盘、组了什么阵列,更取决于你有没有在它出问题之前就收到消息。监控加告警这套东西没有技术门槛,花不了多少时间,却能把"突然丢数据"变成"提前几周计划换盘"。
今天就把这几件事做完:打开 SMART 定期检测、设好温度阈值、接上 UPS 并配置自动关机、把告警推到手机并测试一次。剩下的,交给它自己盯着就好。
还没有评论,快来抢沙发吧!