一季度 35 万块硬盘的故障率数据该怎么读

一家云存储服务商公布了第二季度的硬盘运行数据。这一季监控了 359,101 块硬盘,剔除不满足统计条件的启动盘之后,进入统计的是 354,415 块。季度年化故障率 1.73%,是近几个季度的高位。截至 6 月 30 日的全生命周期年化故障率 1.41%,比上季略有上升。单看这两个数,容易得出硬盘变差的结论。把分布和样本量铺开,结论会变。

入选门槛决定数字含义

统计按型号给出,门槛是样本超过 100 块、盘天数超过 10,000 天。年报表和生命周期表的门槛更高。为什么要设门槛,这一季的三个异常值最能说明。一款 10TB 盘样本 965 块,故障 22 次,年化故障率算出来 9.33%。另一款 14TB 盘样本 1,235 块,故障 25 次,8.26%。绝对次数都不高,样本一小,比率被放大。按四分位分析,异常线划在 6.95%,这三款都在线上。报告里点名了两款的年龄,一款接近七年,一款接近八年半。

零故障同样有样本量问题

这一季有三款盘零故障,样本分别是 239、1,079 和 497 块。零故障很醒目,它同样受样本限制。生命周期表里有一款 16TB 盘在 35,100 块的规模上年化故障率 0.68%。这个数字的信息量远高于小样本的零。厂商、型号、容量、服役月数、样本数和故障次数要一起看,单独挑一个比率排名会失真。

分布偏高与结构变化

31 个纳入统计的型号里有 10 个年化故障率超过 3%。报告里提到这个分布比往常偏高,也还没做完整的稀有度分析。这一季有两款服役接近九年和八年的老盘完全退出,连续两个季度没有新增型号。新部署集中在 20TB 以上,这部分已经超过样本的四分之一。老盘退役和结构上移同时发生。哪一个在推高平均值,报告里没给结论,只提醒后面几个季度继续看。

容量上升带来的介质变化

厂商提高单盘容量的办法之一是改变磁道排布。传统记录让磁道并列,中间留保护间隔,改写任意磁道互不影响。叠瓦式记录把磁道部分重叠,同一块盘片上能多放大约 10% 到 25% 的数据。代价是改中间一段可能牵动覆盖它的部分,磁道于是按带或区组织,更新数据可能要重排整个区域。按管理者分三种,盘内固件自行处理、主机按区顺序写、两者结合。读性能两者接近,顺序写都合适,差别集中在随机重写和复杂度由谁承担。

选型和运维上要改的判断

密度提升带来的是每盘位更多太字节、每机架更低功耗。采购的算法从单价太字节变成项目规划。叠瓦盘适合顺序写和追加型负载,频繁小块重写的场景要先做持续写测试和重建性能测试,校验冗余开销、固件版本和上层存储软件都要纳入评估。热辅助磁记录是另一条路线,用激光瞬间加热盘片上的微小区域,写入更小更稳的磁粒,玻璃基板在 2.5 英寸产品上已是标配。两条路线可以叠加,选型时要先看负载形态,再比容量和价格。

常见问题

年化故障率 1.73% 算高吗?

要看跟谁比。同口径的季度数相比,这一季偏高,但还没到需要更换供应商的程度。需要警惕的是某个型号在自己的样本上连续几季走高。

能拿这份数据买盘吗?

样本量小的型号参考价值有限,寿命结论要等生命周期表。数据中心选型还要叠加重建时间、功耗曲线和固件缺陷记录,季度故障率只是其中一项。

原始数据能自己算吗?

可以。逐型号的样本数、盘天数和故障次数整理成了开放数据集,下载条款允许自用,附带署名和不转售两项条件。自己复算一遍比看汇总表更靠得住。