35 万块盘跑出 1.73% 故障率
2026 年 9 月底,Backblaze 公布了 Q2 2026 的数据中心硬盘寿命报告,一个核心数据直接拉响了警报:季度年化故障率攀升至 1.73%。这不仅仅是一个微小的跳动,这是相当长一段时间以来的最高值。本季度,354,415 块进入分析的硬盘一共堆积了 31,553,350 个盘日,发生 1,498 次实打实的故障。在数据中心的运作逻辑里,每一天的盘日累积都是成本,而每一次故障的发生,都意味着数据冗余机制经受了一次真实考验。三十五万块硬盘的基数足以抹平品牌营销的修饰,把硬件最真实的衰老轨迹暴露出来。数字每攀升一点,机房夜间换盘的频率就又高了几分。
很多人习惯将故障率上升归咎于品控。但这份连续发布 13 年的监控数据揭示了另一个事实:本季度 31 个受统计型号里,有 10 个型号的年化故障率跨过了 3.0% 的高位线。这批处于生命周期后期的设备,在宏观上拉高了整体的平均值。
高故障率本质上是机队老龄化在云机房的翻版。两块分别服役近八年和九年的 4TB、8TB HGST 老盘在本季度正式退场,同时连续第二个季度没有全新型号入库,整个存储集群的平均年龄不可逆地增加了。老盘退役前夕拉高统计数据,验证了硬盘是一项随时间加速磨损的消耗资产。
图:季度年化故障率在近期的显著攀升。来源:Backblaze Drive Stats
同尺寸硬盘拉开十倍差距
在消费市场上,买硬盘往往只看容量和尺寸,但在大规模云存储的显微镜下,表面的参数被直接撕碎。以 16TB 这一档位为例,Seagate ST16000NM001G 的本季故障率是 0.65%,Toshiba MG08ACA16TA 是 1.01%。这两款分别有三万多块盘在跑的主力型号,维持着相当稳健的底盘。
同样是 3.5 英寸的大块头,HGST HUH721212ALN604 这个 12TB 型号的季度年化故障率高达 7.63%。在同一时代、相近容量的货架上,不同型号之间的表现差距超过十倍。买硬盘就是把特定的批次连同它背后的生产工艺一起买进机房。
四分位分析界定的三个离群值更加刺眼:除了刚才提到的 7.63% 外,Seagate ST10000NM0086(10TB)到了 9.33%,Seagate ST14000NM0138(14TB)也有 8.26%。后两个型号的库存分别只有 900 多块和 1200 多块,这几百块盘在 35 万的大盘里微乎其微。它们之所以能制造出近百分之十的故障率,是因为机龄和基数发生了化学反应,一点风吹草动就能让比例翻倍。
零故障榜单藏着样本游戏
只看表面光鲜的榜单,Seagate 本季度可谓风光无限,包揽了本季全部零故障型号。ST8000NM000A、ST12000NM000J 以及 ST14000NM000J 在三个月内 0 故障,16TB 版本的同系列盘也仅仅坏了 1 次。在一堆年化故障率超过百分之三的名单里,这几个型号干净得让人惊讶。
但这背后隐藏着统计规则的陷阱。这几个型号全因为盘数不够 500 块或者盘日不足,连进入终身成绩单的资格都没有。其中一款盘的数量甚至只有 171 块。当测试样本被压缩到几百的规模,三个月不坏任何一块盘,在概率学上是一件符合预期的事情。
故障率的计算必须有时间维度和足够庞大的基数支撑。脱离了千万级别的盘日去谈零故障,就如同在轮盘赌上赢了一次便自诩赌神。小样本在统计学上容易造出虚假的奇迹,这也是 Backblaze 坚持在季度表和终身表中设置严格基数门槛的原因。把几百块盘的表现等同于几万块盘的稳定性,是一场自欺欺人的游戏。
图:时间维度拉长后各型号硬盘的真实表现。来源:Backblaze Drive Stats
硬盘变大逼迫软件填坑
旧盘在不断老化,机房扩容的车轮却没有停下。20TB 以上的硬盘在本季数据集里的占比已经超过 25%,部署重心持续向大容量集中。西部数据在今年公布了 40TB 的 UltraSMR 盘,并将路线图直接指向了 2029 年的 100TB。存储密度的暴涨,正在重塑整个数据中心的基础设施。
这场容量跃进中,叠瓦式磁记录(SMR)技术扮演了关键角色。传统磁记录(CMR)的磁道是并排排列的,中间留有保护间距。SMR 让磁道像屋顶瓦片一样重叠。写入磁头比读取磁头更宽,重叠一部分后依然能读出数据,这让盘片生挤出 10% 到 25% 的容量。
这种做法立刻在应用层引发了连锁反应。SMR 挑剔工作负载,顺序写和追加写很顺利,可一旦发生频繁的小范围改写,就会制造出大量的额外整理工作。不管是驱动管理的 SMR,还是主机感知的 SMR,都要求上层操作系统或应用程序做出适配。机架空间换取更多容量的代价,是把硬件底层的复杂性转嫁给了软件层处理。
换上玻璃基板再战 100TB
物理密度的挖掘已经到了边缘。热辅助磁记录(HAMR)技术采用激光短暂加热盘片上极小的一个点,使得磁头能够写在更小、更稳定的磁颗粒上。这项技术与 SMR 解决的并不是同一个维度的问题。存储厂商为了在未来实现 100TB 的目标,明确会把 HAMR 和 SMR 叠加在一块盘上使用。
为了支撑这些发热和精度要求,传统的铝基板正在大面积退场。2.5 英寸 HAMR 盘使用玻璃基板已经成为标准做法,在 3.5 英寸的高容量设计中,玻璃材质也越来越常见。更换物理骨架本身就是一次推翻重来的大手术,它暗示着铝合金这种材料的物理潜力已经被压榨到了极限。未来数据中心的竞争,很大程度上变成了基础物理材料的竞争。当单盘容量突破天际,存储密度的每一分增加,都需要更加精密的热量控制与更厚重的机械防线来保驾护航。
目前 Backblaze 的 35 万块盘机队里还没有混入 SMR 盘,但他们表态,等这些新技术盘进场后会单独标注并公布故障率。不管硬盘内部堆叠了多少张玻璃盘片,对于云存储厂商而言,核心命题只有一个:如何在设备老化的过程中,维持住那个稳定的百分比。当 100TB 的玻璃盘普及,整条数据防线将不再依靠单盘的素质,而是取决于调度系统能否接住硬件传导上来的压力。
参考链接:
- Backblaze Drive Stats 报告