35万台のHDD定期検診:同サイズでも故障率に10倍の開き

35万台のHDD定期検診:同サイズでも故障率に10倍の開き

ストレージハードウェアクラウドコンピューティング

データソース:Backblaze Drive Stats

35万台の稼働で年間故障率1.73%を記録

2026年9月下旬、Backblazeは2026年第2四半期(Q2)のデータセンター向けハードディスク寿命レポートを公開しました。その中で示された一つのコア数値が、強い警戒感を呼んでいます。四半期の年換算故障率(AFR)が1.73%まで跳ね上がったのです。これは単なる一時的な小幅なブレではなく、ここ最近で最も高い水準となります。今四半期、分析対象となった354,415台のハードディスクは合計31,553,350ドライブ日(Drive Days)を積み上げ、その間に1,498件の現実の故障が発生しました。データセンターの運用において、日々の稼働の積み重ねはそのまま運用コストに直結し、故障が1件起きるたびにストレージの冗長性メカニズムが実戦でのテストに晒されます。35万台という圧倒的な母数は、ハードウェアメーカーのマーケティングによる装飾を削ぎ落とし、現場の過酷な経年劣化の足跡を赤裸々に描き出します。故障率の数値がわずかに上がるだけでも、サーバルームで夜間にディスク交換を行う頻度は確実に高まります。

多くの人は故障率の上昇を目にすると、製造時の品質管理に問題があったのではないかと疑いがちです。しかし、13年以上にわたって継続的に蓄積されてきたこの監視データは、別の事実を浮き彫りにしています。今期集計された31モデルのうち、10モデルで年換算故障率が3.0%の高水準を突破していました。ライフサイクルの終盤に差し掛かったこれら一連の古いモデル群が、マクロな視点で全体の平均値を押し上げたのです。

この高い故障率は、クラウドデータセンターにおけるハードウェアの経年劣化がそのまま数字に表れたものと言えます。今四半期には、それぞれ約8年と9年にわたって稼働し続けたHGST製の4TBおよび8TBの旧型ドライブ2種が正式に退役しました。その一方で、2四半期連続でまったく新しい型番の導入がなかったため、ストレージクラスタ全体の平均稼働年数は不可逆的に上昇しました。退役間際の老朽化したドライブが統計数値を引き上げた事実は、ハードディスクが時間とともに摩耗が加速していく消耗資産であることを改めて裏付けています。

2026年第2四半期 四半期年換算故障率の推移 図:四半期ごとの年換算故障率における直近の顕著な上昇。出典:Backblaze Drive Stats

同一サイズのドライブで生じる10倍の格差

一般のコンシューマー市場では、ハードディスクを選ぶ際に容量とフォームファクタ(3.5インチなど)だけで判断することが少なくありません。しかし、大規模クラウドストレージの顕微鏡を通すと、そうした表面的なスペックは一瞬にして色あせます。例えば16TBクラスを見ると、SeagateのST16000NM001Gの今四半期故障率は0.65%にとどまり、東芝のMG08ACA16TAは1.01%でした。それぞれ3万台以上が稼働している主力モデルであり、極めて安定したベースラインを維持しています。

しかし同じ3.5インチの大型ドライブであっても、HGSTの12TBモデル(HUH721212ALN604)の四半期年換算故障率は7.63%に達しました。同世代かつ近い容量帯の製品でありながら、モデル間のパフォーマンスには10倍以上の開きが存在します。データセンターにハードディスクを導入するということは、単にスペックを買うのではなく、特定の製造バッチとそこに投じられた製造プロセスそのものを引き受けることを意味します。

四分位分析によって特定された3つの外れ値(AFRが6.95%超)は、さらに顕著です。先述した7.63%のHGST製ドライブに加え、SeagateのST10000NM0086(10TB)は9.33%に達し、同じくSeagateのST14000NM0138(14TB)も8.26%を記録しました。後者の2モデルの保有台数はそれぞれ965台と1,235台にすぎず、35万台規模の全体から見ればごくわずかな数です。それにもかかわらず約10%もの故障率を叩き出したのは、ドライブの稼働年数の長さと母数の少なさが相乗効果を起こし、わずかな故障の発生だけで比率が一気に跳ね上がったためです。

ゼロ障害リストの裏に潜むサンプル数の罠

表面的なランキングだけを見れば、今四半期のSeagateは圧倒的な強さを見せ、ゼロ故障を達成した全モデルを独占したように見えます。ST8000NM000A、ST12000NM000J、ST14000NM000Jの3モデルは四半期を通して障害発生件数ゼロを維持し、同シリーズの16TBモデルでもわずか1件の故障にとどまりました。年換算故障率が3%を超えるモデルが並ぶ中で、これらは驚くほど優秀に見えます。

しかし、この実績の背後には統計的な罠が潜んでいます。これらのモデルはいずれも運用台数が500台に満たないか、あるいは稼働ドライブ日数が不足しているため、全期間(Lifetime)の集計表に掲載される基準すら満たしていません。あるモデルに至っては、運用台数がわずか171台しかありませんでした。テスト母数が数百台程度にまで絞り込まれている場合、3か月間に1台も故障が出ないことは、確率論的にごく当たり前に起こり得る現象です。

故障率の算出には、十分な時間の蓄積と巨大な母数の裏付けが欠かせません。数千万規模のドライブ日数を経ずにゼロ故障を語ることは、ルーレットで1回勝っただけでギャンブルの達人を名乗るようなものです。小さなサンプルサイズは統計上の偽りの奇跡を生み出しやすく、だからこそBackblazeは四半期および全期間の集計において厳格な母数基準を設けています。数百台規模の短期間の実績を、数万台規模で実証された安定性と同列に扱うことは、自己欺瞞にすぎません。

生涯年換算故障率の推移 図:運用期間が長期化する中で明らかになる各モデルの真のパフォーマンス。出典:Backblaze Drive Stats

大容量化が強いるソフトウェア層の複雑化

旧型ドライブが老朽化していく一方で、サーバルームの容量拡張の歩みが止まることはありません。今回のデータセットにおいて、20TB以上の大容量ドライブが占める割合はすでに25%を超えており、配備の重心は大容量帯へと急速にシフトしています。ウエスタンデジタルは今年40TBのUltraSMRドライブを発表し、2029年までに100TBに到達するというロードマップを掲げました。記録密度の急激な向上は、データセンターのインフラ構造そのものを根本から塗り替えようとしています。

この容量拡大の波の中で重要な役割を果たしているのが、SMR(瓦記録方式)技術です。従来のCMR(従来型磁気記録)では、トラック同士が保護領域(ガードバンド)を挟んで平行に並んでいます。一方、SMRは屋根の瓦のようにトラックを重ね合わせて記録します。書き込みヘッドの幅が読み取りヘッドよりも広いという物理的特性を利用し、トラックの一部を重ねてもデータ読み取りを可能にすることで、プラッタあたりの容量を10%から25%ほど引き出す仕組みです。

しかしこの設計は、アプリケーション層に即座に影響を及ぼします。SMRはワークロードの特性を強く選びます。シーケンシャルライトや追記処理は軽快にこなせる反面、頻繁なランダムリライトが発生すると、大規模な再配置やガベージコレクションが頻発します。ドライブ側で制御するDrive-managed SMR、ホストが制御するHost-managed SMR、あるいはその中間のHost-aware SMRのいずれであっても、上位のOSやアプリケーション側での最適化が求められます。ラックあたりの格納効率を高める代償として、ハードウェアの物理的な制約がソフトウェア層へと転嫁されているのです。

ガラス基板への移行と100TBへの挑戦

磁気記録密度の向上は、物理的な限界点に近づいています。HAMR(熱アシスト磁気記録)技術は、レーザーによってプラッタ上のごく微小なスポットを一瞬加熱することで、より小さく熱的に安定した磁性粒子への書き込みを可能にします。この技術とSMRは解決しようとしている物理的課題の次元が異なるため、ストレージメーカーは将来の100TB達成に向けて、HAMRとSMRを同一ドライブ上で組み合わせていく方針を明確にしています。

局所的な加熱と極限の精度要求に応えるため、従来のアルミニウム合金基板は姿を消しつつあります。2.5インチHAMRドライブではガラス基板の採用が標準となっており、3.5インチの高容量設計でもガラス素材の導入が急速に進んでいます。ディスクの構造素材そのものを刷新することは、ハードウェアの根本的な再設計を意味し、アルミニウムという素材の物理的ポテンシャルが限界まで絞り尽くされたことを示唆しています。データセンターの競争は、いまや基礎的な材料工学の競争へと移行しています。1台あたりの容量が桁外れに増大するにつれ、記録密度をわずかに高めるためにも、極めて精密な熱制御と堅牢な機械的耐性が不可欠になります。

現在、Backblazeが運用する35万台のフリートにはまだSMRドライブは含まれていません。しかし同社は、これら最新技術を採用したドライブが現場に導入され次第、個別に識別して故障率を公表する方針を示しています。筐体内部にどれほど多くのガラスプラッタが積層されようとも、クラウド事業者にとっての究極の命題はただ一つ、ハードウェアが老朽化していく中でいかに予測可能な信頼性を維持し続けるかです。100TBのガラス基板ドライブが普及する未来において、データ全体の防衛線は単一ドライブの品質に依存するのではなく、ハードウェアから伝わる負荷をストレージオーケストレーション層が的確に吸収できるかどうかに委ねられています。

参考リンク:

  • Backblaze Drive Stats レポート