Quartalsprüfung von 350.000 Festplatten: Zehnfache Ausfallrate trotz gleicher Baugröße

Quartalsprüfung von 350.000 Festplatten: Zehnfache Ausfallrate trotz gleicher Baugröße

SpeicherHardwareCloud Computing

Quellen:Backblaze Drive Stats

350.000 Festplatten erreichen 1,73 % Ausfallrate

Ende September 2026 veröffentlichte Backblaze seinen Drive-Stats-Bericht für das zweite Quartal 2026, und eine zentrale Kennzahl löste umgehend Besorgnis aus: Die annualisierte Ausfallrate (AFR) kletterte im Quartal auf 1,73 %. Dies war kein bloßes statistisches Rauschen, sondern der höchste Wert seit geraumer Zeit. Im Berichtszeitraum summierten die 354.415 analysierten Festplatten insgesamt 31.553.350 Betriebstage (Drive Days) und verzeichneten 1.498 tatsächliche Hardwareausfälle. Im Rechenzentrumsbetrieb schlägt jeder akkumulierte Betriebstag direkt als Betriebskosten zu Buche, während jeder einzelne Ausfall die Datenredundanzmechanismen einem realen Belastungstest unterzieht. Eine Datenbasis von über 350.000 Laufwerken entlarvt jedes Marketingversprechen und legt den schonungslosen Verschleißverlauf der Serverhardware offen. Mit jedem Zehntelprozentpunkt Anstieg nimmt auch die nächtliche Taktung für den Festplattentausch in den Servergängen spürbar zu.

Viele neigen dazu, steigende Ausfallraten voreilig auf Mängel in der Qualitätskontrolle der Hersteller zurückzuführen. Die seit über 13 Jahren erhobenen Langzeitdaten belegen jedoch eine andere Realität: Von den 31 erfassten Festplattenmodellen überschritten in diesem Quartal 10 Modelle die kritische Marke von 3,0 % AFR. Diese Laufwerke, die sich am Ende ihres Lebenszyklus befinden, haben den flottenweiten Durchschnitt massiv nach oben verzerrt.

Die hohe Gesamtausfallrate ist im Kern das Ergebnis einer fortschreitenden Flottenalterung im Cloud-Rechenzentrum. Zwei bewährte HGST-Laufwerke mit 4 TB bzw. 8 TB Kapazität, die fast neun bzw. acht Jahre im Dauereinsatz standen, wurden in diesem Quartal endgültig außer Dienst gestellt. Da zugleich das zweite Quartal in Folge keine völlig neuen Festplattenmodelle in den Bestand aufgenommen wurden, stieg das Durchschnittsalter des gesamten Speicherclusters unweigerlich an. Dass alternde Festplatten kurz vor ihrer Ausmusterung die Statistik nach oben treiben, bestätigt die Natur von Festplatten als klassische Verschleißgüter, deren Ausfallrisiko mit den Jahren exponentiell wächst.

Entwicklung der annualisierten Quartalsausfallrate für Q2 2026 Abb.: Deutlicher Anstieg der annualisierten Quartalsausfallrate in jüngster Zeit. Quelle: Backblaze Drive Stats

Zehnfache Differenz bei identischem Formfaktor

Im Endverbrauchermarkt orientiert sich die Kaufentscheidung meist schlicht an Kapazität und Baugröße. Unter dem Brennglas großskalierter Cloud-Infrastrukturen verlieren diese Oberflächenmerkmale jedoch rasch an Aussagekraft. Im 16-TB-Segment verzeichnete die Seagate ST16000NM001G in diesem Quartal beispielsweise eine Ausfallrate von nur 0,65 %, während die Toshiba MG08ACA16TA bei 1,01 % lag. Beide Modelle bilden mit jeweils über 30.000 aktiven Einheiten das verlässliche Rückgrat der Flotte.

Doch innerhalb desselben 3,5-Zoll-Formfaktors schoss die 12-TB-HGST HUH721212ALN604 auf eine vierteljährliche Ausfallrate von 7,63 % hoch. Bei Modellen ähnlicher Generation und vergleichbarer Kapazität klafft eine Leistungslücke um mehr als das Zehnfache. Wer Festplatten beschafft, erwirbt eben nicht nur ein Datenblatt, sondern bindet sich an eine konkrete Produktionscharge samt deren Fertigungstoleranzen.

Die Quartilsanalyse markiert drei eklatante statistische Ausreißer (AFR über 6,95 %): Neben den erwähnten 7,63 % kletterte die Seagate ST10000NM0086 (10 TB) auf 9,33 %, und die Seagate ST14000NM0138 (14 TB) erreichte 8,26 %. Die beiden letztgenannten Modelle waren mit Beständen von lediglich 965 bzw. 1.235 Stück im Verhältnis zur 350.000er-Gesamflotte winzig. Dass sie dennoch Ausfallraten von annähernd zehn Prozent generierten, liegt an der mathematischen Wechselwirkung zwischen fortgeschrittenem Alter und kleinem Nenner: Bereits eine Handvoll Ausfälle verdoppelt hier die prozentuale Rate.

Die Tücken kleiner Stichproben hinter der Null-Fehler-Liste

Oberflächlich betrachtet feierte Seagate in diesem Quartal einen triumphalen Erfolg und stellte sämtliche Modelle ohne einen einzigen Ausfall. Die Modelle ST8000NM000A, ST12000NM000J sowie ST14000NM000J blieben drei Monate lang fehlerfrei, und auch die 16-TB-Variante derselben Baureihe verzeichnete lediglich einen Defekt. Inmitten von Modellreihen mit Ausfallraten jenseits der 3 % wirken diese Zahlen makellos.

Dahinter verbirgt sich jedoch eine methodische Falle der Statistik. Keines dieser Modelle erfüllte die Mindestkriterien von 500 Laufwerken und 100.000 kumulierten Betriebstagen, um in die lebenslange Gesamttabelle aufgenommen zu werden. Eines der Null-Fehler-Modelle war mit gerade einmal 171 Laufwerken vertreten. Wird die Stichprobe auf wenige hundert Exemplare über drei Monate verengt, ist eine fehlerfreie Phase schlicht ein probabilistischer Erwartungswert und kein Beleg für überlegene Zuverlässigkeit.

Belastbare Ausfallraten erfordern einen langen Zeithorizont und ein signifikantes statistisches Fundament. Ohne zweistellige Millionenwerte an Betriebstagen von Null Fehlern zu sprechen, gleicht dem Verhalten eines Spielers, der sich nach einem einzigen Roulette-Gewinn für unbesiegbar hält. Kleine Kohorten erzeugen rasch statistische Scheinwunder. Aus genau diesem Grund setzt Backblaze strenge Hürden für seine Quartals- und Gesamtauswertungen an. Die kurzzeitige Performanz von einigen hundert Festplatten mit der Langzeitstabilität von zehntausenden Einheiten gleichzusetzen, ist ein Trugschluss.

Entwicklung der lebenslangen annualisierten Ausfallrate Abb.: Reale Leistung einzelner Festplattenmodelle im Langzeitverlauf. Quelle: Backblaze Drive Stats

Wachsende Kapazitäten verlagern Komplexität in die Software

Während Altbestände altern, schreitet der Kapazitätsausbau unaufhaltsam voran. Laufwerke ab 20 TB machen inzwischen über 25 % des erfassten Bestands aus, und Neuinstallationen konzentrieren sich zunehmend am oberen Ende der Kapazitätsskala. Western Digital stellte in diesem Jahr ein 40-TB-UltraSMR-Laufwerk vor und präsentierte eine Roadmap, die bis 2029 die 100-TB-Marke anpeilt. Diese rapide wachsende Speicherdichte verändert die Infrastruktur moderner Rechenzentren grundlegend.

Bei diesem Kapazitätssprung spielt die Shingled-Magnetic-Recording-Technologie (SMR) eine Schlüsselrolle. Bei herkömmlicher Aufzeichnung (CMR) liegen die Datenspuren parallel nebeneinander, getrennt durch Sicherheitsabstände. SMR hingegen überlappt die Spuren dachziegelartig. Da der Schreibkopf physikalisch breiter ist als der Lesekopf, bleibt der überlappte Datenstreifen für den Lesekopf lesbar, wodurch sich pro Platter 10 % bis 25 % mehr Speicherplatz gewinnen lassen.

Dieser Architekturwechsel zieht unmittelbare Konsequenzen für die Software nach sich. SMR stellt hohe Ansprüche an das Workload-Profil: Sequenzielle Schreibvorgänge und Append-Operationen laufen effizient ab, doch häufige, verstreute Überschreibungen erfordern massive Reorganisations- und Garbage-Collection-Prozesse. Ob Drive-managed SMR, Host-aware SMR oder Host-managed SMR – stets müssen Betriebssystem und Speicheranwendungen angepasst werden. Der Raumgewinn im Serverrack wird damit erkauft, dass die mechanische Komplexität der Hardware in höhere Softwareschichten verlagert wird.

Glassubstrate ebnen den Weg zu 100 TB

Die physikalischen Grenzen der Flächendichte sind nahezu erreicht. Heat-Assisted Magnetic Recording (HAMR) nutzt einen mikroskopischen Laserimpuls, um die Oberfläche beim Schreibvorgang kurzzeitig zu erhitzen, sodass Schreibköpfe auf kleinere, thermisch stabile Magnetkörner schreiben können. Da HAMR und SMR voneinander unabhängige physikalische Engpässe lösen, kombinieren die Hersteller beide Verfahren, um die 100-TB-Grenze zu knacken.

Um den extremen thermischen Belastungen und mikroskopischen Toleranzen standzuhalten, weichen traditionelle Aluminium-Platter zunehmend Glas-Substraten. Bei 2,5-Zoll-HAMR-Laufwerken ist Glas bereits Standard, und auch in hochkapazitiven 3,5-Zoll-Designs setzt sich das Material durch. Der Wechsel des Trägermaterials markiert einen tiefgreifenden ingenieurtechnischen Einschnitt und signalisiert, dass das physikalische Potenzial von Aluminiumlegierungen ausgereizt ist. Der Wettbewerb um Rechenzentrumskapazität wandelt sich zur Materialschlacht: Jedes zusätzliche Terabyte erfordert präzisere thermische Kontrolle und robustere mechanische Dämpfung.

In der aktuellen Flotte von Backblaze mit 350.000 Laufwerken befinden sich noch keine SMR-Laufwerke. Das Unternehmen kündigte jedoch an, künftige Neuzugänge dieser Technologie gesondert zu kennzeichnen und deren Ausfallraten transparent auszuweisen. Unabhängig davon, wie viele Glas-Platter im Inneren rotieren, bleibt die Kernaufgabe für Cloud-Betreiber unverändert: Die Ausfallwahrscheinlichkeit über den Alterungsprozess der Flotte hinweg berechenbar zu halten. Wenn 100-TB-Laufwerke auf Glasbasis zum Standard werden, ruht die Datensicherheit nicht mehr auf der Unfehlbarkeit einzelner Datenträger, sondern auf der Fähigkeit übergeordneter Orchestrierungssysteme, die unvermeidlichen Hardware-Turbulenzen abzufedern.

Weiterführende Links:

  • Backblaze Drive Stats Bericht