35만 대 하드디스크 분기 점검: 같은 규격에서도 고장률이 10배 벌어지는 이유

35만 대 하드디스크 분기 점검: 같은 규격에서도 고장률이 10배 벌어지는 이유

스토리지하드웨어클라우드 컴퓨팅

데이터 소스:Backblaze Drive Stats

35만 대 드라이브가 기록한 1.73%의 고장률

2026년 9월 말, 백블레이즈(Backblaze)가 2026년 2분기(Q2) 데이터센터 하드디스크 수명 보고서를 발표하면서 핵심 지표 하나가 즉각 경고등을 켰다. 분기 연간 환산 고장률(AFR)이 1.73%까지 치솟은 것이다. 이는 단순한 미세한 등락이 아니라, 상당한 기간 내 기록된 수치 중 가장 높은 기록이다. 이번 분기 분석 대상에 포함된 354,415대의 하드디스크는 총 31,553,350 드라이브 일수(Drive Days)를 누적하며 1,498건의 실제 고장을 일으켰다. 데이터센터 운영 환경에서 하루하루 쌓이는 드라이브 일수는 고스란히 운영 비용으로 환산되며, 단 한 번의 고장 발생도 시스템의 데이터 이중화 복구 능력을 실전 시험대에 올린다. 35만 대라는 거대한 표본은 제조사의 마케팅 수식을 걷어내고 하드웨어가 겪는 가장 적나라한 노화 궤적을 드러낸다. 고장률 수치가 소수점 한 자리 오를 때마다 야간 전산실에서 디스크를 교체하는 엔지니어의 손길도 분주해진다.

많은 사람은 고장률 상승을 접하면 제품의 초기 품질 관리나 제조 결함을 탓하곤 한다. 그러나 13년 넘게 꾸준히 축적된 이 모니터링 데이터는 다른 진실을 말해준다. 이번 분기에 집계된 31개 모델 중 무려 10개 모델의 연간 환산 고장률이 3.0%라는 높은 기준선을 넘어섰다. 수명 주기의 황혼기에 접어든 노후 장비들이 거시적 관점에서 전체 평균치를 대폭 끌어올린 것이다.

높은 고장률의 본질은 클라우드 전산실의 장비 노후화 현상이다. 각각 8년과 9년 가까이 밤낮없이 가동되던 HGST의 4TB 및 8TB 구형 모델 두 종이 이번 분기를 끝으로 공식 퇴역했다. 이와 동시에 2개 분기 연속으로 완전한 신규 모델의 도입이 전무하면서, 스토리지 클러스터 전체의 평균 연령이 비가역적으로 높아졌다. 퇴역 직전의 노후 디스크들이 통계 수치를 끌어올린 사실은, 하드디스크가 시간이 흐를수록 마모가 가속화되는 대표적 소모성 자산임을 다시금 입증한다.

2026년 2분기 분기 연간 환산 고장률 추이 그림: 최근 뚜렷한 상승세를 보이는 분기별 연간 환산 고장률. 출처: Backblaze Drive Stats

동일한 폼팩터에서 10배 벌어지는 격차

일반 소비자 시장에서 하드디스크를 구매할 때는 흔히 용량과 폼팩터(3.5인치 등) 규격만을 눈여겨본다. 하지만 대규모 클라우드 스토리지라는 현미경 아래에서는 겉으로 드러난 규격이 무색해진다. 예컨대 16TB 제품군을 살펴보면, 씨게이트(Seagate)의 ST16000NM001G 모델은 이번 분기 0.65%의 고장률을 기록했고, 도시바(Toshiba)의 MG08ACA16TA는 1.01%를 기록했다. 두 모델은 각각 3만 대 이상 현장에서 돌아가는 주력 기종으로서 매우 견고한 기초 체력을 유지하고 있다.

그러나 똑같은 3.5인치 대형 규격임에도 HGST의 12TB 모델(HUH721212ALN604)은 분기 연간 환산 고장률이 무려 7.63%까지 치솟았다. 동일한 시대에 생산된 비슷한 용량대의 제품임에도 모델 간 성능 차이가 10배를 웃돈 것이다. 기업이 하드디스크를 구매한다는 것은 단순한 부품이 아니라 특정 생산 배치와 그 이면에 깔린 제조 공정 자체를 전산실 안으로 들여오는 행위임을 뜻한다.

사분위수 분석을 통해 도출된 세 가지 이상치(AFR 6.95% 초과)는 더욱 극명하다. 앞서 언급한 7.63%의 HGST 외에도 씨게이트의 ST10000NM0086(10TB)은 9.33%에 달했고, 씨게이트 ST14000NM0138(14TB) 역시 8.26%를 기록했다. 뒤의 두 모델은 운용 수량이 각각 965대와 1,235대에 불과하여 35만 대 전체 규모에 비하면 지극히 미미한 수준이다. 그럼에도 10%에 육박하는 고장률이 나타난 까닭은, 오랜 장비 연령과 작은 모수가 맞물리면서 불과 스무 건 안팎의 고장만으로도 비율이 순식간에 치솟았기 때문이다.

무결점 명단 뒤에 숨은 표본 수의 함정

표면적인 실적표만 본다면 이번 분기 씨게이트는 흠잡을 데 없는 독무대를 펼쳤다. 무고장 기록을 달성한 모델 목록 전체를 씨게이트가 독식했기 때문이다. ST8000NM000A, ST12000NM000J, ST14000NM000J 모델은 석 달 동안 단 한 건의 고장도 발생하지 않았으며, 동일 시리즈의 16TB 모델 또한 단 1건의 장애만 기록했다. 연간 환산 고장률이 3%를 넘나드는 수많은 모델 사이에서 이 제품들은 놀라울 정도로 깨끗해 보인다.

하지만 그 이면에는 통계적 함정이 도사리고 있다. 이들 무고장 모델은 모두 운용 대수가 500대 미만이거나 누적 드라이브 일수가 부족하여, 장기적 신뢰성을 평가하는 누적 수명(Lifetime) 통계표에 오를 자격조차 얻지 못했다. 심지어 한 기종은 운용 대수가 고작 171대에 불과했다. 테스트 표본이 수백 대 규모로 줄어들면, 3개월 동안 고장이 단 한 대도 나오지 않는 것은 확률적으로 지극히 자연스러운 현상이다.

고장률 산정에는 반드시 충분한 시간 축과 방대한 모수가 뒷받침되어야 한다. 수천만 단위의 드라이브 일수를 배제한 채 무고장을 논하는 것은 룰렛에서 한 번 이겼다고 스스로를 승부사라 자처하는 것과 다를 바 없다. 소규모 표본은 통계적 착시로 가짜 기적을 만들어내기 쉬우며, 이것이 바로 백블레이즈가 분기별 집계와 누적 수명 집계에 엄격한 모수 기준을 설정하는 이유다. 수백 대의 단기 기록을 수만 대의 장기 안정성과 동일시하는 것은 위험한 자기기만이다.

누적 수명 연간 환산 고장률 추이 그림: 시간 축을 길게 늘렸을 때 비로소 드러나는 모델별 실제 성능. 출처: Backblaze Drive Stats

대형화된 디스크가 소프트웨어에 떠넘긴 숙제

구형 드라이브의 노후화 속에서도 데이터센터의 용량 증설은 멈추지 않는다. 이번 분기 데이터셋에서 20TB 이상 대용량 드라이브의 비중은 이미 25%를 돌파했으며, 인프라 확충의 무게중심은 지속적으로 고용량 제품군으로 이동하고 있다. 웨스턴디지털(WD)은 올해 40TB UltraSMR 드라이브를 발표했고, 2029년까지 100TB에 도달한다는 명확한 로드맵을 제시했다. 저장 밀도의 폭발적 성장은 데이터센터 인프라의 근간을 근본적으로 재편하고 있다.

이러한 용량 도약의 중심에는 기와식 자기 기록(SMR) 기술이 자리 잡고 있다. 전통적인 수직 자기 기록(CMR)은 트랙 사이에 보호 영역을 두고 나란히 배치한다. 반면 SMR은 지붕의 기와처럼 트랙을 겹쳐서 기록한다. 쓰기 헤드가 읽기 헤드보다 넓다는 물리적 특성을 활용하여, 트랙을 일부 겹쳐 쓰더라도 읽기 헤드가 데이터를 판독할 수 있도록 함으로써 플래터당 용량을 10%에서 25%까지 더 쥐어짜 내는 원리다.

그러나 이러한 물리적 구조는 소프트웨어 응용 계층에 직접적인 파장을 불러온다. SMR은 데이터 워크로드의 형태를 몹시 가린다. 순차 쓰기나 덧붙이기 방식의 작업은 매끄럽게 처리하지만, 빈번한 무작위 수정 작업이 발생하면 광범위한 트랙 재정리와 가비지 컬렉션 부담이 폭증한다. 드라이브가 자체 관리하든(Drive-managed), 호스트가 직접 관리하든(Host-managed), 혹은 호스트 인식 방식(Host-aware)이든 간에 상위 운영체제와 스토리지 소프트웨어의 전면적인 최적화가 필수적이다. 랙 공간을 아껴 용량을 늘린 대가로, 하드웨어 하부의 복잡성을 소프트웨어 계층이 고스란히 떠안게 된 셈이다.

유리 기판 교체와 100TB를 향한 도전

기록 밀도를 높이려는 물리적 시도는 이제 한계선에 다다르고 있다. 열 보조 자기 기록(HAMR) 기술은 레이저로 플래터 위의 미세한 지점을 순간적으로 가열하여, 훨씬 작고 열적으로 안정한 자성 입자에 데이터를 기록할 수 있게 해준다. 이 기술은 SMR과 서로 다른 차원의 물리적 제약을 해결하기 때문에, 제조사들은 미래 100TB 목표를 달성하기 위해 HAMR과 SMR 기술을 하나의 드라이브에 결합하여 적용할 계획이다.

고온 가열과 극도의 정밀도 요구를 견뎌내기 위해 전통적인 알루미늄 합금 플래터는 역사의 뒤안길로 물러나고 있다. 2.5인치 HAMR 드라이브에서는 이미 유리 기판이 표준으로 자리 잡았으며, 3.5인치 대용량 제품군에서도 유리 소재 채택이 급속히 늘고 있다. 하드웨어의 뼈대를 바꾸는 것은 근본적인 대수술이며, 이는 알루미늄 합금의 물리적 한계가 바닥을 드러냈음을 시사한다. 이제 데이터센터의 주도권 다툼은 기초 재료과학의 경쟁으로 진화했다. 드라이브 한 대의 용량이 극적으로 커질수록, 기록 밀도를 높이기 위해 더욱 정밀한 열 제어와 강력한 기계적 안정성이 요구된다.

현재 백블레이즈의 35만 대 플릿에는 아직 SMR 드라이브가 도입되지 않았다. 그러나 백블레이즈는 신기술 드라이브가 현장에 투입되는 즉시 별도로 분류하여 고장률을 추적 공개하겠다고 밝혔다. 하드디스크 내부에 얼마나 많은 유리 플래터가 들어가든, 클라우드 운영사에게 주어진 과제는 오직 하나다. 장비가 노후화되는 과정 속에서도 예측 가능한 안정적 신뢰성을 유지하는 것이다. 100TB 유리 드라이브가 보편화되는 시대에는, 데이터의 생존선이 개별 하드웨어의 내구성에만 머물지 않고 하부 장비에서 전해지는 충격을 스토리지 오케스트레이션 시스템이 얼마나 안정적으로 흡수해 내는가에 달려 있다.

참고 링크:

  • Backblaze Drive Stats 보고서