ds4가 입증한 프론티어 모델 로컬 추론: 메모리 용량이 재정의하는 하드웨어 문턱

ds4가 입증한 프론티어 모델 로컬 추론: 메모리 용량이 재정의하는 하드웨어 문턱

추론 엔진DeepSeek엣지 컴퓨팅

데이터 소스:HN + web research

128GB 노트북에 284B MoE를 집어넣다

Redis의 창시자 살바토레 산필리포(Salvatore Sanfilippo)가 개발한 C 언어 기반 추론 엔진 드워프스타 4(ds4)는 최신 프론티어 모델을 로컬 환경에서 구동하기 위한 진입 장벽의 기준을 완전히 바꾸어 놓았다. 핵심은 비싼 가속기 카드를 구매할 수 있느냐가 아니라, 충분한 메모리를 확보할 수 있느냐로 옮겨갔다. 284B 규모의 거대한 혼합 전문가(MoE) 모델인 DeepSeek V4 Flash는 원래 엄청난 용량의 비디오 메모리(VRAM)를 요구한다. 일반적인 소비자용 하드웨어로는 이 정도 파라미터 규모를 직접 다루는 것 자체가 불가능했다.

ds4는 비대칭 2비트 양자화 기술을 적용하여, 라우팅된 전문가 레이어를 집중적으로 압축함으로써 주변부 기억을 덜어내면서도 핵심 연산 능력은 온전히 보존했다. 수백억 개에 달하는 라우팅 전문가 파라미터에 이러한 양자화를 적용한 결과는, 핵심 실행 경로만 유지된다면 압축이 곧 지능의 저하를 의미하는 것은 아니라는 점을 증명했다. 284B MoE를 128GB 소비자용 기기에 억지로 집어넣은 이 설계는, 메모리 용량과 연산 처리량을 맞바꿈으로써 프론티어 모델의 추론 문턱을 전문 서버실에서 개인용 데스크톱 수준으로 단번에 끌어내렸다.

하이엔드 기기 영역에서는 512GB Mac Studio에서 V4 PRO를 구동하여 150 t/s의 프리필과 10~13 t/s의 디코딩 처리량을 기록했다. 이 정도의 처리 속도는 복잡한 코드베이스를 대상으로 한 고부하 분석 작업을 여유롭게 뒷받침할 수 있는 수준이다. 연산 인프라를 약 1만 2천 달러짜리 완제품 컴퓨터의 일회성 구매로 전환하는 것은, 대형 모델을 클라우드에서 로컬 개발 환경으로 되가져오기 위한 명확한 재무적 기준선을 제시한다. 이러한 하드웨어 투자 방식은 토큰 사용량에 따라 부과되는 예측 불가능한 클라우드 비용에 대한 불안감을 완전히 해소해 준다.

790 t/s 프리필이 드러낸 진짜 병목

128GB 통합 메모리를 탑재한 M5 Max에서 2048 토큰 컨텍스트 조건으로 측정한 프리필 성능은 790.2 t/s에 달해, 첫 번째 토큰이 출력되기까지의 대기 시간(TTFT)을 극적으로 줄여주었다. 반면 동일 기기에서 측정한 생성 속도는 39.4 t/s에 그쳤으며, 이는 통합 메모리 아키텍처가 메모리 대역폭 집약적인 디코딩 단계에서 여전히 물리적 대역폭의 한계에 묶여 있음을 여실히 드러낸다. 이처럼 추론 단계별로 확연하게 갈리는 성능 특성은, 로컬 에지 추론 환경이 장점은 극대화하고 단점은 회피하는 전략을 취해야 함을 시사한다.

M5 Max와 DGX Spark의 측정 수치를 나란히 놓고 보면 하드웨어별 지향점이 명확하게 드러난다. DGX Spark가 기록한 825.8 / 18.1 t/s와 비교할 때, 서버용 플랫폼이 프리필 연산력에서는 앞서지만 생성 단계에서는 뚜렷한 격차를 벌리지 못했다. 긴 컨텍스트 환경에서는 이러한 차이가 한층 더 부각된다. 65,536 토큰 컨텍스트에서 M5 Max는 398.5 / 27.6 t/s를 유지했으며, 프리필 지표가 견고하게 유지된다는 사실은 KV 캐시의 급증이 전체 파이프라인을 무너뜨리지 않았음을 보여준다.

긴 컨텍스트에서 프리필 속도는 거의 떨어지지 않는 반면 생성 속도는 절반 수준으로 줄어든다는 물리적 한계는, 코딩 에이전트의 워크플로 구조를 직접적으로 규정한다. 이는 상위 오케스트레이션 계층이 장문의 연속 출력을 자제하고, 고빈도 입력과 짧은 턴 중심의 상호작용을 통해 디버깅 작업을 수행하도록 유도한다. 하드웨어 레벨의 물리적 제약이 소프트웨어 생태계로 하여금 빠른 컨텍스트 재로딩에 기반한 경량 인터랙션 모델로 전환하도록 압박하고 있는 셈이다.

메모리가 부족하면 SSD 스트리밍으로 우회한다

메모리 용량이 한계에 다다랐을 때, 모델 전체를 물리적 RAM에 무조건 우겨넣는 것만이 유일한 해결책은 아니다. ds4가 제시한 핵심 엔지니어링 해법은 KV 캐시의 디스크 저장과 NVMe SSD 가중치 스트리밍의 결합이다. 모델 파라미터가 메모리 한계를 초과하면, 시스템은 비활성 전문가의 가중치를 SSD에 보관해 두고 필요할 때 온디맨드로 불러와 용량 한계를 메운다. 최신 솔리드 스테이트 드라이브(SSD)의 마이크로초 단위 초저지연 성능이 이러한 스트리밍 방식을 실현하는 하드웨어 기반이 되었다.

디스크에 저장된 KV 캐시는 프롬프트 해시(prompt hash)를 기반으로 복구할 수 있어, 프로세스를 재시작하더라도 처음부터 프리필을 다시 수행할 필요가 없다. 예기치 못한 충돌이나 재시작 후에도 디스크에서 캐시 상태를 즉시 로드하므로, 프롬프트 내용을 중복 연산하면서 낭비되는 긴 대기 시간을 없앨 수 있다. 자원이 제한된 환경에서는 단순한 모델 선택보다 이러한 저수준 시스템 엔지니어링의 정교함이 실제 시스템의 유용성을 좌우한다.

M5 Max 처리량 곡선 그림: ds4 저장소 speed-bench의 M5 Max 프리필 및 생성 처리량 곡선. 출처: antirez/ds4 저장소 speed-bench/m5_max_ts.svg

네이티브 코딩 에이전트 환경에서 추론 과정은 독립된 프로세스 내부에서 정밀하게 제어된다. 기존 클라우드 API 호출에 수반되던 네트워크 지연과 직렬화 오버헤드는 이러한 구조를 통해 말끔하게 제거된다. 초고속 저장 계층을 메모리의 물리적 확장 공간으로 직접 활용하는 방식은 대형 모델 추론을 얽매고 있던 기존 아키텍처의 경직된 한계를 허물었다.

128GB 머신 두 대를 RDMA로 묶어 하나로 만든다

단일 하드웨어의 물리적 한계는 분산 네트워크를 통해 수평적으로 확장할 수 있다. ds4는 여러 대의 기기 사이에서 Apple RDMA를 활용한 텐서 병렬 처리를 지원하여, 기기 간 이종 메모리 풀을 하나로 연결한다. 이러한 통신 메커니즘은 일반적인 네트워크 스택의 커널 시스템 호출 오버헤드를 건너뛰어, 텐서 분할에 따르는 데이터 교환 지연 시간을 실용적인 수준으로 단축한다.

클러스터 구성의 경우, 8장의 L40S 카드를 배치하여 총합 126 t/s의 생성 처리량을 달성했다. 이 정도 처리량은 소규모 개발 팀 전체의 일상적인 동시 요청을 소화하기에 충분한 성능이다. 새로운 모델의 공식 백엔드에서 밀려난 구형 가속기 카드들이 다시 연산 자원으로 재활용되며, 다중 사용자 추론 서버 구조를 통해 남은 하드웨어 가치를 최대한으로 쥐어짠다. 기기 간 협업의 핵심은 비디오 메모리와 연산 리소스를 정밀하게 분할하고 재조합하는 기술에 있다.

Qwen3.8 생성 처리량 비교 그림: ds4 저장소 speed-bench의 Qwen3.8 체크포인트별 생성 처리량 비교. 출처: antirez/ds4 저장소 speed-bench/qwen38-checkpoints/generation-throughput.svg

다중 사용자 동시 접속을 통한 전체 처리량 향상은, 본질적으로 개별 요청의 지연 시간을 조금 양보하는 대신 버스 대역폭의 활용률을 극대화하는 방식이다. 텐서 분할이든 파이프라인 병렬화든, 핵심 목표는 주어진 실리콘 칩의 한계 성능을 남김없이 뽑아내는 데 있다. 이를 통해 유휴 상태로 방치되던 구형 가속기 카드들은 대규모 클라우드 데이터센터 외부에서도 확고한 생존 영역을 확보하게 되었다.

범용 생태계를 과감히 버린 협소한 구현

ds4는 범용 GGUF 실행기가 되는 것을 거부하고, 프로젝트 자체에서 생성한 극도로 단순화된 GGUF 구조만을 인식하도록 설계되었다. 이러한 협소한 구현 방식은 서로 다른 다양한 양자화 형식을 지원하기 위해 필요한 불필요한 제어 흐름 오버헤드를 제거하여, 소중한 온칩 캐시를 핵심 연산 명령어 실행에만 오롯이 할당할 수 있게 한다. 깃 저장소에 정식 릴리스 태그를 달지 않는 배포 방식 역시, 이 프로젝트가 빠른 속도로 실험과 검증을 반복하는 연구용 플랫폼임을 잘 보여준다.

프로젝트 개발 로그에는 개발 전 과정에서 AI 코딩 에이전트가 깊숙이 참여했음이 명확히 밝혀져 있다. AI 에이전트가 자신들의 기반이 되는 저수준 추론 엔진의 리팩터링 작업에 직접 개입함으로써, 특정 하드웨어 아키텍처에 맞춘 코드 레벨의 튜닝 주기를 비약적으로 단축할 수 있었다. MIT 라이선스를 채택하여 이 극도로 경량화된 구현체를 각종 상용 독점 시스템 내부에도 마찰 없이 손쉽게 내장할 수 있다.

그러나 구현 범위를 좁힌 데 따른 대가 또한 분명하다. 이 소프트웨어 스택의 수명은 지속적으로 가중치를 공개해 주는 소수의 오픈소스 프론티어 모델에 직접적으로 묶여 있다. 만약 주요 프런티어 모델 개발사들이 오픈 가중치 라이선스 정책을 강화한다면, 이처럼 깊숙한 저수준 최적화가 가져다주는 혜택은 순식간에 중단될 위험을 안고 있다. 특정 하드웨어의 성능을 한계까지 쥐어짜는 동시에, 기술적 생존선은 오픈 생태계의 지속적인 자원 공급에 단단히 닻을 내리고 있는 셈이다.

범용성을 희생하여 극한의 효율을 추구하는 이러한 엔지니어링 접근법은 프론티어 모델의 접근 장벽을 근본적으로 다시 썼다. 특정 하드웨어에 맞춰 과감하게 불필요한 추상화 레이어를 걷어낼 수만 있다면, 로컬 추론의 병목은 더 이상 가속기 카드의 연산력이 아니라 메모리와 스토리지 용량이라는 사실을 분명히 입증했다. 이제 높은 파라미터의 프론티어 모델을 직접 구동할 수 있는 힘은 개인용 단말기로 완전히 내려왔으며, 남은 결정권은 해당 기기가 장착하고 있는 물리적 메모리의 한계 용량에 달려 있다.

참고 링크:

  • HN 토론 스레드 기록
  • antirez 공식 벤치마크 보고서