12GB 비디오 메모리(VRAM)를 탑재한 일반 가정용 게이밍 PC에서 1250억(125B) 개 매개변수를 지닌 최첨단 대형 언어 모델이 초당 60토큰이라는 매끄러운 속도로 구동되기 시작했다.
오랜 시간 동안 천억 개 단위 매개변수 모델을 실행하는 일은 데이터센터의 전유물이었다. 수천만 원에 달하는 다중 GPU 랙 서버를 임대하는 것만이 이 판에 발을 들이기 위한 유일한 입장권이었다. 그러나 2026년 들어 세 가지 변화가 동시에 맞물리며 이 전제가 무너졌다. 프론티어 모델 가중치의 오픈소스화, 희소 활성화를 극대화한 혼합 전문가(MoE) 아키텍처의 성숙, 그리고 극한까지 정밀도를 압축한 양자화 기술의 발전이다. 오픈소스 추론 엔진 Strata는 공격적인 하드웨어 계층 스케줄링 전략을 통해 Qwen3.8-Flash-Next 모델을 평범한 개인의 책상 아래 본체 속으로 밀어 넣었다. 추론에 드는 한계 비용은 매달 지불하던 클라우드 사용료에서 이미 보유한 컴퓨터의 전기세 수준으로 떨어졌다. 진정한 기술적 장벽 역시 비싼 VRAM 용량에서 메인보드 시스템 메모리와 SSD 읽기 대역폭으로 이동했다.
12GB VRAM에 담아낸 1250억 개의 매개변수
12GB 비디오 메모리에 1250억 개의 매개변수를 집어넣는다는 것은 마치 냉장고에 코끼리를 밀어 넣겠다는 이야기처럼 들린다. 하지만 현대 대형 모델은 쪼갤 수 없는 단일 덩어리가 아니다. Qwen3.8-Flash-Next는 총 매개변수가 1250억 개에 달하지만, 내부적으로 24,576개의 미세 ‘전문가(Expert)’ 네트워크로 구성된 MoE 구조를 채택했다. 단어 하나를 생성할 때마다 시스템은 이 중 가장 연관성이 높은 10개의 전문가만을 호출한다. 결과적으로 매 토큰 계산 시 실제로 활성화되는 매개변수는 약 60억 개에 불과하다.
Strata 엔진은 이처럼 고도로 희소화된 아키텍처의 특성을 파고들어 하드웨어 워크로드를 완전히 재배치했다. 가장 빈번하게 호출되는 수천 개의 ‘핫 전문가(Hot Experts)‘는 12GB VRAM에 영구 상주시켜 핵심 고주파 연산이 가장 빠른 GPU 코어에서 처리되도록 보장한다. 반면 나머지 수만 개의 ‘콜드 전문가(Cold Experts)‘는 메인보드의 일반 시스템 메모리(RAM)에 보관한다. 이러한 계층 캐시 인터셉트 전략은 게이밍 그래픽카드의 가장 치명적인 약점인 VRAM 부족 문제를 정면으로 우회했다.
이어 시스템 메모리와 CPU가 바통을 이어받아 남은 작업을 처리한다. 드물게 등장하는 희귀 단어로 인해 콜드 전문가가 필요해지면, 시스템은 GPU를 거치지 않고 호스트 CPU를 직접 구동해 AVX-512 또는 AVX2 명령어 세트를 활용한 벡터 병렬 연산을 수행한다. 이 계층 캐싱 메커니즘은 ‘VRAM 만능주의’라는 고정관념을 통쾌하게 부쉈다. 철저한 시스템 엔지니어링 최적화가 뒷받침된다면, 일반적인 보급형 하드웨어라도 지능적인 스케줄링을 통해 거대한 매개변수 집합을 거뜬히 소화해낼 수 있음을 입증한 것이다.
다중 토큰 예측과 검증으로 속도를 두 배로
계층 캐시만으로는 보급형 실리콘의 잠재력을 끝까지 쥐어짜 내기에 부족하다. 생성 속도를 한층 더 끌어올리기 위해, 모델 내부에는 40억 매개변수 규모의 다중 토큰 예측(Multi-Token Prediction / MTP) 헤드가 기본 내장되어 있다. 이 작은 보조 모델이 첨병 역할을 맡아 다음에 올 여러 토큰을 미리 빠르게 예측해 낸다. 이후 거대한 125B 본 모델이 이 예측 결과들을 일괄(배치) 검증한다. 단어를 하나씩 순차적으로 뱉어내던 기존 방식에 비해 배치 검증의 처리 효율은 압도적으로 높다.
이처럼 예측과 검증이 맞물려 돌아가는 파이프라인 덕분에 최종 생성 속도는 단숨에 1.6배에서 1.8배까지 치솟았다. 압축률이 가장 높은 Q2_0 양자화 환경에서 엔비디아 지포스 RTX 5070과 AMD 라이젠 5 7600 조합으로 구성된 테스트 머신은 초당 94토큰이라는 경이로운 수치를 기록했다. 정밀도가 더 높은 IQ3_XXS 양자화 버전에서도 초당 62토큰의 안정적인 실전 속도를 유지했다. 대형 모델 최적화는 이제 단순히 매개변수 숫자를 무작정 깎아내는 데 머물지 않는다. 실행 파이프라인의 구조적 혁신을 통해 보급형 하드웨어의 성능 한계선을 힘으로 밀어 올린 것이다.
도약은 토큰 생성 속도에 그치지 않고 프롬프트 처리(프리필) 단계에서도 고스란히 나타났다. 32,000토큰에 이르는 긴 문맥의 프롬프트를 입력하더라도 시스템은 초당 2,650토큰의 엄청난 속도로 단숨에 읽어 치운다. 장문 텍스트를 처리할 때는 최대 8,192토큰 단위로 청크를 나누어 읽기 때문에 작업 도중 메모리가 고갈되어 멈추는 일이 없다. Qwen3.8-Flash-Next는 기본 26만 토큰, YaRN 기법 적용 시 최대 100만 토큰에 달하는 컨텍스트 윈도우를 지원하므로, 이제 가정용 PC에서도 장편 소설 한 권 전체를 단 한 번에 집어삼킬 수 있게 되었다.
그림: 단일 프롬프트로 생성되어 브라우저에서 실행되는 복셀 탑 정원. 출처: Strata 저장소 README
로컬 실행, 클라우드 서비스를 대체하다
생성 속도와 컨텍스트 길이가 실제 업무 환경에서 활용 가능한 수준에 도달하면서, 로컬 모델 배포는 더 이상 단순한 기술 매니아들의 실험실 장난감에 머물지 않는다. Strata는 로컬 머신의 localhost 환경에서 OpenAI 및 Anthropic API 규격과 완벽히 호환되는 로컬 서버를 구동한다. 개발자는 기존에 사용하던 코딩 도구나 클라이언트 설정을 바꿀 필요가 전혀 없다. 설치 스크립트가 허깅페이스(Hugging Face)에서 모델 가중치를 자동으로 내려받아 로컬 PC를 기존 AI 워크플로우에 매끄럽게 연결해 준다.
커서(Cursor)를 통한 자동 코드 완성이든, 독자적으로 동작하는 클로드 코드(Claude Code) 에이전트든, 요청 주소를 이 로컬 엔드포인트로 지정하기만 하면 즉시 작동한다. 이는 상용 클라우드 API에 대한 물리적 종속을 단숨에 끊어낸다. 개발자는 매달 눈덩이처럼 불어나는 API 청구서를 신경 쓸 필요가 없으며, 핵심 업무 코드나 기밀 데이터가 외부 클라우드 망을 거치면서 생기는 보안 누출 위험도 원천 차단된다. PC의 전원만 켜져 있다면 최첨단 모델의 연산 능력이 무제한으로 뿜어져 나오는 셈이다.
이 시스템의 하드웨어 호환성은 특정 제조사의 울타리에 갇히지 않는다. 16GB VRAM을 갖춘 AMD 라데온 RX 9070 XT 그래픽카드에서도 Q2_0 정밀도 기준으로 동일하게 초당 60토큰의 속도를 기록했다. 시스템 전체는 검증된 오픈소스인 llama.cpp와 ggml 기반으로 설계되었으며, ISTA-DASLab과 Unsloth의 첨단 양자화 알고리즘을 결합해 거대한 모델을 가정용 데스크톱에 우겨넣었다. 소비자용 하드웨어 생태계가 마침내 실질적인 형태를 갖추기 시작하면서, AI 연산 권력이 중앙 집중식 데이터센터에서 개발자의 책상 위로 되돌아오고 있다.
그림: VRAM, 시스템 메모리, CPU, SSD에 분산된 데이터 배치를 보여주는 공식 하드웨어 스케줄링 구성도. 출처: Strata 저장소 docs/media
진정한 병목은 이제 SSD다
연산 인프라를 책상 위로 옮겨오는 과정이 순탄하기만 한 것은 아니다. 그래픽카드가 절대적인 병목의 자리에서 내려오자마자, 극심한 입출력 부하가 주변 하드웨어 부품들로 급격히 전이되었다. 빠른 다중 토큰 예측 파이프라인을 유지하기 위해 아키텍처 내부에는 510억 개 매개변수 규모의 n-gram 임베딩 테이블이 포함되어 있으며, 이 방대한 데이터는 NVMe SSD에 직접 상주하며 실시간 탐색용 룩업 테이블 역할을 수행한다.
결과적으로 보조 저장장치의 읽기 대역폭이 새로운 한계 지점으로 부상했다. 대형 모델은 상상 이상의 거대한 가중치 파일을 쉼 없이 읽어 들여야 한다. 기본 제공되는 Unsloth UD-IQ4_XS 양자화 모델의 다운로드 용량만 94GB에 이른다. 만약 컴퓨터의 물리 RAM 용량이 80GB 미만이어서 모든 전문가 네트워크를 메모리에 다 띄우지 못한다면, 시스템은 토큰을 생성하는 도중 누락된 콜드 전문가를 SSD에서 실시간으로 스트리밍해야 한다. SSD 실시간 읽기가 발생하는 순간 매끄럽던 생성 속도는 낭떠러지로 곤두박질친다. 연산 능력이 해결된 이후, 모델의 실질적인 성능 바닥을 결정짓는 것은 결국 버스 대역폭인 셈이다.
12GB VRAM 또한 이 구성에서 물리적 한계점까지 혹사당하고 있다. 텍스트를 생성하는 도중 멀티모달 이미지를 밀어 넣으면, 비전 인코더가 얼마 남지 않은 VRAM 여유 공간을 단숨에 집어삼킨다. 공식 가이드에서는 이미지를 처리할 때 반드시 커맨드라인 옵션을 통해 VRAM 1GB를 수동으로 사전 확보하라고 명시하고 있다. 이 완충 공간이 없으면 RTX 5070 환경에서 남는 여유 VRAM이 약 200MiB에 불과해 시스템 전체가 프리징 상태에 빠지게 된다.
1250억 개의 매개변수는 현재 보급형 게이밍 그래픽카드의 물리적 한계선에 닿아 있다. 그러나 Strata의 성과는 초대형 모델이 더 이상 거대 클라우드 기업의 전유물이 아님을 분명히 보여주었다. 12GB 그래픽카드를 장착한 일반 PC가 장문 작업에서도 초당 60토큰 이상을 뿜어낼 수 있게 되면서, 대형 언어 모델 경쟁의 기본 규칙은 완전히 바뀌었다. 다음 세대 하드웨어 혁신의 초점은 단일 GPU의 연산 속도를 높이는 것보다, 로컬 AI를 위해 메인보드의 메모리 버스 구조를 어떻게 근본적으로 재설계할 것인가에 맞춰질 것이다.
참고 링크:
- Strata 저장소 README 및 벤치마크 데이터
- Qwen 모델 출시 공지