2026년 9월, 개인 개발자 Mithil Vakde는 단일 RTX 5090 GPU를 단 1.5시간 동안 작동시켜 ARC-AGI-1 공개 평가에서 44%의 점수를 달성했습니다. 전체 훈련 과정에 들어간 비용은 겨우 67센트에 불과했습니다. 소비자용 그래픽 카드 1장과 1달러 미만의 비용으로 TRM, HRM과 같은 최정상 전문 솔버의 점수와 어깨를 나란히 했으며, 수백만 달러를 투입한 수많은 범용 대형 언어 모델(LLM)을 뒤로시켰습니다.
François Chollet이 2019년에 제안한 ARC-AGI는 인간의 추상적 추론 능력을 측정하는 기준점으로 여겨져 왔으며, 커뮤니티는 100만 달러의 현금 상금을 내걸었습니다. 6년 동안 도전받아 온 이 벤치마크를, 개인 개발자 한 명이 기본적인 트랜스포머(Transformer) 아키텍처를 바탕으로 돌파해 냈습니다.
67센트로 얻어낸 44%의 성과
Mithil Vakde가 달성한 44%의 점수는 소형 파라미터 규모에서 오픈소스 커뮤니티의 압도적인 효율성을 보여줍니다. 이 프로젝트의 이전 버전이 공개되었을 때도 Google DeepMind의 Lucas Beyer, fast.ai의 Jeremy Howard, Rohan Anil 등 최정상 연구자들 사이에서 공개 토론이 일어났습니다. 하드웨어가 제한된 환경에서 개인 모델이 거대 기업 연구 팀과 동등한 성과를 낸 것입니다.
거대 모델이 자금을 쏟아부어 데이터를 쌓는 방식은 소수 샘플 추론에서 한계를 드러내고 있습니다. 최정상 전문 솔버는 복잡한 아키텍처와 비싼 연산 자원이 필요하지만, 이번 오픈소스 솔루션은 1달러도 안 되는 비용으로 동등한 성능을 재현했습니다. 연산 자원을 무작정 늘리는 것으로는 특정 작업에서 알고리즘의 비효율성을 숨길 수 없으며, 무분별한 확장보다 정교한 아키텍처 튜닝이 훨씬 더 강력한 돌파력을 가집니다.
그림: ARC-1 공개 평가 성능 비교. 출처: Mithil Vakde 블로그
핵심 컴포넌트 제거 시 점수 반토막
이 솔루션은 트랜스포머 프레임워크를 벗어나지 않으면서도 SwiGlu, RMSNorm, 3D RoPE 위치 인코딩, NorMuon 옵티마이저 등 현대적인 아키텍처 컴포넌트를 정확하게 도입했습니다. 저자가 공개한 어블레이션(Ablation) 실험에 따르면, 3D RoPE나 작업별 임베딩(per-task embedding)을 제거하자마자 모델 점수는 44%에서 약 24%로 급격히 떨어졌습니다.
| 구성 | 점수 |
|---|---|
| 전체 구성 (3D RoPE + 작업별 임베딩) | 44% |
| 3D RoPE 제거 | 약 24% |
| 작업별 임베딩 제거 | 약 24% |
| 가장 기초적인 설정만 유지 | 18% |
| 출력 토큰만 훈련 (이전 버전 대비) | 40% → 44% |
ARC 작업의 본질은 2차원 그리드와 색상 채널을 처리하는 것이며, 3D RoPE는 이러한 다차원 구조를 완벽하게 매핑합니다. 특정 작업에 맞춤화된 공간 위치 인코딩과 임베딩 메커니즘이 국소 특징 추출에서 모델의 단점을 정확하게 보완해 주었습니다.
이러한 어블레이션 데이터는 한 가지 사실을 입증합니다. 작업 구조에 대한 정교한 모델링이 파라미터 수를 늘리는 것보다 훨씬 더 가치 있다는 점입니다. 범용 대형 언어 모델이 습관적으로 사용하는 전면적인 파라미터 무차별 훈련은 고도로 추상화된 추론 작업에서 한계에 도달했습니다. 도메인 로직에 깊이 파고든 아키텍처 조율이야말로 높은 점수를 이끌어내는 직접적인 지렛대입니다.
그림: 어블레이션 실험: 3D RoPE와 작업별 임베딩 제거 시 급격한 하락. 출처: Mithil Vakde 블로그
높은 연구 비용이 탐색 공간을 가로막다
Mithil Vakde는 대형 언어 모델이 샘플 효율성 측면에서 어떠한 우위도 갖지 못한다는 과감한 판단을 내놓았습니다. 지난 6년 동안 ARC에서 이 길을 개척한 사람이 없었던 이유는 기술적 장벽이 넘을 수 없을 만큼 높아서가 아니라, 비싼 실험 비용이 거대 기업 연구원들의 탐색 공간을 가로막았기 때문입니다. 1회 훈련에 수천수만 달러가 드는 환경에서는 거대 기업 팀이 수십수백 번의 어블레이션 실험을 진행하기 어려워, 어떤 아키텍처 세부 사항이 ARC 작업에 실제로 유효한지 발견할 수 없었습니다.
몇 센트에 불과한 시행착오 비용 덕분에 개인 개발자는 다양한 컴포넌트 조합을 고빈도로 테스트할 수 있었습니다. 아무리 사소해 보이는 파라미터 조정이라도 1.5시간 이내에 검증이 가능했습니다. 거대 기업들이 수백만 달러의 훈련 비용으로 쌓아 올린 범용 능력은, 집중적인 시행착오와 정밀 타격이 필요한 단일 작업 앞에서 다소 둔하게 보입니다.
그림: 다른 어블레이션의 최적 성과 비교. 출처: Mithil Vakde 블로그
샘플 효율성이 후반전 경기의 핵심으로
다중 실행에서 해결된 작업의 합집합이 55%에 달했을 때, 저자는 트랜스포머 단독으로도 ARC에서 65%의 임계값에 도달할 수 있다고 판단했습니다. 전체 모델 가중치와 훈련 코드를 포함한 이 완전 오픈소스 솔루션은 Hacker News에서 546개의 추천과 146개의 댓글을 받아 소형 모델의 가능성에 대한 커뮤니티의 기대를 북돋웠습니다. ARC-AGI-1에서의 뛰어난 성과 외에도 이 모델은 더 어려운 ARC-2 테스트에서도 7%의 점수를 기록했습니다.
단 67센트로 최정상 연구 팀의 성과를 재현해 낸 것은 거대 기업들의 수백만 달러 투자를 다소 어색하게 만들었습니다. 연산 자원의 패권이 높은 점수로 직접 전환되지는 않으며, 극도로 낮춰진 비용 속에서 오픈소스 커뮤니티가 보여준 샘플 효율성이야말로 후반전 경기를 주도할 핵심 변수입니다.
참고 링크:
- Mithil Vakde 블로그
- HN 토론
- Lobsters 토론