2026년 9월 30일, 국제 학술지 네이처(Nature)에 거대 AI 모델의 막대한 연산 자원 만능주의를 무색하게 만드는 논문이 실렸다. 카네기 멜런 대학교와 MIT 등 연구진이 공동 개발한 AI 시스템 아타락소스(Ataraxos)가 단 16대의 GPU와 약 8000달러의 훈련 비용만으로 4회 세계 챔피언 핌 니메이어(Pim Niemeijer)를 15승 1패 4무로 꺾은 것이다. 4년 전 업계 정상급 연구소가 1024개의 전용 가속기 칩과 수백만 달러를 쏟아붓고도 블러핑(허풍)이라는 게임 이론의 난제를 풀지 못했던 것과 대조적이다.
16대의 GPU로 연산 독점을 무너뜨리다
이는 최첨단 AI 연구 노선의 급격한 방향 전환을 뜻한다. 핌 니메이어와의 맞대결에서 아타락소스는 압도적인 경기 장악력을 보였다. 규칙은 단순했다. 600주 이상 세계 랭킹 1위를 지켜온 챔피언이 1승을 거둘 때마다 연구팀이 100달러의 상금을 지급하는 방식이었다. 니메이어는 AI가 대국 중에 동적으로 전략을 바꾸지 않는다는 점을 알고 있었기에 여유를 두고 시스템의 허점을 탐색할 수 있었다. 하지만 20판의 대국 끝에 인간 챔피언이 따낸 승리는 단 1판에 불과했다.
연구팀은 전적에 대해 냉철한 공학적 분석을 내놓았다. 유일한 패배와 4번의 무승부는 스트라테고의 규칙상 초반에 말을 무작위로 블라인드 배치해야 하는 구조에서 비롯되었으며, 20판 정도의 표본으로는 초반 운의 영향을 대수의 법칙으로 완전히 상쇄하기 어렵기 때문이었다. 반면 2025년 스트라테고 세계선수권 현장에서 열린 40판의 공개 도전 매치에서 아타락소스는 참가자들의 변칙적인 전략을 상대로 38승을 거두었다. 인간 챔피언을 꺾은 것도 놀랍지만, 학계와 업계를 가장 크게 뒤흔든 것은 믿을 수 없을 정도로 저렴한 연산 비용이었다.
그림: 스트라테고의 복잡한 말 배치와 숨겨진 정보. 출처: Getty Images (Ars Technica 보도 인용)
아타락소스의 연산 자원 소모량은 극히 미미했다. 메인 모델을 학습시키는 데 16대의 GPU를 일주일간 돌렸고, 신념 모델(Belief Model)을 학습시키는 데 4대의 GPU로 4일을 썼을 뿐이다. 연구팀이 추산한 총 훈련 비용은 약 8000달러 수준이다. 반면 딥마인드(DeepMind)가 2022년에 선보인 선행 시스템 딥내시(DeepNash)는 1024개의 전용 칩을 23개월간 가동했다. 2025년 하드웨어 시세로 환산하면 300만450만 달러에 달하는 규모다. 아타락소스의 자가 대국 수는 딥내시의 30분의 1 수준이었고, 훈련 샘플 수는 1%로 압축되었다. 연산 자원 투입 면에서 세 자릿수(1000배)의 격차가 났지만, 후발 주자는 일반 GPU를 활용해 완벽한 우위를 점했다. 무작정 연산량을 늘리는 방식이 한계 효용 체감에 부딪히며, 돈을 태워 모든 경우의 수를 무차별 탐색하던 방법론이 벽을 만난 것이다.
10의 33제곱 가지 배치 조합, 무차별 대입을 무력화하다
400만 달러 규모의 자본이 스트라테고 앞에서 좌절했던 이유를 이해하려면 게임 본연의 구조적 난이도를 살펴봐야 한다. 바둑이나 체스처럼 판 위의 모든 정보가 양측에 완전히 공개되는 완전 정보 게임과 달리, 스트라테고는 짙은 전장의 안개로 둘러싸인 불완전 정보 게임이다. 양측은 원수부터 스파이까지 다양한 계급의 말과 움직일 수 없는 폭탄, 반드시 지켜야 하는 깃발 등 각자 40개의 말을 다룬다. 게임이 시작될 때 상대방 말의 위치만 보일 뿐, 그 말이 구체적으로 어떤 말인지는 전혀 알 수 없다.
오직 두 말이 같은 칸에서 충돌할 때만 심판을 통해 계급이 공개된다. 계급이 낮은 말은 판에서 제거되고, 승리한 말은 살아남지만 자신의 핵심 정체가 상대에게 완전히 드러난다. 이러한 규칙으로 인해 상태 공간의 크기는 기하급수적으로 폭발한다. 텍사스 홀덤 역시 불완전 정보 게임이지만, 플레이어가 손에 쥐는 패는 2장에 불과해 시작 조합이 1326가지에 그친다. 반면 스트라테고의 시작 배치 조합은 무려 10의 33제곱 가지를 넘어선다.
더 치명적인 문제는 결정 트리의 깊이다. 일반적인 체스 대국은 대략 40수 안팎에서 승패가 갈리지만, 스트라테고의 장기전은 2000수를 훌쩍 넘긴다. 이처럼 긴 상호작용 과정에서 강화학습이 가장 빠지기 쉬운 난제가 등장하는데, 바로 블러핑이다. 전투력이 전혀 없는 최하급 말을 원수인 것처럼 꾸며 전선으로 밀어붙이는 행위는 상대에게 극심한 압박을 준다. 블러핑을 너무 자주 쓰면 상대가 허풍을 간파하고 잡아먹어 버리며, 반대로 정직하게만 두면 상대가 전력 배치를 모두 파악해 국지전을 장악해 버린다. 2000수가 이어지는 동안 참과 거짓 사이에서 위협의 균형을 유지하는 것, 이것이 바로 딥마인드의 2022년 모델이 풀지 못했던 급소였다. 천문학적인 게임 트리 앞에서 기존 알고리즘은 다단계 연쇄 블러핑을 처리하느라 연산 자원을 탕진할 수밖에 없었다.
안갯속에서 상대의 패를 짚어내는 신념 모델
아타락소스의 해결책은 문제의 구조 자체를 바꾸는 것이었다. 부족한 정보 속에서 전체 판을 억지로 내다보려 애쓰는 대신, 연구팀은 ‘신념 모델(Belief Model)‘이라 부르는 별도의 두 번째 신경망을 도입했다. 1억 6300만 판의 자가 대국 훈련 과정에서 이 신념 모델의 핵심 임무는 상대가 이미 둔 착점 기록을 역추적하여 아직 정체가 드러나지 않은 상대 말의 계급을 추론하는 일이었다.
이 모델은 표본 추출을 통해 현재 국면에서 상대방이 취하고 있을 확률이 높은 몇 가지 배치 형태를 걸러낸다. 가능한 모든 배치를 전수 조사하는 대신, 가능성이 높은 몇 가지 가설 배치만을 대상으로 미래를 예측하도록 논리 구조를 재편한 것이다. 이 신념 모델 덕분에 아타락소스는 알파고 수준의 몬테카를로 트리 탐색(실제 착점 전에 미래의 유망한 분기 경로를 시뮬레이션하는 기법)을 스트라테고에 성공적으로 적용할 수 있었다.
그림: 핌 니메이어와의 대결에서 시스템의 승률 예측 변화 추이. 출처: 논문 arXiv:2511.07312
과거의 시스템들은 숨겨진 정보가 너무 많아 탐색 트리를 세우지 못하고 직관에 의존하는 가치망에 기댈 수밖에 없었다. 아타락소스는 정보가 불완전한 환경에서 상대방의 숨겨진 패를 먼저 추론해 불확실한 안개를 높은 확률의 근사 정보로 전환해야만 트리 탐색 알고리즘의 진가가 발휘된다는 사실을 입증했다. 이러한 전환은 전통적인 게임 전술까지 바꾸어 놓았다. 인간 챔피언과의 대결에서 아타락소스는 매우 특이한 방어 진형을 자주 사용했다. 가장 중요한 깃발을 판 구석에 박아두고, 그 주변을 단 두 개의 폭탄으로 둘러싸 철통 방어하는 형태였다. 인간 플레이어 사이에서는 융통성이 없고 실수 한 번에 무너지는 위험한 전략으로 여겨졌던 이 배치가 정밀한 연산 검증을 거쳐 가장 효율적인 방어벽임이 증명된 것이다.
심리적 부담을 완전히 털어낸 기계의 냉정함
아키텍처의 혁신은 실제 경기 스타일에 고스란히 드러났다. 아타락소스는 인간 대국자들을 당혹스럽게 만드는 기계 특유의 면모를 보였다. 감정의 동요가 없었고, 열세에 몰렸을 때 인간이 느끼는 초조함도 없었다. 대국 데이터를 복기한 연구진은 인간 플레이어가 실시간 승률 2% 수준의 절망적인 위기에 몰리면 자포자기식 돌격을 감행하거나 무모한 블러핑을 남발하는 경향을 발견했다.
반면 같은 열세 상황에서 아타락소스는 정밀 기계처럼 승률을 0.1%라도 끌어올릴 수 있는 기회를 침착하게 찾아내며 서서히 판세를 원점으로 되돌렸다. 연구진은 AI가 아무렇지도 않게 블러핑을 섞어가며 역전승을 거두는 모습에 주목했다. 기계에게 약한 말로 상대의 강한 말을 속이는 행위는 가슴을 졸여야 하는 심리적 싸움이 아니라, 현재 확률 분포에서 기대 수익이 가장 높은 수학적 선택일 뿐이었다.
이러한 감정 없는 냉철함은 스스로의 취약점을 다루는 방식에서도 나타났다. 판의 특정 구역에 커다란 방어적 허점이 생겼더라도, 상대의 행마를 분석해 상대가 그 허점을 눈치채지 못했다고 판단되면 아타락소스는 그 틈을 메우기 위해 말을 낭비하지 않았다. 양측의 패를 모두 볼 수 있는 관찰자의 시각에서는 당장이라도 치명타를 맞을 수 있는 아슬아슬한 국면이었지만, 아타락소스는 태연하게 방치했다. 인간은 이렇게 두기 어렵다. 치명적인 비밀을 안고 있다는 사실을 스스로 알고 있으면 방어 움직임이나 착점 템포에서 불안감이 은연중에 새어 나오기 마련이다. 기계에는 그런 짐이 없었다. 상대가 모른다고 판단되면, 정말 아무 일도 없는 것처럼 담담하게 판을 운영했다.
현실 세계의 게임은 결코 패를 보여주지 않는다
아타락소스가 성공적으로 검증한 이 프레임워크는 스트라테고에만 머무르지 않는다. 연구팀은 이미 동일한 프레임워크를 다른 게임에 적용하여 바라주 스트라테고(Barrage Stratego)의 세계 챔피언 3명을 꺾었고, 고도의 협력과 보이지 않는 패에 대한 추론이 필수적인 카드 게임 하나비(Hanabi)를 정복했으며, 중국의 대표적 카드 게임 투디주(Dou Dizhu)에서도 최강의 인공지능을 격파했다. 매우 적은 비용으로 각기 다른 규칙의 불완전 정보 환경을 연이어 돌파한 것이다.
하지만 보드게임과 카드게임의 승리는 출발점에 불과하다. 연구진은 현재 모델이 자신의 판단 근거를 자연어로 설명할 수 있도록 하는 연구를 진행하고 있다. 이들의 장기적인 목표는 불완전 정보를 다루는 이 방법론을 기업 간 협상, 금융 시장 거래 등 복잡한 현실 세계의 의사결정 문제로 확장하는 것이다.
스트라테고에서 거둔 성과는 AI 개발 노선의 승리를 웅변한다. 정보가 대거 감춰져 있고 긴 호흡으로 전개되는 복잡한 문제에서, 상대의 숨겨진 정보를 먼저 추론한 뒤 탐색을 수행하는 접근법은 8000달러라는 적은 비용으로 무지막지한 연산 자원 투자 방식을 눌렀다. 10의 33제곱 가지 안갯속에서 인간 챔피언의 숨겨진 패를 정밀하게 짚어낼 수 있게 된 지금, 프런티어 AI 경쟁의 판도는 완전히 바뀌었다. 승부는 더 이상 누가 값비싼 가속기 칩을 더 많이 사 모으느냐가 아니라, 누가 문제의 내재적 구조를 더 깊이 꿰뚫어 보느냐에 달려 있다.
참고 링크:
- Nature 논문: Scalable decision-making for games of imperfect information
- Ars Technica 보도
- Hacker News 토론 (item?id=49933740)