하루 5달러로 가장 어려운 AI 시험 석권: DeepSeek, ARC Prize 효율성 1위 등극

하루 5달러로 가장 어려운 AI 시험 석권: DeepSeek, ARC Prize 효율성 1위 등극

AIDeepSeek추론 테스트

데이터 소스:HN + web research · HN

2026년 8월이 시작된 지 일주일 만에, 한 AI 성적표가 전 세계 개발자 커뮤니티를 흔들었습니다. 중국 DeepSeek의 경량 오픈웨이트 모델인 V4 Flash가 업계에서 가장 까다로운 AI 추론 테스트로 꼽히는 ARC Prize에서 365점을 기록하며 효율성 순위표 정상에 올랐습니다. 미국 플래그십 모델들이 문제당 2달러를 소비하는 반면, 이 모델은 단 4센트만으로 문제를 풀어냈습니다.

결과가 공개되자 세계 최대 프로그래머 커뮤니티인 Hacker News에는 5시간 만에 382개의 추천과 233개의 댓글이 쏟아졌습니다. 가장 많은 공감을 받은 댓글 중 하나는 “미국 AI 연구소들이 큰 일 났다”라고 직설적으로 평가했습니다.

ARC Prize 공식 발표 DeepSeek V4 Flash 0731 성적 카드 그림: ARC Prize 공식이 DeepSeek V4 Flash 0731에 대해 발표한 검증 성적 카드. 출처: arcprize.org

이 시험은 도대체 무엇을 평가하는가

먼저 ARC Prize가 무엇이며 왜 업계에서 ‘AI 수능’이라 불리는지 짚고 넘어갈 필요가 있습니다. 시험 문제는 의외로 단순합니다. 색깔이 칠해진 작은 격자 상자로 구성된 도형 퍼즐로, 3개의 예시를 보고 규칙을 추론하여 4번째 패턴을 완성하는 방식입니다. 성인 인간이라면 한눈에 이해할 수 있으며, 평균 85점 정도를 받습니다.

그러나 AI는 이 유형의 문제에 수년간 걸려 넘어졌습니다. 2024년 당시 가장 강력했던 미국 모델조차 30~40점에 그쳤습니다. 이러한 문제는 암기할 수 있는 문제은행이 없고 규칙이 무궁무진하게 변하므로 과거 유사 문제를 본 적이 있어도 도움이 되지 않습니다. 출제자는 한 가지에 승부를 걸었습니다. 정답을 암기하기만 하는 AI는 이 시험을 통과할 수 없고, 통과하는 모델이야말로 진정으로 ‘생각’할 줄 안다는 점입니다.

추상 추론 테스트에서 인간과 AI의 점수 격차 그림: ARC Prize 공식 웹사이트에 게시된 인간과 AI의 점수 격차. 출처: arcprize.org

DeepSeek이 이번에 치른 시험은 한층 더 업그레이드된 ARC-AGI-2 개정판으로, 100점 만점에 61.4점을 획득했습니다. 점수 자체는 최고점이 아니지만, 가격과 함께 고려하면 이 점수의 무게감은 완전히 달라집니다.

두 개의 순위표, 두 개의 다른 게임

ARC Prize 순위표는 사실 두 가지로 나뉩니다. 하나는 순수 점수가 높은 순서이고, 다른 하나는 가성비가 뛰어난 순서로, 공식 명칭은 ‘효율성 순위표(Efficiency Leaderboard)‘입니다. 웹사이트에는 “진정한 지능이란 난제를 푸는 것뿐만 아니라, 최소한의 자원으로 풀어내는 것”이라고 명시되어 있습니다.

두 순위표를 비교하면 대조가 극명하게 드러납니다. 미국 Anthropic의 플래그십인 Claude Opus 5는 개정판 시험에서 90.4점을 기록했지만 문제당 2.06달러가 듭니다. 반면 DeepSeek은 61.4점을 받으면서 문제당 단 4센트만 소요되어 약 50배의 비용 차이를 보였습니다. OpenAI의 최고 사양 모델인 GPT-5.6 Luna는 더욱 난감한 상황입니다. 59.6점으로 DeepSeek보다 낮은 점수를 받았음에도 비용은 4배 이상 높았습니다.

ARC Prize 공식 홈페이지의 순위 산점도 그림: ARC Prize 공식 홈페이지의 순위 산점도. 가로축은 문제당 비용, 세로축은 점수를 나타내며 좌상단에 위치할수록 가성비가 높음을 의미합니다. 출처: arcprize.org

이것이 바로 ‘365점으로 1위 등극’이 의미하는 바입니다. 효율성 순위표에서 DeepSeek V4 Flash 0731은 미국 경쟁사들을 모두 제쳤습니다. 순수 점수 면에서는 미국 플래그십 모델이 여전히 앞서 있지만, ‘최고 성능’과 ‘최고 가성비’는 이제 두 개의 서로 다른 기업으로 갈라졌습니다.

점수 차트에서는 미국 기업들이 여전히 상위권을 독점하고 있지만, 효율성 차트의 1위 교체는 비즈니스 세계에 훨씬 더 강력한 신호를 보냅니다. 기업이 AI를 도입할 때 지불하는 비용은 API 호출량에 따른 것이지, 벤치마크 순위표에 비용을 내는 것이 아니기 때문입니다.

저렴한 비용의 비밀: 추론 시 더 오래 생각하기

어떻게 이렇게 싸게 만들 수 있었을까요? 먼저 이 시험의 주요 규칙 중 하나인 ‘추론 시간 연장’을 이해해야 합니다. 모델은 답안을 제출하기 전 반복해서 추론하고 초안을 작성할 수 있으며, 이를 업계에서는 ‘추론 시 계산(Inference-time compute)‘이라고 부릅니다. 시험장 밖에서 천재일 필요 없이 시험장에서 시간을 들여 초안을 작성하면 좋은 성적을 낼 수 있습니다. 하지만 초안을 작성하려면 전력이 소모되므로 ‘초안 작성 비용’을 낮추는 쪽이 승리합니다.

DeepSeek은 이러한 ‘소형 모델 + 강력한 추론’ 전략을 극단까지 밀어붙였습니다. V4 Flash의 전체 파라미터는 2,840억 개이지만, 단어를 처리할 때마다 그중 130억 개만 활성화합니다. 마치 대부대를 보유하고 있다가 필요할 때만 최정예 특수부대를 투입하는 방식입니다. 여기에 가중치가 완전히 오픈소스로 공개되어 누구나 다운로드하여 자체 배포할 수 있으므로 중간 유통 마진이 빠집니다. 공식 API 가격은 입력 100만 토큰당 0.14달러, 출력 100만 토큰당 0.28달러로, 미국 플래그십 모델보다 1~2단계 이상 저렴합니다.

오픈소스의 의미는 단순한 비용 절감에 그치지 않습니다. 기업은 모델을 자체 서버에 탑재하여 데이터 유출 걱정 없이, 사용량 제한 없이, 자사 비즈니스에 맞춰 커스터마이징할 수 있습니다. 호출당 고비용을 부과하는 미국의 폐쇄형 거대 기업들에게는 비즈니스 모델 차원의 충격이며, 가격 전쟁은 빙산의 일각일 뿐입니다.

하루 5달러라는 가격 뒤에는 일반 개발자가 처음으로 ‘최고 수준의 사고 능력’을 부담 없이 이용할 수 있게 되었다는 변화가 있습니다. 과거에는 이 정도 수준의 추론 비용이 비싸 핵심 과제에만 제한적으로 쓰였지만, 이제는 24시간 백그라운드에 켜두고 모든 작업을 감시하도록 맡길 수 있습니다.

하루 5달러의 실제 사용 후기

커뮤니티에서는 이미 이러한 방식을 실천하는 개발자들이 나타나고 있습니다. 개발자 LaurensBER는 Hacker News를 통해 5~6개의 작업 세션과 12개의 동시 실행을 온종일 돌려도 하루 5달러를 쓰기 힘들었다고 공유했습니다. 그가 매달 200달러를 내던 Claude 구독은 이미 사용하지 않게 되었습니다. 물론 Claude가 더 강력하지만, ‘사용하기 전 사용량을 계산해야 하는’ 번거로움 자체가 사용을 끄리게 만듭니다.

그를 진정으로 열광하게 만든 것은 저렴한 가격 덕분에 새로 열린 활용 가능성입니다. 자동화 테스트가 실패하면 AI가 자동으로 수정하고, 코드 커버리지가 부족하면 커밋 시 자동으로 테스트를 보완하며, 서버 로그와 보안 감사, 모든 예외 상황을 하나하나 조사하게 만드는 식입니다. 이전에는 ‘할 만한 가치는 있지만 AI 비용이 아까웠던’ 작업들이 이제는 일상적인 업무가 되었습니다.

단일 사용 방식은 사소해 보일 수 있지만, 매일 모든 팀과 개발자에게 곱해지면 완전히 새로운 비용 곡선을 만들어냅니다. ‘낭비할 수 있을 만큼 저렴하다’는 것 자체가 하나의 강력한 역량이 되는 셈입니다.

미국 AI 연구소들의 큰 문제

이것이 바로 실리콘밸리가 불안해하는 근본적인 이유입니다. Hacker News에서 가장 많은 추천을 받은 댓글 중 하나는 다음과 같이 지적했습니다. “미국 AI 연구소들이 큰 일에 직면했다.” 국가 안보 명령 등으로 중국 모델을 차단하지 않는 한, 오픈웨이트 모델이 단 몇 센트에 작동하고 자체 배포와 튜닝까지 가능한 상황에서 글로벌 시장의 그 누구도 폐쇄형 모델에 고액의 프리미엄을 계속 지불하려 하지 않을 것입니다.

또한 현실적인 비용을 계산한 다른 의견도 있었습니다. 로그 모니터링, 감사, 데이터 품질 검사 같은 작업은 플래그십 모델을 쓰기엔 비용 효율이 맞지 않지만, 저렴한 모델을 쓰기엔 완벽합니다. 수요는 항상 존재했지만 이전에는 비용을 감당할 수 없었을 뿐입니다.

물론 대형 모델의 불가체성을 주장하는 목소리도 타당합니다. 또 다른 댓글 작성자는 단순 작업은 어느 모델이나 충분하지만, 24시간 이상 연속으로 진행되는 복잡한 작업에서는 소형 모델의 오류가 누적되므로 대형 모델이 여전히 대체 불가능하다고 지적했습니다. 향후에는 ‘대형 모델이 지휘관 역할을 하고 저렴한 모델이 실무를 담당하는’ 혼합 구조가 유력해질 것입니다.

현재의 트렌드로 볼 때 경쟁은 ‘누가 더 강력한가’에서 ‘누가 더 효율적인가’로 이동하고 있습니다. 스마트폰이 사치품에서 생필품이 되었듯이, 절대적인 성능은 더 이상 가장 희소한 자원이 아닙니다.

본 분석은 ARC Prize 공식 페이지 및 공개 커뮤니티 토론을 바탕으로 작성되었습니다. 필자는 해당 프로젝트의 개발에 참여하지 않았으며 개인적인 시각이 포함되어 있을 수 있으니 의견이 있으시면 지적해 주시기 바랍니다.

참고 링크

  • ARC Prize: DeepSeek V4 Flash 0731 결과 페이지
  • ARC Prize: 리더보드 순위표 페이지
  • HN 토론 (item?id=49214008)
  • DeepSeek 공식 API 문서
  • Artificial Analysis: DeepSeek V4 Flash 가격 및 평가
  • vLLM Recipes: DeepSeek V4 Flash 모델 설명