100배 저렴한 오픈소스 AI가 최고가 모델을 이긴 이유: Neon의 검색 벤치마크 분석

ai오픈소스비용

데이터 소스:HN + web research · HN

8월 5일, 데이터베이스 기업 Neon이 놀라운 성과 측정 결과를 발표했습니다. 알리바바의 오픈소스 모델 Qwen3.5를 기반으로 강화학습을 거친 40억(4B) 매개변수의 소형 모델이 ‘검색(Retrieval)’ 작업에서 1.447점을 기록하며, OpenAI의 가장 비싼 프론티어 모델인 GPT-5.6 Sol(1.369점)을 제쳤습니다. 소형 모델이 승리했으며, 요청 1건당 처리 비용은 상대 모델의 약 1/100 수준에 불과했습니다.

이 벤치마크 발표는 공개 직후 Hacker News 등 기술 커뮤니티에서 200개 이상의 추천과 수십 개의 댓글을 모으며 찬사와 논란을 동시에 불러일으켰습니다. AI에서의 검색이 의미하는 바는 무엇인지, 100배의 비용 차이는 어떻게 산출되었는지, 그리고 이 성과를 어디까지 신뢰할 수 있는지 상세히 짚어봅니다.

검색: AI가 질문에 답하는 첫 번째 단계

먼저 ‘검색(Retrieval)’ 개념을 정리할 필요가 있습니다. AI 비서에게 “회사 출장비 정산 기준은 며칠 전까지 신청해야 하나요?”라고 물었을 때, AI가 문서 전체를 통째로 암기해서 답변하는 것은 아닙니다. AI는 적절한 서가로 이동해 알맞은 안내서를 뽑아 들고, 해당 페이지를 찾아 읽어주는 방식으로 작동합니다. 이처럼 필요한 자료를 찾아내는 과정이 바로 검색입니다.

ChatGPT와 같은 AI 도구의 답변 정확도는 검색의 품질에 절반 이상 의존합니다. 필요한 자료를 정확히 찾았다면 이후 문장 구성이 다소 매끄럽지 않더라도 기본 답변의 틀은 유지됩니다. 반면 자료 검색에 실패하면 아무리 유창한 문장이라도 환각(Hallucination)에 불과합니다. 고객지원 봇이나 내부 지식베이스 Q&A처럼 수많은 문서, 티켓, 제품 설명서에서 정보를 추출해야 하는 기업 환경에서는 검색의 중요성이 더욱 도드라집니다.

기존 검색과 에이전트형 검색 프로세스 비교 그림: 단일 실행 방식의 기존 검색과 다중 단계로 접근하는 에이전트형 검색 프로세스 비교. 출처: neon.com

과거에는 한 번 검색하고 끝내는 방식이었지만, 최근 AI는 사람이 자료를 조사하듯 한 번 검색해보고 결과를 확인한 뒤 필요에 따라 추가 검색을 진행하며 정답에 접근합니다. Neon의 계산에 따르면 GPT-5.6 Sol을 사용해 이러한 다중 단계 검색을 1회 수행하는 데 10초 이상이 소요되며 비용은 약 3센트입니다. 검색 단계가 늘어날 때마다 최고급 모델의 토큰 비용이 누적되므로, 검색은 전체 프로세스에서 가장 비용이 많이 드는 구간 중 하나였습니다.

왜 ‘검색’ 영역에서 먼저 역전이 일어났는가

오픈소스 소형 모델이 폐쇄형 거대 모델을 제치는 현상이 왜 검색 작업에서 가장 먼저 나타났을까요? 그 이유는 세 가지로 요약됩니다.

첫째, 작업의 목표가 매우 명확합니다. 검색의 목표는 ‘정확한 자료 하나를 찾아내는 것’입니다. 이 단일 동작을 집중적으로 훈련시키는 것은 모든 분야에 능통한 범용 모델을 만드는 것보다 훨씬 수월합니다. Hacker News 커뮤니티의 한 사용자는 “공장 조립 라인 작업에 박사급 인력을 투입할 필요는 없다”고 비유했습니다. 반복적이고 구조화된 검색 작업에는 저렴한 소형 모델만으로도 충분합니다.

둘째, 평가 기준이 객관적입니다. 필요한 자료를 찾았는지 여부는 기계적으로 자동 판정할 수 있습니다. 이는 강화학습(RL) 환경에 최적의 조건입니다. 모델이 검색 도구를 사용해 보상과 감점을 받으며 수만 번의 시행착오를 거치도록 훈련하면 ‘언제, 무엇을 검색해야 하는지’ 스스로 습득하게 됩니다. 훈련 전 0.382점이었던 보상 점수는 훈련 후 1.447점으로 상승했습니다. 실질적인 반복 학습을 통해 성능이 확실히 향상된 것이며, 바닥부터 대형 모델을 만들지 않고도 오픈소스 미세조정 기술만으로 높은 성과를 낼 수 있음을 보여줍니다.

훈련 과정 중 모델의 평균 보상 점수 변화 그림: 훈련 단계가 진행됨에 따라 지속적으로 상승하는 평균 보상 점수. 출처: neon.com

셋째, 데이터가 기업 내부에 존재한다는 점입니다. 자체 문서를 ‘질문-답변’ 형태의 학습용 데이터로 자동 변환하고 미세조정 과정을 거치면 맞춤형 전용 모델이 완성됩니다. 외부로 데이터를 송출할 필요가 없어 개인정보 보호 및 보안 우려도 자연스럽게 해소됩니다.

100배 비용 차이의 산출 근거

‘100배 저렴하다’는 표현은 과장된 광고처럼 들릴 수 있지만, 정량적인 숫자로 증명되는 영역입니다.

우선 단순 API 토큰 단가를 비교해봅니다. GPT-5.6 Sol의 API 가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 30달러 수준으로 프리미엄 가격이 적용됩니다. 반면 호스팅형 오픈소스 소형 모델의 가격은 입력 0.03달러, 출력 0.15달러 수준으로, 단순 단가 차이만 160배에서 200배에 달합니다.

다음으로 실제 실행 비용을 측정했습니다. Neon이 제시한 단일 검색 요청당 비용은 GPT-5.6 Sol이 약 0.0873달러, 4B 소형 모델이 약 0.00092달러였습니다. 실제 차이는 94.9배로, 대외적으로는 이를 반올림하여 100배로 표기했습니다.

비용 대비 점수 비교 그래프 그림: 가로축은 요청당 비용, 세로축은 평가 점수. 좌상단에 위치할수록 우수함을 의미. 출처: neon.com

이를 일상적인 서비스 규모로 환산해보면 확연한 차이가 드러납니다. 하루 10만 건의 검색을 처리하는 기업의 경우 Sol을 사용하면 하루 약 8,700달러(월 26만 달러 이상)가 소요되는 반면, 소형 모델을 사용하면 하루 92달러로 해결됩니다. 사용량이 백만 단위로 늘어나는 환경에서는 100배의 비용 차이가 사업의 지속 가능성을 결정짓는 핵심 요소가 됩니다. AI 가격 경쟁의 중심축은 단순한 ‘단가 할인’에서 ‘소형 모델 대체’로 옮겨가고 있습니다.

논란: 결과 발표를 바라보는 두 가지 시선

가장 강력한 비판은 테스트 방식 자체에서 나옵니다. 이번 비교는 기업이 자체 생성한 데이터셋을 기반으로 내부에서 측정한 결과이며, 전체 평가 문제는 공개되지 않았고 BEIR 등 업계 공인 범용 벤치마크를 거치지도 않았습니다. Hacker News의 한 사용자는 “모든 벤치마크는 자사에 유리한 방향으로 조율된다”며 기업 발표 자료에 대한 불신을 나타냈습니다. AI Pricing Guru의 독립 분석 역시 상세 세부 수치가 부족해 제3자의 재현이 어렵다고 지적했습니다.

반면 긍정적으로 바라보는 시각도 존재합니다. 검색의 평가 기준은 비교적 객관적이며, 보상 점수의 상승 곡선(0.382 → 1.447)은 명확한 성능 개선을 보여줍니다. 커뮤니티의 일부 사용자들은 직접 테스트해본 결과 “사실 정보 검색 영역에서는 대형 모델이 불필요하게 복잡한 추론을 시도하다 길을 잃는 반면, 소형 모델이 더 빠르고 정확하게 정답을 찾아낸다”는 경험담을 공유하기도 했습니다. 무엇보다 토큰 단가 차이 자체는 공개 가격표로 확인되는 명백한 사실입니다.

결론적으로 ‘비용이 100배 절감된다’는 점은 사실에 가깝지만, ‘프론티어 모델을 압도했다’는 주장은 현재 해당 기업이 설정한 테스트 환경 내에서 유효한 것으로 해석할 수 있습니다. 실제로 Neon 블로그 본문에 언급된 단일 요청 비용(약 3센트)과 그래프 상의 수치(8.7센트)에 차이가 존재하는 등 산정 기준에 따라 변동폭이 큽니다. 현실 세계의 검색은 정제된 데이터셋보다 훨씬 복잡하며 문서가 노후화되었거나 질문이 모호한 경우가 많습니다. 이러한 실제 환경에서도 소형 모델이 우수한 성능을 유지할지는 지속적인 검증이 필요합니다. 아울러 복잡한 코드 작성이나 장문 추론 등의 영역에서는 여전히 대형 모델이 압도적인 우위를 점하고 있습니다.

AI 가격 전쟁의 향후 향방

이번 발표가 던지는 중요한 메시지는 AI 생태계가 ‘모든 일을 처리하는 단일 대형 모델’ 구조에서 ‘각자 특화된 역할을 담당하는 저렴한 전문 모델의 조합’으로 변화하고 있다는 점입니다. 이에 따라 기업 내부 지식베이스 구축이나 고객지원 자동화 등 AI 서비스 도입 비용은 앞으로 더욱 파격적으로 낮아질 전망입니다.

업계 차원에서는 가격 경쟁의 전선이 ‘토큰 판매가’를 넘어서 ‘어떤 작업을 어떤 모델에 맡길 것인가’로 확장되고 있습니다. 오픈소스 소형 모델이 특정 영역에서 거대 모델의 성능을 따라잡을 때마다 닫힌 생태계의 가격 지배력은 약화될 것입니다. 검색은 그 첫 번째 타깃이었을 뿐, 앞으로 더 많은 영역에서 동일한 변화가 일어날 것입니다.

참고 링크:

  • Neon 블로그: How Castform + Neon Beats Frontier Models on Price and Efficiency
  • Hacker News 토론 (item?id=49186762)
  • AI Pricing Guru: Castform Beats GPT-5.6 Sol: Cost Impact (August 2026)