구글의 가장 저렴한 AI가 벤치마크 1위 달성: 13초, 1.8센트로 웹페이지 완성

구글의 가장 저렴한 AI가 벤치마크 1위 달성: 13초, 1.8센트로 웹페이지 완성

AIGemini

데이터 소스:HN + web research

2026년 9월 2일, 구글(Google)은 6주 만에 세 번째 경량화 모델인 Gemini 3.8 Flash를 내놓았습니다. 이 모델의 가격은 백만 입력 토큰당 0.75달러에 불과합니다. 여러 핵심 벤치마크에서 이 모델은 각 회사가 막대한 자금을 투자한 플래그십 제품들을 직접적으로 넘어섰습니다. 세상에서 가장 저렴한 AI와 가장 강력한 AI가 처음으로 같은 이름 아래 겹쳐졌습니다. 헐값의 도구가 이미 육중한 장비를 이길 수 있게 되었습니다. 고가의 프리미엄 플래그십 제품들은 새로운 존재 이유를 찾아야 합니다.

6주 연속 3세대 출시, 저렴한 컴퓨팅 파워가 프리미엄 공간을 압박하다

3.7 버전이 출시된 지 불과 3주 만에 3.8 Flash가 식탁 위에 올랐습니다. 첫 출시 가격은 하한선을 유지하고 있습니다. 백만 입력 토큰당 단 0.75달러면 됩니다. 출력 토큰 또한 3.75달러에 불과합니다. 구글은 2027년 새해 이후 가격이 1.50달러로 두 배 인상될 것이라고 예고했습니다. 그럼에도 불구하고 컴퓨팅 파워 시장에서 여전히 가장 저렴한 부류에 속합니다.

Gemini 3.8 Flash와 플래그십 모델 벤치마크 비교 그림: Gemini 3.8 Flash는 교차 도메인 다단계 추론(HLE-Verified)에서 54.9%의 점수를 획득했습니다. 출처: 구글 공식 블로그

극도로 낮은 가격표 이면에는 타협 없는 엔지니어링 지표가 있습니다. HLE-Verified 벤치마크는 교차 도메인의 다단계 추론 능력을 평가합니다. 3.8 Flash는 여기서 54.9%의 점수를 획득했습니다. DeepSWE v1.1은 장기 소프트웨어 엔지니어링 능력을 전문적으로 평가합니다. 이 테스트에서 이 모델은 엄청난 규모의 대다수 플래그십 모델을 능가했습니다. 수직적 도메인 테스트에서도 역시 강세를 보였습니다. Vals Finance든 Harvey’s Legal 벤치마크든 다른 값비싼 경쟁 제품들을 전면적으로 압도했습니다. 플래그십보다 훨씬 낮은 비용으로 최상위권의 성적을 거두었습니다. 모델의 능력 성장 곡선이 저비용 측으로 기울어지고 있습니다.

저렴한 모델이 등급을 뛰어넘어 승리할 수 있었던 이유는 기저 설계 방향의 변화에 있습니다. 모델은 복잡한 논리적 임무를 처리할 때 능동적으로 백그라운드에서 다단계 추론을 수행합니다. 외부 도구를 반복적으로 호출하여 최종 답변을 한 단계씩 다듬어나갑니다. 개발자는 수동으로 effort 매개변수를 낮출 수도 있습니다. 이는 내결함성이 높은 비즈니스에서 대량의 토큰 소비를 절약할 수 있습니다. 소형 모델은 연산 시간을 늘려 매개변수 규모의 선천적 열세를 극복했습니다. 이는 현재 기술 프레임워크 하에서 가장 효과적인 부가 기능입니다.

13초 만에 상호작용형 웹페이지 완성, 놀라운 화면 뒤에 숨겨진 정적 코드

저렴한 컴퓨팅 파워가 가져다준 속도의 우위는 개발자 커뮤니티에서 직관적인 시각적 충격으로 전환되었습니다. 유명한 개발자 simonw가 현장 데모를 진행했습니다. 그는 간단한 HTML 개발 명령 한 줄만 입력했습니다. 모델은 13초의 시간과 불과 1.8센트의 비용을 들여 상호작용 가능한 데모 프로그램을 제출했습니다.

하지만 이것은 결코 흠잡을 데 없는 엔지니어링 기적과는 거리가 멉니다. 댓글 창에는 이내 누군가 그 실제 코드를 파헤쳤습니다. 데모 페이지에서 눈에 띄는 ‘60 FPS’라는 글자는 기술적인 내용이 전혀 담겨 있지 않았습니다. 그것은 단지 모델이 HTML 구조에 직접 하드코딩한 정적 텍스트에 불과했습니다. 실제로 브라우저에서 이 코드를 실행했을 때는 육안으로 보일 정도의 끊김 현상까지 동반되었습니다. 저렴한 컴퓨팅 파워는 놀라운 화면을 생성하는 문턱을 평정했습니다. 생성된 코드의 근본적인 신뢰성은 여전히 인간 엔지니어가 줄 단위로 검토하고 리팩토링해야 합니다.

이처럼 저렴하고 빠르면서도 조잡하고 융통성 없는 현상은 공식 데모에도 똑같이 존재합니다. 공식 측은 여러 개의 단일 문장 명령 데모 사례를 제시했습니다. 이 사례들은 시각적으로 매우 큰 충격을 주며 새로운 모델의 만능함을 과시했습니다.

데모 프로젝트트리거 명령(Prompt)산출 결과
3D 성(castle) 퍼즐장면과 재질을 묘사하는 한 문장플레이 가능한 3D 게임 (Nano Banana 생성 텍스처 포함)
레트로 내비게이션 지도레트로 스타일을 요구하는 한 문장실제 거리 뷰 및 경로 검색이 포함된 DOS 버전 구글 지도
지형 시각화 분석실제 지리 데이터를 가져오는 한 문장USGS 데이터 기반의 상호작용형 지형 단면도
하드웨어 3D 분해구성 요소 구조를 묘사하는 한 문장Hardware Anatomy 상호작용형 3D 기기 분해 시각화 프로그램

이러한 사례들은 풍부한 컴퓨팅 파워가 아이디어 단계에서 맹렬하게 돌진하는 모습을 보여줍니다. 소프트웨어 프로토타입 개발의 시행착오 비용이 무한대로 압축되었습니다. 이제 누구나 풀스택 제품 팀의 역할을 시도해 볼 수 있습니다. 일회성 데모를 바로 서비스에 적용할 수는 없습니다. 이를 장기적으로 유지 관리할 수 있는 상용급 코드로 전환하려면 아키텍처 수준에서 여전히 넘어야 할 간극이 존재합니다.

2시간 만에 시스템 취약점 발견, 저렴한 컴퓨팅 파워가 공격과 방어의 저울을 바꾸다

일반적인 개발 작업에는 코드 품질에 대한 논란이 여전히 동반됩니다. 하지만 보안 특화 분야에서 저비용 컴퓨팅 파워의 집중 공격은 전혀 다른 문제 해결의 실마리를 보여주었습니다. 구글은 보안 특화 버전인 3.8 Flash Cyber를 동시에 출시했습니다. 이 모델은 Fairwind Program 인증 체계를 따르며 오직 신뢰할 수 있는 방어 측에만 제공됩니다.

클라우드 취약점 연구 팀은 이를 이용해 내부 테스트를 진행했습니다. 단 2시간 만에 심각한 아키텍처 취약점을 찾아냈습니다. 이는 상식적으로 인간 전문가가 위치를 파악하는 데 수개월이 걸릴 만한 일이었습니다. 이 모델은 CyberGym 취약점 발견 테스트에서 최첨단 수준에 도달했습니다. 20가지 프로그래밍 언어에 걸친 실제 취약점 발견 성공률이 70% 이상으로 안정적으로 유지되었습니다.

DeepSWE 장기 엔지니어링 벤치마크 결과 그림: 3.8 Flash가 매우 낮은 비용으로 장기 소프트웨어 엔지니어링 테스트에서 대형 모델을 능가했다. 출처: 구글 공식 블로그

더욱 중요한 것은 취약점을 파악하고 자동으로 패치하는 능력입니다. 크롬(Chrome) 보안 팀이 실제 테스트를 진행했습니다. 3.8 Flash Cyber가 제시한 올바른 패치 수는 시중에 나와 있는 가장 큰 상용 모델의 2.6배에 달했습니다. 이 모델은 CWE-Bench 테스트에서 47.2%의 성적을 거두었습니다. 이는 선두 플래그십에 근소한 차이로 뒤처진 수치입니다. 하지만 테스트를 완료하는 데 드는 추론 비용은 자릿수 단위로 더 낮았습니다. 보안 방어 검사의 컴퓨팅 비용이 극도로 낮아졌습니다. 이는 사이버 보안의 쫓고 쫓기는 게임에서 보기 드문 시스템적 해결책입니다.

개발 효율성 신화의 냉각, 엔지니어링 팀은 기술 부채를 갚기 시작하다

저렴하고 강력한 새로운 도구에 직면한 커뮤니티의 반응은 빠르게 두 진영으로 나뉘었습니다. 해커뉴스(Hacker News)의 주요 토론 공간에서 deno 같은 낙관론자들은 전통적인 경험이 직접적으로 깨졌다고 탄성을 내질렀습니다. 차세대 경량화 모델이 저렴하고, 빠르고, 좋다는 세 가지 장점을 모두 차지했습니다. 사용자 ipsod는 Flash 라인업이 매달 육안으로 그 진화를 체감하게 해주는 제품이라며 감회를 표했습니다.

다른 한편, 일선 엔지니어링 팀들은 저렴한 컴퓨팅 파워가 가져온 쓴 열매를 씹고 있습니다. 사용자 rjh29는 주관적인 향상 효과가 뚜렷하지 않다고 털어놓았습니다. 심지어 자신이 공식 문서를 찾아보는 횟수조차 줄어들었다는 것을 알게 되었습니다. 훨씬 더 날카로운 목소리는 Forgeties79에게서 나왔습니다. 그는 주변 엔지니어링 팀들이 진흙탕에 빠져 있다고 지적했습니다. 모두가 과거 AI를 이용한 코딩을 무비판적으로 도입하면서 남겨진 기술 부채를 대량으로 갚고 있다는 것입니다.

방대한 양의 코드를 생성하는 비용이 0에 수렴하고 있습니다. 코드 저장소의 엔트로피 증가 속도는 인간이 코드를 심사하는 물리적 한계를 직접적으로 돌파했습니다. Gemini 3.8 Flash는 강력한 코드 생성 능력을 갖추고 있습니다. 이 모델은 매우 저렴한 가격으로 모든 개발자의 에디터에 침투했지만, 전설처럼 내려오던 100배의 생산성은 약속대로 찾아오지 않았습니다.

이 모델의 의미는 얼마나 많은 벤치마크 점수를 얻었느냐에 있지 않습니다. 현재의 기술 경로 아래에서 최고 수준의 추론 능력이 더 이상 고비용의 1회 요청 비용과 강제로 결합되지 않는다는 사실을 증명했습니다. 가장 저렴한 가격대의 도구가 엔지니어링 실전에서 플래그십 제품을 압도했습니다. AI 업계가 줄곧 따랐던 가격 책정 논리가 해체되기 시작했습니다. 새로운 모델은 그 실력만으로 플래그십 제품의 프리미엄 공간을 박살 냈습니다. 그와 동시에 하나의 난제를 던져놓았습니다. 엄청난 양의 불안정한 기계 생성 코드를 어떻게 관리할 것인가? 이 짐은 모든 팀 책임자의 책상 위에 단단히 떨어졌습니다.

참고 링크:

  • 구글(Google) 공식 블로그
  • HN 토론 (item?id=49537553)
  • simonw 실제 테스트