8월 14일 저녁, 알리바바 통의천문(Qwen) 팀이 270억 매개변수 규모의 소형 모델 Qwen3.8-27B를 공개했다. Apache-2.0 라이선스 기반의 무료 오픈소스로 누구나 다운로드할 수 있다. 공식 성적표에 따르면 코딩 벤치마크 DeepSWE 1.1 점수가 이전 세대의 13.3점에서 42.2점으로 3배 이상 폭등하며, 조 단위 매개변수를 보유한 복수의 상용 폐쇄형 모델을 제쳤다. 이 소식은 글로벌 개발자 커뮤니티 Hacker News에 전달되어 하루 만에 819개 추천과 539개 댓글을 기록하며 당일 가장 뜨거운 기술 주제로 떠올랐다.
이것은 단순한 ‘신규 모델 출시’ 소식이 아니다. 지난 2년간 AI 업계를 지배해 온 “매개변수가 많을수록 더 똑똑하다”는 통념에 직접적으로 도전하는 사건이다.
AI 업계에서 270억은 ‘소형’
먼저 ‘매개변수(Parameter)‘가 무엇인지 정리해 보자. 대형 언어 모델을 거대한 조절 노브가 달린 기계로 비유하자면, 각각의 매개변수는 돌릴 수 있는 하나의 노브다. 노브가 많을수록 기계가 담을 수 있는 정보량이 늘어난다. 지난 수년간 AI 기업들의 경쟁은 누가 더 많은 노브를 쌓는가에 집중되어 왔다. 수천억에서 조 단위로 확대되며 최첨단 상용 모델은 2조 내지 2.4조 개에 달하는 매개변수를 쌓았는데, 이는 270억의 거의 90배에 이른다.
노브가 많다는 것은 학습 시 훨씬 많은 GPU와 전력을 소모하고, 이용할 때도 클라우드상에서 비싼 연산 자원을 빌려야 함을 의미한다. “크면 클수록 좋다”는 군비 경쟁의 비용은 결국 일반 사용자의 월간 구독료나 토큰당 API 청구서로 환산되었다. 일반인이 AI를 접하는 길은 사실상 “돈을 내고 클라우드상의 거대한 뇌를 임대하는 것”뿐이었다.
Qwen3.8-27B는 다른 길을 가고자 한다. 노브를 무작정 늘리는 대신 정교하게 만드는 것이다.
성적표 확인: 3배 상승 및 거대 모델 격파
공식 비교표에서 경쟁 상대는 이전 세대 Qwen3.6-27B, 상위 모델 Qwen3.7-Plus, 동일 체급의 Muse Glimmer-30B, 그리고 상용 거물 Opus 4.6 Max다. 270억 체급의 이 소형 모델은 다음과 같은 성적을 거두었다.
- 코딩 과제 DeepSWE 1.1: 42.2 (이전 세대 13.3 대비 3배 이상 상승, Qwen3.7-Plus의 14.2 대비 약 3배 점수);
- 소프트웨어 공학 과제 SWE-bench Pro: 61.7 (Opus 4.6 Max의 53.4 초과);
- 업무 자동화 과제 CoWorkBench: 70.7 (Opus의 68.2 초과);
- 터미널 조작 과제 Terminal Bench 2.1: 73.0 (Opus의 78.2에 근접하며 격차를 5점 이내로 축소).
그림: Qwen3.8-27B 공식 성적표. 코딩 및 업무 자동화 과제에서 전 세대 및 폐쇄형 대형 모델과 비교. 출처: 통의천문 공식 발표 (IT Home 재인용)
명확히 말해, 모든 영역에서의 압도적 압승은 아니다. 저장소 단위 코드 생성 등 일부 과제에서는 Opus가 여전히 앞서 있으며, 조 단위 거대 모델이 많은 시나리오에서 여전히 우위를 점하고 있다. 그러나 방향은 이미 바뀌었다. 270억 매개변수 모델이 자신보다 수십 배 큰 상대와 맞붙어 승패를 겨루는 것이 더 이상 일방적이지 않게 되었으며, 이는 2년 전만 해도 상상하기 힘든 일이었다.
소형 모델은 어떻게 추격했는가?
이 점이야말로 이번 발표에서 가장 주목할 부분이다. 공식 모델 카드와 커뮤니티 토론에 따르면, 세 가지 구체적인 엔지니어링 설계를 통해 이를 달성했다.
첫째, 어텐션 메커니즘의 ‘하이브리드’ 적용. 대형 언어 모델이 텍스트를 읽을 때 ‘어텐션’이라 불리는 메커니즘을 통해 집중할 맥락을 결정하는데, 이는 연산 자원을 가장 많이 소모하는 요소다. Qwen3.8-27B는 총 64개 레이어 구조 중 약 4분의 3을 경량화된 ‘선형 어텐션’(공식 명칭 Gated DeltaNet)으로 교체하고, 나머지 4분의 1에만 전통적인 고정밀 어텐션을 유지했다. 책을 읽을 때 대부분의 장은 속독하고 핵심 장만 정독하는 것에 비유할 수 있다. 절약된 연산력을 통해 270억 매개변수로도 충분한 지식을 효율적으로 소화할 수 있게 되었다.
둘째, 한 번에 여러 토큰 예측. 기존 모델은 한 번에 다음 1개 토큰만 예측했지만, Qwen3.8-27B는 ‘다중 토큰 예측’(MTP) 학습을 통해 한 번에 여러 토큰을 동시에 예측한다. 장기 기사가 수 내다보듯 더 매끄러운 생성과 빠른 속도를 구현했다.
셋째, 추론 깊이 조절 스위치. 모델은 기본적으로 ‘생각한 뒤 답변’하도록 설계되었으나, 새로운 reasoning_effort 노브를 추가하여 과제 난이도에 따라 추론 깊이를 조절할 수 있게 했다. 간단한 질문에는 즉시 답변하고, 난제에서만 깊은 추론에 들어간다. 커뮤니티 실측에서 “자전거를 타는 펠리컨” 그림을 요청하자 2만 단계를 넘는 추론을 21분 동안 거쳐 경이로운 결과물을 제출한 반면, 간단한 질문에는 수 초 만에 응답했다. 생각하는 시간의 주도권을 사용자에게 넘김으로써 엔지니어링 차원에서 자원을 절약한 것이다.
이러한 설계에서 알 수 있는 판단은 분명하다. 학습 데이터와 구조적 기법에 공을 들이는 것이 매개변수를 무작정 늘리는 것보다 훨씬 가성비가 높다는 점이다. 이 판단의 성립 여부는 추가적인 제3자 검증이 필요하지만, 공개된 정보에 따르면 이는 Qwen이 추진하는 ‘소형 모델 노선’의 핵심 기반이 되었다.
소설 한 권 분량의 기억력과 이미지 시각 능력
코딩 외에도 이 모델은 일반 사용자에게 매우 직관적인 두 가지 능력을 갖추고 있다.
첫째는 초장문 ‘기억력’이다. 기본적으로 26만 토큰의 컨텍스트 창을 지원하며, 이는 20만 자 분량의 장편 소설 한 권을 한 번에 읽고 전후 맥락을 기억할 수 있는 수준이다(기술적으로 100만 토큰까지 확장 가능). 과거 긴 문서나 긴 영상의 AI 처리는 클라우드 거대 모델의 전유물이었으나, 이제 소형 모델에서도 수용 가능해졌다.
둘째는 네이티브 이미지 및 영상 이해 능력이다. 이미지와 영상이 ‘퍼스트 클래스 시민’으로 다루어져 이공계 도표, 스캔 문서부터 수 시간 분량의 영상까지 직접 이해하고 처리할 수 있다. 공식 멀티모달 성적표에서도 다수의 대형 모델보다 앞선 순위를 기록했다.
그림: Qwen3.8-27B 공식 멀티모달 성적표. 이미지 및 영상 이해 과제 비교. 출처: 통의천문 공식 발표 (IT Home 재인용)
노트북에서도 실행: 오픈소스가 준 가장 실질적인 선물
매개변수가 작아짐에 따른 가장 직접적인 변화는 하드웨어 비용이다. 조 단위 모델을 자체 호스팅하려면 수십 대의 기업용 GPU가 필요하지만, Qwen3.8-27B의 FP8 양자화 버전을 적용하면 가중치가 약 17GB에 불과하며, 양자화 후 성능도 원본과 거의 동일하다. 고화질 사진을 일반 화질로 압축해도 육안으로 구별하기 힘든 것과 같다. 이미 커뮤니티에서는 MacBook에서 무료 오픈소스 도구로 실행하거나 개인용 GPU에 배포하는 사례가 잇따르고 있다.
이것이 바로 Apache-2.0 라이선스 기반 ‘무료 오픈소스’가 가지는 의미다. 상업적 이용을 포함해 자유롭게 다운로드하고 수정할 수 있다. 소규모 기업이 내부 프로세스에 AI를 도입할 때 클라우드 API 사용료를 지불하거나 외부로 데이터를 송출할 필요가 없다. 연구자와 학생 역시 모델 내부 동작 메커니즘을 자유롭게 펼쳐볼 수 있다. Hacker News의 한 개발자는 Qwen의 이전 세대 소형 모델로 서비스를 운영해 왔으며, 신버전 발표 당일 밤 즉시 테스트에 착수했다고 밝혔다.
커뮤니티 내에는 냉철한 시각도 존재한다. 추론 흔적이 지나치게 길어 일부 과제에서 오버씽킹을 한다는 지적이나, 벤치마크 점수가 반드시 일상적인 체감 성능과 비례하지 않는다는 조언도 나온다. 이러한 지적들은 모두 타당하며, ‘소형 모델 시대가 완성되었다’라기보다는 소형 모델이 비로소 거대 모델과 같은 테이블에 앉아 경쟁할 자격을 얻었음을 의미한다.
군비 경쟁에서 다각화 체제로 전환되는 가운데, 알리바바가 제시한 선택지는 사용자에게 주도권을 돌려주는 것이다. 극한의 성능이 필요하면 클라우드 거대 모델을 임대하고, 저비용·개인정보 보호·제어 가능성을 원한다면 노트북에서 구동되는 270억 소형 모델을 활용하면 된다. 두 니즈에 대한 답이 원래 하나일 필요는 없다.
참고 링크:
- Hugging Face 모델 페이지: Qwen3.8-27B (공식 모델 카드, 아키텍처 및 전체 벤치마크 데이터)
- Hugging Face 모델 페이지: Qwen3.8-27B-FP8 (양자화 가중치 버전)
- Hacker News 토론: Qwen 3.8 27B (819점 / 539개 댓글)
- IT Home: 알리바바 Qwen3.8-27B 오픈소스 공개, 코딩 및 업무 영역에서 Qwen3.7-Plus 능가
- Zhihu 칼럼: Qwen3.8-27B 오픈소스 공개!