원시 데이터 없는 오픈소스 AI: 780억 파라미터 Kolibri가 전면 공개한 제조 레시피

원시 데이터 없는 오픈소스 AI: 780억 파라미터 Kolibri가 전면 공개한 제조 레시피

인공지능거대언어모델오픈소스 생태계

데이터 소스:Aleph Alpha 技术报告 + HN 讨论

전 세계가 오픈소스를 외치고 있지만, 모델 가중치 공개와 학습 데이터 공개가 전혀 다른 차원의 문제라는 점을 명확히 구분하는 사람은 드물다.

2026년 10월 3일 독일 통일의 날, 유럽의 AI 기업 알레프 알파(Aleph Alpha)는 780억 개의 파라미터를 갖춘 거대 모델 ‘Kolibri’를 선보였다. 이들은 모델의 가중치를 오픈소스로 제공했으나, 원시 학습 데이터는 단 1KB도 외부에 넘기지 않았다.

모델이 공개되자마자 커뮤니티 토론장은 데이터의 행방을 둘러싸고 격렬한 공방에 휩싸였다. 원시 데이터를 제공하지 않는다면 진정한 개방이라 부를 수 없다는 원칙론과, 업계가 이미 가중치만 제공하는 방식을 관행으로 받아들여 왔다는 현실론이 팽팽히 맞섰다.

변질된 오픈소스의 개념: 완제품은 주되 원재료는 숨기다

사용자에게 음식을 무료로 대접하는 것과, 대대로 내려오는 비법 요리법과 식자재 공급망 목록까지 통째로 건네는 것은 전혀 다른 일이다. 빅테크 기업들은 오랫동안 오픈소스라는 모호한 간판을 내세워 핵심 학습 데이터에 대한 독점권을 정당화해 왔다.

Kolibri는 실용적인 절충안을 택했다. 알레프 알파는 활성 파라미터가 30억 개에 달하는 MoE(혼합 전문가) 구조의 모델을 아파치 2.0 라이선스로 허깅페이스에 무료 배포했다. 하지만 가장 핵심인 원시 데이터셋은 비공개로 유지하는 대신, 데이터셋을 밑바닥부터 구축할 수 있는 방대한 재현 설명서를 상세히 공개했다.

사전 학습에 참여한 엔지니어들은 커뮤니티 게시판에 직접 등판해 데이터 정제 과정의 세부 질문에 하나하나 답변을 남겼다. 물리적인 하드디스크를 넘겨주는 행위는 표면적인 요식행위에 불과하다. 진정한 투명성은 데이터 증류에 이르는 전체 파이프라인을 온전히 통제하고 있음을 증명하는 데 있다.

Kolibri 공식 비주얼 그림: 녹색 그라데이션 배경 위의 흰색 벌새 로고와 워드마크. 출처: Aleph Alpha

번역투 거부: 21%의 모국어 데이터로 주권을 되찾다

이 거대 모델을 학습시키기 위해 무려 20조 개의 토큰이 투입되었다. 가장 핵심적인 사전 학습 말뭉치 가운데 독일어 고유 데이터는 21.3%를 차지한 반면, 기계 번역된 텍스트는 단 6% 수준으로 압축되었다.

이러한 배합 비율 뒤에는 명확한 방어 논리가 숨어 있다. 번역 텍스트에 지나치게 의존하면 모델에 영미권의 문화적 지문이 짙게 남을 수밖에 없다. 알레프 알파는 정확한 중복 제거, 유사 중복 제거, 부분 문자열 중복 제거 및 휴리스틱 필터링의 구체적인 구현 방식을 투명하게 공개했다.

7.5조에서 20조 토큰으로 데이터를 확장하는 과정에서도 품질 분류기의 증류 과정이 상세히 기술되었다. 데이터 정제 레시피를 스스로 정리해 공개할 수 있는 팀만이 타인에게 휘둘리지 않는 주권을 논할 자격을 얻는다.

연산 자원이 대체할 수 없는 자제력: 기계에게 모른다고 답하는 법을 가르치다

기초 과학 및 수학 평가에서 Kolibri는 AIME 2026 수학 경시대회 벤치마크 96.0점을 기록했다. 이는 활성 파라미터 규모가 4배에 달하는 경쟁 모델들과 어깨를 나란히 하는 성적이다.

알레프 알파는 머린-아서(Merlin-Arthur) 프로토콜을 도입해 기계가 자신의 무지를 인정하도록 훈련시켰다. 주어진 맥락을 벗어나거나 답을 유추할 수 없는 질문을 마주했을 때, 모델은 그럴듯하게 거짓말을 꾸며내는 대신 단호하게 “모른다”고 답한다.

환각을 억제하려면 모델이 자신의 지식 경계를 예민하게 자각해야 하며, 이러한 엔지니어링의 정밀함은 단순히 그래픽카드를 무작정 쏟아붓는다고 해서 얻어지지 않는다.

Kolibri-1 모델 카드 그림: 허깅페이스에 등록된 Kolibri-1 모델 카드의 상세 내용. 출처: Hugging Face / Aleph Alpha

원재료 자체를 레시피로 대체하다

저작권 보상 문제는 여전히 풀리지 않은 숙제로 남아 있다. 독일 작가 및 출판사들의 저작권 침해 논란에 대해 알레프 알파는 아직 구체적인 보상 금액을 제시하지 못했으며, 현실적인 갈등은 계속되고 있다.

그럼에도 Kolibri가 학습 데이터의 구축 과정을 그대로 재현할 수 있는 수준까지 문서화해 낸 것은 큰 진전이다. 이는 업계가 오랜 기간 묵인해 온 모호한 회색지대를 투명한 탁자 위로 끌어올린 격이다. 원시 데이터가 담긴 하드디스크를 넘겨주는 것만이 오픈소스의 유일한 잣대가 될 수는 없다.

제조 레시피와 품질 분류기 증류 파이프라인을 남김없이 입증할 수 있다면, 기술 주권이라는 핵심 카드는 개발자 자신의 손에 확고히 쥐어지게 된다.

참고 링크:

  • 독일 통일의 날 Aleph Alpha의 Kolibri 발표
  • HN 토론 (open-weight와 open-data에 대하여)