2주 만에 재현된 Jev: Cloudflare, 27B 오픈소스 의사결정 모델 Clef 공개

2주 만에 재현된 Jev: Cloudflare, 27B 오픈소스 의사결정 모델 Clef 공개

Cloudflare의사결정 모델ClefJevAI 에이전트오픈소스 모델

데이터 소스:Cloudflare Blog + The Register + HN · HN

새로운 AI 모델 카테고리의 수명 주기는 얼마나 짧아질 수 있을까요? 9월 중순 Typesafe AI가 소형 모델로 에이전트의 분기 액션마다 확률 점수를 매겨주는 Jev를 공개했습니다. 그리고 불과 2주 뒤, Cloudflare는 동일한 아키텍처를 적용해 자체 훈련한 두 개의 오픈 가중치 모델 Clef를 Apache 2.0 라이선스로 Hugging Face에 공개했습니다.

이는 단순한 모방 시연이 아닙니다. 완전히 판을 뒤흔드는 행보입니다. Jev가 아키텍처를 비공개로 유지하고 API 형태로만 제공되는 폐쇄형 모델인 반면, Clef는 가중치를 전면 개방했을 뿐 아니라 상대방의 핵심 벤치마크인 Jev Decision Index에서 1위를 차지했다고 발표했습니다. 하지만 이 숨 가쁜 ‘2주 복제’ 경쟁 속에서 벤치마크 점수보다 더 주목받은 것은 해커뉴스(HN) 댓글란의 날카로운 질문이었습니다. “도대체 여기에 어떤 새로운 기술이 있는가?”

의사결정 모델이란 무엇인가: ‘답변 생성’에서 ‘선택지 채점’으로

먼저 Jev가 불을 지핀 이 카테고리의 본질을 짚어볼 필요가 있습니다. 전통적인 LLM이 “이 고객 문의 티켓을 상위 부서로 이관해야 하는가?”와 같은 문제를 다룰 때는 자기회귀(autoregressive) 생성을 거칩니다. 토큰을 하나씩 순차적으로 출력하며 답변을 ‘작성’하는 방식이므로 속도가 느리고 결과 제어가 어렵습니다. 반면 의사결정 모델(Decision Model)의 발상은 생성 단계를 완전히 제거하는 것입니다. 상태(state)와 타입이 정의된 질문 스키마(schema)를 입력하면, 모델은 단 한 글자의 중간 텍스트도 생성하지 않고 각 후보 옵션에 대한 확률값을 즉시 출력합니다.

Cloudflare 공식 블로그에서 제시한 사례는 고객 문의 티켓 라우팅입니다. 고객 메시지가 인입되면 모델은 “긴급 여부: 예 87%”, “담당 팀: 기술 지원 91%“와 같은 정형화된 점수를 병렬로 반환합니다. 후속 애플리케이션 코드는 이 확률값을 그대로 받아 조건부 라우팅, 에스컬레이션, 상담원 배정을 즉시 처리합니다. 텍스트 생성 과정이 전혀 없기 때문에 에이전트의 핵심 의사결정 핫패스(hot path)에 최적화된 구조입니다.

의사결정 모델 입출력 흐름: 티켓 원문과 스키마 입력 기반 병렬 채점 그림: 의사결정 모델 작동 방식—티켓 원문과 스키마를 입력받아 모든 질의에 대해 병렬로 확률을 출력. 출처: Cloudflare Blog

핵심적인 변화는 제품 계층에서 일어났습니다. 과거 이러한 기능은 단순한 ‘분류기(Classifier)‘로 불렸습니다. BERT 시절만 해도 도메인 특화 분류 모델은 노트북에서 1시간이면 훈련할 수 있었고, 추론 시 VRAM 사용량도 1GB 미만이라 API 호출보다 훨씬 빨랐습니다. Jev의 진정한 기여는 이를 범용 제품으로 재정의했다는 점입니다. 새로운 분류 범주가 생겨도 모델을 재훈련할 필요 없이 JSON 스키마만 교체하면 즉시 다른 용도로 전환할 수 있으며, 개발 친화적인 API로 패키징했습니다. 제품-시장 적합성(PMF)은 Jev가 검증했고, 이제 모든 이들이 시장에 뛰어들고 있는 셈입니다.

Clef의 기술적 접근: Qwen 백본 + 프리필 전용 병렬 채점

Clef 제품군은 두 가지 모델로 출시되었습니다. Qwen3.8-27B를 기반으로 한 Clef(27B)와 Qwen3.5-9B를 기반으로 한 Clef-flash(9B)입니다. 백본 네트워크 가중치는 고정한 상태에서 rank-256 저순위 어댑터(LoRA)와 라우팅 헤드만을 훈련하는 방식을 채택했습니다.

추론 과정은 매우 직관적입니다. Qwen 백본에서 단 한 번의 프리필(prefill-only) 패스를 실행한 후, 유효한 모든 스키마 후보에 대해 병렬로 점수를 산출합니다. 의사결정 단계가 비자기회귀 방식이며 토큰을 순차 생성하지 않는다는 점이 범용 LLM보다 구조적으로 빠른 근본 원인입니다. 블로그에서는 이를 ‘2단계 어텐션 라우팅’이라 부릅니다. 각 후보 옵션이 프롬프트 관련 컨텍스트를 추출하고, 필드 간 크로스 어텐션을 거친 뒤 원본 입력을 다시 참조하여 스키마 제약 조건 아래 최종 채점을 진행합니다. 훈련 목표로는 레이블 스무딩 교차 엔트로피와 확률 보정(calibration)을 위한 Brier 손실을 사용했으며, 인접한 서수형 선택지에 부분 점수를 부여하는 강화학습 기법인 RLCD(Reinforcement Learning from Categorical Distributions)를 적용했습니다.

Cloudflare가 자체 공개한 비교 벤치마크 수치는 다음과 같습니다.

지표ClefClef-flashJev
의사결정 지수 (Decision Index)61.257.157.9
지연 시간 중앙값209ms38.8ms524ms
컨텍스트 윈도우64k64k32k (상태 + 단일 질문)
시각 입력지원 (이미지 및 영상)지원미지원
가중치 공개 여부Apache 2.0 오픈소스Apache 2.0 오픈소스비공개
Workers AI 요금100만 토큰당 $0.24100만 토큰당 $0.09100만 토큰당 $0.042

두 가지 수치가 특히 돋보입니다. Clef-flash는 38.8ms라는 지연 시간으로 57.1의 의사결정 지수를 달성했습니다. 비공개 모델인 Jev(57.9점, 524ms)와 대등한 성능을 내면서도 지연 시간은 약 13분의 1 수준에 불과합니다. 상위 모델인 Clef는 공식 벤치마크에서 1위를 차지하며 Jev보다 약 3점 높은 점수를 기록하면서 지연 시간은 절반으로 줄였습니다. Cloudflare 내부 테스트 결과에 따르면 Browser Run과 연동한 도메인 분류 작업에서 웹사이트 크롤링, 렌더링, 분류까지 2.2초 만에 마쳤습니다. 동일한 작업에 범용 LLM인 gpt-oss-120b는 4.7초가 걸렸으며 분류 결과도 두 개로 제한되었습니다.

의사결정 지수와 지연 시간의 산점도: 파레토 프론티어에 위치한 Clef 시리즈 그림: Jev Decision Index와 지연 시간 비교. 파레토 효율적 경계를 형성하는 Clef 제품군. 출처: Cloudflare Blog (자체 보고치)

공개된 성적표의 이면

하지만 몇 가지 냉정한 점검이 필요합니다. 위의 산점도에 표시된 모든 데이터의 출처는 ‘Cloudflare 자체 보고(self-reported)‘입니다. The Register의 취재에 따르면 이 수치들은 아직 Hugging Face의 공식 Decision Index 리더보드 검증 절차를 거치지 않았습니다. 공식 블로그 스스로도 ‘Jev(비공개)‘와 ‘오픈 모델(보드 검증 완료)’ 표식을 구분해 두었듯이, 자체 보고 수치와 독립 검증 결과는 엄연히 다릅니다.

가격 책정도 눈여겨볼 대목입니다. Clef의 100만 토큰당 $0.24라는 가격은 Jev($0.042)의 약 6배에 달하며, Clef-flash($0.09) 역시 2배 이상 높습니다. HN 댓글에서는 파레토 프론티어 그래프에 비용 축이 완전히 빠져 있다는 점이 지적되었습니다. 산점도상에서는 Clef가 압도적인 우위를 점한 것처럼 보이지만, 비용 축을 추가하면 프론티어의 곡선은 완전히 달라집니다. 성능 우위는 사실이지만 상당한 비용을 지불해야 하는 셈입니다.

로컬 배포의 장벽도 만만치 않습니다. Cloudflare 제품 관리자 Michelle Chen이 The Register에 밝힌 바에 따르면, 단일 동시성 및 64k 컨텍스트 기준 Clef는 85GB, Clef-flash는 41GB의 VRAM을 요구합니다. ‘오픈 가중치로 자체 호스팅 가능’하다는 점은 사실이지만 일반 소비자용 GPU로는 구동이 불가능합니다. HN에서는 좁은 도메인 작업이라면 노트북에서 1시간 동안 BERT 계열 모델을 직접 훈련시키는 것이 어떤 클라우드 API보다 낮은 지연 시간을 보여준다는 지적이 이어졌습니다. 범용 의사결정 모델의 진정한 존재 이유는 특화된 훈련 데이터가 없는 환경을 해결하는 데 있습니다.

마지막으로 훈련 데이터셋이 비공개라는 한계가 있습니다. 가중치는 Apache 2.0 라이선스로 풀렸지만, The Register는 원본 훈련 데이터가 공개되지 않았음을 확인했습니다. ‘오픈’의 진정성은 사용자가 중요하게 생각하는 대상이 가중치인지, 데이터인지에 따라 갈릴 수밖에 없습니다.

HN 논쟁: 혁신적인 신기술인가, 포장만 바꾼 분류기인가

478포인트를 기록한 HN 스레드에서 가장 뜨겁게 맞붙은 쟁점은 최다 추천을 받은 한 줄의 질문이었습니다. “어떻게 이렇게 많은 이들이 불과 며칠에서 몇 주 만에 의사결정 모델을 만들어내는가? 이 개념은 오래전부터 존재했던 것 아닌가?”

많은 엔지니어들은 기술적 실체를 냉철하게 짚었습니다. 트랜스포머는 본래 어휘 전체에 대한 확률 분포를 출력하도록 설계되었습니다. LLM의 구조화된 출력(structured output)과 제약 디코딩을 분류 작업에 응용하는 기법은 오픈소스 커뮤니티에서 이미 수년 동안 널리 활용되어 왔습니다. 모델에 단 한 토큰을 출력하게 한 뒤 logprobs를 정렬해 답을 구하는 방식은 작은 모델에서도 매우 잘 작동합니다. 한 개발자는 더 나아가 **“Jev의 혁신은 주로 인터페이스와 API 디자인에 있었으며, 기존 기술을 대다수 개발자가 직관적으로 이해할 수 있게 만든 데 있다. 그리고 API는 가장 모방하기 쉬운 대상이다”**라고 평가했습니다. Jev 출시 후 2주 만에 Hugging Face에 일련의 오픈소스 경쟁작(AutoJev, Jebadiah, Kev, 그리고 Clef)이 쏟아져 나온 속도 자체가 진입 장벽이 낮음을 증명합니다.

반론 역시 만만치 않습니다. 진정한 장벽은 바로 확률 보정(Calibration)에 있다는 시각입니다. “빠른 분류 모델을 만드는 것은 어렵지 않지만, 모델이 출력하는 확률값이 실제 현실 세계의 신뢰도와 정확히 일치하도록 만드는 것은 극히 어렵다”며, 현재로서는 Jev의 보정 품질이 가장 뛰어나다는 의견도 제시되었습니다. 데이터 엔지니어링 관점에서의 요약도 인상적입니다. 모델 아키텍처는 “재미있고 비교적 쉬운 부분”이며, **“진짜 어려운 것은 고품질 데이터 구축과 정밀한 평가 체계”**라는 지적입니다. 정제된 라벨링 데이터가 없다면 모델이 얼마나 정확하게 분류하는지 검증조차 할 수 없습니다.

두 시각은 결국 동전의 양면입니다. 기술 원리는 모방할 수 있지만, 확률을 진정으로 신뢰할 수 있게 만드는 것은 방대한 데이터 엔지니어링입니다. Cloudflare가 2주 만에 맞불을 놓을 수 있었던 진짜 배경은 지난 15년간 축적해 온 전 세계 네트워크 트래픽 데이터와 라벨링 인프라 덕분입니다. 이것이 주말 동안 급조된 복제 프로젝트들과 Cloudflare의 결정적인 차이점입니다.

함께 공개된 강화학습(RL) 플랫폼의 전략적 의도

블로그 후반부에는 Clef 모델 자체보다 훨씬 더 주목해야 할 발표가 숨어 있습니다. Cloudflare는 고객이 자체 데이터를 활용해 Clef를 특정 산업 도메인 전용 모델로 미세조정할 수 있는 ‘RL 미세조정 서비스’를 동시에 출시했습니다.

훈련 파이프라인은 기존 인프라 블록들을 매끄럽게 연결했습니다. AI Gateway가 프로덕션 트래픽을 수집해 데이터셋을 구성하고, Workers AI가 롤아웃을 생성하며, Containers 환경에서 보상 함수 샌드박스를 실행합니다. 신규 추가된 Trainer 컴포넌트가 가중치를 업데이트한 뒤 BYO Model 기능을 통해 전 세계 엣지로 재배포됩니다. Cloudflare 역시 신뢰 및 안전(Trust & Safety) 콘텐츠 검토, 지원 티켓 자동 분류, 봇 관리 솔루션의 크롤러 탐지 등 방대한 내부 라벨 데이터를 보유한 도메인 작업에 이 파이프라인을 직접 활용하고 있습니다.

RL 미세조정 플랫폼: 프로덕션 트래픽부터 모델 재배포까지의 파이프라인 그림: RL 미세조정 플랫폼 아키텍처. AI Gateway로 프로덕션 데이터를 캡처하고 훈련 루프를 거쳐 엣지로 재배포. 출처: Cloudflare Blog

이러한 포석의 의도는 명확합니다. 단순히 Clef의 추론 토큰을 판매하는 것만으로는 큰 수익을 내기 어렵습니다. 진정한 사업적 목표는 ‘기반 모델 → 강화학습 훈련 환경 → 글로벌 엣지 배포’로 이어지는 전체 라이프사이클을 자사 플랫폼에 묶어두는 데 있습니다. AI Gateway에 쌓이는 데이터는 고객의 것이지만, 훈련과 운영 파이프라인은 Cloudflare 플랫폼 안에 종속됩니다. 이는 Cloudflare가 추진하는 ‘에이전트 클라우드’ 전략과 완벽히 일치합니다. 의사결정 모델은 자율 에이전트의 핫패스에서 가장 빈번하게 호출되는 구성 요소이며, 이 병목을 선점하는 기업이 미래 에이전트 트래픽의 관문을 장악하게 됩니다.

맺음말

2주 만에 Jev를 재현해 낸 이번 사례는 ‘의사결정 모델’이라는 카테고리의 기술적 진입 장벽이 낮음을 증명했습니다. 기존 Qwen 모델을 기반으로 삼고, 자기회귀 텍스트 생성을 생략한 채 병렬 채점 방식을 취하는 구조는 탄탄한 인프라 역량을 가진 팀이라면 누구나 구현할 수 있습니다.

앞으로의 진정한 승부처는 다른 곳에 있습니다. 극한 상황에서도 모델의 확률 보정이 얼마나 정밀하게 유지되는지, 지속적인 강화학습 미세조정을 감당할 수 있는 데이터 파이프라인을 갖추었는지, 그리고 전 세계에 분산된 엣지 네트워크에서 38ms라는 지연 시간 약속을 현실적으로 지켜낼 수 있는지에 따라 판가름 날 것입니다.

엔지니어와 개발자에게 지금 가장 실용적인 접근법은 단순합니다. Clef의 API는 Jev와 완벽하게 호환되며 가중치도 오픈소스로 제공됩니다. 자체 검증 데이터를 가져와 10분만 벤치마크를 돌려보면, 자신의 서비스 환경에 어떤 선택지가 적합한지 객관적인 수치로 확인할 수 있을 것입니다.

참고 링크:

  • Cloudflare 블로그: Introducing Clef — our open-source decision models, and new RL fine-tuning platform
  • The Register: Cloudflare tries to outplay Jev with open-weight Clef models
  • Hacker News 토론: Clef — Open-weight decision models, and new RL fine-tuning platform
  • Hugging Face: Cloudflare/clef 모델 카드
  • Cloudflare 개발자 문서: Workers AI Clef 설명서