Wie kurz kann der Innovationszyklus einer neuen KI-Modellkategorie sein? Mitte September stellte Typesafe AI das Modell Jev vor und demonstrierte, wie ein kompaktes Modell Wahrscheinlichkeitswerte für die einzelnen Verzweigungsaktionen autonomer Agenten berechnen kann. Nur zwei Wochen später veröffentlichte Cloudflare zwei strukturell identische, selbst trainierte Modelle unter der Apache-2.0-Lizenz auf Hugging Face: Clef.
Das ist keine bloße Machbarkeitsstudie – es wirbelt die Spielregeln durcheinander. Während Jev proprietär bleibt, seine Architektur geheim hält und ausschließlich per API nutzbar ist, stellt Clef offene Gewichte bereit und beansprucht obendrein Platz eins im hauseigenen Jev Decision Index des Rivalen für sich. Doch in diesem Wettlauf um den „Zwei-Wochen-Nachbau“ ist die unbequeme Frage aus den Hacker-News-Kommentaren weitaus aufschlussreicher als jeder Benchmark: Was genau ist daran eigentlich neu?
Was sind Entscheidungsmodelle: Vom Generieren von Antworten zum Bewerten von Optionen
Um diese von Jev populär gemachte Kategorie zu verstehen, muss man sich ansehen, wie klassische LLMs Aufgaben wie „Soll dieses Support-Ticket eskaliert werden?“ lösen. Sie nutzen eine autoregressive Generierung: Ein Token nach dem anderen wird berechnet, um eine textuelle Antwort zu „formulieren“ – langsam, teuer und schwer deterministisch zu steuern. Entscheidungsmodelle (Decision Models) streichen diesen Generierungsschritt vollständig. Man übergibt einen Zustand (State) und ein typisiertes Fragenschema (Schema), woraufhin das Modell ohne ein einziges Zwischenwort an Text direkt eine Wahrscheinlichkeitsverteilung für alle vordefinierten Optionen ausgibt.
Der Cloudflare-Blog verdeutlicht dies am Beispiel des Ticket-Routings: Trifft eine Kundenanfrage ein, liefert das Modell parallel typisierte Scores wie „Dringend: Ja 87 %“ und „Zuständiges Team: Technik 91 %“. Nachgelagerte Anwendungslogik kann diese Wahrscheinlichkeiten direkt für Routing, Eskalation oder Übergabe an den Kundenservice nutzen. Da keine Textgenerierung stattfindet, eignet sich dieses Muster ideal für den zeitkritischen Entscheidungspfad autonomer Agenten.
Abbildung: Funktionsweise des Entscheidungsmodells – Ticket-Text und Schema als Eingabe, parallele Ausgabe von Wahrscheinlichkeiten für alle Fragen. Quelle: Cloudflare Blog
Der entscheidende Wandel vollzieht sich auf der Produktebene. Früher nannte man diese Funktion schlicht einen „Klassifikator“. Zu Zeiten von BERT ließ sich ein domänenspezifisches Modell auf einem Notebook in einer Stunde trainieren, benötigte in der Inferenz weniger als 1 GB VRAM und war schneller als jeder API-Aufruf. Jevs Leistung bestand darin, dieses Prinzip in ein universelles Produkt zu verpacken: Anstatt für jede neue Kategorie neu zu trainieren, tauscht man lediglich ein JSON-Schema aus und steuert alles über eine entwicklerfreundliche API. Jev hat den Product-Market-Fit bewiesen – und nun drängen alle in diesen Markt.
Die technische Architektur von Clef: Qwen-Basis mit Prefill-only-Scoring
Die Clef-Familie umfasst zwei Varianten: Clef (27B) und Clef-flash (9B), basierend auf Qwen3.8-27B bzw. Qwen3.5-9B. Beim Training bleibt das Backbone-Netzwerk eingefroren; trainiert werden lediglich ein Rank-256 Low-Rank Adapter (LoRA) und ein Routing-Head.
Bei der Inferenz führt das Qwen-Backbone einen einzigen Prefill-Durchlauf aus und führt anschließend ein paralleles Scoring über alle zulässigen Schema-Optionen durch. Da dieser Entscheidungsschritt nicht-autoregressiv arbeitet und keine Token schrittweise erzeugt werden müssen, ergibt sich ein prinzipbedingter Geschwindigkeitsvorteil gegenüber allgemeinen LLMs. Cloudflare bezeichnet dies als „Two-Phase Attention Routing“: Jede Option extrahiert prompt-relevanten Kontext, Felder führen Cross-Attention durch, bevor sie auf die ursprüngliche Eingabe zurückgreifen, und schließen mit einer schema-gebundenen Bewertung ab. Als Trainingsziel dient eine Kombination aus Label-smoothed Cross-Entropy und Brier-Loss zur Wahrscheinlichkeitskalibrierung, ergänzt durch RLCD (Reinforcement Learning from Categorical Distributions), um benachbarten ordinalen Auswahlmöglichkeiten Teilpunkte zuzuweisen.
Cloudflare veröffentlichte dazu folgende Vergleichswerte:
| Metrik | Clef | Clef-flash | Jev |
|---|---|---|---|
| Entscheidungsindex (Decision Index) | 61,2 | 57,1 | 57,9 |
| Mittlere Latenz (Median) | 209 ms | 38,8 ms | 524 ms |
| Kontextfenster | 64k | 64k | 32k (Status + Einzelfrage) |
| Visuelle Eingabe | Unterstützt (Bilder + Videos) | Unterstützt | Nicht unterstützt |
| Modellgewichte | Apache 2.0 Open Source | Apache 2.0 Open Source | Proprietär (Closed Source) |
| Workers AI Preise | $0,24 / 1M Token | $0,09 / 1M | $0,042 / 1M |
Zwei Zahlen stechen besonders hervor: Clef-flash erreicht mit einer Latenz von nur 38,8 ms einen Decision Index von 57,1 – praktisch gleichauf mit dem proprietären Jev (57,9 Punkte bei 524 ms), jedoch bei rund einem Dreizehntel der Latenz. Das Flaggschiffmodell Clef führt die Rangliste im offiziellen Benchmark an, übertrifft Jev um gut drei Punkte und halbiert gleichzeitig die Reaktionszeit. In internen Tests in Kombination mit Browser Run zur Domain-Klassifizierung meldete Cloudflare: Crawlen, Rendern und Klassifizieren einer Website dauerte 2,2 Sekunden, während das universelle Modell gpt-oss-120b dafür 4,7 Sekunden benötigte und lediglich zwei Kategorien ausgeben konnte.
Abbildung: Vergleich von Jev Decision Index und Latenz – die Clef-Reihe bildet die Pareto-Grenze. Quelle: Cloudflare Blog (selbst gemeldete Werte)
Hinter den Kulissen der Testergebnisse
Ein kritischer Blick auf diese Zahlen ist angebracht. Sämtliche Datenpunkte im obigen Streudiagramm tragen den Vermerk „Cloudflare (self-reported)“. Wie The Register recherchierte, haben diese Ergebnisse die offizielle Validierungs-Pipeline des Decision-Index-Boards auf Hugging Face noch nicht durchlaufen. Dass der Blog selbst zwischen „Jev (closed)“ und „Open models (board-validated)“ unterscheidet, verdeutlicht den Unterschied zwischen Selbstaussagen und unabhängiger Verifikation.
Auch die Preisgestaltung ist aufschlussreich. Mit $0,24 pro Million Token ist Clef fast sechsmal so teuer wie Jev ($0,042/M), und Clef-flash liegt mit $0,09/M mehr als doppelt so hoch. In den Hacker-News-Kommentaren wurde treffend bemerkt, dass im Pareto-Diagramm die Kostendimension vollständig fehlt. Fügt man den Preis zur Achse hinzu, verschiebt sich die Effizienzgrenze beträchtlich: Der Leistungsvorsprung ist real, aber er wird mit höheren Gebühren erkauft.
Die Hürden für ein lokales Hosting sind ebenfalls nicht zu unterschätzen. Cloudflare-Produktmanagerin Michelle Chen bestätigte gegenüber The Register, dass Clef 85 GB VRAM beansprucht und Clef-flash immer noch 41 GB – bezogen auf eine einzelne Anfrage und ein 64k-Kontextfenster. „Open-Source-Gewichte für lokale Bereitstellung“ klingt attraktiv, ist auf handelsüblichen Endkunden-GPUs jedoch schlicht unmöglich. Auf HN wurde darauf hingewiesen, dass man für eng umrissene Aufgaben mit einem kleinen BERT-Modell auf dem eigenen Laptop in einer Stunde ein Modell trainieren kann, dessen Latenz jede Cloud-API unterbietet. Universelle Entscheidungsmodelle spielen ihre Stärke vor allem dann aus, wenn keine spezifischen Trainingsdaten vorliegen.
Hinzu kommt, dass die Trainingsdatensätze proprietär bleiben. Die Gewichte stehen unter Apache 2.0, doch die Trainingsdaten wurden laut The Register nicht offengelegt. Wie viel „Open Source“ darin steckt, hängt davon ab, worauf man mehr Wert legt: Gewichte oder Daten.
Die HN-Debatte: Echte Innovation oder alter Wein in neuen Schläuchen?
Die lebhafteste Diskussion auf Hacker News (478 Punkte) entzündete sich an dem meistgewählten Kommentar: „Wie schaffen es so viele Leute, Entscheidungsmodelle innerhalb von Tagen oder Wochen zu bauen? Das Konzept gibt es doch schon ewig.“
Erfahrene Entwickler legten die technischen Grundlagen offen: Transformer geben von Natur aus Wahrscheinlichkeitsverteilungen über das Vokabular aus. Das Prinzip, strukturierte Ausgaben (structured outputs) und Logprobs für Klassifikationsaufgaben einzusetzen, wird in der Community seit Jahren genutzt – man fordert ein Token an, sortiert die Logprobs und erhält die Antwort. Mehrere Kommentatoren resümierten: Jevs eigentliche Leistung lag im Interface- und API-Design, das eine bestehende Technik für die Masse der Entwickler intuitiv nutzbar machte. Da APIs leicht zu kopieren sind, tauchten innerhalb von zwei Wochen nach Jevs Start zahlreiche Open-Source-Alternativen auf Hugging Face auf (AutoJev, Jebadiah, Kev und nun Clef).
Gleichwohl gibt es gewichtige Gegenargumente: Die eigentliche Hürde ist die Kalibrierung. Einen schnellen Klassifikator zu bauen ist keine Kunst; dafür zu sorgen, dass die ausgegebenen Wahrscheinlichkeiten verlässlich die Realität widerspiegeln, ist extrem anspruchsvoll – und Jev gilt hier weiterhin als Referenz. Aus datentechnischer Sicht gilt: Die Modellarchitektur ist „der unterhaltsame und einfache Teil“, die eigentliche Herausforderung liegt in hochwertigen Daten und rigoroser Evaluierung. Ohne saubere Annotationsdaten lässt sich die Treffsicherheit eines Klassifikators nicht einmal valide messen.
Beide Perspektiven ergänzen sich: Die Grundtechnik ist schnell adaptiert, doch verlässliche Wahrscheinlichkeiten erfordern exzellentes Data Engineering. Dass Cloudflare in zwei Wochen nachziehen konnte, liegt an 15 Jahren gesammelter Netzwerkverkehrsdaten und Labeling-Pipelines – das unterscheidet das Unternehmen von kurzfristigen Community-Nachbauten.
Die eigentliche Stoßrichtung: Cloudflares neue RL-Plattform
In der zweiten Hälfte des Blogbeitrags verbirgt sich eine Weichenstellung, die strategisch weit bedeutender ist als Clef selbst: Cloudflare stellte zeitgleich eine Fine-Tuning-Plattform für Reinforcement Learning vor, mit der Unternehmen Clef anhand eigener Daten auf spezifische Domänen anpassen können.
Der Trainings-Workflow verbindet bestehende Infrastrukturkomponenten: AI Gateway erfasst Produktivtraffic zur Datensatzerstellung, Workers AI generiert Rollouts, Containers führen Sandboxes für Belohnungsfunktionen aus, die neue Trainer-Komponente aktualisiert die Gewichte, und über BYO Model erfolgt das Re-Deployment auf die Edge-Knoten. Cloudflare nutzt dieses Verfahren bereits intern: für Trust & Safety-Moderation, Support-Routing und Bot-Erkennung – allesamt Domänen mit riesigen internen Label-Beständen.
Abbildung: Architektur der RL-Fine-Tuning-Pipeline – Erfassung von Produktivdaten via AI Gateway, Trainingszyklus und erneute Bereitstellung an der Edge. Quelle: Cloudflare Blog
Das geschäftliche Kalkül ist offensichtlich: Der reine Verkauf von Inferenz-Token bietet geringe Margen. Das eigentliche Geschäft besteht darin, die gesamte Kette – „Basismodell → RL-Trainingsumgebung → Edge-Deployment“ – an die Cloudflare-Plattform zu binden. Die im AI Gateway gesammelten Daten gehören dem Kunden, doch Training und Betrieb bleiben im Cloudflare-Ökosystem verankert. Dies passt nahtlos zur Strategie einer „Agent Cloud“: Entscheidungsmodelle liegen auf dem am häufigsten aufgerufenen Pfad autonomer Agenten. Wer diesen Engpass beherrscht, kontrolliert das Eingangstor zum künftigen Agenten-Traffic.
Fazit
Der Nachbau von Jev in nur zwei Wochen beweist, dass die Hürden im Bereich der Entscheidungsmodelle technisch überschaubar sind: Man nehme eine bewährte Qwen-Basis, verzichte auf autoregressive Textgenerierung und bewerte Optionen parallel.
Die künftige Differenzierung wird sich an anderer Stelle entscheiden: wessen Wahrscheinlichkeitskalibrierung in Grenzsituationen stabil bleibt, wessen Datenpipelines das kontinuierliche RL-Fine-Tuning effizient speisen und wessen Edge-Netzwerk das 38-ms-Versprechen auch unter realen globalen Bedingungen einlösen kann.
Für Entwickler ist das pragmatische Fazit eindeutig: Clefs API ist voll kompatibel zu Jev, die Gewichte sind offen verfügbar. Wer eigene Testdaten über beide Modelle laufen lässt, erkennt in zehn Minuten, welches System die Anforderungen des eigenen Projekts besser erfüllt.
Weiterführende Links:
- Cloudflare Blog: Introducing Clef — our open-source decision models, and new RL fine-tuning platform
- The Register: Cloudflare tries to outplay Jev with open-weight Clef models
- Hacker News Diskussion: Clef — Open-weight decision models, and new RL fine-tuning platform
- Hugging Face: Cloudflare/clef Model Card
- Cloudflare Entwicklerdokumentation: Workers AI Clef Documentation