Open Source ohne Rohdaten: Aleph Alpha legt das 78-Milliarden-Rezept von Kolibri offen

Open Source ohne Rohdaten: Aleph Alpha legt das 78-Milliarden-Rezept von Kolibri offen

Künstliche IntelligenzGroße SprachmodelleOpen-Source-Ökosystem

Quellen:Aleph Alpha 技术报告 + HN 讨论

Die gesamte Tech-Welt spricht von Open Source, doch die wenigsten unterscheiden präzise zwischen der Freigabe von Modellgewichten und der Offenlegung von Trainingsdaten.

Am Tag der Deutschen Einheit, dem 3. Oktober 2026, stellte das Heidelberger KI-Unternehmen Aleph Alpha sein neues Schwergewicht vor: Kolibri, ein Modell mit 78 Milliarden Parametern. Die Modellgewichte wurden unter einer Open-Source-Lizenz bereitgestellt – von den ursprünglichen Trainingsdaten rückte das Unternehmen jedoch kein einziges Kilobyte heraus.

Kaum war das Modell online, entbrannte in den Entwicklerforen eine hitzige Debatte über den Verbleib der Daten. Während die eine Seite darauf beharrte, dass ohne Quelldaten der Begriff »Open Source« verfehlt sei, verwiesen Pragmatiker darauf, dass die Branche die reine Bereitstellung von Modellgewichten längst stillschweigend als Standard akzeptiert hat.

Verschobene Open-Source-Begriffe: Das fertige Gericht ohne die Rohzutaten

Ein fertiges Gericht kostenlos zu servieren ist etwas grundlegend anderes, als das überlieferte Familienrezept samt Lieferantenliste preiszugeben. Branchengrößen nutzen den pauschalen Begriff »Open Source« seit Jahren, um ihr Monopol auf unverzichtbare Trainingskorpora zu verschleiern.

Aleph Alpha wählte mit Kolibri einen pragmatischen Mittelweg. Das Unternehmen veröffentlichte die Mixture-of-Experts-Architektur (MoE) mit 3 Milliarden aktiven Parametern auf Hugging Face unter der Apache-2.0-Lizenz. Statt jedoch den rohen Pre-Training-Datensatz hochzuladen, legte das Team eine detaillierte, reproduzierbare Konstruktionsanleitung vor.

Die an der Vorbereitung beteiligten Ingenieure schalteten sich direkt in Community-Foren ein, um selbst minutiöse Fragen zur Datenbereinigung zu beantworten. Die physische Übergabe einer Festplatte ist bloße Symbolik; echte Transparenz beweist sich darin, die gesamte Pipeline der Datendestillation lückenlos zu beherrschen.

Offizielles Kolibri-Visual Abb.: Weißes Kolibri-Logo und Wortmarke auf grünem Verlaufshintergrund. Quelle: Aleph Alpha

Schluss mit Übersetzungsdeutsch: 21 % Muttersprache für die Datenhoheit

Um das Modell zu füttern, durchlief das Training 20 Billionen Token. Im zentralen Pre-Training-Korpus stammten 21,3 % der Daten originär aus dem Deutschen; übersetzte Texte wurden auf gerade einmal 6 % komprimiert.

Hinter dieser Zusammensetzung steht eine klare strategische Absicht. Wer primär auf übersetzte Texte setzt, überträgt unweigerlich den kulturellen Fingerabdruck des englischsprachigen Raums auf das Modell. Aleph Alpha legte seine Verfahren zur exakten Deduplizierung, Fuzzy-Deduplizierung, Teilstring-Bereinigung und heuristischen Filterung offen.

Auch bei der Erweiterung von 7,5 auf 20 Billionen Token wurde die Destillation der Qualitätsklassifikatoren transparent dargelegt. Nur wer in der Lage ist, den Bereinigungsprozess lückenlos zu dokumentieren, kann glaubhaft von digitaler und technologischer Souveränität sprechen.

Rechenleistung ersetzt keine Urteilskraft: Der Maschine beibringen, »Ich weiß es nicht« zu sagen

In wissenschaftlichen Benchmarks erzielte Kolibri im Mathematikwettbewerb AIME 2026 ein Ergebnis von 96,0 Punkten. Damit zog das Modell mit Konkurrenten gleich, die über die vierfache Anzahl aktiver Parameter verfügen.

Beim Training setzte Aleph Alpha auf das Merlin-Arthur-Protokoll, um dem Modell gezielt das Eingeständnis von Unwissenheit anzutrainieren. Wird es mit Fragen konfrontiert, die den gegebenen Kontext übersteigen oder nicht ableitbar sind, antwortet es unmissverständlich mit »Ich weiß es nicht«, anstatt plausible Halluzinationen zu erfinden.

Halluzinationen zu unterbinden erfordert ein feines Gespür des Modells für die eigenen Wissensgrenzen – eine ingenieurtechnische Reife, die sich nicht einfach durch das Aufbieten unendlicher Grafikkarten erkaufen lässt.

Kolibri-1-Model-Card Abb.: Details der Kolibri-1-Model-Card auf Hugging Face. Quelle: Hugging Face / Aleph Alpha

Das Rezept als Ersatz für die Rohzutaten

Rechtliche Verpflichtungen bleiben unterdessen eine offene Rechnung. Angesichts von Urheberrechtsstreitigkeiten mit deutschen Autoren und Verlagen hat das Unternehmen bislang keine konkreten Entschädigungssummen genannt; die juristische Auseinandersetzung schwelt weiter.

Dennoch hat Kolibri einen Präzedenzfall geschaffen: Der Entstehungsprozess der Trainingsdaten wurde so präzise dokumentiert, dass er in der Praxis nachvollziehbar ist. Damit wurde die Grauzone, auf die sich die Branche lange geeinigt hatte, schonungslos ausgeleuchtet. Das Aushändigen von Speicherplatten ist nicht mehr der einzige Maßstab für Offenheit.

Wenn ein Entwicklerteam in der Lage ist, die gesamte Rezeptur samt Filterregeln und Klassifikatordestillation offenzulegen, behält es die Karte der technologischen Souveränität fest in den eigenen Händen.

Weiterführende Links:

  • Aleph Alpha veröffentlicht Kolibri zum Tag der Deutschen Einheit
  • HN-Diskussion (Open-Weight vs. Open-Data)