Poids ouverts sans données brutes : la recette du modèle de 78B de Kolibri redéfinit l'open source

Poids ouverts sans données brutes : la recette du modèle de 78B de Kolibri redéfinit l'open source

Intelligence ArtificielleGrands Modèles de LangageÉcosystème Open Source

Sources:Aleph Alpha 技术报告 + HN 讨论

L’industrie technologique ne cesse de vanter l’open source, mais bien peu font la distinction entre la publication des poids d’un modèle et celle de ses données d’entraînement brutes.

Le 3 octobre 2026, à l’occasion du Jour de l’Unité allemande, l’entreprise européenne d’IA Aleph Alpha a dévoilé Kolibri, un colosse fort de 78 milliards de paramètres. L’entreprise a ouvert les poids de son modèle, sans toutefois livrer le moindre kilooctet de ses données d’entraînement d’origine.

Dès la mise en ligne du modèle, les discussions au sein de la communauté se sont cristallisées sur le devenir des données. Alors qu’une partie des développeurs affirmait qu’un modèle sans données brutes ne mérite pas le qualificatif d’ouvert, les pragmatiques rappelaient que l’écosystème s’accommode depuis longtemps de cette règle tacite consistant à ne fournir que les poids.

L’open source dénaturé : livrer le produit sans les ingrédients bruts

Offrir un plat cuisiné aux utilisateurs et leur transmettre la recette ancestrale accompagnée de la liste des fournisseurs relèvent de deux démarches totalement différentes. Les géants du secteur utilisent depuis des années l’étiquette fourre-tout de l’open source pour masquer leur monopole sur les corpus d’entraînement essentiels.

Kolibri a choisi une voie médiane. Aleph Alpha a mis à disposition sur Hugging Face son architecture Mixture-of-Experts (MoE), dotée de 3 milliards de paramètres actifs, sous licence Apache 2.0. Mais face au jeu de données d’origine, le laboratoire a conservé ses données brutes pour publier en échange un manuel de construction exhaustif et reproductible.

Les ingénieurs ayant participé au pré-entraînement sont même intervenus sur les forums communautaires pour détailler chaque étape du nettoyage des données. Transférer un disque dur physique n’est qu’une façade ; la véritable transparence consiste à prouver que l’on maîtrise l’intégralité de la chaîne de distillation des données.

Visuel officiel de Kolibri Figure : Logo et marque en forme de colibri blanc sur fond vert dégradé. Source : Aleph Alpha

Refus de la traduction automatique : reprendre le contrôle avec 21 % de langue maternelle

Pour nourrir ce grand modèle, l’entraînement a absorbé 20 000 milliards de tokens. Au sein du corpus de pré-entraînement central, les données natives en allemand ont représenté 21,3 %, tandis que les textes traduits ont été restreints à seulement 6 %.

Cette répartition découle d’une stratégie défensive assumée. Recourir massivement à des traductions revient à imprégner le modèle des empreintes culturelles du monde anglo-saxon. Aleph Alpha a détaillé avec précision ses méthodes de déduplication exacte, de déduplication floue, de déduplication de sous-chaînes et de filtrage heuristique.

De 7,5 à 20 trillions de tokens, le processus de distillation des classificateurs de qualité a également été consigné en toute clarté. Seule une équipe capable de publier sa recette de nettoyage est en mesure de revendiquer une souveraineté technologique à l’abri de toute dépendance extérieure.

La puissance de calcul ne remplace pas la rigueur : apprendre à la machine à dire « je ne sais pas »

Lors des évaluations scientifiques, Kolibri a obtenu un score de 96,0 à la compétition mathématique AIME 2026, égalant ainsi des concurrents disposant de quatre fois plus de paramètres actifs.

Aleph Alpha a entraîné son modèle selon le protocole Merlin-Arthur, conçu pour enseigner à la machine à reconnaître ses propres limites. Face à des questions hors contexte ou sans réponse déductible, le modèle déclare sans détour « je ne sais pas », refusant d’élaborer des affabulations péremptoires.

Éviter les hallucinations nécessite une perception aiguë de ses propres frontières de connaissances — une exigence d’ingénierie que l’empilement massif de cartes graphiques ne suffit pas à acheter.

Fiche de modèle Kolibri-1 Figure : Détails de la fiche de modèle Kolibri-1 sur Hugging Face. Source : Hugging Face / Aleph Alpha

Remplacer les ingrédients bruts par la recette

La question des droits d’auteur reste un compte à régler. Face aux contestations d’auteurs et d’éditeurs germanophones, Aleph Alpha n’a pas encore divulgué de montants d’indemnisation précis, laissant subsister des incertitudes juridiques.

Néanmoins, en documentant la fabrication de ses données au point de la rendre reproductible, Kolibri met les zones d’ombre de l’industrie sur la table. Fournir un disque dur n’est plus l’unique critère pour juger de l’ouverture d’un projet.

Dès lors qu’une organisation expose l’intégralité de sa recette, ses filtres heuristiques et sa distillation de classificateurs, la carte maîtresse de la souveraineté technologique reste entre ses mains.

Liens de référence :

  • Aleph Alpha lance Kolibri lors du Jour de l’Unité allemande
  • Débat sur Hacker News (open-weight vs open-data)