El sector tecnológico no deja de hablar de código abierto, pero muy pocos distinguen con claridad entre publicar los pesos de un modelo y liberar sus datos de entrenamiento.
El 3 de octubre de 2026, coincidiendo con el Día de la Unidad Alemana, la empresa europea de IA Aleph Alpha presentó Kolibri, un coloso de 78.000 millones de parámetros. La compañía liberó los pesos del modelo, pero no entregó ni un solo kilobyte de los datos brutos de entrenamiento.
Nada más publicarse el modelo, los foros de desarrolladores estallaron en un intenso debate sobre el paradero de los datos. Mientras un sector sostenía que sin datos no se puede hablar de apertura, los pragmáticos señalaban que la industria lleva tiempo asumiendo como estándar la entrega exclusiva de los pesos.
El concepto desvirtuado del código abierto: entregar el producto sin los ingredientes
Regalar un plato cocinado a los usuarios y entregar la receta familiar junto con la lista de proveedores son dos cosas completamente distintas. Los gigantes tecnológicos llevan años escudándose en la etiqueta general de «código abierto» para maquillar su monopolio sobre los conjuntos de datos esenciales.
Kolibri ha optado por una vía intermedia. Aleph Alpha publicó en Hugging Face su arquitectura Mixture-of-Experts (MoE), que cuenta con 3.000 millones de parámetros activos, bajo licencia Apache 2.0. Sin embargo, en lugar de compartir el corpus bruto, presentó una exhaustiva guía de construcción que permite reproducir el proceso desde cero.
Los propios ingenieros de preentrenamiento participaron en los foros comunitarios respondiendo al detalle sobre la limpieza de datos. Entregar un disco duro físico no es más que una formalidad superficial; la auténtica transparencia reside en demostrar el control absoluto sobre toda la cadena de destilación de datos.
Figura: Logotipo y marca denominativa del colibrí blanco sobre fondo degradado verde. Fuente: Aleph Alpha
Rechazo a la traducción artificial: recuperar el control con un 21 % de lengua materna
Para alimentar a este gran modelo se procesaron 20 billones de tokens. En el corpus principal de preentrenamiento, los datos nativos en alemán representaron el 21,3 %, mientras que el texto traducido se redujo a tan solo un 6 %.
Esta proporción responde a una lógica defensiva muy clara. Si se recurre masivamente a textos traducidos, el modelo acaba impregnado de los sesgos culturales del mundo anglosajón. Aleph Alpha detalló con precisión sus métodos de desduplicación exacta, desduplicación difusa, desduplicación de subcadenas y filtrado heurístico.
Durante la ampliación de datos de 7,5 a 20 billones de tokens, el proceso de destilación de los clasificadores de calidad también quedó minuciosamente documentado. Solo quien es capaz de detallar su receta de depuración tiene legitimidad para reivindicar una soberanía tecnológica real.
La potencia de cómputo no compra el rigor: enseñar a la máquina a decir «no lo sé»
En las evaluaciones científicas, Kolibri obtuvo una puntuación de 96,0 en la competición matemática AIME 2026, igualando el rendimiento de modelos rivales con cuatro veces más parámetros activos.
Aleph Alpha entrenó el modelo utilizando el protocolo Merlin-Arthur, diseñado expresamente para enseñar a la máquina a reconocer su propia ignorancia. Ante preguntas fuera de contexto o sin respuesta deducible, el modelo responde con franqueza «no lo sé», negándose a inventar falsedades con aparente seguridad.
Evitar las alucinaciones exige que el modelo sea plenamente consciente de los límites de su conocimiento, una disciplina de ingeniería que no se puede comprar simplemente acumulando tarjetas gráficas.
Figura: Detalles de la ficha del modelo Kolibri-1 en Hugging Face. Fuente: Hugging Face / Aleph Alpha
Sustituir los ingredientes brutos por la receta
Las compensaciones por derechos de autor siguen siendo una cuenta pendiente. Frente a las disputas con autores y editores alemanes, la compañía no ha hecho públicas indemnizaciones concretas, por lo que las incógnitas legales continúan en el aire.
A pesar de ello, el hecho de que Kolibri haya documentado la creación de sus datos hasta el punto de hacerla reproducible marca un antes y un después. Pone sobre la mesa las zonas grises aceptadas por la industria durante años: entregar un disco duro ya no es el único criterio para medir la apertura.
Cuando un laboratorio es capaz de transparentar por completo su receta, sus filtros heurísticos y su destilación de clasificadores, la carta de la soberanía tecnológica queda en sus propias manos.
Enlaces de referencia:
- Aleph Alpha presenta Kolibri en el Día de la Unidad Alemana
- Debate en HN (sobre open-weight y open-data)