Xiaomi lanza el modelo de código abierto más potente: 6 días de entrenamiento por 850.000 dólares

Xiaomi lanza el modelo de código abierto más potente: 6 días de entrenamiento por 850.000 dólares

Modelos de Lenguaje GrandesCódigo AbiertoAprendizaje por Refuerzo

Fuentes:HN + web research

El 22 de septiembre de 2026, Xiaomi presentó su modelo de código abierto más reciente, alcanzando 46,32 puntos en el Artificial Analysis Intelligence Index v4.3. Más impactante aún que la puntuación fue la factura colocada en la portada del informe técnico: completar todo el proceso de aprendizaje por refuerzo costó unos 850.000 dólares para la versión Flash y aproximadamente 2,62 millones de dólares para la versión Pro.

El factor decisivo en la carrera de la inteligencia artificial está pasando de la cantidad de GPU acumuladas a la capacidad de verificación abierta de los métodos de entrenamiento. Mientras los laboratorios propietarios acostumbran a proyectar disuasión mediante gastos descomunales de cómputo, Xiaomi desmanteló esa asimetría informativa transmitiendo en vivo todo su proceso de aprendizaje por refuerzo durante seis días.

Una factura transparente para el modelo abierto más potente

MiMo-V2.6-Pro superó a Kimi K3 y a Qwen3.8 Max con un índice de inteligencia de 46,32, convirtiéndose en el modelo de código abierto más potente en la actualidad. En cuanto a las tarifas de su API, Xiaomi mantuvo los mismos precios que en la generación V2.5 previa. El coste de entrada de Flash es de apenas 0,14 dólares por millón de tokens, cayendo a tan solo 0,0028 dólares cuando se aprovecha la caché de contexto.

Gráfico de barras del Artificial Analysis Intelligence Index Figura: Gráfico de barras del Artificial Analysis Intelligence Index, con MiMo-V2.6-Pro liderando con 46,32 puntos. Fuente: Página oficial de Xiaomi

La estructura de costes de los modelos de vanguardia ha experimentado una transformación radical. Capacidades que antes exigían cientos de millones de dólares en ajustes ahora se reducen a cifras de un solo dígito en millones. Los modelos de código abierto ya no necesitan cargar con las primas infladas de los gigantes propietarios.

En las sesiones de entrenamiento, Xiaomi configuró actualizaciones de 1.568 muestras por paso, con soporte para contextos de hasta un millón de tokens. Esta arquitectura de alto rendimiento permitió que el sistema procesara entre 3,5 y 3,7 mil millones de tokens por paso manteniendo una elevada eficiencia operativa.

Gráfico de dispersión entre índice de inteligencia y coste por tarea Figura: Gráfico de dispersión entre índice de inteligencia y coste por tarea, con Pro sobre la frontera de Pareto. Fuente: Artificial Analysis / Página oficial de Xiaomi

Cuando se calibra con precisión la proporción entre datos y potencia de cálculo, la rentabilidad de la inteligencia producida aumenta de forma exponencial. La versión Pro se situó directamente en la frontera de Pareto gracias a una planificación rigurosa de los recursos, en lugar de recurrir a la acumulación indiscriminada de máquinas.

El entrenamiento en vivo derriba la caja negra propietaria

La comunidad técnica está cansada de la estrategia de los gigantes propietarios, que publican notas de prensa rimbombantes sin aportar un solo detalle técnico. Xiaomi no solo liberó el informe técnico y el entorno de entrenamiento, sino que también abrió el código fuente del aprendizaje por refuerzo. En menos de seis días, Flash y Pro completaron 30 pasos de RL cada uno, acumulando cerca de 750.000 trayectorias generadas.

Transmitir en directo todo el proceso equivale a poner todas las cartas bocarriba sobre la mesa. Cualquier persona puede contrastar la validez de este método de entrenamiento y replicar las mejoras de rendimiento correspondientes. Los sistemas propietarios que se escudan tras muros de pago y recurren a conjuntos de datos ocultos para liderar tablas de clasificación están perdiendo la confianza de los desarrolladores.

Para evitar el habitual reward hacking (manipulación de recompensas) en el aprendizaje por refuerzo, el equipo diseñó un esquema defensivo en cuatro capas: diseño de funciones de recompensa, evaluación adversarial, detección de anomalías y verificación cruzada mediante evaluadores independientes. Asimismo, a medida que la escala de entrenamiento aumentaba, se congelaron de forma proactiva los pesos del enrutador (router) para contener posibles desvíos.

La precisión en la ingeniería práctica cuenta mucho más que el derroche indiscriminado de recursos de cálculo. Solo cuando las reglas quedan grabadas en los verificadores de base, el modelo consigue converger en la dirección correcta durante tareas complejas y de largo recorrido.

Una curva de aprendizaje que rompe la maldición del estancamiento

El exigente benchmark de ingeniería de software DeepSWE v1.1 es una auténtica prueba de fuego para medir las capacidades reales de un modelo. En esta prueba, la versión Flash ascendió de 48,8 a 65,68 puntos, mientras que la versión Pro subió de 58,4 a 72,57. Durante todo el ciclo de aprendizaje por refuerzo no se registró ninguna fase visible de estancamiento (plateau), manteniendo una curva de rendimiento en constante ascenso.

A modo de comparación, competidores propietarios contemporáneos alcanzaron marcas similares: Claude Opus 5 obtuvo 74,0 puntos y GPT 6 Astra anotó 74,0. La versión Pro, con una fracción insignificante del coste, rozó el techo operativo de la élite de la industria en tareas de desarrollo prolongadas y de gran dificultad.

La tasa media de éxito en las tareas de entrenamiento aumentó en términos relativos un 25 % en Flash y un 12 % en Pro. Siempre que los mecanismos de incentivos estén claramente articulados, la capacidad de exploración de los modelos en entornos complejos dista mucho de haber alcanzado su límite.

Las capacidades del modelo escapan de la pantalla al mundo físico

El horizonte funcional de MiMo-V2.6 va mucho más allá de la generación de código y el diálogo textual. En las demostraciones oficiales, el sistema abarcó desde la recreación de escenas 3D y el modelado en Blender hasta el control en bucle cerrado de brazos robóticos. Además, el modelo participó en la generación de interfaces web interactivas, la composición de piezas musicales en MIDI y colaboró en investigaciones científicas de frontera diseñando estructuras metal-orgánicas (MOF) orientadas a la adsorción de contaminantes PFAS.

Demostración multimodal generada por MiMo-V2.6 Figura: Demostración multimodal generada por MiMo-V2.6. Fuente: Página oficial de Xiaomi

El destino natural de la inteligencia multimodal se encuentra en el mundo físico. Cuando un modelo base comprende las variables espaciales y las propiedades de los materiales, puede controlar de forma directa brazos robóticos, software tridimensional e instrumental de síntesis, en lugar de limitarse a ofrecer sugerencias desde una ventana de chat.

La transparencia radical reescribe las reglas del juego

Las conversaciones en Hacker News captaron con exactitud la esencia de este lanzamiento. El reconocimiento de la comunidad se centró de manera rotunda en la transparencia: el informe técnico expuso sin reservas ni adornos publicitarios incluso aquellos benchmarks donde el rendimiento fue discreto. Los únicos puntos de discrepancia giraron en torno a las condiciones de uso de los datos en la plataforma de alojamiento y las preferencias estéticas de las plantillas frontend de demostración.

Los desarrolladores votan con sus actos a favor de las rutas técnicas en las que pueden confiar. En un sector saturado de retórica corporativa, reconocer con sinceridad las propias debilidades construye el vínculo de confianza más duradero.

Los días en que las empresas propietarias contenían a sus rivales mediante muros de capital tocan a su fin. Xiaomi ha convertido el aprendizaje por refuerzo de vanguardia en una clase abierta accesible para todos. Una factura de 850.000 dólares ha bastado para forjar un modelo abierto capaz de medirse de tú a tú con la cúspide tecnológica, con cada paso matemático expuesto al escrutinio público. Esa capacidad de someterse a la verificación de terceros se ha revelado como un arma competitiva mucho más afilada que cualquier reserva masiva de tarjetas gráficas.

Referencias:

  • Discusión en Hacker News (item?id=49792730)
  • Informe de evaluación de Artificial Analysis Intelligence Index
  • Informe técnico oficial de MiMo-V2.6