En septiembre de 2026, el desarrollador independiente Mithil Vakde logró una puntuación del 44 % en la evaluación pública de ARC-AGI-1 tras ejecutar su entrenamiento durante solo 1,5 horas en una única GPU RTX 5090. El coste total del proceso de entrenamiento fue de tan solo 67 centavos de dólar. Con una sola tarjeta gráfica de consumo y una factura de menos de un dólar, su solución igualó directamente las puntuaciones de solucionadores especializados de primer nivel como TRM y HRM, dejando atrás a numerosos modelos de lenguaje generales impulsados por presupuestos millonarios.
Propuesto por François Chollet en 2019, ARC-AGI se ha considerado durante mucho tiempo la prueba de referencia para medir el razonamiento abstracto humano, contando con una recompensa de 1 millón de dólares ofrecida por la comunidad. Un benchmark de referencia con 6 años de historia fue superado por una sola persona utilizando una arquitectura Transformer fundamental.
67 centavos para alcanzar un 44 %
La puntuación del 44 % alcanzada por Mithil Vakde pone de manifiesto la increíble eficiencia de la comunidad de código abierto en modelos de escala reducida. Cuando se publicó la versión anterior de este proyecto, ya desencadenó debates públicos entre investigadores de primer nivel como Lucas Beyer de Google DeepMind, Jeremy Howard de fast.ai y Rohan Anil. Un modelo desarrollado individualmente en un entorno con restricciones de hardware rindió al mismo nivel que los equipos estrella de las grandes tecnológicas.
La estrategia de los grandes modelos basada en quemar dinero para acumular datos muestra un claro agotamiento en el razonamiento con pocos ejemplos (few-shot). Los solucionadores especializados de élite requieren arquitecturas complejas e inversiones astronómicas en cómputo, mientras que esta alternativa de código abierto reprodujo la misma capacidad por menos de un dólar. La acumulación masiva de cómputo no puede ocultar la ineficiencia algorítmica en tareas específicas; un ajuste fino de la arquitectura resulta mucho más incisivo que la ampliación a la fuerza bruta.
Imagen: Comparativa de rendimiento en la evaluación pública de ARC-1. Fuente: Blog de Mithil Vakde
Eliminar componentes clave reduce la puntuación a la mitad
Esta solución no abandona el marco de trabajo Transformer, sino que incorpora de forma precisa componentes arquitectónicos modernos como SwiGlu, RMSNorm, codificación de posición 3D RoPE y el optimizador NorMuon. En los experimentos de ablación publicados por el autor, al retirar 3D RoPE o el per-task embedding, la puntuación del modelo cae drásticamente del 44 % a aproximadamente el 24 %.
| Configuración | Puntuación |
|---|---|
| Configuración completa (3D RoPE + per-task embedding) | 44 % |
| Sin 3D RoPE | aprox. 24 % |
| Sin per-task embedding | aprox. 24 % |
| Solo configuración básica | 18 % |
| Solo entrenamiento de tokens de salida (respecto a la versión previa) | 40 % → 44 % |
La esencia de las tareas de ARC reside en procesar cuadrículas bidimensionales y canales de color, y 3D RoPE mapea a la perfección esta estructura multidimensional. Los mecanismos de codificación de posición espacial y embebido diseñados a medida para tareas específicas compensan con precisión las carencias del modelo en la extracción de características locales.
Estos datos de ablación demuestran una idea fundamental: el modelado preciso de la estructura de la tarea vale mucho más que acumular parámetros. El entrenamiento por fuerza bruta en la totalidad de los parámetros, habitual en los LLM generales, alcanza su techo en tareas de razonamiento altamente abstracto. El ajuste fino de la arquitectura alineado con la lógica de negocio es la verdadera palanca para lograr puntuaciones elevadas.
Imagen: Estudio de ablación: caída drástica sin 3D RoPE ni per-task embedding. Fuente: Blog de Mithil Vakde
Los costes de investigación bloquean el espacio de exploración
Mithil Vakde plantea una rotunda conclusión: los grandes modelos de lenguaje no poseen ninguna ventaja inherente en eficiencia muestral. El hecho de que nadie haya recorrido con éxito este camino en ARC durante los últimos 6 años no se debe a barreras técnicas insuperables, sino a que los prohibitivos costes experimentales han bloqueado el espacio de exploración de los investigadores en las grandes empresas. Con costes de entrenamiento de miles o decenas de miles de dólares por prueba, los equipos de los grandes laboratorios no pueden realizar decenas o cientos de experimentos de ablación, lo que les impide descubrir qué detalles arquitectónicos son verdaderamente efectivos para ARC.
Un coste de ensayo y error de apenas unos centavos permite a un desarrollador independiente probar combinaciones de componentes con alta frecuencia. Cada ajuste de parámetros, por insignificante que parezca, se puede verificar en 1,5 horas. Las capacidades generales acumuladas por las grandes tecnológicas a cambio de millones de dólares en entrenamiento resultan torpes frente a tareas puntuales que requieren pruebas intensivas y precisión quirúrgica.
Imagen: Comparativa de mejores puntuaciones en otras ablaciones. Fuente: Blog de Mithil Vakde
La eficiencia muestral toma el control
Cuando la unión de tareas resueltas en múltiples ejecuciones alcanza el 55 %, el autor estima que un Transformer por sí solo podría alcanzar el umbral del 65 % en ARC. Esta solución totalmente de código abierto, que incluye los pesos del modelo y el código de entrenamiento, obtuvo 546 puntos y 146 comentarios en Hacker News, encendiendo el entusiasmo de la comunidad por el potencial de los modelos pequeños. Además de su excelente rendimiento en ARC-AGI-1, el modelo también alcanzó un 7 % en el test ARC-2, notablemente más complejo.
Replicar los resultados de equipos de investigación de élite por 67 centavos deja en evidencia las inversiones de millones de dólares de las grandes corporaciones. La hegemonía del cómputo no se traduce directamente en altas puntuaciones; la eficiencia muestral demostrada por la comunidad de código abierto a costes mínimos es la variable central que dominará la segunda mitad de la carrera de la IA.
Enlaces de referencia:
- Blog de Mithil Vakde
- Discusión en HN
- Discusión en Lobsters