En agosto de 2026, un modelo de IA chino alcanzó el primer puesto de la tabla de eficiencia en el desafío ARC-AGI, considerado el benchmark más exigente de razonamiento abstracto en inteligencia artificial. El modelo, denominado DeepSeek V4 Flash 0731, es una versión ligera y veloz del modelo base de código abierto DeepSeek V4. Según los datos oficiales publicados por la organización ARC Prize, el modelo alcanzó un 61.4% de precisión en ARC-AGI-2 con un costo de 4 centavos de dólar por tarea, y un 89.0% en ARC-AGI-1 con apenas 2 centavos por tarea.
El mismo día, la noticia escaló en Hacker News hasta alcanzar 754 puntos y 451 comentarios, convirtiéndose en la publicación técnica más comentada de la jornada. Un día antes registraba 365 puntos, duplicando ampliamente su relevancia en solo 24 horas.
Lo más fascinante de este hito es el contraste: en una industria acostumbrada a asociar precios bajos con menor calidad, un modelo chino de bajo costo se ha posicionado a la cabeza de la clasificación de eficiencia en la prueba de razonamiento más rigurosa. Pruebas realizadas por miembros de la comunidad mostraron que, ejecutando de 5 a 6 sesiones en paralelo con 12 flujos concurrentes durante todo un día de trabajo intensivo, el costo total no superó los 5 dólares.
Qué evalúa la “prueba de IA más difícil”
Las tareas de ARC-AGI destacan por su aparente sencillez: acertijos visuales con cuadrículas de colores. La IA debe deducir la regla de transformación subyacente a partir de unos pocos ejemplos y generar la respuesta correcta. Estas pruebas resultan sumamente intuitivas para los humanos, pero representan un obstáculo enorme para los modelos de IA al evaluar la capacidad de razonamiento abstracto, donde memorizar datos de entrenamiento no sirve de nada. La propia organización ARC Prize señala que el benchmark fue diseñado específicamente para poner a prueba los puntos débiles de la IA.
Durante los últimos dos años, los avances de los modelos punteros en este examen han sido lentos, con costos de cómputo que superaban los varios dólares por problema. En 2025, ARC Prize modificó su reglamento: a partir de entonces, todas las puntuaciones deben incluir de forma obligatoria una métrica de «eficiencia». El puntaje mide la capacidad, mientras que el costo refleja lo costosa que resulta dicha capacidad.
Figura: Gráfico oficial de eficiencia de ARC Prize (título “Escalar no es suficiente”). A partir de ARC-AGI-2, todas las puntuaciones deben incluir métricas de eficiencia. Fuente: arcprize.org
A tenor de la información disponible, DeepSeek V4 Flash 0731 se sitúa como uno de los modelos más destacados de la tabla al combinar alta precisión con un costo extraordinariamente reducido. El equipo de ARC Prize destacó que el modelo «establece un nuevo estándar en la frontera entre costo y rendimiento».
Figura: Ejemplo de tarea pública en ARC-AGI-2 (razonamiento abstracto). Sencillo para humanos, notoriamente difícil para la IA. Fuente: arcprize.org
Criterio de ingeniería: A 2 centavos por pregunta, el costo de las pruebas deja de ser un factor restrictivo. Mientras que antes los laboratorios debían medir cada evaluación, ahora se pueden ejecutar miles de pruebas sin preocupación. Este cambio es más relevante que la puntuación en sí.
Cómo se logró reducir tanto los costos
Podría pensarse que un costo bajo es sinónimo de recortes de calidad. Sin embargo, los detalles arquitectónicos públicos revelan que DeepSeek V4 Flash logra este nivel de eficiencia mediante tres capas de diseño estructural.
La primera capa es una arquitectura dispersa de Mezcla de Expertos (MoE). Aunque el modelo cuenta con unos 284.000 millones de parámetros en total, solo activa alrededor de 13.000 millones para procesar cada tarea. Es análogo a una biblioteca de 300.000 millones de volúmenes donde el lector solo consulta los pocos libros que necesita en cada ocasión, ahorrando un consumo de energía considerable. Activar únicamente una pequeña fracción de expertos por consulta es actualmente una de las estrategias principales en la industria para reducir costos de inferencia.
La segunda capa es la optimización de almacenamiento en caché de prompts. Gran parte del cómputo puede reutilizarse cuando la IA responde a consultas, logrando una tasa de aciertos de caché del 99% en la API oficial. La firma de evaluación independiente Artificial Analysis calculó que el costo promedio por tarea en DeepSeek V4 Flash ronda los 3 centavos, lo que representa menos del uno por ciento del costo de varios modelos propietarios líderes en Estados Unidos.
La tercera capa procede de la competencia en el ecosistema de código abierto. Dado que los pesos de DeepSeek V4 Flash son abiertos, cualquiera puede descargarlo y alojarlo por su cuenta, permitiendo que plataformas de terceros y la comunidad fijen precios competitivos. Las tarifas quedan marcadas por el mercado y no por las decisiones unilaterales de una sola empresa.
Figura: Imagen de portada creada por un blog de terceros para destacar las puntuaciones y los costos por tarea. Fuente: explainx.ai
Criterio de ingeniería: La combinación de arquitectura dispersa, optimización de caché y competencia en el ecosistema abierto genera una caída de costos de carácter estructural. Mientras se mantenga este diseño, no hay razón para prever un aumento de precios.
Las suscripciones costosas de IA quedan en una posición incómoda
La experiencia real de uso en la comunidad refleja con claridad esta transformación. El usuario de Hacker News LaurensBER comentó que, incluso manteniendo de 5 a 6 sesiones abiertas con 12 flujos en paralelo durante todo un día de trabajo intenso, no logró gastar 5 dólares. Aunque cuenta con una suscripción a Claude Max, apenas la utiliza ya que prefería evitar las constantes limitaciones de cuota. El usuario señaló que, si bien los modelos costosos son más potentes, la experiencia de uso condicionada por límites se percibe como un retroceso.
Otro usuario, abixb, fue aún más categórico: «Si esto es cierto, los laboratorios de IA en EE. UU. están en serios problemas. A menos que se prohíban los modelos chinos por orden de seguridad nacional, nadie va a pagar una prima por los modelos de vanguardia».
Aunque contundente, esta postura ataca directamente un supuesto habitual de la industria: los modelos de vanguardia deben ser caros. Tradicionalmente, suscribirse a servicios de IA significaba comprar cuotas mensuales sujetas a colas de espera ante un uso intensivo. En cambio, DeepSeek V4 Flash funciona con una tarifa por uso tan reducida que permite delegar tareas masivas sin pensarlo dos veces: corregir pruebas que fallan automáticamente, revisar registros anómalos o generar cobertura de código pendiente.
Criterio de ingeniería: Cuando la IA es tan económica que su uso desechable no pesa en el bolsillo, el comportamiento del usuario pasa del “ahorro estricto” al “uso ilimitado”. Como señalaron en HN, $10 permiten obtener el equivalente a $140 en cuota, lo que resulta difícil de agotar. Este cambio de paradigma importa mucho más que una posición en la tabla.
Qué significa este cambio para los usuarios
Para los usuarios que no programan, los beneficios de esta carrera por la eficiencia son inmediatos: los servicios de IA serán más baratos en general. A medida que los modelos abiertos abaratan los costos, los proveedores comerciales se ven obligados a ajustar sus precios para no perder usuarios. El incremento de cuotas gratuitas y la bajada de tarifas mensuales observados en diversas herramientas de IA durante el último año guardan relación directa con esta competencia.
De cara al futuro, la IA llegará a escenarios donde antes no resultaba rentable su implantación. Las pequeñas empresas sin presupuesto para equipos de soporte podrán implementar asistentes de atención al cliente; las familias podrán resolver dudas educativas de sus hijos sin temor a la factura de tokens; y tareas habituales como estructurar facturas, redactar borradores o pulir currículums podrán delegarse inicialmente a la IA antes de una revisión humana.
No obstante, conviene matizar: barato no significa infalible. Encabezar la tabla de eficiencia certifica una excelente relación costo-beneficio, pero DeepSeek V4 Flash aún presenta diferencias con los mejores modelos cerrados en tareas complejas de múltiples pasos. En los debates de HN se ha advertido que en flujos de trabajo extensos, los pequeños errores acumulados en modelos menores pueden transformarse en fallos relevantes. La recomendación práctica pasa por emplear modelos económicos como motor principal y reservar los modelos de gama alta como respaldo.
Reflexión final
Los datos públicos indican que este colapso de costos está lejos de concluir. El ritmo de avance de los modelos de código abierto está obligando a toda la industria a replantearse sus estructuras de costos.
Este resultado debe interpretarse como una señal clara: la competición en la inteligencia artificial se ha expandido desde «quién es más inteligente» hacia «quién es más accesible». Mientras esperamos los próximos saltos en capacidad intelectual, la era de la IA ultraeconómica ya es una realidad. Por menos de 5 dólares al día —menos que un café en muchas ciudades— este modelo ha conquistado la cima de la eficiencia en la prueba de IA más difícil del mundo.
Enlaces de referencia:
- ARC Prize: Resultados de la evaluación de DeepSeek V4 Flash 0731
- Discusión en HN (item?id=49214008)