DeepSeek lidera la prueba de IA más difícil por solo 5 dólares al día

DeepSeek lidera la prueba de IA más difícil por solo 5 dólares al día

IADeepSeekPruebas de Inferencia

Fuentes:HN + web research · HN

Apenas transcurrida una semana de agosto de 2026, una tarjeta de resultados de IA ha sacudido a la comunidad de desarrolladores. DeepSeek V4 Flash, un modelo ligero de pesos abiertos desarrollado en China, ha alcanzado 365 puntos en el ARC Prize —ampliamente considerado el examen de razonamiento para IA más difícil del sector—, conquistando el primer puesto en la clasificación de eficiencia. Mientras que los modelos insignia estadounidenses cuestan unos 2,00 dólares por problema, DeepSeek los resuelve por tan solo 4 centavos.

Tras hacerse públicos los resultados, la noticia acumuló en Hacker News 382 votos positivos y 233 comentarios en solo cinco horas. Uno de los comentarios más votados lo resumía sin rodeos: “Los laboratorios de IA de EE. UU. tienen un gran problema”.

ARC Prize Official Scorecard for DeepSeek V4 Flash 0731 Figura: Tarjeta de resultados verificada publicada por la organización de ARC Prize para DeepSeek V4 Flash 0731. Fuente: arcprize.org

¿Qué evalúa realmente esta prueba?

Para comprender su trascendencia, conviene aclarar qué es el ARC Prize y por qué la industria lo llama la “Selectividad de la IA”. El planteamiento de los ejercicios es engañosamente sencillo: acertijos visuales formados por cuadrículas de colores. A partir de tres ejemplos de transformación, el modelo debe deducir la regla subyacente y dibujar el cuarto patrón. Cualquier adulto humano puede resolverlos con facilidad, obteniendo una media de 85 puntos sobre 100.

Sin embargo, la IA ha estado estancada en este tipo de problemas durante años. En 2024, incluso los modelos más potentes de EE. UU. apenas alcanzaban los 30 o 40 puntos. No hay un temario que memorizar: los patrones cambian constantemente y haber visto ejercicios parecidos durante el entrenamiento no sirve de mucho. El creador del examen apostó por una premisa clara: una IA que solo memoriza respuestas no superará esta prueba; solo aquella que sepa “pensar” de verdad lo logrará.

Score Gap Between Humans and AI on Abstract Reasoning Tests Figura: Brecha de puntuación entre humanos e IA mostrada en la web oficial de ARC Prize. Fuente: arcprize.org

En esta ocasión, DeepSeek se enfrentó a la versión actualizada ARC-AGI-2, aún más exigente. Obtuvo 61,4 puntos sobre 100. Aunque no es la puntuación absoluta más alta, al analizarla junto al coste, la dimensión del logro cambia por completo.

Dos clasificaciones, dos juegos diferentes

El ARC Prize mantiene en realidad dos tablas de clasificación: una basada en la precisión bruta y otra en la rentabilidad económica, denominada oficialmente clasificación de eficiencia (Efficiency Leaderboard). La web oficial lo explica con claridad: la verdadera inteligencia no consiste solo en resolver problemas difíciles, sino en hacerlo consumiendo el mínimo de recursos.

Al comparar ambas tablas, el contraste resulta evidente. Claude Opus 5, el modelo insignia de Anthropic (EE. UU.), obtiene 90,4 puntos en el conjunto actualizado, pero cuesta 2,06 dólares por ejercicio. DeepSeek alcanza 61,4 puntos a solo 4 centavos por ejercicio, una diferencia de coste de unas 50 veces. La situación para GPT-5.6 Luna, el modelo tope de gama de OpenAI, es aún más incómoda: 59.6 puntos (por debajo de DeepSeek) a un coste cuatro veces mayor.

Leaderboard Scatter Plot on the ARC Prize Homepage Figura: Gráfico de dispersión de la clasificación en la portada de ARC Prize. El eje horizontal muestra el coste por problema y el vertical la puntuación. Cuanto más a la izquierda y arriba, más rentable. Fuente: arcprize.org

Esto es lo que significa “liderar con 365 puntos”: en la clasificación de eficiencia, DeepSeek V4 Flash 0731 ha dejado atrás a todos sus competidores estadounidenses. En puntuación bruta, los gigantes de EE. UU. siguen a la cabeza; pero “el más potente” y “el más rentable” pertenecen ahora a dos empresas distintas.

Aunque las firmas estadounidenses dominan la tabla de precisión, el cambio de líder en la clasificación de eficiencia envía un mensaje mucho más potente al mundo empresarial. Las empresas pagan la IA en función del volumen de llamadas a la API, no por su posición en un ranking teórico.

El secreto del bajo coste: Pensar más tiempo durante la inferencia

¿De dónde procede semejante ahorro? Para entenderlo hay que conocer una regla fundamental del examen: se permite al modelo “pensar más tiempo” antes de responder. El sistema puede realizar deducciones iterativas y hacer borradores, lo que en el sector se conoce como “cómputo en tiempo de inferencia” (Inference-time compute). No hace falta ser un genio antes del examen; basta con dedicar tiempo a hacer borradores durante la prueba para obtener grandes resultados. Sin embargo, hacer borradores consume energía: quien reduzca el coste del “papel de borrador”, gana la partida.

DeepSeek ha llevado al límite esta estrategia de “modelo pequeño + inferencia intensiva”. V4 Flash cuenta con 284.000 millones de parámetros en total, pero solo activa 13.000 millones por cada token procesado, como un gran ejército que solo despliega comandos especializados cuando es necesario. Además, al ser un modelo de código abierto con pesos públicos, cualquiera puede descargarlo e instalarlo en sus propios servidores, eliminando intermediarios. El precio oficial de la API es de 0,14 dólares por millón de tokens de entrada y 0,28 dólares por millón de tokens de salida: entre uno y dos órdenes de magnitud más barato que los modelos estrella estadounidenses.

El valor del código abierto va mucho más allá del ahorro económico. Las empresas pueden alojar el modelo en su propia infraestructura, garantizando la privacidad de los datos, sin límites de uso y adaptándolo a su negocio. Para los gigantes propietarios de EE. UU., que cobran por cada petición, esto supone una amenaza directa a su modelo de negocio; la guerra de precios es solo la punta del iceberg.

Detrás de los 5 dólares al día se esconde un hito: por primera vez, los desarrolladores independientes pueden permitirse una “capacidad de razonamiento de primer nivel”. En el pasado, esta potencia de cálculo se cobraba por uso y era tan cara que solo se reservaba para tareas críticas; ahora puede ejecutarse las 24 horas en segundo plano supervisándolo todo.

Pruebas reales por 5 dólares al día

La comunidad de desarrolladores ya está aprovechando este cambio. El desarrollador LaurensBER compartió en Hacker News que, manteniendo de 5 a 6 sesiones de trabajo simultáneas con 12 hilos concurrentes, le resultaba imposible gastar 5 dólares al día incluso exprimido al máximo. Su suscripción mensual a Claude de 200 dólares ha quedado en desuso; aunque Claude sigue siendo más potente, la fricción de “calcular el consumo antes de consultar” hace que nadie quiera volver atrás.

Lo que realmente entusiasma a los ingenieros son los nuevos flujos de trabajo que permite un coste tan reducido: si las pruebas automatizadas fallan, la IA las corrige sola; si la cobertura de código es insuficiente, se generan tests automáticos en cada commit; los registros de servidor, las auditorías de seguridad y cada excepción se analizan al detalle. Tareas que antes “valían la pena pero eran demasiado caras para la IA” se han convertido en rutinas diarias.

Cada caso de uso por separado puede parecer modesto, pero multiplicado por cada desarrollador, equipo y día, transforma por completo la curva de costes. Cuando la inteligencia es lo bastante barata como para poder malgastarla, la asequibilidad se convierte en una ventaja competitiva.

Grandes problemas para los laboratorios de IA de EE. UU.

Este es el verdadero motivo de inquietud en Silicon Valley. Uno de los comentarios con más votos en HN señalaba: “Los laboratorios de IA de EE. UU. tienen un gran problema”. A menos que se recurra a decretos de seguridad nacional para bloquear los modelos chinos, ningún cliente internacional querrá seguir pagando un sobreprecio por modelos propietarios cuando existen alternativas de código abierto que hacen el mismo trabajo por unos centavos, permitiendo además el autoalojamiento y el ajuste fino.

Otros usuarios hicieron cuentas muy pragmáticas: tareas como la monitorización de logs, auditorías y control de calidad de datos resultan prohibitivas en modelos insignia, pero son ideales para modelos económicos. La demanda siempre estuvo ahí; simplemente nadie podía pagarla hasta ahora.

Por supuesto, las opiniones que defienden la necesidad de los modelos gigantes también tienen sólidos argumentos. Otro comentarista destacaba que, si bien las tareas sencillas están al alcance de cualquier modelo, la verdadera diferencia aparece en proyectos complejos que requieren más de 24 horas de ejecución continua, donde los errores de los modelos pequeños se acumulan. El futuro apunta más bien a una arquitectura híbrida: “modelos grandes actuando como comandantes y modelos económicos ejecutando como soldados”.

A juzgar por las tendencias actuales, la competición está pasando de “quién es el más fuerte” a “quién es el más rentable”. Al igual que los teléfonos móviles pasaron de ser artículos de lujo a productos cotidianos, el rendimiento bruto ya no es el recurso más escaso.

El análisis anterior se basa en la documentación oficial de ARC Prize y en debates públicos de la comunidad. El autor no ha participado en el desarrollo de estos proyectos; las interpretaciones son subjetivas y se agradece cualquier comentario o corrección.

Enlaces de referencia

  • ARC Prize: Página de resultados de DeepSeek V4 Flash 0731
  • ARC Prize: Tabla de clasificación (Leaderboard)
  • Debate en HN (item?id=49214008)
  • Documentación oficial de la API de DeepSeek
  • Artificial Analysis: Precios y evaluación de DeepSeek V4 Flash
  • vLLM Recipes: Descripción del modelo DeepSeek V4 Flash