Alibaba supera a GPT-5.6 por primera vez: Qwen3.8 Max lidera el Agentic Index en tareas autónomas

IAModelos de Gran TamañoQwenIA China

Fuentes:HN + web research · HN

El 7 de agosto de 2026, una evaluación independiente situó al nuevo modelo de Alibaba en el primer puesto a nivel mundial. Qwen3.8 Max se posicionó en la cima de la clasificación general del «Agentic Index» de Artificial Analysis, siendo la primera vez que un modelo chino supera a sus competidores estadounidenses en la capacidad de ejecutar tareas de forma autónoma. Detrás de él se sitúan GPT-5.6 Sol de OpenAI y Claude Fable 5 de Anthropic.

La noticia se propagó rápidamente en Hacker News. Pocas horas después de su publicación, el hilo acumulaba 391 puntos y 251 comentarios. En una comunidad donde se reúnen algunos de los ingenieros más exigentes del mundo, el comentario más votado resumía el sentir general: «China ha alcanzado el nivel, esa es la clave de esta noticia».

Un nuevo punto de referencia con un examen diferente

Para entender esta clasificación, conviene saber quién está detrás. Artificial Analysis es una entidad de evaluación independiente que no vende modelos; simplemente pone a prueba diferentes modelos en un mismo entorno estandarizado. En años anteriores, las pruebas se centraban en conocimientos generales y razonamiento matemático («exámenes tradicionales»): preguntas y respuestas para medir la precisión.

En junio de este año, la metodología cambió por completo. El nuevo índice evalúa las capacidades «agénticas»: se proporciona al modelo un entorno informático real para que busque información en la web, escriba código, maneje software y ejecute tareas de múltiples pasos de principio a fin. La evaluación abarca 44 profesiones en 9 industrias, y un sistema de corrección automatizado verifica si el resultado final es correcto. La puntuación global pondera dos evaluaciones centrales: tareas de trabajo reales y operaciones de herramientas de múltiples pasos en escenarios bancarios.

Captura de pantalla de la clasificación del Agentic Index de Artificial Analysis Figura: Clasificación del Agentic Index de Artificial Analysis (captura del 7 de agosto de 2026). Fuente: artificialanalysis.ai

Qwen3.8 Max obtuvo 58,4 puntos, frente a los 57,8 puntos de GPT-5.6 Sol y los 56,6 puntos de Claude Fable 5. Sin embargo, el liderazgo no es definitivo: la diferencia con Opus 5, otro modelo insignia de Anthropic, es inferior a 1 punto, y la primera posición ha cambiado varias veces en los últimos días. Desde una perspectiva de ingeniería, la capacidad de trabajo entre los modelos principales es sumamente pareja y ninguno puede considerarse el líder indiscutible.

Más allá del primer puesto individual, la clasificación muestra una presencia destacada de modelos chinos. Entre los cinco primeros puestos hay dos modelos chinos, y entre los trece primeros hay cuatro: además de Qwen de Alibaba, figuran Kimi de Moonshot AI, DeepSeek y GLM de Zhipu AI. Hace apenas dos o tres años, la parte superior de estas listas estaba ocupada exclusivamente por empresas estadounidenses.

La competición ha cambiado de paradigma: ya no se mide quién responde mejor a las preguntas, sino quién es capaz de completar el trabajo real. Responder bien a un examen no garantiza saber trabajar; completar tareas demuestra que el conocimiento se aplica eficazmente.

¿Cuál es la diferencia entre chatear y ejecutar tareas?

La diferencia radica en tres aspectos clave:

Primero, planificación en múltiples pasos (Multi-step planning). Chatear consiste en una respuesta puntual; trabajar implica una secuencia de acciones coordinadas. Es comparable a delegar una tarea a un becario: comparar precios de vuelos en tres plataformas, seleccionar la opción más barata, enviar el itinerario por correo electrónico y reservar el hotel. En cada paso hay que mantener presente el objetivo principal. Los modelos de chat convencionales suelen perder el hilo a mitad del proceso.

Segundo, llamada a herramientas (Tool calling). Del mismo modo que un empleado busca información, realiza llamadas o abre programas, un agente de IA abre el navegador, ejecuta comandos en la terminal y manipula hojas de cálculo. Qwen3.8 Max obtuvo 86,1 puntos en la prueba de «Uso del ordenador», superando los 83,2 puntos de GPT-5.6 Sol. Su rendimiento se mantuvo constante en distintos entornos de asistentes de programación, lo que demuestra que la capacidad reside en el propio modelo y no en una aplicación específica.

Comparativa de rendimiento de Qwen3.8-Max en diferentes entornos de asistentes de programación Figura: Comparativa de rendimiento de Qwen3.8-Max en diversos entornos de trabajo. Fuente: blog oficial de qwen.ai

Tercero, autoevaluación y corrección sobre la marcha. Tras completar cada paso, el modelo revisa su trabajo: si la interfaz se descuadra la corrige, y si la dirección no es la adecuada ajusta el rumbo. Este bucle de retroalimentación en tiempo real es la gran novedad de esta generación de modelos y la razón por la que puede trabajar durante horas de forma continua sin desviarse.

¿Hasta qué punto es capaz en escenarios reales?

Alibaba ha publicado varios conjuntos de datos de pruebas reales, entre los que destacan tres ejemplos:

Simulación de gestión de comercio electrónico durante un año: El modelo gestionó simultáneamente varias tiendas online con un capital inicial de 100.000 dólares. Tuvo que negociar con casi 600 proveedores (incluidos 152 operadores fraudulentos), hacer frente a interrupciones de suministro por tifones y gestionar picos de demanda durante grandes promociones. Tras un año, el saldo final alcanzó los 416.000 dólares (multiplicando por 4,16 el capital inicial), un 38% más alto que el segundo clasificado y un 152% superior al modelo insignia de la generación anterior.

Diseño de chips: Ante un circuito inicial de un chip de cifrado con 8.298 puertas lógicas, el modelo ejecutó de forma autónoma 500 iteraciones de «modificación de código - simulación - depuración». Finalmente redujo la estructura a 678 puertas, disminuyendo la superficie del chip en un 81%.

Competición de algoritmos: En una competición donde participaban 526 equipos humanos, el modelo compitió de forma independiente durante 24 horas y superó al 87% de los equipos humanos. Interpretó las reglas, ajustó los modelos y tomó la decisión de enviar 45 entregas de forma totalmente autónoma.

Gráfico oficial de comparativa de rendimiento de Qwen3.8-Max Figura: Gráfico oficial de comparativa de rendimiento de Qwen3.8-Max (frente a GPT-5.6 Sol, Claude Opus 4.8, etc.). Fuente: blog oficial de qwen.ai

Estas cifras proceden de publicaciones de la propia Alibaba y aún no han sido verificadas en su totalidad por terceros. Como es habitual en ingeniería, la tendencia es creíble, aunque el margen exacto requiere mayor validación.

Eficaz, pero prolijo y costoso

Alcanzar la cima tiene un coste computacional elevado. Los datos de la entidad de evaluación indican que Qwen3.8 Max requirió un promedio de 64 rondas de interacción para completar tareas que la generación anterior resolvía en 14 rondas; el volumen de tokens de entrada aumentó unas 15 veces y la salida alcanzó los 145 millones de tokens. Trabajar con mayor rigurosidad se traduce en un comportamiento más detallado y un mayor consumo de computación.

En cuanto a la velocidad de generación, se sitúa en una posición intermedia: 67 tokens por segundo frente a los 213 tokens por segundo de Gemini 3.6 Flash. Completar una ronda completa de evaluación de agentes supuso una factura computacional de 1.741 dólares.

Existe aún un trecho entre la capacidad de trabajo y la eficiencia económica. No obstante, en cuanto a precios de API, Alibaba cobra 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, cifras sensiblemente inferiores a los modelos estadounidenses equivalentes. Además, Alibaba anunció que la próxima semana liberará los pesos del modelo, siendo la primera vez que se abre el código de un modelo insignia de categoría Max. La apertura del código permitirá a cualquier empresa desplegarlo localmente, lo que reducirá aún más los costes operativos.

De qué se debate en los comentarios

Dado el estrecho margen entre los primeros puestos, los debates en Hacker News se han intensificado. Un sector sostiene que la concentración de puntuaciones es evidencia de «destilación» (distillation), sugiriendo que los modelos de menor tamaño aprenden de las salidas de los modelos más grandes. Otros replican que entrenar con las respuestas de otros modelos no es ilegal y refleja el propio proceso de aprendizaje humano.

Asimismo, algunos ingenieros han compartido su experiencia práctica: tras gastar 15 dólares en DeepSeek para completar proyectos complejos, se plantearon la utilidad de mantener su suscripción mensual de 200 dólares a OpenAI. Aunque las vivencias individuales no constituyen prueba suficiente, el aumento de este tipo de opiniones está cambiando las expectativas del mercado.

Otra vertiente del debate gira alrededor de disputas legales. Algunos comentarios señalaron acuerdos previos de grandes tecnológicas estadounidenses sin admisión de culpa, dejando abiertas dudas sobre propiedad intelectual. Otros consideran que la convergencia de puntuaciones indica que la capacidad de los grandes modelos de lenguaje se aproxima a un estancamiento temporal. Que exista o no ese estancamiento dependerá de la complejidad de las próximas revisiones de los bancos de pruebas.

Cómo cambiará el uso de la IA para los usuarios particulares

Lo más relevante de esta competición para el usuario común no reside en los números de la clasificación.

En los últimos dos años, la IA ofrecía respuestas: redactar un texto o responder a una duda. Ahora comienza a entregar resultados: se le entrega un paquete de facturas y las organiza en una hoja de cálculo enviada por correo; se le indica un viaje de negocios a una ciudad y busca vuelos de forma autónoma, compara precios y realiza las reservas. La integración de estas capacidades agénticas en las aplicaciones móviles es solo cuestión de tiempo.

Las clasificaciones seguirán oscilando. Sin embargo, la dirección ya está trazada: la próxima era de la inteligencia artificial pertenecerá a los modelos capaces de completar el trabajo.

Enlaces de referencia:

  • Artificial Analysis: Clasificación Agentic Index
  • Discusión en HN (item?id=49200652)
  • Blog oficial de Alibaba Cloud / Qwen
  • Cobertura de MarkTechPost
  • Informe de evaluación de VentureBeat