Qwen3.8-27B supera a modelos comerciales de un billón de parámetros en programación y se lanza como código abierto gratuito

Qwen3.8-27B supera a modelos comerciales de un billón de parámetros en programación y se lanza como código abierto gratuito

IACódigo Abierto

Fuentes:HN + web research

El 14 de agosto por la noche, el equipo Qwen de Alibaba lanzó un modelo de tamaño reducido pero alto rendimiento: Qwen3.8-27B, con 27.000 millones de parámetros y disponible de forma gratuita bajo la licencia Apache-2.0. En el conjunto de pruebas oficial, su puntuación en la tarea de programación DeepSWE 1.1 pasó de 13,3 en la generación anterior a 42.2, lo que representa un incremento superior al triple y supera a varios modelos comerciales cerrados con billones de parámetros. En la comunidad global de desarrolladores Hacker News, la noticia acumuló 819 puntos y 539 comentarios en un solo día, convirtiéndose en uno de los temas técnicos más debatidos.

No se trata de un lanzamiento rutinario más. Desafía de manera directa la intuición dominante en el ámbito de la IA durante los últimos dos años: que a mayor número de parámetros, mayor inteligencia del modelo.

27.000 millones: Un peso ligero en el mundo de la IA

Para comprender el concepto de “parámetros”: imagínese un gran modelo de lenguaje como una máquina gigantesca con perillas de control. Cada parámetro es una perilla ajustable; cuantas más perillas tenga, mayor será la capacidad de la máquina. La competencia entre empresas de IA se ha centrado en acumular perillas: desde cientos de miles de millones hasta el nivel de los billones. Los modelos cerrados más avanzados han alcanzado 2 billones o incluso 2,4 billones de parámetros, casi 90 veces el tamaño de Qwen3.8-27B.

Sin embargo, más perillas implican un consumo sustancialmente mayor de GPUs y energía durante el entrenamiento, además de exigir costosa capacidad de cómputo en la nube durante la inferencia. Esta carrera armamentista basada en la escala terminó reflejándose en las facturas de los usuarios finales a través de suscripciones mensuales y cobros por tokens. Para la mayoría de desarrolladores, el acceso a la IA se limitaba a una única vía: alquilar un cerebro gigante en la nube.

Qwen3.8-27B adopta una estrategia distinta: perfeccionar los parámetros en lugar de acumularlos sin medida.

La tarjeta de resultados: Un incremento de 3 veces y victoria frente a gigantes

En la tabla comparativa oficial, el modelo de 27B se enfrentó a la generación previa Qwen3.6-27B, al modelo superior Qwen3.7-Plus, al homólogo Muse Glimmer-30B y al gigante cerrado Opus 4.6 Max. Los resultados obtenidos fueron notables:

  • Tarea de programación DeepSWE 1.1: 42.2 (frente a 13,3 de la generación anterior, más del triple, y casi el triple respecto a 14,2 de Qwen3.7-Plus);
  • Benchmark de ingeniería de software SWE-bench Pro: 61.7, superando los 53,4 de Opus 4.6 Max;
  • Benchmark de automatización de oficina CoWorkBench: 70.7, por encima de los 68,2 de Opus;
  • Tarea de operación en terminal Terminal Bench 2.1: 73.0, acercándose a los 78,2 de Opus con un margen inferior a 5 puntos.

Tabla oficial de benchmark de tareas de texto de Qwen3.8-27B Figura: Comparativa oficial de rendimiento de Qwen3.8-27B en tareas de programación y oficina frente a generaciones anteriores y modelos cerrados. Fuente: Publicación oficial de Qwen (reproducida por IT Home).

Para mantener una perspectiva precisa: no se trata de una victoria absoluta en todos los campos. En la generación de código a nivel de repositorio, Opus conserva su liderazgo, y los gigantes de billones de parámetros siguen siendo superiores en diversos escenarios complejos. No obstante, la tendencia ha cambiado: cuando un modelo de 27.000 millones de parámetros compite de igual a igual con rivales decenas de veces más grandes, el resultado deja de ser unidireccional, algo impensable hace dos años.

¿Cómo ha logrado un modelo más pequeño recortar la distancia?

Este es el aspecto técnico más relevante del lanzamiento. A partir de la ficha oficial del modelo y las discusiones en la comunidad, este avance se sostiene en tres decisiones clave de ingeniería:

En primer lugar, un mecanismo de atención híbrido. Los LLMs utilizan la “atención” para determinar qué contexto priorizar, siendo este el principal cuello de botella de cómputo en las GPUs. Qwen3.8-27B reemplaza aproximadamente tres cuartas partes de su estructura de 64 capas por una “atención lineal” de menor consumo (denominada Gated DeltaNet), reservando la atención de alta precisión tradicional solo para la cuarta parte restante. Metafóricamente: es como hojear rápidamente la mayoría de los capítulos de un libro y leer detenidamente solo los apartados clave. El ahorro en capacidad de cómputo permite al modelo asimilar una amplia base de conocimiento con mayor eficiencia.

En segundo lugar, predicción multitoken (MTP). Los modelos tradicionales predicen un solo token sucesivo a la vez. Qwen3.8-27B se entrenó con Predicción Multitoken (MTP) para anticipar varios tokens de forma simultánea. Al igual que un jugador de ajedrez que anticipa varias jugadas, esto logra una generación más fluida y acelerada.

En tercer lugar, control sobre el nivel de razonamiento. Aunque el modelo razona antes de responder por defecto, incluye el nuevo control reasoning_effort para ajustar la profundidad del pensamiento según la dificultad de la tarea: respuestas rápidas para preguntas sencillas y razonamiento profundo paso a paso para tareas complejas. En pruebas de la comunidad, ante la solicitud de dibujar un “pelícano en bicicleta”, el modelo ejecutó más de 20.000 pasos de razonamiento durante 21 minutos para entregar un gráfico SVG sorprendente; en cambio, responde en segundos ante consultas simples. Transferir la gestión del tiempo de razonamiento al usuario optimiza de forma práctica los recursos.

Estas decisiones de diseño reflejan una premisa clara: invertir en la calidad de los datos de entrenamiento y las técnicas arquitectónicas ofrece un rendimiento superior a incrementar parámetros sin criterio. Aunque la validación continua por parte de terceros verificará este enfoque, la información pública demuestra que constituye el pilar de la filosofía de modelos compactos de Qwen.

Memoria de nivel de novela y visión multimodal nativa

Además de la programación, el modelo incorpora dos capacidades de alto valor práctico para el uso cotidiano.

Primero, una memoria de contexto ultra extensa: soporte nativo para 260.000 tokens, equivalente a procesar una novela completa de 200.000 palabras de una sola vez manteniendo la coherencia contextual (con extensibilidad técnica de hasta 1 millón de tokens). El procesamiento de documentos extensos y vídeos de larga duración, antes reservado a grandes modelos en la nube, es ahora accesible en un modelo compacto.

Segundo, comprensión nativa de imágenes y vídeo. Las imágenes y los vídeos son tratados como elementos de primer orden: desde diagramas técnicos y documentos escaneados hasta vídeos de varias horas. Los benchmarks multimodales oficiales ubican a Qwen3.8-27B por delante de diversos modelos de mayor escala.

Tabla oficial de benchmark multimodal de Qwen3.8-27B Figura: Rendimiento multimodal de Qwen3.8-27B en tareas de comprensión de imagen y vídeo. Fuente: Publicación oficial de Qwen (reproducida por IT Home).

Ejecución en portátiles: El verdadero valor del código abierto

La reducción en la escala de parámetros se traduce inmediatamente en eficiencia de hardware. El autohospedaje de un modelo de un billón de parámetros requiere decenas de GPUs empresariales. En cambio, la versión cuantizada en FP8 de Qwen3.8-27B ocupa unos 17 GB y mantiene un rendimiento equivalente al modelo original, de forma análoga a comprimir una fotografía de alta resolución con una pérdida casi imperceptible a simple vista. Diversos desarrolladores ya lo ejecutan en MacBooks con herramientas de código abierto y en GPUs de consumo doméstico.

Ese es el impacto real de la licencia Apache-2.0: libertad para descargar, modificar y desplegar comercialmente sin tarifas de licencia. Una pequeña empresa puede integrar IA en sus procesos internos sin abonar tarifas por token a servicios en la nube ni enviar datos confidenciales fuera de su red. Investigadores y estudiantes pueden inspeccionar la arquitectura interna de forma directa. En Hacker News, varios desarrolladores señalaron que utilizaban modelos compactos anteriores de Qwen en producción y comenzaron a probar la versión 3.8 la misma noche de su lanzamiento.

La comunidad mantiene asimismo una postura analítica: se señala que las trazas de razonamiento pueden resultar excesivamente extensas en ciertas tareas simples, y que altos puntajes en benchmarks no garantizan una experiencia perfecta en todos los casos de uso. No obstante, estos matices confirman un punto central: los modelos compactos de código abierto han ganado de forma legítima un lugar relevante junto a los gigantes de billones de parámetros.

Al evolucionar de una carrera unidireccional a un ecosistema diversificado, la propuesta de Alibaba devuelve la capacidad de elección al usuario: recurrir a gigantes en la nube para necesidades de máxima exigencia, o ejecutar localmente un modelo de 27B eficiente, privado y controlado directamente en su portátil.

Enlaces de referencia:

  • Página del modelo en Hugging Face: Qwen3.8-27B (Ficha técnica oficial y datos completos de benchmarks)
  • Página del modelo en Hugging Face: Qwen3.8-27B-FP8 (Pesos cuantizados en FP8)
  • Discusión en Hacker News: Qwen 3.8 27B (819 puntos / 539 comentarios)
  • IT Home: Alibaba publica Qwen3.8-27B como código abierto, superando a Qwen3.7-Plus en programación y oficina
  • Columna en Zhihu: ¡Qwen3.8-27B ya disponible en código abierto!