El 26 de agosto de 2026, GLM-5.3-Flash de Zhipu encabezó las plataformas de pruebas en el extranjero, asegurando 62 billones de llamadas de tokens en una semana. La base informática para este enorme torrente de datos está impulsada por un clúster de 100.000 chips totalmente nacionales. Esto marca una desamericanización sustancial de la IA de China en el lado de la inferencia, dos años después de que se cortara el suministro de chips de alta gama. Sin embargo, el costo subyacente es igualmente claro: frente a una realidad en la que el rendimiento de una sola tarjeta se retrasa aproximadamente 4 años, la industria está cerrando a la fuerza la brecha tecnológica mediante el uso de 10 veces el número de chips y facturas de electricidad exponencialmente más altas.
La base hardcore detrás de las pruebas anónimas
Antes de su lanzamiento, GLM-5.3-Flash, bajo el seudónimo de Ox-Alpha, se sometió a pruebas anónimas en dos importantes plataformas en el extranjero y rápidamente dominó las listas. Emplea una arquitectura híbrida con 320B de parámetros totales y 18B de parámetros activos, ofreciendo un precio de entrada de tan solo 0,15 dólares por millón de tokens. Este precio altamente agresivo indica que la potencia informática nacional no solo es funcional, sino que también puede sostener la competencia comercial en su estructura de costos.
Figura: La primera pantalla de la página de lanzamiento oficial de GLM-5.3-Flash: 320B de parámetros totales, 18B activos, multimodal nativo. Fuente: Captura de pantalla de la página de lanzamiento oficial de Zhipu
Durante la semana en que los usuarios en el extranjero llamaban frenéticamente a la API, todas las solicitudes fluyeron a un clúster de chips nacional conectado por una red de gran ancho de banda de desarrollo propio. Zhipu adoptó una arquitectura desagregada EPD de nivel de producción, mejorando el rendimiento del servicio de extremo a extremo en 3 veces en comparación con la línea base. Esto demuestra que el clúster de computación nacional ha superado el umbral básico de simplemente poder ejecutarse, y ahora posee la capacidad de soportar solicitudes de alta concurrencia a nivel de producción para modelos de clase mundial.
El costo físico de intercambiar cantidad por calidad
Dejando de lado las glamurosas estadísticas de uso, las limitaciones físicas del hardware subyacente siguen siendo duras. Limitados por la falta de máquinas de litografía EUV y las restricciones de exportación de memoria HBM, los principales chips nacionales todavía se enfrentan a graves desafíos en el muro de eficiencia térmica en la tecnología de procesos y las capacidades de acceso a la memoria. Una estimación aproximada sugiere que el cómputo de una sola tarjeta de los chips nacionales principales actuales solo equivale a aproximadamente el 60% de la H100 de NVIDIA de hace 4 años.
Figura: Diagrama de arquitectura de GLM-5.3-Flash: Atención lineal más atención dispersa, reduciendo el caché KV en 4,44 veces bajo 1M de contexto. Fuente: Diagrama de arquitectura oficial de Zhipu
Frente a las últimas arquitecturas internacionales de vanguardia, la brecha de rendimiento de una sola tarjeta puede incluso alcanzar un orden de magnitud. En respuesta a esta brecha generacional, los ingenieros chinos han proporcionado una solución extremadamente de fuerza bruta: confiar en una ingeniería de sistemas altamente compleja para aplastar el cómputo total con un clúster de chips 10 veces más grande.
Facturas de electricidad exorbitantes
Acumular cómputo masivo con 100.000 chips trae inevitablemente un aumento exponencial en el consumo de energía. Al adoptar este enfoque de cantidad por cómputo, el consumo de energía por token podría ser alrededor de 5 veces el nivel líder internacional. La proporción de los costos de electricidad en el costo total del clúster se ha disparado desde el 10% al 20% habitual, a casi la mitad.
Algunos desarrolladores en el extranjero también han informado que la velocidad de respuesta de las API chinas ocasionalmente va un poco a la zaga de los principales proveedores occidentales. Sin embargo, subsidiada por una capacidad masiva de generación de energía y un abundante dividendo de ingenieros, la industria de IA de China se ha abierto paso a la fuerza bruta hacia un camino de supervivencia desamericanizado utilizando una solución intensiva en energía y activos.
Una prueba extrema de cómputo real
Con 62 billones de llamadas, GLM-5.3-Flash ha demostrado la verdadera disponibilidad de los clústeres de chips nacionales bajo una concurrencia masiva. 100.000 chips y facturas de electricidad en alza son el claro precio que está pagando la IA de China para romper el bloqueo tecnológico. Cuando existe una brecha generacional objetiva en el rendimiento de una sola tarjeta que solo puede compensarse con diez veces la cantidad y la optimización a nivel del sistema, este concurso se ha convertido en una batalla de capacidades de ingeniería de sistemas y resolución estratégica.
Este camino es muy caro, pero de hecho se ha demostrado que es viable. El análisis anterior se basa en hechos actuales.
Enlaces de referencia:
- Informe del Securities Daily
- Informe del Securities Times
- Kama Notes
- Análisis de Martin Alderson
- Discusión en Lobsters