Le 26 août 2026, GLM-5.3-Flash de Zhipu s’est hissé en tête des plateformes de test à l’étranger, accumulant 62 billions de requêtes de tokens en une semaine. La base de calcul de ce flux de données massif est alimentée par un cluster de 100 000 puces entièrement nationales. Cela marque une désaméricanisation substantielle de l’IA chinoise du côté de l’inférence, deux ans après la coupure de l’approvisionnement en puces haut de gamme. Cependant, le coût sous-jacent est tout aussi clair : face à une réalité où les performances d’une seule carte accusent un retard d’environ 4 ans, l’industrie comble l’écart technologique par la force en utilisant 10 fois plus de puces et des factures d’électricité exponentielles.
La base hardcore derrière les tests anonymes
Avant sa sortie, GLM-5.3-Flash, sous le pseudonyme d’Ox-Alpha, a subi des tests anonymes sur deux grandes plateformes étrangères et a rapidement dominé les classements. Il utilise une architecture hybride avec 320B de paramètres totaux et 18B de paramètres actifs, offrant un prix de saisie aussi bas que 0,15 $ par million de tokens. Cette tarification très agressive indique que la puissance de calcul nationale n’est pas seulement fonctionnelle, mais qu’elle peut également soutenir la concurrence commerciale dans sa structure de coûts.
Figure : Le premier écran de la page de lancement officielle de GLM-5.3-Flash : 320B de paramètres totaux, 18B actifs, multimodal natif. Source : Capture d’écran de la page de lancement officielle de Zhipu
Pendant la semaine où les utilisateurs étrangers appelaient frénétiquement l’API, toutes les requêtes ont afflué vers un cluster de puces national connecté par un réseau à large bande passante développé en interne. Zhipu a adopté une architecture désagrégée EPD de niveau production, améliorant les performances du service de bout en bout de 3 fois par rapport à la ligne de base. Cela montre que le cluster de calcul national a franchi le seuil de base consistant simplement à pouvoir fonctionner, et possède désormais la capacité de prendre en charge des requêtes à haute simultanéité de niveau production pour des modèles de classe mondiale.
Le coût physique de l’échange de la quantité contre la qualité
Si l’on écarte les statistiques d’utilisation prestigieuses, les limites physiques du matériel sous-jacent restent sévères. Contraintes par l’absence de machines de lithographie EUV et les restrictions d’exportation de la mémoire HBM, les principales puces nationales sont toujours confrontées à de graves défis liés au mur d’efficacité thermique dans la technologie des processus et les capacités d’accès à la mémoire. Une estimation approximative suggère que le calcul d’une seule carte des puces nationales grand public actuelles n’équivaut qu’à environ 60 % de celui du H100 de NVIDIA d’il y a 4 ans.
Figure : Diagramme d’architecture GLM-5.3-Flash : Attention linéaire plus attention clairsemée, réduisant le cache KV de 4,44 fois dans un contexte de 1M. Source : Diagramme d’architecture officiel de Zhipu
Face aux dernières architectures de pointe internationales, l’écart de performance d’une seule carte peut même atteindre un ordre de grandeur. En réponse à cet écart générationnel, les ingénieurs chinois ont fourni une solution extrêmement brutale : s’appuyer sur une ingénierie système très complexe pour écraser le calcul total avec un cluster de puces 10 fois plus grand.
Des factures d’électricité exorbitantes
L’accumulation de calculs massifs avec 100 000 puces entraîne inévitablement une augmentation exponentielle de la consommation d’énergie. En adoptant cette approche de quantité pour le calcul, la consommation d’énergie par token pourrait être environ 5 fois supérieure au niveau international de pointe. La proportion des coûts d’électricité dans le coût total du cluster a grimpé en flèche, passant des habituels 10 % à 20 % à près de la moitié.
Certains développeurs étrangers ont également signalé que la vitesse de réponse des API chinoises est parfois légèrement en retard sur celle des principaux fournisseurs occidentaux. Cependant, subventionnée par une capacité massive de production d’électricité et un dividende abondant d’ingénieurs, l’industrie de l’IA chinoise a forcé sa voie de survie désaméricanisée en utilisant une solution gourmande en énergie et en actifs.
Un test extrême du vrai calcul
Avec 62 billions de requêtes, GLM-5.3-Flash a prouvé la véritable disponibilité des clusters de puces nationaux sous une simultanéité massive. 100 000 puces et des factures d’électricité en flèche sont le prix clair que l’IA chinoise paie pour briser le blocus technologique. Lorsqu’il existe un écart générationnel objectif dans les performances d’une seule carte qui ne peut être compensé que par dix fois la quantité et une optimisation au niveau du système, ce concours s’est transformé en une bataille de capacités d’ingénierie système et de résolution stratégique.
Cette voie est très coûteuse, mais elle s’est avérée viable. L’analyse ci-dessus est basée sur des faits actuels.
Liens de référence :
- Rapport du Securities Daily
- Rapport du Securities Times
- Kama Notes
- Analyse de Martin Alderson
- Discussion sur Lobsters