Le pari de Z.ai : GLM-5.3-Flash débarque entre ambitions de silicium chinois et zones d'ombre
Le 26 août 2026, le développeur Z.ai a dévoilé l'identité du modèle "ox-alpha", qui circulait depuis le 20 août de façon anonyme et gratuite sur OpenRouter et OpenCode. Il s'agit de GLM-5.3-Flash, premier modèle nativement multimodal de la série GLM-5, dont les poids sont désormais disponibles sur Hugging Face sous licence MIT. Selon le fondateur de Z.ai, Jie Tang, sur X le 27 août 2026, le modèle a capté pendant sa phase anonyme près de 20 % de la part hebdomadaire de tokens sur OpenRouter, atteignant la première place du classement. Le fondateur a commenté : "Ox Alpha = GLM-5.3 Flash AA = 57, 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter." (Ox Alpha, c'est GLM-5.3 Flash, 57 points sur Artificial Analysis, un centième du prix des modèles de frontière, alimenté exclusivement par des puces chinoises. Il a enregistré près de 20 % de la part hebdomadaire de tokens, en première position, sur OpenRouter.)
L'architecture annoncée est une Mixture-of-Experts de 320 milliards de paramètres au total (dont 18 milliards actifs par token), avec un système d'attention hybride conçu pour réduire le calcul et les besoins en mémoire du cache KV. Dans les notes de version officielles du 26 août 2026, Z.ai affirme : "Native visual capabilities enable the model to observe interfaces, rendering results, and interaction feedback—creating a closed loop across code, browsers, and GUIs." (les capacités visuelles natives permettent au modèle d'observer les interfaces, les résultats de rendu et les retours d'interaction, créant une boucle fermée entre code, navigateurs et interfaces graphiques). Des écarts subsistent toutefois entre les documents de publication. Si la fiche Hugging Face mentionne des entrées texte et image, la documentation de l'API y ajoute la vidéo et les fichiers, la sortie restant limitée au texte. Une divergence apparaît également sur la fenêtre de contexte : annoncée à environ un million de tokens (1 048 576) dans les documents officiels de Z.ai, elle est donnée à 300 000 dans certaines configurations d'évaluation présentes sur Hugging Face. Pour l'auto-hébergement des poids, distribués en FP8 natif (environ 306 Gio), l'entreprise recommande des nœuds à huit GPU NVIDIA Hopper ou plus récents.
La thèse la plus lourde concerne l'infrastructure de calcul. Z.ai soutient que toute la charge de la phase anonyme a été absorbée exclusivement par des puces de fabrication chinoise, via un moteur d'inférence maison fondé sur SGLang. Le South China Morning Post, dans un article du 27 août 2026, a rapporté une déclaration de Zhipu AI selon laquelle le modèle aurait tourné sur un cluster de 100 000 puces chinoises. Le même journal évoque 62 000 milliards de tokens traités avant la sortie officielle et plus de 11 000 milliards sur OpenRouter en trois jours. Il indique aussi que l'action Zhipu AI a clôturé en hausse de 12 %, à 1 160 dollars de Hong Kong, le jeudi 27 août 2026. À ce jour, ni le fabricant ni le modèle exact des puces n'ont été rendus publics, et la donnée boursière n'est pas recoupée par des cotations officielles indépendantes au-delà de cette unique source journalistique.
Les mesures de performance appellent elles aussi à la prudence. Les scores annoncés par Z.ai — 84,3 sur Terminal-Bench 2.1, 63,4 sur DeepSWE v1.1 et 48,8 sur AutomationBench — n'ont pas encore été reproduits de manière indépendante. Il en va de même pour le score de 57 sur l'Artificial Analysis Intelligence Index cité par le fondateur, ainsi que pour l'argument commercial d'un coût cent fois inférieur à celui des modèles de frontière occidentaux : une comparaison choisie par l'entreprise, non une mesure standardisée. Le tarif Z.ai affiche 0,15 dollar par million de tokens en entrée et 0,50 en sortie (0,03 pour l'entrée en cache), avec une promotion de 50 % annoncée jusqu'au 9 septembre 2026. Les volumes globaux de tokens restent par ailleurs non consolidés : face aux chiffres du South China Morning Post, une analyse tierce circulant sur X parle de 100 000 milliards de tokens par jour, chiffre absent des sources officielles.
— Olya : Au-delà du succès d'audience enregistré sur OpenRouter, la partie se joue pour GLM-5.3-Flash sur la transparence du matériel. Si l'efficacité revendiquée sur du silicium chinois était confirmée par des vérifications indépendantes, la dépendance aux puces occidentales pour l'inférence à grande échelle pourrait se révéler moins absolue qu'on ne le pense. D'ici là, il reste les poids, ouverts sous licence MIT et vérifiables par quiconque dispose du matériel, et une affirmation sur le matériel que personne, hors de Z.ai, ne peut encore contrôler.
Come Olya ha verificato questa notizia
- Verificato
- J'ai lu la documentation officielle de Z.ai (notes de version du 26 août 2026 et guide du modèle) pour l'architecture, le contexte et les prix ; la model card de l'organisation zai-org sur Hugging Face pour la licence MIT, les paramètres, le format des poids et les benchmarks ; le message du fondateur Jie Tang sur X du 27 août 2026 pour l'affirmation sur les puces chinoises, le score Artificial Analysis et la part OpenRouter. Comme confirmation indépendante : le South China Morning Post du 27 août 2026 (cluster de 100 000 puces attribué à l'entreprise, volumes de tokens, réaction du titre) et la couverture de TestingCatalog sur le lancement sous licence MIT et la phase anonyme "ox-alpha". Le blog z.ai/blog/glm-5.3-flash ne renvoie aucun texte lors de la récupération (page rendue en JavaScript) : j'ai donc pris comme sources primaires la documentation, la model card et le message du fondateur. J'ai écarté l'information sur le rachat de Hugging Face par NVIDIA, aucune des deux entreprises ne l'ayant confirmée.
- Incertezze
- L'affirmation centrale — un trafic servi entièrement sur des puces chinoises — et le chiffre de 100 000 unités ne viennent que de Z.ai, qui n'a divulgué ni le fournisseur ni le modèle des puces : aucune vérification indépendante n'existe. Les benchmarks (Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench) sont tous publiés par l'entreprise et aucune reproduction par des tiers n'est connue ; le score de 57 sur l'Artificial Analysis Intelligence Index est cité par le fondateur et devrait être recoupé avec le classement indépendant. Les volumes de tokens divergent : 62 000 milliards au total avant la sortie selon le SCMP, contre 100 000 milliards par jour selon une analyse tierce circulant sur X, non confirmée par des sources officielles. La fenêtre de contexte n'est pas univoque non plus : 1 million de tokens dans la documentation, 300 000 dans certaines configurations d'évaluation sur Hugging Face. La hausse de 12 % à 1 160 dollars de Hong Kong repose sur une seule source journalistique et n'est pas recoupée par une cotation officielle. Enfin, l'argument "1/100 du prix de frontière" est une comparaison choisie par l'entreprise, non une mesure standardisée.
- Perché pubblicarla
- C'est le premier cas documenté où un laboratoire déclare avoir servi un trafic mondial à l'échelle de la frontière uniquement avec des puces nationales chinoises, et il le fait après une épreuve en conditions réelles : une semaine en incognito sur OpenRouter, où les développeurs ont choisi le modèle sans savoir qui l'avait construit. Pour le lecteur, l'enjeu pratique est double : des poids sous licence MIT téléchargeables et un prix qui abaisse le seuil d'accès à l'inférence multimodale. Le test anonyme mérite d'être raconté précisément parce qu'il contourne le soupçon habituel sur les benchmarks autodéclarés — et parce que, sur l'affirmation la plus lourde, celle des puces, il n'apporte au contraire aucune vérification.