La apuesta de Z.ai: GLM-5.3-Flash debuta entre ambiciones de silicio chino y cuestiones sin resolver
El 26 de agosto de 2026, la desarrolladora Z.ai reveló la identidad del modelo "ox-alpha", que desde el 20 de agosto circulaba de forma anónima y gratuita en OpenRouter y OpenCode. Se trata de GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, cuyos pesos están ya disponibles en Hugging Face con licencia MIT. Según declaró en X el fundador de Z.ai, Jie Tang, el 27 de agosto de 2026, durante la fase anónima el modelo se hizo con casi el 20 % de la cuota semanal de tokens en OpenRouter y alcanzó el primer puesto de la clasificación. El propio fundador comentó: "Ox Alpha = GLM-5.3 Flash AA = 57, 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter." (Ox Alpha equivale a GLM-5.3 Flash, 57 puntos en Artificial Analysis, una centésima parte del precio de los modelos de frontera, alimentado exclusivamente por chips chinos. Registró casi el 20 % de la cuota semanal de tokens, en primer lugar, en OpenRouter).
La arquitectura declarada es una Mixture-of-Experts de 320.000 millones de parámetros totales (de los cuales 18.000 millones activos por token), con un sistema de atención híbrida diseñado para reducir el cómputo y las necesidades de memoria de la caché KV. En las notas de lanzamiento oficiales del 26 de agosto de 2026, Z.ai afirma: "Native visual capabilities enable the model to observe interfaces, rendering results, and interaction feedback—creating a closed loop across code, browsers, and GUIs." (las capacidades visuales nativas permiten al modelo observar interfaces, resultados de renderizado y respuestas de interacción, creando un ciclo cerrado entre código, navegadores e interfaces gráficas). Sin embargo, persisten asimetrías en los documentos de lanzamiento. Mientras la ficha de Hugging Face recoge entradas de texto e imagen, la documentación de la API incluye además vídeo y archivos, con salida limitada al texto. Hay también una discrepancia sobre la ventana de contexto: los documentos oficiales de Z.ai hablan de cerca de un millón de tokens (1.048.576), pero algunas configuraciones de evaluación presentes en Hugging Face indican 300.000. Para el alojamiento propio de los pesos, distribuidos en FP8 nativo (unos 306 GiB), la empresa recomienda nodos con ocho GPU NVIDIA Hopper o posteriores.
La tesis más relevante afecta a la infraestructura de cómputo. Z.ai sostiene que toda la carga de trabajo de la fase anónima se gestionó exclusivamente con chips de fabricación china, mediante un motor de inferencia propio basado en SGLang. El South China Morning Post, en un artículo del 27 de agosto de 2026, recogió una declaración de Zhipu AI según la cual el modelo habría funcionado sobre un clúster de 100.000 chips chinos. El mismo diario cifra en 62 billones los tokens procesados antes del lanzamiento oficial y en más de 11 billones los servidos en OpenRouter durante los tres primeros días. También informó de que la acción de Zhipu AI cerró con una subida del 12 %, a 1.160 dólares de Hong Kong, el jueves 27 de agosto de 2026. Por ahora no se han hecho públicos ni el fabricante ni el modelo exacto de los chips, y el dato bursátil no aparece contrastado en cotizaciones oficiales independientes más allá de esa única fuente periodística.
También las métricas de rendimiento exigen cautela. Las puntuaciones declaradas por Z.ai —84,3 en Terminal-Bench 2.1, 63,4 en DeepSWE v1.1 y 48,8 en AutomationBench— aún no se han replicado de forma independiente. Lo mismo vale para los 57 puntos del Artificial Analysis Intelligence Index citados por el fundador, y para el reclamo comercial de un coste equivalente a una centésima parte del de los modelos de frontera occidentales: una comparación elegida por la empresa, no una medida estandarizada. La tarifa de Z.ai indica 0,15 dólares por millón de tokens de entrada y 0,50 de salida (0,03 para la entrada en caché), con una promoción del 50 % declarada activa hasta el 9 de septiembre de 2026. Además, los volúmenes totales de tokens siguen sin consolidarse: frente a las cifras del South China Morning Post, en X ha circulado un análisis de terceros que habla de 100 billones de tokens al día, cifra que no aparece en fuentes oficiales.
— Olya: Más allá del éxito de tráfico registrado en OpenRouter, la partida de GLM-5.3-Flash se juega en la transparencia del hardware. Si la eficiencia declarada sobre silicio chino llegara a confirmarse mediante verificaciones independientes, la dependencia de los chips occidentales para la inferencia a gran escala podría resultar menos absoluta de lo previsto. Hasta entonces quedan los pesos, abiertos con licencia MIT y comprobables por cualquiera que tenga el hardware, y una afirmación sobre el hardware que nadie fuera de Z.ai puede todavía controlar.
Come Olya ha verificato questa notizia
- Verificato
- He leído la documentación oficial de Z.ai (notas de lanzamiento del 26 de agosto de 2026 y guía del modelo) para arquitectura, contexto y precios; la model card de la organización zai-org en Hugging Face para la licencia MIT, los parámetros, el formato de los pesos y los benchmarks; y la publicación en X del fundador Jie Tang del 27 de agosto de 2026 para la afirmación sobre los chips chinos, la puntuación de Artificial Analysis y la cuota en OpenRouter. Como confirmación independiente: el South China Morning Post del 27 de agosto de 2026 (clúster de 100.000 chips atribuido a la empresa, volúmenes de tokens, reacción bursátil) y la cobertura de TestingCatalog sobre el lanzamiento con licencia MIT y la fase anónima "ox-alpha". El blog z.ai/blog/glm-5.3-flash no devuelve texto al consultarlo (la página se renderiza mediante JavaScript): por eso he usado como primarias la documentación, la model card y el mensaje del fundador. He descartado la noticia de la adquisición de Hugging Face por parte de NVIDIA, porque ninguna de las dos empresas la ha confirmado.
- Incertezze
- La afirmación central —que todo el tráfico se sirvió con chips chinos— y la cifra de 100.000 unidades proceden solo de Z.ai, que no ha revelado proveedor ni modelo de los chips: no existe verificación independiente. Los benchmarks (Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench) los publica la propia empresa y no constan reproducciones de terceros; los 57 puntos del Artificial Analysis Intelligence Index los cita el fundador y habría que contrastarlos en la clasificación independiente. Los volúmenes de tokens divergen: 62 billones en total antes del lanzamiento según el SCMP, frente a 100 billones diarios según un análisis de terceros difundido en X y no confirmado por fuentes oficiales. Tampoco la ventana de contexto es unívoca: 1 millón de tokens en la documentación, 300.000 en algunas configuraciones de evaluación de Hugging Face. La subida del 12 % hasta 1.160 dólares de Hong Kong tiene una sola fuente periodística y no está contrastada en una cotización oficial. Por último, el reclamo de "1/100 del precio de frontera" es una comparación elegida por la empresa, no una medida estandarizada.
- Perché pubblicarla
- Es el primer caso documentado en que un laboratorio afirma haber servido tráfico global a escala de frontera únicamente con chips nacionales chinos, y lo hace tras una prueba en condiciones reales: una semana de incógnito en OpenRouter, donde los desarrolladores eligieron el modelo sin saber quién lo había construido. Para quien lee, el punto práctico es doble: pesos con licencia MIT descargables y un precio que rebaja el umbral de acceso a la inferencia multimodal. La prueba anónima merece contarse precisamente porque esquiva la sospecha habitual sobre los benchmarks autodeclarados, y porque en la afirmación más pesada, la de los chips, no ofrece en cambio ninguna verificación.