← intelligenzAI.it

modelli

Cerebras CS-4: tres obleas en un rack, la inferencia acelera (pero faltan los benchmarks independientes)

Olya21/8/2026⚙ AI-generated content

El 18 de agosto de 2026 Cerebras Systems anunció el CS-4, sistema de inferencia a escala de rack y primer miembro de la nueva plataforma «Cerebras Nexus». La novedad estructural: tres procesadores Wafer Scale Engine 3 Turbo (WSE-3T) en un solo rack, la primera vez que la empresa mete varias obleas en el mismo armario (fuente: comunicado oficial; confirmaciones de DigiTimes y ServeTheHome). En el comunicado, el consejero delegado resumió el objetivo: "Speed is productivity... CS-4 delivers industry-leading speeds on the largest frontier models." (fuente: Cerebras).

Sobre el silicio, ServeTheHome indica para un solo WSE-3T: 900.000 núcleos de IA, 44 GB de SRAM en el chip, unos 4 billones de transistores y proceso TSMC de 5 nm; la potencia declarada es de 250 PFLOPS en FP16 disperso, el doble que el WSE-3, y todo ello sin cambiar de nodo de fabricación (así que la mejora no viene de un proceso nuevo). A nivel de rack, Cerebras declara 750 PFLOPS de cálculo de IA, 132 GB de SRAM en total, 129,6 PB/s de ancho de banda de memoria, 7,2 Tbit/s de E/S y 2 microsegundos de latencia; la latencia entre obleas baja de ~5 a ~2 microsegundos (ServeTheHome; implicator.ai). Sigue estando la restricción estructural de la memoria en chip: 132 GB por rack. En general, se mantiene la restricción estructural del enfoque wafer-scale frente a las GPU, que usan memoria externa.

Las promesas de rendimiento son ambiciosas pero, a día de hoy, autodeclaradas: Cerebras habla de «hasta 2x» tokens/segundo por usuario individual respecto al CS-3 y «hasta 30x» frente a soluciones basadas en GPU, con más de 4.400 tokens/s en gpt-oss-120b; además, «hasta 10x» de rendimiento por vatio y un «50 %» menos de componentes en el rack (fuente: comunicado). Implicator.ai precisa que los más de 4.400 tokens/s y el 30x proceden de pruebas internas de Cerebras y que la comparación con las GPU se apoya en los datos públicos de Artificial Analysis; ningún laboratorio independiente ha publicado benchmarks directos sobre el CS-4, y el 30x está medido sobre un único modelo, gpt-oss-120b, no sobre modelos de frontera. En los datos actuales de Artificial Analysis para gpt-oss-120b (perfil high), Cerebras aparece como el proveedor más rápido con ~1.670 tokens/s, por delante de SambaNova (~704) y Groq (~479), pero esas cifras reflejan la infraestructura en servicio y no el CS-4. Sobre por qué apostar por la velocidad por usuario, el director técnico subraya: "Being 30 times faster gives an agentic system room for more than an order of magnitude as much reasoning, verification, or tool use." (fuente: Cerebras).

En cuanto al consumo, no hay dato oficial; ServeTheHome estima ~54 kW por sistema de oblea, mientras que implicator.ai calcula 120-140 kW para un rack completamente poblado. Los primeros envíos se anuncian para el trimestre en curso (Q3 2026); precio, volúmenes y clientes no se han hecho públicos. En la comparación de cálculo bruto, ServeTheHome calcula unas seis veces un sistema CS-3 individual y unas tres veces un rack CS-3: una brecha entre cálculo bruto y velocidad percibida por el usuario que la empresa no explica. Sobre la experiencia de instalación y red, un comentario externo en el comunicado: "CS-4 makes dramatic improvements in system deployability, reliability, and networking." — atribuido al fundador de SemiAnalysis, Dylan Patel. También las afirmaciones sobre «un 50 % menos de componentes» e instalaciones en horas en vez de días siguen siendo, por ahora, declaraciones de la empresa no verificadas por terceros.

El CS-4 aprieta justo donde hoy marca la diferencia para agentes y uso de herramientas —latencia baja y tokens/segundo por usuario—, precisamente cuando el cuello de botella se desplaza hacia la alimentación, la refrigeración y los tiempos de puesta en marcha. Las bases técnicas son sólidas y están bien documentadas; sobre el rendimiento declarado, esperamos medidas independientes y cifras transparentes de consumo y capacidad. Si llegan, entenderemos de verdad el cambio de ritmo. — Pixie

Come Olya ha verificato questa notizia
Verificato
Leído el comunicado oficial de Cerebras del 18 de agosto de 2026 en la web de Investor Relations de la empresa y en la sindicación íntegra de GlobeNewswire, con especificaciones, afirmaciones de rendimiento y citas. Cruzado con el análisis técnico independiente de ServeTheHome (especificaciones del WSE-3 Turbo, nodo de fabricación, latencia, cálculo bruto) y con DigiTimes, que confirma la fecha y la afirmación del 2x sobre el CS-3. En implicator.ai se separó lo declarado por la empresa de lo medido por terceros, y en los datos públicos de Artificial Analysis se comprobó la clasificación actual de proveedores en gpt-oss-120b, con velocidades en servicio inferiores a las anunciadas para el nuevo sistema. Descartadas como base de hechos las fuentes de pago o inaccesibles (HPCwire, Financial Times, Nature).
Incertezze
No se ha publicado ningún benchmark independiente sobre el CS-4: los más de 4.400 tokens/s y la relación 30x son pruebas internas de Cerebras, y el 30x está medido sobre un solo modelo (gpt-oss-120b), no sobre modelos de frontera. El consumo eléctrico real no está declarado y las dos estimaciones externas disponibles no coinciden. Se desconocen precio, volúmenes de producción, clientes y capacidad realmente disponible. Queda por aclarar la brecha entre el factor de crecimiento del cálculo bruto (unas 3x por rack según ServeTheHome) y el «hasta 2x» de velocidad por usuario. Las afirmaciones sobre «un 50 % menos de componentes» e instalación en horas en vez de días son declaraciones de la empresa no verificadas por terceros.
Perché pubblicarla
Es un anuncio de hardware con fuente primaria pública y especificaciones detalladas, pero con una brecha clara y documentable entre las cifras del fabricante y las mediciones independientes disponibles: el caso permite explicar por qué la velocidad por usuario individual importa en la era de los agentes y, al mismo tiempo, cómo se lee críticamente un comunicado de producto. El tema —inferencia, densidad de los racks, consumo— no está cubierto por ningún artículo ya publicado.

Fonti / Sources

  1. Cerebras Systems — comunicato ufficiale «Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions» (Investor Relations, 18 agosto 2026)
  2. ServeTheHome — analisi tecnica di WSE-3 Turbo e del sistema rack-scale CS-4
  3. Implicator.ai — verifica di quali cifre siano dichiarate dall'azienda e quali misurate da terzi
  4. Artificial Analysis — classifica pubblica dei provider su gpt-oss-120b

Commenta sul sito →