Cerebras CS-4: tre wafer in un rack, l’inferenza accelera (ma i benchmark indipendenti mancano)
Il 18 agosto 2026 Cerebras Systems ha annunciato il CS-4, sistema di inferenza rack‑scale e primo membro della nuova piattaforma «Cerebras Nexus». La novità strutturale: tre processori Wafer Scale Engine 3 Turbo (WSE‑3T) in un singolo rack, prima volta che l’azienda mette più wafer nello stesso armadio (fonte: comunicato ufficiale; conferme di DigiTimes e ServeTheHome). Nel comunicato l’amministratore delegato ha sintetizzato l’obiettivo: "Speed is productivity... CS-4 delivers industry-leading speeds on the largest frontier models." (fonte: Cerebras).
Sul silicio, ServeTheHome riporta per il singolo WSE‑3T: 900.000 core AI, 44 GB di SRAM on‑chip, circa 4.000 miliardi di transistor e processo TSMC a 5 nm; la potenza dichiarata è 250 PFLOPS in FP16 sparso, il doppio del WSE‑3, pur restando sullo stesso nodo produttivo (quindi il guadagno non deriva da un nuovo processo). A livello di rack, Cerebras dichiara 750 PFLOPS di calcolo AI, 132 GB di SRAM complessiva, 129,6 PB/s di banda di memoria, 7,2 Tbit/s di I/O e latenza di 2 microsecondi; la latenza wafer‑to‑wafer scende da ~5 a ~2 microsecondi (ServeTheHome; implicator.ai). Resta il vincolo strutturale della memoria on‑chip: 132 GB per rack. In generale, resta il vincolo strutturale dell’approccio wafer‑scale rispetto alle GPU, che usano memoria esterna.
Le promesse prestazionali sono ambiziose ma, ad oggi, auto‑dichiarate: Cerebras parla di «fino a 2x» token/sec per singolo utente rispetto a CS‑3 e «fino a 30x» rispetto a soluzioni basate su GPU, con oltre 4.400 token/s su gpt‑oss‑120b; inoltre «fino a 10x» di throughput per watt e «50%» di componenti in meno nel rack (fonte: comunicato). Implicator.ai precisa che i 4.400+ token/s e il 30x derivano da test interni Cerebras e che il confronto lato GPU si appoggia ai dati pubblici di Artificial Analysis; nessun laboratorio indipendente ha pubblicato benchmark diretti sul CS‑4, e il 30x è misurato su un solo modello, gpt‑oss‑120b, non su modelli di frontiera. Nei dati correnti di Artificial Analysis per gpt‑oss‑120b (profilo high), Cerebras risulta il provider più veloce con ~1.670 token/s, davanti a SambaNova (~704) e Groq (~479), ma questi valori riflettono l’infrastruttura in servizio e non il CS‑4. Sul perché spingere su velocità per utente, il direttore tecnico sottolinea: "Being 30 times faster gives an agentic system room for more than an order of magnitude as much reasoning, verification, or tool use." (fonte: Cerebras).
Sul fronte dei consumi, il dato non è dichiarato; ServeTheHome stima ~54 kW per sistema wafer, mentre implicator.ai valuta 120–140 kW per un rack completamente popolato. Le prime spedizioni sono indicate per il trimestre in corso (Q3 2026); prezzo, volumi e clienti non sono stati resi noti. Nel confronto sul calcolo grezzo, ServeTheHome calcola circa sei volte un singolo sistema CS‑3 e circa tre volte un rack CS‑3: uno scarto tra calcolo grezzo e velocità percepita dall’utente che l’azienda non spiega. Sull’esperienza d’installazione e rete, un commento esterno nel comunicato: "CS-4 makes dramatic improvements in system deployability, reliability, and networking." — attribuito al fondatore di SemiAnalysis Dylan Patel. Anche le affermazioni su «50% di componenti in meno» e installazioni in ore anziché giorni restano, al momento, dichiarazioni aziendali non verificate da terzi.
Il CS‑4 spinge dove oggi fa la differenza per agenti e tool‑use — latenza bassa e token/sec per utente — proprio mentre il collo di bottiglia si sposta su alimentazione, raffreddamento e tempi di messa in opera. Le basi tecniche sono solide e ben documentate; sulle performance dichiarate, aspettiamo misure indipendenti e numeri trasparenti su consumi e capacità. Se arrivano, capiamo davvero il cambio di passo. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Letto il comunicato ufficiale Cerebras del 18 agosto 2026 (sito Investor Relations e syndication integrale GlobeNewswire) per specifiche, numeri prestazionali e citazioni. Incrociato con l'analisi tecnica indipendente di ServeTheHome (WSE-3 Turbo, nodo produttivo, latenza, calcolo grezzo) e con DigiTimes, che conferma data e il 2x sul CS-3. Su implicator.ai separata la parte dichiarata dall'azienda da quella misurata da terzi; sui dati pubblici di Artificial Analysis controllata la classifica attuale dei provider su gpt-oss-120b, con velocità in servizio più basse di quelle annunciate. Escluse come base di fatti le fonti a pagamento o irraggiungibili (HPCwire, Financial Times, Nature).
- Incertezze
- Nessun benchmark indipendente sul CS-4: i 4.400+ token/s e il 30x sono test interni Cerebras, e il 30x riguarda un solo modello (gpt-oss-120b), non modelli di frontiera. Il consumo elettrico reale non è dichiarato e le due stime esterne non coincidono. Prezzo, volumi produttivi, clienti e capacità disponibile restano ignoti. Da chiarire lo scarto tra circa 3x di calcolo grezzo per rack (ServeTheHome) e il «fino a 2x» sulla velocità per utente. «50% di componenti in meno» e installazione in ore anziché giorni sono dichiarazioni aziendali non verificate da terzi.
- Perché pubblicarla
- Annuncio hardware con fonte primaria pubblica e specifiche dettagliate, ma con un divario netto e documentabile tra numeri del produttore e misure indipendenti disponibili: buon caso per spiegare al lettore italiano perché la velocità per singolo utente conta nell'era degli agenti e come si legge con spirito critico un comunicato di prodotto. Inferenza, densità dei rack e consumi non sono coperti da nessun articolo già pubblicato.
Fonti / Sources
- Cerebras Systems — comunicato ufficiale «Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions» (Investor Relations, 18 agosto 2026)
- ServeTheHome — analisi tecnica di WSE-3 Turbo e del sistema rack-scale CS-4
- Implicator.ai — verifica di quali cifre siano dichiarate dall'azienda e quali misurate da terzi
- Artificial Analysis — classifica pubblica dei provider su gpt-oss-120b