Cerebras CS-4: drie wafers in één rack, inferentie versnelt (maar onafhankelijke benchmarks ontbreken)
Op 18 augustus 2026 kondigde Cerebras Systems de CS-4 aan, een inferentiesysteem op rackniveau en het eerste lid van het nieuwe platform «Cerebras Nexus». Het structurele nieuws: drie Wafer Scale Engine 3 Turbo-processors (WSE-3T) in één rack, de eerste keer dat het bedrijf meerdere wafers in dezelfde kast zet (bron: officieel persbericht; bevestigd door DigiTimes en ServeTheHome). In het persbericht vatte de topman het doel samen: "Speed is productivity... CS-4 delivers industry-leading speeds on the largest frontier models." (bron: Cerebras).
Over het silicium meldt ServeTheHome voor één WSE-3T: 900.000 AI-cores, 44 GB on-chip SRAM, zo'n 4 biljoen transistors en een TSMC 5 nm-proces; de opgegeven rekenkracht is 250 PFLOPS bij sparse FP16, het dubbele van de WSE-3, terwijl de productienode dezelfde blijft (de winst komt dus niet van een nieuw proces). Op rackniveau claimt Cerebras 750 PFLOPS aan AI-rekenkracht, 132 GB SRAM in totaal, 129,6 PB/s geheugenbandbreedte, 7,2 Tbit/s I/O en 2 microseconden latentie; de latentie tussen wafers daalt van ~5 naar ~2 microseconden (ServeTheHome; implicator.ai). De structurele beperking van on-chipgeheugen blijft: 132 GB per rack. In het algemeen blijft de structurele beperking van de wafer-scale-aanpak bestaan ten opzichte van GPU's, die extern geheugen gebruiken.
De prestatiebeloften zijn ambitieus maar op dit moment zelf opgegeven: Cerebras spreekt van «tot 2x» tokens/seconde per individuele gebruiker ten opzichte van de CS-3 en «tot 30x» ten opzichte van GPU-gebaseerde oplossingen, met ruim 4.400 tokens/s op gpt-oss-120b; daarnaast «tot 10x» doorvoer per watt en «50%» minder componenten in het rack (bron: persbericht). Implicator.ai preciseert dat de 4.400+ tokens/s en de factor 30 uit interne tests van Cerebras komen en dat de vergelijking aan GPU-zijde leunt op de publieke data van Artificial Analysis; geen enkel onafhankelijk lab heeft directe benchmarks op de CS-4 gepubliceerd, en de factor 30 is gemeten op één model, gpt-oss-120b, niet op frontier-modellen. In de huidige data van Artificial Analysis voor gpt-oss-120b (profiel high) is Cerebras de snelste aanbieder met ~1.670 tokens/s, vóór SambaNova (~704) en Groq (~479), maar die waarden weerspiegelen de infrastructuur die al draait en niet de CS-4. Over waarom je inzet op snelheid per gebruiker, benadrukt de technisch directeur: "Being 30 times faster gives an agentic system room for more than an order of magnitude as much reasoning, verification, or tool use." (bron: Cerebras).
Over het stroomverbruik is niets bekendgemaakt; ServeTheHome schat ~54 kW per wafersysteem, terwijl implicator.ai een volledig gevuld rack op 120–140 kW zet. De eerste leveringen worden aangekondigd voor het lopende kwartaal (Q3 2026); prijs, volumes en klanten zijn niet openbaar gemaakt. Op ruwe rekenkracht komt ServeTheHome uit op ongeveer zes keer een enkel CS-3-systeem en ongeveer drie keer een CS-3-rack: een gat tussen ruwe rekenkracht en de door de gebruiker ervaren snelheid dat het bedrijf niet verklaart. Over installatie en netwerk staat er een externe reactie in het persbericht: "CS-4 makes dramatic improvements in system deployability, reliability, and networking." — toegeschreven aan SemiAnalysis-oprichter Dylan Patel. Ook de uitspraken over «50% minder componenten» en installaties in uren in plaats van dagen blijven voorlopig bedrijfsverklaringen die niet door derden zijn geverifieerd.
De CS-4 duwt precies daar waar het vandaag verschil maakt voor agents en tool-gebruik — lage latentie en tokens/seconde per gebruiker — net nu het knelpunt verschuift naar stroom, koeling en doorlooptijd van installatie. De technische basis is solide en goed gedocumenteerd; over de opgegeven prestaties wachten we op onafhankelijke metingen en transparante cijfers over verbruik en capaciteit. Komen die er, dan snappen we pas echt hoe groot de stap is. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Het officiële Cerebras-persbericht van 18 augustus 2026 gelezen op de Investor Relations-site van het bedrijf en in de volledige GlobeNewswire-syndicatie, met specificaties, prestatieclaims en citaten. Gekruist met de onafhankelijke technische analyse van ServeTheHome (specificaties van de WSE-3 Turbo, productienode, latentie, ruwe rekenkracht) en met DigiTimes, dat datum en de 2x-claim ten opzichte van de CS-3 bevestigt. Via implicator.ai het onderscheid gecontroleerd tussen door het bedrijf opgegeven cijfers en metingen van derden, en via de publieke data van Artificial Analysis de huidige rangorde van aanbieders op gpt-oss-120b, met draaiende snelheden die lager liggen dan wat voor het nieuwe systeem is aangekondigd. Bronnen achter een betaalmuur of onbereikbaar (HPCwire, Financial Times, Nature) zijn als feitenbasis terzijde gelegd.
- Incertezze
- Er is geen onafhankelijke benchmark van de CS-4 gepubliceerd: de 4.400+ tokens/s en de factor 30 zijn interne tests van Cerebras, en de factor 30 is gemeten op één model (gpt-oss-120b), niet op frontier-modellen. Het werkelijke stroomverbruik is niet opgegeven en de twee beschikbare externe schattingen komen niet overeen. Prijs, productievolumes, klanten en daadwerkelijk beschikbare capaciteit zijn onbekend. Het gat tussen de groeifactor van de ruwe rekenkracht (ongeveer 3x per rack volgens ServeTheHome) en de «tot 2x» in snelheid per gebruiker moet nog worden opgehelderd. De uitspraken over «50% minder componenten» en installatie in uren in plaats van dagen zijn bedrijfsverklaringen die niet door derden zijn geverifieerd.
- Perché pubblicarla
- Een hardwareaankondiging met een openbare primaire bron en gedetailleerde specificaties, maar met een duidelijk en aantoonbaar gat tussen de cijfers van de fabrikant en de beschikbare onafhankelijke metingen: het geval laat zich gebruiken om uit te leggen waarom snelheid per individuele gebruiker telt in het tijdperk van agents, en tegelijk hoe je een productpersbericht kritisch leest. Het onderwerp — inferentie, rackdichtheid, verbruik — komt in geen enkel eerder gepubliceerd artikel aan bod.
Fonti / Sources
- Cerebras Systems — comunicato ufficiale «Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions» (Investor Relations, 18 agosto 2026)
- ServeTheHome — analisi tecnica di WSE-3 Turbo e del sistema rack-scale CS-4
- Implicator.ai — verifica di quali cifre siano dichiarate dall'azienda e quali misurate da terzi
- Artificial Analysis — classifica pubblica dei provider su gpt-oss-120b