Cerebras CS-4: три пластини в одній стійці, інференс пришвидшується (але незалежних тестів немає)
18 серпня 2026 року Cerebras Systems анонсувала CS-4 — систему інференсу масштабу стійки й першого представника нової платформи «Cerebras Nexus». Структурна новина: три процесори Wafer Scale Engine 3 Turbo (WSE-3T) в одній стійці — уперше компанія розміщує кілька пластин в одній шафі (джерело: офіційний пресреліз; підтвердження DigiTimes і ServeTheHome). У релізі генеральний директор коротко сформулював мету: "Speed is productivity... CS-4 delivers industry-leading speeds on the largest frontier models." (джерело: Cerebras).
Щодо кремнію ServeTheHome наводить для одного WSE-3T: 900 000 ШІ-ядер, 44 ГБ SRAM на кристалі, близько 4 трильйонів транзисторів і техпроцес TSMC 5 нм; заявлена продуктивність — 250 PFLOPS у розрідженому FP16, удвічі більше за WSE-3, і це на тому самому виробничому вузлі (тобто приріст не походить від нового техпроцесу). На рівні стійки Cerebras заявляє 750 PFLOPS ШІ-обчислень, 132 ГБ SRAM сумарно, 129,6 ПБ/с пропускної здатності пам'яті, 7,2 Тбіт/с вводу-виводу і затримку 2 мікросекунди; затримка між пластинами падає з ~5 до ~2 мікросекунд (ServeTheHome; implicator.ai). Структурне обмеження пам'яті на кристалі залишається: 132 ГБ на стійку. Загалом залишається й структурне обмеження самого підходу wafer-scale порівняно з GPU, які використовують зовнішню пам'ять.
Обіцянки щодо продуктивності амбітні, але наразі заявлені самою компанією: Cerebras говорить про «до 2x» токенів на секунду на одного користувача порівняно з CS-3 і «до 30x» порівняно з рішеннями на GPU, за понад 4400 токенів/с на gpt-oss-120b; плюс «до 10x» пропускної здатності на ват і «50%» менше компонентів у стійці (джерело: пресреліз). Implicator.ai уточнює, що 4400+ токенів/с і коефіцієнт 30x отримані у внутрішніх тестах Cerebras, а порівняння з боку GPU спирається на публічні дані Artificial Analysis; жодна незалежна лабораторія не опублікувала прямих бенчмарків CS-4, а 30x виміряно на одній-єдиній моделі, gpt-oss-120b, а не на фронтирних моделях. У поточних даних Artificial Analysis для gpt-oss-120b (профіль high) Cerebras виявляється найшвидшим провайдером із ~1670 токенами/с, попереду SambaNova (~704) і Groq (~479), але ці значення відображають уже працюючу інфраструктуру, а не CS-4. Про те, навіщо тиснути на швидкість на користувача, технічний директор наголошує: "Being 30 times faster gives an agentic system room for more than an order of magnitude as much reasoning, verification, or tool use." (джерело: Cerebras).
Щодо енергоспоживання даних немає; ServeTheHome оцінює ~54 кВт на одну пластинну систему, а implicator.ai — 120–140 кВт для повністю заповненої стійки. Перші постачання заявлені на поточний квартал (III квартал 2026 року); ціну, обсяги та замовників не розкрито. У порівнянні «сирих» обчислень ServeTheHome нараховує приблизно шестикратний приріст до однієї системи CS-3 і приблизно трикратний — до стійки CS-3: розрив між «сирими» обчисленнями і швидкістю, яку відчуває користувач, компанія не пояснює. Про досвід встановлення та мережу — зовнішній коментар у релізі: "CS-4 makes dramatic improvements in system deployability, reliability, and networking." — приписаний засновнику SemiAnalysis Дилану Пателю. Твердження про «50% менше компонентів» і встановлення за години, а не за дні, теж поки що залишаються заявами компанії, не перевіреними третьою стороною.
CS-4 тисне саме туди, де сьогодні все вирішується для агентів і роботи з інструментами, — низька затримка й токени на секунду на користувача, — рівно тоді, коли вузьке місце зміщується до живлення, охолодження і термінів введення в експлуатацію. Технічна основа міцна й добре задокументована; щодо заявленої продуктивності ми чекаємо на незалежні вимірювання та прозорі цифри щодо споживання та доступних потужностей. Якщо вони з'являться, тоді й стане по-справжньому зрозуміло, наскільки великий цей крок. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Прочитано офіційний пресреліз Cerebras від 18 серпня 2026 року на сайті Investor Relations компанії та в повній синдикації GlobeNewswire, де наведені характеристики, заяви про продуктивність і цитати. Звірено з незалежним технічним розбором ServeTheHome (характеристики WSE-3 Turbo, техпроцес, затримка, «сирі» обчислення) і з DigiTimes, який підтверджує дату та заяву про 2x щодо CS-3. На implicator.ai перевірено розмежування між цифрами компанії та вимірюваннями третіх сторін, а за публічними даними Artificial Analysis — поточний рейтинг провайдерів на gpt-oss-120b, де швидкості працюючої інфраструктури нижчі за заявлені для нової системи. Джерела за пейволом або недоступні (HPCwire, Financial Times, Nature) виключено як фактичну основу.
- Incertezze
- Незалежних бенчмарків CS-4 не опубліковано: 4400+ токенів/с і коефіцієнт 30x — це внутрішні тести Cerebras, причому 30x виміряно на одній моделі (gpt-oss-120b), а не на фронтирних моделях. Реальне енергоспоживання не заявлено, а дві доступні зовнішні оцінки не збігаються. Ціна, обсяги виробництва, замовники та фактично доступні потужності невідомі. Залишається нез'ясованим розрив між приростом «сирих» обчислень (близько 3x на стійку за ServeTheHome) і «до 2x» щодо швидкості на користувача. Твердження про «50% менше компонентів» і встановлення за години, а не за дні, — це заяви компанії, не перевірені третьою стороною.
- Perché pubblicarla
- Це анонс обладнання з публічним першоджерелом і детальними характеристиками, але з чітким і документованим розривом між цифрами виробника та доступними незалежними вимірюваннями: випадок дозволяє пояснити, чому швидкість на одного користувача важлива в добу агентів, і водночас — як критично читати продуктовий пресреліз. Тема — інференс, щільність стійок, енергоспоживання — не охоплена жодною вже опублікованою статтею.
Fonti / Sources
- Cerebras Systems — comunicato ufficiale «Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions» (Investor Relations, 18 agosto 2026)
- ServeTheHome — analisi tecnica di WSE-3 Turbo e del sistema rack-scale CS-4
- Implicator.ai — verifica di quali cifre siano dichiarate dall'azienda e quali misurate da terzi
- Artificial Analysis — classifica pubblica dei provider su gpt-oss-120b