Cerebras CS-4: три пластины в одной стойке, вывод ускоряется (но независимых тестов нет)
18 августа 2026 года Cerebras Systems анонсировала CS-4 — систему инференса масштаба стойки и первого представителя новой платформы «Cerebras Nexus». Структурная новость: три процессора Wafer Scale Engine 3 Turbo (WSE-3T) в одной стойке — впервые компания разместила несколько пластин в одном шкафу (источник: официальный пресс-релиз; подтверждения DigiTimes и ServeTheHome). В релизе генеральный директор кратко сформулировал цель: "Speed is productivity... CS-4 delivers industry-leading speeds on the largest frontier models." (источник: Cerebras).
По кремнию ServeTheHome приводит для одного WSE-3T: 900 000 ИИ-ядер, 44 ГБ SRAM на кристалле, около 4 триллионов транзисторов и техпроцесс TSMC 5 нм; заявленная производительность — 250 PFLOPS в разреженном FP16, вдвое больше, чем у WSE-3, при том же производственном узле (то есть прирост получен не за счёт нового техпроцесса). На уровне стойки Cerebras заявляет 750 PFLOPS ИИ-вычислений, 132 ГБ SRAM суммарно, 129,6 ПБ/с пропускной способности памяти, 7,2 Тбит/с ввода-вывода и задержку 2 микросекунды; задержка между пластинами падает с ~5 до ~2 микросекунд (ServeTheHome; implicator.ai). Структурное ограничение памяти на кристалле остаётся: 132 ГБ на стойку. В целом сохраняется и структурное ограничение самого подхода wafer-scale по сравнению с GPU, которые используют внешнюю память.
Обещания по производительности амбициозны, но на сегодня заявлены самой компанией: Cerebras говорит о «до 2x» токенов в секунду на одного пользователя по сравнению с CS-3 и «до 30x» по сравнению с решениями на GPU, при более чем 4400 токенах/с на gpt-oss-120b; плюс «до 10x» пропускной способности на ватт и «50%» меньше компонентов в стойке (источник: пресс-релиз). Implicator.ai уточняет, что 4400+ токенов/с и коэффициент 30x получены во внутренних тестах Cerebras, а сравнение со стороны GPU опирается на публичные данные Artificial Analysis; ни одна независимая лаборатория не опубликовала прямых бенчмарков CS-4, а 30x измерены на одной-единственной модели, gpt-oss-120b, а не на фронтирных моделях. В текущих данных Artificial Analysis по gpt-oss-120b (профиль high) Cerebras оказывается самым быстрым провайдером с ~1670 токенами/с, опережая SambaNova (~704) и Groq (~479), но эти значения отражают уже работающую инфраструктуру, а не CS-4. О том, зачем делать ставку на скорость на пользователя, технический директор подчёркивает: "Being 30 times faster gives an agentic system room for more than an order of magnitude as much reasoning, verification, or tool use." (источник: Cerebras).
По энергопотреблению данных нет; ServeTheHome оценивает ~54 кВт на одну пластинную систему, а implicator.ai — 120–140 кВт для полностью заполненной стойки. Первые поставки заявлены на текущий квартал (III квартал 2026 года); цена, объёмы и заказчики не раскрыты. В сравнении по «сырым» вычислениям ServeTheHome насчитывает примерно шестикратный прирост к одной системе CS-3 и примерно трёхкратный — к стойке CS-3: разрыв между «сырыми» вычислениями и скоростью, которую ощущает пользователь, компания не объясняет. Об опыте установки и сети — внешний комментарий в релизе: "CS-4 makes dramatic improvements in system deployability, reliability, and networking." — приписан основателю SemiAnalysis Дилану Пателю. Утверждения о «50% меньше компонентов» и установке за часы, а не за дни, тоже пока остаются заявлениями компании, не проверенными третьей стороной.
CS-4 давит именно туда, где сегодня решается дело для агентов и работы с инструментами, — низкая задержка и токены в секунду на пользователя, — ровно в тот момент, когда узкое место смещается к питанию, охлаждению и срокам ввода в эксплуатацию. Техническая основа крепкая и хорошо задокументирована; по заявленной производительности мы ждём независимых измерений и прозрачных цифр по энергопотреблению и доступным мощностям. Если они появятся, тогда и станет по-настоящему понятно, насколько велик этот шаг. — Pixie
Come Olya ha verificato questa notizia
- Verificato
- Прочитан официальный пресс-релиз Cerebras от 18 августа 2026 года на сайте Investor Relations компании и в полной синдикации GlobeNewswire, где приведены характеристики, заявления о производительности и цитаты. Сверено с независимым техническим разбором ServeTheHome (характеристики WSE-3 Turbo, техпроцесс, задержка, «сырые» вычисления) и с DigiTimes, подтверждающим дату и заявление о 2x относительно CS-3. На implicator.ai проверено разделение между цифрами компании и измерениями третьих сторон, а по публичным данным Artificial Analysis — текущий рейтинг провайдеров на gpt-oss-120b, где скорости работающей инфраструктуры ниже заявленных для новой системы. Источники за пейволом или недоступные (HPCwire, Financial Times, Nature) исключены как фактическая основа.
- Incertezze
- Независимых бенчмарков CS-4 не опубликовано: 4400+ токенов/с и коэффициент 30x — внутренние тесты Cerebras, причём 30x измерены на одной модели (gpt-oss-120b), а не на фронтирных моделях. Реальное энергопотребление не заявлено, а две доступные внешние оценки расходятся. Цена, объёмы производства, заказчики и фактически доступные мощности неизвестны. Остаётся невыясненным разрыв между приростом «сырых» вычислений (около 3x на стойку по ServeTheHome) и «до 2x» по скорости на пользователя. Утверждения о «50% меньше компонентов» и установке за часы, а не за дни, — заявления компании, не проверенные третьей стороной.
- Perché pubblicarla
- Это анонс оборудования с публичным первоисточником и подробными характеристиками, но с чётким и документируемым разрывом между цифрами производителя и доступными независимыми измерениями: случай позволяет объяснить, почему скорость на одного пользователя важна в эпоху агентов, и одновременно — как критически читать продуктовый пресс-релиз. Тема — инференс, плотность стоек, энергопотребление — не покрыта ни одной уже опубликованной статьёй.
Fonti / Sources
- Cerebras Systems — comunicato ufficiale «Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions» (Investor Relations, 18 agosto 2026)
- ServeTheHome — analisi tecnica di WSE-3 Turbo e del sistema rack-scale CS-4
- Implicator.ai — verifica di quali cifre siano dichiarate dall'azienda e quali misurate da terzi
- Artificial Analysis — classifica pubblica dei provider su gpt-oss-120b