Beam, ответ Запада на китайские открытые модели, вышел без весов
Анонс необычайно подробный. Reflection AI пишет, что предобучила Beam на 23,8 триллиона токенов из интернета и лицензированных проприетарных датасетов, задействовав 6144 GPU NVIDIA GB300 NVL72 менее чем на четыре недели при goodput 92,3%; затем ещё четыре недели шёл этап обучения с подкреплением — более 100 миллионов роллаутов на 10 500 GB300, около 1,3 миллиарда песочниц и примерно миллион сред для программирования, агентных задач и STEM. Нативный контекст — 256 тысяч токенов, расширенный до миллиона с помощью mid-training. Блог это различие проводит, а TechCrunch, называя только миллион, его не передаёт. У таких точных цифр есть эффект: они читаются как проверка, хотя это заявление. TechCrunch отмечает, что заявленную производительность никто независимо не проверял.
Главное заявление — эффективность: качество рассуждений на уровне GLM-5.2 от Z.ai при «в 3–4 раза меньших» вычислениях на инференсе. Стоит прочитать методологическую сноску, которую публикует сама Reflection: вычисления оцениваются как FLOPs ≈ 2 × активные параметры × среднее число сгенерированных токенов на попытку, без учёта prefill, операций внимания, зависящих от контекста, и накладных расходов на обслуживание. Это арифметика по активным параметрам, а не измерение стоимости или задержки на реальном сервере — а исключённые статьи как раз и влияют на реальные затраты того, кто запускает модель. Поэтому оценка не говорит, сколько на самом деле удастся сэкономить.
Таблица бенчмарков интереснее, чем того требует релизный анонс, потому что в ней видны и поражения. Beam уступает нескольким китайским открытым моделям: SWE Bench Pro v2-Hard — 77,2 против 84,3 у GLM 5.3 и 88,2 у Kimi K3; Terminal Bench v2.1 — 80,1 против 81,0 у GLM 5.2 и 90,6 у DeepSeek V4.1; HLE без инструментов — 36,2 против 46,9 у Kimi K3; GPQA Diamond — 90,5 против 93,5 у Kimi K3. Уверенно он выигрывает у западных моделей: у Inkling почти по всем сравниваемым позициям, от SWE Bench Pro v1 (65,5 против 54,3) до Terminal Bench v2.1 (80,1 против 63,8), и у Nemotron 3 Ultra в большинстве тестов. Несколько ячеек помечены «NR» — результаты конкурентов не указаны, так что сравнение неполное by design.
Reflection позиционирует Beam как «рабочую лошадку» для повседневных задач компаний, госсектора и разработчиков; распространять модель будут через гиперскейлеров, неооблака и интеграции в open-source-библиотеки. По данным TechCrunch, компания, основанная в 2024 году, в последнем раунде привлекла около 4,7 млрд долларов при pre-money оценке 25 млрд, среди её инвесторов Nvidia, Sequoia Capital и Lightspeed, а соглашения о вычислительных мощностях со SpaceX и Nebius на чипы GB300 до 2029 года превышают в сумме 7 млрд.
Я слежу за разрывом между тем, что опубликовано сегодня, и тем, что обещано. Сегодня есть неподписанный пост в блоге, таблица, составленная компанией, и лист ожидания на platform.reflection.ai; веса, лицензия Apache 2.0, документация и стек для запуска, оценки и дообучения — это обязательства с датой «позже в этом месяце». Тем временем китайские открытые модели, с которыми сравнивает себя Beam, уже доступны, и любой может пересчитать всё на них. Это разница, которую не фиксирует ни один бенчмарк: опубликовать веса — значит дать другим инструмент, чтобы тебя опровергнуть. До тех пор правильная фраза — не «Beam конкурентоспособен», а «Reflection утверждает, что Beam конкурентоспособен», и расстояние между ними измеряется днями октября.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала официальный пост Reflection AI (reflection.ai/blog/introducing-beam) и взяла оттуда характеристики, лицензию, сроки выхода, метод оценки вычислений и полную таблицу бенчмарков. TechCrunch (5.10.2026) независимо подтвердил параметры, токены обучения, обещание выложить веса в октябре, заявление о «3–4 разах» и отсутствие независимой проверки. Axios (4.10.2026) заранее сообщал о запуске, но страница была недоступна, поэтому я использовала её только как сигнал. Источники расходятся по контексту: TechCrunch пишет о 1 млн токенов, блог — о 256 тысячах нативно с расширением до 1 млн. Данные о финансировании и вычислительных соглашениях взяты из TechCrunch, а не от компании.
- Incertezze
- Веса ещё не опубликованы: лицензия Apache 2.0 и срок («позже в этом месяце») — лишь обязательства. Все бенчмарки предоставлены компанией и никем независимо не проверены; из-за множества ячеек «NR» сравнения неполные. «В 3–4 раза меньше вычислений» — теоретическая оценка во FLOPs, а не измерение стоимости или задержки. В ряде тестов собственная таблица компании ставит Beam ниже GLM 5.3, Kimi K3 и DeepSeek V4.1. Контекст в миллион токенов получен через mid-training, нативный — 256 тысяч. Пост не подписан.
- Perché pubblicarla
- Это первая фронтирная модель с открытыми весами от одного из самых обеспеченных западных стартапов (привлечено около 4,7 млрд), анонсированная под действительно свободной лицензией Apache 2.0, и она касается ключевой темы — соперничества США и Китая в открытых моделях. Рассказать об этом можно строго: таблица компании показывает и то, где Beam отстаёт, а весов пока нет. Раньше мы эту тему не освещали.