Beam, la respuesta occidental a los modelos abiertos chinos, llega sin los pesos
El anuncio es detallado como pocos. Reflection AI escribe que preentrenó Beam con 23,8 billones de tokens procedentes de la web y de conjuntos de datos propietarios con licencia, usando 6.144 GPU NVIDIA GB300 NVL72 durante menos de cuatro semanas con un goodput del 92,3 %; después, una fase de aprendizaje por refuerzo con más de 100 millones de rollouts en 10.500 GB300 durante otras cuatro semanas, unos 1.300 millones de sandboxes y alrededor de un millón de entornos de programación, agénticos y STEM. El contexto nativo es de 256.000 tokens, ampliado a un millón mediante un mid-training — una distinción que el blog sí hace y que TechCrunch, al dar solo la cifra del millón, no transmite. Unas cifras tan precisas tienen un efecto: se leen como verificación, cuando son una declaración. TechCrunch señala que nadie ha comprobado de forma independiente el rendimiento que se reivindica.
La afirmación central es la eficiencia: un rendimiento de razonamiento comparable al de GLM-5.2 de Z.ai con un cómputo de inferencia «3-4 veces menor». Merece la pena leer la nota metodológica que publica la propia Reflection: el cómputo se estima como FLOPs ≈ 2 × parámetros activos × tokens generados de media por intento, excluyendo el prefill, las operaciones de atención que dependen del contexto y el overhead de servicio. Es aritmética sobre los parámetros activos, no una medida de coste o latencia en un servidor real — y las partidas excluidas pesan en el coste real de quien ejecuta el modelo: por eso la estimación no dice cuánto se ahorra de verdad.
La tabla de benchmarks es más interesante de lo que exigiría un comunicado de lanzamiento, porque también muestra las derrotas. Beam queda por debajo de varios modelos abiertos chinos: SWE Bench Pro v2-Hard 77,2 frente a 84,3 de GLM 5.3 y 88,2 de Kimi K3; Terminal Bench v2.1 80,1 frente a 81,0 de GLM 5.2 y 90,6 de DeepSeek V4.1; HLE sin herramientas 36,2 frente a 46,9 de Kimi K3; GPQA Diamond 90,5 frente a 93,5 de Kimi K3. Donde gana con claridad es frente a los modelos occidentales: a Inkling en casi todos los apartados comparados, desde SWE Bench Pro v1, 65,5 frente a 54,3, hasta Terminal Bench v2.1, 80,1 frente a 63,8, y a Nemotron 3 Ultra en la mayoría de las pruebas. Varias celdas aparecen como «NR», puntuaciones no publicadas de los competidores, así que la comparación es parcial por construcción.
Reflection presenta Beam como un modelo «workhorse» para el trabajo diario de empresas, sector público y desarrolladores, distribuido a través de hyperscalers, neoclouds e integraciones en bibliotecas de código abierto. La empresa, fundada en 2024, según TechCrunch ha recaudado unos 4.700 millones de dólares con una valoración pre-money de 25.000 millones en su última ronda, cuenta entre sus inversores con Nvidia, Sequoia Capital y Lightspeed, y tiene acuerdos de cómputo por más de 7.000 millones en total con SpaceX y Nebius para chips GB300 hasta 2029.
Lo que vigilo es la distancia entre lo que es público hoy y lo que se promete. Hoy hay una entrada de blog sin firma, una tabla elaborada por la empresa y una lista de espera en platform.reflection.ai; los pesos, la licencia Apache 2.0, la documentación y el stack para ejecutar, evaluar y hacer fine-tuning son compromisos fechados «más adelante este mes». Mientras tanto, los modelos abiertos chinos con los que Beam se compara ya están disponibles, y cualquiera puede rehacer las cuentas con ellos. Es una diferencia que ningún benchmark registra: publicar los pesos significa dar a los demás la herramienta para desmentirte. Hasta entonces, la frase correcta no es «Beam es competitivo», sino «Reflection dice que Beam es competitivo» — y la distancia entre ambas se mide en días de octubre.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Leí la entrada oficial de Reflection AI (reflection.ai/blog/introducing-beam) y extraje especificaciones, licencia, plazos de lanzamiento, método de estimación del cómputo y la tabla completa de benchmarks. TechCrunch (5/10/2026) confirmó de forma independiente los parámetros, los tokens de entrenamiento, el compromiso de publicar los pesos en octubre, la cifra de «3-4 veces» y la falta de verificación independiente. Axios (4/10/2026) había adelantado el lanzamiento, pero la página no era accesible y solo la usé como indicio. Las fuentes discrepan sobre el contexto: TechCrunch da 1 millón de tokens; el blog, 256.000 nativos ampliados a 1 millón. Los datos de financiación y acuerdos de cómputo proceden de TechCrunch, no de la empresa.
- Incertezze
- Los pesos aún no se han publicado: la licencia Apache 2.0 y la fecha («más adelante este mes») son solo compromisos. Todos los benchmarks son de la empresa y nadie los ha verificado de forma independiente; muchas celdas «NR» dejan los comparativos incompletos. Lo de «3-4 veces menos cómputo» es una estimación teórica en FLOPs, no una medida de coste ni de latencia. En varias pruebas, la propia tabla sitúa a Beam por debajo de GLM 5.3, Kimi K3 y DeepSeek V4.1. El contexto de un millón de tokens se obtiene con un mid-training: el nativo es de 256.000. La entrada no está firmada.
- Perché pubblicarla
- Es el primer modelo de frontera de pesos abiertos de una de las startups occidentales con más financiación (unos 4.700 millones recaudados), anunciado con una licencia realmente permisiva, Apache 2.0, y toca la competencia entre EE. UU. y China en modelos abiertos. Se puede contar con rigor: la tabla de la empresa muestra también dónde Beam se queda atrás, y los pesos aún faltan. No lo habíamos tratado antes.