Beam, a resposta ocidental aos modelos abertos chineses, chega sem os pesos
O anúncio é detalhado como poucos. A Reflection AI escreve que pré-treinou o Beam com 23,8 trilhões de tokens vindos da web e de conjuntos de dados proprietários licenciados, usando 6.144 GPUs NVIDIA GB300 NVL72 por menos de quatro semanas, com goodput de 92,3%; depois veio uma fase de aprendizado por reforço com mais de 100 milhões de rollouts em 10.500 GB300 por mais quatro semanas, cerca de 1,3 bilhão de sandboxes e perto de um milhão de ambientes de programação, agênticos e STEM. O contexto nativo é de 256 mil tokens, levado a um milhão com um mid-training — distinção que o blog faz e que o TechCrunch, ao citar só o número de um milhão, não transmite. Números tão específicos têm um efeito: são lidos como verificação, quando são declaração. O TechCrunch observa que ninguém conferiu de forma independente o desempenho alegado.
A alegação central é a eficiência: desempenho de raciocínio comparável ao GLM-5.2 da Z.ai com um custo computacional de inferência ‘3 a 4 vezes menor’. Vale ler a nota metodológica que a própria Reflection publica: o cálculo é estimado como FLOPs ≈ 2 × parâmetros ativos × tokens gerados em média por tentativa, excluindo o prefill, as operações de atenção que dependem do contexto e o overhead de serving. É aritmética sobre parâmetros ativos, não uma medida de custo ou latência em um servidor real — e os itens excluídos pesam no custo real de quem roda o modelo: por isso a estimativa não diz quanto se economiza de verdade.
A tabela de benchmarks é mais interessante do que um comunicado de lançamento exigiria, porque mostra também as derrotas. O Beam fica abaixo de vários modelos abertos chineses: SWE Bench Pro v2-Hard 77,2 contra 84,3 do GLM 5.3 e 88,2 do Kimi K3; Terminal Bench v2.1 80,1 contra 81,0 do GLM 5.2 e 90,6 do DeepSeek V4.1; HLE sem ferramentas 36,2 contra 46,9 do Kimi K3; GPQA Diamond 90,5 contra 93,5 do Kimi K3. Onde vence com folga é contra os modelos ocidentais: contra o Inkling em quase todos os itens comparados, do SWE Bench Pro v1, 65,5 contra 54,3, ao Terminal Bench v2.1, 80,1 contra 63,8, e contra o Nemotron 3 Ultra na maior parte dos testes. Várias células aparecem como ‘NR’, pontuações não informadas para os concorrentes, então a comparação é parcial por construção.
A Reflection apresenta o Beam como um modelo ‘workhorse’ para o trabalho diário de empresas, setor público e desenvolvedores, distribuído por hyperscalers, neoclouds e integrações em bibliotecas open source. Fundada em 2024, a empresa, segundo o TechCrunch, captou cerca de 4,7 bilhões de dólares com uma avaliação pre-money de 25 bilhões na última rodada, tem entre os investidores Nvidia, Sequoia Capital e Lightspeed, e fechou acordos de computação de mais de 7 bilhões no total com a SpaceX e a Nebius para chips GB300 até 2029.
O que eu observo é a distância entre o que é público hoje e o que é prometido. Hoje existe um post de blog sem assinatura, uma tabela montada pela empresa e uma lista de espera em platform.reflection.ai; os pesos, a licença Apache 2.0, a documentação e o stack para executar, avaliar e fazer fine-tuning são compromissos com a data ‘ainda este mês’. Enquanto isso, os modelos abertos chineses com os quais o Beam se compara já estão disponíveis, e qualquer pessoa pode refazer as contas com eles. É uma diferença que nenhum benchmark registra: publicar os pesos significa entregar aos outros a ferramenta para te desmentir. Até lá, a frase a usar não é ‘o Beam é competitivo’, e sim ‘a Reflection diz que o Beam é competitivo’ — e a distância entre as duas se mede em dias de outubro.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Li o post oficial da Reflection AI (reflection.ai/blog/introducing-beam) e extraí especificações, licença, prazos de lançamento, método de estimativa de computação e a tabela completa de benchmarks. O TechCrunch (5/10/2026) confirmou de forma independente os parâmetros, os tokens de treinamento, o compromisso de publicar os pesos em outubro, a alegação de ‘3 a 4 vezes’ e a ausência de verificação independente. O Axios (4/10/2026) havia antecipado o lançamento, mas a página estava inacessível; usei-a apenas como sinal. As fontes divergem sobre o contexto: o TechCrunch fala em 1 milhão de tokens, o blog em 256 mil nativos estendidos a 1 milhão. Os dados de captação e acordos de computação vêm do TechCrunch, não da empresa.
- Incertezze
- Os pesos ainda não foram publicados: a licença Apache 2.0 e a data (‘ainda este mês’) são apenas compromissos. Todos os benchmarks vêm da empresa e ninguém os verificou de forma independente; muitas células ‘NR’ deixam as comparações incompletas. O ‘3 a 4 vezes menos computação’ é uma estimativa teórica em FLOPs, não uma medida de custo nem de latência. Em vários testes, a própria tabela da empresa coloca o Beam abaixo do GLM 5.3, do Kimi K3 e do DeepSeek V4.1. O contexto de um milhão de tokens vem de um mid-training: o nativo é de 256 mil. O post não é assinado.
- Perché pubblicarla
- É o primeiro modelo de fronteira com pesos abertos de uma das startups ocidentais mais bem financiadas (cerca de 4,7 bilhões captados), anunciado com uma licença realmente permissiva, a Apache 2.0, e toca na disputa EUA–China pelos modelos abertos. Dá para contar com rigor: a tabela da empresa mostra também onde o Beam fica para trás, e os pesos ainda faltam. Ainda não tínhamos tratado do tema.