Beam, die westliche Antwort auf Chinas offene Modelle, kommt ohne Gewichte
Die Ankündigung ist so detailliert wie selten. Reflection AI schreibt, Beam auf 23,8 Billionen Tokens aus dem Web und aus lizenzierten proprietären Datensätzen vortrainiert zu haben, mit 6.144 NVIDIA-GPUs vom Typ GB300 NVL72 in weniger als vier Wochen bei einem Goodput von 92,3 %; danach folgte eine Reinforcement-Learning-Phase mit über 100 Millionen Rollouts auf 10.500 GB300 über weitere vier Wochen, rund 1,3 Milliarden Sandboxes und etwa einer Million Coding-, Agenten- und STEM-Umgebungen. Der native Kontext umfasst 256.000 Tokens, per Mid-Training auf eine Million erweitert – eine Unterscheidung, die der Blog macht und die TechCrunch, das nur die Million nennt, nicht weitergibt. So präzise Zahlen haben eine Wirkung: Sie lesen sich wie eine Überprüfung, sind aber eine Behauptung. TechCrunch merkt an, dass niemand die beanspruchte Leistung unabhängig geprüft hat.
Die zentrale Behauptung ist Effizienz: Reasoning-Leistung vergleichbar mit GLM-5.2 von Z.ai bei ‚drei- bis viermal weniger‘ Rechenaufwand in der Inferenz. Es lohnt sich, die methodische Anmerkung zu lesen, die Reflection selbst veröffentlicht: Der Rechenaufwand wird geschätzt als FLOPs ≈ 2 × aktive Parameter × durchschnittlich generierte Tokens pro Versuch, ohne Prefill, kontextabhängige Attention-Operationen und Serving-Overhead. Das ist Arithmetik mit aktiven Parametern, keine Messung von Kosten oder Latenz auf einem echten Server – und gerade die ausgeklammerten Posten belasten die realen Kosten derer, die das Modell betreiben. Deshalb sagt die Schätzung nicht, wie viel man tatsächlich spart.
Die Benchmark-Tabelle ist interessanter, als es eine Launch-Mitteilung erfordern würde, denn sie zeigt auch die Niederlagen. Beam liegt hinter mehreren offenen chinesischen Modellen: SWE Bench Pro v2-Hard 77,2 gegenüber 84,3 bei GLM 5.3 und 88,2 bei Kimi K3; Terminal Bench v2.1 80,1 gegenüber 81,0 bei GLM 5.2 und 90,6 bei DeepSeek V4.1; HLE ohne Tools 36,2 gegenüber 46,9 bei Kimi K3; GPQA Diamond 90,5 gegenüber 93,5 bei Kimi K3. Deutlich vorn liegt es gegenüber westlichen Modellen: gegen Inkling bei fast allen verglichenen Werten, von SWE Bench Pro v1 mit 65,5 zu 54,3 bis Terminal Bench v2.1 mit 80,1 zu 63,8, und gegen Nemotron 3 Ultra in den meisten Tests. Mehrere Zellen stehen auf ‚NR‘, also nicht berichtete Werte der Konkurrenz – der Vergleich ist damit schon von der Anlage her unvollständig.
Reflection positioniert Beam als ‚Workhorse‘-Modell für die tägliche Arbeit von Unternehmen, öffentlichem Sektor und Entwicklern, vertrieben über Hyperscaler, Neoclouds und Integrationen in Open-Source-Bibliotheken. Das 2024 gegründete Unternehmen hat laut TechCrunch in der letzten Runde rund 4,7 Milliarden Dollar bei einer Pre-Money-Bewertung von 25 Milliarden eingesammelt, zählt Nvidia, Sequoia Capital und Lightspeed zu seinen Investoren und hat Rechenverträge über insgesamt mehr als 7 Milliarden mit SpaceX und Nebius für GB300-Chips bis 2029.
Worauf ich achte, ist die Lücke zwischen dem, was heute öffentlich ist, und dem, was versprochen wird. Heute gibt es einen Blogpost ohne Autorenangabe, eine vom Unternehmen erstellte Tabelle und eine Warteliste auf platform.reflection.ai; die Gewichte, die Apache-2.0-Lizenz, die Dokumentation und der Stack zum Ausführen, Evaluieren und Fine-Tuning sind Zusagen mit dem Datum ‚später in diesem Monat‘. Die offenen chinesischen Modelle, mit denen sich Beam misst, sind dagegen schon verfügbar, und an ihnen kann jeder nachrechnen. Diesen Unterschied erfasst kein Benchmark: Gewichte zu veröffentlichen heißt, anderen das Werkzeug in die Hand zu geben, um einen zu widerlegen. Bis dahin lautet der richtige Satz nicht ‚Beam ist wettbewerbsfähig‘, sondern ‚Reflection sagt, Beam sei wettbewerbsfähig‘ – und der Abstand zwischen beiden misst sich in Oktobertagen.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ich habe den offiziellen Beitrag von Reflection AI (reflection.ai/blog/introducing-beam) gelesen und daraus Spezifikationen, Lizenz, Zeitplan, Methode der Rechenschätzung und die vollständige Benchmark-Tabelle entnommen. TechCrunch (5.10.2026) hat Parameter, Trainingstokens, die Zusage zur Veröffentlichung der Gewichte im Oktober, die ‚3-4x‘-Angabe und das Fehlen unabhängiger Prüfungen unabhängig bestätigt. Axios (4.10.2026) hatte den Launch vorab gemeldet, die Seite war aber nicht abrufbar; ich habe sie nur als Hinweis genutzt. Beim Kontext weichen die Quellen ab: TechCrunch nennt 1 Million Tokens, der Blog 256.000 nativ, erweitert auf 1 Million. Finanzierung und Rechenverträge stammen von TechCrunch, nicht vom Unternehmen.
- Incertezze
- Die Gewichte sind noch nicht veröffentlicht: Apache-2.0-Lizenz und Termin (‚später in diesem Monat‘) sind nur Zusagen. Alle Benchmarks stammen vom Unternehmen und wurden nicht unabhängig geprüft; viele ‚NR‘-Zellen machen die Vergleiche lückenhaft. ‚3- bis 4-mal weniger Rechenaufwand‘ ist eine theoretische FLOPs-Schätzung, keine Messung von Kosten oder Latenz. In mehreren Tests liegt Beam laut der eigenen Tabelle hinter GLM 5.3, Kimi K3 und DeepSeek V4.1. Der Kontext von 1 Million Tokens entsteht durch Mid-Training; nativ sind es 256.000. Der Beitrag nennt keinen Autor.
- Perché pubblicarla
- Es ist das erste Frontier-Modell mit offenen Gewichten eines der am besten finanzierten westlichen Startups (rund 4,7 Milliarden Dollar eingesammelt), angekündigt unter einer wirklich freizügigen Lizenz, Apache 2.0, und es berührt den Wettlauf zwischen USA und China bei offenen Modellen. Es lässt sich sauber erzählen: Die Tabelle des Unternehmens zeigt auch, wo Beam zurückliegt, und die Gewichte fehlen noch. Wir hatten das Thema bisher nicht behandelt.