中国のオープンモデルへの西側の回答「Beam」、重みなしで登場
発表は珍しいほど詳細だ。Reflection AIによれば、Beamはウェブとライセンス取得済みの独自データセットから集めた23.8兆トークンで事前学習され、6,144基のNVIDIA GB300 NVL72 GPUを4週間足らず使い、グッドプットは92.3%だった。続いて強化学習フェーズがさらに4週間、10,500基のGB300上で1億回超のロールアウト、約13億のサンドボックス、約100万のコーディング・エージェント・STEM環境を使って行われたという。ネイティブのコンテキストは25万6千トークンで、ミッドトレーニングによって100万に拡張されている。ブログはこの区別を明記しているが、100万という数字だけを報じたTechCrunchからは伝わらない。ここまで具体的な数字には効果がある。検証済みのように読めてしまうが、実際は自己申告だ。TechCrunchは、主張された性能を誰も独立に確認していないと指摘している。
中心となる主張は効率だ。Z.aiのGLM-5.2に匹敵する推論性能を、「3〜4分の1」の推論計算量で実現するという。ここはReflection自身が公開している方法論の注記を読む価値がある。計算量は FLOPs ≈ 2 × アクティブパラメータ × 1回の試行あたりの平均生成トークン数 として見積もられ、プレフィル、コンテキストに依存するアテンション演算、サービングのオーバーヘッドは除外されている。これはアクティブパラメータに基づく算術であって、実際のサーバーでのコストやレイテンシの測定ではない。そして除外された項目こそ、モデルを動かす側の実コストに効いてくる。だからこの見積もりからは、実際にどれだけ節約できるかはわからない。
ベンチマーク表は、ローンチ発表として求められる以上に興味深い。負けも載っているからだ。Beamは複数の中国製オープンモデルを下回っている。SWE Bench Pro v2-HardではGLM 5.3の84.3、Kimi K3の88.2に対し77.2。Terminal Bench v2.1ではGLM 5.2の81.0、DeepSeek V4.1の90.6に対し80.1。ツールなしのHLEではKimi K3の46.9に対し36.2。GPQA DiamondではKimi K3の93.5に対し90.5。はっきり勝っているのは西側のモデルに対してだ。Inklingには比較項目のほぼすべてで上回り、SWE Bench Pro v1の65.5対54.3からTerminal Bench v2.1の80.1対63.8まで差がある。Nemotron 3 Ultraにも大半のテストで勝っている。いくつかのセルは「NR」、つまり競合のスコアが報告されておらず、比較は構造的に部分的なものになっている。
ReflectionはBeamを、企業・公共部門・開発者の日常業務を担う「ワークホース」モデルと位置づけ、ハイパースケーラー、ネオクラウド、オープンソースライブラリへの統合を通じて提供するとしている。TechCrunchによると、2024年創業の同社は直近のラウンドでプレマネー評価額250億ドルで約47億ドルを調達し、Nvidia、Sequoia Capital、Lightspeedが出資者に名を連ねる。さらにSpaceXおよびNebiusと、2029年までのGB300チップについて総額70億ドル超の計算資源契約を結んでいる。
私が注目しているのは、今日公開されているものと約束されているものとの差だ。現時点にあるのは署名のないブログ記事、同社がまとめた表、そしてplatform.reflection.aiのウェイティングリストだけ。重み、Apache 2.0ライセンス、ドキュメント、そして実行・評価・ファインチューニングのためのスタックは、いずれも「今月中に」と日付の付いた約束だ。一方、Beamが比較対象にしている中国のオープンモデルはすでに公開されていて、誰でも自分で検証し直せる。これはどのベンチマークにも記録されない違いだ。重みを公開するとは、自分を反証する道具を他者に手渡すことなのだから。それまでは、使うべき文は「Beamは競争力がある」ではなく「Reflectionは、Beamに競争力があると言っている」だ。その二つの距離は、10月の日数で測られる。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Reflection AIの公式記事(reflection.ai/blog/introducing-beam)を読み、仕様、ライセンス、公開時期、計算量の推定方法、ベンチマーク表全体を抽出しました。TechCrunch(2026年10月5日)で、パラメータ数、学習トークン数、10月中の重み公開の約束、「3〜4倍」の主張、独立検証がないことを別途確認しました。Axios(2026年10月4日)は発表を事前に報じていましたが、ページにアクセスできなかったため、手がかりとしてのみ扱いました。コンテキスト長は情報源で食い違っています。TechCrunchは100万トークン、ブログはネイティブ25万6千を100万に拡張としています。資金調達と計算資源契約のデータはTechCrunchによるもので、同社の一次情報ではありません。
- Incertezze
- 重みはまだ公開されていません。Apache 2.0ライセンスと時期(「今月中に」)は約束にすぎません。ベンチマークはすべて同社によるもので、独立した検証はされていません。「NR」のセルが多く、比較は不完全です。「計算量3〜4分の1」はFLOPsによる理論上の推定で、コストやレイテンシの実測ではありません。複数のテストで、同社自身の表がBeamをGLM 5.3、Kimi K3、DeepSeek V4.1より下に置いています。100万トークンのコンテキストはミッドトレーニングによるもので、ネイティブは25万6千です。記事に署名はありません。
- Perché pubblicarla
- 西側で最も資金力のあるスタートアップの一つ(約47億ドルを調達)による初のオープンウェイトのフロンティアモデルで、本当に寛容なApache 2.0ライセンスでの公開が予告されており、オープンモデルをめぐる米中競争という中心的なテーマに関わります。厳密に伝えることができます。同社の表自体がBeamの劣る点も示しており、重みはまだありません。これまでの記事では扱っていませんでした。