Muse Spark 1.3:Metaは効率とエージェントで加速、ただしベンチマークは自社発表のまま
Metaは9月2日、Muse Spark 1.3を発表した。自社モデル群としては2か月足らずで3度目のリリースという、間隔の詰まった発表である。同社によれば、モデルは「本日から」Muse CodeとMeta Model APIで利用でき、推論モードはすでに有効、「max reasoning」モードは「追加の安全性テストが完了した直後」に提供されるという。マーク・ザッカーバーグ最高経営責任者は「低コストでのフロンティア性能」と述べ(Investing.com)、OfficeChaiが引用したところでは「コードとエージェント業務においてチームが成し遂げた最大の一歩」だと語った。
Metaが公開した一覧表 —— 数値は画像に埋め込まれており、OfficeChaiとInvesting.comが読み取って報じた —— によれば、1.3はMuse Spark 1.2に比べてツール呼び出しを約20%、消費トークンを約25%削減する。競合の「max」版と比較した自己申告のベンチマークでは、コーディングのDeepSWE v1.1で1.3がOpus 5を上回り(75.4対74.0)、SWEAtlas CodeBase QnAでも上回る(59.4対52.7)。一方、Terminal-Bench 2.1ではGPT 5.6 Solと並ぶ(88.8)。ロングコンテキストではMRCR 256K–512Kと512K–1Mで98.5と98.1を示し、GPT 5.6 Sol Maxの91.5と73.8を上回る。ただしエージェント系のスコアはまちまちだ。GDPVal-AA v2は1754でOpus 5 Maxの1824に届かず、AutomationBenchは49.4対50.3、DeepSearchQAは89.4でGPT 5.6 Sol Maxの93.0に及ばない。
公式発表は方法論を明らかにしていない。ベンチマークは抽出可能なテキストではなく画像として公開されており、独立した評価者による再現も確認されていない。試行回数、スキャフォールディング、競合モデルのバージョンといったテスト条件の記載は一切なく、効率の改善率がベンチマークと同じタスクで測られたものかも明示されていない。ロードマップはより大規模なモデルと将来のオープンウェイト公開に触れているが、日付もライセンスも技術仕様も示していない。
Investing.comによれば、発表後のMeta株は2.47%高で引けた。しかし「低コスト」という主張は営業上のものにとどまる。価格表が公開されていないからだ。Wikipediaがミューズ・スパークのシリーズに帰している100万トークンのコンテキストウィンドウも、1.3の発表では確認されていない。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 公式発表をWebFetchでresearch.meta.aiから開き、日付、Muse CodeとMeta Model APIでの提供状況、推論モードの状態、二つの効率改善率(ツール呼び出し約20%、トークン約25%)、敵対的堅牢性と不可逆な操作に関する記述、将来のオープンウェイト公開への言及、ベンチマーク表の構成を直接確認した。スコアは画像の中にあるため、互いに独立した二つの媒体 —— OfficeChai(完全な表)とInvesting.com(金融通信社)—— から取得し、DeepSWE v1.1、Terminal-Bench 2.1、MRCR、GDPVal-AA v2で同じ値であることを確かめた。バージョン履歴とライセンスはWikipediaの「Muse Spark」の項目と照合した。憶測のみを伝える情報源は採用していない。
- Incertezze
- ベンチマークはMetaの自己申告で、独立した評価者による再現は確認されていない。数値は画像内にあるため、ここで示した値は第三者媒体の読み取りを経ている。媒体どうしは一致しているが、Metaのページ本文では検証できない。価格表は掲載されておらず、「低コスト」は営業上の主張であって確認された料金ではない。オープンウェイトについてMetaは日付もライセンスもモデルの規模も示していない。テスト条件(試行回数、スキャフォールディング、競合のバージョン)も、効率改善率がベンチマークと同じタスク群で測られたかも明示がない。100万トークンのコンテキストウィンドウはWikipedia由来で、1.3の発表にはない。株価の反応とザッカーバーグの発言は公式発表の外にあり、二次情報にもとづく。
- Perché pubblicarla
- 公式発表に裏づけられたフロンティア級のリリースで、具体的な数字があり、しかも語られることの少ない切り口がある。主張されている優位はスコアではなく、エージェントを動かすコスト —— 呼び出しが少なく、トークンが少ない —— にある。実運用に載せる側にとって本当に効くのはこの指標だ。この記事が誠実でいられるのは、それが勝利宣言ではないからでもある。Metaはロングコンテキストとコーディングの一部で先行するが、いくつかのエージェント系ベンチマークではOpus 5とGPT 5.6 Solの後ろにいる。そして日付もライセンスもないオープンウェイトの約束は、その通りのものとして読者に示されるべきだ。