Muse Spark 1.3: Meta przyspiesza w wydajności i agentach, ale benchmarki zostają w domu
Meta zaprezentowała Muse Spark 1.3 2 września — zapowiedź wpisuje się w gęstą sekwencję: to trzecie wydanie zamkniętej rodziny modeli w niecałe dwa miesiące. Według firmy model jest dostępny «od dziś» w Muse Code i w Meta Model API, tryby rozumowania są już włączone, a tryb «max reasoning» ma pojawić się «wkrótce po zakończeniu dalszych testów bezpieczeństwa». Prezes Mark Zuckerberg mówił o «wydajności z granicy możliwości przy niskim koszcie» (Investing.com), a cytowany przez OfficeChai — o «największym pojedynczym skoku, jaki zespół wykonał w pracy nad kodem i agentami».
W zestawieniu opublikowanym przez Metę — którego liczby zamknięte są w obrazku i zostały odczytane oraz podane przez OfficeChai i Investing.com — wersja 1.3 ogranicza wywołania narzędzi o około 20%, a zużycie tokenów o około 25% w porównaniu z Muse Spark 1.2. W samodzielnie zadeklarowanych benchmarkach, zestawiających model z wersjami «max» konkurencji, w programowaniu 1.3 wyprzedza Opus 5 na DeepSWE v1.1 (75,4 do 74,0) i pokonuje go na SWEAtlas CodeBase QnA (59,4 do 52,7), a na Terminal-Bench 2.1 pozostaje na równi z GPT 5.6 Sol (88,8). W długim kontekście dane pokazują 98,5 i 98,1 w MRCR 256K–512K oraz 512K–1M, wobec 91,5 i 73,8 dla GPT 5.6 Sol Max. Wyniki w zadaniach agentowych pozostają jednak niejednoznaczne: GDPVal-AA v2 1754 wobec 1824 dla Opus 5 Max, AutomationBench 49,4 wobec 50,3 dla Opus 5 Max, DeepSearchQA 89,4 wobec 93,0 dla GPT 5.6 Sol Max.
Oficjalna zapowiedź nie wyjaśnia metodologii: benchmarki opublikowano jako obrazek, a nie tekst możliwy do odczytania, i nie ma śladu ich powtórzenia przez niezależnych ewaluatorów. Brakuje jakichkolwiek informacji o konfiguracji testów (liczba prób, scaffolding, wersje konkurencyjnych modeli), a procenty oszczędności nie są wprost powiązane z tymi samymi zadaniami co benchmarki. Mapa drogowa wspomina o większych modelach i przyszłym wydaniu z otwartymi wagami — bez dat, licencji i specyfikacji technicznych.
Według Investing.com akcje Mety zamknęły się po zapowiedzi wzrostem o 2,47%, ale twierdzenia o «niskim koszcie» pozostają handlowe: cennik nie został upubliczniony. Okno kontekstu o wielkości miliona tokenów, przypisywane linii Muse Spark przez Wikipedię, nie jest potwierdzone w zapowiedzi wersji 1.3.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Oficjalna zapowiedź została otwarta przez WebFetch na research.meta.ai i sprawdzona bezpośrednio: data, dostępność w Muse Code i Meta Model API, stan trybów rozumowania, dwa procenty oszczędności (~20% wywołań narzędzi, ~25% tokenów), stwierdzenia o odporności na ataki i o działaniach nieodwracalnych, wzmianka o przyszłym wydaniu z otwartymi wagami oraz struktura tabeli benchmarków. Ponieważ wyniki są w obrazku, pobrano je z dwóch niezależnych od siebie źródeł — OfficeChai (pełne tabele) i Investing.com (agencja finansowa) — które podają te same wartości dla DeepSWE v1.1, Terminal-Bench 2.1, MRCR i GDPVal-AA v2. Historię wersji i licencje skrzyżowano z hasłem Wikipedii «Muse Spark». Źródła oparte wyłącznie na plotkach odrzucono.
- Incertezze
- Benchmarki są deklaracją samej Mety i żaden niezależny ewaluator ich nie powtórzył; znajdują się w obrazku, więc podane tu liczby przechodzą przez odczyt dokonany przez media trzecie — zgodne ze sobą, lecz niemożliwe do zweryfikowania w tekście strony Mety. Cennika brak: «niski koszt» to twierdzenie handlowe, nie zweryfikowana stawka. W sprawie otwartych wag Meta nie podaje ani daty, ani licencji, ani rozmiaru modeli. Nie zadeklarowano konfiguracji testów (liczby prób, scaffoldingu, wersji konkurentów) ani tego, czy procenty oszczędności zmierzono na tym samym zestawie zadań co benchmarki. Okno miliona tokenów pochodzi z Wikipedii, nie z zapowiedzi 1.3. Reakcja giełdy i cytaty Zuckerberga są poza oficjalną zapowiedzią i pochodzą ze źródeł wtórnych.
- Perché pubblicarla
- To wydanie z pierwszej linii, udokumentowane oficjalną zapowiedzią, z konkretnymi liczbami i rzadko podejmowanym wątkiem: deklarowana przewaga leży nie w punktach, lecz w koszcie uruchamiania agentów — mniej wywołań, mniej tokenów — czyli w mierze, która naprawdę liczy się dla tych, którzy wdrażają je produkcyjnie. Obraz jest uczciwy właśnie dlatego, że nie jest triumfem: Meta prowadzi w długim kontekście i w części zadań programistycznych, ale w kilku benchmarkach agentowych zostaje za Opus 5 i GPT 5.6 Sol. A otwarte wagi obiecane bez daty i bez licencji trzeba pokazać takimi, jakie są.