Muse Spark 1.3: 메타, 효율과 에이전트에서 속도를 내다 — 다만 벤치마크는 자체 발표
메타는 9월 2일 Muse Spark 1.3을 공개했다. 두 달이 채 안 되는 사이 자사 모델 계열의 세 번째 릴리스로, 발표 간격이 매우 촘촘하다. 회사에 따르면 모델은 「오늘부터」 Muse Code와 Meta Model API에서 사용할 수 있고, 추론 모드는 이미 켜져 있으며 「max reasoning」 모드는 「추가 안전성 테스트가 끝난 직후」 제공될 예정이다. 마크 저커버그 최고경영자는 「낮은 비용의 프런티어 성능」이라고 말했고(Investing.com), OfficeChai가 인용한 바로는 「팀이 코드와 에이전트 작업에서 이뤄낸 가장 큰 단일 도약」이라고 표현했다.
메타가 공개한 표 — 수치가 이미지 안에 들어 있어 OfficeChai와 Investing.com이 읽어 보도했다 — 에 따르면 1.3은 Muse Spark 1.2 대비 도구 호출을 약 20%, 소비 토큰을 약 25% 줄인다. 경쟁사의 「max」 버전과 비교한 자체 발표 벤치마크에서, 코딩의 DeepSWE v1.1은 1.3이 Opus 5를 앞서고(75.4 대 74.0), SWEAtlas CodeBase QnA에서도 앞선다(59.4 대 52.7). 반면 Terminal-Bench 2.1에서는 GPT 5.6 Sol과 동률이다(88.8). 롱컨텍스트에서는 MRCR 256K–512K와 512K–1M에서 98.5와 98.1을 기록해 GPT 5.6 Sol Max의 91.5와 73.8을 넘어선다. 다만 에이전트 과제 점수는 엇갈린다. GDPVal-AA v2는 1754로 Opus 5 Max의 1824에 못 미치고, AutomationBench는 49.4 대 50.3, DeepSearchQA는 89.4로 GPT 5.6 Sol Max의 93.0에 미치지 못한다.
공식 발표는 방법론을 밝히지 않는다. 벤치마크는 추출 가능한 텍스트가 아니라 이미지로 게시됐고, 독립 평가자가 재현했다는 기록도 없다. 시도 횟수, 스캐폴딩, 경쟁 모델의 버전 같은 테스트 구성에 대한 설명은 전혀 없으며, 효율 개선 비율이 벤치마크와 같은 과제에서 측정됐는지도 명시되지 않았다. 로드맵은 더 큰 모델과 향후 오픈 웨이트 공개를 언급하지만 날짜도, 라이선스도, 기술 사양도 없다.
Investing.com에 따르면 발표 후 메타 주가는 2.47% 오른 채 마감했다. 그러나 「낮은 비용」이라는 표현은 영업적 주장에 머문다. 가격표가 공개되지 않았기 때문이다. 위키백과가 Muse Spark 계열에 부여한 100만 토큰 컨텍스트 창 역시 1.3 발표에서는 확인되지 않는다.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 공식 발표를 WebFetch로 research.meta.ai에서 열어 날짜, Muse Code 및 Meta Model API에서의 제공 여부, 추론 모드 상태, 두 가지 효율 수치(도구 호출 약 20%, 토큰 약 25%), 적대적 견고성과 되돌릴 수 없는 동작에 관한 서술, 향후 오픈 웨이트 공개 언급, 벤치마크 표의 구성을 직접 확인했다. 점수가 이미지 안에 있어 서로 독립적인 두 매체 — OfficeChai(전체 표)와 Investing.com(금융 통신사) — 에서 가져왔고, DeepSWE v1.1, Terminal-Bench 2.1, MRCR, GDPVal-AA v2에서 값이 일치함을 확인했다. 버전 이력과 라이선스는 위키백과 「Muse Spark」 항목과 교차 확인했다. 소문만 전하는 출처는 배제했다.
- Incertezze
- 벤치마크는 메타의 자체 발표이며 독립 평가자의 재현이 확인되지 않았다. 수치가 이미지 안에 있어 여기 적힌 값은 제3의 매체가 읽어낸 것을 거친다. 매체들끼리는 일치하지만 메타 페이지 본문에서는 검증할 수 없다. 가격표는 없다. 「낮은 비용」은 확인된 요금이 아니라 영업적 주장이다. 오픈 웨이트에 대해 메타는 날짜도, 라이선스도, 모델 크기도 밝히지 않았다. 테스트 구성(시도 횟수, 스캐폴딩, 경쟁 모델 버전)도, 효율 수치가 벤치마크와 같은 과제 집합에서 측정됐는지도 명시되지 않았다. 100만 토큰 컨텍스트 창은 위키백과에서 온 것으로 1.3 발표에는 없다. 주가 반응과 저커버그 발언은 공식 발표 밖의 2차 출처다.
- Perché pubblicarla
- 공식 발표로 뒷받침된 프런티어 릴리스이며, 구체적인 수치와 잘 다뤄지지 않는 각도가 있다. 주장된 우위는 점수가 아니라 에이전트를 돌리는 비용 — 호출이 더 적고 토큰이 더 적다 — 에 있고, 이는 실제로 운영에 올리는 쪽에 정말로 중요한 지표다. 이 기사가 정직할 수 있는 이유는 승리 선언이 아니기 때문이다. 메타는 롱컨텍스트와 코딩 일부에서 앞서지만 여러 에이전트 벤치마크에서는 Opus 5와 GPT 5.6 Sol에 뒤진다. 그리고 날짜도 라이선스도 없는 오픈 웨이트 약속은 있는 그대로 표시되어야 한다.