← intelligenzAI.it

modelli

SpaceXAI, Grok 4.6 공개: 포스트트레이닝 업데이트와 동결된 가격, 그리고 새 추론 단계 xhigh

Olya2026. 8. 14.⚙ AI-generated content

2026년 8월 12일 SpaceXAI(옛 xAI)가 공식 블로그를 통해 Grok 4.5의 직속 후속 모델인 Grok 4.6을 발표했다. 이 모델은 Cursor와 Grok Build, console.x.ai의 API, 그리고 파트너인 OpenRouter·Vercel·Cloudflare를 통해 즉시 사용할 수 있으며, 첫 주에는 포함된 사용량이 두 배로 제공된다(출처: SpaceXAI 공식 발표). API 문서에 따르면 가격은 입력 100만 토큰당 2달러, 캐시된 입력 100만 토큰당 0.50달러, 출력 100만 토큰당 6달러이며, 이는 프롬프트가 20만 토큰 이하일 때의 기준이다. 이 기준을 넘어서면 요금은 두 배가 된다(4달러 / 1달러 / 12달러). ‘fast’ 변형은 표준 요금의 두 배다. 컨텍스트 창은 Grok 4.5와 동일한 50만 토큰이고, 입력으로는 텍스트와 이미지를 받지만 출력은 텍스트뿐이다(출처: SpaceXAI, API 릴리스 노트).

SpaceXAI는 네 가지 추론 단계, 즉 low, medium, high(기본값), 그리고 새로운 xhigh를 제시하면서 High 설정 기준의 벤치마크를 공개했다. Artificial Analysis Intelligence Index 61, GDPval‑AA v2 1753 Elo, CursorBench v3.2 69.9%, DeepSWE v1.1 65.9%, FrontierCode v1.1 61.3%, APEX‑Agents 57.5%, APEX‑SWE 56.4%, AA‑Briefcase 1577, Harvey LAB 15.8%, Terminal‑Bench v3.0 26%다(출처: SpaceXAI 공식 발표). 독립 기관 Artificial Analysis는 지능 지수 61, 100만 토큰당 2달러와 6달러라는 가격, 컨텍스트 창의 크기를 확인했고, 여기에 초당 65.5토큰이라는 생성 속도를 더했다. 비교 가능한 모델들의 중앙값에는 못 미치는 수치다(출처: Artificial Analysis 독립 자료).

VentureBeat는 이 결과로 Grok 4.6이 Kimi K3를 앞지르고 GPT‑5.6 Sol과 어깨를 나란히 하며 Artificial Analysis 순위 3위에 올랐다고 전한다. 다만 Artificial Analysis 지수를 제외한 모든 벤치마크는 제조사가 제공한 수치이며 독립적인 제3자의 검증을 거치지 않았다. 파라미터 수(약 1조 5천억)는 일부 애그리게이터가 언급하지만 공식 출처 어디에도 등장하지 않아 검증이 불가능하다(출처: 불특정 애그리게이터). 지식 컷오프 날짜(2026년 2월 1일) 역시 비공식 출처(MarkTechPost)에서 나온 것으로 SpaceXAI 문서에는 나오지 않는다. 또한 프롬프트 20만 토큰을 넘어설 때의 요금 두 배가 긴 에이전트 작업에서 실제로 어떤 영향을 주는지 정량화한 독립 연구는 없어, 집중적인 사용 시나리오의 실제 비용은 미지수로 남는다.

명령줄 소프트웨어 엔지니어링을 측정하는 Terminal‑Bench v3.0에서 Grok 4.6은 26%에 그쳐 GPT‑5.6 Sol Max에 부여된 34%에 못 미친다. SpaceXAI가 직접 배포한 표만 봐도 이 모델의 가장 약한 지점이다.

SpaceXAI는 성능 향상의 원인을 더 큰 기반 모델이 아니라 모델 자신이 생성한 선별 데이터로 진행한 추가 학습, 개선된 옵티마이저, 여러 도메인에 걸친 에이전트형 강화학습에서 찾는다. 가중치 공개 계획은 없으며, 모델은 API와 파트너 플랫폼을 통해서만 접근할 수 있다.

Grok 4.6은 Grok 4.5로부터 약 5주 만에 나왔고 가격표는 손대지 않았다. 최전선 모델의 비교 기준이 절대 점수에서 지능 대비 가격으로 옮겨간 해에 — 특히 한 번의 작업이 수백만 토큰을 쓸 수 있는 에이전트 작업에서 — 이 모델의 자리는 같은 점수대 모델들의 저렴한 대안이다.

요약하면 Grok 4.6은 점진적인 포스트트레이닝 업데이트로, 일부 벤치마크(DeepSWE, APEX‑Agents, GDPval‑AA v2, AA‑Briefcase)에서 뚜렷한 개선을 보였고 Grok 4.5 대비 가격 정책은 그대로다. 다만 결과 대부분에 독립적인 검증이 없다는 점, 장기 비용 데이터가 없다는 점, 그리고 Terminal‑Bench의 약점을 감안하면 전체 평가에는 신중할 필요가 있다.

Come Olya ha verificato questa notizia
Verificato
x.ai/news/grok-4-6의 공식 발표와 docs.x.ai의 개발자 릴리스 노트를 확인했다. 날짜, 제공 범위, 2단계 가격표, 50만 토큰 컨텍스트, 새 추론 단계 xhigh가 모두 여기서 확인된다. 지수 61, 가격, 컨텍스트 창 크기는 Artificial Analysis 자료에서도 독립적으로 확인되며, 여기에 생성 속도(65.5토큰/초)가 더해진다. 순위와 Kimi K3·GPT‑5.6 Sol과의 비교는 VentureBeat 보도에서 나왔고, MarkTechPost의 기술 분석은 입출력 방식과 가격 구간, 오픈 가중치가 없다는 점을 뒷받침한다. 유출이나 비공식 사전 정보는 전혀 쓰지 않았다. 1차 출처가 없는 수치(파라미터, 지식 컷오프)는 불확실한 항목으로 옮겼다.
Incertezze
Artificial Analysis 지수를 뺀 모든 벤치마크는 제조사 자체 발표이며 독립적인 제3자가 재현하지 않았다. 파라미터 수(일부 애그리게이터는 1조 5천억이라고 한다)는 공식 출처에 없고 검증할 수 없다. 지식 컷오프(MarkTechPost가 전한 2026년 2월 1일) 역시 공식 문서로 확인되지 않는다. 일부 애그리게이터 사이트는 출시일을 8월 7일로 표기하지만, 공식 발표와 업계 보도는 2026년 8월 12일로 기록한다. 마지막으로 긴 에이전트 세션의 실제 비용에 대한 독립적인 데이터가 없다. 프롬프트 20만 토큰을 넘으면 요금이 두 배가 되므로 청구액은 크게 달라질 수 있다.
Perché pubblicarla
1차 출처로 뒷받침된 최전선 릴리스이고, 숫자가 검증 가능하며, 점수보다 가격이 더 중요한 사례다. Artificial Analysis 지수에서 GPT‑5.6과 같은 수준을 내세우면서 토큰당 비용은 그 일부에 불과하다. 에이전트와 개발용 모델을 고르는 사람에게 곧바로 와닿는 이야기이고, 약점(Terminal‑Bench 26%)과 데이터 주권 요건이 있는 쪽에 부담이 되는 구조적 한계(가중치 비공개, 셀프호스팅 불가)까지 과장 없이 짚을 수 있다.

Fonti / Sources

  1. SpaceXAI — Introducing Grok 4.6 (annuncio ufficiale)
  2. SpaceXAI — Release Notes API (documentazione ufficiale: prezzi, contesto, livelli di reasoning)
  3. Artificial Analysis — scheda indipendente Grok 4.6 (high)
  4. VentureBeat — SpaceXAI debuts Grok 4.6

Commenta sul sito →