IBM Granite 4.2의 네이티브 추론, 조밀한 아키텍처와 자체 발표 수치 사이에서
2026년 8월 25일 IBM Research가 새로운 모델 계열 Granite 4.2를 발표하고 가중치를 Apache 2.0 라이선스로 제공했다. Hugging Face 문서에는 “fully open for commercial and research use”라는 문구가 적혀 있다. 대형 Mixture-of-Experts 시스템으로 기울어진 지형에서, 이 프로젝트는 30억·80억·300억 파라미터의 조밀한 구조에 집중한다. 30B 버전의 decoder-only 아키텍처는 어텐션 헤드 32개와 KV 헤드 8개의 Grouped Query Attention, RoPE 위치 인코딩, SwiGLU 활성화를 채택했고, 네이티브 128K 토큰 컨텍스트를 지원한다. 기술 블로그는 다섯 번째 사전학습 단계 덕분에 이를 512K까지 확장할 수 있다고 설명한다. 처음부터의 학습은 IBM에 따르면 다섯 단계에 걸쳐 약 15조 토큰으로 이뤄졌다.
가장 큰 변화는 답을 내놓기 전에 추론의 사슬을 생성하는 능력이다. 여기에 thinking / non-thinking 스위치와, 쉬운 질문에는 줄어든 추론 예산을 배정하는 중간 모드 “low-effort”가 더해진다. 사후 학습에는 Group Relative Policy Optimization(GRPO) 알고리즘과 RLHF 정렬이 결합됐고, 에이전트형 흐름을 위한 별도의 강화학습 단계 — 소프트웨어 엔지니어링과 터미널 사용에 초점을 맞춘 — 는 8B와 30B에만 적용됐다. 같은 시점에 4억 7000만 파라미터의 음성 모델 Granite Speech 5.0 Turbo CTC도 공개됐는데, IBM은 Open ASR Leaderboard의 기존 선두권이 약 6,000이던 것에 비해 약 12,600의 RTFx를 주장한다. 학습은 IBM에 따르면 CoreWeave가 제공한 NVIDIA GB200 NVL72 클러스터에서 돌았다.
IBM이 밝힌 성능은 30B 모델에 SWE-Bench Verified 57.00, AIME25와 HMMT Feb25 각각 89.17, GPQA 66.41을 부여한다. 회사 문서에 실린 내부 측정치인 만큼, 독립적인 감사와 검증이 없는 현 상태에서는 이 점수들이 실제로 재현되는지 제3자가 확인할 방법이 없다. 공식 문서는 또한 AIME25와 HMMT Feb25 결과가 정확히 겹치는데도 그 이유를 밝히지 않으며, 경쟁 모델과의 비교는 해당 수치가 빠진 그래프에 맡겨져 있어 1차 출처에서는 검증할 수 없다.
업계가 Mixture-of-Experts의 규모를 좇는 사이에 조밀한 모델을 관대한 라이선스로 내놓는 선택은, 현실의 하드웨어 한계와 씨름해야 하는 쪽을 겨냥하겠다는 뜻이다. 문서에 적힌 효율과 기업 환경에서의 실제 작업 사이의 거리는 첫 현장 통합에서 드러날 것이다.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- IBM Research의 2026년 8월 25일자 공식 발표를 WebFetch로 열었다. 세 가지 크기, Apache 2.0 라이선스, 조밀한 아키텍처, 다단계 RL 파이프라인, 음성 모델이 확인된다. 이를 Hugging Face의 공식 모델 카드 granite-4.2-30b(아키텍처, 컨텍스트, 언어, 벤치마크 표) 및 IBM 기술 블로그(세 크기의 수치, 15조 토큰, thinking·low-effort 모드)와 대조했다. MarkTechPost와 The Decoder의 독립 보도도 같은 값을 전한다 — SWE-Bench Verified 57.00, 컨텍스트, 라이선스. 예비 검색에서 나온 Mamba 하이브리드 아키텍처 가설은 버렸다. IBM 자료는 조밀한 decoder-only 트랜스포머라고 분명히 밝히고 있고, 하이브리드는 Granite 4.0의 것이었다. 날짜는 8월 26일이 아니라 25일 — 1차 출처를 따랐다.
- Incertezze
- 모든 점수는 IBM의 자체 발표다. 확인 시점에 SWE-Bench Verified, Terminal-Bench 2.1, RULER 어디에도 독립적인 재현은 없다. IBM 블로그의 비교 그래프는 경쟁 모델의 수치를 텍스트로 싣지 않아, 비교 자체를 1차 출처에서 검증할 수 없다. 30B의 AIME25와 HMMT Feb25 값이 동일한 점(둘 다 89.17)은 IBM 문서 두 곳에서 확인되지만 설명은 없다. 컨텍스트는 두 IBM 출처의 표현이 다르고 — 네이티브 128K에 512K 확장 — 실제 운영에서 어느 창이 유지되는지 불분명하다. 이번 세대에 대한 ISO 42001 인증 언급은 없다. ‘3시간 분량의 오디오를 1초에 전사’라는 수치는 선언된 처리량이지 독립적인 테스트가 아니다.
- Perché pubblicarla
- 이번 주에 조건부 조항 없이 정말 관대한 라이선스로 가중치를 실제로 내려받을 수 있는 유일한 공개다. 누구든 허락을 구하지 않고 운영에 투입할 수 있다. 흐름을 거스르는 선택 — 단일 하드웨어에서 돌아가는 30억~300억 파라미터의 조밀한 모델 대 최근 몇 주간의 수천억 파라미터 MoE — 은 비용이나 데이터 제약 때문에 모델을 자체적으로 돌려야 하는 쪽과 직결된다. 그리고 자체 발표 수치와 독립 검증 부재 사이의 간극이야말로, 보도자료가 먼저 말하기 전에 독자에게 알려둘 가치가 있는 지점이다.