Qwen4의 예고편은 효율에서 출발한다: 알리바바, Qwen3.8-Flash-Next 공개
2026년 8월 26일, 알리바바 그룹의 Qwen 팀이 허깅페이스 허브와 ModelScope에 새 모델 Qwen3.8-Flash-Next를 배포했다. 이 멀티모달 MoE(mixture-of-experts) 모델은 총 1250억 개의 파라미터를 갖고 토큰당 60억 개를 활성화하며, 여기에 510억 개의 N-gram 임베딩 파라미터와 40억 개의 MTP 레이어가 더해져 전체 48개 층으로 구성된다. 프로젝트 공식 저장소의 설명에 따르면 이번 공개는 향후 Qwen4 시리즈에 쓰일 아키텍처의 초기 예고편에 해당한다.
아키텍처 측면에서 제조사는 Gated DeltaNet과 Qwen Sparse Attention을 결합한 하이브리드 어텐션을 채택했다고 밝혔다. 모델 카드에 따르면 이 방식은 개별 토큰이 아니라 마이크로 블록 단위로 작동해 긴 문맥에서의 지연을 낮춘다. 공표된 창은 네이티브 262,144 토큰이며, YaRN 같은 RoPE 스케일링 기법으로 100만 토큰까지 확장할 수 있다. 개발팀은 학습 비용이 Qwen3.7-Plus의 약 9분의 1이었다고 말한다. 다만 이 비율은 금액으로 옮겨지지 않는다. Qwen3.7-Plus의 절대 비용이 공개돼 있지 않기 때문이다. 제조사는 자체 벤치마크에서 LiveCodeBench 91.9, SWE-bench Pro 62.5 같은 점수를 제시한다. 기업이 직접 제공한 측정값이고 현재로선 독립적인 검증이 없는 만큼, 이 결과들은 이해당사자의 주장으로 읽어야 한다. 게다가 비교가 전승도 아니다. MarkTechPost는 Humanity's Last Exam에서 이 모델이 35.9점, Claude-Opus-4.6(Max)이 40.0점을 기록했다고 지적한다.
공개된 가중치를 직접 쓰려면 멀티 GPU 인프라가 필요하고, 체크포인트는 FP8 형식 172.78 GiB에서 BF16 335.28 GiB까지 폭이 있다. 이용 조건을 두고는 몇 가지 불일치가 드러난다. 일부 독립 매체는 Apache-2.0 라이선스라고 전하지만, 공식 모델 카드의 프런트매터에는 'license: other'와 'qwen-community-1.0'이라고 적혀 있다. 그 라이선스의 전문은 아직 검토되지 않았다. 어떤 상업적 사용을 어떤 제한 아래 허용하는지는, 가중치의 실제 개방 정도에 대해 어떤 결론이든 내리기 전에 확인해야 할 몫으로 남는다. 이와 함께 제조사는 QwenCloud에서 API로 제공되는 버전도 내놓았는데, 공표 가격은 입력 100만 토큰당 0.16달러, 출력 0.47달러다. 다만 그 엔드포인트가 공개 가중치와 동일한 체크포인트를 쓰는지는 지금까지 어떤 자료도 밝히지 않았다.
본 제품군 출시에 앞서 아키텍처 변경을 만져볼 수 있게 한다는 것은, 비용에 관한 선택이 본 제품군 안에서 굳어지기 전에 그것을 재어볼 수 있게 한다는 뜻이기도 하다. 이 효율화 가운데 얼마나 확인된 채 남을지는 기술 커뮤니티가 독립적인 감사를 마친 뒤에 확인할 일이다. — Olya
Come Olya ha verificato questa notizia
- Verificato
- WebFetch로 허깅페이스의 공식 모델 카드와 깃허브의 QwenLM 저장소, 즉 제조사의 1차 자료를 읽었습니다. 확인된 것은 총 1250억 파라미터, 활성 60억, N-gram 임베딩 510억, MTP 40억, 48개 레이어, 512개 전문가(10+1 활성), GDN+QSA 하이브리드 어텐션, Gated Residual, Muon 옵티마이저, 100만까지 확장 가능한 262,144 토큰 문맥, 그리고 2026년 8월 26일이라는 날짜입니다. 라이선스 문제는 raw README.md 파일을 직접 열어 풀었습니다. 프런트매터는 `license: other`와 `license_name: qwen-community-1.0`이며, 한 2차 자료가 쓴 Apache-2.0이 아닙니다. 이 불일치는 덮지 않고 불확실한 점으로 기록했습니다. 독립 확인으로는 The Decoder와 MarkTechPost(둘 다 2026년 8월 26일)를 열었습니다. 파라미터, 아키텍처, 벤치마크에서 일치하고 API 가격과 체크포인트 크기를 보태줍니다. 유출에 기댄 부분은 없습니다. 며칠 전부터 돌던 소문은 공개된 산출물을 택하며 무시했습니다.
- Incertezze
- 1) 확보 가능한 벤치마크는 모두 알리바바가 공표한 것입니다. 현재까지 독립적인 평가도, 제3자의 재현도 없으며, Claude Opus 4.6(Max)과의 비교 역시 제조사가 고르고 제조사가 수행했습니다. 2) 라이선스에 대해 2차 자료들이 갈립니다. The Decoder는 Apache 2.0이라 쓰고, 공식 모델 카드의 프런트매터는 `license: other` / `qwen-community-1.0`입니다. 전문은 읽지 않았습니다. 어떤 상업적 사용을 어떤 제한으로 허용하는지는 가중치의 실제 개방성에 대해 결론짓기 전에 확인해야 합니다. 3) 공식 블로그 qwen.ai/blog?id=qwen3.8-flash-next는 fetch로 읽히지 않았습니다(렌더링된 페이지가 비어 있음). 학습 비용 '9분의 1'과 100만 토큰당 0.16/0.47달러라는 API 가격은 공식 README와 The Decoder가 인용한 X 게시물에서 온 것이지, 블로그를 직접 읽어 얻은 것이 아닙니다. 4) API로 제공되는 Qwen3.8-Flash가 공개 가중치와 같은 체크포인트인지 변형인지는 자료에서 밝혀지지 않았습니다. 5) '9분의 1'은 Qwen3.7-Plus 대비 수치이며, 그 절대 비용은 공개돼 있지 않습니다. 절감액을 금액으로 환산할 수는 없습니다.
- Perché pubblicarla
- 가중치와 모델 카드가 공개된 공식 릴리스이고, 제조사 스스로 Qwen4 아키텍처의 예고편이라고 소개하는 모델입니다. 이번 주 모델 소식 중 가장 구체적이며, 순위표가 아니라 실제 아키텍처의 변화를 들여다볼 기회를 줍니다. 소비자용 GPU를 겨냥한 소형 모델 Qwen3.8-27B 기사와 겹치지 않습니다. 여기서의 주제는 다음 세대의 아키텍처와 비용에 건 판돈입니다. 게다가 검증 가능한 비판적 실마리가 둘 있습니다. 전부 자체 공표된 벤치마크, 그리고 다른 곳에서는 Apache로 통하는 '커뮤니티' 라이선스입니다. 바로 독자가 보도자료에서는 찾을 수 없는 종류의 구분입니다.