알리바바, Qwen3.8-Max 업데이트: 코딩을 겨냥한 스냅샷
알리바바는 2026년 9월 2일 Qwen3.8-Max의 업데이트 스냅샷인 Qwen3.8-Max-0902 공개를 발표했다. 아키텍처는 그대로다. 파라미터 2조 4천억 개, 컨텍스트 창 100만 토큰. 달라진 것은 포스트트레이닝으로, 코딩과 협업 작업(“Cowork” 모드)에 초점을 맞췄다. QwenCloud 공식 모델 카드는 이를 “an upgraded snapshot of qwen3.8-max”라고 설명하며 한계를 명시한다. 컨텍스트 최대 100만 토큰, 입력 99만 1천 토큰, 출력 13만 1천 토큰, 레이트 리밋은 분당 100만 토큰과 분당 15,000건의 요청이다. 가격은 이전 스냅샷과 같다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러, 캐시 읽기 100만 건당 0.17달러.
이 모델은 텍스트·이미지·영상을 입력으로 받고 출력은 텍스트만 내놓으며, 추론 모드(“thinking”)와 코드 인터프리터, 웹 검색, 이미지 검색, 스크레이핑 같은 내장 도구를 갖췄다. 알리바바는 여덟 개 코딩 벤치마크의 자체 측정 결과를 공개했다. TerminalBench 3.0은 11.3점에서 29.0점으로, DeepSWE 1.1은 56.6에서 69.3으로, QwenSWEbench V2는 55.1에서 70.0으로, JobBench는 53.4에서 64.0으로 올랐다.
Arena.ai에 따르면 Qwen3.8-Max-0902는 1,691점으로 Code Arena: WebDev 순위에 종합 1위로 데뷔했다. 앤트로픽의 Max 모델(Opus 5)을 3점, Kimi K3(Max)를 17점 앞선 기록이다. 그러나 2026년 9월 5일 기준 순위에서는 1,686점으로 4위이며, 1,868표를 바탕으로 “Preliminary”로 분류돼 있다. 1위는 1,199표에 1,797점을 받은 오픈AI의 gpt-6-astra-max다. 전체 순위에는 126개 모델에 대해 650,961표가 쌓여 있다.
알리바바가 함께 공개한 비교표에서는 앤트로픽의 최상위 모델이 여덟 개 항목에서 앞서고, Qwen3.8-Max-0902는 세 개의 전문 지표에서 이를 넘어선다. 새 스냅샷은 오픈 가중치 공개 계획이 없으며, QwenCloud API로만 제공된다. 오픈AI와 앤트로픽 API와의 호환성은 공식적으로 명시돼 있다. Qwen과 Arena.ai가 X에 올린 발표 게시물은 직접 확인하지 못했다(서버가 402 오류를 반환한다). 내용은 제3자 색인을 통해서만 파악했다. 벤치마크 수치는 자체 측정이므로 신중하게 볼 필요가 있다.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- QwenCloud 공식 모델 카드(파라미터, 컨텍스트, 한계, 가격, 도구)와 arena.ai의 Code Arena: WebDev 순위를 직접 열어 봤다. 후자는 2026년 9월 5일 기준으로 Qwen3.8-Max-0902를 1,686점 4위, gpt-6-astra-max를 1,797점 1위로 보여 준다. 데뷔 당시의 1위는 더 이상 유효하지 않다는 뜻이다. 이어 TechNode(공개 날짜와 포스트트레이닝이라는 성격), AlphaSignal(가격, 캐시, 벤치마크, API 호환성), 그리고 알리바바의 자체 측정치와 유일하게 제3자가 확인한 데이터(Arena.ai 순위)를 명시적으로 구분한 byteiota를 읽었다. Qwen과 Arena.ai의 X 게시물은 HTTP 402를 반환해 출처로 쓰지 않았다. 경쟁 기사 두 건은 버렸다. 하나는 1차 출처가 검증 불가능한 zip 아카이브로만 배포됐고, 다른 하나는 공식 블로그가 아니라 임원의 소셜 게시물로 발표된 건이었다.
- Incertezze
- X의 발표 게시물은 열리지 않는다(HTTP 402). 내용은 제3자 색인으로만 알 수 있는 반면, 공개 사실과 사양은 QwenCloud 공식 카드에서 확인된다. 벤치마크 수치(TerminalBench, DeepSWE, QwenSWEbench, JobBench)는 거의 전부 알리바바의 자체 측정이며 제3자가 재현한 적이 없다. Code Arena 점수는 “Preliminary”로 표시돼 있어 표가 쌓이면 계속 흔들린다. 데뷔 당시 1,691점과 9월 5일의 1,686점 차이에 대해 플랫폼은 설명하지 않는다. 정확한 공개 시각도, 모델 카드와 별개인 Qwen 공식 블로그 글도 확인되지 않으며, 학습 비용이나 이전 스냅샷의 서비스 유지 여부도 알리바바는 밝히지 않았다.
- Perché pubblicarla
- 같은 독립 출처에서 어떤 주장과 그 유효기간을 함께 확인할 수 있는 경우는 드물다. 9월 2일에 발표된 1위는 5일에 이미 없다. 모델 순위표가 실제로 어떻게 굴러가는지 — 잠정 점수, 쌓이는 표, 사흘 만에 뒤집히는 자리 — 를 보여 주고, 제3자가 확인한 단 하나의 수치와 공급사가 스스로 발표한 여덟 개 벤치마크를 갈라놓는 데 쓸모가 있다. 게다가 실제로 쓰는 사람에게는 구체적인 소식이다. 가격도 같고 아키텍처도 같은데 코딩 능력만 다르고, 오픈 가중치는 없다.