딥시크, V4.1‑Flash 공개: 5520억 파라미터 MoE 모델에 MIT 라이선스, 비피크 요금은 절반인 새 가격표
딥시크는 2026년 9월 10일 DeepSeek‑V4.1‑Flash 출시를 발표하고, 가중치를 허깅페이스 저장소(deepseek-ai/DeepSeek-V4.1-Flash)에 공개하면서 공식 API 문서도 함께 제공했다. 이 모델은 백본에 5520억 파라미터를 둔 MoE(Mixture‑of‑Experts)로 설명되지만 활성화는 비대칭이다. 입력(prefill) 단계에서는 80억, 출력(decode) 단계에서는 160억 파라미터가 활성화된다. Causal Encoder‑Decoder(CED) 아키텍처는 트랜스포머 40개 층(인코더 20, 디코더 20)과 층당 384개의 전문가를 두고 토큰마다 6개를 활성화하며, 여기에 1960억 파라미터 규모의 조건부 메모리 Engram이 더해진다. 최대 컨텍스트는 100만 토큰이고, 어텐션은 Compressed Sparse Attention 2(CSA2), KV 캐시는 FP4(E2M1) 형식이다.
가격표는 2026년 9월 10일 04:00 UTC에 발효됐으며, 비피크 요금은 피크 요금의 50%다. 테크노드가 전한 V4.1‑Flash 비피크 요금은 입력 100만 토큰당 캐시 히트 시 0.02위안, 캐시 미스 시 1위안, 출력 100만 토큰당 4위안이다. 피크 시간대에는 두 배가 된다. 독립 분석기관 Artificial Analysis는 서드파티 공급사에서 확인된 가격으로 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 1.20달러를 제시했다.
저장소에 실린 벤치마크는 모두 자체 발표 수치다. DeepSWE v1.1 해결률 74.2%, Terminal‑Bench 2.1 Pass@1 90.6%, GPQA Diamond Pass@1 90.9%, 코드포스 레이팅 3471. Artificial Analysis는 V4.1‑Flash(Reasoning, Max Effort)에 Artificial Analysis Intelligence Index v4.3 기준 40점을 매겨 같은 급 113개 모델 중 6위에 놓았고, 초당 217.1토큰(3위)의 속도와 총 2억 5000만 토큰의 출력량을 기록했다. 중앙값 1억 4000만 토큰보다 말이 많은 편이다.
딥시크는 V4.1‑Flash가 V4‑Pro를 “in performance, cost, speed and total completion time in internal and external testing” 앞섰다며 이번 결정을 설명했다(테크노드가 전한 발언). 다만 비교는 수치로 뒷받침되지 않는다. 공식 페이지의 그래프에는 비교 가능한 숫자가 없다.
2026년 9월 14일부터 deepseek‑v4‑pro 모델로 가는 모든 요청은 V4.1‑Pro 출시 전까지 V4.1‑Flash로 넘어가며, 요금도 V4.1‑Flash 기준이 적용된다. V4‑Flash와 V4‑Flash‑Vision‑Exp는 중단됐고 그 이름은 한동안 V4.1‑Flash로 연결된다. 새 모델의 API 식별자는 **deepseek-flash**다. MIT 라이선스는 허깅페이스 모델 카드에 표시돼 있고, 가중치는 Safetensors 형식으로 제공되며 기술 보고서(DeepSeek_V41_Tech_Report.pdf)도 같은 저장소에 올라와 있다.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- 딥시크 API 문서의 공식 공지(api-docs.deepseek.com/news/news260910)와 deepseek.com 뉴스 페이지를 읽었습니다. 날짜, 아키텍처, 파라미터, KV 캐시 효율, 새 가격표, 9월 14일부터의 deepseek-v4-pro 라우팅에서 둘이 일치합니다. 허깅페이스 공식 저장소에서는 가중치가 실제로 내려받을 수 있는지(Safetensors), MIT 라이선스, 아키텍처 세부(CED, CSA2, Engram, DeepSeek-ViT), 100만 토큰 컨텍스트, 벤치마크 표를 확인했습니다. 독립 확인으로는 날짜·회사 발언·위안화 가격표를 전한 테크노드와, 제3자 측정치를 제공하는 Artificial Analysis 페이지(Intelligence Index v4.3 = 40, 217.1토큰/초, 출력량 2억 5000만 토큰)를 봤습니다. 자체 발표 수치와 제3자 측정치를, 그리고 공식 위안화 가격과 서드파티 공급사의 달러 가격을 각각 구분해 두었습니다.
- Incertezze
- 저장소의 벤치마크(DeepSWE, Terminal‑Bench, GPQA Diamond, Codeforces)는 딥시크의 자체 발표이며, 검증 시점까지 독립적인 제3자가 재현한 적이 없습니다. V4‑Pro와의 직접 비교는 회사가 수치로 제시하지 않았고, 공식 페이지의 그래프에는 숫자가 없습니다. Artificial Analysis의 독립 점수(Intelligence Index v4.3에서 40)는 2차 출처가 다른 버전의 지수로 인용한 타 모델 점수와 직접 비교할 수 없습니다. 한 2차 출처는 이전 V4‑Flash 0731에 50을 주지만 그것은 예전 버전 지수이므로, 두 숫자를 성능 하락으로 읽으면 안 됩니다. V4‑Pro 종료가 운영 중인 사용자에게 미칠 실질적 영향은 확인되지 않았습니다. 사용량에 대한 공개 데이터가 없습니다. MIT 라이선스는 허깅페이스 카드에 표시된 것이며, 저장소 안의 부수적 이용 조항 전문까지는 확인하지 않았습니다.
- Perché pubblicarla
- 검증 가능한 결과물이 딸린 공개입니다. 내려받을 수 있는 MIT 가중치와 기술 보고서 — 거의 전부가 폐쇄형 벤치마크였던 이번 주 발표들 사이에서는 드문 일입니다. 편집적으로 흥미로운 대목은 점수가 아니라 산업적 결정입니다. 한 연구소가 자사 최상위 모델을 물리고 그 트래픽을 더 싼 모델로 돌렸습니다. 자기 가격표의 상위 구간이 정당하지 않았다고 사실상 인정한 셈입니다. 주장된 성능과 측정된 성능의 간극을 추측 없이 이야기할 수 있습니다. 두 출처가 모두 존재하기 때문입니다.