DeepSeek wypuszcza V4.1‑Flash: model MoE z 552 miliardami parametrów, licencja MIT i nowy cennik z taryfą pozaszczytową za pół ceny
DeepSeek ogłosił 10 września 2026 roku wydanie DeepSeek‑V4.1‑Flash, udostępniając wagi w repozytorium Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) wraz z oficjalną dokumentacją API. Model opisano jako MoE (Mixture‑of‑Experts) z 552 miliardami parametrów w szkielecie, ale o asymetrycznej aktywacji: 8 miliardów aktywnych parametrów na wejściu (prefill) i 16 miliardów na wyjściu (decode). Architektura Causal Encoder‑Decoder (CED) obejmuje 40 warstw Transformera (20 enkodera, 20 dekodera) i 384 ekspertów na warstwę, z czego 6 aktywowanych na token, plus pamięć warunkową Engram o 196 miliardach parametrów. Maksymalny kontekst to milion tokenów, z uwagą Compressed Sparse Attention 2 (CSA2) i pamięcią podręczną KV w formacie FP4 (E2M1).
Cennik wszedł w życie 10 września 2026 roku o 04:00 UTC, a stawki pozaszczytowe wynoszą 50% stawek szczytowych. TechNode podaje pozaszczytowe ceny V4.1‑Flash: 0,02 RMB za milion tokenów wejściowych przy trafieniu w cache, 1 RMB za milion przy chybieniu i 4 RMB za milion tokenów wyjściowych; w szczycie ceny się podwajają. Artificial Analysis, niezależny analityk, wskazuje ceny zaobserwowane u dostawców zewnętrznych: 0,30 USD za milion tokenów wejściowych i 1,20 USD za milion wyjściowych.
Benchmarki podane w repozytorium pochodzą od samej firmy: DeepSWE v1.1 (74,2% rozwiązanych), Terminal‑Bench 2.1 (90,6% Pass@1), GPQA Diamond (90,9% Pass@1) oraz rating Codeforces 3471. Artificial Analysis oceniło V4.1‑Flash (Reasoning, Max Effort) na 40 punktów w Artificial Analysis Intelligence Index v4.3, co daje 6. miejsce wśród 113 modeli tej samej klasy, i zmierzyło prędkość 217,1 tokena na sekundę (3. miejsce) przy łącznej produkcji 250 milionów tokenów — bardziej rozwlekle niż mediana 140 milionów.
DeepSeek uzasadnia decyzję twierdzeniem, że V4.1‑Flash przewyższył V4‑Pro „in performance, cost, speed and total completion time in internal and external testing” (wypowiedź przytoczona przez TechNode). Porównanie nie zostało jednak zilustrowane liczbami: oficjalne strony pokazują wykresy bez porównywalnych wartości.
Od 14 września 2026 roku wszystkie zapytania do modelu deepseek‑v4‑pro będą kierowane do V4.1‑Flash, w taryfie V4.1‑Flash, w oczekiwaniu na premierę V4.1‑Pro. Modele V4‑Flash i V4‑Flash‑Vision‑Exp zostały wycofane, a ich nazwy tymczasowo przekierowano na V4.1‑Flash. Identyfikator API nowego modelu to **deepseek-flash**. Licencję MIT wskazano na karcie Hugging Face; wagi udostępniono w formacie Safetensors, a raport techniczny (DeepSeek_V41_Tech_Report.pdf) opublikowano w tym samym repozytorium.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalne ogłoszenie w dokumentacji API DeepSeeka (api-docs.deepseek.com/news/news260910) oraz stronę z aktualnościami deepseek.com: zgadzają się co do daty, architektury, parametrów, wydajności pamięci podręcznej KV, nowego cennika i kierowania deepseek-v4-pro od 14 września. W oficjalnym repozytorium na Hugging Face sprawdziłam, czy wagi rzeczywiście da się pobrać (Safetensors), a także licencję MIT, szczegóły architektury (CED, CSA2, Engram, DeepSeek-ViT), kontekst miliona tokenów i tabelę benchmarków. Jako niezależne potwierdzenie przeczytałam TechNode (data, wypowiedź firmy, cennik w RMB) oraz kartę Artificial Analysis, czyli pomiar strony trzeciej (Intelligence Index v4.3 = 40, 217,1 tokena/s, rozwlekłość 250 mln tokenów). Liczby deklarowane przez firmę trzymam osobno od zmierzonych przez podmioty trzecie, tak samo jak oficjalne ceny w RMB od dolarowych cen dostawców zewnętrznych.
- Incertezze
- Benchmarki z repozytorium (DeepSWE, Terminal‑Bench, GPQA Diamond, Codeforces) deklaruje sam DeepSeek i w chwili weryfikacji nikt niezależny ich nie odtworzył. Bezpośredniego porównania z V4‑Pro firma nie ujmuje w liczbach: oficjalne strony pokazują wykresy bez wartości. Niezależny wynik Artificial Analysis (40 w Intelligence Index v4.3) nie jest wprost porównywalny z wynikami innych modeli przytaczanymi przez źródła wtórne dla innych wersji indeksu — jedno źródło wtórne przypisuje 50 wcześniejszemu V4‑Flash 0731, ale na starszej wersji indeksu, więc obu liczb nie należy czytać jako pogorszenia. Praktyczny wpływ wycofania V4‑Pro na tych, którzy używają go produkcyjnie, pozostaje niezweryfikowany: nie ma publicznych danych o wolumenach. Licencja MIT to ta zadeklarowana na karcie Hugging Face; pełnego tekstu ewentualnych dodatkowych klauzul użytkowania w repozytorium nie sprawdzałam.
- Perché pubblicarla
- To wydanie z weryfikowalnym artefaktem — pobieralne wagi na MIT i raport techniczny — rzadkość wśród ogłoszeń tego tygodnia, niemal wyłącznie opartych na zamkniętych benchmarkach. Redakcyjnie ciekawy jest nie wynik, lecz decyzja przemysłowa: laboratorium wysyła na emeryturę własny flagowy model i przekierowuje jego ruch na tańszy, przyznając tym samym, że górna półka jego cennika nie miała uzasadnienia. Pozwala to opisać rozjazd między deklarowaną a zmierzoną wydajnością bez spekulacji, bo istnieją oba źródła.