DeepSeek bringt V4.1‑Flash: MoE‑Modell mit 552 Milliarden Parametern, MIT‑Lizenz und neue Preisliste mit halbiertem Nebenzeit‑Tarif
DeepSeek hat am 10. September 2026 die Veröffentlichung von DeepSeek‑V4.1‑Flash angekündigt und dabei die Gewichte im Hugging‑Face‑Repository (deepseek-ai/DeepSeek-V4.1-Flash) sowie die offizielle API‑Dokumentation bereitgestellt. Das Modell wird als MoE (Mixture‑of‑Experts) mit 552 Milliarden Parametern im Backbone beschrieben, allerdings mit asymmetrischer Aktivierung: 8 Milliarden aktive Parameter in der Eingabephase (Prefill) und 16 Milliarden in der Ausgabephase (Decode). Die Causal‑Encoder‑Decoder‑Architektur (CED) umfasst 40 Transformer‑Layer (20 Encoder, 20 Decoder) und 384 Experten pro Layer, von denen 6 pro Token aktiviert werden, dazu einen konditionalen Engram‑Speicher mit 196 Milliarden Parametern. Der maximale Kontext beträgt eine Million Token, mit Compressed Sparse Attention 2 (CSA2) und einem KV‑Cache im FP4‑Format (E2M1).
Die Preisliste trat am 10. September 2026 um 04:00 UTC in Kraft; die Nebenzeit‑Tarife liegen bei 50 % der Hauptzeit‑Tarife. TechNode nennt für V4.1‑Flash die Nebenzeit‑Preise: 0,02 RMB pro Million Eingabe‑Token bei Cache‑Hit, 1 RMB pro Million bei Cache‑Miss und 4 RMB pro Million Ausgabe‑Token; in der Hauptzeit verdoppeln sich die Preise. Artificial Analysis, ein unabhängiger Analyst, führt bei Drittanbietern beobachtete Preise von 0,30 USD pro Million Eingabe‑Token und 1,20 USD pro Million Ausgabe‑Token auf.
Die im Repository angegebenen Benchmarks sind Eigenangaben: DeepSWE v1.1 (74,2 % gelöst), Terminal‑Bench 2.1 (90,6 % Pass@1), GPQA Diamond (90,9 % Pass@1) und ein Codeforces‑Rating von 3471. Artificial Analysis bewertete V4.1‑Flash (Reasoning, Max Effort) mit 40 Punkten im Artificial Analysis Intelligence Index v4.3 und setzte es damit auf Platz 6 von 113 Modellen derselben Klasse; gemessen wurden 217,1 Token pro Sekunde (Platz 3) bei einer Gesamtausgabe von 250 Millionen Token, also wortreicher als der Median von 140 Millionen.
DeepSeek begründet den Schritt damit, dass V4.1‑Flash das Modell V4‑Pro „in performance, cost, speed and total completion time in internal and external testing“ übertroffen habe (von TechNode wiedergegebene Aussage). Der Vergleich ist jedoch nicht beziffert: Die offiziellen Seiten zeigen Diagramme ohne vergleichbare Zahlen.
Ab dem 14. September 2026 werden sämtliche Anfragen an das Modell deepseek‑v4‑pro zu V4.1‑Flash umgeleitet, zu V4.1‑Flash‑Tarifen, bis V4.1‑Pro erscheint. Die Modelle V4‑Flash und V4‑Flash‑Vision‑Exp wurden eingestellt, ihre Namen verweisen vorübergehend auf V4.1‑Flash. Die API‑Kennung des neuen Modells lautet **deepseek-flash**. Die MIT‑Lizenz ist auf der Hugging‑Face‑Modellkarte angegeben; die Gewichte liegen im Safetensors‑Format vor, der technische Bericht (DeepSeek_V41_Tech_Report.pdf) ist im selben Repository veröffentlicht.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Ich habe die offizielle Ankündigung in der API‑Dokumentation von DeepSeek (api-docs.deepseek.com/news/news260910) und die News‑Seite von deepseek.com gelesen: Sie stimmen bei Datum, Architektur, Parametern, KV‑Cache‑Effizienz, neuer Preisliste und der Umleitung von deepseek-v4-pro ab dem 14. September überein. Im offiziellen Hugging‑Face‑Repository habe ich geprüft, ob die Gewichte tatsächlich herunterladbar sind (Safetensors), dazu MIT‑Lizenz, Architekturdetails (CED, CSA2, Engram, DeepSeek-ViT), den Kontext von einer Million Token und die Benchmark‑Tabelle. Als unabhängige Bestätigung habe ich TechNode gelesen (Datum, Unternehmensaussage, Preisliste in RMB) sowie die Seite von Artificial Analysis als Drittmessung (Intelligence Index v4.3 = 40, 217,1 Token/s, Wortfülle 250 Mio. Token). Eigenangaben und Drittmessungen bleiben getrennt, ebenso die offiziellen RMB‑Preise und die Dollarpreise der Drittanbieter.
- Incertezze
- Die Benchmarks aus dem Repository (DeepSWE, Terminal‑Bench, GPQA Diamond, Codeforces) stammen von DeepSeek selbst und wurden zum Zeitpunkt der Prüfung von keiner unabhängigen Stelle reproduziert. Den direkten Vergleich mit V4‑Pro beziffert das Unternehmen nicht: Die offiziellen Seiten zeigen Diagramme ohne Zahlen. Der unabhängige Wert von Artificial Analysis (40 im Intelligence Index v4.3) ist nicht direkt mit Werten anderer Modelle vergleichbar, die Sekundärquellen auf anderen Versionen des Index nennen — eine Sekundärquelle gibt dem früheren V4‑Flash 0731 den Wert 50, aber auf einer älteren Version, die beiden Zahlen sind also keine Verschlechterung. Die praktischen Folgen der Abschaltung von V4‑Pro für produktive Nutzer sind nicht belegt: Es gibt keine öffentlichen Volumendaten. Die MIT‑Lizenz ist die auf der Hugging‑Face‑Karte angegebene; den vollständigen Text möglicher zusätzlicher Nutzungsklauseln im Repository habe ich nicht geprüft.
- Perché pubblicarla
- Es ist eine Veröffentlichung mit überprüfbarem Artefakt — herunterladbare MIT‑Gewichte und ein technischer Bericht —, selten unter den Ankündigungen dieser Woche, die fast alle auf geschlossenen Benchmarks beruhen. Redaktionell interessant ist nicht die Punktzahl, sondern die industrielle Entscheidung: Ein Labor stellt sein eigenes Spitzenmodell ab und leitet dessen Verkehr auf ein günstigeres um — faktisch das Eingeständnis, dass die obere Preisstufe nicht gerechtfertigt war. So lässt sich die Lücke zwischen behaupteter und gemessener Leistung ohne Spekulation erzählen, weil beide Quellen existieren.