DeepSeek lance V4.1‑Flash : modèle MoE de 552 milliards de paramètres, licence MIT et nouveau tarif avec heures creuses à moitié prix
DeepSeek a annoncé le 10 septembre 2026 la sortie de DeepSeek‑V4.1‑Flash, en mettant les poids à disposition dans le dépôt Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) ainsi que la documentation officielle de l'API. Le modèle est décrit comme un MoE (Mixture‑of‑Experts) de 552 milliards de paramètres dans le backbone, mais à activation asymétrique : 8 milliards de paramètres actifs en phase d'entrée (prefill) et 16 milliards en phase de sortie (decode). L'architecture Causal Encoder‑Decoder (CED) compte 40 couches Transformer (20 encodeurs, 20 décodeurs) et 384 experts par couche, dont 6 activés par token, plus une mémoire conditionnelle Engram de 196 milliards de paramètres. Le contexte maximal atteint un million de tokens, avec une attention Compressed Sparse Attention 2 (CSA2) et un cache KV au format FP4 (E2M1).
La grille tarifaire est entrée en vigueur à 04:00 UTC le 10 septembre 2026, les tarifs en heures creuses valant 50 % de ceux des heures pleines. TechNode rapporte les tarifs creux de V4.1‑Flash : 0,02 RMB par million de tokens en entrée avec cache‑hit, 1 RMB par million en entrée avec cache‑miss et 4 RMB par million en sortie ; en heures pleines, les prix doublent. Artificial Analysis, analyste indépendant, relève chez des fournisseurs tiers des prix de 0,30 USD par million de tokens en entrée et 1,20 USD par million en sortie.
Les benchmarks figurant dans le dépôt sont auto‑déclarés : DeepSWE v1.1 (74,2 % résolus), Terminal‑Bench 2.1 (90,6 % Pass@1), GPQA Diamond (90,9 % Pass@1) et un classement Codeforces de 3471. Artificial Analysis a évalué V4.1‑Flash (Reasoning, Max Effort) à 40 points sur l'Artificial Analysis Intelligence Index v4.3, soit la 6ᵉ place sur 113 modèles de la même catégorie, et a mesuré une vitesse de 217,1 tokens par seconde (3ᵉ place) pour une production totale de 250 millions de tokens, plus verbeuse que la médiane de 140 millions.
DeepSeek justifie ce choix en affirmant que V4.1‑Flash a dépassé V4‑Pro « in performance, cost, speed and total completion time in internal and external testing » (déclaration rapportée par TechNode). La comparaison n'est toutefois pas chiffrée : les pages officielles montrent des graphiques sans chiffres comparables.
À partir du 14 septembre 2026, toutes les requêtes adressées au modèle deepseek‑v4‑pro seront redirigées vers V4.1‑Flash, aux tarifs de V4.1‑Flash, en attendant la sortie de V4.1‑Pro. Les modèles V4‑Flash et V4‑Flash‑Vision‑Exp ont été retirés, leurs noms renvoyant temporairement vers V4.1‑Flash. L'identifiant API du nouveau modèle est **deepseek-flash**. La licence MIT est indiquée sur la fiche Hugging Face ; les poids sont fournis au format Safetensors et le rapport technique (DeepSeek_V41_Tech_Report.pdf) est publié dans le même dépôt.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- J'ai lu l'annonce officielle dans la documentation API de DeepSeek (api-docs.deepseek.com/news/news260910) et la page actualités de deepseek.com : elles concordent sur la date, l'architecture, les paramètres, l'efficacité du cache KV, la nouvelle grille tarifaire et le routage de deepseek-v4-pro à partir du 14 septembre. Dans le dépôt officiel Hugging Face, j'ai vérifié que les poids sont réellement téléchargeables (Safetensors), la licence MIT, les détails d'architecture (CED, CSA2, Engram, DeepSeek-ViT), le contexte d'un million de tokens et le tableau des benchmarks. Comme confirmation indépendante, j'ai lu TechNode (date, déclaration de l'entreprise, tarifs en RMB) et la fiche d'Artificial Analysis, mesure tierce (Intelligence Index v4.3 = 40, 217,1 tokens/s, verbosité de 250 millions de tokens). Les chiffres auto‑déclarés restent séparés de ceux mesurés par des tiers, tout comme les prix officiels en RMB et ceux en dollars des fournisseurs tiers.
- Incertezze
- Les benchmarks du dépôt (DeepSWE, Terminal‑Bench, GPQA Diamond, Codeforces) sont auto‑déclarés par DeepSeek et, au moment de la vérification, aucun tiers indépendant ne les avait reproduits. La comparaison directe avec V4‑Pro n'est pas chiffrée par l'entreprise : les pages officielles montrent des graphiques sans chiffres. Le score indépendant d'Artificial Analysis (40 sur l'Intelligence Index v4.3) n'est pas directement comparable aux scores d'autres modèles cités par des sources secondaires sur des versions différentes de l'indice — une source secondaire attribue 50 au précédent V4‑Flash 0731, mais sur une version antérieure : les deux nombres ne doivent donc pas se lire comme une dégradation. L'impact pratique du retrait de V4‑Pro sur ceux qui l'utilisent en production n'est pas vérifié : aucune donnée publique sur les volumes. La licence MIT est celle déclarée sur la fiche Hugging Face ; je n'ai pas vérifié le texte intégral d'éventuelles clauses d'usage annexes dans le dépôt.
- Perché pubblicarla
- C'est une sortie avec un artefact vérifiable — des poids MIT téléchargeables et un rapport technique —, chose rare parmi les annonces de la semaine, presque toutes à benchmarks fermés. L'intérêt éditorial n'est pas le score mais la décision industrielle : un laboratoire met son propre modèle phare à la retraite en détournant son trafic vers un modèle moins cher, admettant de fait que le haut de sa grille tarifaire n'était pas justifié. Cela permet de raconter l'écart entre performances annoncées et mesurées sans spéculer, puisque les deux sources existent.