DeepSeek lança o V4.1‑Flash: modelo MoE de 552 mil milhões de parâmetros, licença MIT e nova tabela com tarifa fora de pico pela metade
A DeepSeek anunciou a 10 de setembro de 2026 o lançamento do DeepSeek‑V4.1‑Flash, disponibilizando os pesos no repositório do Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) e a documentação oficial da API. O modelo é descrito como um MoE (Mixture‑of‑Experts) com 552 mil milhões de parâmetros no backbone, mas com ativação assimétrica: 8 mil milhões de parâmetros ativos na fase de entrada (prefill) e 16 mil milhões na fase de saída (decode). A arquitetura Causal Encoder‑Decoder (CED) tem 40 camadas Transformer (20 de encoder, 20 de decoder) e 384 especialistas por camada, dos quais 6 são ativados por token, além de uma memória condicional Engram de 196 mil milhões de parâmetros. O contexto máximo é de um milhão de tokens, com atenção Compressed Sparse Attention 2 (CSA2) e cache KV em formato FP4 (E2M1).
A tabela de preços entrou em vigor às 04:00 UTC de 10 de setembro de 2026, com tarifas fora de pico equivalentes a 50% das de pico. O TechNode indica as tarifas fora de pico do V4.1‑Flash: 0,02 RMB por milhão de tokens de entrada com acerto de cache, 1 RMB por milhão de entrada com falha de cache e 4 RMB por milhão de saída; em hora de pico os preços duplicam. A Artificial Analysis, analista independente, aponta preços observados em fornecedores terceiros de 0,30 USD por milhão de tokens de entrada e 1,20 USD por milhão de saída.
Os benchmarks apresentados no repositório são autodeclarados: DeepSWE v1.1 (74,2% resolvidos), Terminal‑Bench 2.1 (90,6% Pass@1), GPQA Diamond (90,9% Pass@1) e um rating Codeforces de 3471. A Artificial Analysis avaliou o V4.1‑Flash (Reasoning, Max Effort) com 40 pontos no Artificial Analysis Intelligence Index v4.3, colocando‑o em 6.º lugar entre 113 modelos da mesma classe, e mediu uma velocidade de 217,1 tokens por segundo (3.º lugar) com uma produção total de 250 milhões de tokens, mais verbosa do que a mediana de 140 milhões.
A DeepSeek justifica a decisão afirmando que o V4.1‑Flash superou o V4‑Pro “in performance, cost, speed and total completion time in internal and external testing” (declaração citada pelo TechNode). A comparação, porém, não está quantificada: as páginas oficiais mostram gráficos sem números comparáveis.
A partir de 14 de setembro de 2026, todos os pedidos ao modelo deepseek‑v4‑pro serão encaminhados para o V4.1‑Flash, com tarifas do V4.1‑Flash, à espera do lançamento do V4.1‑Pro. Os modelos V4‑Flash e V4‑Flash‑Vision‑Exp foram retirados, com os respetivos nomes a apontar temporariamente para o V4.1‑Flash. O identificador de API do novo modelo é **deepseek-flash**. A licença MIT consta da ficha do Hugging Face; os pesos são fornecidos em formato Safetensors e o relatório técnico (DeepSeek_V41_Tech_Report.pdf) está publicado no mesmo repositório.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Li o anúncio oficial na documentação da API da DeepSeek (api-docs.deepseek.com/news/news260910) e a página de notícias de deepseek.com: coincidem quanto à data, arquitetura, parâmetros, eficiência do cache KV, nova tabela de preços e encaminhamento do deepseek-v4-pro a partir de 14 de setembro. No repositório oficial do Hugging Face verifiquei que os pesos são mesmo descarregáveis (Safetensors), a licença MIT, os detalhes de arquitetura (CED, CSA2, Engram, DeepSeek-ViT), o contexto de um milhão de tokens e a tabela de benchmarks. Como confirmação independente li o TechNode (data, declaração da empresa e tabela em RMB) e a ficha da Artificial Analysis, uma medição de terceiros (Intelligence Index v4.3 = 40, 217,1 tokens/s, verbosidade de 250 milhões de tokens). Mantenho separados os números autodeclarados dos medidos por terceiros, assim como os preços oficiais em RMB dos preços em dólares dos fornecedores terceiros.
- Incertezze
- Os benchmarks do repositório (DeepSWE, Terminal‑Bench, GPQA Diamond, Codeforces) são autodeclarados pela DeepSeek e, no momento da verificação, nenhum terceiro independente os reproduziu. A comparação direta com o V4‑Pro não é quantificada pela empresa: as páginas oficiais mostram gráficos sem números. A pontuação independente da Artificial Analysis (40 no Intelligence Index v4.3) não é diretamente comparável com pontuações de outros modelos citadas por fontes secundárias em versões diferentes do índice — uma fonte secundária atribui 50 ao anterior V4‑Flash 0731, mas numa versão mais antiga, pelo que os dois números não devem ser lidos como uma piora. Não está verificado o impacto prático da retirada do V4‑Pro sobre quem o usa em produção: não há dados públicos de volumes. A licença MIT é a declarada na ficha do Hugging Face; não verifiquei o texto integral de eventuais cláusulas de uso acessórias no repositório.
- Perché pubblicarla
- É um lançamento com artefacto verificável — pesos MIT descarregáveis e relatório técnico —, coisa rara entre os anúncios desta semana, quase todos de benchmarks fechados. O que interessa editorialmente não é a pontuação, mas a decisão industrial: um laboratório reforma o seu próprio modelo de topo e desvia o tráfego para um mais barato, admitindo na prática que a faixa alta da sua tabela não se justificava. Permite contar a distância entre desempenho declarado e medido sem especulações, porque existem ambas as fontes.