DeepSeek 发布 V4.1‑Flash:5520 亿参数 MoE 模型,MIT 许可,新价目表低峰时段半价
DeepSeek 于 2026 年 9 月 10 日宣布发布 DeepSeek‑V4.1‑Flash,将权重放上 Hugging Face 仓库(deepseek-ai/DeepSeek-V4.1-Flash),并同时提供官方 API 文档。该模型被描述为主干含 5520 亿参数的 MoE(混合专家)模型,但激活是非对称的:输入阶段(prefill)激活 80 亿参数,输出阶段(decode)激活 160 亿。Causal Encoder‑Decoder(CED)架构包含 40 层 Transformer(编码器 20 层、解码器 20 层),每层 384 个专家,每个 token 激活其中 6 个,另有一个 1960 亿参数的条件记忆 Engram。最大上下文为一百万 token,注意力机制为 Compressed Sparse Attention 2(CSA2),KV 缓存采用 FP4(E2M1)格式。
新价目表已于 2026 年 9 月 10 日 04:00 UTC 生效,低峰时段价格为高峰时段的 50%。TechNode 报道的 V4.1‑Flash 低峰价为:每百万输入 token 缓存命中 0.02 元、缓存未命中 1 元,每百万输出 token 4 元;高峰时段价格翻倍。独立分析机构 Artificial Analysis 列出了在第三方供应商处观察到的价格:每百万输入 token 0.30 美元,每百万输出 token 1.20 美元。
仓库中列出的基准成绩均为自行公布:DeepSWE v1.1 解决率 74.2%,Terminal‑Bench 2.1 Pass@1 90.6%,GPQA Diamond Pass@1 90.9%,Codeforces 评分 3471。Artificial Analysis 给 V4.1‑Flash(Reasoning, Max Effort)在 Artificial Analysis Intelligence Index v4.3 上打出 40 分,在同级别的 113 个模型中排第 6,并测得每秒 217.1 token 的速度(第 3),总输出量为 2.5 亿 token,比 1.4 亿的中位数更啰嗦。
DeepSeek 为这一决定给出的理由是,V4.1‑Flash 在 “in performance, cost, speed and total completion time in internal and external testing” 上超过了 V4‑Pro(该表态由 TechNode 报道)。但这一比较没有量化:官方页面只有图表,没有可对照的数字。
自 2026 年 9 月 14 日起,所有发往 deepseek‑v4‑pro 的请求都将转由 V4.1‑Flash 承接,并按 V4.1‑Flash 计费,直至 V4.1‑Pro 推出。V4‑Flash 与 V4‑Flash‑Vision‑Exp 已下线,其名称暂时重定向到 V4.1‑Flash。新模型的 API 标识为 **deepseek-flash**。MIT 许可写在 Hugging Face 模型卡上;权重以 Safetensors 格式提供,技术报告(DeepSeek_V41_Tech_Report.pdf)发布在同一仓库。
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- 我读了 DeepSeek API 文档中的官方公告(api-docs.deepseek.com/news/news260910)和 deepseek.com 的新闻页:两者在日期、架构、参数、KV 缓存效率、新价目表以及 9 月 14 日起 deepseek-v4-pro 的转发上一致。在 Hugging Face 官方仓库中,我确认了权重确实可以下载(Safetensors),并核对了 MIT 许可、架构细节(CED、CSA2、Engram、DeepSeek-ViT)、一百万 token 的上下文和基准表格。作为独立佐证,我读了 TechNode(日期、公司表态、人民币价目)以及 Artificial Analysis 的页面,那是第三方测量(Intelligence Index v4.3 = 40,217.1 token/秒,输出量 2.5 亿 token)。自行公布的数字与第三方测量的数字分开处理,官方人民币价格与第三方供应商的美元价格同样分开。
- Incertezze
- 仓库中的基准(DeepSWE、Terminal‑Bench、GPQA Diamond、Codeforces)由 DeepSeek 自行公布,截至核查时尚无独立第三方复现。与 V4‑Pro 的直接比较,公司没有给出数字:官方页面只有图表。Artificial Analysis 的独立分数(Intelligence Index v4.3 得 40)无法与二手来源引用的、基于不同版本指数的其他模型分数直接对比——某个二手来源给此前的 V4‑Flash 0731 打了 50 分,但那是更早版本的指数,因此这两个数字不能读作退步。V4‑Pro 下线对生产环境用户的实际影响未经核实:没有公开的用量数据。MIT 许可是 Hugging Face 卡片上所声明的;仓库中可能存在的附加使用条款全文我没有核对。
- Perché pubblicarla
- 这是一次带有可核验产物的发布——可下载的 MIT 权重加技术报告——在本周几乎清一色闭源基准的公告中相当罕见。真正有编辑价值的不是分数,而是这项产业决定:一家实验室让自家旗舰退场,把它的流量转到更便宜的模型上,等于承认自己价目表的高端档并不合理。因为两类来源都在,我们可以不靠猜测就把宣称性能与实测性能之间的落差讲清楚。