Hugging Face 2026年夏季报告:下载量Qwen领跑,但计数器并没有量到全部
8月14日,Hugging Face发布了《State of Open Models: Summer 2026 Observations》,署名者包括Adina Yakefu、Apolinário和Irene Solaiman等人,依据的是2026年前七个月Hub上记录的活动。这段时间里,公开的模型仓库从243万个增至296万个,数据集从71.1万个增至100万个(首次越过这道门槛),Spaces从100万个增至144万个。多年来Hub一直是开放权重模型分发的公共基准平台,它的下载计数器也成了谈论“谁在领先”时被引用得最多的指标。
报告显示,阿里巴巴的Qwen系列聚集了社区构建的151,448个衍生模型:是Meta全部模型总体足迹的2.6倍,是Llama专属衍生模型的4.7倍。增长很稳定——期间平均每天新增约180至210个由Qwen衍生的仓库——并不只集中在发布当天。在Hub上测得的2026年下载量中,Hugging Face给Qwen记下约20.45亿次(把所有仓库都算上则为20.61亿次),谷歌的模型约为4.18亿次,Meta的模型约为2.27亿次。“Qwen has become part of the default workflow for developers deciding what models to fine-tune and deploy”——Hugging Face官方报告(“对于要决定微调和部署哪些模型的人来说,Qwen已经进入了默认的工作流”)。
The Next Web(8月16日,Ana Maria Constantin撰稿)指出,阿里巴巴对外公布的30亿次下载,比Hugging Face 2026年在Hub上测得的数字高出约47%。该媒体补充说:“The 3 billion figure came from Alibaba's own emailed statement”(“30亿这个数字来自阿里巴巴通过电子邮件发出的声明”),而其宣称的“超过30万个”衍生模型也高于Hub上统计的151,448个。The Next Web把差距归因于统计范围:Hugging Face的数据只覆盖Hub,不包含通过API的使用、私有部署以及其他渠道,其中就包括阿里巴巴自家的魔搭ModelScope。阿里巴巴没有公布它计算这30亿次和“超过30万个”所用的方法,Hugging Face也没有就这一落差公开表态;Hub的计数器并不区分生产环境使用、测试与自动化流量,报告本身也指出,来自未注册代理的流量占据了相当可观的比例。
除了排名,报告还把使用结构看得更清楚:85.6%的模型累计下载不足200次(一些第三方摘要写成“大约一半”:应以官方文本为准),而1.5%的仓库占据了全部下载量的99.2%;参数量低于10亿的模型拿走了历史下载量的83%,超过1000亿的只有1%。把下载量前25名与点赞数前25名放在一起比较,只有一个仓库同时出现在两份榜单里:关注度和使用量量的是两回事。在规模方面,中国的实验室已经发布了参数量高达2.78万亿的开放权重模型;在所分析的七个月中有五个月,美国实验室发布的最大开放模型都停留在1300亿参数以下。2026年统计到的178次参数量超过200亿的中国开放权重发布中,59%采用Apache 2.0许可证,22%采用MIT;这些比例只适用于这一子集。
如果计数器仍是最顺手的指南针,那也值得记住它把什么留在了外面。Qwen在Hub上的领先毫无疑问,但它与厂商自己宣称的数字之间的距离,说到底讲的是缺少一套关于真实使用情况的共同指标。只要统计范围和方法各不相同,图表给出的就是趋势,而不是判决。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 我在Hugging Face官方博客上打开并读完了这份一手报告(huggingface.co/blog/state-of-open-models-summer-2026),核对了发布日期(2026年8月14日)、作者以及具体数字:仓库、数据集、Spaces、下载量分布、Qwen衍生模型、参数门槛、许可证。作为独立印证,我读了The Next Web 8月16日的报道,它列出了同样的Hub数字,还额外记录了与阿里巴巴所称数据的落差及其来源(通过电子邮件发出的声明);另在Fortune(8月15日)和8月16日的Techmeme汇总中做了进一步比对。我舍弃了同一时间窗内缺乏官方确认的消息:Stripe收购OpenRouter(Stripe未予确认,“我们不评论传闻”)以及NVIDIA与OpenAI的信贷担保。宾夕法尼亚州立大学的DNA-钙钛矿忆阻器也被舍弃:8月16至17日的报道翻炒的是2026年1月19日发表在《Advanced Functional Materials》上的论文,以及2月就已发出的新闻稿,算不上本周新闻。F-16 VENOM的自主飞行同样排除,因为DARPA的发布日期是7月16日。
- Incertezze
- 这些数据只覆盖Hugging Face的Hub:通过API的使用、私有部署、ModelScope及其他渠道都不在其中,因此两个数字(Hugging Face的20.45亿次和阿里巴巴的30亿次)都无法描述模型的真实总体使用情况。阿里巴巴没有公布计算自家30亿次下载和“超过30万个”衍生模型所用的方法,Hugging Face也没有就这一落差公开表态。下载量统计不区分生产环境使用、测试与自动化流量,报告本身也指出来自未注册代理的流量占比相当可观。一些第三方新闻摘要对下载量低于200次的模型占比给出了不同的说法(有一例写成“大约一半”,而非报告中的85.6%):应以官方文本中的数据为准。许可证的百分比只涉及参数量超过200亿的中国发布,不代表整个生态。
- Perché pubblicarla
- 这是本周关于开放模型生态最扎实的系统性数据,来自一个把自己的数字完整公开的一手信源,可以逐行核验。更重要的是,它给读者提供了常规报道里缺席的两样东西:绝大多数已发布模型实际上被使用得多么少的量度(1.5%的仓库占了99.2%的下载量),以及企业自称的数字与第三方平台实测数字之间落差的具体案例——这有助于学会读懂排行榜,而不只是引用它。
Fonti / Sources
- Hugging Face — State of Open Models: Summer 2026 Observations (report ufficiale)
- The Next Web — Qwen is the world's most downloaded open model, by a smaller margin than Alibaba says (16 agosto 2026)
- Fortune — Alibaba AI models hit 3 billion downloads, passing Meta, Google (15 agosto 2026)
- Techmeme — rassegna del report Hugging Face (16 agosto 2026)