Naive-N0.5-Flash:NaiveAI称借助AI打造的模型
2026年9月27日,北京初创公司NaiveAI在Hugging Face上发布了Naive-N0.5-Flash模型,采用MIT许可证。据模型卡介绍,这并非从零设计的架构,而是在小米开放权重基座模型MiMo-V2.5的基础上,追加训练了3.25万亿个token。该系统采用混合专家结构,总参数3090亿,每个token激活155亿;通过结合滑动窗口注意力层与DeepSeek Sparse Attention技术,原生支持100万token的上下文。不过,MIT许可证如何与小米基座模型的许可条款相衔接,目前并不完全清楚。
这个项目的特别之处在于开发方式,该公司在技术博客中称之为“以AI为中心的研发”。博客写道,人类研究员负责确定方向、约束和标准,并做出关键决策,而实现、优化、实验和分析则交给AI模型完成。同一篇文章中写道:“人类研究员确定方向,定义约束和标准,并做出关键决策。人类的优势在于经验、直觉和判断力。”然而,独立媒体Runtime Wire指出,已公开的文件并未说明AI实际完成了多少工作、这一贡献如何衡量,也没有说明这种方法是否真能降低未来的开发成本。该媒体还将这家公司与清华大学副教授代季峰(Jifeng Dai)联系起来,他曾任职于微软亚洲研究院和商汤科技。
在性能和成本方面,模型卡列出的API价格为每百万输入token 0.10美元、每百万输出token 0.40美元;Runtime Wire则报道了人民币价目:每百万输入0.60元、输出2.60元。两组数字来源不同,也与汇率不完全吻合。模型运行需要支持FP8的英伟达GPU,公司为此推出了自研推理系统NaiveRT,标准速度为每用户每秒50个token,Ultrafast模式下据称可达2000个。公司博客称这一峰值来自八卡配置,但未说明GPU型号;Runtime Wire则补充说,每秒超过2100个token的测量结果来自仅限单一数据流的解码测试。
官方GitHub仓库中展示的所有性能基准,都来自一个名为AutoResearch、基于Claude Code的内部评测协议。由于结果只以图表形式呈现,且未经独立第三方验证,这家初创公司所称的具体分数无法得到确认。缺乏外部核实,理应保持谨慎——每当发布速度快过指标的可验证性,这个问题总会出现。
把写代码的活交给另一台机器,或许能加快发布节奏,但真正的不对称在于验证:要确认AI的工作成果,仍然离不开人类的判断力,而这正是该公司宣称的自身把关所在。只要基准测试仍由内部协议衡量、未经第三方复现,所称的性能就应被视为公司的说法,而非经过验证的数据。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 查阅了Hugging Face官方模型卡(NaiveAI/Naive-N0.5-Flash),核对参数、注意力架构、MIT许可证、基座模型MiMo-V2.5、3.25万亿token、价格、硬件要求以及“以AI为中心的研发”这一表述。从官方博客naive.ai获取标题、2026年9月27日的日期、人类与AI的分工,以及Ultrafast模式的8块GPU。从官方GitHub仓库获取评测方法(内部评测框架、Claude Code 2.1.207、采样参数)和基准列表,并确认GPU型号未注明。独立佐证来自Runtime Wire(日期、规格、每秒2122 token的峰值、批评意见、与代季峰的关联);AI Weekly等也证实了发布。由于训练数据未公开,未使用“开源”一词。
- Incertezze
- 没有任何基准经过独立验证,全部由公司内部评测框架测得。README只以图表展示分数,因此不宜引用具体数字。NaiveAI没有量化AI完成了多少工作,也没说明如何衡量。每秒2000 token所用的GPU未注明,且该数据来自单数据流解码测试。美元和人民币价格来源不同,与汇率不符。MIT许可证在多大程度上受MiMo-V2.5条款约束,尚不清楚。
- Perché pubblicarla
- 这是一款采用MIT许可证的大型开放权重模型,支持100万token上下文,不使用完整注意力,价格位居市场最低之列。公司还声称大部分研发由AI完成,这一说法需谨慎报道。它也体现了开放权重的连锁效应:初创公司在小米的基座上继续开发。此前尚未报道(关于小米MiMo的文章涉及的是另一款模型)。