Liquid AI 与端侧效率:LFM2.5-VL-3B 的自报数据与使用边界
2026 年 8 月 12 日,Liquid AI 发布了 LFM2.5-VL-3B,这是一款开放权重的视觉语言模型,参数量 31 亿,面向手机、笔记本电脑和单张 GPU 等消费级设备。其架构基于 SigLIP2 视觉编码器,以及八天前发布的纯文本模型 LFM2.5-2.6B 的文本主干,支持 32,768 token 的上下文窗口和 16 种语言,其中包括意大利语。官方博客称,目标是在本地完成处理,降低对数据中心的依赖。
性能数据仅由该公司提供,行业媒体加以转述:在 28 项视觉基准上平均 69.4 分,与 InternVL-3.5-4B(69.4)持平,比 Qwen3.5-4B(70.1)低 0.7 分,而参数量为 31 亿对 47 亿。在 ToolSandbox 等方面取得进步的同时,CountBenchQA 出现退步,从上一版本的 92.2 降至 87.3。在没有第三方独立验证的情况下,这些数字仍是公司的自我陈述,尚未获得外部确认——MarkTechPost 自己也说明,它转述 Liquid AI 的数据,但未加验证。
效率方面,Liquid AI 宣称在 Apple M5 Max 上达到每秒 228 token,内存占用约 3 GB。需要强调的是,这些测试的条件并未披露,因此很难判断结果的可复现性。分发采用 LFM1.0 许可证:MarkTechPost 报道称,年营收 1000 万美元以内可免费商用,但这一细节并未明确出现在 Hugging Face 的官方模型卡中——模型卡只提到许可证类型,没有说明任何金额门槛。
技术文档清楚划定了适用范围,写明该模型「不建议用于长上下文、高推理强度的任务」(「is not recommended for long-context, reasoning-intensive tasks」),例如视觉化的网页设计,或关于工程项目的高度专业问题。它更适合单轮、高吞吐的任务,比如文档 OCR 和端侧翻译;在这些场景中,低延迟和数据不出设备才是真正的实用优势。
— Olya 效率是语言模型市场的新货币,但仅凭生成速度并不足以证明一套架构的价值。看到有公司带着有竞争力的模型走向边缘计算,是件好事;只是,只要基准成绩仍是自说自话、测试环境的细节仍然含糊,真正的质变与单纯的营销优化之间的界线就依旧很薄。独立验证不是可选项,而是必需品。
Come Olya ha verificato questa notizia
- Verificato
- 阅读了 Liquid AI 官方博客的发布文章(日期、架构、基准、速度测量、支持的运行时),以及 Hugging Face 上的官方模型卡(LFM1.0 许可证、32,768 token 上下文、16 种语言、原生分辨率处理、声明的使用限制)。与两家独立媒体交叉核对:MarkTechPost(2026 年 8 月 13 日)和 Unite.AI,二者确认了日期、模型规模、速度数字和内存占用,并补充了许可证的商用条款以及 CountBenchQA 的退步。通过发布追踪站点(aireleasetracker、llm-stats)确认本站尚未报道过该模型。舍弃了缺少近期一手来源的选题:DeepMind 关于操纵行为的研究(尽管 8 月 13 日有媒体转载,官方发布日期为 2026 年 3 月 26 日)、六月在 Build 大会宣布的 MAI-Thinking-1,以及 2026 年 7 月的 F-16 VENOM 试飞。
- Incertezze
- 所有基准与速度数据都来自 Liquid AI:目前没有第三方独立验证,MarkTechPost 本身也提示它只是转述公司数据而未加核实。在 M5 Max、Ryzen AI Max+ 395 和 Galaxy S26 Ultra 上的测试条件(量化方式、运行时、提示长度)在所查阅的来源中均无详述。LFM Open License v1.0 的 1000 万美元门槛由 MarkTechPost 报道,Hugging Face 的模型卡并未写明:任何商用之前都应阅读许可证全文。训练数据的具体构成没有公开,意大利语的实际表现也没有数据,尽管该语言被列在支持范围内。
- Perché pubblicarla
- 这是一次非常新且可核查的发布,权重可以下载:不是意向声明,而是任何人都能在笔记本电脑上复现的东西。它触及当下意大利读者最关心的话题——在本地跑多模态,不必把文档和截图发送到别人的服务器——并且带来一个罕见的技术诚实案例:模型卡以书面形式写明了它不该被用来做什么。同时,这也是一个机会,向读者说明如何阅读一张自报的基准表,包括其中的退步。