PrismML 的极限量化:效率承诺与缺失的验证
把一个 270 亿参数的模型缩小到能在个人电脑的内存或一块显卡上运行,同时不牺牲它的能力,是近年研究中被反复耕耘的题目之一。2026 年 9 月 17 日,PrismML 公司在自家网站上发布了 Ternary Bonsai 2 27B:一个以 Apache 2.0 许可分发、由 Qwen3.8 27B 压缩而来的多模态模型。其结构采用三值权重,在一个固定的旋转基上只取 -1、0 和 +1,并配以半精度的缩放因子。按官方公告,这一处理把主要版本的体积降到 5.9 吉字节,每个权重的有效比特为 1.76,而作为起点的模型是 53.80 吉字节。但在 Hugging Face 上,技术卡片给出的却是另一个产物的数字:2 比特的 MLX 版本,磁盘上合计占用 8.60 吉字节——其中 0.92 吉字节属于未量化的视觉塔——每个权重的有效比特为 1.72。因此它与公告中的 5.9 吉字节并不构成直接比较,而对外宣传的数字指的是最轻的那种配置。
在性能一侧,公司提供的数据同样对不上。PrismML 网站上的公告给出模型在推理模式下 20 项基准测试的平均分 83.9,相当于原始模型综合平均分的 98.2%;Hugging Face 上的技术卡片算出同样的 98.2%,依据却是 14 项测试,平均 84.78,原始模型为 86.32。正如专业媒体 MarkTechPost 在 2026 年 9 月 18 日所指出的,这些在所有情况下都是内部测量,未经第三方独立复现。外部分析还发现,在复杂的智能体任务中下滑更为明显:在 Terminal-Bench 和 SWE-bench 这类参照上,模型停在原始分数的约 75%。PrismML 自己的文档其实也承认,下降主要集中在知识、推理和视觉这几个类别。
另一重约束来自运行所需的基础设施。这套架构无法通过标准库加载:模型卡片说明,MLX 常规的加载模块不支持该格式所用的哈达玛旋转变换和逆嵌入,因此必须使用 PrismML 自己的运行时,或它维护的 llama.cpp 分支。速度方面,公司公告称在 NVIDIA GeForce RTX 5090 上每秒最高 142.5 个词元,在 Apple M5 Max 上每秒 46.8 个词元;而 Hugging Face 上的卡片对同一块 GPU 给出的数值更低,约为每秒 129 个词元。两份资料都没有说明测量是在何种配置下取得的。这家在自己网站上自称由加州理工学院研究者创立、并列出 Khosla Ventures、Cerberus、谷歌和三星为支持者的公司,称该系统在 RTX 4090 上每个词元耗电 0.714 毫瓦时,按其说法,这比一个全精度的 80 亿参数模型效率高 40%。
在这些数字被第三方复现之前,唯一扎实的仍然只有磁盘上的体积——以及对一个专有 llama.cpp 分支的依赖,它限制了 Apache 2.0 许可在实际中的用处。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 阅读了 prismml.com/news/bonsai-2-27b 上的官方公告:日期、量化方法、每权重比特、5.9 GB、按类别划分的基准表、速度、能耗、许可证、支持者。与 Hugging Face 上的官方模型卡片(prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)交叉比对,后者在体积、测试套件和吞吐量上给出不同数字,并声明了限制以及所需的专用加载器。第三处阅读是 MarkTechPost(2026 年 9 月 18 日):它确认了主要数据,明确将其归于厂商且未经第三方复现,并补充了智能体任务上的下滑。搜索结果中出现的 docs.prismml.com 页面返回 404,未采用。舍弃了 CNN 关于由人工智能生成的情报报告的消息——仅有匿名信源,五角大楼与 Special Operations Command Pacific 未回应置评请求,也没有任何媒体独立证实。
- Incertezze
- 没有任何一项基准被第三方复现:98.2% 是内部测量,而 PrismML 的两份官方出版物由不同套件得出(公告中为 20 项测试,平均 83.9 对 85.4;MLX 模型卡片中为 14 项测试,84.78 对 86.32)。体积也随产物而变:公告中为 5.9 GB,带未量化视觉塔的 2 比特 MLX 版本为 8.60 GB。RTX 5090 上的速度在两份官方资料之间不一致(每秒 142.5 对约 129 个词元),且未声明测试配置。长程智能体任务上的下滑在实际使用中究竟有多重(据 MarkTechPost 在 Terminal-Bench 和 SWE-bench 上约为 75%),以及对专有 llama.cpp 分支的依赖在多大程度上限制了 Apache 2.0 许可的真实使用,仍待厘清。
- Perché pubblicarla
- 这是本周唯一能一路查到底的消息,而且对使用人工智能的人说了具体的事:一个 270 亿参数的模型装进 5.9 GB,带 Apache 2.0 的开放权重,能在 16 GB 的笔记本上运行。但它同时是自报数字的教科书案例:同一家公司的两份官方出版物,对同一个百分比给出不同数值;基准没人重测;开放许可要经过一个只有厂商自己维护的分支。把压缩和它的星号一起讲清楚,正是本站的调子。