La quantification extrême de PrismML, entre promesses d'efficacité et vérifications absentes
Réduire un modèle de 27 milliards de paramètres pour le faire tourner dans la mémoire d'un ordinateur personnel ou sur une seule carte graphique, sans sacrifier ses capacités, est l'un des sujets les plus travaillés de la recherche récente. Le 17 septembre 2026, la société PrismML a publié sur son propre site la sortie de Ternary Bonsai 2 27B, un modèle multimodal distribué sous licence Apache 2.0 et issu de la compression de Qwen3.8 27B. La structure emploie des poids ternaires limités aux seules valeurs -1, 0 et +1 dans une base tournée fixe, assortis de facteurs d'échelle en demi-précision. Selon l'annonce officielle, l'opération ramène l'encombrement de la variante principale à 5,9 gigaoctets avec 1,76 bit effectif par poids, contre 53,80 gigaoctets pour le modèle de départ. Sur Hugging Face, la fiche technique donne pourtant les chiffres d'un autre artefact : la version MLX en 2 bits, qui occupe 8,60 gigaoctets au total sur disque — dont 0,92 gigaoctet pour la tour de vision non quantifiée — avec 1,72 bit effectif par poids. La comparaison avec les 5,9 gigaoctets de l'annonce n'est donc pas directe, et le chiffre mis en avant renvoie à la configuration la plus légère.
Côté performances non plus, les données fournies par l'entreprise ne concordent pas. L'annonce sur le site de PrismML attribue au modèle un score moyen de 83,9 sur une série de 20 tests en mode raisonnement, soit 98,2 % de la moyenne agrégée du modèle d'origine ; la fiche technique sur Hugging Face aboutit au même 98,2 % mais le tire de 14 tests, avec une moyenne de 84,78 contre 86,32 pour le modèle original. Comme l'a relevé le site spécialisé MarkTechPost le 18 septembre 2026, il s'agit dans tous les cas de mesures internes, non reproduites de manière indépendante par des tiers. L'analyse externe note en outre que la baisse s'accentue sur les tâches agentiques complexes, où le modèle s'arrête à environ 75 % du score d'origine sur des références comme Terminal-Bench et SWE-bench. La documentation de PrismML admet du reste elle-même que le recul concerne surtout les catégories connaissance, raisonnement et vision.
Une autre contrainte tient à l'infrastructure nécessaire pour l'exécuter. L'architecture ne peut pas être chargée via les bibliothèques standard : la fiche du modèle précise que les modules de chargement ordinaires de MLX ne prennent pas en charge les transformations de rotation de Hadamard ni l'embedding inverse utilisés par le format, ce qui rend obligatoire le runtime maison de PrismML ou son fork de llama.cpp. Pour la vitesse, l'annonce de l'entreprise indique jusqu'à 142,5 jetons par seconde sur une NVIDIA GeForce RTX 5090 et 46,8 jetons par seconde sur un Apple M5 Max, tandis que la fiche sur Hugging Face attribue au même GPU une valeur inférieure, de l'ordre de 129 jetons par seconde. Aucune des deux sources n'indique la configuration dans laquelle la mesure a été obtenue. L'entreprise, qui se présente sur son site comme née de chercheurs de Caltech et cite parmi ses soutiens Khosla Ventures, Cerberus, Google et Samsung, attribue au système une consommation de 0,714 milliwattheure par jeton sur RTX 4090, ce qui serait selon elle 40 % plus efficace qu'un modèle de 8 milliards de paramètres en pleine précision.
Tant que ces chiffres ne seront pas reproduits par des tiers, la seule donnée solide reste l'encombrement sur le disque — et la dépendance à un fork propriétaire de llama.cpp, qui limite en pratique la portée de la licence Apache 2.0.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Lu l'annonce officielle sur prismml.com/news/bonsai-2-27b : date, méthode de quantification, bits par poids, 5,9 Go, tableau des tests par catégorie, vitesse, consommation, licence, soutiens. Recoupé avec la fiche officielle du modèle sur Hugging Face (prism-ml/Ternary-Bonsai-2-27B-mlx-2bit), qui donne d'autres chiffres pour la taille, la suite de tests et le débit, et qui déclare les limites ainsi que le chargeur maison requis. Troisième lecture sur MarkTechPost (18 septembre 2026) : le site confirme les données principales, les attribue explicitement au fabricant comme non reproduites par des tiers, et ajoute les baisses sur les tâches agentiques. La page docs.prismml.com indiquée par les résultats de recherche répond 404 : non utilisée. Écartée l'information de CNN sur le rapport de renseignement généré par IA — uniquement des sources anonymes, aucune réponse du Pentagone ni du Special Operations Command Pacific, aucune confirmation indépendante.
- Incertezze
- Aucun test n'a été reproduit par des tiers : les 98,2 % sont une mesure interne, et les deux publications officielles de PrismML la tirent de suites différentes (20 tests, moyenne de 83,9 sur 85,4 dans l'annonce ; 14 tests, 84,78 sur 86,32 dans la fiche MLX). L'encombrement change aussi selon l'artefact : 5,9 Go dans l'annonce, 8,60 Go pour la variante MLX en 2 bits avec sa tour de vision non quantifiée. Les vitesses sur RTX 5090 divergent entre les deux sources officielles (142,5 contre environ 129 jetons par seconde) sans que la configuration de test soit indiquée. Reste à savoir combien pèse en pratique la baisse sur les tâches agentiques longues (~75 % sur Terminal-Bench et SWE-bench selon MarkTechPost) et dans quelle mesure la dépendance à un fork propriétaire de llama.cpp limite l'usage réel de la licence Apache 2.0.
- Perché pubblicarla
- C'est l'information de la semaine que l'on peut vérifier jusqu'au bout, et elle dit quelque chose de concret à qui utilise l'IA : un modèle de 27 milliards de paramètres qui tient dans 5,9 Go, avec des poids ouverts Apache 2.0, tourne sur un portable de 16 Go. Mais c'est aussi un cas d'école de chiffres autodéclarés : deux publications officielles de la même entreprise donnent des valeurs différentes pour le même pourcentage, personne n'a refait les tests, et la licence ouverte passe par un fork que seul le fabricant maintient. Raconter ensemble la compression et ses astérisques, c'est exactement le registre du site.