A quantização extrema da PrismML, entre promessas de eficiência e verificações em falta
Reduzir um modelo de 27 mil milhões de parâmetros para que funcione na memória de um computador pessoal ou numa única placa gráfica, sem comprometer as suas capacidades, é um dos temas mais trabalhados da investigação recente. A 17 de setembro de 2026, a empresa PrismML publicou no seu próprio site o lançamento do Ternary Bonsai 2 27B, um modelo multimodal distribuído com licença Apache 2.0 e obtido a partir da compressão do Qwen3.8 27B. A estrutura utiliza pesos ternários limitados apenas aos valores -1, 0 e +1 numa base rodada fixa, acompanhados de fatores de escala em meia precisão. Segundo o anúncio oficial, a operação reduz o tamanho da variante principal para 5,9 gigabytes com 1,76 bits efetivos por peso, contra os 53,80 gigabytes do modelo de partida. Na plataforma Hugging Face, contudo, a ficha técnica apresenta os números de outro artefacto: a versão MLX de 2 bits, que ocupa 8,60 gigabytes no total em disco — dos quais 0,92 gigabytes para a torre de visão não quantizada — com 1,72 bits efetivos por peso. A comparação com os 5,9 gigabytes do anúncio não é, portanto, direta, e o valor publicitado refere-se à configuração mais leve.
Também no capítulo do desempenho os dados fornecidos pela empresa não coincidem. O anúncio no site da PrismML atribui ao modelo uma pontuação média de 83,9 numa série de 20 benchmarks em modo de raciocínio, equivalente a 98,2% da média agregada do modelo de origem; a ficha técnica no Hugging Face chega à mesma percentagem de 98,2%, mas retira-a de 14 testes, com uma média de 84,78 contra os 86,32 do modelo original. Como assinalou a publicação especializada MarkTechPost a 18 de setembro de 2026, trata-se em todos os casos de medições internas, não reproduzidas de forma independente por terceiros. A análise externa nota ainda que a queda se torna mais marcada nas tarefas agênticas complexas, onde o modelo fica por cerca de 75% da pontuação original em referências como Terminal-Bench e SWE-bench. A própria documentação da PrismML admite, de resto, que a descida afeta sobretudo as categorias de conhecimento, raciocínio e visão.
Outra limitação diz respeito à infraestrutura necessária para a execução. A arquitetura não pode ser carregada através das bibliotecas padrão: a model card esclarece que os módulos de carregamento habituais do MLX não suportam as transformações de rotação de Hadamard nem o embedding inverso usados pelo formato, tornando obrigatório o runtime próprio da PrismML ou o seu fork do llama.cpp. Quanto à velocidade, o anúncio da empresa indica até 142,5 tokens por segundo numa NVIDIA GeForce RTX 5090 e 46,8 tokens por segundo num Apple M5 Max, enquanto a ficha no Hugging Face atribui à mesma GPU um valor inferior, de cerca de 129 tokens por segundo. Nenhuma das duas fontes declara a configuração com que a medição foi obtida. A empresa, que no seu site se apresenta como nascida de investigadores do Caltech e aponta entre os apoiantes a Khosla Ventures, a Cerberus, a Google e a Samsung, atribui ao sistema um consumo de 0,714 miliwatt-hora por token numa RTX 4090, que segundo a própria empresa seria 40% mais eficiente do que um modelo de 8 mil milhões de parâmetros em precisão total.
Enquanto os números não forem reproduzidos por terceiros, o único dado sólido continua a ser o espaço ocupado em disco — e a dependência de um fork proprietário do llama.cpp, que limita na prática o alcance da licença Apache 2.0.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Lido o anúncio oficial em prismml.com/news/bonsai-2-27b: data, método de quantização, bits por peso, 5,9 GB, tabela de benchmarks por categoria, velocidade, consumo, licença, apoiantes. Cruzado com a model card oficial no Hugging Face (prism-ml/Ternary-Bonsai-2-27B-mlx-2bit), que dá números diferentes para tamanho, conjunto de testes e débito e declara os limites e o carregador próprio exigido. Terceira leitura no MarkTechPost (18 de setembro de 2026): confirma os dados principais, atribui-os explicitamente ao fabricante como não reproduzidos por terceiros e acrescenta as quedas nas tarefas agênticas. A página docs.prismml.com indicada nos resultados de pesquisa responde 404: não utilizada. Descartada a notícia da CNN sobre o relatório de informações gerado com IA — apenas fontes anónimas, sem resposta do Pentágono nem do Special Operations Command Pacific e sem confirmação independente.
- Incertezze
- Nenhum benchmark foi reproduzido por terceiros: os 98,2% são uma medição interna, e as duas publicações oficiais da PrismML retiram-na de conjuntos diferentes (20 testes, média de 83,9 sobre 85,4 no anúncio; 14 testes, 84,78 sobre 86,32 na model card MLX). Também o tamanho muda consoante o artefacto: 5,9 GB no anúncio, 8,60 GB na variante MLX de 2 bits com torre de visão não quantizada. As velocidades na RTX 5090 divergem entre as duas fontes oficiais (142,5 contra cerca de 129 tokens por segundo), sem que seja declarada a configuração de teste. Falta perceber quanto pesa na prática a queda nas tarefas agênticas longas (~75% em Terminal-Bench e SWE-bench segundo o MarkTechPost) e até que ponto a dependência de um fork proprietário do llama.cpp limita o uso real da licença Apache 2.0.
- Perché pubblicarla
- É a notícia da semana que se consegue verificar até ao fim, e diz algo de concreto a quem usa IA: um modelo de 27 mil milhões de parâmetros que cabe em 5,9 GB, com pesos abertos Apache 2.0, corre num portátil de 16 GB. Mas é também um caso de manual de números autodeclarados: duas publicações oficiais da mesma empresa dão valores diferentes para a mesma percentagem, ninguém repetiu os benchmarks, e a licença aberta passa por um fork que só o fabricante mantém. Contar em conjunto a compressão e os seus asteriscos é exatamente o registo do site.