La cuantización extrema de PrismML, entre promesas de eficiencia y verificaciones ausentes
Reducir un modelo de 27.000 millones de parámetros para que funcione en la memoria de un ordenador personal o de una sola tarjeta gráfica, sin sacrificar sus capacidades, es uno de los temas más trabajados de la investigación reciente. El 17 de septiembre de 2026 la empresa PrismML publicó en su propio sitio el lanzamiento de Ternary Bonsai 2 27B, un modelo multimodal distribuido con licencia Apache 2.0 y derivado de la compresión de Qwen3.8 27B. La estructura emplea pesos ternarios limitados a los valores -1, 0 y +1 en una base rotada fija, acompañados de factores de escala en media precisión. Según el anuncio oficial, la operación reduce el tamaño de la variante principal a 5,9 gigabytes con 1,76 bits efectivos por peso, frente a los 53,80 gigabytes del modelo de partida. En Hugging Face, sin embargo, la ficha técnica recoge los números de otro artefacto: la versión MLX de 2 bits, que ocupa 8,60 gigabytes en total en disco —0,92 de ellos para la torre de visión sin cuantizar— con 1,72 bits efectivos por peso. La comparación con los 5,9 gigabytes del anuncio no es, por tanto, directa, y la cifra publicitada se refiere a la configuración más ligera.
En el terreno del rendimiento los datos de la empresa tampoco encajan entre sí. El anuncio del sitio de PrismML atribuye al modelo una puntuación media de 83,9 en una serie de 20 pruebas en modo de razonamiento, equivalente al 98,2 % de la media agregada del modelo original; la ficha técnica de Hugging Face calcula ese mismo 98,2 % pero lo obtiene de 14 pruebas, con una media de 84,78 frente al 86,32 del original. Como señaló el medio especializado MarkTechPost el 18 de septiembre de 2026, en todos los casos se trata de mediciones internas no reproducidas de forma independiente por terceros. El análisis externo observa además que la caída se acentúa en las tareas agénticas complejas, donde el modelo se queda en torno al 75 % de la puntuación original en referencias como Terminal-Bench y SWE-bench. La propia documentación de PrismML admite, por lo demás, que el descenso afecta sobre todo a las categorías de conocimiento, razonamiento y visión.
Un límite añadido tiene que ver con la infraestructura necesaria para ejecutarlo. La arquitectura no puede cargarse con las bibliotecas estándar: la ficha del modelo aclara que los módulos de carga ordinarios de MLX no admiten las transformaciones de rotación de Hadamard ni el embedding inverso que usa el formato, lo que obliga a recurrir al runtime propio de PrismML o a su fork de llama.cpp. En cuanto a la velocidad, el anuncio de la empresa indica hasta 142,5 tokens por segundo en una NVIDIA GeForce RTX 5090 y 46,8 tokens por segundo en un Apple M5 Max, mientras que la ficha de Hugging Face asigna a esa misma GPU un valor inferior, de unos 129 tokens por segundo. Ninguna de las dos fuentes declara con qué configuración se obtuvo la medida. La empresa, que en su sitio se presenta como fundada por investigadores de Caltech y cita entre sus respaldos a Khosla Ventures, Cerberus, Google y Samsung, atribuye al sistema un consumo de 0,714 milivatios-hora por token en una RTX 4090, que según ella sería un 40 % más eficiente que un modelo de 8.000 millones de parámetros a precisión completa.
Mientras nadie ajeno a la empresa reproduzca esas cifras, el único dato sólido sigue siendo el espacio ocupado en disco, y la dependencia de un fork propietario de llama.cpp, que limita el alcance práctico de la licencia Apache 2.0.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Leído el anuncio oficial en prismml.com/news/bonsai-2-27b: fecha, método de cuantización, bits por peso, 5,9 GB, tabla de pruebas por categoría, velocidad, consumo, licencia, respaldos. Cotejado con la ficha oficial del modelo en Hugging Face (prism-ml/Ternary-Bonsai-2-27B-mlx-2bit), que da números distintos de tamaño, conjunto de pruebas y rendimiento y declara los límites y el cargador propio necesario. Tercera lectura en MarkTechPost (18 de septiembre de 2026): confirma los datos principales, los atribuye explícitamente al fabricante como no reproducidos por terceros y añade las caídas en tareas agénticas. La página docs.prismml.com que aparece en los resultados de búsqueda responde 404: no utilizada. Descartada la noticia de CNN sobre el informe de inteligencia generado con IA: solo fuentes anónimas, sin respuesta del Pentágono ni del Special Operations Command Pacific y sin confirmación independiente.
- Incertezze
- Ninguna prueba ha sido reproducida por terceros: el 98,2 % es una medición interna, y las dos publicaciones oficiales de PrismML la obtienen de conjuntos distintos (20 pruebas, media de 83,9 sobre 85,4 en el anuncio; 14 pruebas, 84,78 sobre 86,32 en la ficha MLX). El tamaño también cambia según el artefacto: 5,9 GB en el anuncio, 8,60 GB en la variante MLX de 2 bits con la torre de visión sin cuantizar. Las velocidades en la RTX 5090 difieren entre las dos fuentes oficiales (142,5 frente a unos 129 tokens por segundo) sin que se indique la configuración de prueba. Queda por ver cuánto pesa en la práctica la caída en tareas agénticas largas (~75 % en Terminal-Bench y SWE-bench según MarkTechPost) y hasta qué punto la dependencia de un fork propietario de llama.cpp limita el uso real de la licencia Apache 2.0.
- Perché pubblicarla
- Es la noticia de la semana que se puede verificar hasta el final, y dice algo concreto a quien usa la IA: un modelo de 27.000 millones de parámetros que cabe en 5,9 GB, con pesos abiertos Apache 2.0, funciona en un portátil de 16 GB. Pero es también un caso de manual de cifras autodeclaradas: dos publicaciones oficiales de la misma empresa dan números distintos para el mismo porcentaje, nadie ha repetido las pruebas y la licencia abierta pasa por un fork que solo mantiene el fabricante. Contar juntas la compresión y sus asteriscos es exactamente el registro de este sitio.