✨︎ Resumen (TL;DR):
- PrismML lanzó Ternary Bonsai 2 27B, una versión comprimida de Qwen3.8-27B.
- El paquete de lenguaje PTQ1_0 ocupa 5.95 GB frente a unos 54 GB del modelo FP16, mientras PrismML reporta 98.2% del rendimiento promedio.
- El tamaño del archivo no demuestra que el modelo funcione de forma general en smartphones ni que conserve el mismo nivel en cada tarea.
PrismML lanzó el 17 de septiembre Ternary Bonsai 2 27B, una versión comprimida de Qwen3.8-27B de Alibaba cuyos pesos de lenguaje ocupan 5.95 GB en su paquete más compacto, frente a unos 54 GB en FP16. La empresa afirma que conserva 98.2% del promedio de rendimiento de la referencia en sus propios benchmarks, pero ese porcentaje no demuestra que el modelo ya funcione de forma general en smartphones ni que entregue el mismo resultado en cada tarea.

Los 5.95 GB cubren sólo los pesos de lenguaje
El archivo se presenta como 5.9 GB, mientras que la ficha de PrismML precisa 5.95 GB para el paquete más compacto, PTQ1_0; otro empaquetado llega a 7.21 GB. En ambos casos se trata del modelo de lenguaje, no del tamaño total del sistema ni de la memoria completa necesaria para ejecutarlo.
La compresión ternaria es una técnica de reducción de modelos que reemplaza la mayoría de los pesos, es decir, los valores que el modelo aprende durante el entrenamiento, por valores -1, 0 o +1, con escalas FP16 por grupos.
Si se requieren entradas de imagen, la torre de visión se descarga por separado y añade 0.63 GB. Por eso, la cifra de 5.95 GB no describe todas las variantes multimodales ni el consumo completo de memoria al usar Bonsai 2.
Soporte para Mac, iPhone y iPad, sin prueba en celulares
PrismML afirma que Bonsai 2 puede ejecutarse mediante CUDA y MLX, con soporte para Mac, iPhone y iPad. Sus mediciones públicas de velocidad, sin embargo, corresponden a GPUs de Nvidia y laptops Apple, no a un teléfono.
El lanzamiento sigue al Bonsai 27B que FomoEra cubrió en julio, cuando PrismML promocionó una variante de 3.9 GB y una demostración en iPhone. Para Bonsai 2, la compañía no publicó un modelo de teléfono compatible, un mínimo de RAM ni una prueba de rendimiento en celulares.
TechCrunch resumió el alcance con cautela: el archivo podría caber en un smartphone de gama alta, pero eso no significa que el modelo esté listo para cualquier celular. Tampoco permite tratar los 5.95 GB como el requisito total de memoria.
El 98.2% es un promedio, no paridad por tarea
PrismML calcula esa retención a partir de promedios propios. Su ficha de modelo reporta 84.78 puntos para Bonsai 2 y 86.32 para Qwen3.8-27B FP16 en 14 benchmarks de modo de razonamiento. La relación entre ambos puntajes, redondeada, es 98.2%.
La página de lanzamiento usa otro agregado: 83.9 frente a 85.4, y también llega a 98.2%. Los materiales consultados no explican por qué cambian la suite y los puntajes.
El desglose confirma que la compresión no afecta todas las capacidades por igual. El orden de cada línea va de Qwen3.8-27B FP16 a Bonsai 2:
- Matemáticas: 97.06 frente a 96.57.
- Programación: 89.07 frente a 89.42.
- Visión: 71.36 frente a 66.19.
- Conocimiento y razonamiento: 85.55 frente a 79.86.
PrismML describe esas pruebas como evaluadas con EvalScope y vLLM sobre una Nvidia H100. Al ser resultados publicados por la propia empresa, el porcentaje todavía no es una validación independiente ni una garantía para tareas de producción.
Qué falta comprobar fuera del laboratorio
Lo que sí muestra Bonsai 2 es una compresión de más de nueve veces para un modelo de 27B que puede correr localmente en hardware mucho más accesible que el de su referencia FP16. El archivo reducido no demuestra que cualquier teléfono pueda ejecutarlo, y el promedio no resuelve las diferencias entre capacidades.
Lo que falta confirmar fuera de sus propios laboratorios es cuánto de esa ventaja se mantiene en celulares, contextos largos y flujos reales de agentes. La cifra de 98.2% resume un promedio de benchmarks, no una garantía de rendimiento uniforme ni de compatibilidad general con smartphones.
