PrismML comprime Qwen3.8-27B a 5.95 GB

PrismML comprime Qwen3.8-27B a 5.95 GB

PrismML comprime Qwen3.8-27B a 5.95 GB, pero el 98.2% no prueba paridad ni uso general en celulares.

Por Humberto Toledo el 18 de septiembre del 2026 a las 5:03 pm PDT

✨︎ Resumen (TL;DR):

  • PrismML lanzó Ternary Bonsai 2 27B, una versión comprimida de Qwen3.8-27B.
  • El paquete de lenguaje PTQ1_0 ocupa 5.95 GB frente a unos 54 GB del modelo FP16, mientras PrismML reporta 98.2% del rendimiento promedio.
  • El tamaño del archivo no demuestra que el modelo funcione de forma general en smartphones ni que conserve el mismo nivel en cada tarea.

PrismML lanzó el 17 de septiembre Ternary Bonsai 2 27B, una versión comprimida de Qwen3.8-27B de Alibaba cuyos pesos de lenguaje ocupan 5.95 GB en su paquete más compacto, frente a unos 54 GB en FP16. La empresa afirma que conserva 98.2% del promedio de rendimiento de la referencia en sus propios benchmarks, pero ese porcentaje no demuestra que el modelo ya funcione de forma general en smartphones ni que entregue el mismo resultado en cada tarea.

Apple quiere meter modelos de IA gigantes en el iPhone
Te podría interesar:
Apple quiere meter modelos de IA gigantes en el iPhone
Un poliedro geométrico oscuro ubicado en un espacio minimalista mal iluminado con sombras profundas.
Foto: crazy motions / Pexels

Los 5.95 GB cubren sólo los pesos de lenguaje

El archivo se presenta como 5.9 GB, mientras que la ficha de PrismML precisa 5.95 GB para el paquete más compacto, PTQ1_0; otro empaquetado llega a 7.21 GB. En ambos casos se trata del modelo de lenguaje, no del tamaño total del sistema ni de la memoria completa necesaria para ejecutarlo.

La compresión ternaria es una técnica de reducción de modelos que reemplaza la mayoría de los pesos, es decir, los valores que el modelo aprende durante el entrenamiento, por valores -1, 0 o +1, con escalas FP16 por grupos.

Si se requieren entradas de imagen, la torre de visión se descarga por separado y añade 0.63 GB. Por eso, la cifra de 5.95 GB no describe todas las variantes multimodales ni el consumo completo de memoria al usar Bonsai 2.

Soporte para Mac, iPhone y iPad, sin prueba en celulares

PrismML afirma que Bonsai 2 puede ejecutarse mediante CUDA y MLX, con soporte para Mac, iPhone y iPad. Sus mediciones públicas de velocidad, sin embargo, corresponden a GPUs de Nvidia y laptops Apple, no a un teléfono.

El lanzamiento sigue al Bonsai 27B que FomoEra cubrió en julio, cuando PrismML promocionó una variante de 3.9 GB y una demostración en iPhone. Para Bonsai 2, la compañía no publicó un modelo de teléfono compatible, un mínimo de RAM ni una prueba de rendimiento en celulares.

TechCrunch resumió el alcance con cautela: el archivo podría caber en un smartphone de gama alta, pero eso no significa que el modelo esté listo para cualquier celular. Tampoco permite tratar los 5.95 GB como el requisito total de memoria.

El 98.2% es un promedio, no paridad por tarea

PrismML calcula esa retención a partir de promedios propios. Su ficha de modelo reporta 84.78 puntos para Bonsai 2 y 86.32 para Qwen3.8-27B FP16 en 14 benchmarks de modo de razonamiento. La relación entre ambos puntajes, redondeada, es 98.2%.

La página de lanzamiento usa otro agregado: 83.9 frente a 85.4, y también llega a 98.2%. Los materiales consultados no explican por qué cambian la suite y los puntajes.

El desglose confirma que la compresión no afecta todas las capacidades por igual. El orden de cada línea va de Qwen3.8-27B FP16 a Bonsai 2:

  • Matemáticas: 97.06 frente a 96.57.
  • Programación: 89.07 frente a 89.42.
  • Visión: 71.36 frente a 66.19.
  • Conocimiento y razonamiento: 85.55 frente a 79.86.

PrismML describe esas pruebas como evaluadas con EvalScope y vLLM sobre una Nvidia H100. Al ser resultados publicados por la propia empresa, el porcentaje todavía no es una validación independiente ni una garantía para tareas de producción.

Qué falta comprobar fuera del laboratorio

Lo que sí muestra Bonsai 2 es una compresión de más de nueve veces para un modelo de 27B que puede correr localmente en hardware mucho más accesible que el de su referencia FP16. El archivo reducido no demuestra que cualquier teléfono pueda ejecutarlo, y el promedio no resuelve las diferencias entre capacidades.

Lo que falta confirmar fuera de sus propios laboratorios es cuánto de esa ventaja se mantiene en celulares, contextos largos y flujos reales de agentes. La cifra de 98.2% resume un promedio de benchmarks, no una garantía de rendimiento uniforme ni de compatibilidad general con smartphones.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed