✨︎ Resumen (TL;DR):
- Alibaba publicó los pesos de Qwen3.8-27B en Hugging Face bajo Apache 2.0 el 14 de agosto de 2026.
- Qwen3.8-2.4T-A95B usa la licencia propia qwen3.8-max y exige un acuerdo comercial a ciertos negocios de IA que superen 50 millones de dólares de ingresos en 12 meses consecutivos.
- En 4 bits, el 27B necesita entre 17 y 19 GB de memoria total; el 2.4T ocupa 397 GB en su cuantización de 1 bit y requiere al menos 450 GB de RAM.
Alibaba publicó el viernes 14 de agosto de 2026 los pesos de Qwen3.8-27B en Hugging Face bajo Apache 2.0. Este modelo denso multimodal está pensado para correr en equipo propio y, en 4 bits, requiere entre 17 y 19 GB de memoria total. Dos días antes, el 12 de agosto, la compañía había abierto Qwen3.8-2.4T-A95B, pero ese modelo insignia usa qwen3.8-max, una licencia propia que exige un acuerdo comercial a ciertos negocios de IA con ingresos superiores a 50 millones de dólares en cualquier periodo de 12 meses consecutivos.

Dos modelos, dos reglas de licencia
El anuncio presenta los dos modelos como un mismo paquete descargable, pero cada repositorio de Hugging Face lleva una etiqueta distinta. Qwen3.8-27B usa Apache 2.0; Qwen3.8-2.4T-A95B aparece bajo qwen3.8-max, una licencia propia.
La licencia obliga a los usuarios, o a sus filiales, que operen un negocio de modelo como servicio, model-as-a-service, o de asistente de trabajo con IA y facturen más de 50 millones de dólares en cualquier periodo de 12 meses consecutivos a obtener una licencia comercial aparte.
El uso interno queda exento, siempre que el software, sus salidas o las capacidades del modelo no se pongan a disposición de terceros. Ese umbral deja fuera de la obligación a la mayoría de las empresas medianas.
La apertura de los pesos del modelo insignia contrasta con la estrategia reciente de Alibaba, que mantenía propietarios sus modelos Max. Fuera de los casos sujetos al umbral, la mayoría de los desarrolladores puede usar, copiar, modificar y distribuir el modelo de 2.4T sin pagarle a Alibaba, aunque debe asumir el costo de cómputo.
La vía de pago que Alibaba mantiene es la API. En China cuesta 12 yuanes por millón de tokens de entrada y 36 yuanes por millón de salida. Fuera de China, el precio es de 2 y 6 dólares, respectivamente. Esas tarifas internacionales equivalen a cerca del 40% y el 24%, en ese orden, de lo que cobra Claude Opus 5 de Anthropic.
El 27B cabe en hardware de consumo
Qwen3.8-27B es un modelo denso multimodal que acepta entradas de texto, imagen y video. El equipo de Qwen lo presenta como la pieza de su nueva generación pensada para ejecutarse en equipo propio.
Unsloth, que obtuvo acceso al modelo desde el día cero según su documentación, publicó una tabla con los requisitos de hardware. En 4 bits, el 27B requiere entre 17 y 19 GB de memoria total al sumar RAM y VRAM.
Ese rango lo sitúa al alcance de una RTX 5080, una 4090 o una Mac con 24 GB de memoria unificada. En BF16, el consumo sube a 56 GB. La variante de 2 bits queda entre 11 y 13 GB.
El modelo de 2.4T está en otra escala de hardware. Tiene 2.4 billones de parámetros, es decir, 2.4 millones de millones, y activa 95,000 millones por token.
Su cuantización más agresiva, de 1 bit, ocupa 397 GB en disco y exige al menos 450 GB de RAM para funcionar. Sin comprimir, el archivo completo en BF16 ocupa 4.9 TB.
La comparación que documentan Unsloth y las fichas oficiales queda así:
| Dato | Qwen3.8-27B | Qwen3.8-2.4T-A95B |
|---|---|---|
| Licencia | Apache 2.0 | qwen3.8-max, propia |
| Entradas | Texto, imagen y video | Solo texto |
| Razonamiento | Se puede apagar por petición | Siempre activo |
| Versión más comprimida | 11 a 13 GB (2 bits) | 397 GB y 450 GB de RAM (1 bit) |
| Sin comprimir | 56 GB (BF16) | 4.9 TB (BF16) |
Contexto largo y control del razonamiento
El 27B admite 262,144 tokens de contexto nativo. La técnica YaRN que documenta la ficha puede ampliar esa ventana hasta 1 millón de tokens.
El modo de razonamiento viene activado por defecto, aunque se puede apagar por petición. El parámetro reasoning_effort ajusta la profundidad en tres niveles, y el modelo conserva el rastro de razonamiento de los mensajes anteriores.
La ventaja del 27B aparece en los agentes
Alibaba sostiene que el 27B supera a Qwen3.7-Plus en conjunto, pero sus propias tablas concentran esa ventaja en pruebas de agentes y uso de computadora.
| Prueba | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|
| SWE-bench Pro | 61.7 | 57.6 |
| DeepSWE 1.1 | 42.2 | 14.2 |
| QwenSWEBench | 79.0 | 59.2 |
| OSWorld-Verified | 84.3 | 73.3 |
El 27B queda por encima de Qwen3.7-Plus en las cuatro pruebas de este bloque. La segunda mitad de la tabla cambia de sentido: Qwen3.7-Plus obtiene mejores resultados en conocimiento, análisis de documentos y percepción del mundo real.
| Prueba | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|
| GPQA Diamond | 89.2 | 90.3 |
| HLE | 30.8 | 34.7 |
| OmniDocBench 1.5 | 91.1 | 91.4 |
| RealWorldQA | 85.9 | 86.9 |
| ERQA | 65.5 | 69.8 |
En las cifras de Alibaba, el 27B rinde mejor cuando debe ejecutar tareas largas, mientras Qwen3.7-Plus conserva la ventaja cuando la prueba exige retener y razonar sobre información.
La tabla también incluye Muse Glimmer-30B, el modelo que Meta abrió este mes para el mismo público que corre modelos en su propia computadora. Queda por debajo del 27B en todas las filas donde la ficha le asigna una cifra.
Los benchmarks todavía llevan la firma de Alibaba
Los resultados comparativos anteriores son cifras de Alibaba y todavía no cuentan con una evaluación independiente publicada.
Las notas al pie indican que el dato de SWE-bench Pro de Opus4.6 Max proviene del reporte oficial de Anthropic. Para las demás cifras, Alibaba evaluó los modelos de la tabla con el entorno de Claude Code y volvió a correr las líneas base sobre una versión corregida del benchmark.
El procedimiento es más homogéneo que el de la ficha del 2.4T, donde Qwen usó OpenCode y los rivales sus propios entornos. Aun así, sigue siendo una medición del vendedor.
Qwen Cloud sigue pendiente
La ficha del 27B anuncia una versión alojada en Qwen Cloud, con 1 millón de tokens de contexto por defecto y herramientas integradas. El servicio todavía no está disponible, así que por ahora el modelo solo existe como archivo descargable.
Horas después de la publicación, el repositorio ya listaba más de 100 cuantizaciones derivadas. Entre ellas estaban las de Unsloth para llama.cpp y una variante NVFP4 que el mismo equipo mide 1.5 veces más rápida que BF16 y que requiere una GPU Blackwell de Nvidia.
Para un desarrollador hispanohablante, el corte práctico es claro: por primera vez en esta generación, Qwen ofrece un modelo que cabe en una tarjeta de 24 GB y cuya licencia no impone un umbral de facturación. Ese modelo es el 27B.
El insignia de 2.4T conserva la escala de 2.4 millones de millones de parámetros, pero su versión de 1 bit pesa 397 GB, exige 450 GB de RAM y usa qwen3.8-max. Su rendimiento real sobre un repositorio grande depende de pruebas que nadie fuera de Alibaba ha publicado todavía.
