Alibaba libera Qwen-Image-2.1: 7B, RGBA y uso no comercial

Alibaba libera Qwen-Image-2.1: 7B, RGBA y uso no comercial

Qwen-Image-2.1 combina imágenes RGBA, hasta 10 referencias y un componente visual 7B, con uso comercial restringido.

Por Humberto Toledo el 20 de septiembre del 2026 a las 6:54 pm PDT

✨︎ Resumen (TL;DR):

  • Alibaba publicó el 20 de septiembre Qwen-Image-2.1, un modelo de generación y edición con salida nativa 2K.
  • El transformer visual tiene 7,000 millones de parámetros y admite transparencia RGBA, edición localizada y hasta 10 referencias.
  • Los pesos están disponibles, pero la licencia solo permite investigación y evaluación no comercial, salvo un acuerdo separado.

Alibaba publicó el 20 de septiembre Qwen-Image-2.1, un modelo de generación y edición de imágenes con salida nativa 2K, transparencia RGBA y soporte para hasta 10 imágenes de referencia. Su componente visual tiene 7,000 millones de parámetros, pero la licencia solo permite investigación y evaluación no comercial, salvo que el usuario consiga un acuerdo separado.

Qwen-Image-2.1 es un modelo de generación y edición de imágenes que produce salidas nativas 2K, archivos RGBA y ediciones localizadas.

Alibaba abre RADAR: su AUC superó al de 23 de 26 radiólogos
Te podría interesar:
Alibaba abre RADAR: su AUC superó al de 23 de 26 radiólogos
Impresionante arquitectura reflejada en el agua durante un vibrante atardecer urbano.
Foto: Sunny / Pexels

Transparencia RGBA integrada

Puede generar una imagen convencional o un archivo RGBA con canal alfa a partir de una instrucción. También edita una capa transparente, conserva el fondo mientras cambia un elemento y extrae un sujeto desde una fotografía RGB para reutilizarlo en otra composición.

La diferencia práctica es que estas tareas están dentro del modelo principal, no repartidas entre distintos modelos. En los ejemplos publicados por Qwen aparecen objetos aislados, composiciones con varios elementos y cambios de texto dentro de una imagen transparente.

Para diseñadores, tiendas en línea y equipos que producen recursos visuales, este flujo reduce los pasos entre generar una imagen y preparar un activo reutilizable. La calidad final todavía depende de la prueba concreta y del hardware disponible.

Hasta 10 referencias en una sola tarea

El modelo admite hasta 10 imágenes de referencia en una misma tarea. Qwen mostró una fotografía grupal construida a partir de 6 retratos, un conjunto de ropa armado con 5 imágenes y una habitación compuesta con 10 referencias de muebles.

Para la edición localizada, la zona puede señalarse con:

  • círculos
  • anotaciones pintadas
  • una máscara independiente

Con esas indicaciones, el usuario puede pedir cambios simultáneos, como retirar un reloj, cambiar el color del cabello y sustituir una prenda, mientras el resto de la imagen permanece como contexto.

Qwen afirma haber mejorado la conservación de identidad en retratos y la consistencia de forma, textura y texto en productos. Estas capacidades resultan pertinentes para catálogos, pruebas de vestuario, storyboards e infografías.

Por ahora, Qwen las ha documentado y demostrado con ejemplos propios, no con una validación independiente de resultados comerciales.

El componente visual 7B no es todo el sistema

Los 7,000 millones de parámetros corresponden al transformer visual de 32 capas que genera la imagen. Esa cifra no describe toda la carga del sistema: la arquitectura publicada también utiliza un codificador Qwen3-VL de 8B para procesar instrucciones e imágenes de entrada, además de un autoencoder RGBA de 64 canales.

Qwen afirma que su atención de granularidad mixta y la reutilización de la caché KV evitan recalcular el texto y las imágenes de referencia en cada paso de eliminación de ruido.

En una prueba de integración con Diffusers, RuntimeWire registró 56.5 GiB de memoria pico en una Nvidia H100 para una imagen de 2,048 × 2,048 píxeles, con BF16, un lote de una imagen y 20 pasos.

Esta medición no representa todas las configuraciones, pero pone en contexto la palabra compacto. Que el componente visual tenga 7B no significa que cualquier computadora pueda ejecutar el modelo con facilidad en su resolución nativa.

La ventaja frente a modelos cerrados sigue pendiente

Qwen incluyó una comparación de Qwen-Image-Bench con modelos abiertos y cerrados. La herramienta usa 1,000 prompts y un Q-Judger ajustado sobre Qwen3.6-27B para puntuar cinco dimensiones: calidad, estética, alineación, fidelidad del mundo real y generación creativa.

Qwen sostiene que Qwen-Image-2.1 supera a la mayoría de los modelos cerrados en esa comparación. The Decoder describió esa ventaja como una afirmación de la compañía y señaló que todavía no había una evaluación independiente consolidada.

El método permite identificar qué midió Qwen, pero el juez, el conjunto de evaluación y el benchmark proceden del mismo ecosistema que publicó el modelo.

Por ahora, la formulación más precisa es que Qwen-Image-2.1 presenta resultados competitivos en la comparación publicada por su desarrollador. El gráfico no basta para presentarlo como el mejor generador de imágenes disponible.

Pesos abiertos, uso comercial restringido

Qwen distribuye los pesos por GitHub, Hugging Face y ModelScope. El repositorio documenta compatibilidad inicial con Diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V.

Esto facilita que investigadores y desarrolladores descarguen los archivos, inspeccionen el código y hagan pruebas en infraestructura propia.

El límite está en la licencia. El acuerdo Qwen Research License Agreement concede derechos mundiales, gratuitos y no transferibles para usar, modificar y redistribuir los materiales únicamente con fines no comerciales. Cualquier uso comercial requiere una licencia separada de Hangzhou Tongyi Laboratory Technology Co.

Que los pesos estén disponibles no equivale a contar con una licencia comercial abierta. Por eso, open-source y open-weight no describen por sí solos las mismas libertades legales. Descargar el modelo para investigarlo no equivale a poder integrarlo sin más en un producto, una tienda, una agencia o un servicio de pago.

Qwen-Image-2.1 ya puede probarse en infraestructura propia y reúne transparencia RGBA, edición localizada y múltiples referencias. Antes de integrarlo en un producto, una empresa todavía debe resolver dos pendientes concretos: comprobar su rendimiento fuera del benchmark de Qwen y obtener la licencia comercial correspondiente.

Fuentes: 1, 2, 3, 4, 5

Más de AI

Feed