Qwen3.8-27B: agente local en 17 GB, pero lento

Qwen3.8-27B: agente local en 17 GB, pero lento

Qwen3.8-27B corre en local con 17 GB, usa herramientas y visión, pero puede tardar 21 minutos.

Por Humberto Toledo el 17 de agosto del 2026 a las 4:12 pm PDT

✨︎ Resumen (TL;DR):

  • Qwen3.8-27B inspeccionó repositorios, usó herramientas, escribió y probó código, y ubicó objetos en imágenes desde hardware local.
  • La versión cuantizada Q4_K_M ocupa 17 GB; el modelo ofrece una ventana nativa de 262,144 tokens.
  • Simon Willison midió entre 15 y 30 tokens por segundo; WildClawBench obtuvo 48.0% y lo ubicó en el puesto 15 de 34 modelos.

Qwen3.8-27B, el modelo de Alibaba con 27,000 millones de parámetros, ya puede trabajar como agente local: inspecciona repositorios, usa herramientas, escribe y prueba código, y analiza imágenes. Simon Willison lo ejecutó en una versión Q4_K_M de 17 GB con LM Studio, mientras WildClawBench lo midió en tareas agénticas. El límite práctico aparece en la velocidad, de 15 a 30 tokens por segundo, y en el modo xhigh, que puede tardar 21 minutos en una tarea visual.

Kitesurf: el navegador de Cloudflare para agentes de IA
Te podría interesar:
Kitesurf: el navegador de Cloudflare para agentes de IA
Cosplayer con disfraz elaborado, cabello azul y acentos florales en un entorno natural sereno.
Foto: TBD Tuyên / Pexels

Un modelo local que sí ejecuta tareas

Qwen3.8-27B es un modelo de IA de 27,000 millones de parámetros que recibe texto, imágenes y video, ofrece 262,144 tokens de contexto nativo y combina razonamiento, código y llamadas a herramientas en una sesión local.

Alibaba publicó sus pesos el 14 de agosto de 2026. Dos días después, Willison cargó el archivo Q4_K_M de 17 GB mediante LM Studio en dos equipos: una MacBook Pro con chip M5 Max y 128 GB de memoria unificada, y una NVIDIA DGX Spark.

El contraste de tamaño con Qwen3.8-2.4T-A95B deja claro el foco de esta prueba: no se trata de la ficha técnica, sino de lo que el 27B hace cuando sus pesos entran en una máquina y reciben trabajo real.

Después, Willison conectó el modelo con Pi, un agente de programación cuyo sistema de instrucciones era relativamente corto. Esa decisión redujo la carga alrededor del experimento y dejó que la prueba se concentrara en el modelo.

En la primera tarea, Qwen3.8-27B recorrió varios archivos del repositorio de Datasette, usó herramientas para leerlos y explicó cómo funcionaba la autenticación del proyecto. Luego recibió un registro de sesión JSONL y escribió un programa en Python para convertirlo a Markdown. El agente también ejecutó ese programa durante el mismo ciclo, en lugar de entregar únicamente el código.

La prueba visual partió de una foto con dos pelícanos. El modelo devolvió coordenadas que rodeaban a ambos animales y después construyó una interfaz web capaz de colocar esas cajas sobre cualquier imagen.

El ejercicio fue manual y lo realizó un solo operador, así que no mide confiabilidad a gran escala. Aun así, reunió cuatro capacidades que suelen ser difíciles para los modelos locales: contexto largo, llamadas a herramientas, visión y generación de código.

Los 17 GB son solo los pesos comprimidos

La cuantización es una compresión de los pesos que reduce su precisión numérica para ahorrar memoria. Por eso, los 17 GB del archivo Q4_K_M no representan todo lo que consume la ejecución.

El contexto activo, la caché de atención, el procesamiento visual y el software que sirve el modelo también requieren recursos. La cifra del archivo describe una parte del despliegue, no el consumo total de la computadora.

El hardware también condiciona el resultado. Una MacBook Pro con 128 GB de memoria unificada y una DGX Spark están muy por encima de una laptop convencional. La prueba demuestra que el modelo cabe en equipo de consumo de gama alta, no que cualquier computadora pueda abrirlo con 262,144 tokens disponibles y mantener una velocidad cómoda.

La ficha oficial indica que Qwen3.8-27B admite 262,144 tokens de manera nativa y puede extenderse hacia 1 millón mediante escalado de posición. Tener esa ventana no significa que usarla completa sea barato en memoria o tiempo. Cada despliegue debe decidir cuánto contexto reservar y qué parte del modelo mover a CPU, GPU o memoria unificada.

xhigh puede convertir una tarea breve en minutos

El razonamiento viene activado y xhigh es el nivel predeterminado. En una de las pruebas visuales de Willison, el modelo generó 22,276 tokens internos de razonamiento antes de entregar 3,223 tokens finales. El proceso tardó 21 minutos.

Al repetir el ejercicio sin razonamiento, terminó en 137 segundos, aunque el resultado visual perdió precisión. La comparación expone un intercambio concreto: reducir la espera puede aumentar los errores que el agente debe corregir.

La documentación ofrece tres niveles, xhigh, medium y low, además de la opción de desactivar el razonamiento. Generar un fragmento sencillo de código y revisar un repositorio completo no requieren el mismo presupuesto de cómputo, así que el ajuste depende de la tarea.

Con LM Studio, Willison midió entre 15 y 30 tokens por segundo. Al probar la predicción de múltiples tokens con llama.cpp, obtuvo una mejora cercana a 72%. Esa función anticipa varios tokens y verifica después cuáles son válidos; el porcentaje corresponde a su configuración y no garantiza el mismo resultado en otros equipos.

Los benchmarks externos moderan el resultado

Alibaba reporta mejoras de Qwen3.8-27B frente a Qwen3.6-27B en sus propias evaluaciones:

  • SWE-bench Pro: 61.7 puntos frente a 53.5.
  • Terminal Bench 2.1: 73.0 frente a 63.4.
  • SWE-MM: 38.6 frente a 25.7.

Varias pruebas usaron el entorno de Claude Code, una ventana de 256,000 tokens y líneas base que Qwen volvió a ejecutar sobre versiones corregidas de los benchmarks. QwenSWEBench y CoWorkBench son evaluaciones internas. Sus resultados sirven para entender el rendimiento bajo la metodología de Alibaba, pero todavía necesitan más reproducción externa.

WildClawBench ofrece otra referencia con tareas completas. Su tabla actual ejecuta 60 trabajos en el mismo entorno OpenClaw y compara 34 modelos. Qwen3.8-27B obtuvo 48.0%, quedó en el puesto 15 y superó por poco a Muse Glimmer 30B de Meta, que marcó 47.6%.

También superó a Qwen3.6-27B, con 43.2%, mientras el primer lugar llegó a 67.2%. El equipo de WildClawBench ejecutó Qwen3.8-27B en un servidor propio con vLLM y no publicó un costo comparable por tarea.

Una sola prueba no define la calidad general. WildClawBench sí delimita el alcance de la mejora: el modelo supera a su antecesor en esa tabla, pero queda por debajo de varios sistemas alojados y de mayor tamaño.

Qué cambia para la IA local

El atractivo de Qwen3.8-27B no está en liderar todas las tablas. Está en concentrar varias funciones dentro de un modelo denso de 27,000 millones de parámetros y con pesos bajo licencia Apache 2.0:

  • Entradas multimodales: texto, imágenes y video.
  • Contexto: 262,144 tokens nativos, con una extensión hacia 1 millón mediante escalado de posición.
  • Razonamiento: niveles xhigh, medium y low, o desactivado.
  • Trabajo agéntico: llamadas a herramientas, inspección de repositorios, generación y prueba de código.

Para un desarrollador o una empresa, la ejecución local permite fijar una versión, modificarla y mantener los datos dentro de su propia infraestructura.

El costo cambia de una tarifa por token a la compra del equipo, el consumo eléctrico, la administración del sistema y el tiempo que tarda cada trabajo.

Qwen3.8-27B ya ve, programa y usa herramientas en local, pero todavía exige memoria de gama alta y una configuración cuidadosa del razonamiento. Para tareas que toleran la espera, puede ser una opción local con pesos Apache 2.0; para flujos que necesitan respuestas rápidas, sus 15 a 30 tokens por segundo y los 21 minutos de xhigh mantienen la distancia frente a servicios alojados más rápidos.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed