Qwen3.8: Qué hay de nuevo, cómo ejecutarlo y alternativas (2026)

El equipo de Qwen de Alibaba lanzó Qwen3.8-27B el 14 de agosto de 2026, dos días después del modelo mucho más grande Qwen3.8-2.4T-A95B. La nota de lanzamiento tiene una sola frase de longitud y vale la pena leerla dos veces.
"Por primera vez, Qwen3.8 lleva un modelo de la clase Qwen-Max al lanzamiento de código abierto".
Se trata de una afirmación sobre la categoría, no sobre el tamaño. Significa que los pesos abiertos ahora se sitúan donde solía estar el modelo insignia alojado.
Si eso se cumple para su carga de trabajo es una cuestión aparte, y las pruebas publicadas solo responden parcialmente a ello. El resto de este artículo trata sobre qué partes.
Este artículo aborda lo que se ha lanzado y en qué difieren los dos documentos oficiales. A continuación, analiza lo que realmente mide la tabla de benchmarks. Por último, explica cómo ejecutar el modelo localmente, en caso de que prefiera que el análisis se quede en su propia máquina.
Qué es realmente Qwen3.8
El README oficial describe la familia como construida "sobre la base arquitectónica de Qwen3.5", ofreciendo mejoras "en programación, trabajo profesional, investigación y tareas agénticas de largo alcance".
La frase que realmente importa para cualquiera que realice trabajos de varios pasos es la siguiente. Qwen3.8 "está diseñado para llevar a cabo tareas complejas de varios pasos hasta su finalización con mayor fiabilidad".
El modelo 27B es el que la mayoría de la gente ejecutará localmente. Su tarjeta del modelo ofrece las cifras concretas: 27B de parámetros, 64 capas, dimensión oculta de 5120 y un diseño híbrido de bloques Gated DeltaNet y Gated Attention.
La longitud de contexto es de 262,144 tokens de forma nativa y ampliable hasta 1,000,000. La licencia registrada en la tarjeta del modelo es apache-2.0.
Vale la pena tener claras las dos entradas de lanzamiento. El modelo de mezcla de expertos 2.4T-A95B llegó el 2026-08-12, y el modelo denso 27B le siguió el 2026-08-14. Solo el segundo es viable para autoalojar.
| Fact | Qwen3.8-27B |
|---|---|
| Lanzamiento | 2026-08-14 |
| Parámetros | 27B denso |
| Capas | 64 |
| Contexto | 262,144 nativo, ampliable a 1,000,000 |
| Licencia | apache-2.0 |
| Entradas | Texto, imágenes, video |
En qué difieren los dos documentos oficiales
Esta es la parte de la que casi nadie informa, y cambia lo que se puede afirmar con seguridad.
El README de GitHub atribuye la arquitectura multimodal a Qwen3.5, la generación sobre la que se construye Qwen3.8. Si solo lee esa página, concluiría que el modelo 27B es solo de texto.
La tarjeta del modelo dice lo contrario, y es específica. Qwen3.8-27B es "un modelo nativo de visión-lenguaje que comprende imágenes y videos, con un control de pensamiento flexible".
Cuando dos fuentes oficiales entran en conflicto, gana la más específica. La tarjeta del modelo describe este checkpoint exacto, por lo que la capacidad multimodal es real. Vale la pena saber que existe esta discrepancia, porque un vistazo rápido al repositorio le diría lo contrario.
Qué mide la tabla de benchmarks y qué deja fuera
La tarjeta del modelo publica una comparación con Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B y Opus4.6 Max. Algunas de las cifras agénticas muestran grandes saltos.
| Benchmark | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (uso de computadora) | 84.3 | 63.9 |
| WebArena-Verified (uso de navegador) | 64.8 | 48.8 |
| AndroidWorld (uso de móvil) | 81.9 | 70.3 |
| SWE-bench Pro (programación) | 61.7 | — |
| MathVision (con intérprete de código) | 94.6 | 90.3 |
| Vision2Web (desarrollo web visual) | 62.9 | 45.0 |
Ahora, la lectura honesta. El uso de computadora, el uso de navegador, el uso de móvil, la programación, las matemáticas visuales y el desarrollo web son lo que cubre esta tabla.
Aquí no hay ningún benchmark para leer una hoja de cálculo, conciliar dos exportaciones o generar un informe a partir de datos tabulares. Las sólidas cifras de OSWorld indican que el modelo puede manejar un escritorio. No le aseguran que vaya a realizar correctamente su conciliación de ingresos.
Un detalle que vale la pena destacar para los lectores que siguen los lanzamientos abiertos. Muse Glimmer-30B aparece en esta tabla como punto de comparación, y su propia tabla de lanzamiento cuatro días antes se comparaba con Qwen3.6-27B. Nuestro artículo sobre Muse Glimmer señalaba que su grupo de pares ya estaba una generación por detrás en el momento de su lanzamiento. Esta tabla es la otra mitad de esa historia.
Cómo ejecutarlo
Los pesos están en Hugging Face Hub y en ModelScope, según la entrada de noticias del README. El formato denso de 27B es la opción práctica para una sola máquina.
Planifique su memoria en función del recuento de parámetros en lugar del límite de contexto. Dispone de una ventana de 262,144 tokens, pero llenarla consume una memoria que la mayoría de las configuraciones locales no tienen disponible.
Comience con un contexto corto y un archivo real. Cargue una exportación, haga una pregunta de la que ya conozca la respuesta y verifique el resultado antes de confiar en algo más largo.
Ese paso de verificación no es opcional para el trabajo con tablas. Un modelo puede describir una hoja de cálculo con fluidez y, aun así, interpretar erróneamente qué columna contiene los totales. Las respuestas incorrectas expresadas con fluidez son más difíciles de detectar que las obvias.
Si necesita la ventana de un millón de tokens, trátelo como un ejercicio independiente con su propio presupuesto de hardware. Las dos configuraciones se comportan de manera muy diferente en la práctica, y evaluar una le dirá muy poco sobre la otra.
Cambie primero el esfuerzo de razonamiento predeterminado
Aquí está el ajuste que definirá su primera impresión, y es visible en la propia plantilla de chat de la tarjeta del modelo.
La plantilla resuelve reasoning_effort como xhigh de forma predeterminada, siendo medium y low los otros valores aceptados. El pensamiento también se puede desactivar.
Un valor predeterminado de xhigh significa que el modelo deliberará extensamente sobre preguntas que no lo requieren. Para una búsqueda de una sola línea en un archivo CSV pequeño, esto se percibirá como que el modelo es lento en lugar de cuidadoso.
Así que lo primero que hay que ajustar no es el prompt. Reduzca el esfuerzo a medium o low para preguntas rutinarias, y reserve xhigh para el trabajo de varios pasos del que realmente trata la nota de lanzamiento.
Dónde encaja esto en un flujo de trabajo de datos
Un modelo de pesos abiertos que usted mismo aloja resuelve un problema específico: que los datos nunca salen de su máquina. Para archivos regulados o confidenciales, ese es todo el argumento, y ninguna comodidad de un servicio alojado puede reemplazarlo.
Todo lo demás en esta elección es un intercambio. Usted asume las decisiones de hardware, actualizaciones y cuantización a cambio de esa única garantía.
Lo que no resuelve es todo lo que rodea al modelo. El perfilado de columnas, la unión de dos exportaciones, la detección de un campo renombrado, la representación de un gráfico y la generación de un documento son tareas independientes.
Esa brecha es la razón por la que existen las capas de protocolos y herramientas. Nuestra explicación sobre qué es MCP cubre el estándar que conecta los modelos con las herramientas. La página de conectores de datos muestra lo que espera como entrada un pipeline centrado en archivos.
Alternativas
Si el requisito es local y abierto, Qwen3.8-27B y Muse Glimmer-30B son los dos candidatos actuales en la misma clase de tamaño. Ambos publican sus pesos y ambos se ejecutan en una sola máquina.
Si el requisito es un artefacto terminado a partir de un archivo en lugar de un endpoint de modelo, la forma de la herramienta es diferente. Powerdrill Bloom toma la hoja de cálculo, perfila las columnas y devuelve el gráfico, el informe o la presentación.
No hay comparación de precios que hacer por el lado de Qwen. No se pudo acceder a ninguna página oficial de precios de Qwen para este modelo, por lo que este artículo no cita ninguna cifra.
Si su tarea real es un archivo que debe convertirse en un informe, pruebe Powerdrill Bloom directamente en él. Consulte también nuestra guía para convertir una exportación de suscripciones en un informe de MRR y ARR y la página del asistente de IA para CSV.
Conclusión
Qwen3.8-27B es un modelo denso de 27B con un contexto nativo de 262,144 tokens, pesos apache-2.0 y entrada documentada de imagen y video. Los saltos agénticos con respecto a Qwen3.6-27B son sustanciales.
Viene acompañado de dos advertencias. El repositorio y la tarjeta del modelo no coinciden en cuanto a la multimodalidad, y los benchmarks publicados cubren tareas de escritorio, navegador, programación y visuales, en lugar de trabajo con tablas.
Ajuste reasoning_effort antes de juzgarlo. El valor predeterminado es xhigh, y ese valor predeterminado realiza más reflexión de la que requieren la mayoría de las preguntas.
Preguntas frecuentes
¿Cuándo se lanzó Qwen3.8?
Las entradas de noticias del README registran Qwen3.8-27B el 2026-08-14 y Qwen3.8-2.4T-A95B el 2026-08-12, ambos en Hugging Face Hub y ModelScope.
¿Es Qwen3.8-27B multimodal?
Sí, según su tarjeta del modelo, que lo describe como un modelo nativo de visión-lenguaje que comprende imágenes y videos. Tenga en cuenta que el README de GitHub atribuye la arquitectura multimodal a Qwen3.5.
¿Qué longitud de contexto admite?
La tarjeta del modelo indica 262,144 tokens de forma nativa, ampliable hasta 1,000,000. Ejecutarlo cerca de la cifra superior requiere una memoria que supera con creces la de una configuración local típica.
¿Por qué parece lento con preguntas sencillas?
La plantilla de chat establece reasoning_effort en xhigh de forma predeterminada. Redúzcalo a medium o low para búsquedas rutinarias y reserve xhigh para tareas que realmente requieran varios pasos.
¿Dicen algo los benchmarks sobre el trabajo con hojas de cálculo?
No. La tabla publicada cubre el uso de computadora, el uso de navegador, el uso de móvil, la programación, las matemáticas visuales y el desarrollo web, sin ningún benchmark para el análisis tabular o la generación de informes.