Qwen3.8 : nouveautés, comment l'exécuter et alternatives (2026)

L'équipe Qwen d'Alibaba a publié Qwen3.8-27B le 14 août 2026, deux jours après le modèle bien plus grand Qwen3.8-2.4T-A95B. La note de publication ne fait qu'une seule phrase et mérite d'être lue deux fois.
« Pour la première fois, Qwen3.8 propose un modèle de la classe Qwen-Max en accès libre. »
Il s'agit d'une affirmation concernant la catégorie, et non la taille. Elle signifie que les poids ouverts se situent désormais là où se trouvait auparavant le modèle phare hébergé.
Reste à savoir si cela se vérifie pour votre charge de travail, et les preuves publiées n'y répondent que partiellement. La suite de cet article s'intéresse justement à ces aspects.
Cet article présente ce qui a été livré et les points de divergence entre les deux documents officiels. Il examine ensuite ce que mesure réellement le tableau des benchmarks. Enfin, il explique comment exécuter le modèle localement, si vous souhaitez que vos analyses restent sur votre propre machine.
Ce qu'est réellement Qwen3.8
Le README officiel décrit la famille comme étant construite « sur les fondations architecturales de Qwen3.5 », apportant des améliorations « dans le codage, le travail professionnel, la recherche et les tâches agentiques à long terme ».
La phrase suivante est celle qui importe le plus pour quiconque effectue des tâches complexes en plusieurs étapes. Qwen3.8 « est conçu pour mener à bien des tâches complexes et multi-étapes avec une plus grande fiabilité ».
Le modèle 27B est celui que la plupart des gens exécuteront localement. Sa fiche de modèle donne les chiffres précis : 27B paramètres, 64 couches, une dimension cachée de 5120, et une architecture hybride de blocs Gated DeltaNet et Gated Attention.
La longueur de contexte est de 262,144 jetons en natif et extensible jusqu'à 1,000,000. La licence indiquée sur la fiche de modèle est apache-2.0.
Il convient de bien distinguer les deux lancements. Le modèle de mélange d'experts 2.4T-A95B est sorti le 2026-08-12, et le modèle dense 27B a suivi le 2026-08-14. Seul le second est réaliste à auto-héberger.
| Caractéristique | Qwen3.8-27B |
|---|---|
| Date de sortie | 2026-08-14 |
| Paramètres | 27B dense |
| Couches | 64 |
| Contexte | 262,144 natif, extensible à 1,000,000 |
| Licence | apache-2.0 |
| Entrées | Texte, images, vidéo |
Là où les deux documents officiels divergent
C'est la partie que presque personne ne mentionne, et elle change ce que vous pouvez affirmer avec certitude.
Le README de GitHub attribue l'architecture multimodale à Qwen3.5, la génération sur laquelle Qwen3.8 est construit. Si vous ne lisez que cette page, vous en conclurez que le modèle 27B est uniquement textuel.
La fiche de modèle dit le contraire, et elle est précise. Qwen3.8-27B est « un modèle vision-langage natif qui comprend les images et les vidéos, avec un contrôle flexible de la réflexion ».
En cas de conflit entre deux sources officielles, c'est la plus précise qui l'emporte. La fiche de modèle décrivant ce checkpoint précis, la capacité multimodale est bien réelle. Il est utile de savoir que cette divergence existe, car un survol rapide du dépôt vous indiquerait le contraire.
Ce que le tableau des benchmarks mesure, et ce qu'il omet
La fiche de modèle publie une comparaison avec Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B et Opus4.6 Max. Certains scores agentiques affichent des progressions spectaculaires.
| Benchmark | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (utilisation de l'ordinateur) | 84.3 | 63.9 |
| WebArena-Verified (utilisation du navigateur) | 64.8 | 48.8 |
| AndroidWorld (utilisation mobile) | 81.9 | 70.3 |
| SWE-bench Pro (codage) | 61.7 | — |
| MathVision (avec interpréteur de code) | 94.6 | 90.3 |
| Vision2Web (développement web visuel) | 62.9 | 45.0 |
Passons maintenant à une lecture objective. L'utilisation de l'ordinateur, du navigateur, du mobile, le codage, les mathématiques visuelles et le développement web sont les seuls domaines couverts par ce tableau.
Il n'y a ici aucun benchmark pour la lecture d'une feuille de calcul, le rapprochement de deux exports ou la génération d'un rapport à partir de données tabulaires. De bons scores sur OSWorld indiquent que le modèle peut piloter un bureau. Ils ne garantissent pas qu'il effectuera correctement votre rapprochement de revenus.
Un détail mérite d'être signalé pour les lecteurs qui suivent les lancements open source. Muse Glimmer-30B apparaît dans ce tableau comme point de comparaison, alors que son propre tableau de lancement, publié quatre jours plus tôt, se comparait à Qwen3.6-27B. Notre article sur Muse Glimmer soulignait que son groupe de référence avait déjà une génération de retard lors de sa sortie. Ce tableau constitue l'autre moitié de cette histoire.
Comment l'exécuter
Les poids sont disponibles sur le Hugging Face Hub et sur ModelScope, conformément aux actualités du README. Le format dense 27B est le choix le plus pratique pour une machine unique.
Planifiez vos besoins en mémoire en fonction du nombre de paramètres plutôt que du plafond de contexte. Une fenêtre de 262,144 jetons est disponible, mais la remplir consomme une mémoire que la plupart des configurations locales n'ont pas en réserve.
Commencez par un contexte court et un fichier réel. Chargez un export, posez une question dont vous connaissez déjà la réponse, et vérifiez le résultat avant de faire confiance au modèle pour des tâches plus longues.
Cette étape de vérification n'est pas facultative pour le travail tabulaire. Un modèle peut décrire une feuille de calcul avec aisance tout en se trompant de colonne pour les totaux. Les réponses fausses mais formulées avec assurance sont plus difficiles à repérer que les erreurs flagrantes.
Si vous avez besoin de la fenêtre d'un million de jetons, considérez cela comme un exercice à part entière avec son propre budget matériel. Les deux configurations se comportent très différemment en pratique, et évaluer l'une ne vous apprendra pas grand-chose sur l'autre.
Modifiez d'abord l'effort de réflexion par défaut
Voici le paramètre qui déterminera votre première impression, et il est visible dans le modèle de chat de la fiche de modèle elle-même.
Le modèle résout reasoning_effort à xhigh par défaut, medium et low étant les autres valeurs acceptées. La réflexion peut également être désactivée.
Une valeur par défaut à xhigh signifie que le modèle délibérera longuement sur des questions qui ne le nécessitent pas. Pour une simple recherche d'une ligne dans un petit fichier CSV, cela donnera l'impression que le modèle est lent plutôt que méticuleux.
La première chose à ajuster n'est donc pas le prompt. Réduisez l'effort à medium ou low pour les questions de routine, et réservez xhigh aux tâches multi-étapes qui font l'objet même de la note de publication.
Sa place dans un flux de travail de données
Un modèle à poids ouverts que vous hébergez vous-même résout un problème bien précis : les données ne quittent jamais votre machine. Pour les fichiers réglementés ou sensibles, c'est l'argument ultime, et aucun confort d'hébergement tiers ne peut le remplacer.
Tout le reste est une question de compromis. Vous assumez la gestion du matériel, des mises à jour et des choix de quantification en échange de cette unique garantie.
Ce qu'il ne résout pas, c'est tout ce qui entoure le modèle. Le profilage des colonnes, la fusion de deux exports, la détection d'un champ renommé, le rendu d'un graphique et la production d'un document sont des tâches distinctes.
C'est pour combler ce fossé qu'existent les protocoles et les outils. Notre guide explicatif sur ce qu'est MCP présente le standard qui connecte les modèles aux outils. La page sur les connecteurs de données montre ce qu'un pipeline axé sur les fichiers attend en entrée.
Alternatives
Si votre besoin est local et ouvert, Qwen3.8-27B et Muse Glimmer-30B sont les deux candidats actuels dans cette catégorie de taille. Tous deux publient leurs poids et s'exécutent sur une seule machine.
Si votre besoin est d'obtenir un livrable fini à partir d'un fichier plutôt qu'un point de terminaison de modèle, la nature de l'outil est différente. Powerdrill Bloom prend la feuille de calcul, profile les colonnes et génère le graphique, le rapport ou la présentation.
Il n'y a pas de comparaison de prix possible du côté de Qwen. Aucune page officielle de tarification de Qwen n'était accessible pour ce modèle, cet article ne mentionne donc aucun chiffre.
Si votre tâche consiste concrètement à transformer un fichier en rapport, essayez directement Powerdrill Bloom. Consultez également notre guide pour transformer un export d'abonnements en un rapport MRR et ARR et la page de l'assistant CSV AI assistant.
Conclusion
Qwen3.8-27B est un modèle dense de 27B paramètres avec un contexte natif de 262,144 jetons, des poids sous licence apache-2.0, et une prise en charge documentée des entrées d'images et de vidéos. Les progressions agentiques par rapport à Qwen3.6-27B sont substantielles.
Deux bémols l'accompagnent toutefois. Le dépôt et la fiche de modèle divergent sur la multimodalité, et les benchmarks publiés couvrent les tâches de bureau, de navigation, de codage et visuelles plutôt que le travail tabulaire.
Configurez reasoning_effort avant de le juger. La valeur par défaut est xhigh, et ce réglage pousse à une réflexion plus poussée que ce que la plupart des questions exigent.
Foire aux questions
Quand Qwen3.8 a-t-il été publié ?
Les actualités du README mentionnent Qwen3.8-27B le 2026-08-14 et Qwen3.8-2.4T-A95B le 2026-08-12, tous deux disponibles sur le Hugging Face Hub et sur ModelScope.
Qwen3.8-27B est-il multimodal ?
Oui, selon sa fiche de modèle, qui le décrit comme un modèle vision-langage natif capable de comprendre les images et les vidéos. Notez que le README de GitHub attribue l'architecture multimodale à Qwen3.5.
Quelle longueur de contexte prend-il en charge ?
La fiche de modèle indique 262,144 jetons en natif, extensible jusqu'à 1,000,000. Une exécution proche de la limit supérieure nécessite une mémoire bien supérieure à celle d'une configuration locale typique.
Pourquoi semble-t-il lent sur des questions simples ?
Le modèle de chat définit par défaut reasoning_effort sur xhigh. Réduisez-le à medium ou low pour les recherches de routine et conservez xhigh pour les tâches véritablement multi-étapes.
Les benchmarks disent-ils quoi que ce soit sur le travail sur feuille de calcul ?
Non. Le tableau publié couvre l'utilisation de l'ordinateur, du navigateur, du mobile, le codage, les mathématiques visuelles et le développement web, sans aucun benchmark pour l'analyse tabulaire ou la génération de rapports.