Qwen3.8: Novità, Come Eseguirlo e Alternative (2026)

Il team Qwen di Alibaba ha rilasciato Qwen3.8-27B il 14 agosto 2026, due giorni dopo il ben più grande Qwen3.8-2.4T-A95B. La nota di rilascio è lunga una sola frase e vale la pena leggerla due volte.
"Per la prima volta, Qwen3.8 porta un modello di classe Qwen-Max in una release aperta."
Si tratta di un'affermazione che riguarda il livello, non le dimensioni. Significa che i pesi aperti ora si collocano dove prima si trovava il modello di punta ospitato.
Se questo valga o meno per il vostro carico di lavoro è un'altra questione, e le prove pubblicate rispondono solo in parte. Il resto di questo articolo si concentra su quali parti.
Questo articolo analizza ciò che è stato rilasciato e i punti in cui i due documenti ufficiali non concordano. Esamina poi cosa misura effettivamente la tabella dei benchmark. Infine, spiega come eseguire il modello localmente, se desiderate che l'analisi rimanga sulla vostra macchina.
Cos'è effettivamente Qwen3.8
Il README ufficiale descrive la famiglia come costruita "sulle fondamenta architetturali di Qwen3.5", offrendo miglioramenti "nella programmazione, nel lavoro professionale, nella ricerca e nei compiti agentici a lungo termine".
La frase che conta per chiunque svolga attività multi-step è la successiva. Qwen3.8 "è progettato per portare a termine compiti complessi e multi-step con maggiore affidabilità".
Il modello da 27B è quello che la maggior parte delle persone eseguirà localmente. La sua model card fornisce i numeri reali: 27B parametri, 64 layer, dimensione nascosta 5120 e un layout ibrido di blocchi Gated DeltaNet e Gated Attention.
La lunghezza del contesto è di 262,144 token nativi ed è estendibile fino a 1,000,000. La licenza registrata sulla model card è apache-2.0.
Vale la pena fare chiarezza sui due rilasci. Il modello mixture-of-experts 2.4T-A95B è arrivato il 2026-08-12, mentre il modello dense da 27B è seguito il 2026-08-14. Solo il secondo è realisticamente auto-ospitabile.
| Dato | Qwen3.8-27B |
|---|---|
| Rilasciato | 2026-08-14 |
| Parametri | 27B dense |
| Layer | 64 |
| Contesto | 262,144 nativo, estendibile a 1,000,000 |
| Licenza | apache-2.0 |
| Input | Testo, immagini, video |
I punti in cui i due documenti ufficiali non concordano
Questa è la parte che quasi nessuno riporta, e cambia ciò che si può affermare con sicurezza.
Il README di GitHub attribuisce l'architettura multimodale a Qwen3.5, la generazione su cui è costruito Qwen3.8. Leggendo solo quella pagina si potrebbe concludere che il modello da 27B sia solo testuale.
La model card dice il contrario, ed è specifica. Qwen3.8-27B è "un modello vision-language nativo che comprende immagini e video, con un controllo flessibile del pensiero."
Quando due fonti ufficiali sono in conflitto, vince quella più specifica. La model card descrive esattamente questo checkpoint, quindi la capacità multimodale è reale. È utile sapere che esiste questa discrepanza, perché una rapida occhiata alla repository vi direbbe il contrario.
Cosa misura la tabella dei benchmark e cosa tralascia
La model card pubblica un confronto con Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B e Opus4.6 Max. Alcuni dei numeri relativi alle capacità agentiche mostrano balzi notevoli.
| Benchmark | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (uso del computer) | 84.3 | 63.9 |
| WebArena-Verified (uso del browser) | 64.8 | 48.8 |
| AndroidWorld (uso mobile) | 81.9 | 70.3 |
| SWE-bench Pro (programmazione) | 61.7 | — |
| MathVision (con interprete di codice) | 94.6 | 90.3 |
| Vision2Web (sviluppo web visivo) | 62.9 | 45.0 |
Ora passiamo a una lettura onesta. Uso del computer, uso del browser, uso mobile, programmazione, matematica visiva e sviluppo web sono gli ambiti coperti da questa tabella.
Qui non ci sono benchmark per la lettura di un foglio di calcolo, la riconciliazione di due esportazioni o la generazione di un report da dati tabulari. Gli ottimi punteggi in OSWorld indicano che il modello è in grado di gestire un desktop, ma non garantiscono che eseguirà correttamente la riconciliazione dei ricavi.
Un dettaglio che vale la pena segnalare per i lettori che seguono i rilasci open. Muse Glimmer-30B appare in questa tabella come punto di confronto, e la sua stessa tabella di lancio di quattro giorni prima si confrontava con Qwen3.6-27B. Il nostro articolo su Muse Glimmer faceva notare come il suo gruppo di riferimento fosse già indietro di una generazione al momento del lancio. Questa tabella rappresenta l'altra metà della storia.
Come eseguirlo
I pesi sono disponibili su Hugging Face Hub e su ModelScope, come indicato nelle novità del README. Il formato dense da 27B è la scelta più pratica per una singola macchina.
Pianificate la memoria in base al numero di parametri piuttosto che al limite massimo del contesto. È disponibile una finestra di 262,144 token, ma riempirla richiede una quantità di memoria che la maggior parte delle configurazioni locali non ha a disposizione.
Iniziate con un contesto breve e un file reale. Caricate un'esportazione, ponete una domanda di cui conoscete già la risposta e verificate il risultato prima di affidargli compiti più lunghi.
Questo passaggio di verifica non è facoltativo per il lavoro sui dati tabulari. Un modello può descrivere un foglio di calcolo in modo fluente e ciononostante sbagliare a individuare la colonna dei totali. Le risposte errate ma fluide sono più difficili da individuare rispetto a quelle palesemente sbagliate.
Se avete bisogno della finestra da un milione di token, consideratela come un'attività a sé stante con un proprio budget hardware. Le due configurazioni si comportano in modo molto diverso all'atto pratico, e testare l'una dice ben poco sull'altra.
Modificare prima di tutto lo sforzo di ragionamento predefinito
Ecco l'impostazione che influenzerà la vostra prima impressione, ed è visibile nel chat template della model card stessa.
Il template imposta reasoning_effort su xhigh per impostazione predefinita, con medium e low come altri valori accettati. Il pensiero può anche essere disattivato.
Un'impostazione predefinita su xhigh significa che il modello rifletterà a lungo su domande che non lo richiedono. Per una ricerca su una singola riga in un piccolo file CSV, questo si tradurrà in un modello lento piuttosto che attento.
Quindi la prima cosa da ottimizzare non è il prompt. Riducete lo sforzo a medium o low per le domande di routine, e riservate xhigh per il lavoro multi-step di cui parla effettivamente la nota di rilascio.
Come si colloca questo in un flusso di lavoro sui dati
Un modello open-weight ospitato in locale risolve un problema specifico: i dati non lasciano mai la vostra macchina. Per i file regolamentati o sensibili questo è l'argomento decisivo, e nessuna comodità offerta da servizi in cloud può sostituirlo.
Qualsiasi altro aspetto di questa scelta è un compromesso. Vi fate carico dell'hardware, degli aggiornamenti e delle decisioni sulla quantizzazione in cambio di quell'unica garanzia.
Ciò che non risolve è tutto il contorno del modello. La profilazione delle colonne, l'unione di due esportazioni, l'individuazione di un campo rinominato, la generazione di un grafico e la produzione di un documento sono attività separate.
Questa lacuna è il motivo per cui esistono i livelli di protocollo e di tooling. La nostra spiegazione su cosa sia l'MCP illustra lo standard che collega i modelli agli strumenti. La pagina dei connettori dati mostra cosa si aspetta in input una pipeline incentrata sui file.
Alternative
Se il requisito è locale e open, Qwen3.8-27B e Muse Glimmer-30B sono i due candidati attuali nella stessa classe di dimensioni. Entrambi pubblicano i pesi ed entrambi girano su una singola macchina.
Se il requisito è un output finito a partire da un file piuttosto che l'endpoint di un modello, la tipologia di strumento è diversa. Powerdrill Bloom prende il foglio di calcolo, profila le colonne e restituisce il grafico, il report o la presentazione.
Non è possibile fare un confronto dei prezzi per quanto riguarda Qwen. Non è stato possibile raggiungere alcuna pagina ufficiale dei prezzi di Qwen per questo modello, pertanto questo articolo non riporta cifre.
Se il vostro compito effettivo è un file che deve diventare un report, provate direttamente Powerdrill Bloom. Consultate anche la nostra guida su come trasformare un'esportazione di abbonamenti in un report MRR e ARR e la pagina dell'assistente CSV AI assistant.
Conclusione
Qwen3.8-27B è un modello dense da 27B con un contesto nativo di 262,144 token, pesi apache-2.0 e input di immagini e video documentati. I balzi in avanti nelle capacità agentiche rispetto a Qwen3.6-27B sono sostanziali.
Ci sono due avvertenze da tenere a mente. La repository e la model card non concordano sulla multimodalità, e i benchmark pubblicati coprono attività desktop, browser, di programmazione e visive piuttosto che il lavoro sui dati tabulari.
Impostate reasoning_effort prima di valutarlo. Il valore predefinito è xhigh, e questa impostazione predefinita comporta una riflessione maggiore di quella richiesta dalla maggior parte delle domande.
Domande frequenti
Quando è stato rilasciato Qwen3.8?
Le novità del README registrano Qwen3.8-27B il 2026-08-14 e Qwen3.8-2.4T-A95B il 2026-08-12, entrambi su Hugging Face Hub e ModelScope.
Qwen3.8-27B è multimodale?
Sì, secondo la sua model card, che lo descrive come un modello vision-language nativo in grado di comprendere immagini e video. Si noti che il README di GitHub attribuisce l'architettura multimodale a Qwen3.5.
Quale lunghezza del contesto supporta?
La model card indica 262,144 token nativi, estendibili fino a 1,000,000. L'esecuzione vicino alla cifra superiore richiede una memoria ben superiore a quella di una tipica configurazione locale.
Perché sembra lento con le domande semplici?
Il chat template imposta reasoning_effort su xhigh per impostazione predefinita. Riducetelo a medium o low per le ricerche di routine e mantenete xhigh per i compiti realmente multi-step.
I benchmark dicono qualcosa sul lavoro con i fogli di calcolo?
No. La tabella pubblicata copre l'uso del computer, l'uso del browser, l'uso mobile, la programmazione, la matematica visiva e lo sviluppo web, senza alcun benchmark per l'analisi tabulare o la generazione di report.