Super Sale WeekClaude Skills — 20% OFF
News

Qwen3.8: O que há de novo, como executá-lo e alternativas (2026)

Powerdrill Team·
Qwen3.8: O que há de novo, como executá-lo e alternativas (2026)

A equipe do Qwen da Alibaba lançou o Qwen3.8-27B em 14 de agosto de 2026, dois dias após o muito maior Qwen3.8-2.4T-A95B. A nota de lançamento tem apenas uma frase e vale a pena ler duas vezes.

"Pela primeira vez, o Qwen3.8 traz um modelo da classe Qwen-Max para lançamento aberto."

Essa é uma afirmação sobre categoria, não sobre tamanho. Ela diz que os pesos abertos agora ocupam o lugar onde o modelo principal hospedado costumava ficar.

Se isso se aplica ao seu fluxo de trabalho é outra questão, e as evidências publicadas respondem a isso apenas em parte. O restante deste artigo aborda quais partes.

Este artigo aborda o que foi lançado e onde os dois documentos oficiais divergem. Em seguida, analisa o que a tabela de benchmarks realmente mede. Por fim, explica como executar o modelo localmente, caso você queira que a análise permaneça na sua própria máquina.

O que o Qwen3.8 realmente é

O README oficial descreve a família como construída "sobre a base arquitetônica do Qwen3.5", entregando melhorias "em programação, trabalho profissional, pesquisa e tarefas de agentes de longo prazo".

A frase que importa para quem realiza trabalhos em várias etapas é a seguinte. O Qwen3.8 "foi projetado para realizar tarefas complexas de várias etapas até a conclusão com maior confiabilidade."

O modelo de 27B é o que a maioria das pessoas executará localmente. Seu model card traz os números exatos: 27B de parâmetros, 64 camadas, dimensão oculta de 5120 e um layout híbrido de blocos Gated DeltaNet e Gated Attention.

O comprimento do contexto é de 262.144 tokens nativamente e extensível até 1.000.000. A licença registrada no model card é apache-2.0.

Vale a pena distinguir os dois lançamentos. O modelo de mistura de especialistas (mixture-of-experts) 2.4T-A95B chegou em 12-08-2026, e o modelo denso de 27B veio em seguida, em 14-08-2026. Apenas o segundo é viável para auto-hospedagem.

Fato Qwen3.8-27B
Lançado em 2026-08-14
Parâmetros 27B denso
Camadas 64
Contexto 262.144 nativo, extensível para 1.000.000
Licença apache-2.0
Entradas Texto, imagens, vídeo

Onde os dois documentos oficiais divergem

Esta é a parte que quase ninguém relata, e ela muda o que você pode afirmar com segurança.

O README do GitHub atribui a arquitetura multimodal ao Qwen3.5, a geração sobre a qual o Qwen3.8 foi construído. Se você ler apenas essa página, concluirá que o modelo de 27B é apenas de texto.

O model card diz o contrário, e é específico. O Qwen3.8-27B é "um modelo nativo de visão-linguagem que compreende imagens e vídeos, com controle flexível de raciocínio."

Quando duas fontes oficiais entram em conflito, a mais específica vence. O model card está descrevendo este checkpoint exato, portanto, a capacidade multimodal é real. Vale a pena saber que essa discrepância existe, pois uma leitura rápida do repositório dirá o oposto.

O que a tabela de benchmarks mede e o que ela deixa de fora

O model card publica uma comparação com o Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B e Opus4.6 Max. Alguns dos números de capacidades de agente apresentam grandes saltos.

Benchmark Qwen3.8-27B Qwen3.6-27B
OSWorld-Verified (uso de computador) 84.3 63.9
WebArena-Verified (uso de navegador) 64.8 48.8
AndroidWorld (uso de celular) 81.9 70.3
SWE-bench Pro (programação) 61.7
MathVision (com intérprete de código) 94.6 90.3
Vision2Web (desenvolvimento web visual) 62.9 45.0

Agora, a leitura realista. Uso de computador, uso de navegador, uso de celular, programação, matemática visual e desenvolvimento web são o que esta tabela cobre.

Não há nenhum benchmark aqui para leitura de planilhas, reconciliação de duas exportações ou geração de relatórios a partir de dados tabulares. Números fortes no OSWorld indicam que o modelo consegue controlar uma área de trabalho. Eles não garantem que ele fará a reconciliação de receita corretamente.

Um detalhe que vale a pena destacar para os leitores que acompanham lançamentos abertos. O Muse Glimmer-30B aparece nesta tabela como ponto de comparação, e sua própria tabela de lançamento, quatro dias antes, comparava-o com o Qwen3.6-27B. Nosso artigo sobre o Muse Glimmer observou que seu grupo de comparação já estava uma geração atrás no lançamento. Esta tabela é a outra metade dessa história.

Como executá-lo

Os pesos estão no Hugging Face Hub e no ModelScope, conforme a seção de novidades do README. O formato denso de 27B é a escolha prática para uma única máquina.

Planeje sua memória com base na contagem de parâmetros, e não no limite máximo de contexto. Uma janela de 262.144 tokens está disponível, mas preenchê-la consome uma memória que a maioria das configurações locais não tem de sobra.

Comece com um contexto curto e um arquivo real. Carregue uma exportação, faça uma pergunta para a qual você já sabe a resposta e verifique o resultado antes de confiar em algo mais longo.

Essa etapa de verificação não é opcional para trabalhos tabulares. Um modelo pode descrever uma planilha com fluência e, ainda assim, ler incorretamente qual coluna contém os totais. Respostas incorretas fluentes são mais difíceis de detectar do que as óbvias.

Se você precisar da janela de um milhão de tokens, trate isso como um exercício separado, com seu próprio orçamento de hardware. As duas configurações se comportam de maneira muito diferente na prática, e testar uma diz muito pouco sobre a outra.

Altere o esforço de raciocínio padrão primeiro

Aqui está a configuração que moldará sua primeira impressão, e ela está visível no próprio modelo de chat do model card.

O modelo resolve o reasoning_effort para xhigh por padrão, sendo medium e low os outros valores aceitos. O pensamento também pode ser desativado.

Um padrão xhigh significa que o modelo deliberará longamente sobre perguntas que não precisam disso. Para uma busca de uma única linha em um CSV pequeno, isso parecerá que o modelo é lento, em vez de cuidadoso.

Portanto, a primeira coisa a ajustar não é o prompt. Reduza o esforço para medium ou low para perguntas rotineiras e reserve o xhigh para o trabalho de várias etapas ao qual a nota de lançamento realmente se refere.

Onde isso se encaixa em um fluxo de trabalho de dados

Um modelo de pesos abertos que você mesmo hospeda resolve um problema específico: os dados nunca saem da sua máquina. Para arquivos regulamentados ou confidenciais, esse é o principal argumento, e nenhuma conveniência de hospedagem externa substitui isso.

Tudo o mais nessa escolha é uma troca. Você assume decisões de hardware, atualizações e quantização em troca dessa única garantia.

O que ele não resolve é tudo o que envolve o modelo. Criação de perfil de colunas, união de duas exportações, detecção de campos renomeados, renderização de gráficos e produção de documentos são tarefas separadas.

Essa lacuna é a razão pela qual existem camadas de protocolo e ferramentas. Nossa explicação sobre o que é MCP aborda o padrão que conecta modelos a ferramentas. A página de conectores de dados mostra o que um pipeline focado em arquivos espera como entrada.

Alternativas

Se o requisito for local e aberto, o Qwen3.8-27B e o Muse Glimmer-30B são os dois candidatos atuais na mesma classe de tamanho. Ambos publicam pesos e ambos rodam em uma única máquina.

Se o requisito for um artefato finalizado a partir de um arquivo, em vez de um endpoint de modelo, o formato da ferramenta é diferente. O Powerdrill Bloom recebe a planilha, analisa as colunas e retorna o gráfico, o relatório ou a apresentação.

Não há comparação de preços a ser feita do lado do Qwen. Nenhuma página oficial de preços do Qwen estava acessível para este modelo, portanto, este artigo não cita valores.

Se a sua tarefa real for um arquivo que precisa se transformar em um relatório, experimente o Powerdrill Bloom diretamente nele. Veja também nosso guia sobre como transformar uma exportação de assinaturas em um relatório de MRR e ARR e a página do assistente de IA para CSV.

Conclusão

O Qwen3.8-27B é um modelo denso de 27B com contexto nativo de 262.144 tokens, pesos apache-2.0 e entrada documentada de imagem e vídeo. Os saltos em capacidades de agente em relação ao Qwen3.6-27B são substanciais.

Dois pontos de atenção o acompanham. O repositório e o model card divergem sobre a multimodalidade, e os benchmarks publicados cobrem tarefas de desktop, navegador, programação e visuais, em vez de trabalho tabular.

Defina o reasoning_effort antes de avaliá-lo. O padrão é xhigh, e esse padrão realiza mais raciocínio do que a maioria das perguntas exige.

Perguntas frequentes

Quando o Qwen3.8 foi lançado?

As entradas de novidades do README registram o Qwen3.8-27B em 14-08-2026 e o Qwen3.8-2.4T-A95B em 12-08-2026, ambos no Hugging Face Hub e no ModelScope.

O Qwen3.8-27B é multimodal?

Sim, de acordo com seu model card, que o descreve como um modelo nativo de visão-linguagem que compreende imagens e vídeos. Note que o README do GitHub atribui a arquitetura multimodal ao Qwen3.5.

Qual comprimento de contexto ele suporta?

O model card indica 262.144 tokens nativamente, extensível até 1.000.000. Executá-lo próximo ao valor limite exige uma memória muito além de uma configuração local típica.

Por que ele parece lento em perguntas simples?

O modelo de chat define o padrão de reasoning_effort como xhigh. Reduza-o para medium ou low para buscas rotineiras e mantenha o xhigh para tarefas genuinamente de várias etapas.

Os benchmarks dizem algo sobre trabalho com planilhas?

Não. A tabela publicada cobre uso de computador, uso de navegador, uso de celular, programação, matemática visual e desenvolvimento web, sem nenhum benchmark para análise tabular ou geração de relatórios.