Semana de super promoçãoClaude Skills — 20% OFF
News

DeepSeek V4.1-Flash: O que há de novo, preços e alternativas (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: O que há de novo, preços e alternativas (2026)

A DeepSeek lançou o V4.1-Flash em 10 de setembro de 2026. Trata-se de um modelo Mixture-of-Experts de 552B parâmetros que lê imagens e texto nativamente, lida com contextos de até um milhão de tokens e é distribuído sob uma licença MIT. A principal mudança é o custo: o modelo ativa 8B de parâmetros na entrada e 16B na saída.

Essa última frase resume toda a história de forma compacta. Este guia detalha essas informações e apresenta os preços publicados da API. Ele também explica o que o lançamento muda e o que permanece igual se o seu trabalho final for um relatório, uma apresentação ou uma tabela.

Todos os fatos abaixo vêm da própria nota de lançamento da DeepSeek, de seu model card no Hugging Face e de sua página de preços publicada, verificados em 14 de setembro de 2026.

O que há de novo no DeepSeek V4.1-Flash

A nota de lançamento da DeepSeek começa com quatro afirmações. O modelo é "mais inteligente, mais rápido e mais eficiente". É "o menor modelo da nossa nova família de arquitetura, com compreensão visual nativa". Ele foi projetado para "maior capacidade, inferência mais rápida e maior rendimento". E ele se expande para modelos maiores posteriormente.

O model card é mais específico. O DeepSeek-V4.1-Flash é descrito como "um modelo multimodal Mixture-of-Experts (MoE) com 552B parâmetros de backbone e suporte para contextos de até um milhão de tokens". Ele "processa nativamente imagens e texto, e gera texto de forma autorregressiva".

Três mudanças são importantes para o trabalho diário, e não apenas para testes de benchmark.

A visão é integrada, não adaptada. Um codificador de visão e um projetor de duas camadas transformam imagens em embeddings. Eles são "processados em conjunto com embeddings de texto desde o início do pré-treinamento do modelo de linguagem". O model card aponta o DeepSeek-ViT, o codificador, como treinado do zero.

O contexto chega a um milhão de tokens. O pré-treinamento usou 45T de tokens, com atenção esparsa treinada em 64K e o contexto estendido para 1M posteriormente na execução.

O esforço de raciocínio é ajustável. O modelo "suporta uma configuração de esforço de raciocínio continuamente controlável (número inteiro de 1 a 100) que equilibra o custo de inferência com a precisão". Você gasta mais apenas nas perguntas que realmente precisam.

A DeepSeek também aposentou a geração anterior. A nota de lançamento afirma que "o V4-Flash & V4-Flash-Vision-Exp foram aposentados" e que os nomes dos modelos antigos são temporariamente direcionados para o V4.1-Flash por motivos de compatibilidade.

A mudança de arquitetura por trás da redução de custos

A parte interessante do lançamento do DeepSeek V4.1-Flash não é a tabela de benchmark. É a aritmética de memória.

O DeepSeek-V4.1-Flash usa o que o model card chama de arquitetura Causal Encoder-Decoder (CED). Trata-se de um Transformer de 40 camadas dividido em um codificador causal de 20 camadas e um decodificador de 20 camadas. O KV cache global do decodificador é projetado a partir dos estados ocultos finais do codificador, em vez de ser construído por camada.

O resultado prático é o número citado em todos os lugares: 8B de parâmetros ativos por token durante o prefill, 16B durante o decode. O model card descreve isso como "uma melhoria substancial na eficiência de custos para fluxos de trabalho de agentes com uso intensivo de entrada".

"Uso intensivo de entrada" é a frase a ser observada. Documentos longos exigem muita entrada. O mesmo vale para um chat onde você anexa quarenta páginas e depois faz seis perguntas sobre elas.

Duas técnicas adicionais reduzem o próprio cache. O Compressed Sparse Attention 2 atribui a cada camada de atenção um de três modos e compartilha índices entre as camadas. O FP4 main KV caching armazena o cache em um formato de quatro bits. Juntos, o model card estima o KV cache global em 890 bytes per token, cerca de um quarto da geração anterior.

A nota de lançamento traduz isso na métrica que o comprador realmente sente. Em comparação com a geração anterior, o cache precisa de "1/4 de HBM" e "1/8 de armazenamento SSD". Ela acrescenta que "as cobranças de cache-hit geralmente representam uma grande parcela dos custos dos agentes".

Preços do DeepSeek V4.1-Flash

A DeepSeek publica preços por milhão de tokens e os divide entre horários de pico e fora de pico. Os valores abaixo são da página oficial de Models & Pricing em 14 de setembro de 2026, em dólares americanos.

Métrica Fora de pico Pico
1M de tokens de entrada (cache hit) $0.003 $0.006
1M de tokens de entrada (cache miss) $0.15 $0.3
1M de tokens de saída $0.6 $1.2

A página afirma que "as tarifas fora de pico são a metade das tarifas de pico" e define os horários de pico como 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira. Todo o restante é considerado fora de pico.

Dois detalhes operacionais acompanham a tabela. O nome do modelo a ser usado é deepseek-flash. O comprimento do contexto é de 1M com uma saída máxima de 384K, e o limite de concorrência listado é de 2.500.

A mesma página observa que o V4-Pro continua disponível. A DeepSeek escreve que "decidiu continuar fornecendo serviços de API para o DeepSeek V4 Pro após 14 de setembro de 2026". O método de cobrança é indicado como inalterado.

O que os benchmarks cobrem e o que não cobrem

As tabelas de modelos instruct do model card inclinam-se para trabalhos de código e agentes. Terminal-Bench, DeepSWE, NL2Repo-Bench e Codeforces ocupam a maioria das linhas. Isso reflete o foco da DeepSeek.

Quatro linhas são mais relevantes se o seu resultado final for um documento.

Benchmark DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

O DocVQA mede a resposta a perguntas sobre imagens de documentos. Essa é a aproximação publicada mais próxima para a leitura de uma fatura digitalizada, um contrato de aluguel ou um relatório em PDF. O modelo base atinge a pontuação de 95.6 nesse teste.

Do lado instruct, o Chartography com ferramentas fica em 78.9 e o BabyVision com ferramentas em 89.6. Ambos são benchmarks de agentes visuais executados por meio de uma estrutura externa.

Considere esses números como indicativos. O model card afirma que todas as avaliações de agentes usam temperature=1.0, top_p=0.95, e que os benchmarks de agentes visuais usam uma janela de contexto de 512k tokens. Sua configuração será diferente.

O que isso muda para o trabalho de transformação de documentos em entregáveis

Um token de entrada mais barato muda quais fluxos de trabalho realmente valem a pena automatizar.

Considere um mês de faturas de fornecedores em PDF. Sob a lógica antiga, você faria a extração uma vez, armazenaria um resumo e trabalharia a partir dele. A extração era a etapa cara, então você a fazia o mínimo possível.

A entrada custa $0.15 por milhão de tokens em caso de cache miss. Um cache hit custa uma fração de centavo. Com essas tarifas, reler a fonte deixa de ser o fator determinante do custo. Você pode fazer uma segunda pergunta comparando com as páginas originais em vez de recorrer às suas próprias anotações.

Isso é importante para a precisão, não apenas para o orçamento. Um resumo perde o número da página. O original, não.

O contexto de 1M tem um efeito semelhante. Ordens de serviço de um trimestre, um arquivo completo de contratos de locação ou um ano de diários de turno podem caber em uma única janela. Você não precisa mais escolher quais dez documentos incluir.

A visão nativa preenche a última lacuna. Um gráfico colado em um slide, a foto de uma leitura de medidor e uma nota de entrega digitalizada tornam-se entradas legíveis, em vez de algo que precisa ser digitado novamente.

Onde um modelo mais barato deixa de ajudar

O DeepSeek V4.1-Flash é uma camada. O entregável é outra.

As páginas da DeepSeek descrevem uma API e um produto de chat. Elas definem preços, limites de contexto, benchmarks e o nome do modelo. O que elas não descrevem é um espaço de trabalho que mantenha seus arquivos, suas análises anteriores e seus formatos de saída integrados entre as sessões.

Essa é a divisão de trabalho comum, não uma falha. Uma API foi feita para ser um componente.

A consequência prática é que a etapa final continua sendo sua. Alguém ainda precisa colocar a resposta em uma tabela formatada, em um slide ou em um documento que um colega possa abrir. Alguém ainda precisa ser capaz de apontar para um número e dizer de qual página ele veio.

O Powerdrill Bloom atua nessa camada. Sua página inicial o descreve como "o analista de dados de IA que mostra seu trabalho". Ela acrescenta que "cada número vem acompanhado da página, da linha e do dado por trás dele". Você faz o upload dos arquivos, pergunta em linguagem natural e obtém o artefato.

As duas camadas se complementam em vez de competir. Um modelo mais barato, com maior contexto e capacidade de visão torna a etapa de leitura mais barata. Um espaço de trabalho decide o que fazer com o que foi lido.

Alternativas que vale a pena conhecer

Se você está avaliando o V4.1-Flash em relação a outras opções, três comparações surgem com mais frequência.

Contra o DeepSeek V4-Pro. A nota de lançamento diz que "testes realizados por várias partes colocam o V4.1-Flash à frente do V4-Pro em desempenho, custo, velocidade e tempo total de execução". Ela acrescenta que a DeepSeek está "descontinuando o V4-Pro". A página de preços ainda lista o V4-Pro a $0.66 por milhão de tokens de entrada em caso de cache miss fora de pico, contra $0.15 do Flash. O V4-Pro não lista suporte a visão nessa página.

Contra modelos proprietários de fronteira. A tabela de comparação do model card inclui o Opus-5.0 e o GPT-5.6 Sol. O Flash lidera em várias linhas de agentes, incluindo o Terminal-Bench 2.1 com 90.6 e o AutomationBench com 54.8. Ele fica atrás no Terminal-Bench 3.0 e 4.0. Encare tabelas fornecidas por desenvolvedores como tabelas fornecidas por desenvolvedores.

Contra um espaço de trabalho em vez de um modelo. Se o que você realmente precisa é de um relatório finalizado a partir de arquivos que já possui, a comparação não deve ser de modelo para modelo. Nosso resumo de alternativas ao DeepSeek aborda essa perspectiva, e o artigo explicativo sobre agentes de dados de IA define a categoria.

Como acessar o DeepSeek V4.1-Flash

Três caminhos estão documentados nas próprias páginas da DeepSeek.

A API é o primeiro. Direcione seu cliente para https://api.deepseek.com para o formato compatível com a OpenAI, ou https://api.deepseek.com/anthropic para o formato da Anthropic, e defina o modelo como deepseek-flash. A página de preços lista suporte para saída JSON, chamadas de ferramentas (tool calls), a API de Responses e visão.

O produto de chat é o segundo, em chat.deepseek.com, linkado diretamente pelo model card.

Os pesos são o terceiro. O modelo está publicado no Hugging Face sob uma licença MIT, acompanhado de um relatório técnico. Esse é o caminho se você precisar dele dentro da sua própria rede.

Uma observação para o terceiro caminho. O model card afirma que "este lançamento não inclui um modelo de chat no formato Jinja", portanto, a codificação de prompts exige atenção caso você faça hospedagem própria.

Perguntas Frequentes (FAQs)

O que é o DeepSeek V4.1-Flash? É um modelo multimodal Mixture-of-Experts lançado pela DeepSeek em 10 de setembro de 2026. O model card lista 552B parâmetros de backbone, processamento nativo de imagem e texto, e suporte para contextos de até um milhão de tokens. Ele é publicado sob uma licença MIT.

Quanto custa o DeepSeek V4.1-Flash? A página oficial de preços lista $0.15 por milhão de tokens de entrada em caso de cache miss em tarifas fora de pico, e $0.3 no pico. A saída custa $0.6 fora de pico e $1.2 no pico. A entrada com cache-hit custa $0.003 fora de pico.

O DeepSeek V4.1-Flash suporta imagens? Sim. O model card descreve um codificador de visão treinado do zero, com embeddings visuais processados em conjunto com o texto desde o início do pré-treinamento. A página de preços indica que a visão é suportada para o deepseek-flash.

O que aconteceu com o DeepSeek V4-Flash? A nota de lançamento afirma que o V4-Flash e o V4-Flash-Vision-Exp foram aposentados. Os nomes dos modelos legados ainda são aceitos e direcionam para o V4.1-Flash, cobrados com a tarifa do Flash.

O DeepSeek V4.1-Flash é bom para criar relatórios e slides? O modelo lida bem com a etapa de leitura, e a pontuação de 95.6 no DocVQA sugere uma forte compreensão de documentos. Transformar isso em um entregável formatado é uma camada separada, que é justamente o que um espaço de trabalho de IA oferece.

Conclusão

O DeepSeek V4.1-Flash é um lançamento focado em eficiência disfarçado de lançamento de novos recursos. O trabalho de arquitetura concentrou-se no KV cache, e o retorno se reflete em entradas longas.

Para quem recebe dados em formato de documentos, esse é um caminho extremamente útil. Ler cem páginas duas vezes agora é um erro de arredondamento, e não mais uma decisão difícil.

O modelo ainda entrega apenas texto. Se a sua semana termina com uma tabela que alguém precisa aprovar, a etapa posterior ao modelo é a que consome seu tempo. Experimente o Powerdrill Bloom gratuitamente e faça o upload dos documentos que você iria resumir manualmente.


Fontes (em 14/09/2026): Nota de lançamento do DeepSeek-V4.1-Flash · Model card do DeepSeek-V4.1-Flash · Modelos e Preços da DeepSeek. Os preços e a disponibilidade mudam; verifique as páginas oficiais antes de planejar seu orçamento.