Semaine des super promosClaude Skills — 20 % DE RÉDUCTION
News

DeepSeek V4.1-Flash : nouveautés, tarifs et alternatives (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash : nouveautés, tarifs et alternatives (2026)

DeepSeek a lancé V4.1-Flash le 10 septembre 2026. Il s'agit d'un modèle Mixture-of-Experts de 552 milliards de paramètres qui lit nativement les images et le texte, gère un contexte allant jusqu'à un million de tokens et est distribué sous licence MIT. Le changement majeur concerne le coût : le modèle active 8 milliards de paramètres en entrée et 16 milliards en sortie.

Cette dernière phrase résume à elle seule toute l'histoire. Ce guide la décortique et présente les tarifs publiés de l'API. Il explique également ce que cette version change, ou ne change pas, si votre travail aboutit à un rapport, une présentation ou un tableau.

Tous les faits ci-dessous proviennent de la note de version officielle de DeepSeek, de sa fiche de modèle Hugging Face et de sa page de tarification publiée, vérifiées le 14 septembre 2026.

Les nouveautés de DeepSeek V4.1-Flash

La note de version de DeepSeek s'ouvre sur quatre affirmations. Le modèle est « plus intelligent, plus rapide, plus efficace ». Il s'agit du « plus petit modèle de notre nouvelle famille d'architectures, doté d'une compréhension visuelle native ». Il est conçu pour offrir « une plus grande capacité, une inférence plus rapide, un débit plus élevé ». Et il s'adaptera plus tard à des modèles plus grands.

La fiche du modèle est plus précise. DeepSeek-V4.1-Flash y est décrit comme « un modèle Mixture-of-Experts (MoE) multimodal doté d'une architecture de base de 552 milliards de paramètres et prenant en charge des contextes allant jusqu'à un million de tokens ». Il « traite nativement les images et le texte, et génère du texte de manière autorégressive ».

Trois changements importent réellement pour le travail quotidien, bien plus que pour les benchmarks.

La vision est intégrée nativement, et non ajoutée après coup. Un encodeur de vision et un projecteur à deux couches transforment les images en plongements (embeddings). Ceux-ci sont « traités conjointement avec les plongements de texte dès le début du pré-entraînement du modèle de langage ». La fiche du modèle indique que DeepSeek-ViT, l'encodeur, a été entraîné à partir de zéro.

Le contexte atteint un million de tokens. Le pré-entraînement a utilisé 45 billions (45T) de tokens, avec une attention éparse entraînée à 64K et un contexte étendu à 1M plus tard au cours du processus.

L'effort de raisonnement est ajustable. Le modèle « prend en charge un paramètre d'effort de raisonnement contrôlable en continu (entier de 1 à 100) qui permet de troquer le coût d'inférence contre de la précision ». Vous ne dépensez plus que pour les questions qui le nécessitent vraiment.

DeepSeek a également retiré la génération précédente. La note de version indique que « V4-Flash & V4-Flash-Vision-Exp sont retirés » et que les anciens noms de modèles redirigent temporairement vers V4.1-Flash pour des raisons de compatibilité.

Le changement d'architecture derrière la baisse des coûts

L'aspect le plus intéressant de la sortie de DeepSeek V4.1-Flash n'est pas le tableau des benchmarks. C'est l'arithmétique de la mémoire.

DeepSeek-V4.1-Flash utilise ce que la fiche du modèle appelle une architecture Causal Encoder-Decoder (CED). Il s'agit d'un Transformer à 40 couches divisé en un encodeur causal de 20 couches et un décodeur de 20 couches. Le cache KV global du décodeur est projeté à partir des états cachés finaux de l'encodeur plutôt que d'être construit par couche.

Le résultat pratique est le chiffre cité partout : 8 milliards de paramètres actifs par token pendant le pré-remplissage (prefill), 16 milliards pendant le décodage. La fiche du modèle décrit cela comme « améliorant considérablement l'efficacité des coûts pour les charges de travail d'agents gourmandes en entrées ».

« Gourmand en entrées » est l'expression clé à retenir. Les longs documents entrent dans cette catégorie. C'est également le cas d'une discussion où vous joignez quarante pages pour ensuite poser six questions à leur sujet.

Deux autres techniques permettent de réduire la taille du cache lui-même. L'attention éparse compressée (Compressed Sparse Attention 2) attribue à chaque couche d'attention l'un des trois modes disponibles et partage les indices entre les couches. Le stockage en cache KV principal FP4 conserve le cache dans un format à quatre bits. Ensemble, selon la fiche du modèle, ils ramènent le cache KV global à 890 octets par token, soit environ un quart de la génération précédente.

La note de version traduit cela en une mesure concrète pour l'acheteur. Par rapport à la génération précédente, le cache nécessite « 1/4 de la HBM » et « 1/8 du stockage SSD ». Elle ajoute que « les frais liés aux hits de cache représentent souvent une part importante des coûts des agents ».

Tarification de DeepSeek V4.1-Flash

DeepSeek publie des tarifs par million de tokens et les répartit entre heures pleines et heures creuses. Les valeurs ci-dessous proviennent de la page officielle Models & Pricing au 14 septembre 2026, en dollars américains.

Mesure Heures creuses Heures pleines
1M de tokens d'entrée (hit de cache) $0.003 $0.006
1M de tokens d'entrée (miss de cache) $0.15 $0.3
1M de tokens de sortie $0.6 $1.2

La page indique que « les tarifs des heures creuses correspondent à la moitié des tarifs des heures pleines » et définit les heures pleines comme étant de 01:00 à 04:00 et de 06:00 à 10:00 UTC, du lundi au vendredi. Tout le reste correspond aux heures creuses.

Deux détails opérationnels accompagnent le tableau. Le nom du modèle à utiliser est deepseek-flash. La longueur de contexte est de 1M avec une sortie maximale de 384K, et la limite de requêtes simultanées indiquée est de 2,500.

La même page indique que V4-Pro reste disponible. DeepSeek écrit qu'elle a « décidé de continuer à fournir des services d'API pour DeepSeek V4 Pro après le 14 septembre 2026 ». Il est précisé que le mode de facturation reste inchangé.

Ce que couvrent les benchmarks, et ce qu'ils ne couvrent pas

Les tableaux des modèles d'instruction (instruct) de la fiche technique s'orientent principalement vers le code et le travail d'agent. Terminal-Bench, DeepSWE, NL2Repo-Bench et Codeforces occupent la majorité des lignes. Cela reflète l'objectif ciblé par DeepSeek.

Quatre lignes s'avèrent plus pertinentes si votre livrable final est un document.

Benchmark DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA mesure la capacité à répondre à des questions sur des images de documents. C'est l'indicateur publié le plus proche de la lecture d'une facture numérisée, d'un bail ou d'un rapport PDF. Le modèle de base y obtient un score de 95.6.

Du côté des modèles d'instruction, Chartography avec outils atteint 78.9 et BabyVision avec outils s'établit à 89.6. Tous deux sont des benchmarks d'agents visuels exécutés via un environnement de test externe.

Considérez ces résultats comme de simples indicateurs de tendance. La fiche du modèle précise que toutes les évaluations d'agents utilisent temperature=1.0, top_p=0.95, et que les benchmarks d'agents visuels s'appuient sur une fenêtre de contexte de 512k tokens. Votre propre configuration sera différente.

Ce que cela change pour le travail de transition du document au livrable

Un token d'entrée moins cher redéfinit complètement les flux de travail qui méritent d'être automatisés.

Prenons l'exemple d'un mois de factures fournisseurs au format PDF. Avec l'ancienne logique financière, vous auriez extrait les données une seule fois, enregistré un résumé, puis travaillé à partir de ce résumé. L'extraction était l'étape coûteuse, vous la limitiez donc au maximum.

Le token d'entrée est facturé $0.15 par million en cas de miss de cache. Un hit de cache ne coûte qu'une fraction de centime. À ces tarifs, la relecture de la source n'est plus le facteur de coût déterminant. Vous pouvez poser une seconde question directement sur les pages d'origine plutôt que sur vos propres notes.

C'est un point crucial pour la précision, et pas seulement pour le budget. Un résumé perd le numéro de page. Le document original, lui, le conserve.

Le contexte de 1M produit un effet similaire. Les ordres de travail d'un trimestre, un dossier de bail complet ou un an de journaux de bord peuvent tenir dans une seule fenêtre. Vous n'avez plus à choisir quels documents inclure.

La vision native comble la dernière lacune. Un graphique collé dans une diapositive, la photo d'un relevé de compteur ou un bon de livraison numérisé deviennent des entrées directement exploitables au lieu d'éléments à ressaisir manuellement.

Là où un modèle moins cher cesse d'être utile

DeepSeek V4.1-Flash n'est qu'une brique technologique. Le livrable en est une autre.

Les pages de DeepSeek décrivent une API et un produit de chat. Elles détaillent les tarifs, les limites de contexte, les benchmarks et le nom du modèle. Ce qu'elles ne décrivent pas, c'est un espace de travail capable de conserver vos fichiers, vos analyses antérieures et vos formats de sortie d'une session à l'autre.

Il s'agit là d'une division classique du travail, et non d'une lacune. Une API est conçue pour être un composant.

La conséquence pratique est que le dernier kilomètre reste à votre charge. Il faut toujours que quelqu'un intègre la réponse dans un tableau mis en forme, une diapositive ou un document qu'un collègue pourra ouvrir. Il faut toujours pouvoir pointer un chiffre du doigt et indiquer de quelle page il provient.

Powerdrill Bloom se situe précisément à ce niveau. Sa page d'accueil le décrit comme « l'analyste de données IA qui montre son travail ». Elle ajoute que « chaque chiffre est accompagné de la page, de la ligne et de la figure qui le justifient ». Vous importez vos fichiers, posez vos questions en langage naturel et obtenez votre livrable.

Ces deux couches se complètent plutôt qu'elles ne se concurrencent. Un modèle moins cher, doté d'un contexte plus large et de capacités visuelles, réduit le coût de l'étape de lecture. Un espace de travail décide ensuite de ce qu'il convient de faire des informations lues.

Des alternatives à connaître

Si vous évaluez V4.1-Flash par rapport à d'autres options, trois comparaisons reviennent le plus souvent.

Face à DeepSeek V4-Pro. La note de version indique que « des tests réalisés par plusieurs parties placent V4.1-Flash devant V4-Pro en termes de performances, de coût, de vitesse et de temps d'exécution total ». Elle ajoute que DeepSeek « abandonne progressivement V4-Pro ». La page des tarifs affiche toujours V4-Pro à $0.66 par million de tokens d'entrée en cas de miss de cache en heures creuses, contre $0.15 pour Flash. V4-Pro ne mentionne pas de support de la vision sur cette page.

Face aux modèles propriétaires de pointe. Le tableau comparatif de la fiche du modèle inclut Opus-5.0 et GPT-5.6 Sol. Flash arrive en tête sur plusieurs lignes liées aux agents, notamment Terminal-Bench 2.1 à 90.6 et AutomationBench à 54.8. Il est en retrait sur Terminal-Bench 3.0 et 4.0. Prenez les tableaux fournis par les éditeurs pour ce qu'ils sont.

Face à un espace de travail plutôt qu'à un modèle. Si votre besoin réel est d'obtenir un rapport finalisé à partir de fichiers existants, la comparaison ne doit pas se faire de modèle à modèle. Notre sélection d'alternatives à DeepSeek aborde cette perspective, et notre guide explicatif sur les agents de données IA définit cette catégorie.

Comment accéder à DeepSeek V4.1-Flash

Trois voies d'accès sont documentées sur les pages officielles de DeepSeek.

L'API est la première option. Orientez votre client vers https://api.deepseek.com pour le format compatible OpenAI, ou vers https://api.deepseek.com/anthropic pour le format Anthropic, et configurez le modèle sur deepseek-flash. La page des tarifs indique que la sortie JSON, les appels d'outils (tool calls), l'API Responses et la vision sont pris en charge.

Le produit de chat est la deuxième option, accessible sur chat.deepseek.com, vers lequel la fiche du modèle renvoie directement.

Les poids du modèle constituent la troisième option. Le modèle est publié sur Hugging Face sous licence MIT, accompagné d'un rapport technique. C'est la voie à suivre si vous devez l'héberger au sein de votre propre réseau.

Une remarque concernant cette troisième option : la fiche du modèle précise que « cette version n'inclut pas de modèle de chat au format Jinja », l'encodage des prompts requiert donc une attention particulière si vous optez pour l'auto-hébergement.

FAQ

Qu'est-ce que DeepSeek V4.1-Flash ? Il s'agit d'un modèle Mixture-of-Experts multimodal lancé par DeepSeek le 10 septembre 2026. Sa fiche technique fait état d'une architecture de base de 552 milliards de paramètres, d'un traitement natif des images et du texte, et d'une prise en charge de contextes allant jusqu'à un million de tokens. Il est publié sous licence MIT.

Combien coûte DeepSeek V4.1-Flash ? La page officielle des tarifs indique $0.15 par million de tokens d'entrée en cas de miss de cache au tarif heures creuses, et $0.3 en heures pleines. La sortie est à $0.6 en heures creuses et $1.2 en heures pleines. L'entrée avec hit de cache est à $0.003 en heures creuses.

Est-ce que DeepSeek V4.1-Flash prend en charge les images ? Oui. La fiche du modèle décrit un encodeur de vision entraîné à partir de zéro, les plongements visuels étant traités conjointement avec le texte dès le début du pré-entraînement. La page de tarification indique que la vision est prise en charge pour deepseek-flash.

Qu'est-il advenu de DeepSeek V4-Flash ? La note de version indique que V4-Flash et V4-Flash-Vision-Exp sont retirés. Les anciens noms de modèles sont toujours acceptés et redirigent vers V4.1-Flash, facturé au tarif de Flash.

DeepSeek V4.1-Flash est-il adapté pour créer des rapports et des présentations ? Le modèle gère parfaitement l'étape de lecture, et son score de 95.6 sur DocVQA témoigne d'une excellente compréhension des documents. Transformer ces données en un livrable mis en forme relève d'une autre couche applicative, ce qu'offre précisément un espace de travail IA.

Conclusion

DeepSeek V4.1-Flash est une mise à jour axée sur l'efficacité qui se présente sous les traits d'une mise à jour de capacités. Le travail d'architecture s'est concentré sur le cache KV, et le bénéfice se fait sentir sur les entrées volumineuses.

Pour tous ceux dont les données se présentent sous forme de documents, c'est une avancée majeure. Relire deux fois une centaine de pages relève désormais de l'épaisseur du trait plutôt que d'un arbitrage budgétaire.

Le modèle vous fournit toujours du texte brut. Si votre semaine de travail se termine par la validation d'un tableau, c'est l'étape qui suit le modèle qui vous fait perdre du temps. Essayez Powerdrill Bloom gratuitement et importez les documents que vous vous apprêtiez à résumer à la main.


Sources (au 14/09/2026) : Note de version de DeepSeek-V4.1-Flash · Fiche du modèle DeepSeek-V4.1-Flash · Modèles et tarifs de DeepSeek. Les tarifs et la disponibilité peuvent varier ; veuillez consulter les pages officielles avant d'établir votre budget.