DeepSeek V4.1-Flash: Was ist neu, Preise und Alternativen (2026)

DeepSeek hat V4.1-Flash am 10. September 2026 veröffentlicht. Es ist ein Mixture-of-Experts-Modell mit 552 Milliarden Parametern, das Bilder und Text nativ liest, Kontexte von bis zu einer Million Token verarbeitet und unter einer MIT-Lizenz bereitgestellt wird. Die wichtigste Änderung betrifft die Kosten: Das Modell aktiviert 8 Milliarden Parameter bei der Eingabe und 16 Milliarden bei der Ausgabe.
Dieser letzte Satz fasst die gesamte Geschichte in komprimierter Form zusammen. Dieser Leitfaden schlüsselt sie auf und nennt die veröffentlichten API-Preise. Er erklärt außerdem, was diese Veröffentlichung für Sie ändert – und was nicht –, wenn Ihre Arbeit in einem Bericht, einer Präsentation oder einer Tabelle endet.
Alle unten aufgeführten Fakten stammen aus DeepSeeks eigener Release-Note, der Hugging Face-Modellkarte und der veröffentlichten Preisseite, überprüft am 14. September 2026.
Was ist neu in DeepSeek V4.1-Flash
Die Release-Note von DeepSeek beginnt mit vier Behauptungen. Das Modell sei „intelligenter, schneller, effizienter“. Es sei „das kleinste Modell in unserer neuen Architekturfamilie mit nativem visuellem Verständnis“. Es sei für „höhere Leistungsfähigkeit, schnellere Inferenz, höheren Durchsatz“ konzipiert. Und es lässt sich später auf größere Modelle skalieren.
Die Modellkarte wird konkreter. DeepSeek-V4.1-Flash wird als „ein multimodales Mixture-of-Experts-Modell (MoE) mit 552 Milliarden Backbone-Parametern und Unterstützung für Kontexte von bis zu einer Million Token“ beschrieben. Es „verarbeitet Bilder und Text nativ und generiert Text autoregressiv“.
Drei Änderungen sind für die tägliche Arbeit wichtiger als für Benchmarks.
Sehvermögen ist integriert, nicht bloß aufgesetzt. Ein Vision-Encoder und ein zweischichtiger Projektor verwandeln Bilder in Embeddings. Diese werden „von Beginn des Sprachmodell-Pre-Trainings an gemeinsam mit Text-Embeddings verarbeitet“. Laut Modellkarte wurde der Encoder, DeepSeek-ViT, von Grund auf neu trainiert.
Der Kontext reicht bis zu einer Million Token. Für das Pre-Training wurden 45 Billionen Token verwendet, wobei Sparse Attention bei 64K trainiert und der Kontext später im Verlauf auf 1M erweitert wurde.
Die Denkintensität ist einstellbar. Das Modell „unterstützt eine stufenlos steuerbare Einstellung für den Denkaufwand (Ganzzahl 1–100), die Inferenzkosten gegen Genauigkeit abwägt“. Sie zahlen nur dann mehr, wenn die Fragen es erfordern.
DeepSeek hat auch die vorherige Generation in den Ruhestand geschickt. In der Release-Note heißt es, dass „V4-Flash & V4-Flash-Vision-Exp eingestellt sind“ und dass die alten Modellnamen aus Kompatibilitätsgründen vorübergehend auf V4.1-Flash umgeleitet werden.
Die Architekturänderung hinter dem Preissturz
Das Interessante an der Veröffentlichung von DeepSeek V4.1-Flash ist nicht die Benchmark-Tabelle. Es ist die Speicher-Arithmetik.
DeepSeek-V4.1-Flash nutzt eine Architektur, die auf der Modellkarte als Causal Encoder-Decoder (CED) bezeichnet wird. Es handelt sich um einen 40-schichtigen Transformer, der in einen kausalen 20-Schichten-Encoder und einen 20-Schichten-Decoder unterteilt ist. Der globale KV-Cache des Decoders wird aus den letzten verborgenen Zuständen des Encoders projiziert, anstatt pro Schicht aufgebaut zu werden.
Das praktische Ergebnis ist die überall zitierte Zahl: 8 Milliarden aktive Parameter pro Token während des Prefills, 16 Milliarden während des Decodes. Die Modellkarte beschreibt dies als „erhebliche Verbesserung der Kosteneffizienz bei eingabeintensiven Agenten-Workloads“.
„Eingabeintensiv“ ist hier das entscheidende Stichwort. Lange Dokumente sind eingabeintensiv. Ebenso ein Chat, bei dem Sie vierzig Seiten anhängen und dann sechs Fragen dazu stellen.
Zwei weitere Techniken verkleinern den Cache selbst. Compressed Sparse Attention 2 weist jeder Attention-Schicht einen von drei Modi zu und teilt Indizes über Schichten hinweg. FP4-Haupt-KV-Caching speichert den Cache in einem Vier-Bit-Format. Zusammen beziffert die Modellkarte den globalen KV-Cache auf 890 Byte pro Token, was etwa einem Viertel der vorherigen Generation entspricht.
Die Release-Note übersetzt dies in die Metrik, die ein Käufer tatsächlich spürt. Im Vergleich zur vorherigen Generation benötigt der Cache „1/4 des HBM“ und „1/8 des SSD-Speichers“. Sie fügt hinzu, dass „Gebühren für Cache-Treffer oft einen großen Teil der Agenten-Kosten ausmachen“.
DeepSeek V4.1-Flash Preise
DeepSeek veröffentlicht Preise pro Million Token und unterteilt diese in Haupt- und Nebenzeiten. Die folgenden Werte stammen von der offiziellen Seite „Models & Pricing“ vom 14. September 2026 in US-Dollar.
| Metrik | Nebenzeit | Hauptzeit |
|---|---|---|
| 1M Eingabe-Token (Cache-Treffer) | $0.003 | $0.006 |
| 1M Eingabe-Token (Cache-Fehlschlag) | $0.15 | $0.3 |
| 1M Ausgabe-Token | $0.6 | $1.2 |
Auf der Seite wird angegeben, dass die „Tarife für Nebenzeiten die Hälfte der Tarife für Hauptzeiten betragen“, und die Hauptzeiten werden als Montag bis Freitag von 01:00–04:00 Uhr und 06:00–10:00 Uhr UTC definiert. Alles andere gilt als Nebenzeit.
Neben der Tabelle finden sich zwei betriebliche Details. Der zu verwendende Modellname lautet deepseek-flash. Die Kontextlänge beträgt 1M mit einer maximalen Ausgabe von 384K, und das angegebene Limit für gleichzeitige Anfragen liegt bei 2.500.
Auf derselben Seite wird darauf hingewiesen, dass V4-Pro weiterhin verfügbar bleibt. DeepSeek schreibt, man habe „beschlossen, die API-Dienste für DeepSeek V4 Pro auch nach dem 14. September 2026 weiterhin anzubieten“. Die Abrechnungsmethode bleibe unverändert.
Was die Benchmarks abdecken und was nicht
Die Tabellen für das Instruct-Modell auf der Modellkarte tendieren stark zu Code- und Agenten-Aufgaben. Terminal-Bench, DeepSWE, NL2Repo-Bench und Codeforces nehmen die meisten Zeilen ein. Das spiegelt die Zielrichtung von DeepSeek wider.
Vier Zeilen sind relevanter, wenn Ihr Ergebnis ein Dokument ist.
| Benchmark | DeepSeek-V4.1-Flash-Base |
|---|---|
| DocVQA (LLM-Judge) | 95.6 |
| CVBench (EM) | 77.9 |
| RefCOCO-avg (Acc@0.5) | 86.0 |
| MMMU-Pro (EM) | 56.5 |
DocVQA misst die Beantwortung von Fragen zu Dokumentenbildern. Das ist der engste veröffentlichte Näherungswert für das Lesen einer gescannten Rechnung, eines Mietvertrags oder eines PDF-Berichts. Das Basismodell erreicht dort einen Wert von 95.6.
Auf der Instruct-Seite liegt Chartography mit Tools bei 78.9 und BabyVision mit Tools bei 89.6. Beides sind Benchmarks für visuelle Agenten, die über eine externe Testumgebung ausgeführt werden.
Betrachten Sie diese Werte als Richtwerte. Auf der Modellkarte wird angegeben, dass alle agentenbasierten Evaluierungen temperature=1.0, top_p=0.95 verwenden und dass Benchmarks für visuelle Agenten ein Kontextfenster von 512k Token nutzen. Ihr Setup wird sich davon unterscheiden.
Was sich dadurch für die Arbeit vom Dokument zum fertigen Ergebnis ändert
Ein günstigeres Eingabe-Token ändert grundlegend, welche Workflows es überhaupt wert sind, automatisiert zu werden.
Stellen Sie sich die Lieferantenrechnungen eines Monats als PDFs vor. Nach der alten Logik hätten Sie die Daten einmal extrahiert, eine Zusammenfassung gespeichert und mit dieser Zusammenfassung gearbeitet. Die Extraktion war der teure Schritt, also hat man sie so selten wie möglich durchgeführt.
Bei einem Cache-Fehlschlag kostet die Eingabe $0.15 pro Million Token. Ein Cache-Treffer kostet nur den Bruchteil eines Cents. Bei diesen Tarifen ist das erneute Lesen der Quelle kein Kostenfaktor mehr. Sie können eine zweite Frage direkt an die Originalseiten stellen, anstatt auf Ihre eigenen Notizen zurückzugreifen.
Das ist nicht nur für das Budget wichtig, sondern auch für die Genauigkeit. Eine Zusammenfassung verliert die Seitenzahl. Das Original nicht.
Der 1M-Kontext hat einen ähnlichen Effekt. Die Arbeitsaufträge eines Quartals, eine vollständige Mietakte oder die Schichtprotokolle eines ganzen Jahres können in einem einzigen Fenster liegen. Sie müssen nicht mehr auswählen, welche zehn Dokumente Sie einbeziehen.
Natives Sehvermögen schließt die letzte Lücke. Ein in eine Folie eingefügtes Diagramm, ein fotografierter Zählerstand und ein gescannter Lieferschein werden zu lesbaren Eingaben, anstatt mühsam abgetippt werden zu müssen.
Wo ein günstigeres Modell an seine Grenzen stößt
DeepSeek V4.1-Flash ist eine Ebene. Das fertige Ergebnis ist eine andere.
Die Seiten von DeepSeek beschreiben eine API und ein Chat-Produkt. Sie listen Preise, Kontextgrenzen, Benchmarks und einen Modellnamen auf. Was sie nicht beschreiben, ist ein Arbeitsbereich, der Ihre Dateien, Ihre vorherigen Analysen und Ihre Ausgabeformate zwischen den Sitzungen zusammenhält.
Das ist die ganz normale Arbeitsteilung, kein Mangel. Eine API ist als Komponente gedacht.
Die praktische Konsequenz ist, dass die letzte Meile bei Ihnen verbleibt. Jemand muss die Antwort immer noch in eine formatierte Tabelle, eine Folie oder ein Dokument bringen, das ein Kollege öffnen kann. Jemand muss immer noch in der Lage sein, auf eine Zahl zu zeigen und zu sagen, von welcher Seite sie stammt.
Powerdrill Bloom setzt genau auf dieser Ebene an. Seine Homepage beschreibt es als „den KI-Datenanalysten, der seine Arbeit offenlegt“. Sie fügt hinzu, dass „jede Zahl mit der Seite, der Zeile und der Abbildung dahinter zurückgegeben wird“. Sie laden die Dateien hoch, fragen in natürlicher Sprache und erhalten das fertige Artefakt.
Die beiden Ebenen ergänzen sich, anstatt zu konkurrieren. Ein günstigeres Modell mit größerem Kontext und Sehvermögen macht den Schritt des Lesens billiger. Ein Arbeitsbereich entscheidet, was mit dem Gelesenen geschieht.
Wissenswerte Alternativen
Wenn Sie V4.1-Flash mit anderen Optionen vergleichen, tauchen drei Vergleiche am häufigsten auf.
Gegenüber DeepSeek V4-Pro. In der Release-Note heißt es, dass „Tests von mehreren Parteien V4.1-Flash in Bezug auf Leistung, Kosten, Geschwindigkeit & Gesamtlaufzeit vor V4-Pro sehen“. Sie fügt hinzu, dass DeepSeek „V4-Pro schrittweise einstellt“. Auf der Preisseite wird V4-Pro bei einem Cache-Fehlschlag in der Nebenzeit immer noch mit $0.66 pro Million Eingabe-Token aufgeführt, verglichen mit $0.15 für Flash. V4-Pro listet auf dieser Seite keine Unterstützung für Vision auf.
Gegenüber geschlossenen Frontier-Modellen. Die Vergleichstabelle der Modellkarte enthält Opus-5.0 und GPT-5.6 Sol. Flash führt in mehreren agentenbasierten Zeilen, darunter Terminal-Bench 2.1 mit 90.6 und AutomationBench mit 54.8. Bei Terminal-Bench 3.0 und 4.0 liegt es dahinter. Betrachten Sie vom Anbieter erstellte Tabellen stets mit der nötigen Skepsis.
Gegenüber einem Arbeitsbereich statt eines Modells. Wenn das, was Sie tatsächlich benötigen, ein fertiger Bericht aus bereits vorhandenen Dateien ist, lautet der Vergleich nicht Modell-zu-Modell. Unsere Übersicht über DeepSeek-Alternativen deckt diesen Rahmen ab, und der Erklärungsbeitrag zum KI-Datenagenten definiert diese Kategorie.
So greifen Sie auf DeepSeek V4.1-Flash zu
Auf den eigenen Seiten von DeepSeek sind drei Wege dokumentiert.
Der erste Weg ist die API. Richten Sie Ihren Client auf https://api.deepseek.com für das OpenAI-kompatible Format oder auf https://api.deepseek.com/anthropic für das Anthropic-Format aus und stellen Sie das Modell auf deepseek-flash ein. Auf der Preisseite werden JSON-Ausgabe, Tool-Aufrufe, die Responses-API und Vision als unterstützt aufgeführt.
Der zweite Weg ist das Chat-Produkt unter chat.deepseek.com, das direkt auf der Modellkarte verlinkt ist.
Der dritte Weg sind die Gewichte. Das Modell ist auf Hugging Face unter einer MIT-Lizenz veröffentlicht, zusammen mit einem technischen Bericht. Das ist der richtige Weg, wenn Sie es in Ihrem eigenen Netzwerk benötigen.
Ein Hinweis für den dritten Weg. Auf der Modellkarte wird angegeben, dass „dieses Release kein Chat-Template im Jinja-Format enthält“, sodass die Prompt-Codierung beachtet werden muss, wenn Sie das Modell selbst hosten.
FAQs
Was ist DeepSeek V4.1-Flash? Es ist ein multimodales Mixture-of-Experts-Modell, das am 10. September 2026 von DeepSeek veröffentlicht wurde. Die Modellkarte listet 552 Milliarden Backbone-Parameter, native Bild- und Textverarbeitung sowie die Unterstützung von Kontexten bis zu einer Million Token auf. Es ist unter einer MIT-Lizenz veröffentlicht.
Wie viel kostet DeepSeek V4.1-Flash? Auf der offiziellen Preisseite werden $0.15 pro Million Eingabe-Token bei einem Cache-Fehlschlag zu Nebenzeiten-Tarifen und $0.3 zu Hauptzeiten-Tarifen aufgeführt. Die Ausgabe kostet $0.6 in der Nebenzeit und $1.2 in der Hauptzeit. Die Eingabe bei einem Cache-Treffer liegt bei $0.003 in der Nebenzeit.
Unterstützt DeepSeek V4.1-Flash Bilder? Ja. Die Modellkarte beschreibt einen von Grund auf neu trainierten Vision-Encoder, bei dem visuelle Embeddings von Beginn des Pre-Trainings an gemeinsam mit Text verarbeitet werden. Die Preisseite kennzeichnet Vision als unterstützt für deepseek-flash.
Was ist mit DeepSeek V4-Flash passiert? In der Release-Note wird angegeben, dass V4-Flash und V4-Flash-Vision-Exp eingestellt wurden. Die alten Modellnamen werden weiterhin akzeptiert und auf V4.1-Flash umgeleitet, abgerechnet zum Flash-Preis.
Eignet sich DeepSeek V4.1-Flash für die Erstellung von Berichten und Folien? Das Modell übernimmt den Schritt des Lesens, und DocVQA mit 95.6 deutet auf ein starkes Dokumentenverständnis hin. Dies in ein formatiertes Endergebnis zu verwandeln, ist eine separate Ebene, die ein KI-Arbeitsbereich bietet.
Fazit
DeepSeek V4.1-Flash ist ein Effizienz-Release im Gewand eines Funktions-Releases. Die Entwicklungsarbeit an der Architektur floss in den KV-Cache, und der Nutzen zeigt sich vor allem bei langen Eingaben.
Für jeden, dessen Daten in Form von Dokumenten vorliegen, ist das die entscheidende Richtung. Hundert Seiten zweimal zu lesen, ist jetzt ein Rundungsfehler und keine bewusste Entscheidung mehr.
Das Modell liefert Ihnen immer noch Text. Wenn Ihre Woche mit einer Tabelle endet, die jemand abzeichnen muss, ist der Schritt nach dem Modell derjenige, der Sie Zeit kostet. Testen Sie Powerdrill Bloom kostenlos und laden Sie die Dokumente hoch, die Sie sonst von Hand zusammengefasst hätten.
Quellen (Stand: 14.09.2026): DeepSeek-V4.1-Flash Release-Note · DeepSeek-V4.1-Flash Modellkarte · DeepSeek Modelle & Preise. Preise und Verfügbarkeit können sich ändern; prüfen Sie die offiziellen Seiten vor der Budgetplanung.