スーパーセールウィークClaude Skills — 20% OFF
News

DeepSeek V4.1-Flash: 新機能、価格、および代替ツール (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: 新機能、価格、および代替ツール (2026)

DeepSeekは2026年9月10日にV4.1-Flashをリリースしました。これは、画像とテキストをネイティブに読み込み、最大100万トークンのコンテキストを処理し、MITライセンスの下で提供される、552BパラメータのMixture-of-Expertsモデルです。最大の変更点はコストです。このモデルは入力時に8Bパラメータ、出力時に16Bパラメータをアクティブにします。

この最後の一文に、すべてのストーリーが凝縮されています。本ガイドでは、その詳細を紐解き、公開されているAPI価格を紹介します。また、あなたの業務の成果物がレポート、スライド資料、または表である場合に、このリリースによって何が変わり、何が変わらないのかを説明します。

以下のすべての事実は、2026年9月14日に確認された、DeepSeek自身のリリースノート、Hugging Faceのモデルカード、および公開されている価格設定ページに基づいています。

DeepSeek V4.1-Flashの新機能

DeepSeekのリリースノートは、4つの主張から始まっています。このモデルは「よりスマートで、より速く、より効率的」です。「ネイティブな視覚理解を備えた、当社の新しいアーキテクチャファミリーの中で最小のモデル」です。「より優れた能力、より高速な推論、より高いスループット」を目指して設計されています。そして、将来的にはより大規模なモデルへとスケールアップします。

モデルカードでは、さらに具体的な仕様が示されています。DeepSeek-V4.1-Flashは、「552Bのバックボーンパラメータを持ち、最大100万トークンのコンテキストをサポートするマルチモーダルなMixture-of-Experts(MoE)モデル」と説明されています。また、「画像とテキストをネイティブに処理し、自己回帰的にテキストを生成」します。

ベンチマークの数値よりも、日々の実務において重要となる3つの変更点があります。

ビジョン機能は後付けではなく、組み込み式です。 ビジョンエンコーダーと2レイヤーのプロジェクターが画像を埋め込み(embeddings)に変換します。これらは「言語モデルの事前学習の開始時から、テキストの埋め込みと共同で処理」されます。モデルカードによると、エンコーダーであるDeepSeek-ViTはスクラッチから学習されています。

コンテキストは100万トークンに達します。 事前学習には45Tトークンが使用され、64Kでスパースアテンションが学習された後、プロセスの後半でコンテキストが1Mに拡張されました。

推論の取り組み度合い(Reasoning effort)をダイヤルのように調整できます。 このモデルは「推論コストと精度をトレードオフにする、連続的に制御可能な推論取り組み設定(整数1〜100)をサポート」しています。本当に必要な質問に対してのみ、より多くのコストをかけることができます。

DeepSeekは前世代のモデルも廃止しました。リリースノートには「V4-FlashおよびV4-Flash-Vision-Expは廃止されました」と記載されており、互換性のために古いモデル名は一時的にV4.1-Flashにルーティングされます。

コスト削減の背景にあるアーキテクチャの変更

DeepSeek V4.1-Flashのリリースで興味深いのは、ベンチマークの表ではありません。メモリの計算式です。

DeepSeek-V4.1-Flashは、モデルカードでCausal Encoder-Decoder (CED)と呼ばれるアーキテクチャを使用しています。これは、20レイヤーの因果関係エンコーダーと20レイヤーのデコーダーに分割された40レイヤーのTransformerです。デコーダーのグローバルKVキャッシュは、レイヤーごとに構築されるのではなく、エンコーダーの最終隠れ状態から投影されます。

その実用的な結果が、いたるところで引用されている数値です。すなわち、プリフィル(prefill)時にはトークンあたり8Bパラメータ、デコード(decode)時には16Bパラメータがアクティブになります。モデルカードでは、これを「入力負荷の高いエージェント型ワークロードのコスト効率を大幅に向上させる」と説明しています。

注目すべきは「入力負荷が高い(input-heavy)」という言葉です。長い文書は入力負荷が高くなります。40ページもの資料を添付した後に、それについて6つの質問をするようなチャットも同様です。

さらに2つの技術がキャッシュ自体を縮小します。Compressed Sparse Attention 2は、各アテンションレイヤーに3つのモードのいずれかを割り当て、レイヤー間でインデックスを共有します。FP4メインKVキャッシュは、キャッシュを4ビット形式で保存します。これらを合わせることで、モデルカードによるとグローバルKVキャッシュはトークンあたり890バイトとなり、前世代の約1/4に抑えられています。

リリースノートは、これを購入者が実際に実感できる指標に換算しています。前世代と比較して、キャッシュに必要な「HBMは1/4」、「SSDストレージは1/8」になります。さらに、「キャッシュヒット料金は、エージェントコストの大部分を占めることが多い」と付け加えています。

DeepSeek V4.1-Flashの価格設定

DeepSeekは100万トークンあたりの価格を公開しており、ピーク時間帯とオフピーク時間帯に分けています。以下の値は、2026年9月14日時点の公式のModels & Pricingページから引用した米ドル建ての価格です。

課金項目 オフピーク ピーク
100万入力トークン(キャッシュヒット) $0.003 $0.006
100万入力トークン(キャッシュミス) $0.15 $0.3
100万出力トークン $0.6 $1.2

同ページには「オフピーク料金はピーク料金の半分」と記載されており、ピーク時間は月曜日から金曜日の01:00〜04:00および06:00〜10:00 UTCと定義されています。それ以外の時間帯はすべてオフピークとなります。

表と並んで、2つの運用上の詳細が記載されています。使用するモデル名はdeepseek-flashです。コンテキスト長は1Mで、最大出力は384K、記載されている同時実行数の制限は2,500です。

同じページには、V4-Proが引き続き利用可能であることも記載されています。DeepSeekは「2026年9月14日以降もDeepSeek V4 ProのAPIサービスの提供を継続することを決定した」と記しています。請求方法についても変更はないとのことです。

ベンチマークがカバーしていること、カバーしていないこと

モデルカードの指示(instruct)モデルの表は、コードやエージェントのタスクに偏っています。Terminal-Bench、DeepSWE、NL2Repo-Bench、Codeforcesがほとんどの行を占めています。これは、DeepSeekが目指している方向性を反映しています。

あなたの成果物がドキュメントである場合、以下の4つの行がより関連性の高いものになります。

ベンチマーク DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQAは、ドキュメント画像に対する質問応答を測定します。これは、スキャンされた請求書、賃貸借契約書、またはPDFレポートの読み取りに最も近い、公開されている代理指標(プロキシ)です。ベースモデルはここで95.6を記録しています。

指示(instruct)モデル側では、ツールを使用したChartographyが78.9、ツールを使用したBabyVisionが89.6となっています。これらはどちらも、外部ハーネスを介して実行されるビジュアルエージェントのベンチマークです。

これらはあくまで方向性を示すものとして捉えてください。モデルカードには、すべてのエージェント評価でtemperature=1.0, top_p=0.95が使用され、ビジュアルエージェントのベンチマークでは512kトークンのコンテキストウィンドウが使用されていると記載されています。実際の皆様の環境とは異なる場合があります。

ドキュメントから成果物を作成する業務において、これがもたらす変化

入力トークンの低価格化は、そもそもどのワークフローを自動化する価値があるかという前提を変えてしまいます。

1ヶ月分の仕入先からの請求書PDFを例に考えてみましょう。従来の計算方法では、一度だけデータを抽出し、その要約を保存して、その要約を基に作業を行っていました。抽出はコストのかかるステップだったため、できるだけ頻度を低く抑えていたのです。

キャッシュミス時の入力価格は100万トークンあたり$0.15です。キャッシュヒット時のコストは1セントの何分の一かです。この料金体系であれば、ソースを再読することがコストの主な要因にはならなくなります。自分で作成したメモではなく、元のページに対して2つ目の質問を直接投げかけることができるのです。

これは予算だけでなく、精度にとっても重要です。要約ではページ番号が失われてしまいますが、オリジナルでは失われません。

1Mのコンテキストも同様の効果をもたらします。四半期分の作業指示書、賃貸借契約ファイルのすべて、あるいは1年分のシフトログを1つのウィンドウに収めることができます。もはや、どの10個のドキュメントを含めるかを選択する必要はありません。

ネイティブなビジョン機能が、最後のギャップを埋めます。スライドに貼り付けられたグラフ、写真に撮られたメーターの数値、スキャンされた納品書はすべて、手入力で打ち直す必要のあるものではなく、そのまま読み取り可能な入力データになります。

安価なモデルだけでは解決できない限界

DeepSeek V4.1-Flashは1つのレイヤーに過ぎません。成果物はまた別のレイヤーです。

DeepSeekのページでは、APIとチャット製品について説明されています。価格、コンテキスト制限、ベンチマーク、モデル名が提示されています。しかし、セッション間でファイル、過去の分析、出力フォーマットをまとめて保持できるワークスペースについては説明されていません。

これは通常の役割分担であり、欠点ではありません。APIはコンポーネント(部品)として機能するように設計されているからです。

実務上の結果として、ラストワンマイルは依然としてあなたの手元に残ります。誰かが回答をフォーマットされた表、スライド、または同僚が開くことのできるドキュメントに落とし込まなければなりません。また、誰かが数値を指し示して、それがどのページから来たのかを説明できなければなりません。

Powerdrill Bloomはそのレイヤーに位置しています。そのホームページでは、「作業プロセスを示すAIデータアナリスト」と説明されています。さらに、「すべての数値は、その背景にあるページ、行、図とともに返される」と付け加えられています。ファイルをアップロードし、自然言語で質問するだけで、成果物が得られます。

この2つのレイヤーは競合するのではなく、相互に補完し合います。より安価で、より長いコンテキストを持ち、ビジョン機能を備えたモデルは、読み取りステップを低コスト化します。そして、読み取った内容をどう処理するかは、ワークスペースが決定します。

知っておくべき代替選択肢

V4.1-Flashを他の選択肢と比較検討する場合、最も頻繁に挙げられるのが以下の3つの比較です。

DeepSeek V4-Proとの比較。 リリースノートによると、「複数の中立的な立場によるテストにおいて、V4.1-Flashはパフォーマンス、コスト、速度、および総実行時間の面でV4-Proを上回っている」とのことです。また、DeepSeekは「V4-Proを段階的に廃止している」とも付け加えています。価格設定ページでは、オフピーク時のキャッシュミスにおける100万入力トークンあたりの価格が、Flashの$0.15に対して、V4-Proは依然として$0.66と記載されています。また、同ページにおいてV4-Proにはビジョンサポートの記載がありません。

クローズドな最先端モデルとの比較。 モデルカードの比較表には、Opus-5.0やGPT-5.6 Solが含まれています。Flashは、Terminal-Bench 2.1で90.6、AutomationBenchで54.8を記録するなど、いくつかのエージェント向け項目でリードしています。一方で、Terminal-Bench 3.0および4.0では後塵を拝しています。ベンダーが作成した比較表は、あくまでベンダー目線のものとして捉えてください。

モデルではなく、ワークスペースとの比較。 実際に必要なのが、手元にあるファイルから完成されたレポートを作成することである場合、比較すべきはモデル同士ではありません。当社のDeepSeek代替案まとめではその枠組みをカバーしており、AIデータエージェントの解説記事ではそのカテゴリを定義しています。

DeepSeek V4.1-Flashへのアクセス方法

DeepSeek自身のページでは、3つのルートが説明されています。

1つ目はAPIです。OpenAI互換フォーマットの場合はhttps://api.deepseek.comを、Anthropicフォーマットの場合はhttps://api.deepseek.com/anthropicをクライアントの接続先に指定し、モデルをdeepseek-flashに設定します。価格設定ページでは、JSON出力、ツール呼び出し、Responses API、およびビジョン機能がサポート対象として記載されています。

2つ目はチャット製品で、モデルカードから直接リンクされているchat.deepseek.comで利用できます。

3つ目はモデルの重み(ウェイト)です。モデルはMITライセンスの下でHugging Faceに公開されており、テクニカルレポートも併せて提供されています。自社ネットワーク内でモデルを動かす必要がある場合は、このルートを選択します。

3つ目のルートに関する注意点として、モデルカードには「このリリースにはJinja形式のチャットテンプレートは含まれていません」と記載されているため、セルフホストする場合はプロンプトのエンコーディングに注意が必要です。

FAQs

DeepSeek V4.1-Flashとは何ですか? 2026年9月10日にDeepSeekによってリリースされたマルチモーダルなMixture-of-Expertsモデルです。モデルカードには、552Bのバックボーンパラメータ、ネイティブな画像およびテキスト処理、最大100万トークンのコンテキストのサポートが記載されています。MITライセンスの下で公開されています。

DeepSeek V4.1-Flashの料金はいくらですか? 公式の価格設定ページによると、オフピーク料金におけるキャッシュミス時の100万入力トークンあたりの価格は$0.15、ピーク時は$0.3です。出力はオフピーク時が$0.6、ピーク時が$1.2です。キャッシュヒット時の入力はオフピーク時で$0.003です。

DeepSeek V4.1-Flashは画像をサポートしていますか? はい。モデルカードには、スクラッチから学習されたビジョンエンコーダーについて説明されており、事前学習の開始時から視覚的な埋め込みがテキストと共同で処理されます。価格設定ページでは、deepseek-flashでビジョン機能がサポートされていると明記されています。

DeepSeek V4-Flashはどうなりましたか? リリースノートによると、V4-FlashおよびV4-Flash-Vision-Expは廃止されました。従来のモデル名も引き続き受け付けられ、V4.1-Flashにルーティングされ、Flashの価格で請求されます。

DeepSeek V4.1-Flashはレポートやスライドの作成に適していますか? このモデルは読み取りステップを処理し、DocVQAで95.6を記録していることから、強力なドキュメント理解力を備えていることが伺えます。しかし、それをフォーマットされた成果物に変換することは別のレイヤーのタスクであり、それこそがAIワークスペースが提供する機能です。

結論

DeepSeek V4.1-Flashは、機能向上リリースを装った効率化リリースです。アーキテクチャの改良はKVキャッシュに注ぎ込まれ、その恩恵は長い入力において発揮されます。

データがドキュメントとして届くすべての人にとって、これは非常に有益な方向性です。100ページを2回読み直すことは、もはや熟考すべき決断ではなく、単なる端数処理(誤差)のようなものになります。

モデルが提供するのは、依然としてテキストデータです。もしあなたの1週間の業務の締めくくりが、誰かの承認を得るための表の作成であるなら、モデルの処理の後のステップこそが最も時間を要する部分です。Powerdrill Bloomを無料でお試しいただき、手作業で要約しようとしていたドキュメントをアップロードしてみてください。


情報源(2026年9月14日現在): DeepSeek-V4.1-Flash リリースノート · DeepSeek-V4.1-Flash モデルカード · DeepSeek モデルと価格設定。価格や提供状況は変更される可能性があるため、予算を立てる前に公式ページをご確認ください。