超級促銷週Claude Skills — 20% 折扣
News

DeepSeek V4.1-Flash:最新功能、定價與替代方案 (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash:最新功能、定價與替代方案 (2026)

DeepSeek 於 2026 年 9 月 10 日發布了 V4.1-Flash。這是一款擁有 552B 參數的混合專家(Mixture-of-Experts)模型,能原生讀取圖像與文字,處理高達 100 萬個 token 的上下文,並以 MIT 授權條款發布。最受矚目的變革在於成本:該模型在輸入時僅啟用 8B 參數,在輸出時啟用 16B 參數。

最後這句話正是整個故事的縮影。本指南將為您深入剖析,並提供已公布的 API 價格。同時,我們也將解釋如果您的工作成果最終需要呈現為報告、簡報或表格,這次發布會帶來哪些改變與不變。

以下所有事實均源自 DeepSeek 官方發布說明、其 Hugging Face 模型卡以及已公布的定價頁面,資料核對時間為 2026 年 9 月 14 日。

DeepSeek V4.1-Flash 有哪些新功能

DeepSeek 的發布說明以四大聲明開篇。該模型「更智慧、更快速、更高效」。它是「我們新架構家族中最小的模型,具備原生視覺理解能力」。它的設計旨在實現「更強大的能力、更快的推理速度、更高的吞吐量」,並為日後擴展至更大模型奠定基礎。

模型卡則給出了更具體的描述。DeepSeek-V4.1-Flash 被定義為「一款多模態混合專家(MoE)模型,擁有 552B 骨幹參數,並支援高達 100 萬個 token 的上下文」。它「能原生處理圖像與文字,並以自迴歸方式生成文字」。

相較於基準測試,有三項改變對日常工作更為重要。

視覺功能是內建的,而非外掛的。 視覺編碼器和雙層投影器將圖像轉換為嵌入向量。這些向量「從語言模型預訓練之初,就與文字嵌入向量一同進行聯合處理」。模型卡指出,其編碼器 DeepSeek-ViT 是從頭開始訓練的。

上下文長度達到 100 萬個 token。 預訓練使用了 45T token,其中稀疏注意力機制在 64K 下進行訓練,並在隨後的運行中將上下文擴展至 1M。

推理強度可自由調節。 該模型「支援連續可控的推理強度設定(整數 1–100),可在推理成本與準確度之間進行權衡」。您只需在需要解答的難題上花費更多成本。

DeepSeek 同時也淘汰了上一代模型。發布說明指出「V4-Flash & V4-Flash-Vision-Exp 已退役」,舊的模型名稱將暫時指向 V4.1-Flash 以確保相容性。

成本降低背後的架構變革

DeepSeek V4.1-Flash 發布最有趣的部分並非基準測試表,而是其記憶運算。

DeepSeek-V4.1-Flash 採用了模型卡中所稱的 Causal Encoder-Decoder (CED) 架構。這是一個 40 層的 Transformer,分為 20 層的因果編碼器與 20 層的解碼器。解碼器的全域 KV 快取是從編碼器的最終隱藏狀態投影而來,而非逐層建構。

實際的結果就是到處被引用的數據:在 prefill 階段每個 token 僅啟用 8B 參數,在 decode 階段啟用 16B 參數。模型卡將此描述為「顯著提升了輸入密集型 Agent 工作負載的成本效益」。

輸入密集型是值得注意的關鍵詞。長文件屬於輸入密集型,附加了 40 頁內容卻只問 6 個問題的對話也是如此。

另外兩項技術縮減了快取本身。Compressed Sparse Attention 2 為每個注意力層分配三種模式之一,並跨層共享索引。FP4 主 KV 快取則以 4 位元格式儲存快取。結合這些技術,模型卡指出其全域 KV 快取僅為 每個 token 890 位元組,大約是上一代的四分之一。

發布說明將其轉化為買家能切身感受到的指標。與上一代相比,該快取僅需「1/4 的 HBM」和「1/8 的 SSD 儲存空間」。並補充說明「快取命中費用通常在 Agent 成本中佔很大比例」。

DeepSeek V4.1-Flash 定價

DeepSeek 公布了每百萬 token 的價格,並區分為尖峰與離峰時段。以下數值源自 2026 年 9 月 14 日的官方「模型與定價」頁面,單位為美元。

計費項目 離峰 尖峰
1M 輸入 token(快取命中) $0.003 $0.006
1M 輸入 token(快取未命中) $0.15 $0.3
1M 輸出 token $0.6 $1.2

該頁面指出「離峰費率為尖峰費率的一半」,並將尖峰時段定義為週一至週五的 01:00–04:00 和 06:00–10:00 UTC。其餘時間皆為離峰時段。

表格旁附帶了兩項營運細節。要使用的模型名稱為 deepseek-flash。上下文長度為 1M,最大輸出為 384K,列出的並行限制為 2,500。

同一頁面也指出 V4-Pro 仍可使用。DeepSeek 寫道,已「決定在 2026 年 9 月 14 日之後繼續為 DeepSeek V4 Pro 提供 API 服務」。計費方式則保持不變。

基準測試涵蓋了什麼,又遺漏了什麼

模型卡的指令模型表格偏向程式碼與 Agent 工作。Terminal-Bench、DeepSWE、NL2Repo-Bench 和 Codeforces 佔據了大部分行數。這反映了 DeepSeek 的目標定位。

如果您的輸出成果是文件,以下四行數據會更具參考價值。

基準測試 DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA 衡量的是對文件圖像的問答能力。這是目前已公布的指標中,最接近閱讀掃描發票、租約或 PDF 報告的代理指標。基礎模型在此項目的得分為 95.6。

在指令方面,結合工具的 Chartography 得分為 78.9,結合工具的 BabyVision 則為 89.6。兩者都是透過外部測試框架運行的視覺 Agent 基準測試。

請將這些數據視為方向性的參考。模型卡指出,所有 Agent 評估均使用 temperature=1.0, top_p=0.95,且視覺 Agent 基準測試使用的是 512k token 的上下文視窗。您的實際配置可能有所不同。

這對「從文件到成果物」的工作帶來什麼改變

更便宜的輸入 token 徹底改變了哪些工作流程值得被自動化。

考慮以一個月份的 PDF 格式供應商發票為例。在舊的運算邏輯下,您會擷取一次資料、儲存摘要,然後根據摘要進行工作。因為擷取是昂貴的步驟,所以您會儘可能減少執行次數。

在快取未命中的情況下,輸入價格為每百萬 token 0.15 美元。而快取命中時,成本僅需幾分之幾美分。在這樣的費率下,重新讀取原始資料不再是成本的主要來源。您可以直接針對原始頁面提出第二個問題,而不用依賴自己的筆記。

這不僅關乎預算,更關乎準確度。摘要可能會遺失頁碼,但原始文件不會。

1M 的上下文長度也帶來了類似的效果。一整季的工單、完整的租約檔案或一整年的輪班日誌都可以放在同一個視窗中。您不再需要糾結要挑選哪 10 份文件放入。

原生視覺功能填補了最後的鴻溝。貼在投影片中的圖表、拍攝的儀表讀數以及掃描的出貨單,全都變成了可直接讀取的輸入資料,而不再需要手動重新輸入。

便宜模型無法再提供幫助的瓶頸

DeepSeek V4.1-Flash 只是其中一個層級,最終的成果物則是另一個層級。

DeepSeek 的頁面介紹了 API 和對話產品。它們列出了價格、上下文限制、基準測試和模型名稱。但它們沒有提供一個能在不同工作階段之間,將您的檔案、先前的分析以及輸出格式整合在一起的工作空間。

這是正常的專業分工,而非缺點。API 本就定位為一個組件。

實際的結果是,最後一哩路仍需由您完成。仍需要有人將答案整理成格式化的表格、投影片或同事可以開啟的文件。也仍需要有人能指著某個數據,說出它是來自哪一頁。

Powerdrill Bloom 正是處於該層級。其首頁將其描述為「會展示其工作過程的 AI 資料分析師」。並補充說明「每個數字都會附帶其背後的頁碼、資料列和圖表」。您上傳檔案,用自然語言提問,即可獲得產出的成果物。

這兩個層級是相輔相成而非競爭關係。一個更便宜、上下文更長、具備視覺功能的模型降低了讀取步驟的成本。而工作空間則決定了如何處理讀取到的內容。

值得了解的其他選擇

如果您正在評估 V4.1-Flash 與其他方案,最常出現以下三種比較。

與 DeepSeek V4-Pro 對比。 發布說明指出「多方測試顯示,V4.1-Flash 在效能、成本、速度和總運行時間上均領先於 V4-Pro」。並補充說明 DeepSeek 正在「逐步淘汰 V4-Pro」。定價頁面目前仍將 V4-Pro 的離峰快取未命中價格列為每百萬輸入 token 0.66 美元,而 Flash 僅為 0.15 美元。此外,V4-Pro 在該頁面上並未列出視覺支援。

與封閉式前沿模型對比。 模型卡的比較表包含了 Opus-5.0 和 GPT-5.6 Sol。Flash 在多個 Agent 相關項目中領先,包括 Terminal-Bench 2.1 得分 90.6 和 AutomationBench 得分 54.8。但在 Terminal-Bench 3.0 和 4.0 中落後。請理性看待廠商自行公布的對比表格。

與工作空間而非模型對比。 如果您實際需要的是根據現有檔案產出完整的報告,那麼這就不是模型與模型之間的比較。我們的 DeepSeek 替代方案總覽涵蓋了這一框架,而 AI 資料 Agent 解析則定義了此一類別。

如何存取 DeepSeek V4.1-Flash

DeepSeek 官方頁面記錄了三種途徑。

第一種是 API。將您的用戶端指向 https://api.deepseek.com 以使用相容 OpenAI 的格式,或指向 https://api.deepseek.com/anthropic 以使用 Anthropic 格式,並將模型設定為 deepseek-flash。定價頁面列出支援 JSON 輸出、工具呼叫、Responses API 以及視覺功能。

第二種是對話產品,網址為 chat.deepseek.com,模型卡中已直接提供連結。

第三種是模型權重。該模型已在 Hugging Face 上以 MIT 授權條款發布,並附帶技術報告。如果您需要在自己的內部網路中部署,這將是首選途徑。

關於第三種途徑的一點注意事項。模型卡指出「此版本不包含 Jinja 格式的對話範本」,因此如果您選擇自行託管,需要特別注意提示詞編碼。

常見問答

什麼是 DeepSeek V4.1-Flash? 它是 DeepSeek 於 2026 年 9 月 10 日發布的多模態混合專家模型。模型卡列出其擁有 552B 骨幹參數、原生圖像與文字處理能力,並支援高達 100 萬個 token 的上下文。該模型以 MIT 授權條款發布。

DeepSeek V4.1-Flash 的費用是多少? 官方定價頁面列出,在離峰時段快取未命中的情況下,每百萬輸入 token 的價格為 0.15 美元,尖峰時段為 0.3 美元。輸出在離峰時段為 0.6 美元,尖峰時段為 1.2 美元。離峰時段快取命中的輸入價格則為 0.003 美元。

DeepSeek V4.1-Flash 支援圖像嗎? 是的。模型卡描述了一個從頭開始訓練的視覺編碼器,其視覺嵌入向量從預訓練之初就與文字一同進行聯合處理。定價頁面也標記 deepseek-flash 支援視覺功能。

DeepSeek V4-Flash 怎麼了? 發布說明指出 V4-Flash 和 V4-Flash-Vision-Exp 已退役。舊的模型名稱仍被接受,並會指向 V4.1-Flash,費用按 Flash 的價格計算。

DeepSeek V4.1-Flash 適合用來製作報告和投影片嗎? 該模型能很好地處理讀取步驟,且 DocVQA 得分 95.6 顯示其具備強大的文件理解能力。然而,將其轉化為格式化的成果物屬於另一個層級,這正是 AI 工作空間所提供的功能。

結論

DeepSeek V4.1-Flash 是一款披著能力提升外衣的效率優化版本。架構上的改進主要集中在 KV 快取上,而其帶來的回報則體現在長輸入的處理上。

對於任何資料來源為文件的人來說,這都是一個極具實用價值的方向。現在,將 100 頁的文件閱讀兩次,其成本微不足道,不再需要糾結。

模型最終交給您的依然是文字。如果您的每週工作成果需要以一份供主管簽核的表格來收尾,那麼模型之後的處理步驟才是最耗費您時間的地方。免費試用 Powerdrill Bloom,並上傳您原本打算手動摘要的文件。


資料來源(截至 2026-09-14): DeepSeek-V4.1-Flash 發布說明 · DeepSeek-V4.1-Flash 模型卡 · DeepSeek 模型與定價。價格與可用性可能會有所變動;請在編列預算前確認官方頁面。