超级促销周Claude Skills——20% 折扣
News

DeepSeek V4.1-Flash:新功能、定价与替代方案 (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash:新功能、定价与替代方案 (2026)

DeepSeek 于 2026 年 9 月 10 日发布了 V4.1-Flash。这是一个拥有 552B 参数的混合专家(Mixture-of-Experts)模型,能够原生读取图像和文本,支持高达 100 万 token 的上下文,并采用 MIT 许可证发布。最引人注目的变化是成本:该模型在输入时激活 8B 参数,在输出时激活 16B 参数。

最后一句话是整个故事的浓缩版。本指南将对其进行详细拆解,并提供已公布的 API 价格。它还将解释,如果您的工作最终以报告、幻灯片或表格的形式呈现,那么这次发布会带来哪些改变,又有哪些没有改变。

以下所有事实均来自 DeepSeek 官方的发布说明、其 Hugging Face 模型卡以及其公布的定价页面,数据核对时间为 2026 年 9 月 14 日。

DeepSeek V4.1-Flash 有哪些新变化

DeepSeek 的发布说明以四个声明开篇。该模型“更聪明、更快、更高效”。它是“我们新架构家族中最小的模型,具有原生视觉理解能力”。它旨在实现“更强的能力、更快的推理、更高的吞吐量”。并且它随后可以扩展到更大的模型。

模型卡则更加具体。DeepSeek-V4.1-Flash 被描述为“一个多模态混合专家(MoE)模型,拥有 552B 骨干参数,并支持高达 100 万 token 的上下文”。它“原生处理图像和文本,并以自回归方式生成文本”。

对于日常工作(而非基准测试)而言,有三个变化至关重要。

视觉功能是内置的,而非外挂的。 视觉编码器和双层投影仪将图像转化为嵌入(embeddings)。这些嵌入“从语言模型预训练开始,就与文本嵌入一起进行联合处理”。模型卡指出,作为编码器的 DeepSeek-ViT 是从头开始训练的。

上下文达到 100 万 token。 预训练使用了 45T token,其中稀疏注意力在 64K 时进行训练,随后在运行过程中将上下文扩展到 1M。

推理力度是可调节的。 该模型“支持连续可控的推理力度设置(整数 1–100),可在推理成本与准确性之间进行权衡”。您只需在需要的问题上投入更多成本。

DeepSeek 还退役了上一代模型。发布说明指出“V4-Flash & V4-Flash-Vision-Exp 已退役”,并且旧的模型名称会临时路由到 V4.1-Flash 以确保兼容性。

成本下降背后的架构变革

DeepSeek V4.1-Flash 发布中最有趣的部分不是基准测试表,而是记忆算术。

DeepSeek-V4.1-Flash 使用了模型卡中所称的因果编码器-解码器(CED)架构。这是一个 40 层的 Transformer,分为 20 层的因果编码器和 20 层的解码器。解码器的全局 KV 缓存是从编码器的最终隐藏状态投影出来的,而不是逐层构建的。

实际结果就是随处可见的那个数字:在预填充阶段每个 token 激活 8B 参数,在解码阶段激活 16B 参数。模型卡将其描述为“显著提高了输入密集型智能体(agentic)工作负载的成本效率”。

“输入密集型”是需要注意的词。长文档就是输入密集型的。附带 40 页内容然后针对其提出 6 个问题的聊天也是如此。

另外两项技术缩小了缓存本身。Compressed Sparse Attention 2 为每个注意力层分配三种模式之一,并在层之间共享索引。FP4 主 KV 缓存以 4 位格式存储缓存。模型卡指出,结合这些技术,全局 KV 缓存为每个 token 890 字节,大约是上一代的四分之一。

发布说明将这一技术转化为买家能实际感受到的指标。与上一代相比,缓存需要“1/4 的 HBM”和“1/8 的 SSD 存储”。它还补充道,“缓存命中费用通常在智能体成本中占很大比例”。

DeepSeek V4.1-Flash 定价

DeepSeek 公布了每百万 token 的价格,并将其分为高峰时段和非高峰时段。以下数值来自 2026 年 9 月 14 日的官方模型与定价(Models & Pricing)页面,单位为美元。

计量指标 非高峰时段 高峰时段
1M 输入 token(缓存命中) $0.003 $0.006
1M 输入 token(缓存未命中) $0.15 $0.3
1M 输出 token $0.6 $1.2

该页面指出“非高峰时段费率是高峰时段费率的一半”,并将高峰时段定义为周一至周五的 UTC 时间 01:00–04:00 和 06:00–10:00。其余时间均为非高峰时段。

表格旁还附带了两个操作细节。要使用的模型名称为 deepseek-flash。上下文长度为 1M,最大输出为 384K,列出的并发限制为 2,500。

同一页面还指出 V4-Pro 仍然可用。DeepSeek 写道,它已“决定在 2026 年 9 月 14 日之后继续为 DeepSeek V4 Pro 提供 API 服务”。据称计费方式保持不变。

基准测试涵盖了什么,又没有涵盖什么

模型卡的指令模型(instruct-model)表格更倾向于代码和智能体工作。Terminal-Bench、DeepSWE、NL2Repo-Bench 和 Codeforces 占据了大部分行。这反映了 DeepSeek 的目标所在。

如果您的输出是文档,那么以下四行会更具相关性。

基准测试 DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA 衡量的是对文档图像的问答能力。这是目前已公布的、最接近读取扫描发票、租约或 PDF 报告的指标。基础模型在此项上的得分为 95.6。

在指令方面,结合工具的 Chartography 得分为 78.9,结合工具的 BabyVision 得分为 89.6。两者都是通过外部测试框架运行的视觉智能体基准测试。

请将这些数据视为方向性参考。模型卡指出,所有智能体评估均使用 temperature=1.0, top_p=0.95,且视觉智能体基准测试使用 512k-token 的上下文窗口。您的具体设置可能会有所不同。

这对“从文档到交付物”的工作带来了什么改变

更便宜的输入 token 改变了哪些工作流才真正值得去实现自动化。

假设要处理一个月的供应商 PDF 发票。在旧的计算方式下,您会提取一次,存储摘要,然后基于摘要开展工作。提取是昂贵的步骤,因此您会尽可能少地进行提取。

在缓存未命中的情况下,输入定价为每百万 token $0.15。而缓存命中的成本仅为一美分的几分之几。在这样的费率下,重新读取源文件不再是成本的主要驱动因素。您可以直接针对原始页面提出第二个问题,而不是针对您自己的笔记。

这不仅关乎预算,更关乎准确性。摘要会丢失页码,而原文不会。

1M 的上下文也具有类似的效果。一个季度的工单、一份完整的租约文件或一年的交接班日志都可以放在同一个窗口中。您不再需要纠结于选择包含哪十个文档。

原生视觉功能弥补了最后的差距。粘贴到幻灯片中的图表、拍摄的仪表读数以及扫描的送货单,都变成了可读取的输入,而不再需要重新手动输入。

便宜的模型在哪些方面无能为力

DeepSeek V4.1-Flash 只是其中一层,交付物则是另一层。

DeepSeek 的页面描述了一个 API 和一个聊天产品。它们列出了价格、上下文限制、基准测试和模型名称。但它们没有描述一个能在不同会话之间将您的文件、先前的分析和输出格式整合在一起的工作空间。

这是正常的劳动分工,而不是缺点。API 本就应该是一个组件。

实际后果是,最后一公里仍由您来完成。仍然需要有人将答案整理成格式化的表格、幻灯片或同事可以打开的文档。仍然需要有人能够指着某个数据并说出它来自哪一页。

Powerdrill Bloom 就处于这一层。其主页将其描述为“展示其工作过程的 AI 数据分析师”。它还补充道,“每一个数字都会附带其背后的页面、行和图表”。您只需上传文件,用自然语言提问,即可获得产出物。

这两层是互补而非竞争关系。一个更便宜、上下文更长、具备视觉功能的模型降低了读取步骤的成本。而工作空间则决定了如何处理读取到的内容。

值得了解的替代方案

如果您正在将 V4.1-Flash 与其他选项进行评估,以下三个对比最常被提及。

对比 DeepSeek V4-Pro。 发布说明称,“多方测试表明,V4.1-Flash 在性能、成本、速度和总运行时间上均领先于 V4-Pro”。它还补充道,DeepSeek 正在“逐步淘汰 V4-Pro”。定价页面仍将 V4-Pro 在非高峰时段缓存未命中时的价格列为每百万输入 token $0.66,而 Flash 仅为 $0.15。在该页面上,V4-Pro 并未列出视觉支持。

对比闭源前沿模型。 模型卡的对比表包括 Opus-5.0 和 GPT-5.6 Sol。Flash 在多个智能体(agentic)指标行上领先,包括 Terminal-Bench 2.1 得分为 90.6,AutomationBench 得分为 54.8。它在 Terminal-Bench 3.0 和 4.0 上则处于落后地位。请理性看待厂商自己发布的对比表。

对比工作空间而非模型。 如果您实际需要的是根据已有文件生成一份完整的报告,那么这就不是模型与模型之间的对比。我们的DeepSeek 替代方案综述涵盖了这一框架,而AI 数据智能体详解则定义了这一类别。

如何获取 DeepSeek V4.1-Flash

DeepSeek 官方页面上记录了三种途径。

第一种是 API。将您的客户端指向兼容 OpenAI 格式的 https://api.deepseek.com,或兼容 Anthropic 格式的 https://api.deepseek.com/anthropic,并将模型设置为 deepseek-flash。定价页面列出其支持 JSON 输出、工具调用(tool calls)、Responses API 以及视觉功能。

第二种是聊天产品,网址为 chat.deepseek.com,模型卡中直接提供了该链接。

第三种是模型权重。该模型已在 Hugging Face 上发布,采用 MIT 许可证,并附带技术报告。如果您需要在自己的内部网络中使用它,可以选择这种途径。

关于第三种途径的一个注意事项。模型卡指出“此版本不包含 Jinja 格式的聊天模板”,因此如果您选择自托管,需要注意提示词编码(prompt encoding)。

常见问题解答

什么是 DeepSeek V4.1-Flash? 它是 DeepSeek 于 2026 年 9 月 10 日发布的多模态混合专家(Mixture-of-Experts)模型。模型卡列出了 552B 骨干参数、原生图像 and 文本处理能力,以及对高达 100 万 token 上下文的支持。它采用 MIT 许可证发布。

DeepSeek V4.1-Flash 的价格是多少? 官方定价页面列出,在非高峰时段,缓存未命中时每百万输入 token 的价格为 $0.15,高峰时段为 $0.3。输出在非高峰时段为 $0.6,高峰时段为 $1.2。非高峰时段缓存命中的输入价格为 $0.003。

DeepSeek V4.1-Flash 支持图像吗? 支持。模型卡描述了一个从头开始训练的视觉编码器,从预训练开始,视觉嵌入就与文本一起进行联合处理。定价页面将 deepseek-flash 标记为支持视觉功能。

DeepSeek V4-Flash 怎么了? 发布说明指出,V4-Flash 和 V4-Flash-Vision-Exp 已退役。旧的模型名称仍被接受,并会路由到 V4.1-Flash,按 Flash 的价格计费。

DeepSeek V4.1-Flash 适合制作报告和幻灯片吗? 该模型可以处理读取步骤,DocVQA 达到 95.6 表明其具有强大的文档理解能力。而将其转化为格式化的交付物则是另一个独立的层面,这正是 AI 工作空间所提供的。

结论

DeepSeek V4.1-Flash 是一款披着“能力提升”外衣的“效率提升”发布。架构工作的重点放在了 KV 缓存上,而其带来的回报则体现在长输入上。

对于任何数据以文档形式呈现的人来说,这都是一个非常有用的方向。现在,将一百页的内容阅读两次只是一个微不足道的零头误差,而不再是一个需要纠结的决定。

该模型向您交付的仍然是文本。如果您的周终工作是以一张需要某人签字确认的表格结束,那么模型之后的步骤才是最耗费您时间的。免费试用 Powerdrill Bloom,并上传您原本打算手动总结的文档。


来源(截至 2026-09-14): DeepSeek-V4.1-Flash 发布说明 · DeepSeek-V4.1-Flash 模型卡 · DeepSeek 模型与定价。价格和可用性可能会发生变化;在制定预算前请查看官方页面。