슈퍼 세일 위크Claude Skills — 20% 할인
News

DeepSeek V4.1-Flash: 새로운 기능, 가격 및 대안 (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: 새로운 기능, 가격 및 대안 (2026)

DeepSeek는 2026년 9월 10일에 V4.1-Flash를 출시했습니다. 이 모델은 이미지와 텍스트를 네이티브로 읽고, 최대 100만 토큰의 컨텍스트를 처리하며, MIT 라이선스로 배포되는 552B 매개변수 규모의 Mixture-of-Experts 모델입니다. 가장 주목할 만한 변화는 비용입니다. 이 모델은 입력 시 8B 매개변수를, 출력 시 16B 매개변수를 활성화합니다.

마지막 문장이 전체 이야기를 압축해서 보여줍니다. 이 가이드에서는 이를 자세히 분석하고 공개된 API 가격을 제공합니다. 또한 귀하의 작업 결과물이 보고서, 슬라이드 또는 표로 작성되는 경우, 이번 출시가 바꾸는 점과 바꾸지 않는 점이 무엇인지 설명합니다.

아래의 모든 사실은 2026년 9월 14일에 확인한 DeepSeek의 자체 출시 노트, Hugging Face 모델 카드 및 공개된 요금 페이지를 기반으로 합니다.

DeepSeek V4.1-Flash의 새로운 기능

DeepSeek의 출시 노트는 네 가지 주장으로 시작합니다. 이 모델은 "더 똑똑하고, 더 빠르며, 더 효율적"입니다. 또한 "네이티브 시각 이해 기능을 갖춘 당사의 새로운 아키텍처 제품군 중 가장 작은 모델"입니다. "더 뛰어난 기능, 더 빠른 추론, 더 높은 처리량"을 위해 설계되었으며, 향후 더 큰 모델로 확장될 예정입니다.

모델 카드는 더 구체적입니다. DeepSeek-V4.1-Flash는 "552B 백본 매개변수를 갖추고 최대 100만 토큰의 컨텍스트를 지원하는 멀티모달 Mixture-of-Experts (MoE) 모델"로 설명됩니다. 이 모델은 "이미지와 텍스트를 네이티브로 처리하고, 자기회귀 방식으로 텍스트를 생성"합니다.

벤치마크보다는 일상적인 업무 관점에서 중요한 세 가지 변화가 있습니다.

비전 기능이 덧붙여진 것이 아니라 내장되어 있습니다. 비전 인코더와 2레이어 프로젝터가 이미지를 임베딩으로 변환합니다. 이러한 임베딩은 "언어 모델 사전 학습 시작 단계부터 텍스트 임베딩과 함께 공동으로 처리"됩니다. 모델 카드에 따르면 인코더인 DeepSeek-ViT는 처음부터 새로 학습되었습니다.

컨텍스트가 100만 토큰에 달합니다. 사전 학습에는 45T 토큰이 사용되었으며, 64K에서 스파스 어텐션(sparse attention)을 학습한 후 학습 과정 후반부에 컨텍스트를 1M으로 확장했습니다.

추론 강도를 다이얼처럼 조절할 수 있습니다. 이 모델은 "추론 비용과 정확도를 절충할 수 있도록 지속적으로 제어 가능한 추론 강도 설정(정수 1~100)을 지원"합니다. 더 많은 비용은 정말 필요한 질문에만 지출하면 됩니다.

DeepSeek는 이전 세대 모델도 단종했습니다. 출시 노트에 따르면 "V4-Flash & V4-Flash-Vision-Exp는 단종"되었으며, 호환성을 위해 기존 모델 이름은 일시적으로 V4.1-Flash로 라우팅됩니다.

비용 절감 뒤에 숨겨진 아키텍처의 변화

DeepSeek V4.1-Flash 출시에서 흥미로운 부분은 벤치마크 표가 아닙니다. 바로 메모리 연산 방식입니다.

DeepSeek-V4.1-Flash는 모델 카드에서 Causal Encoder-Decoder (CED) 아키텍처라고 부르는 방식을 사용합니다. 이는 20레이어 인과적 인코더(causal encoder)와 20레이어 디코더로 나뉜 40레이어 Transformer입니다. 디코더의 글로벌 KV 캐시는 레이어별로 빌드되는 대신 인코더의 최종 은닉 상태(hidden states)에서 투영(project)됩니다.

실질적인 결과는 도처에서 인용되는 수치와 같습니다. 프리필(prefill) 중에는 토큰당 8B 매개변수가 활성화되고, 디코드(decode) 중에는 16B 매개변수가 활성화됩니다. 모델 카드에서는 이를 "입력량이 많은 에이전트 워크로드의 비용 효율성을 크게 향상시킨다"고 설명합니다.

'입력량이 많은(Input-heavy)'이라는 문구에 주목해야 합니다. 긴 문서는 입력량이 많습니다. 40페이지 분량의 문서를 첨부한 뒤 이에 대해 6개의 질문을 던지는 채팅도 마찬가지입니다.

두 가지 추가 기술을 통해 캐시 크기 자체를 줄였습니다. Compressed Sparse Attention 2는 각 어텐션 레이어에 세 가지 모드 중 하나를 할당하고 레이어 간에 인덱스를 공유합니다. FP4 main KV caching은 캐시를 4비트 형식으로 저장합니다. 모델 카드에 따르면 이 두 기술이 결합되어 글로벌 KV 캐시는 토큰당 890바이트로 줄어들었으며, 이는 이전 세대의 약 4분의 1 수준입니다.

출시 노트는 이를 구매자가 실제로 체감할 수 있는 지표로 변환하여 설명합니다. 이전 세대와 비교하여 캐시는 "HBM의 1/4" 및 "SSD 스토리지의 1/8"만 필요로 합니다. 또한 "캐시 히트(cache-hit) 비용이 에이전트 비용에서 큰 비중을 차지하는 경우가 많다"고 덧붙였습니다.

DeepSeek V4.1-Flash 요금

DeepSeek는 100만 토큰당 가격을 공개하며, 이를 피크 시간대와 오프피크(비혼잡) 시간대로 나눕니다. 아래 값은 2026년 9월 14일 기준 공식 Models & Pricing 페이지에 표시된 미국 달러 기준 가격입니다.

측정 항목 오프피크 피크
1M 입력 토큰 (캐시 히트) $0.003 $0.006
1M 입력 토큰 (캐시 미스) $0.15 $0.3
1M 출력 토큰 $0.6 $1.2

해당 페이지에는 "오프피크 요금은 피크 요금의 절반"이라고 명시되어 있으며, 피크 시간은 월요일부터 금요일까지 01:00~04:00 및 06:00~10:00 UTC로 정의되어 있습니다. 그 외의 모든 시간은 오프피크입니다.

표와 함께 두 가지 운영 세부 정보가 나와 있습니다. 사용할 모델 이름은 deepseek-flash입니다. 컨텍스트 길이는 1M이며 최대 출력은 384K이고, 명시된 동시성 제한은 2,500입니다.

동일한 페이지에 V4-Pro를 계속 사용할 수 있다는 점도 언급되어 있습니다. DeepSeek는 "2026년 9월 14일 이후에도 DeepSeek V4 Pro에 대한 API 서비스를 계속 제공하기로 결정했다"고 밝혔습니다. 결제 방식은 변경되지 않고 그대로 유지되는 것으로 명시되어 있습니다.

벤치마크가 다루는 범위와 다루지 않는 범위

모델 카드의 지시(instruct) 모델 표는 코드 및 에이전트 작업에 치우쳐 있습니다. Terminal-Bench, DeepSWE, NL2Repo-Bench 및 Codeforces가 대부분의 행을 차지합니다. 이는 DeepSeek가 지향하는 바를 반영합니다.

출력 결과물이 문서인 경우 다음 네 개의 행이 더 관련성이 높습니다.

벤치마크 DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA는 문서 이미지에 대한 질의응답 능력을 측정합니다. 이는 스캔된 인보이스, 임대 계약서 또는 PDF 보고서를 읽는 작업을 가장 잘 대변하는 공개된 대리 지표(proxy)입니다. 베이스 모델은 여기서 95.6점을 기록했습니다.

지시(instruct) 모델 측면에서는 도구를 사용한 Chartography가 78.9점, 도구를 사용한 BabyVision이 89.6점을 기록했습니다. 둘 다 외부 하네스(harness)를 통해 실행되는 시각적 에이전트 벤치마크입니다.

이 수치들은 경향성을 보여주는 참고용으로 이해하시기 바랍니다. 모델 카드에 따르면 모든 에이전트 평가는 temperature=1.0, top_p=0.95를 사용했으며, 시각적 에이전트 벤치마크는 512k 토큰 컨텍스트 창을 사용했습니다. 실제 사용 환경에 따라 결과는 달라질 수 있습니다.

문서 기반 결과물 작성 작업에서 달라지는 점

입력 토큰 비용이 저렴해지면 자동화할 가치가 있는 워크플로의 기준 자체가 달라집니다.

한 달 치 공급업체 인보이스 PDF를 처리해야 한다고 가정해 보겠습니다. 과거의 셈법으로는 데이터를 한 번 추출하여 요약본을 저장한 다음, 그 요약본을 바탕으로 작업했을 것입니다. 데이터 추출이 비용이 많이 드는 단계였기 때문에 가능한 한 적게 수행했습니다.

캐시 미스 시 입력 가격은 100만 토큰당 $0.15입니다. 캐시 히트 시 비용은 1센트의 극히 일부에 불과합니다. 이 정도 요율이라면 원본을 다시 읽는 작업이 더 이상 비용 상승의 주된 원인이 되지 않습니다. 직접 작성한 메모 대신 원본 페이지를 대상으로 두 번째 질문을 던질 수 있습니다.

이는 단순히 예산뿐만 아니라 정확도 측면에서도 중요합니다. 요약본에서는 페이지 번호가 유실될 수 있지만, 원본에서는 그렇지 않습니다.

1M 컨텍스트도 비슷한 효과를 냅니다. 한 분기 분량의 작업 지시서, 전체 임대 계약서 파일 또는 1년 치 교대 근무 일지를 하나의 창에 모두 띄워둘 수 있습니다. 이제 포함할 문서 10개를 고르느라 고민할 필요가 없습니다.

네이티브 비전 기능은 마지막 공백을 메워줍니다. 슬라이드에 붙여넣은 차트, 사진으로 찍은 계량기 수치, 스캔된 납품서 등이 모두 다시 타이핑할 필요 없이 바로 읽을 수 있는 입력 데이터가 됩니다.

저렴한 모델만으로는 해결되지 않는 한계

DeepSeek V4.1-Flash는 하나의 레이어일 뿐입니다. 최종 결과물은 또 다른 레이어입니다.

DeepSeek의 페이지들은 API와 채팅 제품을 설명합니다. 가격, 컨텍스트 제한, 벤치마크 및 모델 이름을 제시합니다. 하지만 세션 간에 파일, 이전 분석 내용 및 출력 형식을 함께 유지해 주는 워크스페이스에 대해서는 설명하지 않습니다.

이는 단점이 아니라 일반적인 역할 분담입니다. API는 하나의 구성 요소로 기능하도록 설계되었기 때문입니다.

실질적인 결과로, 마지막 단계(last mile)는 여전히 사용자의 몫으로 남습니다. 누군가는 여전히 답변을 서식이 지정된 표, 슬라이드 또는 동료가 열어볼 수 있는 문서로 만들어야 합니다. 누군가는 여전히 특정 수치를 가리키며 그것이 어느 페이지에서 나왔는지 밝힐 수 있어야 합니다.

Powerdrill Bloom이 바로 그 레이어에 위치합니다. 이 서비스의 홈페이지는 "작업 과정을 보여주는 AI 데이터 분석가"라고 스스로를 소개합니다. 또한 "모든 숫자는 해당 숫자가 도출된 페이지, 행 및 배경 데이터와 함께 제공된다"고 덧붙입니다. 사용자는 파일을 업로드하고 자연어로 질문하기만 하면 결과물을 얻을 수 있습니다.

이 두 레이어는 경쟁하기보다는 서로 보완합니다. 더 저렴하고, 더 긴 컨텍스트를 지원하며, 비전 기능을 갖춘 모델은 읽기 단계를 더 저렴하게 만듭니다. 워크스페이스는 그렇게 읽은 내용을 가지고 무엇을 할지 결정합니다.

알아둘 만한 대안들

V4.1-Flash를 다른 옵션들과 비교 평가할 때 가장 자주 언급되는 세 가지 비교 대상이 있습니다.

DeepSeek V4-Pro와의 비교. 출시 노트에 따르면 "여러 주체의 테스트 결과 V4.1-Flash가 성능, 비용, 속도 및 총 실행 시간 측면에서 V4-Pro보다 앞선 것으로 나타났다"고 합니다. 또한 DeepSeek는 "V4-Pro를 단계적으로 단종하고 있다"고 덧붙였습니다. 요금 페이지에는 여전히 V4-Pro가 오프피크 시간대 캐시 미스 시 100만 입력 토큰당 $0.66로 표시되어 있으며, 이는 Flash의 $0.15와 대조적입니다. 해당 페이지에서 V4-Pro는 비전 지원을 명시하고 있지 않습니다.

폐쇄형 프론티어 모델과의 비교. 모델 카드의 비교 표에는 Opus-5.0 및 GPT-5.6 Sol이 포함되어 있습니다. Flash는 Terminal-Bench 2.1에서 90.6점, AutomationBench에서 54.8점을 기록하는 등 여러 에이전트 관련 항목에서 앞서고 있습니다. Terminal-Bench 3.0 및 4.0에서는 뒤처집니다. 공급업체가 작성한 비교 표는 참고용으로만 보시기 바랍니다.

모델이 아닌 워크스페이스와의 비교. 실제로 필요한 것이 이미 가지고 있는 파일로부터 완성된 보고서를 얻는 것이라면, 모델 대 모델의 비교는 적절하지 않습니다. 당사의 DeepSeek 대안 모음에서 이러한 관점을 다루고 있으며, AI 데이터 에이전트 설명서에서 해당 카테고리를 정의하고 있습니다.

DeepSeek V4.1-Flash 사용 방법

DeepSeek의 자체 페이지에는 세 가지 경로가 문서화되어 있습니다.

첫 번째는 API입니다. OpenAI 호환 형식의 경우 클라이언트가 https://api.deepseek.com을 가리키도록 설정하고, Anthropic 형식의 경우 https://api.deepseek.com/anthropic을 가리키도록 설정한 후 모델을 deepseek-flash로 지정합니다. 요금 페이지에는 JSON 출력, 도구 호출(tool calls), Responses API 및 비전 기능이 지원되는 것으로 나와 있습니다.

두 번째는 모델 카드에서 직접 링크를 제공하는 chat.deepseek.com의 채팅 제품입니다.

세 번째는 가중치(weights)입니다. 이 모델은 기술 보고서와 함께 MIT 라이선스로 Hugging Face에 공개되어 있습니다. 자체 네트워크 내부에서 모델을 사용해야 하는 경우 이 경로를 선택하면 됩니다.

세 번째 경로에 대한 한 가지 주의 사항이 있습니다. 모델 카드에 "이번 릴리스에는 Jinja 형식의 채팅 템플릿이 포함되어 있지 않다"고 명시되어 있으므로, 자체 호스팅을 하는 경우 프롬프트 인코딩에 주의해야 합니다.

자주 묻는 질문 (FAQs)

DeepSeek V4.1-Flash란 무엇인가요? 2026년 9월 10일 DeepSeek가 출시한 멀티모달 Mixture-of-Experts 모델입니다. 모델 카드에 따르면 552B 백본 매개변수, 네이티브 이미지 및 텍스트 처리, 최대 100만 토큰의 컨텍스트 지원을 특징으로 합니다. MIT 라이선스로 배포됩니다.

DeepSeek V4.1-Flash의 비용은 얼마인가요? 공식 요금 페이지에 따르면 오프피크 요율 기준 캐시 미스 시 100만 입력 토큰당 $0.15, 피크 시 $0.3입니다. 출력은 오프피크 시 $0.6, 피크 시 $1.2입니다. 캐시 히트 입력은 오프피크 시 $0.003입니다.

DeepSeek V4.1-Flash는 이미지를 지원하나요? 네, 지원합니다. 모델 카드에는 처음부터 새로 학습된 비전 인코더가 설명되어 있으며, 사전 학습 시작 단계부터 시각적 임베딩이 텍스트와 공동으로 처리됩니다. 요금 페이지에는 deepseek-flash에 대해 비전 기능이 지원되는 것으로 표시되어 있습니다.

DeepSeek V4-Flash는 어떻게 되었나요? 출시 노트에 따르면 V4-Flash 및 V4-Flash-Vision-Exp는 단종되었습니다. 기존 모델 이름은 여전히 허용되며 V4.1-Flash로 라우팅되고 Flash 가격으로 청구됩니다.

DeepSeek V4.1-Flash는 보고서와 슬라이드를 작성하는 데 유용한가요? 이 모델은 읽기 단계를 처리하며, DocVQA에서 95.6점을 기록한 것은 강력한 문서 이해 능력을 보여줍니다. 이를 서식이 지정된 최종 결과물로 변환하는 것은 별개의 레이어이며, 이는 AI 워크스페이스가 제공하는 기능입니다.

결론

DeepSeek V4.1-Flash는 기능 출시의 옷을 입은 효율성 중심의 출시작입니다. 아키텍처 개선 작업이 KV 캐시에 집중되었으며, 그 결실은 긴 입력값에서 나타납니다.

데이터가 문서 형태로 제공되는 모든 이들에게 이는 매우 유용한 방향입니다. 이제 100페이지를 두 번 읽는 것은 고민해야 할 결정 사항이 아니라 단지 단수 처리(rounding error) 수준의 미미한 비용 문제일 뿐입니다.

모델은 여전히 텍스트를 전달할 뿐입니다. 한 주의 업무가 누군가의 결재를 받아야 하는 표로 끝난다면, 모델 이후의 단계가 바로 여러분의 시간을 소모하는 단계입니다. Powerdrill Bloom을 무료로 체험해 보고 직접 손으로 요약하려 했던 문서들을 업로드해 보세요.


출처 (2026-09-14 기준): DeepSeek-V4.1-Flash 출시 노트 · DeepSeek-V4.1-Flash 모델 카드 · DeepSeek Models & Pricing. 가격 및 이용 가능 여부는 변경될 수 있으므로 예산을 세우기 전에 공식 페이지를 확인하시기 바랍니다.