DeepSeek V4.1-Flash: Có gì mới, Bảng giá và Giải pháp thay thế (2026)

DeepSeek đã phát hành V4.1-Flash vào ngày 10 tháng 9 năm 2026. Đây là mô hình Mixture-of-Experts 552B tham số có khả năng đọc hình ảnh và văn bản một cách tự nhiên, xử lý ngữ cảnh lên đến một triệu token và được phát hành theo giấy phép MIT. Thay đổi đáng chú ý nhất là chi phí: mô hình kích hoạt 8B tham số ở đầu vào và 16B ở đầu ra.
Câu cuối cùng đó đã tóm tắt toàn bộ câu chuyện một cách cô đọng nhất. Hướng dẫn này sẽ phân tích chi tiết và cung cấp giá API đã được công bố. Tài liệu cũng giải thích những gì bản phát hành này thay đổi và không thay đổi nếu công việc của bạn kết thúc bằng một báo cáo, một slide thuyết trình hoặc một bảng biểu.
Tất cả các thông tin dưới đây đều được lấy từ ghi chú phát hành của chính DeepSeek, model card trên Hugging Face và trang bảng giá đã công bố của họ, được kiểm tra vào ngày 14 tháng 9 năm 2026.
Có gì mới trong DeepSeek V4.1-Flash
Ghi chú phát hành của DeepSeek mở đầu bằng bốn tuyên bố. Mô hình này "thông minh hơn, nhanh hơn, hiệu quả hơn". Đây là "mô hình nhỏ nhất trong dòng kiến trúc mới của chúng tôi, với khả năng hiểu thị giác tự nhiên". Nó được thiết kế để mang lại "khả năng lớn hơn, suy luận nhanh hơn, thông lượng cao hơn". Và nó sẽ mở rộng sang các mô hình lớn hơn sau này.
Model card cung cấp thông tin cụ thể hơn. DeepSeek-V4.1-Flash được mô tả là "một mô hình Mixture-of-Experts (MoE) đa phương thức với 552B tham số xương sống và hỗ trợ ngữ cảnh lên đến một triệu token". Nó "xử lý hình ảnh và văn bản một cách tự nhiên, đồng thời tạo văn bản theo phương thức tự hồi quy (autoregressively)."
Có ba thay đổi thực sự quan trọng đối với công việc hàng ngày hơn là đối với các bài kiểm tra hiệu năng (benchmarking).
Khả năng thị giác được tích hợp sẵn, không phải chắp vá. Một bộ mã hóa thị giác (vision encoder) và một bộ chiếu hai lớp (two-layer projector) sẽ chuyển đổi hình ảnh thành các embedding. Chúng được "xử lý chung với các embedding văn bản ngay từ khi bắt đầu quá trình tiền huấn luyện mô hình ngôn ngữ." Model card cho biết DeepSeek-ViT, bộ mã hóa này, được huấn luyện từ đầu.
Ngữ cảnh đạt tới một triệu token. Quá trình tiền huấn luyện đã sử dụng 45T token, với cơ chế chú ý thưa thớt (sparse attention) được huấn luyện ở mức 64K và ngữ cảnh được mở rộng lên 1M sau đó trong quá trình chạy.
Mức độ tư duy có thể điều chỉnh linh hoạt. Mô hình "hỗ trợ thiết lập mức độ tư duy có thể kiểm soát liên tục (số nguyên từ 1–100) giúp đánh đổi chi phí suy luận lấy độ chính xác." Bạn chỉ chi tiêu nhiều hơn cho những câu hỏi thực sự cần thiết.
DeepSeek cũng đã cho thế hệ trước ngừng hoạt động. Ghi chú phát hành nêu rõ rằng "V4-Flash & V4-Flash-Vision-Exp đã ngừng hoạt động" và các tên mô hình cũ sẽ tạm thời được chuyển hướng đến V4.1-Flash để đảm bảo tính tương thích.
Thay đổi kiến trúc đằng sau sự sụt giảm chi phí
Điểm thú vị trong bản phát hành DeepSeek V4.1-Flash không nằm ở bảng điểm hiệu năng (benchmark). Mà đó là phép toán bộ nhớ.
DeepSeek-V4.1-Flash sử dụng kiến trúc mà model card gọi là Causal Encoder-Decoder (CED). Đây là một Transformer 40 lớp được chia thành một bộ mã hóa nhân quả (causal encoder) 20 lớp và một bộ giải mã (decoder) 20 lớp. KV cache toàn cục của bộ giải mã được chiếu từ các trạng thái ẩn cuối cùng (final hidden states) của bộ mã hóa thay vì được xây dựng theo từng lớp.
Kết quả thực tế là con số được trích dẫn ở khắp mọi nơi: 8B tham số hoạt động trên mỗi token trong quá trình prefill, 16B trong quá trình decode. Model card mô tả điều này giúp "cải thiện đáng kể hiệu quả chi phí cho các khối lượng công việc dạng agent có lượng đầu vào lớn."
"Lượng đầu vào lớn" (Input-heavy) là cụm từ cần lưu ý. Các tài liệu dài là dạng đầu vào lớn. Một cuộc trò chuyện mà bạn đính kèm bốn mươi trang tài liệu rồi đặt sáu câu hỏi về chúng cũng vậy.
Hai kỹ thuật khác giúp thu nhỏ chính bộ nhớ đệm (cache). Compressed Sparse Attention 2 gán cho mỗi lớp chú ý một trong ba chế độ và chia sẻ các chỉ mục giữa các lớp. FP4 main KV caching lưu trữ bộ nhớ đệm dưới định dạng 4-bit. Tổng hợp lại, model card cho biết KV cache toàn cục chỉ ở mức 890 byte trên mỗi token, bằng khoảng một phần tư so với thế hệ trước.
Ghi chú phát hành chuyển đổi điều đó thành số liệu thực tế mà người mua cảm nhận được. So với thế hệ trước, bộ nhớ đệm cần "1/4 dung lượng HBM" và "1/8 dung lượng lưu trữ SSD". Tài liệu nói thêm rằng "phí cache-hit thường chiếm một phần lớn trong chi phí vận hành agent."
Bảng giá DeepSeek V4.1-Flash
DeepSeek công bố giá trên mỗi triệu token và chia theo giờ cao điểm và thấp điểm. Các giá trị dưới đây được lấy từ trang Models & Pricing chính thức vào ngày 14 tháng 9 năm 2026, tính bằng đô la Mỹ.
| Chỉ số | Giờ thấp điểm | Giờ cao điểm |
|---|---|---|
| 1M token đầu vào (cache hit) | $0.003 | $0.006 |
| 1M token đầu vào (cache miss) | $0.15 | $0.3 |
| 1M token đầu ra | $0.6 | $1.2 |
Trang này nêu rõ rằng "giá giờ thấp điểm bằng một nửa giá giờ cao điểm" và định nghĩa giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ Thứ Hai đến Thứ Sáu. Tất cả các khung giờ khác là giờ thấp điểm.
Hai chi tiết vận hành nằm cạnh bảng này. Tên mô hình cần sử dụng là deepseek-flash. Độ dài ngữ cảnh là 1M với đầu ra tối đa là 384K, và giới hạn đồng thời (concurrency limit) được liệt kê là 2.500.
Cùng trang này cũng lưu ý rằng V4-Pro vẫn tiếp tục khả dụng. DeepSeek viết rằng họ đã "quyết định tiếp tục cung cấp dịch vụ API cho DeepSeek V4 Pro sau ngày 14 tháng 9 năm 2026." Phương thức thanh toán được tuyên bố là vẫn giữ nguyên không đổi.
Những gì các bài kiểm tra hiệu năng bao gồm, và những gì không
Các bảng instruct-model của model card thiên về công việc lập trình và agent. Terminal-Bench, DeepSWE, NL2Repo-Bench và Codeforces chiếm hầu hết các hàng. Điều đó phản ánh mục tiêu mà DeepSeek đang hướng tới.
Bốn hàng sau đây sẽ phù hợp hơn nếu kết quả đầu ra của bạn là một tài liệu.
| Benchmark | DeepSeek-V4.1-Flash-Base |
|---|---|
| DocVQA (LLM-Judge) | 95.6 |
| CVBench (EM) | 77.9 |
| RefCOCO-avg (Acc@0.5) | 86.0 |
| MMMU-Pro (EM) | 56.5 |
DocVQA đo lường khả năng trả lời câu hỏi trên hình ảnh tài liệu. Đây là chỉ số đại diện gần nhất được công bố cho việc đọc hóa đơn quét, hợp đồng thuê nhà hoặc báo cáo PDF. Mô hình cơ sở đạt điểm 95.6 ở bài kiểm tra này.
Về phía instruct, Chartography với các công cụ đạt 78.9 và BabyVision với các công cụ đạt 89.6. Cả hai đều là các benchmark visual agent được chạy thông qua một khung thử nghiệm bên ngoài (external harness).
Hãy xem những kết quả này mang tính chất tham khảo định hướng. Model card nêu rõ rằng tất cả các đánh giá dạng agent đều sử dụng temperature=1.0, top_p=0.95, và các benchmark visual agent sử dụng cửa sổ ngữ cảnh 512k-token. Thiết lập của bạn sẽ khác biệt.
Thay đổi này có ý nghĩa gì đối với công việc chuyển đổi từ tài liệu sang sản phẩm bàn giao
Token đầu vào rẻ hơn sẽ thay đổi hoàn toàn việc quy trình làm việc nào thực sự đáng để tự động hóa.
Hãy xem xét một tháng hóa đơn của nhà cung cấp dưới dạng PDF. Theo cách tính toán cũ, bạn sẽ trích xuất một lần, lưu trữ bản tóm tắt và làm việc dựa trên bản tóm tắt đó. Trích xuất là bước tốn kém nhất, vì vậy bạn thực hiện nó càng ít càng tốt.
Đầu vào có giá $0.15 trên mỗi triệu token khi bị cache miss. Một lượt cache hit chỉ tốn một phần nhỏ của một cent. Với mức giá đó, việc đọc lại nguồn không còn là yếu tố chính đẩy chi phí lên nữa. Bạn có thể đặt câu hỏi thứ hai trực tiếp trên các trang gốc thay vì dựa trên các ghi chú của riêng mình.
Điều đó quan trọng đối với độ chính xác, chứ không chỉ đối với ngân sách. Một bản tóm tắt sẽ làm mất số trang. Tài liệu gốc thì không.
Ngữ cảnh 1M cũng mang lại hiệu quả tương tự. Các lệnh làm việc của cả một quý, toàn bộ hồ sơ thuê nhà hoặc nhật ký ca làm việc của cả một năm đều có thể nằm gọn trong một cửa sổ. Bạn không còn phải đắn đo lựa chọn mười tài liệu nào để đưa vào nữa.
Khả năng thị giác tự nhiên lấp đầy khoảng trống cuối cùng. Một biểu đồ được dán vào slide, một bức ảnh chụp số đo đồng hồ và một phiếu giao hàng được quét đều trở thành dữ liệu đầu vào có thể đọc được thay vì là thứ cần phải gõ lại.
Nơi một mô hình rẻ hơn không còn giúp ích được nữa
DeepSeek V4.1-Flash là một lớp. Sản phẩm bàn giao lại là một lớp khác.
Các trang của DeepSeek mô tả một API và một sản phẩm chat. Họ đưa ra mức giá, giới hạn ngữ cảnh, các bài kiểm tra hiệu năng và tên mô hình. Những gì họ không mô tả là một không gian làm việc giúp lưu giữ các tệp tin, phân tích trước đó và định dạng đầu ra của bạn cùng nhau giữa các phiên làm việc.
Đó là sự phân công lao động thông thường, không phải là một thiếu sót. Một API được thiết kế để đóng vai trò là một thành phần.
Hệ quả thực tế là chặng đường cuối cùng vẫn thuộc về bạn. Ai đó vẫn phải đưa câu trả lời vào một bảng biểu được định dạng, một slide thuyết trình hoặc một tài liệu mà đồng nghiệp có thể mở được. Ai đó vẫn phải có khả năng chỉ vào một số liệu và nói rõ nó đến từ trang nào.
Powerdrill Bloom nằm trên lớp đó. Trang chủ của nó mô tả đây là "nhà phân tích dữ liệu AI hiển thị rõ quy trình làm việc của mình." Trang web nói thêm rằng "mỗi con số trả về đều đi kèm với trang, hàng và số liệu đằng sau nó." Bạn chỉ cần tải các tệp lên, đặt câu hỏi bằng ngôn ngữ tự nhiên và nhận kết quả.
Hai lớp này bổ trợ cho nhau chứ không cạnh tranh. Một mô hình rẻ hơn, ngữ cảnh dài hơn, có khả năng thị giác giúp bước đọc tài liệu trở nên tiết kiệm hơn. Một không gian làm việc sẽ quyết định phải làm gì với những gì đã đọc.
Các giải pháp thay thế đáng chú ý
Nếu bạn đang đánh giá V4.1-Flash so với các tùy chọn khác, dưới đây là ba sự so sánh thường gặp nhất.
So với DeepSeek V4-Pro. Ghi chú phát hành cho biết "các thử nghiệm từ nhiều bên cho thấy V4.1-Flash vượt trội hơn V4-Pro về hiệu năng, chi phí, tốc độ & tổng thời gian chạy." Tài liệu nói thêm rằng DeepSeek đang "từng bước loại bỏ V4-Pro." Trang bảng giá vẫn liệt kê V4-Pro ở mức $0.66 trên mỗi triệu token đầu vào khi bị cache miss vào giờ thấp điểm, so với $0.15 của Flash. V4-Pro không liệt kê hỗ trợ thị giác trên trang đó.
So với các mô hình đóng hàng đầu (closed frontier models). Bảng so sánh của model card bao gồm Opus-5.0 và GPT-5.6 Sol. Flash dẫn đầu ở một số hàng đánh giá dạng agent, bao gồm Terminal-Bench 2.1 ở mức 90.6 và AutomationBench ở mức 54.8. Nó bị tụt lại phía sau ở Terminal-Bench 3.0 và 4.0. Hãy xem các bảng so sánh do nhà cung cấp tự chạy với mức độ tham khảo phù hợp.
So với một không gian làm việc thay vì một mô hình. Nếu thứ bạn thực sự cần là một báo cáo hoàn chỉnh từ các tệp tin sẵn có, thì việc so sánh không nằm ở cấp độ mô hình với mô hình. Bài viết tổng hợp các giải pháp thay thế DeepSeek của chúng tôi sẽ đề cập đến khía cạnh đó, và bài giải thích về AI data agent sẽ định nghĩa rõ hơn về danh mục này.
Cách truy cập DeepSeek V4.1-Flash
Có ba con đường được ghi nhận trên chính các trang của DeepSeek.
API là con đường đầu tiên. Hãy trỏ client của bạn đến https://api.deepseek.com đối với định dạng tương thích với OpenAI, hoặc https://api.deepseek.com/anthropic đối với định dạng Anthropic, và đặt mô hình thành deepseek-flash. Trang bảng giá liệt kê đầu ra JSON, gọi công cụ (tool calls), Responses API và khả năng thị giác (vision) là các tính năng được hỗ trợ.
Sản phẩm chat là con đường thứ hai, tại địa chỉ chat.deepseek.com, được model card liên kết trực tiếp.
Trọng số (weights) là con đường thứ ba. Mô hình được phát hành trên Hugging Face theo giấy phép MIT, đi kèm với một báo cáo kỹ thuật. Đây là lựa chọn phù hợp nếu bạn cần triển khai nó trong mạng nội bộ của riêng mình.
Một lưu ý cho con đường thứ ba. Model card nêu rõ rằng "bản phát hành này không bao gồm chat template định dạng Jinja," vì vậy việc mã hóa prompt cần được chú ý nếu bạn tự lưu trữ (self-host).
FAQs
DeepSeek V4.1-Flash là gì? Đây là mô hình Mixture-of-Experts đa phương thức được DeepSeek phát hành vào ngày 10 tháng 9 năm 2026. Model card liệt kê 552B tham số xương sống, khả năng xử lý hình ảnh và văn bản tự nhiên, và hỗ trợ ngữ cảnh lên đến một triệu token. Nó được phát hành theo giấy phép MIT.
DeepSeek V4.1-Flash có giá bao nhiêu? Trang bảng giá chính thức liệt kê mức giá $0.15 trên mỗi triệu token đầu vào khi bị cache miss vào giờ thấp điểm, và $0.3 vào giờ cao điểm. Đầu ra là $0.6 vào giờ thấp điểm và $1.2 vào giờ cao điểm. Đầu vào cache-hit là $0.003 vào giờ thấp điểm.
DeepSeek V4.1-Flash có hỗ trợ hình ảnh không? Có. Model card mô tả một bộ mã hóa thị giác (vision encoder) được huấn luyện từ đầu, với các embedding thị giác được xử lý chung với văn bản ngay từ khi bắt đầu quá trình tiền huấn luyện. Trang bảng giá đánh dấu khả năng thị giác được hỗ trợ cho deepseek-flash.
Chuyện gì đã xảy ra với DeepSeek V4-Flash? Ghi chú phát hành nêu rõ rằng V4-Flash và V4-Flash-Vision-Exp đã ngừng hoạt động. Các tên mô hình cũ vẫn được chấp nhận và chuyển hướng đến V4.1-Flash, được tính phí theo mức giá của Flash.
DeepSeek V4.1-Flash có tốt cho việc xây dựng báo cáo và slide thuyết trình không? Mô hình này xử lý tốt bước đọc tài liệu, và điểm số DocVQA đạt 95.6 cho thấy khả năng hiểu tài liệu mạnh mẽ. Việc chuyển đổi kết quả đó thành một sản phẩm bàn giao được định dạng là một lớp riêng biệt, và đó chính là những gì một không gian làm việc AI cung cấp.
Kết luận
DeepSeek V4.1-Flash thực chất là một bản phát hành tập trung vào hiệu quả nhưng lại mang lớp vỏ của một bản phát hành nâng cấp năng lực. Công sức cải tiến kiến trúc được dồn vào KV cache, và thành quả mang lại rõ rệt nhất ở các dữ liệu đầu vào dài.
Đối với bất kỳ ai có dữ liệu đầu vào là các tài liệu, đây là một hướng đi vô cùng hữu ích. Việc đọc lại một trăm trang tài liệu hai lần giờ đây chỉ là một sai số làm tròn nhỏ nhặt chứ không còn là một quyết định cần phải đắn đo nữa.
Mô hình vẫn chỉ cung cấp cho bạn văn bản. Nếu công việc trong tuần của bạn kết thúc bằng một bảng biểu cần ai đó phê duyệt, thì bước tiếp theo sau mô hình mới chính là bước làm tiêu tốn thời gian của bạn. Dùng thử Powerdrill Bloom miễn phí và tải lên các tài liệu mà bạn từng định tóm tắt bằng tay.
Nguồn (tính đến ngày 14-09-2026): Ghi chú phát hành DeepSeek-V4.1-Flash · Model card DeepSeek-V4.1-Flash · Mô hình & Bảng giá DeepSeek. Giá cả và tính khả dụng có thể thay đổi; vui lòng kiểm tra các trang chính thức trước khi lập ngân sách.