Super Sale WeekClaude Skills — DISKON 20%
News

DeepSeek V4.1-Flash: Apa yang Baru, Harga, dan Alternatif (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: Apa yang Baru, Harga, dan Alternatif (2026)

DeepSeek merilis V4.1-Flash pada 10 September 2026. Ini adalah model Mixture-of-Experts dengan 552 miliar parameter yang membaca gambar dan teks secara native, menangani konteks hingga satu juta token, dan dirilis di bawah lisensi MIT. Perubahan utamanya adalah biaya: model ini mengaktifkan 8 miliar parameter pada input dan 16 miliar pada output.

Kalimat terakhir tersebut adalah keseluruhan cerita dalam bentuk ringkas. Panduan ini akan mengupasnya dan menyajikan harga API yang dipublikasikan. Panduan ini juga menjelaskan apa saja yang berubah dan tidak berubah dari rilis ini jika hasil pekerjaan Anda berakhir dalam bentuk laporan, dek presentasi, atau tabel.

Semua fakta di bawah ini berasal dari catatan rilis resmi DeepSeek, kartu model Hugging Face miliknya, dan halaman harga yang dipublikasikan, yang diperiksa pada 14 September 2026.

Apa yang baru di DeepSeek V4.1-Flash

Catatan rilis DeepSeek dibuka dengan empat klaim. Model ini "lebih cerdas, lebih cepat, lebih efisien." Ini adalah "model terkecil dalam keluarga arsitektur baru kami, dengan pemahaman visual native." Model ini dirancang untuk "kemampuan yang lebih besar, inferensi yang lebih cepat, throughput yang lebih tinggi." Dan model ini akan diskalakan ke model yang lebih besar nantinya.

Kartu modelnya lebih spesifik. DeepSeek-V4.1-Flash digambarkan sebagai "model Mixture-of-Experts (MoE) multimodal dengan 552 miliar parameter backbone dan dukungan untuk konteks hingga satu juta token." Model ini "memproses gambar dan teks secara native, serta menghasilkan teks secara autoregresif."

Tiga perubahan berikut ini lebih penting untuk pekerjaan sehari-hari daripada sekadar untuk pengujian tolok ukur (benchmarking).

Kemampuan visual sudah terintegrasi, bukan sekadar tempelan. Enkoder visi dan proyektor dua lapis mengubah gambar menjadi embedding. Hal tersebut "diproses bersama dengan embedding teks sejak awal pra-pelatihan model bahasa." Kartu model tersebut menyebutkan bahwa DeepSeek-ViT, sang enkoder, dilatih dari nol.

Konteks mencapai satu juta token. Pra-pelatihan menggunakan 45 triliun token, dengan sparse attention yang dilatih pada 64K dan konteks yang diperluas hingga 1 juta kemudian dalam prosesnya.

Upaya penalaran dapat disesuaikan. Model ini "mendukung pengaturan upaya penalaran yang dapat dikontrol secara berkelanjutan (integer 1–100) yang menyeimbangkan biaya inferensi dengan akurasi." Anda hanya mengeluarkan biaya lebih banyak untuk pertanyaan-pertanyaan yang memang membutuhkannya.

DeepSeek juga mempensiunkan generasi sebelumnya. Catatan rilis menyatakan bahwa "V4-Flash & V4-Flash-Vision-Exp telah dipensiunkan," dan nama model lama untuk sementara dialihkan ke V4.1-Flash demi kompatibilitas.

Perubahan arsitektur di balik penurunan biaya

Bagian menarik dari rilis DeepSeek V4.1-Flash bukanlah tabel tolok ukurnya, melainkan aritmetika memorinya.

DeepSeek-V4.1-Flash menggunakan apa yang disebut kartu model sebagai arsitektur Causal Encoder-Decoder (CED). Ini adalah Transformer 40 lapis yang dibagi menjadi encoder kausal 20 lapis dan decoder 20 lapis. Cache KV global milik decoder diproyeksikan dari keadaan tersembunyi akhir (final hidden states) encoder, alih-alih dibangun per lapis.

Hasil praktisnya adalah angka yang dikutip di mana-mana: 8 miliar parameter aktif per token selama prefill, 16 miliar selama decode. Kartu model menggambarkan hal ini sebagai "secara substansial meningkatkan efisiensi biaya untuk beban kerja agen (agentic) yang padat input."

"Padat input" adalah frasa yang perlu diperhatikan. Dokumen panjang termasuk padat input. Begitu pula dengan obrolan di mana Anda melampirkan empat puluh halaman lalu mengajukan enam pertanyaan tentang halaman-halaman tersebut.

Dua teknik tambahan memperkecil ukuran cache itu sendiri. Compressed Sparse Attention 2 menetapkan salah satu dari tiga mode ke setiap lapisan attention dan membagikan indeks di seluruh lapisan. FP4 main KV caching menyimpan cache dalam format empat bit. Secara keseluruhan, kartu model mencatat cache KV global sebesar 890 bita per token, kira-kira seperempat dari generasi sebelumnya.

Catatan rilis menerjemahkan hal tersebut ke dalam metrik yang benar-benar dirasakan oleh pembeli. Dibandingkan dengan generasi sebelumnya, cache ini membutuhkan "1/4 HBM" dan "1/8 penyimpanan SSD." Catatan tersebut menambahkan bahwa "biaya cache-hit sering kali menyumbang porsi besar dari biaya agen."

Harga DeepSeek V4.1-Flash

DeepSeek mempublikasikan harga per juta token dan membaginya berdasarkan jam sibuk (peak) dan luar jam sibuk (off-peak). Nilai di bawah ini diambil dari halaman resmi Models & Pricing pada 14 September 2026, dalam dolar AS.

Metrik Luar jam sibuk Jam sibuk
1 juta token input (cache hit) $0.003 $0.006
1 juta token input (cache miss) $0.15 $0.3
1 juta token output $0.6 $1.2

Halaman tersebut menyatakan bahwa "tarif luar jam sibuk adalah setengah dari tarif jam sibuk" dan mendefinisikan jam sibuk sebagai pukul 01:00–04:00 dan 06:00–10:00 UTC, Senin hingga Jumat. Waktu lainnya termasuk luar jam sibuk.

Dua detail operasional tercantum di samping tabel. Nama model yang digunakan adalah deepseek-flash. Panjang konteks adalah 1 juta dengan output maksimum 384 ribu, dan batas konkurensi yang tercantum adalah 2.500.

Halaman yang sama mencatat bahwa V4-Pro tetap tersedia. DeepSeek menulis bahwa mereka telah "memutuskan untuk terus menyediakan layanan API untuk DeepSeek V4 Pro setelah 14 September 2026." Metode penagihan dinyatakan tetap tidak berubah.

Apa yang dicakup oleh tolok ukur, dan apa yang tidak

Tabel model instruksi (instruct-model) pada kartu model cenderung mengarah pada pekerjaan kode dan agen. Terminal-Bench, DeepSWE, NL2Repo-Bench, dan Codeforces mendominasi sebagian besar baris. Hal ini mencerminkan target sasaran DeepSeek.

Empat baris berikut lebih relevan jika hasil pekerjaan Anda berupa dokumen.

Tolok Ukur DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA mengukur tanya jawab pada gambar dokumen. Ini adalah proksi terbitan terdekat untuk membaca faktur pindaian, surat sewa, atau laporan PDF. Model dasar mencetak skor 95.6 di tolok ukur tersebut.

Di sisi instruksi, Chartography dengan alat bantu mencapai skor 78.9 dan BabyVision dengan alat bantu mencapai skor 89.6. Keduanya merupakan tolok ukur agen visual yang dijalankan melalui harness eksternal.

Bacalah hasil ini sebagai petunjuk arah. Kartu model menyatakan bahwa semua evaluasi agen menggunakan temperature=1.0, top_p=0.95, dan tolok ukur agen visual menggunakan jendela konteks 512 ribu token. Pengaturan Anda akan berbeda.

Apa arti perubahan ini untuk alur kerja dari dokumen ke hasil akhir (deliverable)

Token input yang lebih murah mengubah alur kerja mana saja yang layak untuk diotomatisasi sejak awal.

Bayangkan faktur pemasok selama sebulan dalam bentuk PDF. Dengan aritmetika lama, Anda akan mengekstraknya sekali, menyimpan ringkasannya, dan bekerja dari ringkasan tersebut. Ekstraksi adalah langkah yang mahal, jadi Anda melakukannya sejarang mungkin.

Input dihargai $0.15 per juta token saat terjadi cache miss. Sedangkan cache hit hanya memakan biaya sepersekian sen. Dengan tarif tersebut, membaca ulang sumber tidak lagi menjadi pemicu utama pembengkakan biaya. Anda dapat mengajukan pertanyaan kedua langsung pada halaman aslinya, alih-alih pada catatan Anda sendiri.

Hal ini penting untuk akurasi, bukan hanya anggaran. Ringkasan bisa kehilangan nomor halaman, sedangkan dokumen asli tidak.

Konteks 1 juta token memberikan efek serupa. Perintah kerja selama satu kuartal, berkas sewa lengkap, atau log giliran kerja (shift) selama setahun dapat dimasukkan ke dalam satu jendela. Anda tidak perlu lagi memilih sepuluh dokumen mana yang harus disertakan.

Kemampuan visual native menutup celah terakhir. Grafik yang ditempelkan ke dalam slide, foto pembacaan meteran, dan nota pengiriman yang dipindai semuanya menjadi input yang dapat dibaca, alih-alih sesuatu yang harus diketik ulang.

Di mana model yang lebih murah tidak lagi membantu

DeepSeek V4.1-Flash hanyalah satu lapisan. Hasil akhir (deliverable) adalah lapisan lainnya.

Halaman-halaman DeepSeek menjelaskan tentang API dan produk obrolan. Mereka menetapkan harga, batas konteks, tolok ukur, dan nama model. Apa yang tidak mereka jelaskan adalah ruang kerja (workspace) yang menyimpan file Anda, analisis sebelumnya, dan format output Anda secara bersamaan di antara sesi.

Ini adalah pembagian kerja yang biasa, bukan suatu kekurangan. API memang dimaksudkan untuk menjadi sebuah komponen.

Konsekuensi praktisnya adalah langkah terakhir tetap menjadi tugas Anda. Seseorang masih harus memasukkan jawaban ke dalam tabel yang terformat, slide, atau dokumen yang dapat dibuka oleh rekan kerja. Seseorang masih harus bisa menunjuk ke sebuah angka dan menyebutkan dari halaman mana angka tersebut berasal.

Powerdrill Bloom berada di lapisan tersebut. Halaman berandanya menggambarkan sebagai "analis data AI yang menunjukkan cara kerjanya." Halaman tersebut menambahkan bahwa "setiap angka yang disajikan dilengkapi dengan informasi halaman, baris, dan gambar di baliknya." Anda cukup mengunggah file, bertanya dalam bahasa sehari-hari, dan mendapatkan hasilnya.

Kedua lapisan ini saling melengkapi, bukan bersaing. Model yang lebih murah, berkonteks lebih panjang, dan berkemampuan visual membuat langkah membaca menjadi lebih murah. Ruang kerja menentukan apa yang harus dilakukan dengan apa yang telah dibaca.

Alternatif yang patut diketahui

Jika Anda mengevaluasi V4.1-Flash terhadap opsi lain, tiga perbandingan berikut adalah yang paling sering muncul.

Terhadap DeepSeek V4-Pro. Catatan rilis menyebutkan bahwa "pengujian oleh beberapa pihak menempatkan V4.1-Flash di depan V4-Pro dalam hal performa, biaya, kecepatan & total waktu proses." Catatan tersebut menambahkan bahwa DeepSeek sedang "menghentikan V4-Pro secara bertahap." Halaman harga masih mencantumkan V4-Pro sebesar $0.66 per juta token input saat terjadi cache miss di luar jam sibuk, dibandingkan dengan $0.15 untuk Flash. V4-Pro tidak mencantumkan dukungan visual pada halaman tersebut.

Terhadap model frontier tertutup. Tabel perbandingan pada kartu model menyertakan Opus-5.0 dan GPT-5.6 Sol. Flash unggul pada beberapa baris pengujian agen, termasuk Terminal-Bench 2.1 pada skor 90.6 dan AutomationBench pada skor 54.8. Namun, model ini tertinggal pada Terminal-Bench 3.0 dan 4.0. Anggaplah tabel yang dijalankan oleh vendor sebagaimana mestinya tabel promosi vendor.

Terhadap ruang kerja, bukan sekadar model. Jika yang sebenarnya Anda butuhkan adalah laporan jadi dari file yang sudah Anda miliki, perbandingannya bukanlah antar-model. Rangkuman alternatif DeepSeek kami membahas sudut pandang tersebut, dan penjelasan agen data AI mendefinisikan kategori ini.

Cara mengakses DeepSeek V4.1-Flash

Tiga jalur didokumentasikan di halaman resmi DeepSeek sendiri.

API adalah jalur pertama. Arahkan klien Anda ke https://api.deepseek.com untuk format yang kompatibel dengan OpenAI, atau https://api.deepseek.com/anthropic untuk format Anthropic, dan atur model ke deepseek-flash. Halaman harga mencantumkan output JSON, pemanggilan alat (tool calls), Responses API, dan kemampuan visual sebagai fitur yang didukung.

Produk obrolan adalah jalur kedua, di chat.deepseek.com, yang ditautkan langsung oleh kartu model.

Bobot model (weights) adalah jalur ketiga. Model ini dipublikasikan di Hugging Face di bawah lisensi MIT, disertai dengan laporan teknis. Ini adalah jalur yang tepat jika Anda membutuhkannya di dalam jaringan lokal Anda sendiri.

Catatan untuk jalur ketiga. Kartu model menyatakan bahwa "rilis ini tidak menyertakan templat obrolan format Jinja," sehingga pengodean prompt memerlukan perhatian khusus jika Anda melakukan self-host.

FAQ

Apa itu DeepSeek V4.1-Flash? Ini adalah model Mixture-of-Experts multimodal yang dirilis oleh DeepSeek pada 10 September 2026. Kartu model mencantumkan 552 miliar parameter backbone, pemrosesan gambar dan teks secara native, serta dukungan untuk konteks hingga satu juta token. Model ini dipublikasikan di bawah lisensi MIT.

Berapa biaya DeepSeek V4.1-Flash? Halaman harga resmi mencantumkan $0.15 per juta token input saat terjadi cache miss pada tarif luar jam sibuk, dan $0.3 pada jam sibuk. Output dihargai $0.6 di luar jam sibuk dan $1.2 pada jam sibuk. Input cache-hit adalah $0.003 di luar jam sibuk.

Apakah DeepSeek V4.1-Flash mendukung gambar? Ya. Kartu model menjelaskan enkoder visi yang dilatih dari nol, dengan embedding visual yang diproses bersama dengan teks sejak awal pra-pelatihan. Halaman harga menandai kemampuan visual sebagai fitur yang didukung untuk deepseek-flash.

Apa yang terjadi pada DeepSeek V4-Flash? Catatan rilis menyatakan bahwa V4-Flash and V4-Flash-Vision-Exp telah dipensiunkan. Nama model lama masih diterima dan dialihkan ke V4.1-Flash, dengan biaya yang ditagihkan sesuai tarif Flash.

Apakah DeepSeek V4.1-Flash bagus untuk membuat laporan dan slide? Model ini menangani langkah membaca, dan skor DocVQA sebesar 95.6 menunjukkan pemahaman dokumen yang kuat. Mengubah hasil tersebut menjadi hasil akhir (deliverable) yang terformat adalah lapisan yang berbeda, yang merupakan fungsi dari ruang kerja AI.

Kesimpulan

DeepSeek V4.1-Flash adalah rilis efisiensi yang berkedok sebagai rilis kemampuan baru. Upaya arsitektur difokuskan pada cache KV, dan manfaat terbesarnya dirasakan pada input yang panjang.

Bagi siapa saja yang datanya berupa dokumen, ini adalah arah perkembangan yang sangat berguna. Membaca seratus halaman sebanyak dua kali kini hanyalah masalah kecil (rounding error) alih-alih sebuah keputusan yang berat.

Model ini tetap memberikan Anda teks. Jika akhir pekan Anda ditutup dengan tabel yang harus disetujui seseorang, langkah setelah model itulah yang menyita waktu Anda. Coba Powerdrill Bloom gratis dan unggah dokumen yang tadinya ingin Anda ringkas secara manual.


Sumber (per 14-09-2026): Catatan rilis DeepSeek-V4.1-Flash · Kartu model DeepSeek-V4.1-Flash · Model & Harga DeepSeek. Harga dan ketersediaan dapat berubah; periksa halaman resmi sebelum menganggarkan.