Qwen3.8: Apa yang Baru, Cara Menjalankannya, dan Alternatifnya (2026)

Tim Qwen dari Alibaba merilis Qwen3.8-27B pada 14 Agustus 2026, dua hari setelah Qwen3.8-2.4T-A95B yang jauh lebih besar. Catatan rilisnya hanya sepanjang satu kalimat dan sangat layak dibaca dua kali.
"Untuk pertama kalinya, Qwen3.8 menghadirkan model kelas Qwen-Max ke rilis terbuka."
Itu adalah klaim tentang tingkatan, bukan tentang ukuran. Ini menyatakan bahwa bobot terbuka (open weights) kini berada di posisi yang dulunya ditempati oleh model unggulan (flagship) terinang.
Apakah hal itu berlaku untuk beban kerja Anda adalah pertanyaan lain, dan bukti yang dipublikasikan hanya menjawabnya sebagian. Sisa dari artikel ini akan membahas bagian mana saja yang terjawab.
Artikel ini membahas apa saja yang diluncurkan dan di mana letak perbedaan antara kedua dokumen resmi tersebut. Kemudian, artikel ini akan melihat apa yang sebenarnya diukur oleh tabel tolok ukur (benchmark). Terakhir, artikel ini membahas cara menjalankan model tersebut secara lokal, jika Anda ingin analisis tetap berada di mesin Anda sendiri.
Apa Sebenarnya Qwen3.8 Itu
The README resmi mendeskripsikan rumpun model ini dibangun "di atas fondasi arsitektur Qwen3.5," memberikan peningkatan "dalam pengodean, pekerjaan profesional, penelitian, dan tugas agen jangka panjang."
Kalimat yang penting bagi siapa pun yang melakukan pekerjaan multi-langkah adalah kalimat berikutnya. Qwen3.8 "dirancang untuk menyelesaikan tugas-tugas multi-langkah yang kompleks hingga tuntas dengan keandalan yang lebih tinggi."
Model 27B adalah model yang paling banyak dijalankan orang secara lokal. Model card miliknya memberikan angka pastinya: 27B parameter, 64 layer, dimensi tersembunyi 5120, dan tata letak hibrida dari blok Gated DeltaNet dan Gated Attention.
Panjang konteksnya adalah 262,144 token secara native dan dapat diperluas hingga 1,000,000. Lisensi yang tercatat pada model card adalah apache-2.0.
Kedua entri rilis ini perlu dibedakan dengan jelas. Model mixture-of-experts 2.4T-A95B hadir pada 2026-08-12, dan model dense 27B menyusul pada 2026-08-14. Hanya model kedua yang realistis untuk di-host sendiri.
| Fakta | Qwen3.8-27B |
|---|---|
| Dirilis | 2026-08-14 |
| Parameter | 27B dense |
| Layer | 64 |
| Konteks | 262,144 native, dapat diperluas hingga 1,000,000 |
| Lisensi | apache-2.0 |
| Input | Teks, gambar, video |
Di Mana Letak Perbedaan Antara Kedua Dokumen Resmi
Ini adalah bagian yang hampir tidak dilaporkan oleh siapa pun, dan ini mengubah apa yang dapat Anda klaim dengan aman.
README di GitHub mengatribusikan arsitektur multimodal ke Qwen3.5, generasi yang menjadi dasar pembuatan Qwen3.8. Jika hanya membaca halaman tersebut, Anda akan menyimpulkan bahwa model 27B hanya mendukung teks.
Namun, model card menyatakan sebaliknya, dan ini sangat spesifik. Qwen3.8-27B adalah "model bahasa-visi native yang memahami gambar dan video, dengan kontrol berpikir yang fleksibel."
Ketika dua sumber resmi bertentangan, sumber yang lebih spesifik yang menang. Model card mendeskripsikan checkpoint yang tepat ini, sehingga kemampuan multimodal tersebut memang nyata. Perbedaan ini penting untuk diketahui, karena sekilas membaca repositori akan menunjukkan hal yang sebaliknya.
Apa yang Diukur oleh Tabel Tolok Ukur, dan Apa yang Dilewatkannya
Model card mempublikasikan perbandingan dengan Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B, dan Opus4.6 Max. Beberapa angka kemampuan agen menunjukkan lompatan yang besar.
| Benchmark | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (penggunaan komputer) | 84.3 | 63.9 |
| WebArena-Verified (penggunaan browser) | 64.8 | 48.8 |
| AndroidWorld (penggunaan seluler) | 81.9 | 70.3 |
| SWE-bench Pro (pengodean) | 61.7 | — |
| MathVision (dengan penafsir kode) | 94.6 | 90.3 |
| Vision2Web (pengembangan web visual) | 62.9 | 45.0 |
Sekarang mari kita baca secara jujur. Penggunaan komputer, penggunaan browser, penggunaan seluler, pengodean, matematika visual, dan pengembangan web adalah apa yang dicakup oleh tabel ini.
Tidak ada tolok ukur di sini untuk membaca spreadsheet, merekonsiliasi dua hasil ekspor, atau menghasilkan laporan dari data tabular. Angka OSWorld yang kuat menunjukkan bahwa model tersebut dapat mengoperasikan desktop. Namun, angka tersebut tidak menjamin model akan melakukan rekonsiliasi pendapatan Anda dengan benar.
Satu detail yang perlu diperhatikan bagi pembaca yang mengikuti rilis terbuka. Muse Glimmer-30B muncul di tabel ini sebagai titik perbandingan, dan tabel peluncurannya sendiri empat hari sebelumnya dibandingkan dengan Qwen3.6-27B. Artikel kami tentang Muse Glimmer mencatat bahwa kelompok pembandingnya sudah tertinggal satu generasi saat diluncurkan. Tabel ini adalah bagian lain dari cerita tersebut.
Cara Menjalankannya
Bobot tersedia di Hugging Face Hub dan di ModelScope, sesuai dengan entri berita di README. Format dense 27B adalah pilihan praktis untuk satu mesin.
Rencanakan memori Anda berdasarkan jumlah parameter, bukan batas atas konteks. Jendela 262,144-token memang tersedia, tetapi mengisinya membutuhkan memori yang biasanya tidak dimiliki oleh sebagian besar konfigurasi lokal.
Mulailah dengan konteks pendek dan file asli. Muat satu hasil ekspor, ajukan satu pertanyaan yang sudah Anda ketahui jawabannya, dan periksa jawabannya sebelum memercayai sesuatu yang lebih panjang.
Langkah verifikasi tersebut wajib dilakukan untuk pekerjaan tabular. Sebuah model dapat mendeskripsikan spreadsheet dengan lancar namun tetap salah membaca kolom mana yang berisi total nilai. Jawaban salah yang disampaikan dengan lancar lebih sulit dideteksi daripada kesalahan yang jelas.
Jika Anda memerlukan jendela satu juta token, perlakukan itu sebagai latihan terpisah dengan anggaran perangkat kerasnya sendiri. Kedua konfigurasi tersebut berperilaku sangat berbeda dalam praktiknya, dan menguji tolok ukur salah satunya tidak banyak memberi tahu Anda tentang yang lain.
Ubah Upaya Penalaran Default Terlebih Dahulu
Berikut adalah pengaturan yang akan membentuk kesan pertama Anda, dan ini terlihat di templat obrolan milik model card itu sendiri.
Templat tersebut menetapkan reasoning_effort ke xhigh secara default, dengan medium and low sebagai nilai lain yang diterima. Proses berpikir juga dapat dinonaktifkan.
Default xhigh berarti model akan sengaja berpikir panjang lebar untuk pertanyaan yang sebenarnya tidak membutuhkannya. Untuk pencarian satu baris pada CSV kecil, hal itu akan membuat model terasa lambat, alih-alih teliti.
Jadi, hal pertama yang harus disesuaikan bukanlah prompt-nya. Turunkan upaya penalaran ke medium atau low untuk pertanyaan rutin, dan simpan xhigh untuk pekerjaan multi-langkah yang sebenarnya menjadi fokus utama dalam catatan rilis ini.
Di Mana Posisi Model Ini dalam Alur Kerja Data
Model open-weight yang Anda host sendiri menyelesaikan satu masalah spesifik, yaitu data tidak pernah meninggalkan mesin Anda. Untuk file yang diatur oleh regulasi atau sensitif, itulah argumen utamanya, dan kenyamanan layanan terinang tidak akan bisa menggantikannya.
Pilihan lainnya adalah kompromi. Anda harus menangani perangkat keras, pembaruan, dan keputusan kuantisasi demi mendapatkan satu jaminan tersebut.
Apa yang tidak diselesaikannya adalah segala hal di luar model tersebut. Pembuatan profil kolom, penggabungan dua hasil ekspor, mendeteksi kolom yang diubah namanya, merender bagan, dan menghasilkan dokumen adalah pekerjaan-pekerjaan yang terpisah.
Kesenjangan itulah alasan mengapa lapisan protokol dan alat bantu ada. Penjelasan kami tentang apa itu MCP membahas standar yang menghubungkan model ke alat bantu. Halaman konektor data menunjukkan apa yang diharapkan sebagai input oleh alur kerja berbasis file.
Alternatif
Jika persyaratannya adalah lokal dan terbuka, Qwen3.8-27B dan Muse Glimmer-30B adalah dua kandidat saat ini dalam kelas ukuran yang sama. Keduanya mempublikasikan bobotnya dan dapat dijalankan di satu mesin.
Jika persyaratannya adalah artefak jadi dari sebuah file alih-alih endpoint model, bentuk alat bantu yang dibutuhkan akan berbeda. Powerdrill Bloom mengambil spreadsheet, membuat profil kolom, dan mengembalikan bagan, laporan, atau dek presentasi.
Tidak ada perbandingan harga yang dapat dilakukan dari sisi Qwen. Tidak ada halaman harga resmi Qwen yang dapat diakses untuk model ini, sehingga artikel ini tidak mencantumkan angka apa pun.
Jika tugas Anda yang sebenarnya adalah file yang perlu diubah menjadi laporan, coba Powerdrill Bloom secara langsung. Lihat juga panduan kami tentang mengubah hasil ekspor langganan menjadi laporan MRR dan ARR serta halaman asisten AI CSV.
Kesimpulan
Qwen3.8-27B adalah model dense 27B dengan konteks native 262,144-token, bobot berlisensi apache-2.0, serta input gambar dan video yang terdokumentasi. Peningkatan kemampuan agen dibandingkan Qwen3.6-27B sangatlah substansial.
Ada dua catatan penting yang menyertainya. Repositori dan model card tidak sejalan mengenai kemampuan multimodalnya, dan tolok ukur yang dipublikasikan mencakup tugas desktop, browser, pengodean, dan visual, alih-alih pekerjaan tabular.
Atur reasoning_effort sebelum Anda menilainya. Default-nya adalah xhigh, dan default tersebut melakukan proses berpikir lebih banyak daripada yang dibutuhkan oleh sebagian besar pertanyaan.
Pertanyaan yang Sering Diajukan
Kapan Qwen3.8 dirilis?
Entri berita di README mencatat Qwen3.8-27B pada 2026-08-14 dan Qwen3.8-2.4T-A95B pada 2026-08-12, keduanya tersedia di Hugging Face Hub dan ModelScope.
Apakah Qwen3.8-27B bersifat multimodal?
Ya, menurut model card miliknya, yang mendeskripsikannya sebagai model bahasa-visi native yang memahami gambar dan video. Perlu dicatat bahwa README di GitHub mengatribusikan arsitektur multimodal ke Qwen3.5.
Berapa panjang konteks yang didukungnya?
Model card menyatakan 262,144 token secara native, dan dapat diperluas hingga 1,000,000. Menjalankannya mendekati angka batas atas tersebut membutuhkan memori yang jauh melampaui konfigurasi lokal biasa.
Mengapa model ini terasa lambat untuk pertanyaan sederhana?
Templat obrolan menetapkan default reasoning_effort ke xhigh. Turunkan ke medium atau low untuk pencarian rutin dan simpan xhigh untuk tugas-tugas yang benar-benar membutuhkan banyak langkah.
Apakah tolok ukur tersebut menunjukkan sesuatu tentang pekerjaan spreadsheet?
Tidak. Tabel yang dipublikasikan mencakup penggunaan komputer, penggunaan browser, penggunaan seluler, pengodean, matematika visual, dan pengembangan web, tanpa adanya tolok ukur untuk analisis tabular atau pembuatan laporan.