Qwen3.8: क्या नया है, इसे कैसे चलाएं, और विकल्प (2026)

Alibaba की Qwen टीम ने 14 अगस्त, 2026 को Qwen3.8-27B रिलीज़ किया, जो इससे कहीं बड़े Qwen3.8-2.4T-A95B के आने के ठीक दो दिन बाद आया है। इसका रिलीज़ नोट सिर्फ एक वाक्य का है, जिसे दो बार पढ़ना तो बनता है।
"पहली बार, Qwen3.8 एक Qwen-Max-क्लास मॉडल को ओपन रिलीज़ में लेकर आया है।"
यह दावा इसके टियर (श्रेणी) के बारे में है, न कि इसके साइज़ के बारे में। इसका मतलब है कि ओपन वेट्स (open weights) अब उस जगह पर आ गए हैं जहाँ पहले होस्ट किया गया फ्लैगशिप मॉडल हुआ करता था।
क्या यह आपके वर्कलोड के लिए भी सही साबित होगा, यह एक अलग सवाल है, और पब्लिश किए गए सबूत इसका केवल आंशिक रूप से ही जवाब देते हैं। इस लेख का बाकी हिस्सा इसी बारे में है कि वे कौन से हिस्से हैं।
इस लेख में बताया गया है कि क्या लॉन्च किया गया है और दोनों आधिकारिक दस्तावेज़ों में कहाँ असहमति है। इसके बाद, हम देखेंगे कि बेंचमार्क टेबल वास्तव में क्या मापती है। अंत में, हम इस बात पर चर्चा करेंगे कि यदि आप चाहते हैं कि आपका एनालिसिस आपके अपने कंप्यूटर पर ही रहे, तो इस मॉडल को लोकली (locally) कैसे चलाया जाए।
Qwen3.8 वास्तव में क्या है
आधिकारिक README इस मॉडल फैमिली को "Qwen3.5 के आर्किटेक्चरल फाउंडेशन पर" निर्मित बताता है, जो "कोडिंग, प्रोफेशनल वर्क, रिसर्च और लॉन्ग-होराइजन एजेंटिक टास्क में" बेहतर प्रदर्शन देता है।
मल्टी-स्टेप काम करने वाले किसी भी व्यक्ति के लिए अगला वाक्य सबसे महत्वपूर्ण है। Qwen3.8 को "जटिल, मल्टी-स्टेप टास्क को अधिक विश्वसनीयता के साथ पूरा करने के लिए डिज़ाइन किया गया है।"
27B मॉडल वह मॉडल है जिसे अधिकांश लोग लोकली चलाएंगे। इसका मॉडल कार्ड सटीक आंकड़े देता है: 27B पैरामीटर्स, 64 लेयर्स, हिडन डायमेंशन 5120, और Gated DeltaNet और Gated Attention ब्लॉक्स का एक हाइब्रिड लेआउट।
कॉन्टेक्स्ट लेंथ (context length) नेटिव रूप से 262,144 टोकन है और इसे 1,000,000 तक बढ़ाया जा सकता है। मॉडल कार्ड पर दर्ज लाइसेंस apache-2.0 है।
इन दोनों रिलीज़ एंट्रीज़ के अंतर को स्पष्ट रूप से समझना ज़रूरी है। 2.4T-A95B mixture-of-experts मॉडल 2026-08-12 को आया था, और इसके बाद 27B dense मॉडल 2026-08-14 को आया। केवल दूसरे वाले को ही खुद से होस्ट (self-host) करना व्यावहारिक है।
| तथ्य | Qwen3.8-27B |
|---|---|
| रिलीज़ की तारीख | 2026-08-14 |
| पैरामीटर्स | 27B dense |
| लेयर्स | 64 |
| कॉन्टेक्स्ट | 262,144 नेटिव, 1,000,000 तक विस्तार योग्य |
| लाइसेंस | apache-2.0 |
| इनपुट | टेक्स्ट, इमेज, वीडियो |
दोनों आधिकारिक दस्तावेज़ों में कहाँ असहमति है
यह वह हिस्सा है जिसके बारे में लगभग कोई भी बात नहीं करता है, और यह आपके दावों के आधार को बदल देता है।
GitHub README मल्टीमॉडल आर्किटेक्चर का श्रेय Qwen3.5 को देता है, जिस जनरेशन पर Qwen3.8 आधारित है। यदि आप केवल उसी पेज को पढ़ते हैं, तो आप यही निष्कर्ष निकालेंगे कि 27B मॉडल केवल टेक्स्ट-ओनली (text-only) है।
मॉडल कार्ड कुछ और ही कहता है, और वह काफी स्पष्ट है। Qwen3.8-27B "एक नेटिव विज़न-लैंग्वेज मॉडल है जो फ्लेक्सिबल थिंकिंग कंट्रोल के साथ इमेज और वीडियो को समझता है।"
जब दो आधिकारिक स्रोतों में टकराव होता है, तो अधिक विशिष्ट जानकारी देने वाला स्रोत ही सही माना जाता है। मॉडल कार्ड इसी सटीक चेकपॉइंट का वर्णन कर रहा है, इसलिए इसकी मल्टीमॉडल क्षमता वास्तविक है। इस विसंगति के बारे में जानना ज़रूरी है, क्योंकि रिपॉजिटरी (repo) पर सरसरी नज़र डालने से आपको इसके विपरीत जानकारी मिलेगी।
बेंचमार्क टेबल क्या मापती है, और क्या छोड़ देती है
मॉडल कार्ड में Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B, और Opus4.6 Max के साथ तुलना पब्लिश की गई है। इसके कुछ एजेंटिक नंबर्स में बहुत बड़ा उछाल देखने को मिला है।
| बेंचमार्क | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (कंप्यूटर उपयोग) | 84.3 | 63.9 |
| WebArena-Verified (ब्राउज़र उपयोग) | 64.8 | 48.8 |
| AndroidWorld (मोबाइल उपयोग) | 81.9 | 70.3 |
| SWE-bench Pro (कोडिंग) | 61.7 | — |
| MathVision (कोड इंटरप्रेटर के साथ) | 94.6 | 90.3 |
| Vision2Web (विजुअल वेब डेवलपमेंट) | 62.9 | 45.0 |
अब इसका निष्पक्ष विश्लेषण करते हैं। यह टेबल कंप्यूटर उपयोग, ब्राउज़र उपयोग, मोबाइल उपयोग, कोडिंग, विजुअल मैथ्स और वेब डेवलपमेंट को कवर करती है।
यहाँ स्प्रेडशीट पढ़ने, दो एक्सपोर्ट्स का मिलान करने, या टेबुलर डेटा (तालिकाबद्ध डेटा) से रिपोर्ट तैयार करने के लिए कोई बेंचमार्क नहीं है। मजबूत OSWorld स्कोर आपको यह बताते हैं कि मॉडल डेस्कटॉप चला सकता है। वे यह नहीं बताते कि यह आपके रेवेन्यू मिलान (revenue reconciliation) को सही ढंग से कर पाएगा या नहीं।
ओपन रिलीज़ को फॉलो करने वाले पाठकों के लिए एक विवरण पर ध्यान देना ज़रूरी है। Muse Glimmer-30B इस टेबल में तुलना के बिंदु के रूप में दिखाई देता है, और चार दिन पहले इसकी अपनी लॉन्च टेबल में इसकी तुलना Qwen3.6-27B से की गई थी। Muse Glimmer पर हमारे लेख में बताया गया था कि लॉन्च के समय ही इसका पीयर सेट (peer set) एक पीढ़ी पीछे था। यह टेबल उसी कहानी का दूसरा पहलू है।
इसे कैसे चलाएं
README की न्यूज़ एंट्री के अनुसार, वेट्स (weights) Hugging Face Hub और ModelScope पर उपलब्ध हैं। सिंगल मशीन के लिए 27B dense शेप सबसे व्यावहारिक विकल्प है।
अपनी मेमोरी की योजना कॉन्टेक्स्ट लिमिट के बजाय पैरामीटर काउंट के आधार पर बनाएं। 262,144-टोकन विंडो उपलब्ध तो है, लेकिन इसे भरने में इतनी मेमोरी खर्च होती है जो अधिकांश लोकल सेटअप्स में खाली नहीं होती।
एक छोटे कॉन्टेक्स्ट और एक वास्तविक फ़ाइल के साथ शुरुआत करें। एक एक्सपोर्ट लोड करें, एक ऐसा सवाल पूछें जिसका जवाब आपको पहले से पता हो, और किसी भी लंबे काम पर भरोसा करने से पहले उस जवाब की जांच करें।
टेबुलर काम के लिए यह वेरिफिकेशन स्टेप वैकल्पिक नहीं है। कोई मॉडल किसी स्प्रेडशीट का धाराप्रवाह वर्णन कर सकता है और फिर भी यह गलत पढ़ सकता है कि किस कॉलम में टोटल (योग) है। धाराप्रवाह दिए गए गलत जवाबों को पकड़ना स्पष्ट रूप से गलत जवाबों की तुलना में अधिक कठिन होता है।
यदि आपको मिलियन-टोकन विंडो की आवश्यकता है, तो इसे अपने स्वयं के हार्डवेयर बजट के साथ एक अलग काम के रूप में देखें। व्यावहारिक रूप से दोनों कॉन्फ़िगरेशन बहुत अलग तरह से व्यवहार करते हैं, और एक का बेंचमार्किंग करना आपको दूसरे के बारे में बहुत कम जानकारी देता है।
सबसे पहले डिफ़ॉल्ट रीज़निंग एफर्ट (reasoning effort) को बदलें
यहाँ वह सेटिंग दी गई है जो आपकी पहली छाप तय करेगी, और यह मॉडल कार्ड के अपने चैट टेम्पलेट में दिखाई देती है।
टेम्पलेट reasoning_effort को डिफ़ॉल्ट रूप से xhigh पर सेट करता है, जबकि अन्य स्वीकृत मान medium और low हैं। थिंकिंग (सोचने की प्रक्रिया) को पूरी तरह से बंद भी किया जा सकता है।
xhigh डिफ़ॉल्ट का मतलब है कि मॉडल उन सवालों पर भी विस्तार से विचार करेगा जिन्हें इसकी आवश्यकता नहीं है। एक छोटी CSV फ़ाइल में एक-लाइन के लुकअप के लिए, यह ऐसा लगेगा कि मॉडल सावधान होने के बजाय धीमा है।
इसलिए सबसे पहले ट्यून करने वाली चीज़ प्रॉम्प्ट नहीं है। सामान्य सवालों के लिए एफर्ट को घटाकर medium या low कर दें, और xhigh को केवल उन मल्टी-स्टेप कामों के लिए बचाकर रखें जिनके बारे में वास्तव में रिलीज़ नोट में बात की गई है।
डेटा वर्कफ़्लो में यह कहाँ फिट बैठता है
एक ओपन-वेट मॉडल जिसे आप खुद होस्ट करते हैं, वह एक विशिष्ट समस्या का समाधान करता है, और वह यह है कि डेटा कभी भी आपके कंप्यूटर से बाहर नहीं जाता है। रेगुलेटेड या संवेदनशील फ़ाइलों के लिए यही सबसे बड़ा तर्क है, और कोई भी होस्टेड सुविधा इसकी जगह नहीं ले सकती।
इस विकल्प के बारे में बाकी सब कुछ एक समझौता (trade-off) है। आप उस एक गारंटी के बदले में हार्डवेयर, अपडेट और क्वांटाइजेशन (quantisation) के फैसलों की ज़िम्मेदारी ले रहे हैं।
जो चीज़ यह हल नहीं करता है, वह है मॉडल के आस-पास का सारा काम। कॉलम प्रोफाइलिंग, दो एक्सपोर्ट्स को जोड़ना, रीनेम किए गए फ़ील्ड को पकड़ना, चार्ट रेंडर करना और दस्तावेज़ तैयार करना, ये सभी अलग-अलग काम हैं।
इसी अंतर के कारण प्रोटोकॉल और टूलिंग लेयर्स मौजूद हैं। MCP क्या है पर हमारा एक्सप्लेनर उस स्टैंडर्ड को कवर करता है जो मॉडल्स को टूल्स से जोड़ता है। डेटा कनेक्टर्स पेज दिखाता है कि एक फ़ाइल-फ़र्स्ट पाइपलाइन इनपुट के रूप में क्या उम्मीद करती है।
विकल्प
यदि आवश्यकता लोकल और ओपन की है, तो Qwen3.8-27B और Muse Glimmer-30B एक ही साइज़ क्लास में दो वर्तमान उम्मीदवार हैं। दोनों अपने वेट्स पब्लिश करते हैं और दोनों एक ही मशीन पर चलते हैं।
यदि आवश्यकता किसी मॉडल एंडपॉइंट के बजाय किसी फ़ाइल से तैयार आर्टिफैक्ट (finished artifact) प्राप्त करने की है, तो टूल का स्वरूप अलग होता है। Powerdrill Bloom स्प्रेडशीट लेता है, कॉलम को प्रोफाइल करता है, और चार्ट, रिपोर्ट या डेक प्रदान करता है।
Qwen की तरफ से तुलना करने के लिए कोई प्राइसिंग उपलब्ध नहीं है। इस मॉडल के लिए कोई आधिकारिक Qwen प्राइसिंग पेज उपलब्ध नहीं था, इसलिए इस लेख में कोई आंकड़े उद्धृत नहीं किए गए हैं।
यदि आपका वास्तविक काम एक फ़ाइल है जिसे रिपोर्ट में बदलना है, तो सीधे उस पर Powerdrill Bloom आज़माएं। हमारा गाइड भी देखें जो सब्सक्रिप्शन एक्सपोर्ट को MRR और ARR रिपोर्ट में बदलने के बारे में है, और CSV AI असिस्टेंट पेज देखें।
निष्कर्ष
Qwen3.8-27B एक 27B dense मॉडल है जिसमें 262,144-टोकन नेटिव कॉन्टेक्स्ट, apache-2.0 वेट्स और डॉक्यूमेंटेड इमेज व वीडियो इनपुट शामिल हैं। Qwen3.6-27B की तुलना में इसके एजेंटिक प्रदर्शन में काफी बड़ा उछाल आया है।
इसके साथ दो चेतावनियाँ (caveats) भी जुड़ी हैं। रिपॉजिटरी (repo) और मॉडल कार्ड मल्टीमोडैलिटी पर असहमत हैं, और पब्लिश किए गए बेंचमार्क टेबुलर काम के बजाय डेस्कटॉप, ब्राउज़र, कोडिंग और विजुअल टास्क को कवर करते हैं।
इसका मूल्यांकन करने से पहले reasoning_effort सेट करें। डिफ़ॉल्ट रूप से यह xhigh पर सेट होता है, और यह डिफ़ॉल्ट सेटिंग अधिकांश सवालों की आवश्यकता से अधिक सोचने की प्रक्रिया (thinking) का उपयोग करती है।
अक्सर पूछे जाने वाले प्रश्न
Qwen3.8 कब रिलीज़ हुआ था?
README की न्यूज़ एंट्रीज़ के अनुसार, Qwen3.8-27B को 2026-08-14 को और Qwen3.8-2.4T-A95B को 2026-08-12 को रिलीज़ किया गया था, और दोनों ही Hugging Face Hub और ModelScope पर उपलब्ध हैं।
क्या Qwen3.8-27B मल्टीमॉडल है?
हाँ, इसके मॉडल कार्ड के अनुसार, जो इसे एक नेटिव विज़न-लैंग्वेज मॉडल के रूप में वर्णित करता है जो इमेज और वीडियो को समझता है। ध्यान दें कि GitHub README मल्टीमॉडल आर्किटेक्चर का श्रेय Qwen3.5 को देता है।
यह किस कॉन्टेक्स्ट लेंथ (context length) को सपोर्ट करता है?
मॉडल कार्ड के अनुसार यह नेटिव रूप से 262,144 टोकन सपोर्ट करता है, जिसे 1,000,000 तक बढ़ाया जा सकता है। अधिकतम सीमा के करीब इसे चलाने के लिए सामान्य लोकल सेटअप की तुलना में बहुत अधिक मेमोरी की आवश्यकता होती है।
सरल प्रश्नों पर यह धीमा क्यों महसूस होता है?
चैट टेम्पलेट डिफ़ॉल्ट रूप से reasoning_effort को xhigh पर सेट करता है। सामान्य लुकअप के लिए इसे घटाकर medium या low कर दें और xhigh को केवल वास्तविक मल्टी-स्टेप टास्क के लिए बचाकर रखें।
क्या बेंचमार्क स्प्रेडशीट के काम के बारे में कुछ बताते हैं?
नहीं। पब्लिश की गई टेबल कंप्यूटर उपयोग, ब्राउज़र उपयोग, मोबाइल उपयोग, कोडिंग, विजुअल मैथ्स और वेब डेवलपमेंट को कवर करती है, जिसमें टेबुलर एनालिसिस (तालिकाबद्ध विश्लेषण) या रिपोर्ट जनरेशन के लिए कोई बेंचमार्क नहीं है।