बिना कोड लिखे डेटासेट में आउटलायर्स (Outliers) कैसे खोजें (2026 गाइड)

आप बिना कोड लिखे IQR नियम, z-scores, या box plot का उपयोग करके outliers का पता लगा सकते हैं — ये तीनों spreadsheet में काम करते हैं। IQR नियम quartiles से 1.5 interquartile ranges से अधिक दूरी वाले मानों को चिह्नित करता है; z-scores mean से तीन standard deviations से अधिक दूरी वाले मानों को चिह्नित करते हैं। वे अक्सर असहमत होते हैं, और यह जानना ही असली कौशल है कि ऐसा क्यों होता है।
Outlier का पता लगाना तो आसान काम है। उसके साथ क्या करना है, यह तय करना वह हिस्सा है जो यह निर्धारित करता है कि आपका विश्लेषण ईमानदार है या नहीं, और कोई भी तरीका आपके लिए इसका उत्तर नहीं दे सकता।
यह गाइड बताती है कि दोनों मानक तरीके आपस में असहमत क्यों होते हैं और बिना कोड के outliers का पता लगाने के तीन तरीके क्या हैं। इसके बाद, यह इस बात पर चर्चा करती है कि यह कैसे तय किया जाए कि किसी दिए गए outlier को हटाया जाना चाहिए, रखा जाना चाहिए या अलग से रिपोर्ट किया जाना चाहिए।
Outliers को "बस हटा देने" से कहीं अधिक कठिन क्यों माना जाता है
दोनों मानक तरीके जानबूझकर अलग तरह से काम करने के लिए बनाए गए हैं
IQR नियम quartiles के आधार पर काम करता है, जो स्थितिगत (positional) होते हैं। इसे इस बात से कोई फर्क नहीं पड़ता कि कोई मान कितना चरम (extreme) है, बल्कि केवल इस बात से फर्क पड़ता है कि वह क्रमबद्ध क्रम (sorted order) में कहाँ स्थित है। यही बात इसे उन्हीं outliers द्वारा विकृत होने से बचाती है जिनकी यह तलाश कर रहा है।
Z-scores mean और standard deviation के आधार पर काम करते हैं, और ये दोनों ही चरम मानों (extreme values) से प्रभावित होते हैं। एक बहुत बड़ा मान standard deviation को बढ़ा देता है, जिससे प्रत्येक z-score सिकुड़ जाता है — जिसमें उसका अपना z-score भी शामिल है। एक छोटे dataset पर, एक अकेला बड़ा outlier इस तरह खुद को छिपा सकता है।
यही कारण है कि एक ही कॉलम IQR के तहत चार outliers और z-scores के तहत एक outlier दिखा सकता है। ये तरीके असंगत नहीं हैं; वे अलग-अलग चीजों को मापते हैं।
यह निर्णय सांख्यिकीय नहीं है
$200 के ऑर्डर्स वाली फ़ाइल में $2 million का लेन-देन हर तरीके से चिह्नित (flag) हो जाएगा। इसे हटाया जाना चाहिए या नहीं, यह उन तथ्यों पर निर्भर करता है जिन तक किसी भी तरीके की पहुँच नहीं होती है।
यदि यह गलत दशमलव (decimal) वाली डेटा-एंट्री की गलती है, तो इसे हटा दें। यदि यह एक वास्तविक एंटरप्राइज़ डील है, तो इसे हटाने से आपके विश्लेषण से आपका सबसे महत्वपूर्ण ग्राहक हट जाएगा। यदि यह एक टेस्ट ट्रांजेक्शन है जिसे कोई हटाना भूल गया है, तो इसे हटा दें और अन्य की जांच करें। तीन अलग-अलग कार्रवाइयां, एक जैसा फ्लैग।
वितरण का आकार मान्यताओं को तोड़ता है
दोनों मानक तरीके मानकर चलते हैं कि डेटा का आकार लगभग बेल-शेप (bell-shaped) है। आय (Income), पेज व्यूज, ऑर्डर वैल्यू और सेशन की अवधि आमतौर पर एक लंबी दाईं पूंछ (long right tail) के साथ विषम (skewed) होती है, जहां उच्च मान असाधारण होने के बजाय सामान्य होते हैं।
इस तरह के कॉलम पर z-score नियम लागू करने से आप पूरी तरह से सामान्य डेटा के एक बड़े हिस्से को चिह्नित कर देंगे। इसका समाधान यह है कि पहले आकार की जांच करें, और इसके बजाय log-transforming या पर्सेंटाइल-आधारित कट (percentile-based cut) का उपयोग करने पर विचार करें।
इससे आपको क्या नुकसान होता है
ऐसे औसत जो किसी का प्रतिनिधित्व नहीं करते। एक अकेला चरम मान (extreme value) mean को इतना बदल सकता है कि वह उस सीमा से बाहर हो जाए जहां आपका अधिकांश डेटा वास्तव में मौजूद है। और निर्णय उसी संख्या के आधार पर ले लिए जाते हैं।
अपठनीय अक्ष वाले चार्ट। बाकी मानों से दस गुना बड़ा एक अकेला मान अन्य सभी चीजों को नीचे एक सपाट रेखा में सिकोड़ देता है। चार्ट तकनीकी रूप से सही होता है लेकिन कुछ भी स्पष्ट नहीं कर पाता।
चुपचाप हटा देना। सबसे बुरा परिणाम तब होता है जब कोई फ़ाइल साझा करने से पहले असुविधाजनक पंक्तियों को चुपचाप हटा देता है। बाद में काम करने वाले किसी भी व्यक्ति को यह नहीं पता चल पाता कि आधार बदल गया है, और परिणाम को दोबारा दोहराया नहीं जा सकता।
बिना कोड के outliers खोजने के तीन तरीके
विकल्प 1: IQR नियम
पहले और तीसरे quartiles प्राप्त करने के लिए QUARTILE का उपयोग करें, फिर interquartile range प्राप्त करने के लिए उन्हें घटाएं। Q1 घटाव 1.5 × IQR से नीचे या Q3 जोड़ 1.5 × IQR से ऊपर की किसी भी चीज़ को चिह्नित करें।
यह एक कारण से डिफ़ॉल्ट है: यह चरम मानों के प्रति प्रतिरोधी है और इसके लिए किसी वितरण धारणा की आवश्यकता नहीं होती है। अत्यधिक विषम (skewed) डेटा पर यह अभी भी दाईं पूंछ को ज़रूरत से ज़्यादा चिह्नित करता है, इसलिए संख्या पर भरोसा करने से पहले आकार की जांच कर लें.
विकल्प 2: Z-scores
STDEV.P के साथ mean और standard deviation की गणना करें, फिर यह गणना करें कि प्रत्येक मान mean से कितने standard deviations दूर है। तीन से अधिक होना सामान्य सीमा (threshold) है।
यह लगभग सममित (symmetric) डेटा पर अच्छी तरह से काम करता है और आपको हाँ-या-ना के फ्लैग के बजाय एक परिमाण (magnitude) देता है, जो रैंकिंग के लिए उपयोगी है। यह छोटे नमूनों और विषम कॉलम पर अविश्वसनीय है।
विकल्प 3: एक box plot
कॉलम को box plot के रूप में प्लॉट करें और whiskers से परे के बिंदुओं को पढ़ें। Excel का box plot उसी 1.5 × IQR नियम का उपयोग करता है, इसलिए परिणाम विकल्प 1 से मेल खाता है। अंतर यह है कि आप एक ही समय में वितरण का आकार भी देख पाते हैं।
यह जांचने का सबसे तेज़ तरीका है कि क्या अन्य दो तरीके उपयुक्त भी हैं या नहीं। यदि बॉक्स एक छोर पर बहुत सटा हुआ है और उसकी पूंछ लंबी है, तो किसी भी थ्रेशोल्ड नियम को संदेह की दृष्टि से देखें।
जहाँ ये तीनों एक ही सीमा पर आकर रुक जाते हैं
प्रत्येक विधि चिह्नित (flagged) पंक्तियों की एक सूची देती है। उनमें से कोई भी आपको यह नहीं बताती कि कौन से फ्लैग त्रुटियां हैं, कौन से वास्तविक चरम मान हैं, और कौन से यह दर्शाते हैं कि कॉलम गंदा होने के बजाय विषम (skewed) है।
इसका उत्तर देने के लिए चिह्नित पंक्तियों को संदर्भ (context) में देखना आवश्यक है। उस पंक्ति में और क्या है। क्या वे एक ही समय अवधि या एक ही स्रोत प्रणाली में केंद्रित हैं। क्या वही ग्राहक बार-बार दिखाई देता है। यह जांच है, गणना नहीं, और वास्तव में समय इसी में लगता है।
Powerdrill Bloom के साथ outliers कैसे खोजें
चरण 1: अपना डेटा अपलोड करें
Excel या CSV फ़ाइल अपलोड करें। Powerdrill Bloom आगमन पर प्रत्येक कॉलम का विश्लेषण करता है, इसलिए आपके द्वारा पता लगाने की विधि चुनने से पहले ही वितरण का आकार और चरम मान दिखाई देने लगते हैं।
चरण 2: प्राकृतिक भाषा में जांच का वर्णन करें
सीधे पूछें: इस कॉलम में 1.5 interquartile ranges से बाहर के मानों को चिह्नित करें, फिर मुझे पूरी पंक्तियाँ दिखाएं ताकि मैं संदर्भ देख सकूं। उन प्रश्नों के साथ आगे बढ़ें जो वास्तव में निर्णय लेने में मदद करते हैं। जैसे कि क्या चिह्नित पंक्तियाँ तिथि या स्रोत के अनुसार केंद्रित हैं, क्या वही पहचानकर्ता दोहराया जाता है, और यदि उन्हें बाहर रखा जाता है तो सारांश आँकड़े कैसे बदलते हैं।
चरण 3: चार्ट, रिपोर्ट या डेक निर्यात करें
box plot, उनके संदर्भ के साथ चिह्नित पंक्तियों की एक तालिका, या एक लिखित नोट निकालें जिसमें यह दर्ज हो कि किन पंक्तियों को बाहर रखा गया था और क्यों।
यह मैन्युअल रूप से पता लगाने की प्रक्रिया से बेहतर क्यों है
| स्प्रेडशीट का तरीका | Powerdrill Bloom | |
|---|---|---|
| IQR और z-score के परिणामों की तुलना करना | दो फॉर्मूला सेट, मैन्युअल मिलान | दोनों के लिए पूछें |
| चिह्नित मान के आस-पास का संदर्भ देखना | फ़िल्टर और स्क्रॉल करें | पंक्ति के साथ वापस मिलता है |
| पहले वितरण के आकार की जांच करना | हिस्टोग्राम बनाएं | अपलोड के समय ही प्रोफाइल हो जाता है |
| बाहर रखने के प्रभाव का परीक्षण करना | शीट की प्रतिलिपि बनाएं | दोनों संस्करणों के लिए पूछें |
आखिरी पंक्ति सबसे अधिक मायने रखती है। किसी संदिग्ध outlier को संभालने का ईमानदार तरीका यह है कि परिणाम को उसके साथ और उसके बिना, दोनों तरह से रिपोर्ट किया जाए। पाठक को यह देखने दें कि क्या निष्कर्ष केवल एक पंक्ति पर निर्भर करता है। स्प्रेडशीट में यह तुलना करने के लिए सब कुछ फिर से बनाना पड़ता है, यही कारण है कि आमतौर पर ऐसा नहीं किया जाता है।
सर्वोत्तम अभ्यास: किसी outlier के साथ क्या करना है यह तय करना
बाहर करने से पहले जांच करें। पूरी पंक्ति को देखें। एक गलत दशमलव, एक टेस्ट रिकॉर्ड और एक वास्तविक बड़ा ग्राहक, एक ही कॉलम में बिल्कुल एक जैसे दिखते हैं।
कभी भी चुपचाप न हटाएं। यदि आप पंक्तियों को बाहर करते हैं, तो परिणाम वाले दस्तावेज़ में ही बताएं कि कितनी पंक्तियाँ और क्यों हटाई गईं। बिना किसी नोट के जिस विश्लेषण का आधार बदल दिया गया हो, उसे दोबारा दोहराया नहीं जा सकता।
महत्वपूर्ण होने पर दोनों संस्करणों की रिपोर्ट करें। यदि कोई निष्कर्ष केवल एक मान के आधार पर बदल जाता है, तो यही वास्तविक खोज है, न कि कोई ऐसी असुविधा जिसे छिपा दिया जाए।
सीमा चुनने से पहले आकार की जांच करें। विषम (Skewed) कॉलमों के लिए पर्सेंटाइल कट्स या log transform की आवश्यकता होती है, न कि z-score नियम की।
क्लस्टर (समूहों) पर नज़र रखें। एक ही तारीख को या एक ही स्रोत से आने वाले कई outliers आमतौर पर पाइपलाइन की समस्या को दर्शाते हैं, न कि वास्तव में असामान्य ग्राहकों को। डेटा को साफ करने और डुप्लिकेट हटाने पर हमारी गाइड इस मामले को कवर करती है।
निष्कर्ष
बिना कोड के outliers खोजना तीन उपकरणों पर निर्भर करता है। IQR नियम एक प्रतिरोधी डिफ़ॉल्ट है, z-scores लगभग सममित (symmetric) डेटा के लिए उपयुक्त हैं जब आप परिमाण जानना चाहते हैं, और एक box plot यह जांचता है कि क्या दोनों में से कोई भी धारणा सही बैठती है। उनके असहमत होने की उम्मीद रखें, और इस असहमति को एक जानकारी के रूप में लें।
वह हिस्सा जिसे कोई भी तरीका कवर नहीं करता, वह है निर्णय लेना। यदि आपका outlier का काम केवल एक चिह्नित कॉलम पर ही रुक जाता है क्योंकि प्रत्येक पंक्ति की जांच करना बहुत धीमा है, तो फ़ाइल पर Powerdrill Bloom आज़माएं। हमारा AI data cleaning पेज, वर्णनात्मक आँकड़े चलाने की गाइड, और CSV को चार्ट में बदलना भी देखें।
अक्सर पूछे जाने वाले प्रश्न
किसी डेटासेट में किसे outlier माना जाता है?
पारंपरिक रूप से, पहले या तीसरे quartile से 1.5 interquartile ranges से परे का मान, या mean से तीन standard deviations से अधिक का मान। ये दोनों नियम कानून के बजाय परंपराएं हैं, और कौन सा सही बैठता है यह इस बात पर निर्भर करता है कि आपका डेटा लगभग सममित है या विषम।
मैं बिना कोड के Excel में outliers कैसे खोजूं?
IQR सीमाएं बनाने और उनके बाहर के मानों को चिह्नित करने के लिए QUARTILE का उपयोग करें, या mean और STDEV.P के साथ z-scores की गणना करें। एक box plot दृश्य रूप से वही IQR परिणाम देता है और साथ ही वितरण का आकार भी दिखाता है।
क्या मुझे अपने विश्लेषण से outliers को हटा देना चाहिए?
केवल यह स्थापित करने के बाद कि उनके पीछे क्या कारण था। डेटा-एंट्री की गलतियाँ और टेस्ट रिकॉर्ड हटा दिए जाने चाहिए; वास्तविक चरम मानों को आमतौर पर नहीं हटाया जाना चाहिए, क्योंकि उन्हें हटाने से वास्तविक जानकारी नष्ट हो जाती है। जब यह संदिग्ध हो, तो परिणाम को दोनों तरीकों से रिपोर्ट करें।
IQR और z-score अलग-अलग मानों को क्यों चिह्नित करते हैं?
IQR quartiles के आधार पर काम करता है, जिसे चरम मान विकृत नहीं कर सकते। Z-scores mean और standard deviation के आधार पर काम करते हैं, जिन्हें चरम मान विकृत कर देते हैं। एक पर्याप्त रूप से बड़ा मान standard deviation को बढ़ा देता है और खुद को छिपा सकता है।
क्या होगा यदि मेरा डेटा बेल-शेप के बजाय विषम (skewed) हो?
मानक सीमाएं आय या ऑर्डर मूल्य जैसे विषम कॉलमों पर लंबी पूंछ को ज़रूरत से ज़्यादा चिह्नित करती हैं। पर्सेंटाइल-आधारित कट का उपयोग करें, या पहले कॉलम को log-transform करें, और कोई भी नियम चुनने से पहले वितरण के आकार की जांच करें।