Super Sale WeekClaude Skills — 20% OFF
Tips

बिना किसी सांख्यिकीविद् के A/B टेस्ट के परिणामों का विश्लेषण कैसे करें (2026 गाइड)

Powerdrill Team·
बिना किसी सांख्यिकीविद् के A/B टेस्ट के परिणामों का विश्लेषण कैसे करें (2026 गाइड)

A/B test के परिणामों का विश्लेषण करने के लिए, एक प्राथमिक मीट्रिक पर दोनों समूहों की तुलना करें। जांचें कि क्या यह अंतर सामान्य रैंडम वेरिएशन से बड़ा है, फिर उस रेंज को बताएं जिसमें वास्तविक अंतर आ सकता है। Excel यह गणना कर सकता है। इसके इर्द-गिर्द लिए जाने वाले निर्णय ही आमतौर पर गलत साबित होते हैं।

यह गाइड बताती है कि आंकड़ों को देखने से पहले आपको क्या जुटाना चाहिए और टेस्ट को मैन्युअल रूप से कैसे चलाना चाहिए। यह यह भी बताती है कि मैन्युअल तरीका कहाँ रुक जाता है, और आउटपुट को ईमानदारी से कैसे पढ़ा जाए।

टेस्ट को पढ़ने से पहले आपको किन चीज़ों की आवश्यकता है

चार चीजें यह तय करती हैं कि किसी परिणाम का कोई मतलब है या नहीं। उन्हें सबसे पहले इकट्ठा करें।

एक प्राथमिक मीट्रिक, जिसे टेस्ट चलाने से पहले चुना गया हो। कन्वर्श़न रेट, रेवेन्यू प्रति विज़िटर, या एक्टिवेशन रेट। इसे पहले से ही चुनें। डेटा देखने के बाद इसे चुनना ही वह तरीका है जिससे टीमें खुद को जीत का भरोसा दिलाती हैं।

केवल प्रतिशत ही नहीं, बल्कि वास्तविक संख्या (raw counts)। 200 विज़िटर्स पर 3% की बढ़त का एक मतलब होता है और 200,000 पर इसका बहुत अलग मतलब होता है। आपको हर (denominators) की आवश्यकता होती है।

पूरी टेस्ट अवधि (test window)। आंशिक सप्ताह परिणामों को प्रभावित कर सकते हैं, क्योंकि कार्यदिवसों (weekdays) और सप्ताहांत (weekends) का व्यवहार अलग होता है। पूरे सप्ताह टेस्ट चलाएं।

क्या बदलाव किया गया, इसका रिकॉर्ड। प्रति टेस्ट एक वेरिएबल। यदि आपने हेडलाइन और बटन का रंग एक साथ बदल दिया, तो कोई भी आँकड़ा उन्हें अलग नहीं कर पाएगा।

यदि इन चारों में से कोई भी गायब है, तो गणना करने से पहले रुक जाएं। किसी त्रुटिपूर्ण टेस्ट पर की गई सटीक गणना भी पूरे आत्मविश्वास के साथ गलत उत्तर ही देगी।

वे दो प्रश्न जिनका उत्तर हर A/B test देता है

हर परिणाम दो सवालों पर आकर टिकता है, और इनमें भ्रमित होना आसान है।

क्या अंतर वास्तविक है? यह सार्थकता (significance) का प्रश्न है। यह पूछता है कि यदि दोनों वर्श़न वास्तव में एक जैसा प्रदर्शन करते, तो इतना बड़ा अंतर होने की कितनी संभावना होती। एक p-value इसका उत्तर देता है। सामान्य नियम यह है कि 0.05 से कम को कार्रवाई करने के लिए पर्याप्त माना जाता है।

क्या अंतर इतना बड़ा है कि मायने रखे? यह प्रभाव के आकार (effect size) का प्रश्न है। एक कॉन्फिडेंस इंटरवल (confidence interval) वास्तविक अंतर की संभावित रेंज देकर इसका उत्तर देता है। सांख्यिकीय रूप से वास्तविक 0.2% की बढ़त भी इंजीनियरिंग लागत के लायक नहीं हो सकती है।

ऐसा टेस्ट जो महत्वपूर्ण (significant) तो है लेकिन बहुत छोटा है, एक आम और महंगी गलतफहमी है। दोनों सवालों के जवाब इसी क्रम में दें। दोनों नंबरों को एक साथ रिपोर्ट करें, क्योंकि जो टीम केवल p-value सुनती है, वह हर महत्वपूर्ण परिणाम को लागू करने योग्य मान लेती है।

Excel में मैन्युअल तरीका

Excel इसे मूल रूप से संभालता है। तरीका इस बात पर निर्भर करता है कि आप किस तरह के मीट्रिक का परीक्षण कर रहे हैं।

दोनों समूहों को अगल-बगल रखें

प्रति वैरिएंट एक कॉलम रखें। रेवेन्यू प्रति विज़िटर जैसे निरंतर मीट्रिक (continuous metric) के लिए, प्रत्येक पंक्ति एक विज़िटर का मान होती है। कन्वर्श़न के लिए, प्रत्येक पंक्ति 1 या 0 होती है। सारांश के बजाय मूल पंक्तियों को रखें, क्योंकि फ़ार्मुलों को अंतर्निहित प्रसार (underlying spread) की आवश्यकता होती है।

Use T.TEST for a continuous metric

T.TEST(array1, array2, tails, type) स्टूडेंट के t-test से जुड़ी संभावना (probability) देता है। जब तक आपने पहले से यह तय न किया हो कि केवल एक ही दिशा मायने रखती है, तब तक tails = 2 का उपयोग करें। type के लिए, पेयर्ड सैंपल (paired samples) के लिए 1 का उपयोग करें, जब दोनों समूहों में समान वेरिएंस (equal variance) हो तो 2 का उपयोग करें, और जब ऐसा न हो तो 3 का उपयोग करें। अधिकांश वेब टेस्ट के लिए टू-सैंपल असमान वेरिएंस (two-sample unequal variance) अधिक सुरक्षित डिफ़ॉल्ट विकल्प है।

यह फ़ॉर्मूला सीधे p-value देता है। Microsoft का T.TEST फ़ंक्शन पेज इसके तर्कों (arguments) का विवरण देता है।

कन्वर्श़न रेट को अलग तरह से संभालें

कन्वर्श़न एक अनुपात (proportion) है, न कि एक निरंतर माप (continuous measure)। इसके लिए मानक तरीका टू-प्रोपॉर्शन z-test (two-proportion z-test) है, और Excel में इसके लिए कोई एकल फ़ंक्शन नहीं है। आपके पास दो व्यावहारिक विकल्प हैं।

पूल्ड प्रोपॉर्शन (pooled proportion) और स्टैंडर्ड एरर (standard error) से मैन्युअल रूप से z-test बनाएं, फिर NORM.S.DIST के साथ स्कोर को p-value में बदलें। या फिर वैरिएंट के अनुसार कनवर्टेड और नॉन-कनवर्टेड की संख्या को टू-बाय-टू (two-by-two) टेबल के रूप में रखें। अपेक्षित संख्या (expected counts) की गणना करें, फिर p-value प्राप्त करने के लिए CHISQ.TEST का उपयोग करें।

दोनों काम करते हैं। लेकिन हर बार टेस्ट का ढांचा बदलने पर इन्हें फिर से बनाना पड़ता है।

मैन्युअल तरीका कहाँ काम नहीं आता

तीन चीजें इसे निश्चित रूप से प्रभावित करती हैं।

केवल p-value आपको बढ़त (lift) का आकार नहीं बताता है, इसलिए आपको अभी भी एक अलग कॉन्फिडेंस इंटरवल गणना की आवश्यकता होती है। कई मीट्रिक्स आपके फॉल्स-पॉजिटिव (false-positive) रेट को बढ़ा देते हैं, और शीट में ऐसा कुछ भी नहीं है जो आपको इसके बारे में सचेत करे। और हर नए टेस्ट का मतलब है अलग तरह के एक्सपोर्ट के लिए उन्हीं फ़ार्मुलों को फिर से बनाना।

एक चौथी लागत भी है जिसे नजरअंदाज करना आसान है। जिसने शीट बनाई है, वही एकमात्र व्यक्ति बन जाता है जो इसकी जांच कर सकता है।

एक टेस्ट के लिए, मैन्युअल तरीका ठीक है। लेकिन साप्ताहिक टेस्टिंग प्रोग्राम के लिए, आप साल में पचास बार एक ही शीट को फिर से बना रहे होते हैं।

Powerdrill Bloom के साथ A/B test के परिणामों का विश्लेषण कैसे करें

यदि आपका टेस्ट डेटा पहले से ही एक्सपोर्ट फ़ाइल में है, तो आप फ़ॉर्मूला बनाने की प्रक्रिया को छोड़ सकते हैं।

चरण 1: अपना टेस्ट डेटा अपलोड करें

अपने टेस्टिंग टूल या डेटाबेस से Excel, CSV, या TSV एक्सपोर्ट को यहाँ डालें। कई फाइलें एक साथ लोड हो जाती हैं, इसलिए एक इवेंट्स फाइल और एक यूजर्स फाइल की तुलना एक ही बार में की जा सकती है। अपलोड करने पर कॉलम डिटेक्शन और क्लीनअप अपने आप चल जाते हैं।

सार्थकता विश्लेषण (significance analysis) के लिए Powerdrill Bloom में A/B test परिणाम अपलोड करना

चरण 2: प्राकृतिक भाषा (natural language) में तुलना का वर्णन करें

सवाल को उसी तरह पूछें जैसे आप किसी सहकर्मी से पूछेंगे। उदाहरण के लिए: "वैरिएंट A और B के बीच कन्वर्श़न की तुलना करें, मुझे बताएं कि क्या अंतर महत्वपूर्ण है, और मुझे कॉन्फिडेंस इंटरवल दें।" एजेंट मीट्रिक प्रकार के लिए उपयुक्त टेस्ट चुनता है, p-value और इंटरवल की रिपोर्ट करता है, और बताता है कि उसने किस टेस्ट का उपयोग किया। सेगमेंट ब्रेकडाउन के लिए कहें और यह आपको फिर से सब कुछ बनाने के बजाय इसे दोबारा चला देगा।

चरण 3: चार्ट, रिपोर्ट या डेक एक्सपोर्ट करें

परिणाम को चार्ट के रूप में बाहर निकालें, इसे लिखित सारांश में शामिल करें, या रीडआउट के लिए कैनवास को स्लाइड्स में बदलें। Professional, Business, और Fancy स्टाइल सभी PowerPoint या Notion में एक्सपोर्ट होते हैं। विज़ुअल पक्ष के लिए, डेटा विज़ुअलाइज़ेशन टूल उसी अपलोड से उपलब्ध अन्य चार्ट प्रकारों को कवर करता है।

Powerdrill Bloom में एक स्लाइड डेक में A/B test रीडआउट एक्सपोर्ट करना

बिना किसी बढ़ा-चढ़ाकर किए गए दावे के आउटपुट को कैसे पढ़ें

आप क्या देखते हैं इसका क्या अर्थ है इसका क्या अर्थ नहीं है
p = 0.03 वास्तविक अंतर न होने की स्थिति में इतना बड़ा अंतर होना असंभव है इसका मतलब यह नहीं है कि B के बेहतर होने की 97% संभावना है
p = 0.20 निर्णय लेने के लिए पर्याप्त प्रमाण नहीं हैं यह इस बात का प्रमाण नहीं है कि दोनों वर्श़न बिल्कुल समान हैं
इंटरवल −1% से +6% वास्तविक बढ़त नकारात्मक (negative) भी हो सकती है यह 2.5% की बढ़त नहीं है, भले ही वह मध्य बिंदु (midpoint) हो
महत्वपूर्ण (Significant) लेकिन केवल 0.2% की बढ़त वास्तविक है, और शायद लागू करने (shipping) के लायक नहीं है यह अपने आप में कोई व्यावसायिक जीत नहीं है
आठ में से एक मीट्रिक पर महत्वपूर्ण यह लगभग वैसा ही है जो केवल संयोग से उत्पन्न होता है यह कोई खोज नहीं है

राउंड ऑफ (Round off) भी ईमानदारी से करें। दो दशमलव स्थानों तक बढ़त की रिपोर्ट करना उस सटीकता को दर्शाता है जिसका सैंपल साइज समर्थन नहीं करता है।

निष्कर्ष को एक वाक्य के रूप में लिखें जिसमें एक रेंज शामिल हो। "वैरिएंट B ने कन्वर्श़न को 1% और 5% के बीच बढ़ाया" कहना ईमानदारी भरा है। "वैरिएंट B जीत गया" कहना सही नहीं है, जब तक कि पूरा इंटरवल शून्य से ऊपर न हो।

सामान्य गलतियाँ

टेस्ट को पहली बार महत्वपूर्ण दिखने पर ही रोक देना। बार-बार जांच करना और पहले अच्छे अवसर पर ही रोक देना फॉल्स-पॉजिटिव को बहुत बढ़ा देता है। सैंपल साइज और समाप्ति तिथि पहले से तय करें, फिर प्रतीक्षा करें।

आठ मीट्रिक्स का परीक्षण करना और विजेता की रिपोर्ट करना। पर्याप्त मीट्रिक्स होने पर, कोई न कोई मीट्रिक संयोग से 0.05 को पार कर ही जाएगा। प्राथमिक मीट्रिक का नाम पहले ही तय करें और बाकी को संदर्भ के रूप में लें।

हर (denominator) की उपेक्षा करना। छोटे सैंपल प्रतिशत में नाटकीय बदलाव दिखाते हैं। हमेशा दरों (rates) के बगल में संख्या (counts) भी दिखाएं।

परिणाम आने के बाद तब तक सेगमेंट करना जब तक कि कुछ काम न कर जाए। डिवाइस, देश और चैनल के आधार पर तब तक टुकड़े करना जब तक कि कोई एक टुकड़ा महत्वपूर्ण न हो जाए, यह एक ही समस्या का दूसरा रूप है। जिन सेगमेंट्स की आपको परवाह है, उन्हें पहले से पंजीकृत (pre-register) करें।

ऐसे समूहों की तुलना करना जो कभी तुलनीय थे ही नहीं। यदि ट्रैफ़िक असमान रूप से विभाजित था, या वैरिएंट अलग-अलग दिनों में चलाए गए थे, तो मापे गए अंतर में वह असंतुलन भी शामिल होगा।

शून्य परिणाम (null result) को विफलता मानना। ऐसा टेस्ट जो कोई अंतर नहीं दिखाता, वह भी वास्तविक जानकारी है। यह आपको ऐसे बदलाव को लागू करने से बचाता है जिसमें मेहनत लगती है और हासिल कुछ नहीं होता।

संक्षेप में

A/B test के परिणामों का विश्लेषण दो उत्तरों पर निर्भर करता है: क्या अंतर वास्तविक है, और क्या यह इतना बड़ा है कि मायने रखे। Excel आपको T.TEST के साथ पहला उत्तर देता है और आपको दूसरे को खुद तैयार करने के लिए कहता है। प्रोपॉर्शन (Proportions) के लिए निरंतर मीट्रिक्स की तुलना में एक अलग टेस्ट की आवश्यकता होती है, और यही वह चरण है जिसे अधिकांश लोग छोड़ देते हैं।

यदि आप नियमित रूप से टेस्ट चलाते हैं, तो बार-बार शीट बनाना वह हिस्सा है जिसे हटाया जाना चाहिए। Powerdrill Bloom को मुफ्त में आज़माएं — एक्सपोर्ट अपलोड करें, प्राकृतिक भाषा में तुलना के लिए कहें, और रीडआउट एक्सपोर्ट करें। टूल विकल्पों के लिए, A/B test विश्लेषण के लिए AI टूल देखें, और बुनियादी काम के लिए, वर्णनात्मक आँकड़े (descriptive statistics) कैसे चलाएं देखें।

अक्सर पूछे जाने वाले प्रश्न

मुझे कैसे पता चलेगा कि मेरे A/B test के परिणाम महत्वपूर्ण (significant) हैं?

अपने प्राथमिक मीट्रिक पर दोनों समूहों की तुलना करें और p-value की गणना करें। 0.05 से नीचे का मान आमतौर पर यह मानने की सीमा है कि अंतर संयोगवश नहीं है। इसे कॉन्फिडेंस इंटरवल के साथ जोड़ें, क्योंकि केवल सार्थकता (significance) यह नहीं बताती कि अंतर कितना बड़ा है।

क्या मैं Excel में A/B test के परिणामों का विश्लेषण कर सकता हूँ?

हाँ। रेवेन्यू प्रति विज़िटर जैसे निरंतर मीट्रिक्स के लिए T.TEST का उपयोग करें। कन्वर्श़न रेट प्रोपॉर्शन (proportions) होते हैं, इसलिए उन्हें टू-प्रोपॉर्शन z-test या संख्याओं की टू-बाय-टू टेबल पर काई-स्क्वायर टेस्ट (chi-square test) की आवश्यकता होती है। टू-प्रोपॉर्शन टेस्ट के लिए Excel में कोई एकल इन-बिल्ट फ़ंक्शन नहीं है।

A/B test के लिए मुझे किस सैंपल साइज की आवश्यकता है?

यह आपकी बेसलाइन दर और पता लगाने योग्य सबसे छोटी बढ़त पर निर्भर करता है। छोटी अपेक्षित बढ़त के लिए बहुत बड़े सैंपल की आवश्यकता होती है। लॉन्च करने से पहले लक्ष्य की गणना करें, फिर परिणाम अच्छा दिखने पर रोकने के बजाय उस संख्या तक टेस्ट चलाएं।

वास्तव में p-value मुझे क्या बताता है?

यह इस बात की संभावना देता है कि यदि दोनों वर्श़न वास्तव में एक जैसा प्रदर्शन करते, तो कम से कम इतना बड़ा अंतर दिखाई देता। कम p-value का मतलब है कि संयोग इसकी वजह होने की संभावना कम है। यह इस बात की संभावना नहीं है कि आपका वैरिएंट बेहतर है।

मेरे A/B test में कोई अंतर क्यों नहीं दिखा?

इसके तीन सामान्य कारण हैं। सैंपल प्रभाव का पता लगाने के लिए बहुत छोटा था, बदलाव व्यवहार को बदलने के लिए बहुत सूक्ष्म था, या वास्तव में कोई अंतर नहीं है। शून्य परिणाम (null result) एक वास्तविक खोज है, और यह आपको कुछ ऐसा लागू करने से बचाता है जिससे कोई लाभ नहीं मिलता।