मार्केट बास्केट एनालिसिस क्या है? मेट्रिक्स, उदाहरण और उपयोग के मामले

मार्केट बास्केट एनालिसिस एक ऐसी विधि है जिससे यह पता लगाया जाता है कि कौन से उत्पाद एक ही लेन-देन (ट्रांजैक्शन) में एक साथ खरीदे जाते हैं। यह ऑर्डर डेटा को स्कैन करके उन आइटम संयोजनों (कॉम्बिनेशन) को ढूंढता है जो सामान्य संभावना से अधिक बार एक साथ दिखाई देते हैं। प्रत्येक पैटर्न को तीन मेट्रिक्स परिभाषित करते हैं: सपोर्ट, कॉन्फिडेंस और लिफ्ट। खुदरा विक्रेता (रिटेलर्स) और ऑनलाइन स्टोर इसका उपयोग क्रॉस-सेलिंग, बंडल और उत्पाद प्लेसमेंट के लिए करते हैं।
यह गाइड बताती है कि यह विधि कैसे काम करती है, प्रत्येक मेट्रिक की गणना कैसे की जाती है और परिणामों को कैसे पढ़ा जाता है। इसमें सामान्य एल्गोरिदम, मुख्य उपयोग के मामले (यूज़ केसेस) और उन सीमाओं को भी शामिल किया गया है जिन्हें किसी नियम पर अमल करने से पहले जानना ज़रूरी है।
मार्केट बास्केट एनालिसिस क्या है
मार्केट बास्केट एनालिसिस के पीछे का मूल विचार बहुत सरल है। हर ऑर्डर आइटमों की एक बास्केट (टोकरी) है। हज़ारों बास्केट में से, कुछ आइटम बार-बार एक साथ दिखाई देते हैं। यह एनालिसिस उन संयोजनों को ढूंढता है और मापता है कि उनमें से प्रत्येक कितना मजबूत है।
इसका परिणाम एसोसिएशन नियमों (association rules) का एक सेट होता है। एक नियम इस तरह पढ़ा जाता है "यदि किसी बास्केट में A है, तो उसमें C होने की भी संभावना है।" A को एंटीसिडेंट (antecedent) कहा जाता है, और C को कॉन्सीक्वेंट (consequent) कहा जाता है। दोनों ही एकल आइटम या आइटमों के समूह हो सकते हैं।
इस काम के लिए व्यापक रूप से उपयोग की जाने वाली Python लाइब्रेरी mlxtend का दस्तावेज़ (डॉक्यूमेंटेशन) इसका एक क्लासिक उदाहरण देता है। यह एक ऐसे नियम का वर्णन करता है जो बताता है "कि जो लोग डायपर खरीदते हैं वे बीयर भी खरीद सकते हैं।" चाहे वह जोड़ी किसी विशेष स्टोर में सही साबित हो या न हो, यह परिणाम के प्रारूप को दर्शाता है।
यह तकनीक एसोसिएशन रूल लर्निंग (association rule learning) नामक एक व्यापक क्षेत्र से संबंधित है। mlxtend के दस्तावेज़ बताते हैं कि Apriori एल्गोरिदम को "लेन-देन वाले डेटाबेस पर काम करने के लिए डिज़ाइन किया गया है, जैसे कि किसी स्टोर के ग्राहकों द्वारा की गई खरीदारी।" रिटेल (खुदरा व्यापार) वह क्षेत्र है जहाँ से इस पद्धति की शुरुआत हुई थी, लेकिन बास्केट से बना कोई भी डेटा इसके लिए काम कर सकता है।
यह कैसे काम करता है
मार्केट बास्केट एनालिसिस दो चरणों में चलता है।
पहला चरण लगातार दिखने वाले आइटमसेट (frequent itemsets) ढूंढता है। आइटमसेट आइटमों का कोई भी समूह होता है, जैसे कि {फ़ोन केस, स्क्रीन प्रोटेक्टर}। इसे तब लगातार दिखने वाला माना जाता है जब यह सभी लेन-देन के कम से कम एक न्यूनतम हिस्से में दिखाई देता है। आप उस न्यूनतम हिस्से को निर्धारित करते हैं, जिसे सपोर्ट थ्रेशोल्ड (support threshold) कहा जाता है।
दूसरा चरण आइटमसेट को नियमों में बदलता है। प्रत्येक लगातार दिखने वाले आइटमसेट के लिए, एल्गोरिदम इसे एक एंटीसिडेंट और एक कॉन्सीक्वेंट में विभाजित करता है और परिणामी नियम को स्कोर देता है। mlxtend के दस्तावेज़ नियम निर्माण (rule generation) को "लगातार दिखने वाले पैटर्न की माइनिंग में एक सामान्य कार्य" के रूप में वर्णित करते हैं।
इनपुट हमेशा एक ही आकार का होता है। प्रत्येक पंक्ति (रो) एक लेन-देन है, और प्रत्येक कॉलम यह दर्शाता है कि कोई आइटम उसमें था या नहीं। अधिकांश ई-कॉमर्स प्लेटफॉर्म से निर्यात (एक्सपोर्ट) किए गए ऑर्डर डेटा को पिवट (pivot) की मदद से इस प्रारूप में बदला जा सकता है।
किसी भी मेट्रिक की गणना करने से पहले तैयारी के तीन विकल्प परिणाम को आकार देते हैं। पहला, यह तय करें कि लेन-देन (ट्रांजैक्शन) क्या है, जो आमतौर पर एक ऑर्डर आईडी (order ID) होती है। दूसरा, मात्रा के बजाय उपस्थिति दर्ज करें, ताकि किसी एक आइटम की तीन इकाइयाँ भी केवल एक ही बार गिनी जाएँ। तीसरा, विवरण का स्तर चुनें। उत्पाद श्रेणियां (product categories) कम और व्यापक नियम देती हैं, जबकि व्यक्तिगत SKU अधिक सटीक नियम देते हैं जिनके लिए अधिक डेटा की आवश्यकता होती है।
तीन मुख्य मेट्रिक्स
प्रत्येक नियम को तीन संख्याएँ मिलती हैं। उन्हें एक साथ पढ़ना ही एक उपयोगी नियम को महज एक संयोग से अलग करता है।
सपोर्ट
सपोर्ट उन सभी लेन-देन का हिस्सा है जिसमें वह आइटमसेट शामिल होता है। यदि 1,000 ऑर्डरों में से 60 में फ़ोन केस और स्क्रीन प्रोटेक्टर दोनों शामिल हैं, तो उस जोड़ी का सपोर्ट 0.06 या 6% है।
सपोर्ट आपको बताता है कि कोई पैटर्न कितना सामान्य है। बहुत कम सपोर्ट वाला नियम वास्तविक हो सकता है लेकिन उस पर कार्रवाई करने के लिए वह बहुत दुर्लभ हो सकता है।
कॉन्फिडेंस
कॉन्फिडेंस इस बात की संभावना है कि बास्केट में पहले से ही एंटीसिडेंट होने पर कॉन्सीक्वेंट भी दिखाई देगा। यह जोड़ी के सपोर्ट को एंटीसिडेंट के सपोर्ट से विभाजित करने के बराबर होता है।
कॉन्फिडेंस की एक दिशा होती है। A से C की ओर जाने का कॉन्फिडेंस आमतौर पर C से A की ओर जाने वाले कॉन्फिडेंस से भिन्न होता है। नीचे दिया गया व्यावहारिक उदाहरण दिखाता है कि ऐसा क्यों है।
लिफ्ट
लिफ्ट जोड़ी की वास्तविक आवृत्ति (फ़्रीक्वेंसी) की तुलना उस स्थिति से करती है जिसकी आप तब उम्मीद करेंगे जब दोनों आइटम असंबंधित हों। यह नियम के कॉन्फिडेंस को कॉन्सीक्वेंट के सपोर्ट से विभाजित करने के बराबर होता.
mlxtend के दस्तावेज़ संदर्भ बिंदु को स्पष्ट रूप से बताते हैं: "यदि A और C स्वतंत्र हैं, तो लिफ्ट स्कोर ठीक 1 होगा।" 1 से अधिक लिफ्ट का मतलब है कि आइटम सामान्य संभावना से अधिक बार एक साथ दिखाई देते हैं। 1 से कम लिफ्ट का मतलब है कि वे एक साथ कम बार दिखाई देते हैं।
एक व्यावहारिक उदाहरण
मान लीजिए कि एक ऑनलाइन इलेक्ट्रॉनिक्स स्टोर में एक महीने में 1,000 ऑर्डर आते हैं।
| माप | मान |
|---|---|
| फ़ोन केस वाले ऑर्डर | 200 |
| स्क्रीन प्रोटेक्टर वाले ऑर्डर | 100 |
| दोनों वाले ऑर्डर | 60 |
| जोड़ी का सपोर्ट | 60 / 1,000 = 0.06 |
| कॉन्फिडेंस, फ़ोन केस से स्क्रीन प्रोटेक्टर | 0.06 / 0.20 = 0.30 |
| कॉन्फिडेंस, स्क्रीन प्रोटेक्टर से फ़ोन केस | 0.06 / 0.10 = 0.60 |
| लिफ्ट | 0.30 / 0.10 = 3.0 |
परिणामों को सरल शब्दों में समझें। फ़ोन केस खरीदने वाले दस में से तीन लोगों ने स्क्रीन प्रोटेक्टर भी खरीदा। स्क्रीन प्रोटेक्टर खरीदने वाले दस में से छह लोगों ने फ़ोन केस भी खरीदा। यह जोड़ी सामान्य संभावना की तुलना में तीन गुना अधिक बार एक साथ दिखाई देती है।
जब पूरी नियम तालिका (रूल टेबल) सामने आए, तो उसे एक निश्चित क्रम में पढ़ें। सबसे मजबूत संबंधों को खोजने के लिए लिफ्ट के अनुसार सॉर्ट करें। अपने न्यूनतम सपोर्ट से नीचे के नियमों को हटा दें, क्योंकि वे कार्रवाई करने के लिए बहुत दुर्लभ हैं। फिर यह तय करने के लिए कॉन्फिडेंस का उपयोग करें कि किस दिशा में सिफारिश (रिकमेंडेशन) की जाए।
दोनों कॉन्फिडेंस आंकड़े अलग-अलग कार्रवाइयों की ओर ले जाते हैं। स्क्रीन प्रोटेक्टर खरीदारों को फ़ोन केस का सुझाव देना अधिक मजबूत सिफारिश है, क्योंकि उनमें से 60% पहले से ही इसे लेते हैं। लिफ्ट दोनों दिशाओं में समान है, यही कारण है कि लिफ्ट स्वयं संबंध की मजबूती का बेहतर माप है।
अन्य महत्वपूर्ण मेट्रिक्स
तीन मुख्य मेट्रिक्स अधिकांश आवश्यकताओं को पूरा करते हैं, लेकिन लाइब्रेरी अन्य मेट्रिक्स भी रिपोर्ट करती हैं जो कमजोर नियमों को छानने (फ़िल्टर करने) में मदद करती हैं।
लेवरेज देखे गए और अपेक्षित सह-अस्तित्व (co-occurrence) के बीच के अंतर को मापता है। mlxtend के दस्तावेज़ देखे गए सह-अस्तित्व की तुलना "उस आवृत्ति से करके इसे परिभाषित करते हैं जिसकी उम्मीद तब की जाती जब A और C स्वतंत्र होते।" 0 लेवरेज का अर्थ स्वतंत्रता है।
कन्विक्शन यह मापता है कि कॉन्सीक्वेंट, एंटीसिडेंट पर कितनी मजबूती से निर्भर करता है। लिफ्ट की तरह, 1 का मान स्वतंत्रता को दर्शाता है। उच्च मानों का अर्थ है कि नियम का उल्लंघन सामान्य संभावना की तुलना में कम बार होता है।
व्यवहार में, अधिकांश टीमें नियमों को लिफ्ट के अनुसार सॉर्ट करती हैं, फिर न्यूनतम सपोर्ट और कॉन्फिडेंस द्वारा फ़िल्टर करती हैं। यह संयोजन उन पैटर्नों को सामने लाता है जो मजबूत हैं, मायने रखने के लिए पर्याप्त रूप से सामान्य हैं और विश्वसनीय हैं।
एल्गोरिदम: Apriori और FP-Growth
Apriori एक क्लासिक एल्गोरिदम है। mlxtend दस्तावेज़ एसोसिएशन नियमों की माइनिंग के लिए तेज़ एल्गोरिदम पर अग्रवाल और श्रीकांत के 1994 के पेपर को इसके स्रोत के रूप में उद्धृत करता है। Apriori स्तर-दर-स्तर आइटमसेट बनाता है और ऐसे किसी भी आइटमसेट को हटा देता है जिसके सबसेट लगातार नहीं दिखाई देते हैं, जिससे खोज प्रबंधनीय बनी रहती है।
FP-Growth एक अलग रास्ते से उन्हीं लगातार दिखने वाले आइटमसेट तक पहुँचता है। mlxtend के दस्तावेज़ इसे "स्थापित Apriori एल्गोरिदम के एक लोकप्रिय विकल्प" के रूप में वर्णित करते हैं। यह एक फ्रीक्वेंट पैटर्न ट्री (frequent pattern tree) बनाता है और इसमें कैंडिडेट जनरेशन (candidate generation) की आवश्यकता नहीं होती है। दस्तावेज़ों का कहना है कि यह इसे "विशेष रूप से बड़े डेटासेट के लिए आकर्षक" बनाता है।
सपोर्ट थ्रेशोल्ड दोनों में एक ही तरह से काम करता है। mlxtend के दस्तावेज़ एक सरल उदाहरण देते हैं: 0.5 के थ्रेशोल्ड पर, एक लगातार दिखने वाले आइटमसेट को सभी लेन-देन के कम से कम आधे हिस्से में दिखाई देना चाहिए। रिटेल थ्रेशोल्ड आमतौर पर बहुत कम होते हैं, क्योंकि लोकप्रिय जोड़ियां भी ऑर्डरों के एक छोटे से हिस्से में ही दिखाई देती हैं।
अधिकांश व्यावसायिक प्रश्नों के लिए, एल्गोरिदम का चुनाव गति (स्पीड) को बदलता है, परिणामों को नहीं। दोनों एक ही सपोर्ट थ्रेशोल्ड के लिए समान आइटमसेट प्रदान करते हैं।
मार्केट बास्केट एनालिसिस का उपयोग किस लिए किया जाता है
मार्केट बास्केट एनालिसिस रिटेल और ई-कॉमर्स में सबसे आम है, लेकिन इसके उपयोग के मामले इससे भी आगे तक फैले हुए हैं।
- क्रॉस-सेलिंग। जब एंटीसिडेंट कार्ट में हो, तो चेकआउट के समय कॉन्सीक्वेंट की सिफारिश करें।
- बंडल। उच्च लिफ्ट वाले आइटमों को एक साथ मिलाकर एक ही ऑफर में पैक करें।
- स्टोर और पेज लेआउट। अक्सर जोड़ी बनाने वाले आइटमों को एक-दूसरे के पास रखें, चाहे वह शेल्फ पर हो या उत्पाद पेज पर।
- इन्वेंट्री प्लानिंग। जोड़ीदार आइटमों को एक साथ स्टॉक करें, ताकि एक की कमी दूसरे की बिक्री को चुपचाप प्रभावित न करे।
- कंटेंट और मीडिया। उपयोगकर्ता सत्र (यूज़र सेशन) को एक बास्केट के रूप में मानें और पता लगाएं कि कौन से लेख या वीडियो एक साथ देखे जाते हैं।
- सेवाएं। बैंकिंग या टेलीकॉम में, प्रत्येक ग्राहक के उत्पादों को एक बास्केट के रूप में मानें और पता लगाएं कि कौन से संयोजन एक साथ चलते हैं।
- अभियान समीक्षा। किसी अभियान (कैंपेन) से पहले और उसके दौरान किसी जोड़ी के लिफ्ट की तुलना करें। लिफ्ट में उछाल यह दर्शाता है कि अभियान ने केवल बिक्री की मात्रा को ही नहीं, बल्कि खरीदारी के व्यवहार को भी बदल दिया है।
प्रत्येक उपयोग का मामला एक ही प्रश्न से शुरू होता है। जब ग्राहक कोई एक चीज़ चुनते हैं, तो वे आमतौर पर और क्या चुनते हैं?
इसके बाद की जाने वाली कार्रवाई कॉन्फिडेंस की दिशा से मेल खानी चाहिए। एक बंडल तब काम करता है जब दोनों आइटम एक साथ चाहिए होते हैं। चेकआउट का सुझाव तब काम करता है जब एक आइटम निश्चित रूप से दूसरे आइटम की ओर ले जाता है।
मार्केट बास्केट एनालिसिस बनाम संबंधित तरीके
मार्केट बास्केट एनालिसिस को अक्सर ग्राहक वर्गीकरण (customer segmentation) और रिकमेंडेशन इंजन के साथ मिला दिया जाता है। नीचे दी गई तालिका दिखाती है कि वे कैसे भिन्न हैं।
| विधि | विश्लेषण की इकाई | मुख्य प्रश्न | सामान्य परिणाम |
|---|---|---|---|
| मार्केट बास्केट एनालिसिस | लेन-देन (Transactions) | कौन से आइटम एक साथ चलते हैं? | सपोर्ट, कॉन्फिडेंस और लिफ्ट के साथ एसोसिएशन नियम |
| ग्राहक वर्गीकरण | ग्राहक | कौन से ग्राहक एक जैसे हैं? | साझा विशेषताओं वाले ग्राहकों के समूह |
| कोलाबोरेटिव फ़िल्टरिंग | ग्राहक और आइटम का इतिहास | इस व्यक्ति को आगे क्या पसंद आएगा? | व्यक्तिगत सिफारिशें |
| कोहोर्ट एनालिसिस | प्रारंभ तिथि के अनुसार समूह | समय के साथ व्यवहार कैसे बदलता है? | रिटेंशन कर्व और तालिकाएं |
ये विधियाँ एक-दूसरे की पूरक हैं। वर्गीकरण (segmentation) आपको बता सकता है कि आपके उच्च-मूल्य वाले ग्राहक कौन हैं, और मार्केट बास्केट एनालिसिस आपको बता सकता है कि वे ग्राहक एक साथ क्या खरीदते हैं। ग्राहक वर्गीकरण रिपोर्ट बनाने की हमारी गाइड पहले भाग को कवर करती है, और कोहोर्ट एनालिसिस पर हमारा स्पष्टीकरण समय के आयाम को कवर करता है।
जानने योग्य सीमाएं
मार्केट बास्केट एनालिसिस से मिलने वाले नियम उपयोगी होते हैं, लेकिन उनका गलत या बढ़ा-चढ़ाकर अर्थ निकालना आसान होता है।
सह-अस्तित्व (Co-occurrence) का मतलब कारण (causation) नहीं है। एक उच्च-लिफ्ट वाली जोड़ी आपको बताती है कि दो आइटम एक साथ खरीदे गए हैं। यह आपको यह नहीं बताता कि एक को खरीदने के कारण ही दूसरा खरीदा गया है।
थ्रेशोल्ड परिणाम को आकार देते हैं। यदि सपोर्ट को बहुत अधिक सेट किया जाता है, तो आप विशिष्ट (निश) लेकिन मूल्यवान जोड़ियों को छोड़ सकते हैं। इसे बहुत कम सेट करने पर आपको हज़ारों नियम मिलेंगे, जिनमें से कई केवल शोर (नॉइज़) होंगे।
दुर्लभ आइटम खो जाते हैं। महीने में कुछ ही बार खरीदा जाने वाला कोई महंगा आइटम कभी भी सपोर्ट थ्रेशोल्ड तक नहीं पहुँच पाता, भले ही उसकी जोड़ियां कितनी भी मजबूत क्यों न हों।
रिटर्न और रद्दीकरण (कैंसिलेशन) बास्केट को विकृत करते हैं। यदि लौटाए गए आइटम डेटा में बने रहते हैं, तो एनालिसिस उन जोड़ियों को भी गिन लेता है जिन्हें ग्राहकों ने वापस कर दिया था। उत्पाद रिटर्न रिपोर्ट पर हमारी गाइड इस बात को कवर करती है कि उस पहलू को अलग से कैसे मापा जाए।
कई जोड़ियों का मतलब कुछ गलत पैटर्न भी हो सकते हैं। 500 आइटमों के कैटलॉग में 100,000 से अधिक संभावित जोड़ियां होती हैं। कुछ केवल संयोग से ही उच्च लिफ्ट दिखा सकती हैं। उन पर कार्रवाई करने से पहले डेटा की दूसरी अवधि पर महत्वपूर्ण नियमों की पुष्टि करें।
समय मायने रखता है। छुट्टियों के मौसम (हॉलिडे सीज़न) के दौरान दिखने वाले पैटर्न वसंत ऋतु (स्प्रिंग) में काम नहीं कर सकते हैं। लेआउट या बंडल बदलने से पहले तुलनात्मक अवधियों पर एनालिसिस चलाएं।
बिना कोड लिखे इसे कैसे चलाएं
क्लासिक तरीका Python है, जिसमें mlxtend जैसी लाइब्रेरी का उपयोग किया जाता है, या जोड़ियों की गिनती के लिए SQL का उपयोग किया जाता है। दोनों के लिए ऑर्डर डेटा को प्रति लेन-देन एक पंक्ति और प्रति आइटम एक कॉलम में बदलना आवश्यक होता है।
एक स्प्रेडशीट इसके छोटे संस्करण को संभाल सकती है। एक पिवट टेबल प्रति आइटम ऑर्डरों की गिनती करती है, और एक COUNTIFS फ़ॉर्मूला जोड़ी में दोनों आइटमों वाले ऑर्डरों की गिनती करता है। इसकी सीमा पैमाना (स्केल) है, क्योंकि कैटलॉग के साथ संभावित जोड़ियों की संख्या तेज़ी से बढ़ती है।
एक AI वर्कस्पेस साधारण ऑर्डर एक्सपोर्ट से डेटा को बदलने और गिनने का काम कर सकता है। Powerdrill Bloom हर प्लान पर Excel और CSV के अपलोड की सुविधा देता है। आप पूछ सकते हैं कि कौन से उत्पाद सबसे अधिक बार एक साथ खरीदे जाते हैं और शीर्ष जोड़ियों के लिए सपोर्ट, कॉन्फिडेंस और लिफ्ट का अनुरोध कर सकते हैं।
व्यापक पैटर्न देखने के लिए श्रेणी-स्तर (category-level) पर इसे चलाने से शुरुआत करें। फिर उन श्रेणियों के लिए SKU स्तर पर दोबारा चलाएं जो सबसे अधिक मायने रखती हैं।
परिणाम की जांच उसी तरह करें जैसे आप किसी स्क्रिप्ट की जांच करते हैं। लेन-देन की संख्या की पुष्टि करें, हाथ से किसी एक जोड़ी की औचक जांच (स्पॉट-चेक) करें, और सुनिश्चित करें कि लौटाए गए ऑर्डरों को बाहर रखा गया था। CSV AI assistant पेज फ़ाइल-प्रथम वर्कफ़्लो को दिखाता है।
यदि आपके पास ऑर्डर एक्सपोर्ट तैयार है, तो आप इस पर Powerdrill Bloom आज़मा सकते हैं और शीर्ष जोड़ियों की तुलना अपनी टीम की अपेक्षाओं से कर सकते हैं।
अक्सर पूछे जाने वाले प्रश्न
सरल शब्दों में मार्केट बास्केट एनालिसिस क्या है?
यह यह पता लगाने का एक तरीका है कि ग्राहक कौन से उत्पाद एक साथ खरीदना पसंद करते हैं। यह कई ऑर्डरों को देखता है और मापता है कि सामान्य संभावना की तुलना में प्रत्येक संयोजन कितनी बार दिखाई देता है।
मार्केट बास्केट एनालिसिस में लिफ्ट क्या है?
लिफ्ट तुलना करती है कि दो आइटम कितनी बार एक साथ दिखाई देते हैं और यदि वे असंबंधित होते तो कितनी बार दिखाई देते। 1 की लिफ्ट का मतलब कोई संबंध नहीं है। 1 से ऊपर का मतलब है कि वे उम्मीद से अधिक बार एक साथ दिखाई देते हैं, और 1 से नीचे का मतलब कम है।
आप सपोर्ट और कॉन्फिडेंस की गणना कैसे करते हैं?
सपोर्ट आइटमसेट वाले लेन-देन की संख्या को सभी लेन-देन से विभाजित करने पर प्राप्त होता है। कॉन्फिडेंस जोड़ी के सपोर्ट को एंटीसिडेंट के सपोर्ट से विभाजित करने पर प्राप्त होता है। दोनों को आमतौर पर दशमलव या प्रतिशत के रूप में दिखाया जाता है।
मार्केट बास्केट एनालिसिस के लिए किस एल्गोरिदम का उपयोग किया जाता है?
Apriori क्लासिक एल्गोरिदम है, और FP-Growth एक सामान्य तेज़ विकल्प है। दोनों लेन-देन डेटा से लगातार दिखने वाले आइटमसेट ढूंढते हैं, और फिर उन आइटमसेट से नियम बनाए जाते हैं और उन्हें स्कोर दिया जाता है।
क्या आप Excel में मार्केट बास्केट एनालिसिस कर सकते हैं?
हाँ, छोटे डेटासेट के लिए। एक पिवट टेबल प्रति आइटम ऑर्डरों की गिनती करती है, और COUNTIFS एक जोड़ी वाले ऑर्डरों की गिनती करता है। बड़े कैटलॉग के लिए, जोड़ियों की संख्या तेज़ी से बढ़ती है, इसलिए एक स्क्रिप्ट या AI टूल अधिक व्यावहारिक है।
स्रोत: mlxtend, Association rules · mlxtend, Apriori. व्यावहारिक उदाहरण में उदाहरणात्मक आंकड़ों का उपयोग किया गया है।