การวิเคราะห์ตะกร้าสินค้า (Market Basket Analysis) คืออะไร? ตัวชี้วัด ตัวอย่าง และกรณีการใช้งาน

การวิเคราะห์ตะกร้าสินค้า (Market basket analysis) เป็นวิธีการค้นหาว่าสินค้าใดบ้างที่มักจะถูกซื้อร่วมกันในธุรกรรมเดียวกัน โดยจะสแกนข้อมูลการสั่งซื้อเพื่อหาการจับคู่สินค้าที่เกิดขึ้นบ่อยกว่าที่คาดเดาโดยบังเอิญ รูปแบบแต่ละแบบจะอธิบายด้วยเกณฑ์ชี้วัดสามตัว ได้แก่ support, confidence และ lift ผู้ค้าปลีกและร้านค้าออนไลน์ใช้วิธีนี้ในการขายพ่วง (cross-selling) การจัดชุดสินค้า (bundles) และการจัดวางสินค้า
คู่มือนี้จะอธิบายวิธีการทำงานของวิธีนี้ วิธีคำนวณเกณฑ์ชี้วัดแต่ละตัว และวิธีอ่านผลลัพธ์ นอกจากนี้ยังครอบคลุมถึงอัลกอริทึมทั่วไป กรณีการใช้งานหลัก และข้อจำกัดที่ควรรู้ก่อนที่คุณจะนำกฎไปใช้งานจริง
การวิเคราะห์ตะกร้าสินค้าคืออะไร
แนวคิดพื้นฐานเบื้องหลังการวิเคราะห์ตะกร้าสินค้านั้นง่ายมาก ทุกคำสั่งซื้อคือตะกร้าสินค้าหนึ่งใบ จากตะกร้าสินค้าหลายพันใบ สินค้าบางรายการมักจะปรากฏร่วมกันอยู่เสมอ การวิเคราะห์นี้จะค้นหาการจับคู่เหล่านั้นและวัดว่าความสัมพันธ์แต่ละคู่นั้นแข็งแกร่งเพียงใด
ผลลัพธ์ที่ได้คือชุดของกฎความสัมพันธ์ (association rules) กฎจะระบุว่า "หากตะกร้าสินค้ามี A ก็มีแนวโน้มที่จะมี C ด้วย" โดยเรียก A ว่าเหตุ (antecedent) และเรียก C ว่าผล (consequent) ซึ่งทั้งสองอย่างนี้อาจเป็นสินค้าชิ้นเดียวหรือกลุ่มของสินค้าก็ได้
เอกสารประกอบของ mlxtend ซึ่งเป็นไลบรารี Python ที่ใช้กันอย่างแพร่หลายสำหรับงานนี้ ได้ยกตัวอย่างสุดคลาสสิกไว้ โดยอธิบายถึงกฎที่เสนอว่า "คนที่ซื้อผ้าอ้อมก็มีแนวโน้มที่จะซื้อเบียร์ด้วยเช่นกัน" ไม่ว่าการจับคู่นั้นจะเกิดขึ้นจริงในร้านค้าใดร้านค้าหนึ่งหรือไม่ แต่มันก็แสดงให้เห็นถึงรูปแบบของผลลัพธ์ที่ได้
เทคนิคนี้อยู่ในสาขาที่กว้างกว่าซึ่งเรียกว่าการเรียนรู้กฎความสัมพันธ์ (association rule learning) เอกสารของ mlxtend ระบุว่าอัลกอริทึม Apriori "ได้รับการออกแบบมาเพื่อทำงานกับฐานข้อมูลที่มีธุรกรรม เช่น การซื้อสินค้าโดยลูกค้าของร้านค้า" ธุรกิจค้าปลีกคือจุดเริ่มต้นของวิธีการนี้ แต่ข้อมูลใดๆ ที่ประกอบขึ้นเป็นตะกร้าสินค้าก็สามารถนำมาใช้ได้เช่นกัน
วิธีการทำงาน
การวิเคราะห์ตะกร้าสินค้าดำเนินการในสองขั้นตอน
ขั้นตอนที่หนึ่งคือการค้นหากลุ่มสินค้าที่พบบ่อย (frequent itemsets) กลุ่มสินค้าคือกลุ่มของสินค้าใดๆ เช่น {เคสโทรศัพท์, ฟิล์มกันรอย} จะถือว่าเป็นกลุ่มสินค้าที่พบบ่อยเมื่อปรากฏในสัดส่วนขั้นต่ำของธุรกรรมทั้งหมด โดยคุณเป็นผู้กำหนดค่าขั้นต่ำนั้น ซึ่งเรียกว่าเกณฑ์สนับสนุน (support threshold)
ขั้นตอนที่สองคือการเปลี่ยนกลุ่มสินค้าให้เป็นกฎ สำหรับกลุ่มสินค้าที่พบบ่อยแต่ละกลุ่ม อัลกอริทึมจะแบ่งกลุ่มสินค้าออกเป็นเหตุและผล และให้คะแนนกฎที่ได้ เอกสารของ mlxtend อธิบายว่าการสร้างกฎเป็น "งานทั่วไปในการทำเหมืองรูปแบบที่พบบ่อย (mining of frequent patterns)"
ข้อมูลนำเข้าจะมีรูปแบบเดียวกันเสมอ โดยแต่ละแถวคือหนึ่งธุรกรรม และแต่ละคอลัมน์จะระบุว่ามีสินค้านั้นอยู่ในธุรกรรมหรือไม่ ข้อมูลการสั่งซื้อที่ส่งออกจากแพลตฟอร์มอีคอมเมิร์ซส่วนใหญ่สามารถปรับให้อยู่ในรูปแบบนี้ได้ด้วยการทำ pivot
ตัวเลือกในการเตรียมข้อมูลสามประการจะกำหนดผลลัพธ์ก่อนที่จะคำนวณเกณฑ์ชี้วัดใดๆ ประการแรก ตัดสินใจว่าธุรกรรมคืออะไร ซึ่งปกติแล้วคือรหัสคำสั่งซื้อหนึ่งรายการ ประการที่สอง บันทึกการมีอยู่แทนที่จะเป็นจำนวน ดังนั้นสินค้าชิ้นเดียวกันสามชิ้นจะยังคงนับเป็นหนึ่งครั้ง ประการที่สาม เลือกระดับของรายละเอียด หมวดหมู่สินค้าจะให้กฎที่กว้างกว่าและมีจำนวนน้อยกว่า ในขณะที่ SKU แต่ละรายการจะให้กฎที่แม่นยำกว่าแต่ต้องการข้อมูลที่มากกว่า
เกณฑ์ชี้วัดหลักสามตัว
ทุกกฎจะได้รับตัวเลขสามตัว การอ่านค่าเหล่านี้ร่วมกันคือสิ่งที่จะช่วยแยกแยะระหว่างกฎที่มีประโยชน์กับการเกิดขึ้นโดยบังเอิญ
Support
Support คือสัดส่วนของธุรกรรมทั้งหมดที่มีกลุ่มสินค้านั้น หากคำสั่งซื้อ 60 จาก 1,000 รายการมีทั้งเคสโทรศัพท์และฟิล์มกันรอย ค่า support ของคู่นั้นคือ 0.06 หรือ 6%
Support จะบอกคุณว่ารูปแบบนั้นเกิดขึ้นบ่อยเพียงใด กฎที่มีค่า support ต่ำมากอาจเกิดขึ้นจริง แต่อาจเกิดขึ้นน้อยเกินกว่าจะนำไปใช้งานจริง
Confidence
Confidence คือความน่าจะเป็นที่จะพบผลลัพธ์ (consequent) เมื่อตะกร้าสินค้ามีเหตุ (antecedent) อยู่แล้ว ซึ่งมีค่าเท่ากับค่า support ของคู่สินค้าหารด้วยค่า support ของเหตุ
Confidence มีทิศทาง โดยค่า confidence ของ A ที่นำไปสู่ C มักจะแตกต่างจาก C ที่นำไปสู่ A ตัวอย่างการคำนวณด้านล่างจะแสดงให้เห็นว่าเพราะเหตุใด
Lift
Lift จะเปรียบเทียบความถี่ที่เกิดขึ้นจริงของคู่สินค้ากับสิ่งที่คุณคาดหวังหากสินค้าทั้งสองรายการไม่มีความเกี่ยวข้องกัน ซึ่งมีค่าเท่ากับค่า confidence ของกฎหารด้วยค่า support ของผลลัพธ์
เอกสารของ mlxtend อธิบายจุดอ้างอิงไว้อย่างชัดเจน: "หาก A และ C เป็นอิสระต่อกัน คะแนน Lift จะเท่ากับ 1 พอดี" ค่า lift ที่มากกว่า 1 หมายความว่าสินค้าปรากฏร่วมกันบ่อยกว่าที่คาดเดาโดยบังเอิญ ส่วนค่า lift ที่น้อยกว่า 1 หมายความว่าสินค้าปรากฏร่วมกันน้อยกว่าที่คาดเดาโดยบังเอิญ
ตัวอย่างการคำนวณ
สมมติว่าร้านค้าอิเล็กทรอนิกส์ออนไลน์แห่งหนึ่งมีคำสั่งซื้อ 1,000 รายการในหนึ่งเดือน
| เกณฑ์ชี้วัด | ค่า |
|---|---|
| คำสั่งซื้อที่มีเคสโทรศัพท์ | 200 |
| คำสั่งซื้อที่มีฟิล์มกันรอย | 100 |
| คำสั่งซื้อที่มีทั้งสองอย่าง | 60 |
| Support ของคู่สินค้า | 60 / 1,000 = 0.06 |
| Confidence, เคสโทรศัพท์ ไปยัง ฟิล์มกันรอย | 0.06 / 0.20 = 0.30 |
| Confidence, ฟิล์มกันรอย ไปยัง เคสโทรศัพท์ | 0.06 / 0.10 = 0.60 |
| Lift | 0.30 / 0.10 = 3.0 |
อ่านผลลัพธ์ในภาษาที่เข้าใจง่าย: ผู้ซื้อเคสโทรศัพท์สามในสิบคนซื้อฟิล์มกันรอยด้วย ผู้ซื้อฟิล์มกันรอยหกในสิบคนซื้อเคสโทรศัพท์ด้วย และสินค้าคู่นี้ปรากฏร่วมกันบ่อยกว่าที่คาดเดาโดยบังเอิญถึงสามเท่า
เมื่อได้ตารางกฎทั้งหมดกลับมา ให้ตรวจสอบตามลำดับขั้นตอน เรียงลำดับตามค่า lift เพื่อค้นหาความเชื่อมโยงที่แข็งแกร่งที่สุด ตัดกฎที่ต่ำกว่าค่า support ขั้นต่ำของคุณออก เนื่องจากเกิดขึ้นน้อยเกินกว่าจะนำไปใช้งานจริง จากนั้นใช้ค่า confidence เพื่อตัดสินใจว่าจะแนะนำในทิศทางใด
ตัวเลข confidence ทั้งสองตัวนำไปสู่การดำเนินการที่แตกต่างกัน การแนะนำเคสโทรศัพท์ให้กับผู้ซื้อฟิล์มกันรอยเป็นคำแนะนำที่แข็งแกร่งกว่า เนื่องจาก 60% ของพวกเขาเลือกซื้อเคสโทรศัพท์อยู่แล้ว ค่า lift จะเท่ากันทั้งสองทิศทาง ซึ่งเป็นเหตุผลว่าทำไม lift จึงเป็นเกณฑ์ชี้วัดที่ดีกว่าในการวัดความแข็งแกร่งของความเชื่อมโยงนั้นเอง
เกณฑ์ชี้วัดอื่นๆ ที่ควรรู้
เกณฑ์ชี้วัดหลักทั้งสามตัวครอบคลุมความต้องการส่วนใหญ่แล้ว แต่ไลบรารีต่างๆ จะรายงานเกณฑ์ชี้วัดอื่นๆ ที่ช่วยกรองกฎที่อ่อนแอออกไปด้วย
Leverage วัดช่องว่างระหว่างการเกิดขึ้นร่วมกันที่สังเกตได้กับการเกิดขึ้นร่วมกันที่คาดหวัง เอกสารของ mlxtend นิยามค่านี้โดยการเปรียบเทียบการเกิดขึ้นร่วมกันที่สังเกตได้กับ "ความถี่ที่คาดหวังหาก A และ C เป็นอิสระต่อกัน" ค่า leverage ที่เท่ากับ 0 หมายถึงความเป็นอิสระต่อกัน
Conviction วัดว่าผลลัพธ์ขึ้นอยู่กับเหตุมากน้อยเพียงใด เช่นเดียวกับ lift ค่าที่เท่ากับ 1 บ่งชี้ถึงความเป็นอิสระต่อกัน ค่าที่สูงขึ้นหมายความว่ากฎนี้ถูกละเมิดน้อยกว่าที่คาดเดาโดยบังเอิญ
ในทางปฏิบัติ ทีมส่วนใหญ่จะเรียงลำดับกฎตามค่า lift จากนั้นกรองด้วยค่า support และ confidence ขั้นต่ำ การผสมผสานดังกล่าวจะช่วยเผยให้เห็นรูปแบบที่แข็งแกร่ง เกิดขึ้นบ่อยพอที่จะมีความสำคัญ และน่าเชื่อถือ
อัลกอริทึม: Apriori และ FP-Growth
Apriori เป็นอัลกอริทึมสุดคลาสสิก เอกสารประกอบของ mlxtend อ้างอิงงานวิจัยปี 1994 ของ Agrawal และ Srikant เกี่ยวกับอัลกอริทึมที่รวดเร็วสำหรับการทำเหมืองกฎความสัมพันธ์เป็นแหล่งที่มา Apriori จะสร้างกลุ่มสินค้าทีละระดับและตัดกลุ่มสินค้าใดๆ ที่กลุ่มย่อยของมันไม่พบบ่อยออกไป ซึ่งช่วยให้การค้นหาอยู่ในขอบเขตที่จัดการได้
FP-Growth เข้าถึงกลุ่มสินค้าที่พบบ่อยแบบเดียวกันด้วยเส้นทางที่ต่างออกไป เอกสารของ mlxtend อธิบายว่ามันเป็น "ทางเลือกยอดนิยมแทนอัลกอริทึม Apriori ที่มีอยู่เดิม" โดยจะสร้างต้นไม้รูปแบบที่พบบ่อย (frequent pattern tree) และไม่จำเป็นต้องสร้างผู้สมัคร (candidate generation) เอกสารระบุว่าสิ่งนี้ทำให้มัน "น่าดึงดูดเป็นพิเศษสำหรับชุดข้อมูลขนาดใหญ่"
เกณฑ์สนับสนุน (support threshold) ทำงานในลักษณะเดียวกันในทั้งสองอัลกอริทึม เอกสารของ mlxtend ยกตัวอย่างง่ายๆ ว่า ที่เกณฑ์ 0.5 กลุ่มสินค้าที่พบบ่อยจะต้องปรากฏในธุรกรรมอย่างน้อยครึ่งหนึ่งของทั้งหมด เกณฑ์สำหรับธุรกิจค้าปลีกมักจะต่ำกว่านั้นมาก เนื่องจากแม้แต่คู่สินค้าที่ได้รับความนิยมก็ยังปรากฏในสัดส่วนที่น้อยของคำสั่งซื้อทั้งหมด
สำหรับคำถามทางธุรกิจส่วนใหญ่ การเลือกใช้อัลกอริทึมจะเปลี่ยนแค่ความเร็ว ไม่ใช่ผลลัพธ์ ทั้งสองวิธีจะให้กลุ่มสินค้าแบบเดียวกันสำหรับเกณฑ์สนับสนุนเดียวกัน
การวิเคราะห์ตะกร้าสินค้าใช้ทำอะไรบ้าง
การวิเคราะห์ตะกร้าสินค้ามักใช้กันมากที่สุดในธุรกิจค้าปลีกและอีคอมเมิร์ซ แต่กรณีการใช้งานยังขยายไปไกลกว่านั้นอีกด้วย
- การขายพ่วง (Cross-selling) แนะนำผลลัพธ์ (consequent) ที่หน้าชำระเงินเมื่อมีเหตุ (antecedent) อยู่ในรถเข็น
- การจัดชุดสินค้า (Bundles) รวมสินค้าที่มีค่า lift สูงเข้าด้วยกันเป็นข้อเสนอเดียว
- การจัดวางหน้าร้านและหน้าเว็บ วางสินค้าที่มักจะจับคู่กันไว้ใกล้กัน บนชั้นวางหรือบนหน้าสินค้า
- การวางแผนสินค้าคงคลัง จัดเก็บสินค้าที่จับคู่กันไว้ด้วยกัน เพื่อไม่ให้การขาดแคลนสินค้าชิ้นหนึ่งไปฉุดยอดขายของสินค้าอีกชิ้นหนึ่งโดยไม่รู้ตัว
- เนื้อหาและสื่อ มองเซสชันของผู้ใช้เป็นตะกร้าสินค้า และค้นหาว่าบทความหรือวิดีโอใดที่ถูกรับชมร่วมกัน
- บริการ ในธุรกิจธนาคารหรือโทรคมนาคม ให้มองผลิตภัณฑ์ของลูกค้าแต่ละรายเป็นตะกร้าสินค้า และค้นหาว่าการจับคู่แบบใดที่มักจะไปด้วยกัน
- การทบทวนแคมเปญ เปรียบเทียบค่า lift ของคู่สินค้าก่อนและระหว่างแคมเปญ การเพิ่มขึ้นอย่างรวดเร็วแสดงให้เห็นว่าแคมเปญได้เปลี่ยนพฤติกรรมการซื้อ ไม่ใช่แค่ปริมาณการซื้อ
แต่ละกรณีการใช้งานเริ่มต้นจากคำถามเดียวกัน: เมื่อลูกค้าเลือกสิ่งหนึ่งแล้ว พวกเขามีแนวโน้มที่จะเลือกอะไรอีกบ้าง?
การดำเนินการที่ตามมาควรสอดคล้องกับทิศทางของ confidence การจัดชุดสินค้าจะได้ผลดีเมื่อลูกค้าต้องการสินค้าทั้งสองอย่างร่วมกัน การแนะนำที่หน้าชำระเงินจะได้ผลดีเมื่อสินค้าชิ้นหนึ่งนำไปสู่อีกชิ้นหนึ่งได้อย่างน่าเชื่อถือ
การวิเคราะห์ตะกร้าสินค้า เปรียบเทียบกับ วิธีการที่เกี่ยวข้อง
การวิเคราะห์ตะกร้าสินค้ามักถูกสับสนกับการแบ่งส่วนลูกค้าและระบบแนะนำสินค้า ตารางด้านล่างแสดงให้เห็นถึงความแตกต่างของวิธีการเหล่านี้
| วิธีการ | หน่วยของการวิเคราะห์ | คำถามหลัก | ผลลัพธ์ทั่วไป |
|---|---|---|---|
| การวิเคราะห์ตะกร้าสินค้า | ธุรกรรม | สินค้าใดบ้างที่ไปด้วยกัน? | กฎความสัมพันธ์ที่มีค่า support, confidence และ lift |
| การแบ่งส่วนลูกค้า (Customer segmentation) | ลูกค้า | ลูกค้ากลุ่มใดที่มีความคล้ายคลึงกัน? | กลุ่มลูกค้าที่มีคุณลักษณะร่วมกัน |
| Collaborative filtering | ประวัติลูกค้าและสินค้า | คนๆ นี้จะชอบอะไรเป็นลำดับถัดไป? | การแนะนำแบบเฉพาะบุคคล (Personalized recommendations) |
| การวิเคราะห์กลุ่มประชากรตามรุ่น (Cohort analysis) | กลุ่มตามวันที่เริ่มต้น | พฤติกรรมเปลี่ยนแปลงไปอย่างไรตามกาลเวลา? | เส้นโค้งและตารางการรักษาลูกค้า (Retention curves and tables) |
วิธีการเหล่านี้ส่งเสริมซึ่งกันและกัน การแบ่งส่วนลูกค้าสามารถบอกคุณได้ว่าใครคือลูกค้าที่มีมูลค่าสูงของคุณ และการวิเคราะห์ตะกร้าสินค้าสามารถบอกคุณได้ว่าลูกค้าเหล่านั้นซื้ออะไรบ้างร่วมกัน คู่มือการสร้างรายงานการแบ่งส่วนลูกค้าของเราจะครอบคลุมเนื้อหาในส่วนแรก และคำอธิบายเกี่ยวกับการวิเคราะห์กลุ่มประชากรตามรุ่น (cohort analysis) ของเราจะครอบคลุมในมิติด้านเวลา
ข้อจำกัดที่ควรรู้
กฎที่ได้จากการวิเคราะห์ตะกร้าสินค้านั้นมีประโยชน์ แต่ก็ง่ายที่จะตีความเกินจริงไป
การเกิดขึ้นร่วมกันไม่ใช่ความเป็นเหตุเป็นผล (Co-occurrence is not causation) คู่สินค้าที่มีค่า lift สูงจะบอกคุณว่าสินค้าสองรายการนั้นถูกซื้อร่วมกัน แต่ไม่ได้บอกว่าการซื้อสินค้าชิ้นหนึ่งเป็นสาเหตุให้อีกชิ้นหนึ่งถูกซื้อ
เกณฑ์เป็นตัวกำหนดคำตอบ หากตั้งค่า support สูงเกินไป คุณจะพลาดคู่สินค้าเฉพาะกลุ่ม (niche) ที่มีมูลค่า แต่หากตั้งค่าต่ำเกินไป คุณจะได้กฎหลายพันข้อ ซึ่งส่วนใหญ่เป็นเพียงสัญญาณรบกวน (noise)
สินค้าหายากจะตกหล่นไป สินค้าราคาแพงที่ถูกซื้อเพียงไม่กี่ครั้งต่อเดือนอาจไม่มีทางผ่านเกณฑ์ support ได้เลย แม้ว่าการจับคู่ของมันจะแข็งแกร่งมากก็ตาม
การคืนสินค้าและการยกเลิกทำให้ข้อมูลตะกร้าสินค้าบิดเบือน หากสินค้าที่ถูกคืนยังคงอยู่ในข้อมูล การวิเคราะห์จะนับการจับคู่ที่ลูกค้าได้ยกเลิกไปแล้ว คู่มือการทำรายงานการคืนสินค้าของเราจะครอบคลุมวิธีการวัดผลในส่วนนั้นแยกต่างหาก
คู่สินค้าจำนวนมากอาจทำให้เกิดรูปแบบที่ผิดพลาด แคตตาล็อกที่มีสินค้า 500 รายการจะมีคู่สินค้าที่เป็นไปได้มากกว่า 100,000 คู่ บางคู่อาจแสดงค่า lift ที่สูงโดยบังเอิญเท่านั้น ควรยืนยันกฎที่สำคัญกับข้อมูลในช่วงเวลาที่สองก่อนที่จะนำไปใช้งานจริง
เวลาเป็นสิ่งสำคัญ รูปแบบพฤติกรรมในช่วงเทศกาลวันหยุดอาจไม่เหมือนเดิมในฤดูใบไม้ผลิ ควรทำการวิเคราะห์กับช่วงเวลาที่เปรียบเทียบกันได้ก่อนที่คุณจะเปลี่ยนการจัดวางสินค้าหรือการจัดชุดสินค้า
วิธีการวิเคราะห์โดยไม่ต้องเขียนโค้ด
วิธีการแบบดั้งเดิมคือการใช้ Python ร่วมกับไลบรารีอย่าง mlxtend หรือใช้ SQL ในการนับคู่สินค้า ซึ่งทั้งสองวิธีจำเป็นต้องปรับรูปแบบข้อมูลการสั่งซื้อให้เป็นหนึ่งแถวต่อหนึ่งธุรกรรม และหนึ่งคอลัมน์ต่อหนึ่งสินค้า
สเปรดชีตสามารถจัดการกับข้อมูลขนาดเล็กได้ ตาราง pivot table จะนับคำสั่งซื้อต่อสินค้า และสูตร COUNTIFS จะนับคำสั่งซื้อที่มีสินค้าทั้งสองรายการในคู่ ข้อจำกัดคือเรื่องของขนาดข้อมูล เนื่องจากจำนวนคู่สินค้าที่เป็นไปได้จะเพิ่มขึ้นอย่างรวดเร็วตามขนาดของแคตตาล็อก
พื้นที่ทำงาน AI สามารถปรับรูปแบบข้อมูลและนับจำนวนจากการส่งออกข้อมูลคำสั่งซื้อทั่วไปได้ Powerdrill Bloom รองรับการอัปโหลดไฟล์ Excel และ CSV ในทุกแผนบริการ คุณสามารถถามได้ว่าสินค้าใดที่มักจะถูกซื้อร่วมกันบ่อยที่สุด และขอค่า support, confidence และ lift สำหรับคู่สินค้าอันดับต้นๆ ได้
เริ่มต้นด้วยการวิเคราะห์ในระดับหมวดหมู่เพื่อดูรูปแบบกว้างๆ จากนั้นจึงวิเคราะห์ซ้ำในระดับ SKU สำหรับหมวดหมู่ที่มีความสำคัญที่สุด
ตรวจสอบผลลัพธ์ในลักษณะเดียวกับที่คุณตรวจสอบสคริปต์ ยืนยันจำนวนธุรกรรม สุ่มตรวจคู่สินค้าหนึ่งคู่ด้วยตนเอง และตรวจสอบให้แน่ใจว่าได้คัดแยกคำสั่งซื้อที่คืนสินค้าออกไปแล้ว หน้า CSV AI assistant จะแสดงขั้นตอนการทำงานที่เน้นไฟล์เป็นหลัก
หากคุณมีข้อมูลการสั่งซื้อที่ส่งออกพร้อมแล้ว คุณสามารถทดลองใช้งาน Powerdrill Bloom กับข้อมูลนั้น และเปรียบเทียบคู่สินค้าอันดับต้นๆ กับสิ่งที่ทีมของคุณคาดการณ์ไว้ได้
คำถามที่พบบ่อย
การวิเคราะห์ตะกร้าสินค้าคืออะไร อธิบายแบบง่ายๆ?
มันคือวิธีการค้นหาว่าสินค้าใดบ้างที่ลูกค้ามักจะซื้อร่วมกัน โดยจะพิจารณาจากคำสั่งซื้อจำนวนมากและวัดว่าการจับคู่แต่ละแบบเกิดขึ้นบ่อยเพียงใด เมื่อเปรียบเทียบกับสิ่งที่คาดเดาโดยบังเอิญ
Lift ในการวิเคราะห์ตะกร้าสินค้าคืออะไร?
Lift จะเปรียบเทียบความถี่ที่สินค้าสองรายการปรากฏร่วมกันกับความถี่ที่พวกมันจะปรากฏหากไม่มีความเกี่ยวข้องกัน ค่า lift ที่เท่ากับ 1 หมายความว่าไม่มีความสัมพันธ์กัน ค่าที่มากกว่า 1 หมายความว่าปรากฏร่วมกันมากกว่าที่คาดไว้ และค่าที่น้อยกว่า 1 หมายความว่าน้อยกว่าที่คาดไว้
วิธีการคำนวณ support และ confidence ทำอย่างไร?
Support คือจำนวนธุรกรรมที่มีกลุ่มสินค้านั้นหารด้วยธุรกรรมทั้งหมด ส่วน Confidence คือค่า support ของคู่สินค้าหารด้วยค่า support ของเหตุ โดยปกติทั้งสองค่าจะแสดงในรูปของทศนิยมหรือเปอร์เซ็นต์
อัลกอริทึมใดที่ใช้สำหรับการวิเคราะห์ตะกร้าสินค้า?
Apriori เป็นอัลกอริทึมสุดคลาสสิก และ FP-Growth เป็นทางเลือกที่รวดเร็วกว่าซึ่งนิยมใช้กันทั่วไป ทั้งสองวิธีจะค้นหากลุ่มสินค้าที่พบบ่อยจากข้อมูลธุรกรรม จากนั้นจึงสร้างและให้คะแนนกฎจากกลุ่มสินค้าเหล่านั้น
คุณสามารถทำการวิเคราะห์ตะกร้าสินค้าใน Excel ได้หรือไม่?
ได้ สำหรับชุดข้อมูลขนาดเล็ก ตาราง pivot table จะนับคำสั่งซื้อต่อสินค้า และ COUNTIFS จะนับคำสั่งซื้อที่มีคู่สินค้า สำหรับแคตตาล็อกขนาดใหญ่ จำนวนคู่สินค้าจะเพิ่มขึ้นอย่างรวดเร็ว ดังนั้นการใช้สคริปต์หรือเครื่องมือ AI จึงมีความเหมาะสมในทางปฏิบัติมากกว่า
แหล่งที่มา: mlxtend, Association rules · mlxtend, Apriori ตัวอย่างการคำนวณใช้ตัวเลขเพื่อประกอบการอธิบายเท่านั้น