Tydzień wielkiej wyprzedażyClaude Skills — 20% RABATU
Glossary

Co to jest analiza koszykowa? Wskaźniki, przykłady i zastosowania

Powerdrill Bloom·
Co to jest analiza koszykowa? Wskaźniki, przykłady i zastosowania

Analiza koszykowa to metoda służąca do znajdowania produktów, które są kupowane razem w ramach tej samej transakcji. Skanuje dane o zamówieniach w poszukiwaniu kombinacji produktów, które pojawiają się częściej, niż wynikałoby to z przypadku. Każdy wzorzec opisują trzy metryki: wsparcie, ufność i lift. Sprzedawcy detaliczni i sklepy internetowe wykorzystują ją do sprzedaży wiązanej, tworzenia pakietów oraz rozmieszczania produktów.

Ten przewodnik wyjaśnia, jak działa ta metoda, jak obliczać poszczególne metryki oraz jak interpretować wyniki. Omawia również popularne algorytmy, główne zastosowania oraz ograniczenia, które warto znać przed wdrożeniem danej reguły w życie.

Czym jest analiza koszykowa

Podstawowa idea stojąca za analizą koszykową jest prosta. Każde zamówienie to koszyk produktów. W tysiącach koszyków niektóre produkty stale pojawiają się razem. Analiza ta pozwala znaleźć te kombinacje i zmierzyć siłę każdej z nich.

Wynikiem analizy jest zestaw reguł asocjacyjnych. Reguła brzmi: „jeśli koszyk zawiera A, to prawdopodobnie zawiera również C”. A jest nazywane poprzednikiem, a C następnikiem. Oba mogą być pojedynczymi produktami lub grupami produktów.

Dokumentacja biblioteki mlxtend, powszechnie używanej w języku Python do tego typu zadań, podaje klasyczny przykład. Opisuje ona regułę sugerującą, że „ludzie, którzy kupują pieluchy, chętnie kupują również piwo”. Niezależnie od tego, czy to powiązanie sprawdza się w danym sklepie, pokazuje ono formę, jaką przybiera wynik.

Technika ta należy do szerszej dziedziny zwanej odkrywaniem reguł asocjacyjnych. Dokumentacja mlxtend zauważa, że algorytm Apriori „został zaprojektowany do pracy na bazach danych zawierających transakcje, takich jak zakupy dokonywane przez klientów sklepu”. Handel detaliczny to miejsce, w którym ta metoda się narodziła, ale sprawdzi się ona dla każdych danych składających się z koszyków.

Jak to działa

Analiza koszykowa przebiega w dwóch etapach.

Etap pierwszy polega na znalezieniu częstych zbiorów elementów. Zbiór elementów to dowolna grupa produktów, na przykład {etui na telefon, szkło ochronne}. Uznaje się go za częsty, gdy pojawia się w co najmniej minimalnym odsetku wszystkich transakcji. Ty ustalasz to minimum, zwane progiem wsparcia.

Etap drugi przekształca zbiory elementów w reguły. Dla każdego częstego zbioru elementów algorytm dzieli go na poprzednik i następnik, a następnie ocenia powstałą regułę. Dokumentacja mlxtend opisuje generowanie reguł jako „typowe zadanie w procesie eksploracji częstych wzorców”.

Dane wejściowe mają zawsze taki sam kształt. Każdy wiersz to transakcja, a każda kolumna oznacza, czy dany produkt się w niej znajdował. Eksporty zamówień z większości platform e-commerce można przekształcić do tego formatu za pomocą tabeli przestawnej.

Trzy decyzje przygotowawcze kształtują wynik jeszcze przed obliczeniem jakiejkolwiek metryki. Po pierwsze, zdecyduj, czym jest transakcja – zazwyczaj jest to pojedynczy identyfikator zamówienia. Po drugie, rejestruj obecność, a nie ilość, tak aby trzy sztuki tego samego produktu nadal liczyły się jako jedna. Po trzecie, wybierz poziom szczegółowości. Kategorie produktów dają mniej, ale za to szersze reguły, podczas gdy poszczególne kody SKU dają bardziej precyzyjne reguły, które wymagają jednak większej ilości danych.

Trzy kluczowe metryki

Każda reguła otrzymuje trzy wartości liczbowe. Ich wspólna interpretacja pozwala odróżnić użyteczną regułę od zwykłego zbiegu okoliczności.

Wsparcie

Wsparcie to odsetek wszystkich transakcji, które zawierają dany zbiór elementów. Jeśli 60 na 1,000 zamówień zawiera zarówno etui na telefon, jak i szkło ochronne, wsparcie dla tej pary wynosi 0.06, czyli 6%.

Wsparcie informuje o tym, jak powszechny jest dany wzorzec. Reguła o bardzo niskim wsparciu może być prawdziwa, ale występuje zbyt rzadko, aby podjąć na jej podstawie działania.

Ufność

Ufność to prawdopodobieństwo pojawienia się następnika, pod warunkiem że koszyk zawiera już poprzednik. Jest ona równa wsparciu dla pary podzielonemu przez wsparcie dla poprzednika.

Ufność ma swój kierunek. Ufność reguły prowadzącej od A do C jest zazwyczaj inna niż reguły od C do A. Poniższy praktyczny przykład wyjaśnia, dlaczego tak jest.

Lift

Lift porównuje rzeczywistą częstotliwość występowania pary z częstotliwością, jakiej można by się spodziewać, gdyby oba produkty były ze sobą niepowiązane. Jest on równy ufności reguły podzielonej przez wsparcie następnika.

Dokumentacja mlxtend jasno opisuje punkt odniesienia: „Jeśli A i C są niezależne, wynik Lift będzie wynosił dokładnie 1”. Wskaźnik lift powyżej 1 oznacza, że produkty pojawiają się razem częściej, niż wynikałoby to z przypadku. Wskaźnik lift poniżej 1 oznacza, że pojawiają się razem rzadziej.

Praktyczny przykład

Przyjrzyjmy się internetowemu sklepowi z elektroniką, który odnotował 1,000 zamówień w ciągu miesiąca.

Miara Wartość
Zamówienia zawierające etui na telefon 200
Zamówienia zawierające szkło ochronne 100
Zamówienia zawierające oba produkty 60
Wsparcie dla pary 60 / 1,000 = 0.06
Ufność, od etui na telefon do szkła ochronnego 0.06 / 0.20 = 0.30
Ufność, od szkła ochronnego do etui na telefon 0.06 / 0.10 = 0.60
Lift 0.30 / 0.10 = 3.0

Przełóżmy te wyniki na prosty język. Trzech na dziesięciu kupujących etui na telefon kupiło również szkło ochronne. Sześciu na dziesięciu kupujących szkło ochronne kupiło również etui na telefon. Ta para pojawia się razem trzy razy częściej, niż wynikałoby to z przypadku.

Gdy otrzymasz pełną tabelę reguł, analizuj ją w określonej kolejności. Posortuj wyniki według wskaźnika lift, aby znaleźć najsilniejsze powiązania. Odrzuć reguły poniżej minimalnego progu wsparcia, ponieważ są zbyt rzadkie, aby opłacało się na nie reagować. Następnie użyj ufności, aby zdecydować, w którym kierunku kierować rekomendacje.

Dwie różne wartości ufności prowadzą do odmiennych działań. Sugerowanie etui na telefon osobom kupującym szkło ochronne to silniejsza rekomendacja, ponieważ 60% z nich i tak już je wybiera. Wskaźnik lift jest taki sam w obu kierunkach, dlatego to właśnie on stanowi lepszą miarę siły samego powiązania.

Inne metryki, które warto znać

Trzy kluczowe metryki zaspokajają większość potrzeb, ale biblioteki raportują również inne wskaźniki, które pomagają odsiać słabe reguły.

Leverage mierzy różnicę między zaobserwowanym a oczekiwanym współwystępowaniem. Dokumentacja mlxtend definiuje go poprzez porównanie zaobserwowanego współwystępowania z „częstotliwością, jakiej można by się spodziewać, gdyby A i C były niezależne”. Wartość leverage równa 0 oznacza niezależność.

Conviction mierzy, jak silnie następnik zależy od poprzednika. Podobnie jak w przypadku wskaźnika lift, wartość 1 oznacza niezależność. Wyższe wartości oznaczają, że reguła jest łamana rzadziej, niż sugerowałby przypadek.

In practice, most teams sort rules by lift, then filter by a minimum support and confidence. That combination surfaces patterns that are strong, common enough to matter, and reliable.

Algorytmy: Apriori i FP-Growth

Apriori to klasyczny algorytm. Dokumentacja mlxtend powołuje się na publikację Agrawala i Srikanta z 1994 roku dotyczącą szybkich algorytmów do eksploracji reguł asocjacyjnych jako na swoje źródło. Apriori buduje zbiory elementów poziom po poziomie i odrzuca wszelkie zbiory, których podzbiory nie są częste, co pozwala utrzymać proces wyszukiwania pod kontrolą.

FP-Growth dociera do tych samych częstych zbiorów elementów inną drogą. Dokumentacja mlxtend opisuje go jako „popularną alternatywę dla uznanego algorytmu Apriori”. Buduje on drzewo częstych wzorców i nie wymaga generowania kandydatów. Dokumentacja podaje, że dzięki temu jest on „szczególnie atrakcyjny dla dużych zbiorów danych”.

Próg wsparcia działa w obu przypadkach tak samo. Dokumentacja mlxtend podaje prosty przykład: przy progu wynoszącym 0.5 częsty zbiór elementów musi pojawić się w co najmniej połowie wszystkich transakcji. Progi w handlu detalicznym są zazwyczaj znacznie niższe, ponieważ nawet popularne pary pojawiają się w niewielkim odsetku zamówień.

W przypadku większości pytań biznesowych wybór algorytmu wpływa na szybkość działania, a nie na wyniki. Oba zwracają te same zbiory elementów dla tego samego progu wsparcia.

Do czego służy analiza koszykowa

Analiza koszykowa jest najczęściej stosowana w handlu detalicznym i e-commerce, ale jej zastosowania sięgają znacznie dalej.

  • Sprzedaż wiązana. Rekomendowanie następnika przy kasie, gdy poprzednik znajduje się w koszyku.
  • Pakiety. Łączenie produktów o wysokim wskaźniku lift w jedną ofertę.
  • Układ sklepu i strony. Umieszczanie często łączonych produktów blisko siebie – na półce lub na stronie produktu.
  • Planowanie zapasów. Magazynowanie powiązanych produktów razem, aby brak jednego z nich nie powodował po cichu spadku sprzedaży drugiego.
  • Treści i media. Traktowanie sesji użytkownika jako koszyka i sprawdzanie, które artykuły lub filmy są oglądane razem.
  • Usługi. W bankowości lub telekomunikacji – traktowanie produktów każdego klienta jako koszyka i sprawdzanie, które kombinacje usług zazwyczaj idą w parze.
  • Ocena kampanii. Porównanie wskaźnika lift dla danej pary przed kampanią i w jej trakcie. Wzrost pokazuje, że kampania zmieniła zachowania zakupowe, a nie tylko wolumen sprzedaży.

Każde zastosowanie zaczyna się od tego samego pytania. Kiedy klienci wybierają jedną rzecz, co jeszcze mają tendencję wybierać?

Działanie, które następuje później, powinno być zgodne z kierunkiem ufności. Pakiet sprawdza się wtedy, gdy oba produkty są pożądane jednocześnie. Sugestia przy kasie działa wtedy, gdy jeden produkt niezawodnie prowadzi do zakupu drugiego.

Analiza koszykowa a metody pokrewne

Analiza koszykowa jest często mylona z segmentacją klientów oraz silnikami rekomendacyjnymi. Poniższa tabela pokazuje różnice między nimi.

Metoda Jednostka analizy Główne pytanie Typowy wynik
Analiza koszykowa Transakcje Które produkty idą w parze? Reguły asocjacyjne ze wsparciem, ufnością i wskaźnikiem lift
Segmentacja klientów Klienci Którzy klienci są do siebie podobni? Grupy klientów o wspólnych cechach
Filtrowanie kolaboratywne Historia klienta i produktu Co ta osoba polubi w następnej kolejności? Spersonalizowane rekomendacje
Analiza kohortowa Grupy według daty rozpoczęcia Jak zachowanie zmienia się w czasie? Krzywe i tabele retencji

Metody te uzupełniają się wzajemnie. Segmentacja może powiedzieć Ci, kim są Twoi najbardziej wartościowi klienci, a analiza koszykowa – co ci klienci kupują razem. Nasz przewodnik po tworzeniu raportu segmentacji klientów obejmuje pierwszą część, a nasze wyjaśnienie dotyczące analizy kohortowej opisuje wymiar czasowy.

Ograniczenia, które warto znać

Reguły płynące z analizy koszykowej są użyteczne, ale łatwo wyciągnąć z nich zbyt daleko idące wnioski.

Współwystępowanie to nie przyczynowość. Para o wysokim wskaźniku lift mówi jedynie, że dwa produkty są kupowane razem. Nie oznacza to jednak, że zakup jednego powoduje zakup drugiego.

Progi kształtują wynik. Jeśli ustawisz zbyt wysokie wsparcie, przegapisz niszowe, ale wartościowe pary. Jeśli ustawisz je zbyt nisko, otrzymasz tysiące reguł, z których wiele będzie zwykłym szumem.

Rzadkie produkty giną w tłumie. Drogi produkt kupowany kilka razy w miesiącu może nigdy nie osiągnąć progu wsparcia, nawet jeśli jego powiązania z innymi produktami są bardzo silne.

Zwroty i anulowania zniekształcają koszyki. Jeśli zwrócone produkty pozostaną w danych, analiza uwzględni powiązania, z których klienci ostatecznie zrezygnowali. Nasz przewodnik po tworzeniu raportu zwrotów produktów wyjaśnia, jak mierzyć ten aspekt osobno.

Duża liczba par oznacza ryzyko fałszywych wzorców. Katalog zawierający 500 produktów daje ponad 100,000 możliwych par. Niektóre z nich wykażą wysoki wskaźnik lift wyłącznie przez przypadek. Przed podjęciem działań potwierdź istotne reguły na danych z innego okresu.

Czas ma znaczenie. Wzorce z okresu świątecznego mogą nie sprawdzić się wiosną. Przeprowadź analizę dla porównywalnych okresów, zanim zmienisz układ produktów lub pakiet.

Jak przeprowadzić analizę bez pisania kodu

Klasyczna ścieżka to Python z biblioteką taką jak mlxtend lub SQL do zliczania par. Obie metody wymagają przekształcenia danych o zamówieniach tak, aby uzyskać jeden wiersz na transakcję i jedną kolumnę na produkt.

Arkusz kalkulacyjny poradzi sobie z mniejszą wersją danych. Tabela przestawna zlicza zamówienia na produkt, a formuła LICZ.WARUNKI zlicza zamówienia zawierające oba produkty z pary. Ograniczeniem jest tu jednak skala, ponieważ liczba możliwych par rośnie lawinowo wraz z wielkością katalogu.

Środowisko pracy oparte na sztucznej inteligencji może wykonać przekształcenie i zliczanie danych bezpośrednio ze zwykłego eksportu zamówień. Powerdrill Bloom umożliwia przesyłanie plików Excel i CSV w każdym planie. Możesz zapytać, które produkty są najczęściej kupowane razem, oraz poprosić o obliczenie wsparcia, ufności i wskaźnika lift dla najlepszych par.

Zacznij od analizy na poziomie kategorii, aby dostrzec ogólne wzorce. Następnie uruchom ją ponownie na poziomie kodów SKU dla kategorii, które mają największe znaczenie.

Sprawdź wyniki w taki sam sposób, w jaki sprawdzałbyś kod programu. Potwierdź liczbę transakcji, wyrywkowo zweryfikuj ręcznie jedną parę i upewnij się, że zwrócone zamówienia zostały wykluczone. Strona CSV AI assistant przedstawia proces pracy zorientowany na pliki.

Jeśli masz gotowy eksport zamówień, możesz wypróbować Powerdrill Bloom na swoich danych i porównać najpopularniejsze pary z oczekiwaniami Twojego zespołu.

Często zadawane pytania

Czym jest analiza koszykowa w prostych słowach?

To sposób na dowiedzenie się, które produkty klienci najchętniej kupują razem. Analizuje ona wiele zamówień i mierzy, jak często pojawia się każda kombinacja w porównaniu do tego, co wynikałoby z czystego przypadku.

Czym jest lift w analizie koszykowej?

Lift porównuje częstotliwość wspólnego występowania dwóch produktów z częstotliwością, z jaką pojawiałyby się, gdyby były od siebie niezależne. Wskaźnik lift równy 1 oznacza brak powiązania. Wartość powyżej 1 oznacza, że pojawiają się razem częściej niż oczekiwano, a poniżej 1 – że rzadziej.

Jak oblicza się wsparcie i ufność?

Wsparcie to liczba transakcji zawierających dany zbiór elementów podzielona przez liczbę wszystkich transakcji. Ufność to wsparcie dla pary podzielone przez wsparcie dla poprzednika. Obie te metryki są zazwyczaj przedstawiane w postaci ułamków dziesiętnych lub procentów.

Jaki algorytm jest używany do analizy koszykowej?

Klasycznym algorytmem jest Apriori, a popularną, szybszą alternatywą – FP-Growth. Oba algorytmy wyszukują częste zbiory elementów w danych transakcyjnych, a następnie na ich podstawie generowane i oceniane są reguły.

Czy można przeprowadzić analizę koszykową w programie Excel?

Tak, w przypadku małych zbiorów danych. Tabela przestawna zlicza zamówienia na produkt, a formuła LICZ.WARUNKI zlicza zamówienia zawierające daną parę. Przy dużych katalogach liczba par rośnie bardzo szybko, dlatego bardziej praktyczny jest skrypt lub narzędzie oparte na sztucznej inteligencji.

Źródła: mlxtend, reguły asocjacyjne · mlxtend, Apriori. Przedstawiony przykład ma charakter poglądowy.