Was ist eine Warenkorbanalyse? Metriken, Beispiele und Anwendungsfälle

Die Warenkorbanalyse ist eine Methode, um herauszufinden, welche Produkte in derselben Transaktion zusammen gekauft werden. Sie durchsucht Bestelldaten nach Kombinationen von Artikeln, die häufiger auftreten, als es der Zufall erwarten ließe. Drei Kennzahlen beschreiben jedes Muster: Support, Konfidenz und Lift. Einzelhändler und Online-Shops nutzen sie für Cross-Selling, Produktbündel und die Produktplatzierung.
Dieser Leitfaden erklärt, wie die Methode funktioniert, wie die einzelnen Kennzahlen berechnet werden und wie die Ergebnisse zu interpretieren sind. Er behandelt auch die gängigen Algorithmen, die wichtigsten Anwendungsfälle und die Grenzen, die man kennen sollte, bevor man Maßnahmen auf Basis einer Regel ergreift.
Was ist eine Warenkorbanalyse?
Die Grundidee hinter der Warenkorbanalyse ist einfach. Jede Bestellung ist ein Warenkorb voller Artikel. Über Tausende von Warenkörben hinweg tauchen bestimmte Artikel immer wieder gemeinsam auf. Die Analyse findet diese Kombinationen und misst, wie stark die jeweilige Verbindung ist.
Das Ergebnis ist eine Reihe von Assoziationsregeln. Eine Regel lautet: „Wenn ein Warenkorb A enthält, enthält er wahrscheinlich auch C.“ A wird als Antezedenz bezeichnet und C als Konsequenz. Beides können einzelne Artikel oder Gruppen von Artikeln sein.
Die Dokumentation für mlxtend, eine weit verbreitete Python-Bibliothek für diese Arbeit, liefert das klassische Beispiel. Sie beschreibt eine Regel, die besagt, „dass Menschen, die Windeln kaufen, wahrscheinlich auch Bier kaufen“. Unabhängig davon, ob diese Kombination in einem bestimmten Geschäft zutrifft, zeigt sie die Form des Ergebnisses.
Die Technik gehört zu einem breiteren Bereich namens Assoziationsanalysen. In der mlxtend-Dokumentation wird darauf hingewiesen, dass der Apriori-Algorithmus „für den Betrieb auf Datenbanken mit Transaktionen, wie z. B. Einkäufen von Kunden eines Geschäfts, entwickelt wurde“. Der Einzelhandel ist der Ursprung dieser Methode, aber sie funktioniert mit allen Daten, die aus Warenkörben bestehen.
Wie sie funktioniert
Eine Warenkorbanalyse läuft in zwei Phasen ab.
In Phase eins werden häufige Itemsets ermittelt. Ein Itemset ist eine beliebige Gruppe von Artikeln, wie z. B. {Handyhülle, Displayschutzfolie}. Es gilt als häufig, wenn es in mindestens einem Mindestanteil aller Transaktionen vorkommt. Diesen Mindestwert, den sogenannten Support-Schwellenwert, legen Sie selbst fest.
In Phase zwei werden aus den Itemsets Regeln generiert. Für jedes häufige Itemset teilt der Algorithmus dieses in eine Antezedenz und eine Konsequenz auf und bewertet die resultierende Regel. Die mlxtend-Dokumentation beschreibt die Regelgenerierung als „eine häufige Aufgabe beim Mining häufiger Muster“.
Die Eingabedaten haben immer dieselbe Struktur. Jede Zeile stellt eine Transaktion dar, und jede Spalte gibt an, ob ein bestimmter Artikel darin enthalten war. Exportierte Bestelldaten aus den meisten E-Commerce-Plattformen lassen sich mithilfe einer Pivot-Tabelle in dieses Format umstrukturieren.
Drei Entscheidungen bei der Vorbereitung prägen das Ergebnis, noch bevor eine Kennzahl berechnet wird. Erstens: Definieren Sie, was eine Transaktion ist – in der Regel eine Bestell-ID. Zweitens: Erfassen Sie das Vorhandensein statt der Menge, sodass drei Einheiten desselben Artikels dennoch nur als ein Vorkommen zählen. Drittens: Wählen Sie den Detailgrad. Produktkategorien liefern weniger, aber breitere Regeln, während einzelne SKUs präzisere Regeln liefern, die jedoch mehr Daten erfordern.
Die drei Kernkennzahlen
Jede Regel erhält drei Kennzahlen. Erst das gemeinsame Betrachten dieser Werte unterscheidet eine nützliche Regel von einem reinen Zufall.
Support
Der Support ist der Anteil aller Transaktionen, die das Itemset enthalten. Wenn 60 von 1.000 Bestellungen sowohl eine Handyhülle als auch eine Displayschutzfolie enthalten, beträgt der Support für dieses Paar 0.06 oder 6%.
Der Support zeigt Ihnen, wie häufig ein Muster ist. Eine Regel mit sehr geringem Support ist zwar vielleicht real, aber zu selten, um darauf basierend Maßnahmen zu ergreifen.
Konfidenz
Die Konfidenz ist die Wahrscheinlichkeit, dass die Konsequenz im Warenkorb liegt, unter der Bedingung, dass die Antezedenz bereits enthalten ist. Sie entspricht dem Support des Paares geteilt durch den Support der Antezedenz.
Die Konfidenz hat eine Richtung. Die Konfidenz, dass A zu C führt, unterscheidet sich meist von der Konfidenz, dass C zu A führt. Das folgende Praxisbeispiel zeigt, warum.
Lift
Der Lift vergleicht die tatsächliche Häufigkeit des Paares mit dem, was zu erwarten wäre, wenn die beiden Artikel in keinem Zusammenhang stünden. Er entspricht der Konfidenz der Regel geteilt durch den Support der Konsequenz.
Die mlxtend-Dokumentation beschreibt den Bezugspunkt eindeutig: „Wenn A und C unabhängig sind, beträgt der Lift-Wert genau 1.“ Ein Lift von über 1 bedeutet, dass die Artikel häufiger zusammen auftreten, als es der Zufall erwarten lässt. Ein Lift unter 1 bedeutet, dass sie seltener zusammen auftreten.
Ein Praxisbeispiel
Nehmen wir einen Online-Elektronikshop mit 1.000 Bestellungen in einem Monat.
| Kennzahl | Wert |
|---|---|
| Bestellungen mit einer Handyhülle | 200 |
| Bestellungen mit einer Displayschutzfolie | 100 |
| Bestellungen mit beiden Artikeln | 60 |
| Support des Paares | 60 / 1,000 = 0.06 |
| Konfidenz, Handyhülle zu Displayschutzfolie | 0.06 / 0.20 = 0.30 |
| Konfidenz, Displayschutzfolie zu Handyhülle | 0.06 / 0.10 = 0.60 |
| Lift | 0.30 / 0.10 = 3.0 |
Drücken wir die Ergebnisse in einfachen Worten aus. Drei von zehn Käufern einer Handyhülle kauften auch eine Displayschutzfolie. Sechs von zehn Käufern einer Displayschutzfolie kauften auch eine Handyhülle. Das Paar tritt dreimal so häufig zusammen auf, wie es der Zufall erwarten ließe.
Wenn Sie die vollständige Regeltabelle vor sich haben, lesen Sie diese in einer festen Reihenfolge. Sortieren Sie nach dem Lift, um die stärksten Verbindungen zu finden. Verwerfen Sie Regeln, die unter Ihrem Mindest-Support liegen, da diese zu selten sind, um darauf zu reagieren. Nutzen Sie dann die Konfidenz, um zu entscheiden, in welche Richtung Sie eine Empfehlung aussprechen.
Die beiden Konfidenzwerte führen zu unterschiedlichen Maßnahmen. Den Käufern einer Displayschutzfolie eine Handyhülle vorzuschlagen, ist die stärkere Empfehlung, da 60% von ihnen ohnehin eine dazu kaufen. Der Lift ist in beide Richtungen gleich, weshalb er das bessere Maß für die Stärke der Verbindung an sich ist.
Weitere wissenswerte Kennzahlen
Die drei Kernkennzahlen decken die meisten Anforderungen ab, aber Bibliotheken weisen noch weitere Werte aus, die beim Filtern schwacher Regeln helfen.
Leverage misst die Abweichung zwischen dem beobachteten und dem erwarteten gemeinsamen Auftreten. Die mlxtend-Dokumentation definiert diesen Wert durch den Vergleich des beobachteten gemeinsamen Auftretens mit „der Häufigkeit, die zu erwarten wäre, wenn A und C unabhängig voneinander wären“. Ein Leverage-Wert von 0 bedeutet Unabhängigkeit.
Conviction misst, wie stark die Konsequenz von der Antezedenz abhängt. Wie beim Lift weist ein Wert von 1 auf Unabhängigkeit hin. Höhere Werte bedeuten, dass die Regel seltener verletzt wird, als es der Zufall vermuten ließe.
In der Praxis sortieren die meisten Teams die Regeln nach dem Lift und filtern sie dann nach einem Mindestmaß an Support und Konfidenz. Diese Kombination bringt Muster zum Vorschein, die stark, ausreichend häufig und verlässlich sind.
Algorithmen: Apriori und FP-Growth
Apriori ist der klassische Algorithmus. Die mlxtend-Dokumentation nennt als Quelle die Arbeit von Agrawal und Srikant aus dem Jahr 1994 über schnelle Algorithmen zum Mining von Assoziationsregeln. Apriori baut Itemsets schrittweise Ebene für Ebene auf und sortiert alle Itemsets aus, deren Teilmengen nicht häufig vorkommen, wodurch die Suche überschaubar bleibt.
FP-Growth gelangt auf einem anderen Weg zu denselben häufigen Itemsets. Die mlxtend-Dokumentation beschreibt ihn als „eine beliebte Alternative zum etablierten Apriori-Algorithmus“. Er baut einen Baum für häufige Muster (Frequent Pattern Tree) auf und erfordert keine Generierung von Kandidaten-Itemsets. Laut Dokumentation macht ihn dies „besonders attraktiv für große Datensätze“.
Der Support-Schwellenwert funktioniert bei beiden Algorithmen gleich. Die mlxtend-Dokumentation nennt ein einfaches Beispiel: Bei einem Schwellenwert von 0.5 muss ein häufiges Itemset in mindestens der Hälfte aller Transaktionen vorkommen. Im Einzelhandel liegen die Schwellenwerte meist weitaus niedriger, da selbst beliebte Paare nur in einem kleinen Teil der Bestellungen auftauchen.
Für die meisten geschäftlichen Fragestellungen beeinflusst die Wahl des Algorithmus lediglich die Geschwindigkeit, nicht aber die Ergebnisse. Beide liefern bei gleichem Support-Schwellenwert dieselben Itemsets.
Wofür die Warenkorbanalyse eingesetzt wird
Die Warenkorbanalyse wird am häufigsten im Einzelhandel und E-Commerce eingesetzt, aber die Anwendungsfälle gehen noch weit darüber hinaus.
- Cross-Selling. Empfehlen Sie die Konsequenz an der Kasse, wenn sich die Antezedenz im Warenkorb befindet.
- Produktbündel. Fassen Sie Artikel mit hohem Lift zu einem gemeinsamen Angebot zusammen.
- Laden- und Seitengestaltung. Platzieren Sie häufig zusammen gekaufte Artikel nebeneinander – im Regal oder auf einer Produktseite.
- Bestandsplanung. Lagern Sie zusammengehörige Artikel gemeinsam, damit ein Engpass bei einem Artikel nicht unbemerkt den Verkauf des anderen ausbremst.
- Inhalte und Medien. Betrachten Sie eine Nutzersitzung als Warenkorb und finden Sie heraus, welche Artikel oder Videos gemeinsam konsumiert werden.
- Dienstleistungen. Betrachten Sie im Banken- oder Telekommunikationsbereich die Produkte jedes Kunden als Warenkorb und finden Sie heraus, welche Kombinationen typischerweise zusammenpassen.
- Kampagnenanalyse. Vergleichen Sie den Lift für ein Paar vor und während einer Kampagne. Ein sprunghafter Anstieg zeigt, dass die Kampagne das Kaufverhalten verändert hat und nicht nur das Absatzvolumen.
Jeder Anwendungsfall geht von derselben Frage aus: Wenn Kunden sich für eine Sache entscheiden, was wählen sie meist noch dazu?
Die darauf folgende Maßnahme sollte zur Richtung der Konfidenz passen. Ein Produktbündel funktioniert, wenn beide Artikel zusammen gewünscht werden. Ein Vorschlag an der Kasse funktioniert, wenn ein Artikel zuverlässig zum Kauf des anderen führt.
Warenkorbanalyse im Vergleich zu verwandten Methoden
Die Warenkorbanalyse wird oft mit der Kundensegmentierung und mit Empfehlungsdiensten verwechselt. Die Tabelle zeigt die Unterschiede.
| Methode | Analyseeinheit | Hauptfrage | Typisches Ergebnis |
|---|---|---|---|
| Warenkorbanalyse | Transaktionen | Welche Artikel gehören zusammen? | Assoziationsregeln mit Support, Konfidenz und Lift |
| Kundensegmentierung | Kunden | Welche Kunden ähneln einander? | Kundengruppen mit gemeinsamen Merkmalen |
| Collaborative Filtering | Kunden- und Artikelhistorie | Was wird dieser Person als Nächstes gefallen? | Personalisierte Empfehlungen |
| Kohortenanalyse | Gruppen nach Startdatum | Wie verändert sich das Verhalten im Laufe der Zeit? | Retention-Kurven und -Tabellen |
Die Methoden ergänzen einander. Die Segmentierung kann Ihnen sagen, wer Ihre wertvollsten Kunden sind, und die Warenkorbanalyse zeigt Ihnen, was diese Kunden zusammen kaufen. Unser Leitfaden zur Erstellung eines customer segmentation report deckt die erste Hälfte ab, und unsere Erklärung zur cohort analysis befasst sich mit der zeitlichen Dimension.
Grenzen, die man kennen sollte
Die Regeln aus der Warenkorbanalyse sind nützlich, verleiten jedoch leicht zu Fehlinterpretationen.
Gemeinsames Auftreten ist keine Kausalität. Ein Paar mit hohem Lift zeigt Ihnen, dass zwei Artikel zusammen gekauft werden. Es sagt Ihnen nicht, dass der Kauf des einen den Kauf des anderen verursacht.
Schwellenwerte bestimmen das Ergebnis. Wenn Sie den Support zu hoch ansetzen, verpassen Sie nischige, aber wertvolle Paare. Wenn Sie ihn zu niedrig ansetzen, erhalten Sie Tausende von Regeln, von denen viele nur Rauschen sind.
Seltene Artikel gehen verloren. Ein teurer Artikel, der nur wenige Male im Monat gekauft wird, erreicht möglicherweise nie den Support-Schwellenwert, selbst wenn seine Verbindungen zu anderen Artikeln stark sind.
Retouren und Stornierungen verzerren die Warenkörbe. Wenn retournierte Artikel in den Daten verbleiben, zählt die Analyse Verbindungen, die von den Kunden rückgängig gemacht wurden. Unser Leitfaden für einen product returns report zeigt, wie Sie diese Seite separat messen können.
Viele Paare bedeuten auch einige Scheinmuster. Ein Katalog mit 500 Artikeln bietet mehr als 100.000 mögliche Paare. Einige davon werden rein zufällig einen hohen Lift aufweisen. Bestätigen Sie wichtige Regeln anhand eines zweiten Datenzeitraums, bevor Sie Maßnahmen ergreifen.
Die Zeit spielt eine Rolle. Muster während der Weihnachtszeit gelten im Frühling möglicherweise nicht mehr. Führen Sie die Analyse für vergleichbare Zeiträume durch, bevor Sie ein Layout oder ein Produktbündel ändern.
So führen Sie eine Analyse durch, ohne Code zu schreiben
Der klassische Weg führt über Python mit einer Bibliothek wie mlxtend oder über SQL zum Zählen von Paaren. Beide erfordern die Umstrukturierung der Besteldaten in eine Zeile pro Transaktion und eine Spalte pro Artikel.
Eine Tabellenkalkulation kann eine kleinere Version bewältigen. Eine Pivot-Tabelle zählt die Bestellungen pro Artikel, und eine ZÄHLENWENNS-Formel zählt die Bestellungen, die beide Artikel eines Paares enthalten. Die Grenze liegt in der Skalierbarkeit, da die Anzahl der möglichen Paare mit der Größe des Katalogs schnell ansteigt.
Eine KI-Arbeitsumgebung kann die Umstrukturierung und das Zählen direkt aus einem einfachen Bestellexport übernehmen. Powerdrill Bloom bietet in jedem Tarif den Upload von Excel und CSV an. Sie können fragen, welche Produkte am häufigsten zusammen gekauft werden, und Support, Konfidenz und Lift für die Top-Paare anfordern.
Beginnen Sie mit einem Durchlauf auf Kategorieebene, um die groben Muster zu erkennen. Führen Sie die Analyse dann auf SKU-Ebene für die wichtigsten Kategorien erneut durch.
Überprüfen Sie das Ergebnis genauso, wie Sie ein Skript überprüfen würden. Bestätigen Sie die Anzahl der Transaktionen, machen Sie eine Stichprobe für ein Paar von Hand und stellen Sie sicher, dass retournierte Bestellungen ausgeschlossen wurden. Die Seite zum CSV AI assistant zeigt den dateibasierten Workflow.
Wenn Sie einen Bestellexport bereitliegen haben, können Sie try Powerdrill Bloom damit ausprobieren und die Top-Paare mit den Erwartungen Ihres Teams vergleichen.
Häufig gestellte Fragen
Was ist eine Warenkorbanalyse in einfachen Worten?
Es ist eine Methode, um herauszufinden, welche Produkte Kunden tendenziell zusammen kaufen. Sie untersucht viele Bestellungen und misst, wie oft jede Kombination im Vergleich zu dem auftritt, was der Zufall erwarten ließe.
Was ist der Lift bei einer Warenkorbanalyse?
Der Lift vergleicht, wie oft zwei Artikel zusammen auftreten, mit der Häufigkeit, mit der sie auftreten würden, wenn sie in keinem Zusammenhang stünden. Ein Lift von 1 bedeutet, dass keine Verbindung besteht. Ein Wert über 1 bedeutet, dass sie häufiger als erwartet zusammen auftreten, und unter 1 bedeutet seltener.
Wie berechnet man Support und Konfidenz?
Der Support ist die Anzahl der Transaktionen, die das Itemset enthalten, geteilt durch alle Transaktionen. Die Konfidenz ist der Support des Paares geteilt durch den Support der Antezedenz. Beide Werte werden in der Regel als Dezimalzahlen oder Prozentsätze dargestellt.
Welcher Algorithmus wird für die Warenkorbanalyse verwendet?
Apriori ist der klassische Algorithmus, und FP-Growth ist eine gängige, schnellere Alternative. Beide finden häufige Itemsets aus Transaktionsdaten, und aus diesen Itemsets werden anschließend Regeln generiert und bewertet.
Kann man eine Warenkorbanalyse in Excel durchführen?
Ja, bei kleinen Datensätzen. Eine Pivot-Tabelle zählt die Bestellungen pro Artikel, und ZÄHLENWENNS zählt die Bestellungen, die ein bestimmtes Paar enthalten. Bei großen Katalogen wächst die Anzahl der Paare jedoch schnell an, weshalb ein Skript oder ein KI-Tool praktischer ist.
Quellen: mlxtend, Association rules · mlxtend, Apriori. Das Praxisbeispiel verwendet illustrative Zahlen.