Semaine des super promosClaude Skills — 20 % DE RÉDUCTION
Glossary

Qu'est-ce que l'analyse du panier d'achat ? Métriques, exemples et cas d'usage

Powerdrill Bloom·
Qu'est-ce que l'analyse du panier d'achat ? Métriques, exemples et cas d'usage

L'analyse du panier d'achat est une méthode permettant de découvrir quels produits sont achetés ensemble lors d'une même transaction. Elle parcourt les données de commande à la recherche de combinaisons d'articles qui apparaissent plus souvent que le simple hasard ne le prédirait. Trois indicateurs décrivent chaque modèle : le support, la confiance et le lift. Les détaillants et les boutiques en ligne l'utilisent pour la vente croisée, les offres groupées et le placement de produits.

Ce guide explique comment fonctionne cette méthode, comment calculer chaque indicateur et comment interpréter les résultats. Il présente également les algorithmes courants, les principaux cas d'usage et les limites à connaître avant de mettre en œuvre une règle.

Qu'est-ce que l'analyse du panier d'achat ?

L'idée de base de l'analyse du panier d'achat est simple. Chaque commande est un panier d'articles. Sur des milliers de paniers, certains articles apparaissent systématiquement ensemble. L'analyse identifie ces combinaisons et mesure la force de chacune d'elles.

Le résultat est un ensemble de règles d'association. Une règle se lit ainsi : « si un panier contient A, il est également susceptible de contenir C ». A est appelé l'antécédent, et C le conséquent. Tous deux peuvent être des articles uniques ou des groupes d'articles.

La documentation de mlxtend, une bibliothèque Python largement utilisée pour ce travail, en donne l'illustration classique. Elle décrit une règle suggérant « que les personnes qui achètent des couches sont également susceptibles d'acheter de la bière ». Que cette association se vérifie ou non dans un magasin donné, elle montre la forme du résultat obtenu.

La technique appartient à un domaine plus large appelé l'apprentissage de règles d'association. La documentation de mlxtend note que l'algorithme Apriori « a été conçu pour fonctionner sur des bases de données contenant des transactions, telles que les achats des clients d'un magasin ». Le commerce de détail est le domaine où la méthode a débuté, mais toutes les données structurées sous forme de paniers conviennent.

Comment ça marche

Une analyse du panier d'achat se déroule en deux étapes.

La première étape consiste à trouver les ensembles d'articles fréquents. Un ensemble d'articles est un groupe d'articles, comme {coque de téléphone, protection d'écran}. Il est considéré comme fréquent lorsqu'il apparaît dans au moins une part minimale de toutes les transactions. Vous définissez ce minimum, appelé le seuil de support.

La deuxième étape transforme les ensembles d'articles en règles. Pour chaque ensemble d'articles fréquent, l'algorithme le divise en un antécédent et un conséquent, puis évalue la règle qui en résulte. La documentation de mlxtend décrit la génération de règles comme « une tâche courante dans l'extraction de motifs fréquents ».

Les données d'entrée ont toujours la même structure. Chaque ligne représente une transaction, et chaque colonne indique si un article y était présent. Les exports de commandes de la plupart des plateformes e-commerce peuvent être réorganisés dans ce format à l'aide d'un tableau croisé dynamique.

Trois choix de préparation façonnent le résultat avant même le calcul du moindre indicateur. Premièrement, déterminez ce qu'est une transaction, généralement un identifiant de commande unique. Deuxièmement, enregistrez la présence plutôt que la quantité, de sorte que trois unités d'un même article ne comptent que pour une seule fois. Troisièmement, choisissez le niveau de détail. Les catégories de produits génèrent des règles moins nombreuses et plus larges, tandis que les SKU individuels fournissent des règles mais nécessitent davantage de données.

Les trois indicateurs clés

Chaque règle est associée à trois chiffres. C'est leur lecture conjointe qui permet de distinguer une règle utile d'une simple coïncidence.

Le support

Le support est la part de toutes les transactions qui contiennent l'ensemble d'articles. Si 60 commandes sur 1 000 contiennent à la fois une coque de téléphone et une protection d'écran, le support de cette paire est de 0,06, soit 6 %.

Le support vous indique à quel point un modèle est fréquent. Une règle avec un support très faible peut être réelle, mais trop rare pour qu'on puisse l'exploiter.

La confiance

La confiance est la probabilité de voir le conséquent, sachant que le panier contient déjà l'antécédent. Elle est égale au support de la paire divisé par le support de l'antécédent.

La confiance a un sens. La confiance de A menant à C est généralement différente de celle de C menant à A. L'exemple concret ci-dessous montre pourquoi.

Le lift

Le lift compare la fréquence réelle de la paire avec celle à laquelle on pourrait s'attendre si les deux articles n'étaient pas liés. Il est égal à la confiance de la règle divisée par le support du conséquent.

La documentation de mlxtend décrit clairement le point de référence : « Si A et C sont indépendants, le score de Lift sera exactement de 1 ». Un lift supérieur à 1 signifie que les articles apparaissent ensemble plus souvent que le hasard. Un lift inférieur à 1 signifie qu'ils apparaissent ensemble moins souvent.

Un exemple concret

Prenons l'exemple d'une boutique d'électronique en ligne enregistrant 1 000 commandes par mois.

Mesure Valeur
Commandes contenant une coque de téléphone 200
Commandes contenant une protection d'écran 100
Commandes contenant les deux 60
Support de la paire 60 / 1 000 = 0.06
Confiance, coque de téléphone vers protection d'écran 0.06 / 0.20 = 0.30
Confiance, protection d'écran vers coque de téléphone 0.06 / 0.10 = 0.60
Lift 0.30 / 0.10 = 3.0

Exprimons ces résultats en termes simples. Trois acheteurs de coque de téléphone sur dix ont également acheté une protection d'écran. Six acheteurs de protection d'écran sur dix ont également acheté une coque de téléphone. La paire apparaît ensemble trois fois plus souvent que ce que le hasard prédirait.

Lorsque le tableau complet des règles s'affiche, lisez-le dans un ordre précis. Triez par lift pour trouver les liens les plus forts. Éliminez les règles inférieures à votre support minimum, car elles sont trop rares pour être exploitées. Utilisez ensuite la confiance pour décider dans quelle direction faire vos recommandations.

Les deux valeurs de confiance mènent à des actions différentes. Suggérer une coque de téléphone aux acheteurs de protection d'écran est la recommandation la plus forte, car 60 % d'entre eux en prennent déjà une. Le lift est le même dans les deux sens, c'est pourquoi le lift est la meilleure mesure de la force du lien en lui-même.

Autres indicateurs à connaître

Les trois indicateurs clés couvrent la plupart des besoins, mais les bibliothèques en fournissent d'autres qui aident à filtrer les règles faibles.

Le Leverage mesure l'écart entre la cooccurrence observée et attendue. La documentation de mlxtend le définit en comparant la cooccurrence observée avec « la fréquence à laquelle on s'attendrait si A et C étaient indépendants ». Un leverage de 0 indique une indépendance.

La Conviction mesure à quel point le conséquent dépend de l'antécédent. Tout comme le lift, une valeur de 1 indique l'indépendance. Des valeurs plus élevées signifient que la règle est moins souvent enfreinte que ce que le hasard suggérerait.

En pratique, la plupart des équipes trient les règles par lift, puis filtrent selon un support et une confiance minimums. Cette combinaison permet de faire ressortir des modèles forts, suffisamment fréquents pour être significatifs, et fiables.

Algorithmes : Apriori et FP-Growth

Apriori est l'algorithme classique. La documentation de mlxtend cite comme source l'article de 1994 d'Agrawal et Srikant sur les algorithmes rapides pour l'extraction de règles d'association. Apriori construit des ensembles d'articles niveau par niveau et élimine tout ensemble dont les sous-ensembles ne sont pas fréquents, ce qui permet de garder la recherche gérable.

FP-Growth parvient aux mêmes ensembles d'articles fréquents par un chemin différent. La documentation de mlxtend le décrit comme « une alternative populaire à l'algorithme Apriori établi ». Il construit un arbre de motifs fréquents et ne nécessite pas de génération de candidats. La documentation précise que cela le rend « particulièrement attractif pour les grands ensembles de données ».

Le seuil de support fonctionne de la même manière pour les deux. La documentation de mlxtend donne un exemple simple : avec un seuil de 0,5, un ensemble d'articles fréquent doit apparaître dans au moins la moitié de toutes les transactions. Dans le commerce de détail, les seuils sont généralement beaucoup plus bas, car même les paires populaires n'apparaissent que dans une petite partie des commandes.

Pour la plupart des problématiques commerciales, le choix de l'algorithme influe sur la vitesse, pas sur les résultats. Tous deux renvoient les mêmes ensembles d'articles pour un même seuil de support.

À quoi sert l'analyse du panier d'achat

L'analyse du panier d'achat est très courante dans le commerce de détail et l'e-commerce, mais ses cas d'usage vont bien au-delà.

  • Vente croisée. Recommander le conséquent lors du passage en caisse lorsque l'antécédent est dans le panier.
  • Offres groupées. Proposer des articles ayant un lift élevé au sein d'une offre unique.
  • Agencement du magasin et de la page. Placer les articles fréquemment associés à proximité les uns des autres, en rayon ou sur une page produit.
  • Planification des stocks. Stocker ensemble les articles associés, afin qu'une rupture de stock sur l'un ne vienne pas freiner discrètement les ventes de l'autre.
  • Contenu et médias. Traiter une session utilisateur comme un panier et identifier quels articles ou vidéos sont consommés ensemble.
  • Services. Dans la banque ou les télécoms, traiter les produits de chaque client comme un panier et identifier les combinaisons qui ont tendance à s'associer.
  • Analyse de campagne. Comparer le lift d'une paire avant et pendant une campagne. Un bond montre que la campagne a modifié le comportement d'achat, et pas seulement le volume.

Chaque cas d'usage part de la même question. Lorsque les clients choisissent un article, qu'ont-ils tendance à choisir d'autre ?

L'action qui en découle doit correspondre au sens de la confiance. Une offre groupée fonctionne lorsque les deux articles sont souhaités ensemble. Une suggestion au moment du paiement fonctionne lorsqu'un article mène de manière fiable à l'autre.

Analyse du panier d'achat vs méthodes associées

L'analyse du panier d'achat est souvent confondue avec la segmentation client et les moteurs de recommandation. Le tableau montre en quoi elles diffèrent.

Méthode Unité d'analyse Question principale Résultat type
Analyse du panier d'achat Transactions Quels articles vont ensemble ? Règles d'association avec support, confiance et lift
Segmentation client Clients Quels clients se ressemblent ? Groupes de clients partageant des caractéristiques communes
Filtrage collaboratif Historique des clients et des articles Qu'est-ce que cette personne aimera ensuite ? Recommandations personnalisées
Analyse de cohorte Groupes par date de début Comment le comportement évolue-t-il dans le temps ? Courbes et tableaux de rétention

Ces méthodes sont complémentaires. La segmentation peut vous indiquer qui sont vos clients à forte valeur ajoutée, et l'analyse du panier d'achat peut vous révéler ce que ces clients achètent ensemble. Notre guide pour créer un rapport de segmentation client couvre la première partie, et nos explications sur l'analyse de cohorte couvrent la dimension temporelle.

Limites à connaître

Les règles issues de l'analyse du panier d'achat sont utiles, mais il est facile de les surinterpréter.

La cooccurrence n'est pas la causalité. Une paire avec un lift élevé vous indique que deux articles sont achetés ensemble. Elle ne vous dit pas que l'achat de l'un provoque l'achat de l'autre.

Les seuils façonnent la réponse. Si vous fixez un support trop élevé, vous passerez à côté de paires de niche mais précieuses. Si vous le fixez trop bas, vous obtiendrez des milliers de règles, dont beaucoup ne seront que du bruit.

Les articles rares se perdent. Un article cher acheté seulement quelques fois par mois risque de ne jamais atteindre le seuil de support, même si ses associations sont fortes.

Les retours et les annulations faussent les paniers. Si les articles retournés restent dans les données, l'analyse comptabilise des associations que les clients ont finalement annulées. Notre guide pour créer un rapport sur les retours de produits explique comment mesurer cet aspect séparément.

Un grand nombre de paires engendre de faux modèles. Un catalogue de 500 articles compte plus de 100 000 paires possibles. Certaines afficheront un lift élevé par simple hasard. Confirmez les règles importantes sur une seconde période de données avant d'agir en conséquence.

Le facteur temps est important. Les tendances observées pendant les fêtes de fin d'année peuvent ne pas se vérifier au printemps. Lancez l'analyse sur des périodes comparables avant de modifier un agencement ou une offre groupée.

Comment réaliser une analyse sans écrire de code

La voie classique passe par Python, avec une bibliothèque comme mlxtend, ou par SQL pour compter les paires. Les deux nécessitent de réorganiser les données de commande pour obtenir une ligne par transaction et une colonne par article.

Un tableur peut gérer une version simplifiée. Un tableau croisé dynamique compte les commandes par article, et une formule NB.SI.ENS compte les commandes contenant les deux articles d'une paire. La limite réside dans le passage à l'échelle, car le nombre de paires possibles augmente rapidement avec la taille du catalogue.

Un espace de travail IA peut s'occuper de la réorganisation et du comptage à partir d'un simple export de commandes. Powerdrill Bloom permet d'importer des fichiers Excel et CSV dans tous ses abonnements. Vous pouvez lui demander quels produits sont le plus souvent achetés ensemble et obtenir le support, la confiance et le lift pour les meilleures paires.

Commencez par une analyse au niveau des catégories pour dégager les grandes tendances. Relancez-la ensuite au niveau des SKU pour les catégories les plus importantes.

Vérifiez le résultat de la même manière que vous vérifieriez un script. Confirmez le nombre de transactions, contrôlez manuellement une paire au hasard et assurez-vous que les commandes retournées ont été exclues. La page de l'assistant IA pour CSV présente ce flux de travail axé sur les fichiers.

Si vous disposez d'un export de commandes prêt, vous pouvez essayer Powerdrill Bloom et comparer les meilleures paires obtenues avec les attentes de votre équipe.

Questions fréquentes

Qu'est-ce que l'analyse du panier d'achat en termes simples ?

C'est un moyen de découvrir quels produits les clients ont tendance à acheter ensemble. Elle examine un grand nombre de commandes et mesure la fréquence d'apparition de chaque combinaison, par rapport à ce que le hasard prédirait.

Qu'est-ce que le lift dans l'analyse du panier d'achat ?

Le lift compare la fréquence à laquelle deux articles apparaissent ensemble à celle à laquelle ils apparaîtraient s'ils n'étaient pas liés. Un lift de 1 signifie qu'il n'y a aucune association. Au-dessus de 1, ils apparaissent ensemble plus souvent que prévu, et en dessous de 1, moins souvent.

Comment calcule-t-on le support et la confiance ?

Le support est le nombre de transactions contenant l'ensemble d'articles divisé par le nombre total de transactions. La confiance est le support de la paire divisé par le support de l'antécédent. Les deux sont généralement exprimés sous forme de décimales ou de pourcentages.

Quel algorithme est utilisé pour l'analyse du panier d'achat ?

Apriori est l'algorithme classique, et FP-Growth est une alternative courante plus rapide. Tous deux identifient les ensembles d'articles fréquents à partir des données de transaction, puis des règles sont générées et évaluées à partir de ces ensembles d'articles.

Peut-on faire une analyse du panier d'achat dans Excel ?

Oui, pour de petits ensembles de données. Un tableau croisé dynamique compte les commandes par article, et la fonction NB.SI.ENS compte les commandes contenant une paire. Pour les grands catalogues, le nombre de paires augmente rapidement, ce qui rend l'utilisation d'un script ou d'un outil d'IA plus pratique.

Sources : mlxtend, Association rules · mlxtend, Apriori. L'exemple concret utilise des chiffres illustratifs.