¿Qué es el análisis de la canasta de compra? Métricas, ejemplos y casos de uso

El análisis de la canasta de compra es un método para descubrir qué productos se compran juntos en una misma transacción. Examina los datos de los pedidos en busca de combinaciones de artículos que aparecen con más frecuencia de lo que predeciría el azar. Tres métricas describen cada patrón: soporte, confianza y lift. Los minoristas y las tiendas en línea lo utilizan para la venta cruzada, la creación de paquetes de productos y la disposición de productos.
Esta guía explica cómo funciona el método, cómo calcular cada métrica y cómo interpretar los resultados. También cubre los algoritmos más comunes, los principales casos de uso y las limitaciones que vale la pena conocer antes de actuar en función de una regla.
Qué es el análisis de la canasta de compra
La idea básica detrás del análisis de la canasta de compra es simple. Cada pedido es una canasta de artículos. A lo largo de miles de canastas, algunos artículos siguen apareciendo juntos. El análisis encuentra esas combinaciones y mide la fuerza de cada una.
El resultado es un conjunto de reglas de asociación. Una regla se lee: "si una canasta contiene A, también es probable que contenga C". A se denomina antecedente y C es el consecuente. Ambos pueden ser artículos individuales o grupos de artículos.
La documentación de mlxtend, una biblioteca de Python ampliamente utilizada para este trabajo, ofrece la ilustración clásica. Describe una regla que sugiere "que las personas que compran pañales también tienen probabilidades de comprar cerveza". Independientemente de si esa asociación se cumple o no en una tienda determinada, muestra la estructura del resultado.
La técnica pertenece a un campo más amplio llamado aprendizaje de reglas de asociación. Los documentos de mlxtend señalan que el algoritmo Apriori "ha sido diseñado para operar en bases de datos que contienen transacciones, como las compras de los clientes de una tienda". El sector minorista es donde comenzó el método, pero cualquier dato compuesto por canastas funciona.
Cómo funciona
Un análisis de la canasta de compra se ejecuta en dos etapas.
La primera etapa encuentra conjuntos de artículos frecuentes. Un conjunto de artículos es cualquier grupo de artículos, como {funda de teléfono, protector de pantalla}. Se considera frecuente cuando aparece en al menos una proporción mínima de todas las transacciones. Usted establece ese mínimo, llamado umbral de soporte.
La segunda etapa convierte los conjuntos de artículos en reglas. Para cada conjunto de artículos frecuente, el algoritmo lo divide en un antecedente y un consecuente, y califica la regla resultante. Los documentos de mlxtend describen la generación de reglas como "una tarea común en la minería de patrones frecuentes".
La entrada siempre tiene la misma estructura. Cada fila es una transacción y cada columna indica si un artículo estaba en ella. Las exportaciones de pedidos de la mayoría de las plataformas de comercio electrónico se pueden transformar a este formato mediante una tabla dinámica.
Tres decisiones de preparación dan forma al resultado antes de calcular cualquier métrica. Primero, decida qué constituye una transacción, que generalmente es un ID de pedido. Segundo, registre la presencia en lugar de la cantidad, de modo que tres unidades de un mismo artículo sigan contando como una sola vez. Tercero, elija el nivel de detalle. Las categorías de productos ofrecen menos reglas y más amplias, mientras que los SKU individuales ofrecen reglas más precisas que requieren más datos.
Las tres métricas principales
Cada regla obtiene tres números. Interpretarlos en conjunto es lo que distingue una regla útil de una simple coincidencia.
Soporte
El soporte es la proporción de todas las transacciones que contienen el conjunto de artículos. Si 60 de cada 1,000 pedidos contienen tanto una funda de teléfono como un protector de pantalla, el soporte de ese par es 0.06, o el 6%.
El soporte le indica qué tan común es un patrón. Una regla con un soporte muy bajo puede ser real, pero demasiado poco frecuente como para actuar en consecuencia.
Confianza
La confianza es la probabilidad de ver el consecuente, dado que la canasta ya contiene el antecedente. Es igual al soporte del par dividido por el soporte del antecedente.
La confianza tiene una dirección. La confianza de que A conduzca a C suele ser diferente de que C conduzca a A. El ejemplo práctico a continuación muestra por qué.
Lift
El lift compara la frecuencia real del par con lo que se esperaría si los dos artículos no estuvieran relacionados. Es igual a la confianza de la regla dividida por el soporte del consecuente.
Los documentos de mlxtend describen el punto de referencia claramente: "Si A y C son independientes, la puntuación de Lift será exactamente 1". Un lift superior a 1 significa que los artículos aparecen juntos con más frecuencia que por azar. Un lift inferior a 1 significa que aparecen juntos con menos frecuencia.
Un ejemplo práctico
Tomemos como ejemplo una tienda de electrónica en línea con 1,000 pedidos en un mes.
| Métrica | Valor |
|---|---|
| Pedidos que contienen una funda de teléfono | 200 |
| Pedidos que contienen un protector de pantalla | 100 |
| Pedidos que contienen ambos | 60 |
| Soporte del par | 60 / 1,000 = 0.06 |
| Confianza, de funda de teléfono a protector de pantalla | 0.06 / 0.20 = 0.30 |
| Confianza, de protector de pantalla a funda de teléfono | 0.06 / 0.10 = 0.60 |
| Lift | 0.30 / 0.10 = 3.0 |
Lea los resultados en términos sencillos. Tres de cada diez compradores de fundas de teléfono también compraron un protector de pantalla. Seis de cada diez compradores de protectores de pantalla también compraron una funda de teléfono. El par aparece junto tres veces más a menudo de lo que predeciría el azar.
Cuando reciba la tabla completa de reglas, léala en un orden fijo. Ordene por lift para encontrar las conexiones más fuertes. Descarte las reglas que estén por debajo de su soporte mínimo, ya que son demasiado poco frecuentes para actuar sobre ellas. Luego, use la confianza para decidir en qué dirección hacer la recomendación.
Las dos cifras de confianza conducen a acciones diferentes. Sugerir una funda de teléfono a los compradores de protectores de pantalla es la recomendación más sólida, porque el 60% de ellos ya adquiere una. El lift es el mismo en ambas direcciones, razón por la cual el lift es la mejor medida de la fuerza de la conexión en sí.
Otras métricas que vale la pena conocer
Las tres métricas principales cubren la mayoría de las necesidades, pero las bibliotecas informan otras que ayudan a filtrar las reglas débiles.
El apalancamiento (leverage) mide la brecha entre la coocurrencia observada y la esperada. Los documentos de mlxtend lo definen comparando la coocurrencia observada con "la frecuencia que se esperaría si A y C fueran independientes". Un apalancamiento de 0 significa independencia.
La convicción (conviction) mide con qué fuerza depende el consecuente del antecedente. Al igual que el lift, un valor de 1 indica independencia. Valores más altos significan que la regla se infringe con menos frecuencia de lo que sugeriría el azar.
En práctica, la mayoría de los equipos ordenan las reglas por lift, luego filtran por un soporte y una confianza mínimos. Esa combinación saca a la luz patrones que son fuertes, lo suficientemente comunes como para importar y confiables.
Algoritmos: Apriori y FP-Growth
Apriori es el algoritmo clásico. La documentación de mlxtend cita como fuente el artículo de 1994 de Agrawal y Srikant sobre algoritmos rápidos para la minería de reglas de asociación. Apriori construye conjuntos de artículos nivel por nivel y descarta cualquier conjunto de artículos cuyos subconjuntos no sean frecuentes, lo que mantiene la búsqueda manejable.
FP-Growth llega a los mismos conjuntos de artículos frecuentes por una ruta diferente. Los documentos de mlxtend lo describen como "una alternativa popular al establecido algoritmo Apriori". Construye un árbol de patrones frecuentes y no requiere la generación de candidatos. Los documentos señalan que esto lo hace "particularmente atractivo para grandes conjuntos de datos".
El umbral de soporte funciona de la misma manera en ambos. Los documentos de mlxtend dan un ejemplo sencillo: con un umbral de 0.5, un conjunto de artículos frecuente debe aparecer en al menos la mitad de todas las transacciones. Los umbrales en el comercio minorista suelen ser mucho más bajos, porque incluso los pares populares aparecen en una pequeña proporción de los pedidos.
Para la mayoría de las preguntas comerciales, la elección del algoritmo cambia la velocidad, no los resultados. Ambos devuelven los mismos conjuntos de artículos para el mismo umbral de soporte.
Para qué se utiliza el análisis de la canasta de compra
El análisis de la canasta de compra es más común en el comercio minorista y el comercio electrónico, pero los casos de uso van más allá.
- Venta cruzada. Recomendar el consecuente en el momento del pago cuando el antecedente está en el carrito.
- Paquetes de productos. Agrupar artículos con un alto lift en una sola oferta.
- Diseño de tienda y página. Colocar artículos que se emparejan con frecuencia cerca unos de otros, en un estante o en una página de producto.
- Planificación de inventario. Almacenar artículos emparejados juntos, de modo que la escasez de uno no disminuya silenciosamente las ventas del otro.
- Contenido y medios. Tratar una sesión de usuario como una canasta y descubrir qué artículos o videos se consumen juntos.
- Servicios. En banca o telecomunicaciones, tratar los productos de cada cliente como una canasta y descubrir qué combinaciones tienden a ir juntas.
- Revisión de campañas. Comparar el lift de un par antes y durante una campaña. Un aumento repentino demuestra que la campaña cambió el comportamiento de compra, no solo el volumen.
Cada caso de uso parte de la misma pregunta. Cuando los clientes eligen una cosa, ¿qué más suelen elegir?
La acción que sigue debe coincidir con la dirección de la confianza. Un paquete funciona cuando ambos artículos se desean juntos. Una sugerencia en el momento del pago funciona cuando un artículo conduce de manera confiable al otro.
Análisis de la canasta de compra frente a métodos relacionados
El análisis de la canasta de compra a menudo se confunde con la segmentación de clientes y con los motores de recomendación. La tabla muestra en qué se diferencian.
| Método | Unidad de análisis | Pregunta principal | Resultado típico |
|---|---|---|---|
| Análisis de la canasta de compra | Transacciones | ¿Qué artículos van juntos? | Reglas de asociación con soporte, confianza y lift |
| Segmentación de clientes | Clientes | ¿Qué clientes se parecen? | Grupos de clientes con rasgos compartidos |
| Filtrado colaborativo | Historial de clientes y artículos | ¿Qué le gustará a esta persona a continuación? | Recomendaciones personalizadas |
| Análisis de cohorte | Grupos por fecha de inicio | ¿Cómo cambia el comportamiento con el tiempo? | Tablas y curvas de retención |
Los métodos se complementan entre sí. La segmentación puede decirle quiénes son sus clientes de alto valor, y el análisis de la canasta de compra puede decirle qué compran esos clientes juntos. Nuestra guía para crear un informe de segmentación de clientes cubre la primera mitad, y nuestra explicación sobre el análisis de cohorte cubre la dimensión temporal.
Limitaciones que vale la pena conocer
Las reglas obtenidas del análisis de la canasta de compra son útiles, pero es fácil sobreinterpretarlas.
La coocurrencia no es causalidad. Un par con un alto lift le indica que dos artículos se compran juntos. No le dice que comprar uno cause la compra del otro.
Los umbrales definen el resultado. Si establece un soporte demasiado alto, se perderá pares de nicho pero valiosos. Si lo establece demasiado bajo, obtendrá miles de reglas, muchas de las cuales serán solo ruido.
Los artículos poco comunes se pierden. Es posible que un artículo costoso que se compra unas pocas veces al mes nunca alcance el umbral de soporte, incluso si sus asociaciones son fuertes.
Las devoluciones y cancelaciones distorsionan las canastas. Si los artículos devueltos permanecen en los datos, el análisis contará asociaciones que los clientes revirtieron. Nuestra guía para un informe de devoluciones de productos explica cómo medir ese aspecto por separado.
Muchos pares significan algunos patrones falsos. Un catálogo de 500 artículos tiene más de 100,000 pares posibles. Algunos mostrarán un alto lift solo por azar. Confirme las reglas importantes en un segundo período de datos antes de actuar en consecuencia.
El tiempo importa. Es posible que los patrones durante una temporada navideña no se mantengan en primavera. Ejecute el análisis en períodos comparables antes de cambiar un diseño o un paquete de productos.
Cómo realizar uno sin escribir código
La ruta clásica es Python, con una biblioteca como mlxtend, o SQL para contar pares. Ambos requieren transformar los datos de los pedidos en una fila por transacción y una columna por artículo.
Una hoja de cálculo puede manejar una versión pequeña. Una tabla dinámica cuenta los pedidos por artículo, y una fórmula COUNTIFS cuenta los pedidos que contienen ambos artículos de un par. El límite es la escala, porque el número de pares posibles crece rápidamente con el catálogo.
Un espacio de trabajo de IA puede realizar la transformación y el conteo a partir de una exportación de pedidos simple. Powerdrill Bloom admite cargas de Excel y CSV en todos los planes. Puede preguntar qué productos se compran juntos con más frecuencia y solicitar el soporte, la confianza y el lift de los pares principales.
Comience con una ejecución a nivel de categoría para ver los patrones generales. Luego, vuelva a ejecutar a nivel de SKU para las categorías que más importan.
Verifique el resultado de la misma manera que verificaría un script. Confirme el recuento de transacciones, verifique un par manualmente y asegúrese de que se hayan excluido los pedidos devueltos. La página del asistente de IA para CSV muestra el flujo de trabajo centrado en archivos.
Si tiene lista una exportación de pedidos, puede probar Powerdrill Bloom con ella y comparar los pares principales con lo que su equipo espera.
Preguntas frecuentes
¿Qué es el análisis de la canasta de compra en palabras sencillas?
Es una forma de descubrir qué productos tienden a comprar juntos los clientes. Examina muchos pedidos y mide con qué frecuencia aparece cada combinación, en comparación con lo que predeciría el azar.
¿Qué es el lift en el análisis de la canasta de compra?
El lift compara la frecuencia con la que dos artículos aparecen juntos con la frecuencia con la que aparecerían si no estuvieran relacionados. Un lift de 1 significa que no hay asociación. Por encima de 1 significa que aparecen juntos más de lo esperado, y por debajo de 1 significa menos.
¿Cómo se calculan el soporte y la confianza?
El soporte es el número de transacciones que contienen el conjunto de artículos dividido por el total de transacciones. La confianza es el soporte del par dividido por el soporte del antecedente. Ambos se muestran generalmente como decimales o porcentajes.
¿Qué algoritmo se utiliza para el análisis de la canasta de compra?
Apriori es el algoritmo clásico y FP-Growth es una alternativa común más rápida. Ambos encuentran conjuntos de artículos frecuentes a partir de los datos de las transacciones, y luego se generan y califican las reglas a partir de esos conjuntos de artículos.
¿Se puede hacer un análisis de la canasta de compra en Excel?
Sí, para conjuntos de datos pequeños. Una tabla dinámica cuenta los pedidos por artículo y COUNTIFS cuenta los pedidos que contienen un par. Para catálogos grandes, el número de pares crece rápidamente, por lo que un script o una herramienta de IA resulta más práctico.
Fuentes: mlxtend, Association rules · mlxtend, Apriori. El ejemplo práctico utiliza cifras ilustrativas.