O que é Análise de Cesta de Compras? Métricas, Exemplos e Casos de Uso

A análise de cesta de compras é um método para descobrir quais produtos são comprados juntos na mesma transação. Ela varre os dados de pedidos em busca de combinações de itens que aparecem com mais frequência do que o acaso preveria. Três métricas descrevem cada padrão: suporte, confiança e lift. Varejistas e lojas online a utilizam para cross-selling, bundles e posicionamento de produtos.
Este guia explica como o método funciona, como calcular cada métrica e como ler os resultados. Ele também aborda os algoritmos comuns, os principais casos de uso e os limites que vale a pena conhecer antes de agir com base em uma regra.
O que é a análise de cesta de compras
A ideia básica por trás da análise de cesta de compras é simples. Cada pedido é uma cesta de itens. Em milhares de cestas, alguns itens continuam aparecendo juntos. A análise encontra essas combinações e mede a força de cada uma delas.
O resultado é um conjunto de regras de associação. Uma regra diz: "se uma cesta contém A, também é provável que contenha C". A é chamado de antecedente e C é o consequente. Ambos podem ser itens individuais ou grupos de itens.
A documentação do mlxtend, uma biblioteca Python amplamente utilizada para esse trabalho, traz a ilustração clássica. Ela descreve uma regra sugerindo "que as pessoas que compram fraldas também têm probabilidade de comprar cerveja". Independentemente de essa associação se confirmar ou não em uma determinada loja, ela mostra o formato do resultado.
A técnica pertence a um campo mais amplo chamado aprendizado de regras de associação. A documentação do mlxtend observa que o algoritmo Apriori "foi projetado para operar em bancos de dados que contêm transações, como compras feitas por clientes de uma loja". O varejo é onde o método começou, mas qualquer dado composto por cestas funciona.
Como funciona
Uma análise de cesta de compras funciona em duas etapas.
A primeira etapa encontra conjuntos de itens frequentes. Um conjunto de itens é qualquer grupo de itens, como {capinha de celular, película protetora}. Ele é considerado frequente quando aparece em pelo menos uma parcela mínima de todas as transações. Você define esse mínimo, chamado de limite de suporte.
A segunda etapa transforma os conjuntos de itens em regras. Para cada conjunto de itens frequente, o algoritmo o divide em um antecedente e um consequente e pontua a regra resultante. A documentação do mlxtend descreve a geração de regras como "uma tarefa comum na mineração de padrões frequentes".
A entrada tem sempre o mesmo formato. Cada linha é uma transação e cada coluna indica se um item estava nela. As exportações de pedidos da maioria das plataformas de e-commerce podem ser reorganizadas para esse formato com uma tabela dinâmica.
Três escolhas de preparação moldam o resultado antes que qualquer métrica seja calculada. Primeiro, decida o que é uma transação, que geralmente é um ID de pedido. Segundo, registre a presença em vez da quantidade, de modo que três unidades de um mesmo item ainda contem como uma. Terceiro, escolha o nível de detalhe. Categorias de produtos geram menos regras e mais amplas, enquanto SKUs individuais geram regras mais precisas que exigem mais dados.
As três métricas principais
Cada regra recebe três números. Lê-los em conjunto é o que separa uma regra útil de uma mera coincidência.
Suporte
O suporte é a parcela de todas as transações que contêm o conjunto de itens. Se 60 de 1.000 pedidos contêm tanto uma capinha de celular quanto uma película protetora, o suporte desse par é 0,06, ou 6%.
O suporte indica o quão comum é um padrão. Uma regra com suporte muito baixo pode ser real, mas rara demais para que se possa agir com base nela.
Confiança
A confiança é a probabilidade de ver o consequente, dado que a cesta já contém o antecedente. Ela é igual ao suporte do par dividido pelo suporte do antecedente.
A confiança tem uma direção. A confiança de A levando a C geralmente é diferente de C levando a A. O exemplo prático abaixo mostra o porquê.
Lift
O lift compara a frequência real do par com o que seria esperado se os dois itens não tivessem relação. Ele é igual à confiança da regra dividida pelo suporte do consequente.
A documentação do mlxtend descreve o ponto de referência claramente: "Se A e C forem independentes, a pontuação de Lift será exatamente 1". Um lift acima de 1 significa que os itens aparecem juntos com mais frequência do que o acaso. Um lift abaixo de 1 significa que eles aparecem juntos com menos frequência.
Um exemplo prático
Considere uma loja online de eletrônicos com 1.000 pedidos em um mês.
| Medida | Valor |
|---|---|
| Pedidos contendo uma capinha de celular | 200 |
| Pedidos contendo uma película protetora | 100 |
| Pedidos contendo ambos | 60 |
| Suporte do par | 60 / 1.000 = 0,06 |
| Confiança, capinha de celular para película protetora | 0,06 / 0,20 = 0,30 |
| Confiança, película protetora para capinha de celular | 0,06 / 0,10 = 0,60 |
| Lift | 0,30 / 0,10 = 3,0 |
Leia os resultados em termos simples. Três em cada dez compradores de capinhas de celular também compraram uma película protetora. Seis em cada dez compradores de películas protetoras também compraram uma capinha de celular. O par aparece junto três vezes mais frequentemente do que o acaso preveria.
Quando a tabela completa de regras for gerada, leia-a em uma ordem fixa. Ordene pelo lift para encontrar as conexões mais fortes. Descarte as regras abaixo do seu suporte mínimo, pois são raras demais para se agir com base nelas. Em seguida, use a confiança para decidir em qual direção recomendar.
Os dois valores de confiança levam a ações diferentes. Sugerir uma capinha de celular para compradores de películas protetoras é a recomendação mais forte, porque 60% deles já a levam. O lift é o mesmo em ambas as direções, e é por isso que o lift é a melhor medida da força da conexão em si.
Outras métricas que vale a pena conhecer
As três métricas principais cobrem a maioria das necessidades, mas as bibliotecas relatam outras que ajudam a filtrar regras fracas.
Leverage mede a lacuna entre a coocorrência observada e a esperada. A documentação do mlxtend a define comparando a coocorrência observada com "a frequência que seria esperada se A e C fossem independentes". Um leverage de 0 significa independência.
Conviction mede o quão fortemente o consequente depende do antecedente. Assim como o lift, um valor de 1 indica independência. Valores mais altos significam que a regra é violada com menos frequência do que o acaso sugeriria.
Na prática, mostras equipes ordenam as regras por lift e, em seguida, filtram por um suporte e confiança mínimos. Essa combinação revela padrões que são fortes, comuns o suficiente para serem relevantes e confiáveis.
Algoritmos: Apriori e FP-Growth
O Apriori é o algoritmo clássico. A documentação do mlxtend cita o artigo de 1994 de Agrawal e Srikant sobre algoritmos rápidos para mineração de regras de associação como sua fonte. O Apriori constrói conjuntos de itens nível por nível e poda qualquer conjunto cujos subconjuntos não sejam frequentes, o que mantém a busca gerenciável.
O FP-Growth chega aos mesmos conjuntos de itens frequentes por um caminho diferente. A documentação do mlxtend o descreve como "uma alternativa popular ao consagrado algoritmo Apriori". Ele constrói uma árvore de padrões frequentes e não requer a geração de candidatos. A documentação diz que isso o torna "particularmente atraente para grandes conjuntos de dados".
O limite de suporte funciona da mesma forma em ambos. A documentação do mlxtend dá um exemplo simples: com um limite de 0,5, um conjunto de itens frequente deve aparecer em pelo menos metade de todas as transações. Os limites no varejo costumam ser muito mais baixos, porque mesmo os pares populares aparecem em uma pequena parcela dos pedidos.
Para a maioria das questões de negócios, a escolha do algoritmo altera a velocidade, não os resultados. Ambos retornam os mesmos conjuntos de itens para o mesmo limite de suporte.
Para que serve a análise de cesta de compras
A análise de cesta de compras é mais comum no varejo e no e-commerce, mas os casos de uso vão além.
- Cross-selling. Recomende o consequente no checkout quando o antecedente estiver no carrinho.
- Bundles. Agrupe itens com alto lift em uma única oferta.
- Layout de loja e de página. Posicione itens frequentemente associados próximos uns dos outros, em uma prateleira ou em uma página de produto.
- Planejamento de estoque. Abasteça itens associados juntos, para que a falta de um não prejudique silenciosamente as vendas do outro.
- Conteúdo e mídia. Trate a sessão de um usuário como uma cesta e descubra quais artigos ou vídeos são consumidos juntos.
- Serviços. No setor bancário ou de telecomunicações, trate os produtos de cada cliente como uma cesta e descubra quais combinações tendem a andar juntas.
- Avaliação de campanhas. Compare o lift de um par antes e durante uma campanha. Um aumento mostra que a campanha mudou o comportamento de compra, não apenas o volume.
Cada caso de uso parte da mesma pergunta. Quando os clientes escolhem uma coisa, o que mais eles tendem a escolher?
A ação a ser tomada deve corresponder à direção da confiança. Um bundle funciona quando ambos os itens são desejados juntos. Uma sugestão no checkout funciona quando um item leva de forma confiável ao outro.
Análise de cesta de compras vs. métodos relacionados
A análise de cesta de compras é frequentemente confundida com segmentação de clientes e com mecanismos de recomendação. A tabela mostra como eles se diferenciam.
| Método | Unidade de análise | Pergunta principal | Resultado típico |
|---|---|---|---|
| Market basket analysis | Transações | Quais itens andam juntos? | Regras de associação com suporte, confiança e lift |
| Customer segmentation | Clientes | Quais clientes são parecidos? | Grupos de clientes com características compartilhadas |
| Collaborative filtering | Histórico de clientes e itens | Do que esta pessoa vai gostar a seguir? | Recomendações personalizadas |
| Cohort analysis | Grupos por data de início | Como o comportamento muda ao longo do tempo? | Curvas e tabelas de retenção |
Os métodos se complementam. A segmentação pode lhe dizer quem são seus clientes de alto valor, e a análise de cesta de compras pode lhe dizer o que esses clientes compram juntos. Nosso guia para criar um relatório de segmentação de clientes cobre a primeira parte, e nossa explicação sobre análise de coorte cobre a dimensão temporal.
Limites que vale a pena conhecer
As regras da análise de cesta de compras são úteis, mas é fácil superestimá-las.
Coocorrência não é causalidade. Um par com alto lift indica que dois itens são comprados juntos. Isso não significa que a compra de um cause a compra do outro.
Os limites moldam a resposta. Defina um suporte muito alto e você perderá pares de nicho, mas valiosos. Defina-o muito baixo e você obterá milhares de regras, muitas delas apenas ruído.
Itens raros se perdem. Um item caro comprado poucas vezes no mês pode nunca atingir o limite de suporte, mesmo que suas associações sejam fortes.
Devoluções e cancelamentos distorcem as cestas. Se os itens devolvidos permanecerem nos dados, a análise contará associações que os clientes desfizeram. Nosso guia para um relatório de devoluções de produtos aborda como medir esse aspecto separadamente.
Muitos pares significam alguns padrões falsos. Um catálogo de 500 itens tem mais de 100.000 pares possíveis. Alguns apresentarão alto lift apenas por acaso. Confirme as regras importantes em um segundo período de dados antes de agir com base nelas.
O tempo importa. Padrões durante uma temporada de festas podem não se manter na primavera. Execute a análise em períodos comparáveis antes de alterar um layout ou um bundle.
Como executar uma análise sem escrever código
O caminho clássico é o Python, com uma biblioteca como o mlxtend, ou SQL para contar os pares. Ambos exigem a reorganização dos dados de pedidos em uma linha por transação e uma coluna por item.
Uma planilha pode lidar com uma versão pequena. Uma tabela dinâmica conta os pedidos por item, e a fórmula CONT.SES conta os pedidos que contêm ambos os itens de um par. O limite é a escala, pois o número de pares possíveis cresce rapidamente com o catálogo.
Um espaço de trabalho de IA pode fazer a reorganização e a contagem a partir de uma exportação simples de pedidos. O Powerdrill Bloom permite o upload de arquivos do Excel e CSV em todos os planos. Você pode perguntar quais produtos são comprados juntos com mais frequência e solicitar o suporte, a confiança e o lift para os principais pares.
Comece com uma execução em nível de categoria para ver os padrões gerais. Em seguida, execute novamente em nível de SKU para as categorias mais importantes.
Verifique o resultado da mesma forma que você verificaria um script. Confirme a contagem de transações, faça uma verificação rápida de um par manualmente e certifique-se de que os pedidos devolvidos foram excluídos. A página do assistente de IA para CSV mostra o fluxo de trabalho focado em arquivos.
Se você tiver uma exportação de pedidos pronta, poderá testar o Powerdrill Bloom nela e comparar os principais pares com o que sua equipe espera.
Perguntas frequentes
O que é a análise de cesta de compras em palavras simples?
É uma maneira de descobrir quais produtos os clientes tendem a comprar juntos. Ela analisa muitos pedidos e mede a frequência com que cada combinação aparece, em comparação com o que o acaso preveria.
O que é lift na análise de cesta de compras?
O lift compara a frequência com que dois itens aparecem juntos com a frequência com que apareceriam se não tivessem relação. Um lift de 1 significa que não há associação. Acima de 1 significa que eles aparecem juntos mais do que o esperado, e abaixo de 1 significa menos.
Como calcular o suporte e a confiança?
O suporte é o número de transações que contêm o conjunto de itens dividido pelo total de transações. A confiança é o suporte do par dividido pelo suporte do antecedente. Ambos costumam ser exibidos como decimais ou porcentagens.
Qual algoritmo é usado para a análise de cesta de compras?
O Apriori é o algoritmo clássico, e o FP-Growth é uma alternativa comum mais rápida. Ambos encontram conjuntos de itens frequentes a partir dos dados de transações, e as regras são então geradas e pontuadas a partir desses conjuntos de itens.
É possível fazer análise de cesta de compras no Excel?
Sim, para pequenos conjuntos de dados. Uma tabela dinâmica conta os pedidos por item, e a função CONT.SES conta os pedidos que contêm um par. Para catálogos grandes, o número de pares cresce rapidamente, de modo que um script ou uma ferramenta de IA é mais prático.
Sources: mlxtend, Regras de associação · mlxtend, Apriori. O exemplo prático utiliza números ilustrativos.