Super Sale WeekClaude Skills — 20% OFF
Tips

Como encontrar outliers em um conjunto de dados sem escrever código (Guia de 2026)

Powerdrill Team·
Como encontrar outliers em um conjunto de dados sem escrever código (Guia de 2026)

Você pode encontrar outliers sem escrever código usando a regra do IQR, z-scores ou um box plot — todos os três funcionam em uma planilha. A regra do IQR sinaliza valores que estão a mais de 1,5 intervalo interquartil além dos quartis; os z-scores sinalizam valores a mais de três desvios padrão da média. Eles frequentemente discordam, e entender o porquê é a verdadeira habilidade.

Encontrar um outlier é a parte fácil. Decidir o que fazer com ele é a parte que determina se sua análise é honesta, e nenhum método responde isso por você.

Este guia aborda por que os dois métodos padrão discordam e três maneiras de detectar outliers sem código. Em seguida, aborda como decidir se um determinado outlier deve ser removido, mantido ou relatado separadamente.

Por que os outliers são mais complexos do que "apenas deletá-los"

Os dois métodos padrão discordam por design

A regra do IQR funciona a partir de quartis, que são posicionais. Ela não se importa com o quão extremo é um valor, apenas onde ele se posiciona na ordem de classificação. Isso a torna resistente a distorções causadas justamente pelos outliers que ela está procurando.

Os z-scores funcionam a partir da média e do desvio padrão, e ambos são influenciados por valores extremos. Um único valor enorme infla o desvio padrão, o que reduz todos os z-scores — incluindo o dele mesmo. Em um conjunto de dados pequeno, um único outlier drástico pode se esconder dessa forma.

É por isso que uma mesma coluna pode apresentar quatro outliers pelo IQR e apenas um pelos z-scores. Os métodos não são inconsistentes; eles medem coisas diferentes.

A decisão não é estatística

Uma transação de $2 milhões em um arquivo de pedidos de $200 é sinalizada por todos os métodos. Se ela deve ser removida ou não depende de fatos aos quais nenhum método tem acesso.

Se for um erro de digitação com uma vírgula decimal invertida, remova-o. Se for uma transação corporativa real, removê-la excluirá seu cliente mais importante da análise. Se for uma transação de teste que alguém esqueceu de limpar, remova-a e verifique se há outras. Três ações diferentes, uma mesma sinalização.

O formato da distribuição quebra as premissas

Ambos os métodos padrão pressupõem algo aproximadamente em formato de sino. Renda, visualizações de página, valores de pedidos e durações de sessão geralmente são assimétricos, com uma cauda longa à direita, onde valores altos são normais, e não excepcionais.

Aplique uma regra de z-score a esse tipo de coluna e você sinalizará uma parcela substancial de dados perfeitamente comuns. A solução é verificar o formato primeiro e considerar uma transformação logarítmica ou usar um corte baseado em percentil.

O custo disso para você

Médias que não descrevem ninguém. Um único valor extremo pode deslocar a média a ponto de ela ficar fora da faixa onde a maior parte dos seus dados realmente está. E decisões acabam sendo tomadas com base nesse número.

Gráficos com um eixo ilegível. Um valor dez vezes maior que o restante comprime todo o resto em uma linha plana perto da base. O gráfico está tecnicamente correto, mas não comunica nada.

Exclusão silenciosa. O pior cenário é alguém remover discretamente linhas inconvenientes antes de compartilhar o arquivo. Ninguém adiante saberá que a base mudou, e o resultado não poderá ser reproduzido.

Três maneiras de encontrar outliers sem código

Opção 1: A regra do IQR

Use QUARTILE para obter o primeiro e o terceiro quartis e, em seguida, subtraia para obter o intervalo interquartil. Sinalize qualquer valor abaixo de Q1 menos 1,5 × IQR ou acima de Q3 mais 1,5 × IQR.

Este é o padrão por um motivo: é resistente a valores extremos e não exige premissas de distribuição. Em dados muito assimétricos, ele ainda sinaliza excessivamente a cauda direita, portanto, verifique o formato antes de confiar na contagem.

Opção 2: Z-scores

Calcule a média e o desvio padrão com STDEV.P e, em seguida, calcule a quantos desvios padrão cada valor está da média. Mais de três é o limite usual.

Isso funciona bem em dados aproximadamente simétricos e fornece uma magnitude em vez de apenas uma marcação de sim ou não, o que é útil para classificação. No entanto, não é confiável em amostras pequenas e colunas assimétricas.

Opção 3: Um box plot

Plote a coluna como um box plot e analise os pontos além dos bigodes. O box plot do Excel usa a mesma convenção de 1,5 × IQR, de modo que o resultado coincide com a Opção 1. A diferença é que você visualiza o formato da distribuição ao mesmo tempo.

Esta é a maneira mais rápida de verificar se os outros dois métodos são adequados. Se a caixa estiver muito deslocada para um dos lados com uma cauda longa, desconfie de qualquer regra de limite rígido.

Onde todos os três encontram o mesmo limite

Cada método retorna uma lista de linhas sinalizadas. Nenhum deles diz quais sinalizações são erros, quais são extremos reais e quais significam apenas que a coluna é assimétrica, e não "suja".

Responder a isso exige analisar as linhas sinalizadas em contexto. O que mais está nessa linha. Se elas se concentram em um único período de tempo ou em um único sistema de origem. Se o mesmo cliente aparece repetidamente. Isso é investigação, não cálculo, e é aí que o tempo realmente é gasto.

Como encontrar outliers com o Powerdrill Bloom

Passo 1: Faça o upload dos seus dados

Faça o upload do arquivo Excel ou CSV. O Powerdrill Bloom analisa o perfil de cada coluna assim que ela é carregada, de modo que o formato da distribuição e os valores extremos ficam visíveis antes mesmo de você escolher um método de detecção.

Fazendo upload de uma planilha para encontrar outliers em um conjunto de dados com o Powerdrill Bloom

Passo 2: Descreva a verificação em linguagem natural

Pergunte diretamente: sinalize valores fora de 1,5 intervalo interquartil nesta coluna e mostre-me as linhas completas para que eu possa ver o contexto. Prossiga com as perguntas que realmente resolvem a decisão: se as linhas sinalizadas se concentram por data ou origem, se o mesmo identificador se repete e como as estatísticas descritivas mudam se eles forem excluídos.

Passo 3: Exporte o gráfico, relatório ou apresentação

Extraia o box plot, uma tabela de linhas sinalizadas com seu contexto ou uma nota por escrito registrando quais linhas foram excluídas e o porquê.

Box plot com linhas de outliers sinalizadas exportado do Powerdrill Bloom

Por que isso supera uma verificação de detecção manual

Método por planilha Powerdrill Bloom
Comparar resultados de IQR e z-score Dois conjuntos de fórmulas, reconciliação manual Pedir ambos
Visualizar o contexto em torno de um valor sinalizado Filtrar e rolar a tela Retornado junto com a linha
Verificar o formato da distribuição primeiro Criar um histograma Perfil analisado no upload
Testar o impacto da exclusão Duplicar a planilha Pedir ambas as versões

A última linha é a mais importante. A maneira honesta de lidar com um outlier ambíguo é relatar o resultado com e sem ele. Deixe o leitor ver se a conclusão depende de uma única linha. Essa comparação exige refazer o trabalho em uma planilha, e é por isso que geralmente não é feita.

Boas práticas: decidindo o que fazer com um outlier

Investigue antes de excluir. Olhe para a linha inteira. Um erro de digitação na casa decimal, um registro de teste e um cliente corporativo real parecem idênticos quando analisados em uma única coluna.

Nunca delete silenciosamente. Se você excluir linhas, informe a quantidade e o motivo no mesmo documento do resultado. Uma análise cuja base de dados foi alterada sem aviso não é reproduzível.

Relate ambas as versões quando for relevante. Se uma conclusão muda completamente dependendo de um único valor, essa é a real descoberta, e não um inconveniente a ser escondido.

Verifique o formato antes de escolher um limite. Colunas assimétricas precisam de cortes baseados em percentis ou de uma transformação logarítmica, não de uma regra de z-score.

Fique atento a agrupamentos. Vários outliers ocorrendo na mesma data ou vindos da mesma origem geralmente indicam um problema no pipeline de dados, e não clientes genuinamente incomuns. Nosso guia sobre limpeza e eliminação de duplicatas de dados aborda esse caso.

Conclusão

Encontrar outliers sem código se resume a três ferramentas. A regra do IQR é um padrão resistente, os z-scores são adequados para dados aproximadamente simétricos quando você quer avaliar a magnitude, e um box plot verifica se alguma dessas premissas é válida. Espere que eles discordem e trate essa discordância como informação.

A parte que nenhum método cobre é a decisão. Se o seu trabalho com outliers para em uma coluna sinalizada porque investigar cada linha é demorado demais, experimente o Powerdrill Bloom no arquivo. Veja também nossa página de limpeza de dados com IA, o guia para executar estatísticas descritivas e como transformar um arquivo CSV em gráfico.

Perguntas frequentes

O que é considerado um outlier em um conjunto de dados?

Convencionalmente, um valor além de 1,5 intervalo interquartil a partir do primeiro ou terceiro quartil, ou a mais de três desvios padrão da média. Ambos são convenções, e não leis, e a escolha de qual deles se aplica depende de seus dados serem aproximadamente simétricos ou assimétricos.

Como encontrar outliers no Excel sem código?

Use QUARTILE para construir os limites do IQR e sinalizar valores fora deles, ou calcule os z-scores com a média e STDEV.P. Um box plot fornece o mesmo resultado do IQR visualmente e mostra o formato da distribuição ao mesmo tempo.

Devo remover os outliers da minha análise?

Apenas após identificar o que os causou. Erros de digitação e registros de teste devem ser removidos; valores extremos reais geralmente não devem, pois removê-los exclui informações reais. Quando for ambíguo, relate o resultado de ambas as formas.

Por que o IQR e o z-score sinalizam valores diferentes?

O IQR funciona a partir de quartis, que não podem ser distorcidos por valores extremos. Já os z-scores funcionam a partir da média e do desvio padrão, que são distorcidos por valores extremos. Um valor suficientemente grande infla o desvio padrão e pode se camuflar.

E se meus dados forem assimétricos em vez de terem o formato de sino?

Os limites padrão sinalizam excessivamente a cauda longa em colunas assimétricas, como renda ou valor do pedido. Use cortes baseados em percentis ou aplique uma transformação logarítmica na coluna primeiro, e verifique o formato da distribuição antes de escolher qualquer regra.

Como encontrar outliers em um conjunto de dados sem escrever código (Guia de 2026)