Come trovare gli outlier in un dataset senza scrivere codice (Guida 2026)

Puoi individuare gli outlier senza scrivere codice utilizzando la regola dell'IQR, gli z-score o un box plot: tutti e tre i metodi funzionano su un foglio di calcolo. La regola dell'IQR segnala i valori che superano i quartili di oltre 1.5 volte l'intervallo interquartile; gli z-score segnalano i valori che si discostano dalla media di oltre tre deviazioni standard. Spesso non concordano, e capire il perché è la vera competenza da acquisire.
Trovare un outlier è la parte facile. Decidere cosa farne è la parte che determina l'onestà della tua analisi, e nessun metodo può deciderlo al posto tuo.
Questa guida spiega perché i due metodi standard non concordano e illustra tre modi per individuare gli outlier senza codice. Spiega poi come decidere se un determinato valore debba essere rimosso, mantenuto o segnalato separatamente.
Perché gestire gli outlier è più difficile del "semplice eliminarli"
I due metodi standard differiscono per progettazione
La regola dell'IQR si basa sui quartili, che sono valori posizionali. Non tiene conto di quanto un valore sia estremo, ma solo di dove si colloca nell'ordine sequenziale. Questo la rende resistente alle distorsioni causate proprio dagli outlier che sta cercando.
Gli z-score si basano sulla media e sulla deviazione standard, ed entrambe sono influenzate dai valori estremi. Un singolo valore enorme gonfia la deviazione standard, riducendo di conseguenza ogni z-score, compreso il proprio. Su un dataset di piccole dimensioni, un singolo outlier macroscopico può nascondersi in questo modo.
Ecco perché la stessa colonna può mostrare quattro outlier con l'IQR e solo uno con gli z-score. I metodi non sono incoerenti; misurano semplicemente cose diverse.
La decisione non è di natura statistica
Una transazione da $2 milioni in un file di ordini da $200 viene segnalata da qualsiasi metodo. Se debba essere rimossa o meno dipende da fattori a cui nessun metodo ha accesso.
Se si tratta di un errore di inserimento dati con una virgola fuori posto, rimuovilo. Se si tratta di un vero accordo aziendale, rimuoverlo significa cancellare dall'analisi il tuo cliente più importante. Se si tratta di una transazione di prova che qualcuno ha dimenticato di cancellare, eliminala e verifica se ce ne sono altre. Tre azioni diverse per un'unica identica segnalazione.
La forma della distribuzione invalida le ipotesi di partenza
Entrambi i metodi standard presuppongono una distribuzione approssimativamente a campana. Il reddito, le visualizzazioni di pagina, i valori degli ordini e la durata delle sessioni sono solitamente asimmetrici con una lunga coda a destra, dove i valori elevati sono normali anziché eccezionali.
Se applichi la regola dello z-score a questo tipo di colonna, finirai per segnalare una quota significativa di dati perfettamente normali. La soluzione consiste nel verificare prima la forma della distribuzione e valutare una trasformazione logaritmica o l'uso di un taglio basato sui percentili.
Cosa ti costa tutto questo
Medie che non descrivono nessuno. Un singolo valore estremo può spostare la media al punto da farla finire fuori dall'intervallo in cui si trova effettivamente la maggior parte dei dati. E le decisioni vengono prese proprio su quel numero.
Grafici con un asse illeggibile. Un solo valore dieci volte più grande degli altri comprime tutto il resto in una linea piatta sul fondo. Il grafico è tecnicamente corretto, ma non comunica nulla.
Eliminazione silenziosa. Lo scenario peggiore si verifica quando qualcuno rimuove silenziosamente le righe scomode prima di condividere il file. Nessuno a valle saprà che la base di partenza è cambiata, rendendo il risultato impossibile da riprodurre.
Tre modi per trovare gli outlier senza codice
Opzione 1: La regola dell'IQR
Usa QUARTILE per ottenere il primo e il terzo quartile, quindi sottrai per ottenere l'intervallo interquartile. Segnala qualsiasi valore inferiore a Q1 meno 1.5 × IQR o superiore a Q3 più 1.5 × IQR.
Questo è il metodo predefinito per un motivo: è resistente ai valori estremi e non richiede ipotesi sulla distribuzione. Su dati fortemente asimmetrici tende comunque a sovrastimare le segnalazioni sulla coda destra, quindi verifica la forma della distribuzione prima di fidarti del conteggio.
Opzione 2: Gli z-score
Calcola la media e la deviazione standard con STDEV.P, quindi calcola di quante deviazioni standard ogni valore si discosta dalla media. La soglia abituale è oltre le tre deviazioni standard.
Questo metodo funziona bene su dati approssimativamente simmetrici e fornisce un'indicazione di grandezza anziché una semplice segnalazione sì/no, il che è utile per scopi di classificazione. Risulta invece inaffidabile su campioni di piccole dimensioni e su colonne asimmetriche.
Opzione 3: Il box plot
Rappresenta la colonna come un box plot e osserva i punti oltre i baffi. Il box plot di Excel utilizza la stessa convenzione di 1.5 × IQR, quindi il risultato corrisponderà all'Opzione 1. La differenza è che, in questo modo, puoi visualizzare contemporaneamente la forma della distribuzione.
Questo è il modo più rapido per verificare se gli altri due metodi siano effettivamente appropriati. Se la scatola è schiacciata contro un'estremità con una coda molto lunga, diffida di qualsiasi regola basata su soglie fisse.
Il limite comune a tutti e tre i metodi
Ciascun metodo restituisce un elenco di righe segnalate. Nessuno di essi, tuttavia, ti dice quali segnalazioni siano errori, quali siano reali valori estremi e quali indichino semplicemente che la colonna è asimmetrica anziché "sporca".
Per rispondere a queste domande è necessario analizzare le righe segnalate nel loro contesto. Cos'altro c'è in quella riga? Si concentrano in un determinato periodo di tempo o provengono da un unico sistema di origine? Lo stesso cliente compare ripetutamente? Questa è un'attività di indagine, non di calcolo, ed è qui che si concentra il vero lavoro.
Come trovare gli outlier con Powerdrill Bloom
Passaggio 1: Carica i tuoi dati
Carica il file Excel o CSV. Powerdrill Bloom analizza il profilo di ogni colonna al momento del caricamento, rendendo visibili la forma della distribuzione e i valori estremi ancora prima di scegliere un metodo di rilevamento.
Passaggio 2: Descrivi il controllo in linguaggio naturale
Chiedi direttamente: segnala i valori al di fuori di 1.5 intervalli interquartili in questa colonna, quindi mostrami le righe complete per poterne vedere il contesto. Prosegui con le domande che aiutano concretamente a prendere una decisione: ad esempio, se le righe segnalate si concentrano per data o per origine, se lo stesso identificativo si ripete e come cambiano le statistiche descrittive se tali valori vengono esclusi.
Passaggio 3: Esporta il grafico, il report o la presentazione
Esporta il box plot, una tabella delle righe segnalate con il relativo contesto o una nota scritta che indichi quali righe sono state escluse e perché.
Perché questo metodo è superiore a un controllo manuale
| Soluzione con foglio di calcolo | Powerdrill Bloom | |
|---|---|---|
| Confronto tra i risultati di IQR e z-score | Due set di formule, riconciliazione manuale | Richiedi entrambi |
| Visualizzazione del contesto di un valore segnalato | Filtra e scorri | Restituito insieme alla riga |
| Verifica preliminare della forma della distribuzione | Creazione di un istogramma | Profilato al caricamento |
| Test dell'impatto dell'esclusione | Duplicazione del foglio | Richiesta di entrambe le versioni |
L'ultima riga è la più importante. Il modo più onesto per gestire un outlier ambiguo è presentare il risultato sia includendolo sia escludendolo. Consenti al lettore di vedere se la conclusione dipende da una singola riga. Nei fogli di calcolo, questo confronto richiede di ricostruire l'analisi da capo, motivo per cui di solito non viene fatto.
Best practices: come decidere cosa fare con un outlier
Indaga prima di escludere. Esamina l'intera riga. Un decimale fuori posto, un record di prova e un vero cliente importante appaiono identici se si osserva una singola colonna.
Non eliminare mai i dati in modo silenzioso. Se escludi delle righe, indica quante e perché nello stesso documento in cui presenti il risultato. Un'analisi la cui base di partenza è stata modificata senza alcuna nota non è riproducibile.
Presenta entrambe le versioni quando è importante. Se una conclusione si ribalta a seconda di un singolo valore, è proprio questa la scoperta principale, non un inconveniente da nascondere.
Verifica la forma della distribuzione prima di scegliere una soglia. Le colonne asimmetriche richiedono tagli basati sui percentili o una trasformazione logaritmica, non la regola dello z-score.
Fai attenzione alle concentrazioni. Diversi outlier che si presentano nella stessa data o dalla stessa origine indicano solitamente un problema nella pipeline di dati, piuttosto che clienti davvero insoliti. La nostra guida su come pulire e deduplicare i dati tratta proprio questo caso.
Conclusione
Individuare gli outlier senza codice si riduce a tre strumenti. La regola dell'IQR è un'ottima opzione predefinita e resistente, gli z-score sono adatti per dati approssimativamente simmetrici quando si desidera misurarne l'entità, e un box plot verifica se una delle due ipotesi di partenza sia valida. Aspettati che non concordino e considera questa discrepanza come un'informazione utile.
La parte che nessun metodo può coprire è la decisione finale. Se il tuo lavoro sugli outlier si ferma a una colonna con delle segnalazioni perché esaminare ogni riga richiede troppo tempo, prova Powerdrill Bloom sul tuo file. Vedi anche la nostra pagina sulla pulizia dei dati con l'AI, la guida su come eseguire statistiche descrittive e su come trasformare un file CSV in un grafico.
Domande frequenti
Cosa si definisce outlier in un dataset?
Convenzionalmente, un valore che supera di oltre 1.5 volte l'intervallo interquartile il primo o il terzo quartile, o che si discosta di oltre tre deviazioni standard dalla media. Entrambe sono convenzioni piuttosto che leggi matematiche, e la scelta di quale applicare dipende dal fatto che i dati siano approssimativamente simmetrici o asimmetrici.
Come posso trovare gli outlier in Excel senza codice?
Usa QUARTILE per definire i limiti dell'IQR e segnalare i valori al di fuori di essi, oppure calcola gli z-score con la media e STDEV.P. Un box plot fornisce visivamente lo stesso risultato dell'IQR e mostra contemporaneamente la forma della distribuzione.
Devo rimuovere gli outlier dalla mia analisi?
Solo dopo aver stabilito cosa li ha causati. Gli errori di inserimento dati e i record di prova vanno eliminati; i valori estremi reali solitamente no, perché la loro rimozione cancella informazioni reali. In caso di ambiguità, presenta il risultato in entrambi i modi.
Perché l'IQR e lo z-score segnalano valori diversi?
L'IQR si basa sui quartili, che non possono essere distorti dai valori estremi. Gli z-score si basano sulla media e sulla deviazione standard, che invece risentono dei valori estremi. Un valore sufficientemente grande gonfia la deviazione standard e può arrivare a mascherare se stesso.
Cosa succede se i miei dati sono asimmetrici anziché a campana?
Le soglie standard tendono a segnalare eccessivamente la coda lunga nelle colonne asimmetriche, come quelle relative al reddito o al valore degli ordini. Utilizza tagli basati sui percentili o applica prima una trasformazione logaritmica alla colonna, verificando la forma della distribuzione prima di scegliere qualsiasi regola.