Comment trouver les valeurs aberrantes dans un jeu de données sans écrire de code (Guide 2026)

Vous pouvez identifier les valeurs aberrantes sans écrire de code en utilisant la règle de l'IQR, les z-scores ou une boîte à moustaches — ces trois méthodes fonctionnent dans un tableur. La règle de l'IQR signale les valeurs situées à plus de 1,5 écart interquartile au-delà des quartiles ; les z-scores signalent les valeurs situées à plus de trois écarts-types de la moyenne. Ces méthodes sont souvent en désaccord, et comprendre pourquoi constitue la véritable compétence.
Trouver une valeur aberrante est la partie la plus facile. Décider de ce qu'il faut en faire est l'étape qui détermine l'honnêteté de votre analyse, et aucune méthode ne peut y répondre à votre place.
Ce guide explique pourquoi les deux méthodes standards divergent et présente trois façons de détecter les valeurs aberrantes sans code. Il aborde ensuite la manière de décider si une valeur donnée doit être supprimée, conservée ou signalée séparément.
Pourquoi la gestion des valeurs aberrantes est plus complexe qu'une "simple suppression"
Les deux méthodes standards divergent par conception
La règle de l'IQR s'appuie sur les quartiles, qui sont des mesures de position. Elle ne se soucie pas de l'ampleur d'une valeur, mais uniquement de sa place dans l'ordre trié. Cela la rend résistante aux distorsions causées par les valeurs aberrantes mêmes qu'elle recherche.
Les z-scores s'appuient sur la moyenne et l'écart-type, qui sont tous deux influencés par les valeurs extrêmes. Une seule valeur gigantesque gonfle l'écart-type, ce qui réduit tous les z-scores — y compris le sien. Sur un petit ensemble de données, une seule valeur aberrante spectaculaire peut ainsi passer inaperçue.
C'est pourquoi une même colonne peut présenter quatre valeurs aberrantes selon l'IQR et une seule selon les z-scores. Les méthodes ne sont pas incohérentes ; elles mesurent simplement des choses différentes.
La décision n'est pas statistique
Une transaction de 2 millions de dollars dans un fichier de commandes de 200 dollars est signalée par toutes les méthodes. La question de savoir s'il faut la supprimer dépend de faits auxquels aucune méthode n'a accès.
S'il s'agit d'une erreur de saisie de données avec une virgule mal placée, supprimez-la. S'il s'agit d'un véritable contrat d'entreprise, sa suppression exclut votre client le plus important de l'analyse. S'il s'agit d'une transaction de test que quelqu'un a oublié d'effacer, supprimez-la et recherchez s'il y en a d'autres. Trois actions différentes pour un signalement identique.
La forme de la distribution brise les hypothèses
Les deux méthodes standards supposent une distribution à peu près en forme de cloche. Les revenus, les pages vues, la valeur des commandes et la durée des sessions sont généralement asymétriques avec une longue traîne à droite, où les valeurs élevées sont normales plutôt qu'exceptionnelles.
Appliquez la règle du z-score à ce type de colonne et vous signalerez une part importante de données parfaitement ordinaires. La solution consiste à vérifier d'abord la forme de la distribution, et à envisager une transformation logarithmique ou un seuil basé sur les percentiles.
Ce que cela vous coûte
Des moyennes qui ne décrivent personne. Une seule valeur extrême peut déplacer une moyenne à tel point qu'elle se retrouve en dehors de la fourchette où se situent réellement la plupart de vos données. C'est pourtant sur ce chiffre que les décisions sont prises.
Des graphiques avec un axe illisible. Une valeur dix fois supérieure aux autres compresse tout le reste en une ligne plate au bas du graphique. Le graphique est techniquement correct, mais il ne communique rien.
La suppression silencieuse. Le pire scénario est que quelqu'un supprime discrètement les lignes gênantes avant de partager le fichier. Personne en aval ne sait que la base a changé, et le résultat devient impossible à reproduire.
Trois façons de trouver les valeurs aberrantes sans code
Option 1 : La règle de l'IQR
Utilisez QUARTILE pour obtenir le premier et le troisième quartiles, puis soustrayez-les pour obtenir l'écart interquartile. Signalez tout ce qui est inférieur à Q1 moins 1,5 × IQR ou supérieur à Q3 plus 1,5 × IQR.
C'est l'option par défaut pour une bonne raison : elle résiste aux valeurs extrêmes et ne nécessite aucune hypothèse de distribution. Sur des données fortement asymétriques, elle a tout de même tendance à sur-signaler la traîne de droite, vérifiez donc la forme de la distribution avant de vous fier au décompte.
Option 2 : Les z-scores
Calculez la moyenne et l'écart-type avec STDEV.P, puis calculez à combien d'écarts-types chaque valeur se situe de la moyenne. Le seuil habituel est fixé au-delà de trois.
Cette méthode fonctionne bien sur des données à peu près symétriques et vous donne une magnitude plutôt qu'un simple signalement par oui ou par non, ce qui est utile pour le classement. Elle n'est pas fiable sur les petits échantillons et sur les colonnes asymétriques.
Option 3 : Une boîte à moustaches
Représentez la colonne sous forme de boîte à moustaches et lisez les points situés au-delà des moustaches. La boîte à moustaches d'Excel utilise la même convention de 1,5 × IQR, le résultat correspond donc à l'Option 1. La différence est que vous visualisez en même temps la forme de la distribution.
C'est le moyen le plus rapide de vérifier si les deux autres méthodes sont appropriées. Si la boîte est collée à une extrémité avec une longue traîne, traitez toute règle de seuil avec méfiance.
Là où les trois méthodes se heurtent à la même limite
Chaque méthode renvoie une liste de lignes signalées. Aucune d'entre elles ne vous indique quels signalements sont des erreurs, lesquels sont de véritables extrêmes, et lesquels signifient simplement que la colonne est asymétrique plutôt qu'incorrecte.
Pour y répondre, il faut examiner les lignes signalées dans leur contexte. Qu'y a-t-il d'autre sur cette ligne ? Se regroupent-elles sur une même période ou proviennent-elles d'un même système source ? Le même client apparaît-il à plusieurs reprises ? Il s'agit là d'une enquête, pas d'un calcul, et c'est là que passe réellement le temps.
Comment trouver les valeurs aberrantes avec Powerdrill Bloom
Étape 1 : Importez vos données
Importez le fichier Excel ou CSV. Powerdrill Bloom profile chaque colonne dès son arrivée, de sorte que la forme de la distribution et les valeurs extrêmes sont visibles avant même que vous ne choisissiez une méthode de détection.
Étape 2 : Décrivez la vérification en langage naturel
Demandez directement : signale les valeurs en dehors de 1,5 écart interquartile dans cette colonne, puis montre-moi les lignes complètes pour que je puisse voir le contexte. Enchaînez avec les questions qui permettent réellement de prendre une décision : si les lignes signalées se regroupent par date ou par source, si le même identifiant se répète, et comment les statistiques descriptives changent si elles sont exclues.
Étape 3 : Exportez le graphique, le rapport ou la présentation
Exportez la boîte à moustaches, un tableau des lignes signalées avec leur contexte, ou une note écrite indiquant quelles lignes ont été exclues et pourquoi.
Pourquoi cette méthode surpasse une détection manuelle
| Méthode par tableur | Powerdrill Bloom | |
|---|---|---|
| Comparer les résultats de l'IQR et du z-score | Deux ensembles de formules, rapprochement manuel | Demander les deux |
| Voir le contexte autour d'une valeur signalée | Filtrer et faire défiler | Renvoyé avec la ligne |
| Vérifier d'abord la forme de la distribution | Créer un histogramme | Profilé dès l'importation |
| Tester l'impact de l'exclusion | Dupliquer la feuille | Demander les deux versions |
C'est la dernière ligne qui importe le plus. La manière la plus honnête de traiter une valeur aberrante ambiguë est de présenter le résultat avec et sans elle. Laissez le lecteur voir si la conclusion dépend d'une seule ligne. Cette comparaison nécessite de reconstruire les calculs dans un tableur, c'est pourquoi elle n'est généralement pas faite.
Bonnes pratiques : décider de ce qu'il faut faire d'une valeur aberrante
Enquêtez avant d'exclure. Examinez la ligne entière. Une virgule mal placée, un enregistrement de test et un véritable gros client ont exactement la même apparence dans une seule colonne.
Ne supprimez jamais en silence. Si vous excluez des lignes, indiquez combien et pourquoi dans le même document que le résultat. Une analyse dont la base a été modifiée sans mention écrite n'est pas reproductible.
Présentez les deux versions lorsque c'est important. Si une conclusion s'inverse en fonction d'une seule valeur, c'est cela même qui constitue la découverte, et non un inconvénient à masquer.
Vérifiez la forme de la distribution avant de choisir un seuil. Les colonnes asymétriques nécessitent des seuils basés sur les percentiles ou une transformation logarithmique, et non une règle de z-score.
Surveillez les regroupements. Plusieurs valeurs aberrantes apparaissant à la même date ou provenant de la même source signalent généralement un problème de pipeline de données plutôt que des clients réellement inhabituels. Notre guide sur le nettoyage et la déduplication des données traite de ce cas.
Conclusion
Trouver des valeurs aberrantes sans code se résume à trois outils. La règle de l'IQR est un choix par défaut robuste, les z-scores conviennent aux données à peu près symétriques lorsque vous souhaitez mesurer une magnitude, et une boîte à moustaches permet de vérifier si l'une ou l'autre de ces hypothèses est vérifiée. Attendez-vous à ce qu'ils divergent, et considérez cette divergence comme une information en soi.
La partie qu'aucune méthode ne couvre est la prise de décision. Si votre travail sur les valeurs aberrantes s'arrête à une colonne signalée parce que l'examen de chaque ligne est trop long, essayez Powerdrill Bloom sur votre fichier. Consultez également notre page sur le nettoyage de données par IA, le guide pour générer des statistiques descriptives, et comment transformer un fichier CSV en graphique.
Questions fréquemment posées
Qu'est-ce qui est considéré comme une valeur aberrante dans un ensemble de données ?
Classiquement, une valeur située au-delà de 1,5 écart interquartile du premier ou du troisième quartile, ou à plus de trois écarts-types de la moyenne. Ces deux critères sont des conventions plutôt que des lois, et le choix de l'un ou de l'autre dépend du fait que vos données soient à peu près symétriques ou asymétriques.
Comment trouver des valeurs aberrantes dans Excel sans code ?
Utilisez QUARTILE pour définir les limites de l'IQR et signaler les valeurs situées en dehors de celles-ci, ou calculez les z-scores à l'aide de la moyenne et de STDEV.P. Une boîte à moustaches donne visuellement le même résultat que l'IQR tout en affichant la forme de la distribution.
Dois-je supprimer les valeurs aberrantes de mon analyse ?
Seulement après avoir déterminé leur cause. Les erreurs de saisie de données et les enregistrements de test doivent être supprimés ; ce n'est généralement pas le cas des véritables valeurs extrêmes, car leur suppression élimine des informations réelles. En cas d'ambiguïté, présentez le résultat des deux manières.
Pourquoi l'IQR et le z-score signalent-ils des valeurs différentes ?
L'IQR s'appuie sur les quartiles, que les valeurs extrêmes ne peuvent pas fausser. Les z-scores s'appuient sur la moyenne et l'écart-type, que les valeurs extrêmes faussent. Une valeur suffisamment élevée gonfle l'écart-type et peut ainsi se masquer elle-même.
Que faire si mes données sont asymétriques plutôt qu'en forme de cloche ?
Les seuils standards sur-signalent la longue traîne sur les colonnes asymétriques telles que les revenus ou la valeur des commandes. Utilisez des seuils basés sur les percentiles, ou appliquez d'abord une transformation logarithmique à la colonne, et vérifiez la forme de la distribution avant de choisir une règle.