Super Sale WeekClaude Skills — 20% OFF
Tips

Hoe vind je uitschieters in een dataset zonder code te schrijven (Gids voor 2026)

Powerdrill Team·
Hoe vind je uitschieters in een dataset zonder code te schrijven (Gids voor 2026)

Je kunt uitschieters vinden zonder code te schrijven met behulp van de IQR-regel, z-scores of een boxplot — alle drie werken ze in een spreadsheet. De IQR-regel markeert waarden die meer dan 1,5 keer de interkwartielafstand buiten de kwartielen liggen; z-scores markeren waarden die meer dan drie standaarddeviaties van het gemiddelde afliggen. Ze spreken elkaar vaak tegen, en begrijpen waarom is waar de echte vaardigheid ligt.

Een uitschieter vinden is het makkelijke deel. Beslissen wat je ermee doet, bepaalt of je analyse eerlijk is, en geen enkele methode geeft je daar direct antwoord op.

Deze gids legt uit waarom de twee standaardmethoden van elkaar verschillen en toont drie manieren om uitschieters op te sporen zonder code. Vervolgens bespreken we hoe je beslist of een specifieke uitschieter moet worden verwijderd, behouden of apart moet worden gerapporteerd.

Waarom uitschieters complexer zijn dan "verwijder ze maar gewoon"

De twee standaardmethoden verschillen bewust van elkaar

De IQR-regel werkt op basis van kwartielen, die positioneel zijn. De regel kijkt niet naar hoe extreem een waarde is, maar alleen naar de positie in de gesorteerde volgorde. Dit maakt de methode bestand tegen vertekening door juist de uitschieters waarnaar wordt gezocht.

Z-scores werken op basis van het gemiddelde en de standaarddeviatie, en beide worden beïnvloed door extreme waarden. Eén enorme waarde blaast de standaarddeviatie op, waardoor elke z-score kleiner wordt — inclusief die van zichzelf. Bij een kleine dataset kan een enkele extreme uitschieter zich op deze manier verbergen.

Daarom kan dezelfde kolom vier uitschieters tonen volgens de IQR-methode en slechts één volgens de z-scores. De methoden zijn niet inconsistent; ze meten simpelweg iets anders.

De beslissing is niet statistisch

Een transactie van $2 miljoen in een bestand met bestellingen van $200 wordt door elke methode gemarkeerd. Of deze verwijderd moet worden, hangt af van feiten waar geen enkele methode toegang toe heeft.

Als het een invoerfout is met een verkeerde komma, verwijder deze dan. Als het een echte zakelijke deal is, wist het verwijderen ervan je belangrijkste klant uit de analyse. Als het een testtransactie is die iemand is vergeten te wissen, verwijder deze dan en controleer op andere. Drie verschillende acties, één identieke markering.

De vorm van de verdeling doorbreekt de aannames

Beide standaardmethoden gaan uit van een verdeling die min of meer klokvormig is. Inkomen, paginaweergaven, bestelwaarden en sessieduren zijn meestal scheef verdeeld met een lange rechterstaart, waarbij hoge waarden eerder normaal dan uitzonderlijk zijn.

Als je een z-score-regel toepast op zo'n type kolom, markeer je een aanzienlijk deel van volkomen normale gegevens. De oplossing is om eerst de vorm te controleren en te overwegen een log-transformatie of een grens op basis van percentielen te gebruiken.

Wat dit je kost

Gemiddelden die niemand beschrijven. Een enkele extreme waarde kan een gemiddelde zo sterk verschuiven dat het buiten het bereik ligt waar de meeste van je gegevens zich daadwerkelijk bevinden. Toch worden er beslissingen genomen op basis van dat getal.

Grafieken met een onleesbare as. Eén waarde die tien keer groter is dan de rest, drukt al het andere samen tot een platte lijn onderaan de grafiek. De grafiek is technisch correct, maar communiceert helemaal niets.

Stille verwijdering. Het slechtste scenario is dat iemand stilletjes ongunstige rijen verwijdert voordat het bestand wordt gedeeld. Niemand verderop in het proces weet dat de basis is veranderd, en het resultaat is niet te reproduceren.

Drie manieren om uitschieters te vinden zonder code

Optie 1: De IQR-regel

Gebruik QUARTILE om het eerste en derde kwartiel te berekenen, en trek deze van elkaar af om de interkwartielafstand te bepalen. Markeer alles onder Q1 minus 1,5 × IQR of boven Q3 plus 1,5 × IQR.

Dit is niet voor niets de standaard: het is bestand tegen extreme waarden en vereist geen aanname over de verdeling. Bij sterk scheve gegevens worden er nog steeds te veel waarden in de rechterstaart gemarkeerd, dus controleer de vorm voordat je blind op de telling vertrouwt.

Optie 2: Z-scores

Bereken het gemiddelde en de standaarddeviatie met STDEV.P, en bereken vervolgens hoeveel standaarddeviaties elke waarde van het gemiddelde afligt. Meer dan drie is de gebruikelijke drempelwaarde.

Dit werkt goed bij min of meer symmetrische gegevens en geeft je een omvang in plaats van een simpele ja/nee-markering, wat handig is voor rangschikking. Het is onbetrouwbaar bij kleine steekproeven en bij scheve kolommen.

Optie 3: Een boxplot

Zet de kolom uit als een boxplot en lees de punten buiten de whiskers af. De boxplot van Excel gebruikt dezelfde 1,5 × IQR-conventie, dus het resultaat komt overeen met Optie 1. Het verschil is dat je tegelijkertijd de vorm van de verdeling ziet.

Dit is de snelste manier om te controleren of de andere twee methoden überhaupt wel geschikt zijn. Als de box strak tegen één uiteinde aanligt met een lange staart, neem dan elke drempelwaarde-regel met een korreltje zout.

Waar alle drie tegen dezelfde grens aanlopen

Elke methode levert een lijst met gemarkeerde rijen op. Geen van de methoden vertelt je welke markeringen fouten zijn, welke echte uitersten zijn, en welke betekenen dat de kolom scheef verdeeld is in plaats van 'vervuild'.

Om dat te beantwoorden, moet je de gemarkeerde rijen in hun context bekijken. Wat staat er nog meer in die rij? Groeperen ze zich in één bepaalde periode of komen ze uit één bronsysteem? Verschijnt dezelfde klant herhaaldelijk? Dat is onderzoek, geen berekening, en dat is waar de tijd echt in gaat zitten.

Uitschieters vinden met Powerdrill Bloom

Stap 1: Upload je gegevens

Upload het Excel- of CSV-bestand. Powerdrill Bloom analyseert elke kolom direct bij binnenkomst, zodat de vorm van de verdeling en extreme waarden al zichtbaar zijn voordat je een detectiemethode kiest.

Een spreadsheet uploaden om uitschieters in een dataset te vinden met Powerdrill Bloom

Stap 2: Beschrijf de controle in natuurlijke taal

Vraag direct: markeer waarden buiten 1,5 interkwartielafstanden in deze kolom, en toon me vervolgens de volledige rijen zodat ik de context kan zien. Stel vervolgens de vragen die echt helpen bij het nemen van de beslissing: of gemarkeerde rijen zich groeperen per datum of bron, of dezelfde identificatiecode zich herhaalt, en hoe de samenvattende statistieken veranderen als ze worden uitgesloten.

Stap 3: Exporteer de grafiek, het rapport of de presentatie

Exporteer de boxplot, een tabel met gemarkeerde rijen inclusief hun context, of een schriftelijke notitie waarin staat welke rijen zijn uitgesloten en waarom.

Boxplot met gemarkeerde uitschieters geëxporteerd uit Powerdrill Bloom

Waarom dit beter is dan een handmatige detectieronde

De spreadsheet-route Powerdrill Bloom
IQR- en z-scoreresultaten vergelijken Twee sets formules, handmatige afstemming Vraag om beide
Context rond een gemarkeerde waarde bekijken Filteren en scrollen Meegeleverd met de rij
Eerst de vorm van de verdeling controleren Een histogram maken Geanalyseerd bij het uploaden
Impact van uitsluiting testen Het werkblad dupliceren Vraag om beide versies

De laatste rij is het belangrijkst. De eerlijkste manier om met een twijfelachtige uitschieter om te gaan, is door het resultaat mét en zonder die uitschieter te rapporteren. Laat de lezer zelf zien of de conclusie afhangt van één enkele rij. Zo'n vergelijking vereist in een spreadsheet dat je alles opnieuw opbouwt, en dat is waarom het meestal niet gebeurt.

Best practices: beslissen wat je met een uitschieter doet

Onderzoek voordat je uitsluit. Bekijk de hele rij. Een verkeerde komma, een testrecord en een echte grote klant zien er in een enkele kolom precies hetzelfde uit.

Verwijder nooit stilletjes gegevens. Als je rijen uitsluit, vermeld dan hoeveel en waarom in hetzelfde document als het resultaat. Een analyse waarvan de basis is gewijzigd zonder toelichting, is niet reproduceerbaar.

Rapporteer beide versies als het erom spant. Als een conclusie omslaat op basis van één enkele waarde, dan is dát de bevinding, en niet een ongemak dat moet worden weggewerkt.

Controleer de vorm voordat je een drempelwaarde kiest. Scheve kolommen vereisen grenzen op basis van percentielen of een log-transformatie, geen z-score-regel.

Let op clusters. Meerdere uitschieters op dezelfde datum of uit dezelfde bron wijzen meestal op een probleem in de datapipeline in plaats van op echt ongebruikelijke klanten. Onze gids voor het opschonen en ontdubbelen van gegevens behandelt dit scenario.

Conclusie

Uitschieters vinden zonder code komt neer op drie hulpmiddelen. De IQR-regel is een betrouwbare standaard, z-scores zijn geschikt voor min of meer symmetrische gegevens wanneer je de omvang wilt weten, en een boxplot controleert of een van beide aannames klopt. Verwacht dat ze elkaar tegenspreken, en beschouw die tegenstrijdigheid als waardevolle informatie.

Het deel dat geen enkele methode dekt, is de beslissing. Als je werk met uitschieters stopt bij een gemarkeerde kolom omdat het onderzoeken van elke rij te traag gaat, probeer dan Powerdrill Bloom op het bestand. Bekijk ook onze pagina over AI-gegevensopschoning, de gids voor het uitvoeren van beschrijvende statistiek en het omzetten van een CSV in een grafiek.

Veelgestelde vragen

Wat geldt als een uitschieter in een dataset?

Traditioneel is dat een waarde die meer dan 1,5 interkwartielafstanden van het eerste of derde kwartiel afligt, of meer dan drie standaarddeviaties van het gemiddelde. Beide zijn eerder conventies dan wetten, en welke het beste past hangt af van de vraag of je gegevens min of meer symmetrisch of juist scheef verdeeld zijn.

Hoe vind ik uitschieters in Excel zonder code?

Gebruik QUARTILE om de IQR-grenzen te bepalen en waarden daarbuiten te markeren, of bereken z-scores met het gemiddelde en STDEV.P. Een boxplot geeft visueel hetzelfde IQR-resultaat en toont tegelijkertijd de vorm van de verdeling.

Moet ik uitschieters uit mijn analyse verwijderen?

Alleen nadat je hebt vastgesteld wat de oorzaak is. Invoerfouten en testrecords moeten worden verwijderd; echte extreme waarden meestal niet, omdat je daarmee waardevolle informatie wist. Als het twijfelachtig is, rapporteer het resultaat dan op beide manieren.

Waarom markeren IQR en z-score verschillende waarden?

IQR werkt op basis van kwartielen, die niet kunnen worden vertekend door extreme waarden. Z-scores werken op basis van het gemiddelde en de standaarddeviatie, die wél worden vertekend door extreme waarden. Een voldoende grote waarde blaast de standaarddeviatie op en kan zichzelf zo maskeren.

Wat als mijn gegevens scheef verdeeld zijn in plaats van klokvormig?

Standaard drempelwaarden markeren te veel waarden in de lange staart bij scheve kolommen zoals inkomen of bestelwaarde. Gebruik grenzen op basis van percentielen, of pas eerst een log-transformatie toe op de kolom, en controleer de vorm van de verdeling voordat je een regel kiest.