Super Sale WeekClaude Skills — 20% OFF
Glossary

Wat is statistische significantie? Definitie, voorbeelden en beperkingen (2026)

Powerdrill Team·
Wat is statistische significantie? Definitie, voorbeelden en beperkingen (2026)

Statistische significantie betekent dat het onwaarschijnlijk is dat een resultaat louter op toeval berust, uitgaande van de veronderstelling dat er geen werkelijk effect is. Dit wordt meestal vastgesteld wanneer de p-waarde onder de 0,05 daalt. Die drempelwaarde is een conventie die voor het gemak is aangenomen, geen eigenschap van de natuur. Een significant resultaat is bovendien niet hetzelfde als een belangrijk resultaat.

Die twee zinnen vatten het grootste deel samen van wat er in de praktijk misgaat met dit concept. Teams beschouwen 0,05 als een voldoende en zien significantie als het bewijs van impact, en beide interpretaties leiden tot zelfverzekerde beslissingen die op heel weinig zijn gebaseerd.

Deze gids behandelt wat de p-waarde daadwerkelijk beantwoordt, waar de drempelwaarde vandaan komt en hoe een test wordt opgebouwd. De gids sluit af met de vier dingen die significantie je absoluut niet kan vertellen.

Wat is statistische significantie?

Statistische significantie is een uitspraak over verrassing, niet over de waarheid. Je begint met de aanname dat er niets aan de hand is — dat de twee groepen identiek zijn, of dat de variabelen geen onderling verband hebben. Die aanname is de nulhypothese.

Vervolgens vraag je je af: als de nulhypothese waar zou zijn, hoe vaak zou ik dan gegevens zien die minstens zo extreem zijn als de mijne? Als het antwoord "zelden" is, zijn de waargenomen gegevens moeilijk te verenigen met de aanname en verwerp je deze.

Dat is de hele logica. Let op wat hierin ontbreekt. Er wordt niets gezegd over hoe groot het effect is, hoe waarschijnlijk het is dat je hypothese waar is, of dat het resultaat voor wie dan ook van belang is.

Wat de p-waarde daadwerkelijk beantwoordt

De p-waarde is de waarschijnlijkheid dat je gegevens waarneemt die minstens zo extreem zijn als de jouwe, ervan uitgaande dat de nulhypothese waar is.

Die voorwaardelijke bijzin draagt al het gewicht, en wordt bijna altijd weggelaten. Een p-waarde van 0,03 betekent niet dat er een kans van 3% is dat het resultaat op toeval berust. Het betekent ook niet dat er 97% kans is dat je hypothese juist is. Het betekent: als er werkelijk geen effect zou zijn, zouden gegevens die zo extreem zijn in ongeveer 3% van de gevallen opduiken.

Het onderscheid klinkt academisch totdat het een beslissing beïnvloedt. Voer twintig onafhankelijke tests uit op een dataset waarin nergens echte effecten zitten, en je zult nog steeds ongeveer één "significant" resultaat krijgen. Vijf procent van niets is nog steeds iets. Dat is geen fout in de wiskunde. Dat is simpelweg wat een drempelwaarde van 5% betekent.

Waar de drempelwaarde van 0,05 vandaan komt

Er is geen wiskundige afleiding voor. De grens van 0,05 raakte in zwang door een conventie in de statistische praktijk van de vroege twintigste eeuw en bleef hangen omdat het handig was en iedereen het wekelijks gebruikte.

Dit is belangrijk voor de manier waarop je grensgevallen interpreteert. Een p-waarde van 0,049 en een van 0,051 beschrijven vrijwel identiek bewijs, maar de ene wordt significant genoemd en de andere niet. Die grens behandelen als een harde scheidslijn tussen echt en onecht is het meest voorkomende misbruik van dit concept.

Rapporteer de werkelijke p-waarde in plaats van alleen of deze de drempel heeft gehaald. Lezers kunnen dan zelf beoordelen hoe sterk het bewijs is.

Hoe significantie wordt getest

De nulhypothese

Formuleer de aanname dat er geen effect is nauwkeurig voordat je naar de resultaten kijkt. "Versie B heeft hetzelfde conversiepercentage als versie A" is toetsbaar. "Versie B is beter" is dat niet, omdat het niet specificeert wat als bewijs tegen de stelling zou gelden.

The test statistic

Kies een test die past bij de gegevens. Het vergelijken van de gemiddelden van twee groepen vraagt meestal om een t-test; het vergelijken van proporties vraagt om een z-test of een chi-kwadraattoets op een kruistabel. Het gebruik van de verkeerde test levert een getal op dat legitiem lijkt, maar dat niet is.

De p-waarde en de beslissing

De test zet je gegevens om in een p-waarde. Vergelijk deze met de drempelwaarde die je voorafgaand aan de test hebt ingesteld. Achteraf de drempelwaarde kiezen, of de test herhaaldelijk uitvoeren tot deze de drempel haalt, maakt de hele procedure ongeldig.

Statistische significantie vs. praktische significantie

Statistische significantie Praktische significantie
Beantwoorde vraag Zou dit toeval kunnen zijn? Is dit de moeite waard om naar te handelen?
Afhankelijk van steekproefomvang Sterk Totaal niet
Uitgedrukt als p-waarde Effectgrootte, betrouwbaarheidsinterval
Kan worden bereikt door Meer gegevens te verzamelen Alleen door een werkelijk effect

De laatste rij is de belangrijkste om te onthouden. Bij een voldoende grote steekproef wordt vrijwel elk verschil statistisch significant, inclusief verschillen die veel te klein zijn om er werkelijk toe te doen. Een verbetering in conversie van 0,02% over tien miljoen gebruikers zal elke gewenste drempelwaarde halen, maar is nog steeds de tijd van de ontwikkelaars niet waard.

Dit is waarom de effectgrootte naast elke p-waarde hoort te staan. Significantie zegt dat het effect waarschijnlijk niet nul is; de effectgrootte zegt of iemand er überhaupt om moet geven.

Wat statistische significantie je niet vertelt

Hoe groot het effect is. Een p-waarde krimpt naarmate de steekproefomvang toeneemt, ongeacht de grootte van het onderliggende verschil. Het is geen maatstaf voor de omvang.

Hoe waarschijnlijk je hypothese is. De p-waarde wordt berekend onder de aanname dat de nulhypothese standhoudt. De waarde kan vervolgens niet plotseling de waarschijnlijkheid aangeven dat dit niet zo is. Om die vraag te beantwoorden is een heel ander kader nodig.

Of het resultaat gereproduceerd kan worden. Een enkel significant resultaat in een enkele steekproef is zwak bewijs. Replicatie is wat het tot een bevinding maakt.

Of de opzet van het onderzoek deugdelijk was. Significantietoetsing gaat ervan uit dat de gegevens correct zijn verzameld. Een vertekende steekproef levert een uiterst significant, maar volkomen foutief antwoord op, en geen enkele hoeveelheid statistische nauwkeurigheid achteraf kan dat herstellen.

Veelgemaakte fouten bij het rapporteren van significantie

Alleen rapporteren of de drempel van 0,05 is gehaald. Publiceer de werkelijke p-waarde. "p = 0,048" en "p = 0,052" vertellen een lezer veel meer dan "significant" en "niet significant". Dat paar labels suggereert een verschil in bewijskracht dat er in werkelijkheid niet is.

De test blijven uitvoeren tot deze slaagt. Dagelijks de resultaten controleren en stoppen zodra de p-waarde onder de drempel zakt, garandeert uiteindelijk een significant resultaat, of er nu een effect is of niet. Leg de steekproefomvang vooraf vast.

Veel varianten testen zonder correctie. Het vergelijken van vijf varianten met een controleversie is gelijk aan vijf tests, en de kans op ten minste één fout-positief resultaat is dan veel groter dan 5%. Er bestaan correcties voor precies dit probleem.

Een niet-significant resultaat interpreteren als 'geen effect'. Een test met te weinig onderscheidingsvermogen vindt niets, of er nu wel of niet iets aan de hand is. Rapporteer het betrouwbaarheidsinterval, zodat lezers kunnen zien welke effectgroottes aannemelijk blijven.

De effectgrootte weglaten. Significantie geeft aan dat het effect waarschijnlijk niet nul is. Alleen de effectgrootte vertelt je of het de moeite waard is om er iets mee te doen, en alleen een betrouwbaarheidsinterval laat zien hoe nauwkeurig je dit hebt bepaald.

Hoe je significantie test op je eigen gegevens met Powerdrill Bloom

Stap 1: Upload je gegevens

Upload het resultatenbestand — exportbestanden van experimenten, enquêteresultaten of transactiegegevens. Powerdrill Bloom analyseert de kolommen, zodat groepsgroottes en ontbrekende waarden zichtbaar zijn voordat er tests worden uitgevoerd.

Experimentresultaten uploaden om statistische significantie te testen in Powerdrill Bloom

Stap 2: Beschrijf de test in natuurlijke taal

Geef aan wat je vergelijkt en wat voor soort meting het is. Vergelijk bijvoorbeeld de conversiepercentages tussen deze twee groepen en vraag of het verschil significant is. Vraag naast de p-waarde ook om de effectgrootte en het betrouwbaarheidsinterval. Vraag bovendien of de aannames van de test gelden voor deze gegevens, in plaats van er zomaar van uit te gaan.

Stap 3: Exporteer de grafiek, het rapport of de presentatie

Exporteer de vergelijkingsgrafiek, een tabel met de p-waarde en het betrouwbaarheidsinterval, of een geschreven samenvatting voor de evaluatie.

Vergelijkingsgrafiek met p-waarde en betrouwbaarheidsinterval geëxporteerd uit Powerdrill Bloom

Conclusie

Statistische significantie beantwoordt één specifieke vraag: zou dit resultaat aannemelijk louter door toeval kunnen zijn ontstaan? Daarvoor is het oprecht nuttig, maar het is onbruikbaar voor al het andere dat men ervan verlangt. De drempelwaarde van 0,05 is een conventie, een significant resultaat kan triviaal klein zijn, en een niet-significant resultaat is geen bewijs dat er niets is gebeurd.

Samen met de effectgrootte en een betrouwbaarheidsinterval levert het waardevolle inzichten op. Als je dit trio wilt zonder de tests handmatig in te stellen, probeer dan Powerdrill Bloom op je resultatenbestand. Bekijk ook onze pagina over auto insights, de gids voor het analyseren van A/B-testresultaten zonder statisticus, het uitvoeren van beschrijvende statistiek en het uitvoeren van een t-test met AI.

Veelgestelde vragen

Wat betekent statistisch significant in eenvoudige bewoordingen?

Het betekent dat het onwaarschijnlijk is dat het resultaat zou optreden als er geen werkelijk effect was. Het betekent niet dat het effect groot of belangrijk is — alleen dat toeval alleen een slechte verklaring is voor wat je hebt waargenomen.

What is a p-value?

De waarschijnlijkheid dat je gegevens waarneemt die minstens zo extreem zijn als de jouwe, ervan uitgaande dat de nulhypothese waar is. Het is niet de waarschijnlijkheid dat je hypothese juist is, en het is niet de kans dat het resultaat op toeval berust.

Waarom wordt 0,05 gebruikt als significantieniveau?

Het is eerder een conventie uit de statistische praktijk van de vroege twintigste eeuw dan een berekende waarde. Omdat deze willekeurig is, vertegenwoordigen een p-waarde van 0,049 en een van 0,051 vrijwel identiek bewijs, ondanks het feit dat ze aan weerszijden van de grens liggen.

Kan een resultaat significant zijn maar niet belangrijk?

Ja, en dat gebeurt voortdurend bij grote steekproeven. Een voldoende grote steekproef maakt minieme verschillen statistisch significant. Daarom moet de effectgrootte altijd naast de p-waarde worden gerapporteerd.

Wat betekent het als mijn resultaat niet significant is?

Dat betekent dat je gegevens geen sterk bewijs leveren tegen de nulhypothese — niet dat de nulhypothese waar is. Een test met te weinig onderscheidingsvermogen kan een werkelijk effect volledig missen, dus een niet-significant resultaat zegt vaak vooral iets over de steekproefomvang.