Wat is een betrouwbaarheidsinterval? Definitie, voorbeelden en hoe je deze afleest (2026)

Een betrouwbaarheidsinterval is een bereik dat is berekend op basis van steekproefgegevens. De achterliggende methode zou de werkelijke populatiewaarde bevatten in een vastgesteld percentage van herhaalde steekproeven. Een 95%-interval is het resultaat van een procedure die in 95% van de gevallen slaagt.
Deze formulering klinkt misschien pedant, maar dat is juist de hele essentie. De betrouwbaarheid beschrijft de methode, niet het specifieke bereik dat op je dia staat.
Deze gids behandelt de definitie en waar het interval voor wordt gebruikt. Vervolgens leggen we uit hoe je er een afleest, hoe het verschilt van verwante concepten en wat het je niet kan vertellen.
Wat is een betrouwbaarheidsinterval?
Neem een steekproef, meet iets en je krijgt één getal. Neem een andere steekproef en je krijgt een net iets ander getal. Het interval is een poging om uit te drukken hoeveel dat getal zou variëren.
Een concreet voorbeeld maakt dit duidelijk. Je enquêteert 400 klanten en 62% zegt je te zullen aanbevelen. Een 95%-interval loopt dan bijvoorbeeld van 57% tot 67%.
De juiste interpretatie gaat over de procedure. Stel je voor dat je deze enquête vaak herhaalt en telkens een interval berekent. Ongeveer 95% van die intervallen zou het werkelijke cijfer voor al je klanten bevatten.
De verleidelijke interpretatie is dat er 95% kans is dat de werkelijke waarde tussen 57% en 67% ligt. Volgens de standaarddefinitie is dat onjuist, omdat de werkelijke waarde vaststaat en juist het interval varieert.
Dit onderscheid heeft praktische gevolgen. Zodra het interval is berekend, bevat het de werkelijke waarde of niet, en je kunt niet weten welke van de twee het geval is. Wat je wel kunt weten, is hoe vaak de methode het bij het rechte eind heeft.
Waar een betrouwbaarheidsinterval voor wordt gebruikt
Een meting eerlijk rapporteren. Een enkel percentage suggereert een precisie die een steekproef niet kan leveren. Het interval laat zien hoeveel speling de schatting heeft.
Twee groepen vergelijken. Als het interval voor een verschil nul uitsluit, is het verschil statistisch te onderscheiden op het bijbehorende significantieniveau. Dat is dezelfde informatie die een toets oplevert, maar dan in een beter leesbare vorm.
Beslissen of je actie onderneemt. Een interval dat loopt van 1% verbetering tot 40% verbetering geeft aan dat het effect waarschijnlijk positief is, maar dat de omvang ervan onbekend is. Dat is vaak het eerlijkste antwoord, en het verandert de beslissing.
Verwachtingen scheppen vóór een beslissing. Door het bereik vooraf te publiceren, voorkom je dat een later resultaat als een verrassing wordt gezien. Een getal dat binnen het vooraf aangegeven interval valt, is geen nieuws.
De omvang van het volgende onderzoek bepalen. Als het interval te breed is om bruikbaar te zijn, is de oplossing een grotere steekproef. De breedte vertelt je grofweg hoeveel groter die moet zijn.
Hoe een betrouwbaarheidsinterval werkt
Drie factoren bepalen de breedte, en het is goed om te weten aan welke knoppen je daadwerkelijk kunt draaien.
Steekproefomvang. Meer waarnemingen maken het interval smaller, waarbij de meeropbrengst afneemt. Grofweg geldt: een verviervoudiging van de steekproef halveert de breedte.
Variabiliteit in de gegevens. Sterk verspreide gegevens leiden tot bredere intervallen. Dit is een eigenschap van wat je meet en is meestal niet aan te passen.
Het gekozen betrouwbaarheidsniveau. Een 99%-interval is breder dan een 95%-interval op basis van dezelfde gegevens. Een hogere betrouwbaarheid koop je met minder precisie, niet met betere informatie.
Een vierde factor wordt vaak vergeten: wat je precies schat. Bereiken rond percentages nabij 0% of 100% gedragen zich anders dan bereiken rond een gemiddelde, omdat de waarde begrensd is. Standaardformules kunnen waarden opleveren die buiten deze grenzen vallen.
Dat laatste verwart mensen het meest. Het verhogen van het betrouwbaarheidsniveau maakt de schatting niet beter. Het werpt het net simpelweg breder uit, zodat de methode vaker slaagt.
Hoe je een interval afleest
Kijk eerst naar de breedte en dan pas naar het midden. Een bereik van 61% tot 63% en een bereik van 30% tot 94% kunnen hetzelfde middelpunt hebben, maar slechts één ervan is bruikbaar voor een beslissing.
Een bereik dat zonder betrouwbaarheidsniveau wordt genoemd, is niet te interpreteren. Vraag eerst naar het niveau voordat je conclusies trekt uit de breedte.
Controleer vervolgens wat het interval uitsluit. Bij een verschil tussen twee groepen is nul de waarde die ertoe doet. Als een interval nul bevat, betekent dit dat de gegevens compatibel zijn met helemaal geen verschil.
Finally, ask what the interval is around. An interval for an average tells you about the average, not about individual cases. Half your customers can sit outside an interval for the mean, and nothing is wrong.
Pas op met bereiken die zonder steekproefomvang worden gerapporteerd. Twee intervallen met exact dezelfde breedte kunnen op heel verschillende hoeveelheden bewijs rusten als de onderliggende variabiliteit verschilt. De steekproefomvang hoort naast de schatting te staan.
Een praktische gewoonte: rapporteer het interval altijd direct naast de schatting, in dezelfde zin. Als je ze scheidt en het interval in een voetnoot zet, weet je zeker dat de voetnoot niet gelezen wordt.
Betrouwbaarheidsinterval vs. verwante concepten
| Term | Wat het beschrijft | Veelvoorkomende verwarring |
|---|---|---|
| Betrouwbaarheidsinterval | Aannemelijk bereik voor een populatiewaarde | Geïnterpreteerd als een waarschijnlijkheid over dit specifieke bereik |
| Voorspellingsinterval | Aannemelijk bereik voor één toekomstige waarneming | Gebruikt wanneer de vraag over individuen gaat |
| Foutmarge | De helft van de breedte van een symmetrisch interval | Genoemd zonder het bijbehorende betrouwbaarheidsniveau |
| Standaardafwijking | Spreiding van de gegevens zelf | Verward met onzekerheid in de schatting |
Het onderscheid tussen de eerste twee rijen veroorzaakt in de praktijk de meeste schade. Een smal interval rond een gemiddelde is geen belofte over een individuele klant, bestelling of dag.
Voor het verwante concept of een waargenomen verschil überhaupt reëel is, zie onze gids over wat statistische significantie is.
Beperkingen en wat het je niet kan vertellen
Het lost een vertekende steekproef niet op. Als je enquête alleen je meest actieve gebruikers heeft bereikt, leiden meer reacties tot een smaller interval rond het verkeerde getal. Precisie en nauwkeurigheid zijn verschillende eigenschappen.
Het beschrijft niet hoe belangrijk iets is. Een verschil kan heel precies worden gemeten en toch te klein zijn om actie op te ondernemen. Statistische resolutie en zakelijke relevantie zijn twee verschillende zaken.
Het veronderstelt dat aan de voorwaarden van de methode is voldaan. Elk interval rust op aannames over hoe de steekproef is getrokken. Gelegenheidssteekproeven en het herhaaldelijk tussentijds bekijken van resultaten schenden beide stilletjes die aannames.
Het is gemakkelijk te vertekenen door vroegtijdig te stoppen. Resultaten herhaaldelijk controleren en stoppen zodra het bereik er overtuigend uitziet, verhoogt het foutpercentage tot boven het aangegeven niveau. Leg de steekproefomvang vast voordat je begint te kijken.
Het zegt niets over een individueel geval. Het interval gaat over een populatiewaarde. Dit toepassen op één klant of één transactie is een categoriefout.
Simpel gezegd: het interval kwantificeert de steekproefvariabiliteit en niets anders. Over elke andere foutenbron moet je je zelf nog steeds zorgen maken.
Hoe je er een krijgt uit je gegevens met Powerdrill Bloom
Stap 1: Upload je gegevens
Upload de ruwe reacties of metingen in plaats van een samenvattende tabel. Powerdrill Bloom profileert de kolommen bij binnenkomst, zodat groepsgroottes en ontbrekende waarden zichtbaar zijn voordat er een interval wordt berekend.
Stap 2: Vraag om het interval in natuurlijke taal
Vraag om de schatting en het bereik samen. Vraag naar het gemiddelde per groep met een 95%-betrouwbaarheidsinterval, and ask how many observations sit behind each one.
Stel vervolgens de vervolgvraag die cijfers omzet in een beslissing. Vraag welke groepsverschillen intervallen hebben die nul uitsluiten, en welke te breed zijn om een conclusie te ondersteunen.
Stap 3: Exporteer de grafiek, het rapport of de presentatie
Exporteer een tabel met bijbehorende intervallen, een grafiek met foutbalken of een geschreven alinea die je zo in een rapport kunt plakken.
Conclusie
Een betrouwbaarheidsinterval drukt uit hoeveel je schatting zou verschuiven als je opnieuw een steekproef zou nemen. Kijk eerst naar de breedte en controleer dan of het de waarde uitsluit die ertoe doet. De betrouwbaarheid hoort bij de methode en niet bij het weergegeven bereik.
Het is de moeite waarde om nog één laatste gewoonte aan te nemen. Wanneer iemand je een enkel getal laat zien zonder bijbehorend bereik, vraag dan wat het bereik is. Het antwoord is meestal informatief, en soms is het dat niemand de moeite heeft genomen er een te berekenen.
De gewoonte die het opbouwen waard is, is om het bereik te rapporteren telkens wanneer je het getal rapporteert. Als je liever om beide tegelijk vraagt, probeer dan Powerdrill Bloom op je dataset. Zie ook onze gidsen over het uitvoeren van beschrijvende statistiek en het analyseren van A/B-testresultaten zonder statisticus, plus de pagina over auto insights.
Veelgestelde vragen
Wat betekent een 95%-betrouwbaarheidsinterval nu eigenlijk?
Het betekent dat de gebruikte methode in ongeveer 95% van de herhaalde steekproeven een interval zou opleveren dat de werkelijke populatiewaarde bevat. De 95% beschrijft de procedure en niet het specifieke bereik dat je hebt berekend.
Is een breder betrouwbaarheidsinterval beter of slechter?
Slechter, in de zin dat het minder informatief is. Een breed bereik betekent dat de gegevens veel mogelijke waarden ondersteunen, wat meestal wijst op een kleine steekproef of een hoge variabiliteit in wat je hebt gemeten.
Waarom ziet een 99%-interval er slechter uit dan een 95%-interval?
Omdat een hogere betrouwbaarheid een breder net vereist. Dezelfde gegevens kunnen alleen een betrouwbaardere claim ondersteunen door die claim minder specifiek te maken, waardoor de precisie afneemt naarmate de betrouwbaarheid toeneemt.
Wat is het verschil tussen een betrouwbaarheidsinterval en een foutmarge?
De foutmarge is de helft van de breedte van een symmetrisch interval. Het noemen van een foutmarge zonder het bijbehorende betrouwbaarheidsniveau laat de informatie weg die nodig is om deze te interpreteren.
Can a confidence interval be wrong?
De berekening kan correct zijn terwijl het antwoord misleidend is. Een vertekende steekproef levert een smal interval op rond de verkeerde waarde, omdat de methode de steekproefvariabiliteit meet en niet de nauwkeurigheid.