empirio.ai

Beschrijvende Statistiek & Inferentiële Statistiek: Gids

Beschrijvende statistiek laat zien wat er in je data zit. Wanneer dat genoeg is, wanneer je verder moet rekenen en hoe je het van inferentie scheidt.

Auteur bij empirio.ai - Maria Malzewdoor Maria MalzewBijgewerkt op 7 september 2026Leestijd 13 min

De vragenlijst is retour en er staan 87 regels in een spreadsheet. En dan? De meeste mensen grijpen meteen naar het gemiddelde, zonder eerst te controleren of deze antwoorden een gemiddelde toelaten.

Beschrijvende statistiek vat precies de cases samen die je hebt verzameld, met maten als het gemiddelde, de mediaan en de standaarddeviatie. Inferentiële statistiek gaat een stap verder en schat op basis van die steekproef wat er waarschijnlijk voor de hele populatie geldt, altijd met een marge erbij. Aan het eind weet je welke maat je data toelaten en wanneer je die tweede stap kunt overslaan.


📌 In het kort

  • Beschrijvende statistiek beschrijft de steekproef, inferentiële statistiek schat de populatie.
  • De modus mag op elk meetniveau, het gemiddelde pas vanaf interval.
  • Beschrijf je alleen je eigen groep, dan hoef je niet te toetsen.
  • Een uitschieter trekt duidelijk aan het gemiddelde, de mediaan nauwelijks.
  • Spreiding, aantal respondenten en design bepalen de marge.

Gratis enquête maken

Met empirio.ai maak je in enkele minuten een moderne online enquête — met hosting in de EU.

  • Enquête met AI
  • Aanpassen met drag & drop
  • Analyse in realtime
Gratis beginnen

Wat is beschrijvende statistiek?

Beschrijvende statistiek is het deel van de statistiek dat een bestaande dataset samenvat en presenteert zonder erbuiten te treden. Elke uitspraak geldt voor de cases die je hebt verzameld en voor geen enkele daarbuiten.

Die begrenzing klinkt bescheiden en draagt toch de halve analyse. Van 200 regels ruwe data wordt niemand wijzer. Pas wanneer die regels een paar getallen en één grafiek worden, ontstaat er een beeld van waar het midden ligt, hoe breed de antwoorden uiteenlopen en of twee variabelen samen bewegen. Precies die drie vragen beantwoorden de drie groepen maten.

Ook de presentatie hoort bij beschrijvende statistiek: frequentietabel, staaf- en cirkeldiagram, histogram, boxplot. De vorm volgt de boodschap, niet de eerste knop in je software. Nicola Döring zet de data-analyse in dezelfde volgorde in haar handboek Forschungsmethoden und Evaluation in den Sozial- und Humanwissenschaften (6e druk, Springer 2023, hoofdstuk 12): eerst beschrijven, dan toetsen. Voor de plek van deze stap in het geheel, zie het overzicht van empirisch onderzoek.

Beschrijvende en inferentiële statistiek: het verschil

Het verschil tussen beschrijvende en inferentiële statistiek gaat over het bereik van de uitspraak. Beschrijvende statistiek beweert alleen iets over de mensen die geantwoord hebben. Inferentiële statistiek beweert iets over iedereen die deze respondenten moeten vertegenwoordigen, en becijfert daarbij haar eigen onzekerheid.

Inferentiële statistiek heet daarom ook toetsende of inductieve statistiek. Zij doet twee dingen: populatiewaarden schatten, meestal als betrouwbaarheidsinterval, en hypothesen toetsen over verschillen of samenhang. Elke dataset laat zich beschrijven. Alleen een steekproef uit een correcte trekkingsprocedure maakt generaliseren mogelijk.

Beide delen leunen sterker op elkaar dan het lijkt. Zonder nette beschrijving merk je niet dat een verdeling scheef ligt, dat één waarde alles vertekent of dat een vergelijkingsgroep uit drie personen bestaat. Die drie bevindingen bepalen welke toets überhaupt toelaatbaar is. Daarom opent de beschrijving het resultatenhoofdstuk.

De maten van de beschrijvende statistiek

De maten van de beschrijvende statistiek vallen in drie groepen uiteen: centrummaten voor het midden, spreidingsmaten voor de breedte, samenhangsmaten voor de relatie tussen twee variabelen. Wie maar één groep rapporteert, levert een halve analyse in.

Eén voorbeeld loopt door dit hele hoofdstuk heen. Je hebt 15 studiegenoten gevraagd hoeveel uur per week zij aan hun scriptie besteden. Geordend zijn de antwoorden 2, 3, 3, 4, 4, 4, 5, 5, 6, 6, 7, 8, 9, 10 en 20. Eén persoon springt eruit, en juist dat ene antwoord laat elke maat zien.

Centrummaten: modus, mediaan en gemiddelde

Centrummaten geven aan waar het midden van een verdeling ligt. De modus is de meest voorkomende waarde, hier 4 uur, die drie keer voorkomt. Komen twee waarden even vaak voor, dan zijn er twee modi, en verschillen alle waarden, dan zegt de modus niets meer. De mediaan staat in het midden van de geordende reeks, bij 15 waarden dus op de achtste plek: 5 uur. Het gemiddelde is de som gedeeld door het aantal, hier 96 gedeeld door 15, dus 6,4 uur.

Drie maten, drie verschillende antwoorden op dezelfde vraag. De waarde 20 is de veroorzaker. Laat je die weg, dan zakt het gemiddelde van 6,4 naar 5,4 uur terwijl de mediaan op 5 blijft staan. De mediaan is bestand tegen uitschieters, het gemiddelde niet. Bij scheve variabelen als inkomen, wachttijden of werkdruk rapporteer je daarom allebei.

Spreidingsmaten: spreidingsbreedte, variantie en standaarddeviatie

Spreidingsmaten geven aan hoe ver de waarden uit elkaar liggen. De spreidingsbreedte is het verschil tussen de grootste en de kleinste waarde, hier 20 min 2, dus 18 uur. De variantie bundelt de afwijkingen van het gemiddelde: je kwadrateert elke afwijking, telt alles op en deelt door n min 1, wat hier 19,4 oplevert. Die aftrek van één is de gebruikelijke route zolang je data een steekproef zijn en niet de hele populatie. De standaarddeviatie is de wortel uit de variantie, ongeveer 4,4 uur.

Variantie en standaarddeviatie worden vaak door elkaar gehaald, terwijl het onderscheid simpel is: de variantie staat in gekwadrateerde eenheden en laat zich niet intuïtief lezen, de standaarddeviatie staat in uren en hoort naast het gemiddelde. Ook hier trekt de uitschieter hard. Zonder de waarde 20 daalt de standaarddeviatie van 4,4 naar 2,4 uur.

Samenhangsmaten: welke coëfficiënt bij welke data

Samenhangsmaten laten zien hoe sterk twee variabelen samen bewegen. Het meetniveau bepaalt de keuze: Pearsons r bij twee metrische variabelen, Spearmans rangcorrelatie zodra er één slechts ordinaal is, Cramérs V bij twee nominale variabelen. Pearson en Spearman lopen van min 1 tot plus 1, Cramérs V van 0 tot 1. De eveneens gangbare contingentiecoëfficiënt haalt de 1 alleen in zijn gecorrigeerde vorm, wat Cramérs V de veiligere keuze maakt.

⚠️ Let op

Een hoge correlatiecoëfficiënt bewijst geen oorzaak. Hij laat alleen zien dat twee variabelen samen variëren. Schrijf „hangt samen met” en niet „leidt tot” zolang je onderzoeksopzet geen richting van het effect vaststelt. Pearsons r ziet bovendien alleen rechtlijnige verbanden: een waarde dicht bij nul sluit een sterk maar gekromd verband niet uit. Maak daarom altijd eerst een spreidingsdiagram.

Welke maat mag je bij welk meetniveau gebruiken?

Wat is toegestaan hangt af van het meetniveau van je variabele, niet van de vraag of je software een getal teruggeeft. Excel berekent probleemloos het gemiddelde van een variabele waarin 1 voor Utrecht staat, 2 voor Groningen en 3 voor Eindhoven. Betekenis heeft dat getal nog steeds niet.

De indeling gaat terug op de psycholoog Stanley Smith Stevens, die in 1946 in Science vier soorten schalen onderscheidde en per soort vastlegde welke maten zinvol blijven (Stevens 1946). De tabel hieronder geeft de vandaag gangbare lezing weer, die Stevens op punten uitbreidt. Kritiek is er sinds de jaren negentig: gelezen als starre regel misleiden de vier typen in grensgevallen.

MeetniveauToegestane centrummatenToegestane spreidingsmaten
Nominale schaalModusgeen in strikte zin, rapporteer frequenties en proporties
Ordinale schaalModus, mediaanKwartielen, percentielen
Intervalschaalplus het rekenkundig gemiddeldeSpreidingsbreedte, variantie, standaarddeviatie
Ratioschaalplus het meetkundig gemiddeldeplus de variatiecoëfficiënt

Lees de tabel cumulatief: wat een lager niveau toestaat, blijft op elk hoger niveau toegestaan. De modus werkt daarom overal, het gemiddelde pas vanaf de intervalschaal. Hoe je het niveau van je eigen variabelen bepaalt, staat in het artikel over het meetniveau.

De terugkerende discussie gaat over instemmingsschalen van „helemaal oneens” tot „helemaal eens”. Strikt genomen zijn die ordinaal, want niemand kan aantonen dat alle respondenten de afstanden tussen de opties als gelijk ervaren. Toch behandelt de onderzoekspraktijk zulke items vaak als intervaldata, zeker wanneer meerdere items tot één schaal worden samengevoegd. Dat is alleen houdbaar bij symmetrische, volledig gelabelde opties, en de keuze hoort onderbouwd in je methodesectie. Het artikel over de likertschaal gaat er uitgebreid op in.

Gratis enquête maken

Met empirio.ai maak je in enkele minuten een moderne online enquête — met hosting in de EU.

  • Enquête met AI
  • Aanpassen met drag & drop
  • Analyse in realtime
Gratis beginnen

Wanneer je helemaal geen inferentiële statistiek nodig hebt

Inferentiële statistiek wordt overbodig zodra niemand naar een grotere groep wil generaliseren. Een significantietoets bestaat uitsluitend om van een steekproef naar een populatie te stappen. Valt dat doel weg, dan valt ook de reden voor de toets weg.

Het duidelijkste geval is de integrale telling. Antwoorden alle 42 leden van je studievereniging en wil je iets zeggen over precies die 42 mensen, dan ligt de populatie compleet voor je en valt er niets meer te generaliseren. Dat 19 van de 42 het latere tijdstip prefereren, is dan geen schatting met een marge eromheen maar simpelweg de uitkomst. Antwoordt maar een deel, dan is het geen integrale telling meer maar een groep die zichzelf heeft samengesteld.

Eén grens geldt niettemin, en die hoort in je methodesectie. De regel gaat op zolang je uitspraak zich beperkt tot precies deze groep op precies dit moment. Zodra je de uitkomst leest als aanwijzing voor iets dat eronder ligt, bijvoorbeeld toekomstige leden of een oorzaak, werk je weer met een model en zijn betrouwbaarheidsintervallen weer op hun plaats. De methodenliteratuur brengt dit geval onder bij de term superpopulatie.

💡 Tip

Zet één zin in je methodesectie waarom er geen toets volgt: „Omdat het om een integrale telling van de populatie gaat, zijn geen inferentiële technieken toegepast.” Bij de verdediging klinkt die zin zelfverzekerder dan een toets zonder doel.

Het tweede geval is de gemakssteekproef. Je vragenlijst delen in drie WhatsApp-groepen en op je eigen Instagram is geen aselecte trekking, het is vragen aan wie bereikbaar was. Een toets valt op zulke data nog steeds te berekenen, maar de uitkomst reikt niet verder dan de respondenten. Die beperking hoort open in je limitaties, en juist daar worden punten verdiend. Wat een steekproef methodologisch draagt en vanaf wanneer een onderzoek representatief heet, staat in de twee gelinkte artikelen.

Wat de p-waarde zegt en wat niet

De p-waarde geeft aan hoe waarschijnlijk een uitkomst als de jouwe of een extremere zou zijn als de nulhypothese waar was en alle overige aannames van je model klopten, om te beginnen de aselecte trekking. Zij doet dus een uitspraak over de data onder die aannames, niet over de aannames zelf. Een kleine p-waarde kan daarom ook betekenen dat één van die aannames niet klopt.

De American Statistical Association publiceerde in 2016 zes uitgangspunten over de p-waarde, omdat de misverstanden in de vakliteratuur de overhand kregen. Uitgangspunt twee laat geen ruimte: „P-values do not measure the probability that the studied hypothesis is true …” (Wasserstein en Lazar 2016). De zin gaat verder en sluit ook het tweede veelgemaakte misverstand uit: de p-waarde zegt evenmin hoe waarschijnlijk het is dat je uitkomst puur toeval was. Een p-waarde van 0,03 betekent dus niet dat jouw hypothese voor 97 procent klopt. Wat je eigen twee groepen opleveren, laat de p-waardecalculator zien; de duiding blijft daarmee nog steeds jouw werk.

Evenmin meet een p-waarde de grootte of het belang van een effect, aldus het vijfde uitgangspunt van dezelfde verklaring. Bij een heel grote steekproef kan ook een minuscuul, praktisch irrelevant verschil significant worden. Zet daarom naast elke p-waarde een effectgrootte en waar mogelijk een betrouwbaarheidsinterval.

Waar de marge van afhangt

Het CBS laat zien hoe serieus onzekerheid wordt genomen. In de onderzoeksverantwoording bij de Veiligheidsmonitor legt het bureau uit dat de betrouwbaarheidsmarge bij elk gepresenteerd percentage vooral afhangt van de spreiding in de antwoorden en van het aantal ondervraagde personen, naast het gekozen betrouwbaarheidsniveau en het onderzoeksdesign (CBS, onderzoeksverantwoording). Voor je eigen scriptie betekent dat: een getal zonder uitspraak over de precisie is nog geen af getal, en meer respondenten helpen alleen zolang de spreiding niet meegroeit. Hoe je je aannames vooraf scherp formuleert, staat in het artikel over hypothesen opstellen.

Beschrijvende statistiek in je resultatenhoofdstuk

Het resultatenhoofdstuk opent met beschrijvende statistiek, en wel met de beschrijving van de steekproef: aantal cases, respons, verdeling naar leeftijd, geslacht, studiejaar of wat je onderzoeksvraag vereist. Pas daarna volgen de maten van de inhoudelijke variabelen en tot slot de hypothesetoetsing.

Voor de presentatie geldt een simpele vuistregel. Wat in twee zinnen te zeggen is, blijft in de tekst. Wat meer dan drie waarden omvat, gaat in een tabel. Wat een verdeling of een verloop moet tonen, wordt een grafiek. Elke tabel vermeldt n en de maten die bij het meetniveau passen, dus gemiddelde en standaarddeviatie bij metrische variabelen en frequenties bij nominale. Elke grafiek heeft gelabelde assen met eenheid.

Waarmee je rekent

Voor centrum- en spreidingsmaten volstaat een spreadsheet ruimschoots. SPSS is op veel opleidingen de standaard maar vraagt een licentie; JASP en jamovi zijn gratis, werken vergelijkbaar en dekken de technieken die een scriptie gewoonlijk vraagt. R en Python lonen als je er toch al mee werkt. Beoordeeld wordt niet het programma, maar of je rekenweg te volgen is.

Het wordt aanzienlijk makkelijker wanneer de data al gestructureerd binnenkomen. Bij online onderzoek download je de antwoorden als Excel- of CSV-bestand en bespaar je jezelf het overtypen en de typefouten die daarbij horen. empirio.ai, een online enquêtetool uit Duitsland, toont frequenties en gemiddelden direct in het resultatenoverzicht en levert de ruwe data daarnaast als bestand.

Veelgemaakte fouten bij de analyse

De meeste zwakke plekken in een resultatenhoofdstuk zijn geen rekenfouten maar koppelfouten: een maat wordt losgelaten op data waarvoor zij niet bedoeld is, of een getal krijgt meer betekenis toegedicht dan het draagt. Vier patronen komen steeds terug.

Alle vier vallen tijdens het schrijven niet op en springen bij het lezen meteen in het oog. Het resultatenhoofdstuk er gericht op nalopen kost een kwartier voor het inleveren, en juist hierop wordt bij de verdediging doorgevraagd.

Een gemiddelde over een nominale variabele

Een gemiddelde van 1,6 bij een variabele waarvan de codes voor opleidingen staan, is geen informatie maar een bijproduct van de codering. Bij nominale variabelen rapporteer je frequenties en proporties, verder niets. De test is snel: verandert de uitspraak wanneer je de codes anders toekent, dan is de maat ontoelaatbaar.

Alleen het gemiddelde rapporteren

Een gemiddelde zonder spreidingsmaat verzwijgt de helft van de informatie. Zo'n 6,4 uur per week kan betekenen dat iedereen ongeveer zes uur werkt, of dat een deel twee uur doet en een ander deel elf. Standaarddeviatie en aantal horen daarom op dezelfde regel als het gemiddelde.

Percentages zonder basis

„60 procent van de respondenten is het eens” klinkt solide, totdat blijkt dat vijf mensen hebben geantwoord. Onder ongeveer twintig cases is één persoon meer dan vijf procentpunten waard, waardoor het absolute getal eerlijker is. Noem dat dus altijd, dus „drie van de vijf”.

Significantie verwarren met relevantie

Een significant verschil is niet automatisch een belangrijk verschil. Of een effect in de praktijk telt, blijkt pas uit de effectgrootte, afgezet tegen wat in jouw vakgebied gebruikelijk is en beoordeeld op wat in jouw geval echt verschil maakt. Formuleringen als „zeer significant” suggereren een omvang die de p-waarde niet meet.

Conclusie

Beschrijvende statistiek is geen opwarmertje voor de echte analyse. In veel studentonderzoek is zij de complete analyse. Wie iedereen heeft bevraagd, of geen aselecte steekproef kon trekken, beschrijft zorgvuldig en benoemt de grenzen in plaats van een toets te draaien die de data niet dragen. En wie wel toetst, zet een effectgrootte naast de p-waarde.

Een eerlijk beschreven steekproef weegt zwaarder dan een sterretje achter een getal.

Hoe je verdergaat


Liever je data niet overtypen?

Met empirio.ai maak je je enquête gratis en krijg je frequenties, gemiddelden en een export van de ruwe data zonder tussenstap. Enquête maken

Veelgestelde vragen

Beschrijvende statistiek vat een bestaande dataset samen en presenteert die, zonder erbuiten te treden. Daaronder vallen centrummaten als modus, mediaan en gemiddelde, spreidingsmaten als spreidingsbreedte, variantie en standaarddeviatie, plus samenhangsmaten en grafieken. Elk getal geldt voor de cases die je hebt verzameld.

Beschrijvende statistiek beschrijft de steekproef, inferentiële statistiek trekt daaruit conclusies over de populatie. Zij schat populatiewaarden, meestal als betrouwbaarheidsinterval, en toetst hypothesen, altijd met een marge erbij. Beschrijven kan met elke dataset, generaliseren alleen bij een goed getrokken steekproef.

Beschrijvende statistiek gebruikt drie groepen maten. Centrummaten zijn modus, mediaan en gemiddelde. Spreidingsmaten zijn spreidingsbreedte, interkwartielafstand, variantie en standaarddeviatie. Samenhangsmaten zijn de correlatiecoëfficiënt van Pearson, de rangcorrelatie van Spearman en Cramérs V. Doorslaggevend is eerst het meetniveau en daarna de verdeling.

Een likertschaal is strikt genomen ordinaal, omdat gelijke afstanden tussen de antwoordopties niet aantoonbaar zijn. Daarmee blijven modus en mediaan over. In de onderzoekspraktijk worden meerdere samengevoegde items vaak toch als intervaldata behandeld. Dat is alleen verdedigbaar bij symmetrische, volledig gelabelde opties en met een onderbouwing in je methodesectie.

De p-waarde geeft aan hoe waarschijnlijk een uitkomst als de jouwe of extremer zou zijn als de nulhypothese waar was. Zij meet niet de kans dat jouw hypothese klopt en evenmin de grootte van een effect. De American Statistical Association stelt dat expliciet vast in haar verklaring uit 2016.

Inferentiële statistiek is alleen nodig als je van je steekproef naar een grotere populatie wilt generaliseren. Hebben alle leden van die populatie geantwoord, dan is het een integrale telling en vervalt die stap. Bij een gemakssteekproef kun je wel toetsen, maar de uitkomst reikt niet verder dan de respondenten.

De betrouwbaarheidsmarge hangt volgens het CBS vooral af van drie dingen: de spreiding in de antwoorden, het aantal ondervraagde personen en het gekozen onderzoeksdesign. Meer respondenten maken de marge kleiner, maar een grote spreiding maakt haar weer groter. Meestal wordt een betrouwbaarheidsniveau van 95 procent gekozen.

Dit zou je ook kunnen interesseren

Empirisch onderzoek

Grondslagen van empirisch onderzoek | empirio

Empirisch onderzoek is meer dan cijfers en meer dan een eigen enquête. Ontdek welke route bij jouw onderzoeksvraag past en wat je vóór de eerste vraag geregeld moet hebben.