Twee begeleiders lezen dezelfde ingevulde vragenlijst en komen tot twee verschillende scores. De vragenlijst is daarom nog niet slecht gebouwd. Alleen objectief is hij niet.
Objectiviteit, betrouwbaarheid en validiteit zijn de drie belangrijkste kwaliteitscriteria van kwantitatief onderzoek, en ze toetsen elk iets anders. Objectiviteit betekent dat de uitkomst niet afhangt van wie de meting afneemt, scoort en uitlegt. Betrouwbaarheid betekent dat een instrument nauwkeurig meet, dus met een zo klein mogelijke meetfout. Validiteit betekent dat een vragenlijst werkelijk het kenmerk meet waar het om gaat, en niet per ongeluk een ander. Na dit artikel kun je voor je eigen onderzoek onderbouwen welk criterium je hoe goed haalt.
📌 Het belangrijkste in het kort
- Objectiviteit: de uitkomst hangt niet aan de beoordelaar.
- Betrouwbaarheid: het instrument meet met een kleine meetfout.
- Validiteit: gemeten wordt echt het bedoelde kenmerk.
- Betrouwbaarheid is voorwaarde voor validiteit, niet andersom.
- De COTAN beoordeelt tests op zeven criteria, niet op drie.
Gratis enquête maken
Met empirio.ai maak je in enkele minuten een moderne online enquête — met hosting in de EU.
- Enquête met AI
- Aanpassen met drag & drop
- Analyse in realtime
Objectiviteit, betrouwbaarheid en validiteit: de drie kwaliteitscriteria op een rij
Objectiviteit, betrouwbaarheid en validiteit zijn de drie hoofdkwaliteitscriteria waarmee de kwaliteit van een meetinstrument wordt beoordeeld. Ze beantwoorden achter elkaar drie vragen: is de meting onafhankelijk van degene die haar afneemt, is ze nauwkeurig, en meet ze het juiste?
De volgorde is geen gewoonte, maar geeft weer waar het volgende criterium op leunt. Een onderzoek waarin elke beoordelaar tot een andere score komt, kan al niet betrouwbaar zijn, en een onbetrouwbare meting kan niet geldig zijn. De samenhang is strenger dan de meeste overzichten doen vermoeden, en krijgt verderop een eigen hoofdstuk.
| Kwaliteitscriterium | De vraag erachter | Waaraan je het afmeet |
|---|---|---|
| Objectiviteit | Hangt de uitkomst aan de persoon? | vaste regels voor afname, scoring, interpretatie |
| Betrouwbaarheid | Komt er bij herhaling hetzelfde uit? | betrouwbaarheidscoëfficiënt tussen 0 en 1 |
| Validiteit | Wordt het bedoelde kenmerk gemeten? | inhoudelijke, begrips- en criteriumgebonden bewijzen |
Wat in veel overzichten ontbreekt: die drie zijn niet de hele lijst, en welke lijst je krijgt hangt af van het taalgebied. In het Duitse taalgebied geldt de opsomming van Helfried Moosbrugger en Augustin Kelava uit hun standaardwerk „Testtheorie und Fragebogenkonstruktion“ (Springer, 2012) als conventie, met tien kwaliteitscriteria. In Nederland en Vlaanderen ligt de maatstaf anders: de COTAN, de Commissie Testaangelegenheden Nederland van het Nederlands Instituut van Psychologen, beoordeelt tests op zeven criteria en publiceert die oordelen sinds 1969, als eerste land ter wereld.
- Uitgangspunten van de testconstructie
- Kwaliteit van het testmateriaal
- Kwaliteit van de handleiding
- Normen
- Betrouwbaarheid
- Begripsvaliditeit
- Criteriumvaliditeit
Waarom objectiviteit geen COTAN-criterium is
Objectiviteit staat wel in Nederlandse studieboeken, maar komt in de zeven COTAN-criteria niet als eigen punt voor. Validiteit is er juist opgesplitst in twee losse criteria, begripsvaliditeit en criteriumvaliditeit, en die opsplitsing is een bijzonderheid van het Nederlandse systeem. Voor je scriptie betekent dat vooral: noem objectiviteit gerust, maar verwacht die term niet terug in een COTAN-beoordeling.
Voor een scriptie volstaat de beperking tot de drie hoofdcriteria vrijwel altijd. Alleen moet je weten dat je daarmee een keuze maakt. Wie daarnaast ook de bredere kwaliteitscriteria van empirisch onderzoek kan benoemen, staat bij de verdediging duidelijk steviger.
Verouderde normen: na 15 jaar een waarschuwing, na 20 jaar onvoldoende
Normen verouderen, en de COTAN heeft die veroudering als enige in een harde termijn gegoten. Zijn er sinds het normeringsonderzoek 15 jaar verstreken zonder hernormering, dan krijgt de test de toevoeging ‚De normen zijn verouderd’. Na 20 jaar wordt dat ‚Wegens veroudering zijn de normen niet meer bruikbaar’ en gaat de beoordeling automatisch naar onvoldoende. Neem je voor je scriptie een bestaande schaal over, kijk dan eerst hoe oud de normering ervan is.
Een onvoldoende zegt overigens niet automatisch dat een test slecht is. De COTAN wijst er zelf op dat het oordeel twee dingen kan betekenen: er zijn te weinig gegevens aangeleverd om iets te kunnen beoordelen, of de kwaliteit is aantoonbaar onder de maat. Wijs je een instrument af, noem dan welke van de twee aan de hand is.

Objectiviteit: hangt de uitkomst af van wie de vragenlijst afneemt?
Objectiviteit is er wanneer een test het kenmerk dat hij meet onafhankelijk van afname en scoring meet, en wanneer er duidelijke, gebruikersonafhankelijke regels voor de interpretatie zijn. Praktisch gezien betekent dat: degene die de meting afneemt, krijgt geen speelruimte.
Bij een online enquête is dat criterium makkelijker te halen dan bij welke mondelinge methode ook, omdat er tussen onderzoeker en respondent simpelweg geen gesprek plaatsvindt. Precies daarom is de gestandaardiseerde online enquête bij scripties zo populair. De drie vormen van objectiviteit gaan terug op Gustav Lienert en Ulrich Raatz (1998), Moosbrugger en Kelava nemen ze in die vorm over, en in een scriptie onderbouw je ze alle drie apart.
Afnameobjectiviteit: dezelfde omstandigheden voor iedere respondent
Afnameobjectiviteit is er wanneer de uitkomst niet afhangt van wie het onderzoek begeleidt. De hefboom daarvoor heet standaardisatie: instructie, volgorde, tijdsaanduidingen en antwoordformaten liggen vooraf vast en veranderen tussen twee deelnemers niet. Het ideaal is dat de respondent de enige bron van variatie in de situatie is. Een enquête die via één link wordt verspreid en er voor iedereen hetzelfde uitziet, haalt dat bijna vanzelf.
Scoringsobjectiviteit: dezelfde antwoorden, dezelfde verwerking
Scoringsobjectiviteit is er wanneer verschillende personen bij identieke antwoorden tot dezelfde uitkomst komen. Bij gesloten vragen met vaste antwoordopties is dat onproblematisch, omdat er niets te duiden valt. Zodra je met open vragen werkt, daalt de scoringsobjectiviteit, want vrije tekst moet worden gecategoriseerd. Een reden tot afwijzen is dat niet, maar het vraagt wel om een vastgelegd codeerschema.
Interpretatieobjectiviteit: dezelfde waarden, dezelfde conclusie
Interpretatieobjectiviteit is er wanneer verschillende vakgenoten uit dezelfde getalswaarde dezelfde conclusie trekken. In de praktijk is dat de zwakste van de drie vormen, omdat er normwaarden of duidelijke drempels voor zouden moeten bestaan. Bij een eigen onderzoek zonder normeringssteekproef ontbreken die. Wat je in plaats daarvan doet: de interpretatieregels vooraf vastleggen en in je methodenhoofdstuk noemen, in plaats van ze achteraf op de uitkomst af te stemmen.
💡 Tip
Formuleer de verwerkingsregels voor open vragen voordat je het eerste antwoord leest. Wie het codeerschema pas op de dataset ontwikkelt, kan niet meer uitsluiten dat de categorieën naar de gewenste uitkomst zijn toegeschreven. Bij de verdediging is dat de meest ongemakkelijke vraag die je kunt krijgen.
Betrouwbaarheid: komt er bij een herhaling hetzelfde uit?
Betrouwbaarheid staat voor de meetnauwkeurigheid van een test. Een test is betrouwbaar wanneer hij het kenmerk dat hij meet zonder meetfout meet. De maat daarvoor is de betrouwbaarheidscoëfficiënt, en die ligt tussen 0 en 1.
Een coëfficiënt van 1 betekent dat de meting vrij is van meetfouten, een coëfficiënt van 0 dat de waarde uitsluitend door meetfouten tot stand kwam. In het Duitstalige standaardwerk van Moosbrugger en Kelava (2012) staat dat de betrouwbaarheidscoëfficiënt van een goede test 0,70 niet zou moeten onderschrijden. Dat getal circuleert online vaak zonder bron. Het staat er als streefwaarde, en niet als grens waaronder een schaal onbruikbaar zou zijn.
Voor het bepalen van de betrouwbaarheid zijn in de klassieke testtheorie vier methoden gebruikelijk. Welke daarvan voor jouw scriptie haalbaar is, bepaalt minder de statistiek dan de vraag of je je respondenten een tweede keer bereikt.
| Methode | Hoe ze werkt | Haalbaar in een scriptie? |
|---|---|---|
| Test-hertestbetrouwbaarheid | dezelfde test op twee momenten, waarden correleren | zelden, respondenten zijn meestal niet opnieuw bereikbaar |
| Paralleltestbetrouwbaarheid | twee inhoudelijk gelijkwaardige testvormen | nauwelijks, de itempool is daarvoor te klein |
| Tweedeling (split-half) | test in twee helften splitsen, helften correleren | ja, met Spearman-Brown-correctie |
| Interne consistentie | elk item als eigen testdeel, meestal Cronbachs alfa | ja, dat is het normale geval |
De paralleltestbetrouwbaarheid geldt in de testtheorie als koningsweg, omdat oefen- en herinneringseffecten er geen rol spelen. Voor een bachelorscriptie of masterscriptie is ze toch bijna nooit haalbaar, want ze vraagt om twee vragenlijstversies die tot dezelfde ware waarden leiden. In de praktijk komt vrijwel iedereen uit bij de interne consistentie.
Cronbachs alfa: wat de waarde wel en niet aantoont
Cronbachs alfa meet hoe sterk de items van een schaal onderling samenhangen, en is daarmee een maat voor interne consistentie. De waarde is populair omdat elk statistiekpakket haar uitrekent, en wordt daardoor vaak overgeinterpreteerd. Een hoge alfa toont niet aan dat een schaal maar één kenmerk meet, en de waarde stijgt al doordat een schaal meer items krijgt. Ook de aanname eronder is streng: alle items zouden even sterk op hetzelfde kenmerk moeten laden. Klopt dat niet, dan onderschat alfa de werkelijke betrouwbaarheid. Klaas Sijtsma heeft die beperkingen in 2009 uitvoerig uiteengezet in het vaktijdschrift Psychometrika, en sindsdien wordt McDonalds omega vaak als alternatief genoemd.
Voor een scriptie betekent dat niet dat je omega moet uitrekenen. Alleen dat je alfa met een halve zin duidt, in plaats van haar als bewijs te presenteren. Precies zulke duidingen onderscheiden een goede van een gemiddelde methodendiscussie.

Validiteit: meet de vragenlijst werkelijk het bedoelde kenmerk?
Validiteit is er wanneer een test het kenmerk dat hij zou moeten meten ook werkelijk meet en niet een ander. Voor de testpraktijk geldt validiteit als het belangrijkste kwaliteitscriterium, omdat zij over de zeggingskracht van alle resultaten beslist.
Anders dan bij betrouwbaarheid bestaat er geen enkel getal dat validiteit aantoont. In plaats daarvan wordt zij uit meerdere soorten bewijs opgebouwd, en welke soorten zich daadwerkelijk laten toetsen, verschilt per toepassing. Gebruikelijk zijn vier aspecten, die in je methodenhoofdstuk ook zo mogen heten.
- Inhoudsvaliditeit: dekken de items het kenmerk representatief af? Beantwoord wordt die vraag niet met een berekening, maar met vakinhoudelijke afweging en expertoordeel.
- Indruksvaliditeit (face validity): lijkt de pretentie van een test een leek op het eerste gezicht terecht? Aan de orde is daarmee de acceptatie, niet de zeggingskracht.
- Begripsvaliditeit (constructvaliditeit): is de stap van antwoordgedrag naar het onderliggende kenmerk theoretisch onderbouwd? Aangetoond wordt zij via samenhang met verwante en met bewust onverwante methoden.
- Criteriumvaliditeit: valt vanuit de testscore iets te zeggen over gedrag buiten de testsituatie? Ligt het criterium gelijktijdig voor, dan heet dat congruente validiteit, ligt het in de toekomst, dan predictieve validiteit.
De meest gemaakte fout: inhoudsvaliditeit is niet hetzelfde als indruksvaliditeit
Vaak lees je dat inhoudsvaliditeit en indruksvaliditeit twee namen voor dezelfde zaak zijn. Onjuist, en de verwisseling is zo wijdverbreid dat methodenboeken haar uitdrukkelijk als valkuil benoemen. Het verschil zit in wie oordeelt en waarover. Inhoudsvaliditeit is een vakoordeel over de vraag of de items het kenmerkgebied afdekken. Indruksvaliditeit is de indruk van een leek dat een test plausibel oogt. Een vragenlijst kan heel plausibel ogen en toch langs het kenmerk heen meten, en omgekeerd kan een inhoudelijk zuivere test voor buitenstaanders volstrekt onbegrijpelijk lijken.
⚠️ Let op
Schrijf in je scriptie niet ‚inhoudsvaliditeit oftewel indruksvaliditeit’. Wie beide begrippen gelijkstelt, geeft een methodenexamen een open flank. Noem inhoudsvaliditeit als wat je vakinhoudelijk onderbouwt, en indruksvaliditeit hooguit als argument voor de acceptatie bij je respondenten.
Een tweede onscherpte betreft de interne en de externe validiteit. Beide begrippen komen uit de beoordeling van onderzoeksdesigns en beantwoorden de vragen of een causale conclusie binnen een studie standhoudt en of de resultaten daarbuiten gelden. Onderdelen van de inhouds- of begripsvaliditeit zijn ze niet, ook al worden ze in veel samenvattingen zo ingedeeld. Wie beide systematieken door elkaar haalt, verliest precies de precisie waarop het methodenhoofdstuk wordt beoordeeld.

Gratis enquête maken
Met empirio.ai maak je in enkele minuten een moderne online enquête — met hosting in de EU.
- Enquête met AI
- Aanpassen met drag & drop
- Analyse in realtime
Hoe objectiviteit, betrouwbaarheid en validiteit samenhangen
Betrouwbaarheid is de voorwaarde voor validiteit, en die afhankelijkheid loopt maar in één richting. Moosbrugger en Kelava schrijven dat objectiviteit en betrouwbaarheid alleen de gunstige voorwaarden voor een hoge validiteit leveren, en dat een test met lage betrouwbaarheid geen hoge validiteit kan hebben.
De geciteerde zin uit het leerboek oogt onopvallend en draagt toch de hele systematiek. Een betrouwbare meting kan namelijk alsnog langs het onderwerp heen gaan, terwijl een onbetrouwbare meting nooit geldig kan zijn. Objectiviteit gaat daaraan in de praktijk vooraf, omdat een onderzoek met veel speelruimte in de verwerking zelden stabiele waarden oplevert. Als formele voorwaarde staat dat echter niet in het leerboek, anders dan de verhouding tussen betrouwbaarheid en validiteit.
Een personenweegschaal die constant twee kilo te veel aangeeft, maakt het verschil concreet. Objectief is zij, want bij iedere persoon werkt zij volgens dezelfde regels. Betrouwbaar is zij ook, want bij drie metingen achter elkaar geeft zij hetzelfde aan. Valide is zij toch niet, want zij meet systematisch verkeerd. Precies dat geval, hoge betrouwbaarheid bij lage validiteit, komt in vragenlijsten het vaakst voor, en in de kengetallen valt het niet op.
Wat daaruit volgt voor de volgorde in je methodenhoofdstuk
- Bepaal eerst of het onderzoek voor alle respondenten gelijk verloopt.
- Toets daarna of je schalen intern consistent zijn.
- Onderbouw pas als laatste dat de items het bedoelde kenmerk afdekken.
- Rapporteer een lage waarde, in plaats van haar weg te laten.
Een betrouwbare vragenlijst meet nauwkeurig. Of hij het juiste meet, is daarmee nog niet beantwoord.
Gelden de drie kwaliteitscriteria ook in kwalitatief onderzoek?
Objectiviteit, betrouwbaarheid en validiteit zijn ontwikkeld voor gestandaardiseerde metingen en laten zich niet onveranderd op kwalitatieve methoden overzetten. Een interview met topiclijst hoort juist niet bij elke herhaling hetzelfde op te leveren, omdat het op de afzonderlijke persoon ingaat.
In de kwalitatieve sociale wetenschappen zijn daarom eigen criterialijsten ontstaan. Het bekendst is het voorstel van Yvonna Lincoln en Egon Guba uit „Naturalistic Inquiry“ (Sage, 1985), met de vier criteria geloofwaardigheid, overdraagbaarheid, navolgbaarheid en bevestigbaarheid. Gemeenschappelijk hebben die criteria dat niet de herhaalbaarheid telt, maar de vraag of een buitenstaander elke gemaakte stap kan volgen.
Voor jouw scriptie is het praktische gevolg overzichtelijk. Doe je kwalitatief onderzoek, schrijf dan niet over Cronbachs alfa, maar leg selectie, verloop en analyse zo nauwkeurig vast dat iemand anders de weg kan nagaan. Welke criteria in beide onderzoekslogica’s naast elkaar staan, lees je in het artikel over de kwaliteitscriteria van kwantitatief en kwalitatief onderzoek.
Kwaliteitscriteria in je scriptie: waar horen ze in de opbouw?
Kwaliteitscriteria hebben in een scriptie geen vaste plek in de opbouw. Twee varianten zijn gebruikelijk, en allebei zijn ze verdedigbaar: een eigen subparagraaf in het hoofdstuk over het onderzoeksdesign, of een passage in de reflectie op je eigen werkwijze.
Welke van de twee past, hangt ervan af hoezeer je methodekeuze voor je onderzoeksvraag om onderbouwing vraagt. Staat de methode centraal, dan horen de criteria naar voren in het design. Gaat het sterker om inhoudelijke inzichten, dan werken ze achterin de reflectie natuurlijker. Overleg het bij twijfel met je scriptiebegeleider, want sommige opleidingen hebben er een vaste verwachting over.
Variant 1: kwaliteitscriteria als eigen subparagraaf in het onderzoeksdesign
Variant 1 past wanneer je je methodekeuze uitvoerig onderbouwt en de kwaliteitscriteria deel van die onderbouwing zijn. Het voordeel is dat je lezers de kwaliteitsvraag al hebben afgehandeld voordat ze de resultaten zien, en bij een sterk kwantitatieve opzet weet de lezer bij elk kengetal al hoe het tot stand is gekomen. De prijs is dat je op dat punt nog niet weet welke schalen zwak uitpakken, dus reken op een aanvulling verderop.
- Inleiding met onderzoeksvraag
- Theorie en stand van het onderzoek
- Onderzoeksdesign, daarin: hypothesen, methodekeuze, populatie en steekproef, variabelen, vragenlijst, kwaliteitscriteria met elk een subparagraaf voor objectiviteit, betrouwbaarheid en validiteit
- Dataverzameling
- Data-analyse
- Resultaten
- Reflectie op de werkwijze
- Conclusie
Variant 2: kwaliteitscriteria als passage in de reflectie op je werkwijze
Variant 2 past wanneer je de grenzen van je onderzoek pas in het licht van de resultaten scherp kunt benoemen. De opbouw blijft dezelfde, alleen verhuizen de kwaliteitscriteria naar punt 7 en worden ze daar samen met de beperkingen van je scriptie besproken. Het voordeel is de eerlijkheid, want je schrijft over waarden die je werkelijk hebt gevonden en niet over voornemens. De prijs is dat de methodenkritiek ver achterin staat en snel wordt overgeslagen.
Bij beide varianten geldt dezelfde maatstaf: beoordeeld wordt niet of een onderzoek alle drie de criteria haalt, maar of navolgbaar wordt welke gehaald zijn en waar de grenzen liggen.

Veelgemaakte fouten bij de kwaliteitscriteria
De meeste puntenaftrek in het methodenhoofdstuk ontstaat niet door zwakke kengetallen, maar door uitspraken die meer beweren dan de gegevens toelaten. Drie fouten duiken daarbij bijzonder vaak op.
Alle drie de fouten hebben dezelfde oorzaak: een kwaliteitscriterium wordt ingezet voor iets waarvoor het niet gemaakt is. Wie de drie criteria netjes uit elkaar houdt, omzeilt de fouten bijna vanzelf, en het methodenhoofdstuk wordt er zelfs korter van in plaats van langer.
Fout 1: hoge betrouwbaarheid als bewijs voor validiteit verkopen
Een Cronbachs alfa van 0,89 zegt dat de items van een schaal nauw samenhangen. Over de vraag of die items het bedoelde kenmerk vastleggen, zegt de waarde niets. Wie na het alfa schrijft dat de schaal daarmee valide is, trekt precies de conclusie die de testtheorie uitsluit. De uitweg is een extra alinea over inhoudsvaliditeit, waarin je onderbouwt waarom de items het kenmerkgebied afdekken.
Fout 2: objectiviteit als afgehandeld beschouwen omdat de enquête online loopt
Een online enquête dekt de afnameobjectiviteit grotendeels af, omdat alle respondenten hetzelfde zien. Scorings- en interpretatieobjectiviteit blijven daardoor onaangeroerd. Zodra er open vragen in de vragenlijst staan of drempelwaarden vrij worden gekozen, ontstaat opnieuw speelruimte. De uitweg is alle drie de vormen apart benoemen, in plaats van objectiviteit in één zin af te vinken.
Fout 3: zwakke waarden verzwijgen
Een betrouwbaarheidscoëfficiënt van 0,58 is geen reden om een schaal uit je scriptie te schrappen of de waarde niet te rapporteren. Beoordeeld wordt de omgang ermee, niet de uitkomst. Wie de waarde noemt, uitlegt waar hij vermoedelijk vandaan komt en de interpretatie navenant voorzichtiger formuleert, laat precies de methodische rijpheid zien waar het om gaat. Verzwegen waarden vallen daarentegen uiterlijk bij de verdediging op.
Conclusie
Objectiviteit, betrouwbaarheid en validiteit zijn geen horden die je moet nemen, maar drie vragen die je beantwoordt. Volledige vervulling is ook in professioneel onderzoek de uitzondering, en niemand verwacht haar in een scriptie. Verwacht wordt dat je de drie criteria uit elkaar kunt houden en openlegt waar jouw onderzoek tegen zijn grenzen aanloopt.
Hoe je verder komt
- Wil je de vragenlijst zelf opbouwen? Vragenlijst maken: stappen, opbouw en voorbeeld
- Zoek je de definitie van één begrip? Wat betekent validiteit? en Wat betekent betrouwbaarheid?
- Zoek je de passende analysemethode? Analysemethoden kiezen: welke past bij jouw gegevens?
- Wil je het hele verloop overzien? Grondslagen van empirisch onderzoek
Onze leestip: de COTAN, de Commissie Testaangelegenheden Nederland van het Nederlands Instituut van Psychologen, publiceert haar beoordelingssysteem online. Daar staan de zeven criteria, de beoordelingsprocedure en de termijnen voor verouderde normen bij elkaar, en dat is de snelste manier om te zien hoe een bestaande schaal er in Nederland voor staat.
Moet je enquête vanaf het begin gestandaardiseerd verlopen?
Met empirio.ai, een online enquêtetool uit Duitsland, zien alle deelnemers dezelfde vragenlijst in dezelfde volgorde, waarmee de afnameobjectiviteit grotendeels is afgedekt. Scorings- en interpretatieobjectiviteit blijven jouw werk, want beide hangen aan jouw regels en niet aan het gereedschap.
