Stell dir vor, zwei Personen werten denselben Fragebogen aus und kommen zu zwei verschiedenen Ergebnissen. Der Fragebogen ist deshalb nicht schlecht gestellt. Er ist schlicht nicht objektiv.
Objektivität, Reliabilität und Validität sind die drei Hauptgütekriterien der quantitativen Forschung, und sie prüfen drei verschiedene Dinge. Objektivität bedeutet, dass das Ergebnis nicht davon abhängt, wer die Erhebung durchführt, auswertet und interpretiert. Reliabilität bedeutet, dass ein Instrument genau misst, also mit möglichst kleinem Messfehler. Validität bedeutet, dass ein Fragebogen wirklich das Merkmal erfasst, um das es geht, und nicht versehentlich ein anderes. Nach diesem Beitrag kannst du für deine eigene Erhebung begründen, welches der drei Kriterien du wie gut erfüllst und welches du bewusst offenlässt.
📌 Das Wichtigste im Überblick
- Objektivität heißt: Das Ergebnis hängt nicht an der auswertenden Person.
- Reliabilität heißt: Der Fragebogen misst mit kleinem Messfehler.
- Validität heißt: Gemessen wird wirklich das gemeinte Merkmal.
- Reliabilität ist Voraussetzung für Validität, nicht umgekehrt.
- Moosbrugger und Kelava führen zehn Gütekriterien, nicht drei.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Objektivität, Reliabilität, Validität: die drei Gütekriterien im Überblick
Objektivität, Reliabilität und Validität sind die drei Hauptgütekriterien, mit denen die Qualität eines Messinstruments beurteilt wird. Sie beantworten nacheinander drei Fragen: Ist die Messung unabhängig von der durchführenden Person, ist sie genau, und misst sie das Richtige?
Die Reihenfolge der drei Kriterien ist keine Gewohnheit, sondern bildet ab, worauf das jeweils folgende Kriterium angewiesen ist. Eine unzuverlässige Messung kann nicht gültig sein, und eine Erhebung, bei der jede auswertende Person zu einem anderen Wert kommt, wird kaum zuverlässig ausfallen. Wie streng dieser Zusammenhang tatsächlich ist, klärt das Kapitel Wie Objektivität, Reliabilität und Validität zusammenhängen.
| Gütekriterium | Die Frage dahinter | Woran du es festmachst |
|---|---|---|
| Objektivität | Hängt das Ergebnis an der Person? | feste Regeln für Durchführung, Auswertung, Interpretation |
| Reliabilität | Wie groß ist der Messfehler? | Reliabilitätskoeffizient zwischen 0 und 1 |
| Validität | Wird das gemeinte Merkmal gemessen? | inhaltliche, konstruktbezogene und kriterienbezogene Belege |
Was in vielen Ratgebern fehlt: Diese drei sind nicht die ganze Liste. Helfried Moosbrugger und Augustin Kelava führen in ihrem Standardwerk „Testtheorie und Fragebogenkonstruktion“ zehn Gütekriterien auf. Neben der Trias stehen dort Skalierung, Normierung, Testökonomie, Nützlichkeit, Zumutbarkeit, Unverfälschbarkeit und Fairness, nachzulesen in Kapitel 2 des Lehrbuchs (Springer, 2012). Dieselben Kriterien bilden laut den Autoren die Basis der DIN 33430 zur berufsbezogenen Eignungsbeurteilung.
Für eine studentische Abschlussarbeit reicht die Beschränkung auf die drei Hauptgütekriterien in aller Regel aus. Nur solltest du wissen, dass du damit eine Auswahl triffst. Wer die sieben weiteren Gütekriterien empirischer Forschungsmethoden wenigstens benennen kann, wirkt in der Verteidigung deutlich sicherer.

Objektivität: Hängt das Ergebnis an der Person, die den Fragebogen einsetzt?
Objektivität liegt vor, wenn ein Test dasjenige Merkmal, das er misst, unabhängig von Testleitung und Auswertung misst und wenn klare, anwenderunabhängige Regeln für die Interpretation vorliegen. Praktisch heißt das: Die durchführende Person bekommt keinen Spielraum.
Bei einer Online-Befragung ist dieses Kriterium leichter zu erfüllen als bei jedem mündlichen Verfahren, weil zwischen Forschung und Befragten schlicht kein Gespräch stattfindet. Genau deshalb ist die standardisierte Online-Befragung für studentische Arbeiten so beliebt. Die Objektivität zerfällt dabei in drei Aspekte, die auf Gustav Lienert und Ulrich Raatz zurückgehen und die Moosbrugger und Kelava in dieser Form übernehmen. In einer Abschlussarbeit werden alle drei einzeln begründet.
Durchführungsobjektivität: gleiche Bedingungen für alle Befragten
Durchführungsobjektivität liegt vor, wenn das Ergebnis nicht davon abhängt, wer die Erhebung leitet. Der Hebel dafür heißt Standardisierung: Instruktion, Reihenfolge, Zeitvorgaben und Antwortformate sind vorab festgelegt und ändern sich zwischen zwei Teilnehmenden nicht. Moosbrugger und Kelava nennen als Ideal, dass die befragte Person die einzige Variationsquelle in der Situation ist. Eine Umfrage, die per Link verteilt wird und für alle identisch aussieht, erfüllt das fast automatisch.
Auswertungsobjektivität: gleiche Antworten, gleiche Auswertung
Auswertungsobjektivität liegt vor, wenn bei identischen Antworten verschiedene Personen zum selben Ergebnis kommen. Bei geschlossenen Fragen mit vorgegebenen Antwortoptionen ist das unproblematisch, weil es nichts zu deuten gibt. Sobald du mit offenen Fragen arbeitest, sinkt die Auswertungsobjektivität, denn Freitexte müssen kategorisiert werden. Das ist kein Ausschlussgrund, verlangt aber einen dokumentierten Kategorienplan.
Interpretationsobjektivität: gleiche Werte, gleiche Schlussfolgerung
Interpretationsobjektivität liegt vor, wenn verschiedene Fachleute aus demselben Zahlenwert dieselbe Schlussfolgerung ziehen. In der Praxis ist das der schwächste der drei Aspekte, weil dafür Normwerte oder klare Schwellen vorliegen müssten. Bei einer eigenen Erhebung ohne Eichstichprobe gibt es die nicht. Was du stattdessen tust: die Interpretationsregeln vorab festlegen und im Methodenteil nennen, statt sie nachträglich am Ergebnis auszurichten.
💡 Tipp
Formuliere die Auswertungsregeln für offene Fragen, bevor du die erste Antwort liest. Wer den Kategorienplan erst am Datensatz entwickelt, kann nicht mehr ausschließen, dass die Kategorien zum gewünschten Ergebnis passen. In der Verteidigung ist das die unangenehmste aller Nachfragen.
Reliabilität: Kommt bei einer Wiederholung dasselbe heraus?
Reliabilität bezeichnet die Messgenauigkeit eines Tests. Ein Test ist reliabel, wenn er das Merkmal, das er misst, ohne Messfehler misst. Das Maß dafür ist der Reliabilitätskoeffizient, er liegt zwischen 0 und 1.
Ein Koeffizient von 1 bedeutet, dass die Messung frei von Messfehlern ist, ein Koeffizient von 0, dass der Wert ausschließlich durch Messfehler zustande kam. Moosbrugger und Kelava schreiben, der Reliabilitätskoeffizient eines guten Tests sollte 0,7 nicht unterschreiten. Diese Zahl geistert oft ohne Quelle durchs Netz. Sie steht dort als Soll-Angabe und nicht als Grenzwert, ab dem eine Skala unbrauchbar wäre.
Zur Bestimmung der Reliabilität sind in der Klassischen Testtheorie vier Verfahren gebräuchlich. Welches davon für deine Arbeit überhaupt in Frage kommt, entscheidet weniger die Statistik als die Frage, ob du deine Befragten ein zweites Mal erreichst.
| Verfahren | Wie es funktioniert | Machbar in einer Abschlussarbeit? |
|---|---|---|
| Retest-Reliabilität | derselbe Test zu zwei Zeitpunkten, Werte korrelieren | selten, Befragte sind meist nicht erneut erreichbar |
| Paralleltest-Reliabilität | zwei inhaltlich gleichwertige Testformen | kaum, der Itempool ist dafür zu klein |
| Testhalbierung (Split-Half) | Test in zwei Hälften teilen, Hälften korrelieren | ja, mit Spearman-Brown-Korrektur |
| Innere Konsistenz | jedes Item als eigener Testteil, meist Cronbachs Alpha | ja, das ist der Normalfall |
Die Paralleltest-Reliabilität gilt in der Testtheorie als Königsweg, weil sie Übungs- und Erinnerungseffekte ausschaltet. Für eine Bachelor- oder Masterarbeit ist sie trotzdem fast nie machbar, denn sie verlangt zwei Fragebogenversionen, die zu denselben wahren Werten führen. In der Praxis landen fast alle bei der inneren Konsistenz.
Cronbachs Alpha: was der Wert leistet und was nicht
Cronbachs Alpha misst, wie stark die Items einer Skala untereinander zusammenhängen, und ist damit ein Maß der inneren Konsistenz. Der Wert ist verbreitet, weil jede Statistiksoftware ihn ausgibt, und er wird häufig überinterpretiert. Ein hoher Alpha-Wert belegt nicht, dass eine Skala nur ein einziges Merkmal misst, und er steigt schon dadurch, dass eine Skala mehr Items bekommt. Auch die Annahme dahinter ist streng: Alle Items sollen gleich stark auf dasselbe Merkmal laden. Trifft das nicht zu, unterschätzt Alpha die tatsächliche Reliabilität. Klaas Sijtsma hat diese Einschränkungen 2009 in der Fachzeitschrift Psychometrika ausführlich dargelegt, und als Alternative wird seitdem häufig McDonalds Omega genannt.
Für eine Abschlussarbeit heißt das nicht, dass du Omega rechnen musst. Es heißt, dass du Alpha mit einem Halbsatz einordnest, statt es als Beweis zu präsentieren. Solche Einordnungen unterscheiden eine gute von einer durchschnittlichen Methodendiskussion.

Validität: Misst der Fragebogen wirklich das gemeinte Merkmal?
Validität liegt vor, wenn ein Test das Merkmal, das er messen soll, auch wirklich misst und nicht irgendein anderes. Moosbrugger und Kelava nennen die Validität für die Testpraxis das wichtigste Gütekriterium überhaupt, weil sie über die Aussagekraft aller Ergebnisse entscheidet.
Anders als bei der Reliabilität gibt es keine einzelne Zahl, die Validität belegt. Stattdessen trägt sie sich aus mehreren Belegarten zusammen, und je nach Anwendungsfall sind unterschiedliche davon überhaupt prüfbar. Das Lehrbuch unterscheidet vier Aspekte, die im Methodenteil auch so heißen sollten.
- Inhaltsvalidität: Erfassen die Items das Merkmal repräsentativ? Diese Frage wird nicht gerechnet, sondern durch fachliche Überlegung und Expertenurteil beantwortet.
- Augenscheinvalidität: Erscheint der Anspruch eines Tests einem Laien vom bloßen Augenschein her gerechtfertigt? Das betrifft die Akzeptanz, nicht die Aussagekraft.
- Konstruktvalidität: Ist der Schluss vom Antwortverhalten auf das dahinterliegende Merkmal theoretisch fundiert? Belegt wird das über Zusammenhänge mit ähnlichen und mit bewusst unähnlichen Verfahren.
- Kriteriumsvalidität: Lässt sich vom Testwert auf ein Verhalten außerhalb der Testsituation schließen? Liegt das Kriterium gleichzeitig vor, spricht man von Übereinstimmungsvalidität, liegt es in der Zukunft, von Vorhersagevalidität.
Der häufigste Fehler: Inhaltsvalidität und Augenscheinvalidität sind nicht dasselbe
Häufig liest man, Inhaltsvalidität und Augenscheinvalidität seien zwei Namen für dieselbe Sache. Das stimmt nicht, und die Verwechslung ist so verbreitet, dass Moosbrugger und Kelava sie im Lehrbuch ausdrücklich als Verwechslungsgefahr benennen. Der Unterschied liegt darin, wer urteilt und woraufhin. Inhaltsvalidität ist ein Fachurteil darüber, ob die Items den Merkmalsbereich abdecken. Augenscheinvalidität ist der Eindruck eines Laien, dass ein Test plausibel aussieht. Ein Fragebogen kann sehr plausibel wirken und trotzdem am Merkmal vorbeimessen, und umgekehrt kann ein inhaltlich sauberer Test für Außenstehende völlig unverständlich aussehen.
⚠️ Achtung
Schreibe in deiner Arbeit nicht „Inhaltsvalidität beziehungsweise Augenscheinvalidität“. Wer beide Begriffe gleichsetzt, gibt einer Prüfung aus der Methodenlehre eine offene Flanke. Nenne die Inhaltsvalidität als das, was du fachlich begründest, und die Augenscheinvalidität höchstens als Argument für die Akzeptanz bei den Befragten.
Eine zweite Unschärfe betrifft die interne und die externe Validität. Diese beiden Begriffe stammen aus der Bewertung von Untersuchungsdesigns und beantworten die Fragen, ob ein Ursachenschluss innerhalb einer Studie trägt und ob die Ergebnisse über die Studie hinaus gelten. Sie sind keine Unterarten der Inhalts- oder Konstruktvalidität, auch wenn sie in vielen Zusammenfassungen so einsortiert werden. Wer beide Systematiken vermischt, verliert genau die Präzision, die im Methodenteil bewertet wird.

Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Wie Objektivität, Reliabilität und Validität zusammenhängen
Reliabilität ist die Voraussetzung für Validität, und zwar nur in eine Richtung. Moosbrugger und Kelava schreiben, dass Objektivität und Reliabilität nur die günstigen Voraussetzungen für eine hohe Validität liefern und dass ein Test mit niedriger Reliabilität keine hohe Validität haben kann.
Der Satz wirkt unscheinbar und trägt trotzdem die ganze Systematik. Er bedeutet nämlich: Eine zuverlässige Messung kann trotzdem am Thema vorbeigehen, eine unzuverlässige Messung kann dagegen niemals gültig sein. Die Objektivität geht dem in der Praxis voraus, weil eine Erhebung mit großem Auswertungsspielraum kaum stabile Werte liefert. Als formale Bedingung ist das im Lehrbuch allerdings nicht formuliert, anders als die Beziehung zwischen Reliabilität und Validität.
Ein bekanntes Bild dafür ist die Personenwaage, die konstant zwei Kilogramm zu viel anzeigt. Sie ist objektiv, weil sie bei jeder Person nach denselben Regeln funktioniert. Sie ist reliabel, weil sie bei drei Messungen hintereinander dasselbe anzeigt. Valide ist sie trotzdem nicht, denn sie misst systematisch falsch. Hohe Reliabilität bei niedriger Validität ist in Fragebögen der häufigste Fall, und in den Kennzahlen fällt er nicht auf.
Was daraus für die Reihenfolge im Methodenteil folgt
- Kläre zuerst, ob die Erhebung für alle Befragten gleich abläuft.
- Prüfe danach, ob deine Skalen intern konsistent sind.
- Begründe erst zuletzt, dass die Items das gemeinte Merkmal abdecken.
- Berichte einen niedrigen Wert, statt ihn wegzulassen.
Ein reliabler Fragebogen misst zuverlässig. Ob er das Richtige misst, ist damit noch nicht beantwortet.
Gelten die drei Gütekriterien auch in der qualitativen Forschung?
Objektivität, Reliabilität und Validität sind für standardisierte Messungen entwickelt worden und lassen sich auf qualitative Verfahren nicht unverändert übertragen. Ein Leitfadeninterview soll gerade nicht bei jeder Wiederholung dasselbe ergeben, weil es auf die einzelne Person eingeht.
In der qualitativen Sozialforschung sind deshalb eigene Kriterienkataloge entstanden. Am bekanntesten ist der Vorschlag von Yvonna Lincoln und Egon Guba aus „Naturalistic Inquiry“ (Sage, 1985) mit den vier Kriterien Glaubwürdigkeit, Übertragbarkeit, Verlässlichkeit und Bestätigbarkeit. Im deutschsprachigen Raum wird außerdem häufig auf die Kernkriterien von Ines Steinke verwiesen, die die intersubjektive Nachvollziehbarkeit des Vorgehens in den Mittelpunkt stellen.
Für deine Arbeit ist die praktische Folge überschaubar. Wenn du qualitativ erhebst, schreibe nicht über Cronbachs Alpha, sondern dokumentiere Auswahl, Ablauf und Auswertung so genau, dass jemand anderes den Weg nachvollziehen kann. Welche Kriterien in beiden Forschungslogiken nebeneinanderstehen, steht im Beitrag zu den Gütekriterien quantitativer und qualitativer Forschung.
Gütekriterien in der Abschlussarbeit: wohin sie in der Gliederung gehören
Gütekriterien haben in einer Abschlussarbeit keinen festen Platz in der Gliederung. Zwei Varianten sind üblich, und beide sind vertretbar: ein eigener Unterpunkt im Kapitel zum Forschungsdesign oder ein Abschnitt in der Reflexion des eigenen Vorgehens.
Welche der beiden passt, hängt davon ab, wie stark die Methodenwahl für deine Forschungsfrage begründungsbedürftig ist. Steht die Methode im Zentrum, gehören die Kriterien nach vorn ins Design. Geht es stärker um inhaltliche Erkenntnisse, wirken sie hinten in der Reflexion natürlicher. Kläre das im Zweifel mit deiner Betreuung, denn manche Institute haben dazu eine feste Erwartung.
Variante 1: Gütekriterien als eigener Unterpunkt im Forschungsdesign
Ein eigener Unterpunkt im Designkapitel eignet sich, wenn du deine Methodenwahl ausführlich begründest und die Gütekriterien Teil dieser Begründung sind. Der Vorteil liegt darin, dass die Lesenden die Qualitätsfrage bereits geklärt haben, bevor sie die erste Zahl sehen. Der Preis ist, dass du an dieser Stelle noch nicht weißt, welche Skalen sich später als schwach herausstellen. Rechne also damit, dass du später nachziehen musst.
- Einleitung mit Forschungsfrage
- Theorie und Stand der Forschung
- Forschungsdesign, darin: Hypothesen, Methodenwahl, Grundgesamtheit und Stichprobe, Variablen, Fragenkatalog, Gütekriterien mit je einem Unterpunkt für Objektivität, Reliabilität und Validität
- Datenerhebung
- Datenauswertung
- Ergebnisse
- Reflexion des Vorgehens
- Fazit
Variante 2: Gütekriterien als Abschnitt in der Reflexion
Ein Abschnitt in der Reflexion eignet sich, wenn du die Grenzen deiner Erhebung erst im Licht der Ergebnisse sauber benennen kannst. Der Aufbau bleibt derselbe, nur wandern die Gütekriterien in Punkt 7 und werden dort zusammen mit den Einschränkungen der Arbeit diskutiert. Der Vorteil liegt in der Ehrlichkeit, weil du über tatsächliche Werte schreibst statt über Absichten. Der Preis ist, dass die Methodenkritik weit hinten steht und leicht überlesen wird.
In beiden Varianten gilt derselbe Maßstab: Bewertet wird nicht, ob eine Erhebung alle drei Kriterien erfüllt, sondern ob nachvollziehbar wird, welche erfüllt sind und wo die Grenzen liegen.

Typische Fehler bei den Gütekriterien
Die meisten Abzüge im Methodenteil entstehen nicht durch schwache Kennzahlen, sondern durch Aussagen, die mehr behaupten, als die Daten hergeben. Drei Fehler tauchen dabei besonders oft auf.
Alle drei Fehler haben dieselbe Ursache: Ein Gütekriterium wird für etwas in Anspruch genommen, wofür es nicht gemacht ist. Wer die drei Kriterien sauber auseinanderhält, umgeht sie fast von allein, und der Methodenteil wird dabei sogar kürzer statt länger.
Fehler 1: hohe Reliabilität als Beweis für Validität verkaufen
Ein Cronbachs Alpha von 0,89 sagt aus, dass die Items einer Skala eng zusammenhängen. Es sagt nichts darüber, ob diese Items das gemeinte Merkmal erfassen. Wer nach dem Alpha-Wert schreibt, die Skala sei damit valide, zieht den Schluss, den die Testtheorie ausschließt. Der Ausweg ist ein zusätzlicher Absatz zur Inhaltsvalidität, in dem du begründest, warum die Items den Merkmalsbereich abdecken.
Fehler 2: Objektivität als erledigt betrachten, weil die Umfrage online läuft
Eine Online-Umfrage sichert die Durchführungsobjektivität weitgehend ab, weil alle Befragten dasselbe sehen. Auswertungs- und Interpretationsobjektivität bleiben davon unberührt. Sobald offene Fragen im Fragebogen stehen oder Schwellenwerte frei gewählt werden, entsteht wieder Spielraum. Der Ausweg ist, alle drei Aspekte getrennt zu benennen, statt Objektivität pauschal abzuhaken.
Fehler 3: schwache Werte verschweigen
Ein Reliabilitätskoeffizient von 0,58 ist kein Grund, eine Skala aus der Arbeit zu streichen oder den Wert nicht zu berichten. Bewertet wird die Auseinandersetzung, nicht das Ergebnis. Wer den Wert nennt, erklärt, woran er vermutlich liegt, und die Interpretation entsprechend vorsichtiger formuliert, zeigt die methodische Reife, um die es geht. Verschwiegene Werte fallen dagegen spätestens in der Verteidigung auf.
Fazit
Objektivität, Reliabilität und Validität sind keine Hürden, die du nehmen musst, sondern drei Fragen, die du beantwortest. Absolute Erfüllung ist auch in professionellen Studien die Ausnahme, und niemand erwartet sie in einer Abschlussarbeit. Erwartet wird, dass du die drei Kriterien auseinanderhalten kannst und offenlegst, wo deine Erhebung an ihre Grenzen stößt.
Wie es weitergeht
- Du willst den Fragebogen selbst aufbauen? Fragebogen erstellen: Anleitung und Aufbau
- Du brauchst die Definition eines einzelnen Begriffs? Was bedeutet Validität? und Was bedeutet Reliabilität?
- Du suchst das passende Auswertungsverfahren? Auswertungsmethoden in der empirischen Forschung
- Du willst den ganzen Ablauf im Blick haben? Empirische Forschung: Definition, Methoden, Leitfaden
Unser Literaturtipp: Moosbrugger, Helfried und Kelava, Augustin (Hrsg.) (2012): Testtheorie und Fragebogenkonstruktion. 2. Auflage. Springer: Berlin und Heidelberg. Kapitel 2 behandelt alle zehn Gütekriterien und ist als Leseprobe frei verfügbar. Wer es methodisch genauer braucht, findet bei GESIS die Survey Guideline zur Reliabilität von Daniel Danner (2015).
Deine Befragung soll von Anfang an standardisiert laufen?
Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, sehen alle Teilnehmenden denselben Fragebogen in derselben Reihenfolge. Damit ist die Durchführungsobjektivität weitgehend abgesichert. Auswertungs- und Interpretationsobjektivität bleiben deine Aufgabe, denn beide hängen an deinen Regeln, nicht am Werkzeug.
