empirio.ai

Objektivität, Reliabilität, Validität: Definition, Beispiel

Eine Erhebung kann zuverlässig messen und dabei am Ziel vorbei. Was Objektivität, Reliabilität und Validität unterscheidet und wie du sie in deiner Arbeit belegst, steht hier.

Autorin bei empirio.ai - Maria Malzewvon Maria MalzewAktualisiert am 25. August 2026Lesezeit 15 Min.

Ein Fragebogen wird in Zürich auf Hochdeutsch ausgefüllt, gesprochen wird im Alltag aber Schweizerdeutsch. Einzelne Formulierungen können deshalb anders ankommen, als die Skala es vorsieht, ohne dass an den Fragen selbst etwas geändert wurde.

Die drei Gütekriterien der quantitativen Forschung setzen genau an solchen Unterschieden an, und jedes davon prüft etwas anderes. Objektivität bedeutet, dass verschiedene Personen bei derselben Erhebung zum gleichen Resultat kommen. Reliabilität bedeutet, dass ein Instrument genau misst, also mit einem möglichst kleinen Messfehler. Validität bedeutet, dass ein Fragebogen genau jenes Merkmal erfasst, das er erfassen soll, und kein benachbartes. Nach diesem Beitrag kannst du für deine eigene Erhebung begründen, welches Kriterium du wie weit erfüllst und wo du eine Grenze offenlegst.


📌 Das Wichtigste im Überblick

  • Objektivität prüft den Einfluss der auswertenden Person.
  • Reliabilität prüft, wie genau ein Instrument misst, also den Messfehler.
  • Validität prüft, ob das gemeinte Merkmal erfasst wird.
  • Ein eigenes Schweizer Testbeurteilungssystem liess sich nicht nachweisen.
  • Valérie-Anne Ryser hält kognitive Pretests bei Skalenadaptionen für unverzichtbar.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Objektivität, Reliabilität, Validität: die drei Gütekriterien im Überblick

Objektivität, Reliabilität und Validität bilden die drei Hauptgütekriterien, an denen die Qualität eines Messinstruments gemessen wird. Sie stellen nacheinander drei Fragen: Läuft die Messung unabhängig von der durchführenden Person, arbeitet sie genau, und trifft sie das gemeinte Merkmal?

Die Abfolge der drei Kriterien ist kein Zufall, sondern bildet ab, worauf jedes weitere Kriterium angewiesen ist. Eine Erhebung, bei der zwei auswertende Personen zu verschiedenen Werten kommen, wird nie zuverlässig, und eine unzuverlässige Messung wird nie gültig. Diesem Zusammenhang widmet der Beitrag ein eigenes Kapitel, weil er strenger ausfällt, als viele Übersichten vermuten lassen.

GütekriteriumDie Frage dahinterWoran du es festmachst
ObjektivitätSpielt es eine Rolle, wer auswertet?feste Regeln für Ablauf, Auswertung und Deutung
ReliabilitätErgibt eine zweite Messung denselben Wert?Reliabilitätskoeffizient zwischen 0 und 1
ValiditätTrifft die Messung das gemeinte Merkmal?inhaltliche, konstruktbezogene und kriterienbezogene Belege

In vielen Übersichten fehlt ein Hinweis: Mit diesen dreien ist die Liste nicht zu Ende. Helfried Moosbrugger und Augustin Kelava führen in ihrem Standardwerk „Testtheorie und Fragebogenkonstruktion“ zehn Gütekriterien. Neben der Trias stehen dort Skalierung, Normierung, Testökonomie, Nützlichkeit, Zumutbarkeit, Unverfälschbarkeit und Fairness, nachzulesen in Kapitel 2 des Lehrbuchs (Springer, 2012). Das Buch ist im gesamten deutschsprachigen Raum die übliche Referenz, auch an Schweizer Hochschulen.

Warum sich die Schweiz am europäischen Beurteilungsmodell orientiert

Ein eigenes nationales System zur Beurteilung von Testverfahren gibt es in der Schweiz nicht. Das Zentrum für Testentwicklung und Diagnostik der Universität Freiburg nennt für die Schweiz kein nationales Gremium, sondern lediglich Vertreterinnen und Vertreter der Föderation der Schweizer Psychologinnen und Psychologen (FSP), die auf Mandatsbasis in internationalen Gremien mitarbeiten. Massgeblich sind deshalb das Review-Modell der European Federation of Psychologists' Associations (EFPA) und die Richtlinien der International Test Commission (ITC).

Die DIN 33430 zur berufsbezogenen Eignungsbeurteilung, auf die Moosbrugger und Kelava verweisen, ist eine deutsche Norm. Eine schweizerische Entsprechung mit demselben Anspruch liess sich nicht nachweisen, weshalb in der Praxis häufig deutsche Testrezensionen herangezogen werden. Für eine Bachelor- oder Masterarbeit genügt die Beschränkung auf die drei Hauptgütekriterien dennoch, solange du weisst, dass du damit eine Auswahl triffst. Wer die sieben weiteren Gütekriterien empirischer Forschungsmethoden wenigstens benennen kann, wirkt bei der Verteidigung deutlich souveräner.

Schematische Gegenüberstellung der drei Gütekriterien Objektivität, Reliabilität und Validität

Objektivität: Wie stark beeinflusst die durchführende Person das Resultat?

Objektivität liegt vor, wenn ein Test das gemessene Merkmal unabhängig von Testleitung und Auswertung erfasst und wenn für die Deutung klare, anwenderunabhängige Regeln vorliegen. Praktisch bedeutet das: Wer die Erhebung betreut, bekommt keinen Spielraum.

Bei einer Online-Befragung fällt dieses Kriterium leichter als bei jedem mündlichen Verfahren, weil zwischen Forschung und Befragten gar kein Gespräch stattfindet. Vielmehr sehen alle dieselbe Maske in derselben Reihenfolge. Die drei Aspekte der Objektivität gehen auf Gustav Lienert und Ulrich Raatz (1998) zurück, Moosbrugger und Kelava übernehmen sie in dieser Form, und in einer Masterarbeit wird jeder Aspekt einzeln begründet.

Durchführungsobjektivität: alle Befragten treffen auf dieselbe Situation

Durchführungsobjektivität ist erreicht, wenn das Resultat nicht davon abhängt, wer die Erhebung leitet. Der Hebel dazu heisst Standardisierung: Instruktion, Reihenfolge, Zeitfenster und Antwortformate stehen vorab fest und ändern sich zwischen zwei Teilnehmenden nicht. Als Ideal nennen Moosbrugger und Kelava eine Situation, in der die befragte Person die einzige Quelle von Variation bleibt. Eine per Link verteilte Umfrage erfüllt das beinahe von selbst.

Auswertungsobjektivität: dieselben Antworten führen zu denselben Werten

Auswertungsobjektivität ist erreicht, wenn zwei Personen aus identischen Antworten denselben Wert bilden. Bei geschlossenen Fragen mit vorgegebenen Optionen entsteht dabei kein Spielraum, weil nichts zu deuten bleibt. Sobald offene Fragen dazukommen, sinkt der Wert, denn Freitexte müssen erst in Kategorien überführt werden. Ausgeschlossen ist das nicht, es verlangt aber einen dokumentierten Kategorienplan.

Interpretationsobjektivität: aus demselben Wert folgt dieselbe Aussage

Interpretationsobjektivität ist erreicht, wenn verschiedene Fachpersonen aus einem Zahlenwert dieselbe Schlussfolgerung ziehen. In der Praxis bleibt dieser Aspekt der schwächste, weil dafür Normwerte oder klare Schwellen vorliegen müssten. Bei einer eigenen Erhebung ohne Eichstichprobe existieren sie nicht. Stattdessen legst du die Regeln der Deutung vorab fest und nennst sie im Methodenteil, statt sie nachträglich am Resultat auszurichten.

💡 Tipp

Lass eine zweite Person zehn zufällig gezogene Freitextantworten nach deinem Kategorienplan codieren, bevor du den ganzen Datensatz auswertest. Weichen die Zuordnungen bei mehr als zwei Antworten voneinander ab, ist der Plan zu unscharf formuliert. Diese halbe Stunde erspart dir die unangenehmste Rückfrage bei der Verteidigung.

Reliabilität: Liefert eine zweite Messung denselben Wert?

Reliabilität beschreibt die Messgenauigkeit eines Tests. Ein Test gilt als reliabel, wenn er jenes Merkmal, das er misst, ohne Messfehler abbildet. Ausgedrückt wird das im Reliabilitätskoeffizienten, einer Zahl zwischen 0 und 1.

Ein Koeffizient von 1 steht für eine Messung ohne jeden Messfehler, ein Koeffizient von 0 für einen Wert, der ausschliesslich aus Messfehlern besteht. Moosbrugger und Kelava schreiben, der Reliabilitätskoeffizient eines guten Tests sollte 0,7 nicht unterschreiten. Diese Zahl kursiert im Netz meist ohne Beleg. Sie steht in Kapitel 2 des Lehrbuchs als Soll-Angabe und nicht als Grenzwert, ab dem eine Skala unbrauchbar wäre.

Zur Bestimmung der Reliabilität kennt die Klassische Testtheorie vier Verfahren. Welches davon für deine Arbeit realistisch bleibt, entscheidet weniger die Statistik als die Frage, ob du dieselben Befragten ein zweites Mal erreichst.

VerfahrenWie es funktioniertRealistisch in einer Masterarbeit?
Retest-Reliabilitätderselbe Test zu zwei Zeitpunkten, Werte korrelierenselten, die Befragten sind kaum erneut erreichbar
Paralleltest-Reliabilitätzwei inhaltlich gleichwertige Testformenkaum, dafür ist der Itempool zu klein
Testhalbierung (Split-Half)Test in zwei Hälften teilen, Hälften korrelierenja, mit Spearman-Brown-Korrektur
Innere Konsistenzjedes Item als eigener Testteil, meist Cronbachs Alphaja, das ist der Normalfall

Als Königsweg gilt die Paralleltest-Reliabilität, weil sie Übungs- und Erinnerungseffekte ausschaltet. Für eine Bachelor- oder Masterarbeit bleibt sie dennoch fast immer unerreichbar, denn sie verlangt zwei Fragebogenfassungen, die zu denselben wahren Werten führen. In der Praxis landen deshalb fast alle bei der inneren Konsistenz.

Cronbachs Alpha: was der Wert aussagt und was nicht

Cronbachs Alpha misst, wie eng die Items einer Skala untereinander zusammenhängen, und ist damit ein Mass der inneren Konsistenz. Verbreitet ist der Wert vor allem, weil jede Statistiksoftware ihn ausgibt, und ebenso verbreitet ist seine Überdehnung. Ein hoher Alpha-Wert belegt nämlich nicht, dass eine Skala nur ein einziges Merkmal misst, und er steigt schon dann, wenn die Skala mehr Items bekommt. Streng ist zudem die Annahme dahinter: Alle Items sollen gleich stark auf dasselbe Merkmal laden. Trifft das nicht zu, unterschätzt Alpha die tatsächliche Reliabilität. Klaas Sijtsma hat diese Einschränkungen 2009 in der Fachzeitschrift Psychometrika ausführlich dargelegt, und als Alternative wird seitdem häufig McDonalds Omega genannt.

Rechnen musst du Omega für eine Abschlussarbeit deswegen nicht. Es genügt, Alpha mit einem Halbsatz einzuordnen, statt es als Beweis zu präsentieren. Genau solche Einordnungen unterscheiden eine gute von einer durchschnittlichen Methodendiskussion.

Darstellung des Gütekriteriums Reliabilität als wiederholte Messung mit gleichem Wert

Validität: Erfasst der Fragebogen wirklich das gemeinte Merkmal?

Validität liegt vor, wenn ein Test jenes Merkmal misst, das er messen soll, und nicht ein benachbartes. Für die Testpraxis nennen Moosbrugger und Kelava die Validität das wichtigste Gütekriterium überhaupt, weil sie über die Aussagekraft sämtlicher Ergebnisse entscheidet.

Anders als die Reliabilität lässt sich Validität nicht an einer einzigen Zahl ablesen. Vielmehr setzt sie sich aus mehreren Belegarten zusammen, und je nach Anwendungsfall ist nur ein Teil davon überhaupt prüfbar. Das Lehrbuch trennt vier Aspekte, die im Methodenteil auch so heissen sollten.

  • Inhaltsvalidität: Decken die Items den Merkmalsbereich repräsentativ ab? Gerechnet wird hier nichts, geurteilt wird fachlich und über Expertenurteile.
  • Augenscheinvalidität: Wirkt der Anspruch eines Tests für eine fachfremde Person auf den ersten Blick gerechtfertigt? Betroffen ist die Akzeptanz, nicht die Aussagekraft.
  • Konstruktvalidität: Trägt der Schluss vom Antwortverhalten auf das dahinterliegende Merkmal theoretisch? Belegt wird er über Zusammenhänge mit ähnlichen und mit bewusst unähnlichen Verfahren.
  • Kriteriumsvalidität: Erlaubt der Testwert einen Schluss auf ein Verhalten ausserhalb der Testsituation? Bei gleichzeitig vorliegendem Kriterium spricht man von Übereinstimmungsvalidität, bei künftigem von Vorhersagevalidität.

Inhaltsvalidität und Augenscheinvalidität werden regelmässig verwechselt

Häufig liest man, Inhaltsvalidität und Augenscheinvalidität meinten dasselbe. Zutreffend ist das nicht, und die Verwechslung ist so verbreitet, dass Moosbrugger und Kelava sie im Lehrbuch eigens als Verwechslungsgefahr ausweisen. Der Unterschied liegt darin, wer urteilt und woraufhin. Inhaltsvalidität ist ein Fachurteil darüber, ob die Items den Merkmalsbereich abdecken. Augenscheinvalidität ist der Eindruck einer fachfremden Person, dass ein Test plausibel wirkt. Ein Fragebogen kann sehr überzeugend aussehen und trotzdem am Merkmal vorbeimessen, und ein inhaltlich sauberer Test kann für Aussenstehende völlig unverständlich wirken.

⚠️ Achtung

Schreibe in deiner Arbeit nicht „Inhaltsvalidität beziehungsweise Augenscheinvalidität“. Wer beide Begriffe gleichsetzt, öffnet einer Prüfung aus der Methodenlehre eine Flanke. Nenne die Inhaltsvalidität als das, was du fachlich begründest, und die Augenscheinvalidität höchstens als Argument für die Akzeptanz bei den Befragten.

Eine zweite Unschärfe betrifft die interne und die externe Validität. Beide Begriffe stammen aus der Bewertung von Untersuchungsdesigns und beantworten die Fragen, ob ein Ursachenschluss innerhalb einer Studie trägt und ob die Ergebnisse darüber hinaus gelten. Unterarten der Inhalts- oder Konstruktvalidität sind sie nicht, auch wenn viele Zusammenfassungen sie so einsortieren. Wer beide Systematiken vermischt, verliert genau jene Präzision, die im Methodenteil bewertet wird.

Darstellung des Gütekriteriums Validität als Treffer auf dem gemeinten Merkmal

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Wie Objektivität, Reliabilität und Validität zusammenspielen

Reliabilität ist die Voraussetzung für Validität, und der umgekehrte Schluss trägt nicht. Moosbrugger und Kelava halten fest, dass Objektivität und Reliabilität lediglich die günstigen Voraussetzungen für eine hohe Validität schaffen und dass ein Test mit niedriger Reliabilität keine hohe Validität erreichen kann.

Der zitierte Satz aus dem Lehrbuch wirkt unscheinbar und trägt doch die ganze Systematik. Übersetzt heisst er: Eine zuverlässige Messung kann am Thema vorbeigehen, eine unzuverlässige Messung kann niemals gültig sein. Die Objektivität geht dem in der Praxis voraus, weil eine Erhebung mit grossem Auswertungsspielraum kaum stabile Werte liefert. Als formale Bedingung steht das im Lehrbuch allerdings nicht, anders als die Beziehung zwischen Reliabilität und Validität.

Ein Thermometer, das konstant 1,5 Grad zu viel anzeigt, macht den Unterschied anschaulich. Objektiv arbeitet es, weil es bei jeder Person nach denselben Regeln funktioniert. Reliabel ist es ebenfalls, weil drei Messungen hintereinander denselben Wert liefern. Valide ist es trotzdem nicht, denn es misst systematisch daneben. Genau dieser Fall, hohe Reliabilität bei niedriger Validität, kommt in Fragebögen am häufigsten vor, und in den Kennzahlen fällt er nicht auf.

Schweizer Sonderfall: Skalen auf Hochdeutsch validiert, Alltagssprache Schweizerdeutsch

Skalen für psychologische Konstrukte werden im deutschsprachigen Raum fast immer auf Hochdeutsch entwickelt und geprüft, in der Deutschschweiz aber von Menschen beantwortet, deren Alltagssprache Schweizerdeutsch ist. Valérie-Anne Ryser weist im FORS Guide Nº 22 „Measuring psychological constructs“ (2023) darauf hin, dass Skalen nach Länge, Validität und Reliabilität auszuwählen sind, und hält kognitive Pretests bei einer Adaption für unverzichtbar. Herausgeber ist FORS, das Schweizer Kompetenzzentrum Sozialwissenschaften an der Universität Lausanne.

Für deine eigene Erhebung folgt daraus zweierlei. Erstens sinkt die Reliabilität, sobald einzelne Begriffe unterschiedlich verstanden werden, weil die Antworten dann stärker streuen, als das Merkmal es hergibt. Zweitens gerät die Validität ins Rutschen, sobald ein Item in der Deutschschweiz systematisch anders gelesen wird als in Deutschland. Ein kognitiver Pretest mit einer Handvoll Personen aus der Zielgruppe deckt beides auf, bevor der Link verschickt ist.

Reihenfolge im Methodenteil: erst Durchführung, dann Genauigkeit, dann Abdeckung

Die Reihenfolge im Methodenteil folgt derselben Logik wie der Aufbau der drei Kriterien. Zuerst klärst du die Bedingungen der Durchführung, danach die Genauigkeit deiner Skalen, zuletzt die inhaltliche Abdeckung. Wer diese Abfolge umdreht, begründet die Gültigkeit einer Messung, deren Zuverlässigkeit noch gar nicht geklärt ist.

  • Halte fest, ob die Erhebung für alle Befragten identisch abläuft.
  • Rechne danach die innere Konsistenz deiner Skalen.
  • Begründe zuletzt, dass die Items den Merkmalsbereich abdecken.
  • Nenne auch einen niedrigen Wert, statt ihn wegzulassen.

Zuverlässig gemessen ist nicht dasselbe wie richtig gemessen.

Gelten die drei Gütekriterien auch in der qualitativen Forschung?

Für qualitative Verfahren taugen die drei Gütekriterien nur eingeschränkt, weil sie für standardisierte Messungen entwickelt wurden. Ein Leitfadeninterview soll bei einer Wiederholung eben nicht dasselbe ergeben, sondern auf die einzelne Person eingehen.

In der qualitativen Sozialforschung sind deshalb eigene Kataloge entstanden. Am bekanntesten ist der Vorschlag von Yvonna Lincoln und Egon Guba aus „Naturalistic Inquiry“ (Sage, 1985) mit Glaubwürdigkeit, Übertragbarkeit, Verlässlichkeit und Bestätigbarkeit. Im deutschsprachigen Raum wird daneben häufig auf die Kernkriterien von Ines Steinke verwiesen, die die intersubjektive Nachvollziehbarkeit des Vorgehens in den Mittelpunkt rücken.

Praktisch bleibt die Folge überschaubar. Wer qualitativ erhebt, schreibt nicht über Cronbachs Alpha, sondern dokumentiert Auswahl, Ablauf und Auswertung so genau, dass eine dritte Person den Weg nachvollziehen kann. Welche Kriterien in beiden Forschungslogiken nebeneinanderstehen, zeigt der Beitrag zu den Gütekriterien quantitativer und qualitativer Forschung.

Gütekriterien in der Abschlussarbeit: wo sie in der Gliederung stehen

Die Gütekriterien haben in einer Abschlussarbeit keinen festen Platz in der Gliederung. Üblich sind zwei Varianten, und beide lassen sich vertreten: ein eigener Unterpunkt im Kapitel zum Forschungsdesign oder ein Abschnitt in der Reflexion des eigenen Vorgehens.

Welche Variante passt, hängt davon ab, wie begründungsbedürftig die Methodenwahl für deine Forschungsfrage ist. Steht die Methode im Zentrum, gehören die Kriterien nach vorne ins Design. Geht es stärker um inhaltliche Erkenntnisse, wirken sie hinten in der Reflexion natürlicher. Im Zweifel klärst du das mit deiner Betreuung, denn die Institute handhaben das unterschiedlich.

Variante 1: Gütekriterien als eigener Unterpunkt im Forschungsdesign

Der eigene Unterpunkt im Forschungsdesign eignet sich, wenn du die Methodenwahl ausführlich begründest und die Gütekriterien Teil dieser Begründung sind. Der Vorteil liegt darin, dass die Qualitätsfrage bereits geklärt ist, bevor die Lesenden auf die Ergebnisse treffen. Der Preis ist, dass an dieser Stelle noch nicht feststeht, welche Skalen sich später als schwach erweisen, und du deshalb mit einem Nachtrag in der Reflexion rechnen musst.

  1. Einleitung mit Forschungsfrage
  2. Theorie und Stand der Forschung
  3. Forschungsdesign, darin: Hypothesen, Methodenwahl, Grundgesamtheit und Stichprobe, Variablen, Fragenkatalog, Gütekriterien mit je einem Unterpunkt für Objektivität, Reliabilität und Validität
  4. Datenerhebung
  5. Datenauswertung
  6. Ergebnisse
  7. Reflexion des Vorgehens
  8. Fazit

Variante 2: Gütekriterien als Abschnitt in der Reflexion des Vorgehens

Die Reflexion des Vorgehens eignet sich, wenn du die Grenzen deiner Erhebung erst im Licht der Ergebnisse sauber benennen kannst. Der Aufbau bleibt derselbe, nur wandern die Gütekriterien in Punkt 7 und werden dort gemeinsam mit den Einschränkungen der Arbeit diskutiert. Der Vorteil liegt in der Ehrlichkeit, weil du über tatsächlich erreichte Werte schreibst statt über Absichten. Der Preis ist, dass die Methodenkritik weit hinten steht und leicht überlesen wird.

In beiden Varianten gilt derselbe Massstab: Bewertet wird nicht, ob eine Erhebung alle drei Kriterien erfüllt, sondern ob nachvollziehbar wird, welche erfüllt sind und wo die Grenzen liegen.

Übersicht, an welchen Stellen einer Abschlussarbeit die Gütekriterien Objektivität, Reliabilität und Validität stehen

Typische Fehler bei den Gütekriterien

Die meisten Abzüge im Methodenteil entstehen nicht durch schwache Kennzahlen, sondern durch Aussagen, die mehr behaupten, als die Daten hergeben. Drei Muster tauchen dabei besonders oft auf.

Alle drei Muster gehen auf dieselbe Ursache zurück: Ein Gütekriterium wird für etwas in Anspruch genommen, wofür es nicht gemacht ist. Wer die drei Kriterien sauber auseinanderhält, umgeht die Fehler beinahe von allein, und der Methodenteil wird dabei eher kürzer als länger.

Fehler 1: aus hoher Reliabilität auf Validität schliessen

Ein Cronbachs Alpha von 0,91 belegt, dass die Items einer Skala eng zusammenhängen. Über die Frage, ob diese Items das gemeinte Merkmal erfassen, sagt der Wert nichts. Wer nach dem Alpha-Wert notiert, die Skala sei damit valide, zieht genau jenen Schluss, den die Testtheorie ausschliesst. Der Ausweg ist ein zusätzlicher Absatz zur Inhaltsvalidität, in dem du begründest, warum die Items den Merkmalsbereich abdecken.

Fehler 2: Objektivität abhaken, weil die Umfrage online läuft

Eine Online-Umfrage sichert vor allem die Durchführungsobjektivität, weil alle Befragten dieselbe Maske sehen. Auswertungs- und Interpretationsobjektivität bleiben davon unberührt. Sobald offene Fragen im Fragebogen stehen oder Schwellenwerte frei gewählt werden, entsteht erneut Spielraum. Der Ausweg ist, alle drei Aspekte getrennt zu benennen, statt Objektivität pauschal als erledigt zu betrachten.

Fehler 3: schwache Werte aus der Arbeit heraushalten

Ein Reliabilitätskoeffizient von 0,61 ist kein Grund, eine Skala zu streichen oder den Wert zu verschweigen. Bewertet wird die Auseinandersetzung, nicht die Höhe der Zahl. Wer den Wert nennt, erklärt, woran er vermutlich liegt, und die Deutung entsprechend vorsichtiger formuliert, zeigt genau die methodische Reife, um die es geht. Verschwiegene Werte fallen spätestens bei der Verteidigung auf.

Fazit

Objektivität, Reliabilität und Validität sind keine Hürden, die genommen werden müssen, sondern drei Fragen, die du beantwortest. Vollständige Erfüllung bleibt auch in professionellen Studien die Ausnahme, und in einer Abschlussarbeit erwartet sie niemand. Erwartet wird, dass du die drei Kriterien auseinanderhältst und offenlegst, wo deine Erhebung an ihre Grenzen stösst.

Wie es weitergeht

Unser Literaturtipp: Moosbrugger, Helfried und Kelava, Augustin (Hrsg.) (2012): Testtheorie und Fragebogenkonstruktion. 2. Auflage. Springer: Berlin und Heidelberg. Kapitel 2 behandelt alle zehn Gütekriterien und steht als Leseprobe frei zur Verfügung. Für Schweizer Erhebungen lohnt sich zusätzlich der FORS Guide Nº 22 von Valérie-Anne Ryser (2023), der Auswahl und Adaption von Skalen behandelt.


Soll deine Befragung von Anfang an standardisiert laufen?

Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, sehen alle Teilnehmenden denselben Fragebogen in derselben Reihenfolge. Damit ist die Durchführungsobjektivität weitgehend abgesichert. Auswertungs- und Interpretationsobjektivität bleiben deine Aufgabe, denn beide hängen an deinen Regeln und nicht am Werkzeug.

Deine Umfrage online erstellen

Häufig gestellte Fragen

Reliabilität steht für die Genauigkeit einer Messung, Validität für ihre Gültigkeit. Ein Fragebogen ist reliabel, wenn eine zweite Messung denselben Wert liefert, und valide, wenn er das gemeinte Merkmal erfasst. Ein Thermometer, das konstant 1,5 Grad zu viel anzeigt, ist reliabel, aber nicht valide.

Objektivität ist die Voraussetzung für Reliabilität, Reliabilität die Voraussetzung für Validität. Moosbrugger und Kelava halten fest, dass ein Test mit niedriger Reliabilität keine hohe Validität erreichen kann. Der umgekehrte Schluss trägt nicht: Eine zuverlässige Messung kann trotzdem am gemeinten Merkmal vorbeigehen.

Moosbrugger und Kelava nennen 0,7 als Wert, den der Reliabilitätskoeffizient eines guten Tests nicht unterschreiten sollte. Gemeint ist eine Faustregel und kein Grenzwert. In einer Bachelor- oder Masterarbeit zählt weniger die Höhe der Zahl als die Frage, ob sie berichtet und eingeordnet wird.

Objektivität wird in Durchführungs-, Auswertungs- und Interpretationsobjektivität unterteilt. Durchführungsobjektivität heisst, dass alle Befragten dieselben Bedingungen vorfinden. Auswertungsobjektivität heisst, dass gleiche Antworten von verschiedenen Personen gleich ausgewertet werden. Interpretationsobjektivität heisst, dass aus demselben Zahlenwert dieselbe Schlussfolgerung gezogen wird. In einer Abschlussarbeit werden alle drei getrennt begründet.

Inhaltsvalidität und Augenscheinvalidität bezeichnen zwei verschiedene Aspekte, und Moosbrugger und Kelava weisen die Verwechslung im Lehrbuch eigens aus. Inhaltsvalidität ist ein Fachurteil darüber, ob die Items den Merkmalsbereich repräsentativ abdecken. Augenscheinvalidität ist der Eindruck einer fachfremden Person, dass ein Test plausibel wirkt, und betrifft damit die Akzeptanz.

Moosbrugger und Kelava führen in Kapitel 2 ihres Lehrbuchs zehn Gütekriterien auf: Objektivität, Reliabilität, Validität, Skalierung, Normierung, Testökonomie, Nützlichkeit, Zumutbarkeit, Unverfälschbarkeit und Fairness. Die ersten drei tragen den Namen Hauptgütekriterien. Für eine studentische Abschlussarbeit genügt die Beschränkung auf diese drei in aller Regel.

Ein eigenes nationales System zur Beurteilung von Testverfahren gibt es in der Schweiz nicht. Das Zentrum für Testentwicklung und Diagnostik der Universität Freiburg nennt für die Schweiz lediglich Vertreterinnen und Vertreter der Föderation der Schweizer Psychologinnen und Psychologen, die auf Mandatsbasis in internationalen Gremien mitarbeiten. Massgeblich sind das Review-Modell der EFPA und die Richtlinien der ITC.

Eine auf Hochdeutsch validierte Skala sollte vor einer Befragung in der Deutschschweiz geprüft werden, weil einzelne Begriffe im Alltag anders verstanden werden. Valérie-Anne Ryser empfiehlt im FORS Guide Nº 22 von 2023 kognitive Pretests bei jeder Adaption. Ohne diesen Schritt bleiben Abweichungen bei Reliabilität und Validität unentdeckt.

Das könnte dich auch interessieren

Lexikon

Was bedeutet Validität? Definition und Beispiel

Validität (= Gültigkeit oder Richtigkeit der Messung) bildet ab, inwieweit eine Forschungsarbeit in ihrer gesamten Konstruktion tatsächlich die Ergebnisse erzielt, die dem gestellten Forschungsziel entsprechen.