Ein Fragebogen wird in Zürich auf Hochdeutsch ausgefüllt, gesprochen wird im Alltag aber Schweizerdeutsch. Einzelne Formulierungen können deshalb anders ankommen, als die Skala es vorsieht, ohne dass an den Fragen selbst etwas geändert wurde.
Die drei Gütekriterien der quantitativen Forschung setzen genau an solchen Unterschieden an, und jedes davon prüft etwas anderes. Objektivität bedeutet, dass verschiedene Personen bei derselben Erhebung zum gleichen Resultat kommen. Reliabilität bedeutet, dass ein Instrument genau misst, also mit einem möglichst kleinen Messfehler. Validität bedeutet, dass ein Fragebogen genau jenes Merkmal erfasst, das er erfassen soll, und kein benachbartes. Nach diesem Beitrag kannst du für deine eigene Erhebung begründen, welches Kriterium du wie weit erfüllst und wo du eine Grenze offenlegst.
📌 Das Wichtigste im Überblick
- Objektivität prüft den Einfluss der auswertenden Person.
- Reliabilität prüft, wie genau ein Instrument misst, also den Messfehler.
- Validität prüft, ob das gemeinte Merkmal erfasst wird.
- Ein eigenes Schweizer Testbeurteilungssystem liess sich nicht nachweisen.
- Valérie-Anne Ryser hält kognitive Pretests bei Skalenadaptionen für unverzichtbar.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Objektivität, Reliabilität, Validität: die drei Gütekriterien im Überblick
Objektivität, Reliabilität und Validität bilden die drei Hauptgütekriterien, an denen die Qualität eines Messinstruments gemessen wird. Sie stellen nacheinander drei Fragen: Läuft die Messung unabhängig von der durchführenden Person, arbeitet sie genau, und trifft sie das gemeinte Merkmal?
Die Abfolge der drei Kriterien ist kein Zufall, sondern bildet ab, worauf jedes weitere Kriterium angewiesen ist. Eine Erhebung, bei der zwei auswertende Personen zu verschiedenen Werten kommen, wird nie zuverlässig, und eine unzuverlässige Messung wird nie gültig. Diesem Zusammenhang widmet der Beitrag ein eigenes Kapitel, weil er strenger ausfällt, als viele Übersichten vermuten lassen.
| Gütekriterium | Die Frage dahinter | Woran du es festmachst |
|---|---|---|
| Objektivität | Spielt es eine Rolle, wer auswertet? | feste Regeln für Ablauf, Auswertung und Deutung |
| Reliabilität | Ergibt eine zweite Messung denselben Wert? | Reliabilitätskoeffizient zwischen 0 und 1 |
| Validität | Trifft die Messung das gemeinte Merkmal? | inhaltliche, konstruktbezogene und kriterienbezogene Belege |
In vielen Übersichten fehlt ein Hinweis: Mit diesen dreien ist die Liste nicht zu Ende. Helfried Moosbrugger und Augustin Kelava führen in ihrem Standardwerk „Testtheorie und Fragebogenkonstruktion“ zehn Gütekriterien. Neben der Trias stehen dort Skalierung, Normierung, Testökonomie, Nützlichkeit, Zumutbarkeit, Unverfälschbarkeit und Fairness, nachzulesen in Kapitel 2 des Lehrbuchs (Springer, 2012). Das Buch ist im gesamten deutschsprachigen Raum die übliche Referenz, auch an Schweizer Hochschulen.
Warum sich die Schweiz am europäischen Beurteilungsmodell orientiert
Ein eigenes nationales System zur Beurteilung von Testverfahren gibt es in der Schweiz nicht. Das Zentrum für Testentwicklung und Diagnostik der Universität Freiburg nennt für die Schweiz kein nationales Gremium, sondern lediglich Vertreterinnen und Vertreter der Föderation der Schweizer Psychologinnen und Psychologen (FSP), die auf Mandatsbasis in internationalen Gremien mitarbeiten. Massgeblich sind deshalb das Review-Modell der European Federation of Psychologists' Associations (EFPA) und die Richtlinien der International Test Commission (ITC).
Die DIN 33430 zur berufsbezogenen Eignungsbeurteilung, auf die Moosbrugger und Kelava verweisen, ist eine deutsche Norm. Eine schweizerische Entsprechung mit demselben Anspruch liess sich nicht nachweisen, weshalb in der Praxis häufig deutsche Testrezensionen herangezogen werden. Für eine Bachelor- oder Masterarbeit genügt die Beschränkung auf die drei Hauptgütekriterien dennoch, solange du weisst, dass du damit eine Auswahl triffst. Wer die sieben weiteren Gütekriterien empirischer Forschungsmethoden wenigstens benennen kann, wirkt bei der Verteidigung deutlich souveräner.

Objektivität: Wie stark beeinflusst die durchführende Person das Resultat?
Objektivität liegt vor, wenn ein Test das gemessene Merkmal unabhängig von Testleitung und Auswertung erfasst und wenn für die Deutung klare, anwenderunabhängige Regeln vorliegen. Praktisch bedeutet das: Wer die Erhebung betreut, bekommt keinen Spielraum.
Bei einer Online-Befragung fällt dieses Kriterium leichter als bei jedem mündlichen Verfahren, weil zwischen Forschung und Befragten gar kein Gespräch stattfindet. Vielmehr sehen alle dieselbe Maske in derselben Reihenfolge. Die drei Aspekte der Objektivität gehen auf Gustav Lienert und Ulrich Raatz (1998) zurück, Moosbrugger und Kelava übernehmen sie in dieser Form, und in einer Masterarbeit wird jeder Aspekt einzeln begründet.
Durchführungsobjektivität: alle Befragten treffen auf dieselbe Situation
Durchführungsobjektivität ist erreicht, wenn das Resultat nicht davon abhängt, wer die Erhebung leitet. Der Hebel dazu heisst Standardisierung: Instruktion, Reihenfolge, Zeitfenster und Antwortformate stehen vorab fest und ändern sich zwischen zwei Teilnehmenden nicht. Als Ideal nennen Moosbrugger und Kelava eine Situation, in der die befragte Person die einzige Quelle von Variation bleibt. Eine per Link verteilte Umfrage erfüllt das beinahe von selbst.
Auswertungsobjektivität: dieselben Antworten führen zu denselben Werten
Auswertungsobjektivität ist erreicht, wenn zwei Personen aus identischen Antworten denselben Wert bilden. Bei geschlossenen Fragen mit vorgegebenen Optionen entsteht dabei kein Spielraum, weil nichts zu deuten bleibt. Sobald offene Fragen dazukommen, sinkt der Wert, denn Freitexte müssen erst in Kategorien überführt werden. Ausgeschlossen ist das nicht, es verlangt aber einen dokumentierten Kategorienplan.
Interpretationsobjektivität: aus demselben Wert folgt dieselbe Aussage
Interpretationsobjektivität ist erreicht, wenn verschiedene Fachpersonen aus einem Zahlenwert dieselbe Schlussfolgerung ziehen. In der Praxis bleibt dieser Aspekt der schwächste, weil dafür Normwerte oder klare Schwellen vorliegen müssten. Bei einer eigenen Erhebung ohne Eichstichprobe existieren sie nicht. Stattdessen legst du die Regeln der Deutung vorab fest und nennst sie im Methodenteil, statt sie nachträglich am Resultat auszurichten.
💡 Tipp
Lass eine zweite Person zehn zufällig gezogene Freitextantworten nach deinem Kategorienplan codieren, bevor du den ganzen Datensatz auswertest. Weichen die Zuordnungen bei mehr als zwei Antworten voneinander ab, ist der Plan zu unscharf formuliert. Diese halbe Stunde erspart dir die unangenehmste Rückfrage bei der Verteidigung.
Reliabilität: Liefert eine zweite Messung denselben Wert?
Reliabilität beschreibt die Messgenauigkeit eines Tests. Ein Test gilt als reliabel, wenn er jenes Merkmal, das er misst, ohne Messfehler abbildet. Ausgedrückt wird das im Reliabilitätskoeffizienten, einer Zahl zwischen 0 und 1.
Ein Koeffizient von 1 steht für eine Messung ohne jeden Messfehler, ein Koeffizient von 0 für einen Wert, der ausschliesslich aus Messfehlern besteht. Moosbrugger und Kelava schreiben, der Reliabilitätskoeffizient eines guten Tests sollte 0,7 nicht unterschreiten. Diese Zahl kursiert im Netz meist ohne Beleg. Sie steht in Kapitel 2 des Lehrbuchs als Soll-Angabe und nicht als Grenzwert, ab dem eine Skala unbrauchbar wäre.
Zur Bestimmung der Reliabilität kennt die Klassische Testtheorie vier Verfahren. Welches davon für deine Arbeit realistisch bleibt, entscheidet weniger die Statistik als die Frage, ob du dieselben Befragten ein zweites Mal erreichst.
| Verfahren | Wie es funktioniert | Realistisch in einer Masterarbeit? |
|---|---|---|
| Retest-Reliabilität | derselbe Test zu zwei Zeitpunkten, Werte korrelieren | selten, die Befragten sind kaum erneut erreichbar |
| Paralleltest-Reliabilität | zwei inhaltlich gleichwertige Testformen | kaum, dafür ist der Itempool zu klein |
| Testhalbierung (Split-Half) | Test in zwei Hälften teilen, Hälften korrelieren | ja, mit Spearman-Brown-Korrektur |
| Innere Konsistenz | jedes Item als eigener Testteil, meist Cronbachs Alpha | ja, das ist der Normalfall |
Als Königsweg gilt die Paralleltest-Reliabilität, weil sie Übungs- und Erinnerungseffekte ausschaltet. Für eine Bachelor- oder Masterarbeit bleibt sie dennoch fast immer unerreichbar, denn sie verlangt zwei Fragebogenfassungen, die zu denselben wahren Werten führen. In der Praxis landen deshalb fast alle bei der inneren Konsistenz.
Cronbachs Alpha: was der Wert aussagt und was nicht
Cronbachs Alpha misst, wie eng die Items einer Skala untereinander zusammenhängen, und ist damit ein Mass der inneren Konsistenz. Verbreitet ist der Wert vor allem, weil jede Statistiksoftware ihn ausgibt, und ebenso verbreitet ist seine Überdehnung. Ein hoher Alpha-Wert belegt nämlich nicht, dass eine Skala nur ein einziges Merkmal misst, und er steigt schon dann, wenn die Skala mehr Items bekommt. Streng ist zudem die Annahme dahinter: Alle Items sollen gleich stark auf dasselbe Merkmal laden. Trifft das nicht zu, unterschätzt Alpha die tatsächliche Reliabilität. Klaas Sijtsma hat diese Einschränkungen 2009 in der Fachzeitschrift Psychometrika ausführlich dargelegt, und als Alternative wird seitdem häufig McDonalds Omega genannt.
Rechnen musst du Omega für eine Abschlussarbeit deswegen nicht. Es genügt, Alpha mit einem Halbsatz einzuordnen, statt es als Beweis zu präsentieren. Genau solche Einordnungen unterscheiden eine gute von einer durchschnittlichen Methodendiskussion.

Validität: Erfasst der Fragebogen wirklich das gemeinte Merkmal?
Validität liegt vor, wenn ein Test jenes Merkmal misst, das er messen soll, und nicht ein benachbartes. Für die Testpraxis nennen Moosbrugger und Kelava die Validität das wichtigste Gütekriterium überhaupt, weil sie über die Aussagekraft sämtlicher Ergebnisse entscheidet.
Anders als die Reliabilität lässt sich Validität nicht an einer einzigen Zahl ablesen. Vielmehr setzt sie sich aus mehreren Belegarten zusammen, und je nach Anwendungsfall ist nur ein Teil davon überhaupt prüfbar. Das Lehrbuch trennt vier Aspekte, die im Methodenteil auch so heissen sollten.
- Inhaltsvalidität: Decken die Items den Merkmalsbereich repräsentativ ab? Gerechnet wird hier nichts, geurteilt wird fachlich und über Expertenurteile.
- Augenscheinvalidität: Wirkt der Anspruch eines Tests für eine fachfremde Person auf den ersten Blick gerechtfertigt? Betroffen ist die Akzeptanz, nicht die Aussagekraft.
- Konstruktvalidität: Trägt der Schluss vom Antwortverhalten auf das dahinterliegende Merkmal theoretisch? Belegt wird er über Zusammenhänge mit ähnlichen und mit bewusst unähnlichen Verfahren.
- Kriteriumsvalidität: Erlaubt der Testwert einen Schluss auf ein Verhalten ausserhalb der Testsituation? Bei gleichzeitig vorliegendem Kriterium spricht man von Übereinstimmungsvalidität, bei künftigem von Vorhersagevalidität.
Inhaltsvalidität und Augenscheinvalidität werden regelmässig verwechselt
Häufig liest man, Inhaltsvalidität und Augenscheinvalidität meinten dasselbe. Zutreffend ist das nicht, und die Verwechslung ist so verbreitet, dass Moosbrugger und Kelava sie im Lehrbuch eigens als Verwechslungsgefahr ausweisen. Der Unterschied liegt darin, wer urteilt und woraufhin. Inhaltsvalidität ist ein Fachurteil darüber, ob die Items den Merkmalsbereich abdecken. Augenscheinvalidität ist der Eindruck einer fachfremden Person, dass ein Test plausibel wirkt. Ein Fragebogen kann sehr überzeugend aussehen und trotzdem am Merkmal vorbeimessen, und ein inhaltlich sauberer Test kann für Aussenstehende völlig unverständlich wirken.
⚠️ Achtung
Schreibe in deiner Arbeit nicht „Inhaltsvalidität beziehungsweise Augenscheinvalidität“. Wer beide Begriffe gleichsetzt, öffnet einer Prüfung aus der Methodenlehre eine Flanke. Nenne die Inhaltsvalidität als das, was du fachlich begründest, und die Augenscheinvalidität höchstens als Argument für die Akzeptanz bei den Befragten.
Eine zweite Unschärfe betrifft die interne und die externe Validität. Beide Begriffe stammen aus der Bewertung von Untersuchungsdesigns und beantworten die Fragen, ob ein Ursachenschluss innerhalb einer Studie trägt und ob die Ergebnisse darüber hinaus gelten. Unterarten der Inhalts- oder Konstruktvalidität sind sie nicht, auch wenn viele Zusammenfassungen sie so einsortieren. Wer beide Systematiken vermischt, verliert genau jene Präzision, die im Methodenteil bewertet wird.

Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Wie Objektivität, Reliabilität und Validität zusammenspielen
Reliabilität ist die Voraussetzung für Validität, und der umgekehrte Schluss trägt nicht. Moosbrugger und Kelava halten fest, dass Objektivität und Reliabilität lediglich die günstigen Voraussetzungen für eine hohe Validität schaffen und dass ein Test mit niedriger Reliabilität keine hohe Validität erreichen kann.
Der zitierte Satz aus dem Lehrbuch wirkt unscheinbar und trägt doch die ganze Systematik. Übersetzt heisst er: Eine zuverlässige Messung kann am Thema vorbeigehen, eine unzuverlässige Messung kann niemals gültig sein. Die Objektivität geht dem in der Praxis voraus, weil eine Erhebung mit grossem Auswertungsspielraum kaum stabile Werte liefert. Als formale Bedingung steht das im Lehrbuch allerdings nicht, anders als die Beziehung zwischen Reliabilität und Validität.
Ein Thermometer, das konstant 1,5 Grad zu viel anzeigt, macht den Unterschied anschaulich. Objektiv arbeitet es, weil es bei jeder Person nach denselben Regeln funktioniert. Reliabel ist es ebenfalls, weil drei Messungen hintereinander denselben Wert liefern. Valide ist es trotzdem nicht, denn es misst systematisch daneben. Genau dieser Fall, hohe Reliabilität bei niedriger Validität, kommt in Fragebögen am häufigsten vor, und in den Kennzahlen fällt er nicht auf.
Schweizer Sonderfall: Skalen auf Hochdeutsch validiert, Alltagssprache Schweizerdeutsch
Skalen für psychologische Konstrukte werden im deutschsprachigen Raum fast immer auf Hochdeutsch entwickelt und geprüft, in der Deutschschweiz aber von Menschen beantwortet, deren Alltagssprache Schweizerdeutsch ist. Valérie-Anne Ryser weist im FORS Guide Nº 22 „Measuring psychological constructs“ (2023) darauf hin, dass Skalen nach Länge, Validität und Reliabilität auszuwählen sind, und hält kognitive Pretests bei einer Adaption für unverzichtbar. Herausgeber ist FORS, das Schweizer Kompetenzzentrum Sozialwissenschaften an der Universität Lausanne.
Für deine eigene Erhebung folgt daraus zweierlei. Erstens sinkt die Reliabilität, sobald einzelne Begriffe unterschiedlich verstanden werden, weil die Antworten dann stärker streuen, als das Merkmal es hergibt. Zweitens gerät die Validität ins Rutschen, sobald ein Item in der Deutschschweiz systematisch anders gelesen wird als in Deutschland. Ein kognitiver Pretest mit einer Handvoll Personen aus der Zielgruppe deckt beides auf, bevor der Link verschickt ist.
Reihenfolge im Methodenteil: erst Durchführung, dann Genauigkeit, dann Abdeckung
Die Reihenfolge im Methodenteil folgt derselben Logik wie der Aufbau der drei Kriterien. Zuerst klärst du die Bedingungen der Durchführung, danach die Genauigkeit deiner Skalen, zuletzt die inhaltliche Abdeckung. Wer diese Abfolge umdreht, begründet die Gültigkeit einer Messung, deren Zuverlässigkeit noch gar nicht geklärt ist.
- Halte fest, ob die Erhebung für alle Befragten identisch abläuft.
- Rechne danach die innere Konsistenz deiner Skalen.
- Begründe zuletzt, dass die Items den Merkmalsbereich abdecken.
- Nenne auch einen niedrigen Wert, statt ihn wegzulassen.
Zuverlässig gemessen ist nicht dasselbe wie richtig gemessen.
Gelten die drei Gütekriterien auch in der qualitativen Forschung?
Für qualitative Verfahren taugen die drei Gütekriterien nur eingeschränkt, weil sie für standardisierte Messungen entwickelt wurden. Ein Leitfadeninterview soll bei einer Wiederholung eben nicht dasselbe ergeben, sondern auf die einzelne Person eingehen.
In der qualitativen Sozialforschung sind deshalb eigene Kataloge entstanden. Am bekanntesten ist der Vorschlag von Yvonna Lincoln und Egon Guba aus „Naturalistic Inquiry“ (Sage, 1985) mit Glaubwürdigkeit, Übertragbarkeit, Verlässlichkeit und Bestätigbarkeit. Im deutschsprachigen Raum wird daneben häufig auf die Kernkriterien von Ines Steinke verwiesen, die die intersubjektive Nachvollziehbarkeit des Vorgehens in den Mittelpunkt rücken.
Praktisch bleibt die Folge überschaubar. Wer qualitativ erhebt, schreibt nicht über Cronbachs Alpha, sondern dokumentiert Auswahl, Ablauf und Auswertung so genau, dass eine dritte Person den Weg nachvollziehen kann. Welche Kriterien in beiden Forschungslogiken nebeneinanderstehen, zeigt der Beitrag zu den Gütekriterien quantitativer und qualitativer Forschung.
Gütekriterien in der Abschlussarbeit: wo sie in der Gliederung stehen
Die Gütekriterien haben in einer Abschlussarbeit keinen festen Platz in der Gliederung. Üblich sind zwei Varianten, und beide lassen sich vertreten: ein eigener Unterpunkt im Kapitel zum Forschungsdesign oder ein Abschnitt in der Reflexion des eigenen Vorgehens.
Welche Variante passt, hängt davon ab, wie begründungsbedürftig die Methodenwahl für deine Forschungsfrage ist. Steht die Methode im Zentrum, gehören die Kriterien nach vorne ins Design. Geht es stärker um inhaltliche Erkenntnisse, wirken sie hinten in der Reflexion natürlicher. Im Zweifel klärst du das mit deiner Betreuung, denn die Institute handhaben das unterschiedlich.
Variante 1: Gütekriterien als eigener Unterpunkt im Forschungsdesign
Der eigene Unterpunkt im Forschungsdesign eignet sich, wenn du die Methodenwahl ausführlich begründest und die Gütekriterien Teil dieser Begründung sind. Der Vorteil liegt darin, dass die Qualitätsfrage bereits geklärt ist, bevor die Lesenden auf die Ergebnisse treffen. Der Preis ist, dass an dieser Stelle noch nicht feststeht, welche Skalen sich später als schwach erweisen, und du deshalb mit einem Nachtrag in der Reflexion rechnen musst.
- Einleitung mit Forschungsfrage
- Theorie und Stand der Forschung
- Forschungsdesign, darin: Hypothesen, Methodenwahl, Grundgesamtheit und Stichprobe, Variablen, Fragenkatalog, Gütekriterien mit je einem Unterpunkt für Objektivität, Reliabilität und Validität
- Datenerhebung
- Datenauswertung
- Ergebnisse
- Reflexion des Vorgehens
- Fazit
Variante 2: Gütekriterien als Abschnitt in der Reflexion des Vorgehens
Die Reflexion des Vorgehens eignet sich, wenn du die Grenzen deiner Erhebung erst im Licht der Ergebnisse sauber benennen kannst. Der Aufbau bleibt derselbe, nur wandern die Gütekriterien in Punkt 7 und werden dort gemeinsam mit den Einschränkungen der Arbeit diskutiert. Der Vorteil liegt in der Ehrlichkeit, weil du über tatsächlich erreichte Werte schreibst statt über Absichten. Der Preis ist, dass die Methodenkritik weit hinten steht und leicht überlesen wird.
In beiden Varianten gilt derselbe Massstab: Bewertet wird nicht, ob eine Erhebung alle drei Kriterien erfüllt, sondern ob nachvollziehbar wird, welche erfüllt sind und wo die Grenzen liegen.

Typische Fehler bei den Gütekriterien
Die meisten Abzüge im Methodenteil entstehen nicht durch schwache Kennzahlen, sondern durch Aussagen, die mehr behaupten, als die Daten hergeben. Drei Muster tauchen dabei besonders oft auf.
Alle drei Muster gehen auf dieselbe Ursache zurück: Ein Gütekriterium wird für etwas in Anspruch genommen, wofür es nicht gemacht ist. Wer die drei Kriterien sauber auseinanderhält, umgeht die Fehler beinahe von allein, und der Methodenteil wird dabei eher kürzer als länger.
Fehler 1: aus hoher Reliabilität auf Validität schliessen
Ein Cronbachs Alpha von 0,91 belegt, dass die Items einer Skala eng zusammenhängen. Über die Frage, ob diese Items das gemeinte Merkmal erfassen, sagt der Wert nichts. Wer nach dem Alpha-Wert notiert, die Skala sei damit valide, zieht genau jenen Schluss, den die Testtheorie ausschliesst. Der Ausweg ist ein zusätzlicher Absatz zur Inhaltsvalidität, in dem du begründest, warum die Items den Merkmalsbereich abdecken.
Fehler 2: Objektivität abhaken, weil die Umfrage online läuft
Eine Online-Umfrage sichert vor allem die Durchführungsobjektivität, weil alle Befragten dieselbe Maske sehen. Auswertungs- und Interpretationsobjektivität bleiben davon unberührt. Sobald offene Fragen im Fragebogen stehen oder Schwellenwerte frei gewählt werden, entsteht erneut Spielraum. Der Ausweg ist, alle drei Aspekte getrennt zu benennen, statt Objektivität pauschal als erledigt zu betrachten.
Fehler 3: schwache Werte aus der Arbeit heraushalten
Ein Reliabilitätskoeffizient von 0,61 ist kein Grund, eine Skala zu streichen oder den Wert zu verschweigen. Bewertet wird die Auseinandersetzung, nicht die Höhe der Zahl. Wer den Wert nennt, erklärt, woran er vermutlich liegt, und die Deutung entsprechend vorsichtiger formuliert, zeigt genau die methodische Reife, um die es geht. Verschwiegene Werte fallen spätestens bei der Verteidigung auf.
Fazit
Objektivität, Reliabilität und Validität sind keine Hürden, die genommen werden müssen, sondern drei Fragen, die du beantwortest. Vollständige Erfüllung bleibt auch in professionellen Studien die Ausnahme, und in einer Abschlussarbeit erwartet sie niemand. Erwartet wird, dass du die drei Kriterien auseinanderhältst und offenlegst, wo deine Erhebung an ihre Grenzen stösst.
Wie es weitergeht
- Du willst den Fragebogen selbst aufbauen? Fragebogen erstellen: Anleitung und Aufbau
- Du brauchst die Definition eines einzelnen Begriffs? Was bedeutet Validität? und Was bedeutet Reliabilität?
- Du suchst das passende Auswertungsverfahren? Auswertungsmethoden in der empirischen Forschung
- Du willst den ganzen Ablauf im Blick haben? Empirische Forschung: Definition, Methoden, Leitfaden
Unser Literaturtipp: Moosbrugger, Helfried und Kelava, Augustin (Hrsg.) (2012): Testtheorie und Fragebogenkonstruktion. 2. Auflage. Springer: Berlin und Heidelberg. Kapitel 2 behandelt alle zehn Gütekriterien und steht als Leseprobe frei zur Verfügung. Für Schweizer Erhebungen lohnt sich zusätzlich der FORS Guide Nº 22 von Valérie-Anne Ryser (2023), der Auswahl und Adaption von Skalen behandelt.
Soll deine Befragung von Anfang an standardisiert laufen?
Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, sehen alle Teilnehmenden denselben Fragebogen in derselben Reihenfolge. Damit ist die Durchführungsobjektivität weitgehend abgesichert. Auswertungs- und Interpretationsobjektivität bleiben deine Aufgabe, denn beide hängen an deinen Regeln und nicht am Werkzeug.
