In der Defensio kommt oft eine Frage, mit der kaum jemand rechnet: Woran hätte man gemerkt, dass die eigene Auswertung danebengeht? Beantworten lässt sich das nur mit Gütekriterien, und die sehen je nach Forschungsansatz völlig unterschiedlich aus.
Gütekriterien sind die Maßstäbe für die wissenschaftliche Brauchbarkeit einer Untersuchung. Quantitative Studien prüfen Objektivität, Reliabilität und Validität. Für die qualitative Forschung existiert kein einheitlicher Katalog, sondern mehrere konkurrierende Vorschläge, von denen die sechs Kriterien von Philipp Mayring am häufigsten zitiert werden, gefolgt von den sieben Kernkriterien von Ines Steinke. Am Ende weißt du, welcher Katalog zu deinem Design passt und wie du die Wahl begründest.
📌 Das Wichtigste im Überblick
- Objektivität, Reliabilität und Validität gelten für quantitative Erhebungen.
- Mayring formuliert sechs allgemeine Kriterien für qualitatives Arbeiten.
- Steinke zählt sieben Kernkriterien, Lincoln und Guba vier.
- Ein verbindlicher Katalog für qualitative Forschung fehlt bis heute.
- Englischsprachige Standardwerke führen Objektivität nicht als Hauptgütekriterium.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Gütekriterien: Definition und Zweck
Gütekriterien sind Maßstäbe, mit denen sich beurteilen lässt, ob eine Untersuchung wissenschaftlich brauchbar ist. Geprüft wird damit eine einzige Grundfrage: Beruht ein Ergebnis auf dem gewählten Verfahren oder auf der Person, die es angewendet hat?
Zwischen einer Alltagsbeobachtung und einem wissenschaftlichen Befund liegt genau dieser Unterschied. Wer sagt, die Stimmung im Team sei gekippt, beschreibt eine Wahrnehmung. Ein Befund entsteht erst, wenn offenliegt, mit welchem Instrument, an welchen Personen und nach welchen Regeln die Aussage zustande gekommen ist. Gütekriterien liefern das Vokabular für diesen Unterschied.
Vorgeschrieben ist keines der Kriterien. Weder das Universitätsgesetz noch ein Curriculum legt fest, welche Maßstäbe in einer Bachelorarbeit oder einer Diplomarbeit zu prüfen sind. Bewertet wird, ob du benennen kannst, welche Kriterien deine Erhebung einlöst und wo sie an Grenzen stößt. Im Zweifel entscheidet die Vorgabe deines Instituts oder deiner Betreuung.
Offen ist auch, wo das Thema in der Gliederung steht. Zwei Orte sind üblich: ein Unterpunkt im Kapitel zum Forschungsdesign oder ein Abschnitt in der methodischen Reflexion. Vorzüge und Nachteile beider Varianten beschreibt der Beitrag zu Objektivität, Reliabilität, Validität: Definition, Beispiel.
Die drei Hauptgütekriterien quantitativer Forschung
Quantitative Forschung stützt sich auf drei Hauptgütekriterien: Objektivität, Reliabilität und Validität. Nacheinander beantworten sie, ob ein Ergebnis an der messenden Person hängt, wie groß der Messfehler ausfällt und ob überhaupt das gemeinte Merkmal erfasst wird.
| Gütekriterium | Leitfrage | Nachweis in der Arbeit |
|---|---|---|
| Objektivität | Hängt das Ergebnis an der Person? | feste Regeln für Durchführung, Auswertung, Interpretation |
| Reliabilität | Wie groß ist der Messfehler? | Reliabilitätskoeffizient zwischen 0 und 1 |
| Validität | Wird das gemeinte Merkmal gemessen? | inhaltliche, konstruktbezogene und kriterienbezogene Belege |
Die Reihenfolge der drei ist keine Gewohnheit, sondern eine Abhängigkeit. Eine Erhebung, bei der jede auswertende Person zu einem anderen Wert kommt, liefert kaum zuverlässige Werte, und ohne Zuverlässigkeit ist keine Gültigkeit zu haben. Umgekehrt greift die Logik nicht: Eine Waage, die konstant zwei Kilogramm zu viel anzeigt, misst zuverlässig und trotzdem falsch. Wie sich jedes einzelne Kriterium prüfen lässt, zeigt der Beitrag zu Objektivität, Reliabilität, Validität: Definition, Beispiel.

Nebengütekriterien: warum die Listen je nach Lehrbuch anders aussehen
Nebengütekriterien sind zusätzliche Anforderungen an ein Testverfahren, und welche dazugehören, hängt vom Lehrbuch ab. In Zusammenfassungen im Netz fehlt dieser Punkt fast immer. Genau deshalb findest du in zwei Quellen zwei verschiedene Listen, ohne dass eine davon falsch wäre.
| Nebengütekriterium | Lienert und Raatz (1998) | Moosbrugger und Kelava (2020) |
|---|---|---|
| Normierung | ✓ | ✕ |
| Vergleichbarkeit | ✓ | ✕ |
| Ökonomie | ✓ | ✓ |
| Nützlichkeit | ✓ | ✓ |
| Zumutbarkeit | ✕ | ✓ |
| Unverfälschbarkeit | ✕ | ✓ |
| Fairness | ✕ | ✓ |
✕ bedeutet: In dieser Quelle steht das Kriterium nicht als eigener Punkt der Liste. Moosbrugger und Kelava führen die Normierung 2020 nicht eigenständig, sondern ordnen sie der Interpretationsobjektivität zu.
Helfried Moosbrugger und Augustin Kelava haben den Zuschnitt ihrer Liste mit der 3. Auflage verändert. Wo in der 2. Auflage von 2012 noch zehn Gütekriterien nebeneinanderstanden, trennen sie in Kapitel 2 der 3. Auflage von „Testtheorie und Fragebogenkonstruktion“ (Springer, 2020) zwischen „allgemeinen“ und „speziellen, testtheoriebasierten“ Gütekriterien. Zu den allgemeinen gehören die drei Objektivitätsarten sowie Ökonomie, Nützlichkeit, Zumutbarkeit, Fairness und Unverfälschbarkeit, zu den speziellen Reliabilität und Validität. Beide Zählweisen haben dieselbe Berechtigung: Wer die 2. Auflage von 2012 heranzieht, kommt auf zehn Gütekriterien, wer die 3. Auflage von 2020 nimmt, auf eine anders geschnittene Liste. Nenne deshalb Quelle und Auflage, aus der dein Katalog stammt, statt von „den Nebengütekriterien“ zu schreiben, als gäbe es nur einen.
Kubinger als Bezugspunkt an österreichischen Instituten
Klaus D. Kubinger stellt in seinem Lehrbuch zur psychologischen Diagnostik die Gütekriterien an den Anfang, weil sich an ihnen die Brauchbarkeit eines Verfahrens entscheidet. Der Wiener Psychologe lehrte bis 2012 an der Fakultät für Psychologie der Universität Wien, sein Lehrbuch „Psychologische Diagnostik“ liegt bei Hogrefe in der 3., überarbeiteten Auflage von 2019 vor. Für eine quantitative Arbeit an einem österreichischen Institut ist das eine naheliegende Quelle neben Moosbrugger und Kelava.
Die sechs Gütekriterien qualitativer Forschung nach Mayring
Philipp Mayring nennt sechs allgemeine Gütekriterien qualitativ orientierter Forschung: Verfahrensdokumentation, argumentative Interpretationsabsicherung, Regelgeleitetheit, Nähe zum Gegenstand, kommunikative Validierung und Triangulation. An die Stelle einer Messung tritt bei ihm die Frage, ob ein Vorgehen nachvollziehbar dokumentiert und am Material begründet ist.
Für Verwirrung sorgt regelmäßig die Jahreszahl, weil das Buch seit 1990 in sieben Auflagen vorliegt. Nachzulesen sind die Kriterien in „Einführung in die qualitative Sozialforschung“, zuletzt in der 7. Auflage von 2023 (Beltz), dort im Abschnitt 6.3, der sechs allgemeine Gütekriterien qualitativer Forschung aufführt.
- Verfahrensdokumentation: Vorwissen, Erhebung und Auswertungsregeln liegen so genau vor, dass Außenstehende den Weg nachgehen können.
- Argumentative Interpretationsabsicherung: Deutungen lassen sich nicht nachrechnen, deshalb werden sie am Material begründet.
- Regelgeleitetheit: Die Analyse folgt einem vorab festgelegten Ablauf, Abweichungen werden dokumentiert und begründet.
- Nähe zum Gegenstand: Erhoben wird in der Alltagswelt der Befragten, ein Vertrauensverhältnis gehört zur Methode.
- Kommunikative Validierung: Befragte bekommen die Deutungen vorgelegt, ihre Zustimmung ist ein Argument, kein Beweis.
- Triangulation: Zwei Methoden, zwei Datenquellen, zwei Theorien oder zwei forschende Personen beleuchten denselben Gegenstand.
Bei interpretativem Vorgehen hält Mayring die Beurteilerübereinstimmung für besonders wichtig, also die Frage, ob zwei Personen dasselbe Material gleich codieren. An dieser Stelle steht die einzige Zahl seines Katalogs.
💡 Tipp
Bitte eine zweite Person, fünf deiner Interviewpassagen unabhängig zu codieren, und vergleicht anschließend das Ergebnis. Schon diese kleine Stichprobe zeigt, ob dein Kategoriensystem trägt, und liefert einen belastbaren Satz für den Methodenteil. Ohne einen solchen Abgleich bleibt die Verfahrensdokumentation eine Behauptung.
Welche Kataloge neben Mayring in Abschlussarbeiten vorkommen
Neben Mayring tauchen drei weitere Kataloge regelmäßig in Abschlussarbeiten auf: die sieben Kernkriterien von Ines Steinke, die vier Kriterien von Yvonna Lincoln und Egon Guba sowie die fünf Kriterien von Jörg Strübing und Kollegen aus dem Jahr 2018.
Welchen du wählst, hängt an deinem Vorgehen und nicht am Geschmack. Wer mit der qualitativen Inhaltsanalyse arbeitet, greift naheliegend zu Mayring, weil beides aus derselben Werkstatt stammt. Geht es um die Bewertung eines ganzen Forschungsprozesses, bietet Steinke den breiteren Rahmen. Und wer überwiegend englischsprachige Literatur zitiert, kommt an Lincoln und Guba ohnehin nicht vorbei.
Die sieben Kernkriterien nach Ines Steinke
Ines Steinke legt sieben Kernkriterien vor: intersubjektive Nachvollziehbarkeit, Indikation des Forschungsprozesses, empirische Verankerung, Limitation, Kohärenz, Relevanz und reflektierte Subjektivität. Aufgeführt sind sie unter anderem im Dorsch Lexikon der Psychologie (Hogrefe), das den Katalog auf Steinke (1999) datiert.
Den ganzen Katalog trägt die intersubjektive Nachvollziehbarkeit. Gemeint ist, dass eine außenstehende Person allein anhand deiner Dokumentation beurteilen kann, wie die Ergebnisse zustande gekommen sind. Steinke nennt dafür drei Wege: den Forschungsprozess gründlich dokumentieren, das Material in einer Gruppe interpretieren und kodifizierte Verfahren anwenden. Zwei Jahreszahlen kursieren, weil der Katalog 1999 als Monografie bei Juventa erschien und kurz darauf als Beitrag im Handbuch von Flick, von Kardorff und Steinke.
Die vier Kriterien von Lincoln und Guba mit deutschen Entsprechungen
Yvonna Lincoln und Egon Guba schlagen in „Naturalistic Inquiry“ (Sage, 1985) vier Kriterien vor, die sie unter dem Begriff trustworthiness bündeln. Im deutschsprachigen Ratgeberumfeld werden beide erstaunlich selten genannt, obwohl fast jede englischsprachige Methodenliteratur auf sie zurückgreift.
| Kriterium | Deutsche Entsprechung | Quantitatives Gegenstück |
|---|---|---|
| Credibility | Glaubwürdigkeit | interne Validität |
| Transferability | Übertragbarkeit | externe Validität |
| Dependability | Zuverlässigkeit | Reliabilität |
| Confirmability | Bestätigbarkeit | Objektivität |
Die Gegenüberstellung in der rechten Spalte stammt von Lincoln und Guba selbst: Sie führen ihre vier Kriterien ausdrücklich als grobe Entsprechungen zu den konventionellen Begriffen ein. Die deutschen Bezeichnungen in der mittleren Spalte gehen auf Bortz und Döring zurück und sind in den Lehrmaterialien der Abteilung Methodenlehre der Universität Mainz dokumentiert. Gemeint ist in beiden Fällen eine Übersetzungshilfe und keine Gleichsetzung: Credibility fragt, ob deine Deutung zum Material passt, interne Validität dagegen, ob ein Ursachenschluss trägt. Vier Jahre später ergänzten Guba und Lincoln in „Fourth Generation Evaluation“ (Sage, 1989) fünf Kriterien unter dem Stichwort authenticity, die im deutschsprachigen Raum kaum aufgegriffen wurden.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Warum ein verbindlicher Katalog für qualitative Forschung fehlt
Einen verbindlichen Katalog gibt es nicht, weil sich die Fachwelt bis heute auf keinen geeinigt hat. Der Grund liegt in der Sache: Qualitative Verfahren sind bewusst offen angelegt, und ein einheitlicher Standard würde genau die Offenheit beschneiden, die ihren Zweck ausmacht.
Wie lebendig der Streit ist, zeigt der jüngste Anlauf. Jörg Strübing, Stefan Hirschauer, Ruth Ayaß, Uwe Krähnke und Thomas Scheffer haben 2018 in der Zeitschrift für Soziologie fünf Kriterien vorgeschlagen: Gegenstandsangemessenheit, empirische Sättigung, theoretische Durchdringung, Originalität und textuelle Performanz. Der Untertitel ihres Beitrags lautet „Ein Diskussionsanstoß“, und genau das wurde er.
In derselben Zeitschrift erschienen Repliken, von denen eine schon im Titel bezweifelt, dass allgemeine Gütekriterien überhaupt möglich sind. Für deine eigene Arbeit ist die Uneinigkeit keine schlechte Nachricht, sondern eine Erleichterung: Du musst keinen Standard erfüllen, den es nicht gibt, sondern eine Entscheidung treffen und sie tragfähig begründen.
Wer einen Katalog nennt, ihn begründet und konsequent anwendet, arbeitet sauberer als wer alle vier aufzählt.
Warum international nur Reliabilität und Validität gezählt werden
Objektivität als drittes Hauptgütekriterium ist eine Eigenheit des deutschsprachigen Raums. Die maßgebliche englischsprachige Referenz, die „Standards for Educational and Psychological Testing“, führt im Grundlagenteil drei Kapitel, und Objektivität ist keines davon.
Herausgegeben werden die Standards gemeinsam von der American Educational Research Association, der American Psychological Association und dem National Council on Measurement in Education. Der erste Teil der Ausgabe von 2014 gliedert sich in Validity, Reliability/Precision and Errors of Measurement sowie Fairness in Testing. Fairness, im deutschsprachigen Kanon ein Nebengütekriterium, steht dort gleichrangig neben den anderen beiden.
Im österreichischen Methodenunterricht sitzt die Dreierfolge dagegen genauso fest wie im deutschen. Die Lernunterlage „Grundlagen sozialwissenschaftlicher Methodologie“ der Universität Wien hält fest, dass Objektivität, Reliabilität und Validität in quantitativen Forschungen die Hauptgütekriterien bilden, und beschreibt sie ausdrücklich als aufeinander aufbauend: ohne Objektivität keine Reliabilität, ohne Reliabilität keine Validität. In der englischsprachigen Referenzliteratur kommt dieser Dreischritt nicht vor.
Zwei praktische Folgen hat das für deine Arbeit. Findest du in englischsprachiger Literatur kein Wort zur Objektivität, ist das kein Versäumnis der Quelle, sondern ein Unterschied in der Systematik. Und wenn du auf Englisch schreibst, übersetze Objektivität nicht mit objectivity, sondern beschreibe, was gemeint ist: standardisierte Durchführung, Auswertung und Interpretation.
Typische Fehler im Methodenteil und in der Defensio
Punkteabzüge im Methodenteil entstehen selten durch schwache Kennwerte, sondern durch Aussagen, die mehr behaupten, als die Daten hergeben. Vier Fehler tauchen dabei besonders häufig auf.
Gemeinsam ist den vier Fehlern, dass ein Gütekriterium für etwas herhalten muss, wofür es nicht gemacht ist. Wer die Kataloge sauber auseinanderhält, umgeht sie fast von allein, und der Methodenteil wird dabei kürzer statt länger.
Objektivität mit den Rahmenbedingungen der Erhebung verwechseln
Objektivität meint Unabhängigkeit von der forschenden Person und nicht Unabhängigkeit von der Umgebung. Häufig steht in Arbeiten, eine Erhebung sei objektiv gewesen, weil sie in einem neutralen Raum stattfand. Ein neutraler Raum gehört jedoch zu den Durchführungsbedingungen. Objektiv wird eine Erhebung erst, wenn Instruktion, Auswertungsregeln und Interpretationsregeln vorab feststehen und für alle Befragten gleich gelten.
In der Defensio Objektivität behaupten, ohne sie geprüft zu haben
Prüfungskommissionen fragen in der Defensio gern nach, wie die Auswertungsobjektivität abgesichert wurde. Der Prüfungsleitfaden der Universität Graz zerlegt Objektivität für Prüfungen in Vorbereitung, Durchführung und Auswertung, in der Testtheorie steht an dritter Stelle die Interpretation. Wer nur schreibt, die Auswertung sei objektiv gewesen, hat auf die Rückfrage keine Antwort. Belastbar wird der Satz mit einem zweiten Codierdurchgang oder einem vorab fixierten Auswertungsschema.
Mayring und Steinke mit der falschen Jahreszahl zitieren
Mayrings „Einführung in die qualitative Sozialforschung“ erschien erstmals 1990 und liegt seit 2023 in der 7. Auflage vor. Steinkes Kernkriterien gibt es als Monografie von 1999 und als Handbuchbeitrag, der je nach benutzter Auflage mit 2000, 2008 oder 2010 datiert wird. Zitiert wird immer die Auflage, die du tatsächlich in der Hand hattest. Zwei Jahreszahlen für dieselbe Quelle im selben Verzeichnis fallen sofort auf.
Einen Katalog aufzählen, ohne ihn auf die eigene Erhebung zu beziehen
Eine Liste der sechs Kriterien nach Mayring ist noch keine Prüfung der eigenen Güte. Bewertet wird, ob du für jedes Kriterium sagen kannst, wie du es eingelöst hast und wo du an eine Grenze gestoßen bist. Ein Satz wie „Eine kommunikative Validierung war aus Zeitgründen nicht möglich, weshalb die Deutungen ausschließlich argumentativ abgesichert wurden“ wiegt mehr als eine vollständige Aufzählung ohne Bezug.
Fazit
Für die quantitative Forschung ist die Frage nach den Gütekriterien beantwortet, für die qualitative nicht, und darin liegt kein Mangel, sondern das Ergebnis einer laufenden Fachdebatte. Wähle einen Katalog, nenne die Quelle und arbeite ihn auf deine eigene Erhebung durch.
Wichtiger als die Zahl der Kriterien ist die Ehrlichkeit gegenüber den eigenen Grenzen. Eine Erhebung mit zwölf Interviews wird durch keinen Katalog repräsentativ, aber sie wird nachvollziehbar, sobald Vorgehen, Regeln und offene Punkte auf dem Tisch liegen. Genau danach fragt eine Prüfungskommission.
Wie es weitergeht
Passend zu deinem nächsten Schritt führen fünf Beiträge an dieser Stelle weiter. Abgedeckt sind die quantitative Trias im Detail, die Wahl zwischen den Ansätzen, die Durchführung von Interviews, die Auswertung der Daten und der gesamte Ablauf einer empirischen Untersuchung.
- Alle drei quantitativen Kriterien im Detail: Objektivität, Reliabilität, Validität: Definition, Beispiel
- Unsicher, welcher Ansatz zur Frage passt: Qualitativ vs. quantitativ: Definition und Unterschiede
- Interviews statt einer Umfrage: Qualitative Befragung: Formen, Leitfaden und Auswertung
- Passendes Auswertungsverfahren gesucht: Auswertungsmethoden: das passende Verfahren für deine Daten
- Überblick über den ganzen Ablauf: Empirische Forschung: Definition, Methoden, Leitfaden
Unser Literaturtipp für den Methodenteil
Mayring, Philipp (2023): Einführung in die qualitative Sozialforschung. 7. Auflage. Beltz: Weinheim und Basel. Kapitel 6 behandelt die Gütekriterien kompakt und ist der kürzeste seriöse Einstieg. Für die quantitative Seite eignen sich Moosbrugger, Helfried und Kelava, Augustin (Hrsg.) (2020): Testtheorie und Fragebogenkonstruktion. 3. Auflage. Springer: Berlin und Heidelberg.
Soll deine Erhebung für alle Befragten gleich ablaufen?
Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, sehen alle Teilnehmenden denselben Fragebogen in derselben Reihenfolge, und die Antworten liegen strukturiert vor. Die Durchführungsobjektivität ist damit weitgehend abgesichert. Für Auswertungs- und Interpretationsregeln bleibst du zuständig.
