Am Ende eines Kurses landet ein Evaluationsbogen auf deinem Tisch: „Ich konnte den Erklärungen gut folgen“, darunter fünf Kästchen von „trifft gar nicht zu“ bis „trifft völlig zu“. Kaum jemand denkt beim Ankreuzen daran, dass hinter diesen fünf Kästchen ein Messverfahren aus dem Jahr 1932 steckt.
Das Verfahren heißt Likert-Skala. Eine Likert-Skala misst Einstellungen, indem du mehreren Aussagen zum selben Thema dieselbe abgestufte Antwortskala gibst, meist fünf oder sieben Stufen von klarer Ablehnung bis klarer Zustimmung, und die Antworten der einzelnen Aussagen anschließend zu einem einzigen Wert pro befragter Person zusammenrechnest. Am Ende dieses Artikels weißt du, wie viele Stufen deine Skala braucht, wie du sie beschriftest und was du mit den Zahlen danach rechnen darfst.
📌 Das Wichtigste im Überblick
- Rensis Likert stellte das Verfahren 1932 in seiner Dissertation vor.
- Eine einzelne Frage ist ein Likert-Item, noch keine Likert-Skala.
- Fünf bis sieben Stufen empfehlen die GESIS Survey Guidelines.
- Statistik Austria wechselte 2013 von sechs auf elf Stufen.
- Likert selbst hat gleiche Abstände zwischen den Stufen nie behauptet.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Was ist eine Likert-Skala?
Eine Likert-Skala ist ein Messverfahren aus der Sozialforschung, bei dem Befragte mehreren Aussagen zum selben Thema zustimmen oder widersprechen, jeweils in denselben Abstufungen. Aus den Einzelantworten entsteht anschließend ein Summen- oder Mittelwert, der die Einstellung dieser Person beschreibt.
Zurück geht das Verfahren auf den amerikanischen Sozialpsychologen Rensis Likert, der es 1932 in seiner Dissertation an der Columbia University vorstellte, erschienen als Heft 140 der Reihe Archives of Psychology unter dem Titel A Technique for the Measurement of Attitudes. Ihn trieb kein theoretisches Interesse, sondern Sparsamkeit: Die etablierten Verfahren seiner Zeit verlangten aufwendige Vorstudien, und er wollte prüfen, ob es auch einfacher geht. Es ging. Seine Skala zur Einstellung gegenüber internationalen Beziehungen erreichte mit 24 Aussagen dieselbe Zuverlässigkeit wie ein konkurrierendes Verfahren mit 44 Aussagen (Likert 1932, S. 33). Halb so viele Fragen bei gleichem Ergebnis, und genau deshalb steckt das Verfahren heute in fast jedem Fragebogen.
In der Psychologie heißt ein solches Instrument psychometrische Skala. Sie misst ein Merkmal, das sich nicht direkt beobachten lässt, über Antworten, die sich beobachten lassen. Einstellung, Zufriedenheit oder Motivation kannst du niemandem ansehen. Sichtbar ist nur, welches Kästchen jemand ankreuzt.
Likert-Item und Likert-Skala sind nicht dasselbe
Dieser Unterschied wird fast immer übergangen, auch in Lehrmaterial. Eine einzelne Frage mit fünf Abstufungen ist ein Likert-Item. Die Likert-Skala entsteht erst, wenn du mehrere solcher Items zum selben Merkmal stellst und ihre Werte zu einer Zahl zusammenfasst. Likert schreibt das im Original unmissverständlich: Jede Aussage sei „a scale in itself“, und die Einzelwerte würden anschließend über Median oder Mittelwert kombiniert (Likert 1932, S. 24).
Für eine Diplomarbeit oder Masterarbeit ist das der Punkt, an dem es in der Defensio unangenehm werden kann. Wer eine einzelne Frage als „Likert-Skala“ bezeichnet und anschließend Mittelwerte darauf rechnet, hat zwei Fehler in einem Satz. Wer sechs Aussagen zu Inhalt, Tempo, Betreuung, Material, Raum und Organisation stellt und daraus einen Zufriedenheitswert bildet, hat dagegen eine Skala gebaut.
Ein einzelnes Ankreuzfeld ist ein Item. Eine Skala wird daraus erst durch mehrere Items und eine gemeinsame Auswertung.
Unser Literaturtipp: Likerts Originalarbeit ist frei zugänglich und mit 55 Seiten deutlich kürzer, als der Ruf des Klassikers vermuten lässt. Wer sauber zitieren will, kommt an ihr ohnehin nicht vorbei.
Likert-Skala: Beispiele für gute Antwortskalen
Die häufigste Frage in der Praxis lautet nicht, was eine Likert-Skala ist, sondern wie die Stufen heißen sollen. Für den deutschen Sprachraum gibt es dafür eine belastbare Vorlage: Bernd Rohrmann entwickelte 1978 in der Zeitschrift für Sozialpsychologie Standardbeschriftungen für vier Kontinua, auf die auch die GESIS Survey Guidelines ausdrücklich verweisen.
Der Vorteil solcher geprüften Formulierungen liegt darin, dass die Abstände zwischen den Wörtern von den Befragten halbwegs einheitlich verstanden werden. Selbst gebastelte Stufen wie „eher schon“ oder „geht so“ leisten das nicht, weil jeder etwas anderes darunter versteht.
| Kontinuum | Wofür | Die fünf Stufen |
|---|---|---|
| Bewertung | Zustimmung zu einer Aussage | trifft … zu: gar nicht, wenig, teils-teils, ziemlich, völlig |
| Häufigkeit | wie oft etwas vorkommt | nie, selten, gelegentlich, oft, immer |
| Intensität | wie stark etwas wirkt | gar nicht, wenig, mittelmäßig, überwiegend, völlig |
| Wahrscheinlichkeit | wie sicher etwas eintritt | keinesfalls, wahrscheinlich nicht, vielleicht, ziemlich wahrscheinlich, ganz sicher |
Beschriftungen nach Rohrmann (1978), nachlesbar beim Staatsinstitut für Schulqualität und Bildungsforschung Bayern.
Die Zustimmungsskala und ihr Haken
Daneben steht die Variante, die den meisten zuerst einfällt: stimme überhaupt nicht zu, stimme nicht zu, teils, teils, stimme zu, stimme voll und ganz zu. Genau in dieser Form setzt sie auch Statistik Austria ein, etwa im österreichischen Zusatzmodul zur Lebenszufriedenheit, wo Aussagen „auf einer fünfstufigen Skala eine Bewertung von „stimme voll und ganz zu“ bis „stimme überhaupt nicht zu““ erhielten.
Die Skala ist verbreitet und sofort verständlich, erzeugt aber nachweislich mehr Zustimmung als eine Skala, die direkt nach der Sache fragt (Menold und Bogner 2016). Überall dort, wo du statt „Kurze Wartezeiten sind mir wichtig: stimme zu“ auch „Wie wichtig sind dir kurze Wartezeiten: sehr wichtig bis gar nicht wichtig“ fragen kannst, ist die zweite Form die bessere Wahl.
Die Zufriedenheitsskala
Für Zufriedenheit ist die gängige fünfstufige Fassung: sehr unzufrieden, eher unzufrieden, teils, teils, eher zufrieden, sehr zufrieden. Sie ist ausgewogen, weil links und rechts von der Mitte gleich viele Stufen liegen.
Genau diese Symmetrie ist die Bedingung dafür, dass die Mitte auch als Mitte gelesen wird. Eine Skala mit drei positiven und zwei negativen Stufen verschiebt das Ergebnis, ohne dass jemand es merkt, weil die optische Mitte dann nicht mehr die inhaltliche Mitte ist.
Wie viele Stufen braucht eine Likert-Skala?
Fünf bis sieben Stufen sind der Richtwert. Die GESIS Survey Guidelines fassen den Forschungsstand zusammen und empfehlen genau diese Spanne, weil Skalen dieser Länge zugleich zuverlässig messen, fein genug unterscheiden und von Befragten bevorzugt werden (Menold und Bogner 2016).
Dahinter steckt ein Abwägen zwischen zwei Fehlern. Zu wenige Stufen zwingen unterschiedliche Meinungen in dasselbe Kästchen, dann verschwindet genau der Unterschied, den du messen wolltest. Zu viele Stufen machen die einzelne Stufe bedeutungslos, denn wer könnte erklären, worin sich Stufe 8 und Stufe 9 einer Elferskala unterscheiden?
Was der Wechsel der Stufenzahl in Österreich angerichtet hat
Wie teuer eine geänderte Skala wird, lässt sich an der amtlichen Statistik in Österreich nachlesen. Statistik Austria erhob die Lebenszufriedenheit in der Erhebung EU-SILC bis 2012 auf einer sechsstufigen Skala mit durchgehend benannten Kategorien von „sehr unzufrieden“ bis „sehr zufrieden“.
Mit dem Modul 2013 stellte Statistik Austria auf eine elfstufige Skala von 0 bis 10 um, bei der nur noch die beiden äußersten Kategorien benannt sind. Die Folge steht in derselben Veröffentlichung als nüchterne Fußnote: Ein Vergleich zwischen den beiden Jahren sei „nur eingeschränkt möglich“ (Oismüller und Till, Statistische Nachrichten 12/2015). Wer eine Skala mitten in einer Zeitreihe ändert, verliert die Vergleichbarkeit, und zwar unabhängig davon, ob die neue Skala die bessere ist.
Fünf, sechs oder sieben Stufen: was das jeweils ändert
Die ungerade Zahl hat eine Mitte, die gerade Zahl hat keine. Das ist der eigentliche Unterschied, nicht die Feinheit der Abstufung. Eine sechsstufige Likert-Skala ist deshalb vor allem eine erzwungene Entscheidung: Wer unentschieden ist, muss sich trotzdem auf eine Seite schlagen.
Ob das gut oder schlecht ist, hängt vom Zweck ab. In einer Evaluation, die Verbesserungen anstoßen soll, ist eine erzwungene Tendenz oft hilfreich, weil eine Kolonne mittlerer Kreuze niemandem weiterhilft. In einer Meinungsumfrage, in der echte Unentschiedenheit ein Ergebnis ist, verfälscht sie.
Braucht deine Skala eine neutrale Mitte?
Die Mittelkategorie ist die meistdiskutierte Einzelentscheidung beim Skalenbau, und sie hat auf beiden Seiten gute Argumente. Beide lassen sich in wenigen Zeilen gegenüberstellen.
Was die Mitte leistet
- Wer wirklich unentschieden ist, kann das ausdrücken.
- Neutrale Befragte weichen nicht auf eine falsche Nachbarstufe aus.
- Die Skala bleibt links und rechts symmetrisch.
Was du dafür in Kauf nimmst
- Die Mitte wird auch aus Bequemlichkeit angekreuzt.
- Manche wählen sie, statt „weiß nicht“ zu sagen.
- Die Auswertung unterscheidet beide Gründe nicht.
Die GESIS Survey Guidelines wägen genau diese Punkte ab und empfehlen, die Mitte anzubieten, weil der Schaden durch verdrängte neutrale Meinungen größer ausfällt als der Schaden durch bequeme Mittelkreuze (Menold und Bogner 2016). Kurios ist dabei, dass Rensis Likert diese Frage nie diskutiert hat: In seiner Arbeit von 1932 taucht die Mittelkategorie „undecided“ ausschließlich als Rechenanweisung auf, nämlich mit dem Wert 3 (Likert 1932, Anhang).
Likert-Skala erstellen: Schritt für Schritt
Der häufigste Konstruktionsfehler passiert ganz am Anfang: Jemand tippt eine Frage ins Umfrage-Tool, klickt fünf Antwortstufen dazu und hält das Ergebnis für eine Skala. Gebaut wird eine Skala anders, nämlich indem ein Merkmal in mehrere Aussagen zerfällt, die dasselbe treffen wollen und dabei verschiedene Seiten davon anfassen.
Der folgende Ablauf trägt bei einer Lehrveranstaltungsevaluation ebenso wie beim empirischen Kapitel einer Diplomarbeit. Kalkuliere für Punkt eins mehr Zeit als für die restlichen fünf zusammen, denn dort entscheidet sich, ob am Ende überhaupt etwas Auswertbares herauskommt.
- Merkmal schärfen. Notiere in einem einzigen Satz, worum es geht. „Zufriedenheit mit der Lehrveranstaltung“ taugt, „Meinung zur Lehrveranstaltung“ taugt nicht, weil daraus keine Rangfolge wird.
- Aussagen schreiben. Zwischen fünf und zehn knappe Sätze, je ein Gedanke. Sobald zwei Themen in einer Aussage stecken, wird die Antwort mehrdeutig.
- Richtung wechseln. Ein Teil der Aussagen wird negativ gedreht, damit sichtbar wird, wer ohne Hinsehen immer dieselbe Spalte anklickt. Likert schlug genau das schon 1932 im Anhang vor.
- Format festzurren. Einmal fünf oder sieben Stufen wählen, danach nicht mehr abweichen, auch nicht bei einem einzelnen Block.
- Stufen benennen. Zu jeder Stufe gehört ein Wort. Eine Reihe nackter Ziffern zwischen zwei Endpunkten reicht nicht aus.
- Vorab testen. Fünf themenfremde Personen ausfüllen lassen und danach nachfragen, was sie unter der mittleren Stufe verstanden haben.
Technisch entspricht eine Likert-Skala einer Matrixfrage: untereinander stehende Aussagen, rechts daneben immer dieselbe Antwortskala. In empirio.ai, einem Online-Umfrage-Tool aus Deutschland, entsteht sie als Matrix-Frage, und die Skala wird nur ein einziges Mal hinterlegt. Den übrigen Aufbau des Bogens beschreibt der Beitrag zum Fragebogen erstellen.

Genau diese Bauform meint der Begriff Matrixfrage: Die Skala steht einmal als Spaltenkopf, jede Zeile darunter ist eine eigene Aussage zum selben Merkmal. Die vier Zeilen im Beispiel ergeben gemeinsam einen Zufriedenheitswert, eine einzelne Zeile für sich bleibt ein Likert-Item.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Welches Skalenniveau hat eine Likert-Skala?
Ein einzelnes Likert-Item ist ordinalskaliert. Du weißt, dass „stimme zu“ mehr Zustimmung bedeutet als „teils, teils“, aber du weißt nicht, ob der Abstand zwischen diesen beiden Stufen genauso groß ist wie der zwischen „teils, teils“ und „stimme nicht zu“.
Der Summenwert aus mehreren Items wird in der Forschungspraxis dagegen meist wie eine metrische Größe behandelt, also so, als wären die Abstände gleich. Das ist eine Konvention mit Begründung, keine mathematische Wahrheit: Je mehr Items in den Wert einfließen, desto feiner wird die entstehende Skala, und desto weniger fällt die Ungleichheit der einzelnen Schritte ins Gewicht.
Wenn du die Begriffe nachschlagen willst: Die Ordinalskala kennt nur eine Rangfolge, die Intervallskala zusätzlich gleiche Abstände. Welche Rechenoperationen an welcher Stufe hängen, steht im Überblick zum Skalenniveau.
Was Rensis Likert selbst dazu geschrieben hat
An dieser Stelle lohnt ein Blick ins Original, weil dort etwas anderes steht, als häufig behauptet wird. Likert hat gleiche Abstände ausdrücklich nur für sein aufwendiges Sigma-Verfahren beansprucht, nicht für die einfache Vergabe der Zahlen 1 bis 5.
Seine Tabelle II zeigt beides nebeneinander. Zu den fünf Stufen einer seiner Aussagen gehören die Sigma-Werte −1,63, −0,43, +0,43, +0,99 und +1,76 (Likert 1932, S. 23). Die Abstände betragen also 1,20, dann 0,86, dann 0,56, dann 0,77. Wer stattdessen 1, 2, 3, 4, 5 vergibt, unterstellt viermal denselben Abstand. Likert wusste das und begründete die Vereinfachung rein praktisch: Beide Verfahren korrelierten mit +0,99, deshalb sei die einfache Rechnung „for all ordinary purposes“ vertretbar (Likert 1932, S. 43).
Für dich folgt daraus zweierlei. Erstens gibt es auf die Frage „ordinal oder metrisch“ keine einzige richtige Antwort, sondern eine Entscheidung. Zweitens brauchst du dafür keinen Streit, sondern eine Regel, an die du dich hältst und die du im Methodenteil deiner Arbeit begründest.
Setzt eine Likert-Skala eine Normalverteilung voraus?
Nein, deine erhobenen Daten müssen nicht normalverteilt sein, damit du eine Likert-Skala einsetzen darfst. Die Verwechslung entsteht daran, dass Likert für seine Sigma-Rechnung annahm, Einstellungen seien in der Bevölkerung annähernd normalverteilt.
Er schrieb aber gleich dazu, die Gefahren dieser Annahme seien ihm vollständig bewusst, sie sei nur ein experimenteller Zwischenschritt und müsse durch weitere Untersuchungen entweder überflüssig gemacht oder bestätigt werden (Likert 1932, S. 22). Für die einfache Auswertung mit den Zahlen 1 bis 5 spielt die Annahme ohnehin keine Rolle. Relevant wird Normalverteilung erst dann wieder, wenn du bestimmte statistische Tests auf deine Skalenwerte anwenden willst.
Likert-Skala auswerten: Median, Mittelwert oder Häufigkeiten?
Ob du rechnen darfst und womit, entscheidet eine einzige Vorfrage: Liegt ein einzelnes Item vor oder eine Skala aus mehreren Items? Wer diese Vorfrage sauber beantwortet, hat den größten Teil der möglichen Einwände bereits ausgeräumt.
Beim Einzelitem gehört die Verteilung in den Vordergrund: Wie viel Prozent entfallen auf welche Stufe. Ergänzend passen Median (= der Wert in der Mitte aller geordneten Antworten) und Modus (= die meistgewählte Stufe). Ein Mittelwert über eine einzelne ordinale Frage lädt zur Kritik ein, weil er stillschweigend gleiche Abstände behauptet.
Bei einer Skala aus mehreren Items entsteht zuerst ein Summen- oder Mittelwert je Person, und erst dieser Wert geht in weitere Rechnungen ein. Likert hat es genau so vorgeschlagen (Likert 1932, S. 26). Davor steht die Prüfung, ob die Items überhaupt dasselbe erfassen, meist über Cronbachs Alpha. Was danach infrage kommt, listet der Überblick zu den Auswertungsmethoden.
Wie Statistik Austria Skalenwerte berichtet
Ein Blick in die amtliche Statistik in Österreich zeigt, wie fein erhobene Skalen am Ende tatsächlich publiziert werden. Statistik Austria erhebt die Lebenszufriedenheit im Rahmen von EU-SILC auf einer elfstufigen Skala, gibt in den Veröffentlichungen aber Durchschnittswerte und zusammengefasste Anteile aus, nicht elf einzelne Prozentzahlen.
Daraus lässt sich für die eigene Erhebung eine unbequeme Frage ableiten. Wer elf Stufen abfragt, am Ende jedoch drei Gruppen berichtet, hat vor allem die Antwortlast erhöht. Fünf gut benannte Stufen liefern in solchen Fällen dieselbe Aussage bei geringerem Aufwand für die Befragten.
Likert-Skala dichotomisieren: die Top-Two-Box
In der Marktforschung werden die beiden zustimmenden Stufen häufig zu einer Kennzahl verschmolzen, der Top-Two-Box. Aus „stimme zu“ und „stimme voll und ganz zu“ wird ein einziger Prozentwert, der sich in einer Präsentation gut zeigen lässt.
Zulässig ist das, kostenlos ist es nicht. Jede Zusammenfassung verwischt, ob hinter der Zustimmung überzeugte oder zögerliche Antworten stehen. Gib deshalb beides aus, die Kennzahl und die vollständige Verteilung.
💡 Tipp
Halte je Aussage fest, wie viele Personen sie übersprungen haben. Zwei Mittelwerte sehen in einer Tabelle identisch aus, auch wenn hinter dem einen 40 und hinter dem anderen 120 Antworten stehen.
Typische Fehler bei Likert-Skalen
Die folgenden fünf Fehler begegnen einem in Vereinsumfragen genauso wie in Diplomarbeiten. Sie fallen alle erst in der Auswertung auf, wenn die Antworten schon da sind und sich nichts mehr ändern lässt.
Gemeinsam ist ihnen, dass sie sich vor dem Versand in einer halben Stunde beheben lassen. Danach nicht mehr.
Zustimmung abfragen, wo eine Sachfrage möglich wäre
Skalen vom Typ „stimme zu, stimme nicht zu“ erzeugen systematisch mehr Zustimmung als Skalen, die direkt nach der Sache fragen. Die GESIS Survey Guidelines nennen den Effekt Zustimmungstendenz und empfehlen deshalb, gegenstandsspezifische Skalen zu bevorzugen (Menold und Bogner 2016). Statt „Ich bin mit der Lehrveranstaltung zufrieden: stimme zu“ fragst du besser „Wie zufrieden bist du mit der Lehrveranstaltung: sehr zufrieden bis sehr unzufrieden“.
Nur die beiden Enden beschriften
Eine Skala, bei der links „sehr unzufrieden“ und rechts „sehr zufrieden“ steht und dazwischen nur Zahlen, ist schnell gebaut und schlechter. Vollständig beschriftete Skalen erreichen höhere Zuverlässigkeit und Gültigkeit, und Befragte bevorzugen sie. Besonders profitieren Menschen mit niedrigem oder mittlerem formalem Bildungsabschluss (Menold und Bogner 2016).
Mit Minuswerten nummerieren
Eine Nummerierung von −2 bis +2 sieht symmetrisch aus, wirkt aber nicht so. Befragte meiden die negative Seite und antworten insgesamt positiver, als sie es bei einer Nummerierung von 1 bis 5 täten. Die GESIS Survey Guidelines raten deshalb ausdrücklich von negativen Zahlenwerten in Ratingskalen ab (Menold und Bogner 2016).
Die Skala unterwegs wechseln
Wenn die erste Hälfte deiner Aussagen fünf Stufen hat und die zweite sieben, kannst du beide nicht gemeinsam auswerten. Wie teuer ein solcher Wechsel wird, zeigt der Umstieg von Statistik Austria im Jahr 2013: Danach war die Zeitreihe nur noch eingeschränkt vergleichbar.
Zwei Aussagen in einem Satz
„Die Lehrveranstaltung war gut strukturiert und verständlich“ misst zwei Dinge. Wer die Struktur gut fand und die Erklärungen nicht, kann nicht antworten und kreuzt die Mitte an. Likert hat solche Doppelaussagen bereits 1932 als Ausschlusskriterium beschrieben. Wie du Fragen sauber trennst, steht im Beitrag zu den Fragetypen in Umfragen.
Fazit
Ihren Siegeszug verdankt die Likert-Skala einem sehr nüchternen Umstand: Sie liefert brauchbare Messwerte, ohne dass eine aufwendige Vorstudie nötig wäre. Denselben Umstand büßt sie ein, sobald jemand ihre Schlichtheit für Beliebigkeit hält. Zwei Sätze reichen als Gedächtnisstütze: Ohne mehrere Aussagen gibt es keine Skala, und ohne Wort an jeder Stufe gibt es keine verlässliche Beschriftung. Der Rest, von der Stufenzahl bis zur Mittelkategorie, ist eine begründbare Entscheidung. Ungeprüft übernehmen solltest du dagegen nichts, was gleiche Abstände zwischen den Stufen behauptet. Rensis Likert hat diese Behauptung nie aufgestellt.
Wie es weitergeht
- Du willst die Skalenarten sortieren? Ratingskala: unipolar, bipolar und wie viele Stufen
- Du brauchst das passende Skalenniveau? Skalenniveau bestimmen und richtig rechnen
- Du baust gerade den ganzen Fragebogen? Fragebogen erstellen: Aufbau und Reihenfolge
- Du willst wissen, ob deine Ergebnisse tragen? Objektivität, Reliabilität und Validität
Skala steht, Umfrage fehlt noch?
Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, legst du deine Likert-Aussagen als Matrixfrage an und teilst die Umfrage als Link oder QR-Code.
