„Wie gut hat dich die Lehrveranstaltung auf die Prüfung vorbereitet?“ Darunter eine Reihe von fünf Kästchen, links „gar nicht“, rechts „sehr gut“. Wer heuer einen Evaluierungsbogen ausgefüllt hat, kennt diese Reihe. Ihr Fachname lautet Ratingskala.
Eine Ratingskala ist ein abgestuftes Antwortformat, mit dem Befragte angeben, wie stark ein Merkmal bei ihnen ausgeprägt ist. Vorgegeben sind mehrere geordnete Stufen zwischen zwei Endpunkten, üblich sind fünf bis sieben. Wir zeigen dir, wie du Stufenzahl, Beschriftung und Auswertung so festlegst, dass deine Zahlen später tragen.
📌 Kurz zusammengefasst
- Ratingskalen erfassen Abstufungen statt bloßer Ja-Nein-Antworten.
- Fünf bis sieben Stufen empfehlen die GESIS Survey Guidelines.
- Österreichs Notenskala zeigt, wie Vollverbalisierung aussieht.
- Jede Stufe bekommt ein Wort, nicht nur die Endpunkte.
- „Weiß nicht“ steht außerhalb der Skala, nie mittendrin.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Was ist eine Ratingskala?
Eine Ratingskala ist ein geschlossenes Antwortformat aus mehreren geordneten Stufen, auf denen eine befragte Person einträgt, wie stark ein Merkmal bei ihr ausgeprägt ist, etwa von „gar nicht wichtig“ bis „sehr wichtig“. Das englische rating heißt schlicht Bewertung. Im deutschsprachigen Raum laufen dieselben Skalen auch unter Einschätzskala, Schätzskala oder Bewertungsskala.
Warum dieses Format so verbreitet ist, zeigt der Vergleich mit einer Ja-Nein-Frage. Zwei Antwortmöglichkeiten teilen eine Gruppe nur in zwei Lager. Eine Ratingskala hält fest, wie weit jemand zwischen den Enden steht, und genau das brauchst du bei Einstellungen, Zufriedenheit und Selbsteinschätzungen. Unter den Fragetypen im Fragebogen ist sie deshalb der Regelfall. Das Lexikon der Psychologie von Hogrefe beschreibt sie als „eine abgestufte, mehrstufige Skala, oft mit etikettierten Kategorien, auf der der Befragte seine Antwort auf eine Frage ausdrücken soll“ (Dorsch, Stichwort Ratingskala).
Eingesetzt wird sie in zwei Rollen. Bei der Selbstbeurteilung schätzt jemand sich selbst ein, etwa wie sicher er sich beim Programmieren fühlt. Bei der Fremdbeurteilung urteilt eine andere Person, etwa wenn eine Übungsleiterin die Präsentationen ihrer Gruppe bewertet. Der Bogen sieht in beiden Fällen gleich aus, die Fehlerquellen liegen aber woanders.
Eine Ratingskala hält nicht fest, wie die Welt ist, sondern wie jemand sie erlebt.
Eine Verwechslung räumen wir noch aus dem Weg. In der Finanzwelt meint „Ratingskala“ die Bonitätsstufen, mit denen Agenturen das Ausfallrisiko von Schuldnern einordnen. Hier geht es ausschließlich um das Antwortformat, egal ob in einer Online-Umfrage oder auf Papier.
Welches Skalenniveau hat eine Ratingskala?
Streng genommen liegt eine Ratingskala auf Ordinalniveau. Die Reihenfolge der Stufen steht fest, der Abstand zwischen ihnen nicht: Ob der Schritt von „wenig“ zu „mittelmäßig“ derselbe ist wie der von „überwiegend“ zu „völlig“, lässt sich nicht zeigen.
Das Merkblatt der Universität Graz führt beim Bestimmen des Skalenniveaus durch vier Fragen. Frage eins klärt, ob sich die Merkmale überhaupt in eine Reihenfolge bringen lassen. Frage zwei lautet „Ist der Abstand zwischen 2 Ausprägungen gleich groß?“, und bei Nein endet der Weg bei Ordinal (Universität Graz, Tipps zum Bestimmen des Skalenniveaus).
In der Praxis wird trotzdem oft anders gerechnet, und die Lehrmaterialien sagen das auch offen. Die Methodenberatung der Universität Zürich hält fest: „Trotzdem werden solche Items in der Praxis oft als intervallskaliert behandelt, wenn die Annahme plausibel erscheint“ (Methodenberatung der Universität Zürich). Das Lehrmaterial der TU Dresden nennt es schlicht „strittig, ob sie auf Ordinal- oder Intervallniveau messen“ (TU Dresden, Methoden der Psychologie).
Ratingskala oder Likert-Skala: wo der Unterschied liegt
Eine Likert-Skala ist eine Bauform der Ratingskala, keine Konkurrenz dazu. Kennzeichnend sind eine Zustimmungsdimension, mehrere Aussagen zum selben Merkmal und ein gemeinsamer Wert über alle Aussagen. Eine einzelne Frage daraus heißt korrekt Likert-Type-Item und bleibt ordinalskaliert. Was die Bauform sonst noch verlangt, steht im Beitrag zur Likert-Skala.
Ein Summenwert über mehrere Items wird dagegen meist wie eine Intervallskala ausgewertet. Nicht weil das Addieren das Messniveau anheben würde, das tut es nicht. Ausschlaggebend ist, dass so ein Wert viele Abstufungen hat und die gängigen Verfahren sich gegenüber dieser Verletzung als robust erwiesen haben.
Für den Methodenteil deiner Arbeit
Wer aus Antwortstufen einen Mittelwert bildet, schreibt einen Satz dazu: „Die Antwortstufen wurden als äquidistant behandelt.“ Eine Zeile Aufwand, und die Nachfrage in der Defensio ist vorweggenommen. Fehlt der Satz, behauptet deine Auswertung stillschweigend ein Messniveau, das die Daten nicht hergeben.
Welche Arten von Ratingskalen gibt es?
Ratingskalen lassen sich mit drei Fragen vollständig beschreiben: In welche Richtung läuft die Skala, womit sind die Stufen markiert und wie fein darf die Antwort ausfallen? Jede Skala, die dir in einem Fragebogen unterkommt, ist eine Kombination dieser drei Entscheidungen.
Wie gut deine Daten am Ende werden, hängt an genau dieser Kombination. Eine Skala mit zwei gegensätzlichen Enden und nackten Zahlen dazwischen verlangt den Befragten mehr ab als eine Skala, bei der jede der fünf Stufen ein Wort trägt. Gehen wir die drei Fragen der Reihe nach durch.
Unipolar oder bipolar: in welche Richtung die Skala läuft
Vorab eine Warnung: Bei Zustimmungsskalen ist die Zuordnung in der Fachliteratur uneinheitlich. Die GESIS Survey Guidelines halten fest, es gebe „keine einheitliche Definition der Polarität in der Literatur“. Wer eine Skala als unipolar oder bipolar bezeichnet, schreibt deshalb am besten dazu, welcher Definition er folgt.
Eine unipolare Ratingskala bildet ab, wie viel von einer Sache vorhanden ist, von null bis sehr viel. „Wie wichtig ist dir eine Aufzeichnung der Vorlesung?“ mit Stufen von „gar nicht wichtig“ bis „sehr wichtig“ ist so ein Fall. Einen Gegenpol gibt es nicht, nur mehr oder weniger.
Eine bipolare Ratingskala spannt zwei Gegensätze auf. „Das Tempo in der Übung war …“, mit Stufen von „viel zu langsam“ über die Mitte bis „viel zu schnell“, ist das Muster dafür. Beide Enden definieren einander, und die Mitte muss inhaltlich etwas bedeuten.
Wörter, Zahlen, Symbole: womit die Stufen markiert sind
Marken sind das, was die Befragten am Bildschirm tatsächlich sehen. Vier Formen sind gebräuchlich, und die österreichische Notenskala ist das bekannteste Beispiel für die ersten beiden zugleich. Laut Schulunterrichtsgesetz sind „folgende Beurteilungsstufen (Noten) zu verwenden: Sehr gut (1), Gut (2), Befriedigend (3), Genügend (4), Nicht genügend (5)“ (SchUG § 18 Abs. 2 im RIS).
Methodisch gesehen ist das eine fünfstufige, vollverbalisierte unipolare Skala mit Zahl und Wort an jeder Stufe. Sie erfüllt damit fast alles, was die Methodenliteratur empfiehlt. Beachte nur die Richtung: Oben steht die 1, nicht die 5. In Deutschland läuft dieselbe Skala über sechs Stufen bis zur 6, weshalb sich Notenschnitte aus beiden Ländern nicht ohne Umrechnung vergleichen lassen.
| Art der Marke | Beispiel | Wofür sie taugt |
|---|---|---|
| Verbal | sehr gut bis nicht genügend | Standardfall, am wenigsten missverständlich |
| Numerisch | Noten von 1 bis 5 | vertraute Systeme, sonst deutungsoffen |
| Symbolisch | Sterne, Smileys, Daumen | Kinder und kurze Feedbackfragen |
| Grafisch | Schieberegler ohne Rasterung | feine Abstufungen, nur am Bildschirm |
Zahlen allein wirken eindeutig, sind es aber selten. Bei den Schulnoten weiß jede Person, die hier zur Schule gegangen ist, wo oben und unten liegt. Bei einer Skala von 1 bis 7 ohne jedes Wort muss sie raten, und zwei Befragte legen dieselbe Ziffer verschieden aus. Der Net Promoter Score mit seiner Spanne von 0 bis 10 ist der prominenteste Vertreter dieser Bauart.
Diskret gestuft oder kontinuierlich: wie fein die Antwort ausfällt
Fast alle Ratingskalen sind diskret gestuft. Eine feste Zahl von Kästchen steht zur Wahl, dazwischen liegt nichts. Kontinuierliche Skalen arbeiten stattdessen mit einem Regler oder einer Linie, auf der jeder Punkt möglich ist. Das Forschungsmethoden-Wiki der RPTU Kaiserslautern-Landau führt sie als Slider Scale, bei der Befragte „einen Regler auf einer kontinuierlichen Skala“ bewegen (RPTU, Forschungsmethoden-Wiki).
In der Medizin heißt dieselbe Idee visuelle Analogskala und dient der Schmerzmessung. Sinnvoll ist die Bauform praktisch nur online, weil auf Papier hinterher jemand mit dem Lineal nachmessen müsste.

Wie viele Stufen sollte eine Ratingskala haben?
Fünf bis sieben Stufen sind der Richtwert. Die GESIS Survey Guidelines fassen den Forschungsstand so zusammen, dass „eine optimale Messung in Bezug auf die Reliabilität, Validität und den Differenzierungsgrad mit fünf bis sieben Kategorien erreicht werden kann“, und halten fest, dass Befragte diese Länge selbst bevorzugen (Menold und Bogner 2015, GESIS Survey Guidelines).
Erledigt ist die Frage damit nicht. Dieselbe Handreichung verweist auf neuere Arbeiten, in denen die Messqualität mit steigender Kategorienzahl weiter zunimmt, geprüft bis 10, 11 und sogar 100 Stufen. Durchgesetzt hat sich die Faustregel dennoch, und zwar aus einem handfesten Grund: Mehr als sieben Stufen lassen sich kaum noch sinnvoll benennen.
Mit Mitte oder ohne: die Entscheidung über die mittlere Stufe
Eine ungerade Stufenzahl bietet eine Mitte an, eine gerade erzwingt eine Richtung. Vertretbar ist beides, und die Wahl hängt daran, ob eine mittlere Haltung inhaltlich überhaupt vorkommt. Bei „Wie zufrieden bist du mit der Betreuung deiner Diplomarbeit?“ gibt es echte Unentschiedenheit, bei „Würdest du diese Studienrichtung weiterempfehlen?“ eher nicht.
Die GESIS Survey Guidelines fassen zusammen, dass die meisten Forschenden zur Mittelkategorie raten. Der Grund ist Datenqualität: Ohne Mitte weichen wirklich neutrale Befragte auf eine Nachbarstufe aus und schieben das Ergebnis in eine Richtung, die es gar nicht gibt. Erkauft wird das mit der Tendenz zur Mitte, zu der weiter unten mehr steht.
Bei bipolaren Skalen kommt eine Doppeldeutigkeit dazu. Die Mitte kann „weder noch“ heißen oder „teils, teils“, also Gleichgültigkeit oder Zerrissenheit. Auflösen lässt sich das nur mit einer abgesetzten Zusatzkategorie wie „Kann ich nicht beurteilen“.
Was eine gerade Stufenzahl in der Praxis anrichtet
Ein Beispiel aus der amtlichen Statistik zeigt, wie eine bewusst mittellose Skala aussieht. Statistik Austria erhob im EU-SILC-Modul 2013 das subjektive Sicherheitsgefühl und stellte dafür vier Stufen zur Wahl: „sehr sicher“, „ziemlich sicher“, „etwas unsicher“ und „sehr unsicher“ (Oismüller und Till, Statistische Nachrichten 12/2015). Wer antwortet, muss sich für eine Seite entscheiden.
Sinnvoll ist das hier, weil die Frage auf eine Tendenz zielt und nicht auf langes Abwägen. Für Einstellungsfragen, bei denen echte Unentschiedenheit selbst ein Ergebnis wäre, wäre dieselbe Bauform ein Fehler.
Achtung bei der Weiß-nicht-Kategorie
„Weiß nicht“ und „keine Angabe“ sind keine Skalenstufen und haben in der Mitte nichts verloren. Ihr Platz ist abgesetzt am Ende der Antwortliste, in der Auswertung zählen sie als fehlender Wert. Ob du sie überhaupt anbietest, hängt laut den GESIS Survey Guidelines von Thema, Erhebungsmodus und Zielgruppe ab. Dieselbe Quelle verweist auf Sturgis und Kollegen: Fehlt die Option, nutzen Befragte die Mittelkategorie als Ersatz, dort „face saving don't knows“ genannt.
Kostenlos Umfrage erstellen
Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.
- Umfrage per KI
- Per Drag & Drop anpassen
- Auswertung in Echtzeit
Die Stufen beschriften: welche Wörter taugen
Beschrifte jede Stufe, nicht bloß die beiden Enden. Die GESIS Survey Guidelines sprechen sich „eher für die Verwendung vollverbalisierter Ratingskalen“ aus, weil sie Reliabilität und Validität erhöhen und von Befragten bevorzugt werden. Besonders deutlich wird der Unterschied bei Personen mit geringer formaler Bildung.
Brauchbare Stufenwörter erfüllen vier Bedingungen. Sie sind präzise, sie verteilen sich symmetrisch auf beide Seiten der Mitte, sie sind allgemein verständlich und ihre Abstände wirken gleich groß. Die letzte Bedingung ist die harte, denn „oft“ und „manchmal“ liegen für verschiedene Menschen unterschiedlich weit auseinander, und beim Ankreuzen merkt das niemand.
Bernd Rohrmann hat 1978 genau daran gearbeitet und für mehrere Bewertungsdimensionen deutsche Abstufungen vorgeschlagen, deren Abstände möglichst gleichmäßig ausfallen. Vier dieser Listen gibt das Staatsinstitut für Schulqualität und Bildungsforschung in Bayern so wieder (ISB Bayern, Antwortformate):
- Häufigkeit: nie, selten, gelegentlich, oft, immer
- Intensität: gar nicht, wenig, mittelmäßig, überwiegend, völlig
- Wahrscheinlichkeit: keinesfalls, wahrscheinlich nicht, vielleicht, ziemlich wahrscheinlich, ganz sicher
- Bewertung: trifft gar nicht zu, trifft wenig zu, trifft teils-teils zu, trifft ziemlich zu, trifft völlig zu
Zwei Einschränkungen gehören dazu. Laut derselben Quelle handelt es sich „nicht um feste Regeln, sondern nur um Anhaltspunkte für die Benennung von Antwortstufen“. Außerdem kursieren die Listen in leicht abweichenden Fassungen, weil sie fast immer aus zweiter Hand zitiert werden. Als Ausgangspunkt taugen sie trotzdem weit besser als selbst erfundene Wörter.
Eine Skala aus dem Feld, an der du dich anlehnen kannst
Wie eine vollverbalisierte Häufigkeitsskala in einer großen österreichischen Erhebung aussieht, zeigt dasselbe EU-SILC-Modul. Statistik Austria fragte „Wie oft waren Sie während der letzten vier Wochen glücklich?“ und gab fünf benannte Stufen vor: immer, meistens, manchmal, selten, nie. Fünf Stufen, jede mit einem Wort, und die Frage zielt auf die Sache statt auf Zustimmung.
Ein Hinweis für alle, die mehrsprachig erheben: Solche Wortlisten sind an ihre Sprache gebunden. Eine für das Deutsche kalibrierte Abstufung bleibt nach einer Übersetzung nicht gleichabständig. Übernimm sie also nie einfach, sondern greif auf im Zielland etablierte Formulierungen zurück oder teste deine eigenen vorab.
Tipp
Frag nach der Sache, nicht nach Zustimmung. Also nicht „Ich nutze Umfragen häufig“ mit einer Zustimmungsskala, sondern „Wie oft nutzt du Umfragen?“ mit der Häufigkeitsskala von oben. Die GESIS Survey Guidelines raten von Zustimmungsskalen ab, weil sie höhere Zustimmungsraten erzeugen als Skalen, die direkt nach dem Merkmal fragen.
Ratingskala auswerten: welche Kennzahl trägt?
Berichte zuerst die Häufigkeitsverteilung, also wie viele Personen jede Stufe gewählt haben. Diese Angabe ist auf jedem Skalenniveau zulässig, sie geht beim Zusammenfassen nie verloren und sie zeigt Dinge, die jede einzelne Kennzahl verdeckt.
Ein Kletterverein fragt im Jänner zwanzig Mitglieder, wie zufrieden sie mit den Trainingszeiten sind, auf einer Skala von 1 bis 6. In der einen Gruppe kreuzen zehn Personen die 3 an und zehn die 4. In der anderen wählen zehn die 1 und zehn die 6. Beide Male liegt der Mittelwert bei 3,5 und der Median ebenfalls bei 3,5. Erst die Streuung trennt die Fälle: rund 0,5 gegenüber rund 2,6. Die eine Gruppe ist sich einig, die andere zerfällt in zwei Lager.
| Kennzahl | Wann sie passt | Was sie zeigt |
|---|---|---|
| Häufigkeitsverteilung | immer | Besetzung jeder einzelnen Stufe |
| Modus | immer | die meistgewählte Stufe |
| Median | beim Einzelitem | die mittlere Antwort |
| Mittelwert | beim Wert aus mehreren Items | Durchschnitt über alle Items |
| Standardabweichung | beim Wert aus mehreren Items | wie weit die Antworten auseinanderliegen |
| Top-2-Box | für Präsentationen | Anteil der beiden obersten Stufen |
Wann der Mittelwert durchgeht und wann nicht
Verboten ist der Mittelwert nicht, er braucht nur eine Begründung. Bei einem einzelnen Item ist der Median die vorsichtigere Wahl, weil er ausschließlich eine Reihenfolge voraussetzt. Bei einem Skalenwert aus mehreren Items zum selben Merkmal ist der Mittelwert üblich und vertretbar, sofern die Äquidistanz im Methodenteil als Annahme benannt wird.
Für Gruppenvergleiche gilt dieselbe Zweiteilung: Einzelitems vergleichst du mit rangbasierten Verfahren, Skalenwerte auch mit Verfahren, die auf Mittelwert und Streuung aufbauen. Wo die Grenze zwischen beschreibender und schließender Auswertung verläuft, ordnet der Beitrag zur deskriptiven Statistik und Inferenzstatistik ein.
Die Top-2-Box begegnet dir in jedem Praxisbericht. Sie fasst die beiden zustimmendsten Stufen zu einem Prozentwert zusammen, etwa „81 Prozent sind zufrieden oder sehr zufrieden“. Zulässig ist das, kostet aber Information. Wer sie berichtet, stellt die vollständige Verteilung in den Anhang.
Typische Fehler bei Ratingskalen
Die meisten Schwächen einer Ratingskala entstehen beim Formulieren, nicht beim Rechnen. Antworttendenzen heißt in der Umfrageforschung das Muster, dass Befragte ihre Antworten unabhängig vom Inhalt der Frage in eine Richtung verschieben. Betroffen sind nicht alle, aber bei den Betroffenen läuft die Verschiebung berechenbar in dieselbe Richtung.
Weil Antworttendenzen sich nicht herausmitteln, hilft gegen sie keine größere Stichprobe, wohl aber ein besserer Fragebogen. Die folgenden vier Muster sind gut dokumentiert und in den GESIS Survey Guidelines zu Antworttendenzen zusammengefasst (Bogner und Landrock 2015).
Die Tendenz zur Mitte zieht alles in die Skalenmitte
Manche Befragte wählen unabhängig vom Inhalt die mittleren Stufen, weil eine klare Festlegung mehr Nachdenken kostet. Das Ergebnis wirkt ausgewogener, als die Einstellungen tatsächlich sind. Eine vollständig beschriftete Skala hilft dagegen, weil sie das Nachdenken erleichtert. Wenn eine mittlere Position inhaltlich ohnehin ausscheidet, ist eine gerade Stufenzahl die einfachste Antwort.
Die Zustimmungstendenz nickt alles ab
Akquieszenz nennt die Fachliteratur die Neigung, Aussagen unabhängig vom Inhalt zuzustimmen, also überall „ja“ oder „stimme zu“ anzukreuzen. Die GESIS Survey Guidelines nennen nur ein wirklich wirksames Gegenmittel: auf Zustimmungsskalen verzichten und direkt nach dem Merkmal fragen. Wer bei Zustimmungsskalen bleibt, dreht die Hälfte der Aussagen um. Sichtbar wird die Tendenz dadurch, gerettet sind Korrelationen und Faktorstrukturen damit aber nicht.
Soziale Erwünschtheit schönt heikle Fragen
Bei Themen, die Befragte als sensibel empfinden, kommt die erwartete Antwort statt der zutreffenden. Normverletzendes wird kleingeredet, Normkonformes aufgebauscht. Für Online-Befragungen gibt es eine gute Nachricht: Die GESIS Survey Guidelines halten fest, dass diese Tendenz schwächer ausfällt, wenn keine interviewende Person dabei ist. Verschwinden tut der Effekt dadurch nicht.
Extremantworten sind nicht bloß Geschmackssache
Extremantworten sind das Gegenstück zur Tendenz zur Mitte, also der Hang zu den äußersten Stufen, unabhängig vom Inhalt. Messen lässt sich das als Anteil extremer Antworten über mehrere Ratingskalen hinweg. Ob dahinter ein stabiles Personenmerkmal steckt, ist in der Forschung nicht entschieden. Belegt ist dagegen, dass schriftliche und Online-Befragungen laut den GESIS Survey Guidelines weniger betroffen sind als Telefon- und persönliche Interviews.
Ein letzter, leicht übersehener Fehler betrifft die Optik: Die Stufen müssen auch sichtbar gleich weit auseinanderliegen, sonst fallen die optische und die inhaltliche Mitte auseinander. Weitere Stellschrauben für sauberere Antworten stehen im Beitrag mit Tipps für Online-Umfragen.
Fazit
Ratingskalen sind in zwei Minuten eingebaut und in denselben zwei Minuten verdorben. Entscheidend sind drei Festlegungen: die Zahl der Stufen, die Wörter an jeder einzelnen Stufe und der Umgang mit der Weiß-nicht-Option. Wer diese drei begründet trifft, gewinnt mehr Datenqualität als mit hundert zusätzlichen Antworten.
Beim Auswerten bleibt es dabei: Die Verteilung gehört in jeden Bericht, der Mittelwert nur mit einem Satz Begründung im Methodenteil. Ein Vorbild für eine saubere fünfstufige Skala hängt in Österreich übrigens in jedem Klassenzimmer.
Wie es weitergeht
- Alle Messniveaus im Zusammenhang? Skalenniveau bestimmen
- Zustimmungs-Items im Fragebogen? Likert-Skala
- Noch auf der Suche nach dem Antwortformat? Fragetypen im Fragebogen
- Stimmung im Team messen? Mitarbeiterzufriedenheit messen
Willst du deine Skala ausprobieren, bevor sie rausgeht?
Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, baust du eine abgestufte Skala in wenigen Minuten, schickst sie an fünf Testpersonen und siehst sofort, wie sich die Antworten auf die Stufen verteilen.
