empirio.ai

Was ist eine Ratingskala? Definition und Beispiel

Welche Arten von Ratingskalen es gibt, wie viele Stufen deine Skala braucht und welche Kennzahl du am Schluss berichten darfst: der Überblick mit Schweizer Beispielen.

Autorin bei empirio.ai - Maria Malzewvon Maria MalzewAktualisiert am 18. September 2026Lesezeit 15 Min.

Sechs Kästchen in einer Reihe, links die 1, rechts die 6. Wer in der Schweiz zur Schule gegangen ist, weiss ohne Nachdenken, welches Ende gut gemeint ist. Wer ein paar Kilometer nördlich der Grenze aufgewachsen ist, weiss es genauso sicher und liegt damit genau verkehrt.

Eine Ratingskala ist ein abgestuftes Antwortformat, auf dem eine befragte Person markiert, wie stark ein Merkmal bei ihr ausgeprägt ist. Zwischen zwei Endpunkten liegen mehrere Stufen, üblicherweise fünf bis sieben, und jede davon steht für eine Abstufung des subjektiven Eindrucks. Wir zeigen dir, wie du eine solche Skala baust, beschriftest und am Ende auswertest.


📌 Das Wichtigste in Kürze

  • Eine Ratingskala erfasst Abstufungen statt blosser Ja-Nein-Antworten.
  • Schweizer Schulnoten laufen von 1 bis 6, oben liegt die 6.
  • Streng genommen liegt eine Ratingskala auf Ordinalniveau.
  • Fünf bis sieben Stufen gelten als brauchbarer Richtwert.
  • „Weiss nicht“ gehört ans Ende der Liste, nie in die Mitte.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Was ist eine Ratingskala?

Eine Ratingskala ist ein gebundenes Antwortformat mit mehreren geordneten Stufen, auf denen eine befragte Person einschätzt, wie stark ein Merkmal bei ihr zutrifft, etwa von „gar nicht“ bis „völlig“. Das englische rating steht für Bewertung. Im deutschsprachigen Raum kursieren daneben die Namen Einschätzskala, Schätzskala und Bewertungsskala, gemeint ist jedes Mal dasselbe Format.

Knapper bringt es das Lexikon der Psychologie von Hogrefe auf den Punkt: „eine abgestufte, mehrstufige Skala, oft mit etikettierten Kategorien, auf der der Befragte seine Antwort auf eine Frage ausdrücken soll“ (Dorsch, Stichwort Ratingskala). Der Gewinn gegenüber einer Ja-Nein-Frage liegt in den Zwischenstufen. Zwei Gruppen trennen kann jede geschlossene Frage, doch erst die Abstufung zeigt, wie weit jemand zwischen den Polen steht. Unter den Fragetypen in Umfragen ist die Ratingskala deshalb das Arbeitspferd für Einstellungen und Zufriedenheit.

In der Praxis begegnet sie dir in zwei Rollen. Bei der Selbstbeurteilung schätzt jemand die eigene Ausprägung ein, etwa die eigene Konzentration während der Semesterarbeit. Bei der Fremdbeurteilung beurteilt eine andere Person das Merkmal, etwa wenn eine Praktikumsbetreuerin die Selbstständigkeit einer lernenden Person einstuft. Optisch bleibt die Skala identisch, die Fehlerquellen liegen aber woanders.

Eine Ratingskala misst nicht, wie etwas ist, sondern wie es wahrgenommen wird.

Noch eine Abgrenzung, weil sie beim Suchen regelmässig für Verwirrung sorgt: Banken und Ratingagenturen nennen ihre Bonitätsstufen von AAA abwärts ebenfalls Ratingskala, was mit diesem Beitrag nichts zu tun hat. Hier geht es ausschliesslich um das Antwortformat in einer Online-Umfrage oder auf einem gedruckten Fragebogen.

Welches Skalenniveau hat eine Ratingskala?

Streng genommen misst eine Ratingskala ordinal. Die Reihenfolge der Stufen steht fest, die Grösse der Schritte dazwischen nicht, und niemand kann belegen, dass der Weg von „selten“ zu „gelegentlich“ gleich weit ist wie der von „oft“ zu „immer“.

Wie wenig selbstverständlich gleiche Abstände sind, führt die Methodenberatung der Universität Zürich an einem Beispiel vor, das hier alle kennen: „Im Schweizer System ist eine 6 klar besser als eine 3, aber es lässt sich keine numerische Aussage darüber machen, wie viel besser die 6 genau ist. Sie ist nicht doppelt so gut wie eine 3.“ Für die Kästchen in deinem Fragebogen gilt genau dasselbe.

Zur gelebten Praxis schreibt dieselbe Quelle: „Grundsätzlich müssten Antworten auf einer Likert-Skala als ordinalskaliert betrachtet werden, denn es kann nicht zwingend davon ausgegangen werden, dass die Teilnehmer einer Umfrage die Abstände zwischen den Antworten als gleich wahrnehmen.“ Und unmittelbar danach: „Trotzdem werden solche Items in der Praxis oft als intervallskaliert behandelt, wenn die Annahme plausibel erscheint“ (Methodenberatung der Universität Zürich). Das Lehrmaterial der TU Dresden nennt es schlicht „strittig, ob sie auf Ordinal- oder Intervallniveau messen“ (TU Dresden, Methoden der Psychologie).

Auflösen lässt sich der Widerspruch mit einer einzigen Rückfrage: Steht eine einzelne Frage zur Auswertung an oder ein Wert, der aus mehreren Fragen zum selben Merkmal zusammenwächst?

Ratingskala und Likert-Skala sind nicht dasselbe

Jede Likert-Skala ist eine Ratingskala, umgekehrt gilt das nicht. Zur Likert-Bauform gehören eine Zustimmungsdimension, mehrere Aussagen zum selben Merkmal und ein gemeinsamer Wert daraus. Eine einzelne Frage heisst in der Methodenliteratur korrekter Likert-Item und bleibt ordinalskaliert. Was die Bauform darüber hinaus verlangt, steht im Beitrag zur Likert-Skala.

Ein Summenwert über mehrere Items wird dagegen meist wie eine Intervallskala behandelt. Das Zusammenrechnen hebt das Messniveau nicht an, so viel vorweg. Der Grund ist ein anderer: Ein solcher Wert hat viele feine Abstufungen, und die gängigen Verfahren reagieren auf diese Verletzung robust. Eine Annahme bleibt es trotzdem.

Für den Methodenteil

Ein einziger Satz nimmt der Prüfungskommission die Nachfrage vorweg: „Die Antwortstufen wurden als äquidistant behandelt.“ Damit liegt die Annahme offen. Fehlt der Satz, behauptet deine Auswertung stillschweigend ein Messniveau, das die Daten nicht hergeben.

Welche Arten von Ratingskalen gibt es?

Sortieren lassen sich Ratingskalen über drei Gestaltungsfragen: Wie viele Richtungen bildet die Skala ab, womit sind die Stufen markiert und wie fein darf die Antwort ausfallen? Mit diesen drei Fragen lässt sich jede Skala beschreiben, die dir in einem Fragebogen unterkommt.

Wichtig ist die Kombination, nicht die einzelne Eigenschaft. Eine Skala mit zwei Gegenpolen und nackten Zahlen dazwischen verlangt den Befragten etwas ganz anderes ab als fünf Stufen, die alle ein Wort tragen. Gehen wir die drei Fragen der Reihe nach durch.

Unipolar oder bipolar

Vor die Beispiele gehört eine Warnung: Bei Zustimmungsskalen ordnet die Fachliteratur uneinheitlich zu. Die GESIS Survey Guidelines halten ausdrücklich fest, es gebe „keine einheitliche Definition der Polarität in der Literatur“. Wer den Begriff in einer Semesterarbeit verwendet, schreibt am besten dazu, welcher Lesart er folgt.

Eine unipolare Ratingskala bildet ein einziges Merkmal ab, von null bis viel. „Wie stark stört dich der Fluglärm über deinem Quartier?“ mit Stufen von „gar nicht“ bis „sehr stark“ ist so ein Fall. Einen Gegenpol gibt es nicht, es gibt nur mehr oder weniger von einer Sache.

Eine bipolare Ratingskala spannt zwei Gegensätze auf. „Wie erlebst du das Tempo in der Vorlesung?“ reicht von „viel zu langsam“ über die Mitte bis „viel zu schnell“. Beide Enden definieren sich gegenseitig, und die Mitte muss inhaltlich etwas bedeuten, sonst wird sie zum Sammelbecken.

Verbal, numerisch, symbolisch oder grafisch

Sichtbar sind für die Befragten allein die Marken. Die TU Dresden unterscheidet vier Formen, und jede hat ihren Platz.

Art der MarkeWas die Befragten sehenGeeignet für
Verbalein Wort an jeder Stufeden Regelfall, am wenigsten missverständlich
Numerischeine Ziffernreihe, etwa 1 bis 6eingespielte Systeme wie Schulnoten
SymbolischSterne, Smileys, DaumenKinder und kurze Rückmeldungen
Grafischein Punkt auf einer Liniefeine Abstufungen am Bildschirm

Numerisch wirkt eindeutig, ist es aber nur dort, wo ein vertrautes System dahintersteht. Schulnoten sind dafür das Musterbeispiel und zugleich die Falle. Die Maturitätsanerkennungsverordnung hält für die Schweiz fest: „6 ist die höchste, 1 die tiefste Note. Noten unter 4 stehen für ungenügende Leistungen“ (MAV, Art. 26 Abs. 1). In Deutschland und Österreich läuft dieselbe Ziffernreihe umgekehrt, dort ist die 1 die Bestnote. Gleiche Zahlen, benachbarte Länder, entgegengesetzte Bedeutung.

Daraus folgt für deinen Fragebogen mehr als eine Anekdote. Sobald Personen aus mehreren Ländern antworten, trägt eine nackte Zahlenreihe keine gemeinsame Bedeutung mehr. Helfen können Wörter an jeder Stufe oder wenigstens klar benannte Enden, so wie das Bundesamt für Statistik es in der Erhebung SILC macht: eine Skala von 0 („gar nicht zufrieden“) bis 10 („vollständig zufrieden“) (Bundesamt für Statistik, Subjektives Wohlbefinden). Nach demselben Muster arbeitet der Net Promoter Score.

Diskret gestuft oder kontinuierlich

Fast alle Ratingskalen sind diskret gestuft. Eine feste Zahl von Feldern steht zur Wahl, dazwischen liegt nichts. Auf Papier wie am Bildschirm ist das der Normalfall.

Kontinuierliche Ratingskalen setzen stattdessen auf einen Regler oder eine Linie, auf der ein beliebiger Punkt liegen darf. Das Forschungsmethoden-Wiki der RPTU Kaiserslautern-Landau führt diese Bauform als Slider Scale, bei der Befragte „einen Regler auf einer kontinuierlichen Skala“ bewegen (RPTU, Forschungsmethoden-Wiki). In der Schmerzmessung heisst dieselbe Idee visuelle Analogskala. Sinnvoll ist sie praktisch nur online, denn auf Papier müsste am Schluss jemand mit dem Massstab nachmessen.

Fragebogen einer Online-Umfrage mit einer Ratingskala aus fünf abgestuften Antwortmöglichkeiten

Wie viele Stufen sollte eine Ratingskala haben?

Fünf bis sieben Stufen sind die gängige Antwort. Die GESIS Survey Guidelines fassen den Forschungsstand dahin zusammen, dass „eine optimale Messung in Bezug auf die Reliabilität, Validität und den Differenzierungsgrad mit fünf bis sieben Kategorien erreicht werden kann“, und halten fest, dass Befragte genau diesen Bereich bevorzugen (Menold und Bogner 2015, GESIS Survey Guidelines).

Endgültig geklärt ist die Frage damit nicht. Dieselbe Handreichung verweist auf neuere Arbeiten, in denen die Messqualität mit steigender Kategorienzahl weiter zunimmt, geprüft bis 10, 11 und sogar 100 Stufen. Durchgesetzt hat sich die Faustregel dennoch, und zwar aus einem handfesten Grund: Über sieben Stufen findest du kaum noch Wörter, die sich sauber voneinander unterscheiden.

Für deinen eigenen Bogen heisst das: fünf Stufen, wenn jede ein Wort bekommt, und sieben, wenn du feinere Unterschiede brauchst. Unter fünf verlierst du Differenzierung, über sieben die Beschriftung.

Mit Mitte oder ohne

Eine ungerade Stufenzahl bietet eine Mitte an, eine gerade erzwingt eine Seite. Vertretbar ist beides, entscheidend ist die Vorfrage, ob eine mittlere Position inhaltlich überhaupt vorkommt. Bei „Wie zufrieden bist du mit dem Vorlesungsverzeichnis?“ gibt es echte Unentschiedenheit, bei „Würdest du die Exkursion nochmals mitmachen?“ eher nicht.

Laut den GESIS Survey Guidelines raten die meisten Forschenden dazu, die Mitte anzubieten. Dahinter steckt kein Bedürfnis nach Bequemlichkeit, sondern Datenqualität: Ohne Mitte weichen tatsächlich neutrale Personen auf eine Nachbarstufe aus, und die Verteilung kippt in eine Richtung, die es gar nicht gibt. Bezahlt wird das mit der Tendenz zur Mitte, auf die dieser Beitrag weiter unten zurückkommt.

Bei bipolaren Skalen kommt eine Doppeldeutigkeit dazu. Die Mitte kann „weder noch“ bedeuten oder „teils, teils“, und auseinanderhalten lassen sich die beiden nur mit einer abgesetzten Zusatzkategorie wie „Kann ich nicht beurteilen“. Sonst bleibt nur, die Zweideutigkeit bei der Interpretation offen zu benennen. Unipolare Skalen sind hier einfacher, weil ihre Mitte schlicht eine mittlere Ausprägung meint und sich mit einem Wort wie „mittelmässig“ beschriften lässt.

Achtung

„Weiss nicht“ und „keine Angabe“ sind keine Skalenstufen und gehören nicht in die Mitte. Ihr Platz liegt abgesetzt am Ende der Antwortliste, in der Auswertung zählen sie als fehlender Wert. Ob du sie überhaupt anbietest, hängt laut den GESIS Survey Guidelines von Thema, Erhebungsmodus und Zielgruppe ab. Dieselbe Quelle verweist auf Untersuchungen von Sturgis und Kollegen, wonach Befragte ersatzweise die Mittelkategorie ankreuzen. Solche Antworten heissen dort „face saving don't knows“.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Die Stufen beschriften: worauf es bei den Wörtern ankommt

Beschrifte jede Stufe, nicht bloss die beiden Enden. Die GESIS Survey Guidelines sprechen sich „eher für die Verwendung vollverbalisierter Ratingskalen“ aus, weil Reliabilität und Validität dadurch steigen und Befragte diese Form bevorzugen. Am deutlichsten fällt der Unterschied bei Personen mit geringer formaler Bildung aus.

Vier Bedingungen erfüllen brauchbare Stufenwörter. Präzise müssen sie sein, symmetrisch verteilt mit gleich vielen positiven wie negativen Stufen, allgemein verständlich, und ihre Abstände sollten gleich gross wirken. Die letzte Bedingung ist die harte, denn „oft“ und „manchmal“ liegen für verschiedene Menschen unterschiedlich weit auseinander.

Geprüfte Wortlisten für den deutschen Sprachraum

Empirisch bearbeitet hat diese Frage Bernd Rohrmann im Jahr 1978. Er schlug für mehrere Bewertungsdimensionen deutsche Abstufungen vor, deren Abstände möglichst gleichmässig ausfallen. Zwei davon in der Fassung, die das Staatsinstitut für Schulqualität und Bildungsforschung in Bayern wiedergibt (ISB Bayern, Antwortformate):

  • Häufigkeit: nie, selten, gelegentlich, oft, immer
  • Bewertung: trifft gar nicht zu, trifft wenig zu, trifft teils-teils zu, trifft ziemlich zu, trifft völlig zu

Zwei Einschränkungen gehören dazu. Erstens handelt es sich laut derselben Quelle „nicht um feste Regeln, sondern nur um Anhaltspunkte für die Benennung von Antwortstufen“. Zweitens kursieren die Listen in leicht abweichenden Fassungen, weil sie meist aus zweiter Hand zitiert werden. Als Ausgangspunkt für eigene Formulierungen taugen sie trotzdem klar besser als frei erfundene Stufenwörter.

Warum sich Stufenwörter nicht übersetzen lassen

Kalibriert wurden diese Abstufungen für das Deutsche, und darin liegt zugleich ihre Grenze. Eine Wortfolge, deren Abstände im Deutschen gleichmässig wirken, tut das in einer anderen Sprache nicht automatisch, denn übersetzen lässt sich die Bedeutung, nicht die gefühlte Distanz zwischen zwei Wörtern. Wer einen Bogen mehrsprachig ausgibt, auf Deutsch, Französisch und Italienisch, braucht deshalb je Fassung eigene, in dieser Sprache geprüfte Stufenwörter.

Für die Deutschschweiz ist die Lage vergleichsweise bequem, weil die Listen auf Hochdeutsch formuliert sind und Fragebogen hier ohnehin schriftdeutsch ausgegeben werden. Sicherheit bringt trotzdem nur ein kleiner Pretest: fünf Personen ausfüllen lassen und danach fragen, was sie unter der mittleren Stufe verstanden haben. Der halbe Nachmittag ist gut investiert, denn eine missverstandene Stufe siehst du in den Daten nicht mehr.

Tipp

Frag nach der Sache statt nach Zustimmung. Also nicht „Ich nutze Umfragen häufig“ mit einer Zustimmungsskala, sondern „Wie häufig nutzt du Umfragen?“ mit der Häufigkeitsliste von oben. Die GESIS Survey Guidelines raten von Zustimmungsskalen ab, weil sie höhere Zustimmungsraten erzeugen als Skalen, die direkt nach dem Merkmal fragen.

Ratingskala auswerten: welche Kennzahl trägt?

Berichte zuerst die Häufigkeitsverteilung, also die Besetzung jeder einzelnen Stufe. Zulässig ist sie auf jedem Skalenniveau, und sie macht sichtbar, was jede einzelne Kennzahl verdeckt.

Ein Beispiel dafür, dass das keine Formsache ist: Eine Studierendenschaft fragt sechzig Mitglieder auf der vertrauten Skala von 1 bis 6, wie sie die Öffnungszeiten der Bibliothek finden. Zwölf vergeben eine 6, achtzehn eine 5, zwanzig eine 4, sechs eine 3, drei eine 2 und eine Person eine 1. Der Mittelwert liegt bei 4,45, der Median bei 4,5 und der Modus bei 4. Drei Kennzahlen, drei verschiedene Zahlen, und keine davon sagt, dass genau die Hälfte der Antworten oberhalb der 4 liegt. Ob sechzig oder 9'000 Personen antworten, ändert an diesem Muster nichts.

KennzahlWann sie passtWas sie zeigt
HäufigkeitsverteilungimmerBesetzung jeder einzelnen Stufe
Modusimmerdie meistgewählte Stufe
Medianbei einer einzelnen Fragedie mittlere Antwort
Mittelwertbei einem SkalenwertDurchschnitt über mehrere Items
Standardabweichungbei einem Skalenwertwie breit die Antworten streuen
Top-2-Boxfür Berichte und PräsentationenAnteil der beiden obersten Stufen

Verboten ist der Mittelwert damit nicht, er braucht nur eine Begründung. Bei einer einzelnen Frage ist der Median die vorsichtigere Wahl, weil er mit einer blossen Reihenfolge auskommt. Bei einem Skalenwert aus mehreren Items zum selben Merkmal ist der Mittelwert üblich und vertretbar, sofern die Äquidistanz im Methodenteil als Annahme auftaucht.

Dieselbe Zweiteilung gilt für Gruppenvergleiche. Einzelne Fragen vergleichst du rangbasiert, Skalenwerte auch mit Verfahren, die auf Mittelwert und Streuung aufbauen. Wo die Grenze zwischen beschreibender und schliessender Auswertung verläuft, ordnet der Beitrag zu deskriptiver Statistik und Inferenzstatistik ein.

Beliebt ist in Praxisberichten die Top-2-Box. Sie verschmilzt die beiden zustimmendsten Stufen zu einem Prozentwert, im Bibliotheksbeispiel also die 5 und die 6 zu genau 50 Prozent. Zulässig ist das, gratis ist es nicht, denn die Abstufung darunter verschwindet. Wer sie berichtet, stellt die volle Verteilung daneben.

Typische Fehler bei Ratingskalen

Die meisten Schwächen einer Ratingskala entstehen beim Formulieren, nicht beim Rechnen. Antworttendenzen heissen in der Umfrageforschung jene Muster, bei denen Befragte ihre Antwort unabhängig vom Inhalt der Frage in eine bestimmte Richtung verschieben. Betroffen sind nicht alle, doch bei ihnen verläuft die Verschiebung berechenbar in dieselbe Richtung, und deshalb gleicht sie sich nicht aus.

Zusammengefasst finden sich die folgenden vier Muster in den GESIS Survey Guidelines zu Antworttendenzen (Bogner und Landrock 2015). Gegen keines davon hilft eine grössere Stichprobe. Gegen alle hilft ein besserer Fragebogen.

Die Tendenz zur Mitte glättet das Ergebnis

Manche Befragte steuern unabhängig vom Inhalt die mittleren Stufen an, weil eine klare Festlegung mehr Nachdenken kostet. Heraus kommt eine Verteilung, die ausgewogener aussieht, als die Einstellungen es sind. Hilfreich ist eine vollständig beschriftete Skala, weil sie das Nachdenken abkürzt. Scheidet eine mittlere Position inhaltlich aus, ist eine gerade Stufenzahl die einfachste Lösung.

Die Zustimmungstendenz lässt Befragte allem zustimmen

Akquieszenz meint die Neigung, Aussagen unabhängig von ihrem Inhalt zuzustimmen, also überall „ja“ oder „stimme zu“ anzukreuzen. Als wirklich wirksames Gegenmittel nennen die GESIS Survey Guidelines nur eines: auf Zustimmungsskalen zu verzichten und direkt nach dem Merkmal zu fragen. Wer trotzdem dabei bleibt, formuliert die Hälfte der Aussagen umgekehrt. Sichtbar wird die Tendenz dadurch, sauber werden Korrelationen und Faktorstrukturen deswegen aber nicht.

Soziale Erwünschtheit schönt heikle Fragen

Bei Themen, die Befragte als heikel empfinden, rutscht die Antwort in Richtung des Erwarteten. Normverletzendes wird kleingeredet, Normkonformes aufgehübscht. Für Online-Befragungen gibt es dazu eine gute Nachricht: Laut den GESIS Survey Guidelines fällt diese Tendenz schwächer aus, wenn keine interviewende Person dabei ist. Verschwunden ist der Effekt damit nicht, er wird lediglich kleiner.

Extremantworten hängen nicht nur am Thema

Extremantworten sind das Gegenstück zur Tendenz zur Mitte, also die Neigung, unabhängig vom Inhalt die äussersten Stufen zu wählen. Messen lässt sich das als Anteil extremer Antworten über mehrere Ratingskalen hinweg. Ob dahinter ein stabiles Personenmerkmal steckt, ist in der Forschung nicht entschieden. Belegt ist dagegen, dass schriftliche und Online-Befragungen laut den GESIS Survey Guidelines weniger betroffen sind als Telefon- und persönliche Interviews.

Zum Schluss ein unscheinbarer Fehler, der bloss die Optik betrifft. Die Stufen müssen optisch gleich weit auseinanderliegen, sonst fallen die sichtbare und die inhaltliche Mitte der Skala auseinander. Weitere Stellschrauben für sauberere Antworten stehen im Beitrag mit Tipps für Online-Umfragen.

Fazit

Eingebaut ist eine Ratingskala in fünf Minuten und ebenso schnell ruiniert. Fünf vollständig beschriftete Stufen, ein bewusster Entscheid über die Mitte und einer über die Weiss-nicht-Option bringen mehr Datenqualität als hundert zusätzliche Antworten. Bei den Zahlen gilt: Die Verteilung gehört immer in den Bericht, der Mittelwert nur mit Begründung. Und wer numerische Marken verwendet, denkt daran, dass eine 6 nicht überall dasselbe bedeutet.

Wie es weitergeht


Skala einmal ausprobieren, bevor sie rausgeht?

Mit empirio.ai, einem Online-Umfrage-Tool aus Deutschland, legst du eine abgestufte Skala in wenigen Minuten an und siehst nach ein paar Testantworten, ob die Verteilung hergibt, was du berichten möchtest.

Kostenlos mit empirio.ai starten

Häufig gestellte Fragen

Eine Ratingskala ist ein abgestuftes Antwortformat im Fragebogen. Statt nur Ja oder Nein stehen mehrere Stufen zur Wahl, zum Beispiel fünf Stufen von „trifft gar nicht zu“ bis „trifft völlig zu“. Damit hältst du fest, wie stark ein Merkmal bei einer Person ausgeprägt ist. Gebräuchlich sind auch die Namen Einschätzskala und Bewertungsskala.

Ordinalniveau ist die korrekte Einordnung, weil sich gleiche Abstände zwischen den Antwortstufen nicht nachweisen lassen. Die Methodenberatung der Universität Zürich hält fest, dass solche Items in der Praxis dennoch oft als intervallskaliert behandelt werden, sofern die Annahme plausibel erscheint. Für eine einzelne Frage bleibt es bei Ordinalniveau, für einen Skalenwert aus mehreren Items ist die Konvention üblich.

Fünf bis sieben Stufen gelten als Richtwert. Die GESIS Survey Guidelines nennen diesen Bereich als optimal für Reliabilität, Validität und Differenzierungsgrad und verweisen darauf, dass Befragte ihn ebenfalls bevorzugen. Neuere Arbeiten finden auch bei mehr Kategorien noch Zuwächse, getestet bis 100 Stufen. Durchgesetzt hat sich in der Praxis trotzdem die Faustregel fünf bis sieben.

Festgelegt ist die Richtung in der Maturitätsanerkennungsverordnung: 6 ist die höchste, 1 die tiefste Note, und Noten unter 4 stehen für ungenügende Leistungen. In Deutschland und Österreich läuft dieselbe Ziffernreihe umgekehrt, dort ist die 1 die Bestnote. Für Fragebogen heisst das: Nackte Zahlen ohne Wörter sind über Ländergrenzen hinweg missverständlich.

Bei einer einzelnen Frage ist der Median die vorsichtigere Wahl, weil er nur eine Reihenfolge voraussetzt. Bei einem Skalenwert aus mehreren Items zum selben Merkmal ist der Mittelwert üblich und vertretbar, sofern im Methodenteil steht, dass die Antwortstufen als äquidistant behandelt wurden. Die Häufigkeitsverteilung gehört in beiden Fällen in den Bericht.

Jede Likert-Skala ist eine Ratingskala, umgekehrt gilt das nicht. Zur Likert-Bauform gehören eine Zustimmungsdimension, mehrere Aussagen zum selben Merkmal und ein gemeinsamer Wert daraus. Eine einzelne Frage mit fünf Stufen heisst in der Methodenliteratur korrekter Likert-Item. Ratingskala ist der Oberbegriff für alle abgestuften Antwortformate, unabhängig von der Dimension.

Nein, „Weiss nicht“ und „keine Angabe“ sind keine Skalenstufen. Ihr Platz liegt abgesetzt am Ende der Antwortliste, in der Auswertung zählen sie als fehlender Wert. Ob du sie anbietest, hängt laut den GESIS Survey Guidelines von Thema, Erhebungsmodus und Zielgruppe ab. Ohne dieses Angebot weichen manche Befragte ersatzweise auf die Mittelkategorie aus.

Das könnte dich auch interessieren