empirio.ai

Deskriptive Statistik & Inferenzstatistik: Leitfaden

Deskriptive Statistik sagt, was in deinen Daten steht. Wann das reicht, wann du weiterrechnen musst und wie du sie von der Inferenzstatistik trennst.

Autorin bei empirio.ai - Maria Malzewvon Maria MalzewAktualisiert am 7. September 2026Lesezeit 12 Min.

Die Umfrage ist durch, 52 Antworten liegen als Tabelle vor. Und dann? Der erste Griff geht meistens zum Durchschnitt, bevor überhaupt geklärt ist, ob diese Antworten einen Durchschnitt zulassen.

Deskriptive Statistik verdichtet die Fälle, die du erhoben hast, auf Kennzahlen wie Modus, Median und Standardabweichung. Inferenzstatistik geht weiter und schätzt aus dieser Stichprobe, wie es in der Grundgesamtheit vermutlich aussieht, zusammen mit einer Fehlerspanne für diese Schätzung. Danach erkennst du, welche Kennzahl deine Daten zulassen und wann der zweite Schritt gar nicht nötig ist.


📌 Das Wichtigste im Überblick

  • Deskriptive Statistik beschreibt die Stichprobe, Inferenzstatistik schätzt die Grundgesamtheit.
  • Der Modus passt auf jedem Skalenniveau, der Durchschnitt erst ab metrisch.
  • Beschreibst du nur deine Gruppe, brauchst du keinen Signifikanztest.
  • Ein Ausreisser verschiebt den Durchschnitt deutlich, den Median kaum.
  • Das BFS nennt zu jeder Schätzung eine Fehlerspanne.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Was ist deskriptive Statistik?

Deskriptive Statistik ist jener Teil der Statistik, der einen vorliegenden Datensatz ordnet und zusammenfasst, ohne über ihn hinauszugehen. Was sie liefert, gilt für die erhobenen Fälle und für sonst niemanden.

Diese enge Grenze wirkt harmlos, trägt aber die halbe Auswertung. Rohdaten mit 200 Zeilen sagen niemandem etwas. Sobald daraus wenige Kennzahlen und eine Abbildung werden, zeigt sich, wo die Mitte liegt, wie breit die Antworten streuen und ob zwei Merkmale zusammenhängen. Auf genau diese drei Fragen antworten die drei Gruppen von Kennzahlen.

Zur deskriptiven Statistik gehört auch die Darstellung: Häufigkeitstabelle, Säulen- und Kreisdiagramm, Histogramm, Boxplot. Massgeblich ist die Aussage, nicht das Menü der Software. Nicola Döring ordnet die Datenanalyse in ihrem Lehrbuch Forschungsmethoden und Evaluation in den Sozial- und Humanwissenschaften (6. Auflage, Springer 2023, Kapitel 12) in dieser Reihenfolge: erst beschreiben, danach prüfen. Wo der Schritt im gesamten Ablauf steht, zeigt der Überblick zur empirischen Forschung.

Deskriptive Statistik und Inferenzstatistik: der Unterschied

Der Unterschied zwischen deskriptiver Statistik und Inferenzstatistik betrifft die Reichweite der Aussage. Die deskriptive Statistik spricht ausschliesslich über die Befragten. Die Inferenzstatistik spricht über alle, für die diese Befragten stehen sollen, und beziffert dabei ihre eigene Unsicherheit.

Andere Namen für die Inferenzstatistik lauten schliessende und induktive Statistik, seltener beurteilende Statistik. Gemeint ist immer dasselbe: der Schluss von der Stichprobe auf die Grundgesamtheit. Zwei Aufgaben stecken darin: Kennwerte der Grundgesamtheit schätzen, meist als Vertrauensintervall, und Hypothesen zu Unterschieden oder Zusammenhängen prüfen. Beschreiben lässt sich jeder Datensatz. Verallgemeinern darfst du nur jenen, dessen Auswahl das zulässt.

Beide Teile hängen enger zusammen, als es zunächst wirkt. Ohne saubere Beschreibung bleibt unbemerkt, dass eine Verteilung schief liegt, ein einzelner Wert alles verzerrt oder eine Vergleichsgruppe aus drei Personen besteht. Alle drei Punkte entscheiden darüber, welcher Test überhaupt zulässig bleibt. Deshalb eröffnet die Beschreibung den Ergebnisteil.

Die Kennzahlen der deskriptiven Statistik

Die Kennzahlen der deskriptiven Statistik teilen sich in drei Gruppen: Lagemasse für die Mitte, Streuungsmasse für die Breite, Zusammenhangsmasse für die Beziehung zweier Merkmale. Wer nur eine Gruppe berichtet, legt eine halbe Auswertung vor.

Als Beispiel dient eine Erhebung im Sportverein: 14 Mitglieder haben angegeben, wie viele Franken sie im Monat für Ausrüstung ausgeben. Geordnet lauten die Antworten 0, 10, 20, 20, 20, 30, 30, 40, 50, 60, 80, 100, 120 und 400 Franken. Eine Person hat gerade ein Velo gekauft, und an dieser Antwort zeigt sich jede Kennzahl.

Lagemasse: Modus, Median und Durchschnitt

Lagemasse geben die Mitte einer Verteilung an. Der Modus ist der häufigste Wert, hier 20 Franken mit drei Nennungen. Kommen zwei Werte gleich oft vor, gibt es zwei Modi, und bei lauter verschiedenen Werten sagt der Modus gar nichts. Der Median liegt in der Mitte der geordneten Reihe, bei 14 Werten also zwischen dem siebten und achten: 35 Franken. Das arithmetische Mittel ergibt sich aus 980 Franken geteilt durch 14, also genau 70 Franken.

Eine Frage, drei sehr verschiedene Zahlen. Verursacht wird die Spreizung von den 400 Franken. Ohne diesen Wert sinkt der Durchschnitt von 70 auf rund 45 Franken, während der Median lediglich von 35 auf 30 Franken zurückgeht. Der Durchschnitt reagiert also empfindlich auf einzelne Ausreisser, der Median kaum. Bei Ausgaben, Löhnen und Wartezeiten berichtest du deshalb beide Werte nebeneinander.

Streuungsmasse: Spannweite, Varianz und Standardabweichung

Streuungsmasse beziffern, wie weit die Werte auseinanderliegen. Die Spannweite ist der Abstand zwischen grösstem und kleinstem Wert, hier 400 minus 0, also 400 Franken. Die Varianz bündelt die Abweichungen vom Durchschnitt: Du quadrierst jede Abweichung, summierst alles und teilst durch n minus 1. Der Abzug von eins ist der übliche Weg, solange deine Daten eine Stichprobe sind und nicht die ganze Grundgesamtheit. Die Standardabweichung ist die Wurzel aus der Varianz und beträgt hier rund 100 Franken.

Varianz und Standardabweichung werden häufig vermischt, obwohl die Unterscheidung einfach ist: Die Varianz steht in quadrierten Einheiten und lässt sich nicht anschaulich lesen, die Standardabweichung steht in Franken und darf neben dem Durchschnitt stehen. Auch hier wirkt der Ausreisser stark. Ohne die 400 Franken fällt die Standardabweichung von rund 100 auf rund 36 Franken.

Zusammenhangsmasse: welcher Koeffizient zu welchen Daten passt

Zusammenhangsmasse zeigen, wie stark zwei Merkmale gemeinsam schwanken. Die Wahl hängt am Skalenniveau: Pearsons r bei zwei metrischen Merkmalen, Spearmans Rangkorrelation, sobald eines nur ordinal vorliegt, Cramérs V bei zwei nominalen Merkmalen. Pearson und Spearman liegen zwischen minus 1 und plus 1, Cramérs V zwischen 0 und 1. Der ebenfalls verbreitete Kontingenzkoeffizient erreicht die 1 nur in seiner korrigierten Form, deshalb ist Cramérs V die sicherere Wahl.

⚠️ Achtung

Ein hoher Korrelationskoeffizient beweist keine Ursache. Er zeigt nur, dass zwei Merkmale gemeinsam schwanken. Schreibe deshalb „hängt zusammen mit“ und nicht „führt zu“, solange dein Design keine Wirkrichtung absichert. Pearsons r erfasst zudem nur geradlinige Zusammenhänge, ein Wert nahe null schliesst einen starken, aber gekrümmten Zusammenhang also nicht aus. Vor die Korrelation gehört deshalb immer ein Streudiagramm.

Welches Mass darfst du bei welchem Skalenniveau rechnen?

Zulässig ist, was das Skalenniveau der Variable erlaubt, und nicht alles, was die Software berechnet. Excel liefert ohne Murren einen Durchschnitt für eine Variable, in der 1 für Zürich, 2 für Bern und 3 für Lugano steht. Brauchbar ist diese Zahl trotzdem nicht.

Die Einteilung stammt vom Psychologen Stanley Smith Stevens, der 1946 in Science vier Skalentypen unterschied und für jeden bestimmte, welche Kennzahlen aussagekräftig bleiben (Stevens 1946). Die folgende Tabelle gibt die heute übliche Lesart wieder, die Stevens an einzelnen Stellen erweitert. Kritik daran gibt es seit den Neunzigerjahren: Als starre Regel gelesen, führen die vier Typen in Grenzfällen in die Irre.

SkalenniveauErlaubte LagemasseErlaubte Streuungsmasse
NominalskalaModuskeines im engeren Sinn, berichtet werden Häufigkeiten und Anteile
OrdinalskalaModus, MedianQuartile, Perzentile
Intervallskalazusätzlich arithmetisches MittelSpannweite, Varianz, Standardabweichung
Verhältnisskalazusätzlich geometrisches Mittelzusätzlich Variationskoeffizient

Zu lesen ist die Tabelle kumulativ: Was ein tieferes Niveau erlaubt, bleibt auf jedem höheren erlaubt. Der Modus passt deshalb überall, das arithmetische Mittel erst ab der Intervallskala. Wie du das Niveau deiner eigenen Variablen bestimmst, erklärt der Beitrag zum Skalenniveau.

Reibung entsteht regelmässig bei der Zustimmungsskala von „stimme gar nicht zu“ bis „stimme voll zu“. Formal bleibt sie ordinal, denn dass alle Befragten die Abstände zwischen den Stufen gleich gross erleben, lässt sich nicht belegen. Die Forschungspraxis behandelt solche Items dennoch oft metrisch, vor allem wenn mehrere davon zu einer Skala verrechnet werden. Vertretbar bleibt das nur bei symmetrischen, vollständig beschrifteten Stufen, und die Entscheidung gehört begründet in den Methodenteil. Ausführlich behandelt das der Beitrag zur Likert-Skala.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Wann du gar keine Inferenzstatistik brauchst

Inferenzstatistik erübrigt sich, sobald niemand auf eine grössere Gruppe schliessen will. Ein Signifikanztest existiert einzig, um von einer Stichprobe auf eine Grundgesamtheit zu verallgemeinern. Fehlt dieser Zweck, fehlt der Grund für den Test.

Am deutlichsten wird das bei einer Vollerhebung. Antworten für deine Maturaarbeit alle 19 Personen deiner Klasse und willst du über genau diese 19 Personen etwas aussagen, hast du die Grundgesamtheit vollständig erfasst. Dass 12 von 19 den späteren Termin bevorzugen, ist dann keine Schätzung mit Fehlerspanne, sondern das Resultat. Antwortet nur ein Teil, ist es keine Vollerhebung mehr, sondern eine Auswahl, die sich selbst zusammengestellt hat.

Eine Grenze hat diese Regel trotzdem, und sie gehört in den Methodenteil. Sie gilt, solange sich deine Aussage auf genau diese Gruppe zu genau diesem Zeitpunkt beschränkt. Sobald du das Resultat als Hinweis auf etwas Dahinterliegendes liest, etwa auf künftige Mitglieder oder auf eine Ursache, arbeitest du wieder mit einem Modell und darfst Vertrauensintervalle berichten. In der Methodenliteratur läuft dieser Fall unter dem Stichwort Superpopulation.

💡 Tipp

Halte im Methodenteil fest, warum kein Test folgt: „Da eine Vollerhebung der Grundgesamtheit vorliegt, wird auf inferenzstatistische Verfahren verzichtet.“ Im Kolloquium wirkt dieser Satz stärker als ein Test ohne Adressaten.

Der zweite Fall ist die Gelegenheitsstichprobe. Wer den Link in drei WhatsApp-Gruppen und ins eigene Instagram-Profil stellt, hat nicht zufällig ausgewählt, sondern die Erreichbaren befragt. Ein Test lässt sich auf solchen Daten zwar rechnen, sein Ergebnis reicht aber nicht über die Befragten hinaus. Diese Grenze gehört offen in die Limitationen, und genau dort holt man Punkte. Was eine Stichprobe methodisch trägt und ab wann eine Befragung repräsentativ heisst, klären die beiden verlinkten Beiträge.

Was der p-Wert sagt und was nicht

Der p-Wert beziffert, wie wahrscheinlich ein Ergebnis wie deines oder ein extremeres wäre, falls die Nullhypothese zuträfe und alle übrigen Annahmen deines Modells erfüllt wären, etwa die Zufallsauswahl. Er beschreibt die Daten unter diesen Annahmen, nicht die Annahmen selbst. Ein kleiner p-Wert kann deshalb auch bedeuten, dass eine dieser Annahmen nicht stimmt.

Die American Statistical Association hat 2016 sechs Grundsätze zum p-Wert publiziert, weil die Fehldeutungen in der Fachliteratur überhandnahmen. Grundsatz zwei ist unmissverständlich: „P-values do not measure the probability that the studied hypothesis is true …“ (Wasserstein und Lazar 2016). Der Satz räumt anschliessend die zweite verbreitete Fehldeutung ab: Der p-Wert sagt ebenso wenig, wie wahrscheinlich es ist, dass dein Ergebnis reiner Zufall war. Ein p von 0,03 heisst also nicht, dass deine Hypothese zu 97 Prozent zutrifft. Was bei deinen eigenen zwei Gruppen herauskommt, liefert der p-Wert-Rechner, die Deutung bleibt dennoch bei dir.

Ebenso wenig misst der p-Wert die Grösse oder die Bedeutung eines Effekts, so der fünfte Grundsatz derselben Stellungnahme. Bei grossen Stichproben kann auch ein winziger, praktisch belangloser Unterschied signifikant werden. Neben dem p-Wert gehört daher immer eine Effektstärke in den Ergebnisteil, nach Möglichkeit ergänzt um ein Vertrauensintervall.

Wie die amtliche Statistik damit umgeht

Wie ernsthaft mit Unsicherheit umgegangen wird, zeigt die Schweizerische Arbeitskräfteerhebung des Bundesamts für Statistik. Zu jeder Schätzung weist das BFS eine Fehlerspanne aus und hält fest, dass mit kleinerer Stichprobe die Fehlermarge zunimmt (BFS, Konzepte und methodische Grundlagen der SAKE). Für die eigene Arbeit folgt daraus: Eine Zahl ohne Angabe zu ihrer Genauigkeit ist noch keine fertige Zahl. Wie du deine Annahmen vorher sauber formulierst, zeigt der Beitrag zum Hypothesen aufstellen.

Deskriptive Statistik im Ergebnisteil deiner Arbeit

Der Ergebnisteil einer Matura-, Bachelor- oder Masterarbeit beginnt mit der deskriptiven Statistik, und zwar mit der Stichprobenbeschreibung: Fallzahl, Rücklauf, Verteilung nach Alter, Geschlecht, Semester oder was deine Fragestellung verlangt. Erst danach folgen die Kennzahlen der inhaltlichen Variablen und zuletzt die Hypothesenprüfung.

Für die Darstellung genügt eine Faustregel: Was in zwei Sätzen gesagt ist, bleibt im Text. Was mehr als drei Werte umfasst, gehört in eine Tabelle. Was eine Verteilung oder einen Verlauf sichtbar machen soll, wird zur Abbildung. Jede Tabelle führt n und die zum Skalenniveau passenden Kennzahlen, bei metrischen Variablen also Durchschnitt und Standardabweichung, bei nominalen die Häufigkeiten. Jede Abbildung trägt beschriftete Achsen mit Einheit.

Womit du rechnest

Für Lage- und Streuungsmasse reicht eine Tabellenkalkulation aus. SPSS ist an vielen Hochschulen gesetzt, kostet aber Lizenzgebühren; JASP und jamovi sind kostenlos, bedienen sich ähnlich und decken die Verfahren ab, die in einer Bachelorarbeit üblicherweise vorkommen. R und Python lohnen sich, wenn du ohnehin damit arbeitest. Bewertet wird nicht die Software, sondern die Nachvollziehbarkeit deines Rechenwegs.

Einfacher wird es, wenn die Daten strukturiert eintreffen. Bei einer Online-Erhebung lädst du die Antworten als Excel- oder CSV-Datei herunter und ersparst dir das Abtippen samt Tippfehlern. empirio.ai, ein Online-Umfrage-Tool aus Deutschland, zeigt Häufigkeiten und Durchschnitte direkt in der Auswertung an und gibt die Rohdaten zusätzlich als Datei aus.

Typische Fehler bei der Auswertung

Die meisten Mängel im Ergebnisteil entstehen nicht beim Rechnen, sondern beim Zuordnen: Eine Kennzahl trifft auf Daten, für die sie nicht gedacht war, oder eine Zahl wird stärker gedeutet, als sie es trägt. Vier Muster wiederholen sich auffällig oft.

Alle vier fallen beim Schreiben nicht auf, beim Lesen aber sofort. Wer den Ergebnisteil vor der Abgabe gezielt darauf durchsieht, braucht eine Viertelstunde, und genau danach fragt das Kolloquium.

Durchschnitt einer nominalen Variable

Ein Durchschnitt von 1,6 bei einer Variable, deren Zahlen für Studiengänge stehen, ist keine Information, sondern ein Nebenprodukt der Codierung. Bei nominalen Merkmalen berichtest du Häufigkeiten und Anteile, mehr gibt es nicht. Die Probe geht schnell: Ändert sich die Aussage, sobald du die Codes vertauschst, ist die Kennzahl unzulässig.

Nur den Durchschnitt berichten

Ein Durchschnitt ohne Streuungsmass unterschlägt die Hälfte der Information. 70 Franken im Monat können bedeuten, dass alle rund 70 Franken ausgeben, oder dass die meisten unter 30 Franken bleiben und eine Person 400 Franken investiert. Standardabweichung und Fallzahl gehören daher in dieselbe Zeile wie der Durchschnitt.

Prozentangaben ohne Bezugsgrösse

„60 Prozent der Befragten stimmen zu“ klingt belastbar, bis sich zeigt, dass fünf Personen geantwortet haben. Unter rund zwanzig Fällen entspricht eine einzelne Person mehr als fünf Prozentpunkten, dann ist die absolute Zahl die ehrlichere Angabe. Nenne sie deshalb immer mit, also „drei von fünf“.

Signifikanz mit Relevanz verwechseln

Ein signifikanter Unterschied ist noch kein bedeutsamer Unterschied. Ob ein Effekt praktisch zählt, klärt erst die Effektstärke, eingeordnet in das, was in deinem Fach üblich ist, und beurteilt daran, was in deinem Anwendungsfall überhaupt einen Unterschied macht. Ausdrücke wie „hochsignifikant“ suggerieren eine Grössenordnung, die im p-Wert nicht enthalten ist.

Fazit

Deskriptive Statistik ist bei vielen Arbeiten keine Vorstufe, sondern bereits die ganze Auswertung. Wer alle befragt hat oder keine Zufallsauswahl ziehen konnte, beschreibt sorgfältig und benennt die Grenzen, statt einen Test zu rechnen, den die Daten nicht tragen. Und wer testet, stellt dem p-Wert eine Effektstärke zur Seite.

Eine ehrlich beschriebene Stichprobe wiegt schwerer als ein Sternchen hinter einer Zahl.

Wie es weitergeht


Du willst deine Daten nicht abtippen?

Mit empirio.ai erstellst du deine Umfrage kostenlos und bekommst Häufigkeiten, Durchschnitte und den Rohdaten-Export ohne Umweg. Umfrage erstellen

Häufig gestellte Fragen

Deskriptive Statistik ordnet und verdichtet einen vorliegenden Datensatz, ohne über ihn hinauszugehen. Dazu gehören Lagemasse wie Modus, Median und Durchschnitt, Streuungsmasse wie Spannweite, Varianz und Standardabweichung sowie Zusammenhangsmasse und grafische Abbildungen. Was sie liefert, gilt für die erhobenen Fälle und für sonst niemanden.

Deskriptive Statistik beschreibt die Stichprobe, Inferenzstatistik schliesst von der Stichprobe auf die Grundgesamtheit. Dafür schätzt sie Kennwerte der Grundgesamtheit, meist als Vertrauensintervall, und prüft Hypothesen, jeweils mit einer Fehlerspanne. Beschreiben lässt sich jeder Datensatz, schliessen nur jener mit passendem Auswahlverfahren.

Zur deskriptiven Statistik gehören drei Gruppen von Kennzahlen. Lagemasse sind Modus, Median und Durchschnitt. Streuungsmasse sind Spannweite, Quartilsabstand, Varianz und Standardabweichung. Zusammenhangsmasse sind Pearsons Korrelationskoeffizient, Spearmans Rangkorrelation und Cramérs V. Welche davon zulässig sind, entscheidet in erster Linie das Skalenniveau der Variable, daneben ihre Verteilung.

Eine Likert-Skala ist formal ordinal, weil gleiche Abstände zwischen den Stufen nicht belegbar sind. Zulässig sind daher Modus und Median. Die Forschungspraxis behandelt mehrere verrechnete Items dennoch häufig metrisch. Vertretbar bleibt das nur bei symmetrischen, vollständig beschrifteten Stufen und mit Begründung im Methodenteil.

Der p-Wert beziffert, wie wahrscheinlich ein Ergebnis wie das beobachtete oder ein extremeres wäre, falls die Nullhypothese zuträfe. Er misst weder die Wahrscheinlichkeit, dass die Hypothese zutrifft, noch die Grösse eines Effekts. Genau das hält die American Statistical Association in ihrer Stellungnahme von 2016 fest.

Inferenzstatistik ist nur nötig, wenn du von deiner Stichprobe auf eine grössere Grundgesamtheit schliessen willst. Bei einer Vollerhebung, also wenn alle Mitglieder der Grundgesamtheit geantwortet haben, entfällt dieser Schritt. Bei einer Gelegenheitsstichprobe lässt sich ein Test rechnen, sein Ergebnis reicht aber nicht über die Befragten hinaus.

Das könnte dich auch interessieren