empirio.ai

Deskriptive Statistik & Inferenzstatistik: Leitfaden

Deskriptive Statistik zeigt, was in deiner Erhebung steckt. Wann das genügt, wann du weiterrechnen musst und wie du sie von der Inferenzstatistik trennst.

Autorin bei empirio.ai - Maria Malzewvon Maria MalzewAktualisiert am 7. September 2026Lesezeit 12 Min.

Die Fragebögen sind retour, 64 Zeilen warten in der Tabelle. Und jetzt? Viele klicken als Erstes auf „Mittelwert“, ohne vorher zu klären, ob diese Antworten einen Mittelwert überhaupt zulassen.

Deskriptive Statistik fasst genau die Fälle zusammen, die du erhoben hast, und zwar mit Kennzahlen wie Modus, Median und Standardabweichung. Inferenzstatistik geht darüber hinaus und schätzt aus dieser Stichprobe, wie es in der Grundgesamtheit vermutlich aussieht, immer verbunden mit einer Angabe zur Unsicherheit. Danach weißt du, welche Kennzahl deine Daten hergeben und wann du auf den zweiten Schritt verzichten kannst.


📌 Das Wichtigste im Überblick

  • Deskriptive Statistik beschreibt die Stichprobe, Inferenzstatistik schätzt die Grundgesamtheit.
  • Der Modus geht auf jedem Skalenniveau, der Mittelwert erst ab metrisch.
  • Statistik Austria publiziert Werte mit über 25 Prozent Variationskoeffizient nicht.
  • Ein Ausreißer verschiebt den Mittelwert deutlich, den Median kaum.
  • Der p-Wert sagt nicht, wie wahrscheinlich deine Hypothese stimmt.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Was ist deskriptive Statistik?

Deskriptive Statistik ist der Teil der Statistik, der einen vorliegenden Datensatz ordnet, verdichtet und darstellt, ohne über ihn hinauszugreifen. Jede Kennzahl gilt für die erhobenen Fälle und für keinen Fall darüber hinaus.

Diese Bescheidenheit täuscht, denn ohne sie geht gar nichts. Aus 200 Zeilen Rohdaten liest niemand etwas heraus. Erst wenn daraus wenige Kennzahlen und eine Grafik werden, entsteht ein Bild davon, wo die Mitte liegt, wie breit die Antworten streuen und ob zwei Merkmale zusammenhängen. Genau diese drei Fragen decken die drei Gruppen von Kennzahlen ab.

Zur deskriptiven Statistik zählt auch die Darstellung: Häufigkeitstabelle, Säulen- und Kreisdiagramm, Histogramm, Boxplot. Die Form folgt der Aussage, nicht dem Menü deines Programms. Nicola Döring ordnet die Datenanalyse in ihrem Lehrbuch Forschungsmethoden und Evaluation in den Sozial- und Humanwissenschaften (6. Auflage, Springer 2023, Kapitel 12) in derselben Reihenfolge ein: zuerst beschreiben, dann prüfen. Wo dieser Schritt im gesamten Ablauf steht, zeigt der Überblick zur empirischen Forschung.

Deskriptive Statistik und Inferenzstatistik: der Unterschied

Der Unterschied zwischen deskriptiver Statistik und Inferenzstatistik ist eine Frage der Reichweite. Die deskriptive Statistik behauptet nur etwas über die Befragten. Die Inferenzstatistik behauptet etwas über alle, die diese Befragten vertreten sollen, und nennt dazu die Unsicherheit ihrer Schätzung.

Die Inferenzstatistik trägt deshalb auch die Namen schließende und induktive Statistik, seltener beurteilende Statistik. Gemeint ist immer dasselbe: der Schluss von der Stichprobe auf die Grundgesamtheit. Zwei Aufgaben stecken darin: Kennwerte der Grundgesamtheit schätzen, meist in Form eines Konfidenzintervalls, und Hypothesen über Unterschiede oder Zusammenhänge prüfen. Beschreiben lässt sich jeder Datensatz. Verallgemeinern darfst du nur jenen, dessen Auswahlverfahren das trägt.

Wie eng beide Teile zusammenhängen, zeigt sich beim Rechnen. Ohne saubere Beschreibung merkst du nicht, dass eine Verteilung stark schief liegt, ein einzelner Wert alles verzieht oder eine Vergleichsgruppe nur drei Personen umfasst. Alle drei Befunde entscheiden darüber, welcher Test überhaupt zulässig ist. Deshalb steht die Beschreibung im Ergebnisteil immer am Anfang.

Die Kennzahlen der deskriptiven Statistik

Die Kennzahlen der deskriptiven Statistik ordnen sich in drei Gruppen: Lagemaße für die Mitte, Streuungsmaße für die Breite, Zusammenhangsmaße für die Beziehung zweier Merkmale. Wer nur eine Gruppe berichtet, liefert eine halbe Auswertung ab.

Als Beispiel dient eine Erhebung im Seminar: Du hast 13 Kolleginnen und Kollegen gefragt, wie viele Minuten sie täglich zur Uni brauchen. Geordnet lauten die Antworten 10, 12, 15, 15, 15, 20, 25, 30, 35, 40, 45, 55, 130. Eine Person pendelt aus dem Umland, und an dieser einen Antwort lässt sich jede Kennzahl vorführen.

Lagemaße: Modus, Median und arithmetisches Mittel

Lagemaße benennen die Mitte einer Verteilung. Der Modus ist der häufigste Wert, hier 15 Minuten mit drei Nennungen. Kommen zwei Werte gleich oft vor, gibt es zwei Modi, und bei lauter verschiedenen Werten sagt der Modus gar nichts. Der Median steht in der Mitte der geordneten Reihe, bei 13 Werten also an siebter Stelle: 25 Minuten. Das arithmetische Mittel ergibt sich aus der Summe 447 geteilt durch 13, also rund 34,4 Minuten.

Dieselbe Frage, drei verschiedene Antworten. Schuld daran trägt die 130. Lässt man diese Antwort weg, sinkt das arithmetische Mittel von 34,4 auf rund 26,4 Minuten, während der Median nur von 25 auf 22,5 Minuten nachgibt. Merke: Das arithmetische Mittel reagiert empfindlich auf Ausreißer, der Median deutlich weniger. Bei Pendelzeiten, Einkommen oder Wartezeiten berichtest du deshalb beide Werte.

Streuungsmaße: Spannweite, Varianz und Standardabweichung

Streuungsmaße beantworten, wie weit die Werte auseinanderliegen. Die Spannweite ist der Abstand zwischen größtem und kleinstem Wert, hier 130 minus 10, also 120 Minuten. Die Varianz bündelt die Abweichungen vom Mittelwert: Du quadrierst jede Abweichung, summierst alles und teilst durch n minus 1. Der Abzug von eins ist der übliche Weg, solange deine Daten eine Stichprobe sind und nicht die ganze Grundgesamtheit. Die Standardabweichung ist die Wurzel aus der Varianz und liegt in diesem Beispiel bei rund 32 Minuten.

Varianz und Standardabweichung geraten oft durcheinander, obwohl die Trennung simpel ist: Die Varianz steht in quadrierten Einheiten und lässt sich nicht anschaulich deuten, die Standardabweichung steht in Minuten und darf neben dem Mittelwert stehen. Auch hier wirkt der Ausreißer massiv. Ohne die 130 fällt die Standardabweichung von 32 auf rund 14,6 Minuten, also auf weniger als die Hälfte.

Zusammenhangsmaße: welcher Koeffizient zu welchen Daten passt

Zusammenhangsmaße zeigen, wie stark zwei Merkmale gemeinsam variieren. Die Wahl richtet sich nach dem Skalenniveau: Pearsons r bei zwei metrischen Merkmalen, Spearmans Rangkorrelation, sobald eines davon nur ordinal vorliegt, Cramérs V bei zwei nominalen Merkmalen. Pearson und Spearman liegen zwischen minus 1 und plus 1, Cramérs V zwischen 0 und 1. Der ebenfalls verbreitete Kontingenzkoeffizient erreicht die 1 nur in seiner korrigierten Form, deshalb ist Cramérs V die sicherere Wahl.

⚠️ Achtung

Ein hoher Korrelationskoeffizient belegt keine Ursache. Er sagt nur, dass zwei Merkmale gemeinsam schwanken. Formuliere „hängt zusammen mit“ statt „führt zu“, solange dein Untersuchungsdesign keine Wirkrichtung sichert. Pearsons r erfasst zudem nur geradlinige Zusammenhänge, ein Wert nahe null schließt einen starken, aber gekrümmten Zusammenhang also nicht aus. Vor die Korrelation gehört deshalb immer ein Streudiagramm.

Welches Maß darfst du bei welchem Skalenniveau rechnen?

Erlaubt ist, was das Skalenniveau der Variable hergibt, und nicht alles, was dein Programm ausrechnet. Excel liefert klaglos einen Mittelwert für eine Variable, in der 1 für Wien, 2 für Graz und 3 für Innsbruck steht. Verwertbar ist diese Zahl nicht.

Die Systematik stammt vom Psychologen Stanley Smith Stevens, der 1946 in Science vier Skalentypen unterschied und für jeden festlegte, welche Kennzahlen aussagekräftig bleiben (Stevens 1946). Die folgende Tabelle gibt die heute übliche Lesart wieder, die Stevens an einzelnen Stellen erweitert. Kritik daran gibt es seit den Neunzigerjahren: Als starre Regel gelesen, führen die vier Typen in Grenzfällen in die Irre.

SkalenniveauErlaubte LagemaßeErlaubte Streuungsmaße
NominalskalaModuskeines im engeren Sinn, berichtet werden Häufigkeiten und Anteile
OrdinalskalaModus, MedianQuartile, Perzentile
Intervallskalazusätzlich arithmetisches MittelSpannweite, Varianz, Standardabweichung
Verhältnisskalazusätzlich geometrisches Mittelzusätzlich Variationskoeffizient

Gelesen wird die Tabelle kumulativ: Was ein niedrigeres Niveau erlaubt, bleibt auf jedem höheren erlaubt. Der Modus passt deshalb immer, das arithmetische Mittel erst ab der Intervallskala. Wie du das Niveau deiner eigenen Variablen bestimmst, steht im Beitrag zum Skalenniveau.

Streit gibt es regelmäßig bei der Zustimmungsskala von „stimme gar nicht zu“ bis „stimme voll zu“. Formal ist sie ordinal, denn dass alle Befragten die Abstände zwischen den Stufen gleich groß erleben, lässt sich nicht zeigen. Trotzdem behandelt die Forschungspraxis solche Items häufig metrisch, besonders wenn mehrere davon zu einer Skala verrechnet werden. Tragfähig ist das nur bei symmetrischen, vollständig beschrifteten Stufen, und die Entscheidung gehört mit Begründung in den Methodenteil. Ausführlich behandelt das der Beitrag zur Likert-Skala.

Kostenlos Umfrage erstellen

Mit empirio.ai erstellst du in wenigen Minuten eine moderne Online-Umfrage – mit Hosting in der EU.

  • Umfrage per KI
  • Per Drag & Drop anpassen
  • Auswertung in Echtzeit
Jetzt kostenlos starten

Wann du gar keine Inferenzstatistik brauchst

Inferenzstatistik entfällt dort, wo niemand auf eine größere Gruppe schließen will. Ein Signifikanztest existiert nur, um von einer Stichprobe auf eine Grundgesamtheit zu verallgemeinern. Fällt dieser Zweck weg, fällt auch der Test weg.

Der eindeutigste Fall ist die Vollerhebung. Antworten alle 28 Mitglieder deines ÖH-Referats und willst du über genau diese 28 Personen etwas sagen, liegt die Grundgesamtheit vollständig vor dir. Dass 17 von 28 den späteren Sitzungstermin bevorzugen, ist dann keine Schätzung mit Unsicherheit, sondern das Ergebnis. Antwortet nur ein Teil, ist es keine Vollerhebung mehr, sondern eine Auswahl, die sich selbst zusammengestellt hat.

Eine Grenze hat diese Regel trotzdem, und sie gehört in den Methodenteil. Sie gilt, solange sich deine Aussage auf genau diese Gruppe zu genau diesem Zeitpunkt beschränkt. Sobald du das Ergebnis als Hinweis auf etwas Dahinterliegendes liest, etwa auf künftige Mitglieder oder auf eine Ursache, arbeitest du wieder mit einem Modell und darfst Konfidenzintervalle berichten. In der Methodenliteratur läuft dieser Fall unter dem Stichwort Superpopulation.

💡 Tipp

Halte im Methodenteil in einem Satz fest, warum kein Test folgt: „Da eine Vollerhebung der Grundgesamtheit vorliegt, wird auf inferenzstatistische Verfahren verzichtet.“ In der Defensio wirkt dieser Satz souveräner als ein Test ohne Adressaten.

Der zweite Fall ist die Gelegenheitsstichprobe. Wer den Link in drei WhatsApp-Gruppen und ins eigene Instagram-Profil stellt, hat nicht zufällig ausgewählt, sondern die Erreichbaren befragt. Rechnen lässt sich ein Test auf solchen Daten zwar, nur reicht sein Ergebnis nicht über die Befragten hinaus. Diese Grenze gehört offen in die Limitationen, und genau dort holt man Punkte. Was eine Stichprobe methodisch trägt und ab wann eine Befragung repräsentativ heißt, klären die beiden verlinkten Beiträge.

Was der p-Wert sagt und was nicht

Der p-Wert beziffert, wie wahrscheinlich ein Ergebnis wie deines oder ein extremeres wäre, falls die Nullhypothese zuträfe und alle übrigen Annahmen deines Modells erfüllt wären, etwa die Zufallsauswahl. Er beschreibt also die Daten unter diesen Annahmen, nicht die Annahmen selbst. Ein kleiner p-Wert kann deshalb auch bedeuten, dass eine dieser Annahmen nicht stimmt.

Die American Statistical Association hat 2016 sechs Grundsätze zum p-Wert veröffentlicht, weil die Fehlinterpretationen in der Fachliteratur überhandnahmen. Grundsatz zwei lässt keinen Spielraum: „P-values do not measure the probability that the studied hypothesis is true …“ (Wasserstein und Lazar 2016). Der Satz räumt anschließend die zweite verbreitete Fehldeutung ab: Der p-Wert sagt ebenso wenig, wie wahrscheinlich es ist, dass dein Ergebnis reiner Zufall war. Ein p von 0,03 bedeutet demnach nicht, dass deine Hypothese zu 97 Prozent zutrifft. Was bei deinen eigenen zwei Gruppen herauskommt, rechnet der p-Wert-Rechner aus, deuten musst du das Ergebnis weiterhin selbst.

Ebenso wenig misst der p-Wert, wie groß oder wie bedeutsam ein Effekt ist, so der fünfte Grundsatz derselben Stellungnahme. Bei großen Stichproben kann auch ein winziger, praktisch belangloser Unterschied signifikant werden. Neben dem p-Wert gehört deshalb immer eine Effektstärke in den Ergebnisteil, nach Möglichkeit zusätzlich ein Konfidenzintervall.

Wie die amtliche Statistik damit umgeht

Wie ernst die Unsicherheit genommen wird, zeigt die Praxis von Statistik Austria beim Mikrozensus. Die Bundesanstalt weist zu ihren Ergebnissen Stichprobenfehler und Konfidenzintervalle aus und veröffentlicht Werte mit einem Variationskoeffizienten über 25 Prozent gar nicht erst, weil sie als statistisch nicht interpretierbar gelten (STATjournal 5/2025). Für die eigene Arbeit heißt das: Eine Zahl ohne Angabe zu ihrer Genauigkeit ist keine fertige Zahl. Wie du deine Annahmen vorher sauber formulierst, zeigt der Beitrag zum Hypothesen aufstellen.

Deskriptive Statistik im Ergebnisteil deiner Arbeit

Der Ergebnisteil einer Bachelor-, Master- oder Diplomarbeit startet mit der deskriptiven Statistik, und zwar mit der Stichprobenbeschreibung: Fallzahl, Rücklauf, Verteilung nach Alter, Geschlecht, Semester oder was deine Fragestellung braucht. Danach folgen die Kennzahlen der inhaltlichen Variablen, zuletzt die Hypothesenprüfung.

Für die Darstellung hilft eine Faustregel: Was in zwei Sätzen gesagt ist, bleibt im Text. Was über drei Werte hinausgeht, wandert in eine Tabelle. Was eine Verteilung oder einen Verlauf sichtbar machen soll, wird eine Grafik. Jede Tabelle führt n und die zum Skalenniveau passenden Kennzahlen, bei metrischen Variablen also Mittelwert und Standardabweichung, bei nominalen die Häufigkeiten. Jede Grafik trägt beschriftete Achsen samt Einheit.

Womit du rechnest

Für Lage- und Streuungsmaße genügt eine Tabellenkalkulation. SPSS ist an vielen Hochschulen gesetzt, kostet aber Lizenzgebühren; JASP und jamovi sind gratis, bedienen sich ähnlich und decken die Verfahren ab, die in einer Bachelorarbeit üblicherweise vorkommen. R und Python lohnen sich, wenn du ohnehin damit arbeitest. Bewertet wird am Ende nicht das Programm, sondern die Nachvollziehbarkeit deines Rechenwegs.

Deutlich einfacher wird es, wenn die Daten bereits strukturiert eintreffen. Bei einer Online-Erhebung lädst du die Antworten als Excel- oder CSV-Datei herunter und ersparst dir das Abtippen samt Tippfehlern. empirio.ai, ein Online-Umfrage-Tool aus Deutschland, zeigt Häufigkeiten und Mittelwerte unmittelbar in der Auswertung an und gibt die Rohdaten zusätzlich als Datei aus.

Typische Fehler bei der Auswertung

Die meisten Mängel in Ergebnisteilen entstehen nicht beim Rechnen, sondern beim Zuordnen: Eine Kennzahl trifft auf Daten, für die sie nicht gedacht war, oder eine Zahl wird stärker gedeutet, als sie es trägt. Vier Muster wiederholen sich besonders häufig.

Alle vier fallen beim Schreiben nicht auf, beim Lesen aber sofort. Wer den Ergebnisteil vor der Abgabe gezielt darauf durchsieht, braucht eine Viertelstunde, und genau danach fragt die Defensio.

Mittelwert einer nominalen Variable

Ein Mittelwert von 1,6 bei einer Variable, deren Zahlen für Studienrichtungen stehen, ist keine Information, sondern ein Nebenprodukt der Codierung. Bei nominalen Merkmalen berichtest du Häufigkeiten und Anteile, mehr gibt es nicht. Die Probe dafür geht schnell: Ändert sich die Aussage, sobald du die Codes vertauschst, ist die Kennzahl unzulässig.

Nur den Mittelwert berichten

Ein Mittelwert ohne Streuungsmaß unterschlägt die Hälfte der Information. Rund 34 Minuten Fahrtzeit können bedeuten, dass alle etwa eine halbe Stunde unterwegs sind, oder dass ein Teil zehn Minuten braucht und ein anderer gut eine Stunde. Standardabweichung und Fallzahl gehören daher in dieselbe Zeile wie der Mittelwert.

Prozentangaben ohne Bezugsgröße

„60 Prozent der Befragten stimmen zu“ klingt belastbar, bis sich herausstellt, dass fünf Personen geantwortet haben. Unterhalb von rund zwanzig Fällen entspricht eine einzelne Person mehr als fünf Prozentpunkten, dann ist die absolute Zahl die ehrlichere Angabe. Nenne sie deshalb immer mit, also „drei von fünf“.

Signifikanz mit Relevanz verwechseln

Ein signifikanter Unterschied ist noch kein wichtiger Unterschied. Ob ein Effekt praktisch zählt, klärt erst die Effektstärke, eingeordnet in das, was in deinem Fach üblich ist, und beurteilt daran, was in deinem Anwendungsfall überhaupt einen Unterschied macht. Ausdrücke wie „hochsignifikant“ suggerieren eine Größenordnung, die im p-Wert schlicht nicht steckt.

Fazit

Deskriptive Statistik ist bei vielen Arbeiten nicht die Vorstufe, sondern bereits die vollständige Auswertung. Wer alle befragt hat oder wer keine Zufallsauswahl ziehen konnte, beschreibt sorgfältig und benennt die Grenzen, statt einen Test zu rechnen, den die eigenen Daten nicht tragen. Und wer testet, stellt dem p-Wert eine Effektstärke zur Seite.

Eine ehrlich beschriebene Stichprobe zählt mehr als ein Sternchen hinter einer Zahl.

Wie es weitergeht


Du willst deine Daten nicht abtippen?

Mit empirio.ai erstellst du deine Umfrage kostenlos und bekommst Häufigkeiten, Mittelwerte und den Rohdaten-Export ohne Umweg. Umfrage erstellen

Häufig gestellte Fragen

Deskriptive Statistik ordnet und verdichtet einen vorliegenden Datensatz, ohne über ihn hinauszugreifen. Dazu zählen Lagemaße wie Modus, Median und arithmetisches Mittel, Streuungsmaße wie Spannweite, Varianz und Standardabweichung sowie Zusammenhangsmaße und grafische Darstellungen. Jede Kennzahl gilt für die erhobenen Fälle.

Deskriptive Statistik beschreibt die Stichprobe, Inferenzstatistik schließt von der Stichprobe auf die Grundgesamtheit. Dafür schätzt sie Kennwerte der Grundgesamtheit, meist als Konfidenzintervall, und prüft Hypothesen, jeweils mit Angabe der Unsicherheit. Beschreiben lässt sich jeder Datensatz, schließen nur bei passender Auswahl.

Zur deskriptiven Statistik zählen drei Gruppen. Lagemaße sind Modus, Median und arithmetisches Mittel. Streuungsmaße sind Spannweite, Quartilsabstand, Varianz und Standardabweichung. Zusammenhangsmaße sind Pearsons Korrelationskoeffizient, Spearmans Rangkorrelation und Cramérs V. Welche zulässig sind, entscheidet in erster Linie das Skalenniveau der Variable, daneben ihre Verteilung.

Eine Likert-Skala ist formal ordinal, weil gleiche Abstände zwischen den Stufen nicht belegbar sind. Zulässig sind daher Modus und Median. In der Forschungspraxis werden mehrere verrechnete Items dennoch oft metrisch behandelt. Tragfähig ist das nur bei symmetrischen, voll beschrifteten Stufen und mit Begründung im Methodenteil.

Der p-Wert beziffert, wie wahrscheinlich ein Ergebnis wie das beobachtete oder ein extremeres wäre, falls die Nullhypothese zuträfe. Er misst weder die Wahrscheinlichkeit, dass die Hypothese zutrifft, noch die Größe eines Effekts. Genau das hält die American Statistical Association in ihrer Stellungnahme von 2016 fest.

Inferenzstatistik ist nur nötig, wenn du von deiner Stichprobe auf eine größere Grundgesamtheit schließen willst. Bei einer Vollerhebung, also wenn alle Mitglieder der Grundgesamtheit geantwortet haben, entfällt der Schritt. Bei einer Gelegenheitsstichprobe lässt sich ein Test rechnen, sein Ergebnis reicht aber nicht über die Befragten hinaus.

Das könnte dich auch interessieren

Empirische Forschung

Empirische Forschung: Definition, Methoden, Leitfaden

Empirisch heißt nicht automatisch Zahlen und nicht automatisch eigene Erhebung. Welcher Weg zu deiner Frage passt und was vorher rechtlich feststehen muss, klären wir Schritt für Schritt.