Le questionnaire est revenu, 87 lignes attendent dans un tableur. Et maintenant ? La plupart des gens cliquent d'abord sur la moyenne, sans avoir vérifié que ces réponses autorisent une moyenne.
La statistique descriptive résume exactement les cas que tu as collectés, à l'aide d'indicateurs comme la moyenne, la médiane et l'écart type. La statistique inférentielle va plus loin et estime, à partir de cet échantillon, ce qui vaut probablement pour toute la population, en indiquant toujours le degré d'incertitude de cette estimation. À la fin, tu sauras quel indicateur tes données autorisent et quand la seconde étape est inutile.
📌 L'essentiel en bref
- La descriptive décrit l'échantillon, l'inférentielle estime la population.
- Le mode convient à toute échelle, la moyenne seulement à partir de l'intervalle.
- Décrire ton seul groupe ne demande aucun test de signification.
- Une valeur extrême tire nettement la moyenne, la médiane bouge à peine.
- Un intervalle de confiance ne couvre pas les erreurs de réponse.
Créer un sondage gratuitement
Avec empirio.ai, vous créez un sondage en ligne moderne en quelques minutes — avec un hébergement dans l'UE.
- Sondage créé par IA
- Ajustez en glisser-déposer
- Analyse en temps réel
Qu'est-ce que la statistique descriptive ?
La statistique descriptive est la branche de la statistique qui résume et présente un jeu de données existant sans le dépasser. Chaque énoncé vaut pour les cas que tu as collectés, et pour aucun cas au-delà.
Cette limite paraît modeste, elle porte pourtant la moitié de l'analyse. Personne ne comprend rien à 200 lignes de données brutes. Ce n'est qu'une fois ces lignes réduites à quelques chiffres et un graphique qu'une image apparaît : elle montre où se situe le centre, à quel point les réponses se dispersent et si deux variables varient ensemble. Ce sont exactement les trois questions auxquelles répondent les trois familles d'indicateurs.
La présentation fait aussi partie de la statistique descriptive : tableau de fréquences, diagramme en barres ou en secteurs, histogramme, boîte à moustaches. La forme découle du message, pas du premier bouton du logiciel. Nicola Döring place l'analyse des données dans le même ordre dans son manuel Forschungsmethoden und Evaluation in den Sozial- und Humanwissenschaften (6e édition, Springer 2023, chapitre 12) : décrire d'abord, tester ensuite. Pour situer cette étape dans l'ensemble, vois l'aperçu de la recherche empirique.
Statistique descriptive et inférentielle : la différence
La différence entre statistique descriptive et statistique inférentielle tient à la portée de l'énoncé. La descriptive n'affirme quelque chose que sur les personnes interrogées. L'inférentielle affirme quelque chose sur toutes celles que ces personnes sont censées représenter, et chiffre au passage sa propre incertitude.
La statistique inférentielle porte aussi le nom de statistique inductive. Elle remplit deux fonctions : estimer des paramètres de la population, le plus souvent sous forme d'intervalle de confiance, et tester des hypothèses portant sur des écarts ou des liaisons. Tout jeu de données peut être décrit. Seul un échantillon issu d'une procédure de tirage correcte autorise l'inférence.
Les deux parties dépendent l'une de l'autre plus qu'il n'y paraît. Sans description propre, tu ne repères pas qu'une distribution est fortement asymétrique, qu'une valeur isolée déforme tout, ou qu'un groupe de comparaison compte trois personnes. Ces trois constats décident du test admissible. C'est pourquoi la description ouvre la partie résultats.
Les indicateurs de la statistique descriptive
Les indicateurs de la statistique descriptive se répartissent en trois familles : la position pour le centre, la dispersion pour l'étendue, la liaison pour la relation entre deux variables. Ne rapporter qu'une seule famille revient à rendre une analyse à moitié faite.
Un exemple traverse tout ce chapitre. Tu as demandé à 15 personnes de ta promotion combien d'heures par semaine elles consacrent à leur mémoire. Classées, les réponses donnent 2, 3, 3, 4, 4, 4, 5, 5, 6, 6, 7, 8, 9, 10, 20. Une personne se détache, et cette seule réponse suffit à illustrer chaque indicateur.
Position : mode, médiane et moyenne
Les indicateurs de position situent le centre d'une distribution. Le mode est la valeur la plus fréquente, ici 4 heures, citées trois fois. Si deux valeurs reviennent aussi souvent, il y a deux modes, et si toutes les valeurs diffèrent, le mode ne dit plus rien. La médiane occupe le milieu de la série ordonnée, donc la huitième place sur 15 valeurs : 5 heures. La moyenne est la somme divisée par l'effectif, ici 96 divisé par 15, soit 6,4 heures.
Trois indicateurs, trois réponses différentes à une même question. La valeur 20 en est responsable. Sans elle, la moyenne tombe de 6,4 à 5,4 heures alors que la médiane reste à 5. La médiane résiste aux valeurs extrêmes, la moyenne non. Pour des variables asymétriques comme le revenu, les temps d'attente ou la charge de travail, rapporte les deux.
Dispersion : étendue, variance et écart type
Les indicateurs de dispersion mesurent l'écartement des valeurs. L'étendue sépare la plus grande de la plus petite valeur, ici 20 moins 2, soit 18 heures. La variance rassemble les écarts à la moyenne : tu élèves chaque écart au carré, tu additionnes le tout et tu divises par n moins 1, ce qui donne ici 19,4. Retrancher un est la règle usuelle tant que tes données forment un échantillon et non la population entière. L'écart type est la racine carrée de la variance, environ 4,4 heures.
Variance et écart type sont souvent confondus alors que la distinction est simple : la variance s'exprime en unités au carré et ne se lit pas intuitivement, l'écart type s'exprime en heures et se place à côté de la moyenne. La valeur extrême pèse ici aussi. Sans le 20, l'écart type descend de 4,4 à 2,4 heures.
Liaison : quel coefficient pour quelles données
Les mesures de liaison indiquent à quel point deux variables varient ensemble. Le niveau de mesure décide du coefficient : le r de Pearson pour deux variables métriques, la corrélation des rangs de Spearman dès que l'une est seulement ordinale, le V de Cramér pour deux variables nominales. Pearson et Spearman vont de moins 1 à plus 1, le V de Cramér de 0 à 1. Le coefficient de contingence, lui aussi répandu, n'atteint 1 que dans sa forme corrigée, ce qui fait du V de Cramér le choix le plus sûr.
⚠️ Attention
Un coefficient de corrélation élevé ne prouve aucune causalité. Il montre seulement que deux variables varient ensemble. Écris « est associé à » plutôt que « entraîne » tant que ton dispositif n'établit pas un sens de l'effet. Le r de Pearson ne détecte par ailleurs que les liens rectilignes : une valeur proche de zéro n'exclut pas un lien fort mais courbe. Trace donc toujours un nuage de points avant de lire une corrélation.
Quel indicateur pour quel niveau de mesure ?
Ce qui est permis dépend du niveau de mesure de ta variable, pas du fait que le logiciel renvoie un nombre. Excel calcule sans broncher la moyenne d'une variable où 1 désigne Lille, 2 Nantes et 3 Toulouse. Le résultat reste dépourvu de sens.
Cette typologie remonte au psychologue Stanley Smith Stevens, qui distingua quatre types d'échelles dans Science en 1946 et précisa pour chacun quels indicateurs restent parlants (Stevens 1946). Le tableau ci-dessous reprend la lecture courante aujourd'hui, qui prolonge Stevens sur certains points. La critique existe depuis les années 1990 : lus comme une règle rigide, ces quatre types induisent en erreur dans les cas limites.
| Niveau de mesure | Position admise | Dispersion admise |
|---|---|---|
| Échelle nominale | Mode | aucune au sens strict, on rapporte fréquences et proportions |
| Échelle ordinale | Mode, médiane | Quartiles, percentiles |
| Échelle d'intervalle | en plus la moyenne arithmétique | Étendue, variance, écart type |
| Échelle de rapport | en plus la moyenne géométrique | en plus le coefficient de variation |
Le tableau se lit de manière cumulative : ce qu'un niveau inférieur autorise reste autorisé à tous les niveaux supérieurs. Le mode fonctionne donc partout, la moyenne seulement à partir de l'échelle d'intervalle. Pour déterminer le niveau de tes propres variables, vois l'article sur le niveau de mesure.
Le débat récurrent porte sur les échelles d'accord allant de « pas du tout d'accord » à « tout à fait d'accord ». Formellement, elles sont ordinales, car personne ne peut montrer que tous les répondants perçoivent les écarts entre modalités comme identiques. La pratique de recherche traite pourtant souvent ces items comme des données d'intervalle, surtout lorsque plusieurs sont agrégés en une échelle. Cela ne tient qu'avec des modalités symétriques entièrement libellées, et la décision se justifie dans la méthodologie. L'article sur l'échelle de Likert détaille le sujet.
Créer un sondage gratuitement
Avec empirio.ai, vous créez un sondage en ligne moderne en quelques minutes — avec un hébergement dans l'UE.
- Sondage créé par IA
- Ajustez en glisser-déposer
- Analyse en temps réel
Quand la statistique inférentielle ne sert à rien
La statistique inférentielle devient inutile dès que personne ne cherche à généraliser à un groupe plus large. Un test de signification n'existe que pour passer d'un échantillon à une population. Sans cet objectif, la raison d'être du test disparaît.
Le cas le plus net est le recensement complet. Si les 42 membres de ton association répondent et que tu veux parler précisément de ces 42 personnes, la population est entièrement devant toi et il n'y a plus rien à inférer. Que 19 personnes sur 42 préfèrent le créneau le plus tardif n'est pas une estimation entourée d'incertitude, c'est le résultat. Si une partie seulement répond, ce n'est plus un recensement mais un groupe qui s'est constitué lui-même.
Une limite existe malgré tout, et elle se dit dans la méthodologie. La règle vaut tant que ton énoncé se limite à ce groupe précis à cet instant précis. Dès que tu lis le résultat comme l'indice d'un mécanisme sous-jacent, par exemple pour de futurs membres ou pour une cause, tu travailles de nouveau avec un modèle et les intervalles de confiance reviennent. La littérature méthodologique range ce cas sous le terme de superpopulation.
💡 Conseil
Mets une phrase dans ta méthodologie pour expliquer l'absence de test : « S'agissant d'un recensement complet de la population, aucune procédure inférentielle n'a été appliquée. » En soutenance, cette phrase pèse plus lourd qu'un test sans destinataire.
Le second cas est l'échantillon de convenance. Diffuser le questionnaire dans trois groupes WhatsApp et sur son profil Instagram, ce n'est pas tirer au sort, c'est interroger les personnes joignables. Un test se calcule quand même sur de telles données, mais son résultat ne dépasse pas les répondants. Cette limite se dit ouvertement dans les limites de l'étude, et c'est précisément là que des points se gagnent. Ce qui rend un échantillon méthodologiquement solide et à partir de quand une enquête est représentative est traité dans les deux articles liés.
Ce que dit la p-value, et ce qu'elle ne dit pas
La p-value indique la probabilité d'obtenir un résultat comme le tien, ou plus extrême, si l'hypothèse nulle était vraie et si toutes les autres hypothèses de ton modèle étaient satisfaites, à commencer par le tirage aléatoire. Elle parle donc des données sous ces hypothèses, pas des hypothèses elles-mêmes. Une p-value faible peut donc aussi signifier que l'une d'elles ne tient pas.
L'American Statistical Association a publié en 2016 six principes sur la p-value, tant les contresens s'étaient répandus dans la littérature scientifique. Le deuxième principe ne laisse aucune marge : « P-values do not measure the probability that the studied hypothesis is true … » (Wasserstein et Lazar 2016). La phrase écarte ensuite le second contresens le plus fréquent : la p-value ne dit pas davantage quelle est la probabilité que ton résultat soit dû au seul hasard. Une p-value de 0,03 ne signifie donc pas que ton hypothèse a 97 % de chances d'être vraie. Ce que donnent tes deux propres groupes, le calculateur de valeur p te le montre, l'interprétation reste malgré tout ton travail.
La p-value ne mesure pas davantage la taille ni l'importance d'un effet, c'est le cinquième principe de la même prise de position. Sur un très grand échantillon, un écart minuscule et sans portée pratique peut devenir significatif. Accompagne donc toujours la p-value d'une taille d'effet et, si possible, d'un intervalle de confiance.
Ce que couvre un intervalle de confiance
L'Insee résume l'essentiel dans sa définition de l'intervalle de confiance : les estimations d'une enquête par sondage s'écartent légèrement des résultats qu'aurait donnés une interrogation exhaustive, et un intervalle à 95 % a 95 % de chances de contenir cette valeur exhaustive. L'institut précise surtout ce que l'intervalle ne couvre pas : ni les erreurs de réponse ni les biais de non-réponse (Insee, Intervalle de confiance). Un intervalle étroit ne prouve donc pas une bonne enquête, seulement un échantillon suffisant. Pour formuler tes suppositions en amont, vois l'article sur les hypothèses de recherche.
La statistique descriptive dans ta partie résultats
La partie résultats commence par la statistique descriptive, et précisément par la description de l'échantillon : effectif, taux de réponse, répartition par âge, sexe, année d'étude ou ce que ta problématique exige. Viennent ensuite les indicateurs des variables de fond, et en dernier les tests d'hypothèses.
Une règle simple gouverne la présentation. Ce qui tient en deux phrases reste dans le texte. Ce qui dépasse trois valeurs passe dans un tableau. Ce qui doit montrer une distribution ou une évolution devient un graphique. Chaque tableau indique n et les indicateurs adaptés au niveau de mesure, donc moyenne et écart type pour les variables métriques, fréquences pour les nominales. Chaque graphique porte des axes libellés avec leur unité.
Avec quoi calculer
Un tableur suffit largement pour la position et la dispersion. SPSS est la norme dans beaucoup d'universités mais reste payant ; JASP et jamovi sont gratuits, se manipulent de façon comparable et couvrent les procédures habituellement requises dans un mémoire. R et Python valent le détour si tu les pratiques déjà. Ce qui compte pour la note n'est pas le logiciel mais la traçabilité de ton calcul.
Tout devient plus simple quand les données arrivent déjà structurées. Une enquête en ligne se télécharge en fichier Excel ou CSV, ce qui évite la ressaisie et les fautes de frappe qui vont avec. empirio.ai, un outil de sondage en ligne allemand, affiche fréquences et moyennes directement dans son tableau de résultats et exporte aussi les données brutes en fichier.
Les erreurs les plus fréquentes
La plupart des faiblesses d'une partie résultats ne sont pas des erreurs de calcul mais des erreurs d'appariement : un indicateur s'applique à des données qui ne s'y prêtent pas, ou un chiffre se voit attribuer plus de sens qu'il n'en porte. Quatre schémas reviennent sans cesse.
Les quatre passent inaperçus à l'écriture et sautent aux yeux à la lecture. Relire la partie résultats en les cherchant prend un quart d'heure avant le dépôt, et c'est exactement là que le jury revient en soutenance.
Une moyenne sur une variable nominale
Une moyenne de 1,6 sur une variable dont les codes désignent des filières n'est pas une information, c'est un sous-produit du codage. Sur des variables nominales, tu rapportes des fréquences et des proportions, rien d'autre. Le test est rapide : si l'énoncé change quand tu réattribues les codes, l'indicateur est irrecevable.
Ne rapporter que la moyenne
Une moyenne sans indicateur de dispersion masque la moitié de l'information. Environ 6,4 heures par semaine peuvent signifier que tout le monde travaille six heures, ou qu'une partie des répondants y passe deux heures et une autre onze. Écart type et effectif figurent donc sur la même ligne que la moyenne.
Des pourcentages sans base
« 60 % des répondants sont d'accord » paraît solide, jusqu'à ce qu'on apprenne que cinq personnes ont répondu. En dessous d'une vingtaine de cas, une seule personne pèse plus de cinq points de pourcentage, ce qui rend le chiffre absolu plus honnête. Donne-le toujours, donc « trois sur cinq ».
Confondre significativité et importance
Un écart significatif n'est pas automatiquement un écart important. Ce qui décide de la portée pratique, c'est la taille d'effet, située par rapport aux usages de ta discipline et jugée à l'aune de ce qui changerait vraiment quelque chose dans ton cas. Des formules comme « hautement significatif » suggèrent une ampleur que la p-value ne mesure pas.
Conclusion
La statistique descriptive n'est pas un échauffement avant la vraie analyse. Dans beaucoup de travaux étudiants, elle est l'analyse complète. Qui a interrogé tout le monde, ou n'a pas pu tirer au sort, décrit soigneusement et nomme les limites plutôt que de lancer un test que les données ne portent pas. Et qui teste place une taille d'effet à côté de la p-value.
Un échantillon décrit honnêtement vaut mieux qu'une étoile derrière un chiffre.
Pour aller plus loin
- Tu cherches la bonne méthode ? Les méthodes d'analyse en un coup d'œil
- Tu prépares la partie empirique ? Rédiger un mémoire empirique
- Tu hésites sur tes échelles ? Déterminer le niveau de mesure
- Tu veux reprendre depuis le début ? La recherche quantitative
Tu préfères ne pas ressaisir tes données ?
Avec empirio.ai, tu crées ton questionnaire gratuitement et tu obtiens fréquences, moyennes et export des données brutes sans étape supplémentaire. Créer un questionnaire
