empirio.ai

Qu'est-ce qu'une échelle d'évaluation? Définition et exemple

Nous passons en revue les types d’échelles d’évaluation, le nombre d’échelons à prévoir, la façon de les nommer en français et l’indicateur que tu as le droit de publier.

Autrice chez empirio.ai - Maria Malzewpar Maria MalzewMis à jour le 18 septembre 2026Temps de lecture 14 min

« À quel point cet atelier t’a-t-il été utile ? » En dessous, six cases, de « pas du tout » à « énormément ». Ce format revient dans presque tous les questionnaires et il porte un nom : l’échelle d’évaluation.

Une échelle d’évaluation est un format de réponse gradué sur lequel une personne interrogée indique l’intensité d’une caractéristique chez elle, en général sur cinq à sept échelons répartis entre deux bornes. Tu vas voir ici combien d’échelons choisir, comment les nommer en français et quel indicateur tu as le droit de publier.


📌 L’essentiel en bref

  • Une échelle d’évaluation mesure des degrés, pas des oui ou non.
  • Cinq à sept échelons restent la recommandation la plus courante.
  • Au sens strict, une échelle d’évaluation reste ordinale.
  • Nommer chaque échelon vaut mieux que nommer les deux bornes.
  • La modalité « ne sait pas » n’appartient pas à l’échelle.

Créer un sondage gratuitement

Avec empirio.ai, vous créez un sondage en ligne moderne en quelques minutes — avec un hébergement dans l'UE.

  • Sondage créé par IA
  • Ajustez en glisser-déposer
  • Analyse en temps réel
Commencer gratuitement

Qu’est-ce qu’une échelle d’évaluation ?

Une échelle d’évaluation est un format de réponse fermé composé de plusieurs échelons ordonnés, sur lequel une personne interrogée situe l’intensité d’une caractéristique, par exemple de « très insatisfait » à « très satisfait ». Le mot anglais rating signifie appréciation ou notation, et le français hésite entre trois traductions : échelle d’évaluation, échelle de notation, échelle d’appréciation.

Une question fermée par oui ou non sépare deux groupes et rien de plus, alors qu’une échelle d’évaluation montre où quelqu’un se place entre les deux bornes. Parmi les types de questions d’un questionnaire, c’est le format standard pour les attitudes, la satisfaction et les auto-évaluations, sur papier comme dans un sondage en ligne.

Deux usages coexistent. L’autoévaluation demande à quelqu’un de se juger lui-même, son niveau de trac avant un oral par exemple. L’hétéroévaluation confie ce jugement à un tiers, un enseignant qui apprécie la participation d’un groupe. Le questionnaire a la même allure dans les deux cas, mais les sources d’erreur, elles, n’ont rien à voir.

Une échelle d’évaluation ne mesure pas ce qui est, mais ce qui est ressenti.

Reste une confusion fréquente en français. Dans la finance, « échelle de notation » désigne les degrés de solvabilité attribués par les agences, du AAA au D. Le présent article ne parle que du format de réponse dans un questionnaire.

Quel niveau de mesure pour une échelle d’évaluation ?

Au sens strict, une échelle d’évaluation mesure au niveau ordinal. Les échelons se suivent dans un ordre clair, mais rien ne prouve que l’écart entre « plutôt pas d’accord » et « ni l’un ni l’autre » vaut celui qui sépare « plutôt d’accord » de « tout à fait d’accord ».

Le cours de psychométrie SCALP range ce genre de format parmi les échelles ordinales, avec pour exemple les échelles d’appréciation où l’on demande un jugement du type « Très bon, Bon, Moyen, Mauvais, Très mauvais » (SCALP, cours de psychométrie, échelle ordinale). L’Insee le dit autrement : « les répondants ayant leur propre interprétation des échelles de réponse, il se peut très bien qu’elles ne soient pas utilisées de la même façon par tous pour dire la même chose » (Insee, France, portrait social, édition 2011).

Un critère simple tranche pour ton propre travail : question isolée, ou score agrégé sur plusieurs questions ?

Échelle d’évaluation et échelle de Likert : où passe la frontière

Une échelle de Likert est une forme particulière d’échelle d’évaluation, pas une solution concurrente. Elle suppose une dimension d’accord, plusieurs items du même concept et un score commun. Prise isolément, une de ces questions s’appelle plus justement item de Likert, et elle reste ordinale. Notre article sur l’échelle de Likert détaille ce qu’elle exige en plus.

Un score calculé sur plusieurs items, à l’inverse, s’analyse en pratique comme une échelle d’intervalle. Non que l’addition fasse monter le niveau de mesure, elle ne le fait pas : un tel score compte beaucoup de valeurs possibles et les méthodes courantes résistent bien à cette entorse. Cela reste une hypothèse.

Pour la partie méthodologie

Qui calcule une moyenne sur des échelons ajoute une phrase au mémoire : « les modalités de réponse ont été traitées comme équidistantes ». Sans elle, l’analyse revendique un niveau de mesure que les données ne portent pas.

Quels types d’échelles d’évaluation existe-t-il ?

Une échelle d’évaluation ne se décrit pas seulement par sa longueur. Trois questions suffisent à la caractériser : le sens de la graduation, la nature des marques et la finesse de la réponse.

Le trio compte, car ces trois choix décident de la qualité des données. Reprenons-les un par un.

Unipolaire ou bipolaire : combien de directions l’échelle couvre

Un avertissement avant les exemples : les recommandations de GESIS, l’institut allemand des sciences sociales, notent qu’il n’existe pas de définition unique de la polarité. Mieux vaut donc préciser celle que tu suis.

Une échelle unipolaire mesure l’intensité d’une seule caractéristique, de rien du tout à un maximum. Prenons la question « Dans quelle mesure la charge de travail de ce semestre te pèse-t-elle ? », avec des échelons allant de « pas du tout » à « énormément ».

Une échelle bipolaire place deux caractéristiques contraires aux extrémités, tendu et détendu par exemple. Prenons cette fois « L’ambiance pendant les répétitions de la chorale te paraît plutôt… », de « tendue » à « détendue ». Les deux pôles se définissent l’un par l’autre, ce qui rend la forme exigeante : le milieu doit vouloir dire quelque chose.

Mots, chiffres, symboles ou trait continu : comment les échelons sont marqués

Les marques sont ce que les personnes interrogées voient. Quatre formes reviennent partout.

Type de marqueÀ quoi elle ressembleCe qu’elle vaut
Verbaleun mot par écheloncas standard, le moins ambigu
Numériquedes chiffres, par exemple de 0 à 20systèmes familiers comme la notation scolaire
Symboliquesmileys, étoiles, poucesenfants, retours très courts
Graphiqueun point posé sur un traitnuances fines, en ligne uniquement

Les marques numériques paraissent limpides, et elles ne le sont pas toujours. La notation scolaire française en est le meilleur exemple : vingt et un échelons de 0 à 20, avec des mots posés par-dessus les chiffres. Selon éduscol, un candidat au baccalauréat est « déclaré définitivement admis » à partir de 10 sur 20, et les mentions suivent des seuils fixes : assez bien à 12, bien à 14, très bien à 16 (éduscol, présentation du baccalauréat général).

Aucun élève n’a besoin qu’on lui explique ces chiffres, tout le monde les a vécus. Le Net Promoter Score, gradué de 0 à 10, illustre la variante où seules les bornes portent un mot.

Échelons discrets ou réponse continue : la finesse de la mesure

La plupart des échelles d’évaluation sont graduées par paliers : un nombre fixe de cases, rien entre deux cases. Voilà le cas normal, sur papier comme à l’écran.

Les échelles continues remplacent les cases par un curseur sur lequel un point quelconque peut être choisi. En médecine, la même idée s’appelle échelle visuelle analogique et sert à mesurer la douleur. Le procédé n’a de sens qu’en ligne : sur papier, il faudrait mesurer chaque réponse à la règle.

Échelle d’évaluation à cinq échelons dans le questionnaire d’un sondage en ligne

Combien d’échelons pour une échelle d’évaluation ?

Cinq à sept échelons, telle est la recommandation la plus répandue. Les recommandations de GESIS situent l’optimum de fiabilité, de validité et de finesse entre cinq et sept catégories, intervalle que les personnes interrogées préfèrent elles aussi (Menold et Bogner 2015, GESIS Survey Guidelines).

L’affaire n’est pas close pour autant. Le même document cite des travaux plus récents où la qualité de mesure progresse encore avec le nombre de catégories, testé jusqu’à 10, 11 et même 100 échelons. La règle s’est imposée quand même, pour une raison pratique : au-delà, les mots justes manquent.

Pour ton propre questionnaire : reste à cinq si tu nommes chaque échelon, passe à sept s’il te faut des nuances plus fines. En dessous, la finesse se perd ; au-dessus, le vocabulaire ne suit plus.

Nombre pair ou impair : la question du milieu

Un nombre impair d’échelons offre un milieu, un nombre pair force une prise de position. Tout dépend de l’existence réelle d’une position intermédiaire : devant « À quel point es-tu satisfait ? », l’indécision existe vraiment ; devant « Recommanderais-tu cet atelier ? », beaucoup moins.

GESIS résume que la plupart des chercheurs conseillent de proposer la catégorie médiane. L’argument n’est pas le confort mais la qualité des données : sans milieu, les personnes réellement neutres basculent vers un échelon voisin et créent une tendance qui n’existe pas. Sur une échelle bipolaire, ce milieu reste toutefois ambigu, entre « ni l’un ni l’autre » et « un peu des deux ».

Le cas particulier des échelles en onze points

Une graduation de 0 à 10 revient partout dans la statistique publique française. L’Insee mesure la satisfaction dans son dispositif SRCV avec une question dont seules les bornes portent un mot : « sur une échelle allant de 0 (pas du tout satisfait) à 10 (très satisfait), indiquez votre satisfaction concernant la vie que vous menez actuellement » (Insee, enquête SRCV 2010). Onze échelons, deux mots en tout. Le format gagne en finesse ce qu’il perd en clarté.

Attention

« Ne sait pas » et « refus de répondre » ne sont pas des échelons et n’ont rien à faire au milieu de l’échelle. Leur place est à part, en fin de liste, et l’analyse les compte comme valeurs manquantes. Les proposer ou non dépend, selon GESIS, du sujet, du mode de collecte et du public visé. La même source renvoie aux travaux de Sturgis et de ses collègues : sans cette modalité, les personnes se rabattent sur la catégorie médiane.

Créer un sondage gratuitement

Avec empirio.ai, vous créez un sondage en ligne moderne en quelques minutes — avec un hébergement dans l'UE.

  • Sondage créé par IA
  • Ajustez en glisser-déposer
  • Analyse en temps réel
Commencer gratuitement

Nommer les échelons : ce que le français change

Nomme chaque échelon, pas seulement les deux extrémités. Les recommandations de GESIS se prononcent plutôt en faveur des échelles entièrement verbalisées, qui améliorent la fiabilité et la validité et que les personnes interrogées préfèrent, l’écart étant net chez les personnes peu diplômées.

Quatre conditions font un bon jeu de mots : la précision, la symétrie entre échelons positifs et négatifs, l’intelligibilité et des écarts qui paraissent égaux. La dernière est la plus difficile, parce que « parfois » et « souvent » ne se placent pas au même endroit pour tout le monde.

Et surtout, ces mots ne se traduisent pas : une graduation calibrée pour une langue perd sa régularité dans une autre. Bernd Rohrmann a proposé dès 1978, pour l’allemand, des listes de mots dont les écarts avaient été mesurés empiriquement, listes que l’institut bavarois pour la qualité scolaire reprend encore (ISB Bayern, formats de réponse). Traduire « oft » par « souvent » revient à supposer que les deux mots marquent le même intervalle, ce que personne n’a montré.

Des formulations françaises prêtes à l’emploi

Pour le français, le plus sûr est de reprendre des formulations déjà éprouvées dans une grande enquête nationale. L’Insee interroge les ménages sur leur situation financière ressentie avec six échelons nommés et sans milieu : « Actuellement, pour le ménage, diriez-vous plutôt que financièrement : 1) Vous ne pouvez pas y arriver sans faire de dettes, 2) Vous y arrivez difficilement, 3) C’est juste, il faut faire attention, 4) Ça va, 5) Vous êtes plutôt à l’aise, 6) Vous êtes vraiment à l’aise » (Insee, enquête SRCV).

Dans l’enquête SRCV de 2010, une partie des répondants a noté de 0 à 10 la situation d’une personne fictive, la même pour tout le monde. Huit sur dix l’ont placée entre 2 et 5, et cette dispersion montre que l’échelle ne s’utilise pas de la même façon d’une personne à l’autre. Si l’écart existe déjà dans une seule langue, une liste importée d’une autre n’a aucune chance d’être équidistante.

Conseil

Interroge sur la chose elle-même plutôt que sur l’accord. Au lieu de « Je réponds souvent à des sondages », demande « À quelle fréquence réponds-tu à des sondages ? » avec des échelons de fréquence. GESIS déconseille les échelles d’accord, qui produisent davantage d’approbation.

Analyser une échelle d’évaluation : quel indicateur publier

Publie d’abord la distribution des fréquences, soit le nombre de personnes ayant choisi chaque échelon. Cette information est licite à tous les niveaux de mesure et montre ce que tout résumé chiffré dissimule.

Un exemple. Deux ateliers notés de 1 à 6 par vingt participants chacun obtiennent tous deux 3,5 de moyenne. Dans le premier, dix personnes ont coché 3 et dix autres 4. Dans le second, dix ont coché 1 et dix ont coché 6. Même moyenne, même médiane, deux réalités opposées. Seul l’écart type les sépare : 0,5 d’un côté, 2,5 de l’autre.

IndicateurQuand il convientCe qu’il montre
Distribution des fréquencestoujoursl’effectif de chaque échelon
Modetoujoursl’échelon le plus choisi
Médianesur une question isoléela réponse centrale
Moyennesur un score d’échellele niveau moyen sur plusieurs items
Écart typesur un score d’échellel’étalement des réponses
Satisfaits cumuléspour un rapport ou une présentationla part des deux échelons du haut

La moyenne n’est donc pas interdite, elle demande une justification. Sur une question isolée, la médiane est le choix prudent, parce qu’elle ne suppose qu’un ordre. Sur un score bâti sur plusieurs items du même concept, la moyenne est usuelle et défendable, à condition d’annoncer l’équidistance.

Même partage pour les comparaisons de groupes : les rangs pour les questions isolées, la moyenne et la dispersion pour les scores d’échelle. Notre article sur la statistique descriptive et inférentielle situe la frontière entre les deux familles.

Le taux de satisfaits cumulés revient dans tous les rapports de terrain. Additionner les deux échelons du haut donne une phrase facile à retenir, du type « 78 % se disent satisfaits ou très satisfaits », mais coûte de l’information. Qui la publie joint la distribution en annexe.

Les erreurs les plus fréquentes

La plupart des faiblesses d’une échelle d’évaluation naissent à la rédaction, pas au calcul. Les biais de réponse désignent la tendance de certaines personnes à décaler leurs réponses dans une direction donnée, sans rapport avec le contenu. Le décalage va toujours dans le même sens et ne se compense donc pas.

Les quatre schémas ci-dessous sont bien documentés et résumés dans les recommandations de GESIS consacrées aux biais de réponse (Bogner et Landrock 2015, GESIS Survey Guidelines). Aucun ne se règle par un échantillon plus grand, tous se règlent par un meilleur questionnaire.

La tendance centrale tire les réponses vers le milieu

Certaines personnes cochent les échelons du milieu quel que soit le contenu, parce que cela demande moins d’effort qu’une prise de position. La distribution paraît alors plus équilibrée que les opinions réelles. Et quand une position intermédiaire n’a aucun sens, un nombre pair d’échelons règle le problème.

L’acquiescement fait approuver à peu près tout

L’acquiescement désigne la tendance à approuver une affirmation sans égard pour son contenu, à cocher partout « d’accord », « vrai » ou « oui ». GESIS ne connaît qu’un remède efficace : renoncer aux échelles d’accord et interroger directement sur la caractéristique. Qui y tient peut inverser la formulation de la moitié des items, ce qui rend le biais visible et protège la moyenne, sans sauver les corrélations ni les structures factorielles.

La désirabilité sociale embellit les sujets sensibles

Sur les thèmes perçus comme délicats, les personnes interrogées donnent la réponse attendue plutôt que la réponse exacte. Les comportements contraires à la norme sont minimisés, les conformes exagérés. Bonne nouvelle pour les questionnaires en ligne : GESIS retient que ce biais s’atténue sans enquêteur présent. L’effet ne disparaît pas, il diminue.

Les réponses extrêmes ne dépendent pas que du sujet

Les réponses extrêmes forment le pendant de la tendance centrale, soit la propension à choisir les échelons du bout quel que soit le contenu. Savoir si un trait de personnalité stable se cache derrière n’est pas tranché par la recherche. GESIS retient en revanche que les enquêtes écrites et en ligne sont moins touchées que le téléphone et le face-à-face.

Un dernier défaut tient à la mise en page. Les échelons doivent être espacés régulièrement, faute de quoi le centre visuel de l’échelle ne coïncide plus avec son centre logique. D’autres réglages figurent dans nos conseils pour les sondages en ligne.

Conclusion

Une échelle d’évaluation se met en place vite et se gâche tout aussi vite. Cinq échelons tous nommés, une décision assumée sur le milieu et une autre sur la modalité « ne sait pas » valent mieux que cent personnes interrogées en plus. Côté analyse : la distribution va toujours dans le rapport, la moyenne seulement avec une justification.

Un questionnaire testé sur trois personnes avant l’envoi révèle presque toujours un échelon mal nommé.

Pour aller plus loin


Envie de tester ton échelle avant de l’envoyer ?

Sur empirio.ai, un outil de sondage en ligne allemand, tu construis une échelle graduée en quelques minutes et tu vois, après quelques réponses de test, si la distribution dit ce que tu comptes publier.

Commencer gratuitement avec empirio.ai

Questions fréquentes

Une échelle d’évaluation est un format de réponse gradué dans un questionnaire, sur lequel une personne indique l’intensité d’une caractéristique chez elle. Au lieu d’un simple oui ou non, plusieurs échelons sont proposés, par exemple cinq degrés allant de « pas du tout d’accord » à « tout à fait d’accord ». Le français dit aussi échelle de notation ou échelle d’appréciation.

Au sens strict, une échelle d’évaluation mesure au niveau ordinal, puisque l’égalité des écarts entre échelons ne peut pas être démontrée. Les échelles d’appréciation, où l’on demande un jugement du type très bon, bon, moyen, mauvais, très mauvais, sont classées comme ordinales dans les cours de psychométrie. Pour une question isolée, cette lecture reste la bonne.

Cinq à sept échelons forment la recommandation la plus répandue. Les recommandations de GESIS présentent cet intervalle comme optimal pour la fiabilité, la validité et la finesse, et signalent que les personnes interrogées le préfèrent également. Des travaux plus récents observent encore des gains au-delà, mais la règle des cinq à sept reste celle de la pratique courante.

Une échelle unipolaire mesure l’intensité d’une seule caractéristique, par exemple de « pas du tout pesant » à « très pesant ». Une échelle bipolaire place deux caractéristiques contraires aux extrémités, tendu et détendu par exemple. Les recommandations de GESIS signalent qu’il n’existe pas de définition unique de la polarité dans la littérature méthodologique.

Sur une question isolée, la médiane est le choix prudent, parce qu’elle ne suppose qu’une relation d’ordre. Sur un score construit à partir de plusieurs items portant sur le même concept, la moyenne est usuelle et défendable, à condition d’écrire dans la partie méthodologie que les modalités ont été traitées comme équidistantes. La distribution complète accompagne les deux cas.

Une échelle de Likert est une forme particulière d’échelle d’évaluation, pas une solution concurrente. Elle suppose une dimension d’accord, plusieurs items portant sur le même concept et un score commun. Prise isolément, une question de ce type s’appelle item de Likert. Toute échelle de Likert est donc une échelle d’évaluation, mais l’inverse est loin d’être vrai.

Les recommandations de GESIS résument que la plupart des chercheurs conseillent de proposer une catégorie médiane. Sans elle, les personnes réellement neutres basculent vers un échelon voisin et faussent les données. Attention à la distinction : « ne sait pas » n’est pas un échelon, sa place est à part, à la fin de la liste, et l’analyse la compte comme valeur manquante.

Cela pourrait aussi vous intéresser

Lexique

Échelle de Likert : exemples, échelons et analyse

Combien d'échelons, avec un milieu ou sans ? Nous passons ces décisions en revue, donnons des formulations reprises du Baromètre de la DREES et disons ce que tu peux ensuite calculer.