« À quel point cet atelier t’a-t-il été utile ? » En dessous, six cases, de « pas du tout » à « énormément ». Ce format revient dans presque tous les questionnaires et il porte un nom : l’échelle d’évaluation.
Une échelle d’évaluation est un format de réponse gradué sur lequel une personne interrogée indique l’intensité d’une caractéristique chez elle, en général sur cinq à sept échelons répartis entre deux bornes. Tu vas voir ici combien d’échelons choisir, comment les nommer en français et quel indicateur tu as le droit de publier.
📌 L’essentiel en bref
- Une échelle d’évaluation mesure des degrés, pas des oui ou non.
- Cinq à sept échelons restent la recommandation la plus courante.
- Au sens strict, une échelle d’évaluation reste ordinale.
- Nommer chaque échelon vaut mieux que nommer les deux bornes.
- La modalité « ne sait pas » n’appartient pas à l’échelle.
Créer un sondage gratuitement
Avec empirio.ai, vous créez un sondage en ligne moderne en quelques minutes — avec un hébergement dans l'UE.
- Sondage créé par IA
- Ajustez en glisser-déposer
- Analyse en temps réel
Qu’est-ce qu’une échelle d’évaluation ?
Une échelle d’évaluation est un format de réponse fermé composé de plusieurs échelons ordonnés, sur lequel une personne interrogée situe l’intensité d’une caractéristique, par exemple de « très insatisfait » à « très satisfait ». Le mot anglais rating signifie appréciation ou notation, et le français hésite entre trois traductions : échelle d’évaluation, échelle de notation, échelle d’appréciation.
Une question fermée par oui ou non sépare deux groupes et rien de plus, alors qu’une échelle d’évaluation montre où quelqu’un se place entre les deux bornes. Parmi les types de questions d’un questionnaire, c’est le format standard pour les attitudes, la satisfaction et les auto-évaluations, sur papier comme dans un sondage en ligne.
Deux usages coexistent. L’autoévaluation demande à quelqu’un de se juger lui-même, son niveau de trac avant un oral par exemple. L’hétéroévaluation confie ce jugement à un tiers, un enseignant qui apprécie la participation d’un groupe. Le questionnaire a la même allure dans les deux cas, mais les sources d’erreur, elles, n’ont rien à voir.
Une échelle d’évaluation ne mesure pas ce qui est, mais ce qui est ressenti.
Reste une confusion fréquente en français. Dans la finance, « échelle de notation » désigne les degrés de solvabilité attribués par les agences, du AAA au D. Le présent article ne parle que du format de réponse dans un questionnaire.
Quel niveau de mesure pour une échelle d’évaluation ?
Au sens strict, une échelle d’évaluation mesure au niveau ordinal. Les échelons se suivent dans un ordre clair, mais rien ne prouve que l’écart entre « plutôt pas d’accord » et « ni l’un ni l’autre » vaut celui qui sépare « plutôt d’accord » de « tout à fait d’accord ».
Le cours de psychométrie SCALP range ce genre de format parmi les échelles ordinales, avec pour exemple les échelles d’appréciation où l’on demande un jugement du type « Très bon, Bon, Moyen, Mauvais, Très mauvais » (SCALP, cours de psychométrie, échelle ordinale). L’Insee le dit autrement : « les répondants ayant leur propre interprétation des échelles de réponse, il se peut très bien qu’elles ne soient pas utilisées de la même façon par tous pour dire la même chose » (Insee, France, portrait social, édition 2011).
Un critère simple tranche pour ton propre travail : question isolée, ou score agrégé sur plusieurs questions ?
Échelle d’évaluation et échelle de Likert : où passe la frontière
Une échelle de Likert est une forme particulière d’échelle d’évaluation, pas une solution concurrente. Elle suppose une dimension d’accord, plusieurs items du même concept et un score commun. Prise isolément, une de ces questions s’appelle plus justement item de Likert, et elle reste ordinale. Notre article sur l’échelle de Likert détaille ce qu’elle exige en plus.
Un score calculé sur plusieurs items, à l’inverse, s’analyse en pratique comme une échelle d’intervalle. Non que l’addition fasse monter le niveau de mesure, elle ne le fait pas : un tel score compte beaucoup de valeurs possibles et les méthodes courantes résistent bien à cette entorse. Cela reste une hypothèse.
Pour la partie méthodologie
Qui calcule une moyenne sur des échelons ajoute une phrase au mémoire : « les modalités de réponse ont été traitées comme équidistantes ». Sans elle, l’analyse revendique un niveau de mesure que les données ne portent pas.
Quels types d’échelles d’évaluation existe-t-il ?
Une échelle d’évaluation ne se décrit pas seulement par sa longueur. Trois questions suffisent à la caractériser : le sens de la graduation, la nature des marques et la finesse de la réponse.
Le trio compte, car ces trois choix décident de la qualité des données. Reprenons-les un par un.
Unipolaire ou bipolaire : combien de directions l’échelle couvre
Un avertissement avant les exemples : les recommandations de GESIS, l’institut allemand des sciences sociales, notent qu’il n’existe pas de définition unique de la polarité. Mieux vaut donc préciser celle que tu suis.
Une échelle unipolaire mesure l’intensité d’une seule caractéristique, de rien du tout à un maximum. Prenons la question « Dans quelle mesure la charge de travail de ce semestre te pèse-t-elle ? », avec des échelons allant de « pas du tout » à « énormément ».
Une échelle bipolaire place deux caractéristiques contraires aux extrémités, tendu et détendu par exemple. Prenons cette fois « L’ambiance pendant les répétitions de la chorale te paraît plutôt… », de « tendue » à « détendue ». Les deux pôles se définissent l’un par l’autre, ce qui rend la forme exigeante : le milieu doit vouloir dire quelque chose.
Mots, chiffres, symboles ou trait continu : comment les échelons sont marqués
Les marques sont ce que les personnes interrogées voient. Quatre formes reviennent partout.
| Type de marque | À quoi elle ressemble | Ce qu’elle vaut |
|---|---|---|
| Verbale | un mot par échelon | cas standard, le moins ambigu |
| Numérique | des chiffres, par exemple de 0 à 20 | systèmes familiers comme la notation scolaire |
| Symbolique | smileys, étoiles, pouces | enfants, retours très courts |
| Graphique | un point posé sur un trait | nuances fines, en ligne uniquement |
Les marques numériques paraissent limpides, et elles ne le sont pas toujours. La notation scolaire française en est le meilleur exemple : vingt et un échelons de 0 à 20, avec des mots posés par-dessus les chiffres. Selon éduscol, un candidat au baccalauréat est « déclaré définitivement admis » à partir de 10 sur 20, et les mentions suivent des seuils fixes : assez bien à 12, bien à 14, très bien à 16 (éduscol, présentation du baccalauréat général).
Aucun élève n’a besoin qu’on lui explique ces chiffres, tout le monde les a vécus. Le Net Promoter Score, gradué de 0 à 10, illustre la variante où seules les bornes portent un mot.
Échelons discrets ou réponse continue : la finesse de la mesure
La plupart des échelles d’évaluation sont graduées par paliers : un nombre fixe de cases, rien entre deux cases. Voilà le cas normal, sur papier comme à l’écran.
Les échelles continues remplacent les cases par un curseur sur lequel un point quelconque peut être choisi. En médecine, la même idée s’appelle échelle visuelle analogique et sert à mesurer la douleur. Le procédé n’a de sens qu’en ligne : sur papier, il faudrait mesurer chaque réponse à la règle.

Combien d’échelons pour une échelle d’évaluation ?
Cinq à sept échelons, telle est la recommandation la plus répandue. Les recommandations de GESIS situent l’optimum de fiabilité, de validité et de finesse entre cinq et sept catégories, intervalle que les personnes interrogées préfèrent elles aussi (Menold et Bogner 2015, GESIS Survey Guidelines).
L’affaire n’est pas close pour autant. Le même document cite des travaux plus récents où la qualité de mesure progresse encore avec le nombre de catégories, testé jusqu’à 10, 11 et même 100 échelons. La règle s’est imposée quand même, pour une raison pratique : au-delà, les mots justes manquent.
Pour ton propre questionnaire : reste à cinq si tu nommes chaque échelon, passe à sept s’il te faut des nuances plus fines. En dessous, la finesse se perd ; au-dessus, le vocabulaire ne suit plus.
Nombre pair ou impair : la question du milieu
Un nombre impair d’échelons offre un milieu, un nombre pair force une prise de position. Tout dépend de l’existence réelle d’une position intermédiaire : devant « À quel point es-tu satisfait ? », l’indécision existe vraiment ; devant « Recommanderais-tu cet atelier ? », beaucoup moins.
GESIS résume que la plupart des chercheurs conseillent de proposer la catégorie médiane. L’argument n’est pas le confort mais la qualité des données : sans milieu, les personnes réellement neutres basculent vers un échelon voisin et créent une tendance qui n’existe pas. Sur une échelle bipolaire, ce milieu reste toutefois ambigu, entre « ni l’un ni l’autre » et « un peu des deux ».
Le cas particulier des échelles en onze points
Une graduation de 0 à 10 revient partout dans la statistique publique française. L’Insee mesure la satisfaction dans son dispositif SRCV avec une question dont seules les bornes portent un mot : « sur une échelle allant de 0 (pas du tout satisfait) à 10 (très satisfait), indiquez votre satisfaction concernant la vie que vous menez actuellement » (Insee, enquête SRCV 2010). Onze échelons, deux mots en tout. Le format gagne en finesse ce qu’il perd en clarté.
Attention
« Ne sait pas » et « refus de répondre » ne sont pas des échelons et n’ont rien à faire au milieu de l’échelle. Leur place est à part, en fin de liste, et l’analyse les compte comme valeurs manquantes. Les proposer ou non dépend, selon GESIS, du sujet, du mode de collecte et du public visé. La même source renvoie aux travaux de Sturgis et de ses collègues : sans cette modalité, les personnes se rabattent sur la catégorie médiane.
Créer un sondage gratuitement
Avec empirio.ai, vous créez un sondage en ligne moderne en quelques minutes — avec un hébergement dans l'UE.
- Sondage créé par IA
- Ajustez en glisser-déposer
- Analyse en temps réel
Nommer les échelons : ce que le français change
Nomme chaque échelon, pas seulement les deux extrémités. Les recommandations de GESIS se prononcent plutôt en faveur des échelles entièrement verbalisées, qui améliorent la fiabilité et la validité et que les personnes interrogées préfèrent, l’écart étant net chez les personnes peu diplômées.
Quatre conditions font un bon jeu de mots : la précision, la symétrie entre échelons positifs et négatifs, l’intelligibilité et des écarts qui paraissent égaux. La dernière est la plus difficile, parce que « parfois » et « souvent » ne se placent pas au même endroit pour tout le monde.
Et surtout, ces mots ne se traduisent pas : une graduation calibrée pour une langue perd sa régularité dans une autre. Bernd Rohrmann a proposé dès 1978, pour l’allemand, des listes de mots dont les écarts avaient été mesurés empiriquement, listes que l’institut bavarois pour la qualité scolaire reprend encore (ISB Bayern, formats de réponse). Traduire « oft » par « souvent » revient à supposer que les deux mots marquent le même intervalle, ce que personne n’a montré.
Des formulations françaises prêtes à l’emploi
Pour le français, le plus sûr est de reprendre des formulations déjà éprouvées dans une grande enquête nationale. L’Insee interroge les ménages sur leur situation financière ressentie avec six échelons nommés et sans milieu : « Actuellement, pour le ménage, diriez-vous plutôt que financièrement : 1) Vous ne pouvez pas y arriver sans faire de dettes, 2) Vous y arrivez difficilement, 3) C’est juste, il faut faire attention, 4) Ça va, 5) Vous êtes plutôt à l’aise, 6) Vous êtes vraiment à l’aise » (Insee, enquête SRCV).
Dans l’enquête SRCV de 2010, une partie des répondants a noté de 0 à 10 la situation d’une personne fictive, la même pour tout le monde. Huit sur dix l’ont placée entre 2 et 5, et cette dispersion montre que l’échelle ne s’utilise pas de la même façon d’une personne à l’autre. Si l’écart existe déjà dans une seule langue, une liste importée d’une autre n’a aucune chance d’être équidistante.
Conseil
Interroge sur la chose elle-même plutôt que sur l’accord. Au lieu de « Je réponds souvent à des sondages », demande « À quelle fréquence réponds-tu à des sondages ? » avec des échelons de fréquence. GESIS déconseille les échelles d’accord, qui produisent davantage d’approbation.
Analyser une échelle d’évaluation : quel indicateur publier
Publie d’abord la distribution des fréquences, soit le nombre de personnes ayant choisi chaque échelon. Cette information est licite à tous les niveaux de mesure et montre ce que tout résumé chiffré dissimule.
Un exemple. Deux ateliers notés de 1 à 6 par vingt participants chacun obtiennent tous deux 3,5 de moyenne. Dans le premier, dix personnes ont coché 3 et dix autres 4. Dans le second, dix ont coché 1 et dix ont coché 6. Même moyenne, même médiane, deux réalités opposées. Seul l’écart type les sépare : 0,5 d’un côté, 2,5 de l’autre.
| Indicateur | Quand il convient | Ce qu’il montre |
|---|---|---|
| Distribution des fréquences | toujours | l’effectif de chaque échelon |
| Mode | toujours | l’échelon le plus choisi |
| Médiane | sur une question isolée | la réponse centrale |
| Moyenne | sur un score d’échelle | le niveau moyen sur plusieurs items |
| Écart type | sur un score d’échelle | l’étalement des réponses |
| Satisfaits cumulés | pour un rapport ou une présentation | la part des deux échelons du haut |
La moyenne n’est donc pas interdite, elle demande une justification. Sur une question isolée, la médiane est le choix prudent, parce qu’elle ne suppose qu’un ordre. Sur un score bâti sur plusieurs items du même concept, la moyenne est usuelle et défendable, à condition d’annoncer l’équidistance.
Même partage pour les comparaisons de groupes : les rangs pour les questions isolées, la moyenne et la dispersion pour les scores d’échelle. Notre article sur la statistique descriptive et inférentielle situe la frontière entre les deux familles.
Le taux de satisfaits cumulés revient dans tous les rapports de terrain. Additionner les deux échelons du haut donne une phrase facile à retenir, du type « 78 % se disent satisfaits ou très satisfaits », mais coûte de l’information. Qui la publie joint la distribution en annexe.
Les erreurs les plus fréquentes
La plupart des faiblesses d’une échelle d’évaluation naissent à la rédaction, pas au calcul. Les biais de réponse désignent la tendance de certaines personnes à décaler leurs réponses dans une direction donnée, sans rapport avec le contenu. Le décalage va toujours dans le même sens et ne se compense donc pas.
Les quatre schémas ci-dessous sont bien documentés et résumés dans les recommandations de GESIS consacrées aux biais de réponse (Bogner et Landrock 2015, GESIS Survey Guidelines). Aucun ne se règle par un échantillon plus grand, tous se règlent par un meilleur questionnaire.
La tendance centrale tire les réponses vers le milieu
Certaines personnes cochent les échelons du milieu quel que soit le contenu, parce que cela demande moins d’effort qu’une prise de position. La distribution paraît alors plus équilibrée que les opinions réelles. Et quand une position intermédiaire n’a aucun sens, un nombre pair d’échelons règle le problème.
L’acquiescement fait approuver à peu près tout
L’acquiescement désigne la tendance à approuver une affirmation sans égard pour son contenu, à cocher partout « d’accord », « vrai » ou « oui ». GESIS ne connaît qu’un remède efficace : renoncer aux échelles d’accord et interroger directement sur la caractéristique. Qui y tient peut inverser la formulation de la moitié des items, ce qui rend le biais visible et protège la moyenne, sans sauver les corrélations ni les structures factorielles.
La désirabilité sociale embellit les sujets sensibles
Sur les thèmes perçus comme délicats, les personnes interrogées donnent la réponse attendue plutôt que la réponse exacte. Les comportements contraires à la norme sont minimisés, les conformes exagérés. Bonne nouvelle pour les questionnaires en ligne : GESIS retient que ce biais s’atténue sans enquêteur présent. L’effet ne disparaît pas, il diminue.
Les réponses extrêmes ne dépendent pas que du sujet
Les réponses extrêmes forment le pendant de la tendance centrale, soit la propension à choisir les échelons du bout quel que soit le contenu. Savoir si un trait de personnalité stable se cache derrière n’est pas tranché par la recherche. GESIS retient en revanche que les enquêtes écrites et en ligne sont moins touchées que le téléphone et le face-à-face.
Un dernier défaut tient à la mise en page. Les échelons doivent être espacés régulièrement, faute de quoi le centre visuel de l’échelle ne coïncide plus avec son centre logique. D’autres réglages figurent dans nos conseils pour les sondages en ligne.
Conclusion
Une échelle d’évaluation se met en place vite et se gâche tout aussi vite. Cinq échelons tous nommés, une décision assumée sur le milieu et une autre sur la modalité « ne sait pas » valent mieux que cent personnes interrogées en plus. Côté analyse : la distribution va toujours dans le rapport, la moyenne seulement avec une justification.
Un questionnaire testé sur trois personnes avant l’envoi révèle presque toujours un échelon mal nommé.
Pour aller plus loin
- Envie de voir tous les niveaux de mesure ? Déterminer le niveau de mesure
- Des items d’accord dans ton questionnaire ? Échelle de Likert
- Besoin du bon format de réponse ? Types de questions dans un questionnaire
- Envie d’interroger ton équipe ? Mesurer la satisfaction des salariés
Envie de tester ton échelle avant de l’envoyer ?
Sur empirio.ai, un outil de sondage en ligne allemand, tu construis une échelle graduée en quelques minutes et tu vois, après quelques réponses de test, si la distribution dit ce que tu comptes publier.
