empirio.ai

¿Qué es una escala de calificación? Definición y ejemplo

Te contamos qué tipos de escalas de calificación hay, cuántos escalones necesita la tuya, cómo etiquetarlos en español y qué cifra puedes publicar al final.

Autora en empirio.ai - Maria Malzewpor Maria MalzewActualizado el 18 de septiembre de 2026Tiempo de lectura 15 min

«¿Hasta qué punto te ha resultado útil esta asignatura?», y debajo cinco casillas que van de «nada» a «muchísimo». Casi cualquier cuestionario lleva una pregunta con esa pinta, y el formato de respuesta tiene nombre propio: escala de calificación.

Una escala de calificación es un formato de respuesta graduado con el que una persona indica en qué medida presenta o percibe una característica. Ofrece varios escalones entre dos extremos, normalmente cinco o siete, y cada escalón representa un grado del juicio subjetivo. Al terminar este artículo sabrás cuántos escalones necesita tu escala, cómo etiquetarlos y qué cifra puedes publicar después.


📌 Lo esencial de un vistazo

  • Mide grados, no respuestas de sí o no.
  • De cinco a siete escalones es la recomendación más extendida.
  • Un ítem suelto se queda en nivel ordinal.
  • Las notas españolas van de 0 a 10 con tramos desiguales.
  • «No sabe» va fuera de la escala, nunca en el centro.

Crear encuesta gratis

Con empirio.ai creas una encuesta en línea moderna en pocos minutos — con alojamiento en la UE.

  • Encuesta creada con IA
  • Ajusta con arrastrar y soltar
  • Análisis en tiempo real
Empezar gratis

¿Qué es una escala de calificación?

Una escala de calificación es un formato de respuesta cerrado con varios escalones ordenados, con el que la persona encuestada valora la intensidad de algo, por ejemplo desde «nada satisfecho» hasta «muy satisfecho». La palabra viene del inglés rating, valoración o estimación.

La gracia está ahí: una pregunta de sí o no parte a la gente en dos bloques y se acabó, mientras que una escala recoge en qué punto del camino entre los extremos se coloca cada persona. Dentro de los tipos de preguntas, es el formato por defecto para actitudes y satisfacción.

Aparece además en dos papeles. En la autoevaluación, alguien se puntúa a sí mismo, por ejemplo los nervios antes de un examen. En la heteroevaluación, otra persona lo puntúa, como cuando un tutor valora la participación de un grupo. La escala se ve igual, pero las fuentes de error no se parecen en nada.

Una escala de calificación no mide cómo son las cosas, sino cómo se perciben.

Una aclaración más, porque en un buscador se mezcla todo: en el mundo financiero, «calificación» designa los niveles de solvencia con los que las agencias ordenan el riesgo de crédito. Hablamos aquí solo del formato de respuesta de un cuestionario o una encuesta en línea.

Calificación, valoración o «tipo Likert»: cómo se llama esto en español

En España, «calificación» suena antes que nada a nota académica, y por eso el formato circula con varios nombres. También leerás escala de valoración y, cuando los escalones expresan acuerdo, escala tipo Likert. Antonio Matas, de la Universidad de Málaga, avisa de que muchas se llaman «tipo Likert» por pura generalización, aunque sus alternativas no tengan que ver con el acuerdo (Matas 2018, Revista Electrónica de Investigación Educativa). Elige un nombre y mantenlo en todo tu trabajo.

¿Qué nivel de medición tiene una escala de calificación?

Una escala de calificación mide, en rigor, a nivel ordinal. Los escalones están ordenados, pero nadie puede demostrar que el salto de «poco» a «algo» mida lo mismo que el de «bastante» a «muchísimo».

La revisión de Matas lo dice sin rodeos: estas escalas «se diseñan a un nivel de medida ordinal», y las evidencias indican «que las distancias psicológicas entre alternativas de la escala no son iguales». Ahí empieza el lío, porque en la práctica casi todos calculan medias igualmente. La pregunta se resuelve con un criterio simple: ¿tienes delante un ítem suelto o varios ítems combinados en una puntuación única?

Escala de calificación y escala de Likert: dónde está la diferencia

Una escala de Likert no es una alternativa a la escala de calificación, sino una de sus formas de construcción. La reconocerás por tres rasgos: los escalones expresan acuerdo, hay varias afirmaciones sobre la misma característica y al final se suma o se promedia. Una afirmación aislada se llama con más propiedad ítem de tipo Likert y sigue siendo ordinal. El resto de requisitos está en nuestro artículo sobre la escala de Likert.

La puntuación que sale de varios ítems, en cambio, suele analizarse como si fuera una escala de intervalo. No porque sumar suba el nivel de medición, sino porque esa puntuación tiene muchos valores posibles y los procedimientos habituales aguantan bien la infracción. Sigue siendo un supuesto.

Para tu apartado de metodología

Quien calcula una media a partir de escalones verbales añade una frase: «Los escalones de respuesta se han tratado como equidistantes». Una línea, y el tribunal ya no tiene que preguntarlo.

¿Qué tipos de escalas de calificación existen?

Las escalas no se diferencian solo por su longitud, sino por tres decisiones: la dirección que recogen, lo que va escrito en cada escalón y cuánto afina la respuesta.

La combinación decide buena parte de la calidad de los datos, porque una escala con dos polos y solo los extremos etiquetados pide un esfuerzo muy distinto que una de cinco escalones con palabra propia.

Unipolar o bipolar: cuántas direcciones recoge la escala

Una advertencia antes de los ejemplos: la frontera no se traza igual en toda la literatura. Las guías de la GESIS alemana señalan que no existe una definición unitaria de la polaridad (Menold y Bogner 2015). Si llamas unipolar o bipolar a tu escala, escribe de paso a qué definición te acoges.

Una escala unipolar recoge la intensidad de una sola característica. Ejemplo: «¿Hasta qué punto te agobian los exámenes de enero?», con los escalones nada, poco, algo, bastante y muchísimo. No hay polo contrario, solo más o menos de lo mismo.

Una escala bipolar coloca dos características opuestas en los extremos. Ejemplo: «El ritmo de la asignatura me ha parecido…», de «demasiado lento» a «demasiado rápido», pasando por «el adecuado». Los polos se definen entre sí y el centro tiene que significar algo.

Verbal, numérica, simbólica o gráfica: con qué se marcan los escalones

Las marcas son lo único que la persona encuestada ve realmente, y la elección no es cosmética: cambia lo que hay que interpretar para poder responder.

Tipo de marcaQué ve quien respondePara qué sirve
Verbaluna palabra en cada escalónel caso estándar, el menos ambiguo
Numéricacifras, por ejemplo de 0 a 10sistemas ya conocidos, como las notas
Simbólicacaras, estrellas, pulgaresinfancia y preguntas breves de feedback
Gráficaun punto sobre una líneagraduaciones finas en pantalla

Las marcas numéricas parecen inequívocas y no siempre lo son. En España, la escala de calificación por excelencia está en el expediente: el Real Decreto 1125/2003 fija una «escala numérica de 0 a 10, con expresión de un decimal, a la que podrá añadirse su correspondiente calificación cualitativa»: 0-4,9 suspenso, 5,0-6,9 aprobado, 7,0-8,9 notable, 9,0-10 sobresaliente y la «Matrícula de Honor» desde 9,0 (BOE, Real Decreto 1125/2003).

Mira lo que eso significa. Los cuatro tramos no ocupan lo mismo: el suspenso se lleva casi la mitad de la recta y el sobresaliente, un punto escaso. Números por fuera, tramos desiguales por dentro, y aun así cualquiera la lee sin pensar, porque la ha tenido delante toda la vida. Una escala pelada del 1 al 7 no tiene esa ventaja. El Net Promoter Score, de 0 a 10 con solo los extremos etiquetados, es la apuesta más conocida en esa línea.

Escalonada o continua: cuánto afina la respuesta

La inmensa mayoría son escalonadas: fijan un número cerrado de casillas y nada entre ellas.

Una escala continua funciona con un deslizador sobre el que se marca un punto cualquiera, idea que el ámbito sanitario aprovecha para medir el dolor. Tiene sentido casi solo en digital: en papel habría que ir después con una regla, marca por marca.

Escala de calificación en el cuestionario de una encuesta en línea con cinco opciones de respuesta graduadas

¿Cuántos escalones debe tener una escala de calificación?

De cinco a siete escalones es la recomendación más repetida. Las guías de la GESIS citadas antes sitúan la medición óptima en fiabilidad, validez y capacidad de diferenciación entre cinco y siete categorías, y añaden que las personas encuestadas prefieren ese rango.

Cerrado no está. Esas mismas guías mencionan trabajos recientes en los que la calidad sigue subiendo con más categorías, probadas hasta 10, 11 e incluso 100 escalones. Matas apunta en una dirección parecida y más prudente: el aumento «es apreciable entre cuatro y siete alternativas, siendo menos apreciable a partir de siete alternativas».

Para tu cuestionario, la traducción es corta: quédate en cinco si vas a poner una palabra en cada escalón y sube a siete si necesitas matices más finos. Por debajo de cinco pierdes capacidad de diferenciar y por encima de siete ya casi no hay forma de nombrar cada escalón.

¿Par o impar? La pregunta por el centro

Un número impar tiene centro, uno par obliga a mojarse, y ambas opciones se defienden. La Universidad de Cantabria lo plantea así: «El que sea un número impar permite tener una categoría intermedia o neutral», aunque hay quien elige el par «precisamente para que el encuestado se decante más claramente y no tienda hacia el neutro» (OCW, Universidad de Cantabria).

La guía de cuestionarios de la UOC se moja y aconseja «evitar ofrecer un valor numérico u opción cualitativa intermedia, puesto que las personas usuarias tenderán a dar aquel valor» (Design Toolkit de la UOC). Matas recoge estimaciones según las cuales la alternativa intermedia se lleva entre el 20 y el 50 por ciento de las respuestas.

Decídelo por el contenido. Si la posición intermedia existe y la quitas, inventas una opinión que nadie tiene; si no existe y la pones, regalas una columna de respuestas cómodas. «¿Cómo de satisfecho estás con tu grado?» admite indecisión real; «¿Recomendarías este taller?», no.

Ojo con «No sabe» y «No contesta»

Ninguna de las dos es un escalón y ninguna va en el centro. Su sitio es aparte, al final de la lista, y en el análisis cuentan como valor perdido. Así lo publica el CIS, con «N.S.» y «N.C.» siempre debajo de los escalones, y así lo describe Matas: esa opción «suele colocarse al margen de la escala ordinal».

Crear encuesta gratis

Con empirio.ai creas una encuesta en línea moderna en pocos minutos — con alojamiento en la UE.

  • Encuesta creada con IA
  • Ajusta con arrastrar y soltar
  • Análisis en tiempo real
Empezar gratis

Etiquetar los escalones: qué palabras poner

Pon una palabra en cada escalón, no solo en los extremos. La misma guía de la UOC lo recomienda sin matices: «aunque se usen valores numéricos para la escala, es recomendable incluir una referencia textual con la que las personas usuarias identifiquen claramente el rango positivo, negativo y neutro de cada opción de respuesta».

Unas buenas palabras de escalón cumplen cuatro condiciones: son precisas, hay tantas positivas como negativas, las entiende cualquiera y sus distancias se perciben parecidas. La cuarta es la difícil, porque «a veces» y «a menudo» no caen a la misma distancia para todo el mundo.

Llega la parte incómoda: las listas calibradas existen, pero están atadas a un idioma. Para el alemán, Bernd Rohrmann propuso en 1978 graduaciones verbales elegidas para que los saltos entre escalones resultaran lo más parecidos posible (ISB Baviera, formatos de respuesta). Traducir esas palabras al español sería justo lo que no hay que hacer, porque la calibración se hizo con hablantes de alemán y no sobrevive al cambio de idioma.

Escalones que ya se usan en encuestas españolas

Sí funciona copiar series que ya se leen en voz alta aquí. El Centro de Investigaciones Sociológicas publica sus cuestionarios completos, así que los escalones están ahí, literales y probados con miles de personas (CIS, Barómetro de julio de 2026, estudio nº 3571):

  • Preocupación: muy preocupado/a, bastante, algo, poco, nada preocupado/a
  • Valoración: muy positiva, positiva, negativa, muy negativa
  • Cambio: mucho mejor, algo mejor, igual, algo peor, mucho peor
  • Confianza: mucha confianza, bastante confianza, poca, ninguna confianza

La docencia deja modelos parecidos: para satisfacción, la Universidad de Cantabria propone «muy satisfactoria, bastante satisfactoria, aceptable, bastante insatisfactoria, muy insatisfactoria». Un aviso antes de copiar: ninguna serie garantiza escalones a la misma distancia, así que siguen siendo ordinales.

Un truco que ahorra sesgos

Pregunta por la cosa, no por el acuerdo. En vez de «Uso encuestas a menudo: de acuerdo o en desacuerdo», escribe «¿Con qué frecuencia usas encuestas?». Matas cierra su revisión con una receta compatible: cinco alternativas y una opción de «No opino» aparte.

Analizar una escala de calificación: qué cifra puedes dar

Publica siempre, antes que nada, la distribución de frecuencias: cuánta gente ha elegido cada escalón. Vale en cualquier nivel de medición y enseña lo que las cifras resumidas tapan.

Un ejemplo con números. Dos talleres de una asociación se valoran de 1 a 6 y cada uno reúne 20 respuestas. En el taller A, diez personas marcan un 3 y diez marcan un 4. En el B, diez marcan un 1 y diez marcan un 6. Media: 3,5 en ambos. Mediana: 3,5 también. Y sin embargo el A gustó a todos por igual, mientras que el B partió a la gente en dos mitades.

CifraCuándo encajaQué muestra
Distribución de frecuenciassiemprecuánta gente hay en cada escalón
Modasiempreel escalón más elegido
Medianaen un ítem sueltola respuesta que queda en medio
Mediaen una puntuación de varios ítemsel promedio del conjunto
Desviación típicaen una puntuación de varios ítemscuánto se dispersan las respuestas
Top-two boxen informes y presentacionesel peso de los dos escalones altos

La media no está prohibida, pero necesita justificación. En un ítem suelto, la mediana es la elección prudente porque solo presupone un orden. En una puntuación de varios ítems, la media es lo habitual, siempre que digas en la metodología que has tratado los escalones como equidistantes. Para comparar grupos vale la misma división: ítems sueltos con procedimientos de rangos, puntuaciones con procedimientos de media y dispersión. Dónde acaba lo descriptivo y empieza lo inferencial está en nuestro artículo sobre estadística descriptiva e inferencial.

Qué publicar además de la cifra

Fíjate en cómo lo hace el CIS, que además es gratis. En la escala de ideología de 1 a 10 del barómetro de julio de 2026 no se limita a dar la media de 4,70: publica también la desviación típica, 2,68, y el porcentaje de cada uno de los diez puntos. Copia ese formato y quien te lea podrá rehacer tus cuentas.

Errores típicos con las escalas de calificación

La mayoría de los fallos de una escala se cometen al redactarla, no al calcular. En metodología se habla de estilos de respuesta, que Matas define como «la tendencia sistemática del encuestado a contestar sesgadamente con relación al constructo de interés». No afectan a todo el mundo, pero a quien afectan lo empujan siempre al mismo lado, así que no se compensan solos.

Su revisión agrupa cuatro, y contra ninguno sirve ampliar la muestra, sino escribir mejor el cuestionario.

El estilo de respuesta intermedia empuja hacia el centro

Hay quien elige los escalones centrales al margen del contenido, porque decidirse cuesta más que no decidirse, y la distribución sale más equilibrada de lo que son las opiniones. Un dato útil: Matas relaciona los ítems difíciles de leer con más respuestas centrales, porque quien no entiende la frase se refugia en el medio. Frases cortas y palabra propia en cada escalón lo reducen.

El estilo aquiescente hace que todo parezca bien

Aquiescencia es la tendencia a mostrarse de acuerdo con una afirmación sea cual sea su contenido, marcando «de acuerdo», «sí» o «verdadero» en todo. El remedio de fondo ya ha salido: renuncia a las escalas de acuerdo y pregunta por la característica. Si las mantienes, redacta la mitad de las afirmaciones en sentido inverso, que deja el sesgo a la vista.

La respuesta socialmente deseable maquilla los temas delicados

Ante preguntas que se viven como sensibles, mucha gente contesta lo que se espera en vez de lo que pasa: se minimiza lo que se sale de la norma y se agranda lo que encaja. Buena noticia para quien trabaja en línea, porque la Universidad de Cantabria señala que el cuestionario autoadministrado elimina el sesgo de la persona entrevistadora y mejora la respuesta en preguntas indiscretas.

El estilo de respuesta extrema tira de los bordes

Al otro lado está la tendencia a marcar siempre los extremos, sea cual sea el tema. Se mide como proporción de respuestas extremas a lo largo de varias escalas del mismo cuestionario. Si detrás hay un rasgo estable o solo una costumbre sigue sin estar cerrado en la investigación, así que descríbelo y no lo interpretes de más.

Queda un fallo pequeño y muy visual. Los escalones deben estar separados por la misma distancia, porque si no el centro que se ve deja de coincidir con el real. Hay más en nuestro artículo con consejos para encuestas en línea.

Conclusión

Una escala de calificación se monta en dos minutos y se estropea en uno. Cinco escalones con una palabra cada uno, una decisión consciente sobre el centro y otra sobre el «No sabe» dan más calidad de datos que cien respuestas extra. Al analizar, la regla cabe en una línea: la distribución va siempre en el informe, la media solo con su justificación.

Cómo seguir


¿Quieres probar tu escala antes de enviarla?

Con empirio.ai, una herramienta de encuestas en línea de Alemania, montas una escala graduada en unos minutos y, con cuatro respuestas de prueba, ya ves si la distribución sostiene lo que quieres contar.

Empezar gratis con empirio.ai

Preguntas frecuentes

Una escala de calificación es un formato de respuesta graduado dentro de un cuestionario, con el que alguien indica en qué medida presenta o percibe una característica. En lugar de un sí o un no, hay varios escalones para elegir, por ejemplo cinco que van de «nada» a «muchísimo». También la verás llamada escala de valoración.

En rigor mide a nivel ordinal, porque no hay forma de demostrar que las distancias entre escalones consecutivos sean iguales. La revisión de Antonio Matas sobre el formato de estas escalas recuerda que las distancias psicológicas entre alternativas no son iguales. Para un ítem suelto, el nivel ordinal es la descripción correcta.

De cinco a siete es la recomendación más extendida, por fiabilidad, validez y capacidad de diferenciar. Estudios posteriores encuentran mejoras también con más categorías, aunque el aumento se nota sobre todo entre cuatro y siete alternativas. Quédate en cinco si vas a etiquetar cada escalón con una palabra y sube a siete para matices finos.

Una escala unipolar recoge la intensidad de una sola característica, por ejemplo de «nada» a «muchísimo» en el agobio ante un examen. Una bipolar coloca dos características opuestas en los extremos, como «demasiado lento» y «demasiado rápido». Conviene decir en tu trabajo a qué definición de polaridad te acoges, porque la literatura no la usa de forma unitaria.

En un ítem suelto, la mediana es la opción prudente, porque solo presupone un orden entre los escalones. En una puntuación construida con varios ítems sobre la misma característica, la media es habitual y defendible, siempre que la metodología diga que los escalones se han tratado como equidistantes. La distribución de frecuencias va en el informe en los dos casos.

Una escala de Likert es una forma concreta de escala de calificación, no una alternativa. La reconocerás porque los escalones expresan acuerdo, hay varias afirmaciones sobre la misma característica y al final se combinan en una puntuación. Toda escala de Likert es una escala de calificación, pero muchas escalas de calificación no son de Likert.

Fuera de la escala y al final de la lista de respuestas, nunca entre los escalones y mucho menos en el centro. En el análisis cuentan como valor perdido, no como una posición intermedia. El CIS lo presenta así en sus barómetros, con «N.S.» y «N.C.» siempre debajo de los escalones, y la literatura metodológica en español coincide en colocar esa opción al margen.

También podría interesarte