KR-20 y confiabilidad de una prueba de conocimientos en un trabajo de grado de educación: cálculo en Excel (2026)

Si tu trabajo de grado de Licenciatura o de Educación aplica una prueba de conocimientos (un pretest y un postest sobre fracciones, comprensión lectora, ciencias naturales o inglés), tarde o temprano el jurado te preguntará: «¿cómo sabes que tu prueba es confiable?». Un cuestionario tipo Likert se evalúa con el alfa de Cronbach; una prueba de conocimientos con respuestas correctas e incorrectas se evalúa, en su forma clásica, con el coeficiente KR-20 de Kuder y Richardson. Esta guía te explica qué es, cuándo usarlo, cómo calcularlo paso a paso en Excel con un ejemplo que puedes replicar, cómo interpretarlo sin exagerar y cómo redactarlo en el capítulo metodológico.

Qué es el KR-20 y de dónde viene

Los coeficientes de Kuder y Richardson se publicaron en 1937 en el artículo «The theory of the estimation of test reliability», de la revista Psychometrika (volumen 2, número 3, páginas 151-160). El KR-20 recibe ese nombre porque es la fórmula número veinte de ese artículo. Es una medida de consistencia interna para pruebas con ítems dicotómicos, es decir, ítems que se califican como acierto (1) o error (0). Es un caso particular del alfa de Cronbach calculado sobre puntajes dicotómicos: si aplicas alfa a una matriz de unos y ceros, obtienes el KR-20.

Los valores van de 0 a 1. Cuanto más alto, más consistentemente miden los ítems el mismo conjunto de conocimientos. Pero atención: el KR-20 puede verse afectado por la dificultad de la prueba, por la dispersión de los puntajes y por su longitud, y un valor alto no demuestra por sí solo que la prueba mida una sola dimensión. Es un indicador de consistencia, no una garantía de validez.

Cuándo usar KR-20 y cuándo no

  • Úsalo en pruebas de conocimientos con ítems de respuesta correcta o incorrecta: selección múltiple, falso o verdadero, completar con una respuesta única.
  • No lo uses en cuestionarios de actitudes o percepciones con escala Likert (para eso, alfa de Cronbach u otros coeficientes) ni en ítems de respuesta abierta calificados con rúbrica de varios niveles.
  • Con una sola aplicación basta para calcularlo (no necesitas dos aplicaciones, como en el test-retest), pero necesitas que los mismos estudiantes respondan todos los ítems.

La guía de alfa de Cronbach bajo complementa esta con el caso de escalas Likert y con el diagnóstico de coeficientes bajos.

Docente calificando hojas de respuestas con una clave junto a ella
El KR-20 aplica a pruebas cuyos ítems se califican como acierto o error.

La fórmula, explicada sin símbolos innecesarios

El KR-20 se calcula como K dividido por K menos 1, multiplicado por uno menos la suma de p por q dividida por la varianza de los puntajes totales. Donde:

  • K es el número de ítems de la prueba.
  • p es la proporción de estudiantes que acertó un ítem (también llamada índice de dificultad: valores altos indican ítems fáciles).
  • q es 1 menos p, la proporción que falló ese ítem.
  • Suma de p por q es la suma, sobre todos los ítems, del producto de p y q.
  • Varianza de los puntajes totales es la varianza del total de aciertos de cada estudiante.

Ejemplo paso a paso en Excel (datos ilustrativos)

Estos datos son inventados, con diez estudiantes y ocho ítems, solo para que puedas replicar el procedimiento. En una prueba piloto real necesitarás más estudiantes; la guía de prueba piloto: cuántas personas necesitas explica cómo decidirlo.

Paso 1. Arma la matriz de aciertos. Cada fila es un estudiante y cada columna un ítem; escribe 1 si acertó y 0 si falló.

Estudiante Í1 Í2 Í3 Í4 Í5 Í6 Í7 Í8 Total
E1 1 1 1 1 1 0 1 1 7
E2 1 1 1 1 0 1 1 0 6
E3 1 1 0 1 1 0 0 0 4
E4 1 0 1 1 0 0 1 0 4
E5 1 1 1 0 0 0 0 0 3
E6 1 0 0 1 0 1 0 0 3
E7 0 1 1 0 1 0 0 0 3
E8 1 0 0 0 0 0 0 1 2
E9 0 1 0 0 0 0 0 0 1
E10 1 1 1 1 1 1 1 1 8

Paso 2. Calcula el total por estudiante con la función SUMA sobre cada fila (última columna de la tabla).

Paso 3. Calcula p para cada ítem. Con la función PROMEDIO sobre cada columna de unos y ceros obtienes la proporción de aciertos. En el ejemplo: 0,8; 0,7; 0,6; 0,6; 0,4; 0,3; 0,4 y 0,3.

Paso 4. Calcula p por q. Multiplica cada p por 1 menos p: 0,16; 0,21; 0,24; 0,24; 0,24; 0,21; 0,24 y 0,21. Su suma es 1,75.

Paso 5. Calcula la varianza de los totales. Los totales son 7, 6, 4, 4, 3, 3, 3, 2, 1 y 8; su media es 4,1. La función VAR.P de Excel (varianza poblacional) da 4,49, que es la que corresponde a la fórmula con p por q.

Paso 6. Aplica la fórmula. K es 8, así que K sobre K menos 1 es 8/7, es decir, 1,1429. Una menos 1,75/4,49 es 1 − 0,3898 = 0,6102. El producto es 0,6974, es decir, un KR-20 de aproximadamente 0,70 para esta prueba de ejemplo.

Verificación en SPSS o jamovi. Si introduces la misma matriz de unos y ceros en el análisis de fiabilidad (escala de alfa de Cronbach) obtendrás el mismo valor, 0,697, porque con ítems dicotómicos el alfa coincide con el KR-20. Esto sirve para comprobar tu cálculo en Excel.

Hoja de cálculo con una matriz de unos y ceros de respuestas a una prueba
Con una matriz de unos y ceros puedes calcular el KR-20 en Excel y verificarlo en SPSS o jamovi.

Cómo interpretar el resultado sin exagerar

No existe un número mágico que valide una prueba. Cada autor propone un criterio de aceptabilidad distinto, y la referencia que debes usar es la que cites en tu marco metodológico, con autor y año, y la que acepte tu facultad. El valor de 0,70 de este ejemplo no es un veredicto: es un resultado para interpretar con las siguientes reglas:

  • Un KR-20 bajo no siempre significa que la prueba sea mala. Puede deberse a pocos ítems, a una muestra homogénea, a ítems demasiado fáciles o difíciles, o a que la prueba mide varios contenidos distintos.
  • Un KR-20 muy alto con una prueba larga no prueba unidimensionalidad. Puede indicar ítems redundantes.
  • Depende de la muestra. La confiabilidad no es una propiedad fija de la prueba, sino de las puntuaciones obtenidas en tu grupo; por eso debes reportar el valor en tus datos y no solo el del estudio de otro autor.

Análisis de ítems: lo que sí puedes mejorar

El mismo cálculo te sirve para revisar ítem por ítem. El p de cada ítem es su índice de dificultad: en el ejemplo, el ítem 1 (0,8) es fácil y los ítems 6 y 8 (0,3) son difíciles. Si un ítem lo aciertan todos o ninguno, aporta poco a la consistencia y deberías revisarlo. Además de la dificultad, es habitual calcular un índice de discriminación: la capacidad del ítem de distinguir entre quienes obtienen puntajes altos y bajos en la prueba total; en Excel puedes obtener una correlación entre el ítem y el total con la función de correlación. Un ítem con discriminación cercana a cero o negativa es candidato a revisión: puede estar mal redactado, tener una clave equivocada o medir otro contenido. Revisa los ítems problemáticos con un experto antes de eliminarlos, y documenta los cambios y la razón.

Validez y confiabilidad no son lo mismo

El KR-20 habla de consistencia, no de contenido. Antes de calcularlo, tu prueba debe haber pasado por validez de contenido: revisión de jueces expertos que confirmen que los ítems corresponden a los contenidos y objetivos de aprendizaje que evalúas. La guía de validez de contenido por juicio de expertos detalla cómo hacerlo. Una prueba puede ser consistente y medir otra cosa; el jurado de un trabajo de Licenciatura buscará ambas evidencias.

Cómo redactarlo en el capítulo metodológico

Tu redacción debe incluir: quién elaboró la prueba y con base en qué contenidos; cuántos ítems tiene y de qué tipo; cómo se calificó; cómo se validó el contenido; en qué grupo se aplicó la prueba piloto (características y tamaño); qué coeficiente de confiabilidad usaste y por qué; el valor obtenido y el criterio de interpretación citado; y las modificaciones hechas tras el análisis de ítems. Un párrafo ilustrativo: «La prueba de conocimientos consta de 20 ítems de selección múltiple con una única respuesta correcta, calificados como 1 (acierto) o 0 (error). Su confiabilidad se estimó con el coeficiente KR-20 sobre las respuestas de una muestra piloto de estudiantes con características similares a las de la población objetivo». Si estás en un diseño pretest-postest, la guía de diseño cuasiexperimental pre-post y validez explica cómo se conecta la prueba con el diseño, y la de instrumentos de recolección de información muestra cómo documentar cada instrumento.

Antes de calcular: la tabla de especificaciones

La confiabilidad se calcula sobre una prueba bien construida, y una prueba bien construida parte de una tabla de especificaciones: una matriz que cruza los contenidos que vas a evaluar (por ejemplo, fracciones equivalentes, suma de fracciones, problemas con fracciones) con los niveles de exigencia cognitiva (recordar, aplicar, analizar) y asigna a cada celda un número de ítems proporcional a su peso en tu intervención. Con esa tabla evitas dos problemas frecuentes: una prueba que evalúa solo lo fácil de preguntar y una prueba que evalúa contenidos que no enseñaste. Escribe cada ítem con un enunciado claro, una sola respuesta correcta y distractores plausibles, y revisa que ningún ítem dé pistas para responder otro. Si adaptas ítems de una prueba estandarizada o de un banco institucional, cita la fuente y confirma que puedes usarlos; la guía de cómo usar la escala de otro autor y pedir permiso cubre ese caso.

Qué mostrar en la tabla de resultados

En el capítulo de resultados o en el metodológico, resume la prueba piloto en una tabla corta: número de estudiantes, número de ítems, media y desviación estándar del puntaje total, coeficiente KR-20 y rango de los índices de dificultad y discriminación. Agrega una frase sobre los ítems modificados o eliminados y el motivo. Y recuerda que la prueba piloto se aplica a estudiantes que no formarán parte de la muestra definitiva, para no contaminar el estudio: si aplicas la prueba dos veces al mismo grupo, el aprendizaje de la primera aplicación afecta la segunda.

Errores frecuentes

  • Usar KR-20 en una escala Likert.
  • Calcularlo con la varianza muestral en el denominador y la fórmula poblacional en el numerador (o al revés), mezclando criterios y obteniendo un valor distinto.
  • Reportar el coeficiente de otro estudio como si fuera el de tu muestra.
  • Aplicar la prueba piloto a estudiantes de la muestra definitiva.
  • Eliminar ítems solo para subir el coeficiente, sin revisar su contenido.
  • Interpretar el valor sin citar el criterio.

Preguntas frecuentes

¿Cuál es la diferencia entre KR-20 y alfa de Cronbach?

El KR-20 es el caso particular del alfa de Cronbach para ítems dicotómicos (acierto o error). Si calculas alfa sobre una matriz de unos y ceros obtienes el mismo valor que el KR-20.

¿Cuántos estudiantes necesito para calcular el KR-20?

No hay una cifra única; depende del número de ítems y del diseño. Consulta la guía de prueba piloto y justifica tu tamaño con una fuente, y evita calcularlo con muestras diminutas.

¿Qué valor de KR-20 se considera aceptable?

Cada autor propone su criterio. Elige uno, cítalo con autor y año en tu marco metodológico y aclara que la interpretación depende de la longitud de la prueba y de la muestra.

¿Puedo usar KR-20 si mi prueba tiene ítems abiertos?

Solo para los ítems que se califican de forma dicotómica. Para ítems con calificación por rúbrica de varios niveles necesitas otro coeficiente, como el alfa de Cronbach.

¿Necesito validez de contenido si ya calculé el KR-20?

Sí. La confiabilidad y la validez son evidencias distintas. El KR-20 muestra consistencia; la validez de contenido, que los ítems corresponden a lo que quieres evaluar.

El siguiente paso

Elabora la tabla de especificaciones de tu prueba (contenidos, objetivos e ítems por contenido), valídala con jueces y aplica el piloto antes de calcular nada. Si necesitas ordenar el capítulo metodológico de tu trabajo de grado de educación, Tesify te ayuda a planear y estructurar cada capítulo, y el trabajo sigue siendo 100 % escrito por ti. Más de 9.000 estudiantes lo han usado en más de 15.000 capítulos.

Escribe tu trabajo de grado con IA

Estructura, redacta y formatea tus referencias en Icontec o APA 7 — con integridad académica. Registro gratuito, sin tarjeta.

Empieza gratis con Tesify →

Categorías