Resultados del Saber Pro en datos abiertos: qué muestran, hasta dónde llegan y por qué dos fuentes dan cifras distintas (2026)

Necesitas una cifra del Saber Pro con fuente citable: para una nota, para una clase o para el marco contextual de tu trabajo de grado. El portal institucional del Icfes no siempre responde a las consultas automatizadas, y los boletines llegan en PDF con los cortes que alguien más decidió.

Hay una ruta mejor y poco usada: los microdatos anonimizados del examen están publicados en el portal de datos abiertos del Estado colombiano y se pueden consultar en línea, sin descargar nada, pidiendo exactamente el corte que necesitas. Todas las cifras de este artículo se obtuvieron así el 18 de agosto de 2026, y al final está la advertencia que hay que declarar cuando las cites.

Qué hay publicado y quién lo publica

En datos.gov.co conviven dos tipos de conjuntos con resultados del Saber Pro, y la diferencia importa para la referencia:

  • Publicados por el propio Icfes. El conjunto «Resultados Saber Pro Competencias Genéricas 2019-2», atribuido al Instituto Colombiano para la Evaluación de la Educación – ICFES, Bogotá D.C., con 260 756 registros. Es un periodo único y trae, además del puntaje, el nivel de desempeño y dos percentiles por módulo.
  • Republicados por entidades territoriales. El conjunto «Resultados únicos Saber Pro» agrupa varios años —su descripción dice «Resultados anonimizados de las pruebas Saber Pro desde el año 2018 al año 2022»— y suma 1 217 482 registros. Su ficha lo atribuye a la Alcaldía de Sogamoso, Boyacá y marca su cobertura geográfica como «Municipal», aunque el contenido es nacional.

Esa segunda etiqueta es la primera trampa: si citas ese conjunto como «Icfes», estás atribuyendo mal la fuente. La ficha dice lo que dice, y una referencia se construye con lo que la ficha declara, no con lo que uno supone. El formato exacto para referenciar un conjunto de datos está en cómo citar informes, estadísticas y datasets.

Las cifras del examen

Tomando el conjunto multianual y filtrando el año 2022 completo —225 905 evaluados— los promedios nacionales de las competencias genéricas fueron:

  • Razonamiento cuantitativo: 145,5
  • Lectura crítica: 150,7
  • Inglés: 155,2

En el periodo mayor de ese año, con 126 282 evaluados, el detalle completo fue razonamiento cuantitativo 145,8 · lectura crítica 151,3 · comunicación escrita 131,9 · inglés 156,4 · competencias ciudadanas 142,9. Comunicación escrita es sistemáticamente el módulo más bajo, casi veinte puntos por debajo de lectura crítica: un dato útil para justificar por qué un programa de escritura académica no es un lujo.

Inglés: el nivel que casi nadie alcanza

El módulo de inglés clasifica en niveles del Marco Común Europeo. En ese mismo periodo, de 126 282 evaluados: A1 11 983 · A2 65 341 · B1 34 258 · B2 14 700. Es decir, solo el 11,6 % llegó a B2 y el 61,2 % se quedó en A1 o A2. Si tu trabajo de grado toca bilingüismo, internacionalización o empleabilidad, esa proporción es un dato de contexto sólido y verificable.

La brecha por sexo está en un módulo, no en todos

El mismo corte, desagregado por sexo declarado, muestra algo que un promedio general esconde:

  • Mujeres (73 902): razonamiento cuantitativo 139,7 · lectura crítica 150,9
  • Hombres (52 375): razonamiento cuantitativo 154,5 · lectura crítica 151,9

La diferencia en razonamiento cuantitativo es de 14,8 puntos; en lectura crítica, de 1,0. No es una brecha general de desempeño: está concentrada en un módulo. Cualquier interpretación causal excede lo que muestran estos datos, pero la asimetría en sí es un hecho medible y citable.

Y por origen de la institución

En razonamiento cuantitativo, mismo periodo: instituciones oficiales municipales 158,1 (2 648 evaluados) · oficiales nacionales 149,7 (23 290) · oficiales departamentales 149,6 (19 223) · no oficiales tipo fundación 145,2 (40 839) · no oficiales tipo corporación 141,6 (40 130). Ojo con la lectura fácil: el grupo con el promedio más alto es también el más pequeño, y el origen jurídico de la institución no controla por el perfil de ingreso de sus estudiantes.

Diagrama de dos conjuntos de datos con una zona común y una diferencia destacada
Dos conjuntos oficiales del mismo examen y el mismo periodo no traen el mismo número de registros. La diferencia se traslada al promedio que cites.

El hallazgo: dos fuentes oficiales, dos promedios distintos

Este es el motivo por el que conviene declarar siempre qué archivo abriste. Se puede comparar el mismo examen —Saber Pro 2019-2— en los dos conjuntos:

  • Conjunto publicado por el Icfes: 260 756 registros. Razonamiento cuantitativo 146,56 · lectura crítica 149,03 · inglés 151,99.
  • Conjunto republicado, filtrando el mismo periodo: 258 452 registros. Razonamiento cuantitativo 146,42 · lectura crítica 148,93 · inglés 151,73.

Faltan 2 304 registros —un 0,9 %— y los promedios difieren en la segunda cifra decimal. Ninguno de los dos está «mal»: son recortes distintos del mismo examen. Pero si redondeas a un decimal obtienes 146,6 en un caso y 146,4 en el otro, y esa es exactamente la clase de diferencia que un jurado o un editor detecta cuando contrasta tu cifra con otra publicación.

La causa más probable es que el conjunto oficial reparte el mismo examen entre tres códigos de periodo: 20194 con 2 076 registros, 20195 con 258 452 y 20196 con 228, que suman 260 756. Quien filtra por un solo código —el más grande— pierde los otros dos. Es el error de conteo más fácil de cometer con estos archivos.

Regla práctica: declara el conjunto exacto, su entidad publicadora, el filtro que aplicaste y la fecha de consulta. Sin esos cuatro datos, tu cifra no es reproducible.

Cómo se lee un puntaje individual

Cada módulo trae cuatro campos, y confundirlos es frecuente:

  1. El puntaje. Una escala de 0 a 300 centrada alrededor de 150.
  2. El nivel de desempeño, de 1 a 4.
  3. El percentil nacional, que dice qué porcentaje del país quedó por debajo.
  4. El percentil del grupo de referencia, que compara contra estudiantes de programas afines, no contra todo el país.

Un ejemplo real del conjunto del Icfes: un puntaje de 110 en razonamiento cuantitativo corresponde a nivel 1, percentil nacional 14 y percentil 16 en su grupo de referencia; uno de 130, a nivel 2, percentil nacional 33 y percentil 38 en el grupo. La diferencia entre ambos percentiles es la que un estudiante suele necesitar: frente a tu propio grupo de referencia casi siempre estás algo mejor ubicado que frente al país, porque el grupo comparte formación.

La distribución de niveles en razonamiento cuantitativo para 2019-2 fue: nivel 1, 70 676 · nivel 2, 82 983 · nivel 3, 96 081 · nivel 4, 11 016. Solo el 4,2 % del total alcanzó el nivel más alto, y el 27,1 % quedó en el nivel 1.

Dos personas contrastando una cifra impresa contra una consulta de datos abiertos en un portátil
Una cifra sin conjunto, filtro y fecha de consulta no es verificable, aunque venga de una fuente oficial.

Los tres límites que hay que declarar

  1. La serie abierta termina en 2022. El conjunto multianual cubre de 2018 a 2022. Si necesitas 2024 o 2025, estos archivos no los tienen y hay que solicitarlos al Icfes por su canal formal. Decirlo es preferible a extrapolar.
  2. Un año calendario no equivale a un código de periodo. Filtrar por un solo código subcuenta. En 2022, los códigos que empiezan por «2022» suman 225 905; el mayor de ellos, por sí solo, aporta 126 282.
  3. Son microdatos anonimizados y autodeclarados en buena parte. Estrato, escolaridad de los padres, horas de trabajo y valor de la matrícula los reporta el estudiante al inscribirse, no un registro administrativo. Sirven para describir, no para auditar.

Cómo usar esto en tu trabajo de grado

Un uso honesto y de bajo riesgo es el marco contextual: una o dos cifras que sitúan el problema, con su fuente completa. Un uso más ambicioso es tratar los microdatos como datos secundarios y hacer tu propio análisis; en ese caso, el diseño y las precauciones metodológicas son las de cualquier estudio con fuentes secundarias, resumidas en trabajos con datos secundarios y microdatos. Para el procesamiento, la comparación entre programas está en SPSS, R, jamovi o JASP.

Si tu tema es regional o comparado, dos contextos útiles ya publicados: cuántos estudiantes universitarios hay en América Latina y las cifras de abandono universitario en la región. Y si tu marco toca tecnología educativa, las estadísticas de uso de IA en universidades aportan el otro lado del contexto.

Preguntas frecuentes

¿Dónde están los resultados del Saber Pro en datos abiertos?

En el portal datos.gov.co. Hay conjuntos publicados por el propio Icfes para periodos individuales y republicaciones multianuales hechas por entidades territoriales. Ambos son consultables en línea sin descargar el archivo completo.

¿Cuál fue el promedio nacional de razonamiento cuantitativo?

En 2022, sobre 225 905 evaluados, fue 145,5. En el examen 2019-2 fue 146,56 según el conjunto publicado por el Icfes y 146,42 según la republicación multianual filtrada por ese periodo, porque los dos archivos no contienen exactamente los mismos registros.

¿Hasta qué año llegan los microdatos abiertos?

Hasta 2022 en el conjunto multianual disponible. Para años posteriores hay que acudir a los canales formales del Icfes; extrapolar la serie no es defendible en un trabajo académico.

¿Qué diferencia hay entre el percentil nacional y el del grupo de referencia?

El nacional compara contra todos los evaluados del país; el del grupo de referencia compara contra estudiantes de programas afines. Un mismo puntaje suele ubicarse algo más arriba en el grupo de referencia que en el nacional.

¿Puedo citar estos datos en mi trabajo de grado?

Sí, siempre que declares el conjunto exacto, la entidad que lo publica según su ficha, el filtro que aplicaste y la fecha de consulta. Sin esos cuatro elementos la cifra no es reproducible y el jurado no puede verificarla.

De la cifra al párrafo

Tener el dato es la mitad del trabajo; la otra mitad es redactarlo con su fuente en el lugar correcto y que la referencia quede idéntica en la lista final. Tesify acompaña esa parte: te ayuda a escribir el marco contextual con las cifras integradas al argumento y mantiene las referencias formateadas en APA 7 o Icontec, según lo que exija tu programa. Y antes de entregar, revisar la originalidad del texto con Tesify Detector de Plagio evita que un párrafo de contexto copiado de un boletín termine marcado en el informe de similitud.

Escribe tu marco contextual con Tesify

Escribe tu trabajo de grado con IA

Estructura, redacta y formatea tus referencias en Icontec o APA 7 — con integridad académica. Registro gratuito, sin tarjeta.

Empieza gratis con Tesify →

Categorías