El sesgo algorítmico dejó de ser un tema exclusivo de la literatura anglosajona sobre inteligencia artificial. El 14 de febrero de 2025 se aprobó en Colombia el documento CONPES 4144, Política Nacional de Inteligencia Artificial, y el propio documento advierte que la IA, si sus desafíos no se abordan adecuadamente, puede generar resultados como la «reproducción de sesgos, una mayor desigualdad social, y vulneración de derechos». Eso convierte al sesgo algorítmico en poblaciones vulnerables en un tema con respaldo de política pública real para un trabajo de grado de Ciencia de Datos e Inteligencia Artificial en Colombia, no en una moda importada.
Esta guía te ayuda a convertir ese interés en un trabajo de grado ejecutable: qué preguntas son investigables, qué framework conceptual usar, dónde consigues datos sin vulnerar a las personas que estudias, y qué debes evitar prometer.
Por qué «poblaciones vulnerables» y no «sesgo algorítmico» a secas
Un trabajo de grado sobre «sesgo en la IA» sin población definida es tan amplio que no se puede ejecutar en un semestre. El sesgo algorítmico se manifiesta de forma distinta según a quién afecta: mujeres en modelos de reclutamiento, población rural en modelos de scoring crediticio, comunidades étnicas en sistemas de reconocimiento facial, personas con discapacidad en interfaces de accesibilidad automatizada, trabajadores informales en modelos de elegibilidad para crédito o subsidios. Cada población exige un dataset distinto, una métrica de equidad distinta y un marco normativo distinto. La guía de delimitación del problema aplica directamente a esta decisión: delimitar por población es, aquí, la primera línea de defensa contra un tema inabarcable.
El marco conceptual: de dónde viene el sesgo
La literatura de aprendizaje automático distingue varias fuentes de sesgo que no son intercambiables, y tu marco teórico debería nombrarlas con precisión en lugar de hablar genéricamente de «sesgo del algoritmo»:
- Sesgo histórico — el dato refleja una desigualdad social real que ya existía antes del modelo (por ejemplo, menos mujeres en cargos directivos en los datos históricos de contratación).
- Sesgo de representación — el dataset de entrenamiento subrepresenta a un grupo poblacional frente a su proporción real (por ejemplo, pocas imágenes de personas de piel oscura en un dataset de reconocimiento facial).
- Sesgo de medición — la variable que se usa como proxy no mide lo que dice medir, o lo mide distinto según el grupo (por ejemplo, usar arrestos como proxy de criminalidad, cuando la vigilancia policial no es uniforme por zona).
- Sesgo de agregación — un solo modelo se aplica a subgrupos que en realidad necesitarían modelos o umbrales distintos (por ejemplo, un mismo modelo de riesgo crediticio para zonas urbanas y rurales con estructuras de ingreso muy diferentes).
Esta tipología corresponde a la taxonomía ya estándar en la literatura de equidad algorítmica (fuentes de sesgo en el ciclo de vida del machine learning); cita la fuente específica que hayas leído tú, no repitas la lista sin verificarla en el paper original.

Preguntas investigables con pregunta de investigación
- Scoring crediticio y población rural. ¿Qué variables de un modelo de aprobación de crédito disponible en Colombia podrían actuar como proxy de ubicación rural, y qué efecto tendría eso sobre la tasa de aprobación? Diseño: auditoría de modelo con datos sintéticos o abiertos, análisis de proxy.
- Reclutamiento automatizado y género. ¿Un modelo de preselección de hojas de vida entrenado con datos históricos de una organización colombiana reproduce patrones de subrepresentación femenina en cargos técnicos? Diseño: auditoría retrospectiva con datos anonimizados de una organización que autorice el acceso.
- Reconocimiento facial y comunidades étnicas. ¿Qué tasa de error diferencial presenta un modelo de reconocimiento facial de código abierto según el tono de piel, usando un dataset público de referencia? Diseño: evaluación técnica comparativa, sin datos de personas reales colombianas si no tienes autorización.
- Modelos de riesgo y trabajadores informales. ¿Cómo clasifica un modelo de elegibilidad para un beneficio social a personas con ingresos informales o variables, frente a personas con ingreso formal declarado? Diseño: simulación con datos abiertos del DANE sobre informalidad laboral.
Métricas de equidad: lo que puedes calcular y lo que no debes inventar
Existen métricas formales de equidad algorítmica —paridad demográfica, igualdad de oportunidades, calibración por grupo— cada una con su propia definición matemática y sus propios trade-offs conocidos entre sí (mejorar una casi siempre empeora otra). No prometas en tu anteproyecto que tu modelo «será justo»: define desde el planteamiento cuál métrica específica vas a medir y para qué grupo, porque la equidad algorítmica no es una propiedad única sino un conjunto de definiciones en tensión.
Esta decisión metodológica pertenece al mismo capítulo donde defines enfoque, alcance y diseño; la guía de marco metodológico del trabajo de grado te sirve de estructura general para ese capítulo, aunque tu objeto de estudio sea un modelo y no una muestra humana directa.

Dónde conseguir datos sin vulnerar a la población que estudias
- Datasets abiertos con documentación de sesgo conocido. Varios datasets académicos públicos de equidad algorítmica (compilados por la comunidad de investigación en fairness) ya documentan sus propios sesgos; úsalos para práctica metodológica, no como sustituto de datos colombianos si tu pregunta es sobre Colombia específicamente.
- Datos abiertos del DANE y datos.gov.co. Útiles para caracterizar a la población vulnerable que estudias (informalidad laboral, ruralidad, brecha de género) sin necesidad de acceder a datos personales identificables. Cuando reportes una cifra del DANE en tu justificación, sigue el criterio de la guía sobre cómo citar una cifra oficial: el verbo correcto depende de si el dato viene de una encuesta, un registro administrativo o un censo.
- Convenio con una organización que autorice auditoría de su propio modelo. Es la ruta más rigurosa pero también la más lenta de gestionar: necesitas un acuerdo de confidencialidad y, casi siempre, anonimización previa de los datos antes de que lleguen a tus manos.
Nunca hagas scraping de datos personales identificables de personas vulnerables para «probar» que un modelo es sesgado: eso convierte tu trabajo de grado en el mismo problema ético que estás denunciando.
El marco de gobernanza que puedes citar
El CONPES 4144 incluye, entre sus objetivos, definir medidas que promuevan la identificación, prevención y mitigación de los riesgos y efectos no deseados relacionados con sistemas de IA, «con el fin de evitar asimetrías, inequidades y potenciales vulneraciones de derechos en el país», y dentro de ese eje una línea de acción específica para promover equidad e inclusión en el desarrollo y adopción de la IA. El documento fija un horizonte de implementación de seis años (2024-2030). Cítalo como marco de política pública vigente, no como una norma técnica que resuelva por sí sola tu pregunta de investigación: el CONPES fija la dirección, pero el detalle metodológico de cómo auditar un modelo sigue siendo un vacío técnico que tu trabajo de grado puede empezar a llenar.
Cómo se ve al lado de otros marcos internacionales
Colombia no está sola en esto: la Unión Europea reguló el riesgo algorítmico mediante el Reglamento de Inteligencia Artificial (AI Act), que clasifica los sistemas por nivel de riesgo y exige requisitos más estrictos a los de «alto riesgo» (entre ellos, muchos sistemas de scoring crediticio, reclutamiento y acceso a servicios públicos); en Estados Unidos, el NIST publicó el AI Risk Management Framework como una guía voluntaria de gestión de riesgo, no una ley. Puedes usar esta comparación en tu marco teórico para mostrar que el enfoque colombiano —el CONPES 4144, un documento de política y no una ley— se ubica entre la regulación obligatoria europea y el marco voluntario estadounidense. Antes de afirmar en tu trabajo si Colombia tiene o no una ley de IA, verifica el estado legislativo vigente en la fecha en que escribes: un CONPES no es una ley.
Un ejemplo ilustrativo de cómo se plantea el problema
El siguiente párrafo es un ejemplo ilustrativo —no un hallazgo real— de cómo se articula el problema para la línea de scoring crediticio y población rural:
«Los modelos de aprobación de crédito usados por [tipo de entidad financiera] suelen incluir variables como la ubicación geográfica, el tipo de ingreso y el historial bancario previo. En un país con una brecha de bancarización entre zonas urbanas y rurales, estas variables pueden actuar como proxy indirecto de ruralidad, incluso sin que el modelo use la variable «zona rural» de manera explícita. No existe, hasta donde se revisó en la literatura, un estudio que audite esta relación específicamente para el contexto colombiano. ¿Qué variables de un modelo de aprobación de crédito disponible públicamente correlacionan con la ubicación rural, y qué efecto tendría eso sobre la tasa de aprobación simulada?»
El corchete «[tipo de entidad financiera]» es, otra vez, un relleno de plantilla explícito: en tu propio planteamiento debe convertirse en la fuente real de datos o el modelo específico que vayas a auditar, nunca en una entidad inventada presentada como si la hubieras estudiado.
Errores frecuentes al plantear este tema
- Hablar de «el algoritmo» en abstracto sin especificar el tipo de modelo, la tarea (clasificación, scoring, ranking) ni la población afectada.
- Prometer eliminar el sesgo por completo: la literatura técnica es clara en que las métricas de equidad tienen trade-offs, no una solución única.
- Usar datos personales identificables de población vulnerable sin autorización ni anonimización.
- Citar el CONPES 4144 como si regulara técnicamente la auditoría de modelos, cuando en realidad fija política, no metodología.
Preguntas frecuentes
¿Necesito acceso a un modelo de producción real para hacer este trabajo?
No necesariamente: puedes auditar modelos de código abierto, trabajar con datasets académicos documentados o construir un modelo propio con datos abiertos para ilustrar el fenómeno, siempre que seas transparente sobre esa limitación en tu discusión.
¿Cuál métrica de equidad debo elegir?
Depende de tu pregunta: si te importa que la tasa de aprobación sea proporcional entre grupos, mira paridad demográfica; si te importa que los errores del modelo se distribuyan igual entre grupos, mira igualdad de oportunidades. Discútelo con tu director antes de fijar el diseño, porque ambas rara vez se cumplen a la vez.
¿El sesgo algorítmico es un tema solo para Ingeniería de Sistemas?
No; en Ciencia de Datos e IA la pregunta suele estar más orientada al análisis de datos y a la evaluación del modelo que al desarrollo del sistema completo, lo que lo hace viable incluso sin experiencia previa en ingeniería de software.
¿Necesito aval de comité de ética para este trabajo?
Si tu diseño incluye datos personales identificables de personas reales, sí. Si trabajas exclusivamente con datasets abiertos y anonimizados o con simulaciones, el requisito puede ser menor, pero verifícalo con tu programa antes de asumirlo.
¿Cómo defino el tamaño de mi muestra si trabajo con un dataset ya existente?
Cuando el «universo» es un dataset fijo, la lógica de muestreo cambia: en lugar de calcular un tamaño de muestra, documentas cuántos registros tiene el dataset completo, qué subconjunto usaste y por qué, siguiendo la misma lógica de justificación que exige la guía de población y muestra del trabajo de grado adaptada a datos secundarios.
El siguiente paso
Elige una sola población y una sola métrica de equidad antes de escribir el planteamiento del problema: es la decisión que más tiempo ahorra en este tema, porque «el sesgo algorítmico» sin acotar es, en la práctica, imposible de medir en un trabajo de grado.
Si necesitas apoyo para estructurar el planteamiento del problema o el marco metodológico de tu tesis de Ciencia de Datos e IA, Tesify te ayuda a planear y ordenar cada capítulo, sin reemplazar el análisis técnico que solo tú puedes construir: el trabajo de grado sigue siendo 100 % escrito por ti. Más de 9.000 estudiantes lo han usado en más de 15.000 capítulos.
