,

TFG con datos de redes sociales en 2026: método, ética y protección de datos

Que una publicación sea pública no significa que puedas usarla libremente. Si permite identificar a alguien, es un dato personal y le aplica la normativa de protección de datos. Un TFG con datos de redes sociales es viable, pero exige base jurídica, minimización, anonimización real y un corpus documentado con fecha, porque mañana puede no existir.

Investigadora analizando publicaciones de redes sociales recopiladas para su trabajo académico
Datos abundantes, gratis y sin reclutar a nadie. Por eso atrae, y por eso conviene mirar las condiciones antes de empezar.

La atracción es evidente: hay material infinito, no hay que reclutar participantes ni cuadrar agendas, y se puede empezar hoy. Los problemas aparecen después, y casi siempre en el mismo sitio: en la confusión entre accesible y utilizable.

«Público» no significa «reutilizable»

Es la confusión que hay que deshacer primero, porque de ella se derivan casi todos los errores posteriores. Que una publicación se pueda leer sin contraseña dice algo sobre su accesibilidad, no sobre los derechos que tienes sobre ella.

Un mensaje publicado por una persona identificable es un dato personal, y lo sigue siendo aunque esté a la vista de cualquiera. Sobre él conviven además tres capas que conviene separar:

Tres marcos distintos que se aplican a la vez
Marco Qué regula Quién decide
Protección de datos El tratamiento de información sobre personas identificables La normativa y, en tu caso, la universidad
Condiciones de uso de la plataforma Cómo puedes acceder y extraer el contenido La plataforma
Ética de la investigación Qué es razonable hacer con personas que no saben que participan El comité de ética y tu criterio

Cumplir uno no cubre los otros. Se puede tener una base jurídica correcta y aun así estar incumpliendo las condiciones de la plataforma, o hacer todo formalmente bien y que el planteamiento sea éticamente cuestionable.

La base jurídica y la investigación científica

La pregunta que llega siempre es si hace falta pedir permiso a cada persona. En un corpus de miles de publicaciones eso es materialmente imposible, y la normativa lo contempla: el tratamiento con fines de investigación científica tiene un régimen propio, con garantías reforzadas —minimización, seudonimización cuando sea posible, limitación de la finalidad— precisamente porque el consentimiento individual no siempre es viable.

Lo que eso no significa es que la investigación académica quede exenta. Significa que la vía existe si se acompaña de las garantías. En la práctica, para un TFG, esto se traduce en cuatro decisiones que hay que tomar y justificar por escrito:

  1. Minimización. Recoge solo los campos que necesitas para tu análisis. Si tu pregunta es sobre el contenido de los mensajes, no guardes nombres de usuario, ubicaciones ni enlaces al perfil.
  2. Seudonimización desde el principio. Sustituye los identificadores por códigos en el momento de la recogida, no al final.
  3. Limitación de la finalidad. El corpus es para este trabajo, no para reutilizarlo después en otra cosa.
  4. Seguridad y plazo. Dónde se guarda, quién accede y cuándo se destruye.

No decidas esto solo. Consúltalo con tu tutor y, si tu universidad tiene delegado de protección de datos, con esa figura: existe precisamente para responder a esto y su criterio es el que te protege.

El problema de las citas literales

Proceso de anonimización de identificadores en un conjunto de datos recogido en línea
Ocultar el nombre de usuario no anonimiza nada si el texto sigue siendo buscable palabra por palabra.

Este es el punto que más gente subestima, y el que más rápido convierte un trabajo cuidadoso en uno con un problema serio.

Imagina que anonimizas bien: quitas el nombre de usuario, lo sustituyes por «Usuario 47» y reproduces su mensaje entre comillas en el apartado de resultados. Parece impecable. Pero cualquiera puede copiar esa frase, pegarla en un buscador y llegar al perfil original en cinco segundos. La cita literal es, en sí misma, un identificador.

Las tres salidas habituales:

  • Parafrasear las publicaciones en lugar de reproducirlas, conservando el sentido y declarando que se ha hecho así por protección de los sujetos.
  • Presentar datos agregados: frecuencias, categorías, proporciones, sin ejemplos textuales.
  • Citar literalmente solo cuando procede: cuentas institucionales, medios, o figuras públicas actuando en su condición pública. Ahí la expectativa de privacidad es distinta.

Si tu diseño necesita ejemplos textuales de personas particulares para sostener el análisis, eso es una conversación que hay que tener con el comité antes de recoger nada, no una decisión de redacción al final.

Ética más allá de la norma

Aunque todo lo anterior esté cubierto, quedan preguntas que la norma no resuelve y que un tribunal sí va a plantear:

  • Expectativa razonable de privacidad. Quien publica en un foro de apoyo sobre salud mental probablemente no espera aparecer en un TFG, aunque el foro sea abierto. Que sea legalmente accesible no significa que sea éticamente neutro.
  • Temas sensibles. Salud, orientación sexual, ideología, situación judicial o creencias exigen un nivel de cuidado mayor, y en muchos casos revisión ética obligatoria.
  • Menores. Si tu corpus puede incluirlos y no puedes verificar la edad, ese es un problema de diseño, no un detalle.
  • Riesgo de daño. ¿Podría tu trabajo exponer a alguien a acoso, consecuencias laborales o identificación no deseada? Si la respuesta no es un no claro, replantea.

Cuándo procede pasar por comité y cómo se solicita está en comité de ética para el TFG o el TFM. Pregúntalo antes de recoger: un corpus obtenido sin la autorización que se exigía no se arregla después.

Cómo recoger el corpus

Protocolo de recogida de publicaciones con criterios de inclusión y fechas definidas
El protocolo se escribe antes de recoger. Definir los criterios después de ver los datos es otra cosa.

Una advertencia práctica que ahorra semanas: el acceso automatizado se ha restringido mucho. Las API que hace unos años permitían descargar grandes volúmenes hoy están limitadas, son de pago o han desaparecido, y las condiciones de uso de la mayoría de plataformas prohíben la extracción automatizada. Antes de diseñar un estudio que dependa de recoger 50.000 publicaciones, comprueba que puedes hacerlo.

Para un TFG, la vía realista suele ser una de estas tres:

  • Recogida manual acotada. Un corpus pequeño y bien definido —cien o doscientas publicaciones— recogido a mano según criterios explícitos. Es perfectamente válido para un análisis cualitativo, y evita el problema de las condiciones de uso.
  • Conjuntos de datos ya publicados. Corpus recogidos y anonimizados por otros equipos y depositados en repositorios de investigación, con sus condiciones de uso ya resueltas. La lógica de trabajar así está en TFG con datos secundarios.
  • Acceso oficial a través de los programas de investigación que ofrecen algunas plataformas, si tu proyecto encaja y hay tiempo para tramitarlo.

Sea cual sea, el protocolo se escribe antes: plataforma, criterios de búsqueda, ventana temporal, criterios de inclusión y exclusión, y tamaño objetivo. Definirlos después de ver los datos es lo que convierte una selección en un sesgo.

Documentar algo que va a desaparecer

Un corpus de redes sociales tiene una propiedad incómoda: no es reproducible. Las publicaciones se borran, las cuentas se cierran, los algoritmos de búsqueda cambian. Quien repita tu búsqueda dentro de un año no obtendrá tu corpus.

Eso no invalida el trabajo, pero obliga a documentarlo de otra manera:

  • Fecha y hora exactas de la recogida, no solo el mes.
  • Términos de búsqueda literales y filtros aplicados.
  • Ventana temporal de las publicaciones incluidas.
  • Número recogido, excluido y final, con el motivo de cada exclusión.
  • Conservación segura del material recogido como respaldo del análisis, con las medidas de seguridad y el plazo de destrucción declarados.

Declara explícitamente en limitaciones que el corpus corresponde a un momento concreto y no es replicable. Es honesto, es esperable y no resta: el criterio para redactarlo está en cómo redactar las limitaciones del estudio.

Y conservar el material bruto tiene una segunda función: es lo que te permite responder si alguien cuestiona de dónde salen tus resultados, un escenario tratado en fabricación y falsificación de datos en el TFG.

Qué escribir en la metodología

Un apartado completo para este diseño cubre:

  1. Justificación de por qué redes sociales y no otra fuente.
  2. Plataforma y su lógica: qué tipo de comunicación se produce ahí y qué sesgo introduce respecto a tu población de interés.
  3. Protocolo de recogida completo, como arriba.
  4. Tratamiento de datos personales: qué campos recogiste, cuáles descartaste, cómo seudonimizaste y dónde se guarda el material.
  5. Aprobación ética, si procede, con su referencia.
  6. Método de análisis. Si es cualitativo, el procedimiento de codificación está en análisis de datos cualitativos en el TFG.
  7. Limitaciones de representatividad y de reproducibilidad.

Sobre el sesgo de plataforma conviene ser explícito: quien participa en una red social no representa a la población general, y quien publica sobre un tema no representa a quienes lo viven en silencio. Reconocerlo delimita tus conclusiones en lugar de debilitarlas.

Para referenciar el conjunto de datos y las publicaciones que sí puedas citar, el formato está en cómo citar informes, estadísticas y datasets en APA 7. Y si tu corpus incluye imágenes o código, las reglas de atribución están en plagio de código, datos e imágenes en el TFG.

Errores frecuentes

  • Dar por hecho que público equivale a libre. El error de origen.
  • Citar literalmente creyendo que ocultar el nombre de usuario anonimiza.
  • Recoger todo «por si acaso» en lugar de solo lo necesario.
  • Seudonimizar al final en vez de en la recogida.
  • Definir los criterios después de ver los datos.
  • No documentar la fecha exacta, lo que hace el corpus imposible de situar.
  • Diseñar un estudio que depende de una API a la que no tienes acceso.
  • Consultar al comité después de haber recogido el material.

Conviene ser explícito sobre el reparto en un trabajo con esta carga ética: Tesify no recoge datos de ninguna plataforma, no anonimiza tu corpus y no decide por ti si tu diseño necesita aprobación del comité. Esas son decisiones tuyas, y son las que un tribunal te va a preguntar. Donde sí ayuda es en redactar y estructurar el trabajo alrededor de tus resultados y en mantener las referencias con formato correcto. Prueba Tesify gratis

Preguntas frecuentes

¿Puedo usar publicaciones públicas de redes sociales en mi TFG?

Que una publicación sea accesible sin contraseña no la convierte en material de libre reutilización. Si permite identificar a una persona, sigue siendo un dato personal y le aplica la normativa de protección de datos. Puedes trabajar con ese material en investigación académica, pero con base jurídica adecuada, minimización de datos y medidas de anonimización, no simplemente porque estuviera a la vista.

¿Necesito el consentimiento de cada persona cuyas publicaciones analizo?

No siempre, y en corpus grandes suele ser inviable. El tratamiento con fines de investigación científica tiene un régimen específico con garantías reforzadas, y el consentimiento individual no es la única base posible. Lo que sí es exigible es que la decisión esté justificada por escrito y validada por tu tutor y, cuando corresponda, por el comité de ética de tu universidad.

¿Puedo citar textualmente una publicación en el trabajo?

Es el punto que más se subestima. Una cita literal es localizable con un buscador, así que reproducir el texto exacto puede identificar a la persona aunque hayas ocultado su nombre de usuario. Las alternativas habituales son parafrasear la publicación, presentar solo datos agregados, o usar citas literales únicamente de cuentas institucionales o de figuras públicas actuando como tales.

¿Hace falta pasar por el comité de ética?

Con frecuencia sí, y conviene preguntarlo antes de recoger nada. Aunque no haya contacto directo con personas, estás tratando datos personales de sujetos que no saben que participan en un estudio. Muchos comités exigen revisión en estos casos, especialmente si el tema es sensible o si el corpus incluye a menores, y el trámite tiene sus plazos.

¿Qué pasa si las publicaciones se borran después de recogerlas?

Ocurre constantemente y hay que anticiparlo en la metodología. Un corpus de redes sociales no es reproducible en el sentido clásico: quien repita tu búsqueda dentro de un año obtendrá un resultado distinto. Por eso se documenta con precisión la ventana de recogida, los criterios y la fecha exacta, y se conserva el material recogido de forma segura como respaldo del análisis.

¿Es legal hacer scraping para recoger los datos?

Depende de las condiciones de uso de la plataforma y de cómo trates después los datos, y son dos cuestiones distintas que conviene no mezclar. Muchas plataformas prohíben la extracción automatizada en sus términos, y el acceso por API se ha restringido bastante en los últimos años. Consulta las condiciones concretas y plantea a tu tutor la recogida manual acotada como alternativa realista para un TFG.

Nota: este artículo orienta sobre el planteamiento metodológico y ético. No sustituye al criterio del comité de ética de tu universidad ni, cuando exista, al de su delegado de protección de datos, que son quienes deben validar el tratamiento concreto que propongas.

Escribe tu trabajo de grado con IA

Estructura, redacta y formatea tus referencias en Icontec o APA 7 — con integridad académica. Registro gratuito, sin tarjeta.

Empieza gratis con Tesify →

Categorías