¿Tengo que hacer una prueba piloto? Para qué sirve, con cuántas personas y qué se reporta (2026)

La prueba piloto es la aplicación de tu instrumento a un grupo pequeño de personas parecidas a tu muestra, antes de la recolección definitiva, para detectar preguntas confusas, errores de formato y problemas de tiempo. No es obligatoria por ley, pero casi todos los reglamentos y jurados la esperan cuando el instrumento es propio o adaptado.

Esa es la respuesta corta. La larga tiene tres partes que casi nadie resuelve bien: cuándo hace falta de verdad, con cuánta gente, y qué se hace después con lo que encontraste.

Grupo pequeño de personas respondiendo un cuestionario mientras una investigadora toma notas
El piloto no mide tu variable: mide tu instrumento.

¿Es obligatoria?

No existe una norma nacional colombiana que la exija. Lo que sí existe es una expectativa muy consistente, y depende de un criterio simple: ¿el instrumento ya fue probado por alguien más con una población como la tuya?

Tu situación ¿Piloto?
Diseñaste tú el cuestionario Sí, indispensable. Nadie lo ha respondido nunca.
Usas una escala validada, sin cambios, en una población equivalente No es indispensable, pero sí un ensayo logístico corto.
Usas una escala validada en otra población, otro país u otro nivel educativo Sí. El vocabulario y los referentes cambian.
Tradujiste o modificaste ítems Sí, y además es parte del procedimiento de adaptación.
Vas a hacer entrevistas semiestructuradas Sí. Una entrevista de prueba reordena la guía entera.
Trabajas solo con datos secundarios No aplica; lo que se prueba es la rutina de extracción.

La regla que resume la tabla: si tu instrumento no ha sido respondido antes por alguien parecido a tu población, hay que pilotearlo. Si lo modificaste, con más razón — los criterios de cuándo una modificación obliga a revalidar están en la guía sobre usar la escala de otro autor.

Para qué sirve realmente

Aquí está el malentendido central. Mucha gente cree que el piloto sirve para «ver si me da significativo». No. El piloto no mide tu variable: mide tu instrumento y tu procedimiento. Sirve para responder seis preguntas:

  1. ¿Se entienden las preguntas? La que más problemas evita. Un ítem ambiguo produce respuestas ruidosas que ninguna estadística arregla después.
  2. ¿Cuánto se demora? Si tu encuesta toma 25 minutos y creías que tomaba 10, vas a tener abandonos masivos.
  3. ¿Funciona la logística? El formulario en línea, los saltos condicionales, la exportación de datos. Es preferible descubrir que el salto lógico estaba mal con 8 respuestas que con 200.
  4. ¿Hay ítems que no discriminan? Si todo el mundo responde exactamente lo mismo, ese ítem no aporta información.
  5. ¿Cómo se comporta la fiabilidad? Con reservas, porque con pocos casos la estimación es inestable.
  6. ¿La tasa de respuesta es viable? Si de 30 invitaciones contestan 4, tu plan de recolección no alcanza y hay que replantearlo ahora.

Con cuántas personas

Grupo pequeño de puntos que precede a un grupo mucho mayor, como la muestra piloto frente a la definitiva
El tamaño del piloto depende de qué le estés preguntando al piloto.

Es la pregunta más buscada y la peor respondida, porque circula un número único —«30»— aplicado a todo. La respuesta honesta es que depende de qué quieras averiguar, y hay literatura específica para cada caso.

Si solo quieres detectar problemas de comprensión

Bastan de 5 a 10 personas, siempre que les preguntes activamente qué entendieron en cada ítem en vez de solo recoger sus respuestas. Es más eficiente sentarse con siete personas y pedirles que piensen en voz alta que repartir el formulario a cuarenta y no hablar con ninguna.

Si quieres estimaciones numéricas preliminares

La referencia clásica es Julious (2005), «Sample size of 12 per group rule of thumb for a pilot study», en Pharmaceutical Statistics (4, 287-291), que propone 12 por grupo como regla práctica para estudios piloto.

Si estás desarrollando o adaptando una escala

Johanson y Brooks, en «Initial Scale Development: Sample Size for Pilot Studies» (Educational and Psychological Measurement, 2010, 70, 394-400), recomiendan alrededor de 30 participantes para las etapas iniciales de desarrollo de una escala. De ahí viene, bien entendido, el famoso «20 a 30».

Si tu piloto va a dimensionar el estudio principal

Cuando el objetivo es usar la variabilidad observada para calcular la muestra definitiva, el tamaño del piloto depende del efecto esperado: Whitehead, Julious, Cooper y Campbell lo desarrollan en Statistical Methods in Medical Research (2016, 25, 1057-1073). Y si tu trabajo es un ensayo piloto propiamente dicho, existe una guía de reporte específica: la extensión de CONSORT 2010 para ensayos piloto y de factibilidad (Eldridge et al., BMJ, 2016, i5239).

Para un trabajo de grado típico con un cuestionario propio, entre 15 y 30 personas es un rango defendible, y lo que hay que saber sustentar no es el número sino el criterio: por qué ese, para qué, y con quiénes.

Quiénes deben ser

  • Parecidas a tu población objetivo, no tus compañeros de clase si vas a encuestar docentes rurales.
  • Fuera de la muestra definitiva. Este es el punto que más se incumple y el que un jurado detecta rápido.
  • En lo posible, con variedad interna: si tu población abarca varios semestres o regiones, incluye a alguien de cada extremo.

La regla que casi nadie cumple

Dicho aparte porque es el error más grave: los participantes del piloto no pueden formar parte de la muestra final, y sus datos no se suman a los definitivos.

Hay dos razones. La primera es de contaminación: ya vieron el instrumento y su segunda respuesta no es independiente. La segunda es más obvia: si corregiste el cuestionario después del piloto —que es todo el punto de hacerlo—, esas personas respondieron otro instrumento. Sumar respuestas de dos versiones distintas de un cuestionario es un error de fondo, no de forma.

La única excepción razonable es un piloto puramente logístico en el que no cambiaste absolutamente nada; incluso ahí, conviene declararlo con precisión.

Qué hacer con lo que encuentras

Lista de verificación con elementos aprobados y uno marcado para ajustar tras el pilotaje
El valor del piloto está en la lista de cambios que produce.

Un piloto del que no sale ningún cambio casi siempre significa que no se preguntó bien. Deja una tabla con cuatro columnas: qué se detectó · en qué ítem · qué se hizo · por qué. Esa tabla es el anexo del piloto y el insumo del párrafo de método.

Los hallazgos típicos y su tratamiento:

  • Un ítem que la mitad interpretó distinto → reescribirlo, no eliminarlo.
  • Dos ítems que todos leyeron como el mismo → fusionarlos o diferenciarlos.
  • Preguntas que nadie respondió → suelen ser sensibles o estar mal ubicadas. Revisa el orden antes de culpar al ítem.
  • Un tiempo de respuesta excesivo → recortar, y recortar de verdad.
  • Opciones de respuesta incompletas → si «otro» concentró muchas respuestas, faltaba una categoría.
  • Vocabulario que no es el de la población → el hallazgo más frecuente cuando la escala viene de otro país.

Sobre la fiabilidad: puedes calcular el alfa con los datos del piloto, pero trátalo como indicativo. Con 20 casos la estimación es inestable, y un alfa bajo ahí puede deberse al tamaño y no al instrumento. El alfa que se reporta como resultado es el de la muestra definitiva; si sale bajo, el procedimiento de diagnóstico está en la guía sobre qué hacer cuando el alfa de Cronbach sale bajo.

El párrafo que va en el método

Cuatro o cinco líneas, en pasado y con cifras:

«Antes de la aplicación definitiva se realizó una prueba piloto con 22 estudiantes de séptimo y octavo semestre del mismo programa, no incluidos en la muestra final. Se les solicitó responder el cuestionario y señalar los ítems que resultaran confusos, y se registró el tiempo de diligenciamiento (media: 14 minutos). Como resultado se reformularon 5 ítems por ambigüedad, se fusionaron 2 que resultaron redundantes y se añadió una categoría de respuesta en la pregunta 9. El alfa de Cronbach en el piloto fue de 0,81, tomado como indicativo dada la magnitud de la muestra. La versión ajustada es la que se presenta en el Anexo B.»

Ese párrafo hace tres cosas: demuestra rigor, explica por qué el instrumento del anexo no es idéntico al original, y desactiva la pregunta del jurado antes de que la formule.

Errores frecuentes

  1. Incluir a los del piloto en la muestra final. El más común y el más grave.
  2. Pilotear con amigos que no se parecen a la población. Detectan erratas, no problemas de comprensión reales.
  3. No preguntar nada. Repartir el formulario y recogerlo desperdicia la mitad del valor: hay que preguntar qué entendieron.
  4. No cambiar nada después. Si el piloto no produjo ajustes, revisa cómo lo hiciste.
  5. Reportar el alfa del piloto como resultado del estudio. Es indicativo, no definitivo.
  6. Hacerlo cuando ya no hay tiempo de corregir. Un piloto la semana antes de aplicar es un trámite, no un control de calidad.
  7. Confundirlo con el cálculo del tamaño de muestra. Son cosas distintas; el tamaño de la muestra definitiva se calcula aparte, como se explica en la guía sobre cuántos participantes necesitas.

Preguntas frecuentes

¿Cuántas personas necesito para la prueba piloto?

Depende del objetivo. Para detectar problemas de comprensión bastan de 5 a 10 personas si les preguntas activamente qué entendieron. Para el desarrollo inicial de una escala, Johanson y Brooks (2010) recomiendan cerca de 30. Como regla práctica general para estudios piloto, Julious (2005) propone 12 por grupo. En un trabajo de grado con cuestionario propio, entre 15 y 30 es un rango defendible.

¿Los participantes del piloto cuentan en la muestra final?

No. Ya conocen el instrumento, así que sus respuestas dejan de ser independientes, y si ajustaste el cuestionario tras el piloto respondieron una versión distinta. Se excluyen y se dice explícitamente en el método.

¿Es obligatoria la prueba piloto en el trabajo de grado?

No hay una norma nacional que la exija, pero la mayoría de programas y jurados la esperan cuando el instrumento es propio, traducido o adaptado, o cuando la escala validada se va a aplicar a una población distinta de aquella en la que se validó. Verifica el reglamento de tu programa.

¿Puedo hacer la prueba piloto en línea?

Sí, y es lo habitual cuando la aplicación definitiva también será en línea: así pruebas de paso los saltos condicionales, la obligatoriedad de campos y la exportación de datos. Añade al final dos preguntas abiertas sobre claridad y duración, o mejor, acompaña a algunas personas mientras lo responden.

¿Qué diferencia hay entre prueba piloto y validación por expertos?

La validación por juicio de expertos evalúa si los ítems representan bien el constructo, y la hacen especialistas en el tema. La prueba piloto evalúa si las personas de la población objetivo entienden y pueden responder el instrumento. Son complementarias y van en ese orden: primero expertos, después piloto.

¿Tengo que pedir consentimiento en el piloto?

Sí. Aunque sean pocas personas y los datos no se usen en los resultados, siguen siendo participantes de investigación y aplican las mismas exigencias éticas que en la aplicación definitiva.

¿Cuánto tiempo antes debo hacerla?

Con margen suficiente para corregir y volver a revisar: dos o tres semanas antes de la aplicación definitiva es razonable. Si tu instrumento requiere aval del comité de ética, el piloto va después del aval, no antes.

En resumen

La prueba piloto es barata, rápida y es lo único que separa un instrumento que funciona de uno que produce datos que no significan nada. Con 20 personas, dos horas y una tabla de cambios, blindas el capítulo entero — y evitas la peor situación posible, que es descubrir el ítem confuso cuando ya tienes 180 respuestas y no hay vuelta atrás.

Si todavía estás construyendo el instrumento, empieza por cómo diseñar un cuestionario válido y fiable, y si vas a aplicarlo en línea, por cómo montar la encuesta en Google Forms. Cuando lleguen los datos reales, el paso siguiente es depurar la base antes de analizar.

Escribe tu capítulo de método en Tesify y deja registrado el piloto mientras lo haces, con las referencias en su sitio. Más de 9.000 estudiantes ya escriben así, y el texto sigue siendo cien por ciento tuyo.

Escribe tu trabajo de grado con IA

Estructura, redacta y formatea tus referencias en Icontec o APA 7 — con integridad académica. Registro gratuito, sin tarjeta.

Empieza gratis con Tesify →

Categorías