HARKing: formular la hipótesis después de ver los datos

De las doce variables que mediste, tres dieron resultados interesantes. Tu introducción, escrita después, presenta exactamente esas tres relaciones como predicciones derivadas de la teoría, con su literatura de apoyo y todo. Las otras nueve han desaparecido del manuscrito. Nadie ha inventado un dato ni ha manipulado un análisis, y sin embargo el artículo que sale de ahí transmite algo falso: que la teoría predijo lo que en realidad se descubrió mirando.

Kerr (1998) le puso nombre a esta práctica, HARKing (Hypothesizing After the Results are Known), y desde entonces se ha convertido en una de las objeciones que más rápido escala a rechazo, porque no es un fallo técnico que se corrija en la siguiente ronda: es un problema de fiabilidad del relato. Y no es una práctica marginal: cuando John, Loewenstein y Prelec (2012) preguntaron a investigadores en psicología por prácticas cuestionables, la de reportar un hallazgo inesperado como si hubiera sido predicho fue una de las más admitidas.

Esta guía explica qué formas tiene exactamente el HARKing, por qué destruye la interpretación de tus valores p, qué señales textuales lo delatan ante un revisor, dónde está la frontera con la investigación exploratoria legítima (que es perfectamente publicable), cómo estructurar un manuscrito para no caer en ello y qué responder cuando el revisor ya lo ha insinuado.

Qué es exactamente y por qué invalida tu valor p

HARKing es presentar en la introducción, como si fuese una predicción a priori, una hipótesis que en realidad se formuló después de conocer los resultados. La forma más pura consiste en escribir la introducción al final, eligiendo la literatura que justifica lo que ya sabes que salió.

El daño no es moral, es estadístico. Un valor p responde a la pregunta de con qué frecuencia observarías datos así de extremos si la hipótesis nula fuera cierta, y su interpretación depende de que la hipótesis se haya especificado antes de mirar. Si has explorado doce relaciones y presentas tres como si fueran las únicas que buscabas, el valor p de esas tres ya no significa lo que dice significar: la probabilidad real de haber encontrado algo por azar es mucho mayor que .05, porque tuviste doce oportunidades. Es el mismo problema de la multiplicidad, pero agravado, porque en este caso el lector ni siquiera sabe que hubo doce.

Hay un segundo daño, sobre la teoría. Cuando una predicción se escribe después del resultado, la teoría nunca puede fallar: cualquier resultado se acomoda a algún marco teórico si tienes libertad para elegirlo a posteriori. Así se acumula una literatura donde todas las teorías parecen confirmadas siempre, que es exactamente lo que la investigación sobre replicabilidad de la última década ha destapado.

Y un tercero, más práctico: el HARKing hace desaparecer del registro los resultados nulos. Las nueve relaciones que no salieron eran información valiosa para el campo y para cualquier metaanálisis futuro, y se han perdido porque no encajaban en el relato.

Los tipos de HARKing (no todos son igual de graves)

La distinción importa porque tu respuesta al revisor depende de en cuál has caído. Kerr distinguió varias formas y la literatura posterior, con Rubin (2017) entre otros, ha matizado que su gravedad no es uniforme.

Cómo lo detecta un revisor

No puede demostrarlo, pero reconoce el patrón, y con bastante fiabilidad. Estas son las señales que dispara la sospecha.

El encaje demasiado perfecto

Cuando las cuatro hipótesis se confirman las cuatro, con valores p cómodos y sin ninguna sorpresa, y además el diseño era exploratorio por naturaleza, un revisor experimentado no piensa «qué buena teoría»: piensa en el proceso que produjo ese texto. La investigación real es desordenada, y un manuscrito impecable en el que la teoría acierta al cien por cien resulta menos creíble, no más.

La sospecha aumenta cuando las hipótesis tienen un nivel de especificidad que ninguna teoría previa podría justificar: predicciones sobre un subgrupo concreto, sobre una subescala determinada y no sobre las otras, o sobre una dirección de moderación que en la literatura está abierta.

La asimetría entre método y resultados

Si el método menciona ocho instrumentos y los resultados solo informan de cuatro, el revisor va a preguntar por los otros cuatro. Y si el método menciona cuatro pero la discusión alude de pasada a una variable que no aparecía en ninguna parte, va a preguntar también.

Este cotejo es sistemático en revisión: la lista de medidas frente a la lista de resultados. Cualquier medida que se mide y no se reporta es una pregunta pendiente, y la respuesta «no era relevante para los objetivos» rara vez satisface, porque si no era relevante no se habría administrado.

Las hipótesis que aparecen a mitad del artículo

Una hipótesis nueva formulada en la sección de resultados, o un análisis de moderación que no estaba anunciado en ninguna parte y aparece de repente con su justificación teórica al lado, es una señal muy clara. Los análisis planificados se anuncian antes; los que se anuncian sobre la marcha se hicieron sobre la marcha.

La bibliografía posterior a la recogida de datos

Es una comprobación fina y algunos revisores la hacen: si los datos se recogieron en 2023 y el marco teórico que supuestamente generó las hipótesis se apoya sobre todo en publicaciones de 2025, la cronología no cuadra. No es prueba de nada, porque una teoría puede reformularse con literatura reciente, pero pesa cuando se suma a las demás señales.

La frontera: explorar es legítimo, disimular no

Conviene decirlo claro porque mucha gente sobrecorrige: la investigación exploratoria es una parte imprescindible de la ciencia y es perfectamente publicable, incluso en revistas exigentes. Descubrir un patrón que no esperabas y construir una explicación teórica a partir de él es un buen día de trabajo, y a menudo el origen de las mejores líneas de investigación.

Lo que se penaliza no es explorar, es presentar la exploración con el vestido de la confirmación. La diferencia práctica es un adjetivo bien colocado y una consecuencia inferencial asumida: los hallazgos exploratorios se presentan como hipótesis generadas, no como hipótesis contrastadas, y no sostienen conclusiones fuertes.

La solución estructural que se ha impuesto es separar físicamente los dos bloques dentro del artículo. En resultados, un apartado de análisis confirmatorios (los planificados, corregidos por multiplicidad si procede) y otro de análisis exploratorios, etiquetado como tal. En la discusión, el mismo orden y el mismo etiquetado. Los revisores, lejos de penalizar esta división, la agradecen: les dice exactamente cuánto peso puede soportar cada afirmación.

Y luego está la vía preventiva definitiva, que es el preregistro. Registrar en OSF o AsPredicted las hipótesis, las variables, el plan de análisis y los criterios de exclusión antes de mirar los datos elimina la discusión entera: lo que está en el registro es confirmatorio y lo que no, exploratorio, y cualquiera puede comprobarlo. Nosek y colaboradores (2018) desarrollan por qué esto cambia la naturaleza de la evidencia, y hoy muchas revistas de psicología incentivan explícitamente el registro con distintivos en el artículo. Añadir un preregistro no impide que descubras cosas: solo hace que se sepa cuáles descubriste.

Cómo se ve en un manuscrito real

Delata: «Basándonos en la literatura previa, hipotetizamos que la relación entre carga laboral y agotamiento estaría moderada por el apoyo del supervisor únicamente en trabajadores con menos de cinco años de antigüedad».

Ninguna teoría publicada predice un umbral de cinco años. Esa especificidad solo puede venir de haber visto los datos, y un revisor lo sabe.

Aguanta: «La literatura sugiere que el apoyo del supervisor amortigua la relación entre carga y agotamiento, aunque no ofrece predicciones sobre su variación según la antigüedad. Exploramos esta posibilidad de forma post hoc: el efecto moderador resultó significativo únicamente en el grupo de menor antigüedad (menos de cinco años; b = -.21, p = .008), frente al de mayor antigüedad (b = -.03, p = .71), con una interacción de tercer orden significativa (p = .02). Dado el carácter exploratorio de esta partición, presentamos el resultado como hipótesis a contrastar en un diseño preespecificado, y no como evidencia de moderación diferencial».

Delata: «Se administró una batería que incluía medidas de personalidad, regulación emocional, apoyo social, calidad del sueño y clima organizacional» en el método, y unos resultados donde solo aparecen regulación emocional y apoyo social.

Aguanta: reportar todas las medidas administradas, con sus descriptivos y sus asociaciones principales, aunque sea en material suplementario, y explicar en el texto qué análisis eran confirmatorios y cuáles no. Una tabla suplementaria con las nueve relaciones que no salieron es la mejor vacuna contra la sospecha de reporte selectivo, y además convierte tu artículo en material utilizable para futuras síntesis.

Delata: «Aunque no lo habíamos previsto inicialmente, los resultados son coherentes con la teoría X, que predice precisamente este patrón».

Esta, en cambio, no delata nada: es exactamente la forma correcta de hacerlo. Reconoce que el hallazgo fue inesperado, aporta la interpretación teórica y deja al lector la información necesaria para calibrar el peso de la evidencia. Cuesta una frase y salva la credibilidad del artículo entero.

Cómo responderle al revisor

Cuando un revisor insinúa HARKing (con formulaciones como «the hypotheses appear tailored to the results», «were these analyses preregistered?», «please clarify which analyses were planned a priori»), la tentación es defender que sí, que todo estaba previsto. Es la peor opción posible: si el revisor ya sospecha, una defensa cerrada confirma la sospecha y encima cierra la puerta a la salida honesta.

La salida honesta funciona sorprendentemente bien: reetiquetar. «El revisor plantea una cuestión legítima. Los análisis relativos a las hipótesis 1 y 2 estaban planificados desde el diseño del estudio y así se recoge en el protocolo aprobado por el comité de ética (fecha, referencia), que adjuntamos. Los análisis de moderación por antigüedad, en cambio, surgieron durante el examen de los datos y no estaban previstos: hemos reetiquetado ese apartado como exploratorio en resultados (p. 12) y en la discusión (p. 16), hemos retirado la afirmación correspondiente del abstract, y hemos añadido en la introducción una formulación que refleja el estado real de la predicción teórica, que era abierta».

Fíjate en el elemento que hace fuerte esa respuesta: un documento externo y fechado. El protocolo ético aprobado, la memoria de un proyecto financiado, el registro de un ensayo, el plan de análisis de la tesis depositada, un correo con el plan de análisis enviado a un colaborador antes de la recogida. Cualquiera de esas cosas ancla temporalmente lo que estaba previsto, y son de las pocas pruebas que un revisor acepta.

Complementa siempre con transparencia sobre lo que faltaba: «Hemos incorporado al material suplementario la lista completa de medidas administradas y los resultados de todos los contrastes realizados, incluidos los no significativos (Tabla S6), para que el lector pueda evaluar el número total de análisis efectuados». Ese gesto reduce mucho la sospecha, porque el problema de fondo del HARKing es la información que falta, y tú la estás poniendo.

Y para el futuro: preregistra. No por virtud, sino por economía. Un preregistro convierte esta conversación entera, que puede costarte dos rondas de revisión y un rechazo, en un enlace en el método.

Preguntas frecuentes

¿Está mal hacer análisis que no había planificado?

No, en absoluto. Explorar los datos es una parte necesaria del trabajo científico y muchos hallazgos importantes nacen así. Lo que está mal es presentar después esos análisis como si hubieran sido predicciones a priori. Etiquétalos como exploratorios, no sostengas sobre ellos las conclusiones principales y trátalos como generadores de hipótesis.

¿Cómo distingue un revisor el HARKing de una buena teoría?

Por indicios convergentes: hipótesis con una especificidad que la teoría citada no puede justificar, un porcentaje de confirmación demasiado alto, medidas que aparecen en el método y desaparecen en los resultados, análisis que surgen sin anuncio previo, y a veces la cronología de la bibliografía frente a la recogida de datos. Ninguno prueba nada por separado; juntos son bastante convincentes.

¿El preregistro me protege del todo?

Te protege de esta objeción concreta, que no es poco. Deja documentado y verificable qué era confirmatorio y qué no, y permite explorar con total libertad siempre que la exploración se etiquete. Lo que no hace es sustituir a un buen diseño ni impedir otras objeciones: un estudio preregistrado con potencia insuficiente sigue teniendo potencia insuficiente.

¿Qué hago si ya publiqué el estudio y los datos no encajan con mis hipótesis?

En el manuscrito que tengas entre manos, lo mejor es reportar la hipótesis tal y como se formuló y decir claramente que no se confirmó, discutiendo por qué. Una hipótesis refutada bien discutida es un artículo perfectamente publicable y mucho más informativo que uno con predicciones ajustadas a posteriori. La discusión de por qué falló la predicción suele ser la parte más interesante del texto.

¿Puedo reformular las hipótesis después del preregistro?

Puedes, siempre que declares el cambio, su fecha y su motivo. Los registros de OSF permiten añadir enmiendas con marca temporal, y muchos revisores prefieren un registro con una desviación bien documentada que un registro que no se parece al artículo. Lo que no funciona es tener un preregistro y un artículo que no coinciden sin ninguna explicación: es peor que no haber registrado nada.

¿Tengo que reportar todos los análisis que hice?

Al menos todos los que informaron tus decisiones, sí, aunque sea en material suplementario. La declaración de que has reportado todas las medidas, todas las condiciones, todas las exclusiones y cómo determinaste el tamaño muestral (las llamadas cuatro declaraciones de Simmons y colaboradores) es un párrafo de tres líneas que muchas revistas ya piden y que resuelve buena parte de esta objeción de raíz.

¿Y en qué se diferencia de las otras herramientas?

También te puede interesar