El revisor pide bootstrap en la mediación: por qué, y cómo se hace bien

El comentario tiene dos formas habituales. La educada: «the authors are encouraged to test the indirect effect using bootstrapped confidence intervals». Y la que duele: «the causal steps approach of Baron and Kenny is outdated; the Sobel test assumes normality of the indirect effect, which does not hold». Si tu manuscrito prueba una mediación con los tres pasos clásicos, con el test de Sobel, o con la frase «se cumplieron las condiciones de Baron y Kenny», este comentario era prácticamente inevitable.

La objeción no es un capricho de moda metodológica. El efecto indirecto es el producto de dos coeficientes, y el producto de dos variables aproximadamente normales no es normal: es asimétrico y con colas raras. Cualquier prueba que asuma normalidad para ese producto, y el test de Sobel la asume explícitamente, tiene la potencia y el error de tipo I mal calibrados. El bootstrap resuelve el problema sin asumir nada sobre la forma de esa distribución.

Aquí tienes qué está sospechando el revisor exactamente, qué es el bootstrap del efecto indirecto y qué variante hay que usar (spoiler: no la corregida por sesgo, y eso sorprende a mucha gente), la ejecución concreta en PROCESS para SPSS, en lavaan, en jamovi y en Mplus, el reporte APA 7 completo, y los dos párrafos de respuesta: cuando el intervalo sigue excluyendo el cero y cuando deja de hacerlo.

Qué sospecha el revisor: tres objeciones en un solo comentario

Cuando un revisor pide bootstrap, casi siempre está señalando una de estas tres cosas, y merece la pena identificar cuál, porque la respuesta cambia.

La primera es puramente distribucional. El efecto indirecto es ab, el producto del efecto del predictor sobre el mediador por el efecto del mediador sobre el resultado. Aunque a y b se distribuyan normalmente, su producto no lo hace: es asimétrico, y esa asimetría es mayor cuanto más pequeños son los coeficientes, que es justo el caso habitual en psicología. El error típico que usa el test de Sobel se deriva de una aproximación de primer orden que solo funciona bien en muestras grandes con efectos grandes. El bootstrap construye la distribución empírica del producto sin suponer nada.

La segunda es de potencia. El método de los pasos causales de Baron y Kenny (1986) exige que el efecto total sea significativo antes de mirar la mediación. Eso es un requisito que la literatura posterior desmontó: puede haber efecto indirecto sin efecto total significativo, sobre todo cuando hay dos rutas con signos opuestos que se cancelan, o simplemente cuando el efecto total tiene poca potencia. Zhao, Lynch y Chen (2010) y Hayes (2009) documentaron que el procedimiento de los pasos es el que menos potencia tiene de todos los disponibles. Un revisor que lee «no se cumplió el primer paso, por lo que no se examinó la mediación» sabe que puedes haber tirado un efecto real.

La tercera, la más importante y la que muchos autores no ven venir, es CAUSAL y no estadística. El bootstrap arregla la inferencia sobre ab; no arregla que hayas medido X, M e Y en el mismo cuestionario y el mismo día. Maxwell y Cole (2007) demostraron que una mediación estimada con datos transversales puede estar sustancialmente sesgada respecto al efecto longitudinal real, incluso invirtiendo el signo. Si tu diseño es transversal, el revisor puede pedirte bootstrap y estar además preparando una segunda objeción sobre la temporalidad. Anticiparla en la misma respuesta te ahorra una ronda entera.

Qué es el bootstrap del efecto indirecto y qué variante usar

El procedimiento es conceptualmente simple. Con tu muestra de n participantes, se extraen al azar y con reemplazo n casos, se estima el modelo completo sobre esa remuestra y se guarda el valor de ab. Se repite el proceso miles de veces y se obtiene una distribución empírica de ab. El intervalo de confianza se lee directamente de los percentiles de esa distribución: para un IC del 95%, los percentiles 2,5 y 97,5.

La regla de interpretación es la que importa y también la que más se equivoca al escribirla: si el intervalo NO contiene el cero, se concluye que el efecto indirecto es distinto de cero. No se reporta un valor p del bootstrap, porque la lógica del procedimiento es de intervalo. Escribir «el efecto indirecto fue significativo, p = .03, IC 95% [.04, .21]» es mezclar dos marcos y delata que se copió la salida sin entenderla. La frase correcta es «el intervalo de confianza bootstrap no incluyó el cero».

Percentil, corregido por sesgo o acelerado: cuál

Hay tres variantes en los menús y la elección tiene consecuencias. El intervalo PERCENTIL toma los cuantiles directamente. El CORREGIDO POR SESGO (BC) ajusta los percentiles según la proporción de remuestras por debajo de la estimación original. El CORREGIDO POR SESGO Y ACELERADO (BCa) añade una corrección por asimetría.

Durante años, BC y BCa se recomendaron por tener más potencia. Después se vio el precio: Fritz, Taylor y MacKinnon (2012) mostraron que en las condiciones habituales de psicología esa potencia extra viene con una tasa de error de tipo I inflada, por encima del 5% nominal, especialmente cuando uno de los dos coeficientes es cero. Hayes, que en las primeras versiones de PROCESS ponía BC por defecto, cambió la recomendación: en la tercera edición de su libro (2022) el intervalo percentil es la opción por defecto.

Conclusión práctica: usa PERCENTIL, y si tu salida antigua era BC, dilo y vuelve a correrlo. Un revisor metodólogo lo agradecerá; ninguno te va a criticar por elegir el criterio más conservador.

Cuántas remuestras

5.000 es el mínimo que se espera hoy en una revista Q1, y 10.000 es lo habitual cuando el modelo es rápido de estimar. Con 1.000 remuestras, los extremos del intervalo tienen bastante variabilidad de una ejecución a otra, lo que significa que dos personas con los mismos datos pueden llegar a conclusiones distintas. Fija además la semilla aleatoria y repórtala: hace tu resultado reproducible exactamente, y es un detalle que separa un método cuidado de uno rutinario.

Cómo se ejecuta, software por software

Todas las rutas dan resultados equivalentes cuando el modelo es el mismo; la elección depende de qué necesites además del bootstrap.

SPSS con PROCESS

La macro de Hayes es la vía más usada en psicología. Se instala añadiendo el archivo del cuadro de diálogo personalizado y aparece en Analizar > Regresión > PROCESS. Para una mediación simple es el MODELO 4: variable dependiente en Y, predictor en X, mediador en M, covariables en el campo correspondiente.

En Opciones hay que fijar tres cosas: número de remuestras (Bootstrap samples: 5000), tipo de intervalo (elegir Percentile bootstrap confidence intervals, NO el corregido por sesgo, que en versiones antiguas venía marcado) y, si te interesa, coeficientes estandarizados. La salida devuelve el efecto total, el efecto directo, y una tabla de «Indirect effect(s) of X on Y» con la estimación, el error típico bootstrap, y los límites inferior y superior (BootLLCI y BootULCI). Esa fila es la que se reporta.

Limitación importante de PROCESS: trabaja con regresión por mínimos cuadrados sobre variables observadas, así que no corrige por error de medida ni admite variables latentes, y elimina casos por lista ante datos faltantes. Si tus constructos son escalas psicológicas, esto atenúa el efecto indirecto. Si el revisor menciona error de medida, la respuesta es mover el análisis a un SEM con latentes.

R con lavaan

La ruta estándar y la más flexible. Se escribe el modelo con las etiquetas de los coeficientes (por ejemplo M ~ a*X y luego Y ~ b*M + c*X), y se define el parámetro derivado con el operador de nuevo parámetro: ab := a*b. Al ajustar con sem(), se pide se = "bootstrap" y bootstrap = 5000, y los intervalos se extraen con parameterEstimates(fit, boot.ci.type = "perc", level = .95).

Ese boot.ci.type = "perc" es la clave: por defecto lavaan devuelve intervalos normales basados en el error típico bootstrap, que NO es lo que te está pidiendo el revisor. Es el error más común en respuestas hechas con lavaan.

La ventaja frente a PROCESS es que aquí puedes usar variables latentes con sus indicadores, lo que corrige la atenuación por error de medida, y puedes combinar el bootstrap con estimación robusta. La combinación con FIML para datos faltantes es delicada porque cada remuestra debe reestimarse con FIML y es lento, pero funciona; el alternativa limpia es imputación múltiple más bootstrap, declarada en el método.

Si prefieres el marco de mediación causal, el paquete mediation con la función mediate() implementa el enfoque contrafactual de Imai, Keele y Tingley, que separa el efecto indirecto medio (ACME) y el directo (ADE) y permite un análisis de sensibilidad a la confusión del mediador con el resultado. Ese análisis de sensibilidad es la mejor respuesta que existe al revisor que pregunta si el mediador puede estar confundido.

jamovi

El módulo medmod (en la biblioteca de jamovi) tiene un análisis de mediación con bootstrap: se seleccionan predictor, mediador y resultado, y en Estimation Method se elige Bootstrap con el número de remuestras. Devuelve el efecto indirecto, directo y total con sus intervalos. Para modelos más complejos, el módulo jAMM (jamovi Advanced Mediation Models) admite mediación múltiple, mediación moderada y variables latentes, y está construido sobre lavaan, así que produce el mismo resultado con interfaz gráfica. Es la mejor opción si no quieres escribir código y necesitas más que una mediación simple.

Mplus

Se define el efecto indirecto en MODEL CONSTRAINT con parámetros etiquetados, o directamente con MODEL INDIRECT: y IND x;. El bootstrap se pide en ANALYSIS con BOOTSTRAP = 5000; y los intervalos con OUTPUT: CINTERVAL(BOOTSTRAP); para percentil, o CINTERVAL(BCBOOTSTRAP) para corregido por sesgo, que es el que conviene evitar por lo dicho antes.

Mplus es la vía natural si el modelo tiene variables latentes, indicadores categóricos o estructura multinivel. Una advertencia: el bootstrap no es compatible con todos los estimadores; con WLSMV para indicadores ordinales hay restricciones, y en mediación multinivel el bootstrap estándar no es apropiado porque rompe la estructura de anidamiento, de modo que se recurre al método de Monte Carlo para intervalos (que Preacher y Selig, 2012, describen y que se implementa fácilmente) o a estimación bayesiana.

Cómo se reporta en APA 7

El reporte mínimo de una mediación con bootstrap tiene estos elementos: el coeficiente a con su error típico, el coeficiente b con el suyo, el efecto directo c prima, el efecto total c, y el efecto indirecto ab con su error típico bootstrap y su intervalo de confianza. Más el número de remuestras, el tipo de intervalo y el software con su versión. Si falta el tipo de intervalo, el revisor no puede saber si usaste percentil o BC, y volverá a preguntar.

La frase tipo:

«Se examinó el efecto indirecto de la rumiación sobre la sintomatología depresiva a través de la evitación experiencial mediante intervalos de confianza bootstrap percentil con 5.000 remuestras (PROCESS v4.3, modelo 4; semilla = 20260813). La rumiación predijo la evitación experiencial, a = 0,38, EE = 0,06, p < .001, y la evitación predijo la sintomatología controlando la rumiación, b = 0,29, EE = 0,07, p < .001. El efecto indirecto fue ab = 0,11, EE bootstrap = 0,03, IC 95% [0,06, 0,18]; dado que el intervalo no incluyó el cero, se concluye que la evitación experiencial media la asociación. El efecto directo se mantuvo significativo, c prima = 0,21, EE = 0,08, p = .009.»

Dos vicios de redacción que un revisor Q1 marca

El primero: «mediación parcial» y «mediación total». Esta terminología viene de los pasos causales y se abandonó por buenas razones. Que el efecto directo siga siendo significativo depende sobre todo de la potencia, no de la naturaleza del fenómeno, y llamar «total» a una mediación es afirmar que el efecto directo es exactamente cero, algo que un contraste no significativo no demuestra. Rucker, Preacher, Tormala y Petty (2011) lo desarrollaron y hoy la práctica es reportar la magnitud del efecto indirecto y del directo, sin etiquetarlos.

El segundo: llamar «mediación» a lo que es asociación transversal. La palabra tiene contenido causal. Si tu diseño no lo sostiene, la salida honesta es declararlo explícitamente en la primera frase de resultados y en la discusión, o hablar de «modelo indirecto» o «asociación indirecta». Un revisor que ve la palabra usada con cautela y con una limitación explícita se relaja; uno que la ve usada como si nada, escala.

El párrafo de respuesta al revisor, redactado

Dos escenarios, y en ambos conviene adelantarse a la objeción causal aunque el revisor no la haya escrito todavía.

Si el intervalo bootstrap sigue excluyendo el cero

«Agradecemos la observación, que compartimos plenamente. Hemos sustituido el análisis basado en los pasos causales y el test de Sobel por una estimación del efecto indirecto con intervalos de confianza bootstrap percentil (5.000 remuestras, semilla declarada para reproducibilidad), siguiendo la recomendación actual (Hayes, 2022). Los resultados se presentan en la Tabla 4 y en el texto revisado (pp. 15-16).

El efecto indirecto de la rumiación sobre la sintomatología depresiva a través de la evitación experiencial fue ab = 0,11, EE bootstrap = 0,03, IC 95% [0,06, 0,18], sin incluir el cero. Hemos optado por el intervalo percentil y no por el corregido por sesgo porque este último presenta tasas de error de tipo I por encima del nivel nominal en las condiciones habituales de estas muestras (Fritz, Taylor y MacKinnon, 2012).

Aprovechamos para señalar dos cambios adicionales derivados de esta revisión. Primero, hemos eliminado del manuscrito los términos «mediación parcial» y «mediación total», sustituyéndolos por el reporte directo de las magnitudes del efecto indirecto y directo (Rucker et al., 2011). Segundo, hemos añadido a la discusión un párrafo explícito (p. 20) sobre la limitación causal del diseño transversal para la inferencia de mediación (Maxwell y Cole, 2007), indicando que el modelo debe leerse como una descripción de la estructura de asociación compatible con la hipótesis, no como evidencia de un proceso temporal.»

Si con bootstrap el efecto indirecto deja de sostenerse

Es menos frecuente de lo que la gente teme, porque el bootstrap suele tener MÁS potencia que Sobel, no menos. Cuando ocurre, casi siempre es porque antes se había concluido mediación a partir de los pasos causales sin probar el producto. Y esa corrección es exactamente lo que el revisor estaba buscando.

«Agradecemos el comentario, que ha corregido una conclusión del manuscrito. Al estimar directamente el efecto indirecto con intervalos bootstrap percentil (5.000 remuestras), el intervalo incluye el cero, ab = 0,05, EE bootstrap = 0,04, IC 95% [-0,02, 0,13]. El análisis anterior, basado en el patrón de significación de los pasos causales, nos había llevado a afirmar una mediación que la estimación directa del producto no respalda.

Hemos modificado el manuscrito en consecuencia. La sección de resultados presenta ahora el efecto indirecto con su intervalo y describe el hallazgo como no concluyente (p. 15). La discusión ya no presenta la evitación experiencial como mecanismo, sino como una variable asociada a ambas cuya función mediadora este estudio no puede sostener, y hemos añadido en las limitaciones un análisis de sensibilidad de potencia que indica que, con nuestro tamaño muestral, la probabilidad de detectar un efecto indirecto de la magnitud esperada según la literatura previa era de .61, insuficiente para interpretar el resultado nulo como ausencia de mediación (p. 21). El abstract y las conclusiones se han actualizado en coherencia. Consideramos que esta versión describe con más exactitud lo que los datos permiten afirmar.»

Preguntas frecuentes

¿El bootstrap sirve si tengo muestra pequeña?

El bootstrap no crea información: remuestrea la que hay. Con n = 60 funciona mecánicamente y da un intervalo, pero ese intervalo hereda toda la inestabilidad de la muestra original y suele ser muy ancho. Sigue siendo mejor que Sobel en esas condiciones, porque al menos no impone una forma falsa a la distribución, pero no convierte un estudio con poca potencia en uno concluyente, y conviene decirlo en las limitaciones.

¿Puedo reportar un valor p del efecto indirecto?

Con bootstrap, lo correcto es el intervalo, no un p. Algunas salidas ofrecen un p basado en el cociente entre la estimación y el error típico bootstrap, pero eso vuelve a asumir normalidad del producto, que es justo lo que el bootstrap venía a evitar. Si tu revista exige un valor p, se puede reportar el del método de Monte Carlo o el de distribución del producto, declarándolo; lo que no procede es presentar el p normal como si fuera resultado del bootstrap.

¿Qué hago si el revisor me pide bootstrap en un modelo multinivel?

El bootstrap estándar remuestrea casos individuales y eso rompe la estructura de anidamiento, así que no es directamente aplicable. Las alternativas son el bootstrap por clusters (remuestrear grupos completos), el método de Monte Carlo para intervalos del efecto indirecto (Preacher y Selig, 2012), que solo necesita las estimaciones y su matriz de covarianzas, o estimación bayesiana con intervalos de credibilidad. Cualquiera de las tres responde al fondo del comentario; explica en la respuesta por qué el bootstrap clásico no procedía.

¿Sirve el bootstrap para justificar causalidad en una mediación?

No, y confundirlo es lo que provoca la siguiente objeción del revisor. El bootstrap es un método de inferencia sobre la incertidumbre de una estimación; no dice nada sobre el orden temporal ni sobre variables de confusión entre mediador y resultado. Un modelo de mediación con datos transversales y bootstrap impecable sigue siendo una descripción de asociaciones. Lo que sí ayuda es el análisis de sensibilidad a la confusión mediador-resultado del paquete mediation, que cuantifica cuánta confusión anularía el efecto.

¿Cuántas remuestras son suficientes: 1.000, 5.000 o 10.000?

Con 1.000 los extremos del intervalo varían de forma apreciable entre ejecuciones, con lo que tu conclusión puede depender de la semilla. 5.000 es el estándar aceptado y lo que la mayoría de las revistas espera; 10.000 es preferible cuando el modelo estima rápido, y es prácticamente obligatorio si el intervalo queda cerca del cero, porque ahí la precisión de los percentiles decide la conclusión.

¿Es mejor PROCESS o lavaan?

PROCESS es más rápido y su catálogo de modelos numerados cubre casi cualquier combinación de mediación y moderación sin escribir código, pero trabaja con variables observadas y elimina casos por lista. lavaan permite variables latentes (y por tanto corregir el error de medida, que atenúa los efectos indirectos), manejo de faltantes con FIML e integración con el resto del modelo estructural. Si tus constructos son escalas con fiabilidad por debajo de .85, la versión latente es sustancialmente mejor y merece la pena el esfuerzo.

¿Y en qué se diferencia de las otras herramientas?

También te puede interesar