ANOVA de medidas repetidas en APA 7: esfericidad y grados de libertad corregidos

Un ANOVA de medidas repetidas bien reportado en APA 7 lleva una línea que no aparece en ningún ANOVA entre grupos: los grados de libertad con decimales. Algo así: F(1.56, 45.24) = 12.34, p < .001, η²p = .30. Esos decimales no son una errata ni un descuido de SPSS. Son la huella de que has corregido la falta de esfericidad, y son lo primero que mira un revisor que sabe de qué va el diseño.

Esta guía va de eso: qué se reporta exactamente, en qué orden, y cuál de las dos correcciones te toca. Si lo que necesitas es el ANOVA de un factor entre grupos, lo tienes en cómo reportar un ANOVA en APA 7; y si todavía estás decidiendo si tu diseño pide un ANOVA de medidas repetidas o un modelo mixto, la comparación está en modelos mixtos frente a ANOVA de medidas repetidas.

Qué lleva un ANOVA de medidas repetidas en APA 7

El reporte completo tiene cinco piezas, y en este orden:

1. El resultado de Mauchly. Antes que nada hay que decir si se cumple el supuesto de esfericidad, porque de eso depende todo lo demás. Se escribe con su chi cuadrado, sus grados de libertad y su p.

2. La corrección aplicada, si hubo que aplicarla. Con el nombre de la corrección y el valor de épsilon.

3. El estadístico F con sus grados de libertad, ya corregidos si procede.

4. El valor p.

5. El tamaño del efecto, normalmente eta cuadrado parcial (η²p) o eta cuadrado generalizado (η²G).

Y si el efecto es significativo y el factor tiene más de dos niveles, se añaden las comparaciones por pares con el método de ajuste que hayas usado. Nada de esto es opcional en APA 7: el manual pide un tamaño del efecto para cada contraste que informes, y una revista con revisión metodológica seria te devolverá el manuscrito si falta el resultado de Mauchly.

La esfericidad: qué es y por qué te obliga a cambiar los grados de libertad

La esfericidad es el supuesto de que las varianzas de las diferencias entre cada par de niveles son iguales. Ojo con el matiz, porque casi todo el mundo lo enuncia mal: no es que las varianzas de los niveles sean iguales, es que las varianzas de las diferencias entre niveles lo son.

Con dos niveles (pretest y postest, sin más) el supuesto se cumple por definición: solo hay una diferencia posible, así que solo hay una varianza. Por eso, en un diseño de dos medidas, SPSS te da la prueba de Mauchly en blanco y no hay nada que corregir. A partir de tres niveles ya hay varias diferencias y el supuesto puede fallar.

Cuando falla, la F se vuelve demasiado optimista: rechazas la hipótesis nula más veces de las que deberías. La solución no es cambiar de prueba, es castigar los grados de libertad multiplicándolos por un factor menor que 1, que es épsilon (ε). Al bajar los grados de libertad, el valor crítico de F sube y el p se hace más conservador. De ahí salen los decimales.

Mauchly no es una prueba de la que fiarse a ciegas

La prueba de Mauchly tiene el mismo problema que el resto de pruebas de supuestos: depende del tamaño muestral. Con 20 participantes no detecta violaciones que sí importan; con 200 marca como significativas desviaciones triviales. Es el mismo argumento que se aplica a la prueba de normalidad de Shapiro-Wilk, y por el mismo motivo.

Por eso una parte considerable de la literatura metodológica recomienda directamente corregir siempre, sin mirar Mauchly. Si épsilon vale 1, la corrección no cambia nada y no has perdido nada; si vale menos, ya estás cubierto. Esa práctica es defendible y cada vez más común, pero tiene una consecuencia práctica: si decides corregir siempre, dilo en el manuscrito. Un revisor que ve grados de libertad con decimales y ningún Mauchly reportado va a pensar que se te ha olvidado la prueba, no que has tomado una decisión.

Greenhouse-Geisser o Huynh-Feldt: cuál te toca

Hay dos correcciones y SPSS te da las dos, con lo cual la duda es cuál copiar. La regla que se usa en la práctica viene de Girden (1992) y depende del valor de épsilon de Greenhouse-Geisser:

Si ε de Greenhouse-Geisser es menor que .75, usa Greenhouse-Geisser. Es la corrección más conservadora y ahí es donde hace falta.

Si ε de Greenhouse-Geisser es mayor que .75, usa Huynh-Feldt. Greenhouse-Geisser corrige de más en ese rango y pierdes potencia sin motivo.

Hay una tercera opción que verás en las salidas, «límite inferior», y no la uses: es el caso peor teórico y es tan conservadora que casi nunca es lo que quieres.

Lo que no puedes hacer es mirar las tres filas, ver cuál te da p < .05 y copiar esa. Eso es p-hacking, se nota, y es exactamente el tipo de cosa que el revisor de artículos señala cuando lee un apartado de resultados.

Ejemplo completo, listo para copiar

Imagina un estudio de intervención en ansiedad con 30 participantes medidos en tres momentos: antes, después y a los tres meses. Esto es lo que iría en el apartado de Resultados:

«La prueba de Mauchly indicó que el supuesto de esfericidad no se cumplía, W = .72, χ²(2) = 9.34, p = .009, por lo que se aplicó la corrección de Greenhouse-Geisser (ε = .78). El efecto del momento de medida sobre la ansiedad fue significativo, F(1.56, 45.24) = 12.34, p < .001, η²p = .30. Las comparaciones por pares con ajuste de Bonferroni mostraron una reducción significativa entre el pretest (M = 24.30, DT = 5.12) y el postest (M = 18.70, DT = 4.88), p < .001, y entre el pretest y el seguimiento (M = 19.10, DT = 5.03), p = .002. La diferencia entre postest y seguimiento no fue significativa, p = 1.000.»

Fíjate en cuatro detalles que se fallan constantemente:

Los grados de libertad llevan dos decimales y no se redondean a entero. Si escribes F(2, 58) después de haber corregido, estás reportando el ANOVA sin corregir.

Épsilon va con dos decimales y sin cero delante del punto, porque no puede pasar de 1.

Un p de Bonferroni puede valer exactamente 1.000 y se escribe así. El ajuste multiplica el p por el número de comparaciones y se trunca en 1; no es un error de la salida.

Las medias y desviaciones típicas van dentro de la frase cuando son pocas. Si son muchas, van a una tabla y en el texto solo queda el contraste.

Eta cuadrado parcial en medidas repetidas: el aviso que casi nadie da

El η²p que devuelve SPSS en un diseño de medidas repetidas usa como denominador la suma de cuadrados del efecto más su término de error específico, no la variabilidad total. En diseños intrasujeto ese término de error es pequeño, porque la variabilidad entre personas ya se ha sacado fuera. Resultado: el η²p de un ANOVA de medidas repetidas sale sistemáticamente más alto que el de un diseño equivalente entre grupos, y no porque el efecto sea mayor.

Eso tiene dos consecuencias que te afectan de verdad. La primera es que no puedes comparar tu η²p con el de un estudio entre grupos como si midieran lo mismo. La segunda es que si alguien va a meter tu estudio en un metaanálisis, ese η²p le va a dar problemas.

La alternativa es eta cuadrado generalizado (η²G), propuesto por Olejnik y Algina (2003) precisamente para que los tamaños del efecto sean comparables entre diseños. Cada vez más revistas de psicología lo piden en diseños intrasujeto. Si tu revista objetivo no dice nada, lo más defendible es reportar los dos, o reportar η²p y decir en una frase que no es comparable con diseños entre grupos.

Si tienes el resultado ya redactado y necesitas sacar el tamaño del efecto sin rehacer las cuentas, la calculadora de tamaño del efecto lo convierte, y tamaño del efecto desde texto lo extrae directamente del párrafo.

La tabla, cuando hace falta

Con un solo factor intrasujeto y tres niveles, la tabla sobra: cabe todo en el texto. La tabla empieza a ganar cuando tienes un diseño mixto (un factor intrasujeto y otro entre grupos), varios factores intrasujeto, o más de una variable dependiente.

En ese caso, la tabla APA 7 lleva filete superior, filete bajo la cabecera y filete final, sin líneas verticales. Las columnas son: fuente de variación, gl, F, p y el tamaño del efecto. Los grados de libertad corregidos van en la columna gl con sus decimales, y la corrección aplicada se explica en la nota de la tabla, no en una columna.

Si prefieres no pelearte con los filetes en Word, el generador de tablas en APA 7 te la devuelve montada y lista para pegar.

Errores que salen una y otra vez

Reportar Mauchly y luego usar los grados de libertad sin corregir. Es el más común de todos. Reportas que la esfericidad falla y a continuación copias la fila «Esfericidad asumida». O corriges o no corriges, pero lo que dice el texto y lo que dicen los números tiene que ser lo mismo.

No decir qué corrección se ha usado. Poner grados de libertad con decimales y no nombrar a Greenhouse-Geisser ni a Huynh-Feldt deja al lector sin saber cuál de las dos está viendo, y son distintas.

Reportar Mauchly en un diseño de dos niveles. No hay nada que reportar: con dos medidas la esfericidad se cumple siempre. Si tu tabla de Mauchly sale vacía, no es un fallo de la salida.

Omitir el método de ajuste de las comparaciones por pares. «Las comparaciones post hoc fueron significativas» no dice nada. Bonferroni, Holm y Tukey dan resultados distintos, y hay que decir cuál.

Confundir el ANOVA de medidas repetidas con un modelo mixto cuando hay datos perdidos. El ANOVA de medidas repetidas elimina al participante entero si le falta una sola medida. En un estudio longitudinal con abandono, eso puede llevarse media muestra por delante sin que te des cuenta. Ahí el modelo mixto no es una preferencia estadística: es la única opción que usa todos los datos.

Este mismo ANOVA de medidas repetidas, con Greenhouse-Geisser aplicado sobre datos de verdad y no sobre un ejemplo de manual, es parte del capítulo 4 del libro «Reporta tus resultados en APA 7»: diez capítulos que recorren un solo estudio, con el dataset y los scripts para reproducir cada número.

Antes de enviarlo

El apartado de Resultados de un diseño intrasujeto es donde más objeciones técnicas se acumulan, porque hay muchas decisiones seguidas y cada una deja rastro. Si quieres ver qué te van a objetar antes de que lo haga el editor, sube el manuscrito al revisor de artículos: es gratis, no pide registro y te dice exactamente qué falta en cada frase.

Referencias

Girden, E. R. (1992). ANOVA: Repeated measures. Sage.

Greenhouse, S. W., y Geisser, S. (1959). On methods in the analysis of profile data. Psychometrika, 24(2), 95-112.

Huynh, H., y Feldt, L. S. (1976). Estimation of the Box correction for degrees of freedom from sample data in randomized block and split-plot designs. Journal of Educational Statistics, 1(1), 69-82.

Mauchly, J. W. (1940). Significance test for sphericity of a normal n-variate distribution. The Annals of Mathematical Statistics, 11(2), 204-209.

Olejnik, S., y Algina, J. (2003). Generalized eta and omega squared statistics: Measures of effect size for some common research designs. Psychological Methods, 8(4), 434-447.

Sigue leyendo

Todos los articulos del blog