Cómo reportar la prueba de esfericidad de Mauchly en APA 7

En breve

La prueba de Mauchly se escribe con la W en cursiva y sin cero inicial, y con un chi-cuadrado en redonda que lleva sus grados de libertad y la N dentro del paréntesis: W = .61, χ²(2, N = 60) = 28.67, p < .001, ε = .72. Esos gl no son los del ANOVA: salen de k(k − 1)/2 − 1, así que con tres medidas valen 2 y con cuatro, 5. Cuando la esfericidad no se cumple, el estadístico F no se recalcula: lo que cambia son los grados de libertad, que se multiplican por el epsilon y salen decimales, y con ellos el valor p — unos gl de (2, 118) con ε = .72 pasan a (1.44, 84.96) y se dejan así, con dos decimales, sin redondear a entero. La convención más citada (Girden, 1992) informa Greenhouse-Geisser cuando ε < .75 y Huynh-Feldt cuando ε ≥ .75; el límite inferior es tan conservador que ya casi nadie lo usa. El tamaño del efecto no se toca: η²p = .24 antes y después de corregir, porque las sumas de cuadrados son las mismas.

Pides el ANOVA de medidas repetidas, abres la salida y te encuentras dos tablas que nadie te explicó: una con una W de Mauchly y un chi-cuadrado, y otra con cuatro filas para un solo efecto, dos de ellas con grados de libertad que tienen decimales. La duda ya no es estadística, es de redacción: qué fila va al manuscrito, cómo se escribe y qué pasa si el valor p cruza el .05 al corregir. El reporte completo del contraste, con sus medias, su F y su tabla, está en cómo reportar un ANOVA de medidas repetidas en APA 7; aquí vamos solo a la esfericidad y a las correcciones.

Qué asume la esfericidad y qué se rompe cuando falla

La esfericidad no habla de las varianzas de tus medidas, sino de las varianzas de las diferencias entre ellas. Con tres momentos —pre, post y seguimiento a los tres meses— cada participante genera tres restas posibles (post − pre, seguimiento − pre, seguimiento − post), y el supuesto exige que esas tres diferencias tengan la misma varianza en la población. Es fácil que no la tengan: en una intervención para la ansiedad, la distancia entre el pre y el post varía muchísimo entre pacientes, mientras que la distancia entre el post y el seguimiento es pequeña en casi todo el mundo porque a esas alturas la mayoría se ha estabilizado.

Cuando esas varianzas son desiguales, el término de error del ANOVA de medidas repetidas se queda corto y la F sale más grande de lo que le corresponde. La consecuencia es una tasa de error de tipo I por encima del 5% nominal, y con una violación seria puede acercarse al doble de lo que crees estar usando. La corrección no maquilla nada, devuelve el contraste a su sitio recortando los grados de libertad para compensar la precisión que el modelo se había atribuido de más.

Con dos medidas no hay nada que comprobar. Una sola diferencia no puede tener varianzas desiguales consigo misma, así que la esfericidad se cumple por definición y SPSS te devuelve W = 1.000 con la celda del valor p vacía. Si tu diseño es pre-post y un revisor te pide la prueba de Mauchly, la respuesta es que no aplica, y sale más barato escribirlo en el manuscrito que discutirlo después. El supuesto entra en cuanto hay tres niveles o más del factor intra-sujetos, también cuando ese factor forma parte de una interacción con un factor entre sujetos.

La prueba de Mauchly comprueba esa igualdad, pero la comprueba mal. Con muestras pequeñas casi nunca detecta una violación real, y con muestras grandes marca como significativa una desviación trivial. Es el mismo defecto que arrastran casi todas las pruebas de supuestos, que dependen más del tamaño muestral que del tamaño de la violación (lo tienes desarrollado en cómo verificar los supuestos estadísticos). Por eso hay metodólogos que ya no la usan como interruptor y aplican la corrección de Greenhouse-Geisser siempre: APA 7 no lo prohíbe, siempre que lo declares en el apartado de análisis y no lo decidas después de ver el resultado.

La línea de Mauchly, escrita entera

Así queda en el texto: «La prueba de Mauchly indicó que el supuesto de esfericidad no se cumplía, W = .61, χ²(2, N = 60) = 28.67, p < .001, ε = .72». En esa línea hay cuatro decisiones de formato. La W va en cursiva, porque es un estadístico con letra latina, y sin cero inicial, porque está acotada entre 0 y 1. El chi-cuadrado va en redonda, porque la chi es una letra griega y APA 7 reserva la cursiva para el alfabeto latino. El epsilon, por lo mismo, también en redonda y también sin cero delante.

Los grados de libertad de ese chi-cuadrado no son los del ANOVA, y ahí se equivoca medio mundo. Salen de k(k − 1)/2 − 1, donde k es el número de medidas repetidas: con tres medidas son 2, con cuatro son 5 y con cinco, 9. No tienen relación con los gl del efecto, que en este ejemplo son 2 y 118; que el 2 salga en los dos sitios es una casualidad de tener tres medidas, y se deshace en cuanto pasas a cuatro, donde el efecto va con 3 y Mauchly con 5. Esos gl cuentan las covarianzas que la prueba está comparando, no los grupos ni las personas. Como todo chi-cuadrado en APA 7, lleva el tamaño muestral dentro del paréntesis, detrás de los gl y separado por una coma.

Cuando la prueba no sale significativa también se informa, y en la misma frase se dice qué has hecho después: «La prueba de Mauchly no indicó una violación de la esfericidad, W = .95, χ²(2, N = 60) = 2.98, p = .225; se informan los grados de libertad sin corregir». Un manuscrito que menciona a Mauchly y no aclara qué fila de la tabla acabó copiando obliga al revisor a suponerlo, y el revisor supone lo peor.

El sitio de esta frase es el primer párrafo de Resultados o el apartado de análisis de datos del Método, nunca una nota al pie ni el material suplementario. Ocupa una línea y responde de golpe a tres preguntas que un revisor de metodología va a hacer igualmente: si comprobaste el supuesto, qué encontraste y qué decidiste hacer con ello.

Los grados de libertad corregidos salen decimales, y así se dejan

El epsilon es un multiplicador de los grados de libertad, y no hace nada más. Vale 1 cuando la esfericidad es perfecta y baja hacia 1/(k − 1) cuanto peor se pone. Con ε = .72 y unos gl originales de (2, 118), los corregidos son 2 × .72 = 1.44 y 118 × .72 = 84.96. La F no se recalcula: sigue siendo 18.62, con las mismas sumas de cuadrados. Lo único que cambia es la distribución contra la que la comparas y, por tanto, el valor p.

La frase completa queda así: «El momento de medida tuvo un efecto significativo sobre la sintomatología ansiosa, F(1.44, 84.96) = 18.62, p < .001, η²p = .24, con corrección de Greenhouse-Geisser (ε = .72)». Dos decimales en los gl, la F tal cual, el nombre de la corrección con todas las letras y el epsilon a la vista para que cualquiera pueda reconstruir los grados de libertad originales sin pedirte los datos.

Redondear esos gl a enteros es el error más repetido y el más caro. F(1, 85) no es una versión limpia de F(1.44, 84.96): es otra prueba, con otra distribución de referencia y otro valor p. Los grados de libertad de una F no tienen por qué ser números enteros; lo son en los diseños entre sujetos porque cuentan grupos y personas, pero aquí son el producto de una escala por un factor decimal. Déjalos con dos decimales aunque la plantilla de la tabla proteste, y no elimines el del numerador porque parezca raro.

El tamaño del efecto no cambia al corregir. SPSS repite el mismo η²p = .24 en las cuatro filas porque las sumas de cuadrados son idénticas: el reparto de varianza es el que era y lo único que se ha movido es el listón de significación. Si en tu tabla el eta cuadrado parcial de la fila corregida no coincide con el de la fila de esfericidad asumida, no has aplicado una corrección: has copiado dos efectos distintos.

Greenhouse-Geisser, Huynh-Feldt o límite inferior: cuál informas

Greenhouse-Geisser. Es la corrección conservadora y la que ves en la mayoría de los artículos. Su epsilon nunca pasa de 1 ni baja del límite inferior, así que corrige de más cuando la violación es leve; a cambio, no deja pasar falsos positivos. Huynh-Feldt. Ajusta al alza el epsilon de Greenhouse-Geisser, que subestima cuando la esfericidad casi se cumple. Su valor puede pasar de 1 y entonces se trunca a 1, que equivale a no corregir. En el ejemplo de arriba, un ε de Greenhouse-Geisser de .72 corresponde a un ε de Huynh-Feldt de .73. Límite inferior. Asume el peor escenario posible, ε = 1/(k − 1), que con tres medidas es .50 y deja los grados de libertad en (1, 59). Es tan conservador que ya casi nadie lo informa; aparece en la salida porque SPSS lo imprime, no porque haga falta.

La regla de decisión más citada es la de Girden (1992): si el epsilon de Greenhouse-Geisser queda por debajo de .75, informas Greenhouse-Geisser; si queda por encima, Huynh-Feldt, que es menos conservador y ahí no hace falta pagar tanta potencia. Es una convención, no una ley. Hay metodólogos que recomiendan Greenhouse-Geisser siempre por sistema, y también es defendible. Lo que no se sostiene es calcular las dos y quedarse con la que cruza el .05.

Sea cual sea tu criterio, escríbelo en Método antes de mirar los resultados: «Cuando la prueba de Mauchly indicó una violación de la esfericidad se aplicó la corrección de Greenhouse-Geisser». Una frase de veinte palabras convierte una decisión que parece tomada a posteriori en una decisión declarada, y esa diferencia es la que separa un análisis defendible de uno que huele a pesca de resultados.

Hay dos salidas que no dependen de este supuesto. La aproximación multivariada —la traza de Pillai que SPSS imprime en la tabla anterior— no asume esfericidad y suele tener más potencia cuando el epsilon es bajo y la muestra no es diminuta. Los modelos mixtos van un paso más allá: modelan la estructura de covarianza en lugar de corregirla a posteriori, aguantan datos perdidos sin borrar personas enteras y son la opción razonable en cuanto tienes cuatro o cinco momentos. La comparación entera, con sus pegas, está en modelos mixtos frente a ANOVA de medidas repetidas.

Cuando la corrección cambia la decisión

Aquí es donde duele. Un estudio con 30 participantes medidos en tres momentos da esta prueba de Mauchly: W = .36, χ²(2, N = 30) = 28.61, p < .001, con ε de Greenhouse-Geisser de .61. Sin corregir, el efecto del momento es F(2, 58) = 3.42, p = .039. Con Greenhouse-Geisser, F(1.22, 35.38) = 3.42, p = .065. Con Huynh-Feldt (ε = .62), p = .064. Con el límite inferior, .075. El efecto es exactamente el mismo en las cuatro filas: lo único que se mueve es el listón contra el que lo comparas.

La frase que toca escribir no dice «marginalmente significativo» ni «tendencia a la significación». Dice esto: «Tras aplicar la corrección de Greenhouse-Geisser (ε = .61), el efecto del momento de medida no alcanzó el nivel de significación, F(1.22, 35.38) = 3.42, p = .065, η²p = .11». Si tu criterio era el .05, un .065 está fuera, y describirlo con un adverbio no lo mete dentro.

El tamaño del efecto sigue ahí y es el que da la lectura honesta. Un η²p de .11 con 30 personas no es una ausencia de efecto: es un estudio corto de potencia que no ha podido separar ese efecto del ruido con el diseño que tenía. Eso se escribe en la discusión con esas palabras, se acompaña del intervalo de confianza de la diferencia entre medias y sirve para que quien replique el estudio sepa con cuántos participantes tiene que venir.

Copiar la fila de esfericidad asumida cuando Mauchly ha salido significativo es la versión de medidas repetidas del p-hacking, y se detecta desde fuera sin acceso a los datos: unos grados de libertad enteros junto a una prueba de Mauchly significativa cuentan la historia solos. Si por algún motivo informas la fila sin corregir, dilo y justifícalo en la misma frase.

Qué fila copiar en cada programa

SPSS. Te da dos tablas. En «Prueba de esfericidad de Mauchly» están la W, el chi-cuadrado aproximado, los gl, el valor p y las tres columnas de epsilon (Greenhouse-Geisser, Huynh-Feldt y límite inferior). En «Pruebas de efectos intra-sujetos» está el efecto repetido cuatro veces, una fila por corrección. Copias una fila entera —F, gl del efecto, gl del error y p—, y que sea la que anunciaste. Mezclar los gl de una fila con el valor p de otra es más frecuente de lo que parece cuando se copia a mano.

jamovi y JASP. La corrección es una casilla en el panel de supuestos, con las opciones «Ninguna», «Greenhouse-Geisser» y «Huynh-Feldt». Marca solo la que vas a informar: si dejas las tres, la tabla sale con tres filas por efecto y volverás al problema de elegir mirando el valor p.

R. Ojo con esto, porque cambia lo que estás copiando sin avisarte. La función aov_ez del paquete afex aplica Greenhouse-Geisser por defecto e imprime los grados de libertad ya corregidos, así que si pegas su salida tal cual llevas la corrección puesta aunque no la hayas pedido, y tienes que declararlo. La función ezANOVA del paquete ez hace lo contrario: da la tabla sin corregir y, aparte, una tabla de correcciones con GGe, p[GG], HFe y p[HF], donde el epsilon te lo dan pero los grados de libertad los multiplicas tú.

En la tabla del artículo, la nota es de una línea: «Los grados de libertad se han corregido con Greenhouse-Geisser (ε = .72)». Antes de enviar, lee la frase entera en voz alta y comprueba tres cosas: que la corrección que nombras es la de los gl que has escrito, que el epsilon aparece y que la W y el epsilon van sin cero inicial. El formateador de resultados APA te devuelve la línea con las cursivas y los decimales colocados, y el reporte del contraste completo, con su tabla y su tamaño del efecto, está en cómo reportar un ANOVA en APA 7.

Preguntas frecuentes

¿Cómo se reporta la prueba de Mauchly en APA 7?

En una frase, dentro del texto, con la W en cursiva y sin cero inicial, el chi-cuadrado en redonda con sus gl y la N dentro del paréntesis, el valor p y el epsilon: «La prueba de Mauchly indicó que el supuesto de esfericidad no se cumplía, W = .61, χ²(2, N = 60) = 28.67, p < .001, ε = .72». Justo después se dice qué corrección se aplicó, para que el lector sepa de dónde salen los grados de libertad de la tabla.

¿Qué hago si la prueba de Mauchly sale significativa?

No repites el análisis ni cambias de prueba: aplicas una corrección de los grados de libertad y copias esa fila. El estadístico F y el tamaño del efecto son los mismos; lo que cambia es el par de gl, que se multiplican por el epsilon, y con ellos el valor p. Con ε = .72, unos gl de (2, 118) pasan a (1.44, 84.96) y la frase queda F(1.44, 84.96) = 18.62, p < .001, η²p = .24, con corrección de Greenhouse-Geisser.

¿Por qué los grados de libertad corregidos tienen decimales? ¿Se redondean?

Tienen decimales porque son el resultado de multiplicar los gl originales por el epsilon, que es un número entre 1/(k − 1) y 1. No se redondean a entero: F(1, 85) es otra prueba, con otra distribución de referencia, y el valor p que da no es el que has calculado. La convención es dejarlos con dos decimales, tal como los imprime el programa.

¿Greenhouse-Geisser o Huynh-Feldt?

La convención de Girden (1992), que es la que sigue casi todo el mundo, dice Greenhouse-Geisser cuando el epsilon está por debajo de .75 y Huynh-Feldt cuando está por encima, porque ahí Greenhouse-Geisser corrige de más y te cuesta potencia. Hay quien informa siempre Greenhouse-Geisser, y es defensible mientras se declare de antemano. Lo que no vale es calcular las dos y quedarse con la que cruza el .05.

¿Hay que hacer la prueba de Mauchly si solo tengo dos medidas?

No, y no se puede. Con dos medidas hay una única diferencia por persona, así que la esfericidad se cumple por definición: SPSS devuelve W = 1.000 y deja el valor p en blanco. El supuesto entra a partir de tres niveles del factor intra-sujetos. Si tu diseño es pre-post, escribe una línea diciendo que la esfericidad no aplica y ahórrate la pregunta del revisor.

¿Cambia el tamaño del efecto al corregir por esfericidad?

No. Las sumas de cuadrados son las mismas antes y después, así que el eta cuadrado parcial no se mueve: SPSS imprime el mismo η²p en las cuatro filas de la tabla. La corrección solo modifica los grados de libertad y el valor p. Si en tu tabla el tamaño del efecto cambia entre la fila corregida y la de esfericidad asumida, has copiado dos efectos distintos.

¿Copiaste la fila que dijiste que ibas a copiar?

El Revisor Q1 lee tu apartado de resultados con la lista de un revisor de primera línea y te marca los grados de libertad que no cuadran con la corrección que anuncias, el epsilon que falta y la fila que no tocaba, antes de que lo haga un informe con fecha límite.

Revisar mi manuscrito

Con la W en cursiva, la chi y el epsilon en redonda, los grados de libertad corregidos con sus dos decimales y el nombre de la corrección escrito, tu ANOVA de medidas repetidas ya no le da a nadie un motivo fácil para devolverlo. Si la duda es anterior —cuántos momentos de medida aguanta tu diseño, si conviene corregir o pasarse a un modelo mixto, qué se informa en la tabla—, eso sale mucho más barato antes de recoger los datos que después: en consultoría estadística revisamos el plan completo y dejamos por escrito qué va en cada tabla.

Sigue leyendo

Todos los articulos del blog