El revisor pide invarianza de medición: qué significa y cómo se prueba

El comentario suele llegar así: «before comparing latent means across groups, the authors must establish measurement invariance». O en su versión más corta y más fría: «the group comparisons are not interpretable without evidence of invariance». Si tu artículo compara puntuaciones entre hombres y mujeres, entre países, entre grupo clínico y control o entre dos momentos temporales, es probablemente el comentario más devastador que puedes recibir, porque no cuestiona un análisis: cuestiona si la comparación central del artículo significa algo.

También es de los que más se responden mal. Hay dos formas típicas de fallar: la primera es correr la prueba, ver que la invarianza escalar no se cumple, y seguir comparando medias como si nada. La segunda es la contraria, entrar en pánico y retirar todas las comparaciones cuando la invarianza parcial habría bastado perfectamente.

Aquí tienes qué está protegiendo el revisor, qué significa cada uno de los cuatro niveles y qué te autoriza a hacer cada uno, la ejecución concreta en R con lavaan y semTools, en Mplus y en jamovi, los criterios de decisión actualizados con sus umbrales, la tabla APA 7 tal cual se presenta y tres párrafos de respuesta: invarianza alcanzada, invarianza parcial y invarianza no alcanzada.

Qué sospecha el revisor: que tu diferencia no sea una diferencia

Cuando comparas la puntuación media de ansiedad entre adolescentes españoles y chilenos, estás dando por hecho algo que no has demostrado: que el cuestionario mide lo mismo, de la misma manera, en los dos grupos. Si un ítem como «me cuesta relajarme» funciona distinto en un contexto que en otro, porque se traduce peor, porque la palabra tiene otra carga, porque el grupo clínico entiende «relajarme» de otro modo, entonces la diferencia de medias que has encontrado mezcla dos cosas: una diferencia real en ansiedad y un sesgo del instrumento. Y no hay forma de separarlas después.

Esa es exactamente la sospecha del revisor. No duda de tu análisis de varianza, duda de que las dos puntuaciones estén en la misma escala. Es el mismo problema que compararías si midieras a un grupo en centímetros y a otro en pulgadas: la aritmética funciona, el resultado no significa nada.

La invarianza de medición es el procedimiento estándar para descartar esa alternativa. Consiste en una secuencia de análisis factoriales confirmatorios multigrupo en los que vas imponiendo restricciones progresivamente más duras y compruebas si el ajuste del modelo empeora. Si no empeora, los parámetros que has igualado entre grupos son equivalentes y la comparación correspondiente es lícita. Si empeora, has encontrado dónde el instrumento se comporta distinto.

Un detalle que conviene tener claro para responder bien: la invarianza no es un requisito burocrático que se cumple o no se cumple. Es información. Descubrir que dos ítems funcionan distinto en un país es un hallazgo publicable por sí mismo, no un fracaso, y enmarcarlo así en la respuesta cambia por completo cómo lo lee el editor.

Los cuatro niveles y qué te autoriza a hacer cada uno

La secuencia es acumulativa: cada modelo añade restricciones al anterior, y no tiene sentido probar el siguiente si el anterior falló. Lo importante no es la lista, es la columna de «qué puedes concluir», que es lo que el revisor está mirando.

Configural: la misma estructura

El modelo se estima simultáneamente en todos los grupos con la misma configuración (los mismos ítems cargando en los mismos factores) pero sin igualar ningún parámetro. Lo que pruebas es que el constructo tiene la misma forma en todos los grupos: que la escala de burnout tiene tres factores tanto en enfermería como en docencia.

Si el modelo configural no ajusta, no hay nada más que hacer con la secuencia: el instrumento no representa la misma estructura en los dos grupos y comparar cualquier cosa es indefendible. Es raro que ocurra si el modelo de un factor ajustaba bien en la muestra total, pero pasa, sobre todo con traducciones.

Métrica o débil: las mismas cargas factoriales

Igualas las cargas factoriales entre grupos. Lo que estás probando es que un cambio de una unidad en el factor latente produce el mismo cambio en la respuesta al ítem en todos los grupos, es decir, que los ítems son igual de buenos indicadores del constructo.

Qué te autoriza: comparar correlaciones, covarianzas, coeficientes de regresión y efectos estructurales entre grupos. Si tu artículo lo que hace es probar si la asociación entre perfeccionismo y ansiedad es más fuerte en un grupo que en otro, con invarianza métrica ya has cubierto el requisito. Mucha gente sufre buscando la escalar cuando su pregunta de investigación solo necesitaba la métrica.

Escalar o fuerte: los mismos interceptos

Además de las cargas, igualas los interceptos de los ítems (o los umbrales, si los ítems son ordinales). Estás probando que dos personas con el mismo nivel del constructo latente, una de cada grupo, responden lo mismo al ítem. Es lo que descarta el sesgo sistemático de respuesta.

Qué te autoriza: comparar medias, latentes u observadas. Este es el nivel que necesitas si tu artículo dice «las mujeres puntúan más alto en X que los hombres», y por eso es el nivel que el revisor pide en la inmensa mayoría de los casos.

Estricta o residual: las mismas varianzas residuales

Se igualan además las varianzas de error de los ítems. Estás probando que la fiabilidad del instrumento es equivalente entre grupos. Es un nivel exigente y bastante discutido: para comparar medias LATENTES no hace falta, porque el error ya está modelado fuera del factor. Solo se vuelve relevante si vas a comparar puntuaciones OBSERVADAS (sumatorios), donde el error sí entra en el total.

Si un revisor te exige invarianza estricta para comparar medias latentes, puedes discrepar con argumento y con literatura. Es uno de los pocos sitios de esta lista donde la petición del revisor suele ir más allá de lo necesario.

Cómo se ejecuta, software por software

Antes de tocar nada, dos decisiones que condicionan todo lo demás. Primera: si tus ítems son Likert con cinco o menos categorías, tratarlos como continuos sesga las cargas y los índices de ajuste; hay que usar correlaciones policóricas y estimación WLSMV, y en ese caso la secuencia trabaja con UMBRALES en lugar de con interceptos, siguiendo el esquema de Wu y Estabrook (2016). Segunda: necesitas un tamaño muestral razonable EN CADA GRUPO, no en total; con 60 personas en el grupo pequeño la prueba tiene poca potencia y los resultados son inestables.

R con lavaan y semTools

La vía corta es cfa() con el argumento group para el modelo configural, y luego group.equal = c("loadings") y group.equal = c("loadings", "intercepts") para los siguientes. Compararlos con lavTestLRT() o con la función compareFit() de semTools, que devuelve directamente una tabla con los índices y sus diferencias.

La vía recomendada para ítems ordinales es measEq.syntax() de semTools, que genera la sintaxis correcta con los umbrales y las identificaciones adecuadas para el esquema de Wu y Estabrook, algo que a mano se equivoca casi todo el mundo. Le pasas el modelo, los datos, ordered con los nombres de los ítems, group, y el argumento group.equal con el nivel que quieras.

Si usas MLR (estimación robusta para no normalidad), la diferencia de chi cuadrado NO se calcula restando: hay que pedir la corrección de Satorra-Bentler, que lavTestLRT hace con method = "satorra.bentler.2001". Restar chi cuadrados robustos a mano es un error que un revisor metodólogo detecta en la tabla.

Mplus

Desde la versión 7, el bloque ANALYSIS admite MODEL = CONFIGURAL METRIC SCALAR y Mplus estima los tres modelos en una sola pasada y te da la tabla de comparación hecha. Es la ruta más limpia si tienes licencia. Con GROUPING = grupo (1 = ... 2 = ...) en el bloque VARIABLE queda definido el agrupamiento.

Con ítems categóricos y estimador WLSMV, la diferencia de chi cuadrado exige DIFFTEST: guardas la derivada del modelo menos restringido con SAVEDATA: DIFFTEST = archivo.dat y en el modelo restringido pones ANALYSIS: DIFFTEST = archivo.dat. Sin eso, la comparación de chi cuadrados no es válida.

Si comparas muchos grupos a la vez, digamos veinte países, la secuencia clásica es poco práctica y casi siempre falla: ahí la alternativa es la optimización por alineamiento (ALIGNMENT), pensada exactamente para ese caso.

jamovi y SPSS

jamovi no trae invarianza multigrupo en su análisis de AFC de base. Hay módulos de la biblioteca que la incorporan, pero si tu artículo va a una revista Q1 lo razonable es hacerla en lavaan (el propio jamovi permite ejecutar sintaxis de R a través del módulo Rj) y reportar la versión de los paquetes.

SPSS tampoco la hace: se necesita AMOS, donde se define un modelo multigrupo y se especifican los modelos anidados en el gestor de modelos, o EQS. Si tu método dice «los análisis se realizaron con SPSS 29» y el revisor te pide invarianza, vas a tener que declarar un software adicional, lo cual es perfectamente normal y no penaliza.

Criterios de decisión: por qué el chi cuadrado ya no manda

La prueba clásica es la diferencia de chi cuadrado entre modelos anidados. El problema es conocido: el chi cuadrado es sensible al tamaño muestral, y con 800 participantes cualquier desviación trivial resulta significativa. Si sigues solo ese criterio, casi ningún instrumento pasa la invarianza escalar en muestras grandes, lo cual es señal de que el criterio no discrimina bien, no de que todos los instrumentos estén rotos.

Por eso la práctica actual combina el chi cuadrado con los cambios en los índices de ajuste aproximado. Los umbrales que un revisor de psicología reconoce son estos:

Invarianza parcial: la salida que casi nadie usa bien

Cuando la invarianza escalar falla, la respuesta correcta no suele ser abandonar la comparación, sino localizar QUÉ ítems la rompen y liberarlos. Es la invarianza parcial que propusieron Byrne, Shavelson y Muthén (1989), y está aceptada desde entonces: basta con que queden al menos dos ítems por factor con carga e intercepto invariantes para que las medias latentes sigan siendo comparables.

El procedimiento es este: partes del modelo escalar, miras los índices de modificación de los interceptos, liberas el mayor, vuelves a estimar, y repites hasta alcanzar un ajuste aceptable. Dos cautelas que separan una respuesta seria de una expedición de pesca. La primera: libera de uno en uno y reestima entre medias, porque los índices de modificación cambian. La segunda: cada ítem liberado hay que interpretarlo sustantivamente, no solo estadísticamente. Si el ítem no invariante entre España y Chile es el que habla de «coger» algo, tienes una explicación de traducción, y esa frase en la discusión vale más que toda la tabla.

Cómo se reporta en APA 7

La invarianza se reporta con una tabla y dos párrafos, uno en el método (procedimiento y criterios, declarados ANTES de ver los resultados) y otro en resultados (qué salió).

La tabla tiene una fila por modelo (configural, métrico, escalar, escalar parcial si aplica, estricto si lo pruebas) y estas columnas: χ², gl, p, CFI, TLI, RMSEA con su intervalo de confianza del 90%, SRMR, y luego las columnas de comparación: Δχ², Δgl, p de la diferencia, ΔCFI, ΔRMSEA, ΔSRMR. La nota al pie declara el estimador, el software con su versión, el tratamiento de faltantes y los umbrales que has usado, con su cita.

El párrafo de resultados tipo, en el caso limpio:

«Se examinó la invarianza de medición del cuestionario entre hombres (n = 412) y mujeres (n = 508) mediante análisis factorial confirmatorio multigrupo con estimador WLSMV. El modelo configural mostró un ajuste adecuado, χ²(246) = 502,31, p < .001, CFI = .967, RMSEA = .048 [.042, .054], SRMR = .045. La imposición de cargas iguales no deterioró el ajuste, ΔCFI = -.003, ΔRMSEA = .002, ΔSRMR = .008, apoyando la invarianza métrica. La imposición adicional de umbrales iguales tampoco lo hizo, ΔCFI = -.004, ΔRMSEA = .001, ΔSRMR = .005, apoyando la invarianza escalar. Se concluye que las comparaciones de medias latentes entre sexos son interpretables.»

Y en el caso de invarianza parcial: «El modelo escalar completo deterioró el ajuste (ΔCFI = -.018). La inspección de los índices de modificación señaló el ítem 7 («me cuesta tomar decisiones») como fuente principal de no invarianza. Al liberar su umbral, el modelo escalar parcial alcanzó un ajuste equivalente al métrico (ΔCFI = -.004). Dado que se mantuvieron invariantes cinco de los seis ítems del factor, las comparaciones de medias latentes se consideran interpretables (Byrne et al., 1989), si bien con la cautela que introduce el funcionamiento diferencial del ítem 7.»

El párrafo de respuesta al revisor, redactado

Tres versiones según lo que te salga. La estructura común: agradecer sin adular, decir qué hiciste, dar las cifras clave dentro del propio párrafo (el revisor no debería tener que ir a buscar la tabla para saber si funcionó), y decir qué cambió en el manuscrito.

Si alcanzas la invarianza escalar

«Agradecemos esta observación, que señala un requisito que no habíamos documentado. Hemos añadido al apartado de resultados un análisis de invarianza de medición entre los dos grupos mediante AFC multigrupo (nueva Tabla 2, p. 12) siguiendo la secuencia configural, métrica y escalar, con estimador WLSMV al tratarse de ítems ordinales de cinco categorías, y con umbrales parametrizados según Wu y Estabrook (2016).

El modelo configural ajustó adecuadamente (CFI = .967, RMSEA = .048 [.042, .054]) y ni la restricción de cargas (ΔCFI = -.003) ni la de umbrales (ΔCFI = -.004) deterioraron el ajuste por encima del criterio de .010 (Chen, 2007). Se alcanzó, por tanto, invarianza escalar, lo que respalda la interpretabilidad de las comparaciones de medias que constituían el objetivo del estudio. Hemos añadido en el método la descripción del procedimiento y sus criterios (p. 9) y una frase en la discusión que explicita que las diferencias observadas no son atribuibles a funcionamiento diferencial del instrumento (p. 18).»

Si solo alcanzas invarianza parcial

«Agradecemos la sugerencia, cuyo resultado ha resultado informativo más allá de lo esperado. La secuencia de invarianza (nueva Tabla 2) alcanzó invarianza métrica sin problemas (ΔCFI = -.002), pero la escalar completa deterioró el ajuste por encima del criterio (ΔCFI = -.019). Los índices de modificación identificaron el ítem 7 como principal fuente de no invarianza, y al liberar su intercepto el modelo escalar parcial resultó equivalente al métrico (ΔCFI = -.005).

Dado que se mantienen invariantes cinco de los seis interceptos del factor, las comparaciones de medias latentes siguen siendo interpretables bajo el criterio de invarianza parcial (Byrne, Shavelson y Muthén, 1989), y así lo hemos hecho constar en el método (p. 10). Hemos sustituido además las comparaciones de puntuaciones observadas por comparaciones de medias latentes, que son las que la invarianza parcial autoriza, y hemos añadido a la discusión (p. 19) una interpretación sustantiva del ítem no invariante: su formulación apela a una expresión con connotaciones distintas en las dos variedades del español de la muestra, lo que sugiere una revisión de la adaptación para futuros usos. Consideramos que este hallazgo secundario refuerza el interés del artículo.»

Si la invarianza no se sostiene

Aquí no hay forma de salvar la comparación de medias, y el error de cálculo típico es intentarlo. Lo que sí se puede salvar es el artículo, cambiando la pregunta: de «los grupos difieren en X» a «el instrumento funciona distinto entre grupos, y esto es lo que implica».

«Agradecemos el comentario, que nos ha obligado a revisar la afirmación central del manuscrito. La secuencia de invarianza (nueva Tabla 2) no alcanzó la invarianza escalar, ni siquiera en su versión parcial: fue necesario liberar cuatro de los seis interceptos para lograr un ajuste aceptable, lo que deja el modelo por debajo del mínimo requerido para comparar medias latentes.

En consecuencia hemos reformulado el manuscrito. Hemos retirado las comparaciones de medias entre grupos del apartado de resultados y de la discusión, y hemos reorientado el estudio hacia lo que los datos sí sostienen: la equivalencia estructural y métrica del instrumento (que sí se alcanzó) y la identificación del funcionamiento diferencial de cuatro ítems, presentado ahora como resultado principal con su interpretación de contenido. El título, el abstract y los objetivos se han modificado en coherencia (pp. 1-3). Somos conscientes de que esto cambia el alcance del artículo, pero consideramos que publicar diferencias de medias no interpretables habría sido peor, y que el mapa de ítems no invariantes es información útil para quienes usen la escala en esta población.»

Preguntas frecuentes

¿Cuánta muestra hace falta por grupo para probar invarianza?

No hay un número mágico, pero por debajo de 100-150 participantes en el grupo más pequeño la prueba tiene poca potencia y los índices de ajuste se vuelven inestables, sobre todo con estimadores robustos. Si tu grupo pequeño tiene 60 personas, lo honesto es reportar la prueba y declarar la limitación de potencia, no presentar un resultado no significativo como evidencia de invarianza.

¿Necesito invarianza si solo comparo correlaciones entre grupos, no medias?

Necesitas invarianza métrica, no escalar. Igualar cargas es lo que garantiza que la métrica del factor es la misma y que un coeficiente estructural significa lo mismo en ambos grupos. Es un nivel bastante más fácil de alcanzar que el escalar, así que si tu pregunta era de asociación y no de nivel, el problema suele ser menor de lo que temes.

¿La invarianza longitudinal se prueba igual que la de grupos?

La lógica es la misma pero la implementación cambia: no hay grupos, hay medidas repetidas dentro de la misma persona, así que el modelo se estima con los factores de cada ola en un solo modelo y hay que correlacionar los residuos del mismo ítem entre olas, porque un ítem comparte con su propia versión pasada más que el factor. Olvidar esas correlaciones de residuos es el error más común en invarianza longitudinal y produce un ajuste artificialmente malo.

¿Qué hago si tengo muchos grupos, por ejemplo 25 países?

La secuencia clásica casi siempre falla con muchos grupos, porque con tantas restricciones simultáneas cualquier desviación pequeña acumula. La alternativa estándar es la optimización por alineamiento de Asparouhov y Muthén (2014), disponible en Mplus, que estima el modelo con invarianza aproximada y te dice qué parámetros son no invariantes en qué grupos sin exigir invarianza exacta. Se reporta con su propia tabla y con el porcentaje de parámetros no invariantes.

¿La invarianza es lo mismo que el funcionamiento diferencial del ítem (DIF)?

Responden a la misma preocupación desde dos tradiciones. La invarianza viene del marco de ecuaciones estructurales y trabaja con cargas e interceptos; el DIF viene de la teoría de respuesta al ítem y trabaja con parámetros de discriminación y dificultad. Un ítem con intercepto no invariante es, conceptualmente, un ítem con DIF uniforme. Si tu revista es de psicometría, puede que prefiera el marco de TRI; si es de psicología aplicada, el de invarianza es el habitual.

¿Puedo comparar grupos si mi escala es una suma de ítems y no un factor latente?

Puedes, pero el requisito sube: para comparar puntuaciones sumadas necesitas en rigor invarianza estricta, porque el error de medida entra en la suma y no está modelado aparte. La salida más limpia es comparar medias latentes en un modelo multigrupo, que solo exige invarianza escalar y además corrige por error de medida. Es más trabajo y produce una comparación mejor.

¿Y en qué se diferencia de las otras herramientas?

También te puede interesar