Imputación de Datos Faltantes en SPSS y R: MCAR, MAR, MNAR y MICE

Los datos perdidos no son una rareza que ocurre solo en tesis mal planificadas: aparecen en estudios longitudinales cuando los participantes abandonan, en encuestas cuando se saltan ítems sensibles, en registros clínicos cuando el dato no se recogió. Lo que decides hacer con ellos afecta la validez de tus conclusiones, y "eliminar los casos que tengan algún dato faltante" no es la respuesta estadísticamente correcta en la mayoría de los casos. Esta guía explica por qué y muestra las alternativas paso a paso.

Los tres mecanismos de datos perdidos

La forma en que los datos desaparecen condiciona qué puedes hacer con ellos. Rubin (1976) distingue tres mecanismos:

  • MCAR (Missing Completely At Random): la probabilidad de que un dato falte no depende ni del valor de esa variable ni de ninguna otra variable del estudio. Es el supuesto más benévolo (y el menos frecuente en la práctica). Un ordenador que se cuelga aleatoriamente durante la recogida de datos produce MCAR. Si los datos son MCAR, eliminar los casos incompletos produce estimaciones insesgadas (aunque pierdas potencia).
  • MAR (Missing At Random): la probabilidad de que el dato falte depende de otras variables observadas, pero no del valor del dato faltante en sí. Por ejemplo: los hombres mayores responden menos a las preguntas de salud mental que las mujeres jóvenes, y tienes esa información en tu base de datos. MAR es el supuesto que los métodos modernos de imputación requieren y que se puede defender con argumentación y con los datos disponibles.
  • MNAR (Missing Not At Random): la probabilidad de que el dato falte depende del valor que habría tenido. El ejemplo clásico: los pacientes con mayor dolor no acuden a la revisión final del estudio, así que no tienes sus puntuaciones de dolor. MNAR es el más problemático y ningún método estadístico puede resolver completamente el sesgo que produce sin información adicional externa.

El primer paso, siempre, es explorar el patrón de datos perdidos y argumentar qué mecanismo es más plausible. Esto va en la sección de Método. Ignorarlo es uno de los errores que los revisores de revistas Q1 señalan con más frecuencia.

Por qué eliminar casos es casi siempre una mala idea

La eliminación por lista (listwise deletion) solo es válida bajo MCAR, que es el supuesto más restrictivo y generalmente incorrecto. Bajo MAR, eliminar los casos incompletos introduce sesgo porque los que se quedan son sistemáticamente distintos de los que se van. Además, pierdes potencia porque reduces la muestra, y en estudios donde el tamaño muestral ya era ajustado eso puede hacer que el análisis deje de ser viable.

La eliminación por pares (pairwise deletion, que SPSS usa en algunas tablas de correlación) tampoco resuelve el problema: usa subconjuntos distintos de casos para cada par de variables, lo que produce matrices de covarianza no definidas positivamente que hacen fallar el AFC u otras técnicas multivariadas.

Imputación única: por la media y similares

Sustituir los valores faltantes por la media de la variable es simple e intuitivo, pero tiene dos defectos graves: reduce la varianza real de la variable (todos los imputados tienen el mismo valor) y no incorpora incertidumbre en la estimación. Los errores estándar quedan artificialmente pequeños. La imputación por la media solo es aceptable cuando hay muy pocos datos perdidos (menos del 5%) bajo MCAR, y siempre es inferior a la imputación múltiple.

Imputación múltiple con MICE: la solución estándar

La imputación múltiple (MI) genera varias versiones completas del conjunto de datos (habitualmente 5 a 20, según el porcentaje de datos perdidos), analiza cada versión por separado y combina los resultados con las reglas de Rubin. Al generar varias imputaciones, la incertidumbre sobre los valores faltantes queda reflejada en los errores estándar finales.

El algoritmo más utilizado es MICE (Multiple Imputation by Chained Equations), también llamado imputación por ecuaciones condicionales. Cada variable con datos perdidos se imputa con un modelo de regresión (lineal, logística, etc.) que usa las demás variables como predictores, de forma iterativa. MICE funciona bien con datos de distintos tipos (continuas, ordinales, dicotómicas mezcladas) y bajo el supuesto MAR.

Imputación múltiple en SPSS

  1. Ve a Analyze > Multiple Imputation > Impute Missing Data Values.
  2. Mueve las variables con datos perdidos (y las variables auxiliares que ayuden a predecirlos) al panel de análisis.
  3. Elige el número de imputaciones: mínimo 5, más si el porcentaje de datos perdidos supera el 20%.
  4. SPSS crea una nueva variable Imputation_ que identifica cada versión imputada (0 = datos originales, 1 a M = versiones imputadas).
  5. Ejecuta tu análisis principal sobre este dataset ampliado. SPSS con el procedimiento de imputación activo combina los resultados automáticamente usando las reglas de Rubin.

Imputación múltiple en R con mice

library(mice)
# Explorar patrón de perdidos
md.pattern(datos)

# Imputar: m = número de imputaciones, method = pmm para continuas
imp <- mice(datos, m = 10, method = "pmm", seed = 123)

# Analizar en cada dataset imputado
fit <- with(imp, lm(y ~ x1 + x2))

# Combinar resultados (reglas de Rubin)
summary(pool(fit))

El método pmm (predictive mean matching) es robusto para variables continuas no normales porque imputa valores realmente observados en lugar de valores predichos por la ecuación. Para variables dicotómicas usa logreg; para politómicas, polyreg.

Cuántas imputaciones necesitas

La regla clásica de 5 imputaciones es conservadora. Von Hippel (2020) propone que el número de imputaciones debería ser al menos igual al porcentaje de datos perdidos: si tienes un 20% de datos perdidos, usa al menos 20 imputaciones. Con menos, la eficiencia de la estimación cae y los errores estándar combinados no son estables entre ejecuciones.

Cómo reportar en la sección de Método

Describe: (1) el porcentaje de datos perdidos por variable, (2) el mecanismo supuesto (MCAR, MAR) y cómo lo evaluaste (por ejemplo, test de Little para MCAR), (3) el método de imputación (MICE con M imputaciones), (4) las variables auxiliares incluidas en el modelo de imputación, y (5) el software. Ejemplo: "El 8% de los valores estaban perdidos en la escala de ansiedad. El test de Little no rechazó el supuesto MCAR (chi2(34) = 38.1, p = .29), aunque dado el patrón de respuesta se consideró MAR más plausible. Se realizó imputación múltiple con MICE (M = 10) usando el paquete mice 3.16 en R (R Core Team, 2024), incluyendo como variables auxiliares edad, sexo y puntuación de depresión."

El artículo en inglés sobre managing missing data amplía los detalles técnicos de cada método y las condiciones de aplicación.

Una vez limpios los datos con imputación múltiple, el siguiente paso habitual es verificar la consistencia interna de los instrumentos. La calculadora de omega de McDonald y la calculadora de alfa de Cronbach permiten comprobarlo directamente desde los estadísticos de la escala.

¿Tienes datos perdidos y no sabes cómo justificar el método ante el comité?

Soy doctor en Psicología y evalúo el patrón de datos perdidos, decido el método correcto y ejecuto la imputación múltiple con el texto listo para el apartado de Método. Da igual si es SPSS o R. Diagnóstico inicial gratis.

Reservar diagnóstico gratuito →

Sigue leyendo

Todos los articulos del blog