La regresión múltiple es probablemente el análisis multivariante más utilizado en psicología, y también uno de los que más decisiones metodológicas requiere antes, durante y después de su ejecución. Una de las decisiones más controvertidas es el método de selección de variables: ¿deberías incluir todos los predictores de golpe (método enter), añadirlos uno a uno según su contribución estadística (método forward o stepwise), o seguir alguna otra estrategia? La respuesta depende fundamentalmente de si tu objetivo es explicar un fenómeno o predecir un resultado, y confundir ambos propósitos es una fuente habitual de problemas.
El método stepwise (paso a paso) fue enormemente popular durante décadas, pero ha caído en desgracia entre los metodólogos por razones bien fundamentadas. En su versión clásica, el algoritmo añade predictores al modelo uno a uno, seleccionando en cada paso el que aporta la mayor contribución estadísticamente significativa, y eliminando los que dejan de serlo al incluir nuevos predictores. El problema es que este proceso capitaliza el azar de forma masiva. Con 20 predictores potenciales y 100 participantes, el stepwise encontrará un modelo que parece funcionar bien con tus datos, pero que probablemente no se replicará en una muestra nueva. Las tasas de error tipo I se inflan dramáticamente, los coeficientes están sesgados hacia valores más extremos, y el R² del modelo final sobreestima la varianza explicada real.
Métodos de entrada y selección guiada por la teoría
El método enter (introducir todos los predictores simultáneamente) evita los problemas del stepwise porque no depende de los datos para decidir qué variables incluir. La decisión sobre qué predictores incluir se basa en la teoría y en la evidencia previa, no en los valores p de la muestra actual. Esto produce estimaciones menos sesgadas y más replicables, aunque requiere que tengas una justificación teórica para cada predictor que incluyas. El inconveniente es que con muchos predictores y una muestra moderada, los errores estándar pueden ser grandes y la multicolinealidad puede hacer que coeficientes individuales sean difíciles de interpretar.
Un enfoque intermedio es la selección jerárquica (hierarchical regression), donde introduces los predictores en bloques según un orden teórico predeterminado. Por ejemplo, en un estudio que predice el rendimiento académico, podrías introducir primero las variables sociodemográficas (bloque 1), luego las variables cognitivas (bloque 2), y finalmente las variables motivacionales (bloque 3). En cada paso evalúas si el nuevo bloque explica varianza adicional significativa más allá de los bloques anteriores. Este enfoque es informativo porque permite evaluar la contribución incremental de cada conjunto de variables, y el orden de entrada está determinado por la teoría, no por los datos.
Interpretación de los coeficientes
La interpretación de los coeficientes de regresión múltiple requiere más precaución de la que muchos investigadores ejercen. El coeficiente de regresión parcial (b o β) de un predictor X representa el cambio esperado en Y por cada unidad de cambio en X, manteniendo constantes todos los demás predictores del modelo. Esta interpretación "manteniendo constantes las demás variables" es crucial y a menudo se olvida. Si la autoestima y el optimismo correlacionan 0.60 entre sí y ambas predicen el bienestar, los coeficientes parciales de cada una estarán sustancialmente atenuados respecto a sus correlaciones bivariadas con bienestar, porque cada una está controlando por la otra.
La multicolinealidad, es decir, la alta correlación entre predictores, no viola estrictamente ningún supuesto de la regresión, pero hace que los coeficientes individuales sean inestables y difíciles de interpretar. Los factores de inflación de varianza (VIF) son la medida más utilizada para detectarla: valores por encima de 5 o 10 (según la referencia que consultes) indican multicolinealidad problemática. La solución puede ser eliminar uno de los predictores redundantes, combinarlos en una puntuación compuesta, o usar técnicas como la regresión ridge que penalizan los coeficientes y producen estimaciones más estables a costa de un ligero sesgo.
¿Atascado con los supuestos o la interpretación?
Soy doctor en psicología y reviso tu regresión de principio a fin: supuestos, multicolinealidad, interpretación de coeficientes y redacción APA 7 lista para tu tesis o tu paper. Presupuesto cerrado en 24 h.
Pídeme un diagnóstico gratis →Más allá de la regresión lineal clásica
La regresión lineal clásica asume una relación lineal entre los predictores y la variable dependiente, residuos normalmente distribuidos, homocedasticidad e independencia de las observaciones. Cuando la variable dependiente no es continua (es dicotómica, ordinal, de conteo o una proporción), necesitas modelos de regresión generalizados. La regresión logística para variables dependientes binarias y la regresión de Poisson para variables de conteo son las más utilizadas en psicología, pero los principios generales de selección de predictores e interpretación de coeficientes son análogos.
Si tus datos tienen una estructura jerárquica o anidada (alumnos dentro de aulas, medidas repetidas dentro de participantes), la regresión lineal clásica no es apropiada porque viola el supuesto de independencia. En estos casos, los modelos multinivel o mixtos son la alternativa correcta. Y si tu interés principal es la predicción (por ejemplo, clasificar pacientes en categorías diagnósticas), las técnicas de aprendizaje automático como la regresión regularizada (LASSO, elastic net) ofrecen ventajas importantes sobre la regresión stepwise tradicional, incluyendo validación cruzada incorporada y mejor control del sobreajuste.
Si la regresion de tu tesis tiene varios predictores y no tienes claro como verificar supuestos o interpretar los coeficientes, en mi consultoria estadistica revisamos el modelo juntos y te dejo el resultado listo para pegar en el manuscrito. Mas detalles en el servicio de tesis doctoral.