La regresión lineal es, probablemente, la técnica estadística más utilizada en investigación en psicología. Permite predecir una variable dependiente continua a partir de una o más variables independientes. En este tutorial te guío paso a paso para realizarla en SPSS, verificar sus supuestos e interpretar los resultados correctamente.
¿Qué es la regresión lineal?
La regresión lineal modela la relación entre una variable dependiente (Y) y una o más variables independientes (X) mediante la ecuación:
Y = β₀ + β₁X₁ + β₂X₂ + ... + βₖXₖ + ε
Donde β₀ es la constante, β₁...βₖ son los coeficientes de regresión, y ε es el error residual.
Existen dos variantes principales:
- Regresión lineal simple: una sola variable predictora (X → Y)
- Regresión lineal múltiple: varias variables predictoras (X₁, X₂, ... Xₖ → Y)
Ejemplo práctico: dataset
Imaginemos que queremos predecir el rendimiento académico (nota media, 0-10) a partir de las horas de estudio semanales y el nivel de ansiedad (medido con el STAI, 20-80) en una muestra de 120 estudiantes de psicología.
Nuestras variables serían:
| Variable | Tipo | Escala | Rol |
|---|---|---|---|
| Nota media | Cuantitativa | 0 – 10 | Dependiente (Y) |
| Horas estudio | Cuantitativa | 0 – 40 h/semana | Independiente (X₁) |
| Ansiedad (STAI) | Cuantitativa | 20 – 80 | Independiente (X₂) |
Paso 1: Verificar los supuestos
Antes de ejecutar la regresión, debemos verificar supuestos estadísticos para confirmar que nuestros datos cumplen las condiciones del modelo. Saltarse este paso es uno de los errores más frecuentes en tesis y artículos.
1.1. Linealidad
La relación entre cada predictor y la variable dependiente debe ser lineal. Para comprobarlo en SPSS:
/* Ruta en SPSS */
Gráficos → Cuadros de diálogo antiguos → Dispersión/Puntos
→ Dispersión simple → Definir
Eje Y: nota_media
Eje X: horas_estudio
En el gráfico de dispersión resultante, los puntos deben seguir un patrón aproximadamente lineal (una nube alargada, no curva). Si ves una relación curvilínea, deberás considerar transformaciones o modelos no lineales.
Diagrama de dispersión con línea de regresión. Patrón lineal correcto.
1.2. Normalidad de los residuos
Los residuos del modelo deben seguir una distribución aproximadamente normal. Esto se comprueba después de ejecutar la regresión, mediante:
/* Ruta en SPSS */
Analizar → Regresión → Lineal
→ Gráficos → Marcar: "Gráfico de probabilidad normal"
→ Marcar: "Histograma"
En el gráfico P-P normal resultante, los puntos deben seguir de cerca la línea diagonal. Desviaciones sistemáticas indican que los residuos no son normales.
1.3. Homocedasticidad
La varianza de los residuos debe ser constante en todos los niveles del predictor. Se verifica con el gráfico de residuos estandarizados vs. valores predichos:
/* En la ventana de Gráficos de la regresión */
Eje Y: *ZRESID (residuos estandarizados)
Eje X: *ZPRED (valores predichos estandarizados)
Si los puntos se distribuyen de forma aleatoria (sin patrón de embudo o abanico), el supuesto se cumple.
Gráfico de residuos vs. predichos. Sin patrón = homocedasticidad correcta.
1.4. Ausencia de multicolinealidad (regresión múltiple)
Cuando tenemos varios predictores, estos no deben estar altamente correlacionados entre sí. Lo comprobamos con los estadísticos de colinealidad:
/* Ruta en SPSS */
Analizar → Regresión → Lineal
→ Estadísticos → Marcar: "Diagnósticos de colinealidad"
Criterios clave:
- VIF (Factor de Inflación de Varianza): debe ser < 5 (idealmente < 3)
- Tolerancia: debe ser > 0.20 (idealmente > 0.40)
Paso 2: Ejecutar la regresión en SPSS
Una vez verificados los supuestos, ejecutamos el análisis:
Ruta principal:
Analizar → Regresión → Lineal
/* Configuración */
Dependiente: nota_media
Independientes: horas_estudio, ansiedad_stai
Método: Introducir (Enter)
/* Opciones recomendadas */
→ Estadísticos: Estimaciones, Ajuste del modelo, Descriptivos, Colinealidad
→ Gráficos: *ZRESID vs *ZPRED, Histograma, P-P normal
→ Guardar: Valores predichos (no tipificados), Residuos (tipificados)
Nota sobre el método: Utiliza Introducir (Enter) como método por defecto. Los métodos por pasos (Stepwise, Forward, Backward) son criticados en la literatura porque capitalizan el azar y producen modelos poco replicables. Solo úsalos en análisis exploratorios y siempre con validación cruzada.
Paso 3: Interpretar la salida de SPSS
SPSS genera varias tablas. Te explico las más importantes:
3.1. Resumen del modelo
| Modelo | R | R² | R² corregido | Error estándar |
|---|---|---|---|---|
| 1 | .849 | .721 | .716 | 1.034 |
Predictores: (Constante), ansiedad_stai, horas_estudio
¿Cómo interpretar R²?
- R² = .721 significa que el modelo explica el 72.1% de la varianza del rendimiento académico.
- R² corregido = .716 es la versión ajustada por el número de predictores. Es el valor que debemos reportar.
- Según Cohen (1988): R² = .02 (pequeño), .13 (mediano), .26 (grande). Nuestro modelo tiene un efecto grande. Si necesitas convertir R² a f² de Cohen u otros índices, puedes usar nuestra calculadora de tamaño del efecto.
3.2. Tabla ANOVA
| Fuente | Suma de cuadrados | gl | Media cuadrática | F | Sig. |
|---|---|---|---|---|---|
| Regresión | 323.45 | 2 | 161.73 | 151.23 | <.001 |
| Residuo | 125.12 | 117 | 1.07 | ||
| Total | 448.57 | 119 |
La tabla ANOVA nos dice si el modelo en su conjunto es significativo. Con F(2, 117) = 151.23, p < .001, podemos afirmar que el modelo predice significativamente el rendimiento.
3.3. Tabla de coeficientes
| Predictor | No estandarizados | Estandarizados | t | Sig. | Colinealidad | ||
|---|---|---|---|---|---|---|---|
| B | Error | Beta (β) | Tolerancia | VIF | |||
| (Constante) | 3.42 | 0.58 | n/a | 5.90 | <.001 | n/a | n/a |
| Horas estudio | 0.18 | 0.02 | .62 | 11.28 | <.001 | .89 | 1.12 |
| Ansiedad (STAI) | -0.05 | 0.01 | -.28 | -4.85 | <.001 | .89 | 1.12 |
¿Cómo interpretar los coeficientes?
- B (no estandarizado): Por cada hora adicional de estudio, la nota sube 0.18 puntos (manteniendo la ansiedad constante).
- Beta (β) estandarizado: Permite comparar la importancia relativa de los predictores. Las horas de estudio (β = .62) tienen más peso que la ansiedad (β = -.28).
- VIF = 1.12: Muy por debajo de 5, no hay problemas de multicolinealidad.
Paso 4: Reportar los resultados en APA 7
A continuación, te muestro cómo redactar los resultados de forma correcta:
Se realizó una regresión lineal múltiple para examinar si las horas de estudio semanales y el nivel de ansiedad (STAI) predecían el rendimiento académico. El modelo global fue significativo, F(2, 117) = 151.23, p < .001, R² = .72, R² ajustado = .72. Las horas de estudio predijeron positivamente el rendimiento (β = .62, p < .001), mientras que la ansiedad lo predijo negativamente (β = -.28, p < .001). El modelo explicó el 72.1% de la varianza del rendimiento académico.
Antes de enviarlo: ese párrafo es correcto, pero un revisor mira además si justificaste la elección de predictores, si documentaste los supuestos y si en la discusión te has colado hablando de causalidad. Si ya tienes el manuscrito escrito, pásalo por el Revisor Q1: es una pre-revisión gratuita estilo Reviewer 2 que te señala qué le van a marcar a tu apartado de resultados antes de que lo haga la revista.
Errores frecuentes a evitar
- No verificar los supuestos. Es el error más grave y frecuente. Ejecutar la regresión sin comprobar linealidad, normalidad, homocedasticidad y multicolinealidad puede invalidar completamente los resultados.
- Usar Stepwise sin justificación. Los métodos por pasos son exploratorios y producen resultados poco replicables. Usa el método Enter con predictores seleccionados por tu marco teórico.
- Confundir B con Beta. B es el coeficiente bruto (en unidades originales); Beta (β) es el estandarizado (para comparar entre predictores). Reporta ambos.
- Ignorar los residuos. Si los residuos no son normales o hay heterocedasticidad, los intervalos de confianza y los p-valores no son fiables.
- Interpretar correlación como causalidad. La regresión describe asociaciones. Sin un diseño experimental, no podemos hablar de efectos causales.
- No reportar R² ajustado. El R² sin ajustar infla la varianza explicada, especialmente con muchos predictores. Siempre reporta R² ajustado.
Checklist final
- ✅ He verificado la linealidad con gráfico de dispersión
- ✅ He comprobado la normalidad de los residuos con P-P plot e histograma
- ✅ He verificado la homocedasticidad con residuos vs. predichos
- ✅ He comprobado VIF < 5 para multicolinealidad
- ✅ He usado el método Enter (no Stepwise)
- ✅ He reportado R² ajustado, no solo R²
- ✅ He reportado F, gl, p, β en formato APA 7
- ✅ He interpretado los resultados en contexto, sin asumir causalidad
Conclusión
La regresión lineal en SPSS es sencilla de ejecutar, pero su correcta interpretación requiere atención a los supuestos y a la forma de reportar los resultados. Si sigues los pasos de este tutorial, tendrás un análisis robusto que cualquier revisor aceptará sin objeciones.
Si necesitas ayuda con tu regresión o cualquier otro análisis estadístico, no dudes en contactarme. Puedo revisar tus datos, verificar los supuestos y ayudarte a escribir la sección de resultados de tu artículo o tesis.