Intervalos de Confianza: Cómo Interpretarlos Sin Equivocarte

Los intervalos de confianza (IC) son una de las herramientas estadísticas más útiles en investigación, pero también una de las peor comprendidas. Si en tus artículos solo reportas el valor p, te estás dejando información muy valiosa sobre la mesa. Vamos a aclarar de una vez qué son, qué significan y cómo interpretarlos correctamente.

¿Qué es realmente un intervalo de confianza?

Un IC del 95% te da un rango de valores plausibles para el parámetro poblacional que estás estimando. La definición formal (que siempre cuesta un poco) es: si repitieras el estudio 100 veces con muestras diferentes, aproximadamente 95 de esos intervalos contendrían el valor verdadero de la población.

Esto es lo que NO significa un IC del 95%

Y es importante, porque estos malentendidos los veo incluso en artículos publicados:

  • NO significa que hay un 95% de probabilidad de que el parámetro esté dentro del intervalo que has calculado. El parámetro está o no está: la probabilidad es del procedimiento, no del resultado concreto
  • NO significa que el 95% de los datos caen dentro del rango
  • NO es lo mismo que el rango de la distribución de datos. Un IC habla de la estimación del parámetro, no de los datos en sí

¿Por qué son tan importantes?

Los intervalos de confianza te dicen cosas que el valor p no puede:

  • Precisión de tu estimación: un IC estrecho significa que tu estimación es precisa; uno muy amplio te dice que hay mucha incertidumbre
  • Significación práctica: puedes tener un efecto estadísticamente significativo (p < .05) pero con un IC tan amplio que incluya desde efectos triviales hasta enormes. Eso no es muy informativo
  • Dirección y magnitud del efecto: un IC para una diferencia de medias de [0.2, 1.8] te dice que el efecto es positivo y puede ir de pequeño a grande

Cómo interpretar un IC en la práctica

Te doy algunos ejemplos concretos que uso con mis clientes:

  • IC para una diferencia de medias: [0.5, 2.3]. Como no incluye el 0, la diferencia es estadísticamente significativa. Además, incluso el límite inferior (0.5) sugiere un efecto relevante
  • IC para una correlación: [-0.05, 0.42]. Incluye el 0, así que no es significativa. Pero ojo: el límite superior sugiere que podría haber una correlación moderada: quizás necesitas más muestra
  • IC para un odds ratio: [1.2, 3.8]. No incluye el 1 (que indicaría no efecto), así que el efecto es significativo. El riesgo es entre 1.2 y 3.8 veces mayor

IC y tamaño muestral

Esto es algo fundamental que muchos pasan por alto: a mayor muestra, más estrecho el IC. Si tu intervalo es demasiado amplio para ser informativo, la solución suele ser aumentar el tamaño muestral. De hecho, planificar tu muestra para obtener un IC con la precisión deseada es un enfoque más sofisticado que el clásico análisis de potencia basado en p-valores.

IC en APA 7

Las normas APA 7 exigen reportar intervalos de confianza para las estadísticas principales. El formato es:

  • Diferencia de medias: Mdif = 3.45, IC 95% [1.23, 5.67]
  • Correlación: r = .34, IC 95% [.15, .51]
  • Tamaño de efecto: d = 0.67, IC 95% [0.32, 1.02]

Intervalo de confianza vs intervalo de credibilidad

Conviene aclarar una confusión que aparece cada vez que un investigador empieza a tocar estadística bayesiana. El intervalo de confianza es frecuentista: la "confianza" reside en el procedimiento, no en el intervalo concreto que te ha tocado. El intervalo de credibilidad (bayesiano) sí permite la lectura que la gente intuitivamente quiere hacer del IC frecuentista: "hay un 95% de probabilidad de que el parámetro esté dentro de este rango", condicionado a tu prior y a los datos. Si reportas ambos en el mismo manuscrito, asegúrate de usar la nomenclatura correcta: un revisor metodológico te lo va a corregir si confundes los términos.

IC para distintos tipos de parámetros

La forma de construir el intervalo cambia según lo que estés estimando. Lo que sí permanece constante es la lógica de interpretación: rango plausible para el parámetro, anchura proporcional a la incertidumbre, lectura por la inclusión o no de un valor de referencia.

  • Media única: IC clásico basado en la t de Student. SPSS te lo da por defecto en Explorar. Si N<30 y los datos no son normales, considera bootstrap.
  • Diferencia de medias: el valor de referencia para significación es el 0. Reporta también la d de Cohen con su IC propio, que nuestra calculadora de tamaño del efecto obtiene a partir de medias, t o F (la diferencia bruta sin estandarizar depende de la escala de medida).
  • Proporciones: el IC de Wilson es preferible al de Wald cuando la proporción se acerca a 0 o 1, sobre todo con muestras pequeñas. SPSS solo da Wald por defecto: para Wilson tienes que pedirlo o calcularlo en R con binom.test().
  • Coeficiente de regresión: el valor de referencia es 0 (igual que en una diferencia de medias). Reportar el IC para cada coeficiente es lo que distingue un manuscrito serio de uno que solo muestra t y p.
  • Odds ratio y hazard ratio: el valor de referencia es 1 (no 0). El IC se calcula en escala logarítmica y se exponencia, por eso suele ser asimétrico. Si te aparece [0.95, 2.4], roza la no significación incluso aunque el OR sea 1.5 puntual.
  • Coeficiente alpha o omega: en análisis de fiabilidad, el IC del alpha de Cronbach es esencial. SPSS no lo da; necesitas R (psych::alpha()) o jamovi. Sin IC, reportar solo el puntual oculta que con N=80 el IC puede ser [.60, .85], lo cual cambia bastante la lectura.

Cuando el IC paramétrico no sirve: bootstrap

El IC clásico asume normalidad de la distribución muestral del estimador, algo que se cumple razonablemente bien para medias con N moderado gracias al teorema central del límite, pero falla para estadísticos como la mediana, la diferencia de medianas, el R² o las cargas factoriales. Para esos casos, el bootstrap es la solución estándar: remuestrear con reemplazo, calcular el estadístico mil o cinco mil veces, y usar los percentiles 2.5 y 97.5 como límites del IC al 95%.

En R, la función boot() del paquete boot hace este trabajo en pocas líneas. En SPSS está disponible desde la versión 19 dentro de las opciones Bootstrap de la mayoría de procedimientos. El bootstrap también es la vía habitual para construir IC robustos en análisis de mediación y moderación, donde la distribución del efecto indirecto raras veces es normal.

Errores frecuentes que veo en consultoría

1. Confundir el IC del efecto con el rango de los datos. Si la media es 50 con DT=10 y N=100, el IC al 95% para la media es aproximadamente [48, 52], no [30, 70]. Si necesitas convertir puntuaciones brutas a escalas estandarizadas (z, T, CI), nuestro conversor de puntuaciones z lo resuelve al instante. El IC habla del estimador, no de la dispersión muestral.

2. Reportar el IC al 95% pero usar el umbral de significación al 99%. El nivel de confianza del IC debe coincidir con el complementario del nivel alfa de la prueba (95% para alfa=.05, 99% para alfa=.01). Mezclarlos lleva a conclusiones inconsistentes.

3. Tratar el IC como un test binario "significativo / no significativo". Un IC que apenas roza el cero pero indica un efecto pequeño merece exactamente la misma lectura que uno que lo incluye con holgura: incertidumbre alta. La dicotomización es lo que el IC permite evitar.

4. No reportar el IC en metaanálisis. El forest plot vive del IC: cada estudio se representa por su efecto puntual y su IC. Un metaanálisis que solo reporta efectos sin IC es directamente inadmisible.

5. Calcular el IC al revés con regresión logística. Si reportas un OR pero te equivocas y exponencias antes de calcular el IC en lugar de después, el intervalo queda mal. Es un fallo habitual cuando se hace a mano sin software.

Estos cinco errores tienen algo en común: casi nunca los ves tú, los ve el revisor. Si ya tienes el borrador escrito, pásalo por el Revisor Q1 antes de enviarlo a la revista: es gratuito, lee tu manuscrito con la mala leche del Reviewer 2 y te avisa de los estimadores que reportas sin su intervalo, de los IC que interpretas como si fueran el rango de los datos y de las inconsistencias entre el nivel de confianza y el alfa que declaras en Métodos.

IC y planificación del estudio

La planificación clásica del tamaño muestral se basa en potencia estadística para detectar un efecto de magnitud predefinida. Hay una alternativa más informativa y cada vez más recomendada: planificar para precisión, es decir, calcular el N necesario para que el IC del efecto sea suficientemente estrecho. Esta lógica se conoce como accuracy in parameter estimation (AIPE) y está implementada en el paquete MBESS de R o en G*Power para ciertos casos.

El razonamiento clínico tiene sentido: si vas a estimar la eficacia de una intervención, lo que te importa no es solo si el efecto será significativo, sino cuán estrecho podrás reportar el IC alrededor del efecto observado. Un IC de [0.05, 0.45] es estadísticamente significativo pero tan amplio que es difícil tomar decisiones clínicas. Planificar para precisión te lleva a un N que produce un IC útil.

Mi recomendación

Acostúmbrate a mirar siempre los intervalos de confianza, no solo el p-valor. En cada análisis que ejecutes pregúntate tres cosas: ¿incluye el valor de referencia?, ¿es estrecho o amplio?, y ¿el límite que más interesa clínicamente (el inferior si esperas un efecto positivo, el superior si esperas equivalencia) está donde necesitas? Esa lectura tridimensional cambia por completo la conversación con el revisor y con tu tribunal de tesis. Si necesitas ayuda para calcular IC bootstrap, construirlos para parámetros no estándar o planificar precisión para tu próximo estudio, en mi consultoría para tesis doctorales trabajamos exactamente este tipo de decisiones.

Sigue leyendo

Todos los articulos del blog