ICC y Concordancia entre Evaluadores: Guía Completa (SPSS y R)

Cuando dos o más evaluadores puntúan las mismas muestras (observadores que codifican conducta, clínicos que puntúan entrevistas, lectores que evalúan ensayos), necesitas demostrar que la variabilidad en las puntuaciones refleja diferencias reales entre las muestras y no diferencias entre los evaluadores. El coeficiente de correlación intraclase (ICC) es el índice estándar para eso, y también para la fiabilidad test-retest de instrumentos de medida continua. Esta guía explica cuándo usarlo, qué modelo elegir, cómo calcularlo y cómo interpretar los valores.

ICC vs kappa de Cohen: cuándo usar cada uno

El ICC y la kappa de Cohen miden lo mismo conceptualmente (acuerdo entre evaluadores más allá del azar), pero para tipos de datos distintos:

  • ICC: para variables continuas o escalas de valoración numéricas (por ejemplo, una escala de dolor de 0 a 10, una puntuación de calidad de vida, un tiempo de reacción).
  • Kappa de Cohen: para variables nominales o categóricas (por ejemplo, dos psicólogos que clasifican a cada paciente en "remisión / sin remisión"). La calculadora de kappa de Cohen calcula el índice con sus intervalos de confianza para datos categóricos.

El error más habitual es usar correlación de Pearson en lugar del ICC para medir acuerdo: la correlación de Pearson captura la covariación pero no detecta un sesgo sistemático (si evaluador A puntúa siempre 2 puntos más que evaluador B, Pearson puede ser 1.0 pero el acuerdo real es pésimo). El ICC incluye ese sesgo en el cálculo.

Los seis modelos del ICC (y cuál elegir)

El ICC no es un único índice: el marco de Shrout y Fleiss (1979) revisado por Koo y Mae (2016) distingue por dos decisiones:

1. El modelo estadístico:

  • ICC(1): cada sujeto es evaluado por evaluadores distintos, seleccionados al azar de una población de evaluadores. No se puede generalizar a evaluadores concretos.
  • ICC(2): todos los sujetos son evaluados por los mismos evaluadores, que se consideran una muestra aleatoria de la población de evaluadores posibles. El más usado en validación de instrumentos.
  • ICC(3): todos los sujetos son evaluados por los mismos evaluadores, que son los únicos que existen o los únicos a los que quieres generalizar. Adecuado cuando el instrumento siempre se usará con esos evaluadores específicos.

2. La unidad de análisis:

  • Single measures: fiabilidad de la puntuación de un solo evaluador.
  • Average measures: fiabilidad de la media de todos los evaluadores (siempre más alta que single; solo tiene sentido si el instrumento siempre se usará promediando evaluadores).

La combinación más habitual en validación de cuestionarios e investigación clínica es ICC(2,1) — two-way mixed, single measures: mismos evaluadores para todos los sujetos, generalización a la población de evaluadores, fiabilidad de una medición individual. Usa ICC(3,1) solo si los evaluadores del estudio son los únicos que usarán el instrumento.

Cómo calcular el ICC en SPSS

  1. Estructura los datos: una fila por sujeto, una columna por evaluador (o por ocasión de medida, en test-retest).
  2. Ve a Analyze > Scale > Reliability Analysis.
  3. Mueve las columnas de cada evaluador a la lista de Items.
  4. En el menú Statistics, marca Intraclass correlation coefficient.
  5. Selecciona el modelo: Two-Way Mixed para ICC(2) o ICC(3); One-Way Random para ICC(1).
  6. Tipo: Consistency o Absolute agreement. Elige Absolute agreement para fiabilidad entre evaluadores (detecta sesgos sistemáticos); Consistency solo si el sesgo es intencionado y esperado.
  7. SPSS reporta el ICC para medidas individuales y para medidas promedio, con su IC 95%.

Cómo calcular el ICC en R

El paquete irr tiene la función icc():

library(irr)
datos <- data.frame(
  eval1 = c(5, 4, 3, 6, 7, 4, 5, 6),
  eval2 = c(6, 4, 4, 6, 8, 4, 5, 7)
)
icc(datos, model = "twoway", type = "agreement", unit = "single")

Los argumentos model (oneway / twoway), type (agreement / consistency) y unit (single / average) corresponden directamente a las decisiones del apartado anterior.

Valores de referencia e interpretación

Los valores de referencia más citados son los de Koo y Mae (2016), una revisión más reciente y conservadora que la tabla original de Cicchetti (1994):

ICCInterpretación
< .50Pobre
.50 a .75Moderado
.75 a .90Bueno
> .90Excelente

Tres puntos importantes antes de aplicar la tabla mecánicamente: primero, reporta siempre el intervalo de confianza al 95%; con muestras pequeñas (menos de 30 sujetos) el IC es tan amplio que el valor puntual es poco informativo. Segundo, el estándar para uso clínico individual suele exigir ICC > .90; para investigación grupal se acepta ≥ .75. Tercero, el modelo de ICC que usaste cambia cómo se interpretan los valores: un ICC(3,1) de .80 significa algo diferente a un ICC(2,1) de .80.

ICC para fiabilidad test-retest

El mismo procedimiento sirve para medir la estabilidad de un instrumento en el tiempo: una columna para la primera aplicación y otra para la segunda. Usa ICC(2,1) con Absolute agreement. Define el intervalo temporal antes del estudio (lo usual en instrumentos de rasgos estables es 2 a 4 semanas). Una ICC test-retest ≥ .70 suele ser el mínimo aceptable para instrumentos de investigación; ≥ .90 para uso clínico o diagnóstico. Las guías COSMIN para instrumentos de resultados en salud (PROM) recogen los estándares específicos por área; el artículo de validación en ciencias de la salud los resume.

SEM y MIC: ir más allá del ICC

El ICC dice si un instrumento es fiable en términos relativos (si discrimina entre sujetos), pero no dice cuánto error hay en unidades de la escala original. El Error Estándar de la Medida (SEM = DT × sqrt(1 − ICC)) responde esa pregunta. El Mínimo Cambio Detectable (MDC = 1.96 × sqrt(2) × SEM) es el umbral por encima del cual un cambio en la puntuación de un paciente supera el ruido de medida. Estos dos índices son esenciales en investigación clínica longitudinal y en validación de instrumentos de resultados en salud.

Cómo reportar en APA

Especifica el modelo, el tipo y la unidad; reporta el IC 95%; e indica el tamaño de la muestra: ICC(2,1) = .84, IC 95% [.71, .92], n = 40. Si reportas test-retest, añade el intervalo temporal. Para validación de un instrumento, lo habitual es incluir una tabla con el ICC por dimensión o ítem, el IC 95% y el SEM.

¿Necesitas calcular el ICC para tu tesis o tu artículo?

Soy doctor en Psicología y calculo el ICC (entre evaluadores o test-retest), el SEM y el MDC, con el reporte completo para el comité o el revisor. Para instrumentos de psicología, enfermería, fisioterapia o medicina. Diagnóstico inicial gratis.

Reservar diagnóstico gratuito →

Sigue leyendo

Todos los articulos del blog