Network Meta-Análisis: Comparaciones Indirectas y Ranking (Tutorial)

El metaanálisis tradicional, también llamado metaanálisis por pares (pairwise meta-analysis), compara dos intervenciones a la vez: un tratamiento contra un control, un fármaco contra otro fármaco, o una terapia contra una lista de espera. Esta estructura funciona bien cuando la pregunta clínica es binaria, pero en la práctica real los clínicos y los responsables de políticas sanitarias se enfrentan a preguntas más complejas. Un psicólogo clínico que trata trastornos de ansiedad no necesita saber simplemente si la terapia cognitivo-conductual (TCC) es mejor que el placebo; necesita saber cómo se compara la TCC con los inhibidores selectivos de la recaptación de serotonina (ISRS), con el mindfulness, con la terapia combinada, y con cualquier otra alternativa disponible. El network metaanálisis (NMA), también conocido como metaanálisis en red o metaanálisis de comparaciones múltiples, permite responder a este tipo de preguntas.

El concepto de comparación indirecta

La idea central del NMA descansa en un principio lógico aparentemente simple: si el estudio A compara la TCC contra el placebo y el estudio B compara los ISRS contra el placebo, podemos comparar indirectamente la TCC con los ISRS a través de su comparador común, el placebo. Esta idea fue formalizada matemáticamente por Bucher et al. (1997) y posteriormente desarrollada en marcos estadísticos más sofisticados por Lu y Ades (2004, 2006) y Salanti et al. (2008, 2011).

Para que una comparación indirecta sea válida, es necesario que se cumpla el supuesto de transitividad: los estudios que comparan A versus C y B versus C deben ser suficientemente similares en todas las características relevantes (población, duración, dosis, medidas de resultado) como para que la diferencia entre A y B pueda estimarse de forma no sesgada a través de C. Si los estudios que comparan TCC versus placebo se realizaron con pacientes leves y los que comparan ISRS versus placebo se realizaron con pacientes graves, la comparación indirecta estará confundida por la gravedad de los pacientes.

Cuando existen tanto comparaciones directas (estudios que comparan A versus B directamente) como indirectas (estimaciones de A versus B a través de C), el NMA combina ambas fuentes de evidencia en una única estimación. Esto aumenta la precisión de la estimación y, en principio, permite detectar inconsistencias: si la evidencia directa e indirecta no coinciden, algo está fallando, ya sea el supuesto de transitividad, la presencia de modificadores del efecto, o problemas de calidad en los estudios.

La red de evidencia

El componente visual más característico del NMA es el grafo de red (network graph). En este grafo, cada nodo representa una intervención y cada arista (línea que conecta dos nodos) representa la existencia de al menos un estudio que compara directamente esas dos intervenciones. El tamaño de los nodos suele ser proporcional al número total de participantes asignados a esa intervención, y el grosor de las aristas es proporcional al número de estudios o participantes en esa comparación directa. Este gráfico permite evaluar de un vistazo la estructura de la evidencia: qué comparaciones tienen evidencia directa abundante, cuáles se apoyan en un solo estudio, y cuáles solo pueden estimarse indirectamente.

TCC ISRS Placebo Mind- fulness Combi- nado Grosor de línea = n.o de estudios directos | Tamaño del nodo = n.o de participantes
Red de evidencia ficticia para tratamientos de ansiedad. El grosor de las aristas refleja la cantidad de evidencia directa; el tamaño de los nodos refleja el número total de participantes por intervención.

Una red bien conectada es esencial para la validez del NMA. Cada intervención debe estar conectada al resto de la red, directa o indirectamente, para que sea posible estimar todas las comparaciones. Las redes con forma de estrella (donde todas las comparaciones pasan por un nodo central, como el placebo) dependen completamente de la evidencia indirecta para las comparaciones entre tratamientos activos. Las redes más densas, con múltiples bucles (loops), permiten evaluar la consistencia entre evidencia directa e indirecta.

El supuesto de consistencia

El supuesto de consistencia establece que la estimación directa de A versus B y la estimación indirecta (a través de C) deben coincidir. Cuando no coinciden, hablamos de inconsistencia, que es la manifestación estadística de una violación del supuesto de transitividad. La inconsistencia puede evaluarse globalmente (test de diseño de Higgins) o localmente, comparación por comparación (método node-splitting o back-calculation). Detectar inconsistencia es crucial porque invalida las estimaciones del NMA para las comparaciones afectadas.

Interpretación de resultados: league tables y rankings

Los resultados de un NMA se presentan habitualmente de tres formas. La primera es el forest plot, que muestra todas las comparaciones frente a un tratamiento de referencia (por ejemplo, todas las intervenciones versus placebo). La segunda es la league table, una matriz triangular donde cada celda contiene la estimación del efecto y su intervalo de confianza o credibilidad para la comparación entre dos tratamientos. Esta tabla permite evaluar cualquier comparación por pares de un solo vistazo.

La tercera forma es el ranking de tratamientos, que ordena las intervenciones de mejor a peor. El SUCRA (Surface Under the Cumulative Ranking curve) es el índice de ranking más utilizado: un SUCRA del 100% indica que un tratamiento es siempre el mejor en todas las simulaciones, y un SUCRA del 0% indica que siempre es el peor. Los P-scores (frecuentistas) son análogos al SUCRA en el marco bayesiano.

Sin embargo, los rankings deben interpretarse con extrema cautela. Un tratamiento puede tener el SUCRA más alto y sin embargo no ser estadísticamente diferente de varios otros tratamientos. Los rankings exageran diferencias que pueden no ser clínicamente significativas y son especialmente inestables cuando los intervalos de confianza son amplios. Cialdini et al. (2022) y Salanti et al. han advertido reiteradamente que el SUCRA no debe usarse como único criterio para recomendar un tratamiento.

Cuándo es apropiado un NMA

Un NMA es apropiado cuando se cumplen varias condiciones. Primero, debe existir una red conectada de intervenciones: cada tratamiento debe estar conectado al resto, directa o indirectamente, a través de al menos un comparador común. Segundo, los estudios incluidos deben ser suficientemente similares en sus características clínicas y metodológicas para que el supuesto de transitividad sea razonable. Tercero, debe haber suficientes estudios para estimar los efectos con una precisión aceptable; con uno o dos estudios por comparación, las estimaciones serán muy imprecisas.

Las situaciones donde un NMA no es apropiado incluyen redes desconectadas (donde no existe un camino que una todas las intervenciones), evidencia insuficiente (pocas comparaciones directas), heterogeneidad clínica extrema entre estudios de diferentes comparaciones, o cuando las intervenciones no son genuinamente comparables (por ejemplo, comparar cirugía con psicoterapia para el dolor crónico sin justificación clínica).

Software y guías de reporte

Los NMA pueden ejecutarse en un marco frecuentista o bayesiano. En R, el paquete netmeta implementa el enfoque frecuentista (modelo gráfico-teórico de Rucker y Schwarzer), mientras que gemtc implementa el enfoque bayesiano mediante JAGS. En Stata, el comando network permite ambos enfoques. Los modelos bayesianos también pueden ajustarse directamente en WinBUGS u OpenBUGS usando el código proporcionado por el NICE Decision Support Unit.

Para el reporte, la extensión PRISMA-NMA (Hutton et al., 2015) proporciona una lista de verificación específica que incluye elementos como la presentación del grafo de red, la evaluación de la transitividad, los tests de consistencia, y la presentación de rankings con sus intervalos de credibilidad. Seguir estas directrices no solo mejora la transparencia del reporte, sino que facilita la evaluación de la calidad por parte de revisores y lectores, algo esencial si el objetivo es publicar en revistas Q1.

En conclusión, el NMA es una extensión poderosa del metaanálisis tradicional que permite comparar simultáneamente múltiples intervenciones y generar jerarquías de tratamientos. Su valor reside en la capacidad de integrar evidencia directa e indirecta para informar decisiones clínicas complejas. Sin embargo, sus supuestos son más exigentes que los del metaanálisis por pares, y la interpretación de los rankings requiere prudencia. Como toda herramienta estadística avanzada, es tan fiable como la calidad de los datos y la razonabilidad de los supuestos sobre los que se construye.

Sigue leyendo

Todos los articulos del blog