Métodos estadísticos para identificar hospitales con exceso de mortalidad: caso aplicado al registro de pacientes ingresados por infarto en el sistema público de hospitales en Catalunya.
Abstract
La correcta evaluación de cómo un hospital maneja a sus pacientes ingresados ​​por una determinada enfermedad es importante para la gestión de la salud pública. En este TFM se discutirán métodos usados ​​para la evaluación de la mortalidad durante el ingreso ya largo plazo mediante modelos de regresión logística y de supervivencia haciendo especial énfasis en la inclusión de efectos aleatorios para medir el efecto de los hospitales. Se analizará un conjunto de datos real sobre ingresos en la red de hospitales del sistema de salud pública de Cataluña en los últimos años.
Full text
Máster Interuniversitario en Estadística e Investigación Operativa UPC-UB Título: Métodos estadísticos para identificar hospitales con exceso de mortalidad: caso aplicado al registro de pacientes ingresados por infarto en el sistema público de hospitales en Catalunya. Autor: Virginia Munoa Urruticoechea Director: Isaac Subirana Cachinero Co-Director: Klaus Gerhard Langohr Departamento: Estadística e Investigación Operativa Universidad: Universitat Politècnica de Catalunya – Universitat de Barcelona Convocatoria:
2
Resumen Conocimiento de base: La medida más representativa del buen funcionamiento de un determinado hospital es la mortalidad. La estimación de dicha medida de evaluación se suele realizar mediante el modelo de regresión de Cox; no obstante, la inclusión de efectos aleatorios contribuye a aumentar la heterogeneidad, lo que lleva a una mayor variabilidad en los tiempos de supervivencia. En este proyecto nos centraremos en estudiar los efectos de los hospitales mediante un modelo estadístico apropiado para incorporar dichos efectos. Objetivo: El objetivo principal es evaluar la mortalidad a largo plazo de los pacientes ingresados por infarto agudo de miocardio en los hospitales de Cataluña, y así poder comprobar si el funcionamiento de un determinado hospital es satisfactorio. Para ello se utilizarán y compararán dos herramientas de R , las cuales ajustarán modelos que incorporan efectos aleatorios. Métodos: Este estudio incluye 51734 pacientes de entre 29-69 años ingresados entre 2007-2015 en alguno de los 40 hospitales de Cataluña que engloba la base de datos proveniente del Programa de Analítica de Datos para la Investigación y la Innovación en Salud (PADRIS). El seguimiento realizado es hasta 2016 y se identificaron 4345 muertes. Se ha aplicado el modelo de Cox con los hospitales como efectos aleatorios mediante dos funciones diferentes de R ( coxph y coxme ), y así ver cómo afecta el ingresar en un centro u otro en la mortalidad. En dichos modelos, se ha ajustado por sexo, edad, indicador de diabetes, hipertensión, fallo renal, elevación o descenso del segmento ST, antecedentes de infarto agudo de miocardio (IAM) y presencia de unidad coronaria y de cuidados intensivos; y se ha añadido el efecto aleatorio del hospital. Resultados: El aumento de un año de edad del paciente ( HR : 1,06, IC: 1,05-1,06), el sexo femenino ( HR : 1,12, IC: 1,04-1,20) y la presencia de cinco de los seis factores de riesgo (la diabetes, el fallo renal, la elevación y el descenso de ST, y la existencia de antecedentes de IAM) aumentan el riesgo de mortalidad. En cuanto a los efectos aleatorios, se observa que están asociados con el riesgo instantaneo de mortalidad (p-valor = 1,3 ·e−10 ) y que hay una heterogeneidad en cuanto a la mortalidad entre los hospitales no explicada por sus características ni de los pacientes que ingresan. Conclusiones: Las estimaciones obtenidas para el modelo de Cox con la función coxph con frailty son muy similares a aquellas obtenidas a través la función coxme . Esta última es i
ii más rápida, más estable y más flexible, pero en ambas concluimos que hay mucha variabilidad entre hospitales a la hora de analizar el riesgo instantaneo de mortalidad. Palabras clave: Efectos aleatorios, fragilidad, mortalidad, modelo de Cox.
Abstract Background: The most representative measure of the good performance of a certain hospital is mortality. The estimation of this evaluation measure is usually carried out using the Cox regression model; however, the inclusion of random effects contributes to increase the heterogeneity, leading to greater variability in survival times. In this project we will focus on studying the effects of hospitals using an appropriate statistical model to incorporate these effects. Objetivo: The main objective is to evaluate the long-term mortality of patients admitted for acute myocardial infarction in the hospitals of Catalonia, and thus be able to check if the operation of a certain hospital is satisfactory. For this, they will be used and compared two tools of Rto adjust models that incorporate random effects. Métodos: This study includes 51734 patients aged 29-69 years admitted between 2007- 2015 in one of the 40 hospitals in Catalonia that includes the database from the Data Analytics Program for Research and Innovation in Health (PADRIS). The follow-up carried out is until 2016 and 4345 deaths were identified. The Cox model has been applied with the hospitals as random effects using two different functions of R ( coxph y coxme ), and thus see how admission to one center or another affects mortality. These models have been adjusted by sex, age, indicator of diabetes, hypertension, kidney failure, elevation or depression of the ST segment, history of acute myocardial infarction (AMI) and presence of a coronary unit and intensive care unit; and the random effect of the hospital has been added. Resultados: Increasing patient age ( HR : 1.06, CI: 1.05-1.06), female gender ( HR : 1.12, CI: 1.04-1.20), and the presence of five of the six risk factors (diabetes, renal failure, elevation and depression of ST, and the existence of a history of AMI) increase the risk of mortality. Regarding random effects, it is observed that they are associated with the instantaneous risk of mortality (p-value = 1.3 ·e−10 ) and that there is heterogeneity in terms of mortality between hospitals not explained by their characteristics or the ones of the patients. Conclusiones: The estimates obtained for the Cox model with the function coxph with frailty are very similar to those obtained through the function coxme . The latter is faster, more stable and more flexible, but in both we conclude that there is a lot of variability between hospitals when analyzing the risk of mortality. Palabras clave: Random effects, frailty, mortality, Cox model. iii
iv
Agradecimientos Primero, quería agradecer a Isaac y Klaus por dirigirme y guiarme en este proyecto. Vuestras ideas y correcciones han hecho que este estudio haya salido adelante; y la gran disposición que habéis tenido siempre me ha facilitado muchísimo el proceso. Otra persona a la que le estaré eternamente agradecida es a Andrea. Gracias por acompañarme durante el comienzo de mi vida laboral y por haberme ayudado tanto en ella. No he podido tener mejor compañera, eres una persona increíble y vales muchísimo. Estoy segura de que te va a ir genial en tu nueva etapa. Infinitas gracias a mi familia de Barcelona. Gracias Rosa, Nuria, Olga, Antonio, Adri, Garazi, Irene y Pedro por hacerme sentir en casa desde el minuto uno, a pesar de que esta se nos caiga a pedazos. Gracias por vuestro apoyo siempre, por los consejos, las risas, los desahogos, las charlas y debates interminables; pero sobre todo, gracias por convertiros en mi hogar. La felicidad que me ha dado este piso durante mi estancia en Barcelona es inmensa, y no os puedo querer más, con vuestras locuras incluidas. Continúo agradeciendo a las tres personas con las que más horas he pasado fuera de casa, a mis tres mellizas. Naiara, Jona, Iker, gracias por hacerme arrepentirme cada día de haber escogido mal el idioma de la carrera. Aún así, está claro que os teníais que cruzar en mi camino y 4 años más tarde lo habéis hecho. Mi team vascos al que tanto quiero y con el que tanto he compartido, no sé que hubiera hecho sin vosotros. Eskerrik asko. Tampoco podía faltar mi segunda familia, la que me ha dado este máster, mi cuadro. Marc, Cheto, Clara, Eric, Erik, Gerard, Idoia, Jordi, Leire (y de nuevo, Jona, Iker y Nai), creo que aún no soy consciente de la suerte que he tenido con vosotros. “Si das mucho es porque eres mucho, nadie da lo que no tiene” es una frase que me encanta y que no os puede representar más, vosotros me habéis dado la vida estos dos años. Moltes gràcies Koadroak, us estimo molt. Por supuesto, también mil gracias a Nerea, Patri y Elenka por compartir conmigo esos 4 años de carrera nada fáciles pero que tantos momentos nos han dado. v
vi Mi queridísima kuadrilla, mis amigas del alma, mis DVS. Diecisiete personitas incondicionales a las que adoro y me han acompañado durante una vida. Gracias por estar siempre, por crecer conmigo y no fallarme nunca. Hace poco leí sobre la importancia de apuntar bien en qué personas queremos que nos acompañen a la hora de saltar a nuevas etapas y al igual que la autora, yo tengo claro que he sabido escoger bien. Con este TFM cierro una fase y comienzo otra, y por supuesto, ellas se vienen conmigo. Finalmente, termino agradeciendo a las personas que más quiero en el mundo entero: mi familia. Ama, Aita, primero, gracias por hacer posible mis estudios y mi estancia en Barcelona. Gracias por apoyarme siempre con todo, por empujarme a vivir esta experiencia y por darlo absolutamente todo por nosotras. Sofi, mi hermana querida, gracias por ser la persona con la que más yo misma puedo ser y por enseñarme a que no hay que conformarse en la vida. No sé si tus alumnos saben la suerte de profesora que tienen, pero yo sí la suerte de hermana que me he tocado. Aitite, Amama, Cris, gracias por el cariño que me habéis dado siempre, os quiero mucho.
Índice general 1. Introducción 1 2. Base de datos: PADRIS 3 2.1. Variables de la base de datos . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 2.1.1. Variables referentes al paciente . . . . . . . . . . . . . . . . . . . . . . 4 2.1.2. Variables referentes al hospital . . . . . . . . . . . . . . . . . . . . . . 4 2.2. Criterio de inclusión de los pacientes . . . . . . . . . . . . . . . . . . . . . . . 5 2.3. Seguimiento (follow-up) .............................. 6 3. Métodos estadísticos 7 3.1. Mortalidad ..................................... 7 3.2. Función de Supervivencia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8 3.3. Funciones de riesgo y de riesgo acumulada . . . . . . . . . . . . . . . . . . . . 8 3.4. ModelodeCox ................................... 9 3.4.1. Formulación del modelo . . . . . . . . . . . . . . . . . . . . . . . . . . 10 3.4.2. Aplicación del modelo a los datos . . . . . . . . . . . . . . . . . . . . . 11 3.5. Modelo de Cox con efectos aleatorios . . . . . . . . . . . . . . . . . . . . . . . 12 3.5.1. Formulación del modelo . . . . . . . . . . . . . . . . . . . . . . . . . . 13 3.5.2. Aplicación del modelo a los datos . . . . . . . . . . . . . . . . . . . . . 13 3.5.3. Algoritmo utilizado para estimar el modelo . . . . . . . . . . . . . . . 20 4. Resultados 21 4.1. Análisisdescriptivo................................. 21 4.2. Regresión de Cox con efectos aleatorios . . . . . . . . . . . . . . . . . . . . . 25 4.2.1. Función coxph ............................... 26 4.2.2. Función coxme ............................... 29 5. Conclusiones y discusión 33 vii
4CAPÍTULO 2. BASE DE DATOS: PADRIS idEpisodi: Identificador del episodio. UP: Código del hospital del ingreso. mort: Variable que indica si el individuo ha muerto o no. Circumstancia_alta_nom : Variable útil para saber si el individuo ha muerto durante el ingreso o si ha sido trasladado a otro hospital. Data_defuncio : Fecha de fallecimiento. Los individuos que tienen missing continúan vivos a fecha de 31-12-2016. Además, se pueden distinguir, por un lado, las variables que hacen referencia al paciente, y por otro, las que nos dan información sobre el hospital. 2.1.1. Variables referentes al paciente En este caso tendríamos las variables simplemente informativas, como pueden ser el sexo y la edad del sujeto en cuestión; y otros factores de riesgo cardiovascular: diab2: Indicador de la presencia de diabetes. hta2: Indicador de padecimiento de hipertesión. elevst : Elevación o descenso del segmento ST, el cual representa el período isoeléctrico cuando los ventrículos se encuentran entre la despolarización y la repolarización. killip34: Antecedentes de infarto agudo de miocardio (IAM). renal2: Indicador de fallo renal. fibril : Indicador de padecimiento de fibrilación auricular, es decir, de un ritmo cardíaco irregular que puede provocar coágulos de sangre en el corazón. pci: Antecedentes de intervención coronaria percutánea (ICP). antcvd: Indicador de haber sufrido un evento cardiovascular previamente al ingreso. 2.1.2. Variables referentes al hospital A su vez existen variables propias del hospital. Estás últimas serían las siguientes cinco: UCI: Presencia de unidad de cuidados intensivos. TERCIARIO: Si son hospitales altamente especializados. HEM: Presencia de laboratorio de cataterismo (hemodinámia). UC: Presencia de unidad coronaria.
2.2. CRITERIO DE INCLUSIÓN DE LOS PACIENTES 5 ACREDOCENT: Si son hospitales universitarios. Es conveniente mencionar que más adelante crearemos la variable UC_UCI , la cual nos indica con un 1 si dicho hospital tiene tanto unidad de cuidados intensivos como unidad coronaria, y con un 0 si carece de alguna de las dos. 2.2. Criterio de inclusión de los pacientes En este trabajo se han incluído mujeres y hombres mayores de edad, quienes han podido ser ingresados en un mismo hospital u otro varias veces. De hecho, este es el caso de algunos individuos que aparecen más de una vez con ingresos en distintos hospitales pero con pocos días de diferencia. Además, se ha decidido mantener únicamente a los hospitales donde haya habido un mínimo de 200 ingresos; considerando de esta forma una base de datos con 51734 pacientes, 56693 episodios, y 40 hospitales. En la Figura 2.1 se aprecia la diferencia en la cantidad de mujeres y de hombres en cada uno de los hospitales incluídos en el estudio. HOSPITAL DOS DE MAIG HOSPITAL PLATÓ HOSPITAL GENERAL DE CATALUNYA HOSPITAL COMARCAL DE SANT BERNABÉ Hospital d'Olot i Comarcal de la Garrotxa HOSPITAL SANTA CATERINA HU SAGRAT COR HOSPITAL DE VILADECANS FUNDACIÓ HOSPITAL SANT JOAN DE DÉU HOSPITAL MUNICIPAL DE BADALONA HOSPITAL COMARCAL DE L'ALT PENEDÈS HOSPITAL DE FIGUERES FUNDACIÓ PRIVADA HOSPITAL DE MOLLET HOSPITAL DE PALAMÓS Hospital Comarcal de Blanes FUNDACIÓ HOSPITAL DE L'ESPERIT SANT Parc Sanitari Sant Joan de Déu HOSPITAL GENERAL DE L‘HOSPITALET HOSPITAL D'IGUALADA HOSPITAL DE SANT PAU I SANTA TECLA HOSPITAL DE TERRASSA HOSPITAL GENERAL DE GRANOLLERS HOSPITAL RESIDENCIA SANT CAMIL HOSPITAL GENERAL DE VIC HOSPITAL VERGE DE LA CINTA DE TORTOSA HU DE SANT JOAN DE REUS Hospital Universitari Mútua de Terrassa HOSPITAL DE SANT JOAN DESPÍ MOISÈS BROGGI CENTRE HOSPITALARI HOSPITAL DE MATARÓ HOSPITAL DEL MAR HU ARNAU DE VILANOVA DE LLEIDA HOSPITAL DE SABADELL HU JOAN XXIII DE TARRAGONA HU GERMANS TRIAS I PUJOL DE BADALONA HOSPITAL DE LA SANTA CREU I SANT PAU HU DE GIRONA DR. JOSEP TRUETA HOSPITALS VALL D'HEBRON Hospital Clínic i Provincial de Barcelona HU DE BELLVITGE Ingresos 0 500 1000 1500 2000 2500 3000 3500 Mujer Hombre Figura 2.1: Número de mujeres y hombres ingresados en cada hospital. Como se ha comentado anteriormente, la base de datos cuenta con varias dificultades, como la estancia de un sujeto en distintos hospitales durante un tiempo no muy extenso. En este caso, no nos interesa tener recogidos los datos de cada ingreso, ya que generaría imprecisiones. Por ejemplo, si una persona lleva semanas en un hospital y es derivada a otro donde muere al mismo día de la entrada, la muerte se registraría en el segundo centro; sin embargo, sería más lógico que el evento se anotase en el anterior. Por ello, inicialmente, antes de realizar el análisis descriptivo, se ha considerado una ventana de 28 días (4 semanas) como un mismo ingreso, donde sólamente se ha tenido en cuenta el hospital donde el individuo ha permanecido más días. Por lo tanto, si un paciente ha sido ingresado en más de un hospital durante un periodo de 28 días, en la base de datos solo constará aquel donde haya estado más
6CAPÍTULO 2. BASE DE DATOS: PADRIS tiempo. Más adelante, a la hora de analizar distintos modelos de Cox, se ha considerado sólo el primer episodio para cada individuo, para poder analizar de esta manera la mortalidad a largo plazo. En esta última base de datos, entonces, solo estará registrado un ingreso por paciente. 2.3. Seguimiento (follow-up) Se analizarán los episodios de los individuos ingresados en 40 hospitales distintos de Cataluña durante el periodo entre 2007 hasta 2015. Se tendrá en cuenta si dichos pacientes han tenido antecedentes de ingresos previos a este periodo, mediante la variable antcvd2 ; sin embargo, los ingresos ocurridos posteriormente al 31 de diciembre de 2015 no se considerarán. El estudio de dichos pacientes se efectuará hasta el 31 de diciembre de 2016, es decir, tendremos un año de seguimiento como mímimo. De hecho, la última fecha de defunción es el mismo 31 de diciembre de 2016.
Capítulo 3 Métodos estadísticos En este capítulo se abordarán conceptos básicos de supervivencia como las definiciones de la función de supervivencia, la función de riesgo y la función de riesgo acumulada. Se profundizará en el modelo de Cox y en especial, el modelo de Cox con efectos aleatorios, introduciendo las distintas funciones y paquetes del software R que nos permiten ajustar dichos modelos. La mayoría los conceptos de supervivencia que describiremos en esta sección son extraídos del libro “Análisis de supervivencia” [7]. Empezamos definiendo T como el tiempo desde un origen bien definido hasta el suceso de interés ϵ . El suceso puede ser la muerte, como bien ocurre en nuestro estudio; la aparición de un tumor; el desarrollo de una enfermedad o infección, etc. Formalmente, T es una variable aleatoria no negativa correspondiente a una población homogénea. El modelo para T puede quedar caracterizado, entre otras, por la función de supervivencia ( S ( t )), la función de riesgo (λ(t)) y la función de riesgo acumulada (Λ(t)), las cuales serán definidas en este capítulo. 3.1. Mortalidad Ante la necesidad de explicar en qué consiste un mal funcionamiento de un determinado hospital, primero definiremos la razón de mortalidad estandarizada (RME), ya que la relación entre ambas es evidente. Esta es la razón entre el número de muertes observadas (O) y el número de muertes esperadas (E), tomando como base las tasas de mortalidad de una población de referencia: RME =O E El exceso de mortalidad en un hospital, entonces, es un indicador del mal funcionamiendo de dicho centro. Sin embargo, en la base de datos analizada, nos encontraremos con varias complicaciones, como por ejemplo, el traslado de un paciente a otro hospital, los reingresos, los fallecimientos a lo largo de un año, etc. En el Capítulo 2, entre otras cosas, se ha aclarado cómo hemos abordado dichos acontecimientos. 7
8CAPÍTULO 3. MÉTODOS ESTADÍSTICOS 3.2. Función de Supervivencia La función de supervivencia se denota por S y corresponde a la probabilidad de que un individuo sobreviva más de t unidades de tiempo (por ejemplo, años), es decir, la probabilidad de que el suceso E ocurra después de t años. Por tanto, denotamos S ( t ) = Prob ( T > t ), que está definida para t≥0. Algunas de las propiedades básicas son las siguientes: S(0) = 1 yS(∞)=0 S(t)es una función monótona decreciente Si Tes continua, S(t)es continua y estrictamente decreciente. Con el fin de estimar la función de supervivencia, como en la mayoría de las ocasiones contenemos datos censurados en nuestros estudios, solemos proceder al cálculo de la curva de Kaplan-Meier, un método no paramétrico. Definimos t1< t2< . . . < tk como tiempos de los eventos obsevados y n = n0 como el tamaño de la muestra al inicio, cuando aún no hay individuos fallecidos o censuras. Fijamos dj como el número de individuos que han tenido un evento en el instante tj , donde j = 1 , . . . , k , y mj como el número de individuos censurados en el intervalo [tj, tj+1) . Entonces, nj = (mj+dj) + . . . + (mk+dk) será el número de individuos en riesgo justo antes al instante tj , definiendo de esta manera el estimador Kaplan-Meier de la función de supervivencia como: ˆ S(t) = Y j:tj<t nj−dj nj . 3.3. Funciones de riesgo y de riesgo acumulada La función de riesgo describe el comportamiento de la probabilidad condicionada de morir en un pequeño intervalo siendo que la persona está viva al inicio del mismo. Dicha función, cuando Tes una variable aleatoria absolutamente continua, se define formalmente como λ(t) = l´ım ∆t→0 1 ∆tProb[t≤T < t + ∆t|T≥t], donde λ ( t )∆ t sería la probabilidad de que a un individuo de edad t le ocurra E en ( t, t + ∆ t ]. Algunas de las propiedades básicas, siendo T una variable absolutamente continua, son las siguientes: λ(t)es una función no negativa. Rs 0λ(u)du < ∞para algún s > 0 y R∞ 0λ(u)du =∞, Sea f ( t )la función de densidad de probabilidad, se puede estimar la función de riesgo a través de la función de superviviencia mediante la siguiente forma: λ(t) = f(t) S(t)=−d dt(ln S(t)).(3.1)
3.4. MODELO DE COX 9 O lo que es lo mismo S(t) = e−Rt 0λ(u)du. Debido a la dificultad en estimar directamente la función de riesgo mediante la ecuación (3.1), definiremos también la función de riesgo acumulada Λ( t ). Esta función es muy útil gráficamente y, cuando Tes absolutamente contínua, se calcula de la siguiente manera: Λ(t) = Zt 0 λ(u)du. El riesgo acumulativo podría ser interpretado como el número de eventos que se esperarían para cada individuo en el tiempo T siendo dicho evento un proceso repetible. Sin embargo, esta función generalmente sólo se usa como una medida intermedia para estimar λ ( t ) y como una herramienta de diagnóstico para evaluar la validez del modelo de supervivencia [8]. Por último, presentaremos el estimador Nelson-Aalen, un método no-paramétrico utilizado para estimar Λ(t)[9], el cual se puede definir como ˆ Λ(t) = X ti<t di ni , siendo di el número de eventos y ni el número total de individuos en riesgo, ambos en el instante ti. 3.4. Modelo de Cox El modelo de regresión de riesgos proporcionales de Cox es un modelo de regresión de análisis de supervivencia que describe la relación entre la incidencia del evento, expresada por la función de riesgo, y un conjunto de covariables [10]. En dicho modelo, la medida del efecto es la tasa de riesgo, es decir, el riesgo o probabilidad de sufrir el evento de interés sabiendo que el individuo ha sobrevivido hasta un tiempo específico. Este riesgo representa el número esperado de eventos por unidad de tiempo. Los modelos de riesgo proporcionales conocidos como modelos de Cox son los más utilizados en la investigación clínica para analizar datos de supervivencia, y por tanto los que más frecuentemente aparecen en la literatura médica. En estos modelos, el análisis de regresión se utiliza para procesar datos censurados. Una característica de los modelos de Cox es que no se especifica la distribución de los datos, es decir, puede tomar cualquier aspecto [11]. Por este motivo se dice que el modelo de Cox es de naturaleza semiparamétrica y podemos analizar cualquier variable que pueda influir en la ocurrencia del evento, a diferencia del análisis de supervivencia de Kaplan-Meier [12]. Por tanto, los modelos de Cox son ventajosos cuando el objetivo es comparar grupos, valorar supervivencias relativas; ya que en ese caso lo que se
10 CAPÍTULO 3. MÉTODOS ESTADÍSTICOS quiere es calcular cocientes de riesgo. Al dividir las dos funciones para dicho cálculo, como la función de riesgo base λ0 ( t )interviene en ambas, este desaparece, por lo que daría realmente igual cuál pueda ser la forma de esta función. 3.4.1. Formulación del modelo Sea Ti el tiempo de estudio para el i -ésimo paciente, δi el indicador del evento para el i -ésimo paciente (δi= 1 si el evento ha ocurrido y δi = 0 si hay censura por la derecha) y Zi = (Zi1, . . . , Zis)t el vector de covariables o factores de riesgo para el i -ésimo individuo en el tiempo t que pueden afectar en la distribución de supervivencia de T . Los vectores Zik, k = 1 , . . . , s , son covariantes fijas, es decir, variables explicativas recogidas en el origen del estudio, por ejemplo, el sexo, la edad, etc. Sea λ ( t|Z )la función de riesgo en el tiempo t para un individuo con vector de riesgo Z , el modelo básico es el siguiente [13]: λ(t|Z) = λ0(t)ϕβtZ, donde λ0 ( t )es función de riesgo basal , β = (β1, . . . , βs)t es un vector de parámetros , y ϕβtZes una función conocida. Como λ(t|Z)debe ser positivo, ϕβtZse define como ϕβtZ= exp βtZ= exp s X k=1 βkZk, de forma que el modelo toma la siguiente forma: λ(t|Z) = λ0(t) exp βtZ=λ0(t) exp s X k=1 βkZk, esto es, λ(t) = λ0(t) exp (β1Z1) exp (β2Z2)· · · exp (βsZs). El análisis de regresión de riesgos proporcionales de Cox es una de las técnicas de regresión más populares para los resultados de supervivencia, pero hay varias suposiciones importantes para el uso apropiado del modelo y son las siguientes: 1. El logaritmo del cociente de las funciones de riesgo se relaciona linealmente con los factores pronósticos, lo cual puede ser verificado mediante un gráfico de los residuos. 2. La razón entre las funciones de riesgo es constante a lo largo del tiempo, ya que se verifica λ(t|Z) λ0(t)= exp {β1Z1+β2Z2+. . . +βpZp},(3.2)
3.4. MODELO DE COX 11 en donde el término de la derecha sólo depende de los valores de las covariantes y no del tiempo t . Este es el motivo por el cual se conoce como modelo de riesgos proporcionales. 3. La función de supervivencia es una función exponencial, en otras palabras, se expresa como una función exponencial de la razón de riesgo en cualquier momento t S(t) = S0(t)HR[12]. 3.4.2. Aplicación del modelo a los datos A la hora de analizar una sola muestra de datos de supervivencia, o comparar dos o más grupos de tiempos de supervivencia, existen otros métodos no paramétricos muy útiles. Sin embargo, en la mayoría de los estudios médicos que dan lugar a datos de supervivencia también se registra información complementaria de cada individuo [13]. Por ello, en este estudio hemos aplicado los modelos de Cox, ya que queremos comparar la supervivencia de los pacientes en los diferentes hospitales recogidos en nuestra base de datos. En este caso, las variables demográficas como la edad y el sexo del paciente, y los factores fisiológicos como la diabetes y la hipertensión, pueden tener un impacto en el tiempo en el que el paciente sobrevive. Como hemos comentado en la introducción, para realizar este trabajo anteriormente hemos preparado los datos, considerarando sólo el primer episodio para cada individuo y así, poder analizar la mortalidad a largo plazo. En este proyecto se va a trabajar con el modelo ya creado en el proyecto EURHOBOP [6], un estudio de cohorte fundado por la Comisión Europea y diseñado para proporcionar un sistema válido de evaluación comparativa (benchmarking) del síndrome coronario agudo (SCA) a la comunidad europea. El objetivo de dicho estudio fue derivar y validar un conjunto de modelos para comparar las tasas de mortalidad intra-hospitalaria en hospitales europeos, en infarto agudo del miocardio (IAM) e intervención coronaria percutánea (ICP), teniendo en cuenta el país, así como las características del hospital y del paciente. El ajuste del modelo se realiza seleccionando pacientes con IAM y SCA y las siguientes variables: Sexe , Edat_agrupada , hta2 , diab2 , elevst , renal2 , killip34 y UC_UCI . La selección de dichas variables fue mediante un procedimiento paso a paso que se basó en la maximización del coeficiente de correlación de concordancia (CCC). El CCC se calculó como la concordancia entre las tasas de mortalidad intrahospitalaria observadas y esperadas para cada hospital, ponderadas por el número de pacientes reclutados por dicho hospital. Este proceso se repitió hasta que se incluyeron todas las variables candidatas. Además, se realizó un paso adicional para eliminar las variables que no mejoraban el CCC y no se asociaban significativamente con el resultado [6]. Antes de comenzar con el análisis de supervivencia mediante las funciones de R que comentaremos a continuación, hemos limpiado la base de datos utilizada para el análisis descriptivo. Como ya se ha mencionado previamente, a la hora de analizar la mortalidad a largo plazo solamente consideraremos el primer episodio de cada paciente y solo entrarán
12 CAPÍTULO 3. MÉTODOS ESTADÍSTICOS aquellos que no hayan tenido eventos cardiovasculares previos. Además, para evitar futuras malinterpretaciones, únicamente mantendremos los hospitales con más de doscientos ingresos. Por tanto, la nueva base de datos constará de 35460 registros y 30 hospitales. Posteriormente, iniciaremos el análisis cargando el paquete de R,survival [14] para hacer uso de varias de las funciones que contiene. Primero, utilizaremos la función Surv para crear un objeto de supervivencia que se utilizará como variable de respuesta en la fórmula del modelo que generaremos. Para ello, solamente necesitaremos las variables que indican el tiempo de seguimiento y si ha ocurrido el evento, en nuestro caso, la muerte. Después, aplicaremos la función coxph , la cual trata de ajustar un modelo de regresión de riesgos proporcionales de Cox, en la cual se incorporan variables y subconjuntos de la población de la muestra dependientes del tiempo, múltiples eventos por sujeto, y otras extensiones, utilizando la formulación del proceso de conteo de Andersen y Gill [15]. En este caso, necesitaremos un objeto en forma de fórmula ( formula ), con el elemento de supervivencia recién mencionado a la izquierda de un operador “ ∼ ” y los términos a la derecha; la base de datos correspondiente ( data ) y una cadena de caracteres que especifica el método para el manejo de empates ( ties ). Asimismo, existen otros argumentos posibles pero que no se han usado en este trabajo, como el subconjunto de los datos a utilizar ( subset ), una función de filtro para los datos faltantes ( na.action ), un vector de pesos ( weights ), un vector de valores iniciales de la iteración (init) o una lista de opciones de control (control). Existen bastantes diferencias entre los hospitales de la base de datos. Como en alguno de ellos hay pocos ingresos (Hospital Municipal de Badalona, 204 ingresos) comparando con otros (Hospital Universitari de Bellvitge, 3516 ingresos), la estimación de la mortalidad para dichos centros puede ser poco fiable si se trata el hospital como un factor de efectos fijos. Por tanto, en este proyecto hemos optado por añadir los hospitales (variable UP ) como efecto aleatorio, mitigando así el problema anterior. Además, de esta manera nos centraremos en lo que realmente nos interesa, esto es, en el efecto de los hospitales, en vez de proceder con una comparación entre los hospitales de la muestra. 3.5. Modelo de Cox con efectos aleatorios En los últimos años se ha estado investigando bastante y de forma activa sobre el suplemento de los efectos aleatorios para los estudios de supervivencia. Los efectos aleatorios generalmente se ven como variables categóricas que describen el exceso de riesgo o fragilidad en un individuo o grupos de individuos. La idea es que los individuos o grupos tienen diferentes fragilidades y que aquellos que son más frágiles morirán antes que los demás [4]. La fragilidad es un componente aleatorio diseñado para tener en cuenta la variabilidad causada por factores de nivel individual no observados que, de otro modo, no se tendrían en cuenta para los otros predictores en el modelo. Entonces, si consideramos un modelo con algunas variables que recogen ciertas características de, en nuestro caso, grupos (hospitales) y añadimos un
3.5. MODELO DE COX CON EFECTOS ALEATORIOS 13 componente de fragilidad, dos grupos con los mismos valores en las variables incluidas en el modelo pueden tener funciones de supervivencia diferentes. Lo que ocurre es que estos factores no observados (fragilidades) pueden aumentar la heterogeneidad, lo que lleva a una mayor variabilidad en los tiempos de supervivencia [16]. Existe cierta diferenciación en la terminología. Mediante el uso del término “modelo de fragilidad” nos referimos a un modelo de supervivencia con un solo efecto aleatorio, mientras el término “modelo de efectos mixtos” lo utilizamos para referirnos a un modelo con factores mixtos y factores aleatorios [17]. En este trabajo se incluirá un factor aleatorio (hospital) y algunos efectos fijos (sexo, diabetes, etc), además de variables continuas como la edad que no son efectos aleatorios y se considerán, por lo tanto, también variables fijas. 3.5.1. Formulación del modelo Definimos λ0 ( t )como la función de riesgo basal y X y Z como las matrices para los efectos fijos y aleatorios, repectivamente. Asumimos un modelo de riesgos proporcionales con efectos aleatorios, con la siguiente función de riesgos: λ(t) = λ0(t) exp(Xβ+Zω),(3.3) donde β es el vector de los coeficientes de los efectos fijados y ω el vector de los coeficientes de los efectos aleatorios. Para cualquier valor fijado de β y ω , definimos el logaritmo de la función de verosimiltud parcial P L como [18] log[P L(β,ω))] = n X i=1 Z∞ 0 Yi(t)ηi(t)−log X j Yj(t)eηj(t) dω, (3.4) donde ηi ( t ) = Xi ( t ) β + Zi ( t ) ω es la puntuación lineal para el sujeto i al instante t y Yi ( t )describe el conjunto de riesgos. Cuando el sujeto i está bajo observación al instante t , Yi ( t ) = 1, mientras que el caso contrario, Yi(t) = 0. Asimismo, ω puede seguir distintas distribuciones, como por ejemplo, una distribución gaussiana, gamma o t, las cuales pueden ser escogidas en R dependiendo de la función que utilicemos para ajustar nuestro modelo de Cox. A continuación, definiremos las funciones de Restudiadas, comentando sus diferencias e igualdades. 3.5.2. Aplicación del modelo a los datos En esta segunda parte, hemos vuelto a hacer uso de la función coxph , pero añadiendo a los términos de la derecha de la formula una función de fragilidad denominada frailty [14], la cual permite agregar un término simple de efectos aleatorios a un modelo de Cox. La forma de este objeto de Res la siguiente [14]: frailty (x,dist = ”gamma”, ..., sparse =..., theta =..., df =..., method =..., ....)
20 CAPÍTULO 3. MÉTODOS ESTADÍSTICOS 3.5.3. Algoritmo utilizado para estimar el modelo Para cerrar este capítulo, queremos explicar de forma resumida en esta subsección el algoritmo que se usa para estimar el modelo con coxme . El reto cuando se introducen los efectos aleatorios en el modelo de Cox surge con la aparición de una integral para cada hospital, la cual se ha de resolver. Usualmente se utilizan métodos numéricos como la aproximación de Laplace, y una vez calculada la integral, métodos iterativos como Newton-Raphson para obtener así el siguiente valor de los parámetros. El MLE para la varianza de los efectos aleatorios se basa en una probabilidad parcial integrada [26]: IPL(β, θ) = 1 (2π)q/2|Σ(θ)|1/2ZPL(β, ω)e−ω′Σ−1(θ)ω/2dω donde q es la dimensión de la densidad gaussiana, es decir, el número de efectos aleatorios. Cuando el la varianza del efecto aleatorio es cero, esto colapsa a la probabilidad parcial ordinaria de Cox. Se ha de mencionar también que esta fórmula se aplica porque la distribución de los efectos aleatorios en coxme sigue una normal, pero habría que cambiarla si siguiese una t de Student o una gamma. La estrategia computacional central [26] para coxme es un bucle externo y otro interno. El bucle exterior busca sobre los parámetros θ de la matriz de varianza un máximo de la verosimilitud parcial integrada. Para cada valor de θen esta búsqueda: 1. Calculamos A(θ)yA−1(θ) 2. Resolvemos el modelo de Cox penalizado log [ PL ( β, ω )] -(1 / 2) ω′A−1ω para obtener el vector solución ( ˆ β, ˆω ), donde PL es el logaritmo de verosimilitud parcial habitual de Cox. La solución iterativa de Newton-Raphson a este problema es el bucle interior. 3. Usamos la aproximación de Laplace para calcular el logaritmo de la verosimilitud parcial integrada, usando los resultados del paso 2. Un componente necesario de la solución en el paso 2 es el cálculo de H y su descomposición de Cholesky generalizada H = LDL′ , donde D es diagonal y L es triangular inferior con Lii = 1. La aproximación de Laplace en el paso 3 es particularmente conveniente para este problema ya que todos los componentes ya están disponibles. Finalmente, vemos interesannte comentar que los principales esfuerzos de eficiencia en la rutina coxme se han centrado en efectos discretos, es decir, las variables de agrupación [27].
Capítulo 4 Resultados Los resultados del estudio se han dividido en dos apartados. La primera sección incluye un análisis descriptivo de los datos realizado inicialmente. La segunda sección incluye los resultados obtenidos con el modelo de Cox mediante la función coxph con frailty por un lado, y mediante la función coxme por otro lado. Interpretaremos de las salidas de R , proporcionaremos un gráfico con los efectos aleatorios y crearemos una tabla de los hospitales con el percentil donde se ubicarían. 4.1. Análisis descriptivo Se ha realizado un análisis descriptivo teniendo en cuenta las distintas variables de la base de datos inicial formada por 56693 resgistros de ingresos y 33 variables. Dichos episodios se darán en 40 hospitales distintos y serán de 51734 pacientes, solo que varios de ellos ingresarán más de una vez. Como podemos observar en la siguiente tabla (Tabla 4.1) 3689 individuos reingresan en algún hospital durante el periodo del estudio: Número de ingresos 1 2 3 4 5 6 7 8 Individuos 47614 3497 478 98 32 9 3 4 Tabla 4.1: Número de ingresos que han presentado los pacientes. Primero, nos hemos centrado en las carácteristicas de los pacientes. Esta descripción está resumida en la Tabla 4.2, donde podemos encontrar información de las variables referentes al paciente en función del género, además del número de ingresos y de muertes. 21
22 CAPÍTULO 4. RESULTADOS Mujer Hombre Todos Número de ingresos 17023 39670 56693 Sin elevación del segmento ST % 44.1 % 37.9 % 39.8 % Elevación del segmento ST % 44.3 % 53.8 % 50.9 % Descenso del segmento ST % 11.6 % 8.27 % 9.28 % Antecedentes de infarto agudo de miocardio 17.7 % 11.7 % 13.5 % Fibrilación auricular % 1.58 % 2.62 % 2.31 % Hipertensión % 61.7 % 45.4 % 50.3 % Diabetes % 33.8 % 27.1 % 29.1 % Antecedentes de intervención coronaria percutánea % 37.2 % 55.1 % 49.7 % Fallo renal % 12.9 % 8.32 % 9.69 % Muertes 11.2 % 6.16 % 7.66 % Tabla 4.2: Porcentajes de los factores de riego en hombres y en mujeres. Después, también hemos querido analizar las variables referentes al centro sanitario. Por tanto, hemos resumido en la Tabla 4.3 el número de hospitales que hay para cada característica propia de dichos centros, junto al porcentaje correspondiente. Es llamativo ver como la gran mayoría de los hospitales que tuvieron más de 200 ingresos son universitarios (80 %) y muchos de ellos tienen UCI (70 %), mientras que la presencia de unidad coronaria en ellos es escasa. UCI TERCIARIO HEM ACREDOCENT UC % Total UCI 28 10 10 25 7 70 % TERCIARIO 10 10 8 9 7 25 % HEM 10 8 11 9 5 27.5 % ACREDOCENT 25 9 9 32 7 80 % UC 7 7 5 7 717.5 % Tabla 4.3: El número de hospitales y su porcentaje para cada una de las características. Por otro lado, en la Tabla 4.4 mostraremos las características de los 10 hospitales con más pacientes ingresados en el periodo de tiempo del estudio. Observamos como todos ellos tienen UCI y son universitarios, lo cuál tiene sentido, ya que, como ya hemos comentado, la gran mayoría de ellos cumplen estas características. Asimismo, es interesante como justamente los únicos 7 hopitales con presencia de unidad coronaria y 9 de los 10 hospitales terciaros entran dentro de los 10 hospitales con más ingresos. Analizando la diferencia de ingresos entre hombres y mujeres, en la Figura 2.1 se aprecia claramente una gran mayoría en el caso de los hombres. De hecho, solamente 2 hospitales ha tenido más ingresas de mujeres: el Hospital de Viladecans y el Hospital de Badalona.
4.1. ANÁLISIS DESCRIPTIVO 23 Hospital UCI Terciario Hem Acredocent UC Hospital Universitari Arnau de Vilanova de Lleida Sí Sí Sí Sí Sí Hospital Universitari Joan XXIII de Tarragona Sí Sí Sí Sí No Hospital Universitari de Girona Dr. Josep Trueta Sí Sí Sí Sí Sí Hospital Universitari de Bellvitge Sí Sí Sí Sí No Hospital Universitari Germans Trias i Pujol Sí Sí No Sí Sí Hospital Clínic i Provincial de Barcelona Sí Sí Sí Sí Sí Hospital de Sabadell Sí No No Sí No Hospital del Mar Sí Sí No Sí Sí Hospital de la Santa Creu i Sant Pau Sí Sí Sí Sí Sí Hospitals Vall d’Hebron Sí Sí Sí Sí Sí Tabla 4.4: Los 10 hospitales con más ingresos y sus características. Más adelante, se ha analizado el número de fallecimientos que ha habido en cada hospital (Figura 4.1). El Hospital de la Santa Creu i Sant Pau, el Hospital Universitari de Bellvitge y el Hospital Clínic i Provincial de Barcelona son los que más fallecimientos han sufrido, como se puede apreciar en color rojo en la Figura 4.1. Los tres hospitales superan las trescientas muertes; sin embargo, también se ha de tener en cuenta que dichas clínicas son las que más registros tienen junto con Hospital Vall d’Hebron y Hospital Universitari de Girona Dr. Josep Trueta. Figura 4.1: Número de fallecimientos en función del hospital. De hecho, si calculamos el porcentaje de mortalidad en cada hospital en función del número de episodios atendidos, ninguno de ellos entraría en la clasificación de los 15 hospitales con tasa de mortalidad mayor. Esta lista estaría liderada por centros como el Hospital comarcal de Sant Bernabé, el Hospital de Viladecans y el Hospital de Figueres, con 42, 53 y 62 fallecimientos respectivamente, como podemos observar en la Figura 4.1 en un color amarillo claro.
24 CAPÍTULO 4. RESULTADOS Por otra parte, se ha querido tener conocimiento de los ingresos y fallecimientos en cada hospital según el año, para observar si ha habido algún aumento o descenso significativo. En la Figura 4.2 se aprecia que la tasa de mortalidad más alta el último año, entre estos 5 hospitales, es la del Hospital de la Santa Creu i Sant Pau, ya que es de las que menos pacientes ingresan y más fallecimientos tiene. Además, vemos que la tasa de mortalidad es más o menos constante en el tiempo, puesto que generalmente al incrementar los episodios, aumentan las muertes de forma similar, y viceversa. 2008 2009 2010 2011 2012 2013 2014 2015 0 100 200 300 400 500 600 700 Años N HOSPITAL UNIVERSITARI DE GIRONA DR. JOSEP TRUETA HOSPITAL UNIVERSITARI DE BELLVITGE Hospital Clínic i Provincial de Barcelona HOSPITAL DE LA SANTA CREU I SANT PAU HOSPITALS VALL D'HEBRON 2008 2009 2010 2011 2012 2013 2014 2015 0 20 40 60 80 Años N Figura 4.2: Ingresos (izq) y fallecimientos (dch) por años en los 5 hospitales más visitados. Asimismo, se ha querido observar cómo afecta la diferencia de edades en los pacientes ingresados. La edad ha sido agrupada en intervalos de 12 o 13 años de edad, esto es, entre los 18 y los 30, entre los 31 y los 42, etc; apreciándose claramente en la Figura 4.3 que el mayor número de fallecidos sería el intervalo que contiene las edades más longevas. Por otro lado, al igual que ocurría en el caso de los hospitales, la tasa de mortalidad es más o menos constante en el tiempo. 2008 2009 2010 2011 2012 2013 2014 2015 0 500 1000 1500 2000 2500 3000 3500 Años N [18,30] [31,42] [43,60] [61,72] [73,85+] 2008 2009 2010 2011 2012 2013 2014 2015 0 100 200 300 400 Años N Figura 4.3: Ingresos (izq) y fallecimientos (dch) por años en función de la edad.
4.2. REGRESIÓN DE COX CON EFECTOS ALEATORIOS 25 Por último, se han vuelto a calcular los porcentajes de la Tabla 4.2, pero en este caso, diferenciaremos entre los fallecidos y los aún vivos. De esta forma, podemos hacernos una idea de qué variables han podido afectar en la muerte de dichos pacientes. En la nueva tabla (Tabla 4.5) se han marcado en color rojo aquellos porcentajes de los fallecidos con un alto incremeto respecto a los vivos, como es el caso del descenso del segmento ST, de los antecedentes de infarto agudo de miocardio ( killip34 ) y del padecimiento de diabetes ( diab2 ). Por otro lado, los porcentajes de ausencia de elevación del segmento ST (sin elevación ST) y de los antecedentes de intervención coronaria percutánea ( pci ) son bastante menores entre los fallecidos, lo cual da a entender que tanto los cambios en el electrocardiograma como el haber tenido una intervención percutánea parecen afectar en la mortalidad. Estos últimos se han indicado en color verde. Vivos Fallecidos Número de ingresos 52348 4345 Sin elevación del segmento ST % 40.7 % 28.5 % Elevación del segmento ST % 51.0 % 50.6 % Descenso del segmento ST % 8.31 % 20.9 % Antecedentes de infarto agudo de miocardio 10.6 % 48.1 % Fibrilación auricular % 1.85 % 7.80 % Hipertensión % 49.8 % 56.2 % Diabetes % 28.5 % 36.04 % Antecedentes de intervención coronaria percutánea % 51.8 % 24.35 % Fallo renal % 9.05 % 17.45 % Tabla 4.5: Porcentajes de los factores de riego en hombres y en mujeres fallecidos. Para terminar con el análisis descriptivo, en la curvas de Kaplan Meier (Figura 4.4) se ve claramente que las mujeres tienen más posibilidades de morir que los hombres, al igual que los pacientes sin diabetes, hipertensión o fallo renal. También es observable que en las variables sexo y fallo renal las diferencias entre los dos grupos comienzan antes, mientras que en el caso de la diabetes y la hipertensión el hecho de padecerlas afecta cuando ya ha trascurrido bastante tiempo. Dicha bajada en los primeros días se debe a la mortalidad intra-hospitalaria. 4.2. Regresión de Cox con efectos aleatorios En esta sección se presentarán los resultados obtenidos en el análisis de regresión de Cox de diferentes maneras. Comenzaremos exponiendo los resultados obtenidos con la función coxph con frailty mediante la salida de R . Después, haremos los mismo con la función coxme , sin embargo, utilizando esta herramienta daremos otros dos resultados: un gráfico de efectos aleatorios y una tabla de los hospitales y sus repectivos percentiles. Es por ello que dividiremos esta sección en dos apartados distintos.
26 CAPÍTULO 4. RESULTADOS Figura 4.4: Las curvas de Kaplan Meier para diferentes variables. 4.2.1. Función coxph Primero, como ya hemos comentado anteriormente, se han ajustado diferentes modelos mediante la función coxph con efectos aleatorios ( frailty ). En total, han sido 11 modelos, ya que para los efectos aleatorios podían seguir 3 distribuciones posibles: gaussiana, t de Student y gamma. De igual modo, para cada una de estas 3 distribuciones, existían también 3 métodos para calcular su varianza: aic , df y fixed . Además, para el caso de la distribucion gaussiana y gamma, podríamos aplicar los métodos reml y em , respectivamente. Por tanto, para escoger entre estos 11 modelos, se ha utilizado el criterio de AIC y la busqueda de una varianza mínima en los efectos aleatorios, quedándonos así con un modelo donde los efectos aleatorios siguen una distribución gaussiana y donde el método para el calculo de la varianza es el método de máxima verosimilitud restringida (REML). En la Figura 4.5 se muestra la salida de R del resúmen del modelo seleccionado para la función coxph con efectos aleatorios. Es preciso mencionar que las filas que aparecen como gauss :1 , gauss :39 , etc., se refieren a los HR e intervalos de confianza (IC) de los hospitales, donde los valores 1, 39, etc., son los códigos de dichos centros hospitalarios. La varianza de los efectos aleatorios de dicho modelo es 0,0416.
4.2. REGRESIÓN DE COX CON EFECTOS ALEATORIOS 27 Figura 4.5: Salida de Rde la función coxph. Como bien podemos contemplar, las estimaciones de los parámetros que aparecen al inicio de la Figura 4.5 son los logaritmos de las tasas de riesgos instantáneos. Al exponenciarlos obtenemos los más conocidos como hazard ratios (HR), lo cuál también es calculado por la
28 CAPÍTULO 4. RESULTADOS función summary , algo más abajo. Entonces, por ejemplo, la razón de riesgos instantaneos para los antecedentes de infarto agudo de miocardio (IAM) ( killip34 ) es exp(1.67517) = 5.3397. Recordemos que este es el hazard relativo de que ocurra un evento (en nuestro caso, la muerte) en un grupo del estudio en comparación con el otro; por lo tanto, la presencia de estos antecedentes aumenta el riesgo de muerte por un factor de cinco en comparación con sujetos sin dichos antecedentes. Al examinar la salida, se observa que, con la excepción de la diabetes, la cual tampoco se aleja mucho, todas las características a nivel del paciente están asociadas con el riesgo de mortalidad (p-valor <0,05). El aumento de un año de edad del paciente, el sexo femenino y la presencia de cinco de los seis factores de riesgo (la diabetes, el fallo renal, la elevación y el descenso de ST, y la existencia de antecedentes de IAM) aumentan el riesgo de mortalidad. En el caso del sexo, el p-valor es de 0,0071, con un HR de exp(coef) = 0,8953, y dado que estas tasas se interpretan como efectos multiplicativos sobre el riesgo, ser hombre reduce el riesgo de mortalidad un 10,47 %. En cuanto a la edad, la cual tiene un p-valor de 2 ·e−153 y un HR de 1,0588, podemos decir que cada año de edad hace crecer el riesgo de muerte un 5,88 %. No obstante, las variables que tienen una HR más alto son las que indican la elevación o descenso de ST y la existencia de antecedentes de IAM, ya que el peligro aumenta más de un 100 % con ellas. Por otro lado, el hecho de que el hospital tenga unidad de cuidados intensivos y coronaria se asociaría con una disminución riesgo de mortalidad; sin embargo, al tener un p-valor tan alto (0,48) no es estadísticamente significativamente diferente de cero. Además, el intervalo de confianza (IC) para su HR incluye 1, indicando así que no hay pruebas suficientes para concluir que los grupos son diferentes desde el punto de vista estadístico, al igual que ocurre con el hecho de padecer diabetes. Nótese la diferencia entre los IC y los p-valores, ya que ambos están estrechamente relacionados, aunque proporcionan información diferente. Mientras que los p-valores son el resultado de las pruebas de hipótesis e indican si los datos de la muestra proporcionan o no suficientes evidencias para rechazar la hipótesis nula (por ejemplo, si una diferencia observada entre 2 tratamientos es porque los 2 tratamientos realmente tienen diferentes niveles de eficacia, o si se debe a cambios aleatorios), los IC describen qué tan incierto es nuestro cálculo de la diferencia estimada. Simplemente, el IC indica si la estimación es precisa o solo muy “aproximada”. Por ejemplo, si el objetivo de un estudio es probar si hay una diferencia en la presion arterial sistólica entre 2 grupos de personas, el p-valor solo indica si hay un valor estadísticamente “significativo” o una diferencia estadísticamente “no significativa” en la presión arterial sistólica entre los 2 grupos [28]. Una vez analizados los efectos fijos, el resúmen de coxph también nos devuelve los HR de los efectos aleatorios ωi para cada centro hospitalario i , junto con sus intervalos de confianza. Contemplamos cómo el p-valor de los efectos aleatorios es de 1,3 e−10 , por lo que podríamos decir que están asociados con el riesgo de mortalidad. Este test corresponde a si el efecto aleatorio contribuye en la mejora de la predicción. En el caso que el efecto siga una
4.2. REGRESIÓN DE COX CON EFECTOS ALEATORIOS 29 distribución normal, la hipótesis nula sería que la varianza es cero. Y en general, la hipótesis nula corresponde a la situación en que los efectos de los hospitales tanto de la muestra como todos los hospitales posibles que hubieran podido participar en el estudio son cero. Por último, hay hospitales que están por encima y otros por debajo del promedio, siendo la Fundació Hospital de l’Esperit Sant el que parece alejarse más del promedio (HR=1,5). El centro que parece estar bastante por encima del promedio, observando sólo estos resultados, sería el Hospital de Terrassa, ya que disminuye el riesgo de mortalidad, con un efecto aleatorio de 0,75. La desviación estándar estimada entre centros de sqrt(0,04166667) = 0,2041242 es bastante sustancial. Una característica del modelo de Cox de efectos mixtos (3.3) es que la desviación estándar de los efectos aleatorios es directamente interpretable. Un valor de 0,204, por tanto, corresponde a un riesgo relativo de exp(0,204) = 1,226 . Entonces, el 66 % de los centros hospitalarios de estas mismas características tendrían un HR entre 0,82 y 1,22, ya que corresponde a que el 66 % de probabilidad de una normal está entre la media menos una desviación estándar y la media más una desviación estándar. 4.2.2. Función coxme Continuamos con la aplicación de la función coxme . Primero, analizaremos los valores obtenidos mediante R y después, expondremos el gráfico y la tabla mencionadas previamente. En la Figura 4.6 se muestra la salida de R del resúmen del modelo seleccionado para la función coxme. La varianza de los efectos aleatorios de dicho modelo es 0.0398. Figura 4.6: Salida de Rde la función coxme.
36 CAPÍTULO 5. CONCLUSIONES Y DISCUSIÓN
Bibliografía [1] T. L. Higgins y col. “Benchmarking Inpatient Mortality Using Electronic Medical Record Data: A Retrospective, Multicenter Analytical Observational Study”. En: Critical care medicine 50.4 (2022), págs. 543 - 553. doi: https://doi.org/10.1097/ CCM.0000000000005301. [2] S Siregar y col. “The Dutch Hospital Standardised Mortality Ratio (HSMR) method and cardiac surgery: benchmarking in a national cohort using hospital administration data versus a clinical database”. En: Heart 100.9 (2014), págs. 702 - 710. doi: 10.1136/ heartjnl-2013-304645. [3] Wikipedia. Modelo de efectos aleatorios — Wikipedia, La enciclopedia libre. [Internet; descargado 11-agosto-2022]. 2021. url: https://es.wikipedia.org/w/index.php? title=Modelo_de_efectos_aleatorios&oldid=137809393. [4] T. M. Therneau y col. “Penalized Survival Models and Frailty”. En: Journal of Computational and Graphical Statistics 12.1 (2003), págs. 156 - 175. doi: 10.1198/ 1061860031365. [5] Gencat. Programa d’analítica de dades per a la recerca i la innovació en salut (PADRIS). https://aquas.gencat.cat/ca/ambits/analitica-dades/padris/. [6] I.R.Dégano y col. “A European benchmarking system to evaluate in-hospital mortality rates in acute coronary syndrome: the EURHOBOP project.” En: International Journal of Cardiology 182 (2015), págs. 509 - 516. doi: http://dx.doi.org/10.1016/j.ijcard. 2015.01.019. [7] G. Gomez y col. Analisis de supervivencia. 2011. [8] T. G. Clark y col. “Survival analysis part i: Basic concepts and first analyses.” En: British Journal of Cancer 89(2) (2003), págs. 232 - 238. doi: //doi.org/10.1038/sj. bjc.6601118. [9] D. W. Hosmer y S. Lemeshow. Applied logistic regression. New York:John Wiley & Sons, Inc., 2000. doi:10.1002/0471458546. [10] M. J.Bradburn y col. “Survival analysis part II: multivariate data analysis–an introduction to concepts and methods”. En: ritish journal of cancer 89(3) (2003), págs. 431 - 436. doi:https://doi.org/10.1038/sj.bjc.6601119. 37
38 BIBLIOGRAFÍA [11] L. M. Molinero. “Más allá de los modelos de Cox: modelos paramétricos de supervivencia.” En: Asociación de la Sociedad Española de Hipertensión- Liga Española para la lucha contra la hipertensión arterial (2004). [12] D. Lee y J. In. “Analysis for time to event - Survival Analysis: Part I”. En: Korean Journal of Anesthesiology 71 (mayo de 2018). doi:10.4097/kja.d.18.00067. [13] D. Collett. Modelling Survival Data in Medical Research. Chapman y Hall/CRC, 2014. doi:https://doi.org/10.1201/b18041. [14] T. M Therneau. A Package for Survival Analysis in R. R package version 3.4-0. 2022. url:https://CRAN.R-project.org/package=survival. [15] P. K. Andersen y R. D. Gill. “Cox’s Regression Model for Counting Processes: A Large Sample Study”. En: The Annals of Statistics 10.4 (1982), págs. 1100 - 1120. issn: 00905364. url:http://www.jstor.org/stable/2240714. [16] D. G. Kleinbaum y M. Klein. Parametric Survival Models. New York, NY: Springer New York, ene. de 2005, págs. 257 - 329. isbn: 0-387-23918-9. doi: 10.1007/0-387- 29150-4_7. [17] M. Crowther y col. “Multilevel mixed effects parametric survival models using adaptive Gauss–Hermite quadrature with application to recurrent events and individual participant data meta-analysis”. En: Statistics in Medicine 33 (sep. de 2014). doi: 10.1002/sim.6191. [18] T. Therneau y col. “Mixed effects Cox models”. En: CRAN repository (mar. de 2015). url:https://cran.r-project.org/web/packages/coxme/vignettes/coxme.pdf. [19] A. Hayes. T Distribution Definition. Jun. de 2022. url: https://www.investopedia. com/terms/t/tdistribution.asp. [20] J. Dagpunar. “The gamma distribution”. En: Significance 16.1 (2019), págs. 10 - 11. doi: https://doi.org/10.1111/j.1740-9713.2019.01226.x. [21] Universidad del País Vasco - EHU. Selección de modelos. https://ocw.ehu.eus/ pluginfile . php / 54411 / mod _ resource / content / 1 / estadistica / tema - 12 - seleccion-de-modelos.pdf. [22] H. Bozdogan. “Model selection and Akaike’s Information Criterion (AIC): The general theory and its analytical extensions”. En: Psychometrika 52 (1987), págs. 345 - 370. doi: https://doi.org/10.1007/BF02294361. [23] STHDA. Cox Proportional-Hazards Model. http://www.sthda.com/english/wiki/ cox-proportional-hazards-model. [24] T. M. Therneau y M. Huebner. “Creating Special Variance Structures for Coxme”. En: (sep. de 2022). url: https://cran.rproject.org/web/packages/coxme/ vignettes/variance.pdf. [25] T. M. Therneau. coxme: Mixed Effects Cox Models. R package version 2.2-17. 2022. url:https://cran.r-project.org/web/packages/coxme/coxme.pdf.
BIBLIOGRAFÍA 39 [26] Terry Therneau. Coxme and the Laplace Approximation. 2012. url: https://cran.rproject.org/web/packages/coxme/vignettes/laplace.pdf. [27] T. M. Therneau. “On mixed-effect Cox models, sparse matrices, and modeling data from large pedigrees”. En: (dic. de 2003). url: https://www.researchgate.net/ publication / 2872363 _ On _ mixed - eect _ Cox _ models _ sparse _ matrices _ and _ modeling_data_from_large_pedigrees. [28] S. Huey Tan y S. Beng Tan. “The Correct Interpretation of Confidence Intervals”. En: Proceedings of Singapore Healthcare 19.3 (2010), págs. 276 - 278. doi: https://doi. org/10.1177/201010581001900316. [29] R Core Team. R: A Language and Environment for Statistical Computing. R Foundation for Statistical Computing. Vienna, Austria, 2021. url: https://www.R-project.org/ .