scieee AI-readable full text Open interactive document viewer

Modelos lineares generalizados na análise de dados de saúde

Fernando, Lúria Constância Cavalata

Abstract

Ao longo dos séculos surgiram surtos e epidemias de doenças infeciosas que provocaram milhões de mortes. Atualmente, a nova doença COVID-19 derivada de um vírus (nomeado de SARS-CoV-2 pela Organização Mundial da Saúde (OMS)) já provocou no mundo inteiro, até ao momento, mais de 3 milhões de mortes. Para compreender melhor o comportamento desta nova doença tem sido desenvolvidos e analisados inúmeros processos de modelação, em particular na área de Modelos Lineares Generalizados. Os Modelos Lineares Generalizados tem vindo a ser amplamente utilizados nas mais diversas áreas de estudo, para a modelação de fenómenos. O objetivo principal do estabelecimento de modelos deste tipo e analisar a influência que as variáveis explicativas têm sobre uma variável de interesse (a variável resposta), cuja distribuição pertence à exponencial. O principal objetivo deste estudo e desenvolver modelos estatísticos, no contexto de Modelos Lineares Generalizados, para identificar os principais fatores associados à recuperação dos doentes contaminados com a COVID-19. Assim, numa primeira abordagem são estabelecidos modelos de Regressão Logística com o objetivo de se analisar o efeito de diferentes fatores na recuperação (ou não recuperação) de um doente com COVID-19. Os dados utilizados nesta abordagem referem-se a dados de Filipinas observados no mês de fevereiro do ano de 2020. Numa segunda abordagem pretendeu-se identificar fatores que influenciaram o número de doentes recuperados da COVID-19 estabelecendo Modelos de Regressão de Poisson. No entanto, os modelos desenvolvidos apresentaram o problema de sobredispersão, tornando-se necessário recorrer a Modelos de Regressão Binomial Negativa. Os modelos foram desenvolvidos com aplicação a um conjunto de dados relativos ao número de casos com COVID-19 registados em 130 países em agosto do ano de 2020.

Full text

Lúria Constância Cavalata Fernando Modelos Lineares Generalizados na Análise de Dados de Saúde Lúria Constância Cavalata Fernando UMinho | 2021 Modelos Lineares Generalizados na Análise de Dados de Saúde Universidade do Minho Escola de Ciências julho de 2021 Dissertação de Mestrado Mestrado em Estatística Lúria Constância Cavalata Fernando Modelos Lineares Generalizados na Análise de Dados de Saúde Universidade do Minho Escola de Ciências julho de 2021 Trabalho efetuado sob a orientação das Professoras Arminda Gonçalves Susana Faria Arminda Armi Arminda Gonçalves Susana Faria Dedicat´oria Dedico este trabalho ao meu marido Estatela Fernando que sempre me apoiou e acreditou em mim, pela motivac¸˜ ao mesmo estando distante, aos meus filhos Estˆ ancia Fernando e Gede˜ ao Fernando, que suportaram a minha ausˆ encia de quase trˆ es anos. I Direitos de Autor e Condic¸ ˜oes de Utilizac¸˜ao do Trabalho por Terceiros Este ´ e um trabalho acad´ emico que pode ser utilizado por terceiros desde que respeitadas as regras e boas pr´ aticas internacionalmente aceites, no que concerne aos direitos de autor e direitos conexos. Assim, o presente trabalho pode ser utilizado nos termos previstos na licenc¸a abaixo indicada. Caso o utilizador necessite de permiss˜ ao para poder fazer um uso do trabalho em condic¸ ˜ oes n˜ ao previstas no licenciamento indicado, dever´ a contactar o autor, atrav´ es do Reposit´ oriUM da Universidade do Minho. Licenc¸a concedida aos utilizadores deste trabalho. II Declarac¸˜ao de integridade Eu, L´ uria Constˆ ancia Cavalata Fernando, nº PG35967, aluna do Mestrado em Estat´ ıstica na Escola de Ciˆ encias da Universidade do Minho, declaro ter atuado com integridade na elaborac¸˜ ao do presente trabalho acad´ emico e confirmo que n˜ ao recorri ` a pr´ atica de pl´ agio nem a qualquer forma de utilizac¸˜ ao indevida ou falsificac¸˜ ao de informac¸ ˜ oes ou resultados em nenhuma das etapas conducente ` a sua elaborac¸˜ ao. Mais declaro que conhec¸o e que respeitei o C´ odigo de Conduta ´ Etica da Universidade do Minho. III Agradecimentos Agradec¸o a Deus pelas muitas benc¸˜ aos que proporciona na minha vida, aos meus pais por todo apoio e dedicac¸˜ ao; Agradec¸o ` as minhas professoras e orientadoras Doutora Arminda Manuela e Doutora Susana Faria, pela paciˆ encia, incentivo, empenho e todo o apoio dado no decorrer deste estudo e tamb´ em pelas sugest˜ oes e cr´ ıticas que foram importantes para a realizac¸˜ ao deste trabalho; Agradec¸o aos meus Colegas pelo apoio, durante todo o meu percurso acadˆ emico; A todos que de alguma forma contribu´ ıram para a realizac¸˜ ao deste trabalho, muito obrigada. IV Resumo Ao longo dos s´ eculos surgiram surtos e epidemias de doenc¸as infeciosas que provocaram milh˜ oes de mortes. Atualmente, a nova doenc¸a COVID-19 derivada de um v´ ırus (nomeado de SARS-CoV-2 pela Organizac¸˜ ao Mundial da Sa´ ude (OMS)) j´ a provocou no mundo inteiro, at´ e ao momento, mais de 3 milh˜ oes de mortes. Para compreender melhor o comportamento desta nova doenc¸a tˆ em sido desenvolvidos e analisados in´ umeros processos de modelac¸˜ ao, em particular na ´ area de Modelos Lineares Generalizados. Os Modelos Lineares Generalizados tˆ em vindo a ser amplamente utilizados nas mais diversas ´ areas de estudo, para a modelac¸˜ ao de fen´ omenos. O objetivo principal do estabelecimento de modelos deste tipo ´ e analisar a influˆ encia que as vari´ aveis explicativas tˆ em sobre uma vari´ avel de interesse (a vari´ avel resposta), cuja distribuic¸˜ ao pertence ` a fam´ ılia exponencial. O principal objetivo deste estudo ´ e desenvolver modelos estat´ ısticos, no contexto de Modelos Lineares Generalizados, para identificar os principais fatores associados ` a recuperac¸˜ ao dos doentes contaminados com a COVID-19. Assim, numa primeira abordagem s˜ ao estabelecidos modelos de Regress˜ ao Log´ ıstica com o objetivo de se analisar o efeito de diferentes fatores na recuperac¸˜ ao (ou n˜ ao recuperac¸˜ ao) de um doente com COVID-19. Os dados utilizados nesta abordagem referem-se a dados de Filipinas observados no mˆ es de fevereiro do ano de 2020. Numa segunda abordagem pretendeu-se identificar fatores que influenciaram o n´ umero de doentes recuperados da COVID-19 estabelecendo Modelos de Regress˜ ao de Poisson. No entanto, os modelos desenvolvidos apresentaram o problema de sobredispers˜ ao, tornando-se necess´ ario recorrer a Modelos de Regress˜ ao Binomial Negativa. Os modelos foram desenvolvidos com aplicac¸˜ ao a um conjunto de dados relativos ao n´ umero de casos com COVID-19 registados em 130 pa´ ıses em agosto do ano de 2020. Palavras-chave: COVID-19, Modelos Lineares Generalizados, Regress˜ ao Log´ ıstica, Modelo de Regress˜ ao de Poisson, Modelo de Regress˜ ao Binomial Negativa. V Abstract Over the centuries, outbreaks and epidemics of infectious diseases have caused millions of deaths. Currently, the new disease COVID-19 derived from a virus named SARS-CoV-2 by the World Health Organization (WHO) has caused more than 3 million deaths worldwide so far. To better understand the behavior of this new disease, numerous modeling processes have been developed and analyzed, particularly in the area of Generalized Linear Models. Generalized Linear Models have been widely used in various fields of study to model phenomena. The main purpose of establishing this type of models is to analyze the influence that explanatory variables have on a variable of interest (the response variable) whose distribution belongs to the exponential family. The main objective of this study is to develop statistical models in the context of Generalized Linear Models to identify the main factors associated with the recovery of patients infected with COVID-19. Thus, in a first approach, Logistic Regression models are established to analyze the effect of different factors on the recovery (or non-recovery) of a patient with COVID-19. The data used in this approach derives from data collected in the Philippines in the month of February 2020. In a second stage, it was intended to identify factors influencing the number of patients recovered from COVID-19 by establishing Poisson Regression Models. However, the developed models presented the problem of overdispersion, making it necessary to use Negative Binomial Regression Models. The models were developed with application to a dataset concerning the number of cases with COVID-19 registered in 130 countries in August 2020. Keywords: COVID-19, Generalized Linear Models, Logistic Regression, Poisson Regression Models, Negative Binomial Regression Models. VII VI da pandemia da COVID-19 naquele pa´ ıs, onde foram diagnosticados 143 doentes com a doenc¸a COVID-19, dos quais, nesse per´ ıodo, 93 doentes n˜ ao recuperaram da doenc¸a e 50 recuperaram. A vari´ avel resposta a ser estudada ´ e a vari´ avel Status (Estado do Doente): recuperado ou n˜ ao recuperado da doenc¸a COVID-19. Numasegunda abordagemanalisou-seos dados recolhidos no ˆ ambitoda investigac¸˜ ao levada a cabo na ´ area da sa´ ude a n´ ıvel mundial efetuada pela Organizac¸˜ ao Mundial da sa´ ude (OMS) no dia 3 de agosto do ano 2020, em que foram estudados dados da COVID-19 em 130 pa´ ıses. Neste estudo a vari´ avel resposta ´ e quantitativa discreta, valores que correspondem ao n´ umero total de recuperados por COVID-19 naquele dia. Para isso foram desenvolvidos modelos estat´ ısticos na ´ area dos Modelos Lineares Generalizado que permitem indicar fatores associados ` a recuperac¸˜ ao dos doentes com esta patologia. Assim, o principal objetivo deste trabalho ´ e desenvolver modelos estat´ ıstico para identificar os principais fatores associados ` a recuperac¸˜ ao dos doentes contaminados com a COVID-19 utilizando Modelos Lineares Generalizados, em particular Modelos de Regress˜ ao Log´ ıstica e Modelos de Regress˜ ao de Poisson/Regress˜ ao Binomial Negativa. O tratamento de dados ser´ a realizado atrav´ es do software Rstudio. Todos os gr´ aficos apresentados ao logo desta dissertac¸ ˜ ao foram integralmente realizados pelo mesmo. 1.1 Composic¸˜ao do Trabalho O presente trabalho est´ a dividido em seis cap´ ıtulos que, em seguida, ser˜ ao descritos da seguinte forma. No Cap´ ıtulo 1 ´ e descrita uma breve introduc¸˜ ao ao tema em an´ alise. No Cap´ ıtulo 2 ´ e apresentada uma base te´ orica relativa aos Modelos Lineares Generalizados, que fundamenta as metodologias utilizadas neste trabalho. No Cap´ ıtulo 3 apresenta em detalhe o modelo de Regress˜ ao Log´ ıstica para dados bin´ arios (com a distribuic¸˜ ao de Bernoulli). 2 No Cap´ ıtulo 4 s˜ ao descritos os conte´ udos te´ oricos relacionados com os modelo de Regress˜ ao de Poisson e de Regress˜ ao Binomial Negativa para dados de contagem. No Cap´ ıtulo 5 apresentam-se os resultados da aplicac¸˜ ao destes modelos a dados reais de Sa´ ude. Inicia-se o estudo com uma an´ alise descritiva das bases de dados, seguindo-se a formulac¸˜ ao e a discuss˜ ao dos modelos de regress˜ ao para dados bin´ arios e para dados de contagem de forma a inferir sobre quais as vari´ aveis com poder explicativo sobre as vari´ aveis resposta de interesse, selecionando os modelos que melhor se ajustam aos dados. No Cap´ ıtulo 6 s˜ ao apresentadas as principais conclus˜ oes e algumas sugest˜ oes para trabalho futuro. 3 Cap´ıtulo 2 Modelos Lineares Generalizados A formulac¸˜ ao de um modelo linear generalizado compreende a escolha de uma distribuic¸˜ ao de probabilidade para a vari´ avel resposta, das vari´ aveis quantitativas e/ou qualitativas para representar a estrutura linear do modelo e de uma func¸˜ ao de ligac¸˜ ao. Para a melhor escolha da referida distribuic¸˜ ao de probabilidade ´ e aconselh´ avel examinar os dados para observar algumas caracter´ ısticas, tais como a assimetria, a natureza discreta ou cont´ ınua, o intervalo de variac¸˜ ao, etc. ´ E importante salientar que os termos que comp˜ oem a estrutura linear do modelo podem ser de natureza discreta ou cont´ ınua, qualitativa ou mista, e devem dar uma contribuic¸˜ ao significativa na explicac¸˜ ao da vari´ avel resposta, Cordeiro (2004). 2.1 Fam´ılia Exponencial Uma vari´ avel aleat´ oria Y tem distribuic¸˜ ao pertencente ` a fam´ ılia Exponencial de dispers˜ ao (ou simplesmente fam´ ılia Exponencial) quando a sua func¸˜ ao densidade de probabilidade (f.d.p.) ou func¸˜ ao massa de probabilidade (f.m.p.) for escrita na forma f(y|θ, φ)=exp (yθ−b(θ) a(φ)+c(y, φ))(2.1) onde, θ´ e o parˆ ametro de localizac¸˜ ao; φ´ e o parˆ ametro de dispers˜ ao ou parˆ ametro de escala e a(.), b(.) e c(.) s˜ ao func¸ ˜ oes reais conhecidas. A func¸˜ ao a(.) depende apenas do parˆ ametro de dispers˜ ao e ´ e geralmente da forma a(φ)=φ w, onde w ´ e uma constante conhecida, a func¸˜ ao b(.) depende apenas do parˆ ametro θe a func¸˜ ao c(.) depende apenas da vari´ avel aleat´ oria Y e do parˆ ametro de dispers˜ ao φ. Quando φfor conhecido tem-se uma distribuic¸˜ ao da fam´ ılia Exponencial com parˆ ametro can´ onico θ. 4 Pode ser demonstrado, McCullagh e Nelder (1989) que, se Y ´ e uma vari´ avel aleat´ oria com uma distribuic¸˜ ao pertencente ` a fam´ ılia Exponencial, ent˜ ao E(Y)=µ=b0(θ) (2.2) Var(Y)=σ2=a(φ)b00(θ) (2.3) onde b’(θ) e b”(θ) s˜ ao a primeira e a segunda derivadas de b(θ), respectivamente. Assim, a variˆ ancia de Y ´ e o produto de duas func¸ ˜ oes a b”(θ) que depende apenas do parˆ ametro can´ onico θque se designa por func¸˜ ao de variˆ ancia de µe que se representa por, Var(µ), e outra, a(φ), que depende apenas do parˆ ametro de dispers˜ ao φ, Turkman (2000). 2.1.1 Exemplos de algumas Distribuic¸ ˜oes Conhecidas Pertencentes `a Fam´ılia Exponencial Distribuic¸˜ao Binomial Se Y ∼B(n, π), onde n ´ eon´ umero de experiˆ encias de Bernoulli de um determinado acontecimento e π´ e a probabilidade de sucesso desse acontecimento em cada experiˆ encia, a func¸˜ ao de probabilidade ´ e dada por f(y|n, π)= n y!πy(1 −π)n−y=(2.4) =exp "ylog π 1−π+nlog(1 −π)+log n y!#. Obt´ em-se, θ=log π 1−π, b(θ)=nlog(1 +exp(θ)), a(φ)=1 e c(y, φ)=log n y. A m´ edia e a variˆ ancia de Y s˜ ao representadas por E(Y)=µ=b0(θ)=nπ, Var(Y)=a(φ)b00(θ)=nπ(1 −π). A func¸˜ ao de variˆ ancia ´ e Var(µ)=nπ(1 −π). 5 Distribuic¸˜ao de Bernoulli Uma vari´ avel aleat´ oria Y tem distribuic¸˜ ao de Bernoulli com parˆ ametro πse sua func¸˜ ao de probabilidades ´ e dada por =exp ylog π 1−π+log(1 −π). f(y|π)=πy(1 −π)1−y=(2.5) Obt´ em-se, θ=log π 1−π, b(θ)=log(1 +exp(θ)), a(φ)=1 e c(y, φ)=0. A m´ edia e a variˆ ancia de Y s˜ ao representadas por E(Y)=µ=b0(θ)=π, Var(Y)=a(φ)b00(θ)=π(1 −π). A func¸˜ ao de variˆ ancia ´ e Var(µ)=π(1 −π). Distribuic¸˜ao de Poisson Considerando que Y segue uma distribuic¸˜ ao de Poisson, com parˆ ametro µ, P(µ), a func¸˜ ao de probabilidade de Y ´ e dada por f(y|µ)=e−µµy y!=(2.6) =exp ylog(µ)−µ−log(y!). Neste caso, θ=log(µ), b(θ)=exp(θ), a(φ)=1 e c(y, φ)=−log(y!). A m´ edia e a variˆ ancia de Y s˜ ao respetivamente E(Y)=b0(θ)=exp(θ)=µ e Var(Y)=a(φ)b00(θ)=exp(θ)=µ. A func¸˜ ao de variˆ ancia Var(µ)=µ. 6 Distribuic¸˜ao Binomial Negativa Seja Y uma vari´ avel aleat´ oria que segue uma distribuic¸˜ ao Binomial Negativa com parˆ ametros k e p, y ∼BN(k, p). A vari´ avel Y representa o n´ umero de insucessos anteriores a k sucessos, num conjunto de acontecimentos independentes e com a mesma probabilidade de sucesso, p. A func¸˜ ao de probabilidade de Y ´ e dada por f(y|n,p)= y+k−l k−l!pk(1 −p)y=(2.7) =exp "ylog(1 −p)+klog(p)+log y+k−l k−l!#. Neste caso, a distribuic¸˜ ao Binomial Negativa est´ a escrita na forma can´ onica, onde θ=log(1 −p), b(θ)=−klog(p), a(φ)=1 e c(y, φ)=log y+k−l k−l. A m´ edia e a variˆ ancia s˜ ao expressas por E(Y)=µ=b0(θ)=k(1 −p) p, Var(Y)=a(φ)b00(θ)=k(1 −p) p2 A func¸˜ ao de variˆ ancia Var(µ)=k(1 −p) p2. Distribuic¸˜ao Normal Seja Yuma vari´ avel aleat´ oria que segue uma distribuic¸˜ ao Normal com valor m´ edio µe variˆ ancia σ2, se a sua func¸˜ ao densidade de probabilidade ´ e dada por f(y|µ, σ2)=1 σ√2πexp −1 2σ2(y−µ)2,y∈R.(2.8) Tem-se, ent˜ ao, f(y|µ, σ2)=exp (1 σ2 yµ−µ2 2!−1 2 y2 σ2+log(2πσ2)!). Comparada com (2.1), tem-se θ=µ, b(θ)=µ2 2, a(φ)=σ2e c(y,φ)=-1 2y2 σ2+log(2πσ2). A m´ edia e a variˆ ancia de Y s˜ ao representadas por E(Y)=b0(θ)=θ=µ, 7 Var(Y)=a(φ)b00(θ)=θ=σ2. A func¸˜ ao de variˆ ancia ´ e Var (µ)=1. O que mostra que a distribuic¸˜ ao N(µ, σ2) com µdesconhecido e σ2>0, conhecido, pertence ` a fam´ ılia Exponencial na forma can´ onica. Distribuic¸˜ao Gama Se Ytem distribuic¸˜ ao Gama com parˆ ametro de forma νe de escala, ν/µ, (Y∼ Ga(ν, ν/µ)), a sua func¸˜ ao densidade de probabilidade ´ e f(y|ν, µ)=1 Γ(µ) ν µ!ν yν−1exp −ν µy!=(2.9) =exp{ν(−y µ−log µ)+(ν−1) log y−log Γ(ν)+νlog ν}= =exp ν(θy+log(−θ)) +(ν−1) log y−log Γ(ν)+νlog ν, com y>0 e θ=−1 µ. Logo para a func¸˜ ao de probabilidade da forma (2.1) apresentada, tem-se θ=−1 µ, b(θ)=−log(−θ), a(φ)=1 ν, c(y, φ)=(ν−1) log y+νln ν−log Γ(ν). A m´ edia e a variˆ ancia de Y s˜ ao representadas por E(Y)=b0(θ)=1 θ=µ, Var(Y)=a(φ)b00(θ)=µ2 ν. A func¸˜ ao de variˆ ancia ´ e Var(µ)=µ2. 2.2 Descric¸˜ao do Modelo Linear Generalizado Nelder e Wedderburn (1972) deram o nome de Modelo Linear Generalizado como uma extens˜ ao do modelo linear cl´ assico Y=Xβ+ 8 onde X´ e uma matriz de dimens˜ ao n×(p+1) de especificac¸˜ ao do modelo. Em geral, a matriz das covari´ aveis de interesse Xcom um primeiro vetor unit´ ario, associada a um vetor β=(β0, β1...,βp)Tde parˆ ametros, e ´ e um vetor de erros aleat´ orios com distribuic¸˜ ao que se sup˜ oe Np(0, σ2I). Estas hip´ oteses implicam obviamente que o valor esperado da vari´ avel resposta ´ e uma func¸˜ ao linear das covari´ aveis E(Y|X)=µ=Xβ. Portanto, a extens˜ ao ´ e feita em duas vertentes: a distribuic¸˜ ao considerada n˜ ao tem de ser Normal, mas que pode pertencer a qualquer fam´ ılia Exponencial; a estrutura de linearidade mant´ em a func¸˜ ao que associa o valor esperado e o vetor de covari´ aveis de interesse X=(X1, ..., Xp) pode ser qualquer func¸ ˜ ao diferenci´ avel. As componentes fundamentais do Modelo Linear Generalizado s˜ ao: •Componente aleat´ oria; •Componente sistem´ atica; •Func¸˜ ao de ligac¸˜ ao. Componente aleat´oria Dado o vetor de covari´ aveis X=(X1, ..., Xp) as vari´ aveis Yi, com i=1,...,n, s˜ ao (condicionalmente) independentes com distribuic¸˜ ao pertencente ` a fam´ ılia Exponencial da forma (2.1), com E[yi|Xj]=µi=b0(θi), para i=1,...,nej=1,...,p, possivelmente, um parˆ ametro de dispers˜ ao φn˜ ao dependente de i. Componente sistem´atica Consiste numa combinac¸˜ ao linear de vari´ aveis preditoras, ou seja, o valor esperado µiest´ a relacionado como preditor linear ηi=XT iβatrav´ es da relac¸ ˜ ao µi=h(ηi)=h(XT iβ), ηi=g(µi) 9 onde, h´ e uma func¸˜ ao mon´ otona e diferenci´ avel; β´ e um vetor de parˆ ametros de dimens˜ ao p; xj´ e o vector de especificac¸˜ ao de dimens˜ ao p; g=h−1´ e a func¸˜ ao de ligac¸˜ ao que relaciona a m´ edia de yiao preditor linear, ou seja, g(µi)=ηi,i=1,...,n. Quando existem covari´ aveis qualitativas elas devem ser codificadas ` a custa de vari´ aveis bin´ arias mudas chamadas indicatrizes (ou dummy). Func¸˜ao de ligac¸˜ao Func¸˜ ao diferenci´ avel e mon´ otona g(.) que associa a componente aleat´ oria e sistem´ atica, atrav´ es duma relac¸ ˜ ao da forma g(µi)=ηi=xT iβ= p X j=1 xijβj←→ µi=g−1(xT iβ). Quando o preditor linear coincide com o parˆ ametro can´ onico, isto ´ e, θi=ηi=XT iβ. A func¸˜ ao de ligac¸˜ ao correspondente diz-se ent˜ ao func¸˜ ao de ligac¸˜ ao can´ onica. Em s´ ıntese, a estrutura de um Modelo LinearGeneralizado ´ e formada por trˆ es partes: uma componente aleat´ oria composta de uma vari´ avel aleat´ oria Ycom n observac¸ ˜ oes independentes, um vetor de m´ edias µe uma distribuic¸˜ ao pertencente ` a fam´ ılia Exponencial; uma componente sistem´ atica composta por vari´ aveis explicativas X1,...,Xp tais que produzem um preditor linear η; e uma func¸˜ ao mon´ otona diferenci´ avel, conhecida como func¸˜ ao de ligac¸˜ ao, que relaciona estas duas componentes (Cordeiro (2004)). 2.3 Estimac¸˜ao dos Parˆametros Num Modelo Linear Generalizado o parˆ ametro β´ e parˆ ametro de interesse, o qual ´ e estimado pelo m´ etodo da m´ axima verosimilhanc¸a. Nos Modelos Lineares Generalizados, os m´ etodos de inferˆ encia estat´ ıstica baseiam-se, essencialmente, na func¸˜ ao de verosimilhanc¸a. O parˆ ametro de dispers˜ ao φ, quando existe, ´ e considerado um parˆ ametro perturbador e ´ e estimado pelo m´ etodo dos momentos. Geralmente o m´ etodo de m´ axima verosimilhanc¸a ´ e tamb´ em considerado como base fundamental no processo inferencial, no caso dos testes de hip´ oteses sobre os coeficientes estimados e da qualidade do ajustamento. 10 A func¸˜ ao de verosimilhanc¸a do modelo, em func¸˜ ao de β,´ e dada por Turkman (2000) L(β)= n Y i=1 f(yi|θi, φ)=(2.10). = n Y i=1 exp (yiθi−b(θi) a(φ)+c(yi, φ))=exp        n X i=1 yiθi−b(θi) a(φ)+ n X i=1 c(yi, φ)       . O logaritmo da verosimilhanc¸a ´ e dado por log(L(β)) =`(β)= = n X i=1(yiθi−b(θi) a(φ)+c(yi, φ))= n X i=1 `i(β), onde, `i´ e a contribuic¸˜ ao de cada observac¸˜ ao yipara a verosimilhanc¸a. O estimador de m´ axima verosimilhanc¸a para βs˜ ao obtidos como soluc¸˜ ao do sistema de equac¸ ˜ oes de verosimilhanc¸a e as mesmas s˜ ao dadas por ∂`(β) ∂βj = n X i=1 ∂`i(β) ∂βj =0,j=1,...,p.(2.11) A equac¸˜ ao (2.11) ´ e a derivada do logaritmo da verosimilhanc¸a em relac¸˜ ao ao parˆ ametro βe pode-se chamar de Score. Para obter estas equac¸ ˜ oes, segundo Turkman (2000), utiliza-se a regra de cadeia ∂`i(β) ∂βj =∂`i(θi) ∂θi ∂θi(µi) ∂µi ∂µi(ηi) ∂ηi ∂ηi(β) ∂βj ,j=0,1,...,p. Sabendo que b0(θi)=µie Var(Yi)=φb00(θi), ent˜ ao ∂`i(θi) ∂θi =yi−µi a(φ), ∂µi ∂θi =b00(θi)=Var(Yi) a(φ), 11 onde, Var(ˆ µi) representa a func¸˜ ao de variˆ ancia estimada para a distribuic¸˜ ao do modelo em estudo. Outra medida da adequabilidade de modelos ´ e a estat´ ıstica de Pearson generalizada que ´ e dada por X2= n X i=1 (yi−ˆ µi)2 Var(ˆ µi).(2.20) Res´ıduo do Desvio O res´ ıduo da func¸˜ ao Desvio correspondente ` a i-´ esima observac¸˜ ao ´ e definido por RD i=δipdi,(2.21) onde, δi=sinal(yi−ˆ µi), di´ e a contribuic¸˜ ao da i-´ esima observac¸˜ ao para a medida do desvio definida em 2.6.1. Res´ıduos Padronizados O res´ ıduo de Pearson padronizado ´ e definido por riE =yi−ˆ µi pVar(ˆ µi)(1 −hii).(2.22) sendo, hii o i-´ esimo elemento da diagonal da matriz Hdefinida por H=W1/2X(XTWX)−1XTW1/2, sendo, W definida quando da discuss˜ ao do M´ etodo de Fisher, Turkman (2000). O res´ ıduo de Desvio padronizado ´ e dado por rDE =rD p(1 −hii).(2.23) 2.6.4 Tipos de Observac¸ ˜oes Pretende-se detetar observac¸ ˜ oes at´ ıpicas do conjunto de dados. Essas observac¸ ˜ oes s˜ ao classificadas em: Outliers: s˜ ao observac¸ ˜ oes mal ajustados com res´ ıduos altos e elas podem ser, ou n˜ ao, influentes; 18 Pontos influentes: s˜ ao observac¸ ˜ oes com influˆ encia desproporcional nas estimativas dos coeficientes do modelo, isto ´ e, quando exclu´ ıdos do modelo mudam de forma substancial algumas propriedades do modelo ajustado. Pontos alavanca: s˜ ao observac¸ ˜ oes posicionados em regi˜ oes remotas no espac¸o das vari´ aveis explicativas com grande impacto na determinac¸˜ ao das propriedades do modelo de regress˜ ao. As observac¸ ˜ oes outliers, influentes e alavanca s˜ ao identificados atrav´ es da an´ alise de res´ ıduos e da medida hii, onde hii ´ e o elemento da diagonal da matriz de projec¸ ˜ ao. Segundo Cordeiro (2004), ´ e muito razo´ avel utilizar hii como uma medida da influˆ encia da i-´ esima observac¸˜ ao sobre o pr´ oprio valor ajustado. Supondo que todos os pontos exerc¸am a mesma influˆ encia sobre os valores ajustados, podemos esperar que hii esteja pr´ oximo de p n, em que p´ e o n´ umero de parˆ ametro no modelo e n´ e o total das observac¸ ˜ oes. Portanto, conv´ em examinar as observac¸ ˜ oes correspondentes aos maiores valores de hii. Alguns autores sugerem hii >2p ncomo um indicador de pontos influentes. Para avaliar de uma forma mais geral a influˆ encia da i-´ esima observac¸˜ ao nas estimativas dos coeficientes da regress˜ ao utiliza-se a medida de distˆ ancia de Cook que ´ e dada por DCi= hiir2 ip p(1 −hii). Logo, DCiser´ a elevado quando o valor de hii ´ e diferente de zero e res´ ıduos elevados, ent˜ ao para valores elevados de DCiconsidera-se a respetiva observac¸ ˜ ao como influente. 2.6.5 Tipos de Gr´aficos A representac¸˜ ao gr´ afica ´ e uma forma informal de avaliar a qualidade de ajustamento de um modelo. Existem v´ arios tipos de gr´ aficos para analisar a qualidade de ajustamento, mas neste trabalho vai-se usar trˆ es tipos: 1)-Gr´afico dos res´ıduos padronizados versus valores ajustados, este gr´ afico pode ser ´ util na detecc¸˜ ao de observac¸ ˜ oes que divergem da tendˆ encia geral das demais observac¸ ˜ oes, observac¸ ˜ oes que est˜ ao fora do limite considerado para a distribuic¸˜ ao dos res´ ıduos, indicando poss´ ıveis outliers. 19 2)- Gr´afico Normal de probabilidades para res´ıduos com envelope, analisa o pressuposto da normalidade dos res´ ıduos e da escolha da distribuic¸˜ ao para a vari´ avel resposta. Se o modelo ajustado ´ e o correto, existe grande probabilidade de que todos os pontos estejam dentro do envelope. 3)- Gr´aficos de hii eDCiversus a ordem da observac¸˜ao, s˜ ao geralmente ´ uteis na identificac¸˜ ao de pontos alavanca e pontos influentes. 20 Cap´ıtulo 3 Modelo de Regress˜ao Log´ıstica A Regress˜ ao Log´ ıstica tem-se constitu´ ıdo num dos principais m´ etodos de modelac¸˜ ao estat´ ıstica de dados. Mesmo quando a resposta de interesse n˜ ao ´ e originalmente do tipo bin´ ario, alguns investigadores tˆ em dicotomizado a resposta de modo que a probabilidade de sucesso possa ser ajustada atrav´ es da Regress˜ ao Log´ ıstica (Paula (2004)). O modelo de Regress˜ ao Log´ ıstica ´ e um caso particular do Modelo Linear Generalizado, que geralmente ´ e usado quando a vari´ avel resposta ´ e qualitativa com dois resultados poss´ ıveis denominados de ”fracasso”e ”sucesso”. Seja xij a vari´ avel explicativa e yio n´ umero de ocorrˆ encias de um determinado evento, em que i=1,2,...,nrepresenta o n´ umero de observac¸ ˜ oes e j=1,2,...,p representa o n´ umero de covari´ aveis. Assume-se ainda, que a vari´ avel resposta tem distribuic¸˜ ao de Bernoulli (πi) com πi=P(yi=1) =E(Yi) e cuja func¸˜ ao de probabilidade ´ e dada por f(yi|πi)=πyi i(1 −πi)1−yi,yi=0,1,i=1,...,n(3.1) onde, πi´ e a probabilidade de ocorrˆ encia de um evento, que significa a probabilidade do sucesso P(yi=1) =πie a probabilidade do fracasso P(yi=0) =1−πi. O objetivo ´ e formular um modelo para a probabilidade de um objeto ou indiv´ ıduo caracterizado por um vetor de vari´ aveis explicativas tomar o valor 1. No entanto, no modelo de regress˜ ao cl´ assico o valor esperado ´ e dado por E(Y|xi=xi)=β0+β1xi1+···+βpxip,i=1,...,n. Assim sendo, ´ e poss´ ıvel que a m´ edia assuma qualquer valor, quando xvaria entre 21 −∞ e+∞, existindo assim incorrespondˆ encia ao contradom´ ınio do modelo de Regress˜ ao Log´ ıstica, isto ´ e, quando g(x)→+∞, ent˜ ao P(Y=1) →1; g(x)→ −∞, ent˜ ao P(Y=1) →0. Para que haja correspondˆ encia, a Regress˜ ao Log´ ıstica reformula o modelo linear de modo a conceder que o valor da vari´ avel resposta varie entre 0 e 1. A mesma ´ e obtida pela seguinte equac¸˜ ao πi=P(Yi=1|x)exp(β0+β1xi1+···+βpxip) 1+exp(β0+β1xi1+···+βpxip).(3.2) Para descrever a relac¸˜ ao linear entre a vari´ avel resposta e as vari´ aveis explicativas faz-se o uso da func¸˜ ao logit que ´ e o logaritmo da raz˜ ao entre a probabilidade de sucesso e a probabilidade de insucesso. A equac¸˜ ao da func¸˜ ao logit ´ e log πi 1−πi=β0+β1xi1+···+βpxip,(3.3) onde πi´ e uma proporc¸˜ ao de Bernoulli, xj(j=1, ..., p) ´ e a vari´ avel explicativa e β0, β1, . . . , βps˜ ao parˆ ametros do modelo de Regress˜ ao Log´ ıstica, chamada de raz˜ ao de desigualdade. De acordo com Agresti (2013), uma das principais estat´ ısticas utilizadas na an´ alise de dados bin´ arios ´ e a raz˜ ao de chances πi 1−πi, que ´ e definida como a raz˜ ao entre a chance de um evento ocorrer num grupo, sendo que a chance ´ e a probabilidade de ocorrˆ encia deste evento dividida pela probabilidade da n˜ ao ocorrˆ encia do mesmo evento. 3.1 Estimac¸˜ao dos Coeficientes de Regress˜ao Para a estimac¸˜ ao dos coeficientes de regress˜ ao, quando a vari´ avel resposta ´ e bin´ aria, partindo do pressuposto que existe independˆ encia dos valores observados, utiliza-se o m´ etodo de m´ axima verosimilhanc¸a descrito na Secc¸˜ ao 2.3. Neste caso a func¸˜ ao de verosimilhanc¸a ´ e dada por L(β)= n Y i=1 πyi i(1 −πi)(1−yi). Na pr´ atica usa-se o logaritmo da func¸˜ ao verosimilhanc¸a (ou log-verosimilhanc¸a) 22 para simplificar a tarefa de obtenc¸ ˜ ao dos estimadores e ´ e dado por log(β)=l(β)= n X i=1yilog πi 1−πi+log(1 −πi). Substituindo na express˜ ao (3.2) fica `(β)= n X i=1  yilog          exp(β0+β1xi1+···+βpxip) 1+exp(β0+β1xi1+···+βpxip) 1−exp(β0+β1xi1+···+βpxip) 1+exp(β0+β1xi1+···+βpxip)          +log 1−exp(β0+β1xi1+···+βpxip) 1+exp(β0+β1xi1+···+βpxip)! = = n X i=1"yilog exp β0+β1xi1+···+βpxip+log 1 1+exp(β0+β1xi1+···+βpxip)!!#. Logo, `(β)= n X i=1hyiβ0+β1xi1+···+βpxip−log 1+exp(β0+β1xi1+···+βpxip)i. O valor de βque maximiza `(β)´ e obtido ap´ os derivar `(β) em relac¸ ˜ ao aos parˆ ametros (β0, β1, . . . , βp). Caso n˜ ao seja poss´ ıvel uma soluc¸˜ ao anal´ ıtica ser˜ ao necess´ arios m´ etodos iterativos para a sua resoluc¸ ˜ ao. 3.2 Qualidade de Ajustamento Para avaliar o ajustamento do modelo s˜ ao utilizados alguns testes como o teste de Wald e o teste de Raz˜ ao de Verosimilhanc¸a que tˆ em como objetivo avaliar a significˆ ancia de cada vari´ avel explicativa inclu´ ıda no modelo. O teste normalmente usado para avaliar o ajustamento de modelos de Regress˜ ao Log´ ıstica ´ e o teste de Hosmer-Lemeshow, que verifica se existe uma associac¸˜ ao estatisticamente significativa entre as vari´ aveis preditoras e a vari´ avel resposta. 3.2.1 Teste de Hosmer e Lemeshow Este teste avalia o modelo ajustado, comparando as frequˆ encias observadas e as esperadas. O teste associa os dados ` as suas probabilidades estimadas da mais baixa ` a mais alta, e ent˜ ao aplica um teste de Qui-quadrado para determinar se as frequˆ encias estimadas est˜ ao pr´ oximas das frequˆ encias observadas, Hosmer (1989). 23 A hip´ otese a testar ´ eH0: ”O modelo encontrado explica bem os dados” HL = g X k=1 (ok−ek)2 nkπk(1 −πk)∼χ2 p−1(3.4) onde, k - ´ eon´ umero de grupos (exemplo 10 grupos compostos pelos decis do valor ajustado da probabilidade); nkn´ umero de indiv´ ıduos em cada grupo; okn´ umero de respostas positivas dentro de cada grupo; ekvalor esperado do n´ umero de casos dentro de cada grupo assumindo que o modelo est´ a correto. O teste de diagn´ ostico de Hosmer-Lemeshow modificado verifica se as probabilidades estimadas a partir do modelo s˜ ao consistentes com a resposta bin´ aria observada. Para tal ordena as probabilidades estimadas para cada observac¸˜ ao, divide-as em (10) grupos de sensivelmente o mesmo n´ umero de probabilidades, calcula as probabilidades m´ edias dentro de cada grupo e, multiplicando-as pelo n´ umero de observac¸ ˜ oes do grupo, obt´ em o n´ umero esperado de sucessos nesse grupo. Esse n´ umero ´ e ent˜ ao comparado com o n´ umero efetivo de sucessos observados no grupo atrav´ es de um teste de Qui-quadrado de Pearson. 3.2.2 Curva ROC Seja ˆ Y=1 se um indiv´ ıduo selecionado na populac¸˜ ao em estudo for classificado como acontecimento de interesse e ˆ Y=0 se classificado como n˜ ao acontecimento. Para esta classificac¸˜ ao ´ e necess´ ario estabelecer um ponto de corte que determina a probabilidade de um dado indiv´ ıduo ser classificado numa determinada classe. O ponto de corte mais utilizado ´ e C =0,5, significando que para um valor ˆ Yser maior ou igual a 0,5 o indiv´ ıduo ser´ a classificado na classe 1, caso contr´ ario ser´ a classificado na classe 0. A curva Receiver Operating Characteristic (ROC) ´ e um m´ etodo utilizado para medir a capacidade de predic¸ ˜ ao do modelo. Esta curva representa a sensibilidade, a probabilidade de se detetar os verdadeiros positivos, contra a especificidade, probabilidade de se detetar os verdadeiros negativos, permitindo estudar a sua variac¸˜ ao para diferentes pontes de corte. A ´ area sob a curva ROC, denomina-se de Area Under the ROC Curve (AUC), que indica a capacidade do modelo discriminar corretamente as vari´ aveis, variando entre 0 e 1, segundo Hein (2010): •Se AUC =0,5 n˜ ao h´ a discriminac¸˜ ao; 24 •Se 0,6 ≤AUC <0,7 o modelo apresenta uma discriminac¸ ˜ ao limitada; •Se 0,7 ≤AUC <0,8 o modelo apresenta uma discriminac¸ ˜ ao aceit´ avel; •Se 0,8 ≤AUC <0,9 o modelo apresenta uma excelente discriminac¸ ˜ ao; •Se AUC ≥0,9 o modelo apresenta uma discriminac¸ ˜ ao quase perfeita. 3.2.3 Matriz de Confus˜ao Uma maneira pr´ atica de Avaliar o ajustamento de um modelo de Regress˜ ao Log´ ıstica ´ e pela projec¸˜ ao do modelo na Tabela de Classificac¸˜ ao (ou Matriz de Confus˜ ao). Para isto, precisa-se criar uma tabela com o resultado da classificac¸˜ ao cruzada da vari´ avel resposta, de acordo com uma vari´ avel dicot´ omica em que os valores se derivam das probabilidades log´ ısticas estimadas na regress˜ ao, Mair (2008) . Para a classificar os ”eventos”dos ”n˜ ao eventos”, elabora-se a Matriz de Confus˜ ao ou Tabela de Classificac¸˜ ao, com as observac¸ ˜ oes de Verdadeiro Positivo (VP), Falso Positivo (FP), Falso Negativo (FN) e Verdadeiro Negativo (VN) (Tabela 3.1). Tabela 3.1: Matriz de confus˜ ao Valor Observado 1 0 Valor estimado 1 VP FP 0 FN VN Sensibilidade: representa a proporc¸˜ ao de verdadeiros positivos, ou seja, a capacidade do modelo em avaliar o evento dado Y=1, isto ´ e, SENS =VP VP +FP. Especificidade: fornece a proporc¸˜ ao de verdadeiro negativos, valor este que ´ e determinado pela probabilidade de prevermos a n˜ ao ocorrˆ encia do evento entre os indiv´ ıduos em que este n˜ ao foi observado, o n˜ ao evento Y=0, isto ´ e, ESPE =VN VN +FN. Um bom modelo ´ e aquele em que a sensibilidade e a especificidade s˜ ao superiores a 80%, razo´ avel se estes dois valores estiverem entre 50% e 80% e med´ ıocre se ambos forem inferiores a 50%. 25 3.3 Interpretac¸˜ao dos Coeficientes A interpretac¸ ˜ ao dos parˆ ametros num modelo de Regress˜ ao Log´ ıstica baseia-se em raz˜ oes de chances (odds ratios). O odds ratio ´ e dado pelo quociente entre a odds do acontecimento de interesse ocorrer (Y=1) nos indiv´ ıduos com x=1 e a odds desse acontecimento ocorrer (Y=1) nos indiv´ ıduos com x=0. Uma vez ajustado o modelo e avaliada a significˆ ancia dos coeficientes estimados, ´ e necess´ ario interpretar os valores associados aos coeficientes do modelo. Para interpretarmos os valores associados aos coeficientes do modelo de Regress˜ ao Log´ ıstica, ´ e conveniente proceder ` a an´ alise de acordo com a natureza das vari´ aveis explicativas e as mesma podem ser categ´ oricas ou n˜ ao. Vari´avel independente dicot´omica Oodds ratio ´ e dado pelo quociente entre a odds do acontecimento de interesse ocorrer (Y=1) nos indiv´ ıduos com x=1eaodds desse acontecimento ocorrer (Y=1) nos indiv´ ıduos com x=0. Assim, quando x´ e uma vari´ avel independente e a mesma pode assumir dois valores 0 ou 1, na qual pode-se construir a tabela de contingˆ encia com a probabilidade que se pretende estimar, isto ´ e, quando Ytem a seguinte distribuic¸˜ ao de probabilidade π1=P(Y=1|X=1) e π0=P(Y=1|X=0): x=1 x=0 y=0 1-π11-π0 y=1π1π0 Considerando a express˜ ao (3.2) para se obter o π0eπ1calcula-se π1=exp(β1+β2) 1+exp(β1+β2), π0=exp(β1) exp(β1), em que as chances representam-se da seguinte maneira π1 1−π1 =exp(β1+β2) 26 eπ0 1−π0 =exp(β1). Quando a vari´ avel resposta assumir o valor 1 com x=1 a raz˜ ao de chance ´ eπ1 1−π1, da mesma forma a chance da vari´ avel resposta assumir valor 1 com x=0, esse odds ´ eπ0 1−π0. Aplicando a func¸˜ ao logit fica logit[P(Y=1|X=1)] =log π1 1−π1=β1+β2,(3.5) e logit[P(Y=1|X=0)] =log π0 1−π0=β1.(3.6) A raz˜ ao de chance designada por odds ratio ´ e estimada da seguinte forma odds ratio = π1 1−π1 π0 1−π0 .(3.7) Substituindo a express˜ ao (3.5) na (3.6) fica, odds ratio =exp(β1+β2) exp(β1)=exp(β2). O valor da raz˜ ao de chance representa o risco para a vari´ avel resposta Ytomar o valor 1, quando a vari´ avel explicativa X=1, em relac¸˜ ao a x =0. O intervalo de 100%(1 −α) de confianc¸a para a estimativa e exp(β2)´ e dado por iexp( ˆ β2−z1−α 2ˆ SE(ˆ β2)); exp( ˆ β2+z1−α 2ˆ SE(ˆ β2))h onde Z1−α 2´ e o quantil de probabilidade da distribuic¸˜ ao Normal de valor m´ edio zero e variˆ ancia unit´ aria. Se o intervalo de confianc¸a incluir o valor 1, n˜ ao existe relac¸˜ ao significativa entre as vari´ aveis X(vari´ avel explicativa) e Y(vari´ avel resposta). 27 Substituindo a func¸˜ ao da variˆ ancia Var(ˆ µi)=µ+αµ2, a estat´ ıstica de Pearson generalizada ´ e dada por X2= n X i=1 (yi−ˆ µi)2 ˆ µi+αˆ µi2. 34 Cap´ıtulo 5 Aplicac¸˜ao a Dados Reais Neste cap´ ıtulo iremos aplicar Modelos Lineares Generalizados, em particular a Regress˜ ao Log´ ıstica, a Regress˜ ao de Poisson e a Regress˜ ao Binomial Negativa, na an´ alise de dados reais. Uma das bases de dados utilizada refere-se ao n´ umero de doentes contaminados com o COVID-19 e que j´ a recuperaram ou n˜ ao, nas Filipinas. A amostra foi obtida no mˆ es de fevereiro de 2020 e cont´ em 143 observac¸ ˜ oes. A vari´ avel resposta Status (Estado do Doente) ´ e uma vari´ avel bin´ aria, que pode tomar dois valores: 0 se o doente recuperou, e 1 se o doente n˜ ao recuperou. A base de dados ´ e ainda constitu´ ıda por quatro vari´ aveis: Idade,Sexo,Nacionalidade eTransmiss˜ao que s˜ ao vari´ aveis explicativas do modelo de regress˜ ao. Na Tabela 5.1 est´ a apresentada a descric¸ ˜ ao das vari´ aveis. Tabela 5.1: Vari´ aveis em Estudo Vari´avel Descric¸˜ao Status A vari´ avel indica se o doente recuperou ou n˜ ao; Idade A vari´ avel representa a idade dos doentes; Sexo A vari´ avel representa o sexo dos doentes; Nacionalidade A vari´ avel representa a nacionalidade dos doentes; Transmiss˜ao A vari´ avel representa o local de transmiss˜ ao da doenc¸a. A an´ alise explorat´ oria tem como objetivo obter informac¸˜ ao proveniente dos dados a tratar. Para uma melhor compreens˜ ao das vari´ aveis qualitativas iremos utilizar o gr´ afico de barras. Na descric¸˜ ao da vari´ avel quantitativa cont´ ınua ir´ a ser apresentada o 35 histograma e caixa com bigode Figura 5.1: Histograma e diagrama em caixa de Bigodes para a vari´ avel Idade A Figura 5.1 sugere que a vari´ avel idade tem distribuic¸˜ ao enviesada ` a esquerda. Aplicou-seo teste de Shapiro Wilk para verificar se a vari´ avelIdade segue uma distribuic¸˜ ao Normal e obteve-se uma estat´ ıstica de teste de 0,9750 e o valor de prova de 0,0002, rejeitando-se a hip´ otese nula, ao n´ ıvel de significˆ ancia de 5%. Ou seja, h´ a evidˆ encia estat´ ıstica que a vari´ avel Idade n˜ ao segue uma distribuic¸˜ ao Normal. A caixa com bigode sugere que 75% dos doentes infetados com o COVID-19 est˜ ao entre as idade 13 e 75 anos. Figura 5.2: Gr´ afico de barras para a vari´ avel Nacionalidade eTransmiss˜ao 36 Na Figura 5.2 o gr´ afico ` a esquerda indica que o maior n´ umero de doentes ´ e de nacionalidade Filipina. O gr´ afico ` a direita podemos observar que o maior n´ umero de doentes (117) teve a doenc¸a por transmiss˜ ao local. Figura 5.3: Gr´ afico de barras para a vari´ avel Sexo eStatus Na Figura 5.3 apresenta a distribuic¸˜ ao dos doentes recuperados ou n˜ ao da COVID19 nas Filipinas a distribuic¸˜ ao dos doentes segundo o g´ enero. Os doentes que foram mais infectados s˜ ao do sexo masculino e h´ a um maior n´ umero de doentes n˜ ao recuperados. Associac¸˜ao entre a vari´avel resposta e a Idade Para verificar a existˆ encia de diferenc¸as significativas entre as idade dos dois grupos de doentes (recuperados e n˜ ao recuperados), aplica-se o teste de MannWhitney, uma vez que o pressuposto de Normalidade n˜ ao foi verificado. O objectivo do teste ´ e o de avaliar a igualdade das medianas das idades dos dois grupos de doentes. As hip´ oteses a testar s˜ ao: H0: A mediana das idades para os doentes recuperados ´ e igual a mediana das idades para os doentes n˜ ao recuperados. H1: A mediana das idades para os doentes recuperados ´ e diferente a mediana das 37 idades para os doentes n˜ ao recuperados. Na Tabela 5.2 apresenta-se a distribuic¸ ˜ ao da idade dos doentes recuperados e n˜ ao recuperados. Tabela 5.2: Distribuic¸˜ ao da idade entre doentes Recuperado e n˜ ao Recuperado Idade Recuperado N˜ ao Recuperado M´ edia 48 68 Mediana 46 69 Desvio Padr˜ ao 17 12 M´ aximo 88 89 M´ ınimo 13 34 Em relac¸˜ ao aos doentes recuperados, a m´ edia da idade ´ e 48, com desvio padr˜ ao 17, a mediana das idade ´ e 46, a idade m´ ınima ´ e 13, e a idade m´ axima ´ e 88. Em relac¸ ˜ ao aos doentes n˜ ao recuperados, a m´ edia da idade ´ e 68, com desvio padr˜ ao 12, a mediana das idade ´ e 69, a idade m´ ınima ´ e 34, e a idade m´ axima ´ e 89. Aplicando o teste n˜ ao param´ etrico MannWhitney, obtˆ em-se a estat´ ıstica de teste 10296 e o valor de prova ´ e 0,0001. Conclui-se que h´ a evidencias estat´ ısticas para afirmar que existem diferenc¸as significativas entre as idades dos dois grupo de doentes. Associac¸˜ao entre a vari´avel resposta e as vari´aveis explicativas categ´oricas Uma tabela de contingˆ encia ´ e uma tabela de tabulac¸˜ ao cruzada de duas ou mais vari´ aveis aleat´ orias, normalmente qualitativas. O objetivo principal da an´ alise da tabela de contingˆ encia ´ e averiguar se existe ou n˜ ao alguma relac¸˜ ao entre as vari´ aveis aleat´ orias de qualquer tipo que se representam agrupados numa tabela de contingˆ encia. Para averiguar a existˆ encia dessas relac¸ ˜ oes pode realizar-se o teste de independˆ encia de Qui-quadrado. Este teste compara as frequˆ encias dos valores observados com as frequˆ encias dos valores esperados das diferentes categorias de uma vari´ avel aleat´ oria e a hip´ otese nula ´ e rejeitada quando o valor da estat´ ıstica de teste for maior que o valor cr´ ıtico da 38 distribuic¸˜ ao Qui-quadrado. Este teste n˜ ao deve ser utilizado se mais do que 20% das frequˆ encias esperadas, sob a hip´ otese nula, forem inferiores a 5 ou se algumas delas for igual 0. As hip´ oteses a testar s˜ ao: H0: N˜ ao h´ a associac¸˜ ao entre as duas vari´ aveis H1: H´ a associac¸˜ ao entre as duas vari´ aveis Para testar a hip´ otese nula de que n˜ ao existe associac¸˜ ao entre as duas vari´ aveis, usamos a seguinte estat´ ıstica de teste X2= r X i=1 c X j=1 =(nij −eij)2 eij ∼χ2 (r−1)(c−1) onde r ´ e n´ umero de linhas, c´ eon´ umero de colunas da tabela de contingˆ encia, nij representa a frequˆ encia observada na c´ elula (i, j), e eij representa a frequˆ encia esperada na c´ elula (i, j) que ´ e estimada por eij =ti×tj ta onde titotal de linha i, tjtotal de coluna j e tatotal da amostra. Nas Tabelas 5.3, 5.4 e 5.5 est˜ ao apresentados as frequˆ encias observadas dos pacientes da amostra, recuperados e n˜ ao recuperados da COVID-19 em cada uma das categorias das covari´ aveis utilizadas neste estudo. Quanto maior for a diferenc¸a entre as frequˆ encias observadas e as frequˆ encia esperadas, maior ser´ a a associac¸˜ ao entre as vari´ aveis. Tabela 5.3: Frequˆ encia da vari´ avel Status segundo a transmiss˜ao Status Importado Local Total Recuperado 19 31 50 N˜ ao Recuperado 7 86 93 Total 26 117 143 39 Tabela 5.4: Frequˆ encia da vari´ avel Status segundo o Sexo Status Feminino Masculino Total Recuperado 15 35 50 N˜ ao Recuperado 27 66 93 Total 42 101 143 Tabela 5.5: Frequˆ encia da vari´ avel Status segundo a Nacionalidade Status Americana Inglesa Chinesa Tawainesa Filipina DescoTotal nhecida Recuperado 1 0 2 1 46 0 50 N˜ ao Recuperado 2 2 1 0 81 7 93 Total 3 2 3 1 127 7 143 Na Tabela 5.6 apresentam-se os valores da estat´ ıstica de teste e os respetivos valores de prova do teste de independˆ encia de Qui-quadrado entre as vari´ aveis explicativas e a vari´ avel resposta. Na base de dados em estudo, h´ a evidˆ encia estat´ ıstica que existe uma associac¸˜ ao significativa entre a vari´ avel resposta (Status) e a vari´ avel Transmiss˜ao e que n˜ ao existe associac¸˜ ao significativa com as vari´ aveis Nacionalidade eSexo, ao n´ ıvel de significˆ ancia de 5%. Tabela 5.6: Teste de independˆ encia de Qui-quadrado entre as vari´ aveis explicativas e a vari´ avel resposta Vari´ aveis Estat´ ıstica de teste (X2) valor-p Graus de liberdade Transmiss˜ao 18,302 <0,001 1 Nacionalidade 8,116 0,152 5 Sexo 0,098 0,754 1 40 5.1 Estimac¸˜ao do modelo Este modelo foi desenvolvido com objectivo de estimar a probabilidade de um determinado doente n˜ ao recuperar da COVID-19 recorrendo-se a Regress˜ ao Log´ ıstica. Inicialmente ajustou-se um modelo de Regress˜ ao Log´ ıstica simples a cada uma das var´ aveis explicativas, com o objetivo de estudar a importˆ ancia de cada vari´ avel explicativa tem para a vari´ avel resposta, a Tabela 5.7 esta a Regress˜ ao Log´ ıstica simples. Tabela 5.7: Modelo de Regress˜ ao Log´ ıstica simples Vari´ aveis Estimativas Odds Intervalo de Desvio Teste Valor-p explicativas dos ratios confianc¸a padr˜ ao Wald coeficientes (OR) (95% OR) Constante 4,626 102 (2,94 ; 6,59 ) 0,926 4,997 0,001 Idade -0,088 0,92 ( -0,06; -0,12) 0,015 -5,743 <0,001 Constante -0,485 0,61 (-1,13 ;0,13 ) 0,317 -1,528 0,121 Sexo Masculino -0,193 0,82 (-0,94; 0,56) 0,382 -0,506 0,613 Constante 17,570 0,01 (0,04 ; 21,96 ) 3956 0,004 0,996 Nacionalidade Am´erica -18,260 1,27 (0,00 ; 0,00) 3956 -0,005 0,996 Inglesa -35,130 0,00 (0,00 ; 1,24) 4845 -0,007 0,994 Chinesa -16,870 0,01 (-0,01 ; 9,95) 3956 -0,004 0,997 Filipina -18,130 0,06 (-0,04 ; 1,81) 3956 -0,005 0,996 Desconhecido -35,130 0,00 (0,00 ; 2,66) 4229 -0,008 0,993 Constante 0,998 2,71 (0,17 ; 1,94 ) 0,442 2,258 0,024 Transmiss˜ao Local -2,019 0,13 (-3,04 ;-1,09) 0,489 -4,126 0,001 De seguida procedeu-se ` a construc¸˜ ao dos modelos de regress˜ ao log´ ıstica m´ ultipla. Na selec¸˜ ao das vari´ aveis usa-se o m´ etodo de selec¸˜ ao backward, stepwise e forward . Modelo inicial com todas as vari´aveis explicativas (Modelo Completo) Status ∼Bernoulli(p), onde p ´ e a probabilidade de um doente n˜ ao recuperar da COVID-19. 41 log p 1−p=β0+β1×Idade +β2×Sexo +β3×Nacionalidade+β4×Nacionalidade+ β5×Nacionalidade+β6×Nacionalidade+β7×Nacionalidade+β8×Transmiss˜ao. Tabela 5.8: Modelo de Regress˜ ao Log´ ıstica inicial (Modelo Completo) Vari´ aveis Estimativas Odds Intervalo de Desvio Teste Valor-p explicativas dos ratios confianc¸a padr˜ ao Wald coeficientes (OR) (95% OR) Constante 7,074 0,01 (0,04 ; 21,96 ) 2,040 3,466 0,005 Idade -0,088 0,09 ( 0,09 ; 0.88) 0,017 -5,011 <0,001 Sexo Masculino -0,587 0,04 (0,15 ; 1,20) 0,524 -1,118 0,264 Nacionalidade Am´erica 16,358 1,27 (0,00 ; 0,00) 3956 0,004 0,996 Inglesa -17,377 0,00 (0,00 ; 1,24) 2413 -0,007 0,994 Chinesa -1,875 0,01 (0,01 ; 9,95) 1,968 -0,952 0,341 Filipina -0,473 0,06 (0,04 ; 1,81) 1,477 -0,321 0,748 Desconhecido -16,477 0,00 (0,00 ; 2,66) 1329 -0,012 0,991 Transmiss˜ao Local -1,823 0,01 (0,03 ; 0,05) 0,668 -2,727 0,006 Na Tabela 5.8 est˜ ao apresentados os valores estimados dos coeficientes, os desvios padr˜ ao, a estat´ ıstica de teste Wald e os valores de prova. Pode-se verificar que as vari´ aveis explicativas Idade eTransmiss˜ao s˜ ao estatisticamente significativas, evidenciando que existe associac¸˜ ao com a vari´ avel resposta. Aplicando este m´ etodo de selec¸˜ ao o modelo final Modelo 1 Status ∼Bernoulli(P) log p 1−p=β0+β1×Idade +β2×Transmiss˜ao Selec¸˜ao Forward usando a estat´ıstica AIC Este m´ etodo inicia com o modelo sem vari´ aveis explicativas adicionando cada vari´ avel para averiguar como influˆ encia a vari´ avel resposta, baseando-se na estat´ ıstica AIC. O modelo selecionado usando este m´ etodo ´ e Modelo 2 42 Status ∼Bernoulli(P) log p 1−p=β0+β1×Idade +β2×Transmiss˜ao Selec¸˜ao Both usando a estat´ıstica AIC Este m´ etodo ´ e uma combinac¸˜ ao dos dois m´ etodos antecedentes e consiste na remoc¸˜ ao e inclus˜ ao das vari´ aveis baseando-se na estat´ ıstica AIC. O modelo selecionado usando este crit´ erio ´ e Modelo 3 Status ∼Bernoulli(p) log p 1−p=β0+β1×Idade +β2×Transmiss˜ao Podemos verificar que o modelo final ´ e o mesmo para todos os m´ etodos de selec¸˜ ao das covari´ aveis. Para confirmar que o modelo selecionado se ajusta melhor, compara-se o valor do AIC e a func¸˜ ao desvio do modelo final com o modelo nulo. A Tabela 5.7 apresenta os resultado da comparac¸˜ ao. Da Tabela 5.9 observa-se que o valor do AIC e do desvio do modelo final ´ e menor, do que o modelo nulo, indicando um melhor ajustamento. Tabela 5.9: Comparac¸˜ ao entre os Modelos AIC Desvio Modelo Nulo 187,11 185,11 Modelo Final 132,05 126,05 An´alise de res´ıduos 43 Figura 5.8: Histograma e caixa com Bigodes para a vari´ avel Testes Figura 5.9: Histograma e caixa com Bigodes para a vari´ avel Casos 50 Figura 5.10: Histograma e caixa com Bigodes para a vari´ avel GTSP (Total de Gastos na sa´ ude por pessoa) Da Figura 5.6 at´ e a Figura 5.10, apresentam-se os Histograma e as caixas de bigode das vari´ aveis explicativas dos modelos. Os gr´ aficos sugerem que estas vari´ aveis tˆ em distribuic¸ ˜ oes enviesadas ` a direita, ou enviesamento positivo, uma vez que se apresentam concentradas no lado esquerdo com uma larga cauda para a direita. Al´ em disso pode-se observar a presenc¸a de observac¸ ˜ oes outliers. 5.2.1 Associac¸˜ao entre as variav´eis Nesta secc¸˜ ao usaremos o coeficiente de correlac¸˜ ao de Spearman para estudar a existˆ encia da correlac¸˜ ao entre a vari´ avel dependente com cada uma das vari´ aveis independentes. Na Tabela 5.14 mostra a correlac¸ ˜ ao de Spearman entre a vari´ aveis. Nestes resultados, a correlac¸˜ ao de Spearman entre a vari´ avel resposta Recuperado e as vari´ aveis explicativas Mortes, Casos, Testes, Populac¸˜ ao, Ativos, Expectativa e GTSP para o n´ ıvel de significˆ ancia de 5% indica que existe uma associac¸˜ ao positiva entre as vari´ aveis. Por exemplo, quando a expectativa de vida do pais aumenta, o n´ umero de recuperados aumenta. 51 Tabela 5.14: Tabela de correlac¸ ˜ ao de Spearman entre as vari´ aveis Vari´aveis Casos 1 Mortes 0,92 1 Recuperado 0,97 0,91 1 Ativos 0,89 0,83 0,82 1 Testes 0,74 0,67 0,78 0,58 1 Populac¸˜ao 0,57 0,58 0,56 0,53 0,57 1 Expectativa 0,27 0,26 0,32 0,10 0,49 -0,11 1 IDS -0,15 -0,24 -0,21 -0,01 -0,31 -0,04 -0,37 1 GTSP 0,16 0,10 0,19 0,13 0,15 0,06 0,09 -0,08 1 Dado que se tratam de dados de contagem recorre-se o Modelo de Regress˜ ao de Poisson no ajustamento do modelo. Modelo Inicial Recuperados ∼P(µ) log( µ casos)=β0+β1×Ativos +β2×Mortes +β3×Testes +β4×IDS +β5×populac¸ ˜ao + β6×Expectativa+β7×GTSP Tabela 5.15: Modelo de Regress˜ ao de Poisson Vari´ aveis Estimativas Desvio Teste Valor-p explicativas dos padr˜ ao Wald coeficientes Constante -0,001 0,009 -46,79 0,001 Ativos -0,006 0,005 -108,7 0,001 Mortes 0,007 0,001 10,34 0,001 Testes 0,001 0,001 99,62 0,001 IDS -0,002 0,001 -6,971 0,001 Expectativa 0,003 0,001 9,799 0,001 GTSP 0,001 0,003 62,33 0,001 Na Tabela 5.15 est˜ ao apresentados as estimativas dos coeficientes do modelo, os valores da estat´ ıstica de Wald e os respetivos valores de prova indicam que todos os coeficientes associados a cada vari´ avel explicativa s˜ ao estatisticamente significativos. O parˆ ametro de dispers˜ ao ˆ φ=239 o que evidencia dispers˜ ao dos dados. 52 Analisando da Figura 5.11 referente ao gr´ afico Normal de Probabilidade do Modelo de Regress˜ ao de Poisson ajustado verifica-se que o modelo n˜ ao traduz um bom ajustamento aos dados. Figura 5.11: Gr´ afico normal de probabilidade referente ao modelo de poisson Mediante este problema vai-se ajustar aos dados um Modelo de Regress˜ ao Binomial Negativo. Regress˜ao Binomial Negativa O ajustamento aos dados foi realizado de forma an´ aloga ao modelo Regress˜ ao de Poisson. Comec¸ou-se por se ajustar o modelo inicial, com todas as vari´ aveis. Na Tabela 5.13 apresentam-se as estimativas dos coeficientes, desvio padr˜ ao, teste Wald e os respetivos valor de prova. Modelo inicial log( µ casos)=β0+β1×Ativos +β2×Mortes +β3×Testes +β4×IDS +β5×Populac¸ ˜ao + β6×Expectativa +β7×GTSP 53 Tabela 5.16: Modelo de Regress˜ ao Binomial Negativa modelo inicial Vari´ aveis Estimativas Desvio Teste Valor-p explicativas dos padr˜ ao Wald coeficientes Constante -1,706 0,001 -4,148 0,003 Ativos -0,001 0,006 -0,943 0,345 Mortes -0,004 0,006 -0,067 0,946 Testes 0,001 0,009 0,054 0,957 IDS 0,005 0,004 -6,971 0,962 Populac¸˜ao 0,003 0,001 0,625 0,532 Expectativa 0,002 0,003 3,078 0,002 GTSP 0,005 0,002 1,281 0,201 Para o n´ ıvel de significˆ ancia de 5% , os valores da estat´ ıstica de teste e os respetivos valores de prova, levam a concluir que apenas a vari´ avel Expectativa ´ e significativa. Modelo de selec¸˜ao Na selec¸˜ ao das vari´ aveis iniciou-se com o m´ etodo Backward usando a estat´ ıstica AIC. Neste m´ etodo comec¸a-se com modelo completo e vai-se retirando cada vari´ avel baseando-se na estat´ ıstica AIC, isto ´ e, constr´ oi-se um novo modelo retirando cada vari´ avel explicativa e escolhe-se o modelo com o menor valor de AIC. O processo termina quando ao retirar-se uma vari´ avel, o valor do AIC aumenta. Selec¸˜ao Backward usando a estat´ıstica AIC Modelo 1: log( µ casos)=β0+β1×Expectativa. Selec¸˜ao Forward usando a estat´ıstica AIC Modelo 2: log( µ casos)=β0+β1×Expectativa . Selec¸˜ao Both usando a estat´ıstica AIC Modelo 3: log( µ casos)=β0+β1×Expectativa. Ao comparar os resultados dos m´ etodos de selec¸˜ ao verifica-se que o modelo final ´ e 54 o mesmo. Tabela 5.17: Comparac¸˜ ao entre os Modelos AIC Desvio Modelo inicial 289033 287650 Modelo Final 2400.4 133.72 Na Tabela 5.17 compara-se o modelo inicial com o modelo final e verifica-se que o modelo final teve um menor valor de AIC e um menor valor da func¸˜ ao Desvio em relac¸˜ ao ao modelo inicial. As estimativas dos coeficientes do modelo, do desvio padr˜ ao, da estat´ ıstica de teste de Wald e respetivos valores provas s˜ ao apresentados na tabela 5.18. Tabela 5.18: Modelo Final de Regress˜ ao Binomial Negativa Vari´ aveis Estimativas Desvio Teste Valor-p explicativas dos padr˜ ao Wald coeficientes Constante -1,694 0,405 -4,178 0,001 Expectativa 0,017 0,005 3,189 0,002 Na Figura 5.12 est´ a representado o gr´ afico Normal de probabilidade para o modelo final de regress˜ ao Binomial Negativa ajustado. Analisando a Figura ´ e evidente que o modelo Binomial Negativa ´ e mais adequado para explicar a variabilidade dos dados do que o modelo de Regress˜ ao de Poisson. No entanto, a qualidade de ajustamento aos dados deve ser melhorado. V´ arias tentativas foram realizadas para obter um melhor ajustamento aos dados mas n˜ ao se obteve resultados positivos. 55 Figura 5.12: Gr´ afico Normal de probabilidade do modelo Binomial Negativa Na Figura 5.13 est´ a apresentada os gr´ aficos da an´ alise de res´ ıduos. Estes gr´ aficos permitem verificar a qualidade do modelo ajustado com a Regress˜ ao Binomial Negativa. Da observac¸˜ ao destes gr´ aficos, identificam-se observac¸ ˜ oes outliers. No entanto, o modelo n˜ ao sofre alterac¸ ˜ ao significativa quando se eliminam essas observac¸ ˜ oes. Figura 5.13: Gr´ afico da an´ alise de res´ ıduos do modelo de regress˜ ao Binomial Negativa 56 Interpretac¸˜ao do modelo ajustado da Regress˜ao Binomial Negativa Para o aumento de uma unidade na esperanc¸a de vida do pa´ ıs, a taxa de doentes recuperados da COVID-19 aumenta 1,017% como ´ e visto na Tabela 5.18. Para comparar a qualidade de ajustamento dos dois modelo, o modelo de Poisson e o modelo de Binomial Negativa, efetua-se o teste Vuong. Tabela 5.19: Teste Vuong entre os modelos de Regress˜ ao Teste Vuong Binomial Negativa e Poisson Estat´ ıstica 286626,128 Valor de prova <0,0001 Ajustamento prefer´ ıvel Binomial Negativa Os resultados apresentados na Tabela 5.19 indicam que o modelo Binomial Negativa ´ e prefer´ ıvel ao modelo de Poisson. 57 Cap´ıtulo 6 Conclus˜ao No trabalho apresentado foram estudados os Modelos Lineares Generalizados em particular o Modelo de Regress˜ ao Log´ ıstica, o Modelo de Regress˜ ao de Poisson e o Modelo de Regress˜ ao Binomial Negativa. Inicialmente desenvolveram-se modelos estat´ ısticos para identificar os principais fatores associados ` a recuperac¸˜ ao dos doentes com a SARS-CoV-2, utilizando o Modelo de Regress˜ ao Log´ ıstica. Estes dados referem-se ao n´ umero de doentes contaminados com o COVID-19 nas Filipinas no mˆ es de fevereiro de 2020. Uma an´ alise explorat´ oria dos dados foi realizada, pois ela pode sugerir se existe uma associac¸˜ ao entre a vari´ avel resposta e as vari´ aveis explicativas. No modelo inicialmente ajustado foi utilizado a distribuic¸˜ ao binomial onde foram inclu´ ıdas as vari´ aveis explicativas Idade,Sexo,Nacionalidade,Transmiss˜ao e a vari´ avel resposta Status (estado do doente) para saber se o doente recuperou ou n˜ ao recuperou da doenc¸a da COVID-19. Atrav´ es deste notou-se que existe uma associac¸˜ ao significativa entre a vari´ avel resposta (Status) com a vari´ avel Idade e a vari´ avel Transmiss˜ao e n˜ ao existe associac¸˜ ao significativa com as vari´ aveis Nacionalidade eSexo, ao n´ ıvel de significˆ ancia de 5%. Conclu´ ıu-se que a chance de n˜ ao recuperar aumenta com a idade em cerca de 9% com aumento de uma unidade na idade. Quanto ` a vari´ avel transmiss˜ ao, verifica-se que a chance de um paciente n˜ ao recuperar ´ e 5,12 vezes maior em transmiss˜ ao local em relac¸˜ ao a transmiss˜ ao exportada. Numa segunda abordagem, desenvolveram-se modelos estat´ ısticos para identificar que influencia o n´ umero de doentes recuperados da COVID-19. 58 Ajustou-se o modelo de regress˜ ao de Poisson onde se verificou que existem sobredispers˜ ao, raz˜ ao pela qual foi utilizada o modelo de Regress˜ ao Binomial Negativa e verificou-se que este modelo era prefer´ ıvel em comparac¸˜ ao ao modelo anterior. As vari´ aveis explicativas utilizadas foram Casos,Mortes,Testes,Ativos,Cr´ıtico, Populac¸˜ao eExpectativa e a vari´ avel resposta ´ eTotal de Recuperado. Os resultados da an´ alise mostraram que quanto maior a expectativa de vida no pa´ ıs maior o n´ umero total de doentes recuperados. Para trabalho futuro sugerimos a aplicac¸˜ ao de outras metodologias para modelar dados de contagem. Outrossim, seria interessante continuar este trabalho tendo j´ a acesso a dados mais completos e atuais sobre a doenc¸a COVID-19. 59