Full text
Universidade do Minho Escola de Engenharia Afonso Augusto de Paula Lobo Sistemas para a Inteligência do Negócio Adaptativos em SaúdeGestão de doentes fevereiro 2022 Sistemas para a Inteligência do Negócio Adaptativos em SaúdeGestão de doentes UMinho | 2022 Afonso Augusto de Paula Lobo
Afonso Augusto de Paula Lobo A83946 Sistemas para a Inteligência do Negócio Adaptativos em SaúdeGestão de doentes fevereiro 2022 Dissertação de Mestrado Mestrado Integrado em Engenharia e Gestão de Sistemas de Informação Trabalho efetuado sob a orientação do Professor Doutor Manuel Filipe Santos Doutor Hugo Daniel Abreu Peixoto
i DIREITOS DE AUTOR E CONDIÇÕES DE UTILIZAÇÃO DO TRABALHO POR TERCEIROS Este é um trabalho académico que pode ser utilizado por terceiros desde que respeitadas as regras e boas práticas internacionalmente aceites, no que concerne aos direitos de autor e direitos conexos. Assim, o presente trabalho pode ser utilizado nos termos previstos na licença abaixo indicada. Caso o utilizador necessite de permissão para poder fazer um uso do trabalho em condições não previstas no licenciamento indicado, deverá contactar o autor, através do RepositóriUM da Universidade do Minho. Licença concedida aos utilizadores deste trabalho https://creativecommons.org/licenses/by-nc-nd/4.0/
ii DECLARAÇÃO DE INTEGRIDADE Declaro ter atuado com integridade na elaboração do presente trabalho académico e confirmo que não recorri à prática de plágio nem a qualquer forma de utilização indevida ou falsificação de informações ou resultados em nenhuma das etapas conducente à sua elaboração. Mais declaro que conheço e que respeitei o Código de Conduta Ética da Universidade do Minho.
iii AGRADECIMENTOS Os meus agradecimentos vão para todos aqueles que de alguma forma contribuíram para que conseguisse concluir esta etapa com sucesso. Gostava de agradecer de uma forma especial ao Professor Doutor Manuel Filipe Vieira Torres dos Santos que no papel orientador desta dissertação sempre se mostrou disponível a ajudar com todas as questões burocráticas, logística e desenvolvimento. Queria agradecer também o seu voto de confiança que me permitiu realizar a dissertação no tema que eu pretendia. Deixo também um agradecimento especial ao Doutor Hugo Daniel Abreu Peixoto que no papel de coorientador sempre se mostrou disponível para resolução das questões técnicas e de investigação. Agradeço de forma sentida a toda a minha família e amigos que sempre me apoiaram e motivaram na realização deste projeto, foram sempre um suporte em todos os momentos do meu percurso académico.
iv RESUMO Sistemas para a Inteligência do Negócio Adaptativos em SaúdeGestão de doentes A má planificação dos recursos nas entidades hospitalares consiste num fator comprometedor da qualidade do serviço prestado e da saúde financeira dos mesmos. Tal acontece devido a uma falta de planos que implementem uma boa gestão e previsão do fluxo de doente tendo uma otimização da alocação dos recursos condizente, permitindo melhorar a eficiência de serviço e uma minimização nos seus custos. Nesta dissertação o projeto consiste na análise dos dados relativos a pacientes, suas admissões e recursos alocados na prestação de serviço do Centro Hospitalar do Tâmega e Sousa. Com uma análise posterior, são definidos e implementados dois tipos de modelos, primeiramente um conjunto de modelos de Machine Learning que nos permitam prever o fluxo temporal de admissão dos pacientes, seguido da implementação de modelos de otimização lógica para a gestão de recursos, mais concretamente a alocação ótima das camas que responda eficientemente às necessidades da unidade hospitalar tendo em consta o fluxo de doentes previsto. Após a implementação bem-sucedida destes modelos, é realizada uma integração dos mesmos numa plataforma ABI (Adaptative Business Intelligence ) permitindo a gestão e otimização em tempo real. Palavras chave: Fluxo de doentes; Gestão de Recursos; Machine Learning ; Otimização; Previsão.
v ABSTRACT Adaptive Business Intelligence in Healthcare – Patients Management Poor planning of hospital resources is a compromising factor for the quality of the service provided and their financial health. This happens due to a lack of plans that implement good management and forecast of patient flow, having a consistent optimization of the allocation of resources, allowing to improve the efficiency of the service and minimization of its costs. In this dissertation, the project consists of the analysis of data related to patients, their admissions, and resources allocated in the service provision of the Tâmega e Sousa Hospital Center. With further analysis, two types of models are defined and implemented, firstly a set of Machine Learning models that allow us to predict the temporal flow of patient admissions, followed by the implementation of logical optimization models for resource management, more specifically the optimal allocation of beds that efficiently meet the needs of the hospital unit considering the expected flow of patients. After the successful implementation of these models, they are integrated into an ABI platform (Adaptive Business Intelligence) allowing this management and optimization in real-time. Keywords: Forecast; Machine Learning; Optimization; Patient Flow; Resource Management
vi ÍNDICE DECLARAÇÃO DE INTEGRIDADE............................................................................................................. ii Agradecimentos ..................................................................................................................................... iii Resumo ................................................................................................................................................. iv Abstract .................................................................................................................................................. v Lista de abreviaturas/Siglas ................................................................................................................. viii Lista de figuras ...................................................................................................................................... ix Lista de tabelas ....................................................................................................................................... x 1. Introdução ...................................................................................................................................... 1 1.1 Enquadramento ...................................................................................................................... 1 1.2 Motivações .............................................................................................................................. 2 1.2.1 Motivação Técnica ........................................................................................................... 2 1.2.2 Motivação Pessoal ........................................................................................................... 2 1.3 Objetivos e Resultados Esperados .......................................................................................... 3 1.4 Organização do Documento .................................................................................................... 4 2. Metodologias, Arquiteturas e Ferramentas ..................................................................................... 5 2.1 Metodologia de Investigação - DSR ......................................................................................... 5 2.2 Metodologia de Desenvolvimento – CRISP DM ....................................................................... 7 2.3 Ligação e Cruzamento das metodologias ................................................................................ 9 2.4 Arquitetura ABI ..................................................................................................................... 10 2.5 Ferramentas .............................................................................................................................. 13 3. Conceitos base e Estado da arte .................................................................................................. 14 3.1 Estratégia de Pesquisa Bibliográfica ..................................................................................... 14 3.2 Data Mining .......................................................................................................................... 14
3 1.3 Objetivos e Resultados Esperados Tendo como questão de investigação formulada para este projeto – “Até que ponto é possível incrementar a eficiência da gestão de camas no internamento hospitalar com recurso a técnicas de inteligência artificial?”, os objetivos e resultados esperados na realização deste projeto de dissertação decorrem no sentido de promover o respetivo aumento da eficiência no planeamento e gestão de camas. Para tal torna-se necessário a investigação e definição de modelos preditivos de Machine Learning que permitam prever o fluxo dos doentes, a definição do conjunto de medidas de eficiência para avaliar cenários de disponibilidade de camas e afetação de recursos e a definição de modelos de otimização da disponibilidade de camas e afetação dos recursos humanos tendo como base os modelos preditivos definidos, os recursos disponíveis e a programação de cirurgias. De modo atingir os objetivos esperados e responder ao problema proposto é necessário, numa primeira fase, a implementação dos modelos preditivos, com o devido tratamento e dedução de dados relativos ao fluxo de doentes no hospital. Com os resultados obtidos nestes modelos, decorre a implementação de um modelo de otimização que tem como base os mesmo resultados, os recursos disponíveis e as cirurgias programadas. Após a definição e implementação destes modelos prossegue a implementação dos mesmos num sistema ABI que permita, em tempo real, a otimização da gestão do fluxo de doentes e do planeamento das camas disponíveis. Em suma o propósito deste trabalho é o de promover a implementação de um sistema de ABI que permita, em tempo real, otimizar a gestão e planeamento de camas e do fluxo de doentes alguns objetivos foram definidos: • A definição de um conjunto de modelos preditivos sobre o fluxo dos doentes; • A definição de um conjunto de medidas de eficiência para avaliar cenários de disponibilidade de camas e afetação de recursos; • A definição de modelos de otimização da disponibilidade de camas e afetação de recursos humanos com base nos modelos preditivos desenvolvidos nos pontos anterior, os recursos disponíveis e na programação de cirurgias.
4 1.4 Organização do Documento Este documento apresenta-se divido em quatro grandes capítulos de modo a abordar cada tópico de forma separada e detalhada facilitando a perceção do mesmo e apresentado todos os conteúdos relevantes para a Dissertação. O capitulo 1 foca na introdução ao tema e ao problema da dissertação, identificando o problema e motivação do mesmo, os objetivos propostos para sua resolução, resultados esperados e quais as metodologias utilizadas para desenvolvimento deste projeto, uma relativa ao processo de investigação e outra relativa aos processos e técnicas de Machine Learning e Data Mining . No capítulo 2 é introduzido e desenvolvido o Estado da Arte, onde são explicados todos os conceitos necessários a serem percebidos para a execução da dissertação. Começando com uma introdução ao conceito de Data Mining, quais as suas formas, aplicações e o seu contributo no projeto, seguindo-se para a componente de Machine Learning e abordando as principais técnicas e modelos constituintes, quer de previsão quer de otimização, comparando os vários existentes não de forma generalizadas, mas também aplicada ao contexto do problema. No terceiro capítulo é apresentado o planeamento do trabalho a ser desenvolvido no âmbito da dissertação, assim como o prazo de entrega dos artefactos a serem produzidos. O quarto e último capítulo é apenas destinado às referências bibliográficas utilizadas na realização do documento.
5 2. METODOLOGIAS, ARQUITETURAS E FERRAMENTAS Na secção seguinte são abordadas as metodologias a ser utilizadas para investigação e desenvolvimento do projeto, a arquitetura constituinte e as ferramentas a utilizar. 2.1 Metodologia de Investigação - DSR A metodologia de investigação recomendada e utilizada no desenvolvimento deste projeto foi a Design Science Research Methodology for Information Systems realizada por Peffers, Tuunanen, Rothenberger e Chatteriee em 2007. Esta foi desenvolvida com o intuito de criar uma “framework” para resolução e pesquisa de problemas correntemente investigados. São distinguidas seis principais iterações: • Problem identification and motivation : Fase inicial de identificação do problema a ser investigado e respetiva solução. No projeto de dissertação em questão consiste na integração a uma plataforma de ABI ( Adaptative Business Intelligence ) de modelos preditivos relativos ao fluxo e admissão dos doentes num hospital aliado à criação de modelos de otimização de camas e restantes recursos baseados nas previsões efetuadas. Permitindo assim estimar o tempo de chegada e internamento dos pacientes, ajustando as necessidades do hospital ao mesmo. Aumentado a eficiência da execução nos processos e minimizando os custos. • Define the objetives for a solution : Aqui são definidos os objetivos a que a solução traçada terá de responder. Neste caso concreto passará pelos modelos de previsão do fluxo de doentes aliado aos modelos de otimização de recursos. Para tal é necessário a condução de um estudo investigacional acerca dos vários modelos e técnicas, aplicadas ao contexto, de ML existentes, quer a nível de previsão, quer a nível de otimização. • Design and development : Nesta fase é esperado o planeamento de um artefacto representativo do projeto em questão seja sob forma de relatório, paper , modelo ou um pedaço tecnologia sob forma de software / hardware. Relativamente ao projeto da
6 dissertação serão então correspondidos os modelos de Machine Learning de previsão de doentes e otimização de camas e recursos devidamente implementados. • Demonstration : Demonstração devida, do artefacto desenvolvido que dará as respostas ao problema proposto. • Evaluation: Fase de avaliação da solução final desenvolvida, a partir das devidas métricas aplicadas ao contexto. • Communication: Iteração final do DP ( Design Process ) que consiste na comunicação do problema, da sua devida resolução, da importância da mesma e em que medida responde aos objetivos propostos na fase inicial [1]. Figura 1 - DSRM Process Model - [1]
7 2.2 Metodologia de Desenvolvimento – CRISP DM De modo a promover o sucesso na realização e cumprimento desta dissertação e seus respetivos objetivos propostos, torna-se necessário adotar um conjunto de metodologias previamente conhecidas que sirvam como guião e direção para todas as decisões e implementações a tomar. Será por este motivo escolhida a metodologia CRISP-DM (CrossIndustry Standart Process for Data Mining), metodologia publicada em 1999 com o âmbito de auxiliar e indicar todos os processos e passos necessários para aplicação de projetos data mining . Neste modelo metodológico estão presentes quatro diferentes níveis de abstração, as fases, tarefas genéricas, tarefas especificas e instâncias dos processos [2] [3]. No nível de topo encontram-se as fases, cada fase é constituída por tarefas genéricas e abrangentes a todos os possíveis ambientes e implementações de um projeto data mining . Com o objetivo de descrever como devem ser efetuadas ações nas tarefas genéricas aplicadas a situações específicas foram constituídas as tarefas específicas. Por último as instâncias dos processos representam um conjunto de ações e decisões tomadas resultantes do desenvolvimento de um projeto data mining [3]. No primeiro e mais relevante nível de abstração são distinguidas seis diferentes fases ou iterações: Buisness-Understanding, Data Understanding, Data Preparation, Modeling, Evaluation, Deployment , contendo cada uma tarefas especificas correspondentes: Figura 2 - Fases do CRISP-DM [3]
8 Buisness Understanding , os objetivos e requisitos são definidos, perceção do tipo de problema de data mining em questão e definição dos critérios de sucesso. Data Understanding , nesta fase o foco centra-se na coleta de dados, no seu devido tratamento, exploração e descrição para determinar os atributos analisar e estudar a relação entre si. Data Preparation , responsável pelas tarefas de data cleaning , lidando com a possível má qualidade de dados e construção de novos atributos derivados a partir dos existentes, tendo em conta o modelo e objetivos de data mining. Modeling, centra-se aqui a escolha da técnica de modelação a ser utilizada, dividindo os dados em dados teste e dados de treino ou de modelo. Para a escolha acertada dos modelos é necessário ter em conta o tipo de dados disponíveis, o problema de negócio e qual será o modelo que melhor desempenhará na resolução do problema, avaliando-o segundo os critérios de avaliação de modelos. Evaluation , decorre a avaliação dos resultados obtidos, interpretados à luz dos objetivos propostos. São definidos um conjunto de ações a ser tomadas e é realizada uma revisão de todo o processo. Deployment , é a instância concreta do processo realizado, pode estar em forma de software ou um reportório final. Consiste na implementação, monitorização e manutenção do produto final [2]. A implementação e aplicação de projeto data mining seguindo a metodologia CRISP-DM é naturalmente aplicada nas diversas áreas e contextos em que se torna necessário, entre as quais se encontram, em segundo e primeiro posto na frequência de aplicação, a indústria da Educação e Investigação e a indústria da Saúde, podendo comprovar através da figura 3, resultante de um estudo realizado com o objetivo de perceber os principais domínios de aplicação do modelo CRISP-DM , pelo Christoph Schröer et al. / Procedia Computer Science [2].
9 Figura 3 - Dominíos de aplicação do CRISP-DM [4] 2.3 Ligação e Cruzamento das metodologias De maneira a facilitar o desenvolvimento do projeto de dissertação seguindo ambas as metodologias sugeridas, foi desenvolvida uma tabela demonstrativa de ligação entre as iterações do Design Science Research Methodology e as fases do CRISP-DM. Tabela 1 - Cruzamento das Metodologias CRISP-DM DSRM Business Understanding Data Understanding Data Preparation Modeling Evaluation Deployment Problem identification and motivation X
10 Define the objectives for a solution X X Design and development X X Demonstration X Evalutation X Comunication X 2.4 Arquitetura ABI Uma vez que este projeto tem como resultado a implementação dos modelos a criar no sistema ABI, a arquitetura seguida no mesmo será a arquitetura de um sistema ABI respetivo. O Sistema ABI é um sistema representado pela sua capacidade de constante adaptação aos dados e ocorrências em tempo real. Este tipo de sistemas é caracterizado por três grandes módulos: • Previsão, constituído pelos conjuntos de modelos preditivos; • Otimização, conjunto de algoritmos aplicados aos dados previstos de maneira a obter as melhores soluções para os problemas em questão;
11 • Adaptação, módulo responsável pela aprendizagem constante do sistema, pegando no output dos modelos, corrigindo erros e aprendendo à medida que as execuções são realizadas. Nas Figuras 4 a 6 abaixo podemos ver representados de forma ilustrativa o funcionamento e relação de cada um dos módulos: Figura 4 - Módulo Preditivo [5] Figura 5 - Módulo de Ótimização [5] Figura 6 - Módulo de Adaptação [5]
12 Com estes três módulos este tipo de sistemas fornece-nos várias vantagens, assim como: • Modelos de previsão baseados em resultados de Data Mining ; • Algoritmos de otimização completamente integrados com os modelos preditivos; • Módulo de adaptação que permite a evolução e aprendizagem constante e atual do sistema garantindo a sua capacidade de contextualização em diferentes cenários; • Transformação de dados em informação [6]. A arquitetura característica destes sistemas segue então uma linha de funcionamento onde conjuntos de dados em grandes quantidades são previamente preparados e analisado através das técnicas de Data Mining criando informação útil capaz de constituir um input para o módulo preditivo. Neste conjunto de dados previstos são realizadas as devidas otimizações com o instituto de chegar à melhor solução possível. Este output final é analisado pelo modulo de adaptação que corrige erros possíveis transforma outra vez este conjunto de dados num input de previsão, garantindo assim a evolução e adaptação constante dos dados e do respetivo sistema. Podemos ver representada esta arquitetura na figura 7, abaixo [7]. Figura 7 - Arquitetura de um Sistema AB I [5] A implementação destes sistemas complexos na indústria da saúde representa um grande passo na evolução e modernização dos mesmos. Com os mesmos é possível garantir uma melhor
19 Os algoritmos e problemas mais associados a este tipo de aprendizagem são os de classificação, onde o objetivo se centra na aprendizagem de um sistema de classificação presente no input fornecido e os dados representam valores categóricos. Quando estes problemas se focam na previsão de valores numéricos são associados aos mesmos, algoritmos de regressão [13]. De entre os vários algoritmos existentes aplicados nas áreas de Classificação e Regressão os mais conhecidos e aplicados são algoritmos como Linear Classifiers (Logical Regression, Support Vector Machines e Naive Bayes Classifier ), Neural Networks e Decision tree como o Random Forest [13]. Num estudo realizado pelo departamento de computer science da Cornell University, onde foram comparados todos estes principais algoritmos característicos a este tipo de aprendizagem e problemas, testados através de 11 diferentes fontes de dados e avaliados através das métricas de performance e avaliação de modelos de machine learning , foram distinguidos com indicadores de melhor performance no overall as Calibrated Boosted Trees. Random Forest foi o algoritmo com a segunda melhor performance seguida de algoritmos como, Uncalibrated Bagged Trees, Calibrated SVM’s e Uncalibrated Neural Networks . Os modelos ou algoritmos que se destacaram pela negativa na sua performance em problemas de Classificação foram modelos como, Naive Bayes, Logistic Regression, Decision Trees e Boosted Stumps (Caruana & Niculescu-Mizil, 2006). 3.4.2 Aprendizagem não supervisionada Aprendizagem não supervisionada diferencia-se da supervisionada na medida que o software não necessita de um atributo target no seu input para realizar o processo de aprendizagem automática [17]. Constitui o modelo de aprendizagem mais comum presente no cérebro humano. Os principais algoritmos constituintes deste tipo de aprendizagem centram-se no Principal Component Analysi s (PCA), técnica utilizada para reduzir o número de dimensões de um conjunto de dados, agrupando variáveis semelhantes numa só e na identificação de padrões em algoritmos como K-Means realizando Clustering num conjunto de dados sem um atributo target, sendo por sua vez um dos algoritmos mais simples e utilizados de aprendizagem não supervisionada [18].
20 Figura 9 - K-means Clustering [18] Este modelo de aprendizagem permite realizar análises preditivas e descritivas, contendo várias aplicações no mundo real na deteção de outliers nos dados, deteção de fraudes e reconhecimento facial [19]. 3.4.3 Aprendizagem por reforço Neste tipo de aprendizagem as decisões efetuadas pelo software de modo a acumular e aprender a informação que lhe é atribuída é realizada através do reforço positivo, isto é, o software pode seguir vários caminhos de modo a chegar a um objetivo de previsão, uns constituem a solução, outros não, cada vez que o software segue um “caminho” ou decide acertadamente é lhe atribuída uma recompensa, realizando assim a aprendizagem em questão. É definido assim um modelo onde a aprendizagem do agente com o meio ambiente é efetuada através da tentativa e erro em que são descobertas quais ações geram maior recompensa através da experiência, podendo tal influenciar não só o resultado e a solução final como a próxima ação a ser tomada. Os algoritmos mais utlizados neste tipo de aprendizagem são, Decision Trees, Logic Based Methods e Variable Resolution Dynamic Programming (VRDP). [20].
21 3.4.4 Modelos Preditivos de Séries Temporais A previsão de séries temporais nada mais é que a previsão de dados com base em conjuntos de registos que acontecem ao longo do tempo. Esta previsão por sua vez constitui uma ferramenta útil para prever o fluxo de pacientes nas unidades hospitalares. Ao analisar dados históricos sobre admissões, altas e transferências de pacientes, permite aos hospitais antecipar melhor a demanda futura e alocar recursos de acordo. Vários estudos e artigos científicos discutem o uso da previsão de séries temporais para o fluxo de pacientes em hospitais. Um artigo de Shruti Kaushik intitulado “AI in Healthcare: Time-Series Forecasting Using Statistical, Neural, and Ensemble Architectures ” compara o desempenho de diferentes técnicas estatísticas, neurais e de agrupamento na previsão das despesas médias semanais dos pacientes com certos medicamentos para dor. Foi descoberto no mesmo que um modelo de agrupamento combinando previsões do modelo autoregressive integrated moving average (ARIMA), do multilayer perceptron (MLP) e do long short-term memory (LSTM) superou os modelos individuais [21]. Outro estudo realizado por Fouzi Harrou com o nome de “ Monitoring patient flow in a hospital emergency department: ARMA-based nonparametric GLRT scheme ” propõe um método para prever fluxos anormalmente altos de pacientes em departamentos de emergência usando dados de séries temporais . Foi desenvolvido um modelo ARMA para descrever o fluxo nominal de pacientes no departamento de emergência e um teste de razão de verossimilhança generalizada para detetar estas anomalias [22]. Concluindo, a previsão de séries temporais apresenta ser uma ferramenta valiosa para prever o fluxo de pacientes em hospitais. Analisando dados históricos e através métodos estatísticos ou de modelos de ML apropriados, as unidades hospitalares conseguem antecipar melhor a o fluxo de pacientes futuro e alocar recursos em conformidade.
22 3.5 Diagrama de Relações De maneira compreender melhor os conceitos acima abordados nas suas aplicações práticas, segue um diagrama representativo das ligações e relações que cada conceito tem com os restantes. Figura 10 - Diagrama de conceitos Sendo a Inteligência Artificial uma tecnologia que permite a criação de sistemas capazes de simular a inteligência Humana, o ML apresenta-se como uma subsecção concentrada no conjunto de técnicas e modelos capazes de produzir aprendizagem de máquinas. Este modelo por sua vez tem por bases grandes conjuntos de dados, dados esses que são previamente tratados e analisados através de técnicas de Data Mining . 3.6 Otimização Algoritmos de Otimização são um tipo de algoritmos cuja função é, a partir de um conjunto soluções possíveis de um problema, obter a solução ótima aplicada ao seu contexto, minimizando custo ou maximizando lucro. Estes algoritmos são conhecidos também como algoritmos heurísticos, destacam-se entre os mesmos: Hill Climbing, Simulated Annealing e o Genetic Algorithm .
23 A aplicação deste tipo de técnicas torna-se necessário no desenvolvimento da dissertação devido à sua utilidade na resolução de problemas de mapeamento, ajustando-se assim à gestão de camas e recursos presentes nos hospitais, tendo em conta o conjunto solução dos modelos preditivos da gestão de clientes. 3.6.1 Modelos de Otimização – Hill Climbing O Hill Climbing é um modelo de otimização cujo objetivo é encontrar um local mínimo ou máximo dependendo do objetivo. O modelo começa com uma solução inicial gerada aleatoriamente, ou não, são aplicadas alterações locais a elementos da solução consultando os seus vizinhos. O custo de cada um é avaliado através da aplicação da fitness_function , caso se observe uma melhora no mesmo, o processo volta ao início partindo da solução que representa o vizinho em questão, não se observando melhora em nenhum dos vizinhos locais da solução, esta mantém-se e é repetido também o processo. Este acaba quando as alterações efetuadas à solução inicial deixam de representar uma melhora positiva no custo da mesma, não existindo nenhum vizinho melhor que o atual sendo este um mínimo ou máximo ótimo ao problema [23]. 3.6.2 Modelos de Otimização – Simulated Annealing Simulated Annealing é um método análogo à termodinâmica, mais concretamente com o arrefecimento de metais e líquidos, onde a temperatura é reduzida gradualmente atingindo o ponto de equilíbrio térmico. Neste existe um parâmetro T, que define a temperatura inicial, um parâmetro denominado como c oolin g, responsável pela taxa de arrefecimento e o step, responsável pela alteração dos elementos da solução consultando assim os seus vizinhos. Na inicialização do processo é gerada uma solução inicial em que é escolhido um dos seus elementos ao acaso para ser alterado conforme o parâmetro step definido, ao efetuar a alteração esta solução passa a corresponder a um vizinho da inicial. Através da fitness function é calculado o custo da nova solução. A grande diferença neste método é que nem sempre o vizinho com melhor custo é escolhido uma vez que pode existir a probabilidade de estarmos a escolher um caminho que à partida tende a ser melhor, mas pode levar a atingir um mínimo local e não mínimo ótimo, esta escolha é baseada numa probabilidade calculada no algoritmo. Este processo segue todas as iterações até que a temperatura atinga um ponto previamente definido, a cada iteração é efetuado um arrefecimento da temperatura [24].
24 3.6.3 Modelos de Otimização – Genetic Algorithm O Algoritmo Genético é um algoritmo de procura que tem como base a teoria da evolução de Charles Darwin, que atua sobre um conjunto de possíveis soluções, funcionando através da genética e seleção “natural”. Todas as soluções possíveis são chamadas de indivíduos de uma população ou genes de uma solução. Para inicialização deste algoritmo é gerado um conjunto de n soluções denominado como população inicial, através da mesma decorrem transformações dos seus indivíduos com recurso à mutação dos seus elementos ou ao seu cross-over (junção de duas soluções, gerando uma só) realizando assim a criação de novas soluções e novas populações. Tendo em conta o número de elitismo, número dos n melhores indivíduos, denominados como “pais”, a serem escolhidos para gerar a nova população, são então escolhidos os que verificam melhor resultado na fitness_function representado assim uma melhor solução. O algoritmo de pesquisa acaba aquando é atingido o número de populações / gerações pretendidas na inicialização do mesmo [25]. A classe dos algoritmos genéticos tem aplicações nos diversos problemas de machine learning , atuando na pesquisa de uma solução ótima através de um conjunto solução gerado pelos métodos de ML em questão. Atuam sobre espaços solução discretos onde métodos de gradiente não tem aplicação, por norma, com melhor performance do que os métodos referidos anteriormente ( Hill-Climbing, Simulated-Annealing ). As principais utilizações centram-se na definição de soluções para problemas de mapeamento ou gestão de recursos e problemas de planeamento com restrição horária. 3.6.4 Comparação dos Modelos De maneira a facilitar a realização do projeto da dissertação é necessário obter uma perceção acerca das três hipóteses de algoritmos de otimização e qual se adequa melhor ao contexto atendendo à sua performance. Já vários estudos foram realizados com o objetivo de perceber qual o método/algoritmo que permite chegar a uma “melhor” solução ótima. Para resolver o problema de timetabling ou
25 definição horária para ocorrência de eventos com certos recursos disponíveis, o Departamento de Inteligência Artificial da Universidade de Edinburgo realizou um estudo que tinha como objetivo a otimização horária dos eventos, aulas ou exames, nas instituições escolares. Para tal foi definido um problema onde se pretendia a definição de um calendário de exames para uma instituição de ensino em que nenhum exame poderia acontecer ao mesmo tempo, os alunos tinham de ter pelo menos duas horas de intervalo entre os exames no mesmo dia e a capacidade da instituição é limitada dependendo do horário, quantos menos horas extra foram utilizadas na definição deste calendário melhor é considerada a solução. Após realização do estudo e comparação das performances foi concluído que os métodos Hill Climbing e Simulated Annealing ofereciam uma melhor qualidade da solução, porém o Algoritmo Genético permite obter uma variedade de soluções distintas para o problema ainda que não tão ótimas [26]. De modo a comparar estes métodos, não só em problemas de timetabling mas também nos de mapeamento, gestão ou alocação de recursos, como a distribuição de camas num hospital, foi atendido um estudo realizado pela Universidade de Grenoble onde o objetivo prendia pela resolução de um problema de mapeamento ou alocação de processos de comunicação nos processadores de uma máquina de memória distribuída comparando a performance dos três métodos ou algoritmos tendo em conta a qualidade da solução ótima encontrada e o tempo de computação necessário. Foi verificado após comparação das métricas de avaliação de performance que a qualidade das soluções oferecida pelo Hill Climbing era inferior ao Simulated Annealing obtidas, porém com menor tempo computacional, os resultados obtidos pelo Simulated Annealing eram comparáveis ao Algoritmo Genético apresentando o último menos tempo de computação. Foi também estudada a hipótese da implementação híbrida do Algoritmo Genético com o Hill Climbing o que por sua vez oferecia a melhor solução em termos de qualidade, mas o custo computacional era demasiado elevado, sendo considerada por isso o Algoritmo Genético a melhor opção para resolução deste tipo de problemas. A mesma Universidade em questão utiliza o Algoritmo Genético como método preferencial para otimização em problemas de mapeamento, com grande sucesso, nas áreas de medicina, robótica e redes neuronais [23]. 3.6.5 Modelo de Otimização de Recursos numa Instituição Hospitalar
26 A má gestão dos recursos nas instituições hospitalares constitui um problema presente na indústria da saúde, comprometendo não só a qualidade de serviço e representando um aumento nos custos inerentes da manutenção do mesmo. Torna-se por isso uma necessidade real, realizar uma otimização de recursos humanos e materiais destas instituições. Neste intuito o Departamento de Engenharias Industrial e Gestão Sistemas de Informação da Universidade de Tehran realizaram um estudo acerca da eficiência de aplicação do Algoritmo Genético para otimização dos recursos humanos no Tous Hospital em Tehran. Os dados utilizados foram colecionados num período de 36 meses contendo informação acerca do fluxo de clientes, em quantidade e espaçamento temporal. O objetivo passava pelo ajuste dos horários laborais dos médicos e nove unidades especializadas hospitalares tendo em conta os dados recolhidos, de modo a encontrar qual o mínimo ótimo de pessoal staff que permitisse um aumento da eficiência dos processos e a minimização dos custos. Para tal foi executado um algoritmo genético em que a fitness function tinha como parâmetros base os salários do pessoal necessário e número de clientes atendidos por cada um em três turnos de trabalho. Após 500 execuções / gerações foi encontrada, com sucesso, uma solução ótima de alocação do staff para o atendimento máximo de clientes, maximizando a eficiência e minimizando o custo, de 69 funcionários necessários comparativamente aos 108 utilizados frequentemente no hospital. No mesmo estudo é referida a limitação acerca da obtenção de dados das unidades hospitalares e da polivalência da aplicação deste método, com sucesso, em outros hospitais [27].
27 4. TRABALHO REALIZADO E RESULTADOS OBTIDOS Nesta secção são apresentados os trabalhos realizados e os resultados obtidos. A secção está organizada em torno das fases do processo CRISP-DM. 4.1 Compreensão do Negócio Primeiramente, antes de qualquer desenvolvimento ou receção e tratamento de dados foi importante perceber aquilo que eram os problemas presentes e respetivos os objetivos propostos para realização do projeto e como cumprir os mesmos. O Hospital de Marco Canaveses tinha várias questões por ver resolvidas, entre as quais, primeiramente se centra, ter uma noção de quantos pacientes ou doentes são esperados nos próximos períodos, sejam estes dias, semanas ou meses. De modo a poder planificar a gestão dos seus recursos de uma forma adequada e garantindo que responde às necessidades apresentadas foi então proposto criar um modelo de previsão diária do fluxo de doentes, com base nos dados passados de admissões, altas e internamento dos mesmos. Posteriormente à realização do modelo preditivo e conseguindo ter então uma previsão, dentro dos possíveis, acerca do número de doentes esperado em cada especialidade no seguinte dia, segue-se o próximo problema, a má gestão/distribuição de camas pelas especialidades fazendo com que fosse necessário alocar doentes em especialidades que não as suas contribuindo para o mau funcionamento do Hospital. Foi para isso, elaborado um modelo de otimização de camas, visando, de acordo com o fluxo de doentes e pensando nas camas como um recurso movível entre os Hospital e não fixo de cada especialidade, a melhor distribuição de camas possível pelas especialidades, visando minimizar a alocação errada de doentes. Importante referir no contexto do problema em questão que para uma melhor perceção do mesmo foram criados três importantes conceitos: • Doente Físico, o doente que se encontra internado no espaço físico da especialidade e é da responsabilidade da mesma especialidade, exemplificando, doente da
28 responsabilidade da especialidade de Medicina Interna internado no espaço físico da mesma. • Doente Responsável, o doente que se encontra internado numa especialidade fora da responsável pelo mesmo, devido à falta de camas nessa especialidade, exemplificando, doente da responsabilidade de Medicina Interna internado no serviço de pneumologia. • Doente Previsto, doente cuja responsabilidade não é da especialidade onde se encontra internado devido à sublocação da mesma, exemplificando, doente de pneumologia internado no serviço de Medicina Interna, representando assim um ‘Doente Responsável’ de pneumologia e um ‘Doente Previsto’ na Medicina Interna. Conseguindo assim obter uma melhor perceção do estado de cada especialidade e saber que o objetivo do modelo de otimização se centrava em minimizar os ‘Doentes Responsáveis’ e ‘Previstos’ em cada especialidade, dentro das limitações do Hospital. Paralelamente ao problema da gestão de camas surge também o problema de uma má gestão e planificação horária dos enfermeiros no Hospital, fazendo isto com que haja uma constante necessidade de realização de horas extra e uma sobrecarga horária nos mesmos. De modo a perceber se era possível obter uma otimização significativa da planificação horária do pessoal, sob o número de recursos apresentado, foi elaborado um modelo de otimização cujo objetivo centrava em minimizar a realização de horas extra, garantindo ao mesmo tempo que todas as necessidades do Hospital eram supridas e percebendo se havia uma falta de recursos ou efetivamente má gestão dos mesmos. Em suma esta dissertação pode ser divida em três partes: • A elaboração de um modelo preditivo para o fluxo de doentes no Hospital. • Desenvolvimento de um modelo de otimização de distribuição de camas, de modo a minimizar a alocação errada dos doentes pelas especialidades. • Implementação de um modelo de otimização horária dos enfermeiros com intuito de perceber se é possível sob o contexto atual do hospital minimizar a realização de horas extra do pessoal.
35 Figura 13 - Exemplo de DataSet Resultante
36 Figura 14 - Exemplo de DataSet Resultante Nas figuras 12 a 14 estão representados exemplos de dataset s resultantes depois de aplicadas todas as transformações nesta etapa de preparação dos dados. Neste caso em específico são correspondentes ao conjunto de dados relativo ao fluxo de doentes diário entre 2019 e maio de 2022 das três especialidades com maior expressão no hospital.
37 4.4 Modelação Para o desenvolvimento deste estudo foram desenvolvidos, três diferentes modelos, com dois focos distintos. Primeiramente foi elaborado um modelo de previsão com intuito de prever o fluxo de doentes no CHTS, de seguida, tendo por base esta previsão, foram elaborados modelos de otimização para a alocação de camas pelas diferentes especialidades do Hospital e para alocação horária do pessoal. 4.5 Modelo de Previsão do Fluxo de doentes De modo a realizar um modelo que nos permitisse obter uma previsão geral acerca do fluxo de doentes em cada especialidade no Hospital, foi elaborado, para caso demonstrativo, um modelo com base apenas no fluxo doentes da especialidade de Medicina Interna, sendo esta a que representa maior expressão a nível de volume de pacientes. Uma vez que a variável a prever se centrava só e apenas no fluxo de pacientes, já representada pelo atributo “NDOENTES_RESPONSAVEL_TOTAL” foi descartada a necessidade de realizar modelos multivariados de maneira a evitar redundância e ocorrência de erros no modelo. Para tal foi escolhido o ‘ARIMAAuto Regressive Integrated Moving Average’ , mais concretamente o “Auto-Arima”, um modelo uni variado que apenas prevê uma variável/série temporal de cada vez. O Modelo Auto-Arima permite lidar já com dados sazonais como é o caso e realizar a diferenciação automática dos mesmos para lhes retirar a sazonalidade e quaisquer tendências presentes nos dados tornando-os estacionários. Para além destes parâmetros existem mais dois a ter conta neste modelo uni variado, o parâmetro p, número de termos autorregressivos ou o número de “observações defasadas” e determina o resultado do modelo fornecendo pontos defasados e o parâmetro q que indica a ordem do modelo de média movel. Dependendo do valor destes parâmetros depende também a previsão do modelo, no caso do Auto-Arima estes valores são também eles definidos automaticamente dentro de um range definido inicialmente sendo este entre 1 e 5 (start_q & start_p). O critério para escolher a melhor combinação destes valores (p, d, q) é baseado no AIC, uma técnica baseada no ajuste dentro da amostra para estimar a probabilidade de um modelo prever/estimar valores futuros. A melhor combinação é aquela que apresenta o AIC menor.
38 Na figura 15 podemos ver representado graficamente o conjunto de dados que serviu de input para o modelo. O fluxo de doentes da especialidade de medicina interna desde janeiro de 2019 a junho de 2022. Figura 15 - Fluxo de doentes de Medicina Interna de 2019 a 2022 O objetivo passou por testar o modelo criando a partir deste conjunto de dados um datase t de treino, correspondente ao fluxo de doentes de janeiro de 2019 a maio de 2022 e um datase t de teste correspondente ao fluxo de doentes do mês de junho de 2022. Na figura 16 abaixo podemos ver a azul os dados correspondentes do dataset de treino e a laranja o dataset teste.
39 Figura 16 - Divisão dados treino e dados teste Para avaliar a precisão da solução foram utilizadas três métricas entre as quais: • Mean Forecast Error , Erro Médio da Previsão ou ‘Bias’, é tanto melhor quão mais próximo de 0 estiver, se for negativo significa que estamos perante um caso de undercast dos dados, se for positivo está a acontecer Overfitting . • Mean Squared Error , ou Erro Médio Quadrado, medida que avalia os erros e desvios de maior magnitude atribuindo maior peso, de forma a combater anomalias e outliers. • Mean Absolute Error ou Erro Médio Absoluto, o erro médio entre a diferença do valor previsto e o valor real. A solução encontrada pelo modelo com menor AIC foi com os valores de p = 4, d = 1 e q = 5. Os valores das métricas para avaliação foram: • Erro Médio de Previsão = -0.22 • Erro Médio Quadrado = 200.8 • Erro Médio Absoluto = 11.7
40 Verificando estes valores podemos conferir que a previsão não sendo perfeita, teve sucesso, até porque apresentando um erro médio absoluto de 11 é considerado positivo tendo em conta que a escala do fluxo de doentes diário no mês de junho de 2022 ronda sempre as duas centenas, pelo que um erro de 11 pacientes na previsão não é muito significativo. De modo a visualizar a previsão realizada pelo modelo, estão representados na figura 17 os resultados do modelo, sendo a azul os dados reais e a laranja os dados previstos. Figura 17 - Resultados da previsão 4.6 Modelos de Otimização Após realizada a previsão do fluxo de doentes no Hospital, segue-se a etapa dos modelos ou algoritmos de otimização. Na realização dos dois modelos de otimização, os algoritmos testados foram os mesmos, da maneira a que antes da descrição do desenvolvimento e formulação dos problemas seguem abaixo cada um dos algoritmos testados e o seu respetivo pseudocódigo. Implementação dos modelos Para otimizar tanto a atribuição de camas a doentes, como a atribuição horária dos enfermeiros foram então comparados quatro algoritmos de otimização diferentes, de forma a perceber qual
41 deles representaria um melhor desempenho. A configuração dos algoritmos foi adaptada de forma a considerar a data num dos parâmetros, uma vez que é uma variável de entrada na função de aptidão e essencial para definir o domínio diário do problema. Os algoritmos que foram considerados neste estudo estão apresentados abaixo assim como uma breve descrição dos mesmos. Random Search (RS) 1. RS Pseudo Code round = 0 best_satisfaction = 0 best solution TO NULL While round < rounds solution = random solution between the domain values satisfaction = fitness function(date, solution) If satisfaction > best_satisfaction then best_satisfaction = satisfaction best solution = solution End If round ++ End While Return best solution Random Search ou algoritmos de pesquisa aleatória tem por base gerar soluções aleatórias durante um certo número de rounds. A cada round a solução gerada é avaliada, a função que no final de todos os rounds apresentar melhor score constitui a solução apresentada pelo algoritmo em questão.
42 Hill Climbing(HC) 2. HC Pseudo Code Generate an initial solution s0, s = s0 satisfaction = fitness(date, s) While termination criteria not met do neighbor_solution = Generate_Neighbor(s, domain) neighbor_satisfaction = fitness(date, neighbor_solution) If neighbor_satisfaction > satisfaction then s = neighbor_solution satisfaction = neighbor_satisfaction End If End While Return s O Hill Climbing é um algoritmo de pesquisa local, baseado em incrementos e decrementos das soluções geradas, chamadas de "vizinhos", partindo de uma solução inicial aleatória ou previamente fornecida dentro do domínio. Na sua execução, cada vizinho gerado é analisado e avaliado através da fitness function quanto à sua qualidade, se um dos vizinhos gerados na iteração apresentar um resultado melhor passa a ser a solução atual. O algoritmo continua até que não haja possibilidade de melhoria nas soluções. Este algoritmo tende a encontrar soluções óptimas locais.
43 Simulated Annealing(SA) 3. SA Pseudo Code Generate an initial solution s0, s = s0 satisfaction0 = fitness(date, s) While temperature > 0.1 do s1 = Generate(s0, domain) satisfaction1 = fitness(date, s1) If Accept(satisfaction0, satisfaction1, temperature) then satisfaction0 = satisfaction1 s0 = s1 End If temperature = temperature * cooling End While Return s0 O Simulated Annealing é um método análogo à termodinâmica inspirado no processo de arrefecimento de metais. Este algoritmo consiste numa sequência de iterações onde ocorre uma diminuição progressiva da temperatura, inicializando-a num valor elevado onde cada alteração é aceite, sendo esta probabilidade de aceitação cada vez menor à medida que a temperatura diminui de acordo com uma taxa de arrefecimento. O método de pesquisa é idêntico ao algoritmo HC baseado na transformação de soluções através de incrementos à solução anterior, a grande diferença é que através da aceitação ou não das soluções esta abordagem evita ficar preso a mínimos ou máximos locais.
44 Genetic Algorithm(GA) 4. GA Pseudo Code Initialize population elite = elistism * Population-Size For i in range number_generations fitness(date, individual) for each individual in population Select the elite with the best result Insert elite into new_population While new population-size < Population-Size IF probability of mutation Mutate elite individual - > new individual ELSE Crossover elite indivduals -> new individual Insert individual into new population End While End For Return last generation best indvidual O Algoritmo Genético baseia-se na teoria da evolução de Charles Darwin. Atua sobre um conjunto de soluções possíveis denominadas indivíduos de uma população. O algoritmo parte de uma população inicial e são efetuadas transformações em cada um dos indivíduos através de mutação ou cruzamento/ cross-over , cuja decisão é baseada numa probabilidade previamente definida. Os melhores indivíduos são escolhidos de acordo com um número de elitismo para
51 promovendo maior consistência dos resultados a longo prazo e maior fiabilidade. Relativamente ao tempo de computação, o GA apresenta menos de metade do HC. Pelo lado negativo, o Simulated Annealing não apresenta uma única solução viável, no entanto, este facto deve-se aos parâmetros escolhidos na sua implementação. Mais concretamente a temperatura inicial utilizada, que apesar de ser elevada, é um parâmetro que deve ser alterado consoante o cenário. Para se fazer uma comparação justa com os outros algoritmos, teria de se descobrir qual o valor ótimo a utilizar para este parâmetro, o que é uma tarefa bastante complexa. O algoritmo Random Search não apresentou surpresas no seu comportamento, uma vez que as soluções são geradas através de probabilidades aleatórias. Figura 19 - Execução do Random Search Figura 20 - Execução do Hill Climbing
52 Figura 21 - Execução do Algoritmo Genético Figura 22 - Execução do Simulated Annealing As figuras 19 a 22 representam os resultados obtidos para as 10 execuções efetuadas para cada algoritmo. Na data utilizada para realizar as 10 execuções, havia um caso de sobrelotação com mais 53 doentes do que camas a disponibilizar. Este facto aliado à atribuição errada de camas levou ao registo de cerca de 92 doentes alocados a especialidades erradas. Quando comparamos os resultados apresentados pelo HC e pelo GA, apesar de cumprirem com as atuais limitações de camas, não foi necessária a alocação errada de doentes. O número de doentes físicos foi maximizado de 459 para 551 e a classe responsável foi minimizada de 92 doentes para 0. De modo conclusivo, foi revelado um desempenho positivo de dois algoritmos: o Hill Climbing e o Algoritmo Genético. Ambos, avaliados ao longo de 10 execuções, obtiveram pontuações médias idênticas de 43,2 e 42,2, respetivamente. Tiveram um impacto positivo na gestão de camas quando comparados com a situação atual, recuperando menos 92 alocações erradas e aumentando a classe de doentes físicos de 459 para 551. No que respeita ao desvio-padrão, o
53 GA destaca-se, com um valor de 1,88 face ao valor de 2,97 obtido pelo HC, sendo assim mais consistente. Relativamente ao tempo de execução, a diferença torna-se significativa uma vez que o GA apresenta menos de metade do HC. É seguro, portanto dizer que, a partir deste estudo o melhor algoritmo a ser utilizado na alocação de camas para promover o aumento da eficiência e desempenho dos hospitais para com seus pacientes é o Algoritmo Genético. Otimização da distribuição horária dos Enfermeiros Após a realização do problema da alocação errada de camas e doentes no Hospital seguiu-se então a resolução da alocação horário semanal dos enfermeiros com vista à minimização das horas extra. Neste problema foi realizada uma abordagem teórica de resolução, isto é, não existiu implementação nem desenvolvimento, foi apenas percebido o problema, definidas as suas limitações e objetivos e explicada a estratégia a seguir para uma posterior resolução. Para tentar perceber se era ou não possível chegar a uma solução ótima ou que pelo menos apresentasse melhorias significativas face à situação atual a abordagem em termos de modelos testados foi diferente e reduzida. Como está suportado através de estudo realizados anteriormente onde já foram testados a aplicação de algoritmos de otimização, mais concretamente os GA ou algoritmos genéticos, para gestão dos recursos humanos na indústria hospitalar e estes registaram sucesso, destacando-se também de outros modelos e frameworks utilizadas, como aconteceu na resolução do problema anterior, neste estudo foi tomado apenas como hipótese a aplicação desta classe de algoritmos de modo a utilizar o tempo e os recursos de uma forma mais eficiente. O desafio em si consistia, a partir de um conjunto de dados correspondentes á alocação real dos enfermeiros no Hospital e tendo em conta a previsão do fluxo de doentes, aplicar um modelo de otimização que fosse capaz de entregar uma planificação horária dos respetivos, cumprindo certas restrições e objetivos de maneira que minimizar as horas extra e maximizasse a eficiência na utilização destes recursos.
54 Restrições apresentadas: • São necessárias em média 4.2 horas de cuidado enfermeiro por cada doente • Existem três turnos (Manhã – Tarde – Noite) • O turno da Manhã tem de representar cerca de 50% do tempo laboral de Enfermaria • O turno da tarde tem de representar 30% do tempo de Enfermaria • O turno da noite tem de representar 20% do tempo de Enfermaria • O turno da manhã tem a duração de 6 horas (8:30h – 14:30h) • O turno da tarde tem a duração de 6 horas (14:30h – 20:30h) • O turno da noite tem a duração de 12 horas (20:30 – 8:30) • São necessários no mínimo 6 enfermeiros por turno • Existem 45 Enfermeiros no Departamento • Cada enfermeiro trabalha 35 horas semanais mais horas extras consoante as necessidades A partir de estas restrições foi possível inferir que o tempo necessário para cuidado de enfermaria num departamento é igual a 4.2 x número de doentes responsáveis previstos. Significa isto também que para determinar o número de horas de cuidado de enfermaria por turno basta multiplicar o valor resultante da multiplicação pelas percentagens de tempo laboral de cada um dos turnos. Como a distribuição horária é feita por dias e por turnos dentro da mesma semana, a abordagem escolhida foi de otimizar os Turnos de um dia separadamente, otimizando a distribuição horária de cada turno teremos a solução ótima, se assim for possível, para o dia em questão. Para tal, é necessário ter em conta que com o limite de horas extra dedicadas da para uma determinada semana, podemos deduzir o número de horas extra dedicados a cada um dos Turnos. Por exemplo, na semana a otimizar foi definido um limite de horas extra semanais de 7 horas por cada enfermeiro, isto é o mesmo que dizer que cada enfermeiro terá de fazer é média mais 1 hora por dia. Aplicando o mesmo princípio utilizado para saber a quantidade horas laborais a realizar por turno, multiplicando o limite diário de horas extra pelas percentagens de cada turno temos o número de horas extra que cada enfermeiro pode realizar dentro desse turno.
55 É importante referir que na abordagem realizada foi tido como pressuposto de solução que foi definido um número limite de horas extra semanais para os enfermeiros, o algoritmo com base no mesmo tentava minimizar as tais horas extra laboradas e quantidade de vezes que o limite era ultrapassado. Este limite podia ser calculado através do tempo necessário para cuidado de enfermaria da semana em questão , tendo sempre em conta que apenas existiam 45 Enfermeiros disponíveis o que podia ser manifestamente pouco para as necessidades do Hospital, nas datas a testar. Os dados fornecidos para este estudo foram os mesmos adicionando ainda um dataset contendo informação acerca da alocação horária dos enfermeiros no departamento deste do final do mês de janeiro de 2021 até ao final do mês de fevereiro de 2021. Destes dados podíamos retirar informação como: • Departamento Médico • Serviço do Departamento de cada Enfermeiro • Quadro de departamento alocado a cada Enfermeiro e respetivo código • Data de início da semana • Data diária • Turno de cada Enfermeiro • Nome • Código de Identificação Tendo em conta os dados fornecidos, as restrições e os objetivos do problema em questão, a fase seguinte consistiu em definir o domínio ou espaço solução com base nessas informações. Tal como aconteceu com o problema da alocação de camas, a distribuição horária também seguiu uma abordagem dinâmica do domínio. Ou seja, mais uma vez, o domínio não é uma variável fixa e constante, mas sim um valor ou intervalo de valores que varia diariamente e de turno para turno, uma vez que as limitações de horas extra foram aplicadas aos turnos, conforme mencionado anteriormente. O domínio para cada turno de um determinado dia seria compreendido entre 0 e o limite de horas extra do turno em questão, calculado através do limite de horas extra imposto para a semana.
56 A solução era então apresentada por turno e consistia num array de 45 posições, onde cada posição estava associada a um enfermeiro específico e às horas extra que lhe foram atribuídas nesse mesmo turno. Elaborando isto para cada turno de todos os dias da semana, obtemos a distribuição horária das horas extras realizadas para uma determinada semana. Dessa forma, é possível ter uma visão clara e organizada da distribuição das horas extras entre os enfermeiros e garantir que as restrições impostas sejam cumpridas. Além disso, esta abordagem dinâmica do domínio permite uma maior flexibilidade na gestão das horas extras, permitindo ajustes em tempo real de acordo com as necessidades e restrições impostas. Isso garante que a distribuição das horas extras seja feita de forma justa e equilibrada entre os enfermeiros, evitando sobrecarga de trabalho e garantindo o cumprimento das normas estabelecidas. Através desta solução, é possível gerir eficientemente a distribuição das horas extras e garantir o bem-estar dos enfermeiros e a qualidade do atendimento prestado aos pacientes. Após realizada a interpretação e proposta de resolução seria necessário elaborar uma função objetivo à semelhança do problema da afetação de camas seguido da aplicação do algoritmo genético em todos os turnos de uma determinada semana. Posteriormente uma comparação entre a solução atual encontrada pelo Hospital e a solução encontrada pelo algoritmo de otimização, tendo deste modo perceber se é ou não pertinente a aplicação deste tipo de algoritmos sobre este contexto e também quais as componentes a serem melhoradas para uma melhor execução dos mesmos.
57 5. CONCLUSÃO Finalizado o projeto podemos concluir que a realização do mesmo foi bem-sucedida uma vez que todos os objetivos propostos foram atingidos e ainda foi possível realizar um extra para modelação da otimização das horas extra por parte do Enfermeiros. De modo a compreender melhor o trabalho realizado seguem abaixo enumerados os objetivos propostos e os resultados atingidos. Objetivos esperados: • A definição de um conjunto de modelos preditivos sobre o fluxo dos doentes; • A definição de um conjunto de medidas de eficiência para avaliar cenários de disponibilidade de camas e afetação de recursos; • A definição de modelos de otimização da disponibilidade de camas e afetação de recursos humanos com base nos modelos preditivos desenvolvidos nos pontos anterior, os recursos disponíveis e na programação de cirurgias; Resultados atingidos: • Desenvolvimento e implementação de um modelo preditivo do fluxo dos doentes • Definição de um conjunto de métricas e medidas de avaliação para cenários de disponibilidade de camas e afetação de recursos; • Desenvolvimento e implementação de vários modelos de otimização das camas no Hospital; • Benchmarking dos modelos realizados e devidas ilações; • Definição e modelação de um modelo de otimização visando minimizar o recurso da hora extra por parte dos Enfermeiros; • Questão de investigação inicialmente formulada, respondida. Quanto aos resultados atingidos foram exatamente os esperados sendo estes a promoção da implementação de um sistema de ABI que permita, em tempo real, otimizar a gestão e planeamento de camas e do fluxo de doentes, sendo que os modelos em questão se encontram prontos a serem implementados.
58 A implementação dos algoritmos testados neste estudo, distinguindo o algoritmo genético, pode levar a uma diminuição do desperdício de recursos ao permitir que as unidades hospitalares tenham a oportunidade de enfrentar a sobrelotação e sejam capazes de responder às suas necessidades diárias. Isto leva a uma gestão e planeamento de camas muito melhor, onde todos os pacientes têm a possibilidade de ser alocados à sua unidade / especialidade hospitalar correta, aumentando a qualidade dos serviços médicos prestados aos pacientes. Com isto é possível dizer, relativamente á questão de investigação proposta, é possível obter uma melhoria efetiva na alocação de camas conseguindo minimizar a distribuição errada de doentes com recurso à junção de técnicas de inteligência artificial, preditivas e de otimização. No decorrer desta dissertação foi também realizado um artigo abordando o problema da alocação errada de camas nos hospitais, intitulado de “Better Medical Efficiency by means of Hospital Bed Management Optimization – a Comparison of Artificial Intelligence Techniques”. Este artigo foi aceite para publicação para conferência de Inteligência Artificial - EPIA 2023. Para estudos futuros, aconselha-se não só a um estudo mais aprofundado sobre algoritmos dependentes da otimização de parâmetros de entrada, como é o caso do AG e principalmente do Simulated Annealing , que com a otimização dos parâmetros de input podem apresentar resultados muito bons, mas também, dar também seguimento a uma implementação e resolução adequada ao problema de minimização das horas extra dos Enfermeiros numa unidade hospitalar.
59 6. REFERÊNCIAS BIBLIOGRÁFICAS [1] K. Peffers, T. Tuunanen, … M. R.-J. of, and undefined 2007, “A design science research methodology for information systems research,” Taylor & Francis , vol. 24, no. 3, pp. 45– 77, Dec. 2007, doi: 10.2753/MIS0742-1222240302. [2] C. Schröer, F. Kruse, J. G.-P. C. Science, and undefined 2021, “A systematic literature review on applying CRISP-DM process model,” Elsevier , Accessed: Mar. 23, 2022. [Online]. Available: https://www.sciencedirect.com/science/article/pii/S1877050921002416 [3] R. Wirth and J. Hipp, “CRISP-DM: Towards a Standard Process Model for Data Mining.” [4] C. Schröer, F. Kruse, and J. M. Gómez, “A systematic literature review on applying CRISPDM process model,” in Procedia Computer Science , Elsevier B.V., 2021, pp. 526–534. doi: 10.1016/j.procs.2021.01.199. [5] Z. Michalewicz, M. Schmidt, M. Michalewicz, and C. Chiriac, Adaptive Business Intelligence . Springer, 2007. Accessed: Jun. 27, 2023. [Online]. Available: https://hdl.handle.net/2440/36909 [6] J. Lopes, T. Guimarães, and M. F. Santos, “Adaptive business intelligence: A new architectural approach,” in Procedia Computer Science , Elsevier B.V., 2020, pp. 540– 545. doi: 10.1016/j.procs.2020.10.075. [7] J. Lopes, J. Braga, and M. F. Santos, “Adaptive business intelligence platform and its contribution as a support in the evolution of hospital 4.0,” in Procedia Computer Science , Elsevier B.V., 2021, pp. 905–910. doi: 10.1016/j.procs.2021.04.016. [8] R. Goldschmidt, E. Passos, and E. Bezerra, “Data Mining,” 2015, Accessed: Mar. 23, 2022. [Online]. Available: https://books.google.com/books?hl=ptPT&lr=&id=HN6sCQAAQBAJ&oi=fnd&pg=PT4&dq=Goldschmidt,+R.,+Passos,+E.,+%26+B ezerra,+E.+(2015).+Data+Mining.+Elsevier+Brasil.&ots=3tuN_KdNO3&sig=03l9282PjN7 heyIkzPYAEnGK7Yw [9] K. R.-I. J. of A. R. in and undefined 2012, “Data mining techniques,” Citeseer , vol. 2, no. 10, p. 2277, 2012, Accessed: Mar. 23, 2022. [Online]. Available: https://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.898.6657&rep=rep1&type= pdf
60 [10] H. Koh, G. T.-J. of healthcare information management, and undefined 2011, “Data mining applications in healthcare,” Citeseer , Accessed: Mar. 23, 2022. [Online]. Available: http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.92.3184&rep=rep1&type=pdf [11] J. Santos-Pereira, L. Gruenwald, and J. Bernardino, “Top data mining tools for the healthcare industry,” Journal of King Saud University - Computer and Information Sciences . King Saud bin Abdulaziz University, 2021. doi: 10.1016/j.jksuci.2021.06.002. [12] I. el Naqa and M. J. Murphy, “What Is Machine Learning?,” Machine Learning in Radiation Oncology , pp. 3–11, 2015, doi: 10.1007/978-3-319-18305-3_1. [13] T. A.-N. advances in machine learning and undefined 2010, “Types of machine learning algorithms,” books.google.com , Accessed: Mar. 23, 2022. [Online]. Available: https://books.google.com/books?hl=ptPT&lr=&id=XAqhDwAAQBAJ&oi=fnd&pg=PA19&dq=Ayodele,+T.+O.+(2010).+Types+of+m achine+learning+algorithms.+New+advances+in+machine+learning,+3,+1948.&ots=r2Jq7UDjKm&sig=cEk02QrQZQB4WRnozEZ80pM1FOc [14] M. Mohri, A. Rostamizadeh, and A. Talwalkar, “Foundations of machine learning,” 2018, Accessed: Mar. 23, 2022. [Online]. Available: https://books.google.com/books?hl=ptPT&lr=&id=dWB9DwAAQBAJ&oi=fnd&pg=PR5&dq=%5D+Mohri,+M.,+Rostamizadeh,+A.,+ %26+Talwalkar,+A.+(2018).+Foundations+of+machine+learning.+MIT+press.+&ots=AyrX URw3n2&sig=UdHidqK-fmo-RK2GO3fTtgpLhlU [15] B. Liu, “Supervised Learning,” in Web Data Mining , Springer Berlin Heidelberg, 2011, pp. 63–132. doi: 10.1007/978-3-642-19460-3_3. [16] R. Caruana and A. Niculescu-Mizil, “An empirical comparison of supervised learning algorithms,” ACM International Conference Proceeding Series , vol. 148, pp. 161–168, 2006, doi: 10.1145/1143844.1143865. [17] P. Dayan, M. Sahani, G. D.-T. M. encyclopedia of the, and undefined 1999, “Unsupervised learning,” math.princeton.edu , Accessed: Mar. 25, 2022. [Online]. Available: https://web.math.princeton.edu/~sswang/developmental-diaschisisreferences/dun99b.pdf [18] B. M.-I. J. of S. and R. (IJSR) and undefined 2020, “Machine learning algorithms-a review,” researchgate.net , 2019, doi: 10.21275/ART20203995.