scieee AI-readable full text Open interactive document viewer

Future Estimation of Hydrometeorological Variables Using Machine Learning Techniques: A Comparative Approach

Firmino Cardoso, Jean; Silva, Erickson Johny Galindo da; Costa, Ialy Rayane de Aguiar; Oliveira, Andreia Azevedo Abrantes de; Coutinho, Artur Paiva; Marques Bezerra, Saulo de Tarso

Abstract

[ENGLISH]Objective: The objective of the research was to analyze and compare different machine learning models to identify which technique presents the best performance in predicting hydrometeorological variables. Theoretical Framework: This section presents the main concepts that underpin the work. Machine learning techniques such as support vector machines, decision trees, random forests, artificial neural networks, and gradient boosting are presented, providing a solid foundation for understanding the context of the investigation. Method: The study uses a comparative methodology by applying machine learning techniques to predict hydrometeorological variables based on data collected in Petrolina-PE. Various machine learning techniques were employed and compared. Data normalization was performed through logarithms, and the treatment included filling or excluding inconsistent records. The effectiveness of the models is evaluated using metrics such as the Nash-Sutcliffe efficiency coefficient, Willmott index, and Pearson correlation coefficient. Results and Discussion: The obtained results showed good predictability, ranging from 50 to 70% efficiency. The comparative analysis of the results allowed identifying patterns and relationships between variables and initial configurations of the algorithms, contributing to a better understanding of hydrometeorological processes and their predictability. Research Implications: By providing more accurate and reliable forecasts, the models presented can assist managers in making decisions about the sustainable use of water and the mitigation of natural disasters such as floods. Originality/Value: This study contributes to the literature by advancing the estimation of hydrometeorological variables, improving existing techniques, and providing more accurate data for water resource management. Its impact extends from mitigating risks associated with extreme hydrological events to promoting efficiency in the use of water resources, contributing to the sustainability and resilience of aquatic ecosystems, essential in the face of climate change and environmental challenges. [PORTUGUESE]Objetivo: O objetivo da pesquisa foi analisar e comparar diferentes modelos de aprendizagem de máquina para identificar qual técnica apresenta o melhor desempenho na previsão de variáveis hidrometeorológicas. Referencial Teórico: Neste tópico, são apresentados os principais conceitos que fundamentam o trabalho. As técnicas de aprendizagem de máquina, como máquinas de suporte vetorial, árvore de decisão, florestas aleatórias, redes neurais artificiais e reforço de gradiente são apresentadas, fornecendo uma base sólida para a compreensão do contexto da investigação. Método: O estudo utiliza uma metodologia comparativa aplicando técnicas de aprendizado de máquina para prever variáveis hidrometeorológicas, baseando-se em dados coletados em Petrolina-PE. Diversas técnicas de aprendizagem de máquina foram empregadas e comparadas. A normalização dos dados foi realizada através de logaritmos, e o tratamento incluiu preenchimento ou exclusão de registros inconsistentes. A eficácia dos modelos é avaliada usando métricas como o coeficiente de eficiência de Nash-Sutcliffe, índice de Willmott e coeficiente de correlação de Pearson. Resultados e Discussão: Os resultados obtidos apresentaram uma capacidade de previsibilidade boa, variando de 50 a 70% sua eficiência. A análise comparativa dos resultados permitiu identificar padrões e relações entre variáveis e configurações iniciais dos algoritmos, contribuindo para uma melhor compreensão dos processos hidrometeorológicos e sua previsibilidade. Implicações da Pesquisa: Ao fornecer previsões mais precisas e confiáveis, os modelos apresentados podem auxiliar os gestores na tomada de decisões sobre o uso sustentável da água e a mitigação de desastres naturais, como inundações. Originalidade/Valor: Este estudo contribui para a literatura ao avançar na estimativa de variáveis hidrometeorológicas, aprimorando técnicas existentes e fornecendo dados mais precisos para a gestão de recursos hídricos. Seu impacto se estende desde a mitigação de riscos associados a eventos hidrológicos extremos até a promoção da eficiência no uso dos recursos hídricos, contribuindo para a sustentabilidade e resiliência dos ecossistemas aquáticos, essenciais frente às mudanças climáticas e desafios ambientais. [SPANISH]Objetivo: El objetivo de la investigación fue analizar y comparar diferentes modelos de aprendizaje automático para identificar qué técnica presenta el mejor rendimiento en la predicción de variables hidrometeorológicas. Marco Teórico: Esta sección presenta los principales conceptos que sustentan el trabajo. Se presentan técnicas de aprendizaje automático como máquinas de vectores de soporte, árboles de decisión, bosques aleatorios, redes neuronales artificiales y potenciación del gradiente, proporcionando una base sólida para comprender el contexto de la investigación. Método: El estudio utiliza una metodología comparativa aplicando técnicas de aprendizaje automático para predecir variables hidrometeorológicas basándose en datos recopilados en Petrolina-PE. Se emplearon y compararon diversas técnicas de aprendizaje automático. La normalización de datos se realizó mediante logaritmos, y el tratamiento incluyó el relleno o la exclusión de registros inconsistentes. La eficacia de los modelos se evalúa utilizando métricas como el coeficiente de eficiencia de Nash-Sutcliffe, el índice de Willmott y el coeficiente de correlación de Pearson. Resultados y Discusión: Los resultados obtenidos mostraron una buena previsibilidad, oscilando entre el 50 y el 70% de eficiencia. El análisis comparativo de los resultados permitió identificar patrones y relaciones entre variables y configuraciones iniciales de los algoritmos, contribuyendo a una mejor comprensión de los procesos hidrometeorológicos y su previsibilidad. Implicaciones de la Investigación: Al proporcionar pronósticos más precisos y fiables, los modelos presentados pueden ayudar a los gestores en la toma de decisiones sobre el uso sostenible del agua y la mitigación de desastres naturales como las inundaciones. Originalidad/Valor: Este estudio contribuye a la literatura avanzando en la estimación de variables hidrometeorológicas, mejorando las técnicas existentes y proporcionando datos más precisos para la gestión de los recursos hídricos. Su impacto se extiende desde la mitigación de riesgos asociados con eventos hidrológicos extremos hasta la promoción de la eficiencia en el uso de los recursos hídricos, contribuyendo a la sostenibilidad y resiliencia de los ecosistemas acuáticos. [CHINESE]目的:本研究旨在分析和比较不同的机器学习模型,以确定哪种技术在预测水文气象变量方面表现最佳。理论框架:本节介绍了支持这项工作的主要概念。介绍了支持向量机、决策树、随机森林、人工神经网络和梯度提升等机器学习技术,为理解调查背景提供了坚实的基础。方法:本研究采用比较方法,应用机器学习技术根据在彼得罗利纳-PE收集的数据预测水文气象变量。采用了多种机器学习技术并进行了比较。通过对数进行数据归一化,处理包括填充或排除不一致的记录。使用纳什-萨特克利夫效率系数、威尔莫特指数和皮尔逊相关系数等指标评估模型的有效性。结果与讨论:所得结果显示出良好的可预测性,效率在50%到70%之间。结果的比较分析允许识别变量与算法初始配置之间的模式和关系,有助于更好地理解水文气象过程及其可预测性。研究意义:通过提供更准确和可靠的预测,所提出的模型可以协助管理者就水的可持续利用和减轻洪水等自然灾害做出决策。原创性/价值:本研究通过推进水文气象变量的估算,改进现有技术,并为水资源管理提供更准确的数据,为文献做出了贡献。其影响从减轻与极端水文事件相关的风险扩展到提高水资源利用效率,有助于水生生态系统的可持续性和复原力,这在面对气候变化和环境挑战时至关重要。 [GERMAN]Ziel: Ziel der Forschung war es, verschiedene Modelle des maschinellen Lernens zu analysieren und zu vergleichen, um festzustellen, welche Technik die beste Leistung bei der Vorhersage hydrometeorologischer Variablen aufweist. Theoretischer Rahmen: Dieser Abschnitt stellt die wichtigsten Konzepte vor, die der Arbeit zugrunde liegen. Techniken des maschinellen Lernens wie Support Vector Machines, Entscheidungsbäume, Random Forests, künstliche neuronale Netze und Gradient Boosting werden vorgestellt und bieten eine solide Grundlage für das Verständnis des Untersuchungskontextes. Methode: Die Studie verwendet eine vergleichende Methodik, indem Techniken des maschinellen Lernens angewendet werden, um hydrometeorologische Variablen auf der Grundlage von in Petrolina-PE gesammelten Daten vorherzusagen. Verschiedene Techniken des maschinellen Lernens wurden eingesetzt und verglichen. Die Datennormalisierung erfolgte durch Logarithmen, und die Behandlung umfasste das Auffüllen oder den Ausschluss inkonsistenter Datensätze. Die Wirksamkeit der Modelle wird anhand von Metriken wie dem Nash-Sutcliffe-Effizienzkoeffizienten, dem Willmott-Index und dem Pearson-Korrelationskoeffizienten bewertet. Ergebnisse und Diskussion: Die erzielten Ergebnisse zeigten eine gute Vorhersagbarkeit mit einer Effizienz zwischen 50 und 70 %. Die vergleichende Analyse der Ergebnisse ermöglichte die Identifizierung von Mustern und Beziehungen zwischen Variablen und Anfangskonfigurationen der Algorithmen, was zu einem besseren Verständnis hydrometeorologischer Prozesse und ihrer Vorhersagbarkeit beitrug. Forschungsimplikationen: Durch die Bereitstellung genauerer und zuverlässigerer Vorhersagen können die vorgestellten Modelle Manager bei Entscheidungen über die nachhaltige Wassernutzung und die Minderung von Naturkatastrophen wie Überschwemmungen unterstützen. Originalität/Wert: Diese Studie trägt zur Literatur bei, indem sie die Schätzung hydrometeorologischer Variablen vorantreibt, bestehende Techniken verbessert und genauere Daten für das Wasserressourcenmanagement bereitstellt. [FRENCH]Objectif : L'objectif de la recherche était d'analyser et de comparer différents modèles d'apprentissage automatique afin d'identifier quelle technique présente les meilleures performances dans la prévision des variables hydrométéorologiques. Cadre théorique : Cette section présente les principaux concepts qui sous-tendent le travail. Des techniques d'apprentissage automatique telles que les machines à vecteurs de support, les arbres de décision, les forêts aléatoires, les réseaux de neurones artificiels et le gradient boosting sont présentées, fournissant une base solide pour comprendre le contexte de l'enquête. Méthode : L'étude utilise une méthodologie comparative en appliquant des techniques d'apprentissage automatique pour prédire les variables hydrométéorologiques sur la base de données collectées à Petrolina-PE. Diverses techniques d'apprentissage automatique ont été employées et comparées. La normalisation des données a été effectuée par logarithmes, et le traitement comprenait le remplissage ou l'exclusion des enregistrements incohérents. L'efficacité des modèles est évaluée à l'aide de mesures telles que le coefficient d'efficacité de Nash-Sutcliffe, l'indice de Willmott et le coefficient de corrélation de Pearson. Résultats et discussion : Les résultats obtenus ont montré une bonne prévisibilité, avec une efficacité allant de 50 à 70 %. L'analyse comparative des résultats a permis d'identifier des modèles et des relations entre les variables et les configurations initiales des algorithmes, contribuant à une meilleure compréhension des processus hydrométéorologiques et de leur prévisibilité. Implications de la recherche : En fournissant des prévisions plus précises et fiables, les modèles présentés peuvent aider les gestionnaires à prendre des décisions concernant l'utilisation durable de l'eau et l'atténuation des catastrophes naturelles telles que les inondations. Originalité/Valeur : Cette étude contribue à la littérature en faisant progresser l'estimation des variables hydrométéorologiques, en améliorant les techniques existantes et en fournissant des données plus précises pour la gestion des ressources en eau. Son impact s'étend de l'atténuation des risques associés aux événements hydrologiques extrêmes à la promotion de l'efficacité de l'utilisation des ressources en eau.

Full text

Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 1 RGSA – Revista de Gestão Social e Ambiental ISSN: 1981-982X Submission date: 04/22/2024 Acceptance date: 06/21/2024 DOI: https://doi.org/10.24857/rgsa.v18n6-164 Organization: Interinstitutional Scientific Committee Chief Editor: Éverton Hillig Assessment: Double Blind Review pelo SEER/OJS ESTIMATIVA FUTURA DE VARIÁVEIS HIDROMETEOROLÓGICAS UTILIZANDO TÉCNICAS DE APRENDIZAGEM DE MÁQUINA: UMA ABORDAGEM COMPARATIVA Jean Firmino Cardoso 1 Erickson Johny Galindo da Silva 2 Ialy Rayane de Aguiar Costa 3 Andreia Azevedo Abrantes de Oliveira 4 Artur Paiva Coutinho 5 Saulo de Tarso Marques Bezerra 6 RESUMO Objetivo: O objetivo da pesquisa foi analisar e comparar diferentes modelos de aprendizagem de máquina para identificar qual técnica apresenta o melhor desempenho na previsão de variáveis hidrometeorológicas. Referencial Teórico: Neste tópico, são apresentados os principais conceitos que fundamentam o trabalho. As técnicas de aprendizagem de máquina, como máquinas de suporte vetorial, árvore de decisão, florestas aleatórias, redes neurais artificiais e reforço de gradiente são apresentadas, fornecendo uma base sólida para a compreensão do contexto da investigação. Método: O estudo utiliza uma metodologia comparativa aplicando técnicas de aprendizado de máquina para prever variáveis hidrometeorológicas, baseando-se em dados coletados em Petrolina-PE. Diversas técnicas de aprendizagem de máquina foram empregadas e comparadas. A normalização dos dados foi realizada através de logaritmos, e o tratamento incluiu preenchimento ou exclusão de registros inconsistentes. A eficácia dos modelos é avaliada usando métricas como o coeficiente de eficiência de Nash-Sutcliffe, índice de Willmott e coeficiente de correlação de Pearson. Resultados e Discussão: Os resultados obtidos apresentaram uma capacidade de previsibilidade boa, variando de 50 a 70% sua eficiência. A análise comparativa dos resultados permitiu identificar padrões e relações entre variáveis e configurações iniciais dos algoritmos, contribuindo para uma melhor compreensão dos processos hidrometeorológicos e sua previsibilidade. Implicações da Pesquisa: Ao fornecer previsões mais precisas e confiáveis, os modelos apresentados podem auxiliar os gestores na tomada de decisões sobre o uso sustentável da água e a mitigação de desastres naturais, como inundações. Originalidade/Valor: Este estudo contribui para a literatura ao avançar na estimativa de variáveis hidrometeorológicas, aprimorando técnicas existentes e fornecendo dados mais precisos para a gestão de recursos 1 Universidade Federal de Pernambuco, Caruaru, Pernambuco, Brasil. E-mail: jean.fir[email protected] Orcid: https://orcid.org/0000-0001-6092-713X 2 Universidade Federal de Pernambuco, Caruaru, Pernambuco, Brasil. E-mail: erickson.gal[email protected] Orcid: https://orcid.org/0000-0002-8738-9981 3 Universidade Federal de Pernambuco, Caruaru, Pernambuco, Brasil. E-mail: [email protected] Orcid: https://orcid.org/0000-0002-6655-487X 4 Universidade Federal de Pernambuco, Caruaru, Pernambuco, Brasil. E-mail: andreia.ab[email protected] Orcid: https://orcid.org/0000-0002-2002-3766 5 Universidade Federal de Pernambuco, Caruaru, Pernambuco, Brasil. E-mail: [email protected] Orcid: https://orcid.org/0000-0002-0644-0037 6 Universidade Federal de Pernambuco, Caruaru, Pernambuco, Brasil. E-mail: [email protected] Orcid: https://orcid.org/0000-0002-5815-5908 Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 2 hídricos. Seu impacto se estende desde a mitigação de riscos associados a eventos hidrológicos extremos até a promoção da eficiência no uso dos recursos hídricos, contribuindo para a sustentabilidade e resiliência dos ecossistemas aquáticos, essenciais frente às mudanças climáticas e desafios ambientais. Palavras-chave: Hidrometeorologia, Aprendizagem de Máquina, Vazão de Rios, Recursos Hídricos, Modelos Computacionais. FUTURE ESTIMATION OF HYDROMETEOROLOGICAL VARIABLES USING MACHINE LEARNING TECHNIQUES: A COMPARATIVE APPROACH ABSTRACT Objective: The objective of the research was to analyze and compare different machine learning models to identify which technique presents the best performance in predicting hydrometeorological variables. Theoretical Framework: This section presents the main concepts that underpin the work. Machine learning techniques such as support vector machines, decision trees, random forests, artificial neural networks, and gradient boosting are presented, providing a solid foundation for understanding the context of the investigation. Method: The study uses a comparative methodology by applying machine learning techniques to predict hydrometeorological variables based on data collected in Petrolina-PE. Various machine learning techniques were employed and compared. Data normalization was performed through logarithms, and the treatment included filling or excluding inconsistent records. The effectiveness of the models is evaluated using metrics such as the NashSutcliffe efficiency coefficient, Willmott index, and Pearson correlation coefficient. Results and Discussion: The obtained results showed good predictability, ranging from 50 to 70% efficiency. The comparative analysis of the results allowed identifying patterns and relationships between variables and initial configurations of the algorithms, contributing to a better understanding of hydrometeorological processes and their predictability. Research Implications: By providing more accurate and reliable forecasts, the models presented can assist managers in making decisions about the sustainable use of water and the mitigation of natural disasters such as floods. Originality/Value: This study contributes to the literature by advancing the estimation of hydrometeorological variables, improving existing techniques, and providing more accurate data for water resource management. Its impact extends from mitigating risks associated with extreme hydrological events to promoting efficiency in the use of water resources, contributing to the sustainability and resilience of aquatic ecosystems, essential in the face of climate change and environmental challenges. Keywords: Hydrometeorology, Machine Learning, River Flow, Water Resources, Computational Models. SELECCIÓN DE PROVEEDORES DE LA INDUSTRIA DE LA SAL CON EL MÉTODO DE AHP Y TOPIS RESUMEN Propósito: Este estudio tiene como objetivo identificar los criterios para seleccionar a los proveedores de sal y proponer un marco de selección de proveedores para que la industria de la sal pueda comprar materias primas de acuerdo con las normas y precios especificados. Referencia teórica: Esta investigación sintetiza los criterios de selección de proveedores a partir de la literatura. Método: Se construyó un marco de toma de decisiones para la selección de proveedores mediante la integración del PAH con TOPSIS. Los datos se recopilaron a través de entrevistas con profesionales de la industria de la sal y de observaciones de la fabricación de sal y la cadena de suministro. El peso de los criterios para seleccionar al proveedor de sal se determinó mediante el uso de cuestionarios que utilizaron la metodología AHP y TOPSIS. Resultado y conclusión: Los hallazgos de este estudio ofrecen a la industria de la sal información valiosa sobre los factores que deben tenerse en cuenta al seleccionar proveedores, como la calidad, el servicio, la entrega, la Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 3 flexibilidad y la capacidad de respuesta. El resultado del método AHP indica que el criterio con la clasificación más alta es la calidad. Los resultados sugieren que los criterios se clasifican en orden descendente de importancia, con la calidad teniendo el mayor peso, seguido de la entrega, la capacidad de respuesta, la flexibilidad y el servicio. Se ha elegido al proveedor A, con la clasificación más alta. Implicaciones de la investigación: El marco desarrollado en este artículo utiliza solo cinco criterios y fue validado en una empresa de sal. Se puede continuar con la investigación añadiendo nuevos criterios y validándolos en varias industrias de la sal. Se espera que el algoritmo y los resultados de esta investigación se utilicen como insumos en el diseño de la cadena de suministro digital de la industria de la sal. Además, la administración puede usar este método para elegir proveedores de materias primas en función de la calidad, el servicio, la entrega, la flexibilidad y la capacidad de respuesta. La mayoría de los productores de materias primas salinas en Indonesia son agricultores salineros, la mayoría de los cuales todavía utilizan métodos tradicionales de producción y almacenamiento de sal. Se espera que los resultados de esta investigación puedan proporcionar información a los proveedores de sal, incluidos los productores de sal, sobre los criterios que deben cumplirse para que la sal producida pueda venderse inmediatamente a la industria de la sal. Originalidad/valor: Este estudio desarrolla un sistema de selección de proveedores diseñado para el negocio de la sal, que tiene una importancia significativa en Indonesia. Se prevé que los resultados del estudio de literatura de este estudio proporcionen información valiosa para los académicos que investigan la selección de proveedores. Esta investigación puede profundizarse examinando el impacto de esta decisión del proveedor en el rendimiento de la cadena de suministro de sal, que se extiende desde la fase ascendente hasta la descendente. Palabras clave: Industria de la Sal, Selección de Proveedores, Cadena de Suministro, Calidad, Servicio. RGSA adota a Licença de Atribuição CC BY do Creative Commons (https://creativecommons.org/licenses/by/4.0/). 1 INTRODUÇÃO A previsão e estimativa de variáveis hidrometeorológicas desempenham um papel crucial na gestão sustentável dos recursos hídricos. Essas informações são essenciais para o planejamento e tomada de decisões em diversas áreas, como gestão de recursos hídricos, agricultura, controle de enchentes e geração de energia. No entanto, as características complexas e não lineares dos processos hidrológicos representam um desafio significativo para a modelagem e previsão precisa dessas variáveis. A complexa interação entre fatores naturais, como precipitação, evaporação, infiltração e escoamento, dificulta a criação de modelos robustos. Além disso, a influência das atividades humanas, como urbanização e desmatamento, complica ainda mais os estudos. A variabilidade espacial e temporal desses fenômenos exige abordagens sofisticadas para capturar com precisão as mudanças ao longo do tempo. Diversos estudos têm sido realizados no campo da estimativa das variáveis hidrometeorológicas utilizando técnicas de aprendizagem de máquina. Por exemplo, Liang et al. (2018) integraram o gerador de precipitação aleatória de florestas aleatórias ao SWAT para realizar previsões de longo prazo de vazões em uma bacia. Huang et al. (2019) combinaram Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 4 múltiplos modelos baseados em dados para previsões de longo prazo de escoamento mensal, utilizando a média bayesiana. Prieto et al. (2019) utilizaram técnicas de floresta aleatória para prever o fluxo em bacias não monitoradas, com a aplicação de testes estatísticos para avaliar a adequação dos resultados. Dayal et al. (2021) propuseram uma abordagem baseada em imagens de satélite e técnicas de aprendizado de máquina para estimar a vazão de rios em regiões monçônicas da Índia. Senocak et al. (2023) e Valipour et al. (2024) aplicaram técnicas de aprendizado de máquina para prever precipitações. Técnicas de aprendizagem de máquina têm sido amplamente exploradas como uma abordagem promissora para a estimativa futura da vazão de rios e outras variáveis hidrometeorológicas (Nachappa et al., 2020). O aprendizado de máquina envolve a construção e o treinamento de modelos computacionais capazes de identificar padrões e relacionamentos em conjuntos de dados (Braz, 2023). Esses modelos são comumente utilizados para a previsão e estimativa de novos dados. Neste trabalho, é proposta uma abordagem comparativa para a estimativa futura de variáveis hidrometeorológicas utilizando técnicas de aprendizagem de máquina. O objetivo é analisar e comparar diferentes modelos de aprendizado de máquina aplicados a conjuntos de dados hidrometeorológicos, buscando identificar qual técnica ou combinação de técnicas apresenta o melhor desempenho na previsão dessas variáveis. Essa pesquisa é relevante e justificada pela necessidade de avançar o conhecimento na área de estimativa hidrometeorológica, buscando aprimorar as técnicas utilizadas atualmente e fornecer informações mais precisas para a gestão dos recursos hídricos. Ao obter previsões mais confiáveis de precipitação, temperatura, umidade do ar, velocidade do vento e outras variáveis é possível melhorar a tomada de decisões em relação ao uso sustentável da água e mitigação de desastres naturais, como enchentes. O impacto potencial deste trabalho abrange desde a redução de riscos e danos causados por eventos hidrológicos extremos até a otimização do uso dos recursos hídricos, promovendo a sustentabilidade e a resiliência dos sistemas hidrológicos. 2 REFERENCIAL TEÓRICO No cenário contemporâneo da análise de dados e do aprendizado de máquina, a Máquina de Suporte Vetorial para Regressão (Support Vector Machine Regression, SVMR) emerge como uma abordagem robusta e versátil para a modelagem de problemas de regressão, sendo uma extensão natural Máquina de Suporte Vetorial (SVM), técnica consagrada por sua eficácia na resolução de problemas de classificação (Lal & Datta, 2019). Adaptando os princípios da Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 5 SVM para a tarefa de regressão, a SVMR oferece uma solução poderosa para a estimativa de valores contínuos, demonstrando sua aplicabilidade em uma ampla gama de campos. Sua fundamentação repousa sobre o conceito central de encontrar um hiperplano de regressão ótimo que melhor se ajusta aos dados observados, ao mesmo tempo que maximiza a margem entre os pontos de dados e o hiperplano de regressão, privilegiando a generalização e a robustez do modelo (Lal & Datta, 2019). Distintivamente, a SVMR é capaz de lidar com outliers e não linearidades de maneira eficaz, resultando em modelos de regressão mais flexíveis e adaptáveis a diferentes contextos, além de oferecer a possibilidade de lidar com problemas de alta dimensionalidade, onde a relação entre as variáveis pode ser intrincada e difícil de ser modelada por métodos tradicionais (Dalla Torre et al., 2024). A Regressão por Árvores de Decisão (Decision Tree Regression) destaca-se na análise de dados e aprendizado de máquina como uma técnica eficaz para previsão de valores contínuos. Utilizando uma estrutura de árvore hierárquica, essa abordagem proporciona uma modelagem intuitiva e poderosa das relações complexas entre variáveis independentes e a variável de saída. A Árvore de Decisão é representada graficamente como um fluxograma que divide os dados em segmentos menores, onde cada ramo corresponde a um critério de divisão baseado em uma variável preditora. Os nós finais da árvore contêm as previsões de valores contínuos, permitindo a criação de modelos não-lineares que capturam nuances e interações entre as variáveis (Latif & Ahmed, 2023). A Regressão por Floresta Aleatória (Random Forest Regression) destaca-se na análise de dados e previsão de valores contínuos como uma abordagem avançada de aprendizado de máquina. Esta técnica, uma extensão das Árvores de Decisão, visa superar limitações e melhorar a precisão das previsões ao combinar múltiplas árvores independentes em um modelo robusto (Chen et al., 2020). Cada árvore é construída com base em uma amostra aleatória dos dados de treinamento e utiliza uma seleção aleatória de variáveis preditoras em cada divisão, reduzindo a tendência ao overfitting e aumentando a estabilidade do modelo. Amplamente aplicada em diversos domínios, a Regressão por Floresta Aleatória é especialmente eficaz em conjuntos de dados complexos, heterogêneos e de alta dimensionalidade, onde a linearidade das relações entre variáveis é limitada e as interações entre os preditores são difíceis de serem modeladas por técnicas tradicionais de regressão linear (Antoniadis et al., 2021). A regressão por Gradient Boosting, uma técnica avançada de aprendizado de máquina, tem se destacado como uma poderosa abordagem para a previsão precisa de valores contínuos em diversos domínios, sendo parte da família de algoritmos de ensemble (Xu et al., 2023). Este método é particularmente eficaz em cenários onde a complexidade das relações entre as Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 6 variáveis preditoras e a variável resposta requer uma modelagem mais sofisticada. Segundo Xu et al. (2023), o Reforço de Gradiente (Gradient Boosting) opera sequencialmente, combinando vários modelos fracos, como árvores de decisão rasas, para formar um modelo forte. A cada iteração, novas árvores são ajustadas para corrigir os erros residuais deixados pelas anteriores, priorizando os casos mais difíceis de prever. O algoritmo busca encontrar a direção no espaço de parâmetros que mais reduz o erro residual, adicionando árvores subsequentes de forma a minimizar esse erro, resultando em uma aproximação gradual e refinada da função alvo. As Redes Neurais Artificiais (Artificial Neural Networks, ANN) têm se destacado como uma das abordagens mais poderosas e versáteis no campo do aprendizado de máquina e análise de dados, sendo amplamente utilizadas para modelar relações complexas entre variáveis preditoras e variáveis de resposta contínuas. Estes são modelos computacionais inspirados na estrutura e funcionamento do cérebro humano, compostas por camadas de neurônios interconectados, permitindo a transformação não-linear dos dados através de camadas ocultas. A flexibilidade inerente às ANN permite a captura de padrões não-lineares e interações sutis nos dados, tornando-as valiosas em diversas aplicações. Na regressão por ANN, o objetivo é estimar um relacionamento funcional entre as variáveis preditoras e a variável de resposta contínua, otimizando os pesos e viés das conexões entre os neurônios por meio de algoritmos como o gradiente descendente, para minimizar a diferença entre as previsões da rede e os valores reais da variável de resposta (Alaneme & Mbadike, 2019). 3 METODOLOGIA 3.1 ÁREA DE ESTUDO Foram selecionados dados do município de Petrolina. Localizada no Sertão Pernambuco, Nordeste do Brasil (Figura 1), a cidade é reconhecida como um dos principais polos de fruticultura irrigada do país. Petrolina é uma das líderes nacionais na produção de frutas, especialmente uvas, mangas e goiabas, que são exportadas para diversos países, incluindo mercados na Europa e nos Estados Unidos. A cidade é conhecida pela produção de vinhos de alta qualidade, favorecida pelo clima semiárido e técnicas de irrigação eficientes, sendo uma das poucas regiões do Brasil que consegue produzir vinhos de mesa e espumantes competitivos no mercado internacional. Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 7 Figura 1 Localização do município de Petrolina-PE O posto de coleta de dados em Petrolina é identificado como A307-INMET, e está posicionado geograficamente na latitude -9.388, longitude -40.523 e altitude 372,72 m. Os registros da série histórica foram iniciados em fevereiro de 2003 e se estendem até janeiro de 2023, com medições horárias que abrangem parâmetros como a data da medição, horário da medição, precipitação total para o intervalo temporal, pressão atmosférica ao nível da estação, pressão atmosférica reduzida ao nível do mar, pressão atmosférica máxima no intervalo temporal, pressão atmosférica mínima no intervalo temporal, radiação global, temperatura do ar no bulbo seco, temperatura do ar no ponto de orvalho, temperatura máxima horária, temperatura mínima, temperatura no ponto de orvalho, temperatura mínima no ponto de Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 8 orvalho, umidade relativa do ar, umidade relativa máxima, umidade relativa mínima, direção do vento, velocidade média do vento, velocidade máxima, dentre outros parâmetros. 3.2 TRATAMENTO DOS DADOS Inicialmente, adotou-se a estratégia de preenchimento de registros temporais que continham dados inconsistentes com a realidade, substituindo pelo valor médio correspondente ao respectivo parâmetro. Essa abordagem foi aplicada visando mitigar lacunas nos dados. Entretanto, é importante destacar que essa ação induziu uma ligeira volatilidade nos resultados, com uma magnitude da ordem de 10−7. Vale ressaltar que essa volatilidade é decorrente do próprio processo de preenchimento e deve ser interpretada considerando essa escala. Registros nos quais não era possível ou que não faziam sentido preencher com o valor médio geral da coluna foram eliminados de maneira integral. Essa medida foi adotada para assegurar a integridade e a coerência dos dados analisados. Após a execução dos procedimentos mencionados anteriormente, restaram um total de 122.444 registros temporais no banco de dados. Quanto ao processo de ajuste das informações coletadas, foi empregada a Equação 1, que descreve a técnica de normalização do logaritmo dos dados. Esse método de normalização do logaritmo busca padronizar os dados, levando em consideração a média e o desvio padrão do logaritmo natural das observações de treinamento. Ao aplicar essa técnica, os valores são ajustados de forma a considerar a distribuição estatística subjacente dos dados, contribuindo para uma análise mais coerente e comparável entre diferentes registros temporais. 𝐸𝑖′= 𝐿𝑛(𝐸𝑖+1)−𝑚é𝑑𝑖𝑎(𝐸𝑙𝑛) 𝑆𝑙𝑛 (1) Onde: 𝐸𝑖′ a informação temporal normalizada para o tempo i; 𝐸𝑖 é a informação temporal no tempo i; 𝑚é𝑑𝑖𝑎(𝐸𝑙𝑛) a média do Ln(Ei+1) de treino; 𝑆𝑙𝑛 o desvio padrão do Ln(Ei) de treino. No tocante aos dados de entrada e saída dos modelos, procedeu-se ao cálculo e organização das correlações possíveis entre as variáveis, empregando o método de Pearson, conforme delineado por Cohen et al. (2009). Com o intuito de calcular essas correlações, foi utilizada a função integrada da biblioteca Pandas do Python. Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 9 Os coeficientes de correlação resultantes aparecem como matrizes, oferecendo uma visualização clara das relações entre as variáveis coletadas. Valores próximos de 1 indicam uma correlação positiva forte, sugerindo uma relação direta entre as variáveis. Por outro lado, valores próximos de -1, indicam correlações mais fracas e, em alguns casos, negativas, onde uma variável tende a aumentar enquanto a outra diminui. Para investigar as relações não lineares entre variáveis, recorreu-se ao coeficiente de correlação não linear de Spearman. Segundo Yu e Hutson (2024), os valores obtidos variam de -1 a 1. Um valor próximo de 1 indica uma correlação forte e positiva, indicando que, conforme uma variável aumenta, a outra também tende a aumentar, seguindo uma tendência monotônica. Por outro lado, um valor próximo de -1 sugere uma correlação forte e negativa, denotando que, à medida que uma variável aumenta, a outra tende a diminuir, seguindo uma tendência decrescente monotônica. Um valor próximo de 0 sugere uma correlação fraca ou nula, indicando uma ausência de relação monotônica entre as variáveis. 3.3 ELABORAÇÃO DOS ALGORITMOS UTILIZADOS Para este estudo, uma série de algoritmos relevantes foram selecionados para análise. Entre estes, destacam-se a aplicação das máquinas de suporte vetorial (SVM), árvore de decisão (DT), florestas aleatórias (RF), redes neurais artificiais (ANN) e reforço de gradiente (GB). Essa seleção contempla uma variedade de abordagens que abrangem desde métodos mais tradicionais, como árvores de decisão e máquinas de suporte vetorial, até técnicas mais avançadas, como as redes neurais artificiais. A escolha desses algoritmos se baseou em sua capacidade de lidar com a complexidade e a não linearidade dos dados hidrometeorológicos, bem como em sua eficácia na realização de tarefas de previsão e modelagem. Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 16 GBR e ANN demonstraram NSE variando de 0,449 a 0,458, com coeficientes de correlação acima de 0,67 e RMSE na faixa de 3,692 a 3,723. Ao comparar o modelo ANN com o mesmo algoritmo desenvolvido por Prieto et al. (2019), ambos para intervalos maiores de tempo, temos um desempenho muito semelhante. Tabela 1 Resultado das métricas para a relação temperatura do ar versus umidade relativa do ar. Modelo NSE d r c KGE R² RMSE SM SVM 0,408 0,833 0,877 0,73 0,774 0,770 13,059 14,667 DT 0,774 0,934 0,88 0,822 0,838 0,775 8,063 9,04 RF 0,780 0,935 0,884 0,826 0,842 0,781 7,966 8,918 GBR 0,775 0,934 0,881 0,823 0,840 0,777 8,048 9,019 ANN 0,770 0,932 0,878 0,818 0,834 0,770 8,146 9,145 NSE=coeficiente de eficiência de Nash-Sutcliffe; r= Índice de Correlação de Pearson; c= índice de desempenho do modelo; KGE= Índice de Eficiência Kling-Gupta; R²= R quadrado; RMSE= Erro Quadrático Médio da Raiz; SM= Somatório das Métricas; SVM= máquina de suporte vetorial; DT= árvore de decisão; RF= floresta aleatória; GBR= reforço de gradiente; ANN= rede neural artificial. Tabela 2 Resultado das métricas para a relação entre a variável de entrada, temperatura do ar (bulbo seco) horária, e a variável de saída, também relacionada à temperatura do ar (bulbo seco) com um intervalo de três dias. Modelo NSE d r c KGE R² RMSE SM SVM 0,072 0,699 0,765 0,535 0,595 0,585 4,293 7,043 DT 0,576 0,847 0,759 0,643 0,649 0,576 2,901 4,850 RF 0,584 0,850 0,764 0,650 0,652 0,584 2,875 4,791 GBR 0,583 0,860 0,765 0,658 0,689 0,586 2,878 4,738 ANN 0,584 0,851 0,764 0,650 0,656 0,584 2,874 4,785 Analisando a relação entre a temperatura do ar (bulbo seco) como variável de entrada e a previsão da temperatura do ponto de orvalho com um intervalo de sete dias como variável de saída (Figuras 2e e 3e) (Tabela 5). O modelo SVM apresentou um NSE negativo (-11,042), indicando um desempenho substancialmente inferior em relação aos demais modelos testados, situação comparável apenas com o pior caso de Dayal et al. (2021). Seus coeficientes de correlação (d=0,331, r=0,678, c=0,224, KGE=-0,251) sugerem uma relação limitada entre as variáveis, enquanto o RMSE de 16,367 aponta para uma precisão insatisfatória na previsão. Em contraste, os modelos DT, RF, GBR e ANN demonstraram NSE variando de 0,447 a 0,460, com coeficientes de correlação superiores a 0,67 e RMSE na faixa de 3,467 a 3,509. Na combinação, o modelo de destaque foi o GBR, assim como em Xu et al. (2023), esse modelo apresentou uma maior velocidade para o processamento e para a otimização, mesmo utilizando parâmetros hidrológicos diferentes em cada estudo. Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 17 Tabela 3 Resultado das métricas para a relação entre a temperatura do ar (bulbo seco) como variável de entrada e a umidade relativa do ar com um intervalo de 3 dias como variável de saída. Modelo NSE d r c KGE R² RMSE SM SVM 0,181 0,638 0,705 0,449 0,358 0,497 16,044 19,202 DT 0,506 0,815 0,712 0,580 0,59 0,507 12,455 14,745 RF 0,506 0,815 0,712 0,580 0,588 0,506 12,455 14,748 GBR 0,499 0,811 0,707 0,573 0,584 0,499 12,547 14,874 ANN 0,502 0,811 0,709 0,575 0,584 0,503 12,506 14,822 Tabela 4 Resultado das métricas para a relação entre a temperatura do ar (bulbo seco) como variável de entrada e a previsão da temperatura do ar (bulbo seco) com um intervalo de 7 dias como variável de saída. Modelo NSE d r c KGE R² RMSE SM SVM -5,202 0,388 0,627 0,243 0,437 0,393 12,489 21,601 DT 0,453 0,783 0,673 0,528 0,545 0,453 3,710 6,275 RF 0,456 0,784 0,676 0,530 0,544 0,457 3,698 6,250 GBR 0,449 0,795 0,676 0,537 0,576 0,457 3,723 6,232 ANN 0,458 0,785 0,677 0,532 0,546 0,459 3,692 6,234 Tabela 5 Resultado das métricas para a relação entre a temperatura do ar (bulbo seco) como variável de entrada e a previsão da temperatura do ponto de orvalho com um intervalo de sete dias como variável de saída. Modelo NSE d r c KGE R² RMSE SM SVM -11,042 0,331 0,678 0,224 -0,251 0,46 16,367 31,967 DT 0,454 0,787 0,675 0,531 0,551 0,455 3,484 6,032 RF 0,458 0,788 0,677 0,534 0,551 0,459 3,473 6,006 GBR 0,447 0,795 0,675 0,537 0,578 0,456 3,509 6,021 ANN 0,460 0,788 0,679 0,535 0,553 0,461 3,467 5,992 Após realizadas as análises para diversos modelos e variáveis de entrada e saída, é importante destacar que para as demais combinações testadas, não foram identificadas informações relevantes nos resultados. Considerando todos os resultados encontrados, foram identificadas combinações envolvendo temperatura do ar e do ponto de orvalho, e umidade relativa do ar que conseguiram gerar um desempenho suficiente para serem consideradas em aplicações práticas utilizando os algoritmos desenvolvidos. Infelizmente, resultados com bons desempenhos para a precipitação não foram obtidos, diferentemente de Sáez (2018) onde a maioria de seus modelos com melhores resultados foram de precipitação e vazão. Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 18 Ao avaliar os valores das métricas, constatou-se que o algoritmo de floresta aleatória obteve o melhor desempenho. No entanto, ao considerar o número de ocorrências em que cada algoritmo teve um bom resultado, o reforço de gradiente e as redes neurais artificiais emergiram como vencedores do título de melhor algoritmo para o estudo. 5 CONCLUSÃO Com base nas análises realizadas utilizando diversos modelos e combinações de variáveis de entrada e saída, torna-se evidente que determinadas configurações se destacaram, proporcionando insights valiosos sobre a relação entre as variáveis climáticas estudadas. Ao considerar a temperatura do ar como variável de entrada e a umidade relativa do ar como saída, especialmente no intervalo temporal de 0 dias, os resultados obtidos por diferentes algoritmos demonstraram consistência e desempenho satisfatório, exceto para o algoritmo SVM, que apresentou um desempenho inferior. No entanto, para outras combinações de variáveis, como a relação entre a temperatura do ar e a umidade relativa do ar com intervalos maiores, os modelos DT, RF, GBR e ANN se destacaram, exibindo resultados mais precisos e consistentes, enquanto o SVM teve um desempenho inferior. É relevante observar que, embora algumas relações tenham sido identificadas como moderadas ou apresentaram desempenho inferior, isso proporcionou uma compreensão mais profunda das interações entre as variáveis climáticas estudadas. Modelos como DT, RF, GBR e ANN mostraram uma capacidade mais robusta de previsão e precisão em diversas combinações de variáveis, evidenciando sua aplicabilidade e confiabilidade para esses contextos específicos. AGRADECIMENTOS O presente trabalho foi realizado com apoio da Universidade Federal de Pernambuco (UFPE) e da Coordenação de Aperfeiçoamento de Pessoal de Nível Superior – Brasil (CAPES). Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 19 REFERÊNCIAS Alaneme, U. G.; Mbadike, E. M. (2019). Modelling of the mechanical properties of concrete with cement ratio partially replaced by aluminium waste and sawdust ash using artificial neural network. SN Applied Sciences, v. 1, n. 11, p. 1514. Antoniadis, A; lambert, L. S.; Poggi, J. M. (2021) Random forests for global sensitivity analysis: A selective review. Reliability Engineering & System Safety, v. 206, p. 107312. Braz, J. A. G. (2023). Predição de velocidade de ventos para geração eólica, utilizando aprendizado de máquina. Trabalho de Conclusão de Curso. Chen, R. C.; Dewi, C.; Huang, S. W.; Caraka, R. E. (2020). Selecting critical features for data classification based on machine learning methods. JouANNl of Big Data, v. 7, n. 1, p. 52. Cohen, I.; Huang, Y.; Chen, J.; Benesty, J. (2009). Pearson correlation coefficient. Noise reduction in speech processing, p. 1-230. Springer Berlin. Dalla T. D.; Lombardi, A.; Menapace, A.; Zanfei, A.; Righetti, M. (2024). Exploring the feasibility of Support Vector Machine for short-term hydrological forecasting in South Tyrol: challenges and prospects. Discover Applied Sciences, v. 6, n. 4, p. 154. Dayal, D.; Gupta, P. K.; Pandey, A. (2021). Streamflow estimation using satellite-retrieved water fluxes and machine learning technique over monsoon-dominated catchments of India. Hydrological Sciences JouANNl, v. 66, n. 4, p. 656-671. Huang, H.; Liang, Z.; Li, B.; Wang, D.; Hu, Y.; Li, Y. (2019). Combination of multiple datadriven models for long-term monthly runoff predictions based on Bayesian model averaging. Water Resources Management, v. 33, p. 3321-3338. Kamir, E.; Waldner, F.; Hochman, Z. (2020). Estimating wheat yields in Australia using climate records, satellite image time series and machine learning methods. ISPRS JouANNl of Photogrammetry and Remote Sensing, v. 160, p. 124-135. Lal, A.; Datta, B. (2019). Multi-objective groundwater management strategy under uncertainties for sustainable control of saltwater intrusion: Solution for an island country in the South Pacific. JouANNl of Environmental Management, v. 234, p. 115-130. Latif, S. D.; Ahmed, A. N. (2023). A review of deep learning and machine learning techniques for hydrological inflow forecasting. Environment, Development and Sustainability, v. 25, n. 11, p. 12189-12216. Liang, Z.; Tang, T.; Li, B.; Liu, T.; Wang, J.; Hu, Y. (2018). Long-term streamflow forecasting using SWAT through the integration of the random forests precipitation generator: case study of Danjiangkou Reservoir. Hydrology Research, v. 49, n. 5, p. 1513-1527. Moraes, R. G. S.; Lima, E. F.; Souza, P. L. O.; Damascena, J. F.; Silva, C. M. (2023). Métodos de estimativa da evapotranspiração de referência no período seco e chuvoso em Imperatriz, MA. Revista Brasileira de Climatologia, v. 33, p. 169-188. Nachappa, T. G.; Piralilou, S. T.; Gholamnia, K.; Ghorbanzadeh, O.; Rahmati, O.; Blaschke, T. (2020). Flood susceptibility mapping with machine learning, multi-criteria decision Estimativa Futura de Variáveis Hidrometeorológicas Utilizando Técnicas de Aprendizagem de Máquina: Uma Abordagem Comparativa ___________________________________________________________________________ Rev. Gest. Soc. Ambient. | Miami | v.18.n.6 | p.1-20 | e08267 | 2024. 20 analysis and ensemble using Dempster Shafer Theory. JouANNl of Hydrology, v. 590, p. 125275. Nguyen, T.; Nguyen, B. M.; Nguyen, G. (2019). Building resource auto-scaler with functionallink neural network and adaptive bacterial foraging optimization. InteANNtional Conference on Theory and Applications of Models of Computation, p. 501-517. Prieto, C.; Le Vine, N.; Kavetski, D.; García, E.; Medina, R. (2019). Flow prediction in ungauged catchments using probabilistic random forests regionalization and new statistical adequacy tests. Water Resources Research, v. 55, n. 5, p. 4364-4392. Sáez, P. J. (2018). Simulación de procesos hidrológicos utilizando técnicas de machine learning y modelos hidrológicos (Tese de doutorado). Universidad Católica de Murcia. Senocak, A. U. G.; Yilmaz, M. T.; Kalkan, S.; Y. I. (2023). An explainable two-stage machine learning approach for precipitation forecast. JouANNl of Hydrology, v.627. Thieu, N.; Barma, S.; Lam, V.; Kisi, O.; Mahesha, Amai. (2023). Groundwater level modeling using augmented artificial ecosystem optimization. JouANNl of Hydrology, v. 617. Valipour, M.; Khoshkam, H.; Bateni, S. M.; Jun, C. (2024). Machine-Learning-based shortterm forecasting of daily precipitation in different climate regions across the contiguous United States. Expert Systems with Applications, v. 238. Xu, K.; Han, Z.; Xu, H.; Bin, L. (2023). Rapid prediction model for urban floods based on a light gradient boosting machine approach and hydrological-hydraulic model. InteANNtional JouANNl of Disaster Risk Science, v. 14, n. 1, p. 79-97. Yu, H.; Hutson, A. D. (2024). A robust Spearman correlation coefficient permutation test. Communications in Statistics-Theory and Methods, v. 53, n. 6, p. 2141-2153.