Full text
Proyecto Fin de Carrera Ingeniería de Telecomunicación Formato de Publicación de la Escuela Técnica Superior de Ingeniería Autor: F. Javier Payán Somet Tutor: Juan José Murillo Fuentes Dep. Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2013 Trabajo Fin de Grado Grado en Ingeniería de Tecnologías Industriales Mención Automática Estimación espacial de la temperatura mediante geoestadística y aprendizaje automático no supervisado Autor: Andrés Moreno Muñoz Tutora: Amparo Núñez Reyes Dpto. Ingeniería de Sistemas y Automática Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025
Trabajo Fin de Grado Grado en Ingeniería de Tecnologías Industriales Mención Automática Estimación espacial de la temperatura mediante geoestadística y aprendizaje automático no supervisado Autor: Andrés Moreno Muñoz Tutora: Amparo Núñez Reyes Profesora Titular de Universidad Dpto. Ingeniería de Sistemas y Automática Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025
Trabajo Fin de Grado: Estimación espacial de la temperatura mediante geoestadística y aprendizaje automático no supervisado Autor: Andrés Moreno Muñoz Tutora: Amparo Núñez Reyes El tribunal nombrado para juzgar el trabajo arriba indicado, compuesto por los siguientes profesores: Presidente: Vocal/es: Secretario: acuerdan otorgarle la calificación de: El Secretario del Tribunal Fecha:
Agradecimientos Q uiero dedicar unas palabras de agradecimiento a todas las personas que han contribuido en el camino hasta la realización de este Trabajo de Fin de Grado, que pone fin a esta etapa en la Universidad. En primer lugar, agradezco a mi tutora, DªAmparo Núñez Reyes, sus valiosos consejos a lo largo de este proyecto. Sus conocimientos han sido fundamentales para la culminación de este trabajo. También quiero agradecer a mis compañeros, quienes me han brindado su amistad y su ejemplo y han compartido conmigo momentos inolvidables durante estos años. A mi familia, gracias por vuestro amor incondicional y a todos mis queridos amigos, gracias por vuestra paciencia y compañía en cada etapa de mi formación académica. Sin vosotros no habría llegado hasta aquí. Andrés Moreno Muñoz Sevilla, 2025 I
Resumen E ste trabajo se enmarca en la investigación actual sobre control predictivo distribuido en modelos espacio-temporales. La capacidad para estimar con precisión variables climatológicas como temperatura, radiación solar y humedad en un territorio es esencial, no solo para la gestión ambiental, la planificación territorial y la formulación de políticas climáticas, sino también para el correcto funcionamiento de los sistemas de Control Predictivo Basado en Modelo (MPC). El objetivo de este trabajo, es aplicar una metodología destinada a predecir el comportamiento de variables meteorológicas, especialmente la temperatura en la Comunidad Autónoma de Andalucía. Para evaluar su eficacia se realizan diferentes pruebas sobre un conjunto de datos históricos recopilados por las estaciones meteorológicas andaluzas. La metodología aplicada, combina el uso de Mapas Autoorganizados (Self-Organizing Maps, SOM) con Kriging Ordinario. La primera técnica permite la identificación de patrones climáticos latentes y la reducción de la dimensionalidad del conjunto de datos, preservando las relaciones topológicas inherentes a las mediciones. Por su parte, el Kriging Ordinario como técnica de interpolación geoestadística, permite estimar los valores de las variables meteorológicas en ubicaciones no muestreadas, aprovechando la estructura de dependencia espacial existente entre las observaciones. Esta combinación de técnicas, permitiría mejorar la representación espacial de las condiciones climáticas, proporcionando una herramienta robusta para el análisis y predicción de variables de interés ambiental. III
2Capítulo 1. Introducción En esta línea y relacionado con estas dos metodologías, el presente trabajo tiene como objetivo la aplicación de ambas herramientas al caso particular de la Comunidad Autónoma de Andalucía, utilizando un conjunto de datos históricos que comprende mediciones de temperatura media mensual del año 2023. Dichas mediciones provienen de las 96 estaciones meteorológicas distribuidas a lo largo de Andalucía, que permiten tener una base adecuada para hacer pruebas y evaluar la capacidad predictiva de estas técnicas. El principal impedimento con el que tendrán que lidiar será la distribución no homogénea de las estaciones meteorológicas. Figura 1.1 Red de Estaciones Meteorológicas de Andalucía. Para alcanzar el objetivo propuesto, se plantean el análisis comparativo de dos métodos para la predicción de la temperatura media en Andalucía: • Kriging Ordinario aplicado directamente a los datos reales: en un primer método, se aplicará el Kriging Ordinario directamente sobre los registros de temperatura media mensual recopilados, permitiendo evaluar la capacidad predictiva del método de Kriging sin aplicar técnicas de reducción de datos previamente [4]. • Aplicación de Mapas Autoorganizados y posterior interpolación con Kriging: en un segundo método, se entrenará una red SOM con los datos históricos, extrayendo los vectores de pesos de las neuronas como una representación comprimida y estructurada de la información climática. Posteriormente, se aplicará Kriging usando estos pesos, para analizar cómo la reducción de la dimensionalidad afecta a las predicciones realizadas. En la literatura ya se han explorado enfoques de este tipo integrando aprendizaje no supervisado con geoestadística, por ejemplo, para mejorar la predicción de propiedades del suelo [5]. Para llevar a cabo el estudio planteado, se utilizará el software MATLAB [6] en su versión R2024b, ya que facilita la implementación de los Mapas Autoorganizados.
3 El análisis comparativo de los resultados obtenidos en ambos métodos, permitirá estudiar las ventajas y limitaciones de integrar técnicas de aprendizaje automático en problemas tradicionales de interpolación espacial. Concretamente, permitirá evaluar si al combinar estas metodologías se logra una mejora en las predicciones realizadas exclusivamente con la técnica de interpolación (Kriging Ordinario). La motivación principal de este trabajo es el interés por adquirir competencias en técnicas de análisis de datos, particularmente en el ámbito del aprendizaje automático, un campo que está experimentando una expansión vertiginosa y cuyo impacto es creciente en numerosos sectores económicos y sociales. A través del estudio y aplicación de herramientas como los Mapas Autoorganizados y el Kriging, se pretende alcanzar la predicción de las variables meteorológicas analizadas así como explorar el potencial de estas metodologías en el tratamiento de datos espaciales de alta dimensionalidad. A continuación, en el capítulo dos se presentan los fundamentos teóricos de las metodologías empleadas, detallando su funcionamiento y resaltando los aspectos principales que permiten su aplicación en este trabajo. El capítulo tres, está destinado a la extracción de los datos y al análisis y procesamiento de los mismos. El capítulo cuatro, contiene la metodología y la discusión de los resultados obtenidos. Para finalizar, el último capítulo contiene las conclusiones obtenidas, líneas futuras y posibles extensiones del trabajo realizado.
2 Marco Teórico E l aprendizaje automático constituye una rama de la inteligencia artificial centrada en el desarrollo de algoritmos que permiten identificar patrones y relaciones complejas dentro de grandes volúmenes de datos [7]. Dentro de este campo, el aprendizaje no supervisado se caracteriza por analizar y agrupar conjuntos de datos en grupos o clusters. A diferencia del aprendizaje supervisado, donde se entrena a un modelo utilizando entradas y salidas conocidas, en el aprendizaje no supervisado el sistema recibe únicamente los datos de entrada, y debe encontrar patrones o agrupaciones relevantes por sí mismo. Este tipo de aprendizaje es especialmente útil en situaciones donde no es posible etiquetar grandes cantidades de datos o se buscan comportamientos indeseados. Otra característica de gran utilidad es la capacidad de reducir la dimensionalidad de los datos. Los modelos reducen el número de entradas para mejorar el tratamiento de las observaciones y facilitar la visualización. 2.1 Redes Neuronales Las Redes Neuronales son modelos computacionales, cuya estructura se inspira en el funcionamiento del cerebro humano. Su objetivo es aprender de los datos, identificar patrones y realizar diversas tareas en función de la finalidad para la que estén programadas [8]. Son capaces de aprender de la experiencia, provocando pequeños cambios dentro de su estructura que le permiten adaptarse a nuevas condiciones de entrenamiento y validación. Están compuestas por neuronas organizadas en diversas capas, que permiten modelar las complejas relaciones entre los datos. 5
6Capítulo 2. Marco Teórico Esto hace que este tipo de tecnologías se esté aplicando en múltiples áreas donde la detección de patrones complejos es crucial, como en el reconocimiento de imágenes, la traducción automática de lenguajes, la predicción de series temporales, el diagnóstico médico y la conducción autónoma, entre otras. Figura 2.1 Estructura de una Red Neuronal [7]. A partir de su situación dentro de la red, se pueden distinguir tres tipos de capas [7]: • Capa de entrada: Es la capa inicial que recibe los datos de entrada de fuentes exteriores. • Capas ocultas: Son las capas intermedias donde se realizan los cálculos y transformaciones para aprender patrones complejos en los datos. • Capa de salida: Es la capa final que produce el resultado o la predicción basada en los datos procesados por las capas anteriores. En el caso de una red no supervisada, la capa de salida no está directamente definida, sino que la misma estructura de la red y los patrones identificados pueden ser reconocidos como la propia salida. 2.1.1 Funcionamiento de las Redes Neuronales El funcionamiento de una Red Neuronal se basa en la transmisión de información y transformación de la arquitectura de capas de neuronas. Cada una de las neuronas recibe múltiples entradas, realiza una combinación ponderada de ellas, aplica una función de activación no lineal y transmite el resultado a las neuronas de la siguiente capa. Una vez definida la arquitectura de la red neuronal, su funcionamiento durante el proceso de aprendizaje puede dividirse en varias etapas [9]: • Propagación hacia adelante (forward propagation): Los datos de entrada se transmiten a través de las distintas capas de la red. Cada neurona recibe una combinación lineal de sus entradas ponderadas, le aplica una función de activación no lineal (como ReLU, sigmoide o tanh) y transmite el resultado a la
2.1 Redes Neuronales 7 siguiente capa. De este modo, todas las neuronas contribuyen simultáneamente al cálculo de la salida final, cada una aportando una parte del procesamiento de la información. • Cálculo del error: Una vez obtenida la salida de la red, esta se compara con el valor deseado (en problemas supervisados) mediante una función de error o pérdida, como el error cuadrático medio o la entropía cruzada. Esta medida cuantifica el grado de desacierto del modelo. • Retropropagación del error (backpropagation): El error calculado se propaga hacia atrás a lo largo de la red, capa por capa, actualizando los pesos de todas las neuronas mediante algoritmos de optimización como el descenso del gradiente. Este ajuste busca minimizar el error en las siguientes iteraciones, permitiendo que la red aprenda patrones complejos en los datos. 2.1.2 Redes Neuronales No Supervisadas Hasta ahora, se ha abordado el funcionamiento general de las redes neuronales, donde el proceso requiere de un conjunto de datos de entrada y sus correspondientes salidas deseadas [7]. No obstante, existen numerosas situaciones prácticas donde no se dispone de dicha información etiquetada. Ante esta limitación, surgen las RN de aprendizaje no supervisado, cuyo objetivo principal es identificar patrones, comportamientos concretos o relaciones ocultas dentro de los datos de entrada. Estas redes reorganizan su arquitectura interna mediante mecanismos de aprendizaje competitivo y adaptación progresiva. El principal resultado del proceso de autoorganización, es la formación de clústeres o grupos de datos similares [10]. De esta manera, la red neuronal es capaz de clasificar y estructurar los datos sin necesidad de datos etiquetados previamente, sino que se basa únicamente en las relaciones internas entre los patrones presentados. Este agrupamiento emerge de la competencia entre neuronas, donde cada unidad trata de especializarse en representar una región concreta del espacio de características. 2.1.3 Proceso de Aprendizaje En el proceso de aprendizaje no supervisado, las RN ajustan sus pesos en función de las entradas que reciben, pero sin una finalidad concreta u objetivo final. El aprendizaje competitivo se basa en la idea de que las neuronas compiten por la representación de los patrones de entrada [10]. Durante cada ciclo de aprendizaje, la neurona más cercana a una entrada en particular, se convierte en la "ganadora" y ajusta sus parámetros internos para representar esa entrada. Este proceso de competencia es crucial, ya que asegura que las neuronas no solo respondan a las entradas, sino que también aprendan a especializarse en características específicas de los datos, lo que lleva a una distribución más eficiente de las neuronas en el espacio.
8Capítulo 2. Marco Teórico Uno de los pasos clave del aprendizaje no supervisado es la adaptación cooperativa. Aunque solo una neurona es la "ganadora" y puede asociarse a una o varias entradas concretas, las neuronas cercanas a la ganadora también ajustan sus pesos, aunque en menor medida. Este ajuste cooperativo permite que las neuronas vecinas aprendan representaciones similares, favoreciendo la organización topológica de los datos. Como consecuencia, las neuronas vecinas tienden a especializarse en patrones de entrada que son similares entre sí, preservando la estructura y relaciones entre los datos de entrada. Es fundamental que la relación espacial entre los datos se mantenga, ya que permite una representación más comprensible de los datos [7]. Los clusters son grupos de neuronas que representan patrones similares de datos. La capacidad de formar estos clústers uno de los aspectos más poderosos de las RN no supervisadas. La competencia entre neuronas, da lugar a la formación de grupos dentro de la red. A medida que el aprendizaje avanza, las neuronas más cercanas entre sí tienden a ajustar sus pesos de manera similar. Este proceso se repite iterativamente, y como resultado, las neuronas se agrupan en regiones del espacio de características que son similares. Las entradas que caen en una región particular formarán parte del mismo grupo, mientras que las entradas que caen en regiones diferentes de la red pertenecerán a grupos distintos. Además, resultan muy útiles a la hora de hacer representaciones gráficas y entender qué está ocurriendo con los datos para su posterior análisis. El proceso de aprendizaje está marcado por una serie de parámetros que determinan cómo evoluciona el aprendizaje de la red en cada una de las iteraciones [11]. El learning rate, es un parámetro fundamental en los algoritmos de aprendizaje de redes neuronales. Es el factor que determina cómo de grande o pequeño será el ajuste de los pesos, variando la velocidad de aprendizaje. Su valor influye directamente en la convergencia del modelo y la estabilidad del proceso de entrenamiento, siendo crucial para asegurar el correcto funcionamiento del algoritmo. En el aprendizaje no supervisado, no existe una función de coste a minimizar concreta debido a que, como ya se expuso anteriormente, el aprendizaje es competitivo. Otro parámetro a tener en cuenta es la función de vecindad [12], que determina el grado de influencia que las neuronas vecinas tienen sobre la neurona ganadora durante el proceso de aprendizaje competitivo. Este parámetro, ayuda a preservar la topología de los datos, haciendo que las neuronas cercanas representen entradas similares.
2.1 Redes Neuronales 9 La función de vecindad, determina cómo de cerca tienen que estar las neuronas para que puedan ajustarse a la entrada y existen distintas fórmulas para expresarla, aunque la mas común es la gaussiana: hi j(t) = exp −d2 i j 2σ(t)2!(2.1) En esta ecuación: •hi j(t)representa la función de vecindad en el tiempo t. •di j es la distancia entre la neurona ganadora iy la neurona j. •σ(t) es un parámetro que controla el alcance de la vecindad y decrece con el tiempo para permitir la estabilidad de la red. A continuación se expone cuál podría ser la fórmula general de actualización de los pesos de una neurona [13]. wi(t+1) = wi(t) +η·hi j ·(x−wi(t)) (2.2) En esta ecuación: •wi(t)representa el vector de pesos de la neurona ien el tiempo t. •η es la tasa de aprendizaje (learning rate), que controla la magnitud del ajuste de los pesos. •hi j es una función de vecindad que determina cuánto influye la entrada x en la actualización de los pesos de la neurona iy sus vecinas. •xes el vector de entrada presentado a la red. Esta fórmula refleja cómo los pesos de una neurona se ajustan en función de la entrada y la influencia de las neuronas vecinas, permitiendo que la red aprenda y se organice de manera progresiva [11]. En cuánto al entrenamiento de la red, este puede dividirse en dos fases [14]: • Fase de ordenamiento: está caracterizada por un learning rate y una vecindad elevados y su objetivo es establecer la organización topológica básica de los datos. • Fase de convergencia: Los parámetros de learning rate y vecindad son muy reducidos y se centra en afinar la representación, ajustando las posiciones de las neuronas para optimizar la fidelidad del mapeo.
10 Capítulo 2. Marco Teórico Este esquema de evolución permite a las redes neuronales no supervisadas capturar tanto las características globales pero sin sacrificar la representación de las relaciones locales de los datos de entrada. El campo del aprendizaje no supervisado posee otros modelos con arquitecturas relevantes, como los autoencoders o las redes de Hebb [15], cada una diseñada para tareas específicas de reducción de dimensionalidad, agrupamiento o descubrimiento de relaciones en los datos. Sin embargo, todas ellas comparten la misma premisa fundamental: aprender sin disponer de salidas etiquetadas, confiando en la estructura inherente de los datos. También poseen limitaciones, como la sensibilidad a la selección de parámetros iniciales, la dificultad para interpretar los resultados y la dependencia de la correcta elección del tamaño y estructura de la red. En este contexto, surge una de las arquitecturas más reconocidas y extendidas: el Mapa de Kohonen (Self-Organizing Map, SOM) [11], que combina el aprendizaje competitivo con la preservación de la topología de los datos, ofreciendo una representación bidimensional fácilmente interpretable de espacios de alta dimensión.
2.2 Mapas Autoorganizados (SOM) 11 2.2 Mapas Autoorganizados (SOM) Los Mapas Autoorganizados o Redes de Kohonen, son un tipo de red neuronal no supervisada, introducida por T. Kohonen en 1982 [11]. Surgen de la necesidad de visualizar y representar datos complejos de alta dimensionalidad de una manera comprensible. En numerosos problemas reales —como el reconocimiento de patrones, el análisis de datos o la exploración de grandes bases de información— los conjuntos de datos presentan una estructura interna complicada que no resulta evidente a simple vista. El objetivo de estos Mapas, es poder representar conjuntos de datos de alta dimensionalidad en un plano de dos o tres dimensiones, manteniendo la topología del espacio orginal. Consigue que las muestras que se encuentran próximas unas a otras, lo sigan estando tras la representación simplificada. 2.2.1 Funcionamiento y Fases Cómo ya se explicó anteriormente, la red sigue un proceso de aprendizaje competitivo, donde cada vector de pesos asociados a las neuronas se irá modificando en cada una de las iteraciones. En este caso, el proceso de aprendizaje de la red puede dividirse en cuatro partes: Inicialización, Competición, Cooperación y Adaptación [16]. Inicialización En esta fase se realiza la inicialización de los pesos de las neuronas, que representan las coordenadas de las neuronas en el espacio de entrada y son fundamentales para el comportamiento posterior de la red. La inicialización puede hacerse de manera aleatoria o siguiendo una distribución basada en los datos de entrada. Una buena elección en este paso acelera notablemente la convergencia y mejora la calidad final de la organización del mapa. En la práctica, es habitual inicializar los pesos de forma aleatoria dentro del rango de los datos normalizados, garantizando así que todas las regiones del espacio de entrada estén inicialmente representadas por alguna neurona de la red. Esta distribución inicial determina los puntos de partida para la fase de entrenamiento y tiene una influencia importante en la calidad de la autoorganización posterior.
18 Capítulo 2. Marco Teórico métodos es que tiene en cuenta la relación espacial entre los datos. Para ello, se basa en funciones llamadas variogramas, que describen cómo cambia la similitud entre los valores de una variable en función de la distancia. Gracias a esta modelización del comportamiento espacial, se consiguen estimaciones más realistas y ajustadas a los datos reales [23]. Tipos y aplicaciones El método del Kriging posee varias versiones adaptadas a distintas situaciones y supuestos sobre los datos [24]. A continuación, se describen los tipos más comunes, detallando sus características y utilidades: • Kriging Simple (SK): El Simple Kriging es la forma más básica del Kriging, y se caracteriza por asumir que la media de la variable a estudiar es constante y conocida en todo el dominio de estudio. Esto significa que, el valor de la variable depende únicamente de la distancia y la correlación espacial con los puntos conocidos. Sin embargo, el Simple Kriging es poco utilizado en la práctica debido a que resulta muy difícil conocer la media exacta de la variable. A pesar de esto, se utiliza en contextos específicos donde el conocimiento previo de la media es robusto, como en el análisis de contenidos minerales en la minería, donde las condiciones geológicas suelen ser bien comprendidas. • Kriging Ordinario (OK): El Kriging Ordinario es el tipo más común y utilizado. A diferencia del Simple Kriging, asume que la media de la variable es desconocida y varía de un punto a otro. El método es capaz de estimar la media de manera local, lo que lo hace mucho más flexible y aplicable a una variedad de contextos espaciales. Gracias a esta característica, se puede utilizar en estudios de fenómenos ambientales, como la meteorología (por ejemplo, la interpolación de temperaturas o precipitaciones), o en agricultura de precisión, donde la variabilidad del suelo y las condiciones climáticas cambian a lo largo del territorio.
2.3 Kriging 19 • Kriging Universal (UK): El Kriging Universal es adecuado para situaciones en las que se observa una tendencia o un comportamiento a largo plazo en los datos. A diferencia del Kriging Ordinario, el Kriging Universal modela esta tendencia mediante una función matemática (generalmente una polinómica), que permite incorporar una variabilidad estructural a lo largo del dominio, además de la variabilidad espacial. Este tipo de Kriging es ideal cuando los datos presentan una variación sistemática o una tendencia subyacente que no puede ser captada simplemente con la estimación de la media local. Un ejemplo de su aplicación sería en estudios de cambio climático o modelización de la calidad del aire, donde se espera que haya un cambio gradual en las variables (temperatura, concentración de contaminantes) en función de factores como la latitud, la altitud o la proximidad a fuentes de contaminación. Además de los tipos principales de Kriging, existen variantes especializadas que abordan diferentes necesidades en el análisis espacial. El Indicator Kriging (IK) se utiliza para variables categóricas o binarias y permite estimar la probabilidad de presencia o ausencia de una característica en un punto dado. El Disjunctive Kriging (DK) es adecuado para modelar fenómenos no lineales o discontinuos. Por último, el Kriging con tendencia (Trend Kriging) incorpora explícitamente una función de tendencia en el modelo, permitiendo capturar tanto la variabilidad local como los cambios sistemáticos a lo largo del espacio o el tiempo. La elección del método depende de las características de los datos y del objetivo del estudio. En este trabajo, se utilizará el Kriging Ordinario debido a que no se requiere suponer una tendencia global y a su vez permite obtener una estimación robusta para situaciones donde la media es desconocida y no constante. Otra posibilidad podría ser utilizar el Kriging Universal, donde se tiene en cuenta el largo plazo de forma más explícita. Tabla 2.1 Resumen de Tipos de Kriging. Tipo de Kriging Descripción SK Asume que la media es constante y conocida. OK La media es desconocida y varía en cada punto. UK Modela una tendencia global en los datos, como una función polinómica. IK Estima la probabilidad de presencia de una característica (categórica). DK Representa fenómenos no lineales o discontinuos. Trend Kriging Incorpora un modelo de tendencia en forma de función continua.
20 Capítulo 2. Marco Teórico Fundamento del Kriging Ordinario El objetivo del Kriging Ordinario es estimar el valor de una variable regionalizada Z(s0) en una ubicación desconocida s0 , a partir de n observaciones Z(s1),Z(s2),...,Z(sn) en ubicaciones conocidas s1,s2,...,sn . Para ello, se utiliza un estimador lineal [6]: Dado que los datos meteorológicos utilizados en este estudio presentan una distribución espacial irregular y no existe una tendencia global clara, el Kriging Ordinario se considera la técnica más adecuada. Su capacidad para estimar valores en ubicaciones no muestreadas sin asumir una media conocida, junto con su robustez en entornos con alta variabilidad local, lo convierten en una herramienta de gran utilidad para la interpolación de temperaturas, humedad y precipitaciones. ˆ Z(s0) = n ∑ i=1 λiZ(si)(2.6) donde λi son los pesos asignados a cada dato, determinados para cumplir dos condiciones fundamentales: •No sesgo (unbiasedness): Eˆ Z(s0)−Z(s0)=0(2.7) •Minimización de la varianza del error: σ2 K=Varˆ Z(s0)−Z(s0)(2.8) Para garantizar el no sesgo, se impone la siguiente restricción sobre los pesos: n ∑ i=1 λi=1(2.9) La minimización de la varianza del error, sujeta a la restricción anterior, se resuelve aplicando el método de los multiplicadores de Lagrange. Esto conduce al siguiente sistema de ecuaciones: (∑n j=1λjγ(si−sj)+ µ=γ(si−s0)para i=1,...,n ∑n j=1λj=1(2.10) donde: •γ(si−sj)es el valor del variograma entre los puntos siysj, •µes el multiplicador de Lagrange, •λjson los pesos a determinar.
2.3 Kriging 21 Este sistema puede escribirse en forma matricial como: γ11 ··· γ1n1 . . ..... . .. . . γn1··· γnn 1 1··· 1 0 λ1 . . . λn µ = γ1,0 . . . γn,0 1 (2.11) Este sistema se resuelve para encontrar los λiy el valor del multiplicador µ. Varianza del Error La varianza del error, σ2 K , es una medida fundamental de la precisión del estimador de Kriging Ordinario. Representa la incertidumbre asociada con la predicción de Z(s0) en la ubicación desconocida s0 , y se calcula como la varianza de la diferencia entre el valor estimado ˆ Z(s0) y el valor verdadero Z(s0) . Esta varianza se obtiene a partir de los pesos λiy el variograma de las ubicaciones cercanas: σ2 K= n ∑ i=1 n ∑ j=1 λiλjγ(si−sj)− n ∑ i=1 λiγ(si−s0)(2.12) Esta fórmula se deriva de la propiedad de minimización de la varianza en el proceso de Kriging. La varianza más baja indica una mayor precisión en la estimación, mientras que una varianza más alta refleja mayor incertidumbre. La estimación de la varianza es esencial para entender la calidad de las predicciones del Kriging, permitiendo evaluar la fiabilidad de los valores interpolados. Variogramas El variograma es una herramienta fundamental en geoestadística, ya que describe la dependencia espacial entre los datos [25]. Es el núcleo del método de Kriging, ya que proporciona la información necesaria para ponderar las muestras conocidas al estimar un valor desconocido. El variograma experimental se calcula a partir de los datos y luego se ajusta a un modelo teórico que se utiliza en la interpolación. Definición de variograma El variograma, denotado como γ(h) , se define como la mitad de la varianza del incremento entre dos valores de una variable regionalizada Z(x) separados por una distancia h[26]: γ(h) = 1 2Var[Z(x)−Z(x+h)] En la práctica, se estima a partir de un conjunto finito de datos como: ˆ γ(h) = 1 2N(h) N(h) ∑ i=1 [Z(xi)−Z(xi+h)]2 donde N(h)es el número de pares de datos separados por la distancia h.
22 Capítulo 2. Marco Teórico Interpretación del variograma El variograma describe cómo varía la similitud entre los valores de una variable espacial conforme aumenta la distancia entre ellos [26]: • Nugget: valor del variograma cuando h→0 . Representa errores de medida o variabilidad a escalas menores que la resolución de muestreo. • Sill: valor al que se estabiliza el variograma. Es igual a la varianza total de los datos si no hay tendencia. • Range: distancia a partir de la cual ya no hay correlación espacial. Para h> range, los valores se consideran independientes. Figura 2.3 Interpretación del Variograma. Modelos teóricos de variograma Para utilizar Kriging, es necesario ajustar el variograma experimental a un modelo teórico válido [27]. Los modelos más comunes son: •Modelo esférico: γ(h) = (C0+Ch3h 2a−h3 2a3i,si h≤a C0+C,si h>a •Modelo exponencial: γ(h) = C0+C1−e−h/a •Modelo gaussiano: γ(h) = C0+C1−e−(h2/a2)
2.3 Kriging 23 Donde C0 es el nugget, C es la varianza del sill, y a es el rango. Estos modelos permiten describir diferentes comportamientos espaciales de los datos. Por ejemplo, el modelo esférico es adecuado para fenómenos con un rango definido, mientras que el modelo exponencial se utiliza para fenómenos con una disminución gradual de la correlación espacial. El ajuste adecuado del variograma es fundamental, ya que determina el peso que se asigna a cada muestra en la estimación mediante Kriging. Un modelo mal ajustado puede producir estimaciones erróneas o mapas poco realistas. A continuación se presenta un ejemplo ilustrativo de un variograma experimental y su ajuste a un modelo teórico, comparando las tres posibilidades anteriores: Figura 2.4 Ejemplo de Ajuste de Variograma. A menudo, cada par de ubicaciones tiene una distancia única, y suele haber varios pares de puntos. Representar en diagramas todas las muestras se vuelve imposible. En lugar de representar cada par, se hace una división en bins de intervalo. En los casos que abordaremos en este trabajo, se define una distancia máxima para la que se considera que los datos tienen correlación espacial y se divide en intervalos. Por ejemplo, se calcula la semivarianza de todos los puntos que se encuentren a 100 kilómetros de distancia, definiendo una distancia máxima de 400 kilómetros, significa que la división ha sido de 4 bins.
24 Capítulo 2. Marco Teórico 2.4 SOM + Kriging Ordinario La metodología que combina SOM y Kriging Ordinario es un enfoque híbrido que permite mejorar la interpolación espacial de datos geográficos [6]. La combinación de ambas técnicas busca aprovechar la capacidad de los Mapas Autoorganizados para organizar conjuntos de datos en grupos o clusters, y posteriormente aplicar el Kriging Ordinario para lograr interpolaciones más precisas. Diversos estudios respaldan esta integración de técnicas, destacando la capacidad de segmentación de datos que poseen los Mapas Autoorganizados, [5] aplicándolos en ámbitos cómo la hidrología o la climatología. Numerosos investigadores han utilizado SOM para clasificar patrones de temperaturas, a escala regional y continental [28], demostrando la eficacia de SOM para identificar estructuras espaciales y subrayan la validez de complementar el análisis con interpolaciones geoestadísticas para conseguir resultados óptimos. Tras el entrenamiento de la red SOM, los datos de entrada —en este caso, series de temperatura, latitud y longitud— se transforman en una representación a través de neuronas, que constituyen un prototipo que resume las características de un subconjunto de datos similares. La asignación de cada muestra a su neurona más próxima (conocida como Best Matching Unit, BMU) permite reemplazar el valor original por una versión cuantizada, representativa de su grupo de pertenencia [11]. En lugar de aplicar Kriging Ordinario a cada grupo por separado, se propone otro enfoque. Este trabajo emplea la SOM como herramienta de cuantización: cada observación térmica, es sutituida por el valor correspondiente de su BMU, y posteriormente se calcula la media de estas temperaturas cuantizadas para cada estación meteorológica. Esto da lugar a un único valor representativo de cada estación, conservando la estrcutura espacial original pero libre de la tendencia de los datos originales y ruido que podrían afectar a la interpolación. Estas temperaturas cuantizadas, constituyen el conjunto de entrada sobre el que se aplica el Kriging Ordinario. Este procedimento combinado puede presentar varias ventajas frente a otros métodos tradicionales. En primer lugar, permite reducir la varianza dentro de los datos al sustituir las observaciones originales por neuronas, funcionando como filtro que permite mantener las relaciones toplógicas de las muestras. Desde el punto de vista geoestadístico, esta estructura permite obtener un variograma más estable [2], así como disminuir el coste computacional al reducir el número de datos a interpolar, por lo tanto, el ajuste del variograma y el cálculo de predicciones se vuelven más eficientes [29].
2.4 SOM + Kriging Ordinario 25 Figura 2.5 Resumen gráfico de técnicas de interpolación espacial. La figura 2.5 ilustra las dos metodologías que se siguen en este trabajo par abordar la interpolación de la temperatura en Andalucia mediante Kriging Ordinario. En la parte superior de la figura, se parte de los datos originales y se elimina la tendencia espacial, que es modelada mediante una regresión lineal en función de las coordenadas geográficas y los valores de temperatura. Posteriormente, estos residuos son los que se utilizan en el método de interpolación del Kriging Ordinario. Tras obtener estos valores interpolados de los residuos, se combinan con la tendencia original para obtener los valores finales. El segundo enfoque de la figura (SOM + Kriging Ordinario), parte también de los datos originales, pero no es necesario aplicar el detrending debido a que la red SOM al reorganizar los datos elimina la tendencia inherente de los datos. La red asigna a cada observación el valor de su BMU para cuantizar las observaciones. Estas temperaturas cuantizadas, son las entradas usadas en el método del Kriging Ordinario para interpolar y conseguir las predicciones finales. Las metodologías expuestas anteriormente, son las que se pondrán a prueba para evaluar la calidad de las predicciones que cada una es capaz de ofrecer.
3 Origen de los Datos y Preprocesamiento En este capitulo se explica cómo se realiza la extracción de datos de las variables meteorológicas, así cómo el análisis previo y procesamiento de los mismos. El objetivo de este trabajo es realizar una comparativa entre distintas metodologías para predecir temperaturas medias en una zona concreta de España. Se llevan a cabo distintas pruebas, donde se hace uso de SOM gracias al toolbox de Redes Neuronales de MATLAB y la técnica de interpolación geoestadística del Kriging. 3.1 Base de Datos Para la realización de las pruebas, se toma como zona de trabajo la Comunidad Autónoma de Andalucía, en el sur de España. Esta región se caracteriza por tener una de las temperaturas medias más altas del país, con puntos donde se llegan a alcanzar los 40 ◦ C. El clima es seco, y las precipitaciones suelen ser muy escasas. En cambio, existen puntos de gran altitud, donde las temperaturas toman valores anómalos en zonas como Sierra Nevada, donde el estudio de las predicciones será más desafiante. Figura 3.1 Situación geográfica de Andalucía [30]. 27
34 Capítulo 4. Resultados Experimentales Preparación de los datos Para llevar a cabo el análisis geoestadístico mediante Kriging ordinario, se seleccionaron los registros de temperatura correspondientes a los meses de diciembre, mayo y agosto. Estos datos fueron proporcionados por estaciones meteorológicas distribuidas a lo largo de la región de estudio, cada una con sus respectivas coordenadas geográficas (latitud y longitud). La elección de estos tres meses tiene como objetivo capturar el comportamiento térmico del territorio en momentos representativos del invierno, la primavera y el verano, respectivamente. El proceso de preparación de los datos se compone de varias etapas. Para empezar, se realizó un filtrado temporal para extraer manualmente los registros correspondientes a cada uno de los meses seleccionados. Durante esta fase, se identificaron aquellas estaciones que no disponían de datos para el mes específico, eliminándose tanto sus registros como sus coordenadas geográficas, con el fin de evitar inconsistencias y lagunas en las etapas posteriores del algoritmo de interpolación. Para la correcta implementación del algoritmo de predicción, se procedió a la conversión de las coordenadas geográficas de cada estación desde grados sexagesimales a decimales. Para calcular las distancias entre estaciones, se utilizó la fórmula de Haversine, que permite calcular la distancia entre dos puntos sobre la superficie terrestre, teniendo en cuenta su curvatura. Esta función es especialmente adecuada para contextos geográficos en los que se requiere una estimación precisa de la distancia entre pares de estaciones y la distancia entre ellas es significativa. Con el objetivo de facilitar la automatización del proceso, se implementó una función que permitía seleccionar las muestras correspondientes a un mes específico a partir del conjunto de datos históricos. Este procedimiento recorre todas las estaciones meteorológicas disponibles, identificando aquellas entradas cuya fecha coincide con el mes de interés y excluyendo automáticamente las que no presentan registros válidos.
4.1 Método 1: Kriging Ordinario 35 Debido a las distintas magnitudes de los atributos de interés (longitud,latitud y temperatura), se realizó la normalización de los datos dentro del rango (0,1), permitiendo que ninguna de las variables tenga más influencia en el algoritmo de predicción. Para llevar a cabo la interpolación espacial, se generó una malla de puntos de predicción que abarca todo el dominio geográfico de estudio. Esta malla se construyó considerando los valores extremos de latitud y longitud, dividiendo el área en una rejilla de miles de puntos, usando los grados como referencia para crear esta malla. Finalmente, las coordenadas de estos puntos fueron transformadas de grados a kilómetros para facilitar el funcionamiento del algoritmo de Kriging, que trabaja de forma más eficiente con distancias en unidades métricas. Para la implementación de los algoritmos en el software, que han usado como herramienta algunos generadores de código. Detección y corrección de deriva espacial Antes de aplicar el Kriging Ordinario, es necesario comprobar si las hipótesis hechas sobre el set de datos son ciertas. En este caso, el Kriging Ordinario asume que la media del proceso no cambia en el espacio, es decir, que cumple con la estacionaridad de primer orden. Para comprobar este aspecto, se lleva a cabo un test de deriva espacial, que evalúa si existe un gradiente sistemático asociado a las coordenadas espaciales. El test consiste en ajustar un modelo de regresión lineal que relaciona las coordenadas espaciales con la temperatura para determinar si existe una relación significativa entre ambas. Como resultado de este análisis, se obtienen una serie de coeficientes conocidos como p-values. Estos valores permiten contrastar la hipótesis de que la deriva espacial es inexistente. Se diferencian dos posibles casos, y en función del resultado del p-value global [33], se usa una estrategia distinta para realizar la interpolación; • Si p≥0,05 : El Kriging Ordinario (OK) es coherente y puede aplicarse directamente. •Si p<0,05: Existe deriva espacial, hay tres maneras de abordar el problema: –Eliminar la deriva mediante detrending. –Utilizar Kriging Universal (UK). – Aplicar un preprocesado que elimine la deriva (en este caso, SOM + OK). La relación entre la temperatura y las coordenadas espaciales puede modelarse mediante una regresión lineal múltiple de la forma: T=β0+βXX+βYY+ε(4.1)
36 Capítulo 4. Resultados Experimentales donde: •Tes la temperatura (variable dependiente), •XyYrepresentan las coordenadas espaciales en kilómetros, •β0es el término independiente, •βX y βY son los coeficientes que cuantifican la relación entre la temperatura y cada una de las coordenadas, •εes el término de error aleatorio. El test de deriva espacial se realiza para cada uno de los meses seleccionados, y los resultados se presentan en la siguiente tabla. Se muestra el p-valor global del test, así como los p-valores asociados a los coeficientes βX y βY . Un p-valor global menor que 0.05 indica que al menos uno de los coeficientes es significativamente diferente de cero, lo que sugiere la presencia de deriva espacial. Tabla 4.1 Resultados del test de deriva espacial para cada mes. Mes p-valor global p(βX)p(βY) Agosto 2023 0.0000 0.0000 0.0242 Abril 2023 0.0000 0.0000 0.0315 Diciembre 2023 0.0000 0.0000 0.0245 Dado que en todos los casos el p-valor global es menor que 0.05, se concluye que existe una deriva espacial significativa en los datos de temperatura para cada uno de los meses analizados. Esto implica que las temperaturas no son estacionarias en el espacio y que la relación entre las coordenadas espaciales y la temperatura debe ser considerada en el proceso de interpolación. En este caso, se ha optado por realizar el detrending a los datos para acabar con la deriva espacial. El detrending es una técnica empleada para eliminar tendencias en los datos, y permite cumplir con el objetivo de asegurar la estacionaridad de primer orden. Esta técnica identifica qué parte del comportamiento de la variable se debe a su ubicación (por ejemplo, un aumento constante de la temperatura hacia el sur o hacia zonas más bajas) y se elimina esta tendencia general de los valores observados.
4.1 Método 1: Kriging Ordinario 37 El resultado de esta eliminación, son una serie de valores residuales que ya no presentan una tendencia clara ligada al espacio, lo que permite analizar únicamente la variabilidad local y aplicar correctamente la interpolación. Tras interpolar sobre estos valores, es posible volver a añadir la tendencia estimada para reconstruir el valor final de la variable con mayor fidelidad. En conclusión, esta técnica asegura que las predicciones se basen en las relaciones espaciales reales entre puntos próximos, y no en una variación global que podría distorsionar la estructura obtenida a partir del variograma. Análisis y Cálculo de Variogramas Para cada mes, se calcula la distancia entre las estaciones meteorológicas utilizando la función Haversine, que permite obtener una estimación precisa de la distancia entre los pares de estaciones. Posteriormente, se calcula la semivarianza γ para cada par de estaciones utilizando la fórmula clásica: γ(h) = 1 2(T(i)−T(j))2 donde T(i) y T(j) son las temperaturas de las estaciones i y j , respectivamente, y h es la distancia entre ellas. Este cálculo se realizó para todos los pares únicos de estaciones en cada mes. A continuación, las distancias h se agruparon en bins (intervalos) de tamaño definido. En este apartado, se optó por 50 bins, con un valor máximo de h igual al 60% de la distancia máxima entre estaciones. Estos bins permiten calcular el promedio de la semivarianza para cada intervalo de distancia, obteniendo así el variograma experimental. La elección del número de bins y del rango de distancias es crucial para obtener una representación adecuada de la variabilidad espacial. Se tuvieron en cuenta distintas posibilidades, resultando la implementada en este trabajo la más fiable. Los variogramas experimentales obtenidos fueron los siguientes: Ajuste de Modelos de Variograma Una vez obtenidos los variogramas experimentales para cada mes, se proponen tres modelos de variograma: esférico, exponencial y gaussiano. Durante el desarrollo del trabajo, se desarrolló una función capaz de ajustar los tres modelos de variograma, decidiendo cuál de ellas era la mejor opción. Tras experimentar con la normalización de los datos, se optó por sacar los variogramas con las distancias en kilómetros y sin normalizar las temperaturas, debido a que a la hora de hacer las predicciones y mostrar los resultados, resulta más práctico hacerlo en términos de grados Celsius.
38 Capítulo 4. Resultados Experimentales (a) Variograma Experimental diciembre 2023. (b) Variograma Experimental Abril 2023. (c) Variograma Experimental Agosto 2023. Tabla 4.2 Parámetros del mejor modelo de variograma por mes (2023). Mes Modelo Nugget Sill Rango (km) Diciembre Gaussiano 0.2536 1.754 69.05 Abril Gaussiano 0.373 0.882 75.4 Agosto Gaussiano 0.4831 1.372 94.13 En diciembre, el modelo que mejor se ajusta al comportamiento espacial de la temperatura es el gaussiano, con un nugget muy bajo (0.2536). Este valor indica que apenas existe variabilidad a escala muy pequeña, lo cual es coherente con la estabilidad térmica típica del invierno, donde las condiciones atmosféricas suelen estar dominadas por sistemas regionales amplios y homogéneos. En abril, aunque el modelo sigue siendo el gaussiano, el nugget se incrementa ligeramente (0.373), lo que podría reflejar cierta inestabilidad asociada al cambio de estación o a la mayor variabilidad de fenómenos meteorológicos. Agosto, en cambio, presenta el nugget más alto de los tres meses analizados (0.4831), lo que sugiere una mayor variabilidad local, probablemente relacionada con diferencias de insolación, proximidad al mar o efectos orográficos.
4.1 Método 1: Kriging Ordinario 39 En cuanto al sill, los valores se mantienen relativamente bajos en todos los casos, con un máximo en agosto (1.372), seguido de diciembre (1.754) y abril (0.882). Este parámetro representa la variabilidad estructurada en los datos, por lo que el valor más alto en agosto puede estar indicando que, aunque las temperaturas tienden a ser más uniformes, todavía existen diferencias relevantes entre algunas zonas, especialmente entre áreas costeras e interiores. Por último, el rango —la distancia máxima a partir de la cual las observaciones dejan de estar correlacionadas— varía entre 69.05 km (diciembre) y 94.13 km (agosto), con abril en un punto intermedio (75.40 km). En diciembre, la correlación espacial se limita a escalas más cortas, posiblemente por la influencia del relieve o de fenómenos locales como las inversiones térmicas. En agosto, el rango se extiende un poco más, lo cual encaja con una distribución térmica más homogénea a nivel regional, típica del verano andaluz. En conjunto, estos resultados muestran cómo la estructura espacial de la temperatura cambia según la estación del año. El análisis del variograma permite ver que en invierno las diferencias térmicas pueden ser más abruptas a corta distancia, mientras que en verano, aunque hay menos contraste térmico general, las variaciones locales siguen siendo importantes. Además, la primavera aparece como un periodo de transición, con niveles moderados de variabilidad tanto en la escala local como en la espacial. Los variogramas ajustados son los siguientes: Figura 4.1 Variograma Ajustado de Diciembre.
40 Capítulo 4. Resultados Experimentales Figura 4.2 Variograma Ajustado de Abril. Figura 4.3 Variograma Ajustado de Agosto. Interpolación (Kriging Ordinario) Con el ajuste de los variogramas finalizado, se da paso a la implementación del Kriging. Utilizando los modelos de variograma ajustados para cada uno de los meses estudiados (diciembre, abril y agosto), el Kriging permitirá predecir las temperaturas en ubicaciones repartidas por Andalucía. Para ello, se emplearán los parámetros obtenidos del ajuste del variograma (nugget, sill y rango), los cuales se utilizarán en el proceso de interpolación para generar las predicciones. Este procedimiento permitirá obtener una representación más detallada y precisa de la temperatura en el territorio, revelando posibles patrones o zonas que no se habrían detectado solo con los datos de las estaciones. Al final, los resultados de la interpolación se representarán en mapas espaciales que darán una visión más completa de la variación de la temperatura a lo largo de la región durante los tres meses considerados. El proceso de interpolación se ha realizado con una función personalizada que implementa el algoritmo clásico de Kriging Ordinario. La función de Kriging ordinario toma las coordenadas de las estaciones, las temperaturas asociadas y los puntos donde hacer las predicciones. La función devuelve las predicciones de temperatura y
4.1 Método 1: Kriging Ordinario 41 la varianza de las mismas. Durante las pruebas realizadas sobre el algoritmo para verificar la calidad de las predicciones, se encontraron problemas con el condicionamiento de la matriz de covarianzas. Esto provoca que sea difícil de invertir y en caso de no ser invertible, no es posible resolver el sistema de ecuaciones que permite obtener los coeficientes para la interpolación. Las soluciones propuestas han sido las siguientes: • Regularización: se ha añadido un término de regularización a la matriz para mejorar su condicionamiento. Este término, generalmente un valor pequeño, ayuda a hacer que la matriz sea más estable numéricamente al suavizar las diferencias extremas entre sus valores propios. • Uso de Pseudo-Inversa: permite resolver el sistema cuando la matriz no es invertible. Es útil para obtener soluciones aproximadas. Validación Cruzada La validación cruzada es una técnica estadística utilizada para evaluar la capacidad de generalización de un modelo predictivo [34]. En el contexto de este trabajo, se emplea la validación cruzada Leave-One-Out (LOO), que consiste en dejar fuera una observación del conjunto de datos en cada iteración y usar el resto para entrenar el modelo. Esta técnica es especialmente útil para obtener una estimación precisa del rendimiento del modelo sin la necesidad de dividir el conjunto de datos en subconjuntos de entrenamiento y prueba, lo cual es crítico cuando se dispone de un conjunto de datos pequeño o limitado. El procedimiento de validación Leave-One-Out se lleva a cabo de la siguiente manera: 1. Se divide el conjunto de datos en n observaciones, donde n es el número total de puntos de datos disponibles. 2. En cada iteración i , se deja fuera la i -ésima observación, la cual se utiliza como conjunto de prueba. El resto de las observaciones, se usan para poner a prueba el modelo. 3. Se realiza la predicción de la i -ésima observación usando el modelo entrenado con los datos restantes. 4. Este proceso se repite n veces, cada vez dejando fuera una observación diferente, generando así npredicciones para el conjunto de datos completo. El objetivo de este enfoque es obtener una estimación del error de predicción para cada observación individual y evaluar la fiabilidad del modelo mediante métricas estadísticas.
42 Capítulo 4. Resultados Experimentales Cálculo de Métricas de Validación Una vez obtenidas las predicciones para todas las observaciones, se calculan las métricas de error para evaluar el desempeño del modelo [6]. Las métricas utilizadas en este trabajo son las siguientes: • Error cuadrático medio (RMSE): Esta métrica mide la magnitud promedio de los errores, penalizando más los errores grandes [35]. Se calcula como: RMSE =s1 n n ∑ i=1 (Zi−ˆ Zi)2 donde Zi es el valor real de la i -ésima observación y ˆ Zi es la predicción del modelo para esa observación. • Error absoluto medio (MAE): Esta métrica proporciona una medida más simple del error promedio, sin penalizar los errores grandes. Se calcula como: MAE =1 n n ∑ i=1Zi−ˆ Zi • Coeficiente de determinación (R2): Esta métrica indica la capacidad del modelo para explicar la variabilidad de los datos [36]. Un valor de R2 cercano a 1 indica un buen ajuste del modelo, mientras que un valor cercano a 0 sugiere que el modelo no explica adecuadamente la variabilidad en los datos. Se calcula como: R2=1−∑n i=1(Zi−ˆ Zi)2 ∑n i=1(Zi−¯ Z)2 donde ¯ Zes la media de los valores observados. Estas métricas evalúan la calidad de las predicciones. Un modelo confiable debe presentar un RMSE y MAE bajos y un R2cercano a uno. En este trabajo, estas métricas se utilizan para evaluar el rendimiento del algoritmo implementado, permitiendo detectar posibles problemas como el sobreajuste (overfitting), la subestimación de la variabilidad de los datos o errores en el preprocesado.
4.1 Método 1: Kriging Ordinario 43 A continuación se muestra una tabla con los errores obtenidos para cada uno de los meses: Tabla 4.3 Métricas de Validación del modelo Kriging para distintos meses del 2023. Mes RMSE (°C) MAE (°C) R2 Diciembre 2023 1.07 0.82 0.719 Abril 2023 0.83 0.63 0.600 Agosto 2023 0.94 0.69 0.655 A continuación se detallan los resultados del análisis realizado que se han resumido en la tabla anterior (véase la tabla 4.3): • Rendimiento general del modelo: El modelo Kriging aplicado a los datos reales mostró un comportamiento sólido, aunque con diferencias entre los meses. Abril fue el mes donde el modelo alcanzó su mayor precisión en términos de error, con los valores más bajos tanto de RMSE (0.83°C) como de MAE (0.63°C). Sin embargo, su capacidad explicativa fue más limitada, con un R2de 0.600. Por otro lado, diciembre destacó por tener el mayor coeficiente de determinación (R2 = 0.719), lo que indica que el modelo fue capaz de capturar mejor la estructura espacial de la temperatura en este mes, aunque a costa de errores algo mayores (RMSE = 1.07°C, MAE = 0.82°C). • Precisión de las predicciones: En los tres meses analizados, el modelo mantuvo un nivel de precisión bastante aceptable. Agosto fue el mes con mayores errores (RMSE = 0.94°C, MAE = 0.69°C), lo que podría estar relacionado con una mayor complejidad en los patrones espaciales de temperatura durante este periodo estival. Aun así, los valores de MAE se mantuvieron por debajo del grado, lo que sugiere que las predicciones, en términos absolutos, fueron cercanas a los valores observados en todas las estaciones.
50 Capítulo 4. Resultados Experimentales 4.2 Neural Network Toolbox Una toolbox es un conjunto de herramientas y funciones predefinidas que amplían las capacidades de un software concreto y facilitan la implementación de algoritmos y métodos específicos. En el caso de MATLAB, las toolboxes son paquetes descargables que permiten a los usuarios trabajar de manera más eficiente en campos como la inteligencia artificial, el procesamiento de señales o la optimización. La Neural Network Toolbox de MATLAB [37] incorpora las herramientas necesarias para diseñar, entrenar y simular redes neuronales. En el caso de los Mapas Autoorganizados (SOM), esta toolbox incluye funciones que permiten configurar la arquitectura de la red, definir parámetros como el tamaño del mapa y las funciones de vecindad, y distintas posibilidades de entrenamiento de la red. Además, facilita la visualización de los resultados y estructura de la red, lo que resulta esencial para interpretar los patrones obtenidos por la red a partir de los datos de entrada. Figura 4.13 Ejemplo de Diagrama de SOM. En primer lugar, se deben definir los vectores de entrada a la red, donde cada columna corresponde a un atributo, y cada fila a una observación concreta. A continuación, se define la topología de la red, es decir, la distribución y forma de las neuronas. La función selforgmap, permite definir la red usando distintos parámetros de entrada que pueden ser modificados [14].
4.2 Neural Network Toolbox 51 Código 4.1 Función selforgmap en MATLAB. net = selforgmap(dimensions, coverSteps, initNeighbor, topologyFcn, distanceFcn) El primer parámetro es el número de neuronas de la capa de salida que tendrá la red [14]. Estas neuronas son las encargadas de representar los patrones y el comportamiento de los datos de entrada, permitinedo su organización en clusters. El parámetro topologyFcn define la topología de la red, es decir, cómo están conectadas las neuronas entre sí. • hextop : Define una topología hexagonal, donde cada neurona tiene hasta seis vecinos. Esta opción es útil para preservar relaciones espaciales complejas y es comúnmente utilizada en SOM. • gridtop : Define una topología rectangular o en cuadrícula, donde cada neurona tiene hasta cuatro vecinos. Es más simple y puede ser adecuada para datos menos complejos. • randtop : Define una topología aleatoria. (a) Topología Hexagonal. (b) Topología Rectangular. (c) Topología Aleatoria. Figura 4.14 Ejemplos de Topologías en SOM.
52 Capítulo 4. Resultados Experimentales El parámetro distanceFcn especifica la función de distancia utilizada para calcular la similitud entre las neuronas. Las opciones más comunes incluyen: • linkdist : Calcula la distancia en términos de conexiones entre las neuronas. • dist : Utiliza la distancia euclídea estándar. • mandist : Calcula la distancia de Manhattan (suma de las diferencias absolutas). Entrenamiento de la Red En la función selforgmap, se han definido variables que se usan en las dos fases de entrenamiento de la red: • Ordering-phase learning rate: Tasa de aprendizaje utilizada durante la fase de ordenamiento. • Ordering-phase steps: Número de pasos o iteraciones en la fase de ordenamiento. • Tuning-phase learning rate: Tasa de aprendizaje utilizada durante la fase de ajuste. • Tuning-phase neighborhood distance: Distancia de vecindad utilizada durante la fase de ajuste. Estas variables son fundamentales para el entrenamiento y adaptación de la red. El entrenamiento se lleva a cabo con la función train, que permite definir diversos parámetros como el número de iteraciones y el método. En este trabajo, se lleva a cabo entrenamiento por lotes, también conocido como batch training, que es un enfoque en el que todas las observaciones del conjunto de datos se presentan simultáneamente en cada iteración del proceso de aprendizaje. En lugar de actualizar los pesos de la red después de procesar cada muestra individual, como ocurre en el entrenamiento secuencial, el entrenamiento por lotes acumula los efectos de todas las muestras y realiza una única actualización al final de cada iteración.
4.2 Neural Network Toolbox 53 El entrenamiento por lotes en los Mapas Autoorganizados (SOM) presenta ventajas como una mayor eficiencia computacional, una convergencia más estable y suave, y una mejor adaptación al procesamiento de grandes volúmenes de datos, ya que permite actualizar los pesos considerando todas las muestras simultáneamente y aprovechar de manera más eficiente los recursos disponibles. Además, la estructura resultante es más precisa y coherente con los datos de entrada. Figura 4.15 Pantalla de Entrenamiento de SOM. Resultados del Entrenamiento En la figura anterior, se puede observar que existen distintas gráficas que ayudan a comprender el proceso de entrenamiento y los resultados obtenidos. Estas gráficas incluyen: • SOM Topology: Muestra cómo las neuronas están conectadas entre sí, destacando las relaciones topológicas dentro del mapa. • SOM Neighbor Distances: Representa las distancias entre las neuronas vecinas, lo que permite identificar regiones con alta densidad de datos o áreas menos representadas. • SOM Sample Hits: Indica cuántos de los datos de entrada han activado cada neurona •SOM Neighbor Connections: Muestra las conexiones de las neuronas.
54 Capítulo 4. Resultados Experimentales • SOM Input Planes: Muestra la distribución de los pesos para cada una de las entradas. • SOM Weight Positions: Muestra las ubicaciones de los atributos de entrada junto a la disposición de las neuronas en el espacio bidimensional. Estas visualizaciones son esenciales para interpretar los resultados del SOM y garantizar que la red ha capturado adecuadamente las características principales de los datos de entrada. Además, permiten ajustar parámetros como el tamaño del mapa o la función de vecindad para optimizar el rendimiento del modelo. (a) SOM Topology. (b) SOM Neighbor Distances. (c) SOM Sample Hits. (d) SOM Neighbor Connections. (e) SOM Input Planes. (f) SOM Weight Positions. Figura 4.16 Ejemplos de Gráficos de SOM.
4.3 Método 2: SOM + Kriging Ordinario 55 4.3 Método 2: SOM + Kriging Ordinario En este segundo caso, se explora si es posible obtener una predicción más robusta del comportamiento espacial de la temperatura usando los Mapas Autoorganizados para preprocesar los datos y reconocer patrones. El uso de la red neuronal, tiene como principal objetivo simplificar y estructurar la información espacial disponible. En lugar de trabajar directamente con los valores brutos de temperatura, se opta por aplicar una etapa previa de agrupación que permita encontrar patrones comunes entre las distintas estaciones y observaciones. De esta forma, se consiguen transformar grandes volúmenes de datos en un conjunto más manejable y representativo, donde cada estación queda asociada a una neurona represenativa en función de sus características espaciales y térmicas. Este paso también ayuda a reducir el ruido presente en los datos y a suavizar las pequeñas diferencias entre estaciones muy cercanas o con valores de temperatura muy parecidos, que no aportan valor real al modelo de predicción. Cuando se cuantizan las temperaturas mediante los Mapas Autoorganizados, se obtiene una representación más generalizada del espacio con respecto a la variable climatológica. En definitiva, la red neuronal actúa como una especie de filtro o preprocesador inteligente que mejora la calidad de los datos antes de aplicar el modelo de predicción. Preparación de los datos y Entrenamiento de la Red Al igual que en el caso anterior, se han usado los datos meteorológicos diarios correspondientes a los meses de abril, agosto y diciembre del año 2023. La elección de los meses, cómo se expuso anteriormente, permite capturar y analizar el comportamiento del modelo de predicción frente a distintas condiciones climáticas y estacionales. De cada mes se han extraído un total de 30 o 31 mediciones correspondientes a cada uno de los días del mes, que servirán para entrenar a la red. Los datos se han extraído del Sistema de Información Agroclimática para el Regadío (SiAR), incluyendo los datos de las 96 estaciones meteorológicas. A partir de los datos de cada estación, se han unificado para obtener una tabla ordenada que permita introducir los parámetros de entrenamiento que requiere la red.
56 Capítulo 4. Resultados Experimentales Para el entrenamiento de la red SOM, se han utilizado como vectores de entrada, tres atributos por cada observación: la temperatura media diaria registrada en cada estación, y las coordenadas espaciales correspondientes (latitud y longitud). Para garantizar la homogeneidad y evitar resultados incongruentes, todas las variables fueron previamente normalizadas en el rango [0, 1] , permitiendo que ninguna de ellas domine sobre las otras en esta fase de aprendizaje de la red. Durante las pruebas realizadas, se probó a introducir los datos sin normalizar, para analizar el comportamiento de la red y su convergencia, pero finalmente se optó por normalizar todos los atributos en la misma escala. En la siguiente tabla (4.4) se muestran los parámetros de entrenamiento de la red SOM. Tabla 4.4 Parámetros de entrenamiento de la red SOM. Parámetro Valor Tamaño de la cuadrícula ( gridSize )4×4 Vecindario inicial ( initNeighbor ) 3 Pasos iniciales ( coverSteps ) 300 Topología ( topologyFcn ) hextop Iteraciones de entrenamiento 1500 Algoritmo de entrenamiento trainbu (Batch Weight/Bias Rule) Cabe destacar que el tamaño de cuadrícula de la red se ha determinado experimentalmente conforme a los errores (QE) y (TE) obtenidos durante el entrenamiento. La red del tamaño elegido, proporciona el equilibrio óptimo entre ambos, permitiendo representar el espacio de forma adecuada, sin estar ajustado en exceso a los datos de entrenamiento. A continuación, se muestra una tabla comparativa (4.5) de diferentes redes usadas para diciembre, que sirven para justificar la elección del número de neuronas. Tabla 4.5 Evaluación de errores QE y TE para distintos tamaños de red SOM. Tamaño de la red QE TE 3×30.14498 0.07897 4×40.11562 0.16667 5×50.09538 0.15457 6×60.08110 0.18347 7×70.07016 0.27285 Se puede observar que el tamaño de red de 4×4 es el que ofrece el mejor equilibrio en ambos errores. Cuánto más grande es la red, más se ajusta a los datos de entrada, lo que no permitirá que sea flexible y eficiente a la hora de hacer predicciones.
4.3 Método 2: SOM + Kriging Ordinario 57 El número de iteraciones también se ha ajustado para evitar el sobreajuste, y se ha optado por un algoritmo de entrenamiento por lotes (Batch Weight/Bias Rule) para mejorar la estabilidad del proceso. El vecindario inicial se ha fijado en 3 por ser el valor por defecto, y los coverSteps se han determinado experimentalmente, ya que son los que permiten a la red obtener la forma general para representar la red adecuadamente y terminar de converger en la fase de tuning. Para cada uno de los meses, se mostrarán algunas figuras que permiten conocer información concreta del entrenamiento de la red. Se han descartado los que no proporcionaban información relevante o eran difícilmente interpretables. Tras el entrenamiento de la red, se puede visualizar cómo queda la estructura de la misma, y como se adapta a los datos de entrada. En la figura, se muestra un ejemplo de la red entrenada, donde cada neurona va a representar una estación meteorológica que permitirá hacer predicciones y su posición en el espacio geográfico. Los colores indican la temperatura media registrada en cada estación, permitiendo observar cómo se distribuyen las temperaturas. Figura 4.17 Ejemplo de Red SOM en 3D. Al finalizar el entrenamiento, se utiliza la salida para procesar las observaciones. Cada muestra de entrada está asociada a una neurona "Best Matching Unit" (BMU). De este modo, se consigue la cuantización del espacio original de datos, en la que cada observación queda representada por una única neurona del mapa. Como resultado, se obtienen tres vectores de pesos de 16 componentes, donde cada uno de ellos corresponde a un atributo de entrada. El vector de temperaturas se usará para reemplazar los valores de temperatura originales de las neuronas asignadas. Este valor, aunque más generalizado, permite mantener la coherencia espacial y térmica de los datos, siendo de gran utilidad en fases posteriores. En cuánto al código y obtención de los datos necesarios para llevar a cabo las predicciones, las funciones utilizadas serán distintas, debido a incompatibilidades con el formato que proporciona la red a su salida.
58 Capítulo 4. Resultados Experimentales Detección de Deriva Espacial Gracias al preprocesado de los datos que realiza la red, se consigue eliminar la tendencia original de los datos al reemplazar cada muestra original por el vector de pesos de la neurona más cercana, que actúa como un valor representativo. El proceso de aprendizaje de la red, le permite capturar patrones locales y no preserva estructuras globales, diluyendo la formación de la tendencia tras la cuantización. No obstante, se ha aplicado el mismo proceso de ajuste de modelo lineal a los datos de salida para cada uno de los meses para comprobar si se cumple el detrending de la red. Tabla 4.6 Test de deriva espacial aplicado a las salidas de la red SOM. Mes p-valor global p-valor βXp-valor βY Diciembre 0.1362 0.8293 0.0554 Abril 0.8400 0.5734 0.7869 Agosto 0.3370 0.3801 0.1835 Los resultados muestran valores de pvalues elevados en todos los casos, tanto en el global como en los coeficientes individuales βX y βY . Son muy superiores al valor umbral de 0.05, lo que confirma que la red actúa como un mecanismo de detrending automático. Cálculo de Variogramas Se seguirá el mismo procedimiento que en el método anterior para calcular los variogramas, pero en este caso, se utilizarán los valores de temperatura cuantizados obtenidos de la red SOM. Estos valores se asignarán a las estaciones correspondientes, y se calcularán las distancias entre ellas para obtener el variograma experimental. Tras calcular el variograma experimental, se obtendrán los parámetros del variograma ajustado, que permitirá obtener los recursos necesarios para el Kriging Ordinario. Se ha optado por dividir las distancias en intervalos o ’bins’, equiespaciado, calculando en cada uno de ellos la semivarianza media. Esta forma de agrupar los datos ayuda a interpretar mejor el comportamiento de la temperatura con respecto a la distancia, y facilita el posterior ajuste del modelo teórico. Las funciones usadas para llevar a cabo los variogramas difieren de las usadas en el método anterior, debido a que no se consigue capturar la relación espacial de manera clara. Durante este proceso de ajuste, se observó que los puntos experimentales no permitían una estimación fiable de los parámetros, devolviendo valores no representativos, con rangos excesivamente pequeños o sill negativo. Por esta razón, se optó por forzar los parámetros del modelo a partir de observaciones del variograma experimental.
4.3 Método 2: SOM + Kriging Ordinario 59 El procedimiento comienza con el cálculo de las distancias entre pares de estaciones a partir de sus coordenadas expresadas en kilómetros. Estas distancias se usan para calcular la semivarianza entre cada par, empleando los valores de temperatura ya cuantizados y desnormalizados tras salir de la red. Tras calcular la semivarianza, se agrupan en un determinado número de grupos (bins), y para cada uno de ellos, se calculan el número de pares dentro del intervalo, así como el valor medio de la semivarianza. Finalmente, se calculan de forma directa los tres parámetros clave del variograma ajustado, fijando una serie de condiciones: •El nugget se fija como el 5% del valor máximo de la semivarianza observada. • El sill se fija en el valor máximo de la semivarianza media, asumiendo que a partir de este valor, la relación de los datos deja de existir. • El rango se fija como la distancia a partir de la cual la semivarianza alcanza el 95% del sill. En caso de no alcanzar el 95% del sill, se fija el rango como la distancia máxima entre pares de estaciones. Este enfoque permite obtener un modelo válido para predecir posteriormente. El modelo ajustado en todos los casos será exponencial, ya que es el que resulta más sencillo a la hora de forzar los parámetros debido a su estructura. Tabla 4.7 Parámetros del variograma forzado SOM. Mes Nugget Sill Range (km) Agosto 2023 0.4417 3.0382 113.1 Abril 2023 0.2896 2.5918 339.3 Diciembre 2023 0.5381 5.774 307 Validación Cruzada Leave-One-Out Al igual que en el método anterior, se usa esta técnica para evaluar la capacidad predictiva del modelo tras aplicar el método del Kriging Ordinario. Como ya se indicó anteriormente, el método consiste en excluir en cada iteración una estación meteorológica, o en este caso una de las neuronas, y realizar la predicción de temperatura a partir de las demás. Las predicciones obtenidas se comparan directamente con los valores cuantizados reales, y a partir de esas diferencias se calculan tres métricas para evaluar la calidad de la predicción. En la siguiente tabla (4.8) se pueden observar los resultados de la validación cruzada para cada uno de los meses, añadiendo en este caso la desnormalización de los errores para tener una perspectiva real sobre el error cometido en grados Celsius (°C).
66 Capítulo 4. Resultados Experimentales Figura 4.26 Errores por estación Agosto SOM 2023. (a) Mapa de calor de Varianzas de Agosto SOM 2023. (b) Histograma de Varianza de Agosto SOM 2023. Los resultados obtenidos muestran que el modelo Kriging, combinado con la red SOM, ha logrado una buena capacidad predictiva en todos los meses analizados. Las métricas de validación indican un rendimiento sólido, con valores de RMSE y MAE relativamente bajos, lo que sugiere que el modelo es capaz de capturar adecuadamente las variaciones espaciales de la temperatura.
4.4 Comparación de Resultados 67 4.4 Comparación de Resultados Los resultados obtenidos tras la validación cruzada de los modelos, cambian al incorporar la red SOM como paso previo al Kriging. En particular, la diferencia más significativa se produce en la reducción de los errores de predicción en los tres meses analizados. Por ejemplo, en diciembre, el modelo Kriging ordinario alcanza un RMSE de 1.07 ◦ C y un MAE de 0.82 ◦ C, mientras que con la estrategia Kriging + SOM estos valores se reducen hasta 0.74 ◦ C y 0.58 ◦ C respectivamente, un 20% menor. La mejora también está presente en el coeficiente de determinación (R 2 ), que asciende hasta 0.86, lo cual indica una mayor capacidad explicativa del modelo sobre la variabilidad de las temperaturas reales. Además, los valores normalizados de RMSE y MAE avalan esta mejora en términos relativos, mostrando errores absolutos promedio por debajo del 11% en todos los meses al aplicar Kriging + SOM. Esto confirma que la red SOM no solo permite una reducción efectiva de los errores, sino también una representación más robusta del comportamiento térmico espacial antes de aplicar el modelo de interpolación. En conjunto, los resultados corroboran la utilidad de la combinación SOM-Kriging como una alternativa más precisa y fiable frente al uso exclusivo de Kriging, especialmente en contextos con alta densidad de observaciones temporales y cierta heterogeneidad espacial. Tabla 4.9 Comparación de métricas de validación para Kriging clásico y Kriging + SOM (meses de 2023). Diciembre 2023 Abril 2023 Agosto 2023 K SOM + K K SOM + K K SOM + K RMSE (°C) 1.07 0.74 0.83 0.58 0.94 0.73 MAE (°C) 0.82 0.58 0.63 0.46 0.69 0.51 R20.719 0.86 0.600 0.78 0.655 0.78 Tabla 4.10 Mejora relativa y ganancia absoluta al usar Kriging + SOM frente a Kriging clásico. Mes 2023 Mejora en RMSE Mejora en MAE Ganancia absoluta en R2 Diciembre -30,8 % -29,3 % +0,141 Abril -30,1 % -27,0 % +0,180 Agosto -22,3 % -26,1 % +0,125
68 Capítulo 4. Resultados Experimentales A continuación, se muestran algunas gráficas que permiten observar la diferencia existente entre las predicciones de ambos modelos. (a) Comparativa de Predicciones DICIEMBRE. (b) Comparativa de Predicciones ABRIL. (c) Comparativa de Predicciones AGOSTO. (d) Error acumulado DICIEMBRE. (e) Error acumulado ABRIL. (f) Error acumulado AGOSTO. Figura 4.27 Comparativa de predicciones y errores acumulados. Con relación al error acumulado, se observa cómo el área encerrada bajo la curva es menor para la estrategia de Kriging + SOM, lo que refuerza la obtención de los resultados de los errores en la tabla comparativa (4.9).
4.4 Comparación de Resultados 69 En los siguientes gráficos pueden observarse las métricas de validación obtenidas para cada uno de los meses analizados, tanto para el modelo Kriging clásico como para el modelo combinado con SOM. Se incluyen las métricas RMSE, MAE y R 2 para cada mes. (a) DICIEMBRE (b) ABRIL (c) AGOSTO Figura 4.28 Comparativa de métricas para Diciembre, Abril y Agosto.. Además de las métricas de validación, se analizó la varianza de predicción generada por cada uno de ellos. El modelo de Kriging ofrece valores más bajos, especialmente en zonas más alejadas de las estaciones meteorológicas, mientras que en el modelo combinado con SOM, el valor incrementa notablemente en regiones periféricas.
70 Capítulo 4. Resultados Experimentales Tabla 4.11 Varianza promedio de predicción por método y mes. Método Diciembre 2023 Agosto 2023 Abril 2023 Kriging clásico 1.0846 °C20.9753 °C20.8089 °C2 Kriging + SOM 2.1661 °C21.5328 °C21.0543 °C2 (a) DICIEMBRE (b) ABRIL (c) AGOSTO Figura 4.29 Comparativa de varianzas de predicción. La varianza calculada en SOM + Kriging, refleja la incertidumbre respecto a las neuronas, no respecto a los datos originales. Al usar los valores de los prototipos para interpolar, el algoritmo toma estos valores como datos originales, creyendo que cada uno de ellos es una observación puntual, cuando en realidad cada uno de ellos es la media de varios puntos. La reducción de datos para predecir provoca la pérdida de densidad de información, y como consecuencia se produce un aumento de la incertidumbre de predicción. Al tener menos puntos, el algoritmo reconoce la falta de información en ciertas zonas y lo demuestra con valores mayores de varianza.
5 Conclusiones y Líneas Futuras de Investigación El objetivo de este trabajo ha sido el de abordar un problema de interpolación espacial de temperatura media mensual en Andalucía desde una perspectiva innovadora, con una metodología que combina técnicas de aprendizaje no supervisado con geoestadística clásica. En concreto, explora cómo la unión entre el Kriging Ordinario y los Mapas Autoorganizados (SOM) y cómo podría ofrecer una solución más precisa para representar comportamientos térmicos en un determinado territorio. Uno de los aportes más relevantes ha sido la reinterpretación del proceso de cuantización mediante SOM en una primera fase. Gracias a este tipo de red neuronal, se consigue acabar con la deriva espacial de los datos, eliminar el ruido local y captar de una forma más fiel los patrones del fenómeno climático. Este paso previo a la interpolación, permite en una segunda fase aplicar exclusivamente el Kriging Ordinario a los residuos resultantes tras pasar el filtro de la SOM, que evita tener que emplear métodos alternativos para eliminar la tendencia. Los resultados obtenidos muestran que la estrategia de SOM + Kriging Ordinario mejora notablemente las métricas de validación respecto al Kriging Ordinario original, reduciendo los errores MAE y RMSE en torno a un 30%, siendo diciembre y abril los periodos donde más se aprecia la mejora. Además, todo esto se logra sin disparar el coste computacional, constatando que obtener valores más precisos con estructuras de red compactas es posible. Por otra parte se observa que el modelo híbrido que implica el uso de SOM, es capaz de mantener un comportamiento coherente desde el punto de vista geoestadístico, presentando niveles altos de incertidumbre que se ven reflejados en la varianza de las predicciones. Las zonas donde las estaciones escasean o la información no es tan abundante, presentan una mayor varianza. Esto también se debe a que se han reemplazado los datos originales por neuronas capaces de condensar la información 71
72 Capítulo 5. Conclusiones y Líneas Futuras de Investigación de las medidas. Estos prototipos provocan la pérdida de densidad de datos, priorizando la representación a nivel local de los patrones, a costa de sacrificar la interpolación fiable en zonas de la periferia. A la vista de los resultados obtenidos para el caso concreto de Andalucía, se constata que la combinación de Kriging Ordinario y SOM puede ser una estrategia efectiva para la interpolación espacial de fenómenos climáticos, permitiendo mejorar la precisión de los valores y reducir los errores de validación. Líneas futuras de Investigación A partir de este trabajo, surgen diversas líneas de investigación para ampliar y mejorar los resultados. En primer lugar, se propone añadir a la variable temperatura otras variables como humedad relativa o precipitaciones. Ello permitiría modelar relaciones para obtener una visión más completa del comportamiento climático en el territorio estudiado. También se podría extender el horizonte temporal para analizar si el método reconoce los patrones temporales y arroja resultados similares. La segunda propuesta está relacionada con la metodología empleada, proviene del empleo de una variante dinámica de los Mapas Autoorganizados. En este trabajo, la red aplicada es estática, y permite solo modelar el territorio concreto en un instante determinado. Las variantes dinámicas son capaces de adapatarse en tiempo real a la introducción de nuevas observaciones. De ahí que permitan captar con mayor precisión los patrones climáticos. Otra posible extensión, se refiere a la metodología empleada. Sería interesante comparar esta combinación de técnicas con otros métodos muy usados de interpolación espacial, como el Inverse Distance Weighting (IDW). Esta comparación podría contribuir al establecimiento de criterios para determinar el número idóneo de estaciones meteorológicas y sus localizaciones. Adicionalmente, se plantea la posibilidad de emplear la variante Kriging Universal. Este método permite un tratamiento alternativo de la tendencia temporal. En cuanto a la varianza, una posible línea de trabajo futura sería ajustar el diseño de la red considerando la varianza calculada sobre los datos originales, de modo que pueda compararse directamente con la obtenida mediante Kriging Ordinario. Este enfoque permitiría emplear un proceso iterativo en el que se modifique el número de nodos de la red hasta que la reducción de la varianza deje de ser significativa.
6 Anexo A: Códigos de MATLAB Código Completo de Entrenamiento de SOM y Kriging Código 6.1 Carga, normalización y preparación de los datos. data = DICIEMBREDATOS; Y = table2array(data(:,[6,9,10])); % [T, Lat, Lon] Y = str2double(strrep(Y, ',', '.')); Y_norm = normalize(Y,'range'); % normaliza cada col. Y_norm = fillmissing(Y_norm,'linear'); % rellena NaN % Número de observaciones y estaciones n_obs = size(Y_norm,1); n_est = 96; % Matriz para entrenar la SOM Y_ordenada = zeros(n_obs,3); Y_ordenada(:,1) = Y_norm(:,2); % LatN Y_ordenada(:,2) = Y_norm(:,3); % LonN Y_ordenada(:,3) = Y_norm(:,1); % TempN % Conversión geográfica a plano (km) [Xm,Ym] = geo2meters(latitudes_decimales(:), ... longitudes_decimales(:)); coord_km_station = [Xm Ym] ./ 1000; 73
74 Capítulo 6. Anexo A: Códigos de MATLAB Código 6.2 Entrenamiento de la SOM (4×4) y bucle opcional de tamaños. %% 2) Entrenamiento de la SOM tam = [4 4]; % tamaño de la cuadrícula net = selforgmap(tam,'initNeighbor',3,'coverSteps',300, ... 'topologyFcn','hextop'); net.trainParam.epochs = 1500; net = train(net, Y_ordenada'); %{ gridList = [3 3; 4 4; 5 5; 6 6; 7 7]; nTests = size(gridList,1); QE = nan(nTests,1); TE = nan(nTests,1); for t = 1:nTests gSize = gridList(t,:); net = selforgmap(gSize,'initNeighbor',3,'coverSteps',300, ... 'topologyFcn','hextop'); net.trainParam.epochs = 1500; net = train(net, Y_ordenada'); % BMU y métricas W = net.IW{1}; out = net(Y_ordenada'); bmu = vec2ind(out)'; d = vecnorm(Y_ordenada - W(bmu,:), 2, 2); QE(t) = mean(d); pos = net.layers{1}.positions; TEcnt = 0; for i = 1:size(Y_ordenada,1) [~,ord] = sort(vecnorm(W - Y_ordenada(i,:),2,2)); if norm(pos(:,ord(1))-pos(:,ord(2))) > 1.1 TEcnt = TEcnt + 1; end end TE(t) = TEcnt / size(Y_ordenada,1); end disp(table(gridList,QE,TE)); %}
75 Código 6.3 Cuantización de temperaturas por BMU, cálculo de QE/TE y promediado por estación. %% 3) Cuantización y agrupación weights = net.IW{1}; outputs = net(Y_ordenada'); bmu = vec2ind(outputs)'; % Des-normaliza pesos de temperatura maxT = max(Y(:,1)); minT = min(Y(:,1)); weights_T_C = weights(:,3)*(maxT-minT)+minT; temp_q_all = weights_T_C(bmu); % % ---------- Métricas QE y TE ---------- nObs = size(Y_ordenada,1); dist2BMU = vecnorm(Y_ordenada - weights(bmu,:),2,2); QE = mean(dist2BMU); pos = net.layers{1}.positions.'; badCnt = 0; for ii = 1:nObs dAll = vecnorm(weights - Y_ordenada(ii,:),2,2); [~,ord] = sort(dAll); id1 = ord(1); id2 = ord(2); if norm(pos(id1,:)-pos(id2,:)) > 1.1, badCnt = badCnt+1; end end TE = badCnt / nObs; fprintf('\n--- QE = %.5f, TE = %.5f ---\n', QE, TE); % ---------- Promedio por estación ---------- rep_per_est = n_obs / n_est; % 2880/96 = 30 est_idx = repelem((1:n_est)',rep_per_est); temp_q96_SOM = accumarray(est_idx,temp_q_all,[n_est,1],@mean); % Relleno de posibles NaN nan_idx = isnan(temp_q96_SOM); if any(nan_idx) temp_q96_SOM(nan_idx) = mean(temp_q96_SOM(~nan_idx)); end
82 Índice de Figuras 4.18 Comparativa Predicción-Real Diciembre SOM 2023 61 4.19 Mapa de Calor de Temperaturas Interpoladas Diciembre SOM 2023 61 4.20 Errores por estación Diciembre SOM 2023 62 4.21 Comparativa Predicción-Real Abril SOM 2023 63 4.22 Mapa de Calor de Temperaturas Interpoladas Abril SOM 2023 63 4.23 Errores por estación Abril SOM 2023 64 4.24 Comparativa Predicción-Real Agosto SOM 2023 65 4.25 Mapa de Calor de Temperaturas Interpoladas Agosto SOM 2023 65 4.26 Errores por estación Agosto SOM 2023 66 4.27 Comparativa de predicciones y errores acumulados 68 4.28 Comparativa de métricas para Diciembre, Abril y Agosto. 69 4.29 Comparativa de varianzas de predicción 70
Índice de Tablas 2.1 Resumen de Tipos de Kriging 19 4.1 Resultados del test de deriva espacial para cada mes 36 4.2 Parámetros del mejor modelo de variograma por mes (2023) 38 4.3 Métricas de Validación del modelo Kriging para distintos meses del 2023 43 4.4 Parámetros de entrenamiento de la red SOM 56 4.5 Evaluación de errores QE y TE para distintos tamaños de red SOM 56 4.6 Test de deriva espacial aplicado a las salidas de la red SOM 58 4.7 Parámetros del variograma forzado SOM 59 4.8 Métricas de validación del modelo Kriging + SOM para distintos meses de 2023 60 4.9 Comparación de métricas de validación para Kriging clásico y Kriging + SOM (meses de 2023) 67 4.10 Mejora relativa y ganancia absoluta al usar Kriging + SOM frente a Kriging clásico 67 4.11 Varianza promedio de predicción por método y mes 70 83
Índice de Códigos 4.1 Función selforgmap en MATLAB 51 6.1 Carga, normalización y preparación de los datos 73 6.2 Entrenamiento de la SOM (4×4) y bucle opcional de tamaños 74 6.3 Cuantización de temperaturas por BMU, cálculo de QE/TE y promediado por estación 75 6.4 Detección de deriva y construcción del variograma experimental 76 6.5 Ajuste forzado y obtención de nugget, meseta y rango 77 6.6 Kriging ordinario con validación LOO y métricas (°C y normalizadas) 77 6.7 Interpolación sobre malla regular mediante Kriging ordinario 78 6.8 Función calcular_semivarianza : 79 6.9 Función kriging_ordinario : predicción y varianza mediante Ordinary Kriging 79 6.10 Función geo2meters : conversión geográfica a coordenadas planas 80 85
Bibliografía [1] P.-F. Kuo et al., “Comparing kriging estimators using weather station data and local greenhouse sensors,” Sensors, vol. 21, no. 5, p. 1853, 2021. [2] E. Varouchakis, D. Solomatine, G. Perez et al., “Combination of geostatistics and self-organizing maps for the spatial analysis of groundwater level variations in complex hydrogeological systems,” Stochastic Environmental Research and Risk Assessment, vol. 37, pp. 3009–3020, 2023. [3] N. Cressie, Statistics for Spatial Data. Wiley, 1993. [4] “Kriging-based approach to predict missing air temperature data,” Computers and Electronics in Agriculture, vol. 142, pp. 440–449, 2017. [5] Y. Huang et al., “Prediction of soil organic matter using ordinary kriging combined with the clustering of self-organizing map: a case study in pinggu district, beijing, china,” Soil Science, vol. 182, no. 2, pp. 52–62, 2017. [6] A. Núñez-Reyes and S. Ruiz-Moreno, “Spatial estimation of solar radiation using geostatistics and machine learning techniques,” 2021. [7] D. J. Matich, “Redes neuronales: Conceptos básicos y aplicaciones,” Cátedra de Informática Aplicada a la Ingeniería de Procesos – Orientación I, Tech. Rep., s.f., profesores: Carlos Alberto Ruiz y Marta Susana Basualdo. [8] IBM Corporation, “Redes neuronales,” https://www.ibm.com/docs/es/spssmodeler/saas?topic=networks-neural-model, 2024. [9] S. J. Prince, Understanding Deep Learning. Cambridge, MA: MIT Press, 2023, disponible en línea. [Online]. Available: http://udlbook.com [10] H. U. Dike, Y. Zhou, K. K. Deveerasetty, and Q. Wu, “Unsupervised learning based on artificial neural network: A review,” Journal of Bionic Engineering, vol. 17, no. 3, pp. 500–517, 2020. [Online]. Available: https://www.sciencedirect.com/science/article/pii/S1672652920300473 87
88 Bibliografía [11] T. Kohonen, “The self-organizing map,” Proceedings of the IEEE, vol. 78, no. 9, pp. 1464–1480, 1990. [12] M. Cottrell, M. Olteanu, F. Rossi, and N. N. Villa-Vialaneix, “Self-organizing maps, theory and applications,” Revista de Investigación Operacional, vol. 39, no. 1, pp. 1–22, 2018. [Online]. Available: https://hal.science/hal-01796059 [13] T. Kohonen, “Essentials of the self-organizing map,” Neural Networks, vol. 37, pp. 52–65, 2013. [14] MathWorks, “Cluster data with a self-organizing map,” https://es.mathworks. com/help/deeplearning/gs/cluster-data-with-a-self-organizing-map.html, 2024, accedido: 3 de mayo de 2025. [15] A. Banerjee, W. Ding, J. Dy, V. Lyubchich, and A. Rhines, “Proceedings of the 6th international workshop on climate informatics: Ci2016,” 2016. [Online]. Available: https://opensky.ucar.edu/islandora/object/technotes:543 [16] D. C. Martín, “Mapas autoorganizados (self-organizing maps),” Trabajo Fin de Grado, Universidad de Valladolid, 2020, dirigido por Miguel Alejandro Fernández Temprano. [17] M. Cottrell, J.-C. Fort, and G. Pagès, “Theoretical aspects of the som algorithm,” Neurocomputing, vol. 21, pp. 119–138, 1998. [18] J. M. Marín, “Los mapas auto-organizados de kohonen (som),” 2004, accedido: 2025-05-03. [Online]. Available: https://halweb.uc3m.es/esp/ Personal/personas/jmmarin/esp/DM/tema5dm.pdf [19] G. Pölzlbauer, “Survey and comparison of quality measures for self-organizing maps,” na, 2004. [20] G. Matheron, The Theory of Regionalized Variables and its Applications. Paris: Les Cahiers du Centre de Morphologie Mathématique, École des Mines de Paris, 1971. [21] A. G. Journel and C. J. Huijbregts, Mining Geostatistics. Academic Press, 1978. [22] G. Matheron, “Principles of geostatistics,” Economic Geology, vol. 58, no. 8, pp. 1246–1266, 1963. [23] J. P. Chiles and P. Delfiner, Geostatistics: Modeling Spatial Uncertainty. Wiley, 2012.
Bibliografía 89 [24] OnestopGIS, “Tipos de kriging: Ordinary, simple, universal, indicator, probability, disjunctive, co-kriging, log-normal kriging,” 2023, accedido: 2025-05-03. [Online]. Available: https://www.onestopgis.com/GIS-Theoryand-Techniques/16-Spatial-Interpolation/4-Kriging/2-Types-of-Kriging.html [25] G. Bastin, M. Gevers, and Others, “Optimal estimation of the average areal rainfall and optimal selection of rain gauge locations,” Water Resources Research, vol. 20, no. 4, pp. 463–470, 1984. [Online]. Available: https://www.researchgate.net/publication/240489014 [26] C. de Investigación en Geografía y Geomática "Ing. Jorge L. Tamayo", “Análisis estructural - diplomado en análisis de información geoespacial,” 2021. [Online]. Available: https://centrogeo.repositorioinstitucional.mx/jspui/bitstream/1012/ 165/1/21-Analisis%20Estructural%20-%20%20Diplomado%20en%20An% C3%A1lisis%20de%20Informaci%C3%B3n%20Geoespacial.pdf [27] Esri, “Cómo funciona kriging,” 2025. [Online]. Available: https://pro.arcgis. com/es/pro-app/latest/tool-reference/3d-analyst/how-kriging-works.htm [28] Columbia University, Mailman School of Public Health. (2024) Kriging interpolation. [Online]. Available: https://www.publichealth.columbia.edu/ research/population-health-methods/kriging-interpolation [29] H. Ha, J. R. Olson, L. Bian, and P. A. Rogerson, “Analysis of heavy metal sources in soil using kriging interpolation on principal components,” Environmental Science & Technology, vol. 48, no. 9, pp. 4999–5007, 2014, pMID: 24693925. [Online]. Available: https://doi.org/10.1021/es405083f [30] Wikipedia contributors, “Andalucía,” 2025. [Online]. Available: https: //es.wikipedia.org/wiki/Andaluc%C3%ADa [31] P. y. A. Ministerio de Agricultura, “Sistema de información agroclimática para el regadío,” 2025. [Online]. Available: https://www.mapa.gob.es/es/desarrollo-rural/temas/gestion-sostenibleregadios/sistema-informacion-agroclimatica-regadio/presentacion.aspx [32] ——, “Sistema de información agroclimática para el regadío,” 2025. [Online]. Available: https://servicio.mapa.gob.es/websiar/SeleccionParametrosMap. aspx?dst=1 [33] M. Molina Arias, “¿qué significa realmente el valor de p?” Revista de Pediatría de Atención Primaria, vol. 19, pp. 377–381, 2017. [34] O. Dubrule, “Cross-validation of kriging in a unique neighborhood,” Journal of the International Association for Mathematical Geology, vol. 15, no. 6, pp. 687–699, 1983.
90 Bibliografía [35] G. Farzaneh, J. Ghoddousi, and M. Panahi, “Application of geostatistical models to identify spatial distribution of groundwater quality parameters,” Environmental Science and Pollution Research, vol. 29, no. 12, pp. 18069– 18 083, 2022. [Online]. Available: https://www.researchgate.net/publication/ 358042822 [36] X. Li, C. Zhang, and W. Li, “Performance evaluation of ordinary and regression kriging in estimating soil salinity in arid regions,” Environmental Monitoring and Assessment, vol. 187, no. 6, p. 343, 2015. [Online]. Available: https://doi.org/10.1007/s10661-015-4492-8 [37] MathWorks, “Deep learning toolbox,” 2025. [Online]. Available: https: //es.mathworks.com/products/deep-learning.html