Full text
28 Proyecto Fin de Carrera Ingeniería de Telecomunicación Formato de Publicación de la Escuela Técnica Superior de Ingeniería Autor: F. Javier Payán Somet Tutor: Juan José Murillo Fuentes Dep. Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2013 Trabajo Fin de Grado Grado en Ingeniería de las Tecnologías Industriales Detección automática y caracterización de receptores de plantas termosolares con colectores cilindro-parabólicos a través de análisis de imágenes termográficas y RGB tomadas desde drones autónomos. Autor: Carlos Mesa Sierra Tutor: Jorge Galán Vioque, Juan Sebastián Valverde García y Miguel Angel Pérez Cutiño Departamento de Matemática Aplicada II Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025
Trabajo Fin de Grado Grado en Ingeniería de las Tecnologías Industriales Detección automática y caracterización de receptores de plantas termosolares con colectores cilindro-parabólicos a través de análisis de imágenes termográficas y RGB tomadas desde drones autónomos. Autor: Carlos Mesa Sierra Tutor: Jorge Galán Vioque, Juan Sebastián Valverde García y Miguel Angel Pérez Cutiño Catedrático de Universidad / Profesor Contratado Doctor / Investigador Predoctoral Departamento de Matemática Aplicada II Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025
Trabajo Fin de Grado: Detección automática y caracterización de receptores de plantas termosolares con colectores cilindro-parabólicos a través de análisis de imágenes termográficas y RGB tomadas desde drones autónomos. Autor: Carlos Mesa Sierra Tutor: Jorge Galán Vioque, Juan Sebastián Valverde García y Miguel Angel Pérez Cutiño El tribunal nombrado para juzgar el trabajo arriba indicado, compuesto por los siguientes profesores: Presidente: Vocal/es: Secretario: acuerdan otorgarle la calificación de: El Secretario del Tribunal Fecha:
Agradecimientos E n primer lugar, me gustaría expresar mi agradecimiento a mi familia, por su constante apoyo y por enseñarme a seguir adelante ante cualquier adversidad que se presentara en el camino. Gracias por creer en mi y por ser mi fuente de inspiración y admiración. Papá, por ser el ejemplo a seguir para tantas personas, no sabes la fuerza que me has transmitido en todo este recorrido. Mamá, por tus sabios consejos, por saber siempre que decir en los momentos difíciles, por dar todo de ti para que pueda dedicar el 100% a mi carrera, gracias por todo. Tu hijo termina por fin esta carrera, aunque no hayas conseguido tener a tu hijo abogado. Hermana, por ser la que alegra cualquier día en casa y por conseguir que desconecte después de mis largos días de biblioteca. A mis amigos de la infancia, por estar siempre ahí y por conseguir que me despeje en mis interminables días de estudio. A mi novia, por su paciencia y apoyo incondicional. Gracias por hacerme reír cuando más lo necesitaba, en especial en mis momentos de estrés y dudas. Agradecer también a todos lo profesores con los que me he cruzado en mi etapa estudiantil, en especial a Jorge Galán, Juan Valverde y Miguel Ángel Pérez. Gracias por la ayuda y orientación que me han brindado en este trabajo fin de carrera. Por último, me gustaría agradecer a la empresa VirtualMechanics SL por ofrecerme la posibilidad de llevar a cabo este trabajo, facilitándome información fundamental para su realización. Carlos Mesa Sierra Sevilla, 2025 I
Resumen L as plantas termosolares, como parte de las energías renovables, necesitan de un seguimiento del estado de sus componentes para garantizar que funcionen a la perfección y poder evitar posibles fallos. En especial, uno de estos componentes son los tubos receptores, cuya temperatura debe estar controlada para su correcto funcionamiento. En este contexto, la inteligencia artificial, la visión por computador y el aprendizaje automático permiten recurrir a herramientas para analizar grandes volúmenes de datos, detectar patrones y predecir comportamientos El objetivo principal de este trabajo es la realización de métodos para detectar los tubos receptores y estimar sus temperaturas a partir de imágenes térmicas, con el fin de replicar el comportamiento de un sistema de análisis térmico previamente externalizado por la empresa VirtualMechanics SL. Con este objetivo en mente, se divide el trabajo en dos partes. Una primera que consiste en el uso del software del fabricante de la cámara térmica, y la segunda en la que se desarrolla un modelo predictivo mediante técnicas de aprendizaje automático. En resumen, este proyecto tratará la integración de la inteligencia artificial y la visión por computador en el sector termosolar para desarrollar sistemas predictivos que no solo mejoren la seguridad en el funcionamiento de las plantas, sino que también representan una forma de detectar roturas en los tubos. III
2Capítulo 1. Introducción 1. Etiquetado manual de imágenes: Más de 200 imágenes térmicas fueron etiquetadas manualmente utilizando distintas herramientas. 2. Obtención de temperaturas aparentes: Se utilizó un software de FLIR [ 3 ] para analizar todas las imágenes y obtener sus temperaturas aparentes. 3. Validación con Python: Se implementó un código en Python para corroborar los datos obtenidos con la aplicación, utilizando librerías especializadas como FLIR. De esta manera se consigue una muy buena precisión en la toma de datos, de manera que se garantiza la calidad del conjunto de datos para su posterior utilización en el entrenamiento del modelo. 1.4 Propósito y objetivos del estudio El objetivo general de este trabajo es desarrollar métodos para estimar la temperatura medida de los tubos receptores en plantas termosolares a partir de imágenes térmicas, con el fin de replicar el comportamiento de un sistema de análisis térmico previamente externalizado por la empresa VirtualMechanics SL. Esta empresa ha utilizado durante años un algoritmo (cuya lógica interna es desconocida) desarrollado por una tercera entidad. Al sustituir dicho sistema por uno propio, es imprescindible garantizar la coherencia entre las nuevas mediciones y las históricas, y evitar grandes cambios en cuanto a los valores obtenidos. A partir de este contexto, los objetivos principales de este trabajo se pueden separar en dos. Primero, utilizar el software del fabricante de la cámara térmica para predecir las temperaturas y así comparar sus resultados con los obtenidos por la empresa externa. Y, segundo, desarrollar un modelo predictivo, basado en técnicas de inteligencia artificial, capaz de aproximarse al comportamiento del algoritmo desconocido utilizado por la empresa externa. Es decir, se busca encontrar valores de temperatura que se parezcan a los calculados por la empresa externa. Para alcanzar este propósito se plantean los siguientes objetivos específicos: • Recopilar y procesar datos de inspecciones previas, además de incluir las temperaturas aparentes a través de diferentes métodos. • Utilización de librerías de Python, IA y un software específico (FLIR Thermal Studio) para la detección de HCEs y cálculo de sus temperaturas. • Entrenar y evaluar modelos de aprendizaje automático para predecir temperaturas en tubos receptores. • Identificar patrones significativos en los datos que permitan anticipar y solucionar fallos, y evitar información insignificante según el problema que se desee solucionar. • Optimizar el rendimiento del modelo de manera que se seleccione las técnicas de regresión más adecuadas para el caso de estudio. 1.5 Metodología inicial La metodología adoptada en este estudio se basa en un flujo de trabajo bien definido: 1. Recopilación de datos: Disposición de imágenes térmicas de inspecciones anteriores, de las cuales se extraían parámetros como la velocidad del viento y la emisividad. 2. Procesamiento y etiquetado: Se procesaron más de 200 imágenes térmicas para extraer las temperaturas aparentes mediante métodos manuales y automáticos. 3. Obtención de temperaturas con software FLIR: Se utilizó el software FLIR Thermal Studio para calcular la temperatura medida de los tubos a partir de las imágenes térmicas etiquetadas.
1.5 Metodología inicial 3 4. Desarrollo de modelos predictivos: Se entrenaron modelos utilizando Scikit-learn en Python, aplicando técnicas de regresión avanzadas. 5. Evaluación y optimización: Los modelos fueron validados y optimizados para garantizar la precisión de las predicciones.
2 Fundamentos teóricos E l presente capítulo recopila los conceptos teóricos esenciales que sustentan este trabajo. Para ello se realiza un estudio del funcionamiento y tipos de centrales termosolares, haciendo especial hincapié en las plantas cilindro-parabólicas, además de analizar el papel de los tubos receptores en esta. Por otra parte, se introducen nociones sobre el uso de imágenes térmicas para mantenimiento predictivo. Por último, se presenta un estudio del aprendizaje automático junto con los principales modelos de regresión, lo cual es de gran ayuda a la hora del análisis y diagnóstico en este tipo de centrales. 2.1 Introducción a las centrales termosolares En la actualidad, las centrales termosolares presentan un papel muy importante en la sociedad en términos de sistemas generadores de energía eléctrica. Estas, debido al uso de energía solar como fuente de energía renovable, acompañan el objetivo de conseguir un modelo energético sostenible. 2.1.1 Principios básicos del funcionamiento de una central energética termosolar El funcionamiento de una central termosolar radica en un proceso de transformaciones de energías. La radiación solar se convierte en energía térmica, la cual se transforma en energía mecánica. Una vez llegado a este punto, se volverá a producir un proceso de transformación consiguiendo así la energía eléctrica, que será la que se suministre en los lugares de consumo. Las centrales termosolares presentan ciertas ventajas frente a la tecnología fotovoltaica, como es que puede contar con almacenamiento térmico. Gracias a esto se puede generar electricidad durante la noche o cuando no hay suficiente radiación solar, y también actúa como reserva de energía en períodos de baja producción, contribuyendo así a una mayor estabilidad en la red eléctrica. Además, estas instalaciones pueden aprovechar el calor generado en el proceso para producir calor de proceso en aplicaciones industriales, lo que amplía su utilidad más allá de la producción de electricidad. Sin embargo, estas presentan una desventaja frente a las plantas fotovoltaicas y es que presentan un coste de instalación y operación mayor. Las centrales termosolares están compuestas de diferentes componentes, las cuales se pueden observar en la figura 2.1. En esta se aprecia una parte reservada al almacenamiento de energía, el cual es un sistema común de cualquier planta termoeléctrica y permite el continuo suministro de energía durante la noche o en días nublados. Otro sistema común que aparece es la aportación de combustible fósil. Como resumen, en la figura 2.1 encontramos sistemas que son comunes para las centrales eléctrica pero la diferencia se encuentra en el receptor y concentrador, los cuales son característicos de las centrales termosolares. [1] 5
6Capítulo 2. Fundamentos teóricos Figura 2.1 Esquema general del funcionamiento de una central termosolar en el que se encuentran componentes específicas de este tipo de centrales como son el concentrador y el receptor, y componentes generales de centrales eléctricas. El concentrador solar tiene como función dirigir la radiación del sol, a partir de superficies reflectoras, hacia un receptor, donde se calienta un fluido de transferencia térmica. Esto produce la energía mecánica necesaria para mover un alternador para generación de energía eléctrica. Además, es crucial la labor del concentrador de seguir la trayectoria del sol para aprovechar así la radiación solar. Esto se consigue a partir de un mecanismo de control situado en el concentrador. [4] 2.1.2 Tipos de plantas termosolares Se pueden encontrar distintas tecnologías para generación de energía eléctrica en centrales termosolares y, dependiendo de esta tecnología utilizada, existen distintos tipos de plantas termosolares. Entre ellas encontramos las centrales termosolares de colectores cilindro-parabólicos, de heliostatos con receptor central en torre, con reflectores lineales Fresnel y con discos parabólicos de Stirling. [1] Centrales termosolares de heliostatos con receptor central en torre Este primer tipo de centrales están constituidas por un conjunto de helióstatos cuya función es concentrar los rayos solares sobre un receptor ubicado en una torre. El fluido térmico puede alcanzar temperaturas de 500-600ºC. [9] El funcionamiento de las centrales termosolares del tipo torre se puede encontrar en la figura 2.2 y se basa en la presencia de grandes espejos, llamados heliostatos, que siguen al sol y reflejan su luz en dirección a un único punto. En este punto se encuentra una caldera ubicada en lo alto de una torre. Una vez en la caldera, se calienta un fluido térmico el cual es transportado a un generador de vapor. En este momento, se transfiere el calor del mencionado fluido a otro (normalmente agua) para convertirlo en vapor, listo para impulsar una turbina y generar electricidad. Este tipo de centrales presenta un sistema de almacenamiento, como tanques de sales fundidas, para estabilizar y aumentar su producción. [14]
2.1 Introducción a las centrales termosolares 7 (a) Funcionamiento de una central termosolar tipo torre. (b) Central termosolar tipo torre. Figura 2.2 Imagen de una central termosolar de heliostatos con receptor en torre ubicado en Sevilla junto a su funcionamiento. Centrales termosolares con reflectores lineales Fresnel En este tipo de centrales termosolares se utilizan espejos planos montados en una estructura que permite girarlos sobre un eje. Estos espejos son un conjunto de concentradores cuya función es seguir el movimiento del sol y concentrar la luz hacia un receptor. [ 14 ] El mencionado receptor presenta una estructura parecida a la de un trapecio y está cubierto por un cristal que provoca que haya menos pérdidas. Dentro de esta estructura se encuentra un tubo con fluido caloportador que se irá calentando por la radiación solar, produciéndose así vapor que accionará la turbina para producir la energía eléctrica que se persigue. [8] (a) Funcionamiento de una central termosolar con reflectores lineales Fresnel. (b) Central termosolar con reflectores lineales Fresnel. Figura 2.3 Imagen de una central termosolar con reflectores lineales Fresnel junto a su funcionamiento. Centrales termosolares con discos parabólicos de Stirling Las centrales termosolares con discos parabólicos de Stirling utilizan un sistema de espejos que forman una estructura parabólica, de tal forma que se concentre la luz solar en un receptor ubicado en su foco. Allí, el fluido se calienta hasta alcanzar temperaturas de aproximadamente 750 °C. Para la producción de energía eléctrica, se emplean tecnologías como motores Stirling o turbinas Brayton. [8] El funcionamiento de este tipo de centrales se podría dividir en tres procesos: • Concentrador: Este está asociado al disco parabólico y consiste en una superficie reflectante cuyo diseño parabólico permite que la radiación del sol se focalice en un área pequeña. Es en este foco
8Capítulo 2. Fundamentos teóricos donde se encuentra el receptor, que es el encargado de recibir la energía solar para desplazarla al motor Stirling. • Seguimiento solar: Esto consiste en mantener un seguimiento constante del sol a partir de un mecanismo de dos ejes, lo cual permite una disposición perpendicular de los espejos al sol durante todo el día, asegurando que los rayos solares se dirijan al receptor. • Motor Stirling: Este motor se alimenta de una fuente de calor externa. Al accionarse, se conecta un generador a su salida mecánica para producir la electricidad. (a) Funcionamiento de una central termosolar con discos parabólicos de Stirling. (b) Central termosolar con discos parabólicos de Stirling. Figura 2.4 Imagen en la que se encuentra una central termosolar con discos parabólicos de Stirling junto a su funcionamiento. Centrales termosolares de colectores cilindro-parabólicos En este último tipo se emplean espejos cóncavos que reflejan la radiación solar sobre un tubo el cual coincide con la línea focal. En el interior de este se encuentra un fluido caloportador el cual adquiere una temperatura de 400ºC, generando vapor sobrecalentado que impulsa una turbina para la producción de energía eléctrica. [12] La estructura de este tipo de centrales permite una rotación de los colectores cilíndricos parabólicos de manera que estos, junto a los tubos absorbedores, siguen el movimiento del sol.
2.1 Introducción a las centrales termosolares 9 (a) Funcionamiento de una central termosolar cilindroparabólica. (b) Colectores cilindro-parabólicos junto a tubos absorbedores. Figura 2.5 Imagen en la que se encuentran colectores cilindro-parabólicos junto a los tubos absorbedores junto a su funcionamiento. En esta figura 2.5 se aprecia un colector (Solar Collector Element, SCE) con sus tubos absorbedores (Heat Collector Element, HCE). El SCE está compuesto por 28 espejos que concentran la energía solar en el foco de la parábola, donde están localizados 3 HCE. Esta es la configuración básica de las plantas termosolares en España: 3 HCEs por SCE, 12 SCE que se mueven de manera conjunta en un SCA (Solar Collector Assembly) siguiendo la trayectoria del sol, y 4 SCAs por lazo. Un lazo es un recorrido del fluido de transferencia de calor (Heat Transfer Fluid, HTF). Al inicio del primer SCA el fluido se encuentra a una temperatura baja e irá calentándose hasta llegar a la temperatura óptima al final del último SCA. Este tipo de centrales serán las que se trabajarán en este proyecto ya que los datos e imágenes que se utilizarán son de centrales cilindro-parabólicas. 2.1.3 Importancia de los tubos receptores Como se ha comentado anteriormente, en este trabajo se hace un especial hincapié en las centrales termosolares de tecnología cilindro-parabólica. Durante todo el estudio aparecerán los tubos receptores, por lo que hay que tener claro qué función desempeñan en estas centrales y cuáles son sus componentes. Los tubos receptores (HCE) en plantas termosolares cilindro-parabólicas, son los responsables de transformar la energía del sol en energía térmica. Su eficiencia influye directamente en la capacidad de la planta para generar electricidad, lo que los convierte en un componente crucial para el rendimiento del sistema. Estos están compuestos por diferentes elementos que se podrán observar en la figura 2.6. Entre los componentes principales se encuentran la cubierta de vidrio, el tubo metálico central, el recubrimiento, el getter, la soldadura vidrio-metal y el dilatador [13], los cuales se explican a continuación.
10 Capítulo 2. Fundamentos teóricos Figura 2.6 Componentes principales de un tubo receptor de una planta termosolar cilindro-parabólica. 1. Cubierta de vidrio: Para minimizar la fuga de calor pero permitiendo el paso de radiación, los tubos metálicos en las plantas termosolares se aíslan con un recubrimiento muy fino de vidrio especial. Entre este vidrio, habitualmente hecho de borosilicato, y el tubo, se mantiene un vacío que protege el recubrimiento del tubo y mejora la eficiencia térmica. [13] 2. Tubo metálico central: Los tubos están hechos de acero inoxidable con un espesor en la pared de unos 2 mm y un diámetro cercano a 70 mm. El tubo metálico transfiere al fluido que circula dentro de él, el calor recibido por la radiación del sol. [13] 3. Recubrimiento: El tubo absorbente está cubierto exteriormente por un revestimiento especial diseñado para captar la mayor cantidad de energía solar mientras minimiza las pérdidas térmicas por emisión. Este recubrimiento incluye capas de cermet y molibdeno, optimizando la absorción y reduciendo la emisividad en el espectro infrarrojo. Para evitar la oxidación y degradación causada por altas temperaturas y exposición al aire, se aísla con una cubierta de vidrio al tubo metálico en una atmósfera de vacío. [13] 4. Getter: Los getters son compuestos metálicos que se encargan de eliminar moléculas gaseosas como el hidrógeno. Además, los getters funcionan como un indicador de problemas: contienen bario, que reacciona con el oxígeno cambiando de color a blanco, alertando sobre la pérdida de vacío en el sistema. [13] 5. Soldadura vidrio-metal y dilatador: Es crucial mantener el vacío, comentado anteriormente, dentro del tubo sin que haya pérdidas. Si la soldadura falla, el tubo quedará inutilizable. El dilatador compensa las diferencias de expansión entre el vidrio y el tubo metálico causadas por las distintas temperaturas. [13] 2.2 Procesamiento y análisis de imágenes térmicas 2.2.1 Análisis de imágenes térmicas en plantas termosolares Las imágenes térmicas son herramientas útiles, las cuales se suelen utilizar en el mantenimiento de plantas industriales, en especial, en las termosolares. Estas imágenes capturan la radiación infrarroja que emiten los objetos, lo que permite detectar anomalías térmicas en componentes que pueden ser difíciles de apreciar a simple vista. El uso de drones, equipados con cámaras térmicas, es una metodología efectiva para la inspección de componentes de difícil acceso como son los tubos receptores. Estos drones permiten la realización de inspecciones de manera rápida y eficiente, existiendo la posibilidad de llevarlas a cabo de manera periódica
2.2 Procesamiento y análisis de imágenes térmicas 11 para plantas termosolares de áreas elevadas. De esta manera, se permite la identificación temprana de fallos y la ubicación exacta de ellos si es que ocurriesen. 2.2.2 Fundamentos del cálculo de temperatura en imágenes térmicas La temperatura de los objetos no se captura directamente por las cámaras térmicas, sino que estas detectan la radiación infrarroja que emiten los objetos a través del sensor de la cámara, y se convierte en una estimación de temperatura mediante modelos físicos. Durante este proceso, existen distintos factores los cuales tienen que presentar una configuración sin errores, como son la emisividad o propiedades ópticas del sistema. Visualizando la página oficial de FLIR Systems [ 2 ], puede encontrarse que la temperatura de un objeto se puede calcular mediante la siguiente expresión: T=B lnR ε·(S−O)+F(2.1) donde: •T: temperatura del objeto (Kelvin) •ε: emisividad del objeto •S: señal radiométrica detectada por el sensor •R,B,F,O: constantes de calibración específicas del modelo de cámara Como puede observarse, la emisividad del objeto es un parámetro fundamental en este cálculo. Este se podría definir como un parámetro adimensional que representa la capacidad que tiene el objeto de emitir radiación infrarroja. Si se tomase un valor incorrecto para la emisividad, se pueden llegar a errores importantes en la estimación de la temperatura, por lo que hay que tener seguridad en este valor, el cual siempre está comprendido entre 0 y 1. Sin embargo, esta fórmula no es siempre así para todos los casos de uso, ya que hay otros fabricantes que aunque se basen en la misma base física (la ley de Planck para cuerpos grises), tienen ciertos cambios, como pueden ser diferentes ajustes o constantes. Por tanto, es cierto que los distintos métodos de cálculo térmico están basados en los mismos principios físicos pero, al depender de otros factores, el cálculo de la temperatura podrá variar dependiendo del dispositivo. Así que, para poder calcular una temperatura de manera precisa y sin errores hace falta conocer los parámetros que intervienen en el proceso y el modelo de cálculo que utilice el fabricante. 2.2.3 Procesamiento de imágenes térmicas En el procesamiento de imágenes térmicas, en especial, en los datos incluidos internamente, se pueden encontrar distintas posibles etapas a partir de las cuales se consigue garantizar que los datos de estas imágenes sean útiles para tomar decisiones. Entre estas etapas se encuentra la normalización, la cual permite ajustar la imagen para que los valores térmicos se muestren de manera coherente y comparativa. De esta manera, los datos se podrán observar en un rango determinado. Además, como segunda etapa se puede encontrar la eliminación de ruido. Gracias a esto se consigue obtener mediciones más precisas ya que se reducen interferencias en los datos. Como última etapa se presenta la segmentación, a partir de la cual se pretende identificar y aislar áreas específicas de la imagen, como en este caso podrían ser las regiones de interés de los tubos absorbedores.
18 Capítulo 2. Fundamentos teóricos ˆy(x) = 1 k∑ i∈Nk(x) yi donde: •Nk(x)representa el conjunto de los kvecinos más cercanos a x, •yies el valor real asociado al vecino i, •ˆy(x)es la predicción del modelo para la entrada x. Regresión Tweedie El modelo de regresión Tweedie es una generalización de los modelos lineales clásicos que permite predecir valores (variable dependiente) los cuales tienen un comportamiento exponencial de la familia Tweedie, como la normal, Poisson o gamma. Se suele utilizar cuando la variable dependiente presenta valores continuos y ceros. Su función de pérdida depende de un parámetro llamado power p, que determina el tipo de distribución: -p=0: regresión normal (gaussiana), -p=1: regresión Poisson (cuenta), -p=2: regresión gamma (valores positivos continuos), -1<p<2: distribución compuesta. El objetivo es minimizar la siguiente función de pérdida: LTweedie(w) = 1 n n ∑ i=1 ℓ(yi,ˆyi;p) donde: •ℓ: es la función de pérdida Tweedie asociada al parámetro de potencia p, •ˆyi=X⊤ iw: es la predicción lineal del modelo, •n: número de muestras. 2.5 Métricas de Evaluación Una costumbre útil es el análisis de distintas métricas para respaldar la decisión de qué modelo de regresión es mejor. De esta manera se puede confirmar la precisión de los regresores. Gracias a las métricas se permite cuantificar la diferencia entre los valores reales observados y las predicciones generadas por el modelo. Si se quisiera analizar dentro del mundo del aprendizaje automático, se puede llegar a la conclusión de que esto es realmente útil para comparar algoritmos y optimizar su rendimiento. [6] Para analizar estas métricas más a fondo, se presentan las principales a continuación: 2.5.1 Error Cuadrático Medio (MSE - Mean Squared Error) El MSE es una de las métricas más comunes para evaluar modelos de regresión. Se define como la media de los errores al cuadrado, es decir, la diferencia de los valores reales y los valores predichos, al cuadrado. De esta manera se puede saber la precisión en el ajuste del modelo a las observaciones. [6]
2.5 Métricas de Evaluación 19 MSE =1 n n ∑ i=1 (yi−ˆyi)2 Donde: •nes el número total de observaciones. •yies el valor real de la i-ésima observación. •ˆyies el valor predicho para la i-ésima observación. Esta métrica resulta realmente interesante cuando se tienen errores grandes ya que los penaliza, es decir, si se quiere minimizar grandes desviaciones, esto sería muy útil. Un valor de MSE más bajo indica una mejor capacidad del modelo para ajustarse a los datos. 2.5.2 Raíz del Error Cuadrático Medio (RMSE - Root Mean Squared Error) El RMSE es la raíz cuadrada del MSE. De esta manera, se consigue eliminar la solución en unidades cuadradas, como ocurre en el MSE. [6] RMSE =√MSE =s1 n n ∑ i=1 (yi−ˆyi)2 2.5.3 Error Absoluto Medio (MAE - Mean Absolute Error) El MAE es la diferencia entre los valores de las predicciones y los valores reales: [6] MAE =1 n n ∑ i=1|yi−ˆyi| En comparación con el MSE, esta métrica es menos sensible a valores atípicos. Además, es especialmente útil para interpretar los errores de forma más directa en la misma escala que los datos originales. 2.5.4 Error Absoluto Máximo El error absoluto máximo proporciona información sobre la mayor desviación cometida por el modelo en una predicción concreta: [6] Error absoluto máximo =m´ ax(|yi−ˆyi|) Esta métrica es importante cuando se pretende evaluar el peor caso de error del modelo. 2.5.5 Error Porcentual Absoluto Medio (MAPE - Mean Absolute Percentage Error) El MAPE expresa el error como un porcentaje, lo que permite comparar el rendimiento del modelo en diferentes escalas. [6] MAPE =100% n n ∑ i=1 yi−ˆyi yi
20 Capítulo 2. Fundamentos teóricos 2.5.6 Coeficiente de Determinación (R2) El R2 indica la proporción de la varianza en la variable dependiente que es explicada por el modelo. Su valor oscila entre 0 y 1, donde valores cercanos a 1 indican un mejor ajuste. [6] R2=1−∑n i=1(yi−ˆyi)2 ∑n i=1(yi−¯y)2 Donde ¯yes la media de los valores reales, e ˆyies el valor predicho por el modelo para la observación i. 2.5.7 Resumen de métricas Tabla 2.3 Resumen de métricas de evaluación para modelos de regresión. Métrica Descripción MSE Promedio de los errores al cuadrado; penaliza errores grandes. RMSE Raíz cuadrada del MSE; misma unidad que la variable objetivo. MAE Promedio de los errores absolutos; menos sensible a valores atípicos. Error Absoluto Máximo Mayor error absoluto observado; útil para evaluar el peor caso. MAPE Promedio del error porcentual absoluto; permite comparaciones relativas. R2 Proporción de la varianza explicada por el modelo; indica la calidad del ajuste. 2.6 Revisión bibliográfica En los últimos años, el uso de técnicas de visión por computador y aprendizaje automático ha aumentado debido a su utilidad en aplicaciones industriales, y sobre todo en el ámbito de las energías renovables. Y, siendo más preciso, las plantas termosolares se han beneficiado de estas tecnologías, ya que se consigue mejorar sus sistemas de mantenimiento y la optimización operativa. Por tanto, en esta sección se presentarán los trabajos más relevantes que están relacionados con el caso que ocupa en este Trabajo Fin de Grado, y que han servido como base. En cuando al papel de las imágenes térmicas como herramienta de diagnóstico en plantas termosolares, hay varias fuentes que destacan. La tecnología termosolar y su funcionamiento ha sido descrito por Arsinger [ 4 ] y en documentos técnicos como el de [ 1 ]. En estas referencias se puede apreciar una visión clara de cuántos tipos hay de plantas termosolares y cuál es el papel de los tubos receptores. Relacionado con esto se encuentra el estudio recogido en [ 9 , 14 , 11 ], en el que se analizan los distintos tipos de plantas solares, donde se encuentra las de tipo cilindro-parabólico, que es la que se aborda en este trabajo. Los tubos receptores tienen un papel muy importante en las plantas termosolares, y por este motivo se pueden encontrar trabajos como el de Espinosa Rueda [ 8 ], donde se evalúa el impacto térmico de estos tubos en la producción eléctrica. Además, en el trabajo de Llorente Sánchez [ 13 ] se puede apreciar un estudio de los tubos receptores, quedando claro las distintas partes de estos. En cuanto al procesamiento de imágenes térmicas y su análisis, es muy importante comprender los principios físicos de la conversión de señales infrarrojas en valores de temperatura, tal como se explica en la documentación técnica de FLIR [ 2 ] y en su software oficial [ 3 ], el cual ha sido empleado durante este trabajo para la extracción y tratamiento inicial de datos térmicos.
2.6 Revisión bibliográfica 21 El aprendizaje automático ha sido abordado desde una perspectiva normativa por la ISO [ 10 ], y también a nivel técnico en fuentes como [ 7 , 15 ]. Gracias a esto se ha podido observar los tipos de modelos de regresión que existen (como la regresión lineal, árboles de decisión, redes neuronales y técnicas de ensamblaje), para así comprobar cual es con el que se obtienen mejores resultados en nuestro trabajo. Relacionado con esto también se encuentra el trabajo de Cano de la Torre [5], ya que aplica técnicas de Machine Learning, como puede ser árboles de decisión o Bagging y Boosting. Por otra parte, las métricas de evaluación aplicadas en este trabajo (MAE, RMSE, MSE, R 2 , entre otras) se fundamentan en análisis previos como los de [ 6 ], donde se explican las ventajas y limitaciones de cada métrica. Estas herramientas de evaluación son muy interesantes para comparar modelos y poder decidir cual predice mejor, que será para lo que se utilice en este trabajo. Finalmente, desde el punto de vista del mantenimiento avanzado, el trabajo de León Artillo [ 12 ] aporta una perspectiva innovadora mediante el uso de counterfactuals para la detección de roturas, lo cual reafirma la tendencia hacia el uso de IA como herramienta de diagnóstico inteligente en plantas termosolares. En resumen, el presente trabajo se enmarca en una línea de investigación activa y respaldada por numerosos estudios previos. Sin embargo, introduce elementos diferenciadores como el uso conjunto de etiquetado automático, visión por computador e integración directa con software térmico profesional, además de proponer una doble metodología (ratio y diferencia absoluta) que amplía las perspectivas de análisis y predicción en el entorno industrial real.
3 Metodología L a metodología seguida en este trabajo está formada por dos fases que responden a los objetivos planteados en la introducción. En la primera fase, se estudia el error obtenido al utilizar FLIR Thermal Studio para estimar la temperatura medida de los tubos receptores y, en la segunda fase, se implementa un sistema predictivo basado en aprendizaje automático para estimar la temperatura medida, y así poder compararlo con los datos de la empresa externa. Ambas fases se apoyan en un tratamiento inicial de los datos, en la obtención precisa de las temperaturas aparentes a partir de imágenes térmicas, y en la identificación automatizada de los tubos receptores a través de técnicas de visión por computador, que se detallan a continuación. La segunda fase tiene un añadido y es que también se necesita entrenar el conjunto de datos, por lo que se compararon distintos modelos de regresión. Para ello, se plantean dos enfoques distintos. Uno primero basado en la predicción directa de la temperatura y otro centrado en la estimación de un ratio por el que multiplicar la temperatura aparente, y así obtener la medida. Por tanto, para comprender esto, se presenta este apartado de Metodología para entender todo con más detalle. 3.1 Descripción de los datos 3.1.1 Origen de los datos En este trabajo se han utilizado un conjunto de datos proporcionados por la empresa VirtualMechanics SL. Esta colaboración ha permitido acceder a información obtenida en inspecciones de plantas termosolares de tecnología cilindro-parabólica. Estas inspecciones han sido realizadas para el mantenimiento de las plantas pero, para este estudio, se han utilizado con un objetivo más concreto como es el análisis del funcionamiento de los tubos receptores. Al analizar estos datos se busca la anticipación a posibles fallos y la localización del lugar en el que se ha producido una avería, si es que ha llegado a producirse. Además, la calidad de los datos proporcionados ha permitido contar con una fuente de información fiable para el desarrollo de modelos de aprendizaje automático, los cuales serán capaces de predecir parámetros desconocidos de los tubos receptores en plantas termosolares. Asimismo, este conjunto de datos permite adquirir una visión real de las condiciones operativas en las centrales termosolares en España. Esto es posible gracias a que presentan datos de mediciones ambientales (como son la temperatura ambiente y la velocidad del viento) y parámetros técnicos extraídos de las imágenes térmicas. Esta combinación de información permite contextualizar el análisis y mejorar la precisión de los modelos predictivos desarrollados en este trabajo. 23
24 Capítulo 3. Metodología 3.1.2 Imágenes térmicas Las imágenes térmicas empleadas en este proyecto fueron tomadas a partir de drones equipados con cámaras térmicas avanzadas. Según las cámaras utilizadas se podrán captar unos datos u otros. Estos dispositivos permiten capturar la radiación infrarroja emitida por los tubos receptores en las plantas termosolares. Una vez capturados, se convierten en datos visuales. Gracias a estas imágenes se permite obtener información de ubicaciones de difícil acceso como son los tubos receptores. Una imagen, a modo de ejemplo, con la que se trabajará en este estudio es la siguiente: Figura 3.1 Imagen térmica de una inspección realizada por la empresa VirtualMechanics SL, la cual presenta datos asociados internos de diferentes parámetros. 3.1.3 Variables medidas Las imágenes utilizadas como fuentes de datos, contienen información básica como la hora y el lugar en las que fueron tomadas. Gracias a esta información, se puede combinar con registros de plantas que incluyen mediciones de distintos sensores tomadas a lo largo del día y, de esta manera, obtener una serie de variables adicionales. Algunas tienen un papel más o menos relevante en la predicción del estado operativo de los tubos receptores. Por ello, se llevó a cabo un análisis para estudiar qué representa cada variable y evaluar su viabilidad para el caso que nos ocupa. Se ha contado con varias inspecciones, en cada una de las cuales se encuentran unas 20.000 imágenes con sus respectivas variables asociadas. Cada imagen está dispuesta en una fila y cada variable en columnas separadas, contabilizando 12 distintas columnas (12 variables) a las que se añadirán otras 4. A continuación, se detallan estas variables: • PlantDescr: Código alfanumérico que identifica el tubo receptor dentro de la planta. Esta nomenclatura permite asociar cada imagen con las características y mediciones correspondientes a ese tubo (ubicación, sensores, etc.). • LocInLoop: Hace referencia a la posición del tubo receptor (HCE) dentro de un lazo en la planta termosolar. •Loop: Designa el lazo al que pertenece el HCE. • MeasuredTemp_degC: Temperatura medida del tubo absorbedor (HCE) en grados Celsius y representa la variable objetivo de este trabajo. Aunque esta variable se encuentra en algunas inspecciones, hay otras en las que no por lo que se busca predecir para así poder utilizarla en inspecciones futuras o en las cuales no se tienen este dato.
3.1 Descripción de los datos 25 • HTF_degC: Valor de temperatura en grados Celsius del fluido caloportador que circula por el interior del tubo. •Ambient_degC: Valor de la temperatura ambiente en grados Celsius. •Windspeed: Velocidad del viento. •Img_time: Muestra la fecha y la hora en las que fueron tomadas las imágenes. • DNI: Valor de la radiación directa medida por un sensor dentro de la planta. En cierto modo indica cuánta energía solar está llegando al campo. •HCE_tag: Código que identifica a cada tubo. •State: Valor binario que indica si la funda de vidrio está sana (0) o rota (1). •SCE_defocused: Valor binario que indica si el colector está fuera de foco (1) o no (0). •VIS_img_name: Nombre de la imagen. • Apparent temperature: Temperatura aparente. Esta variable ha sido añadida manualmente a las inspecciones ya que son de vital importancia en este trabajo. Sobre esta variable se buscará realizar las transformaciones necesarias para que se parezca a la variable objetivo. • Measured-Apparent Temp ratio: Esta ha sido una variable añadida manualmente y refleja la temperatura medida entre la temperatura aparente. Con esto se consigue estimar un ratio y puede ser útil si en el modelo se busca predecir el ratio por el cual multiplicar la temperatura aparente para calcular la temperatura del tubo. • ApparentTemp*1.3: Variable añadida manualmente que hace referencia a la temperatura aparente por un ratio de 1.3. De esta manera se buscaba analizar la similitud entre este resultado y la temperatura medida del tubo. • Error: Variable añadida manualmente para ver reflejado el error entre la temperatura medida y la temperatura aparente. 3.1.4 Matriz de temperatura y alineación de datos Un aspecto fundamental del trabajo es el que sigue a continuación. Realizando distintas pruebas se veía una falta de coherencia entre los datos que se obtenían de las imágenes térmicas y lo que se visualizaba en la propia imagen, es decir, por ejemplo, se obtenían temperaturas propias de los espejos cilíndrico-parabólicos en zonas correspondientes a los tubos absorbedores. Por tanto, se sospechaba que la imagen térmica que se visualiza no representaba directamente los valores de temperatura. Por tanto, el problema era importante. Existían casos en los que los píxeles de la imagen visual no estaban correctamente alineados con su correspondiente matriz térmica. Esta descorrelación entre la imagen visible y la matriz de temperatura implicaba que las regiones de interés (en este caso, los tubos receptores) no coincidían con los valores de temperatura esperados en esas posiciones. Dicho problema podía deberse al software de la cámara, al formato del archivo o a errores de exportación.
26 Capítulo 3. Metodología Por este motivo, se optó por extraer directamente la matriz de temperatura para cada imagen, de manera que se trabajase sobre ella para evitar errores. Este fue uno de los pasos más importantes en todo el trabajo ya que se garantiza la fiabilidad de los datos térmicos utilizados, que harán falta para las dos fases de obtención de temperaturas de los tubos. Un ejemplo de esta problemática se presenta en la figura 3.2 y en la figura 3.3. En la primera imagen se puede observar una imagen cualquiera del conjunto de datos y, justo debajo, la imagen interna que presentaba. Es fácil encontrar la diferencia, de hecho puede parecer que son imágenes distintas tomadas desde diferentes posiciones, por lo que se demuestra la importancia de extraer la matriz de temperatura directamente. Figura 3.2 Imagen del conjunto de datos proporcionada por VirtualMechanics SL. Figura 3.3 Imagen interna de la figura 3.2, donde se puede apreciar el claro error que presentan, pudiendo parecer imágenes totalmente distintas.
3.1 Descripción de los datos 27 3.1.5 Estrategias para complementar datos faltantes En este proyecto, se hace uso de diferentes variables, sin embargo, la temperatura aparente no aparece y es esta la que se utiliza, por ejemplo, para realizarle las transformaciones necesarias de manera que se convierta en el valor de la temperatura de los tubos. Al no estar presente este parámetro de manera directa, se llevaron a cabo distintas estrategias para su cálculo, como son un etiquetado manual de las imágenes y la utilización de una herramienta de inteligencia artificial proporcionada por la empresa VirtualMechanics SL. ETIQUETADO MANUAL El primer paso consistió en procesar y etiquetar más de 200 imágenes térmicas utilizando la herramienta LabelMe. Esto es un software utilizado para la anotación de datos visuales. Durante el proceso de etiquetado se procedió al descarte de imágenes que no son de interés para el estudio o que estuviesen defectuosas. De esta manera, a las imágenes seleccionadas como buenas se les asignaron distintas etiquetas, las cuales representan los espejos cilindro-parabólicos y los tubos receptores. Esto nos permite tener una fuente de datos para poder detectar espejos y tubos, además de la identificación de las zonas de interés para el cálculo de los valores de las temperaturas aparentes. IA PARA EL CÁLCULO DE LAS TEMPERATURAS APARENTES Una vez conseguido un conjunto de imágenes, las cuales tienen asociadas las temperaturas aparentes y las etiquetas, se utilizan para entrenar un algoritmo de inteligencia artificial el cual fue facilitado por VirtualMechanics SL. Esta herramienta permite conseguir un etiquetado automático de los tubos de imágenes nuevas, y obtener los valores de las temperaturas aparentes asociados a dichos tubos receptores. Para que esta herramienta funcionase, había que introducirle como entrada las máximas imágenes etiquetadas posibles. De esta manera, el modelo aprendía para futuras imágenes, las cuales no tuviesen etiquetas asociadas. Esto resultó bastante útil ya que ahorra mucho tiempo. Sin embargo, al producirse el etiquetado mediante inteligencia artificial, existía la posibilidad de que se detectase como tubos, zonas que no se correspondían como tal. De esta manera se podían obtener datos erróneos. Aún así, se decidió utilizar este método en inspecciones cuyas imágenes no se encontrasen etiquetadas, ya que se garantizaba que, en un porcentaje bastante alto, se detectasen los tubos con sus temperaturas asociadas a la perfección. En el caso de las imágenes que diesen fallo, se procederá para no contar con ellas ni en el uso del software de FLIR ni en el entrenamiento previo del modelo predictivo. VALIDACIÓN CON LIBRERÍAS PYTHON Con el fin de garantizar la precisión de los datos calculados, además de contribuir a la automatización en el cálculo de las temperaturas, se desarrolló un código personalizado en Python utilizando las librerías de FLIR y OpenCV. El objetivo principal de este código fue tener una base comparativa para comprobar que la IA funcionaba acorde a lo esperado. Además, se obtenía así un script el cual permitía detectar automáticamente los tubos receptores. Este código simplifica futuros trabajos en los que se tenga como objetivo la obtención de determinadas temperaturas en grandes volúmenes de datos. En el código, primeramente se cargan y filtran los datos facilitados de las inspecciones, además de las etiquetas junto a las respectivas imágenes. Se define una región de interés en cada imagen (que estará vinculada con los tubos centrales) y se calcula la temperatura en esa zona. Por último, se recogen los datos generados en un archivo csv para una mejor visualización de los resultados. A modo de ejemplo, se presenta la siguiente tabla en la que se muestran el resultado en grados Celsius de las temperaturas aparentes de ciertas imágenes:
4 Análisis y resultados E n este capítulo se muestran los resultados que se han obtenido al aplicar todas las fases comentadas en el apartado de metodología. Se empieza con una exploración de los datos para estudiar distribuciones y correlaciones entre variables y, acto seguido, se entrenan distintos modelos con diferentes técnicas de escalado. Además, se comparan los regresores a partir de las distintas métricas utilizadas (MSE, MAE y error máximo). Esto se realiza tanto para los datos de entrenamiento como para un conjunto de datos externo, aplicado a su vez para ambas metodologías. 4.1 Análisis exploratorio de los datos 4.1.1 Distribución de variables Con el objetivo de entender mejor el comportamiento de las variables independientes empleadas en los modelos de regresión, se ha realizado un análisis mediante histogramas acompañados de curvas de densidad. En la Figura 4.1, se representan las distribuciones de distintas variables como son la DNI, la HTF_degC, la ambient_degC, la windspeed y la apparent temperature. De esta manera se podrán conocer mejor las variables con las que se trabajan y se pueden identificar ciertas anomalías o, por el contrario, comportamientos usuales. Estas variables fueron las seleccionadas dentro de todo el conjunto de datos debido a que eran las que más influencia tenían en los datos. Se comprobó que, al incluir alguna de las otras variables, los resultados no se veían ni empeorados ni mejorados, por lo que se descartó su uso. Figura 4.1 Distribución de las variables independientes seleccionadas (DNI, HTF_degC, ambient_degC, windspeed y apparent temperature) para así conocer de una manera más detallada los datos. 35
36 Capítulo 4. Análisis y resultados Visualmente se pueden deducir ciertas afirmaciones que se comentan a continuación: • DNI: Como se comentó en el apartado de metodología, esta variable indica cuánta energía solar llega al campo. La distribución presenta una gran afluencia de valores altos, con un pico significativo cercano a los 900 W/m2. Esto es consistente con la operativa de la planta en condiciones de alta irradiación, propias de climas soleados y estables. • HTF_degC: Esta variable mide la temperatura del fluido térmico que circula por los tubos. En cuanto a su distribución, se puede observar que está principalmente concentrada entre 300 °C y 380 °C, lo que indica que la planta trabaja principalmente en régimen estacionario. Además, se pueden observar ciertos valores más bajos que podrían ser provocados por fases de arranque o apagado del sistema. • ambient_degC: La distribución de esta variable se encuentra entre 28 °C y 39 °C, con varios picos. Esto refleja las condiciones térmicas externas del entorno en el que se encuentra la planta, pudiéndose deducir que la planta se encuentra en una zona cálida (como es propio en este tipo de plantas). • windspeed: En cuanto a esta variable podemos observar un comportamiento bastante asimétrico, aunque se puede apreciar que hay una mayor concentración de valores en la zona entre 0.5 y 2 m/s. La presencia de velocidades moderadas y bajas es habitual en días soleados y estables, en los que la planta opera con normalidad. • apparent temperature: Esta es la variable más importante de este trabajo, la cual se tuvo que añadir al conjunto de datos. Se puede observar que el rango de valores está entre 40 °C y 140 °C, lo que demuestra la variedad de situaciones operativas de la planta, aumentando la dificultad del problema que se intenta solucionar en este trabajo. En resumen, este análisis confirma la importancia de las variables seleccionadas. Además, permite conocer mejor con qué parámetros se está trabajando y así detectar la presencia de datos atípicos. Estos aspectos se han tenido en cuenta en las siguientes fases del modelado y en la selección de los algoritmos de regresión. 4.1.2 Correlaciones entre variables Una vez analizadas individualmente las variables más relevantes del conjunto de datos, se quiso visualizar las relaciones de estos parámetros entre sí. Para ello se han utilizado distintos gráficos de dispersión en los que se representa en el eje x a la temperatura aparente, ya que es la variable más importante del conjunto de datos, y en el eje vertical se mostrarán la temperatura aparente, la velocidad del viento, la temperatura del fluido caloportador (HTF) y la DNI. Gracias a esto se pueden llegar a apreciar posibles correlaciones directas entre la temperatura aparente y el resto de variables. Además, sirve para identificar regiones en las que haya una mayor concentración de los datos y, si los hubiera, patrones que destaquen por no ser normales. Además, los datos se han enriquecido visualmente mediante dos niveles de codificación categórica, adaptados según la metodología empleada. En la primera metodología (predicción del ratio entre la temperatura medida y la aparente), el color de los puntos hace referencia a la calidad del ratio y se considerará como bad, medium o good en función de un umbral que se define para ese ratio. De esta manera, si el ratio es menor o mayor a cierto valor que se comentará en breve, los datos asociados a ese ratio se quitarán ya que, probablemente, tengan algún error de partida. Por otro lado, la forma del marcador representa los cuartiles de la velocidad del viento. Es decir, se dividen las muestras en tres rangos según su intensidad, lo que permite detectar si el viento afecta más o menos a la relación entre las variables representadas. En la segunda metodología (predicción directa de la temperatura medida), el color de los puntos se basa en la diferencia entre la temperatura medida y la temperatura aparente. Se establece una división simple entre muestras aceptables (con |Error| < 40°C) y malas (|Error| > 40°C), asignando las etiquetas acceptable y bad respectivamente. De esta manera, al igual que antes, los datos cuyos errores estén en ese rango de valores no se tomarán como válidos y se despreciarán. De nuevo, la forma del marcador sigue representando los cuartiles de la velocidad del viento. De esta forma, cada gráfico sintetiza simultáneamente hasta cuatro dimensiones: dos continuas (en los ejes), una categórica cualitativa (color) y otra ordinal (forma del marcador). Este nivel de detalle aporta una visión más agradable y permite detectar interacciones complejas entre las variables. A lo largo de las siguientes gráficas se detallarán estas interacciones, ayudando a entender en qué contextos la estimación de temperatura puede ser más o menos precisa y qué variables presentan mayor influencia sobre dicha estimación.
4.1 Análisis exploratorio de los datos 37 Criterios de clasificación del error Como se ha comentado en la introducción de este apartado, se han establecido umbrales tanto para el ratio entre la temperatura medida y la aparente (primera metodología) como para el error absoluto (segunda metodología). En la primera metodología se ha representado gráficamente la temperatura aparente frente a otras variables como son la temperatura ambiente, la velocidad del viento, la temperatura del HTF y la DNI. En dichas gráficas, hay dos características que se pueden visualizar también. Primero se representa la calidad del ratio a partir de distintos colores, considerando aceptables los que tengan un valor entre 1.2 y 1.4, aunque hay otros rangos de valores que se presentan a continuación: •Good (verde): ratio entre 1.2 y 1.4 (valores considerados ideales). •Medium (naranja): ratio cerca del rango ideal, es decir, entre 1.1 y 1.2, o entre 1.4 y 1.5. •Bad (azul): ratio por debajo de 1.1 o por encima de 1.5. Figura 4.2 Distribución del ratio entre la temperatura medida y la aparente. Se destacan los límites utilizados para clasificar la calidad del dato. En la Figura 4.2 se muestra la distribución del ratio entre la temperatura medida y la temperatura aparente. Este gráfico permite observar cómo se comporta este cociente a lo largo del conjunto de datos, y justifica la selección de los umbrales utilizados para su clasificación. Como se puede observar en la gráfica, la mayoría de los valores están dentro del rango entre 1.1 y 1.5 pero presentando un pico mayor entre 1.2 y 1.4, lo que indica que, en condiciones normales de operación, la temperatura medida suele superar en un 20% a 40% a la aparente. Por este motivo se ha considerado como aceptable (good) el rango comprendido entre 1.2 y 1.4. Por debajo de 1.1 o por encima de 1.5 se consideran que son datos los cuales tienen errores del proceso de etiquetado ya que se comprueba que la temperatura aparente no puede ser mayor que la medida, y tampoco puede ser excesivamente grande en comparación con la medida. Por ello, estos valores se consideran valores "bad". Adicionalmente, la forma del marcador representa los cuartiles de velocidad del viento, permitiendo explorar si este factor influye en la relación entre variables: •Cuartil 1 (Q1): viento bajo (menor a 1.1 m/s). •Cuartiles 2 y 3 (Q2–Q3): viento moderado (entre 1.1 y 1.9 m/s). •Cuartil 4 (Q4): viento alto (mayor o igual a 1.9 m/s). En la segunda metodología el criterio de clasificación se basa en el error absoluto entre la temperatura medida y la temperatura aparente. Este error fue una variable que se añadió manualmente al conjunto de
38 Capítulo 4. Análisis y resultados datos y corresponde al parámetro "Error". Por tanto, se puede hacer una distinción en los valores en base a este parámetro, considerándolos como Good, Medium o Bad en base a: •Good (azul): errores absolutos menores o iguales a 20 °C. •Medium (verde): errores comprendidos entre 20 y 40 °C. •Bad (naranja): error mayores a 40 °C. Figura 4.3 Distribución del error entre la temperatura medida y la aparente. Se indican los límites establecidos para considerar una predicción aceptable (+-40°C). En la Figura 4.3 se presenta la distribución del error absoluto calculado como Error =Tmedida −Taparente . Esta gráfica es realmente útil para apreciar como se reparte la diferencia entre ambas variables a lo largo del conjunto de datos y sirve para establecer un criterio de calidad de la predicción en la segunda metodología. Se puede apreciar que la mayoría de errores se concentran en torno a 0°C, los cuales van disminuyendo en frecuencia a medida que aumenta la magnitud del error. Este comportamiento es coherente si se compara con la Figura 4.2, en la que se observaba que el ratio más repetido se sitúa entre 1.2 y 1.4. Esto puede parecer contradictorio a simple vista, pero ambos análisis son compatibles ya que la Figura 4.3 agrupa los errores en intervalos, por lo que incluso un ratio del 1.2 puede implicar un error absoluto reducido (por ejemplo, 3–4°C). Este es el motivo por el que la concentración de errores cercanos a 0°C no contradice el que exista un ratio dominante diferente de 1. Por tanto, el gráfico del ratio muestra los valores de forma relativa (porcentaje) y el gráfico del error agrupa los valores por intervalos. En base a esto, se consideró como predicción aceptable todos los valores que tuviesen un error igual o inferior a 40°C, valor que abarca a más del 95% del conjunto de datos. Este umbral (marcado por las líneas rojas discontinúas) permite diferenciar los casos en los que los datos presentan valores razonables en cuanto a la temperatura medida y la aparente, y los datos los cuales presentan errores de fábrica. En cuanto a las etiquetas que se les han asignado, se consideran como bad a los errores superiores a 40°C ya que, probablemente, el proceso de etiquetado a través de IA habrá reconocido mal los tubos o simplemente había un error en el propio conjunto de datos inicial. En definitiva, esta representación permite justificar el criterio adoptado para clasificar la calidad de la variable objetivo en la segunda metodología, facilitando su análisis gráfico y posterior interpretación. En ambos enfoques, el añadir unas variables reflejadas por el color, para la calidad del resultado, y la forma, para el viento, permite detectar posibles dependencias de los errores con respecto a variables operativas como la velocidad del viento o la radiación solar. Es decir, si se localiza una fuente de error en la variable objetivo y la velocidad del viento, y se repite para otras gráficas en las que se comparen otras variables, se podrá deducir que hay algún error.
4.1 Análisis exploratorio de los datos 39 Primera Metodología, Correlaciones entre variables Para comenzar la explicación de las distintas gráficas, primero se centra el análisis en la primera metodología. En todas las gráficas se comparará la temperatura aparente con el resto de variables importantes del conjunto de datos. Además, como se ha comentado, se utilizarán otras dos variables para poder así comparar hasta en cuatro dimensiones. Figura 4.4 Distribución de la temperatura aparente junto a la temperatura ambiente, comparándolas a su vez con la velocidad del viento y el ratio. La Figura 4.4 tiene como objetivo identificar si existe alguna relación entre la temperatura ambiente y la temperatura aparente. Además, se puede analizar como esta relación puede verse afectada por la velocidad del viento o por la calidad del ratio. A simple vista, se observa que existe una cierta dispersión vertical, es decir, para una misma temperatura aparente se pueden observar varios valores diferentes de temperatura ambiente. De esto se puede deducir que ambas variables presentan cierta relación de forma moderada pero en ningún caso lineal. La gran mayoría de los puntos presentan una clasificación de ratio "good" o "medium", lo que indica que hay muy pocos extremos ("bad"). Estos datos calificados como "bad" se encuentran principalmente para temperatura aparentes bajas, aunque se pueden apreciar situaciones en las que, para temperaturas altas o medianamente altas, se encuentren estos puntos. No parece haber un patrón claro entre los cuartiles de viento y la calidad del ratio. Los tres estilos de marcador se encuentran repartidos a lo largo de todo el gráfico. No obstante, los valores clasificados como "bad" tienden a agruparse en zonas de viento muy bajo (Q1). Por tanto, se puede observar que, de este gráfico, se puede obtener información muy útil sobre las condiciones en las que el ratio es más fiable. Es decir, si se tuviese que elegir la combinación en la que se obtendrían mejores resultados, sería con temperaturas moderadas tanto aparente como ambiente, y velocidad del viento medias. Con estas condiciones se tendrían ratios más estables y precisos.
40 Capítulo 4. Análisis y resultados Figura 4.5 Distribución de la temperatura aparente junto a la velocidad del viento, comparándolas a su vez con el ratio. El objetivo de esta Figura 4.5 es explorar si la velocidad del viento influye en la fiabilidad del ratio calculado. A diferencia del gráfico anterior, aquí no se ha empleado codificación por forma ya que la propia variable en el eje y ya representa el valor de windspeed. Analizando la gráfica se pueden extraer varias observaciones, aunque la que salta a la vista primero, es que la mayoría de los datos están concentrados en el rango de vientos bajos a moderados. Esto correspondería a los cuartiles 1, 2 y 3, según la diferenciación que se realizó para la primera gráfica explicada. Esto es totalmente esperable ya que muchas plantas termosolares trabajan especialmente cuando se tiene controlada la velocidad del viento, ya que podría suponer un problema rachas fuertes de viento en estas plantas. En estos rangos bajos de viento (entre 0.5 y 1.9 m/s), se puede apreciar una mayor proporción de puntos verdes, lo que indica que la calidad del ratio es bastante buena en estas condiciones. Y, en cuanto a los dos colores de puntos restantes, hay un mayor porcentaje de puntos naranjas frente a los azules. En cuanto a la temperatura aparente se puede observar que, a medida que aumenta, especialmente por encima de 100°C, la dispersión en la velocidad del viento se mantiene constante, pero aparecen más puntos clasificados como "medium" y "bad", lo que podría estar indicando que a temperaturas elevadas el modelo tiende a tener mayor incertidumbre, sobre todo en condiciones de viento más variable. Analizando las dos variables principales (la de los ejes), no se aprecia una relación clara o lineal entre estas. Esto tiene sentido desde el punto de vista físico ya que la temperatura aparente y la velocidad del viento no están directamente acopladas. En resumen, este gráfico sugiere que las mejores predicciones del ratio se obtienen en condiciones de viento bajo y temperaturas aparentes moderadas. Por otra parte, en las situaciones donde la temperatura aparente alcanza valores extremos, la precisión disminuye ligeramente, como lo evidencian los puntos de color naranja y azul.
4.1 Análisis exploratorio de los datos 41 Figura 4.6 Distribución de la temperatura aparente junto a la temperatura del fluido caloportador HTF, comparándolas a su vez con la velocidad del viento y el ratio. Esta Figura 4.6 muestra la relación entre la temperatura aparente (eje horizontal) y la temperatura del fluido caloportador HTF en grados Celsius (eje vertical). En el gráfico se puede observar una fuerte correlación positiva entre la temperatura aparente y la del HTF lo cual es coherente desde un punto de vista físico. A mayor radiación y concentración solar, la temperatura del fluido caloportador aumenta. Y, en cuanto a la temperatura aparente, se puede observar una distribución para valores entre unos 25 ºC y 155 ºC La mayoría de los puntos están concentrados entre los valores más altos del HTF, es decir, entre 310°C y 390°C. En esta zona, la gran mayoría de los puntos se clasifican como "good", pero en especial, en la zona comprendida entre 38ºC y 100ºC de temperatura aparente. A partir de ese rango, se pueden encontrar puntos como "good" cuando se está cerca de los 100ºC, pero a mayor temperatura, peores resultados se tienen. Sin embargo, a medida que descienden los valores de HTF (por debajo de 280°C), se encuentra una zona bastante amplia en la que no hay presencia de datos. Cierto es que alrededor del rango comprendido entre 60 ºC y 140 ºC hay algunas muestras, pero mínimas en comparación con el rango de temperaturas elevadas del HTF. Estos agrupamientos anómalos en valores muy bajos de HTF (por debajo de 150°C) podrían corresponder a eventos atípicos como fases de arranque, limpieza o parada de la planta. En estas regiones, la dispersión es mayor y se puede observar que ocurre únicamente para velocidades del viento altas (cuarto cuartil). Continuando con la codificación por forma del viento (Q1, Q2-Q3, Q4), salvo el rango de temperaturas del HTF de entre 60ºC y 140ºC, no parece introducir una clara separación en el comportamiento del ratio. En conjunto, este gráfico valida la idea de que la temperatura del HTF es una variable altamente correlacionada con la temperatura aparente y, por tanto, es muy importante para explicar la variabilidad del ratio en este enfoque de modelado.
42 Capítulo 4. Análisis y resultados Figura 4.7 Distribución de la temperatura aparente junto al DNI, comparándolas a su vez con la velocidad del viento y el ratio. Esta Figura 4.7 muestra la relación entre la temperatura aparente (eje horizontal) y la DNI (eje vertical). Analizándolo se puede observar que existe ciertos comportamientos curiosos entre la temperatura aparente y la DNI. La zona de alta irradiancia (DNI > 850W/m2) es donde se presentan la mayoría de muestras, e incluso una mayoría de predicciones "good", lo que sugiere que el modelo ofrece mejor precisión bajo condiciones óptimas de captación solar. Conforme disminuye la radiación, se observa como hay varias zonas en las que no existen datos (entre 840 y 870W/m2, y entre 740 y 780W/m2). Y, en cuanto a la calidad del ratio en función de esta variable, no se puede sacar nada en claro ya que hay una distribución heterogénea de estos puntos. Respecto al efecto del viento, se puede ver un comportamiento totalmente homogéneo respecto a la DNI. Para condiciones de DNI bajo (menores a 750W/m2), todos los datos sin excepción, se encuentran en el cuarto cuartil, es decir, están bajo la presencia de grandes vientos. En la zona intermedia de la DNI ( 780 y 840W/m2) solo se encuentran valores bajos del viento (Q1). Y, para valores altos de la DNI, hay una clara dominancia de vientos medios pertenecientes al segundo y tercer cuartil. Habría una dominancia total si no se considerase los 870W/m2ya que en esa zona la forma de los datos son cuadrados (Q1). Este gráfico, por tanto, revela que la calidad del ratio de predicción depende tanto de la irradiación como del régimen de viento. Esto es especialmente relevante, ya que las perturbaciones externas (como el viento) pueden alterar el equilibrio térmico del tubo receptor, afectando la exactitud del modelo basado en temperatura aparente. Segunda Metodología, Correlaciones entre variables Para continuar con el análisis visual, en esta sección se examinan las gráficas correspondientes a la segunda metodología, en la cual el modelo de regresión predice directamente la temperatura medida. Al igual que en el caso anterior, se representa en todos los gráficos la temperatura aparente en el eje horizontal y se compara con las variables más importantes del conjunto de datos, estas situadas en el eje vertical. Además de la incorporación de los dos niveles adicionales mencionados anteriormente. A continuación, se presentan y analizan las gráficas correspondientes, destacando los patrones observados.
4.1 Análisis exploratorio de los datos 43 Figura 4.8 Distribución de la temperatura aparente junto a la temperatura ambiente, comparándolas a su vez con la velocidad del viento y el error entre la temperatura medida y la aparente. Esta Figura 4.8 muestra la relación entre la temperatura aparente (eje X) y la temperatura ambiente (eje Y). En ella se puede observar que la gran mayoría de los puntos están clasificados como good (azul), lo que indica que en la mayor parte del conjunto de datos, la temperatura aparente se aproxima razonablemente bien a la medida real, es decir, en un rango positivo de 20 grados. Los puntos medium (verde) y especialmente los bad (naranja) se presentan de forma minoritaria y dispersa, sin una concentración clara en zonas específicas del gráfico. Esto sugiere que no hay una relación directa entre grandes errores y ciertos rangos de temperatura aparente o ambiente. Aunque, observando cuidadosamente la gráfica, se puede observar que, para valores muy pequeños o muy grandes, está la presencia de los valores etiquetados como "medium". En cuanto a los cuartiles de viento se puede observar cierto comportamiento curioso comparándose con la temperatura ambiente. Se dan las situación de que si existe un valor de temperatura ambiente, el cuartil de viento será fijo sin cambiar. Por ejemplo, si se observan los 32 ºC de temperatura ambiente, se puede apreciar que únicamente hay velocidades del viento altas (Q4). Si se compara con el color de la variable objetivo, los errores bad aparecen tanto en condiciones de viento bajo como alto, lo que implica que, al menos en esta visualización, la velocidad del viento no parece influir directamente en la magnitud del error. La temperatura ambiente muestra un rango estrecho (28°C a 39°C), lo que puede limitar su relevancia como variable predictora individual. No obstante, podría jugar un papel más relevante cuando se analiza en conjunto con otras variables. Este gráfico sugiere que, en una gran parte del conjunto de datos, la temperatura aparente se aproxima bien a la medida real si se multiplicase por el ratio del rango elegido como "good". Los errores más significativos no están concentrados en una región específica del espacio de características, lo que indica que no hay una dependencia fuerte de la temperatura ambiente sobre el error.
50 Capítulo 4. Análisis y resultados Por otro lado, el segundo modelo con mejores resultados es el HistGradientBoosting, presentando un MSE=0.0036), por lo que su rendimiento es inferior al de Random Forest. Modelos como TweedieRegressor o SGDRegressor ofrecen resultados considerablemente peores, con errores máximos cercanos a 0.75 y errores medios tres o cuatro veces mayores. Evaluación en la metodología basada en la predicción directa A continuación se procede al análisis de la segunda metodología, donde se evalúan los mismos cuatro modelos de regresión que en la primera: TweedieRegressor, RandomForest, HistGradientBoosting y SGDRegressor. Tabla 4.2 Comparación de modelos en la predicción directa de la temperatura medida. Modelo MSE MAE Error absoluto máximo TweedieRegressor 33.294 3.878 57.528 RandomForest 3.657 1.173 20.800 HistGradientBoosting 19.626 2.799 53.579 SGDRegressor 151.202 10.828 69.039 Tal y como refleja la Tabla 4.2, el modelo Random Forest vuelve a destacar por su rendimiento notablemente superior al resto, con un MSE de 3.657, un MAE de 1.173 y un error absoluto máximo de tan solo 20.8°C. Viendo esto se puede confirmar que no haría falta ajustar un ratio para conseguir que el modelo sea capaz de predecir, de manera precisa, bastantes casos. Al igual que antes, se presentan cinco ejemplos correspondientes a muestras aleatorias del conjunto de entrenamiento para comprobar visualmente la capacidad de predicción del modelo: •Predicciones: [64.48, 109.31, 76.25, 72.88, 64.26] •Valores reales: [66.00, 109.00, 77.00, 73.00, 64.00] •Errores absolutos: [1.52, 0.31, 0.75, 0.12, 0.26] Se puede comprobar que se obtienen muy buenos resultados, todos inferiores a 2°C. Por tanto, se puede afirmar que el modelo presenta una capacidad de ajustar con mucha precisión el valor objetivo incluso en observaciones puntuales. El análisis global del error absoluto muestra que el 97.3% de las muestras presentan un error inferior a 10°C, y más del 99.5% tienen errores menores de 20°C. Solo un número muy reducido de observaciones (solo dos) presentan errores superiores a ese umbral. La distribución completa se resume a continuación: •Errores menores de 5°C: 19.604 muestras •Menores de 10°C: 20.049 muestras •Menores de 20°C: 20.137 muestras •Menores de 40°C: 20.139 muestras •Total de muestras: 20.139 Parecen todo buenas noticias pero, el error absoluto máximo registrado es de aproximadamente 20.8°C, lo que indica que existen ciertos casos donde el modelo no consigue ajustarse del todo. Estos casos pueden estar debidos al etiquetado de los tubos receptores, ya que, se consiguieron quitar errores entre la temperatura medida y aparente de 40 ºC, pero para un error cercano a este valor, puede estar dando fallo. Además, también puede ser motivo cuando se encuentran regiones del espacio de variables donde la relación entre las entradas y la salida es altamente no lineal. En comparación, el modelo TweedieRegressor obtuvo un MSE de 33.29 y un error máximo superior a 57°C, mientras que el SGDRegressor se comportó claramente peor (MSE = 151.20 y error máximo > 69°C). Por tanto, queda confirmado que la mejor elección es la elección del modelo Random Forest en esta segunda metodología.
4.2 Evaluación de modelos de regresión 51 4.2.2 Impacto del escalado A continuación se pasa al proceso de escalado de variables, el cual es un proceso muy importante, aunque gana o pierde relevancia en función del método de regresión utilizado. En este apartado se analiza el efecto que tiene aplicar diferentes técnicas de escalado sobre el rendimiento de los modelos de regresión de ambas metodologías. ¿Cómo se realizará esto? Pues en este apartado se han comparado seis métodos de transformación, los cuales se explicaron en apartado anteriores, y los cuales son el StandardScaler, MinMaxScaler, RobustScaler, Normalizer, QuantileTransformer y PowerTransformer. Para compararlos se utiliza, principalmente, métricas como el error cuadrático medio (MSE), error absoluto medio (MAE) y error absoluto máximo. A continuación, se presentan los resultados y se procederá a su análisis. Primera metodología Para analizar el efecto del escalado en la primera metodología, se ha evaluado el rendimiento del modelo final (Random Forest Regressor) utilizando seis técnicas de escalado distintas. En la Tabla 4.3 se presentan los resultados obtenidos al aplicar cada escalador sobre las variables independientes. Si se observan los valores obtenidos se da uno cuenta de que son resultados prácticamente idénticos. El StandardScaler, MinMaxScaler y RobustScaler presenta unos valores de MSE y MAE muy similares (MSE ≈ 0.000642, MAE ≈ 0.01606). También se aprecia un error absoluto máximo en torno a 0.288–0.289. Los métodos con los que se han obtenido peores resultados, aunque prácticamente indiferentes en comparación con las otras técnicas de escalado, son el Normalizer y el QuantileTransformer. Estos aumentan el error máximo levemente hasta 0.293. Como se ha comentado al principio del subapartado, el escalado tendrá más o menos importancia según el método de regresión seleccionado y, al tratarse de un modelo basado en árboles, el Random Forest es muy robusto a escalados. Como su estructura no depende de la magnitud relativa de las variables, se consigue evitar preprocesamientos innecesarios. Tabla 4.3 Impacto del tipo de escalado en el rendimiento del modelo Random Forest para la predicción del ratio. Scaler MSE MAE Error absoluto máximo StandardScaler 0.000642 0.016058 0.288 PowerTransformer 0.000642 0.016059 0.288 RobustScaler 0.000642 0.016055 0.289 MinMaxScaler 0.000642 0.016055 0.289 Normalizer 0.000631 0.015991 0.293 QuantileTransformer 0.000643 0.016060 0.294 En conclusión, el uso de técnicas de escalado no aporta una mejora significativa en esta metodología, y puede ser prescindible si se utiliza un modelo de tipo Random Forest. No obstante, esta evaluación es esencial para validar que la elección del algoritmo minimiza la necesidad de un preprocesamiento complejo. Segunda metodología En el caso de la segunda metodología, donde se predice directamente la temperatura medida, se ha evaluado también cómo influye el tipo de escalado de los datos sobre el rendimiento del modelo Random Forest. Antes de nada, ya hay que tener en mente que el escalado en este tipo de modelos no resulta útil, pero este análisis de escalados estaba preparado por si la regresión con mejores resultados resultaba otra que si dependiera del escalado, por lo que, para el Random Forest, se realizará el análisis para verificar que el escalado no influye en este método. Como se observa en los resultados de la Tabla 4.4, todos los métodos de escalado ofrecen métricas muy similares, tanto en MSE como en MAE. Sin embargo, el StandardScaler, junto con el RobustScaler y el MinMaxScaler, proporciona el menor error absoluto máximo (22.11°C). Es cierto que el Normalizer presenta un buen MAE pero su error absoluto máximo es el más alto de todos (22.51°C), y esto afectaría sobre todo su uso en situaciones críticas.
52 Capítulo 4. Análisis y resultados Tabla 4.4 Impacto del tipo de escalado en el rendimiento del modelo Random Forest para la predicción directa de la temperatura medida. Scaler MSE MAE Error absoluto máximo StandardScaler 3.636 1.168 22.11 MinMaxScaler 3.641 1.169 22.11 RobustScaler 3.637 1.168 22.11 PowerTransformer 3.638 1.169 22.11 QuantileTransformer 3.639 1.169 22.21 Normalizer 3.650 1.169 22.51 En conclusión, se confirma lo que se intuía y ocurre lo mismo que en la primera metodología, es decir, el impacto del escalado es prácticamente nulo. Todos los escaladores evaluados ofrecen resultados muy similares en términos de MSE, MAE y error absoluto máximo, lo que confirma la robustez del modelo Random Forest frente a transformaciones en la escala de las variables. Se afirma entonces que no es útil el realizar un escalado ni en el caso que se predice directamente la temperatura medida, ni cuando se predice el ratio. 4.3 Evaluación sobre datos de prueba (test externo) 4.3.1 Primera metodología Primero se va a evaluar la capacidad para generalizar que presenta el modelo basado en la predicción del ratio entre la temperatura medida y la aparente. Para ello se ha utilizado un conjunto de datos externo el cual no ha sido utilizado durante el entrenamiento. Los resultados numéricos globales obtenidos son los siguientes: •MAE: 0.6869 •MSE: 0.5361 •Error absoluto máximo: 6.8136 •Error absoluto medio: 0.6869 •Error absoluto mínimo: 0.0224 Analizando estos resultados se comprueba un comportamiento razonablemente preciso. Sin embargo, hay una mayor dispersión si se compara con la evaluación sobre el conjunto de entrenamiento. La mayor diferencia respecto al conjunto de entrenamiento sugiere la presencia de casos más complejos o representaciones diferentes en los nuevos datos. E incluso puede darse el caso de que se haya etiquetado mal algún HCE por parte de la IA. Todo esto se soluciona con más entrenamiento y más imágenes correctamente etiquetadas. Posteriormente, se utilizó el ratio predicho para multiplicarlo por la temperatura aparente y así calcular la temperatura medida estimada. De esta manera se puede apreciar cual es el error en temperatura que se obtiene, y resulta más fácil para después compararlo con la segunda metodología. A continuación, se presentan los errores expresados en grados Celsius: •Error < 10°C: 97.69% de las muestras •Error < 5°C: 83.94% •Error < 2°C: 35.58% Analizando estos porcentajes, se puede sacar en claro que se obtienen muy buenos resultados en la mayoría de los casos. Aunque el error absoluto máximo ha aumentado respecto al conjunto de entrenamiento, la gran mayoría de predicciones siguen cayendo en un rango aceptable. Se tiene un 80% de los datos con un error por debajo de 5°C, lo cual se asume que es un error aceptable. A continuación, se presentan algunos ejemplos de predicciones obtenidas, incluyendo tantos muy buenas predicciones, como relativamente malas:
4.3 Evaluación sobre datos de prueba (test externo) 53 Tabla 4.5 Ejemplos de predicción de temperatura medida a partir del ratio estimado. Predicción (°C) Temperatura medida (°C) 54.54 50.00 56.25 55.00 53.79 51.00 54.87 54.00 54.79 52.00 54.10 51.00 65.74 56.00 59.65 53.00 54.71 52.00 55.05 55.00 64.53 57.00 56.01 53.00 53.83 53.00 Como se observa en la Tabla 4.5, las predicciones tienen buena concordancia con los valores medidos. En conjunto, esta metodología ofrece resultados robustos y fiables, con un margen de error práctico adecuado para aplicaciones reales en sistemas termosolares. 4.3.2 Segunda metodología En esta segunda metodología, se evalúa el modelo de regresión de Random Forest el cual predice directamente la temperatura medida a partir de las variables independientes del sistema. Para ello, se utilizó un conjunto de prueba, totalmente distinto al de entrenamiento, pero el mismo que se utilizó en la primera metodología para que la comparación de los resultados sea lógica y se pueda decidir cuál es mejor en función del mismo criterio. Los resultados son los siguientes: •MAE: 4.0670 •MSE: 26.4231 •Error absoluto máximo: 89.3000 •Error absoluto medio: 4.07 •Error absoluto mínimo: 0.00 Como se aprecia, aunque el modelo logra una media de error aceptable, el error absoluto máximo alcanza los 89.3°C, lo que sugiere la existencia de casos puntuales con desviaciones muy elevadas. Como se ha comentado en el primer método, esto se soluciona con más entrenamiento y más imágenes correctamente etiquetadas. Para evaluar la precisión práctica del modelo, se calculó el porcentaje de muestras cuya predicción cae dentro de ciertos umbrales de error: •Error < 10°C: 95.28% de las muestras •Error < 5°C: 72.85% •Error < 2°C: 23.35% Analizando estos resultados se tiene la buena noticia de que más del 95% de las predicciones tienen errores menores a 10°C. Sin embargo, se observa que menos del 25% de las predicciones presentan un error menor al <2°C, y menos del 73% menores a 5ºC. Algunos ejemplos de predicciones reales se presentan en la siguiente tabla:
54 Capítulo 4. Análisis y resultados Tabla 4.6 Ejemplos de predicción directa de temperatura medida mediante Random Forest. Predicción (°C) Temperatura medida (°C) 53.11 50.00 56.13 55.00 52.99 51.00 55.05 54.00 55.04 52.00 53.43 51.00 68.36 56.00 58.55 53.00 53.84 52.00 55.21 55.00 66.77 57.00 56.05 53.00 54.17 53.00 La tabla muestra que, en general, las predicciones son razonables y cercanas al valor real. Sin embargo, se evidencian errores algo más altos que en el enfoque basado en el ratio, especialmente en las muestras con temperaturas más elevadas. 4.3.3 Comparación final entre metodologías Una vez que han sido evaluadas las dos metodologías sobre un conjunto de prueba no utilizado en el entrenamiento, se procede a comparar sus rendimientos de manera que se llegue a una conclusión de cuál de ellas es más adecuada para predecir la temperatura medida. Analizando todos los resultados, se puede observar que hay una leve ventaja a favor de la primera metodología, en la cual se predice el ratio entre la temperatura medida y la aparente, para después multiplicarlo por la aparente. Se observa que el porcentaje de muestras con errores bajos es más alto en el enfoque basado en el ratio: •Error < 5°C: 83.94% (metodología 1) vs. 72.85% (metodología 2) •Error < 2°C: 35.58% (metodología 1) vs. 23.35% (metodología 2) Ambas metodologías alcanzan más del 95% de predicciones por debajo de 10°C de error, lo que son resultados excelentes. Sin embargo, la primera predice con menor dispersión y una mayor concentración en el rango de alta precisión. Además, tal y como se comentó, se consideran como valores aceptables los que presenten una desviación respecto a la temperatura medida de +-5ºC y, en la primera metodología, se obtiene cerca del 85% de resultados satifactorios. Por tanto, se dan como muy buen resultado estos valores ya que hay que considerar que pueden haber errores en el conjunto de datos debido a múltiples casos (como puede ser la propia IA encargada del etiquetado). En resumen, la metodología basada en el ratio no solo presenta mejores métricas, sino también una distribución del error más favorable. Por tanto, se concluye que esta primera aproximación es la más adecuada para este problema, tanto desde el punto de vista estadístico como práctico. Como resumen, se presenta la siguiente Tabla 4.7, en la cual se puede apreciar los resultados recogidos: Tabla 4.7 Comparativa de métricas sobre datos de prueba entre las dos metodologías. Método MAE MSE Error máx. % Error < 5°C Predicción por ratio 0.6869 0.5361 6.81 83.94% Predicción directa 4.0670 26.4231 89.30 72.85%
5 Conclusiones E ste apartado significa que se está alcanzando el final del estudio sobre la detección automática y caracterización de receptores de plantas termosolares con colectores cilindro-parabólicos a través de análisis de imágenes termográficas y RGB tomadas desde drones autónomos. Durante todo el trabajo se han explicado teóricamente las plantas termosolares, se han realizado códigos en Python para completar datos faltantes y se han evaluado diferentes técnicas en el aprendizaje automático. Una conclusión de todo esto se presentará en este capítulo, además de analizar los puntos críticos del trabajo y posibles mejoras futuras. 5.1 Conclusiones 5.1.1 Resumen del enfoque y elección metodológica Uno de los principales retos abordados fue que el conjunto de datos inicial no presentaba datos muy importantes como puede ser la temperatura aparente. Por este motivo hubo que diseñar distintos métodos de resolución como es la construcción de un algoritmo basado en técnicas de visión por computador y procesamiento térmico. En primer lugar, se etiquetaron manualmente más de 200 imágenes térmicas mediante herramientas como LabelMe, de manera que quedasen etiquetados tanto los espejos como los tubos. Una vez realizado esto se utilizó FLIR Thermal Studio para extraer las temperaturas aparentes de los HCEs, teniendo que probar con varios valores de distintas variables desconocidas como podía ser la emisividad. Con esto ya se tenían las temperaturas aparentes pero, para garantizar la fiabilidad y ahorrar futuros trabajos, se desarrolló un script en Python para calcular esas temperaturas aparentes automáticamente. Por último, se probó una herramienta facilitada por la empresa VirtualMechanics SL, con la cual, a partir de imágenes ya etiquetadas, se conseguían etiquetar nuevas imágenes y obtener automáticamente las temperaturas aparentes de los tubos. Una vez completado el conjunto de datos, se propusieron y evaluaron dos metodologías de predicción. La primera consistió en predecir un ratio, el cual se calculaba como la división de la temperatura aparente entre la medida, a través de distintas variables como son la temperatura aparente, la radiación solar (DNI), la velocidad del viento o la temperatura ambiente. Este ratio se multiplicaría posteriormente por la temperatura medida para así calcular la temperatura medida del HCE. Este enfoque se utilizó porque se estarían prediciendo valores mucho más parejos, ya que todos deberían estar en un rango, como mínimo y máximo, de entre 1.0 y 2.0. En la segunda metodología se utiliza un enfoque mucho más directo y es que se predice directamente la temperatura medida del tubo a partir de las mismas variables que se utilizaron en la primera metodología. Esta aproximación se basa en la idea de que las variables medidas in situ o calculadas a partir de imágenes termográficas contienen suficiente información para predecir la temperatura del tubo. Ambas metodologías fueron implementadas utilizando distintos modelos de regresión. Entre ellos se incluyen algoritmos lineales (como Tweedie Regressor o SGD Regressor), modelos basados en árboles (Random Forest, HistGradientBoosting), redes neuronales (MLP Regressor) y técnicas de ensamblaje (Bagging, Stacking). Además, se llevo a cabo un exhaustivo análisis en el preprocesamiento de los datos, incluyendo técnicas de normalización y escalado (StandardScaler, MinMaxScaler, RobustScaler, entre otros). De esta 55
56 Capítulo 5. Conclusiones manera, se analizó también como era el efecto de estas técnicas de escalado en todos los regresores pero, en especial, en el regresor seleccionado para las dos metodologías. Para evaluar cada enfoque se tuvo que realizar validación cruzada y se testeó sobre datos externos. Para esto se utilizando varias métricas como el error cuadrático medio (MSE), el error absoluto medio (MAE) y el error absoluto máximo. De esta manera se consiguió comprobar cuál era el modelo con mejor precisión y también que tuviese buena generalización. Si se analiza todo como un conjunto, se comprueba que toda la metodología implementada en este trabajo ha permitido superar con éxito el problema de predicciones planteado y aportar un análisis en el que se comparan las distintas metodologías planteadas, concluyendo con que la mejor técnica es la primera metodología. 5.1.2 Limitaciones y puntos críticos Conforme se ha ido realizando este trabajo, se han identificado diversas limitaciones que, si bien no impidieron alcanzar los objetivos propuestos, sí condicionaron el proceso metodológico y la calidad de los resultados en determinadas fases. Es importante destacarlas con el fin de contextualizar adecuadamente el alcance del proyecto y señalar posibles áreas de mejora en futuros desarrollos. La primera limitación que se encontró en este trabajo fue la incompletitud del conjunto de datos original ya que faltaba la variable más importante como era la temperatura aparente. Debido a esta ausencia se tuvieron que llevar a cabo varias estrategias para conseguir este dato faltante, como son el etiquetado de imágenes, el uso de FLIR Thermal Studio, la realización de scripts en Python y la utilización de modelos de IA proporcionados por VirtualMechanics SL. Gracias a esto se consiguió completar el dataset pero se introdujo un cierto grado de incertidumbre en la fiabilidad de las temperaturas extraídas, especialmente cuando las herramientas automáticas etiquetaban incorrectamente zonas no correspondientes a tubos receptores. Es decir, se daban las situaciones en las que el algoritmo de IA etiquetaba como tubos zonas correspondientes a espejos, lo que provocaba que la temperatura aparente estuviese mal extraída. Además, el mayor problema y el que más costó detectar estuvo relacionado con la visualización y estructura interna de las imágenes térmicas. En muchos casos, la imagen que se mostraba al abrir el archivo no coincidía con la imagen térmica real contenida en su interior, es decir, la información útil para el análisis no se correspondía visualmente con lo que parecía observarse inicialmente. Esta discrepancia dificultó el proceso de caracterización térmica de los tubos receptores, provocando errores en la localización de regiones de interés, en la extracción de temperaturas y en el etiquetado de zonas válidas. Como consecuencia, fue necesario extraer todas las imágenes térmicas reales para que no hubiese problema. Por último, se presenta una dificultad en cuanto al proceso de modelado predictivo. Se observaron dificultades en la selección de las técnicas seleccionadas y en el ajuste de hiperparámetros ya que, aunque se evaluaron múltiples regresores (tanto lineales como no lineales, así como técnicas de ensamblado y redes neuronales), había tal cantidad de posibilidades que el comprobarlas todas se hizo tedioso. 5.1.3 Potencial futuro El desarrollo de este trabajo abre varias líneas de exploración para el futuro. Una de las principales mejores sería la optimización del proceso de anotación de datos. Para esto se utilizaron técnicas manuales, lo que lo hace un problema tedioso, pero también se utilizó una IA que etiquetase automáticamente. Sin embargo, para que esta herramienta de inteligencia artificial funcione mejor, necesita de más imágenes etiquetadas manualmente. Además, la utilización de aprendizaje semi-supervisado permitiría reducir la intervención de la persona en futuros trabajos de etiquetado. Otra mejora podría ser la implementación de procesos de ajuste automático de hiperparámetros. Se podrían utilizar técnicas como la optimización Bayesiana o una Grid Search más exhaustiva, para mejorar así el rendimiento del sistema sin tener que depender de los ajustes manuales.
5.1 Conclusiones 57 Además, el utilizar nuevos conjuntos de datos sería realmente interesante porque se podría entrenar con más exactitud y con más generalización el modelo, generando por consiguiente mejores resultados. Por último, en forma de conclusión, la mejora futura más importante sería el entrenamiento mas exhaustivo de la IA encargada de etiquetar imágenes y obtener las temperaturas aparentes. En el momento que se entrene el modelo con un conjunto nuevo de imágenes etiquetadas, la herramienta de inteligencia artificial se verá enormemente mejorada y se podrá prácticamente asegurar que las temperaturas aparentes extraídas estén completamente bien.
Índice de Figuras 2.1 Esquema general del funcionamiento de una central termosolar en el que se encuentran componentes específicas de este tipo de centrales como son el concentrador y el receptor, y componentes generales de centrales eléctricas 6 2.2 Imagen de una central termosolar de heliostatos con receptor en torre ubicado en Sevilla junto a su funcionamiento 7 2.3 Imagen de una central termosolar con reflectores lineales Fresnel junto a su funcionamiento 7 2.4 Imagen en la que se encuentra una central termosolar con discos parabólicos de Stirling junto a su funcionamiento 8 2.5 Imagen en la que se encuentran colectores cilindro-parabólicos junto a los tubos absorbedores junto a su funcionamiento 9 2.6 Componentes principales de un tubo receptor de una planta termosolar cilindro-parabólica 10 2.7 Este diagrama muestra las principales categorías del aprendizaje automático: supervisado, no supervisado, semisupervisado y por refuerzo, diferenciadas según el grado de etiquetado de los datos. Se incluyen ejemplos representativos de las tareas o técnicas más comunes en cada tipo 12 3.1 Imagen térmica de una inspección realizada por la empresa VirtualMechanics SL, la cual presenta datos asociados internos de diferentes parámetros 24 3.2 Imagen del conjunto de datos proporcionada por VirtualMechanics SL 26 3.3 Imagen interna de la figura 3.2, donde se puede apreciar el claro error que presentan, pudiendo parecer imágenes totalmente distintas 26 3.4 Parámetros a modificar en el software de FLIR Thermal Studio para conseguir los valores de temperatura de los tubos absorbedores 28 4.1 Distribución de las variables independientes seleccionadas (DNI, HTF_degC, ambient_degC, windspeed y apparent temperature) para así conocer de una manera más detallada los datos 35 4.2 Distribución del ratio entre la temperatura medida y la aparente. Se destacan los límites utilizados para clasificar la calidad del dato 37 4.3 Distribución del error entre la temperatura medida y la aparente. Se indican los límites establecidos para considerar una predicción aceptable (+-40°C) 38 4.4 Distribución de la temperatura aparente junto a la temperatura ambiente, comparándolas a su vez con la velocidad del viento y el ratio 39 4.5 Distribución de la temperatura aparente junto a la velocidad del viento, comparándolas a su vez con el ratio 40 4.6 Distribución de la temperatura aparente junto a la temperatura del fluido caloportador HTF, comparándolas a su vez con la velocidad del viento y el ratio 41 4.7 Distribución de la temperatura aparente junto al DNI, comparándolas a su vez con la velocidad del viento y el ratio 42 4.8 Distribución de la temperatura aparente junto a la temperatura ambiente, comparándolas a su vez con la velocidad del viento y el error entre la temperatura medida y la aparente 43 4.9 Distribución de la temperatura aparente junto a la velocidad del viento, comparándolas a su vez con el error entre la temperatura medida y la aparente 44 59