Detección y diagnóstico de fallos mediante técnicas basadas en datos aplicadas a un colector de aguas
Abstract
Departamento de Ingeniería de Sistemas y Automática
Full text
UNIVERSIDAD DE VALLADOLID ESCUELA DE INGENIERIAS INDUSTRIALES Grado en Ingeniería Mecánica Detección y diagnóstico de fallos mediante técnicas basadas en datos aplicadas a un colector de aguas Autor: Elena Gómez, Alberto Tutor: De la Fuente Aparicio, María Jesús Departamento de Ingeniería de Sistemas y Automática Valladolid, Julio 2022.
2
3 ÍNDICE DE CONTENIDOS RESUMEN .................................................................................................................. 11 ABSTRACT .................................................................................................................. 12 CAPÍTULO I: INTRODUCCIÓN Y OBJETIVOS ......................................................... 13 1.1 INTRODUCCIÓN ....................................................................................................... 15 1.2. OBJETIVOS .............................................................................................................. 16 1.3. ORGANIZACIÓN ...................................................................................................... 16 CAPÍTULO II: MARCO TEÓRICO ............................................................................. 19 2.1. CONTROL DE CALIDAD ........................................................................................... 21 2.2. CONTROL ESTADÍSTICO DE PROCESOS .................................................................. 23 2.2.1 VARIABILIDAD EN EL PROCESO DE PRODUCCION ............................................ 23 2.2.2. CAUSAS DE LA VARIABILIDAD ......................................................................... 25 2.2.3. GRAFICOS DE CONTROL .................................................................................. 27 2.3. Análisis de Componentes Principales (PCA)........................................................... 29 2.3.1. Introducción .................................................................................................... 29 2.3.2. Objetivos del PCA ............................................................................................ 29 2.3.3. Desarrollo matemático del método PCA ........................................................ 30 2.3.4. Estadísticas para la monitorización ................................................................. 32 2.4. TÉCNICAS DE APRENDIZAJE AUTOMÁTICO ............................................................ 34 2.4.1. REDES NEURONALES ARTIFICIALES ................................................................. 35 2.4.2. APRENDIZAJE AUTOMÁTICO ........................................................................... 37 2.4.3. AUTOENCODERS ............................................................................................. 38 2.4.4. ÁRBOLES DE DECISIÓN (RANDOM FOREST) .................................................... 41 2.4.5. MATRIZ DE CONFUSIÓN .................................................................................. 44 CAPÍTULO III: COLECTOR DE AGUAS .................................................................... 47 3.1 CASO DE ESTUDIO ................................................................................................... 49 3.2 DESCRIPCIÓN DE LA PLANTA ................................................................................... 49 3.3 VARIABLES Y DATOS DE LA PLANTA ........................................................................ 51 CAPÍTULO IV: APLICACIÓN DESARROLLADA ....................................................... 55 4.1. PROCEDIMIENTO. DATOS DE FALLO. ..................................................................... 57
4 4.2. MODELOS PARA LA DETECCIÓN DE FALLOS .......................................................... 58 4.2.1. ANÁLISIS DE COMPONENTES PRINCIPALES (PCA) ........................................... 58 4.2.2. PCA NO LINEAL ................................................................................................ 67 4.2.3. PCA DEL RESIDUO............................................................................................ 78 4.3. MODELOS PARA LA CLASIFICACIÓN DE FALLOS ..................................................... 86 4.3.1. MODELO DE RED NEURONAL MONOCAPA ..................................................... 86 4.3.2. MODELO DE RED NEURONAL MULTICAPA ..................................................... 94 4.3.3. MODELO DE ARBOLES DE DECISIÓN ............................................................. 101 CAPÍTULO V: CONCLUSIONES Y TRABAJO FUTURO ......................................... 107 5.1. CONCLUSIONES .................................................................................................... 109 5.2. TRABAJO FUTURO ................................................................................................ 110 REFERENCIAS ........................................................................................................... 113
5 ÍNDICE DE FIGURAS Figura 1. Variaciones naturales y asignables..................................................... 24 Figura 2. Tipos de salida del proceso. ................................................................ 25 Figura 3. Distribución de proceso simétrica. ..................................................... 25 Figura 4. Ejemplo de los efectos de las causas asignables sobre la distribución de un proceso. ...................................................................................................... 26 Figura 5. Ejemplo del efecto de las causas asignables sobre la distribución de un proceso. ........................................................................................................... 26 Figura 6. Ejemplo de diagrama de control para detección de anomalías. ...... 27 Figura 7. Factores para calcular acotamientos 3σ para la gráfica R [6]. ........ 28 Figura 8. Representación de las m dimensiones del conjunto de datos. ........ 30 Figura 9. Relación entre la Inteligencia Artificial, Machine Learning y Deep Learning [11]. ....................................................................................................... 35 Figura 10. Ejemplo de neurona artificial con 5 entradas [12].......................... 36 Figura 11. Arquitectura de una Red Neuronal Feedforward con dos capas ocultas [14]. ......................................................................................................... 37 Figura 12. Arquitectura de un Autoencoder [16]. .............................................. 39 Figura 13. Sobreajuste de una red [17]. ............................................................ 39 Figura 14. Combinación de 2 Autoencoders [18]. ............................................. 40 Figura 15. Esquema de la clasificación de las técnicas Data Mining [19]. ..... 41 Figura 16. Esquema del árbol de decisión [20]. ................................................ 43
6 Figura 17. Ejemplo de matriz de confusión con tasa de clasificación=98.4 %.[4] ............................................................................................................................... 45 Figura 18. Esquema de la planta de alcantarillado. .......................................... 50 Figura 19 Diagrama de bloques simplificado de la planta de alcantarillado .. 50 Figura 20. Variables del proceso. ....................................................................... 52 Figura 21. Código del archivo para provocar fallos. .......................................... 53 Figura 22. Tabla de fallos provocados en la planta. ......................................... 57 Figura 23. (a) Arriba. Gráfico de control 𝑇2para el fallo en n5 (offset=2). (b) Abajo. Gráfico de control Q para el fallo en n5 (offset=2). ............................... 60 Figura 24. Resultado paramétrico del fallo en n5 (offset=2). .......................... 61 Figura 25. (a) Arriba. Gráfico de control 𝑇2para el fallo en n4 (offset=2,4). (b) Abajo. Gráfico de control Q para el fallo en n4 (offset=2,4). ............................ 62 Figura 26. Resultado paramétrico del fallo en n4 (offset=2). .......................... 62 Figura 27. Resumen de los 10 fallos provocados en la planta con umbral constante. ............................................................................................................. 63 Figura 28. (a) Arriba. Gráfico de control 𝑇2para comportamiento normal. (b) Abajo. Gráfico de control Q para comportamiento normal. .............................. 64 Figura 29. Esquema de funcionamiento de la ventana deslizante aplicada a un vector. ................................................................................................................... 65 Figura 30. (a) Arriba. Gráfico de control 𝑇2para el fallo en n5 (offset=2,4). (b) Abajo. Gráfico de control Q para el fallo en n5 (offset=2,4). ............................ 66 Figura 31. Resultados de PCA adaptativo con fallo n5 (offset=2,4). ............... 66 Figura 32. Resumen de los 10 fallos provocados en la planta con umbral adaptativo. ............................................................................................................ 67
7 Figura 33. Arquitectura de la red final obtenida. ............................................... 68 Figura 34. a) Arquitectura Autoencoder 1. b) Arquitectura Autoencoder 2. c) Arquitectura Autoencoder 3. d)Arquitectura Red ............................................... 70 Figura 35. Gráficas de entrenamiento de Autoencoders y red. ........................ 71 Figura 36. Tabla de resultados de PCA no lineal con umbral constante. ........ 73 Figura 37. (a) Arriba. Gráfico de control 𝑇2para el fallo en q7 (offset=2000). (b) Abajo. Gráfico de control Q para el fallo en q7 (offset=2000). ........................ 74 Figura 38. (a) Arriba. Gráfico de control 𝑇2para el fallo en n4 (offset=2,4). (b) Abajo. Gráfico de control Q para el fallo en n4 (offset=2,4). ............................ 75 Figura 39. Tabla de resultados de PCA no lineal con umbral adaptativo. ....... 76 Figura 40. (a) Arriba. Gráfico de control 𝑇2para el fallo en q8 (offset=8500). (b) Abajo. Gráfico de control Q para el fallo en q8 (offset=8500). ........................ 77 Figura 41. (a) Arriba. Gráfico de control 𝑇2para el fallo en n4 (offset=2). (b) Abajo. Gráfico de control Q para el fallo en n4 (offset=2). ............................... 78 Figura 42. Representación del entrenamiento de la red. ................................. 79 Figura 43. (a) Arriba. Gráfico de control 𝑇2para el funcionamiento normal con umbral constante. (b) Abajo. Gráfico de control Q funcionamiento normal con umbral constante. ................................................................................................ 80 Figura 44. (a) Arriba. Gráfico de control 𝑇2para funcionamiento normal con umbral adaptativo. (b) Abajo. Gráfico de control Q para funcionamiento normal con umbral adaptativo. ........................................................................................ 81 Figura 45. Resultados PCA con residuo y umbral constante. ........................... 82 Figura 46. (a) Arriba. Gráfico de control 𝑇2para el fallo n4 (offset=2,4) con umbral constante. (b) Abajo. Gráfico de control Q para el fallo n4 (offset=2,4) con umbral constante. ......................................................................................... 83
8 Figura 47. Resultados de PCA con residuo y umbral adaptativo ..................... 84 Figura 48. (a) Arriba. Gráfico de control 𝑇2para el fallo n5 (offset=2) con umbral adaptativo. (b) Abajo. Gráfico de control Q para el fallo n5 (offset=2) con umbral adaptativo. ............................................................................................................ 85 Figura 49. Matriz de Confusión del entrenamiento con 18 neuronas. ............ 87 Figura 50. Matriz de confusión del entrenamiento con 4 neuronas. ............... 88 Figura 51. Matriz de confusión del entrenamiento con 10 neuronas. ............ 88 Figura 52. Entrenamiento de la red. ................................................................... 89 Figura 53. Validación del fallo en q8. ................................................................. 90 Figura 54. Resumen de resultados para la clasificación de 1 fallo por parte del modelo monocapa. .............................................................................................. 90 Figura 55. Validación del fallo en la pareja de fallos q8 y n5. .......................... 91 Figura 56. Validación del fallo en la pareja de fallos q8 y q7 con el modelo monocapa. ............................................................................................................ 91 Figura 57. Validación del fallo en la pareja de fallos n4 y n5 con el modelo monocapa. ............................................................................................................ 92 Figura 58. Resumen de resultados para parejas de datos con modelo monocapa. ............................................................................................................ 93 Figura 59. Matriz de confusión para la clasificación de 5 fallos simultáneamente con el modelo monocapa. ..................................................... 94 Figura 60. Resultado del entrenamiento de los Autoencoders por separado. 96 Figura 61. Matriz de confusión de la efectividad del entrenamiento de la red completa. .............................................................................................................. 97 Figura 62. Validación del fallo en q7. ................................................................. 98
9 Figura 63. Resumen de resultados para la clasificación de 1 fallo por parte del modelo multicapa. ............................................................................................... 98 Figura 64. Validación del fallo en la pareja de fallos q8 y qwwtp con el modelo multicapa. ............................................................................................................. 99 Figura 65. Validación del fallo en la pareja de fallos n5 y q7 con el modelo multicapa. ............................................................................................................. 99 Figura 66. Resumen de resultados para parejas de datos con modelo multicapa. .......................................................................................................... 100 Figura 67. Matriz de confusión para la clasificación de 5 fallos simultáneos con el modelo multicapa. ........................................................................................ 101 Figura 68. Estructura de un árbol ensamblado en el bosque. ...................... 102 Figura 69. Matriz de confusión del entrenamiento del bosque con 200 árboles. ............................................................................................................................ 103 Figura 70. Matriz de confusión para bosque de 200 árboles. ...................... 104 Figura 71. Matriz de confusión para bosque de 600 árboles. ...................... 104 Figura 72. Matriz de confusión para bosque de 1200 árboles. .................... 105
16 identificarlas y poder encontrar el origen y la solución a un problema o fallo determinado. En el presente trabajo se han desarrollado diversos métodos para la clasificación de fallos, basados en redes neuronales y árboles de decisión, y así poder sacar conclusiones sobre la idoneidad o la eficacia de cada método en función de la situación. 1.2. OBJETIVOS Este trabajo tiene como objetivo el desarrollo de técnicas de detección y diagnóstico de fallos basadas en datos, y el análisis, estudio y comparación de los resultados obtenidos para cada tipo de técnica. Para desarrollar las técnicas relacionadas con la detección se han utilizado herramientas del Control Estadístico de Procesos, como el Análisis de Componentes Principales y técnicas basadas en inteligencia computacional como los Autoencoders. Y para el desarrollo de técnicas enfocadas a la clasificación de fallos, se ha recurrido a la inteligencia artificial mediante redes neuronales, Autoencoders y árboles de decisión. Todos los métodos han sido desarrollados y validados en el colector de aguas descrito en el Capítulo III. 1.3. ORGANIZACIÓN La organización de la memoria del trabajo estará ordenada de la siguiente manera: En el Capítulo I se explica de forma breve y contextualizada los métodos utilizados para la realización del trabajo, además de enumerar los objetivos que motivan el desarrollo del proyecto y un esquema de la distribución de la memoria.
17 En el Capítulo II se proyecta todo el contenido teórico alrededor del cual giran todos los procedimientos llevados a cabo en el proyecto. Términos como el control de calidad, el Análisis de Componentes Principales, las Redes Neuronales o los Árboles de Decisión son desarrollados en profundidad. En el Capítulo III se introduce la planta de la que se han extraído todos los datos necesarios para los cálculos llevados a cabo. Se trata de un colector de aguas con 24 variables monitorizadas, de las cuales se extraerá la información necesaria a través de los métodos desarrollados. En el Capítulo IV se incluyen toda la metodología, los cálculos y los resultados para cada método desarrollado. Los resultados son representados con gráficas, tablas y matrices de confusión. El Capítulo V aparecen las conclusiones a las que se ha llegado tras la realización del trabajo, además de la explicación y la interpretación de todos los resultados obtenidos. Además, se sugieren ideas para futuros trabajos y posibles conceptos que aporten mejores resultados. Al final del trabajo se incluyen todas aquellas referencias bibliográficas de las que se ha hecho uso para el desarrollo del presente trabajo.
18
19 CAPÍTULO II: MARCO TEÓRICO
20
21 2.1. CONTROL DE CALIDAD La gestión de la producción engloba todas aquellas técnicas y métodos que tienen el fin de convertir las materias primas en productos elaborados en un proceso industrial. Esta gestión debe encontrarse en continua optimización para que el producto final cumpla los estándares de calidad, cantidad, tiempo y coste mínimo [1]. A raíz de esta idea surge el término PDCA (Plan, Do, Check, Action) hace más de 80 años, y que consiste en un método ciclo que garantiza la atención continua sobre el control de calidad. Se evalúa el proceso, se aplican las acciones correctivas pertinentes, y se vuelve a evaluar. En la actualidad, una empresa que quiera seguir siendo competitiva deberá hacer un gran esfuerzo de adaptación, especialmente en el aspecto tecnológico y de gestión, y será la rapidez con la que se consiga esta adaptación la que determinará la competitividad de la empresa. La globalización es el principal responsable de las modificaciones que están dándose en la cultura empresarial [2]. La referencia a la hora de diseñar un modelo de gestión por parte de una empresa siempre será la normativa que haya que cumplir. Las normas ISO suelen ser las normas a cumplir en la actividad industrial, aunque existen algunos mercados como el asiático que pueden seguir otras pautas. En relación a las normas ISO, la norma que regula la gestión industrial y el control de calidad es la ISO 9001, la cual especifica los requisitos para un sistema de gestión de calidad, concretamente cuando una empresa necesita demostrar su capacidad para proporcionar los productos o servicios exigidos por el cliente, o cuando la empresa desea aumentar la satisfacción del cliente incluyendo procesos de mejora del sistema y asegurando la conformidad a los requisitos legales y del cliente [3]. La consecuencia de una buena implantación de un sistema de gestión es la ventaja competitiva de la empresa respecto de las demás dentro del mismo ámbito, que se traduce en reducción de tiempos y costes, mejora de la imagen de la empresa, satisfacción de los clientes y posibilidad de conseguir nuevos, y en general, un mayor nivel de productividad [4].
22 La monitorización es una etapa del proceso de gestión de calidad que proporciona la información necesaria para conocer el funcionamiento del proceso y poder controlarlo. Esta información se emplea en la detección de fallos o anomalías, lo que posibilita corregirlas de manera rápida con las herramientas y medidas correctivas correspondientes, haciendo que el proceso vuelva a su funcionamiento normal. Para que toda la información del funcionamiento del proceso pueda ser extraída y procesada, son necesarias una serie de herramientas como los sensores, los actuadores y los controladores lógicos programables (PLC). Todos estos elementos se encuentran interconectados, permitiendo que la información fluya de forma continua. Esta monitorización es compleja, y solo ha sido posible gracias a los numerosos y recientes avances en los Sistemas de Control Distribuido (Distributed Control System, DCS), y a la hiperconectividad entre máquinas de la Industria 4.0. Como se ha dicho anteriormente, uno de los objetivos principales de la monitorización del proceso es la detección y diagnóstico de fallos (FDD). Un fallo puede ser una condición anormal que provoca un mal funcionamiento del proceso no deseado, aunque también puede ser un defecto en un componente del equipo que evita que se cumplan las especificaciones o que se ponga en peligro los productos o las personas. La detección del fallo va seguida de la clasificación o diagnóstico del mismo, que consiste en identificar el tipo de fallo, la gravedad que provoca o dónde se encuentra la anomalía [4]. La última etapa sería la recuperación tras el fallo, en la que se soluciona el problema y el proceso vuelve a su funcionamiento normal. Si la calidad se cuantifica como la probabilidad de que el producto final se encuentre dentro de los límites de calidad establecidos por los requisitos correspondientes, una variabilidad alta afecta negativamente a la calidad. Por lo que, definiendo un punto de funcionamiento en un proceso, los fallos o anomalías serán identificados como índices de variabilidad elevados respecto a dicho punto.
23 2.2. CONTROL ESTADÍSTICO DE PROCESOS El Control Estadístico de Procesos (CEP) o Statistical Process Control (SPC) está constituido por un conjunto de técnicas que tienen la función de examinar la calidad de un proceso productivo. Los objetivos de un CEP guardan relación con lo explicado anteriormente, y entre los cuales destacan los siguientes: minimizar la producción defectuosa, mantener una actitud de mejora continua del proceso, y mantener la producción dentro de los límites marcados por las especificaciones. Para que estos objetivos se puedan alcanzar, se debe tener en cuenta que los procesos, además de generar un producto, generan información. Y es esta información la que, recogida gracias a la monitorización, permite ‘’escuchar’’ el proceso. Además, las técnicas de CEP deben ser aplicadas lo más próximas posible al proceso generador de la información, de tal manera que el tiempo de reacción ante el proceso sea lo más pequeño posible [5]. 2.2.1 VARIABILIDAD EN EL PROCESO DE PRODUCCION La variabilidad es una característica inherente del proceso, pues nada puede hacerse para suprimir las variaciones en una planta, pero lo que si se puede y se debe hacer es investigar las causas que producen la variabilidad con el objetivo de minimizarla. Para determinar la variación de un proceso, se toma una serie de muestras pequeñas y se las coloca en una escala proporcional, en el eje horizontal (Véase la Figura 1.a) ). En el eje vertical se indica la frecuencia o el número de veces que ocurrieron. Eventualmente, se consiguen distribuciones como las de la Figura 1.b), tras un número determinado de muestras. Estas distribuciones irán cambiando en función de lo que revelen las muestras (Figura 1.c) ). Si la distribución resultante es similar a la de la Figura 1.d), significará que solo se han encontrado causas de variaciones naturales, que se explicarán más adelante. Para encontrarse con causas de variaciones asignables, que son
24 aquellas que no se esperan como parte del proceso, las distribuciones creadas por las muestras serán inesperadas (mostradas en la Figura 1.e) ) [6]. Figura 1. Variaciones naturales y asignables. La gestión del proceso debe conseguir que las variaciones asignables sean eliminadas, de tal manera que el proceso se encuentre bajo control. Que el proceso se encuentre o no bajo control lo determina la salida. En la figura 2 se representan 3 posibles situaciones de la salida ( a), b), c) ). En la salida a), el proceso se encuentra fuera de control. Sin embargo, en b), el proceso está controlado pero descentrado respecto de los límites de especificación de producto. El caso c) representa un proceso controlado correctamente y dentro de las especificaciones.
25 Figura 2. Tipos de salida del proceso. 2.2.2. CAUSAS DE LA VARIABILIDAD Como se ha comentado anteriormente, las causas de la variabilidad de la salida de un proceso se pueden dividir en dos tipos: Causas comunes: Son fuentes de variación puramente aleatorias, inidentificables e imposibles de evitar. Si la variabilidad de un proceso estuviera únicamente compuesta por causas comunes, la distribución del proceso sería simétrica, es decir, presenta el mismo número de observaciones por encima y por debajo de la media. Figura 3. Distribución de proceso simétrica.
32 𝐸= 𝑋−𝑋 (9) Esta matriz de residuos E permite obtener la variabilidad de los datos de observación a través de los vectores propios que se encuentran asociados a los valores singulares m-a de menos valor, y es posible representar el conjunto de datos de partida: 𝑋=𝑋+𝐸 (10) 2.3.4. Estadísticas para la monitorización Para la monitorización del proceso a partir del PCA, se usan distintos estadísticos que permiten construir gráficos de control para supervisar el proceso. Así se consigue monitorizar el proceso con una única variable, a la vez que se muestra el umbral de normalidad en el mismo gráfico [4]. 2.3.4.1. Estadística Hotelling (𝑻𝟐) Este estadístico utiliza el espacio de dimensión a. A partir de la matriz X normalizada con media 0 y varianza 1, y 𝑥 ∈ ℜ𝑚𝑥1 se puede definir la estadística 𝑇2: 𝑇2=𝑥𝑇𝑃Λ𝑎 −1𝑃𝑇𝑥 (11) Donde Λ𝑎 es una matriz con las primeras a columnas y filas de la matriz Λ, siendo a el número de componentes principales elegido. También se puede representar 𝑇2 en su forma genérica, introduciendo la ecuación (7) en (11): 𝑇2=𝑇∗Λ𝑎 −1∗𝑇 (12) Se forma a partir de los autovectores que forman el subespacio de la variación imperante, por lo que este estadístico representa la variación del proceso. Sin embargo, es necesario un límite para determinar si el proceso se encuentra
33 fuera de control, y este umbral asociado al estadístico Hotellings se determina con el número de datos de muestreo n: 𝑇𝛼2=(𝑛2)∗𝑎 𝑛∗(𝑛−𝑎)𝐹𝛼(𝑎,𝑛−𝑎) (13) En la ecuación (13) 𝐹𝛼(𝑎,𝑛−𝑎) es el valor crítico de la función F de Fisher- Snedecor, n y n-a son los grados de libertad de la función, y 𝛼 es el nivel de significancia. El valor de 𝛼 supondrá la tolerancia que se tendrá a las falsas alarmas, y sus valores más frecuentes están entre 0,01 y 0,05. Debido a que 𝑇2 se basa en los a primeros componentes principales, ofrece la medida de las desviaciones de las variables latentes, que son aquellas que mejor explican la variabilidad de la planta. El inconveniente de esto es que detectará únicamente los eventos que produzcan mayor variabilidad en las variables latentes que la explicada por las causas comunes. Pero anomalías que produzcan variaciones en el ruido no se detectarán, ya que el espacio del ruido ha sido descartado para el cálculo de este estadístico [10]. 2.3.4.2. Estadístico SPE o Q Este estadístico soluciona el problema de la detección de eventos en el espacio del ruido que tenía 𝑇2. Las siglas SPE significan Error de Predicción Cuadrático en español. Se calcula a partir de un vector de observación 𝑥 ∈ ℜ𝑚𝑥1: 𝑄=𝑟𝑇𝑟 (14) donde r es el vector residuo: 𝑟=(𝐼−𝑃𝑃𝑇)𝑥 (15) El estadístico indica la diferencia (residuo r) entre el vector de observación x y su valor proyectado en el espacio reducido de los componentes principales. Al igual que ocurría con el estadístico anterior, Q necesita de un umbral para
34 determinar si el proceso se encuentra fuera de los límites de control. Este umbral se calcula con los datos tomados fuera de línea para el PCA [10]: 𝑄𝛼=𝑣 2∗µ∗𝑥𝛼 2(1−𝛼,ℎ)−1 (16) Donde 𝑥𝛼 2(1−𝛼,ℎ)−1 es la inversa de a función acumulativa 𝑥2, α es el índice de tolerancia a falsas alarmas, µ y 𝑣 son la media y la varianza de Q, y el parámetro h se calcula de la siguiente manera: ℎ=2∗µ2 𝑣 (17) El estadístico Q representará fluctuaciones en el ruido siempre que el proceso esté controlado. Si la covarianza de X cambia, Q superará el umbral y el fallo será detectado. 2.4. TÉCNICAS DE APRENDIZAJE AUTOMÁTICO Tras la detección de un fallo en un proceso, se lleva a cabo un estudio para diagnosticar el fallo, y de esta manera se pueda identificar la causa y el origen de la anomalía detectada. Para efectuar esta clasificación se utilizarán modelos computacionales como las redes neuronales, que mediante un aprendizaje automático se encargarán de diagnosticar cada fallo, permitiendo la identificación de cada uno. Dentro del aprendizaje automático se diferencian dos ramas de la inteligencia artificial: Machine Learning y Deep Learning. La primera estudia técnicas para el desarrollo de algoritmos que se automejoren de forma automática. Por otro lado, el Deep Learning se centra en crear largos y potentes modelos de redes neuronales que sean capaces de tomar decisiones con gran precisión a través de datos reales [11].
35 Figura 9. Relación entre la Inteligencia Artificial, Machine Learning y Deep Learning [11]. 2.4.1. REDES NEURONALES ARTIFICIALES En los últimos años las Redes Neuronales Artificiales (ANN) han recibido un gran interés para minar datos, ya que se pueden modelar grandes y complejos problemas con los medios que ofrece. Son capaces de encontrar patrones de forma inductiva gracias a algoritmos de aprendizaje basados en datos existentes [12]. Las ANN representan un método de resolución de problemas de clasificación, identificación o predicción, siempre que haya cierta tolerancia a errores y se necesite de un aprendizaje mientras se ejecuta el método. La unidad de una red neuronal artificial es la neurona, que se define como un procesador elemental con capacidad limitada para el cálculo de, generalmente, la suma ponderada de las entradas que llegan a la neurona, y ejecuta una función de activación que produce la señal que será enviada al resto de neuronas. El modelo de una neurona se compone de un vector de pesos 𝑤 (18) que equivale a las conexiones sinápticas en una neurona real, 𝑤0 es el umbral de activación o bias, la entrada la forma el vector 𝑥 y el escalar y es la salida (19). 𝑤 =(𝑤1,…,𝑤𝑛)𝑇 (18)
36 𝑦=𝛾[∑ 𝑤𝑖 𝑚 𝑖=1 𝑥𝑖+𝑤0] (19) Donde 𝛾 es una función no lineal. Figura 10. Ejemplo de neurona artificial con 5 entradas [12]. Las neuronas se agrupan en capas y tienen una alta conectividad entre ellas. Para su correcto funcionamiento, las neuronas son sometidas a un aprendizaje automático mediante un algoritmo, que permite que puedan minimizar el error de ajuste de datos cambiando su estructura o sus parámetros. Las Redes Neuronales Feedforward (FANN) son el tipo de ANN más estudiado por la comunidad científica, y sus usos son numerosos dentro de amplios campos de aplicación. Su nombre indica que es alimentada hacia adelante, es decir, la información fluye desde las entradas hacia las salidas [13]. En cuanto a la arquitectura, una FANN está compuesta por neuronas dividas en diferentes capas (Figura 11), y de las que hay 3 tipos: capa de entrada, capa oculta (puede ser única o puede haber varias) y capa de salida. Una vez se define la arquitectura de la red con el número de capas ocultas y el número de neuronas en cada capa, la red se ajusta a una muestra dada a través de procesos de aprendizaje explicados más adelante.
37 Figura 11. Arquitectura de una Red Neuronal Feedforward con dos capas ocultas [14]. En el caso de que el número de capas ocultas sea mayor de uno, la red neuronal será de aprendizaje profundo o Deep Learning. Este subcampo de la inteligencia artificial se centra en crear largos modelos de redes neuronales que son capaces de tomar decisiones con gran precisión a través de datos reales. 2.4.2. APRENDIZAJE AUTOMÁTICO El aprendizaje automático, también llamado machine learning, es una rama de la Inteligencia Artificial que estudia técnicas para el desarrollo de algoritmos que permitan que los modelos se mejoren a sí mismos de forma automática. El objetivo es que estos modelos sean capaces de poder hacer predicciones y tomar decisiones a partir de datos reales. Dentro del aprendizaje automático, existen dos tipos principales: • Aprendizaje automático supervisado: Se caracteriza por la presencia de un agente externo que controla el proceso de entrenamiento,
38 estableciendo la respuesta que debería generar la red (output), a partir de una entrada determinada. De esta forma se compara la salida de la red con la salida deseada, y las diferencias que existan se ajustan iterando los pesos hasta que la salida tiende a ser la deseada [15]. • Aprendizaje automático no supervisado: Las redes con este tipo de aprendizaje no necesitan información externa para el ajuste de los pesos. La red utiliza el algoritmo de aprendizaje para detectar peculiaridades o correlaciones en el conjunto de entradas, y así estima la función de densidad probabilística p(x) [15]. 2.4.3. AUTOENCODERS Un Autoencoder es un tipo de red de propagación hacia adelante formado por 3 capas. La peculiaridad de estas redes es que la salida tiene el mismo valor que la entrada a la red, lo que significa que la tarea del autoencoder es la de recrear las entradas. En este proceso de recreación, el Autoencoder tendrá que ser capaz de, mediante un codificador, reducir la dimensionalidad manteniendo las características que definen la entrada, y de realizar a continuación la operación inversa mediante un decodificador. El tipo de aprendizaje de un Autoencoder será por tanto no supervisado, ya que no hay que dotar a la red de la salida deseada. Todo esto obliga a que la capa de salida tenga el mismo número de neuronas que la capa de entrada.
39 Figura 12. Arquitectura de un Autoencoder [16]. Existe un problema con la arquitectura de estas redes, y es que, si el número de neuronas en la capa oculta es igual o mayor al número de neuronas de las capas de entrada y salida, el Autoencoder corre el peligro de aprender la función de identidad en vez de aproximarla, por lo que aparece el problema de sobreajuste. En la figura 13 se ilustra este problema, donde la curva negra representa una red sobre ajustada, y la recta azul se corresponde con una red mejor ajustada, que tendrá menor precisión, pero mucha mayor flexibilidad a datos nuevos [17]. Figura 13. Sobreajuste de una red [17].
40 La solución a este problema es incluir la condición de que tiene que haber menos neuronas en la capa oculta que en las capas de entrada y salida del Autoencoder. Los Autoencoders que cumplen esta condición se denominan Autoencoders Simples. 2.4.3.1. AUTOENCODERS APILADOS (STACKED AUTOENCODERS) Se pueden crear redes neuronales con varias capas ocultas a partir del apilamiento de varios Autoencoders. Sabiendo que el resultado real del Autoencoder no se encuentra en la capa de salida sino en la capa oculta, se puede usar esa capa oculta como entrada de otro Autoencoder, de manera que la unión de los Autoencoders no es uno detrás de otro, sino que sus capas se encuentran combinadas, como refleja la Figura 14. Figura 14. Combinación de 2 Autoencoders [18]. Cabe destacar que, aunque se combinen los Autoencoders, el número de neuronas a la entrada y a la salida de la red seguirá siendo iguales. Solo la capa intermedia y la arquitectura del Autoencoder se verá modificada. La arquitectura formada de cuello de botella es ideal para la función que desempeña el Autoencoder, pues la codificación y decodificación se realiza de forma gradual. El resultado real del Stacked Autoencoder es la construcción de la representación distribuida por la capa intermedia [18].
41 2.4.4. ÁRBOLES DE DECISIÓN (RANDOM FOREST) Un árbol de decisión es un modelo de predicción cuyo objetivo es el aprendizaje inductivo a partir de construcciones lógicas y observaciones. Probablemente sea el modelo para clasificación más utilizado. También representa una técnica de minería de datos (Data Mining) proveniente de la inteligencia artificial y la estadística, donde se encuentran técnicas como las redes neuronales o la regresión lineal Figura 15. Esquema de la clasificación de las técnicas Data Mining [19]. Los árboles de decisión crean un modelo de clasificación basado en los diagramas de flujo, y clasifican casos en grupos o pronostican valores de una variable dependiente basada en variables independientes. Algunas ventajas de los árboles de decisión son la sencillez de interpretar la decisión, la reducción
48
49 3.1 CASO DE ESTUDIO La planta de la que han extraído los datos necesarios para la realización de este trabajo consiste en una red de recogida de agua y alcantarillado simulada [21]. Este colector de aguas, desarrollado en [22], tiene objetivo de servir como banco de pruebas dentro de la comunidad científica, especialmente en ingeniería de control. La particularidad de este modelo integrado se encuentra en que representa la interconexión que existe en la actualidad entre las plantas de tratamiento de aguas residuales (EDAR) con otros elementos como son las redes de alcantarillado o los equipos de recogida de agua fluvial. Además, la simulación cuenta con algoritmos que generan las características propias de distintas situaciones meteorológicas, generando así un volumen de precipitaciones cuya intensidad y duración dependen del día de la semana o la estación del año. Como consecuencia de esto el modelo está dotado de una gran complejidad, y su desarrollo ha sido posible gracias al exponencial aumento de la potencia computacional en las últimas décadas. 3.2 DESCRIPCIÓN DE LA PLANTA La planta (Figura 18) está formada por seis colectores de agua pluvial y residual (1, 2, 3, 4, 5, 6) y seis tanques de almacenamiento de aguas residuales (ST1, ST2, ST3, ST4, ST5, ST6), de los cuales uno de ellos se encuentra desconectado (ST5). El resto de la planta lo completan las tuberías que interconectan todos los elementos, cinco válvulas que regulan el caudal de salida de cada depósito conectado, una bomba hidráulica y la planta de tratamiento de aguas residuales (WWTP en la Figura 18, por sus siglas en inglés). El objetivo del alcantarillado es recoger todas las aguas residuales y conducirlas a la EDAR, a la vez que se mantiene un caudal con un valor cercano al nominal, y una variabilidad baja. Los tanques de los que dispone la planta tienen la función de almacenar aguas residuales, de tal manera que sea posible aumentar el caudal cuando este sea bajo, y cortar el suministro cuando el valor del caudal aumente.
50 Figura 18. Esquema de la planta de alcantarillado. En la Figura 19 se muestra el diagrama de bloques del sistema de alcantarillado, en el que el depósito de almacenamiento 6 ha sido renombrado a 5. Los triángulos azul marino se corresponden a los depósitos de almacenamiento, las elipses celestes a los colectores de agua, y los rectángulos amarillos representan las tuberías. Figura 19 Diagrama de bloques simplificado de la planta de alcantarillado Para la detección y diagnóstico de los fallos de la planta es necesario obtener información del proceso a lo largo de un periodo de tiempo. Esta información es extraída gracias a una serie de sensores repartidos en diferentes zonas. La planta posee sensores de nivel de depósito en cada uno de los tanques,
51 sensores de caudal en todas las tuberías que componen la instalación, y sensores de apertura en las válvulas alojadas en cada uno de los depósitos de almacenamiento. Para el desarrollo del trabajo, se hace uso de un modelo simulado de la planta en SIMULINK [22], de donde se obtienen los conjuntos de datos necesarios para el estudio. Los datos se obtienen a partir de sensores distribuidos por la planta. 3.3 VARIABLES Y DATOS DE LA PLANTA En la Figura 20 están representadas todas las variables que se pueden recoger en la planta. De estas variables q1, q2, q4, q5 y q6 son perturbaciones que entran al sistema, por lo que no se pueden modificar. Por otro lado, q3, q7, q8, q9, y los niveles de los cinco depósitos son las variables de estado del sistema, que se consideran como salidas del proceso. El objetivo de control del sistema es que el flujo a la entrada de la depuradora (q9) esté lo más cercano posible a su valor nominal independientemente de las condiciones del sistema al mismo tiempo que se evitan desbordamientos en los tanques y en la propia depuradora. Para lograr este objetivo, se considera como variables manipuladas el caudal de flujo a la salida de los tanques (lo que se ha llamado u1, u2, u3, u4 y u5), y el controlador calculará estas variables para minimizar la diferencia entre el caudal que entra a la depuradora y su valor nominal, para lo cual además distribuirá el caudal de agua entre los diferentes tanques de la red maximizando la diferencia entre el nivel de agua en cada tanque y el valor de referencia de dicho nivel calculado de forma dinámica.
52 Figura 20. Variables del proceso. Los sensores recogen información de la planta cada 3 minutos y durante 10 días de funcionamiento de la planta. Sabiendo esto: 𝑛=60 𝑚𝑖𝑛 3∗24 ℎ 1 𝑑í𝑎∗10 𝑑í𝑎𝑠=4800+1=4801 donde n es el número de observaciones en la planta. Se suma una unidad debido a que el sensor envía información en el instante inicial. De esta manera, la matriz de datos del proceso X ∈ ℜ𝑛𝑥𝑚, donde m=24 y n=4801. Para estudiar la detección y clasificación de fallos es necesario provocarlos. Para ello, a la planta simulada hay que añadirle un fichero donde se especificará qué fallos se van a provocar y en qué instante de tiempo. En este fichero (Figura 21) se pueden provocar 19 fallos distintos de tipo offset, es decir, el fallo que se elija consistirá en añadir un aumento en el valor de una variable. También se debe elegir el instante de tiempo en el que se produce la VARIABLE DESCRIPCIÓN UNIDADES q1 CAUDAL EN LA TUBERÍA 1 m^3/d q2 CAUDAL EN LA TUBERÍA 2 m^3/d q3 CAUDAL EN LA TUBERÍA 3 m^3/d q4 CAUDAL EN LA TUBERÍA 4 m^3/d q5 CAUDAL EN LA TUBERÍA 5 m^3/d q6 CAUDAL EN LA TUBERÍA 6 m^3/d q7 CAUDAL EN LA TUBERÍA 7 m^3/d q8 CAUDAL EN LA TUBERÍA 8 m^3/d qwwtp CAUDAL EN LA TUBERÍA 9 ó CAUDAL EN LA DEPURADORA m^3/d n1 NIVEL DEL AGUA EN EL DEPÓSITO 1 m n2 NIVEL DEL AGUA EN EL DEPÓSITO 2 m n3 NIVEL DEL AGUA EN EL DEPÓSITO 3 m n4 NIVEL DEL AGUA EN EL DEPÓSITO 4 m n5 NIVEL DEL AGUA EN EL DEPÓSITO 5 m u1 APERTURA DE LA VÁLVULA 1 % u2 APERTURA DE LA VÁLVULA 2 % u3 APERTURA DE LA VÁLVULA 3 % u4 APERTURA DE LA VÁLVULA 4 % u5 APERTURA DE LA VÁLVULA 5 % ref1 REFERENCIA DEL CONTROLADOR PARA EL NIVEL 1 m ref2 REFERENCIA DEL CONTROLADOR PARA EL NIVEL 2 m ref3 REFERENCIA DEL CONTROLADOR PARA EL NIVEL 3 m ref4 REFERENCIA DEL CONTROLADOR PARA EL NIVEL 4 m ref5 REFERENCIA DEL CONTROLADOR PARA EL NIVEL 5 m
53 anomalía. Tanto el valor del offset del fallo que se elige provocar como el instante de tiempo en el que se provoca, se introducen en el fichero de la Figura 21. Después se simula la planta desarrollada en SIMULINK [21], y tras el periodo de simulación se almacenan los datos de las 24 variables en la matriz X, que es la matriz a partir de la cual se realiza el resto de los procedimientos para el estudio. Figura 21. Código del archivo para provocar fallos.
54
55 CAPÍTULO IV: APLICACIÓN DESARROLLADA
56
57 4.1. PROCEDIMIENTO. DATOS DE FALLO. En este capítulo se van a aplicar las técnicas que se han detallado en el Capítulo II a datos extraídos del colector de aguas, de forma que se estudiará la detección de fallos producidos en la planta y su posterior diagnóstico. Para este trabajo se han provocado un total de 10 fallos independientes, lo que dará lugar a 10 matrices de datos X. Todos los fallos se han efectuado para la observación n=480, lo que significa que el fallo se provoca al comienzo del segundo día de simulación, con la intención de que, si se produjesen oscilaciones al comienzo de la simulación, le diera tiempo a la planta a estabilizarse. La Figura 22 muestra una tabla con un resumen de todos los fallos provocados en la planta. También se ha obtenido una matriz X de comportamiento normal, es decir, sin ningún fallo provocado. Esta matriz será necesaria para aplicar la técnica de Análisis de Componentes Principales. Figura 22. Tabla de fallos provocados en la planta. Se han provocado 10 fallos, pero solo sobre 5 variables. Cada una de ellas tiene asociados 2 fallos de distinta magnitud o valor. Se ha hecho de esta manera para que estos mismos fallos se puedan utilizar tanto en el estudio de detección como en el de clasificación, y se tenga un conjunto de datos de entrenamiento de los métodos y un conjunto diferente para validar dichos métodos. VARIABLE NOMBRE FALLO TIPO VALOR 20000 23000 2000 3500 6000 8500 2 2,4 2 2,4 OFFSET SENSOR NIVEL 5º DEPÓSITO OFFSET qwwtp q7 q8 n4 n5 OFFSET SENSOR CAUDAL Q7 OFFSET SENSOR CAUDAL Q8 OFFSET SENSOR CAUDAL DEPURADORA SENSOR NIVEL 4º DEPÓSITO
64 Figura 28. (a) Arriba. Gráfico de control 𝑇2para comportamiento normal. (b) Abajo. Gráfico de control Q para comportamiento normal. Para intentar solucionar este problema, en el apartado siguiente se van a modificar los umbrales de ambos estadísticos, introduciendo el concepto de umbral adaptativo. 4.2.1.4. RESULTADOS DEL PCA CON UMBRAL ADAPTATIVO En este apartado se va a introducir una modificación el proceso de detección de los fallos, con el objetivo de mejorar los resultados obtenidos en el apartado anterior, ya que distan bastante de ser precisos y concluyentes. Se introduce el concepto de Umbral Adaptativo, que consiste en ajustar el umbral a los valores del estadístico en cada momento, obteniendo una curva variable en el tiempo en vez de una recta paralela al eje de abscisas.
65 Para formar el umbral adaptativo de 𝑇2 se ha utilizado el mismo procedimiento que para calcular el umbral adaptativo de Q (Ecuación 16), pero aplicando el método de ventana deslizante al vector T2 (1x4801). Este método consiste en ir calculando valores del umbral, pero para intervalos de observaciones menores. Se ha decidido que serán 10 las observaciones que formen cada intervalo, y se desplazará una observación al cambiar al siguiente intervalo. La Figura 29 muestra el procedimiento. De esta manera se obtiene un vector del umbral adaptativo de 𝑇2 de dimensiones 1x4792. Los 9 valores que faltan para completar el vector son los 9 primeros porque ambas ventanas deslizantes se han realizado a pasado. Estos 9 valores serán igual al valor del umbral del apartado anterior. El cálculo del umbral adaptativo de Q es igual que el de 𝑇2, pero aplicando la ventana deslizante al vector Q (1x4801). Figura 29. Esquema de funcionamiento de la ventana deslizante aplicada a un vector. Los resultados obtenidos de provocar el fallo en nivel del 5º depósito con offset=2,4 indican un buen funcionamiento del PCA tras la mejora.
66 Figura 30. (a) Arriba. Gráfico de control 𝑇2para el fallo en n5 (offset=2,4). (b) Abajo. Gráfico de control Q para el fallo en n5 (offset=2,4). La curva roja de las figuras Xa y Xb, son los umbrales adaptativos de ambos estadísticos. Al igual que en el apartado anterior, en aquellos lugares en donde el umbral esté por encima del estadístico durante n=15 observaciones consecutivas, el fallo será detectado por el PCA. Figura 31. Resultados de PCA adaptativo con fallo n5 (offset=2,4). La detección de los fallos con PCA y umbral adaptativo aporta mejores resultados que en el apartado anterior, aumentando la efectividad del método de forma considerable. Así lo refleja la tabla de la Figura 32, en la que se encuentra el resumen de resultados tras provocar los 10 fallos distintos. T2 QT2 QT2 Q 481 481 85,8067 84,3039 1,0593 0,6356 FALSAS ALARMAS (%) TIEMPO DETECCION FALLO (n) PORCENTAJE ALARMAS (%)
67 Figura 32. Resumen de los 10 fallos provocados en la planta con umbral adaptativo. De la figura anterior se puede destacar que la mayoría de los datos se detectan de forma prácticamente instantánea desde su aparición, y no hay ninguno que tenga un tiempo de detección superior a las 653 observaciones, lo que equivaldría a un tiempo de detección máximo de 8,63 horas. Si se comparan los dos estadísticos, se llega a la conclusión de que el funcionamiento de Q es mejor que el que desarrolla 𝑇2, tanto en tiempo de detección como en porcentaje de alarmas, ya que los fallos detectados por Q se mantienen en el tiempo más que los de 𝑇2. 4.2.2. PCA NO LINEAL Con el propósito y el objetivo de continuar mejorando el modelo obtenido anteriormente, se ha desarrollado un modelo de PCA no lineal. En este modelo se utilizan las siguientes herramientas: Redes Neuronales y Autoencoders. También se compararán los resultados obtenidos con el umbral constante y con el umbral adaptativo. NOMBRE FALLO TIPO VALOR T2 QT2 QT2 Q OFFSET 2 481 481 70,048 74,5773 1,0593 0,6356 OFFSET 2,4 481 481 85,8067 84,3039 1,0593 0,6356 OFFSET 2 481 481 44,5627 83,5107 1,0593 0,6356 OFFSET 2,4 481 481 38,781 89,7934 1,0593 0,6356 OFFSET 2000 846 481 25,3392 49,6765 2,3895 0,6356 OFFSET 3500 682 481 37,2991 68,1277 1,3373 0,6356 OFFSET 6000 651 481 38,0714 63,1183 0,7788 0,6356 OFFSET 8500 641 481 46,0447 69,6097 0,7911 0,6356 OFFSET 20000 678 653 32,9785 55,0824 1,0463 2,3292 OFFSET 23000 481 481 57,942 84,45 1,0593 0,6356 NIVEL 4º DEPÓSITO CAUDAL Q7 CAUDAL Q8 CAUDAL DEPURADORA ESTUDIO DETECCIÓN FALLOS TIEMPO DETECCION FALLO PORCENTAJE ALARMAS FALSAS ALARMAS NIVEL 5º DEPÓSITO
68 4.2.2.1. PCA NO LINEAL OFFLINE La matriz X de datos de funcionamiento normal se normaliza con media 0 y varianza 1, al igual que en PCA lineal. La diferencia es que ahora se procede a crear y entrenar una red neuronal para la detección de fallos. La creación de la red se hará por capas, donde cada capa es un Autoencoder con un número de neuronas determinado en la capa oculta. Estos Autoencoders se irán entrenando por separado, y una vez estén entrenados, se apilarán todos ellos (Stacked Autoencoder) formando una única red neuronal, donde el número de entradas sea igual al número de salidas. La arquitectura de la red es simétrica, formada por las capas de entrada y salida, de 24 neuronas cada una, y 3 capas ocultas: 2 capas ocultas de 30 neuronas, y la capa oculta central compuesta por 10 neuronas. De esta manera se consigue una arquitectura bottleneck, que favorece el funcionamiento de las redes neuronales [21]. Figura 33. Arquitectura de la red final obtenida. El primer Autoencoder, de 30 neuronas en la capa oculta, se entrena con la matriz X normalizada, por lo que dispondrá de 24 neuronas en las capas de
69 entrada y salida. Para conseguir la arquitectura deseada, se codifica el primer Autoencoder para obtener la capa oculta (30 neuronas), que será la matriz de datos de entrenamiento para el segundo Autoencoder, de 10 neuronas en la capa oculta. Para el tercer Autoencoder el proceso es el mismo: se codifica el segundo Autoencoder y se extrae la capa oculta (10 neuronas), que será de nuevo de la matriz de datos de entrenamiento del tercer Autoencoder, creado con 30 neuronas en la capa oculta para completar la simetría. Llegado a este punto, se tiene el tercer Autoencoder con 30 neuronas en la capa oculta, pero no se puede crear un cuarto Autoencoder, ya que este tipo de red neuronal, como se ha explicado en el capítulo II, aproxima la salida a la entrada tras un proceso de codificación y decodificación. Por lo que, para la última capa, no se podrá proceder con un cuarto Autoencoder, sino con una red neuronal con una capa oculta, cuyas únicas diferencias son que para el entrenamiento se introducen tanto los datos de entrada (capa oculta de 30 neuronas extraída del tercer Autoencoder), como los datos objetivo, que es la salida que se desea que tenga la red (matriz X normalizada); y que el número de salidas es distinto que el de entradas. La capa de salida de esta red tiene 24 neuronas, por lo que se completa la simetría y se procede a apilar la red. Esta red final también deberá ser entrenada, y para dicho entrenamiento tanto los datos de entrada como los datos objetivo serán la matriz X de datos de funcionamiento bajo control normalizada. La Figura 34 muestra los esquemas de los 3 Autoencoders y la red que forman la red final.
70 Figura 34. a) Arquitectura Autoencoder 1. b) Arquitectura Autoencoder 2. c) Arquitectura Autoencoder 3. d)Arquitectura Red En la Figura 35 se muestran los entrenamientos de los 3 Autoencoders y de la red por separado, antes de apilarlos y formar la red final. En estas gráficas se muestra la comparación entre la entrada (curva azul) y la salida real (curva roja) de cada una de las redes por separado.
71 Figura 35. Gráficas de entrenamiento de Autoencoders y red. Una vez creada la red, el paso siguiente es el cálculo de los estadísticos y los umbrales fuera de línea para comportamiento normal. Para calcular 𝑇2 se necesitará conocer el valor de las salidas de la capa intermedia de 10 neuronas. Habrá que calcular por lo tanto las salidas de la capa de 30 neuronas, y con estas salidas que son entradas a la siguiente capa de la red neuronal se calcularán las que salen de la capa intermedia. La función de transferencia de la red es logarítmica, por lo que las salidas tendrán la siguiente forma: 𝑎=𝑙𝑜𝑔𝑠𝑖𝑔(𝑤∗𝑝+𝑏) (20) donde w son los pesos de cada capa, p son las entradas relativas a la capa, y b son los umbrales de activación o bias. logsig es la función no lineal 𝛾 de la ecuación (19) en el Capítulo II. Por tanto, para la capa de 30 neuronas la salida toma el valor siguiente:
72 𝑎30 =𝑙𝑜𝑔𝑠𝑖𝑔(𝑤30∗𝑋𝑡𝑛+𝑏30) (21) donde 𝑎30 es una matriz de 30x4801 y 𝑋𝑡𝑛 es la matriz X de datos de funcionamiento normal normalizada. Y para la capa intermedia, la ponderación es: 𝑎10=𝑙𝑜𝑔𝑠𝑖𝑔(𝑤10∗𝑎30+𝑏30) (22) donde 𝑎10 es una matriz 10x4801. Para el cálculo de 𝑇2 se utiliza la ecuación genérica (12), donde T=𝑎10, que se corresponde con la salida de la capa del cuello de botella de la red. El cálculo de -1 es distinto que en PCA lineal puesto que no se ha realizado el cálculo de los valores propios. Por lo tanto: Λ−1=(𝑇𝑡∗𝑇 𝑛−1)−1 (23) El cálculo de Q se realiza empleando la ecuación (14), pero el residuo 𝑟 en este caso se calcula como la diferencia entre la salida de la red entrenada con los datos de entrenamiento, y los propios datos de entrenamiento que es la salida deseada: 𝑟=𝑋𝑟𝑒𝑑−𝑋𝑛 (24) Tras el cálculo de los dos estadísticos fuera de línea, se procede a calcular los estadísticos 𝑇𝛼 𝑦 𝑄𝛼 con sus respectivas ecuaciones (13) y (16). Estos umbrales, al igual que en PCA lineal, serán los utilizados en la etapa en línea. 4.2.2.2. PCA NO LINEAL ONLINE Con la red creada a partir de los datos de funcionamiento normal, calculados los estadísticos 𝑇2 y Q, y obtenidos los umbrales de ambos estadísticos, se procede a la evaluación y el estudio de la detección de fallos por parte del PCA no lineal. Para ello, se seguirá un procedimiento similar al empleado en el PCA lineal. Se normaliza la matriz con fallo X con la media y la varianza de la normalización realizada fuera de línea con los datos de funcionamiento normal.
73 Tras obtener la matriz de datos de fallo X normalizada (𝑋𝑛), se calculan los estadísticos 𝑇2 𝑦 𝑄 de la misma manera que fuera de línea, pero sustituyendo la matriz X de datos normales normalizada por la de datos de fallo normalizada. Una vez terminados los cálculos de los estadísticos y sus umbrales, se procede a graficar las soluciones e interpretar los resultados. 4.2.2.3. RESULTADOS PCA NO LINEAL CON UMBRAL CONSTANTE Para el estudio de la detección de fallos con el modelo no lineal, se tendrán en cuenta el valor de los 3 parámetros que se usaron con anterioridad: tiempo de detección de fallo, porcentaje de alarmas y porcentaje de falsas alarmas. Figura 36. Tabla de resultados de PCA no lineal con umbral constante. Tras realizar los cálculos de los 10 fallos distintos sobre el PCA no lineal (resumen en la Figura 36), a la vista está que este modelo de detección de fallos no sólo no consigue su objetivo de mejorar la eficacia en la detección de fallos, sino que empeora el modelo anterior. Tan sólo el fallo en n5 es detectado por el estadístico Q, resaltado en verde en la Figura 36. El resto de los tiempos de fallo distan bastante de ser aceptables en la detección, pues la mayoría se encuentran por encima de la observación n=3700. Los porcentajes de alarmas NOMBRE FALLO TIPO VALOR T2 QT2 QT2 Q OFFSET 2 3727 3776 8,5581 5,0682 1,1834 1,911 OFFSET 2,4 3127 481 6,209 2,6383 0,5452 1,6949 OFFSET 2 3728 3728 7,7281 8,1006 1,3982 0,8873 OFFSET 2,4 3127 3127 7,4627 5,791 0,449 0,5752 OFFSET 2000 3728 3785 8,5661 2,5565 0,6184 1,1123 OFFSET 3500 3728 3783 8,6592 2,0608 0,5916 1,0069 OFFSET 6000 3728 3784 8,7523 1,7682 0,5916 0,6887 OFFSET 8500 3727 3781 8,8372 1,8609 0,6455 0,7423 OFFSET 20000 10 3727 2,9215 6,8837 100 0,5648 OFFSET 23000 3727 3727 9,3953 5,2093 0,6455 0,3765 NIVEL 4º DEPÓSITO CAUDAL Q7 CAUDAL Q8 CAUDAL DEPURADORA ESTUDIO DETECCIÓN FALLOS TIEMPO DETECCION FALLO (n) PORCENTAJE ALARMAS (%) FALSAS ALARMAS (%) NIVEL 5º DEPÓSITO
80 En la Figura 42 se ilustra cómo ha sido el entrenamiento. La curva azul es la salida de la red (𝑋𝑟𝑒𝑑), mientras que la curva roja es la salida objetivo o deseada (𝑋𝑛) Ahora se somete a la matriz 𝑟 a un PCA lineal desarrollado anteriormente, con una variabilidad de los componentes principales mayor o igual al 95%. Ahora si se calculan los dos estadísticos 𝑇2 y 𝑄 y sus respectivos umbrales 𝑇𝛼 𝑦 𝑄𝛼. También se procede a calcular los umbrales adaptativos de ambos estadísticos de la misma manera que en el resto de los modelos. Figura 43. (a) Arriba. Gráfico de control 𝑇2para el funcionamiento normal con umbral constante. (b) Abajo. Gráfico de control Q funcionamiento normal con umbral constante. En las Figuras 43 y 44 se muestra el resultado del PCA no lineal de los residuos aplicados a los datos de comportamiento normal (sin fallo) para umbral constante y adaptativo respectivamente. Llegados a este punto, se procede al
81 tratamiento de los datos de fallo para poder incluirlos en el modelo y verificar si se produce la detección y cuál es su efectividad. Figura 44. (a) Arriba. Gráfico de control 𝑇2para funcionamiento normal con umbral adaptativo. (b) Abajo. Gráfico de control Q para funcionamiento normal con umbral adaptativo. 4.2.3.2. PCA DEL RESIDUO ONLINE El tratamiento de los datos de fallo es similar al tratamiento de los datos de comportamiento bajo control de la planta. Los datos son normalizados a -1 y +1, pero con respecto a los valores de la normalización de los datos de funcionamiento normal. Después se introducen en la red ya creada, y se calcula 𝑟: 𝑟𝑓=𝑋𝑓−𝑋𝑟𝑒𝑑𝑓 (25) Donde 𝑋𝑓 es la matriz de datos de fallo normalizada y 𝑋𝑟𝑒𝑑𝑓 es la salida de la red con 𝑋𝑓 como entrada. Se aplica el modelo de PCA lineal a 𝑟𝑓, pero la normalización con media 0 y varianza 1 se realiza con respecto a los valores de la normalización de 𝑟 fuera de línea. De aplicar PCA se obtienen 𝑇2 y 𝑄
82 referentes a 𝑟𝑓, y se obtienen los resultados correspondientes al comparar estos estadísticos con los umbrales calculados fuera de línea. 4.2.3.3. RESULTADOS PCA CON RESIDUO Y UMBRAL CONSTANTE Los resultados obtenidos con el umbral constante no son excelentes, pero se mejora con claridad el modelo con PCA no lineal. Figura 45. Resultados PCA con residuo y umbral constante. Los fallos en los niveles de los depósitos son detectados de forma instantánea, y además tienen un porcentaje de alarmas muy alto, alguno incluso del 100%. Sin embargo, los fallos de los caudales no tienen un correcto funcionamiento en este modelo, ya que se detectan tarde tanto en q7 como en q8, e incluso un fallo en q7 no es siquiera detectado por el estadístico Q. En cuanto a las falsas alarmas, los datos siguen siendo positivos, ya que en ningún fallo se supera el 5%. En la Figura 46 se puede observar el buen funcionamiento de este modelo en algunos fallos, como es el ejemplo del fallo en el nivel del 4º depósito. El fallo es muy visual y se aprecia que efectivamente, puesto que se está trabajando con el residuo del modelo neuronal y no con las variables directamente, la detección funciona mejor debido a que se está amplificando el fallo. NOMBRE FALLO TIPO VALOR T2 QT2 QT2 Q OFFSET 2 481 481 31,2037 75,1389 2,7542 1,2712 OFFSET 2,4 481 481 94,0509 80,2083 2,7542 1,2712 OFFSET 2 481 481 90,463 76,875 2,7542 1,2712 OFFSET 2,4 481 481 100 100 2,7542 1,2712 OFFSET 2000 1729 NONE 17,7734 NONE 2,4419 NONE OFFSET 3500 481 885 38,4722 22,7783 2,7542 1,5982 OFFSET 6000 1609 1609 27,005 3,4461 4,4375 0,375 OFFSET 8500 522 1461 44,8469 15,6886 2,5341 0,4132 OFFSET 20000 515 818 50,2333 16,8968 2,5692 0,7417 OFFSET 23000 418 545 96,7593 64,1682 2,7542 1,1194 NIVEL 5º DEPÓSITO NIVEL 4º DEPÓSITO CAUDAL Q7 CAUDAL Q8 CAUDAL DEPURADORA ESTUDIO DETECCIÓN FALLOS TIEMPO DETECCION FALLO (n) PORCENTAJE ALARMAS (%) FALSAS ALARMAS (%)
83 Figura 46. (a) Arriba. Gráfico de control 𝑇2para el fallo n4 (offset=2,4) con umbral constante. (b) Abajo. Gráfico de control Q para el fallo n4 (offset=2,4) con umbral constante. 4.2.3.4. RESULTADOS PCA CON RESIDUO Y UMBRAL ADAPTATIVO Si se introduce el umbral adaptativo en el modelo del PCA con residuo, los resultados que se obtienen son prácticamente inmejorables en cuanto a detección de fallos se refiere:
84 Figura 47. Resultados de PCA con residuo y umbral adaptativo Ahora todos los fallos se detectan de forma inmediata por al menos uno de los dos estadísticos. Además, el porcentaje de alarmas es el más alto de los obtenidos hasta ahora, con una media de 89,85% en 𝑇2 y 91,51% en Q. Como comentario final, decir que el porcentaje de falsas alarmas no supera el 1% en ninguna ocasión, lo que es otro indicador más del buen funcionamiento de este modelo. En cuando a la parte gráfica de los fallos, se consigue amplificar ampliamente cada fallo, por lo que el umbral adaptativo es incapaz de seguir al estadístico una vez se provoca el fallo. NOMBRE FALLO TIPO VALOR T2 QT2 QT2 Q OFFSET 2 481 481 97,1528 98,8194 0,8475 0,6356 OFFSET 2,4 481 481 95,7639 98,8889 0,8475 0,6356 OFFSET 2 481 481 99,0741 99,3287 0,8475 0,6356 OFFSET 2,4 481 481 100 100 0,6356 0,6356 OFFSET 2000 481 481 74,9074 88,9583 0,6356 0,6356 OFFSET 3500 481 481 90,3472 97,4074 0,6356 0,6356 OFFSET 6000 518 418 72,029 76,6435 0,5894 0,6356 OFFSET 8500 481 481 85,625 88,1019 0,6356 0,6356 OFFSET 20000 481 543 85,9859 69,9859 0,6356 3,1835 OFFSET 23000 481 481 97,7083 97,0139 0,6356 0,6356 CAUDAL Q7 CAUDAL Q8 CAUDAL DEPURADORA ESTUDIO DETECCIÓN FALLOS TIEMPO DETECCION FALLO (n) PORCENTAJE ALARMAS (%) FALSAS ALARMAS (%) NIVEL 5º DEPÓSITO NIVEL 4º DEPÓSITO
85 Figura 48. (a) Arriba. Gráfico de control 𝑇2para el fallo n5 (offset=2) con umbral adaptativo. (b) Abajo. Gráfico de control Q para el fallo n5 (offset=2) con umbral adaptativo. En la Figura 48 (a) se observa la diferencia de orden de magnitud entre el umbral (rojo) y el estadístico (azul) tras provocar el fallo en la observación n=480. En Q, el umbral se encuentra sobre los valores 0 y 1, mientras que, tras el fallo, el estadístico Q alcanza 500 en el máximo de la curva. En 𝑇2, el umbral adaptativo se encuentra en torno al valor 6 en todo el intervalo de observaciones, mientras que, tras el fallo, se produce un máximo con valor 3228. Esta gran diferencia de orden de magnitud entre los umbrales y los estadísticos permite una gran rapidez para la detección del fallo, e ilustra de manera clara y concisa el momento de detección del fallo en la gráfica.
86 4.3. MODELOS PARA LA CLASIFICACIÓN DE FALLOS Para el diagnóstico de los fallos detectados, se han desarrollado tres modelos distintos. Los resultados que aporten cada uno serán estudiados y comparados entre sí para poder determinar qué modelo clasifica de mejor manera las anomalías en la planta. Uno de los modelos estará basado en los árboles de decisión, y en los otros dos se aplicarán redes neuronales de distinto número de capas ocultas 4.3.1. MODELO DE RED NEURONAL MONOCAPA Este modelo utiliza las redes neuronales como herramienta para el diagnóstico de los fallos. En este caso la red será de propagación hacia adelante, y con sólo una única capa oculta. En primer lugar, se cargan los datos de entrenamiento en el programa. Estos datos de entrenamiento serán las matrices 𝑋𝑓𝑛 de n fallos provocados, pero en los que se eliminarán las observaciones del primer día, es decir, las primeras 480 observaciones. Esto se debe a que durante esas observaciones no se había provocado el fallo, por lo que ese intervalo de valores no se identifica con ningún fallo, y es inútil para el entrenamiento de la red. La red tendrá la misión de clasificar 5 fallos, por lo que serán 5 las matrices 𝑋𝑓𝑛 (𝑋𝑓1;𝑋𝑓2;𝑋𝑓3;𝑋𝑓4;𝑋𝑓5). La red creada tendrá una única capa oculta y será de propagación hacia adelante o feedforward, y únicamente se elegirá el número de neuronas de la capa oculta, ya que el número de neuronas en la capa de entrada vendrá determinado por el tamaño de los datos de entrada, y el de la capa de salida, por el tamaño de los datos objetivo. Los datos de entrada de la red son los datos de fallo agrupados en una matriz X=[𝑋𝑓1 𝑋𝑓2 𝑋𝑓3 𝑋𝑓4 𝑋𝑓5], por lo tanto el número de entradas de la red será 24, igual al número de filas de la matriz X. La matriz de datos de salida deseada consistirá en una matriz de 5 columnas (mismo número de columnas que de fallos a clasificar). En cuanto al número de filas:
87 𝑛º 𝑓𝑖𝑙𝑎𝑠=4801∗5−(480∗5)=21605 𝑓𝑖𝑙𝑎𝑠 Debido a que, tal como se ha comentado anteriormente, se han eliminado las primeras 480 observaciones. Los primeros 4321 valores de la primera columna tendrán el valor 1, siendo el resto 0. Para la segunda columna, serán los valores comprendidos entre la fila 4322 y 8642 los que tengan valor 1, siendo el resto de las filas 0. En la tercera columna, tendrán valor 1 de la fila 8643 a la 12963, y el resto 0. Para la cuarta columna, los valores unidad serán los comprendidos entre las filas 12964 y 17284, con el resto de filas valor 0. En cuanto a la quinta columna, todas sus filas tendrán valor 0 excepto las 4321 últimas. Se elije un número de neuronas de la capa oculta, y se entrena la red con los datos de entrada X y los datos de salida deseados Y. En función del número de neuronas en la capa oculta, el entrenamiento de la red será mejor o peor. Figura 49. Matriz de Confusión del entrenamiento con 18 neuronas.
88 Si se eligen 18 neuronas como tamaño de la capa oculta de la red, el entrenamiento es excelente, pues se logra clasificar la totalidad de los datos correctamente (Figura 49). Las Figuras 50 y 51 muestran la calidad de los entrenamientos con distinto número de neuronas, siendo más ineficientes que el de 18. Figura 50. Matriz de confusión del entrenamiento con 4 neuronas. Figura 51. Matriz de confusión del entrenamiento con 10 neuronas.
89 Otra forma para comprobar que el entrenamiento de la red es correcto, consiste en ilustrar mediante gráficas las salidas de la red, como se ha hecho en la Figura 52. Figura 52. Entrenamiento de la red. La Figura 52 muestra que, efectivamente, la salida de la red es la misma que la salida deseada, ya que tiene el valor 1 en el lugar que le corresponde a cada fallo de entrenamiento, y es 0 en el resto. Para validar este modelo de clasificación de fallos, se introducen fallos de la misma clase que los de entrenamiento, pero de distinta magnitud, y así se puede observar si el modelo es capaz de diagnosticar los fallos de la misma manera que con los fallos de entrenamiento. Primero se va a trabajar bajo la hipótesis de que únicamente se produce un fallo en la planta al mismo tiempo, es decir, el modelo sólo tendrá que clasificar una clase de fallo a la vez. Para la visualización de los resultados, se prueba con un fallo de mayor magnitud en el caudal 8. Los resultados son excelentes ya que q8 tiene el valor 1 durante
96 Figura 60. Resultado del entrenamiento de los Autoencoders por separado. La red final también debe entrenarse. Sus datos de entrada para el entrenamiento será la matriz X normalizada entre -1 y +1, y los datos objetivos o deseados serán los correspondientes a la matriz Y. Para comprobar el entrenamiento de la red completa, se obtiene la salida de la red una vez entrenada, y se compara con la salida deseada. La herramienta ideal para visualizar dicha comparación es la matriz de confusión (Figura 61).
97 Figura 61. Matriz de confusión de la efectividad del entrenamiento de la red completa. El entrenamiento del modelo multicapa también consigue clasificar la totalidad de los datos correctamente, al igual que sucedía en el modelo monocapa. Se procede ahora a la validación del método de clasificación, que al igual que anteriormente, consistirá en introducir fallos de la misma clase pero de distinta magnitud, para determinar si la red es capaz de clasificar estos nuevos datos de fallo que se introducen en ella. De la misma manera que en el modelo monocapa, primero se aumentará la magnitud de un solo fallo, y después se irá aumentando el número de fallos en la entrada a la red. Se aumenta la magnitud en el fallo q7 (offset=3500), y se introducen estos datos de fallo en la red. La salida de la red aporta los resultados que se muestran en la Figura 62.
98 Figura 62. Validación del fallo en q7. Los resultados de la gráfica son excelentes, ya que no existe ningún tipo de perturbación en todo el intervalo de datos. El fallo q7 se mantiene en 1 mientras que el resto de los fallos no son clasificados, y su valor es 0 para todo el intervalo. Los resultados numéricos para el resto de los fallos se incluyen en la tabla de la Figura 63. Figura 63. Resumen de resultados para la clasificación de 1 fallo por parte del modelo multicapa. Se observa una gran mejora en la clasificación del fallo en el caudal de la depuradora (qwwtp), aunque la clasificación del fallo n4 es de peor calidad. Sin embargo, con este modelo se consigue clasificar todos los fallos en al menos un 50%, lo cual supone una característica diferencial con el modelo anterior. FALLO PORCENTAJE CLASIFICACIÓN (%) q8 100,0000 n4 50,5439 n5 78,5003 q7 100,0000 qwwtp 57,5793
99 En la validación con datos de entrada a la red correspondientes a dos fallos distintos, los resultados siguen siendo positivos (Figura 64 y 65). A continuación se muestran algunos ejemplos gráficos y la tabla de resultados. Figura 64. Validación del fallo en la pareja de fallos q8 y qwwtp con el modelo multicapa. Figura 65. Validación del fallo en la pareja de fallos n5 y q7 con el modelo multicapa.
100 Figura 66. Resumen de resultados para parejas de datos con modelo multicapa. Los porcentajes mayores del 50%, al igual que antes, se deben a los datos mal clasificados en fallos que son perfectamente clasificados, por lo que el porcentaje que debería ser 50 sube ligeramente. Vuelve a ser alto el porcentaje de datos mal clasificados en aquellas parejas donde interviene el fallo qwwtp, pero la clasificación de este fallo es superior al 25% en todas las situaciones. Es decir, más de la mitad de los datos correspondientes a ese fallo son clasificados correctamente. La suma de los 3 porcentajes de cada situación no suma 100% debido a que hay algunos datos que no son clasificados en ninguno de los 5 fallos. Para finalizar con la validación, se introduce como entrada en la red los datos de los 5 fallos con aumento de magnitud. Los resultados pueden verse en la matriz de confusión mostrada en la Figura 67. El porcentaje de clasificación global es del 77,8%. A pesar de que consigue diagnosticar el fallo en qwwtp, este porcentaje únicamente sufre un aumento del 5% respecto del modelo q8 (%) n4 (%) OTRO (%) q8 + n4 52,0713 25,2719 18,7457 q8 (%) n5 (%) OTRO (%) q8 + n5 50,7406 39,2502 7,6140 q8 (%) q7 (%) OTRO (%) q8 + q7 50,0000 50,0000 0,0000 q8 (%) qwwtp (%) OTRO (%) q8 + qwwtp 62,4508 28,7896 7,0933 n4 (%) n5 (%) OTRO (%) n4 + n5 26,0472 52,4300 15,2164 n4 (%) q7 (%) OTRO (%) n4 + q7 25,2719 54,6286 16,1884 n4 (%) qwwtp (%) OTRO (%) n4 + qwwtp 31,2659 29,7269 33,4298 n5 (%) q7 (%) OTRO (%) n5 + q7 39,2502 56,8387 1,5159 n5 (%) qwwtp (%) OTRO (%) n5 + qwwtp 39,9097 28,7896 27,2328 q7 (%) qwwtp (%) OTRO (%) q7 + qwwtp 50,4397 28,7896 19,1044
101 anterior. Esto se debe a que clasifica algo peor los fallos en los niveles (n4 y n5), pero es un modelo más completo puesto que consigue clasificar al menos un 50% de los datos de cada uno de los fallos. Figura 67. Matriz de confusión para la clasificación de 5 fallos simultáneos con el modelo multicapa. 4.3.3. MODELO DE ARBOLES DE DECISIÓN El tercer y último modelo que se realizado para la clasificación de los fallos en una planta industrial está basado en árboles de decisión. Al igual que sucedía con los modelos basados en redes neuronales, en este modelo también existe una etapa de entrenamiento y otra de comprobación o validación del modelo. En primer lugar, se crea una matriz X=[𝑋𝑓1 𝑋𝑓2 𝑋𝑓3 𝑋𝑓4 𝑋𝑓5], idéntica a la creada en los anteriores modelos de clasificación de fallos. A continuación, se crea un vector Y con 21605 elementos, mismo número de elementos que filas tiene la matriz X. Estos elementos son categóricos en vez de numéricos, y representan cada una de las cinco clases de fallos a clasificar. Puesto que existen cinco
102 clases distintas, los 4321 primeros elementos son de clase 1, del 4322 al 8642 son de clase 2, del 8643 al 12963 son de clase 3, del 12964 al 17284 son de clase 4, y del 17285 al 21605 son de clase 5. Con las matrices X e Y, se entrena un conjunto de árboles de decisión o bosque, especificando el número de árboles que lo forman. Figura 68. Estructura de un árbol ensamblado en el bosque. El entrenamiento se ha realizado para distinto número de árboles, con el objetivo de encontrar un entrenamiento óptimo del bosque. La matriz de confusión que representa la calidad del entrenamiento no varía para el número de árboles, pero el tamaño del bosque si influirá en la validación.
103 Figura 69. Matriz de confusión del entrenamiento del bosque con 200 árboles. Primero se llevará a cabo la validación para un tamaño de bosque de 200 árboles. En la validación se incluyen los 5 fallos con aumento de magnitud de forma simultánea para poder obtener resultados a partir de la matriz de confusión (Figura 70). El porcentaje global de datos clasificados es del 63,4%. Es un valor inferior comparado con los resultados obtenidos con el resto de modelos. Sin embargo, variando el número de árboles que componen el bosque, este resultado puede cambiar.
104 Figura 70. Matriz de confusión para bosque de 200 árboles. Si aumentamos el tamaño del bosque a 600 árboles, el porcentaje global de datos clasificados es de 64%. Con un bosque 3 veces más grande únicamente se ha conseguido un aumento del 0,7%. Figura 71. Matriz de confusión para bosque de 600 árboles. Por último, se ha aumentado el número de árboles en el entramiento, duplicando el bosque anterior. Con 1200 árboles el porcentaje global de datos
105 clasificados es de 65,7%. La clasificación mejora suavemente con aumentos grandes del tamaño del bosque, lo que significa que el esfuerzo computacional aumenta drásticamente para mejoras en la clasificación pequeñas. Figura 72. Matriz de confusión para bosque de 1200 árboles. El hecho de que el porcentaje a penas aumente se debe a que ninguno de los 3 bosques validados consigue clasificar el fallo en qwwtp, por lo que el porcentaje máximo que puede alcanzar es del 80%. Queda demostrado que un aumento en el número de árboles no alcanza a conseguir clasificar el fallo en el caudal de la depuradora, pues el porcentaje de clasificación es del 0%. Por lo tanto, no se puede considerar una mejora de ninguno de los dos modelos anteriores.
112
113 REFERENCIAS [1] Gestión de producción y operaciones: ejemplos, sistema y etapas. (s. f.). www.beetrack.com. Recuperado 1 de junio de 2022, de https://www.beetrack.com/es/blog/gestion-de-produccion-y- operaciones [2] CARBONERAS CHECA, M. A. & BESTRATÉN BELLOVÍ, M. Integración de sistemas de gestión: prevención de riesgos laborales, calidad y MA. Ministerio de Trabajo y Asuntos Sociales, España, 2008. [3] AENOR (2009). Sistemas de gestión de la calidad. Requisitos. UNE-EN ISO 9001:2015 Madrid: AENOR. [4] GONZÁLEZ VELÁZQUEZ, M. (2020). Mejora en la calidad de un proceso mediante la detección de anomalías basadas en datos. Trabajo Fin de Grado. EII, Universidad de Valladolid. [5] PRAT BARTÉS, A., TORT-MARTONELL LLABRÉS, X. & GRIMA CINTAS, P. (2000). Métodos estadísticos. Control y mejora de la calidad. Barcelona: Universidad Politécnica Catalunya. [6] CARRO PAZ, R. & GONZÁLEZ GÓMEZ, D. (2012). Control Estadístico de Procesos. Buenos Aires: Universidad Nacional de Mar de la Plata. [7] L. (2021, 19 agosto). Los graficos de control de Shewhart: principios basicos. LeanSherpa. Recuperado 9 de junio de 2022, de https://leansherpa.es/los-graficos-control-shewhart-principios-basicos/ [8] GOMEZ, A., & VILLOLDO, A. G. (s. f.). Diagrama o gráfico de control: herramienta control de procesos. Manual de gestión de calidad paso a paso. Recuperado 9 de junio de 2022, de http://asesordecalidad.blogspot.com/2017/07/diagrama-o-grafico-de- control.html#.YqG25hrP1D8
114 [9] CUEVAS DÍAZ, A. (2012). Aplicación de la técnica de componentes principales en el análisis del comportamiento mecánico dinámico funcional de las turbinas a vapor de 100MW. Marianao, Cuba: Instituto Superior Politécnico José Antonio Echeverría. [10] D. GARCIA-ÁLVAREZ & M. FUENTE. Análisis Comparativo de Técnicas de Detección de Fallos utilizando PCA. Revista Iberoamericana de Automática e Informática Industrial RIAI, vol. 8, pp. 182-195, 2011. [11] KELLEHER, J. D. (2019). Deep learning. MIT press. [12] ABELIUK, A., & GUTIÉRREZ, C. (2021). Historia y evolución de la inteligencia artificial. Revista Bits de Ciencia, (21), 14-21. [13] ARISTIZÁBAL, M. C. (2006). Evaluación asimétrica de una red neuronal artificial: aplicación al caso de la inflación en Colombia. Lecturas de Economía, (65), 75-116. [14] X. (2022, 6 febrero). Redes Neuronales en Metatrader II. X-Trader.net - Trading en Estado Puro. Recuperado 15 de junio de 2022, de https://www.x-trader.net/redes-neuronales-en-metatrader-ii/ [15] LÓPEZ FLÓREZ, R. & FERNÁNDEZ FERNÁNDEZ, J. M. (2008). Las redes neuronales artificiales. Fundamentos teóricos y aplicaciones prácticas. La Coruña, España: Gesbiblo, S. L. [16] KIM KIM, J. H. (2018). Aplicación de técnicas de aprendizaje no supervisado al modelado de ciclos cinemáticos urbanos. Proyecto fin de Grado, E.T.S.I. Industriales, Universidad Politécnica de Madrid. [17] PEQUEÑO ALONSO, A. (2020). Mejora del control de calidad de un proceso mediante técnicas de aprendizaje automático. Trabajo Fin de Grado. Valladolid: Universidad de Valladolid [18] SKANSI, S. (2018). Introduction to Deep Learning: from logical calculus to artificial intelligence. Springer.
115 [19] BERLANGA, V., RUBIO HURTADO, M. J., & VILÀ BAÑOS, R. (2013). Cómo aplicar árboles de decisión en SPSS. REIRE. Revista d'Innovació i Recerca en Educació, 2013, vol. 6, num. 1, p. 65-79. [20] MARTÍNEZ, R. E. B., RAMÍREZ, N. C., MESA, H. G. A., SUÁREZ, I. R., TREJO, M. D. C. G., LEÓN, P. P., & MORALES, S. L. B. (2009). Árboles de decisión como herramienta en el diagnóstico médico. Revista médica de la Universidad Veracruzana, 9(2), 19-24. [22] SAAGI, R., FLORES ALSINA, X., FU, G., BUTLER, D., GERNAEY, K. V., & JEPPSSON, U. (2016). Catchment & sewer network simulation model to benchmark control strategies within urban wastewater systems. Environmental Modelling & Software, 78, 16-30. https://doi.org/10.1016/j.envsoft.2015.12.013 [21] CEMBELLÍN, A., FRANCISCO, M., & VEGA, P. (2020). Distributed Model Predictive Control Applied to a Sewer System. Processes, 8(12), 1595. https://doi.org/10.3390/pr8121595