Detección de defectos en tiempo real en una línea de fabricación de tableros mediante técnicas de reconocimiento de patrones
Abstract
Grado en Ingeniería Informática
Full text
Detecci´on de defectos en tiempo real en una l´ınea de fabricaci´on de tableros mediante t´ecnicas de reconocimiento de patrones Trabajo de Fin de Grado Grado de Ingenier´ıa Inform´atica Menci´on Computaci´on Universidad de Valladolid Autor: Alejandro Rodr´ıguez Collado Tutores: MaAr´anzazu Sim´on Hurtado y Carlos Enrique Vivaracho Pascual
TFG: Grado de Ingenier´ıa Inform´atica Resumen Las t´ecnicas de an´alisis de datos han ido introduci´endose en el mundo de la factor´ıas dando lugar a la Industria 4.0. En el caso del grupo Sonae Arauco diversos dispositivos les han permitido ser galardonados con premios por innovaci´on tecnol´ogica. Uno de sus sistemas es el “Smart Eyes”, un sistema de detecci´on de imperfecciones en los tableros producidos con filtros de im´agenes. Este proyecto tiene como objetivo crear un sistema de detecci´on de estas imperfecciones empleando t´ecnicas de an´alisis de datos y aprendizaje autom´atico. Este proyecto es un Trabajo de Fin de Grado del Programa de Estudio Conjuntos INDat - Ingenier´ıa Inform´atica + Estad´ıstica. Por lo tanto constar´a de dos memorias, una por grado. Esta es la memor´ıa de Ingenier´ıa Inform´atica, y consta de las siguientes partes. Una primera parte describir´a el problema en su conjunto as´ı como los datos obtenidos por parte de la empresa para estudiar el problema. Esta informaci´on estar´a acompa˜nada de una descripci´on de los antecedentes al desarrollo de este proyecto. En la segunda parte del proyecto se explicar´an los procedimientos de tratamiento de im´agenes empleados en la actualidad por la empresa as´ı como nuestro algoritmo propio para el filtrado. La tercera parte consistir´a en el empleo de distintos tipos de clasificadores, principalmente regresi´on log´ıstica, redes neuronales y Support Vector Machines. Esta parte aparecer´a desarrollada de forma exclusiva en la memoria del grado en Ingenier´ıa Inform´atica y tendr´a su contra-parte en la memoria del TFG de Estad´ıstica sobre el uso de clasificadores relacionados con an´alisis discriminante y ´arboles de decisi´on. La cuarta parte analizar´a los resultados obtenidos con cada uno de los clasificadores en esta memoria. De esta forma, podremos conocer qu´e metodolog´ıa ha dado lugar a resultados mejores. El rendimiento de cada clasificador aparecer´a reflejado en la memoria en la cual se haya explicado previamente el funcionamiento del clasificador. Un ep´ılogo servir´a para exponer las conclusiones sacadas relacionadas con la consecuci´on de los objetivos marcados as´ı como para desglosar el posible trabajo futuro a realizar. 2
TFG: Grado de Ingenier´ıa Inform´atica Abstract The data analysis techniques have been gradually introduced in the world of factories, giving birth to the 4.0 Industry. Sonae Arauco has developed various devices that have allowed them to be multiple times awarded thanks to his technical innovation. They developed “Smart Eyes”, an imperfection-detecting system to be used in their board production line that works using filtering. The goal of this project is to create an imperfection-detecting system that uses data analysis techniques and Machine Learning. This End-of-Degree Project is of a double degree (INDat – double degree in Computer Engineering and Statistics), so it consists of two memories, one per degree. This is the memory corresponding to Computer Engineer degree and it consists of several parts. The first part will describe the general state of the problem as well as the data provided by the company. This information will be accompanied by a description of the antecedents of the Project. In the second part of the Project the image treatment procedures will be explained: both the system currently working in Tradema as well as our own algorithm to filter the images. The third part will describe different classifiers as well as its results. The classifiers appearing in this part will be related to logistic regression, neural networks and support vector machines. In the Statistics End-of-Degree Project memory, you can find classifiers related to discriminant analysis and decision trees. The fourth part will analize the obtained results of each classifier. This will allow us to know what has been the method that has obtained the best results. The performance of each classifier will be written on the memory that has previously explained the theory behind the classifier. The epilogue will serve to explain the observed conclusions related to the achivement of proposed goals as well as break down the possible future work. 3
TFG: Grado de Ingenier´ıa Inform´atica Agradecimientos Todo el trabajo y dedicaci´on que han hecho falta para el desarrollo de este proyecto son fruto del apoyo continuo de personas que han permanecido a mi lado desde el comienzo del mismo. En primer lugar, querr´ıa agradecer la ayuda continua, atenta, sensata y paciente de mis tutores Arancha, Carlos y Miguel. No hubiera sido posible finalizar este trabajo sin vuestra gu´ıa y apoyo que, por otro lado, me ha brindado la oportunidad de aprender enormemente de vuestro profundo conocimiento en las materias que hemos tratado. Muchas gracias a mis padres, Bel´en y Jos´e, por vuestro cari˜no y ayuda en el recorrido que ha sido el desarrollo del proyecto. Porque s´e que, a´un no entendiendo en profundidad los detalles de mi TFG, os lo hab´eis le´ıdo y ojeado en m´as de una ocasi´on. Querr´ıa agradecer tambi´en el apoyo que me ha dado Alfon. Buena compa˜n´ıa ha sido el mejor remedio a tantos momentos en los que, al dejar de trabajar en el proyecto, me desazonaba al pensar en la larga lista de quehaceres. Por ´ultimo y no por ello menos importante me gustar´ıa dar las gracias a mi hermana Luc´ıa, abuelo Jes´us y abuela Julia y a mis amigos, especialmente a los miembros de Teatro Horizon. Todos me hab´eis ayudado de alguna forma en estos meses de trabajo. 4
´ Indice general 1. Introducci´on 7 1.1. Descripci´ondelproyecto........................................... 7 1.2. Objetivosdelproyecto............................................ 8 1.2.1. Objetivos espec´ıficos del Trabajo de Fin de Grado de Ingenier´ıa Inform´atica . . . . . . . . . . 8 1.3. Estructuradelamemoria .......................................... 9 2. Planificaci´on temporal 11 2.1. Lista inicial de tareas del proyecto . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 2.2. Planificaci´on inicial del proyecto . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13 2.3. Estructura temporal seguida en el proyecto . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 3. Antecedentes 19 3.1. Pr´acticasenempresa............................................. 19 3.2. Reuniones previas al desarrollo del TFG . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19 4. Descripci´on de los datos 21 4.1. Glosariodedefectos ............................................. 21 4.1.1. Defectosnegros............................................ 21 4.1.2. Defectosblancos ........................................... 22 4.1.3. DefectosTopogr´aficos ........................................ 22 4.2. Corpusdeim´agenes ............................................. 24 4.2.1. Corpus I: Im´agenes “defectuosas” . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25 4.2.2. Corpus II: Im´agenes “sin defectos” . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28 4.3. Im´agenes de falsos negativos de “Smart Eyes” . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29 5. Tratamiento de las im´agenes 31 5.1. Sistema“SmartEyes” ............................................ 31 5.1.1. Extracci´on de zona de inter´es . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 5.1.2. Tratamientodelaimagen ...................................... 32 5.2. Nuestrapropuesta .............................................. 33 5.2.1. Extracci´on de zona de inter´es . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33 5.2.2. Tratamientodelaimagen ...................................... 33 5.2.3. Optimizaci´ondelfiltrado ...................................... 34 6. Extracci´on de caracter´ısticas 37 6.1. Variablesextra´ıdas.............................................. 37 6.1.1. ´ Areas de error relativo en negro y blanco . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37 6.1.2. Caracterizaciones de las distribuciones de grises . . . . . . . . . . . . . . . . . . . . . . . . . . 38 6.1.3. Transformada Discreta del Coseno (DCT) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39 6.2. Conjuntos de variables consideradas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40 5
TFG: Grado de Ingenier´ıa Inform´atica ´ INDICE GENERAL 7. Metodolog´ıa 43 7.0.1. Definicionesprevias ......................................... 43 7.1. Sistemadereferencia............................................. 47 7.2. Regresi´onLog´ıstica.............................................. 47 7.3. SupportVectorMachine(SVM)....................................... 50 7.3.1. N´ucleolineal ............................................. 52 7.3.2. N´ucleopolin´omico .......................................... 53 7.3.3. N´ucleodebaseradial ........................................ 53 7.4. Redes Neuronales (Neural Networks) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55 7.4.1. Perceptr´onmulticapa ........................................ 56 8. Resultados 61 8.1. Sistema“SmartEyes” ............................................ 61 8.2. Sistemadereferencia............................................. 63 8.2.1. CorpusI................................................ 64 8.2.2. CorpusII ............................................... 66 8.3. Regresi´onLog´ıstica.............................................. 68 8.4. SupportVectorMachine........................................... 73 8.4.1. N´ucleoLineal............................................. 74 8.4.2. N´ucleopolin´omico .......................................... 76 8.4.3. N´ucleo de base radial (RBF) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 80 8.5. RedesNeuronales............................................... 86 8.5.1. Perceptr´on Multicapa (MLP) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 86 9. Discusi´on general de resultados 95 9.1. Comparativa de los modelos seg´un AUC y EER . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 95 9.2. Comparativa de los modelos seg´un precisi´on, especificidad y sensibilidad . . . . . . . . . . . . . . . . 100 9.3. Discusi´onsobremodelos...........................................102 9.3.1. CorpusI................................................102 9.3.2. CorpusII ...............................................105 9.4. Discusi´on de relevancia de las variables . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107 9.4.1. Variables relativas al filtrado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107 9.4.2. Caracterizaciones de la distribuci´on de grises . . . . . . . . . . . . . . . . . . . . . . . . . . . 107 9.4.3. Componentes extra´ıdas de la DCT . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 108 9.5. Conclusiones .................................................109 10.Conclusiones y trabajo futuro 111 10.1. Relaci´on con los contenidos del grado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 111 10.2.Objetivosalcanzados.............................................111 10.3.TrabajoFuturo................................................112 Bibliograf´ıa 115 6
Cap´ıtulo 1 Introducci´on 1.1. Descripci´on del proyecto Sonae Arauco (Figura 1.1) es una empresa internacional de comercializaci´on de tablero de fibra de densidad media. Producen tableros que son usados para todo tipo de utilidades, desde los tableros que conforman los muebles producidos por empresas como IKEA hasta aquellos que son empleados como protecci´on en el transporte de productos. La empresa, adem´as, fue de las primeras que hizo una incursi´on muy temprana a la industria 4.0 con sistemas inteligentes y autorregulados. Figura 1.1: Logo de la empresa. Cuentan con unidades de producci´on esparcidas por Espa˜na, Portugal, Alemania y Sud´africa que les permiten abastecer a clientes a lo largo de la geograf´ıa europea y africana, tal y como podemos observar en la Figura 1.2. A mayores, una planta en Canad´a provee de tableros a los consumidores norteamericanos y sudamericanos [1]. La planta de producci´on Tradema de Valladolid, antigua planta de Tafisa, es una de las pioneras en la implantaci´on de la industria inteligente dentro de Sonae Arauco. Adaptar su proceso de producci´on en tiempo real a los resultados de los an´alisis de datos de los parametros de fabricaci´on les ha permitido ser galardonados en varias ocasiones con distinciones como el “Premio mejor iniciativa empresarial Big Data de Espa˜na” de Telef´onica y Synergic Partners en el a˜no 2016 [2]. Figura 1.2: L´ıneas de producci´on del grupo. 7
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 1. INTRODUCCI´ ON Este proyecto surge como evoluci´on natural a las pr´acticas de empresa que desarroll´e all´ı. Aprovechando el conocimiento adquirido me pareci´o interesante intentar crear una evoluci´on pareja a su desarrollo de sistemas inteligentes para su sistema “Smart Eyes”. “Smart Eyes” se trata de una herramienta de control de calidad de las imperfecciones superficiales de los tableros creada en el a˜no 2014 por la empresa ISDN Group. Se basa en la aplicaci´on de filtros a las im´agenes captadas por unas c´amaras situadas en la l´ınea de producci´on. El sistema funciona bien, aunque admiten que har´ıa falta dedicar cierto tiempo a refinarlo. Sigue siendo necesario que un operario revise los tableros y el sistema a veces capta demasiados tableros en buen estado como defectuosos. En este sentido, tambi´en es relevante comentar que no se ha realizado un estudio objetivo del rendimiento de este sistema, por lo tanto, no se conoce su fiabilidad real. El objetivo de este proyecto es dise˜nar un sistema de detecci´on de defectos en los tableros siguiendo la filosof´ıa m´as reciente en tableros Tradema: el uso del aprendizaje autom´atico y el an´alisis de datos. Es, por lo tanto, una excelente ocasi´on para crear un proyecto que a´une lo aprendido a lo largo del doble grado as´ı como conocimientos adquiridos a lo largo del periodo de pr´acticas en empresa. Este trabajo constar´a de dos memorias, una correspondiente al Trabajo de Fin de Grado de Ingenier´ıa Inform´atica y otra del grado de Estad´ıstica [3]. Para una comprensi´on clara y completa del proyecto, es necesaria la lectura de ambos textos. 1.2. Objetivos del proyecto El objetivo general del proyecto es crear un sistema de detecci´on de defectos superficiales en los tableros con las im´agenes obtenidas por las c´amaras de la l´ınea de producci´on de Tradema aplicando t´ecnicas de tratamien- to de im´agenes, an´alisis de datos y Machine Learning. Se trabajar´a con dos Corpus de im´agenes de diferentes caracter´ısticas de los que se extraer´an dos juegos diferentes de variables que servir´an de entrada a los clasificadores. 1.2.1. Objetivos espec´ıficos del Trabajo de Fin de Grado de Ingenier´ıa Inform´atica Obtener un corpus o base de datos de im´agenes adecuada para el trabajo a realizar. Realizaci´on de un planificaci´on temporal aproximada del desarrollo del proyecto. Clasificar, mediante visualizaci´on, los datos obtenidos seg´un las diferentes clases a reconocer. Analizar y depurar los datos obtenidos. Analizar el funcionamiento y rendimiento del sistema actualmente empleado por la empresa (“Smart Eyes”). Realizar un preprocesamiento de las im´agenes (filtrado) de manera que se resalten los fallos a detectar. Extraer caracter´ısticas de la imagen procesada para ser usadas como entrada a los clasificadores. Emplear an´alisis supervisado para clasificar la imagen, usando procedimientos como: •Regresi´on log´ıstica. •Support Vector Machines. •Redes Neuronales. An´alisis posterior y extracci´on de conclusiones relevantes en base a la discusi´on general de los modelos de an´alisis supervisado. 8
CAP´ ITULO 1. INTRODUCCI´ ON TFG: Grado de Ingenier´ıa Inform´atica 1.3. Estructura de la memoria Los documentos que recogen el desarrollo del proyecto son dos memorias, una correspondiente a la parte de Trabajo de Fin de Grado de Ingenier´ıa Inform´atica y otra correspondiente al Grado en Estad´ıstica [3]. La Tabla 1.1 muestra cada uno de los cap´ıtulos de las memoria de Trabajo de Fin de Grado de ingenier´ıa inform´atica. Para la comprensi´on completa del desarrollo del proyecto ser´a necesario la lectura de las partes comunes de esta memoria as´ı como los cap´ıtulos de metodolog´ıa, resultados, discusi´on de resultados y conclusiones exclusivos de la memoria de estad´ıstica. Memoria Ingenier´ıa Inform´atica Introducci´on El presente cap´ıtulo sirve de preludio a la memoria del proyecto. Detalla objetivos y estructura. Planificaci´on temporal Tareas a desarrollar en el proyecto y planificaci´on temporal de estas inicial y seguida. Antecedentes En esta primera parte aparece sintetizada toda la obtenci´on de informaci´on y recursos previa al comienzo pr´actico del proyecto. Descripci´on de los datos An´alisis de las caracter´ısticas de las im´agenes entregadas por parte de la empresa. En este cap´ıtulo tambi´en se ha desarrollado un glosario de defectos presentes en las im´agenes entregadas. Tratamiento de las im´agenes Estudio del sistema de filtrado en funcionamiento en la empresa as´ı como desarrollo de una propuesta propia m´as ligera para el filtrado de im´agenes. Extracci´on de caracter´ısticas Descripci´on de las variables a extraer de las im´agenes en bruto y filtradas que servir´an para conformar la entrada de los clasificadores. Metodolog´ıa Desarrollo de los clasificadores usados para la discriminaci´on de im´agenes con defectos con respecto a las que carecen de ellos. En esta memoria se han creado modelos de regresi´on log´ıstica, de Support Vector Machine y redes neuronales. Resultados Resultados obtenidos a partir de los modelos desarrollados en el cap´ıtulo de metodolog´ıa de la memoria de Ingenier´ıa Inform´atica. Discusi´on general de resultados Discusi´on global de los resultados obtenidos en ambas memorias relativa metodolog´ıas, variables, modelo ´optimo,... Conclusiones y trabajo futuro Exposici´on de las conclusiones extra´ıdas a partir de los resultados as´ı como el desarrollo de posibles l´ıneas de trabajo futuras. Bibliograf´ıa Tabla 1.1: Estructura general del proyecto dividida seg´un el contenido que aparece en la memoria de ingenier´ıa inform´atica. 9
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 2. PLANIFICACI´ ON TEMPORAL Figura 2.4: Tabla que especifica la planificaci´on seguida en el proyecto. Tal y como se puede observar, existen diversas variaciones sobre la planificaci´on inicial del proyecto. Las principales fueron: Se han a˜nadido las siguientes tareas: La obtenci´on tard´ıa del Corpus II supuso un retraso generalizado en las tareas del proyecto. Inicialmente se obtuvo una semana despu´es de lo planificado. La observaci´on detenida de las im´agenes puso en evidencia diversos problemas relacionados con la captaci´on de estas. Por ello fue preciso solicitar a la empresa implicada que grabase un nuevo juego de im´agenes. Esto supuso retrasar la mayor´ıa de hitos a cumplir desde el mes de febrero. El retraso en la entrega del Corpus II ocasiono que las siguientes tareas se tuviesen que desglosar en dos subtareas al no haberse podido realizar estas simult´aneamente para el Corpus I y II. Las siguientes tareas se 16
CAP´ ITULO 2. PLANIFICACI´ ON TEMPORAL TFG: Grado de Ingenier´ıa Inform´atica Tareas a˜nadidas ID Tarea Horas Descripci´on XIX. Corpus I: ´ Arboles de decisi´on III 30 El desarrollo de un trabajo relacionado con la asignatura ‘M´etodos Estad´ısticos de Computaci´on Intensiva’ permiti´o el desarrollo de un tipo de Boosting con naturaleza bayesiana de ´arboles de decisi´on: los Bayesian Additive Regression Trees (BART). Aplicaci´on sobre Corpus I. XX. Cambio de Formato de los resultados 20 Una vez obtenidos los resultados provisionales de diversos procedimientos, se opto por incluir nuevos resultados en las memorias para que la comparativa desde m´as criterios se pudiese realizar. XXI. Corpus II: ´ Arboles de decisi´on III 30 Desarrollo de los BART con los datos obtenidos a partir del Corpus II tuvieron que subdividir en dos, una relacionada con el Corpus I y otra con el Corpus II: •IV. An´alisis de datos del Corpus I y II •V. Sistema de referencia •X. Optimizaci´on del filtrado •XI. Extracci´on de caracter´ısticas . Variaciones con respecto al tiempo estimado: •II. Corpus I: etiquetado (55 horas en vez de 40). El etiquetado manual supuso m´as tiempo debido a la dificultad existente en la clasificaci´on de alguna de las im´agenes. •IV. An´alisis de datos del Corpus I y II (30 horas en vez de 15). Se debe principalmente a la necesidad de haber analizado por separado el Corpus I y II y a la abstracta interpretabilidad de las caracter´ısticas extra´ıdas. •Sistema de referencia (15 horas en vez de 5). Una etapa de recuerdo del manejo de Python combinada con la necesidad de establecer dos sistemas de referencia (uno por Corpus) hizo que esta tarea requiriese m´as tiempo. •VIII. Actualizaci´on y revisi´on de los documentos II (40 horas en vez de 20). El aumento de horas se debi´o principalmente a una mayor cantidad de contenido a modificar. •IX. Procesamiento de im´agenes (35 horas en vez de 40). La primera puesta en contacto con las funciones de Matlab de filtrado de im´agenes fue m´as sencilla de lo esperado. •X. Optimizaci´on del filtrado (15 horas en vez de 10) y XI. Extracci´on de caracter´ısticas (20 horas en vez de 15), debido a la necesidad de optimizar y estudiar las caracter´ısticas por separado en el Corpus I y II. La tarea XV. Redes Neuronales II se ha suprimido por falta de tiempo. 17
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 2. PLANIFICACI´ ON TEMPORAL 18
Cap´ıtulo 3 Antecedentes Previo al desarrollo del proyecto, cabe destacar dos periodos claves en cuanto a recopilaci´on de informaci´on para el posterior desarrollo del mismo. 3.1. Pr´acticas en empresa Desarroll´e mis pr´acticas curriculares en empresa a lo largo del primer semestre del a˜no 2017. Me sirvi´o para conocer el entorno laboral de Tradema as´ı como diversas t´ecnicas que emplean en sus sistemas de captaci´on de medidas en tiempo real a lo largo de la l´ınea de producci´on. Estos datos, combinados con otros que obtienen del estudio emp´ırico de los tableros, les permiten crear diversos sistemas inteligentes que predicen y controlan otras variables significativas en el proceso de producci´on. Las pr´acticas me permitieron profundizar y desarrollar mis conocimientos sobre metodolog´ıas como el an´alisis de componentes principales o el k-vecinos m´as pr´oximos. Adem´as pude usar redes neuronales de diversa ´ındole que me posibilitaron familiarizarme con sus conceptos y metodolog´ıas. El equipo relacionado con el Machine Learning de la empresa estaba constantemente desbordado con trabajo: hab´ıa que desarrollar software concreto para adecuarse a las necesidades que iban surgiendo en la empresa. Este proceso de creaci´on constante no les permite, en general, tener tiempo para refinar sistemas que ya funcionan relativamente bien en la empresa. Conoc´ı entonces el sistema “Smart Eyes”, el cual llevaba en funcionamiento desde el a˜no 2014. El equipo de an´alisis de datos hab´ıa intentado reservar parte de su tiempo para “actualizarlo” en base a conceptos de Machine Learning. Sin embargo, debido a la carencia de tiempo y a que el sistema con un enfoque de filtros simples funciona relativamente bien hizo que la actualizaci´on no se llegara a realizar. Cuando acab´e las pr´acticas, me ofrecieron como proyecto futuro la actualizaci´on del sistema evoluci´on de “Smart Eyes”. Fue as´ı como surgi´o el proyecto que aqu´ı presentamos. 3.2. Reuniones previas al desarrollo del TFG La metodolog´ıa empleada para la recogida de informaci´on previa al comienzo del proyecto fue la realizaci´on de diversas reuniones con los tutores as´ı como entrevistas con distintos empleados de la empresa. El d´ıa 16 de octubre visitamos las instalaciones de tableros Tradema. Conocimos de primera mano la l´ınea de producci´on as´ı como el sistema de control de calidad ya implementado en la f´abrica, “Smart Eyes”. Es un sistema que siempre est´a en funcionamiento en segundo plano. No hace un control de calidad exhaustivo del tablero (es siempre necesaria la labor de un operario para revisar que los pedidos est´en en buen estado) y, aunque parece que detecta muchas de las incidencias en los tableros, detecta tambi´en muchos en perfecto estado como defectuosos (falsos positivos). 19
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 3. ANTECEDENTES El n´umero de tableros que clasifica mal (tanto falsos positivos como falsos negativos) es en principio desconocido. Por lo tanto, se trata de un sistema en el que no existe ning´un tipo de medida de rendimiento; s´ı contamos con el n´umero de devoluciones por estar defectuoso el producto. La empresa est´a contenta con su funcionamiento y reconoce que existen mejoras del sistema que no se han aplicado o estudiado, principalmente por falta de tiempo. Tambi´en se mantuvieron varias conversaciones con ISND Group, empresa responsable de la creaci´on del Software de “Smart Eyes”. Nos comentaron que el sistema hace para las im´agenes por separado de cada c´amara dos filtrados independientes, uno para detectar los defectos “negros” y otro para los “blancos”(apartado 4.1). Tambi´en recorta puntos sin inter´es de la imagen y puntos ciegos de la c´amaras. Las im´agenes laterales se ajustan, adem´as, al tama˜no del tablero, informaci´on que proporciona el propio sistema de gesti´on de ´ordenes de producci´on de la f´abrica. Nos facilitaron tambi´en una lista de los algoritmos empleados por el sistema. 20
Cap´ıtulo 4 Descripci´on de los datos En este cap´ıtulo se describen los conjuntos de datos recibidos por parte de Tradema. 4.1. Glosario de defectos Se les ha dado una nomenclatura acorde a la clasificaci´on creada en el desarrollo del sistema “Smart Eyes” de la empresa. Existen tres tipos de defectos seg´un su apariencia: negros, blancos y topogr´aficos. 4.1.1. Defectos negros Estos defectos los denominamos as´ı por el color de su apariencia, que en general ser´a de un tono de gris muy oscuro o negro completamente. Estos defectos constituyen cerca del 85 % de los defectos que podremos encontrar en los tableros. En este tipo de defectos, la causa de la aparici´on de la mancha puede ser por diversos motivos: Aparici´on de una mancha circular o el´ıptica de tama˜no variable en la superficie del tablero, tal y como aparece en las Figuras 4.1 y 4.2. Suele deberse al derramamiento puntual de aceite de alguna de las m´aquinas o a resina que no ha sido previamente eliminada en el proceso de creaci´on de la astilla para el tablero. Suponen m´as del 90 % de los defectos negros presentes en las muestras empleadas para el estudio del sistema. Figura 4.1: Defecto negro de tama˜no peque˜no. Figura 4.2: Defecto negro grande. A veces las manchas oscuras van acompa˜nadas de una especie de estela o rastro. En estas im´agenes, aparecer´a un punto negro oscuro seguido de una raya gris´acea (Figura 4.3). Estos defectos se deber´an a la ceniza que sale despedida de la planta de energ´ıa de la f´abrica. Figura 4.3: Imagen de un defecto provocado por la ceniza. 21
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 4. DESCRIPCI´ ON DE LOS DATOS Aparici´on de dos figuras conc´entricas, una interior de color m´as oscuro y otra exterior alrededor m´as clara. De nuevo, suelen ocasionarse por el derramamiento de aceite. Un ejemplo aparece en la Figura 4.4. Figura 4.4: Imagen de un defecto con zonas m´as oscuras y m´as claras. 4.1.2. Defectos blancos Estos defectos son causados por la existencia de fibras en la superficie del tablero. Toman un color completamente blanco en las im´agenes. Son el defecto detectado algo por encima del 6 % de los tableros que aparecen en las muestras entregadas. Requieren de una buena iluminaci´on presente en la toma de im´agenes. S´olo en aquellas im´agenes donde la luz es homog´enea y adecuada se detectan con facilidad estos defectos. Al estudiar las muestras de im´agenes de los Corpus hemos observado c´omo en los laterales de las im´agenes (zonas m´as iluminadas de estas) aparecen la mayor´ıa de los defectos de este tipo. En las Figuras 4.5 y 4.6 aparecen ejemplos de este tipo de defecto. Figura 4.5: Fibra de tama˜no peque˜no. Figura 4.6: Fibra de tama˜no grande. 4.1.3. Defectos Topogr´aficos Denominaci´on asignada a los defectos debido a su naturaleza (con cierto contorno o relieve) que requieren de la aplicaci´on de dos filtrados distintos en b´usqueda de puntos m´as claros y m´as oscuros que el resto de la imagen. Son de naturaleza muy diversa, representando cerca del 9 % de las taras halladas en las im´agenes de las muestras. De acuerdo a su aspecto, podemos clasificar los defectos topogr´aficos en diversos tipos: 4.1.3.1. Hendiduras Presencia de golpes, mellas y surcos en la imagen de la superficie del tablero. Se suelen deber a fallos en el transporte del tablero en zonas previas a la zona de supervisi´on de c´amaras. Es un defecto grave en el tablero as´ı como uno de los defectos topogr´aficos m´as comunes. Existen surcos que debido a que con su relieve forman contornos m´as oscuros ser´an m´as f´acilmente detectados de forma m´as habitual por el filtrado en negros, como es el caso de la Figura 4.7. Otros, sin embargo, aparecen en la imagen con tonos m´as claros y su detecci´on depender´a m´as del filtrado de blancos. La Figura 4.8 es un ejemplo de esto. Figura 4.7: Defecto cuyo contorno es m´as oscuro. Figura 4.8: Defecto de contorno m´as claro. 22
CAP´ ITULO 4. DESCRIPCI´ ON DE LOS DATOS TFG: Grado de Ingenier´ıa Inform´atica 4.1.3.2. Grietas de separaci´on y de uni´on Brechas y fisuras aparecen en la superficie del tablero. Distinguimos dos tipos de grietas: Grietas de separaci´on: aquellas en las que el tablero se parte en dos trozos que se van separando. Son las m´as comunes y dependiendo de su amplitud y longitud pueden ser m´as o menos dif´ıciles de detectar. Tienen una morfolog´ıa variable, tal y como podemos ver las Figuras 4.9 y 4.10. Figura 4.9: Imagen de una grieta de separaci´on: resquebrajamiento simple. Figura 4.10: Imagen de una grieta de separaci´on amplia. Grietas de uni´on: aquellas en la que los dos trozos del tablero se van juntando progresivamente. Son menos comunes y presentan ciertas dificultades a la hora de ser detectadas. Un ejemplo de grieta de uni´on lo podemos observar en la Figura 4.11. Figura 4.11: Imagen de una grieta de uni´on. 4.1.3.3. Roturas Huecos generados en el tablero. Pueden ser o laterales, correspondientes a algun defecto en la terminaci´on del tablero en la c´amara derecha o izquierda (tal y como vemos en las Figuras 4.12 y 4.13) o longitudinales en el tablero (Figura 4.14). Figura 4.12: Imagen de una rotura en el lateral derecho del tablero. Figura 4.13: Imagen de una rotura en el lateral izquierdo del tablero. Figura 4.14: Imagen de una rotura longitudinal en el tablero. 23
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 4. DESCRIPCI´ ON DE LOS DATOS 4.1.3.4. Humedades Gotas de agua y surcos formados por humedades presentes en el tablero. Generan diversidad de problemas, como imposibilitar el cumplimiento de especificaciones t´ecnicas del hinchamiento del tablero. Las Figuras 4.15 y 4.16 son ejemplos de esto. Figura 4.15: Rastro de agua en la superficie del tablero. Figura 4.16: Gotas de agua en el tablero. 4.1.3.5. Bolsas de aire Contornos en el tablero rellenos de aire creados por error en el prensado de los tableros. Son defectos de alta dificultad a detectar, ya que el gradiente de grises de la imagen que refleja la existencia de relieve es de poca amplitud. Son defectos que requieren de nuevo de una buena iluminaci´on. En la Figura 4.17 podemos ver una bolsa de aire claramente por la diferencia de grises de la imagen. En la Figura 4.18 vemos una bolsa de aire de detecci´on mucho m´as compleja. Figura 4.17: Bolsa de aire acompa˜nada de una peque˜na grieta. Figura 4.18: Bolsa de aire cuya detecci´on es m´as compleja. 4.2. Corpus de im´agenes Llamamos corpus a un conjunto cerrado de datos empleados en una investigaci´on cient´ıfica. En nuestro caso, este se compondr´a de im´agenes procedentes de dos fuentes de im´agenes con distintas caracter´ısticas y con ciertas diferencias en su naturaleza. La disposici´on de clases conjunta presente en las im´agenes empleadas en el trabajo aparecen reflejadas en la Tabla 4.1: Conjunto de im´agenes empleado Corpus I Corpus II Total Sin defectos 709 3893 4602 Con defectos 6458 107 6565 Total 7167 4000 11167 Tabla 4.1: Distribuci´on de observaciones en el total de im´agenes empleadas. Los defectos observados podemos desglosarlos empleando la categorizaci´on descrita en el glosario de defectos (Secci´on 4.1) tal y como aparece en la Tabla 4.2: 24
CAP´ ITULO 4. DESCRIPCI´ ON DE LOS DATOS TFG: Grado de Ingenier´ıa Inform´atica Conjunto de im´agenes empleado Defecto Corpus I Corpus II Total Negro 5497 91 5588 Blanco 546 15 561 Topogr´afico: Bolsas de aire 41 0 41 Topogr´afico: Gotas de agua 17 0 17 Topogr´afico: Grietas de separaci´on 64 0 64 Topogr´afico: Grietas de uni´on 46 0 46 Topogr´afico: Hendiduras 94 1 95 Topogr´afico: Rotura horizontal 66 0 66 Topogr´afico: Rotura lateral 71 0 71 Topogr´afico: Surcos de Agua 55 0 55 Total 6458 107 6565 Tabla 4.2: Distribuci´on de los defectos en el conjunto total de im´agenes. La fila de totales no es como tal la suma del n´umero de observaciones de cada tipo de defectos, ya que en ciertas im´agenes est´an presentes m´as de un tipo de defecto. A lo largo de las dos siguientes sub-secciones se describe la naturaleza de los dos corpus, detallando su obtenci´on, composici´on, etc. 4.2.1. Corpus I: Im´agenes “defectuosas” Este corpus, recibido el 23 de noviembre del 2017, consta de 8754 im´agenes que el sistema en funcionamiento de la empresa ha etiquetado como pertenecientes a tableros con defectos. Despu´es de la eliminaci´on de im´agenes cuyo grabado ha sido incorrecto, el conjunto de im´agenes se reducir´a a 7167 im´agenes. Las im´agenes recibidas corresponden a distintos periodos de grabado en los que se han mantenido constantes los par´ametros de la toma de datos, aunque no corresponden los datos a ning´un marco de muestreo pre-planteado. Cada imagen pertenece a una de las cuatro c´amaras que graban el proceso de producci´on, pero no conocemos a qu´e c´amara pertenece cada imagen. Todas las im´agenes tienen la misma altura (144 p´ıxeles) y una anchura variable. La anchura variable se debe al proceso de pre-tratamiento de las im´agenes. Cada imagen se ha recibido como una dupla, de tal modo que tenemos: 1. Imagen ‘original’: no se han aplicado a´un los filtros del sistema “Smart Eyes”. Tiene un ligero pre-tratamiento en el que se eliminan las zonas correspondientes a los puntos ciegos y a las zonas sin tableros. En la Figura 4.19 se puede ver un ejemplo. 2. Imagen procesada: Imagen filtrada por el sistema. La figura 4.20 es el resultado del filtrado de la imagen correspondiente a la Figura 4.19. El proceso de filtrado de las im´agenes se encuentra detallado en el apartado del sistema de “Smart Eyes” (Secci´on 5.1)). Figura 4.19: Ejemplo de imagen ‘original’ del Corpus I. Figura 4.20: Ejemplo de imagen ‘procesada’ del Corpus I. 25
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 5. TRATAMIENTO DE LAS IM´ AGENES Como ya se ha comentado, es un sistema del que no se tiene una medida del rendimiento, ya que no se conoce el porcentaje de falsos negativos. De hecho, la detecci´on de muchos falsos positivos hace que la decisi´on final de desechar un tablero sea siempre manual, es decir, el sistema avisa de un posible defecto, pero es un operario el que, tras visionar el tablero, decide si se retira o no. La empresa est´a contenta con su funcionamiento, aunque reconoce que el sistema se puede mejorar. 5.1.1. Extracci´on de zona de inter´es Previamente a lo que ser´ıa en s´ı el tratamiento de la imagen, se eliminan los tramos sin tablero (cinta de transporte) y los puntos ciegos de las c´amaras. Lo primero es posible gracias a que el software de planificaci´on de la empresa provee la anchura de los tableros de cada orden de producci´on. Esto les permite calcular qu´e regi´on de las im´agenes captadas por las dos c´amaras laterales no es ´util. La eliminaci´on de los puntos ciegos se debe a que las c´amaras graban im´agenes con cierto solapamiento: podremos eliminar tramos que una c´amara no graba con suficiente resoluci´on con la garant´ıa de que la contigua lo grabar´a mejor. La retirada de los puntos ciegos se hace de tal forma que se retire lo m´ınimo imprescindible de la imagen, dando preferencia a que se detecte el mismo error por dos c´amaras distintas que a que realmente queden puntos ciegos en el sistema por los que puedan pasar inadvertidas las taras. A mayores se estudia en las im´agenes si existen rayas horizontales negras, como podemos ver en la figura 5.3. Estas se deben a la alta frecuencia de grabado exigida a las c´amaras. Estos fotogramas con rayas no son filtrados ni tratados, sencillamente se descartan. Figura 5.3: Imagen con raya horizontal negra. 5.1.2. Tratamiento de la imagen La imagen se procesa de dos formas independientes: una responsable de detectar los errores que hemos clasificado como “blancos” y otra capaz de detectar los “negros”. El tratamiento de la imagen conlleva fases en las que se reducen las gamas de tonos de la imagen, procedimiento llamado posterizaci´on, as´ı como un proceso de conteo de formas en la imagen. Se detectan bordes con la ayuda de varios operadores, uno diferencial y otro relacionado con el algoritmo de Canny, a la vez que se busca si hay intersecciones entre las distintas formas de la imagen. La aplicaci´on de un algoritmo de suavizado permite reducir el ruido presente en la imagen. Finalmente se usa un ‘Threshold’ o umbral para binarizar la imagen de la forma m´as adecuada. El proceso de detecci´on de defectos blancos es muy similar s´olo que, en vez de trabajar con la imagen original, se trabaja con la imagen invertida, es decir, se sustituye cada valor por la diferencia entre el valor m´aximo -255- y el valor original de la imagen para cada p´ıxel [4]. Una vez que el sistema ha binarizado cada imagen como una matriz con valores 0 y 1, no-error y error, hace una aproximaci´on del ´area de error posible en la imagen. Si supera un umbral asignado a esta ´area, la imagen se etiqueta como correspondiente a tablero defectuoso. Las im´agenes van pasando por un Buffer para ir procesando paulatinamente las im´agenes y determinar su naturaleza. En la figura 5.4 podemos observar el resultado del tratamiento de una imagen pre-procesada con defectos negros: Figura 5.4: Imagen filtrada por Smart Eyes con defectos negros antes y despu´es de ser procesada. 32
CAP´ ITULO 5. TRATAMIENTO DE LAS IM´ AGENES TFG: Grado de Ingenier´ıa Inform´atica Con ello se logra un sistema robusto, especialmente para la detecci´on de defectos negros. Sin embargo, el filtrado de blancos del algoritmos crea mucho ruido en las im´agenes que tienen problemas de homogeneidad en la iluminaci´on, tal y como vemos en la imagen con defecto blanco de la figura 5.5. Esto da lugar a muchos falsos positivos. Figura 5.5: Imagen filtrada por Smart Eyes con defecto blanco antes y despu´es de ser procesada. Se crea ruido a la derecha. En el apartado 8.1 se muestra el rendimiento de este sistema. 5.2. Nuestra propuesta Nuestro sistema de pre-procesamiento de la imagen ha sido desarrollado en Matlab. El lenguaje de programaci´on nos ofrece vers´atiles herramientas para el tratamiento de la imagen. 5.2.1. Extracci´on de zona de inter´es Tenemos que hacer distinci´on entre las im´agenes del Corpus I y del Corpus II. Con respecto a las primeras, las im´agenes ya han sido pre-tratadas por “Smart Eyes”, por lo que tienen ya retirados los puntos ciegos y los tramos sin tablero. Con respecto a las segundas, hemos intentado emular el procedimiento empleado por “Smart Eyes” de retirada de puntos ciegos y zonas sin tablero. Al no contar con las medidas reales del tablero, el corte ha sido en cierto modo aproximado. Todo el proceso de recorte de imagen se ha hecho con Matlab, siguiendo un procedimiento similar al que aparece en el apartado de recorte de im´agenes de la web de MathWorks [5]. En la siguiente figura (5.6) vemos un ejemplo de imagen de una de las c´amaras laterales, en el que se han eliminado la parte izquierda sin tablero y el punto ciego a la derecha: Figura 5.6: La imagen inferior es el resultado de extraer la zona de inter´es de la superior. 5.2.2. Tratamiento de la imagen Hemos optado por seguir un esquema general similar al procedimiento de “Smart Eyes” con el uso de dos procesos de filtrado, uno para defectos negros y otro para defectos blancos. Una vez cargada la imagen, se modifica para pasarla a escala de grises. La imagen ya consta solo de degradados de gris, pero el formato en que est´an guardadas (JPG) codifica las im´agenes por defecto en un modelo tricolor RGB. Despu´es intentamos emplear distintas estrategias para normalizar u homogeneizar la luz como la ecualizaci´on de histogramas o la versi´on adaptativa de este procedimiento. Buscan que la distribuci´on de cada nivel de gris en el histograma de la imagen siga una distribuci´on uniforme, maximizando el contraste y conservando la entrop´ıa o informaci´on. Estos enfoques no resultaron adecuados porque las im´agenes, en general, contienen una gama de grises peque˜na. 33
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 5. TRATAMIENTO DE LAS IM´ AGENES El procedimiento ´optimo que hemos hallado para la detecci´on defectos blancos ha resultado ser la sustracci´on del fondo de la imagen [6]. Esta t´ecnica se emplea en im´agenes cuya iluminaci´on de fondo no es uniforme. Se pueden aplicar distintas formas, aunque la elegida es una circunferencia de radio constante. Posteriormente se procede a binarizar la imagen haciendo uso de un valor umbral, quedando la imagen codificada en dos valores: 0 y 255, correspondientes a negro y blanco. Con la matriz (imagen) resultante, podremos calcular de forma aproximada cu´anto vale el ´area del defecto con el n´umero de p´ıxeles que tomen el color blanco. La detecci´on de defectos negros es an´aloga, s´olo que en vez de trabajar con la imagen original se trabaja con la invertida. En la figura 5.7 vemos c´omo se ha procesado una de las im´agenes del conjunto: Figura 5.7: Salida b´asica del procesamiento de las im´agenes. La binarizaci´on parece funcionar correctamente: destaca aquellas zonas que pueden ser error y deja blancas aquellas que parecen estar correctas. Funciona correctamente con ejemplos en los que hay defectos negros, blancos y otros defectos. Parece que los falsos positivos de “Smart Eyes” nuestro sistema no los detecta como positivos. Sin embargo, los defectos relacionados con el hinchamiento del tablero no son detectados correctamente. 5.2.3. Optimizaci´on del filtrado Nuestra propuesta de refinado de las im´agenes consta de dos filtrados (negro y blanco) cada uno de los cuales depende de dos par´ametros: uno relacionado con la sustracci´on del fondo y otro con el procedimiento de binarizaci´on. Cada uno de los dos par´ametros de los filtrados se han optimizado de forma independiente mediante un procedimiento iterativo empleando distintos valores para estos. Para estimar la calidad del filtrado resultante, se ha empleado la tasa de equierror. Se ha considerado ´optimo aquel filtrado cuya tasa de equierror fuese m´ınima. Tasa de Equierror La tasa de equierror (EER - Equal Error Rate) es una medida de evaluaci´on de sistemas de clasificaci´on empleado com´unmente en dispositivos de biometr´ıa. Se define como el punto en el que se igualan la tasa de falsos positivos y la tasa de falsos negativos. Estas dos tasas son probabilidades condicionadas definidas a partir de la matriz cl´asica dos por dos. En la Tabla 5.1 vemos un ejemplo de matriz dos por dos, particularmente una matriz de confusi´on [7]. En horizontal se define la clase verdadera de la observaci´on, mientras que en vertical aparece la clase predicha o etiqueta. Clase Sin defecto Con defecto Etiq. Sin defecto TN FN Con defecto FP TP Tabla 5.1: Matriz de confusi´on dos por dos. 34
CAP´ ITULO 5. TRATAMIENTO DE LAS IM´ AGENES TFG: Grado de Ingenier´ıa Inform´atica En la diagonal de esta matriz aparecen las observaciones bien clasificadas [8]: los verdaderos positivos (True Positive - TP), en nuestro caso las im´agenes con defectos clasificadas como con defectos, y los verdaderos negativos (True Negative - TN), im´agenes sin defectos clasificadas como tal. En la posici´on inferior izquierda est´an los tableros sin defectos clasificados como si los tuviesen (falsos positivos, False Positive - FP) y en la posici´on derecha superior los tableros con defectos clasificados como si no los tuviesen (falsos negativos, False Negative - FN). Llamamos tasa de falsos positivos (False Positive Rate - FPR) a la probabilidad existente de que una observaci´on, condicionada a que no tenga defectos, sea clasificada como si los tuviese. FPR = P(Etiqueta=Defectuoso|Clase=Sin defectos) = FP TN + FP De forma an´aloga definimos la tasa de falsos negativos (False Negative Rate - FNR) como la probabilidad existente de que una observaci´on, condicionada a que tenga defectos, sea clasificada como si no los tuviese. FNR = P(Etiqueta=Sin defectos|Clase=Defectuoso) = FN TP + FN El umbral que seleccionaremos ser´a aquel que permita que se igualen la tasa de falsos positivos y falsos negativos tal y como podemos ver en la Figura 5.8. El umbral se ha seleccionado por separado en el Corpus I que en el II para seguir una l´ınea de trabajo similar a la desarrollada con los clasificadores. Figura 5.8: Representaci´on gr´afica de la definici´on de tasa de equierror (EER - Equal Error Rate). En la figura se representan la tasa de falsos positivos (FPR) y la tasa de falsos negativos (FNR) en funci´on de la sensibilidad. Se ha realizado la optimizaci´on del filtrado de los Corpus I y II por separado debido a las diferencias existentes en ellos en cuanto a propiedades (diferencia de luminosidad, resoluci´on de las im´agenes, etc.). 35
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 5. TRATAMIENTO DE LAS IM´ AGENES 36
Cap´ıtulo 6 Extracci´on de caracter´ısticas A lo largo de este cap´ıtulo se detallan las diferentes caracter´ısticas o variables extra´ıdas a partir de las im´agenes en bruto que componen los Corpus as´ı como las resultantes de aplicar dos filtrados sobre ´estas. Los filtrados sirven para realzar las zonas notoriamente oscuras -posible defecto negro- o muy claras -posible defecto blanco-. En la memoria de trabajo de fin de grado de ingenier´ıa inform´atica se ha detallado m´as en profundidad la naturaleza de los filtrados. Una segunda parte de este cap´ıtulo describe los conjuntos de variables, compuestos por las caracter´ısticas extra´ıdas desarrolladas previamente, que servir´an como entrada a los modelos de clasificaci´on que se crear´an posteriormente. 6.1. Variables extra´ıdas 6.1.1. ´ Areas de error relativo en negro y blanco Las caracter´ısticas base extra´ıdas tras al procedimiento de filtrado realizado ser´an las ´areas de error relativa en blanco y negro. Estas variables se calculan como la suma de p´ıxeles que son marcados como defectuosos despu´es del filtrado y la binarizaci´on entre el total de p´ıxeles de la imagen. Area Error = P´ıxeles marcados como con defecto Area =P´ıxeles marcados como con defecto Anchura ×Altura Este ´area se ha calculado por separado para el filtrado de negros y el de blancos. Al tomar estas variables valores muy bajos se han multiplicado por un factor de escala constante de 1000. Provendr´an de las im´agenes binarizadas despu´es del filtrado blanco o negro, por lo tanto, estas dos variables. La Figura 6.1 muestra ejemplos de im´agenes filtradas en blanco y negro y c´omo a partir de ellas se han calculado las ´areas de error relativas. Figura 6.1: Salida del c´alculo del ´area de error relativa en negro y en blanco en una imagen. El valor ha sido multiplicado por un factor de escala. 37
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 6. EXTRACCI´ ON DE CARACTER´ ISTICAS 6.1.2. Caracterizaciones de las distribuciones de grises El siguiente conjunto de variables relevantes est´a relacionado con la distribuci´on de grises de las im´agenes. Llamamos distribuci´on de grises de una imagen a la frecuencia de aparici´on de cada uno de los tonos de gris dentro de la imagen. Esta frecuencia de aparici´on se ha medido de forma relativa, es decir, como proporci´on (dividiendo entre el total de p´ıxeles de la imagen). Existen 256 tonos de grises codificados en valores entre 0 y 255, correspondiendo el 0 al color negro y el 255 al blanco y quedando entremedias las diferentes tonalidades de gris. En la Figura 6.2 se puede observar una representaci´on gr´afica (histograma de grises) de la distribuci´on de grises de una imagen en bruto de los Corpus. Este ejemplo refleja claramente c´omo en la mayor´ıa de las im´agenes en bruto una proporci´on muy alta de los p´ıxeles de la imagen se encuentran comprendidos entre 140 y 200 en la escala de grises. Figura 6.2: Histograma de grises asociado a la distribuci´on de grises de una imagen en bruto perteneciente a uno de los Corpus. Para evitar trabajar con las 256 variables que genera la distribuci´on, se han utilizado dos caracterizaciones diferentes de la distribuci´on de grises. Formar´an parte de dos conjuntos de variables independientes con los que se trabajar´a simult´aneamente. Las caracterizaciones en cuesti´on son: Conjunto A - PCA: se emplea el an´alisis de componentes principales [9] con las 256 variables de la distribuci´on relativa de grises para as´ı reducir de forma muy notoria la dimensionalidad. Antes de realizar el an´alisis de componentes principales se ha eliminado una de las variables: ´esta era dependiente del resto al tratarse de variables en tanto por uno que suman uno en total. Conjunto B - Estad´ısticos: se hace uso de los estad´ısticos caracter´ısticos de la distribuci´on de valores tomados en escala de grises por los p´ıxeles de la imagen. Supone una reducci´on de dimensionalidad menor que podr´ıa dar lugar a un conjunto de datos con m´as variabilidad ´util para la posterior clasificaci´on de las im´agenes. Los estad´ısticos empleados de las distribuciones han sido los siguientes: media, varianza, asimetr´ıa, kurtosis, mediana, cuartil-10 % y cuartil-90 %. Estas variables se han extra´ıdo de la imagen original (en bruto) as´ı como de las im´agenes filtradas en negro y blanco sin binarizar. 38
CAP´ ITULO 6. EXTRACCI´ ON DE CARACTER´ ISTICAS TFG: Grado de Ingenier´ıa Inform´atica 6.1.3. Transformada Discreta del Coseno (DCT) A mayores se ha a˜nadido un ´ultimo juego de variables: la DCT [10] (transformada discreta del coseno). Se emplea especialmente en la compresi´on de sonido e im´agenes dando lugar a conocidos formatos como MP3 o JPEG. La Figura 6.3 muestra un ejemplo de c´omo la DCT es capaz de resumir la informaci´on contenida en una imagen en unos pocos d´ıgitos. Figura 6.3: Aplicaci´on de la transformada discreta del coseno a una imagen en escala de grises. Debajo de las im´agenes aparece la matriz correspondiente [11]. Se trata de la una t´ecnica capaz de expresar informaci´on como suma de funciones coseno oscilando a diferentes frecuencias. Es una funci´on muy relacionada con la transformada de Fourier (DFT). Lo que las distingue es que, mientras que la DFT emplea tanto funciones seno como conseno, la DCT solo trabaja con cosenos y, por lo tanto, con n´umeros reales. La definici´on formal de la transformada discreta del coseno empleada [12] (DCT-II) expresa cada p´ıxel de la imagen original en escala de grises (x[n]) como una suma de cosenos con diferentes coeficientes: x[n] = 1 NPN−1 k=0 w[k]Cx[k] cos π 2Nk(2n+ 1)si 0 ≤n<N 0 en otro caso w[k] = 1 2si k= 0 1 si 0 ≤k < N Los coeficientes de los cosenos se puede calcular con las siguientes expresiones anal´ıticas a partir de los valores de las x[n]: Cx[k] = PN−1 n=0 2x[n] cos π 2Nk(2n+ 1)si 0 ≤k < N 0 en otro caso Sobre las componentes extra´ıdas de la DCT (los coeficientes Cx[k]) se han aplicado dos transformaciones sucesivas: se han elevado al cuadrado (para hacer que sean positivos los valores) y se ha aplicado despu´es el logaritmo (para que la distribuci´on subyacente fuese m´as suave y cumpliese de forma m´as fuerte las hip´otesis de normalidad). Se han extra´ıdo los 30 t´erminos m´as relevantes de la transformada discreta del coseno de la imagen filtrada binarizada y sin binarizar, a˜nadiendo a los conjuntos de variables previamente descritos 60 variables. La imagen filtrada sin binarizar surge como la suma elemento a elemento de las matrices correspondientes a las im´agenes filtradas en blanco y en negro. Esta adici´on se acota de tal forma que ning´un elemento pueda superar el valor 255, el m´aximo en la escala de grises definida. La extracci´on de 30 elementos se ha hecho a la vista de c´omo en muchas im´agenes a partir de la componente 30 los valores eran pr´acticamente nulos. 39
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 6. EXTRACCI´ ON DE CARACTER´ ISTICAS La Figura 6.4 muestra en forma de esquema las im´agenes con las que se ha trabajado as´ı como las variables extra´ıdas de cada una de ellas. Figura 6.4: Representaci´on esquem´atica de las im´agenes con las que se ha trabajado y variables que se extraen en cada fase. 6.2. Conjuntos de variables consideradas Las siguientes subsecciones describen con detalle las variables que componen los dos conjuntos de datos empleados en la clasificaci´on de im´agenes, caracterizados por su uso de estad´ısticos o componentes principales como ya se ha mencionado. Las ´areas de error relativa en negro y en blanco y las componentes extra´ıdas de transformada discreta del coseno completan los conjuntos de datos. Se estudi´o posteriormente completar el estudio con un tercer conjunto de variables C, integrado ´unicamente por las variables de ´area de error y las componentes de la transformada discreta del coseno extra´ıdas. La obtenci´on de resultados peores que con el conjunto A y el B hizo que esta v´ıa de trabajo fuese descartada en los primeros estadios de este proyecto. Conjunto A: uso de PCA (2 + 8 + 60 variables) Las variables que conforman este conjunto son: ´ Area de error relativa en la imagen procesada en negros y en la imagen procesada en blancos. Tomar´an valores naturalmente bajos entre 0 y 1 (2 variables). A trav´es del an´alisis de componentes principales extraemos: •Componentes 1-4 de la distribuci´on de grises de la imagen original. En las im´agenes del Corpus I, cuatro componentes recogen una inercia del 80.20 %. El resto de componentes son residuales. En el Corpus II la inercia alcanza el valor de 88.53 % con 4 componentes. (4 variables). •Componentes 1-2 de la distribuci´on de grises de la imagen tratada en blancos. La varianza explicada con 2 componentes en el Corpus I es del 96.91 % mientras que en el Corpus II es del 97.46 %. (2 variables). •Componentes 1-2 de la distribuci´on de grises de la imagen tratada en negros. La inercia recogida por dos componentes en el caso del Corpus I ha sido del 96.30 %. En el Corpus II este valor es del 97.13 % (2 variables). DCT de la imagen tratada sin binarizar y binarizada (30 ×2 variables) 40
CAP´ ITULO 6. EXTRACCI´ ON DE CARACTER´ ISTICAS TFG: Grado de Ingenier´ıa Inform´atica La Tabla 6.1 muestra de forma resumida las variables que componen este conjunto de datos. Variables del conjunto de variables A (70) Area de Error (2) AreaErrorB AreaErrorN PCA Img. original (4) CompPrinOr1 CompPrinOr2 CompPrinOr3 CompPrinOr4 Img. filtrada en blanco (2) CompPrinTratB1 CompPrinTratB2 Img. filtrada en negro (2) CompPrinTratN1 CompPrinTratN2 DCT Img. filtrada sin binarizar (30) Componentes de la 1 a la 30 extra´ıdas. Img. filtrada binarizada (30) Componentes de la 1 a la 30 extra´ıdas. Tabla 6.1: Variables del conjunto de datos A. Conjunto B: uso de estad´ısticos (2 + 21 + 60 variables) Las variables que conforman este conjunto son: ´ Area de error relativa en la imagen procesada en negros y en la imagen procesada en blancos. Tomar´an valores naturalmente bajos entre 0 y 1 (2 variables). Media, varianza, asimetr´ıa (skewness), kurtosis, mediana, cuartil-10 % y cuartil-90 % de las distribuciones de grises de la imagen original, tratada en blancos y tratada en negros. Ser´an valores entre 0 y 255 (7 ×3 variables). DCT de la imagen tratada sin binarizar y binarizada (30 ×2 variables) La Tabla 6.2 muestra de forma resumida las variables que componen este conjunto de datos. Variables del conjunto de variables B (83) Area de Error (2) AreaErrorB AreaErrorN Estad´ısticos Img. original (7) MediaOr VarianzaOr SkewnessOr KurtosisOr MedianaOr P10Or P90Or Img. filtrada en blanco (7) MediaTratadaB VarianzaTratadaB SkewnessTratadaB KurtosisTratadaB MedianaTratadaB P10TratadaB P90TratadaB Img. filtrada en negro (7) MediaTratadaN VarianzaTratadaN SkewnessTratadaN KurtosisTratadaN MedianaTratadaN P10TratadaN P90TratadaN DCT Img. filtrada sin binarizar (30) Componentes de la 1 a la 30 extra´ıdas. Img. filtrada binarizada (30) Componentes de la 1 a la 30 extra´ıdas. Tabla 6.2: Variables del conjunto de datos B. 41
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 7. METODOLOG´ IA La regresi´on log´ıstica establece que la funci´on logit de probabilidad de ocurrencia de un suceso (p) se puede expresar como la combinaci´on lineal de una serie de variables regresoras [13]. El sumatorio de estas variables por lo tanto ser´a ponderado por unos pesos o par´ametros a ajustar. Suponiendo que disponemos de mvariables de entrada al clasificador, podemos denominar a los par´ametros como Θ = (θ0, θ1, ..., θm). El modelo incluye un par´ametro θ0 correspondiente al t´ermino independiente. La expresi´on expl´ıcita del modelo a ajustar ser´a: logit(p) = log p 1−p= ΘX=θ0+θ1x1+... +θmxm Con una sencilla transformaci´on exponencial, podemos llegar a una expresi´on explicita del modelo que explique la probabilidad en vez de la funci´on logit de esta: p 1−p=eθ0+θ1x1+...+θmxm p=1 1 + e−θ0−θ1x1−...−θmxm Los par´ametros se buscar´an cumpliendo el criterio de m´axima verosimilitud seg´un el cual se optimizan los par´ametros de tal forma que los resultados observados sean los m´as probables No existe una expresi´on cerrada con la que trabajar para su optimizaci´on, por lo que se tiene que recurrir a m´etodos iterativos como el algoritmo de Newton- Raphson, el gradiente descendiente o el IRWLS. Los par´ametros ´optimos ˆ Θ ser´an aquellos que minimicen la Logverosimilitud (log L), la cual depende adem´as de los par´ametros de los datos observados (x, y) = (¯x1, y1), ..., (¯xn, yn): ˆ Θ = m´ın Θ−log L(Θ|x, y) En la Figura 7.4 podemos ver la frontera definida por un procedimiento de regresi´on log´ıstica sencillo. Una de las caracter´ısticas de esta t´ecnica es que la salida del clasificador es una probabilidad. Esto nos permite refinar el clasificador con un par´ametro umbral a mayores para realizar la separaci´on de im´agenes con defecto de las que no lo tienen. Figura 7.4: Representaci´on de una regresi´on log´ıstica en un ejemplo sencillo: con m´as pr´actica, m´as probabilidades de ´exito [19]. La regresi´on log´ıstica se utiliza en m´ultiples campos, sobre todo aquellos en los que se puede sacar partido a la propiedad de la salida en forma de probabilidad previamente mencionada. En medicina se emplea para analizar el estado del paciente [20]. Se ha empleado tambi´en para predecir resultados electorales as´ı como en estudios de probabilidad de devoluci´on de un pr´estamo [21]. 48
CAP´ ITULO 7. METODOLOG´ IA TFG: Grado de Ingenier´ıa Inform´atica Regularizaci´on Para evitar problemas relacionados con el sobreajuste en los que el error de generalizaci´on es superior a la tasa de error observada en el conjunto de entrenamiento, se a˜nade un t´ermino de regularizaci´on para los par´ametros R(Θ) que depende a mayores de un nuevo par´ametro λ. ˆ Θ = m´ın Θ−log L(Θ|x, y) + λR(Θ) Esto impide que los par´ametros adquieran valores elevados y con ello el sobreajuste. Los dos t´erminos de regularizaci´on m´as comunes dependen de la norma dos y la norma uno de un vector. Mientras que la norma dos resulta ser m´as sencilla de optimizar, la norma uno da lugar a par´ametros dispersos. Esto supone que algunos sean nulos y con ello se haga una selecci´on de variables. Regularizaci´on L1. Haciendo uso de la norma 1: ˆ Θ = m´ın Θ−log L(Θ|x, y) + λ||Θ||1= m´ın Θ−log L(Θ|x, y) + λ n X i=0 |θi| Esta regularizaci´on da lugar a regiones en el espacio de soluciones con forma romboidal. En la Figura 7.5 se puede observar un ejemplo en un caso bidimensional. Figura 7.5: Regularizaci´on L1. Las regiones de soluciones factibles aparecen en azul claro mientras que las elipses rojas representan el contorno de la funci´on de error [22]. Regularizaci´on L2. Haciendo uso de la norma 2: ˆ Θ = m´ın Θ−log L(Θ|x, y) + λ 2||Θ||2 2= m´ın Θ−log L(Θ|x, y) + λ 2 n X i=0 θ2 i Esta regularizaci´on da lugar regiones en el espacio de soluciones con forma esferoidal. En la Figura 7.6 se puede observar un ejemplo en un caso bidimensional. Figura 7.6: Regularizaci´on L2. Las regiones de soluciones factibles aparecen en azul claro mientras que las elipses rojas representan el contorno de la funci´on de error [22]. 49
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 7. METODOLOG´ IA Implementaci´on usada Se ha empleado Python junto al paquete sklearn [23] con la funci´on de regresi´on log´ıstica correspondiente as´ı como las funciones de estimaci´on de curvas ROC y tasa de equierror por validaci´on cruzada. Previamente al entrenamiento del clasificador se han normalizado todos los datos de tal forma que cada una de las variables tuviese media cero y varianza uno. En cada uno de los conjuntos de datos de los Corpus se ha estudiado la precisi´on alcanzada por dos modelos distintos, cada uno correspondiente a un tipo de regularizaci´on: Regularizaci´on L1. Se hace una b´usqueda del par´ametro λ´optimo que minimice la tasa de error estimada mediante validaci´on cruzada. Se hace intr´ınsecamente la selecci´on de variables con el entrenamiento del modelo al quedar algunos par´ametros reducidos a cero. Regularizaci´on L2. Previamente al entrenamiento del clasificador se hace una selecci´on recursiva de variables con la funci´on RFE de sklearn. Posteriormente se entrena el clasificador optimizando el par´ametro λde regularizaci´on. El modelo ´optimo en cada uno de los conjuntos de datos de los Corpus, seleccionado entre el resultado ´optimo de la regularizaci´on L1 y la regularizaci´on L2, aparece desarrollado en la Secci´on 8.3. 7.3. Support Vector Machine (SVM) Algoritmos de aprendizaje asociados a problemas de clasificaci´on y regresi´on [13]. Se basan en la definici´on del hiperplano de separaci´on m´axima entre las envolventes convexas de las clases. Alexey Ya. Chervonenkis y Vladimir N. Vapnik crearon este algoritmo en 1963. Este ´ultimo desarrollo el potencial actual de los Support Vector Machines con las investigaciones sobre la funci´on n´ucleo que public´o en 1992. El modelo original de SVM no permit´ıa salidas probabil´ısticas. Sin embargo, desarrollos posteriores hacen posible esta salida. El procedimiento b´asico de los Support Vector Machines se puede ilustrar de forma sencilla mediante un ejemplo bidimensional. En la Figura 7.7 podemos observar el diagrama de dispersi´on de dos tipos de individuos o clases, representados con cuadrados y c´ırculos respectivamente. Figura 7.7: Representaci´on bidimensional con dos clases [24]. El primer paso consistir´a en trazar las envolventes convexas que cercan los puntos de cada una de las clases de individuos. LLamamos envolvente convexa de Xa la intersecci´on de todas las regiones convexas que contienen a S. En el caso de un plano, se puede definir como el pol´ıgono convexo que contiene a todos los puntos de X y cuyos v´ertices son algunos de estos puntos. La Figura 7.8 muestra las envolventes convexas correspondientes a nuestro ejemplo bidimensional. 50
CAP´ ITULO 7. METODOLOG´ IA TFG: Grado de Ingenier´ıa Inform´atica Figura 7.8: Definici´on de la envolvente convexa de cada una de las clases [24]. Posteriormente se toman una serie de puntos como referencia, los vectores o puntos soporte (Support Vectors), que permiten definir la frontera o hiperplano que discrimina entre clases en problemas de clasificaci´on. Normalmente son las observaciones de las clases que perteneciendo a la envolvente se encuentran m´as pr´oximas a la envolvente de la otra clase. La Figura 7.9 ilustra este paso en el caso de nuestro ejemplo de dos dimensiones. Figura 7.9: Definici´on de los Support Vectors (destacados con un c´ırculo) y el hiperplano separador de margen m´aximo haciendo uso de las envolventes convexas [24]. Son modelos muy flexibles principalmente por la existencia del “kernel trick” o truco del n´ucleo [17], que permite separar puntos no linealmente separables proyect´andolos a espacios de mayor dimensionalidad. Las funciones n´ucleo est´an relacionadas con el producto escalar y transforman una matriz en otra semidefinida positiva, es decir, con autovalores no negativos. Se trata de clasificadores robustos y precisos cuyo coste computacional escala relativamente r´apido. Son muy resistentes al sobreajuste y permiten que el modelo sea f´acilmente almacenable al constar ´unicamente de los vectores soporte. Han sido utilizados para la categorizaci´on de textos [25], en problemas de distinci´on de correo Spam por ejemplo, y en ´ambitos relacionados con el reconocimiento de im´agenes, como puede ser el problema de reconocimiento de d´ıgitos escritos a mano [26]. Usos recientes apuntan a su utilidad en campos relacionados con la biolog´ıa como es la clasificaci´on prote´ıca autom´atica [27]. Los n´ucleos con los que se ha trabajado en este proyecto son el n´ucleo lineal, polin´omico y de base radial. Otros n´ucleos populares son el sigmoide, el perceptr´on o el de la tangente hiperb´olica. 51
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 7. METODOLOG´ IA 7.3.1. N´ucleo lineal Dado un conjunto de entrenamiento de datos (¯x1, y1), ..., (¯xn, yn) en los que las xson los vectores de variables explicativas de cada una de las observaciones y la variable yrepresenta una clasificaci´on dicot´omica (-1 y 1), el n´ucleo lineal busca aquel hiperplano lineal cuyo margen de separaci´on sea m´aximo. Podemos definir un hiperplano cualquiera de la siguiente forma, siendo ¯wun vector de pesos normal al hiperplano separador y bun t´ermino independiente. ¯w·¯x−b= 0 El objetivo se puede definir f´acilmente con una expresi´on cerrada: yi( ¯w·¯x−b)≥1 para todo 1 ≥i≥n Sin embargo, cuando los datos no son linealmente separables hace falta introducir una funci´on de p´erdida l(y) = m´ax(0,1−yi( ¯w·¯x−b)) La expresi´on a minimizar tomar´a la siguiente forma: 1 n n X i=1 m´ax(0,1−yi( ¯w·¯x−b)) A mayores se define un par´ametro de regularizaci´on. Dependiendo de la norma utilizada, tiene un efecto u otro. La m´as utilizada es la norma dos, lo que da lugar a una regularizaci´on Ridge. "1 n n X i=1 max(0,1−yi( ¯w·¯x−b))#+λ||¯w||2 Sin embargo en este proyecto se ha usado la norma uno o penalizaci´on Lasso cuya principal ventaja es la posibilidad de anular coeficientes de par´ametros y de este modo hacer un procedimiento de selecci´on de variables. "1 n n X i=1 max(0,1−yi( ¯w·¯x−b))#+λ||¯w||1 La elecci´on del par´ametro de regularizaci´on supone calibrar el modelo ajustado y evitar el sobreajuste. Tambi´en supone una definici´on de m´argenes diferentes, pudi´endose con la modificaci´on de λestrecharse o ampliarse estos. La Figura 7.10 muestra la diferencia que supone aplicar el n´ucleo lineal con y sin regularizaci´on en el conjunto de datos sobre flores Iris. Figura 7.10: Representaci´on de los tipos de flores Iris en funci´on del tama˜no y anchura de su s´epalo acompa˜nados del margen definido por un SVM de n´ucleo lineal. En la izquierda se ha aplicado sin regularizaci´on, mientras que en la derecha se ha regularizado [28]. 52
CAP´ ITULO 7. METODOLOG´ IA TFG: Grado de Ingenier´ıa Inform´atica 7.3.2. N´ucleo polin´omico El n´ucleo polin´omico busca hiperplanos cuyo margen de separaci´on sea equivalente a una funci´on de un determinado grado. Este grado se tendr´a que definir previamente como un par´ametro p. Valores altos de pdan lugar a sobreajuste, por lo que conviene que no se alcancen valores muy elevados con este par´ametro. En los Support Vector Machines en los que se emplea el n´ucleo que no es lineal se sustituye el producto escalar por otras funciones. En el caso del n´ucleo polin´omico, la funci´on n´ucleo empleada es: K( ¯xi,¯xj) = ( ¯xi·¯xj)p El n´ucleo lineal previamente explicado ser´ıa un caso particular de este n´ucleo en el que p= 1. Al igual que ocurr´ıa con el n´ucleo lineal, existe la posibilidad de a˜nadir un t´ermino de regularizaci´on λpara controlar el sobreajuste. Se ha aplicado la norma dos o cuadr´atica en el caso de la regularizaci´on de los SVM de n´ucleo polin´omico. La Figura 7.11 muestra la diferencia que supone aplicar el n´ucleo lineal y el polin´omico con p= 3 en el conjunto de datos sobre flores Iris. La frontera ha adquirido en el caso del n´ucleo polin´omico la forma propia de una funci´on de tercer grado. Figura 7.11: Representaci´on de los tipos de flores Iris en funci´on del tama˜no y anchura de su s´epalo acompa˜nados del margen definido por un SVM de n´ucleo lineal sin regularizaci´on (izquierda) y un SVM de n´ucleo polin´omico de grado tres (derecha) [28]. 7.3.3. N´ucleo de base radial (Radial Based Function - RBF) El n´ucleo de base radial busca un hiperplano cuyo margen de separaci´on sea m´aximo cuya frontera pueda ser m´as flexible que la que resulta de usar un n´ucleo lineal o polin´omico. Llamamos funci´on de base radial a una funci´on en la que el valor depende de un origen o centro de coordenadas. Emplean normalmente la norma eucl´ıdea para el c´alculo de distancias y tienen multitud de usos dentro del an´alisis de datos, como puede ser las redes neuronales de base radial. La nueva funci´on n´ucleo que emplearemos con los SVM de base radial emplear´a la norma eucl´ıdea, como ya se ha mencionado, y un par´ametro σ. El n´ucleo se definir´a de la siguiente forma: K( ¯xi,¯xj) = e||¯xi−¯xj||2 2σ2 Esta funci´on toma un valor m´as peque˜no seg´un la distancia y toma valores entre 0 y 1. Una interpretaci´on directa de este valor es la medida de similaridad entre observaciones. 53
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 7. METODOLOG´ IA Aparece tambi´en un nuevo par´ametro que ajustar σ. Este par´ametro mide la apertura de la forma acampanada que surge como frontera al usar esta t´ecnica. Un valor peque˜no de σhar´a m´as grandes las disimilaridades entre observaciones, mientras que uno grande las reducir´a. El t´ermino de regularizaci´on acompa˜nado del par´ametro λexiste tambi´en en este tipo de n´ucleo. En el caso del n´ucleo de base radial normalmente el t´ermino de regularizaci´on que se aplica emplea la norma dos (regularizaci´on L2). Esto se debe principalmente a la complejidad del problema, que no escala adecuadamente con la regularizaci´on L1 cuando el n´umero de muestras es elevado. La Figura 7.12 muestra la diferencia que supone aplicar un n´ucleo lineal y uno radial en el conjunto de datos sobre flores Iris. Tal y como podemos ver, las fronteras que define el n´ucleo radial son m´as flexibles debido a su forma curva. Figura 7.12: Representaci´on de los tipos de flores Iris en funci´on del tama˜no y anchura de su s´epalo acompa˜nados del margen definido por un SVM de n´ucleo lineal sin regularizaci´on (izquierda) y un SVM de n´ucleo radial (derecha) [28]. Implementaci´on utilizada Se ha desarrollado haciendo uso del lenguaje de programaci´on Python con ayuda del paquete de aprendizaje sklearn [23]. Se ha empleado la funci´on SVC para la creaci´on de los Support Vector Machines de n´ucleo de base radial y los de n´ucleo polin´omico, mientras que la funci´on LinearSVC ha servido para la creaci´on de los de n´ucleo lineal. Previamente al entrenamiento del clasificador se han normalizado todos los datos de tal forma que cada una de las variables tuviese media cero y varianza uno. El par´ametro γdel n´ucleo de base radial y el grado del polinomio pdel n´ucleo polin´omico se han optimizado mediante la funci´on de validaci´on cruzada GridSearchCV. Este parametro equivale a: γ=1 2σ2 El par´ametro de regularizaci´on Ctambi´en se ha optimizado con esta funci´on. Con los Support Vector Machines creados con n´ucleo lineal se ha utilizado penalizaci´on L1 mientras que los de base radial y polin´omico se han regularizado mediante norma 2. La relaci´on del par´ametro Ccon λes la siguiente: C=1 λ Las tasas de error y las matrices de confusi´on se han estimado mediante funciones de validaci´on cruzada (10 particiones) propias de sklearn, al igual que la estimaci´on de curvas medias ROC (y ´areas subyacentes) y tasa de equierror. 54
CAP´ ITULO 7. METODOLOG´ IA TFG: Grado de Ingenier´ıa Inform´atica 7.4. Redes Neuronales (Neural Networks) Sistemas de computaci´on cuya arquitectura original se basa en el funcionamiento del cerebro [13]. Son modelos capaces de obtener excelentes resultados en complejas tareas a trav´es del c´omputo intensivo de una colecci´on de datos suficientemente grande. A la unidad b´asica de c´omputo de las redes neuronales se la llama neurona. Esto se debe principalmente a su similitud con lo que ser´ıa la morfolog´ıa de una c´elula nerviosa del cerebro animal, tal y como podemos ver en la Figura 7.13. Figura 7.13: Estructura de la unidad b´asica de una red neuronal (derecha) comparada con la c´elula biol´ogica (izquierda) [29]. El dise˜no original de estas redes fue lo que se denomin´o el modelo de McCulloch-Pitts (1943) en el que el funcionamiento unitario de la neurona consta de dos operaciones b´asicas. Primero se realiza la suma de la ponderaci´on de las mentradas Y= (y1, ..., ym) por unos pesos que denominaremos W= (w1, ..., wm). A esta suma se le a˜nade un t´ermino independiente (b). Las entradas Ypueden ser las variables de entrada al clasificador o pueden ser la salida de otras neuronas dependiendo de la capa en la que este situada la neurona en cuesti´on. La funci´on de propagaci´on de la neurona jsituada en una capa de la red neuronal ser´a el resultado de la suma ponderada de sus entradas m´as un t´ermino independiente: uj= m X i=1 wiyi+b Al tratarse de una suma ponderada de t´erminos es de vital importancia la normalizaci´on o estandarizaci´on de los datos. De no hacerse podr´ıa dar lugar a un problema en el que no hubiese convergencia hacia una soluci´on. Posteriormente se aplica a la funci´on de propagaci´on una funci´on que acota la salida de la neurona. Esta funci´on se la denomina de activaci´on. Son mon´otonas crecientes y la caracter´ıstica de que sean derivables mon´otonas es deseable. yj=F(uj) = F m X i=1 wiyi+b Las funciones de activaci´on m´as empleadas son: Identidad. Recorrido = (−∞,∞). F(x) = x Unitaria. Recorrido = {0,1}. F(x) = 0 si x < 0 1 si x≥0 55
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 7. METODOLOG´ IA Sigmoide. Recorrido = (0,1). F(x) = 1 1 + e−x Tangente hiperb´olica. Recorrido = (−1,1). F(x) = tanh(x) = ex−e−x ex+e−x Arco tangente. Recorrido = (−π 2,π 2). F(x) = tan−1(x) Unidad de ra´ız cuadrada inversa (Inverse Square Root Unit). Recorrido = ( −1 √α,1 √α). F(x) = x √1 + αx2 Unidad lineal rectificada (Rectified Linear Unit - ReLU). Recorrido = [0,∞). F(x) = 0 si x < 0 xsi x≥0 Existen muchos tipos de redes neuronales y se clasifican de distintas formas. Una posible forma es si son redes sin realimentaci´on o con realimentaci´on. Llamamos realimentaci´on a la existencia de arcos conectores entre neuronas de una capa con otras pertenecientes a otra capa anterior. Las redes con realimentaci´on suelen tener hip´otesis m´as complejas y precisas en los problemas a cambio de una mayor opacidad en el funcionamiento del algoritmo. La Figura 7.14 muestra esta clasificaci´on b´asica en el caso de varios tipos de redes neuronales. Figura 7.14: Clasificaci´on b´asica de las redes neuronales sin realimentaci´on y con realimentaci´on [30]. Este proyecto se ha centrado principalmente en un tipo de red neuronal: los perceptrones de m´ultiples capas como tipo de red neuronal artificial de propagaci´on sin realimentaci´on. 7.4.1. Perceptr´on multicapa (Multi-Layer Perceptron - MLP) Red neuronal sin realimentaci´on que consta de una capa de entrada, una o varias capas ocultas y una capa de salida, tal y como podemos ver en la Figura 7.15. 56
CAP´ ITULO 7. METODOLOG´ IA TFG: Grado de Ingenier´ıa Inform´atica Figura 7.15: Estructura general de un perceptr´on multicapa [13]. La capa de entrada constar´a de tantas neuronas como variables de entrada tenga el clasificador (N0 variables de entrada). Las capas ocultas, plenamente conectas, tendr´an una arquitectura que habr´a que determinar en funci´on de los resultados obtenidos. El n´umero de capas ocultas lo denominaremos H. El n´umero de neuronas de la capa oculta iser´a N[i−1], pudiendo tomar ivalores entre 1,2, ..., H. La capa de salida tendr´a tantas neuronas como salidas se deseen. El n´umero de neuronas de la capa de salida lo denominaremos N[H]. En nuestro caso, al tratarse de un problema de clasificaci´on binario la capa de salida tendr´a una ´unica neurona. Las neuronas que los componen realizan una suma ponderada para posteriormente emplear cualquiera de las funciones de activaci´on previamente mencionadas. Las dos m´as empleadas son la tangente hiperb´olica y la sigmoide. La Figura 7.16 representa el funcionamiento b´asico de una neurona. Figura 7.16: Procedimiento b´asico realizado por una neurona ide una capa oculta hcon funci´on de activaci´on F procesando la observaci´on p[13]. La salida yp hi de una neurona ique forma parte de una capa oculta hque est´a procesando la observaci´on pcuya funci´on de activaci´on es Fse puede expresar como: yp h,i =F(up hi) up hi = PN[h−1]−1 j=0 wh ijyp h−1,j+wh i,N[h−1] si ∀h= 1,2,3, ...H PN0−1 j=0 w0 ijIp j+wh i,N0en la capa de entrada (h= 0) 57
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS 8.2.1. Corpus I En el caso del Corpus I, se obtienen resultados b´asicos altamente satisfactorios, tal y como podemos observar en las curvas ROC (´area de error relativa en blanco y ´area de error relativa en negro por separado Figura 8.9; con la suma de ambas: Figura 8.10) as´ı como en los valores de la tasa de equierror y AUC (Tabla 8.4). Esto se debe primordialmente al excelente funcionamiento del filtrado en im´agenes cuya resoluci´on es muy alta. Figura 8.9: Curvas ROC del sistema de referencia empleando por separado ´area de error relativa en blanco (azul) y ´area de error relativa en negro (rojo) del Corpus I. Figura 8.10: Curva ROC del sistema de referencia empleando la suma de las ´areas de error relativas en negro y blanco para la clasificaci´on con defecto - sin defecto del Corpus I. 64
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Resultados del sistema de referencia en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Suma de ´areas de error 0.046 0.962 Negro: 0.907 Blanco: 0.577 ´ Areas de error por separado Negro 0.044 0.976 Blanco 0.333 0.769 Tabla 8.4: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del sistema de referencia con el Corpus I. En el caso de usarse la suma de ´areas de error se ha calculado el AUC para cada clase de error. En el caso del uso de la suma de las ´areas de error relativas, los valores de la AUC y de la EER son excelentes. La posterior comparativa entre ´el ´area bajo la curva ROC de las clases con defecto negro-sin defecto negro y la correspondiente a con defecto blanco-sin defecto blanco pone en evidencia el funcionamiento deficiente del sistema con los defectos blancos. Usando las dos ´areas de error relativa por separado se obtiene un sistema de caracter´ısticas similares al anterior. La discriminaci´on de defectos blancos tan solo por el ´area de error relativa es compleja, llegando a mal clasificarse cerca del 30 % de las observaciones al igualarse las tasas de falsos positivos y falsos negativos. Los modelos de umbral ajustado seg´un la tasa de equierror seleccionados obtienen resultados b´asicos altamente satisfactorios, tal y como podemos observar en las tablas de resultados (Tablas 8.5 y 8.6). Sistema de referencia (1 umbral) -Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 676 271 947 Con defecto 33 6187 6220 709 6458 7167 Tasa de acierto: 95.75 % Intervalo de confianza del 95 %: (95.28, 96.21) •Sensibilidad: 95.80 % •Especificidad: 95.34 % Tabla 8.5: Matriz de confusi´on y tasa de acierto con el uso de 1 umbral (´area relativa de error en negro + ´area relativa de error en blanco) en Corpus I. Sistema de referencia (2 umbrales) -Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 684 286 970 Con defecto 25 6172 6197 709 6458 7167 Tasa de acierto: 95.66 % Intervalo de confianza del 95 %: (95.19, 96.13) •Sensibilidad: 95.57 % •Especificidad: 96.47 % Tabla 8.6: Matriz de confusi´on y tasa de acierto con el uso de 2 umbrales (uno para ´area relativa de error en negro y otro para la de blanco) en Corpus I. Las matrices de confusi´on reflejan c´omo con dos umbrales el n´umero de falsos positivos es menor que con uno, mientras que la tasa de falsos negativos es inferior con un umbral. Las tasas de acierto nos indican que el uso de dos umbrales da lugar a resultados globales ligeramente mejores. La especificidad y sensibilidad de los modelos son elevadas y equilibradas. 65
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS 8.2.2. Corpus II Con el Corpus II los resultados que obtenemos con el sistema de referencia son menos satisfactorios, tal y como vemos en las curvas ROC (con dos umbrales: Figura 8.11; con un umbral: Figura 8.12) as´ı como en los valores de la tasa de equierror y AUC (Tabla 8.7). Al haber sido la fuente de estas im´agenes un v´ıdeo, la resoluci´on de los fotogramas extra´ıdos es menor que la del Corpus I. Figura 8.11: Curvas ROC del sistema de referencia empleando por separado ´area de error relativa en blanco (azul) y ´area de error relativa en negro (rojo) del Corpus II. Figura 8.12: Curva ROC del sistema de referencia empleando la suma de las ´areas de error relativas en negro y blanco para la clasificaci´on con defecto - sin defecto del Corpus II. 66
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Resultados del sistema de referencia en el Corpus II Tasa de equierror (EER) Area Under Curve (AUC) Suma de ´areas de error 0.551 0.459 nNegro: 0.465 Blanco: 0.431 ´ Areas de error por separado Negro 0.205 0.872 Blanco 0.576 0.429 Tabla 8.7: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del sistema de referencia con el Corpus II. Empleando la suma de las ´areas de error los valores del AUC y de la EER son bastante pobres, dando lugar a un sistema que clasificar´ıa mal m´as del 50 % de las observaciones en el punto de la tasa de equierror. El uso por separado de las ´areas de error relativas destaca de nuevo c´omo la clasificaci´on de los defectos blancos es mucho m´as complicada. La clasificaci´on para los defectos negros es mejor atendiendo tanto al AUC como a la EER. Los modelos de umbral ajustado seleccionados mediante tasa de equierror obtienen resultados mediocres, tal y como podemos observar en las matrices de confusi´on y en la tasa de acierto estimada (Tablas 8.8 y 8.9). Sistema de referencia (1 umbral) -Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 1748 54 1802 Con defecto 2145 53 2198 3893 107 4000 Tasa de acierto: 44.95 % Intervalo de confianza del 95 %: (40.07, 49.82) •Sensibilidad: 49.53 % •Especificidad: 44.90 % Tabla 8.8: Matriz de confusi´on y tasa de acierto con el uso de 1 umbral (´area relativa de error en negro + ´area relativa de error en blanco) en Corpus II. Sistema de referencia (2 umbrales) -Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 1997 97 2094 Con defecto 1896 10 1906 3893 107 4000 Tasa de acierto: 50.17 % Intervalo de confianza del 95 %: (45.27, 55.07) •Sensibilidad: 9.34 % •Especificidad: 51.29 % Tabla 8.9: Matriz de confusi´on y tasa de acierto con el uso de 2 umbrales (uno para ´area relativa de error en negro y otro para la de blanco) en Corpus II. Los resultados parecen indicarnos que emplear un umbral da lugar a una clasificaci´on m´as equilibrada. Los valores de la sensibilidad y especificidad son bajos, especialmente en el modelo de dos umbrales d´onde la especificidad roza el 10 %. Por lo tanto, mientras que en el Corpus I se buscar´a refinar la precisi´on de un sistema que ya funciona bien por umbrales, en el Corpus II a´un se puede mejorar mucho. 67
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS 8.3. Regresi´on Log´ıstica Siguiendo las pautas de la secci´on 7.2 se ha valorado la precisi´on de varios modelos de regresi´on log´ıstica. Tal y como se describi´o en este apartado, en las distintas secciones correspondientes a cada conjunto de datos de los Corpus aparecer´a especificado el modelo ´optimo seleccionado entre: 1. Selecci´on recursiva de variables y la resoluci´on de la optimizaci´on mediante penalizaci´on L2. 2. Usando la penalizaci´on L1. Esta ya cuenta con una capacidad intr´ınseca para crear coeficientes dispersos o nulos. Corpus I 8.3.0.1. Conjunto de datos A Modelo ´optimo: 48 variables. Seleccionado bajo el criterio de m´axima tasa de acierto estimada por validaci´on cruzada. Obtenido mediante regularizaci´on L1. AreaErrorN y AreaErrorB. PCA: CompPrinOr1, CompPrinOr2, CompPrinOr3, CompPrinOr4, CompPrinTratB1, CompPrinTratB2, CompPrinTratN1, CompPrinTratN2. DCT: imagen sin binarizar: todas las componentes menos 26; imagen binarizada: 1, 6, 9, 12, 13, 15, 19, 25, 28. Figura 8.13: Curvas ROC de regresi´on log´ıstica empleando el conjunto de datos A del Corpus I. Resultados de la Regresi´on Log´ıstica en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos A 0.070 ±0.04 0.971 ±0.02 nNegro: 0.977 ±0.02 Blanco: 0.862 ±0.11 Tabla 8.10: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo de regresi´on log´ıstica creado a partir del conjunto A de datos del Corpus I. 68
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Los resultados relacionados con la curva ROC y la tasa de equierror aparecen en la Figura 8.13 y en la Tabla 8.10. Los resultados son excelentes: la tasa de equierror es baja (cercana al 7 %) y el ´area bajo la curva ROC es bastante grande. El AUC de la curva correspondiente a la clasificaci´on de defectos blancos pone de manifiesto la dificultad de la detecci´on de ´estos. El modelo de regresi´on log´ıstica con el conjunto de datos A del Corpus I da lugar a un clasificador cuya tasa de acierto es altamente similar a la del sistema de referencia (Tabla 8.11). El n´umero de tableros etiquetados err´oneamente como defectuosos ha aumentado -haciendo que la especificidad empeore notablemente- y han disminuido los falsos negativos. Sistema de regresi´on log´ıstica -Conjunto de datos A, Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 546 136 682 Con defecto 163 6322 6485 709 6458 7167 Tasa de acierto: 95.82 % Intervalo de confianza del 95 %: (94.14, 97.52) •Sensibilidad: 97.89 % •Especificidad: 77.00 % Tabla 8.11: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo de regresi´on log´ıstica del Corpus I con el conjunto de datos A obtenido con regularizaci´on L1. 8.3.0.2. Conjunto de datos B Modelo ´optimo: 63 variables. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. Obtenido mediante regularizaci´on L1. AreaErrorB y AreaErrorN. Estad´ısticos: MediaOr, VarianzaOr, SkewnessOr, KurtosisOr, MedianaOr, P10Or, P90Or, MediaTratadaB, VarianzaTratadaB, SkewnessTratadaB, MedianaTratadaB, P10TratadaB, P90TratadaB, MediaTratadaN, SkewnessTratadaN, KurtosisTratadaN, MedianaTratadaN, P10TratadaN , P90TratadaN. DCT: imagen sin binarizar: todas las componentes menos la 24; imagen binarizada: 1, 7, 12, 13, 15, 17, 18, 19, 20, 23, 24, 25, 26. Figura 8.14: Curvas ROC de regresi´on log´ıstica empleando el conjunto de datos B del Corpus I. 69
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS Resultados de la Regresi´on Log´ıstica en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos B 0.090 ±0.07 0.954 ±0.05 nNegro: 0.977 ±0.03 Blanco: 0.867 ±0.12 Tabla 8.12: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo de regresi´on log´ıstica creado a partir del conjunto B de datos del Corpus I. Los resultados relacionados con la curva ROC y la tasa de equierror aparecen en la Figura 8.14 y en la Tabla 8.12. Se trata de resultados altamente similares a los del conjunto A, quiz´a algo peores al haber aumentado la tasa de equierror y disminuido el ´area bajo la curva ROC de defecto general. El modelo seleccionado reitera las conclusiones sacadas a partir de la curva ROC y la EER en cuanto que los resultados son algo peores que con el conjunto de datos A. El conjunto de datos B logra un resultado aparentemente peor o muy similar al del sistema de referencia con el Corpus I (Tabla 8.13). Existe una diferencia notable entre la especificidad y la sensibilidad. Sistema de regresi´on log´ıstica -Conjunto de datos B, Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 445 71 516 Con defecto 264 6387 6651 709 6458 7167 Tasa de acierto: 95.32 % Intervalo de confianza del 95 %: (93.54, 97.10) •Sensibilidad: 98.90 % •Especificidad: 62.76 % Tabla 8.13: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo de regresi´on log´ıstica del Corpus I con el conjunto de datos B obtenido con regularizaci´on L1. Corpus II 8.3.0.3. Conjunto de datos A Modelo ´optimo: 49 variables. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. Obtenido mediante regularizaci´on L1. AreaErrorB. PCA: CompPrinOr1, CompPrinOr2, CompPrinOr3, CompPrinOr4, CompPrinTratB1, CompPrinTratB2, CompPrinTratN1, CompPrinTratN2. DCT: imagen sin binarizar: todas las componentes; imagen binarizada: 4, 8, 9, 13, 17, 25, 26, 27, 29, 30. Resultados de la Regresi´on Log´ıstica en el Corpus II Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos A 0.428 ±0.14 0.610 ±0.18 nNegro: 0.594 ±0.23 Blanco: 0.624 ±0.27 Tabla 8.14: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo de regresi´on log´ıstica creado a partir del conjunto A de datos del Corpus II. Los resultados relacionados con la curva ROC y la tasa de equierror aparecen en la Figura 8.15 y en la Tabla 8.14. Se puede observar evidencia que podr´ıa indicar que este sistema es algo mejor que el sistema de referencia, como el aumento del AUC y la disminuci´on de la EER. Esta es a´un as´ı muy elevada, siendo cercana al 40 %. 70
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Figura 8.15: Curvas ROC de regresi´on log´ıstica empleando el conjunto de datos A del Corpus II. El modelo con el umbral de clasificaci´on ajustado alcanza de manera global una precisi´on mucho mejor que el sistema de referencia (Tabla 8.15). La observaci´on detallada de la matriz de confusi´on nos permite concluir que la detecci´on de im´agenes con defectos ha empeorado significativamente a costa de una mejora detectando im´agenes sin defectos. Esto hace que la sensibilidad sea muy baja y la especificidad muy alta: el clasificador, por lo tanto, carecer´a de una buena capacidad clasificadora. Sistema de regresi´on log´ıstica -Conjunto de datos A, Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 3874 105 3979 Con defecto 19 2 21 3893 107 4000 Tasa de acierto: 96.85 % Intervalo de confianza del 95 %: (94.87, 98.83) •Sensibilidad: 1.87 % •Especificidad: 99.51 % Tabla 8.15: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo de regresi´on log´ıstica del Corpus II con el conjunto de datos A obtenido con regularizaci´on L1. 8.3.0.4. Conjunto de datos B Modelo ´optimo: 41 variables. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. Obtenido mediante regularizaci´on L2. AreaErrorN. Estad´ısticos: MediaOr, VarianzaOr, MedianaOr, P10Or, P90Or, MediaTratadaB, SkewnessTratadaB, KurtosisTratadaB, MedianaTratadaB, MediaTratadaN, SkewnessTratadaN, KurtosisTratadaN, P10TratadaN. DCT: imagen sin binarizar: 1, 2, 4, 6, 7, 16, 27, 28, 29; imagen binarizada: 3, 4, 5, 6, 7, 9, 10, 11, 15, 16, 17, 19, 20, 22, 24, 26, 28, 29. 71
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS Figura 8.16: Curvas ROC de regresi´on log´ıstica empleando el conjunto de datos B del Corpus II. Resultados de la Regresi´on Log´ıstica en el Corpus II Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos B 0.360 ±0.37 0.644 ±0.20 nNegro: 0.680 ±0.19 Blanco: 0.456 ±0.32 Tabla 8.16: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo de regresi´on log´ıstica creado a partir del conjunto B de datos del Corpus II. Las curvas ROC aparecen representadas en la Figura 8.16. Diversos resultados relevantes se encuentran reflejados en la Tabla 8.16. El clasificador inducido con el conjunto B de datos es mejor que el obtenido con el A si tomamos como criterio la tasa de equierror. Si tomamos el ´area bajo la curva ROC del defecto general, son dos sistemas muy similares. La detecci´on de defectos blancos no parece ser muy satisfactoria. La tasa de acierto correspondiente al modelo de regresi´on log´ıstica inducido es mucho mejor que la del sistema de referencia (Tabla 8.17). La detecci´on de im´agenes sin defectos tiene una precisi´on algo inferior a la correspondiente al clasificador inducido con el conjunto A de datos, mientras que la detecci´on de tablero con defectos ha mejorado. A´un hay mucho margen para mejorar, ya que el n´umero de tableros con defectos bien clasificados no alcanza a ser ni el 50 %. Sistema de regresi´on log´ıstica -Conjunto de datos B, Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 3847 85 3932 Con defecto 46 22 68 3893 107 4000 Tasa de acierto: 96.72 %. Intervalo de confianza del 95 %:(94.71, 98.74) •Sensibilidad: 20.56 % •Especificidad: 98.82 % Tabla 8.17: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo de regresi´on log´ıstica del Corpus II con el conjunto de datos B obtenido con regularizaci´on L2. 72
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica La Tabla resumen 8.18 muestra el n´umero de variables, ´area bajo la curva ROC y tasa de equierror de los modelos de regresi´on log´ıstica. Tambi´en aparece la tasa de acierto estimada por validaci´on cruzada del modelo elegido. Podemos observar c´omo en el caso del Corpus I solo el clasificador creado con el primer conjunto de datos mejora aparentemente y de forma muy leve la precisi´on del sistema de referencia. Los valores de la ´area bajo la curva ROC y la tasa de equierror son altamente satisfactorios. En el caso del Corpus II, la mejora es significativa en lo que se refiere a tasa de acierto, superando con creces el funcionamiento del sistema de referencia. Este dato puede ser enga˜noso, ya que la detecci´on de im´agenes con defectos deja mucho que desear como se puede observar en las matrices de confusi´on expuestas y los valores de la sensibilidad. No se trata de modelos equilibrados en los que la tasa de falsos negativos y de falsos positivos sea similar, por lo que su capacidad clasificadora es dudosa. Esto se ve reflejado claramente en la tabla por los bajos valores de la AUC y los altos valores de la tasa de equierror. Los modelos regularizados con la norma 1 que han resultado ser los ´optimos (Corpus I: conjuntos de datos A y B; Corpus II: conjunto de datos A) se caracterizan por una alta dimensionalidad relativa si los comparamos con los que ser´ıan resultado de la selecci´on recursiva de variables y de la regularizaci´on L2, como ser´ıa el caso del modelo del conjunto de datos B del Corpus II. Resultados de los modelos de regresi´on log´ıstica Corpus I Corpus II Variables EER AUC Tasa de acierto Variables EER AUC Tasa de acierto Conjunto A 48 0.070 0.971 95.82 % 49 0.428 0.610 96.85 % Conjunto B 63 0.090 0.954 95.32 % 41 0.331 0.608 96.72 % Tabla 8.18: N´umero de variables, AUC y EER, as´ı como tasa de acierto estimada por validaci´on cruzada del modelo seleccionado, de los sistemas de regresi´on log´ıstica haciendo uso de los conjuntos de datos A y B en ambos Corpus. 8.4. Support Vector Machine Siguiendo las pautas de la secci´on 7.3 se han estudiado las curvas ROC y tasas de equierror de los sistemas de Support Vector Machine. Posteriormente se ha valorado la tasa de acierto alcanzada por los modelos seleccionados. En todos los casos desarrollados se ha optimizado el valor del par´ametro de regularizaci´on λ. A lo largo de las siguientes subsecciones se exponen los resultados del uso de tres n´ucleos diferentes: 1. Lineal. Al emplear penalizaci´on L1 se realiza intr´ınsecamente la selecci´on de variables quedando ciertos coeficientes nulos. Suponen una excepci´on de cara a la metodolog´ıa empleada, ya que tal y como se coment´o en la implementaci´on utilizada, los SVM de n´ucleo lineal no contar´an en esta secci´on con curvas ROC ni tasa de equierror. Esto se debe a que la implementaci´on usada, al igual que la mayor´ıa de implementaciones de SVM lineales, al usar regularizaci´on L1 no puede tener como salida probabilidades. Por lo tanto, se valorar´an unicamente las matrices de confusi´on as´ı como la tasa de acierto, especificidad y sensibilidad. 2. Polin´omico. Creado a partir de todas las variables, se especificar´a con cada modelo cual es el grado pdel polinomio usado. 3. De base radial. Emplea la totalidad de las variables del conjunto. Se ha optimizado el valor del parametro del n´ucleo σ. 73
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS Figura 8.20: Curvas ROC de Support Vector Machine de n´ucleo polin´omico de grado p= 3 empleando el conjunto de datos B del Corpus II. Una vez ajustado el umbral de clasificaci´on, podemos definir un modelo cuyos resultados est´an en la Tabla 8.30. El procedimiento sigue teniendo dificultades para distinguir los tableros con defectos. La sensibilidad del modelo toma un valor demasiado bajo, cercano al 10 %. Funciona mejor que el obtenido con el conjunto A y parece tener un comportamiento similar al correspondiente SVM de n´ucleo lineal. Sistema de Support Vector Machine de n´ucleo polin´omico -Conjunto de datos B, Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 3857 96 3953 Con defecto 36 11 47 3893 107 4000 Tasa de acierto: 96.70 %. Intervalo de confianza del 95 %:(93.75, 98.20) •Sensibilidad: 10.28 % •Especificidad: 99.07 % Tabla 8.30: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo SVM de n´ucleo polin´omico de grado p= 3 del Corpus II con el conjunto de datos B. 8.4.3. N´ucleo de base radial (RBF) Corpus I 8.4.3.1. Conjunto de datos A Modelo ´optimo. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. 70 variables, todas las del conjunto de datos. El valor ´optimo de σelegido mediante validaci´on cruzada ha sido 4.082. Las curvas ROC (Figura 8.21) y las medidas relacionadas as´ı como la tasa de equierror (Tabla 8.31) apuntan la obtenci´on de un clasificador de excelentes resultados similares a los de la regresi´on log´ıstica o el sistema de referencia. Destaca la cercan´ıa de las AUC de blanco y negro: es un modelo diestro detectando ambos tipos de defectos. 80
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Figura 8.21: Curvas ROC de Support Vector Machine de n´ucleo de base radial con σ= 4.082 empleando el conjunto de datos A del Corpus I. Resultados de Support Vector Machine de n´ucleo de base radial en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos B 0.086 ±0.05 0.964 ±0.03 nNegro: 0.946 ±0.04 Blanco: 0.918 ±0.06 Tabla 8.31: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo Support Vector Machine de n´ucleo de base radial con σ= 4.082 creado a partir del conjunto A de datos del Corpus I. En la Tabla 8.32 podemos observar que la mayor flexibilidad del n´ucleo de funci´on de base radial ha dado lugar a un clasificador bastante satisfactorio. Tiene una tasa de acierto superior al sistema de referencia y a los modelos de regresi´on log´ıstica y Support Vector Machines anteriores. Parece tener mayores dificultades distinguiendo el tablero sin defectos aunque la especificidad est´a m´as cerca de la sensibilidad que en otros modelos. Sistema de Support Vector Machine de n´ucleo de base radial -Conjunto de datos A, Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 570 59 629 Con defecto 139 6399 6538 709 6458 7167 Tasa de acierto: 97.24 %. Intervalo de confianza del 95 %:(95.85, 98.62) •Sensibilidad: 99.08 % •Especificidad: 80.39 % Tabla 8.32: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo SVM de n´ucleo de base radial con σ= 4.082 del Corpus I con el conjunto de datos A. 8.4.3.2. Conjunto de datos B Modelo ´optimo. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. 83 variables, todas las del conjunto de datos. El valor ´optimo de σelegido mediante validaci´on cruzada ha sido 5. 81
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS Figura 8.22: Curvas ROC de Support Vector Machine de n´ucleo de base radial con σ= 5 empleando el conjunto de datos B del Corpus I. Resultados de Support Vector Machine de n´ucleo de base radial en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos B 0.066 ±0.05 0.962 ±0.05 nNegro: 0.980 ±0.02 Blanco: 0.948 ±0.04 Tabla 8.33: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo Support Vector Machine de n´ucleo de base radial con σ= 5 creado a partir del conjunto B de datos del Corpus I. Tanto la tabla con los valores de las AUC y la tasa de equierror (Tabla 8.27) como las curvas ROC (Figura 8.19) se˜nalan que el modelo obtenido es excelente, incluso algo mejor que el SVM de base radial obtenido con el conjunto de datos A. La conclusi´on extra´ıda a partir de las curvas ROC y de la tasa de equierror se reitera en la tabla de resultados del modelo ajustado (Tabla 8.34). El modelo obtenido a partir conjunto de datos B satisface las metas logradas por el modelo optimizado creado con el conjunto de datos A, superando el rendimiento del sistema de referencia y los modelos de regresi´on log´ıstica y Support Vector Machine de n´ucleo lineal y de n´ucleo polin´omico. Aparentemente es un modelo cuya tasa de acierto es ligeramente mejor que la obtenida con el Support Vector Machine ´optimo de n´ucleo de base radial del conjunto de datos A pero sigue teniendo un problema de abundancia de falsos positivos a la hora de clasificar. Sistema de Support Vector Machine de n´ucleo de base radial -Conjunto de datos B, Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 569 51 620 Con defecto 138 6407 6545 709 6458 7167 Tasa de acierto: 97.34 %. Intervalo de confianza del 95 %:(95.98, 98.70) •Sensibilidad: 99.21 % •Especificidad: 80.48 % Tabla 8.34: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo SVM de n´ucleo de base radial con σ= 5 del Corpus I con el conjunto de datos B. 82
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Corpus II Para los modelos referidos al Corpus II ha sido necesario dar mayor peso a las observaciones de im´agenes defectuosas. Se ha aportado el triple de peso a estas. De no hacerse de esta forma, el entrenamiento no se realizaba correctamente y daba lugar a un clasificador desequilibrado sin capacidad clasificadora. 8.4.3.3. Conjunto de datos A Modelo ´optimo. Seleccionado bajo criterio de m´aximo F-Score estimado por validaci´on cruzada. 70 variables, todas las del conjunto de datos. El valor ´optimo de σelegido mediante validaci´on cruzada ha sido 4.082. Figura 8.23: Curvas ROC de Support Vector Machine de n´ucleo de base radial con σ= 4.082 empleando el conjunto de datos A del Corpus II. Resultados de Support Vector Machine de n´ucleo de base radial en el Corpus II Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos A 0.400 ±0.12 0.613 ±0.17 nNegro: 0.593 ±0.19 Blanco: 0.584 ±0.24 Tabla 8.35: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo Support Vector Machine de n´ucleo de base radial con σ= 4.082 creado a partir del conjunto A de datos del Corpus II. Valores mediocres para el ´area bajo la curva y la tasa de equierror (Tabla 8.35) as´ı como la posici´on de los puntos de las curvas ROC (Figura 8.23) apuntan a la obtenci´on de un modelo con una capacidad clasificadora reducida. La complejidad superior del n´ucleo de base radial no logra crear un clasificador equilibrado, ya que sigue teniendo dificultades con las im´agenes correspondientes a tableros con alg´un tipo de defecto (Tabla 8.36). Aunque la tasa de acierto haya disminuido, clasifica mal menos tableros con defectos que los modelos Support Vector Machines anteriores, dando lugar a una sensibilidad algo m´as alta. 83
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS Sistema de Support Vector Machine de n´ucleo de base radial -Conjunto de datos A, Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 3676 89 3765 Con defecto 218 18 235 3893 107 4000 Tasa de acierto: 92.35 %. Intervalo de confianza del 95 %:(89.34, 95.36) •Sensibilidad: 16.82 % •Especificidad: 94.40 % Tabla 8.36: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo SVM de n´ucleo de base radial con σ= 4.082 del Corpus II con el conjunto de datos A. 8.4.3.4. Conjunto de datos B Modelo ´optimo. Seleccionado bajo criterio de m´aximo F-Score estimado por validaci´on cruzada. 83 variables, todas las del conjunto de datos. El valor ´optimo de σelegido mediante validaci´on cruzada ha sido 5. Figura 8.24: Curvas ROC de Support Vector Machine de n´ucleo de base radial con σ= 5 empleando el conjunto de datos B del Corpus II. Resultados de Support Vector Machine de n´ucleo de base radial en el Corpus II Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos B 0.380 ±0.13 0.730 ±0.15 nNegro: 0.726 ±0.16 Blanco: 0.392 ±0.20 Tabla 8.37: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del modelo Support Vector Machine de n´ucleo de base radial con σ= 5 creado a partir del conjunto B de datos del Corpus II. El modelo es capaz de obtener el ´area bajo la curva de defecto general m´as alto a la vez que una tasa de equierror no muy elevada en relaci´on con los modelos anteriores del Corpus II (Tabla 8.35). Las curvas ROC de defecto general y negro se distribuyen de una forma correcta mientras que la de defectos blancos, con un valor de la AUC paup´errimo, evidencia una detecci´on de defectos blancos imprecisa (Figura 8.23). 84
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica La Tabla 8.38 nos muestra c´omo el modelo ´optimo alcanzado da lugar a una clasificaci´on similar a la obtenida con los m´etodos previos. Parece ser el mejor modelo creado hasta ahora para el Corpus II ya que aparentemente clasifica correctamente casi un 20 % de las muestras de im´agenes con defectos que recibe, m´as que los modelos de este Corpus de vector soporte anteriores y de regresi´on log´ıstica. Su sensibilidad a´un es demasiado baja por lo que el margen de mejora es amplio. Sistema de Support Vector Machine de n´ucleo de base radial -Conjunto de datos B, Corpus II- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 3789 86 3875 Con defecto 104 21 125 3893 107 4000 Tasa de acierto: 95.25 %. Intervalo de confianza del 95 %:(92.84, 97.66) •Sensibilidad: 19.63 % •Especificidad: 97.33 % Tabla 8.38: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo SVM de n´ucleo de base radial con σ= 5 del Corpus II con el conjunto de datos B. La Tabla resumen 8.39 muestra los resultados obtenidos con Support Vector Machines de n´ucleo lineal, polin´omico y de base radial. Con respecto al Corpus I podemos destacar c´omo el mejor resultado se alcanza con el n´ucleo de base radial y el conjunto de datos B si tomamos como criterio de selecci´on la tasa de equierror o la tasa de acierto del modelo ajustado. El AUC estimado es pr´acticamente el mismo que el del modelo con el conjunto de variables A. El n´ucleo polin´omico de grado dos empleado parece haber dado lugar a un caso de sobreajuste: aunque el error en el conjunto de entrenamiento era inferior que en el caso del n´ucleo lineal, el error de generalizaci´on estimado por validaci´on cruzada que aparece en la tabla es mayor. Los resultados con el Corpus II no son satisfactorios en su inmensa mayor´ıa: la alta tasa de acierto es enga˜nosa, ya que el estudio de las matrices de confusi´on mostradas a lo largo de esta secci´on revelan la escasa capacidad de clasificaci´on existente en lo que se refiere a las im´agenes con defectos. El modelo m´as equilibrado, capaz de clasificar correctamente el 20 % de las muestras de tablero con defectos, ha sido el que ha resultado ´optimo tambi´en en el caso del Corpus I: el SVM de n´ucleo de base radial creado con el conjunto de datos B. Cabe destacar como este modelo es aquel con m´as ´area bajo la curva ROC de los creados a partir del Corpus II. Tasa de acierto estimada de los modelos de Support Vector Machine Corpus I Corpus II Variables EER AUC Tasa de acierto Variables EER AUC Tasa de acierto Lineal Conjunto A 39 - - 96.97 % 49 - - 97.25 % Conjunto B 37 - - 97.05 % 63 - - 97.38 % Polin. Conjunto A 70 0.111 0.937 96.66 % 70 0.512 0.544 95.97 % Conjunto B 83 0.117 0.922 96.76 % 83 0.532 0.491 96.70 % RBF Conjunto A 70 0.086 0.964 97.24 % 70 0.400 0.613 92.35 % Conjunto B 83 0.066 0.962 97.34 % 83 0.380 0.730 95.25 % Tabla 8.39: N´umero de variables, AUC y EER, as´ı como tasa de acierto estimada por validaci´on cruzada del modelo seleccionado, de los sistemas de Support Vector Machine de n´ucleo lineal, Polin´omico (Polin.) y de base radial (RBF) haciendo uso de los conjuntos de datos A y B en ambos Corpus. 85
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS 8.5. Redes Neuronales De acuerdo a la metodolog´ıa establecida en la secci´on 7.4 se han desarrollado los distintos tipos de redes neuronales. En cada una de las secciones que sigue se especifica la arquitectura de la red en forma de gr´afico. Las redes neuronales desarrolladas han sido las siguientes: 1. Perceptr´on multicapa. Mediante validaci´on cruzada se han seleccionado la arquitectura de la red, la funci´on de activaci´on de las neuronas y el valor de αcomo par´ametro de regularizaci´on tal que el valor de la tasa de error estimada fuese m´ınimo. 8.5.1. Perceptr´on Multicapa (MLP) Corpus I En los modelos creados a partir de los conjuntos de datos extra´ıdos del Corpus I de im´agenes ha sido necesario dar el doble de peso a las observaciones de im´agenes sin defectos al existir menos representaci´on de esta clase en el conjunto de datos. 8.5.1.1. Conjunto de datos A Modelo ´optimo. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. Funci´on de activaci´on: unidad lineal rectificada (ReLU). Arquitectura (Figura 8.25): •Capa de entrada: 70 neuronas (una por variable del conjunto). •Capas ocultas: tres capas con respectivamente 3, 3 y 5 neuronas. •Capa de salida: 1 neurona. Figura 8.25: Estructura ´optima para el perceptr´on multicapa inducido con el conjunto de datos A del Corpus I. El perceptr´on multicapa ´optimo creado a partir de los datos del conjunto A en el caso del Corpus I consta de tres capas ocultas y emplea la funci´on de activaci´on de la unidad lineal rectificada. 86
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Figura 8.26: Curvas ROC del perceptr´on multicapa empleando el conjunto de datos A del Corpus I. Resultados del perceptr´on multicapa en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos A 0.101 ±0.10 0.956 ±0.03 nNegro: 0.975 ±0.08 Blanco: 0.910 ±0.08 Tabla 8.40: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del perceptr´on multicapa creado a partir del conjunto A de datos del Corpus I. El perceptr´on multicapa seleccionado logra valores para las ´areas bajo las curvas ROC altamente satisfactorios as´ı como un valor de la tasa de equierror del 10 % de observaciones mal-clasificadas para cada una de las clases (Tabla 8.40). Las curvas ROC indican que el sistema es capaz de detectar de forma balanceada defectos blancos y negros (Figura 8.26). El modelo con el umbral de clasificaci´on definido da lugar a una tasa de acierto altamente satisfactoria que supera las obtenidas con los procedimientos anteriores de aprendizaje y el sistema de referencia (Tabla 8.41). Se trata de un modelo mucho m´as equilibrado que los anteriores, ya que la diferencia en n´umero entre falsos negativos y falsos positivos no es tan significativa. Sistema perceptr´on multicapa -Conjunto de datos A, Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 618 93 711 Con defecto 91 6365 6456 709 6458 7167 Tasa de acierto: 97.43 %. Intervalo de confianza del 95 %:(96.09, 98.77) •Sensibilidad: 98.55 % •Especificidad: 87.16 % Tabla 8.41: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo de perceptr´on multicapa del Corpus I con el conjunto de datos A. 87
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 8. RESULTADOS 8.5.1.2. Conjunto de datos B Modelo ´optimo. Seleccionado bajo criterio de m´axima tasa de acierto estimada por validaci´on cruzada. Funci´on de activaci´on: unidad lineal rectificada (ReLU). Arquitectura (Figura 8.27): •Capa de entrada: 83 neuronas (una por variable del conjunto). •Capas ocultas: tres capas de tres neuronas cada una. •Capa de salida: 1 neurona. La funci´on lineal rectificada as´ı como una arquitectura muy similar a la ´optima en el caso del conjunto de datos A parece ser la estructura ´optima para el perceptr´on con este conjunto de datos. Figura 8.27: Estructura ´optima para el perceptr´on multicapa inducido con el conjunto de datos B del Corpus I. El modelo obtenido logra una tasa de equierror muy baja as´ı como un ´area bajo la curva ROC de valor alto (Tabla 8.42). Las curvas ROC de cada uno de los tipos de defectos son equilibradas y satisfactorias (Figura 8.28). Resultados del perceptr´on multicapa en el Corpus I Tasa de equierror (EER) Area Under Curve (AUC) Conjunto de datos B 0.083 ±0.06 0.930 ±0.08 nNegro: 0.975 ±0.03 Blanco: 0.928 ±0.07 Tabla 8.42: Estimaci´on de la tasa de equierror y el ´area bajo la curva ROC del perceptr´on multicapa creado a partir del conjunto B de datos del Corpus I. El modelo ajustado es capaz de obtener un resultado muy satisfactorio (Tabla 8.43). Este modelo parece funcionar algo peor que el obtenido con el conjunto de datos A, pero la diferencia es ´ınfima: la observaci´on detallada de las matrices de confusi´on nos hace percatarnos de que la tasa de acierto y el n´umero de falsos positivos y falsos negativos es pr´acticamente el mismo. 88
CAP´ ITULO 8. RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Figura 8.28: Curvas ROC del perceptr´on multicapa empleando el conjunto de datos B del Corpus I. Sistema perceptr´on multicapa -Conjunto de datos B, Corpus I- Clase Sin Defecto Con defecto Etiqueta Sin Defecto 617 96 711 Con defecto 92 6362 6456 709 6458 7167 Tasa de acierto: 97.37 %. Intervalo de confianza del 95 %:(96.02, 98.72) •Sensibilidad: 98.51 % •Especificidad: 87.02 % Tabla 8.43: Matriz de confusi´on y tasa de acierto correspondiente del modelo ´optimo de perceptr´on multicapa del Corpus I con el conjunto de datos B. Corpus II Para los modelos del Corpus II ha sido necesario dar el triple de peso a las observaciones de im´agenes defectuosas en compensaci´on por su escasez con respecto a la otra clase. Los modelos ´optimos se han seleccionado en base a la tasa de acierto y a su equilibrio, es decir, que el n´umero de falsos positivos y de falsos negativos fuese similar. 8.5.1.3. Conjunto de datos A Modelo ´optimo. Seleccionado bajo criterio de m´aximo F-Score estimado por validaci´on cruzada. Funci´on de activaci´on: tangente hiperb´olica. Arquitectura (Figura 8.29): •Capa de entrada: 70 neuronas (una por variable del conjunto). •Capas ocultas: tres capas de tres neuronas cada una. •Capa de salida: 1 neurona. El modelo escogido cuenta con tres capas ocultas homog´eneas de tres neuronas en las que la funci´on de activaci´on es la tangente hiperb´olica. 89
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS En el Corpus I, el mejor modelo seg´un el valor de la tasa de equierror es, a pesar de sus simpleza, el sistema de referencia. Los tres mejores modelos de aprendizaje supervisado seg´un esta medida han sido los SVM de n´ucleo de base radial con el conjunto de datos B, la regresi´on log´ıstica con el A y el perceptr´on multicapa con el conjunto B de variables. La ventaja que ofrece la regresi´on log´ıstica es emplear un subconjunto reducido de variables sobre el total. Empleando el ´area bajo la curva ROC como medida comparativa, el modelo de SVM de base radial con el conjunto de datos A sustituye al perceptr´on multicapa con el conjunto de los estad´ısticos como tercer mejor modelo de reconocimiento de patrones. El sistema de referencia logra empatar esta marca. En el caso del Corpus II, los modelos de regresi´on log´ıstica, SVM de n´ucleo RBF y los MLP logran resultados medios con tasas de equierror inferiores al 45 %. El resto de modelos logran resultados bastante pobres, especialmente el sistema de referencia que da lugar a un modelo de clasificaci´on en el que la asignaci´on al azar ser´ıa m´as eficaz. Las Figuras 9.1 y 9.2 muestran mediante gr´aficos de l´ıneas las estimaciones realizadas de ´area bajo la curva ROC y la probabilidad complementaria a la tasa de equierror: 1 −EER, a la que he denominado tasa de equiacierto, asociadas a los modelos creados con los conjuntos de datos A y B extra´ıdos de los Corpus I y II respectivamente. Es importante destacar la diferencia de escala existente en ambas Figuras. ●● ● ●● ● ● ● ● ●● ● ● ● ● ●● ● ● ● ● ● ●● ● ● ● ● ● ● ●●● ● ● ● ● ● ● ●● ●●● Conjunto A Conjunto B Sistema de referencia Regresión Logística SVM: núcleo Polinómico SVM: núcleo RBF Perceptrón multicapa Discriminante Lineal Discriminante Cuadrático Árbol de decisión C4.5 Random Forest Adaptive Boosting Bayesian Ad. Reg. Trees 0.900 0.925 0.950 0.975 1.000 0.900 0.925 0.950 0.975 1.000 Metodología y conjunto de datos Valor Medida ● ● 1−EER AUC Según metodología y conjunto de variables AUC y 1−EER − Corpus I Figura 9.1: AUC y tasa de equiacierto para cada uno de los conjuntos de datos del Corpus I y metodolog´ıa empleada. Podemos extraer una serie de conclusiones similares a las obtenidas a partir de la Tabla 9.1. Mientras que los resultados del Corpus I son bastante similares y uniformes, los del Corpus II son mucho m´as variables debido a la resoluci´on m´as pobre de las im´agenes. Podemos comentar como el ´area bajo la curva ROC y la tasa de equiacierto, y por tanto la tasa de equierror, son bastante parejas para realizar una comparativa de calidad de las metodolog´ıas empleadas. La Figura 9.3 une en un ´unico gr´afico de l´ıneas las Figuras 9.1 y 9.2, represent´andose en un solo gr´afico el AUC y tasa de equiacierto para ambos Corpus con cada uno de los algoritmos empleados. Como ya hemos comentado, el que los modelos del Corpus I queden por encima de los del Corpus II en su totalidad se debe a la menor resoluci´on del segundo conjunto de im´agenes. 96
CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica ● ● ● ●●●● ● ●●● ● ● ● ● ●● ● ● ● ●● ● ● ● ● ● ● ● ●● ●● ● ● ● ● ●● ● ●● ●● Conjunto A Conjunto B Sistema de referencia Regresión Logística SVM: núcleo Polinómico SVM: núcleo RBF Perceptrón multicapa Discriminante Lineal Discriminante Cuadrático Árbol de decisión C4.5 Random Forest Adaptive Boosting Bayesian Ad. Reg. Trees 0.5 0.6 0.7 0.8 0.9 1.0 0.5 0.6 0.7 0.8 0.9 1.0 Metodología y conjunto de datos Valor Medida ● ● 1−EER AUC Según metodología y conjunto de variables AUC y 1−EER − Corpus II Figura 9.2: ´ Area bajo la curva ROC y tasa de equiacierto para cada uno de los conjuntos de datos del Corpus II y metodolog´ıa empleada. ●●●●●●●●●●● ●●●●●● ●●●● ● ●●●●●●●●●●● ●●●●●●●● ●●● Conjunto A Conjunto B Sistema de referencia Regresión Logística SVM: núcleo Polinómico SVM: núcleo RBF Perceptrón multicapa Discriminante Lineal Discriminante Cuadrático Árbol de decisión C4.5 Random Forest Adaptive Boosting Bayesian Ad. Reg. Trees 0.5 0.6 0.7 0.8 0.9 1.0 0.5 0.6 0.7 0.8 0.9 1.0 Metodología y conjunto de datos Valor Medida ● ● 1−EER AUC Corpus ●Corpus I Corpus II Según metodología y conjunto de variables AUC y 1−EER − Corpus I + II Figura 9.3: ´ Area bajo la curva ROC y tasa de equiacierto para cada uno de los conjuntos de datos de los Corpus I y II (representados con estilos de l´ınea diferentes) y metodolog´ıa empleada. 97
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS Las Figuras 9.4 y 9.5 son una visualizaci´on de la relaci´on existente entre el AUC y el n´umero de variables en funci´on del conjunto de datos y la metodolog´ıa empleadas en el Corpus I y Corpus II. Es relevante destacar que aunque las figuras de los dos Corpus son altamente similares, existe una diferencia de escala significativa en el eje vertical (´area bajo la curva ROC). Se podr´ıa hacer otro par de figuras con la tasa de equierror pero las representaciones que obtendr´ıamos ser´ıan an´alogas a las del AUC. En el Corpus I, en cuanto a los modelos desarrollados en esta memoria, podemos destacar los modelos de SVM de n´ucleo RBF de alta dimensionalidad, los de regresi´on log´ıstica con menos variables y el simple sistema de referencia. Este ´ultimo logra una marca bastante buena para su relativa simpleza, como ya se ha comentado. El rango de valores de los modelos del Corpus II en lo que se refiere a ´area bajo la curva ROC es mucho m´as extenso que en el Corpus I. El sistema de referencia resulta ser excesivamente simple y se aproxima a la asignaci´on azarosa muy posiblemente debido a la pobre calidad de las im´agenes. Destacan los modelos de SVM de base radial y los MLP sobre el resto de los modelos desarrollados en esta memoria aunque resultan ser notablemente inferiores a otras metodolog´ıas desarrolladas en la memoria de estad´ıstica [3]. 98
CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica ● SRef RegLog RegLog SVM−Polin. SVM−Polin. SVM−RBF SVM−RBF MLP MLP LDA LDA QDA QDA C4.5 C4.5 RF RF ADA ADA BART BART 0.92 0.94 0.96 0.98 1.00 0 20 40 60 80 Número de variables Area bajo la Curva (AUC) Algoritmo ● ● ● ● ● ● ● ● ● ● ● AdaBoost Árboles de decisión C4.5 Bayesian Additive Regression Trees Discriminante Cuadrático Discriminante Lineal Perceptrón multicapa Random Forest Regresión Logística Sistema de referencia SVM de núcleo Polinómico SVM de núcleo RBF Conjunto de datos ●− Conjunto A Conjunto B Según metodología y conjunto de variables AUC y número de variables − Corpus I Figura 9.4: ´ Area bajo la curva ROC y n´umero de variables seg´un el conjunto de datos del Corpus I usado y el clasificador empleado. ● SRef RegLog RegLog SVM−Polin. SVM−Polin. SVM−RBF SVM−RBF MLP MLP LDA LDA QDA QDA C4.5 C4.5 RF RF ADA ADA BART BART 0.5 0.6 0.7 0.8 0.9 0 20 40 60 80 Número de variables Area bajo la Curva (AUC) Algoritmo ● ● ● ● ● ● ● ● ● ● ● AdaBoost Árboles de decisión C4.5 Bayesian Additive Regression Trees Discriminante Cuadrático Discriminante Lineal Perceptrón multicapa Random Forest Regresión Logística Sistema de referencia SVM de núcleo Polinómico SVM de núcleo RBF Conjunto de datos ●− Conjunto A Conjunto B Según metodología y conjunto de variables AUC y número de variables − Corpus II Figura 9.5: ´ Area bajo la curva ROC y n´umero de variables seg´un el conjunto de datos del Corpus II usado y el clasificador empleado. 99
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS 9.2. Comparativa de los modelos seg´un precisi´on, especificidad y sensibilidad La Tabla 9.2 refleja las medidas alcanzadas por los modelos desarrolladas en esta memoria relativas a precisi´on, sensibilidad (True Positive Rate -TPR-) y especificidad (True Negative Rate -TNR-) de los sistemas cuyo umbral probabil´ıstico (de Score) de clasificaci´on ha sido asignado seg´un el criterio correspondiente de los resultados. Tal y como se ha detallado en la introducci´on de esta secci´on, se han estimados las medidas en los modelos de an´alisis supervisado mediante validaci´on cruzada de diez particiones. Compendio general de resultados Corpus I Corpus II Variables Precisi´on TPR TNR Variables Precisi´on TPR TNR 00 Sist. Ref. 1 95.75 % 95.80 % 95.34 % 1 45.03 % 49.50 % 44.90 % 01 RLog Conjunto A 48 95.82 % 97.89 % 77.00 % 49 96.85 % 1.87 % 99.51 % Conjunto B 63 95.32 % 98.90 % 62.76 % 41 96.72 % 20.56 % 98.82 % 02 SVM Lin Conjunto A 39 96.97 % 99.00 % 78.27 % 49 97.25 % 0.93 % 99.89 % Conjunto B 37 97.05 % 98.98 % 79.55 % 63 97.38 % 10.28 % 99.76 % Pol Conjunto A 70 96.66 % 98.93 % 74.61 % 70 95.97 % 3.74 % 98.51 % Conjunto B 83 96.76 % 99.10 % 75.46 % 83 96.70 % 10.28 % 99.07 % RBF Conjunto A 70 97.24 % 99.08 % 80.39 % 70 92.35 % 16.82 % 94.40 % Conjunto B 83 97.34 % 99.21 % 80.48 % 83 95.25 % 19.63 % 97.33 % 03 MLP Conjunto A 70 97.43 % 98.55 % 87.16 % 70 91.23 % 16.82 % 93.27 % Conjunto B 83 97.37 % 98.51 % 87.02 % 83 95.20 % 39.25 % 96.74 % Tabla 9.2: N´umero de variables as´ı como tasa de acierto, sensibilidad y especificidad estimada de los modelos estudiados en la memoria de ingenier´ıa inform´atica. En el caso del Corpus I, se obtienen marcas excelentes en los que la precisi´on siempre queda superior al 95 %. La sensibilidad, por encima del 90 % en los modelos estudiados, permanece siempre por encima de la estimaci´on de la tasa de verdaderos negativos o especificidad. Esta preferencia de los clasificadores para asignar la etiqueta positiva (‘defectuoso’) a la hora de predecir muestras se puede achacar a la mayor proporci´on de muestras con defectos dentro del Corpus I. Esto afecta al entrenamiento y ajuste de los modelos. El sistema de referencia, como resultado base, es altamente satisfactorio al superar el 95 % de precisi´on o tasa de acierto. Cabe destacar como los modelos de MLP y de SVM de n´ucleo RBF logran tasas de error cercanas al 3 %. La regresi´on log´ıstica y el resto de modelos de SVM logran precisiones similares al sistema de referencia. En el Corpus II, la precisi´on no resulta ser una magnitud adecuada para estimar la calidad clasificadora de los modelos. La clara asimetr´ıa existente entre las clases del Corpus (tan solo tres im´agenes con defectos por cada cien) resulta en una tasa de acierto muy significativa unicamente etiquetando todas las observaciones como im´agenes carentes de defectos. Los clasificadores, antes este desequilibrio en la muestra de entrenamiento, tienen un claro sesgo ante la clase mayoritaria. La comparativa se deber´a realizar, por lo tanto, empleando la sensibilidad o TPR. El n´umero de modelos que logran sobrepasar, en el proceso de validaci´on cruzada, el 50 % de muestras con defectos bien clasificados es notoriamente bajo: todos los modelos que lo logran se basan en metodolog´ıa de ´arboles de decisi´on y se detallan en la memoria de estad´ıstica [3]. En cuanto a los modelos desarrollados en esta memoria, parece destacar el MLP con el conjunto de variables B. Su resultado dista de ser adecuado como para considerar que el modelo es ´util. Los modelos que logran una marca inferior carecen de forma m´as destacada de utilidad pr´actica. 100
CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Las Figuras 9.6 y 9.7 son representaciones de las medidas relativas a la capacidad discriminatoria (precisi´on, sensibilidad y especificidad) de los modelos de an´alisis supervisado desarrollados con los conjuntos de datos A y B extra´ıdos del Corpus I y Corpus II. Cabe destacar como a pesar de la similitud de ambas Figuras, la diferencia de escala entre ambas es significativa. ●●●●●●●●●●●● ●●●●●●●●●● ● ● ● ●● ● ● ● ● ● ●● ● ● ●●●●●●●●●●●● ●●●●●●●●●●●● ● ● ● ● ● ● ● ●● ●● ● Conjunto A Conjunto B Sistema de referencia Regresión Logística SVM: núcleo Lineal SVM: núcleo Polinómico SVM: núcleo RBF Perceptrón multicapa Discriminante Lineal Discriminante Cuadrático Árbol de decisión C4.5 Random Forest Adaptive Boosting Bayesian Ad. Reg. Trees 60 70 80 90 100 60 70 80 90 100 Modelo y conjunto de datos Medida (%) Medida ● ● ● Especificidad Precisión Sensibilidad Según metodología y conjunto de variables Precisión, sensibilidad y especificidad − Corpus I Figura 9.6: Precisi´on, TPR y TNR para cada uno de los conjuntos de datos del Corpus I y metodolog´ıa empleada. El Corpus I ha dado lugar a modelos con excelentes marcas en los que la especificidad parece ser la ´unica medida algo m´as carente, especialmente en los modelos de regresi´on log´ıstica. El sistema de referencia destaca especialmente al superar el 90 % en las tres tasas. Esto solo lo logran otros modelos desarrollados en la memoria de estad´ıstica. La representaci´on correspondiente al Corpus II sirve de evidencia para reflejar la baja tasa de verdaderos positivos de los modelos. Muchos modelos parecen no haber logrado alcanzar hip´otesis que distingan claramente las im´agenes con tableros defectuosos. Cuatro modelos desarrollados en la memoria de estad´ıstica son los ´unicos capaces de superar el 50 % de observaciones con defectuosas correctamente clasificadas. ● ●●●●●●●●●●● ● ●●● ● ● ●● ● ● ● ● ● ●●●●●●●●●●● ● ●●●●●●●●●●● ● ● ● ● ● ● ● ● ● ● ● ● ● ●●●●●●●●●●● Conjunto A Conjunto B Sistema de referencia Regresión Logística SVM: núcleo Lineal SVM: núcleo Polinómico SVM: núcleo RBF Perceptrón multicapa Discriminante Lineal Discriminante Cuadrático Árbol de decisión C4.5 Random Forest Adaptive Boosting Bayesian Ad. Reg. Trees 0 25 50 75 100 0 25 50 75 100 Modelo y conjunto de datos Medida (%) Medida ● ● ● Especificidad Precisión Sensibilidad Según metodología y conjunto de variables Precisión, sensibilidad y especificidad − Corpus II Figura 9.7: Precisi´on, TPR y TNR para cada uno de los conjuntos de datos del Corpus II y metodolog´ıa empleada. 101
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS 9.3. Discusi´on sobre modelos En esta secci´on se ha hecho un Spider Plot o representaci´on de malla del ranking que ocupa cada modelo con respecto al resto de los creados para ese Corpus. Las representaciones se han realizado de tal forma que cuanto mayor sea el ´area recogida por el modelo, mayor calidad tendr´a este con respecto al resto. En los casos en los que se diese un empate, se ha asignado el ranking correspondiente a la posici´on m´axima. Las cinco medidas elegidas para la representaci´on han sido las siguientes: N´umero de variables. Se ha establecido un ranking decreciente: cuantos m´as atributos tenga el modelo, menor ser´a el ranking del modelo. Cabe a destacar que esta medida ser´a de menor relevancia por dos motivos: 1. Muchos modelos emplean variables cuya medici´on requiere la extracci´on de la totalidad de las variables (como es el caso una componente avanzada de la DCT). 2. Todos los modelos estudiados ofrecen una clasificaci´on de nuevas muestras pr´acticamente instant´anea. Precisi´on. Se ha establecido un ranking creciente: los modelos con mayor precisi´on tendr´an mayor ranking. ´ Area bajo la curva ROC. Se ha establecido un ranking creciente: a m´as AUC, mayor ranking. F-Score. Tal y como se explico en la secci´on de metodolog´ıa, es la media arm´onica de la sensibilidad y especificidad. Se ha establecido un ranking creciente: los modelos con mayor F-Score tendr´an mayor ranking. Tasa de equierror. Se ha establecido un ranking decreciente: cuanto m´as EER tenga el modelo, menor ser´a el ranking del modelo. 9.3.1. Corpus I En la Tabla 9.3 podemos observar el ranking, de mejor a peor, en cada uno de los criterios de los modelos desarrollados para el Corpus I ordenados por la calificaci´on correspondiente al F-Score. Se ha escogido el F-Score para la ordenaci´on al ser un criterio sin valores faltantes y sin empates. Ranking general de los modelos estudiados (Corpus I) Conjunto F-Score Precisi´on AUC EER NoVariables Sistema de referencia - 21 5 15 18 23 Perceptr´on multicapa Conjunto A 13 15 11 6 10 Perceptr´on multicapa Conjunto B 12 14 4 11 5 SVM de n´ucleo RBF Conjunto B 10 13 15 16 5 SVM de n´ucleo RBF Conjunto A 9 12 16 10 10 SVM de n´ucleo lineal Conjunto B 8 11 - - 16 SVM de n´ucleo lineal Conjunto A 7 10 - - 15 Regresi´on log´ıstica Conjunto A 6 6 17 14 12 SVM de n´ucleo polin´omico Conjunto B 5 9 3 3 5 SVM de n´ucleo polin´omico Conjunto A 4 8 6 4 10 Regresi´on log´ıstica Conjunto B 2 3 10 9 11 Tabla 9.3: Ranking de los criterios seleccionados (N´umero de variables, Precisi´on, AUC, F-Score y EER) para los modelos estudiados en el Corpus I desarrollados en la memoria de ingenier´ıa inform´atica. En la Figura 9.8 aparece las representaciones de malla de los ranking del sistema de referencia y los modelos desarrollados en la memoria de ingenier´ıa inform´atica. Podemos hacer los siguientes comentarios en base a la representaci´on de malla de los modelos del Corpus I realizada: Sistema de referencia: en el Corpus I el sistema de referencia logra resultados bastante buenos: emplea el menor n´umero posible de variables (una) y con ello consigue puntuaciones altas en todas las medidas a excepci´on de la precisi´on general del modelo. Regresi´on log´ıstica: el modelo creado a partir con el conjunto de variables B parece ser superior en todos los sentidos al del A. Los resultados son medios y no excesivamente destacables. 102
CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica Support Vector Machines: los SVM de n´ucleo lineal carecen de puntuaci´on en tasa de equierror y ´area bajo la curva ROC al no haberse podido estimar estas medidas. Parecen lograr un compromiso adecuado entre el n´umero de variables y la precisi´on o el F-Score. Los SVM de n´ucleo polin´omico han dado lugar a un resultado que en comparativa con el resto es pobre. Aquellos cuyo n´ucleo es una funci´on de base radial obtienen con los conjuntos de datos A y B resultados medios que destacan por su EER y su AUC respectivamente. Perceptr´on multicapa: el modelo correspondiente al conjunto A parece destacar por encima del B exceptuando en la EER. Ambos parecen destacar de forma media en lo que se refiere a la precisi´on. 103
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS Figura 9.8: Representaci´on gr´afica del ranking en distintos criterios (N´umero de variables, Precisi´on, F-Score, EER y AUC) del sistema de referencia y los modelos desarrollados en la memoria de ingenier´ıa inform´atica a partir de los conjuntos de datos A y B del Corpus I. 104
CAP´ ITULO 9. DISCUSI´ ON GENERAL DE RESULTADOS TFG: Grado de Ingenier´ıa Inform´atica 9.3.2. Corpus II En la Tabla 9.4 podemos observar el ranking, de mejor a peor, en cada uno de los criterios de los modelos desarrollados para el Corpus II ordenados por la calificaci´on correspondiente al F-Score. De nuevo, la elecci´on del F-Score como criterio de ordenaci´on se debe a que no tiene valores faltantes ni empates. Ranking general de los modelos estudiados (Corpus II) Conjunto F-Score Precisi´on AUC EER NoVariables Perceptr´on multicapa Conjunto B 18 5 15 15 5 Sistema de referencia - 16 1 3 3 23 Regresi´on log´ıstica Conjunto B 12 12 9 13 15 SVM de n´ucleo RBF Conjunto B 11 7 15 12 5 SVM de n´ucleo RBF Conjunto A 10 3 12 11 10 Perceptr´on multicapa Conjunto A 9 2 6 7 10 SVM de n´ucleo lineal Conjunto B 8 19 - - 11 SVM de n´ucleo polin´omico Conjunto B 7 11 4 4 5 SVM de n´ucleo polin´omico Conjunto A 5 8 5 5 10 Regresi´on log´ıstica Conjunto A 3 14 10 8 13 SVM de n´ucleo lineal Conjunto A 1 17 - - 13 Tabla 9.4: Ranking de los criterios seleccionados (N´umero de variables, Precisi´on, AUC, F-Score y EER) para los modelos estudiados en el Corpus II desarrollados en la memoria de ingenier´ıa inform´atica. En la Figura 9.9 aparecen las representaciones de malla de los ranking del sistema de referencia y los modelos desarrollados en la memoria de ingenier´ıa inform´atica. Al tener una resoluci´on inferior las im´agenes del Corpus II, las caracter´ısticas se extraen de tal forma que tienen ruido y variaciones con respecto al Corpus I. Esto genera una disposici´on diferente de rankings que desarrollamos a continuaci´on. Podemos hacer los siguientes comentarios en base a la representaci´on de malla de los modelos del Corpus II realizada: Sistema de referencia: en el Corpus II logra con una ´unica variable medidas de precisi´on, EER y AUC bajas. Sin embargo, su F-Score -relevante ante la baja especificidad de los modelos de este Corpuses relativamente elevado. Regresi´on log´ıstica: se obtienen modelos con puntuaciones medias, destacando el F-Score, EER y menor dimensionalidad del clasificador asociado al conjunto A y la precisi´on y AUC del modelo del conjunto B. Support Vector Machines: los Support Vector Machine de n´ucleo lineal carecen de puntuaci´on en tasa de equierror y ´area bajo la curva ROC al no haberse podido estimar estas medidas. El modelo SVM de n´ucleo lineal del conjunto de variables de las componentes principales parece carecer de utilidad al tener un F-Score muy bajo (y por tanto una especificidad paup´errima). El conjunto B logra resultados pobres cuya ´unica medida a destacar es la precisi´on. Los SVM de n´ucleo polin´omico carecen de rasgos destacables al lograr puntuaciones bajas. En el caso de aquellos con n´ucleo de funci´on de base radial, los resultados son medios. Parece que la ´unica ventaja que ofrece el conjunto A con respecto al B es una reducci´on de dimensionalidad. Perceptr´on multicapa: mientras que el conjunto A logra resultados pobres con menos variables, el conjunto de los estad´ısticos logra resultados medios-altos con un n´umero de variables elevado teniendo en cuenta la pobreza general relativa en los resultados del Corpus II. Destaca el alto ranking del F-Score. 105
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 10. CONCLUSIONES Y TRABAJO FUTURO Los datos se depuraron de tal forma que las im´agenes que hab´ıa captado incorrectamente “Smart Eyes” no se emplearon en la inducci´on de los sistemas de clasificaci´on. Posteriormente, las im´agenes se analizaron para conocer cuales eran las propiedades m´as relevantes de estas que pudiesen tener relevancia en el posterior filtrado de la imagen y en la extracci´on de caracter´ısticas. Se realizo un an´alisis del funcionamiento de “Smart Eyes”. Se pudo realizar una estimaci´on muy sesgada de su tasa de error y con el estudio visual se analiz´o la posible fuente de este error. El sistema tiene un comportamiento err´atico en escenarios donde el tablero o est´a muy iluminado o carece de suficiente luz. Se ha desarrollado un sistema propio de filtrado en base a la irregularidad en la iluminaci´on existente en las im´agenes. El sistema de filtrado consta de un procedimiento para la detecci´on de relieves propios de defectos negros y otro para la detecci´on de relieves de defectos blancos. El sistema de filtrado se ha optimizado por separado para ambos Corpus para tener en cuenta las diferencias existentes entre ambos. A partir de las diferentes im´agenes usadas en el proceso de filtrado se han extra´ıdo diversas caracter´ısticas: relativas al procesamiento (´areas de error relativas), componentes de la transformada discreta del coseno y caracterizaciones de la distribuci´on de grises de las im´agenes. Sobre este ´ultimo grupo de variables se ha podido hacer un estudio de las ventajas y desventajas que ofrec´ıa caracterizar el histograma de grises mediante componentes principales o con estad´ısticos. Se han ajustado correctamente modelos de an´alisis supervisado de regresi´on log´ıstica, Support Vector Machines y perceptr´on multicapa. Sobre los primeros se ha estudiado el efecto de la regularizaci´on L1 como forma de selecci´on de variables. Con los SVM se ha variado el n´ucleo, los par´ametros relativos a estos y el coste para obtener clasificadores con resultados asociados ´optimos. En el caso del perceptr´on multicapa, el estudio se ha hecho en base a la variaci´on de la arquitectura, activaci´on de las neuronas y los par´ametros relativos a la regularizaci´on. Posteriormente se ha realizado una discusi´on sobre los resultados obtenidos a partir de los clasificadores desarrollados en ambas memorias. Se ha valorado qu´e modelos de los desarrollados podr´ıa ser el ´optimo para el problema planteado en funci´on de los resultados obtenidos. Adicionalmente, se ha estudiado la relevancia de las variables dentro del proceso discriminatorio de los clasificadores. Esta secci´on ha resultado ser la m´as gratificante ya que a trav´es del estudio y comparaci´on de resultados se han podido conocer las ventajas y desventajas de cada una de las metodolog´ıas empleadas. Con el desarrollo del proyecto se han podido crear modelos de an´alisis supervisado de agregaci´on de ´arboles de decisi´on capaces de discriminar con alta precisi´on entre im´agenes con defectos de las que carecen de ellos. Los modelos de Random Forest y AdaBoost logran resultados altamente satisfactorios en las diferentes medidas relativas a su calidad como clasificadores. Aquellos creados a partir del conjunto de variables caracterizado por el uso de estad´ısticos combinan estos con la informaci´on extra´ıda de la DCT. Destacan por encima del resto de variables la Kurtosis de la imagen tratada en negro, dato que concuerda con la relaci´on existente entre esta medida y el n´umero de puntos extra˜nos en una distribuci´on. Por otro lado, aquellos inducidos con el conjunto de datos de las componentes principales parecen marcar como relevantes estas componentes. Aquellas extra´ıdas a partir de la transformada discreta del coseno (DCT) aportan informaci´on de utilidad pero complementaria en comparaci´on con componentes principales en estos modelos. 10.3. Trabajo Futuro Como trabajo futuro, se pueden proponer diversidad de l´ıneas para la continuaci´on del proyecto: La obtenci´on de im´agenes de falsos negativos supondr´ıa un aporte de alto valor al posible futuro desarrollo del estudio realizado. De esta forma, podr´ıamos precisar nuestra estimaci´on sobre la tasa de acierto de ‘Smart Eyes’ as´ı como conocer si los nuevos modelos que hemos desarrollado son capaces de detectar correctamente aquellas im´agenes con defectos que ‘Smart Eyes’ no clasifico adecuadamente. 112
CAP´ ITULO 10. CONCLUSIONES Y TRABAJO FUTURO TFG: Grado de Ingenier´ıa Inform´atica Si la empresa nos facilitase otro conjunto de datos, podr´ıamos utilizarlo como conjunto test y de esta forma hacer una estimaci´on m´as precisa de las medidas de capacidad discriminatoria de los modelos desarrollados. Otra forma de conocer si los mejores modelos funcionan adecuadamente ser´ıa ponerles en funcionamiento en la l´ınea de la empresa para observar si realmente mejoran el rendimiento asociado a ‘Smart Eyes’. Se podr´ıa continuar trabajando con los conjuntos de im´agenes ya obtenidos de la empresa y probar clasificadores m´as complejos como ser´ıan las redes convolucionales [34] en las que la imagen filtrada se podr´ıa introducir sin la extracci´on de caracter´ısticas en el clasificador. Con los resultados obtenidos, existe evidencia que apoya que si se mejorasen los equipos de visi´on artificial se podr´ıa obtener un sistema altamente fiable. Las tasas de error de este proyecto han sido muy bajas empleando im´agenes en escala de grises grabadas por c´amaras lineales. Estas c´amaras las compro la empresa hace m´as de cinco a˜nos y, por aquel entonces, ya estaban algo obsoletas. Parece evidente que si la empresa adquiriese c´amaras industriales de ´ultima generaci´on se podr´ıa alcanzar el 100 % de im´agenes bien clasificadas. 113
TFG: Grado de Ingenier´ıa Inform´atica CAP´ ITULO 10. CONCLUSIONES Y TRABAJO FUTURO 114
Bibliograf´ıa [1] Sonae Arauco. Sonae Industria - About Us. 2018. ´ Ultimo acceso: 04-02-2018. url:http://www.sonaeindustria. com/page.php?ctx=1,0,17. [2] Synergic Partners. Ganadores de Data Sciences Awards 2016. 2016. ´ Ultimo acceso: 04-02-2018. url:http: //www.synergicpartners.com/synergic-partners-y-telefonica-anuncian-los-premiados-de-los- dsawards/. [3] Alejandro Rodr´ıguez Collado y Miguel Alejandro Fern´andez Temprano. Detecci´on de defectos en tiempo real en una l´ınea de fabricaci´on de tableros mediante m´etodos multivariantes de clasificaci´on. Departamento de Estad´ıstica e Investigaci´on Operativa, Facultad de Ciencias. Universidad de Valladolid, 2019. [4] Mathworks. Complement Image. 2017. ´ Ultimo acceso: 04-02-2018. url:https://es.mathworks.com/help/ images/ref/imcomplement.html. [5] Mathworks. Crop Image. 2017. ´ Ultimo acceso: 31-01-2018. url:https://es.mathworks.com/help/images/ ref/imcrop.html. [6] Mathworks. Correct Nonuniform Background Illumination and Analyze Foreground Objects. 2017. ´ Ultimo acceso: 31-01-2018. url:https://es.mathworks.com/help/images/image-enhancement-and-analysis. html. [7] A. Agresti. Categorical Data Analysis. Wiley Series in Probability and Statistics. Wiley, 2003. isbn: 9780471458760. url:https://books.google.es/books?id=hpEzw4T0sPUC. [8] Luis ´ Angel Garc´ıa y Miguel Alejandro Fern´andez. Apuntes de la asignatura ”An´alisis de Datos”. Departamento de Estad´ıstica e Investigaci´on Operativa, Facultad de Ciencias. Universidad de Valladolid, 2016. [9] T.A. Banet, T. Aluja y A. Morineau. Aprender de los datos: el an´alisis de componentes principales : una aproximaci´on desde el Data Mining. Ciencia y tecnolog´ıa. EUB, 1999. isbn: 9788483120224. url:https: //books.google.es/books?id=6p7mPQAACAAJ. [10] Gilbert Strang. “The Discrete Cosine Transform”. En: SIAM Rev. 41.1 (mar. de 1999), p´ags. 135-147. issn: 0036-1445. doi:10.1137/S0036144598336745.url:http://dx.doi.org/10.1137/S0036144598336745. [11] Xiph.Org Foundation. Strengths and Weaknesses of the DCT. 2018. ´ Ultimo acceso: 05-09-2018. url:https: //people.xiph.org/~xiphmont/demo/daala/demo1.shtml. [12] Nuno Vasconcelos University of California San Diego. Discrete Cosine Transform. 2016. ´ Ultimo acceso: 23- 11-2018. url:http://www.svcl.ucsd.edu/courses/ece161c/handouts/DCT.pdf. [13] Teodoro Calonge Cano y Carlos J. Alonso Gonz´alez. Apuntes de la asignatura ”T´ecnicas de Aprendizaje Autom´atico”. Departamento de Inform´atica, Escuela de Ingenier´ıa Inform´atica. Universidad de Valladolid, 2018. [14] Teodoro Calonge Cano y Carlos J. Alonso Gonz´alez. Apuntes de la asignatura ”Miner´ıa de Datos”. Departamento de Inform´atica, Escuela de Ingenier´ıa Inform´atica. Universidad de Valladolid, 2018. [15] Viv Bewick, Liz Cheek y Jonathan Ball. “Statistics review 13: receiver operating characteristic curves”. En: Critical care (London, England) 8.6 (2004), 508—512. issn: 1364-8535. doi:10.1186/cc3000.url: http://europepmc.org/articles/PMC1065080. [16] Suzanne Ekelund AcuteCareTesting. ROC curves – what are they and how are they used? 2011. ´ Ultimo acceso: 23-11-2018. url:https://acutecaretesting.org/en/articles/roc-curves-what-are-they- and-how-are-they-used. 115
TFG: Grado de Ingenier´ıa Inform´atica BIBLIOGRAF´ IA [17] Luis ´ Angel Garc´ıa y Miguel Alejandro Fern´andez. Apuntes de la asignatura ”An´alisis de Datos Multivariantes”. Departamento de Estad´ıstica e Investigaci´on Operativa, Facultad de Ciencias. Universidad de Valladolid, 2017. [18] Nathan Brixius. The Logit and Sigmoid Functions- Nathan Brixius: Data science, optimization, analytics, sports. 2016. ´ Ultimo acceso: 06-08-2018. url:https://nathanbrixius.wordpress.com/2016/06/04/ functions-i-have-known-logit-and-sigmoid/. [19] KDnuggets. Learn Generalized Linear Models (GLM) using R. 2017. ´ Ultimo acceso: 06-08-2018. url:https: //www.kdnuggets.com/2017/10/learn-generalized-linear-models-glm-r.html/2. [20] Thomas Mazzocco y Amir Hussain. “Novel logistic regression models to aid the diagnosis of dementia”. En: Expert Systems with Applications 39.3 (2012), p´ags. 3356 -3361. issn: 0957-4174. doi:https://doi. org/10.1016/j.eswa.2011.09.023.url:http://www.sciencedirect.com/science/article/pii/ S0957417411013327. [21] Sami Ben Jabeur. “Bankruptcy prediction using Partial Least Squares Logistic Regression”. En: Journal of Retailing and Consumer Services 36 (2017), p´ags. 197 -202. issn: 0969-6989. doi:https://doi.org/ 10.1016/j.jretconser.2017.02.005.url:http://www.sciencedirect.com/science/article/pii/ S0969698916305434. [22] Cross Validated. Why L1 norm for sparse models. 2018. ´ Ultimo acceso: 13-08-2018. url:https://stats. stackexchange.com/questions/45643/why-l1-norm-for-sparse-models. [23] David Cournapeau. Scikit-learn. 2018. ´ Ultimo acceso: 20-06-2018. url:http://scikit-learn.org/stable/. [24] Cross Validated. How does a Support Vector Machine (SVM) work? 2013. ´ Ultimo acceso: 07-08-2018. url: https://stats.stackexchange.com/questions/23391/how-does-a-support-vector-machine-svm- work/58216. [25] Kunlun Li y col. “Multi-class text categorization based on LDA and SVM”. En: Procedia Engineering 15 (2011). CEIS 2011, p´ags. 1963 -1967. issn: 1877-7058. doi:https://doi.org/10.1016/j.proeng.2011. 08.366.url:http://www.sciencedirect.com/science/article/pii/S1877705811018674. [26] Fotini Simistira, Vassilis Katsouros y George Carayannis. “Recognition of online handwritten mathematical formulas using probabilistic SVMs and stochastic context free grammars”. En: Pattern Recognition Letters 53 (2015), p´ags. 85 -92. issn: 0167-8655. doi:https://doi.org/10.1016/j.patrec.2014.11.015.url: http://www.sciencedirect.com/science/article/pii/S0167865514003651. [27] Zbigniew Krajewski y Ewaryst Tkacz. “Protein structural classification based on pseudo amino acid composition using SVM classifier”. En: Biocybernetics and Biomedical Engineering 33.2 (2013), p´ags. 77 -87. issn: 0208-5216. doi:https://doi.org/10.1016/j.bbe.2013.03.002.url:http://www.sciencedirect.com/ science/article/pii/S020852161300003X. [28] Cross Validated. Do all machine learning algorithms separate data linearly? 2016. ´ Ultimo acceso: 13-08-2018. url:https://stats.stackexchange.com/questions/215696/do-all-machine-learning-algorithms- separate-data-linearly?noredirect=1. [29] Stack Overflow. Single neuron in neural network using C++. 2016. ´ Ultimo acceso: 17-08-2018. url:https: //stackoverflow.com/questions/38850538/single-neuron-in-neural-network-using-c. [30] Rafa l Weron. “Electricity price forecasting: A review of the state-of-the-art with a look into the future”. En: International Journal of Forecasting 30.4 (2014), p´ags. 1030 -1081. issn: 0169-2070. doi:https://doi.org/ 10.1016/j.ijforecast.2014.08.008.url:http://www.sciencedirect.com/science/article/pii/ S0169207014001083. [31] Wen-Yuan Chen, Sin-Horng Chen y Cheng-Jung Lin. “A speech recognition method based on the sequential multi-layer perceptrons”. En: Neural Networks 9.4 (1996), p´ags. 655 -669. issn: 0893-6080. doi:https : //doi.org/10.1016/0893-6080(95)00140-9.url:http://www.sciencedirect.com/science/article/ pii/0893608095001409. 116
BIBLIOGRAF´ IA TFG: Grado de Ingenier´ıa Inform´atica [32] I. Kanellopoulos y col. “Classification of remotely-sensed satellite images using Multi-layer Perceptron Networks”. En: Artificial Neural Networks. Ed. por Teuvo KOHONEN y col. Amsterdam: North-Holland, 1991, p´ags. 1067 -1070. isbn: 978-0-444-89178-5. doi:https://doi.org/10.1016/B978-0-444-89178-5.50020-8. url:http://www.sciencedirect.com/science/article/pii/B9780444891785500208. [33] Oli Blum. How to visualize a neural network? 2016. ´ Ultimo acceso: 17-08-2018. url:https://stackoverflow. com/questions/29888233/how-to-visualize-a-neural-network. [34] Keiron O’Shea y Ryan Nash. “An Introduction to Convolutional Neural Networks”. En: CoRR abs/1511.08458 (2015). arXiv: 1511.08458.url:http://arxiv.org/abs/1511.08458. 117