scieee AI-readable full text Open interactive document viewer

Contribuciones a la detección de TDAH en la infancia mediante soluciones basadas en Deep Learning

Amado Caballero, Patricia

Abstract

Departamento de Teoría de la Señal y Comunicaciones e Ingeniería Telemática

Full text

TRABAJO FIN DE MÁSTER MÁSTER EN INGENIERÍA DE TELECOMUNICACIÓN CONTRIBUCIONES A LA DETECCIÓN AUTOMÁTICA DE TDAH EN LA INFANCIA MEDIANTE SOLUCIONES BASADAS EN DEEP LEARNING ————————————————————————————— AUTOR: PATRICIA AMADO CABALLERO TUTOR: CARLOS ALBEROLA LÓPEZ J.P. CASASECA DE LA HIGUERA 22 de septiembre de 2021 TÍTULO:CONTRIBUCIONES A LA DETECCIÓN AUTOMÁTICA DE TDAH EN LA INFANCIA MEDIANTE SOLUCIONES BASADAS EN DEEP LEARNING AUTOR:PATRICIA AMADO CABALLERO TUTOR:CARLOS ALBEROLA LÓPEZ J.P. CASASECA DE LA HIGUERA DEPARTAMENTO:TSCIT Miembros del Tribunal PRESIDENTE:MÁRCOS MARTÍN FERNÁNDEZ SECRETARIO:IGNACIO DE MIGUEL JIMÉNEZ VOCAL:LUIS MIGUEL SAN JOSÉ REVUELTA P. SUPLENTE: MANUEL RODRÍGUEZ CAYETANO S. SUPLENTE: JAVIER AGUIAR PÉREZ VOCAL SUPLENTE: RAMÓN DE LA ROSA STEINZ CALIFICACIÓN: Resumen del proyecto El Trastorno por Déficit de Atención e Hiperactividad es considerado uno de los trastornos psiquiátricos infantiles más frecuentes, con una prevalencia en torno al 5% y con un número significativamente mayor de varones diagnosticados con respecto al de mujeres, debido a la dificultad de encontrar marcadores claros que ayuden a determinar la presencia de esta patología en las mujeres. Este hecho, unido a la atenuación de los síntomas con la edad, complica el diagnóstico con el crecimiento. En el presente trabajo, se plantea aunar la utilización de registros de actigrafía con técnicas de aprendizaje profundo para la obtención de patrones que nos ayuden a encontrar diferencias en función de la edad y el sexo de los pacientes diagnosticados con TDAH. Para realizar este análisis, se han creado grupos de pacientes divididos por edad y sexo y se han clasificado mediante una red neuronal convolucional adaptada a cada grupo. Una vez realizada está clasificación, se han empleado mapas de oclusión como técnica de visualización para ver las características de las señales útiles para la clasificación e interpretar el resultado obtenido en relación con la patología. Palabras clave TDAH, Actigrafía, CNN, Mapas de oclusión, Aprendizaje Profundo, Clasificación Keywords ADHD, Actigraphy, CNN, Occlusion Sensitivity, Deep Learning, Classification Abstract Attention Deficit Hyperactivity Disorder is considered one of the most frequent disorder in UNIVERSIDAD DE VALLADOLID childhood, with a prevalence around 5% and mainly diagnosed in males against females,due to the difficulty of finding markers due to the difficulty of finding clear markers that help to determine the presence of this pathology in females. This fact t ogether with the attenuation of symptoms with age, complicates diagnosis with growth. In this work we propose to combine actigraphy records with Deep learning techniques to obtein patterns that help us to find differences according to the age and sex of patients diagnosed with ADHD. To perform this análisis, groups of patients divided by sex and age have been created and classified using a convolutional neural network adapted to each group. Once this classification was performed, occlusion sensitivity is used as a visualization technique to see the characteristics of the signals useful for the classification and to interpret the result obtained in relation to the pathology. III AGRADECIMIENTOS En primer lugar, me gustaría agradecerle a mis tutores, Carlos Alberola y Pablo Casaseca por su confianza y su ayuda para que este trabajo saliera adelante. También me gustaría agradecer al Laboratorio de Procesado de Imagen el haberme proporcionado los medios necesarios para el desarrollo de este trabajo Me gustaría agradecer a mi familia todo el apoyo que me han dado durante este tiempo, ya que sin ellos, sin su paciencia y su cariño, el camino habría sido mucho más difícil. Gracias por ser mi apoyo incondicional. IV ÍNDICE GENERAL 1. Introducción 1 1.1. Motivaciones ............................................. 1 1.2. Objetivos ............................................... 2 1.3. FasesyMétodos............................................ 2 1.4. Medios necesarios empleados para el desarrollo . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 1.5. Estructuradeldocumento ...................................... 4 2. Antecedentes 5 2.1. EstadodelArte ............................................ 5 2.1.1. Resúmen de los métodos de diagnóstico objetivo del TDAH . . . . . . . . . . . . . . . . . 5 2.1.2. Diferencias por sexo y edad en el diagnostico del TDAH según los métodos tradicionales . 10 2.1.3. Utilización de señales biomédicas para el estudio del TDAH . . . . . . . . . . . . . . . . 10 2.1.4. El uso de la MRI en el diagnóstico del TDAH . . . . . . . . . . . . . . . . . . . . . . . . 10 2.1.5. Estado del Arte: La interpretación del Deep Learning . . . . . . . . . . . . . . . . . . . 11 2.1.5.1. Interpretación de redes neuronales en el diagnóstico de enfermedades . . . . . . 11 2.1.5.2. Interpretabilidad del Deep Learning para el diagnóstico del TDAH . . . . . . . 12 2.1.6. Análisisycomparativa.................................... 12 2.2. Técnicas y métricas para evaluar el rendimiento de un sistema de reconocimiento de patrones . . . 12 2.2.1. Técnicas para la evaluación del rendimiento de un sistema experto . . . . . . . . . . . . . 13 2.2.1.1. Validacióncruzada ................................ 14 2.2.1.2. Métricas para evaluar la validez de los modelos de clasificación . . . . . . . . . 14 2.2.1.3. Sensibilidad y especificidad . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 2.2.1.4. Valores Predictivos y exactitud . . . . . . . . . . . . . . . . . . . . . . . . . . 16 2.2.1.5. Razones de verosimilitud . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 3. Métodos 18 3.1. Clasificación sectorizada mediante una CNN . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18 3.1.1. Sectorización de pacientes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18 3.1.2. Características de la CNN utilizada para la clasificación de pacientes . . . . . . . . . . . 19 3.1.3. Características de los entrenamientos clasificación sectorizada . . . . . . . . . . . . . . . 21 3.1.4. Clasificación final de los pacientes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22 3.2. Análisis de las activaciones de la CNN . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25 3.2.1. Mapas de activaciones neuronales . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25 3.2.1.1. Procesado previo al cálculo de las activaciones de la CNN . . . . . . . . . . . . 25 3.2.1.2. Mapas de activaciones a partir de la excitación de las neuronas . . . . . . . . . 26 3.2.1.3. Eigenfaces: Cálculo de autovectores para el reconocimiento de patrones . . . . . 30 3.2.2. DeepDream, el algoritmo de Google . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30 3.2.3. Algoritmos para la visualización de zonas de activación . . . . . . . . . . . . . . . . . . . 31 V ÍNDICE GENERAL PATRICIA AMADO CABALLERO 3.2.3.1. Mapas de activación Grad-CAM . . . . . . . . . . . . . . . . . . . . . . . . . 32 3.2.3.2. Mapasdeoclusión................................. 33 3.2.3.3. Mapasdeoclusión................................. 33 4. Resultados y discusión 36 4.1. Prestaciones de la red convolucional para la clasificación sectorizada . . . . . . . . . . . . . . . . 36 4.1.1. Clasificación global de pacientes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37 4.1.1.1. Scatter plot para los grupos de estudio . . . . . . . . . . . . . . . . . . . . . . 40 4.2. Prestaciones y resultados obtenidos para los diferentes métodos de interpretabilidad de la CNN . . 44 4.2.1. Mapasdeactivaciones .................................... 44 4.2.1.1. Eigenfaces sobre los mapas de activación . . . . . . . . . . . . . . . . . . . . . 44 4.2.1.2. Aplicación del algoritmo Deep Dream para los cuatro subgrupos de estudio . . . 45 4.2.2. Visualización de las zonas más relevantes para la clasificación . . . . . . . . . . . . . . . 47 4.2.2.1. MapasGrad-CAM ................................ 49 4.2.2.2. MapasdeOclusión ................................ 49 4.3. Discusión de los resultados cualitativos obtenidos para los mapas de oclusión . . . . . . . . . . . 62 4.3.1. Resumen de los Mapas de Oclusión obtenidos en el estudio . . . . . . . . . . . . . . . . 62 4.3.2. Discusión........................................... 64 5. Conclusiones y líneas futuras 65 5.1. Conclusiones ............................................. 65 5.2. LimitacionesyLíneasFuturas .................................... 66 VI ÍNDICE DE FIGURAS 2.1. Ejemplo de funcionamiento de Validación con k-folds para 3 iteraciones . . . . . . . . . . . . . . 14 2.2. Ejemplo de funcionamiento de Validación Leave One Out para un conjunto de N=18 muestras . . 15 3.1. Esquema que resume el tratamiento de los datos para la generación de las imágenes que nos servirán de entrada para la CNN........................................ 20 3.2. Estructura de la CNN utilizada para los entrenamientos . . . . . . . . . . . . . . . . . . . . . . 20 3.3. Proceso de entrenamiento del sistema de diagnóstico. . . . . . . . . . . . . . . . . . . . . . . . . 24 3.4. Proceso de entrenamiento para la clasificación por pacientes . . . . . . . . . . . . . . . . . . . . . 24 3.5. Mapa de Activación obtenido para un caso . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 3.6. Mapa de Activación obtenido para un caso . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28 3.7. Esquema del procesado de los diferentes mapas de activación . . . . . . . . . . . . . . . . . . . . 29 3.8. Eigenfaces obtenidas para un caso . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31 3.9. Algoritmo para la obtención de los Mapas de Activación de clases . . . . . . . . . . . . . . . . . . 32 3.10. Mapa Grad-CAM obtenido para un caso . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34 3.11. Esquema de funcionamiento de la técnica de oclusión . . . . . . . . . . . . . . . . . . . . . . . . 34 3.12. Mapa de Oclusión obtenido para un caso . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35 4.1. Scatter Plot para las ventanas de 1800s de Chicas (izquierda) y Chicos (derecha). . . . . . . . . . 41 4.2. Scatter Plot para las ventanas de 1800s de secundaria(izquierda) y primaria(derecha). . . . . . . 41 4.3. Scatter Plot para las ventanas de 300s de chicas (izquierda) y chicos (derecha). . . . . . . . . . . 42 4.4. Scatter Plot para las ventanas de 300s de secundaria(izquierda) y primaria(derecha). . . . . . . . 42 4.5. Scatter Plot para las ventanas de 60s de de chicas (izquierda) y chicos (derecha). . . . . . . . . . 43 4.6. Scatter Plot para las ventanas de 60s de secundaria(izquierda) y primaria(derecha). . . . . . . . 43 4.7. Mapas de activación para dos chicas de secundaria en el tramo de actividad diurna. . . . . . . . . 45 4.8. Mapas de activación para dos chicas de primaria en el tramo de actividad nocturna. . . . . . . . . 45 4.9. Mapas de Eigenfaces obtenidos para controles(izquierda) y casos(derecha) en la red de secundaria. 46 4.10. Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de secundaria para la actividad nocturna. . . . . . . . . . . . . . 46 4.11. Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de chicas para la actividad nocturna. . . . . . . . . . . . . . . . . 47 4.12. Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de primaria para la actividad nocturna. . . . . . . . . . . . . . . 47 4.13. Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de chicos para la actividad nocturna. . . . . . . . . . . . . . . . . 48 4.14. Imágenes generadas por el algoritmo DeepDream para nuestras imágenes de entrada para la red de chicas (izquierda) y la red de secundaria, mostrando el resultado para un caso y un control en ambasejecuciones. .......................................... 48 4.15. Mapas de Grad-CAM obtenidos para las señales de actividad diurna. . . . . . . . . . . . . . . . . 49 4.16. Mapas de Grad-CAM obtenidos para las señales de actividad nocturna. . . . . . . . . . . . . . . 50 VII ÍNDICE DE FIGURAS PATRICIA AMADO CABALLERO 4.17. Ejemplo de espectrograma utilizado para alimentar la CNN. . . . . . . . . . . . . . . . . . . . . 51 4.18. Mapas de oclusión de actividad diurna para las chicas de secundaria generados para la red entrenada conchicas. .............................................. 52 4.19. Mapas de oclusión de actividad nocturna para las chicas de secundaria generados para la red entrenadaconchicas.......................................... 53 4.20. Mapas de oclusión de actividad diurna para las chicas de secundaria generados para la red entrenada conregistrosdesecundaria....................................... 53 4.21. Mapas de oclusión de actividad nocturna para las chicas de secundaria generados para la red entrenada con registros de secundaria. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54 4.22. Mapas de oclusión de actividad diurna para las chicas de primaria para la red entrenada con chicas(CONTROLES)......................................... 54 4.23. Mapas de oclusión de actividad diurna de las chicas en primaria para la red entrenada con chicas (CASOS)................................................ 55 4.24. Mapas de oclusión de actividad nocturna de las chicas de primaria para la red entrenada con chicas (CONTROLES). ........................................... 55 4.25. Mapas de oclusión de actividad nocturna de las chicas de primaria para la red entrenada con chicas (CASOS)................................................ 56 4.26. Mapas de oclusión de actividad diurna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CONTROLES) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57 4.27. Mapas de oclusión de actividad diurna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CASOS) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57 4.28. Mapas de oclusión de actividad nocturna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CONTROLES) . . . . . . . . . . . . . . . . . . . . . . . 58 4.29. Mapas de oclusión de actividad nocturna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CASOS) . . . . . . . . . . . . . . . . . . . . . . . . . . . 58 4.30. Mapas de oclusión de actividad diurna para los chicos de secundaria (controles) en la red de chicos. 59 4.31. Mapas de oclusión de actividad diurna para los chicos de secundaria (casos) en la red de chicos. . . 59 4.32. Mapas de oclusión de actividad diurna para algunos de los casos (derecha) y controles (izquierda) de los chicos de primaria en la red entrenada con chicos. . . . . . . . . . . . . . . . . . . . . . . . 60 4.33. Mapas de oclusión de actividad nocturna para algunos de los casos (derecha) y controles (izquierda) en los chicos de primaria en la red de chicos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61 4.34. Mapas de oclusión de actividad nocturna para algunos de los casos (derecha) y controles (izquierda) en los chicos de primaria en la red de primaria. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61 VIII ÍNDICE DE TABLAS 2.1. Resumen de estudios más relevantes para el TDAH que no están basados en actigrafía (1/2) . . . . 7 2.2. Resumen de estudios más relevantes para el TDAH que no están basados en actigrafía (2/2) . . . . 8 2.3. Resumen de estudios de actigrafía. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9 2.4. Impacto de las razones de verosimilitud para la utilidad clínica. . . . . . . . . . . . . . . . . . . . 17 3.1. Sujetos que forman parte de cada grupo de estudio . . . . . . . . . . . . . . . . . . . . . . . . . . 19 3.2. Parámetros utilizados en los entrenamientos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 3.3. Imágenes disponibles para los entrenamientos en cada uno de los grupos . . . . . . . . . . . . . . 22 3.4. Porcentaje medio de imágenes empleadas en el entrenamiento . . . . . . . . . . . . . . . . . . . . 23 3.5. Sujetos que forman parte de los conjuntos de train y test en la clasificación de pacientes . . . . . . 23 3.6. Imágenes que maximizan la activación disponibles para los entrenamientos en cada uno de los grupos 26 4.1. Exactitud obtenida del entrenamiento de la CNN para el conjunto de test. . . . . . . . . . . . . . 37 4.2. Resultados obtenidos para el conjunto de secundaria. . . . . . . . . . . . . . . . . . . . . . . . . 38 4.3. Resultados obtenidos para el conjunto de primaria. . . . . . . . . . . . . . . . . . . . . . . . . . 38 4.4. Resultados obtenidos para el conjunto de chicas. . . . . . . . . . . . . . . . . . . . . . . . . . . . 38 4.5. Resultados obtenidos para el conjunto de chicos. . . . . . . . . . . . . . . . . . . . . . . . . . . . 38 4.6. Exactitud para la clasificación Leave One Out desecundaria.................... 39 4.7. Exactitud para la clasificación Leave One Out dechicas. ..................... 39 4.8. Media de fallos que se producen en la clasificación. . . . . . . . . . . . . . . . . . . . . . . . . . 40 4.9. Resumen de los Mapas de oclusión obtenidos para las CNN de chicas. . . . . . . . . . . . . . . . 62 4.10. Resumen de los Mapas de oclusión obtenidos para la CNN de chicos. . . . . . . . . . . . . . . . . 62 4.11. Resumen de los Mapas de oclusión para la CNN de primaria. . . . . . . . . . . . . . . . . . . . . 63 4.12. Resumen de los Mapas de oclusión obtenidos para la CNN de secundaria. . . . . . . . . . . . . . 63 IX CAPÍTULO 2. ANTECEDENTES PATRICIA AMADO CABALLERO En [ 7 ] y [ 4 ] también se desarrollaron métodos para poder llevar a cabo un diagnóstico objetivo del TDAH. En estos estudios, así como en [ 5 ] se llevo a cabo un análisis exhaustivo de dichos métodos y los resultados que se obtuvieron. A continuación y a modo de resumen, se incluyen actualizadas las tablas que aparecían en [ 5 ] y que aglutinan muy bien la información existente hasta el momento acerca del diagnóstico objetivo. En las tablas 2.1 y 2.2, se muestran los resultados no basados en actigrafía y en la tabla 2.3 un resumen de los estudios de actigrafía. Los resultados se expresan como lo hacen los autores en los trabajos citados. 6 UNIVERSIDAD DE VALLADOLID CAPÍTULO 2. ANTECEDENTES F. Información Autores Sujetos Métodos Resultados Informes Parentales Cortese et al. [8] 722 pacientes con TDAH y 683 para el grupo de control Informes subjetivos del sueño proporcionados por los padres Los mejores resultados obtienen p<0,001 para la resistencia a la hora de dormir, el inicio del sueño y la dificultad para despertarse por la mañana Análisis Químico Tuthill et al. [9] 16 pacientes con TDAH y 261 sujetos sanos Nivel de plomo en el pelo p=0,006 Weiss et al. [10] 277 pacientes con TDAH y 106 sujetos sanos Nivel de TSH en la sangre Se encontraron niveles anormales en el 2,2% de los pacientes con TDAH y en el 1% de sujetos sanos El-Faddagh et al. [11] 129 mujeres y 126 hombres a lo largo de 11 años Alelo Exon III gen DRD4 p=0,061 en 4.5 y.o., p=0,026 en 8 y.o., p=0,005 en 11 y.o. Van Veen et al. [12] 40 sujetos diagnosticados como TDAH y 40 controles emparejados Melatonina en saliva Ritmo circadiano retrasado en pacientes con TDAH (p<0,0005) Imagen Médica Kurtek et al. [13] 19 pacientes con TDAH y 15 controles Análisis de forma de estructuras cerebrales a partir de resonancia magnética Exactitud =0,9118 Ashtari et al. [14] 18 pacientes con TDAH y 15 sujetos sanos DT-MRI Los pacientes con TDAH muestran valores más bajos ADHD patients FA (Anisotropía fraccional) en el cerebro medio: p<0,01 Silk et al. [15] 15 pacientes con TDAH y 15 sujetos sanos 15 DT-MRI Los pacientes con TDAH mostraron valores más altos de FA en diferentes regiones del cerebro: región occipito-parietal derecha p<0,001, estriado izquierdo p<0,001, inf. Izquierdo. región temporal p<0,005, derecha inf. región parietal p<0,001 e izquierda inf. región frontal p<0,05 Zimmer et al. [16] Encuesta de diferentes estudios PET/SPECT El metabolismo de los pacientes con TDAH presenta varias anomalías: glucosa, dopamina (catecolaminas en general) y noradrenalina. Riaz et al. [17] NeuroBureau ADHD-200 Un tipo de resonancia magnética funcional (fMRI) conocida como Resting State fMRI (rsfMRI o R-fMRI) Exactitud = 0.818, Sensibilidad=1, Especificidad = 0.75 Sun et al. [18] 83 niños emparejados por edad y sexo con TDAH recién diagnosticado y nunca tratado (40 con TDAH inatento y 43 con TDAH combinado) y 87 sujetos control sanos Resonancia magnética anatómica y tensor de difusión Imágenes (MR) No se encontraron diferencias globales entre los niños con TDAH y los sujetos control en el volumen cerebral total o en el volumen total de materia gris y blanca. Exactitud = 0.737 (discriminación de pacientes) y Exactitud = 0.801 (diferentes subtipos) Señales Biomédicas Modarres- Zadeh et al. [19] 5 pacientes con TDAH y 5 controles emparejados antes y después de la medicación Análisis espectral EEG y test de comportamiento Los índices extraídos del análisis espectral y los resultados de las pruebas fueron significativamente diferentes en ambos grupos p en[0,017,0,0025). Los índices se acercaron después de la medicación. Gutierrez et al. [20] 4 pacientes con TDAH no medicados Relación de la densidad espectral de potencia en las bandas beta yTheta del EEG La relación se altera en los pacientes con TDAH pero tiende a valores normales después del entrenamiento Hyun-Lee et al. [21] 13 niños en tres grupos: TDAH, retraso mental y grupo de control Análisis de wavelets de EEG y mapas autoorganizados Exactitud =0,6 Dong-Ming et al. [22] 6 jóvenes Análisis de EEG por entropía multiescala Se detectaron diferentes estados de atención con rmExactitud =0,63158, lo que revela una alta complejidad en la actividad de EEG incluso cuando no se realiza ninguna actividad TABLA 2.1: Resumen de estudios más relevantes para el TDAH que no están basados en actigrafía (1/2) 7 CAPÍTULO 2. ANTECEDENTES PATRICIA AMADO CABALLERO F. Información Autores Sujetos Métodos Resultados Señales Biomédicas Nan et al. [23] 6 personas sanas Análisis del desplazamiento de información mediante EEG cuando se cambia de atención sostenida a falta de atención p<0,005 en bandas alpha ybeta,p<0,05 en la banda Theta Hale et al. [24] 35 adultos con TDAH y 104 adultos sanos Asimetría del EEG en la banda beta Asimetría atípica en el TDAH (p= 0,00001) Ghasshemi et al. [25] 10 adultos con TDAH y 40 adultos sano Características morfológicas de las señales ERP Exactitud =0,92 en la banda gamma Castro- Cabrera et al. [26] 23 sujetos y 23 controles Análisis de características morfológicas, wavelets y características no lineales de señales ERP. Morphological: Sensibilidad = 0,96,Especificidad =0,65, Exactitud = 0,81 ±0,1100,AUC =0,81; dinámicas no lineales: Sensibilidad = 0,69,Especificidad =0,78, Exactitud = 0,7391 ±0,1200,AUC =0,72; wavelets: Sensibilidad =1,Especificidad = 0,78,Exactitud =0,8695 ±0,0973, AUC = 0,91; mejor combinación de características: Sensibilidad =0,96,Especificidad = 0,87,Exactitud =0,9130 ±0,0100, AUC = 0,94 Demanuelle et al. [27] 2 pacientes con TDAH y 2 controles emparejados Sincronía de fase de señales MEG adquiridas en regiones distantes del cerebro. No reportado Öztoprak et al. [28] Entre 37 y 44 niños en el grupo con TDAH y 32 a 38 niños en el grupo de control sano. Medidas ERP en las señales EEG durante la realización de una tarea de tipo Stroop. Exactitud = 0.995 e (train) Exactitud = 1 (10 sujetos test) PSG Gruber et al. [29] 32 pacientes con TDAH y 64 sujetos sanos adultos durante 5 noches consecutivas Informes de sueño Los informes de sueño pueden ser usados para el diagnóstico del TDAH Silvestri et al. [30] 16 sujetos diagnosticados como TDAH inactivo y 39 con otros tipos de TDAH Informes de sueño Tanto los aspectos macro como microestructurales del sueño presentaron diferencias significativas.El sueño de los sujetos con TDAH presentó más trastornos. Las mayores diferencias presentaron p< 0,0001 Cortese et al. [8] Meta-Analysis inclyendo 722 sujetos con TDAH y 683 controles Informes de sueño Los sujetos con TDAH presentan más trastornos del sueño La característica más informativa presento p<0,001 Análisis del movimiento mediante infrarrojos Teicher et al. [31] 17 sujetos diagnosticados con TDAH y 10 sujetos sanos Evaluación de los movimientos de la cabeza mediante dispositivos infrarrojos Sensibilidad= 0,94, Especificidad=1logrado mediante la combinación de la complejidad de los movimientos de la cabeza evaluados mediante el análisis fractal con otras variables significativas (edad, puntuación en una tarea continuada) Teicher et al. [32] 18 pacientes con TDAH y 11 de contro Evaluación de los movimientos de la cabeza mediante dispositivos infrarrojos Los movimientos en la cabeza para pacientes con TDAH son más frecuentes (p< 0,002), 3.4 veces más frecuentes p>0,01), al cubrir áreas grandes (p>0,001) y más lineales y menos complejos (p>0,00004) TABLA 2.2: Resumen de estudios más relevantes para el TDAH que no están basados en actigrafía (2/2) 8 UNIVERSIDAD DE VALLADOLID CAPÍTULO 2. ANTECEDENTES F. Información Autores Sujetos Métodos Resultados Dane et al. [33] Se evaluaron 42 sujetos TDAH (20 de tipo inatento, 22 de tipo combinado) y 22 controles. Registros de Actigrafía de 24 horas de duración promedio en 2h de duración Solo diferencias durante la tarde. Los tipos de TDAH no presentaron diferencias en el análisis actigráfico. Actividad Diurna Teicher et al. [34] 11 pacientes con TDAH y 12 controles Registros de Actigrafía de 72 horas promediados y muestreados cada 5 minutos La distribución de las puntuaciones de actividad (porcentaje de tiempo empleado en actividad baja, media o alta) constituye un índice relevante para el diagnóstico de TDAH (la distribución de la actividad es significativamente sesgado a la derecha en pacientes con TDAH) Kam et al. [35] 10 pacientes con TDAH y 7 controles 3 horas de registros de actigrafía muestreados a 32 Hz La distribución promedio obtenida a partir de los histogramas de actividad de 1 minu- to presentó mayor nivel de actividad y variabilidad en el grupo de TDAH (p<0,05) Martín et al. [7, 36] 31 pacientes con TDAH y 35 controles de 6 años de edad Registros de Actigrafía durante 24 h muestreados a 1 Hz Exactiud = 0.8571 , Sensibilidad = 0.9500 y Especificidad = 0.7727 Muñoz et al. [37] 22 pacientes, 11 diagnosticados como TDAH y 11 sujetos sanos Dos acelerómetros: uno de muñeca y otro de tobillo para analizar los datos obtenidos durante 6 horas escolares y una red convolucional. Exactiud = 0.8570 , Sensibilidad = 0.6 y Especificidad = 1 para la muñeca y Exactitud= 0.937, Sensibilidad =0.8 y Especificidad=1 para el tobillo Mahony et al. [38] 43 pacientes, 24 con TDAH y 19 controles de 6 a 11 años de edad Señales de actigrafía obtenidas mediante IMUs o unidades de medición inercial, durante 1h Exactiud = 0.9512 , Sensibilidad = 0.9444 y Especificidad = 0.9565 Amado et al. [4] 148 pacientes, 73 con TDAH y 75 controles de 6 a 15 años de edad Registros de Actigrafía durante 24 h muestreados a 1 Hz utilizando redes neuronales convolucionales para clasificar espectrogramas de ventanas de actividad. Exactiud = 0.9857 , Sensibilidad = 0.9762 y Especificidad = 0.9952 Informes de Sueño Cortese et al. [8] 722 sujetos componen el grupo de TDAH y 683 componen el grupo de control Los informes Actigáficos del sueño Los niños con TDAH presentaron una me- nor eficiencia del sueño, un tiempo de sueño real y tiempos promedio para quedarse dormidos. Los resultados más significativos arrojaron p<0,001 Gruber et al. [29] 38 niños con TDAH y 64 controles durante 5 noches consecutivas Informes de sueño actigráfico Se encontró un aumento de la inestabilidad en el inicio del sueño, la eficiencia del sueño y el sueño verdadero en pacientes con TDAH Ritmo biologico circadiano Van Veen et al. [12] 40 sujetos diagnosticados como TDAH y 40 controles emparejados Registros actimétricos de 24 horas Comienzo y finalización retardados del sueño en sujetos con TDAH. Mayor relevancia lograda para el inicio del sueño: p=0,006 TABLA 2.3: Resumen de estudios de actigrafía. 9 CAPÍTULO 2. ANTECEDENTES PATRICIA AMADO CABALLERO 2.1.2 DIFERENCIAS POR SEXO Y EDAD EN EL DIAGNOSTICO DEL TDAH SEGÚN LOS MÉTODOS TRADICIONALES Existen diversos estudios recientes, que basados en este método de diagnóstico han resaltado la influencia de la edad y el sexo en la manifestación de la patología. En está sección, repasaremos algunos de ellos. En el estudio realizado por Murray et al. al. [ 39 ] se encontró que las mujeres tenían más probabilidades de mostrar síntomas en los primeros años de la adolescencia, mientras que los hombres mostraban síntomas desde su niñez. Se encontró también relación entre el diagnóstico tardío de las chicas con patrones de hiperactividad e impulsividad, debido a la aparición tardía de los síntomas. En un metanálisis realizado en 2021, Loyer et al. al. encontraron diferencias en la manifestación del TDAH en función del sexo en niños y adolescentes. Se encontró que los niños con TDAH eran más hiperactivos que las niñas con TDAH y los niños tenían más dificultades en términos de inhibición de la respuesta motora y flexibilidad cognitiva. [40] 2.1.3 UTILIZACIÓN DE SEÑALES BIOMÉDICAS PARA EL ESTUDIO DEL TDAH Se entiende por señales biomédicas aquellas señales originadas por el cuerpo humano que se utilizan para el diagnóstico o la investigación médica. Para el diagnóstico del TDAH, tiene especial interés el electroencefalograma (EEG). Esta técnica no invasiva permite el estudio del sistema nervioso central a través de señales eléctricas generadas en los impulsos nerviosos que son recogidas a través de electrodos. En relación al análisis del TDAH en subgrupos de edad y sexo, hay varios estudios que emplean las EEG junto con señales de actividad electrodérmica (EDA); que se refiere a la variación continua en las características eléctricas de la piel, para la caracterización de las diferencias entre sexos en la adolescencia En [ 41 ], Hermens et al. al. sugirieron que los procesos psicofisiológicos podrían ser fundamentales para caracterizar el TDAH en cada sexo, y encontraron evidencias de que los déficits en los sistemas de excitación / atención venian marcados en la expresión conductual del TDAH en cada sexo. Lazzaro et al. al. [ 42 ]. encontraron que los adolescentes manifestaban estados de baja actividad no presentes en los niños. En otro estudio, en el que se emplearon señales EEG para caracterizar las diferencias entre los subtipos de TDAH en función del sexo [ 43 ], se encontró que el componente hiperactivo / impulsivo maduran con la edad y que la falta de atención parece ser más generalizado con el aumento de la edad. En cuanto a las diferencias de sexo, se encontraron que las diferencias de grupo eran más pequeñas en mujeres que en hombres. 2.1.4 EL USO DE LA MRI EN EL DIAGNÓSTICO DEL TDAH La imagen por resonancia magnética (MRI) consiste en la utilización de campos magnéticos (en lugar de radiaciones ionizantes) para la obtención de las diferentes imágenes. En relación con nuestro problema, existen estudios en los que se han encontrado diferencias en como se 10 UNIVERSIDAD DE VALLADOLID CAPÍTULO 2. ANTECEDENTES ve afectado el cerebro de un paciente diagnosticado con TDAH en función del sexo, donde se hayaron diferencias en las redes fronto-subcorticales, estando estas más afectadas en las niñas. [44] 2.1.5 ESTADO DEL ARTE: LA INTERPRETACIÓN DEL DEEP LEARNING Uno de los objetivos que se persigue con este trabajo es desarrollar un método que nos permita interpretar el comportamiento de la CNN en términos de las señales de actividad. Existen algunos trabajos que han utilizado técnicas para realizar estudios similares en relación con el diagnóstico de enfermedades. En concreto dividiremos los estudios en dos bloques: Estudios que realizan interpretación de redes neuronales en el diagnóstico de enfermedades. Estudios que aplican interpretabilidad en deep learning para el diagnóstico del TDAH. 2.1.5.1 INTERPRETACIÓN DE REDES NEURONALES EN EL DIAGNÓSTICO DE ENFERMEDADES Existen varios estudios recientes que aplican metodologías de interpretación de redes, utilizando como señales de entrada señales EEG e imágenes MRI. En [ 45 ], Jonas et al. utilizan señales EEG junto con una red neuronal convolucional para predecir el pronóstico de pacientes en coma tras haber sufrido un paro cardíaco. Una vez realizada la clasificación, utilizan el cálculo de mapas de activación de clases ponderados por gradiente (Grad- CAM) para identificar las características de las señales EEG que la red utilizó para la correcta clasificación, obteniendo resultados prometedores. La técnica de (Grad-CAM) también ha sido empleada por Uyttenhove et al. al. para interpretar los resultados de una red convolucional que detecta sujetos que padecen epilepsia [ 46 ], obteniendo como resultado que dicha red es capaz de aprender características sensibles con conexiones a marcadores de epilepsia conocidos. Existen estudios que han utilizado imágenes por resonancia magnética como señales de entrada de redes neuronales para su posterior interpretación. En concreto, Cai et al. al. utilizan una versión mejorada del mapa de activación de clases (CAM) para encontrar texturas en las imágenes MRI que se correlacionen con los subtipos de distrofia muscular. [ 47 ]. En un estudio sobre las migrañas, se encontraron patrones de activación diferentes en las MRI del cerebro usando redes convolucionales y CAM. [ 48 ]. También se han utilizado los mapas de activación de clases, en este caso Grad-CAM para encontrar patrones que ayuden a mejorar el diagnóstico del cáncer de mama mediante MRI [49]. Otro estudio, realizado en 2018, utilizaba señales de electroencefalograma (EEG), electromiograma (EMG) y electrooculograma (EOG) para entrenar una red convolucional y despúes obtener los mapas de activación mediante Grad-CAM guiado para identificar características en estas señales [50]. 11 CAPÍTULO 2. ANTECEDENTES PATRICIA AMADO CABALLERO 2.1.5.2 INTERPRETABILIDAD DEL DEEP LEARNING PARA EL DIAGNÓSTICO DEL TDAH En el estudio planteado por Chen et al. al. en 2019 emplearon redes convolucionales y mapeo de activación de clases ponderado por gradiente (Grad-CAM) para detectar anomalías de frecuencia espacial personalizadas en EEG de niños con TDAH. Las señales de entrada utilizadas para este estudio fueron señales EEG [ 51 ]. El estudio pudo detectar anomalías EEG de niños con TDAH visualizando el proceso de toma de decisiones y encontró diferencias significativas con respecto al grupo de control. 2.1.6 ANÁLISIS Y COMPARATIVA En este capítulo, se ha realizado un repaso de diversos estudios en las dos líneas de investigación en las que se enmarca este trabajo: el diagnóstico del TDAH para grupos diferenciados de sexo y edad y el empleo del deep learning para obtener información útil en el diagnóstico de enfermedades. Según lo que hemos visto a lo largo de este capítulo, podemos afirmar que: Los estudios que hablan de las diferencias de los síntomas por sexo y edad, coinciden en una déficit en el diagnóstico en las niñas. Las técnicas de visualización de mapas de activaciones en redes neuronales se han utilizado en el estudio de diversas enfermedades, pero no existen estudios conocidos que utilicen actimetría para ello. Aunque si se ha empleado Deep Learning para diseñar métodos objetivos de diagnóstico para el TDAH, no hemos encontrado ninguno que aplique metodologías de interpretación. Con todo lo planteado, podemos justificar nuestra propuesta de desarrollo de un sistema de diagnóstico experto utilizando la sectorización de pacientes y técnicas de Deep Learning. 2.2 TÉCNICAS Y MÉTRICAS PARA EVALUAR EL RENDIMIENTO DE UN SISTEMA DE RECONOCIMIENTO DE PATRONES El Reconocimiento de Patrones es la disciplina científica que estudia los procesos que permiten extraer información de un conjuntos de datos, con el objetivo de llevar a cabo acciones posteriores como clasificación de los datos en unas determinadas categorías o labores de regresión para predecir un determinado valor no observado. En lo que sigue, y dadas las características de este trabajo, nos centraremos en la tarea de clasificación. Dicho esto, en un sistema de reconocimiento de patrones se realizan las siguientes etapas: Adquisición de datos de entrada. Extracción de características a partir de los datos de entrada. Se espera que estas características resuman la información contenida en los datos y que mantengan poder discriminante suficiente para que sean útiles en la etapa de clasificación. 12 UNIVERSIDAD DE VALLADOLID CAPÍTULO 2. ANTECEDENTES Clasificación del conjunto de datos de estudio en grupos o clases, basándose en las características extraídas. En esta sección se presentarán las técnicas y métricas que se han utilizado en la evaluación del sistema experto planteado en este trabajo. 2.2.1 TÉCNICAS PARA LA EVALUACIÓN DEL RENDIMIENTO DE UN SISTEMA EXPERTO Existen diversas técnicas que permiten evaluar el rendimiento en los sistemas de reconocimiento de patrones. En este trabajo nos centramos en el aprendizaje supervisado, de forma que el sistema que diseñaremos parte de la disposición de una base de datos suficientemente grande de ejemplos etiquetados como para que el sistema experto pueda aprender a partir de ellos. Entendemos por etiquetados, en nuestro dominio de aplicación, señales de actigrafía que vengan acompañadas de un diagnóstico (como sano –control– o enfermo –caso–), así como de información demográfica adicional como edad o sexo. Pues bien, el aprendizaje consiste en ajustar los parámetros libres del sistema experto a partir de un subconjunto de datos de la base de datos que acabamos de mencionar. Al subconjunto empleado para entrenar se le denomina conjunto de entrenamiento. Normalmente se acompaña el conjunto de entrenamiento de un conjunto de validación, el cual permite seleccionar los metaparámetros de nuestro problema, por ejemplo, la arquitectura de clasificador a seleccionar –si se han entrenado varias arquitecturas– o cualquier otro parámetro que no se fije mediante el entrenamiento. Finalmente, las prestaciones del sistema de reconocimiento de patrones se miden a partir de parámetros de rendimiento cuyos valores se obtienen haciendo funcionar el sistema experto finalmente elegido sobre un conjunto de test. Los tres subconjuntos que acabamos de mencionar (entrenamiento, validación y test) deben ser disjuntos, con el objetivo de que las medidas sean fiables. De no serlo, es decir, de coincidir datos, pongamos de entrenamiento y test, las medidas obtenidas serán, con toda seguridad, excesivamente optimistas. En el caso en el que las bases de datos sean muy grandes, emplear este procedimiento para una determinada selección de datos en los tres conjuntos podría ser suficiente. Ahora bien, cuando estas bases de datos son pequeñas, hecho que ocurre con frecuencia en aplicaciones clínicas donde no es sencillo reclutar a elevadas cantidades de pacientes, el hecho de que los datos se seleccionen de una u otra manera para construir estos tres conjuntos puede tener relevancia, de tal manera que una ordenación podría traer consigo resultados pesimistas, pero otra, por meras razones de tamaño muestral, podría traer consigo unos resultados optimistas. Por este motivo, se recurre habitualmente a un procedimiento consistente en la validación cruzada. Esta técnica consiste en llevar a cabo múltiples asignaciones de datos a los diferentes conjuntos de entrenamiento, validación y test y, para cada una de esas ordenaciones, medir las prestaciones del sistema. Con ello conseguimos no una (única) medida de las prestaciones, sino un muestro de la función de densidad del parámetro de medida de prestaciones que estemos empleando, lo cual nos permite proporcionar una medida en términos estadísticos y así aproximarnos mejor al verdadero valor del parámetro que estamos buscando. Dentro de la validación cruzada podemos distinguir, asimismo, varias técnicas. Dos de ellas son la validación cruzada con k-folds y, un casi particular y muy singular del anterior, la validación 13 CAPÍTULO 2. ANTECEDENTES PATRICIA AMADO CABALLERO cruzada Leave One Out, que por su popularidad merece un análisis separado. 2.2.1.1 VALIDACIÓN CRUZADA Como ya hemos apuntado, la validación cruzada se caracteriza por la utilización del análisis estadístico para la evaluación de los resultados, garantizando así la independencia entre las particiones de entrenamiento y test. Su principio de funcionamiento consiste en realizar un análisis variando los conjuntos de entrenamiento y test, manteniendo la misma proporción, para después calcular, por ejemplo, la media aritmética de los resultados. En función de cómo se distribuyen las particiones, tendremos diferentes tipos de validación cruzada. Para el desarrollo de nuestro sistema experto hemos empleado: Validación cruzada con k-folds : Consiste en dividir los datos de muestra en k subconjuntos, empleando uno de ellos para los datos de test y el resto (k-1) para los datos de entrenamiento. Este proceso se repite durante k iteraciones, hasta que se han evaluado todos los conjuntos de test disponibles. Mediante está técnica, tenemos la ventaja de que se evalúan todos los datos, pero la carga computacional alta. Podemos ver en la figura 2.1 un ejemplo de funcionamiento de este tipo de validación. FIGURA 2.1: Ejemplo de funcionamiento de Validación con k-folds para 3 iteraciones Validación Leave One Out : En este caso, los datos se separan de forma que cada iteración consta de una única muestra en el conjunto de test. Esta técnica nos permite ajustar muy bien el error, pero la carga computacional es elevada debido a que el número de iteraciones es directamente proporcional al número de muestras del que disponemos. Su diagrama de funcionamiento puede verse en la figura 2.2, donde se ha patente que este método es el caso particular del anterior para k=N, con N el tamaño del registro de datos. 2.2.1.2 MÉTRICAS PARA EVALUAR LA VALIDEZ DE LOS MODELOS DE CLASIFICACIÓN A la hora de evaluar las propiedades de un sistema de diagnóstico, existen diversas métricas que nos proporcionan una idea del comportamiento del mismo. En función de la interpretación que podemos hacer de los resultados obtenidos para estos indicadores, podemos hablar de dos grupos diferenciados: 14 UNIVERSIDAD DE VALLADOLID CAPÍTULO 2. ANTECEDENTES FIGURA 2.2: Ejemplo de funcionamiento de Validación Leave One Out para un conjunto de N=18 muestras Intrínsecos del desempeño de la prueba Permiten evaluar una prueba diagnóstica sin tener en cuenta la prevalencia de la patología en la población estudiada. En el presente estudio, se han analizado la sensibilidad y la especificidad. Indicadores de la eficacia real de la prueba : En este grupo podemos incluir los valores predictivos, que si bien responden a la probabilidad de que la persona efectivamente esté enferma ante un test positivo, variarán enormemente con la población estudiada. También se puede incluir la exactitud, que mide la probabilidad de detectar la presencia o ausencia de enfermedad. Para comprender el significador correcto de estas métricas, debemos distinguir entre cuatro grupos de pacientes: Verdaderos Positivos (VP) : Pacientes cuyo resultado en una prueba diagnóstica es positivo y realmente están afectados por la enfermedad estudiada. Falsos Negativos (FN) : Aquellos pacientes afectados por la enfermedad que no son detectados como positivos por la prueba diagnóstica. Falsos Positivos (FP) Se refiere a los pacientes para los que la prueba diagnóstica da un resultado positivo y realmente son sujetos sanos. Verdaderos Negativos (VN) : Sujetos sanos para los que la prueba diagnóstica es negativa. 2.2.1.3 SENSIBILIDAD Y ESPECIFICIDAD Son independientes de la prevalencia de la enfermedad en la población estudiada y pueden definirse como: 15 CAPÍTULO 3. MÉTODOS PATRICIA AMADO CABALLERO Ventanas de 1800 DÍA NOCHE GRUPO DE ESTUDIO Caso Control Caso Control Chicas 1311 1316 967 934 Chicos 5252 5791 3748 4199 Secundaria 996 779 691 566 Primaria 5567 6328 4024 4567 Ventanas de 300 DÍA NOCHE GRUPO DE ESTUDIO Caso Control Caso Control Chicas 8093 7957 4392 4370 Chicos 32489 35478 17256 19213 Secundaria 6208 4843 3157 2406 Primaria 34374 38592 18491 21177 Ventanas de 60 DÍA NOCHE GRUPO DE ESTUDIO Caso Control Caso Control Chicas 40322 39641 8077 10121 Chicos 162053 178112 33773 46308 Secundaria 30864 24347 6781 5534 Primaria 171511 193406 35069 50895 TABLA 3.3: Imágenes disponibles para los entrenamientos en cada uno de los grupos 3.1.4 CLASIFICACIÓN FINAL DE LOS PACIENTES La CNN nos permite establecer una clasificación de las ventanas de actividad, por lo que será necesario implementar algoritmos que nos permitan realizar la clasificación a nivel de pacientes. Para ello, hemos seguido la metodología descrita en [ 5 ]; la figura 3.4 muestra un esquema de cómo se realiza este procesado. De forma breve, introducimos a un clasificador dos variables, a saber el porcentaje de ventanas de actividad diurna que han resultado ser caso, y ese porcentaje para ventanas de actividad nocturna. Con los modelos de los clasificadores entrenados se hacen predicciones sobre el mismo conjunto de test sobre el que se evaluaba la CNN. El número total de pacientes pertenecientes a los conjuntos de test y train de pacientes puede verse en la tabla 3.5. 22 UNIVERSIDAD DE VALLADOLID CAPÍTULO 3. MÉTODOS CHICAS Ventana Casos Dia Controles Dia Casos Noche Controles Noche 60 s 50.43% 49.57% 44.38% 55.62% 300 s 50,42% 49.58% 50.13% 49.87% 1800 s 49.90% 50.10% 50.87% 49.13% CHICOS Ventana Casos Dia Controles Dia Casos Noche Controles Noche 60 s 47.64% 52.36% 42.17% 57.83% 300 s 47.80% 52.20% 47.32% 52.68% 1800 s 47.56% 52.44% 47.16% 52.84% SECUNDARIA Ventana Casos Dia Controles Dia Casos Noche Controles Noche 60 s 50,43% 44.10% 55.06% 44.94% 300 s 50,43% 43.82% 56.75% 43.25% 1800 s 50,43% 43.89% 54.97% 45.03% PRIMARIA Ventana Casos Dia Controles Dia Casos Noche Controles Noche 60 s 47 % 53% 40.79% 59.21% 300 s 47.11% 52.89% 46.61% 53.39% 1800 s 46.80% 53.20% 46.84% 53.12% TABLA 3.4: Porcentaje medio de imágenes empleadas en el entrenamiento GRUPO DE ESTUDIO TRAIN TEST Chicas 19 8 Chicos 80 32 Secundaria 14 5 Primaria 85 35 TABLA 3.5: Sujetos que forman parte de los conjuntos de train y test en la clasificación de pacientes 23 CAPÍTULO 3. MÉTODOS PATRICIA AMADO CABALLERO CHICAS Periodos de actividad 60s-300s-1800s Imágenes de Entrenamiento 129x55 píxeles DÍA NOCHE CNN 1 CNN 2 TDAH NO TDAH TDAH NO TDAH CHICOS Periodos de actividad 60s-300s-1800s Imágenes de Entrenamiento 129x55 píxeles DÍA NOCHE CNN 1 CNN 2 TDAH NO TDAH TDAH NO TDAH SECUNDARIA Periodos de actividad 60s-300s-1800s Imágenes de Entrenamiento 129x55 píxeles DÍA NOCHE CNN 1 CNN 2 TDAH NO TDAH TDAH NO TDAH PRIMARIA Periodos de actividad 60s-300s-1800s Imágenes de Entrenamiento 129x55 píxeles DÍA NOCHE CNN 1 CNN 2 TDAH NO TDAH TDAH NO TDAH FIGURA 3.3: Proceso de entrenamiento del sistema de diagnóstico. Conjunto de Entrenamiento TDAH NO TDAH TDAH NO TDAH DÍA NOCHE N º TDAH N º NO TDAH N º TDAH N º NO TDAH % CASO % CONTROL % CASO % CONTROL Clasificadores 2D FIGURA 3.4: Proceso de entrenamiento para la clasificación por pacientes 24 UNIVERSIDAD DE VALLADOLID CAPÍTULO 3. MÉTODOS 3.2 ANÁLISIS DE LAS ACTIVACIONES DE LA CNN Podemos dividir los métodos utilizados para la interpretación de redes convolucionales en dos tipos, en función de su principio de funcionamiento: Técnicas de análisis del funcionamiento de cada neurona de la CNN, como la visualización de los filtros, pesos o activaciones de las neuronas de la red [58]. Técnicas basadas en la obtención de mapas que reflejen a partir de una imagen de entrada la importancia que tienen los píxeles en la predicción de la CNN [59]. En el presente trabajo se han estudiado varias de estas técnicas con el objetivo de diseñar mapas asociados a cada uno de los sujetos e intentar encontrar la relación entre el comportamiento de la CNN y las señales de entrada. 3.2.1 MAPAS DE ACTIVACIONES NEURONALES En [ 60 ], Molnar plantea la interpretación de los resultados obtenidos mediante técnicas de aprendizaje automático como un problema matemático de optimización. Las redes convolucionales aprenden conceptos abstractos de las imágenes con las que alimentamos la red, especialmente en las capas ocultas. En estas redes, la imagen se va transformando a través de las capas convolucionales, aprendiendo características más complejas con cada transformación. Típicamente, las primeras capas convolucionales suelen centrarse en aprender características relacionadas con los bordes y texturas más básicas y las últimas capas suelen centrarse en la detección de partes de objetos de la imagen. Para visualizar las características, se suele emplear una imagen de entrada que maximice la activación de la red y se ven las zonas de activación para cada neurona. Debido a que la cantidad de neuronas que posee una red convolucional es muy grande, se suelen visualizar las características mediante los canales de cada capa, obteniendo un mapa de activación por cada una de las capas. Nuestro objetivo será crear mapas propios de activación que nos permitan extraer características propias asociadas a cada uno de los grupos estudiados. Para ello se han realizado los siguientes pasos: Extracción de las imágenes que maximicen la activación de la red. Obtención de la activación de las neuronas de la CNN. Creación de mapas asociados a cada sujeto de caso o control y aplicación de técnicas PCA para extraer conclusiones de dichos mapas. 3.2.1.1 PROCESADO PREVIO AL CÁLCULO DE LAS ACTIVACIONES DE LA CNN Para poder extraer las activaciones de las neuronas, es importante que la imagen de entrada maximice la activación de la red para una de las clases sobre las que se esté evaluando. En nuestro caso, estas imágenes se corresponderán con las imágenes que tras el entrenamiento de la red neuronal son clasificadas correctamente cuando se evalúa esta imagen en el conjunto de test. 25 CAPÍTULO 3. MÉTODOS PATRICIA AMADO CABALLERO En nuestro caso concreto, hemos seleccionado las imágenes cuya tasa de acierto se corresponde con más de un 90%. En la tabla 3.6 podemos ver cuántas imágenes de entrada maximizan la red para cada conjunto. Ventanas de 1800 DÍA NOCHE GRUPO DE ESTUDIO Caso Control Caso Control Chicas 298 456 267 435 Chicos 1546 2399 1513 2315 Secundaria 395 254 219 132 Primaria 1326 2398 1421 2553 Ventanas de 300 DÍA NOCHE GRUPO DE ESTUDIO Caso Control Caso Control Chicas 1893 2895 956 1104 Chicos 8325 12838 4579 7664 Secundaria 2238 1740 882 207 Primaria 9089 14698 5666 8258 Ventanas de 60 DÍA NOCHE GRUPO DE ESTUDIO Caso Control Caso Control Chicas 1778 3577 687 2213 Chicos 107682 125191 6187 18450 Secundaria 5764 3112 1618 402 Primaria 114558 135427 8179 22687 TABLA 3.6: Imágenes que maximizan la activación disponibles para los entrenamientos en cada uno de los grupos Con estos conjuntos de imágenes, calcularemos las activaciones de la red para la creación de los mapas de activación. 3.2.1.2 MAPAS DE ACTIVACIONES A PARTIR DE LA EXCITACIÓN DE LAS NEURONAS En una red convolucional, cada una de las capas está formada por neuronas que, en función de la imagen con la que alimentemos la entrada, reaccionarán y permitirán la clasificación final de dicha imagen en uno de los grupos sobre los que se realice el estudio. Si se encuentra que determinadas neuronas reaccionan siempre para un grupo de estudio concreto (Caso o Control en nuestro problema), nos será posible establecer un patrón de activación que supondrá el primer paso a la hora de elaborar un sistema que nos permita dar sentido al comportamiento de la red neuronal. Utilizaremos los conjuntos de imágenes definidos en 3.2.1.1 para visualizar las activaciones de las neuronas de la red. 26 UNIVERSIDAD DE VALLADOLID CAPÍTULO 3. MÉTODOS En función de la capa en la que centremos nuestro análisis la red detectará patrones diferentes, desde texturas y bordes en las primeras capas hasta partes de objetos en las más profundas [ 60 ]. En nuestro caso, las imágenes con las que alimentamos la red no son imágenes al uso, sino una representación de las señales de actimetría en tiempo-frecuencia, por lo que nos interesa que los patrones que obtengamos nos muestren activaciones en las bajas, medias o altas frecuencias. Es por ello que, vamos a analizar las activaciones de la última capa convolucional de nuestra red, antes de la capa Relu y las de clasificación, puesto que será más probable encontrar patrones más complejos en esta capa que en las anteriores. Con las activaciones de la capa seleccionada, elaboraremos un mapa por cada uno de los sujetos de estudio, mediante el siguiente procesado: Se calculan las activaciones que generan cada una de las imágenes de máxima activación asociadas a cada sujeto. Obtenemos entonces para cada imagen un mapa de activaciones; donde cada uno de los rectángulos representa una neurona y su color la intensidad con la que se activa. Cada mapa estará compuesto por las activaciones de las 128 neuronas de la capa convolucional, como se ilustra en la figura 3.5. Por lo tanto, los mapas serán matrices de 256x224. Se obtienen para cada sujeto un mapa por cada una de las imágenes de máxima activación. Los mapas obtenidos para cada imagen se promedian, obteniendo finalmente un mapa de activación por cada sujeto, donde cada rectángulo representará la activación media de esa neurona para el sujeto de estudio. Esto se realiza para la activación nocturna y diurna. FIGURA 3.5: Mapa de Activación obtenido para un caso Este proceso, que está esquematizado en la figura 3.7, se repite para todos los grupos de entrenamiento presentados en 3.1.3. Una vez obtenemos estos mapas de activación, podemos empezar a realizar el procesado que nos permita dar sentido a las diferencias en los mapas. Este procesado consiste en la obtención de los autovectores de las imágenes obtenidas de los mapas mediante la técnica de 27 CAPÍTULO 3. MÉTODOS PATRICIA AMADO CABALLERO FIGURA 3.6: Mapa de Activación obtenido para un caso eigenfaces, comúnmente utilizada para la obtención de patrones en redes de reconocimiento facial. Finalmente, tendremos unos mapas de activación caracterizados por los autovectores de las activaciones promedio de la CNN, como los que vemos en la figura 3.8. 28 UNIVERSIDAD DE VALLADOLID CAPÍTULO 3. MÉTODOS IMAGEN 1 IMAGEN 2 IMAGEN X Mapa de activaciones 256x224 Mapa de activaciones 256x224 Mapa de activaciones 256x224 PROMEDIO Mapa de activaciones promedio 256x224 FIGURA 3.7: Esquema del procesado de los diferentes mapas de activación 29 CAPÍTULO 3. MÉTODOS PATRICIA AMADO CABALLERO 3.2.1.3 EIGENFACES: CÁLCULO DE AUTOVECTORES PARA EL RECONOCIMIENTO DE PATRONES Se entiende por autovectores de una matriz a aquellos vectores distintos de cero que para cierto escalar λcumplen; Ax=λx(3.2) El término Eigenfaces o caras propias hace referencia al conjunto de vectores propios utilizado principalmente en problemas de reconocimiento facial. Los autovectores se derivan de la matriz de covarianza de la distribución de probabilidad sobre el espacio vectorial de alta dimensión de las imágenes de entrada. Los Eigenfaces permiten crear un conjunto básico de todas las imágenes utilizadas para construir la matriz de covarianza, lo que lleva a una reducción de la dimensionalidad del problema, ya que con un conjunto más pequeño caracterizamos el conjunto original de imágenes de entrenamiento [61]. Para calcular los Eigenfaces hemos aplicado la siguiente metodología: Primero, se calcula el mapa de activación de cada sujeto del grupo de estudio según el procesado explicado en 3.2.1.2. Se calcula la media de los mapas de activación del grupo de estudio y se resta a cada uno de los mapas. Vectorizamos estos nuevos mapas, redimensionando para obtener un vector para cada uno de los sujetos de estudio. Calculamos la matriz de covarianza y sus autovectores y autovalores, donde cada autovector tendrá la misma dimensionalidad que el mapa de activaciones. Por último, se eligen las componentes principales y se genera un nuevo mapa que caracteriza a cada sujeto a partir de sus autovectores. Podemos ver en la figura 3.8 un ejemplo de cómo son estos nuevos mapas. 3.2.2 DEEPDREAM,EL ALGORITMO DE GOOGLE DeepDream es un algoritmo creado por Google que consiste en la visualización de los patrones aprendidos por una red neuronal. Para ello, envía una imagen a través de la red, calcula el gradiente de la imagen con respecto a las activaciones de una capa en particular y devuelve una imagen que supondría la activación máxima de la red para las clases estudiadas [62]. En nuestro caso concreto, hemos utilizado el algoritmo DeepDream de Matlab para visualizar cuál sería la activación máxima de la red para casos y controles. Hemos aplicado este algoritmo de dos formas diferentes: Directo sobre la capa de clasificación de la CNN, para obtener imágenes que reflejen cómo sería la activación máxima de la red. Aplicando el algoritmo sobre las imágenes de entrada que utilizábamos para los mapas de activaciones de neuronas y observando los patrones que se generan a partir de ellas. 30 UNIVERSIDAD DE VALLADOLID CAPÍTULO 3. MÉTODOS FIGURA 3.8: Eigenfaces obtenidas para un caso 3.2.3 ALGORITMOS PARA LA VISUALIZACIÓN DE ZONAS DE ACTIVACIÓN A lo largo de los años y con el auge del Deep Learning, se han desarrollado diferentes técnicas que permiten visualizar la importancia que tiene cada píxel de la imagen de entrada en las predicciones realizadas por la red, con el objetivo de conseguir realizar una interpretación del funcionamiento de la red. Entre las numerosas técnicas existentes, en el presente trabajo nos hemos centrado en las siguientes: Métodos basados en Class Activation Mapping (CAM) , que son técnicas que evalúan la zona de activación en función de la activación de la capa Softmax mediante la obtención la agrupación promedio global (GAP) de la CNN [ 63 ]. En nuestro caso, hemos empleado el método Grad-CAM , que es una generalización del método CAM, pero aplicando el cálculo del gradiante para calcular la agrupación promedio. Métodos basados en perturbaciones , cuyo principio de funcionamiento consiste en someter a perturbaciones a las características de una imagen fija, alimentar el modelo con esta imagen modificada y evaluar cómo cambia el resultado. La técnica de este tipo que hemos implementado en este trabajo se conoce como técnica de oclusión y permite obtener imágenes modificadas empleando una máscara que permite ocultar ciertas zonas de la imagen original. Los mapas obtenidos mediante estas técnicas son de las dimensiones de las imágenes de entrada, 129x55. Se ha caracterizado a los casos y controles de cada uno de los grupos mediante sus mapas de oclusión y Grad-CAM promedio con un proceso análogo al que se describe en el esquema de la figura 3.7. En los siguientes apartados se explicará el principio de funcionamiento de estos métodos de visualización. 31 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO Conjunto Sensibilidad Precisión Especificidad VPP NVP LR+ LR- 1800 1 0.9 0.75 0.8750 1 4 0 300 1 0.86 0.65 0.8450 0.8 2.8571 0 60 0.9667 0.92 0.85 0.9167 0.95 6.444 0.0392 TABLA 4.2: Resultados obtenidos para el conjunto de secundaria. Conjunto Sensibilidad Precisión Especificidad VPP NVP LR+ LR- 1800 0.9235 0.9486 0.9722 0.9705 0.9322 32.2 0.0787 300 0.9471 0.96 0.9722 0.9721 0.9541 39.0941 0.0545 60 0.9529 0.9743 0.9944 0.9941 0.9581 171.529 0.0473 TABLA 4.3: Resultados obtenidos para el conjunto de primaria. Conjunto Sensibilidad Precisión Especificidad VPP NVP LR+ LR- 1800 1 0.9571 0.90 0.9705 0.9467 10 0 300 1 09429 0.8667 0.9267 1 7.5 0 60 0.85 0.9143 1 1 0.8850 0.15 TABLA 4.4: Resultados obtenidos para el conjunto de chicas. Conjunto Sensibilidad Precisión Especificidad VPP NVP LR+ LR- 1800 0.9125 0.9438 0.9750 0.9757 0.9227 36.5 0.08970 300 0.9313 0.9531 0.9750 0.9753 0.9362 37.25 0 60 0.9625 0.9688 0.9750 0.9757 0.9646 38.5 0.0385 TABLA 4.5: Resultados obtenidos para el conjunto de chicos. 38 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN Cabe destacar que en el caso de los grupos de secundaria y las chicas, el conjunto de test es tan pequeño que un error en la clasificación de un único sujeto puede significar una gran variación en el resultado. Es por esto que para estos conjuntos se ha realizado también una clasificación Leave One Out. En las tablas 4.6 y 4.7 se muestran los resultados obtenidos para esta clasificación. Conjunto Exactitud σ 1800 0.9789 0.0713 300 0.9789 0.035 60 0.9684 0.0820 TABLA 4.6: Exactitud para la clasificación Leave One Out de secundaria. Conjunto Exactitud σ 1800 0.9741 0.0656 300 0.9667 0.0679 60 0.9593 0.0747 TABLA 4.7: Exactitud para la clasificación Leave One Out de chicas. En los resultados obtenidos para la clasificación Leave One Out se puede observar que la tasa de acierto a la hora de clasificar cada sujeto individualmente es elevada, lo que indica que a pesar de estar trabajando en grupos de test pequeños, la respuesta del sistema de clasificación es buena para dichos grupos. Los valores predictivos y las razones de verosimilitud son parámetros que tienen aplicación clínica ya que permiten hacernos una idea de la eficacia de la prueba diagnóstica. En nuestro caso, todos los grupos presentan valores predictivos elevados, por lo que podemos afirmar que nuestro sistema se comporta de manera eficiente, con una cantidad muy pequeña de falsos negativos y falsos positivos. Las razones de verosimilitud nos permiten medir la validez de una prueba diagnóstica. Para que la utilidad de dicha prueba sea elevada, los valores de LR+ y LR- deben ser superiores a 10 e inferiores a 0.1 respectivamente, como ya pusimos de manifiesto en la tabla 2.4. En nuestro caso se cumplen estas condiciones en la mayoría de los grupos, con excepción de los conjuntos de secundaria y las chicas, debido principalmente a que el conjunto de test es muy pequeño. En relación con el resto de métricas que hemos evaluado, el sistema otorga buenas prestaciones en términos de sensibilidad, exactitud y especificidad, aunque son ligeramente inferiores a las que obteníamos al trabajar con el conjunto completo. Esta ligera disminución se debe a que, al trabajar con grupos más pequeños, clasificar erróneamente perjudica más a los porcentajes globales. Para comparar de una forma más equitativa con los resultados obtenidos anteriormente, hemos recogido en la tabla 4.8 la media de fallos que se producen en cada uno de los grupos de entrenamiento y la media que obteníamos para los entrenamientos del grupo completo. Observamos que, en general, la sectorización que hemos llevado a cabo mejora la clasificación global, ya que aunque los porcentajes de exactitud, sensibilidad y especificidad han variado lige- 39 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO Ventana Secundaria Primaria Chicas Chicos Conjunto Global 1800 s <1 1.8 <1 1.5 <1 300 s <1 1.4 <1 1.3 2.5 60 s <1 <1 <1 1 1.2 TABLA 4.8: Media de fallos que se producen en la clasificación. ramente, el sistema falla en clasificar menos pacientes que los que fallaba al hacer la clasificación conjunta. Para ilustrar mejor estas conclusiones, vamos a visualizar los diagramas de dispersión (Scatter Plot) extraídos de los conjuntos de clasificación. 4.1.1.1 SCATTER PLOT PARA LOS GRUPOS DE ESTUDIO En las figuras 4.1 a 4.6 podemos ver los Scatter plot obtenidos para los diferentes tamaños de ventana. Estos diagramas reafirman lo que observábamos en los resultados de la clasificación global , los Scatter Plot nos muestran un bajo número de sujetos mal clasificados, en particular cuando se trata de casos. Con los resultados obtenidos, podemos afirmar que la CNN diseñada es un buen punto de partida para aplicar los algoritmos de interpretabilidad. 40 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.1: Scatter Plot para las ventanas de 1800s de Chicas (izquierda) y Chicos (derecha). FIGURA 4.2: Scatter Plot para las ventanas de 1800s de secundaria(izquierda) y primaria(derecha). 41 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO FIGURA 4.3: Scatter Plot para las ventanas de 300s de chicas (izquierda) y chicos (derecha). FIGURA 4.4: Scatter Plot para las ventanas de 300s de secundaria(izquierda) y primaria(derecha). 42 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.5: Scatter Plot para las ventanas de 60s de de chicas (izquierda) y chicos (derecha). FIGURA 4.6: Scatter Plot para las ventanas de 60s de secundaria(izquierda) y primaria(derecha). 43 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO 4.2 PRESTACIONES Y RESULTADOS OBTENIDOS PARA LOS DIFERENTES MÉTODOS DE INTERPRETABILIDAD DE LA CNN En el capítulo 3 se explicaron varias técnicas que sirven para extraer de la red neuronal información útil a la hora de entender e interpretar su funcionamiento. En esta sección vamos a ver algunos de los resultados obtenidos tras adaptar esas técnicas a nuestro problema concreto. Presentaremos los resultados en dos grupos: Métodos que se centran en el funcionamiento de la CNN. Métodos que permiten la visualización de las zonas más relevantes de la imagen para su posterior clasificación. Con ello, se pretende llegar a un método que nos permita entender visualmente las diferencias entre aquellos sujetos que están diagnosticados con TDAH (casos) y los sujetos de control. 4.2.1 MAPAS DE ACTIVACIONES En la sección 3.2.1.2 se detalló el proceso de obtención de estos mapas de activaciones. Cuando se obtiene el mapa de las activaciones, lo que se obtiene es la activación que cada una de las imágenes de entrada provoca en las neuronas de la capa seleccionada. En nuestro caso, se ven las 128 neuronas pertenecientes a la tercera capa convolucional, que es la capa más profunda de la red y la que creemos que puede darnos información más relevante. Para obtener cada uno de los mapas para cada sujeto se ha hecho primero una media de las activaciones en cada uno de los 10 folds entrenados (sección 3.1.3) y después se han medido las activaciones de neuronas que provocan cada una de las imágenes de acierto máximo que hemos obtenido para cada sujeto. Finalmente, cada sujeto tendrá asociados dos mapas de activación: uno relacionado con las redes separadas en grupos de edad y otro para los grupos separados por sexo. Vamos a visualizar en las figuras 4.7 y 4.8 algunos de los mapas de activación obtenidos Los mapas de activación muestran ligeras variaciones en las neuronas que se activan en función de si es caso o control, pero no se ve de una forma clara cuál puede ser el origen de dichas variaciones. 4.2.1.1 EIGENFACES SOBRE LOS MAPAS DE ACTIVACIÓN Debido a que los mapas de activación por sí solos no proporcionan una interpretación clara, vamos a proceder a realizar sobre ellos el cálculo de los Eigenfaces, o conjunto de vectores propios empleados en problemas de reconocimiento facial (sección 3.2.1.3). Adaptando esta técnica a nuestro caso particular, se han obtenido mapas de Eigenfaces como los que podemos ver en la figura 4.9, en la que se muestran los Eigenfaces de dos chicas de control y dos casos. Vemos que las imágenes características obtenidas sí que presentan diferencias pero, 44 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.7: Mapas de activación para dos chicas de secundaria en el tramo de actividad diurna. FIGURA 4.8: Mapas de activación para dos chicas de primaria en el tramo de actividad nocturna. al igual que pasaba con los mapas de activaciones, no nos clarifican a qué se deben dichas diferencias. El análisis a partir de los mapas de activaciones y los Eigenfaces no parece proporcionar una explicación clara de los pormenores de la CNN, pero sí nos permite ver ligeras diferencias en función de si el sujeto que estamos evaluando es un caso o un control. Por tanto, resultará interesante probar otros métodos alternativos. 4.2.1.2 APLICACIÓN DEL ALGORITMO DEEP DREAM PARA LOS CUATRO SUBGRUPOS DE ESTUDIO Este algoritmo, que se explicó en el capitulo 3.2.2, nos puede servir para comprobar que en la red: 45 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO FIGURA 4.9: Mapas de Eigenfaces obtenidos para controles(izquierda) y casos(derecha) en la red de secundaria. Se activan diferentes zonas de la imagen en función de si es un caso o control. Existen diferencias sustanciales en las activaciones en función del grupo de estudio. Las figuras 4.10 a 4.13 representan las imágenes artificiales creadas por el algoritmo que representarían imágenes idealizadas de entrada para un caso y un control. Estas imágenes nos muestran diferencias importantes, por lo que podemos entender que la red genera excitaciones diferentes de sus neuronas en función de si la imagen de entrada es un caso o control. FIGURA 4.10: Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de secundaria para la actividad nocturna. No obstante, si intentamos aplicar este algoritmo partiendo de las imágenes de entrada de máximo acierto que definíamos en la sección 3.2.1.2 este algoritmo no nos permite apreciar dichas diferencias. 46 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.11: Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de chicas para la actividad nocturna. FIGURA 4.12: Imágenes de activación máxima para un caso (izquierda) y un control(derecha) generadas por el algoritmo DeepDream en la red de primaria para la actividad nocturna. 4.2.2 VISUALIZACIÓN DE LAS ZONAS MÁS RELEVANTES PARA LA CLASIFICACIÓN En los problemas de clasificación, resulta de especial interés poder visualizar aquellas zonas de la imagen de entrada que la red utiliza para hacer la discriminación por clases. En nuestro caso, como las imágenes que utilizamos para alimentar la CNN son espectrogramas de las señales de actividad, este análisis por zonas nos indicará el rango frecuencial que la red está utilizando en la clasificación. Como se mencionó en la sección 3.2.3, en este estudio hemos empleado dos de ellos: Mapas Grad-Cam: Devuelve el mapa de activación de clase ponderado por gradiante. Mapas de Oclusión : Se obtienen midiendo el cambio en la activación total para la capa y el canal especificados cuando algunas partes de los datos de entrada están ocultos con una máscara. En las siguientes secciones vamos a visualizar y explicar los resultados obtenidos mediante estas técnicas. 47 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO FIGURA 4.21: Mapas de oclusión de actividad nocturna para las chicas de secundaria generados para la red entrenada con registros de secundaria. FIGURA 4.22: Mapas de oclusión de actividad diurna para las chicas de primaria para la red entrenada con chicas(CONTROLES). 54 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.23: Mapas de oclusión de actividad diurna de las chicas en primaria para la red entrenada con chicas (CASOS). FIGURA 4.24: Mapas de oclusión de actividad nocturna de las chicas de primaria para la red entrenada con chicas (CONTROLES). 55 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO FIGURA 4.25: Mapas de oclusión de actividad nocturna de las chicas de primaria para la red entrenada con chicas (CASOS). 56 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN Chicos de Secundaria En este grupo, como podemos ver en la figura 4.26, ocurre lo mismo que para las chicas si comparamos con los mapas de los casos de la figura 4.27. En la figura 4.29 podemos ver cómo en los casos la actividad está más extendida a lo largo de la ventana temporal que en los controles. En cuanto al estudio solo por sexo, podemos ver en las figuras 4.30 y 4.31 que tienen especial relevancia los mapas de oclusión de actividad diurna, donde se ve que para los controles se tiende a concentrar la información en la zona central de la ventana de actividad, mientras que la región para los casos es más extensa. FIGURA 4.26: Mapas de oclusión de actividad diurna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CONTROLES) FIGURA 4.27: Mapas de oclusión de actividad diurna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CASOS) 57 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO FIGURA 4.28: Mapas de oclusión de actividad nocturna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CONTROLES) FIGURA 4.29: Mapas de oclusión de actividad nocturna para los chicos de secundaria generados para la red entrenada con registros de secundaria.(CASOS) 58 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.30: Mapas de oclusión de actividad diurna para los chicos de secundaria (controles) en la red de chicos. FIGURA 4.31: Mapas de oclusión de actividad diurna para los chicos de secundaria (casos) en la red de chicos. 59 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO Chicos de Primaria En este subgrupo, para la actividad diurna (figura 4.32), nos encontramos con que los casos tienen una zona de activación más extendida en el rango de frecuencias, con varias áreas de valor máximo, mientras que para los controles se concentra en un punto en torno a la mitad de la ventana, tanto en tiempo como en frecuencia. En cuanto a la actividad nocturna (figura 4.33), nos encontramos en ambos casos con una área de activación grande en la zona central, pero en el caso de los controles el máximo se encuentra en zona de frecuencias mayores. FIGURA 4.32: Mapas de oclusión de actividad diurna para algunos de los casos (derecha) y controles (izquierda) de los chicos de primaria en la red entrenada con chicos. Si vemos los mapas de oclusión para estos mismos sujetos en la red entrenada con registros de primaria ( figura 4.34), encontramos relevantes los mapas de oclusión para la noche, donde se observa que las áreas de activación máxima son muy diferentes para casos y controles. Para los casos, nos encontramos con máximos de tamaño muy pequeño en zonas de baja frecuencia, mientras que para los controles estas áreas son mucho más grandes y a frecuencias más altas. En cuanto a la disposición temporal, los casos presentan los máximos más cercanos al final de la ventana y los controles, más cerca del comienzo. 60 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN FIGURA 4.33: Mapas de oclusión de actividad nocturna para algunos de los casos (derecha) y controles (izquierda) en los chicos de primaria en la red de chicos. FIGURA 4.34: Mapas de oclusión de actividad nocturna para algunos de los casos (derecha) y controles (izquierda) en los chicos de primaria en la red de primaria. 61 CAPÍTULO 4. RESULTADOS Y DISCUSIÓN PATRICIA AMADO CABALLERO CASOS CONTROLES Día Noche Día Noche PRIMARIA SECUNDARIA TABLA 4.9: Resumen de los Mapas de oclusión obtenidos para las CNN de chicas. CASOS CONTROLES Día Noche Día Noche PRIMARIA SECUNDARIA TABLA 4.10: Resumen de los Mapas de oclusión obtenidos para la CNN de chicos. 4.3 DISCUSIÓN DE LOS RESULTADOS CUALITATIVOS OBTENIDOS PARA LOS MAPAS DE OCLUSIÓN En esta sección resumiremos las conclusiones extraídas del estudio de los mapas de oclusión. Para ello, mostraremos en varias tablas los mapas que hemos presentado en la sección 4.2.2.2 y después presentaremos las conclusiones que hemos extraído de ellos. 4.3.1 RESUMEN DE LOS MAPAS DE OCLUSIÓN OBTENIDOS EN EL ESTUDIO En las tablas 4.9 a 4.12 se resumen los mapas de oclusión detallados en la sección 4.2.2.2. Para ello, se presentan mapas de oclusión típicos de cada grupo de estudio en función de la CNN que se esté evaluando. Las tablas 4.9 y 4.10 muestran los resultados de las redes entrenadas con registros de sexo y las tablas 4.11 y 4.12, los resultados de las redes entrenadas con registros de edad. 62 UNIVERSIDAD DE VALLADOLID CAPÍTULO 4. RESULTADOS Y DISCUSIÓN CASOS CONTROLES Día Noche Día Noche CHICAS CHICOS TABLA 4.11: Resumen de los Mapas de oclusión para la CNN de primaria. CASOS CONTROLES Día Noche Día Noche CHICAS CHICOS TABLA 4.12: Resumen de los Mapas de oclusión obtenidos para la CNN de secundaria. 63 BIBLIOGRAFÍA PATRICIA AMADO CABALLERO [33] A.V. Dane, R.J. Schachar, and R. Tannok. Does Actigraphy Differentiate ADHD Subtypes in a Clinical Research Setting? J. Am. Acad. Child. Adolesc. Psychiatry, 39:752–760, 2000. [34] M.H. Teicher, C. A. Glod, K. Pahlavan, D. Harper, E. Magnus, and F. Wren. Locomotor Activity and the Diagnosis of ADHD. Am. Psychiatr Assoc. Abstr., 141:98, 1991. [35] H.J. Kam, K. Lee, S.M. Cho, Y.M. Shin, and R.W. Park. High-Resolution Actigraphic Analysis of ADHD: A Wide Range of Movemente Variability Observation in Three School Courses – A Pilot Study. Healthc. Inform. Res., 17(19–37), 2011. [36] P. Casaseca-de-la-Higuera, D. Martín-Martínez, S. Alberola-López, J. María Andrés-de- Llano, J. Antonio López-Villalobos, J. Ramón-Garmendia Leiza, and C. Alberola-López. Automatic diagnosis of adhd based on multichannel nonlinear analysis of actimetry registries. In 2012 Annual International Conference of the IEEE Engineering in Medicine and Biology Society, pages 4204–4207, Aug 2012. doi: 10.1109/EMBC.2012.6346894. [37] Mario Muñoz-Organero, Lauren Powell, Ben Heller, Val Harpin, and Jack Parker. Automatic extraction and detection of characteristic movement patterns in children with adhd based on a convolutional neural network (cnn) and acceleration images. Sensors, 18(11):3924, 2018. [38] Niamh O’Mahony, Blanca Florentino-Liano, Juan J Carballo, Enrique Baca-García, and Antonio Artés Rodríguez. Objective diagnosis of adhd using imus. Medical engineering & physics, 36(7):922–926, 2014. [39] Aja Louise Murray, Tom Booth, Manuel Eisner, Bonnie Auyeung, George Murray, and Denis Ribeaud. Sex differences in adhd trajectories across childhood and adolescence. Developmental science, 22(1):e12721, 2019. [40] Maryanne Loyer Carbonneau, Martin Demers, Marc Bigras, and Marie-Claude Guay. Metaanalysis of sex differences in adhd symptoms and associated cognitive deficits. Journal of Attention Disorders, 25(12):1640–1656, 2021. [41] Daniel F Hermens, Michael R Kohn, Simon D Clarke, Evian Gordon, and Leanne M Williams. Sex differences in adolescent adhd: findings from concurrent eeg and eda. Clinical neurophysiology, 116(6):1455–1463, 2005. [42] I Lazzaro, E Gordon, W Li, CL Lim, M Plahn, S Whitmont, S Clarke, RJ Barry, A Dosen, and R Meares. Simultaneous eeg and eda measures in adolescent attention deficit hyperactivity disorder. International Journal of Psychophysiology, 34(2):123–134, 1999. [43] Adam R Clarke, Robert J Barry, Rory McCarthy, and Mark Selikowitz. Age and sex effects in the eeg: differences in two subtypes of attention-deficit/hyperactivity disorder. Clinical neurophysiology, 112(5):815–826, 2001. [44] Keri S Rosch, Stewart H Mostofsky, and Mary Beth Nebel. Adhd-related sex differences in fronto-subcortical intrinsic functional connectivity and associations with delay discounting. Journal of neurodevelopmental disorders, 10(1):1–14, 2018. 70 UNIVERSIDAD DE VALLADOLID BIBLIOGRAFÍA [45] Stefan Jonas, Andrea O Rossetti, Mauro Oddo, Simon Jenni, Paolo Favaro, and Frederic Zubler. Eeg-based outcome prediction after cardiac arrest with convolutional neural networks: Performance and visualization of discriminative features. Human brain mapping, 40(16):4606–4617, 2019. [46] Thomas Uyttenhove, Aren Maes, Tom Van Steenkiste, Dirk Deschrijver, and Tom Dhaene. Interpretable epilepsy detection in routine, interictal eeg data using deep learning. In Machine Learning for Health, pages 355–366. PMLR, 2020. [47] Jinzheng Cai, Fuyong Xing, Abhinandan Batra, Fujun Liu, Glenn A Walter, Krista Vandenborne, and Lin Yang. Texture analysis for muscular dystrophy classification in mri with improved class activation mapping. Pattern recognition, 86:368–375, 2019. [48] Hwei Geok Ng, Matthias Kerzel, Jan Mehnert, Arne May, and Stefan Wermter. Classification of mri migraine medical data using 3d convolutional neural network. In International Conference on Artificial Neural Networks, pages 300–309. Springer, 2018. [49] Sarah Eskreis-Winkler, Natsuko Onishi, Katja Pinker, Jeffrey S Reiner, Jennifer Kaplan, Elizabeth A Morris, and Elizabeth J Sutton. Using deep learning to improve nonsystematic viewing of breast cancer on mri. Journal of Breast Imaging, 3(2):201–207, 2021. [50] Fernando Andreotti, Huy Phan, and Maarten De Vos. Visualising convolutional neural network decisions in automatic sleep scoring. In CEUR Workshop Proceedings, pages 70–81. CEUR Workshop Proceedings, 2018. [51] He Chen, Yan Song, and Xiaoli Li. Use of deep learning to detect personalized spatialfrequency abnormalities in eegs of children with adhd. Journal of neural engineering, 16(6): 066046, 2019. [52] Christopher M Florkowski. Sensitivity, specificity, receiver-operating characteristic (roc) curves and likelihood ratios: communicating the performance of diagnostic tests. The Clinical Biochemist Reviews, 29(Suppl 1):S83, 2008. [53] Anne B Arnett, Bruce F Pennington, Erik G Willcutt, John C DeFries, and Richard K Olson. Sex differences in adhd symptom severity. Journal of Child Psychology and Psychiatry, 56(6): 632–639, 2015. [54] Florence D Mowlem, Mina A Rosenqvist, Joanna Martin, Paul Lichtenstein, Philip Asherson, and Henrik Larsson. Sex differences in predicting adhd clinical diagnosis and pharmacological treatment. European child & adolescent psychiatry, 28(4):481–489, 2019. [55] José-Ramón Valdizán Usón, Elvira Mercado Val, and Alberto Mercado Undanivia. Caracteristicas y variabilidad clinica del tdah en niñas. [56] Ning Qian. On the momentum term in gradient descent learning algorithms. Neural networks, 12(1):145–151, 1999. [57] Sebastian Ruder. An overview of gradient descent optimization algorithms. arXiv preprint arXiv:1609.04747, 2016. 71 BIBLIOGRAFÍA PATRICIA AMADO CABALLERO [58] Karen Simonyan, Andrea Vedaldi, and Andrew Zisserman. Deep inside convolutional networks: Visualising image classification models and saliency maps. arXiv preprint ar- Xiv:1312.6034, 2013. [59] Ruth Fong, Mandela Patrick, and Andrea Vedaldi. Understanding deep networks via extremal perturbations and smooth masks. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 2950–2958, 2019. [60] Christoph Molnar. Interpretable machine learning. Lulu. com, 2020. [61] Matthew A Turk and Alex P Pentland. Face recognition using eigenfaces. In Proceedings. 1991 IEEE computer society conference on computer vision and pattern recognition, pages 586–587. IEEE Computer Society, 1991. [62] Alexander Mordvintsev, Christopher Olah, and Mike Tyka. Inceptionism: Going deeper into neural networks. 2015. [63] Chunpeng Wu, Wei Fan, Yuan He, Jun Sun, and Satoshi Naoi. Handwritten character recognition by alternately trained relaxation convolutional neural network. In 2014 14th International Conference on Frontiers in Handwriting Recognition, pages 291–296. IEEE, 2014. [64] Bolei Zhou, Aditya Khosla, Agata Lapedriza, Aude Oliva, and Antonio Torralba. Learning deep features for discriminative localization. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 2921–2929, 2016. [65] Ramprasaath R Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Batra. Grad-cam: Visual explanations from deep networks via gradientbased localization. In Proceedings of the IEEE international conference on computer vision, pages 618–626, 2017. [66] Matthew D Zeiler and Rob Fergus. Visualizing and understanding convolutional networks. In European conference on computer vision, pages 818–833. Springer, 2014. 72