scieee AI-readable full text Open interactive document viewer

Predicción de la temperatura crítica de superconductores mediante técnicas de Machine Learning. Redes neuronales y algoritmos genéticos

Herrero Álvarez, Javier

Abstract

[ES] En este trabajo se desarrolla un modelo de regresión para predecir la temperatura crítica de materiales superconductores a partir de su fórmula empírica, utilizando técnicas de Machine Learning (ML). Los superconductores son materiales que por debajo de una temperatura crítica tienen resistividad eléctrica nula. Los modelos basados en redes neuronales desarrollados se entrenan utilizando una base de datos con 21263 muestras de superconductores y 81 predictores, además de la temperatura crítica. En primer lugar, se reduce el número de predictores a 52 eliminando aquellos con coeficiente de correlación R > 0.9 respecto a otro predictor. A continuación, el uso de algoritmos genéticos para selección de los predictores de una red neuronal FFN permite reducir el número de predictores a 35, proporcionando intuición física sobre qué variables influyen en la temperatura crítica y cuáles no, además de simplificar el modelo. Finalmente, se utilizan algoritmos genéticos similares para optimizar los parámetros de la red neuronal FFN con 35 predictores, obteniéndose un modelo con indicadores de eficiencia promedio RMSE = 11.66 K (Root Mean Squared Error) y R^2 = 0.8849 (coeficiente de determinación).

Full text

Trabajo de Fin de Grado Grado en F´ısica Predicci´on de la temperatura cr´ıtica de superconductores mediante t´ecnicas de Machine Learning Redes neuronales y algoritmos gen´eticos Autor: Javier Herrero ´ Alvarez Director: Javier Echanobe Arias Leioa, 22 de junio de 2023 ´ Indice 1. Introducci´on y objetivos 3 2. Superconductividad y temperatura cr´ıtica 5 2.1. Teor´ıa BCS de la superconductividad: los pares de Cooper . . . . . . . . . 5 2.2. LasreglasdeMatthias ............................. 6 2.2.1. Reglas de Matthias para elementos at´omicos . . . . . . . . . . . . . 6 2.2.2. Reglas de Matthias para compuestos y aleaciones . . . . . . . . . . 7 3. T´ecnicas de Machine Learning 8 3.1. Aspectos fundamentales de las t´ecnicas ML . . . . . . . . . . . . . . . . . . 8 3.1.1. Clasificaci´on general de los modelos ML . . . . . . . . . . . . . . . 8 3.1.2. Datos de entrenamiento, validaci´on y test . . . . . . . . . . . . . . . 8 3.1.3. Indicadores para la eficiencia de los modelos de regresi´on . . . . . . 9 3.1.4. Generalizaci´on, overfitting yunderfitting de los modelos . . . . . . . 9 3.1.5. Hiperpar´ametros de un modelo . . . . . . . . . . . . . . . . . . . . 10 3.1.6. Normalizaci´on de los datos . . . . . . . . . . . . . . . . . . . . . . . 10 3.2. Redes neuronales FFN (feed-forward networks)................ 10 3.2.1. Redes neuronales de una capa: el perceptr´on . . . . . . . . . . . . . 11 3.2.2. Redes neuronales de varias capas . . . . . . . . . . . . . . . . . . . 12 3.2.3. La funci´on de activaci´on . . . . . . . . . . . . . . . . . . . . . . . . 13 3.2.4. Entrenamiento de la red: el algoritmo backpropagation ....... 14 3.3. Redes ELM (Extreme Learning Machine)................... 15 3.3.1. La inversa generalizada de Moore-Penrose . . . . . . . . . . . . . . 15 3.4. Algoritmos gen´eticos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 3.4.1. Introducci´on a los algoritmos gen´eticos . . . . . . . . . . . . . . . . 16 3.4.2. Selecci´on de caracter´ısticas con algoritmos gen´eticos . . . . . . . . . 18 3.4.3. Optimizaci´on de hiperpar´ametros con algoritmos gen´eticos . . . . . 19 4. Experimentos y resultados obtenidos 20 4.1. Descripci´on del dataset utilizado........................ 20 4.2. Selecci´on de caracter´ısticas con el coeficiente de correlaci´on . . . . . . . . . 21 4.3. Redes FFN con las 52 caracter´ısticas seleccionadas . . . . . . . . . . . . . . 22 4.4. Redes ELM con las 52 caracter´ısticas seleccionadas . . . . . . . . . . . . . 23 4.5. Selecci´on de caracter´ısticas con algoritmos gen´eticos (I) . . . . . . . . . . . 25 4.6. Redes FFN con 38 caracter´ısticas seleccionadas . . . . . . . . . . . . . . . 26 4.7. Selecci´on de caracter´ısticas con algoritmos gen´eticos (II) . . . . . . . . . . 27 4.8. Redes FFN con 35 caracter´ısticas seleccionadas . . . . . . . . . . . . . . . 28 4.9. Optimizaci´on de hiperpar´ametros con algoritmos gen´eticos . . . . . . . . . 28 4.10. Redes FFN optimizadas con 35 caracter´ısticas . . . . . . . . . . . . . . . . 31 4.11. Comparativa y discusi´on . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33 5. Conclusiones y l´ıneas futuras 34 Glosario 36 Referencias 38 1 A. Algunos conceptos de estad´ıstica 39 A.1. Varianza y desviaci´on est´andar . . . . . . . . . . . . . . . . . . . . . . . . 39 A.2. Covarianza y correlaci´on . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39 B. Desarrollo matem´atico del algoritmo backpropagation y el descenso del gradiente 41 C. Relaci´on entre el error cuadr´atico medio de una variable normalizada y sin normalizar 43 2 1. Introducci´on y objetivos El t´ermino Machine Learning (ML) hace referencia a un conjunto de t´ecnicas computacionales cuyo objetivo es que las m´aquinas aprendan a partir de la experiencia adquirida. Est´a englobado dentro de otro conjunto de t´ecnicas m´as amplio, denominado Inteligencia Artificial (IA). En sus inicios, la IA se centr´o en resolver problemas complicados para la mente humana pero sencillos para los computadores, es decir, c´alculos matem´aticos y algoritmos. Hoy en d´ıa, el reto est´a en la resoluci´on de problemas que son relativamente f´aciles e intuitivos para los humanos, pero que no son sencillos de formular en un contexto computacional [1]. Por ejemplo, cuando un humano pasea por la calle, es capaz de reconocer de inmediato si un objeto que est´a viendo es un coche, una persona, etc. Encontrar un algoritmo computacional (i.e. escribir el c´odigo de un programa de ordenador tradicional) para reconocimiento de objetos a partir de im´agenes, sin embargo, no es sencillo. La diferencia clave entre los humanos y las m´aquinas en este contexto es que los humanos, al contrario que las m´aquinas, adquieren conocimiento y poseen intuici´on [1]. ML es un enfoque de IA cuya filosof´ıa es que los computadores adquieran experiencia y conocimiento a partir de una gran cantidad de datos, al igual que hacen los seres humanos a lo largo de sus vidas. Una de las claves para obtener un buen modelo ML es escoger adecuadamente la representaci´on de los datos que se van a utilizar para entrenar (train) a la m´aquina, es decir, cu´antas caracter´ısticas (features o predictores) se le van a proporcionar y en qu´e formato [1], buscando evitar caracter´ısticas redundantes que aumenten la complejidad del modelo innecesariamente. Esto se conoce como selecci´on de caracter´ısticas (feature selection). En este trabajo, se aplican distintos modelos ML y t´ecnicas de selecci´on de caracter´ısticas al problema de la predicci´on de temperaturas cr´ıticas de superconductores. Los superconductores son materiales para los que a temperaturas menores que una temperatura cr´ıtica Tcla resistividad el´ectrica se hace cero. A la temperatura Tcse produce una transici´on de fase, pasando bruscamente de una resistividad no nula a una resistividad nula [2]. Este tipo de materiales, por tanto, permiten el flujo de corriente a trav´es de ellos sin disipaci´on de potencia por efecto Joule, lo cual resulta muy ´util en aplicaciones de electrotecnia. Sin embargo, a d´ıa de hoy el uso de los superconductores no est´a para nada extendido. Esto se debe fundamentalmente a dos motivos [3]: Las temperaturas cr´ıticas son, por lo general, extremadamente bajas. El mayor valor de Tcregistrado hasta Julio de 2017 es de unos 203 K (unos −70 ◦C) [3]. No existe un modelo te´orico que explique la dependencia funcional de la temperatura cr´ıtica Tc, lo cual dificulta la b´usqueda de posibles materiales superconductores a temperatura ambiente. Algunos investigadores han desarrollado modelos ML de regresi´on para predecir la temperatura cr´ıtica de superconductores. Por ejemplo, Kam Hamidieh obtiene un modelo con RMSE = 9.5 K (Root Mean Squared Error) y R2= 0.92 (coeficiente de determinaci´on) basado en una t´ecnica ML denominada XGBoost (conjunto de ´arboles propulsado por gradiente) [3]. Otros modelos de regresi´on propuestos en la literatura son el modelo random forest de Kaname Matsumoto y Tomoya Horide (con R2= 0.92) [4] o el modelo bagged trees de B. Roter y S.V. Dordevic (con RMSE = 8.91 K y R2= 0.93) [5]. Los tres modelos mencionados parten de la base de datos Supercon, del Instituto Nacional de Jap´on de Ciencia de Materiales, Japan’s National Institute for Materials Science (NIMS), y predicen la temperatura cr´ıtica partiendo de la f´ormula emp´ırica del material. 3 En este trabajo se desarrolla un modelo de regresi´on para predecir Tcpartiendo de los predictores extra´ıdos por Kam Hamidieh de la base de datos Supercon (relacionados con la f´ormula emp´ırica del material). Sin embargo, el enfoque seguido es distinto: el modelo que se desarrolla est´a basado en redes neuronales. El principal objetivo de este trabajo es encontrar un modelo ML que, a partir de la f´ormula emp´ırica de un material superconductor, prediga su temperatura cr´ıtica. Este modelo podr´ıa ser ´util para encontrar nuevos superconductores de alta temperatura. En esta l´ınea, se desarrollar´an distintos modelos ML, y se comparar´an sus resultados. En concreto, se utilizar´an modelos basados en redes neuronales FFN y redes ELM. Un segundo objetivo del trabajo es la ganancia de intuici´on f´ısica acerca de qu´e propiedades de los elementos at´omicos tienen mayor influencia sobre la temperatura cr´ıtica de los superconductores. Las t´ecnicas gen´eticas de selecci´on de caracter´ısticas utilizadas converger´an hacia modelos con un n´umero reducido de predictores, proporcionando la mencionada intuici´on f´ısica, as´ı como una menor complejidad del modelo. Cabe destacar que los algoritmos gen´eticos tambi´en se utilizan en este trabajo para optimizar los hiperpar´ametros de los modelos de regresi´on utilizados. Como ´ultimo objetivo, de car´acter m´as amplio, se pretende ilustrar c´omo se pueden aplicar los distintos algoritmos ML en la resoluci´on de problemas de f´ısica y demostrar su potencia para la resoluci´on de problemas que con m´etodos anal´ıticos o num´ericos tradicionales requerir´ıan de una cantidad excesiva de recursos y tiempo. El trabajo comienza con una descripci´on cualitativa del fen´omeno de la superconductividad en la secci´on 2, en base al modelo BCS y las reglas de Matthias. En la secci´on 3 se presentan las t´ecnicas ML utilizadas para el desarrollo del trabajo. Tras explicar los aspectos fundamentales del Machine Learning, se explican las t´ecnicas basadas en redes neuronales FFN, redes ELM y algoritmos gen´eticos. La secci´on 4 recoge los experimentos realizados a lo largo del trabajo utilizando las herramientas ML presentadas en la secci´on previa, as´ı como los resultados obtenidos y un an´alisis de los mismos. El modelo que se obtiene finalmente es una red neuronal FFN con 35 predictores, reduciendo los 81 que hab´ıa inicialmente en el dataset en un 56.79 %. Los indicadores de eficiencia promedio obtenidos, RMSE = 11.66 K y R2= 0.8849, no llegan a superar a los de los modelos de referencia presentados en esta introducci´on. Sin embargo, la reducci´on del n´umero de predictores conseguida proporciona intuici´on f´ısica sobre qu´e variables influyen sobre la temperatura cr´ıtica, adem´as de que el modelo FFN desarrollado tiene una estructura computacional m´as sencilla que los utilizados en los otros trabajos mencionados (basados en ´arboles de decisi´on). Finalmente, en la secci´on 5 se presentan las conclusiones extra´ıdas de los experimentos realizados. Tambi´en se mencionan posibles l´ıneas futuras de investigaci´on en el ´ambito de este trabajo. Se incluyen tambi´en tres ap´endices en los que se realizan desarrollos matem´aticos que, si bien no son necesarios para una lectura de esta memoria, pueden resultar interesantes como profundizaci´on. El ap´endice A contiene una introducci´on a algunos conceptos b´asicos de estad´ıstica, el ap´endice B contiene el desarrollo matem´atico de los algoritmos backpropagation y descenso del gradiente y el ap´endice C la relaci´on entre el MSE de una variable normalizada y de dicha variable sin normalizar. Adem´as, se proporciona un glosario de siglas y t´erminos en ingl´es para facilitar una consulta r´apida en caso necesario. 4 2. Superconductividad y temperatura cr´ıtica Los superconductores son materiales que, por debajo de una temperatura cr´ıtica Tc, experimentan una transici´on a una fase de resistividad el´ectrica nula. Tradicionalmente, se han dividido en dos grandes grupos: los superconductores de tipo I tienen una transici´on brusca a la fase superconductora a la temperatura cr´ıtica, mientras que los de tipo II presentan una transici´on gradual. Estos segundos siguen presentando propiedades superconductoras a temperaturas m´as altas, es por ello que los de tipo I tambi´en se denominan de baja temperatura y los de tipo II de alta temperatura [2]. Es importante mencionar que los materiales superconductores presentan propiedades (como el efecto Meissner) que no pueden explicarse model´andolos como un material conductor cuya resistividad tiende a cero [2]. Esto sugiere que es necesario el desarrollo de una teor´ıa de la superconductividad independiente a la conductividad. La teor´ıa de la superconductividad de Bardeen-Cooper-Schrieffer (BCS) ha sido uno de los intentos m´as relevantes por encontrar una teor´ıa de la superconductividad. Por otra parte, las dificultades mencionadas en la secci´on 1 para el desarrollo de un modelo te´orico para los superconductores han motivado la b´usqueda de reglas emp´ıricas que recogen las condiciones para la superconductividad y las variables que afectan sobre la temperatura cr´ıtica. Un ejemplo son las reglas de Matthias que, aunque no son rigurosas ni se cumplen siempre, proporcionan intuici´on sobre las propiedades que influyen sobre Tc. En la secci´on 2.1 se realiza una breve introducci´on cualitativa a la teor´ıa BCS. En la secci´on 2.2 se presentan las reglas de Matthias para tratar de ganar intuici´on sobre qu´e propiedades influyen sobre la superconductividad. 2.1. Teor´ıa BCS de la superconductividad: los pares de Cooper La teor´ıa BCS explica el fen´omeno de la superconductividad para superconductores de tipo I. La idea principal que hay detr´as de esta teor´ıa es que, si existe un estado en el que la resistencia es cero, ha de existir un bandgap entre dicho estado y el estado conductor normal [6]. En un conductor normal, con resistencia el´ectrica finita, los electrones chocan con los iones de la red y, consecuentemente, pierden energ´ıa [7] (efecto Joule). En un superconductor, tambi´en hay un movimiento de portadores a trav´es de la red, y la ´unica posibilidad para que no haya una interacci´on con los iones de la red (con su consecuente p´erdida de energ´ıa) es que no haya ning´un nivel energ´etico disponible en el rango de las energ´ıas de interacci´on con la red. Adem´as, como a temperaturas mayores que Tcs´ı que hay disipaci´on por efecto Joule, el intervalo energ´etico de niveles prohibidos deber´a ser del orden de la energ´ıa t´ermica kBTc, siendo kBla constante de Boltzmann [6]. Por otra parte, es un resultado bien conocido de la mec´anica estad´ıstica que en un sistema de fermiones el n´umero de ocupaci´on de los niveles decrece monot´onicamente como una funci´on escal´on no del todo vertical (estad´ıstica de Fermi-Dirac). Adem´as, seg´un el principio de exclusi´on de Pauli, no es posible que haya dos fermiones en un mismo estado cu´antico. Como un electr´on individual es un fermi´on (tiene esp´ın semientero), los electrones quedan descartados como posibles portadores en un superconductor, ya que el principio de exclusi´on impide que est´en todos ellos en el estado superconductor. As´ı, los portadores han de ser bosones [6]. La teor´ıa BCS propone como portadores del estado superconductor pares de electrones de esp´ın opuesto que quedan emparejados entre s´ı debido a una fuerza atractiva que es capaz de vencer la repulsi´on de Coulomb, conocidos como pares de Cooper. Estos pares tienen, en efecto, naturaleza bos´onica, ya que 5 su esp´ın resultante es entero por estar formados por dos part´ıculas de esp´ın semientero [6]. Es precisamente la naturaleza bos´onica de los pares de Cooper la que permite que a temperaturas bajas (menores que Tc) todos los portadores de carga formen un condensado de Bose-Einstein en el estado superconductor que se forma por debajo del intervalo prohibido. En la figura 2.1 se muestra un esquema del estado superconductor y el bandgap para ilustrar la explicaci´on de los dos p´arrafos anteriores. El esquema mostrado es v´alido solamente para T < Tc, esto es, en la fase superconductora. Figura 2.1: Esquema del estado superconductor y el bandgap que se forma entre ´este y el estado conductor normal del material. Para terminar con esta breve descripci´on de la teor´ıa BCS, falta describir la naturaleza de la interacci´on atractiva entre los electrones: En superconductores de tipo I, la fuerza atractiva se debe al intercambio de fonones (cuantos de vibraci´on de la red) entre los dos electrones del par [7]. En superconductores de tipo II, no est´a tan clara la naturaleza de la interacci´on, pero una posibilidad es que se deba a un apantallamiento de la interacci´on repulsiva de Coulomb. La presencia de un electr´on en una red provoca una deformaci´on de la estructura cristalina, atrayendo los iones positivos cercanos hacia ´el. Esta densidad de carga positiva neta creada en torno a un electr´on apantalla su carga negativa, permitiendo que los dos electrones que forman el par experimenten una fuerza atractiva [7]. 2.2. Las reglas de Matthias Las reglas de Matthias son un conjunto de observaciones emp´ıricas que tratan de recoger las condiciones para que un material sea superconductor y la dependencia funcional de Tc[8]. Son m´as bien una serie de pautas para facilitar la b´usqueda de nuevos superconductores que unas reglas universales. A pesar de sus evidentes y muy grandes limitaciones, estas reglas dan pistas de qu´e propiedades de los elementos at´omicos y de las estructuras cristalinas influyen en la superconductividad, y pueden utilizarse para decidir qu´e variables incluir como predictores en los modelos de Machine Learning que se desarrollar´an. 2.2.1. Reglas de Matthias para elementos at´omicos Los experimentos con superconductores dan lugar a las siguientes reglas, aunque no siempre se cumplen [8]: 1. Los elementos superconductores tienen un n´umero de electrones de valencia por ´atomo ncomprendido entre 2 y 8. 6 2. En general, los elementos ferromagn´eticos, antiferromagn´eticos, no met´alicos, semimet´alicos o semiconductores no son superconductores. 3. La temperatura cr´ıtica es proporcional a una funci´on T(n) del n´umero de electrones de valencia por ´atomo. 4. La temperatura cr´ıtica es proporcional a la siguiente funci´on del volumen at´omico Vy la masa at´omica M:Tc∝Vx M, siendo 4 <x<5. 5. Existen ciertas estructuras cristalinas que son m´as propensas a la superconductividad. De cara a este trabajo, lo m´as interesante de estas reglas emp´ıricas es que la existencia de una fase superconductora para un elemento y, en caso afirmativo, su temperatura cr´ıtica, dependen de la estructura electr´onica del elemento, de sus par´ametros de escala (masa y volumen) y de su estructura cristalina. Otro apunte interesante es que la funci´on T(n) tiene m´aximos locales para nimpar y m´ınimos para npar en el caso de los metales de transici´on, mientras que es creciente en el caso del resto de metales. Esta dependencia funcional sugiere que, adem´as de la interacci´on mediada por fonones propuesta en la teor´ıa BCS, posiblemente haya involucrado un t´ermino de interacci´on esp´ın-esp´ın [8]. 2.2.2. Reglas de Matthias para compuestos y aleaciones Las reglas de Matthias para compuestos y aleaciones son similares a las at´omicas, con las siguientes modificaciones [8]: 1. nse refiere ahora al n´umero de electrones de valencia por ´atomo en la aleaci´on o compuesto. 2. Id´entica al caso at´omico, excepto algunos ferromagn´eticos de esp´ın de orbitales f. 3. Id´entica al caso at´omico, pero el patr´on de picos est´a desplazado para cada material. 4. En este caso, Tc∝Vx. 5. Similar al caso at´omico. El hecho de que estas reglas sean similares al caso at´omico sugiere que un modelo de predicci´on de Tcbasado en la f´ormula emp´ırica sea viable. 7 Sigmoide en (neuronas de las capas ocultas, ‘logsig’ en MATLAB): f(a) = 1 a+ exp (−a)(3.8) Tiene tres propiedades que la hacen interesante como funci´on de activaci´on: su salida est´a acotada al intervalo (0,1), su gradiente es m´aximo en valores pr´oximos a cero y satura para valores alejados del cero. Una combinaci´on lineal de un n´umero suficiente de unidades sigmoides en una ´unica capa puede aproximar cualquier funci´on [10]. Tangente hiperb´olica (neuronas de las capas ocultas, ‘tansig’ en MATLAB): f(a) = ea−e−a ea+e−a(3.9) Es similar a la sigmoide, salvo un reescalado horizontal y que su salida est´a acotada a (−1,1). ReLU o Rectified Linear Unit (neuronas de las capas ocultas, ‘poslin’ en MATLAB): f(a) = 0a < 0 a a ≥0(3.10) Esta funci´on facilita y acelera el proceso de entrenamiento en redes multicapa. 3.2.4. Entrenamiento de la red: el algoritmo backpropagation El entrenamiento de una red comienza asignando valores aleatorios a sus pesos y bias. El proceso de entrenamiento subsiguiente es iterativo, y tiene como objetivo minimizar una funci´on error, como el MSE, mediante la modificaci´on de los pesos y bias de la red. El principal problema es que, si la red produce una salida incorrecta, no hay manera a priori de saber qu´e neuronas son las culpables ni c´omo se han de modificar sus par´ametros [12]. La soluci´on a este problema viene dada por el algoritmo backpropagation. Si la funci´on error es derivable con respecto a las salidas y las funciones de activaci´on utilizadas son derivables, entonces la funci´on error es derivable con respecto a los pesos (y los bias). Conociendo las derivadas del error con respecto a los pesos, es posible utilizar t´ecnicas de optimizaci´on como el descenso del gradiente para actualizar el valor de los pesos [12]. As´ı, el entrenamiento de una red es un proceso iterativo en el que cada iteraci´on consta de dos partes: 1. Se calculan las derivadas de la funci´on error con respecto a los pesos (y bias) [12]. Se comienza calculando las salidas de la red para los datos de entrenamiento (forwardpropagation) y, con ellas, el MSE con respecto a los valores objetivo. A continuaci´on, se utiliza el algoritmo backpropagation para propagar el error desde la salida hacia las neuronas internas de la red, por medio de la regla de la cadena de las derivadas. 2. Se utilizan las derivadas calculadas en la fase anterior para actualizar los pesos de manera que se reduzca el error. Para esta fase, hay una gran cantidad de algoritmos de optimizaci´on. Uno de los m´as utilizados es el “descenso del gradiente” [12]. Para actualizar los pesos, existen dos posibilidades. La primera, denominada on-line learning consiste en actualizar los pesos tras el c´alculo de las derivadas para una entrada de los datos de entrenamiento. Se denomina iteraci´on a la actualizaci´on realizada para cada entrada individual de los datos de entrenamiento, y epoch al conjunto de actualizaciones asociadas a una exposici´on completa a todos los datos de entrenamiento. La segunda posibilidad es utilizar batch learning, que consiste en actualizar los pesos tras sumar las 14 derivadas para cada una de las entradas de todos los datos de entrenamiento. En este caso, una ´unica actualizaci´on de los pesos ya constituir´a una epoch. En el ap´endice B se desarrollan en detalle las matem´aticas de backpropagation y del descenso del gradiente. 3.3. Redes ELM (Extreme Learning Machine) Las redes ELM (Extreme Learning Machine, M´aquina de Aprendizaje Extremo) son un tipo de FFN de una ´unica capa oculta. Este enfoque consiste en generar aleatoriamente los pesos de las neuronas ocultas y calcular los de la capa de salida imponiendo que las salidas de la red para todos los datos de entrenamiento coincidan con su target [13]. La topolog´ıa de la red consiste en una capa de entrada de nneuronas, una capa oculta de mneuronas con funci´on de activaci´on no lineal f(sigmoide, por ejemplo) y una neurona de salida (en nuestro caso) con activaci´on lineal (unitaria). Los pesos de cada neurona de la capa oculta se recogen en las filas de la matriz Wy los de la neurona de salida en el vector fila β. Los bias de la capa oculta constituyen el vector columna  b. Las salidas de la ´unica capa oculta se representan con el vector columna  h. As´ı, las ecuaciones de la red son:  h=fWx + b ˆy=β h (3.11) Para entrenar una red ELM, se comienza asignando valores aleatorios a los pesos Wy bias  bde la capa oculta. Con dichos valores, se calculan las salidas  h(i)de la capa oculta para cada dato idel subconjunto de datos de entrenamiento (Ndatos en total). Con los vectores columna obtenidos para cada dato, se forma una matriz H=h h(1)  h(2) ...  h(N)i. Por otra parte, se forma una matriz fila T=y(1) y(2) ... y(N)con los targets y(i)de los datos de entrenamiento. A continuaci´on, se exige que las salidas de la red para los datos de entrenamiento sean los targets, es decir, que: βH =T(3.12) Para ello, los pesos de la capa de salida βhan de tomar los siguientes valores [13]: β=TH†(3.13) donde H†es la inversa generalizada de Moore-Penrose (secci´on 3.3.1) de la matriz H[13]1. La principal ventaja de las redes ELM es la rapidez de su entrenamiento. En lugar de un entrenamiento iterativo, como en las redes FFN, basta con realizar un c´alculo matricial. 3.3.1. La inversa generalizada de Moore-Penrose Las matrices no cuadradas, como H, no tienen una operaci´on de inversi´on H−1bien definida. Existe, sin embargo, una matriz H†llamada pseudoinversa o inversa generalizada de Moore-Penrose que puede utilizarse como aproximaci´on de una hipot´etica H−1[1]. Un m´etodo para obtener la pseudoinversa se basa en la descomposici´on en valores singulares (SVD), seg´un la cual una matriz Hde tama˜no m×nse descompone como [1]: 1N´otese que, para mantener la coherencia con el resto del trabajo, la notaci´on utilizada es ligeramente distinta a la habitual en redes ELM (las matrices est´an traspuestas con respecto a la notaci´on habitual). 15 H=UDV T(3.14) Ues una matriz m×mortogonal, y sus columnas se llaman vectores singulares de salida de H. Dichos vectores se calculan como los vectores propios de HHT. Des una matriz m×nque s´olo tiene elementos no nulos en su diagonal, denominados valores singulares de H. Los valores singulares de Hson las ra´ıces cuadradas de los valores propios de HHToHTH. Ves una matriz n×nortogonal, y sus columnas se llaman vectores singulares de entrada de H. Dichos vectores se calculan como los vectores propios de HTH. Teniendo en cuenta SVD, la pseudoinversa puede calcularse de forma directa a partir de la generalizaci´on de la propiedad (ABC)−1=C−1B−1A−1de la inversi´on de matrices. Aplicando esta propiedad a la ecuaci´on 3.14: H†=UDV T†=VT−1D†U−1=V D†UT(3.15) donde la pseudoinversa D†de la matriz diagonal Dse calcula invirtiendo sus elementos no nulos y trasponiendo el resultado [1]. En la ´ultima igualdad se ha tenido en cuenta que las matrices UyVson ortogonales, es decir, que U−1=UTyV−1=VT. La justificaci´on de que H†es una aproximaci´on de una hipot´etica H−1se basa en que si la matriz Htiene mayor n´umero de columnas que de filas, la ecuaci´on matricial Hx =y tiene m´ultiples soluciones, siendo x =H†y la de menor norma eucl´ıdea ||x||. Si Htiene mayor n´umero de filas que de columnas, la ecuaci´on matricial no siempre tiene soluci´on, pero x =H†y es el vector que minimiza la norma eucl´ıdea ||Hx −y|| [1]. Se verifican resultados an´alogos considerando que x yy son vectores fila y la ecuaci´on matricial xH =y, intercambiando las palabras filas por columnas (y viceversa). 3.4. Algoritmos gen´eticos En esta secci´on se realiza una introducci´on a los algoritmos gen´eticos (secci´on 3.4.1). A continuaci´on, se explica c´omo este conjunto de t´ecnicas ML puede aplicarse a la selecci´on de caracter´ısticas (secci´on 3.4.2) y a la optimizaci´on de hiperpar´ametros (secci´on 3.4.3). 3.4.1. Introducci´on a los algoritmos gen´eticos Los algoritmos gen´eticos son un conjunto de t´ecnicas ML de optimizaci´on inspiradas en la teor´ıa de la evoluci´on de Darwin y en la gen´etica molecular. En este trabajo, se utilizan indistintamente los t´erminos algoritmo gen´etico y evolutivo, aunque este ´ultimo hace normalmente referencia a un conjunto m´as amplio de algoritmos. Seg´un los principios de la gen´etica molecular, un determinado ser vivo est´a caracterizado por su genotipo (su conjunto de genes), que codifica su fenotipo (el conjunto de caracter´ısticas f´ısicas observables a nivel macrosc´opico). Cada gen puede tomar diferentes valores o alelos y, en funci´on de ellos el ser vivo en cuesti´on tendr´a un fenotipo u otro. Seg´un la teor´ıa de la evoluci´on de Darwin, si se considera una poblaci´on de individuos distintos en un entorno concreto, hay algunos con un fenotipo m´as favorable para la supervivencia y reproducci´on, y otros con mayores dificultades para sobrevivir y reproducirse. A medida que transcurre el tiempo, la poblaci´on evoluciona hacia genotipos que codifican fenotipos m´as aptos para el entorno considerado. Esto es lo que se conoce como selecci´on natural: los individuos “m´as adaptados” sobreviven y se reproducen, transmitiendo su genotipo a la generaci´on siguiente, mientras que los “menos adaptados” mueren y su genotipo se va perdiendo [14]. 16 Inspirados en esta analog´ıa biol´ogica, surgen los algoritmos evolutivos. En el caso en el que el fenotipo se codifica en forma de genes, estos algoritmos se conocen tambi´en como algoritmos gen´eticos. En este trabajo, los individuos a optimizar son redes neuronales, y la funci´on objetivo a minimizar es el MSE para los datos de test. Con respecto a los genes (que no son m´as que los par´ametros del modelo neuronal que el algoritmo evolutivo toma como variables independientes en el proceso de optimizaci´on), se consideran dos casos: Algoritmos de selecci´on de caracter´ısticas: los genes son binarios. Para cada variable del dataset, un 1 indica su inclusi´on como predictor en el modelo de regresi´on, mientras que un 0 indica su exclusi´on. El objetivo del algoritmo es encontrar un modelo que incluya como predictores el subconjunto de variables que minimice MSEtest. Algoritmos de optimizaci´on de hiperpar´ametros: los genes son n´umeros enteros o reales, o bien variables categ´oricas (en este trabajo s´olo se consideran genes enteros). Cada gen es un hiperpar´ametro (secci´on 3.1.5) del modelo de regresi´on cuyo MSEtest se desea minimizar. N´otese que el m´ınimo encontrado por un algoritmo evolutivo no tiene por qu´e ser un m´ınimo global, pero puede ser suficientemente bueno para la aplicaci´on considerada [14]. Funcionamiento de un algoritmo gen´etico Los algoritmos gen´eticos se basan en dos pilares: la variaci´on de los genotipos y la selecci´on de individuos seg´un la funci´on objetivo. En primer lugar, se inicializa una poblaci´on de modelos ML con valores aleatorios para sus genes, y se eval´ua la eficiencia de cada uno (MSEtest). A continuaci´on, comienza el siguiente proceso iterativo [14], en el que la k-´esima iteraci´on constituye una poblaci´on de individuos llamada k-´esima generaci´on: 1. Selecci´on de los padres de futuros individuos en base a su eficiencia. 2. Recombinaci´on de los genes de los padres para dar lugar a individuos hijos. 3. Mutaci´on con cierta probabilidad de los hijos resultantes del paso anterior. 4. Evaluaci´on de los nuevos candidatos en base a su eficiencia. 5. Selecci´on de los individuos que formar´an parte de la siguiente generaci´on. Componentes de un algoritmo gen´etico Los componentes fundamentales de un algoritmo gen´etico son [14]: Representaci´on o codificaci´on de los genes (binarios, enteros, reales, etc.). Funci´on objetivo (por ejemplo, MSEtest a minimizar). Poblaci´on: conjunto de individuos en una generaci´on. Mecanismo de selecci´on de los progenitores, los correspondientes operadores se aplican a nivel de poblaci´on. Este mecanismo proporciona una mayor probabilidad de reproducirse a los individuos con mejor valor de la funci´on objetivo. Operadores de mutaci´on: operan sobre un individuo resultante del cruce de dos progenitores (hijo). Es un operador que, de forma aleatoria y con una peque˜na probabilidad, modifica el valor de algunos de los genes del hijo. Operadores de recombinaci´on o cruce: operan sobre dos individuos, los progenitores, para dar uno o m´as descendientes. El operador, que puede ser aleatorio o determinista, selecciona qu´e genes de cada progenitor tendr´an los hijos. Cruzando dos individuos con buen valor de la funci´on objetivo es esperable obtener eventualmente alg´un descendiente que mejore dicho valor. 17 Mecanismo de selecci´on de supervivientes: opera a nivel de poblaci´on. Se aplica una vez generados los descendientes de una generaci´on para decidir qu´e individuos pasar´an a formar parte de la siguiente generaci´on. Existen distintas estrategias, algunas de ellas son deterministas (se cogen los individuos con mejor valor de la funci´on objetivo) y otras tienen alg´un componente aleatorio. Algunas estrategias tambi´en dan mayor peso a los individuos m´as j´ovenes. En la parte izquierda de la figura 3.4 se muestra un posible operador de cruce para un genotipo binario. Las l´ıneas rojas (pivotes) dividen el genotipo en diferentes regiones, y el hijo contiene en cada regi´on la copia del genotipo de uno de sus progenitores de manera alterna. En la parte derecha se puede ver un posible operador de mutaci´on para genotipo binario. De manera aleatoria (seg´un una tasa de mutaci´on), algunos de los genes del hijo (marcados en rojo) cambian su valor. Existen otros tipos de operadores de variaci´on. Para informaci´on m´as detallada puede consultarse el libro de Eiben y Smith [14]. Figura 3.4: Ejemplo de operadores de variaci´on para una representaci´on binaria. Izquierda: operador de cruce de dos pivotes. Derecha: operador de mutaci´on. En teor´ıa, si el operador mutaci´on utilizado permite que partiendo de un genotipo dado se pueda obtener cualquier otro (por muy peque˜na que sea la probabilidad), entonces el algoritmo evolutivo en cuesti´on es capaz de encontrar el ´optimo global de la funci´on objetivo si se deja correr suficiente tiempo [14]. 3.4.2. Selecci´on de caracter´ısticas con algoritmos gen´eticos Los algoritmos gen´eticos para selecci´on de caracter´ısticas tienen como fin encontrar el subconjunto de predictores del dataset que da lugar al modelo ML de regresi´on con menor error de test. As´ı, cada individuo es un modelo de regresi´on, y la funci´on objetivo a optimizar es MSEtest (o el promedio de MSEtest para unos pocos entrenamientos del modelo). El genotipo del modelo consiste en qu´e predictores incorpora y cu´ales no. La representaci´on utilizada es binaria: se utiliza un vector cuya longitud coincide con el n´umero de predictores en el dataset. Cada elemento del vector (gen) corresponde a un predictor del dataset. El valor 1 indica que dicho predictor se incluye como variable de entrada en el modelo de regresi´on, mientras que el valor 0 indica que no se incluye. Los operadores de cruce y de mutaci´on son similares a los que se muestran en la figura 3.4, aunque existen otras posibilidades [14]. Tras crear una serie de individuos de partida aleatorios y esperar unas cuantas generaciones, la distribuci´on de genotipos que exhiba la poblaci´on evolucionada indicar´a qu´e variables de predicci´on son m´as importantes para el problema de regresi´on que se desea resolver. De esta manera, los algoritmos gen´eticos proporcionan no s´olo una mejora en el modelo de regresi´on ML, sino que tambi´en aportan intuici´on f´ısica sobre el problema que resuelve el modelo. 18 3.4.3. Optimizaci´on de hiperpar´ametros con algoritmos gen´eticos En este caso, los individuos son un modelo de regresi´on (o el promedio de varios) y la funci´on a optimizar sigue siendo un indicador de eficiencia (como el error). Las variables del algoritmo gen´etico son los hiperpar´ametros del modelo. Para una red FFN hay algunos hiperpar´ametros enteros (como el n´umero de neuronas en cada capa oculta), otros categ´oricos (como la funci´on de activaci´on de cada capa) y otros reales (como el learning rate). En este trabajo, a las variables categ´oricas y reales a optimizar se les asocia una variable entera para simplificar el algoritmo y reducir su tiempo de ejecuci´on: A cada una de las ncategor´ıas de una variable categ´orica se le asigna un entero entre 1 y n. En el caso de las variables reales se escogen nposibles valores reales para la variable, y a cada uno se le asigna un entero entre 1 y n. El algoritmo gen´etico de optimizaci´on de hiperpar´ametros tiene un funcionamiento similar al que se ha explicado en la secci´on 3.4.1, con la salvedad de que los operadores de cruce y mutaci´on ahora act´uan sobre genes enteros (en lugar de binarios). Los operadores de mutaci´on para genes enteros mutan cada gen de manera independiente seg´un una tasa de mutaci´on (probabilidad p), y se subdividen en dos grupos [14]: Mutaci´on aleatoria: para cada gen, en base a una probabilidad p, se escoge un nuevo valor de manera aleatoria de entre todos los posibles valores del gen. Este operador es adecuado para variables enteras que representan categor´ıas. Mutaci´on creep: consiste en sumar una peque˜na cantidad (positiva o negativa) a cada gen con una probabilidad p. Los valores a sumar se escogen aleatoriamente de una distribuci´on centrada en cero, por ejemplo, una distribuci´on binomial. Este tipo de operadores es adecuado para genes que son enteros per se. Respecto a los operadores de recombinaci´on, lo normal suele ser utilizar el mismo tipo de operadores que para las representaciones de genes binarias, por ejemplo, el operador basado en pivotes mostrado en la parte izquierda de la figura 3.4 [14]. 19 4. Experimentos y resultados obtenidos En esta secci´on se aplican las t´ecnicas explicadas en la secci´on 3 al desarrollo de un modelo de regresi´on para predecir la temperatura cr´ıtica de un superconductor (Tc) partiendo de su f´ormula emp´ırica. En la secci´on 4.1 se presenta el dataset utilizado y los 81 predictores del modelo. En la secci´on 4.2 se realiza una selecci´on de predictores en base al coeficiente de correlaci´on. En las secciones 4.3 y 4.4 se entrenan, respectivamente, modelos FFN y ELM con los 52 predictores seleccionados. Se descarta utilizar ELM en base a los resultados obtenidos. En las secciones 4.5 y 4.7 se realiza una selecci´on de caracter´ısticas con algoritmos gen´eticos utilizando FFN como modelo de regresi´on (dos ejecuciones consecutivas del algoritmo de selecci´on). Las redes FFN con el n´umero de predictores resultante tras la selecci´on (38 y 35, respectivamente) se analizan en las secciones 4.6 y 4.8, respectivamente. A continuaci´on, se realiza una optimizaci´on de los hiperpar´ametros del modelo FFN con 35 predictores utilizando, para ello un algoritmo gen´etico (secci´on 4.9). La red FFN resultante se estudia en la secci´on 4.10. Finalmente, en la secci´on 4.11 se realiza una recapitulaci´on de los distintos modelos entrenados a lo largo de la secci´on 4 y se realiza una comparativa entre sus eficiencias. 4.1. Descripci´on del dataset utilizado El dataset utilizado para el desarrollo de los modelos ML para la predicci´on de Tcfue creado por Kam Hamidieh siguiendo los pasos descritos en la referencia [3]. Est´a basado en la base de datos “Superconducting Material Database” mantenida por el Instituto Nacional Japon´es de Ciencia de Materiales (NIMS). El dataset contiene 21263 entradas o muestras correspondientes a distintos superconductores. Para cada entrada, hay 81 variables o predictores (cada una en una columna) relacionadas con la f´ormula emp´ırica del superconductor. La ´ultima columna contiene las temperaturas cr´ıticas Tc(en Kelvin), que son los targets de los modelos desarrollados. El fichero con los datos se llama train.csv. La primera columna contiene el n´umero total de elementos (distintos) en el superconductor. Las otras 80 columnas corresponden a caracter´ısticas extra´ıdas a partir de las siguientes 8 propiedades de los elementos at´omicos: masa at´omica (atomic mass), primera energ´ıa de ionizaci´on (fie), radio at´omico (atomic radius), densidad (density), afinidad electr´onica (electron affinity), calor de fusi´on (fusion heat), conductividad t´ermica (thermal conductivity) y valencia (valence). N´otese que el autor se ha inspirado en las reglas de Matthias (secci´on 2.2) para escoger estas propiedades [3]. Para cada una de las 8 propiedades de los elementos, se calculan 10 predictores considerando la f´ormula emp´ırica del superconductor (las 80 columnas restantes). Dichos predictores son: media (mean), media ponderada (wtd mean), media geom´etrica (gmean), media geom´etrica ponderada (wtd gmean), entrop´ıa (entropy), entrop´ıa ponderada (wtd entropy), rango (range), rango ponderado (wtd range), desviaci´on est´andar (std) y desviaci´on est´andar ponderada (wtd std). Las expresiones para el c´alculo de los predictores y un ejemplo pueden verse con detalle en el art´ıculo de Kam Hamidieh [3]. Se decide eliminar cuatro entradas con Tca m´as de 3 desviaciones t´ıpicas de la distribuci´on de temperaturas cr´ıticas (outliers): H2S1(185 K), Hg0.66Pb0.34Ba2Ca1.98Cu2.9O8.4 (143 K), Hg0.7Pb0.3Ba2Ca2Cu3O8(143 K) y Tl0.8Hg0.2Ba2Ca2Cu3O9(137.4 K). As´ı, el dataset resultante tiene 21259 superconductores. En la figura 4.1 se muestra el histograma de Tcde los superconductores del dataset. Como es de esperar, la mayor parte de da20 tos corresponden a Tcpr´oximos al cero absoluto. La proporci´on de superconductores con Tc>95 K es peque˜na. El valor medio es de 34.3991 K y la desviaci´on t´ıpica de 34.2184 K. Figura 4.1: Histograma de temperaturas cr´ıticas de los superconductores del dataset. Finalmente, cada una de las 81 caracter´ısticas y los targets se normalizan utilizando zscores (ecuaci´on 3.2). Se ha comprobado que este tipo de normalizaci´on da mejores resultados que el escalado al rango [0,1] (ecuaci´on 3.3) mediante pruebas preliminares con unas pocas redes FFN. A partir de ahora se utiliza este tipo de normalizaci´on. 4.2. Selecci´on de caracter´ısticas con el coeficiente de correlaci´on Una vez preparado el dataset, se utiliza el coeficiente de correlaci´on (ap´endice A.2) para reducir el n´umero de predictores. La matriz de correlaci´on para las 81 variables es de tama˜no 81 ×81. En lugar de trabajar con dicha matriz, se buscan correlaciones en las submatrices 10 ×10 correspondientes a los 10 predictores asociados a cada propiedad at´omica. Como criterio para descartar una de dos variables entre ayb, se utiliza Rab ≥0.9. Tabla 4.1: Submatriz de correlaciones para los predictores relacionados con la masa at´omica . En la tabla 4.1 se muestra la submatriz de correlaciones para las variables relacionadas con la masa at´omica. Se muestran en verde los coeficientes R≥0.90, en amarillo 0.85 ≤ R < 0.9 y en azul 0.80 ≤R < 0.85. Como ejemplo, se explica el proceso de eliminaci´on de caracter´ısticas redundantes para esta submatriz. Utilizando el criterio R≥0.9: mean atomic mass est´a correlacionado con gmean atomic mass. wtd mean atomic mass con wtd gmean atomic mass. range atomic mass con std atomic mass y con wtd std atomic mass. 21 std atomic mass con wtd std atomic mass. As´ı, de las 10 variables relacionadas con la masa at´omica se seleccionan 6 eliminando redundancias por correlaci´on: mean atomic mass,wtd mean atomic mass,entropy atomic mass,wtd entropy atomic mass,wtd range atomic mass ywtd std atomic mass. Tabla 4.2: Variables seleccionadas (marcadas con “X”) en base a los coeficientes de correlaci´on. mean wtd mean gmean wtd gmean entropy wtd entropy range wtd range std wtd std atomic mass X X X X X X fie X X X X X X atomic radius X X X X X X density X X X X X X electron affinity X X X X X X X X X fusion heat X X X X X X thermal conductivity X X X X X X X X valence X X X X En la tabla 4.2 se muestran las variables seleccionadas de la manera explicada en los p´arrafos anteriores. A estas variables hay que a˜nadir el n´umero de elementos. En total, se han seleccionado 52 caracter´ısticas de las 81 que se hab´ıan extra´ıdo inicialmente. 4.3. Redes FFN con las 52 caracter´ısticas seleccionadas Una vez seleccionados los 52 predictores mencionados, se ha procedido al entrenamiento de redes FFN (objeto “feedforwardnet” del “Deep Learning Toolbox” de MATLAB). Se ha optado por utilizar en un inicio los par´ametros mostrados en la tabla 4.3, escogidos tras realizar pruebas preliminares. Para m´as informaci´on sobre estos u otros par´ametros de la red cons´ultese la documentaci´on de los objetos “feedforwardnet” de MATLAB [15]. Tabla 4.3: Par´ametros utilizados para el entrenamiento de las redes FFN. Par´ametro Valor Descripci´on hidden [18 10] N´umero de neuronas en cada capa oculta. trainFcn ‘trainscg’ Entrenamiento con backpropagation de gradiente conjugado escalado. performFcn ‘mse’ Error cuadr´atico medio como funci´on error. trainParam.lr 0.3 Learning rate, tasa de aprendizaje. trainParam.max fail 300 M´aximo n´umero de epochs durante el que contin´ua el entrenamiento si no disminuye MSEval. trainParam.min grad 1e-10 M´ınimo gradiente para que contin´ue el proceso de entrenamiento. trainParam.epochs 10000 N´umero m´aximo de epochs en el entrenamiento. Para acelerar el proceso de entrenamiento de las redes, se utiliza de ahora en adelante el valor ‘true’ para la opci´on ‘UseParallel’, que habilita la paralelizaci´on del entrenamiento entre los distintos n´ucleos de la CPU (Central Processing Unit) de la computadora utilizada. En los casos en los que se ha utilizado un ordenador que dispone de GPU (Graphics Processing Unit) tambi´en se ha usado el valor ‘true’ para la opci´on ‘UseGPU’. Para evaluar la eficiencia de las redes con estos par´ametros y las 52 caracter´ısticas, se han entrenado 20 redes con distintas divisiones de datos y distintos valores iniciales de los pesos, con el fin de evitar el sesgo. En la tabla 4.4 se muestran los valores medios de algunos indicadores de su eficiencia para los datos de entrenamiento, validaci´on y test: error cuadr´atico medio para los targets normalizados (MSEnorm), ra´ız del error cuadr´atico medio en Kelvin (RMSE (K), v´ease ap´endice C), coeficiente de correlaci´on Ry coeficiente 22 de determinaci´on R2. Evidentemente, los menores errores y mayores valores de R2se obtienen para los datos de entrenamiento. Los indicadores que realmente miden la eficiencia son los correspondientes a los datos de test. Para los datos de test, los valores promedio obtenidos son RMSE = 12.56 K y R2= 0.8651. Todav´ıa hay margen de mejora hasta el umbral R2≥0.9 habitualmente considerado satisfactorio. Tabla 4.4: Valores medios de algunos indicadores de eficiencia de entrenamiento, validaci´on y test para 20 redes FFN con 52 predictores y los par´ametros de la tabla 4.3. Entrenamiento Validaci´on Test Mejor Peor Medio Mejor Peor Medio Mejor Peor Medio MSEnorm 0.0913 0.1274 0.1075 0.1172 0.1489 0.1319 0.1212 0.1567 0.1348 RMSE (K) 10.34 12.21 11.22 11.71 13.20 12.43 11.91 13.55 12.56 R0.9535 0.9336 0.9448 0.9394 0.9217 0.9319 0.9381 0.9188 0.9301 R20.9092 0.8716 0.8926 0.8825 0.8495 0.8684 0.8800 0.8442 0.8651 En la figura 4.2 se muestra el error a lo largo del proceso de entrenamiento de una de las 20 redes entrenadas para los datos de entrenamiento, validaci´on y test. La l´ınea discontinua representa la epoch con el menor error de validaci´on, que se utiliza para monitorizar el comienzo del overfitting. Tras 300 epochs de paciencia se detiene el entrenamiento. Figura 4.2: MSEtrain, MSEval y MSEtest (para los targets normalizados) frente al n´umero de epochs para una de las redes con 52 predictores y los par´ametros de la tabla 4.3 En la figura 4.3 se muestran las gr´aficas de regresi´on (salida del modelo frente a valor real) con los targets normalizados para la misma red que en la figura 4.2. Si el modelo de regresi´on fuera perfecto, se observar´ıan todos los puntos sobre la diagonal se˜nalada con puntos discontinuos en las gr´aficas. Se observa que, en general, este modelo tiende a predecir menores valores de Tcque los reales para los materiales con mayor Tc. 4.4. Redes ELM con las 52 caracter´ısticas seleccionadas Con vistas a reducir el tiempo de ejecuci´on de los algoritmos evolutivos que se presentan m´as adelante, se prueba a entrenar redes ELM, ya que su tiempo de entrenamiento es considerablemente menor al de las redes FFN. Se realizan pruebas con entre 1 y 1000 neuronas en la ´unica capa oculta, utilizando los 52 predictores seleccionados. N´otese que, como el entrenamiento de las redes ELM es un c´alculo matricial, sin necesidad de realizar 23 Tabla 4.14: Opciones utilizadas para el algoritmo gen´etico de optimizaci´on de hiperpar´ametros. Opci´on Valor Descripci´on ‘PopulationType’ Por defecto Codificaci´on del genotipo de los individuos. Por defecto, los genes son reales salvo aquellos que se especifiquen en intcon como enteros. ‘PopulationSize’ Por defecto m´ın (m´ax (10 ·nvars, 40),100) = 60 Figura 4.9: Valor medio y menor valor de MSEtest para cada generaci´on del algoritmo gen´etico. la funci´on de activaci´on de la primera capa oculta o el porcentaje de training data, est´an pr´acticamente homogeneizados para toda la poblaci´on, hay otros con mayor variabilidad. En la tabla 4.15 se muestran los valores (o rangos de valores) de los hiperpar´ametros para el mayor sector de los gr´aficos y para el mejor individuo (menor MSEtest) de la generaci´on 34. Con respecto a las redes FFN de secciones anteriores, las redes optimizadas: Tabla 4.15: Valores de los hiperpar´ametros para el mayor sector del gr´afico de sectores y para el mejor individuo (menor MSEtest) de la generaci´on 34. Hiperpar´ametro Mayor Sector Mejor Individuo a) N´umero de neuronas 1acapa oculta [350,400) 422 b) N´umero de neuronas 2acapa oculta [30,60) 36 c) Funci´on de activaci´on 1acapa oculta ‘poslin’ ‘poslin’ d) Funci´on de activaci´on 2acapa oculta ‘logsig’ ‘logsig’ e) learning rate 0.1 0.01 f) Porcentaje de training data 70 % 70 % Tienen un n´umero de neuronas mayor que las anteriores (hidden = [18,10]). Utilizan una primera capa oculta con funci´on de activaci´on ‘poslin’ ( ReLU) en lugar de ‘logsig’ (sigmoide). El learning rate utilizado es el mismo que en redes anteriores, 0.1, en el caso del mayor sector, y menor, 0.01, en el caso del mejor individuo. Respecto al porcentaje de training data, cuantos m´as datos se utilicen para entrenar el modelo mejor ser´a ´este, luego no sorpende que un 97 % de los individuos utilicen el mayor valor considerado, 70 %. Sin embargo, se seguir´a utilizando un valor de 60 % por consistencia en la comparaci´on con otros modelos desarrollados en el trabajo. El tiempo de entrenamiento de las redes optimizadas es mayor (unos 10 min frente a 3 min en las no optimizadas), por su mayor n´umero de neuronas. 30 Figura 4.10: Diagramas de sectores de los genotipos de los 70 individuos de la generaci´on 34. 4.10. Redes FFN optimizadas con 35 caracter´ısticas Una vez realizada la optimizaci´on de hiperpar´ametros, se entrenan redes FFN considerando los par´ametros optimizados de la tabla 4.15. Para cada conjunto de par´ametros, se entrenan 20 redes y se toma el promedio de sus MSEtest como indicador de su eficiencia. En ambos casos, se utiliza un 60 % de training data, por los motivos expuestos en la secci´on 4.9. Se fija, tambi´en, trainFcn =‘trainscg’,performFcn =‘mse’,trainParam.max fail = 31 300, trainParam.min grad = 1e-10, trainParam.epochs = 10000. En la tabla 4.16 se muestran los valores de los hiperpar´ametros optimizados para la mejor red obtenida, y en la tabla 4.17 sus indicadores de eficiencia de entrenamiento, validaci´on y test. Todos ellos mejoran con respecto a antes de la optimizaci´on de hiperpar´ametros. Es conveniente destacar algunos de estos indicadores: Tabla 4.16: Valores de los hiperpar´ametros optimizados para la mejor red obtenida. N´umero de neuronas 1acapa oculta 400 N´umero de neuronas 2acapa oculta 36 Funci´on de activaci´on 1acapa oculta ‘poslin’ Funci´on de activaci´on 2acapa oculta ‘logsig’ learning rate 0.01 Porcentaje de training data 60 % Tabla 4.17: Valores medios de algunos indicadores de eficiencia de entrenamiento, validaci´on y test para 20 redes FFN con 35 predictores y los par´ametros de la tabla 4.16. Entrenamiento Validaci´on Test Mejor Peor Medio Mejor Peor Medio Mejor Peor Medio MSEnorm 0.0628 0.0817 0.0714 0.1075 0.1338 0.1167 0.1042 0.1291 0.1161 RMSE (K) 8.58 9.78 9.14 11.22 12.52 11.69 11.05 12.29 11.66 R0.9683 0.9581 0.9637 0.9464 0.9298 0.9399 0.9464 0.9338 0.9407 R20.9376 0.9180 0.9287 0.8957 0.8645 0.8834 0.8957 0.8720 0.8849 Para la red con 35 predictores sin optimizar, los promedios para los datos de entrenamiento son RMSE = 10.64 K y R2= 0.9033. Tras la optimizaci´on, se obtiene RMSE = 9.14 K y R2= 0.9287. Esta mejor´ıa indica que el aumento de la complejidad del modelo (mayor n´umero de neuronas) mejora la eficiencia de entrenamiento. Es decir, que el modelo inicial es demasiado simple para el problema. La red con 35 predictores sin optimizar tiene promedios de test de RMSE = 12.21 K yR2= 0.8733. Tras la optimizaci´on, se obtiene RMSE = 11.66 K y R2= 0.8849. El aumento en la complejidad del modelo realizado no disminuye su capacidad de generalizaci´on, sino que la aumenta. El uso de funciones ReLU en la primera capa oculta mejora la eficiencia. En la figura 4.11 se muestran las gr´aficas de regresi´on (salida predicha frente a valor real) con Tcnormalizada para una de las redes optimizadas. En comparaci´on con las obtenidas en el primer modelo FFN (figura 4.3), hay muchos menos puntos alejados de la bisectriz del primer cuadrante, luego la mejor´ıa conseguida ha sido significativa. Figura 4.11: Gr´aficas de regresi´on con los datos normalizados para una de las redes optimizadas. 32 4.11. Comparativa y discusi´on En la tabla 4.18 se muestra una comparativa de la eficiencia (promedio de 20 redes) de las distintas redes entrenadas en este trabajo, indicando la secci´on de la memoria correspondiente a dicha red. Adem´as, se indican como filas enteras los algoritmos de selecci´on de caracter´ısticas y optimizaci´on de hiperpar´ametros ejecutados, de modo que la tabla sigue un orden cronol´ogico de arriba hacia abajo. Tabla 4.18: Comparativa del promedio (20 redes) del RMSE y de R2de test para las distintas redes. Secci´on RMSEtest (K) R2 test Selecci´on de caracter´ısticas en base al coeficiente de correlaci´on (secci´on 4.2) FFN con 52 caracter´ısticas 4.3 12.56 0.8651 ELM con 52 caracter´ısticas 4.4 14.35 0.8245 Selecci´on de caracter´ısticas con algoritmos gen´eticos (I) (secci´on 4.5) FFN con 38 caracter´ısticas 4.6 12.36 0.8699 Selecci´on de caracter´ısticas con algoritmos gen´eticos (II) (secci´on 4.7) FFN con 35 caracter´ısticas 4.8 12.21 0.8733 Optimizaci´on de hiperpar´ametros con algoritmos gen´eticos (secci´on 4.9) FFN optimizada con 35 caracter´ısticas 4.10 11.66 0.8849 Las primeras redes entrenadas, tanto FFN como ELM, tienen 52 predictores, seleccionados en base al coeficiente de correlaci´on. Se observa que ELM arroja un RMSE casi 2 K mayor que FFN y un R20.04 puntos menor. La primera ejecuci´on del algoritmo gen´etico de selecci´on con redes FFN reduce los predictores a 38. Tambi´en mejoran los par´ametros de eficiencia de test: RMSE disminuye en 0.2 K, y R2aumenta unos 0.004 puntos. La segunda ejecuci´on del algoritmo reduce los predictores a 35, adem´as de disminuir RMSE en 0.15 K y aumentar R2en 0.0034 puntos. Finalmente, la optimizaci´on de hiperpar´ametros reduce RMSEtest otros 0.55 K y aumenta R2 test otros 0.0116 puntos. Se observa, as´ı, que el mayor aumento de la eficiencia se da con la optimizaci´on de hiperpar´ametros. A´un as´ı, no se llega al umbral R2≥0.9. Con respecto a la selecci´on de caracter´ısticas, finalmente se han seleccionado 35 predictores, los 34 de la tabla 4.10 junto al n´umero de elementos distintos en el superconductor. Los predictores seleccionados proporcionan intuici´on f´ısica sobre qu´e variables afectan a Tc y sugieren que aquellas propiedades at´omicas para las que se incorporan como predictores: La media aritm´etica o la media aritm´etica pesada (masa at´omica, primera energ´ıa de ionizaci´on, radio at´omico, densidad, conductividad t´ermica) influyen en Tcmediante una relaci´on lineal. La media geom´etrica pesada (afinidad electr´onica y valencia) entran en la f´ormula de Tccomo una ra´ız n-´esima. La entrop´ıa o la entrop´ıa ponderada (todas) aparecen en la expresi´on de Tccomo sumas de logaritmos. El rango ponderado (primera energ´ıa de ionizaci´on, radio at´omico, afinidad electr´onica) entran en la funci´on Tccomo restas ponderadas de los valores extremos. La desviaci´on t´ıpica o la desviaci´on t´ıpica ponderada (masa at´omica, primera energ´ıa de ionizaci´on, radio at´omico, afinidad electr´onica, conductividad t´ermica y valencia) entran en la f´ormula de Tccomo ra´ıces cuadradas de sumas de t´erminos cuadr´aticos. En base a esto, se confirma que la hipot´etica funci´on matem´atica para Tces bastante compleja. Es por ello que los modelos ML resultan de utilidad en contextos como ´este, con una soluci´on anal´ıtica compleja. 33 5. Conclusiones y l´ıneas futuras En este trabajo se ha desarrollado un modelo ML para la predicci´on de la temperatura cr´ıtica de materiales superconductores partiendo de su f´ormula emp´ırica. Se han utilizado dos tipos de modelos ML de regresi´on, las redes FFN y ELM. Estas ´ultimas se han descartado debido a su baja eficiencia. Adem´as de los modelos de regresi´on, se ha utilizado otro conjunto de t´ecnicas ML, los algoritmos gen´eticos, para reducir el n´umero de predictores en el modelo de regresi´on y optimizar sus hiperpar´ametros. Para desarrollar el modelo de regresi´on, se ha utilizado un dataset realizado por Kam Hamidieh [3]. Dicho dataset contiene 21263 muestras (de las que se han eliminado 4 outliers), cada una con 81 predictores extra´ıdos a partir de la f´ormula emp´ırica de los superconductores y las temperaturas cr´ıticas correspondientes, obtenidas de la base de datos Supercon. Antes de comenzar a entrenar los modelos ML, se ha reducido el n´umero de predictores a 52 eliminando aquellos con coeficiente de correlaci´on R > 0.9 con respecto a alg´un otro predictor. Tras entrenar varias redes FFN con 52 predictores, se ha reducido el n´umero de predictores a 35 por medio del uso de algoritmos gen´eticos para selecci´on de caracter´ısticas. Como resultado de dicha selecci´on de caracter´ısticas se ha obtenido no s´olo un modelo m´as simple sino tambi´en una mayor eficiencia, pues dicho modelo con menor n´umero de predictores tiene mayor capacidad de generalizaci´on que el modelo inicial con 52 predictores. Adem´as, la selecci´on de caracter´ısticas ha servido tambi´en para ganar intuici´on f´ısica acerca de qu´e variables de las consideradas como predictores entrar´ıan y c´omo en una hipot´etica f´ormula anal´ıtica para la temperatura cr´ıtica. Se ha confirmado, de esta forma, la esperable complejidad de esta f´ormula que sigue sin encontrarse a pesar de los esfuerzos realizados por la comunidad cient´ıfica. Finalmente, se han utilizado algoritmos gen´eticos similares a los utilizados para la selecci´on de caracter´ısticas para optimizar los hiperpar´ametros del modelo de regresi´on FFN con 35 predictores. El algoritmo de optimizaci´on ha puesto de manifiesto que el n´umero de neuronas necesario es mayor que el considerado inicialmente y que resulta beneficioso para este problema utilizar una funci´on de activaci´on ReLU, en lugar de la sigmoide, en la primera capa oculta. Este modelo optimizado con 35 predictores tiene unos indicadores de eficiencia promedio para los datos de test de RMSE = 11.66 K y R2= 0.8849. Estos indicadores no llegan a superar a los obtenidos con los modelos basados en XGBoost, random forest obagged trees mencionados en la introducci´on, aunque hay que tener en cuenta que el modelo FFN es computacionalmente m´as sencillo que ´estos. A pesar de no haber superado el umbral R2>0.9 y de haber otros trabajos que obtienen mejores indicadores de eficiencia, el modelo desarrollado resulta de inter´es porque ha conseguido reducir el n´umero de predictores en un 56.79 %, proporcionando la intuici´on f´ısica ya mencionada. Adem´as, se ha ilustrado c´omo los algoritmos gen´eticos para selecci´on de caracter´ısticas y optimizaci´on de hiperpar´ametros pueden resultar ´utiles como modelos auxiliares a la hora de desarrollar un modelo de regresi´on, con resultados satisfactorios. Gracias a estos algoritmos, es posible explorar un espacio de posibilidades mucho mayor que el que ser´ıa viable explorar de manera manual o iterativa (probando una por una todas las posibilidades). Se ha comprobado, por otra parte, que las redes neuronales son tambi´en una potente herramienta para tratar de aproximar funciones desconocidas (por su complejidad u otros motivos), como la funci´on para la temperatura cr´ıtica. Este trabajo es un ejemplo de c´omo las redes neuronales y los algoritmos gen´eticos, entre otras t´ecnicas ML, pueden resultar de utilidad como herramienta adicional a las herramientas anal´ıticas 34 y num´ericas en la resoluci´on de problemas f´ısicos complejos. A nivel acad´emico personal, este trabajo me ha servido para sumergirme en el mundo del ML y de la IA, que se est´a desarrollando a una velocidad cada vez m´as vertiginosa. Con los modelos desarrollados he aprendido c´omo se pueden utilizar las redes neuronales (y otros modelos de regresi´on) junto con los algoritmos gen´eticos para resolver problemas de f´ısica, y que no s´olo se trata de una mera caja negra que predice un resultado, sino que tambi´en se puede ganar intuici´on que pueda servir de ayuda en el desarrollo de una teor´ıa anal´ıtica. Adem´as, este trabajo me ha supuesto una oportunidad para aprender sobre el fen´omeno de la superconductividad, de gran inter´es en campos como el almacenamiento y transporte de la energ´ıa o la creaci´on de campos magn´eticos fuertes que tan en auge est´an actualmente. Para dar fin a esta secci´on, se proponen una serie de l´ıneas de trabajo futuras que podr´ıan ser interesantes para continuar con el estudio realizado en este TFG: Desarrollar un modelo ML para predecir la temperatura cr´ıtica de superconductores que incluya como predictores par´ametros relacionados con la estructura cristalina (que, seg´un las reglas de Matthias, en la secci´on 2.2, influye en la superconductividad). Desarrollar un modelo de clasificaci´on que prediga si un material es superconductor o no (el modelo desarrollado predice Tcconsiderando que la f´ormula emp´ırica proporcionada corresponde a un superconductor). Utilizar t´ecnicas de Programaci´on Gen´etica para tratar de encontrar una funci´on anal´ıtica para la temperatura cr´ıtica en funci´on de los predictores utilizados en el modelo de regresi´on. Estas t´ecnicas van construyendo funciones en base a unas variables de entrada y un conjunto de operadores, y dichas funciones van evolucionando seg´un un algoritmo gen´etico hacia una que minimice el error. Desarrollar un modelo que sepa extraer las caracter´ısticas a partir de la f´ormula emp´ırica y los datos de los elementos at´omicos, para no perder informaci´on al realizar la extracci´on de manera manual. El principal esfuerzo estar´ıa en encontrar una representaci´on de los datos que permitiera, adem´as de la f´ormula emp´ırica, proporcionar al modelo la multitud de par´ametros at´omicos necesarios para la extracci´on de caracter´ısticas. B´usqueda de modelos basados en l´ogica difusa (en t´erminos de conjuntos borrosos, definidos por reglas imprecisas) para ganar intuici´on sobre qu´e caracter´ısticas influyen m´as sobre la temperatura cr´ıtica. Considerando que a d´ıa de hoy los ´unicos superconductores de alta temperatura que se han encontrado requieren tambi´en de condiciones de alta presi´on, desarrollar modelos que tambi´en recojan la influencia de la presi´on. Est´a claro que el reto de la superconductividad a temperatura ambiente tiene todav´ıa mucho camino que recorrer. Para terminar de aclarar qu´e variables influyen sobre la temperatura cr´ıtica y sobre si un material es superconductor o no, es necesario un equipo multidisciplinar de expertos en f´ısica de materiales y expertos en aplicaci´on de t´ecnicas num´ericas y t´ecnicas ML a problemas de f´ısica. 35 Glosario backpropagation Algoritmo para propagar el error de una red multicapa desde la salida hacia las capas internas. bandgap Intervalo prohibido de energ´ıas comprendido entre dos niveles o bandas permitidos. batch learning Actualizaci´on de los pesos considerando el error total para todos los datos de entrenamiento. BCS Teor´ıa de la superconductividad de Bardeen-Cooper-Schrieffer. bias T´ermino constante que se suma a una combinaci´on lineal. classification Clasificaci´on, referido a un algoritmo. cluster Cada uno de los grupos de un algoritmo de clustering. clustering Agrupaci´on, referido a un algoritmo. CPU Central Processing Unit, Unidad de Procesamiento Central. dataset Base de datos. ELM Extreme Learning Machine, es un tipo de NN de una capa oculta. epoch Conjunto de tantas actualizaciones sucesivas de pesos como datos de entrenamiento, una para cada dato. feature selection Selecci´on de caracter´ısticas. features Caracter´ısticas o variables de una entrada de una base de datos. FFN Feed-Forward Network, red neuronal en la que la informaci´on fluye solamente en la direcci´on de entrada a salida. forward-propagation Propagaci´on de un dato desde la entrada de la red hacia la salida.. generalization Generalizaci´on, capacidad de un modelo de lograr buenos resultados con datos no vistos durante el entrenamiento. genetic algorithm Algoritmo gen´etico. GPU Graphics Processing Unit, Unidad de Procesamiento de Gr´aficos. hidden Oculta, hace referencia a una etapa interna de un modelo ML. hyperparameters Hiperpar´ametros de un modelo ML. IA Inteligencia Artificial. layer Capa de una red neuronal. learning rate Tasa de aprendizaje de un modelo ML. ML Machine Learning, se traduce como Aprendizaje Autom´atico. MSE Mean Squared Error, Error Cuadr´atico Medio. multilayer De varias capas, referido a una red neuronal. NN Neural Network, Red Neuronal. on-line learning Actualizaci´on de los pesos considerando cada dato de entrenamiento individualmente. outlier Dato de un conjunto estad´ıstico muy alejado del resto. overfitting Cuando un modelo se ajusta tanto a los datos de entrenamiento que no generaliza a datos nuevos. 36 regression Regresi´on, referido a un algoritmo. ReLU Rectified Linear Unit, un tipo de funci´on de activaci´on. RMSE Root Mean Squared Error, Ra´ız del Error Cuadr´atico Medio. supervised Supervisado, referido a un algoritmo. SVD Singular Value Descomposition, Descomposici´on en Valores Singulares. target Objetivo, valor deseado de la salida en un algoritmo ML. task Tarea o problema que resuelve un algoritmo ML. test data Subdivisi´on de los datos para test o prueba. train Entrenar un modelo ML. training data Subdivisi´on de los datos para entrenamiento. underfitting Cuando un modelo es tan sencillo que no se ajusta adecuadamente a los datos de entrenamiento. unsupervised No supervisado, referido a un algoritmo. validation data Subdivisi´on de los datos para validaci´on. zscore T´ecnica de normalizaci´on basada en restar la media y dividir entre la desviaci´on t´ıpica. 37 Referencias [1] I. Goodfellow, Y. Bengio, and A. Courville, Deep learning. Cambridge (EE. UU.): MIT Press, 2016. [2] C. Kittel, Introduction to Solid State Physics, 8th ed. New York: John Wiley and Sons, 2005. [3] K. Hamidieh, “A data-driven statistical model for predicting the critical temperature of a superconductor,” Computational Materials Science, no. 154, 2018. [4] K. Matsumoto and T. Horide, “An acceleration search method of higher Tc superconductors by a machine learning algorithm,” Applied Physics Express, vol. 12, no. 7, p. 073003, jun 2019. [Online]. Available: https://dx.doi.org/10.7567/ 1882-0786/ab2922 [5] B. Roter and S. V. Dordevic, “Predicting new superconductors and their critical temperatures using machine learning,” Physica C: Superconductivity and its Applications, vol. 575, p. 1353689, 2020, iD: 271531. [Online]. Available: https://www.sciencedirect.com/science/article/pii/S0921453420301374 [6] “BCS theory of superconductivity lecture notes for engineering physics,” 2016. [Online]. Available: https://semesters.in/ bardeen-cooper-schriffer-bcs-theory-qualitative-notes-for-engineering-physics-btech/ [7] A. A. Shah and T. Bhatnagar, “Superconductors - “resistance is futile”,” in 5th IEEE Integrated STEM Conference, 2015. [8] N. Ghazikhanian, “The Matthias Rules,” Tech. Rep., December 2017. [9] L. Marvin, Neural Networks with MATLAB, 2016. [10] C. C. Aggarwall, Neural networks and deep learning : a textbook. Cham, Switzerland: Springer, 2018. [11] A. Zell, Simulation Neuronaler Netze, 1st ed. Addison-Wesley, 1994. [12] C. M. Bishop, Neural Networks for Pattern Recognition. New York: Oxford University Press, 1995. [13] L. L. C. Kasun, H. Zhou, G.-B. Huang, and C. M. Vong, “Extreme learning machines,” IEEE Intelligent Systems, pp. 31–34, November/December 2013. [14] A. E. Eiben and J. E. Smith, Introduction to Evolutionary Computing, 2nd ed. Berlin: Springer, 2015. [15] “Reference page for feedforwardnet,” ´ Ultimo acceso: 17/03/2023. [Online]. Available: https://es.mathworks.com/help/deeplearning/ref/feedforwardnet.html?lang=en [16] “Reference page for ga,” ´ Ultimo acceso: 10/04/2023. [Online]. Available: https://es.mathworks.com/help/gads/ga.html#d124e50955 [17] “How can I save every generation’s best position using ga?” ´ Ultimo acceso: 10/04/2023. [Online]. Available: https://es.mathworks.com/matlabcentral/answers/ 123459-how-can-i-save-every-generation-s-best-position-using-ga [18] K. F. Riley, M. P. Hobson, and S. J. Bence, Mathematical Methods for Physics and Engineering, 3rd ed. Cambridge University Press, 2006. 38 A. Algunos conceptos de estad´ıstica A continuaci´on se explican algunos conceptos b´asicos de estad´ıstica, con el fin de llegar a definir el coeficiente de correlaci´on de Pearson. Este indicador se utiliza tanto para selecci´on de caracter´ısticas (secci´on 3.4.2) como para evaluaci´on de los modelos de regresi´on (secci´on 3.1.3). A lo largo de la explicaci´on, se consideran dos variables ayb(o caracter´ısticas) con valores {ai}N i=1 y{bi}N i=1, donde Nes el n´umero de datos en el dataset o en alguna de sus subdivisiones, dependiendo del contexto. A.1. Varianza y desviaci´on est´andar La varianza s2y la desviaci´on est´andar σ=s=√s2son medidas de la dispersi´on de los Nvalores {ai}de una variable adel dataset. La desviaci´on t´ıpica es la ra´ız de la varianza, y esta ´ultima se define como [18]: s2=1 N N X i=1 (ai−a)2=a2−a2(A.1) donde aes la media de los valores en la muestra y a2la media de los cuadrados de los valores. A.2. Covarianza y correlaci´on La covarianza y correlaci´on son dos indicadores que caracterizan la relaci´on entre dos variables aybdel dataset. La covarianza se define como [18]: σab =1 N N X i=1 (ai−a)bi−b=ab −ab (A.2) donde la barra sobre las variables significa valor medio. Una propiedad de la covarianza es que dos variables independientes en sentido estad´ıstico tienen covarianza nula. El rec´ıproco, sin embargo, no es cierto. Resulta m´as ´util en el contexto de este trabajo el coeficiente de correlaci´on de Pearson, definido de la siguiente manera [18]: Rab =σab σaσb (A.3) donde σab es la covarianza entre las variables ayb,σala desviaci´on est´andar de ayσb la desviaci´on est´andar de b. Se puede demostrar que Rab siempre est´a comprendido entre −1 y 1 [18]. Por lo tanto, la correlaci´on no es m´as que un escalado de la covarianza. El coeficiente Rab tiene las siguientes propiedades [18]: Dos variables totalmente independientes tienen Rab = 0. Dos variables relacionadas linealmente entre s´ı tienen Rab = 1 si la pendiente de la relaci´on es positiva y Rab =−1 si la pendiente es negativa. Estas dos propiedades justifican el uso de Rcomo medida de la eficiencia (secci´on 3.1.3) de un modelo de regresi´on: cuanto m´as pr´oximo a la unidad sea el valor de Rˆyy, mayor ser´a la eficiencia del modelo. Se suele utilizar tambi´en el cuadrado de este coeficiente, R2, denominado coeficiente de determinaci´on. Para que un modelo de regresi´on se considere bueno, se utiliza el criterio R2>0.90, que es equivalente a R > 0.95. 39