Full text
Traballo Fin de Grao Una medida de influencia en la clasificación a través de la teoría de juegos cooperativos Roi Gómez Salvador 2020/2021 UNIVERSIDADE DE SANTIAGO DE COMPOSTELA
GRAO DE MATEMÁTICAS Traballo Fin de Grao Una medida de influencia en la clasificación a través de la teoría de juegos cooperativos Roi Gómez Salvador UNIVERSIDADE DE SANTIAGO DE COMPOSTELA
Trabajo propuesto Área de Coñecemento: Estadística e Investigación Operativa. Título: Una medida de influencia en la clasificación a través de la teoría de juegos cooperativos. Breve descripción do contido En este trabajo se pretende revisar la referencia [1]. En ella se parte de que si un conjunto de datos ha sido analizado por medio de un clasificador binario [2], se plantea la cuestión de cuáles fueron los factores más importantes para determinar el resultado de la clasificación. Para dar respuesta, en [1] se emplea un enfoque axiomático para caracterizar de forma única una medida de influencia: una función que, dado un conjunto de individuos clasificados, genera un valor para cada característica correspondiente a su influencia en la determinación del resultado de la clasificación. Además se estudia la relación de la medida de influencia con el valor de Banzhaf de la teoría de juegos cooperativos clásica [3]. Para finalizar el trabajo, se ilustrará la medida de influencia a través de ejemplos y conjuntos de datos. Bibliografía [1] Datta, A., Datta, A., Procaccia, A. D., and Zick, Y. (2015), “Influence in classification via cooperative game theory.” Twenty-Fourth International Joint Conference on Artificial Intelligence, 511–517. [2] Hastie, T., Tibshirani, R., and Friedman, J. (2008), The Elements of Statistical Learning. Springer Series in Statistics. [3] Sánchez Rodríguez, E. and Vidal Puga, J. (2014), Juegos Coalicionales. Universidade de Vigo. Servizo de Publicacións, ed. iii
Índice general Resumen VII Introducción IX 1. Teoría de juegos cooperativos 1 2. El problema de clasificación 7 2.1. Dos aproximaciones sencillas a la predicción . . . . . . . . . . . . . . . . . . 7 2.1.1. Modeloslineales ............................. 7 2.1.2. Modelos de vecinos más cercanos . . . . . . . . . . . . . . . . . . . . 9 2.2. Modelos lineales para clasificación . . . . . . . . . . . . . . . . . . . . . . . 9 2.3. Análisisclúster .................................. 10 2.4. Validacióncruzada................................ 11 2.5. Métodos basados en árboles . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 2.5.1. Árboles de regresión . . . . . . . . . . . . . . . . . . . . . . . . . . . 12 2.5.2. Árboles de clasificación . . . . . . . . . . . . . . . . . . . . . . . . . 13 2.5.3. Ejemplo spam ............................... 14 3. Influencia en la clasificación 17 3.1. Caracterización axiomática . . . . . . . . . . . . . . . . . . . . . . . . . . . 18 3.1.1. Ejemplo1................................. 24 3.1.2. Ejemplo2................................. 26 3.2. Influencia en clasificadores lineales . . . . . . . . . . . . . . . . . . . . . . . 28 3.3. Extensiones de la medida de influencia de las características . . . . . . . . . 29 3.3.1. Influencia de los estados . . . . . . . . . . . . . . . . . . . . . . . . . 29 3.3.2. Influencia de los pesos . . . . . . . . . . . . . . . . . . . . . . . . . . 30 3.3.3. Medida de distancia general . . . . . . . . . . . . . . . . . . . . . . . 30 4. Ejemplo COVID-19 31 v
vi ÍNDICE GENERAL 5. Conclusiones 37 A. Programación con R39 A.1. Preparación de los datos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39 A.2.Medidadeinfluencia............................... 40
Resumen Partiendo de un conjunto de datos que han sido clasificados en dos clases, queremos saber cuáles han sido los factores más importantes para determinar la clase que les ha sido asignada. Para ello se usará una aproximación axiomática con la finalidad de definir una medida de influencia única. Esta medida será una función que, a partir de un conjunto de datos clasificados, devolverá un valor para cada característica correspondiente a la influencia que ha tenido a la hora de determinar la clasificación. Primero se comenzará con una breve introducción a los juegos cooperativos con utilidad transferible, ya que axiomatizar una medida de influencia y una solución de teoría de juegos tienen características comunes, y varios modelos de clasificación. Después de definir la medida de influencia, se muestra que tiene una forma intuitiva cuando el clasificador es lineal. Y por último, aplicamos la medida en un conjunto de datos relacionados con pacientes afectados por el COVID-19 dependiendo de si han tenido algún incidente o no. Abstract Starting from a collection of data that have been classified into two classes, we want to know which factors have been the most important in determining the classification outcome. For this purpose, an axiomatic approach will be used in order to define a unique measure of influence. This measure will be a function that, given a set of classified data, outputs a value for each feature corresponding to its influence in determining the classification outcome. We will first begin with a brief introduction to cooperative games with transferable utility, since axiomatizing an influence measure and a game theory solution have common aspects, and several classification models. After defining the influence measure, we show that it has an intuitive form when the classifier is linear. Finally, we apply the measure on a dataset related to patients affected by COVID-19 depending on whether they have had any incident or not. vii
4CAPÍTULO 1. TEORÍA DE JUEGOS COOPERATIVOS Un valor fsatisface la propiedad de jugador nulo si, para todo v∈GNy para todo i∈Njugador nulo de v, se tiene que fi(v)=0. Un valor fsatisface la simetría si, para todo v∈GNy para todo par de jugadores i, j ∈Nsimétricos en v, se tiene que fi(v) = fj(v). Un valor fsatisface aditividad si, para todo par de juegos v, w ∈GN,f(v+w) = f(v) + f(w). Un valor fsatisface poder total si, para todo v∈GNse tiene que: n X i=1 fi(v) = 1 2n−1 n X i=1 X S⊂N\{i} |v(S∪i)−v(S)|. Es fácil ver que la eficiencia indica que fdebe repartir v(N)entre todos los jugadores. La propiedad de jugador nulo quiere decir que los jugadores que no generan beneficios no deben recibir nada. La simetría significa que debemos tratar por igual a jugadores que aportan lo mismo. La aditividad es básicamente un requerimiento técnico que, aunque no está conectado con la idea de ecuanimidad, tampoco parece ir en contra de tal idea. La propiedad de poder total establece que el pago total obtenido por los jugadores es la suma de las medias de las contribuciones marginales de todos los jugadores. Por lo tanto, si un valor es eficiente no puede satisfacer la propiedad de poder total. A continuación, definimos el valor de Shapley y enunciamos un teorema que prueba que las cuatro primeras propiedades caracterizan el valor de Shapley. Definición 1.7. El valor de Shapley está dado por: φi(v) = X S⊂N\{i} s!(n−s−1)! n!(v(S∪ {i})−v(S)), para todo v∈GNy todo i∈N, donde syndenotan los cardinales de SyN, respectivamente. Teorema 1.8. Existe un único valor en GNque verifica las propiedades de eficiencia, jugador nulo, simetría y aditividad. Este valor es el valor de Shapley. Definición 1.9. El valor de Banzhaf de un jugador i∈Nestá dado por: βi(v) = 1 2n−1X S⊂N\{i} (v(S∪ {i})−v(S)), para todo v∈GNy todo i∈N.
5 Teorema 1.10. Existe un único valor en GNque verifica las propiedades de jugador nulo, simetría, aditividad y poder total. Este valor es el valor de Banzhaf. Este valor tiene una interpretación simple en términos probabilísticos. Supongamos que se elige al azar una coalición Sy al unirse el jugador irecibe su contribución marginal. Si todas las coaliciones tienen la misma probabilidad de ser elegidas, el valor de Banzhaf del jugador ies su pago esperado. En el caso del valor de Shapley, se supone que se elige un orden o permutación al azar de los jugadores y que cada jugador recibe su contribución a la coalición de jugadores que se forma en el orden dado antes de su llegada. Si todos los órdenes tienen la misma probabilidad, es fácil ver que el valor de Shapley de cada jugador es su pago esperado de acuerdo con el mecanismo anteriormente descrito. Nótese que sólo una propiedad diferencia estas dos caracterizaciones: el valor de Shapley verifica eficiencia mientras que el valor de Banzhaf verifica poder total.
Capítulo 2 El problema de clasificación El aprendizaje estadístico es una disciplina que tiene aplicaciones en muchas áreas de la ciencia, las finanzas o la industria. Incluye un gran número de métodos y técnicas pertenecientes a diversos campos como la estadística, la gestión de datos y la inteligencia artificial. 2.1. Dos aproximaciones sencillas a la predicción Cuando se trata de aprendizaje estadístico, normalmente se tiene una medida de salida que será nuestra variable respuesta, casi siempre cualitativa o categórica, que se pretende predecir a partir de un conjunto de características, las variables independientes. Partimos de un conjunto de datos de orientación, donde observamos las salidas y las características para un conjunto de objetos (o personas). A partir de estos datos construimos un modelo de predicción que nos permitirá predecir la salida de un nuevo objeto. Denotamos por Xla variable de entrada. Cuando Xsea un vector escribiremos cada componente como Xi. A la variable de salida la denotaremos por Y, y cuando hagamos una predicción pasaremos a llamarla ˆ Y. 2.1.1. Modelos lineales En el método lineal simple, tenemos una variable salida Yy una colección de variables entrada X1, X2, ..., Xp. Predecimos la salida Ycomo ˆ Y=ˆ β0+Pp j=1 Xjˆ βj, donde el término ˆ β0es el intercepto. Suele ser común incluirlo en ˆ βañadiendo la constante 1 en X, de modo que la predicción resulte en ˆ Y=XTˆ β. Así, podemos tomar una función en un espacio de entradas p-dimensional de la forma f(X) = XTˆ β, la cual es lineal y su 7
8CAPÍTULO 2. EL PROBLEMA DE CLASIFICACIÓN gradiente f0(X) = ˆ βes un vector en el espacio de entradas que señala la dirección con la inclinación más alta. Por lo tanto, si tenemos Nindividuos, obtenemos el modelo de regresión: Yi=β0+β1xi,1+· · · +βpxi,p +i, donde Yies la variable salida del i-ésimo individuo, xi,1, ..., xi,p las variables entradas del mismo y iel error asociado a dicho individuo. En forma matricial se puede expresar así: Y=Xβ+. Ahora anticipamos una observación sobre el problema de clasificación. Nuestro espacio de datos es, en ese caso, divisible en regiones de acuerdo con las características de la clasificación. Estas regiones pueden ser más o menos suaves, dependiendo del enfoque usado para el método de predicción, por ejemplo mínimos cuadrados o el vecino más cercano. Por un lado, la aproximación de mínimos cuadrados toma los coeficientes βpara minimizar el residuo de sumas al cuadrado: RSS(β) = N X i=1 (Yi−XT iβ)2. RSS(β)es una función cuadrática de los parámetros y, por lo tanto, el mínimo siempre existe, pero puede no ser único. Para resolverlo, pasaremos a notación matricial: RSS(β)=(Y−Xβ)T(Y−Xβ), donde Xes una matriz N×(p+1) siendo cada fila un vector de entrada, e Yun N-vector de salidas del conjunto de partida. Se llega así a la ecuación normal: XT(Y−Xβ)=0. Si XTXes no singular, la solución única viene dada por: ˆ β= (XTX)−1XTY, y el valor ajustado a la entrada i-ésima Xies ˆ Yi=ˆ Y(Xi) = XT iˆ β. Es decir, una vez que sabemos los estimadores de los parámetros, ˆ β, podemos calcular los ajustes o predicciones para la muestra de unos individuos Xicon i∈ {1, ..., N}, de la forma ˆ Y(Xi) = XT iˆ βcon i∈ {1, ..., n}, o bien, en notación matricial, ˆ Y(X) = XTˆ β.
2.2. MODELOS LINEALES PARA CLASIFICACIÓN 9 2.1.2. Modelos de vecinos más cercanos En cambio, la aproximación del vecino más cercano usa las observaciones del conjunto de entrenamiento, τ, más cercanas a Xen el espacio de entradas para conseguir ˆ Y. En concreto, el vecino k-cercano ajustado por ˆ Yes definido por: ˆ Y(X) = 1 kX Xi∈Nk(X) Yi, donde Nk(X)denota la vecindad de Xdefinida por los kpuntos más cercanos a Xen el conjunto de partida. La cercanía implica una métrica, la cual asumiremos como la distancia euclidiana por el momento. Por lo tanto, encontramos las kobservaciones con los Ximás cercanos a Xen el espacio de entrada, y el promedio de sus respuestas. 2.2. Modelos lineales para clasificación Volviendo al problema de clasificación usando regresión, si tenemos Kclases, el modelo de regresión ajustado para la k-ésima clase sería: ˆ fk(X) = ˆ βk0+ˆ βT kX. La decisión de frontera entre dos clases kyles un conjunto de puntos que cumplen ˆ fk(X) = ˆ fl(X), es decir, el conjunto nX: (ˆ βk0−ˆ βl0)+(ˆ βk−ˆ βl)TX= 0o, que puede ser un conjunto afín o un hiperplano. Este tipo de regresión modela funciones discriminantes δk(X)para cada clase, y después clasifica a Xen la clase con mayor valor. Por lo tanto, si δk(X)es lineal en X, los límites de decisión serán lineales. Consideramos la regresión lineal de una matriz de indicadores. Existe un clasificador G que toma valores en el conjunto {1, ..., K}de grupos y las respuestas se codifican mediante variables indicadoras Y1, ..., YKdonde Yk= 1 en el grupo ky 0 en otro caso. De esta forma tenemos el vector Y= (Y1, ..., YK)y las Nentradas diferentes. Así, tenemos una matriz Yde tamaño N×Kque solamente contiene 0’s y 1’s, de forma que cada fila tiene un único 1. Ajustamos un modelo de regresión lineal a cada columna de Ysimultáneamente y el ajuste está dado por: ˆ Y=X(XTX)−1XTY, donde Xes la matriz de diseño, con p+ 1 columnas correspondientes a las pentradas y una columna de 1’s para el intercepto. Cabe destacar que, para cada columna de vectores respuestas Yk, tenemos un vector de coeficientes. Por lo tanto, obtenemos una matriz (p+ 1) ×Kde coeficientes: ˆ β= (XTX)−1XTY.
10 CAPÍTULO 2. EL PROBLEMA DE CLASIFICACIÓN Ahora, para obtener la clasificación de una nueva observación xprimero calculamos el valor ajustado de salida ˆ f(x)T= (1, xT)ˆ β, un vector de tamaño K. Después identificamos la componente más grande y clasificamos mediante: ˆ G(x) = argmaxk∈Gˆ fk(x). Se obtiene de esta forma el grupo al que pertenece. 2.3. Análisis clúster Por otra parte, en el análisis de clústeres también tenemos la finalidad de agrupar las observaciones o variables en grupos con características semejantes. Aquí, nos centraremos en el problema de partición de datos, donde queremos dividir los datos en un número de grupos prefijados. Supongamos una muestra de nelementos con pvariables y los queremos dividir en Kgrupos. Para ello, disponemos del algoritmo de k-medias descrito a continuación. Partimos de Kpuntos como centros de los grupos iniciales que pueden ser escogidos aleatoriamente o arbitrariamente. En segundo lugar, calculamos las distancias euclidianas de cada elemento al centro de los Kgrupos, y asignamos cada elemento al grupo más próximo. Esta asignación se realiza secuencialmente: con cada nuevo punto incluido en un grupo se vuelven a calcular las coordenadas de la nueva media de dicho grupo. Comprobamos mediante un criterio si es posible mejorar la asignación de los elemento y en caso contrario tendríamos terminado el método. El criterio mencionado en el párrafo anterior es la suma de cuadrados dentro de los grupos, SSIG en adelante, para todas las variables, es decir, la suma ponderada de las varianzas de las variables en los grupos: SSIG = K X k=1 p X j=1 nk X i=1 (xijk −¯xjk)2, donde xijk es el valor de la variable jen el elemento idel grupo k, y ¯xjk la media de la variable jen el grupo k. Por lo tanto, el criterio viene dado por: m´ın SSIG = m´ın K X k=1 p X j=1 nks2 jk, donde nkes el número de elementos del grupo kys2 jk es la varianza de la variable jen dicho grupo. De esta forma, al minimizar las varianzas de todas las variables en los grupos,
2.4. VALIDACIÓN CRUZADA 11 obtenemos grupos con las características más parecidas. Por último, existen varios métodos para calcular el número de grupos óptimo en el algoritmo de k-medias. Uno de los más usados consiste en realizar un test Faproximado de reducción de variabilidad, comparando la SSIG con Kgrupos con la de K+ 1, y calculando la reducción proporcional de variabilidad que se obtiene aumentando un grupo adicional. El test viene dado por: F=SSIG(K)−SSIG(K+ 1) SSIG(K+ 1)/(n−K−1). Este valor Fse compara con una distribución Fcon pyp(n−K−1) grados de libertad, a pesar de que no siempre se puede aplicar, ya que los datos pueden no verificar las hipótesis de la distribución F. 2.4. Validación cruzada La validación cruzada es una técnica para evaluar modelos de machine learning mediante el entrenamiento de varios modelos en subconjuntos de los datos de entrada disponibles y evaluarlos con el subconjunto complementario de los datos. Es decir, en la validación cruzada de kiteraciones o k-fold se dividen los datos en ksubconjuntos (folds). Uno de los subconjuntos se utiliza como datos de prueba y el resto, k−1, como datos de entrenamiento. El proceso de validación cruzada se repite durante kiteraciones, con cada uno de los posibles subconjuntos de datos de prueba. El error se calcula como la media aritmética de los errores de cada iteración para obtener un único resultado. Si denotamos a MSEipor el error en la iteración i-ésima, entonces el error de la validación cruzada se estima por: CVk=1 k k X i=1 MSEi. 2.5. Métodos basados en árboles Los árboles de decisión tienen como base la segmentación del espacio de predicción en un número de regiones simples. Los árboles de decisión pueden ser aplicados a los problemas de regresión y a los problemas de clasificación. Se les llama árboles de regresión, si la variable salida es cuantitativa, y árboles de clasificación si la variable es cualitativa.
12 CAPÍTULO 2. EL PROBLEMA DE CLASIFICACIÓN 2.5.1. Árboles de regresión Partimos de un conjunto de Nobservaciones, cada una con pvariables de entrada y una variable respuesta. Esto es, (xi, yi)para cada i=1, 2, ..., N, con xi= (xi1, xi2, ..., xip). Para ambos modelos tenemos una partición del espacio de predicción, donde cada región se representa por Rmcon m∈ {1, ..., M}, y creamos un modelo para la variable respuesta con una constante cmpara cada región: f(x) = M X m=1 cmI(x∈Rm). Si se escoge como criterio el mínimo de la suma de cuadrados P(yi−f(xi))2, es fácil ver que el mejor ˆcmes el promedio de los yien la región Rm: ˆcm=prom(yi:xi∈Rm). Buscar la mejor partición binaria en términos del mínimo de suma de cuadrados, en general, es muy costoso computacionalmente. Por lo tanto, se usa el siguiente algoritmo. Comenzando con todo el conjunto de datos, se considera una variable de separación jy un punto de separación s, y definimos los siguientes semiplanos: R1(j, s) = {x:xj≤s}yR2(j, s) = {x:xj> s}. Después se busca la variable jy el punto sde forma que resuelvan: arg m´ın j, s m´ın c1X xi∈R1(j,s) (yi−c1)2+ m´ın c2X xi∈R2(j,s) (yi−c2)2 . Ahora, para un jy un sdados, el mínimo interno se resuelve de la forma: ˆc1=prom(yi:xi∈R1(j, s)) yˆc2=prom(yi:xi∈R2(j, s)). Para cada variable de división, la determinación del punto de división spuede hacerse muy rápidamente y, por tanto, recorriendo todas las entradas la determinación del mejor par (j,s) es viable. Una vez encontrada la mejor división, separamos los datos en las dos regiones resultantes y repetimos el proceso de separación en cada una de las dos regiones. Luego, este proceso se repite en todas las regiones resultantes hasta tener un árbol con las dimensiones deseadas. Un árbol demasiado grande podría sobreajustar los datos, mientras que un árbol pequeño podría no capturar una estructura importante. Una regla común a seguir es crear un primer árbol T0grande, parando cuando los nodos tengan un tamaño pequeño. Después este árbol se poda mediante el algoritmo que
2.5. MÉTODOS BASADOS EN ÁRBOLES 13 precisaremos a continuación. Definimos un subárbol T⊂T0como cualquier árbol que se puede obtener podando el árbol T0, esto es, colapsando cualquier número de sus nodos internos (no terminales). Se usará mcomo índice de cada nodo terminal, representando cada región Rm. Sea |T|el número de nodos terminales en TyNmel número de observaciones en Rm. Tomando: ˆcm=1 NmX xi∈Rm yi, Qm(T) = 1 NmX xi∈Rm (yi−ˆcm)2,(2.1) definimos el criterio de complejidad de los costes para un α∈R+: Cα(T) = |T| X m=1 NmQm(T) + α|T|. La idea es encontrar, para cada α, un subárbol Tα⊆T0que minimice Cα(T). La afinación del parámetro α≥0actúa sobre la compensación entre el tamaño del árbol y su buen ajuste a los datos. Cuanto mayor valor tenga αmás pequeño será el árbol Tαy, al revés, cuanto menor sea αmás grande será Tα. Es fácil observar que para α= 0 la solución es el árbol T0. Para escoger Tαse usa la poda del eslabón más débil: sucesivamente se colapsan los nodos internos que producen el menor incremento por nodo en PmNmQm(T), y continuamos hasta que producimos un único nodo. Esto da una secuencia finita de subárboles, y se puede ver que esta secuencia debe contener a Tα. Para más detalles ver Breiman et al. (1984) o Ripley (1996). La estimación de αes lograda con la validación cruzada 5- o 10- fold: escogemos el valor ˆαpara minimizar la validación cruzada de la suma de cuadrados. El árbol final es Tˆα. 2.5.2. Árboles de clasificación Centrándonos en los árboles de clasificación donde nuestra variable respuesta toma valores de la forma 1,2, ..., K, el único cambio necesario en el algoritmo del árbol es sobre el criterio de división de los nodos y de poda del árbol. Para regresión se usó la medida de impureza de nodo del error cuadrático Qm(T)definido en (2.1), pero no es idóneo para clasificación. Ahora, en un nodo m, definimos: ˆpmk =1 NmX xi∈Rm I(yi=k),
20 CAPÍTULO 3. INFLUENCIA EN LA CLASIFICACIÓN Definición 3.4. Sea Ua=hN, A, uaiun conjunto de datos definido por el clasificador ua, donde ua(a0) = 1 si a0=a, y ua(a0) = 0 si a06=a. El conjunto de datos Uaes conocido como conjunto simple de datos sobre a. Además, se puede comprobar que la aditividad implica que para cualquier escalar α∈Q,φi(αG) = αφi(G), donde el conjunto de datos αG tiene el valor de cada punto multiplicado por un factor αpara cualquier conjunto de datos G. Haciendo uso de las propiedades anteriores, se puede probar el siguiente resultado. Proposición 3.5. Cualquiera medida de influencia que satisfaga los axiomas de simetría, dummy y aditividad, evalúa en cero todas las características. Demostración. Primero, se demostrará que para cualquier a,a0∈Ay cualquier b∈Ai, se da que φi(U(a−i,b)) = φi(U(a0 −i,b)). Esto es así, porque se puede definir una aplicación biyectiva de U(a−i,b)aU(a0 −i,b)tal que para todo j∈N\ {i}, se intercambian ajya0 j. Por la propiedad de simetría de los estados, φi(U(a−i,b)) = φi(U(a0 −i,b)). Ahora, si φes aditiva, entonces tenemos que para cualquier conjunto de datos G= hN, B, vi,φi(G) = Pa∈Bv(a)φi(Ua). Esto es, la influencia de una característica debe ser la suma de sus influencias sobre los conjuntos simples de datos sobre aponderadas por el valor v(a). Por último, supongamos por contradicción que existe algún conjunto simple U¯ a(¯ a∈B) para el cual alguna característica i∈Nno tiene una influencia igual a cero. Esto es, se asume que φi(U¯ a)6= 0. Se define un conjunto de datos G=hN, A, vicomo sigue. Para todo a∈Atal que a−i=¯ a−i, se toma v(a) = 1, y v(a) = 0 si a−i6=¯ a−i. En el conjunto de datos resultante, v(a)está determinado solamente por los valores de las características en N\{i}; en otras palabras, v(a) = v(a−i, b)para todo b∈Ai, por lo que la característica ies dummy. De acuerdo con el axioma de característica dummy, se tiene que φi(G) = 0; sin embargo, 0 = φi(G) = X a:v(a)=1 φi(Ua) = X b∈Ai φi(U(¯ a−i,b)) =X b∈Ai φi(U¯ a) = |Ai|φi(U¯ a)>0, donde la segunda igualdad viene dada por la descomposición de Gen los conjuntos simples, y en la cuarta igualdad se aplica la simetría. Por lo tanto, se llega a una contradicción y
3.1. CARACTERIZACIÓN AXIOMÁTICA 21 se puede afirmar que cualquier medida de influencia que satisfaga los axiomas de simetría, dummy y aditividad, evalúa en cero la influencia de todas las características. Como muestra la Proposición 3.5, la aditividad, simetría y la propiedad dummy no consiguen describir una influencia de modo satisfactorio. Un lector familiarizado con la caracterización axiomática del valor de Shapley encontrará este resultado decepcionante: la caracterización clásica de los valores de Shapley y Banzhaf asume la aditividad. En lo que sigue, mostraremos la caracterización axiomática de una medida de influencia, por medio de la definición de un axioma alternativo, que evoca una propiedad descrita por Lehrer (1988) que hace uso de ciertas uniones e intersecciones, en el contexto de la teoría de juegos. A partir de aquí, asumiremos que en todos los conjuntos de datos, estos están clasificados por un clasificador binario. Escribimos W(B)para referirnos al conjunto de los individuos de Btales que v(a)=1y los llamaremos perfiles ganadores. Por otra parte, escribiremos L(B)para referirnos al conjunto de los individuos de Btales que v(a)=0y los llamaremos perfiles perdedores. Por lo tanto, podemos escribir φi(W(B), L(B)), en vez de φi(G). Así que, dados dos conjuntos disjuntos W, L ⊂Apodemos definir el conjunto de datos como G=hW, Liy la influencia de icomo φi(W(B), L(B)), sin tener que poner explícitamente N,Byv. Definición 3.6. Una medida de influencia φsatisface la propiedad de la unión disjunta (DU) si para cualquier Q⊂A, y cualesquiera R, R0⊂A\Q, entonces φi(Q, R)+φi(Q, R0) = φi(Q, R ∪R0), y φi(R, Q) + φi(R0, Q) = φi(R∪R0, Q). Esto es, dado el resultado de una clasificación binaria de dos conjuntos de datos G1=hW, L1iyG2=hW, L2i, el axioma de la unión disjunta afirma que la capacidad de una característica de afectar a los elementos de salida de G1es independientes de la capacidad que tiene sobre los de G2, si los perfiles ganadores son los mismos en ambos conjuntos de datos. Reemplazando el axioma de aditividad por el de unión disjunta obtenemos una medida de influencia única, de la siguiente forma: χi(G) = X a∈BX b∈Ai:(a−i,b)∈B |v(a−i, b)−v(a)|,∀i∈N. (3.1) Esta medida contabiliza el número de veces que un cambio en el estado de la característica iafecta en la clasificación de los datos de salida. Si normalizamos χy lo dividimos
22 CAPÍTULO 3. INFLUENCIA EN LA CLASIFICACIÓN entre |B|, la medida resultante tiene la siguiente interpretación: se toma un vector a∈B al azar, y cuenta el número de puntos en Aipara los cuales (a−i, b)∈Beicambia el valor de a. Se puede observar que, cuando todas las características tienen dos estados y B=A, entonces χcoincide con el valor de Banzhaf (1964). A continuación se presenta un lema que caracteriza una medida de influencia que satisface (D), (Sim) y (DU) cuando el conjunto de datos contiene solo una única característica. Lema 3.7. Sea φuna medida de influencia que satisface la simetría de los estados, y sean G1=h{i}, Ai, v1iyG2=h{i}, Ai, v2idos conjuntos de datos con una única característica i. Si el número de estados ganadores de G1yG2son idénticos, entonces φi(G1) = φi(G2). El lema anterior implica que para juegos con una única característica, el valor de la característica solo depende del número de estados ganadores, en lugar de su identidad. Ahora se enunciará un teorema que demuestra que φes la única medida de influencia que satisface los tres axiomas anteriores, salvo el producto por una constante. Teorema 3.8. Una medida de influencia φsatisface (D), (Sim) y (DU) si y solo si existe una constante C tal que para todo conjunto de datos G=hN, B, vi φi(G) = C·χi(G),∀i∈N. Demostración. Es fácil probar que χsatisface los tres axiomas, por lo tanto nos centraremos en la otra implicación del “si y solo si”. Asumimos que tenemos el conjunto Acomo datos; la demostración es válida incluso si se asume que tenemos un subconjunto arbitrario B⊂A. Denotaremos W=W(A) yL=L(A)como los conjuntos de los perfiles ganadores y perdedores respectivamente. Dado un a−i∈A−i, definimos La−i={¯ a∈L:a−i=¯ a−i}yWa−i={¯ a∈W:a−i=¯ a−i}. Utilizando la propiedad de la unión disjunta, se puede descomponer φi(W, L)de la forma: φi(W, L) = X a−i∈A−iX ¯ a−i∈A−i φi(Wa−i, L¯ a−i).(3.2) Si en todos los sumandos de (3.2) resulta ¯ a−i6=a−i, entonces la característica ies dummy dado el conjunto de datos proporcionado. En efecto, los perfiles de estados están
3.1. CARACTERIZACIÓN AXIOMÁTICA 23 en Wa−io en L¯ a−i; esto es, si v(a−i, b)=0entonces (a−i, b)no se observa, y si v(¯ a−i, b)=1, entonces (¯ a−i, b)no se observa. Por lo tanto, se concluye que: φi(W, L) = X a−i∈A−i φi(Wa−i, La−i).(3.3) Ahora consideremos φi(Wa−i, La−i). Como φsatisface la propiedad de simetría de los estados, el Lema 3.7 implica que φisolo tiene la posibilidad de depender de a−i,|Wa−i| y|La−i|. Luego, para cualesquiera a−iya0 −ital que |La−i|=|La0 −i|y|Wa−i|=|Wa0 −i|, por el Lema 3.7, φi(Wa−i, La−i) = φi(Wa0 −i, La0 −i). En otras palabras, φisolo depende de |Wa−i|,|La−i|, y no de la identidad de a−i. Por lo tanto, se puede ver a φipara una única característica como función de dos parámetros, wylen N, donde wes el número de los estados ganadores y lel número de los perdedores. De acuerdo con la propiedad de característica dummy, se sabe que φi(w, 0) = φi(0, l)=0; es más, la propiedad de la unión disjunta dice que φi(x, l) + φi(y, l) = φi(x+y, l), y que φi(w, x) + φ(w, y) = φi(w, x +y). Ahora se probará que φi(w, l) = φi(1,1)wl. Se probará por inducción en w+l. Para w+l= 2 la afirmación es clara. Asumimos sin pérdida de generalidad que w > 1yl≥1; entonces podemos escribir w=x+ycon x, y ∈Ntal que 1≤x, y < w. Por nuestra observación anterior, φi(w, l) = φi(x, l) + φi(y, l) =φi(1,1)xl +φi(1,1)yl =φi(1,1)wl, donde la segunda igualdad se tiene por la hipótesis de inducción. Entonces, φi(1,1) es la influencia de la característica icuando hay exactamente un estado ganador y uno perdedor. Denotaremos φi(1,1) = ci. Definimos: Wi(a−i) = {b∈Ai:v(a−i, b)=1}yLi(a−i) = Ai\Wi(a−i). Por lo tanto, |Wa−i|=|Wi(a−i)|y|La−i|=|Li(a−i)|. Juntando todo lo anterior, se obtiene que: φi(G) = ciX a−i∈Ai |Wi(a−i)|·|Li(a−i)|.(3.4) Ahora solo queda ver que la medida dada en (3.4) es igual (salvo el producto por una constante) a χi. En efecto, (3.4) es igual a Pa∈A:v(a)=0 |Wi(a−i)|, lo que a su vez es igual
24 CAPÍTULO 3. INFLUENCIA EN LA CLASIFICACIÓN aPa∈A:v(a)=0 Pb∈Ai|v(a−i, b)−v(a)|. De forma análoga, tenemos que (3.4) es igual a: X a∈A:v(a)=1 X b∈Ai |v(a−i, b)−v(a)|. Por lo tanto, se tiene la siguiente igualdad: X a−i∈Ai |Wi(a−i)|·|Li(a−i)|=1 2X a∈AX b∈Ai |v(a−i, b)−v(a)|. En particular, para cada conjunto de datos G=hN, A, viy para todo i∈N, existe alguna constante Cital que φi(G) = Ciχi(G). Para concluir la demostración, se mostrará que Ci=Cjpara todo i, j ∈N. Sea σ:N−→ Nuna biyección que intercambia icon j; entonces φi(G) = φσ(i)(σG). Por la propiedad de simetría de las características, Ciχi(G) = φi(G) = φσ(i)(σG) = φj(σG) =Cjχj(σG) = Cjχi(G). Por lo tanto, hemos llegado a que Ci=Cjpara todo i,j∈N. 3.1.1. Ejemplo 1 Ahora realizaremos un ejemplo sencillo donde aplicar la medida de influencia presentada y ver una clara relación con el valor de Banzhaf. Por lo tanto, vamos a considerar un clasificador binario que clasifica en 0 o 1. Cada vector a∈Binforma sobre un total de tres atributos que toman valores de 0 o 1, es decir, es un vector de la forma a= (a1, a2, a3) donde ai∈ {0,1}para todo i∈ {1,2,3}. Hay un total de 2×2×2=8combinaciones de los estados de estos atributos. Supongamos que tenemos un vector de cada tipo y que se han clasificado de la forma que aparece en la Tabla 3.1. av(a)av(a) (0,0,0) 0(0,1,1) 1 (0,0,1) 1(1,0,1) 0 (0,1,0) 0(1,1,0) 0 (1,0,0) 0(1,1,1) 1 Tabla 3.1: Datos del ejemplo 1. Ahora procederemos a calcular la medida de influencia, primero para la característica i= 1. Fijamos un vector a, por ejemplo (0,0,1), y se calcula la diferencia en la clasificación
3.1. CARACTERIZACIÓN AXIOMÁTICA 25 cuando cambia el valor del primer atributo y pasa a ser 1 (véase la ecuación (3.1)). En este caso, el cambio de estado ha producido un cambio en la clasificación, de 1 a 0, por lo que la diferencia de los valores en valor absoluto será 1. De forma análoga ocurrirá al considerar el vector (1,0,1), por lo tanto, la influencia aumenta en 2, uno por cada vector. Otro posible caso sería el del vector (0,0,0), cuyo valor es 0, al igual que el de (1,0,0), por lo tanto no hay cambio en la clasificación y entonces no aumenta la influencia. De la misma forma se procede con el resto de vectores, obteniéndose el siguiente resultado: χ1(G) =2 · |v(1,0,0) −v(0,0,0)|+ 2 · |v(1,0,1) −v(0,0,1)| + 2 · |v(1,1,0) −v(0,1,0)|+ 2 · |v(1,1,1) −v(0,1,1)| =2 ·0+2·1+2·0+2·0=2. De forma análoga se calcula la influencia de las otras dos características: χ2(G) =2 · |v(0,1,0) −v(0,0,0)|+ 2 · |v(0,1,1) −v(0,0,1)| + 2 · |v(1,1,0) −v(1,0,0)|+ 2 · |v(1,1,1) −v(1,0,1)| =2 ·0+2·0+2·0+2·1=2, χ3(G) =2 · |v(0,0,1) −v(0,0,0)|+ 2 · |v(0,1,1) −v(0,1,0)| + 2 · |v(1,0,1) −v(1,0,0)|+ 2 · |v(1,1,1) −v(1,1,0)| =2 ·1+2·1+2·0+2·1=6. Tenemos, para cada una de las tres características, una influencia de 2, 2 y 6, respectivamente. Por lo tanto, se puede decir que la tercera característica es la más influyente. Ahora veamos la relación con el valor de Banzhaf. En este ejemplo se cumple que todas las características tienen dos estados y B=A, por lo tanto χcoincide con el valor de Banzhaf. Identificamos las distintas combinaciones de estados de las características como las posibles coaliciones de características, S, tal que el estado 1 se interpreta como que la característica correspondiente, i,“participa en la coalición”y el estado 0 como que “no participa”. En la Tabla 3.2, así dadas las coaliciones, recogemos los valores de los juegos asociados, vi, uno para cada característica. Si para S⊂N,aSes el elemento de B correspondiente a S, e i∈ {1,2,3}, se define el juego vi: vi(S) = m´ın {v(aS), v(aS∪i)}si i /∈S, m´ax nv(aS), v(aS\{i})osi i∈S. (3.5)
26 CAPÍTULO 3. INFLUENCIA EN LA CLASIFICACIÓN aS v1(S)v2(S)v3(S) (0,0,0){∅} 000 (0,0,1) {3}011 (0,1,0) {2}000 (1,0,0) {1}000 (0,1,1) {2,3}111 (1,0,1) {1,3}100 (1,1,0) {1,2}000 (1,1,1) {1,2,3}111 Tabla 3.2: Juegos TU asociados al conjunto de datos. Ahora, para cada i, se calcula el valor de Banzhaf del jugador ien el juego vi: β1(v1) = 1 23−1[(v(1,0,0) −v(0,0,0)) + (v(1,0,1) −v(0,0,1)) + (v(1,1,0) −v(0,1,0)) + (v(1,1,1) −v(0,1,1))] =1 23−1·(0 + 1 + 0 + 0) = 1 4, β2(v2) = 1 23−1[(v(0,1,0) −v(0,0,0)) + (v(0,1,1) −v(0,0,1))) + (v(1,1,0) −v(1,0,0)) + (v(1,1,1) −v(1,0,1))] =1 23−1·(0 + 0 + 0 + 1) = 1 4, β3(v3) = 1 23−1[(v(0,0,1) −v(0,0,0)) + (v(0,1,1) −v(0,1,0))) + (v(1,0,1) −v(1,0,0)) + (v(1,1,1) −v(1,1,0))] =1 23−1·(1 + 1 + 0 + 1) = 3 4. Los valores de Banzhaf obtenidos coinciden con las medidas de influencia calculadas anteriormente si normalizamos sus valores dividiendo por |B|= 8. 3.1.2. Ejemplo 2 Vamos a considerar de nuevo el ejemplo anterior, con un clasificador binario y cada vector a∈Bcon tres atributos que toman valores de 0 o 1, pero en este caso vamos a tener en cuenta que en nuestra muestra puede haber vectores repetidos o que no son observados en ningún momento. Por lo tanto, supongamos que tenemos los resultados de la Tabla 3.3,
3.1. CARACTERIZACIÓN AXIOMÁTICA 27 donde la primera columna son las posibles valores del vector a, la segunda las veces que ese vector ha salido repetido en nuestra muestra y la tercera cómo lo ha clasificado v. afrecuencia(a)v(a) (0,0,0) 3 0 (0,0,1) 2 1 (0,1,0) 0 - (1,0,0) 2 0 (0,1,1) 4 1 (1,0,1) 1 0 (1,1,0) 1 0 (1,1,1) 3 1 Tabla 3.3: Datos del ejemplo 2. Como se puede observar en la segunda columna, Btiene 16 elementos. Otro dato a tener en cuenta sería la combinación (0,1,0) de atributos, que no ha sido observada en ningún momento, por lo tanto, a la hora de calcular la influencia no podemos tener en cuenta cómo ha sido clasificado ni cómo cambia dicha clasificación si se modifica el valor de alguno de los atributos. Procedamos a calcular la medida de influencia, primero para la característica i= 1. Como hemos hecho en el ejemplo anterior, fijamos un vector a, por ejemplo (0,0,1), y se calcula la diferencia en la clasificación cuando cambia el valor del primer atributo y pasa a ser 1 (véase la ecuación (3.1)). Se produce un cambio en la clasificación, de 1 a 0, por lo que la diferencia de los valores va a ser 1. Además, como el vector (0,0,1) se repite 2 veces y, de forma análoga, el vector (1,0,1) se repite solamente 1 vez, se puede decir que la influencia aumenta en 2 + 1 = 3. Otro posible caso sería el del vector (0,0,0), cuyo valor es 0, al igual que el de (1,0,0), por lo tanto no hay cambio en la clasificación y entonces no aumenta la influencia. De la misma forma se procede con el resto de vectores, obteniendo ahora el siguiente resultado: χ1(G) =(3 + 2) · |v(1,0,0) −v(0,0,0)|+ (2 + 1) · |v(1,0,1) −v(0,0,1)| + 0 · |v(1,1,0) −v(0,1,0)|+ (4 + 3) · |v(1,1,1) −v(0,1,1)| =5 ·0+3·1+0+7·0=3.
28 CAPÍTULO 3. INFLUENCIA EN LA CLASIFICACIÓN De forma análoga se calcula la influencia de las otras dos características: χ2(G) =0 · |v(0,1,0) −v(0,0,0)|+ (2 + 4) · |v(0,1,1) −v(0,0,1)| + (2 + 1) · |v(1,1,0) −v(1,0,0)|+ (1 + 3) · |v(1,1,1) −v(1,0,1)| =0 + 6 ·0+3·0+4·1=4, χ3(G) =(3 + 2) · |v(0,0,1) −v(0,0,0)|+ 0 · |v(0,1,1) −v(0,1,0)| + (2 + 1) · |v(1,0,1) −v(1,0,0)|+ (1 + 3) · |v(1,1,1) −v(1,1,0)| =5 ·1+0+3·0+4·1=9. Tenemos, para cada una de las tres características, una influencia de 3, 4 y 9, respectivamente. De este modo, se puede decir que la tercera característica es la más influyente. En este caso B6=A, por lo tanto, no se puede relacionar con el valor de Banzhaf. 3.2. Influencia en clasificadores lineales En esta sección se presentará la aplicación de los resultados anteriores a la clase de clasificadores lineales. Para esta clase de funciones, la medida de influencia tiene un interpretación intuitiva. Un clasificador lineal está definido por un hiperplano en Rn, de forma que todos los puntos que están a un lado del hiperplano toman el valor 1, y todos los puntos del otro lado toman el valor 0. Formalmente, se asocia un peso wi∈Ra todas las características de N(se asume que wi6= 0 para todo i∈N); un punto x∈Rnvale 1 si x·w≥q, donde q∈Res un parámetro dado. La función de clasificación v:Rn→ {0,1}viene dada por: v(x) = 1si x·w≥q, 0en otro caso. (3.6) Fijado el valor de xia algún b∈R, se considera el conjunto: Wi(b) = nx−i∈Rn−1:v(x−i, b)=1o; se observa que si b < b0y wi>0, entonces Wi(b)⊂Wi(b0)(si wi<0entonces Wi(b0)⊂ Wi(b)). Dados dos valores b, b0∈R, se denota por: Di(b, b0) = nx−i∈Rn−1:v(x−i, b)6=v(x−i, b0)o.
3.3. EXTENSIONES DE LA MEDIDA DE INFLUENCIA DE LAS CARACTERÍSTICAS29 Por la anterior observación, si b < b0entonces Di(b, b0) = Wi(b0)\Wi(b), y si b > b0 entonces Di(b, b0) = Wi(b)\Wi(b0). Supongamos que en vez de tomar valores en Rn, se toman en [0,1]n, entonces podemos definir |Di(b, b0)|=V ol(Di(b, b0)), donde: V ol(Di(b, b0)) = Zx−i∈[0,1]n−1|v(x−i, b0)−v(x−i, b)|∂x−i. En otras palabras, para medir la influencia total de fijar el estado de la característica ia b, se calcula el volumen total de Di(b, b0)para todo b0∈[0,1], esto es R1 b0=0 V ol(Di(b, b0))∂b. Por lo tanto, la influencia total de fijar el estado iabes Rx∈[0,1]n|v(x−i, b)−v(x)|∂x. La influencia total de iserá entonces la influencia total de sus estados, i. e.: Z1 b=0 Zx∈[0,1]n|v(x−i, b)−v(x)|∂x∂b. (3.7) La fórmula en la ecuación (3.7) se denota por χi(w;q). La ecuación (3.1) es una versión discretizada de la ecuación (3.7); el resultado de la sección anterior se puede extender a un conjunto continuo, con solo unos pocos cambios en la demostración. Ahora se mostrará en el siguiente teorema que la medida dada en (3.7) concuerda con los pesos de una manera natural. Teorema 3.9. Sea vun clasificador lineal definido por wyq; entonces χi(G)≥χj(G) si y solo si |wi|≥|wj|. 3.3. Extensiones de la medida de influencia de las características Anteriormente se presentó una caracterización axiomática de la influencia de la característica, donde el valor de cada vector de características es 0 o 1. En esta sección se presentarán algunas posibles extensiones más de la medida, y las variaciones en los axiomas que sean necesarias. 3.3.1. Influencia de los estados Al igual que se ha visto la influencia que tiene cierta característica, uno también se puede preguntar por la influencia de cierto estado de una característica. En otras palabras, en vez de medir la influencia de una característica, medir la influencia de una característica
Capítulo 5 Conclusiones En este trabajo, principalmente se ha estudiado y analizado una medida de influencia en la clasificación. Esta medida de influencia ha sido definida a partir únicamente de una serie de axiomas naturales, y con la posibilidad de ser extendida fácilmente a otros contextos. La principal ventaja de esta aproximación es la posibilidad de usarla con un conocimiento mínimo sobre el algoritmo o prioridades del clasificador. En el ejemplo del COVID-19, se puede observar que se parte simplemente del conjunto de todos los pacientes, sin conocer previamente en qué tipo de personas es más agresivo el virus. La medida de influencia puede ser extendida de varias formas. La medida χpresentada contabiliza el número de veces que un cambio en el estado de cierta característica produce un cambio en el clasificador. Sin embargo, se puede dar el caso de que el conjunto de datos no contenga alguno de los vectores a,a0∈B, tal que a0= (a−i, b), como es en el caso de nuestro ejemplo. Se puede observar en la Tabla 4.1 que no tenemos ningún paciente con las características de tener menos de 60 años y con los antecedentes de bronquitis, demencia y con o sin diabetes, por ejemplo. En nuestro caso, hemos prescindido simplemente de esos perfiles a la hora de calcular la influencia, pero un problema abierto sería extender la medida de manera que no deseche posibles perfiles. Esta forma de proceder se ha visto reflejada al estudiar la influencia de las características en la clasificación de una incidencia, pues si bien al considerar el área sanitaria de Santiago-Barbanza la patología previa de la bronquitis no tenía gran influencia, esta se incrementó al realizar el análisis a nivel de toda Galicia, cuando se observaron perfiles de pacientes no existentes en el primer análisis. Esto parece aconsejar la búsqueda de una medida que podría equilibrar los resultados. Por último, los resultados de la parte experimental son más bien ilustrativos que informativos, ya que simplemente hemos analizado los pacientes a partir de cuatro característi- 37
38 CAPÍTULO 5. CONCLUSIONES cas. Y en función de esas cuatro características, hemos visto que las más influyentes son la diabetes y la edad, pero tampoco se podría concluir que son las más influyentes en general, ya que, escogiendo más o unas distintas podrían variar los resultados. Por lo que, un paso a mayores sería la de ir escogiendo más características para obtener unos resultados más realistas y en consecuencia útiles para servir de apoyo a la toma de decisiones.
Apéndice A Programación con R A.1. Preparación de los datos Pacientes=read.csv2("Pacientes_01.csv", sep=";", header=FALSE, stringsAsFactors=TRUE) Antecedentes=read.csv2("Antecedentes_01.csv", sep=";", header=FALSE, stringsAsFactors=TRUE) m=length(Pacientes[,1]) datos=Pacientes[,c(4,2)] #Creamos los dos grupos de edad <60 (0) / >=60 (1) n=which(datos[,2]<60) v=rep(0,length(n)) datos[,2]=replace(datos[,2],1:m, 1) datos[,2]=replace(datos[,2],n, v) #Columna Bronquitis SI(1)/NO(0) datos=cbind(datos,Br=rep(0,m)) n=which(Antecedentes[,2]==’R78’ | Antecedentes[,2]==’R79’) ln=length(n) for (i in 1:ln){ for (j in 1:m) { if(Antecedentes[n[i],1]==Pacientes[j,1]) { 39
40 APÉNDICE A. PROGRAMACIÓN CON R datos[j,3]=1} }} #Columna Demencia SI(1)/NO(0) datos=cbind(datos,Dem=rep(0,m)) n=which(Antecedentes[,2]==’P70’) ln=length(n) for (i in 1:ln){ for (j in 1:m) { if(Antecedentes[n[i],1]==Pacientes[j,1]) { datos[j,4]=1} }} #Columna Diabetes SI(1)/NO(0) datos=cbind(datos,Diab=rep(0,m)) n=which(Antecedentes[,2]==’T89’ | Antecedentes[,2]==’T90’ | Antecedentes[,2]==’W85’) ln=length(n) for (i in 1:ln){ for (j in 1:m) { if(Antecedentes[n[i],1]==Pacientes[j,1]) { datos[j,5]=1} }} A.2. Medida de influencia a=datos va=rep(0,32) for (w in 0:1){ #diabetes for (l in 0:1){ #demencia for (i in 0:1){ #bronquitis for (j in 0:1){
A.2. MEDIDA DE INFLUENCIA 41 #edad for (k in 0:1){ #incidencia index=which(a[,1]==k & a[,2]==j & a[,3]==i & a[,4]==l & a[,5]==w) va[16*w+8*l+4*i+2*j+k+1]=length(a[index,1]) }}}}} chi_1=0 for (w in 0:1){ #diabetes for (l in 0:1){ #demencia for (i in 0:1){ #bronquitis for (k in 0:1){ #incidencia if (va[16*w+8*l+4*i+2*0+k+1]>0 & va[16*w+8*l+4*i+2*1+(1-k)+1]>0){ chi_1=chi_1 + va[16*w+8*l+4*i+2*0+k+1]+va[16*w+8*l+4*i+2*1+1-k+1] }}}}} chi_2=0 for (w in 0:1){ #diabetes for (l in 0:1){ #demencia for (j in 0:1){ #edad for (k in 0:1){ #incidencia if (va[16*w+8*l+4*0+2*j+k+1]>0 & va[16*w+8*l+4*1+2*j+1-k+1]>0){ chi_2=chi_2 + va[16*w+8*l+4*0+2*j+k+1]+va[16*w+8*l+4*1+2*j+1-k+1] }}}}} chi_3=0 for (w in 0:1){ #diabetes
42 APÉNDICE A. PROGRAMACIÓN CON R for (i in 0:1){ #bronquitis for (j in 0:1){ #edad for (k in 0:1){ #incidencia if (va[16*w+8*0+4*i+2*j+k+1]>0 & va[16*w+8*1+4*i+2*j+1-k+1]>0){ chi_3=chi_3 + va[16*w+8*0+4*i+2*j+k+1]+va[16*w+8*1+4*i+2*j+1-k+1] }}}}} chi_4=0 for (l in 0:1){ #demencia for (i in 0:1){ #bronquitis for (j in 0:1){ #edad for (k in 0:1){ #incidencia if (va[16*0+8*l+4*i+2*j+k+1]>0 & va[16*1+8*l+4*i+2*j+1-k+1]>0){ chi_4=chi_4 + va[16*0+8*l+4*i+2*j+k+1]+va[16*1+8*l+4*i+2*j+1-k+1] }}}}} #influencia edad chi_1 #influencia bronquitis chi_2 #influencia demencia chi_3 #influencia diabetes chi_4
Bibliografía Banzhaf, J. F. (1964), “Weighted voting doesn’t work: A mathematical analysis.” Rutgers Law Review, 19, 317–343. Breiman, L., Friedman, J., Stone, C. J., and Olshen, R. A. (1984), Classification and Regression Trees. CRC press. Datta, A., Datta, A., Procaccia, A. D., and Zick, Y. (2015), “Influence in classification via cooperative game theory.” Twenty-Fourth International Joint Conference on Artificial Intelligence, 511–517. Davila-Pena, L., García-Jurado, I., and Casas-Méndez, B. (2021), “Assessment of the influence of features on a classification problem: an application to COVID-19 patients.” arXiv preprint. arXiv:2104.14958. Dua, D. and Graff, G. (2017), “UCI machine learning repository.” URL http://archive. ics.uci.edu/ml. Hastie, T., Tibshirani, R., and Friedman, J. (2008), The Elements of Statistical Learning. Springer Series in Statistics. Lehrer, E. (1988), “An axiomatization of the Banzhaf value.” International Journal of Game Theory, 17, 89–99. Ripley, B. D. (1996), Pattern Recognition and Neural Networks. Cambridge University Press. Sánchez Rodríguez, E. and Vidal Puga, J. (2014), Juegos Coalicionales. Universidade de Vigo. Servizo de Publicacións, ed. Shapley, L. S. (1953), “A value for n-person games.” Contributions to the Theory of Games, 2, 307–317. 43