scieee AI-readable full text Open interactive document viewer

Comparabilidad de elecciones

Roye Muiños, Gibran

Abstract

[cast] Este trabajo ha tenido como objetivo establecer y estudiar una metodología de comparación de conjuntos de datos que representan a los mismos individuos pero en diferentes tiempos. Se han estudiado datos electorales donde se ha realizado un análisis exploratorio inicial para conocer los datos y su contexto utilizando algunos métodos estadísticos como ACP y clustering. Se ha determinado una metodología de comparación basada en reducir la dimensión de los datos a dos y el traslado de los conjuntos de datos al mismo espacio, observando entonces su desplazamiento mediante la visualización gráfica, y su correlación con las variables, visualizadas estas también en el mapa junto a los conjuntos de datos. Los resultados de este estudio muestran las tendencias de los individuos en el tiempo según las variables, y la metodología puede ser ampliable tanto a más datos electorales como a conjuntos de datos de otra naturaleza.

Full text

Facultat d’Economia i Empresa Facultat de Matemàtiques i Estadística TRABAJO FINAL DE GRADO Comparabilidad de elecciones Grado de Estadística Autor: Gibran Roye Muiños Director: Josep M. Oller Sala Convocatoria: 2019 Resumen Este trabajo ha tenido como objetivo establecer y estudiar una metodología de comparación de conjuntos de datos que representan a los mismos individuos pero en diferentes tiempos. Se han estudiado datos electorales donde se ha realizado un análisis exploratorio inicial para conocer los datos y su contexto utilizando algunos métodos estadísticos como ACP y clustering. Se ha determinado una metodología de comparación basada en reducir la dimensión de los datos a dos y el traslado de los conjuntos de datos al mismo espacio, observando entonces su desplazamiento mediante la visualización gráfica, y su correlación con las variables, visualizadas estas también en el mapa junto a los conjuntos de datos. Los resultados de este estudio muestran las tendencias de los individuos en el tiempo según las variables, y la metodología puede ser ampliable tanto a más datos electorales como a conjuntos de datos de otra naturaleza. Palabras clave: Datos electorales,Profiling,álgebra lineal,análisis de componentes principales,Matrices. Abstract This project’s aim was to define and study a methodology that allows to compare different datasets which represent the same individuals but on different spots in time. We have chosen to study electoral data. A first research analysis has been done in order to get to know the features of the data and its context. In this initial analysis, some statistical tools have been used such as PCA and clustering. The comparison methodology stablished in this project is based on, first, the dimensionality reduction of the datasets and the shift of these datasets to the same space. After, the individuals’ changes from the pass of the time could be seen. If this movement is compared with the placement of variables on the same space, we can know the relationship with the groups of individuals and the variables, in order to get some ideas on why they move. The methodology stablished can be expanded not only to more electoral data, but also to other datasets with a different nature. Keywords: Electoral data,Profiling,Linear algebra,Principal components analysis, Matrixes. Índice general Índice de figuras V 1. Introducción 1 2. Bases del estudio 3 2.1. Determinación de los datos ........................ 3 2.2. Contexto de la situación .......................... 5 3. Análisis individual 8 3.1. Descripción del conjunto de datos .................... 8 3.2. Reducción de la dimensión y visualización ............... 10 3.3. Profiling .................................... 20 4. Comparación de resultados 27 4.1. Centralización ................................. 28 4.2. Rotación .................................... 29 4.3. Visualización y comparación ........................ 31 5. Generalización 37 6. Conclusiones 43 Referencias 44 iv Índice de figuras 3.1. Variabilidad acumulada explicada 2015 . . . . . . . . . . . . . . . . . . . . 14 3.2. Valorespropios2015 .............................. 15 3.3. Variabilidad acumulada explicada 2017 . . . . . . . . . . . . . . . . . . . . 16 3.4. Valorespropios2017 .............................. 17 3.5. Mapa de individuos 2015 . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18 3.6. Mapa de individuos 2017 . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19 3.7. Dendogramas .................................. 21 3.8. Evolución varianza entre grupos . . . . . . . . . . . . . . . . . . . . . . . . 22 3.9. Profiling12015................................. 23 3.10.Profiling22015................................. 23 3.11.Profiling32015................................. 24 3.12.Profiling12017................................. 24 3.13.Profiling22017................................. 25 3.14.Profiling32017................................. 25 4.1. Centralización.................................. 29 4.2. Comparación de resultados . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 4.3. Comparación de resultados con partidos . . . . . . . . . . . . . . . . . . . 35 v Trabajo final de grado Gibran Roye Muiños Clasificación AMS MSC clasificación principal 05C50; clasificaciones secundarias: 91F10 62H25 Lista de acrónimos ACP Análisis de componentes principales CERA Censo Electoral de los Residentes ausentes IDESCAT Institut d'Estadística de Catalunya CDC Convergencia Democrática de Catalunña ERC Esquerra Republicana de Catalunya JXSí Junts Pel Sí UCD Unión Democrática de Cataluña CUP Candidatura de Unidad Popular PSOE Partido Socialista Obrero Español PP Partido Popular Cs Ciudadanos PDeCAT Partido Democráta de Cataluña UE Unión Europea PC Principal component SS Sum of Squared distances vi Trabajo final de grado Gibran Roye Muiños Agradecimientos Quería agradecer a mí tutor en este trabajo, Josep M. Oller Sala, por su apoyo, guía y aportación de ideas al trabajo, ofreciendo tanto la idea inicial del proyecto como gran parte del material necesario para el desarrollo de esta. También agradecer al profesor Esteban Vegas por las herramientas de soporte de LaTeX ofrecidas. vii Capítulo 1 INTRODUCCIÓN El mundo político, como la economía y las ciencias sociales en general, se ve influenciado y determinado por un número casi infinito de variables. Si nos centralizamos solamente en el caso de las elecciones que se realizan cada determinado tiempo en un territorio determinado, la probabilidad de tener dos elecciones completamente iguales es prácticamente nula, lo cual no obstante da sentido a realizar diferentes elecciones en diferentes períodos de tiempo. Esto es debido a que tanto los agentes involucrados en estas elecciones como la infinidad de factores que las influyen están en constante movimiento e interacción entre ellos. Cuando nos referimos a los agentes involucrados, nos referimos por una parte a los votados, que serían los partidos políticos o personas que se presentan a las elecciones, dependiendo de la votación de referencia, y por otro lado a los votantes, ciudadanos, aunque también nos podríamos referir a grupos de votantes y proceder a la agrupación de resultados por territorios, por ejemplo. Tanto los votantes como los votados varían a lo largo del tiempo, aparecen nuevos partidos, se fusionan algunos territorios o algunas personas cambian de ideología y rumbo aún manteniendo el mismo nombre o etiqueta sobre sí mismos. Este trabajo realizará un análisis de la comparabilidad de diferentes elecciones en el mismo territorio pero en diferentes períodos. Cuando se realizan elecciones generales con cuatro años de diferencia entre ellas, por ejemplo, resulta interesante realizar una comparación entre ellas de las cuales se podría desarrollar un estudio para encontrar el origen de estas diferencias o, al menos, ser capaz de compararlas correctamente. Este trabajo hará uso de la aplicación de conocimientos matemáticos (álgebra lineal y cálculo sobre matrices) y de lógica, con soporte de la estadística, sobre un caso real, encontrando una metodología correcta desde donde iniciar la comparación. Se busca obtener una base teórica, puramente matemática, con capacidad de ser aplicable a más elecciones, en diferentes tiempos y territorios. 1 Trabajo final de grado Gibran Roye Muiños Se obtendrán metodologías y procesos de cómo se pueden comparar diversas elecciones en el tiempo, estudiando las características de cada una. Cabe destacar que existen muchísimos más métodos y aproximaciones que se podrían utilizar más allá de los usados en este estudio, por lo que se priorizará conseguir una metodología correcta y sólida. Durante el proyecto, se irán definiendo los criterios necesarios en cada parte del proceso, como por ejemplo, las distancias escogidas para calcular la distancia entre matrices o qué tratamiento se le va a dar a las observaciones missings en cada situación, y se acompañará el desarrollo de ideas con argumentos convenientes y demostraciones. Se realizará el estudio con soporte de datos reales, elecciones realizadas en España en dos años cercanos. Se elegirán votaciones pertenecientes al territorio español con el fin de tener la mayor cantidad de información posible sobre el caso. Dentro del territorio, se buscarán datos electorales de elecciones realizadas a nivel autonómico con el fin de mantener la cantidad y la variabilidad de los datos a un nivel ajustado de sencillez inicial para poder desarrollar correctamente el análisis. Se hará uso de la herramienta R (lenguaje de programación) para realizar los cálculos y análisis pertinentes. Se ha elegido esta herramienta debido a su capacidad y facilidad para el tratamiento y análisis de datos, desde la lectura de bases hasta la obtención de conclusiones. Para la redacción se combinará esta herramienta con Látex, a través de un archivo Sweave. Látex permite la generación de una muy buena redacción de documentos con elementos matemáticos como formulación y tablas, además, permite la replicación sencilla del análisis con otro set de datos de forma automática y veloz. Sweave permitirá juntar la codificación de R con la codificación de Látex en un solo archivo, y podrá ser compilable para generar archivos PDF. Finalmente, se obtendrán conclusiones y se dejará determinada una base matemática que podrá ser ampliada hacia varios casos según la necesidad existente. 2 Trabajo final de grado Gibran Roye Muiños Median :0.04087 Median :0.07097 Median :0.03151 Median :0.004551 Mean :0.04439 Mean :0.08058 Mean :0.03425 Mean :0.005517 3rd Qu.:0.05807 3rd Qu.:0.09397 3rd Qu.:0.03946 3rd Qu.:0.007143 Max. :0.17088 Max. :0.41414 Max. :0.13265 Max. :0.032967 Abstención Min. :0.03158 1st Qu.:0.14807 Median :0.17986 Mean :0.18229 3rd Qu.:0.21629 Max. :0.38173 Y en el 2017, están representados en el Parlament 7 partidos: [1] "C's" "JUNTSxCAT" "ERC-Cat Sí" "PSC" [5] "Cat Comú-Podem" "CUP" "PP" "Resto" [9] "Votos en blanco" "Abstención" Distribuidos de la siguiente forma en el connjunto de todo el territorio: C's JUNTSxCAT ERC-Cat Sí PSC Min. :0.00000 Min. :0.02945 Min. :0.03846 Min. :0.00000 1st Qu.:0.06224 1st Qu.:0.23445 1st Qu.:0.18525 1st Qu.:0.03501 Median :0.10158 Median :0.32000 Median :0.21922 Median :0.05517 Mean :0.11944 Mean :0.31543 Mean :0.22312 Mean :0.06266 3rd Qu.:0.16242 3rd Qu.:0.39914 3rd Qu.:0.25666 3rd Qu.:0.08094 Max. :0.42308 Max. :0.68085 Max. :0.44547 Max. :0.20705 Cat Comú-Podem CUP PP Resto Min. :0.00000 Min. :0.00000 Min. :0.00000 Min. :0.000000 1st Qu.:0.02023 1st Qu.:0.03343 1st Qu.:0.01465 1st Qu.:0.004847 Median :0.03030 Median :0.04647 Median :0.02252 Median :0.008981 Mean :0.03354 Mean :0.05397 Mean :0.02504 Mean :0.009225 3rd Qu.:0.04396 3rd Qu.:0.06429 3rd Qu.:0.03191 3rd Qu.:0.012768 Max. :0.10714 Max. :0.23711 Max. :0.14941 Max. :0.046512 Votos en blanco Abstención Min. :0.000000 Min. :0.03896 1st Qu.:0.002082 1st Qu.:0.12437 Median :0.003703 Median :0.15085 9 Trabajo final de grado Gibran Roye Muiños Mean :0.004357 Mean :0.15322 3rd Qu.:0.005651 3rd Qu.:0.17860 Max. :0.043011 Max. :0.35630 Los conjuntos de datos cuentan con una primera columna de datos de tipo caracter con la función de identificador (nombre de municipio). Las siguientes columnas con datos de tipo numérico situados entre 0 y 1 que hacen referencia a la proporción de votos dirigidos desde cada municipio a cada partido, votos nulos, votos en blanco o porcentaje de abstención. El 2015 cuenta con 947 municipios donde los votos irán distribuidos entre 9 columnas. El 2017 cuenta con 947 municipios donde los votos irán distribuidos entre 10 columnas 3.2. Reducción de la dimensión y visualización Análisis de componentes principales: teoría El objetivo ahora es poder visualizar los resultados electorales. Para la representación gráfica, cada variable supone una dimensión, por lo tanto, la primera variable se mostraría en el eje X, la segunda en el eje Y y una tercera variable podría ser observada en el eje Z. No obstante, no es posible visualizar más variables al mismo tiempo con este método por lo que es necesario reducir las dimensiones del conjunto de datos. Además, no solo tendrá otras ventajas la reducción de las dimensiones debido a que algunas métricas utilizadas en métodos y modelos estadísticos se pueden ver afectados cuando se aplican sobre varias dimensiones, sino que también reducirá el número de variables de distintos conjuntos de datos a dos o tres sin importar el número inicial de variables con el que contaban, es decir, contarán con el mismo número de variables. Para ello, se procederá a realizar el ACP, Análisis de Componentes Principales. El proceso se inicia con la centralización de las variables. Esto se realiza mediante el cálculo del valor medio de las variables, obteniéndose así un valor medio en cada eje. Luego, se obtiene el vector formado por el valor medio de todos los ejes: Vi= (P1, P2, ..., Pn); i= 1,2, .., n(variables) Este vector, que representa el valor medio de todas las variables, es llevado al punto 0 (donde todas las coordenadas de los ejes son 0) quedando así todas las variables centradas al tener el punto medio entre el origen de todas las dimensiones. No obstante, la posición de los datos entre ellos no ha sido cambiada. Esto permitirá que una vez centrados todos los datos, se cree una recta de regresión que pase por el punto 0. Para ello, se crea una 10 Trabajo final de grado Gibran Roye Muiños recta ya desde el punto 0 y se rota sobre este punto; esta recta rotará hasta conseguir el máximo ajuste de los datos que pueda. Para definir el máximo ajuste de la recta, se proyectan los puntos de las observaciones en la recta a partir de aquel punto de la recta que más cerca está de la observación. Luego, se pueden mesurar las distancias entre el punto original y el punto proyectado; entonces, se buscaría rotar la recta que hiciera que la suma de todas las distancias fuera mínima, es decir, existe menos error entre el punto proyectado y el punto original en todo el conjunto de datos. De forma alternativa y para un cálculo más sencillo, también se puede intentar maximizar la distandia de la observación proyectada frente al punto de origen. Entonces, se extraerían todas estas distancias obtenidas desde cada observación y se elevarían al cuadrado para conseguir siempre valores positivos y que las distancias no se compensen entre sí. Sumadas estas distancias, se obtiene la suma de las distacias al cuadrado, o en inglés, sum of squared distances (SS), la cual se quiere maximizar. SS =Pn i=1(xi−xpi)2 El resultado obtenido, la recta, será el componente principal 1. Entonces, esta línea busca resumir la máximo la variabilidad de las variables dentro de sí misma, ya que resulta de ser una proporción de cada variable original. Luego cuando esta proporción es elevada para una variable original con respecto a esta recta, quiere decir que la variable original a la que se hace referencia tiene mucho peso a la hora de explicar ese resultado; si se tiene en cuenta que la recta resume el comportamiento de todas las variables en ella misma, esto quiere decir que la variable original a la que se hace referencia tiene mucha capacidad de resumir todo el conjunto de datos. Es decir, las componentes principales creadas son nuevas variables producidas a partir de la combinación lineal de variables ya existentes. Los nuevos vectores unitarios ( denominados así a los vectores de norma 1) pertenecientes a las PC (componente principal ) son denominados vectores singulares o eigenvector. La raíz del eigenvector del PC1, se llama valor singular del PC1. Una vez obtenida la PC1, se puede obtener la PC2 mediante la creación de un eje ortogonal al PC1, obteniendo así, mediante la rotación de los nuevos ejes, otra vez los ejes x e y formados por las nuevas variables capaces de explicar más informacón utilizando solo dos de ellas. Luego, las observaciones definidas por las variables previas quedarán visualizadas mediante nuevas coordenadas en un nuevo conjunto de datos. Se pueden conseguir la tercera dimensión siguiendo el mismo proceso y creando un eje perpendicular a los dos ejes previos. Cabe destacar que el número máximo de componenetes que se podrían crear equivaldría al mínimo entre el número total de variables y el tamaño de la muestra en el conjunto de datos. No obstante, en este caso solo interesaría conseguir entre dos y tres 11 Trabajo final de grado Gibran Roye Muiños ejes para poder ser representados gráficamente. Se puede conocer también la capacidad que ha tenido cada componente de resumir la variabilidad. Para ello sería necesario conseguir la SS calculada previamente para cada componente y dividirla por n-1, lo cual permite convertirla en variación respecto al origen donde n es el tamaño de la muestra. El porcentaje obtenido muestra la variación total que rodea a la componente principal. Es decir, este porcentaje mostraría la cantidad de información de las variables originales que se expresa en las nuevas y permitiría establecer el número mínimo de nuevas dimensiones necesarias para no perder demasiada información del conjunto de datos original. Finalmente, cabe destacar que como todas las variables quedarían reflejadas en un subconjunto mucho más pequeño, si el resultado muestra una agrupación de observaciones podría indicar la posible presencia de grupos muy parecidos entre sí, dando lugar indirectamente a un proceso de clustering (clasificación). Un último concepto que cabe definir antes de proceder a la realización del ACP, es la distancia que se utilizará como métrica. La distancia típica utilizada más cercana al concepto más común de distancia es la distancia euclídea. Esta distancia, además, tiene un cálculo sencillo, siendo este el siguiente: dE(P, Q) = qPn i=1(pi−qi)2 No obstante, se procederá a utilizar la Distancia de Hellinger. Con el objetivo de obtener resultados más interpretables y que mejoren los resultados de los procesos futuros. Esta distancia se expresa de la forma siguiente: h(P, Q) = 2 ·||√P−√Q|| Sin embargo, esta distancia se obtiene de forma automática al calcular la distancia euclídea si se transforman los datos iniciales. La primera transformación necesaria de estos datos será la transformación de cada dato en su raíz y multiplicación de toda la matriz de datos por 2. Esta transformación, dará lugar a un nuevo conjunto de datos manteniendo la misma estructura de la base, no obstante, cuando un proceso como el ACP realize el cálculo de distancias, estará calculando la distancia de Hellinger en vez de la distancia Euclídea. La razón del uso de esta distancia es su equivalencia a la distanciade Rao. La distancia de Rao cuenta con una característica interesante y es que, cuando se calcula la distancia sobre dos puntos próximos entre sí, la mayoría de distancias estadísticas tienden a asemejarse a la distancia de Rao. Si supusiéramos que los puntos sobre los cuales queremos 12 Trabajo final de grado Gibran Roye Muiños calcular las distancias se encuentran dentro de una esfera, la mayoría de distancias calcularían una recta entre pares de puntos, mientras que la distancia de Rao calcularía la longitud del arco de la esfera entre un punto y otro. Como resultado, entre puntos muy cercanos, ambas formas de calcular la separación entre puntos se aproximan mucho. Es debido a esto que se ha elegido una distancia equivalente a la distancia de Rao. Análisis de componentes principales: aplicación Se dispone a hacer el análisis de componentes principales (ACP) de la base de datos. Este análisis se basa en crear nuevas variables a partir de la combinación de las variables continuas, con la peculiaridad de que estas nuevas son las que recogen mayor inercia al proyectar sobre estas la nube de puntos multidimensional, formada por los individuos de la muestra (en este caso los municipios de la comunidad autónoma) que tienen como coordenadas los valores obtenidos en las variables cuantitativas (todas en este estudio). El objetivo de este análisis es tener una visión de la base de datos con una dimensionalidad reducida, lo suficientemente reducida como para poder representarla gráficamente (2D O 3D). Con este resultado, además, dará a conocer características de las observaciones que vengan explicadas a través de la variabilidad de los datos, por lo tanto, servirá como una primera fotografía de la situación en la que se encuentran. En el caso actual, se llevará a cabo el análisis sobre los conjuntos de datos del 2015 y 2017. El objetivo en este apartado será solo obtener estas fotografías anteriormente mencionadas, por lo que, aunque se pueda realizar alguna comparación entre ambos años, todavía no sería completamente correcto compararlos. Para llevar a cabo el análisis, se utilizará la función PCA de R incluida en el paquete FactoMineR, [1]. La documentación de este paquete define que esta función realiza el análisis de componentes principales con elementos suplementarios, los cuales serán introducidos en este caso al ser necesario tener en cuenta la introducción de futuras variables en el análisis de cada conjunto de datos. Con respecto al tratamiento de missings, la función realiza el tratamiento de variables missing a través de su sustitución por el valor medio de la columna, aunque no será necesario que se realice este proceso al haber realizado el tratamiento de missings anteriormente. Como resultado, se requeriá de la siguiente función para la realización del análisis: acp15<−PCA(data15, graph =T, ncp = 3) Donde data15 es la matriz de datos (posteriormente se aplicará a data17), graph = F bloquea la realización de gráficos, los cuales se generarán posteriormente; ncp = 3 indica las dimensiones que se obtendrán, donde se limitará a 3 para poder ser visualizadas. Posteriormente se analizan los componentes principales obtenidos; para ello, se comenzará 13 Trabajo final de grado Gibran Roye Muiños por conocer el porcentaje de variación incluida en cada componente a través de gráficos scree que permiten su visualización (en verde los valores por encima de la media): 123456789 Valores propios de los CP acumulados Componentes principales Valores propios acumulados 0 20 40 60 80 100 Valor por encima de la media Valores por debajo Figura 3.1: Variabilidad acumulada explicada 2015 Para el 2015, se puede observar que dos componentes principales son capaces de explicar de forma conjunta un 60 por ciento de la variabilidad, mientras que para 3 componentes se explicaría alrededor del 70 por ciento. Aún y no estar más cerca del 100 por ciento como sería deseable, debería ser suficiente información comprendida entre las dos y tres dimensinoes para resumir el conjunto de variables correctamente. También para el 2015 será interesente conocer los valores propios de forma individual ya que resulta también beneficioso para los resultados contar con valores propios que se encuentren por encima de la media. En el siguiente gráfico, se puede observar que solo los dos primeros componentes principales se sitúan por encima de la media. 14 Trabajo final de grado Gibran Roye Muiños 123456789 Valores propios de los CP Componentes principales Valores propios 01234 Valor por encima de la media Valores por debajo Figura 3.2: Valores propios 2015 Y a continuación se analiza el caso del 2017: 15 Trabajo final de grado Gibran Roye Muiños 12345678910 Valores propios de los CP acumulados Componentes principales Valores propios acumulados 0 20 40 60 80 100 Valor por encima de la media Valores por debajo Figura 3.3: Variabilidad acumulada explicada 2017 A diferencia del caso anterior, ahora con dos dimensiones se contiene menos del 60 por ciento de la variabilidad y con tres dimensiones solo se superaría el 60 por ciento sin llegar al 70. Es decir, estos resultados tienen más dificultades para explicar el conjunto de variables originales utilizando solo dos o tres dimensiones. No obstante, se observa en el siguiente gráfico que se cuenta con un valor propio muchísimo por encima de la media, mientras que además de él solo el segundo y tercer valor propio también superan la media. 16 Trabajo final de grado Gibran Roye Muiños 12345678910 Valores propios de los CP Componentes principales Valores propios 01234 Valor por encima de la media Valores por debajo Figura 3.4: Valores propios 2017 Finalmente, se muestran los resultados obtenidos utilizando dos dimensiones. En el eje de X se encuentra el primer componente principal que explica el 46 por ciento de la variabilidad y en el eje de Y se encuentra el segundo componente, el cual abarca el 13 por ciento de la variabilidad. El mapa de puntos muestra las coordenadas de todos los individuos (municipios) en estos nuevos ejes: 17 Trabajo final de grado Gibran Roye Muiños −5 0 5 −5 0 5 Dim.1 Dim.2 Mapa de individuos Figura 3.5: Mapa de individuos 2015 Como se puede observar, se han marcado a los individuos con cuatro colores según el tamaño del municipio. El tamaño del municipio ha sido obtenido desde la misma fuente que los datos (Instituto de Estadística de Cataluña). Para designar el color a los individuos se ha definido la partición según el cuantil en el que se encuentran: Azul, individuos situados en el primer cuartil, es decir, con menos de 313 habitantes. Verde, individuos situados en el segundo cuartil, es decir, con entre 314 y 946 habitantes. Amarillo, individuos situados en el tercer cuartil, es decir, con entre 947 y 3747 habitantes. Rojo, individuos situados en el cuarto cuartil, es decir, con más de 3748 habitantes. Realizando el mismo mapeo para el 2017, se obtiene una nube de puntos muy diferente a la anterior. No obstante, cabe recordar que todavía no es correcto comparar estos dos 18 Trabajo final de grado Gibran Roye Muiños Figura 3.13: Profiling 2 2017 Figura 3.14: Profiling 3 2017 Finalmente se pueden extraer resultados interesantes de las características comunes entre subconjuntos de datos en ambos períodos estudiados: 25 Trabajo final de grado Gibran Roye Muiños En ambos períodos, siempre se encuentran claramente separados por sus características entre los tres grupos los votos en blanco, la CUP y el conjunto Cs, PSC PP, Comuns y abstención. Es decir, frecuentemente se podrían formar tres grupos de individuos bien diferenciados por sus características los votos en blanco (en desacuerdo con los partidos presentados), el conjunto de votos a partidos que se encuentran en el resto del territotio español además de Cataluña (Cs, PSC, PP y Comuns) además de la abstención; y finalmente otro grupo más para la CUP, partido independentista que se diferencia más de otros partidos con el mismo objetivo por estar más cerca de un extremo y que no ha querido formar parte del bloque independentista en el 2015 para formar Junts pel Sí. Luego, en referencia a los partidos independentistas, Esquerra, JxCat y Junts pel Sí también se pueden encontrar resultados interesantes. En el 2015, las características de JxSí lo situaban entre el mismo grupo de la CUP y el grupo de los votos en blanco. Entonces, en el 2017 con la separación de los partidos, se puede ver que se han separado de siguiendo las mismas características que antes, ahora JxCat se sitúa solamente en el mismo grupo que el partido CUP, mientras que ERC se sitúa todavía entre ambos grupos igual que antes. Finalmente, destacar que los resultados muestran la separación de los municipios claramente entre independentistas y unionistas, manteniéndose en ambos años y cuyo resultado está claramente influenciado por los eventos sociales y políticos del entorno que rodea a los datos. 26 Capítulo 4 COMPARACIÓN DE RESULTADOS Ahora que ya se cuenta con los dos conjuntos de elecciones de forma separada y se conoce su contexto y la descripción estadística de los datos, se procederá a comparar estos resultados. Si se intentara comparar directamente el movimiento de los individuos de las elecciones de un año a otro, esta fórmula sería correcta únicamente en el caso de ni partidos ni individuos hayan cambiado. El cambio en los partidos, al cual se hace referencia, es que un partido cambie su ideología o rumbo, lo cual pasa frecuentemente debido a que siempre intentarán adapatarse a los cambios de la sociedad con tal de llamar la atención de un número mayor de votantes y hacer crecer su porcentaje de votos. Por lo tanto, el cambio en los conjuntos de datos de ambos períodos viene porque si un individuo quiere votar a un partido con ciertas características, por ejemplo podría ser un partido de derechas, un partido preocupado por cierto problema social, un partido conservador, etc. el partido que cumple estas características en el año x, posiblemente en la siguiente votación aún y aunque se busquen las mismas características, será otro partido el que las cumpla. Como resultado, los partidos vienen caracterizados más que por sus nombres y etiquetas, por características ocultas generadas a partir de la actividad histórica del partido y de sus promesas de futuro. Como resultado, el objetivo será colocar ambos conjuntos de datos en la misma situación. Como los partidos representados pueden haber cambiado de un período a otro y además para permitir su visualización y realizar la comparación a partir de allí, los conjuntos de datos sobre los que se trabajará serán los obtenidos a partir de las herramientas de ACP. Es decir, para cada conjunto de datos electorales se tendrá una matriz de datos X, de dimensiones nxr, nhará referencia a los municipios, por lo que se tendrán tantas filas como número de municipios, mientras que rhará referencia a las coordenadas del ACP, es decir, dos columnas, una para la dimensión 1 y otra para la dimensión 2 que contendrán 27 Trabajo final de grado Gibran Roye Muiños la coordenada de cada municipio en el mapa de individuos de las componentes principales. 4.1. Centralización Ahora, una vez se cuenta con ambos conjuntos de datos nuevos. Estos datos se encuentran separados en el espacio debido al movimiento en el tiempo que ha afectado a todo el conjunto de datos. Para facilitar la lectura y a modo de generalizar, al conjunto de datos de 2015 se le llamará por la matriz X, mientras que al conjunto de datos de 2017 se le llamará por la matriz Y. Lo primero, será poder poner un conjunto sobre otro para poder compararlos, por lo que se trasladarán tanto Xcomo Yal mismo punto, el origen. Para centralizar la matriz de datos X o Y, se hará uso del vector 1, compuesto por tantas filas como individuos tenga la matriz que se quiere centrar y solo una columna, todos sus elementos son 1:         111 = 1 121 = 1 ··· 1N1= 1         se comienza por la multiplicación del vector 1 transpuesto por la matrix XoY. El resultado será una nueva matriz con una sola fila y tantas columnas como coordenadas. Los valores de cada coordenada de la única fila es el sumatorio de todos los valores anteriores de aquella fila. El siguiente paso será la multiplicación del vector 1 por la matriz resultante anteriormente con el fin de obtener el mismo resultado de antes pero en vez de tener una fila se tendrían tantas filas como individuos, todas iguales entre ellas. Si entonces se divide esta matriz por N (número de municipios), entonces se conseguiría para cada coordenada el valor medio. Por otro lado, se debe realizar la multiplicación de la matrix identidad por la matrix XoY, como resultado, se conseguiría la misma matriz XoYsolo con valores en la diagonal. Finalmente, se restaría esta matriz con la obtenida anteriormente. El resultado final sería la matrix inicial con la que se contaba habiéndola restado por el valor medio de cada coordenada. Resumiendo este procedimeinto, sería el siguiente: (I−1 N11t)·X=˜ X 28 Trabajo final de grado Gibran Roye Muiños Figura 4.1: Centralización Procedimiento realizado igual para XeY. El siguiente paso, constará en corregir el ajuste de los partidos mediante la rotación de la matriz. 4.2. Rotación Este apartado buscará rotar ˜ Y de tal forma que encaje al máximo con ˜ X. Este procedimiento es equivalente a rotar a ˜ X para encajar con ˜ Y. Cabe destacar además que ˜ X e ˜ Y son conjuntos fijos, constantes. Como se requiere minimizar la separación de las matrices, y teniendo en cuenta que se quiere rotar ˜ Y, se utilizará la norma de matrices por simplicidad: Φ(S) = || ˜ X−˜ Y S||2 Teniendo en cuenta que la norma de matrices es: ||A||2=tr(AA2) = Piα(αiα)2 Se desarrollará la fórmula: Φ(S) = tr[( ˜ X−˜ Y S)( ˜ X−˜ Y S)t] = tr(˜ X˜ Xt+˜ Y˜ Yt−˜ Y S ˜ Xt−˜ XSt˜ Yt) = tr(˜ X˜ Xt) + tr(˜ Y˜ Yt)−tr(˜ Y S ˜ Xt)−tr(˜ XSt˜ Yt) Con tr(˜ Y S ˜ Xt) = tr(˜ Y S ˜ Xt)t; entonces: 29 Trabajo final de grado Gibran Roye Muiños Φ(S) = tr(˜ X˜ Xt) + tr(˜ Y˜ Yt)−2tr(˜ Y S ˜ Xt) Para reducir al máximo el espacio entre ˜ X e ˜ Y se debe minimizar Φ(S). No obstante, minimizar Φ(S)equivale a maximizar Ψ(S): Ψ(S) = tr(˜ Y S ˜ Xt) = tr(˜ Xt˜ Y S) Al ser ˜ X e ˜ Y fijos, ˜ Xt˜ Yes constante (C) de dimensión rxr. Esta matriz C se puede descomponer en sus valores singulares: C=ULV t, con L siendo una amtriz diagonal (l1, l2,··, lr)y V y U siendo matrices de vectores propios de ˜ Yt˜ X˜ Xt˜ Yy˜ Xt˜ Y˜ Yt˜ X. Antes de proseguir, se definirá la descomposición en valores singulares. Teniendo presente inicialmente a A∈nMmxn(R),k=min(m, n)yr=rango(A)con (0≤r≤k), entonces puede demostrarse que las matrices cuadradas y simétricas AAtyAtAposeen todos los valores propios positivos y con la misma multiplicidad. Si A es simétrica entonces AAt=AtA=A2. Si A es ortogonal, entonces sus valores singulares serán todos ellos iguales a 1 ya que AAt=AtA=In Luego, si A∈Mmxn(R)yλun valor propio de la matriz AAto de AtA, entonces el valor l=√λdiremos es un valor singular de la matriz. A y Attienen los mismo valores singulares. Entonces, sea Amxn(R)con 0≤r=rango(A). Luego, existen unas matrices U∈ Mmxr(R),L∈Mrxr(R)yV∈Mnxr(R)tales que: A=ULV t Donde; Les una matriz diagonal, L=diag(l1,···, lr), con l1≥ ·· ≥ lr≥0donde li=√λipara unos valores λi≥0que son los valores propios no nulos correspondientes a la matriz AAtoAtA, considerados tantas veces como indique su multiplicidad; U, escrito a partir de sus r vectores columna, U= (u1,··, ur), resulta que estos son vectores unitarios y ortogonales entre sí, es decir, son vectores propios de AAtcorrespondientes a los valores propios de λi; y V también escrita a partir de sus vectores columna, V= (v1,··, vr), resulta que estos son vectores unitarios y ortoganles entre sí, es decir, son vectores propios de AtAcorrespondientes a sus valores propios λi. Finalmente, se le denominará a A=ULV t como la descomposición de la matriz A en valores singulares. La expresión conseguida puede escribirse en términos de los vectores columna de U y V así como los vectores singulares de licomo: A=Pr i=1 liuivt iDescomposición espectral generalizada de la matriz A 30 Trabajo final de grado Gibran Roye Muiños Entonces, siguiendo con el ejercicio, se obtiene: Φ(S) = tr(ULV tS) = tr(LV tSU) Si denominamos VtSU =T, entonces Φ(S) = tr(LT)equivalente a Φ(S) = lijtji = Pr i=1 liti debido a que Pr j=1(tij)2= 1 Además, se puede conseguir que Ψ(S) = Pr i=1 litii ≤Pn i=1 lien el caso en que T=I. Pero, si T=I, entonces I=VtSU; por lo tanto, V Ut=S. Finalmente, para conseguir reducir al máximo el espacio entre ˜ X e ˜ Y y así conseguir la rotación que mejor encaje ambos conjuntos de datos, se deberá conseguir la matriz S equivalente a V Utsiendo V y U matrices de vectores propios. Esta matriz se deberá aplicar sobre ˜ Y si se sigue el procedimiento descrito. 4.3. Visualización y comparación Finalmente, se contará con dos conjuntos de datos: ˜ X compuesto por los datos del 2015 transformados a coordenadas de dos dimensiones según los resultados del análisis de componentes principales realizado y habiendo sido centrado al punto de origen tras restar el valor medio de las coordenadas a sus observaciones; e ˜ YS, la cual representa los datos del 2017 y que, además de haber pasado por el mismo procedimiento que ˜ X, también se ha multiplicado por la matriz S con tal de rotar la matriz y conseguir la máxima cercanía entre ambos resultados El siguiente paso será la representación gráfica de ambos conjuntos de datos adapatados en un mismo plano, con la indicación del movimiento de los individuos en el espacio. 31 Trabajo final de grado Gibran Roye Muiños −6 −4 −2 0 2 4 6 −6 −4 −2 0 2 4 6 Cambio resultados electorales Dimensi'on 1 Dimensi'on 2 2015 2017 Figura 4.2: Comparación de resultados Esta figura muestra a todos los municipios representados en el espacio de dos dimensiones. Ambos conjuntos de datos fueron representados inicialmente en las dos dimensiones gracias al procedimiento de análisis de componentes principales. El procedimiento representa a cada individuo en las dos dimensiones a través de coordenadas obtenidas sobre nuevos ejes X e Y. Luego se centralizaron ambos conjuntos de datos en el punto de origen. Finalmente se procedió a rotar el conjunto de 2017 para conseguir el máximo encaje con el conjunto de 2015. El resultado final ha sido este mapa de puntos donde se muestra en azul claro la nueva localización de los municipios del 2015, y en verde, la nueva localización de los datos del 2017. El tamaño de los puntos se ha ajustado al tamaño de los municipios (valor obtenido también desde el IDESCAT [9]), siendo este proporcional al tamaño del mayor municipio, que en este caso es Barcelona. No obstante, debido a la gran diferencia entre el municipio de mayor tamaño y lo de menos, se ha reducido el tamaño representado de Barcelona a la mitad y se ha aumentado el de los menores municipios hasta ser visibles en la nube de puntos. A modo de comprobación de que el procedimiento sea correcto, se ha realizado otra vez todo el procedimiento sustituyendo los datos del 2017 por los del 2015 también y se ha obtenido una nuve puntos de un solo color, indicando que todos 32 Trabajo final de grado Gibran Roye Muiños los municipios se encuentran situados igual e indicando que se cumple este check de errores. Como se puede observar también en la figura, se ha representado con flechas el movimiento de los mayores municipios de un año a otro. Para ampliar esta información, a continuación se muestra el cambio de coordenadas de los 10 municipios más grandes y más pequeños: Cambio mayores municipios Rank Municipio 2015 2017 1 Barcelona (2.67,-0.58) (2.98,-0.54) 2 Hospitalet de Llobregat (4.89,-0.80) (5.20,-0.04) 3 Terrassa (3.31,-0.64) (3.49,-0.70) 4 Badalona (4.39,-0.32) (4.50,0.27) 5 Sabadell (3.10,-0.90) (3.34,-0.88) 6 Lleida (2.70,0.45) (2.63,0.72) 7 Tarragona (3.63,-0.30) (3.74,0.34) 8 Mataró (3.18,-0.47) (3.19,-0.20) 9 Santa Coloma de Gramenet (5.46,-0.96) (5.69,-0.12) 10 Reus (2.80,-0.13) (2.93,0.52) Cambio menores municipios Rank Municipio 2015 2017 938 Bausen (3.21,1.83) (4.30,0.74) 939 Savallá del Comtat (-1.43,-0.05) (-1.32,-1.08) 940 Quar (-1.26,-0.32) (-4.22,1.88) 941 Senan (-2.42,-1.78) (-2.60,-1.31) 942 Cava (-3.58,0.65) (-4.84,1.94) 943 Forés (-1.31,0.50) (0.11,3.53) 944 Fígols (-1.28,3.34) (-0.32,2.02) 945 Febró (-1.73,-3.78) (-2.77,-1.07) 946 Sant Jaume de Frontayá (-3.42,-2.93) (-3.00,-0.33) 947 Gisclareny (-4.58,-2.70) (-4.26,-0.77) De estos cuadros y de la visualización gráfica se puede destacar que los municipios grandes tienden a moverse hacia un valor mayor de la componente 1, mientras que el comportamiento de los municipios más pequeños es más inestable. No obstante, estos resultados no muestran más información que la cercanía entre los votos de los municipios y si se han desplazado una gran distancia entre un período y otro (donde se ve que los 33 Trabajo final de grado Gibran Roye Muiños municipios de mayor tamaño tienden a desplazarse menos distancia). Por eso, para conseguir realmente resultados de esta visualización, deberán ser representados los partidos. La nube de puntos conseguida se encuentra dentro de una circumferencia, donde en algún punto deberían estar situados los partidos, los cuales también se pueden mover de un año a otro indicando su cambio de rumbo de acuerdo a la percepción de los ciudadanos. Si por ejemplo un municipio dedicase en una votación de un año concreto el 100 por ciento a un partido, ese municipio se encontraría situado en las mismas coordenadas que el el partido al que vota. El objetivo de tener los partidos representados es ver si los municipios que ya han sido representado tienden a desplazarse hacia ellos o alejarse. Un resultado que es fácil esperar es que los partidos se encuentren alejados de la nube de puntos, al ser estos el caso extremo de la situación. Para representar a los partidos políticos, se generarán nuevos municipios ficticios que dedidacrán el 100 por ciento de sus votos al partido que quieren representar. Estos municipios ficticios no se pueden haber introducido junto al resto para generar los anteriores procesos de ACP o clustering porque podrían influenciar en los resultados, por lo que se aplican posteriormente los mismo procedimientos sobre ellos para luego ser visualizados en el mismo plano. Los municipios ficticios tendrán el mismo nombre del partido que representan. 34 Trabajo final de grado Gibran Roye Muiños  1 n n X i=1 (ri−zi) 2 = 1 n1t nXQt p−Y Qt q =1 n21t nXQt p−Y Qt qQpXt−YqYt1n =1 n2XXt1n1t n+1 n2Y Y t1n1t n−2 n2Y QqtQpXt1n1t n(5.14) Si llamamos Hn=In−1 n1n1t n, combinando (5.13) y (5.14) obtenemos s2 |fp(x)−fq(y)|=1 nXXtHn+1 nY Y tHn−2 nY QqtQpXtHn =1 nXtHnX+1 nYtHnY−2 nQqtQpXtHnY = (SXX )+(SY Y )−2QpSXY Qqt(5.15) Donde SXX =1 nXtHnX SY Y =1 nYtHnY(5.16) Es la estimación por el método de los momentos de la matriz de varianzas y covarianzas de X1, . . . , XpyY1, . . . , Yqrespectivamente, mientras que SXY es una estimación de la matriz de covarianzas entre ambos grupos de variables, X1, . . . , XpeY1, . . . , Yq SXY =1 nYtHnY(5.17) Por tanto minimizar (5.15) va a ser equivalente a maximizar la expresión QpSXY Qqt(5.18) Para ello efectuemos la descomposición de SXY ∈Mp×q(R), en valores singulares: SXY =ULV t(5.19) Donde, sin pérdida de generalidad, podemos suponer l1,≥l2,≥. . . ≥lm>0,m≤ m´ın{p, q},Ues Mp×m(R),Ves Mq×m(R)y tales que UtU=ImyVtV=Im, y maximizar (5.18) puede expresarse como 41 Trabajo final de grado Gibran Roye Muiños QpSXY Qqt=QpULV tQqt = m X i=1 li< wi, zi> = m X i=1 li(5.20) Donde wi=Qpuiyzi=Qqvi,i= 1, . . . , m. Además, al ser Qp∈Vp(Rk) = transforma vectores los vectores unitarios y perpendiculares ui∈Mp×1(R)en vectores unitarios y perpendiculares wi∈Mk×1(R). De forma análoga, al ser Qq∈Vq(Rk) = transforma vectores los vectores unitarios y perpendiculares vi∈Mq×1(R)en vectores unitarios y perpendiculares wi∈Mk×1(R). La igualdad en la desigualdad (5.20) se alcanzará si elegimos QpyQqde forma que Qpui=±Qqvii= 1, . . . , m (5.21) Hay infinitas posibilidades, una de ellas es escoger Qqde forma que Qq=1 ut iQt pvi Qpuiut iQt pi= 1, . . . , m (5.22) mientras que basta escoger Qpde manera que ut iQt pvi6= 0. Futura investigación Esta solución puede ser introducida en la práctica para el caso estudiado en este proyecto rompiendo con algunas limitaciones de la metedología anterior al poderse escoger cualquier otro conjunto de datos con características muy diferentes. Es por esto que resultaría interesante realizar de nuevo el proceso práctico utilizando métodos más generales como el recién explicado y ponerlos a prueba utilizando varios conjuntos de datos provenientes de espacios temporales muy diferentes para contar con mayores diferencias posibles. Finalmente, también se podrían ampliar los resultados conseguidos, además de generalizando los procedimientos, aumentando la capacidad de los métodos de visualización utilizados introduciendo una tercera dimensión, consiguiendo así representar mucha más información en el mapeo de datos realizado en el presente. 42 Capítulo 6 CONCLUSIONES Este proyecto ha buscado una metodología que permitiera la comparación de diferentes conjuntos de datos electorales de un mismo territorio en tiempos distintos. Para ello, se han escogido dos conjuntos de datos pertenecientes a las elecciones al Parlament de Catalunya de los años 2015 y 2017. Estos conjuntos de datos servirían como visualización y comprobación a medida que se iba desarrollando la metodología. Previamente a establecer el procedimiento de comparación entre ambos conjuntos se ha realizado un estudio por separado de ambos conjuntos de datos. Los resultados han mostrado que la cantidad de partidos representados en el Parlament de Catalunya varia alrededor de 7, a su vez, se ha realizado un proceso de clasificación (clustering) y profiling de los datos para tratar de identificar características comunes que, no solo unieran grupos de municipios, sino también grupos de variables (partidos). El resultado de los procesos de clasificación ha mostrado en ambos años una brecha clara entre dos conjuntos de partidos, los independentistas y los constitucionalistas. En el primer grupo se puede encontrar a Junts pel Sí, Esquerra, Junts per Catalunya y la CUP, mientras que en el segundo grupo se pueden encontrar a los otros partidos que además también se encuentran en el resto del territorio español, PP, PSC, Cs, CatComú y Cat sí que es Pot. Este resultado cumple con el contexto que rodea a los datos, ya que no solo ha sido una separación que se puede encontrar a lo largo de la historia, sino que en los últimos años se ha visto reforzada en la sociedad debido a la convocatoria de consultas y Referéndums y a la hoja de ruta independentista. Finalizando el análisis individual y ya preparando la comparación de ambos conjuntos de datos, se ha realizado el análisis de componentes principales, lo que permitiría la comparación de dos conjuntos de datos con diferente número de columnas, y la visualización de estos en un plano 2D. Esto ha creado dos nubes de puntos que representan a los municipios en sus nuevas coordenadas. A pesar de no dar mucha información y de no 43 Trabajo final de grado Gibran Roye Muiños poder ser comparadas las dos nubes de puntos, se han marcado los municipios con cuatro colores distintos según en que cuartil del tamaño de los municipios según población se encuentran. Los resultados de la coloración de los municipios han mostrado la separación de ideología política clara entre los cuatro grupos formados. Esta separación ha mostrado a los cuatro grupos situarse de forma ordenada, al estar el grupo de los municipios más pequeños en un lado, el de los más grandes en el otro y los grupos intermedios en el medio, más entremezclados entre sí. La metodología de comparación utilizada como base en este estudio, consta de acercar ambos conjuntos de datos lo máximo posible dentro del espacio euclídeo. Para ellos, primero se han centrado los dos conjuntos en el origen, restando a cada una de sus variables, el valor medio. Posteriormente se ha realizado una rotación de un conjunto sobre otro para conseguir el encaje máximo entre estos. Estos dos movimientos buscarían eliminar al máximo los cambios de los partidos y los municipios provenientes de los otros factores del ecosistema que influencia y afecta a los datos, aislando finalmente solo los cambios que ha generado el partido o el municipio en sí. El resultado, ha sido la representación gráfica de las dos nubes de puntos anteriores pero ahora situadas en la misma situación una sobre otra, mostrando algunos desplazamientos en el espacio de los municipios y distinguiendoles a partir de la población de cada uno. Se han introducido en este mapa también los partidos como nuevos puntos de la nube de puntos. Tanto municipios como partidos han sufrido cambios de un año a otro, al haber sido todos desplazados. Los municipios grandes han mostrado un desplazamiento corto, y en general los más grandes tienden a ir en la misma dirección, mientras que el desplazamiento de los pequeños es más acentuado y diverso. El desplazamiento de los grandes a veces va en concordancia con el desplazamiento de un partido, indicando que, o bien el municipio sigue la hoja de ruta del partido, o bien el partido realiza un buen trabajo de adaptación a los cambios de tendencia de la sociedad. Con respecto a los resultados encontrados en el análisis individual que separaban entre grupos independentistas y constitucionalistas, se puede ver en el nuevo mapa una cierta cercanía entre los partidos que pertenecen al mismo grupo y una clara separación entre grupos. Otra cercanía con la realidad es el acercamiento de Barcelona hacia las coordenadas del partido CatComú, el cual también en esa fecha, era el responsable de la gobernanza de Barcelona. Finalmente, se han introducido algunas ideas que podrían ayudar a mejorar y generalizar el proceso, el cual puede verse limitado en ciertos aspectos o dejar muchos criterios libres en algunas situaciones. Los nuevos conceptos introducidos se basan en la aplicación de una función sobre los distintos conjuntos de datos con distintos números de columnas que situaría directamente a todos los conjuntos en un mismo espacio, sin tener que ser este el origen. 44 Bibliografía [1] Lê, Sébastien and Josse, Julie and Husson, François and others, FactoMineR: an R package for multivariate analysis, journal: Journal of statistical software, vol.1, número 1, págs. 1-18, 2018. [2] Murtagh, Fionn and Legendre, Pierre Ward’s hierarchical clustering method: Clustering criterion and agglomerative algorithm, journal: arXiv preprint arXiv:1111.6285, 2011. [3] Cristina Gil Martínez ANÁLISIS DE COMPONENTES PRINCIPALES (PCA), https://rpubs.com/Cristina_Gil/PCa, 2018. [4] Kenneth Roy Cabrera Torres, Distancias y similitudes, https://labscn-unalmed. github.io/ecologia-numerica/guiones/distancias_disimilitudes_matriz_ discrepancia.html#la-distancia-de-hellinger-d_17, 2019. [5] IDESCAT, Eleccions al Parlament de Catalunya. Dades generals, http://www. idescat.cat/pub/?id=elepc&n=389&by=mun&t=201500&lang=es. [6] Gobierno de España, Censo Electoral de los Residentes Ausentes - CERA, http: //www.exteriores.gob.es/Consulados/HaMBURGO/es/ServiciosConsulares/ EnHamburgo/electorales/Paginas/CERA.aspx. [7] María Menéndez, Qué ha pasado en Cataluña desde la consulta del 9-N, http://www.rtve.es/noticias/20171004/ pasado-cataluna-desde-consulta-del-9-hasta-del-1/1583644.shtml, 2017. [8] IDESCAT, Altitud, superficie y población. Municipios https://www.idescat.cat/ pub/?id=aec&n=925&lang=es, journal: Idescat. Anuario estadístico de Cataluña. Altitud, superficie y población. Municipios. [9] Universidad La Laguna, Clustering jerárquico. [10] Josep M. Oller Sala, material vario sobre álgebra lineal e ideas base del trabajo. 45 Trabajo final de grado Gibran Roye Muiños [11] Oller, J.M., Satorra, A. Tobeña, A. Unveiling pathways for the fissure among secessionists and unionists in Catalonia: identities, family language, and media influence. Palgrave Commun 5, 148 (2019). https://doi.org/10.1057/s41599-019-0357-z 46