scieee AI-readable full text Open interactive document viewer

Análisis de resultados electorales a nivel municipal con relación a factores económicos

Aragón Ruiz, María

Abstract

Grado en Estadística

Full text

Facultad de Ciencias Trabajo Fin de Grado Grado en Estadística Análisis de resultados electorales a nivel municipal con relación a factores económicos Autora: María Aragón Ruiz Tutores: Bonifacio Salvador González Jesús M. Rodríguez Rodríguez Curso 2020/2021 ÍNDICE RESUMEN ...................................................................................................................................... 5 ABSTRACT ...................................................................................................................................... 5 Capítulo 1 INTRODUCCIÓN ............................................................................................................ 6 Capítulo 2 DATOS .......................................................................................................................... 8 2.1 OBTENCIÓN DE DATOS ........................................................................................................ 9 2.2 UNIÓN DE LOS DATOS ....................................................................................................... 11 2.3 DEPURACIÓN DE LOS DATOS............................................................................................. 13 Capítulo 3 ANÁLISIS DE LOS DATOS ............................................................................................ 16 3.1 EXPLORACIÓN DE LOS DATOS ........................................................................................... 16 Variables Categóricas .......................................................................................................... 16 Variables Numéricas ............................................................................................................ 17 3.2 RESULTADOS GENERALES .................................................................................................. 31 Análisis de Componentes Principales .................................................................................. 31 Análisis de Correlaciones Canónicas ................................................................................... 41 Análisis Clúster .................................................................................................................... 46 ANOVA para clúster ............................................................................................................. 51 3.3 RESULTADOS POR TIPO DE MUNICIPIO ............................................................................. 58 Análisis de componentes principales .................................................................................. 58 Análisis de Correlaciones Canónicas ................................................................................... 63 Regresión Logística .............................................................................................................. 69 Capítulo 4 CONCLUSIONES .......................................................................................................... 77 REFERENCIAS ............................................................................................................................... 78 LISTA DE FIGURAS ........................................................................................................................ 80 LISTA DE TABLAS.......................................................................................................................... 82 ANEXO DE CÓDIGOS .................................................................................................................... 83 OBTENCIÓN DE DATOS ............................................................................................................ 83 UNIÓN DE LOS DATOS ............................................................................................................. 83 DEPURACIÓN DE LOS DATOS .................................................................................................. 84 EXPLORACIÓN DE LOS DATOS ................................................................................................. 84 RESULTADOS GENERALES ........................................................................................................ 91 RESULTADOS POR TIPOS DE MUNICIPIO ............................................................................... 100 5 RESUMEN El objetivo principal de este proyecto fue analizar los resultados correspondientes a las elecciones municipales del 26 de mayo de 2019 en Castilla y León con relación a factores económicos. Habiéndose obtenido los datos de fuentes oficiales, se buscaron las relaciones entre los dos tipos de variables (electorales y económicas), mediante diferentes técnicas multivariantes. Todos los resultados se han obtenido mediante el entorno de desarrollo R- Studio, incluyendo la utilización de la herramienta Excel para el tratamiento de los datos. ABSTRACT Main objective of this study was to analyse the results of the municipal elections of 26 May, 2019, held in Castilla y León in relation to economic factors. The data were obtained from official sources, relation between electoral and economic variables were found using different multivariate techniques. Results were obtained using R studio development environment and Excel for data processing. 6 Capítulo 1 INTRODUCCIÓN La finalidad de este trabajo consiste en buscar relaciones, si es que existen, entre los resultados de las elecciones municipales del 26 de mayo de 2019 en Castilla y León, y diferentes factores económicos que se tendrán en cuenta. Tanto la información de la parte electoral, como la correspondiente a los datos económicos, se ha obtenido a partir de fuentes oficiales, como son: el Instituto Nacional de Estadística (INE), la Agencia Tributaria, el Servicio Público de Empleo Estatal (SEPE) y la Junta de Castilla y León. Una vez recopilados los datos anteriores, se han unido mediante la variable que identifica a cada municipio, realizando en ella los cambios necesarios para que la tabla resultante sea correcta. Por último, se ha procedido a la depuración de los datos, corrigiendo los errores producidos después de unir los archivos individuales, aunque únicamente se han tenido en cuenta los 456 municipios de la comunidad autónoma cuyo número de habitantes es superior a 500, ya que en las elecciones municipales se ha supuesto que en municipios pequeños se suele votar más en función de las personas que de los partidos. En aquellas variables que recogen resultados totales, como es evidente que presentan valores más altos en aquellos municipios con más habitantes, ha sido necesaria una transformación de los valores absolutos a relativos. Por ello, se han tomado los datos por cada 1.000 habitantes para todas las variables exceptuando las rentas, que recogen valores medios. Debido al desequilibrio existente en el número de habitantes, se ha tenido en cuenta la siguiente clasificación en tres tipos diferentes de municipios:  Rural: población menor que 2.000  Semirural: población entre 2.000 y 10.000  Urbano: población mayor que 10.000 Se observa que, aunque el primer grupo representa el 72% de los municipios totales, el segundo el 23% y el tercero el 5%, el porcentaje de población total que recoge cada uno de ellos es 15%, 21% y 64% respectivamente. Además, se ha observado que el número de habitantes del municipio ejerce una gran influencia en el valor del resto de variables. Por ello, todos los análisis se han realizado tanto para el conjunto inicial, como para los tres conjuntos separados por tipos. La primera técnica utilizada ha sido el Análisis de Componentes Principales, cuya finalidad es reducir el número de variables, intentando perder la menor cantidad de información posible. El propósito de este tipo de análisis dentro del trabajo ha sido encontrar de forma gráfica alguna de las relaciones buscadas. Por otro lado, se ha aplicado un Análisis de Correlaciones Canónicas, que resulta una técnica adecuada cuando las variables disponibles pueden dividirse en dos grupos en función de algún criterio, como es el caso de este trabajo, que se han dividido en electorales y económicas. Su principal utilidad reside en estudiar las relaciones entre ambos conjuntos. Al aplicarse los dos análisis anteriores, en el grupo inicial de municipios no se han encontrado relaciones de interés entre los dos tipos de variables. Además, se ha realizado un Análisis Clúster y un ANOVA para contrastar la igualdad de medias en los clústeres obtenidos. 7 El Análisis Clúster tiene como finalidad obtener particiones de los datos de tal forma que los inviduos dentro de cada una de ellas sean lo más similares posibles entre sí y que difieran lo máximo posible con respecto a los municipios del resto de particiones. En este caso se utilizaron el método k-means y el método jerárquico, una de cuyas diferencias es que en el primero de ellos se debe establecer a priori el número de grupos que se espera obtener. En este trabajo se consideraron 8 clústeres en ambos métodos, puesto que es el número óptimo que se obtenía para k-means, seleccionando finalmente el clustering jerárquico como el más adecuado. La conclusión obtenida del análisis clúster ha sido que, como ya se había supuesto, la población influye en el resto de variables, ya que en el clúster 1 se encuentran agrupados casi todos los municipios rurales, mientras que los municipios rurales y semirurales se encuentran repartidos de forma más equitativa entre los otros 7 clústeres. Para comparar las respuestas medias de cada variable en los 8 grupos obtenidos mediante el método jerárquico se ha realizado un ANOVA para cada variable disponible, contrastándose en cada modelo la hipótesis: 𝐻0:𝜇1=𝜇2=⋯=𝜇8 Encontrándo diferencias significativas entre las medias de los 8 grupos para todas las variables excepto para la renta por persona, y presentándose estas diferencias entre el cúster 1 y los demás, que como ya se ha explicado, es el que representa a los municipios rurales y demostrándose que la Población ejerce gran influencia sobre el resto de variables Por lo tanto, al no haber encontrado relaciones sólidas entre las variables económicas y los resultados electorales, se han aplicado de nuevo el análisis de componentes principales y el análisis de correlaciones canónicas en los 3 tipos de municipio. Utilizando el primero de ellos, se ha observado que, para los municipios rurales y para los semirurales, no se aparecen relaciones claras, mientras que, en los urbanos, se establece que Otros comparte dirección de crecimiento con Paro Total y Total Empresas por Municipio, Izquierda con Total Contratos, Número Total Licencias y Número Trabajadores y Derecha con Número Establecimientos, Número Total Declaraciones y Población. Por otra parte, mediante el Análisis de Correlaciones Canónicas, no pueden establecerse conclusiones sólidas para los municipios rurales y semirurales, aunque para los municipios urbanos se establece que la primera variable canónica económica resulta un buen predictor para Derecha e Izquierda Como último método para establecer las relaciones buscadas, se ha aplicado la técnica de regresión logística, cuya principal utilidad es que permite estimar la probabilidad de una variable categórica binaria en función variables númericas. Al no disponer de las variables categóricas necesarias para aplicar este tipo de modelo, se han creado tres nuevas variables: MayoríaDerecha, MayoríaIzquierda y MayoríaOtros, descartando aquellos municipios en los que la mayoría de voto era a otros partidos, de tal forma que MayoríaDerecha= 1- MayoríaIzquierda. Tampoco se han tenido en cuenta los municipios rurales, puesto que el hecho de que su número de habitantes sea pequeño podría enmascarar los resultados. Los resultados obtenidos mediante la regresión logística muestran que la probabilidad de que un municipio semirural tenga mayoría de derechas aumenta con el número de empresas y número de contratos por cada 1.000 habitantes y disminuye con el número de licencias por cada 1.000 habitantes. Mientras que, la probabilidad de que un municipio urbano tenga mayoría de derechas aumenta con el número de Trabajadores y número de parados por cada 1.000 habitantes y disminuye con el número de establecimientos por cada 1.000 habitantes. 8 Capítulo 2 DATOS Este capítulo consistirá en la explicación detallada de los pasos seguidos hasta la obtención de los datos que se utilizarán para los análisis, comenzando por la recopilación de tablas proporcionadas por diferentes fuentes, y terminando por la unión de todas ellas y su posterior depuración. Se comenzará por la definición de algunos conceptos, puesto que es importante conocer la información de la que se dispondrá para comprender las variables con las que se va a trabajar a lo largo de todo el análisis. En primer lugar, se define la renta, según el Instituto Nacional de Estadística, como los ingresos percibidos durante el año anterior al de la entrevista, y el IRPF (Impuesto sobre la Renta de las Personas Físicas), como un impuesto que pagan las personas físicas que son residentes en España o contribuyentes de sus rentas obtenidas durante un año natural, que empieza el 1 de enero y termina el 31 de diciembre. Por otra parte, las Afiliaciones a la seguridad social, son un acto administrativo mediante el que se reconoce la condición de inclusión en el Sistema de Seguridad Social a la persona física y el IAE, es un impuesto que recoge las Actividades Económicas de los establecimientos. Además, la Cuenta de Cotización de una empresa, consiste en un código de 11 dígitos que se le asignan a cada empresa con el fin de identificar y controlar las responsabilidades del Sistema de Seguridad Social. El SIE (Sistema de Información Estadística). El Código INE o Código de municipio, sirve como identificación única de cada municipio y está compuesto por 5 dígitos, representando los dos primeros al código de la provincia y los tres restantes al del municipio dentro de ésta. Por último, el Censo es una lista oficial de los habitantes de una población o de un estado. Los datos con los que se va a trabajar se agrupan en tres conjuntos diferentes, contando cada uno de ellos con diferentes variables. Por un lado, los datos poblacionales, en los que se encuentran:  Municipio: nombre del municipio.  Código INE: código INE del municipio.  Población: número de habitantes del municipio. Continuando por los datos electorales:  Votos en blanco: número de votos en blanco en el municipio.  Votos nulos: número de voto nulos en el municipio.  Derecha: número de votos a partidos de Derecha en el municipio.  Izquierda: número de votos a partidos de Izquierda en el municipio.  Otros: número de votos a otro tipo de partidos en el municipio. Y por último los datos económicos:  Renta neta media por persona: ingresos netos percibidos durante el año anterior al de la entrevista por persona en el municipio.  Renta neta media por hogar: ingresos netos percibidos durante el año anterior al de la entrevista por los miembros del hogar en el municipio.  Total Empresas por Municipio: número de empresas en el municipio. 9  Número Total Declaraciones: número total de declaraciones en el municipio.  Paro Total: número total de parados en el municipio.  Total Contratos: número total de contratos en el municipio.  Número Total Licencias: número total de licencias que figuran en cada municipio por el IAE.  Numero Trabajadores: número de trabajadores en cada municipio con una Cuenta de Cotización.  Numero Establecimientos: número de establecimientos en cada municipio por Cuentas de Cotización. Todos estos datos se han descargado y se han sometido a distintos procedimientos hasta llegar a agrupar las variables de la forma anterior y, a lo largo de todo este capítulo, se irá detallando el proceso. 2.1 OBTENCIÓN DE DATOS Es importante que queden reflejadas las fuentes de las que se han obtenido los datos, así como su referencia temporal, puesto que, si se produce algún fallo a la hora de trabajar con ellos, podrán revisarse de forma sencilla. Teniendo en cuenta que se utilizarán los resultados de las elecciones municipales del 26 de mayo de 2019 en Castilla y León, todos los datos se seleccionarán tan próximos a dicha fecha como sea posible. Los datos iniciales, se han obtenido mediante consutas personalizadas a partir de las siguientes fuentes, seleccionando para cada una de las 9 provincias de Castilla y León: 1. https://www.ine.es/dynt3/inebase/index.html?padre=525  Año 2019  Cifras oficiales de población resultantes de la revisión del Padrón municipal a 1 de enero: o Municipio y código INE o Total población (unidad personas) 2. https://www.ine.es/experimental/atlas/exp_atlas_tab.htm  Año 2017  Indicadores de renta media: o Municipio y código INE o Renta neta media por persona (unidad euros) o Renta neta media por hogar (unidad euros) 3. https://www.agenciatributaria.es/AEAT.internet/datosabiertos/catalogo/hacienda/Est adistica_de_los_declarantes_del_IRPF_por_municipios.shtml  Año 2018  Declaraciones por municipios del IRPF: o Municipio o Número total declaraciones (unidad declaraciones) 4. http://www.sepe.es/HomeSepe/que-es-el-sepe/estadisticas/datosestadisticos/municipios  Abril 2019  Paro y contratos registrados: o Municipio o Paro Total (unidad personas) o Total Contratos (unidad contratos) 16 Capítulo 3 ANÁLISIS DE LOS DATOS En este capítulo se tratará de cumplir el objetivo del trabajo, que es establecer relaciones entre las variables económicas y electorales. Una vez obtenidos los datos con los que se trabajará, se hará uso de las ténicas multivariantes conocidas para encontrar dichas relaciones. En primer lugar, un análisis exploratorio de los datos resultará de interés, en el que se presentarán las características principales de cada variable presente en la tabla. Por otra parte, se aplicarán al conjunto de municipios inicial, técnicas multivariantes, cómo Análisis de Componentes Principales, para intentar establecer relaciones de forma gráfica, Análisis de Correlaciones Canónicas, en el que se encuentran las variables separadas en los grupos de interés, un Análisis Clúster sobre los municipios y un ANOVA, usando las características de los clústeres obtenidos. Para terminar, se agruparán los municipios en base a una clasificación que se explicará posteriormente, y se aplicarán el Análisis de Componentes Principales y el de Correlaciones Canónicas, para comparar los resultados obtenidos en cada uno de los tipos, además de una regresión logística para establecer las variables que aumentan la probabilidad de voto a cada una de las opciones electorales. 3.1 EXPLORACIÓN DE LOS DATOS Esta etapa del proceso de análisis de datos, consiste en utilizar técnicas de estadística descriptiva para poder interpretar los datos más fácilmente, creando gráficos y tablas para plantear unas conclusiones iniciales sobre las posibles relaciones existentes entre las variables económicas y electorales. Esta etapa tiene dos objetivos principales, por un lado, presentar características de las variables individuales y por otro, descubrir patrones y relaciones entre variables. Se separará el análisis exploratorio en base al tipo de variables con las que se trabaja: categóricas o numéricas. Variables Categóricas La variable Tipo de municipio, se ha creado por el desequilibrio existente en el número de habitantes de los municipios disponibles, clasificando los municipios según su Población de la siguiente forma:  Rural: población menor que 2.000  Semirural: población entre 2.000 y 10.000  Urbano: población mayor que 10.000 Rural Semirural Urbano 329 104 23 0.72 0.23 0.05 Tabla 1. Tipo de municipio 17 Ilustración 2. Exploración Tipo Municipio Población Rural Población Semirural Población Urbana Población Total 310.998 444.192 1.357.677 2.112.867 0.15 0.21 0.64 1 Tabla 2. Población por Tipo de Municipio El total de la población de los 456 municipios analizados, son 2.112.867 habitantes, de los cuales 310.998 pertenecen a municipios rurales (15%), 444.193 a municipios semirurales (21%) y 1.357.677 a municipios urbanos (64%). La idea obtenida tras el análisis de Tipo de municipio es que los habitantes de Castilla y León están vinculados a los 3 grupos de forma muy desigual, ya que, aunque los urbanos solo son el 5%, en ellos encontramos el 64% de la población y, por lo tanto, las conclusiones que se obtengan de este tipo de municipios serán de gran importancia. Variables Numéricas Min. 1º cuartil Mediana Media 3º cuartil Max. 501 696 1.066 4633 2162 298.866 Tabla 3. Estadísticos Población A pesar de que la media de Población es 4.633, se puede ver que el 75% de los municipios no superan los 2.162 habitantes y todos ellos se encuentran muy alejados del máximo de la variable y muy próximos al mínimo. Ilustración 3. Exploración Población 18 Por otro lado, la moda de la variable se encuentra en el intervalo entre 500 y 1.000 habitantes, siendo más de 200 municipios los que cumplen esta característica, mientras que los intervalos en los se observa menor número de municipios corresponden a un gran número de habitantes. Min. 1º cuartil Mediana Media 3º cuartil Max. 7.715 9.921 10.656 10.829 11.681 16.544 Tabla 4. Estadísticos Renta por Persona Los estadísticos de la renta neta media por persona muestran una distribución de la variable bastante centrada, puesto que la media y la mediana de los datos son muy próximas. Ilustración 4. Exploración Renta por Persona La moda de la renta neta media por persona se encuentra en 10.000, aunque los siguientes valores más comunes están entre dicho valor y 12.500, por lo tanto, se aprecia que la distribución de esta variable es ligeramente asimétrica hacia la izquierda. Ilustración 5. Exploración Renta por Persona por Tipo Municipio Si se analiza esta variable según los 3 tipos de municipio se puede ver que los rurales son los que presentan menor moda, 10.000, seguidos de los semirurales, entre 10.000 y 12.500 y por último los urbanos, en 12.500. Min. 1º cuartil Mediana Media 3º cuartil Max. 16.559 22.749 25.012 25.538 27.807 47.012 Tabla 5. Estadísticos Renta por Hogar Para la renta renta neta media por hogar, se encuentran características similares a las de la renta neta media por persona. Su distribución también es centrada, puesto que en este caso la media y la mediana también son bastante próximas. 19 Ilustración 6. Exploración Renta por Hogar Su distribución también es ligeramente asimétrica hacia la izquierda y la moda se encuentra muy próxima a 20.000, siendo más de 150 municipios los que presentan una renta neta media por hogar en torno a dicho valor. Ilustración 7. Exploración Renta por Hogar por Tipo Municipio También se encuentran diferencias en la moda de la variable según el tipo de municipio siendo de nuevo, la más pequeña para los municipios rurales, seguido de los semirurales y la más grande para los municipios urbanos. Para las siguientes variables, si se continúa trabajando con valores absolutos el análisis no aportaría nada puesto que, al tratarse de totales, es evidente que cualquiera de ellas presentará valores más altos en aquellos municipios con más habitantes. Por lo tanto, se continuará con la exploración de los datos con valores relativos, es decir, tomando los datos por cada 1.000 habitantes. Min. 1º cuartil Mediana Media 3º cuartil Max. 0.007 0.02 0.03 0.15 0.08 9.42 Tabla 6. Estadísticos Empresas por cada 1.000 habitantes En cuanto a la variable número de empresas, se observa que el 75% de los municipios no superan las 0.08 empresas por cada 1.000 habitantes, encontrándose dicho valor muy alejado del máximo de la variable (9.42) y mucho más próximo al mínimo (0.007). 20 Ilustración 8. Exploración Empresas por cada 1000 habitantes La moda de la variable se encuentra entre las 0.01 y 0.02 empresas por cada 1.000 habitantes, seguida por el intervalo comprendido entre las 0.05 y las 0.1. Para terminar con la descripción de esta variable, se ve como el número de empresas por cada 1.000 habitantes es mayor para los municipios urbanos, si se compara con el número de empresas que presentan los municipios rurales y semirurales, puesto que las modas de cada tipo de municipio se encuentran en intervalos diferentes. Ilustración 9. Exploración Empresas por cada 1000 habitantes Tipo Municipio Min. 1º cuartil Mediana Media 3º cuartil Max. 0.03 0.15 0.23 1.18 0.51 81.29 Tabla 7. Estadísticos Delaraciones por cada 1000 habitantes Se observa que, para la variable Número Declaraciones, el 75% de los municipios no superan las 0.51 declaraciones por cada 1.000 habitantes, encontrándose todos ellos muy alejados del valor máximo de la variable, que es 81.29. 21 Ilustración 10. Exploración Declaraciones por cada 1000 habitantes La moda de la variable se encuentra en el intervalo entre 0.1 y 0.25 declaraciones por cada 1.000 habitantes siendo unos 225 municipios los que presentan su número comprendido entre estos dos valores. Ilustración 11. Exploración Declaraciones por cada 1000 habitantes Tipo Municipio El número de declaraciones por cada 1.000 habitantes es mayor para los municipios urbanos, seguido de los municipios semirurales y siendo el grupo de rurales el que presenta menor valor para la variable en la mayor parte de los casos. Min. 1º cuartil Mediana Media 3º cuartil Max. 0.004 0.01 0.02 0.13 0.05 8.4 Tabla 8. Estadísticos Paro por cada 1000 habitantes Para la variable Paro, el 75% de los municipios no superan los 0.05 parados por cada 1.000 habitantes, valor que se encuentra muy alejado del máximo de la variable y mucho más próximo al mínimo, que son 8.4 y 0.004, respectivamente. 22 Ilustración 12. Exploración Paro por cada 1000 habitantes La moda corresponde al intervalo que comprende entre los 0.02 y los 0.05 parados por cada 1.000 habitantes, siendo más de 125 municipios los que registran su tasa entre estos valores. Un número muy similar de municipios presentan entre 0.01 y 0.02 parados por cada 1.000 habitantes. Ilustración 13. Exploración Paro por cada 1000 habitantes Tipo Municipio El grupo los municipios que presentan mayor tasa de parados son los urbanos, y los que la presentan menor son los rurales, observándose de nuevo que la moda en cada uno de los tipos de municipio se encuentra en intervalos muy diferentes. Min. 1º cuartil Mediana Media 3º cuartil Max. 0 0.005 0.01 0.09 0.04 7.06 Tabla 9. Estadísticos Contratos por cada 1000 habitantes En Contratos se osberva que el 75% de los municipios no superan los 0.04 contratos por cada 1.000 habitantes, encontrándose este valor muy alejado del máximo de la variable (7.06). 23 Ilustración 14. Exploración Contratos por cada 1000 habitantes La moda de la variable se encuentra en el intervalo que comprende los valores 0 y 0.05, siendo casi de 125 municipio los que presentan el número de contratos por cada 1.000 habitantes dentro de dicho intervalo. Ilustración 15. Exploración Contratos por cada 1000 habitantes Tipo Municipio Aunque, los municipios urbanos son los que presentan un número mayor de contratos por cada 1.000 habitantes, seguidos del grupo de municipios semirurales, se aprecia que la diferencia entre el número de contratos entre los municipios rurales y los semirurales es menos evidente, incluso hay varios intervalos que presentan municipios de los 3 tipos. Min. 1º cuartil Mediana Media 3º cuartil Max. 0 0.02 0.04 0.19 0.09 13.07 Tabla 10. Estadísticos Número Licencias por cada 1000 habitantes Para Número Licencias por cada 1000 habitantes, se observa que el 75% de los municipios disponibles no superan las 0.09, estando dicho valor muy alejado del máximo de la variable, que son 13.07 licencias. 24 Ilustración 16. Exploración Licencias por cada 1000 habitantes Además, se puede ver que la moda de la variable se encuentra en el intervalo [0.02,0.05], siendo más de 175 municipios los que presentan su número de licencias por cada 1.000 habitantes comprendido entre dichos valores. Ilustración 17. Exploración Licencias por cada 1000 habitantes Tipo Municipio En este caso, los municipios con el número de licencias más alto por cada 1.000 habitantes son los urbanos, y los municipios semirurales se encuentran presentes en casi todos los intervalos representados. Min. 1º cuartil Mediana Media 3º cuartil Max. 0 0.007 0.016 0.14 0.06 10.58 Tabla 11. Estadísticos Trabajadores por cada 1000 habitantes Para Número Trabajadores por cada 1.000 habitantes se puede ver que el 75% no supera el valor 0.06, estando este valor mucho más próximo al mínimo (0), que al máximo (10.58). 25 Ilustración 18. Exploración Trabajadores por cada 1000 habitantes Se encuentra la moda de esta variable en el intervalo comprendido entre los valores valores 0.01 y 0.02, siendo más de 87 municipios los que cumplen dicha característica, además, los resultados son muy similares para el intervalo que comprende entre los 0 y los 0.005 trabajadores por cada 1.000 habitantes. Ilustración 19. Exploración Trabajadores por cada 1000 habitantes Tipo Municipio Para esta misma variable se observa que los municipios pertenecientes al grupo semirural se encuentran presentes en todos los intervalos de valores excepto en los dos últimos, encontrándose además municipios urbanos en los 6 últimos intervalos. Min. 1º cuartil Mediana Media 3º cuartil Max. 0 0.005 0.01 0.05 0.02 3.78 Tabla 12. Estadísticos Establecimientos por cada 1000 habitantes Para la última variable económica, Número Establecimientos, se ve que el 75% de los municipios no supera los 0.02 establecimientos por cada 1.000 habitantes, encontrándose dicho valor mucho más próximo al mínimo que al máximo. 32 Autovalor %Varianza %Varianza Acumulada 1 6.17 47.43 47.43 2 1.60 12.33 59.76 3 1.02 7.88 67.64 4 0.86 6.61 74.25 5 0.66 5.08 79.33 6 0.59 4.51 83.84 7 0.42 3.24 87.08 8 0.37 2.85 89.93 9 0.34 2.64 92.57 10 0.30 2.28 94.85 11 0.28 2.14 96.99 12 0.25 1.92 98.93 13 0.14 1.07 100 Tabla 17. Varianza Explicada por Componentes Observando la tabla superior, se puede ver que la primera componente es la que presenta mayor autovalor y mayor porcentaje de varianza explicada (47.43%). Podrían seleccionarse hasta 4 componentes para superar el 70%, alcanzando así el 74.25%. Sin embargo, a partir de la segunda componente se ve que el porcentaje de varianza explicada que aportarían las nuevas componentes es mínimo y por lo tanto habría que seleccionar demasiadas dimensiones para superar el 80%. Ilustración 28. Gráfico de Autovalores Analizando el gráfico de autovalores se llega a la misma conclusión. Se puede pensar que 2 componentes son suficientes, puesto que es el número en el que la representación empieza a descender más lentamente, aunque, con esta elección, únicamente se obtendría un 59.7% de varianza explicada. Además, se seleccionarán 2 dimensiones para poder interpretar los resultados gráficamente. Mediante el autovector correspondiente a la primera componente, que determina los coeficientes, se observa que todas las variables presentan un valor negativo, siendo la variable renta neta media por persona la que tiene el coeficiente más pequeño, seguido de la renta neta media por hogar. 33 𝑃𝐶1=−0.36𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛−0.31𝐷𝑒𝑟𝑒𝑐ℎ𝑎−0.26𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.18𝑂𝑡𝑟𝑜𝑠 −0.04𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎−0.10𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 −0.35𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜−0.35𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 −0.34𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙−0.21𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠−0.32𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.25𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠−0.32𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 Para la segunda componente, se encuentran signos tanto positivos como negativos en los coeficientes, aunque son mucho mayores los de las variables de renta que los pertenecientes al resto de variables, teniendo ambas signo negativo: 𝑃𝐶2=0.03𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛+0.02𝐷𝑒𝑟𝑒𝑐ℎ𝑎+0.04𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.08𝑂𝑡𝑟𝑜𝑠 −0.71𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎−0.68𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 +0.06𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜+0.003𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 +0.08𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙−0.007𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠+0.03𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 +0.04𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠+0.06𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 Ilustración 29. Contribución por Variables Todas las variables están correladas positivamente y en grado alto con la primera componente, excepto las rentas, como puede observarse en la columna correspondiente a Coordenadas1. Se observa de nuevo, que, en el segundo eje, las variables que presentan mayor correlación con dicha dimensión son los dos tipos de renta (Coordenadas2). Si se analizan las contribuciones de las variables a las 2 primeras componentes, que indican lo que ha contribuido cada variable a la definición de cada uno de los ejes:  Para la primera componente las contribuciones más bajas corresponden a los dos tipos de renta, como se ve en la columna Contribucion1.  Para la segunda, las rentas son las que aportan una mayor contribución como puede verse en la columna Contribucion2. Por otro lado, los cosenos cuadrados informan de la calidad de la representación de la variable en la dimensión correspondiente:  Para la primera componente todas las variables presentan cierta calidad de representación excepto las rentas (Cos2.1).  En la segunda, las únicas variables bien representadas son las rentas (Cos2.2). Tras este análisis no se obtienen conclusiones muy claras en cuanto a establecer relaciones entre las variables electorales y las económicas, pero si se han observado ciertos comportamientos: 34  La primera dimensión representa el comportamiento de todas las variables a excepción de las rentas, mientras que la segunda componente está representada por las rentas.  Con respecto a la primera dimensión todas las variables parecen crecer de forma simultánea, aunque las rentas en menor medida. Puesto que mediante el análisis de componentes principales centrado en las dos primeras dimensiones no se obtienen las relaciones buscadas, antes de concluir que no hay relación entre las variables económicas y las electorales, se representarán los gráficos con las coordenadas de las variables por pares de componentes. La primera dimensión, con la que se obtiene un 47.43% de variabilidad explicada, parece representar gran parte de las características económicas de los municipios, encontrándose entre las variables que más contribuyen dentro de dicha componente: Población, Número Total Declaraciones, Total Empresas por Municipio, Paro Total, Número Total Licencias y Número Establecimientos. 𝑃𝐶1=−0.36𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛−0.31𝐷𝑒𝑟𝑒𝑐ℎ𝑎−0.26𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.18𝑂𝑡𝑟𝑜𝑠 −0.04𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎−0.10𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 −0.35𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜−0.35𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 −0.34𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙−0.21𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠−0.32𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.25𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠−0.32𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 Ilustración 30. Contribuciones a la Componente 1 La segunda componente, representa los dos tipos de rentas, puesto que estas dos variables son las que presentan mayor importancia en la dimensión 2. 𝑃𝐶2=0.03𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛+0.02𝐷𝑒𝑟𝑒𝑐ℎ𝑎+0.04𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.08𝑂𝑡𝑟𝑜𝑠 −0.71𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎−0.68𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 +0.06𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜+0.003𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 +0.08𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙−0.007𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠+0.03𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 +0.04𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠+0.06𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 35 Ilustración 31. Contribuciones a la Componente 2 La cuarta dimensión, se utilizará para la representación de la elección de voto a otros partidos, puesto que, es la variable Otros la que presenta una mayor contribución en la componente 4. 𝑃𝐶4=0.05𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛+0.22𝐷𝑒𝑟𝑒𝑐ℎ𝑎+0.03𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.92𝑂𝑡𝑟𝑜𝑠 +0.05𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎+0.10𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 −0.03𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜+0.04𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 +0.004𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙−0.16𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠+0.006𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 +0.24𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠+0.09𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 Ilustración 32. Contribuiones a la Componente 4 La componente 5, representará a la tendencia de voto a partidos de izquierdas, aunque también a las dos variables económica que faltan por considerar, puesto que las variables que aportan una mayor contribución en esta dimensión son: Izquierda, Total Contratos y Número Trabajadores. 𝑃𝐶5=−0.095𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛−0.108𝐷𝑒𝑟𝑒𝑐ℎ𝑎+0.668𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.226𝑂𝑡𝑟𝑜𝑠 +0.0117𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎+0.00371𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 −0.0507𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜−0.059𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 −0.000026𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙+0.5𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠+0.126𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.4𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠−0.236𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜 36 Ilustración 33. Contribuciones a la Componente 5 Por último, la octava dimensión corresponde a los votos a partidos considerados de derechas, puesto que la variable con mayor contribución en la componente 8 es Derecha. 𝑃𝐶8=−0.29𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛+0.76𝐷𝑒𝑟𝑒𝑐ℎ𝑎+0.15𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎+0.14𝑂𝑡𝑟𝑜𝑠 +0.22𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝑃𝑒𝑟𝑠𝑜𝑛𝑎−0.25𝑅𝑒𝑛𝑡𝑎𝑁𝑒𝑡𝑎𝑀𝑒𝑑𝑖𝑎𝐻𝑜𝑔𝑎𝑟 −0.01𝑇𝑜𝑡𝑎𝑙𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜−0.27𝑁𝑢𝑚𝑒𝑟𝑜𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠 −0.13𝑃𝑎𝑟𝑜𝑇𝑜𝑡𝑎𝑙+0.02𝑇𝑜𝑡𝑎𝑙𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠−0.25𝑇𝑜𝑡𝑎𝑙𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.06𝑁𝑢𝑚𝑒𝑟𝑜𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠+0.16𝑁𝑢𝑚𝑒𝑟𝑜𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜 Ilustración 34. Contribuciones a la componente 8 Puesto que todas las variables disponibles se encuentran representadas por alguna de las 5 componentes analizadas anteriormente (1,2,4,5 y 8), serán las utilizadas para crear los planos por pares de componentes, obteniéndose 10 gráficos diferentes. 37 Ilustración 35. Plano por componentes 1-2 En el gráfico superior se observan dos grupos de variables, por un lado, las rentas, que presentan coordenadas próximas a 1 con la segunda dimensión y próximas a 0 con la primera, y por otro, el resto de variables, en cuyo caso ocurre contrario. Puesto que las rentas muestran coordenadas próximas a 0 con la primera componente, no presentan relación lineal con los valores que toman los municipios en dicho eje. Ninguna de las variables está bien representada sobre el plano formado por las 2 componentes, aunque lo estén en cada una de ellas por separado. Por lo tanto, se puede decir que los municipios con rentas altas por persona también presentarán rentas altas por hogar. Ilustración 36. Plano por componentes 1-4 En el plano anterior, se observan 2 grupos de variables diferenciados. Por un lado, la variable Otros, que presenta un valor de coordenada próxima a 1 con la componente 4, en contraposición con el resto de variables, cuya coordenada con la cuarta dimensión no supera 0.25 (en valor absoluto). Además, la variable Otros es la mejor representada en el plano formado por las componentes 1 y 4, puesto que es la única variable que se encuentra en el borde del círculo y sus coordenadas con ambos ejes son relativamente altas. Los municipios con un número de votos alto para la derecha, presentan un número alto de trabajadores y un gran número de habitantes. En el caso de los votos a la izquierda, los municipios con valores altos presentan gran número de parados y un valor alto de población. 38 Ilustración 37. Plano pr componentes 1-5 En el gráfico anterior, se aprecia como la variable Izquierda se encuentra junto con Total Contratos, diferenciada del resto de variables, puesto que presentan coordenadas muy similares en los dos ejes. Además, como las coordenadas que presentan en ambas dimensiones son altas, son las variables mejor representadas en el plano. Los municipios con número un número alto de votos a la izquierda presentan también un número alto de contratos. Por otra parte, los municipios con gran número de votos a la derecha presentarán un gran número de habitantes, un número alto de trabajadores y un gran número de establecimientos. Para la variable Otros, se aprecia una dirección de crecimiento similar a la que presentan Número Trabajadores y Número de Establecimientos. Ilustración 38. Plano por componentes 1-8 En el último plano cuyo primer eje es la componente 1, no se observan grandes diferencias entre grupos de variables. La variable Derecha es la mejor representada por el plano formado por la primera y octava dimensión, puesto que es la que presenta mayores coordenadas en ambos ejes a la vez. Sin embargo, este gráfico no resulta útil para establecer relaciones interesantes entre variables electorales y económicas. Simplemente, se establece que aquellos municipios con valores altos en el número de votos para cualquiera de las 3 opciones, presentarán gran número de establecimientos y una renta neta media por persona alta, puesto que todas estas variables presentan direcciones de crecimiento similares. 39 Si se analizan los 4 gráficos anteriores, se puede ver que la primera componente resulta ser factor de tamaño, puesto que todas las coordenadas de las variables en el primer eje tienen signo positivo. Al desplazarse en la dirección de crecimiento de esta dimensión, todas las variables crecen a la vez, o decrecen al moverse en la dirección contraria. Ilustración 39. Plano por componentes 2-4, 2-5 y 2-8 En el gráfico correspondiente a las dimensiones 2 y 4, se observan 4 grupos de variables diferentes. Por un lado, con respecto a la componente 2, se puede ver que las rentas presentan coordenadas positivas y altas, mientras que Paro Total, Número Establecimientos y Total Empresas por Municipio presentan coordenadas negativas y pequeñas, de tal forma que, si aumenta el valor de uno de los dos grupos anteriores, el otro disminuye. Con respecto a la componente 4 se observan otros dos grupos de variables, el primero de ellos formado por Otros y Total Contratos, cuyas coordenadas en el eje son positivas, y el segundo formado por Número Total Declaraciones, Derecha y Número Trabajadores, cuyas coordenadas son negativas. En cuanto a las relaciones entre variables electorales y económicas en este gráfico se observa que los grupos de municipios con un número alto de votos a la derecha presentan un gran número de declaraciones y de trabajadores. Los municipios con un gran número de votos a otros partidos presentan un número alto de contratos. En la representación de las dimensiones 2 y 5, se observan diferencias entre grupos de variables. En primer lugar, para la dimensión 2, los dos tipos de renta presentan coordenadas positivas, mientras que Paro Total, Número Establecimientos y Total Empresas por Municipio presentan coordenadas negativas para esta misma componente. Para la dimensión 5, se encuentra la misma diferencia para dos grupos de variables, el primero formado por Izquierda, Total Contratos y Número Total Licencias, y el segundo por Derecha, Número Establecimientos y Número Trabajadores. Por lo tanto, los municipios con mayor número de votos a la izquierda presentarán mayor número de contratos y de licencias, mientras que los que tengan mayor número de votos a la derecha presentarán mayores números de establecimientos y trabajadores. En el último plano, correspondiente a las dimensiones 2 y 8, no se observan diferencias tan marcadas entre las variables como en los casos anteriores, aunque se puede ver que, de nuevo, los dos tipos de renta presentan coordenadas positivas y altas con la dimensión 2. Tampoco resulta útil para establecer relaciones entre variables económicas y electorales, puesto que las 3 variables correspondientes al segundo grupo se encuentran bastante concentradas en el gráfico, aunque podría decirse que los municipios con mayor valor para Derecha presentan valores altos para Número Establecimientos y que Otros y Renta neta media por persona presentan una dirección de crecimiento similar. 40 Ilustración 40. Plano por componentes 4-5 Aunque en el caso del gráfico superior, correspondiente a las componentes 4 y 5, no se encuentran agrupaciones claras de variables por valores extremos de sus coordenadas en cada uno de los ejes, esta representación resulta muy interesante para establecer las relaciones buscadas, puesto que ninguna de las variables electorales presenta la misma dirección de crecimiento. Los municipios con gran número de votos a la derecha, presentan también altos valores para Población, Número de Establecimientos y Número de Trabajadores. En cuanto a los votos para los partidos de izquierda, serán más altos en aquellos municipios con mayor número de contratos, y también crecerán con el paro y el número total de licencias. Por último, los votos a otros partidos serán mayores en aquellos municipios con mayor número de declaraciones y de empresas. Ilustración 41. Plano por componentes 4-8 En el último plano correspondiente a las dimensiones 4 y 8, no se establecen relaciones claras entre las variables económicas y las electorales, puesto que Derecha e Izquierda presentan la misma dirección de crecimiento. Los municipios con mayor número de votos a derecha e izquierda presentarán una renta neta media por persona más alta y mayor número de establecimientos y aquellos con mayor número de votos a otros partidos presentarán mayor número de contratos. 41 Ilustración 42. Plano por componentes 5-8 En el último plano obtenido, formado por la componente 5 en el primer eje y la 8 en el segundo, se observan relaciones interesantes entre las variables electorales y las económicas. Los grupos de municipios con mayor número de votos a la derecha presentan una gran renta neta media por persona y un alto número de empresas. Además, este tipo de voto disminuirá a medida que aumente el paro. Los municipios con un número alto de votos a la izquierda, presentarán un mayor número de contratos con respecto al resto y la variable Izquierda aumentará a medida que disminuya el número de trabajadores. Por último, los municipios con mayor número de votos a otros partidos, presentarán mayor número de trabajadores, declaraciones, población y establecimientos. Además, se observa que izquierda y otros presentan direcciones opuestas de crecimiento, lo que quiere decir que al aumentar una de las variables disminuirá la otra. Análisis de Correlaciones Canónicas Puesto que los resultados obtenidos mediante el análisis de componentes principales no han resultado de gran utilidad para el propósito del trabajo, se realizará un análisis de correlaciones canónicas. Esta técnica multivariante es adecuada cuando las variables disponibles pueden dividirse en dos grupos en función de algún criterio, y su principal utilidad es estudiar las relaciones entre ambos conjuntos. En este caso las variables se dividirán en 3 electorales:  X1=Derecha  X2=Izquierda  X3=Otros Y 10 variables económicas:  Y1=Población  Y2=Renta neta media por persona  Y3=Renta neta media por hogar  Y4=Total Empresas por Municipio  Y5=Número Total Declaraciones  Y6=Paro Total  Y7=Total Contratos  Y8=Número Total Licencias  Y9=Numero Trabajadores  Y10=Numero Establecimientos 48 Método jerárquico Este método presenta una ventaja con respecto a k-means, y es que no necesita que se establezca a priori el número de grupos que se quieren obtener. Los métodos jerárquicos obtienen representaciones con forma de árbol que se denominan dendogramas y por lo tanto se mostrará una figura jerárquica entre los municipios. A medida que se asciende en el dendograma se van uniendo las diferentes ramas, de tal forma que aquellos municipios que se encuentren dentro de la misma unión serán similares entre sí. Las uniones que estén en la parte baja del dendograma contendrán municipios más similares que las que se encuentren en la parte alta. Por lo tanto, las conclusiones que puedan extraerse de este tipo de gráficos residirán en la altura a la que se unen los diferentes municipios, ya que, en base a esta recta horizontal podrá verse que municipios se encuentran dentro de cada grupo. Por otro lado, hay que elegir la medida de similitud, que en este caso será la distancia euclídea:  Para dos individuos 𝑖 y 𝑗, su distancia euclídea denominada 𝐷𝑖𝑗 será: 𝐷𝑖𝑗=√∑(𝑥𝑘𝑖−𝑥𝑘𝑗)2 𝑛 𝑘=1 Siendo 𝑋𝑘𝑖 el valor de la variable 𝑥𝑘 para el individuo 𝑖 y 𝑋𝑘𝑗 el valor de la variable 𝑥𝑘 para el individuo 𝑗. Finalmente, hay que seleccionar el algoritmo que medirá la distancia entre clústeres:  Complete Linkage: calcula por pares la distancia entre los elementos de 2 grupos distintos y selecciona la máxima que se encuentre, siendo ésta la distancia entre ambos.  Average Linkage: funciona de la misma forma que el método anterior, pero, en este caso, la distancia entre los grupos será la media de todas las obtenidas entre pares de individuos.  Single Linkage: utiliza el mismo procedimiento, pero seleccionando el mínimo de todas las distancias. Una vez seleccionados los métodos para medir la distancia entre individuos y entre clústeres, se formará el dendograma de manera iterativa, de tal forma que, primero se tratará cada elemento como un clúster individual y se irán uniendo los individuos más similares en cada paso hasta que todos ellos pertenezcan a un único grupo y se complete el gráfico. Al aplicar el método, el primer paso ha sido calcular la matriz de distancia euclídea para los datos después de estandarizarlos y, posteriormente, aplicar los 3 métodos Linkage explicados para seleccionar aquel que obtenga mejores resultados. 49 Ilustración 50. Dendograma Complete Linkage Ilustración 51. Dendograma Average Linkage Ilustración 52. Dendograma Single Linkage Como puede verse, el método Complete Linkage presenta un dendograma más equilibrado. Por lo tanto, se seleccionará este método para aplicar el clustering jerárquico a los datos y la distancia euclídea para medir la distancia entre los municipios, estableciendo el corte del dendograma en aquella altura que proporcione 8 grupos, que es el número óptimo de clúster que se obtenía para k-means y así se podrán comparar los resultados. 50 Ilustración 53. Dendograma Complete Linkage y distancia euclídea Los resultados obtenidos utilizando el método jerárquico difieren con respecto al método kmeans, por lo que el siguiente paso será seleccionar aquel que obtenga mejores resultados. Para la selección del mejor algoritmo se utilizarán 3 medidas diferentes. Por un lado, la conectividad de cada método, que será mejor cuanto menor sea su valor y, por otra parte, el índice de Dunn y el ancho de la silueta, que, en contraposición con la primera medida deben ser lo más grandes posible. Ilustración 54. Conectividad. Índice de Dunn. Silueta Como se puede observar en los gráficos superiores, la conectividad es menor para el método jerárquico sea cual sea el número de clústeres que se seleccione, además el índice de Dunn y el ancho de la silueta también son siempre mayores para este mismo método. Por lo tanto, se utilizará el clustering jerárquico con distancia euclídea y complete Linkage para la creación de los 8 grupos de municipios. Como ya se ha comentdo en puntos anteriores, se tiene la sospecha de que la variable Población, puede condicionar los datos tanto económicos como electorales, excepto para el caso de las rentas, puesto que al tratarse de medias por municipio y no de totales, el número de habitantes no influye en el valor de dichas variables. Para contrastar esta teoría, se plantea una clasificación de los municipios según su población: 51 Grupo HC Rural Semirural Urbano 1 321 50 14 2 0 13 0 3 0 26 0 4 8 9 6 5 0 0 1 6 0 4 0 7 0 0 2 8 0 2 0 Tabla 25. Clasifiación Clúster por tipo de municipio De los 456 municipios municipios totales, 329 son rurales, 104 son semirurales y 23 urbanos. En cuanto a la agrupación de los individuos en los 8 clústeres, según el tipo de municipio al que pertenecen, se puede ver que de los 329 rurales, 321 se encuentran en el primer clúster, mientras que los otros dos tipos, semirural y urbano se encuentran más dispersos en los 8 grupos obtenidos. Por lo tanto, parece que la idea que se planteaba de que la Población ejerce una gran influencia en el resultado de las variables podría ser cierta. ANOVA para clúster Para comparar las respuestas medias a las 13 variables de los 8 grupos obtenidos con el clustering jerárquico se realizará un ANOVA, trabajando en cada análisis con dos variables. Por un lado, la variable clúster, que establece los 8 grupos de interés, y por otro, la variable respuesta, que será cada una de las 13 variables numéricas por separado. Siendo la hipótesis a contrastar en cada caso: 𝐻0:𝜇1=𝜇2=⋯=𝜇8 En caso de que se estableciese que hay diferencias significativas entre las medias de los 8 grupos, se utilizará el test de Tukey para saber entre que grupos se encuentran dichas diferencias. Además, tras la realización del ANOVA, se debe contrastar que se cumplan tres condiciones para validar el modelo:  Independencia de los residuos.  Homocedasticidad, o equivalencia de las varianzas.  Normalidad de los residuos. Para todas las variables númericas, excepto las rentas, ha sido necesaria una transformación logarítmica para que se cumpliesen las 3 condiciones anteriores. Para las variables a las que se ha aplicado la transformación logarítmica se rechaza la igualdad de medias, puesto que los pvalores obtenidos para el contraste planteado son muy próximos a 0, y por lo tanto menores que 0.05. Después de rechazar la igualdad de medias para todas las variables anteriores, se ha aplicado el test de Tukey para averiguar entre qué grupos se producen: 52 Ilustración 55. Test de Tukey para Población, Derecha e Izquierda Ilustración 56. Test de Tukey para Otros, Empresas y Declaraciones Ilustración 57. Test de Tukey para Paro, Contratos y Licencias 53 Ilustración 58. Test de Tukey para Trabajadores y Establecimientos Como se puede observar, la mayor parte de las diferencias entre grupos residen entre el clúster 1, que está representado principalmente por los municipios rurales y los otros 7. Por último, para las 11 variables se muestran los gráficos para comprobar que, efectivamente, se cumplen las 3 condiciones para que el modelo ANOVA sea válido:  Independencia y homocedasticidad: Ilustración 59. Independencia y homocedasticidad para Población, Derecha, Izquierda y Otros 54 Ilustración 60. Independencia y homocedasticidad para Empresas, Declaraciones, Paro y Contratos Ilustración 61. Independencia y homocedasticidad para Licencias, Trabajadores y Establecimientos  Normalidad de los residuos: Ilustración 62. Normalidad residuos para Población, Derecha, Izquierda y Otros 55 Ilustración 63. Normalidad residuos para Empresas, Declaraciones, Paro y Contratos Ilustración 64. Normalidad residuos para Licencias, Trabajadores y Establecimientos Para terminar con el ANOVA, se muestran los resultados obtenidos para la Renta neta media por persona y la renta neta media por hogar. En el caso de la primera variable, no se puede rechazar la igualdad de medias entre los 8 grupos, puesto que el p-valor obtenido es 0.655>0.05: Ilustración 65. ANOVA renta neta media por persona 56 Además, se comprueba que el ANOVA es válido, puesto que se cumplen la independencia de los residuos, la homocedasticidad y la normalidad: Ilustración 66. Condiciones ANOVA renta neta media por persona En el caso de la renta neta media por hogar, se rechaza la igualdad de medias entre los 8 clústeres, puesto que el p-valor es 0.0146, menor que 0.05: Ilustración 67. ANOVA renta neta media por hogar Aunque no es posible establecer entre que grupos se producen dichas diferencias mediante el test de Tukey, parece que se encuentran las mayores desigualdades entre el grupo 1 con el 3 y el 4: Ilustración 68. Tukey renta neta media por hogar 57 El ANOVA realizado para esta variable también cumple las condiciones de independencia de los residuos, homocedasticidad y normalidad: Ilustración 69. Condiciones ANOVA renta neta media por hogar 64 Declaraciones, Paro Total y Número Total Licencias, mientras que la variable Izquierda presenta la mayor correlación con el Paro. También, se observa como las correlaciones son mucho mayores para el grupo Otros, si lo comparamos con las correspondientes al grupo de municipios rurales, lo que quiere decir que esta variable toma mayor importancia en los municipios semirurales, siendo la correlación más destacable la que presenta con Número Total Declaraciones. Ilustración 79. Correlaciones entre variables Urbanos Por último, se muestran las correlaciones entre variables económicas y electorales para el grupo de municipios urbanos y se observa como las correlaciones de los tres grupos electorales son considerablemente mayores en este caso, sobre todo para los grupos Derecha e Izquierda, para los que ya se encuentran correlaciones muy significativas. Las variables económicas que presentan mayor correlación con las electorales son Población y Número Total Declaraciones. Ahora, se compararán los resultados obtenidos sobre las variables canónicas y su significancia para los tres tipos de municipios: Ilustración 80. Variables canónicas y su significancia Rurales 65 Ilustración 81. Variables canónicas y su significancia Semirurales Ilustración 82. Variables canónicas y su significancia Urbanos Como se puede observar, en los 3 casos la primera correlación canónica es mayor que las otras dos, siendo 0.68 para los municipios rurales, 0.80 para los semirurales y 0.99 para los urbanos. Esto parece indicar que, como ya se había observado, el conjunto de los municipios rurales parece ser el menos útil para establecer relaciones entre los 2 grupos de variables y el más útil el de los municipios urbanos, puesto que es el que contiene a la mayor parte de la población de Castilla y León. Además, para contrastar la hipótesis nula: 𝐻0:𝐿𝑎𝑠 𝑐𝑜𝑟𝑟𝑒𝑙𝑎𝑐𝑖𝑜𝑛𝑒𝑠 𝑐𝑎𝑛ó𝑛𝑖𝑐𝑎𝑠 𝑒𝑛 𝑙𝑎 𝑓𝑖𝑙𝑎 𝑎𝑐𝑡𝑢𝑎𝑙 𝑦 𝑙𝑎𝑠 𝑠𝑖𝑔𝑢𝑖𝑒𝑛𝑡𝑒𝑠 𝑠𝑜𝑛 0 los p-valores obtenidos son próximos a 0 en los 3 tipos de municipio, para la primera correlación canónica y mucho mayores que 0.05 para la segunda y la tercera, por lo tanto, se rechazará en el primer caso y en los otros dos no se podrá, lo que supone que únicamente se considere la primera. El siguiente paso será comparar los coeficientes estandarizados de las variables canónicas para cada uno de los casos: 𝑋𝑐𝑎𝑛1𝑟𝑢𝑟𝑎𝑙𝑒𝑠=−0.71𝐷𝑒𝑟𝑒𝑐ℎ𝑎−0.66𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.37𝑂𝑡𝑟𝑜𝑠 𝑋𝑐𝑎𝑛1𝑠𝑒𝑚𝑖𝑟𝑢𝑟𝑎𝑙𝑒𝑠=−0.82𝐷𝑒𝑟𝑒𝑐ℎ𝑎−0.28𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.27𝑂𝑡𝑟𝑜𝑠 𝑋𝑐𝑎𝑛1𝑢𝑟𝑏𝑎𝑛𝑜𝑠=−0.75𝐷𝑒𝑟𝑒𝑐ℎ𝑎−0.23𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎−0.16𝑂𝑡𝑟𝑜𝑠 66 La primera variable canónica para el grupo de variables electorales presenta en los tres casos una diferencia ponderada con mayor peso en Derecha. Sin embargo, al comparar el caso correspondiente al conjunto de municipios inicial con el resto, se observa como para los municipios rurales los coeficientes para Derecha e Izquierda se igualan y el correspondiente a Otros crece, lo que quiere decir que la aportación de los datos electorales para este grupo de municipios se equipara. Por otro lado, al comparar con los semirurales se observa como la diferencia entre Derecha e Izquierda se incrementa, mientras que Izquierda y Otros quedan igualados. Por último, en los municipios urbanos se aprecia una gran diferencia entre el coeficiente correspondiente a Derecha e Izquierda y a su vez una diferencia también bastante marcada entre Izquierda y Otros. Por lo tanto, se supone que la variable que más aporta en los cuatro casos es Derecha. 𝑌𝑐𝑎𝑛1𝑟𝑢𝑟𝑎𝑙𝑒𝑠=−0.64𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛−0.04𝑅𝑒𝑛𝑡𝑎 𝑛𝑒𝑡𝑎 𝑚𝑒𝑑𝑖𝑎 𝑝𝑜𝑟 𝑝𝑒𝑟𝑠𝑜𝑛𝑎 −0.008𝑅𝑒𝑛𝑡𝑎 𝑛𝑒𝑡𝑎 𝑚𝑒𝑑𝑖𝑎 𝑝𝑜𝑟 ℎ𝑜𝑔𝑎𝑟 −0.23𝑇𝑜𝑡𝑎𝑙 𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠 𝑝𝑜𝑟 𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜 +0.006𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠−0.12𝑃𝑎𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 −0.13𝑇𝑜𝑡𝑎𝑙 𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠− 0.03𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.08𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠− 0.06𝑁ú𝑚𝑒𝑟𝑜 𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 Para los municipios rurales, se encuentra un único coeficiente positivo, aunque resultará insignificante puesto que es prácticamente nulo. A diferencia del primer caso analizado, la variable que presenta mayor coeficiente es Población, presentando una gran diferencia con la siguiente variable que aporta mayor peso, que es Total Empresas por Municipio. 𝑌𝑐𝑎𝑛1𝑠𝑒𝑚𝑖𝑟𝑢𝑟𝑎𝑙𝑒𝑠 =−0.38𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛−0.01𝑅𝑒𝑛𝑡𝑎 𝑛𝑒𝑡𝑎 𝑚𝑒𝑑𝑖𝑎 𝑝𝑜𝑟 𝑝𝑒𝑟𝑠𝑜𝑛𝑎 −0.08𝑅𝑒𝑛𝑡𝑎 𝑛𝑒𝑡𝑎 𝑚𝑒𝑑𝑖𝑎 𝑝𝑜𝑟 ℎ𝑜𝑔𝑎𝑟 −0.13𝑇𝑜𝑡𝑎𝑙 𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠 𝑝𝑜𝑟 𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜 −0.29𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠− 0.28𝑃𝑎𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 −0.10𝑇𝑜𝑡𝑎𝑙 𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠− 0.14𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.04𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠+ 0.16𝑁ú𝑚𝑒𝑟𝑜 𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 En cuanto a los semirurales, de nuevo se encuentra un único coeficiente positivo, correspondiente al Número de Establecimientos, pero en este caso presenta una importancia considerable. Por otra parte, se observa que la variable con mayor peso vuelve a ser Población, pero en este caso con menor diferencia respecto a las siguientes que son Número Total Declaraciones y Paro Total. 𝑌𝑐𝑎𝑛1𝑢𝑟𝑏𝑎𝑛𝑜𝑠=−1.21𝑃𝑜𝑏𝑙𝑎𝑐𝑖ó𝑛+0.08𝑅𝑒𝑛𝑡𝑎 𝑛𝑒𝑡𝑎 𝑚𝑒𝑑𝑖𝑎 𝑝𝑜𝑟 𝑝𝑒𝑟𝑠𝑜𝑛𝑎 −0.03𝑅𝑒𝑛𝑡𝑎 𝑛𝑒𝑡𝑎 𝑚𝑒𝑑𝑖𝑎 𝑝𝑜𝑟 ℎ𝑜𝑔𝑎𝑟 +0.36𝑇𝑜𝑡𝑎𝑙 𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠 𝑝𝑜𝑟 𝑀𝑢𝑛𝑖𝑐𝑖𝑝𝑖𝑜 +0.08𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 𝐷𝑒𝑐𝑙𝑎𝑟𝑎𝑐𝑖𝑜𝑛𝑒𝑠+ 0.03𝑃𝑎𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 −0.11𝑇𝑜𝑡𝑎𝑙 𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠+ 0.004𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑜𝑡𝑎𝑙 𝐿𝑖𝑐𝑒𝑛𝑐𝑖𝑎𝑠 −0.25𝑁ú𝑚𝑒𝑟𝑜 𝑇𝑟𝑎𝑏𝑎𝑗𝑎𝑑𝑜𝑟𝑒𝑠+ 0.07𝑁ú𝑚𝑒𝑟𝑜 𝐸𝑠𝑡𝑎𝑏𝑙𝑒𝑐𝑖𝑚𝑖𝑒𝑛𝑡𝑜𝑠 Para terminar, en el grupo de municipios urbanos se observan varios coeficientes positivos, aunque el único de importancia es Total Empresas por Municipio. Además, se encuentra la mayor diferencia entre la variable Población y el resto. 67 A continuación, se muestran las correlaciones entre los 2 conjuntos iniciales de variables y sus variables canónicas, recordando que las variables supresoras son aquellas que presentan signos opuestos en su coeficiente y en la correlación correspondiente. Xcan1R Xcan1S Xcan1U X1 -0.72 -0.92 -0.99 X2 -0.65 -0.52 -0.90 X3 -0.15 -0.36 -0.38 Tabla 26. Correlaciones v.electorales y v.canónicas del mismo grupo Xcan1R Xcan1S Xcan1U Y1 -0.65 -0.72 -0.98 Y2 -0.06 -0.05 -0.14 Y3 -0.10 -0.18 -0.03 Y4 -0.55 -0.60 -0.89 Y5 -0.55 -0.70 -0.97 Y6 -0.43 -0.64 -0.48 Y7 -0.30 -0.29 -0.84 Y8 -0.41 -0.58 -0.86 Y9 -0.23 -0.36 -0.81 Y10 -0.35 -0.49 -0.90 Tabla 27. Correlaciones v.económicas y v.canónicas del grupo opuesto En el caso de las variables electorales, no se encuentra ninguna variable supresora, puesto que las correlaciones entre estas 3 variables y la primera variable canónica correspondiente a su grupo son negativas en los cuatro casos, igual que ocurría con sus coeficientes. Ycan1R Ycan1S Ycan1U X1 -0.49 -0.73 -0.97 X2 -0.45 -0.41 -0.89 X3 -0.10 -0.29 -0.37 Tabla 28. Correlaciones v.electorales y v.canónicas del grupo opuesto Ycan1R Ycan1S Ycan1U Y1 -0.95 -0.90 -0.99 Y2 -0.09 -0.07 -0.14 Y3 -0.15 -0.23 -0.03 Y4 -0.81 -0.75 -0.91 Y5 -0.80 -0.88 -0.99 Y6 -0.64 -0.80 -0.49 Y7 -0.45 -0.37 -0.85 Y8 -0.60 -0.72 -0.87 Y9 -0.34 -0.45 -0.82 Y10 -0.51 -0.62 -0.91 Tabla 29. Correlaciones v.económicas y v.canónicas del mismo grupo Sin embargo, para las variables económicas se encuentran variables supresoras en los tres casos. Para el conjunto de datos inicial se encontraba como variable supresora Número Trabajadores, mientras que, para los municipios rurales la variable supresora es Número Total Declaraciones, para los semirurales Número Establecimientos y para los urbanos Renta neta media por persona, Total Empresas por Municipio, Número Total Declaraciones, Paro Total, Número Total Licencias y Número Establecimientos. 68 Para continuar, se muestra un análisis de redundancia canónico para los diferentes tipos de municipio según su población: Ilustración 83. Análisis Redundancia Canónico Rurales Observando los resultados para el conjunto de municipios rurales, se ve que la capacidad predictiva de las dos primeras variables canónicas para el conjunto opuesto de variables es prácticamente inútil, puesto que se obtienen proporciones de varianza explicada de 0.15 y 0.17. Ilustración 84. Análisis Redundancia Canónico Semirurales Lo mismo ocurre para los municipios semirurales, puesto que, aunque los resultados son algo mejores, las proporciones de varianza explicadas por las dos primeras variables canónicas son aproximadamente 0.26. Ocurre lo mismo observando los coeficientes de redundancia totales, que en este caso son 0.32 y 0.27. Ilustración 85. Análisis Redundancia Canónico Urbanos Sin embargo, en el último grupo, correspondiente a los municipios urbanos, se observa que las dos primeras variables canónicas resultan ser predictores mejores para el conjunto opuesto de variables, puesto que las proporciones de varianza explicadas por cada una de ellas son 0.63 y 0.59. Los coeficientes de redundancia totales indican buena capacidad de las variables electorales para predecir la económicas (0.75) y buena capacidad de las variables económicas para predecir las electorales (0.64). Por último, se muestran las correlaciones múltiples cuadradas entre los dos tipos de variables y las canónicas del grupo opuesto: Ycan1R Ycan1S Ycan1U X1 0.2444 0.5385 0.9465 X2 0.1992 0.1675 0.7890 X3 0.0100 0.0812 0.1381 Tabla 30. Correlaciones múltiples cuadradas v.electorales y v.canónicas opuestas 69 En el caso del conjunto global de municipios, la primera variable canónica de las variables económicas presentaba cierta capacidad predictiva para Derecha (0.55), aunque más pobre para Izquierda (0.36) y aún menor para Otros (0.17). Para los municipios rurales se observa una disminución en dicha capacidad predictiva puesto que, en este caso, las correlaciones múltiples cuadradas son 0.24 para Derecha, 0.20 para Izquierda y 0.01 para Otros. En el grupo de municipios semirurales ocurre algo similar, aunque con una mejora considerable en la capacidad predictiva para Derecha. Las ideas más destacables se encuentran en el grupo de municipios urbanos, puesto que la primera variable canónica correspondiente al grupo económico presenta muy buenas capacidades predictivas para Derecha (0.95) e Izquierda (0.79). Xcan1R Xcan1S Xcan1U Y1 0.4198 0.5135 0.9570 Y2 0.0038 0.0028 0.0197 Y3 0.0104 0.0324 0.0007 Y4 0.3066 0.3594 0.8008 Y5 0.2989 0.4848 0.9482 Y6 0.1876 0.4050 0.2316 Y7 0.0922 0.0854 0.7047 Y8 0.1685 0.3315 0.7368 Y9 0.0540 0.1307 0.6573 Y10 0.1193 0.2443 0.8123 Tabla 31. Correlaciones múltiples cuadradas v.económicas y v.canónicas opuestas Por otro lado, para el conjunto inicial de municipios, la primera variable canónica de las variables electorales resultaba un buen predictor para Población, Total Empresas por Municipio, Número Total Declaraciones y Paro Total, puesto que los valores correspondientes de la correlación múltiple al cuadrado eran 0.56, 0.53, 0.55, 0.53. Para los municipios rurales la única variable para la que la primera variable canónica correspondiente al grupo electoral presenta una capacidad predictiva medianamente alta es para Población, puesto que el valor de la correlación múltiple al cuadrado es 0.42, y resulta mucho mayor que los valores para el resto de variables. Algo parecido ocurre para los municipios semirurales, ya que la primera variable canónica en este caso solo obtiene capacidades predictivas destacables para Población y para Número Total Declaraciones. Sin embargo, como ocurría en el caso de la primera variable canónica económica, en el caso electoral, los mejores resultados en cuanto a la capacidad de predecir las variables económicas se obtienen en el grupo de municipios urbanos, puesto que en la mayoría de las variables se presenta dicho valor por encima de 0.65, a excepción de las rentas y el Paro Total. Regresión Logística Debido a que, con los dos análisis anteriores, tampoco se han obtenido relaciones claras entre los dos tipos de variables, se planteará para cada uno de los tres tipos de municipio, una regresión logística con las variables electorales como respuesta y como explicativas las variables económicas. Se utilizarán para analizar las posibles diferencias entre modelos, en base a que variables aumentan la probabilidad de que la mayoría de voto se encuentre en cada tipo de opción electoral. La principal utilidad de la regresión logística, es que permite estimar la probabilidad de una variable categórica en función de una o varias variables numéricas, siempre que la variable categórica sea binaria. Todos los modelos que se plantearán en este punto, corresponderán a regresión logística múltiple, puesto que presentarán más de un predictor, y presentarán la siguiente forma, suponiendo Y como variable respuesta y X1, X2, …, Xn como predictores: 70 ln(𝑃(𝑌=1|𝑋) (1−𝑃(𝑌=1|𝑋)))=𝛽0+𝛽1𝑋1+𝛽2𝑋2+⋯+𝛽𝑛𝑋𝑛 Por lo tanto, el valor de la probabilidad de que la variable respuesta sea 1 dados los valores de las covariables, se obtendrá: P(Y=1|X)= 𝑒𝛽0+𝛽1𝑋1+𝛽2𝑋2+⋯+𝛽𝑛𝑋𝑛 1+𝑒𝛽0+𝛽1𝑋1+𝛽2𝑋2+⋯+𝛽𝑛𝑋𝑛 Una vez obtenidas las estimaciones de cada coeficiente del modelo, podrá conocerse la probabilidad de que un individuo pertenezca a un grupo u otro de la variable respuesta, dado un valor concreto de cada variable predictora, de la siguiente forma: 𝑃(Y=1|X)= 𝑒𝛽0 +𝛽1 𝑋1+𝛽2 𝑋2+⋯+𝛽𝑛 𝑋𝑛 1+𝑒𝛽0 +𝛽1 𝑋1+𝛽2 𝑋2+⋯+𝛽𝑛 𝑋𝑛 Por lo tanto, cada coeficiente indica el cambio en el logaritmo debido al incremento en una unidad del valor de la variable explicativa asociada. Para evaluar la calidad de cada modelo, se utilizará la matriz de confusión, que tiene como función principal mostrar el número de individuos cuya asignación ha sido errónea. Se trata de una tabla comparativa entre observaciones y predicciones: Predicciones 0 1 Observaciones 0 VN FP 1 FN VP Tabla 32. Matriz de confusión Los valores que se encuentran en la diagonal principal, corresponden con los valores estimados correctamente por el modelo, puesto que son los “Verdaderos Negativos” y los “Verdaderos Positivos”. Por el contrario, la diagonal opuesta muestra los individuos que se han asignado de forma errónea. Existen 3 medidas que pueden extraerse a partir de la matriz. En primer lugar, la exactitud, que muestra la proporción de predicciones correctas frente al total. Por otro lado, la sensibilidad, que muestra la tasa de verdaderos positivos. Si un modelo es “poco sensible”, podría decirse que clasifica muchos individuos como negativos, cuando realmente son positivos. Por último, la especificidad, que representa la tasa de verdaderos negativos. Cómo el conjunto de datos disponible es poco equilibrado, la excatitud no resultará útil para evaluar la calidad de los modelos, por lo tanto, se utilizarán únicamente la sensibilidad y la especificidad, calculadas de la siguiente forma: 𝑠𝑒𝑛𝑠𝑖𝑏𝑖𝑙𝑖𝑑𝑎𝑑= 𝑉𝑃 𝑉𝑃+𝐹𝑁 𝑒𝑠𝑝𝑒𝑐𝑖𝑓𝑖𝑐𝑖𝑑𝑎𝑑= 𝑉𝑁 𝑉𝑁+𝐹𝑃 71 En primer lugar, se plantean 3 nuevas variables que se utilizarán para representar las variables electorales como respuestas a los los distintos modelos:  𝑀𝑎𝑦𝑜𝑟í𝑎𝐷𝑒𝑟𝑒𝑐ℎ𝑎 {1 𝑠𝑖 𝐷>𝐼 𝑦 𝑂 0 𝑒𝑛 𝑜𝑡𝑟𝑜 𝑐𝑎𝑠𝑜}  𝑀𝑎𝑦𝑜𝑟í𝑎𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎 {1 𝑠𝑖 𝐼>𝐷 𝑦 𝑂 0 𝑒𝑛 𝑜𝑡𝑟𝑜 𝑐𝑎𝑠𝑜}  𝑀𝑎𝑦𝑜𝑟í𝑎𝑂𝑡𝑟𝑜𝑠 {1 𝑠𝑖 𝑂>𝐼 𝑦 𝐷 0 𝑒𝑛 𝑜𝑡𝑟𝑜 𝑐𝑎𝑠𝑜} Antes de aplicar la regresión logística, resulta interesante observar la distribución de las 3 variables electorales, para ver cómo se reparten los votos en cada tipo de municipio: MayoríaDerecha MayoríaIzquierda MayoríaOtros General 274 128 51 0.60 0.28 0.12 Rurales 197 90 39 0.60 0.28 0.12 Semirurales 63 33 8 0.60 0.32 0.08 Urbanos 14 5 4 0.61 0.22 0.17 Tabla 33. Distribución de mayorías electorales por tipo de municipio Como se puede observar en la tabla superior, en cualquiera de los 3 tipos, se da la mayoría de voto a partidos de derechas en aproximadamente el 60% de los municipios. Además, puesto que los municipios rurales son el grupo mayoritario (329 de los 456), la distribución de la mayoría de voto es la misma que en el conjunto inicial. Las diferencias se producen en los municipios semirurales y en los urbanos. En el primer grupo, disminuye la proporción de municipios que presentan su mayoría en Otros, y aumentan los que la presentan en Izquierda, con porcentajes del 8% y 32%, respectivamente. En los municipios urbanos, ocurre lo contrario, aumenta la proporción de municipios con mayoría de voto a Otros partidos y disminuye para la Izquierda, obteniéndose el 17% y 22%. Puesto que los municipios en los que la mayoría de voto se da en el grupo Otros, son un porcentaje muy pequeño en los 3 tipos de municipio, se eliminarán aquellos que cumplan dicha condición, de tal forma que se cumplirá la siguiente relación para las dos variables restantes: 𝑀𝑎𝑦𝑜𝑟í𝑎𝐷𝑒𝑟𝑒𝑐ℎ𝑎=1−𝑀𝑎𝑦𝑜𝑟í𝑎𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎 Y se realizarán los modelos logísticos con los municipios que queden, de esta forma podrán encontrarse conclusiones interesantes que indiquen con qué variables aumenta 𝑃(𝑀𝑎𝑦𝑜𝑟í𝑎𝐷𝑒𝑟𝑒𝑐ℎ𝑎=1) y, por lo tanto disminuye 𝑃(𝑀𝑎𝑦𝑜𝑟í𝑎𝐼𝑧𝑞𝑢𝑖𝑒𝑟𝑑𝑎=1). Por otra parte, se seleccionará el mejor modelo en base al criterio del menor AIC, puesto que se debe elegir un modelo final para cada tipo de municipio. Esta tarea se realizará mediante el método Backward de selección de variables, que comienza por incluir todas las variables posibles en el modelo y las va eliminando una a una, expluyendo en cada paso la variable menos influyente. 72 En cuanto a las posibles variables a incluir en los modelos, para el número de empresas, declaraciones, paro, contratos, licencias, trabajadores y establecimientos, se considerar valores relativos por cada 1000 habitantes. De esta forma no será necesario considerar la población. Para los municipios rurales, no se ha encontrado ningún modelo que obtenga resultados de interés. Esto se debe a que en este tipo de municipios los resultados electorales dependen más de las personas que se presentan que de las ideologías y este hecho podría enmascarar las relaciones entre variables. Por lo tanto, únicamente se tendrán en cuenta los municipios semirurales y los urbanos, es decir, aquellos cuya población sea superior a los 2000 habitantes. En primer lugar, se muestran los resultados obtenidos para los municipios semirurales. El primer paso, ha sido generar el modelo completo, para aplicar posteriormente el algoritmo Backward y seleccionar de esta forma las variables más últiles: Ilustración 86. Regresión Logística Semirural 1 Como se puede observar, el AIC es 131.32, y la única variable que resulta significativa a la hora de ser incluida en el modelo es el número de contratos por cada 1000 habitantes. Por lo tanto, tras aplicar el algoritmo Backward se obtienen los siguientes resultados: Ilustración 87. Regresión logística Semirural 2 El modelo óptimo presenta un AIC de 121, sin embargo, parece demasiado simple, puesto que únicamente tiene en cuenta la variable contratos, y por lo tanto se intentará encontrar un modelo más complejo de tal forma que su AIC no crezca demasiado. Si se examina la traza que ha generado el algoritmo: 73 Ilustración 88. Regresión logística Semirural 3 Se seleccionará el modelo anterior, puesto que su AIC (122.17) es bastante similar al mínimo obtenido e incluye las variables que presentaban los p-valores más pequeños, en cuanto a contrastar su significancia en el modelo. Por lo tanto, se obtiene: ln(𝑃(𝑚𝑎𝑦𝑜𝑟𝑖𝑎𝐷𝑒𝑟𝑒𝑐ℎ𝑎=1) (1−𝑃(𝑚𝑎𝑦𝑜𝑟𝑖𝑎𝐷𝑒𝑟𝑒𝑐ℎ𝑎=1)))=−0.4+9.77𝐸𝑚𝑝𝑟𝑒𝑠𝑎𝑠+10.14𝐶𝑜𝑛𝑡𝑟𝑎𝑡𝑜𝑠−6.08𝐿𝑖𝑐𝑒𝑛 Predicciones 0 1 Observaciones 0 9 24 1 4 59 Tabla 34. Matriz Confusión Semirurales 𝑠𝑒𝑛𝑠𝑖𝑏𝑖𝑙𝑖𝑑𝑎𝑑= (59) (59+4)=0.94 𝑒𝑠𝑝𝑒𝑐𝑖𝑓𝑖𝑐𝑖𝑑𝑎𝑑= (9) (24+9)=0.27 El modelo estimado en los municipios semirurales, indica que, el voto mayoritario a la derecha está asociado a valores grandes de las variables Empresas y Contratos y a valores pequeños de la variable licencias. El modelo presenta valores altos para la sensibilidad, del 94%, lo que quiere decir que apenas se le escapan casos en los que la mayoría de voto sea para la derecha, al contrario de lo que ocurre con la especificidad, que es del 27%, y por lo tanto no resulta útil para discriminar los casos en los que la mayoría de voto es a la izquierda. Para terminar, se muestran los resultados para los municipios urbanos, donde se encuentran los resultados más relevantes, puesto que, aunque se trata de un pequeño número de municipios, es donde se encuentra recogida la mayor parte la población. Se comenzará por generar el modelo completo, para aplicar posteriormente el algoritmo Backward, obteniendo: 80 LISTA DE FIGURAS Ilustración 1.Unión de Datos .................................................................................................... 11 Ilustración 2. Exploración Tipo Municipio ............................................................................... 17 Ilustración 3. Exploración Población ....................................................................................... 17 Ilustración 4. Exploración Renta por Persona ........................................................................ 18 Ilustración 5. Exploración Renta por Persona por Tipo Municipio ....................................... 18 Ilustración 6. Exploración Renta por Hogar ........................................................................... 19 Ilustración 7. Exploración Renta por Hogar por Tipo Municipio .......................................... 19 Ilustración 8. Exploración Empresas por cada 1000 habitantes .......................................... 20 Ilustración 9. Exploración Empresas por cada 1000 habitantes Tipo Municipio ............... 20 Ilustración 10. Exploración Declaraciones por cada 1000 habitantes .............................. 21 Ilustración 11. Exploración Declaraciones por cada 1000 habitantes Tipo Municipio .... 21 Ilustración 12. Exploración Paro por cada 1000 habitantes ................................................ 22 Ilustración 13. Exploración Paro por cada 1000 habitantes Tipo Municipio ...................... 22 Ilustración 14. Exploración Contratos por cada 1000 habitantes ....................................... 23 Ilustración 15. Exploración Contratos por cada 1000 habitantes Tipo Municipio ............. 23 Ilustración 16. Exploración Licencias por cada 1000 habitantes ........................................ 24 Ilustración 17. Exploración Licencias por cada 1000 habitantes Tipo Municipio .............. 24 Ilustración 18. Exploración Trabajadores por cada 1000 habitantes ................................. 25 Ilustración 19. Exploración Trabajadores por cada 1000 habitantes Tipo Municipio ....... 25 Ilustración 20. Exploración Establecimientos por cada 1000 habitantes ........................... 26 Ilustración 21. Exploración Establecimientos por cada 1000 habitantes ........................... 26 Ilustración 22. Exploración Derecha por cada 1000 habitantes ......................................... 27 Ilustración 23. Exploración Derecha por cada 1000 habitantes Tipo Municipio .............. 27 Ilustración 24. Exploración Izquierda por cada 1000 habitantes ........................................ 28 Ilustración 25. Exploración Izquierda por cada 1000 habitantes Tipo Municipio .............. 28 Ilustración 26. Exploración Otros por cada 1000 habitantes ............................................... 29 Ilustración 27. Exploración Otros por cada 1000 habitantes Tipo Municipio ..................... 29 Ilustración 28. Gráfico de Autovalores ................................................................................... 32 Ilustración 29. Contribución por Variables ............................................................................. 33 Ilustración 30. Contribuciones a la Componente 1 .............................................................. 34 Ilustración 31. Contribuciones a la Componente 2 .............................................................. 35 Ilustración 32. Contribuiones a la Componente 4 ................................................................ 35 Ilustración 33. Contribuciones a la Componente 5 .............................................................. 36 Ilustración 34. Contribuciones a la componente 8 .............................................................. 36 Ilustración 35. Plano por componentes 1-2 ........................................................................... 37 Ilustración 36. Plano por componentes 1-4 ........................................................................... 37 Ilustración 37. Plano pr componentes 1-5 .............................................................................. 38 Ilustración 38. Plano por componentes 1-8 ........................................................................... 38 Ilustración 39. Plano por componentes 2-4, 2-5 y 2-8 ........................................................... 39 Ilustración 40. Plano por componentes 4-5 ........................................................................... 40 Ilustración 41. Plano por componentes 4-8 ........................................................................... 40 Ilustración 42. Plano por componentes 5-8 ........................................................................... 41 Ilustración 43. Representación Variables Canónicas ........................................................... 42 Ilustración 44. Variables Canónicas y su significancia ......................................................... 43 Ilustración 45. Análisis de redundancia canónico ................................................................ 45 Ilustración 46. Correlaciones múltiples cuadradas entre v.electorales y v.canónicas opuestas ..................................................................................................................................... 46 81 Ilustración 47. Correlaciones múltiples cuadradas entre v.económicas y v.canónicas opuestas ..................................................................................................................................... 46 Ilustración 48. Número óptimo de clústeres .......................................................................... 47 Ilustración 49. Resultado Algoritmo K-means ........................................................................ 47 Ilustración 50. Dendograma Complete Linkage................................................................... 49 Ilustración 51. Dendograma Average Linkage ..................................................................... 49 Ilustración 52. Dendograma Single Linkage .......................................................................... 49 Ilustración 53. Dendograma Complete Linkage y distancia euclídea .............................. 50 Ilustración 54. Conectividad. Índice de Dunn. Silueta ......................................................... 50 Ilustración 55. Test de Tukey para Población, Derecha e Izquierda .................................. 52 Ilustración 56. Test de Tukey para Otros, Empresas y Declaraciones ................................. 52 Ilustración 57. Test de Tukey para Paro, Contratos y Licencias ........................................... 52 Ilustración 58. Test de Tukey para Trabajadores y Establecimientos .................................. 53 Ilustración 59. Independencia y homocedasticidad para Población, Derecha, Izquierda y Otros ........................................................................................................................................ 53 Ilustración 60. Independencia y homocedasticidad para Empresas, Declaraciones, Paro y Contratos ................................................................................................................................ 54 Ilustración 61. Independencia y homocedasticidad para Licencias, Trabajadores y Establecimientos ....................................................................................................................... 54 Ilustración 62. Normalidad residuos para Población, Derecha, Izquierda y Otros ........... 54 Ilustración 63. Normalidad residuos para Empresas, Declaraciones, Paro y Contratos .. 55 Ilustración 64. Normalidad residuos para Licencias, Trabajadores y Establecimientos ... 55 Ilustración 65. ANOVA renta neta media por persona ........................................................ 55 Ilustración 66. Condiciones ANOVA renta neta media por persona ................................. 56 Ilustración 67. ANOVA renta neta media por hogar ............................................................ 56 Ilustración 68. Tukey renta neta media por hogar ................................................................ 56 Ilustración 69. Condiciones ANOVA renta neta media por hogar ..................................... 57 Ilustración 70. Gráfico de autovalores por tipo de municipio ............................................ 58 Ilustración 71. Contribuciones a las componentes 1 y 2 para rurales ................................ 60 Ilustración 72. Contribuciones a las componentes 1 y 2 para semirurales ........................ 60 Ilustración 73. Contribuciones a las componentes 1 y 2 para urbanos ............................. 61 Ilustración 74. Plano por componentes 1-2 rurales ............................................................... 61 Ilustración 75. Plano por componentes 1-2 semirurales ....................................................... 62 Ilustración 76. Plano por componentes 1-2 urbanos ............................................................ 62 Ilustración 77. Correlaciones entre variables Rurales ........................................................... 63 Ilustración 78. Correlaciones entre variables Semirurales .................................................... 63 Ilustración 79. Correlaciones entre variables Urbanos ......................................................... 64 Ilustración 80. Variables canónicas y su significancia Rurales ............................................ 64 Ilustración 81. Variables canónicas y su significancia Semirurales ..................................... 65 Ilustración 82. Variables canónicas y su significancia Urbanos .......................................... 65 Ilustración 83. Análisis Redundancia Canónico Rurales ...................................................... 68 Ilustración 84. Análisis Redundancia Canónico Semirurales ............................................... 68 Ilustración 85. Análisis Redundancia Canónico Urbanos .................................................... 68 Ilustración 86. Regresión Logística Semirural 1 ....................................................................... 72 Ilustración 87. Regresión logística Semirural 2 ........................................................................ 72 Ilustración 88. Regresión logística Semirural 3 ........................................................................ 73 Ilustración 89. Regresión Logística Urbanos 1 ........................................................................ 74 Ilustración 90. Regresión Logística Urbanos 2 ........................................................................ 74 Ilustración 91. Regresión Logística Urbanos 3 ........................................................................ 74 82 LISTA DE TABLAS Tabla 1. Tipo de municipio ....................................................................................................... 16 Tabla 2. Población por Tipo de Municipio ............................................................................. 17 Tabla 3. Estadísticos Población ............................................................................................... 17 Tabla 4. Estadísticos Renta por Persona ................................................................................. 18 Tabla 5. Estadísticos Renta por Hogar .................................................................................... 18 Tabla 6. Estadísticos Empresas por cada 1.000 habitantes ................................................. 19 Tabla 7. Estadísticos Delaraciones por cada 1000 habitantes ........................................... 20 Tabla 8. Estadísticos Paro por cada 1000 habitantes ........................................................... 21 Tabla 9. Estadísticos Contratos por cada 1000 habitantes ................................................. 22 Tabla 10. Estadísticos Número Licencias por cada 1000 habitantes ................................. 23 Tabla 11. Estadísticos Trabajadores por cada 1000 habitantes .......................................... 24 Tabla 12. Estadísticos Establecimientos por cada 1000 habitantes ................................... 25 Tabla 13. Estadísticos Derecha por cada 1000 habitantes ................................................. 26 Tabla 14. Estadísticos Izquierda por cada 1000 habitantes ................................................. 27 Tabla 15. Estadísticos Otros por cada 1000 habitantes ....................................................... 28 Tabla 16. Variables por Tipo de Municipio ............................................................................. 29 Tabla 17. Varianza Explicada por Componentes ................................................................. 32 Tabla 18. Correlaciones entre variables económicas y electorales .................................. 43 Tabla 19. Coeficientes Estandarizados Variables Electorales ............................................. 44 Tabla 20. Coeficientes Estandarizados Variables Económicas ........................................... 44 Tabla 21. Correlaciones entre variables electorales y variables canónicas del mismo grupo .......................................................................................................................................... 44 Tabla 22. Correlaciones entre variables económicas y variables canónicas del grupo opuesto ...................................................................................................................................... 44 Tabla 23. Correlaciones entre variables electorales y variables canónicas del grupo opuesto ...................................................................................................................................... 45 Tabla 24. Correlaciones entre variables económicas y variables canónicas del mismo grupo .......................................................................................................................................... 45 Tabla 25. Clasifiación Clúster por tipo de municipio ............................................................ 51 Tabla 26. Correlaciones v.electorales y v.canónicas del mismo grupo ............................ 67 Tabla 27. Correlaciones v.económicas y v.canónicas del grupo opuesto ...................... 67 Tabla 28. Correlaciones v.electorales y v.canónicas del grupo opuesto ......................... 67 Tabla 29. Correlaciones v.económicas y v.canónicas del mismo grupo .......................... 67 Tabla 30. Correlaciones múltiples cuadradas v.electorales y v.canónicas opuestas ..... 68 Tabla 31. Correlaciones múltiples cuadradas v.económicas y v.canónicas opuestas .. 69 Tabla 32. Matriz de confusión .................................................................................................. 70 Tabla 33. Distribución de mayorías electorales por tipo de municipio .............................. 71 Tabla 34. Matriz Confusión Semirurales .................................................................................. 73 Tabla 35. Matriz Confusión Urbanos ........................................................................................ 75 Tabla 36. Valores medios Modelo 1 ........................................................................................ 75 Tabla 37. Valores medios Modelo 2 ........................................................................................ 76 83 ANEXO DE CÓDIGOS OBTENCIÓN DE DATOS Creación de las nuevas variables electorales #CARGAR LAS LIBRERIAS library(readxl) library(dplyr) library (xlsx) #LECTURA DEL ARCHIVO paraDepurar<-read_excel("C:/…/auxiliar.xlsx") #DERECHA: #PARTIDO POPULAR, CIUDADANOS-PARTIDO DE LA CIUDADANIA,VOX Derecha<-paraDepurar$`PP`+paraDepurar$`Cs`+paraDepurar$VOX #IZQUIERDA: #PARTIDO SOCIALISTA OBRERO ESPAÑOL,UNIDAS PODEMOS IZQUIERDA UNIDA,IZQUIERDA UNIDA, PODEMOS, PODEMOS-EQUO Izquierda<- paraDepurar$`PSOE`+paraDepurar$`PODEMOS.IU`+paraDepurar$`IU`+paraDepurar$PODEM OS+paraDepurar$`PODEMOS EQUO` #Se eliminan los partidos de DERECHA Y DE IZQUIERDA paraDep<-select(paraDepurar,-PP,-Cs,-VOX,-PSOE,-PODEMOS.IU,-IU,-PODEMOS,- `PODEMOS EQUO`) #OTROS:RESTO DE PARTIDOS Otros<-rowSums(paraDep) #Se añaden las 3 nuevas variables a los datos datosDIO<-cbind(Derecha,Izquierda,Otros) #Creacion del nuevo archivo auxiliarDIO<- write.xlsx(datosDIO,"C:/Users/maria/Desktop/TFGNoviembre/escribir2/a8DIO.xlsx" ,col.names = TRUE, row.names = TRUE) UNIÓN DE LOS DATOS Unión Izquierda #Cargar las librerías library(readxl) library(dplyr) library (xlsx) library(data.table) library(tidyverse) #Cargar los archivos archivo7<-read_excel("C:/…/archivo7j.xlsx") archivo12<-read_excel("C:/…/archivo12j.xlsx") archivo3<-read_excel("C:/…/archivo3j.xlsx") archivo4<-read_excel("C:/…/archivo4j.xlsx") archivo5<-read_excel("C:/…/archivo5j.xlsx") archivo6<-read_excel("C:/…/archivo6j.xlsx") #Convertir los archivos en data.table a7DT<-as.data.table(archivo7) a12DT<-as.data.table(archivo12) a3DT<-as.data.table(archivo3) a4DT<-as.data.table(archivo4) a5DT<-as.data.table(archivo5) a6DT<-as.data.table(archivo6) #Unir los archivos a712DT<-a7DT %>% left_join(a12DT, by = "Municipio") a7123DT<-a712DT %>% left_join(a3DT, by = "Municipio") a71234DT<-a7123DT %>% left_join(a4DT, by = "Municipio") a712345DT<-a71234DT %>% 84 left_join(a5DT, by = "Municipio") a7123456DT<-a712345DT %>% left_join(a6DT, by = "Municipio") #Crear nuevo archivo a7123456<-write.xlsx(a7123456DT,"C:/…/archivoJ.xlsx",col.names = TRUE, row.names = TRUE) DEPURACIÓN DE LOS DATOS Restricciones para la variable Población #Cargar las librerías library(readxl) library(dplyr) library (xlsx) #Cargar el archivo datosLimpios<-read_excel("C:/…/archivoJ.xlsx") #Aplicar restricciones a la variable Población d500<-datosLimpios[as.numeric(datosLimpios$Poblacion)>500,] d100<-datosLimpios[as.numeric(datosLimpios$Poblacion)>100,] #Crear los nuevos archivos datos1.500<-write.xlsx(d500,"C:/…/archivo500J.xlsx",col.names = TRUE, row.names = TRUE) datos1.100<-write.xlsx(d100,"C:/…/archivo100J.xlsx",col.names = TRUE, row.names = TRUE) EXPLORACIÓN DE LOS DATOS #Cargar las librerías library(readxl) library (xlsx) library(ggplot2) library(ggthemes) #Cargar el archivo datos<-read_excel("C:/…/archivo500J0.xlsx") names(datos) #Crear la variable tipoMunicipio tipoMunicipio<-rep(0,length(datos$Poblacion)) pob<-datos$Poblacion for (i in 1:length(tipoMunicipio)) { if(pob[i]<2000){ tipoMunicipio[i]<-"rural" } if(pob[i]>2000 & pob[i]<=10000){ tipoMunicipio[i]<-"semiRural" } if(pob[i]>10000){ tipoMunicipio[i]<-"urbano" } } #Añadir la variable a los datos datos<-cbind(datos,tipoMunicipio) #Modificar los datos datos$`Renta neta media por persona`<-as.numeric(datos$`Renta neta media por persona`) datos$`Renta neta media por hogar`<-as.numeric(datos$`Renta neta media por hogar`) datos$`Total Empresas por Municipio`<-as.numeric(datos$`Total Empresas por Municipio`) datos$`Numero Total Declaraciones`<-as.numeric(datos$`Numero Total Declaraciones`) datos$tipoMunicipio<-as.factor(datos$tipoMunicipio) #Frecuencia de la variable tipoMunicipio table(datos$tipoMunicipio) prop.table(table(datos$tipoMunicipio)) ggplot(data = datos, aes(x = datos$tipoMunicipio)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + 85 xlab("Tipo de Municipio") + ylab("Frecuencia") + ggtitle("Frecuencia de Tipo de Municipio") poblacionTotal<-sum(datos$Poblacion) rural<-datos[which(datos$tipoMunicipio=="rural"),] poblacionRural<-sum(rural$Poblacion) propPobRural<-poblacionRural/poblacionTotal semiRural<-datos[which(datos$tipoMunicipio=="semiRural"),] poblacionSemi<-sum(semiRural$Poblacion) propPobSemi<-poblacionSemi/poblacionTotal urbano<-datos[which(datos$tipoMunicipio=="urbano"),] poblacionUrbana<-sum(urbano$Poblacion) propPobUrbana<-poblacionUrbana/poblacionTotal #Poblacion summary(datos$Poblacion) L<-c(500,1000,2000,5000,10000,30000,50000,70000,110000,130000,170000,300000) intervaloPoblacion<-cut(datos$Poblacion, breaks = L, right = FALSE, include.lowest = TRUE, labels = c("(500,1000]", "(1000,2000]","(2000,5000]","(5000,10000]","(10000,30000]","(30000,50000]" ,"(50000,70000]","(70000,110000]","(110000,130000]","(130000,170000]", "(170000,300000]")) datos<-cbind(datos,intervaloPoblacion) ggplot(data = datos, aes(x = datos$intervaloPoblacion)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Intervalos de Poblacion") + ylab("Frecuencia") + ggtitle("Frecuencia de Poblacion por Intervalos") #Renta neta media por persona summary(datos$`Renta neta media por persona`) ggplot(datos, aes(x=datos$`Renta neta media por persona`)) + ggtitle("Renta neta media por persona") + theme_fivethirtyeight() + geom_histogram(bins = 9,color="#28324a", fill="#3c78d8") ggplot(datos) + geom_histogram(bins = 9, aes(x = datos$`Renta neta media por persona`, fill = datos$tipoMunicipio), color = 'black') + facet_grid(tipoMunicipio~., scales = 'free') + xlab("Renta neta media por persona") + ylab("Frecuencia") + ggtitle("Distribución de la variable Renta neta media por persona para los distintos tipos de municipio") + theme_minimal()+ labs(fill = 'Tipo de Municipio') #Renta neta media por hogar summary(datos$`Renta neta media por hogar`) ggplot(datos, aes(x=datos$`Renta neta media por hogar`)) + ggtitle("Renta neta media por hogar") + theme_fivethirtyeight() + geom_histogram(bins = 9,color="#28324a", fill="#3c78d8") ggplot(datos) + geom_histogram(bins = 9, aes(x = datos$`Renta neta media por hogar`, fill = datos$tipoMunicipio), color = 'black') + facet_grid(tipoMunicipio~., scales = 'free') + xlab("Renta neta media por hogar") + ylab("Frecuencia") + ggtitle("Distribución de la variable Renta neta media por hogar para los distintos tipos de municipio") + theme_minimal()+ labs(fill = 'Tipo de Municipio') #Total Empresas pobTotal<-sum(datos$Poblacion) emp1000<-rep(0,length(datos$`Total Empresas por Municipio`)) emp<-datos$`Total Empresas por Municipio` for (i in 1:length(emp1000)) { emp1000[i]<-(emp[i]/pobTotal)*1000 86 } summary(emp1000) datos<-cbind(datos,emp1000) L2<-c(0,0.01,0.02,0.03,0.04,0.05,0.75,0.1,0.5,1,5,10) intervaloEmpresas<-cut(datos$emp1000, breaks = L2, right = FALSE, include.lowest = TRUE, labels = c("(0,0.01]", "(0.01,0.02]","(0.02,0.3]","(0.03,0.04]","(0.04,0.05]","(0.05,0.1]" ,"(0.1,0.5]","(0.5,0.75]","(0.75,1]","(1,5]", "(5,10]")) datos<-cbind(datos,intervaloEmpresas) ggplot(data = datos, aes(x = datos$intervaloEmpresas)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Empresas por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia Empresas ") ggplot(datos, aes(datos$intervaloEmpresas, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Empresas por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Numero Declaraciones decl1000<-rep(0,length(datos$`Numero Total Declaraciones`)) decl<-datos$`Numero Total Declaraciones` for (i in 1:length(decl1000)) { decl1000[i]<-(decl[i]/pobTotal)*1000 } summary(decl1000) datos<-cbind(datos,decl1000) L3<-c(0.03,0.04,0.05,0.1,0.25,0.5,1,5,10,30,50,82) intervaloDeclaraciones<-cut(datos$decl1000, breaks = L3, right = FALSE, include.lowest = TRUE, labels = c("(0.03,0.04]", "(0.04,0.05]","(0.05,0.1]","(0.1,0.25]","(0.25,0.5]","(0.5,1]" ,"(1,5]","(5,10]","(10,30]","(30,50]", "(50,82]")) datos<-cbind(datos,intervaloDeclaraciones) ggplot(data = datos, aes(x = datos$intervaloDeclaraciones)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Declaraciones por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia Declaraciones") ggplot(datos, aes(datos$intervaloDeclaraciones, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Declaraciones por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Paro Total paro1000<-rep(0,length(datos$`Paro Total`)) paro<-datos$`Paro Total` for (i in 1:length(paro1000)) { paro1000[i]<-(paro[i]/pobTotal)*1000 } summary(paro1000) datos<-cbind(datos,paro1000) L4<-c(0.003,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,8.5) intervaloParo<-cut(datos$paro1000, breaks = L4, right = FALSE, include.lowest = TRUE, labels = c("(0.003,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,8.5]")) datos<-cbind(datos,intervaloParo) ggplot(data = datos, aes(x = datos$intervaloParo)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Paro por cada 1000 habitantes") + ylab("Frecuencia") + 87 ggtitle("Frecuencia Paro") ggplot(datos, aes(datos$intervaloParo, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Paro por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Total Contratos contratos1000<-rep(0,length(datos$`Total Contratos`)) contratos<-datos$`Total Contratos` for (i in 1:length(contratos1000)) { contratos1000[i]<-(contratos[i]/pobTotal)*1000 } summary(contratos1000) datos<-cbind(datos,contratos1000) L5<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,7.1) intervaloContratos<-cut(datos$contratos1000, breaks = L5, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,7.1]")) datos<-cbind(datos,intervaloContratos) ggplot(data = datos, aes(x = datos$intervaloContratos)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Contratos por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia Contratos") ggplot(datos, aes(datos$intervaloContratos, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Contratos por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Numero Licencias licencias1000<-rep(0,length(datos$`Numero Total Licencias`)) licencias<-datos$`Numero Total Licencias` for (i in 1:length(licencias1000)) { licencias1000[i]<-(licencias[i]/pobTotal)*1000 } summary(licencias1000) datos<-cbind(datos,licencias1000) L6<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,13.1) intervaloLicencias<-cut(datos$licencias1000, breaks = L6, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,13.1]")) datos<-cbind(datos,intervaloLicencias) ggplot(data = datos, aes(x = datos$intervaloLicencias)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Numero Licencias por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia de Numero Licencias") ggplot(datos, aes(datos$intervaloLicencias, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Numero Licencias por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Numero Trabajadores trabajadores1000<-rep(0,length(datos$`Numero Trabajadores`)) trabajadores<-datos$`Numero Trabajadores` for (i in 1:length(trabajadores1000)) { trabajadores1000[i]<-(trabajadores[i]/pobTotal)*1000 } summary(trabajadores1000) datos<-cbind(datos,trabajadores1000) L7<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,10.6) 88 intervaloTrabajadores<-cut(datos$trabajadores1000, breaks = L7, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,10.6]")) datos<-cbind(datos,intervaloTrabajadores) ggplot(data = datos, aes(x = datos$intervaloTrabajadores)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Trabajadores por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia Trabajadores") ggplot(datos, aes(datos$intervaloTrabajadores, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Trabajadores por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Numero Establecimientos estab1000<-rep(0,length(datos$`Numero Establecimientos`)) estab<-datos$`Numero Establecimientos` for (i in 1:length(estab1000)) { estab1000[i]<-(estab[i]/pobTotal)*1000 } summary(estab1000) datos<-cbind(datos,estab1000) L8<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,1.5,2,3.8) intervaloEstablecimientos<-cut(datos$estab1000, breaks = L8, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,1.5]","(1.5,2]", "(2,3.8]")) datos<-cbind(datos,intervaloEstablecimientos) ggplot(data = datos, aes(x = datos$intervaloEstablecimientos)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Establecimientos por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia Establecimientos") ggplot(datos, aes(datos$intervaloEstablecimientos, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Establecimientos por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Derecha derecha1000<-rep(0,length(datos$Derecha)) derecha<-datos$Derecha for (i in 1:length(derecha1000)) { derecha1000[i]<-(derecha[i]/pobTotal)*1000 } summary(derecha1000) datos<-cbind(datos,derecha1000) L9<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,39.1) intervaloDerecha<-cut(datos$derecha1000, breaks = L9, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,39.1]")) datos<-cbind(datos,intervaloDerecha) ggplot(data = datos, aes(x = datos$intervaloDerecha)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Derecha por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia de Derecha") ggplot(datos, aes(datos$intervaloDerecha, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ 89 labs(x= "Derecha por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Izquierda izquierda1000<-rep(0,length(datos$Izquierda)) izquierda<-datos$Izquierda for (i in 1:length(izquierda1000)) { izquierda1000[i]<-(izquierda[i]/pobTotal)*1000 } summary(izquierda1000) datos<-cbind(datos,izquierda1000) L10<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,30.9) intervaloIzqu<-cut(datos$izquierda1000, breaks = L10, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,30.9]")) datos<-cbind(datos,intervaloIzqu) ggplot(data = datos, aes(x = datos$intervaloIzqu)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Izquierda por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia de Izquierda") ggplot(datos, aes(datos$intervaloIzqu, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Izquierda por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Otros otros1000<-rep(0,length(datos$Otros)) otros<-datos$Otros for (i in 1:length(otros1000)) { otros1000[i]<-(otros[i]/pobTotal)*1000 } summary(otros1000) datos<-cbind(datos,otros1000) L11<-c(0,0.005,0.01,0.02,0.05,0.1,0.2,0.5,1,2,5,9.3) intervaloOtros<-cut(datos$otros1000, breaks = L11, right = FALSE, include.lowest = TRUE, labels = c("(0,0.005]", "(0.005,0.01]","(0.01,0.02]","(0.02,0.05]","(0.05,0.1]","(0.1,0.2]" ,"(0.2,0.5]","(0.5,1]","(1,2]","(2,5]", "(5,9.3]")) datos<-cbind(datos,intervaloOtros) ggplot(data = datos, aes(x = datos$intervaloOtros)) + geom_bar(color = 'darkslategray', fill = 'steelblue') + xlab("Otros por cada 1000 habitantes") + ylab("Frecuencia") + ggtitle("Frecuencia de Otros") ggplot(datos, aes(datos$intervaloOtros, fill=datos$tipoMunicipio)) + geom_bar(position="dodge",colour="black")+ labs(x= "Otros por cada 1000 habitantes", y="Frecuencias", fill="Tipo Municipio") #Proporciones de variables por tipo de municipio rural<-datos[which(datos$tipoMunicipio=="rural"),] semiRural<-datos[which(datos$tipoMunicipio=="semiRural"),] urbano<-datos[which(datos$tipoMunicipio=="urbano"),] #Población poblacionTotal<-sum(datos$Poblacion) poblacionRural<-sum(rural$Poblacion) propPobRural<-poblacionRural/poblacionTotal poblacionSemi<-sum(semiRural$Poblacion) propPobSemi<-poblacionSemi/poblacionTotal poblacionUrbana<-sum(urbano$Poblacion) propPobUrbana<-poblacionUrbana/poblacionTotal 96 intervalsot<-TukeyHSD(fmot) intervalsot plot(intervalsot) plot(fmot$residuals) qqnorm(fmot$residuals) qqline(fmot$residuals) boxplot(fmot$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) for (i in 1:length(otros)){ if(otros[i]==0){ otros[i]<-0.000001 } } logot<-log(otros) for (i in 1:length(logot)){ if(logot[i]==log(0.000001)){ logot[i]<-0 } } boxplot(logot~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Votos Otros") fmlogot<-aov(lm(logot~cluster)) summary(fmlogot) intervalslogot<-TukeyHSD(fmlogot) intervalslogot plot(intervalslogot) plot(fmlogot$residuals) qqnorm(fmlogot$residuals) qqline(fmlogot$residuals) boxplot(fmlogot$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #RENTA NETA MEDIA POR PERSONA rentaPersona<-datos$`Renta neta media por persona` boxplot(rentaPersona ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Renta por persona") fmrp<-aov(lm(rentaPersona~cluster)) summary(fmrp) intervalsrp<-TukeyHSD(fmrp) intervalsrp plot(intervalsrp) plot(fmrp$residuals) qqnorm(fmrp$residuals) qqline(fmrp$residuals) boxplot(fmrp$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #RENTA NETA MEDIA POR HOGAR rentaHogar<-datos$`Renta neta media por hogar` boxplot(rentaHogar ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Renta por hogar") fmrh<-aov(lm(rentaHogar~cluster)) summary(fmrh) intervalsrh<-TukeyHSD(fmrh) intervalsrh plot(intervalsrh) plot(fmrh$residuals) qqnorm(fmrh$residuals) qqline(fmrh$residuals) boxplot(fmrh$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #TOTAL EMPRESAS POR MUNICIPIO empresas<-datos$`Total Empresas por Municipio` boxplot(empresas ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Empresas") fmemp<-aov(lm(empresas~cluster)) summary(fmemp) intervalsemp<-TukeyHSD(fmemp) intervalsemp plot(intervalsemp) plot(fmemp$residuals) qqnorm(fmemp$residuals) qqline(fmemp$residuals) boxplot(fmemp$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) logemp<-log(empresas) 97 boxplot(logemp~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Empresas") fmlogemp<-aov(lm(logemp~cluster)) summary(fmlogemp) intervalslogemp<-TukeyHSD(fmlogemp) intervalslogemp plot(intervalslogemp) plot(fmlogemp$residuals) qqnorm(fmlogemp$residuals) qqline(fmlogemp$residuals) boxplot(fmlogemp$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #NUMERO TOTAL DECLARACIONES declaraciones<-datos$`Numero Total Declaraciones` boxplot(declaraciones ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Declaraciones") fmdec<-aov(lm(declaraciones~cluster)) summary(fmdec) intervalsdec<-TukeyHSD(fmdec) intervalsdec plot(intervalsdec) plot(fmdec$residuals) qqnorm(fmdec$residuals) qqline(fmdec$residuals) boxplot(fmdec$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) logdec<-log(declaraciones) boxplot(logdec~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Declaraciones") fmlogdec<-aov(lm(logdec~cluster)) summary(fmlogdec) intervalslogdec<-TukeyHSD(fmlogdec) intervalslogdec plot(intervalslogdec) plot(fmlogdec$residuals) qqnorm(fmlogdec$residuals) qqline(fmlogdec$residuals) boxplot(fmlogdec$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #PARO TOTAL paro<-datos$`Paro Total` boxplot(paro ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Parados") fmparo<-aov(lm(paro~cluster)) summary(fmparo) intervalsparo<-TukeyHSD(fmparo) intervalsparo plot(intervalsparo) plot(fmparo$residuals) qqnorm(fmparo$residuals) qqline(fmparo$residuals) boxplot(fmparo$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) logparo<-log(paro) boxplot(logparo~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Parados") fmlogparo<-aov(lm(logparo~cluster)) summary(fmlogparo) intervalslogparo<-TukeyHSD(fmlogparo) intervalslogparo plot(intervalslogparo) plot(fmlogparo$residuals) qqnorm(fmlogparo$residuals) qqline(fmlogparo$residuals) boxplot(fmlogparo$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #TOTAL COTRATOS contratos<-datos$`Total Contratos` boxplot(contratos ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Contratos") fmcontratos<-aov(lm(contratos~cluster)) summary(fmcontratos) intervalscontratos<-TukeyHSD(fmcontratos) intervalscontratos plot(intervalscontratos) plot(fmcontratos$residuals) 98 qqnorm(fmcontratos$residuals) qqline(fmcontratos$residuals) boxplot(fmcontratos$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) for (i in 1:length(contratos)){ if(contratos[i]==0){ contratos[i]<-0.000001 } } logcontratos<-log(contratos) for (i in 1:length(logcontratos)){ if(logcontratos[i]==log(0.000001)){ logcontratos[i]<-0 } } boxplot(logcontratos~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Contratos") fmlogcontratos<-aov(lm(logcontratos~cluster)) summary(fmlogcontratos) intervalslogcontratos<-TukeyHSD(fmlogcontratos) intervalslogcontratos plot(intervalslogcontratos) plot(fmlogcontratos$residuals) qqnorm(fmlogcontratos$residuals) qqline(fmlogcontratos$residuals) boxplot(fmlogcontratos$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #NUMERO TOTAL LICENCIAS licencias<-datos$`Numero Total Licencias` boxplot(licencias ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Licencias") fmlicencias<-aov(lm(licencias~cluster)) summary(fmlicencias) intervalslicencias<-TukeyHSD(fmlicencias) intervalslicencias plot(intervalslicencias) plot(fmlicencias$residuals) qqnorm(fmlicencias$residuals) qqline(fmlicencias$residuals) boxplot(fmlicencias$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) for (i in 1:length(licencias)){ if(licencias[i]==0){ licencias[i]<-0.000001 } } loglicencias<-log(licencias) for (i in 1:length(loglicencias)){ if(loglicencias[i]==log(0.000001)){ loglicencias[i]<-0 } } boxplot(loglicencias~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Licencias") fmloglicencias<-aov(lm(loglicencias~cluster)) summary(fmloglicencias) intervalsloglicencias<-TukeyHSD(fmloglicencias) intervalsloglicencias plot(intervalsloglicencias) plot(fmloglicencias$residuals) qqnorm(fmloglicencias$residuals) qqline(fmloglicencias$residuals) boxplot(fmloglicencias$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #NUMERO TRABAJADORES trabajadores<-datos$`Numero Trabajadores` boxplot(trabajadores ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Trabajadores") fmtrabajadores<-aov(lm(trabajadores~cluster)) summary(fmtrabajadores) intervalstrabajadores<-TukeyHSD(fmtrabajadores) intervalstrabajadores 99 plot(intervalstrabajadores) plot(fmtrabajadores$residuals) qqnorm(fmtrabajadores$residuals) qqline(fmtrabajadores$residuals) boxplot(fmtrabajadores$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) for (i in 1:length(trabajadores)){ if(trabajadores[i]==0){ trabajadores[i]<-0.000001 } } logtrabajadores<-log(trabajadores) for (i in 1:length(logtrabajadores)){ if(logtrabajadores[i]==log(0.000001)){ logtrabajadores[i]<-0 } } boxplot(logtrabajadores~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Trabajadores") fmlogtrabajadores<-aov(lm(logtrabajadores~cluster)) summary(fmlogtrabajadores) intervalslogtrabajadores<-TukeyHSD(fmlogtrabajadores) intervalslogtrabajadores plot(intervalslogtrabajadores) plot(fmlogtrabajadores$residuals) qqnorm(fmlogtrabajadores$residuals) qqline(fmlogtrabajadores$residuals) boxplot(fmlogtrabajadores$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) #NUMERO ESTABLECIMIENTOS establecimientos<-datos$`Numero Establecimientos` boxplot(establecimientos ~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Establecimientos") fmestablecimientos<-aov(lm(establecimientos~cluster)) summary(fmestablecimientos) intervalsestablecimientos<-TukeyHSD(fmestablecimientos) intervalsestablecimientos plot(intervalsestablecimientos) plot(fmestablecimientos$residuals) qqnorm(fmestablecimientos$residuals) qqline(fmestablecimientos$residuals) boxplot(fmestablecimientos$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) for (i in 1:length(establecimientos)){ if(establecimientos[i]==0){ establecimientos[i]<-0.000001 } } logestablecimientos<-log(establecimientos) for (i in 1:length(logestablecimientos)){ if(logestablecimientos[i]==log(0.000001)){ logestablecimientos[i]<-0 } } boxplot(logestablecimientos~ cluster, col = c(1,2,3,4,5,6,7,8), ylab = "Numero Establecimientos") fmlogestablecimientos<-aov(lm(logestablecimientos~cluster)) summary(fmlogestablecimientos) intervalslogestablecimientos<-TukeyHSD(fmlogestablecimientos) intervalslogestablecimientos plot(intervalslogestablecimientos) plot(fmlogestablecimientos$residuals) qqnorm(fmlogestablecimientos$residuals) qqline(fmlogestablecimientos$residuals) boxplot(fmlogestablecimientos$residuals~cluster, col = c(1,2,3,4,5,6,7,8)) 100 RESULTADOS POR TIPOS DE MUNICIPIO #Cargar librerías library(readxl) library (xlsx) library(psych) library(GGally) library(ggplot2) library(FactoMineR) library(factoextra) library(fields) library(CCA) library(vegan) library(candisc) library(ggpubr) library(gridExtra) library(corrplot) #Cargar los datos datos<-read_excel("C:/…/archivo500J0.xlsx") names(datos) #Crear variable tipoMunicipio tipoMunicipio<-rep(0,length(datos$Poblacion)) pob<-datos$Poblacion for (i in 1:length(tipoMunicipio)) { if(pob[i]<2000){ tipoMunicipio[i]<-"rural" } if(pob[i]>2000 & pob[i]<=10000){ tipoMunicipio[i]<-"semiRural" } if(pob[i]>10000){ tipoMunicipio[i]<-"urbano" } } #Crear variables mayoriaElección mayoriaDerecha<-rep(0,length(datos$Derecha)) derecha<-datos$Derecha izquierda<-datos$Izquierda otros<-datos$Otros for (i in 1:length(mayoriaDerecha)) { if(derecha[i]>izquierda[i] && derecha[i]>otros[i]){ mayoriaDerecha[i]<-1 } else{ mayoriaDerecha[i]<-0 } } mayoriaIzquierda<-rep(0,length(datos$Izquierda)) for (i in 1:length(mayoriaIzquierda)) { if(izquierda[i]>derecha[i] && izquierda[i]>otros[i]){ mayoriaIzquierda[i]<-1 } else{ mayoriaIzquierda[i]<-0 } } mayoriaOtros<-rep(0,length(datos$Otros)) for (i in 1:length(mayoriaOtros)) { if(otros[i]>derecha[i] && otros[i]>izquierda[i]){ mayoriaOtros[i]<-1 } else{ mayoriaOtros[i]<-0 } } 101 datos<-cbind(datos,tipoMunicipio,mayoriaDerecha,mayoriaIzquierda,mayoriaOtros) datos$`Renta neta media por persona`<-as.numeric(datos$`Renta neta media por persona`) datos$`Renta neta media por hogar`<-as.numeric(datos$`Renta neta media por hogar`) datos$`Total Empresas por Municipio`<-as.numeric(datos$`Total Empresas por Municipio`) datos$`Numero Total Declaraciones`<-as.numeric(datos$`Numero Total Declaraciones`) datos$tipoMunicipio<-as.factor(datos$tipoMunicipio) datos$mayoriaDerecha<-as.factor(datos$mayoriaDerecha) datos$mayoriaIzquierda<-as.factor(datos$mayoriaIzquierda) datos$mayoriaOtros<-as.factor(datos$mayoriaOtros) #Crear variables por cada 1000 habitantes pobTotal<-sum(datos$Poblacion) emp1000<-rep(0,length(datos$`Total Empresas por Municipio`)) emp<-datos$`Total Empresas por Municipio` for (i in 1:length(emp1000)) { emp1000[i]<-(emp[i]/pobTotal)*1000 } decl1000<-rep(0,length(datos$`Numero Total Declaraciones`)) decl<-datos$`Numero Total Declaraciones` for (i in 1:length(decl1000)) { decl1000[i]<-(decl[i]/pobTotal)*1000 } paro1000<-rep(0,length(datos$`Paro Total`)) paro<-datos$`Paro Total` for (i in 1:length(paro1000)) { paro1000[i]<-(paro[i]/pobTotal)*1000 } contratos1000<-rep(0,length(datos$`Total Contratos`)) contratos<-datos$`Total Contratos` for (i in 1:length(contratos1000)) { contratos1000[i]<-(contratos[i]/pobTotal)*1000 } licencias1000<-rep(0,length(datos$`Numero Total Licencias`)) licencias<-datos$`Numero Total Licencias` for (i in 1:length(licencias1000)) { licencias1000[i]<-(licencias[i]/pobTotal)*1000 } trab1000<-rep(0,length(datos$`Numero Trabajadores`)) trab<-datos$`Numero Trabajadores` for (i in 1:length(trab1000)) { trab1000[i]<-(trab[i]/pobTotal)*1000 } estab1000<-rep(0,length(datos$`Numero Establecimientos`)) estab<-datos$`Numero Establecimientos` for (i in 1:length(estab1000)) { estab1000[i]<-(estab[i]/pobTotal)*1000 } datos<- cbind(datos,emp1000,decl1000,paro1000,contratos1000,licencias1000,trab1000,est ab1000) table(datos$mayoriaDerecha) table(datos$mayoriaIzquierda) table(datos$mayoriaOtros) rurales<-datos[which(datos$tipoMunicipio=="rural"),] nombres1<-rurales$Municipio semi<-datos[which(datos$tipoMunicipio=="semiRural"),] nombres2<-semi$Municipio urbano<-datos[which(datos$tipoMunicipio=="urbano"),] nombres3<-urbano$Municipio #Tratar outliers impute_outliers <- function(x, removeNA = TRUE){ quantiles <- quantile(x, c(0.05, 0.95), na.rm = removeNA) 102 x[x<quantiles[1]] <- mean(x, na.rm = removeNA) x[x>quantiles[2]] <- median(x, na.rm = removeNA) x } datosPob<-impute_outliers(datos$Poblacion) datosDer<-impute_outliers(datos$Derecha) datosIz<-impute_outliers(datos$Izquierda) datosOtros<-impute_outliers(datos$Otros) datosRentPers<-impute_outliers(datos$`Renta neta media por persona`) datosRentHog<-impute_outliers(datos$`Renta neta media por hogar`) datosEmp<-impute_outliers(datos$`Total Empresas por Municipio`) datosDec<-impute_outliers(datos$`Numero Total Declaraciones`) datosParo<-impute_outliers(datos$`Paro Total`) datosContratos<-impute_outliers(datos$`Total Contratos`) datosLic<-impute_outliers(datos$`Numero Total Licencias`) datosTrabajadores<-impute_outliers(datos$`Numero Trabajadores`) datosEstab<-impute_outliers(datos$`Numero Establecimientos`) em<-impute_outliers(datos$emp1000) dc<-impute_outliers(datos$decl1000) pa<-impute_outliers(datos$paro1000) co<-impute_outliers(datos$contratos1000) li<-impute_outliers(datos$licencias1000) tr<-impute_outliers(datos$trab1000) es<-impute_outliers(datos$estab1000) dat<- cbind(datosPob,datosDer,datosIz,datosOtros,datosRentPers,datosRentHog,datosEmp ,datosDec,datosParo,datosContratos,datosLic,datosTrabajadores,datosEstab, em,dc,pa,co,li,tr,es) dat<-as.data.frame(dat) names(dat)<-c("Poblacion","Derecha","Izquierda", "Otros","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos", "emp100","decl1000","paro1000","contratos1000","licencias1000","trab1000","est ab1000") datosPobr<-impute_outliers(rurales$Poblacion) datosDerr<-impute_outliers(rurales$Derecha) datosIzr<-impute_outliers(rurales$Izquierda) datosOtrosr<-impute_outliers(rurales$Otros) datosRentPersr<-impute_outliers(rurales$`Renta neta media por persona`) datosRentHogr<-impute_outliers(rurales$`Renta neta media por hogar`) datosEmpr<-impute_outliers(rurales$`Total Empresas por Municipio`) datosDecr<-impute_outliers(rurales$`Numero Total Declaraciones`) datosParor<-impute_outliers(rurales$`Paro Total`) datosContratosr<-impute_outliers(rurales$`Total Contratos`) datosLicr<-impute_outliers(rurales$`Numero Total Licencias`) datosTrabajadoresr<-impute_outliers(rurales$`Numero Trabajadores`) datosEstabr<-impute_outliers(rurales$`Numero Establecimientos`) emr<-impute_outliers(rurales$emp1000) dcr<-impute_outliers(rurales$decl1000) par<-impute_outliers(rurales$paro1000) cor<-impute_outliers(rurales$contratos1000) lir<-impute_outliers(rurales$licencias1000) trr<-impute_outliers(rurales$trab1000) esr<-impute_outliers(rurales$estab1000) datr<- cbind(datosPobr,datosDerr,datosIzr,datosOtrosr,datosRentPersr,datosRentHogr,da tosEmpr,datosDecr,datosParor,datosContratosr,datosLicr,datosTrabajadoresr,dato sEstabr, emr,dcr,par,cor,lir,trr,esr) 103 datr<-as.data.frame(datr) names(datr)<-c("Poblacion","Derecha","Izquierda", "Otros","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos", "emp100","decl1000","paro1000","contratos1000","licencias1000","trab1000","est ab1000") datosPobs<-impute_outliers(semi$Poblacion) datosDers<-impute_outliers(semi$Derecha) datosIzs<-impute_outliers(semi$Izquierda) datosOtross<-impute_outliers(semi$Otros) datosRentPerss<-impute_outliers(semi$`Renta neta media por persona`) datosRentHogs<-impute_outliers(semi$`Renta neta media por hogar`) datosEmps<-impute_outliers(semi$`Total Empresas por Municipio`) datosDecs<-impute_outliers(semi$`Numero Total Declaraciones`) datosParos<-impute_outliers(semi$`Paro Total`) datosContratoss<-impute_outliers(semi$`Total Contratos`) datosLics<-impute_outliers(semi$`Numero Total Licencias`) datosTrabajadoress<-impute_outliers(semi$`Numero Trabajadores`) datosEstabs<-impute_outliers(semi$`Numero Establecimientos`) ems<-impute_outliers(semi$emp1000) dcs<-impute_outliers(semi$decl1000) pas<-impute_outliers(semi$paro1000) cos<-impute_outliers(semi$contratos1000) lis<-impute_outliers(semi$licencias1000) trs<-impute_outliers(semi$trab1000) ess<-impute_outliers(semi$estab1000) dats<- cbind(datosPobs,datosDers,datosIzs,datosOtross,datosRentPerss,datosRentHogs,da tosEmps,datosDecs,datosParos,datosContratoss,datosLics,datosTrabajadoress,dato sEstabs, ems,dcs,pas,cos,lis,trs,ess) dats<-as.data.frame(dats) names(dats)<-c("Poblacion","Derecha","Izquierda", "Otros","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos", "emp100","decl1000","paro1000","contratos1000","licencias1000","trab1000","est ab1000") datosPobu<-impute_outliers(urbano$Poblacion) datosDeru<-impute_outliers(urbano$Derecha) datosIzu<-impute_outliers(urbano$Izquierda) datosOtrosu<-impute_outliers(urbano$Otros) datosRentPersu<-impute_outliers(urbano$`Renta neta media por persona`) datosRentHogu<-impute_outliers(urbano$`Renta neta media por hogar`) datosEmpu<-impute_outliers(urbano$`Total Empresas por Municipio`) datosDecu<-impute_outliers(urbano$`Numero Total Declaraciones`) datosParou<-impute_outliers(urbano$`Paro Total`) datosContratosu<-impute_outliers(urbano$`Total Contratos`) datosLicu<-impute_outliers(urbano$`Numero Total Licencias`) datosTrabajadoresu<-impute_outliers(urbano$`Numero Trabajadores`) datosEstabu<-impute_outliers(urbano$`Numero Establecimientos`) emu<-impute_outliers(urbano$emp1000) dcu<-impute_outliers(urbano$decl1000) pau<-impute_outliers(urbano$paro1000) cou<-impute_outliers(urbano$contratos1000) liu<-impute_outliers(urbano$licencias1000) 104 tru<-impute_outliers(urbano$trab1000) esu<-impute_outliers(urbano$estab1000) datu<- cbind(datosPobu,datosDeru,datosIzu,datosOtrosu,datosRentPersu,datosRentHogu,da tosEmpu,datosDecu,datosParou,datosContratosu,datosLicu,datosTrabajadoresu,dato sEstabu, emu,dcu,pau,cou,liu,tru,esu) datu<-as.data.frame(datu) names(datu)<-c("Poblacion","Derecha","Izquierda", "Otros","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos", "emp100","decl1000","paro1000","contratos1000","licencias1000","trab1000","est ab1000") #Análisis Componentes Principales pca<-prcomp(dat,scale.=TRUE) aux<-fviz_screeplot(pca, addlabels = TRUE,main="Municipios",ylim = c(0, 50)) pcar<-prcomp(datr,scale.=TRUE) auxr<-fviz_screeplot(pcar, addlabels = TRUE,main="Municipios Rurales",ylim = c(0, 40)) pcas<-prcomp(dats,scale.=TRUE) auxs<-fviz_screeplot(pcas, addlabels = TRUE,main="Municipios Semirurales",ylim = c(0, 50)) pcau<-prcomp(datu,scale.=TRUE) auxu<-fviz_screeplot(pcau, addlabels = TRUE,main="Municipios Urbanos",ylim = c(0, 70)) ggpubr::ggarrange(aux,auxr,auxs,auxu) gridExtra::grid.arrange(aux,auxr,auxs,auxu) pca$rotation pcar$rotation pcas$rotation pcau$rotation au1<-fviz_contrib(pca, choice = "var", axes = 1, top = 13,title ="Municipios:Contribuciones de las variables a la Dimension1") au2<-fviz_contrib(pca, choice = "var", axes = 2, top = 13,title ="Municipios:Contribuciones de las variables a la Dimension2") ggpubr::ggarrange(au1,au2) au3<-fviz_contrib(pcar, choice = "var", axes = 1, top = 13,title ="Municipios Rurales:Contribuciones de las variables a la Dimension1") au4<-fviz_contrib(pcar, choice = "var", axes = 2, top = 13,title ="Municipios Rurales:Contribuciones de las variables a la Dimension2") ggpubr::ggarrange(au3,au4) au5<-fviz_contrib(pcas, choice = "var", axes = 1, top = 13,title ="Municipios Semirurales:Contribuciones de las variables a la Dimension1") au6<-fviz_contrib(pcas, choice = "var", axes = 2, top = 13,title ="Municipios Semirurales:Contribuciones de las variables a la Dimension2") ggpubr::ggarrange(au5,au6) au7<-fviz_contrib(pcau, choice = "var", axes = 1, top = 13,title ="Municipios Urbanos:Contribuciones de las variables a la Dimension1") au8<-fviz_contrib(pcau, choice = "var", axes = 2, top = 13,title ="Municipios Urbanos:Contribuciones de las variables a la Dimension1") ggpubr::ggarrange(au7,au8) PCA(dat) PCA(datr) PCA(dats) 105 PCA(datu) #Correlaciones Canónicas X<-cbind(dat$Derecha,dat$Izquierda,dat$Otros) colnames(X)<-c("Derecha","Izquierda","Otros") Y<-cbind(dat$Poblacion,dat$`Renta neta media por persona`,dat$`Renta neta media por hogar`,dat$`Total Empresas por Municipio`,dat$`Numero Total Declaraciones`,dat$`Paro Total`,dat$`Total Contratos`,dat$`Numero Total Licencias`,dat$`Numero Trabajadores`,dat$`Numero Establecimientos`) colnames(Y)<-c("Poblacion","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos") velectorales<-as.data.frame(X) veconomicas<-as.data.frame(Y) Xr<-cbind(datr$Derecha,datr$Izquierda,datr$Otros) colnames(Xr)<-c("Derecha","Izquierda","Otros") Yr<-cbind(datr$Poblacion,datr$`Renta neta media por persona`,datr$`Renta neta media por hogar`,datr$`Total Empresas por Municipio`,datr$`Numero Total Declaraciones`,datr$`Paro Total`,datr$`Total Contratos`,datr$`Numero Total Licencias`,datr$`Numero Trabajadores`,datr$`Numero Establecimientos`) colnames(Yr)<-c("Poblacion","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos") velectoralesr<-as.data.frame(Xr) veconomicasr<-as.data.frame(Yr) Xs<-cbind(dats$Derecha,dats$Izquierda,dats$Otros) colnames(Xs)<-c("Derecha","Izquierda","Otros") Ys<-cbind(dats$Poblacion,dats$`Renta neta media por persona`,dats$`Renta neta media por hogar`,dats$`Total Empresas por Municipio`,dats$`Numero Total Declaraciones`,dats$`Paro Total`,dats$`Total Contratos`,dats$`Numero Total Licencias`,dats$`Numero Trabajadores`,dats$`Numero Establecimientos`) colnames(Ys)<-c("Poblacion","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos") velectoraless<-as.data.frame(Xs) veconomicass<-as.data.frame(Ys) Xu<-cbind(datu$Derecha,datu$Izquierda,datu$Otros) colnames(Xu)<-c("Derecha","Izquierda","Otros") Yu<-cbind(datu$Poblacion,datu$`Renta neta media por persona`,datu$`Renta neta media por hogar`,datu$`Total Empresas por Municipio`,datu$`Numero Total Declaraciones`,datu$`Paro Total`,datu$`Total Contratos`,datu$`Numero Total Licencias`,datu$`Numero Trabajadores`,datu$`Numero Establecimientos`) colnames(Yu)<-c("Poblacion","Renta neta media por persona","Renta neta media por hogar", "Total Empresas por Municipio","Numero Total Declaraciones","Paro Total","Total Contratos", "Numero Total Licencias","Numero Trabajadores","Numero Establecimientos") velectoralesu<-as.data.frame(Xu) veconomicasu<-as.data.frame(Yu) colnames(X) XX<-X colnames(XX)<-c("X1","X2","X3") colnames(Y) YY<-Y colnames(YY)<-c("Y1","Y2","Y3","Y4","Y5","Y6","Y7","Y8","Y9","Y10")