Full text
RText Mining Solution 2016 Prof. Dr. José Pino Universidad de Málaga, Andalucía Tech, Escuela Técnica Superior de Ingeniería Industrial, Campus de Teatinos s/n, 29071 Málaga, España 18/07/2016 Tutorial de Text Mining Solution 2016 Prof. Dr. José Pino -Díaz Universidad de Málaga, Andalucía Tech, Escuela Técnica Superior de Ingeniería Industrial, Campus de Teatinos s/n, 29071 Málaga, España 18/07/2016 Tutorial de Text Mining Solution
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 2 Contenido Introducción ........................................................................................... 4 Comenzando a trabajar con R.TeMiS ......................................................... 5 Importar Corpus ..................................................................................... 8 Visualización del corpus activo y de los diccionarios de términos .................. 13 Visualizar el corpus de documentos ........................................................ 13 Visualizar el diccionario de términos ....................................................... 14 Gestión y distribución del corpus .............................................................. 15 Análisis descriptivo del léxico ................................................................... 21 Resumen cuantitativo del vocabulario de términos. .................................. 22 Tabla de disimilaridad. .......................................................................... 23 Términos más frecuentes. ..................................................................... 24 Términos específicos por modalidades de la variable. ............................... 25 Análisis de términos concretos. ............................................................. 27 Términos que coocurren con otros concretos. .......................................... 29 Evolución temporal de términos concretos. ............................................. 29 Análisis de correspondencias aplicado a un corpus de documentos ............... 30 Concepto de similaridad, disimilaridad, distancia y proximidad entre documentos. ....................................................................................... 30 Análisis de correspondencias. ................................................................ 30 Análisis de correspondencias con RTemis. ............................................... 31 Interpretación del diagrama de correspondencias .................................... 34 Procedimiento de análisis de correspondencias con RTemis. ...................... 35 I) AFC de la matriz documentos-términos sin agregar ninguna variable ... 35 II) AFC de la tabla lexical completa agregando variables (full documentterm matrix by variables) ................................................................... 40 Clasificación ascendente jerárquica aplicada a un corpus de documentos ...... 45 Concepto de similaridad y distancia entre documentos. ............................ 45 Concepto de clasificación jerárquica. ...................................................... 45 Clasificación ascendente jerárquica. ....................................................... 46 Clasificación ascendente jerárquica con RTemis. ...................................... 47
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 3 Ayuda a la interpretación del Análisis de Correspondencias y de la Clasificación ascendente jerárquica ............................................................................. 54 Bibliografía ............................................................................................ 56
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 4 Introducción R.TeMiS (R Text MIning Solution) (Bouchet-Valat & Bastin, 2013) es un paquete de R (RcmdrPlugin.temis) (Bouchet-Valat, 2016), concebido como plugin de R Commander, que permite analizar, manipular y crear corpus de textos (Garnier, 2014). La arquitectura estadística de RTemis corre a cargo del paquete tm desarrollado por Ingo Feinerer (Feinerer, 2008 ; 2011 ; Feinerer, Hornik y Meyer, 2008). R.TeMiS se ha completado con otros paquetes clásicos de R, como el paquete para la representación de los análisis factoriales de correspondencias de Nenadic y Greenacre (2007). También se han desarrollado paquetes específicos para facilitar el uso de R.TeMiS en los estudios de prensa, por ejemplo para la gestión de los corpus de artículos de prensa de la base de datos Factiva. R.TeMiS se presenta como un plugin de R Commander, desarrollado por Fox (2005), lo cual facilita su utilización para los no usuarios de R.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 5 Comenzando a trabajar con R.TeMiS 1º) Cargamos R en nuestro equipo. Obtenemos la siguiente pantalla una vez picamos dos veces en el logo de acceso a R. 2º) A continuación nos situamos con el puntero del ratón en la opción Paquetes del menú de R. Se nos abre un menú desplegable y picamos en cargar paquete:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 6 3º) Seleccionamos en la ventana de paquetes, RcmdrPlugin.temis: 4º) En un instante aparecerá la interfaz de R.Commander en la pantalla del equipo:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 7 5º) Observamos que en el menú de la interfaz de R.Commander aparece la opción Text mining. Si picamos sobre el botón Text mining se nos despliega el siguiente menú: 6º) En las siguientes secciónes del curso se explicarán cada una de las opciones del menú desplegable de Text mining.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 8 Importar Corpus 1º) La primera opción que nos aparece en el menú Text mining es la de Importar corpus. Picando sobre ella nos aparece la siguiente ventana de opciones de procesamiento del texto:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 9 a) Se ha de seleccionar el tipo de archivo que contiene el documento o documentos que se van a analizar. Cuatro tipos de corpus pueden ser importados por R.TeMiS: • archivos de texto plano (en el formato .txt) • archivos tipo tabla [en formatos .csv, .xls (dependiendo de la versión de Excel, 32 o 64 bits, no siempre son reconocidos por el programa) u .ods. Las líneas corresponden a individuos (i.e., personas encuestadas mediante cuestionario) o a datos de elementos (i.e., artículos científicos, exposiciones, etc.) y las columnas a las variables descriptivas (una de ellas es la variable que contiene el texto que vamos a analizar) • archivos en .html o .xml exportados de las bases de prensa Factiva, LexisNexis o Europresse. • Resultados de investigaciones sobre corpus extraídos de twitter b) Se selecciona el idioma en el que están escritos los documentos. c) Se selecciona la codificación de los documentos de texto (UNICODE, UTF 8, Windows 1250, ISO8859-x, etc.). Si se desconoce la codificación del texto, dejar la opción “detect automatically”. d) Seleccionar o no, según se desee, cortar el documento o documentos en otros más pequeños. Al importar un corpus el usuario puede decidir cortarlo en unidades más pequeñas. La unidad mínima a seleccionar es el párrafo. Si se elige esta opción cada párrafo será considerado como un documento, esto puede permitir mejorar la calidad del análisis de los textos, en particular de la clasificación jerárquica ascendente. La elección de cortar el documento en párrafos para el análisis del texto pretende tener en cuenta los formatos de escritura mediática de manera menos arbitraria que con el corte de segmentos de longitud uniforme (Jenny, 1999). Los archivos de texto tabulados (CSV, XLS), resultado de cuestionarios, encuestas o estudios similares, son cortados por defecto en tantos documentos como líneas. e) A continuación se seleccionan las acciones con las que se quiere preparar el texto para el análisis (nivel de procesamiento léxico del corpus): • pasar los términos a minúsculas (para que no haya diferencias entre el mismo término si aparece tanto escrito con una mayúscula como si no); • eliminar los signos de puntuacion;
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 16 Seleccionar o excluir términos. Esta acción permite seleccionar o excluir uno o más términos del vocabulario. Modificar (recodificar) los parámetros de una variable temporal. Creación de subcorpus a partir de determinados términos o de una variable. Esto permite estudiar el contexto de uso del término elegido. Creado un subcorpus, i.e. a partir de una variable cualitativa, como por ejemplo se ve en la imagen de abajo, “Género”, la opción restaurar el corpus permite volver al corpus registrado.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 17 La opción Distribución del corpus permite tres acciones: • Clasificar el corpus de documentos según una sola variable. Por ejemplo la variable cualitativa “Género” permite clasificar el corpus de respuestas (cada respuesta constituye un documento en los análisis de los corpus de cuestionarios, encuestas, etc.) según sean hombres (H), o mujeres (M), las dos modalidades de la variable. El dato se puede obtener en porcentages o en frecuencias absolutas (ver las tres imágenes siguientes).
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 18 Ejemplo 1: Se analiza un corpus de Factiva (formato HTML) de 586 noticias de prensa sobre Julian Assange (escándalo Wikileaks), de diferentes medios (Agencia France Presse, L'humanité, Le Figaro, Le Parisien y Libération). Se quiere obtener el gráfico de distribución de noticias según el medio que la ha publicado (ver las tres imágenes siguientes).
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 19 Ejemplo 2: Se analiza un corpus de artículos científicos obtenidos de una base datos (formato CSV). Los artículos han sido publicados en diferentes revistas científicas. Se quiere obtener el gráfico de distribución de artículos según la revista que lo ha publicado (ver la imagen siguiente). Distribution of documents by Origin Number of documents 0 100 200 300 Agence France Presse L'Humanité Le Figaro Le Parisien-Aujourd'hui en France Libération
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 20 • Clasificar el corpus según dos variables. • Conocer la evolución temporal del corpus, por ejemplo, según la fecha de publicación de cada documento. Ejemplo 3: Gráfico de distribución de los artículos publicados por año.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 21 Análisis descriptivo del léxico Continuamos explicando las opciones que aparecen en el menú Text mining de R.Temis. La opción Descriptive analysis of vocabulary contiene las siguientes opciones.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 22 Resumen cuantitativo del vocabulario de términos. Esta opción, una vez seleccionada la variable, permite obtener un resumen cuantitativo del número total de términos, el número de términos distintos, número de hapax (un hápax o hápax legómenon es una palabra que ha aparecido registrada solamente una vez en un corpus; es una palabra que sólo aparece una vez dentro de un contexto, ya sea en el registro escrito de un idioma entero, en las obras de un autor o dentro de un solo texto), etc., presentes en el corpus. Ejemplo: Seleccionada la variable, se selecciona la unidad de análisis (que puede ser el documento o la modalidad de la variable.; por ejemplo, si la variable elegida es “Género”, la selección de la modalidad de la variable realiza el análisis para “masculino”, “femenino” y para el total).
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 23 La ventana permite seleccionar los parámetros del gráfico asociado al resumen léxico cuantitativo. Tabla de disimilaridad. La opción Tabla de disimilaridad nos permite conocer si los vocabularios de los documentos o de las modalidades de las variables son más o menos similares (el programa calcula la distancia chi cuadrado, de modo que un menor valor de la distancia implica una mayor similaridad). Ejemplo:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 24 Ejemplo: De un corpus de 586 noticias de prensa sobre Julian Assange (escándalo Wikileaks) extraído de Factiva (formato HTML), procedente de diferentes medios (Agencia France Presse, L'humanité, Le Figaro, Le Parisien y Libération), se quiere obtener la tabla de disimilaridad de las noticias según lel medio donde se ha publicado (variable “Origin”). Se comprueba como los vocabularios empleados en los textos de las noticias más próximos son los de Agence France Press y Le Figaro, Agence France Press y Libération, y Libération y Le Figaro. Términos más frecuentes. Esta opción permite conocer cuáles son los términos más frecuentes en los documentos, en todo el corpus o según una variable seleccionada (en la imagen de abajo se ha seleccionado la variable “Origin” y un número de términos a visualizar de 10). El resultado nos aparece en forma de tabla, donde: • % Term/Level = % ; Nº de ocurrencia del término en la modalidad sobre el total de las ocurrencias de todos los términos que aparecen en la categoría o modalidad de la variable seleccionada.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 25 • % Level/Term = % ; Nº de ocurrencias del término en la modalidad de la variable elegida sobre el total de frecuencias de dicho término en el corpus. • Global % = % ; Nº de ocurrencias del término en el conjunto del corpus sobre el total de ocurrencias de todos los términos del corpus. • Level = Número de ocurrencias del término en la modalidad (en la imagen de abajo las modalidades son Agence france Presse y L'Humanité) de la variable seleccionada (en este caso la variable es “Origin” y las modalidades cada uno de los medios que han publicado las noticias). • Global = Número de ocurrencias del término en todo el corpus. • t value = Parámetro del valor del test (si este valor es positivo el término está sobrerrepresentado, si es negativo el término está subrepresentado) • Prob. = Probabilidad de obtener el término en el conjunto del corpus. Términos específicos por modalidades de la variable. Esta opción permite recuperar los términos específicos por modalidades de la variable. Se seleccionan los parámetros: mínima probabilidad de ocurrencia, mínimo nº de ocurrencias y el nº de términos específicos a obtener en el resultado.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 32 Según el análisis realizado obtendremos que cada término, documento o categoría de variable quedará situado en el diagrama de correspondencias mediante dos coordenadas (x, y), la coordenada (x) es el valor que toma el término para el factor 1, o dimensión 1, la coordenada (y) es el valor que toma el término para el factor 2, o dimensión 2. Como resultado del análisis de correspondencias en RTemis se obtienen dos salidas: el informe del análisis y el diagrama de correspondencias. En el informe del análisis de correspondencias figura: el resumen del corpus analizado: Correspondence analysis of 795 documents, 85 terms and 25 supplementary variables. el resumen de los factores: Axes summary: Axis 1 2 3 4 5 Inertia (%) 6.3 3.6 3.3 3.1 2.7 Cumulated inertia (%) 6.3 9.9 13.2 16.2 19.0 (La tasa de inercia asociada a cada eje factorial indica la parte de la inercia total de la nube proyectada sobre ese eje. Cada eje factorial o factor contribuye en un porcentaje determinado a explicar la variación entre categorías) los términos y documentos más contributivos en la parte negativa o positiva de cada uno de los dos factores o dimensiones: Position: Indica la coordenada del término en el factor o dimensión. Contribution: Indica la inercia del término o documento en %. Es decir, el porcentaje en el que dicho término contribuye a explicar la variación entre entre categorías. Quality: Indica la calidad de un término o documento en %. Es una medida de la calidad de la representación de dicho término o documento en el plano de dos dimensiones. Most contributive terms on positive side of axis 1: Position Contribution (%) Quality (%) barroco 1.89 8.6 50.3 siglo_XVII 1.69 7.7 46.6 siglo_XVI 1.72 5.9 35.1 siglo_XVIII 1.62 5.6 34.6 manierismo 2.18 5.3 37.0 romanticismo 1.78 4.4 31.2
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 33 neoclasicismo 2.14 3.8 32.0 siglo_XIX 0.94 3.3 20.7 artistas 1.80 3.2 15.1 renacimiento 1.72 3.1 15.7 ... Most contributive documents on positive side of axis 1: Position Contribution (%) Quality (%) 542 2.2 2.18 47.5 593 1.8 1.72 43.3 562 2.0 1.68 45.7 571 1.7 1.60 42.9 607 1.9 1.56 28.0 608 1.9 1.56 28.0 ... 542 Pinturas Exposición_temática Barroco Manierismo Neoclasicismo Renacimiento Romanticismo Siglo_XIX Siglo_XV Siglo_XVI Siglo_XVII Siglo_XVIII Artistas Grandes_Maestros_/_Old_Masters Museo_de_El_Prado Revisión_colecciones 593 Esculturas Obras_en_papel Pinturas Platería Exposición_itinerante Exposición_temática Barroco Gótico Impresionismo Manierismo Neoclasicismo Renacimiento Rococó Romanticismo Antigüedad_romana Siglo_XIX Siglo_XV Siglo_XVI Siglo_XVII Siglo_XVIII Museo_de_El_Prado Obras_artísticas_de_pequeño_formato Revisión_colecciones 562 Pinturas Exposición_temática Barroco Impresionismo Manierismo Neoclasicismo Realismo Romanticismo Siglo_XIX Siglo_XVI Siglo_XVII Siglo_XVIII Artistas Evolución_de_la_pintura_española Grandes_Maestros_/_Old_Masters Pintura_española 571 Artes_visuales Bocetos Esculturas Pinturas Relieves Exposición_temática Barroco Impresionismo Manierismo Neoclasicismo Realismo Renacimiento Rococó Romanticismo Siglo_XIX Siglo_XV Siglo_XVI Siglo_XVII Siglo_XVIII Museo_de_El_Prado Obras_artísticas_de_pequeño_formato Revisión_colecciones ...
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 34 Interpretación del diagrama de correspondencias En el diagrama de correspondencias la dimensión 1 representa el primer factor y la dimensión 2 representa el segundo factor. Cada factor explica un porcentaje de variación de la nube de puntos. El eje factorial o factor que explica más variabilidad en una categoría de una variable está más relacionado con ella. En el diagrama del ejemplo los factores 1 y 2 tienen una inercia (%) de 6.3 y 3.6 respectivamente. Estos valores son muy bajos por tanto se hace muy difícil interpretar el significado de los mismos. Más fácil es encontrar las similitudes entre los términos según su proximidad en el plano.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 35 Procedimiento de análisis de correspondencias con RTemis. Hay dos formas de realizar el análisis factorial de correspondencias (AFC) con RTemis: • AFC de la tabla lexical completa sin agregar ninguna variable (full document-term matrix) • AFC de la tabla lexical completa agregando variables (full document-term matrix by variables) I) AFC de la matriz documentos-términos sin agregar ninguna variable Este análisis de correspondencias permite representar gráficamente los términos coocurrentes en un plano de dos dimensiones (dos ejes factoriales o factores). El informe del AC (análisis de la posición, contribución y calidad de los términos), el diagrama de correspondencias y otras ayudas, como el contexto de utilización o las coocurrencias de los términos, permiten localizar los temas. El analista puede eliminar los términos no presentes en más de un porcentaje (%) de documentos a determinar.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 36 También puede fijar el número de ejes factoriales o factores (dimensiones) a estudiar. El usuario también dispone de una ayuda sobre el análisis a realizar. Una vez fijados los parámetros del análisis se acepta y nos aparecen dos cuadros de diálogo: Este cuadro nos informa del número de documentos eliminado del análisis porque no incluyen ningún término de los retenidos. Disminuyendo el valor del porcentaje de documentos fijado en el cuadro inicial eliminaremos menos términos y retendremos más documentos.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 37 Este cuadro nos informa que algunas categorías de las variables han sido eliminadas ya que no contienen valores válidos para los documentos retenidos. A continuación, una vez aceptados los cuadros de diálogo, nos aparece la ventana donde fijar los parámetros de visualización del diagrama de correspondencias.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 38 Se fijan los elementos a visualizar en el diagrama de correspondencias: • Los factores o dimensiones en los ejes (x, y). • Las categorías de las variables. • Las etiquetas y símbolos de los términos, documentos y variables. • El número de ítems (documentos o términos) más contributivos a los dos ejes (factores), al eje horizontal o al eje vertical.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 39 Informe del análisis de correspondencias: Diagrama de correspondencias.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 40 La ventana dispone de ayuda sobre los parámetros a fijar. II) AFC de la tabla lexical completa agregando variables (full document-term matrix by variables) Este análisis de correspondencias permite cruzar el conjunto de términos y las categorías de las variables selecionadas; permite representar gráficamente en un plano de dos dimensiones los términos en función de las categorías de las variables elegidas. El informe del AC (análisis de la posición, contribución y calidad de los términos) (Minguillón-Campos & Pino-Díaz, 2016), el diagrama de correspondencias y otras ayudas, como el contexto de utilización o las coocurrencias de los términos, permiten localizar los temas.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 41 Una vez fijados los parámetros del análisis se acepta y nos aparecen dos cuadros de diálogo:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 48 El cuadro de diálogo dispone de la opción de Ayuda en la que se explica el método de Hierarchical clustering empleado en RTemis: Una vez elegido el conjunto de documentos sobre los que hacer la clasificación jerárquica se acepta y nos aparece una ventana informativa:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 49 Se acepta y aparecen dos ventanas: 1ª) el dendrograma completo antes de crear los clusters en el cuadro Create clusters (siguiente ventana) 2ª) el cuadro de diálogo Create clusters:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 50 Se fijan los siguientes parámetros: a) El número de clusters o clases a retener en el análisis. b) El número máximo de documentos por clase a obtener en el informe del Hierarchical clustering. c) Retener términos con una probabilidad por debajo (%) del valor fijado. d) Retener términos con una ocurrencia por encima del valor fijado. e) El número máximo de términos a obtener en el informe. Fijados los parámetros se acepta y se obtiene: a) el informe de la clasificación jerárquica ascendente: En el informe nos aparece en primer lugar datos sobre el análisis efectuado: Hierarchical clustering of 446 documents using 9 terms (Ward's method with Chi-squared distance). Y a continuación el resumen del análisis:
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 51 En el sumario, para cada cluster o clase figura su número de documentos, el porcentaje de documentos sobre el total analizado y la varianza dentro de la clase. El informe de cada cluster comprende el listado de términos específicos. Para cada término figuran los siguientes datos: • % Term/Level = (%) Nº de ocurrencia del término en la clase sobre el total de las ocurrencias de todos los términos que aparecen en la clase. • % Level/Term = (%) Nº de ocurrencias del término en clase sobre el total de frecuencias del término en el corpus. • Global % = (%) Nº de ocurrencias del término en el conjunto del corpus sobre el total de ocurrencias de todos los términos del corpus. • Level = Número de ocurrencias del término en la clase. • Global = Número de ocurrencias del término en todo el corpus. • t value = Parámetro del valor del test (si este valor es positivo el término está sobrerrepresentado, si es negativo el término está subrepresentado) • Prob. = Probabilidad de obtener el término en el conjunto del corpus. Además, el informe del cluster se completa con los documentos que lo componen (con indicación de la distancia de cada documento al centroide del cluster).
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 52 b) el dendrograma: La clasificación jerárquica ascendente agrupa a los documentos en clusters según su similaridad, esto se visualiza en el dendrograma. Los documentos similares, con términos comunes, son clasificados en el mismo cluster. Dependiendo de los documentos que lo forman, el cluster resultante tiene una varianza interna determinada; cuanto más similares sean los documentos menor será la varianza interna. Los clusters se van uniendo de abajo a arriba (el cluster resultante agrupa a los documentos de los clusters que se unen), de manera que se observa como
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 53 a modo de ramas se unen en otras ramas hasta que quedan dos que se unen arriba en una sola (este tronco común es el corpus completo). Dos clusters son más similares entre sí cuanto más cerca de la base del dendrograma se unen en una sola rama (más cerca de la base supone una más baja varianza dentro del cluster que se forma por la unión de estos dos); conforme ascendemos en el dendrograma la varianza interna en los clusters aumenta.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 54 Ayuda a la interpretación del Análisis de Correspondencias y de la Clasificación ascendente jerárquica Como ayuda a la interpretación de la proximidad entre dos términos en el diagrama de correspondencias se puede analizar el contexto de utilización de ambos términos. Para ello se crea un subcorpus con los documentos que contienen esos términos y se visualiza el conjunto de documentos que lo forman. a) Creación de subcorpus a partir de determinados términos o de una variable. Esto permite estudiar el contexto de uso del término elegido.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 55 b) Visualización del subcorpus También se pueden interpretar más finamente las proximidades gráficas entre los términos realizándo el análisis descriptivo del subcorpus.
Tutorial de R-Text Mining Solution Dr. José Pino-Díaz Universidad de Málaga 56 Bibliografía Bouchet-Valat, M. (2016). Package RcmdrPlugin.temis. Recuperado el 25 de Julio de 2016, de https://cran.rproject.org/web/packages/RcmdrPlugin.temis/RcmdrPlugin.temis.pdf Bouchet-Valat, M., & Bastin, G. (2013). RcmdrPlugin.temis, a Graphical Integrated Text Mining Solution in R. The R Journal , 188-196. Garnier, B. (2014). R.TeMiS. Une approche intégrée et libre de l'analyse de données textuelles. Recuperado el 19 de julio de 2016, de rtemis.hypotheses.org Gutiérrez, R., González, A., Torres, F., & Gallardo, J. (1994). Métodos jerárquicos de análisis cluster. Recuperado el 24 de Julio de 2016, de Técnicas de análisis de datos multivariable. Tratamiento computacional: http://www.ugr.es/~gallardo/pdf/cluster-3.pdf Minguillón-Campos, J., & Pino-Díaz, J. (2016, Abril 1). Aplicación de la técnica de Regresión Lineal Simple a la relación Contribution – Quality en el análisis de correspondencias en data mining con R.TeMiS [R Text Mining Solution]. Recuperado el 25 de Julio de 2016, de RIUMA, Repositorio Institucional de la Universidad de Málaga: http://riuma.uma.es/xmlui/handle/10630/11102 Navarro Gómez, M. L. (1983). Aspectos teóricos y una aplicación práctica del análisis factorial de correspondencias. Estadística española , 33-59.