scieee AI-readable full text Open interactive document viewer

Estudio de similitudes entre áreas temáticas

Rosa Troyano, Francisco Fernando de la; Velasco Morente, Francisco; González Abril, Luis; Martínez Gasca, Rafael

Full text

Rev. Esp. Doc. Cient., 28, 2, 2005 155 ESTUDIO DE SIMILITUDES ENTRE ÁREAS TEMÁTICAS L. González1, F. Velasco1, R. M. Gasca2y F. de la Rosa2 Resumen: En este trabajo presentamos unos resultados que permiten la representación gráfica de las similitudes entre centros de interés que aparecen en las páginas Web que se encuentran distribuidas en Internet. Para ello se cuantifica y representa gráficamente por medio de un índice de similitud entre los diferentes centros de interés, de acuerdo a una interpretación intuitiva de similitud entre conjuntos. La utilización de una función procedente de la teoría del aprendizaje nos permite estudiar, a partir de la información en las páginas Web, la similitud o interrelación que existe entre diferentes líneas de investigación. El análisis visual de dichas interrelaciones se ha aplicado al área de investigación del aprendizaje referido al período mayo 2003-mayo 2004. Asimismo, se construyen varias tablas que aclaran la potencialidad futura de este índice de similitud. Palabras clave: similitud, líneas de investigación, visualización, Internet. Abstract: In this paper some results are presented which permit the graphic representation of the similarities between subjects which appear on web pages found on the Internet. To this end, these similarities are quantified and graphically represented by means of an index between the different subjects, in accordance with an intuitive interpretation of similarity between sets. The use of a function based on Learning Theory, enable us to study the similarity or interrelation between different lines of investigations corresponding to information on web pages. The visual analysis of the aforementioned interrelations has been applied to the area of Learning research refering to the period May 2003-May 2004. Furthermore, various tables which clarify the potential of this similarity index are constructed. Keywords: similarity, research lines, visualization, internet. 1. Introducción El gran volumen de información no estructurada que se encuentra dispersa en las bases de datos textuales, de las cuales Internet es un claro ejemplo, hace cada vez más difícil su tratamiento y/o análisis. Con objeto de abordar estos problemas, presentamos en este artículo unos resultados acerca de la similitud entre sucesos que permiten un análisis visual de las similitudes existentes entre centros de interés (se refieren a las áreas de investigación pertenecientes a la Teoría del Aprendizaje) que un usuario determinado desee realizar. La representación visual de las similitudes facilita, en gran medida, su comprensión y el análisis de cuestiones relativas a las relaciones cualitativas no tempo1Dep. de Economía Aplicada I. Universidad de Sevilla. Correo-e: [email protected]; [email protected]. 2Dep. de Lenguajes y Sistemas Informáticos. Universidad de Sevilla. Correo-e: [email protected]; [email protected]. Recibido: julio 2002; 2.aversión: 25-2-05. E S T U D I O S L. González y otros 156 Rev. Esp. Doc. Cient., 28, 2, 2005 rales, tales como: ¿Está el centro de interés A muy relacionado con el B en la Web? ¿Es muy importante el peso que tiene el centro de interés C en el conjunto estudiado? y otras preguntas sobre relaciones cualitativas temporales, tales como: ¿Se han acercado los centros de interés A y B en los últimos años? ¿Cuál ha sido la evolución del centro de interés C con respecto al centro de interés D a lo largo de los años? Las cuestiones que acabamos de plantear han sido ampliamente estudiadas y han permitido el desarrollo de una amplia gama de métodos estadísticos, denominados técnicas de análisis multivariante que, junto a técnicas de representación de gráficas, han sido adaptadas y desarrolladas en disciplinas tales como Cienciometría (1, 2), Infometría (3, 4), Bibliometría (5, 6) o Webometría (7, 8, 9), para analizar de forma visual las bases de datos documentales. Las técnicas usadas para realizar estas representaciones son conocidas fundamentalmente como técnicas de reducción de la dimensión y se caracterizan por transformar la información almacenada, normalmente en un espacio n-dimensional (vector de natributos), en un espacio de dos o tres dimensiones, con el objeto de que la información pueda ser analizada por un observador de forma visual. Uno de los problemas principales de estas técnicas se encuentra en la pérdida de información apreciable que se produce en el proceso de reducción, y que aparece cuando la población en estudio no contiene relaciones significativas entre los distintos individuos. Las técnicas de reducción de dimensión, utilizadas en las disciplinas relacionadas con el tratamiento de la documentación científica, pueden ser clasificadas en técnicas neuronales y estadísticas. Las técnicas neuronales utilizan la capacidad de aprendizaje de las redes neuronales, como la red de Kohonen (10, 11, 12), a fin de conseguir la reducción de la dimensión de los datos bibliométricos, habitualmente representados mediante vectores en un hiperespacio. Por otro lado, y dentro de las técnicas estadísticas, se puede realizar, a su vez, una subdivisión en técnicas de clasificación o clustering y técnicas de reducción de la dimensión. Las técnicas para la reducción de la dimensión de los datos bibliométricos utilizan métodos estadísticos muy variados (13). Podemos destacar, entre ellos, las técnicas de escalamiento multidimensional (MDS) (14, 15) que comenzaron a desarrollarse a finales de los años 60 en el área de la psicopsíquica, para analizar las percepciones psíquicas entre distintos individuos. Desde un punto de vista estadístico estas técnicas están incluidas dentro del análisis de técnicas multivariantes, donde las variables estadísticas se representan mediante un modelo lineal. Otra técnica estadística de reducción es el análisis de componentes principales, que busca el mejor modelo lineal con el propósito de proyectar los datos minimizando la pérdida de información. El método de las palabras asociadas (2, 16, 17, 18, 19, 20) es otra de las técnicas estadísticas de clasificación jerárquica. Este método se basa en la construcción de un grafo, donde los nodos representan las palabras clave y los arcos son las frecuencias de aparición en los documentos de las palabras clave que relacionan, también conocidos como co-ocurrencia de palabras. A partir del grafo, estas técnicas son capaces de encontrar y representar los centros de interés que ocultan los documentos, es decir, zonas de la red muy enlazadas y consistentes, asimilables a «puntos calientes» o «polos de atracción» de gran intensidad informativa (16). En contraste con las técnicas anteriores, la presentada en este artículo se distingue por su marcado carácter frecuencialista y se fundamenta en la Teoría del Aprendizaje Estadístico (21, 23). Estudio de similitudes entre áreas temáticas Rev. Esp. Doc. Cient., 28, 2, 2005 157 Este artículo se ha estructurado como sigue: en las sección 2 presentamos una nueva técnica de análisis basada en un índice de similitud (24), que permite responder a las preguntas cualitativas planteadas al inicio de la introducción. En la sección 3 mostramos, con un ejemplo práctico, la aplicación de esta técnica para calcular nuestro índice de similitud. En particular y mediante el rastreo de recursos electrónicos con la ayuda de agentes, hemos encontrado las relaciones entre varias líneas de investigación de un área determinada, que hemos presentado en la tabla II y a continuación hemos representado gráficamente los índices entre dichas líneas. De estas representaciones gráficas, obtenidas de los índices de similitud y presentados en la tabla III, hemos construido, además, varias tablas (tabla IV, tabla V) que nos ayudan en la comprensión de este índice y que nos dan a entender su potencialidad en un futuro inmediato, como queda reflejado en la sección 4 de conclusiones y trabajos futuros. 2 Similitud entre sucesos Por similitud entre objetos se entiende una medida de correspondencia, o parecido, entre objetos que van a ser estudiados. Esta medida debe tomar en consideración diferentes características de los objetos, según el sentido de similar que se quiera dar. Por ello, si se considera un conjunto de objetos Ω, al cual no se le supone ninguna estructura matemática determinada, hemos de encontrar una función tal que a cada par de objetos x, x′de Ω, le asocie un número que cuantifique cuán parecidos son. Si el espacio de trabajo es Rd, esta similitud normalmente viene dada a través de un producto escalar (esta es una de las ideas claves en la Teoría del Aprendizaje Estadístico (21, 22)); por ello, una forma de asignar similitudes entre objetos es incrustar, a partir de una aplicación f , el conjunto Ωdentro de Rd(ver figura 1). Figura 1 Función f de Ω Ωen Rd. De esta forma, si se tiene un conjunto de objetos Ω, dados dos subconjuntos Ay B (ver figura 2), intuitivamente se aprecia que éstos son tanto más similares cuanto más pequeño sea el conjunto (A\ B) ∪(B\ A) (denominado diferencia simétrica), es decir, cuantos menos elementos tenga el conjunto Aque no tenga By recíprocamente. La diferencia simétrica es usada para estudiar la similitud entre los subconjuntos Ay By con objeto de llevar a cabo una cuantificación del grado de similitud, suponemos que nos encontramos dentro de un espacio probabilístico, ya que el utilizar una probabilidad P nos permite llevar a cabo una cuantificación de la similitud, además de posibilitar la L. González y otros 158 Rev. Esp. Doc. Cient., 28, 2, 2005 Figura 2 Representación de dos conjuntos Ay B asignación de pesos a los diferentes elementos de los conjuntos. A partir de estas premisas en (23, 24) se lleva a cabo un detallado estudio que conduce a la siguiente medida de similitud: Definición 2.1. Sea (Ω, A, P) un espacio probabilístico. Se define la función núcleo similitud k : A×A→Rpara todo A, B∈A como sigue: k(A, B) = P(A ∩B) – P(A) · P(B) (1) En (25) aparece recogida por primera vez esta medida de similitud, la cual ha sido estudiada con detalle en (24). Las propiedades más importantes de esta función (para un estudio en detalle, ver (23)) son las siguientes: 1. Si P(A) = 0 ó P(A) = 1, entonces k(A, B) = 0 para todo B∈A. 2. Sea A#B#B′, entonces: k(A,B)=k(A,A)–P(A)P(B\A) y 0 ≤k(A,B′)≤k(A,B)≤ ≤(A, A). Esta propiedad indica que hay menos similitud entre Ay Bcuanto mayor sea P(B\ A). Así, si consideramos un conjunto finito e interpretamos la probabilidad en términos de número de elementos, entonces Ay Bcon A#Bson más similares cuantos menos elementos tenga Bque no están en A(ver figura 3). De esta propiedad se sigue que para A∈Afijado, se verifica máx k(A, B) = k(A, A). {B:A#B} 3. Si Ay Bson sucesos independientes, entonces k(A, B) = 0. Figura 3 Intuitivamente Ay Bson más similares que Ay B′ ′ Estudio de similitudes entre áreas temáticas Rev. Esp. Doc. Cient., 28, 2, 2005 159 4. Sea B#B′#A –(A –es el conjunto complementario de A), entonces k(A, B) = –k(A, A)+P(A)·P(A –\B) y k(A, A –)≤k(A, B′)≤k(A, B)≤0. La interpretación, a la vista de la figura 4, en términos de conjunto es la siguiente: Como B′tiene más elementos que no están en Aque B, su similitud es mayor en valor absoluto. De aquí se sigue que fijado A, se verifica mín k(A,B)=k(A,A –). {B:B#A –} Figura 4 Intuitivamente se declara que Ay Bson más similares que Ay B′ ′ 5. Dado A, B∈A, entonces k(A, A –)≤k(A, B)≤k(A, A), es decir, el suceso que más similitud tiene con Aes el propio Ay el que menos es A –. 6. k(A, B –) = –k(A, B), para todo A, B∈A, es decir, si consideramos que B y B –son totalmente disimilares, entonces es natural que la similitud entre Ay Bsea opuesta a la de Ay B –. 7. Dado A, B∈A, se tiene |k(A, B)| ≤mín {k(A, A), k(B, B)} ≤– 1 4(2) Esta propiedad proporciona una cota superior (– 1 4) para la similitud y una cota inferior (– – 1 4) para la disimilitud (no similitud) entre sucesos. Con objeto de tener una representación gráfica basada en la función de similitud se propone la siguiente construcción: Fijado un suceso A∈A, sea la función kA: A→R definida como: kA(B) = k(A, B) ∀B∈A Es decir, variando B∈A, se tiene una cuantificación de todas las similitudes en relación a A. Por otro lado, y puesto que la función kArecoge las características del suceso Ba través su probabilidad, se considera la función kA(P(·)) = k(A, ·), la cual está definida en [0, 1] y su representación gráfica está dentro del rectángulo [0, 1] ×[– – 1 4, – 1 4]. Si denotamos por p= P(A), entonces kA(B) = P(A∩B)–p·P(B) y teniendo en cuenta la descomposición de Ben la forma B= B1∪B2, tal que B1= A∩B#A, B2= A –∩B#A –, que por construcción son disjuntos, se tienen las siguientes propiedades. Si P(B) = x≤p, se tiene que: kA(B) = (1 – p) · P(B1) – pP(B2). Luego si P(B) = x, entonces el máximo se alcanza cuando P(B2) = 0 y vale máxP(B)=xkA(B) = (1 – p) · x, alcanzándose cuando el suceso B#A. L. González y otros 160 Rev. Esp. Doc. Cient., 28, 2, 2005 Si P(B) = x> p, entonces kA(B) = (1 – p) · P(B1) – pP(B2) y el máximo se alcanza cuando P(B1) es máximo y P(B2) es mínimo y como P(B) = x= P(B1) + P(B2); esto se consigue si B1= A, con lo que el máximo de kA(B) vale máxP(B) = xkA(B) = (1 – p) · p– – p· (x– p) = p· (1 – x) y se alcanza cuando el suceso Bcumple: A#B. Si P(B) = x≤1 – p, se sigue que como kA(B) = –kA(B –), entonces mín{B\P(B)=x}kA(B)= = –máx{B –\P(B –}=1–x}kA(B –) = –px, ya que en este caso P(B –) = 1 – x≥py sustituyendo para este caso en el desarrollo anterior, se tiene que el máximo se obtiene en p(1 – (1 – x)) y esto se cumple cuando A#B –. De esta forma, el mínimo se tiene cuando el suceso B#A –. Por último si P(B) = x> 1 – p, se sigue que como kA(B) = –kA(B –), entonces mín{B\P(B)=x}kA(B) = –máx{B –\P(B –)=1–x}kA(B –) = –(1 – p)(1 – x), ya que en este caso P(B –)= – 1 – x≤p, con lo que al sustituir para este caso en el desarrollo anterior, tenemos que el máximo se alcanza en (1 – p)(1 – x) y esto ocurre cuando B –#A. De esta forma, el mínimo se alcanza cuando el suceso A –#B. Por todo ello, la gráfica de la función kA(P(B)) queda dentro del paralelogramo de la figura 5. Figura 5 Dominio y recorrido de la función kA(P(B)), para Afijo y P(A)= 0,15 3Aprendizaje en la Red En esta sección aplicamos la sección 2 para medir las similitudes que existen entre varias líneas de investigación pertenecientes a la Teoría del Aprendizaje, las cuales aparecen recogidas en la tabla I. El proceso de selección de éstas ha sido extraído de las distintas secciones en que se dividen las actas de varios congresos representativos dedicados al área en estudio (Inteligencia Artificial). La selección de las palabras clave utilizadas para representar las líneas de investigación han sido escogidas de las presentadas por los autores en los abstracts de los artículos admitidos en las distintas secciones de los congresos, que en nuestro caso se corresponden con las líneas de investigación del área. Así, estudiamos las similitudes existentes dentro de doce líneas de investigación Estudio de similitudes entre áreas temáticas Rev. Esp. Doc. Cient., 28, 2, 2005 161 abiertas, relacionadas con el área de estudio, utilizando para ello la información que proporciona a través de la red Internet un buscador cualquiera. Si una página web contiene una palabra clave que sirve de descriptor de una línea de investigación se contabiliza como una página web que trata sobre dicha línea. Entendemos entonces que el número de páginas web que relacionan las distintas líneas de investigación es proporcional al número de artículos que relacionan las líneas de investigación y por tanto esta medida es utilizada como una estimación de la fuerza con que dos disciplinas están relacionadas. Para la obtención de la información utilizamos un agente software que, a partir de las palabras clave, se encarga de consultar el buscador y obtener los listados de las páginas Web, que tratan a la vez sobre alguna de las parejas de las materias investigadas. Es conocido que en la mayoría de los buscadores de páginas Web, tales como Altavista, Google, Yahoo, ... existen bases de datos de históricos, donde se recogen las direcciones de las páginas por años así como los identificadores de cada una de esas páginas. El agente software diseñado se introduce dentro de estas bases de datos, rastrea y cuantifica el número de veces que los identificadores aparecen por año. De esta forma, se ha realizado una búsqueda, en las bases de datos del buscador Altavista, del número de páginas donde aparezcan referenciados a la vez dos ítems concretos en el año 2004; y hemos denotado los números de enlaces (frecuencias absolutas) por nij, con i, j=1, 2, ..., 12. Después de realizar la búsqueda, hemos encontrado un total de N= 426.661 páginas, donde al menos aparece un ítem, obteniendo la tabla II. Para enlazar estos datos con la construcción de similitudes se ha tenido en cuenta que el número de datos disponibles es suficientemente grande, y hemos optado por una interpretación frecuencialista de la probabilidad, considerando de esta forma que P(Ai∩Aj)=— nij Npara i, j= 1, 2, ..., 12, con lo cual estamos en condiciones de aplicar la función núcleo similitud. Hemos realizado los cálculos (ver tabla III) y representado las similitudes en la figura 6, donde podemos ver la posición (para interpretar esta gráfica, y la siguiente, es necesario saber que los diferentes ítems se encuentran ordenados en función de sus probabilidades) de los valores kAi(Aj) variando Aidesde i= 1 hasta 12, con respecto a todos los restantes ítems. Tabla I Relación de doce líneas de investigación relacionadas con el Aprendizaje Items Research Subjects A1Ensemble Learning (EL) A2Neural Network Learning (NNL) A3Case-based Learning (CBL) A4Rules-based Learning (Tree Learning) (TRL) A5Bayesian Network (BN) A6Kernel Methods (KM) A7Inductive Logic Programming (ILP) A8Soft Computing (Evolutionary Computing and Fuzzy Logic) (SC) A9Web Mining (WM) A10 Text Mining (TxM) A11 Association Rules (AR) A12 Reinforcement Learning (RL) L. González y otros 162 Rev. Esp. Doc. Cient., 28, 2, 2005 Del estudio de estas gráficas una a una tenemos las siguientes conclusiones acerca de la similitud entre una de las temáticas y su relación con las demás. Gr1.-A1tiene similitud positiva con A7(ver tabla III) y con el resto tiene disimilitud. Así, con A6, A4y A5dicha disimilitud (similitud negativa) es prácticamente nula. Ahora bien, con las que más disimilitud tiene A1es con A11 y A10 con una disimilitud similar a ambas. Figura 6 Representación gráfica de todas las similitudes Tabla II Número de citas en las que aparecen recogidas algunas de las líneas de investigación relacionadas con el Aprendizaje en el período mayo 2003-mayo 2004 A 1 A 2 A 3 A 4 A 5 A 6 A 7 A 8 A 9 A 10 A 11 A 12 A 1 3.780 78 16 88 41 167 348 76 35 106 64 816 A 2 78 10.900 78 319 137 318 346 542 91 76 137 1.680 A 3 16 78 13.600 120 18 9 306 101 40 66 81 471 A 4 88 319 120 11.300 290 114 755 160 82 190 424 871 A 5 41 137 18 290 10.800 187 512 548 410 587 200 1.760 A 6 167 318 9 114 187 19.400 423 569 224 382 271 725 A 7 348 346 306 755 512 423 24.600 779 675 890 1.790 3.110 A 8 76 542 101 160 548 569 779 36.000 847 952 750 3.490 A 9 35 91 40 82 410 224 675 847 40.800 7.260 3.180 712 A 10 106 76 66 190 587 382 890 952 7.260 83.500 2.570 797 A 11 64 137 81 424 200 271 1.790 750 3.180 2.570 93.800 703 A 12 816 1.680 471 871 1.760 725 3.110 3.490 712 797 703 102.000 Tabla III Similitudes entre todas las líneas de investigación P(Ai)A1A2A3A4A5A6A7A8A9A10 A11 A12 A10,008859 0,00878100 -4,3520E-05 -0,000245 -2,8389E-05 -0,00012816 -1,142E-05 0,00030482 -0,00056940 -0,00076517 -0,00148541 -0,00179773 -0,000205 A20,025547 -4,3520E-05 0,02489455 -0,00063151 7,1055E-05 -0,00032557 -0,00041629 -0,00066203 -0,00088525 -0,00222970 -0,00482161 -0,00529537 -0,00216 A30,031875 -0,000245 -0,00063151 0,03085938 -0,00056296 -0,00076467 -0,00142826 -0,00112065 -0,00245280 -0,00295438 -0,00608351 -0,00681786 -0,006516 A40,026484 -2,8389E-05 7,1055E-05 -0,00056296 0,02578329 9,2930E-06 -0,00093705 0,00024252 -0,00185967 -0,00234045 -0,00473789 -0,00482882 -0,004290 A50,025312 -0,00012816 -0,00032557 -0,00076467 9,2930E-06 0,02467210 -0,00071267 -0,00025945 -0,00085141 -0,00145962 -0,00357807 -0,00509619 -0,001926 A60,045469 -1,142E-05 -0,00041629 -0,00142826 -0,00093705 -0,00071267 0,04340189 -0,00163021 -0,00250292 -0,00382306 -0,00800329 -0,00936112 -0,00917 A70,057657 0,00030482 -0,00066203 -0,00112065 0,00024252 -0,00163021 0,05433268 0,05433268 -0,0030391 -0,00393147 -0,00919784 -0,00848034 -0,006494 A80,084376 -0,00056940 -0,00088525 -0,00245280 -0,00185967 -0,00085141 -0,0030391 -0,0030391 0,07725679 -0,00608339 -0,0142816 -0,01679197 -0,011991 A90,095626 -0,00076517 -0,00222970 -0,00295438 -0,00234045 -0,00145962 -0,00382306 -0,00393147 -0,01139603 0,08648189 -0,00169876 -0,01356989 -0,021192 A10 0,195705 -0,00148541 -0,00482161 -0,00608351 -0,00473789 -0,00357807 -0,00800329 -0,00919784 -0,02174047 --0,00169876 0,15740499 -0,03700173 -0,044918 A11 0,219840-0,00179773 -0,00529537 -0,00681786 -0,00482882 -0,00509619 -0,00848034 -0,00848034 -0,02383721 -0,01356989 -0,03700173 0,17151411 -0,050910 A12 0,239065 -0,00020548 -0,0021699 -0,00651640 -0,00429016 -0,00192638 -0,0091709 -0,00649465 -0,02065617 -0,02119219 -0,04491853 -0,05091011 0,181913 Rev. Esp. Doc. Cient., 28, 2, 2005 163