scieee AI-readable full text Open interactive document viewer

Robustez en Multidimensional Scaling

García López. Pedro Antonio; Torrecilla de Amo, Diego; González Carmona, Andrés; Pascual Acosta, Antonio

Abstract

En este trabajo se presenta, mediante un estudio de simulación, una solución del problema de Multidimensional Scaling (MDS), cuando los datos aparecen perturbados por un error aleatorio. En el estudio de simulación se plantea un diseño cuyos factores son los distintos estimadores robustos considerados, el tipo de error y la intensidad del mismo. Asimismo se estudia la adecuación de la solución propuesta y su comparación con algoritmos clásicos de resolución del problema de MDS tratado.

Full text

ESTADÍSTICA ESPAÑOLA Vol. 45, Núm. 152, 2003, págs. 5 a 22 Robustez en Multidimensional Scaling por PEDRO ANTONIO GARCÍA LÓPEZ DIEGO TORRECILLA DE AMO ANDRÉS GONZÁLEZ CARMONA Departamento de Estadística e I.O. Universidad de Granada ANTONIO PASCUAL ACOSTA Departamento de Estadística e I.O. Universidad de Sevilla RESUMEN En este trabajo se presenta, mediante un estudio de simulación, una solución del problema de Multidimensional Scaling (MDS), cuando los datos aparecen perturbados por un error aleatorio. En el estudio de simulación se plantea un diseño cuyos factores son los distintos estimadores robustos considerados, el tipo de error y la intensidad del mismo. Asimismo se estudia la adecuación de la solución propuesta y su comparación con algoritmos clásicos de resolución del problema de MDS tratado. Palabras Clave: Multidimensional Scaling (MDS), Estimadores robustos, Simulación, R, S-Plus. Clasificación AMS: 65U05. 6ESTADÍSTICA ESPAÑOLA INTRODUCCIÓN Los juicios de proximidad que producen los datos básicos (similaridades o disimilaridades) para la mayor parte de las aplicaciones de los procedimientos MDS, son sensibles a la existencia de observaciones anómalas, no sólo por la dificultad que presenta el detectar y eliminar errores de transcripción e introducción de datos sino porque, a menudo, el problema del cansancio del sujeto que responde cuando ha de establecer un gran número de juicios, le lleva a respuestas erróneas en muchos casos. Además, algunos juicios de proximidad son intrínsecamente más difíciles de emitir que otros, con lo que es razonable suponer que la distribución de los errores asociados a ellos tenga mayor varianza, lo cual introduce un problema añadido en el proceso de reconstrucción de la configuración. El primer método de resolución para MDS está basado en los trabajos de Young y Householder (1938) y Torgerson (1958). Es probablemente el método más ampliamente usado porque, aunque los procedimientos no métricos han sustituido en muchos casos a los métodos métricos, casi todos los programas usados en la actualidad emplean alguna variante del procedimiento Young-HouseholderTorgerson (Y-H-T) como configuración inicial. Obviamente si el enfoque tradicional es sensible a los datos anómalos, los programas que lo usan para obtener la configuración inicial se ven afectados también por ellos. En este sentido, Spence y Lewandowsky (1989) demuestran cómo un único dato anómalo puede distorsionar drásticamente una solución MDS cuando se emplea el método métrico tradicional. Debido a esta “fragilidad” resulta necesario, e incluso diríamos imprescindible, encontrar técnicas mucho más resistentes que amortigüen estos problemas. Estas razones justifican sobradamente la definición de procedimientos que protejan a estos métodos de la presencia de estas anomalías. En los trabajos de Spence (1982), Null y Sarle (1982), y Heiser (1988) se argumenta la necesidad, para MDS, de algoritmos que sean resistentes a los efectos de los datos anómalos. Un programa robusto para MDS debe mostrarse por tanto, poco afectado por la presencia de datos anómalos, incluso cuando existan en número relativamente grande y, además, deberá funcionar de manera adecuada cuando no haya ninguno de ellos presente. Con esta idea, Spence y Lewandowsky (1989) proponen un programa, basado en la mediana como medida robusta, para resolver la presencia de observaciones anómalas. Esta estrategia supone, obviamente, una drástica eliminación de la información métrica contenida en los datos. ROBUSTEZ EN MULTIDIMENSIONAL SCALING 7 En este trabajo se aborda el problema desde un planteamiento más general, considerando varios estimadores robustos que gozan de unas propiedades teóricas idóneas, en el sentido de intentar utilizar toda (o la mayor parte de) la información métrica posible contenida en los datos. Estos estimadores son las α-trimedias y los estimadores de Huber y de Tukey, estos últimos basados en la definición de una función de peso asociada al vector de datos considerado. Sobre las propiedades teóricas de los mismos nos remitimos a Huber (1981) y a Hampel et al. (1986). OBJETIVOS En este trabajo se han perseguido tres objetivos básicos: 1. Desarrollar un método de resolución del problema de MDS que sea resistente a la presencia de datos anómalos Para ello se ha elaborado un diseño de simulación en el que se contaminan las distancias originales de una configuración dada mediante tres procedimientos: a. Una pequeña cantidad de grandes errores, b. Una moderada cantidad de pequeños errores (a los que llamaremos errores de fondo) c. Ambas contaminaciones simultáneamente. Se trata, por tanto, de desarrollar un procedimiento que se comporte bien en condiciones normales, y presente resistencia frente a los errores contenidos en los datos hasta, al menos, un porcentaje suficientemente amplio de contaminación. El método será algorítmico con estimadores robustos y tan general como para que pueda aplicarse a un MDS de cualquier dimensión. 2. Controlar la adecuación de la metodología propuesta Para ello habrá que medir, por una parte, el grado de reconstrucción de las configuraciones finales conseguidas por medio de los procedimientos propuestos, y por otra comprobar si este grado de reconstrucción depende de la configuración inicial elegida en el proceso de simulación. 3. Contrastar los resultados obtenidos por los procedimientos que se proponen con los que se obtienen, en iguales condiciones, por medio de los procedimientos clásicos (métricos y no métricos) de MDS Para ello se han utilizado los programas PC-MDS, que incorpora el método clásico KYST, y SPSS (V. 10.0) que incorpora el muy difundido método ALSCAL. 8ESTADÍSTICA ESPAÑOLA FORMULACIÓN DEL PROBLEMA En MDS se pretende obtener una configuración geométrica mediante un conjunto de N puntos en un espacio euclídeo de dimensión predeterminada, de tal forma que cada uno de ellos represente a un estímulo y que la diferencia, eij , entre la distancia de los puntos i y j, dij, y las disparidades o disimilaridades existentes entre los correspondientes estímulos, δij, (i y j:1,...,N; i≠j), sea mínima. Si designamos por k la dimensión del espacio euclídeo considerado, es posible encontrar la solución del problema de MDS resolviendo el siguiente conjunto de ecuaciones: ji con N ,, 1:j , i para 0de ijijij ≠=−δ=K cuyas incógnitas son las coordenadas de los puntos que se pretenden encontrar. Utilizando la métrica euclídea para los valores de dij y designando por xrs a la coordenada s-ésima (s:1,...,k) del punto genérico, Pr (r:1,...,N), de la configuración final, X, se obtienen del sistema anterior N-1 ecuaciones en donde aparecerán xrs como incógnitas. Utilizando el método de Newton en cada una de estas ecuaciones, se obtiene la solución iterativa: ( ) t js t rs t rj t rjrjt rs 1t rs xx dd xx − ⋅−δ += + Para obtener la coordenada xrs en el paso t+1, a partir del correspondiente valor en el paso t, se tienen N-1 correcciones, tantas como valores puede tomar j. Si escribimos las N-1 ecuaciones como: r j ,...,N, 1 j: ) c ( xx j t rs t rs 1t rs ≠+= + podemos elegir una medida robusta, rob, y calcular su valor a partir de las N-1 correcciones j t rs ) c ( para pasar de t rs x a 1t rs x +. Por tanto, si j t rsrj t rs ) c ( rob ) c (≠ = es una determinación robusta(1) de la corrección, obtenemos: ) c ( xx t rs t rs 1t rs += + (1)En este trabajo hemos usado cinco medidas robustas diferentes: tres L-estimadores (Mediana, Trimedia al 30% y Trimedia al 40%) y dos M-estimadores (el estimador de Huber y el estimador de Tukey) ROBUSTEZ EN MULTIDIMENSIONAL SCALING 9 Pueden realizarse modificaciones del tamaño del paso ( ) t rs c en la dirección del vector de correcciones para acelerar la convergencia del procedimiento iterativo. Siguiendo a D.G. Luenberger (1984), el tamaño del paso puede ser modificado multiplicándolo por el factor: t t t c α =γ en donde ct es la magnitud relativa al vector de correcciones: ( ) ( ) 2/1 a, i 2 t ia a,i 2 t ia t x c c             =∑ ∑ y αt se obtiene del método δ2 de Aitken (Ramsay, 1977) ( ) ( ) 2/1 a, i 2 2t ia 1t ia t ia a,i 2 2t ia 1t ia t1t xx2x xx             −− − α=α∑ ∑ −− −− + lo cual obliga a generar dos soluciones previas, antes de abordar el procedimiento que aquí se expone. El algoritmo final, queda pues de la forma siguiente: ( ) t rs tt rs 1t rs cxx ⋅γ+= + El algoritmo propuesto(2) ha sido programado en R y S-Plus. ESTUDIO DE SIMULACIÓN El estudio consta de tres fases: •• Primera fase: Se estudia el comportamiento de los algoritmos presentados aplicándolos a una determinada configuración original en dimensión dos, perturbada convenientemente, y se observa el grado de reconstrucción obtenido. (2)Puede solicitarse en [email protected] 10 ESTADÍSTICA ESPAÑOLA La configuración inicial seleccionada está formada por 21 puntos del plano, situados 16 de ellos sobre los lados de un cuadrado de lado unidad y equidistantes entre sí, otro en el origen de coordenadas y los cuatro restantes sobre los ejes de coordenadas, a distancia 1/2 del origen, según se muestra en la figura 1. Estos 21 puntos determinan una matriz triangular con 210 distancias y las disimilaridades son el resultado de someter a dichas distancias a un efecto distorsionador con un diseño experimental factorial de 5x4x2 con seis repeticiones por celda, del siguiente modo: •• Cinco tipos de medidas robustas: Trimedia al 30%, Trimedia al 40%, Mediana, Huber y Tukey. •• Cuatro porcentajes de distancias anómalas: 10%, 20%, 30% y 40%. El método consiste en seleccionar aleatoriamente el porcentaje de distancias correspondiente y contaminar dichas distancias con errores (Ramsay, 1977) lognormales pseudoaleatorios de desviación típica igual a 2. La contaminación se produce multiplicando la distancia por la transformada exponencial del error. •• Dos escenarios: Con error de fondo y sin él. El método consiste en contaminar, con el mismo criterio del punto anterior, distancias hasta completar el 50% del total de ellas, con errores pseudoaleatorios procedentes de una distribución lognormal con desviación típica igual a 0.1. En resumen, se llevan a cabo un total de 5x4x2x6=240 estudios separados. Puesto que la solución que en este caso proporciona el método Y-H-T es bastante pobre, por cuanto se ve ampliamente afectada por la presencia de valores anómalos, se establece como primera configuración de los procedimientos iterati- ROBUSTEZ EN MULTIDIMENSIONAL SCALING 11 vos una definida por los rangos de las distancias perturbadas, esto es, los datos iniciales (disimilaridades) se reemplazan por sus rangos, lo que atenúa la contaminación anómala de los datos, y a continuación se calcula sobre ellos una solución MDS por el procedimiento Y-H-T. El problema de la constante aditiva se resuelve utilizando una versión robusta del método de Torgerson. En este caso: ( ) { } { } jh ih ijj, ihi j i0robrobrobcδ−δ−δ=≠≠ con lo que la escala original de distancias se reconstruye obligando a que las medianas verifiquen la condición: ( ) ( ) 0 ijj i0 ijj id medcmed << =+δ Como medida del índice de reconstrucción se ha utilizado el coeficiente de correlación lineal medio (de las 6 réplicas) entre las distancias de la configuración original y las de la configuración reconstruida por el procedimiento. Con este diseño se han obtenido los resultados de las tablas 1 y 2, en donde el valor superior de cada fila es el índice medio de reconstrucción (r-medio) y el valor inferior corresponde a la desviación típica para cada r-medio. 12 ESTADÍSTICA ESPAÑOLA Tabla 1 Porcentaje de datos anómalos (sin error de fondo) Medida robusta 10% 20% 30% 40% Trim-30% 99,65 0,0023 95,06 0,0881 86,63 0,0863 78,23 0,1201 Trim-40% 99,82 0,0030 99,89 0,0018 95,31 0,0391 77,49 0,1204 Mediana 99,94 0,0006 99,99 0,0002 96,59 0,0307 82,09 0,0805 Huber 99,69 0,0025 95,01 0,0636 93,11 0,0416 69,21 0,0820 Tukey 98,23 0,0174 99,09 0,0124 87,81 0,1008 78,57 0,1443 Tabla 2 Porcentaje de datos anómalos (con error de fondo) Medida robusta 10%-40% 20%-30% 30%-20% 40%-10% Trim-30% 92,50 0,0848 96,44 0,0417 89,36 0,0993 51,31 0,1472 Trim-40% 94,86 0,0758 99,38 0,0058 90,06 0,0899 52,86 0,2111 Mediana 99,79 0,0018 97,74 0,0370 96,48 0,0502 57,55 0,02470 Huber 96,18 0,0691 93,71 0,0772 90,71 0,0562 57,43 0,0646 Tukey 99,69 0,012 92,94 0,1005 95,11 0,0591 66,43 0,2126 ROBUSTEZ EN MULTIDIMENSIONAL SCALING 13 Los gráficos 1 y 2 muestran los valores correspondientes a las tablas 1 y 2 Gráfico 1 65 70 75 80 85 90 95 100 10% 20% 30% 40% Porcentaje de datos anómalos (sin error de fondo) Índice medio de reconstrucción (r-medio) Trim-30% Trim-40% Mediana Huber Tukey Gráfico 2 50 55 60 65 70 75 80 85 90 95 100 10% 20% 30% 40% Porcentaje de datos anómalos (con error de fondo) Índice medio de reconstrucción (r-medio) Trim-30% Trim-40% Mediana Huber Tukey A la vista de estos resultados es conveniente hacer notar que es difícil calcular un valor a partir del cual pueda decirse que no se obtiene una reconstrucción idónea. No obstante, podemos afirmar que todos los estimadores robustos obtienen la configuración original de forma muy buena cuando la presencia de datos anómalos llega hasta un 30% del total (63 distancias perturbadas de 210). La pérdida mayor se produce en la trimedia al 30%, con un 13.37% cuando están presentes el 30% de anómalos. Cuando los datos originales se contaminan además con un error de fondo, los resultados empeoran ligeramente, pero siguen siendo muy buenos, sobre todo 20 ESTADÍSTICA ESPAÑOLA CONCLUSIONES 1. En el estudio realizado, tanto en la primera fase como en la segunda, los procedimientos robustos ofrecen resultados satisfactorios hasta para un 30% de datos anómalos, con y sin error de fondo. 2. El estudio realizado en la tercera fase, deja claro que cualquiera de los procedimientos expuestos supera, y a veces considerablemente, a los procedimientos clásicos ALSCAL en su versión no métrica y a KYST en su versión métrica. REFERENCIAS ANDREWS, D. F.; BINCKEL, P. J.; HAMPEL, F. R.; HUBER, P. J.; ROGERS, W. H. & TUKEY, J. W. (1972).- «Robust Estimates of Location». Princeton, New Jersey: Princeton University Press. CLARKSON, D. B. (1988).- «Robustness of Multidimensional Scaling Estimates» Proceedings of the Statistical Computing Section, Annual Meeting of the A.S.A., 175-180. CLARKSON, D. B. & KIM, J.- «Robustness of Nonmetric Multidimensional Scaling Estimates». IMSL Inc., Houston, TX, 175-180. COX, T.F. & COX, M.A.A. (1994).- «Multidimensional Scaling». Chapman & Hall. GARCÍA-LÓPEZ, P.A., GONZÁLEZ, A. & VERA, J.F. (1993).- «Contributions to the Nonmetric Maximum Likelihood MDS from Directional Rankings of Similarities Method. Proceedings of the 1993» European Meeting of the Psychometric Society. GOODALL, C. (1982).- «M-Estimators of Location: an outline of the theory. Understanding Robust and Exploratory Data Analysis». New York: Wiley, 339-400. HAMPEL, F.R.; RONCHETTI, E.M.; ROUSSEEUW, P.J. & STAHEL, W.A. (1986).- «Robust Statistics. The Approach Based on Influence Functions» Wiley Series in Probability and Mathematical Statistics. HEISER, W. J. (1988).- «Multidimensional scaling with least absolute residuals». Classification and Related Methods of Data Analysis. H.H. Bock (Editor), 455462 ROBUSTEZ EN MULTIDIMENSIONAL SCALING 21 HUBER, P.J. (1981).- «Robust Statistics». Wiley Series in Probability and Mathematical Statistics. KRUSKAL, J. B. (1964a).- «Multidimensional scaling by optimizing goodness-of-fit to a nonmetric hypothesis» Psychometrika, 29, 1-27. KRUSKAL, J. B. (1964b).- «Nonmetric multidimensional scaling: a numerical method» Psychometrika, 29, 115-129. LUENBERGER, D. G. (1984).- «Linear and nonlinear programming». Reading, MA: Addison-Wesley. NULL, C. H. & SARLE, W. (June 1982).- «Robust multidimensional scaling». Paper presented at the Joint Meeting of the Psychometric and Classification Societies. Montreal, Canada. R DEVELOPMENT CORE TEAM (2002).- «R: A Programming Environment for Data Analysis and Graphics». RAMSAY, J. O. (1977).- «Maximum Likelihood Estimation in Multidimensional Scaling». Psychometrika, 42, 241-266. ROSEMBER, J. L. & GASKO, M. (1982).- «Comparing location estimators: Trimmed Means, medians and trimean. Understanding Robust and Exploratory Data Analysis». New York: Wiley, 297-336. SPENCE, I. (1982).- «Robust multidimensional scaling». Paper presented at the Joint Meeting of the Psychometric Society and the Classification Society. Montréal, Canada. SPENCE, I. (1983).- «Monte Carlo simulation studies». Applied Psychological Measurement, 7, 405-425. SPENCE, I. & LEWANDOWSKY, S. (1989).- «Robust Multidimensional Scaling». Psychometrika, 54, 501-513. THISTED, R. A. (1988).- «Elements of Statistical Computing. Numerical Computation». Chapman & Hall. TORGERSON, W. S. (1958).- «Theory and methods of scaling» New York: Wiley. TORRECILLA DE AMO, D. (1999).- «Estudios de Robustez en Multidimensional Scaling». Tesis Doctoral. Universidad de Granada. YOUNG, G. & HOUSEHOLDER, A. S., (1938).- «Discussion of a set of points in terms of their mutual distances». Psychometrika, 3, 19-22. 22 ESTADÍSTICA ESPAÑOLA ROBUSTNESS IN MULTIDIMENSIONAL SCALING SUMMARY In this paper we show, by means a simulation study, a method to solve the perturbational error Multidimensional Scaling (MDS) problem. We work with a factorial design in which it has been considered several robust estimators, and two types of random error with several intensities. Furthermore we study the fit of the obtained configuration and its comparison with other classical MDS methods. Key-words: Multidimensional Scaling (MDS), Robust estimators, Simulation, R, S-Plus 2000. AMS Clasification: 65U05.