scieee AI-readable full text Open interactive document viewer

Distribuciones discretas en MDS para datos de disimilaridad generados mediante cuestionarios

Muñoz Orellana, Juan Antonio; Vera Vera, José Fernando; González Carmona, Andrés; Pascual Acosta, Antonio; Rufián Lizana, Antonio

Abstract

En este trabajo se propone la utilización de distribuciones estadísticas discretas como alternativa a la distribución lognormal para la modelización de datos de disimilaridad provenientes de escalas con pocas modalidades en los modelos confirmatorios MDS de Ramsay y Vera. Los resultados ponen de manifiesto que las distribuciones más apropiadas son las mixturas Poisson-lognormal y Poisson-gaussiana inversa. El análisis de datos simulados confirma la falta de adecuación de un modelo continuo a datos provenientes de las escalas generalmente utilizadas en los procedimientos de sondeo de opinión subjetiva de comparación de pares.

Full text

ESTADÍSTICA ESPAÑOLA Vol. 46, Núm. 155, 2004, págs. 5 a 18 Distribuciones discretas en MDS para datos de disimilaridad generados mediante cuestionarios por JUAN ANTONIO M. ORELLANA JOSÉ FERNANDO VERA ANDRÉS GONZÁLEZ CARMONA Departamento de Estadística e I. O Universidad de Granada ANTONIO PASCUAL ACOSTA ANTONIO RUFIÁN LIZANA Departamento de Estadística Universidad de Sevilla RESUMEN En este trabajo se propone la utilización de distribuciones estadísticas discretas como alternativa a la distribución lognormal para la modelización de datos de disimilaridad provenientes de escalas con pocas modalidades en los modelos confirmatorios MDS de Ramsay y Vera. Los resultados ponen de manifiesto que las distribuciones más apropiadas son las mixturas Poisson-lognormal y Poisson-gaussiana inversa. El análisis de datos simulados confirma la falta de adecuación de un modelo continuo a datos provenientes de las escalas generalmente utilizadas en los procedimientos de sondeo de opinión subjetiva de comparación de pares. 6ESTADÍSTICA ESPAÑOLA Palabras clave: Multidimensional scaling, Lognormal, Poissonlognormal, Poisson-gaussiana inversa, Máxima verosimilitud. Clasificación AMS: 91C15 1. INTRODUCCIÓN Entre 1977 y 1982, Ramsay desarrolla un modelo probabilístico de MDS donde los datos de disimilaridad se modelizan utilizando la distribución lognormal biparamétrica, siendo estimados los parámetros mediante máxima verosimilitud. Entre las hipótesis más importantes referentes a los datos en el modelo de Ramsay destacan la continuidad en la escala de medida, el origen determinado en cero y la consiguiente no negatividad de los datos. No obstante, esas asunciones adolecen de varios inconvenientes. Por un lado, la no negatividad y el origen determinado en cero plantean problemas desde el punto de vista práctico, ya que bajo ciertas circunstancias, suele ser habitual encontrar datos negativos o cuyo origen no esté determinado en cero. Por otro lado, la hipótesis de continuidad en la escala de medida presenta un serio problema puesto que los procedimientos habituales de obtención de datos de disimilaridad están basados en escalas de medida discretas, siendo necesarias, como pone de manifiesto Ramsay (1982), un mínimo de siete categorías para poder suponer continuidad en los datos, lo que no resulta frecuente a la hora de diseñar encuestas. Además, es conocido experimentalmente que un individuo no suele emplear de forma homogénea más de cinco modalidades, por lo que aunque las escalas estén formadas por más categorías, una distribución continua no define adecuadamente el modelo. Los problemas planteados por la eliminación de las hipótesis de no negatividad y origen determinado en cero fueron tratados por Vera (1996) mediante la introducción en el modelo de un parámetro umbral, θ, utilizando una lognormal triparamétrica como distribución subyacente, lo que permite considerar los datos definidos sobre [θ, +∞), estimando θ mediante una fase adicional dentro del procedimiento iterativo. Este trabajo se centra en el problema de considerar una escala de medida continua cuando las modalidades empleadas al emitir un juicio constituyen necesariamente una medida discreta, indicando la necesidad de una distribución alternativa para datos de disimilaridad obtenidos mediante procedimientos directos como los empleados en una encuesta, lo que resultará aplicable tanto al modelo de Ramsay como a la extensión de Vera. DISTRIBUCIONES DISCRETAS EN MDS PARA DATOS DE DISIMILARIDAD GENERADOS MEDIANTE CUESTIONARIOS 7 2. PLANTEAMIENTO DEL MODELO El método propuesto por Ramsay se enmarca dentro de las técnicas confirmatorias de MDS, lo que permite, además de obtener la matriz de configuración, tomar decisiones basadas en contrastes de hipótesis y en regiones de confianza. El método empleado para la estimación de los parámetros que intervienen en el problema es el de máxima verosimilitud, por lo que resulta fundamental determinar adecuadamente la distribución de los datos. En la versión más elemental del modelo de Ramsay se presuponen observaciones independientes e idénticamente distribuidas, con densidades, ( ) 2 ijij ,ddf σ ∗donde 2 σrepresenta el factor de variabilidad del modelo, que es constante para cada par de estímulos (i, j). Para la modelización del comportamiento de los juicios emitidos, se considera un modelo multiplicativo de error de las disimilaridades, ij d, respecto a las distancias reales, ∗ ij d, que viene dado por la expresión ∗ ⋅= ijij dcd , siendo c un error aleatorio, de forma que tomando logaritmos se obtiene el modelo aditivo clásico: ,dlndln ijij ∗ +ε= donde se ha denotado por cln =ε . Si se asume que ε sigue una distribución normal, () 2 ,0 σΝ , entonces la distribución de c será lognormal y por tanto, ij d∼ () 2 ij,dln σΛ ∗. La suposición de disimilaridades no negativas y el conocimiento empírico de que la dispersión de los datos psicológicos aumenta con su localización(1), han conducido a proponer la ley lognormal como distribución más adecuada para los datos de disimilaridad. Para esta distribución, la log-verosimilitud que se debe maximizar para obtener los estimadores de la matriz de configuración y el parámetro de dispersión, puede expresarse de la forma, () () () ,2lndlnln S 2 1 ,Lln ji ij 2 2 2 dij πΜ−−      σΜ+ σ −=Χσ ∑ ∠ [1] donde, (1) La ley lognormal es un modelo de error muy usado cuando la razón entre la desviación típica y la media se supone constante. 8ESTADÍSTICA ESPAÑOLA , d d lnS ij ij ji 2         =∗ ∠ ∑ siendo M el número total de observaciones independientes. La distribución lognormal posee un estadístico suficiente para el parámetro de dispersión, por lo que la estimación de 2 σ puede realizarse de forma independiente de la de la matriz de configuración, X. De hecho se pospone en el modelo la estimación de X hasta haber obtenido la estimación de 2 σ. El estimador máximoverosímil de 2 σ viene dado por, Μ =σ S 2 Sustituyendo 2 σ por 2  σ en [1], se obtienen las ecuaciones que permiten maximizar respecto de X, () () Μ−−      Μ −=Χσ ln1Sln 2 ,  Lln 2 dij Las ecuaciones implícitas que se obtienen adoptan la expresión, Κ=== ∑∑ ,,1q,n,,1p,txt pj j pj j pj LK pq x donde, ()                 +         =∗∗ ∗pj jp pj pj 2 pj pj d d ln d d ln d 1 t. Estas ecuaciones se resuelven mediante técnicas iterativas obteniendo la configuración máximo-verosímil de los estímulos. 3. MODELIZACIÓN DE DATOS DE DISIMILARIDAD EN ESCALAS DISCRETAS Para resolver el problema de la falta de continuidad de los datos se plantea en este trabajo la utilización de una distribución discreta adecuada que represente las características de las disimilaridades, en principio, supuestamente positivas y con origen en cero. Por tanto, para la modelización de datos de disimilaridad discretos DISTRIBUCIONES DISCRETAS EN MDS PARA DATOS DE DISIMILARIDAD GENERADOS MEDIANTE CUESTIONARIOS 9 en MDS resulta conveniente utilizar distribuciones que, al igual que la lognormal, sean leptocúrticas, presenten asimetría positiva y cuya varianza aumente con la localización. Además, su dominio será en esta primera aproximación Ν, siendo deseable que, cuando el número de categorías efectivas sea apropiado, se aproximen en lo posible a la distribución lognormal, siendo por tanto esta la extensión natural cuando la escala pueda considerarse continua. En este trabajo se proponen dos distribuciones como adecuadas a estas características, pudiendo considerarse aceptable su aproximación a la lognormal. Concretamente han sido estudiadas la distribución Poisson-lognormal como alternativa teórica natural y la distribución Poisson-gaussiana inversa como elección apropiada desde el punto de vista computacional. Para centrar la terminología empleada, se dirá que una variable aleatoria, X, se distribuye según una distribución Poisson-lognormal (P-LN) de parámetros µ y 2 σ, si lo hace según una distribución P(λ) en la que el parámetro, λ, sigue una distribución lognormal biparamétrica, Λ(µ, 2 σ). En este caso, su f.m.p. queda determinada por, {} () λ           σ µ−λ− λ πσ ==ΧΡ=Ρ −λ− ∞+ ∫d 2 ln expe 2!r 1 r2 2 1r 0 r, con .,2,1,0r L= Puede encontrarse un estudio detallado de esta distribución en Shaban (1988). La media y varianza vienen dadas por, [] [] 2/2 2222 2 e1eearV;e σ+µσσ+µ σ +µ +      −=Χ=ΧΕ siendo los coeficientes de asimetría y apuntamiento, respectivamente, ()() () () [] 2/3 2 2 1 11 11321 +−ωωαωα +−ωωα++ω−ωωα =γ [2] () () ()() [ ++ω−ωωα++ω+ω+ω−ωωωα=γ 2166631 2 223 3 3 2[3] () ] () [ ] [ ] 2 11117 +−ωϖαωα÷+−ωωα+ 10 ESTADÍSTICA ESPAÑOLA donde µ =α e y 2 eσ =ω . Esta distribución ha sido empleada con frecuencia para modelizar la abundancia de especies proporcionando mejores ajustes que la lognormal o la binomial negativa (Anscombe (1950), Holgate (1969)). También ha servido para modelizar poblaciones de plancton o crímenes con baja incidencia (Plassman et al. (2001)) y puede suponérsele cierta convergencia asintótica a la lognormal (Holgate (1969)). Para su empleo en MDS, la búsqueda de una distribución discreta se ha basado fundamentalmente en la adecuación de la forma de la distribución, analizando la evolución de la razón 2 12 / γ γ . Fijando el parámetro de localización, µ , se observa que esta razón es creciente en función de ω, comportamiento que también presenta la distribución lognormal. Considerando fijo el parámetro, 1 = µ , la variación de la razón 2 12 /γγ , calculada cuando 2 σ, oscila en el intervalo (0,5], se recoge en la Tabla 1. Tabla 1 RAZÓN 2 12 /γγ , PARA 2 σ EN (0,5] Y 1 = µ EN LAS DISTRIBUCIONES LOGNORMAL (LN) Y P-LN 2 σ0.1 0.5 1 2 3 4 5 LN 1.830 2.143 2.900 7.005 19.353 53.703 147.453 P-LN 1.438 2.140 2.941 7.071 19.415 53.748 147.482 Gráficamente, puede apreciarse la evolución de los cocientes en función de 2 σ en la Figura 1. DISTRIBUCIONES DISCRETAS EN MDS PARA DATOS DE DISIMILARIDAD GENERADOS MEDIANTE CUESTIONARIOS 11 Figura 1 EVOLUCIÓN DE LA RAZÓN 2 12 /γγ Como se puede apreciar, sólo hay diferencias significativas para valores de 2 σ, muy pequeños que hacen que la varianza de la distribución esté muy próxima a su media. Estos valores no son habituales ya que la varianza en las mixturas poissonianas es siempre estrictamente mayor que su media (Teicher (1960)). La varianza de las dos distribuciones no evoluciona de la misma forma al crecer 2 σ (el crecimiento en P-LN es mayor) por lo que realizamos la misma prueba manteniendo fija la media y permitiendo que la varianza tome un rango de valores equivalente a los obtenidos cuando el parámetro 2 σen P-LN oscila en el intervalo (0,1]. De nuevo se obtiene una evolución muy similar en ambas distribuciones. La Tabla 2, recoge algunos valores para las dos distribuciones con media fija igual a 5 y la misma varianza. 12 ESTADÍSTICA ESPAÑOLA Tabla 2 VARIACIÓN DE LA RAZÓN 2 12 /γγ CON IGUAL VARIANZA Y MEDIA CONSTANTE 5. Varianza 5.1 10 20 30 40 50 100 () LN/2 12 γγ 1.882 1.992 2.240 2.515 2.810 3.120 4.816 () LNP/ 2 12 −γγ 1.039 1.792 2.126 2.401 2.693 3.003 4.707 Su representación gráfica muestra claramente esa evolución, como puede apreciarse en la Figura 2. Figura 2 EVOLUCIÓN DE LA RAZÓN 2 12 /γγ Estas mismas pruebas se han repetido con otros valores tanto de la media como del parámetro µ , obteniéndose las mismas conclusiones, lo que permite afirmar que la distribución P-LN puede utilizarse para modelizar datos de disimilaridad en MDS, sustituyendo adecuadamente a la distribución lognormal y evitando la hipóte- DISTRIBUCIONES DISCRETAS EN MDS PARA DATOS DE DISIMILARIDAD GENERADOS MEDIANTE CUESTIONARIOS 13 sis de continuidad en los casos en que la escala realmente utilizada posee menos de siete modalidades. Considerada esta distribución como alternativa discreta, la siguiente etapa consiste en encontrar los estimadores máximo-verosímiles de los distintos elementos que intervienen en el problema. No obstante, desde el punto de vista computacional resulta extraordinariamente complejo el tratamiento de las ecuaciones de verosimilitud obtenidas, por lo que surge la necesidad de buscar una aproximación de la anterior distribución que mantenga las mismas características y permita el tratamiento analítico del problema de MDS. La adecuada es la distribución Poisson-gaussiana inversa (P-GI). Shaban (1981) conjetura que esta distribución puede aplicarse en aquellos casos en los que P-LN sea adecuada debido a la similitud de las distribuciones mixturantes (lognormal y gaussiana inversa). La distribución P-GI es una mixtura poissoniana bi-paramétrica que se obtiene cuando el parámetro de la distribución de Poisson, λ, tiene una distribución gaussiana inversa. Al igual que ocurre con la distribución gaussiana inversa, son múltiples las parametrizaciones que admite esta distribución. Stein, Zuccini y Juritz (1987), proponen la siguiente densidad para la distribución P-GI de parámetros ( µ ,α), que ha sido la que hemos utilizado. {} () () () () = ααµφ             φ αφ === − !x K/ K / xXPP 2 1 x x 2 1 2 X () () 0,0, !x K/ e 22 1 x x >α>µ ααµφ π α =− φ, siendo () µ−α+µ=φ 2 1 22 , y () xKν, la función de Bessel modificada de 2ª especie y orden ν. Entre las ventajas de esta parametrización se incluyen que el parámetro µ es la media poblacional y los estimadores de máxima verosimilitud que se obtienen son más consistentes que los obtenidos con la parametrización original, por lo que es adecuada en la situación que nos ocupa. Si tomamos como medida del error () ∑∗ − =ε i 2 ii 2 p pp ,