scieee AI-readable full text Open interactive document viewer

Aplicación del modelado estadístico y la detección de señales en memoria de reconocimiento y potenciales evocados

Wallace-Ruíz, Agustín

Abstract

La aplicación del modelado estadístico puede aportar una mayor comprensión de los procesos implicados en la memoria de reconocimiento, para la que ya existen técnicas de medida desde diferentes enfoques teóricos. En este trabajo nos apoyamos en la Teoría de Detección de Señales (TDS) y utilizaremos algunas de sus herramientas metodológicas, que como trataremos de demostrar tienen relación con el modelado estadístico (DeCarlo 1998). En el presente trabajo, expondremos los fundamentos teóricos del modelado estadístico, además, se realiza una exposición de los diferentes modelos del modelado estadístico que podemos aplicar al estudio de la memoria de reconocimiento, y finalmente, se hace una revisión de las diferentes teorías que tratan de dar explicación a los procesos implicados en la memoria de reconocimiento, una breve introducción a la TDS, y los métodos de medida de la memoria de reconocimiento. En el estudio empírico, en primer lugar, se realiza un estudio para comprobar si el modelado estadístico (utilizando un modelo loglineal) aporta información adicional a las técnicas tradicionalmente utilizadas para el estudio de este fenómeno desde el punto de vista de la detección de señales. En segundo lugar se aplican de nuevo estas técnicas a un estudio de memoria de reconocimiento donde se incluyen medidas psicofísicas como son los potenciales evocados utilizando un modelo lineal múltiple. En tercer lugar, aplicamos el modelado estadístico (utilizando un modelo de regresión de Poisson) a las respuestas de los sujetos añadiendo la información que nos proporcionan los tiempos de reacción. Los resultados de estos estudios nos muestran que existe asociaciónentre la seguridad de la respuesta de los sujetos y el tipo de respuesta que daban asumiendo un modelo cognitivo de reconocimiento. También, hemos comprobado que pueden existir dos procesos diferenciados de memoria en función de los estímulos que se presentan, apoyándonos en registros electrofisiológicos lo que apoyaría un modelo asociacionista de la memoria. Finalmente, hemos comprobado que los sujetos son capaces de discriminar estímulos diferentes que han memorizado previamente, diferenciándose esta discriminación en el tiempo de reacción de la respuesta, lo que nos lleva a pensar que el sujeto utiliza un modelo cognitivo de reconocimiento. En definitiva, hemos tratado de que se encuentren la estadística y la teoría psicológica para contribuir a la unificación de los modelos de forma parsimoniosa, pero en toda su extensión. El modelado une en una misma estructura el modelo sustantivo y el modelo estadístico-matemático, optando por el modelo más parsimonioso y considerando conjuntamente todas las variables plausibles del modelo.

Full text

TESIS DOCTORAL Aplicación del modelado estadístico y la detección de señales en memoria de reconocimiento y potenciales evocados. Por Agustín Wallace Ruiz Dirigida por: Dr. Manuel Pelegrina del Rio Programa de Doctorado en Psicología Cognitiva Facultad de Psicología de Málaga Departamento de Psicobiología y Metodología de las CC. Del Comportamiento Universidad de Málaga 2015 AUTOR: Agustín Wallace Ruiz http://orcid.org/0000-0003-1437-0128 EDITA: Publicaciones y Divulgación Científica. Universidad de Málaga Esta obra está bajo una licencia de Creative Commons Reconocimiento-NoComercialSinObraDerivada 4.0 Internacional: http://creativecommons.org/licenses/by-nc-nd/4.0/legalcode Cualquier parte de esta obra se puede reproducir sin autorización pero con el reconocimiento y atribución de los autores. No se puede hacer uso comercial de la obra y no se puede alterar, transformar o hacer obras derivadas. Esta Tesis Doctoral está depositada en el Repositorio Institucional de la Universidad de Málaga (RIUMA): riuma.uma.es EL DOCTOR MANUEL PELEGRINA DEL RÍO, PROFESOR TITULAR DEL DEPARTAMENTO DE PSICOBIOLOGÍA Y METODOLOGÍA DE LAS CIENCIAS DEL COMPORTAMIENTO DE LA UNIVERSIDAD DE MÁLAGA Certifica: Que la tesis doctoral realizada por D. Agustín Wallace Ruiz con el título: “Aplicación del modelado estadístico y la detección de señales en memoria de reconocimiento y potenciales evocados”, de la cual soy director, ha sido proyectada, desarrollada y redactada bajo mi supervisión. Que el mecionado trabajo de investigación reúne todas las catarerísticas ciemtíficas y técnicas para poder ser defendido públicamente. Asimismo merece nuestra valoración en cuanrto a actualidad y planteamiento metodológico. De todo lo cual informo, como trámite preceptivo para su aceptación y posterior defensa pública. Málaga a 13 de febrero de 2015 Firmado: Manuel Pelegrina del Río DEDICATORIA A las personas más especiales de mi vida, mi mujer Angelines y mi hija Alicia, por su amor, compañía, paciencia y apoyo incondicional durante estos años AGRADECIMIENTOS Son muchas las personas a las que quiero agradecer y dedicar esta tesis doctoral, tanto a las que han contribuido directamente con sus comentarios, consejos, enseñanzas o ayuda, así como las que me han apoyado, hecho pasar buenos momentos y dado su cariño a lo largo de los años de realización de esta tesis doctoral. En primer lugar quiero agradecer al Dr. Manuel Pelegrina por su ayuda, paciencia, consejos y apoyo, y por haberme iniciado en mi vida académica, y su inestimable ayuda para finalizar este trabajo. A mi familia: mis padres Pilar y Agustín, mis hermanos MªIsabel, Laura y Jorge por su aportación emocional y apoyo incondicional. A mis compañeros de la Facultad de Psicología de Málaga, y especialmente a los del departamento de Psicobiología y Metodología de la C.C. del Comportamiento por su apoyo, ánimo, y ser excelentes compañeros/as de trabajo. A los alumnos de la Facultad de Psicología de Málaga que han contribuido con su “cerebro” y ayuda en el laboratorio a que esta tesis pudiese ser finalizada. INDICE PRIMERA PARTE: ENFOQUE TEÓRICO 1 – Introducción 1 1.1 Antecedentes históricos 2 1.2 Antecedentes históricos recientes 5 1.3 El presente trabajo 13 2 – El Modelado Estadístico 15 2.1 ¿Qué es el modelado estadístico? 16 2.2 ¿Cuál es el objetivo del modelado estadístico? 17 2.3 Aspectos Fundamentales del modelado estadístico 17 2.4 Etapas del modelado estadístico 19 2.5 Ventajas del modelado estadístico 22 2.6 Sistemas de codificación para variables categóricas 22 2.7 Selección del modelo 27 2.7.1 Selección de modelos conducida por el investigador 28 2.7.2 Selección de modelos mediante algoritmos automáticos 31 2.8 Concluyendo 35 3 – El Modelo de Regresión Lineal 36 3.1 Introducción 37 3.2 El modelo de regresión lineal simple 39 3.2.1 ¿Cómo se ajusta la recta de regresión? 41 3.2.2 Estimación de los parámetros del modelo 42 3.2.3 Ajuste y selección del modelo 44 Procedimiento 3Resultados 239 4Discusión 241 DISCUSIÓN GENERAL 244 CONCLUSIÓN 255 REFERENCIAS 259 PRIMERA PARTE ENFOQUE TEÓRICO Statistical thinking will one day be as necessary for efficient citizenship as the ability to read and write. H.G. Wells CAPÍTULO 1 INTRODUCCIÓN I am surely not alone in having suspected that some of Fisher’s major views were adopted simply to avoid agreeing with his opponents. Leonard Savage. Introducción A.Wallace 2 1.1 ANTECEDENTES HISTÓRICOS El intento de dar explicación a todo aquello que aparece en nuestro entorno, es algo inherente al ser humano, de este modo, la estadística ha proporcionado el marco conceptual que nos permite explicar1 y predecir muchos de los fenómenos que nos rodean. Inicialmente egipcios, babilonios, árabes, griegos y romanos impulsaron esta ciencia como una forma de mejorar y controlar su extensa civilización, pero cayó en desuso tras la caída del imperio romano; no obstante, de nuevo a finales de la Edad Media vuelve a recobrar importancia. Fue el matemático italiano, Leonardo de Pisa (conocido como Fibonacci) 11701250 la persona que revolucionó las matemáticas en Europa. Hasta entonces se seguía utilizando el sistema de numeración romana, muy sencillo de utilizar para sumas y restas; pero supone todo un reto en operaciones más complejas. La aportación principal de este matemático fue la introducción de la numeración árabe (de base 10) y el cero como dígito de valor nulo. Pero quizás, por lo que suele ser mas conocido es por la secuencia de Fibonacci (1,1,2,3,5,8,13,21,34,55). En esta secuencia, cada número a partir del tercero, se obtiene sumando los dos que le preceden (ver figura 1.1). 1 En este trabajo se ha utilizado la palabra explicar, o desde aquí explicativo, explicativa…de una manera amplia. Los diseños en el ámbito del modelado han “confundido” explicación con variable causal o predictiva. Mientras en filosofía de la ciencia el término explicar va siempre unido a una teoría, nunca a una variable. Porque, según la filosofía de la ciencia, ninguna variabe, sin una teoría, puede explicar nada por sí sola. Introducción A.Wallace 3 Figura 1.1 Gráfica de la secuencia de Fibonacci y sus ecuaciones Donde una secuencia aparentemente aleatoria de números, sigue un patrón determinado por una función. Es interesante señalar también la relación de esta secuencia con el número φ = 1,61803..., llamado número de oro y que representa la letra inicial en griego del nombre del escultor griego Fidias que lo utilizó en sus obras. Este es el primer y más importante de los objetivos generales que pretendemos conseguir mediante esta tesis, buscar funciones que nos permitan encontrar patrones donde aparentemente solo existe el caos. Más adelante, en el renacimiento se vive un gran furor por la estadística, y se producen avances muy importantes (notación, logaritmos, signos, etc.). Así, alrededor del año 1540, el alemán Muster realizó una compilación estadística de los recursos nacionales, que comprendía datos acerca de la organización política, instrucciones sociales, comercio y poderío militar. Durante el siglo XVII se aportaron indicaciones más concretas sobre los métodos de observación y análisis cuantitativo y se ampliaron los campos de la inferencia y la teoría estadística. Introducción A.Wallace 4 Por otra parte, la teoría de probabilidad tiene su origen en los juegos de azar. Hacia 1650, en Francia, un jugador llamado De Mére consultó al matemático Blaise Pascal sobre algunas cuestiones relacionadas con el juego de dados. Pascal mantuvo correspondencia con Fermat, Huygens y Bernoulli. Gracias a todos ellos, la teoría de la probabilidad pasó de ser una mera colección de problemas aislados, relativos a algunos juegos, a ser un sector importante de las matemáticas. Pero fue Achenwall quien acuñó en 1760 la palabra estadística, que extrajo del término italiano statista (estadista). Creía, que los datos de la nueva ciencia serían el aliado más eficaz del gobernante consciente. La raíz etimológica de la palabra se halla, por otra parte, en el término latino status, que significa estado o situación. Esta etimología aumenta el valor intrínseco de la palabra, por cuanto la estadística revela el sentido cuantitativo de las más variadas situaciones. Durante el sigo XVIII empieza el auge de la estadística descriptiva en asuntos sociales y económicos, y es a finales de ese siglo y comienzos del XIX cuando se comienzan a asentar verdaderamente las bases teóricas de la teoría de probabilidades con los trabajos de Lagrange (1770) y Laplace (1780), Gauss (1801), y de Poisson (1837). Previamente, cabe destacar el descubrimiento de la distribución normal por de Moivre (1738), distribución que será posteriormente “redescubierta” por Gauss (1801) y Poisson (1837). No obstante, fue Quételect (1835) quien aplica la Estadística a las ciencias sociales, interpretando la teoría de la probabilidad para su uso en las ciencias sociales y así, resolver la aplicación del principio de promedios y de la variabilidad a los Introducción A.Wallace 5 fenómenos sociales. Quételect (1835) fue el primero en realizar la aplicación práctica del “método” Estadístico a las diversas ramas de la ciencia. Entretanto, en el período del 1800 al 1820 se desarrollaron dos conceptos matemáticos fundamentales para la teoría Estadística; la teoría de los errores de observación, aportada por Laplace y Gauss; y la teoría de los mínimos cuadrados desarrollada por Laplace, Gauss y Legendre. A finales del siglo XIX, Galton (1888) ideó el procedimiento conocido por correlación, que tenía por objeto medir la influencia relativa de los factores sobre las variables. De aquí partió el desarrollo del coeficiente de correlación momento-producto creado por Pearson (1895), así como el importante concepto de la desviación estándar (Pearson, 1893). Por su parte, Yule (1907), en fechas muy próximas a las citadas realizaba amplios estudios sobre la medida de las correlaciones (Yule, 1897). 1.2 ANTECEDENTES HISTÓRICOS RECIENTES El análisis de los datos categóricos hasta fechas recientes ha estado limitado al análisis de tablas de contingencia bidimensionales con el estadístico 2 χ de Pearson. Esto es debido a la controversia que surgió a principios de siglo entre Pearson y Yule. Así, el año 1900 es el punto de comienzo del análisis de datos categóricos desde que Pearson (1900) introdujo el estadístico 2 χ y Yule (1911) presentó la razón de productos cruzados (odds ratio). En 1900 Pearson era muy conocido por la comunidad estadística, estaba a la cabeza del laboratorio estadístico del University College in London, y su trabajo en la década precedente incluía el desarrollo de una familia de Introducción A.Wallace 6 distribuciones de probabilidad sesgada (llamadas curvas de Pearson), obteniendo la estimación de los coeficientes de correlación, encontrando el error estándar y extendiendo el trabajo de Galton (1888) sobre la regresión lineal. El trabajo de Pearson (1900) tenía por objeto desarrollar la prueba ji-cuadrado e incluía tanto los resultados de la ruleta del casino de Monte Carlo (que variaba aleatoriamente) como las pruebas de ajuste de series de datos, las denominadas curvas de Pearson, y las pruebas estadísticas de independencia incluidas en las tablas de contingencia bidimensionales. En 1904, Pearson introdujo el término contingencia como una “measure of the total deviation of the classification from independent probability” e introdujo medidas para describir su magnitud. Defendía que las variables observadas eran transformaciones discretas de dos variables aleatorias continuas con distribución normal bivariada y pretendía extender la teoría de la correlación a las tablas de contingencia. Yule era contemporáneo de Pearson, pero eligió una aproximación alternativa. Habiendo completado los trabajos pioneros sobre modelos de regresión múltiple y referidos a coeficientes de correlación parcial y múltiple, Yule (1911) desvió su atención a partir de 1900 hacia el estudio de la asociación en tablas de contingencia, ya que creía que muchas de las variables categóricas eran intrínsecamente discretas y definió índices en términos de conteo de celdillas, sin asumir un continuo subyacente. Sus medidas incluyen la razón de productos cruzados y la transformación de esta, llamada Q de Yule. Yule (1907) descubrió la discrepancia potencial entre asociaciones marginales y condicionales en tablas de contingencia, más tarde revisado por Simpson (1951) y llamada paradoja de Simpson. Yule (1907) por su parte argumentaba que las variables observadas debían ser el núcleo de interés independientemente de su nivel de medida. Pero Pearson (1906-1914) era el líder de la ciencia estadística en Inglaterra, se Introducción A.Wallace 13 Por último, hemos de resaltar que la formulación definitiva del modelo lineal generalizado fue propuesta por McCullagh y Nelder (1983), los cuales desarrollaron en profundidad los fundamentos teórico-matemáticos del modelo. Desde entonces son varios los autores que han continuado estos trabajos, Agresti (1990), Dobson (1983), Lindsey (1997), Judd y McClelland (1998). 1.3 EL PRESENTE TRABAJO El modelado estadístico como hemos visto, es un enfoque de análisis de datos que empezó a gestarse a principios del siglo XX y que se desarrolló a partir de la mitad de este siglo, gracias en gran parte, a los avances en informática, que han propiciado la potencia de cálculo necesaria, y a los avances en estadística de finales de los 80 y principios de los 90. Visto de este modo, se plantea como una alternativa integradora, no excluyente a los modelos estadísticos tradicionales. El objetivo de esta investigación es comprobar si estas técnicas estadísticas aportan una mayor comprensión de los procesos implicados en la memoria de reconocimiento, para la que ya existen técnicas de medida desde diferentes enfoques teóricos. En este trabajo nos apoyamos en la Teoría de Detección de Señales (TDS) como base teórica y utilizaremos algunas de sus herramientas metodológicas, que como trataremos de demostrar tienen relación con el modelado estadístico (DeCarlo 1998). La exposición del presente trabajo se ha estructurado en dos partes, la primera constituye el enfoque teórico de la investigación donde se exponen, en primer lugar, los fundamentos teóricos del modelado estadístico; en segundo lugar, una exposición de los Introducción A.Wallace 14 diferentes modelos del modelado estadístico que podemos aplicar al estudio de la memoria de reconocimiento; y en tercer lugar, una revisión de las diferentes teorías que tratan de dar explicación a los procesos implicados en la memoria de reconocimiento, una breve introducción a la TDS, y métodos de medida de la memoria de reconocimiento. La segunda parte consiste en el estudio empírico llevado a cabo. En primer lugar se realiza un estudio para comprobar si el modelado estadístico aporta información adicional a las técnicas tradicionalmente utilizadas para el estudio de este fenómeno desde el punto de vista de la detección de señales. En segundo lugar se aplican de nuevo estas técnicas a un estudio de memoria de reconocimiento donde se incluyen medidas psicofísicas como son los potenciales evocados. En tercer lugar, aplicamos el modelado estadístico a las respuestas de los sujetos añadiendo la información que nos proporcionan los tiempos de reacción. Modelado Estadístico A.Wallace 15 CAPÍTULO 2 EL MODELADO ESTADÍSTICO Essentially, all models are wrong, but some are useful. George Box Modelado Estadístico A.Wallace 16 2.1- ¿QUE ES EL MODELADO ESTADÍSTICO? El modelado estadístico es un proceso en el que, mediante la aplicación de un conjunto de procedimientos estadísticos, se alcanzará una explicación sobre la variable respuesta a partir de una función ponderada de una o más variables explicativas (Dobson, 1983). Es una de las herramientas más útiles para estudiar y comprender la variabilidad de un conjunto de datos observados. Dentro de esta variabilidad podemos distinguir dos elementos:  La variabilidad sistemática  La variabilidad aleatoria La variable de respuesta que estudiamos estaría compuesta de este modo por un componente sistemático y otro aleatorio: El componente sistemático podemos representarlo mediante un modelo de regresión (donde la variabilidad de los datos está explicada por categorías o variables objeto de nuestro estudio). El componente aleatorio, también denominado residual, incluye las diferentes posibilidades de respuesta. Representa una medida que describe hasta qué punto la variable de respuesta se desvían debido a fluctuaciones de las categorías o variables ajenas a nuestros objetivos de medida. La relación entre los dos componentes de la variable de respuesta se puede especificar mediante una sencilla ecuación: Modelado Estadístico A.Wallace 17 DATOS = MODELO + ERROR donde MODELO, es la variabilidad de los datos explicada por el componente sistemático, y ERROR, es la variabilidad no explicada. 2.2 - ¿CUAL ES EL OBJETIVO DEL MODELADO ESTADÍSTICO? Se trata de un proceso por el cual los modelos se construyen, evalúan y modifican en relación directa con los datos obtenidos. Por tanto, el objetivo es conseguir un modelo a partir de unos datos específicos en el cual la proporción de componente sistemático sea lo más grande posible con respecto al error. Asimismo, este modelo debe representar la relación entre la variable de respuesta y las variables explicativas. 2.3 – ASPECTOS FUNDAMENTALES DEL MODELADO ESTADÍSTICO Antes de iniciar el proceso debemos dejar claras nuestras intenciones a la hora de utilizar los modelos resultantes del proceso de modelado. En efecto, mediante el modelado podemos conseguir dos objetivos:  Explicativo: pretendemos descubrir la relación hipotética entre dos o más variables (como ocurre en los modelos de análisis clásicos).  Predictivo: pretendemos predecir el valor de la variable de respuesta a partir de las variables explicativas (como en los modelos de regresión). Así, durante el proceso de modelado estadístico podemos obtener diferentes modelos igualmente válidos, y es aquí donde aparece el problema de la selección del Modelado Estadístico A.Wallace 18 modelo estadístico óptimo (Claeskens y Hjort, 2008). En general, el principio que debe guiar esta búsqueda es el de parsimonia: debemos elegir el modelo más simple siempre que nos encontremos ante igualdad de condiciones, o dicho de otro modo, no debemos incluir efectos sistemáticos en el modelo si no es absolutamente necesario. La manera de reducir el error en modelado estadístico, consiste en comparar pares de modelos. Para ello utilizaremos procedimientos de naturaleza inferencial, centrándonos en el aumento o disminución del error, evaluado mediante técnicas de contraste de hipótesis. Además, debemos evitar lo que se denomina “sobreajuste”, ya que el excesivo ajuste a los datos no nos proporcionará buenas predicciones en caso de que se presenten fluctuaciones al utilizar muestras diferentes (validez externa), siendo esta una gran aportación del modelado (Song y Lee, 2006). En relación a los aspectos sustantivos del modelado estadístico, hay que realizar la distinción entre:  Modelos de confirmación: provienen de la teoría sustantiva o de estudios previos, por lo tanto, los modelos quedarían especificados antes del análisis de los datos.  Modelos de hipótesis: los modelos nos vendrán sugeridos durante el proceso de modelado estadístico. Aquí el análisis de los datos no confirmaría las hipótesis del investigador sino que el modelo se convertiría en una hipótesis a comprobar en relación a un conjunto nuevo de observaciones. Modelado Estadístico A.Wallace 19 Como consecuencia de todo lo anterior, “El proceso de modelado genera nuevas hipótesis que modifican la teoría sustantiva inicial” (Losilla, et al. 2005 p. 54). Es aquí donde el investigador ha de considerar la teoría sustantiva en relación estrecha con la metodología. Por ello, es importante indicar que el criterio de selección de los modelos, no podrá basarse únicamente en criterios estadísticos, sino que también tiene que basarse en la significación sustantiva, y es gracias a esto por lo que podemos llegar a teorías explicativas (Kadane y Lazar, 2004). Una cita clásica ya en el modelado estadístico nos recuerda que “modelling in science remains partly, at least, an art” (McCullagh y Nelder 1989, p.8). Por lo que, gran parte de la responsabilidad del proceso de modelado recae sobre el investigador y su perspicacia a la hora de trabajar. 2.4 – ETAPAS DEL MODELADO ESTADÍSTICO El proceso del modelado estadístico se estructura básicamente en 4 etapas, pero dado su carácter iterativo es probable que volvamos a etapas previas. Para elaborar un modelado estadístico debemos seguir las siguientes etapas (Agresti, 1996):  Etapa de especificación: en esta etapa seleccionaremos (de entre todos los modelos posibles) los modelos más relevantes y que mejor representen nuestra variable de respuesta. En esta etapa deberemos tomar decisiones Modelado Estadístico A.Wallace 20 relacionadas con la formulación del componente sistemático, los supuestos del componente aleatorio y cómo se combinan ambos componentes. Esta etapa está fundamentada, tanto en la teoría sustantiva, como en la observación de los datos.  Etapa de selección: representa un segundo paso en el proceso de modelado estadístico, y consiste en la estimación de los parámetros del componente sistemático, donde valoraremos la diferencia entre datos observados y ajustados. Cuando tenemos varios modelos posibles para explicar los datos, debemos utilizar además la comparación de modelos anidados para seleccionar el modelo más parsimonioso, y que a su vez, represente mejor los datos observados. Además, hemos de estimar los intervalos de confianza de los parámetros del modelo, para así poder determinar la eficacia predictiva y la interpretabilidad del modelo (Zucchini, 2000).  Etapa de evaluación: en esta etapa debemos valorar si el modelo ajustado es válido, dejando relativamente al margen, si presenta un buen ajuste a los datos. Para ello, realizaremos un diagnostico del modelo, evaluando los posibles errores de especificación del componente sistemático, de la distribución de probabilidad del componente aleatorio, y por ultimo, de la relación de ambos componentes (etapa de especificación del modelo) (Wei y Shih, 1994). Finalmente, se evaluarán las observaciones extremas o influyentes, para evitar asumir estimaciones erróneas.  Etapa de interpretación: la última etapa del proceso de modelado estadístico, consiste en elegir el modelo óptimo en función de los criterios de bondad de ajuste y parsimonia, pero integrado e interpretado en el marco teórico de referencia que hemos propuesto (ver figura 2.1). Modelado Estadístico A.Wallace 21 Figura 2.1: Etapas del Modelado estadístico (elaborado a partir de Ato, 1996) Modelado Estadístico A.Wallace 28 2.7 - SELECCIÓN DEL MODELO Cuando nuestro objetivo es predictivo (queremos obtener una ecuación con el menor error de predicción) los criterios estadísticos serán los determinantes, ya que buscamos las variables que nos proporcionen menor error de predicción. Sin embargo, cuando nuestro objetivo es explicativo, serán los criterios teóricos los determinantes, dependiendo, de este modo, la selección de modelo de los conocimientos y experiencia del investigador. Existen dos formas de seleccionar los modelos (Claeskens y Hjort, 2008):  La denominada “selección conducida por el investigador”, donde es el investigador el que decide que términos permanecen en el modelo y cuáles no. Normalmente se utiliza en investigaciones con finalidad explicativa.  O bien, la selección mediante algoritmos automáticos en base a criterios fijados a priori. Se utiliza en investigaciones exploratorias o predictivas. 2.7.1 - SELECCIÓN DE MODELOS CONDUCIDA POR EL INVESTIGADOR En esta técnica hay que tener en cuenta el principio jerárquico por el cual si en un modelo se elimina un término cualquiera, todos los términos de mayor orden en los que esté incluido también se eliminaran, y a la inversa, si incluimos un término, todos los de orden inferior también deberían incluirlo (Bishop, Fienberg, y Holland, 1975). Al trabajar con modelos jerárquicos, los términos de alto orden (interacciones) no dependen del método de codificación empleado (Kleimbaum 1994); sin embargo, si Modelado Estadístico A.Wallace 29 el modelo no es jerárquico la significación estadística de los coeficientes de regresión varía dependiendo del método de codificación. Además, hemos de añadir que sólo pueden incluirse en el modelo variables resultantes del producto de varias variables, siempre y cuando cumplan el supuesto de que representen un concepto interpretable en la práctica. Además, nuestra estrategia de selección la basaremos en el planteamiento de un modelo máximo (MMax), y sus sucesivos modelos restringidos (MR), a través de una estrategia de ajuste condicional, siempre teniendo en cuenta el principio jerárquico. Los pasos a seguir serían los siguientes: 1. Especificar el modelo MMax: debe estar basado en la teoría sustantiva y la observación de los datos. Si trabajamos con diseños no experimentales es importante incluir términos de control para evitar sesgos en la estimación de los efectos. Este modelo máximo debe contener (Drapper y Smith 1998; Kleinbaum, Kupper y Muller, 1998): potenciales variables explicativas de interés para el investigador, potenciales variables de control, potenciales variables modificadoras, y potencias y términos de interacción entre las variables anteriores. También es importante la relación entre el número de términos del MMax y el número de casos. Sabemos que el número de casos deber ser igual o mayor que el numero de parámetros a estimar + 1. De hecho, se suele utilizar una matriz que contenga al menos 10 veces el número de parámetros del MMax ( 10 )np≥ (McCullagh y Nelder 1989). Modelado Estadístico A.Wallace 30 Los criterios que deberemos seguir para seleccionar los términos que incluiremos en el modelo deberían consistir en: primer lugar los que sean importantes desde el punto de vista práctico, en segundo lugar los que tengan una interpretación práctica clara, en tercer lugar los que se basen en medidas objetivas y fiables y por último, las que tengan un menor coste de obtención y registro. Hemos de aclarar que un MMax grande minimiza la probabilidad de error tipo II o infraajuste, mientras que un MMax pequeño minimiza la probabilidad de error tipo I o sobreajuste. 2. Evaluar los términos de interacción: comenzaremos evaluando las interacciones de mayor orden mediante pruebas de significación estadística (Kleinbaum, Kupper y Muller 1998). Una opción es evaluar las interacciones de una en una y la otra es probar el grupo completo de interacciones de un determinado orden, “Chunk test”, y si resulta estadísticamente significativo, comprobar cada interacción por separado. Si el resultado es no significativo, eliminamos todos los términos, pasando a un nivel inferior de interacciones. Si este resultado es significativo, sólo eliminaríamos del modelo los términos que examinemos de forma individual y no sean estadísticamente significativos. Por último, evaluaremos los términos de interacción de nivel inferior que no estén incluidos en los términos de interacción de nivel superior y que sean estadísticamente significativos. Como hemos comentado anteriormente, si el efecto de interacción es fácilmente interpretable, podemos incluirlo o descartarlo en base a la estimación por intervalo de sus coeficientes o de los índices 2 R∆ y PRE. Modelado Estadístico A.Wallace 31 3. Evaluar las variables explicativas y de control: podemos mantener o no las variables de manera individual o por grupos, ya que si las eliminamos pueden producir una estimación sesgada del efecto de las variables explicativas (su eliminación produce un cambio relevante en el parámetro de al menos una variable explicativa). Este fenómeno se denomina “confusión” (Everitt y Howell, 2005). También la eliminación de esta variable puede un aumento del error estándar o pérdida de precisión en la estimación del parámetro de al menos una variable explicativa. Por último, puede resultar imposible su eliminación si la variable de control forma parte del Modelo Mínimo (MMin). Debemos señalar que “en el caso de modelos que incluyan términos de interacción, la evaluación de la confusión y la precisión es compleja, puesto que el coeficiente de las variables explicativas de interés no es único, sino que depende de los valores de las variables de interacción”. En estos casos, lo mejor es ajustar diferentes modelos que estimen los coeficientes de las variables explicativas y sus intervalos de confianza (IC) para cada combinación de las categorías de las variables modificadoras. Tomada esta decisión, nuestro siguiente paso consiste en evaluar los sucesivos MR. Hemos de añadir que para valorar la relevancia científico-práctica utilizaremos los IC95%, 2 R∆ y PRE, y para la significación estadística el grado de significación j p . 2.7.2 - SELECCIÓN DE MODELOS MEDIANTE ALGORITMOS AUTOMÁTICOS El uso de algoritmos de selección automática está basado únicamente en criterios estadísticos (Forster, 2000). Modelado Estadístico A.Wallace 32 1. La bondad de ajuste del modelo: cuando trabajamos con modelos de regresión lineal se utilizan el coeficiente de determinación (R2), el coeficiente de determinación ajustado 2 ()R y el estadístico p C de Mallows (1973). Teniendo en cuenta el contexto en el que estamos trabajando. Para la inclusión y excusión de términos habrá que utilizar la diferencia entre los grados de libertad de los modelos que se comparan: 2 11 T N Dnp RDn − = − − (2.7) donde n es el número de observaciones y p el numero de parámetros del modelo de trabajo. Se utiliza éste en vez del clásico R2, ya que no tiene el problema de que al incrementase el numero de términos tienda a 1 .Por otra parte, podemos hacer el ajuste mediante el estadístico p C de Mallows (1973). 2 MT p MMAX MMAX D C pn D gl = +− (2.8) Si el modelo de trabajo tiene un ajuste aceptable, p C es casi igual a p, por tanto el criterio consistirá en seleccionar los modelos cuyo p C sea menor o igual a p, y entre estos el que tenga el p C menor (Drapper y Smith, 1981). Hay que tener en cuenta que cuando el MR tiene distinto p, cada criterio puede llevar a seleccionar un modelo distinto. Este estadístico es de los más utilizados, ya que nos lleva a seleccionar los modelos más parsimoniosos. También se suele representar gráficamente mediante una gráfica bidimensional de los valores de p C de diferentes modelos y los parámetros de cada uno de ellos. Los modelos óptimos estarán por debajo (o sobre la diagonal principal) y los menos adecuados por encima de esta (Neter, Wasserman y Kutner, 1983), ver figura 2.2. Modelado Estadístico A.Wallace 33 Figura 2.2 Grafico de los valores de p C 2. Las técnicas automáticas de selección: Hay dos tipos (Dobson 1983):  “All posible regressions”, que es la estimación de todas la ecuaciones posibles.  “Métodos por pasos”, que se construyen mediante la eliminación o adición de términos a los modelos (“backward elimination”, “forward selection”, y “stepwise regresión”) o definiendo conjuntos de términos para su evaluación global (“chunkwise regresión”). La primera de las técnicas está basada en la estimación de todos los modelos posibles que se derivan del MMax. Hay que estimar 21 k − (donde k es el numero de términos del MMax). Después se agrupan estos modelos en función del número de términos que incluyen, y se ordenan en función de los criterios de ajuste calculados. La selección final dependerá de las ecuaciones que presenten mejores valores en estos criterios y también de cuestiones como, coste, tiempo, objetividad, etc. Tiene Modelado Estadístico A.Wallace 34 el problema de que normalmente resulta inviable cuando el MMax tiene un número elevado de términos. La segunda, consiste en la técnica por pasos (bien hacia atrás o bien hacia delante). En este caso, se construyen los modelos mediante la eliminación de términos a partir del MMax o su adición desde el MMin. Así, en cada uno de dichos pasos, se valorará un término o bloque en función de los criterios fundamentados en los índices de ajuste y tolerancia. Finalizamos cuando ningún término cumpla con los criterios de exclusión o inclusión. Hemos de añadir que, el método “stepwise regresión” es una modificación del método “fordward selection”. Éste nos permite reexaminar en cada paso las variables que se han incorporado al modelo y eliminarlas si no son relevantes. De este modo las variables pueden incluirse y excluirse del modelo más de una vez. El denominado “chunkwise regresión” es una técnica muy utilizada ya que reduce el número de modelos a valorar, incorporando las variables necesarias siguiendo criterios sustantivos. (Kleinbaum, Kupper y Muller, 1998). En el programa de análisis estadístico R (Ihaka y Gentleman, 1996) existe un paquete específico llamado glmulti (Calcagno, 2010) que realiza estos cálculos de manera automática. Modelado Estadístico A.Wallace 35 Limitaciones: el principal problema de estas técnicas es que nos pueden llevar a seleccionar modelos inconsistentes o incoherentes desde un punto de vista estructural y teórico (Nuñez, et al., 2011), podemos encontrarnos con dos problemas, uno es la sobreestimación de efectos cuando no tenemos claro qué modelo queremos, y tenemos un gran número de ellos. Este problema no debería ocurrirle a un investigador experto en el tema. El otro inconveniente está relacionado con los problemas de interpretación derivados de no mantener la jerarquía de términos. Así, al evaluar las interacciones puede ocurrir que seleccionemos un modelo que incluya un término de interacción, pero no los efectos principales. Este sería un problema de diseño (Myung, 2000). 2.8 CONCLUYENDO En este capítulo se ha tratado de forma didáctica de aproximarnos a la “filosofía” del modelado estadístico, donde a diferencia de los métodos de análisis al uso, no existe un único resultado posible, sino que podemos obtener diferentes resultados “válidos” en función de los datos, la teoría sustantiva, el número de variables, los conocimientos del investigador, etc., lo cual enriquece y pone el valor los resultados obtenidos en nuestras investigaciones. Una vez introducidas estas técnicas, pasaremos a repasar los modelos que podemos aplicar a nuestros datos de memoria de reconocimiento en función de la naturaleza de las variables con las que trabajamos. En el siguiente capítulo realizamos una exposición de los modelos a aplicar cuando la variable de respuesta es continua, el modelo de regresión lineal, desde la perspectiva del modelado estadístico. Regresión Lineal A.Wallace 36 CAPÍTULO 3 EL MODELO DE REGRESIÓN LINEAL Las cosas complejas y estadísticamente improbables, son por naturaleza más difíciles de explicar que las cosas simples y estadísticamente probables, Richard Dawkins. Regresión Lineal A.Wallace 43 En primer lugar debemos obtener la significación estadística del coeficiente 1 b . Evaluaremos la hipótesis nula 01 :0H β = , ya que deseamos comprobar en qué medida es 1 b diferente de 0 en la población. En el caso de rechazar esta hipótesis nos estaría indicando que el efecto es diferente de 0. (la variable explicativa tiene un efecto estadísticamente significativo sobre la variable de respuesta). Asumimos que la distribución muestral de 1 b es normal con media 1 β . Para comprobar esta hipótesis utilizamos el estadístico t de Student: ( ) 1 1 b tEE b = (3.8) donde 1 ()EE b es la estimación del error estándar de la distribución muestral de 1 b . Para obtener 1 ()EE b tenemos que acudir a la siguiente fórmula: ( ) ( ) 1 /1 X SCE n k EE b SC −− = (3.9) Partiendo del supuesto de que 0 H es cierta el estadístico t sigue una distribución t de Student con 1nk−− grados de libertad, donde n es el número total de observaciones, y k el número de términos del modelo. Si el valor t obtenido es superior al valor crítico , /2gl t α o ,gl t α (dependiendo de si la hipótesis es bilateral o unilateral) consideraremos que el parámetro 1 β es estadísticamente distinto de 0 (Allen, 1997). En segundo lugar, debemos determinar la magnitud del efecto 1 b de la variable explicativa. Para ello necesitamos obtener el intervalo de confianza (IC) de 1 β . Los limites de este intervalo nos indican los valores entre los que puede variar el verdadero valor de 1 b en la población. Estos valores nos permitirán la interpretación del efecto de Regresión Lineal A.Wallace 44 X sobre Y en términos de magnitud del efecto. Para ello, debemos asociar 1 b a una medida de precisión de la estimación del valor del parámetro poblacional 1 β , es decir, el error estándar ( 1 ()EE b ). Utilizando el valor de 1 b y su error estándar se puede construir el intervalo de confianza 1 α − de 1 β : 1 1 1, 2 1 (1 ) ( ) nk IC b t EE b α αβ −− −=± (3.10) El intervalo de confianza es una alternativa a la prueba de significación t, (GroB, 2003) y además, nos “permite valorar la relevancia científica del efecto de la variable explicativa que refleja 1 b ”. Para ello es absolutamente imprescindible, establecer un valor previo de referencia. 3.2.3. – AJUSTE Y SELECCIÓN DEL MODELO En modelado estadístico se utiliza el enfoque de la comparación de modelos, donde el modelo de regresión que incorpora la variable explicativa se compara con el modelo que no la incorpora. Este procedimiento se realiza comparando estos dos modelos alternativos, un modelo ampliado (MA) que incorpora la variable explicativa y el modelo nulo (MN) que no contiene la variable explicativa. En el caso del modelo nulo (MN), sólo se estima el parámetro 0 β , prediciendo el mismo valor en la variable de respuesta para todos los sujetos, sin tener en cuenta el valor de los sujetos en la variable explicativa. Por tanto, la estimación de este parámetro, en este modelo es igual a la media de la variable de respuesta. 01 0 ˆ : ˆ : MA Y b b X MN Y b = + = (3.11) Regresión Lineal A.Wallace 45 Para comparar ambos modelos debemos valorar la diferencia de las discrepancias (D) entre los dos modelos. El procedimiento de comparación entre MN y MA es denominado como “estrategia de ajuste global” (Graybill e Iyer, 1994). La discrepancia (D) está basada en la diferencia entre valores observados y los predichos por el modelo, lo que sería igual a la SCE de cada modelo. De este modo, la discrepancia del modelo ampliado será menor o igual a la discrepancia del modelo nulo. Esto es debido a que siempre que introduzcamos una variable explicativa al modelo, disminuirá el error de predicción, en el caso de que exista relación con la variable de respuesta, y por el contrario no cambiará su valor en el caso de que no exista relación con la variable de respuesta. También tenemos que decidir si la disminución de la discrepancia (D) es suficiente para que sea estadísticamente significativa (Freund, et al., 2006). Dicha comparación es equivalente a contrastar la hipótesis nula del parámetro 1 β , que vimos antes ( 01 :0H β = ). Esta hipótesis indica la ausencia de relación lineal entre las variables X e Y, o en el contexto que estamos tratando, que la inclusión de la variable X no disminuye el error de predicción con respecto al MN. Para contrastar que no existen diferencias entre el ajuste de ambos modelos (MA y MN), utilizamos el estadístico F: ) ( () () MN MA MA MN MA MA DDpp FD np −− =− (3.12) donde MA p y MN p representan el número de parámetros independientes estimados en cada modelo, n es el número total de observaciones y MA np− los grados de libertad del MA. Hay que señalar que el resultado de esta fórmula debe coincidir con el valor del estadístico t 2, y refleja el error promedio que reduce cada variable del MA, respecto a la Regresión Lineal A.Wallace 46 inclusión de cualquier variable al azar. Si asumimos que los datos siguen una distribución normal de los errores, el estadístico F se distribuye según el modelo de probabilidad F de Fisher-Snedecor con grados de libertad iguales a los grados de libertad de numerador y denominador. Su interpretación sería: la siguiente:  Si 1F≤ se acepta el MN.  Si 1F> se acepta el MA. De este modo, si el valor F es menor que el valor crítico, aceptamos el MN (el error de predicción del MA no es menor que el del MN), por ser mas parsimonioso. En el caso contrario, si el valor F es superior al valor crítico 1, 2,gl gl F α , el MN es rechazado, aceptando el MA (el efecto de variable explicativa sería estadísticamente significativo). Además, puede resultar muy útil calcular el valor de R2 del MA, que nos dará la proporción de variabilidad de la respuesta Y explicada por la variable X (Lewis-Beck, 1980). 2MN MA MA MN DD RD − = (3.13) Durante el proceso de comparación de modelos resulta bastante útil el uso de una tabla que resuma la información más relevante acerca de los modelos con los que estemos trabajando. Al hacer un uso predictivo del modelo de regresión, podemos calcular el IC alrededor del cual estará cualquier valor ˆi y predicho por la ecuación de regresión. Si consideramos el caso de la predicción de ˆi y cuando X = 0, el IC para esta predicción se corresponde con el IC para 0 β : Regresión Lineal A.Wallace 47 01 0 ˆ0 i ybb b=+= (3.16) Después deberíamos obtener el error estándar estimado 0 ()EE b : ( ) 2 0 1 X Dx EE b n p n SC  = +  − (3.14) Calculando el IC de 0 β : ( ) ( ) 0 0 1, 2 0 1nk IC b t EE b α αβ −− −=± (3.15) Como podemos comprobar este IC está construido de igual modo que el IC para 1 β , pero su interpretación es diferente, debido a que el valor de 0 β representa la media de Y cuando X = 0, por lo tanto su IC es el rango de valores entre los que se encuentra la media de Y en la población de sujetos cuyo valor X = 0. Para 1 β es el cambio en Y para cada incremento en una unidad en X, y su IC es el rango de valores de cambio en Y en la población. También podemos calcular el error estándar del valor pronosticado ˆi y , ( ) ˆ i EE y ( ) ( ) 2 1 1 ˆi X xx D EE y n p n SC  − = +  −  (3.16) y el IC de ˆi y cuando i Xx= tiene el valor ( ) 1, 2 ˆˆ (1 ) i i nk i IC y y t EE y α α −− −=± (3.17) La distancia entre i x y x es la que determinará la amplitud del IC., así, a mayor diferencia entre i x y x , mayor será el error estándar de la puntuación predicha. De esta manera los IC para ˆi y serán más estrechos a medida que la distancia entre i x y x sea menor. Regresión Lineal A.Wallace 48 Podemos calcular un intervalo alrededor de ˆi y que nos permita saber el rango de valores entre los que se encontrará i y para los sujetos de la población con un valor de i Xx= (Cook y Weisberg, 1999). A esto se le denomina intervalo de predicción (IP), y su cálculo es igual que el del IC, pero con cambios en el error estándar, ya que la estimación de la respuesta para sujetos tiene más variabilidad que la estimación de la respuesta media. Para calcular el IP debemos calcular la desviación estándar de manera similar al error estándar: ( ) ( ) 2 1 1 ˆ1 i X xx D DE y n p n SC  − = ++  −  (3.18) Así, nos encontramos que para un mismo valor de i Xx= el IP para ˆi y será más amplio que su IC. Sin embargo, cuando utilizamos el modelo de regresión con fines predictivos debemos tener en cuenta que la recta de regresión se ha ajustado para el rango de valores de X observados, siendo incorrecto realizar predicciones para valores de X que se encuentren fuera del rango observado, debido a que la relación entre X e Y puede ser diferente a la estimada fuera de estos límites (Rawling, et al., 1998). 3.3MODELO DE REGRESIÓN LINEAL MÚLTIPLE DESDE EL MODELADO ESTADÍSTICO Estamos trabajando con una generalización del modelo de regresión lineal simple con más de una variable explicativa o cuando nuestra variable explicativa es politómica. Esto implica que hay que determinar cuáles son las variables más relevantes para predecir o explicar la variable de respuesta. También nos facilita la predicción de la Regresión Lineal A.Wallace 49 variable de respuesta a partir de una serie de variables explicativas, esto nos va a ofrecer la ventaja de utilizar más información en la construcción del modelo, y consecuentemente, realizar estimaciones más precisas. Además podremos conocer cuáles son las variables explicativas que más influyen en la variable de respuesta. En este sentido es importante determinar si existe interacción entre las variables explicativas y controlar la influencia de variables de confundido. Deberemos elegir cuidadosamente qué variables vamos a considerar como explicativas. Algunos criterios que deben de cumplir serán los siguientes (Losilla, et al. 2005):  Tener sentido numérico.  No deberá de haber variables repetidas o redundantes  Las variables introducidas en el modelo deberán de tener una cierta justificación teórica.  La relación entre variables explicativas en el modelo y casos debe de ser como mínimo de 1 a 10.  La relación de las variables explicativas con la variable de respuesta debe de ser lineal, es decir, proporcional. Cuando trabajamos con estos modelos incluiremos al menos un parámetro más a estimar con respecto al modelo de regresión simple. 0 11 22 0 ˆ... jj jj Y XX X X βββ βεββε = + + ++ += + + ∑ (3.19) Esta ecuación recibe el nombre de hiperplano, pues cuando tenemos al menos dos variables explicativas, en vez de recta de regresión tenemos un plano o superficie de regresión: Regresión Lineal A.Wallace 50 Figura 3.4 Superficie de regresión Este es uno de los modelos más extendido en los estudios predictivos y explicativos, porque nos permite predecir más de una variable explicativa, y porque podemos observar la interacción entre variables explicativas e incluir variables de control. 3.3.1 – AJUSTE Y SELECCIÓN DEL MODELO CON UN PREDICTOR POLITÓMICO Cuando tenemos una sola variable explicativa pero ésta es politómica, es decir, tiene más de dos categorías, estamos ante un modelo de regresión lineal múltiple, ya que es necesario codificar esta variable en 1c− variables ficticias, lo que da lugar a estimar 1c− parámetros más la constante (Peña, 2002). Los modelos que se compararan mediante la estrategia de ajuste global para una variable explicativa con tres categorías serían: 0 11 22 0 ˆ : ˆ : MA Y b b A b A MN Y b =++ = (3.20) Regresión Lineal A.Wallace 51 El ajuste global del modelo se hace comparando la discrepancia del MA, con la discrepancia del MN, utilizando la razón F: ( )( ) () MN MA MA MN MA MA DD pp FD np −− =− (3.21) De este modo podemos contrastar la hipótesis nula. Nos referimos al hecho de que el MA no reduzca el error de predicción respecto al MN. El valor F lo comparamos con el valor critico 1, 2,gl gl F α donde 1MA MN gl p p= − y 2MA gl n p= − . En el caso de que rechacemos 0 H , ello estaría indicando que al menos uno de los coeficientes i b es estadísticamente distinto de 0, y no necesariamente que todos sean distintos de 0 (es decir, al menos hay diferencias entre una de las comparaciones). No obstante, mediante esta prueba no podemos saber si el resultado significativo del modelo se debe a que hay diferencias entre dos categorías o entre todas. Para ello, deberemos acudir a la estrategia de ajuste parcial, que en este caso nos obliga a realizar dos ajustes parciales (Peña, 2002): 0 11 22 0 22 ˆ : ˆ : MA Y b b A b A MR Y b b A =++ = + 0 11 22 0 11 ˆ : ˆ : MA Y b b A b A MR Y b b A =++ = + (3.22) En el primer caso, realizando la prueba de ajuste parcial, podemos comprobar si el efecto de la primera categoría es estadísticamente diferente de la categoría de referencia ( 01 :0H β = ). Si este ajuste parcial es significativo, nos indicaría que 10b≠ , y que hay diferencias estadísticamente significativas entre las dos categorías. En el segundo caso, realizando la prueba de ajuste parcial, nos permite comprobar si el efecto de la segunda categoría es estadísticamente diferente de la Regresión Lineal A.Wallace 52 categoría de referencia ( 02 :0H β = ). Si este ajuste parcial es significativo, nos indicaría que 2 0b≠ , y por lo tanto que hay diferencias estadísticamente significativas entre las dos categorías. Para saber qué comparaciones son estadísticamente significativas debemos realizar una prueba F de ajuste parcial para cada una de las 1c− variables ficticias. Para ello se compara el MA con un MR, que excluye una de las variables ficticias. Así, tendremos una 1c− para cada coeficiente de regresión: ( )( ) () MR MA MA MR MA MA DD pp FD np −− =− (3.23) De este modo, el modelo seleccionado incluirá todas las variables ficticias o ninguna de ellas, y no se utilizan los modelos que sólo incluyen un subconjunto de variables ficticias. (Peña, 2002). Utilizando esta técnica obtendremos muchos datos como resultado de la comparación de modelos, por ello, es muy útil resumir toda esta información en un cuadro (ver tabla 3.3). Tabla 3.2 Tabla resumen modelo lineal múltiple con un predictor polinómico Además de toda la información incluida en esta tabla, podemos obtener más información calculando e interpretando el intervalo de confianza de los coeficientes j β (que se obtiene a partir de la estimación del coeficiente de regresión y su error estándar). Regresión Lineal A.Wallace 59  Variable modificadora continua: en este caso queremos obtener el efecto de X cuando Z toma el valor genérico ( ) cZ c= . Lo que haremos será centrar Z en el valor de referencia c, generando una nueva variable c Z Zc= − , para después estimar el modelo de regresión de Y sobre X y Z. De este modo el IC de 1 b se corresponderá con el efecto de X para el valor c elegido. 3.4LA COLINEALIDAD La colinealidad ocurre cuando las variables explicativas están relacionadas entre si constituyendo una combinación lineal (se denomina multicolinealidad si son varias las variables explicativas relacionadas). La consecuencia es que no podremos distinguir la influencia de cada uno de ellas al quedar solapadas. Puede darse en diseños no experimentales y experimentales cuando los grupos están desequilibrados en tamaño. Si por el contrario están los grupos equilibrados debido a la aleatorización, no deberemos encontrarnos este problema (López, 1998). Este es un aspecto muy importante, ya que la mayoría de las veces nos interesa conocer la aportación de cada una de las variables a la explicación de la respuesta. Para esto es muy práctico calcular el coeficiente de determinación 2 MA R : 2MN MA MA MN DD RD − = (3.32) Pero esto solo nos vale en el caso de una única variable explicativa. En regresión múltiple utilizaremos el incremento de 2 R ( 2 R∆ ) que expresa la diferencia entre 2 MA R y 2 MR R : Regresión Lineal A.Wallace 60 2 22 MN MA MN MR MR MA MA MA MR MN MN MN DDDD DD RRR DDD −−− ∆= − = − = (3.33) A diferencia de 2 R que compara la explicación del MA con la del MN, 2 MA R∆ compara la explicación del MA con la de un MR determinado, es decir, la explicación debida a ese término cuando el modelo ya incluye otros términos. De este modo, 2 MA R∆ será menor al 2 MA R que incluye ese término si existe colinealidad entre ese término y los que ya están incluidos en el modelo. Existe otro índice que podemos utilizar denominado “reducción proporcional del error” o en ingles PRE. A diferencia de 2 R∆ , que mide la explicación de un término respecto al total de la variabilidad, este índice lo hace con respecto a lo que queda por explicar de dicha variabilidad. Expresa, por tanto, la reducción proporcional en la variabilidad que queda por explicar (o la reducción del error de predicción producida al incluir un término nuevo en el modelo). 22 2 22 () 1 1( ) MA MR MA MR MA MR MR MR MN MR MN RR R DDD PRE R R DDD −∆ − = = = −− − (3.34) Ambos índices son complementarios, y por lo tanto suelen utilizarse para evitar posibles conclusiones erróneas sobre la importancia de un término (López, 1998). Si no existe colinealidad los valores de los efectos de las variables explicativas no difieren de los ajustados como modelos simples. Resumiendo, en ausencia de colinealidad los coeficientes de regresión j b indican el efecto de cada variable explicativa. En el caso de que exista colinealidad los valores de j b serán distintos ya que estiman los efectos de cada una de las variables explicativas. Regresión Lineal A.Wallace 61 Como ya ha quedado explicitado en esta tesis en el modelo de regresión lineal múltiple el coeficiente de una variable explicativa refleja el cambio (efecto) en la respuesta que se espera al incrementar en 1 unidad esa variable, y se conoce que dicho efecto se producirá para cualquier valor que tomen el resto de variable incluidas en el modelo; pero se desconoce si dicho cambio será el mismo para distintos valores de otras variables no incluidas en el modelo (McCullagh y Nelder, 1989). 3.5 - PROBLEMAS Y SOLUCIONES DE LA COLINEALIDAD Podemos estudiar la colinealidad mediante (López 1998):  El coeficiente de correlación múltiple al cuadrado ( 2 j R ): que se obtiene al regresar una variable explicativa sobre todas las demás variables explicativas del modelo.  La tolerancia: que es la proporción de la varianza de esa variable no explicada por las otras variables que ya están en la ecuación ( 2 1 j R− ). Tendremos una tolerancia alta si obtenemos un valor cercano a 1 (la variable no está correlacionada con las demás), y tolerancia baja si obtenemos un valor cercano a 0 (existencia de relación de la variable con las demás), es decir, no aportaría nada al modelo.  El factor de inflación de la varianza (FIV), que nos indica el impacto de la colinealidad sobre la precisión de los estimadores de los coeficientes de regresión: 2 1 1j R− (ver tabla 3.4). Regresión Lineal A.Wallace 62 Tabla 3.4: Resultados posibles del estudio de la colinealidad. Por otra parte, hay que tener en cuenta que la colinealidad no afecta a la capacidad predictiva del modelo, sino a la precisión e interpretación de los coeficientes de regresión de las variables colineales, que nos pueden llevar a conclusiones incorrectas. Si el modelo es predictivo, la colinealidad no nos afecta, pero en el caso de ser explicativo afectará a la valoración de los efectos de las variables explicativas. Esto ocurre en los casos de colinealidad elevada, pero también existe la colinealidad perfecta o singularidad, que se da cuando una variable explicativa representa una combinación lineal del resto de variables (Belsley, et al., 2004) Existen 3 situaciones en las que podemos encontrarnos en esta situación: en primer lugar, se da en el caso de incluir variables linealmente relacionadas, en segundo lugar, si en vez de introducir 1k− variables indicadora incluimos k variables, y en tercer lugar, si el tamaño de la muestra es pequeño, (cuando n es menor que el numero de coeficientes a estimar) ver en Berry (1993). Para solucionar estos problemas de colinealidad podemos: aumentar el tamaño de la muestra, combinar dos o mas variables explicativas correlacionadas en una sola, Regresión Lineal A.Wallace 63 eliminar una de las variables explicativas si no es posible combinarla con otras (no es aconsejable), y centrar las dos variables explicativas (Cronbach 1987). 3.6 - MODELOS CON MEDIDAS REPETIDAS Tendremos dependencia entre observaciones en estas situaciones (Oliver, et al., 2000):  Medidas apareadas: esto ocurre cuando se registran dos o más observaciones de una misma variable (o categoría).  Medidas repetidas: ocurre cuando se registran dos o más observaciones de un mismo concepto provenientes de un mismo sujeto. Este tipo de medidas son menos variables que las medidas entre sujetos diferentes, debido a que en las mismas condiciones la variabilidad intra es más constante que la variabilidad entre. Lo importantes es medir el mismo concepto y en la misma escala de medida.  Datos secuenciales: ocurre cuando se registra una misma información para cada sujeto del estudio varias veces a lo largo del tiempo, siendo la variable tiempo de interés para el estudio como variable explicativa de las diferencias entre medidas. Para poder analizar estos datos, hay que eliminar esta dependencia, normalmente transformando los datos (en el caso de medidas apareadas y repetidas). Regresión Lineal A.Wallace 64 Los tipos de diseño que proporcionan este tipo de datos son:  Diseños entre sujetos: donde la hipótesis que se suelen plantear son acerca de la diferencia entre distintos grupos de sujetos (cada sujeto solo pertenece a una categoría de la variable explicativa).  Diseños intra sujetos: donde las hipótesis que se suelen plantear son acerca de la diferencia entre las medidas (repetidas o pareadas) sin la intervención de las variables que definen los grupos de sujetos (cada sujeto tiene un valor en cada categoría de la variable).  Diseños mixtos: donde las hipótesis que se plantean son acerca de las diferencias entre las medidas y entre los grupos de sujetos. 3.6.1. DISEÑOS CON MEDIDAS REPETIDAS O APAREADAS En este tipo de diseños las variables explicativas varían entre sujetos, teniendo más de una medida por sujeto, siendo éstas dependientes. Para el correcto análisis de este tipo de diseños deberemos transformar los datos combinando las medidas dependientes en una sola medida que elimine la variabilidad intra sujeto, y que podamos regresar sobre las variables explicativas entre sujetos de interés. Tomaremos cada observación como ih y , siendo i el numero de sujeto y h el numero de medida realizada. Obtendremos la medida combinada a partir de una agregación ( 0 P ) de estas medidas originales, ponderando cada medida h por un factor h δ que nos permite dar mayor importancia a una medida que a la otra, asignando el valor 1 a cada medida h. Regresión Lineal A.Wallace 65 02 h ih h h h y P δ δ =∑ ∑ (3.35) El procedimiento a seguir será, generar la medida combinada 0 P para cada uno de los sujetos, utilizándose ésta como variable de respuesta en la comparación de los modelos para testar el efecto de la variable explicativa. Y para evaluar su significación estadística deberemos comparar un MA incluyendo esta variable con un MR que no la incluya: 0 01 000 ˆ : ˆ : MA P b b X MR P b P = + = = (3.36) Para la interpretación de los coeficientes de regresión habrá que tener en cuenta que se hallan en la escala de medida de la variable combinada, pero se pueden convertir a los valores originales dividiéndolos por el denominador de 0 P . En el caso de los intervalos de confianza el procedimiento es el mismo. En definitiva, mediante este procedimiento se colapsan las observaciones de cada sujeto en una única medida, eliminando de la discrepancia del modelo la variabilidad intra sujeto. 3.6.2. DISEÑOS DE MUESTRAS RELACIONADAS En estos diseños la variable explicativa varia intra sujeto (cada sujeto proporciona más de una respuesta que será dependiente en cada categoría de la variable explicativa). Al igual que con los diseños anteriores habrá que transformar los datos para eliminar la dependencia, pero en este caso generaremos una variable que refleje la diferencia entre las medidas para cada sujeto (así contrastaremos la hipótesis sobre Regresión Lineal A.Wallace 66 diferencias entre los niveles del facto intrasujeto). Además, hemos de comprobar si la media de la nueva medida de diferencias es significativamente distinta de cero, a partir de una prueba de conformidad. Si es así, entonces asumimos que existen diferencias (la variable explicativa incide en la respuesta). Si es estadísticamente igual a cero asumimos que no existen diferencias. Por otra parte, cuando realizamos el análisis de la diferencia entre dos medias, y partimos de que la variable explicativa intra sujeto tiene dos categorías, entonces debemos generar una variable que recoja la diferencia entre las medidas. La media de esta variable es la que contrastaremos para ver si es estadísticamente igual a cero. Esta nueva variable es: 11 22 122 12 ii yy d δδ δδ + =+ (3.37) donde δ es un valor de ponderación que puede ir entre 1 y 1− , pero es mejor utilizar 0,5 y 0,5− para que la diferencia entre los dos valores sea la unidad. Para realizar la prueba de conformidad, debemos utilizar la razón F, comparando un MA que predice la media observada y un MR que predice el valor cero: 11 1 : ˆ :0 MA d d MR d = = (3.38) El numerador de la razón F podemos calcularlo mediante la siguiente fórmula: 2 1MR MA D D nd−= (3.39) En el caso de partir de una variable explicativa intrasujeto que tiene más de dos categorías, habrá que generar 1c− variables de diferencia. Para generar estas variables codificaremos el valor de interés mediante contrastes ortogonales. Así conseguimos que Regresión Lineal A.Wallace 67 la variabilidad total que atribuiremos a la variable explicativa se descomponga de forma independiente entre las 1c− variables generadas: 2 h ih h i h h y d δ δ =∑ ∑ (3.40) donde h δ son los valores de ponderación correspondientes a los coeficientes de un conjunto de 1c− contrastes ortogonales (definidos para codificar la variable explicativa). Al igual que en los diseños anteriores la media de cada variable i d se debe comparar con cero: 11 1 ˆ : ˆ :0 MA d d MR d = = (3.41) Finalmente habrá que obtener el valor de la prueba F global del análisis de la 01 2 :c H µµµ = = , que evalúa si existen diferencias en el conjunto de las c medidas repetidas 3.6.3. DISEÑOS MIXTOS Como sabemos, en estos diseños al menos una de las variables explicativas cambia entre sujetos y otra intra sujeto. Por consiguiente, habrá que analizar las variables tanto de forma independiente como su interacción. Vamos a ver el caso de una variable entre y otra intra con dos categorías cada una. Como en los casos anteriores habrá que generar una nueva variable 1 d que refleje la diferencia entre las categorías de la variable intra sujeto y utilizarla como variable de respuesta en un modelo que incluya la variable entre sujetos como variable Regresión Lineal A.Wallace 68 explicativa. Con ello pretendemos comprobar si las diferencias entre categorías de la variable intra sujeto se mantienen en las dos categorías de la variable entre sujetos. 12 h ih h h h y d δ δ =∑ ∑ (3.42) Para comprobar el modelo se sigue la misma lógica que en el análisis de muestras independientes con medidas repetidas o apareadas (pero con 1 d en vez de 0 P ). 1 01 10 ˆ : ˆ : MA d b b X MR d b = + = (3.43) En el caso de tener variables con más de dos categorías o mas variable entre o intra, habrá que generar un mayor número de variables de diferencia i d , y variables explicativas. En la tabla ANOVA, que resume la comparación de modelos, debemos añadir las discrepancias y grados de libertad atribuibles a las fuentes de variabilidad que se excluyen del análisis, por lo que la tabla ANOVA debe incluir las fuentes de variabilidad con sus correspondientes sumas cuadráticas y grados de libertad. 3.7 CONCLUYENDO En este capítulo se ha tratado el modelo de regresión lineal y sus extensiones desde la perspectiva del modelado estadístico. Este capítulo nos sirve de introducción didáctica a estas técnicas ya que la mayoría de investigadores están familiarizados con la regresión lineal y de este modo, podemos comprender mejor cómo funciona el modelado. En el contexto de este trabajo las medidas psicofísicas registradas en los experimentos pueden ser analizadas con los modelos lineales presentados en el capítulo permitiéndonos obtener un detallado análisis de los datos. Modelo Lineal Generalizado A.Wallace 74 2 - Componente aleatorio: El valor observado i y es una realización de la variable aleatoria Y, cuyo valor esperado viene dado por () ii Ey µ = . 3 – La función de enlace: Simbolizada como () i g µ , transforma el valor esperado a la escala del predictor lineal. () ii g µη = (4.2) Así, la inversa de la función de enlace nos permite que al aplicar al resultado del predictor lineal i η , obtener el valor esperado i µ (que está en la escala de la variable de respuesta): 11 01 () ( ) ii i gg X µ η ββ −− = = + (4.3) Esta función debe asumir que la función sea conocida, monotónica y diferenciable. Es el investigador el que debe decidir cual es la función de enlace más adecuada en cada caso (Czado, 1997). Otra de las formas de seleccionar la función de enlace más adecuada, es la denominada “función de enlace canónica” que define el parámetro canónico de la distribución (ver tabla 4.2). Tabla 4.2 Funciones de enlace canónicas (adaptado de Ato 1996) Modelo Lineal Generalizado A.Wallace 75 4.3 – CLASIFICACIÓN DE LOS MLG La clasificación de los MLG se realiza considerando las siguientes características (Ato 1996): 1) Relación entre las variables: distinguiremos entre modelos simétricos y asimétricos. Los primeros tienen como objetivo el estudio de 2 o más variables con el mismo rol dentro del modelo, y los segundos tienen como objetivo la explicación o predicción de una respuesta a partir de un conjunto de variables explicativas. 2) Respuesta registrada: la variable de respuesta puede ser continua, categórica, binaria o politómica, de tiempo entre eventos y de recuento. 3) Respuesta modelada: podemos realizar el modelado sobre la variable de respuesta directamente o agrupando los datos. En este último caso, todas las variables explicativas deben ser categóricas, o continuas categorizadas mediante la agregación de los valores de respuesta de los sujetos que tienen un mismo patrón de valores en las variables explicativas. En el caso de trabajar con datos agrupados la repuesta modelada es diferente a la registrada. Si los datos individuales se han agrupado la respuesta modelada y registrada coinciden. 4) Componente sistemático: Distinguimos entre componente categórico como aquel componente organizado a partir de variables cualitativas, y mixto Modelo Lineal Generalizado A.Wallace 76 como el componente que incluye términos continuos y categóricos mediante algún tipo de codificación. Pero si todos los términos son continuos también tendemos un componente sistemático mixto. 5) Componente aleatorio: en el MLG la distribución de la probabilidad del error corresponde a la familia exponencial. Los más utilizados son los de Poisson, Binomial y Multinomial en función de la naturaleza de los datos. 6) Función de enlace: se utilizará la función “logit” para distribuciones binomiales, “logit” para distribuciones de Poisson, y “logit” generalizado para las distribuciones multinomiales, para transformar el valor esperado a la escala del predictor lineal y así, poder realizar la correcta interpretación del modelo. Tabla 4.3 Clasificación de modelos según los MLG (adaptado de Ato 1996). Modelo Lineal Generalizado A.Wallace 77 A esta clasificación podríamos añadir las variables de estímulo. Por ejemplo las probabilidades a priori de la frecuencia de las palabras y los procesos de transición entre los estímulos y las variables de respuesta, que utilizaremos en este trabajo. 4.4 – SUPUESTOS DEL MLG Al igual que en los modelos lineales, es necesario cumplir una serie de supuestos, aunque en este caso sean menos restrictivos (McCullagh y Nelder 1989):  Independencia de las observaciones  Especificación correcta del modelo (será incorrecta si hay una ausencia de términos relevantes en el componente sistemático).  Comprobar la presencia de observaciones problemáticas.  Especificar correctamente la función de enlace  Comprobar la presencia de “outliers” o valores mal justados por el modelo  Comprobar la presencia de valores influyentes sobre los coeficientes estimados. 4.5 – ESTIMACIÓN DE PARAMETROS En el caso de la distribución del componente aleatorio no normal se utiliza la Máxima Verosimilitud (ML). Cuando trabajamos con los OLS podemos aplicarlos sin realizar hipótesis sobre la distribución de la variable de respuesta, pero para la ML se hace necesario asumir dicha distribución. Ello es debido a la definición de estos modelos a partir de la probabilidad conjunta de las n observaciones (Lindsey, 1997). Modelo Lineal Generalizado A.Wallace 78 En el MLG utilizaremos, para la estimación ML, el algoritmo de Mínimos Cuadrados Iterativamente ponderados (IWLS). Los pasos a seguir en este algoritmo consisten en (Eliason, 1993): a) Estimar los parámetros, aplicando la función de enlace sobre los valores observados, obteniendo un vector G que se regresa sobre las variables explicativas X por medio de OLS. Es decir, 1 ˆ( )( ) jXX XG β − ′′ = . b) Una vez obtenidas estimados los parámetros calculamos los valores predichos ˆi η , transformándolos por medio de la inversa de la función de enlace y obteniendo los valores esperados i m . c) Obtenidos los valores predichos y esperados, construiremos una variable de respuesta de trabajo i Z (la diferencia entre valores esperados y observados) y una matriz de ponderación W (la diagonal principal de esta matriz representa las varianzas de los valores esperados i m ). d) Posteriormente regresamos la variable i Z sobre las variables explicativas X, teniendo en cuenta los valores de ponderación W, y obteniendo una estimación WLS mediante la siguiente ecuación: 1 ˆ( )( ) jX WX X WZ β − ′′ = e) Por último, hemos de repetir los pasos b y d de forma iterativa hasta cumplir el criterio de convergencia que se haya determinado. Modelo Lineal Generalizado A.Wallace 79 Hemos de indicar que es muy importante obtener la estimación del error estándar de ˆj β a través de 1 ˆ ()( ) j V X WX β − ′ = , que representa es la matriz de varianzas-covarianzas de ˆj β . 4.6 – AJUSTE Y SELECCIÓN DEL MODELO Una vez que tenemos los parámetros del modelo debemos seleccionarlos y ajustarlos. Esta tarea consiste en proponer modelos con diferentes parámetros. Para ello nos basamos en la discrepancia entre los datos observados y los esperados. 4.6.1. MODELOS Los modelos posibles son (Dobson, 1990, 2002): En el modelo saturado (MS) el número de parámetros estimados es igual al número de observaciones. En el caso de datos individuales el número de observaciones es igual al tamaño de la muestra. En el caso de tener datos agrupados el número de observaciones es igual al número de casillas de la tabla de contingencia. No se utiliza con datos individuales ya que el número de parámetros a estimar seria igual al del tamaño muestral. Este modelo reproduce los datos observados de una manera exacta. El modelo máximo (MMax) es el modelo más complejo. Éste incluye las variables explicativas, las variables de control y los términos de interacción. La elección del número de términos a incluir en el MMax (p) está en relación directa con el tamaño muestral. Hay que tener en cuenta que el numero de grados de libertad del tamaño del error debe ser positivo 1np>− . Con datos agrupados MMax = MS. Modelo Lineal Generalizado A.Wallace 80 El modelo mínimo (MMin) incluye un número mínimo de parámetros que debe ser estimado. Está vinculado al muestreo utilizado y requiere la inclusión de un factor de bloqueo en el caso de diseños de bloques aleatorios. El modelo nulo (MN) incluye un solo parámetro, proporcionando el mismo valor esperado para todas las observaciones. Normalmente sirve de referencia cuando se modelan datos individuales ya que no representa la estructura de los datos de una manera adecuada. El modelo cero (MC) no estima ningún parámetro (es el investigador el que fija el valor de los parámetros). Se utiliza para las pruebas de conformidad sobre el valor del parámetro. El modelo de trabajo (MT): es el objeto de comparación en cada paso del proceso de ajuste y selección del modelo final”. Estará entre el MMax y el MMin. (Lindsey 1997). En resumen, como ya vimos anteriormente, en el modelado el objetivo es encontrar el modelo que reproduzca más fielmente los datos observados con un menor número de parámetros. 4.6.2AJUSTANDO MODELOS Una vez obtenido el modelo adecuado, hemos de seguir aplicando el ajuste de los modelos observados en relación con los esperados. Para obtener la bondad de ajuste Modelo Lineal Generalizado A.Wallace 81 comparamos la diferencia entre valores observados y esperados. En MLG esto se denomina discrepancia (D) (Gill, 2001). El cálculo se realiza de manera diferente según la distribución del componente aleatorio y su interpretación cambia en función de si los datos son individuales o agrupados. Estos cálculos son necesarios para seleccionar el modelo óptimo. Para ello se comparan pares de modelos. En efecto, dos modelos están anidados si uno es un caso particular de otro (los términos del modelo menor están incluidos en el modelo mayor). Estas comparaciones se hacen utilizando el test de razón de verosimilitud D∆ . Mediante el ajuste global trabajamos con datos agrupados el MT se compara con el MS (el ajuste global compara valores esperados y valores observados). En este caso la D del MS es igual a 0, y por lo tanto la diferencia de discrepancias es igual a la D del MT (la D del MT proporciona el ajuste global del modelo por sí mismo) (McCulloch y Searle, 2001). Cuando partimos de datos individuales el MT se compara con el MN (se comparan los valores esperados por cada uno de ellos). En este caso la D no es interpretable por sí misma: MN MT DD D∆= − . Esta prueba tiene una distribución asintótica 2 χ , y su significación se obtiene situando el valor obtenido en la distribución 2 χ con los grados de libertad obtenidos de la diferencia de grados de libertad de los dos modelos (la diferencia de parámetros de los dos modelos.). En este caso la prueba D∆ evalúa si la adición de términos del MT reduce significativamente el valor D con Modelo Lineal Generalizado A.Wallace 82 respecto al MN. En el caso de los datos agrupados evalúa si la eliminación de términos del MT con respecto al MS incrementa significativamente la D (un valor estadísticamente significativo nos lleva a la selección del MS). Mediante el ajuste condicional comparamos las D de dos modelos anidados con el objetivo de escoger el modelo más simple (MR), cuya D no difiera significativamente de la D del modelo mas complejo al que esta anidado (MA). También utilizamos la prueba D∆ pero con los siguientes cambios: MR MA DD D∆= − . La significación se obtiene a través de la distribución 2 χ con los grados de libertad obtenidos de la diferencia de grados de libertad de los dos modelos. Esto nos permite evaluar la significación estadística de un parámetro mediante la formulación de dos modelos anidados siendo el MR el modelo que excluye parámetros. A su vez, también podemos evaluar la significación estadística de un subconjunto de parámetros formulando los correspondientes MA y MR. 4.6.3LA SELECCIÓN DEL MODELO Completado lo anterior, hemos de elegir el mejor modelo (Kadane 2004). Así, cuando el objetivo es predictivo hay que seleccionar las variables que expliquen el mayor porcentaje de variabilidad de respuesta, utilizando los criterios estadísticos en forma de algoritmos automáticos de selección. Sin embargo, cuando el objetivo es explicativo: priman los criterios teóricos, siendo el investigador el que guía el proceso de selección, especificando un modelo inicial y un conjunto sucesivo de modelos restringidos, comprobándolos mediante una Modelo Lineal Generalizado A.Wallace 83 estrategia de ajuste condicional; pero teniendo en cuenta una serie de aspectos. En efecto, en primer lugar, debemos respetar el principio de modelo jerárquico (el termino que introduzcamos deben incluir todos sus términos de orden inferior). En segundo lugar, deberíamos evaluar los términos de interacción a través de su significación estadística. En tercer lugar, analizaremos la posibilidad de incluir o excluir variables de control (confundidoras o de ajuste); y por ultimo decidiremos qué variables explicativas deben permanecer o no en el modelo. 4.7 – INTTERPRETANDO EL MODELO AJUSTADO Para la interpretación del modelo debemos tener en cuenta que (Liao 1994): En primer lugar, hemos de asumir que la significación estadística no puede ser el único criterio válido utilizado para la interpretación de los parámetros del modelo. Así, es conveniente el cálculo de los intervalos de confianza, además de la selección del modelo en base a criterios como: relevancia científica, tipo de diseño, etc. Así, cuando trabajamos con MLG, al existir una función de enlace, e interpretar los coeficientes, hay que realizar la transformación a la escala de la variable de respuesta. De este modo la interpretación de los parámetros se hace en términos del factor de cambio en el valor esperado de respuesta asociado al incremento unitario de X. Por otra parte, para la interpretación de los términos de interacción, debemos desviar relaciones simples. Además, es muy aconsejable utilizar tablas resumen para la interpretación de los coeficientes (Kam y Franzese, 2007) ver tabla 4.4. Modelos Loglineales A.Wallace 89 Tabla 5.1 Características de la distribución de Poisson. Inconvenientes de los modelos loglineales (Von Eye y Mun 2013):  Colapsabilidad: se produce cuando se omiten variables relevantes de una tabla de contingencia.  La Paradoja de Simpson: es el cambio en el sentido de una asociación entre dos variables cuando se controla el efecto de una tercera variable, normalmente se produce cuando se colapsa de manera inadecuada una tabla.  Tablas dispersas: cuando tenemos frecuencias esperadas pequeñas o valores cero. Inicialmente explicaremos los modelos más sencillos (con dos variables), para posteriormente ir aumentando el número de variables, lo que evidentemente aumenta su complejidad. En el ámbito de la memoria de reconocimiento pueden ser muy útiles estos modelos, ya que es habitual la presencia de variables categóricas como el tipo de respuesta del sujeto, frecuencias a priori, condición experimental, escalas de estimación, estímulos, respuestas, sesión, etc. Modelos Loglineales A.Wallace 90 5.2 MODELOS LOGLINEALES CON DOS VARIABLES Estos modelos podemos formularlos de dos maneras diferentes, con la primera nos referimos a la escala de las frecuencias esperadas (modelo multiplicativo), con la segunda manera, a la escala del logaritmo de las frecuencias esperadas (modelo aditivo). El objetivo del modelado loglineal, consiste en encontrar un modelo que represente óptimamente los resultados empíricos, es decir, que no difiera del modelo saturado (ajuste global), y que sea además el más simple de todos los modelos posibles con ajuste óptimo. La evaluación de los modelos puede hacerse con ayuda de algún criterio estadístico (que veremos más adelante). Una vez hallado el modelo óptimo se interpretan sus parámetros desde una perspectiva sustantiva. Para el caso de tablas 2 x 2 los modelos posibles son:  El modelo de equiprobabilidad [1]  Los dos modelos con efecto marginal, el de fila [A], y el de columna [B].  El modelo de independencia [A,B]  El modelo saturado [AB] La notación de los modelos es la sugerida por Goodman (1971) y Fienberg (1980). Para la presentación y explicación de estos modelos utilizaremos la codificación con respecto a una categoría de referencia (codificación ficticia o “Dummy coding”). Modelos Loglineales A.Wallace 91  Modelo de Equiprobabilidad [1] El modelo de equiprobabilidad o nulo supone que todas las frecuencias esperadas ij m son iguales (exponemos el modelo multiplicativo y aditivo): ij me λ = (5.1) ( ) log ij m λ = (5.2) La codificación de este modelo es un vector de unos, y es un componente necesario para todos los modelos lineales y loglineales. Nos permite representar la constante, y requiere 1 grado de libertad. Es un modelo cuya utilidad reside en que es un punto de referencia con el que comparar otros modelos, aunque puede tener también un sentido sustantivo. Es el modelo con la discrepancia máxima, con un sólo parámetro (la constante), y en el que sus valores ajustados son todos iguales.  Modelo con Efecto Marginal de Fila [A] En este modelo se supone que todas las frecuencias esperadas presentan valores marginales diferentes para los valores de A pero iguales para B. A i ij m ee λ λ = (5.3) ( ) log A ij i m λλ = + (5.4) Dado que el efecto marginal produce dos valores diferentes necesita 2 grados de libertad. Debido a que la constante necesita un grado de libertad debemos introducir una restricción en el modelo (restricción de nulidad) referida a un nivel de la variable codificada (usualmente el primer nivel). De este modo la restricción 1 0 A λ = define como objetivo el segundo nivel de A y como referencia el primer nivel. Por lo que sólo se utiliza un grado de libertad. Modelos Loglineales A.Wallace 92  Modelo con Efecto Marginal de Columna [B] Desde este modelo se supone que las frecuencias esperadas presentan valores marginales diferentes en la variable B, pero iguales para A. B j ij m ee λ λ = (5.5) ( ) log B ij j m λλ = + (5.6) Dado que le efecto marginal produce dos valores diferentes, necesita 2 grados de libertad. Debido a que la constante necesita un grado de libertad debemos introducir una restricción en el modelo (restricción de nulidad) referida a un nivel de la variable codificada (usualmente el primer nivel). De este modo la restricción 1 0 B λ = define como objetivo el segundo nivel de B y como referencia el primer nivel. Por ello se utiliza un grado de libertad.  Modelo de Independencia [A,B] El modelo de independencia supone que las frecuencias esperadas no presentan asociación entre las variables A y B, es decir, solo supone efectos marginales tanto de fila como de columna. B Aj i ij m ee e λ λ λ = (5.7) ( ) log AB ij i j m λλ λ =++ (5.8) Dado que los efectos marginales producen 4 valores diferentes, necesita 4 grados de libertad. Debido a que la constante necesita un grado de libertad debemos introducir una restricción en el modelo (restricción de nulidad) referida al primer nivel de las variables codificadas (usualmente el primer nivel). De este modo las restricciones 11 0 AB λλ = = definen como objetivo el segundo nivel de A y B y como referencia el primer nivel. Debido a esto solo se utilizan dos grados de libertad. Modelos Loglineales A.Wallace 93 Este modelo tiene la propiedad de que la razón de odds (OR) es igual a la unidad y su logaritmo es 0, de aquí el nombre del modelo (Vermunt, 1997).  Modelo Saturado [AB] El modelo saturado supone que las frecuencias esperadas son una mezcla de efectos marginales de las variables A y B, y también de su asociación mutua. B AB Aj ij i ij m ee e e λλ λ λ = (5.9) ( ) log A B AB ij i j ij m λλλλ =+++ (5.10) Este modelo necesita 4 grados de libertad, tantos como casillas de la tabla de contingencia, de aquí viene el nombre del modelo. El ajuste global del modelo es perfecto y el ajuste parcial relativo al MN es máximo. Este modelo no es interpretable, está utilizando toda la información de los datos (deja 0 grados de libertad). 5.3. MODELOS LOGLINEALES CON TRES VARIABLES Aquí, consideraremos los modelos jerárquicos, donde los componentes interactivos incorporan todos los parámetros de orden inferior, a diferencia de los modelos no jerárquicos. Debido a ello, el aumento de modelos con respecto al de dos dimensiones es importante, ya que pasamos de 5 a 19 modelos posibles:  Un modelo de equiprobabilidad [1]  Tres modeles de efectos marginales [A], [B] y [C]  Tres modelos de independencia marginal [A,B], [A,C] y [B,C]  Un modelo de independencia mutua [A,B,C]  Tres modelos de asociación marginal [AB], [AC] y [BC]  Tres modelos de asociación condicional [AB,C], [AC,B] y [BC,A] Modelos Loglineales A.Wallace 94  Tres modelos de doble asociación [AB,AC], [AB,BC] y [AC,BC]  Un modelo de triple asociación [AB,AC,BC]  Un modelo saturado [ABC] La interpretación de estos modelos se suele realizar describiendo la estructura de su asociación marginal y condicional utilizando las OR debido a que los parámetros son funciones de la OR. Al igual que en los modelos para dos dimensiones habrá que introducir las restricciones de nulidad para los parámetros (Fienberg y Rinaldo, 2012). Ahora pasamos a exponer los posibles modelos a ajustar para tres variables, obviando los ya expuestos para dos variables.  Modelo de Independencia [A,B,C] El modelo de independencia supone que las tres variables son mutuamente independientes: B AC j ik ijk m ee e e λ λλ λ = (5.11) ( ) log ABC ijk i j k m λλλλ =+++ (5.12) Dado que los efectos marginales producen 6 valores diferentes necesita 6 grados de libertad. Debido a que la constante necesita un grado de libertad, debemos introducir una restricción en el modelo (restricción de nulidad) referida al primer nivel de las variables codificadas (usualmente el primer nivel). De este modo las restricciones 111 0 ABC λλλ = = = definen como objetivo el segundo nivel de A, B y C, y como referencia el primer nivel. Por lo tanto solo se utilizan tres grados de libertad (más el de Modelos Loglineales A.Wallace 95 la constante). De este modo, los parámetros de este modelo se interpretan con respecto a este nivel de referencia. En este modelo, la asociación marginal es idéntica a la condicional entre dos variables, dada una tercera e igual a 1 (son asociaciones nulas que revelan la independencia entre variables). En este modelo las 1OR = .  Modelos de asociación condicional [AB,C], [AC,B] y [BC,A] En estos modelos se parte del supuesto de que hay una asociación entre dos variables, pero tal asociación es independiente de una tercera variable: B AB AC j ij ik ijk m ee e e e λλ λλ λ = (5.13) ( ) log A B C AB ijk i j k ij m λλλλλ =++++ (5.14) B A C AC j i k ik ijk m ee e e e λ λ λλ λ = (5.15) ( ) log A B C AC ijk i j k ik m λλλλλ =++++ (5.16) B BC AC j jk ik ijk m ee e e e λλ λλ λ = (5.17) ( ) log A B C BC ijk i j k jk m λλλλλ =++++ (5.18) En estos modelos la asociación marginal entre dos variables es igual que la asociación parcial, dada la tercera variable.  Modelos de doble asociación [AB,AC], [AB,BC] y [AC,BC] Estos modelos suponen que dos variables son condicionalmente independientes de otro par de variables. B AB A C AC j ij i k ik ijk m ee e e e e λλ λλ λ λ = (5.19) Modelos Loglineales A.Wallace 96 ( ) log A B C AB AC ijk i j k ij ik m λλλλλ λ =++++ + (5.20) B AB BC AC j ij jk ik ijk m ee e e e e λ λλ λλ λ = (5.21) ( ) log A B C AB BC ijk i j k ij jk m λλλλλ λ =++++ + (5.22) B BC A C AC j jk i k ik ijk m ee e e e e λλ λ λλ λ = (5.23) ( ) log A B C AC BC ijk i j k ik jk m λλλλλ λ =++++ + (5.24) Las tablas marginales de las variables asociadas tienen las mismas asociaciones que sus tablas parciales. Este tipo de modelos nos permiten revelar la existencia de relaciones espurias, es decir, de relaciones no lógicas. Una asociación será espuria si encontramos una tercera variable que haga que esta asociación desaparezca si controlamos la tercera variable. En estos modelos las OR marginales son iguales a la OR parciales en el caso de las asociaciones marginales que se incluyen en el modelo, pero no en las asociaciones no incluidas en el modelo.  Modelo de triple asociación [AB,AC,BC] Este modelo parte del supuesto de que ningún par de variables es condicionalmente independiente. B AB BC A C AC j ij jk i k ik ijk m ee e e e e e λλ λ λλ λ λ = (5.25) ( ) log A B C AB AC BC ijk i j k ij ik jk m λλλλλ λ λ =++++ + + (5.26) En este modelo la asociación parcial entre dos variables es la misma para cada uno de los niveles de la tercera, pero diferente de su asociación marginal, al contrario que los anteriores modelos expuestos. Modelos Loglineales A.Wallace 97  Modelo saturado [ABC] Desde este modelo suponemos que cada par de variables puede ser condicionalmente dependiente, y además se parte del supuesto de que la asociación entre pares de variables puede depender del nivel de una tercera. B AB BC ABC A C AC j ij jk ijk i k ik ijk m ee e e e e e e λ λ λλ λλ λ λ = (5.27) ( ) log A B C AB AC BC ABC ijk i j k ij ik jk ijk m λλλλλ λ λ λ =++++ + + + (5.28)  Selección del modelo (Agresti, 1990) Para la selección del modelo más adecuado debemos seguir tres criterios básicos:  El criterio lógico: que sigue el principio de parsimonia  El criterio estadístico: que descansa en la bondad de ajuste del modelo  El criterio sustantivo: que se basa en la interpretabilidad del modelo. En resumen, buscamos el modelo más parsimonioso, con una bondad de ajuste aceptable y que pueda ser interpretado. Suele ocurrir que hay más de un modelo que cumple estas características. Un modelo parsimonioso es aquel que con el mayor número de grados de libertad tiene todos sus parámetros significativos. Además, un modelo bien ajustado es aquel cuya razón entre discrepancia y grados de libertad se aproxima a la unidad. Debemos considerar ajustado un modelo cuando 0.10P≥ . Modelos Loglineales A.Wallace 98 Para la selección del modelo más adecuado podemos ayudarnos del índice Akaike Information Criterion (AIC). Este índice se calcula mediante la siguiente fórmula (Akaike 1981): 2AIC D gl= − (5.29) donde D es la desvianza menos el doble de los grados de libertad (entendemos el mínimo que puede haber) O bien podemos utilizar el Bayesian Information Criterion BIC desarrollado por Gideon Schwarz (1978) que se calcula: ( ) logBIC D gl N= − (5.30) donde D es la desvianza menos los grados de libertad por el logaritmo de N. Por eso cuando hay un BIC o un AIC muy pequeño, es porque la discrepancia es muy pequeña y tenemos por el contrario muchos grados de libertad y/o muchos datos. Como sabemos, estos índices no son interpretables en si mismos, sino en comparación con los valores obtenidos para cada modelo, por ello, si tenemos dos modelos, escogeremos aquel que tenga el valor AIC o BIC más bajo. Hay que recordar que el MS se descarta al no ser posible su interpretación. También recordar que no debemos interpretar un modelo sin haber evaluado su ajuste. Especialmente recomendable es realizar un análisis de los residuales. Como norma general, consideraremos un ajuste normal si los residuales estandarizados no presentan una proporción significativa de valores muy altos. Consideraremos un ajuste inapropiado cuando hay una proporción mayor de 0,5 valores residuales sobre 1 en términos absolutos, o bien la presencia de un valor residual mayor que 2 entendido este valor en términos absolutos. Modelos Loglineales A.Wallace 105 1) Modelo triangular de bloques [T] La hipótesis a contrastar es si existe un incremento de las frecuencias en el triangulo superior (postest) respecto a las frecuencias del triangulo inferior (prestest). Si los resultados son diferentes en cada bloque entonces hay dos bloques diferenciados, en caso contrario aceptaríamos la hipótesis nula. Las variables categóricas deben ser ordinales. ( ) log ABT ij i j ij m λλλλ =+++ (5.35) donde T ij λ es un parámetro que toma los siguientes valores, 2 si ij< o 1 si ij> . Se somete a prueba la hipótesis de nulidad de bloques triangulares, por lo tanto si 0 T ij λ = se acepta 0 H , no existen bloques triangulares pero si se rechaza no podemos eliminar del modelo este parámetro. 2) Modelo de bloques mixtos [M] En este modelo, las variables categóricas deben ser nominales y además, es más complejo, ya que se supone que en los datos podemos distinguir conglomerados de respuesta con pautas definidas. ( ) log ABM ij i j ij m λλλλ =+++ (5.36) Regresión de Posisson A.Wallace 106 CAPÍTULO 6 REGRESIÓN DE POISSON Lo último que uno sabe, es por donde empezar. Blaise Pascal Regresión de Posisson A.Wallace 107 6.1 – INTRODUCCIÓN Este es el modelo más adecuado para analizar variables de respuesta de recuento (Long, 1997). Inicialmente se aplicó en el estudio de conductas criminales, para posteriormente expandirse a otras áreas. Actualmente es una distribución muy utilizada en la investigación médica y, en particular, en epidemiología. La distribución de Poisson es la que suelen seguir los datos de recuento y nos permite obtener la probabilidad de que se produzca un determinado k de ocurrencias de un evento, siendo su función de probabilidad: exp( ) () ! i y ii i Py k y µµ π − = = = (6.1) Si 0 µ > el parámetro media de la distribución coincide con la varianza, denominándose esta característica como “equidispersión”. Esta distribución debe su nombre, como hemos indicado anteriormente en este trabajo, al estadístico Poisson que la describió en 1837, aunque ya había sido introducida en 1718 por De Moivre como una forma límite de la distribución binomial que surge cuando se observa un evento raro después de un número grande de repeticiones. El concepto de evento “raro” o poco frecuente debe ser entendido en el sentido de que la probabilidad de observar k eventos decrece rápidamente a medida que k aumenta. Sus principales características son:  Tiene un único parámetro: la media.  La varianza es igual a la media Regresión de Posisson A.Wallace 108  Si el cociente entre la varianza y la media es mayor de 1 tendremos sobredispersión. Una característica de la distribución de Poisson es que tiene la propiedad de que la suma de las variables aleatorias de Poisson independientes es también la variable de Poisson, cuya medida es igual a la suma de las medias de las variables aleatorias independientes (Haight 1967). Ventajas sobre el modelo lineal:  Los modelos lineales podrían predecir valores negativos.  La varianza de la variable de respuesta probablemente aumente con la media.  Los errores no se distribuyen según la distribución normal.  Los ceros no se pueden transformar satisfactoriamente. ¿Que diferencias hay entre modelar respuestas de frecuencias y respuestas de recuento? En la regresión de Poisson nos interesa saber de qué manera una o más variables pueden explicar o predecir el número de ocurrencias (recuento) que se darán en un determinado evento. Tradicionalmente se han analizado este tipo de variables con un modelo de regresión lineal (Gürtler y Henze 2000), no siendo esto del todo correcto, aunque sí es cierto que con valores de recuento grandes sus resultados no difieren mucho de los de la regresión de Poisson. De este modo, aplicaremos este modelo cuando se dispone de datos individuales, para el caso de datos agrupados deberemos acudir a los modelos loglineales. Pero si Regresión de Posisson A.Wallace 109 todas las variables son categóricas se pueden utilizar indistintamente aunque es recomendable utilizar el modelo loglineal (Cameron y Trivedi, 1998, 2013). En el contexto de este trabajo pueden ser muy útiles para modelar el recuento de respuestas o conductas de los sujetos a los estímulos utilizando una gran variedad de variables explicativas incluyendo las medidas psicofísicas. 6.2 – EL MODELO DE REGRESIÓN DE POISSON SIMPLE Se utiliza cuando la variable de respuesta es de recuento y la variable explicativa es continua o categórica binaria, y se estudia si el valor esperado i m del recuento está influenciado por la variable explicativa. Como hemos comentado antes, si la variable explicativa es binaria es mejor utilizar el modelo loglineal. La ecuación del modelo de regresión de Poisson simple es: 01 log( ) ii i X η µ ββ = = + (6.2) Este es un MLG cuyo componente aleatorio sigue la distribución de Poisson, utiliza una función de enlace logarítmica, con una variable de respuesta cuantitativa discreta no negativa. La relación entre el parámetro µ y la variable explicativa viene dada por: 01 log( ) ii m b bX= + (6.3) y en su forma multiplicativa es: 01 0 1 exp( ) exp( )exp( ) ii i m b bX b bX= += (6.4) Como vemos no hay relación lineal entre el valor de la variable de respuesta y el valor de la variable explicativa. Además, la expresión multiplicativa nos permitirá interpretar los efectos de 1 b directamente en la escala de la variable de respuesta, Regresión de Posisson A.Wallace 110 mientras que la interpretación de dichos efectos en la expresión aditiva se realiza sobre la escala del predictor lineal (logarítmica). 6.2.1 VARIABLE DE EXPOSICIÓN En el modelo de regresión de Poisson, debemos incluir la variable de exposición o también llamado “multiplicador de tasa” simbolizado por t. De este modo se tiene en cuenta que el recuento de cada una de las observaciones se puede basar en periodos de tiempo, espacio o tamaño de población diferentes (Lunneborg 1994, Lindsey 1995). Si el valor t es igual para todas las observaciones no hace falta incluirla en el modelo (sería como una constante). Por otra parte, la variable t debe ser como mínimo de 10 a 100 veces mayor que el dato de recuento para que los supuestos de la distribución de Poisson se cumplan, en caso contrario habría que utilizar un modelo loglineal. (Liao 1994). 6.2.2 ESTIMACIÓN DE LOS PARÁMETROS En este modelo, y siguiendo la expresión aditiva, el valor del coeficiente 1 b representa el cambio en el logaritmo de recuento esperado por cada unidad de cambio en la variable explicativa X, siendo este cambio constante entre los valores X que estén separados equidistantemente (es un cambio lineal). Pero si tomamos la expresión multiplicativa, la interpretación del coeficiente 1 b será más sencilla, debido a que el valor exponenciado de 1 b representa el factor de cambio del recuento esperado para el incremento de una unidad en la variable explicativa X, siendo este cambio no constante entre los valores de X, ya que de hecho es un cambio no lineal. Regresión de Posisson A.Wallace 111 Si deseamos saber el factor de cambio en el recuento esperado cuando la puntuación en X se incrementa en δ unidades, solo tendremos que calcular 1 exp( )b δ , que a su vez se pude transformar a porcentaje (Lindsey, 1995). Para obtener la significación estadística de los coeficientes del modelo, podemos contrastar la hipótesis de que 0 β = con la prueba de Wald (1945): 1 1 () b zEE b = (6.5) Siguiendo su valor una distribución normal ( ) 0,1N , además podemos calcular su intervalo de confianza: 11 2 1 (1 ) : ( )IC b z EE b α αβ −± . De este modo, el coeficiente será significativo si el intervalo de confianza no contiene el valor 0, aunque es el investigador el que puede decidir el valor criterio. Para la expresión multiplicativa del modelo exponenciaremos la fórmula anterior: Finalmente es necesario obtener el IC para los valores esperados, para ello, debemos obtener el valor del error estándar, su cálculo en este contexto conlleva cierta dificultad (Liao 1994). 6.2.3 COMPARACIÓN DE MODELOS Para la comparación de los modelos debemos utilizar la prueba de diferencias que en este modelo se obtiene de: ( ) 1 2 log ni i ii ii m D y ym y =   =− +−      ∑ (6.6) De este modo comparamos el MA con el MR en modelos simples, donde en este último el valor esperado i m es el valor medio de los recuentos registrados para las diferentes observaciones. Así: MN MA DD D∆= − , distribuyéndose D∆ como una 1 121 (1 )exp( ):exp ( )IC b z EE b α αβ  −±  Regresión de Posisson A.Wallace 112 distribución 2 χ con grados de libertad MN MA gl gl gl∆= − (la diferencia en el número de parámetros del modelo). En los MLG no tenemos un 2 R (índice de bondad de ajuste), pero si “pseudo2 R ” (Cameron y Trivedi, 1998): 2MN MA MN DD pseudo R D − −= (6.7) El valor obtenido varía entre 0 y 1, y aumentará según se vayan introduciendo variables al MA. Se interpreta como la proporción de reducción en la discrepancia del MN debida a la inclusión de la variable explicativa en el MA. 6.2.4 MODELO CON VARIABLE EXPLICATIVA BINARIA Si la variable explicativa es categórica binaria se puede incluir directamente al modelo con la adecuada codificación. Si codificamos con respecto a una categoría de referencia el valor 1 exp( )b es el factor de cambio entre el número promedio de recuentos para el grupo codificado con el valor 1 respecto al grupo de referencia codificado como 0. Si la variable explicativa es politómica hay que convertirla en 1k− variables, quedándonos un modelo de Regresión de Poisson Múltiple. 6.3 – EL MODELO DE REGRESIÓN DE POISSON MÚLTIPLE Se utiliza cuando la variable de respuesta es de recuento y las variables explicativas son continuas o categóricas, y se estudia si el valor esperado i m del recuento está Regresión de Posisson A.Wallace 113 influenciado por las variables explicativas. A diferencia de el modelo simple, tenemos que distinguir entre modelos que incluyen interacciones entre variable explicativas y los que no las incluyen (Cameron y Trivedi 1998). La ecuación aditiva del modelo sin interacción es: 0 11 0 1 log( ) ... k i i k ki j ji j XX X µ ββ β β β = = + ++ = + ∑ (6.8) donde j X es la representación genérica de las variables explicativas y de control. El ajuste se realiza de igual manera que con el modelo simple comparando MA y MR, y la interpretación de los coeficientes de una variable explicativa proporciona el efecto de esta variable manteniendo constantes las restantes variables del modelo, de manera independiente al valor que tomen estas variables. En este caso se asume que el efecto de cada una de las variables explicativas es constante para el dominio de valores de las restantes variables del modelo. La ecuación aditiva del modelo con dos variables en interacción es: 01 2 3 log( ) i i i ii X Z XZ µ ββ β β =+++ (6.9) donde X y Z serian las variables explicativas y de control. Los efectos principales del modelo serían 1 β y 1 β , y el efecto de interacción entre las variables sería 3 β . Es recomendable comenzar el proceso de selección con las interacciones de mayor orden, eliminado las que no resulten estadísticamente significativas (Claeskens y Hjort 2008). Podemos realizar esto con las interacciones, una a una, o mediante un chunk test (con interacciones de un orden similar). El proceso se sigue realizando sobre las interacciones de orden inmediatamente inferior, realizando se sucesivamente este proceso según el principio jerárquico. Regresión Logística A.Wallace 119 límites. Es una función monótona creciente o decreciente, no lineal y con forma de S (ver figura 7.1). Figura 7.1 Función de densidad y función de distribución logística. Se representa por ()pz , lo que refleja que se interpreta en términos de probabilidad: exp( ) () 1 exp( ) z pz z =+ (7.1) Una variable dicotómica se describe como la proporción de casos que pertenecen a una categoría ( 11 p nn= ) y su valor estará comprendido entre 0 y 1. Esto se interpreta como la probabilidad de que un sujeto presente dicha característica, donde π es la proporción poblacional y p la proporción muestral. Como ya hemos visto, la proporción muestral de casos que pertenecen a la primera categoría de una variable binaria es 11 p nn= , para calcular la proporción de la segunda categoría se realiza mediante 1 1p− . Normalmente 0 significa ausencia de la característica de estudio y 1 presencia. También se puede utilizar un índice complementario denominado odds (Hosmer y Lemeshow, 1989, 2000), que se calcula como el cociente del número de sujetos de una categoría dividido entre el número de sujetos de la otra categoría o dicho de otro Regresión Logística A.Wallace 120 modo, el cociente entre la probabilidad de que ocurra frente a la probabilidad de que no ocurra : 11 p Op =− . Suele aparecer sin el subíndice, siendo el cociente entre la categoría 1 y la categoría 0. Sus valores van de 0 a ∞ y se interpreta:  Si 1O< hay más sujetos en la categoría 0 que en la categoría 1.  Si 1O= habría el mismo número de sujetos en las dos categorías.  Si 1O> hay menos sujetos en la categoría 0 que en la categoría 1. También podemos utilizar la odds ratio (OR), que no es más que comparar las odds obtenidas en dos grupos de sujetos , 1 1 AA A AB BB B Op p OOp p − = = − (7.2) Sus valores también van de 0 a ∞ y se interpreta:  Si 1OR < nuestro objeto de estudio es menor en el grupo A que en el Grupo B (hay un incremento de odds).  Si 1OR = nuestro objeto de estudio es igual en los dos grupos (no hay variación de odds).  Si 1OR > nuestro objeto de estudio es mayor el grupo A que en el grupo B (hay una disminución de odds). Es importante indicar que habrá que hacer distinciones en el caso de trabajar con datos agrupados o datos individuales: si las variables explicativas son continuas no se pueden agrupar datos y se realizaría un modelo de regresión logística, pero si las variables explicativas son categóricas se pueden agrupar los datos y se realizaría un modelo de regresión logit (Kleinbaum 1994). Regresión Logística A.Wallace 121 Los inconvenientes que podemos encontrarnos con esta prueba son (Long 1997):  Implica conocer el nivel de separación entre los valores de la variable de respuesta.  Problemas numéricos derivados de la frecuencia observada en las combinaciones entre los niveles de la/s variable/s predictora/s y la variable de respuesta.  El tamaño de muestra: en el caso de que el tamaño muestral sea reducido es conveniente utilizar el test de la razón de verosimilitud.  Es sensible a los casos perdidos.  La categorización de las variables debe estar bien fundamentada.  Sesgo en presencia de colinealidad. 7.2. MODELO DE REGRESIÓN LOGÍSTICA SIMPLE Este modelo nos “permite predecir la probabilidad de presentar una determinada característica de interés en función del valor en una variable explicativa de tipo continuo”. Su ecuación es: 01 logit( ) log 1 i ii i X π µ ββ π  = = +  −  (7.3) Como en todos los MLG tenemos el componente sistemático (el predictor lineal que nos proporciona el valor predicho), la función de enlace (logit) que es el logaritmo de todas las odds esperadas por el modelo, y por último el componente aleatorio que supone la variabilidad de la variable de respuesta Y no explicada por el predictor lineal ( η ) siguiendo una distribución de probabilidad de Bernoulli (distribución binomial con 1n= ). Debido a que los datos no se agrupan, cada predicción del modelo condicionada Regresión Logística A.Wallace 122 a un valor determinado de la variable explicativa incluye un único sujeto, por eso el error es binomial ya que la respuesta solo puede tomar valores 0 y 1. La función de enlace logit se utiliza cuando el componente aleatorio sigue una distribución Binomial (, ) ii Bn π , ya sea con i n sujetos o con 1 sujeto. Esta función de enlace nos permite linealizar la relación entre la probabilidad modelada y la combinación lineal de variables explicativas, y también convertir los valores esperados a una misma escala de medida. El valor transformado se presenta en la escala de medida del predictor lineal. 7.2.1. ESTIMACIÓN DE LOS PARÁMETROS DEL MODELO La ecuación aditiva del modelo de regresión logística simple para una muestra concreta es: 01 logit( ) log( ) log 1 i ii i i m m o b bX m  = = = +  −  (7.4) donde i m es la probabilidad esperada de éxito para la observación i. El logit de i m es igual al logaritmo del cociente entre la proporción esperada de éxito y su complementario. Esta misma ecuación expresada en términos multiplicativos permite que la respuesta sea ahora la odds esperada. 01 0 1 exp( ) exp( )exp( ) ii i o b bX b bX= += (7.5) Para la estimación de los parámetros podemos utilizar dos métodos diferentes, el condicional y el incondicional la elección de alguno de estos métodos depende del número sujetos de la muestra (Menard, 1995). Si el número de parámetros es grande con respecto a la muestra utilizaremos el método condicional, y si el número de parámetros es pequeño con respecto a la muestra se utiliza el método incondicional. Regresión Logística A.Wallace 123 Ésto es debido a que la estimación por máxima verosimilitud es óptima con muestras grandes en relación al número de parámetros. Es importante señalar que la interpretación de los parámetros es exactamente la misma con los dos métodos. Los programas de análisis de datos estadísticos habitualmente utilizan el método incondicional si no se les indica lo contrario. La interpretación de los coeficientes del modelo de regresión logística se suelen hacer en términos de la ecuación multiplicativa, ya que se expresa la razón entre la probabilidad de ocurrencia esperada i m y la no ocurrencia 1 i m− de la característica modelada (Pampel, 2000). De este modo:  Si 10b> entonces 1 exp( ) 1b> , es decir, un incremento de X produce un incremento de i o (que aumente la probabilidad de que la característica estudiada aparezca).  Si 10b= entonces 1 exp( ) 1b= , es decir un incremento de X no cambia i o  Si 10b< entonces 1 exp( ) 1b< , es decir, un incremento de X produce una disminución de i o (que disminuya la probabilidad de que la característica estudiada aparezca). Como hemos visto, el valor de 1 exp( )b es el factor por el que se multiplica i o cuando la variable explicativa X se incrementa en una unidad, pero también puede ser interpretado directamente como una OR. Si la variable explicativa es continua es preferible considerar un incremento en X de u unidades, así el factor por el que se multiplica i o cuando X se incrementa en u unidades viene dado por 1 exp( )ub (Hosmer y Lemeshow, 1989). Regresión Logística A.Wallace 124 En el caso de 0 exp( )b este es el valor de i o para un sujeto con valor 0 en la variable explicativa X, y como constante se considera un valor de referencia respecto al cual interpretar las odds de sujetos con valores diferentes de 0 en la variable explicativa (siempre que 0 sea un valor posible de X). 7.2.2. INFERENCIAS SOBRE LOS COEFICIENTES DE REGRESIÓN Comenzaremos con la comprobación de la significación estadística del modelo mediante una prueba de ajuste global. Existen dos procedimientos alternativos (Menard 2002): En primer lugar, aplicar una prueba de significación para comprobar si el parámetro que se estima es estadísticamente igual o diferente de 0. Después se realiza la prueba de significación de Wald (que se fundamenta en que la distribución muestral de una estimación máximo verosímil sigue la normal cuando n es grande): ( ) 2 1 1 b WEE b  =   (7.6) En segundo lugar se puede aplicar el procedimiento de comparar la discrepancia de dos modelos (un MN y un MA). También se puede calcular el IC del parámetro 1 β , pero en este caso resulta mejor calcular el IC del OR, ya que su distribución muestral tiende a ser simétrica en muestras de tamaño pequeño: ( ) 11 2 1 (1 )IC b z EE b α αβ −=± (7.7) Por su parte, los límites del IC para el OR vienen dados por: 121 (1 ) exp( ( ))IC OR b z EE b α α −=± (7.8) Regresión Logística A.Wallace 125 7.2.3. COMPARACIÓN DE MODELOS La discrepancia de un modelo de regresión logística (-2logL) se calcula a partir de la diferencia entre los valores observados i y y los valores esperados i m del modelo: 1 2log 2 ( log( (1 )) log(1 )) n i ii i i D L y mm m = =− =− −+ − ∑ (7.9) Pudiéndose expresar así: 1 2 ( logit( ) log(1 )) n ii i i D mm m = =− +− ∑ (7.10) Para conocer la bondad de ajuste debemos recurrir a la prueba de ajuste global, donde realizaremos el test de la diferencia de discrepancias ( D∆ ): 2log ( 2log ) 2log MR MR MA MR MA MA L DD D L L L  ∆ = − =− −− =−   (7.11) Como sabemos, este índice sigue una distribución 2 χ con grados de libertad iguales a la diferencia de parámetros entre los dos modelos comparados. En el caso de el MR = MN y el MA es el que incluye la variable explicativa. Por lo tanto el D∆ que evalúa el ajuste global de un MA es: 2log ( 2log ) 2log MN MN MA MN MA MA L DD D L L L  ∆ = − =− −− =−   (7.12) Que sigue una distribución 2 χ con 1 grado de libertad. 7.2.4. BONDAD DE AJUSTE DEL MODELO Para determinar la bondad de ajuste del modelo podemos utilizar los siguientes índices (Hosmer y Hjort 2002): Regresión Logística A.Wallace 126  2 HM χ compara el número de sujetos observados en cada categoría de respuesta con el número de sujetos predicho por el modelo. El procedimiento debe comenzar dividiendo a los sujetos en g grupos (lo normal es 10g= ), a partir de la probabilidad esperada de respuesta i m . De este modo en el primer grupo estarán los sujetos con 0,1 i m≤ , en el segundo los sujetos con 0,1 0,2 i m<≥ y así hasta 1. Después para cada grupo se recuenta el número de sujetos observados en la muestra en cada categoría de respuesta, y también se calcula el número de sujetos predicho por el modelo en cada categoría de respuesta. Es muy recomendable representar estos datos en una tabla (ver tabla 7.1). Tabla 7.1 Valores observados y esperados para el cálculo del estadístico 2 HM χ El estadístico se calcula a partir de la tabla: ( ) ( ) 22 0. 0. 1. 1. 2 10. 1. ggg gg HM ggg oe oe ee χ = −− = + ∑ (7.13) Sigue una distribución 2 χ con 2 g− grados de libertad, pudiéndose obtener su significación estadística. El modelo estará ajustado si no hay significación estadística. Hay que indicar que no puede calcularse para un MN, ya que predeciría un único i m para todos los sujetos, siendo imposible establecer g grupos.  2 L R de la familia pseudo2 R , y se calcula a partir de la discrepancia del MN y MA: Regresión Logística A.Wallace 127 2MN MA L MN DD RD − = (7.14) Un inconveniente importante consiste en su difícil interpretación, ya que no refleja el porcentaje de varianza de Y explicada por X, porque las D no son sumas de cuadrados. 7.2.5. MODELO CON VARIABLE EXPLICATIVA BINARIA Si nuestro modelo incluye un predictor binario X con 2 categorías, la ecuación del modelo será: 01 logit( ) i m b bX= + (7.15) El proceso es similar a cuando tenemos un predictor continuo, lo que debemos tener en cuenta es la interpretación de los coeficientes de regresión. Si la codificación es respecto a la categoría de referencia 0, el coeficiente 0 b es el valor del logit( ) i m de los sujetos del grupo codificado con el valor 0, y el coeficiente 1 b es el cambio que se produce en el logit( ) i m debido a un incremento en una unidad en X. Pero si lo que deseamos es interpretar la ecuación multiplicativa entonces, el termino 1 exp( )b es la OR del grupo codificado con el valor 1 con respecto al codificado con el valor 0. Finalmente, si la codificación es respecto al promedio de categorías, el paso del grupo codificado con valor 1− al codificado con el valor 1+ implica un incremento de 2 unidades en la variable explicativa. Regresión Logística A.Wallace 128 7.3. MODELO DE REGRESIÓN LOGÍSTICA MÚLTIPLE En este modelo al menos uno de los predictores debe ser cuantitativo, ya que si todos fuesen categóricos, deberíamos utilizar el modelo de regresión logit (por la agrupación de los datos) (Glonek y McCullagh 1995). Este modelo puede incluir una combinación lineal de variables explicativas categóricas o cuantitativas, así como sus términos de interacción. Además, nos permite ajustar el efecto de una variable mediante variables de control. Su ecuación es: 0 11 22 0 1 logit( ) ... k i i i k ik j ij j m b bX bX bX b bX = = + + ++ = + ∑ (7.16) Si el modelo no presenta términos de interacción se interpreta igual que el modelo de regresión logística simple, teniendo en cuenta que al interpretar un parámetro se consideran fijados los demás. Así, 1 exp( )b se interpreta como la OR asociada a un incremento de una unidad en X (Skrondal y Rabe-Hesketh, 2003). En el caso de que el modelo presente términos de interacción, éste se incluye en el modelo como un nuevo término. Con dos variables explicativas la ecuación sería: 0 1 22 3 logit( ) ii i m b b X b Z b XZ=+++ (7.17) donde 3 b es el coeficiente de regresión del término de interacción entre la variable explicativa X y la variable modificadora Z. No se recomienda incluir términos de interacción con más de dos variables ya que, por una parte, su interpretación es bastante compleja, y por otra, sucede que suele Experimento 2 A.Wallace 225 MODELADO ESTADÍSTICO APLICADO EN MEMORIA DE RECONOCIMIENTO Y POTENCIALES EVOCADOS3 1 INTRODUCCIÓN Para el segundo de los experimentos de memoria de reconocimiento, vamos a evaluar tares de memoria “explícita” e “implícita”, manipulando los estímulos y las condiciones experimentales para contrastar las diferencias entre ambos tipos de memoria (Baddeley, 1999). Hemos de añadir que los constructos a los que nos referimos son elaboraciones para este experimento sin pretender teorizar sobre el tema de la memoria. La tarea planteada consistió en el estudio del resultado obtenido en el rendimiento de un observador al valorar una señal. El procedimiento más sencillo consiste en establecer juicios de valor, basados en respuestas SINO. Desde la TDS partimos del supuesto de que el sujeto elije un valor como criterio de respuesta basado en la máxima verosimilitud. En nuestra investigación, los valores de sensación de la señal sobre los valores de sensación del ruido en el ámbito de la memoria de palabras, (Egan, 1958). Los datos de este estudio proceden de una serie de estímulos sensoriales que proponemos al participante y que elicitan respuestas electrofisiológicas en el cerebro, provocando secuencias características de ondas en el trazado electroencefalográfico (EEG) (Hillyard y Kutas, 1983). Estas ondas son diferentes para cada modalidad 3 Los datos de este experimento provienen del laboratorio de psicofísica de la Facultad de Psicología de Málaga y no han sido publicados. Experimento 2 A.Wallace 226 sensorial y su variabilidad depende del tipo de estímulo. En nuestra aplicación utilizamos los potenciales relacionados con eventos (ERP en inglés). Consideramos el tiempo que tarda en activarse un P300 como variable de respuesta ante los estímulos, la señal y el ruido durante diferentes sesiones de registro. Mediante estas técnicas podemos aislar y registrar áreas del cerebro específicas. En la práctica, la forma de onda de la P300 se debe evocar utilizando un estímulo provisto por alguna de las modalidades sensoriales. El procedimiento típico es el paradigma oddball, en el que un estímulo diana se presenta entre estímulos de fondo más frecuentes. También puede usarse un estímulo distractor para asegurarse de que la respuesta se debe a la diana en lugar de a un cambio en el patrón de fondo o para manipular la atención. El paradigma odd-ball clásico ha sufrido muchas variaciones, pero al final la mayor parte de los protocolos utilizados para evocar la P300 implica alguna forma de hacer consciente una situación o una toma de decisiones. Es en este contexto en el que se introduce el paradigma de la TDS. La investigación científica a menudo descansa en la medición de la P300 para examinar potenciales relativos a eventos, especialmente cuando se trata de la toma de decisiones, ya que existe una relación bastante directa entre la reducción de la incertidumbre del sujeto y la amplitud del P300. Por otra parte, el deterioro cognitivo a veces está relacionado con modificaciones en el P300, de manera que se puede utilizar como medida para detectar la eficiencia de la respuesta en la evaluación de diferentes procesos cognitivos. Así es que hay un amplio rango de usos del P300 que va, por ejemplo, desde el estudio de la depresión y la drogadicción, a los trastornos de ansiedad, o los procesos cognitivos, como la atención, percepción y memoria. Experimento 2 A.Wallace 227 Las hipótesis que queremos contrastar aquí se refiere a la constatación de las diferencias entre memoria “implícita” y “explícita”, añadiendo a ello la obtención del modelo mejor ajustado, y determinando además en qué medida contribuyen a ello las diferentes condiciones experimentales y variables o categorías del experimento. 2 MÉTODO Participantes Participaron 48 Estudiantes de psicología con edades comprendidas entre los 19 y 23 años, que cursaban asignaturas del área de Metodología de las Ciencias del Comportamiento (Facultad de Psicología de la Universidad de Málaga). La muestra estaba formada por hombres y mujeres. Material En primer lugar obtuvimos una muestra de 40 palabras a partir de su frecuencia de uso y clase. Las palabras fueron presentadas mediante el programa E-prime v1.1 (Schneider, Eshman y Zucolotto, 2002). El registro se realizó con un equipo de potenciales evocados QuickAmp de 72 canales y el programa de registro Brainvision Recorder v2. Se utilizaron 11 canales: 3 frontales (F3, FZ, F4), 3 centrales (C3, CZ, C4), 3 parietales (P3, PZ, P4), y 2 occipitales (O1, O2). Procedimiento Se aplicó el paradigma de la TDS en memoria de reconocimiento de ítems. La mitad de las palabras, 20 para cada condición, fueron consideradas señal y otras 20 ruido. En la condición de memoria “implícita” el participante realizaba una tarea Experimento 2 A.Wallace 228 distractora al observar la primera lista de palabras. Esta tarea consistía en evaluar la simetría de dos números colocados encima y debajo de la palabra a rememorar. Además, el participante no era informado de que estaba ante una prueba de memoria. En la condición de memoria “explícita” aparecía la palabra a memorizar y el participante era informado de que debía someterse posteriormente a una prueba de memoria. La aparición de cada palabra estaba precedida por un punto negro en la pantalla durante 500 milisegundos. El participante respondía mediante respuestas SINO en caso de que la palabra perteneciera o no a la lista original. Las sesiones tenían una duración de 20 minutos, registrando los datos del EEG en el programa Brainvision Recorder. Posteriormente fueron tratados y segmentados mediante el programa Brainvision Analyzer. En este experimento nos decidimos por los Potenciales evocados cognitivos P300. La onda P300 (EP300, P3) es un (ERP) que puede ser registrado mediante Electroencefalografía como una deflexión positiva de voltaje con una latencia de unos 300ms en el EEG. La presencia, magnitud, topografía y duración de esta señal se utiliza a veces en la medición de la función cognitiva de los procesos de toma de decisiones. Esta metodología permite aislar y registrar localmente un área sin el ruido de otras señales adquiridas a través de electrodos sobre la piel del cráneo. La investigación científica a menudo descansa en la medición del P300 para examinar potenciales relativos a eventos, especialmente cuando se trata de la toma de decisiones. Experimento 2 A.Wallace 229 La obtención del P300 se realizó mediante el programa Brainvisión Analyzer. Ambos programas son comercializados para tareas de investigación por BrainProducts (ver figura 1). Figura 1: Ejemplo de procesado y análisis de señal con Brainvision Analizer v2. En la figura 1 tenemos un ejemplo de la información que nos puede proporcionar de manera visual el programa Brainvisión Recorder tras el procesado de la actividad cerebral, que incluye, la forma de la onda del potencial, su latencia, su voltaje, la activación eléctrica por zonas de la corteza cerebral y tiempo, el tipo de onda cerebral, y gracias al módulo Low Resolution Electromagnetic Tomography (LORETA) imágenes de resonancia magnética funcional de baja resolución. Paralelamente, el programa registra mucha más información que va recogiendo durante el proceso de registro y que podemos recuperar en forma de archivo de datos. El programa además de realizar el Experimento 2 A.Wallace 230 filtrado de las ondas cerebrales, también permite realizar algunos análisis estadísticos con ellos, comparación de ondas, cálculo de la grand average, etc. 3 RESULTADOS De los resultados obtenidos en el registro de potenciales evocados se seleccionaron para el análisis los pertenecientes a los electrodos frontales (F3, FZ, F4) que son los habitualmente utilizados en el estudio de los ERP (tiempos de latencia en milisegundos). Para el ajuste de estos datos utilizamos el programa R (Ihaka y Gentleman, 1996). Se ha ajustado 1 modelo, el modelo lineal de interacción entre las variables: A (tipo de memoria) y B (señal-ruido) (ver figura 2 y 3). Figura 2: Salida del programa R con el modelo ajustado Experimento 2 A.Wallace 231 Figura 3: Gráficos de diagnóstico El modelo que mejor hemos ajustado [F=10,91, p<0,001] es un modelo lineal de interacción que incluye las variables A (tipo de memoria) y la variable B (señal-ruido), es decir el modelo A:B. Este modelo incluye A que resulta de la comparación de los dos tipos de memoria y que es el resultado más significativo desde el punto de vista estadístico (ver tabla 1). Tabla 1: Resumen del modelo ajustado Experimento 2 A.Wallace 232 Pero también, observamos otros datos relevantes, por ejemplo, la significación entre la señal y el ruido como dos elementos distintos del experimento. Es decir, que los tipos de memoria, además de ser estadísticamente significativos entre sí, se comportan de forma diferente y varían de forma estadísticamente significativa en función de la señal-ruido. Considerando los resultados obtenidos tras el ajuste de los modelos, y teniendo en cuenta que estamos trabajando con un modelo exploratorio (y que hemos obteniendo un R2 ajustado moderado), podríamos decir en primer lugar que ambos tipos de memoria son diferentes, y en segundo lugar que los sujetos harían uso de un tipo u otro de memoria en función de los estímulos presentados y de las sesiones. Por lo que concluimos que la memoria, al ser la más significativa de todas las comparaciones incluye una variabilidad propia y sólo relativamente independiente de la señal-ruido y de las sesiones. En efecto, éstas últimas variables incorporan una variabilidad propia asociada a la memoria, pero con entidad propia y diferenciada, como vemos, ya que la significación estadística, a pesar de que existe, es menor a la comparación específica de tipos de memoria. 4 DISCUSIÓN El modelo mejor ajustado ha resultado ser de interacción, que incluye las variables que aquí hemos llamado A (tipo de memoria) y la variable B (señal-ruido), es decir el modelo A:B siendo la señal y el ruido diferentes en el modelo. Por consiguiente, podemos asumir que hay interacción entre ambas memorias, Que la memoria denominada “implícita” no es independiente de la memoria que hemos denominado “explícita”. Según estos modelos no existiría una memoria pura, sino una interacción entre memorias que dependería selectivamente del tipo de estímulo utilizado. Con ello Experimento 2 A.Wallace 233 se abre una oportunidad para estudiar la memoria humana mediante modelos de conjuntos difusos donde se deberían trabajar las evidencias a favor de un tipo u otro de memoria y no tanto los modelos o teorías puras de la memoria. Todo ello aporta un modelo estructural general (saturado y articulado por partes), de acuerdo con unas variables fundamentales: memoria “explícita” e “implícita”; así como unos modelos parciales que permiten evaluar todos los efectos relevantes que se detectan en la respuesta de los participantes a partir de las variables estímulo y de las sesiones de la investigación, en la línea seguida por DeCarlo (1998) y Wallace, Pelegrina, Ruiz-Soler, (2002) en el ámbito de la memoria, la detección de señales y el modelado estadístico. Además, hemos incorporado los potenciales evocados en el mismo contexto, añadiendo una medida psicofísica que tiene una gran estabilidad. Estos resultados nos llevan, a diferencia del experimento anterior, a un modelo asociativo (de abajo a arriba) más que cognitivo, donde no se aprecian los efectos del esquema, ya que, la interacción obtenida entre ambas memorias como modelo general se ve afectada por el tipo de estímulo de forma diferenciada (tanto de la señal como del ruido). Por consiguiente, “lo implícito y lo explicito “, tal y como fue operacionalizado en este experimento, es un constructo unido a variables de estímulo-respuesta más cercano a modelos asociativos que cognitivos. Es decir, es algo unido a lo corpóreo o físico y no tanto a los esquemas de conocimiento (ver en anexo 1 un ejemplo de palabras asociadas a las condiciones experimentales). Experimento 3 A.Wallace 239 Figura 1: Resultados del modelo ajustado con R En la salida del programa R, el modelo que mejor hemos ajustado es un modelo que incluye los efectos principales de las variables explicativas, y la interacción entre dos variables explicativas (ver tabla 2 y figura 2). Obteniéndose un pseudo-R2 de 0,54. Tabla 2: Resumen del modelo ajustado Experimento 3 A.Wallace 240 Figura 2: Gráficos diagnósticos del modelo ajustado El modelo obtenido pone el énfasis en el la clase de palabras utilizadas y sus diferencias en el TR 4 DISCUSIÓN A tenor de los resultados obtenidos, hemos comprobado que existen dos procesos diferenciados en función de la clase de palabras que se presenta a los sujetos. La interacción C:T donde el tipo de palabra es el efecto principal que intereractúa con el tiempo de exposición del estímulo. Experimento 3 A.Wallace 241 Las palabras de clase abierta se reconocen más rápidamente (ya que tienen un TR menor), y se cometen menos falsas alarmas que con las palabras de clase cerrada (un 50% menos). No hay diferencias entre CA y CC cuando se trata de aciertos y rechazos incorrectos. Por otra parte, como hemos utilizado el equipo de registro de potenciales evocados para el registro del los TR, se obtuvo al igual que en el experimento anterior los potenciales evocados y las imágenes de activación eléctrica de la corteza cerebral (ver figura 3) donde podemos comprobar que tanto el voltaje como la localización en la corteza de los sujetos al realizar la tarea con palabras de CA son distintos a los de CC. Además, existen diferencias individuales que pueden ser estudiadas por si hubiese algún tipo de patrón asociado a variables psicológicas. Estos resultados son consistentes con los obtenidos por Henson, Hornberger y Rugg, (2005) y Hoppstädter, Baeuchl, Diener, et al., (2015). Figura 3: Gráfico de actividad eléctrica de la corteza cerebral al realizar las dos tareas. En este experimento, de nuevo se asume un modelo cognitivo como un modelo más eficiente en memoria de palabras con significado frente al conductista, ya que los Experimento 3 A.Wallace 242 sujetos reconocen mejor y más rápido las palabras de CA (que tienen significado) que las de CC (que no tienen significado) (ver anexo 1). Como línea futura de investigación cabe citar la necesidad de estudio de las características de los registros de la figura 3. Anexo 1 (Experimento 3) (Pelegrina, Emberley, et al., 2011) Discusión General A.Wallace 243 DISCUSIÓN GENERAL Defiende tu derecho a pensar, incluso pensar de manera errónea, es mejor que no pensar. Hipatia de Alejandría. Discusión General A.Wallace 244 Un modelo estadístico es una ecuación que reproduce los fenómenos que observamos de la forma más exacta posible. Para ello tiene en cuenta los datos suministrados y la influencia que el azar tiene en estas observaciones, además, el modelo es diferente cada vez que se modifica la información. Estos modelos pueden aplicarse en el ámbito de la psicología, ya que el modelo matemático, a diferencia de la teoría, presenta una estrecha vinculación con los datos empíricos, y de este modo, el modelo se convierte en una herramienta teórica de fáci1 manejo que permite la introducción de ajustes a fin de describir adecuadamente los datos experimentales. La psicología matemática hoy en día está ampliamente extendida y se están desarrollando aplicaciones de modelado estadístico y simulación. Debemos señalar también, que la Teoría de Detección de Señales y los modelos expuestos en este trabajo sobre memoria de reconocimiento han conseguido una formalización bien fundamentada aplicada en diversos contextos. La base de gran parte de las pruebas estadísticas utilizadas en psicología se encuentran en el Modelo Lineal Clásico (MLC). Este modelo supone que su estructura refleja los elementos explicativos de un fenómeno por medio de relaciones funcionales probabilísticas entre variables, el cual hemos utilizado en el segundo experimento de este trabajo desde la perspectiva del modelado estadístico, donde se ha ajustado un modelo lineal múltiple en el que hemos encontrado diferencias en la latencia del P300 en función del tipo de memoria y la presentación de una señal o un ruido. Además, aparecen la interacción entre el tipo de memoria y la señal-ruido. El más reciente, MLG (Nelder y Wedderburn, 1972) es una extensión del MLC. Este modelo ha supuesto un gran cambio en la estadística, siendo una solución válida para modelos de dependencia con datos categóricos y cuantitativos conjuntamente. Discusión General A.Wallace 245 De forma complementaria con las habituales pruebas de contraste de hipótesis y las pruebas de significación, el modelado estadístico, que empieza a despuntar a partir de los años 60, se centra en la estimación de parámetros y el ajuste de modelos de probabilidad a los datos empíricos (Ato y López, 1996). Esto nos ha permitido en nuestro trabajo integrar en el modelo todos los elementos necesarios para el análisis: significación estadística y la estructura de la relación entre las variables. La APA en 2013 publicó la segunda edición de “Beyond Significance Testing: Reforming Data Analysis Methods in Behavioral Research” donde insta a los investigadores a utilizar las nuevas técnicas estadísticas que están evolucionando y apareciendo desde mediados del siglo XX, para solventar las limitaciones de los test estadísticos clásicos. Los modelos que surgen del modelado estadístico tratan de explicar la variación de una respuesta a partir de la relación conjunta de dos fuentes de variabilidad, una de carácter determinista y otra aleatoria (Judd y McClelland, 1989). En esto es semejante el MLC, ya que el modelo trata de representar lo mejor posible los datos, reduciendo el error al máximo. En el caso del primer experimento se ha ajustado un modelo loglineal en el que se ha encontrado asociación entre la escala de estimación y la respuesta de los sujetos y también entre la señal-ruido y la respuesta de los sujetos. Esto ha sido mostrado en los experimentos anteriores, considerando los modelos de respuesta como elemento a modelar y no simplemente los resultados de las respuestas, siendo esto último una aportación del MLG y del modelado estadístico. El modelado estadístico consiste, por tanto, en la construcción, formulación y ajuste de modelos a los datos empíricos respondiendo a tres criterios: la bondad de ajuste, la parsimonia y la integración teórica. Dicho de otro modo, buscamos el modelo Discusión General A.Wallace 246 que explique la variable de respuesta con el menor error y con el menor número de variables explicativas. Esto se realizará siguiendo las etapas expuestas en este trabajo: especificar el modelo teórico, estimar los parámetros del modelo, seleccionar el modelo, evaluarlo e interpretarlo. Podemos aceptar o no el modelo, en este caso reiniciaríamos el proceso. En efecto, en el tercer experimento se ha ajustado un modelo de Poisson Múltiple, en el que hemos encontrado diferencias en las respuestas de los sujetos en función del tipo de palabra que se les ha presentado, la señal-ruido, además se ha comprobado que los tiempos de reacción son diferentes en función de tipo de palabra. Esto nos ha permitido modelar el estímulo y su probabilidad, de acuerdo con la estadística Bayesiana que la TDS incorpora en las probabilidades a priori. Por consiguiente, desde el modelado aquí propuesto se presupone en cierto modo la consideración de una “memoria estadística” Para la estimación de los parámetros del modelo, debido a su complejidad es necesario utilizar un software estadístico que nos permita realizar el modelado estadístico. Aunque la cantidad de programas estadísticos es bastante amplia (SAS, SPSS, STATA, StatGraphics, MATLAB, etc.), en modelado estadístico se ha utilizado mucho el programa GLIM (Nelder, 1974), su última versión GLIM4 ha sido ampliamente utilizado. Hoy en día tenemos a nuestro alcance varios programas estadísticos gratuitos que nos permiten realizar modelado estadístico, uno de ellos es lem (Vermunt, 1997), de sencillo manejo y muy apto para la enseñanza del modelado. Pero el programa que hoy en día tiene la mayor potencia de cálculo y nos proporciona más información sobre nuestros modelos es R (Ihaka y Gentleman, 1996). Actualmente Discusión General A.Wallace 247 tiene 7469 paquetes estadísticos que nos permiten realizar casi cualquier prueba estadística conocida, además cuenta con abundante documentación y tutoriales, para realizar nuestros cálculos. Con R se trabaja con decisiones y pasos sucesivos, de manera similar a lo que hacemos con el modelado estadístico: construimos modelos, calculamos la desvianza para evaluar el modelo y entonces, aceptamos inicialmente o lo rechazamos. En definitiva, como hemos visto anteriormente, se han aplicado técnicas de modelado estadístico en el contexto de la memoria de reconocimiento, con el objetivo de comprobar su utilidad analítica y además conocer si proporcionan información adicional a las técnicas tradicionalmente utilizadas en este campo, como los índices de discriminación de la TDS. Hasta nuestros trabajos anteriores en este sentido no hemos constatado modelos cognitivos ni de la neurociencia en este contexto, aunque el modelado es muy importante en las diferentes ingenierías, lo cual permite prever un desarrollo en la neurociencia. En resumen, el modelado estadístico nos permite obtener el modelo mejor ajustado de los datos, utilizando variables cualitativas y cuantitativas, superando limitaciones de los métodos de análisis más extendidos como la independencia, la homogeneidad y la distribución de los datos (Agresti, 2002). Pero también, la posibilidad de modelar los datos obtenidos, y no solo, la obtención de diferencias significativas o no entre las distintas condiciones experimentales. Así pues, los datos obtenidos en nuestras investigaciones nos permiten realizar un “análisis adaptado a los datos, los estímulos y las condiciones del diseño”, aspecto a Conclusión A.Wallace 254 CONCLUSIÓN Ninguna investigación humana puede ser denominada ciencia si no pasa a través de pruebas matemáticas. Leonardo Da Vinci. Conclusión A.Wallace 255 En el presente trabajo se han expuesto diferentes modelos estadísticos aplicados a datos empíricos, para obtener toda la información posible sobre ellos. El objetivo principal de este trabajo ha consistido, por una parte, en aumentar nuestro conocimiento acerca de los modelos asociativos y de los modelos cognitivos, en este caso, la memoria de reconocimiento, y por otra parte, presentar el modelado estadístico como una técnica de análisis complementaria a los análisis clásicos que se suelen aplicar. Además, esto puede llevarnos a un diálogo (o posible debate) sobre la idoneidad de estos modelos y su aplicación a otros ámbitos. Las respuestas de los sujetos en pruebas de memoria pueden ser dicotómicas (aciertos y errores), politómicas (escalas subjetivas de estimación con una gran variedad de posibilidades) y a partir de ellas y de acuerdo con los estímulos, se elaboran tablas de contingencia complejas, donde lo modelos que hemos venido tratando encajan perfectamente porque se adaptan de forma literal a los datos, sean los que sean: variables independientes o de estímulo, variables de respuesta, variables de confundido, etc. En este caso, la aplicación del modelado nos ha proporcionado información sobre los modelos matemáticos de contenido sustantivo, en todos los datos en los que se han aplicado. Esto nos ha permitido obtener información adicional a la de los métodos de análisis tradicionales. En el primer experimento hemos comprobado que existe asociación entre la seguridad de la respuesta de los sujetos y el tipo de respuesta que daban asumiendo un modelo cognitivo de reconocimiento. En el segundo, hemos comprobado que pueden Conclusión A.Wallace 256 existir dos procesos diferenciados de memoria en función de los estímulos que se presentan, apoyándonos en registros electrofisiológicos lo que apoyaría un modelo asociacionista de la memoria. En tercer lugar, hemos comprobado que los sujetos son capaces de discriminar estímulos diferentes que han memorizado previamente, diferenciándose esta discriminación en el tiempo de reacción de la respuesta, lo que nos lleva a pensar que el sujeto utiliza un modelo cognitivo de reconocimiento. Podemos concluir que nuestra investigación nos ha proporcionado evidencias e información formalizada matemáticamente sobre la relación entre las variables y condiciones cada investigación sobre la memoria de reconocimiento, desde diferentes perspectivas, representadas por los experimentos en los que hemos tratado de reflejar de la mejor manera posible las características de este complejo proceso cognitivo. Finalmente indicar que es posible que el modelado se incluya en el futuro en una teoría estadístico-matemática más amplia en torno a la actual teoría de conjuntos que tendría en cuenta los elementos del modelado y su desarrollo futuro. Incorporando conjuntos amplios de variables y redes: por ejemplo, mediante los conceptos de retículo, red o lattice entre otros. Pero estos conceptos se nos escapan a los propósitos del presente trabajo. No obstante, y para terminar enumeramos una sinopsis de los elementos más relevantes de nuestro trabajo actual y sus posibles extensiones en el futuro. Conclusión A.Wallace 257 Elementos considerados en el mismo modelado: Historia previa del estímulo. Estímulos con sus probabilidades a priori. Condiciones experimentales. Diseño. Diseño restringido. Plan de investigación. Respuestas. Constructos operacionalizados mediante variables. Grupos de variables a criterio de la teoría. Modelos de acuerdo con los objetivos de la investigación. Elegir el modelo estadístico mejor ajustado y más parsimonioso. Elementos a considerar en el futuro: Simulación basada en las estructuras anteriores Modelos de redes y neuronales. Referencias A.Wallace 258 REFERENCIAS Un científico es un hombre tan endeble y humano como cualquiera; sin embargo, la búsqueda científica puede ennoblecerle, incluso en contra de su voluntad. Isaac Asimov. Referencias A.Wallace 259 Abrahamson, I.G. y Levitt, H. (1969). Statistical analysis of data from experiments in human signal detection. Journal of Mathematical Psychology, 6, 391-417. Achen, C.H. (1982). Interpreting and Using Regression. Newbury Park, CA: Sage Publications. Aggarwal, C.C. (2013). Outlier Analysis. New York: Springer-Verlag. Aggleton, J.P. y Brown, M.W. (1999). Episodic memory, amnesia, and the hippocampal-anterior thalamic axis. Behavioral and Brain Sciences, 22(3), 425444. Aggleton, J. P., McMackin, D., Carpenter, K., et al. (2000). Differential cognitive effects of colloid cysts in the third ventricle that spare or compromise the fornix. Brain, 123(1), 800-815. Agresti, A. (1984). Analysis of Ordinal Categorical Data. New York: J. Wiley & Sons. Agresti, A. (2007). An Introduction to Categorical Data Analysis (2nd Edition). Hoboken, NJ: Wiley-Interscience. Agresti, A. (1990). Categorical Data Analysis. Hoboken, NJ: Wiley-Interscience. Agresti, A. (2013). Categorical Data Analysis (3rd Edition). Hoboken, NJ: WileyInterscience. Agresti, A. (1999). On logit confidence intervals for the odds ratio with small samples. Biometrics, 55, 597-602. Aitkin, M. (1980). A note on the selection of log-linear models. Biometrics, 36(1), 173-178. Akaike, H. (1981). Likelihood of a model and information criteria. Journal of Econometrics , 16, 3-14. Algom, D. (1992). Advances in Psychology Vol.92: Psychophysical Approaches to Cognition. Amsterdam: North-Holland. Referencias A.Wallace 260 Allan, L.G., Siegel, S.D. y Tangen, J.M. (2005). A signal detection analysis of contingency data. Learning and Behavior, 33, 250-263. Altman, D.G. y Bland, J.M. (1994). Diagnostic tests 1: sensitivity and specificity. British Medical Journal, 308, 1552. Andersen, E.B. (1997). Introduction to the Statistical Analysis of Categorical Data. Berlin: Springer-Verlag. Arbel, Y., Spencer, K.M. y Donchin, E. (2011). The N400 and the P300 are not all that independent. Psychophysiology, 48, 861-875. Arminger, G., Clogg, C.C. y Sobel, M.E. (1995). Handbook of Statistical Modeling for the Social and Behavioral Sciences. New York: Springer-Verlag. Arnau, J. (1986). Psicología experimental cognitiva: modelos básicos de procesamiento de la información. Anuario de Psicología, 35, No.2, 5-16. Arnau, J. (1977). Utilización de modelos matemáticos en psicología. Anuario de Psicología, 17, 5-17. Atkinson, R.C. y Juola, J.F. (1974). Search and decisión processes in recognition memory. Rn D.H. Krantz, R.C. Atkinson, R.D. Luce, y P. Suppes (Eds.). Contemporary Developments in Mathematical Psychology: Vol. 1. Learning, Memory & Thinking. San Francisco: Freeman. Atkinson, R.C., Hertmann, D.J. y Wescourt, K. T. (1974). Search processes in recognition memory. En Solso (Ed.), Theories in Cognitive Psychology: The Loyola Symposium. Potomac, MD: Erlbaum. Ato, M. y López, J.J. (1996). Análisis Estadístico para Datos Categóricos. Madrid: Síntesis. Ato, M., Losilla, J.M., Navarro, J.B., Palmer, A. y Rodrigo, M.F. (2005). Análisis de Datos: Modelo Lineal Generalizado. Tarrasa: CBS. Referencias A.Wallace 261 Azen, R. y Walker, C.M. (2011). Categorical Data Analysis for the Behavioral and Social Sciences. New York: Routledge. Baddeley, A.D. (1992). Working memory: the interface between memory and cognition. Journal of Cognitive Neuroscience, 4(3), 281-288. Baddeley, A.D. (1982). Psicología de la Memoria. Barcelona: Debate. Ballesteros, S., Reales, J.M. y Manga, D. (1999). Memoria implícita y memoria explicita intramodal e intermodal: influencia de las modalidades elegidas y del tipo de estímulos. Psicothema, 11(4), 831-851. Balota, D.A. y Spieler, D.H. (1999). Word frequency, repetition, and lexicality effects in word recognition tasks: beyond measures of central tendency. Journal of Experimental Psychology, 128(1), 32-55. Bassi, F., Hagenaars, J.A., Croon, M., & Vermunt, J.K. (2000). Estimating true changes when categorical panel data are affected by uncorrelated and correlated classification errors. Sociological Methods & Research, 29(2), 230268. Belsley, D.A., Kuh, E. y Welsch, R.E. (2004). Regression Diagnostics: Identifying Influential Data and Sources of Collinearity. Hoboken, NJ: Wiley-Interscience. Berkson, J. (1944). Application of the logistic function to bio-assay. Journal of the American Statistical Association, 39(227), 357-365. Bernbach, H.A. y Kupchak, P.G. (1972). Recognition and recall in short-term memory. Journal of Mathematical Psychology, 9, 231-242. Berry, W.D. (1993). Understanding Regression Assumptions. Newbury Park, CA: Sage Publications. Bhat, S., Agarwal, A., Gray, A. y Vuduc, R. (2010). Toward interactive statistical modeling. Procedia Computer Science, 1, 1835-1844. Referencias A.Wallace 268 Goodman, L.A. (1971). The analysis of multidimensional contingency tables: stepwise procedures and direct estimation methods for building models for multiple classifications. Technometrics, 13(1), 33-61. Graf, P. y Mandler, G. (1984). Activation makes words more accessible, but not necessarily more retrivable. Journal of Verbal Learning and Verbal Behavior, 23(5), 553-568. Graybill, F.A. e Iyer, H.K. (1994). Regression Analysis: Concepts and Applications. Belmont, CA: Duxbury Press. Green, D.M. & Swets, J.A. (1988). Signal Detection Theory and Psychophysics. Los Altos, CA: Peninsula Publishing. Grimnes, S. & Martinsen, O.G. (2008). Bioimpedance and Bioelectricity Basics (2nd Edition). London: Academic Press. Grünwald, P.D. (2000). Model selection based on Minimum Description Length. Journal of Mathematical Psychology, 44, 133-152. Gürtler, N. y Henze, N. (2000). Recent and classical goodness-of-fit tests for the Poisson distribution. Journal of Statistical Planning & Inference, 90, 207-225. Haberman, S.J. (1974). The Analysis of Frecuency Data. Chicago: University of Chicago Press. Haight, F.A. (1967). Handbook of the Poisson Distribution. New York: J. Wiley & Sons. Haight, F.A. (1966). Some statistical problems in connection with word association data. Journal of Mathematical Psychology, 3, 217-233. Haist, F., Shimamura, A.P. y Squire, L.R. (1992). On the relationship between recall and recognition memory. Journal of Experimental Psychology, 18(4), 691-702. Referencias A.Wallace 269 Hald, A. (2007). A History of Parametric Statistical Inference from Bernoulli to Fisher 1713-1935. New York: Springer-Verlag. Hald, A. (2003). A History of Probability and Statistics and their Applications before 1750. Hoboken, NJ: Wiley-Interscience. Handy, T.C. (2009). Brain Signal Analysis: Advances in Neuroelectric and Neuromagnetic Methods. Cambridge, MA: The MIT Press. Hardy, M.A. (1993). Regression with Dummy Variables. Newbury Park, CA: Sage Publications. Hasselmo, M.E. (2012). How We Remember: Brain Mechanisms of Episodic Memory. Cambridge, MA: The MIT Press. Heathcote, A., Ditton, E. y Mitchell, K. (2006). Word frequency and word likeness mirror effects in episodic recognition memory. Memory and Cognition, 34(4), 26-838. Heinze, H.J., Münte, T.F. y Mangun, G.R. (1994). Cognitive Electrophysiology. New York: Springer-Verlag. Heinze, H.J., Münte, T.F., Kutas, M., Butler, S.R., et al. (1999). Cognitive Event-related Potentials. EEG and Clinical Neurophysiology, 52, 91-95. Hillyard, S.A. y Kutas, M. (1983). Electrophysiology of cognitive processing. Annual Review of Psychology , 34, 33-61. Hillyard, S.A., Picton, T.W. y Regan D. (1978). Sensation, percpion and attention En E. Callaway, Tueting, P. y Koslow, S. (eds). Event-Related Brain Potentials in Man. New York: Academic Press Hintzman, D.L., Caulton, D.A. y Levitin, D.J. (1998). Retrieval dynamics in recognition and list discrimination: Further evidence of separate processes of familiarity and recall. Memory and Cognition, 26(3), 449-462. Referencias A.Wallace 270 Hirshman, E. y Master, S. (1997). Modeling the conscious correlates of recognition memory: Reflections on the remember-know paradigm. Memory and Cognition, 25(3), 345-351. Hirshman, E. y Palij, M. (1992). Rehearsal and the word frequency effect in recognition memory. Journal of Memory & Language, 31, 477-484. Hoaglin, D.C. y Welsch, R.E. (1978). The hat matrix in regression and ANOVA. American Statistician , 32(1), 17-22. Hoppstädter M., Baeuchl C., Diener C., Flor H. y Meyer P. (2015). Simultaneous EEGfMRI reveals brain networks underlying recognition memory ERP old/new effects. Neuroimage. 116, 112-22. Hosmer, D.W. y Hjort, N.L. (2002). Goodness-of-fit processes for logistic regression: simulation results. Statistics in Medicine, 21, 2723-2738. Hosmer, D.W., Lemeshow, S. y Sturdivant, R.X. (2013). Applied Logistic Regression (3rd Edition). Hoboken, NJ: J. Wiley & Sons. Hunt, E. (1985). Mathematical models of the Event-Related Potential. Psychophysiology, 22(4), 395-402. Huppert, F.A. y Piercy, M. (1978). The role of trace strength in recency and frequency judgments by amnesic and control subjects. Quarterly Journal of Experimental Psychology, 30(2), 347-354. Hurst, W. y Volpe, B.T. (1982). Temporal order judgments with amnesia. Brain and Cognition, 1(3), 294-306. Hutcheson, G.D. y Sofroniou, N. (1999). The Multivariate Social Scientist: Introductory Statistics Using Generalized Linear Models. London: Sage. Inoue, C. y Bellezza, F.S. (1998). The detection model of recognition using know and remember judgments. Memory and Cognition, 26(2), 299-308. Referencias A.Wallace 271 Jaccard, J. (2001). Interaction Effects in Logistic Regression. Thousand Oaks, CA: Sage Publications. Jacoby, L.L. (1991). A process dissociation framework: Separating automatic from intentional uses of memory. Journal of Memory and Language, 30(5), 513-541. Jacoby, L.L. y Kelley, C.M. (1992). Unconscious influences of memory: Dissociations and automaticity. En A. Milner y E.M. Rugg (Eds.). The Neuropsychology of Consciousness. San Diego: Academic Press. Jacoby, L.L., Kelley, C.M. y Dywan, J. (1989). Memory attributions. En H. Roediger III, E. Fergus e I.M. Craik (Eds.). Varieties of Memory and Consciousness: Essays in Honour of Endel Tulving. Hillsdale: Erlbaum. Jacoby, L.L., Toth, J.P. y Yonelinas, A. P. (1993). Separating conscious and unconscious influences of memory: measuring recollection. Journal of Experimental Psychology: General, 122(2), 139-154. Johnson, R. (1993). On the neural generators of the P300 component of the EventRelated Potential. Psychophysiology , 30, 90-97. Jones, M., Curran, T., Mozer, M.C., & Wilder, M.H. (2013). Sequential effects in response time reveal learning mechanisms and event representations. Psychological Review, 120(3), 628-666. Judd, C.M. y McClelland, G.H. (1989). Data Analysis: A Model-Comparison Approach. Orlando, FL: Harcourt Brace Jovanovich. Judd, C.M., McClelland, G.H. y Ryan, C.S. (2008). Data Analysis: A ModelComparison Approach (2nd Edition). New York: Routledge. Kadane, J.B. y Lazar, N.A. (2004). Methods and criteria for model selection. Journal of American Statistical Association, 99, 279-290. Referencias A.Wallace 272 Kam, C.D. & Franzese, R.J. (2007). Modeling and Interpreting Interactive Hypotheses in Regression Analysis. Ann Arbor, MI: Michigan University Press. Kappenman, E.S. y Luck, S.J. (2010). The effects of electrode impedance on data quality and statistical significance in ERP recordings. Psychophysiology, 47, 888-904. Katayama J y Polich J. (1998). Stimulus context determines P3a and P3b. Psychophysiology, 35, 23-33. Kelley, R. y Wixted, J.T. (2001). On the nature of associative information in recognition memory. Journal of Experimental Psychology: Learning, Memory, and Cognition, 27(3), 701-722. Kenny, D.A., Kashy, D.A., Mannetti, L., Pierro, A. y Livi, S. (2002). The statistical analysis of data from small groups. Journal of Personality and Social Psychology, 83(1), 126-137. Kinoshita, S. (1995). The word frequency effect in recognition memory versus repetition priming. Memory and Cognition, 23(5), 569-580. Kirk, R.E. (1982). Experimental Design: Procedures for the Behavioral Sciences. Belmont, CA: Brooks/Cole. Kleinbaum, D.G. (1994). Logistic Regression: A Self-Learning Text. New York: Springer-Verlag. Kleinbaum, D.G. y Klein, M. (2010). Logistic Regression: A Self-learning Text (3rd Edition). New York: Springer-Verlag. Kleinbaum, D.G., Kupper, L.L. y Muller, K.E. (1988). Applied Regression Analysis and other Multivariable Methods (2nd Edition). Belmont, CA: Duxbury Press . Referencias A.Wallace 273 Klimesch, W., Doppelmayr, A., Yonelinas, A., et al. (2001). Theta synchronization during episodic retrieval: Neural correlates of conscious awareness. Cognitive Brain Research, 12(1), 33-38. Kline, R.B. (2013). Beyond Significance Testing - Statistics Reform in the Behavioral Sciences (2nd Edition). Washington: APA. Knoke, D. & Burke, P.J. (1980). Log-Linear Models. Newbury Park, CA: Sage Publications. Knoblauch, K. y Maloney, L.T. (2012). Modeling Psychophysical Data in R. New York: Springer-Verlag. Krzanowski, W.J. (1998). An Introduction to Statistical Modelling. London: Arnold. Kuhn, M. y Johnson, K. (2013). Applied Predictive Modeling. New York: SpringerVerlag. Kutas, M. y Federmeier, K.D. (2011). Thirty years and counting: finding meaning in the N400 component of the Event Related Brain Potential (ERP). Annual Review of Psychology, 62, 14.1-14.27. Kutas, M. y Van Petten, C. (1994). Psycholinguistics electrified: Event-Related Potential investigations. En M.A. Gernsbacher (Ed.), Handbook of Psycholinguistics. San Diego, CA: Academic Press. Kutas, M., McCarthy, G. y Donchin, E. (1977). Augmenting mental chronometry: the P300 as a measure of stimulus evaluation time. Science, 197(4305), 792-795. Landis, J.R. y Koch, G.G. (1977). The measurement of observer agreement for categorical data. Biometrics, 33(1), 159-174. Lang, J.B. y Agresti, A. (1994). Simultaneus modelling joint and marginal distributions of multivariate categorical responses. Journal of the American Statistical Association, 89, 625-632. Referencias A.Wallace 274 Lehman, M. y Malmberg, K.J. (2009). A global theory of remembering and forgetting from multiple lists. Journal of Experimental Psychology, 35, 970988. Leuthold, H. y Sommer, W. (1998). Postperceptual effects and P300 latency. Psychophysiology, 35, 34-46. Li, Y. y Baron, J. (2012). Behavioral Research Data Analysis with R. New York: Springer-Verlag. Liao, T.F. (1994). Interpreting Probability Models: Logit, Probit and other Generalized Linear Models. Thousand Oaks, CA: Sage Publications. Lindsey, J.K. (1997). Applying Generalized Linear Models. New York: SpringerVerlag. Lindsey, J.K. (1995). Modelling Frequency and Count Data. Oxford: Clarendon Press. Loftus, G.R. (1978). On interpretation of interactions. Memory & Cognition, 6(3), 312319. Lopez, E. (1998). Tratamiento de la colinealidad en regresión múltiple. Psicothema, 10(2), 491-507. Losilla, J.M., Navarro, J.B., Palmer, A., Rodrigo, M.F. y Ato, M. (2005). Análisis de Datos: Del Contraste de Hipótesis al Modelado Estadístico. Tarrasa: CBS. Luce, R.D. (1959). Individual Choice Behavior. A Theoretical Analysis. New York: J. Wiley & Sons. Luce, R.D. (1986). Response Times: Their Role in Inferring. New York: Oxford University Press Luce, R.D. (1999). Where is mathematical modeling in psychology headed? Theory & Psychology, 9(6), 723-737. Referencias A.Wallace 275 Luck, S.J. (2005). An Introduction to the Event-Related Potential Technique. Cambridge, MA: The MIT Press. Lunneborg, C.E. (1994). Modeling Experimental and Observational Data. Belmont, CA: Duxbury Press. Macmillan, M.A. y Creelman, C.D. (1991). Detection Theory. A User’s Guide. Cambridge. Cambridge University Press. Mahalanobis, P.C. (1936). On the generalized distances in statistics. Proceedings National Institute of Science, 2(1), 49-55. Malapeira, J.M., Honrubia, M.L., Viader, M., et al. (1995). Análisis de los componentes del tiempo de reacción. Anuario de Psicología, 65, 139-151. Mallows, C.L. (1973). Some Comments on CP. Technometrics, 15(4), 661-675. Malmberg, K.J. (2008). Recognition memory: a review of the critical findings and an integrated theory for relating them. Cognitive Psychology, 57, 335-384. Malmberg, K.J. y Murnane, K. (2002). List composition and the word-frequency effect for recognition memory. Journal of Experimental Psychology, 28(4), 616-630. Malmberg, K.J., Steyvers, M., Stephens, J.D. y Shiffrin, R.M. (2002). Feature frequency effects in recognition memory. Memory and Cognition, 30(4), 607613. Mandler, G. (1991). Your face looks familiar but I can’t remember your name: A review of dual process theory. En W. Hockley y E.S. Lewandowsky (Eds.). Relating Theory and Data: Essays on Human Memory in hHonour of Bennet B. Murdock. Hillsdale: Erlbaum. Referencias A.Wallace 276 Mayes, A.R. (1988). Amnesia and memory for contextual information. En G.M. Davies, E. Donald, y M. Thomson (Eds.). Memory in Context: Context in Memory. New York: John Wiley. McCullagh, P. (2002). What is an statistical model? The Annals of Statistics, 30(5), 1225-1310. McCullagh, P. y Nelder, J.A. (1989). Generalized Linear Models (2nd Edition). London: Chapman & Hall. McNicol, D. (1972). A Primer of Signal Detection Theory. London: Allen & Unwin. Mell, D., Bach, M. y Heinrich, S.P. (2008). Fast stimulus sequences improve the efficiency of Event-related Potential P300 recordings. Journal of Neuroscience Methods, 174, 259-264. Menard, S. (2002). Applied Logistic Regression Analysis (2nd Edition). Thousand Oaks, CA: Sage Publications. Mickes, L., Wais, P.E. y Wixted, J.T. (2009 ). Recollection is a continuous: implications for dual-process theories of recognition memory. Psychological Science, 20(4), 509-515. Mickes, L., Wixted, J.T. y Wais, P.E. (2007). A direct test of the unequal-variance Signal Detection Model of recognition memory. Psychonomic Bulletin & Review, 14(5), 858-865. Mosteller, F. (1951). Remarks on the method of paired comparisons: I. the least squares solution assuming equal SD and equal correlations. Psychometrika, 16(1), 3-9. Müller, S. y Welsh, A.H. (2009). Model selection in Generalized Linear Models. Statistica Sinica, 19, 1155-1170. Referencias A.Wallace 277 Münte, T.F., Wieringa, B.M., Weyerts, H, Szentkuti, A, et al. (2001). Differences in brain potentials to open and closed class words: class and frequency effects. Neuropsychologia, 39(1), 91-102. Myung, I.J. (2000). The importance of complexity in model selection. Journal of Mathematical Psychology, 44, 190-204. Nelder, J.A. y Wedderburn, R.W. (1972). Generalized Linear Models. Journal of the Royal Statistical Society, 135(3), 370-384. Nelson, T.O. (1984). A comparison of current measures of accuracy feeling-of-knowing predictions. Psychological Bulletin, 95, 109-133. Norman, K.A., Tepe, K., Nyhus, E. y Curran, T. (2008). Event-Related Potential correlates of interference effects on recognition memory. Psychonomic Bulletin & Review, 15(1), 36-43. Nuñez-Peña, M.I. Corral, M.J. y Escera, C. (2004). Potenciales evocados cerebrales en el contexto de la investigación psicológica: una actualización. Anuario de Psicología, 35(1), 3-21. Nyberg, L., Cabeza, R. y Tulving, E. (1996). PET studies of encoding and retrieval: The HERA model. Psychonomic Bulletin & Review, 3(2), 135-148. Olivares-Carreño, E.I. e Iglesias-Dorado, J. (2008). Potenciales evocados de larga latencia y procesamiento mnésico de caras y palabras. Revista de Neurología, 47(12), 624-630. Oliver, J.C., Rosel, J. y Murray, L. (2000). Análisis de medidas repetidas mediante métodos de máxima verosimilitud. Psicothema, 12(2), 403-407. Pampel, F.C. (2000). Logistic Regression: A Primer. Thousand Oaks, CA: Sage Publications. Referencias A.Wallace 284 Yonelinas, A.P. y Jacoby, L.L. (1994). Dissociations of processes in recognition memory: Effects of interfer-ence and of response speed. Canadian Journal of Experimental Psychology, 48(4), 516-534. Yonelinas, A.P. y Jacoby, L.L. (1996). Noncriterial recollection: Familiarity as automatic, irrelevant recollection. Consciousness and Cognition, 5(1-2), 131141. Yonelinas, A.P., Dobbins, I., Szymanki, M.D., et al. (1996). Signal-Detection, threshold, and dual-process models of recognition memory: ROCs and conscious recollection. Consciousness & Cognition, 5, 418-441. Yonelinas, A.P., Kroll, N.E., Dobbins, I.G. & Soltani, M. (1999). Recognition memory of faces: When familiarity supports associative recognition judgments. Psychonomic Bulletin & Review, 6(4), 654-661. Yonelinas, A.P., Otten, L.J., Shaw, K.N. & Rugg, M.D. (2005). Separating the brain regions involved in recollection and familiarity in recognition memory. The Journal of Neuroscience, 5(11), 3002-3008. Zani, A. y Proverbio, A. (2002). The Cognitive Electrophysiology of Mind and Brain. Amsterdam: Academic Press. Zucchini, W. (2000). An introduction to model selection. Journal of Mathematical Psychology, 44, 41-61. An bhail an tsolais a bheith ar an solas a-gan agus solas taobh istigh. Bealtaine an Shine solas na gréine beannaithe ar tú, agus te do chroí till glows sé cosúil le tine móna mór