scieee AI-readable full text Open interactive document viewer

El sesgo condicionado en el análisis de influencia: Una revisión

Muñoz Pichardo, Juan Manuel; Moreno Rebollo, Juan Luis; Gómez Gómez, T.; Enguix González, Alicia

Abstract

El sesgo condicionado se ha propuesto como diagn ´ostico de influencia en distintos modelos y t´ecnicas estad´ısticas. Tratando de recoger una visi ´on global de la utilidad del concepto, en este trabajo se hace una revisi ´on general del mismo relacion ´andolo con la curva de sensibilidad y la curva de influencia muestral. Adem ´as, se se˜nalan posibles l´ıneas de trabajo que permitir´an abordar el an ´alisis de la influencia a trav´es de este enfoque en una gran variedad de t ´ecnicas estad´ısticas.

Full text

Q¨ UESTII´ O,vol. 25, 2, p. 263-284, 2001 EL SESGO CONDICIONADO EN EL AN ´ ALISIS DE INFLUENCIA: UNA REVISI ´ ON J. M. MU ˜ NOZ-PICHARDO J. L. MORENO-REBOLLO T. G ´ OMEZ-G ´ OMEZ A. ENGUIX-GONZ´ ALEZ Universidad de Sevilla  El sesgo condicionado se ha propuesto como diagn ´ ostico de influencia en distintos modelos y t´ ecnicas estad´ ısticas. Tratando de recoger una visi´ on global de la utilidad del concepto, en este trabajo se hace una revisi ´ on general del mismo relacion´ andolo con la curva de sensibilidad y la curva de influencia muestral. Adem´ as, se se˜ nalan posibles l´ ıneas de trabajo que permitir´ an abordar el an´ alisis de la influencia a trav´ es de este enfoque en una gran variedad de t´ ecnicas estad´ ısticas. Conditional bias in influence analysis: a review Palabras clave: An´alisis de influencia, modelos lineales, componentes principales, muestreo en poblaciones finitas, sesgo condicionado Clasificaci´ on AMS (MSC 2000): 62J20, 62H25, 62D05 *Universidad de Sevilla. Facultad de Matem´aticas. Departamento de Estad´ıstica e Investigaci´on Operativa. Avda. Reina Mercedes s/n. 41012 Sevilla. –Recibido en octubre de 2000. –Aceptado en abril de 2001. 263 1. INTRODUCCI ´ ON El objetivo de todo an´alisis estad´ıstico es obtener conclusiones fiables a partir de los datos resultantes de una experimentaci´on. Por tanto, la fiabilidad de las observaciones del proceso es de especial inter´es, ya que el an´alisis se realiza sobre codificaciones del fen´omeno natural en estudio y las t´ecnicas estad´ısticas que se apliquen pueden verse fuertemente afectadas por algunas de las observaciones realizadas. Este problema ha originado un gran n´umero de m´etodos enfocados, bien al desarrollo de nuevas t´ecnicas que no se vean influenciadas excesivamente por la modelizaci´on del fen´omeno natural, bien al an´alisis de la calidad de los datos, o bien al estudio de aquellas observaciones que afectan considerablemente a los resultados del an´alisis. En este tercer enfoque se han propuesto un conjunto de m´etodos englobados en lo que gen´ericamente se conoce como el An´ alisis de Influencia. La gran mayor´ıa de las t´ecnicas propuestas para el an´alisis de influencia est´an basadas enla aproximaci´ongen´ericarealizadaporCookyWeisberg(1982): para medirelefecto que sobre un aspecto de inter´es del an´alisis (estad´ıstico, estimaci´on,...) tiene una observaci´on o un conjunto de ellas, se introducen peque˜nas perturbaciones, que las afectan de alguna manera, y se cuantifica el cambio producido. Es decir, las t´ecnicas surgen de conjugar adecuadamente perturbaci´ on del modelo y comparaci´ on de resultados. Cook (1987) trata de unificar el problema bajo la siguiente formulaci´on general: Sea un conjunto de datos D, un modelo Mpostulado a priori, un resultado R  D  M  seleccionado de una s´ıntesis de los datos y el modelo, y sea wun vector de perturbaciones, perteneciente a un conjunto Ωde perturbaciones relevantes, siendo M  w  el modelo perturbado, de forma que  w0  Ω Æ M  M  w0  . As´ı, el An´alisis deInfluenciaconsisteencompararlosresultados R  D  M  w  yR  D  M  . En consecuencia, son cuestiones claves la elecci´on del esquema de perturbaci´on y el m´etodo de comparaci´on. De cada forma distinta de conjugar el binomio perturbaci ´ oncomparaci´ on resultar´a una t´ecnica para el an´alisis de influencia. En cuanto al primer elemento del binomio, el m´as utilizado es el esquema de perturbaci´on de la omisi´on de las observaciones a las que se le pretende evaluar su impacto. No obstante, la anterior formulaci´on general del problema permite otros enfoques. Diversos autores, como Lawrance (1991) y Escobar y Meeker (1992), han propuesto clasificaciones de los distintos tipos de perturbaciones: perturbaciones en los datos, perturbaciones en las hip´ otesis del modelo, perturbaciones en ponderacionesde casos. 264 Este ´ultimo esquema es utilizado en el denominado An´alisis de Influencia Local (Cook (1986)). Una vez seleccionado el esquema de perturbaci´on, es necesario elegir el estad´ıstico o resultado R  D  M  del an´alisis y el m´etodo de comparaci´on de resultados. La primera cuesti´on queda a criterio del investigador,en funci´on del objetivo principal del an´alisis. Como ilustraci´on de la gran variedad de m´etodos de comparaci´on propuestos, pueden citarse los siguientes: Curva de influencia muestral (Cook y Weisberg (1982), Belsley y otros (1980)); Raz´ on de vol´ umenes de regiones de confianza, cuando el resultado R  D  M  seleccionado es una regi´on de confianza (Andrews y Pregibon (1978)); Raz ´ on entre determinantes,para la estimaci´on de matrices de varianzas y covarianzas (Barnett y Lewis (1994), Belsley y otros (1980)); Distancias entre las distribuciones muestrales de los estimadores, como la distancia de Rao (Mu˜noz-Pichardo y Fern´andez-Ponce (1997)); Desplazamiento de verosimilitud, como m´etodo de comparaci´onrespecto a los contornosde la log-verosimilituddel modelopostulado (Cooky Weisberg (1982),Cook y otros (1988)), o bien del modelo perturbado (Billor y Loynes (1993)). Brown y Lawrance (2000), a trav´es de la verosimilitud, estudian este t´opico en regresi´on m´ultiple sobre una amplia gama de esquemas de perturbaci´on, extendiendo el estudio de la influencia a diferentes tests de hip´otesis de inter´es en este modelo. Mu˜noz-Pichardo y otros (1995) proponen el concepto de sesgo condicionado como enfoquegen´erico, v´alidoen ungrann´umero delas t´ecnicas y modelosestad´ısticos. Tras la introducci´on anterior sobre el problema de la influencia, en este trabajo se pretende realizarunarevisi´ondelasdistintasaplicacionesdel sesgocondicionado(s.c.), as´ı como su relaci´on con otros conceptos estad´ısticos. En la Secci´on 2, se recoge la relaci´on con la curva de influencia muestral y la curva de sensibilidad. En la Secci´on 3, se recoge la aplicaci´on del mismo a los modelos lineales, aport´andose una estimaci´on de la varianza del estimador del sesgo condicionado. A continuaci´on, se aplica al an´alisis de componentes principales (Secci´on4)yenel muestreo en poblaciones finitas (Secci´on 5). Finalmente, se concluye se˜nalando otros campos en los que se puede abordar el an´alisis de influencia bajo la perspectiva del concepto de s.c.. 2. EL CONCEPTO DE SESGO CONDICIONADO Y EL AN ´ ALISIS DE INFLUENCIA Partiendo del Lema de Descomposici´on de Efron y Stein (1984), que expresa un estad´ıstico Tsobre una muestra aleatoria simple como una suma finita, cuyos t´erminos son funcionesdelas esperanzascondicionadasde Tdadaslas observacionesmuestrales, Mu˜noz-Pichardo y otros (1995) definen el concepto de sesgo condicionado y proponen su aplicaci´on en el An´alisis de Influencia. A continuaci´on, se recoge el lema citado, 265 la definici´on del concepto de sesgo condicionado y la justificaci´on de su aplicaci´on al problema de la influencia. Lema 1. (Efron y Stein).Toda variable aleatoria S  X1  X2  Xn  funci´ on de n variables aleatorias independientes X1  X2  Xnpuede expresarse como S  X1  Xn   E  S  n ∑ i  1Ai  Xi;S  ∑∑ 1  i  j  nBij  Xi  Xj;S   ∑∑∑ 1  i  j  k  n Cijk  Xi  Xj  Xk;S    H  X1  Xn;S   donde las 2n  1variables aleatorias del miembro derecho de la expresi´ on tienen esperanza nula y est´ an mutuamente incorreladas, siendo: Ai  xi;S   E  S  Xi  xi   E  S   «i-´esimo efecto medio», Bij  xi  xj;S   E  S   Xi  xi  Xj  xj   E  S  Xi  xi    E  S   Xj  xj  E  S   «  i  j  -interacci´on de 2oorden», yas ´ ı sucesivamente. Dadounestad´ıstico Tn  Tn  Y1  Yn  definidosobreunamuestraaleatoria,Y1  Yn,ysu descomposici´on en t´erminos del resultado anterior, se observa que Ai  yi;Tn  cuantifica la desviaci´on que la realizaci´on muestral Yi  yiprovoca en el valor esperado de Tn. Por tanto, puede considerarse como una medida de la influencia que dicha realizaci´on muestral ejerce sobre Tn.As´ı, Mu˜noz-Pichardo y otros (1995) proponen la siguiente definici´on: Definici´ on 1. Sea Y1  Ynuna m.a. de una v.a. Y, sea Tn  Tn  Y1  Yn  un estad´ ıstico y sea y1  ynuna realizaci´ on de la muestra. El sesgo condicionado (s.c.) de Tndada la i-´ esima observaci´ on se define como   yi;Tn  E  Tn  Yi  yi   E  Tn  . Sobre esta definici´on se pueden realizar diversas consideraciones. En primer lugar, el s.c. depende de la distribuci´on del estad´ıstico Tny del valor observado yi. Por tanto, al contrario de la curva de influencia muestral, que se define a partir de una realizaci´on de toda la muestra, el s.c. mide la influencia del valor observado sobre el estad´ıstico, en t´erminos de la esperanza de su distribuci´on muestral, y por tanto, es independiente de cualquier realizaci´on muestral concreta de los restantes elementos de la muestra. Por otra parte, no presupone ning´un esquema de perturbaci´on, salvo el condicionamiento 266 previo impuesto por el conocimiento de la observaci´on bajo estudio. Adem´as, es un par´ametrocuyadimensi´on coincideconla dimensi´on delestad´ıstico, al igual que ocurre con la curva de influencia muestral, por tanto, para cuantificarlo se ha de proceder a utilizar normas semejantes a las aplicadas sobre ´esta. Finalmente, su dependencia de la distribuci´on de Tn, puede provocar que el desconocimiento de algunos par´ametros de la misma implique la necesidad de su estimaci´on. La definici´on 1 puede generalizarse como sigue: Definici´ on 2. En las condiciones de la definici´ on 1, el s.c. de Tndado el conjunto de observaciones  yi1  yim  se define como (1)   yi1  yim;Tn  E  Tn  Yi1  yi1  Yim  yim   E  Tn  . En consecuencia,  1  puede considerarse como una medida de la influencia conjunta de las observaciones  yi1  yim  sobre Tn. De las dos definiciones anteriores se obtienen las siguientes expresiones: Bij  yi  yj;Tn     yi  yj;Tn      yi;Tn    yj;Tn    (2) Cijk  yi  yj  yk;Tn     yi  yj  yk;Tn       yi  yj;Tn    yi  yk;Tn    yj  yk;Tn        yi;Tn    yj;Tn    yk;Tn    (3) Por tanto, el efecto interacci´on de segundo orden debido a las observaciones  yi  yj  , seg´un (2),es la influenciaconjuntadeambasobservacionessobre Tnmenosla influencia individual de cada una de ellas. An´alogo comentario se puede realizar observando la expresi´on (3). Otras propiedades del s.c. son las relaciones con los conceptos de curva de sensibilidad y curva de influencia muestral. Hampel (1974), con el objetivo de estudiar la conducta infinitesimal de funcionales estad´ısticos, propone el concepto de funci´on influencia sobre un funcional definido sobre el espacio de las distribuciones de probabilidad. A partir de dicha definici´on se han propuesto diversas versiones muestrales. Una de las de mayor inter´es es la curva de sensibilidad, propuesta por Tukey (1970): dada Y1  Yn  1 una muestra aleatoria de una v.a.Y, la curva de sensibilidad (CS)deTnasociada a una realizaci´on muestral y1  yn  1se define como: CSn  1  y;Tn  n  Tn  y1  yn  1  y   Tn  1  y1  yn  1    Cuando el objetivo es el estudio de la influencia de observaciones individuales sobre alg´un estad´ıstico, se propone otra versi´on muestral, la curva de influencia muestral 267 (CIM): dada Y1  Ynuna muestra aleatoria de una v.a.Y,yTnun estad´ıstico definido sobre la muestra, la curva de influencia muestral de un estad´ıstico Tnasociada a la i-´esima observaci´on de una realizaci´on muestral y1  yn  viene dada por CIMi  Tn    n  1   T  i   Tn  y1  yn    siendo T  i   Tn  1  y1  yi  1  yi  1  yn  el estad´ıstico obtenido bajo la omisi´on de la i-´esima observaci´on. Generalizando la definici´on anterior, se define la curva de influencia muestral de Tn asociada a un conjunto de mobservaciones Bcomo sigue: CIMB  Tn    n  m   T  B   Tn  y1  yn    siendo T  B  el estad´ıstico obtenido bajo la omisi´on de las observaciones contenidas en B. Lacurvade sensibilidadpuedeconsiderarsecomofunci´onaleatoria,asociadaalamuestraY1  Yi  1Yi  1  Yn: CSn  1  y;Tn  n  Tn  Y1  Yi  1  y  Yi  1  Yn   Tn  1  Y1  Yi  1Yi  1  Yn    Asimismo, la curva de influencia muestral puede considerarse como funci´on aleatoria, asociada a la muestra Y1  Yn: CIMi  Tn    n  1   Tn  1  Y1  Yi  1Yi  1  Yn   Tn  Y1  Yn    Bajo estas consideraciones, se pueden enunciar los siguientes resultados: Teorema 1. Sea Y1  Ynuna muestra aleatoria, sea Tn  Tn  Y1  Yn  un estad´ ıstico y T  i   Tn  1  Y1  Yi  1Yi  1  Yn  , y sup´ ongase que E  Tn  E  T  i   . 1. La curva de sensibilidad, asociada a la muestra Y1  Yi  1Yi  1  Yn  verifica (4) 1 nE  CSn  1  yi;Tn     yi;Tn   2. La curva de influencia muestral, asociada a la muestra Y1  Yn, verifica (5) 1 n  1E  CIMi  Tn   Yi  yi    yi;Tn   La igualdad (4), adem´as de la relaci´on entre los dos conceptos, viene a profundizar en el inter´es del s.c. como herramienta ´util para el an´alisis de influencia, y la igualdad (5) 268 puede para fundamentarte´oricamente el conceptode curvade influencia muestral como esquema de comparaci´on v´alido para el an´alisis de influencia. Por ello, Mu˜noz-Pichardo y otros (1995) proponenel siguiente estimador insesgado del s.c.    yi;T  Tn  Y1  Yi  1  yi  Yi  1  Yn   Tn  1  Y1  Yi  1Yi  1  Yn  Tn  T  i   y en general,    yi1  yim;Tn  Tn  T  i1  im   que puede denominarse sesgo condicionado estimado (s.c.e.). Conviene hacer notar que en muchas ocasiones para el c´alculo del s.c. y su estimador no es necesario conocer la distribuci´on subyacente al modelo, algo que le ocurre a otras t´ecnicas de diagn´ostico de influencia como el desplazamiento de verosimilitud o la distancia de Rao. Mu˜noz-Pichardoy otros (1998)aplican esteconceptoal An´alisis de InfluenciaLocal, en particularenel ModeloLineal General. Un planteamientogen´ericodedichaaplicaci´on, siguiendolas pautas marcadasporCook ensudescripci´on delproblema dela influencia, puede ser el siguiente: Sea un modelo Mpostulado a priori, sea Y1  Ynuna muestra aleatoria de la(s) variable(s) que intervienen en el mismo, sea un estad´ıstico Tn  Y1  Yn;M  ,wun vector perteneciente a un conjunto Ωde perturbaciones relevantes, siendo M  w  el modelo perturbado, de forma que  w0  Ω Æ M  M  w0  yTn  Y1  Yn;M   Tn  Y1  Yn;M  w0   y sea yiuna realizaci´on muestral de la i-´esima componente de la muestra aleatoria. El estudio de la funci´on de w  Ω:  w  yi;Tn  EM  w   Tn  Yi  yi   EM  w   Tn   en un entorno de w0permitir´a realizar el an´alisis de influencia local que la realizaci´on muestral Yi  yiejerce sobre Tn, siendo EM  w     la esperanza en el modelo perturbado M  w  . Para este planteamiento general, son v´alidas las consideraciones realizadas anteriormente sobre el concepto de s.c.. En particular, en ocasiones se tendr´a que buscar un estimador, pudi´endose considerar el estimador insesgado:   w  yi;Tn  Tn  Y1  Yi  1  yi  Yi  1  Yn;M  w   Tn  1  Y1  Yi  1Yi  1  Yn;M  w   Para ilustrar la utilidad de lo expresado hasta ahora, a continuaci´on, se recoge una aplicaci´on simple: el s.c. y diagn´osticos de influencia sobre el estad´ıstico media muestral. 269 2.1. Una aplicaci´ on ilustrativa: estad´ıstico media muestral Sea Y1  Ynuna muestra aleatoria de una v.a. Y, con E  Y  µyVar  Y  σ2,y consideremos el estimador BLUE de µ  el estad´ıstico media muestral Tn  Y. Puede obtenerse f´acilmente el s.c. de dicho estad´ıstico dada la i-´esima realizaci´on muestral yi:   yi;Y   1 n  yi  µ   Portanto,comol´ogicamentese pod´ıaintuir,la influenciade unaobservaci´onser´a mayor cuanto m´as diste de la media poblacional. An´alogamente,   yi1  yim;Y   1 n m ∑ j  1  yij  µ   En ambas expresiones se observa su dependencia del par´ametro µ, por lo que es necesario obtener las correspondientes estimaciones: (6)    yi;Y   1 n  1  yi  Y  y (7)    yi1  yim;Y   1 n  m m ∑ j  1  yij  Y   respectivamente. Para evitar el problema del signo, a efectos pr´acticos, como medidas de influencia pueden considerarse los cuadrados de las expresiones (6) y (7): S2 i   yi  Y n  1  2  S2 i1  im   1 n  m m ∑ j  1  yij  Y   2  Con el objetivo de estudiar la influencia local sobre el BLUE de µ  se puede considerar el modelo perturbado determinado por: E  Yk   µ   k Var  Yk   σ2   k   i;Var  Yi  σ2  w  w  0  (8) El BLUE de µen el modelo especificado en (8) viene dado por: Yw  1 n  1  w∑ k   i Yk  w n  1  wYi  y por tanto,   i  w  yi;Yw   w n  1  w  yi  µ  nw n  1  w   yi;Y   270 (El super´ındice  i  se utiliza para indicar que s´olo la i-´esima observaci´on es perturbada). Se puede observar que el s.c. en el modelo perturbado es proporcional al s.c. en el modelo postulado, siendo la raz´on de proporcionalidad: α  w  nw n  1  w  En cuanto al estimador del s.c., se obtiene: (9)    i  w  yi;Yw   1 n  1 nw n  1  w  yi  Y   nw n  1  w    yi;Y   Considerando nuevamente su cuadrado para evitar el signo, se puede utilizar con medida de influencia local la funci´on de w: S2 i  w  S2 i  α  w   2  La siguiente igualdad redunda en la relevancia de la raz´on de proporcionalidad α  w  : (10)    i  w  yj;Yw   α  w     yj;Y   1  α  w     yj;Y  i    j  1  n  Para w   0  1  , dicha raz´on verifica 0  α  w   1, y en consecuencia,    i  w  yj;Yw  es combinaci´on lineal convexa entre    yj;Y  y    yj;Y  i   , donde los coeficientes no dependen de las observaciones i-´esima ni j-´esima, tan s´olo del tama˜no muestral y del factor de perturbaci´on considerado. Dado el papel relevante que juega esta raz´on de proporcionalidad, Mu˜noz-Pichardo y otros (1998) la denominan potencial de influencia local de la i-observaci ´ on, interpret´andola como la proporci´on de influencia de cualquier observaci´on sobre el BLUE de µen el modelo perturbado (8), explicada por la influencia que ejerce dicha observaci´on sobre el BLUE de µen el modelo postulado. 3. SESGO CONDICIONADO EN EL MODELO LINEAL GENERAL MULTIVARIANTE En esta secci´on estudiamos el s.c. sobre el Modelo Lineal General Multivariante (MLGM), con objeto de tratar de forma unificada el an´alisis de influencia en los diversos modelos que se obtienen como casos particulares de ´el: Modelos de Regresi´on (m´ultiple y multivariante), Modelos de An´alisis de la Varianza (univariante y multivariante), Modelos de An´alisis de la Covarianza (univariantey multivariante), An´alisis de Perfiles, An´alisis de Medidas Repetidas, etc. 271 En particular,si se considera el estimador de Horvitz-Thompson,  THT  ∑sYi πi  del total poblacional de la caracter´ıstica Y,T  Y  ∑N i  1Yi  se obtiene que S  Ii  1;  THT  Yi1  πi πi  ∑ j   i Yj∆ij πiπj  donde πj  Pr  Ij  1  ,j  1  N  representan las probabilidades de inclusi´on de primer orden asociadas al dise˜no muestral    p     y∆ij  Cov  Ii  Ij  ,i  j  1  N  Dado que el s.c. es un par´ametro poblacional desconocido, se propone como estimador del mismo el estimador de Horvitz-Thompson sobre el dise˜no muestral restringido sobre las muestras que contienen a ui:  SHT  Ii  1;  THT  Yi1  πi πi  ∑ j   i Yj∆ij πijπjIi  donde πij  Pr  Ii  1  Ij  1  , son las probabilidades de inclusi´on de segundo orden en el dise˜no muestral. Un estimador insesgado de la varianza de  SHT  Ii  1;  THT  en el dise˜no restringido viene dado por:  Var   SHT  Ii  1;  THT    ∑ j   i∑ h   i YjYh∆ij ∆ih πiπjπh  πi πij πih  1 πijh  IjIh  dondeπijh  Pr  Ii  1  Ij  1  Ih  1  , son lasprobabilidadesde inclusi´on detercer orden en    p     . Es evidente que tanto el s.c., como el s.c.e. y el estimador de su varianza dependen del dise˜no muestral    p     , por lo que la influencia de cada unidad muestral seleccionada es funci´on del comportamiento de dicha unidad respecto a la caracter´ıstica bajo estudio y del dise˜no muestral elegido por el investigador. La aplicaci´on a cada tipo de dise˜no es directa, sin m´as que determinar los par´ametros dependientes del mismo (probabilidades y covarianzas de las variables aleatorias indicadores), aunque en ocasiones pueda resultar compleja. No obstante, frente a la posible complejidad, el concepto de s.c. posee la caracter´ıstica de su generalidad. El planteamiento arriba recogido puede utilizarse en un amplio espectro del muestreo en poblaciones finitas, quedando abiertas un n´umero considerable de l´ıneas de investigaci´on y desarrollo. 6. CONCLUSI ´ ON Este trabajo recoge una revisi´on del concepto de s.c. y su aplicaci´on al an´alisis de influencia en diversas t´ecnicas estad´ısticas. Su definici´on gen´erica, su f´acil interpretaci´onysuc´alculo no excesivamente complejo le permite tener un extenso campo de 278 aplicaci´on y un amplio abanico de posibilidades en el an´alisis de influencia y an´alisis de influencia local de cualquier estad´ıstico en cualquier modelo. Muestra de tales afirmaciones son los resultados anteriormente recogidos y los trabajos de Jim´enez (1994) y Jim´enez y otros (1995) en el ´area de las t´ecnicas de remuestreo, en particular en el bootstrap, para detectar muestras bootstrap con un efecto considerable sobre los resultados de las estimaciones. Las medidas de diagn´ostico de influencia propuestas pueden generalizarse f´acilmente al an´alisis de influencia conjunto de dos o m´as observaciones. Algunos resultados sobre tal aspecto est´an recogidos en los trabajos citados anteriormente. Profundizando por la l´ınea de los modelos lineales se puede abordar la influencia en los modelos lineales generalizados (univariantes y multivariantes), an´alisis de supervivencia, etc. En la l´ınea del ACP, pueden obtenerse resultados de inter´es en An´alisis Discriminante, An´alisis Factorial, An´alisis Can´onico, etc. Finalmente, en el ´area del muestreo en poblaciones finitas, como se recoge en el apartado anterior, queda un amplio campo abierto para seguir desarrollandot´ecnicas de diagn´ostico de influencia, m´as a´un cuando en este ´area la problem´atica de la influencia no ha sido, hasta ahora, tratada en profundidad. REFERENCIAS Andrews, D. F. y Pregibon, D. (1978). «Finding outliers that matter».J. Royal Statistics Soc., Ser. B, 40, 85-93. Atkinson, A. C. (1981). «Two graphical displays for outliying and influential observations in regression».Biometrika, 68, 13-20. Barnett, V. y Lewis, T. (1994). Outliers in Statistical Data. John Wiley and Sons. Barret, B. E. y Ling, R. F. (1992). «General classes of influence measures for multivariate regression».J.A.S.A., (7), 184-191. Belsley, D. A., Kuh, E. y Welsch, R. E. (1980). Regresion diagnostics: Identifying influential data and sources of collinearity. John Wiley and Sons. Billor, N. y Loynes, R. M. (1993). «Local influence: a new approach».Commun. Statist. Theory and Methods, 22(6), 1595-1611. Brown, G. C. y Lawrance, A. J. (2000). «Theory and illustration of regression influence diagnostics».Commun. Statist. Theory and Methods, 29 (9 & 10), 2079-2107. Cook, R. D. y Weisberg, S. (1982). Residuals and influence in regresion, Chapman and Hall. (1986). «AssessmentofLocalInfluence(withdiscussion)».J. RoyalStatistics Soc., Ser. B, 48, 133-169. (1987). «Influence assessment».Journal of Applied Statistics, 14, 2, 117-132. 279 Cook, D., Pe˜na, D. y Weisberg, S. (1988). «The likelihood displacement: a unifying principle for influence measures».Commun. Statist.-Theory and Methods, 17 (3), 623-640. Critchley, F. (1985). «Influence in Principals Components Analysis».Biometrika, 43, 128-136. Efron, B. y Stein, C. (1984). «The jackknife estimate of variance».Ann. Statist., 9 (3), 586-596. Enguix-Gonz´alez,A., Moreno-Rebollo, J. L., Jim´enez-Gamero,M. D. y Mu˜noz-Pichardo, J. M. (2000). «Estudio de influencia en componentes principales a trav´es del sesgocondicionado».Actas XXV Congreso Nac. de Estad´ ıstica e Investigaci´ onOperativa, (Vigo, Espa˜na). Escobar, L.A.y Meeker, W.Q. (1992). «Assessinginfluencein regressionanalysiswith censored data».Biometrics, 48, 507-528. Hampel, F. R. (1974). «The influence curve and its role in robust estimation».J. Am. Statist. Assoc., 69, 383-393. Hossain, A. y Naik, D. N. (1989). «Detectionofinfluentialobservationsinmultivariate regression».Journal of Applied Statistics, 16, 25-37. Jim´enez Gamero, M. D. (1994). An´ alisis de las muestras generadas en el proceso de simulaci´ on bootstrap. Tesis Doctoral. Universidad de Sevilla. Jim´enez Gamero, M. D., Mu˜noz Pichardo, J. M. y Mu˜noz Reyes, A. (1995). «Medida de influencia en las estimaciones bootstrap».Actas del XXII Congreso Nac. de Estad´ ıstica e I.O., (Sevilla). Lawrance, A. J. (1991). «Local and deletion influence».EnDirections in robust statistics and diagnostics, W. Stahel y S. Weisberg (eds.). Springer-Verlag. Moreno-Rebollo, J. L., Enguix-Gonz´alez, A., Mu˜noz-Pichardo, J. M. y Alba, M. V. (2000). «Influencia Local en el Modelo Lineal General Multivariante».Actas XXV Congreso Nac. de Estad´ ıstica e Investigaci´ on Operativa, (Vigo, Espa˜na). Moreno Rebollo, J.L., Mu˜noz Reyes, A.M.y Mu˜noz Pichardo, J.M.(1999). «Influence diagnostic in survey sampling: conditional bias».Biometrika, 86, (4), 923-928. Mu˜noz Pichardo, J. M. y Fern´andez Ponce, J. M. (1997). «Distancias de Mahalanobis y Rao: Influencia en el Modelo Lineal General».Actas IV International Meeting of Multidimensional Data analysis, (Bilbao, Spain), 259-262. Mu˜noz Pichardo, J. M., Mu˜noz Garc´ıa, J., Fern´andez Ponce, J. M. y Jim´enez Gamero, M. D. (2000). «Influence analysis in multivariatelinear general models».Commun. Statist.-Theory and Methods, 29 (aceptado para publicaci´on). Mu˜noz Pichardo, J. M., Mu˜noz Garc´ıa, J., Fern´andez Ponce, J. M. y L´opez Bl´azquez, F. (1998). «Local Influence on the General LinearModel».Sankhy˜a, Ser. B, 60 (3). Mu˜noz Pichardo, J.M., Mu˜noz Garc´ıa, J., Moreno Rebollo, J. y PinoMej´ıas, R.(1995). «A new approach to influence analysis in linear models».Sankhy˜a, Ser. A, 57 (3). 393-409. Tukey, J. W. (1970). Exploratory Data Analysis, (1970/71: edici´on preliminar). Reading Mass. Addison-Wesley. 280 ENGLISH SUMMARY CONDITIONAL BIAS IN INFLUENCE ANALYSIS: A REVIEW J. M. MU ˜ NOZ-PICHARDO J. L. MORENO-REBOLLO T. G ´ OMEZ-G ´ OMEZ A. ENGUIX-GONZ´ ALEZ Universidad de Sevilla  Conditional bias has been proposed as an influence diagnostic on different models and statistical techniques. In this paper, we sum up these applications and we relate it to the sensitivity curve and the sample influential curve. Moreover, we point out some areas in which the Influence Analysis could be studied through this approach. Keywords: Influence analysis, linear models, principal components, survey sampling, conditional bias AMS Classification (MSC 2000): 62J20, 62H25, 62D05 *Universidad de Sevilla. Facultad de Matem´aticas. Departamento de Estad´ıstica e Investigaci´on Operativa. Avda. Reina Mercedes s/n. 41012 Sevilla. –Received October 2000. –Accepted April 2001. 281 From the Decomposition Lemma of Efron and Stein (1984), Mu˜noz - Pichardo et al. (1995) proposed the conditional bias (c.b.) as a general approach in Influence Analysis. In this paper, we gather together some applications of this concept in several models and statistical techniques. Definition1. LetY1  Ynbe a random sampleof a randomvariableY, let Tn  Tn  Y1  Yn  be a statistic and let y1  ynbe a sample realization. The c.b. of Tngiven yiis defined as   yi;Tn  E  Tn  Yi  yi   E  Tn  . From Definition 1, we note that the c.b. depends on the distribution of Tnand on the observed value yi, and it assesses the influence of yion Tnin terms of its expected value. Therefore, it not depends on y2  yn  The perturbation considered it is due to the knowledge of the observation under study, yi  Moreover, if Tnis q-dimensional (q  1), then a norm must be used in orderto define an influence measurefrom   yi;Tn  . Finally, we note that, in general,   yi;Tn  depends on unknown parameters, so it must be estimated. In Section 2 we relate the c.b. to the expected value of the sensitivity curve (Tukey, 1970), and the sample influence curve. From these relations, Mu˜noz-Pichardo et al. (1995) proposed    yi;T  Tn  Y1  Yi  1  yi  Yi  1  Yn   Tn  1  Y1  Yi  1Yi  1  Yn  Tn  T  i   as estimator of   yi;T   Following the guidelines laid down by Cook (1987), Mu˜noz-Pichardo et al. (1998) apply the c.b. in Local Influence Analysis through the study of the function  w  yi;Tn  EM  w   Tn  Yi  yi   EM  w   Tn   being M  w  a perturbation of the postulated model M. As an illustration, in section 2.1 we obtain the c.b. and some influence measures on the sample mean. Also, we study the local influence on the sample mean of a random sample. In section 3, we study the c.b. in the Multivariate General Linear Model (MGLM), in order to handle in an unified way the influence analysis on the models that are obtained as particular cases of it. Given the MGLM, that is defined by the matrix identity Y  XB   , with the usual hypotheses, and a linear estimable function (l.e.) Λ Λ ΛB, it is obtained that (Mu˜noz-Pichardo et al., 2000) 282   yi;Λ Λ Λ  B  Λ Λ ΛS  xi  y  i  x  iB      yi;Λ Λ Λ  B  1 1  viiΛ Λ ΛS  xie  i  being  Ba least squares estimator of B,x  iand y  ithe i-th rows of Xand Y, respectively, S  X  X,S  an inverse generalized of S,e  ithe i-th row of the matrix of ordinary residuals, and vii the i-diagonal element of the hat matrix V  X  S  X. In order to assess the influence of yion the BLUE, Λ Λ Λ  B  we apply matrix norms, obtaining various influence diagnostics. The application of these diagnostics in the Multiple Regression Model, make possible to obtain, as particular cases, some of the influence measures defined in the literature. Moreover, we study the Local Influence Analysis in this model. In section 4, we study the influence analysis in Principal Components, under hypothesis of normality. The c.b. of  λk,  αk  k  1  p, the eigenvalues and eigenvectors of the sample covariance matrix are given by (Enguix-Gonz´alez et al., 2000) , S  xi   λk  1 n  1I  xi  λk  O  n  2  and S  xi   αk  1 n  1I  xi  αk  O  n  2   being x1  xnthe sample realization and I  x  λk  ,I  x  αk  the influence functions of λk and αk  the population eigenvalues and eigenvectors, I  x  λk   α  k  x  µ   2  λkand I  x  αk   α  k  x  µ  ∑ j   k α  j  x  µ  λj  λkαj  From  S  xi   λk  and  S  xi   αk  several influence measure on  λkand  αkare proposed. Finally, in section 5, we show that the c.b. can be applied in sampling from a finite population, when the inference is design-based. Moreno-Rebollo et al. (1999) adjust the definition of c.b. in order to obtain an influence measure in survey sampling. Let U   u1  uN  be a finite populationand    p     a samplingdesign defined onU, let πi  i  1  N  be the first order inclusion probabilities. Let Ybe a characteristic of the population,Y   Y1  YN  ,θ  θ  Y  the parameter of interest and  θ   θ  s  an estimator of θ, for s   . Definition 3. The conditional bias of  θ  caused by the presence of uiin the sample s  is definedby S  Ii  1;  θ  E   θ  Ii  1   E   θ   being Ii  s  1if ui  s  Ii  s  0otherwise. Particularly, if the Horvitz-Thompson (HT) estimator,  THT  ∑sYi πi  is considered, it is obtained that S  Ii  1;  THT  Yi1  πi πi  ∑ j   i Yj∆ij πiπj  283 being ∆ij  Cov  Ii  Ij  ,i  j  1  N  on    p      Moreno-Rebollo et al. (1999) proposed to estimate S  Ii  1;  THT  by the HT-estimator based on the restricted sampling design, on the samples containing ui,  SHT  Ii  1;  THT  Yi1  πi πi  ∑ j   i Yj∆ij πijπjIj  We note that both the c.b. and its estimation depend on the sampling design, that is a distinctive feature of the influence measures in sample survey. 284