Full text
Fundamentos de Estadística A Calabia, Universidad de Alcala. (DOI: https://doi.org/10.5281/zenodo.17515850) 3 de noviembre de 2025 Índice 1. Estadística Descriptiva 4 1.1. Conceptosbásicos.................................. 4 1.2. Organizacióndedatos ............................... 4 1.3. Medidasestadísticas ................................ 6 1.3.1. Medidas de posición: . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6 1.3.2. Medidas de dispersión: . . . . . . . . . . . . . . . . . . . . . . . . . . . 7 1.3.3. Medidasdeforma: ............................. 7 1.4. Análisisexploratorio ................................ 8 2. Probabilidad 9 2.1. Fundamentos .................................... 9 2.2. Combinatoria .................................... 14 2.2.1. Permutaciones (sin repetición) . . . . . . . . . . . . . . . . . . . . . . . 15 2.2.2. Permutaciones con repetición . . . . . . . . . . . . . . . . . . . . . . . 15 2.2.3. Variaciones sin repetición . . . . . . . . . . . . . . . . . . . . . . . . . 15 2.2.4. Variaciones con repetición . . . . . . . . . . . . . . . . . . . . . . . . . 15 2.2.5. Combinaciones sin repetición . . . . . . . . . . . . . . . . . . . . . . . 15 2.2.6. Combinaciones con repetición . . . . . . . . . . . . . . . . . . . . . . . 16 2.3. Variablesaleatorias................................. 16 2.3.1. Distribución discreta Bernoulli B(p).................... 18 2.3.2. Distribución discreta Binomial B(n,p) .................. 18 2.3.3. Distribución discreta de Poisson . . . . . . . . . . . . . . . . . . . . . . 19 2.3.4. Distribución discreta Geométrica . . . . . . . . . . . . . . . . . . . . . 19 2.3.5. Distribución discreta Binomial Negativa . . . . . . . . . . . . . . . . . 20 2.3.6. Distribución discreta Hipergeométrica . . . . . . . . . . . . . . . . . . . 20 2.3.7. Distribución continua uniforme . . . . . . . . . . . . . . . . . . . . . . 21 1
Fundamentos de Estadística A. Calabia 2.3.8. Distribución continua gaussiana (normal) . . . . . . . . . . . . . . . . . 22 2.3.9. Distribución continua exponencial . . . . . . . . . . . . . . . . . . . . . 23 2.3.10. Distribución continua Chi-cuadrado (χ2) ................. 24 2.3.11. Distribución continua t de Student . . . . . . . . . . . . . . . . . . . . 26 2.3.12. Distribución continua F de Fisher . . . . . . . . . . . . . . . . . . . . . 27 2.4. Teorema de Tchebychev aplicado . . . . . . . . . . . . . . . . . . . . . . . . . 27 3. Inferencia Estadística 28 3.1. Estimación...................................... 28 3.2. Contrastes de Hipótesis paramétricos clásicos . . . . . . . . . . . . . . . . . . . 31 3.2.1. Contraste sobre la media (bilateral y unilateral) . . . . . . . . . . . . . 32 3.2.2. Contraste sobre la varianza . . . . . . . . . . . . . . . . . . . . . . . . 33 3.2.3. Contraste sobre una proporción . . . . . . . . . . . . . . . . . . . . . . 33 3.3. Comparación entre dos poblaciones . . . . . . . . . . . . . . . . . . . . . . . . 34 3.3.1. Comparación entre dos medias (muestras independientes y normales) . 34 3.3.2. Comparación entre dos proporciones . . . . . . . . . . . . . . . . . . . 35 3.3.3. Comparación de medias con datos pareados . . . . . . . . . . . . . . . 36 3.4. Test de normalidad y transformaciones . . . . . . . . . . . . . . . . . . . . . . 36 3.4.1. Test de Shapiro-Wilk . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 3.4.2. Test de Kolmogorov-Smirnov (K-S) . . . . . . . . . . . . . . . . . . . . 37 3.4.3. Transformaciones Box-Cox . . . . . . . . . . . . . . . . . . . . . . . . . 37 3.5. Testdebondaddeajuste.............................. 38 3.5.1. Chi-cuadrado de bondad de ajuste . . . . . . . . . . . . . . . . . . . . 38 3.5.2. Kolmogorov-Smirnov para bondad de ajuste . . . . . . . . . . . . . . . 39 3.6. Test de independencia y homogeneidad . . . . . . . . . . . . . . . . . . . . . . 39 3.6.1. Test Chi-cuadrado de independencia . . . . . . . . . . . . . . . . . . . 39 3.6.2. Test Chi-cuadrado de homogeneidad . . . . . . . . . . . . . . . . . . . 40 3.6.3. Tests de aleatoriedad . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41 3.6.4. TestdeBox-Pierce ............................. 42 3.7. Inferencia no paramétrica . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43 3.7.1. Test U de Mann-Whitney (Wilcoxon rank-sum) . . . . . . . . . . . . . 43 3.7.2. Test de Kruskal-Wallis . . . . . . . . . . . . . . . . . . . . . . . . . . . 45 3.7.3. Test de la mediana (por signos o Wilcoxon) . . . . . . . . . . . . . . . 46 3.7.4. Comparación de dos muestras . . . . . . . . . . . . . . . . . . . . . . . 47 4. Modelos de Regresión y Análisis de la Varianza 48 4.1. Covarianza y Cuasicovarianza . . . . . . . . . . . . . . . . . . . . . . . . . . . 48 2
Fundamentos de Estadística A. Calabia 4.2. Coeficientes de Correlación y Determinación . . . . . . . . . . . . . . . . . . . 49 4.3. RegresiónLineal .................................. 50 4.4. Modelos Transformables a Lineales . . . . . . . . . . . . . . . . . . . . . . . . 51 4.5. Regresión Polinómica y MMC Matriciales . . . . . . . . . . . . . . . . . . . . 52 4.6. Ajuste por MMCC Ponderados . . . . . . . . . . . . . . . . . . . . . . . . . . 54 4.7. Análisis de la Varianza (ANOVA) . . . . . . . . . . . . . . . . . . . . . . . . . 57 5. Referencias y Bibliografía Recomendada 59 3
Fundamentos de Estadística A. Calabia 1. Estadística Descriptiva 1.1. Conceptos básicos Población: Conjunto total de elementos que comparten una característica común y sobre los que se desea obtener información. Muestra: Subconjunto representativo de la población, seleccionado mediante técnicas de muestreo. Técnicas de muestreo: •Aleatorio simple, i.e., al azar. •Estratificado (tamaños muestrales proporcionales al estrato). •Sistemático, donde hay un orden en los individuos y se escogen por intervalos regulares. •Por conglomerados (polietápico). Tras hacer agrupaciones, se seleccionan algunas y se hace un muestreo de éstas. Variables estadísticas: •Cualitativas: ◦Nominales: No tienen orden (ej. color de ojos). ◦Ordinales: Tienen orden (ej. nivel educativo). •Cuantitativas: ◦Discretas: Toman valores aislados (ej. número de hijos). ◦Continuas: Toman cualquier valor dentro de un intervalo (ej. altura). 1.2. Organización de datos La organización de datos es el primer paso en el análisis estadístico. Consiste en clasificar, ordenar y resumir la información recogida para facilitar su interpretación. Tablas de frecuencias: •Frecuencia absoluta (fi): número de veces que aparece un valor o categoría en el conjunto de datos. •Frecuencia relativa (hi): proporción del total que representa cada valor, se calcula como hi=fi n. •Frecuencia acumulada (Fi): suma de las frecuencias absolutas hasta el valor iésimo, es decir, Fi=Pi j=1 fj. •Frecuencia relativa acumulada (Hi): suma de las frecuencias relativas hasta el valor i-ésimo, es decir, Hi=Pi j=1 hj. A continuación se presenta la tabla de frecuencias correspondiente a una variable aleatoria observada en un conjunto de datos. La tabla incluye la frecuencia absoluta, relativa y sus acumuladas para cada valor. 4
Fundamentos de Estadística A. Calabia Valor (xi)fihiFiHi 3 1 0.083 1 0.083 4 2 0.167 3 0.250 5 3 0.250 6 0.500 6 2 0.167 8 0.667 7 2 0.167 10 0.833 8 1 0.083 11 0.917 9 1 0.083 12 1.000 Total 12 1.000 – – Representaciones gráficas: •Gráfico de barras: representa frecuencias de variables cualitativas o discretas. Cada barra indica la frecuencia de una categoría. Ejemplo: A B C D E 20 40 10 20 30 40 50 Categorías Frecuencia •Histograma: se utiliza para variables cuantitativas continuas. Las barras representan intervalos de valores y su altura indica la frecuencia. Ejemplo: 2 4 6 2 4 6 Valores Frecuencia •Gráfico de sectores (circular o pastel): muestra la proporción de cada categoría respecto al total. Es útil para variables cualitativas. Ejemplo: 20 % 30 % 50 % A B C 5
Fundamentos de Estadística A. Calabia •Diagrama de tallo y hojas: conserva los datos originales y permite visualizar la forma de la distribución. Se usa con datos numéricos pequeños. Ejemplo: Datos: 7, 7, 8, 12, 14, 15, 15, 16, 17, 17, 18, 19, 21, 22, 22, 23, 24, 25, 31, 33, 35. 0|778 1|245567789 2|122345 3|135 •Diagrama de caja (boxplot): resume la distribución de los datos mediante cinco medidas estadisticas (definidas en la siguiente sección): mínimo, primer cuartil (Q1), mediana (Q2), tercer cuartil (Q3) y máximo. También permite detectar valores atípicos. Ejemplo: 35 40 45 50 55 Grupo A Grupo B Grupo C 1.3. Medidas estadísticas Las medidas estadísticas permiten resumir y describir las características principales de un conjunto de datos. Consideremos el siguiente conjunto de ndatos como ejemplo: {4, 8, 6, 5, 3, 4, 7, 9, 10, 2}. 1.3.1. Medidas de posición: Media (µ): Promedio de los valores. µ=1 n n X i=1 xi=4+8+6+5+3+4+7+9+10+2 10 =58 10 = 5.8 Si los datos están agrupados por frecuencias, el sumatorio va desde i= 1 hasta k, el número de valores diferentes que toma la variable: µ=1 n k X i=1 xifi=4·2+8+6+5+3+7+9+10+2 10 =58 10 = 5.8 6
Fundamentos de Estadística A. Calabia Mediana: Valor central cuando los datos están ordenados. Datos ordenados: {2,3,4,4,5,6,7,8,9,10}⇒Mediana =5+6 2= 5.5 Moda: Valor que más se repite. Moda = 4 (aparece dos veces) Cuartiles: •Q1(posición al 25 % de los datos ordenados): 1er cuartil = 4 •Q2(posición al 50 % de los datos ordenados): Mediana = 5.5 •Q3(posición al 75 % de los datos ordenados): 3er cuartil = 8 Percentiles: Dividen los datos en 100 partes. Ejemplo: el percentil 90 está cerca del valor 10. 1.3.2. Medidas de dispersión: Rango: Diferencia entre el valor máximo y mínimo. R= 10 −2=8 Rango intercuartílico:Q3−Q1= 8 −4=4 Varianza: Es el cuadrado de la desviación de una variable respecto a su media. σ2=1 nX(xi−µ)2=61.6 10 ≈6.16 Cuasivarianza (varianza corregida): Es un estimador insesgado de la varianza poblacional. Aproxima la varianza de la población a partir de una muestra. s2=1 n−1X(xi−µ)2=61.6 9≈6.84 Desviación típica : σ=√6.16 ≈2.48 Cuasidesviación típica : s=√6.84 ≈2.61 1.3.3. Medidas de forma: Momentos de orden r: Los momentos centrados de orden rse definen como: µr=1 n n X i=1 (xi−¯x)r donde ¯xes la media muestral. Los momentos de orden 3 y 4 son especialmente útiles para analizar la forma de una distribución. 7
Fundamentos de Estadística A. Calabia Asimetría (Skewness): Mide la simetría de una distribución. Se calcula como: γ1=µ3 σ3 donde µ3es el momento centrado de orden 3 y σla desviación estándar. Valores positivos indican asimetría positiva (cola a la derecha), y negativos, asimetría negativa (cola a la izquierda). Curtosis (Kurtosis): Mide la concentración de los datos en torno a la media. Se calcula como: γ2=µ4 σ4 donde µ4es el momento centrado de orden 4. El coeficiente de curtosis de Fisher se define como γ2−3, para comparar con la distribución normal (que modela fenómenos naturales como alturas, errores de medición, etc.). Tipos de curtosis: - Leptocúrtica: γ2>3. Distribución más picuda que la normal. - Mesocúrtica: γ2= 3. Distribución normal. - Platicúrtica: γ2<3. Distribución más achatada que la normal. Normalidad: Una distribución puede considerarse aproximadamente normal si los coeficientes tipificados de asimetría y curtosis están en el intervalo [−2,2]. Tipificación de una variable: Para comparar variables con distintas unidades o escalas, se utiliza la tipificación: zi=xi−¯x σ donde zies el valor tipificado, ¯xla media, y σla desviación estándar. Esta transformación genera una variable con media 0 y desviación estándar 1. 1.4. Análisis exploratorio El análisis exploratorio permite detectar patrones, tendencias y valores atípicos. Detección de datos atípicos: Se consideran atípicos los valores que están fuera del rango: [Q1−1.5·RIQ, Q3+ 1.5·RIQ] En el ejemplo anterior, [4 −6,8 + 6] = [−2,14], no hay valores atípicos. Desigualdad de Tchebychev: Para cualquier distribución, al menos 1−1 k2de los datos están dentro de kdesviaciones típicas de la media. Demostración [Ferrer et al., 1995]: Sea f(xi)la función de probabilidad de una variable aleatoria Xque toma nvalores posibles con media µ, su varianza σ2está dada por: σ2= n X i=1 (xi−µ)2f(xi) 8
Fundamentos de Estadística A. Calabia Nota: Una función de probabilidad describe la probabilidad de que una variable aleatoria discreta asuma un valor específico. Por ejemplo, al lanzar un dado, la probabilidad de obtener cualquier número del 1 al 6 es de 1/6. Note f(xi) = fi/n. Separando esta ecuación en dos partes, y sabiendo que: xj< µ −kσ ≤µ≤µ+kσ < xh Como (xi−µ)2> k2σ2para xi≤xjyxi≥xh, se tiene: σ2= n X i=1 (xi−µ)2f(xi)≥ j X i=1 (xi−µ)2f(xi) + n X i=h (xi−µ)2f(xi)> > j X i=1 (kσ)2f(xi) + n X i=h (kσ)2f(xi)=(kσ)2"j X i=1 f(xi) + n X i=h f(xi)#= =k2σ2[P(X≤xj)+P(X≥xh)] De donde se deduce que: [P(X≤xj)+P(X≥xh)] <1 k2 En esta ecuación, P(X≤xj)es la probabilidad de que la variable Xtome valores menores o iguales que xj,yP(X≥xj)es la probabilidad de que la variable Xtome valores mayores o iguales que xh. Finalmente obtenemos: P(xj< X < xh)>1−1 k2 Ejemplo: Con k= 2, al menos 1−1 4= 0.75 (75%) de los datos están en el intervalo [µ−2σ, µ + 2σ] = [0.84,10.76] 2. Probabilidad 2.1. Fundamentos La probabilidad estudia fenómenos aleatorios, es decir, aquellos cuyo resultado no puede preverse con certeza. Conceptos fundamentales: Experimento aleatorio: Es aquel cuyo resultado no puede preverse con certeza, aunque se conozcan todos los factores que lo afectan. Espacio muestral (Ω): Es el conjunto de todos los posibles resultados de un experimento aleatorio. Suceso: Es cualquier subconjunto del espacio muestral. Si contiene un solo resultado, se llama suceso elemental. Suceso seguro: Es el que siempre ocurre. Coincide con el espacio muestral. Suceso imposible: Es el que nunca ocurre. Es el conjunto vacío. 9
Fundamentos de Estadística A. Calabia 2.2.6. Combinaciones con repetición Se eligen kelementos de un total de n, el orden NO importa y se pueden repetir. C′ n,k =n+k−1 k Ejemplo: ¿Cuántas formas hay de repartir 5 caramelos entre 3 niños (pueden recibir más de uno)? C′ 3,5=3+5−1 5=7 5= 21 2.3. Variables aleatorias Las variables aleatorias son funciones que asignan un valor numérico a cada resultado de un experimento aleatorio y se clasifican en dos tipos: discretas y continuas. Las funciones de probabilidad (para variables discretas) y las funciones de densidad (para variables continuas) describen cómo se distribuyen los valores de una variable aleatoria. Una variable aleatoria discreta toma valores numéricos aislados (generalmente enteros), cada uno con una probabilidad asociada. Se utiliza para modelar fenómenos donde los resultados posibles son contables, como por ejemplo: Bernoulli: un solo ensayo con dos resultados posibles (éxito/fracaso). Binomial: número fijo de ensayos independientes con dos resultados posibles. Poisson: cuenta eventos en un intervalo de tiempo o espacio, con tasa constante. Geométrica: número de ensayos hasta el primer éxito. Binomial negativa: número de ensayos hasta obtener réxitos. Hipergeométrica: número de éxitos en una muestra sin reemplazo de una población finita. Para estas variables (discretas), las funciones de probabilidad asignan a cada valor posible de una variable aleatoria discreta una probabilidad. Se denota como P(X=x). Propiedades: 0≤P(X=xi)≤1para todo xi PiP(X=xi)=1 Ejemplo: Variable Xque representa el número de caras al lanzar dos monedas. x P(X=x) 0 0.25 1 0.5 2 0.25 16
Fundamentos de Estadística A. Calabia Una variable aleatoria continua puede tomar cualquier valor dentro de un intervalo. Se describe mediante una función de densidad de probabilidad (f.d.p.), que indica cómo se distribuyen los valores. Las principales distribuciones son: Uniforme: todos los valores en el intervalo tienen la misma probabilidad. Gaussiana (o normal): distribución simétrica en forma de campana, muy utilizada en fenómenos naturales. Exponencial: modela el tiempo entre eventos en un proceso de Poisson. Chi-cuadrado: aparece en pruebas estadísticas y estimación de varianzas. t de Student: usada en inferencia para muestras pequeñas. F de Fisher: empleada en análisis de varianza. Para estas variables (continuas), las funciones de densidad de probabilidad (f.d.p.) describen cómo se distribuyen los valores de una variable aleatoria continua. Se denota f(x). Propiedades: f(x)≥0para todo x R∞ −∞ f(x)dx = 1 La probabilidad de que Xesté entre dos valores se calcula como: P(a≤X≤b) = Zb a f(x)dx Ejemplo: Si Xtiene distribución uniforme en [0,10], entonces: f(x) = 1 10,para 0≤x≤10 La probabilidad de que Xesté entre 3 y 7 es: P(3 ≤X≤7) = Z7 3 1 10 dx =4 10 = 0.4 Diferencias clave: - En variables discretas, se suman probabilidades: P(X=x) - En variables continuas, se integran densidades: P(a≤X≤b) = Rb af(x)dx - En variables continuas, P(X=x) = 0 para cualquier valor específico Es importante comprender que la función de densidad no da probabilidades directamente, sino que se integra para obtenerlas. 17
Fundamentos de Estadística A. Calabia 2.3.1. Distribución discreta Bernoulli B(p) Modela un único ensayo con dos posibles resultados: éxito (valor 1) con probabilidad p, y fracaso (valor 0) con probabilidad 1−p. Función de probabilidad: P(X=x)=px(1 −p)1−x, x ∈ {0,1} Media y varianza: µ=p, σ2=p(1 −p) Ejemplo: Supongamos que la probabilidad de que un componente esté defectuoso es p= 0.2. Si seleccionamos uno al azar, ¿cuál es la probabilidad de que sea defectuoso? P(X=1)=p= 0.2 Probabilidad de que no sea defectuoso: P(X=0)=1−p= 0.8 Relación con la Binomial: La distribución Bernoulli es un caso particular de la Binomial con n= 1: B(n= 1, p)≡Bernoulli(p) 2.3.2. Distribución discreta Binomial B(n,p) Modela el número de éxitos en nensayos independientes, cada uno con dos posibles resultados (éxito o fracaso), y con probabilidad constante de éxito p. Función de probabilidad: P(X=k) = n kpk(1 −p)n−k, k = 0,1,...,n Media y varianza: µ=np, σ2=np(1 −p) Ejemplo: Supongamos que la probabilidad de que una bombilla sea defectuosa es p= 0.1. Si se seleccionan n=8bombillas al azar, ¿cuál es la probabilidad de que exactamente 2 sean defectuosas? P(X= 2) = 8 2(0.1)2(0.9)6≈8! 2!6! ·0.01 ·0.5314 = 0.1488 Probabilidad acumulada: Para calcular la probabilidad de que haya menos de 3 bombillas defectuosas (P(X < 3)): P(X < 3)=P(X= 0) + P(X= 1) + P(X= 2) 18
Fundamentos de Estadística A. Calabia P(X= 0) = 8 0(0.1)0(0.9)8= 1 ·1·0.4304 = 0.4305 P(X= 1) = 8 1(0.1)1(0.9)7= 8 ·0.1·0.4782 = 0.3826 P(X=2)≈0.1488 (calculado antes) P(X < 3) = 0.4305 + 0.3826 + 0.1488 = 0.9619 Aproximación por Poisson: Si nes grande y ppequeño (n > 50,np<5), la binomial se puede aproximar por una Poisson con λ=np. 2.3.3. Distribución discreta de Poisson Modela el número de veces que ocurre un evento en un intervalo fijo de tiempo o espacio, cuando los eventos ocurren de forma aleatoria pero con una tasa constante λ. Función de probabilidad: P(X=k) = λke−λ k!, k = 0,1,2, . . . Media y varianza: µ=λ, σ2=λ Ejemplo: Supón que en una biblioteca se producen de media λ= 3 llamadas por hora. ¿Cuál es la probabilidad de que en una hora haya exactamente 5 llamadas? P(X= 5) = 35e−3 5! ≈243 ·0.0498 120 = 0.1009 Probabilidad acumulada: ¿Cuál es la probabilidad de que haya al menos 2 llamadas en una hora? P(X≥2) = 1 −P(X= 0) −P(X= 1) P(X= 0) = 30e−3 0! = 1 ·0.0498 = 0.0498 P(X= 1) = 31e−3 1! = 3 ·0.0498 = 0.1494 P(X≥2) = 1 −0.0498 −0.1494 = 0.8008 2.3.4. Distribución discreta Geométrica Modela el número de ensayos necesarios hasta obtener el primer éxito en una secuencia de ensayos independientes con probabilidad de éxito p. Función de probabilidad: P(X=k) = (1 −p)k−1p, k = 1,2,3, . . . 19
Fundamentos de Estadística A. Calabia Media y varianza: µ=1 p, σ2=1−p p2 Ejemplo: Supón que la probabilidad de que un dado salga un 6 es p=1 6. ¿Cuál es la probabilidad de obtener el primer 6 en el cuarto lanzamiento? P(X= 4) = (1 −1 6)3·1 6≈0.0965 2.3.5. Distribución discreta Binomial Negativa Generaliza la geométrica: modela el número de ensayos necesarios para obtener réxitos. Función de probabilidad: P(X=k) = k−1 r−1pr(1 −p)k−r, k =r, r + 1, . . . Media y varianza: µ=r p, σ2=r(1 −p) p2 Ejemplo: Supón que la probabilidad de acertar una pregunta tipo test es p= 0.2. ¿Cuál es la probabilidad de que sean necesarios exactamente 7 intentos para acertar 3 preguntas? P(X= 7) = 6 2(0.2)3(0.8)4= 15 ·0.008 ·0.4096 = 0.0492 2.3.6. Distribución discreta Hipergeométrica Modela el número de éxitos en una muestra de tamaño nextraída sin reemplazo de una población finita de tamaño N, que contiene Kelementos con la característica de interés. Función de probabilidad: P(X=k) = K kN−K n−k N n, k = m´ax(0, n −(N−K)),...,m´ın(n, K) Media y varianza: µ=n·K N, σ2=n·K N·1−K N·N−n N−1 Ejemplo: Supongamos que en una caja hay N= 20 bombillas, de las cuales K= 5 son defectuosas. Si se seleccionan n= 6 bombillas sin reemplazo, ¿cuál es la probabilidad de que exactamente k= 2 sean defectuosas? P(X= 2) = 5 215 4 20 6=10 ·1365 38760 ≈0.352 20
Fundamentos de Estadística A. Calabia Probabilidad acumulada: ¿Cuál es la probabilidad de que haya al menos 1 bombilla defectuosa? P(X≥1) = 1 −P(X= 0) P(X= 0) = 5 015 6 20 6=1·5005 38760 ≈0.129 P(X≥1) = 1 −0.129 = 0.871 2.3.7. Distribución continua uniforme La distribución uniforme continua modela fenómenos donde todos los valores dentro de un intervalo son igualmente probables. Función de densidad: f(x) = (1 b−a,si a≤x≤b 0,en otro caso Media y varianza: µ=a+b 2, σ2=(b−a)2 12 Ejemplo: El tiempo de espera para un autobús está uniformemente distribuido entre a= 0 yb= 10 minutos. Función de densidad: f(x) = 1 10−0= 0.1para 0≤x≤10. Media: µ=0+10 2= 5 minutos. Varianza: σ2=(10−0)2 12 =100 12 ≈8.33 minutos2. ¿Cuál es la probabilidad de esperar entre 3 y 7 minutos? P(3 ≤X≤7) = Z7 3 f(x)dx =Z7 3 0.1dx = 0.1·(7 −3) = 0.4 ¿Cuál es la probabilidad de esperar menos de 2 minutos? P(X < 2) = Z2 0 0.1dx = 0.1·(2 −0) = 0.2 ¿Cuál es la probabilidad de esperar más de 8 minutos? P(X > 8) = Z10 8 0.1dx = 0.1·(10 −8) = 0.2 21
Fundamentos de Estadística A. Calabia 2.3.8. Distribución continua gaussiana (normal) La distribución gaussiana (o normal) es la más importante en estadística. Modela fenómenos naturales como alturas, errores de medición, puntuaciones en exámenes, etc. Función de densidad: f(x) = 1 σ√2πe−(x−µ)2 2σ2 donde µes la media y σla desviación típica. La estandarización se usa para transformar la variable Xen una normal estándar N(0,1): Z=X−µ σ Ejemplo: Las puntuaciones en un examen siguen una distribución normal con media µ= 70 y desviación típica σ= 10. ¿Cuál es la probabilidad de que un alumno obtenga entre 60 y 80 puntos? Calculamos los valores estandarizados: Z1=60−70 10 =−1, Z2=80−70 10 = 1 Buscamos en la tabla de la normal estándar (online/software): P(−1≤Z≤1) = P(Z≤1) −P(Z≤ −1) De la tabla de la normal: P(Z≤1) ≈0.8413,P(Z≤ −1) ≈0.1587 P(60 ≤X≤80) = 0.8413 −0.1587 = 0.6826 Aproximadamente el 68.3 % de los alumnos obtienen entre 60 y 80 puntos. Ejemplo: ¿Cuál es la probabilidad de que un alumno obtenga más de 85 puntos? Estandarizamos: Z=85−70 10 = 1.5 Buscamos en la tabla: P(Z≤1.5) ≈0.9332 Por tanto, P(X > 85) = 1 −0.9332 = 0.0668 Solo el 6.68 % de los alumnos superan los 85 puntos. Ejemplo: ¿Cuál es el valor que deja por debajo al 90% de los alumnos? Buscamos en la tabla el valor Ztal que P(Z≤z) = 0.90. Se obtiene z≈1.28. Despejamos X: X=µ+z·σ= 70 + 1.28 ·10 = 82.8 El 90 % de los alumnos obtienen menos de 82.8 puntos. 22
Fundamentos de Estadística A. Calabia La distribución binomial puede aproximarse por una normal cuando el número de ensayos nes grande y la probabilidad de éxito pno está demasiado cerca de 0 o 1, i.e., np ≥5yn(1 −p)≥5: X≈N(µ=np, σ =pnp(1 −p)) Como la binomial es discreta y la normal es continua, se aplica una corrección de continuidad para mejorar la aproximación: - Para calcular P(X≤k), usamos P(Y≤k+ 0.5) - Para calcular P(X≥k), usamos P(Y≥k−0.5) - Para calcular P(X=k), usamos P(k−0.5≤Y≤k+ 0.5) Ejemplo: Supongamos que X∼B(100,0.4) µ=np = 100 ·0.4 = 40 σ=√100 ·0.4·0.6 = √24 ≈4.899 Queremos calcular P(X≤45) usando la aproximación normal. Aplicamos corrección de continuidad: P(X≤45) ≈P(Y≤45.5) Estandarizamos: Z=45.5−40 4.899 ≈1.122 Usando la tabla de la normal estándar: P(Z≤1.122) ≈0.8686 Por tanto: P(X≤45) ≈0.8686 2.3.9. Distribución continua exponencial La distribución exponencial modela el tiempo entre eventos que ocurren de forma continua y aleatoria, como el tiempo entre llamadas telefónicas, llegadas de clientes, o fallos de un sistema. Es una distribución sin memoria, i.e., la probabilidad de que el evento ocurra en el futuro no depende del tiempo ya transcurrido. Función de densidad: f(x) = λe−λx, x ≥0 donde λ>0es el parámetro de tasa (número medio de eventos por unidad de tiempo). Media y varianza: µ=1 λ, σ2=1 λ2 Ejemplo: El tiempo entre llegadas de clientes a una tienda sigue una distribución exponencial con λ= 0.5(es decir, en promedio llega un cliente cada 2 minutos). Función de densidad: f(x) = 0.5e−0.5x, para x≥0. Media: µ=1 0.5= 2 minutos. Varianza: σ2=1 (0.5)2= 4 minutos2. 23
Fundamentos de Estadística A. Calabia ¿Cuál es la probabilidad de que el próximo cliente llegue en menos de 2 minutos? P(X < 2) = Z2 0 0.5e−0.5xdx = 1 −e−0.5·2= 1 −e−1≈0.6321 ¿Cuál es la probabilidad de que el próximo cliente tarde más de 5 minutos en llegar? P(X > 5) = Z∞ 5 0.5e−0.5xdx =e−0.5·5=e−2.5≈0.0821 ¿Cuál es la probabilidad de que el próximo cliente llegue entre 1 y 4 minutos? P(1 < X < 4) = P(X < 4) −P(X < 1) P(X < 4) = 1 −e−0.5·4= 1 −e−2≈0.8647 P(X < 1) = 1 −e−0.5·1= 1 −e−0.5≈0.3935 P(1 < X < 4) = 0.8647 −0.3935 = 0.4712 La distribución exponencial es especialmente útil para modelar tiempos de espera y procesos de llegada. La probabilidad de que el evento ocurra en un intervalo se calcula integrando la función de densidad en ese intervalo. 2.3.10. Distribución continua Chi-cuadrado (χ2) La distribución chi-cuadrado (χ2) es una distribución continua definida solo para valores positivos. Es fundamental en estadística para el estudio de la variabilidad y la comparación de varianzas. Solo toma valores positivos (X≥0), y su forma depende del número de grados de libertad k. Por definición, si Z1, Z2, . . . , Zkson variables aleatorias independientes, cada una con distribución normal estándar (N(0,1)), entonces la suma de sus cuadrados: X=Z2 1+Z2 2+···+Z2 k sigue una distribución chi-cuadrado con kgrados de libertad, que se denota como X∼χ2 k. Media y Varianza: µ=k,σ2= 2k Supón que tienes una muestra x1, x2, . . . , xnde una población normal con media µy varianza σ2. La siguiente variable Qsigue una distribución χ2 n: Q= n X i=1 xi−µ σ2 Ejemplo: La variable χ2aparece de forma natural al sumar cuadrados de normales estándar, e.g. con tres observaciones independientes de una variable normal estándar: z1= 0.5,z2=−1.2, z3= 1.0, la suma de sus cuadrados es una realización de una variable χ2 3: X= (0.5)2+ (−1.2)2+ (1.0)2= 0.25 + 1.44 + 1.00 = 2.69 24
Fundamentos de Estadística A. Calabia Ejemplo: Relación con la varianza muestral. Supón que tienes una muestra de tamaño n= 5 de una población normal con media conocida µ= 10 y desviación típica conocida σ= 2. Los valores observados son: x1= 12,x2= 9,x3= 11,x4= 8,x5= 10. Q= 5 X i=1 xi−10 22 = =12 −10 22 +9−10 22 +11 −10 22 +8−10 22 +10 −10 22 = 2.5 Por tanto, Q= 2.5es una realización de una variable χ2 5. La distribución chi-cuadrado mide la suma de los cuadrados de desviaciones tipificadas respecto a la media. Es la base para el estudio de la variabilidad y para construir intervalos de confianza y contrastes sobre la varianza (que se verán en el siguiente tema). La corrección de Yates (también llamada corrección por continuidad) se utiliza en el contraste de independencia para tablas de contingencia de 2×2con frecuencias pequeñas. Su objetivo es ajustar el valor del estadístico χ2para evitar sobreestimar la significancia estadística. Se aplica cuando se usa el test χ2para evaluar si existe asociación entre dos variables categóricas en una tabla de contingencia de 2×2del tipo: B1B2Total A1a b a + b A2c d c + d Total a + c b + d n El estadístico χ2con corrección de Yates es: χ2 Yates =X(|O−E|−0.5)2 E Donde: Oes la frecuencia observada. Ees la frecuencia esperada bajo la hipótesis de independencia. Se resta 0.5 para corregir la continuidad. Ejemplo: Supongamos la siguiente tabla y correspondientes frecuencias esperadas: Sí No Total Tratamiento 12 8 20 Control 5 15 20 Total 17 23 40 E11 =(20)(17) 40 = 8.5, E12 =(20)(23) 40 = 11.5, E21 =(20)(17) 40 = 8.5, E22 =(20)(23) 40 = 11.5 25
Fundamentos de Estadística A. Calabia El p-valor es la probabilidad, bajo la hipótesis nula, de obtener un resultado tan extremo (o más) que el observado en la muestra. Si el p-valor < α, se rechaza H0. Si el p-valor ≥α, no se rechaza H0. Ejemplo: Se realiza un contraste bilateral sobre la media y se obtiene un estadístico z= 2.1. El p-valor asociado es: p= 2 ·P(Z > 2.1) ≈2·0.0179 = 0.0358 Si α= 0.05, entonces p < α y se rechaza H0. 3.2.1. Contraste sobre la media (bilateral y unilateral) Si σes conocida y ngrande ⇒usar distribución normal Z=x−µ0 σ/√n Si σes desconocida y npequeño ⇒usar distribución t de Student T=x−µ0 s/√n Ejemplo: Contraste bilateral con σconocida Una empresa afirma que el peso medio de sus paquetes es de 500 g. Se toma una muestra de n= 64 paquetes, con media muestral x= 506 g y desviación típica poblacional σ= 16 g. ¿Se puede afirmar, al 5 % de significación, que la media es distinta de 500 g? H0:µ= 500,H1:µ= 500 Z=506−500 16/√64 =6 2= 3 p-valor = 2 ·P(Z > 3) ≈2·0.0013 = 0.0026 Como p-valor = 0.0026 < α = 0.05, se rechaza H0 Hay evidencia suficiente para afirmar que la media es distinta de 500 g. Ejemplo: Contraste unilateral sobre la media con σdesconocida Un profesor sospecha que la media de notas de su clase es superior a 6. En una muestra de n= 25 alumnos, la media es x= 6.4, con s= 1.2. H0:µ= 6,H1:µ>6 T=6.4−6 1.2/√25 =0.4 0.24 ≈1.67 gl = 24, p-valor =P(T > 1.67) ≈0.054 Como p-valor = 0.054 > α = 0.05, no se rechaza H0 No hay evidencia suficiente para afirmar que la media es superior a 6. - Si realmente µ > 6y no se rechaza H0, se comete error tipo II. - Si realmente µ= 6 y se rechaza H0, se comete error tipo I. 32
Fundamentos de Estadística A. Calabia 3.2.2. Contraste sobre la varianza Verificar si la varianza poblacional σ2es igual a un valor específico σ2 0. Muestras pequeñas (n < 30) y población normal ⇒usar estadistico χ2=(n−1)s2 σ2 0 Muestras grandes (n≥30)⇒usar estadistico Z=s2−σ2 0 √2σ4 0/(n−1) Ejemplo: Población normal y el tamaño muestral pequeño. Se afirma que la varianza del peso de un producto es σ2= 4. En una muestra de n= 10, se obtiene s2= 6.25. H0:σ2= 4,H1:σ2= 4 χ2=9·6.25 4= 14.06 gl = 9, valores críticos: χ2 0.025 = 19.02,χ2 0.975 = 2.70 Como 2.70 <14.06 <19.02, no se rechaza H0 Ejemplo: Muestras grandes Se afirma que la varianza de la duración de baterías es σ2= 25. En una muestra de n= 50, se obtiene s2= 30. H0:σ2= 25,H1:σ2= 25 Z=30−25 q2·252 49 =5 √25.51 ≈0.99 p-valor = 2 ·P(Z > 0.99) ≈0.32 Como p-valor = 0.32 > α = 0.05, no se rechaza H0 3.2.3. Contraste sobre una proporción Verificar si la proporción poblacional pes igual a un valor específico p0. Estadístico: Z=ˆp−p0 qp0(1−p0) n Ejemplo: Se afirma que el 30 % de los clientes compran online. En una muestra de n= 200, 70 lo hacen. ˆp=70 200 = 0.35 H0:p= 0.3,H1:p= 0.3 Z=0.35−0.3 √0.3·0.7/200 = 1.543 33
Fundamentos de Estadística A. Calabia p-valor = 2 ·P(Z > 1.543) = 0.1228 Como p-valor = 0.1228 > α = 0.05, no se rechaza H0 No hay evidencia suficiente para afirmar que la proporción de clientes que compran online es distinta de 30 %. 3.3. Comparación entre dos poblaciones Comparar parámetros poblacionales (medias, proporciones, varianzas) entre dos grupos independientes o relacionados. 3.3.1. Comparación entre dos medias (muestras independientes y normales) Si las varianzas son conocidas: Z=x1−x2 qσ2 1 n1+σ2 2 n2 Ejemplo: Dos máquinas producen tornillos. Se sabe que las desviaciones típicas son σ1= 2 y σ2= 3. Se toman muestras de n1= 40 yn2= 50, con medias x1= 10.5yx2= 9.8. H0:x1=x2,H1:x1=x2 Z=10.5−9.8 q4 40 +9 50 ≈1.32 Como Z= 1.32 < z0.025 = 1.96, no se rechaza H0. p-valor = 2 ·P(Z > 1.32) = 0.186 > α = 0.05 No hay evidencia suficiente para afirmar que las medias de producción de tornillos entre las dos máquinas sean distintas. Si las varianzas son desconocidas e iguales: T=x1−x2 sp·q1 n1+1 n2 , s2 p=(n1−1)s2 1+ (n2−1)s2 2 n1+n2−2 Ejemplo: Grupo A: n1= 20,x1= 75,s1= 10 Grupo B: n2= 25,x2= 70,s2= 12 H0:x1=x2,H1:x1=x2 s2 p=19 ·100 + 24 ·144 43 ≈124.56, sp≈11.16 T=5 11.16 ·q1 20 +1 25 ≈1.49 gl =n1+n2= 43,p-valor = 2 ·P(T > 1.49) ≈0.1426 > α = 0.05, no se rechaza H0. 34
Fundamentos de Estadística A. Calabia Si las varianzas desconocidas y distintas: Se usa el test de Welch con la distribución t de Student, tras calcular los grados de libertad ajustados con las siguientes fórmulas: T=x1−x2 qs2 1 n1+s2 2 n2 Grados de libertad gl =s2 1 n1+s2 2 n22 s2 1 n12 n1−1+s2 2 n22 n2−1 Ejemplo: Grupo A: n1= 15,x1= 82,s1= 9 Grupo B: n2= 18,x2= 76,s2= 11 H0:x1=x2,H1:x1=x2 T=82 −76 q81 15 +121 18 ≈1.723 gl =(81 15 +121 18 )2 (81/15)2 15−1+(121/18)2 18−1≈31 p-valor = 2 ·P(T > 1.723) ≈0.0948 > α = 0.05. No se rechaza H0. No hay evidencia suficiente para afirmar que las medias de los dos grupos sean distintas. 3.3.2. Comparación entre dos proporciones Z=ˆp1−ˆp2 rˆp(1 −ˆp)1 n1+1 n2 ,ˆp=x1+x2 n1+n2 Ejemplo: Grupo A: x1= 45 de n1= 100 Grupo B: x2= 30 de n2= 100 H0:ˆp1= ˆp2,H1:ˆp1= ˆp2 ˆp1= 0.45,ˆp2= 0.30,ˆp= 0.375 Z=0.15 q0.375 ·0.625 ·1 100 +1 100≈0.15 0.0685 ≈2.19 p-valor = 2 ·P(Z > 2.19) ≈0.028 < α = 0.05, se rechaza H0al 5 %. 35
Fundamentos de Estadística A. Calabia 3.3.3. Comparación de medias con datos pareados Los datos son dependientes (nparejas de observaciones). Se analiza la diferencia entre pares: di=xi−yi Estadístico: T=d sd/√n, donde d=media de las diferencias, sd=desviación típica de las diferencias. Ejemplo: Se mide la presión antes y después de un tratamiento en 10 pacientes. Diferencias: d={2,3,1,0,−1,2,3,1,2,1} H0:xd= 0, H1:xd= 0 d= 1.4, sd≈1.26, T =1.4 1.26/√10 ≈3.5 gl = 9, p-valor = 2·P(T > 3.5) = 0.007 <0.01, se rechaza H0. Hay evidencia estadísticamente significativa para afirmar que el tratamiento sí tiene efecto sobre la presión arterial. 3.4. Test de normalidad y transformaciones Muchos contrastes paramétricos requieren que los datos provengan de una distribución normal. Para verificar este supuesto, se utilizan test de normalidad. Si los datos no son normales, pueden aplicarse transformaciones como la de Box-Cox para aproximarlos a la normalidad. 3.4.1. Test de Shapiro-Wilk Evaluar si una muestra proviene de una distribución normal. Tamaño muestral pequeño o moderado (n≤50 recomendado). H0: Los datos provienen de una distribución normal. H1: Los datos no provienen de una distribución normal. Ejemplo: Se aplica el test de Shapiro-Wilk con software (con software, por ejemplo, en R con ‘shapiro.test(x)‘) a una muestra de 20 datos y se obtiene un p-valor de 0.08. Como p>0.05, no se rechaza H0: los datos pueden considerarse normales. 36
Fundamentos de Estadística A. Calabia 3.4.2. Test de Kolmogorov-Smirnov (K-S) Comparar la distribución empírica de una muestra con una distribución teórica (por ejemplo, normal). H0: La muestra sigue la distribución teórica especificada. H1: La muestra no sigue dicha distribución. Estadístico: D= m´ax |Fn(x)−F(x)| donde: -Fn(x)es la función de distribución empírica de la muestra. -F(x)es la función de distribución teórica (por ejemplo, normal). El estadístico Dmide la mayor diferencia absoluta entre la función de distribución empírica y la función de distribución teórica en todo el dominio de x. Este valor captura el punto donde la discrepancia entre ambas distribuciones es más grande, y se utiliza para evaluar si esa diferencia es lo suficientemente significativa como para rechazar la hipótesis nula. Ejemplo: Se aplica el test K-S a una muestra de 30 datos, comparándola con una normal N(0,1). Se obtiene D= 0.12 y el p-valor asociado es 0.04. Como p < 0.05, se rechaza H0: los datos no siguen una distribución normal. 3.4.3. Transformaciones Box-Cox Transformar los datos para que se aproximen a una distribución normal, lo cual puede mejorar el rendimiento de modelos estadísticos que asumen normalidad (como la regresión lineal). La transformación de Box-Cox se aplica a cada dato xide la muestra mediante la siguiente función: x(λ) i=(xλ i−1 λ,si λ= 0 ln(xi),si λ= 0 Esta es una familia de funciones parametrizadas por λ, que permite ajustar la forma de la distribución de los datos: - Para λ>1, se reduce la asimetría negativa (colas largas a la izquierda). - Para 0<λ<1, se reduce la asimetría positiva (colas largas a la derecha). - Para λ<0, se invierte la curvatura, útil en casos de asimetría negativa. - Para λ= 0, se aplica la transformación logarítmica: x(0) i= ln(xi). La transformación solo está definida para datos positivos: xi>0. Esto se debe a que tanto la potencia como el logaritmo requieren entradas positivas para producir resultados reales. El valor óptimo de λse estima mediante métodos de máxima verosimilitud, buscando que los datos transformados se ajusten lo mejor posible a una distribución normal. Este valor 37
Fundamentos de Estadística A. Calabia puede variar según la naturaleza de los datos. La transformación de Box-Cox puede aplicarse fácilmente mediante software. Ejemplo: Se tiene una muestra de tiempos de espera: X={2.1,3.5,4.0,5.2,6.8,7.1,8.3,9.0,10.5,11.2} Se aplica la transformación Box-Cox con software y se encuentra que el valor óptimo es λ= 0.97. Los datos transformados se aproximan a una distribución normal (verificado con el test de Shapiro-Wilk). 3.5. Test de bondad de ajuste Estos test permiten evaluar si una muestra se ajusta a una distribución teórica esperada. 3.5.1. Chi-cuadrado de bondad de ajuste H0: La distribución observada se ajusta a la distribución teórica. H1: La distribución observada no se ajusta. Estadístico: χ2= k X i=1 (Oi−Ei)2 Ei donde: Oi= frecuencia observada en la categoría i Ei= frecuencia esperada en la categoría i k= número de categorías El estadístico siempre es positivo o cero, porque se basa en cuadrados de diferencias. Si los datos se ajustan bien al modelo, el valor de χ2será pequeño. Si hay mucha discrepancia entre lo observado y lo esperado, será grande. Por tanto, solo se rechaza H0si el valor de χ2es suficientemente grande, es decir, si cae en la cola derecha de la distribución. Ejemplo: Se lanza un dado 60 veces. Se obtienen las siguientes frecuencias: Cara 1 2 3 4 5 6 Observado (Oi) 8 10 9 12 11 10 Esperado (Ei) 10 10 10 10 10 10 H0: El dado es justo (todas las caras tienen la misma probabilidad). H1: El dado no es justo (al menos una cara tiene distinta probabilidad). 38
Fundamentos de Estadística A. Calabia χ2=(8 −10)2 10 +(10 −10)2 10 +···+(10 −10)2 10 = 1.0 gl = k−1 = 5, valor crítico χ2 0.05,5= 11.07 Como 1.0<11.07, no se rechaza H0. 3.5.2. Kolmogorov-Smirnov para bondad de ajuste H0: La muestra sigue la distribución teórica. H1: La muestra no sigue la distribución teórica. Estadístico: D= m´ax |Fn(x)−F(x)| donde: Fn(x)= función de distribución empírica F(x)= función de distribución teórica Ejemplo: Se tiene una muestra de 20 datos. Se compara con una normal N(0,1) y se obtiene D= 0.15, con p-valor = 0.12. Como p-valor >0.05, no se rechaza H0. 3.6. Test de independencia y homogeneidad 3.6.1. Test Chi-cuadrado de independencia Evaluar si existe una relación significativa entre dos variables categóricas. En otras palabras, determinar si son independientes o están asociadas. H0: Las variables son independientes (no hay asociación). H1: Las variables no son independientes (hay asociación). Estadístico: Se utiliza la estadística de Pearson para comparar las frecuencias observadas con las esperadas bajo la hipótesis de independencia: χ2=X i,j (Oij −Eij)2 Eij donde: Oij: frecuencia observada en la celda (i, j). Eij: frecuencia esperada en la celda (i, j)bajo H0, calculada como: Eij =Fi·Cj n 39
Fundamentos de Estadística A. Calabia Fi: total de la fila i. Cj: total de la columna j. n: tamaño total de la muestra. Siendo rel número de filas y cel número de columnas de la tabla de contingencia, los grados de libertad son: gl = (r−1)(c−1) El valor crítico se obtiene de la tabla de la distribución χ2para el nivel de significación αy los grados de libertad correspondientes. Como el test χ2de independencia siempre evalúa si hay desviación respecto a la independencia (sin dirección específica), se trata de una prueba de una cola (cola derecha). Si el valor calculado χ2es mayor que el valor crítico, se rechaza H0. Este test puede realizarse fácilmente con software para tablas grandes, calculando automáticamente el estadístico, los grados de libertad y el p-valor. Ejemplo: Se estudia la relación entre fumar (sí/no) y tener hipertensión (sí/no): Hipertensión Sí Hipertensión No Total Fuma 30 20 50 No fuma 20 30 50 Total 50 50 100 Frecuencias esperadas: E11 =50 ·50 100 = 25, E12 =50 ·50 100 = 25, E21 =50 ·50 100 = 25, E22 =50 ·50 100 = 25 El estadístico: χ2=(30 −25)2 25 +(20 −25)2 25 +(20 −25)2 25 +(30 −25)2 25 =25 25 +25 25 +25 25 +25 25 = 4.0 Para gl = (2 −1)(2 −1) = 1 ⇒χ2 0.05,1= 3.84 Como 4.0>3.84, se rechaza H0. Hay evidencia de que fumar y tener hipertensión no son independientes. 3.6.2. Test Chi-cuadrado de homogeneidad Evaluar si dos o más poblaciones tienen la misma distribución respecto a una variable categórica. Es decir, comprobar si la proporción de respuestas es homogénea entre grupos. H0: Las poblaciones tienen la misma distribución (son homogéneas). H1: Al menos una población difiere en su distribución. Este test se aplica cuando se tienen varias muestras independientes (por ejemplo, regiones, grupos de edad, etc.) y se desea comparar cómo se distribuyen respecto a una misma variable categórica (por ejemplo, preferencia por marcas, respuesta a un tratamiento, etc.). 40
Fundamentos de Estadística A. Calabia Estadístico: Se utiliza el mismo estadístico que en el test de independencia Ejemplo: Se comparan tres regiones (A, B y C) en cuanto a preferencia por tres marcas de café (X, Y, Z). Se recoge la siguiente tabla de frecuencias observadas: Marca X Marca Y Marca Z Total Región A 20 15 15 50 Región B 25 10 15 50 Región C 30 10 10 50 Total 75 35 40 150 Para gl = (3 −1)(3 −1) = 4 ⇒χ2 0.05,4= 9.49 Una vez calculado el estadistico, si el valor calculado supera el valor crítico, se rechaza H0y se concluye que al menos una región tiene una distribución distinta de preferencias. 3.6.3. Tests de aleatoriedad Evaluar si una secuencia de datos sigue un patrón aleatorio o si presenta algún tipo de estructura (tendencia, agrupación, simetría, etc.). Este tipo de test es útil para validar supuestos de independencia temporal, especialmente en series de tiempo o en experimentos donde se espera que los datos no sigan un patrón sistemático. Test de rachas (Runs test): Evalúa si los datos presentan una secuencia aleatoria de valores por encima y por debajo de una referencia (por ejemplo, la mediana). Pasos: 1. Se transforma la secuencia original en una secuencia de símbolos (+/−)según si cada valor está por encima (+) o por debajo (−)de la mediana. 2. Se cuentan las rachas, es decir, secuencias consecutivas del mismo símbolo. 3. Se calcula el número esperado de rachas bajo la hipótesis de aleatoriedad: µR=2n(+)n(−) n+ 1 4. Se calcula la desviación estándar: σR=s2n(+)n(−)(2n(+)n(−)−n) n2(n−1) 5. Se calcula el estadístico: Z=R−µR σR donde Res el número de rachas observadas, n(+) yn(−)son los números de símbolos +y−,yn=n(+) +n(−). 6. Se compara con el valor crítico de la distribución normal estándar (dos colas). 41
Fundamentos de Estadística A. Calabia Estadístico: D= m´ax |Fn1(x)−Fn2(x)| Ejemplo: Muestra A: {3,5,7,9,11} Muestra B: {4,6,8,10,12} x FA(x)FB(x)|FA(x)−FB(x)| 3 1/5 0/5 0.2 4 1/5 1/5 0 5 2/5 1/5 0.2 6 2/5 2/5 0 7 3/5 2/5 0.2 8 3/5 3/5 0 9 4/5 3/5 0.2 10 4/5 4/5 0 11 5/5 4/5 0.2 12 5/5 5/5 0 D= m´ax |FA(x)−FB(x)|= 0.2 Para n1=n2= 5 yα= 0.05, el valor crítico aproximado es Dcrítico ≈0.565. Como D= 0.2<0.565, no se rechaza H0. No hay evidencia suficiente para afirmar que las dos muestras provienen de distribuciones distintas. El test sugiere que podrían provenir de la misma distribución. 4. Modelos de Regresión y Análisis de la Varianza 4.1. Covarianza y Cuasicovarianza La covarianza mide el grado de asociación lineal entre dos variables aleatorias. Dadas dos variables aleatorias XyY,lacovarianza poblacional se define como: Cov(X, Y ) = E[(X−µX)(Y−µY)] Donde: µX=E[X],µY=E[Y] Si Cov(X, Y )>0: relación directa. Si Cov(X, Y )<0: relación inversa. Si Cov(X, Y )=0: no hay relación lineal (aunque puede haber no lineal). En otras palabras, estamos diciendo que la covarianza es el valor esperado del producto de las desviaciones de XyYrespecto a sus medias. Es decir, mide cómo varían conjuntamente. 48
Fundamentos de Estadística A. Calabia Dada una muestra de tamaño nde pares (xi, yi)y medias muestrales xyy,lacovarianza muestral se calcula como: sXY =1 n−1 n X i=1 (xi−x)(yi−y) A veces se usa la versión no corregida (cuasicovarianza), especialmente en contextos de ajuste de observaciones: ˜sXY =1 n n X i=1 (xi−x)(yi−y) Esta versión no ajusta por grados de libertad y puede subestimar la variabilidad. Ejemplo: Dada la siguiente muestra de 5 pares: (x, y)={(1,2),(2,4),(3,5),(4,4),(5,5)} x= 3,y= 4 La covarianza es: sXY =1 4[(1 −3)(2 −4)+(2−3)(4 −4)+(3−3)(5 −4)+(4−3)(4 −4)+(5−3)(5 −4)] = 1.5 4.2. Coeficientes de Correlación y Determinación Medir la intensidad y dirección de la relación lineal entre dos variables, y cuantificar cuánto de la variabilidad de una variable puede explicarse por otra. Dado un conjunto de datos (xi, yi),elcoeficiente de correlación de Pearson se define como: r=Cov(X, Y ) sXsY Donde: Cov(X, Y )es la covarianza muestral. sX,sYson las desviaciones típicas muestrales de XyY. Si r= 1: correlación positiva perfecta. Si r=−1: correlación negativa perfecta. Si r= 0: no hay correlación lineal. Cuanto más cerca de ±1, más fuerte es la relación lineal. El Coeficiente de determinación se define como: R2=r2 R2representa la proporción de la variabilidad de Yque puede explicarse por la variabilidad de Xmediante una relación lineal. Por ejemplo, R2= 0.81 indica que el 81 % de la variabilidad de Yse explica por X. 49
Fundamentos de Estadística A. Calabia Ejemplo: Dada la muestra: (x, y)={(1,2),(2,3),(3,5),(4,4),(5,6)} x= 3,y= 4 Se calcula la covarianza: sXY =1 4P(xi−x)(yi−y) = 1 4(4 + 1 + 0 + 0 + 4) = 2.25 sX=q1 4P(xi−x)2=√2.5 sY=q1 4P(yi−y)2=√2.5 Entonces: r=2.25 √2.5·√2.5=2.25 2.5= 0.9⇒R2= 0.92= 0.81 Existe una fuerte correlación positiva entre xey, y el 81 % de la variabilidad de yse explica por x. 4.3. Regresión Lineal Encontrar el modelo que mejor se ajusta a los datos, minimizando la suma de los cuadrados de las diferencias entre los valores observados yiy los valores ajustados ˆyi, i.e., método de mínimos cuadrados (MMCC). El modelo para ajustar los datos a una recta es: y= ˆy+ε=β0+β1x+ε MMCC busca minimizar la función de error: S(β0, β1) = n X i=1 (yi−ˆyi)2= n X i=1 (yi−β0−β1xi)2 Este es un problema de optimización. Se derivan las expresiones respecto a β0yβ1, se igualan a cero y se resuelven el sistema: ∂S ∂β0 =−2X(yi−β0−β1xi)=0 ∂S ∂β1 =−2Xxi(yi−β0−β1xi)=0 Resolviendo este sistema se obtienen las estimaciones: ˆ β1=P(xi−x)(yi−y) P(xi−x)2=sXY s2 X ,ˆ β0=y−ˆ β1x La recta ajustada (regresión de Ysobre X) minimiza la suma de los cuadrados de las distancias verticales entre los puntos observados y la recta (es decir, las diferencias en y). Por otro lado, la regresión de Xsobre Yinvierte los roles de las variables, i.e., se considera Ycomo la variable independiente y Xcomo la dependiente. En este caso, se minimiza la suma de los cuadrados de las distancias horizontales entre los puntos observados y la recta ajustada: ˆx=β′ 0+β′ 1y 50
Fundamentos de Estadística A. Calabia ˆ β′ 1=P(xi−x)(yi−y) P(yi−y)2=sXY s2 Y ,ˆ β′ 0=x−ˆ β′ 1y En contraste con las regresiones de Ysobre Xo de Xsobre Y, que minimizan distancias verticales u horizontales respectivamente, el análisis de componentes principales (PCA) busca una dirección que minimice la suma de las distancias perpendiculares desde los puntos a una recta (o hiperplano) que mejor representa la variabilidad conjunta de las variables. Esta recta principal no distingue entre variable dependiente e independiente, y se orienta según la máxima varianza de los datos proyectados, proporcionando una representación simétrica y óptima en términos de compresión de información. A diferencia de las regresiones clásicas, el PCA se basa en la descomposición espectral (eigendecomposition) de la matriz de covarianzas, lo que permite identificar las direcciones de máxima varianza. Sin embargo, el PCA no se aborda en detalle en este curso. Ejemplo: Regresión clásica. Se pide ajustar la recta a los datos: (x, y) = {(1,2),(2,4),(3,5),(4,4),(5,6)} Se obtiene entonces, para regresión de Ysobre X: ˆy= 1.8+0.8x y para regresión de Xsobre Y: ˆx=−0.82 + 0.91y Con un R2= 0.73 en ambos casos, i.e., el modelo explica el 73% de la variabilidad de datos observados. 4.4. Modelos Transformables a Lineales Ajustar modelos no lineales mediante transformaciones que permiten aplicar técnicas de regresión lineal. Transformaciones comunes: Exponencial: y=aebx ⇒ln y= ln a+bx Se transforma la variable dependiente yaplicando logaritmo natural. Logarítmico: y=a+bln x Se transforma la variable independiente x. Potencial: y=axb⇒ln y= ln a+bln x Se aplica logaritmo natural a ambas variables. Hiperbólico: y=a+b x Se transforma la variable independiente como 1/x. 51
Fundamentos de Estadística A. Calabia Ejemplo: modelo exponencial (ln y= ln a+bx) Definimos: Y= ln y, X =x Y={ln(2.7),ln(7.4),ln(20.1),ln(54.6),ln(148.4)}≈{0.993,2.001,3.004,4.000,5.001} Ajustar una recta Y=α+βX mediante MMCC: ˆ β=P(xi−x)(Yi−Y) P(xi−x)2≈1.001,ˆα=Y−ˆ β·x≈ −0.008 Parámetros originales: ˆ b=ˆ β≈1.001,ˆa=eˆα≈e−0.008 ≈0.992 Modelo ajustado: y= 0.992 ·e1.001x 4.5. Regresión Polinómica y MMC Matriciales Extender el modelo de regresión lineal para ajustar relaciones no lineales entre variables mediante polinomios, utilizando el método de mínimos cuadrados en forma matricial. El modelo polinómico es: y=β0+β1x+β2x2+···+βkxk+ε Aunque el modelo es no lineal en x, sigue siendo lineal en los parámetros βj, lo que permite aplicar mínimos cuadrados. La forma matricial del modelo es: y=Xβ+ε donde: y∈Rn: vector de observaciones. X∈Rn×(k+1): matriz de diseño con columnas 1, x, x2, . . . , xk. β∈Rk+1: vector de parámetros. ε: vector de errores aleatorios. La función objetivo es minimizar la suma de los cuadrados de los residuos: S(β)=∥y−Xβ∥2= (y−Xβ)T(y−Xβ) Para la condición de mínimo relativo, se derivan las componentes de Srespecto a βy se igualan a cero: ∂S ∂β=−2XT(y−Xβ) = 0 Esto lleva a las ecuaciones normales: XTXβ=XTy Para la solución del sistema, si XTXes invertible, entonces queda: ˆ β= (XTX)−1XTy 52
Fundamentos de Estadística A. Calabia Para existencia de solución única, las columnas de Xdeben ser linealmente independientes, y el número de observaciones ndebe ser mayor que el número de parámetros k+ 1. Una vez obtenida la solución ˆ β, se calcula la varianza de los residuos como estimador de la varianza del error: s2=∥y−Xˆ β∥2 n−p donde: n: número de observaciones. p=k+ 1: número de parámetros estimados. e=y−Xˆ β: vector de residuos. Esta varianza de referencia se utiliza posteriormente para estimar la incertidumbre de los coeficientes. La matriz cofactor es la matriz inversa del sistema normal y representa la sensibilidad del ajuste respecto a los datos. Sus elementos diagonales están relacionados con la precisión de cada parámetro estimado. La matriz cofactor se define como: Qxx = (XTX)−1 La matriz varianza-covarianza de los estimadores (vector solución) permite estudiar la precisión y la correlación entre los parámetros estimados. La matriz varianza-covarianza se calcula como: Cov(ˆ β)=s2Qxx donde: - Los elementos diagonales representan las varianzas de cada coeficiente. - Los elementos fuera de la diagonal representan las covarianzas entre coeficientes. Las desviaciones típicas (errores estándar) de los coeficientes estimados indican la dispersión esperada de cada estimador alrededor de su valor verdadero. Las desviaciones típicas de los coeficientes estimados se calculan con la varianza de referencia (s2) calculada anteriormente: SD(ˆ βj) = ps2·Qjj, j = 0,...,k Para cada parámetro ˆ βj, el intervalo de confianza al nivel 1−αse calcula mediante la distribución tde Student: ˆ βj±t1−α/2,n−p·SD(ˆ βj) Ejemplo: Ajuste Cuadrático Datos: (x, y) = {(1,2),(2,2),(3,5),(4,7),(5,13)} Modelo: y=β0+β1x+β2x2 53
Fundamentos de Estadística A. Calabia Matriz de diseño: X= 1 1 1 1 2 4 1 3 9 1 4 16 1 5 25 ,y= 2 2 5 7 13 Estimación por mínimos cuadrados: ˆ β= (XTX)−1XTy Resultado: ˆ β0≈3.20,ˆ β1≈ −2.01,ˆ β2≈0.79 Varianza de referencia: s2=Pn i=1 e2 i n−p≈0.629 Matriz cofactor: Qxx = (XTX)−1≈ 4.60 −3.30 0.50 −3.30 2.67 −0.43 0.50 −0.43 0.07 Matriz varianza-covarianza del vector solución: Cov(ˆ β)=s2Qxx ≈ 2.89 −2.07 0.31 −2.07 1.68 −0.27 0.31 −0.27 0.045 Desviaciones típicas de los coeficientes estimados: SD(ˆ β0)≈1.70,SD(ˆ β1)≈1.30,SD(ˆ β2)≈0.21 Estas desviaciones típicas indican la dispersión esperada de cada estimador alrededor de su valor verdadero, bajo los supuestos del modelo. Intervalos de confianza al 95 %: Con t0.975,2≈4.303:ˆ β0∈[−4.12,10.52],ˆ β1∈[−7.59,3.56],ˆ β2∈[−0.13,1.70] 4.6. Ajuste por MMCC Ponderados Estimar los parámetros de un modelo lineal en los coeficientes, cuando las observaciones tienen distinta fiabilidad, asignando a cada una un peso. Modelo general: y=Xβ+ε 54
Fundamentos de Estadística A. Calabia Donde: y∈Rn: vector de observaciones. X∈Rn×(k+1): matriz de diseño con columnas 1, x, x2, . . . , xk. β∈Rk+1: vector de parámetros. ε: vector de errores aleatorios. Se introduce una matriz diagonal P= diag(w1, w2, . . . , wn), donde cada wi>0representa el peso asignado a la observación yi. Los pesos reflejan la confianza relativa en cada dato. Se minimiza la función objetivo: S(β)=(y−Xβ)TP(y−Xβ) La condición de mínimo se obtiene anulando el gradiente: ∂S ∂β=−2XTP(y−Xβ) = 0 Lo que lleva a las ecuaciones normales ponderadas: XTPX ˆ β=XTPy Si XTPX es invertible: ˆ β= (XTPX)−1XTPy La varianza de los residuos ponderados se estima como: s2=(y−Xˆ β)TP(y−Xˆ β) n−p Donde nes el número de observaciones y pel número de parámetros. La matriz cofactor describe la sensibilidad del ajuste respecto a los datos y se define como: Qxx = (XTPX)−1 La matriz varianza-covarianza del vector solución (estimadores) permite cuantificar la incertidumbre de cada parámetro estimado y su correlación con los demás: Cov(ˆ β)=s2Qxx Las desviaciones típicas (errores estándar) de los coeficientes estimados se obtienen como: SD(ˆ βj) = ps2·Qjj, j = 1,...,p Donde Qjj es el elemento diagonal correspondiente de Qxx. Para cada parámetro ˆ βj, el intervalo de confianza al nivel 1−αse calcula como: ˆ βj±t1−α/2,n−p·SD(ˆ βj) 55
Fundamentos de Estadística A. Calabia Donde t1−α/2,n−pes el valor crítico de la distribución tde Student con n−pgrados de libertad. Ejemplo: Ajuste Cuadrático Ponderado Datos: (x, y) = {(1,2),(2,2),(3,5),(4,7),(5,13)} Se decide asignar a cada punto un peso inversamente proporcional a su distancia al origen: wi=1 xi Modelo: y=β0+β1x+β2x2+ε Matriz de diseño: X= 1 1 1 1 2 4 1 3 9 1 4 16 1 5 25 ,y= 2 2 5 7 13 , P = diag 1 1,1 2,1 3,1 4,1 5 Estimación por mínimos cuadrados ponderados: ˆ β= (XTPX)−1XTPy Resultado: ˆ β0≈3.17,ˆ β1≈ −1.99,ˆ β2≈0.78 Varianza de referencia: s2=eTPe n−p≈0.193 Matriz cofactor: Qxx = (XTPX)−1≈ 7.12 −6.10 1.02 −6.10 5.87 −1.03 1.02 −1.03 0.19 Matriz varianza-covarianza de la solución: Cov(ˆ β)=s2Qxx ≈ 1.38 −1.18 0.20 −1.18 1.13 −0.20 0.20 −0.20 0.036 Las desviaciones típicas (errores estándar) indican la dispersión esperada de cada estimador alrededor de su valor verdadero, bajo los supuestos del modelo. Estas medidas se obtienen como la raíz cuadrada de la diagonal de la matriz varianza-covarianza: SD(ˆ β0)≈1.17,SD(ˆ β1)≈1.07,SD(ˆ β2)≈0.19 56
Fundamentos de Estadística A. Calabia Intervalos de confianza al 95 %: Con t0.975,2≈4.303: ˆ β0∈[−1.88,8.22],ˆ β1∈[−6.57,2.60],ˆ β2∈[−0.04,1.60] 4.7. Análisis de la Varianza (ANOVA) Evaluar si existen diferencias significativas entre las medias de varios grupos poblacionales, a partir de muestras independientes. ANOVA se utiliza cuando se desea comparar más de dos medias. En lugar de realizar múltiples pruebas t(lo que aumentaría el error tipo I), se realiza una única prueba global basada en la descomposición de la variabilidad total. Las muestras son independientes entre sí. Las poblaciones tienen distribución normal. Las poblaciones tienen varianzas iguales (homocedasticidad). Supongamos que hay kgrupos, cada uno con njobservaciones. El modelo estadístico es: yij =µj+εij, εij ∼ N(0, σ2) Donde: yij: observación i-ésima del grupo j. µj: media del grupo j. εij: error aleatorio. La suma total de cuadrados se descompone en la suma de cuadrados entre grupos y la suma de cuadrados dentro de los grupos: SCtotal =SCentre +SCdentro Donde: SCtotal =Pk j=1 Pnj i=1(yij −y)2 SCentre =Pk j=1 nj(yj−y)2 SCdentro =Pk j=1 Pnj i=1(yij −yj)2 Grados de libertad: glentre =k−1 gldentro =N−k, donde N=Pnj gltotal =N−1 Medias cuadráticas: MSentre =SCentre k−1, MSdentro =SCdentro N−k 57