scieee AI-readable full text Open interactive document viewer

Evolución de las investigaciones en poblaciones finitas: Una perspectiva metodológica

Basulto Santos, Jesús; Martín Martín, Domingo; Murgui Izquierdo, Santiago

Full text

C apítulo 2 2 Evolución de las investigaciones en poblaciones finitas Una perspectiva metodológica Jesús Basulto Santos Domingo M artín M artín Universidad de Sevilla Santiago Murgui Izquierdo Universidad de Valencia Introducción Sobre la Historia de la Inferencia en Poblaciones Finitas vamos a interesamos más en las innovaciones metodológicas que surgieron en el siglo XIX y parte del XX, hasta 1934, que en las numerosas encuestas que se realizaron a partir del XIX. Dejando de lado los Censos, la primera innovación que surgirá en el siglo XIX serán las llamadas Monografías de Le Play. La imposibilidad de extender los resultados de las Monografías a las poblaciones de interés será una justificación más para que el Método Representativo de Kiaer sea aceptado por los líderes del Instituto Internacional de Estadística. Este utilizará la estratificación en sus encuestas y recurrirá a los censos para seleccionar muestras representativas. Desde su propuesta en 1895 deberá competir con el despegue de los censos, de las estadísticas generales de los recientes Institutos de Estadística y de las Monografías, hasta que en la reunión del Instituto Internacional de Estadística, celebrada en Berlín en 1903, se proponga un comité para estudiar “La aplicación del Método Representativo”. No será hasta 1926 que por fin Bowley y Jensen presenten sus investigaciones sobre dicho método. Bowley (1906) reflexionará sobre el porqué de la falta de aplicación del cálculo de probabilidades en la recogida de datos por muestreo, a pesar de que las encuestas venían siendo utilizados desde hace 20 años. Buscando una medida para el error de las estimaciones, Bowley propondrá el uso de intervalos aleatorios, basados en los métodos bayesianos y el teorema central del límite. Esto último servirá para medir la precisión de las constantes a estimar en las poblaciones finitas por medio de muestras seleccionadas aleatoriamente. Bowley utilizará el diseño estratificado con afijación proporcional como una alternativa al 357 Historia de la Probabilidad y la Estadística (IV) simple para aumentar la precisión de las estimaciones. El diseño por conglomerados será también propuesto. Ahora bien, ante el sesgo que produce un diseño aleatorio simple cuando se usan los promedios de la variable de interés con conglomerados de distintos tamaños, Bowley (1926) desarrollará la teoría de los diseños intencionados usando muestras balanceadas o equilibradas como solución al problema. Por último, Neyman(1934) introducirá la innovación de los intervalos de confianza, una nueva aproximación para medir la precisión de las estimaciones, que será su “Método Representativo”, y que le permitirá generalizar el diseño estratificado de Bowley y desarrollar los diseños aleatorios por conglomerados. En el período que va desde 1855, con la publicación de Le Play de su monografía “Los Trabajadores Europeos” hasta el artículo de Neyman en 1934, se han presentado un conjunto de innovaciones sobre cómo hacer inferencias en poblaciones finitas que marcarán la senda a seguir en el futuro. Si ahora consideramos este conjunto de innovaciones y las unimos a las que se han producido desde 1934 hasta final del siglo XX, podemos ver que hoy tenemos un abanico de métodos, cuya presentación, muchas veces formal, está muy alejado de su origen, lo que ante una situación concreta nos lleva a preguntamos ¿qué método debemos utilizar? Una forma de agrupar las distintas aproximaciones metodológicas a la inferencia de poblaciones finitas es la que establece la siguiente distinción: 1) Censos e investigaciones exhaustivas, 2) Muestras Representativas, 3) Muestras Aleatorias, 4) Muestras Intencionadas y 5) Muestras generadas de forma espontánea. Estas agrupaciones nos servirán para relacionar las innovaciones con sus orígenes históricos y, también, para señalar cuándo una es más conveniente que otra, A partir de aquí, el trabajo está organizado en las secciones siguientes: En la sección primera resumimos la aproximación por censos e investigaciones exhaustivas donde reflexionamos sobre su utilidad, relacionando la innovación de las monografías con los censos. Reflexionamos sobre las muestras representativas en la sección dos, donde recogemos el Método Representativo de Kiaer. Las muestras aleatorias son recogidas en la sección tres, donde incluimos las innovaciones de Bowley, finalizando con la respuesta de éste al trabajo de Neyman. En la sección cuatro hablamos de las llamadas muestras intencionadas, donde recordamos la aportación de Bowley y los modelos de superpoblación. En la última sección tratamos las muestras generadas de forma espontánea. Finalizamos el trabajo con algunas conclusiones. I Ia Aproximación: Censos e Investigaciones Exhaustivas Para conocer los valores que una variable Y toma sobre las unidades de un universo U, la primera opción a considerar es la realización de un censo o estudio exhaustivo, cuyo resultado es de desear que conduzca al conjunto de datos (yi, y2,---,yN)- Sin embargo, frecuentemente surgen errores y limitaciones que impiden conseguir el objetivo deseado. En cuanto a los errores es habitual establecer la siguiente clasificación: a-Errores del marco o directorio: Subcobertura, por existencia de unidades de U no consideradas al diseñar el censo Sobrecobertura, por observación de unidades que realmente no pertenecen a U Observación de unidades repetidas 358 Historia de la Probabilidad y la Estadística (IV) b-Errores por falta de respuesta: Falta de localización de alguna unidad Falta de contacto con alguna unidad Rechazo a colaborar Incapacidad de observar la variable de interés c-Errores de medida: Discrepancia entre los verdaderos valores que se obtendrían con la medición de la variable y el valor recogido. En cuanto a las limitaciones que suelen presentarse cabe distinguir: 1De naturaleza presupuestaria 2Asociadas con la duración de la investigación 3Derivadas de la confidencialidad de la información Un ejemplo histórico de investigación exhaustiva son “Las Relaciones Topográficas”, respuestas a cuestionarios elaborados bajo el mandato de Felipe II en los años setenta del siglo XVI con el fin de conocer una descripción particular de los pueblos pertenecientes a Castilla. Los cuestionarios fueron enviados por orden del rey a los gobernadores, corregidores y otras justicias. Se ordenaba que los alcaldes y regidores comisionaran a vecinos del pueblo “personas antiguas y discretas y curiosas” que conociesen las materias que se preguntaban para que respondieran el cuestionario. Este censo que buscaba recoger todos los aspectos de los pueblos fue un fracaso ya que al final sólo se pudieron recoger 653 cuestionarios, y esto a pesar de remitir en muchos casos un segundo cuestionario simplificado del primero. Una estadística de los pueblos que contestaron a uno o a los dos cuestionarios es recogido por F. J. Campos y Fernández (2000). La falta de jurisdicción de corregidores y gobernadores en algunas villas y la ausencia de personas competentes para hacer las relaciones fueron los motivos más frecuentes del fracaso de esta investigación. Un análisis pormenorizado de la parte de los cuestionarios que recogen información sobre pesca ha sido realizado por S. Basulto en 2006 (Tesina de Licenciatura de la Universidad de Huelva). La primera alternativa a los Censos fueron las Monografías que con su estudio de casos permitió recoger información más detallada. Debemos a Le Play el método de la Monografía, lo que hoy correspondería al método del caso. Le Play fue un pionero de la Sociología y un impulsor del método científico en las ciencias sociales en el siglo XIX francés (Garrígós Monerris, 2003). Veamos una aproximación de este método en palabras de Adolfo Álvarez Buylla (1850-1927), catedrático de Economía Política y Hacienda Pública de la Universidad de Oviedo, que en 1903 tuvo que abandonar su tierra para incorporarse en Madrid al Instituto de Reformas Sociales1 (19031924). “Es la mayor copia de datos para llegar al más exacto conocimiento del estado de los trabajadores, y a buscar la mejor organización posible de la sociedad, afín de que cesen tantas injusticias como dominan hoy por desgracia en las relaciones entre los hombres, ... consiste en una minuciosa descripción del estado económico (inventario de bienes, - ingresos, gastos de toda clase), moral, religioso, artístico, de cultura, educación, etc.; * 'Antecedente al Instituto de Reformas Sociales, fue la creación en 1883 de la Comisión de Reformas Sociales que hasta 1890 elaboró un extenso cuestionario de 223 preguntas con el objetivo de conocer la realidad obrera (“la cuestión social”). 359 Historia de la Probabilidad y la Estadística (IV) descripción sacada del examen directo y personal del modo de existencia del sujeto a observación, seguido de las consideraciones que sugiere al autor la situación de las familias obreras, con ánimo de encontrar la que, constituida con toda pureza de costumbres y bajo la singularidad del padre, viniera a ser como el tipo de familia cristiana, en cuya restauración creía encontrar Le Play la felicidad humana”.2 Un estudio de la obra “Les Ouvriers Européens”, segunda edición de 1855, puede verse en el artículo de P.F. Lazarsfeld (1961). En la mayoría de los casos, la realidad observada tras el intento de efectuar un análisis exhaustivo conduce a plantearse la siguiente cuestión: Si después de realizar una investigación censal únicamente se accede a observar la variable de interés en n unidades de un universo de tamaño N ¿será válida la extrapolación de los resultados que se obtengan a todo el universo completo? La respuesta a esta pregunta es condicional, dependerá de las características comparadas que posean el colectivo completo y aquel para el que se han obtenido los datos. 2* Aproximación: Muestras Representativas Una muestra se dice que es representativa del universo U con respecto a una serie de variables Xi, X2,..., Xm, si la estructura de los datos obtenidos al observar las citadas variables en la muestra es la misma que la correspondiente a todo el universo. En coherencia con esta definición, cuando una muestra sea representativa, cualquier resultado acerca de las variables de referencia que se establezca sobre la muestra, podrá ser directamente expandido al universo completo y su validez estará plenamente garantizada. Las limitaciones que presenta el concepto de representatividad son inherentes a la propia definición. Para poder asegurar que una muestra es representativa sería necesario conocer la estructura de la población completa, algo que ya de partida se considera el objeto de la investigación. Matizando el concepto de representatividad, en la práctica estadística es frecuente desconocer la estructura de los datos poblacionales asociados con una variable de interés Y, y sin embargo disponer de la estructura correspondiente a una variable auxiliar X (podría ser la misma variable Y referida a una ocasión anterior). En tales circunstancias, el hecho de disponer de una muestra representativa con respecto a X ¿asegura la representatividad con respecto a la variable Y? En términos categóricos la respuesta a esta pregunta es negativa. No obstante, en la medida en que exista cierta vinculación entre ambas variables, será posible concebir aproximaciones a la idea formal de representatividad. Fue el estadístico Noruego A. N. Kiaer quien en la reunión del Instituto Internacional de Estadística de 1895 celebrada en Berne, propuso el método representativo como una alternativa al censo. En el método representativo, la muestra reflejará la población finita y esto se puede lograr bien por muestreo equilibrado a través de una selección intencionada de las unidades muéstrales, o por muestreo aleatorio. Este debate fue llevado a cabo por Kiaer en las reuniones bianuales de ISI celebradas en 1895, 1897, 1901 y 1903, encontrando resistencia por parte de los Institutos de Estadística Oficiales, partidarios de la realización de censos y muy poco inclinados ante la innovación que propugnaba Kiaer. 2Femando, Pérez, J.M. (2007): Antonio Flores de Lemus: años de formación universitaria. Correspondencia con Francisco Giner de los Ríos. Real Academia de Ciencias Morales y Políticas. Página 130. 360 Historia de la Probabilidad y la Estadística (IV) Los esfuerzos de Kiaer dieron sus frutos en la sesión del ISI celebrada en Berlin en 1903, cuando se adoptó una resolución que recomendaba el uso del método representativo sujeto a la provisión de que en la publicación de los resultados se especificaran las condiciones bajo las cuales se había realizado la selección de las observaciones. Veamos algunos de los trabajos que Kiaer presentó en las reuniones del Instituto Internacional de Estadística. En 1895, en la reunión del Instituto Internacional de Estadística en Beme, presentó un trabajo con el título “Observations et expériences concernant des dénombrements représentatifs”, donde introduce el método Representativo. Veamos alguno de sus comentarios. En el caso de querer estudiar la llamada “cuestión social”, Kiaer propone cuál es para él la población de interés. “Una cosa me ha llamado la atención, y es que las investigaciones detalladas concernientes a los ingresos, las viviendas y demás condiciones económicas o sociales que han sido hechas en relación con las clases obreras, no hayan sido extendidas de una manera análoga a todas las clases sociales de la sociedad. Me parece evidente que aún centrándose sólo en la cuestión obrera propiamente dicha, se debe comparar la situación económica, social, moral, etc., de los obreros con la de las clases medias y las clases ricas. En un país donde las clases superiores son muy ricas y las clases medias tienen un nivel de vida muy holgado, las pretensiones de las clases obreras relativas a sus salarios, a sus viviendas, etc., se miden según una escala distinta que la de un país (o una localidad) en que la mayoría de las personas pertenecientes a las clases superiores no son ricas y las clases medias se encuentran en apuros. De esta proposición, que me parece del todo clara, se sigue que para apreciar bien las condiciones de la clase obrera, será necesario también conocer, además de ésta, los elementos análogos de las otras clases. Pero es necesario dar un paso más y decir que, puesto que la sociedad no consiste sólo de la clase obrera, no se debe descuidar, en las investigaciones sociales, ninguna clase de la sociedad. ” Kiaer usará dos encuestas realizadas en Noruega donde aplicará el método representativo, que también llama enumeración representativa. La primera de las encuestas, que comenzó a elaborarse en 1894, pretendía crear una especie de seguridad social que cubriese las incapacidades debidas a la edad. La otra encuesta, que había comenzado a elaborarse en 1890, buscaba calcular la distribución de la renta del cabeza de familia según edad, estado civil y ocupación. Vamos a considerar sólo la primera encuesta, donde el método Representativo fue aplicado de la forma siguiente: con la información del último censo, los cuestionarios fueron asignados proporcionalmente a la población de las ciudades y los distritos en que fueron agrupados los municipios. En el caso de las ciudades se eligieron las cinco con mayor población, además de la capital, que fue estratificada en cuatro segmentos definidos por calles según sus poblaciones. En cuanto a los pueblos, fueron clasificados en 18 grupos, según el censo de 1891, y cada grupo fue de nuevo clasificado según la importancia de su actividad económica. Vemos que hasta aquí Kiaer está haciendo uso de la estratificación tan empleada en nuestras encuestas modernas. En una segunda etapa, en el caso de la capital, se eligieron calles en cada uno de los grupos de forma intencionada buscando que representaran a todas las calles del mismo grupo. En la última etapa, se pidió a los entrevistadores que debían visitar todo tipo de viviendas, de tal manera que cubriesen las distintas condiciones sociales y económicas. Una vez asignados los cuestionarios, Kiaer comparaba la muestra con el censo 361 Historia de la Probabilidad y la Estadística (IV) respecto del sexo, ocupación y localización. En aquellos casos donde ocurrían discrepancias de la muestra con el censo, debido a que, por ejemplo, los entrevistadores no habían seguido las normas, Kiaer quitaba o añadía cuestionarios hasta lograr una buena aproximación de la muestra al censo. ¿Qué ocurrió con esta encuesta de Kiaer? Gracias al reciente trabajo de Einar Lie (2002) sabemos que esta encuesta fue un fracaso a pesar de que el tamaño era de 80.000 personas. Un problema que surgió fue que la muestra no recogió bien el hecho que debían haber más incapacitados en las ciudades que en los pueblos, también que la propensión a tener incapacidades era mayor en los solteros que los casados, y que finalmente la incapacidad aumentaba con la edad. Aunque Kiaer conocía que su muestra no recogía bien la incidencia de la discapacidad, dio su informe sin modificar la muestra. Einar Lie explica este comportamiento de Kiaer como una consecuencia de las limitaciones del método Representativo, en el sentido de que las variables de control que hacían representativa la muestra aunque estaban bien relacionadas con la variable de interés “número de incapacitados”, problemas de selección de las últimas unidades rompieron estas relaciones. Nuestra opinión sobre este fracaso fue que la variable de interés “número de incapacitados” era un suceso raro y así era difícil investigar por medio del método representativo. Si la muestra hubiera sido aleatoria, acompañada de estratificaciones y variables de control, la muestra que necesitaríamos sería enorme. El mayor crítico a la encuesta de Kiaer fue Hjorth, un actuario, que según sus cálculos aproximados concluyó que el tamaño de la muestra era demasiado pequeño, lo que justifica nuestra opinión. Podríamos decir que Kiaer se enfrento con lo que hoy llamamos “poblaciones raras”, que necesita la metodología del Muestreo por Redes (Monroe G. Sirken, 2004). Volviendo a la reunión de Instituto Internacional de Estadística, la reacción de los colegas a este primer trabajo de Kiaers fue oponerse al método Representativo. Fue el profesor G. von Mayr, de la Universidad de Munich, quien afirmó que: “ Veo con mucho peligro el punto de vista recogido en su trabajo. Creo que la muestra representativa puede tener algún valor, pero éste está restringido al terreno ya iluminado por un censo. No podemos sustituir por cálculo la observación real de los hechos. La muestra sólo nos proporciona estadísticas para las unidades actualmente observadas, pero no verdaderas estadísticas de toda la población. ” Esta respuesta de Mayr debe contemplarse dentro de los éxitos logrados por el método censal que condujo a sus usuarios a rechazar cualquier otra innovación que pudiera hacerle la competencia. Kiaer volverá a presentar otro trabajo en la reunión del Instituto Internacional de Estadística en 1897 en St. Petersburgo. Con el título de “Sur les méthodes représentatives ou typologiques appliquées à la statistique41, Kiaer nos dice lo siguiente : ”Por investigación representativa quiero expresar una exploración parcial donde la observación se hace sobre un gran número de lugares dispersos distribuidos sobre toda la extensión del territorio, de tal manera que el conjunto de los lugares formen una miniatura del territorio total. Estos lugares no deben ser elegidos de forma arbitraria, sino según una agrupación racional basada sobre los resultados generales de las estadísticas; y los cuestionario usados deben ser asignados a dichos lugares, de tal manera que los resultados sean controlados, respectos de sus diferencias, con la ayuda del censo generar 362 Historia de la Probabilidad y la Estadística (IV) En la reunión de Berne, un responsable, M. Bodio, resumía el estado de la cuestión sobre las monografías y los censos, con estas palabras “La monografía estadística y la enumeración son dos maneras de investigación de los hechos sociales que se complementan. La enumeración, por si sólo no puede dar más que perfiles generales de los fenómenos, la silueta, por así decir, de la figura.”. Ante el olvido del Método Representativo, Kiaer afirmaba lo siguiente. “Añadiría a ellos la investigación parcial en general. Al permitir poner el análisis en todos sus detalles de la vida económica y moral del pueblo, da la sangre, carne, nervios o esqueleto construidos por la estadística general, y a la vez la enumeración completa las nociones aportadas por la monografía Y añade una afirmación que a veces es difícil de explicar. “Es necesario notar que el valor científico de las investigaciones parciales dependen mucho más de su carácter representativo, que del número de datos.” Kiaer presentará otro trabajo en la reunión del Instituto Internacional de Estadística en 1901 en Budapest. Con el título de “Sur les méthodes représentatives ou typologiques*1, donde quiso distinguir su método representativo del método de los Tipos. Kiaer nos dice lo siguiente. “Una investigación detallada de un cierto distrito o de un cierto barrio de una ciudad, no es una investigación representativa. Si el distrito o el barrio son áreas tipos, estos métodos serán de Tipos. Pero no se podría generalizar los resultados para todo el país o toda la ciudad. Pero si examináramos gran número de localidades diseminadas de una manera proporcional a lo largo de los diferentes distritos del país o de las distintas partes de la ciudad, entonces podríamos generalizar los resultados por medio del método representativo.” En esta reunión Kiaer recibirá una nueva crítica por parte de Bortkiewicz. Este profesor de estadística de la Universidad de Berlín aplicará una prueba de significación a la hipótesis nula de que la muestra representativa, de uno de los trabajos de Kiaer, no se diferencia de la población de donde ha sido construida, y con métodos debido a Poisson, concluye que la hipótesis no soporta los datos observados. Kruskal y Mosteller (1980) señalan, con acierto, como una metodología basada en un modelo probabilístico no puede ser aplicada a una muestra representativa, que al ser ésta intencionada está lejos de ser una realización de dicho modelo aleatorio. Se necesita una nueva metodología que justifique el uso de las pruebas de significación. Kiaer participará en la reunión de Berlín de 1903, donde sus aportaciones, recogidas en la publicación de 1905, no añadirán nada a lo ya conocido hasta ese momento . En la reunión de Berlín, el Instituto Internacional de Estadística propondrá un comité para estudiar “La aplicación del Método Representativo en Estadística”. El comité estará formado por los siguientes profesores: A. L. Bowley, Corrado Gini, Adolph Jensen, Lucien Martch, Verrijn Stuard y Franz Zized. No será hasta la reunión de 1926 en Roma donde se presentarán las memorias de Jensen y de Bowley. 363 Historia de la Probabilidad y la Estadística (IV) En la segunda década del siglo XX el método representativo fue ampliamente utilizado. Inicialmente el método preferido de selección muestral fue la selección intencionada pero gradualmente la aleatorización seria un fuerte competidor del muestreo equilibrado para seleccionar la muestra. Según la resolución del ISI de 1926, se puede obtener una muestra lo suficientemente representativa de la población mediante dos procedimientos: A) Selección aleatoria: se selecciona un número de unidades de forma que la regla dominante es que las probabilidades de inclusión sean iguales. B) Selección intencionada: donde se selecciona un número de grupos de unidades (en terminología moderna “conglomerados”) de forma que casi reproduzcan las mismas características que la población objetivo, a través de unas variables de control. (Recogido de las recomendaciones del ISI, reproducidas por Yates (1946)) Una aplicación interesante del método de Kiaer fue a la extracción de una muestra a partir de un censo realizado en un momento t para su comparación con otros censos realizados en momentos t’ posteriores. Una ilustración puede verse en el trabajo « Une application de la méthode représentative aux matériaux du dernier recensement de la population italienne » (1 er décembre 1921). Bull. Int. Satisti. Inst. 1928, vol. 23, 198-215. En él se propone guardar una muestra del Censo de Italia para su comparación con otros censos sobre temas que en el futuro fueran de interés. Se utilizaron variables particulares para elegir la muestra representativa, buscando que los valores medios fueran casi los mismos en la población y la muestra. La principal conclusión fue que al tomar otras variables, no usadas en la selección de la muestra representativa, se notó que las diferencias encontradas fueron anormales. Este trabajo fue el que Neyman uso en su crítica del Muestreo Intencionado. Las experiencias señaladas permiten comprobar la imposibilidad de conseguir muestras fielmente representativas, aunque en ocasiones sí pueden alcanzarse aproximaciones. Esto nos conduce a planteamos las siguientes cuestiones: Si existen indicios de que una muestra es aproximadamente representativa, ¿será correcto afirmar que los resultados muéstrales serán aproximadamente válidos para la población completa?, ¿cómo se puede medir el grado de representatividad de una muestra? Y finalmente ¿cómo medir el grado de aproximación de los resultados muéstrales a los correspondientes a la población completa? 3a Aproximación: Muestras Aleatorias Un cálculo del grado de aproximación que se obtiene al elevar a la población completa los resultados obtenidos sobre los datos muéstrales puede resolverse asociando una estructura estocástica sobre los datos. Una forma, aunque no la única, de generar tal estructura consiste en introducir mecanismos aleatorios a la hora de seleccionar las unidades muéstrales. El procedimiento de selección se especifica a través de un diseño muestral y éste a su vez explicita el soporte de la estructura estocástica inducida. Veamos los primeros pasos que se dieron para la aplicación del muestreo probabilístico originalmente debido a Arthur Lyon Bowley, hasta llegar al artículo de Neyman de 1934. Bowley introdujo inn ovaciones en el Muestreo de Poblaciones Finitas. Varias de estas innovaciones fueron: (a) aplicar el cálculo de probabilidades al muestreo de poblaciones finitas, (b) desarrollar el diseño aleatorio simple y el diseño estratificado proporcional y (c) elaborar un muestreo intencionado para la selección de conglomerados. Recogemos a continuación los trabajos de Bowley relacionados con el Muestreo de Poblaciones Finitas. 1 (1) El artículo “Address to the Economics Statistics Section of the British Association for the Advancement of Science”, York, 1906. publicado en el Journal of the Royal Statistical Society, vol. 69, pp. 540-568. 364 Historia de la Probabilidad y la Estadística (IV) (2) El libro de “Elements of Statistics”. 3rd. Ed. King and Son. London. 1907. (3) El libro “Livelihood and Poverty” de A.L. Bowley and A.R. Bumett-Hurst. Vol. VII, Rotledge/Thoemmes Pres, 1915. Edición de 1997. (4) La memoria “Measurement of the Precision Attained in Sampling”, Bulletin of the International Statistical Institute, 22, 1926. Suplement to Liv. 1, [6].[62]. Preceded by summaries in French and English. (5) La respuesta que Bowley dio en la discusión del artículo de Jerzy Neyman, 1934. “On the Different Aspects of the Representative Method: the Method of Stratified Sampling and the Method of Purposive Selection”, publicado en la Royal Statistical Society, pp. 558625. El texto de Bowley que nos interesa está en la página 609. En el artículo (1), Bowley señala el desconocimiento que se tiene de cómo calcular el error de una estimación, a pesar de tener una teoría de cómo hacerlo. En apoyo de la teoría cita a Gauss, Laplace, Quetelet, Edgeword y Karl Pearson. A continuación habla sobre la curva normal y su deducción de la binomial, y nos dice que las fórmulas encontradas tienen dos bases, la que suponen hipótesis a priori y la que se justifica por medio de ajustes empíricos. Todas estas fórmulas están disponibles y son aplicadas, por ejemplo, a los métodos simples de muestreo que existen desde hace 20 años. A continuación Bowley propone un intervalo aleatorio que lo usa para medir la precisión (la exactitud, como dice Bowley) de la constante que desea estimar de carácter cuantitativo, apoyado en la aproximación normal. También propone un intervalo aleatorio en el caso de querer estimar la proporción de un atributo. Ilustra su propuesta anterior mediante una simulación de muestras de una población finita usando un diseño sistemático. Este ejemplo empírico le sirve para conocer la aproximación normal, y también para mostrar el buen funcionamiento de las fórmulas de los intervalos. A continuación Bowley propone aplicar las fórmulas propuestas a la recogida de estadísticas de salarios, empleo, etc., por medio de muestras aleatorias. En su libro (2), capítulo VII, trata ejemplos de toma de muestras en las ciencias naturales, señalando el ahorro, de tiempo y coste y, además, nos recuerda que las muestras son necesarias en los casos donde las unidades seleccionadas son sometidas a modificaciones que las hacen inservibles. A continuación nos dice que “lo esencial de un examen por muestreo es que todo miembro del grupo considerado debe tener casi la misma chance de ser incluido en la muestra”. En este capítulo, Bowley vuelve al ejemplo descrito en su artículo (1). El libro (3) escrito con A.R. Bumett-Hurst contiene varias investigaciones realizadas por muestreo aleatorio en Northampton, Warrington, Stanley y Reading sobre las condiciones sociales de la llamada clase obrera. El capítulo que nos interesa aquí es el VI de metodología. En este capítulo VI del libro, Bowley señala los errores que pueden ocurrir en una investigación por muestreo, critica la falta de una medida de precisión de los resultados y así, cuando quiere calcular los errores de las estimaciones, ilustra el uso de los intervalos aleatorios propuestos en su artículo de 1906 por medio del siguiente ejemplo: nos dice que si en la muestra de hogares de Reading tenemos que el 20% de los hogares tiene cuatro habitaciones, entonces el porcentaje de hogares, de la población bajo estudio, con cuatro habitaciones es tan verosímil de estar en el intervalo [19,06-20,94] como de estar fuera de él. La memoria de 1926 (4) es el trabajo teórico que Bowley aporta sobre inferencia en poblaciones finitas. La memoria, de 57 páginas, está dividida en: Selección Aleatoria, Selección Intencionada y Pruebas Generales. Usando la versión bayesiana del teorema central 365 Historia de la Probabilidad y la Estadística (IV) aConsiderar que la muestra es representativa y asumir que los resultados obtenidos son válidos para toda la población bConsiderar que la muestra resultante puede interpretarse como el resultado de aplicar un proceso de selección aleatorio, ajustado a un diseño probabilístico preestablecido. En tal caso, sobre la estructura estocástica inducida por dicho diseño sería posible analizar la fiabilidad de los resultados obtenidos. cAsumir un modelo de superpoblación y realizar la inferencia con el soporte estocástico que se genera. En los casos en los que existen indicios de que la falta de respuesta es no significativa, desde un punto de vista práctico y con las pertinentes reservas, podría considerarse aceptable la adopción de las dos primeras alternativas. Sin embargo, ésta no es una situación de carácter general y lo ilustraremos con un ejemplo. Hasta 1996 la Consejería de Agricultura de la Generalitat Valenciana venía elaborando cuentas económicas agregadas anuales del sector cooperativo agrario valenciano. Para ello contaba con la información que cada año le remitían todas las entidades, si bien algunas carencias mínimas se suplían mediante técnicas de imputación. Sin embargo a partir de dicha ejercicio y debido a un cambio legislativo, las entidades han dejado de remitir sus cuentas de forma exhaustiva y las que lo hacen de manera espontánea, en ningún momento ofrecen garantías de constituir una muestra representativa del universo global de cooperativas. Antes al contrario, se observa un importante sesgo hacia las cooperativas de mayor tamaño La única alternativa viable para realizar entonces la inferencia estadística es mediante la adopción de un modelo de superpoblación. Desde una perspectiva empírica y sobre la base de datos de las cooperativas agrarias valencianas Murgui y otros (2005) y Colom y otros (2006) utilizan la metodología de un modelo lineal, en el que los valores económicos de cada ejercicio se consideran auxiliares para la inferencia del ejercicio siguiente, para efectuar un análisis retrospectivo. La aplicación sobre los datos referidos a los años en que se disponía de información censal y muestras simuladas, ha permitido constatar que los resultados obtenidos utilizando muestras que no son representativas ni aleatorias, se ajustan con una precisión aceptable a los parámetros poblacionales, incluso con tamaños muéstrales no excesivamente elevados. Conclusiones IaNo existe un único procedimiento estadístico para aproximamos al conocimiento de una población finita. 2aHan sido las dificultades prácticas que históricamente se han ido planteando las que han generado el desarrollo de las distintas perspectivas metodológicas. 3aDesde un punto de vista empírico no parece adecuado establecer un orden de preferencia entre las distintas perspectivas. Son las circunstancias particulares de cada problema las que inducen a decantarse por una alternativa frente a otra. 4aUno de los problemas abiertos de mayor interés, aunque no el único, es la definición de criterios que permitan comparar el resultado de aplicar distintas aproximaciones a una población finita. En determinados contextos es frecuente disponer de diferentes estimadores y/o diseños para un mismo parámetro, resultando complejo la elección de uno de ellos en particular. 372 Historia de la Probabilidad y la Estadística (IV) Si hubiera que concretar en una frase el objetivo común denominador en las investigaciones por muestreo, resultaría algo parecido a lo siguiente: “Se pretende diseñar las muestras y resolver los problemas de estimación minimizando los costes, maximizando la fiabilidad y precisión de los resultados y, muy especialmente, asegurando la armonización y coherencia de los resultados que se obtengan con los que se generan a través de otras operaciones estadísticas” Bibliografía Bowley, A.L. (1926): “Measurement of the Precision Attained in Sampling”, Bulletin of the International Statistical Institute, Vol. 22 (1), pp. 1-62 of Special annex following p. 451. Brewer, K.R.W. (1999): “Design-based or Prediction-based Inference? Stratified Random vs Stratified Balanced Sampling”, International Statistical Review 67 (1), pp. 35-47. Campos F. J. Y Fernández De Sevilla (2000). Las Relaciones Topográficas de Felipe II: Indices, fuentes y bibliografía. Web del Real Centro Universitario. Escorial-María Cristina. San Lorenzo del Escorial. CASSEL, C.M., SÁRNDAL, C.E. y Wretman, J.FI. (1976): Foundations of Inference in Survey Sampling, John Wiley and Sons, New York. Cochran, W. G. (1953): Sampling Techniques, John Wiley & Sons, New York. COLOM, C. y otros (2006): “Análisis de la evolución de una población finita con muestras repetidas”. IV Congreso de Metodología de Encuestas. (2006) Pamplona. Deming, W. E. (1950): Some theory of Sampling, Wiley, New York. Garrigós Monerris, J.I. (2003): “Frédéric Le Play y su círculo de reforma social”. Papers, Revista de Sociología, núm. 69, 133-146. Hansen, M. H., Hurwitz, W.N. y Madow, W.G. (1953): Sample Survey Methods and Theory. Volume I: Methods and Applications. Volume II: Theory, Wiley, New York. Kiaer, A. N. (1895-6): “Observations et expériences concernant des dénombrement". Discussion appears in Liv. 1, XCIII-XCVII. The meeting was in Berne in 1895. Bulletin of the International Statistical Institute, 9, Liv. 2, 176-183. Kiaer, A. N. (1899): “Sur les méthodes représentatives ou typologiques appliquées à la statistique". Bulletin of the International Statistical Institute, 11, Liv. 2, 180-185. The meeting was in St. Petersburg in 1897. Kiaer, A. N. (1903): “Sur les méthodes représentatives ou typologiques". Bulletin of the International Statistical Institute, 13, Liv. 1, 66-70. Discussion The meeting was in Budapest in 1901. Kiaer, A. N. (1905): “Untitle speech on the representative method". Bulletin of the International Statistical Institute, 14, Liv. 1, 119-126. The meeting was in Berlin in 1903. Kruskal, W.H., and Mosteller, F. (1980): “Representative sampling IV: The history of the concept in Statistics, 1895-1939”, International Statistical Review, 48, pp. 169-195. Lazarsfeld, P.F. (1961): Notes on the History of Quantification in Socilogy-Trends, Sources and Problems. Isi, vol. 52, No. 2, 277-333. Lie, E. (2002): “The rise and fall of sampling surveys in Norway, 1875-1906”. Science in Context. 15 (3), 385-409. 373 Historia de la Probabilidad y la Estadística (IV) Little, R.J.A. y D.B. Rubin (1987): Statistical Analysis with Missing Data, Wiley, New York. Sirken, M.G. (2004): “Network sample surveys of rare and elusive populations: a historical review”. Proceedings of Statistics Canada Symposium. Innovative Methods for Surveyeing Difficult-to-reach Populations. MURGUI, S. y otros (2005): “Diseño y evaluación empírica de una estrategia de predicción por muestreo en cooperativas agrarias”. (2005). Rev. Estadística Española. Vol 47, Número 159, 299-320. MURGUI, S. y otros (2007): “Cálculo de la precisión en el índice de producción industrial” Congreso de Asepelt. Valladolid. Neyman, J. (1934). “On the Two Different Aspects of the Representative Method: The Method of Stratified Sampling and the Method of Purposive Selection”, Journal of the Royal Statistical Society, 97, pp. 558-606. Oh, H. y Scheuren, F.J. (1983): “Weighting Adjustment for Unit Nonresponse” en W.G. Madow, I. Olkim, y D.B. Rubin (editores): Incomplete Data in Sample Surveys: Theory and Bibliographies (Volume 2), Academic Press, New York, pp. 143-184. Rao, J.N.K. (1996). “Developments in sample survey theory: An appraisal”. The Canadian Journal of Statistics, 25, 1-21. Rao, J.N.K., and Bellhouse, D.R. (1990). “History and development of the theoretical foundations of survey based estimation and analysis”, Survey Methodology, 16, pp. 3-29. Royall, R.M. (1970). “On finite population sampling theory under certain linear regression models”, Biometrika, 57, pp. 377-387. Royall, R. M. (1971): “Linear Regression Models in Finite Population Sampling Theory”, en V.P. Godambe y D.A. Sprott (editores): Foundations of Statistical Inference, Holt, Reinhart & Winston de Canada, Toronto. Royall, R.M., AND Herson, J.H. (1973): “Robust estimation in finite populations, I and II”, Journal of the American Statistical Association, 68, pp. 880-889 y 890-893. SÀRNDAL, C.E., B. Swensson y J. Wretman (1992): Model Assisted Survey Sampling, Springer-Verlag, New York. Thomsen, I. Y Siring, E. (1983): “On the Causes and Effects of Nonresponse: Norweigan Experiences”, en W.G. Madow y I. Olkim (editores): Incomplete Data in Sample Surveys: Proceedings of the Symposium (Volume 3), Academic Press, New York, pp. 25-29. Valliant, R., Dorfman, A.H. and Royall, R.M. (2000): Finite Population Sampling and Inference: A Prediction Approach, New York: John Wiley & Sons, New York. Yates F. (1946): “A review of recent developments in sampling and sample surveys (with discussion)”, Journal of the Royal Statistical Society, Vol. 109, No. 1, pp. 12-43. YATES, F. (1949): Sampling Techniques for Censuses and Surveys, Griffin, London. 374