scieee AI-readable full text Open interactive document viewer

La solución del problema de elegir un promedio en Laplace

Basulto Santos, Jesús; Busto Guerrero, Javier; Ortega Irizo, Francisco Javier

Full text

49 LA SOLUCIÓN DEL PROBLEMA DE ELEGIR UN PROMEDIO EN LAPLACE (MEMORIA DE 1774) Jesús Basulto Santos José Javier Busto Guerrero Francisco Javier Ortega Irizo Universidad de Sevilla INTRODUCCIÓN Cuando tenemos la necesidad de estimar una magnitud desconocida µ, realizamos una muestra de mediciones sobre la magnitud, 12 ,,, n xxx K , y procedemos a calcular un valor, ˆ µ , a partir de la mediciones, por medio de algún criterio que nos asegure una buena estimación de la magnitud. La cuestión de estimar una magnitud a partir de un conjunto de mediciones, era denominada en el siglo XVIII el problema de elegir un promedio. Laplace (1749-1827) abordará el problema en 1772 y lo recogerá, como problema 3,en su memoria de 1774 “Mémoire sur la probabilité des causes par les évenemens”. Laplace ha encontrado una solución al problema, de elegir un promedio, en 1772 pero no lo incluirá en su memoria de 1772 “Sur les Séries récurrorécurrentes” por creer que era de poca utilidad. Sólo, después de leer en la revista de astronomía de Jean Bernoulli, que el problema es de gran importancia en astronomía y que Daniel Bernoulli y Lagrange han considerado el problema en sus trabajos de investigación, retomará la solución encontrada en 1772 y la recogerá en su memoria de 1774. HISTORIA DE LA PROBABILIDAD Y DE LA ESTADÍSTICA 50 Laplace partirá de que las mediciones son realizaciones independientes de una variable aleatoria X tal que XZ −µ= , donde Z es una variable aleatoria (v.a.) con una función de densidad conocida ()z φ . La v.a. Z será la Ley de los Errores. El supuesto de que los errores deben seguir una Ley aleatoria ha sido aceptado por muchos investigadores, aunque cada uno de ellos ha propuesto su propia función de densidad. Como explicaremos más adelante, Laplace desarrollará su propuesta únicamente para tres mediciones. Ordenando las tres mediciones 123 ,,xxx en los estadísticos ordenados, 123 yyy ≤≤ , Laplace calculará la densidad conjunta de observar las tres mediciones cuando provienen de una Ley ()Y φ−µ , para todo valor de la magnitud µ, es decir, 123123 (,,)()()() yyyyyy φφ−µφ−µφ−µ % que es nuestra función de verosimilitud. Para Laplace, el valor a priori de la magnitud µ es una v.a. con una función de densidad () πµ . Con lo que la densidad de la v.a., µ, condicionada a las mediciones, vendrá dada por nuestra fórmula de Bayes 123123 (|,,)()(,,|) yyyyyy πµ∝πµφµ Ahora bien, Laplace se apoyará en el principio de la Razón Insuficiente (“si no tenemos una causa para asignar diferentes probabilidades a priori, debemos suponer que todas las probabilidades son iguales de verosímiles”) para suponer que ()1 πµ= , es decir, una función a priori imparcial. Stigler (1986) señala que el principio de razón insuficiente es más que un axioma metafísico, un método para simplificar los cálculos. Bajo el supuesto de tomar una función a priori imparcial, Laplace obtendrá la siguiente función de densidad a posteriori, una vez observadas las tres mediciones, 123123 (|,,)(,,|) yyyyyy πµ∝φµ y al considerar que la integral 123 (,,|) yyyd φµµ ∫ es finita, obtiene la densidad a posteriori siguiente 123 123 123 (,,|) (|,,) (,,|) yyy yyy yyyd φµ πµ= φµµ ∫ LA SOLUCIÓN DEL PROBLEMA DE ELEGIR UN PROMEDIO EN LAPLACE 51 Esta última fórmula es la que propondrá Laplace, al comienzo de su memoria, como un Principio para poder invertir, llamado principio de la probabilidad inversa, el proceso que va de las causas a los sucesos, se invierte para ir de los sucesos a las causas. A partir de aquí, Laplace introducirá la siguiente función de pérdida ˆˆ (,)g µµ=µ−µ donde ˆ µ es una estimación de µ. Laplace tomará como la mejor estimación del valor de la magnitud, µ, el valor µ* que haga mínima la pérdida esperada a posteriori. Es decir, el valor esperado de la función de pérdida cuando µ sigue la función a posteriori. Por razonamientos geométricos, Laplace probará que µ* debe ser la mediana de la densidad a posteriori de la v.a. µ. Es decir, * 123 1 (|,,) 2 yyyd µ −∞ πµµ= ∫ Ahora bien, si queremos que esta fórmula sea útil necesitamos especificar la función de densidad ()z φ , es decir debemos elegir la Ley o Curva de los Errores. Laplace rechazará la hipótesis de que la curva de los errores es uniforme, ()zk φ= en un intervalo finito centrado en el cero. La razón es que son más probables errores pequeños que grandes. Igualmente rechazará la hipótesis de que la curva sea triangular, () zk ′ φ= en un intervalo finito centrado en el cero, ya que cree que esta derivada debe disminuir cuando aumenta z. Laplace supondrá que la curva de los errores debe verificar que sea simétrica respecto de cero y que ()() zzk ′ φφ=− para 0 z > . Estas hipótesis le conducirá a que la curva de los errores sea () 2 kz k ze − φ= que hoy denominamos distribución de Laplace o doble exponencial. Una vez elegida la curva de los errores, Laplace obtiene la siguiente fórmula para la mediana a posteriori, 11 *ln1 33 kpkq ee yp k −−  µ=+++−   HISTORIA DE LA PROBABILIDAD Y DE LA ESTADÍSTICA 52 donde 21 pyy =− , 32 qyy =− , suponiendo que pq > . La constante k es conocida. Laplace observa que cuando k tiende a cero, entonces µ* se aproxima a la media aritmética. Igualmente, cuando k tiende a infinito, entonces µ* se aproxima a la mediana de las mediciones, que es el máximo de la función de verosimilitud. Resuelto el problema, Laplace emprende estimar µ cuando el parámetro k es desconocido. De nuevo Laplace utiliza el principio de la razón insuficiente para el vector (µ, k), proponiendo como función a priori (,)1 k πµ= . El principio de la probabilidad inversa le lleva a la siguiente distribución a posteriori, 123123 (,,,)(,,,) kyyyyyyk πµφµ % donde la distribución a posteriori para µ, es 123123 0 (|,,)(,|,,) yyykyyydk ∞ πµ=πµ ∫ y la mediana de esta distribución es el valor µ* que verifica la siguiente ecuación, * 123 1 (|,,) 2 yyyd µ −∞ πµµ= ∫ y esta última ecuación es equivalente a la siguiente, * 123123 00 1 (,|,,)(,|,,) 2 kyyyddkkyyyddk µ ∞∞∞ −∞−∞ πµµ=πµµ ∫∫∫∫ que haciendo el cambio de variable 1 y θ=µ− , y teniendo en cuenta las definiciones de p y q se transforma en * 00 1 (,,)(,,) 2 kpqddkkpqddk ∞θ∞∞ −∞−∞ πθθ=πθθ ∫∫∫∫ que a su vez es equivalente a * 00 1 (,,)(,)(,,)(,) 2 kpqkpqddkkpqkpqddk ∞θ∞∞ −∞−∞ πθπθ=πθπθ ∫∫∫∫ Ahora, teniendo en cuenta que se verifica LA SOLUCIÓN DEL PROBLEMA DE ELEGIR UN PROMEDIO EN LAPLACE 53 (,,|)(,|,) pqkkpq πθ∝πθ (*) (ver fórmulas (1) y (2) más adelante), donde la proporcionalidad actúa sobre ambas funciones y las funciones dependen de las variables θ y k, obtenemos la siguiente ecuación * 00 * 2(2)2() 00 1 (,,)(,,) 2 133 kpkq kpqkpq pqkddkpqkdd ee kedkkedk ∞θ∞∞ −∞−∞ ∞∞−− −+−θ−+ πθθ=πθθ⇒  ⇒=+−   ∫∫∫∫ ∫∫ que conduce a la ecuación de grado tres: 1 33 33(2)(2) * (2)()33 pqpq pqpq − −− −  ++ +−θ=++−   donde hemos supuesto que pq > . Ahora bien, según señala Stigler(1986), Laplace ha cometido un error al calcular θ*, ya que en vez de utilizar la expresión (*), utilizó la siguiente: (,,)(,,) pqkpqk πθπθ% lo que le llevó a la ecuación * 00 * 2(2)2() 00 1 (,,)(,)(,,)(,) 2 (,)1(,) 33 kpkq kpqkpq pqkkpqddkpqkkpqddk ee kekpqdkkekpqdk ∞θ∞∞ −∞−∞ ∞∞−− −+−θ−+ πθπθ=πθπθ⇒  ⇒π=+−π   ∫∫∫∫ ∫∫ que finalmente le condujo a la ecuación de grado 15: 55 5 555 5 ** (42)(33) * (32)33 2(23)(42)(24) (32)399 pqpq pq pqpqpq pq −− − −−− − +−θ+−θ +−θ−−= +++ =+−−+ donde hemos supuesto que pq > . Laplace probará que sólo existe una raíz válida (que la mediana sea una raíz de una ecuación de grado 15 explica por qué Laplace tomó sólo tres mediciones). HISTORIA DE LA PROBABILIDAD Y DE LA ESTADÍSTICA 54 Stigler conjetura que este error fue debido a que, en tiempos de Laplace, no se tenía una idea clara del concepto de probabilidad condicionada. No obstante, analizando el camino seguido por Laplace, tal vez pueda darse otra interpretación al error cometido y que le llevó a la ecuación errónea. En primer lugar, Laplace calcula la distribución marginal a posteriori de k, obteniendo 2() (|,)1 33 kpkq kpqee kpqke−− −+  π∝−−   donde se observa que depende sólo de p y q. A continuación, obtiene una ecuación que le permite calcular la mediana a posteriori para cada valor de k conocido, valor que Laplace llamó x y que nosotros vamos a llamar θ*(k), ya que se trata de una función que depende del valor de k. Dicho valor ha de verificar * 2(2())2() 1 33 kpkq kpqkkpqee keke−− −+−θ−+  =+−   y al tomar esperanzas en ambos miembros, obtenemos * 2(2())2() 00 (|,)1(|,) 33 kpkq kpqkkpqee kekpqdkkekpqdk ∞∞−− −+−θ−+ π=+−π   ∫∫ Laplace resolverá las integrales pero considerando un θ* fijo que no depende de k, lo que le conduce a resolver la ecuación incorrecta indicada anteriormente. Aunque las soluciones que se obtienen son diferentes, cálculos realizados por Stigler y por nosotros, nos llevan a sostener que la diferencia entre ellas es muy pequeña. A partir de aquí, nuestro trabajo consta de la sección 2, donde obtenemos, para k conocida, los resultados de Laplace. En esta sección discutimos la obtención de la función a priori imparcial ()1 πµ= , señalamos que p y q son estadísticos conjuntamente auxiliares y demostramos que los intervalos bayesianos se comportan como intervalos de confianza, en muentras condionadas a los estadísticos auxiliares p y q. En la sección 3 consideramos que k es desconocido, discutimos la función a priori de Laplace (,)1 k πµ= y probamos que si eligimos una función a priori imparcial del tipo (,)1 kk πµ= , entonces los intervalos bayesianos se comportan como intervalos de confianza, cuando se condiciona a los estadísticos auxiliares p y q. Por último, finalizamos el trabajo con una discusión del trabajo de Laplace. LA SOLUCIÓN DEL PROBLEMA DE ELEGIR UN PROMEDIO EN LAPLACE 55 ESTIMACIÓN DE µ CUANDO k ES CONOCIDO A partir de la curva de errores (|,) 2 kx k fxke −−µ µ= donde R µ∈ , 0 k > y xR ∈ , y los estadísticos ordenados { } 123 ,, yyyy =, obtenemos la siguiente función de verosimilitud 3 1 (|,)i i ky Lkye = −−µ ∑ µ∝ que posee un máximo en 2 ˆ y µ= que denominamos estimador máximo verosímil. Llamando 21 pyy =− , 32 qyy =− , podemos escribir la función de verosimilitud de la forma siguiente, ˆˆˆ () ˆ (|,,,)kpq Lpqke −µ−µ−+µ−µ++µ−µ µµ∝ que si ahora tomamos como función imparcial, ()1 πµ= , obtenemos la siguiente distribución a posteriori ˆ (|,,,) ˆ (|,,,) ˆ (|,,,) Lpqk pqk Lpqkd ∞ −∞ µµ πµµ= µµµ ∫ y haciendo el cambio de variable 1 y θ=µ− obtenemos () (|,,)(,,) kppq e pqkIpqk −θ+−θ++−θ πθ= donde () 2 (,,)1 33 kpkq kpqee Ipqke k −− −+  =−−   Ahora, si consideramos la función de pérdida absoluta de Laplace, podemos probar que el valor de µ que minimiza la perdida esperada a posteriori es la mediana de la distribución a posteriori. Llamando µ* al valor de la mediana, éste debe ser solución de la ecuación siguiente, HISTORIA DE LA PROBABILIDAD Y DE LA ESTADÍSTICA 56 * 1 ˆ (|,,,) 2 pqkd µ −∞ πµµµ= ∫ y, si suponemos que los tres estadísticos ordenados son diferentes, entonces se demuestra que para pq > resulta 12 * yy <µ< , si pq < entonces 23 * yy <µ< y si pq = entonces 2 * y µ= . Si ahora suponemos que pq > , entonces es fácil probar que 11 *ln1 33 kpkq ee yp k −−  µ=+++−   Estos resultados de Laplace contienen ideas que han sido fundamentales para el desarrollo posterior de la inferencia estadística. En primer lugar vamos a obtener la distribución conjunta de los estadísticos ordenados, 3 1 3 123 (,,|,)3! 2 i i ky k fyyyke = −−µ ∑  µ=   que si hacemos el cambio de variables: { } 12132 ,,ypyyqyyθ=µ−=−=− obtenemos 3 () (,,|)3! 2kppq k fpqke −θ+−θ++−θ  θ=  (1) que no depende de µ. La distribución marginal de los estadísticos p y q, es 3 (,|)3!(,,) 2 k fpqkIpqk  =   que al no depender de µ son denominados estadísticos auxiliares. La distribución de la v.a. θ, condicionada a los estadísticos auxiliares, no depende de la cantidad desconocida µ, () (|,,)(,,) kppq e fpqkIpqk −θ+−θ++−θ θ= que coincide con la función (|,,) pqk πθ . Al depender θ de µ y del estadístico 1 y , recibe el nombre de cantidad pivotal. Igualmente se prueba que la marginal de θ no depende de µ. LA SOLUCIÓN DEL PROBLEMA DE ELEGIR UN PROMEDIO EN LAPLACE 57 Laplace ha resuelto el problema de elegir un promedio para una curva doble exponencial. Construye una función de densidad sobre el parámetro µ a partir de la muestra observada, y esta función mide la incertidumbre que tenemos sobre dicho parámetro. En cambio, Lagrange ha tomado la media aritmética y ha calculado su distribución en el muestreo, con el objeto de apoyar su elección. Todas las muestra del mismo tamaño intervienen en la solución de Lagrange, la observada y el resto. Sabemos que la estadística que se impuso en el primer cuarto de nuestro siglo va a seguir el camino de Lagrange. Ahora bien, Fisher va a retomar los resultados de Laplace y va a proponer un camino intermedio, entre una muestra y todas las muestras. Fisher propondrá el Principio de Condicionar a estadísticos auxiliares. Este principio consiste en trabajar con muestras que tienen los mismos valores para los estadísticos auxiliares calculados en la muestra observada. Es decir, si 2 p = y 1 q = , sólo consideraremos muestra de tamaño 3 n = donde 2 p = y 1 q = . Por lo tanto, en la construcción de un intervalo de confianza para µ, deberemos utilizar la distribución (|,,)fpqk θ . Fisher también retomará la idea de asignar una función de densidad al parámetro desconocido µ. Ahora bien, Fisher rechazará las funciones a priori uniformes de Laplace por cambiar frente a transformaciones de los parámetros. Es decir, si ()1 πµ= , el principio de razón insuficiente conduce a que 2 ()1 πµ= , que no está de acuerdo con la regla del cambio de variable. Fisher inventará la denominada Inferencia Fiducial, cuyo objetivo es determinar una función de densidad para µ a partir de una muestra observada. Una solución al problema de determinar la funciones a priori de Laplace va a surgir de Jeffreys (ver su libro de 1961). La idea de Jeffreys consiste en definir en el conjunto de los modelos de Laplace, (|,) 2 kx k fxke −−µ µ= con conocido, la denominada distancia de Hellinger entre dos modelos dis tintos, es decir ( ) 2 1212 1212 (,)(|,)(|,) Hfykfykdy ∞ −∞  µµ=µ−µ  ∫ que llamando 21 h =µ−µ , obtenemos que la distancia de Hellinger vale ( ) ( ) 22 121 (,)412 2 khkh Hekhe −− µµ=−−