Distribuciones no informativas en modelos truncados no regulares: modelos de búsqueda de empleo
Abstract
Ofrecemos una vía de generalización de la Regla de Jeffreys para la obtención de distribuciones a priori, que puede aplicarse también a modelos no regulares. El análisis del caso unidimensional nos permitirá también obtener las distribuciones a priori en modelos multidimensionales, al menos en algunas situaciones específicas. A partir de estas distribuciones, podemos aplicar las técnicas de la Inferencia Bayesiana a aquellos modelos económicos en los que aparecen “parámetros no regulares”, como son los modelos de búsqueda de empleo, de subastas del sector público, etc.
Full text
DISTRIBUCIONES NO INFORMATIVAS EN MODELOS TRUNCADOS NO REGULARES: MODELOS DE BÚSQUEDA DE EMPLEO. BASULTO SANTOS, Jesús Departamento de Economía Aplicada I Universidad de Sevilla Correo-e: [email protected] ORTEGA IRIZO, Fco. Javier Departamento de Economía Aplicada I Universidad de Sevilla Correo-e: [email protected] RESUMEN Ofrecemos una vía de generalización de la Regla de Jeffreys para la obtención de distribuciones a priori, que puede aplicarse también a modelos no regulares. El análisis del caso unidimensional nos permitirá también obtener las distribuciones a priori en modelos multidimensionales, al menos en algunas situaciones específicas. A partir de estas distribuciones, podemos aplicar las técnicas de la Inferencia Bayesiana a aquellos modelos económicos en los que aparecen “parámetros no regulares”, como son los modelos de búsqueda de empleo, de subastas del sector público, etc. Palabras Clave: Inferencia Bayesiana, Distribución a priori no informativa, modelo no regular, modelos de búsqueda de empleo.
2 1. Introducción. Dentro del marco de la Inferencia Bayesiana, la obtención de una distribución a priori no informativa es un problema interesante, que ha generado gran cantidad de literatura. En la única situación en la que parece haber total acuerdo es en el caso de modelos uniparamétricos regulares, en el que suele optarse por la distribución obtenida a partir de la Regla de Jeffreys. Cuando los modelos tienen más de un parámetro, y más aún si no se cumplen las condiciones de regularidad usuales, existen multitud de propuestas para obtener las distribuciones a priori; cabe destacar la referencia a priori de Bernardo (Bernardo y Smith, 1994) por ser quizás la opción más habitualmente utilizada en estos últimos casos. La distribución a priori de Jeffreys se basa, como es conocido, en el concepto de Información de Fisher, que adquiere sentido sólo bajo condiciones de regularidad. Por ello, nuestra propuesta de obtención de distribuciones a priori en modelos no regulares se basará en una medida de Información aplicable a modelos no regulares (denominada Información de Akahira) y a su relación con la Información de Fisher. De esta forma, ofrecemos una generalización de la Regla de Jeffreys para modelos no regulares uniparamétricos. La construcción de la distribución a priori para modelos de más de un parámetro, se hará siguiendo los caminos más usuales utilizados hasta ahora en la literatura sobre el tema, que en definitiva consisten básicamente en obtener la distribución conjunta a partir de distribuciones unidimensionales (bien marginales o bien condicionadas), si bien este es un tema que permanece aún bastante abierto y al que no se ha ofrecido una respuesta general satisfactoria. Existen multitud de ejemplos de modelos no regulares en economía (Sareen, 2003). Nosotros vamos a ocuparnos de un modelo estacionario de búsqueda de empleo propuesto en Lancaster, 1997. En este modelo, uno de los parámetros desconocidos es el denominado “salario de reserva” (ξ), que es el valor mínimo a partir del cual el trabajador acepta la oferta de trabajo. Así, un trabajador sólo acepta una oferta con salario W si se verifica W>ξ; esta dependencia del recorrido de la variable W del parámetro desconocido ξ hace que el modelo no verifique las condiciones usuales de regularidad. Ofrecemos una solución parcial para este modelo, en el caso de que supongamos que la variable W sigue una distribución uniforme de extremos
3 desconocidos; la obtención de la distribución a priori para otros casos es una cuestión que queda abierta para futuros trabajos. A partir de aquí, el trabajo se estructura como sigue. En la sección 2, definimos la Información de Fisher y la de Akahira, así como la relación fundamental que puede establecerse entre ambas. En la sección 3, ofrecemos nuestra propuesta de obtención de la distribución a priori no informativa en el caso uniparamétrico, una fórmula cómoda de cálculo aplicable bajo ciertas condiciones y analizamos las propiedades de la distribución obtenida. En la sección 4, se describe la obtención de la distribución conjunta a partir de las condicionadas unidimensionales, ofreciéndose una solución parcial aplicable en ciertos casos interesantes. En la sección 5, se expone brevemente el modelo de búsqueda de empleo propuesto por Lancaster, 1997 y se obtiene la distribución a priori no informativa conjunta, a partir de la cual podemos obtener las distribuciones marginales a posteriori de forma exacta. Por último, en la sección 6 se exponen las conclusiones fundamentales y las cuestiones no resueltas. 2. Información de Fisher e Información de Akahira. 2.1. Información de Fisher Consideremos una familia de distribuciones P θ , k θ∈Θ⊆con funciones de densidad () fx|θ, verificando las condiciones estándar de regularidad (Azzalini,1996, p.71 ). Como es conocido, a partir de las hipótesis de regularidad pueden obtenerse las dos propiedades siguientes: 1. logf(x | ) E0 θ ∂θ ⎡⎤ = ∀θ ⎢⎥ ∂θ ⎣⎦ y 2. () 22 2 logf x | logf(x | ) EE θθ ⎡⎤ ⎛∂ θ ⎞ ⎡⎤ ∂θ ⎢⎥ = −∀θ ⎜⎟ ⎢⎥ ⎜⎟ ∂θ ∂θ ⎢⎥ ⎣⎦ ⎝⎠ ⎣⎦ . Definición: Se llama Información de Fisher que la variable X proporciona sobre el parámetro k θ∈Θ⊆ a 2 X logf(x | ) I() E θ ⎡ ⎤ ∂θ ⎛⎞ θ= ⎢ ⎥ ⎜⎟ ∂θ ⎝⎠ ⎢ ⎥ ⎣ ⎦. Bajo las hipótesis de regularidad, aplicando la propiedad 2, se obtiene que
4 ( ) 2 X2 logf x | I() E θ ⎡ ⎤ ∂ θ θ=− ⎢ ⎥ ∂θ ⎢ ⎥ ⎣ ⎦. Nota: En el caso de más de un parámetro, bajo las hipótesis de regularidad, podemos definir la matriz de Información de Fisher como: t2 t logf(x | ) logf(x | ) logf(x | ) I( ) E E , θθ ⎡⎤ ⎡ ⎤ ∂θ∂θ ∂ θ ⎛⎞⎛⎞ θ= =− ⎢⎥ ⎢ ⎥ ⎜⎟⎜⎟ ∂θ ∂θ ∂θ∂θ ⎝⎠⎝⎠ ⎢⎥ ⎣ ⎦ ⎣⎦ es decir, () 2 i,j ij logf(x | ) I( ) Eθ ⎡⎤ ∂θ θ=−⎢⎥ ∂θ ∂θ ⎢⎥ ⎣⎦ . A partir de los trabajos de Jeffreys, 1946, 1961, el concepto de Información de Fisher tomó relevancia dentro del enfoque Bayesiano, ya que dada una reparametrización biyectiva y regular ϕ=ϕ(θ) (donde suponemos que ambos parámetros son unidimensionales), se verifica que 2 I( ) I( ) ϕ =θ∂θ∂ ϕ y por tanto, la regla de obtención de distribuciones a priori consistente en tomar () I() π θ∝ θ es invariante ante reparametrizaciones, ya que verifica () I() I() () ∂ θ∂θ πϕ ∝ ϕ = θ =πθ ∂ ϕ∂ϕ . Así, este autor propuso la llamada regla de Jeffreys para construir distribuciones a priori no informativas basándose en el concepto de Información de Fisher. En el caso univariante, esta es la opción actualmente más aceptada. La importancia del concepto de Información de Fisher es indudable, aunque eso sí, recordando siempre que sólo es aplicable a modelos regulares. Por ello, es natural plantearse si habrá alguna forma de generalizar este concepto o al menos definir una medida de información aplicable a modelos no regulares y que tenga en esencia todas las propiedades de la Información de Fisher.
5 2.1. Información de Akahira. Existen varias definiciones alternativas de medidas de información aplicables a modelos no regulares, aunque nosotros vamos a trabajar sólo con la que utilizan Akahira y Takeuchi, 1991. Consideremos una familia de distribuciones de probabilidad cuyas funciones de densidad, con respecto a la medida de Lebesgue, sea ( ) { } fx| ,θθ∈Θ⊆y 1n X ,...,X una muestra aleatoria simple del modelo ( ) fx| θ . Definimos la cantidad de información entre () 1 f|θi y () 2 f| θ icomo: 1 1/2 1/2 X12 1 2 J ( , ) 8log f(x | ) f(x | ) dxθθ =− θ θ ∫. La integral que aparece en la definición es conocida como la afinidad entre () 1 f|θi y () 2 f|θi (que llamaremos 1 X12 A(, ) θ θ). Podemos observar de forma trivial que: i) Si 12 θ=θ, entonces la afinidad es uno (es decir, la afinidad de una variable consigo misma es uno); ii) Si ( ) ( ) 12 sop X | sop X |θ∩ θ =∅, entonces la afinidad entre las distribuciones es cero (donde ( ) i sop X | θ representa el soporte de la densidad i f(x| )θ). La afinidad es una medida de “similitud” entre distribuciones, que toma valores entre 0 y 1 (Matusita, 1955, Le Cam, 1990). Al ser la información una función decreciente de la afinidad, obtendremos que la información es una medida de “discrepancia” entre distribuciones. Remarquemos también que la información entre dos variables estará comprendida entre 0 e infinito, alcanzándose estos valores en los dos casos extremos reseñados anteriormente. Indiquemos que la Información de Akahira, reproduce las tres propiedades más importantes de la información de Fisher (Ortega y Basulto, 2003). Ejemplo 2.1: Consideremos el modelo Exponencial de parámetro θ>0, cuya función de densidad es () x fx| e ,x 0, 0 −θ θ=θ > θ> . En este caso, 12 ,0∀θ θ > , tenemos 12 12 1 2 A( , ) 2 ( ) θ θ= θθ θ+θ y por tanto, ( ) 12 12 1 2 J( , ) 8log 2 ( )θθ =− θθ θ+θ .
6 Ejemplo 2.2: Consideremos el modelo ( ) U½,½θ− θ+ , θ ∈. Dados dos valores θ1 y θ2, en este caso obtenemos: 21 21 1 2 12 1 2 1 2 1 2 12 8log(1 ) si y sop(X ) sop(X ) J( , ) 8log(1 ) si y sop(X ) sop(X ) si sop(X ) sop(X ) −+θ−θθ≥θ ∩ ≠∅ ⎧ ⎪ θθ =− +θ−θ θ≥θ ∩ ≠∅ ⎨+∞ ∩ = ∅ ⎪ ⎩ donde ( ) iii XU ½, ½,i1,2.θ− θ+ =∼ Esta fórmula, puede ser resumida en 12 12 12 12 8log(1 ) si 1 J( , ) si 1. ⎧− −θ −θ θ −θ ≤ θθ = ⎨ + ∞θ−θ> ⎩ 2.2.3 Relación entre las Informaciones de Fisher y de Akahira. En el caso de modelos regulares, existe una conexión entre ambas medidas de información reflejada en la siguiente proposición, cuya demostración puede verse en Akahira y Takeuchi, 1991. Proposición: En los modelos regulares, para h suficientemente pequeño se verifica: 22 J( , h) I( )h o(h )θθ+ = θ + . A partir de la proposición, podemos establecer inmediatamente el siguiente corolario: Corolario: En los modelos regulares, se verifica 2 h0 J( , h) I( ) lim h → θ θ+ θ= . De este corolario, podemos extraer las dos conclusiones siguientes: a) Tenemos que ( ) J, h θ θ+ tiende a cero cuando h tiende a cero (para cualquier valor de θ) y además la velocidad de esta convergencia es del orden de h2.
7 b) Dado un h pequeño y fijo, mientras mayor sea ( ) I θ , “más distintas” serán ( ) fx| θ y () fx| hθ+ y, por tanto, mayor será la “capacidad de discriminación” entre θ y θ+h. Ejemplo 2.1 (continuación): Consideremos el modelo Exponencial de parámetro θ>0, cuya función de densidad es ( ) x fx| e ,x 0 −θ θ =θ > . Hemos obtenido 12 J( , )θθ , de donde deducimos que ( ) J( , h) 8log 2 ( h) (2 h)θθ+ =− θθ+ θ+ . Además, puede comprobarse que la primera y segunda derivadas respecto de h son: J( , h) 4h J'( , h) h(h)(h2) ∂θθ+ =θθ+= ∂+θ+θ y 222 222 J( , h) 4(2 h ) J''( , h) h(h)(h2) ∂θθ+ θ− =θθ+= ∂ +θ + θ . Así, h0 h0 J( , h) lim lim J'( , h) 0 h →→ θθ+ = θθ+ = y 1 2X 2 h0 h0 J( , h) lim lim J''( , h) 1/ I ( ). h →→ θ θ+ = θθ+ = θ = θ Indiquemos que Pitman, 1979, adopta como definición de modelo regular la existencia de ( ) ( ) 2 h0 lim J , h h →θθ+ , resaltando que para que se cumpla esta propiedad no es necesario que el recorrido de la variable no dependa del parámetro. En efecto, si consideramos el modelo cuya densidad es: (x) 2 1 f(x| ) e (x ) x 2 θ− θ= −θ ≥θ , es fácil comprobar que se verifican: 1. h0 J( , h) logf(x| ) lim E 0. |h| → θθ+ ∂ θ ⎡⎤ == ⎢⎥ ∂θ ⎣⎦ 2. () () 22 22 h0 logf x | logf x | J( , h) lim 1 E E h → ⎡⎤ ⎡ ⎤ ⎛∂ θ ⎞ ∂ θ θθ+ ⎢⎥ == =− ⎢ ⎥⎜⎟ ⎜⎟ ∂θ ∂θ ⎢⎥ ⎢ ⎥ ⎝⎠ ⎣ ⎦ ⎣⎦ , y por tanto este modelo sería regular, aunque el recorrido dependa del parámetro. Nota 1: La definición que hemos utilizado puede ampliarse de la forma:
8 () 1 11 22 X12 1 2 2 8 J(, ) logf(x|) f(x| ) dx, 1 1 1 −α +α θθ =− θ θ −<α< −α ∫, aunque nosotros sólo trabajaremos con el caso 0 α =. Nota 2: Obsérvese cómo la información puede calcularse sin problemas en el caso de más de un parámetro. De hecho, la definición de información puede establecerse de forma más general usando directamente medidas de probabilidad. En concreto, en Akahira y Takeuchi, 1991, la definición que se ofrece es: Dada una variable aleatoria X definida sobre un espacio muestral χ y P y Q medidas absolutamente continuas respecto a una medida σ-finita µ, definimos la cantidad de información entre P y Q como: 1/2 1/2 dP dQ J(P,Q) 8log d dd ⎛⎞⎛⎞ = −µ ⎜⎟⎜⎟ µµ ⎝⎠⎝⎠ ∫. La definición ofrecida inicialmente en este trabajo no es más que un caso particular, donde P y Q son las medidas de probabilidad inducidas por las variables correspondientes a los parámetros θ1, θ2, la medida σ-finita considerada es la de Lebesgue y las derivadas respecto a esta medida son las funciones de densidad de las variables. 3. Obtención de distribuciones a priori no informativas. Caso uniparamétrico. 3.1. Elección de la distribución a priori. Tras observar la relación entre ambas medidas de información en los modelos regulares, nos podemos preguntar qué ocurriría en el caso de considerar un modelo no regular. Antes de pasar a resultados generales, vamos a ver un ejemplo. Ejemplo 3.1: Consideremos el modelo ( ) ( ) U0, , 0, θ θ∈ +∞ , con función de densidad 1 f(x| ) , 0 x − θ=θ ≤ ≤θ. Como es conocido, este modelo es no regular, puesto que
9 1 f(x, )dx 0 f(x, )dx ∂∂ θ=−≠= θ ∂θ θ ∂θ ∫∫ . Para h>0 obtendremos ( ) J( , h) 4log hθθ+ =− θθ+ mientras que para h<0 se tendrá ( ) J( , h) 4log hθθ+ =− θθ+ , por lo que en este modelo se verifica 2 h0 J( , h) lim h → θθ+ = +∞. Es decir, J(θ,θ+h) converge a cero cuando h tiende a cero, pero la velocidad de esta convergencia es inferior a la de h2. Sin embargo, podemos comprobar que dicha convergencia es tan rápida como la de ⏐h⏐. En efecto, cálculos elementales de límites nos llevan a: h0 h0 J( , h) J( , h) lim lim 4/ hh +− →→ θθ+ θθ+ = =θ. Hemos visto así que en ambos casos (modelo regular y no regular) se tiene h0 lim J( , h) 0 →θθ+ = (recordar que ( ) J, 0θθ = ), si bien la velocidad de esta convergencia es más rápida en los modelos regulares que en el modelo uniforme. Sabemos que en los modelos regulares (con un único parámetro) la distribución a priori no informativa comúnmente aceptada es la de Jeffreys, a saber, () 1/2 () I()πθ ∝ θ que podemos escribir a partir del corolario como 1/2 2 h0 J( , h) () lim h → ⎛⎞ θθ+ πθ∝⎜⎟ ⎜⎟ ⎝⎠ . Según el ejemplo visto anteriormente de la distribución uniforme, y puesto que la convergencia es del orden de ⏐h⏐, proponemos como distribución a priori para el parámetro θ h0 J( , h) ( ) lim h → θ θ+ πθ∝ . De forma global, nuestra propuesta es la siguiente:
16 Aunque este resultado general es bastante importante, existen varios ejemplos en los que la coincidencia de resultados entre la inferencia bayesiana y clásica es exacta (Ortega y Basulto, 2003) 4. Distribuciones multiparamétricas. Cuando hay más de un parámetro, es decir, cuando m θ∈Θ⊆, la regla general de Jeffreys, aplicable al caso regular, consiste en tomar () I() π θ∝ θ , donde ( ) I θ representa el determinante de la matriz de información, lo que sigue asegurando la invarianza ante reparametrizaciones arbitrarias. No obstante, esta opción presenta deficiencias importantes, que hacen que en muchos casos no sea la opción habitualmente elegida (Jeffreys, 1961, Ortega y Basulto, 2003). Para evitar estos inconvenientes, Jeffreys sugirió una modificación para su regla general en el caso multiparamétrico que debía aplicarse en los modelos con parámetros de localización y escala y que resulta equivalente a obtener la distribución de cada parámetro suponiendo que los otros son fijos y posteriormente, la distribución multiparamétrica será el producto de las correspondientes unidimensionales (Jeffreys, 1961, p.182-183). El camino más usual para la construcción de distribuciones a priori multidimensionales consiste en obtener las mismas a partir de ciertas distribuciones unidimensionales (marginales o condicionadas), dependiendo el proceso seguido y la distribución a priori obtenida de si se considera que alguno de los parámetros es el de interés, siendo el resto parámetros “perturbadores”, o si, por el contrario, se considera que todos los parámetros son de interés (Bernardo y Smith, 1994, Nicolau, 1993). Supongamos por simplicidad que ( ) 2 12 ,θ= θ θ ∈Θ⊆; además, vamos a suponer también que en nuestro problema ambos parámetros son de interés. En este caso, un camino posible es obtener las distribuciones condicionadas ( ) 1|2 1 2 π θθ y ( ) 2|1 2 1 πθθ aplicando la regla de obtención de distribuciones unidimensionales y buscar posteriormente una distribución conjunta ( ) 12 , π θθ compatible con ambas condicionadas, que no siempre tiene por qué existir (Arnold y otros, 1999). Un problema importante de este tipo de procedimientos es que, por ejemplo, la distribución ( ) 1|2 1 2 πθθ quedará
17 determinada salvo una constante arbitraria que puede depender de θ2, y que posteriormente influye en la obtención de la distribución conjunta. De esta forma, al aplicar una regla uniparamétrica al parámetro θ1 suponiendo que θ2 es fijo, obtendremos una expresión del tipo 1|2 1 2 1|2 1 2 1|2 2 (|)g(,)C() π θθ∝ θθ θ, donde 1|2 2 C()θ es una función arbitraria. De forma análoga, tendremos 2|1 2 1 2|1 1 2 2|1 1 (|)g(,)C()πθθ∝ θθ θ. En el caso particular de que se verifiquen: ** 1|2 1 2 1|2 2 1|2 1 1|2 2 2|1 1 2 2|1 1 2|1 2 2|1 1 g(, )C()h()h()yg(, )C()h()h()θθ θ = θ θ θθ θ = θ θ y siguiendo a Nicolau, 1993 y Ghosal, 1999, proponemos elegir 12 1|21 2|12 (, ) h()h()πθ θ ∝ θ θ . Observemos que en este caso, como indica Nicolau, 1993, podemos considerar que ambos parámetros son independientes a priori; la elección de tomar ambas constantes arbitrarias iguales a 1 es la que conlleva a que las distribuciones condicionadas coincidan con las correspondientes marginales. Aunque la solución ofrecida es parcial, es necesario observar que esta situación es interesante y muy frecuente en la práctica (Ghosal, 1999) , sobre todo cuando en el modelo uno de los parámetros es regular y el otro no regular. Ejemplo 4.1: Consideremos el modelo de Pareto, cuya densidad viene dada por (1 ) f(x| , ) x , x , , 0. ϕ−+ϕ ηϕ =ϕη >η ηϕ> Si consideramos que η es conocido (y por tanto fijo), el modelo cumple las condiciones de regularidad; diremos que el modelo es regular con respecto al parámetro ϕ o que “el parámetro ϕ es regular”. Por el contrario, si consideramos conocido el valor de ϕ, el modelo no verifica las hipótesis de regularidad, por lo que diremos que “el parámetro η es no regular”. Ahora, podemos obtener los núcleos de las distribuciones a priori condicionadas, aplicando la regla univariante. Sea ( ) (, |x) logfx|, η ϕ= ηϕ. A) Si consideramos η conocido, por ser ϕ regular, la distribución a priori de |ϕη será proporcional a la Información de Fisher del modelo (cuando η es conocido). Es fácil comprobar que 22 2 E− ⎡⎤ ∂ ∂ϕ = −ϕ ⎣⎦ , y por tanto, obtendremos ( ) 11 |C() − π ϕη∝ϕ η.
18 B) Si consideramos ϕ conocido, el modelo es no regular y verifica las condiciones señaladas en la sección 3.2. Teniendo en cuenta que [ ] E ∂ ∂η = ϕ η, obtendremos 12 (|) C() − πηϕ∝η ϕ. Como puede apreciarse, ambas condicionadas pueden descomponerse en producto de funciones que dependen cada una de un solo parámetro, por lo que la distribución a priori conjunta que proponemos es ( ) 11 ,. − − π ηϕ ∝η ϕ Ejemplo 4.2: Consideremos la familia de localización-escala: 10 f(x, ) f ((x )/ ), , 0 − θ= ϕ −θ ϕ θ∈ ϕ > donde ( ) 0 fz es una densidad en el intervalo [ ) 0,+∞ . Supongamos que el parámetro ϕ es regular y que 0 f(0) 0 + ≠, es decir, que el parámetro θ es no regular. En este caso, se verifican: 2 12 02 Ef(0);Ek, −− ⎡⎤ ∂∂ ⎡⎤ =ϕ + − = ϕ ⎢⎥ ⎢⎥ ∂θ ⎣⎦ ∂ϕ ⎣⎦ donde 2 ' 00 0 k1xf(x)/f(x)f(x)dx ⎡⎤ =+ ⎣⎦ ∫ por lo que () 1 |1·C()πθϕ∝ ϕ y ( ) 12 |·C() − πϕθ∝ϕ θ, es decir, las condicionadas pueden descomponerse en producto de funciones dependientes de cada uno de los parámetros y por lo tanto la distribución a priori conjunta será ( ) 1 ,. − π θϕ ∝ϕ En el caso de que no se cumpla esta propiedad, siempre quedaría la opción de buscar una reparametrización para la cual sí se verifique. Ejemplo 4.3: Consideremos el modelo Uniforme en (,) α β, cuya densidad viene dada por 1 f(x| , ) ( ) , x , . − αβ = β−α α≤ ≤β α<β∈ En este caso, ambos parámetros son no regulares, verificándose las condiciones de la sección 3.2 si consideramos alguno de los parámetros fijo. Siendo (,|x) logf(x|,)αβ = αβ, podemos comprobar fácilmente que [][] 1 EE() − ∂∂α= ∂∂β=β−α , con lo que obtendríamos 11 (|) ( )C() − π α β ∝ β−α β y 12 (|) ( )C() − πβ α ∝ β−α α , es decir, las densidades a priori condicionadas no pueden descomponerse en producto de funciones dependientes de un solo parámetro. Ahora bien, podemos considerar la reparametrización , µ =α σ=β−α, es decir, los parámetros pasan a ser el punto inicial de la distribución y la longitud del intervalo
19 (obsérvese que µ es un parámetro de localización y σ de escala). Ahora, 1 (, |x) log( ), x − µσ = σ µ≤ ≤µ+σ. Si consideramos σ fijo, estamos básicamente en la situación del ejemplo 3.2, obteniéndose ( ) 1 |1C() π µσ∝ σi, mientras que al considerar µ fijo estaríamos básicamente en el caso del ejemplo 3.1, obteniendo () 12 |C() − π σµ∝σ µ. Por tanto, la distribución a priori conjunta que proponemos en este modelo es () 1 ,− πµσ∝σ (que, deshaciendo el cambio, resulta ser ()( ) 1 ,− π αβ ∝ β−α ). 5. Un modelo de búsqueda de empleo. En Lancaster, 1997, se propone un modelo de búsqueda de empleo adecuado a la situación en la que los datos observados son la duración de la búsqueda (T) y el salario aceptado (W), cuya verosimilitud para una muestra ( ) 11 n n (t ,w ),...,(t ,w ) vendría dada por: {} () n ni i1 L( , , ) exp F( | )T f w | , b w = θ λξ=λ −λ ξθ θ <ξ< ∏ donde λ es la tasa de aparición de ofertas de trabajo, ni i1 Tt = =∑, f(w| )θ es la función de densidad de la oferta salarial W (θ puede ser de dimensión superior a uno), F(w | ) θ es la función de supervivencia de W, ξ es el salario de reserva, es decir el valor salarial por debajo del cual el trabajador no acepta la oferta de trabajo y b es la tasa de beneficio del desempleo, cuyo valor se supone conocido. Si aceptamos la hipótesis de que los desempleados actúan buscando maximizar la esperanza de sus ingresos bajo un horizonte infinito, entonces, tendríamos la restricción: b F(w | )dw +∞ ξ λ ξ= + θ ρ∫, donde ρ es la tasa de descuento, que puede suponerse conocida (si fuese desconocida habríamos de añadir un parámetro más al modelo). Esta restricción, puede expresarse en la forma g( , )ξ= θλ y así la restricción de la verosimilitud quedaría de la forma
20 b g( , ) w<θλ<. En este caso, el parámetro ξ “desaparecería” en el modelo, pues lo sustituiríamos por su expresión g( , ) θ λ. Aun cuando los parámetros θ y λ tuviesen un comportamiento regular en el modelo inicial, bajo esta hipótesis pasarían a tener, en general, un comportamiento no regular (debido a que el recorrido de la variable W dependería de ambos parámetros). Si abandonamos la restricción debida a la optimalidad en el comportamiento, el parámetro ξ deja de estar relacionado funcionalmente con (,)θλ y pasa a ser un parámetro más del modelo. Observemos que en el caso de que el modelo de las ofertas salariales f(w| ) θ fuese regular, tendríamos que el vector paramétrico (, )θλ tendría un comportamiento regular, mientras que ξ sería no regular. Vamos a suponer que la distribución de las ofertas salariales es uniforme en (,)αβ, con ambos extremos desconocidos (en Lancaster, 1997 se elige una distribución log-Normal). En este caso, podemos simplificar el modelo, pues el salario aceptado, que es superior al salario de reserva ξ, se distribuirá uniformemente en el intervalo () ,ξβ , que no depende del extremo inferior del intervalo α (observemos que, en general, si la distribución de las ofertas salariales depende de dos parámetros α y β, entonces la distribución truncada del salario aceptado dependerá de α, β y ξ). Haciendo la reparametrización σ =β−ξ, el salario aceptado sigue una distribución U( , ).ξξ+σ CASO A: El parámetro ξ no está relacionado funcionalmente con σ. En este caso, 1 f(w| , ) , w − ξσ =σ ξ< <ξ+σ, ( ) F| 1 ξ σ=, y la verosimilitud sería: { } nn (1) (n) L( , , ) exp T , b w , w − λξσ=λ −λ σ <ξ< ξ+σ> , donde (1) w y (n) w son, respectivamente, los valores mínimo y máximo de { } 1n w ,...,w . Para obtener la distribución a priori conjunta, teniendo en cuenta que el logaritmo de la verosimilitud para una muestra de tamaño 1 sería ( , , ) Log t Log , wλξσ = λ−λ− σ ξ< <ξ+σ, aplicamos las reglas de obtención de las distribuciones condicionadas unidimensionales. El parámetro λ es regular y, puesto que 222− −∂ ∂λ = λ, obtenemos () 11 |, C(,) − πλ ξσ ∝λ ξσ. Los parámetros ξ y σ tienen
21 comportamiento no regular; Como en el ejemplo 4.3, obtendremos ( ) 2 |, 1·C(,)πξλσ∝ λσ y () 13 |, ·C(,) − πσλξ∝σ λξ. Así, estamos en la situación en la que podemos considerar los parámetros independientes a priori, siendo la distribución conjunta: ( ) 11 ,, − − π λξσ ∝λ σ . Con esta distribución a priori, podemos llevar a cabo nuestra inferencia algebraicamente y de forma exacta. En efecto, la distribución a posteriori es { } n1 (n1) (1) (n) (,, |t,w) exp T , b w , w −−+ πλξσ =λ −λ σ <ξ< ξ+σ> , donde t y w representan los tiempos de búsqueda y los salarios observados respectivamente. Esta distribución es propia; concretamente, la constante de integración viene dada por: ( ) n (n1) (n1) (n) KnT(w b) r (n2)! −− −− =−−−, donde (n) (1) rw w=− representa el recorrido de los salarios aceptados. Las distribuciones marginales a posteriori de los parámetros también pueden obtenerse explícitamente. Concretamente, la distribución a posteriori del parámetro λ resulta ser una Gamma de parámetros (n,T); La densidad a posteriori de ξ viene dada por n (n) (1) (|t,w) (w ) , b w − πξ ∝ −ξ <ξ< mientras que la distribución marginal de σ es: (n 1) (n) (n 1) (n) (r)sir w b (|t,w) si w b −+ −+ ⎧σσ− ≤σ≤− ⎪ πσ ∝⎨σ−≤σ<+∞ ⎪ ⎩ . Las constantes de integración de las densidades marginales de ξ y σ también pueden calcularse sin mayor dificultad. CASO B: El parámetro ξ está relacionado funcionalmente con σ. Según hemos indicado, la relación funcional sería b F(w | )dw +∞ ξ λ ξ= + θ ρ∫, donde tanto b como ρ son conocidos. Siendo la distribución de las ofertas salariales
22 uniforme, es fácil comprobar que F(w | )dw / 2 +∞ ξ θ =σ ∫ , por lo que la relación entre los parámetros es b (2 )ξ= +λσ ρ . Así, el logaritmo de la verosimilitud para una muestra de tamaño 1 sería (,) Log t Log,b (2) w b (2)λσ=λ−λ−σ+λσρ<<+λσρ+σ. Para obtener la distribución de | λ σ, observemos que 1t − ∂ ∂λ = λ −, y que bajo el supuesto en el que estamos trabajando, Tsigue una distribución exponencial de parámetro λ, por lo que [] 111 EE[T]0 −−− ∂ ∂λ =λ − =λ −λ =. Es decir, aunque el recorrido de W depende del parámetro λ, el comportamiento es regular. Por tanto, tomaremos () 22 |E ⎡⎤ πλσ∝ − ∂ ∂λ ⎣⎦ , es decir, ( ) 11 |C() − π λσ∝λ σ. Por otra parte, [] 1 E− ∂∂σ=σ, y por tanto () 12 |C() − πσλ∝σ λ. En definitiva, la distribución a priori conjunta resultaría ser ( ) 11 , − − πλσ∝λ σ , que como vemos es la misma que se obtuvo en el caso A. Indiquemos que las distribuciones marginales a posteriori también pueden obtenerse de manera similar. 6. Conclusiones y cuestiones abiertas. La propuesta de obtención de distribuciones a priori no informativas para modelos no regulares uniparamétricos, se muestra bastante satisfactoria, ya que a su sencillez de cálculo se unen sus buenas propiedades de invarianza ante reparametrizaciones y de “comportamiento frecuencialista” de los intervalos de probabilidad bayesianos que se obtienen a partir de ella. En el caso de más de un parámetro, hemos ofrecido una solución parcial satisfactoria para un conjunto de modelos importante. No obstante, permanece abierto el problema general de obtención de la distribución conjunta en cualquier situación; debemos resaltar que este problema permanece abierto aún en el caso de modelos regulares. Por ejemplo, la solución ofrecida en Bernardo y Smith (1994) depende de la ordenación que se considere sobre el conjunto de parámetros; si el vector 12 (, )θθ “está ordenado”, es decir θ1 es el parámetro de interés mientras que θ2 es un parámetro perturbador, estos autores sugieren obtener la distribución conjunta como 21 1 (|)()πθ θ πθ ; en Nicolau, 1993, se considera el caso de parámetros ortogonales y se
23 propone una distribución de la que el autor dice (pág. 378): “esencialmente, esta distribución es sólo la distribución a priori del parámetro de interés dado que el parámetro perturbador está determinado”, puesto que se considera una solución del tipo 12 2 (|)()πθ θ πθ , donde 2 ()πθ puede elegirse arbitrariamente. Para el modelo de búsqueda de empleo, se ofrece una solución sólo en el caso de que la distribución de las ofertas salariales se suponga uniforme (de extremos desconocidos). Para otro tipo de distribuciones (por ejemplo, cuando las ofertas salariales siguen un modelo log-Normal), al construir las distribuciones condicionadas no se verifica la condición de “separabilidad” necesaria para aplicar nuestra propuesta, siendo este un problema a resolver. Lancaster, 1997, asume independencia a priori entre los parámetros, siendo este una posible solución a considerar. BIBLIOGRAFÍA 1. Akahira, M. and Takeuchi, K. (1991), “A Definition of Information Amount Applicable to Non-Regular Cases”, Journal of Computing and Information, 2, pp.71-92. 2. Apóstol, T.M.(1960), “Análisis Matemático”, Reverté, Madrid. 3. Arnold, B.C., Castillo, E. and Sarabia, J.M. (1999), Conditional Specification of Statistical Models, Springer Series in Statistics, Springer-Verlag, New York. 4. Azzalini, A. (1996), “Statistical Inference Based on the Likelihood”, Chapman and Hall, London. 5. Basulto, J. (1997), “Funciones a Priori Imparciales Unidimensionales”, Estadística Española, 142, pp.99-128. 6. Bernardo, J.M. and Smith, A.F.M. (1994), “Bayesian Theory”, John Wiley and Sons, Chichester. 7. Ghosal, S. (1999), “Probability Matching Priors for Non-Regular Cases”, Biometrika, 86, pp.956-964.
24 8. Jeffreys, H. (1946), “An Invariant Form for the Prior Probability in Estimation Problems”, Proc. Roy. Soc. (London), Ser. A, 186, pp.453-461. 9. Jeffreys, H. (1961), “Theory of Probability”, 3rd. edition, Oxford University Press, London. 10. Kosmas, K.F. (1990), “Shortest Confidence Intervals for Families of Distributions Involving Truncation Parameters”, The American Statician, 44, pp.167-168. 11. Lancaster, T. (1997), “Exact Structural Inference in Optimal Job-Search Models”, Journal of Business and Economic Statistics, 15, pp.165-179. 12. Le Cam, (1990), “On the standard asymptotic confidence ellipsoids of Wald”, International Satatistical Review, 58, pp.129-152. 13. Matusita, K. (1955), “Decisión Rules Based on the Distance for Problems of Fit, two Samples and Estimation”, Ann. Math. Statist., 26, pp.631-640. 14. Nicolau, (1993), “Bayesian Intervals with Good Frequentist Behaviour in the Presence of Nuisance Parameters”, J.R. Statist. Soc., Ser. B, 55, pp.377-390. 15. Ortega, F.J. y Basulto, J. (2003), “Distribuciones a priori unidimensionales en Modelos No Regulares: Medidas de Información”, Estadística Española, 154, pp.363383. 16. Pitman, E.J. (1979), “Some Basic Theory for Statistical Inference”, Chapman and Hall, London. 17. Sareen, S. (2003), “Reference Bayesian inference in nonregular models”, Journal of Econometrics, 113, pp.265-288. 18. Welch, B.L. and Peers, H.W. (1963), “On Formulae for Confidence Points Based on Integral of Weithed Likelihoods”, J.R. Statist. Soc., Ser. B, 25, pp.318-329.