Problemas de agregación en el coeficiente de concentración de Gini
Full text
V Reunión de Economía Mundial (Sevilla 2003) Problemas de agregación en el coeficiente de concentración de Gini Basulto Santos, Jesús Universidad de Sevilla. e-mail: [email protected] Romero García, José Enrique. Universidad de Sevilla. e-mail: [email protected] Resumen Hemos realizado un análisis de los problemas que pueden producirse al calcular la concentración de una característica cuantitativa cuando en lugar de trabajar con los datos desagregados observados se realiza la agregación de dichos datos. Partiremos del artículo de Gini, de 1914, en donde define su coeficiente de concentración como una media aritmética ponderada de las denominadas desigualdades relativas. La formula que propone Gini la limita a datos desagregados y, posteriormente, la modifica tanto para datos agregados en frecuencias como para datos agregados en intervalos. Palabras clave: Lorenz, dispersión, concentración, Gini. Área Temática: Metodología
2 1. Introducción. El cálculo de la concentración para valores desagregados ha sido realizado aplicando generalmente de forma correcta la fórmula original de Gini; pero no ha ocurrido igual con el cálculo de la concentración para valores agregados, para los que, en algunas ocasiones, se han aplicado fórmulas incorrectas. En el presente trabajo, hemos intentado esclarecer distintas expresiones para el cálculo de la concentración y su aplicabilidad según las circunstancias. Previamente a este trabajo ha sido realizado un análisis profundo del artículo original de Gini “Sulla misura della concentrazione e della variabilità dei caractteri” (1914). Este trabajo fue consecuencias de los trabajos: Indici di Concentrazione e di dipendenza de 1910 y Variabilità e Mutabilità de 1912. A partir de aquí, recogemos la fórmula original de Gini para datos desagregados en frecuencias unitarias en la sección 2; en la sección 3 recogemos la fórmula de Gini para datos agregados en frecuencias, dando una nueva expresión de esta fórmula en la sección 4; en la sección 5 recogemos la fórmula de Gini para datos agregados en intervalos y, por último, finalizamos con las principales conclusiones. 2. Datos desagregados. Nos proponemos en esta sección dar una justificación, basada en un cuidadoso estudio del artículo histórico de Gini de 1914, del denominado habitualmente índice de Gini para el cálculo de la concentración para valores desagregados, cuya expresión suele recogerse en los libros de texto como ( ) ∑ ∑ − = − = − =1 1 1 1 n i i n i ii P QP R. El objetivo perseguido por Gini en su trabajo de 1914 es, en sus propias palabras: “proponer una medida de concentración que sea independiente de la curva de distribución del carácter”. En su artículo, Gini considera que disponemos de n valores ordenados {ai, i=1,..,n} de una variable estadística cuantitativa no negativa, es decir, a1=..... = a n. Así, si definimos las variables ∑ = = i k kiaA 1 , cantidad acumulada del carácter hasta el lugar i-ésimo, las variables ∑ ∑ = = == n k k i k k n i i a a A A Q 1 1, que constituyen la proporción que representa la cantidad
3 acumulada del carácter hasta el lugar i, Ai, respecto a la cantidad total presente del carácter, y las variables n i Pi=, que denotan la proporción de observaciones hasta el lugar i respecto al número de observaciones totales, puede verificarse fácilmente que ii PQ≤. Gini afirma: “la concentración del carácter será tanto más fuerte cuanto más fuerte sean las n-1 desigualdades ii PQ<, i=1,..,n-1”. (4) La desigualdad (4) es tanto más fuerte, en valor absoluto, cuanto mayor sea la diferencia Pi - Qi; y , dado que el valor máximo de Qi es Pi, tanto más fuerte en valor relativo cuanto más alta es la razón i ii iP QP R− =. Analicemos seguidamente cuál es el significado de RiPi= Pi-Qi. Veamos que es la proporción, respecto a la intensidad total de todo el colectivo, que ha de transferirse al colectivo de los P i casos con intensidad más baja, para eliminar la desigualdad presente en los mismos respecto al conjunto del colectivo. En efecto, ( ) ( ) . 1 11 * * * iiii n kk n kkii i kk n i i PQPQ a aQPa A A Q =−+= = −+ == ∑ ∑∑ = == En el caso de equidistribución, la proporción acumulada del carácter, Qi , sería igual a la proporción acumulada de individuos, Pi; luego el cociente i ii iP QP R− = tendría que ser cero. Por el contrario, en el caso de máxima desigualdad, la proporción acumulada del carácter, Qi, sería igual a cero, luego iii PQP=− y el cociente i ii iP QP R− = tendría que ser uno. Así pues, el
4 valor de Ri varía entre 0, en caso de equidistribución, y uno, en caso de concentración perfecta; y, por ello, puede considerarse un indicador de la concentración del carácter que se presenta entre los Pi casos que tienen intensidad más baja en el carácter en estudio. Dado que ese indicador de la concentración del carácter afecta a la proporción Pi de casos, es por lo que como medida de la concentración global del carácter podremos asumir la media ponderada de los n-1 valores de Ri, donde cada uno de los Ri entra con un peso proporcional al valor Pi. Tal medida será ( ) ∑ ∑ ∑ ∑ ∑ ∑ − = − = − = − = − = − = − = − == 1 1 1 1 1 1 1 1 1 1 1 1 n i i n i ii n i i n i i i ii n i i n i ii P QP P P P QP P PR R, es decir: ( ) ∑ ∑ − = − = − =1 1 1 1 n i i n i ii P QP R . (11) Esa medida, que en los libros de texto habituales aparece como índice de Gini, es la que Gini denomina Razón de Concentración. Obsérvese, que para concentración perfecta, Qi=0, i=1,..,n-1, con lo que ( ) ∑∑ − = − = =− 1 1 1 1 n i i n i ii PQP, luego R=1. Para equidistribución, Pi=Qi, con lo que R=0. Obsérvese también, que a medida que las desigualdades ii PQ< son más fuertes, entonces R aumenta. La razón de concentración es por lo tanto, un indicador de concentración que verifica las condiciones siguientes: crece al crecer la concentración, toma como valor más alto uno en el caso de máxima concentración y toma su valor más pequeño, 0, en el caso de mínima concentración. Teniendo presente que
5 ( ) ( ) 2 1 2 111 1 1 1 1 1 1 − = ⋅− === ∑∑∑ − = − = − = nnn n i nn i Pn i n i n i i, obtenemos la siguiente formulación para R, más operativa que la original: ( ) ( ) 1 21 1 1 n i i n ia RnA = − =− − ∑ (12 bis). 3. Agregación en frecuencias. Si el cálculo de la concentración para valores desagregados ha sido realizado aplicando generalmente de forma correcta la fórmula original de Gini, no ha ocurrido igual, como indicamos en la introducción, con el cálculo de la concentración para valores agregados. En muchos manuales de estadística, se utiliza la fórmula ( ) 1 *11 1 s ii is i i PQ R P − =− = − =∑ ∑ , (I) a la que también se le asigna el nombre de índice de Gini para datos agregados en frecuencias; y, como veremos, está fórmula nunca fue usada por Gini, y además puede presentar serías deficiencias. En lo que sigue, obtendremos la expresión de la razón de concentración, R, para el caso que los n valores estén agrupados en frecuencias absolutas; es decir, que de los n datos solo haya s valores diferentes xl, l=1,..,s, y cada valor xl se repite nl veces ( Gini los llama fl ). Para obtener la fórmula, Gini define los valores Nl, como el número total de individuos con valores menores o iguales a xl, y Nl-1 , como el número de individuos con valores menores a xl, es decir menores o iguales a xl-1 ( él los llama il e il-1); y por tanto, es claro que Nl-1= Nl - nl. Con lo cual, partiendo de (12 bis), se obtiene que ( ) ( ) 1 1 1 1 1 s llll l n NNxn RnA − = +− =− − ∑. (13)
6 En muchos libros de texto, se utiliza la fórmula (11) de Gini con datos agregados en frecuencias, es decir, la fórmula (I); pero (I) no coincide con (13) en estos casos de datos agregados en frecuencias. En efecto, consideremos el siguiente ejemplo numérico en el que se aprecia claramente los diferentes resultados que aportan ambas expresiones. Calculemos en primer lugar R mediante (13): xi ni Ni Si=xini Ni-1+Ni -1 (Ni-1+Ni -1)xini 5 15 15 75 14 1050 80 90 105 7200 119 856800 105 7275 857850 R= 0.133822363 Se obtiene un valor para R de 0.13, indicando que hay poca concentración, cosa lógica pues hay pocos individuos con ingresos pequeños y muchos individuos con elevados ingresos. Si ahora calculamos R usando la fórmula (I), se obtiene: xi ni Ni ti=xini Ai Pi Qi 5 15 15 75 75 0.142857143 0.01030928 80 90 105 7200 7275 1 1 105 7275 R*= 0.927835052 Que indica concentración muy elevada, cosa que sabemos que no ocurre. 4. Otra formulación del índice R para datos agregados en frecuencias absolutas Nos hemos propuesto una expresión alternativa que sea más operativa a la dada por Gini en (13). Para ello, partiremos de su fórmula original, ( ) ∑ ∑ − = − = − =1 1 1 1 n ii n iii P QP R.
7 Para cada uno de los s valores diferentes presentes en los n datos, xi, consideramos las cantidades ( ) 1 11 1 2 ii i Nn i ijii jN n LPnP N − − + =+ − ==− ∑ ( ) 1 11 1 2 ii i Nn ii ijii jN n nx MQnQ A − − + =+ − ==− ∑. Puede comprobarse que ( ) ( ) 1 11 ns iiii ii PQLM − == −=− ∑∑ 1 11 1 1 2 ns ii ii nPL − == − ==− ∑∑ , con lo que ( ) ( ) ( ) ( ) 1 11 11 11 11 11 11 11 111 111 1 1 1 11 11 111 1 111 22 12 ; 1 ns iiii ii ns ii ii ss ii ii ss ii ii ss ii ii sss iii iii s i i s i i PQLM R PL LM LL LM LLL M nn nM n − == −− == == −− == == −−− === = = −− === − =−= −− − =+−= −−− =+−= −− +− = − ∑∑ ∑∑ ∑∑ ∑∑ ∑∑ ∑∑∑ ∑ ∑ es decir,
8 1 12 1 s i i nM R n = +− = − ∑ , (II) con ( ) 1 2 ii iii n nx MnQ A − =− . Igualmente, hemos obtenido que una expresión de R a partir, exclusivamente, de los Pi, Q i de los s valores diferentes presentes en los n datos originales viene dada por: ( ) ( ) ( ) ( ) −+− − = − − =∑∑ ∑ == =s iiii s iiii s iiii pqnQPn N N QPn R 11 1 2 1 1 2 2 1 ˆˆ , donde, ∑ = =−= =−= s jjj ii i i ii i i i ii nx nx q q QQ N n p p PP 1 , 2 ˆ , 2 ˆ . Si ahora calculamos la razón de concentración mediante (II): xi ni Ni ti=xini Ai Qi Mi 5 15 15 75 75 0.010309278 0.08247423 80 90 105 7200 7275 1 45.9587629 105 7275 46.0412371 R= 0.133822363 Es decir, hemos obtenido el mismo valor que el calculado usando la fórmula (13). 5. Agregación en intervalos. Ahora, extenderemos la fórmula (12 bis) a situaciones donde los datos han sido agregados en r clases, con límites Ik=[lk-1, lk], k=1,..,r.
9 Para ver en que se traduce, en este caso, la fórmula (12 bis), se definen las frecuencias acumuladas Nk y Nk-1, donde Nk es el número total de datos con valores menores o iguales que lk , y Nk-1 el número total de datos con valores inferiores o iguales a lk-1. Igualmente define Sk como la cantidad total del carácter que está presente en la clase k-ésima. La formula (12 bis) conduce, en esta ocasión, a esta otra fórmula aproximada: ( ) ( ) ( ) ( ) 1 11 1 1 1 11 r r kkkn kkk k k nn SNNnA SNN RnAnA − −= = +− +− ′=−= −− ∑ ∑, (15) verificándose que: R’<R. (16) Si consideramos que los nk valores de la intensidad del carácter en la clase Ik siguen una progresión aritmética, lo cual es un caso particular de que los valores del carácter se distribuyan, dentro de cada clase, de forma uniforme; se tiene que, en el caso de agrupación en intervalos, y bajo el supuesto establecido de progresión aritmética, la expresión aproximada de R, es: ( ) ( ) ( ) ( ) 2 11 1 11 111 16 r kkkkkk k n RSNNnll nA −− = ′′ =+−+−−− − ∑, (17) Si construimos una curva de concentración con datos agregados en intervalos de clase, y a continuación se unen los puntos de cambio de la curva de concentración por segmentos; aproximando así la curva de concentración por una poligonal y luego calculamos la aproximación al área de concentración como el área existente entre la recta de equidistribución y la poligonal, veamos seguidamente la fórmula que se obtiene. Puede comprobarse fácilmente, que el área de concentración aproximada, ACA, para el caso que la curva de concentración se aproxime por una poligonal, tiene la siguiente expresión: ( ) ( ) 1 11 11 222 r r kkkn kkk k k nn SNNnA SNN ACA nAnA − −= = +− + =−= ∑ ∑. (20) Ahora, para calcular una medida aproximada de la concentración Gini dividió ese área entre el área del triangulo inferior que determina la gráfica de la curva de concentración, que como