Previsión de ventas en una gran cadena de tiendas
Abstract
La optimización del reaprovisionamiento de una gran cadena de supermercados e hipermercados depende de muchos parámetros entre los que se encuentra la previsión de la demanda de los distintos productos en venta. Esta demanda es diferente en función de las características del producto, el día de la semana, la época del año, etc. Teniendo en cuenta estos aspectos hemos desarrollado y programado un procedimiento de previsión basado en técnicas de tratamiento de series temporales capaz de pronosticar de forma bastante precisa las ventas diarias de cada producto en cada centro de la cadena. El presente trabajo detalla todos los pormenores de este proceso de previsión.
Full text
Máster en Estadística e Investigación Operativa Título: Previsión de ventas en una gran cadena de tiendas Autor: Maider Mateos del Pino Directores: Mikel Lezaun Iturralde y Fernando Tusell Palmer Departamento: Matemática Aplicada, Estadística e Investigación Operativa Universidad del País Vasco Tutora UPC: Pilar Muñoz Gràcia Departamento UPC: Estadística e Investigación Operativa Convocatoria: Junio de 2009
Agradecimientos En primer lugar, me gustar´ıa trasladar mis agradecimientos a todas las personas que, de un modo u otro, han aportado su granito de arena a este proyecto fin de m´aster. En el aspecto acad´emico quiero expresar mi gratitud a todos los componentes del grupo de investigaci´on, especialmente a mis directores, Mikel Lezaun y Fernando Tusell, por su asesoramiento y por haber depositado su confianza en m´ı desde el primer momento; y, por supuesto, a Agueda que, adem´as de aportar ideas, ha hecho mucho m´as llevaderas las largas horas de despacho. Gracias tambi´en a Pilar Mu˜noz quien, sin apenas conocerme, acept´o la tutor´ıa de este trabajo. En lo econ´omico, tengo que agradecer a i-MATH Consolider y a Eroski S.Coop. la financiaci´on de este proyecto que a´una universidad y empresa y que ha permitido la realizaci´on de esta memoria. Asimismo, quisiera mencionar especialmente a los responsables de Eroski, Ra´ul Corroto y Francisco Javier L´opez, por su inter´es y por haber puesto a nuestra disposici´on todos los datos necesarios para la elaboraci´on de este trabajo. Finalmente, en el aspecto personal, debo dar las gracias a mi familia por su paciencia y apoyo incondicional a lo largo de mis a˜nos de estudio y, en especial, durante los ´ultimos meses. No cabe duda de que sin su ayuda todo esto no habr´ıa sido posible. Gracias a los amigos, amigas y compa˜neras de equipo por haber conseguido que desconectara del mundo de las matem´aticas y la estad´ıstica siempre que ha hecho falta. 3
´ Indice general Introducci´on 9 1. Descripci´on de los datos 11 1.1. An´alisis descriptivo de las series diarias por referencia . . . . . . . . . . . . 11 1.1.1. Categor´ıa1................................ 12 1.1.2. Categor´ıa2................................ 15 1.2. An´alisis descriptivo de las series diarias por categor´ıa . . . . . . . . . . . . . 18 1.2.1. Categor´ıa1................................ 18 1.2.2. Categor´ıa2................................ 19 1.3. An´alisis descriptivo de las series mensuales . . . . . . . . . . . . . . . . . . . 20 1.3.1. Categor´ıa1................................ 20 1.3.2. Categor´ıa2................................ 22 1.4. Conclusiones del an´alisis descriptivo . . . . . . . . . . . . . . . . . . . . . . 23 2. Modelos de previsi´on mensual 25 2.1. ¿Esquema aditivo o multiplicativo? . . . . . . . . . . . . . . . . . . . . . . . 25 2.2. M´etodo de Holt-Winters . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 2.2.1. Formulaci´on................................ 28 2.3. Modelo estructural b´asico . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29 2.3.1. Recordatorio de los modelos en espacio de estado . . . . . . . . . . . 29 2.3.2. ElfiltrodeKalman............................ 30 2.3.3. Formulaci´on del modelo estructural b´asico . . . . . . . . . . . . . . . 31 2.4. ModelosARIMA ................................. 32 2.4.1. Algunos conceptos previos . . . . . . . . . . . . . . . . . . . . . . . . 32 2.4.2. Formulaci´on de un modelo ARIMA . . . . . . . . . . . . . . . . . . . 33 2.4.3. Identificaci´on del modelo . . . . . . . . . . . . . . . . . . . . . . . . 35 2.4.4. Estimaci´on de los par´ametros . . . . . . . . . . . . . . . . . . . . . . 36 2.5. Combinaci´on de previsiones . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 3. Reparto en d´ıas de la previsi´on mensual 39 3.1. Reparto en semanas o grupos de d´ıas especiales . . . . . . . . . . . . . . . . 39 3.2. Distribuci´on diaria dentro del grupo . . . . . . . . . . . . . . . . . . . . . . 42 5
4. Implementaci´on 45 4.1. M´etodo de Holt-Winters . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 45 4.1.1. Valoresiniciales.............................. 46 4.1.2. Elecci´on de los par´ametros de alisado α,βyγ............ 47 4.2. Modelo estructural b´asico . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47 4.3. ModelosARIMA ................................. 48 4.3.1. Selecci´on de los ´ordenes de diferenciaci´on . . . . . . . . . . . . . . . 48 4.3.2. Selecci´on de los ´ordenes p,P,qyQ.................. 48 4.4. Validaci´on de los modelos . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49 4.5. Combinaci´on y reparto de previsiones . . . . . . . . . . . . . . . . . . . . . 51 5. Resultados 53 5.1. Diciembrede2008 ................................ 54 5.1.1. Categor´ıa1................................ 54 5.1.2. Categor´ıa2................................ 59 5.2. Octubrede2008 ................................. 62 5.2.1. Categor´ıa1................................ 63 5.2.2. Categor´ıa2................................ 65 5.3. Datos corregidos de inflaci´on . . . . . . . . . . . . . . . . . . . . . . . . . . 67 6. Conclusiones y v´ıas de investigaci´on futuras 69 6.1. Conclusiones ................................... 69 6.2. V´ıas de investigaci´on futuras . . . . . . . . . . . . . . . . . . . . . . . . . . 70 Bibliograf´ıa 73 ANEXO I: Descripci´on del c´odigo 75 6
´ Indice de figuras 1.1. Ventas diarias de 52 referencias de la Categor´ıa 1 . . . . . . . . . . . . . . . 12 1.2. Ventas diarias de la referencia R4909990 en los centros A y D . . . . . . . . 14 1.3. Ventas diarias de 52 referencias de la Categor´ıa 2 . . . . . . . . . . . . . . . 16 1.4. Gr´aficas de la serie m´as larga de cada centro en la Categor´ıa 2 . . . . . . . 18 1.5. Series diarias agregadas para la Categor´ıa 1 . . . . . . . . . . . . . . . . . . 19 1.6. Series diarias agregadas para la Categor´ıa 2 . . . . . . . . . . . . . . . . . . 20 1.7. Evoluci´on de las ventas mensuales de la Categor´ıa 1 . . . . . . . . . . . . . 21 1.8. Evoluci´on de las ventas mensuales de la Categor´ıa 2 . . . . . . . . . . . . . 22 5.1. Ajustes de la series mensuales para la Categor´ıa 1 . . . . . . . . . . . . . . 55 5.2. Previsiones para los grupos de d´ıas de la Categor´ıa 1 en diciembre de 2008 . 57 5.3. Previsiones diarias de la Categor´ıa 1 en diciembre de 2008 . . . . . . . . . . 59 5.4. Previsiones para los grupos de d´ıas de la Categor´ıa 2 en diciembre de 2008 . 61 5.5. Previsiones para los grupos de d´ıas de la Categor´ıa 1 en octubre de 2008 . . 64 5.6. Previsiones diarias de la Categor´ıa 1 en octubre de 2008 . . . . . . . . . . . 65 5.7. Previsiones para los grupos de d´ıas de la Categor´ıa 1 en octubre de 2008 . . 66 7
´ Indice de cuadros 1.1. Longitud de las series de la Categor´ıa 1 . . . . . . . . . . . . . . . . . . . . 12 1.2. Referencias con mayor influencia en las ventas de la Categor´ıa 1 . . . . . . . 13 1.3. Venta diaria de la Referencia R9717653 en el Centro B en noviembre de 2007 15 1.4. Longitud de las series de la Categor´ıa 2 . . . . . . . . . . . . . . . . . . . . 16 1.5. Referencias con mayor influencia en las ventas de la Categor´ıa 2 . . . . . . . 17 1.6. Estad´ısticos descriptivos para la Categor´ıa 1 . . . . . . . . . . . . . . . . . . 21 1.7. Estad´ısticos descriptivos para la Categor´ıa 2 . . . . . . . . . . . . . . . . . . 22 2.1. Coeficientes de variaci´on de las diferencias y cocientes estacionales . . . . . 27 5.1. Previsiones mensuales para la Categor´ıa 1 en diciembre de 2008 . . . . . . . 54 5.2. Previsiones mensuales para la Categor´ıa 1 en diciembre de 2007 . . . . . . . 56 5.3. Previsiones mensuales para la Categor´ıa 2 en diciembre de 2008 . . . . . . . 60 5.4. Previsiones mensuales para la Categor´ıa 1 en octubre de 2008 . . . . . . . . 63 5.5. Previsiones mensuales para la Categor´ıa 2 en octubre de 2008 . . . . . . . . 66 5.6. Comparaci´on de previsiones en el Centro A para diciembre de 2008 con los datos en valor y deflactados . . . . . . . . . . . . . . . . . . . . . . . . . . . 67 8
Introducci´on Este trabajo fin de m´aster se enmarca dentro del proyecto que bajo el t´ıtulo “Optimizaci´on del reaprovisionamiento en una gran cadena de tiendas” investigadores de la Universidad del Pa´ıs Vasco y de la Universidad Rey Juan Carlos est´an llevando a cabo para la empresa Eroski S.Coop. En pocas palabras, el objetivo general del proyecto consiste en modelizar el problema del reaprovisionamiento e idear soluciones inform´aticas que mejoren las actualmente utilizadas por Eroski. La optimizaci´on del reaprovisionamiento de una gran cadena de supermercados e hipermercados a partir de las plataformas de distribuci´on depende de muchos par´ametros, empezando por la previsi´on de la demanda de los distintos productos en venta. Esta demanda es diferente seg´un las caracter´ısticas del producto, el d´ıa de la semana, la ´epoca del a˜no, etc. Resuelto este primer paso, dado que el comportamiento de las distintas tiendas es similar, las plataformas de aprovisionamiento recibir´an en determinados momentos grandes pedidos de los mismos productos. Ahora bien, estas plataformas tienen sus limitaciones y han de optimizar su actividad evitando, en la medida de lo posible, altibajos en la carga de trabajo sin que falle el abastecimiento. Un tercer paso es la log´ıstica, la optimizaci´on del flujo de distribuci´on de los productos desde las plataformas hasta los establecimientos. As´ı, podr´ıamos plantear multitud de problemas relacionados con el aprovisionamiento. El presente trabajo se centrar´a ´unicamente en el primero de los pasos, la previsi´on de la demanda. Actualmente, el abastecimiento de los puntos de venta se basa en lo que los responsables de Eroski denominan “modelo de aprovisionamiento de stock reactivo”. A grandes rasgos, este modelo consiste en fijar para cada producto y cada tienda un stock m´ınimo, es decir, una cantidad m´ınima de producto que debe haber en la tienda en todo momento. Cuando las existencias se acercan al stock m´ınimo, el encargado del establecimiento hace un pedido a la plataforma para que le sean enviadas m´as unidades. Es f´acil ver que este modelo cuenta con varios inconvenientes importantes. Por un lado, la plataforma no conoce con antelaci´on cu´ando recibir´a un pedido ni su volumen, de manera que su margen de maniobra de cara a optimizar la distribuci´on se ve muy limitado. Por otro lado, est´a el factor humano. Es frecuente que la persona encargada de controlar el stock pase por alto que alguno de los art´ıculos ha alcanzado su nivel de stock m´ınimo y que, por tanto, no lo incluya en el pedido. Si el fallo no es subsanado r´apidamente puede que el producto en cuesti´on se agote influyendo muy negativamente en la imagen de marca. 9
a priori, las festividades no tienen repercusi´on. La variedad de productos es muy amplia por lo que el n´umero de series a estudiar ser´a mucho mayor que en la Categor´ıa 1. De nuevo, comenzamos por examinar la longitud de los conjuntos de datos. Entre los cuatro centros se dispone de un total de 925 series. El Cuadro 1.4 muestra el desglose por longitud de todas ellas. Longitud de las series ≤10 11-50 51-200 201-500 501-800 >800 Total Node series Centro A 3 24 40 48 61 12 188 Centro B 6 24 43 39 62 14 188 Centro C 12 21 49 48 52 50 232 Centro D 5 30 66 88 107 21 317 Total 26 99 198 223 282 97 925 Cuadro 1.4: Longitud de las series de la Categor´ıa 2 Hay 97 series con m´as de 800 observaciones pero s´olo suponen un 10.48 % del total. Existe tambi´en un n´umero considerable de secuencias de longitud media que podr´ıan ser ´utiles si se llega a confirmar que no hay una periodicidad anual. No obstante, con el fin de desarrollar una herramienta de previsi´on v´alida para todos los productos ser´ıa preferible contar con una cantidad superior de series largas. Figura 1.3: Ventas diarias de 52 referencias de la Categor´ıa 2 Al observar la Figura 1.3, en la que se han dibujado 13 series de cada centro, percibimos lo mismo que en el Cuadro 1.4. La densidad de series largas es mayor que en la Categor´ıa 1 pero siguen existiendo productos con pocas observaciones. Asimismo, no son pocas las referencias que reaparecen tras una ´epoca sin haber sido vendidas. De modo que, en caso 16
de trabajar con series diarias a nivel de referencia, ser´ıa conveniente buscar una manera eficiente de tratar este tipo de intermitencias. Tambi´en hemos calculado el porcentaje de ventas de cada referencia sobre el total de la categor´ıa. Al contrario que en la Categor´ıa 1, donde unas pocas referencias bastaban para alcanzar el 80 % de las ventas, en el caso de la Categor´ıa 2 la oferta aparece mucho m´as atomizada. As´ı lo demuestran las tablas del Cuadro 1.5. Centro A Referencia Long. % % acum. 1 R726646 652 3.69 3.69 2 R358580 777 3.57 7.26 3 R97584 531 3.04 10.30 4 R337279 699 2.63 12.94 5 R5848049 796 2.39 15.33 6 R371443 840 2.12 17.44 7 R322065 846 2.05 19.49 8 R358069 817 1.98 21.47 9 R357822 828 1.75 23.23 10 R826008 833 1.75 24.97 Centro B Referencia Long. % % acum. 1 R358069 848 5.50 5.50 2 R337279 857 3.17 8.67 3 R358580 813 3.05 11.72 4 R5502695 628 2.18 13.90 5 R97584 608 2.12 16.02 6 R2455384 695 2.01 18.02 7 R358689 720 1.75 19.77 8 R5848049 832 1.74 21.51 9 R5355946 725 1.66 23.17 10 R306209 831 1.48 24.65 Centro C Referencia Long. % % acum. 1 R358580 854 4.47 4.47 2 R8455685 540 3.40 7.87 3 R371443 869 2.85 10.72 4 R337279 543 2.52 13.24 5 R2455384 860 2.44 15.67 6 R358069 856 2.26 17.93 7 R4852604 840 2.04 19.97 8 R5502695 771 1.89 21.86 9 R322065 820 1.85 23.72 10 R9263054 315 1.81 25.53 Centro D Referencia Long. % % acum. 1 R371443 880 3.29 3.29 2 R382663 750 1.61 4.90 3 R358069 486 1.47 6.37 4 R370353 755 1.46 7.83 5 R601914 678 1.43 9.27 6 R322065 884 1.39 10.65 7 R889332 892 1.36 12.01 8 R2366490 789 1.35 13.36 9 R2455384 456 1.27 14.63 10 R5502695 643 1.26 15.89 Cuadro 1.5: Referencias con mayor influencia en las ventas de la Categor´ıa 2 El comportamiento es similar en los cuatro centros y en ninguno de ellos se consigue atribuir m´as del 25 % de las ventas a los 10 productos m´as comunes. Es remarcable que la referencia que acumula mayores ventas apenas alcance una cuota del 5 % sobre el total en ninguno de los casos. En esta misma l´ınea, y aunque en las tablas no pueda apreciarse, debemos apuntar que para alcanzar una proporci´on del 80 % siempre son necesarias m´as de 70 referencias. El caso m´as extremo se encuentra en el Centro D para el que hacen falta hasta 126 productos. Por todo esto, aqu´ı no ser´ıa ´util centrarse ´unicamente en las referencias de mayor relevancia. Por ´ultimo, a la vista de las gr´aficas de las series m´as largas de cada centro (Figura 1.4) podr´ıamos decir que, en principio, no hay una estacionalidad mensual o anual llamativa pero habr´ıa que llevar a cabo un estudio m´as detallado para confirmarlo. 17
0 5 10 15 20 Años Unidades 2006 2007 2008 Centro A 0 5 10 15 Años Unidades 2006 2007 2008 Centro B 20 40 60 80 120 Años Unidades 2006 2007 2008 Centro C 0 10 20 30 40 50 60 Años Unidades 2006 2007 2008 Centro D Figura 1.4: Gr´aficas de la serie m´as larga de cada centro en la Categor´ıa 2 Aunque es menos com´un que en la Categor´ıa 1, tambi´en es posible hallar series que contengan d´ıas laborables de venta cero para los que es complicado distinguir si son debidos a la falta de stock en tienda o a que no se registraron ventas. En definitiva, concluimos que no todos los productos cuentan con datos suficientes para permitir el ajuste de un modelo estad´ıstico de previsi´on. El limitarse a aquellas referencias m´as vendidas o con mayor frecuencia en la observaci´on tampoco parece ser una buena alternativa dado que, incluso registrando las mayores ventas, solamente representan una peque˜na parte del total, poniendo de manifiesto la gran atomizaci´on de esta categor´ıa. 1.2. An´alisis descriptivo de las series diarias por categor´ıa A continuaci´on vamos a estudiar muy brevemente las series de ventas diarias agregadas por categor´ıa. Es decir, para cada d´ıa se sumar´an las ventas de todas las referencias disponibles y pertenecientes a una misma categor´ıa. De esta manera, se consiguen salvar algunos de los obst´aculos hallados durante el an´alisis por referencias. Por ejemplo, las series resultantes ser´an las de mayor longitud posible y no contendr´an periodos de no observaci´on. Adem´as, en caso de existir alg´un tipo de estacionalidad ser´a mucho m´as visible. 1.2.1. Categor´ıa 1 Una vez agregados los datos se obtienen cuatro ´unicas series, una para cada centro, cuya gr´afica aparece en la Figura 1.5. 18
0 1000 3000 5000 Años Unidades 2006 2007 2008 Centro A 0 1000 3000 5000 Años Unidades 2006 2007 2008 Centro B 0 1000 3000 5000 Años Unidades 2006 2007 2008 Centro C 0 1000 2000 3000 4000 Años Unidades 2006 2007 2008 Centro D Figura 1.5: Series diarias agregadas para la Categor´ıa 1 Ahora es mucho m´as notoria la periodicidad anual de la que habl´abamos al principio. El incremento en las ventas en fechas cercanas a Navidad se manifiesta claramente mediante unos picos que en ocasiones llegan a multiplicar por 10 el valor medio de la serie. En menor medida y de modo diferente seg´un el centro, se pueden apreciar aumentos de venta en torno a las Semanas Santas de los distintos a˜nos. La estacionalidad semanal sigue existiendo aunque la escala del eje horizontal es demasiado comprimida para permitir detectarla con nitidez. 1.2.2. Categor´ıa 2 De forma an´aloga se han calculado las series diarias para el total de la Categor´ıa 2 (Figura 1.6). En esta ocasi´on el comportamiento es diferente en funci´on del establecimiento. Mientras que en los centros A y C no es visible ning´un tipo de regularidad aparte de la semanal, las gr´aficas de las tiendas B y D dejan entrever cierta periodicidad anual en la que los meses de verano son los de menor venta. Por otro lado, se aprecian varias observaciones extremadamente peque˜nas para las que en este momento no tenemos explicaci´on. Habr´ıa que contactar con los centros en cuesti´on para averiguar si ocurri´o alg´un tipo de incidencia en la tienda, si se trata de errores en la introducci´on de los datos en el sistema o de cualquier otra causa. Por el contrario, est´a muy claro el porqu´e de las observaciones que sobresalen por encima de la serie. Al examinar a qu´e d´ıas corresponden hemos visto que pr´acticamente en su totalidad son v´ısperas de festivos. Concretamente, se trata de los d´ıas previos a la Semana Santa y al puente de la Constituci´on, donde las tiendas permanecen cerradas varios d´ıas seguidos. 19
0 500 1000 1500 Años Unidades 2006 2007 2008 Centro A 0 200 600 1000 Años Unidades 2006 2007 2008 Centro B 0 1000 2000 3000 4000 Años Unidades 2006 2007 2008 Centro C 500 1500 2500 3500 Años Unidades 2006 2007 2008 Centro D Figura 1.6: Series diarias agregadas para la Categor´ıa 2 Si bien es cierto que al agregar las ventas por categor´ıas hemos logrado construir series m´as manejables desde el punto de vista estad´ıstico, no debemos olvidar que seguimos contando con un periodo muestral inferior a tres a˜nos. Ya hemos visto que a menudo se intuye una pauta anual pero, desgraciadamente, el hist´orico de datos disponible resulta insuficiente para aprender dicha pauta de manera fidedigna. 1.3. An´alisis descriptivo de las series mensuales Adem´as de las series diarias que hemos descrito en los apartados anteriores, Eroski tambi´en proporcion´o datos de venta mensuales para las dos categor´ıas y los cuatro centros de estudio. Afortunadamente, la insuficiencia de informaci´on no ser´a un problema tan acuciante a partir de ahora. No obstante, ser´ıa preferible contar con m´as observaciones, sobre todo en la Categor´ıa 2. En lo que sigue llevaremos a cabo el an´alisis descriptivo de las series mensuales de cada una de las categor´ıas. 1.3.1. Categor´ıa 1 Para el estudio de las ventas mensuales de la Categor´ıa 1 contamos con datos recogidos entre enero de 2001 y octubre de 2008 en todos los centros excepto en el D, para el que la serie comenz´o a ser observada en agosto de 2001. En la Figura 1.7 se encuentra la evoluci´on de las ventas de esta categor´ıa en los cuatro establecimientos. Recordar que las unidades no equivalen a euros sino que los valores reales est´an multiplicados por una constante desconocida para preservar la confidencialidad. 20
5000 15000 25000 Años Unidades 2002 2004 2006 2008 Centro A 5000 15000 25000 35000 Años Unidades 2002 2004 2006 2008 Centro B 10000 20000 30000 Años Unidades 2002 2004 2006 2008 Centro C 10000 30000 50000 Años Unidades 2002 2004 2006 2008 Centro D Figura 1.7: Evoluci´on de las ventas mensuales de la Categor´ıa 1 Sin duda, lo m´as llamativo de estas series es la fuerte estacionalidad anual que poseen. Obviamente, los picos corresponden a los meses de diciembre, donde el consumo de productos de esta categor´ıa se dispara gracias a la campa˜na de Navidad. En cuanto a la tendencia, podemos decir que es inexistente en los tres primeros centros. Sin embargo, en la tienda D se observa claramente una tendencia lineal decreciente. Fuentes de la empresa indican que este descenso en las ventas comenz´o con la apertura de un nuevo establecimiento de la competencia en la inmediaciones. El Cuadro 1.6 resume algunos de los estad´ısticos descriptivos m´as importantes. Centro A Centro B Centro C Centro D M´ınimo 4286.90 2369.33 6561.98 6273.37 Mediana 9669.50 7724.81 11630.48 17348.66 Media 10870.84 9342.80 13036.16 20298.03 M´aximo 33437.38 34528.00 30558.94 59046.20 Desviaci´on t´ıpica 5080.49 6908.47 5037.23 11696.61 Cuadro 1.6: Estad´ısticos descriptivos para la Categor´ıa 1 Los valores m´ınimo y m´aximo de las series hacen patente la gran amplitud de los rangos de datos, consecuencia, en gran medida, de las elevadas ventas de los meses de diciembre. Estas observaciones son tambi´en la raz´on de un cierto desplazamiento hacia valores altos de las medias. Muestra de ello es que la media siempre supera a la mediana. Las desviaciones t´ıpicas de las cuatro series son bastante altas, pero esto tambi´en es fruto de las ventas de los diciembres. 21
1.3.2. Categor´ıa 2 Para el estudio de la Categor´ıa 2 disponemos de menos datos, desde enero de 2004 hasta octubre de 2008. Su evoluci´on se muestra en la Figura 1.8. 18000 20000 22000 24000 Años Unidades 2004 2005 2006 2007 2008 Centro A 12000 16000 20000 Años Unidades 2004 2005 2006 2007 2008 Centro B 40000 50000 60000 Años Unidades 2004 2005 2006 2007 2008 Centro C 25000 35000 45000 Años Unidades 2004 2005 2006 2007 2008 Centro D Figura 1.8: Evoluci´on de las ventas mensuales de la Categor´ıa 2 Observamos que, en mayor o menor grado, todas las series presentan tendencia. Parece que los tres primeros centros van aumentando sus ventas a medida que pasa el tiempo, mientras que la tendencia del Centro D es ligeramente decreciente, sobre todo en la segunda mitad del periodo muestral. Sigue habiendo una estacionalidad anual aunque es mucho menos marcada que en las series de la Categor´ıa 1. No se detectan picos tan llamativos como en aquel caso y las ventas no se disparan en diciembre por la campa˜na de Navidad. Por lo general, son los meses de verano (julio y agosto) los que menos ventas registran y marzo el que m´as. De todos modos, basta fijarse en las escalas de los ejes verticales y compararlas con los de la Figura 1.7 para notar que la diferencia entre unos meses y otros no es tan acusada. Podr´ıamos decir que las ventas de la Categor´ıa 2 son m´as estables a lo largo del a˜no que las de la Categor´ıa 1. Centro A Centro B Centro C Centro D M´ınimo 17283.92 10552.62 39320.42 23271.54 Mediana 19880.16 14935.02 47852.82 35070.82 Media 19635.18 15360.05 48609.14 32753.09 M´aximo 24315.68 19851.94 66711.15 44649.02 Desviaci´on t´ıpica 1375.07 2253.62 6366.15 4464.54 Cuadro 1.7: Estad´ısticos descriptivos para la Categor´ıa 2 22
Informaci´on similar se desprende de los estad´ısticos descriptivos recogidos en la tabla anterior (Cuadro 1.7). Los rangos de datos, determinados por los valores m´ınimo y m´aximo de cada serie, son mucho m´as estrechos que los del caso anterior. En comparaci´on con las medias, las desviaciones t´ıpicas toman valores bajos (coeficientes de variaci´on peque˜nos) y, exceptuando el Centro D, en todas las tiendas la media y la mediana son semejantes. Por todo esto, nos atrevemos a afirmar que la dispersi´on de las series de la Categor´ıa 2 es moderada. Gracias a ello, los modelos que ajustaremos ser´an capaces de proporcionar buenas predicciones aunque no se disponga de tantas observaciones como ser´ıa deseable. 1.4. Conclusiones del an´alisis descriptivo Despu´es de realizar este exhaustivo an´alisis descriptivo hemos llegado a varias conclusiones. En primer lugar, consideramos inviable trabajar con modelos para series de ventas diarias. A nivel de referencia, casi todas las secuencias presentan un periodo de observaci´on muy corto y con interrupciones, lo que hace de su modelado una tarea compleja. Si se agregan las ventas de todos los productos hasta conseguir series de venta por categor´ıas la situaci´on no es mucho mejor. Se obtienen series m´as largas y con pocas discontinuidades que permiten intuir las pautas anuales. Sin embargo, menos de tres a˜nos de datos no es una cantidad suficiente para que los modelos puedan aprender dichas pautas y hacer previsiones fiables. Quiz´a en el futuro, cuando el hist´orico de datos sea mayor, ser´a posible el tratamiento de series diarias. Por otro lado, contamos con datos de venta mensuales recogidos durante m´as de siete a˜nos en el caso de la Categor´ıa 1 y durante m´as de cuatro para la Categor´ıa 2. La estacionalidad de las series se detecta de manera mucho m´as clara y nos encontramos en una situaci´on mejor que la anterior. Por lo tanto, nos decantamos por la opci´on de ajustar modelos y hacer predicciones para los datos mensuales. No obstante, la empresa nos pide que el pron´ostico logrado sea, al menos, a nivel de categor´ıa y d´ıa. Por eso, una vez obtenido el m´etodo de previsi´on mensual adecuado, desarrollaremos una t´ecnica simple de reparto en d´ıas. Por ´ultimo, simplemente queda apuntar que las series analizadas cuentan tanto con tendencia como con estacionalidad, por lo que los modelos que se utilicen deber´an ser capaces de recoger estos dos aspectos. Es decir, los modelos deber´an explicar la evoluci´on global a largo plazo de las ventas y los patrones que se repiten a˜no a a˜no como, por ejemplo, el incremento de ventas del mes de diciembre. 23
Cap´ıtulo 2 Modelos de previsi´on mensual Despu´es de haber observado con detenimiento la forma y caracter´ısticas m´as relevantes de los datos, ha llegado el momento de hacer previsiones. Tal y como hemos comentado en el cap´ıtulo anterior, trataremos ocho series de ventas mensuales correspondientes a cuatro centros y dos categor´ıas. Para ello se ajustar´an diversos modelos estad´ısticos de previsi´on. Dado que no existe un modelo que funcione mejor en todos los casos, en lugar de definir un criterio concreto que seleccione la mejor opci´on en cada situaci´on, haremos una combinaci´on de todos los pron´osticos calculados. Este cap´ıtulo est´a dedicado al repaso te´orico de los diferentes m´etodos de previsi´on a utilizar. 2.1. ¿Esquema aditivo o multiplicativo? Algunos de los m´etodos que presentaremos a continuaci´on se basan en que la serie observada es una combinaci´on de varias componentes: la tendencia, las variaciones estacionales y las variaciones residuales. La pregunta que surge inmediatamente es: ¿C´omo act´uan las distintas componentes para que den como resultado los valores de la serie observada? Existen b´asicamente dos esquemas de integraci´on de las componentes: -Esquema aditivo: las componentes se suman y se tiene una expresi´on de la forma yt=Tt+St+t(2.1) donde ytes el valor de la serie original y Tt,Stytson, respectivamente, la componente tendencial, la estacional y la residual en el instante t. -Esquema multiplicativo: las componentes se multiplican dando lugar a la f´ormula yt=Tt×St×t(2.2) donde se ha utilizado la misma notaci´on que antes. La versi´on aditiva asume que los efectos estacionales son constantes y no dependen del nivel medio de la serie. Por el contrario, la versi´on multiplicativa supone que las componentes estacionales var´ıan en funci´on del nivel medio local desestacionalizado. Dicho 25
b´asico es exactamente la del modelo 2.14 que se ha presentado en el apartado anterior. yt= (1 0 1 0 ··· 0) | {z } H µt βt γt γt−1 . . . γt−10 | {z } Xt +t(2.26) µt βt γt γt−1 γt−2 . . . γt−10 = 1 1 0 0 ··· 0 0 0 1 0 0 ··· 0 0 0 0 −1−1··· −1−1 0 0 1 0 ··· 0 0 0 0 0 1 ··· 0 0 . . .. . .. . .. . ..... . .. . . 0 0 0 0 ··· 1 0 | {z } F µt−1 βt−1 γt−1 γt−2 γt−3 . . . γt−11 | {z } Xt−1 + ηt ζt ωt 0 0 . . . 0 (2.27) Una vez construido el modelo se puede proceder a la previsi´on haciendo uso del filtro de Kalman explicado en 2.3.2. A la hora de programar el modelo deberemos tener en cuenta que est´a definido en t´erminos aditivos, mientras que en 2.1 vimos que las series con las que vamos a trabajar presentan un esquema multiplicativo. Para salvar este peque˜no obst´aculo basta tomar logaritmos en las variables originales de forma que en lugar de ajustar el modelo estructural a las ventas mensuales se lo ajustaremos a su logaritmo. 2.4. Modelos ARIMA La familia de modelos ARIMA (AutoRegressive Integrated Moving Average), tambi´en conocidos como modelos de Box-Jenkins, juegan un papel importante en el campo de las series temporales. Son capaces de recoger la tendencia y la estacionalidad de los datos pero, a diferencia del m´etodo de Holt-Winters y de los modelos estructurales, su filosof´ıa no se basa en la descomposici´on de las series en tales factores. Dedicaremos esta secci´on a dar algunas pinceladas sobre el funcionamiento de los modelos ARIMA pero no entraremos en muchos detalles te´oricos ya que se abrir´ıa un campo de estudio demasiado extenso para los objetivos de este trabajo. 2.4.1. Algunos conceptos previos Para comenzar, deben aclararse algunos t´erminos o conceptos que se usar´an a la hora de definir los modelos ARIMA. Se dice que un proceso es estacionario cuando los datos fluct´uan alrededor de una media constante y el grado de dispersi´on no var´ıa en el tiempo. M´as formalmente, diremos que la serie ytes estacionaria si: 32
1. La media es constante en el tiempo. E[yt] = µ∀t(2.28) 2. La covarianza entre yteyt+kno depende del tiempo t. Cov[yt, yt+k] = E[(yt−µ)(yt+k−µ)] = γk∀t(2.29) Este tipo de covarianza se llama autocovarianza y los coeficientes {γ0, γ1, . . .}constituyen lo que se denomina funci´on de autocovarianza. A menudo, la funci´on de autocovarianza se estandariza dando lugar a la funci´on de autocorrelaci´on {ρ0, ρ1, . . .}. ρk=γk γ0 k= 0,1, . . . (2.30) donde γ0=Cov[yt, yt] = V ar[yt]. En procesos estacionarios ρkmide la correlaci´on entre yteyt+k. El operador retardo,B, aplicado a un valor de una serie, desfasa ese valor en un periodo. Es decir: Byt=yt−1(2.31) Obviamente, el efecto de aplicarlo sucesivamente sveces desfasa speriodos el valor de la serie. Bsyt=yt−s(2.32) El operador diferencia de orden 1 se define como: ∇yt= (1 −B)yt=yt−yt−1(2.33) En general, una diferencia de orden dse puede escribir como: ∇dyt= (1 −B)dyt(2.34) 2.4.2. Formulaci´on de un modelo ARIMA En lugar de dar directamente la formulaci´on de los modelos ARIMA iremos definiendo diferentes procesos que nos ir´an conduciendo a ellos poco a poco y de manera m´as clara. Modelos autorregresivos (AR) En algunas ocasiones se pretende predecir el comportamiento de una variable yen un momento ta partir de los valores que tom´o en instantes de tiempo pasados, yt−1, yt−2, . . . Adem´as, puesto que en el comportamiento de una variable tambi´en influyen otros aspectos, deber´a incluirse en la relaci´on un t´ermino de error Zt. Si consideramos que esta relaci´on es lineal estaremos construyendo un proceso autorregresivo. Formalmente, se dice que una serie temporal ytes un proceso autorregresivo de orden p, AR(p), si es una suma ponderada de los pvalores pasados yt−1, . . . , yt−py un t´ermino de error Zt. Es decir, yt=φ1yt−1+···+φpyt−p+Zt(2.35) 33
donde Ztes un proceso puramente aleatorio de media cero y varianza σ2 Z. Usando el operador retardo, B, 2.35 se escribe: φp(B)yt=Zt(2.36) donde φp(B)=1−φ1B−φ2B2−···−φpBpes un polinomio en Bde orden p. Se demuestra que el proceso es estacionario si las raices de φp(B) se encuentran fuera del c´ırculo unidad. Modelos de medias m´oviles (MA) Una alternativa de modelizaci´on pasa por tratar de explicar el comportamiento de yt no en funci´on de los valores que tom´o en el pasado sino a trav´es de los errores cometidos al estimar el valor de la variable en periodos anteriores. Ello da lugar a los modelos de medias m´oviles. Formalmente, una serie temporal ytse dice que es un proceso de medias m´oviles de orden q, MA(q), si es una suma ponderada de los ´ultimos qerrores. Su f´ormula es: yt=Zt+θ1Zt−1+···+θqZt−q(2.37) donde Ztes un proceso puramente aleatorio de media cero y varianza constante σ2 Z. De nuevo, usando el operador retardo obtenemos: yt=θq(B)Zt(2.38) con θq(B) = 1 + θ1B+···+θq(B) un polinomio en Bde orden q. Modelos autorregresivos de medias m´oviles (ARMA) Evidentemente, los modelos AR se pueden combinar con los modelos MA para formar una familia de modelos de series temporales m´as general y, por consiguiente, m´as ´util. Estos nuevos modelos se llaman modelos autorregresivos de medias m´oviles y en ellos la variable ytqueda explicada en funci´on de los valores que tom´o en periodos anteriores y de los errores cometidos en la estimaci´on. Una expresi´on general de un modelo ARMA(p, q) ser´ıa: yt=φ1yt−1+···+φpyt−p+Zt+θ1Zt−1+···+θqZt−q(2.39) o, equivalentemente, φp(B)yt=θq(B)Zt(2.40) donde φp(B), θq(B) y Ztse definen como antes. Para que las estimaciones de los par´ametros de un modelo ARMA tengan las propiedades estad´ısticas adecuadas, es necesario que la serie muestral que se utilice para la estimaci´on sea estacionaria. 34
Modelos autorregresivos integrados de medias m´oviles (ARIMA) Desafortunadamente, es muy com´un encontrar series no estacionarias a las que no se les puede ajustar directamente un modelo ARMA. No obstante, existen maneras sencillas de convertir en estacionaria una serie que no lo es. Si el problema es que la serie presenta heterocedasticidad, es decir, las oscilaciones alrededor de la media no son semejantes en distintos momentos de tiempo, la toma de logaritmos suele ser una soluci´on satisfactoria. En efecto, el tomar logaritmos tiene la importante propiedad de disminuir la variabilidad de la serie manteniendo su patr´on de comportamiento. Por supuesto, existen otro tipo de transformaciones que reducen la heterocedasticidad pero, sin duda, el logaritmo es la m´as utilizada. Otra causa de no estacionariedad es que la serie tenga tendencia. En tal caso, conviene diferenciar la serie tantas veces como haga falta hasta conseguir que la media sea constante. En la mayor´ıa de los casos una o dos diferenciaciones suelen ser suficientes. Una vez que la serie haya sido transformada y/o diferenciada hasta conseguir que sea estacionaria, ya se le puede ajustar un modelo ARMA(p, q). Pues bien, un modelo ARIMA(p, d, q) no es m´as que un modelo ARMA(p, q) aplicado a una serie que ha sido diferenciada dveces para eliminar la tendencia. As´ı pues, la expresi´on 2.40 se puede generalizar dando lugar a: φp(B)(1 −B)dyt=θq(B)Zt(2.41) donde φp(B), θq(B) y Ztse definen como antes y dindica el n´umero de veces que la serie ha sido diferenciada para conseguir la estacionariedad. Si, adem´as, los datos presentan estacionalidad, no s´olo habr´a que modelizar la parte regular (no estacional) sino que habr´a que tratar tambi´en la componente estacional. Debemos tener en cuenta que esta ´ultima tambi´en puede presentar tendencia y que, por lo tanto, la serie puede precisar una o varias diferenciaciones de orden estacional. Entonces, un modelo con ´ordenes (p, d, q) en la parte regular y (P, D, Q) en la estacional se denota por ARIMA(p, d, q)(P, D, Q)sy se formula del modo siguiente: φp(B)ΦP(Bs)(1 −B)d(1 −Bs)Dyt=θq(B)ΘQ(Bs)Zt(2.42) donde ΦP(Bs) y ΘQ(Bs) son polinomios en Bsde orden PyQ, respectivamente y ses el orden de la estacionalidad. En el caso de datos mensuales ser´a s= 12. En los modelos ARIMA se puede incluir tambi´en un t´ermino constante cy quedar´ıa: φp(B)ΦP(Bs)(1 −B)d(1 −Bs)Dyt=c+θq(B)ΘQ(Bs)Zt(2.43) 2.4.3. Identificaci´on del modelo Uno de los pasos m´as importantes al ajustar un modelo ARIMA(p, d, q)(P, D, Q)ses la selecci´on de los ´ordenes p,q,PyQ. Habitualmente, la elecci´on se realiza examinando con detenimiento las funciones de autocorrelaci´on (ACF) y autocorrelaci´on parcial (PACF) y detectando para qu´e retardos estas funciones toman valores significativamente distintos de cero. El mayor inconveniente de este procedimiento es que requiere la participaci´on del analista. Recordemos que el objetivo de este proyecto es desarrollar un m´etodo de previsi´on 35
para todos los productos de una gran cadena de supermercados e hipermercados, por lo que ser´an miles las series a tratar. Est´a claro que en casos como ´este la participaci´on del analista debe ser m´ınima y la elecci´on de los ´ordenes se tiene que hacer de forma autom´atica, sin recurrir al estudio detallado de las gr´aficas del ACF y del PACF. En el cap´ıtulo dedicado a la implementaci´on abordaremos esta cuesti´on con m´as profundidad. 2.4.4. Estimaci´on de los par´ametros Tras elegir cu´ales ser´an los ´ordenes (p,d,q,P,D,Q) del modelo que ajustar´a la serie hay que proceder a la estimaci´on de los par´ametros AR y MA tanto de la parte regular como de la estacional (φ1, . . . , φp, Φ1,...,ΦP,θ1, . . . , θq, Θ1,...,ΘQ). La estimaci´on se har´a por m´axima verosimilitud. Recordamos que la verosimilitud de un conjunto de datos asociada a un modelo es proporcional a la probabilidad de obtener esos datos dado el modelo. Es decir, mide la posibilidad de observar la muestra actual para un conjunto particular de par´ametros del modelo. Como su propio nombre indica el m´etodo de m´axima verosimilitud consiste en encontrar los valores de los par´ametros que maximizan esta cantidad. Generalmente, los programas que ajustan modelos ARIMA encuentran autom´aticamente estimaciones iniciales para los par´ametros y, luego, los van mejorando recursivamente hasta encontrar los valores ´optimos seg´un el criterio de m´axima verosimilitud. 2.5. Combinaci´on de previsiones A trav´es de los m´etodos descritos, se obtienen tres previsiones para cada una de las series pero, obviamente, no hay un m´etodo que funcione mejor que el resto en todos los casos. Existen multitud de medidas que permiten cuantificar la precisi´on de predicci´on de los modelos. Algunas de ellas son, por ejemplo, el error absoluto medio (EAM), el error cuadr´atico medio (ECM) o el error porcentual absoluto medio (EPAM). Sin embargo, si se eval´uan diversos m´etodos en base a las distintas medidas de precisi´on es normal que el resultado sea diferente seg´un la medida utilizada. Por ejemplo, supongamos que disponemos de previsiones realizadas usando tres modelos A, B y C. Es posible que seg´un el ECM el mejor de ellos sea el modelo B mientras que con el EPAM sea el C. En tal caso, ¿cu´al de los modelos se deber´ıa tomar como definitivo? No existe una respuesta determinante a esta cuesti´on. Con el fin de evitar situaciones como ´esta, una posible alternativa es hacer una combinaci´on de predicciones. Muchos estudios emp´ıricos (recogidos en la revisi´on de Clemen [6]) concluyen que la combinaci´on de previsiones procedentes de varios m´etodos da como resultado una previsi´on m´as precisa que la hallada con cada uno de ellos por separado. Asimismo, la incertidumbre (o tama˜no de los errores de predicci´on) de los pron´osticos combinados suele ser considerablemente menor que la de los modelos tomados de forma independiente. Por eso, tras calcular las previsiones con los distintos m´etodos (Holt-Winters, BSM y ARIMA) las combinaremos dando lugar al pron´ostico de venta mensual definitivo. Desde finales de la d´ecada de los 60 se ha trabajado mucho en la combinaci´on de previsiones tanto en el aspecto te´orico como en el experimental. Algunos de los m´etodos que se han estudiado son muy simples y no van m´as all´a de hacer la media aritm´etica o 36
una media ponderada de los diferentes pron´osticos. Pero otros cuentan con un grado de complejidad superior: hay m´etodos basados en las varianzas y covarianzas de los errores de previsi´on, t´ecnicas bayesianas, regresiones tomando como variables independientes las previsiones seg´un los diversos modelos en las que se debe tener en cuenta el problema de la colinealidad, etc. Sin embargo, no hay evidencia de que los procedimientos m´as sofisticados conduzcan a mejores resultados. Puesto que el objetivo de este proyecto no es entrar en los detalles de la combinaci´on de previsiones y ya que un an´alisis m´as exhaustivo no asegurar´ıa predicciones m´as acertadas, hemos optado por hacer la combinaci´on a trav´es de una media ponderada. Si ytes la observaci´on en el instante te ˆyt|t−1es la predicci´on para el mismo periodo calculada con datos hasta t−1, se define el error de previsi´on a un paso como: et=yt−ˆyt|t−1(2.44) Disponiendo de observaciones y previsiones para nperiodos de tiempo, una de las medidas de precisi´on m´as utilizadas es el error cuadr´atico medio (ECM). ECM = 1 n n X t=1 e2 to su ra´ız cuadrada RECM = √ECM (2.45) Nuesto m´etodo de combinaci´on consistir´a en hacer una media ponderada en la que se dar´a mayor peso a las previsiones procedentes de los modelos que hayan dado mejores resultados en el pasado, es decir, los de menor error cuadr´atico medio. Por tanto, la expresi´on para la previsi´on de venta mensual definitiva ser´a la siguiente: ˆyt|t−1=ω1ˆy1 t|t−1+ω2ˆy2 t|t−1+ω3ˆy3 t|t−1(2.46) donde ˆy1 t|t−1, ˆy2 t|t−1e ˆy3 t|t−1denotan las previsiones para el periodo tobtenidas con el m´etodo de Holt-Winters, el modelo estructural y el modelo ARIMA, respectivamente, y ω1,ω2yω3son sus pesos asociados ωi= 1 RECMi 3 X i=1 1 RECMi i= 1,2,3 (2.47) 37
Cap´ıtulo 3 Reparto en d´ıas de la previsi´on mensual Aplicando el procedimiento descrito en el cap´ıtulo anterior se ha conseguido calcular una previsi´on mensual para cada centro y categor´ıa de productos. No obstante, Eroski necesita una previsi´on a nivel de d´ıa. Por lo tanto, lo que haremos ser´a repartir la previsi´on mensual en los d´ıas laborables del mes en cuesti´on. Para ello utilizaremos los datos diarios de los meses an´alogos al de estudio en los a˜nos anteriores. La metodolog´ıa de distribuci´on en d´ıas de la predicci´on no requiere un hist´orico de datos tan largo como las t´ecnicas de series temporales. De hecho, el reparto podr´ıa hacerse incluso con los datos diarios de un ´unico a˜no. Sin embargo, para reducir la sensibilidad del m´etodo ante los efectos fin de semana y ciertos eventos extra˜nos como huelgas, grandes ofertas, sucesos meteorol´ogicos importantes, etc. conviene contar con tantos a˜nos como sea posible. Hemos dicho que la empresa solicita previsiones diarias pero es obvio que el descenso a nivel de d´ıa conlleva un fuerte incremento de la incertidumbre y, por consiguiente, se hace mucho m´as complicado el acierto en los pron´osticos. Adem´as, los responsables de Eroski dicen que, hasta cierto punto, son admisibles errores elevados en las predicciones diarias siempre y cuando la previsi´on total para un grupo de d´ıas determinado (semanas completas, v´ısperas de festividades importantes,. . . ) sea buena. Por eso, el reparto en d´ıas constar´a de dos fases: el reparto en semanas o grupos de d´ıas especiales y la distribuci´on diaria dentro del grupo. Se dar´a un tratamiento especial a los meses de marzo, abril y diciembre por contener periodos de grandes vol´umenes de ventas (Semana Santa y Navidad). 3.1. Reparto en semanas o grupos de d´ıas especiales Para proceder al reparto de la previsi´on mensual en grupos de d´ıas, lo primero que hay que hacer es definir con cierto criterio los grupos que puedan tener un comportamiento similar dentro del mes a lo largo de todos lo a˜nos. Se distinguen tres casos: 39
Meses que no contienen fiestas relevantes (Semana Santa ni Navidad) En los meses que no est´en afectados por la Semana Santa o la Navidad los grupos de d´ıas ser´an de semanas completas. Al tomar conjuntos de 7 d´ıas se asegura que siempre haya un ´unico lunes, un ´unico martes, etc., de modo que la proporci´on de ventas del grupo respecto al total mensual no se ver´a afectada por un posible efecto fin de semana. Obviamente, al final del mes quedar´an d´ıas sueltos que ser´an tratados como otro grupo independiente. La agrupaci´on de un mes determinado ser´a independiente de la agrupaci´on del mes anterior o posterior. Es decir, no existir´a ning´un grupo que contenga d´ıas de dos meses diferentes. Marzo y abril Los meses de marzo y abril requieren un tratamiento especial porque contienen la Semana Santa que, al ser una fiesta m´ovil, no siempre cae en los mismos d´ıas del mes pero s´ı en los mismos d´ıas de la semana. Para distribuir los grupos de marzo y abril primero se identifica el conjunto afectado por la Semana Santa, que comprender´a ocho d´ıas: desde el martes anterior a Jueves Santo hasta el martes posterior al Lunes de Pascua, ambos incluidos. El resto de los d´ıas se separar´a en semanas completas como si se tratase de periodos normales. De nuevo, pueden quedar d´ıas sueltos justo antes de la Semana Santa y/o a final de mes. En tal caso, se proceder´a igual que con los ´ultimos d´ıas de los meses comunes. Diciembre Diciembre es un mes muy distinto al resto porque est´a repleto de fiestas que implican importantes incrementos en las ventas. Por eso, el reparto en conjuntos de d´ıas se hace de manera particular. Se distinguen varios grupos de d´ıas especiales: - Cuatro d´ıas del puente de la Inmaculada y la Constituci´on (incluye el 7 de diciembre y dos d´ıas laborables antes y otro despu´es del puente). - Tres d´ıas laborables antes de Nochebuena. - Tres d´ıas laborables antes de Nochevieja. - Fin de semana anterior a Nochebuena. - D´ıas entre Navidad y los especiales de Nochevieja. - D´ıas anteriores al puente (principio de mes). - Resto Por ejemplo, para el a˜no 2008 los grupos de d´ıas quedar´ıan de la siguiente manera: ENERO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 FEBRERO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 40
MARZO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 ABRIL 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 MAYO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 JUNIO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 JULIO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 AGOSTO 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 SEPTIEMBRE 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 OCTUBRE 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 NOVIEMBRE 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 DICIEMBRE 2008 Lun. Mar. Mie. Jue. Vie. Sab Dom. 1 2 3 4 5 67 89 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 Cuando los grupos de d´ıas hayan sido creados hay que identificarlos con los grupos equivalentes de los a˜nos anteriores. En la mayor´ıa de los casos la identificaci´on ser´a sencilla porque coincidir´an las fechas, pero habr´a que tener especial cuidado al emparejar los conjuntos de d´ıas de marzo, abril y diciembre. En marzo y abril, est´a claro que el grupo correspondiente a la Semana Santa se comparar´a con la Semana Santa de los a˜nos anteriores. El resto de los grupos, que mayormente habr´an sido construidos por semanas completas, se comparar´an con las semanas completas equivalentes por fecha de los a˜nos previos siempre que ´estas no contengan ninguno de los d´ıas afectados por la Semana Santa. Por ejemplo, el grupo formado por los d´ıas del 1 al 7 de abril de 2008 no ser´a comparado con los mismos d´ıas de 2007 ya que en ese a˜no la Semana Santa cay´o entre el 5 y el 8 de abril. 41
4.3. Modelos ARIMA Retomando la secci´on 2.4.2 sabemos que un modelo ARIMA estacional est´a dado por la ecuaci´on φp(B)ΦP(Bs)(1 −B)d(1 −Bs)Dyt=c+θq(B)ΘQ(Bs)Zt(4.5) donde ses el orden de la estacionalidad, cun t´ermino constante, φp, ΦP,θqy ΘQson polinomios de orden p,P,qyQ, respectivamente, y dyDindican el n´umero de diferenciaciones regulares y estacionales necesarias para conseguir una serie estacionaria. La manera habitual de construir un modelo de este tipo consta de tres pasos: - Selecci´on de los ´ordenes de diferenciaci´on dyD. - Selecci´on de los ´ordenes p,P,qyQde los polinomios. - Estimaci´on de los par´ametros (coeficientes de los polinomios). Generalmente, si se trabaja con una cantidad manejable de series, los dos primeros pasos se efect´uan de forma manual y subjetiva observando ciertos gr´aficos representativos de cada serie. Como hemos indicado en m´ultiples ocasiones, desafortunadamente, no es ´este nuestro caso. Usaremos, pues, el procedimiento propuesto por Hyndman y Khandakar [11] para elegir los par´ametros d,D,p,P,qyQautom´aticamente. 4.3.1. Selecci´on de los ´ordenes de diferenciaci´on La identificaci´on de los ´ordenes de diferenciaci´on dyDse lleva a cabo mediante tests sobre la existencia de ra´ıces unitarias. La mayor´ıa de las pruebas de este tipo toma como hip´otesis nula que existe una ra´ız unitaria, pero de este modo se tiende a aceptar la hip´otesis nula con demasiada facilidad dando lugar a m´as diferenciaciones de las necesarias. Por eso, se utilizar´an contrastes basados en la hip´otesis nula de no existencia de ra´ız unitaria. En primer lugar, se elige el orden de diferenciaci´on estacional Da trav´es del test Canova-Hansen [2] que contrasta la hip´otesis nula de no existencia de ra´ıces unitarias en frecuencias estacionales frente a la alternativa de que s´ı existe una ra´ız tal. Una vez hallado D, se identifica el valor de daplicando sucesivamente la prueba KPSS a los datos diferenciados de orden estacional (si D6= 0) o a los datos originales (si D= 0). El test KPSS contrasta la hip´otesis nula de estacionariedad de la serie frente a la alternativa de existencia de una ra´ız unitaria. Si el resultado del test es significativo se diferencian los datos y se les vuelve a aplicar el test, y as´ı sucesivamente. El proceso finaliza cuando se acepta la hip´otesis nula. El valor de dvendr´a dado por el n´umero de diferenciaciones que hayan hecho falta. 4.3.2. Selecci´on de los ´ordenes p,P,qyQ Despu´es de decidir la cantidad de diferenciaciones, toca establecer los ´ordenes de los polinomios tanto de la parte de medias m´oviles como de la autorregresiva. La selecci´on se har´a calculando los modelos ARIMA(p, d, q)(P, D, Q)spara diversos valores de p,P,qyQ y eligiendo aqu´el con menor AIC (Akaike’s Information Criterion). El proceso de estimar todos los modelos correspondientes a todas las posibles combinaciones de ´ordenes ser´ıa 48
muy largo y lento debido a la gran cantidad que suponen. Por eso, tomamos un camino que permite recorrer el espacio de modelos de manera m´as eficiente gracias al siguiente algoritmo iterativo. Paso 1: Se prueban cuatro posibles modelos con los que iniciar el proceso. ARIMA(0, d, 0)(0, D, 0)12 ARIMA(1, d, 0)(1, D, 0)12 ARIMA(0, d, 1)(0, D, 1)12 ARIMA(2, d, 2)(1, D, 1)12 Entre ellos se elige el de menor AIC y lo llamaremos modelo actual. Si se hace m´as de un diferenciaci´on, o sea, si d+D > 1 se toma c= 0. En caso contrario, se calculan modelos con constante (c6= 0). Paso 2: Se consideran hasta trece variaciones del modelo actual. aquellas en las que s´olo uno de p,P,qyQvar´ıa ±1 respecto al modelo actual aquellas en las que pyqvar´ıan ±1 respecto al modelo actual simult´aneamente aquellas en las que PyQvar´ıan ±1 respecto al modelo actual simult´aneamente aquellas en las que se incluye la constante csi en el modelo actual c= 0 o se excluye si en el modelo actual c6= 0 Cuando se encuentra un modelo cuyo AIC es menor que el del modelo actual, se convierte en el nuevo modelo actual y se repite el procedimiento. El proceso termina cuando no se encuentra ning´un modelo cercano al actual con menor AIC. Para evitar problemas de convergencia se establecen cotas superiores para los par´ametros: pyqno podr´an ser mayores que 6 mientras que PyQvaldr´an como m´aximo 2. 4.4. Validaci´on de los modelos Tras haber sido estimados, tanto el modelo estructural como el ARIMA han de ser validados. Para ello recurriremos a t´ecnicas est´andares de an´alisis de residuos basadas en contrastes de hip´otesis. Una vez m´as, el proceso deber´a ser autom´atico por lo que se descarta un estudio visual de los gr´aficos asociados a los residuos. Chequearemos la normalidad y la autocorrelaci´on de los residuos. Verificaci´on de la normalidad Para comprobar si los residuos siguen una distribuci´on normal se utiliza el contraste de Kolmogorov-Smirnov en la versi´on modificada de Lilliefors. Recordamos que el contraste de Kolmogorov-Smirnov compara la funci´on de distribuci´on te´orica F(x) con la emp´ırica Fn(x). Bajo la hip´otesis nula ambas funciones son iguales. El procedimiento para construir el contraste es: 1. Ordenar los valores muestrales de menor a mayor. 49
2. Calcular la funci´on de distribuci´on emp´ırica de la muestra Fn(x). 3. Calcular la discrepancia m´axima entre las funciones de distribuci´on emp´ırica y te´orica mediante el estad´ıstico Dn= m´ax |Fn(x)−F(x)|(4.6) cuya distribuci´on, bajo la hip´otesis nula, est´a tabulada. Fijado un nivel de significaci´on α, se rechazar´a H0cuando Dnsea mayor que el valor tabulado. Si los par´ametros µyσ2de la funci´on de distribuci´on F(x) no son conocidos y deben ser estimados, las tablas conducen a un contraste muy conservador, tendiendo a aceptar la hip´otesis nula. La versi´on modificada de Lilliefors se basa en una tabulaci´on diferente cuando los par´ametros son estimados. Aplicaremos este test a los residuos de los modelos para determinar si se cumple la hip´otesis de normalidad. Verificaci´on de la independencia Para que los modelos sean v´alidos, los residuos, aparte de cumplir la hip´otesis de normalidad, tienen que ser independientes, es decir, no deben estar autocorrelados. Someteremos los residuos a dos pruebas que chequear´an esta cuesti´on. Por un lado, haremos un contraste de autocorrelaci´on para cada retardo k < 40. Sabemos que cuando las observaciones son independientes y la poblaci´on base es normal, los coeficientes de autocorrelaci´on muestrales, rk, se distribuyen, aproximadamente, como una normal de media cero y varianza 1/n. Por consiguiente, se pueden considerar significativamente distintos de cero aquellos coeficientes que, en valor absoluto, sean mayores que 2/√n. Como el test se realiza a un nivel de confianza del 95 % y estamos tomando 40 retardos, permitiremos que dos valores superen el umbral de significaci´on. Por otro lados, y a modo de complemento del contraste de autocorrelaci´on, haremos un test de Ljung-Box. Se trata de un contraste conjunto de los mprimeros coeficientes de autocorrelaci´on. Se toma el estad´ıstico Q=n(n+ 2) m X k=1 r2 k n−k(4.7) que, bajo la hip´otesis de independencia se distribuye como una χ2con m−1 grados de libertad. Generalmente, cuando el estad´ıstico resulta significativo para un determinado valor m, tambi´en lo es para todos los siguientes. Pero en algunas ocasiones Qvuelve a ser no significativo tras varios periodos. En estos casos, la aceptaci´on o rechazo de la hip´otesis nula es sensible al valor de mescogido. Con el fin de evitar situaciones como ´esta se realizar´a el contraste tomando diversos valores de m. Concluiremos que los residuos son independientes si se superan con ´exito tanto las pruebas de autocorrelaci´on como las de Ljung-Box. 50
4.5. Combinaci´on y reparto de previsiones En lo que respecta a la combinaci´on de las distintas previsiones mensuales y su posterior reparto en d´ıas no cabe hacer muchas apreciaciones. Ambos procedimientos, descritos convenientemente en sus respectivos cap´ıtulos, han sido implementados en R como funciones independientes que son llamadas desde el programa principal. Simplemente es importante decir que a la hora de hacer la combinaci´on se tienen en cuenta ´unicamente aquellas previsiones procedentes de los modelos que hayan superado la etapa de validaci´on. Supongamos, por ejemplo, que para una serie concreta se determina que el modelo estructural es correcto pero el modelo ARIMA ajustado tiene residuos que no cumplen alguno de los requisitos. Entonces, la predicci´on definitiva para dicha serie se construir´a a partir de las predicciones derivadas del m´etodo de Holt-Winters y del modelo estructural. 51
Cap´ıtulo 5 Resultados En este cap´ıtulo vamos a presentar con detalle los resultados obtenidos para cada una de las series a estudio despu´es de haberles aplicado el proceso de previsi´on indicado en los cap´ıtulos anteriores. Recordamos que para esta primera prueba Eroski puso a nuestra disposici´on datos de ventas relativos a cuatro centros y dos categor´ıas. Los centros se escogieron por considerarse representativos de los dos tipos de tienda que la empresa posee, supermercados e hipermercados. Por su parte, las categor´ıas representan productos con comportamientos de venta muy diferentes a lo largo del a˜no. La Categor´ıa 1 engloba referencias de venta estacional muy marcada. En la descripci´on de los datos vimos c´omo se registran cuotas muy altas en fechas cercanas a festividades especiales como Semana Santa o Navidad. Por el contrario, la Categor´ıa 2 presenta ventas mucho m´as regulares a lo largo de todo el a˜no ya que comprende productos de consumo diario. Vamos a analizar exhaustivamente las predicciones mensuales y diarias logradas para dos meses concretos: octubre y diciembre de 2008. Estas predicciones ser´an comparadas con las ventas reales registradas. El estudio de las previsiones diarias para otros meses no ha sido posible debido a que la empresa no ha facilitado datos suficientes. Como veremos a continuaci´on, los pron´osticos para octubre se han hecho un mes hacia adelante, es decir, con datos hasta septiembre. Sin embargo, Eroski considera que diciembre es un mes especial ya que en ´el se dan, con diferencia, los mayores porcentajes de venta sobre el total anual. Por ser el mes de mayor actividad conviene hacer los pedidos y organizar la distribuci´on con m´as antelaci´on que en el resto de meses. Para conseguirlo es indispensable tener una aproximaci´on de cu´anto se va a vender bastante antes de que comience el mes. Por eso, las previsiones para diciembre se obtendr´an a dos meses vista, o sea, con datos hasta octubre. No olvidar que las cantidades que aparecer´an est´an dadas en valor monetario y que no son reales sino que han sido retocadas para mantener la confidencialidad de los datos. La modificaci´on consiste simplemente en multiplicar las series originales por una constante. De esta manera, todas las proporciones y magnitudes relativas de los errores son iguales que si se trabajara con las observaciones reales. 53
5.1. Diciembre de 2008 Comenzamos por los resultados para diciembre de 2008. Dedicaremos un apartado a cada una de las categor´ıas. 5.1.1. Categor´ıa 1 Previsi´on mensual En esta primera tabla mostramos las previsiones mensuales obtenidas para cada uno de los cuatro centros analizados. Se incluyen tambi´en la ra´ız del error cuadr´atico medio (RECM), que proporciona una medida de la discrepancia entre la serie real y los valores ajustados, y el porcentaje de error cometido en la predicci´on. Evidentemente, porcentajes positivos indican que la previsi´on ha sido superior a la venta real mientras que porcentajes negativos dicen que el pron´ostico se ha quedado corto. Centro A Centro B Centro C Centro D Venta real 18723.29 17799.32 21255.06 19589.18 Holt-Winters 23614.62 19656.81 26152.93 14829.20 RECM 2055.60 1697.41 2388.05 5077.04 % Error 26.12 10.44 23.04 -24.30 Modelo estructural 23568.48 ——–1——–2——–1 RECM 2099.81 % Error 25.88 Modelo ARIMA 21647.02 ——–2 24501.49 16225.10 RECM 2456.28 2442.48 5153.45 % Error 15.61 15.27 -17.17 Combinaci´on 23013.80 19656.81 25336.51 15521.93 RECM 1175.95 1697.41 804.77 1762.01 % Error 22.91 10.44 19.20 -20.76 Cuadro 5.1: Previsiones mensuales para la Categor´ıa 1 en diciembre de 2008 Podemos extraer mucha informaci´on de esta tabla. Para comenzar, seg´un el an´alisis de residuos llevado a cabo, parece que el modelo estructural no funciona del todo bien en este tipo de series. Bien sea por la falta de normalidad o por la existencia de autocorrelaci´on, el modelo no ha superado la etapa de validaci´on en tres de los cuatro centros. No obstante, una muestra de cuatro series es una muestra muy peque˜na para afirmar con rotundidad que este tipo de modelos no es adecuado. De hecho, veremos m´as adelante que en la Categor´ıa 2 los residuos del modelo estructural b´asico solamente presentan problemas en una de las series. El Cuadro 5.1 deja a la vista tambi´en que la magnitud del ECM es muy similar para todos los m´etodos aunque la exactitud de la previsi´on puede ser bastante diferente. Se observa que los modelos que proporcionan menores errores cuadr´aticos medios no siempre 1No supera la validaci´on, falla la normalidad de los residuos. 2No supera la validaci´on, falla la independencia de los residuos. 54
conducen a previsiones m´as acertadas. Por eso se opt´o por hacer una combinaci´on de predicciones en lugar de elegir la de menor ECM. Como era de esperar por el m´etodo de combinaci´on elegido, los pron´osticos resultantes son intermedios, es decir, no son ni los mejores ni los peores posibles. Sin embargo, s´ı es muy notoria la reducci´on del error cuadr´atico medio que se consigue. Este hecho se detecta tambi´en en la Figura 5.1 donde la l´ınea roja, que corresponde al ajuste tras la combinaci´on, es m´as cercana a la venta real (l´ınea negra) que los ajustes por separado. Centro_A Años Unidades 2002 2004 2006 2008 5000 15000 25000 Centro_B Años Unidades 2002 2004 2006 2008 5000 15000 25000 Centro_C Años Unidades 2002 2004 2006 2008 10000 20000 30000 Centro_D Años Unidades 2002 2004 2006 2008 10000 30000 50000 Venta real ARIMA Holt-Winters Combinaci´on Estructural Figura 5.1: Ajustes de la series mensuales para la Categor´ıa 1 Por ´ultimo, notar que en todos los centros excepto en el D la previsi´on es mayor que la venta real. Como decimos, cuatro series son pocas para sacar conclusiones pero es posible que, contando con datos hasta octubre de 2008, los modelos no hayan sido capaces de detectar los descensos en las ventas provocados por la crisis, ya que ´esta comenz´o tan solo unos pocos meses antes. Las t´ecnicas de series temporales utilizadas necesitan m´as tiempo para dar cuenta de este tipo de cambios en la tendencia. As´ı pues, es probable que el acierto en las previsiones para los centros A, B y C hubiera sido mayor si en diciembre de 2008 se hubiera gozado de bonanza econ´omica. La raz´on de que esto no suceda en el Centro D es que ´este ya ten´ıa una tendencia decreciente previa (v´ease la Figura 1.7) que 55
los modelos ya hab´ıan detectado. En efecto, si realizamos un ejercicio de previsi´on an´alogo para el mes de diciembre de 2007 comprobamos que el error de predicci´on se reduce en varios puntos en todos los casos. As´ı lo muestra la siguiente tabla. Centro A Centro B Centro C Centro D Venta real 22014.92 32074.52 24436.86 22801.76 Previsi´on 25571.13 30702.91 28628.01 20796.13 % Error 16.15 -4.28 17.15 -8.80 Cuadro 5.2: Previsiones mensuales para la Categor´ıa 1 en diciembre de 2007 Reparto en grupos de d´ıas especiales Siguiendo el procedimiento expuesto en los cap´ıtulos 2 y 3, tras pronosticar las ventas mensuales totales hemos de hacer el reparto en grupos de d´ıas para, posteriormente, concluir con la distribuci´on diaria. Diciembre es uno de esos meses especiales que requieren un trato diferente al usual. Los grupos de d´ıas no se basan en semanas completas sino que est´an regidos por las festividades del periodo navide˜no y el puente de la Constituci´on. Recordamos que diciembre queda dividido en siete conjuntos de d´ıas: - Principios de mes (d´ıas anteriores al grupo determinado por el puente). - Puente de la Constituci´on (por lo general incluye cuatro d´ıas laborables: el 7 de diciembre y dos d´ıas antes y otro despu´es del puente). - Fin de semana anterior a Nochebuena (viernes y s´abado). - Tres d´ıas laborables antes de Nochebuena. - D´ıas entre Navidad y el grupo de Nochevieja. - Tres d´ıas laborables antes de Nochevieja. - Resto. Los gr´aficos de la Figura 5.2 muestran una comparaci´on entre la predicci´on para cada grupo de d´ıas y la venta real registrada. El n´umero situado sobre cada pareja de barras indica el porcentaje de error cometido. Lo primero que llama la atenci´on al ver estos diagramas son las diferencias que hay en los errores de previsi´on de los distintos grupos dentro de un mismo centro. En el caso del Centro A, por ejemplo, los errores oscilan entre un -15.49 % y un 50.89 %. Esto se debe a que al descender a nivel de conjuntos de d´ıas la incertidumbre crece notablemente y el lograr predicciones acertadas se convierte en una tarea m´as complicada. Adem´as, al reducirse el intervalo temporal, pueden entrar en juego otro tipo de factores externos que no se han tenido en cuenta en este estudio y que influyen fuertemente en las ventas de unos d´ıas concretos pero no tienen repercusi´on en el global mensual. A modo de ilustraci´on, imaginemos que en los d´ıas previos a Nochebuena por falta de g´enero sube mucho el precio de un producto de consumo habitual en las comidas y cenas 56
Centro A 0 1000 2000 3000 4000 5000 6000 7000 8000 9000 principios 4puente finsemana 3Navidad Navi-vieja 3Nochevieja resto Unidades 24.45% -6.21% 17.74% -15.49% 50.89% 3.91% 39.67% Centro B 0 1000 2000 3000 4000 5000 6000 7000 principios 4puente finsemana 3Navidad Navi-vieja 3Nochevieja resto Unidades 18.31% 84.15% -10.96% -39.82% 17.88% -5.88% 38.75% Centro C 0 1000 2000 3000 4000 5000 6000 7000 principios 4puente finsemana 3Navidad Navi-vieja 3Nochevieja resto Unidades 23.61% 18.71% 3.60% -14.85% 37.86% 17.33% 37.92% Centro D 0 1000 2000 3000 4000 5000 6000 principios 4puente finsemana 3Navidad Navi-vieja 3Nochevieja resto Unidades 3.60% -37.81% -10.68% -53.70% -7.59% -12.41% -15.97% Previsi´on Venta real Figura 5.2: Previsiones para los grupos de d´ıas de la Categor´ıa 1 en diciembre de 2008 t´ıpicas de estas fechas. Posiblemente, muchos clientes optar´an por comprar otro producto m´as asequible y de caracter´ısticas similares. Si, por el contrario, de cara a Nochevieja se dispone de m´as existencias y el precio baja, las ventas ser´an mayores. En caso de que en a˜nos anteriores no se haya dado un comportamiento semejante a ´este, el m´etodo de reparto en d´ıas sobreestimar´a las ventas de los d´ıas previos a Nochebuena pero se quedar´a corto en las de Nochevieja, dando lugar a una situaci´on como la que se aprecia en el Centro B. Sin embargo, la predicci´on para el total mensual no se ver´a afectada. Aparte de la variabilidad de los precios, otros factores como eventos meteorol´ogicos, ofertas, huelgas, etc. pueden provocar comportamientos como el que hemos se˜nalado. En segundo lugar debemos fijarnos no s´olo en los porcentajes de error sino tambi´en en los errores en t´erminos absolutos. A pesar de que, por confidencialidad, la escala vertical no refleja las ventas en euros y, por consiguiente, no es apreciable en los gr´aficos, s´ı podemos desvelar que en la mayor´ıa de los casos las cuant´ıas de los errores no son alarmantes. Por ejemplo, alguno de los errores cercanos al 40 % que se observan se traduce, en t´erminos absolutos, en una diferencia entre venta real y prevista pr´oxima a 300 euros a repartir entre todos los d´ıas del grupo. An´alogamente, las desviaciones peque˜nas no suponen errores superiores a unas pocas decenas de euros. Exceptuando los casos m´as extremos, los responsables de Eroski se han mostrado satisfechos con estos resultados. 57
tratamiento especial a los d´ıas previos al 12 de octubre. Adem´as, el m´etodo de distribuci´on diaria se encargar´a de asignarle venta nula. Centro A 0 500 1000 1500 2000 2500 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades -24.03% -19.64% -15.87% -27.48% 2.31% Centro B 0 200 400 600 800 1000 1200 1400 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades -13.24% -30.77% -13.42% -1.51% 35.99% Centro C 0 500 1000 1500 2000 2500 3000 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades -3.23% -20.65% -4.12% -0.35% 4.35% Centro D 0 400 800 1200 1600 2000 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades 2.26% -9.85% -6.19% -17.21% -1.72% Previsi´on Venta real Figura 5.5: Previsiones para los grupos de d´ıas de la Categor´ıa 1 en octubre de 2008 A diferencia de lo que ocurr´ıa con los grupos de diciembre, donde la venta era muy desigual, vemos que en octubre se distribuye de manera m´as o menos uniforme a lo largo de los diversos grupos (o semanas). Obviamente, el conjunto correspondiente a los ´ultimos d´ıas del mes tiene menos actividad que el resto debido a que se compone de s´olo tres d´ıas. Sin embargo, hay muchos clientes que a esas alturas de mes ya han cobrado y aprovechan para hacer la compra importante, con lo que la diferencia de este grupo respecto a las semanas completas es m´as peque˜na de lo que cabr´ıa esperar. Queremos destacar tambi´en la precisi´on de las predicciones conseguidas a este nivel, que en muchos casos se desv´ıan muy pocos euros de la venta real. El caso menos favorable es el del Centro A ya que se arrastra el error de la previsi´on mensual. Distribuci´on diaria De nuevo, gracias a haber tomado el a˜no 2003 como referencia, se ha conseguido reproducir con bastante ´exito la evoluci´on diaria de las ventas de octubre de 2008. As´ı lo muestran los gr´aficos de la Figura 5.6. Coincidiendo con los cinco fines de semana que contiene el mes, todos los establecimientos presentan cinco picos de ventas de los que ha dado cuenta el m´etodo de distribuci´on diaria. Comparando con el gr´afico an´alogo para diciembre (Figura 5.3) vemos un patr´on m´as regular en el sentido de que la venta se va registrando poco a poco a lo largo de todo 64
Centro A 0 250 500 750 1000 1-oct 3-oct 5-oct 7-oct 9-oct 11-oct 13-oct 15-oct 17-oct 19-oct 21-oct 23-oct 25-oct 27-oct 29-oct 31-oct Unidades Centro B 0 150 300 450 600 1-oct 3-oct 5-oct 7-oct 9-oct 11-oct 13-oct 15-oct 17-oct 19-oct 21-oct 23-oct 25-oct 27-oct 29-oct 31-oct Unidades Centro C 0 300 600 900 1200 1500 1-oct 3-oct 5-oct 7-oct 9-oct 11-oct 13-oct 15-oct 17-oct 19-oct 21-oct 23-oct 25-oct 27-oct 29-oct 31-oct Unidades Centro D 0 250 500 750 1000 1-oct 3-oct 5-oct 7-oct 9-oct 11-oct 13-oct 15-oct 17-oct 19-oct 21-oct 23-oct 25-oct 27-oct 29-oct 31-oct Unidades Previsi´on Venta real Figura 5.6: Previsiones diarias de la Categor´ıa 1 en octubre de 2008 el mes y no se concentra en dos o tres d´ıas muy se˜nalados. Se dan casos en los que dentro de una misma semana la previsi´on se desv´ıa de la observaci´on real en ambos sentidos, es decir, algunos d´ıas se pasa y otros se queda corta. Cuando esto sucede es com´un que los errores d´ıa a d´ıa sean ligeramente altos en porcentaje (aunque no sean preocupantes en t´erminos absolutos) pero se compensen dando, en el total semanal, muy buenos resultados. Como ilustraci´on de este tipo de situaciones tenemos la segunda semana en el Centro A, o la tercera en los Centros B y C entre otras. 5.2.2. Categor´ıa 2 Para finalizar con la presentaci´on de los resultados, repasaremos r´apidamente los logrados para la Categor´ıa 2. Previsi´on mensual Al ser esta categor´ıa la que engloba productos de venta estable a lo largo del a˜no y al no haber tanta diversidad en el comportamiento de los meses, se espera que los m´etodos usados funcionen de manera similar a como lo hicieron para diciembre. Efectivamente, as´ı es. Los errores cometidos en la previsi´on para octubre son semejantes en magnitud a los de diciembre. Esta vez no sucede como con la Categor´ıa 1 donde exist´ıa una notoria diferencia de exactitud de la previsiones entre un mes y otro. 65
Centro A Centro B Centro C Centro D Venta real 21172.64 17978.40 66711.15 31639.60 Previsi´on 19977.43 16329.94 58100.74 32135.32 % Error -5.64 -9.17 -12.91 1.57 Cuadro 5.5: Previsiones mensuales para la Categor´ıa 2 en octubre de 2008 Notamos tambi´en que la venta en los hipermercados (Centros C y D) es muy superior a la de los supermercados. Si nos fijamos en la Categor´ıa 1, en cambio, observaremos que el volumen de ventas no var´ıa tanto de unas tiendas a otras. Este fen´omeno viene explicado por el hecho de que los productos de la primera categor´ıa sean frescos y los clientes tiendan a comprarlos el d´ıa anterior o incluso el mismo d´ıa de su consumo y, en consecuencia, en el establecimiento m´as cercano a su domicilio. Los art´ıculos de la Categor´ıa 2, por el contrario, no son frescos y no requieren ser consumidos inmediatamente despu´es de haber sido adquiridos. Por eso, son productos comunes en los carros de las grandes compras semanales que, por costumbre, se efect´uan en superficies mayores donde la oferta es m´as variada. Reparto en semanas En la Figura 5.7 presentamos c´omo han quedado los pron´osticos semanales tras el reparto. Centro A 0 1000 2000 3000 4000 5000 6000 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades -6.39% -17.46% -3.29% -2.98% -3.45% Centro B 0 1000 2000 3000 4000 5000 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades 4.69% -34.99% -11.93% -2.85% -10.12% Centro C 0 2000 4000 6000 8000 10000 12000 14000 16000 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades -10.30% -28.44% -11.08% -7.27% -14.08% Centro D 0 1000 2000 3000 4000 5000 6000 7000 8000 9000 semana 1-7 semana 8-14 semana 15-21 semana 22-28 final 29-31 Unidades 7.55% -0.83% -8.65% 1.20% -7.81% Previsi´on Venta real Figura 5.7: Previsiones para los grupos de d´ıas de la Categor´ıa 1 en octubre de 2008 66
Las conclusiones a las que nos conducen estos gr´aficos no difieren demasiado de las ya apuntadas para la Categor´ıa 1, de modo que no volveremos sobre ellas. Simplemente nos gustar´ıa destacar el buen funcionamiento del procedimiento de reparto que, cuando se apoya en buenas previsiones mensuales, consigue a menudo errores para el grupo de d´ıas inferiores al ±5 %. 5.3. Datos corregidos de inflaci´on A lo largo de todo el trabajo venimos tratando series expresadas en valores nominales, es decir, en euros1. El hecho de que se hayan agregado diversas referencias cuyas cantidades f´ısicas no son directamente sumables impide hacerlo de otra manera. Pero uno de los inconvenientes de esto es que los datos pueden estar afectados por el cambio de los precios. Por ejemplo, con datos expresados en valor, que en un a˜no se hayan registrado m´as ventas que en el anterior no implica necesariamente que se hayan vendido m´as unidades del producto. Es posible que se hayan vendido las mismas unidades pero a un precio m´as caro. Es factible utilizar un ´ındice para deflactar los valores nominales y obtener ventas expresadas en t´erminos reales, eliminando el efecto de los precios cambiantes. En Teor´ıa Econ´omica se hace uso de la noci´on de elasticidad-precio de un bien, definida como: η=−∆q/q ∆p/p (5.1) donde qes la cantidad demandada y pel precio. En otras palabras, una elasticidad η= 1 equivale a decir que un peque˜no aumento en el precio se traduce en una reducci´on de la cantidad demandada proporcionalmente igual y, por tanto, en unas ventas en valor aproximadamente inalteradas. Entonces, trabajar en valores ignorando el efecto de los precios (como hemos hecho hasta ahora) es equivalente a suponer elasticidades unitarias, lo que puede ser acertado para algunos productos e inadecuado para otros. No obstante, vamos a hacer una peque˜na prueba calculando la previsi´on mensual de las dos series del Centro A teniendo en cuenta el efecto de la inflaci´on. Para ello, deflactaremos la serie seg´un el ´ Indice de Precios de Consumo (IPC) del grupo de alimentos y bebidas no alcoh´olicas. Categor´ıa 1 Categor´ıa 2 D. en valor D. deflactados D. en valor D. deflactados Venta real 18723.29 20709.68 Previsi´on 23013.80 21543.79 19980.53 19409.77 % Error 22.91 15.06 -3.52 -6.28 Cuadro 5.6: Comparaci´on de previsiones en el Centro A para diciembre de 2008 con los datos en valor y deflactados 1Recordar que en realidad son series transformadas para mantener la confidencialidad 67
En el Cuadro 5.6 se comparan los pron´osticos que se han logrado para diciembre de 2008 tras aplicar el procedimiento de previsi´on mensual a las dos series del Centro A expresadas en valor y corregidas de inflaci´on. Solamente con esta peque˜na prueba ya vemos que el deflactar los datos no siempre va a conducir a mejores pron´osticos. En este caso, la previsi´on para la Categor´ıa 1 mejora considerablemente vi´endose el porcentaje de error reducido en m´as de 7 puntos. La Categor´ıa 2 se encuentra en el lado opuesto ya que tras corregir la serie la predicci´on empeora ligeramente. L´ogicamente, aunque no nos detendremos en ello, estas variaciones quedan reflejadas tambi´en en las previsiones por grupos de d´ıas y, por extensi´on, en las diarias. No estar´ıa de m´as hacer un estudio profundo para ver qu´e productos son los m´as afectados por la inflaci´on o en qu´e situaciones es correcta la asunci´on de elasticidad unitaria. As´ı, decidir´ıamos en cada caso si conviene o no deflactar la serie. 68
Cap´ıtulo 6 Conclusiones y v´ıas de investigaci´on futuras Tras haber explicado a lo largo de los cap´ıtulos precedentes un m´etodo de previsi´on de ventas orientado a una gran cadena de supermercados e hipermercados, ha llegado el momento de presentar las conclusiones generales que se pueden extraer del trabajo realizado, as´ı como las posibles l´ıneas de investigaci´on futuras. 6.1. Conclusiones Con este trabajo hemos conseguido desarrollar un m´etodo de previsi´on capaz de proporcionar pron´osticos para las ventas diarias de un centro dado a nivel de categor´ıa. El m´etodo consta fundamentalmente de dos fases. En la primera de ellas se recurre a tres conocidas t´ecnicas de tratamiento de series temporales (m´etodo de Holt-Winters, modelo estructural b´asico y modelos ARIMA) que, tras ser combinados, conducen a una previsi´on mensual. La segunda fase consiste en el reparto diario de dicha previsi´on y se basa en las proporciones de venta de los a˜nos precedentes. Aunque el objetivo m´as ambicioso es conseguir predicciones diarias a nivel de referencia, los datos disponibles hasta el momento no lo permiten. En la parte descriptiva vimos que las series de datos por referencia poseen multitud de anomal´ıas dif´ıcilmente salvables tales como periodos de observaci´on demasiado cortos y con intermitencias. Todas las t´ecnicas consideradas recogen dos caracter´ısticas importantes de los datos: la tendencia y la estacionalidad. En otras palabras, el proceso de previsi´on dise˜nado explica tanto la evoluci´on global a largo plazo de las ventas como los patrones que se repiten a˜no a a˜no. Adem´as, el procedimiento de reparto diario maneja de manera diferente los meses que contienen fechas especiales y que suponen una proporci´on de las ventas anuales muy elevada. Otra de las propiedades relevantes del m´etodo es su capacidad para dar previsiones con bastante antelaci´on. El sistema que Eroski viene utilizando durante los ´ultimos a˜nos solamente hace predicciones a una semana vista, mientras que nuestra propuesta puede hacer una primera aproximaci´on a las ventas incluso con varios meses de antelaci´on. Gracias a ello el margen de tiempo del que la plataforma dispone para organizar la distribuci´on es mucho mayor, garantizando un mejor rendimiento. 69
No debemos olvidar que el objetivo final del proyecto es construir un programa que se integre en los sistemas inform´aticos de Eroski. En este aspecto cabe remarcar que el m´etodo desarrollado proporciona previsiones de forma autom´atica haciendo que la intervenci´on por parte del analista sea m´ınima. No menos importante es la rapidez del algoritmo. En el momento en que el m´etodo se implante ser´an millones las series a tratar, por lo que el programa debe ser eficiente en este sentido. Esta es una de las razones por las que nos hemos decantado por estos modelos y no por otros m´as sofisticados que, aunque podr´ıan llevar a previsiones m´as acertadas, tendr´ıan un coste computacional no asumible. A pesar de todo esto, nos encontramos tambi´en con algunas limitaciones. Por lo general, este tipo de modelos de series temporales necesitan un hist´orico de datos bastante largo. No hay un n´umero fijo de observaciones a partir del cual se pueda asegurar que los modelos vayan a funcionar bien siempre pero se recomienda tener al menos cinco a˜nos de ventas. De todos modos, el mejor o peor funcionamiento del proceso depender´a del tipo de serie ante el que nos encontremos. De hecho, ya hemos visto que lleva menos tiempo aprender una pauta muy estable (como la de la Categor´ıa 2) que otra que no lo es tanto. Desafortunadamente, en m´ultiples ocasiones nos encontraremos con situaciones en las que no haya tanta informaci´on disponible, por ejemplo, al tratar centros de reciente apertura. Al hilo de la insuficiencia de informaci´on, una desventaja del m´etodo de distribuci´on diaria de la previsi´on semanal o por grupos de d´ıas es que, tal y como suced´ıa con la Categor´ıa 2, no siempre tendremos datos diarios del a˜no en el que los d´ıas de la semana cayeron de la misma forma que en el a˜no de estudio. La b´usqueda de una alternativa para la distribuci´on diaria podr´ıa ser el objeto de an´alisis de un trabajo futuro. Por otro lado, cuando se da un suceso extra˜no como una huelga o un evento meteorol´ogico extremo, los modelos no son capaces de detectarlo y el desajuste que se haya provocado en las ventas se propagar´a al hacer las previsiones de los meses siguientes. Asimismo, debido al tiempo de aprendizaje que necesitan las t´ecnicas de series temporales, un cambio en la tendencia de la serie no se ver´a reflejado en las previsiones hasta varios meses despu´es de haberse producido. 6.2. V´ıas de investigaci´on futuras Aunque hemos dado el primer paso para intentar solucionar el problema del aprovisionamiento y, m´as concretamente, el de la previsi´on de ventas, todav´ıa hay muchas cuestiones que quedan abiertas y que podr´ıan ser objeto de estudios posteriores. He aqu´ı algunas de ellas. Desarrollo de la herramienta a gran escala El siguiente paso dentro del proyecto que estamos realizando es la creaci´on de una aplicaci´on inform´atica que en un futuro se implantar´a en los sistemas de Eroski. Esta herramienta se comunicar´a con otras ya existentes con el fin de anticipar y agilizar la gesti´on de los pedidos. No obstante, antes de nada, ser´ıa muy recomendable probar el m´etodo con una muestra de series mucho m´as amplia para detectar y corregir posibles errores o aspectos que no se hayan tenido en cuenta hasta ahora. 70
Tratamiento de los centros con insuficiencia de datos Ya hemos mencionado que las t´ecnicas de series temporales requieren un hist´orico de datos bastante largo, por lo que ser´an imposibles de aplicar a las series de ventas de un centro de reciente apertura. El problema que se plantea es c´omo conseguir una previsi´on para estos establecimientos carentes de datos. Una primera idea que se podr´ıa analizar es la b´usqueda de un centro “espejo” de caracter´ısticas y comportamiento de ventas similares al de estudio. Una t´ecnica estad´ıstica muy extendida y que puede resultar adecuada para la selecci´on de este centro espejo es el an´alisis cluster o de conglomerados. Consideraci´on de otras variables Hasta ahora, para calcular los pron´osticos solo hemos considerado las ventas del pasado. Sin embargo, hay muchos factores que pueden influir en la actividad de un supermercado o hipermercado como, por ejemplo, el tiempo meteorol´ogico, la situaci´on econ´omica, etc. Igualmente, ser´ıa interesante tener en cuenta si un producto se va a poner en oferta a la hora de hacer la previsi´on. Nuevas aperturas Cuando Eroski se plantea la apertura de un nuevo centro se lleva a cabo un plan de viabilidad para ver si resultar´a rentable. En ´el se calculan todos los gastos derivados de la compra o alquiler del local, licencias, personal, mobiliario, llenado de la tienda,. . . Evidentemente, un dato muy importante en la decisi´on de abrir o no la nueva tienda es la estimaci´on de las ventas durante los primeros a˜nos de existencia del centro. Sin embargo, es un dato muy dif´ıcil de obtener ya que son muchos los factores que repercuten en las ventas y no siempre son f´aciles de medir. El estatus socio-econ´omico y el n´umero de habitantes del ´area de cobertura del establecimiento, la valoraci´on de la marca en la regi´on, la facilidad de acceso o la ubicaci´on de los competidores son s´olo una peque˜na muestra de las variables a considerar. Hoy en d´ıa, la empresa utiliza varios m´etodos para la obtenci´on de una estimaci´on de las ventas de un nuevo centro pero ninguno de ellos resulta del todo fiable. El problema del pricing Otro problema que empieza a preocupar es el de la gesti´on de los precios. Preguntas sobre el impacto que tendr´a una subida en el precio de un art´ıculo o c´omo afectar´a a las ventas de las otras marcas una oferta en el producto de la marca blanca son cada vez m´as habituales. No es mucho el trabajo realizado en este ´ambito, por lo que el pricing podr´ıa ser una buena l´ınea de investigaci´on. Gesti´on del almacenamiento y la distribuci´on Dejando un poco de lado la estad´ıstica, la investigaci´on operativa tambi´en tiene mucho que decir en el mundo del reaprovisionamiento. Tanto la log´ıstica como la distribuci´on podr´ıan hacerse de manera muy eficiente si se emplearan modelos de optimizaci´on. Encontrar la mejor ubicaci´on para una plataforma de almacenaje, calcular las rutas ´optimas 71
para los camiones que distribuyen la mercanc´ıa o ajustar los turnos de trabajo de los empleados a las necesidades de cada centro pueden suponer un ahorro nada despreciable para la empresa. En resumidas cuentas, hemos dise˜nado, implementado y probado un m´etodo autom´atico de previsi´on de ventas que mejora cualitativa y cuantitativamente el que Eroski ha utilizado hasta ahora. No obstante, nos topamos con algunas limitaciones que podr´ıan ser depuradas en nuevos estudios. Adem´as, el ´area del reaprovisionamiento engloba muchos m´as problemas que el de la previsi´on de ventas, de modo que a´un quedan muchas v´ıas de investigaci´on abiertas para el futuro. 72
Bibliograf´ıa [1] P.J. Brockwell and R.A. Davis. Introduction to Time Series and Forecasting. SpringerVerlag, 1996. [2] F. Canova and B.E. Hansen. Are Seasonal Patterns Constant Over Time? A Test for Seasonal Stability. Journal of Business and Economic Statistics, vol. 13, No. 3, pp. 237-252, 1995. [3] C. Chatfield. The Analysis of Time Series: an Introduction. Chapman and Hall, 1980. [4] C. Chatfield. Time-Series Forecasting. Chapman and Hall/CRC, 2001. [5] C. Chatfield and M. Yar. Holt-Winters Forecasting: Some Practical Issues. The Statistician, vol. 37, pp. 129-140, 1988. [6] R.T. Clemen. Combining Forecasts: A Review and Annotated Bibliography. International Journal of Forecasting, vol. 5, pp. 559-583, 1989. [7] E.S. Gardner and D.G. Dannenbring. Forecasting with Exponential Smoothing: Some Guidelines for Model Selection. Decision Sciences, vol. 11, issue 2, pp. 370-383, 1980. [8] G.K. Groff. Empirical Comparison of Models for Short-Range Forecasting. Management Sciences, vol. 20, No. 1, pp. 22-31, 1973. [9] J.D. Hamilton. Time Series Analysis. Princeton University Press, 1994. [10] A.C. Harvey. Forecasting, Structural Time Series Models and the Kalman Filter. Cambridge University Press, 1989. [11] R.J. Hyndman and Y. Khandakar. Automatic Time Series Forecasting: The forecast Package for R. Journal of Statistical Software, vol. 27, issue 3, 2008. [12] G. Janacek and L. Swift. Time Series Forecasting, Simulation and Applications. Ellis Horwood Limited, 1993. [13] S. Makridakis, S.C. Wheelwright and R.J. Hyndman. Forecasting: Methods and Applications. John Wiley & Sons, 1998. [14] M. Mart´ı Recober y M.P. Mu˜noz Gr`acia. Apuntes de la asignatura Previsi´o i S`eries Temporals. [15] D.C. Montgomery and L.A. Johnson. Forecasting and Time Series Analysis. McGrawHill, 1976. 73