Sistema de predicción de tráfico portuario
Abstract
In the recent years, forecasting or predictions of port freight have received an increasing attention in ports management and logistics. Two differentiate analytical approaches are used to predict port traffic: causal methods and time-series methods. This TFG is focussed in to investigate and apply forecasting techniques, based on time-series and ecnonometric methods, for port management in order to optimize resources looking for smart port strategies.
Full text
Trabajo realizado por: Idoia Salaverria Guezala Dirigido por: Manel Grifoll Colls Grado en: Ingeniería civil Barcelona, 26 de septiembre de 2018 Departamento de infraestructuras del transporte y del territorio TREBALL FINAL DE GRAU Sistema de predicción de tráfico portuario
i Abstract The merchandise ports are places that need to be adapted for time to time, both because of the evolution of the ships that arrive there and the volume of the containers that they must accept. For this reason, it is important to know the commercial tendency suffered by these ports to be able to enlarge and modify them to make them more efficient. Along this work, an analysis of the most important ports of Spain (Barcelona, Valencia and Algeciras) has been done before creating a model that allows us to predict the volume of the containers that each port will have to receive. To accomplish this, some models have been created by using linear regressions that relate the traffic of these ports with some econometrical variables: GDP, unemployment rate and the oil price. After shaping both the univariate models and the multiple ones, it has been detected that the last ones stick much better to the reality and therefore they guarantee a more reliable result with a smaller error range. Through different verification tests it has been detected that these models have relatively low errors, as the MAPE of the majority of them is around 1-10%. Only three of the models that have been created would not be convenient to implement since their absolute error rate reaches 35%. This is the case of the total traffic in Algeciras, the transhipment in Barcelona and the import-export traffic of Algeciras. By using other prediction methods, such as a regression of higher order, a better result could be achieved. The most trusted model, whose implementation would guarantee a very good prediction of the volume of the containers that will be received, is the one that predicts the transhipment of the port of Algeciras. The regression obtained using the worldwide GDP and the traffic of this port creates a model whose error rate is lower than 1,5%. This said, we can see that even using a simple empirical method, like the linear regression, it is possible to adjust several models to the reality and guarantee a good model of container volume prediction.
ii Resumen Los puertos de mercancías son lugares que deben ir adaptándose a cada época, tanto por la evolución de los barcos que llegan a él como por volumen de contenedores que tiene que ser capaz de admitir. Por este motivo es importante conocer la tendencia comercial que sufren estos puertos y así poder modificarse y ampliarse convirtiéndose en lugares eficientes. A lo largo de este trabajo se ha querido hacer un análisis de los puertos estatales más importantes (Barcelona, Valencia y Bahía de Algeciras) para poder después crear un modelo que nos permita predecir el volumen de contenedores que van a tener que ser capaces de recibir cada uno de ellos. Para ello, se han creado unos modelos mediante el uso de regresiones lineales tanto univariantes como múltiples que relacionan el tráfico de estos puertos con algunas variables económicas: PIB, tasa de desempleo y precio del petróleo. Tras conformar tanto modelos univariantes como múltiples se ha detectado que los segundos se ajustan mucho mejor a la realidad y que por tanto nos garantizan unos resultados más similares a los verdaderos con un menor margen de error. Mediante diferentes tests de validación se ha detectado que estos modelos tienen unos errores relativamente bajos, puesto que todos ellos tienen un MAPE del orden del 1-10%. Solo tres de los modelos que se han creado no serían convenientes para ponerlos en práctica ya que su error porcentual absoluto llega a alcanzar el 35%. Este es el caso del tráfico total de la Bahía Algeciras, tráfico en tránsito del puerto de Barcelona y el tráfico en import-export de Algeciras. Con la utilización de otros métodos de predicción, como podría ser una regresión de mayor orden, sería posible alcanzar mejores resultados. El modelo de mayor confianza, cuya implementación nos aseguraría una muy buena predicción del volumen de contenedores que recibirá es el tránsito en el puerto de Algeciras. La regresión creada con el PIB mundial junto con el tráfico de este puerto crea un modelo cuyo error porcentual es inferior al 1,5%. Dicho esto, se ve que incluso utilizando un método empírico sencillo, como lo es la regresión lineal, es posible ajustar varios modelos a la realidad y así asegurar un buen modelo de predicción del volumen de contenedores.
iii Agradecimientos En primer lugar quiero dar las gracias a mi tutor, Manel Grifoll, por haberme motivado a realizar este trabajo, haberme ayudado a orientarlo y resulto todas los problemas que no he sido capaz de averiguar por mí misma. Por otro lado, agradecer a Maribel Ortego que, posiblemente sin haber sido consciente de ello, me ha aclarado muchísimas de las dudas que he tenido del ámbito estadístico a la hora de realizar este trabajo. La que con un breve email ha sido capaz de resolverme cuestiones para las que llevaba días investigando. Por supuesto, quiero dejar un importante hueco para mis padres y hermanas. Mis padres han sabido darme el empujón que he necesitado en varios momentos, y qué decir de mi hermana Ana, mi ejemplo a seguir, la persona que más capacidad para motivarme tiene y seguramente quien más ha creído nunca en mí. Los amigos siempre han sido muy importantes en mi vida y realmente es fácil tenerlos cuanto todo va bien, pero haberlos tenido también en mis días malos es lo más importante. Agradezco tanto a las amigas con las que he compartido casa cada día (especialmente a Claudia y a Pilar) por haber aguantado mis quejas sobre mundo y sacarme a pasear cuando lo he necesitado, como a las que no tenía cerca. A mis lagunas porque, incluso estando separadas la mayoría del año, me habéis sacado una sonrisa aunque fuera con un abrazo virtual y porque la mayoría de vosotras sois las que mejor me habéis entendido durante este último año. Gracias también a mis compañeros de clase, con quienes he compartido gran parte de las horas de este último curso, por haber podido compartido nuestras dudas sobre cómo plantear y planificar un TFG y, sobre todo, por hacer que las largas horas en la uni hayan sido menos intensas. En especial agradecer a mi compañera y amiga Ester, por centrar un poco mi cabeza cuando se me olvida la magnitud de lo que estaba haciendo. Por último, dar las gracias a todos y cada uno de los profesores que he tenido a lo largo de la carrera por haberme enseñado que la ingeniería civil es lo que quiero hacer y así ver el claro objetivo de terminar este TFG en los momentos en los que quería dejarlo todo.
iv Índice Abstract .......................................................................................................................................... i Resumen ........................................................................................................................................ ii Agradecimientos .......................................................................................................................... iii Índice .............................................................................................................................................iv 1. Introducción y objetivos ............................................................................................................ 1 2. Metodología .............................................................................................................................. 4 2.1 Series temporales de los puertos españoles .................................................................. 4 2.2 Variables econométricas ................................................................................................. 7 2.3 Descripción del método .................................................................................................. 8 2.4 Correlación entre variables ........................................................................................... 10 2.5 Métrica de los errores ................................................................................................... 11 3. Resultados ............................................................................................................................... 13 3.1 Correlación entre series temporales ............................................................................. 13 3.2 Estacionalidad de las variables ...................................................................................... 16 3.3 Test de cointegración .................................................................................................... 20 3.4 Regresión lineal univariante .......................................................................................... 23 3.5 Regresión lineal múltiple ............................................................................................... 25 4. Validación de los modelos e intercomparación ...................................................................... 29 5. Discusión ................................................................................................................................. 32 6. Conclusiones............................................................................................................................ 36 7. Referencias .............................................................................................................................. 38 APÉNDICES .................................................................................................................................. 40 Apéndice A .......................................................................................................................... 40 Apéndice B........................................................................................................................... 43 Apéndice C ........................................................................................................................... 46 Apéndice D .......................................................................................................................... 49 Apéndice E ........................................................................................................................... 55 Apéndice F ........................................................................................................................... 58 Apéndice G .......................................................................................................................... 61
1 1. Introducción y objetivos En una época en la que debido a la globalización el volumen de transporte ha aumentado en gran medida se ha buscado el medio más barato para hacerlo. El coste del transporte marítimo es el más bajo en comparación con otros medios de transporte y es especialmente efectivo para desplazamientos de larga distancia. Dentro del transporte marítimo, el comercio mediante el uso contenedores es el que más rápido ha crecido en los últimos años y por tanto el espacio dedicado a la carga y descarga de los puertos ha tomado gran importancia. Los puertos tienen una labor fundamental para que el comercio marítimo sea efectivo y éste afecta directamente en la economía de la zona. A lo largo de las últimas décadas, se ha comprobado que el precio del viaje por TEU (acrónimo del término en inglés Twenty-foot Equivalent Unit) se reduce mediante el incremento de la capacidad de las embarcaciones. El problema es que debido al crecimiento del tamaño de los barcos es necesario hacer el trasbordo de un mayor número de contenedores en el menor tiempo posible. Esto crea la necesidad de mejorar las instalaciones y equipamientos de los puertos e intentar reducir la congestión de embarcaciones con el fin de hacerlos más atractivos para las compañías y que no decidan embarcar en los puertos con los que compiten. Muchos puertos están iniciando diferentes planes de expansión para hacer frente con este gran número de contenedores por barco y reducir la congestión. Pero para evaluar estas expansiones es necesario hacer una previsión del número de embarcaciones y del incremento de comercio de los próximos años para tomar la decisión correcta sobre su tamaño. Hoy en día contamos con diferentes estudios y métodos empíricos para hacer un análisis de predicción del rendimiento de contenedores, tales como el modelo autorregresivo integrado de media móvil (ARIMA), el modelo de medias móviles (MA), la regresión lineal, el suavizamiento exponencial, entre otros (González Casimiro, 2009). Algunos estudios disponibles revelan que hay una relación entre el volumen de contenedores y algunas variables macroeconómicas del país y región donde se encuentra el puerto, tales como el PIB, el precio del petróleo o la población. Sin embargo, el elemento más importante para hacer un modelo de predicción preciso es seleccionar las variables independientes adecuadas. Cada puerto tiene unas características diferentes y por tanto las variables a considerar deberán ser diferentes. Por ejemplo, un puerto con que se dedica principalmente a importar y exportar
2 estará más correlacionado con el PIB de la región donde se encuentra el puerto, mientras que uno más dedicado al tránsito dependerá más de factores globales. Según el artículo 2 del texto refundido de la Ley de Puertos del Estado y de la Marina Mercante, "se denomina puerto marítimo al conjunto de espacios terrestres, aguas marítimas e instalaciones que, situado en la ribera de la mar o de las rías, reúna condiciones físicas, naturales o artificiales y de organización que permitan la realización de operaciones de tráfico portuario, y sea autorizado para el desarrollo de estas actividades por la Administración competente". Los puertos tienen notables impactos en la economía de los países en los que se sitúan, tanto positivos como negativos. Los efectos positivos se relacionan principalmente con el crecimiento económico de los países y su PIB, además de crear puestos de trabajo tanto directa como indirectamente. No obstante, sigue habiendo algunos aspectos negativos alrededor del comercio marítimo. La principal consecuencia negativa es el deterioro del medio ambiente y la congestión causada por el gran volumen de embarcaciones. Los puertos juegan un papel muy importante en cuanto al transporte marítimo, por tanto las mejoras técnicas, las infraestructuras y las superestructuras están previstas para cargar y descargar diferentes cargamentos de distintos tipos de barcos. De todas maneras, no todos los puertos tienen las mismas características y por tanto juegan papeles muy diferentes. En cuanto al tipo de puertos de contendores, se pueden clasificar dos clases dependiendo de la función que tienen: los puerto de tránsito o dedicados a import-export. El tránsito consiste en que la mercancía que llega en los barcos se desembarca para distribuirla en diferentes embarcaciones y estos sigan su curso, mientras que el import-export se refiere a los casos en el que el puerto es el punto de origen o destino de una ruta marítima. Generalmente, un puerto puede realizar ambas acciones, pero es habitual que cada uno esté más especializada en una de las dos tareas. En el transporte marítimo es habitual usar un modelo hub and spoke que consiste en que algunos puertos (hub) son los encargados de recibir la mercancía para después enviarlo a puertos de menor tamaño. Considerando la clasificación previa, los hub son puertos de tránsito mientras que los puertos secundarios de destino son denominados de import-export. A su vez, los hub se pueden distinguir entre hub globales y regionales, en función de cuales sean sus puertos de origen y destino.
3 El objetivo principal de este trabajo es predecir el tráfico de contenedores en los puertos españoles con un modelo de ajuste econométrico. Las variables que se han seleccionado para este análisis son el tráfico de contenedores de los tres puertos a estudiar, separado por tránsito e importación-exportación, el producto interior bruto (tanto regional como nacional y mundial), el precio del petróleo por barril y la tasa de desempleo local y global. Con el fin de evaluar la relación entre las variables explicadas y generar el modelo de predicción se ha elegido un método regresivo. Dicho estudio se centra en los principales puertos mediterráneos del Estado español: Barcelona, Valencia y Bahía de Algeciras. A nivel personal, los objetivos que me he propuesto con este trabajo es por un lado entender en mayor medida el funcionamiento de los puertos españoles y el tráfico de mercancías marinas. Por otro lado, para realizar este estudio es necesario ampliar el conocimiento de herramientas estadísticas y del soporte informático MatLab, puesto que antes de comenzarlo mi nivel de conocimiento era básico. Este documento constará de diversos capítulos, comenzando por una apartado donde se ha hecho una pequeña introducción y se han expuesto los objetivos del trabajo. Incluyendo, al mismo tiempo las características de los puertos y una clasificación de los distintos puertos con los que nos encontramos dependiendo de la función que tomen. Puesto que este trabajo se centra en tres puertos españoles, en el segundo apartado, se realiza también un análisis del sistema portuario del Estado español, haciendo hincapié en los tres puertos que se analizarán después: Barcelona, Bahía de Algeciras y Valencia. Así mismo, se describen las variables econométricas que se han considerado relevantes para este estudio y se resume esquemáticamente el método a utilizar para crear el modelo. El siguiente capítulo, se divide en 6 apartados, a través de los cuales se procede a la explicación detallada de los pasos a seguir con el fin de alcanzar los modelos deseados y comprobar su confiabilidad. Además de la explicación de los diferentes test a realizar, se muestran los resultados obtenidos. En el capítulo 4 se realiza una verificación del modelo obtenido en el anterior capitulo. A continuación se explica con más detalle este procedimiento que consiste en calcular los errores de los modelos creados utilizando distintos métodos y ver de esta manera si los resultados que se obtienen con el modelo se asemejan a los reales. Tras haber realizado las comprobaciones necesarias, en los últimos apartados habrá una discusión sobre los modelos creados con el fin de concluir con el mejor modelo para cada puerto. Al mismo tiempo, se resumen los resultados más sorprendentes con los que nos hemos encontrado a los largo del estudio.
4 2. Metodología 2.1 Series temporales de los puertos españoles España, debido a su forma peninsular es uno de los países con mayor longitud de costa, siendo el más costero de la Unión Europea con 8000km. Por ese motivo y por su buena ubicación es un país que cuenta con un gran número de puertos de interés general, exactamente 46 gestionados por el ente Puertos del Estado. Al igual que ocurre de forma general, en España la mayor parte de las mercancías se transporta en contenedores alcanzando el 71% del total de la mercancía del país en 2016 según datos obtenidos de Puertos del Estado. Tal y como se puede ver en la Figura 1, entre las mercancías distribuidas en contenedores (TEUs) en España, más de tres cuartas partes lo hacen desde los tres principales puertos del país: Algeciras, Valencia y Barcelona. Este es el motivo por el que estos son los tres puertos seleccionados para el estudio. Figura 1. Distribución por puertos de los contenedores totales en TEUs en España en 2016. Fuente: Puertos del Estado (2016). Elaboración propia Los tres puertos principales tienen características muy diferentes sobre todo en cuanto a su función, tal y como muestra la Figura 2. El puerto de Barcelona se dedica principalmente a la importación y exportación mientras que el puerto de la Bahía de Algeciras es mayoritariamente un punto intermedio entre rutas marítimas actuando como hub. El puerto de Valencia es un hub mixto puesto que casi la mitad de sus mercancías tienen como origen y destino el propio puerto. A pesar de que su fracción de import-export no llegue al 50%, es el puerto español por donde entra y sale la mayor parte de las mercancías del país y debido a su importante hinterland (que incluye Madrid) se considera el principal puerto de España.
11 2.4.2 Coeficiente de determinación R2 Este coeficiente estadístico que muestra el grado de asociación lineal entre dos variables independientes se obtiene haciendo el cuadrado del coeficiente de correlación de Pearson. El valor del coeficiente de correlación de Pearson pertenece siempre al intervalo [-1,1] donde decimos que no existe relación lineal si toma el valor 0 y en cambio hay una correlación perfecta cuando su valor es 1 o -1. El coeficiente se simboliza con la letra rxy y se calcula mediante la siguiente expresión: MatLab cuenta con una función que calcula este coeficiente de manera rápida y haciendo después su cuadrado, se obtiene el valor de R2. Los valores obtenidos tras este cálculo pertenecen al rango [0,1] y cuanto mayor sea su magnitud mejor correlacionado estará. Por este motivo, se tiene que tomar un valor límite a partir del cual consideraremos que existe una relación entre ambas variables. 2.5 Métrica de los errores Una vez se hayan creado los modelos univariantes y múltiples para hacer la predicción del volumen de contenedores que llegan a cada puerto es necesario calcular su error, tal y como se muestra en el diagrama de flujo de la Figura 4. Para ello existen distintos tests y, puesto que no todos ofrecen los mismos resultados, en este estudio se realizaran tres de ellos: la raíz del error cuadrático medio, el error medio absoluto y el error porcentual absoluto medio. La raíz del error cuadrático medio (RMSE) es una medida de uso habitual que calcula la diferencia entre los valores predichos por un modelo y los valores observados. El RMSE sirve para agregar las magnitudes de los errores en las predicciones o los modelos y se representa de la siguiente manera:
12 El error medio absoluto (MAE) es un estadístico que describe una información similar al anterior y su cálculo se hace por tanto de manera semejante: Por último, contamos con el llamado error absoluto porcentual medio (MAPE) que mide la magnitud del error absoluto en términos porcentuales. Este último tiene la ventaja de permitirnos comparar la precisión de modelos con distinto volumen, como ocurre entre el caso del tráfico de Barcelona y su tránsito. Su valor se obtiene mediante la siguiente fórmula:
13 3. Resultados 3.1 Correlación entre series temporales A la hora de hacer un modelo de regresión con el fin de hacer un modelo de predicción de datos, resulta útil trabajar basándose en series temporales, ya que estas permiten trabajar con secuencias de datos ordenados de manera cronológica. Como se ha mencionado anteriormente, se hará uso de multitud de series temporales con el fin de escoger la regresión que mejor se adapte a la realidad. En primer lugar, se ha realizado la recopilación de datos referentes al tráfico de los tres puertos de estudio, considerando tanto el tráfico total te mercancías, como el tránsito y el import-export por separado. Una vez se han obtenido estos datos, se ha procedido a conseguir los valores de las variables econométricas seleccionadas para el máximo número de años posible y que de esta manera el modelo sea más adecuado. En algunos de los casos, los datos obtenidos eran trimestrales y se han tenido que homogeneizar con el fin de que todas las series temporales con las que se contaba estuvieran espaciadas con intervalos de tiempo iguales, en esta caso, de un año. Las series temporales económicas con las que finalmente se cuenta son el PIB de las tres comunidades autónomas, el PIB mundial, el PIB español, la tasa de desempleo para las cinco mismas situaciones que el PIB y el precio de los barriles de petróleo. En definitiva, para este análisis contamos con 20 series temporales de diferentes periodos, todos ellos entre 1973 y 2017. En el Apéndice A - Series temporales se muestran las series temporales. Tras haber recogido toda la información, y del mismo modo que se ha mencionado anteriormente, se procede a calcular la correlación entre las distintas variables. Para calcular el valor de R2 se emplea como soporte MatLab. Para este estudio el valor a partir del cual se ha considerado que las variables están relacionadas es el 0,75. En la Tabla 1 se han recogido todos los coeficientes de determinación R2 y se han sombreado de color verde las relaciones que se tomaran como buenas. Los valores comprendidos entre 0,7 y 0,75 son considerables, por este motivo, estos valores aparecen también sombreados de color ámbar en la Tabla 1. Tras analizar la Tabla 1 se ve como entre el número total de contenedores y el PIB, tanto regional como global, existe una alta correlación. Exceptuando el puerto de Algeciras, en todos los casos el coeficiente supera el 0,8 tanto en relación con el PIB de la comunidad a la que
14 Tabla 1. Tabla que muestra el coeficiente de correlación entre las variables Fuente: Elaboración propia
15 pertenecen como con el PIB español y mundial. El hecho de que el puerto de Algeciras no esté tan relacionado con el PIB de Andalucía no es totalmente sorprendente, puesto que es un puerto dedicado mayoritariamente al tránsito, por tanto no depende mucho de la economía autonómica, pero si mundial. Tanto en el caso del puerto andaluz como el valenciano, el coeficiente de correlación entre el número de contenedores y el PIB mundial es cercano al 0,95. Este dato es esperable puesto que ambos puertos tienen un mayor porcentaje de tránsito que de import-export lo que hace que dependa más de la economía mundial. Figura 6. Evolución de tráfico total en los tres puertos y el precio del barril de petróleo en los años 2003-2017 Fuente: Elaboración propia Por otro lado, el hecho de que no exista ningún tipo de correlación entre el tráfico de contenedores y el precio del petróleo es un tema a analizar. Por un lado el precio del petróleo es un buen indicador de la economía mundial, lo que debería estar relacionado con el movimiento de mercancías. Además, las embarcaciones usan derivados del petróleo como combustible, por tanto el coeficiente obtenido sorprende. Si observamos la Figura 6 vemos que efectivamente en los últimos años no hay ninguna relación entre el número de contenedores y la dicha variable económica. Sin embargo, si calculásemos el coeficiente R2 para un periodo de tiempo menor, sin incluir los datos a partir del 2013, probablemente obtendríamos un valor mucho mayor. Especialmente el puerto de Barcelona sigue una línea muy parecida a la del precio del petróleo, destacando el descenso del año 2009. De la misma manera, podemos ver que el volumen de contenedores no está prácticamente relacionada con la tasa de desempleo. Solo existe una alta correlación entre el tráfico de import-export de Barcelona y la tasa de desempleo mundial. Puesto que parece una variable econométrica interesante, se tomara como buena también la correlación entre el tránsito de
16 Valencia y la tasa de desempleo de la comunidad a la que pertenece y de España, donde el coeficiente supera el 0,7. 3.2 Estacionalidad de las variables Los coeficientes de correlación permiten ver si dos variables están suficientemente correlacionados como para poder relacionarlos mediante una regresión lineal. Sin embargo, hay veces en las que dos series pueden tener un alto valor del coeficiente de correlación pero no ser estacionarias. Esta no estacionariedad provoca que la regresión no sea adecuada y nos dé como resultado lo que se conoce como regresión espuria. Las regresiones espuria ocurren al relacionar variables no estacionarias, salvo que ambas estén cointegradas. (Granger & Newbold, 1974) Una serie estacionaria es aquella cuya varianza y media se mantiene constante en el tiempo. En el caso de las series económicas es muy habitual que estas medidas varíen con el tiempo, igual que ocurre con el número de contenedores, ya que con los años ha ido aumentando. Si se utilizan datos no estacionarios, se pueden obtener valores muy altos de R cuadrado incluso si las dos variables no están relacionadas. Esta situación suele existir cuando las dos variables son tendencias en el tiempo. Por ejemplo, la tendencia del número de faldas vendidas y el ratio de ahogados en una piscina municipal pueden tener la misma tendencia en el tiempo porque el calor es la variable que los une, y sin embargo, no tienen ningún tipo de relación real entre ellas. Basta que dos variables tengan algo de tendencia para que aparezca una aparente relación entre ellas. Cuando se elimina esta tendencia, por ejemplo, diferenciando los datos, esta relación espuria desaparece. La herramienta habitual para comprobar la estacionariedad son los test de raíz unitaria, tales como la prueba de Dickey-Fuller Aumentada (ADF), el test de Phillip-Perron (PP) o la observación del correlograma. 3.2.1 Test de Dickey-Fuller Aumentado (ADF) El test de Dickey-Fuller Aumentado es una test de raíz unitaria que supone la hipótesis nula (H0) de que el modelo es no estacionario y para probarlo se estima el siguiente modelo:
17 Realizando el test con el soporte de MatLab se puede obtener su valor donde lo más interesante es saber el p-valor del estadístico. El p-valor se define como la probabilidad que tiene el estadístico de cumplir la hipótesis nula. Puesto que en el caso del test ADF la hipótesis nula es que la serie sea no estacionaria, si el valor de p es bajo podemos suponer que se rechaza H0 y que por tanto la serie es estacionara. En consecuencia, hay que poner un límite del p-valor a partir del cual aceptamos que la serie sea estacionaria, generalmente 0,05 o 0,01. En este trabajo se toman como estacionarias aquellas series cuyo p-valor sea menor a 0,05. ADF Autocorrelación p-value ¿Estacionario? RESULTADO Tráfico Barcelona 0.0031 si No estacionario Tráfico Algeciras 0.001 si No estacionario Tráfico Valencia 0.001 si No estacionario Tránsito Barcelona 0.0594 no No estacionario Tránsito Algeciras 0.1972 no No estacionario Tránsito Valencia 0.0171 si No estacionario Imp/exp Barcelona 0.0346 si No estacionario Imp/exp Algeciras 0.4982 no No estacionario Imp/exp Valencia 0.2105 no Estacionario* PIB Cataluña 0.001 si No estacionario PIB Andalucía 0.0035 si No estacionario PIB Com. Valenciana 0.0042 si No estacionario PIB España 0.1109 no No estacionario PIB Mundial 0.001 si No estacionario Precio Petróleo 0.3889 no No estacionario Paro Cataluña 0.7122 no No estacionario Paro Andalucía 0.7725 no No estacionario Paro Com. Valenciana 0.6438 no No estacionario Paro España 0.7306 no No estacionario Paro Mundial 0.7944 no No estacionario (*) Se cuenta con pocos valores en la serie temporal y la interpretación del la FAS puede ser errónea Tabla 2. Test ADF e interpretación de las funciones de autocorrelación de las series iniciales Fuente: Elaboración propia 3.2.2 Visualización del correlograma En la Tabla 2 se puede ver que muchas de las series son estacionarias según el test ADF. Sin embargo, en los gráficos de las series temporales mostrados en el Apéndice A - Series
18 temporales observamos que estas tienen una tendencia creciente en el tiempo y por tanto no los consideraremos así para nuestro estudio. Para complementar la decisión de tomar una serie como estacionaria o no estacionaria, se ha decidido hacer una verificación utilizando la autocorrelación. La autocorrelación, también conocida como dependencia secuencial, es la correlación de una serie temporal (yt) con una versión desplazada en el tiempo de la misma (yt+k). Este desplazamiento, habitualmente llamado desfase, se identifica con la letra k. La función de autocorrelación (FAS) muestra el coeficiente de correlación en función del retardo k que se le introduce a la serie y se representa mediante un correlograma. El valor que toma el primer pico es 1, puesto que la correlación entre dos series iguales obtiene este valor (como es lógico, están totalmente correlacionadas). A partir del primer retardo está correlación debería reducir considerablemente y mantenerse con un valor pequeño para poder decir que es estacionario. Si la disminución del coeficiente de correlación es lenta estaremos en el caso en que la serie a estudiar no es estacionaria. Un correlograma que desciende rápidamente o de manera aleatoria es típico de variables estacionarias. En la Figura 7 se muestran dos ejemplos de FAS. De la primera se interpreta que la serie en la que trabaja no es estacionaria, mientras que la segunda sí. Figura 7. Ejemplos de funciones de autocorrelación (FAS) según la estacionalidad de la serie Fuente: Elaboración propia Del mismo modo que se había supuesto de manera visual, algunas de las series que se han considerado como estacionarias tras pasar el test de ADF no son tan estables como se precisa para nuestro cálculo. Los gráficos del Apéndice C - Autocorrelación de las series temporales nos muestrean que la disminución del coeficiente de correlación en todas las series ocurre de
19 manera lenta y por tanto no se van a considerar estacionarias para crear el modelo. Por lo cual, se deben trabajar las series con el fin de poder considerarlas estacionarias. Este procedimiento se realizara de dos maneras, tal y como se ha explicado inicialmente en la metodología a utilizar. 3.2.3 Diferenciación Tras justificar en el anterior apartado que la correlación de las series no estacionarias nos darían como resultado una regresión espuria, se va a aplicar la diferenciación con tal de hacer que la serie pierda su tendencia y pase a ser estacionaria. Diferenciar una serie temporal consiste en calcular la diferencia entre cada dato y su anterior, siempre perdiendo el primero de los datos. De forma numérica se hace de la siguiente forma: El proceso para quitar la tendencia consiste en crear un operador retardo (Lag Operator) de diferenciación y utilizarlo para filtrar la serie inicial. En el caso que tras hacer esta operación las series aun pueden tener una tendencia restante y por tanto hará falta tomar la segunda diferencia en las series que sigan sin ser estacionarias. La segunda diferencia de la serie se obtiene de la siguiente manera: Observando los gráficos de las nuevas series temporales, incluidas en el Apéndice D - Series temporales tras la primera y segunda diferenciación, se puede ver como la tendencia ha desaparecido en gran medida y por tanto la serie ha pasado a ser estacionaria. Para asegurarnos que efectivamente las series no estacionarias han pasado a serlo, se ha vuelto a realizar el test ADF con las series transformadas. A su vez, se ha vuelto a calcular la función de autocorrelación para todos los casos y así poder contrastar los resultados obtenidos con el test de Dickey-Fuller Aumentado. La Tabla 3 muestra los p-valores referentes a las series tras haber pasado la primera y segunda diferencia, y la interpretación de los gráficos de autocorrelación. Al mismo tiempo se han coloreado de verde las celdas que aseguran que la series pasan a ser estacionarias. En general se puede ver como el p-valor reduce tras hacer la diferenciación y en el caso de las series no estacionarias tras la primera diferencia, estas pasan a serlo tras la segunda. Las FAS tras haber realizado la primera diferenciación están incluidas en el Apéndice E - Funciones de autocorrelación tras la primera diferenciación, mientras que
20 el Apéndice F - Funciones de autocorrelación tras la segunda diferenciación incluye las funciones de autocorrelación tras pasar el filtro de la segunda diferencia. En definitiva, en la Tabla 3 vemos que todas las series pasan a ser estacionarias al menos tras la segunda diferenciación y que por tanto no hará falta excluir ninguna de las series para crear el modelo. Tras la primera diferencia Tras la segunda diferencia p-value Resultado ADF Autocorrelación p-value Resultado ADF Autocorrelación Tráfico Barcelona 0.001 si Estacionario - - - Tráfico Algeciras 0.001 si Estacionario - - - Tráfico Valencia 0.0028 si No estacionario 0.001 si Estacionario Tránsito Barcelona 0.001 si Estacionario - - - Tránsito Algeciras 0.0096 si Estacionario - - - Tránsito Valencia 0.0827 no Estacionario* 0.001 si Estacionario Imp/exp Barcelona 0.0027 si Estacionario - - - Imp/exp Algeciras 0.0208 si Estacionario* 0.001 si Estacionario Imp/exp Valencia 0.0039 si Estacionario - - - PIB Cataluña 0.0148 si No estacionario 0.001 si Estacionario PIB Andalucía 0.1867 no No estacionario 0.001 si Estacionario PIB Com. Valenciana 0.1331 no No estacionario 0.001 si Estacionario PIB España 0.001 si Estacionario - - - PIB Mundial 0.001 si Estacionario - - - Precio Petróleo 0.0067 si Estacionario - - - Paro Cataluña 0.0184 si No estacionario 0.001 si Estacionario Paro Andalucía 0.0276 si No estacionario 0.001 si Estacionario Paro Com. Valenciana 0.0221 si No estacionario 0.001 si Estacionario Paro España 0.0273 si No estacionario 0.001 si Estacionario Paro Mundial 0.0030 si Estacionario - - - (*) Se cuenta con pocos valores en la serie temporal y la interpretación del la FAS puede ser errónea Tabla 3. Test de ADF e interpretación de las FAS tras aplicar la primera y segunda diferenciación Fuente: Elaboración propia 3.3 Test de cointegración En los apartados anteriores se ha comentado que el procedimiento más habitual para hacer que una serie temporal pase a ser estacionaria es la diferenciación, ya que permite eliminar la tendencia que tienen la mayoría de las variables econométricas. Este procedimiento es adecuado cuando contamos con muestras muy grandes, pero puesto que las series temporales
27 Linear regression model: Trafico_Algeciras ~ 1 + PIB_Andalucia + PIB_Espana + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -1.0275e+05 3.3834e+05 -0.30369 0.76485 PIB_Andalucia 18.214 11.351 1.6047 0.12597 PIB_Espana -933.17 787.58 -1.1849 0.25148 PIB_Mundial 39893 9891.1 4.0333 0.00077989 Root Mean Squared Error: 3.77e+05 R-squared: 0.892 p-value = 6.48e-09 Modelo 1. Primera hipótesis de modelo para el Tráfico de Algeciras Fuente: Elaboración propia Linear regression model: Trafico_Algeciras ~ 1 + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -3.9172e+05 95399 -4.1061 0.00018711 PIB_Mundial 64392 2328.3 27.656 3.8688e-28
28 Root Mean Squared Error: 3.53e+05 R-squared: 0.949 p-value = 3.87e-28 Modelo 2. Modelo ajustado para el Tráfico de Algeciras Fuente: Elaboración propia En este apartado solo se han mostrado el resultado completo de dos de los modelos creados, pero en el Apéndice G - Modelos de regresión lineal múltiple se muestran todos los resultados obtenidos. Se puede ver que para cada una de las variables de tráfico hay dos modelos. En primer, lugar una hipótesis inicial donde se incluyen todas las variables correlacionadas y en segundo lugar el modelo simplificado donde se han eliminado las variables con poco aporte (igual que ocurre en el Modelo 1 y Modelo 2). Así mismo la Tabla 2 muestra de manera resumida los modelos creados. En todos los casos el segundo modelo, a pesar de ser más simplificado, ofrece resultados de mejor o igual calidad y permite ahorra tiempo de cálculo, aunque este análisis se realiza más adelante. DESCRIPCIÓN DE LOS MODELOS Modelo 1 Trafico_Algeciras = -1.0275e+05 + 18.214 PIB_Andalucia - 933.17 PIB_Espana + 39893 PIB_Mundial Modelo 2 Trafico_Algeciras = -3.9172e+05 + 64392 PIB_Mundial Modelo 3 Trafico_Barcelona = -3.7309e+05 + 21.085 PIB_Cataluna - 406.12 PIB_Espana - 18277 PIB_Mundial Modelo 4 Trafico_Barcelona = -3.2182e+05 + 18.178 PIB_Cataluna - 18350 PIB_Mundial Modelo 5 Trafico_Valencia = -1.8867e+06 + 35.626 PIB_Valencia - 739.8 PIB_Espana + 51045 PIB_Mundial Modelo 6 Trafico_Valencia = -1.7525e+06 + 23.01 PIB_Valencia + 52959 PIB_Mundial Modelo 7 Transito_Algeciras = 38101 + 0.82284 Trafico_Algeciras + 5082.6 PIB_Mundial Modelo 8 Transito_Algeciras = 81922 + 0.89835 Trafico_Algeciras Modelo 9 Transito_Barcelona = -4.4071e+05 + 0.51107 Trafico_Barcelona Modelo 10 Transito_Valencia = -1.3831e+06 + 0.69366 Trafico_Valencia + 8186.5 PIB_Mundial + 33203 Desempleo_Valencia - 34050 Desempleo_Espana Modelo 11 Transito_Valencia = -1.3445e+06 + 0.82639 Trafico_Valencia Modelo 12 ImportExport_Algeciras = 1.0703e+06 - 565.08 PIB_Espana Modelo 13 ImpExp_Barcelona = 2.5587e+06 + 0.2623 Trafico_Barcelona + 0.71957 PIB_Cataluna - 3.116e+05 Desempleo_Mundial Modelo 14 ImportExport_Barcelona = 2.9228e+06 + 0.28375 Trafico_Barcelona - 3.5926e+05 Desempleo_Mundial Modelo 15 ImportExport_Valencia = 1.3435e+06 + 0.17395 Trafico_Valencia
29 Tabla 7. Descripción numérica de cada uno de los 15 modelos realizados Fuente: Elaboración propia Al realizar los modelos para predecir el tránsito (Modelo 8, Modelo 9 y Modelo 11), se ha visto que las únicas variables independientes que tenían impacto sobre el modelo son los tráficos correspondiente a cada uno de los puertos. Por tanto estos modelos no son de mucho interés para el estudio, puesto que no se relacionan con variables puramente econométricas. Lo mismo ocurre con el Modelo 15, donde se ve que el volumen de import/export del puerto de Valencia solo se puede modelar utilizando el tráfico del mismo puerto, puesto que es la única variable con la que está correlacionada (Tabla 1). 4. Validación de los modelos e intercomparación En el anterior apartado se han creado los modelos univariantes y múltiples para hacer la predicción de volumen de contenedores que llega a cada puerto. Al mismo tiempo, el programa ha proporcionado el valor de R2 con el que es posible saber la asociación existente entre el modelo lineal y los datos reales de las series. En todos los modelos creados se han obtenido valores de R cuadrado mayor a 0,7 y en los casos del tráfico total de los modelos múltiples (incluyendo el transito y el import-export) estos valores rondan el 0,9. Estos datos aseguran que los modelo tiene una alta garantía. Así mismo, hay otros tests numéricos que muestran los errores que obtiene el modelo y por tanto hacen ver si los resultados de los modelos son buenos, como por ejemplo la raíz del error cuadrático medio, el error medio absoluto y el error porcentual absoluto medio. Para sacar conclusiones es necesario, o al menos recomendable, utilizar diferentes parámetros y de esta manera tener suficiente información para comparar modelos entre sí. En general, el MAPE es el test que más capacidad nos proporciona a la hora de comparar distintos modelos, ya que es el único que trabaja sobre la misma base (%). Sin embargo es adecuado hacer una contrastar el resultado de más de una prueba. Debido a que los modelos múltiples incluyen las variables más representativas para cada variable a estudiar y por tanto tienen una mayor utilidad, se ha decidido realizar los test de validación únicamente de estos modelos y descartar del estudio los modelos simples.
30 La Tabla 8 muestra los resultados obtenidos de los diferentes test mencionados para todos los modelos creados en el anterior apartado, cuyos valores se han obtenido mediante la introducción de las formulas correspondientes en el programa matemático MatLab. De esta manera, es posible verificar la funcionalidad de los test y comparar los modelos más efectivos. En esta tabla los modelos aparecen únicamente con la numeración, pero en la Tabla 7 es posible ver la descripción de cada uno de ellos. Para la mayoría de las variables aparecen dos modelos diferentes, esto se debe a la simplificación que se ha realizado en los casos posibles y estos aparecen indicados (*). En general se observa que los distintos test ofrecen resultados bastante equivalentes, especialmente la raíz del error cuadrático medio y el error medio absoluto, donde para un elevado valor del primero se obtiene un elevado valor del segundo. Sin embargo, cuando nos referimos al error porcentual (MAPE) los resultados obtenidos son más diversos. RMSE (TEUS) MAE (TEUS) MAPE (%) Modelo 1 - Tráfico_Algeciras 3,77 · 105 2,959 · 105 9,1278 Modelo 2 - Tráfico_Algeciras* 3,53 · 105 2,637 · 105 34,4724 Modelo 3 - Tráfico_Barcelona 1,73 · 105 1,20 · 105 6,9237 Modelo 4 - Tráfico_Barcelona* 1,80 · 105 1,284 · 105 7,5311 Modelo 5 - Tráfico_Valencia 1,87 · 105 1,165 · 105 4,6454 Modelo 6 - Tráfico_Valencia* 2,03 · 105 1,51 · 105 6,6082 Modelo 7 - Tránsito_Algeciras 6,93 · 104 4,815 · 104 1,4949 Modelo 8 - Tránsito_Algeciras* 7,53 · 104 5,1 · 104 1,6512 Modelo 9 - Tránsito_Barcelona 1,31 · 105 9,533 · 104 23,9767 Modelo 10 - Tránsito_Valencia 8,92 · 104 5,605 · 104 3,5754 Modelo 11 - Tránstio_Valencia* 8,42 · 104 6,144 · 104 3,8586 Modelo 12 - ImpExp_Algeciras 5,65 · 104 4,405 · 104 17,3222 Modelo 13 - ImpExp_Barcelona 1,12 · 105 8,352 · 104 5,8051 Modelo 14 - ImpExp_Barcelona* 1,09 · 105 8,407 · 104 5,8256 Modelo 15 - ImpExp_Valencia* 8,44 · 104 6,163 · 104 3,0958 *Modelos simplificados Tabla 8. Resultados de los test de validación Fuente: Elaboración propia Tras haber calculado los distintos parámetros tanto de los modelos iniciales como de los modelos simplificados, es posible ver que en la mayoría de los casos para una misma variable ambos modelos tienen unos errores muy similares, y por tanto, será de mayor utilidad el uso de los modelos simplificados.
31 En general, el MAPE ronda el 5%, siendo inferior en la gran mayoría de los modelos. Con esto se puede decir que la regresión lineal se adapta bastante bien al volumen de contenedores de los puertos. Sin embargo, para tres de las variables la regresión lineal no ajusta bien: Tráfico de Algeciras, trafico en tránsito de Barcelona y tráfico en import-export de Algeciras. Posiblemente habría otros métodos de predicción que nos permitirían obtener mejores resultados, como por ejemplo una regresión de orden mayor.
32 5. Discusión En este apartado donde se pretenden discutir los resultados obtenidos a lo largo del estudio realizado, nos centraremos principalmente en tres aspectos: el análisis de los datos, la correlación entre variables y los modelos creados. En primer lugar se discutirán los datos con los que se ha contado a la hora de realizar el estudio. En general, las series con las que se contaba han tenido una evolución positiva a lo largo de los últimos años aunque, en general, tanto las variables de tráfico como las econométricas, han sufrido algún mínimo relativo en este periodo. En muchos de los casos, como se pude ver de manera clara en el gráfico del tráfico total de contenedores de Barcelona (Apéndice A - Series temporales), este descenso coincide con una época de crisis económica. Cada puerto tiene una manera diferente de funcionar, por tanto los datos que recibimos de cada uno de ellos es muy diferente. Para empezar, el puerto de Algeciras trabaja casi en su totalidad recibiendo contenedores en tránsito, es decir, la mercancía no se queda en el puerto. Sin embargo, el puerto de Barcelona se especializa más en mercancías de import-export. Esto ha hecho, que los distintos puertos creen modelos muy diferentes, ya que no se ven afectados por las mismas variables económicas. Cabe añadir también que el puerto de Valencia no noto el descenso de volumen de mercancías durante el periodo de crisis económica, debido a la decisión tomada por varias compañías de transportes. Debido al descenso de tráfico general, pudieron desviar a Valencia los barcos que habitualmente desembarcan en Barcelona y de esta manera reducir gastos. En segundo lugar se procede a hacer un análisis sobre la correlaciones obtenidas entre las distintas variables. Mediante la observación de los valores recogidos en la Tabla 1 se que el valor del tráfico de los tres puertos tiene un alto nivel de correlación entre ellos. A pesar de que el tráfico interno entre ellos es muy reducido, este grado de correlación se puede deber a que el tráfico en los tres puertos depende en gran medida de los mismos valores económicos, además de que la evolución del tráfico ha sido bastante similar en los últimos años, con un incremento casi constante en todos ellos. A su vez, el tráfico de contenedores de cada uno de los puertos está correlacionado con el volumen de contenedores en tránsito. Sin embargo, no ocurre lo mismo entre el tráfico total y los valores de import-export. Por ejemplo, el puerto de Algeciras tiene un bajo valor del coeficiente de correlación, lo que es debido a que solo el 9% del tráfico total de este puerto es
33 mercancía que desembarca para quedarse en este lugar. Esto a su vez provoca que el valor del coeficiente entre el tráfico y el tránsito en Algeciras sea muy cercano a la unidad. Ahora pasamos al análisis de las variables econométricas, que como se lleva diciendo a lo largo del documento, es el que mayor información de funcionamiento incluye. Un dato que me ha sorprendido bastante es la baja correlación entre el tráfico de los puertos y la tasa de desempleo de sus respectivas comunidades autónomas. Al inicio del estudio, se supuso que esta variable ayudaría a crear un modelo adecuado, sin embargo se ha visto que no. La tasa de desempleo tuvo un gran descenso durante los años de crisis económica española y después se ha recuperado. En el caso de tráfico, en cambio, ha habido un crecimiento casi constante. A pesar de que ciertamente existe un mínimo relativo durante los años de crisis, en líneas generales su evolución ha sido creciente, cosa que no ocurre en la tasa de desempleo. Un hecho que no se puede dejar pasar es que en modo general, los datos de import-export están correlacionados con el PIB de España o de sus comunidades autónomas, mientras que el volumen de contenedores en tránsito solo se correlaciona con el PIB mundial. Estos datos son esperables puesto que cuando nos referimos al tránsito, la mercancía no desembarca en ese puerto, simplemente sufre un cambio de embarcación. Por tanto, a pesar de que el país no esté pasando por su mejor momento en cuanto a la economía, el puerto puede seguir funcionando correctamente para este uso. Al mismo tiempo, se observa que, debido a que el puerto de Algeciras recibe un elevadísimo porcentaje de embarcaciones dedicados al tránsito tiene una alta correlación con el PIB mundial (0,95), mientras que no está tan correlacionado con el PIB de Andalucía (0,75). Al tomar la decisión de las posibles variables econométricas que permitirían construir un modelo predictivo adecuado para el tráfico de los distintos puertos se pensó que el petróleo sería uno de ellos. No obstante, tras realizar el test de correlación se ha visto que el nivel de relación entre el tráfico y el petróleo no alcanza en muchos casos al 0,1. A pesar de ellos, al comparar cualitativamente mediante un gráfico la evolución del petróleo y el tráfico del puerto catalán se observa un similitud de su progreso. Tal y como muestra la Figura 8, ambas variables sufren un descenso en la época de crisis española, pero el precio del petróleo tiene un recuperación más rápida. En consecuencia, se ha querido comprobar si eliminando los últimos años de la serie, donde el paralelismo entre ambas desaparecía, se obtenía un mayor valor de R2. Al volver a realizar el test incluyendo únicamente los datos anteriores a 2013 se ha obtenido de la misma manera un valor menor al 0,1, lo que supone una nula correlación entre ambas observaciones.
34 Figura 8. Evolución del tráfico en el puerto de Barcelona y el precio del petróleo Fuente: Port de Barcelona y Expansión. Elaboración propia Tras haber analizado los datos de correlación, nos dispondremos a discutir los resultados obtenidos en el apartado dedicado a las regresiones lineales univariantes y múltiples. En primer lugar se han realizado regresiones univariantes, de los cuales se ha conoce el valor de R2. Por otro lado, para conseguir unos modelos que ese asemejen más a la realidad se han creado modelos múltiples combinando distintas variables. En estos modelos también se conoce el valor de R cuadrado. De este modo es posible comparar la eficacia de ambos tipos de modelos donde siempre obtenemos mejores (o los mismos) resultados en el caso de los múltiples. Esta comparativa se muestra en la Tabla 9. Tanto en las regresiones univariantes como en las múltiples existen varios modelos para cada una de las variables, sin embargo en la tabla comparativa solo se muestra un valor de R2 para cada caso. En el caso de los modelos univariantes simplemente se ha elegido el modelo con un mayor valor para este parámetro, es decir, el que se considera el mejor modelo para esa variable concreta. Por ejemplo, en el caso del tráfico de contenedores total del puerto de Barcelona la correlación con mayor valor de R cuadrado (R2=0,890) ocurre en el modelo creado con el PIB de España. Por otra parte, en cuanto a las regresiones múltiples los modelos seleccionados para hacer la comparativa son los modelos simplificados, es decir, los que se han obtenido tras haber eliminado las variables con un bajo p-valor. Esto es debido a que, de la manera que se ha podido comprobar en la Tabla 8, los resultados obtenidos son muy similares y sin embargo son más sencillos de calcular.
35 Univariantes - máx. R2 Múltiples simplificados - R2 Tráfico Algeciras 0,986* 0,949 Trafico Barcelona 0,890 0,913 Tráfico Valencia 0,986 0,986 Tránsito Algeciras 0,986 0,946 Tránsito Barcelona 0,785 0,785 Tránsito Valencia 0,986 0,986 Import-Export Algeciras 0,705 0,705 Import-Export Barcelona 0,769 0,851 Import-Export Valencia 0,753 0,753 * Es mayor porque es una relación que no interesa entre el tráfico y el tránsito, que no se ha utilizado en el múltiple Tabla 9. Comparación de los valore de R2 entre los modelos univariantes y múltiples Fuente: Elaboración propia Visto que los modelos múltiples ofrecen mejores resultados, es más adecuado trabajar con ellos. Por este motivo, se ha profundizado más el estudio de estos modelos. Los modelos para la predicción del tráfico de mercancías de los tres puertos españoles se ajustan mediante el uso exclusivo de los datos del producto interior bruto (PIB). En el caso del tráfico de Algeciras solo es necesario el uso del PIB mundial; mientras que en el caso del puerto barcelonés y valenciano se han utilizado el PIB español, mundial y de sus respectivas comunidades. Al realizar las verificaciones de los modelos múltiples se obtienen errores muy diferentes entre unos y otros, y a pesar de que muchos de ellos entran dentro de un rango de error porcentual aceptable (inferiores al 5%), hay algunos otros valores bastante elevados. Esto es debido a que en todos los modelos se han utilizado regresiones lineales y es probable que en alguno de ellos sería más adecuado utilizar alguno de orden mayor. Concretamente para tres de las variables la regresión lineal no ajusta bien: Tráfico de Algeciras, volumen de contenedores en tránsito de Barcelona y volumen de contenedores en import-export de Algeciras. Por ejemplo, en el gráfico del Modelo 6 se puede ver que el tráfico de Valencia ajusta muy bien con una regresión lineal, puesto que sus puntos siguen una línea casi perfecta. Esto provoca que su error absoluto porcentual medio sea inferior al 5%.
36 6. Conclusiones Una de las primeras conclusiones y más triviales que se saca de este estudio, es que cada puerto tiene una manera de funcionar totalmente distinta, empezando por el funcionamiento que tienen. Mientras que el puerto de Bahía de Algeciras, posiblemente por su situación estratégica, se dedica casi de manera exclusiva al tránsito, el puerto de Barcelona se dedica en gran parte al import-export. Esto ha tenido consecuencias durante el estudio, debido principalmente a que cada uno de ellos está correlacionado con variables distintas. El puerto de andaluz tiene mayores coeficientes de correlación con variables de ámbito mundial, mientras que el puerto catalán con variables de ámbito estatal o regional. Exceptuando el puerto de Algeciras, en todos los casos el coeficiente de correlación supera el 0,8 tanto en relación con el PIB de la comunidad a la que pertenecen como con el PIB español y mundial. Tanto en el caso del puerto andaluz como el valenciano, el coeficiente de correlación entre el número de contenedores y el PIB mundial es cercano al 0,95. Por otro lado, se ha visto que el volumen de contenedores no está prácticamente relacionado con la tasa de desempleo. Debido a que solo el tráfico de import-export de Barcelona tenía una alta correlación con esta variable y puesto que se considera un factor econométrico interesante, se ha trabajado finalmente con coeficientes superiores a 0,7 (en vez de 0,75) Al comenzar con este estudio, consideré como primera opción hacer regresiones univariantes y por tanto obtendría muchos modelos para cada una de las variables. Después, mediante los distintos métodos de validación, podría elegir el modelo más adecuado para cada caso. Sin embargo, cuando se decidió utilizar modelos múltiples que ofrecen mejores resultados, me encontré con que solo tenía uno o dos modelos para cada variable y por tanto la toma de decisión se simplificó mucho. Como normal general se ha decidido tomar como bueno el modelo simplificado ya que los errores entre este y el modelo inicial son muy similares y tal y como se muestra en la Tabla 10 estos errores son bajos. En esta tabla se han mostrado únicamente los modelos definitivos, es decir, los simplificados, excepto en el caso del tráfico de Algeciras. Las dos regresiones que modelan el tráfico total en el puerto de Bahía de Algeciras (Modelo 1 y Modelo 2) ofrecen resultados muy distintos y provocan que en este caso el modelo que se acepte para futuras predicciones sea el modelo inicial. Tal y como muestra la Tabla resumen de los resultados de los test de verificación Fuente: Elaboración propiaexisten diferencias de fiabilidad entre los distintos modelos, por
43 Apéndice B - Relación entre volumen de contenedores y variables econométricas A continuación se muestra la relación entre muchas de las variables utilizadas a lo largo del estudio. Estas relacionan el volumen de contenedores de distintos puertos y las variables econométricas. Debido a la cantidad de factores con los que se ha trabajado en este estudio se podrían haber mostrado infinidad de relaciones, pero se ha decidido mostrar solo las que más importancia han tenido a lo largo del trabajo, es decir, las variables que están altamente correlacionadas entre ellas.
44
45
46 Apéndice C - Autocorrelación de las series temporales La autocorrelación es un método para comprobar si las series son o no estacionarias. Para ello es necesario analizar la función de autocorrelación (FAS) y con ese fin se muestran a continuación todas ellas. En el texto se han analizado más exhaustivamente, pero a primera vista se ve que siguen una forma similar a la que seguiría cualquier serie no estacionaria.
47
48
49 Apéndice D - Series temporales tras la primera y segunda diferenciación Anteriormente se han mostrado las series temporales iniciales donde se veía que la mayoría de ellas sufrían una tendencia generalmente positiva. Esto ha creado la necesidad de diferenciar todas ellas, en muchos casos siendo necesaria la segunda diferenciación. A continuación se muestra el resultado de haber pasado todas las series por dos pases de diferenciación y se observa que estas han perdido la tendencia que anteriormente sufrían.
50
51
52
59
60
61 Apéndice G - Modelos de regresión lineal múltiple En esta sección se muestran todos los distintos modelos realizados con la ayuda de MatLab. Se incluye tanto el gráfico que representa la regresión como la función del modelo y algunos factores del mismo. Los valores más significativos son aquellos datos que aparecen sombreados: R2, RMSE y el p-valor. Para cada una de las variables relacionadas con el volumen de contenedores, hay dos modelos creados. En primer lugar una hipótesis con todas las variables posibles y en segundo lugar una simplificación del modelo donde intervienen menos variables. Linear regression model: Trafico_Algeciras ~ 1 + PIB_Andalucia + PIB_Espana + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -1.0275e+05 3.3834e+05 -0.30369 0.76485 PIB_Andalucia 18.214 11.351 1.6047 0.12597 PIB_Espana -933.17 787.58 -1.1849 0.25148 PIB_Mundial 39893 9891.1 4.0333 0.00077989 Root Mean Squared Error: 3.77e+05 R-squared: 0.892 p-value = 6.48e-09 Modelo 1. Primera hipótesis de modelo para el Tráfico de Algeciras Fuente: Elaboración propia
62 Linear regression model: Trafico_Algeciras ~ 1 + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -3.9172e+05 95399 -4.1061 0.00018711 PIB_Mundial 64392 2328.3 27.656 3.8688e-28 Root Mean Squared Error: 3.53e+05 R-squared: 0.949 p-value = 3.87e-28 Modelo 2. Modelo ajustado para el Tráfico de Algeciras Fuente: Elaboración propia
63 Linear regression model: Trafico_Barcelona ~ 1 + PIB_Cataluna + PIB_Espana + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -3.7309e+05 1.4528e+05 -2.5681 0.018822 PIB_Cataluna 21.085 2.3935 8.8095 3.8906e-08 PIB_Espana -406.12 241.33 -1.6829 0.10876 PIB_Mundial -18277 4049.6 -4.5133 0.0002379 Root Mean Squared Error: 1.73e+05 R-squared: 0.925 p-value = 7.56e-11 Modelo 3. Primera hipótesis de modelo para el Tráfico de Barcelona Fuente: Elaboración propia Linear regression model: Trafico_Barcelona ~ 1 + PIB_Cataluna + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -3.2182e+05 1.4841e+05 -2.1684 0.042361 PIB_Cataluna 18.178 1.7307 10.503 1.3766e-09 PIB_Mundial -18350 4230.8 -4.3373 0.00031978 Root Mean Squared Error: 1.8e+05 R-squared: 0.913 p-value = 2.39e-11 Modelo 4. Modelo ajustado para el Tráfico de Barcelona Fuente: Elaboración propia
64 Linear regression model: Trafico_Valencia ~ 1 + PIB_Valencia + PIB_Espana + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -1.8867e+06 1.7173e+05 -10.986 2.0614e-09 PIB_Valencia 35.626 7.0557 5.0493 8.346e-05 PIB_Espana -739.8 355.27 -2.0824 0.051846 PIB_Mundial 51045 445 9 11.448 1.0736e-09 Root Mean Squared Error: 1.87e+05 R-squared: 0.986 419, p-value = 7.73e-17 Modelo 5. Primera hipótesis de modeloa para el Tráfico de Valencia Fuente: Elaboración propia
65 Linear regression model: Trafico_Valencia ~ 1 + PIB_Valencia + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) -1.7525e+06 1.7259e+05 -10.154 4.1138e-09 PIB_Valencia 23.01 3.9212 5.8682 1.1892e-05 PIB_Mundial 52959 4730.8 11.194 8.3009e-10 Root Mean Squared Error: 2.03e+05 R-squared: 0.982 p-value = 2.04e-17 Modelo 6. Modelo ajustado para el Tráfico de Valencia Fuente: Elaboración propia Linear regression model: Transito_Algeciras ~ 1 + Trafico_Algeciras + PIB_Mundial Estimated Coefficients: Estimate SE tStat pValue (Intercept) 38101 1.1776e+05 0.32354 0.75295 Trafico_Algeciras 0.82284 0.052896 15.556 2.4634e-08 PIB_Mundial 5082.6 2937.9 1.73 0.11431 Root Mean Squared Error: 6.93e+04 R-squared: 0.989 p-value = 1.55e-10 Modelo 7. Primera hipótesis de modelo para el Tránsito de Algeciras Fuente: Elaboración propia
66 Linear regression model: Transito_Algeciras ~ 1 + Trafico_Algeciras Estimated Coefficients: Estimate SE tStat pValue (Intercept) 81922 1.2499e+05 0.65541 0.52567 Trafico_Algeciras 0.89835 0.03248 27.659 1.612e-11 Root Mean Squared Error: 7.53e+04 R-squared: 0.986 p-value = 1.61e-11 Modelo 8. Modelo ajustado para el Tránsito de Algeciras Fuente: Elaboración propia
67 Linear regression model: Transito_Barcelona ~ 1 + Trafico_Barcelona Estimated Coefficients: Estimate SE tStat pValue (Intercept) -4.4071e+05 1.2353e+05 -3.5677 0.0021998 Trafico_Barcelona 0.51107 0.063067 8.1036 2.0394e-07 Root Mean Squared Error: 1.31e+05 R-squared: 0.785 p-value = 2.04e-07 Modelo 9. Hipótesis inicial y modelo ajustado definitivo para el Tránsito de Barcelona Fuente: Elaboración propia Linear regression model: Transito_Valencia ~ 1 + Trafico_Valencia + PIB_Mundial + Desempleo_Valencia + Desempleo_Espana Estimated Coefficients: Estimate SE tStat pValue (Intercept) -1.3831e+06 1.9054e+05 -7.2589 8.7293e-05 Trafico_Valencia 0.69366 0.11828 5.8648 0.00037642 PIB_Mundial 8186.5 9924.7 0.82486 0.43336 Desempleo_Valencia 33203 43858 0.75707 0.47072 Desempleo_Espana -34050 53489 -0.63659 0.54218 Root Mean Squared Error: 8.92e+04 R-squared: 0.988 p-value = 9.18e-08 Modelo 10. Primera hipótesis de modelo para el Tránsito de Valencia Fuente: Elaboración propia
68 Linear regression model: Transito_Valencia ~ 1 + Trafico_Valencia Estimated Coefficients: Estimate SE tStat pValue (Intercept) -1.3445e+06 1.2061e+05 -11.148 2.4713e-07 Trafico_Valencia 0.82639 0.030007 27.54 1.6894e-11 Root Mean Squared Error: 8.42e+04 R-squared: 0.986 p-value = 1.69e-11 Modelo 11. Modelo ajustado para el Tránsito de Valencia Fuente: Elaboración propia