Modelação de Quotas de Mercado
Full text
Modelação de Quotas de Mercado Carla Sofia da Silva Gonçalves Mestrado em Engenharia Matemática Departamento de Matemática 2015 Orientador Prof. Doutor Joaquim Pinto da Costa, FCUP Co-orientadora Profª Doutora Margarida Brito, FCUP
Todas as correções determinadas pelo júri, e só essas, foram efetuadas. O Presidente do Júri, Porto, ______/______/_________
Agradecimentos Gostaria de agradecer ao Professor Joaquim Costa e à Professora Margarida Brito por terem aceite orientar o meu trabalho e pela disponibilidade e apoio prestados quer durante o decorrer do estágio quer durante a escrita da dissertação. Aos meus pais um agradecimento especial por terem permitido que chegasse até aqui, apoiando sempre as minhas decisões, e à minha irmã, a Francisca, um obrigado por toda a sua energia contagiante. A toda a equipa da SONAE SR que me acompanhou durante o estágio, em especial ao Rui Santos, Carla Araújo, Sandra Cardoso, Hugo Neves e Mafalda Pinto. Deixo ainda um grande obrigada ao Ricardo, por todas as sugestões, paciência, apoio e carinho. Por último, mas não menos importante, agradeço a todos os amigos e colegas que me acompanharam durante este percurso pela Faculdade de Ciências.
Resumo Uma vez que as quotas de mercado são por vezes integradas em índices de desempenho duma empresa, a quota de mercado é frequentemente uma variável tão ou mais importante que as receitas e lucros. A análise de quotas de mercado é mais complexa que a análise de vendas, uma vez que estas não são o resultado do desempenho de apenas um produto, nem mesmo apenas da empresa em causa. Além disso, as ferramentas não estão tão desenvolvidas quanto à análise de vendas, nem os dados são tão compreensivos ou precisos, uma vez que englobam o comportamento das várias empresas que constituem o mercado. Esta dissertação é o resultado da colaboração com uma empresa líder mercado, inserida no contexto dum estágio curricular. Vários métodos tradicionais foram explorados, nomeadamente de forma a modelar a resposta da quota a campanhas promocionais: regressões lineares, logísticas, redes neuronais e máquinas de suporte vetorial, assim como explorados modelos de atração, modelos não-lineares específicos para a modelação de quotas de mercado. Foram também aplicados métodos menos ortodoxos Os modelos hierárquicos, normalmente aplicados a vendas, no geral melhoram a qualidade dum modelo quando se tem informação da série a vários níveis de agregação. A sua aplicação é menos imediata na aplicação a quotas de mercado e uma solução original é sugerida. Por último, foi implementado um modelo de escolha, uma metodologia premiada pelo Nobel de 2000, a qual tenta inferir parâmetros de escolha dos consumidores. Durante o trabalho é feita uma digressão formal pelos vários modelos, juntamente com as respetivas aplicações em R. Espera-se desta forma que a dissertação tenha uma utilidade mais ampla que o caso em estudo. Palavras-chave: quota de mercado; séries temporais; data mining; econometria; modelos hiérarquicos; modelos de atração; modelos de escolha.
Abstract Since market shares are sometimes integrated into market performance indices of firms, the market share is often a variable as, if not more, importante than revenue and profits. Analyzing market shares is more complex than analyzing sales, since they are not the result of the performance of a single product, nor solely of the firm being studied. Besides, tools are not as developed as those to study sales, neither is data as comprehensive or accurate, since it encompasses the behavior of the several firms which make the market. This thesis is the result of a collaboration with a firm that is the market leader, within the scope of a curricular internship. Several traditional methods were explored, namely as a way to model the market share response to promotional campaigns: linear regressions, logistic regressions, neural networks and vectorial support machines, and we explore attraction models, non-linear models specific for the modelling of market shares. Other less orthodox methods are applied as well. Hierarchical models, usually applied to sales, in general improve the quality of the model when there are time series data at several levels of aggregation. Its application is less linear when applied to market shares and an original solution is proposed. Lastly, a choice model was implemented, a methodology awarded with the Nobel of 2000, which tries to infer choice parameters from consumers. During this work, a formal digression is perfomed through the several models, together with their respective application in R. This thesis is therefore expected to have an wider application than the case study at hand. Keywords: market share; time series; data mining; econometrics; hierarchical models; attraction models; choice models.
FCUP i Modelação de Quotas de Mercado Índice Lista de Figuras iii Lista de Tabelas v 1 Introdução 1 1.1 Problema ........................................... 1 1.2 EstruturadaDissertação .................................. 2 2 Descrição dos Dados 3 2.1 Estrutura do Negócio e Divisão Geográfica . . . . . . . . . . . . . . . . . . . . . . . . 3 2.2 RecolhadosDados ..................................... 4 2.3 NormalizaçãodasVariáveis................................. 6 2.4 DescriçãodasVariáveis................................... 7 2.5 PrimeiraAnálisedosDados................................. 8 2.6 Análise da Correlação entre Variáveis . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 2.7 Validação ........................................... 14 3 Estado da Arte 17 3.1 ModelosEspaciais...................................... 17 3.2 ModelosdeAtração ..................................... 18 3.3 ModelosemDataMining .................................. 19 3.4 ModelosdeEscolha ..................................... 20 4 Análise de Séries Temporais 21 4.1 ProcessosEstocásticos ................................... 21 4.1.1 Média, Função Autocovariância, Função Autocorrelação e Variância . . . . . . 22 4.2 Modelo Clássico de Séries Temporais . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 4.2.1 Decomposição em Componentes Básicas . . . . . . . . . . . . . . . . . . . . . 23
2 FCUP Modelação de Quotas de Mercado como de outros dois concorrentes. Também conseguimos informação sobre a área e localização das várias lojas, que dividimos em regiões. Estes dados serão explorados em detalhe no Capítulo 2. No Capítulo 3 é feito um resumo do estado da arte, e a sua aplicação é realizada nos capítulos posteriores. 1.2 Estrutura da Dissertação No Capítulo 2, é feita uma apresentação dos dados disponíveis para este trabalho. No Capítulo 3 apresenta-se um resumo da literatura consultada, referente a problemas que envolvem o estudo de quotas de mercado. Os dados disponíveis não permitiram a aplicação de todos os modelos consultados. Os capítulos 4, 5 e 6 consistem numa revisão teórica aprofundada dos modelos apresentados no estado da arte, e a sua aplicação. No Capítulo 4 é tratada a análise de séries temporais, nomeadamente através do cálculo das autocorrelações e estimação das componentes tendência, sazonalidade e resíduo. É ainda considerada a modelação de séries utilizando modelos autoregressivos integrados de médias móveis (ARIMA). No Capítulo 5, abordam-se modelos em data mining, nomeadamente regressão linear e logística, árvores de regressão, máquinas de suporte vetorial e redes neuronais. Estes modelos explicam a trajectória da quota como resposta de esforços promocionais. OCapítulo 6 trata um modelo Bayesiano, proposto por Chen e Yang (2007), cujo objetivo é simular o comportamento dos clientes utilizando dados agregados. Numa perspetiva um pouco diferente são apresentados também modelos de atração que vêm a quota como resultado do quociente entre a atração que uma empresa suscita nos consumidores e a soma da atração de todas as empresas que constituem o mercado (Cooper e Nakanishi, 1988). Nos capítulos 7 e 8 é feita, respetivamente, a apresentação e análise dos erros cometidos em cada método e conclusão do trabalho. No Capítulo 7 são apresentados também modelos hierárquicos cujo objetivo é usar a hierarquia das séries temporais (uma vez que são consideradas 5 regiões que no seu conjunto formam Portugal Continental) para tentar obter resultados mais robustos combinando as previsões independentes de cada região. Uma vez que a elaboração da tese foi uma oportunidade para aprender novos modelos e explorar conceitos do curso foi feita uma digressão formal pelos vários modelos, juntamente com as respetivas aplicações em R. Espera-se desta forma que a tese tenha uma utilidade mais ampla que o caso em estudo.
FCUP 3 Modelação de Quotas de Mercado Capítulo 2 Descrição dos Dados Neste capítulo é feita uma apresentação e primeira análise dos dados disponíveis: 2.1 Estrutura do Negócio e Divisão Geográfica . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 2.2 RecolhadosDados ............................................. 4 2.3 NormalizaçãodasVariáveis......................................... 6 2.4 DescriçãodasVariáveis........................................... 7 2.5 PrimeiraAnálisedosDados......................................... 8 2.6 Análise da Correlação entre Variáveis . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 2.7 Validação ................................................... 14 2.1 Estrutura do Negócio e Divisão Geográfica De forma a perceber como abordar o problema de previsão das quotas foi necessário entender de que forma a empresa é gerida e, por sua vez, a sua informação estruturada. A empresa é dividida em regiões, cada uma das quais é responsável pelas suas lojas, as quais estão, por sua vez, sub-divididas por unidade de negócio. Esta estruturação é ilustrada na Figura 2.1. Os produtos comercializados na empresa estão divididos em 5 grupos designados por unidade de negócio. As regiões, para Portugal Continental, estão igualmente dividas em 5 grupos, detalhadas Regiões Sul Interior Litoral Grande Porto Grande Lisboa Unidades Unidade 55 Unidade 54 Unidade 53 Unidade 52 Unidade 51 Eletrodomésticos Entretenimento Som e Imagem Informática Telecomunicações Portugal Continental =Regiões =Lojas =Unidades Figura 2.1: Visão geral da estrutura da empresa.
4 FCUP Modelação de Quotas de Mercado no mapa das lojas apresentado na Figura 2.2. O estudo da quota de mercado é feito por uma segunda empresa de consultoria, especializada em estudos de mercado. Estes relatórios foram sendo fornecidos ao longo do estágio e compreendem as datas entre janeiro de 2011 e novembro de 2014 (47 meses). Para além disso, informação de outras variáveis foi fornecida por colegas, nomeadamente das campanhas publicitárias e áreas das várias lojas. Worten Concorrência Região Grande Lisboa Grande Porto Litoral Interior Sul Figura 2.2: Divisão geográfica de Portugal Continental com representação de lojas. 2.2 Recolha dos Dados Numa fase inicial do estágio foram reunidos todos os relatórios referentes ao período dos 47 meses. Os dados a que tivemos acesso combinavam as unidade 54 e 55, não tendo havido acesso a informações referentes à unidade 52. Isto deve-se ao facto da empresa e da consultora estruturarem o negócio de formas diferentes. Dos referidos relatórios foi possível extrair a seguinte informação: • Quota total da empresa a nível de Portugal Continental; • Quota disponível por região e a nível de Portugal Continental: ◦Total da região (excepto para a unidade 52), assim como para cada uma das suas unidades: *Unidade 51; *Unidade 53; *Unidade 54 e 55 (em conjunto). Estas serão as variáveis independentes que tentaremos explicar e prever. Durante a recolha de informação dos relatórios escritos foi colocada a questão de como complementar e explicar esta série temporal com dados da empresa, nomeadamente das várias lojas. Uma
FCUP 5 Modelação de Quotas de Mercado vez que a informação sobre a quota está disponível ao nível das regiões, enquanto para as lojas ao nível da sua localização apenas se dispõe do código postal, a solução passou por associar a cada código postal o concelho, distrito e, a cada distrito, a região, dentro das 5 referidas. Isto foi possível com a utilização da ferramenta de gestão de bases de dados, Access do Microsoft Office. Com base em informação que nos foi disponibilizada foi construído um modelo entidade-relação no Microsoft Access, conforme o diagrama da Figura 2.3. Além disso, a base de dados foi complementada com informação demográfica do INE (INE, 2011, 2013). Figura 2.3: Diagrama Entidade-Relação do Microsoft Access. Resumidamente, as tabelas inseridas foram: •tabela com distritos: cada distrito tem um identificador (ID_distrito) que o distingue dos restantes; •tabela com a população anual por concelho; •tabela com concelhos: à semelhança dos distritos, cada concelho tem um identificador (ID_concelho) único; Além disso, por cada concelho é registada a região a que pertence (Grande Lisboa, Grande Porto, ...) e ainda a proporção de poder de compra; •tabela com códigos postais: são registados todos os códigos postais; por cada código postal é registado o concelho a que este pertence. Com estas tabelas foi possível aceder aos códigos postais de cada uma das regiões bem como a outras informações tais como a população no ano 2011 na Grande Lisboa, por exemplo. As tabelas restantes referem-se às lojas da empresa e dos concorrentes: •tabela com informação geral das lojas da empresa: registo do código postal da loja, data de abertura e fecho;
6 FCUP Modelação de Quotas de Mercado •tabela com informação mais especifica ao nível de cada loja: registo mensal de vendas brutas e áreas de venda por unidade de negócio; •tabela com informação das lojas da concorrência: registo do concorrente e código postal das lojas bem como datas de abertura/fecho das mesmas. Uma vez trabalhada a informação num formato útil foi decidido combinar os dois meios de informação numa folha de cálculo única, uma estrutura também conhecida em estatística por data frame. Teve que ser adotado o denominador para o qual havia informação: sendo que a unidade da série temporal escolhida foi o mês, a unidade da série geográfica foi a região, e as unidade de negócio foram agrupadas dentro das três consideradas pela consultora. Uma vez que a quota é um “jogo” entre empresas, tentamos obter mais variáveis exógenas referentes à competição para modelar a quota da empresa. Foram, por isso, recolhidos dados respeitantes ao histórico das campanhas promocionais no mesmo período, de janeiro de 2011 a novembro de 2014, tanto da própria empresa como das empresas concorrentes. Esta informação não proveio dos relatórios, mas de estimativas internas. Visto esta informação ser suscetível a erros foi feita uma tentativa de verificação da veracidade desta recolha. Os dados respeitantes à própria empresa, presumiu-se serem mais fiáveis, tendo sido apenas validadas as datas das campanhas. Apenas as principais campanhas promocionais foram consideradas; por principais entenda-se campanhas abrangentes que tenham sido transversais entre todos os produtos e regiões. Estas campanhas têm durações de apenas alguns dias, no máximo uma semana; no entanto, registou-se apenas os meses nas quais estas foram observadas. Resumidamente, os dados disponíveis para este projeto são: • os valores de quota referidos anteriomente; • número de lojas da empresa e dos seus concorrentes, por região; • histórico de principais campanhas promocionais da empresa e dos concorrentes; • área de venda por unidade de negócio e por região (apenas as da empresa); • vendas brutas por unidade de negócio e por região (apenas as da empresa); • dados demográficos das várias regiões: proporção do poder de compra e número de habitantes. 2.3 Normalização das Variáveis Ao longo da tese, por razões de confidencialidade, algumas estimações serão omitidas, algumas escalas nos gráficos não serão representadas, e promoções e concorrentes serão identificados e codificados por números. Valores como vendas e quotas serão representados mas além de sofrerem uma transformação são ainda normalizados. Esta normalização será feita apenas durante a representação gráfica e não foi feita como pré-processamento. Dentro de várias funções de normalização de dados consideradas, optamos por escalar os valores das variáveis para o intervalo unitário usando a seguinte função: f(x) = x−xmin xmax −xmin .
FCUP 7 Modelação de Quotas de Mercado Esta função conhecida por “featuring scale” é muito utilizada em data mining, habitualmente de forma a evitar trabalhar com variáveis de magnitudes muito diferentes (Aksoy e Haralick, 2001). 2.4 Descrição das Variáveis Faz-se uma enumeração das variáveis longitudinais recolhidas para os 47 meses, janeiro de 2011 a novembro de 2014, bem como a sua designação no estudo. Além de variar ao longo do tempo, algumas variáveis variam também por região, r∈ {PC, GL,GP,L,I, S}, e unidades de negócio, u∈ {UN51,UN53,UN54/55, total}. A granularidade das variáveis é resumida no diagrama da Figura 2.4. •QUOTA(t,r,u): quota nacional e das várias regiões para as várias unidades, excepto a unidade 52; •PROMOk(t): dentro da própria empresa são considerados 4 tipos distintos de campanhas promocionais k, de forma a melhor discernir a influência de cada tipo de campanha na quota. Trata-se de uma variável binária que toma valor 1 se há a campanha nesse mês e 0 caso contrário. Apenas as campanhas promocionais abrangentes são consideradas. De notar que as campanhas são iguais em todas as regiões consideradas e, excetuando a PROMO4, são comuns às três unidades de negócio consideradas. •CONCOj(t): campanha promocional da empresa concorrente j, com j={1, 2}para a unidade 51, j={1,2,4}para a unidade 53 e j={1,2,4, 5}para as unidades 54 e 55. Para cada unidade de negócio, a variável é igual em todas as regiões. Diferentes unidades de negócio apresentam diferente número de concorrentes e, portanto, há unidades de negócio com mais variáveis, relativas às campanhas da concorrência, que outras. Trata-se de uma variável binária. Não é considerada qualquer campanha do concorrente “3” uma vez que este não realizou nenhuma campanha abrangente nos últimos quatro anos. •AREA(t,r,u): área total nas lojas da própria empresa para cada uma das unidades, em m2. •VENDAS(t,r,u): total de vendas brutas nas várias unidades das lojas da própria empresa, em euros. •NRLOJAS0(t,r): número de lojas da própria empresa. •NRLOJASj(t,r): número de lojas do concorrente jque contém as várias unidades de negócio. Tal como CONCOj,jvaria com o número de concorrentes. •POP(t,r): variável demográfica representativa da população na região, recolhida do INE (INE, 2013). •PPC(t,r): variável demográfica representativa do poder de compra na região per capita em milhares de euros, recolhida do INE (INE, 2011). Por região e unidade: •QUOTA •AREA •VENDAS •NRLOJASj Por região: •POP •PPC Por unidade de negócio: •PROMOk •CONCOj Figura 2.4: Esquema geral da granularidade das variáveis.
8 FCUP Modelação de Quotas de Mercado 2.5 Primeira Análise dos Dados Construída a base de dados, procedemos à análise dos mesmos. Como referido, por questões de confidencialidade, algumas variáveis foram transformadas. Apesar de transformados, vamos supor que os dados continuam a refletir o comportamento dos valores reais. Quota de Mercado. Esta variável foi recolhida, como referido anteriormente, para diferentes categorias de produtos e diferentes regiões. É apresentada a série temporal para as três unidades disponíveis na Figura 2.5, assim como o ciclo mensal que não demonstra qualquer efeito de sazonalidade. No capítulo 4 estas séries temporais serão estudadas com mais detalhe Na figura é ilustrada a série temporal apenas para Portugal Continental; no entanto, é de notar que cada uma das regiões tem um comportamento concordante com a sua unidade. A diferença entre as séries é sobretudo entre unidades de negócio. A Figura 2.5b, conhecida como gráfico por ciclo mensal, representa a quota com as observações em cada mês com a respetiva média. Não são evidentes efeitos de sazonalidade dentro de cada mês, sendo a média muito semelhante. 0.25 0.50 0.75 0.25 0.50 0.75 0.25 0.50 0.75 51 53 54/55 Jan−11 Mai−11 Set−11 Jan−12 Mai−12 Set−12 Jan−13 Mai−13 Set−13 Jan−14 Mai−14 Set−14 QUOTA normalizada (a) Série temporal Jan Fev Mar Abr Mai Jun Jul Ago Set Out Nov Dez 0.25 0.50 0.75 0.25 0.50 0.75 0.25 0.50 0.75 51 53 54/55 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 QUOTA normalizada (b) Ciclo mensal Figura 2.5: Representação da quota em série temporal e ciclo mensal para as três unidades de negócio para Portugal Continental. Vendas Brutas. Tal como as áreas, esta variável é recolhida para cada uma das lojas sendo depois selecionadas as lojas por região e procedendo-se à soma de vendas por mês e categoria de produtos. A análise da Figura 2.6 na página ao lado permite observar que as vendas brutas nas diferentes regiões têm um comportamento semelhante. De observar ainda que o comportamento da
FCUP 9 Modelação de Quotas de Mercado variável de ano para ano é bastante semelhante. É de notar que, ao contrário das quotas, nas vendas existe um efeito sazonal, com a média das vendas muito mais pronunciada em dezembro. Este efeito sazonal não se reproduz nas quotas de mercado. Jan Fev Mar Abr Mai Jun Jul Ago Set Out Nov Dez 0.25 0.50 0.75 0.25 0.50 0.75 0.25 0.50 0.75 51 53 54/55 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 2011 2012 2013 2014 VENDAS normalizada Figura 2.6: Vendas brutas normalizadas. Área. Esta variável é medida ao nível de cada loja, sendo que a base de dados construída permite aceder às lojas por região; assim sendo, foram somadas as áreas para cada unidade de negócio ao longo dos meses. A análise da Figura 2.7 permite observar que em alguns períodos não houve alteração significativa nas áreas das lojas. 0.25 0.50 0.75 0.25 0.50 0.75 0.25 0.50 0.75 51 53 54/55 Jan−11 Mai−11 Set−11 Jan−12 Mai−12 Set−12 Jan−13 Mai−13 Set−13 Jan−14 Mai−14 Set−14 AREA normalizada Figura 2.7: Áreas normalizadas para as várias unidades de Portugal Continental. Número de Lojas. O número de lojas da empresa era conhecido com precisão. No que respeita aos concorrentes, a recolha teve de ser mais cuidada. Como visto na listagem de variáveis na secção anterior, para a unidade 51 apenas foram considerados três concorrentes. Para a unidade 53, foi considerada um quarto concorrente e para as unidades 54 e 55 um quinto. As lojas encontram-se representadas geograficamente na Figura 2.2. De notar que, em algumas regiões o número de lojas de algumas empresas se manteve inalterado no período em estudo. Infelizmente esta pequena variação nas áreas e no número de lojas durante os quatro anos em consideração significa que estas variáveis serão de fraco poder preditivo. Campanhas Promocionais. As campanhas promocionais consideradas são iguais em todas as regiões. Esta variável é uma variável binária, tomando valor 0 quando não há campanha e valor 1 caso contrário. Por mês, cada promoção considerada não ocorreu mais do que uma vez. Para representar esta variável é feito um gráfico de barras com as frequências relativas de registos com
10 FCUP Modelação de Quotas de Mercado ou sem promoção, o que corresponde a analisar a proporção de meses em que houve ou não a campanha, ver a Figura 2.8: CONCO2 CONCO1 PROMO4 PROMO3 PROMO2 PROMO1 Fev−11 Jun−11 Out−11 Fev−12 Jun−12 Out−12 Fev−13 Jun−13 Out−13 Fev−14 Jun−14 Out−14 Variável (a) Registo de ocorrência de campanha da unidade 51. CONCO2 CONCO1 PROMO4 PROMO3 PROMO2 PROMO1 0.0 0.1 0.2 0.3 0.4 0.5 (b) Frequências relativas (47 meses). CONCO4 CONCO2 CONCO1 PROMO4 PROMO3 PROMO2 PROMO1 Fev−11 Jun−11 Out−11 Fev−12 Jun−12 Out−12 Fev−13 Jun−13 Out−13 Fev−14 Jun−14 Out−14 Variável (c) Registo de ocorrência de campanha da unidade 53. CONCO4 CONCO2 CONCO1 PROMO4 PROMO3 PROMO2 PROMO1 0.0 0.1 0.2 0.3 0.4 0.5 (d) Frequências relativas (47 meses). CONCO5 CONCO4 CONCO2 CONCO1 PROMO4 PROMO3 PROMO2 PROMO1 Fev−11 Jun−11 Out−11 Fev−12 Jun−12 Out−12 Fev−13 Jun−13 Out−13 Fev−14 Jun−14 Out−14 Variável (e) Registo de ocorrência de campanha das unidades 54 e 55. CONCO5 CONCO4 CONCO2 CONCO1 PROMO4 PROMO3 PROMO2 PROMO1 0.0 0.1 0.2 0.3 0.4 0.5 (f) Frequências relativas (47 meses). Figura 2.8: Frequências absolutas da variável campanha. De notar que as campanhas PROMOk, com k∈ {1,··· ,4}, dizem respeito aos quatro tipos de campanhas promocionais da própria empresa e CONCO1 e CONCO2 às campanhas das duas empresas na competição, no âmbito da unidade de negócios 51. Como se pode ver, ocorreram, quanto muito, duas das quatro campanhas. Neste caso, num dado mês a empresa pode ter mais do que uma campanha promocional, o que de facto acontece. Observa-se que houve mais campanhas do tipo CONCO1. No entanto, no total, a empresa fez mais campanhas promocionais. Podemos ainda verificar que não há um padrão no histórico de promoções.
FCUP 11 Modelação de Quotas de Mercado 2.6 Análise da Correlação entre Variáveis É importante na análise de um conjunto de variáveis perceber de que forma estas se correlacionam. Um estimador não será estável fazendo uso de variáveis explicativas correlacionadas, além de não ser possível separar os efeitos umas das outras devido a multicolinearidade (Haitovsky, 1969). Os coeficientes de correlação medem a correlação entre duas variáveis. No entanto, diferentes coeficientes deverão ser tomados conforme o tipo das variáveis em causa. De facto, neste trabalho podem considerar-se dois tipos de variáveis: quantitativas, como é o caso das quotas, áreas, vendas brutas e número de lojas e binárias ou dicotómicas, que indicam a existência ou não de campanha promocional. Entre duas variáveis quantitativas pode usar-se o coeficiente de correlação linear de Pearson. Para as restantes combinações de variáveis as medidas consideradas correspondem a medidas de correlação derivadas deste coeficiente (Lira e Neto, 2006). Coeficiente de Correlação de Pearson. Este coeficiente de correlação mede o grau de relação linear entre duas variáveis quantitativas. Se existe uma relação linear perfeita entre os valores das variáveis, o coeficiente toma valor 1 ou -1 (o valor -1 indica uma relação linear perfeita mas inversa, isto é, quando uma das variáveis aumenta a outra diminui), quando não existe qualquer relação linear o coeficiente toma valor 0. A sua fórmula é dada por: ρX,Y=Cov(X,Y) σXσY . RA função cor{stats} permite calcular o correspondente coeficiente amostral. Coeficiente de Correlação do Ponto Bisserial. Este coeficiente é utilizado quando uma variável é quantitativa e outra é dicotómica (Lira e Neto, 2006). Tomando Xcomo a variável quantitativa e Y a variável dicotómica, o coeficiente de correlação é dado por (¯ X1−¯ X0)pπ(1 −π) Sx , onde ¯ X0e¯ X1são as médias de Xquando Y=0eY= 1, respetivamente, πé a proporção de Y= 1 eSxo desvio padrão da variável X. RUtilizando o comando biserial.cor{ltm} é possível obter o valor do coeficiente ponto bisserial (Rizopoulos, 2013). Coeficiente de Correlação Phi. Utilizado para determinar a correlação entre variáveis dicotómicas, o coeficiente Phi é determinado através da tabela de frequências (Lira e Neto, 2006). A título de exemplo, dada a seguinte tabela de contingência: Variável y Variável x 1 0 Total 1a b a +b 0c d c +d Total a+c b +d a +b+c+d
18 FCUP Modelação de Quotas de Mercado somatório (Huff, 2003). Uma vez que se considera estes modelos como sendo verdade para um indíviduo então também são inferidos para partes da população. Outros modelos, mais usados por estatísticos de geologia para séries espaciais envolvendo, por exemplo, minérios, são as séries geoespaciais. Numa analogia com as séries temporais, estes são modelos cujos dados são indexados em relação à sua geografia e desta forma são modelos que relacionam a variável dependente com a sua geoespacialidade. Em particular, as chamadas regressões de Krigagem são usadas para interpolar valores em localizações desconhecidas (Sarma, 2009). Nenhum destes modelos espaciais será considerado neste trabalho uma vez que temos valores de quota para apenas 5 grandes regiões. 3.2 Modelos de Atração Na literatura de análise da quota de mercado há vários modelos baseados no chamado “Teorema da Quota de Mercado.” Antes de proceder à explicação deste teorema vejamos em que consiste o “Teorema Fundamental de Kotler” (Kotler, 1984). Segundo Kotler, a quota de mercado é proporcional ao esforço de marketing, ou seja, si=cMi(3.1) onde cé uma constante de proporcionalidade, sié a quota do produto da marca ieMié o esforço de marketing do produto da empresa i. Uma vez que as quotas têm de somar 1, se considerarmos que o mercado é constituído por m marcas, então Pm i=1 si= 1 e, portanto, Pm i=1 cMi= 1. Trabalhando esta igualdade resulta que c=1 Pm i=1 Mi . (3.2) Juntando (3.1) e (3.2) obtém-se a fórmula que define o “Teorema Fundamental de Kotler”. Teorema 3.1 (Teorema Fundamental de Kotler). Considerando m marcas concorrentes, a quota da marca i ∈ {1, ··· ,m}, si, é dada pelo quociente entre o esforço de marketing da marca, Mi, e a soma de todos os esforços de marketing. si=Mi Pm j=1 Mj . (3.3) Dada a sua simplicidade, várias variações desta fórmula surgiram. Consideremos o caso em que duas empresas gastam a mesma quantia em marketing, a participação das duas empresas no mercado não é necessariamente a mesma. Nesta situação é mais correto usar a fórmula: si=αiMi Pm i=1 αjMi ,
FCUP 19 Modelação de Quotas de Mercado onde αirepresenta a eficácia do esforço de marketing da empresa i. Em relação ao esforço de marketing, Kotler assumiu que este é função de um conjunto de variáveis de marketing: Mi=f(Xki ), onde ké o número de variáveis consideradas. Num estudo paralelo, Bell et al. (1975) consideraram que o fator determinante para a escolha de um consumidor, quando realiza uma compra, é a atração que este sente relativamente a cada uma das marcas. Suponhamos que Aié a atração do produto da marca iesia quota correspondente. Então: 1. Ai≥0 e Pm j=1 Aj>0; 2. Se Ai= 0 então si= 0; 3. Se Ai=Ajentão si=sj; 4. Independentemente da marca ique sofra variação na atração, a quota das restantes marcas é afetada da mesma forma, qualquer que seja i. Teorema 3.2 (Teorema da Quota de Mercado). A relação entre a quota da marca i, sie a atração das m empresas que constituem o mercado é dada por: si=Ai Pm j=1 Aj . (3.4) A atração é função das variáveis de marketing e será explorada no Capítulo 6. Se olharmos para as equações (3.3) e (3.4) podemos verificar que, de facto, são muito semelhantes. No entanto, partem de ideias diferentes. Na primeira, a quota é vista em função do esforço de marketing da empresa, já na segunda é considerada a atração do consumidor pela marca (Cooper e Nakanishi, 1988, secção 2.4). Nos modelos de atração, a quota duma dada empresa varia em função explícita da quota das outras empresas. Isto será um problema para os nossos dados uma vez que os relatórios que nos foram disponibilizados apenas contém dados da quota da empresa em estudo, e apenas da empresa em estudo. No entanto o modelo será explorado no Capítulo 6. 3.3 Modelos em Data Mining Estes métodos consistem em algoritmos de otimização que estimam os parâmetros do modelo em causa de forma a melhor refletir os dados disponíveis, desta forma descobrindo padrões e tendências. Neste trabalho os métodos em data mining usados são: regressão linear,árvores de regressão,redes neuronais emáquinas de suporte vetorial. Além da regressão linear, é usada uma tranformação da variável a prever, devido às restrições no seu domínio. A função logit é muito utilizada para estimar probabilidades uma vez que transforma um domínio [0,1] em ] −∞,+∞[. Podemos então considerar um modelo linear em que o resultado
20 FCUP Modelação de Quotas de Mercado será uma transformada: logit(Y) = β0+ K X k=1 βkXk+ε. Portanto, usando a função inversa da logit, conhecida como a função logística, isto será o equivalente de usar o modelo: Y=1 1 + exp(−(β0+PK k=1 βkXk+ε)). 3.4 Modelos de Escolha Modelos de escolha, também conhecidos por modelos de desagregação, são modelos em que se supõe que existe um processo de decisão racional subjacente às escolhas dos consumidores (Ben-Akiva e Bierlaire, 1999). Racional no sentido de economia que define um agente racional como sendo um agente que consegue ordenar as suas preferências sem conflito (se prefere A a B e prefere B a C, então prefere A a C); estas preferências são modeladas por uma função de utilidade. Supondo então que o consumidor segue uma função de utilidade e que a pretende maximizar, a modelação de escolha tenta encontrar os parametros desta função. Estes modelos tentam, portanto, expor parâmetros de decisão subjacentes às decisões que vemos serem feitas como resposta a fatores exógenos ao consumidor, tais como campanhas promocionais. É sugerida e implementada uma aplicação desta metodologia para quotas na secção 6.2. Foi implementado um método de Monte Carlo usando a abordagem Bayesiana sugerida em Chen e Yang (2007). Este tipo de modelação tem-se tornado mais popular desde o Nobel em Economia de 2000. Um problema com este modelos, e vários dos anteriores, é que dispomos apenas da quota de mercado da empresa em relação aos concorrentes, mas não das séries de quota de cada uma das empresas no mercado. Isto dificulta a análise de como os consumidores estão a responder às várias campanhas. Vamos considerar, dada a falta de dados e uma vez que a empresa em causa é a líder do mercado, que as campanhas e a resposta da quota é efectivamente entre duas empresas fictícias: SONAE e não-SONAE.
FCUP 21 Modelação de Quotas de Mercado Capítulo 4 Análise de Séries Temporais Neste capítulo serão abordados os conceitos de séries temporais e sua aplicação aos dados: 4.1 ProcessosEstocásticos........................................... 21 4.2 Modelo Clássico de Séries Temporais . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 4.3 ProcessosEstacionários........................................... 28 4.4 Testes de Hipóteses para Avaliação da Estacionariedade . . . . . . . . . . . . . . . . . . . . . . . . 30 4.5 ProcessosNão-Estacionários........................................ 32 4.6 EscolhadoModelo.............................................. 33 4.1 Processos Estocásticos Uma série temporal é um conjunto de observações de uma variável dispostas sequencialmente no tempo (Brockwell e Davis, 1987), pelo que a variável em estudo é uma série temporal. Para garantir a natureza imprevisível de uma observação futura supõe-se que cada observação yté a realização de uma variável aleatória Yt. A série temporal {yt:t∈T0}é assim a realização de uma família de variáveis aleatórias {Yt:t∈T}. Posto isto, a modelação de dados temporais pode ser feita considerando os dados como a realização de um processo estocástico {Yt:t∈T}. Daqui em diante, representaremos por Ytum processo estocástico. O objectivo da análise de uma série temporal é compreender o mecanismo gerador da série, de forma a identificar padrões não aleatórios no passado, que permitam a previsão do comportamento futuro da série orientando assim a tomada de decisões. Em contraposição a séries longitudinais, as séries temporais assumem que existe um processo estocástico por detrás. Interessa-nos portanto estudar propriedades estocásticas como a estacionariedade. A nível de amostragens, considerando que os dados são constituídos por ncasos medidos em kocasiões, habitualmente tem-se que nas séries longitudinais, o né grande e o kpequeno, enquanto, nas séries temporais, o né pequeno e o ké grande.
22 FCUP Modelação de Quotas de Mercado 4.1.1 Média, Função Autocovariância, Função Autocorrelação e Variância Dado um processo estocástico, várias medidas podem ser calculadas de forma a compreender o seu comportamento. Nomeadamente: Medida Descrição Média – µYtE[Yt] Função autocorrelação – RX(s,t) E[YsYt] Função de autocovariância – KY(s,t) Cov[Ys,Yt] = E[(Ys−µYs)(Yt−µYt)] Variância – σ2 YtVar[Yt] = E[(Yt−µYt)2] = KY(t,t) Tabela 4.1: Fórmulas da média, função autocorrelação, função autocovariância e variância. Quando o processo em estudo é uma série temporal, torna-se relevante perceber de que forma a variável se relaciona com os valores que tomou no passado. Assim sendo, é comum utilizarse as seguintes medidas: a função autocovariância (ACVF) de Ytcom lag (atraso) h, dada por γX(h) = KY(t,t+h) e a função autocorrelação (ACF) de Ytcom lag h, dada por ρX(h) = γX(h) γX(0). Além destas, destaca-se a função de autocorrelação parcial (PACF) que define a correlação entre as observações YteYt−hremovendo o efeito das observações entre Yt−heYt. Esta remoção é feita determinando YteYt−hcomo combinação linear das observações Yt−1,Yt−2, ...,Yt−h+1 (Cryer e Chan, 2008, secção 6.2). RA função acf{stats} permite estimar as funções autocorrelação e autocovariância. Para determinar a função autocorrelação parcial pode usar-se pacf{stats}. Por omissão, os gráficos resultantes da aplicação das função acf epacf são correlogramas. Aplicando a função ACF às séries temporais da Figura 2.5 na página 8 obtivemos os gráficos de autocorrelação da Figura 4.1. As linhas a azul denotam os valores −1 n±2 √n(Cowpertwait e Metcalfe, 2009, secção 2.3). A análise do gráfico das autocorrelações revelou que nas séries observadas para Portugal Continental, as observações não possuem auto-correlação no geral elevada. Para a unidade 51, o maior valor registou-se no lag 12, ou seja, a quota de um mês qualquer está mais auto corelacionada com a quota registada há 12 meses do que com qualquer outro registo; existirá portanto alguma sazonalidade. No entanto, as autocorrelações são baixas. Onde se verifica maior correlação é para as 51 53 54/55 0.0 0.5 1.0 0 5 10 15 0 5 10 15 0 5 10 15 Lag ACF / PACF Função ACF PACF Figura 4.1: Correlogramas da ACF e PACF para as três unidades em Portugal Continental.
FCUP 23 Modelação de Quotas de Mercado unidades 54 e 55, nesta série temporal podemos verificar que até um lag de 7 meses a auto correlação toma valor superior a 0.4 e que o maior valor é obtido para um lag de 3 meses. Isto indica que, para um dado mês, os meses que mais influenciam o seu valor são os 7 meses anteriores. Olhando para o gráfico das autocorrelações parciais podemos verificar que para as duas primeiras unidades a remoção do efeito entre observações não levou a grandes alterações no valor da sua autocorrelação. Para as unidades 54 e 55, a alteração de valores é mais notável havendo uma redução nos valores de autocorrelação entre duas observações. No resto do capítulo, faremos uma análise do comportamento das série de forma a tentar retirar alguma informação sobre o processo gerador dos seus valores, as quotas. 4.2 Modelo Clássico de Séries Temporais Além do estudo da autocorrelação com lag ké de especial interesse perceber se o valor de uma série tende a crescer ou decrescer e se existem efeitos periódicos na série. Posto isto, de seguida é feita uma revisão do modelo clássico de decomposição de séries temporais, bem como de dois algoritmos para obtenção de cada uma das suas componentes. 4.2.1 Decomposição em Componentes Básicas Segundo o modelo clássico, uma série temporal é composta por três componentes básicas a partir das quais poderão ser feitas previsões: Componente Descrição TtTendência Comportamento crescente ou decrescente ao longo do tempo. StComponente sazonal ou Sazonalidade Flutuações cíclicas relacionadas com calendário, ocorrem em séries de dados relativas a períodos inferiores a um ano. ItComponente irregular ou erro Flutuações aleatórias. Tabela 4.2: Componentes de uma série temporal segundo o modelo clássico. O objectivo do modelo clássico é decompor uma série analisando cada uma das suas componentes separadamente. O processo de decomposição requere a remoção sistemática de cada uma das componentes. Salienta-se que, mesmo que o modelo clássico seja o mais adequado, nem todas as séries temporais terão as três componentes acima referidas. Obviamente, as flutuações aleatórias estarão sempre presentes. Esta decomposição pode ser consultada em Brockwell e Richard A. Davis (2002).
24 FCUP Modelação de Quotas de Mercado Modelo Aditivo vs Modelo Multiplicativo Dada a decomposição anterior, coloca-se a questão de como combinar as componentes. Esta combinação pode ser feita somando ou multiplicando as componentes não observáveis resultando assim num modelo aditivo ou multiplicativo, respetivamente. Modelo Aditivo Yt=Tt+St+It Modelo Multiplicativo Yt=Tt·St·It Tabela 4.3: Modelo clássico aditivo e multiplicativo. O modelo multiplicativo deverá ser usado quando a magnitude do padrão de sazonalidade nos dados depende da magnitude dos mesmos, ou seja, a magnitude da sazonalidade cresce quando os valores dos dados crescem e decresce quando estes decrescem. Por outro lado, o modelo aditivo deverá ser escolhido quando a magnitude da sazonalidade não depende do comportamento dos dados. Neste sentido, um teste simples é a construção de um gráfico da amplitude sazonal em função da tendência. O modelo multiplicativo pode ser transformado num modelo aditivo através da aplicação da função logaritmo. Para a variável em estudo, o modelo aditivo será o mais adequado. 4.2.2 Estimação da Tendência, Componente Sazonal e Aleatória A tendência descreve o movimento dos dados ao longo do tempo e, em geral, é a componente mais importante de uma série temporal. Como referido por Granger (1979), a sazonalidade é causada por movimentos oscilatórios periódicos que ocorrem em períodos inferiores a um ano, como feriados, por exemplo. Para a análise de uma série temporal, determinar a diferença entre o que ocorre normalmente e o que ocorre em períodos específicos é bastante importante. Posto isso, a remoção da tendência e da componente sazonal é necessária. À remoção da componente sazonal dá-se a designação de ajuste sazonal ou dessazonalização. Existem vários métodos para obter estas componentes. Supondo que existem nobservações {y1,..., yn}, segue-se a explicação de dois deles. Método 1 Passo 1 Estimar a tendência aplicando um filtro de média móvel especialmente escolhido para eliminar o componente sazonal e amortecer o ruído (Brockwell e Richard A. Davis, 2002, secção 1.5). Seja do período da série, usa-se: ˆ Tt=((0.5yt−q+yt−q+1 + ... + yt+q−1+ 0.5yt+q)/d, se d= 2q d−1Pq i=1 Yt−j, se d= 2q+ 1, com q+ 1 ≤t≤n−q.
FCUP 25 Modelação de Quotas de Mercado Passo 2 Estimar a sazonalidade. Para cada k= 1,...,dcalcular a média wkdos desvios {(yk+jd −ˆ Tk+jd ) : q<k+jd ≤n−q}. A sazonalidade será estimada por ˆ Sk=wk−1 d d X i=1 wi, para k>d,ˆ Sk=ˆ Sk−d. RA função decompose{stats} decompõe séries temporais usando médias móveis. Primeiro estima a tendência usando médias móveis (se o filtro é NULL, uma janela simétrica com pesos iguais é usada), e de seguida remove-a da série. Depois, a sazonalidade é calculada pela média, para cada unidade de tempo, em todos os períodos. Finalmente, a componente erro é determinada através da remoção de tendência e sazonalidade da série original. Método 2 Este algoritmo é apresentado em Cleveland et al. (1990) e consiste na decomposição de séries temporais baseada no método de regressão LOESS (Cleveland, 1979). O algoritmo conta com dois processos recursivos estando um inserido no outro. Portanto, os processos serão designados por processo interno e externo, respetivamente. Para i= 1 até n(o) Para j= 1 até n(i) Estimação da tendência e sazonalidade Fim de Para j Estimação da componente aleatória Cálculo dos pesos para estimação robusta Fim de Para i 1 2 3 4 5 6 7 Algoritmo 1: Pseudo-algoritmo STL. O processo interno conta n(i)iterações sendo feita uma atualização da tendência e sazonalidade. No processo externo cada iteração consiste numa passagem pelo processo interno seguido do cálculo robusto de pesos que serão usados na próxima execução do ciclo interno de forma a suavizar a influência de pontos com comportamento distinto. Na primeira os pesos são iguais a 1. Suponha-se que o número de observações em cada período ou ciclo da componente sazonal én(p). Para dados mensais com periodicidade anual, toma-se n(p)= 12. Serão consideradas as sub-séries constituídas pelas observações correspondentes a cada posição do ciclo sazonal. Para o exemplo anterior, existem 12 sub-séries sendo que a primeira é formada por todas as observações de janeiro, a segunda pelas observações de fevereiro e assim sucessivamente. Processo interno. Suponha-se que S(k) veT(k) v, para v= 1,...,n, são as componentes sazonal e tendência no final da k-ésima iteração. Veja-se como calcular S(k+1) veT(k+1) v: 1. Remoção da tendência. Cálculo da série Yt−T(k) v.
26 FCUP Modelação de Quotas de Mercado 2. Suavização das subséries. Todos os pontos de cada sub-série da tendência são suavizados com o método LOESS usando q=n(s)ed= 1. O conjunto dos n+ 2n(p)valores resultantes da suavização em todas as sub-séries forma a série sazonal C(k+1) vcom v=−n(p)+ 1,..., n+n(p). 3. Aplicação do filtro passa-baixo. Cálculo de L(k+1) v,v= 1,..., n, aplicando a C(k+1) vum filtro de médias móveis de tamanho n(p), seguido de outro filtro de médias móveis de tamanho n(p), um filtro de médias móveis de tamanho 3 e, finalmente, aplicando uma suavização de LOESS com d=1eq=n(l). 4. Cálculo da sazonalidade.S(k+1) v=C(k+1) v−L(k+1) v. 5. Dessazonalização. Cálculo da série Yv−S(k+1) v. 6. Suavização da tendência. A série dessazonalizada é suavizada pelo método LOESS com q=n(t)ed= 1. A tendência no (k+ 1)-ésimo passo, T(k+1) vé dada pelos valores obtidos. Processo Externo. Suponha-se que da primeira passagem pelo ciclo interno resultam estimativas da tendência e sazonalidade, TveSv. Então a componente aleatória é estimada por Rv=Yv−Tv−Sv. O próximo passo é determinar pesos para cada observação, pesos que refletem o quão elevado éRv. Valores pequenos ou até mesmo nulos serão atribuídos a outliers, que resultam em valores elevados de |Rv|. Seja h= 6mediana(|Rv|), a fórmula para o cálculo dos pesos em véρv=B(|Rv|/h) com B(u) = ((1 −u2)2, se 0 ≤u≤1 0, caso contrario. O processo interno é repetido usando na suavização das subséries e da tendência o método de LOESS com uma atualização de pesos obtida multiplicando o peso das vizinhanças de vpor ρv (Cleveland et al., 1990). Em relação à decomposição usando médias móveis, este método tem a vantagem de manter o número de observações. Estimação de Parâmetros Parâmetro Descrição Estimação n(p)Número de observações por sub ciclo sazonal. Para dados mensais com periodicidade anual n(p)= 12. n(i),n(o)Número de iterações por cada passagem no ciclo interno e externo, respectivamente. A estimação robusta é necessária quando o comportamento não Gaussiano da série lida com valores extremos (existência de outliers, por exemplo, são uma evidência). Se tal não acontecer, tomar n(o)= 0 e n(i)= 2; caso contrário, tomar n(i)=2en(o)= 5 ou n(o)= 10. O valor n(o)pode também ser determinado segundo um critério de convergência que termina quando o número de iterações satisfaz o critério.
FCUP 27 Modelação de Quotas de Mercado Parâmetro Descrição Estimação n(l)Parâmetro da suavização no filtro passa-baixo. Menor inteiro ímpar tal que n(l)≥n(p). n(t)Parâmetro da suavização da tendência. Menor inteiro ímpar tal que n(t)≥1.5n(p) 1−1.5n−1 (s) . n(s)Parâmetro da suavização da sazonalidade. Inteiro ímpar maior ou igual a 7 de forma a minimizar a distância entre a reta resultante da aplicação da suavização e os valores de sk. Tabela 4.4: Parâmetros do algoritmo STL. RA função stl{stats} decompõe séries temporais usando o método STL. Aplicando os métodos Decompose e STL à série temporal das unidades 54/55, obtêm-se as componentes da Figura 4.2: 0.00 0.25 0.50 0.75 1.00 −0.1 0.0 0.1 0.2 0.2 0.4 0.6 −0.2 −0.1 0.0 0.1 0.2 QUOTA normalizada Sazonalidade Tendência Resíduo 2011 2012 2013 2014 2015 Método STL Decompose Figura 4.2: Decomposição da série temporal usando os métodos STL e Decompose para as unidades 54 e 55. De facto, comparando os gráficos da tendência, pode verificar-se que a estimação feita usando o método de LOESS resulta numa curva mais suave do que a determinada usando o método das médias móveis. No entanto, a estimação das variáveis resulta em valores muito semelhantes.
FCUP 35 Modelação de Quotas de Mercado Capítulo 5 Modelos em Data Mining Neste capítulo serão aplicados vários modelos tradicionais de estatística e data mining: 5.1 RegressãoLinear .............................................. 35 5.2 ModeloLogístico............................................... 37 5.3 ÁrvoresdeRegressão............................................ 40 5.4 RedesNeuronais............................................... 42 5.5 MáquinasdeSuporteVectorial ....................................... 45 Estes modelos serão depois comparados entre si, assim como com o resto dos modelos da dissertação, no Capítulo 7. 5.1 Regressão Linear Os modelos de regressão linear modelam a relação entre uma variável contínua Y, designada resposta ou variável dependente, e um conjunto de variáveis X= (X1, ...,Xk) que podem ser de qualquer tipo e são designadas por variáveis independentes ou explicativas. No modelo de regressão linear clássico assume-se que a distribuição condicionada Y|X=xtem distribuição normal com média dependente de x: Y|X=x∼ N(µ(x), σ2(x)), tal que µ(x) = E[Y|X=x] = β0+ k X i=1 βixi. As constantes β0,..., βksão os parâmetros ou coeficientes de regressão. Posto isto, Y(X=x) = µ(x) + ε=β0+ k X i=1 βixi+ε=β0+β1x1+ ... + βkxk+ε, onde ε∼ N(0, σ2).
36 FCUP Modelação de Quotas de Mercado Se k= 1, trata-se de uma regressão linear simples; caso contrário, regressão linear múltipla. A regressão linear assume que dadas nobservações, {yi:xi1,..., xik }n i=1, a relação entre yie as kvariáveis correspondentes é linear. Pode representar-se de forma matricial como: y1 . . . yn = 1x11 ... x1k . . .. . ..... . . 1xn1··· xnk β0 . . . βp + ε1 . . . εn , ou de forma mais abreviada: y=Xβ+ε. Cada observação yideve ser considerada como a realização de uma variável aleatória Yi∼ N(µ(xi),σ2(xi)). Tal como nos modelos de probabilidade linear, na nossa variável de resposta, a quota, existe a restrição implícita 0≤Y≤1, embora não haja nenhuma restrição vinculativa no contradomínio do modelo. Aplicação. Tendo em conta os dados apresentados no Capítulo 2, iremos começar por considerar o seguinte modelo completo com interacções entre todas as variáveis que não são exclusivas e considerando ainda as campanhas com lag (atraso) de um mês. O modelo foi construído portanto pelas seguintes variáveis e os seus efeitos de segunda ordem: PROMOk(t), CONCOj(t), PROMOk(t- 1), CONCOj(t-1) e REGIAO, ∀j,k. Como explorado no Capítulo 2, as várias variáveis demográficas (como população e poder de compra), assim como as vendas, estão linearmente correlacionadas entre si, e com as regiões. Uma vez que um estimador não será estável ao fazer uso de variáveis explicativas correlacionadas (Gujarati, 2004, Capítulo 10), foi escolhida a variável categórica das regiões. Esta variável diz respeito à região em que a observação foi feita, capturando os efeitos das anteriores sobre a quota e funcionando como um controlo sobre as diferentes médias da quota nas várias regiões. Obtemos um modelo reduzido a partir deste através dum algoritmo stepwise, em que as variáveis foram sendo retiradas, uma a uma, pela ordem da remoção que mais minimizava o cálculo do AIC, um critério de qualidade de modelos estatísticos (Akaike, 1998). Na Figura 5.3 estão representados os coeficientes com maior valor acima de um certo valor de corte. Existe ainda um teste de hipóteses para avaliar o quão relevante é uma variável para o modelo de regressão, o teste-t(Seltman, 2015, Capítulo 9), descrito de seguida: Suponhamos que se pretende testar a hipótese H0:βj= 0,j∈ {0, ··· ,p}, o que significa que o coeficiente β0não é significativo e que a variável Xjnão deve constar no modelo de regressão, então esta hipótese pode ser testada usando a estatística de teste Tj=ˆ βj se( ˆ βj). Sob H0,Tj a ∼t(n−(p+ 1)). RA função lm{stats} permite estimar um modelo linear usando um estimador OLS (mínimos quadrados). Os valor-passociados ao teste-tpodem ser obtidos usando o comando summary.lm{stats}.
FCUP 37 Modelação de Quotas de Mercado Uma vez que dispomos de ferramentas estatísticas para escolher o modelo de regressão linear mais significativo (algoritmo stepwise e teste-t) não necessitámos de recorrer ao método k-fold, um modelo de regressão linear ilustrativo pode ser construído usando cerca de 70% da amostra e o seu erro pode ser estimado recorrendo aos restantes 30%. A análise gráfica dos erros (Figura 5.1) permite verificar que a unidade 54 e 55 tem, em geral, um erro inferior às restantes. Apesar da previsão usando este modelo ter dado valores entre 0 e 1 isto podia não ter acontecido pois não existe garantia que o contra-domínio do modelo seja [0,1]. O facto das previsões não terem saído do intervalo está relacionado com os valores que a variável tomou no histórico pois estes nunca foram muito próximos de 0 ou 1. Outra possível desvantagem destes modelos é que os coeficientes representam efeitos absolutos na variável dependente, o que pode não ser desejável. Um incremento em 1 duma variável dependente Xitem sempre um efeito βi, independentemente do valor de Xi. Se houver retornos diminuídos (uma campanha tem um efeito maior na quota quando a quota é baixa do que quando esta é alta), pode fazer mais sentido observar o efeito de um aumento duma variável independente em unidades relativas como na função logística que será vista de seguida, e não em absolutas como no modelo linear (Faraway, 2006). 51 53 54/55 ● ● ● ● ● ● ● ● ● ●● ● ● ●● ● ● ● ● ● ● ● ● ● ● ●● ● ●● ● ● ● ● 0 % 10 % 20 % 30 % 40 % PC GL GP L I S PC GL GP L I S PC GL GP L I S MAPE Figura 5.1: Comparação dos erros estimados para a regressão linear, por região e unidade. 5.2 Modelo Logístico De forma a garantir a restrição no domínio da variável a prever, consideramos a modelação da quota através de um modelo não linear, de forma que Y=1 1 + exp−(β0+...+βkXk). Esta função é a função logística e apresenta a forma de S. Adotando este modelo, estamos a assumir que a quota segue uma função logística, ou seja, assumimos que para valores baixos da função preditora, a quota será próxima de zero e que aumenta à medida que o preditor aumenta. Relativamente à estimação dos parâmetros, uma vez que se trata da função logística, podemos inverter a expressão de forma a poder utilizar o método OLS para estimar os parâmetros: logit(Y) = β0+β1X1+ ... + βkXk,
38 FCUP Modelação de Quotas de Mercado sendo logit(Y) = log Y 1−Y. Neste caso, os parâmetros têm um significado diferente. O coeficiente βié interpretado como a alteração que o aumento de uma unidade na variável iproduz no logaritmo dos odds da quota. No caso das nossas variáveis, que tomam valor 0 ou 1 conforme haja ou não campanha, o coeficiente βié visto como o impacto que a existência da campanha tem sobre o logit da quota. Procedendo de forma análoga à regressão linear, estimamos os erros médios cometidos pelo modelo de cada região: 51 53 54/55 ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ● ●● ● ● ● ● ● ● ● ● ● ● ● ●● ● ● ● ● ● ● ● ● ● ●● ● ●● ●● ● ● ● ● ● ● 0 % 10 % 20 % 30 % 40 % 50 % PC GL GP L I S PC GL GP L I S PC GL GP L I S MAPE Figura 5.2: Comparação dos erros estimados para a regressão logistica, por região e unidade. 5.2.1 Análise dos coeficientes para regressão linear e modelo logit Consideremos os modelos construídos utilizando os dados de todas as regiões com todas as variáveis e os seus efeitos de segunda ordem: PROMOk(t), CONCOj(t), PROMOk(t-1), CONCOj(t- 1) e REGIAO, ∀j,k. Vamos assumir que os modelos resultantes do algoritmo stepwise têm todos os coeficientes significativos. Apenas são representados coeficientes com valor absolutos superior a um dado valor de corte que entendemos ser interessante. Comecemos pela análise da Figura 5.3 na próxima página. Para a unidade 51, a interação entre a PROMO4(t) e a CONCO2(t) tem um coeficiente muito semelhante ao da interação entre a CONCO2(t) e a PROMO1(t−1) mas com sinal oposto, ou seja, o modelo estima que se todas as outras variáveis se mantiverem fixas, a ocorrência em simultâneo da PROMO4 e CONCO2 leva a uma subida na quota e que se houver uma PROMO1 no mês t-1 seguida de uma CONCO2 no mês tentão a quota vai sofrer uma descida. Pode observar-se ainda que os valores absolutos dos coeficientes têm valores bastantes próximos. Algo que não seria de esperar era um sinal negativo para a PROMO4; uma razão para este valor poderá ser o facto desta campanha ocorrer quase sempre em simultâneo com alguma da concorrência levando a que o modelo estime uma descida quando esta ocorre. Para a unidade de negócio 53, verifica-se uma maior variação entre os valores absolutos dos coeficientes. De observar que o coeficiente com maior valor está associado à ocorrência, quando ocorrem as campanhas PROMO3 e CONCO1 no mesmo mês, logo seguido da ocorrência de CONCO2 tendo havido no mês anterior PROMO1. Nesta unidade de negócio, a PROMO4 surge com coeficiente positivo; no entanto, a PROMO3 surge com valor associado negativo. Por último, na unidade 54 e 55, os coeficientes tomam valores inferiores pelo que, para o valor de corte escolhido, apenas três são representados. Os três coeficientes têm valores muito semelhantes. Uma nota a esta análise é
FCUP 39 Modelação de Quotas de Mercado 51 53 54/55 PROMO4xCONCO2 CONCO2xPROMO1(t−1) PROMO4 PROMO1xPROMO4 PROMO1xCONCO2(t−1) PROMO2xPROMO4 PROMO3(t−1) CONCO1xPROMO4(t−1) PROMO1xCONCO2 PROMO3xCONCO1 CONCO2xPROMO1(t−1) PROMO4xCONCO2 PROMO2 PROMO2xCONCO1(t−1) PROMO1xPROMO4 PROMO3 PROMO4 PROMO2xCONCO2 CONCO1xCONCO2(t−1) PROMO2xCONCO1 PROMO1xCONCO2 β Sinal + − Figura 5.3: Principais betas para a regressão linear. 51 53 54/55 PROMO4xCONCO2 CONCO2xPROMO1(t−1) PROMO1xPROMO4 PROMO2xPROMO4 PROMO1xCONCO2 PROMO4 PROMO1xCONCO2(t−1) CONCO1 CONCO1xPROMO4(t−1) CONCO1xPROMO1(t−1) PROMO2 CONCO1xPROMO2(t−1) PROMO3(t−1) PROMO3xCONCO1 CONCO2xPROMO1(t−1) PROMO4xCONCO2 PROMO2 PROMO2xCONCO1(t−1) PROMO1xPROMO4 PROMO3 PROMO4 PROMO2xCONCO2 PROMO4xCONCO1(t−1) CONCO2(t−1) CONCO1xPROMO1(t−1) PROMO1(t−1) CONCO1(t−1) PROMO3(t−1) CONCO2 PROMO1xCONCO1 CONCO1 CONCO1xCONCO2(t−1) PROMO2xCONCO1 PROMO1xCONCO2 PROMO1xCONCO2(t−1) PROMO3xCONCO2 CONCO1xPROMO2(t−1) PROMO2xCONCO2(t−1) PROMO2xREGIAOI PROMO1xCONCO1 CONCO2(t−1) PROMO2(t−1) PROMO4 CONCO1xREGIAOI PROMO4(t−1) β Sinal + − Figura 5.4: Principais betas para o modelo. o facto de que a mesma campanha promocional ou interação entre campanhas tem diferentes impactos nas diferentes unidades de negócio, não se mantendo a ordem dos coeficientes. Um exemplo evidente é a ocorrência num mesmo mês das campanhas promocionais PROMO4 e CONCO2 que para a unidade 51 tem coeficiente associado positivo e para a unidade 53 tem valor ligeiramente superior es com sinal negativo. Passando para a análise da Figura 5.4, podemos verificar um decréscimo mais acentuado entre os valores dos coeficientes. Isto deve-se ao facto dos coeficientes refletirem o incremento que a existência de uma campanha promocional provoca no logit da quota e não na quota. Numa análise muito geral podemos verificar que, nas unidades 53 e 54/55, a ordem dos coeficientes apresentados na regressão linear se manteve. Para a unidade 51, os dois primeriros coeficientes correspondem aos da regressão linear, embora depois a ordem seja diferente. Relação Causa-Efeito. É importante fazer notar que fazer estatística com dados humanos (um agente racional) é algo muito diferente da maioria das aplicações estastícas que observam fenómenos não-humanos (agentes passivos). O problema é que, quando se trata de seres humanos, o observado é também o observador, de forma que estabelecer uma relação causa-efeito pode ser complicado, e uma regressão assume que a variável independente é, de facto, independente. É
40 FCUP Modelação de Quotas de Mercado perfeitamente plausível que a decisão de fazer promoções advenha duma redução da quota baixa. De facto, se este estudo tiver algum efeito a nivel de decisão, então o estudo será automaticamente invalidado a partir desse ponto no tempo. 5.3 Árvores de Regressão Árvores de classificação e regressão são mais um método de aprendizagem para construção de modelos de previsão a partir de dados. Estes modelos são obtidos através da partição sucessiva do espaço de dados com estimação de modelos simples em cada partição. O resultado pode, desta forma, ser representado como uma árvore. As árvores de classificação foram desenvolvidas para variáveis dependentes que tomam um número finito de valores e cujo erro de previsão é medido através de uma função custo. Por outro lado, as árvores de regressão foram pensadas para variáveis dependentes que tomam valor contínuo ou discreto ordinal. Neste caso, a medida mais usada é o quadrado das diferenças entre o valor previsto e o valor real. O algoritmo CART – Classification and Regression Trees (Hand et al., 2000, secção 5.2) – é o mais comum como metodologia de regressão não paramétrica para a previsão do desempenho de uma variável. As Árvores de Regressão CART são essencialmente usadas para explicar e prever uma determinada variável a partir de valores observados de variáveis explicativas da mesma. Este método permite ainda construir grupos homogéneos de indivíduos que são caracterizados pelos mesmos valores dos atributos. A metodologia de regressão CART pressupõe três etapas: • Crescimento da árvore procedendo a diversas ramificações binárias no sentido de diminuir a diversidade da variável em estudo; • Validação da árvore; • Interpretação da árvore resultante. Crescimento da Árvore. A árvore de regressão CART é obtida a partir de sucessivas divisões binárias do conjunto de dados (usando a amostra de treino) através de uma medida de homogeneidade que é usada para decidir qual a melhor variável de corte e valor de corte associados a cada nó. Cada nó é dividido em dois nós descendentes, de forma a reduzir a heterogeneidade dos valores da variável dependente nestes nós relativamente ao nó ascendente. Em cada divisão é avaliada a redução da variância da variável a prever de forma a definir a melhor variável de corte. Todo este processo é recursivo, cada nova ramificação origina uma árvore com menor variabilidade do que a árvore que a antecedia. No entanto, o crescimento da árvore pode ajustar-se demasiado aos valores da amostra de treino, o que pode causar algumas dificuldades na generalização do modelo obtido. Assim sendo, é comum definirem-se regras de paragem de crescimento da árvore. Algumas regras de paragem do crescimento de uma árvore são a consideração de um número máximo de níveis, a definição dos números mínimos de observações para nós a ramificar ou para nós descendentes e a imposição de um decréscimo mínimo da diversidade. Terminada a construção da árvore, a previsão associada a um elemento que foi encaminhado para determinado nó folha será dada pela média no nó-folha onde esse elemento se enquadra (uma previsão que é igual para todos os elementos que pertençam ao mesmo nófolha).
FCUP 41 Modelação de Quotas de Mercado REGIAO = PC,GL,GP,L REGIAO = GP,L REGIAO = GP PROMO1 < 0.5 CONCO1 >= 0.5 PROMO4.l < 0.5 PROMO1 < 0.5 CONCO1 >= 0.5 PROMO1 < 0.5 CONCO1 >= 0.5 PROMO4.l < 0.5 PROMO1.l < 0.5 REGIAO = PC CONCO1 < 0.5 CONCO2.l < 0.5 PROMO1 < 0.5 PROMO2 < 0.5 REGIAO = S CONCO1 >= 0.5 CONCO1 < 0.5 0.11 0.18 0.24 0.21 0.28 0.31 0.37 0.28 0.36 0.43 0.37 0.45 0.44 0.5 0.52 0.55 0.6 0.67 0.61 0.75 0.76 yes no Figura 5.5: Árvore de regressão da unidade 51 para a quota normalizada, usando os dados de todas as regiões. REGIAO = PC,GL,GP,L REGIAO = GL,GP REGIAO = GP PROMO1 < 0.5 CONCO1.l < 0.5 PROMO1 < 0.5 PROMO1 < 0.5 PROMO1.l >= 0.5 PROMO2.l >= 0.5 REGIAO = S PROMO4.l < 0.5 PROMO1.l >= 0.5 CONCO1.l < 0.5 0.15 0.2 0.26 0.25 0.34 0.33 0.33 0.39 0.44 0.67 0.75 0.69 0.75 0.81 yes no Figura 5.6: Árvore de regressão da unidade 53 para a quota normalizada, usando os dados de todas as regiões. REGIAO = PC,GL,GP,L REGIAO = GP PROMO1 < 0.5 REGIAO = PC,GL PROMO1 < 0.5 PROMO2 < 0.5 REGIAO = GL CONCO1 < 0.5 CONCO1.l < 0.5 REGIAO = I CONCO1.l < 0.5 CONCO1 < 0.5 PROMO1 < 0.5 CONCO1.l < 0.5 0.075 0.15 0.22 0.28 0.36 0.32 0.38 0.38 0.45 0.52 0.64 0.67 0.67 0.73 0.79 yes no Figura 5.7: Árvore de regressão da unidade 54 e 55 para a quota normalizada, usando os dados de todas as regiões. Aplicando este método ao conjunto de dados de todas as regiões e considerando as promoções PROMOk(t), PROMOk(t−1), CONCO1(t) e CONCO2(t), como variáveis explicativas obtivemos as seguintes árvores nas Figuras 5.5 - 5.7. Uma das grandes vantagens das árvores de regressão é a sua fácil interpretabilidade, algo particularmente útil num ambiente empresarial como a SONAE em que métodos de data mining são em geral desconhecidos. Claro que tomar decisões com base nestes valores sofre dos problemas referidos na primeira secção do capítulo. A análise das árvores obtidas permite mais uma vez concluir que as variáveis terão diferente impacto em diferentes regiões. Se fixarmos, por exemplo, a região Sul podemos verificar que para a unidade 51 as variáveis tidas em consideração são CONCO2(t−1), PROMO1(t) e a PROMO2(t); para a unidade 53 apenas se considera a PROMO4(t−1) e para as unidades 54 e 55 a mesma análise revela que as variáveis utilizadas são a PROMO1(t) e CONCO1(t−1). Para cada região foi construído um modelo usando as promoções e promoções com lag, para cada unidade de negócio. Tal como nos modelos de regressão linear, uma vez que apenas temos um modelo a avaliar por região, 70% da amostra foi usada para atreinar o modelo e 30% para estimar o erro do mesmo. O resultados encontram-se na Figura 5.8. Como critério de paragem de crescimento da árvore utilizamos um valor de corte de 0.001, ou
42 FCUP Modelação de Quotas de Mercado seja, se a média da quota numa nova folha não decresce pelo menos 0.1% em relação ao nó que a origina então a árvore é podada nesse nó. 51 53 54/55 ● ● ● ●●● ● ● ● ● ● ● ● ●● ● ● ● ● ● ●● ● ● ● ● ● ● ● ● 0 % 10 % 20 % 30 % 40 % PC GL GP L I S PC GL GP L I S PC GL GP L I S MAPE Figura 5.8: Comparação dos erros estimados pelas árvores de regressão, por região e unidade. 5.4 Redes Neuronais As redes neuronais consistem num método de aprendizagem inspirado pela capacidade de aprendizagem, bem como reconhecimento de padrões, por parte do sistema nervoso central de um ser vivo. Motivação Biológica – Funcionamento do Sistema Nervoso O sistema nervoso detecta estímulos internos e externos desencadeando repostas quer a nível dos músculos, quer a nível das glândulas e é formado, essencialmente, por células nervosas que se comunicam através de sinapses, formando as redes neuronais. Oneurónio (ou célula nervosa) é o principal componente do sistema nervoso estimando-se que o cérebro humano seja constituído por cerca de 86 bilhões de neurónios. Existem vários tipos de neurónios com diferentes funções e estruturas morfológicas. As sinapses são regiões através das quais ocorrem os processos de comunicação entre neurónios (a transmissão do sinal neural ocorre devido a processos electroquímicos específicos). As sinapses estão presentes não apenas entre uma terminação nervosa e um neurónio mas também entre a terminação nervosa e células musculares ou glandulares. Terminal do Axónio (terminal de transmissão) Dentritos (terminal de recepção) Sentido da propagação Nó de RanvierAxónio Corpo Bainha de Mielina (a) Componentes de um neurónio. (b) Morfologias básicas de neurónios. Figura 5.9: Estrutura de um neurónio.
FCUP 43 Modelação de Quotas de Mercado Durante este processo de transmissão de informação os neurónios não se tocam, permanecendo um espaço entre eles denominado de fenda sináptica, onde um neurónio pré-sináptico se liga a outro (neurónio pós-sináptico). O sinal ou impulso nervoso, transmitido pelo axónio da célula pré-sináptica chega à extremidade e estimula a libertação de neurotransmissores na fenda (estes neurotransmissores encontram-se armazenados em bolsas chamadas vesículas sinápticas). Este elemento químico liga-se a receptores específicos no neurónio pós-sináptico, dando continuidade à propagação do sinal. Em termos funcionais, o que acontece é que os neurónios sensoriais recebem informação e enviam-na para o sistema nervoso central onde os neurónios de associação a codificam, compararam, guardam e tomam uma decisão que é depois enviada, desencadeando alguma reacção por parte dos músculos ou glândulas. Redes Neuronais Artificiais Numa rede neuronal artificial várias camadas de unidades de processamento estão ligadas às anteriores na forma de uma rede, tal como ilustrado na Figura 5.10. PROMO1(t) PROMO1(t−1) PROMO2(t) PROMO2(t−1) PROMO3(t) PROMO3(t−1) PROMO4(t) PROMO4(t−1) CONCO1(t) CONCO1(t−1) CONCO2(t) CONCO2(t−1) QUOTA Figura 5.10: Esquema duma rede neuronal com uma camada escondida. A camada inicial é o vetor xde valores de entrada xia partir do qual queremos construir a nossa previsão y. Cada camada é ligada à anterior por um vetor de pesos que é calculado a partir da camada anterior apor uma função f(a,W), onde Wé a matriz de pesos e fé designada função de ativação. Seguem dois exemplos de funções de ativação e respetivos contradomínios: Função Ativação Fórmula Contradomínio linear x]−∞,+∞[ sigmóide 1 1+e(−x)[0,1] Tabela 5.1: Duas funções comuns de ativação de redes neuronais. Para um determinado problema, o número de camadas escondidas (camadas de neurónios intermédios), o número de unidades em cada uma dessas camadas e os pesos de conexão dependem do conjunto de treino. O algoritmo de aprendizagem supervisionada mais popular é o algoritmo de retropropagação (ou back-propapagation) do erro (Almeida, 1997). Neste algoritmo, os dados
50 FCUP Modelação de Quotas de Mercado A estimação de parâmetros utilizando diretamente estes modelos pode ser muito trabalhosa. No entanto, o modelo pode ser reduzido a um modelo linear de forma a que se possam usar técnicas de regressão linear (Cooper e Nakanishi, 1988, secção 2.5). Se, por exemplo, aplicarmos o logaritmo em ambos os membros obtemos a expressão logsit =αi+ K X k=1 βklogxkit + logεit −log m X j=1 (αj K Y k=1 xβk kjt εjt ). Por outro lado, se somarmos a equação anterior para todo o ie dividirmos por mobtemos: 1 m m X i=1 logsit =1 m m X i=1 αi+ K X k=1 βklogxkit + logεit −log m X j=1 (αj K Y k=1 xβk kjt εjt ). Designando por ˜ st, ˜xkt e ˜εt, a média geométrica de st,xkt eεtrespetivamente, podemos reescrever a equação anterior como: log ˜ st= ¯α+ K X k=1 βklog ˜xkt + log ˜εt−logm X j=1 (αj K Y k=1 xβk kjt εjt ). Finalmente, subtraindo as duas expressões obtemos um modelo linear: log sit ˜ st = (αi−¯α) + K X k=1 βklog xki ˜xkt + log εit ˜ st . Considerando ainda que não há efeito competitivo na atração da empresa, pode considerar-se um outro tipo de modelação. O modelo MNL (MultiNomial Logit) pressupõe que: Modelo MNL: Ait = exp(αi+PK k=1 βkxkit +εit ) Tal como no modelo MCI a expressão pode ser manipulada de forma a obter um problema de estimação linear. Como visto, outros modelos comuns na modelação da quota de mercado são: Modelo Linear: sit =αi+PK k=1 βkxkit +εit Modelo Multiplicativo: sit = exp(αi)QK k=1 xβk kit εit Modelo Exponencial: sit = exp(αi+PK k=1 βkxkit +εit ) As relações mais interessantes entre estes modelos e os modelos de atração são a relação entre o modelo multiplicativo e o modelo MCI e ainda entre o MNL e o modelo exponencial. Relativamente ao modelo multiplicativo, este assume que a quota é uma função multiplicativa das variáveis explicativas. Por sua vez, o modelo MCI assume que as atrações são uma função multiplicativa das variáveis, sendo a quota obtida através da normalização das atrações. A principal diferença é então a normalização (Cooper e Nakanishi, 1988, secção 2.5). Resumidamente, as formas simplificadas para estes modelos são:
FCUP 51 Modelação de Quotas de Mercado Modelo Linear: sit =αi+PK k=1 βkxkit +εit Modelo Multiplicativo: logsit =αi+PK k=1 βklogxkit + logεit Modelo Exponencial: logsit =αi+PK k=1 βkxkit +εit Modelo MCI log sit ˜ st=α∗ i+PK k=1 βklog xkit ˜xkt +ε∗ it Modelo MNL log sit ˜ st=α∗ i+PK k=1 βk(xkit −¯xkt ) + ε∗ i Continuando com os modelos de atração, podemos introduzir uma maior complexidade ao modelo considerando que os parâmetros βdependem não só de kmas também da marca i. Esta mudança resulta na seguinte fórmula para a atração Ait : Modelo MCI: Ait = exp(αi+εit )Qm j=1 QK k=1 fk(xkit )βki Modelo MNL: Ait = exp(αi+PK k=1 Pm j=1 βki xkit +εit ) Esta modelação é também designada por differentials effects model (Cooper e Nakanishi, 1988, secção 3.3). No entanto, esta modelação ainda não é totalmente adequada na maioria das aplicações. Porquê? Não são considerados efeitos entre marcas. A atração da marca ié escrita em função apenas das suas ações/variáveis de marketing. De forma a contemplar uma estrutura que tenha em conta os efeitos entre marcas, podemos definir o modelo de atração extendido (Cooper e Nakanishi, 1988, secção 3.4): Modelo MCI extendido: Ait = exp(αi+εit )Qm j=1 QK k=1 fk(xkjt )βkij Modelo MNL extendido: Ait = exp(αi+PK k=1 Pm j=1 βkij xkjt +εit ) Relativamente ao desempenho destes modelos, Naert e Weverbergh (1981) num estudo compreendendo dados empíricos no mercado de consumo, tanto no mercado da gasolina como em lâminas de barbear, concluiram que os modelos de atração resultam em melhores previsões que os modelos linear e multiplicativo. Um estimador OLS poderá estimar os βdeste modelo ou com GLS para tomar em conta a correlação dos erros. Nalbantov et al. (2010) estima os parâmetros usando SVMs. Nos modelos de atração, a quota duma dada empresa varia em função explicita da quota das outras empresas. Considerando o caso em estudo, isto revela-se um problema para os nossos dados uma vez que os relatórios que nos foram disponibilizados apenas contêm dados da quota da empresa em estudo. Posto isto, temos informação para a quota SONAE e para a quota não-SONAE (visto que a soma destas é 1). De forma a utilizar este modelo consideramos então a existência de duas “empresas”: a SONAE e a não-SONAE. Trata-se de uma aproximação muito grosseira mas os dados não permitem fazê-lo de outra forma. Tomando a SONAE como empresa 1 e a não-SONAE como empresa 2, as quotas são, respetivamente, dadas por: s1t=A1t/(A1t+A2t) e s2t=A2t/(A1t+A2t). Tendo em conta que apenas consideramos duas empresas, então a estimação deste modelo pode reduzir-se a um modelo linear que determina o logit da quota de uma empresa como uma combinação linear de uma transformação das variáveis. Para verificar este raciocínio, basta aplicar o logaritmo a ambos os membros das expressões da quota das duas empresas e subtrair: log(s1t)−log(s2t) = log(A1t)−log(A1t+A2t)−log(A2t) + log(A1t+A2t)
52 FCUP Modelação de Quotas de Mercado ⇔log(s1t)−log(s2t) = log(A1t)−log(A2t) Uma vez que existem duas empresas então s2t= 1 −s1te a expressão anterior equivale a: logs1t 1−s1t= log(A1t)−log(A2t) Para o caso do modelo MCI extendido, A1t= exp(α1+ε1t) m Y j=1 K Y k=1 fk(xkjt )βk1je A2t= exp(α2+ε2t) m Y j=1 K Y k=1 fk(xkjt )βk2j, de onde resulta a forma reduzida: logit(s1t)=(α1−α2)+(ε1t−ε2t) + K X k=1 (βk1j−βk2j)log(fk(xkjt )). Para o modelo MNL, A1t= exp(α1+ K X k=1 m X j=1 βk1jxkjt +ε1t) e A2t= exp(α2+ K X k=1 m X j=1 βk2jxkjt +ε2t) e portanto: logit(s1t)=(α1−α2)+(ε1t−ε2t) + K X k=1 (βk1j−βk2j)xkjt . Demonstramos assim que, para o caso de duas empresas, o modelo de atração é idêntico ao modelo logístico (secção 5.2). 6.2 Modelos de Escolha Nesta secção será feita uma revisão do método Bayesiano proposto por Chen e Yang (2007) para modelar o comportamento individual dos consumidores utilizando dados agregados. Neste trabalho, a modelação da dinâmica de compra de um cliente é feita recorrendo a dados agregados ao nível da loja. Uma das principais dificuldades no estudo da dinâmica de compra consiste no facto de não podermos observar o comportamento passado de um cliente quando apenas existe informação agregada. Como tal, os modelos existentes ignoram a dinâmica de procura quando analisam os dados agregados, sendo construídos através de um processo de maximização da função utilidade, capturando assim a heterogeneidade dos consumidores. Uma das vantagens principais do método apresentado neste trabalho de Chen e Yang é a ca-
FCUP 53 Modelação de Quotas de Mercado pacidade de modelar o comportamento de um consumidor, tendo em conta o histórico de procura agregada. Isto será possível simulando um conjunto de escolhas consistentes com os dados observados através do método de simulação Monte Carlo. No entanto, uma vez que as escolhas individuais não são conhecidas, esta coerência entre as simulações e os dados reais não pode ser medida. Para avaliar a validade do modelo os autores fizeram várias simulações. Primeiro fixaram os parâmetros e geraram a procura agregada através da escolhas individuais obtidas por simulação. De seguida, tendo apenas acesso às procuras agregadas, utilizam o método para verificar se obtêm uma estimativa dos parâmetros próxima do valor que usaram inicialmente (ver Chen e Yang, 2007, Tabela 1). Geração de Escolhas a partir dos Dados Observados Assume-se que a procura agregada, Sjt , do produto jno instante té gerada por Mclusters de consumidores no mercado. Dentro de um mesmo cluster assume-se que todos os clientes têm a mesma função utilidade e todos os clusters têm o mesmo número de clientes. Além disso, supõe-se que cada cliente consome apenas uma unidade de produto por cada período de tempo. Aqui, o cluster é considerado a unidade mínima de desagregação. A função utilidade para o produto jno cluster i(no instante t) é uijt =θ| ixijt +εijt , (6.1) onde xijt é o vetor que inclui variáveis de marketing, θié uma variável com distribuição normal multivariada (θi∼NMV(µ,Σ)) e εijt é o termo erro com função distribuição de valor extremo do tipo- I (também conhecida por distribuição Gumbel). As variáveis de marketing compreendem, por exemplo, o preço e existência de campanhas promocionais e podem ainda ser incluídas as simulações do histórico de procura de forma a captar a dinâmica de procura. Para Jprodutos, a função de utilidade especificada conduz a uma probabilidade de escolha logit: Pr(yijt = 1) = sijt =exp(θixijt ) PJ k=0 exp(θixikt ), com yijt = 1 se os clientes do cluster iconsomem o produto jno instante t(Viton, 2010). Caso contrário, yijt = 0. Os dois métodos mais comuns para estimar modelos discretos de escolha usando dados agregados são: • Minimizar as discrepâncias entre os valores de quota observados e os previstos, por exemplo, minimizar o erro quadrático médio. • Maximizar a função de máxima verosimilhança. De acordo com esta aproximação, a função maxima verosimilhança correpondente à equação 6.1 é: L= | Y t=1 CM O0,t,...,OJt J Y j=0 Zsijt f(θi|µ,Σ)dθiOjt , (6.2)
54 FCUP Modelação de Quotas de Mercado onde: -CM O0,t,...,OJt é o coeficiente multinomial; -f(θi|µ,Σ) é a função densidade de θi; -Ojt é o número de clusters, em M, que escolhe a marca jno instante t: Ojt =bSjt M+ 0.5c. Esta função máxima verosimilhança é baseada no no facto de se considerar que os Mclusters são permutáveis e que cada grupo tem uma probabilidade de escolha esperada dada por Rsijt f(θi|µ,Σ)dθi. Apesar da estimação do modelo com dados agregados ser viabilizada por estas duas abordagens, não é muito fácil incorporar o histórico de compra do consumidor visto que esta informação não está diretamente disponível. Para superar esta dificuldade é proposto um modelo Bayesiano hierárquico que permite tratar as escolhas individuais como variável, obtendo-as por “ampliação” dos dados agregados. A ideia é usar um conjunto Rde clusters de forma que a probabilidade média das escolhas neste subconjunto aproxime a dos restantes M−Rclusters. Esta abordagem facilita o processo de modelação com dados agregados pois o histórico simulado pode ser utilizado directamente quando é calculada sij . O ponto de partida deste modelo é a função máxima verosimilhança dada na equação (6.2); no entanto, assume-se que existem Rclusters representativos dos Mcujas escolhas (denotadas por yrjt , com r∈ReR≤M) serão obtidas por “ampliação” dos dados. Conhecidos os dados agregados, o histórico de procura, h, em Ré um conjunto de yrjt tal que: R X r=1 yrjt ≤Ojt . Esta condição resulta do facto de Rser um subconjunto de M. Seja Ho conjunto de todos os h, ou seja, o conjunto de todos os históricos de compra possíveis. Podemos escrever a função máxima verosimilhança dos dados agregados como: L=X h∈HLR|hxLM−R|h, onde: -LR|h=QR r=1 R[Q| t=1 QJ j=0(srjt )yrjt f(θr|µ,Σ)]dθré a função máxima verosimilhança nos Rclusters; -LR−M|h=QT t=1 nCM−R z0t,...,CJt QJ j=0 hRsijt f(θi|µ,Σ)θiiZjt o, com Zjt =Ojt −PR r=1 yrjt eCM−R z0t,...,CJt , o coeficiente multinomial. Uma vez que se assume que os Rclusters sao representativos dos Mclusters então assume-se que Rsijt f(θi|µ,Σ)dθi=PR r=1 srjt R. Com a simulação de escolhas nos Rclusters, este trabalho permite introduzir um histórico de procura na função utilidade e consequentemente em sijt . Sem este aumento nos Rclusters, quando
FCUP 55 Modelação de Quotas de Mercado sijt é função do histórico, seria necessário integrar sobre todas as possibilidades Rsijt (θi|¯ θ)dθi, o que seria impraticável. Em relação à escolha de MeR, pode tomar-se R=M. No entanto, nesse caso é necessário que PR r=1 yrjt =Ojt e, consequentemente, o algoritmo de simulação de dados torna-se ineficiente. Um valor de Rrelativamente grande em relação a Mreduz a taxa de aceitação na geração de escolhas simuladas, o que torna o algoritmo menos eficiente. Por outro lado, um valor de Rmuito pequeno, torna o algoritmo mais eficiente mas pode não ser representativo de M. No seu trabalho, Chen e Yang, concluem que quando o valor de Mé desconhecido, se os resultados de estimação forem robustos quando se varia Rfixando M, então isto sugere que a escolha de Mé razoável. Vejamos agora como estimar os parâmetros do modelo (µeΣ). A função L=Ph∈H(LR|hxLM−R|h) é, como referido, difícil de tratar devido à distribuição de heterogeneidade dos consumidores e ao grande número de combinações de histórico de compra admissível (h) que são consistentes com as ações agregadas. Por esta razão, é tomada uma análise bayesiana usando dados simulados. A análise bayesiana dos dados agregados é feita especificando a função distribuição conjunta de todos os parâmetros do modelo. A função densidade de probabilidade conjunta posterior pode ser escrita como f{yt},{θr},µ,Σ|{St},{xrt }∝ | Y t=1 nf(St|yt,θ1,...,θR) R Y r=1 [f(yrt |θr,xrt )f(θr|µ,Σ)f(µ,Σ)]o, onde -yté o conjunto de escolhas yrjt ,r∈ {1,..., R},j∈ {1, ..., J}; -f(St|yt,θ1,...,θR) = LM−R|h,t; -f(yrt |θr,xrt ) = QJ j=0(srjt )yrjt é a probabilidade de escolha no instante t, do cluster r, cujas escolhas foram simuladas; -f(θr|µ,Σ) é a distribuição de heterogenidade; -f(µ,Σ) é a distribuição a priori. A estimação será feita através de cadeias de Markov e gerando iterativamente amostras para os parâmetros do modelo. No seu trabalho, os autores consideram ainda a opção de não escolha de nenhuma das marcas de interesse. A não escolha é denotada por j= 0 e tem associada uma função utilidade dada por ui0t=εi0t. Passo 1. Geração de yt A chave deste algoritmo é a geração de escolhas individuais (a nível dos Rclusters) gerando ytde forma condicional a outros parâmetros do modelo. Pela equação de probabilidade conjunta
56 FCUP Modelação de Quotas de Mercado posterior, yté proporcional a t0 Y τ=thCM−R z0t,...,CJt J Y j=0 R X r=1 srjτ/RZjt i R Y r=1 J Y j=0 syrjτ rjτ, onde srjt =exp(θ| rxjt ) Pkexp(θ| rxkt ) et+1,..., t0são os períodos em que a escolha dos consumidor é afetada pela escolha em t. Se não houver este efeito dinâmico t0=t. Uma vez que f(yrt |θr,xrt ) = QJ j=0(srjt )yrjt , podem gerar-se amostras de yrt (r= 1, ..., R) recorrendo a uma função distribuição discreta com J+ 1 valores possíveis. Cada amostra yrt consiste num vetor em que apenas uma das entradas é 1 (indicando a escolha do consumidor dentro das J+ 1 possibilidades). A probabilidade de cada resultado é srjt , que é a probabilidade logit apresentada. A amostra candidata é qualificada se Zjt é não negativo para todo oj; caso contrário, uma nova amostra é gerada. Considere-se que a amostra anterior é y(p) te a seguinte é y(n) t, a probabilidade de aceitação da amostra y(n) té dada por minnt0 Y τ=thCM−R z0t,...,CJt J Y j=0 R X r=1 srjτ/RZjt i R Y r=1 J Y j=0 syrjτ rjτy(n) t. t0 Y τ=thCM−R z0t,...,CJt J Y j=0 R X r=1 srjτ/RZjt i R Y r=1 J Y j=0 syrjτ rjτy(p) t,1o Se y(n) tnão for aceite, y(p) t:= y(n) te é gerada uma nova amostra y(n) t. Passo 2. Gerar θr Depois de geradas as escolhas dos Rclusters, θrpode ser gerado usado o algoritmo de Metropolis- Hastings (Chib e Greenberg, 1995). A função máxima verosimilhança de θré l(θr)∝ T Y t=1 hJ Y j=0 R X r=1 srjt RZjt J Y j=0 syrjt rjt i, e sijt =exp(θ| rxjt ) Pkexp(θ| rxkt ). Por outro lado, assumindo que θrprovém de uma variável aleatória normal multivariada com média µe matriz covariância Σ, a função probabilidade posterior é f(θr)∝ |Σ|−1 2exp(−1/2(θr−µ)|Σ−1(θr−µ))l(θr). Para gerar amostras de θré usado o método de Metropolis-Hastings (Chib e Greenberg, 1995,
FCUP 57 Modelação de Quotas de Mercado página 330). Seja θ(p) ra amostra anterior e θ(n) r, a probabilidade de aceitação da amostra é minnexp[−1/2(θ(n) r−µ)|Σ−1](θ(n) r−µ)l(θ(n) r) exp[−1/2(θ(p) r−µ)|Σ−1](θ(p) r−µ)l(θ(p) r),1o Cada nova amostra é gerada a partir de θ(p) r: θ(n) r:= θ(p) r+∆, onde ∆é uma amostra de uma normal multivariada de média 0e matriz covariância 0.015I, sendo I a matriz identidade. Passo 3. Gerar Σ Gerar elementos da diagonal de Σ,Σkk ,k∈ {1,...,K}onde Ké a dimensão de θr. A distribuição posterior de Σkk é tal que f(Σkk |θrk ,¯ θk)∝InvGamma(a,b), onde a=s0+R 2,(s0= 3) e b=2 PR r=1(θrk −¯ θk)2+2q0,(q0= 0.2). Passo 4. Gerar µ f(µ|θr,Σ) = MNV(v,Ψ), onde v=Ψ(PR r=1 θr R+Σ0), Ψ= (Σ−1 0+RΣ−1)−1eΣ0= 100I. Passo 5. Voltar ao Passo 1 Enquanto θrnão for aceite (∀r∈ {1, ... ,R}) volta a 1. Por vezes a convergência é muito lenta e um critério bastante utilizado é o número máximo de iterações. 6.2.1 Aplicação do algoritmo ao caso em estudo No caso em estudo, estamos perante um contexto mais amplo do que uma loja. Apresentamos de forma esquemática a analogia do nosso problema ao modelo proposto por Chen e Yang: Loja Marca B Marca A Região Geográfica Não-SONAE SONAE Figura 6.1: Aplicação original dos autores à esquerda versus a nossa aplicação à direita.
58 FCUP Modelação de Quotas de Mercado Os nossos dados não permitem simular a não escolha, pelo que cada cluster de clientes apenas pode escolher a SONAE ou a não-SONAE (tal como nos modelos de atração). Na implementação consideramos as variáveis: ser SONAE (x1), ser não-SONAE (x2) e fazer campanha (x3). Com este modelo estaremos a simular o peso que cada cluster homogéneo de consumidores dá ao facto dos produtos serem da SONAE ou da concorrência e ainda ao facto de haver campanha promocional. A implementação deste algoritmo foi feita em R e a sua execução é lenta para valores elevados do número de clusters R. Foram testadas todas as combinações para os valores de clusters M∈ {30,40,50}e de R∈ {10, 20,30}. A estimação de parâmetros foi feita recorrendo aos meses entre janeiro de 2011 e abril de 2014 e os erros foram obtidos prevendo os últimos 7 meses. Os erros obtidos para a unidade 51, em Portugal Continental, são representados na Figura 6.2: M=50 R=10 16 % 20 % 24 % R=10 R=20 R=30 M=30 M=40 M=50 MAE Figura 6.2: Erros absolutos usando o método da escolha. A execução destes modelos demorou no total 14 horas tendo sido usado um processador i3 1.80GHz de 4 cores, a correr simulações em paralelo. Cada modelo foi simulado 100 vezes, o valor inicial de µfoi (1, 1,1) e para as diagonais da matriz de covariância usamos o valor 0.1. Além disso, escolhemos t0= 1. Em geral a cadeia de Markov convergiu antes das 30 iterações. Com este modelo tentamos estimar os valores dos parâmetros µ e a diagonal da matriz de covariância Σ. Fixando M= 50 observamos que a alteração do valor de R introduzia uma variação apenas a partir da segunda casa décimal nas estimativas de µ. No entanto, no que respeita à diagonal da matriz de covariância, as alterações foram maiores. Por exemplo, para R= 10, os valores estimados são metade dos valores estimados usando R= 20. Segundo os autores, se o valor de Mfosse próximo do ideal, então existiria convergência dos parâmetros para um dado valor mesmo alterando o valor de R, o que não aconteceu na nossa simulação. Os autores referem, nas suas aplicações, que iterações na ordem das dezenas ou centenas de milhar são usadas nas suas simulações. Tudo isto sugere que talvez devessemos usar valores de MeRsuperiores. A análise dos resultados revela um erro absoluto elevado. No entanto, seria expectável que os erros fossem elevados uma vez que, como já foi referido, estamos a fazer uma simplificação muito grande ao considerar que existem apenas duas empresas. A título ilustrativo mostramos as estimativas ˆµobtidas pelas simulações usando M= 50 e R= 10: os seus valores foram 0.030,0.037 e 0.04. Se este modelo se ajustasse bem aos nossos dados isto significaria que em média a função utilidade de um cliente atribuía um peso de 0.03 ao facto de um produto ser SONAE, 0.037 ao facto
FCUP 59 Modelação de Quotas de Mercado de ser da concorrência e 0.04 à existência de campanha promocional. De notar que neste caso as campanhas teriam um peso superior na função utilidade de um cliente. De forma a verificar se um maior número para os valores de MeRproduzia melhores resultados, decidimos testar ainda a estimação de parâmetros utilizando M= 200 e R= 50. Executamos a cadeia de Markov para 600 iterações e portanto 600 amostras foram geradas para cada parâmetro. Decidimos estimar os parâmetros a partir da média das últimas 400 amostras. O desvio padrão registado para as estimativas de µé para os três parâmetros muito próximo de 0.14 e a matriz de covariâncias obtida sugere um grande variabilidade entre os clusters. Estes parâmetros levaram a um erro absoluto muito semelhante aos anteriores. Outras variáveis poderiam ter sido testadas, nomeadamente a proporção de lojas da SONAE e não-SONAE, no entanto, dado o tempo de execução da nossa implementação para valores elevados de MeRoptamos por não fazê-lo. Uma outra razão é a simplificação feita ao usar um mercado com duas empresas, que em princípio não permitirá que o modelo tenha um bom desempenho. Além disso, não estamos a modelar um único produto da SONAE e não-SONAE mas sim uma família de produtos. Como nota final, reforçamos que estes modelos são particularmente úteis para estimar a importância que o consumidor dá a uma dada característica da empresa e que dada a relação entre a função utilidade e a probabilidade de escolha de um produto, este modelo permite ainda estimar a quota do mesmo.
66 FCUP Modelação de Quotas de Mercado Região Unidade Bottom Up Top Down Combinação Ótima PC Total 56.5 ±10.7 5.1 ±1.3 29.2 ±7.8 PC 51 14.0 ±3.9 9.9 ±2.6 12.6 ±3.6 PC 53 15.9 ±1.4 6.9 ±1.8 14.1 ±1.1 PC 54/55 49.8 ±3.1 6.2 ±2.2 30.9 ±2.8 GL 51 10.7 ±2.9 12.1 ±2.3 10.8 ±2.9 GL 53 6.9 ±2.8 37.4 ±2.2 7.9 ±2.3 GL 54/55 6.4 ±2.7 16.2 ±3.3 7.5 ±3.0 GP 51 9.6 ±2.0 78.5 ±12.5 9.6 ±1.9 GP 53 8.5 ±2.6 15.5 ±2.2 8.4 ±2.5 GP 54/55 6.4 ±1.8 46.2 ±6.3 11.1 ±5.2 L 51 8.8 ±3.8 26.9 ±8.1 12.2 ±5.1 L 53 7.0 ±1.4 7.6 ±1.9 7.8 ±1.7 L 54/55 7.0 ±2.3 55.0 ±5.8 7.7 ±2.3 I 51 10.3 ±3.4 42.7 ±7.4 10.5 ±3.5 I 53 7.2 ±2.7 44.1 ±1.4 9.8 ±3.0 I 54/55 5.8 ±1.3 44.3 ±2.7 22.1 ±3.2 S 51 10.1 ±3.0 11.4 ±4.1 11.2 ±2.8 S 53 8.0 ±3.3 15.6 ±1.4 8.3 ±2.8 S 54/55 4.2 ±1.5 5.6 ±1.3 6.4 ±2.1 Sem Hierarquia 5.0 ±1.0 9.8 ±2.4 6.6 ±2.6 6.4 ±0.7 11.3 ±3.4 7.5 ±2.1 6.5 ±1.4 10.1 ±2.1 8.4 ±4.2 7.0 ±0.9 9.3 ±3.2 6.9 ±1.8 6.7 ±1.5 10.8 ±2.7 7.3 ±2.1 5.9 ±2.4 10.8 ±2.5 8.2 ±1.9 4.0 ±1.5 Tabela 7.1: Erro médio ±desvio padrão (em %) da combinação dos modelos hierárquicos, no conjunto de validação, e erro cometido pelo melhor método no conjunto de teste. superiores são obtidas por combinação linear das previsões feitas para cada uma das 5 regiões. No método top-down também se verifica que no nível em que é feita a previsão independente (nível superior correspondente à quota no total), o erro é baixo mas, ao descer na hierarquia, os erros vão aumentando. O método de combinação ótima revela melhores resultados do que os métodos bottom-up e top-down nos níveis em que as previsões são obtidas por combinação de outras. Podemos ver que, de uma forma geral os valores do erro médio estão bastante próximos dos valores obtidos quando prevemos cada uma das combinações unidade/região de forma independente, no entanto, são ligeiramente superiores. Para concluir, verificamos que a previsão em cada uma das regiões de forma independente se revela mais eficaz do que a obtida recorrendo a uma estrutura hierárquica. Para terminar apresentamos, como já foi referido, na última coluna da tabela, o erro cometido pelo melhor método no conjunto dos últimos 7 meses. Em relação ao desvio padrão do erro, verificamos que no conjunto de teste este se localiza entre o valor 3.5% e 7%. 7.3 Cartogramas Umas das mais importantes áreas em estatística, por vezes descartada em favor da mais glamorosa estatística inferencial, é a estatística descritiva. Esta disciplina tenta transmitir os dados da
FCUP 67 Modelação de Quotas de Mercado forma mais intuitiva possível e condensada ao utilizador. Uma vez que qualquer Português conhece bem o mapa de Portugal, podemos explorar essa cognição para representar a área, não em termos reais, mas em relação à variável que se quer explicar. A este tipo de mapas chamam-se cartogramas. O primeiro algoritmo computacional para a elaboração de cartogramas é de Tobler (1973). Enquanto os mapas coropléticos associam quantidades a regiões através do uso de cores, os cartogramas são mapas que modificam a própria topografia da região em proporção com a quantidade a ela associada. No seu algoritmo original, Tobler formalizou o seguinte problema de otimização: minimizar o determinante do Jacobiano de uma superfície, que é resolvido através de um método iterativo de diferenças finitas. O método contudo requer restrições convolutas para ser preciso (Dougenik et al., 1985). Um algoritmo baseado em automatos celulares foi sugerido por Appel et al. (1983), mas devido ao facto de requerer a conversão da topografia numa grelha pode introduzir demasiadas distorções. Os algoritmos mais usados contudo são baseados em dinâmicas da física: Gastner e Newman (2004) utiliza algumas ideias de Appel et al., com ideias da física de fluídos em que é associado aos vários nós, a “quantidade” desejada e estes vão sendo expandidos na direcção dos nós com “quantidades” mais pequenas. O processo repete-se até todos os nós terem as mesmas “quantidades”, e o mapa estar devidamente distorcido. Este método é recente e parece ser cada vez mais utilizado. O algoritmo que ainda continua mais em uso, contudo, e que usamos, vem de Dougenik et al. (1985). Este deforma directamente a topografia. O algoritmo desenvolvido utiliza o conceito de forças: Fij = (pj−qj)pjdij se dij >pj, (pj−qj)((4pj−3dij )/pj)(d2 ij /p2 j) caso contrário, (7.1) em que Fij é a força excercída pelo polígono jno ponto i,pjé a área actual do polígono normalizada entre todos os polígonos, qjé a área da variável desejada, também normalizada, e dij é a distância entre os vários pontos ie os centros do polígono j. O “caso contrário” do sistema é um ajustamento que evita problemas nos casos em que uma coordenada se encontra muito próxima do centro do polígono. Este método é aplicado várias vezes aos vários vértices do mapa, usando um múltiplo da força Fij até o resultado ser visualmente satisfazível. Estes mapas são formas eficientes de comunicar resultados. O mapa original está na Figura 2.2 na página 4. Utilizamos então um cartograma para mostrar as estimativas do impacto das campanhas promocionais ao longo do país, como estimado pela regressão linear (secção 5.1). Para a transformação da Figura 7.7 na página seguinte foi utilizado o software de sistema de informação geográfica QGIS (2009), com base num mapa administrativo LAU 1 (distritos) do Instituto Geográfico Português (IGEO, 2015), adaptado para as 5 regiões “administrativas” da SONAE e submetido às dinâmicas em (7.1).
68 FCUP Modelação de Quotas de Mercado (a) PROMO1 (b) PROMO2 (c) PROMO4 Figura 7.7: Cartogramas do efeito de várias promoções na quota da unidade 51.
FCUP 69 Modelação de Quotas de Mercado Capítulo 8 Conclusão A previsão de séries temporais de quota de mercado ainda é um assunto infante. O problema revelou-se ainda mais severo face à recolha e limitação dos dados. Após uma exploração da literatura e dos dados nos primeiros capítulos, dentro dos dados que nos foram disponibilizados, as campanhas promocionais são as variáveis mais úteis para explicar a variação na quota da empresa. Os modelos de data mining mais convencionais, e ainda os modelos ARIMA, são comparados no Capítulo 7, o modelo que melhor parece descrever os dados são as redes neuronais. Isto devese ao facto das redes neuronais facilmente embeberem efeitos de segunda ordem das variáveis e modelarem qualquer função contínua por partes (Hornik, 1991). Várias outras abordagens menos ortodoxas são avaliadas no Capítulo 6, nomeadamente os vários modelos anteriores são combinados num modelo hierárquico de forma a melhorar os resultados. Além disso, é utilizado um modelo de escolha e analisamos o modelo de atração. O modelo de atração é comum na literatura de estudo de quotas (Cooper e Nakanishi, 1988); para os nossos dados, mostramos que o modelo se desenvolve num modelo logístico, que tinha sido já explorado no Capítulo 5. Os modelos hierárquicos são métodos conhecidos que permitem melhorar a qualidade dum modelo quando se tem informação a vários níveis de agregação (por exemplo, complementado as previsões das vendas nas várias regiões com um modelo do total do país), mas a aplicação a quotas não é de todo trivial. Estudamos no Capítulo 6 uma forma de o fazer. Os modelos de escolha utilizam um método de Monte Carlo para estimar parâmetros na função utilidade dos consumidores e foram alvo dum prémio Nobel em 2000. São modelos recentes que costumam ser aplicados para vendas (Chen e Yang, 2007); esta foi uma tentativa de os utilizar em quotas. A nossa implementação foi desenvolvida em R. Visto que a medida em estudo é fração de vendas brutas, e é possível obter o seu histórico, seria possível abordar este problema desenvolvendo um modelo de previsão para as vendas da worten e um modelo de previsão para as vendas totais do mercado. De facto, numa fase inicial esta metodologia foi também testada mas os erros obtidos eram superiores.
70 FCUP Modelação de Quotas de Mercado Contribuições. Para além duma exploração horizontal da aplicação de várias técnicas à previsão das quotas de mercado, realçamos os seguintes pontos originais: • A utilização de modelos hierárquicos para quotas, cuja aplicação costuma resumir-se a vendas: foi feita esta aplicação porque verificamos que os pesos da quota por região se mantiveram bastante estacionários no período em estudo; • A aplicação de modelos de escolha para a quota de mercado, num contexto mais genérico que uma loja. Trabalho Futuro. Com informação adicional sobre os concorrentes seria possível extrair mais informação, e mais precisa, do modelo da atração ou do modelo de escolha. Por outro lado, com o auxílio de séries geoespaciais, seria interessante estudar o impacto da distância das lojas em relação aos focos urbanos através de modelos gravíticos como o modelo de Huff (Huff, 1964). Poderiam ainda ser desenvolvidos métodos mais robustos para a estimação das vendas brutas da worten e das vendas brutas totais, obtendo posteriormente a quota. Relativamente à análise do desempenho dos modelos poderia ser feita uma análise estatística dos erros cometidos, com o objetivo de avaliar de forma mais exata a diferença entre o seu desempenho nos dados.
FCUP 71 Modelação de Quotas de Mercado Bibliografia Akaike H (1998). “Information Theory and an Extension of the Maximum Likelihood Principle.” Em “Selected Papers of Hirotugu Akaike,” volume 71, pp. 199–213. Springer. doi: 10.1007/ 978-1-4612-1694-0{_}15. (pg. 36) Aksoy S, Haralick RM (2001). “Feature normalization and likelihood-based similarity measures for image retrieval.” Pattern Recognition Letters,22(5), 563–582. doi: 10.1016/S0167-8655(00) 00112-4. (pg. 7) Almeida LB (1997). “Multilayer perceptrons.” Handbook of Neural Computation,Oxford University Press,UK, pp. 1–30. (pg. 43) Appel A, Evangelisti C, Stein A (1983). “Animating Quantitative Maps with Cellular Automata.” IBM Technical Discovery Bulletin. (pg. 67) Bell DE, Keeney RL, Little JD (1975). “A Market Share Theorem.” Journal of Marketing Research, 12(2), 136–141. (pg. 19) Ben-Akiva M, Bierlaire M (1999). “Discrete Choice Methods and their Applications to Short Term Travel Decisions.” Em “Handbook of Transportation Science. Kluwer,” pp. 5–33. Springer. doi: 10.1007/978-1-4615-5203-1{_}2. (pg. 20) Brockwell PJ, Davis RA (1987). Time Series: Theory and Methods. Springer Series in Statistics. Springer New York. doi: 10.1007/978-1-4899-0004-3. (pg. 21) Brockwell PJ, Richard A Davis (2002). Introduction to Time Series and Forecasting. Springer Texts in Statistics. Springer New York. doi: 10.1007/b97391. (pg. 23), (pg. 24), (pg. 32) Chen Y, Yang S (2007). “Estimating Disaggregate Models Using Aggregate Data Through Augmentation of Individual Choice.” Journal of Marketing Research,44(4), 613–621. doi: 10.1509/jmkr.44. 4.613. (pg. 2), (pg. 20), (pg. 52), (pg. 53), (pg. 55), (pg. 57), (pg. 69) Chib S, Greenberg E (1995). “Understanding the Metropolis-Hastings Algorithm.” The American Statistician,49(4), 327–335. doi: 10.1080/00031305.1995.10476177. (pg. 56) Cleveland RB, Cleveland WS, McRae JE, Terpenning I (1990). “STL: A seasonal-trend decomposition procedure based on loess.” Journal of Official Statistics,6(1), 3–73. doi: 10.1016/j.jnca.2015.06. 008. (pg. 25), (pg. 26) Cleveland WS (1979). “Robust Locally Weighted Regression and Smoothing Scatterplots.” Journal of the American Statistical Association,74(368), 829–836. doi: 10.2307/2683591. (pg. 25)
72 FCUP Modelação de Quotas de Mercado Cooper LG, Nakanishi M (1988). Market-Share Analysis. Springer. doi: 10.13140/2.1.1004.6402. (pg. 2), (pg. 19), (pg. 49), (pg. 50), (pg. 51), (pg. 69) Cowpertwait PS, Metcalfe AV (2009). “State Space Models.” Em Springer (ed.), “Introductory Time Series with R,” pp. 229–246. Springer New York. doi: 10.1007/978-0-387-88698-5{_}12. (pg. 22), (pg. 28), (pg. 29) Cryer JD, Chan KS (2008). Time Series Analysis. Springer Texts in Statistics. Springer New York. doi: 10.1007/978-0-387-75959-3. (pg. 22), (pg. 32) Dougenik JA, Chrisman NR, Niemeyer DR (1985). “An Algorithm to Construct Continuous Area Cartograms.” The Professional Geographer,37(1), 75–81. doi: 10.1111/j.0033-0124.1985.00075. x. (pg. 67) Faraway JJ (2006). Extending the linear model with R: Generalized Linear, Mixed Effects and Nonparametric Regression Models. Chapman and Hall/CRC. (pg. 37), (pg. 44) Fritsch S, Guenther F, following earlier work by Marc Suling (2012). neuralnet: Training of neural networks. R package version 1.32. (pg. 44) Gastner MT, Newman MEJ (2004). “From The Cover: Diffusion-based method for producing densityequalizing maps.” Proceedings of the National Academy of Sciences of the United States of America,101(20), 7499–7504. doi: 10.1073/pnas.0400280101. (pg. 67) Granger C (1979). “Seasonality: causation, interpretation, and implications.” Em A Zellner (ed.), “Seasonal Analysis of Economic Time Series,” pp. 33–56. NBER. (pg. 24) Greene WH (2011). Econometric Analysis. Pearson Education Limited (Verlag). (pg. 15) Gujarati DN (2004). Basic Econometrics. McGraw Hill. (pg. 30), (pg. 31), (pg. 36) Haitovsky Y (1969). “Multicollinearity in regression analysis: Comment.” The Review of economics and statistics, pp. 92–107. doi: 10.2307/1926450. (pg. 11) Hand D, Mannila H, Smyth P (2000). Principles of data mining. Cambridge University Press. (pg. 40) Hornik K (1991). “Approximation capabilities of multilayer feedforward networks.” Neural Networks, 4(2), 251–257. doi: 10.1016/0893-6080(91)90009-T. (pg. 44), (pg. 69) Hotelling H (1929). “Stability in Competition.” The Economic Journal,39(153), 41. doi: 10.2307/ 2224214. (pg. 17) Huff DL (1964). “Defining and Estimating a Trading Area.” Journal of Marketing,28(3), 34. doi: 10.2307/1249154. (pg. 17), (pg. 70) Huff DL (2003). “Parameter Estimation in the Huff Model.” ArcUser, (October-December 2003), 3. (pg. 18) Hyndman RJ (2014). “Forecasting: Principles & Practice.” URL: http://robjhyndman.com/uwafiles/ fpp-notes.pdf. (pg. 14)
FCUP 73 Modelação de Quotas de Mercado Hyndman RJ, Ahmed Ra, Athanasopoulos G, Shang HL (2011). “Optimal combination forecasts for hierarchical time series.” Computational Statistics & Data Analysis,55(9), 2579–2589. doi: 10.1016/j.csda.2011.03.006. (pg. 64) IGEO (2015). “Mapa LAU de Portugal, Instituto Geográfico Português.” URL: http://www.gadm.org, visitado a 15 de janeiro de 2015. (pg. 67) INE (2011). “Poder de compra per capita por Localização geográfica (NUTS - 2002); Bienal - INE.” (pg. 5), (pg. 7) INE (2013). “População média anual residente (Nº) por Local de residência (NUTS - 2013). Sexo e idade; Anual - INE, Estimativas Anuais da População Residente.” (pg. 5), (pg. 7) Kohavi R (1995). “A Study of Cross-Validation and Bootstrap for Accuracy Estimation and Model Selection.” Em “IJCAI’95 Proceedings of the 14th international joint conference on Artificial intelligence - Volume 2,” pp. 1137–1143. Morgan Kaufmann Publishers Inc. (pg. 15) Kotler P (1984). Marketing Management: Analysis, Planning and Control. Prentice-Hall. (pg. 18) Kwiatkowski D, Phillips PC, Schmidt P, Shin Y (1992). “Testing the null hypothesis of stationarity against the alternative of a unit root.” Journal of Econometrics,54(1-3), 159–178. doi: 10.1016/ 0304-4076(92)90104-Y. (pg. 31) Leeflang PSH, Reuyl JC (1984). “On the Predictive Power of Market Share Attraction Models.” Journal of Marketing Research,21(2), 211. doi: 10.2307/3151703. (pg. 17) Lira SA, Neto AC (2006). “Coeficientes de correlação para variáveis ordinais e dicotómicas derivados do coeficiente linear de pearson.” Ciência & Engenharia,15, 45–53. (pg. 11) Meyer D (2014). “Support Vector Machines: The Interface to libsvm in package e1071.” (pg. 47) Naert P, Weverbergh M (1981). “On the Prediction Power of Market Share Attraction Models.” Journal of Marketing Research,18(2), 146. doi: 10.2307/3150949. (pg. 51) Nalbantov GI, Franses PH, Groenen PJF, Bioch JC (2010). “Estimating the Market Share Attraction Model using Support Vector Regressions.” Econometric Reviews,29(5-6), 688–716. doi: 10.1080/ 07474938.2010.481989. (pg. 51) Philips PCB, Perron P (1988). “Testing for a unit root in time series regression.” Biometrika,75(2), 335–346. doi: 10.1093/biomet/75.2.335. (pg. 31) QGIS (2009). “Geographic Information System.” URL: http://qgis.osgeo.org. (pg. 67) R Core Team (2015). R: A Language and Environment for Statistical Computing. R Foundation for Statistical Computing, Vienna, Austria. Revelle W (2015). psych: Procedures for Psychological, Psychometric, and Personality Research. R package version 1.5.6. (pg. 12) Rizopoulos D (2013). ltm: Latent Trait Models under IRT. R package version 1.0-0. (pg. 11)
74 FCUP Modelação de Quotas de Mercado Sarma DD (2009). Geostatistics with Applications in Earth Sciences. Springer. doi: 10.1007/ 978-1-4020-9380-7. (pg. 18) Seltman HJ (2015). “Experimental Design and Analysis.” URL: http://www.stat.cmu.edu/{~}hseltman/ 309/Book/Book.pdf. (pg. 36) Shumway RH, Stoffer DS (2011). Time Series Analysis and Its Applications With R Examples. Springer. doi: 10.1007/978-1-4419-7865-3. (pg. 29), (pg. 31) Smola AJ, Sch B, Schölkopf B (2004). “A Tutorial on Support Vector Regression.” Statistics and Computing,14(3), 199–222. doi: 10.1023/B:STCO.0000035301.49549.88. (pg. 46) Tobler WR (1973). “A Continuous Transformation Useful for Districting.” Annals of the New York Academy of Sciences,219(1), 215–220. doi: 10.1111/j.1749-6632.1973.tb41401.x. (pg. 67) Trapletti A, Hornik K (2013). tseries: Time series analysis and computational finance. R package version 0.10-32. (pg. 31) Viton PA (2010). “Derivation of the Logit Choice Probabilities.” URL: http://facweb.knowlton. ohio-state.edu/pviton/courses2/crp5700/logit.pdf. (pg. 53)