Extração de conhecimento com a data mining na indústria têxtil.
Full text
Dissertação de Mestrado em Economia e Administração de Empresas Extração de Conhecimento com Data Mining na Indústria Têxtil Sérgio Luís Neves Almeida [email protected] Orientada por Prof. Doutor Carlos Manuel Milheiro de Oliveira Pinto Soares Setembro 2012
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário i Agradecimentos “O único lugar onde Sucesso vem antes do Trabalho é no Dicionário." (Albert Einstein) Quero agradecer aos meus pais, que na sua simplicidade me mostraram que respeito, dignidade e honestidade são os principais valores que um homem deve ter na sua vida. Eles sempre me apoiaram e incentivaram em todas as minhas decisões, mesmo tendo eles que fazer vários sacrifícios para que eu pudesse realizar os meus sonhos. Ao meu orientador Professor Doutor Carlos Soares, pelo apoio, amizade, confiança, compreensão e orientação, tanto académica como pessoal. À Professora Doutora Aurora Teixeira, que me orientou conjuntamente com o Professor Doutor Carlos Soares numa fase inicial deste trabalho, e pela qual possuo uma verdadeira admiração. Ao Professor Doutor Abel Fernandes, diretor deste Curso, por me ter presenteado com todo o seu apoio, disponibilidade e conhecimentos, ao longo deste meu percurso. Ao LIAAD - Laboratório de Inteligência Artificial e Apoio à Decisão, unidade associada do INESC TEC - INESC Tecnologia e Ciência, que me recebeu de forma acolhedora, oferecendo espaço e meios que permitiram a realização deste trabalho. À empresa Bivolino por disponibilizar de forma simpática e compreensiva os dados que foram a base prática do presente estudo. À Júlia, que com a sua meiguice e carinho sempre me encorajou nos meus objetivos, não me deixando ser vencido pelo desânimo de momentos difíceis. À minha família (particularmente aos meus primos), amigos e colegas que me acompanharam ao longo destes dois anos no Mestrado em Economia e Administração de Empresas, pelos quais nutro uma forte amizade e carinho. Não particularizando ninguém, uma vez que, cada um na medida em que lhe foi possível me acolheu ao longo desta jornada, com a sua dedicação, respeito, partilha e companheirismo. The research leading to these results has received funding from the European Union Seventh Framework Programme (FP7/2007-2013) under grant agreement n° 260169 (Project CoReNet - www.corenet-project.eu).
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário ii Resumo O sucesso do negócio da indústria têxtil depende em boa medida dos produtos oferecidos, em conjunto com a rapidez de resposta face às variações da procura, sendo esta em parte definida pelos estilos de vida dos consumidores. Neste sentido, o estudo comportamental de hábitos e tendências de compra podem proporcionar modelos capazes de integrar os sistemas de apoio à decisão das empresas. A descoberta de tais modelos emerge da necessidade que as empresas possuem em otimizar recursos, mediante o direcionamento das suas estratégias para a satisfação do cliente, a rentabilização de recursos e consequente sucesso empresarial. As técnicas de Data Mining podem em boa medida ser utilizadas no desenvolvimento de modelos baseados em dados e experiências passadas tendo em vista a obtenção de futuros benefícios através de novo conhecimento. Neste enquadramento várias áreas têm sido alvo de aplicação das referidas técnicas no desenvolvimento de modelos específicos para os respetivos problemas. O caso particular da indústria do vestuário não é exceção, pois têm sido investigadas técnicas baseados em Data Mining para providenciar conhecimento que permita melhorar os modelos de vendas. Não obstante, a descoberta de modelos científicos (baseados em algoritmos de descoberta de subgrupos de Data Mining), capazes de caracterizar subgrupos com distribuições raras não tem sido efetuada nesta área. Neste contexto, a presente dissertação pretende contribuir na pesquisa de vários modelos para uma área por explorar na indústria do vestuário. Foi aplicada uma técnicas de Data Mining, mais concretamente uma técnica de descoberta de subgrupos baseada no algoritmo CN2-SD, para encontrar subgrupos raros e interessantes numa base de dados cedida por uma empresa fabricante de vestuário por medida. Os resultados comprovam que é possível obter conhecimento útil para o apoio à decisão na indústria têxtil usando técnicas de descoberta de subgrupos. Palavras-chave: Processos de Extração de Conhecimento; KDD; Data Mining; Subgroup Discovery; Descoberta de Subgrupos; CN2-SD; Indústria Têxtil; Indústria do vestuário.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário iii Abstract The business success of the textile industry largely depends on the products offered and on the speed of response to the variations in demand, induced by changes in consumer lifestyles. The study of behavioral habits and buying trends can provide models that can be integrated into the decision support systems of companies. The discovery of such models arises from the need that companies have to optimize resources by designing their strategies to achieve customer satisfaction, maximize resources and, consequently, reach business success. Data Mining techniques can be used to develop models based on past experiences and data with the goal of obtaining future benefits through new knowledge. Several areas have been targeted for application of these techniques in the development of models that are suitable for their problems. The particular case of the textile industry is no exception. Data Mining techniques have been developed to provide knowledge to improve sales models. However, the discovery of scientific models based on subgroup discovery algorithms, that characterize subgroups of observations with rare distributions, has not been made in this area. In this context, this study aims to contribute to the research of several models for an unexplored area in the textile industry. A Data Mining technique, more precisely a subgroup discovery method based on the algorithm CN2-SD, was used to find rare and interesting subgroups on a database provided by a manufacturer of custom-made clothing. The results show that it is possible to obtain knowledge that is useful for decision support in the textile industry using subgroup discovery techniques. Keywords: Knowledge Extraction Processes; KDD; Data Mining; Subgroup discovery; CN2-SD; Textile Industry.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário iv Índice Agradecimentos ............................................................................................................ i Resumo ....................................................................................................................... ii Abstract ..................................................................................................................... iii Índice. ......................................................................................................................... iv Índice de Tabelas ........................................................................................................ vi Índice de Figuras ....................................................................................................... vii Abreviaturas .............................................................................................................viii 1. Introdução ............................................................................................................... 1 2. Extração de Conhecimentos de Dados e Descoberta de Subgrupos ...................... 3 2.1. Data Mining de acordo com CRISP-DM ............................................................. 4 2.2. Data Mining e a Descoberta de Subgrupos .......................................................... 7 2.2.1. Definição de Descoberta de Subgrupos ........................................................8 2.2.2. Principais Elementos dos Algoritmos de Descoberta de Subgrupos ............ 10 2.2.3. Algoritmos aplicados na Descoberta de Subgrupos..................................... 11 2.2.3.1. Algoritmos baseados em Classificação ................................................. 12 2.2.3.2. Algoritmos baseados em Associação .................................................... 15 2.2.3.3. Algoritmos Evolutivos .......................................................................... 16 2.3.4. Algoritmos adequados ao presente caso de estudo ...................................... 17 2.4. Aplicação de Data Mining em diversos casos práticos ...................................... 18 2.4.1. Descoberta de Subgrupos na Medicina ....................................................... 18 2.4.2. Descoberta de Subgrupos na Bioinformática .............................................. 19 2.4.3. Descoberta de Subgrupos no Marketing ..................................................... 20 2.4.4. Descoberta de Subgrupos em e-learning .................................................... 20 2.4.5. Descoberta de Subgrupos em outras aplicações .......................................... 21
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário v 2.4.6. Síntese de aplicações dos Algoritmos CN2-SD, RSD e APRIORI-SD ........ 21 3. A Descoberta de Subgrupos e o Algoritmo CN2-SD ............................................ 23 3.1. O Algoritmo por Indução de Regras CN2 ......................................................... 23 3.2. A Heurística de Precisão Relativa Ponderada (WRAcc) ..................................... 24 3.3. A Classificação Probabilística ........................................................................... 24 3.4. O Algoritmo CN2-SD ....................................................................................... 25 3.5. Análise ROC (Receiver Operating Characteristic) ............................................ 27 3.6. Medidas de Avaliação de Subgrupos ................................................................. 29 4. Caso de estudo ....................................................................................................... 32 4.1. Business Understanding .................................................................................... 32 4.2. Data Understanding e Data Preparation .......................................................... 33 4.3. Modelling - Aplicação do Software RapidMiner ................................................ 37 4.4. Evaluation – Interpretação e Avaliação de Resultados ...................................... 40 4.4.1. Subgrupos Pouco Interessantes................................................................... 42 4.4.2. Subgrupos Interessantes ............................................................................. 45 4.4.3. Subgrupos Muito Interessantes ................................................................... 47 4.5. Deployment ....................................................................................................... 50 5. Conclusões ............................................................................................................. 51 Referências ................................................................................................................ 53 Anexos ........................................................................................................................ 59 Anexo A – The Bivolino Company ........................................................................... 60 Anexo B - The CRISP-DM methodology .................................................................. 64 Anexo C - The RapidMiner software ....................................................................... 65 Anexo D – 1ª Fase da Análise Exploratória de Dados .............................................. 66 Anexo E – 2ª Fase da Análise Exploratória de Dados ............................................... 77 Anexo F – Modelo obtido pelo RapidMiner ............................................................. 85 Anexo G – Desvios nas regras do Modelo obtido pelo RapidMiner .......................... 87
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário vi Índice de Tabelas Tabela 1: Matriz de contingência ................................................................................. 29 Tabela 2: Variáveis presentes na base de dados da empresa Bivolino. .......................... 33 Tabela 3: Variáveis consideradas no Software RapidMiner. ......................................... 34 Tabela 4: Intervalos considerados na discretização de variáveis. .................................. 34 Tabela 5: Distribuição de encomendas por País. .......................................................... 35 Tabela 6: Distribuição global de encomendas por género e vales promocionais. .......... 35 Tabela 7: Análise exploratória de dados. ...................................................................... 36 Tabela 8: Regras escolhidas para interpretação e análise. ............................................. 41 Tabela 9: Tabela dos desvios percentuais de subgrupos pouco interessantes. ............... 43 Tabela 10: Tabela dos desvios percentuais de subgrupos interessantes para Marketing. .................................................................................................................................... 45 Tabela 11: Tabela dos desvios percentuais de subgrupos muito interessantes de elevada dimensão. .................................................................................................................... 47 Tabela 12: Tabela dos desvios percentuais de subgrupos muito interessantes de pequena dimensão. .................................................................................................................... 49
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário vii Índice de Figuras Figura 1: Fases do processo Data Mining. .....................................................................5 Figura 2: Exemplo de uma Curva ROC........................................................................ 28 Figura 3: Dados importados para o RapidMiner. .......................................................... 37 Figura 4: RapidMiner Repository. ................................................................................ 38 Figura 5: Processo com o algoritmo CN2-SD no RapidMiner. ..................................... 38 Figura 6: Informação do algoritmo CN2-SD no RapidMiner. ....................................... 39 Figura 7: Tipo de variáveis aceites pelo algoritmo CN2-SD no RapidMiner. ............... 39 Figura 8: RapidMiner aplicado ao presente caso de estudo. ......................................... 40 Figura 9: Resultados obtidos no RapidMiner. .............................................................. 40 Figura 10: Gráfico dos desvios percentuais de subgrupos pouco interessantes.............. 44 Figura 11: Gráfico dos desvios percentuais de subgrupos interessantes para Marketing. .................................................................................................................................... 45 Figura 12: Gráfico dos desvios percentuais de subgrupos muito interessantes de elevada dimensão. .................................................................................................................... 47 Figura 13: Gráfico dos desvios percentuais de subgrupos muito interessantes de pequena dimensão. .................................................................................................................... 49
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário viii Abreviaturas BMI Body Mass Index CRISP-DM Cross Industry Standard Process for Data Mining DM Data Mining DMS Data Mining Server INESC TEC INESC Tecnologia e Ciência INESC Instituto de Engenharia de Sistemas e Computadores KDD Knowledge Discovery in Data LIAAD Laboratório de Inteligência Artificial e Apoio à Decisão MOODLE Modular Object-Oriented Dynamic Learning Environment PET Positron Emission Tomography ROC Receiver Operating Characteristic SD Subgroup Discovery
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 7 Evaluation Neste ponto é pretendida a comparação e avaliação dos resultados obtidos com os modelos obtidos com a intenção de determinar se ainda existem pontos-chave por considerar na resolução do problema proposto. Deployment Considerada a etapa final, é pretendido que os modelos concebidos sejam capazes de receber novos dados com vista à produção de relatórios finais que permitam a tomada de decisões estratégicas que favoreçam o desenvolvimento da área em estudo, o que poderá implicar a revisão de projetos com base em resultados conseguidos no ciclo de Data Mining. 2.2. Data Mining e a Descoberta de Subgrupos Data Mining é referido por Fayyad et al. (1996a), como sendo um passo no Processo de Extração de Conhecimento de Dados que identifica padrões ou modelos nos dados previamente preparados e tratados, sendo em etapas posteriores avaliados. De acordo com Lee (2003), as aplicações de Data Mining na pesquisa e identificação de padrões válidos trazem consigo benefícios relevantes para o Processo de Extração de Conhecimento de Dados, pois permitem reduzir custos, aumentar lucros e elevar a qualidade de serviços. Importa referir que o Data Mining não elimina a necessidade de conhecimento dos dados e da área de negócio onde se inserem, uma vez que as aplicações de Data Mining descobrem nova informação nos dados, mas não revelam automaticamente o valor dessa informação e de que forma pode ser utilizada para rentabilizar o negócio. De acordo com os dados e objetivo do estudo, podem surgir diferentes tarefas de Data Mining, podendo ser estas aplicadas e classificadas em duas perspectivas (Han et al., 2006):
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 8 • Data Mining por indução descritiva, na qual se descreve e apresentam as características gerais dos dados, ou seja, o objetivo é a descoberta de conhecimento para a classificação da predição. De entre várias tarefas poderão ser mencionadas a classificação, regressão, series temporais e a descoberta de subgrupos (dependendo do tipo de algoritmo); • Data Mining por indução preditiva, o qual consiste na construção de modelos, realização de inferências e/ ou predição do comportamento de novos dados. No que diz respeito às tarefas mais utilizadas podem-se referir a associação de regras, sumarização e a descoberta de subgrupos (dependendo do tipo de algoritmo). Kloesgen (1996) refere a descoberta de subgrupos como uma técnica para extração de padrões relativamente a uma determinada variável de interesse (Class value ). Esta técnica encontra-se algures entre a indução descritiva e preditiva, uma vez que o seu objetivo é a identificação de subconjuntos para descrever relações entre variáveis independentes e um determinado valor na variável de interesse (Class value ). Neste sentido, os algoritmos utilizados nesta tarefa devem identificar e pesquisar subgrupos para cada um dos valores ou classes que a variável de interesse pode assumir. Existe uma considerável variedade de tarefas de Data Mining, sendo de acordo com (Berry, 2004) as tarefas mais comuns: Classificação, Clustering, Regressão, Previsão e Associação. Estas tarefas não serão abordadas nem clarificadas uma vez que o presente estudo irá utilizar outra tarefa Designada por descoberta de subgrupos (Subgroup Discovery), a qual será seguidamente abordada. 2.2.1. Definição de Descoberta de Subgrupos Kloesgen (1996) e Wrobel (1997) apresentam a descoberta de subgrupos como uma técnica de Data Mining para a descoberta de relações interessantes entre diferentes objetos, relativamente a determinadas propriedades de uma variável de interesse. Os modelos teóricos anteriormente existentes não conseguiam atingir este propósito, sendo que, tal como Kloesgen (1996) refere era permanente a necessidade de modelos simples
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 9 associados a técnicas estatísticas capazes de procurar de relações ou padrões de raridade. Neste sentido, na descoberta de subgrupos, partimos do princípio que temos uma população de indivíduos (objetos, clientes, …) assim como as propriedades desses indivíduos nos quais estamos interessados (Wrobel, 2001). A tarefa de descoberta de subgrupos consiste na descoberta de subgrupos (o maior possível) dessa população que são estatisticamente mais interessantes, ou seja que revelam distribuições estatísticas com características raras relativamente à distribuição global da propriedade em estudo (Wrobel, 2001). Lavrac (2005) também refere que a tarefa supracitada pretende identificar subgrupos da população que são estatisticamente relevantes, ou seja subgrupos nos quais existem relações que correspondem a um padrão ou modelo com características estatísticas raras. Neste sentido, Gamberger (2002a) formaliza uma regra (R), a qual consiste na descrição de um subgrupo obtido por indução, da seguinte forma: : Entenda-se por como o valor ou classe da variável de interesse na tarefa de descoberta de subgrupos e por um conjunto de atributos que descrevem a distribuição estatística do subgrupo em causa. A escolha deste tipo de técnica deve-se ao facto de ser a única tarefa que interliga o Data Mining descritivo com o Data Mining preditivo, ou seja a indução descritiva com a indução preditiva (Gamberger et al., 2002a) na descoberta de subgrupos com distribuições que apresentam como medidade de qualidade a raridade da nova distribuição encontrada, coagulando assim com o objetivo desta dissertação, ou seja, com a identificação de grupos de clientes com encomendas de camisas com características diferentes do habitual. Os algoritmos para a descoberta de subgrupos podem ser classificados em 3 grupos: algoritmos baseados em classificação, fazendo parte deste tipo o EXPLORA, MIDOS, SubgroupMiner, SD, CN2-SD e RSD; algoritmos baseados em associação, sendo os
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 10 principais o APRIORI-SD, SD4TS, SD-MAP, DpSubgroup, Merge-SD e IMR; e os algoritmos evolutivos, sendo estes o SDIGA, MESDIF e NMEEF-SD. No intuito de aferir qual o algoritmo mais adequado para o caso em estudo na presente dissertação, serão identificados os elementos que caracterizam os algoritmos, assim como serão também apresentados e revistos bibliograficamente todos os algoritmos anteriormente identificados. 2.2.2. Principais Elementos dos Algoritmos de Descoberta de Subgrupos De acordo com Atzmueller et al. (2004) os elementos que podem ser considerados como mais importantes numa abordagem de descoberta de subgrupos são os seguintes: Tipo da variável de interesse ( ) O tipo de variável da variável de interesse. Podendo esta ser do tipo binário, nominal (ou categórico) e numérico. Neste sentido e para cada tipo de variável, a análise a efetuar poderá ser diferente. No caso de variáveis do tipo binário, a variável de interesse apenas toma dois valores (verdadeiro ou falso). Para variáveis do tipo nominal ou categórica, a variável poderá assumir um número indeterminado de valores, no entanto a filosofia é similar à das variáveis binárias, ou seja encontrar subgrupos para cada valor assumido. Em variáveis numéricas, é necessária uma abordagem diferente, ou seja, poderá ser necessária a divisão da variável em várias classes relativamente à média, ou a discretização num determinado número de intervalos, ou a pesquiza de desvios significantes relativamente às restantes classes assumidas pela variável de interesse, de entre outras possíveis abordagens. Linguagem Descritiva A representação dos subgrupos deverá ser adequada à obtenção de regras interessantes. Estas regras devem ser de simples representação podendo os valores ser representados
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 11 de forma negativa e/ou positiva, por lógica fuzzy assim como através de inequidades ou equidades, de entre outras representações possíveis. Medidas de Qualidade Estas medidas são um fator chave na extração de conhecimento, uma vez que o interesse nos resultados obtidos depende diretamente das mesmas. As medidas de qualidade avaliam a importância e interesse dos subgrupos obtidos. Com isto, existem diversas medidas de qualidade (as quais serão posteriormente abordadas em maior detalhe), no entanto, não existe consenso bibliográfico sobre qual ou quais as mais adequadas para a descoberta de subgrupos (Gamberger et al., 2003a, Kloesgen, 1996, Lavrac et al., 2004a). Estratégia de Pesquiza Tal com as medidas de qualidade a estratégia de pesquiza reveste-se de uma importância crucial na obtenção de resultados, uma vez que a dimensão do espaço de pesquiza possui uma relação exponencial com o número de atributos/variáveis e respectivas classes consideradas. De entre algumas estratégias de pesquiza realçam-se as seguintes: beam search, algoritmos evolutivos e pesquiza em espaços multidimensionais. 2.2.3. Algoritmos aplicados na Descoberta de Subgrupos Existem diversos algoritmos a utilizar na descoberta de subgrupos. Na presente dissertação serão identificados os algoritmos de maior relevância e utilização, assim como a estratégia de pesquiza por eles utilizada. Tais algoritmos podem ser classificados em 3 tipos: algoritmos baseados em classificação, algoritmos baseados em associação e algoritmos evolutivos.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 12 2.2.3.1. Algoritmos baseados em Classificação Vários algoritmos resultantes da adaptação de regras de classificação têm sido desenvolvidos para a descoberta de subgrupos. As regras de classificação tem por objetivo gerarem modelos que consistem num conjunto de regras, as quais induzem propriedades de todas as classes em relação à variável de interesse em estudo. Na descoberta de subgrupos o objetivo é descobrir regras individuais de interesse, com isso é necessário efetuar algumas modificações nas regras de classificação por forma à sua adaptação ao objetivo da descoberta de subgrupos (Gamberger, 2002a). De seguida são apresentados os principais algoritmos resultantes da adaptação de regras de classificação, sendo que os algoritmos EXPLORA e MIDOS encontram-se separados dos restantes algoritmos (baseados em classificação) uma vez que estes foram os primeiros a serem desenvolvidos e utilizam diferentes estratégias de pesquiza de subgrupos (Wrobel, 1997). EXPLORA E MIDOS O EXPLORA e o MIDOS são baseados em classificação e utilizam árvores de decisão. Estes algoritmos podem aplicar uma de duas estratégias de pesquiza (exaustiva e heurística) sendo possível utilizar várias medidas de avaliação da qualidade dos subgrupos encontrados (Wrobel, 1997). As estratégias de pesquiza exaustivas e heurísticas podem ser utilizadas em diversos algoritmos, os quais serão identificados no decorrer da sua apresentação. A estratégia exaustiva avalia as regras que podem gerar os subgrupos de maior qualidade, no entanto se o espaço de procura se tornar demasiado grande não é possível aplicar esta estratégia. Por sua vez a estratégia de pesquiza heurística é utilizada na redução do número de potenciais subgrupos a considerar (Kloesgen, 1996). Sendo o primeiro algoritmo a ser desenvolvido, o EXPLORA utiliza árvores de decisão na extração de regras, as quais são utilizadas na implementação de métodos de verificação estatística (Kloesgen, 1996). Este algoritmo utiliza medidas de qualidade estatística tais como evidência, generalidade, redundância e simplicidade (Kloesgen, 1996).
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 13 O algoritmo MIDOS utiliza o EXLORA em bases de dados multi-relacionais, na procura de subgrupos com distribuição estatística rara (Wrobel, 1997). Duas diferenças significativas deste algoritmo em relação ao EXPLORA são (Wrobel, 1997): Primeiro, apesar de ambos permitirem optar por uma estratégia de pesquiza exaustiva ou heurística, o EXPLORA é utilizado em variáveis categóricas enquanto o MIDOS em variáveis binárias; Segundo, o MIDOS utiliza como medida de qualidade estatística a raridade enquanto o EXPLORA utiliza as outras medidas de qualidade supracitadas (Wrobel, 1997). Na subsecção que se segue, serão abordados os restantes algoritmos de descoberta de subgrupos resultantes da adaptação de regras de classificação, os quais utilizam uma estratégia de pesquiza denominada por beam search. SubgroupMiner, SD, CN2-SD, RSD Os algoritmos que serão de seguida apresentados possuem duas características em comum: A primeira, o facto de todos serem desenvolvidos para variáveis categóricas; A segunda, a estratégia de pesquiza supracitada beam search. A diferença principal entre estes algoritmos situa-se nas medidas de qualidade aplicadas na descoberta de subgrupos, as quais serão identificadas durante a apresentação individual de cada algoritmo. O algoritmo SubgroupMiner é uma extensão do EXPLORA e do MIDOS (Kloesgen et al., 2002). Trata-se de um sistema avançado de descoberta de subgrupos que utiliza regras de decisão e pesquiza interativas, permitindo a utilização de bases de dados de elevada dimensão graças a integração eficiente de bases de dados, hipóteses multirelacionais, interações baseadas em visualização e descoberta de estruturas de subgrupos de causalidade. Este algoritmo pode utilizar diversas medidas de qualidade na verificação dos desvios da distribuição estatística, no entanto a mais usual é o teste binomial (Kloesgen, 1996). O SD obedece a sistema de regras de indução baseadas na variação da amplitude nos algoritmos de estratégia beam search, sendo essa variação orientada por conhecimento prático e científico (Gamberger et al., 2002a). Em vez de definir medidas ótimas para
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 14 descobrir e automaticamente selecionar os subgrupos, o objetivo é proporcionar aos investigadores flexibilidade em permitir a pesquiza num número alargado de soluções ótimas. Na avaliação da qualidade dos subgrupos obtidos são utilizadas vários métodos que não serão aqui descritos, como sejam os métodos Q8, de sensibilidade, de especialidade, de falso alarme, de suporte e de confiança referidos em Gamberger et al. (2002b). O CN2-SD é um algoritmo de descoberta de subgrupos obtido através da adaptação da regra de classificação standard CN2 (Lavrac et al., 2004b). O CN2-SD efetua a indução de subgrupos na forma de regras, modificando e adaptando subgrupos com características raras como medida de qualidade para seleção das regras. Esta abordagem efetua a descoberta de subgrupos mediante as seguintes modificações sobre o CN2 (Lavrac et al., 2004b): Substituição da heurística de pesquiza por uma heurística de regras raras, a qual deverá ser suficientemente genérica e precisa; Incorporação de exemplos com ponderações no algoritmo; Incorporação de exemplos com ponderações na heurística de pesquiza de raridade; E utilizando a classificação probabilística baseada na distribuição por classes dos exemplos abrangidos por regras individuais. Outro algoritmo baseado em classificação que importa referir é o RSD (Relational subgroup discovery) (Lavrac et al., 2003), o qual tem por objetivo a obtenção de subgrupos o mais amplos possível, com uma distribuição estatística tão rara quanto possível em relação à variável em estudo, e diferente o suficiente por forma a conseguir abranger toda a população em análise. Este algoritmo é uma extensão do algoritmo CN2-SD que possibilita a descoberta relacional de subgrupos (Lavrac et al., 2003). Resumindo os aspetos de interesse deste grupo de algoritmos baseados em classificação, deve-se realçar que o SubgroupMiner assume a necessidade de transformação das variáveis para o tipo discreto, uma vez trabalha apenas com variáveis numéricas. Os algoritmos SD, CN2-SD e RSD utilizam heurísticas de pesquiza diferentes que relacionam a raridade e o tamanho nas distribuições dos subgrupos encontrados. Por sua vez, o CN2-SD e RSA, utilizam apenas a raridade, sendo que, apenas o RSD é utilizado para descoberta relacional de subgrupos.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 15 2.2.3.2. Algoritmos baseados em Associação Os algoritmos baseados em regras de associação, tem por objetivo a obtenção de relações entre as variáveis contidas nos dados em estudo. Neste caso, podem aparecer variáveis tanto antecedentes como consequentes da regra. Como na descoberta de subgrupos as variáveis consequentes da regra são prefixadas, só é possível aplicar as regras de associação na descoberta de subgrupos mediante a adaptação das mesmas. De seguida apresentam-se os principais algoritmos baseados em associação. O algoritmo APRIORI-SD é aplicado a variáveis do tipo categóricas e utiliza a raridade como medida de qualidade para as regras induzidas e classificação das distribuições obtidas (Kavsek et al., 2006). Importa realçar que tal como alguns algoritmos baseados em classificação, a APRIORI-SD utiliza a estratégia de pesquiza beam search. O SD4TS é baseado no APRIORI-SD, no entanto utiliza a qualidade do subgrupo para limitar ainda mais o espaço da pesquiza, sendo que a qualidade da medida é preditiva e especificada pelo problema (Mueller et al., 2009). Relativamente à estratégia de pesquiza passível de ser utilizada, esta é apenas a beam search em variáveis categóricas (Mueller et al., 2009). O SD-MAP é um algoritmo de descoberta de subgrupos de estratégia exaustiva para variáveis binárias (Atzmueller et al., 2006), podendo também ser utilizado para variáveis contínuas (Atzmueller et al., 2009). Este algoritmo pode utilizar múltiplas funções de medição de qualidade nos subgrupos obtidos, sendo as mais utilizadas o Piatetshy-Shaphiro, a raridade e o teste binomial (Kloesgen, 1996). O algoritmo DpSubgroup utiliza uma árvore de padrões frequentes para obter subgrupos de forma eficiente, incorporando um estimador otimista aplicável tanto a variáveis binárias como categóricas (Grosskreutz et al., 2008). Grosskreutz et al. (2008) referem também que as medidas de qualidade mais utilizadas neste algoritmo são a PiatetshyShaphiro, a X 2 de Pearson. O Merge-SD é um algoritmo que utiliza grupos de dados contidos no espaço de pesquiza explorando as fronteiras entre as descrições numéricas dos subgrupos (Grosskreutz et al., 2009). É desta forma que o algoritmo lida com dados que possuem atributos numéricos. Através de uma estratégia exaustiva e medidas de qualidade predominantemente Piatetshy-Shaphiro, o Merge-SD explora variáveis contínuas com
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 16 limitações de qualidade, em intervalos fora do limite estabelecido pelos subgrupos (Grosskreutz et al., 2009). Relativamente ao algoritmo IMR, este apresenta-se como uma alternativa na descoberta de subgrupos não redundantes, sendo que deve ser aplicado a variáveis categorias, daí a necessidade tornar discretas as variáveis quando estas são contínuas (Boley et al., 2009). Este algoritmo utiliza uma estratégia de pesquiza heurística, na procura de atributos com descrições equivalentes relativamente à sua extensão na base de dados, em vez de descrições individuais. De acordo com Boley et al. (2009), podem ser utilizadas várias medidas de qualidade, mas a maior parte dos casos de estudo que aplicam este algoritmo afirmam que o mais eficaz é o teste binomial. Dos algoritmos apresentados nesta subsecção, todos são adaptações de outros algoritmos já existentes e todos utilizam árvores de decisão na sua representação. Apenas o Merge-SD e SD-MAP conseguem lidar com variáveis numéricas ou contínuas, para os restantes é necessário tornar discretas as variáveis, o que por vezes é preciso ter em atenção, uma vez que o processo de tornar discretas as variáveis poderá afetar os resultados obtidos. De referir que apenas o algoritmo APRIORI-SD consegue lidar com variáveis categóricas em conjunto com medidas de qualidade de raridade e seguindo uma estratégia de pesquiza beam seach. 2.2.3.3. Algoritmos Evolutivos Os algoritmos evolutivos imitam os princípios da evolução natural com o objetivo de estabelecer processos de pesquiza (Back et al., 1997). Um dos tipos de algoritmos evolutivos mais utilizado são os algoritmos genéticos, os quais são inspirados na evolução natural dos processos sendo inicialmente abordados por Holland (1975). A heurística deste tipo de algoritmos é definida pela função fitness, a qual determina quais são os indivíduos (regras) que serão tidos como membros da nova população no processo de competição (Holland, 1975). O facto anteriormente mencionado torna os algoritmos genéticos muito uteis na descoberta de subgrupos. Os algoritmos evolutivos propostos para a extração de subgrupos são seguidamente apresentados.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 23 3. A Descoberta de Subgrupos e o Algoritmo CN2-SD O algoritmo CN2-SD surge da modificação do algoritmo CN2 (Clark et al., 1989, Clark et al., 1991), visando esta modificação a obtenção de subgrupos com população cuja distribuição apresenta desvios interessantes em relação a distribuição genérica. 3.1. O Algoritmo por Indução de Regras CN2 O algoritmo CN2 pretende efetuar a indução de regras de classificação (Clark et al., 1989, Clark et al., 1991) sob a forma de “if Cond then Class value ”, ou de outra forma, “ “, onde a condição (Cond) refere os atributos/variáveis (e respectivos valores) e Class value refere o valor, categoria ou classe da respectiva variável de interesse. A implementação do CN2 implica duas tarefas principais: • A tarefa de mais baixo nível, a qual efetua uma pesquiza do tipo beam search com a finalidade de encontrar apenas uma regra. Sendo que esta tarefa utiliza a precisão da classificação da regra/condição (Cond) em análise como função heurística; • A tarefa de nível mais elevado, que realiza um procedimento de controlo, o qual executa repetidamente a tarefa de baixo nível para induzir um conjunto de regras. A precisão (accurracy – Acc) da classificação da regra/condição (Cond) é definida como a probabilidade condicionada de um valor da variável de interesse dada a condição ou regra Cond, sendo esta descrita da seguinte forma: | .
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 24 3.2. A Heurística de Precisão Relativa Ponderada ( WRAcc) O algoritmo CN2 aplica uma heurística de pesquiza com precisão relativa ponderada (Weighted Relative Accuracy – WRAcc) (Lavrac et al., 1999, Todorovski et al., 2000). Esta heurística é uma variante da regra de precisão que pode ser aplicada tanto num contexto de indução descritiva como de indução preditiva. De acordo com Wrobel (1997), esta heurística pode ser definida como: . |! Importa referir que, tal como a maior parte deste tipo de heurísticas, esta é constituída por duas componentes/medidas relacionadas entre si, sendo estas: • A medida da generalidade ou tamanho relativo de um subgrupo e; • A medida de raridade da distribuição ou precisão relativa ou seja, a diferença entre a regra de precisão que obedece a | e a precisão standard . Em termos práticos a heurística supracitada define que uma regra é interessante no caso de a sua precisão melhorar em relação à precisão standard ). Outra característica a referir sobre a precisão relativa prende-se com o facto de esta medir a diferença entre os verdadeiros positivos e os verdadeiros positivos esperados. Finalmente e em relação à generalidade, refere-se que esta é utilizada como ponderação, de tal forma que a precisão relativa ponderada deriva da generalidade de uma regra ( e da precisão relativa ( |! ). 3.3. A Classificação Probabilística As regras obtidas por indução podem estar ordenadas ou desordenadas. No caso de as regras estarem ordenadas a sua interpretação processa-se de um forma sequencial, ou
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 25 seja, para a classificação de um exemplo, as regras são testadas de forma sequencial e a primeira regra que cobre o exemplo é utilizada para predição. Já para um conjunto de regras desordenadas, a sua interpretação segue a indução de regras do tipo “if Cond then Class value [ClassDistribution]”, onde ClassDistribution refere a lista dos exemplos que são cobertos pela regra. Na classificação são testadas todas as condições/regras existentes e são guardadas as que se adequam ao exemplo em teste. No caso de o exemplo obedecer a várias regras de predição, então é utilizado um sistema de votação para obter a regra final. Poderá surgir também a situação em que o exemplo não se enquadra em nenhuma regra invocada, neste caso, é utilizada a regra principal (que se adequa a toda a população em estudo). 3.4. O Algoritmo CN2-SD Tal como já referido, o algoritmo CN2-SD deriva da modificação do algoritmo CN2 (Clark et al., 1989, Clark et al., 1991) tendo em vista a obtenção de subgrupos populacionais interessantes. Neste sentido, as principais modificações estão relacionadas com: • A implementação de um algoritmo de cobertura ponderada; • A incorporação de exemplos ponderados na heurística de pesquiza com precisão relativa ponderada (Weighted Relative Accuracy – WRAcc); • A classificação probabilística tanto para regras ordenadas como regras desordenadas, e; • A avaliação das regras através da curva ROC. Relativamente à implementação do algoritmo importa referir que uma das lacunas de algoritmos do mesmo tipo do CN2 advém do facto de apenas as primeiras regras geradas podem corresponder a subgrupos interessantes, mas sem garantias de que tal suceda, uma vez que podem não ter medidas de cobertura e significância adequadas para tal (as medidas de qualidade cobertura e significância serão posteriormente abordadas). Neste contexto e como solução ao problema mencionado Gamberger et al. (2002a) propõe um algoritmo com cobertura ponderada, no qual todas as regras geradas
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 26 representam subgrupos populacionais interessantes com medidas de qualidade adequadas. Neste sentido o algoritmo especifica dois esquemas de ponderação, nos quais especifica qual a nova ponderação de cada exemplo com o surgimento de uma nova regra. Os esquemas de ponderação referidos baseiam-se numa ponderação multiplicativa e ponderação aditiva correspondentemente. Tal como o próprio nome sugere, na ponderação multiplicativa o peso atribuído aos exemplos cobertos pela regra decresce de forma multiplicativa. Se o fator multiplicativo for 0 então tem-se o mesmo resultado que o algoritmo CN2 uma vez que não é dada nenhuma ponderação ao conjunto de exemplos em análise. Relativamente à ponderação aditiva a ponderação dada a cada conjunto de exemplos cobertos pela mesma regra é igual a " # $%# &, onde i é o número da iteração. Na primeira iteração de cada exemplo o peso é igual a " # '%# 1&, sendo que nas iterações seguintes a ponderação vai decrescendo de forma proporcional à sua cobertura de regras previamente induzidas. Tal como já foi referido, o CN2-SD incorpora a ponderação dos exemplos na heurística de pesquiza com precisão relativa ponderada (WRAcc). Esta alteração do algoritmo CN2 permite considerar diferentes partes do espaço populacional em cada iteração do algoritmo de cobertura ponderada. Com isto, na computação do WRAcc todas as probabilidades são processadas como frequências relativas, sendo a medida WRAcc modificada a seguinte: )*+ , -, .., . , !, -, / Onde -, é a soma das ponderações de todos os exemplos, , é a soma das ponderações dos exemplos cobertos e , . é a somas das ponderações dos exemplos cobertos correctamente. No algoritmo CN2-SD a regra com maior WRAcc Mod , regra essa que ainda não se encontra como regra final é retirada do espaço de pesquiza para adição de uma nova
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 27 regra que diga respeito a um subgrupo interessante, ressalvando que, todas as regras finais são diferentes. No que diz respeito à classificação probabilística, importa relembrar que o algoritmo CN2-SD não utiliza o mesmo esquema de classificação do algoritmo CN2. Enquanto que o algoritmo CN2 utiliza o número de exemplos cobertos na computação das regras de classificação da distribuição, o CN2-SD trata a classificação da distribuição em termos de probabilidades, através da frequência relativa estimada. Em termos de implementação, o CN2-SD utilizado por Lavrac et al. (2002) foi implementado em Java, enquanto que o CN2-SD utilizado por Lavrac et al. (2004b) foi implementado em C. Esta última implementação é mais eficiente e menos restritiva, uma vez que, permite a utilização da variável de interesse do tipo categórico enquanto que a implementação em Java apenas permitia como variável de interesse uma variável binária. 3.5. Análise ROC (Receiver Operating Characteristic) Para identificar um subgrupo como interessante, é necessário identificar e interpretar as características do subgrupo, e para isso, é necessário encontrar meios que descrevam os subgrupos encontrados sendo a visualização de subgrupos a mais utilizada. Segundo Kralj et al. (2005), as principais técnicas de visualização de subgrupos disponíveis atualmente são as seguintes: gráfico de setores, diagrama de caixas, visualização da distribuição de um atributo contínuo, análise da curva ROC e gráfico de barras. A curva ROC é a técnica mais utilizada como um meio de avaliação dos resultados obtidos pelo processo de descoberta de subgrupos, visto que possui uma visualização intuitiva (Kralj et al., 2005). A utilização da curva ROC (Receiver Operating Characteristics) na descoberta de subgrupos consiste num espaço de visualização composto por um gráfico de duas dimensões, no qual se ilustra o grau de interesse de cada subgrupo descoberto. Para a avaliação do grau de interesse, utiliza-se a medida FPr (false positive rate) no eixo x do gráfico e a medida TPr (true positive rate) no eixo y do gráfico. A TPr corresponde a
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 28 taxa de amostras de um subgrupo que pertence a uma dada classe/categoria, atribuída através da variável de interesse, em relação ao total de amostras pertencentes à classe. A FPr corresponde a taxa de amostras do subgrupo que não pertence a tal classe. Figura 2: Exemplo de uma Curva ROC. Na figura anterior ilustra uma curva ROC que contém 4 subgrupos. O gráfico possui uma linha diagonal que o divide em duas partes, os subgrupos que estiverem próximos dessa linha devem ser considerados como não interessantes, pois a linha representa igualdade nos valores de TPr e FPr. Esta igualdade torna o subgrupo desinteressante, pois expressa a existência uma frequência similar de amostras das duas classes no subgrupo. Importa referir que a medida WRAcc é apropriada para a análise da qualidade de um subgrupo e perfeitamente visível numa curva ROC, uma vez que que o valor dessa medida é proporcional à distância desde a diagonal do espaço ROC até ao ponto do subgrupo.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 29 3.6. Medidas de Avaliação de Subgrupos Várias medidas podem ser utilizadas para avaliar separadamente cada uma das regras que constituem os subgrupos encontrados. Nesse contexto, as regras devem ser avaliadas com o objetivo de saber quais são as melhor sustentadas pelos dados, ou podem ser avaliadas com o intuito de selecionar as que oferecem algum conhecimento surpreendente ou inesperado. Algumas das medidas de avaliação de regras que são baseadas na matriz de contingência para cada regra (Freitas, 1999) são de seguida apresentadas. Tabela 1: Matriz de contingência Nesta matriz, B refere o conjunto de exemplos para os quais a condição da regra é verdadeira e o seu complemento B denota o conjunto de exemplos para os quais a condição da regra é falsa. Analogamente para H e para o complemento de H. Utilizando por base a matriz de contingência, e possível definir as seguintes medidas de avaliação de regras: • Precisão (Acc); • Erro (Err); • Confiança Negativa (NegRel); • Sensibilidade (Sens); • Especificidade (Spec);
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 30 • Cobertura (Cov) e; • Suporte (Sup). Para além das medidas de avaliação anteriormente referidas existem outras igualmente importantes, não obstante e uma vez que estamos a tratar da descoberta de subgrupos as medidas de avaliação devem ser distinguidas entre medidas de avaliação descritivas e preditivas: • As medidas de avaliação descritivas são utilizadas na análise da qualidade individual de cada regra obtida, sendo que são estas as mais apropriadas para a descoberta de subgrupos, uma vez que, na descoberta de subgrupos induzem-se padrões individuais com interesse; • As medidas de avaliação preditivas são utilizadas adicionalmente às medidas descritivas. Estas medidas avaliam um conjunto de regras através da interpretação da descrição de um subgrupo sob a forma de modelo preditivo. Uma vez que o objetivo da descoberta de subgrupos não é a otimização da precisão, não serão abordadas este tipo de medidas na presente dissertação. Importa referir que, o algoritmo CN2-SD também consegue efetuar a indução preditiva ao induzir um classificador. Medidas de Avaliação Descritivas As medidas de avaliação descritivas pretendem avaliar individualmente o nível de interesse de cada subgrupo identificado, sendo as principais medidas: • Cobertura (Coverage – Cov); • Suporte (Support – Sup); • Tamanho (Size – SIZE); • Significância (Significance – Sig) e; • Raridade (Unusualness – WRAcc).
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 31 Irá ser abordada apenas a medida de raridade (WRAcc) uma vez que se trata da medida utilizada pelo algoritmo CN2-SD e cuja justificação de escolha foi apresentada em seções anteriores. Raridade (Unusualness – WRAcc) Esta medida é calculada com base na média da WRAcc de todas as regras, ou seja: 1 0 1 $ 2 $3# Tal como já foi explicado em seções anteriores, esta medida é a mais apropriada para medir a raridade das distribuições dos subgrupos, uma vez que é proporcional à distância vertical desde a diagonal no espaço ROC e possui uma relação precisãogeneralidade adequada a esta tarefa. Precisão vs. Generalidade A precisão tem como objetivo minimizar o número de exemplos incorretamente cobertos por uma regra. Entretanto, isso pode levar a casos patológicos, como uma regra muito precisa que cobre apenas um único exemplo. Além disso, dadas duas regras com a mesma precisão, a regra mais geral das duas, ou seja, a que cobre mais exemplos, é a mais preferível. Uma forma de gerir o compromisso entre precisão e generalidade é utilizar medidas que efetuem a poderão da precisão, o que sucede na medida de raridade WRAcc.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 32 4. Caso de estudo Tal como já abordado na seção anterior a metodologia utilizada é a CRISP DM. Sendo assim, serão descritos os passos que levaram até à conclusão do presente estudo, começando com Business Understanding e terminando na fase de Evaluation, uma vez que não foi realizado o Deployment. 4.1. Business Understanding O presente estudo encontra-se ligado ao sector têxtil, o qual está associado aos estilos de vida dos consumidores, sendo que a variedade de produtos oferecidos e rapidez de resposta perante variações da procura podem ser determinantes na sustentação do sucesso do negócio. Neste sentido a empresa Bivolino (empresa fabricante de vestuário por medida) pretende melhorar a rentabilidade, eficiência, produtividade e antecipação em relação aos seus clientes e respectivas tendências. Neste sentido e com o intuito de identificar e tomar consciência das tendências de determinados grupos populacionais, a empresa Bivolino cedeu uma base de dados com 8.056 encomendas de clientes. Pretende-se então, através do tratamento de dados, proporcionar conhecimento válido que permita um melhor direcionamento de esforços e estratégias de atuação da empresa principalmente ao nível do Design, mas também ao nível de Marketing. Os modelos a encontrar são modelos baseados em algoritmos de descoberta de subgrupos capazes de identificar subgrupos com distribuições raras, mas passíveis de descrever. A técnica de descoberta de subgrupos será baseada no algoritmo CN2-SD (ver capítulo 3), no qual a principal medida de qualidade é a raridade (unusualness) relativamente a regras ou modelos que descrevam subgrupos populacionais com encomendas cujas características obedecem a distribuições diferentes de média global. Os resultados serão avaliados segundo vários critérios, sendo estes: tamanho dos subgrupos, desvios da distribuição relativamente às características das encomendas, utilidade do ponto de vista do Design de novos produtos e apoio às estratégias de Marketing e capacidade em providenciar novo conhecimento que não seja trivial ou óbvio. É importante sublinhar que o objectivo
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 39 poderia ser evitado tratando previamente os dados por exemplo numa folha de cálculo do Microsoft Excel. Conforme explicado na seção 2.3.4 do capítulo 2, o algoritmo selecionado foi o CN2SD. O algoritmo que está disponível no RapidMiner para descoberta de subgrupos com medida de qualidade WRAcc apenas permite definir como variável de interesse uma variável do tipo binário, sendo que no presente caso a variável de interesse é o BMI que é uma variável do tipo nominal que pode tomar 5 valores diferentes. No entanto, está disponível em http://kt.ijs.si/petra_kralj/SubgroupDiscovery/rm.html uma extensão do RapidMiner que implementa o operador CN2-SD (figuras 6 e 7). Como se pode ver na figura 7, este operador permite tratar como variável de interesse (label) variáveis binárias (binary) ou variáveis nominais (polynomial). Figura 6: Informação do algoritmo CN2-SD no RapidMiner. Figura 7: Tipo de variáveis aceites pelo algoritmo CN2-SD no RapidMiner.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 40 Colocado o processo a pesquisar modelos, após 3 dias e 2 horas de processamento computacional obteve-se como resultado 54 regras (figuras 8 e 9), as quais se encontram detalhadas no Anexo B. Figura 8: RapidMiner aplicado ao presente caso de estudo. 4.4. Evaluation – Interpretação e Avaliação de Resultados Os resultados obtidos pelo RapidMiner apresentam-se da forma que a figura 9 mostra. VotingModel if Fit = Comfort fit then Morbidly Obese (188 / 743 / 421 / 103 / 5) if Weight = 115-135 then Morbidly Obese (111 / 468 / 15 / 0 / 0) if Affiliate = Retailer 1 and Cuff white = n and Country = uk then Morbidly Obese (178 / 787 / 1005 / 1068 / 24) … else Normal weight correct: 17287 out of 74318 training examples. Figura 9: Resultados obtidos no RapidMiner.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 41 Das 54 regras obtidas e analisadas serão apresentadas 19 regras relevantes para o presente estudo, sendo estes as que constam na tabela 8, a qual foi transformada para valores percentuais em relação ao total de 7066 encomendas. BMI Modelo (CN2-SD) Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Tamanho do Subgrupo (%) 3,5% 20,3% 32,1% 42,9% 1,3% 100,0% 1. - if Country = uk then Obese 4,8% 23,8% 32,7% 37,5% 1,2% 60,5% 2. - if Fit = Regular then Obese 1,3% 16,3% 38,5% 43,0% 0,9% 56,3% 4. - if Fit = Regular and Collar white = n and Cuff white = n then Normal weight 1,3% 15,7% 38,5% 43,5% 0,9% 51,5% 7. - if Affiliate = Retailer 1 and Cuff white = n and Country = uk then Morbidly Obese 5,8% 25,7% 32,8% 34,9% 0,8% 43,3% 8. - if Back Yoke contrast = y and Collar size = <36 then Obese 5,7% 26,9% 32,7% 33,9% 0,9% 43,2% 9. - if Cuff = Round Single and Collar white = n and Cuff white = n then Overweight 3,1% 20,3% 30,8% 44,3% 1,4% 40,3% 14. - if Hem = Curved Hem and Fabric = FabricID12186 then Obese 2,3% 16,7% 31,3% 48,4% 1,3% 30,7% 15. - if Age = 35/44 then Overweight 2,7% 17,7% 36,6% 42,3% 0,7% 28,5% 21. - if Placket = Real front and Affiliate = Bivolino then Obese 1,9% 16,0% 33,4% 46,5% 2,3% 23,7% 22. - if Weight = 45-75 then Overweight 0,3% 0,3% 9,7% 84,3% 5,4% 23,1% 23. - if Fit = Super Slim Fit then Normal weight 0,2% 2,1% 19,2% 75,3% 3,2% 22,7% 25. - if Fit = Comfort fit then Morbidly Obese 12,9% 50,9% 28,8% 7,1% 0,3% 20,7% 33. - if Fit = Regular and Weight = 95-115 and Collar white = n and Cuff white = n then Normal weight 0,7% 40,9% 49,8% 8,7% 0,0% 10,6% 36. - if Weight = 115-135 then Morbidly Obese 18,7% 78,8% 2,5% 0,0% 0,0% 8,4% 39. - if Hem = Straight Hem and Fit = Comfort fit and Collar white = n then Overweight 11,8% 56,9% 24,7% 6,6% 0,0% 5,2% 40. - if collar = Italian Semi-Spread and Affiliate = Bivolino and Pocket = No Pocket and Collar white = n and Cuff white = n then Obese 0,6% 5,6% 26,7% 64,6% 2,5% 5,0% 46. - if Heightcm = 200/210 and Weight = 115135 and Collar white = n then Overweight 0,0% 65,6% 34,4% 0,0% 0,0% 0,5% 47. - if collar = Classic Point and Heightcm = 190/200 and Pocket = Mitred and Weight = 115135 and Placket = Real front and Cuff white = n then Overweight 0,0% 87,0% 13,0% 0,0% 0,0% 0,3% 49. - if Heightcm = 160/170 and Weight = 75-95 and Placket = Folded and Hem = Curved Hem then Obese 0,0% 33,3% 66,7% 0,0% 0,0% 0,1% else Normal weight Tabela 8: Regras escolhidas para interpretação e análise. Cada uma das regras da tabela 8 descreve um subgrupo populacional cuja distribuição difere da distribuição de população. Com isso, torna-se necessário calcular as diferenças percentuais da distribuição do subgrupo encontrado em relação à distribuição total que engloba todas as encomendas. Para além do cálculo supracitado e para melhor interpretar e avaliar os resultados do ponto de vista da utilidade para o Design de novos produtos, procedeu-se à interpretação e análise dos subgrupos encontrados de acordo com os seguintes critérios:
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 42 Subgrupo pouco interessante: o Subgrupo óbvio do ponto de vista do senso comum; o Subgrupo cuja distribuição apresenta um desvio pequeno em relação à distribuição total de encomendas; o Subgrupo demasiado pequeno (menor do que 0,5% das encomendas); • Subgrupo interessante para Marketing uma vez que providencia informação útil nessa área, nomeadamente ao nível do País, entidade e configurador onde as encomendas são efectuadas. Este tipo de informação é menos interessante para o Design porque não contém informação sobre as caracteríticas das camisas encomendadas; • Subgrupo muito interessante para Design: o Subgrupo que representa pelo menos 30% das encomendas; o Subgrupo que representa pelo menos 5% das encomendas, e apresenta desvios percentuais relevantes (elevados) em relação à distribuição total de encomendas. 4.4.1. Subgrupos Pouco Interessantes Recorrendo à tabela 9 e ao gráfico da figura 10 as regras nº 2, 22, 23 e 36 avaliaram-se como subgrupos pouco interessantes, uma vez que as regras sugerem conhecimentos óbvios do ponto de vista do senso comum: • A regra nº 2 refere que existe um subgrupo no qual a variável fit é igual a regular e os desvios indicam menos população morbidamente obesa, obesa e com baixo peso. Este subgrupo é pouco interessante dado que genericamente a escolha de camisas com fit igual a regular é tipicamente escolhida por população com excesso de peso porque se ajusta de forma mais elegante ao corpo sem evidenciar o peso em excesso. • A regra nº 22 refere que existe um subgrupo no qual a variável weight encontrase entre os 45kg e os 75 kg e os desvios indicam mais população com peso normal e baixo peso. Trata-se pois de uma conclusão óbvia, pois genericamente
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 43 e para a altura média da população o intervalo de peso indicado sugere população considerada com peso normal e baixo peso; • A regra nº 23 apresenta um resultado um pouco semelhante à regra nº 2, pois neste caso o subgrupo encontrado associa-se à variável fit igual a super slim e a desvios que indicam maior população de peso normal e baixo peso, o que tipicamente é constatado. Regra geral são as pessoas com baixo peso e peso normal que preferem roupa justa uma vez que se ajusta de forma elegante ao seu corpo, ou seja, mais uma regra óbvia; • A regra nº 36 apresenta um resultado um pouco semelhante à regra nº 22, mas neste caso o subgrupo encontrado refere weight entre os 115 e os 135 kg com desvios positivos elevados para os morbidamente obesos e obesos, assim como desvios negativos elevados para quem têm excesso de peso, peso normal e baixo peso. Tal facto sugere um conhecimento óbvio de senso comum, pois em termos médios um peso no intervalo indicado sugere problemas de peso. Desvios Avaliação dos Subgrupos Modelo (CN2-SD) Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Pouco Interessante 2. - if Fit = Regular then Obese -62,1% -19,3% 19,9% 0,2% -32,9% Óbvio 22. - if Weight = 45-75 then Overweight -91,1% -98,5% -69,9% 96,6% 322,6% Óbvio 23. - if Fit = Super Slim Fit then Normal weight -94,6% -89,5% -40,1% 75,5% 150,1% Óbvio 36. - if Weight = 115-135 then Morbidly Obese 441,2% 289,0% -92,1% -100,0% -100,0% Óbvio 9. - if Cuff = Round Single and Collar white = n and Cuff white = n then Overweight -9,5% 0,2% -4,0% 3,3% 10,3% Desv. Pequenos < |15%| 46. - if Heightcm = 200/210 and Weight = 115-135 and Collar white = n then Overweight -100,0% 224,0% 7,0% -100,0% -100,0% População Muito Pequena < 0,5% 47. - if collar = Classic Point and Heightcm = 190/200 and Pocket = Mitred and Weight = 115-135 and Placket = Real front and Cuff white = n then Overweight -100,0% 329,4% -59,4% -100,0% -100,0% População Muito Pequena < 0,5% 49. - if Heightcm = 160/170 and Weight = 75-95 and Placket = Folded and Hem = Curved Hem then Obese -100,0% 64,6% 107,5% -100,0% -100,0% População Muito Pequena < 0,5% else Normal weight Tabela 9: Tabela dos desvios percentuais de subgrupos pouco interessantes.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 44 Figura 10: Gráfico dos desvios percentuais de subgrupos pouco interessantes. Continuando com alguns subgrupos pouco interessantes: • Refere-se agora uma regra que desperta pouco interesse dado que os desvios em relação à população total são relativamente pequenos. Trata-se da regra nº 9, na qual o tamanho do subgrupo é superior a 15% mas os desvios indicados são pouco relevantes e em valor absoluto inferiores a 10,3%. Nesta perspectiva torna-se pouco importante discutir um subgrupo cuja distribuição e comportamento se assemelha à população total não obedecendo portanto a uma distribuição tão rara quanto desejado; • Relativamente às regras nº 46, 47 e 49, considera-se que apesar de aparentemente as condições parecerem interessantes, dado que o número de encomendas a que se referem é inferior a 0,5% da amostra total, não se considera que sejam regras que mereçam especial atenção por parte nem do Design de produtos nem de Marketing. -120,0% -70,0% -20,0% 30,0% 80,0% 130,0% 180,0% 230,0% 280,0% Obesi. Morbida Obeso Excesso de Peso Peso Normal Baixo Peso 2. - if Fit = Regular then Obese 22. - if Weight = 45-75 then Overweight 23. - if Fit = Super Slim Fit then Normal weight 36. - if Weight = 115-135 then Morbidly Obese 9. - if Cuff = Round Single and Collar white = n and Cuff white = n then Overweight
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 45 4.4.2. Subgrupos Interessantes Nesta subseção são apresentados alguns subgrupos que apesar de serem pouco interessantes do ponto de vista do Design de novos produtos, são interessantes do ponto de vista de Marketing o que se pode verificar pela visualização da tabela 10 e do gráfico da figura 11. Desvios Avaliação dos Subgrupos Modelo (CN2-SD) Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Interessante 1. - if Country = uk then Obese 38,3% 17,3% 1,8% -12,5% -2,6% Para Marketing 7. - if Affiliate = Retailer 1 and Cuff white = n and Country = uk then Morbidly Obese 68,3% 26,9% 2,2% -18,7% -38,5% Para Marketing 15. - if Age = 35/44 then Overweight -20,8% -12,8% 13,9% -1,3% -45,3% Para Marketing 21. - if Placket = Real front and Affiliate = Bivolino then Obese -46,3% -21,1% 3,9% 8,5% 78,4% Para Marketing else Normal weight Tabela 10: Tabela dos desvios percentuais de subgrupos interessantes para Marketing. Figura 11: Gráfico dos desvios percentuais de subgrupos interessantes para Marketing. Alguns dos subgrupos interessantes para Marketing são: • A regra nº 1 refere que no Reino Unido, país que de acordo com a tabela 5 detém 55,6% das encomendas, o desvio indica maior presença de indivíduos morbidamente obesos e obesos e menos com peso normal. Do ponto de vista do Design de novos produtos esta informação parece não ser muito relevante, pois -120,0% -70,0% -20,0% 30,0% 80,0% 130,0% 180,0% 230,0% 280,0% Obesi. Morbida Obeso Excesso de Peso Peso Normal Baixo Peso 1. - if Country = uk then Obese 7. - if Affiliate = Retailer 1 and Cuff white = n and Country = uk then Morbidly Obese 15. - if Age = 35/44 then Overweight
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 46 não refere características das camisas mas apenas dos indivíduos, no entanto do ponto de vista de Marketing, poderá por exemplo sugerir que tipo de clientela alvo a atingir com campanhas de Marketing por forma a incrementar as vendas; • A regra nº 7 indica que para encomendas que advém do Retailer 1 1 (a qual detém 40,2% das encomendas) também advém do Reino Unido (o qual detém 55,6% das encomendas) e não seleccionam punho branco, a tendência é para a população ser mais morbidamente obesa e obesa e menos com peso normal e com baixo peso. Este facto reforça a regra nº 1, dando a informação acrescida de qual a entidade por onde entram as encomendas, o que mais um vez poderá ser útil numa perspectiva de Marketing, na medida em que se toma conhecimento que no Reino Unido, a população que compra camisas da Bivolino, tendencialmente é mais obesa e morbidamente obesa e menos com peso normal e baixo peso, fazendo as suas compras no Retailer 1; • A regra nº 15 sugere a existência de um subgrupo no qual se verifica que na faixa etária entre os 35 e os 44 anos a população tendencialmente desloca-se para o excesso de peso mantendo quase inalterada a população com peso normal. Neste contexto parece que este subgrupo se preocupa mais que o resto da população com questões de obesidade e baixo peso. Neste sentido, esta informação poderá por exemplo direcionar campanhas de Marketing que mostrem preocupação com as mesmas questões; • A regra nº 21 refere um facto curioso, que complementa o que se constata na regra nº 7, ou seja, verifica-se que a população que compra diretamente pela Bivolino escolhe uma carcela do tipo real front e tendencialmente possuem mais baixo peso, o que ao nível da variável BMI é o oposto do que já se tinha visto com a regra nº 7, mais uma vez torna-se interessante do ponto de vista do Marketing saber por onde entram mais encomendas e a que tipo clientela se destina. 1 Por questões de confidencialidade não são mencionadas as designações oficiais dos retalhistas que trabalham com a empresa Bivolino.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 47 4.4.3. Subgrupos Muito Interessantes Interpretando a tabela 11 e o gráfico da figura 12 verificam-se vários subgrupos de dimensão elevada e média, e muito interessantes, nomeadamente no que diz respeito ao Design de novos produtos. Desvios Avaliação dos Subgrupos Modelo (CN2-SD) Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Muito Interessante (Para Design) 4. - if Fit = Regular and Collar white = n and Cuff white = n then Normal weight -61,0% -22,3% 19,9% 1,5% -33,2% População Elevada > 50% 8. - if Back Yoke contrast = y and Collar size = <36 then Obese 63,9% 32,7% 1,9% -21,0% -33,2% População Elevada > 43% 14. - if Hem = Curved Hem and Fabric = FabricID12186 then Obese -34,6% -17,6% -2,6% 12,9% 5,0% População Média > 30% Tabela 11: Tabela dos desvios percentuais de subgrupos muito interessantes de elevada dimensão. Figura 12: Gráfico dos desvios percentuais de subgrupos muito interessantes de elevada dimensão. Analisando de forma mais detalhada os subgrupos de elevada e média população da tabela 11 temos que: -120,0% -70,0% -20,0% 30,0% 80,0% 130,0% 180,0% 230,0% 280,0% Obesi. Morbida Obeso Excesso de Peso Peso Normal Baixo Peso 4. - if Fit = Regular and Collar white = n and Cuff white = n then Normal weight 8. - if Back Yoke contrast = y and Collar size = <36 then Obese 14. - if Hem = Curved Hem and Fabric = FabricID12186 then Obese
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 48 • A regra nº 4 proporciona informação relativamente ao colarinho, punho e fit, sendo que quando o fit é regular, e nem o punho nem o colarinho são brancos a tendência deste grupo é para se desviar para o excesso de peso contra a obesidade mórbida, obesidade e baixo peso. Apesar de esta informação ser apenas mais um complemento à informação da regra nº 2, uma vez que se precisam mais alguns pormenores do produto, os designers poderão aproveitar estes conhecimentos no desenvolvimento de novos produtos; • As regras nº 8 e 9 não apresentam desvios muito elevados mas apenas suficientes, contudo merecem especial enfoque uma vez que definem subgrupos muito relevantes ao nível das características das camisas encomendadas. Por exemplo, a regra nº 8 refere que nesse subgrupo de indivíduos com tamanho de colarinho inferior a 36cm, o back yoke contrast é mais selecionado pelos obesos e morbidamente obesos e menos pelos indivíduos com baixo peso e peso normal. O que numa primeira instância parece um contrassenso, uma vez que, se o colarinho é inferior a 36cm não deveria haver mais população obesa e morbidamente obesa. Verifica-se pois, que se trata de um subgrupo muito específico e interessante que aprecia o contraste da linha de costura. Já a regra nº 14 vai ao detalhe do tipo de tecido escolhido, ou seja, sabe-se que o subgrupo que escolhe bainhas curvas e o tecido FabricID12186 tendencialmente apresentam mais população de peso normal e baixo peso, decrescendo na população com peso acima do normal. Neste sentido, talvez seja este o subgrupo de maior interesse para o Design dada a sua dimensão, desvios e detalhe de informação apresentada. Para terminar a interpretação e avaliação de resultados, serão abordados alguns subgrupos de pequena dimensão (entre 5 e 10% da população total), os quais se revelam muito interessantes, por um lado devido aos seus elevados desvios e por outro lado pela informação que as regras sugerem.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 55 Freitas, A. (1999), “On rule interestingness measures”, Knowledge-Based Systems, Vol. 112(5–6), pp.309–315. Gamberger, D. e Lavrac, N. (2002a), “Expert-guided subgroup discovery: methodology and application”, Journal of Artificial Intelligence, Vol. 17, pp.501–527. Gamberger, D. e Lavrac, N. (2002b), “Generating actionable knowledge by expertguided subgroup discovery”, Proceedings of the 6th European conference on principles and practice of knowledge discovery in Databases, Vol. 2431, pp. 163– 174. Gamberger, D., Lavrac, N. e Wettschereck, D. (2002c), “Subgroup visualization: a method and application to population screening”, Proceedings of the 2nd international workshop on integration and collaboration aspects of Data Mining, decision support and meta-learning, pp. 35–40. Gamberger, D. e Lavrac, N. (2003a), “Active subgroup mining: a case study in coronary heart disease risk group detection” Artificial Intelligence in Medicine, Vol. 28, pp. 27–507. Gamberger, D. Smuc, T. e Lavrac, N. (2003b), “Subgroup discovery: on-line Data minig server and its application”, Proceedings of the 5th international conference on simulations in biomedicine, pp. 433–442. Gamberger, D. e Lavrac, N. (2007a), “Supporting factors in descriptive analysis of brain ischaemia”, Proceedings of the 11th conference on artificial intelligence in medicine, Vol. 4594, pp. 155–159. Gamberger, D., Lavrac, N., Krstaic, A. e Krstaic, G. (2007b), “Clinical Data analysis based on iterative subgroup discovery: experiments in brain ischaemia Data analysis”, Applications Intelligence, Vol. 27(3), pp. 205–217. Gamberger, D., Lavrac, N., Zelezny, F. e Tolar, J. (2004), “Induction of comprehensiblemodels for gene expression Datasets by subgroup discovery methodology”, Journal of Biomedical Informatics, Vol. 37(4), pp. 269–284. Grosskreutz, H. e Rueping, S. (2009), “On subgroup discovery in numerical domains”, Data Mining Knowledge Discovery, Vol. 19(2), pp. 210–216.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 56 Grosskreutz, H., Rueping, S. e Wrobel, S. (2008), “Tight optimistic estimates for fast subgroup discovery”, European conference on machine learning and principles and practice of knowledge discovery in Databases, pp. 440–456. Han, J. e Kamber, M. (2006), Data Mining: Concepts and Techniques, Illinois: Morgan Kaufmann, Second edition. Holland, J. (1975), “Adaptation in natural and artificial systems”, University of Michigan Press, pp. 66–72. Kavsek, B. e Lavrac, N. (2004a), “Analysis of example weighting in subgroup discovery by comparison of three algorithms on a real-life Data set”, Proceedings of the 15th European conference on machine learning and 8th European conference on principles and practice of knowledge discovery in Databases, pp. 64–76. Kavsek, B. e Lavrac, N. (2004b), “Using subgroup discovery to analyze the UK traffic Data”, Metodoloski Zvezki, Vol. 1(1), pp. 249–264. Kavsek, B. e Lavrac, N. (2006), “APRIORI-SD: adapting association rule learning to subgroup discovery”, Applied Artificial Intelligence, Vol. 20, pp. 543–583. Kloesgen, W. (1996), “Explora: a multipattern and multistrategy discovery assistant”, Advances in Knowledge Discovery and Data Mining. American Association for Artificial Intelligence, pp. 249–271. Kloesgen, W. (1999), “Applications and research problems of subgroup mining”, Proceedings of the 11th international symposium on foundations of intelligent systems, pp. 1–15. Kloesgen, W. e May, M. (2002), “Census Data Mining - an application”, Proceedings of the 6th European conference on principles of Data Mining and knowledge discovery, pp. 65–79. Kralj, P., Lavrac, N., Zupan, B. e Gamberger, D. (2005), “Experimental Comparison of Three Subgroup Discovery Algorithms: Analysing Brain Ischemia Data”, 8th International Multiconference Information Society, Jozef Stefan Institute, Ljubljana, p. 220-223.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 57 Lambach, D. e Gamberger, D. (2008), “Temporal analysis of political instability through descriptive subgroup Discovery”, Conflict Management and Peace Science, Vol. 25, pp.19–32. Lavrac, N. (2005), “Subgroup discovery techniques and applications”, Proceedings of the 9th Pacific-Asia conference on knowledge discovery and Data Mining, Vol. 3518, pp. 2–14. Lavrac, N., Cestnik, B., Gamberger, D. e Flach, P. (2004a), “Decision support through subgroup discovery: three case studies and the lessons learned”, Machine Learning, Vol. 57(1–2), pp. 115–143. Lavrac, N., Kansek, B., Flach, D. e Todorovski, L. (2004b), “Subgroup Discovery with CN2-SD”, Jornal of Machine Learning Research, Vol. 5, pp. 153–188. Lavrac, N., Zelezny, F. e Flach, P. (2003), “RSD: relational subgroup discovery through first-order feature construction", Proceedings of the 12th international conference inductive logic programming, Vol. 2583, pp. 149–165. Lee, M., (1993), “Knowledge Based Factory”, Artificial Intelligence in Engineering, Vol. 8, pp. 109–125. Mueller, M., Rosales, R., Steck, H., Krishnan, S., Rao, B. e Kramer, S. (2009) “Subgroup discovery for test selection: a novel approach and its application to breast cancer diagnosis”, Proceedings of the 8 th international symposium on intelligent Data analysis, Vol. 5772, pp. 119–130. Romero, C. e Ventura, S. (2007), “Educational Data Mining: a survey from 1995 to 2005”, Expert Systems with Applications, Vol. 33(1), pp. 135–146. Romero, C., González, P., Ventura, S., del Jesus M. e Herrera, F. (2009), “Evolutionary algorithm for subgroup discovery in e-learning: a practical application using Moodle Data”, Expert Systems with Applications, Vol. 36, pp. 1632–1644. Schmidt, J., Hapfelmeier, A., Mueller, M., Perneczky, R., Kurz, A., Drzezga, A. e Kramer, S. (2010), “Interpreting PET scans by structured patient data: a Data Mining case study in dementia research”, Knowledge and Information Systems, Vol. 24(1), pp. 149–170.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 58 Tan, P., Steinbach, M. e Kumar, V. (2006), Introduction to Data Mining, Boston: Pearson International Edition Thomassey, S. (2010), “Sales forecasts in clothing industry: The key success factor of the supply chain management “, International Journal of Production Economics, Vol 128, pp. 470-483. Trajkovski, I., Zelezny, F., Tolar, J. e Lavrac, N. (2006), “Relational descriptive analysis of gene expression Data”, Proceedings of the 3rd starting artificial intelligence researchers, pp. 184–195. Trajkovski, I., Zelezny, F., Tolar, J. e Lavrac, N. (2008), “Learning relational descriptions of differentially expressed gene groups”, IEEE Transactions on Systems, Man, and Cybernetics, Vol. 38(1), pp. 16–25. Wrobel, S. (1997), “An algorithm for multi-relational discovery of subgroups”, Proceedings of the 1st European symposium on principles of Data Mining and knowledge discovery, Vol. 1263, pp. 78–87. Wrobel, S. (2001), Relational Data Mining, Berlin: Springer. Zelezny, F., Lavrac, N. e Dzeroski, S. (2003), “Constraint-based relational subgroup discovery”, Proceedings of the 2nd workshop on multi-relational Data Mining, pp. 135–150. Zelezny, F., Tolar, J., Lavrac, N. e Stepankova, O. (2005), “Relational subgroup discovery for gene expression Data Mining”, Proceedings of the 3rd European medical and biological engineering conference.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 59 Anexos
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 60 Anexo A – The Bivolino 2 Company Figure A1: Bivolino Website Bivolino, founded in 1954, is a Belgian clothing manufacturer, specialized in customized shirts. Bivolino.com was founded by the brothers Louis and Jacques Byvoet. On 13 October 1987 the company was passed over to Michel Byvoet. Brothers Louis and Jacques Byvoet founded the company in 1954 with a joint investment of 8 million Belgian franks. Their grandfather, Jacques Byvoet, had been in the linen trade since 1900 and the name Bivolino was chosen to represent both the family name of Byvoet and linen. They based the company in Hasselt – Belgium. Under the direction of the Byvoet brothers, the company, a small plant with 80 employees, produced 350.000 shirts a year. At this point, export to the Netherlands, Luxemburg, Germany and Switzerland represented 35% of the business. In 1969, Bivolino introduced a new ergonomic measurement system, allowing each shirt to be individually fitted to the body. This system was the first of its kind in Europe, and was created in partnership with IBM. In 1981, Bivolino became the first shirt label to take steps towards computerised production, which automatically produces the 2 Os textos e imagens que constam no anexo A foram parcialmente retirados do sítio da empresa Bivolino no endereço http://www.bivolino.com/.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 61 pattern making gradations. By now, and using this technology, Bivolino was producing 900.000 shirts a year and employing 270 people. On 13 October, 1987 a fire ruined the Bivolino plant in Hasselt. Over the next year, sales decreased by 80%. As the company struggled to recover, production was moved to Tunisia and Romania. During this time, the Byvoet brothers decided to pass on the family business to Louis’ son, Michel Byvoet. The growth of the internet opened up new possibilities for Bivolino and the brand established a new digital studio at the Limburg Science Park. In 1997 the first shirt was sold via their online shop, Bivolino.com. In 2000, after two years of anthropometric research, Bivolino launched their biometric sizing technology (Patent nr EECEP1341427 & US-7346421), which could calculate the cut and size for every Bivolino customer, without using a measurement tape. In 2010, Bivolino launched its latest piece of technology, a 3D shirt design platform. The tool was developed under the Open Garments research project, and was supported by European Commission research funds. Bivolino: Sustainable Business Model The making of the bespoke shirt starts immediately in Bivolino apparel manufacturing plans just after the order has been confirmed online. This means that there is no stock of shirts waiting somewhere that eventually need to be absorbed. There is only fabrics, buttons, yarns, shirt collar stiffeners,…It is called a Made-to-Order business model or a Consumer Driven Manufacturing business model which reduces stock wastes and promotes a real sustainable supply chain. These savings result in a win-win situation for everybody taking part in the supply chain. This provides a high quality personalized service at very competitive prices and could be called by “Mass Customization”. Bivolino: Biometric Sizing Since 2004, the right size is guaranteed by a biometric sizing technology (patent Nr EEC-EP1341427 & US-7346421) which means that the customer get the right size without trying the shirt or without using any tape measurement. Only by giving height, weight, age and collar size or cup size for women, the customer will get a bespoke shirt cut to the bones! For the first Bivolino can remake the shirt if needed till 100%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 62 satisfaction. This worldwide unique biometric sizing technology help to make a record low return rate of 3.8% in total. From this amount, Bivolino repairs as much as possible so that waste is reduced to a strict minimum. Those “default” remaining shirts are then offered to those of us who are in real need through charity organizations. Bivolino: 3D Technology In 2010, Bivolino launched its latest piece of technology – a 3D shirt design tool. The result of several years of research, the tool was developed thanks to the Open Garments research project, and was supported by European Commission research funds. A new zoom function on the collar, cuffs and pockets means that customers can now see their shirt presented as realistically as possible, all in real time. Endless design combinations are now also possible – from choosing contrasting fabrics, inner collars, cuffs, yoke and back panels to contrasting sleeves, stitching, removable bones, buttons and more, allowing customers to create the ultimate bespoke shirt. When using the design tool, customers can choose from one of four categories: Business, Fashion, Party and Arty. Figure A2: Bivolino Bespoke Shirts
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 63 Bivolino: Digital Clothing Bivolino provides a vision of the future which encompasses the evolution of digital clothing supply chains, from design to retail, that minimize returns and, in turn, reduce waste. This “webified” supply chain is the “Googlification” of the apparel industry and trade (referring to the book ‘What would Google do?‘ from Jeff Jarvis) focusing on econfigurators, digital design toolkits, online dressing facilities and the development of "controlled" virtual shopping communities. Waste can be controlled as part of a lean manufacturing, or sustainable initiative. Technology also plays a role in developing a more sustainable supply chain. Bivolino uses sustainable technologies including computerized sketching, CAD pattern design, digital grading and marker-making, digital printing and computer numerical control (CAM) single-ply cutting. In fact, any technology which allows the product to remain in digital form until later in the process is considered to be more sustainable. Why is it more sustainable to create and buy a garment in a digital form? Surely you need to see real product samples? Whenever a physical sample is created, waste is introduced into the process. At Bivolino, you indeed create and buy a shirt which is digitally displayed and configurated, without real samples nor photos. This is worldwide unique! Bivolino: Awards In 2004, Bivolino was given the Starter Award from the Dutch home shopping shopping association, Thuiswinkel.org. In 2006, the company was awarded the BeCommerce Award by the Belgian home shopping association, BeCommerce.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 64 Anexo B - The CRISP-DM 3 methodology CRISP-DM (stands for Cross Industry Standard Process for Data Mining) is a comprehensive data mining methodology and a process model to conduct a data mining project. CRISP-DM breaks down the life cycle of a data mining project into six phases: business understanding, data understanding, data preparation, modeling, evaluation, and deployment. Figure A3: CRISP-DM methology 3 Os textos e imagens que constam no anexo B foram parcialmente retirados do endereço http://exde.files.wordpress.com/2009/03/crisp_visualguide.pdf
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 71 Affiliate Affiliate Row Labels Count of Orderno Row Labels Count of Orderno Retailer 2 157 Retailer 2 1,95% Retailer 10 3 Retailer 10 0,04% Bivolino 4234 Bivolino 52,56% Retailer 6 44 Retailer 6 0,55% Retailer 4 132 Retailer 4 1,64% Retailer 7 34 Retailer 7 0,42% Retailer 8 9 Retailer 8 0,11% Retailer 5 54 Retailer 5 0,67% Retailer 1 3228 Retailer 1 40,07% Retailer 9 6 Retailer 9 0,07% Retailer 3 155 Retailer 3 1,92% Grand Total 8056 Grand Total 100,00% BMI BMI Row Labels Count of Orderno Row Labels Count of Orderno Morbidly Obese 255 Morbidly Obese 3,17% Obese 1535 Obese 19,05% Overweight 2529 Overweight 31,39% Normal weight 3604 Normal weight 44,74% Underweight 133 Underweight 1,65% Grand Total 8056 Grand Total 100,00% Hem Hem Row Labels Count of Orderno Row Labels Count of Orderno Curved Hem 3804 Curved Hem 47,22% Curved Hem with Gussets 3054 Curved Hem with Gussets 37,91% Straight Hem 1198 Straight Hem 14,87% Grand Total 8056 Grand Total 100,00% Back yoke contrast Back yoke contrast Row Labels Count of Orderno Row Labels Count of Orderno n 4829 n 59,94% y 3227 y 40,06% Grand Total 8056 Grand Total 100,00% Fabric Fabric Row Labels Count of Orderno Row Labels Count of Orderno Sera6 7 Sera6 0,09% Angenelle Thijsen 3 1 Angenelle Thijsen 3 0,01% Antigua 1 2 Antigua 1 0,02% Arvik 1 1 Arvik 1 0,01% Atros 1 21 Atros 1 0,26% Atros 2 16 Atros 2 0,20% Atros 3 21 Atros 3 0,26% Barbados 12 Barbados 0,15% Bath 62 Bath 0,77% Beijing 14 Beijing 0,17% Berry 2 1 Berry 2 0,01% BIA 1 9 BIA 1 0,11% BIA 2 1 BIA 2 0,01% BIA 3 5 BIA 3 0,06%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 72 Biar 2 1 Biar 2 0,01% Bodo 1 2 Bodo 1 0,02% Bodo 2 5 Bodo 2 0,06% Bodo 4 7 Bodo 4 0,09% Bono1 3 Bono1 0,04% Bono2 3 Bono2 0,04% Bono3 4 Bono3 0,05% Bono4 15 Bono4 0,19% Boreo 2 2 Boreo 2 0,02% Boston 1 16 Boston 1 0,20% Boston 2 17 Boston 2 0,21% Brama 2 1 Brama 2 0,01% Brama 4 4 Brama 4 0,05% Brama 5 1 Brama 5 0,01% Brighton 53 Brighton 0,66% Brisbane 6 Brisbane 0,07% bristol 1 10 bristol 1 0,12% Cadiz 1 1 Cadiz 1 0,01% Cadiz 2 2 Cadiz 2 0,02% Cadiz 3 1 Cadiz 3 0,01% Cadiz 4 5 Cadiz 4 0,06% calvo1 6 calvo1 0,07% calvo3 6 calvo3 0,07% calvo4 4 calvo4 0,05% Cambridge 8 Cambridge 0,10% Candi 2 1 Candi 2 0,01% Canterbury 36 Canterbury 0,45% Cara 3 3 Cara 3 0,04% Cardiff 53 Cardiff 0,66% Chester 3 Chester 0,04% Chicago 20 Chicago 0,25% Combi 2 2 Combi 2 0,02% Consu 1 4 Consu 1 0,05% Cuba 16 Cuba 0,20% Dalar 1 21 Dalar 1 0,26% Dalar 2 9 Dalar 2 0,11% Dalar 3 12 Dalar 3 0,15% Damo 1 7 Damo 1 0,09% Derby 33 Derby 0,41% Dex 1 1 Dex 1 0,01% Dex 3 2 Dex 3 0,02% Docra 1 4 Docra 1 0,05% Docra 2 9 Docra 2 0,11% Docra 3 5 Docra 3 0,06% Docra 4 3 Docra 4 0,04% Don Valentine 1 5 Don Valentine 1 0,06% Don Valentine 3 5 Don Valentine 3 0,06% Don Valentine 4 5 Don Valentine 4 0,06% Drop 1 4 Drop 1 0,05% Drop 6 2 Drop 6 0,02% Dubai 7 Dubai 0,09% Durham 7 Durham 0,09% Edinburgh 8 Edinburgh 0,10% Elasti 1 8 Elasti 1 0,10% Elasti 2 12 Elasti 2 0,15% Elasti 3 8 Elasti 3 0,10% Elasti 4 13 Elasti 4 0,16%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 73 Elasti 5 7 Elasti 5 0,09% Elasti 6 5 Elasti 6 0,06% Elasti 7 3 Elasti 7 0,04% Elasti 9 6 Elasti 9 0,07% Elor 1 2 Elor 1 0,02% Elor 2 4 Elor 2 0,05% Elor 3 3 Elor 3 0,04% Elor 5 2 Elor 5 0,02% Eton 25 Eton 0,31% Exeter 11 Exeter 0,14% FabricID12186 4906 FabricID12186 60,90% Fakir 1 10 Fakir 1 0,12% Fakir 2 11 Fakir 2 0,14% Fioco 1 5 Fioco 1 0,06% Fiucu 1 6 Fiucu 1 0,07% Fiucu 1 6 Fiucu 1 0,07% Flint 1 6 Flint 1 0,07% Flint 2 4 Flint 2 0,05% Flint 3 6 Flint 3 0,07% Flint 5 24 Flint 5 0,30% Gada 1 5 Gada 1 0,06% Gada 2 3 Gada 2 0,04% Gola1 1 Gola1 0,01% Greenwich 183 Greenwich 2,27% Grenada 12 Grenada 0,15% Harrow 87 Harrow 1,08% Ibiza 9 Ibiza 0,11% Jardi2 1 Jardi2 0,01% Juan 3 5 Juan 3 0,06% Juan 4 2 Juan 4 0,02% Juan 7 5 Juan 7 0,06% Juan 8 4 Juan 8 0,05% KANKI 1 2 KANKI 1 0,02% Kazar 2 14 Kazar 2 0,17% Kingston 22 Kingston 0,27% Kiwi 1 11 Kiwi 1 0,14% Kiwi 3 13 Kiwi 3 0,16% Kiwi 8 3 Kiwi 8 0,04% Koran 2 1 Koran 2 0,01% Koran 3 2 Koran 3 0,02% Laba 1 8 Laba 1 0,10% Laba 3 1 Laba 3 0,01% Laba 4 6 Laba 4 0,07% Laba 5 4 Laba 5 0,05% Leeds 37 Leeds 0,46% Liberty 7 3 Liberty 7 0,04% Liberty 9 1 Liberty 9 0,01% Liberty Flowers 4 1 Liberty Flowers 4 0,01% Liberty Flowers 5 1 Liberty Flowers 5 0,01% Liberty Flowers 6 2 Liberty Flowers 6 0,02% Liberty Flowers 7 1 Liberty Flowers 7 0,01% Lino 1 1 Lino 1 0,01% Lino 3 5 Lino 3 0,06% Lino 4 4 Lino 4 0,05% Liss 1 17 Liss 1 0,21% Liss 2 7 Liss 2 0,09% Liss 3 9 Liss 3 0,11%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 74 Liss 5 5 Liss 5 0,06% london 1 64 london 1 0,79% london 2 38 london 2 0,47% london 4 110 london 4 1,37% Lori 1 3 Lori 1 0,04% Lotur1 9 Lotur1 0,11% Lotur2 2 Lotur2 0,02% Malfi 1 2 Malfi 1 0,02% Marco 2 6 Marco 2 0,07% Marco 5 26 Marco 5 0,32% Marco1 53 Marco1 0,66% Marco3 11 Marco3 0,14% Marco4 25 Marco4 0,31% Marco6 33 Marco6 0,41% Marco7 23 Marco7 0,29% Marco8 7 Marco8 0,09% Marco9 24 Marco9 0,30% Mars 3 2 Mars 3 0,02% Melta 1 3 Melta 1 0,04% Miami 8 Miami 0,10% Milan 47 Milan 0,58% Minus 1 1 Minus 1 0,01% Miro 2 6 Miro 2 0,07% Miro 3 3 Miro 3 0,04% Miro 7 2 Miro 7 0,02% Miro 9 10 Miro 9 0,12% MOZA1 8 MOZA1 0,10% MOZA2 10 MOZA2 0,12% MOZA3 4 MOZA3 0,05% Nadir 1 2 Nadir 1 0,02% Nadir 4 1 Nadir 4 0,01% NADIR2 1 NADIR2 0,01% Neon1 2 Neon1 0,02% Neon2 2 Neon2 0,02% New York 10 New York 0,12% Newcastle 15 Newcastle 0,19% Norwich 18 Norwich 0,22% Oldie1 1 Oldie1 0,01% Oldie2 7 Oldie2 0,09% Oldie3 3 Oldie3 0,04% Opion 1 2 Opion 1 0,02% Opion 2 2 Opion 2 0,02% Oxford 13 Oxford 0,16% Para 3 6 Para 3 0,07% Para 4 7 Para 4 0,09% Para 5 4 Para 5 0,05% Party 1 18 Party 1 0,22% Party 2 6 Party 2 0,07% Party 5 5 Party 5 0,06% Party 7 9 Party 7 0,11% Party 8 21 Party 8 0,26% Party 9 11 Party 9 0,14% Perth 12 Perth 0,15% Plaza 1 2 Plaza 1 0,02% Plaza 2 4 Plaza 2 0,05% Plaza 3 1 Plaza 3 0,01% Plaza 4 3 Plaza 4 0,04%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 75 Plaza 5 5 Plaza 5 0,06% Plymouth 89 Plymouth 1,10% Rado 5 4 Rado 5 0,05% Rado 7 1 Rado 7 0,01% Rafia 1 7 Rafia 1 0,09% Rafia 2 5 Rafia 2 0,06% Ravenne1 5 Ravenne1 0,06% Reading 37 Reading 0,46% Regi 2 2 Regi 2 0,02% Rena 1 2 Rena 1 0,02% Rena 3 3 Rena 3 0,04% Reso 1 18 Reso 1 0,22% Reso 2 1 Reso 2 0,01% Reso 3 16 Reso 3 0,20% Reso 4 1 Reso 4 0,01% Reso 6 4 Reso 6 0,05% Reso 8 3 Reso 8 0,04% Rius 1 17 Rius 1 0,21% Rius 2 32 Rius 2 0,40% Rius 3 6 Rius 3 0,07% Rius 4 22 Rius 4 0,27% Rius 5 7 Rius 5 0,09% Rius 6 13 Rius 6 0,16% ROCAS 1 2 ROCAS 1 0,02% ROCAS 2 2 ROCAS 2 0,02% ROCAS 3 3 ROCAS 3 0,04% Roco 1 52 Roco 1 0,65% Roco 2 22 Roco 2 0,27% Roco 3 5 Roco 3 0,06% Roco 4 7 Roco 4 0,09% Roco 5 5 Roco 5 0,06% Roco 6 5 Roco 6 0,06% Roco 7 10 Roco 7 0,12% Roco 8 9 Roco 8 0,11% Rogna 1 12 Rogna 1 0,15% Romeo 2 7 Romeo 2 0,09% Romeo 5 2 Romeo 5 0,02% Romeo 7 3 Romeo 7 0,04% Romeo 8 5 Romeo 8 0,06% San Francisco 5 San Francisco 0,06% Seoul 1 25 Seoul 1 0,31% Seoul 2 11 Seoul 2 0,14% Seoul 3 11 Seoul 3 0,14% Seoul 5 17 Seoul 5 0,21% Sera2 2 Sera2 0,02% Serbo 1 4 Serbo 1 0,05% Shanghai 2 Shanghai 0,02% Sheffield 57 Sheffield 0,71% Silco 2 3 Silco 2 0,04% Silco 4 7 Silco 4 0,09% SILIA 2 5 SILIA 2 0,06% SILIA 3 1 SILIA 3 0,01% Spira 1 14 Spira 1 0,17% Spira 2 3 Spira 2 0,04% Spira 3 11 Spira 3 0,14% Spira 4 2 Spira 4 0,02% Spira 8 2 Spira 8 0,02%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 76 Stirling 28 Stirling 0,35% Sydney 5 Sydney 0,06% Tobago 4 Tobago 0,05% Tokyo 13 Tokyo 0,16% Toron 4 11 Toron 4 0,14% Trame 1 6 Trame 1 0,07% Trame 2 2 Trame 2 0,02% Trame 3 3 Trame 3 0,04% Trame 4 1 Trame 4 0,01% Trame 5 4 Trame 5 0,05% Trent 38 Trent 0,47% Trinity 16 Trinity 0,20% Ubo 1 2 Ubo 1 0,02% Vega 1 4 Vega 1 0,05% Vega 2 5 Vega 2 0,06% Vegas 5 Vegas 0,06% Vera 1 2 Vera 1 0,02% Virna 1 33 Virna 1 0,41% Virna 2 17 Virna 2 0,21% Virna 3 2 Virna 3 0,02% Virna 4 3 Virna 4 0,04% Virna 5 8 Virna 5 0,10% Virna 6 23 Virna 6 0,29% Virna 7 1 Virna 7 0,01% Windy 1 3 Windy 1 0,04% Windy 2 1 Windy 2 0,01% Windy 4 3 Windy 4 0,04% Windy 5 5 Windy 5 0,06% Windy 6 7 Windy 6 0,09% Worcester 101 Worcester 1,25% York 105 York 1,30% Grand Total 8056 Grand Total 100,00%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 77 Anexo E – 2ª Fase da Análise Exploratória de Dados As tabelas do presente anexo referem-se à segunda fase da análise exploratória de dados, na qual: • São consideradas apenas as encomendas do género masculino relativas a 5 países (Bélgica, Alemanha, França, Holanda e Reino Unido), totalizando 7.066 encomendas; • A variável de interesse é o BMI (índice de massa corporal), cujo domínio é: obesidade mórbida, obeso, excesso de peso, peso normal e baixo peso, e; • Os valores percentuais apresentados dizem respeito a cada domínio da variável BMI associada a outra ou outras variáveis, indicando a percentagem de encomendas desse domínio em relação ao total de encomendas consideradas (7.066). Neste sentido, é apresentada a distribuição dos valores da categoria BMI para cada subconjunto de dados, sendo que, o total expressa a porção de casos que o subconjunto representa.
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 78 E.1. – Age Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Total 16/24 0,0% 5,2% 0,2% 0,8% 0,5% 6,7% 25/34 0,2% 15,8% 1,8% 6,0% 0,5% 24,2% 35/44 0,8% 12,0% 5,0% 10,4% 0,2% 28,5% 45/54 1,1% 6,6% 6,6% 8,6% 0,1% 22,9% 55/64 1,0% 2,3% 4,7% 4,3% 0,1% 12,3% 65/74 0,4% 1,0% 1,7% 1,7% 0,0% 4,7% 75< 0,0% 0,0% 0,3% 0,3% 0,0% 0,6% Total: 3,5% 42,9% 20,3% 32,1% 1,3% 100,0% E.1.1. – Age and Country Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Total be 16/24 0,0% 0,0% 0,0% 7,1% 0,6% 7,8% 25/34 0,0% 1,3% 5,7% 17,4% 0,2% 24,5% 35/44 0,3% 3,7% 9,3% 16,4% 1,0% 30,7% 45/54 0,3% 7,0% 7,1% 9,1% 0,0% 23,5% 55/64 0,5% 3,7% 3,4% 3,1% 0,0% 10,7% 65/74 0,3% 0,8% 0,6% 0,2% 0,3% 2,3% 75< 0,0% 0,2% 0,3% 0,0% 0,0% 0,5% de 16/24 0,0% 0,0% 0,3% 3,0% 0,0% 3,3% 25/34 0,0% 1,3% 5,3% 10,7% 0,3% 17,7% 35/44 0,0% 6,0% 13,7% 14,7% 0,0% 34,3% 45/54 0,3% 6,0% 8,7% 7,7% 0,0% 22,7% 55/64 0,7% 6,0% 5,0% 3,0% 0,0% 14,7% 65/74 0,0% 2,7% 2,3% 2,3% 0,0% 7,3% fr 16/24 0,0% 0,3% 1,3% 7,7% 0,9% 10,2% 25/34 0,0% 1,1% 7,7% 23,3% 0,6% 32,8% 35/44 0,7% 3,0% 10,0% 10,9% 0,0% 24,6% 45/54 0,4% 4,1% 5,2% 5,6% 0,0% 15,3% 55/64 1,1% 3,3% 7,0% 2,1% 0,1% 13,7% 65/74 0,0% 0,9% 1,0% 0,7% 0,0% 2,6% 75< 0,0% 0,1% 0,7% 0,0% 0,0% 0,9% nl 16/24 0,0% 0,0% 0,8% 8,7% 0,2% 9,7% 25/34 0,0% 1,9% 5,1% 17,1% 0,5% 24,6% 35/44 0,2% 4,4% 10,7% 14,9% 0,2% 30,5% 45/54 0,5% 4,3% 9,2% 9,6% 0,0% 23,6% 55/64 0,4% 2,2% 4,4% 1,6% 0,1% 8,7% 65/74 0,0% 0,5% 1,9% 0,5% 0,0% 2,9% uk 16/24 0,0% 0,3% 0,9% 3,5% 0,5% 5,1% 25/34 0,3% 1,8% 6,0% 13,9% 0,5% 22,5% 35/44 1,1% 5,7% 10,5% 10,5% 0,1% 28,0% 45/54 1,6% 7,7% 9,5% 5,5% 0,1% 24,4% 55/64 1,1% 6,1% 4,0% 2,3% 0,0% 13,5% 65/74 0,6% 2,1% 1,8% 1,2% 0,0% 5,6% 75< 0,0% 0,5% 0,3% 0,0% 0,0% 0,8%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 79 E.2. – Fit Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Total Comfort fit 2,8% 10,8% 6,0% 1,5% 0,1% 21,2% Regular 0,7% 9,2% 22,0% 24,1% 0,5% 56,5% Super Slim Fit 0,0% 0,5% 4,2% 16,5% 0,7% 21,9% No Fit 0,0% 0,1% 0,1% 0,2% 0,0% 0,4% Total: 3,5% 20,5% 32,4% 42,3% 1,2% 100,0% E.2.1. – Fit and Age Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Total 16/24 Comfort fit 0,2% 0,8% 0,0% 1,0% 0,0% 2,1% Regular 0,2% 1,9% 8,1% 34,9% 1,9% 46,9% Super Slim Fit 0,0% 0,2% 4,4% 40,5% 5,0% 50,0% No Fit 0,0% 0,0% 0,0% 1,0% 0,0% 1,0% 25/34 Comfort fit 0,6% 2,4% 1,5% 0,3% 0,1% 4,9% Regular 0,3% 3,9% 18,5% 33,5% 0,7% 56,9% Super Slim Fit 0,0% 0,8% 4,9% 30,8% 1,1% 37,7% No Fit 0,0% 0,0% 0,1% 0,5% 0,0% 0,5% 35/44 Comfort fit 2,5% 8,3% 4,2% 0,8% 0,1% 15,8% Regular 0,4% 8,9% 26,4% 24,0% 0,3% 60,0% Super Slim Fit 0,0% 0,5% 6,2% 17,0% 0,3% 24,1% No Fit 0,0% 0,0% 0,1% 0,0% 0,0% 0,2% 45/54 Comfort fit 3,8% 15,6% 7,4% 2,5% 0,0% 29,2% Regular 1,1% 12,4% 26,8% 20,0% 0,3% 60,6% Super Slim Fit 0,1% 0,5% 3,7% 5,6% 0,1% 10,0% No Fit 0,0% 0,1% 0,1% 0,0% 0,0% 0,2% 55/64 Comfort fit 5,6% 22,4% 13,9% 2,4% 0,1% 44,4% Regular 1,8% 17,1% 19,4% 13,2% 0,2% 51,8% Super Slim Fit 0,0% 0,0% 1,1% 2,4% 0,1% 3,5% No Fit 0,0% 0,1% 0,2% 0,0% 0,0% 0,3% 65/74 Comfort fit 7,2% 25,1% 19,0% 4,9% 0,3% 56,5% Regular 0,9% 10,1% 14,7% 14,4% 0,3% 40,3% Super Slim Fit 0,0% 0,0% 0,3% 1,4% 0,0% 1,7% No Fit 0,3% 0,0% 1,2% 0,0% 0,0% 1,4% 75< Comfort fit 2,2% 34,8% 19,6% 0,0% 0,0% 56,5% Regular 0,0% 15,2% 23,9% 4,3% 0,0% 43,5%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 80 E.3. – Configurator Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Total Arty Shirts 0,0% 0,0% 0,1% 0,1% 0,0% 0,2% Bespoke Shirt 0,3% 3,4% 7,5% 11,9% 0,3% 23,4% BOXERS 0,0% 0,0% 0,0% 0,0% 0,0% 0,0% Fashion Shirt 0,3% 2,9% 6,8% 10,8% 0,4% 21,3% made to measure shirts 0,0% 0,4% 0,5% 0,9% 0,0% 1,9% No Configuratort 0,3% 1,1% 1,6% 2,0% 0,1% 5,1% Party Shirt 0,9% 3,0% 2,9% 2,9% 0,0% 9,7% Shirt Configurator 0,0% 0,1% 0,0% 0,0% 0,0% 0,1% Tuxedo Shirt 0,0% 0,1% 0,2% 0,4% 0,0% 0,6% Work Shirt 1,7% 9,6% 12,8% 13,2% 0,4% 37,7% Total: 3,5% 20,5% 32,4% 42,3% 1,2% 100,0% E.3.1. – Collection and Configurator Obesidade Morbida Obeso Excesso de Peso Peso Normal Baixo Peso Total Bespoke Shirt Bespoke Basics 0,2% 5,1% 12,2% 21,0% 0,4% 38,9% Easy-Iron 0,7% 7,2% 15,7% 22,5% 0,6% 46,8% Fashion Basics 0,0% 0,0% 0,1% 0,1% 0,0% 0,2% Fundamentals 0,1% 1,6% 2,5% 4,8% 0,1% 9,1% Prestige 2ply 0,1% 0,6% 1,7% 2,5% 0,1% 5,0% Fashion Shirt Bespoke Basics 0,0% 0,0% 0,0% 0,1% 0,0% 0,1% Black & White 0,0% 0,0% 0,0% 0,1% 0,0% 0,1% Clearance 0,0% 0,0% 0,0% 0,1% 0,0% 0,1% Fashion Basics 0,6% 5,8% 13,3% 22,9% 1,0% 43,5% Flower Power 0,0% 0,4% 0,5% 0,6% 0,1% 1,5% Fundamentals 0,1% 0,8% 4,0% 4,4% 0,1% 9,4% Italian Luxury 0,4% 2,9% 7,1% 10,1% 0,3% 20,7% linen 0,0% 0,3% 0,7% 0,5% 0,1% 1,6% Luxury 0,0% 0,0% 0,0% 0,1% 0,0% 0,1% Sale 0,0% 0,1% 0,0% 0,1% 0,0% 0,1% Scots Clans 0,1% 0,5% 1,0% 3,0% 0,1% 4,7% Trendy Trends 0,4% 2,9% 5,3% 8,9% 0,5% 18,1% Party Shirt Autograph Design 7,8% 25,2% 19,4% 19,1% 0,3% 71,8% Autograph Plain 1,8% 5,7% 10,2% 10,2% 0,0% 27,9% M&S Man Plain 0,0% 0,0% 0,0% 0,1% 0,0% 0,1% Savile Row Plain 0,0% 0,0% 0,0% 0,1% 0,0% 0,1% Work Shirt Autograph Plain 0,0% 0,0% 0,0% 0,0% 0,0% 0,0% M&S Man Design 1,4% 7,3% 7,0% 8,8% 0,2% 24,6% M&S Man Plain 1,3% 7,0% 9,2% 10,1% 0,2% 27,8% Savile Row Design 0,8% 3,3% 4,8% 3,4% 0,0% 12,3% Savile Row Plain 1,1% 7,8% 13,0% 12,8% 0,6% 35,3%
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 87 Anexo G – Desvios nas regras do Modelo obtido pelo RapidMiner Modelo (CN2-SD) Obesi. Morb. Desvio Obeso Desvio Exceso de Peso Desvio Peso Norm. Desvio Baixo Peso Desvio Tamanho do Subgrupo (%) Tamanho do Subgrupo Total: 3,5% 20,3% 32,1% 42,9% 1,3% 100,0% 7066 1. - if Country = uk then Obese 4,8% 38,3% 23,8% 17,3% 32,7% 1,8% 37,5% -12,5% 1,2% -2,6% 60,5% 4272 2. - if Fit = Regular then Obese 1,3% -62,1% 16,3% -19,3% 38,5% 19,9% 43,0% 0,2% 0,9% -32,9% 56,3% 3976 3. - if Collar size = <36 and Country = uk then Obese 5,3% 53,4% 25,3% 25,1% 32,8% 2,0% 35,5% -17,3% 1,2% -9,5% 51,6% 3644 4. - if Fit = Regular and Collar white = n and Cuff white = n then Normal weight 1,3% -61,0% 15,7% -22,3% 38,5% 19,9% 43,5% 1,5% 0,9% -33,2% 51,5% 3642 5. - if Collar size = <36 and Cuff white = n and Country = uk then Morbidly Obese 5,5% 58,1% 25,0% 23,7% 33,0% 2,6% 35,4% -17,4% 1,1% -12,9% 48,5% 3426 6. - if Weight = 75-95 then Overweight 0,2% -94,6% 6,1% -70,1% 45,4% 41,3% 48,3% 12,6% 0,1% -95,1% 45,8% 3235 7. - if Affiliate = Retailer 1 and Cuff white = n and Country = uk then Morbidly Obese 5,8% 68,3% 25,7% 26,9% 32,8% 2,2% 34,9% -18,7% 0,8% -38,5% 43,3% 3062 8. - if Back Yoke contrast = y and Collar size = <36 then Obese 5,7% 63,9% 26,9% 32,7% 32,7% 1,9% 33,9% -21,0% 0,9% -33,2% 43,2% 3056 9. - if Cuff = Round Single and Collar white = n and Cuff white = n then Overweight 3,1% -9,5% 20,3% 0,2% 30,8% -4,0% 44,3% 3,3% 1,4% 10,3% 40,3% 2847 10. - if Fit = Regular and Placket = Real front then Obese 1,4% -60,6% 17,8% -11,9% 39,2% 21,9% 40,7% -5,2% 1,0% -23,7% 36,4% 2573 11. - if Country = uk and Collar white = n and Fit = Regular and Cuff white = n then Morbidly Obese 2,0% -43,5% 19,2% -5,3% 39,4% 22,7% 38,8% -9,5% 0,6% -51,1% 34,1% 2408 12. - if Weight = 75-95 and Pocket = No Pocket then Normal weight 0,2% -95,1% 4,3% -79,0% 42,2% 31,2% 53,3% 24,3% 0,1% -93,3% 33,3% 2351 13. - if Fit = Regular and Collar size = <36 and Country = uk then Overweight 1,9% -45,9% 20,5% 1,3% 39,1% 21,7% 37,8% -11,9% 0,7% -42,0% 32,6% 2300 14. - if Hem = Curved Hem and Fabric = FabricID12186 then Obese 2,3% -34,6% 16,7% -17,6% 31,3% -2,6% 48,4% 12,9% 1,3% 5,0% 30,7% 2169 15. - if Age = 35/44 then Overweight 2,7% -20,8% 17,7% -12,8% 36,6% 13,9% 42,3% -1,3% 0,7% -45,3% 28,5% 2011 16. - if Placket = Real front and Back Yoke contrast = n then Morbidly Obese 2,3% -33,8% 17,2% -15,3% 33,1% 3,0% 45,3% 5,6% 2,2% 71,4% 27,9% 1970 17. - if collar = Classic Point and Collar white = n and Cuff white = n then Morbidly Obese 5,3% 52,9% 25,7% 27,0% 30,6% -4,8% 37,5% -12,5% 0,9% -30,9% 27,3% 1932 18. - if Cuff = Round Single and Placket = Real front and Collar white = n then Overweight 4,0% 15,2% 23,2% 14,5% 31,9% -0,8% 39,5% -7,9% 1,5% 15,0% 27,0% 1911 19. - if Country = uk and Weight = 75-95 then Obese 0,3% -92,0% 8,2% -59,4% 49,6% 54,4% 41,9% -2,3% 0,0% -100,0% 25,7% 1813 20. - if Fit = Regular and Back Yoke contrast = n then Obese 0,5% -85,2% 12,3% -39,5% 38,5% 19,7% 47,7% 11,2% 1,1% -15,4% 25,0% 1763
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 88 21. - if Placket = Real front and Affiliate = Bivolino then Obese 1,9% -46,3% 16,0% -21,1% 33,4% 3,9% 46,5% 8,5% 2,3% 78,4% 23,7% 1672 22. - if Weight = 45-75 then Overweight 0,3% -91,1% 0,3% -98,5% 9,7% -69,9% 84,3% 96,6% 5,4% 322,6% 23,1% 1635 23. - if Fit = Super Slim Fit then Normal weight 0,2% -94,6% 2,1% -89,5% 19,2% -40,1% 75,3% 75,5% 3,2% 150,1% 22,7% 1601 24. - if Weight = 45-75 and Collar white = n then Overweight 0,3% -90,3% 0,3% -98,7% 9,8% -69,6% 84,8% 97,6% 4,9% 283,1% 21,2% 1496 25. - if Fit = Comfort fit then Morbidly Obese 12,9% 272,9% 50,9% 151,3% 28,8% -10,2% 7,1% -83,6% 0,3% -73,1% 20,7% 1460 26. - if Weight = 95-115 then Obese 1,2% -64,9% 47,5% 134,7% 44,8% 39,5% 6,4% -85,0% 0,0% -100,0% 19,8% 1401 27. - if Heightcm = 190/200 then Normal weight 0,0% -100,0% 17,7% -12,4% 28,5% -11,2% 52,2% 21,7% 1,6% 22,0% 15,5% 1094 28. - if Weight = 45-75 and Placket = Real front then Overweight 0,1% -97,1% 0,4% -98,0% 11,9% -63,0% 81,7% 90,4% 5,9% 366,0% 14,1% 994 29. - if Fit = Regular and Weight = 45-75 then Overweight 0,5% -84,5% 0,2% -98,9% 12,0% -62,8% 83,9% 95,6% 3,4% 168,1% 13,3% 937 30. - if Placket = Real front and Fit = Regular and Back Yoke contrast = n then Morbidly Obese 0,7% -80,1% 13,8% -31,6% 39,7% 23,6% 44,3% 3,2% 1,5% 16,8% 12,4% 874 31. - if Weight = 95-115 and Pocket = No Pocket then Normal weight 1,3% -63,8% 41,9% 106,8% 49,0% 52,5% 7,9% -81,6% 0,0% -100,0% 11,3% 800 32. - if Collar size = 4244 then Obese 0,4% -89,1% 12,3% -39,3% 53,7% 67,2% 33,2% -22,5% 0,4% -70,4% 11,3% 797 33. - if Fit = Regular and Weight = 95-115 and Collar white = n and Cuff white = n then Normal weight 0,7% -80,7% 40,9% 101,9% 49,8% 55,0% 8,7% -79,8% 0,0% -100,0% 10,6% 751 34. - if Weight = 95-115 and Back Yoke contrast = n then Normal weight 0,6% -82,7% 42,2% 108,1% 49,6% 54,5% 7,6% -82,2% 0,0% -100,0% 9,5% 669 35. - if Placket = Blind and Back Yoke contrast = n then Obese 1,4% -59,9% 16,5% -18,7% 33,8% 5,4% 46,8% 9,0% 1,5% 20,8% 9,2% 650 36. - if Weight = 115 - 135 then Morbidly Obese 18,7% 441,2% 78,8% 289,0% 2,5% -92,1% 0,0% - 100,0% 0,0% -100,0% 8,4% 594 37. - if Heightcm = 160/170 and Weight = 45-75 then Overweight 0,0% -100,0% 0,0% - 100,0% 28,7% -10,5% 68,4% 59,4% 2,9% 127,6% 5,9% 414 38. - if Hem = Straight Hem and Collar white = n and Cuff white = n and Back Yoke contrast = n and Fabric = FabricID12186 then Overweight 2,2% -37,2% 26,8% 32,5% 33,1% 2,9% 36,9% -14,1% 1,1% -14,9% 5,2% 369 39. - if Hem = Straight Hem and Fit = Comfort fit and Collar white = n then Overweight 11,8% 242,1% 56,9% 180,8% 24,7% -23,0% 6,6% -84,6% 0,0% -100,0% 5,2% 364 40. - if collar = Italian Semi-Spread and Affiliate = Bivolino and Pocket = No Pocket and Collar white = n and Cuff white = n then Obese 0,6% -83,7% 5,6% -72,3% 26,7% -16,9% 64,6% 50,6% 2,5% 98,5% 5,0% 356 41. - if Weight = 115135 and Hem = Curved Hem then Obese 15,9% 360,2% 82,2% 305,7% 1,9% -94,0% 0,0% - 100,0% 0,0% -100,0% 3,7% 258 42. - if Hem = Curved Hem and Weight = 115135 and Collar white = n then Overweight 17,3% 401,0% 80,6% 297,9% 2,1% -93,4% 0,0% - 100,0% 0,0% -100,0% 3,4% 237
Faculdade de Economia – Universidade do Porto Extração de Conhecimento com Data Mining na Indústria do Vestuário 89 43. - if Weight = 135155 then Morbidly Obese 52,2% 1412,8% 47,8% 135,8% 0,0% - 100,0% 0,0% - 100,0% 0,0% -100,0% 2,8% 201 44. - if Fit = Comfort fit and Placket = Folded and Collar white = n and Back Yoke contrast = n and Cuff white = n then Morbidly Obese 5,6% 62,0% 50,3% 148,6% 39,2% 21,9% 4,9% -88,6% 0,0% -100,0% 2,0% 143 45. - if Heightcm = 200/210 and Weight = 95-115 then Normal weight 0,0% -100,0% 0,0% - 100,0% 51,5% 60,3% 48,5% 13,1% 0,0% -100,0% 1,4% 101 46. - if Heightcm = 200/210 and Weight = 115-135 and Collar white = n then Overweight 0,0% -100,0% 65,6% 224,0% 34,4% 7,0% 0,0% - 100,0% 0,0% -100,0% 0,5% 32 47. - if collar = Classic Point and Heightcm = 190/200 and Pocket = Mitred and Weight = 115-135 and Placket = Real front and Cuff white = n then Overweight 0,0% -100,0% 87,0% 329,4% 13,0% -59,4% 0,0% - 100,0% 0,0% -100,0% 0,3% 23 48. - if Heightcm = <140 then Morbidly Obese 87,5% 2433,9% 12,5% -38,3% 0,0% - 100,0% 0,0% - 100,0% 0,0% -100,0% 0,2% 16 49. - if Heightcm = 160/170 and Weight = 75-95 and Placket = Folded and Hem = Curved Hem then Obese 0,0% -100,0% 33,3% 64,6% 66,7% 107,5% 0,0% - 100,0% 0,0% -100,0% 0,1% 9 50. - if Heightcm = 140/150 and Collar size = 44-46 then Morbidly Obese 100,0% 2795,9% 0,0% - 100,0% 0,0% - 100,0% 0,0% - 100,0% 0,0% -100,0% 0,0% 2 51. - if Heightcm = 200/210 and Cuff = Short Sleeve and Collectiont = Savile Row Design then Normal weight 0,0% -100,0% 0,0% - 100,0% 0,0% - 100,0% 100,0% 133,1% 0,0% -100,0% 0,0% 2 52. - if Heightcm = 210/220 and Weight = 75-95 then Underweight 0,0% -100,0% 0,0% - 100,0% 0,0% - 100,0% 0,0% - 100,0% 100,0% 7751,1% 0,0% 2 53. - if Heightcm = 210/220 and Collar size = 38-40 then Underweight 0,0% -100,0% 0,0% - 100,0% 0,0% - 100,0% 0,0% - 100,0% 100,0% 7751,1% 0,0% 2 54. - if Fabric = Party 8 and Pocket = Single Flap Pocket then Obese 0,0% -100,0% 100,0% 393,8% 0,0% - 100,0% 0,0% - 100,0% 0,0% -100,0% 0,0% 1