XXI Jornadas de Classificação e Análise de Dados - JOCLAD 2014 - Livro de Resumos
Full text
Reunião Anual da ASSOCIAÇÃO PORTUGUESA DE CLASSIFICAÇÃO E ANÁLISE DE DADOS (CLAD) Livro de Resumos AS JOCLAD 2014 TIVERAM O APOIO INSTITUCIONAL DE:
Ficha Técnica Presidente das Jornadas Alda Carvalho (Presidente do INE) Secretário das Jornadas Fernanda Sousa (Presidente da CLAD e FEUP-Universidade do Porto) Comissão Organizadora Catarina Marques (ISCTE-Instituto Universitário de Lisboa) Isabel Silva (FEUP-Universidade do Porto) José Gonçalves Dias (ISCTE-Instituto Universitário de Lisboa) Nuno Lavado (ISEC-Instituto Politécnico de Coimbra) Título: XXI Jornadas de Classificação e Análise de Dados (JOCLAD 2014). Livro de Resumos. Produzido: Instituto Nacional de Estatística Editores: Fernanda Sousa, Catarina Marques, Isabel Silva, José Gonçalves Dias, Nuno Lavado, Carlos Marcelo ISBN: 978-989-98955
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 iii Prefácio Desde a sua constituição a Associação Portuguesa de Classificação e Análise de Dados (CLAD) tem vindo a desenvolver a sua actividade de acordo com a natureza e objectivos definidos na sua génese. Entre as diversas actividades desenvolvidas encontra-se a promoção das Jornadas Científicas, que têm tido lugar anualmente, sem qualquer interrupção. Para tal, têm contado com o precioso apoio de diferentes grupos de investigação, com actividade científica relevante nas áreas de actuação da CLAD, sediados em instituições universitárias. Das edições anteriores, onze tiveram lugar na zona da Grande Lisboa, três no Porto, e ainda Aveiro, Açores, Algarve, Vila Real, Tomar e Guimarães que receberam as Jornadas por uma vez. Este ano a CLAD celebra vinte anos de existência e estas são já as XXI Jornadas de Classificação e Análise de Dados, JOCLAD 2014. Para assinalar esta data entendeu-se por bem dar visibilidade à forte cooperação existente, desde sempre, entre o Instituto Nacional de Estatística, INE, e a CLAD. Estas Jornadas, que pela primeira vez não ocorrem em seio universitário, têm lugar em Lisboa e contam com o valioso apoio logístico do INE. O Programa das JOCLAD 2014 reflecte o carácter multidisciplinar das Jornadas, enquadrando de forma equilibrada a apresentação de trabalhos teóricos e aplicados e focando diversas temáticas da Análise de Dados em domínios transversais à sociedade. A Comissão Organizadora agradece a todos os autores e moderadores de sessões, aos membros da Comissão Científica, bem como aos participantes, aos participantes convidados e aos colegas que procederam à revisão dos trabalhos que constam deste livro. Uma nota particular ao Professor Christian Hennig que lecciona o mini-curso, bem como ao Banco de Portugal e ao INE que, através dos seus corpos técnicos, organizaram as Sessões Temáticas que constam do Programa. Por último, desejamos agradecer a todas as entidades que, directa ou indirectamente, apoiaram ou patrocinaram estas Jornadas. O nosso obrigado a todos. Lisboa, Abril de 2014 P’la Comissão Organizadora JOCLAD 2014 Fernanda Sousa
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 v ORGANIZAÇÃO Presidente das Jornadas Alda Carvalho (Presidente do INE) Secretário das Jornadas Fernanda Sousa (Presidente da CLAD e FEUP-Universidade do Porto) Comissão Organizadora Catarina Marques (ISCTE-Instituto Universitário de Lisboa) Isabel Silva (FEUP-Universidade do Porto) José Gonçalves Dias (ISCTE-Instituto Universitário de Lisboa) Nuno Lavado (ISEC-Instituto Politécnico de Coimbra) Comissão Científica Conceição Amado (Universidade de Lisboa) Helena Bacelar-Nicolau (Universidade de Lisboa) Paula Brito (Universidade do Porto) Jorge Cadima (Universidade de Lisboa) Pedro Campos (Universidade do Porto) Margarida Cardoso (Instituto Universitário de Lisboa) José Gonçalves Dias (Instituto Universitário de Lisboa) Susana Faria (Universidade do Minho) Ana Sousa Ferreira (Universidade de Lisboa) Carlos Ferreira (Universidade de Aveiro) Adelaide Figueiredo (Universidade do Porto) A. Manuela Gonçalves (Universidade do Minho) Luís Miguel Grilo (Instituto Politécnico de Tomar) Paulo Infante (Universidade de Évora) Victor Lobo (Universidade Nova de Lisboa) Catarina Marques (Instituto Universitário de Lisboa) Manuela Neves (Universidade de Lisboa) Fernando Nicolau (Universidade Nova de Lisboa) Irene Oliveira (Universidade de Trás-os-Montes e Alto Douro) Fátima Salgueiro (Instituto Universitário de Lisboa) Pedro Duarte Silva (Universidade Católica Portuguesa) Carlos Soares (Universidade do Porto) Fernanda Sousa (Universidade do Porto) Paula Vicente (Instituto Universitário de Lisboa)
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 vii APOIOS
PROGRAMA
RESUMOS
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 xix ÍNDICE MINI-CURSOS Christian Hennig Clustering with the Gaussian mixture model 3 SESSÕES PLENÁRIAS Mário A. T. Figueiredo Sparsity and structured sparsity for feature selection in Machine Learning and Statistics 7 Salvatore Ingrassia Recent results in model based clustering via the Cluster ‐ Weighted approach 9 Georges Lemaître The Value-added of International Comparisons 11 Christian Hennig Measurement of quality in cluster analysis 13 SESSÕES TEMÁTICAS ST I – Sessão do Instituto Nacional de Estatística Fátima Moreira, Cristina Neves SIOU - Fonte de atualização da Geografia do Ficheiro Nacional de Alojamentos 17 Eduarda Góis, Cristina Gonçalves, Esperança Figueiredo, Patrícia Pereira Inquérito às Despesas das Famílias: Porquê? Como? Para quê? 23 Soraia Pereira, Luís Correia, Pedro Campos Estimação do desemprego ao nível NUTS III 29 Vitor Hugo Quaresma Mendonça, Anabela Costa da Silva Série longa do Índice de Preços no Consumidor (1948 – 2013) 33
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 xxi ST II – Sessão do Banco de Portugal Filipa Lima, Inês Correia, Rodrigo Batista Non-financial sector indebtedness 39 Homero Gonçalves, Mário Lourenço, Vítor Silveira High-growth enterprises in Portugal 45 Cloé Magalhães, Pedro Cordeiro, Rita Poiares Quarterly time-series from Central Balance Sheet Database 51 ST III – Sessão 20 anos da CLAD Áurea Sousa, Helena Bacelar-Nicolau, Fernando C. Nicolau, Osvaldo Silva Classes de objectos simbólicos: dados da indústria automóvel 57 Manabu Ichino, Paula Brito A hierarchical conceptual clustering based on the quantile method for mixed data 61 Ana Sousa Ferreira Avaliações internacionais e desempenho dos alunos portugueses 67 Paulo Gomes Índice de Bem-estar em Portugal – Contributos para a interpretação dos resultados baseada em classificação de variáveis 71 Sessões paralelas Classificação e Análise de Dados Anna Carolina Finamore, M. Rosário Oliveira, Cláudia Pascoal, and António Pacheco Classifying a fairy tale: A case study 79 M. Rosário Oliveira, Rui Valadas, Marcin Pietrzyk, and Denis Collange Impact of input variables’ stability on the classification of Internet applications 85 Eunice Carrasquinha, Conceição Amado, Ana M. Pires On circulant matrix approximation to correlation matrix: an application to sounds 89 Adelaide Maria Figueiredo, Fernanda Otília Figueiredo Metodologia STATIS em Controlo Estatístico da Qualidade 93
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 xxiii Análise de Dados em Medicina A. Rita Gaio, Óscar Felgueiras, Rosa Santos, Elsa Azevedo Progression of carotid atherosclerotic plaques: speed and dependency from vascular risk factors 97 José Guerreiro, Carla Torre, Marta Gomes, Suzete Costa Impacto das normas de orientação clínica na evolução do padrão de prescrição de antidiabéticos orais e antihipertensores em Portugal – Exemplo prático da análise de regressão segmentada a uma série temporal interrompida 101 A. Rita Gaio, Joaquim Costa, Milton Severo Equiparação das classificações dos cursos de Medicina 103 Vanda M. Lourenço, Ana M. Pires M-regression, false discovery rates and outlier detection in genetic association studies 107 Modelos Longitudinais Isabel Silva, Cristina Torres, Maria Eduarda Silva Estimating bivariate integer-valued moving average models with the generalized method of moments 111 Luís Nobre Pereira, Lara Noronha Ferreira Modelação e previsão da procura turística doméstica em Portugal numa conjuntura de crise económica e financeira 115 Paula C.R. Vicente, Maria de Fátima Salgueiro Modelo com trajetória latente com dados gerados a partir de um planned missing design: estudo de simulação 119 Maria de Fátima Salgueiro, Paula C.R. Vicente The effect of observed data deviations from normality on the parameter estimates of a latent growth curve model: a simulation study 123 Análise de Estruturas de Covariância Catarina Pral, Bruno Gonçalves, Catarina Marques Depressão e risco de reincidência criminal face à delinquência juvenil 127 Paulo João, Victor Lobo Visual Fraud Detection With Self Organizing Maps 131 Edmundo Roque Ribeiro, Catarina Marques, Eduardo Correia Os ginásios da Cidade de Maputo: Os determinantes da satisfação e da lealdade dos clientes 137 Luís Miguel Grilo, Carlos Agra Coelho Near-exact distributions for the statistic used to test the reality of covariance matrix in a complex normal distribution 141
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 xxv Análise de Dados em Economia e Gestão Fernando Santos, Ana Lorga da Silva, Isabel Duarte Fatores chave de sucesso das equipas virtuais de tecnologias de informação em regime de outsourcing: do ponto de vista dos membros da equipa 145 Winston Jerónimo e Ana Amaro Abordagem exploratória: análise hibrida de indicadores de sustentabilidade empresarial 149 Paula Vicente, Catarina Marques, Elizabeth Reis Resultados de uma sondagem CATI móvel 155 A. Pedro Duarte Silva, Paula Brito Discriminant analysis of interval data: Parametric versus distance-based approaches 159 Data Mining Diogo Matos, Nuno C. Marques, Margarida G. M. S. Cardoso Agrupamento sobre uma matriz de distâncias UMAT – uma aplicação sobre dados financeiros 163 Luís Gomes, Pedro Saleiro, Carlos Soares Análise de tendências políticas no Twitter para previsão de sondagens 169 Luís Trigo, Pavel Brazdil Análise de afinidades entre investigadores com Text Mining 173 Vera Costa, Pedro Saleiro, Carlos Soares Active learning para análise de sentimento no Tweeter 177 POSTERS Sessão I Daniela Catalão, A. Manuela Gonçalves, Susana Faria, Jorge Oliveira Metodologia estatística para a avaliação de um recurso natural (Minho e Galiza) 183 José G. Dias, Isabel Tiago de Oliveira Explaining contraceptive use by the wealth index in India: A latent variable approach 187 Catarina Marques, José G. Dias The impact of population heterogeneity on factor analysis estimation 191
SESSÕES PLENÁRIAS
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 7 5ª Feira, 10 de Abril – Sessão Plenária I, Salão Nobre (14:30) Sparsity and structured sparsity for feature selection in Machine Learning and Statistics Mário A. T. Figueiredo IST, Universidade de Lisboa, Portugal Sparsity is currently a major theme in statistics, machine learning, and signal processing, which can be seen in terms of the classical goals of feature selection and model selection. This talk will focus on methods which embed sparse model/feature selection into the learning algorithms. In such methods, learning is carried out by minimizing a regularized empirical risk functional composed of two terms: a "loss term," controlling the goodness of fit to the data (e.g., quadratic, logistic, or hinge loss), and a "regularizer term," which is designed to promote sparsity. The simplest example is the now famous L1-norm regularization (often known as LASSO), which penalizes weight components individually, and has been explored in various machine learning and statistical applications. More sophisticated regularizers, such as those that use mixed norms and groups of weights, are able to promote "structured" sparsity: i.e., they promote sparsity patterns that are compatible with a priori knowledge about the structure of the problem. Some regularizers are even able to encourage structured sparsity, without prior knowledge about this structure. Sparsity-inducing regularizers require the use of specialized optimization routines for learning, some of which will be reviewed in this talk.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 9 6ª Feira, 11 de Abril – Sessão Plenária II, Salão Nobre (11:40) Recent results in model based clustering via the Cluster‐Weighted approach Salvatore Ingrassia Department of Economics and Business, University of Catania, Italy Cluster-weighted models (CWMs) are a flexible family of mixture models for fitting the joint distribution of a random vector composed by a response variable and by a set of covariates. They act as a convex combination of the products between the marginal distribution of the covariates, and the conditional distribution of the response given the covariates, in each mixture component. In this talk, we introduce a wide family of CWMs where the component conditional distributions are assumed to belong to the exponential family and where the covariates are allowed to be of mixed-type (that is containing both categorical and continuous variables). Under the assumption of Gaussian covariates, sufficient conditions for model identifiability are provided. Moreover, maximum likelihood parameter estimates are derived using the EM algorithm. Parameter recovery and performance of some information criteria are both investigated by a wide simulation study. An application to real data is finally presented where the proposed model outperforms other well-established mixture-based approaches.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 11 6ª Feira, 11 de Abril – Sessão Plenária III, Salão Nobre (15:15) The Value-added of International Comparisons Georges Lemaître Formerly OECD, Paris Scarcely a week goes by these days without the publication of some statistic for which international comparisons are provided or referred to. At the most elementary level, such comparisons provide information on where countries stand on commonly reported indicators of economic and social performance. Sometimes these rankings are themselves surprising and revealing, showing, for example, that the extent of migration to France or Germany or even the United States is very low in relation to many other OECD countries, or that relatively more persons experience crime in a given year in Sweden than in Italy. Until international microdatasets became available in recent years, international data could be characterized as being rather limited in scope compared to the richness that was available from national statistics. It has been impossible to assemble and disseminate this richness internationally in a sensible way, however, at once because of its volume and because the definitions in use varied from country to country. The requirements of international comparability also mean that many national specificities are lost in “forcing” national statistics into an international framework and common definitions. What is gained in return, however, is an additional source of variation, namely that by country, and variation, as we know, is often a source of information. What varies from country to country is, in addition to the outcomes, the history and traditions of each country but especially the institutions and policies in place. And it is the relationship between the latter and “success” or “failure” that is of particular interest. What kinds of information can one extract from international comparisons? The first, mentioned above, is a benchmarking of national outcomes to an international average which, if the national outcome differs significantly from the international average, leads to the question of why this is so. Ideally, one would like to be able to point to precise reasons; in practice, because social and economic outcomes tend to be multiply determined, it is rarely a simple matter to do so. The difficulty in explaining country-to-country differences in international student performance (the OECD PISA results), for example, are a case in point. But even if one cannot fully explain these differences, recent OECD assessment results for adults (PIAAC) show that in-country progress in reading skills across generations has been significant and that that there has been considerable catch-up to leading countries by many which were trailing over past decades. A second use of international data is to shed light on the current policy and economic environment in a way that is not necessarily possible on the basis of national data alone. The trade-off between the degree of employment protection and the duration of unemployment is an example, as is the rapidity with which immigrants integrate into the labour market of a country.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 12 A third use of international data is to make possible generalisations across countries. The lack of variation in a particular outcome across countries which differ considerably in their institutions and policy environment may suggest that one is dealing with a phenomenon which is fundamental and transcends policy intervention. Examples here are the relative employment outcomes of high- and low-educated immigrants compared to their native-born counterparts and the association between school outcomes of the children of immigrants and various measures of concentration of immigrant children or of disadvantage in schools. A fourth use of international comparisons is to help confirm that one is asking the right research question, or to serve as a source of counterexamples. Here it will be seen that the concentration of immigrants in schools is not necessarily a problem per se for educational outcomes. This result for immigrants leads more generally into the broader question of the sources of inequality in outcomes for the educational system as a whole and what differentiates countries from one another in this regard. Among the comparisons of interest are the effects of parental education vs those of the concentration of advantage/disadvantage in schools on outcomes. International comparisons can thus serve a variety of purposes other than that of simply showing where one’s country stands in relation to others on particular statistical indicators. At their best, judicious use of international data can indeed illuminate and provide insights into some fundamental societal questions.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 13 Sábado, 12 de Abril – Sessão Plenária IV, Salão Nobre (11:50) Measurement of quality in cluster analysis Christian Hennig University College London, Reino Unido There is much work on benchmarking is supervised classification, where “quality” can generally be measured as a function of misclassification probabilities. In unsupervised classification (cluster analysis), the measurement of quality is much more problematic, because in reality there is no true class label which can be used for cross-validation and the like. Furthermore, there is no guarantee that in situations where there is a true classification (for example, where benchmark data sets from supervised classification are used to assess clustering methods, or where data is simulated from a mixture distribution), this classification is unique. There can be a number of different reasonable clusterings of the same data, depending on the research aim. I will discuss the use of statistics for the assessment of clustering quality that can be computed from classified data without making reference to “the true clusters”. Such statistics have traditionally been called “cluster validation indexes” (such as the average silhouette width), and sometimes been used for estimating the number of clusters. Most of the traditional statistics try to balance various aspects of a clustering against each other (such as within-cluster homogeneity and between-cluster separation), but in order to characterize what advantages and disadvantages a clustering has, it is useful to formalize different aspects of cluster quality separately. This can also be used to explain misclassification rates in cases where “true” clusterings exist as function of the features of these clusterings.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 20 2.3. O SIOU como fonte de atualização da Geografia do FNA Com a criação do FNA, considerou-se que o SIOU poderia ser utilizado como uma fonte de atualização relativamente a novas construções e demolições. O aproveitamento desta informação esteve também na origem da reformulação do projeto, tendo-se desencadeado um trabalho significativo no sentido da adaptação do pedido de recolha da informação não só ao nível do edifício mas também do fogo (alojamento). Deste modo, desde janeiro de 2013 que são recolhidas (também) no SIOU as seguintes variáveis para atualização do FNA: Morada de cada um dos edifícios licenciados de acordo com a estrutura do EURADIN; Coordenadas geográficas de cada edifício (construções novas e demolições); Atributos relativos a cada um dos fogos que constituem o edifício: andar e lado (para obtenção da morada completa do fogo), área e tipologia. Considerando que o FNA é constituído, no momento da sua criação, pelos dados dos Censos 2011, tornou-se necessário, para efeitos de atualização, receber da parte de todas as Câmaras Municipais os dados do licenciamento (com os novos atributos necessários para efeitos de atualização do FNA) desde março de 2011 (momento censitário – data de referência dos Censos 2011). Este processo de recuperação da informação sobre coordenadas geográficas e identificação dos fogos através do SIOU (Inquérito aos Projetos de Obras de Edificação e Demolição de Edifícios) está em curso (Tabela 1 e 2), correspondendo a obras de construção nova para habitação e demolições (no que respeita à recolha de coordenadas e identificação dos fogos) e a obras de alteração, ampliação e reconstrução para habitação (apenas no que respeita à identificação dos fogos). Tabela 1: Nº de processos recolhidos no SIOU com informação para atualização do FNA
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 21 Do total de processos enviados às Câmaras Municipais (28 966 licenças) para recuperação de coordenadas geográficas e identificação dos fogos, em obras concluídas, já foi possível recuperar 94,0% da informação, referentes a obras concluídas entre março de 2011 e dezembro de 2013 (27 216 licenças). Tabela 2: Nº de processos em recuperação de informação para atualização do FNA (março 2011 a dezembro 2012) 3. Conclusão A atualização do FNA constitui um enorme desafio pela sua dimensão e complexidade, assim como pelo facto de o INE recorrer essencialmente a dados administrativos com esta finalidade As alterações recentes ao nível do SIOU vieram introduzir melhorias importantes através da adaptação do pedido de recolha da informação ao nível do edifício para o nível fogo (alojamento), para as novas construções e demolições. A BGE, construída a partir da georreferenciação dos edifícios dos Censos 2011 constitui a componente geográfica mais importante do FNA, pelo que a utilização da informação do SIOU para a sua atualização representa um elevado potencial, dado que integra a componente relacionada com a dinâmica urbanística a nível nacional (com desagregação municipal). Ao longo do ano de 2013, ano de implementação do SIOU, não se verificaram constrangimentos no envio da nova informação pelas Câmaras Municipais, pelo que se garante uma cobertura completa ao nível das novas variáveis recolhidas. A implementação de métodos de recolha via formulários eletrónicos no SIOU, em 2013, contribuíram também para um maior controlo e melhor qualidade da informação recolhida. A estratégia de atualização da BGE definida pelo INE, assente na gestão partilhada com as Câmaras Municipais representa um compromisso e um garante de qualidade da informação de base, permitindo ainda que a BGE possa assumir um carácter de base nacional oficial de referência, possibilitando a interoperabilidade e partilha de bases de dados nacionais entre diferentes instituições da Administração Pública e a apropriação de dados administrativos na atividade estatística.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 22 Referências INE, DMSI (2013). Modelo de Atualização do Ficheiro Nacional de Alojamentos – DMSI, outubro 2013. INE, DEE (2013). Relatório sobre a efetiva apropriação de dados administrativos provenientes das Câmaras Municipais para o Sistema de Indicadores de Operações Urbanísticas – INE, dezembro 2013.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 23 ST I – Sessão INE – 5ª Feira, 10 de Abril, Salão Nobre (17h30) Inquérito às Despesas das Famílias: Porquê? Como? Para quê? Eduarda Góis1, Cristina Gonçalves2, Esperança Figueiredo3, Patrícia Pereira4 1Instituto Nacional de Estatística, eduarda.go[email protected]t; 2Instituto Nacional de Estatística, [email protected]; 3Instituto Nacional de Estatística, [email protected]; 4Instituto Nacional de Estatística, [email protected] Sumário O Instituto Nacional de Estatística (INE) irá realizar em 2015 uma nova edição do Inquérito às Despesas das Famílias (IDEF), sobre a estrutura das despesas dos agregados familiares residentes em Portugal e distribuição dos rendimentos. Porquê a existência deste inquérito, como é realizado, qual a sua finalidade? São questões que pretendemos analisar neste artigo. Palavras-chave: Agregados familiares, Análise de clusters, Despesas monetárias das famílias 1. Porquê? O IDEF faz parte da série de dados estatísticos sobre orçamentos familiares iniciada em Portugal em 1967, sendo uma das operações estatísticas mais consolidadas do INE, com utilização crescente em vários sectores nacionais e entidades internacionais. Trata-se de uma operação estatística de grande dimensão, dirigida a uma amostra representativa da população residente no território nacional, estratificada regionalmente, e em que o questionário inclui a utilização de cadernetas para o preenchimento pelas famílias selecionadas de todas as despesas familiares e individuais durante duas semanas. Recolhe também dados demográficos, dados sobre rendimento e sobre as aquisições realizadas com frequência supra quinzenal, através de entrevista direta. O seu principal objetivo é o apuramento quinquenal da estrutura de despesas familiares de acordo com a COICOP-IDEF (Classificação do Consumo Individual por Objetivo adaptada aos Inquéritos às Despesas das Famílias), concorrendo, deste modo, para a atualização dos ponderadores do Índice de Preços no Consumidor e para as estimativas de Consumo Privado das Contas Nacionais. O inquérito permite ainda responder ao projeto europeu Household Budget Survey e a vários exercícios de aproximação à dieta alimentar dos residentes, através do estudo das quantidades de bens alimentares adquiridas.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 24 2. Como? Em 2010/2011, o questionário utilizado no IDEF organizava-se em diferentes módulos: Caracterização do alojamento, do agregado doméstico privado e dos seus membros, incluindo os rendimentos monetários e a disponibilidade de alguns bens de conforto; Um diário de consumo intensivo para o preenchimento das despesas quinzenais de todo o agregado, existindo ainda um diário de consumo intensivo individual para os membros do agregado que preferem fazê-lo separadamente; Recolha retrospetiva dos consumos geralmente realizados com frequência mensal, trimestral ou anual, apelando-se para a recordação das despesas efetuados durante os 30 dias anteriores à quinzena de entrevista, durante os três meses anteriores à quinzena de entrevista e no decurso dos doze meses anteriores à quinzena de entrevista; a recolha retrospetiva abrange ainda os recebimentos gratuitos e a título de salário. A recolha de dados sobre a valorização do autoconsumo, do autoabastecimento, da autolocação e dos recebimentos em géneros e salários em espécie permite o desenvolvimento da caraterização e análise do rendimento total das famílias, complementando os indicadores habituais baseados na distribuição do rendimento monetário. No inquérito realizado em 2010/2011 foi utilizado pela primeira vez o registo informático na recolha das despesas em bens e serviços de consumo corrente, através da integração da COICOP-IDEF na aplicação informática do inquérito, e no sentido de se obterem ganhos de qualidade, de proximidade local e temporal na relação entrevistador/família. A recolha dos dados sobre o alojamento, agregado, indivíduos, conforto e bens de equipamento, receitas monetárias líquidas e despesas de consumo supra quinzenais mantiveram o método de recolha utilizado nas edições anteriores: entrevista direta presencial com computador (CAPI). Para a classificação das despesas com bens ou serviços é utilizada a Classificação do Consumo Individual por Objectivo adaptada aos Inquéritos às Despesas das Famílias (COICOP-IDEF), considerada na harmonização subjacente à CCIO (Classificação do Consumo Individual por Objetivo). A COICOP-IDEF associa a cada classe um período de referência específico (quinzenal, mensal ou trimestral de acordo com o que é mais frequentemente expectável), sendo necessário proceder à anualização dos valores das despesas indicados pelos respondentes através da aplicação de fatores multiplicativos que têm em conta o número de períodos no ano (26 no caso da periodicidade quinzenal, 12 no caso da periodicidade mensal, e 4 no caso de consumos a que está associada periodicidade trimestral).
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 25 3. Para quê? Durante muitos anos os inquéritos aos orçamentos familiares constituíram em Portugal a grande, e talvez única, referência para o desenvolvimento de estudos e caraterização das famílias portuguesas em termos do rendimento, despesas e condições de conforto. Mais recentemente, a existência de dados anuais sobre a distribuição do rendimento monetário das famílias harmonizados no âmbito EU-SILC não comprometeu a procura de informação dos rendimentos do IDEF, pela sua dimensão e representatividade regionais, e pela possibilidade de análise integrada do rendimento e despesa e das vertentes monetária e não monetária. Possibilita em particular um exercício de consistência de outros instrumentos estatísticos realizados pelo INE. Para além da publicação e apuramentos específicos disponíveis no Portal de Estatísticas Oficiais, os ficheiros de dados anonimizados disponibilizados pelo INE são amplamente utilizados para o desenvolvimento de análises detalhadas específicas sobre a distribuição do rendimento e despesas das famílias portuguesas. É neste contexto que se apresenta um exercício de análise de clusters para a classificação da população em grupos homogéneos segundo o seu padrão de despesas. 4. Caracterização de perfis de despesa: uma análise de clusters Através de uma análise de agrupamentos, procedeu-se à agregação dos agregados familiares em clusters, com o objetivo de encontrar agregados que possuam um padrão de despesas monetárias homogéneo intra-clusters e heterogéneo inter-cluster. As variáveis de agrupamento utilizadas correspondem às despesas monetárias para as onze primeiras Divisões da COICOP-IDEF, com aplicação do ponderador final do IDEF que integra um fator de correção das não respostas e o ajustamento por margens à população residente. Todas as variáveis utilizadas são numéricas, expressas em euros. Procedeu-se à transformação das variáveis originais em variáveis estandardizadas com vista a apresentarem a mesma amplitude. Devido ao elevado número de casos (n=9 489 agregados; 11 variáveis analisadas) foram utilizados métodos de classificação não hierárquica, nomeadamente o método K-means, que consiste na transferência de um indivíduo para o cluster cujo centróide se encontra a menor distância (Reis, 2001). Considerou-se o método K-means com k=4, por ter resultado na melhor diferenciação, coerente e com interesse interpretativo no que se refere ao perfil de despesa monetária dos agregados familiares em estudo.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 26 Tabela 1: Caracterização dos clusters Da análise dos resultados deste exercício, complementada pelo confronto com os restantes dados anonimizados disponíveis, evidenciam-se alguns aspetos: – Cluster 4 Um dos grupos (cluster 4) é muito numeroso − representa 60% das famílias residentes – e regista uma despesa monetária anual média reduzida: 8304€, que corresponde a cerca de metade da despesa monetária anual média no País, 15781€. São maioritariamente famílias sem crianças dependentes e em mais de 40% dos casos com a presença de pelo menos um idoso. Estes agregados familiares são também caraterizados por afetarem mais de metade da despesa monetária à aquisição de bens e serviços básicos (alimentação, habitação e transportes), com um valor médio destas despesas de 4516€, reduzido quando comparado com a média nacional de 7652€. Mais de metade destas famílias situa-se nos dois primeiros quintis de rendimento monetário por adulto equivalente. – Cluster 2 No extremo oposto, encontra-se o grupo de famílias correspondente ao cluster 2, em que a despesa monetária anual média, 50602€, mais do que triplica a despesa monetária anual média no País. Ao contrário das famílias do cluster 4, o tipo de despesa predominante corresponde às despesas em transportes (21,8%), sendo que os três tipos de despesas em bens e serviços básicos não excedem 40% do total das despesas monetárias. Para estas famílias, o segundo tipo de despesa mais relevante corresponde às despesas com hotéis, restaurantes, cafés e similares. São famílias maioritariamente pertencentes ao quintil de rendimento por adulto equivalente mais elevado e com crianças dependentes, e representam apenas 6% das famílias residentes. O valor médio das despesas monetárias em alimentação, habitação e transportes é elevado (20140€) quando comparado com a média nacional. CLUSTER 1 •Despesa monetária anual média = 23 843€ •Estrutura da despesa monetária: •28,8% em saúde •13,7% em alimentação •12,2% em habitação •12,2% em transportes •Representavam 4% dos agregados •56,2% nos 4º e 5º quintis de rendimento •72,6% dos agregados sem crianças dependentes •44,2% com pelo menos 1 pessoa idosa •Dimensão média do agregado: 2,6 pessoas CLUSTER 2 •Despesa monetária anual média = 50 602€ •Estrutura da despesa monetária: •21,8% em transportes •13,5% em hotéis e restauração •9,3% em alimentação •8,9% em lazer •8,7% em habitação •Representavam 6% dos agregados •74% no 5º quintil de rendimento •73,2% dos agregados com crianças dependentes •Dimensão média do agregado: 3,6 pessoas CLUSTER 3 •Despesa monetária anual média = 22 654€ •Estrutura da despesa monetária: •20,9% em transportes •16,5% em alimentação •12,3% em habitação •11,4% em hotéis e restauração •Representavam cerca de 30% dos agregados •58% nos 4º e 5º quintis de rendimento •Dimensão média do agregado: 3,2 pessoas CLUSTER 4 •Despesa monetária anual média = 8 304€ •Estrutura da despesa monetária: •20,2% em alimentação •19,8% em habitação •14,3% em transportes •Representavam 60% dos agregados •55,6% nos 1º e 2º quintis de rendimento •75,1% dos agregados sem crianças dependentes •44,1% com pelo menos 1 pessoa idosa •Dimensão média do agregado: 2,2 pessoas
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 27 – Clusters 1 e 3 Os clusters 1 e 3 registam despesas monetárias anuais médias de ordem de grandeza semelhante (respetivamente, 23843€ e 22654€), sendo todavia muito distintos na repartição desta despesas por Divisão e na sua representatividade populacional. O grupo de famílias do cluster 3, que representa 30% dos agregados familiares, afeta cerca de 50% da sua despesa à aquisição de bens e serviços básicos (alimentação, habitação e transportes). As famílias classificadas no cluster 1 representam apenas cerca de 4% dos agregados familiares e são caraterizadas pela predominância das despesas em saúde (28,8%) e por gastos com alimentação, habitação e transportes inferiores a 40%. Em mais de 40% dos casos incluem pelo menos uma pessoa idosa. Em média, as famílias do cluster 1 gastam menos 180€ por mês em alimentação, habitação e transportes (9077€) quando comparadas com as famílias do cluster 3 (11245€). Em ambos os clusters mais de metade das famílias situam-se nos dois últimos quintis de rendimento monetário por adulto equivalente. Figura 1: Proporção das famílias e Despesa monetária anual média por cluster Referências INSTITUTO NACIONAL DE ESTATÍSTICA (2012). Inquérito às Despesas das Famílias 2010/2011, Lisboa, Instituto Nacional de Estatística, I.P. MAROCO, J. (2007). Análise Estatística com utilização do SPSS, Lisboa, Edições Sílabo. REIS, E. (2001). Estatística Multivariada Aplicada, 2ªEdição, Lisboa, Edições Sílabo. Estrutura da despesa monetária Alimentação 13,7% 9,3% 16,5% 19,8% Habitação 12,2% 8,7% 12,3% 20,2% Transportes 12,2% 21,8% 20,9% 14,3% Saúde 28,8% Lazer 8,9% Hotéis e restauração 13,5% 11,4% 23 843 € 50 602 € 22 654 € 8 304 € 0 € 60 000 € 0% 10% 20% 30% 40% 50% 60% 70% Cluster 1 Cluster 2 Cluster 3 Cluster 4 Proporção dos agregados Despesa monetária anual média
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 29 ST I – Sessão INE – 5ª Feira, 10 de Abril, Salão Nobre (17h50) Estimação do desemprego ao nível NUTS III Soraia Pereira1, Luís Correia2, Pedro Campos3 1Instituto Nacional de Estatística, [email protected]; 2Instituto Nacional de Estatística, luis.corr[email protected]t; 3Instituto Nacional de Estatística, pedro.campo[email protected] Sumário A quantificação do desemprego assume uma enorme importância social e política nas sociedades contemporâneas. Em Portugal, o Instituto Nacional de Estatística (INE) publica estimativas trimestrais sobre o mercado de trabalho a nível nacional e regional (NUTS I e II). No entanto, para níveis mais desagregados não se consegue obter uma precisão aceitável utilizando o mesmo método de estimação. Neste estudo propõe-se uma metodologia de estimação da taxa de desemprego ao nível NUTS III com base num modelo de regressão logística utilizado pelo Office for National Statistics (ONS) do Reino Unido. Palavras-chave: Estimação em pequenos domínios, IEFP, ONS, Regressão logística, Taxa de desemprego. 1. Introdução As estimativas da taxa de desemprego são publicadas trimestralmente pelo INE ao nível regional NUTS II (Norte, Centro, Lisboa, Alentejo, Algarve, Região Autónoma dos Açores, Região Autónoma da Madeira). Estas características são calculadas usando um método direto com base nos dados do Inquérito ao Emprego. Atualmente, as necessidades de conhecimento do mercado de trabalho impõem estimativas fiáveis para a taxa de desemprego a níveis mais desagregados, nomeadamente ao nível NUTS III (INE 2011). As NUTS III são domínios de menor dimensão em que se subdividem as NUTS II (Figura 1) e, como tal, a informação sobre algumas das variáveis de interesse não é suficiente para se obter estimativas com precisão aceitável recorrendo ao método já referido. Este é um problema de estimação em pequenos domínios (RAO, J. N. K. 2003). Este tipo de problemas surge em diversas áreas de aplicação, e originou vários projetos internacionais, tais como o EURAREA (CHAMBERS R. et al 2004), o SAMPLE (SAMPLE 2008), entre outros. Os modelos mais utilizados para resolver o problema de estimação em pequenos domínios são baseados na regressão linear. Entre estes modelos, destaca-se o modelo usado pelo Office for National Statistics (ONS), Instituto de Estatística do Reino Unido, que aplicou um modelo de regressão logística para produzir estimativas da taxa de desemprego para domínios territoriais designados por Parliamentary Constituencies (ONS 2009).
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 36 originais (índices e estruturas de ponderação). Foi necessário um esforço de transcrição de dados de modo a ser possível utilizar ferramentas informáticas na compilação desta série longa. Este processo permitiu também melhorar a qualidade dos índices, pois foi possível aumentar a precisão dos cálculos e corrigir alguns erros de agregação detetados nos dados dos períodos mais antigos. 4. Apresentação da série e dos principais resultados Como resultado deste trabalho, conseguiu compilar-se uma série do IPC para o período 1949-2013, consistente com a metodologia atualmente utilizada no cálculo mensal do IPC. O comportamento dos preços ao longo deste período de 65 anos (Gráfico 1) refletiu vários ciclos económicos, nomeadamente, as transformações das características e do modo de funcionamento da economia portuguesa, as alterações significativas que se produziram no enquadramento internacional e as políticas económicas adotadas nesse período. Entre 1948 e meados da década de 1960 a inflação manteve-se estável em níveis relativamente baixos. A partir de meados da década de 60, os preços evidenciaram aumentos mais acentuados. Gráfico 1: Taxas de variação do Índice de Preços no Consumidor No início da década de 1970, o IPC registou uma aceleração para níveis mais elevados, com a taxa de variação média de 12 meses a ultrapassar os 10% em dezembro de 1971 e a
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 37 manter-se em valores superiores ou muito próximos nos anos seguintes. A desvalorização substancial da moeda nacional, a que se assistiu a partir da segunda metade da década de 70 e que se prolongou na primeira metade da década seguinte, foi outro fator decisivo para os elevados níveis de inflação que então se registaram. Entre abril de 1974 e dezembro de 1985 a taxa de variação média de 12 meses do IPC oscilou entre um máximo de 30,5% em agosto de 1984 e um mínimo de 14,5% em abril de 1981. Durante a grande maioria dos meses neste período a variação média anual situou-se próxima ou acima de 20%. Na segunda metade da década de 80, o IPC desacelerou de forma significativa, num enquadramento externo marcado pela adesão à Comunidade Económica Europeia em 1986 e pela redução substancial nos preços do petróleo em 1984-1985. Na década de 90, e no contexto da preparação da participação de Portugal na União Monetária, continuou a redução da taxa de inflação refletindo nomeadamente a alteração da política monetária que passou a orientar-se para a estabilidade cambial como objetivo intermédio para atingir a estabilidade de preços. Efetivamente, desde março de 1995, a taxa média de variação do IPC manteve-se sempre abaixo dos 5%. Desde a introdução do euro que a taxa de variação média apresenta valores relativamente baixos, tendo mesmo ocorrido variações negativas durante o ano de 2009 na sequência da crise económica mundial iniciada no final do ano anterior. Agradecimentos: Fundação para a Ciência e a Tecnologia: Bolsa SFRH/BGCT/51126/2010 (Ana Paula Diogo) e Bolsa SFRH/BGCT/51751/2011 (Anabela Silva). Referências: DIOGO, A. P. (2011). Série longa de inflação em Portugal – Análise do período 1976-2010 com base no IPC. Tese de Mestrado em Economia ISCTE/IUL. INE (2012). Destaque do Índice de Preços no Consumidor – Abril 2012. INE (2014). Destaque do Índice de Preços no Consumidor – Janeiro 2014. SILVA, A. (2013). Séries longas de inflação em Portugal 1977-1948.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 39 ST II – Sessão Banco de Portugal – 6ª Feira, 11 de Abril, Salão Nobre (10h40) Non-financial sector indebtedness Filipa Lima1, Inês Correia2, Rodrigo Batista3 1Banco de Portugal, [email protected]; 2Banco de Portugal, [email protected]; 3Banco de Portugal, [email protected] Abstract The monthly publication of statistics concerning the non-financial sector indebtedness was one of the most outstanding achievements of the Statistics Department of Banco de Portugal in the recent years. Combining different dimensions of analysis, through the use and matching of the databases within the Department, it allows an innovative insight to the indebtedness of the sector. In this paper we briefly present the compilation methodology and some of the results that can be drawn from the data. Keywords: Central bank statistics, Indebtedness, Micro-data, Non-financial sector. 1. Introduction The thorough assessment of the current Portuguese economic and financial context by the three international organisations participating in the EU/IMF Financial Assistance Programme (FAP) proved to be quite demanding in terms of information requirements, with increasing requests for more detailed information. These requests focused in several areas of the economy with a special attention being drawn upon the indebtedness levels, not only for the general government, but for the entire non-financial sector. In February 2012, Banco de Portugal initiated the publication of the new chapter K and section A.20 of the Statistical Bulletin on the debt of the non-financial sector (Figure 1). This publication reflects the concerns of Banco de Portugal in making accessible to the public the information required by the international organisations. This new chapter provides an innovative insight to the indebtedness of the non-financial sector since, for the first time, it provides data for several dimensions of analysis, namely: debtor and creditor sectors, type of financial instrument, original maturity, economic activity and size of the company. These dimensions are crossed between them offering information at an unprecedented level, even when comparing at an international level. 2. Methodological framework This approach to data compilation requires some preconditions. Starting by the classification of the debtor according to its institutional sector, it is necessary to define the nonfinancial sector. The non-financial sector is composed of several entities that can be separated into two distinct groups, public or private entities, according to their ownership. Within the
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 40 private sector, the debtors can be allocated to the private corporations sector, in case they are a company, or otherwise to the private individuals sector. Within the public sector the allocation is made considering whether or not the entities are within the scope of the general government. It is important to mention that the public corporations can either be inside or outside the general government sector (Figure 1). The private corporations are also classified according to their sector of activity and their size. Figure 1: Delimitation of the non-financial sector Information on the debtor side is crossed with that on the creditor’s so that it is possible to measure how much funding is being channelled by which creditor to which debtor. Five categories of creditor are specified, four of them internal (general government, financial sector, corporations, private individuals) and the last concerning external creditors. The data is further broken down by financial instrument and original maturity. As stated in the Statistical Press Release, “the concept of debt presented in this new chapter includes loans, debt securities and trade credits. In the case of general government, it includes also saving certificates, Treasury certificates and other Treasury liabilities. The values presented are based on end-of-period positions valued at nominal value, excluding accrued interest” [BANCO DE PORTUGAL (2012)]. Unless stated otherwise, the data refer to nonconsolidated debt. 3. Databases and mapping The combination of the several dimensions of analysis is only possible with the use and matching of data available from the several databases managed by the Statistics Department of Banco de Portugal. Besides the direct contribution given by the different data sources to the final output, there are information flows between the data sources themselves, where the aggregated data are complemented by data coming from micro-databases. For example we map information provided by the Central Balance Sheet Database (CBSD) to the Central Credit Register (CCR) so that we can breakdown bank loans by the private companies’ size. This Non-financial Sector Non-Financial Private Sector Private Corporations Private Individuals Non-Financial Public Sector General Government (GG) GG entities except corporations Public corporations included in the GG Public corporations not included in the GG Public Corporations
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 41 13 janeiro 2014 0 50 100 150 200 250 300 350 400 450 500 Dec-07 Dec-08 Dec-09 Dec-10 Dec-11 Dec-12 Dec-13 General government Public corporations not included in the general government Private corporations Private individuals 99% 160% 11% 78% 96% 184% 12% 153% upgrade to the information of the CCR micro-database will afterwards be used to allow an allocation of the information from Monetary and Financial Statistics. Crucial in this process is the correct matching between the different databases, for which a unique key identifier is used in a common list of entities. This key identifier is the element that allows a coherent classification of the debtors (size, economic activity sector, institutional sector) in the different micro-databases (CBSD, CCR, securities database and external operations database). 4. Statistical analysis Looking at the results, it is possible to see that the debt-to-GDP ratio of the Portuguese non-financial sector has increased from 346% in 2007 to 445% in 2013 (Figure 2). Figure 2 shows the composition of the non-financial sector debt. While the structure did not vary, both the general government and the private companies registered significant increases, +75 p.p. and 24 p.p., respectively. For private individuals, there was a small decrease from 2007 to 2013 from 99% to 96% of the GDP. Public companies not included in the general government remained stable at 12% of GDP. Figure 2: Debt-to-GDP Ratio Figure 3 shows, for each type of debtor, the structure of the creditors at end-2013. The detail by type of instrument is presented in Figure 4. Data for end-2007 are in parenthesis. From the figure it is observable that the share of the external sector in the debt of the general government decreased from 67% in 2007 to 56% in 2013, whereas the weight of the financial sector increased by 12 percentage points (p.p.). Regarding private corporations, the share of the external sector almost doubled, from 12% to 21%, in the same period, whereas the financial sector decreased its weight by 10 p.p.. For public corporations, the funding distribution across creditor’s sector changed considerably, with an increase from almost 0% to 25% in the share of the funding coming from the general government while the share coming from the external sector decreased by 26 p.p..
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 42 Figure 3: Non-financial sector debt by creditor sector Dec-13 (Dec-07) The financing structure of the general government changed significantly between 2007 and 2013: while the external sector is still the main creditor, debt securities (59% at end-2007, 25% at end-2013) were replaced by loans granted under the FAP (31% at end-2013, 7% at end- 2007); internal financing was mainly done through debt securities (+13 p.p.). For public corporations, domestic loans (mainly granted by the general government) represented at end- 2013 the largest share (48%, 25% at end-2007) while at end-2007 external loans dominated (45%, 23% at end-2013). For private corporations, domestic loans decreased from 63% at end- 2013 to 59% at end-2007, compensated by both external loans and debt securities held by nonresidents (+4 p.p. each). Figure 4: Non-financial sector debt by instrument Dec-13 (Dec-07) Disclaimer 6% 44% 16% 6% 29% Non-Financial Sector 15% 24% 2% 4% 56% General Government 25% 29% 11% 0% 35% Public Corporations 1% 39% 29% 11% 21% Private Corporations 59% 9% 7% 7% 18% Domestic Loans External Loans Debt securities held by residents Debt securities held by non residents Other (7%) (22%) (18%) (50%) (9%) (5%) (10%) (12%) (2%) (61%) (67%) (1%) (47%) (29%) (10%) (12%) (0%) (27%) (11%) 1% 39% 29% 11% 21% Private Corporations General Government Financial Sector Corporations Private Individuals External 49% 15% 11% 12% 13% Non-Financial Sector 12% 31% 24% 25% 8% General Government 48% 23% 11% 11% 7% Public Corporations 59% 9% 7% 7% 18% Private Corporations (15%) (5%) (17%) (6%) (57%) (6%) (7%) (16%) (7%) (59%) (22%) (45%) (25%) (63%) (5%) (16%) (12%) (7%) (3%) (7%) 59% 9% 7% 7% 18% Domestic Loans External Loans Debt securities held by residents Debt securities held by non residents Other Trade Credits (in the case of the General Government it also includes Savings and Treasury certificates and other Treasury liabilities)
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 43 The analyses, opinions and findings of this paper represent the views of the authors, which are not necessarily those of the Banco de Portugal or the Eurosystem. Any errors and omissions are the sole responsibility of the authors. References BANCO DE PORTUGAL (2012), New chapter on non-financial sector indebtedness (Statistical Press Release)
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 45 ST II – Sessão Banco de Portugal – 6ª Feira, 11 de Abril, Salão Nobre (11h00) High-growth enterprises in Portugal Homero Gonçalves1, Mário Lourenço2, Vítor Silveira3 1 Banco de Portugal, [email protected]; 2 Banco de Portugal, [email protected]; 3 Banco de Portugal, [email protected] Abstract In an economic crisis, such as the most recent one, examples of success and growth, counter-cyclical to the general recessive environment, are often used as beacons for other companies towards a path of recovery. Information available at Banco de Portugal allows the identification of a set of companies with high growth rates and of its distinctive features, as well as of the economic activities within which its presence is most noteworthy. Keywords: Enterprises, Growth, Dynamics, Micro-data. 1. Motivation and conceptual framework The Portuguese economy faced a significant contraction over the last few years during which unemployment grew to record levels. It is then crucial to restore growth and for that a key issue relates to the promotion of entrepreneurial dynamics. High-growth enterprises (HGE) play an important role in this matter as they are usually linked with innovation and job creation. A better knowledge about these firms would allow policy makers to develop appropriate approaches in order to maximize the chances of developing HGE [OECD (2010)]. In order to identify such companies, it is common to consider the EUROSTAT-OECD (2007) approach according to which HGE are those achieving an average annual growth rate above 20% for a period of three consecutive years, having such growth evaluated either considering the number of employees or, as is the case of the present analysis, the turnover. 2. Methodological approach and data description The need for in depth knowledge of the non-financial corporations (NFC) sector in Portugal led Banco de Portugal to the development of a business register combining data from the several databases it manages while also using other administrative sources. This business register, which is being constantly automatically updated with the most recent relevant information, gathers information on each enterprise’s characteristics through a time-span of over 20 years [GONÇALVES et. al. (2013)]. Identifying HGE as a subset of this population is not straightforward. Potential HGE’s turnover variations must be derived organically from their current activity, i.e., unrelated to other effects that could bias the analysis. Hence, in this exercise, enterprises involved in
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 52 Finally, the information on the population of NFC comes from the reference population of NFC, which is a business register that combines information from several sources from Banco de Portugal and other public entities, such as the Ministry of Justice and Statistics Portugal [GONÇALVES et al. (2013)]. This database comprises, for each non-financial corporation operating in Portugal, a set of structural information (legal person identification number, location of the head office and sector of economic activity) as well as economic variables (number of employees, turnover, total assets and equity, for each year). 1.2. Other databases The CBSD also uses information from other databases managed by the Statistics Department. The SSIS is a database with data on securities issues and portfolios, on a “security-by-security” and “investor-by-investor” basis. As for the CCR, this is a database with information on actual and potential credit liabilities towards financial credit institutions granting credit in Portugal. 2. The annual procedure The information of the reference population of NFC concerning the sector of economic activity and the annual turnover for each corporation is considered the foundation stone of this procedure. In order to fill information gaps existing in the annual database, a two-stage procedure has been defined: (i) the imputation of total assets, combining cold-deck and mean imputation methods in three sequential steps, in order to improve the information from the reference population of NFC to be used in subsequent procedures; (ii) with the outcome of the first stage, a treatment of non-response is applied over annual data in order to produce information relating to all NFC. In this stage, we have implemented a mean imputation process in three sequential steps. As Figure 1 shows, this procedure allows the estimation of data for about 2% of the NFC with no response to IES in 2012. Figure1: Non-response rate, by sector of economic activity (2012) (%)
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 53 3. The quarterly procedure The quarterly procedure estimates the quarterly population totals for a set of variables, combining quarterly data from ITENF database with the ancillary information that results from the annual procedure. The latter set of information is incorporated in two different steps: first, by the post stratification of the sample, and then by the ratio estimator. 3.1. Post stratification of the sample The extrapolation methodology includes the post stratification of the sample, by sector of economic activity and one out of two quantitative ancillary variables, each one directed to the estimation of a specific set of variables: (i) Turnover, for the activity variables, trade credits and inventories, or (ii) Total assets, for the remaining balance-sheet and interest expenses indicators. The post strata are defined with ancillary information from the reference population of NFC. 3.2. Ratio estimator The ancillary information available in the annual database is useful to calibrate the quarterly estimates, through a ratio estimator, defined as follows: Where is the ratio estimate for the population total of variable Y in post stratum h, is the number of responses in post stratum h, is the number of corporations in post stratum h in the population, is the variable Y for corporation i, is the probability of selection for corporation i, and is the ancillary quantitative variable for corporation i. There are two possible ancillary quantitative variables: (i) Total income, for activity, trade credits and inventory indicators, and (ii) Total assets, for the remaining balance-sheet and interest expenses indicators. Figure 2a uses, as an example, the Obtained funding for the Manufacturing, mining and quarrying sector to compare the Horvitz-Thompson estimator with the ratio estimator, as defined before, and we conclude that the latter has a smaller deviation from the annual.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 54 4. The reconciliation procedure To reconcile the annual and quarterly series, it is applied an adjustment procedure referred as benchmarking that follows the movement preservation principle developed by DENTON (1971), which consists in obtaining adjusted series that keep the dynamics of the original quarterly series, through the minimisation of a quadratic loss function subject to a set of constraints that ensure (i) the temporal consistency between the adjusted quarterly time-series and the annual figures relating the population of NFC, that result from the annual procedure, and (ii) for each period, that the accounting equilibrium is met. Figure 2b continues the example mentioned in the previous section to illustrate the results from this procedure. 5. Final remarks The outcome of the process described in this paper is a set of quarterly time-series, divided into Balance sheet and Profit and loss account indicators for all NFC, as well as a set or economic and financial ratios broken down by economic activity, size and capital holding sector. Given the amount of detail of these statistics, the use of ancillary information through the different techniques here described plays an important role in each of the procedures, as it improves the quality of the estimates, as well as it provides a link between the annual and quarterly databases. Acknowledgement and disclaimer: We would like to thank Prof. Pedro Simões Coelho for his valuable contribution for development of the estimator for the quarterly data. The analyses, opinions and findings of this paper represent the views of the authors, which are not necessarily Figure 2a: Quarterly procedure Figure 2b: Reconciliation procedure Figure 2: Obtained funding – Manufacturing, mining and quarrying
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 55 those of the Banco de Portugal or the Eurosystem. Any errors and omissions are the sole responsibility of the authors. References BANCO DE PORTUGAL (2008), Simplified reporting: Inclusion of the Simplified Corporate Information in the Statistics on Non-Financial Corporations from the Central Balance-Sheet Database, Supplement 1/2008 to the Statistical Bulletin, Banco de Portugal. BANCO DE PORTUGAL (2013), Estatísticas das Empresas Não Financeiras da Central de Balanços – notas metodológicas, Supplement 2/2008 to the Statistical Bulletin, Banco de Portugal (Portuguese version). DENTON, Frank T. (1971), Adjustment of Monthly or Quarterly Series to Annual Totals: An Approach Based on Quadratic Minimization. Journal of the American Statistical Association, 66 (Mar. 1971), 99-102. GONÇALVES, H. and LOURENÇO, M. (2013), Building business registers to monitor entrepreneurial dynamics, IFC Bulletin, 37, 42-45. INE (2012), Documento Metodológico – Inquérito Trimestral às empresas não financeiras, versão 2.1, fevereiro de 2012 (Portuguese version).
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 57 ST III – Sessão 20 anos da CLAD – 6ª Feira, 11 de Abril, Salão Nobre (17h05) Classes de objectos simbólicos: dados da indústria automóvel Áurea Sousa 1, Helena Bacelar-Nicolau 2, Fernando C. Nicolau 3, Osvaldo Silva4 1Universidade dos Açores, Departamento de Matemática, CEEAplA, CMATI, [email protected]t; 2Universidade de Lisboa, Faculdade de Psicologia (LEAD), ISAMB, hbacel[email protected]; 3Univ. Nova de Lisboa, FCT, Dep. de Matemática e DataScience, g[email protected]rg 4Universidade dos Açores, Departamento de Matemática, CES, CMATI, osi[email protected] Sumário Neste trabalho, é abordada a Análise Classificatória Hierárquica Ascendente (ACHA) de dados simbólicos ou complexos (generalizações de dados clássicos), com base no coeficiente de afinidade generalizado ponderado e em critérios de agregação clássicos e probabilísticos, estes últimos no âmbito da metodologia VL. São apresentados os principais resultados obtidos com a ACHA de 33 modelos de carros (dados simbólicos na área da indústria automóvel), com base no coeficiente de afinidade generalizado ponderado, centrado e reduzido pelo método de Wald e Wolfowitz, comparando-se os resultados obtidos com os de outros autores e com a partição definida a priori pelas categorias (“Utilitário”, “Berlina”, “Desportivo”, “Luxo”) a que os modelos de carros pertencem. Palavras-chave: Análise classificatória hierárquica, Coeficiente de afinidade generalizado ponderado, Dados simbólicos ou complexos, Metodologia VL. 1. Introdução Na sociedade actual, onde os avanços computacionais têm imperado, é cada vez mais frequente a utilização de bases de dados, sendo fundamental efectuar a síntese de conjuntos de dados de elevada dimensão em termos dos seus conceitos subjacentes, os quais têm de ser descritos por dados mais complexos, designados por dados simbólicos. Estes dados podem ser heterogéneos e são representados em tabelas, cujas células podem conter um ou mais valores, tais como subconjuntos de categorias, intervalos da recta real, ou distribuições de frequências (Bock and Diday, 2000; Bacelar-Nicolau, 2000, 2002; Bacelar-Nicolau et al., 2009, 2010; Sousa et al., 2013). As linhas da tabela de dados representam unidades de dados ou objectos simbólicos e as colunas representam variáveis simbólicas. Muitas medidas de proximidade entre objectos simbólicos têm sido referidas na literatura (Bock e Diday, 2000). Uma vez obtida a matriz de proximidades entre os elementos do conjunto a classificar, podem ser aplicados critérios de agregação clássicos ou probabilísticos (Bacelar-Nicolau et al., 2009, 2010; Sousa et al., 2013). Neste trabalho, a ACHA foi efectuada com base no coeficiente de afinidade generalizado ponderado (Bacelar-Nicolau, 2000; Bacelar- Nicolau et al., 2009, 2010) e em três critérios de agregação probabilísticos no âmbito da Metodologia VL (Nicolau, 1983; Nicolau e Bacelar-Nicolau, 1998), sobre um conjunto de dados retirado da literatura da análise de dados complexos.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 58 2. Análise classificatória hierárquica de objectos simbólicos com base no coeficiente de afinidade generalizado ponderado A Análise Classificatória (Cluster Analysis) tem como objectivo identificar grupos (classes) de entidades (indivíduos, objectos, etc.), relativamente homogéneos e, de preferência, bem separados, com base nas semelhanças ou dissemelhanças entre essas entidades. Os métodos hierárquicos aglomerativos começam por considerar um número de classes igual ao número de elementos a classificar e posteriormente, em cada etapa, efectuam a junção ou aglomeração de classes em classes maiores, obtendo-se na última etapa um único grupo contendo todos os elementos a classificar. A partir do coeficiente de afinidade entre duas distribuições de probabilidade discretas, proposto por Matusita (1951), Bacelar-Nicolau (1980, 1988) introduziu o coeficiente de afinidade no domínio da Análise Classificatória, para avaliar a semelhança básica entre pares de colunas ou pares de linhas de uma matriz de dados, ou seja, entre variáveis ou entre indivíduos, conforme o conjunto que se pretende classificar. Este coeficiente foi estendido a diferentes tipos de dados, incluindo dados de tipo heterogéneo e de natureza complexa (ou simbólicos) (Bacelar-Nicolau, 2000, 2002; Bacelar-Nicolau et al., 2009, 2010), frequentemente presentes em bases de dados de elevada dimensão. Os critérios de agregação probabilísticos usados, no âmbito da Metodologia VL, recorrem essencialmente a noções probabilísticas para a definição das funções de comparação (Nicolau, 1983; Nicolau e Bacelar-Nicolau, 1998). A extensão do coeficiente de afinidade para o caso de dados simbólicos é designada por coeficiente de afinidade generalizado ponderado (Bacelar-Nicolau, 2000, 2002; Bacelar- Nicolau et al., 2009, 2010). O coeficiente assintoticamente centrado e reduzido, sob uma hipótese de referência permutacional baseada no teorema limite de Wald e Wolfowitz permite, por sua vez, definir um coeficiente probabilístico no contexto da metodologia VL, na linha iniciada por Lerman (1972, 1981) e desenvolvida por Bacelar-Nicolau (e.g.1980, 1987, 1988) e Nicolau (e.g. 1983, 1998). Aplicações da extensão do coeficiente de afinidade para o caso de dados simbólicos foram apresentadas, por exemplo, em Bacelar-Nicolau et al. (2009, 2010) e em Sousa et al. (2013). 3. Exemplo da indústria automóvel: “Car data set” A matriz de dados simbólicos que aqui usamos, para exemplificar a metodologia, é referida na literatura da análise de dados simbólicos (e.g., De Carvalho et al., 2006a, 2006b; Souza et al., 2007) e contém trinta e três modelos de carros (objectos simbólicos), descritos por oito variáveis cujos valores são intervalos da recta real (“Preço”, “Cilindrada”, “Velocidade Máxima”, “Aceleração”, “Passo”, “Comprimento”, “Largura” e “Altura”), duas variáveis categóricas ("Alimentação" e "Tracção") com categorias não ordenadas que podem assumir múltiplos valores (subconjuntos de categorias) e uma variável nominal (“Categoria do Carro”). Esta última variável, com as modalidades “Utilitário”, “Berlina”, “Desportivo” e “Luxo”, reflecte a classificação a priori dos modelos de carros, a qual pode ser encontrada, por exemplo, em De Carvalho et al. (2006a, 2006b). A Tabela 1 mostra uma parte da matriz de
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 59 dados simbólicos, sendo de referir que a matriz de dados completa está disponível no software SODAS (Symbolic Official Data Analysis System). Tabela 1-Parte da matriz de dados simbólicos -“Car data set” Modelo Preço Cilindrada Alimentação Tracção . . . Altura Categoria Alfa 145 [27806, 33596] [1370, 1910] Gasoli, Diese Anter . . . [143, 143] Utilit Alfa 156 [41593, 62291] [1598, 2492] Gasoli Anter . . . [142, 142] Berlina . . . . . . . . . . . . . . . . . . . . . Passat [39676, 63455] [1595, 2496] Gasoli, Diese Anter, Integ . . . [146, 146] Luxo Nesta comunicação, são apresentados os principais resultados obtidos com a A.C.H.A. dos trinta e três modelos de carros, com base no coeficiente de afinidade generalizado ponderado, centrado e reduzido pelo método de Wald e Wolfowitz, e em três critérios de agregação probabilísticos, AVL, AV1 e AVB (Nicolau, 1983; Bacelar-Nicolau, 1988; Nicolau e Bacelar- Nicolau, 1998; Lerman, 1972, 1981). Os principais resultados obtidos são comparados com os de outros autores (e.g., De Carvalho et al., 2006a, 2006b; Souza et al., 2007). Referências BACELAR-NICOLAU, H. (1980) Contribuições ao Estudo dos Coeficientes de Comparação em Análise Classificatória, Tese de Doutoramento, FCL, Universidade de Lisboa. BACELAR-NICOLAU, H. (1987) On the Distribution Equivalence in Cluster Analysis. In Devijver, P.A. & Kittler, J. (Ed.) Pattern Recognition Theory and Applications, NATO ASI Series, Series F: Computer and Systems Sciences, vol. 30, New York, Springer - Verlag, 73-79. BACELAR-NICOLAU, H. (1988) Two Probabilistic Models for Classification of Variables in Frequency Tables. IN BOCK, H.-H. (Ed.) Classification and Related Methods of Data Analysis. North Holland, Elsevier Sciences Publishers B.V., pp. 181-186. BACELAR-NICOLAU, H. (2000) The Affinity Coefficient. IN BOCK, H.-H. & DIDAY, E. (Ed.) Analysis of Symbolic Data: Exploratory Methods for Extracting Statistical Information from Complex Data. Series: Studies in Classification, Data Analysis, and Knowledge Organization, Berlin, Springer-Verlag, 160-165. BACELAR-NICOLAU, H. (2002) On the Generalised Affinity Coefficient for Complex Data. Biocybernetics and Biomedical Engineering, 22(1), 31-42. BACELAR-NICOLAU, H., NICOLAU, F.C, SOUSA, Á. & BACELAR-NICOLAU, L. (2009) Measuring Similarity of Complex and Heterogeneous Data in Clustering of Large Data Sets. Biocybernetics and Biomedical Engineering, 29 (2), 9-18.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 60 BACELAR-NICOLAU, H., NICOLAU, F.C., SOUSA, Á., BACELAR-NICOLAU, L (2010) Clustering Complex Heterogeneous Data Using a Probabilistic Approach. Proceedings of the Stochastic Modeling Techniques and Data Analysis International Conference (SMTDA2010), 85-93, (electronic publication). BOCK, H.-H. & DIDAY, E. (2000) Analysis of Symbolic Data: Exploratory Methods for Extracting Statistical Information from Complex Data. Series: Studies in Classification, Data Analysis, and Knowledge Organization, Berlin: Springer-Verlag. DE CARVALHO, F.A.T., BRITO, P. & BOCK, H.-H. (2006a) Dynamic Clustering for Interval Data Based on L2 Distance. Computational Statistics, 21(2), 1-19. DE CARVALHO, F.A.T., SOUZA, R.M.C.R. de, CHAVENT, M. & LECHEVALLIER, Y. (2006b) Adaptive Hausdorff Distances and Dynamic Clustering of Symbolic Interval Data. Pattern Recognition Letters, 27 (3), 167-179. LERMAN, I.C. (1972) Étude Distributionelle de Statistiques de Proximité entre Structures Algébriques Finies du Même Type: Apllication à la Classification Automatique, Cahiers du B.U.R.O., 19, Paris. LERMAN, I.C. (1981) Classification et Analyse Ordinale des Données, Paris, Dunod. NICOLAU, F.C. (1983) Cluster Analysis and Distribution Function. Methods of Operations Research, 45, 431-433. NICOLAU, F.C. & BACELAR-NICOLAU, H. (1998) Some Trends in the Classification of Variables. IN Hayashi, C., Ohsumi, N., Yajima, K., Tanaka, Y., Bock, H.-H., Baba, Y. (Ed.) Data Science, Classification, and Related Methods. Springer-Verlag, 89-98. MATUSITA, K. (1951) On the Theory of Statistical Decision Functions. Ann. Instit. Stat. Math, III, 1-30 SOUSA, Á., NICOLAU, F., BACELAR-NICOLAU, H. & SILVA, O. (2013) Clustering of Symbolic Data based on Affinity Coefficient: Application to a Real Data Set. Biometrical Letters, 50 (1), 27-38. SOUZA, R.M.C.R., DE CARVALHO, F.A.T., & PIZZATO, D.F. (2007) A Partitioning Method for Mixed Feature-Type Symbolic Data Using a Squared Euclidean Distance. IN FREKSA, C., KOHLHASE, M., & SCHILL, K. (Ed.) KI 2006: Advances in Artificial Intelligence. 29th Annual German Conference on AI, KI 2006, Bremen, Germany, June 14-17, 2006, Proceedings. Series: Lecture Notes in Computer Science, Vol. 4314, Berlin Heidelberg, Springer-Verlag, 260-273.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 61 ST III – Sessão 20 anos da CLAD – 6ª Feira, 11 de Abril, Salão Nobre (17h25) A hierarchical conceptual clustering based on the quantile method for mixed data Manabu Ichino1, Paula Brito2 1School of Science and Engineering, Tokyo Denki University, Japan, [email protected]; 2Faculdade de Economia & LIAAD-INESC TEC, Universidade do Porto, Portugal, m[email protected].pt Abstract We consider the case where each element of the set to be analyzed is described by variables of different types. The quantile method transforms each element to (m+1) numerical vectors, called the quantile vectors, for a given integer m, which controls the granularity of concepts generated. We define the concept size of a p-dimensional hyper-rectangle spanned by quantile vectors. The proposed hierarchical clustering method agglomerates clusters so as to minimize the concept size of the clusters formed, so as to achieve the compactness of the cluster descriptions. We introduce the weighted self-information (WSI), based on the concept size, to find informative clusters. Conjunctive logical expressions for clusters selected by the WSI are obtained. Keywords: concept size, compactness, hierarchical conceptual clustering, quantile method, symbolic data analysis. 1. Quantile representation Following the approach presented in Ichino (2008), the proposed method is based on a common representation model for data described by variables Yj, j=1,….p, of possibly different types, which uses some predefined quantiles of the underlying distribution of the observed data values. We are interested in symbolic data, i.e., data that comprises intrinsic variability, and consider the different symbolic variable types, as defined in Noirhomme and Brito (2011). Let S ={s1, ….sn} be the set of elements to be clustered. If the m-th quantiles Q1…, Qj, …, Qm-1, are chosen, with (Qj)= j/m, then each observation, for each element si S and each variable Yj, is represented by a (m+1) dimensional vector (Q0=Min, Q1,..., Qj,…, Qm-1, Qm=Max). The value of m controls the level of granularity of data representation, and it is a user's choice. For the sake of simplicity, but also because of their broad utilization, let us suppose that we use the quartiles, i.e., m=4. The quartile representation is then defined by the 5-uple (Min, Q0.25, Q0.5, Q0.75, Max) where Q0.25, Q0.5, are Q0.75 are the quartiles. In the case of multi-valued numerical variables, quantiles may be determined as in classical descriptive statistics, assuming equal weights for each observed value. Here we follow Mood et al (1994) and use the Empirical Distribution Function, without interpolation - defining the quantile Qj as the first observed value x, in the ranked list, where the condition F(x) j/m is met. For intervalvalued variables, an underlying distribution must be assumed within each observed interval; this may be the Uniform distribution, as proposed by Bertrand and Goupil (2000); however, other distributions may be considered, e.g., the Triangular distribution, or even any parametric
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 68 de quatro em quatro anos com a finalidade de gerar informação de qualidade sobre os resultados do desempenho dos alunos e sobre os contextos em que estes aprendem. Portugal participou no primeiro ciclo do TIMSS em 1995 e voltou a participar na prova do 4º ano em 2011. O PIRLS é uma avaliação internacional sobre a compreensão da leitura dos alunos do 4.º ano de escolaridade, desenvolvida pela IEA. Desde 2001, os testes PIRLS são aplicados de cinco em cinco anos com a finalidade de gerar informação de qualidade sobre os resultados do desempenho dos alunos em leitura e sobre os contextos em que estes aprendem. Em 2011, foi criada uma versão para aplicar em países cujos alunos estão aquém dos níveis de leitura estabelecidos para o PIRLS (prePIRLS). Portugal participou pela primeira vez no PIRLS em 2011. Em 2011, a aplicação dos dois estudos da IEA, o TIMSS e o PIRLS, coincidiu, o que permitiu relacionar a literacia de leitura dos alunos do 4.º ano de escolaridade com o seu desempenho em matemática e ciências. 2. As Provas PISA, TIMSS e PIRLS A prova do PISA é constituída por 13 cadernos de teste que combinam itens dos diferentes domínios avaliados, tendo cada aluno respondido a um único caderno de teste que lhe foi atribuído aleatoriamente. O teste PISA tem sido aplicado em papel e tem uma duração total de duas horas, ocupando os itens do domínio principal 2/3 do tempo total da prova. Em cada ciclo, a avaliação relativa ao domínio principal é mais detalhada. Por exemplo, no PISA 2012 participaram 65 países e economias e a avaliação em literacia matemática, considerou itens relativos a três processos cognitivos - Formular; Aplicar e Interpretar – e quatro conteúdos – Quantidade; Incerteza; Mudança e relações; Espaço e forma. O PISA não se limita a avaliar se um aluno reproduz eficazmente os conhecimentos adquiridos, procura antes aferir se os alunos conseguem aplicar, em contextos diferenciados, o que aprenderam. Uma abordagem desta natureza procura perceber se as sociedades contemporâneas reconhecem e valorizam os indivíduos não por aquilo que eles sabem mas por aquilo que eles conseguem fazer com o que sabem (OCDE, 2012). Neste projeto, são também recolhidas informações que permitem contextualizar os resultados, através da aplicação de questionários aos alunos, aos pais e às escolas. O PISA permite, pois, identificar os fatores que influenciam os níveis de desempenho nos vários domínios de literacia, nomeadamente, elementos sociodemográficos dos alunos e da sua relação com a aprendizagem e, ainda, diversas características das escolas participantes, como a sua organização e recursos. A prova do TIMSS é constituída por um conjunto de cadernos, numa composição de itens de matemática e de ciências que abrangem os três processos cognitivos (Aplicar, Conhecer e Raciocinar). Cada aluno responde a um único caderno de prova. A avaliação em matemática
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 69 considera duas dimensões: uma relativa ao conteúdo – Números, Formas Geométricas e Medida, Apresentação de Dados – e a outra ao domínio cognitivo. A avaliação em ciências segue o mesmo desenho, sendo contempladas as seguintes áreas: Ciências da Vida, Ciências Físicas e Ciências da Terra. Neste estudo, a par dos testes, são também aplicados questionários visando recolher informação de contexto que permite descrever as situações e os fatores que influenciam a aprendizagem da matemática e das ciências. A prova do PIRLS foi desenhada de modo a contemplar duas finalidades de leitura, a literária - ler como experiência literária - e a informativa - ler para adquirir e utilizar informação -, assim como os processos de compreensão da leitura - Reter, Fazer inferências diretas, Interpretar e integrar e Avaliar -. A prova é constituída por um conjunto de cadernos, numa composição de itens que envolvem as diferentes finalidades e processos de compreensão da leitura. Cada aluno responde apenas a um caderno de prova. Também neste estudo, a par dos testes, são aplicados questionários visando recolher informação de contexto que permite descrever as situações e os fatores que afetam a literacia de leitura. Nestes três estudos, os itens não são públicos, possibilitando-se deste modo a comparação de resultados ao longo das várias edições da prova e a identificação de tendências. A OCDE e a IEA disponibilizam, em cada ciclo de cada um destes estudos, alguns itens que deixam de fazer parte das provas e que ilustram o tipo de situações apresentadas aos alunos. 3. O desempenho dos alunos portugueses A análise do desempenho dos alunos portugueses pode ser efetuada por valores de referência internacionais (benchmarks), ou por conteúdos e domínios cognitivos, ou ainda usando a informação de contexto recolhida por qualquer dos estudos internacionais em que Portugal participa. Os dados recolhidos e os resultados obtidos por estes estudos são tornados públicos pelos consórcios internacionais após a divulgação do relatório internacional e, permitem aos investigadores o acesso a um alargado leque de informação, contribuindo para que estes instrumentos de avaliação internacional possam ser reguladores do sistema de ensinoaprendizagem. No estudo PISA 2012 participaram 65 países/economias sendo 34 países membros da OCDE e 31 países parceiros. Neste ciclo PISA, Portugal obteve 487 pontos na escala da matemática, representando uma progressão de 21 pontos relativamente ao resultado alcançado em 2003 – ano em que a matemática também foi domínio principal. Esta pontuação coloca Portugal, pela primeira vez, desde o início do Programa PISA, na média da OCDE. No domínio da leitura Portugal alcançou 488 pontos, sendo a média dos países da OCDE neste domínio de 496 pontos e no domínio das ciências, 489 pontos, sendo a média dos países da OCDE neste domínio de 501 pontos. No TIMSS 2011, participaram 63 países e 14 participantes em Benchmarking. Neste estudo, o desempenho médio dos alunos portugueses em matemática foi de 532 pontos, numa
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 70 escala de 0-1000, com um ponto médio de referência de 500 e um desvio padrão de 100. Este resultado coloca Portugal entre os 15 países com melhor desempenho em matemática para o 4.º ano. Nesta prova e usando a mesma escala, o desempenho médio dos alunos portugueses do 4.º ano em ciências foi de 522 pontos o que o coloca entre os 19 países com melhor desempenho em ciências para o 4.º ano. No PIRLS 2011, participaram 49 países e 9 participantes em Benchmarking. Neste estudo, Portugal obteve um desempenho médio de 541 pontos o que o coloca entre os 19 países com melhor desempenho em leitura no 4.º ano. Nestes três estudos, em cada país participante, a amostragem é realizada em duas fases: num primeiro momento são selecionadas aleatoriamente as escolas e, num segundo momento são selecionados aleatoriamente os alunos ou as turmas de alunos de cada escola participante. Este tipo de metodologia, acarreta um cuidado especial na análise destes dados, uma vez que as técnicas estatísticas disponíveis nos softwares estatísticos mais comuns não são adequadas. Assim, estes estudos lançam um verdadeiro desafio aos investigadores não só pela colossal informação educacional gerada mas também pelos métodos estatísticos que devem ser usados na sua análise. Referências MARTIN, M.O., MULLIS, I.V.S., FOY, P., & STANCO, G.M. (2012). TIMSS 2011 International Results in Science, Chestnut Hill, MA: TIMSS & PIRLS International Study Center, Boston College MULLIS, I.V.S., MARTIN, M.O., FOY, P., & ARORA, A. (2012). TIMSS 2011 International Results in Mathematics, Chestnut Hill, MA: TIMSS & PIRLS International Study Center, Boston College MULLIS, I.V.S., MARTIN, M.O., FOY, P., & DRUCKER, K.T. (2012). PIRLS 2011 International Results in Reading, Chestnut Hill, MA: TIMSS & PIRLS International Study Center, Boston College OECD (2014). PISA 2012 Results: What Students Know and Can Do – Student Performance in Mathematics, Reading and Science (Volume I), PISA, OECD Publishing. ProjAVI (2012), PIRLS 2011 - Principais resultados em Leitura, www.projavi.mec.pt/np4/179/, (acedido em 21 de fevereiro de 2014). ProjAVI (2012), TIMSS 2011 Principais resultados em Ciências, www.projavi.mec.pt/np4/179/, (acedido em 21 de fevereiro de 2014). ProjAVI (2012), TIMSS 2011 Principais resultados em Matemática, www.projavi.mec.pt/np4/179/, (acedido em 21 de fevereiro de 2014). ProjAVI (2013), PISA 2012 Portugal – Primeiros resultados, www.projavi.mec.pt/np4/179/, (acedido em 21 de fevereiro de 2014).
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 71 ST III – Sessão 20 anos da CLAD – 6ª Feira, 11 de Abril, Salão Nobre (18h05) Índice de Bem-estar em Portugal – Contributos para a interpretação dos resultados baseada em classificação de variáveis Paulo Gomes1 1ISEGI – Universidade Nova de Lisboa, [email protected] Sumário Apresentaremos os principais resultados do Índice de Bem-estar em Portugal, estudo recentemente divulgado pelo INE, complementando-os por recurso a uma análise estatística multivariada dos indicadores selecionados na caracterização do bem-estar, a qual proporciona uma tipologia desses indicadores que evidencia comportamentos diferenciadores na evolução do índice, nomeadamente no contraste da evolução em 2004-2008 e 2008-2011. Palavras-chave: Análise em Componentes Principais, Análise Classificatória, Índice de Bemestar, Seleção de variáveis. 1. Introdução O Índice de Bem-estar (IBE), recentemente divulgado pelo INE, é um estudo estatístico de periodicidade anual e cujo âmbito geográfico é o país. As variáveis que integram a construção do IBE provêm de procedimentos administrativos e de operações estatísticas desenvolvidas no contexto do Sistema Estatístico Nacional, do Sistema Estatístico Europeu, do Banco Mundial e outros. Do ponto de vista concetual, as condições materiais de vida das famílias e a qualidade de vida, foram identificadas como perspetivas essenciais na avaliação da evolução do bem-estar. Neste contexto, procurou-se que cada perspetiva fosse representada com indicadores, agrupados em domínios de análise, que correspondessem, tão fielmente quanto possível, à delimitação concetual definida. Na perspetiva das condições materiais de vida pretende-se: Captar o domínio do bem-estar económico, através das possibilidades correntes e futuras de consumo, da realização do bem-estar material e da desigualdade de distribuição de rendimento; Avaliar a vulnerabilidade económica através da medição da pobreza monetária, da privação material, do endividamento e da vulnerabilidade da habitação; Avaliar a participação e inclusão social, a vulnerabilidade do trabalho e a disparidade salarial segundo o sexo, e a qualidade do trabalho. Na perspetiva de qualidade de vida, foram considerados sete domínios de análise:
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 72 Educação, conhecimento e competências – através da caracterização da educação formal, da aprendizagem ao longo da vida, da qualidade de educação e nível de competências adquiridas e da produção de conhecimento e inovação; Saúde – através dos indicadores-resultado na saúde, da avaliação da prestação de cuidados de saúde e dos indicadores relativos a fatores de risco; Balanço vida-trabalho – através da avaliação da conciliação do tempo afeto à família e ao trabalho e da avaliação subjetiva do balanço vida-trabalho; Segurança pessoal – através da avaliação da criminalidade e da avaliação subjetiva da segurança pessoal; Participação cívica e governação – através da avaliação da participação cívica e política e da confiança nas instituições; Relações sociais e bem-estar subjetivo – através da avaliação do bem-estar subjetivo social e do bem-estar subjetivo individual, dimensões que pela sua especificidade não serão objeto de análise conjunta; Ambiente – através da avaliação de qualidade da água e do ar, da intensidade apercebida de ruído, da análise do destino final dos resíduos, da medida da biodiversidade e da avaliação subjetiva da qualidade ambiental. Em cada domínio foram previamente identificadas dimensões prioritárias de análise que evidenciaram as problemáticas a considerar em cada um deles, na ótica do bem-estar, as quais alicerçaram o processo de seleção de variáveis. O objetivo inerente à construção desta nova infraestrutura estatística é poder acrescentar à ênfase na medição da produção económica, a ênfase na medida do bem-estar das pessoas, num contexto de sustentabilidade. Com indicadores sintéticos ao nível de cada domínio, de cada perspetiva e a nível global, aprofundase o mecanismo de acompanhamento dos principais fatores críticos do desenvolvimento económico e social de Portugal, em termos de bem-estar das pessoas e das famílias. As variáveis tomadas em cada domínio vêm expressas em diferentes unidades de medida, pelo que o recurso a números índice simples (baseados no rácio entre o valor da variável no ano j e o valor dessa variável no ano-base), e à função de agregação média dos índices associados aos indicadores referentes a cada domínio, proporciona uma escala unidimensional para a representação da construção multidimensional do Bem-estar. Independentemente da perda de informação subjacente à escolha desta escala, as vantagens desta opção situam-se ao nível da simplicidade e da transparência do método, da eliminação da heterogeneidade da medida, da comparabilidade entre indicadores, mas também da atenuação da sensibilidade dos valores finais dos índices à inclusão de indicadores com diferentes níveis de precisão estatística. Apresentaremos os principais resultados do Índice de Bem-estar em Portugal, no período 2004-2011 e ainda dados preliminares relativos ao ano de 2012. Os referidos dados refletem a
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 73 evolução de 79 indicadores, repartidos pelos 10 domínios selecionados, tendo sido atribuída a mesma ponderação a todos os domínios, assim como a mesma ponderação às variáveis inseridas em cada domínio. Esta escolha não reflete qualquer apriorismo quanto à importância relativa de cada domínio na caracterização do bem-estar, nem tão pouco qualquer apriorismo quanto à importância relativa de cada variável no seio de um dado domínio. Isto é, não havendo uma justificação científica para a atribuição de pesos distintos aos domínios ou às variáveis, optou-se pela não diferenciação das ponderações. Complementarmente procederemos a uma análise estatística multivariada dos dados recorrendo a métodos da análise fatorial e da análise classificatória com o objetivo de evidenciarmos os principais contrastes na evolução dos domínios em estudo e dos anos objeto de análise. Procederemos também à identificação de tipologias de indicadores face às características da respetiva evolução no período 2004-2012, onde colocaremos em evidência o efeito da crise na evolução do bem-estar em Portugal. 2. Principais resultados O Índice de Bem-estar em Portugal evoluiu positivamente entre 2004 e 2011, atingindo o valor de 108,1 em 2011, estimando-se uma redução para 107,6 em 2012. Contudo, as duas perspetivas de análise do bem-estar – traduzidas através dos índices sintéticos de Condições materiais de vida e de Qualidade de vida – evoluíram em sentidos opostos: enquanto o índice que explica a evolução das Condições materiais de vida registou genericamente uma evolução negativa, atingindo o valor de 89,2 em 2011 (na comparação com o ano-base de 2004 = 100), o índice relativo à evolução da Qualidade de vida apresentou uma evolução continuamente positiva, atingindo em 2011 o valor de 116,2. Os dados preliminares de 2012, também divulgados neste Destaque, reforçam esse contraste: o índice relativo às Condições materiais de vida teve novo agravamento com uma desvalorização de 13,2 pontos percentuais entre 2004 e 2012. Dada a forte associação existente entre muitas das variáveis que compõem este indicador sintético e o funcionamento do sistema económico, a sua evolução reflete o baixo crescimento da economia no período pré-crise e é particularmente sensível aos efeitos do aprofundamento da crise económica.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 74 Figura 1 - Índice de Bem-estar (IBE): global e por perspetiva (2004=100) Efetivamente, a análise da evolução nos períodos 2004-2008 e 2008-2012 evidenciou que à quebra registada na variação percentual do índice das Condições materiais de vida entre 2004 e 2008 (-3,8 pontos percentuais), se seguiu uma quebra mais acentuada no período 2008-2012, apontando-se para 2012 uma variação de -13,2 pontos percentuais. As taxas de variação média anual 2004-2008 (-1%) e 2008-2012 (-2,5%) sinalizam este contraste. Por sua vez, na perspetiva da Qualidade de vida, à evolução positiva entre 2004 e 2008 explicada por uma variação de 9,5 pontos percentuais, seguiu-se uma evolução também positiva no período 2008- 2012, mas de menor intensidade (7,0 p.p.), estimando-se para 2012, uma variação de 16,5 pontos percentuais, face ao ano base de 2004. 3. Contributos para a interpretação dos resultados A análise em componentes principais do quadro multivariado “domínios versus anos” sintetizou o contraste entre a evolução das condições materiais de vida dos portugueses, por comparação com o ano de 2004, e a evolução da respetiva qualidade de vida. Por outro lado, essa análise também evidenciou uma clivagem na evolução dos índices entre 2004-2008 e 2008-2012 e, por conseguinte, alguns sinais do efeito da crise no bem-estar dos portugueses. Complementarmente, a classificação hierárquica dos objetos “domínios do bem-estar” destacou o comportamento ímpar do domínio educação, conhecimento e competências, o qual se revelou o domínio com melhor desempenho, tendo a variação do índice sido de 53,9 pontos percentuais no período de 2004-2011. Por outro lado, essa classificação agrega 4 domínios transversais às
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 75 duas perspetivas de análise atrás referidas: vulnerabilidade económica, trabalho e remunerações, participação cívica e governação e relações sociais e bem-estar subjetivo. Por último, procedeu-se a uma análise classificatória dos 79 indicadores retidos no estudo, identificando 6 clusters de indicadores, dos quais dois deles constituem pequenos grupos remanescentes de indicadores, com trajetórias singulares na evolução do respetivo índice. Relativamente a cada um dos 4 primeiros clusters identificados, recorremos à representação de box-plots associados à distribuição empírica da taxa de variação média dos índices nos períodos 2004-2008, 2008-2011 e 2004-2011. Referências INE (2013). Destaque: Índice de Bem-estar 2004-2012. 6 de Dezembro de 2013. INE (2013). Índice de Bem-estar: Documento metodológico. OECD (2011b). How's Life?: Measuring Well-being. OECD Publishing. STIGLITZ, J. E., SEN, A., & FITOUSSI, J.-P. (2009). Report by the Commission on the Measurement of Economic Performance and Social Progress.
SESSÕES PARALELAS
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 84 In the case study considered, we observed that the use of Linear Discriminant Analysis (Classic or Robust) lead to smaller accuracy values than the other methods (Naïve Bayes, knn and C4.5). Finally, one should note that the addition of irrelevant input variables was circumvented by the maxMIFS algorithm which did not select any of these variables. Acknowledgments: This work was partially supported by FCT (Fundação para a Ciência e a Tecnologia) through project Pest-OE/MAT/UI0822/2014 and grant SFRH/BD/71780/2010. We express our most sincere gratitude to Prof. João Branco, for providing us the data he collected in the 1980's on measurements from Multivariate Analysis books, which served as inspiration to carry out this study. Finally, we would like to thank the referee for his insightful comments which helped to improve the paper. References BATTITI, R. (1994). Using Mutual Information for Selecting Features in Supervised Neural Net Learning. IEEE Transactions on Neural Networks, 5(4):537–550, 1994. COVER, T. & THOMAS, J. (2006). Elements of Information Theory. Wiley Sons, New York, NY, USA, 2nd edition. JOHNSON, R. A. & WICHERN, D. W. (2007). Applied Multivariate Statistical, 6th Edition. Pearson Prentice Hall, New Jersey. PASCOAL, C. (2014). Contributions to Variable Selection and Robust Anomaly Detection in Telecommunications, PhD Thesis, submitted for discussion. PIRES, A. M. & BRANCO, J. A. (2010). Projection-Pursuit Approach to Robust Linear Discriminant Analysis. Journal Multivariate Analysis, 101, 2464–2485. TAN, P.-N., STEINBACH, M. & KUMAR, V. (2005). Introduction to Data Mining. Addison Wesley, Boston. TODOROV, V. & FILZMOSER, P. (2009). An Object-Oriented Framework for Robust Multivariate Analysis. Journal of Statistical Software, 32(3), 1-47.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 85 Classificação e Análise de Dados –5ª Feira, 10 de Abril, Salão Nobre (16h10) Impact of input variables’ stability on the classification of Internet applications M. Rosário Oliveira1, Rui Valadas2, Marcin Pietrzyk3, and Denis Collange3 1CEMAT and Departamento de Matemática, Instituto Superior Técnico, Universidade de Lisboa, Portugal, rsi[email protected]nico.ulisboa.pt; 2Departamento de Eng. Electrotécnica e de Computadores and Instituto de Telecomunicações, Instituto Superior Técnico, Universidade de Lisboa, Portugal, [email protected]; 3Orange Labs, France, mj.pietrzy[email protected] and [email protected] Abstract The portability of a statistical classifier for Internet applications is its ability to operate correctly on a dataset it was not trained for. In this work we address the impact of the stability of input variables on the portability of classifiers. Our procedure, applied to 3 datasets, resorts to the notion of effect size and shows that the observed performance degradation for some Internet applications is explained by the lack of the input variables’ stability between datasets captured at different locations and/or time periods. Key-words: Internet traffic classification; Identification of Internet applications, Hypothesis testing, Effect size. 1. Introduction The classification of Internet applications has deserved considerable attention in recent years. Deterministic approaches based on port numbers and Deep Packet Inspection (DPI) solutions turn to be unreliable or unrealistic given the increasing use of dynamic ports, encryption and obfuscation of packets content. To address these problems, recent studies have relied on statistical classification techniques to probabilistically map objects (traffic flows) to Internet applications (Dainotti et al. 2012, Kim et al. 2008, Li et al. 2009, Moore and Zuev 2005). In general, these proposals have been evaluated in the context of a single dataset and the reported performance is usually very high. However, there are two important aspects in the performance of classifiers that have deserved little attention so far. First, the per-class performance of some applications may be poor even if the overall performance is very high. The overall performance follows the trend of the most numerous applications, and if their classification performance is good so it will the overall one. However, this may mask poor performance on less frequent applications. Second, a classifier trained and tested on a particular dataset may perform poorly on a different dataset, collected on a different location or time period. We will refer to the ability of a classifier to operate correctly on datasets it was not trained for as its portability. Portability is an important requirement for network operators since it would be impractical to train every classifier that needs to be deployed in the numerous operator’s Points-of-Presence (PoPs). For cost-effectiveness, large-scale classification infrastructures must rely on a small set of highly-
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 86 portable (pre-trained) classifiers. Moreover, it is important to highlight that the quest for portability is in the heart of the classification problem. Indeed, classifiers for Internet applications should seek capturing application specific behaviors and not dataset or site specific ones. So far, the portability problem has only been addressed in a few works and mainly from an empirical perspective. Li et al. (2009) report low portability performance in P2P and INTERACTIVE traffic and Pietrzyk et al. (2009) in BITTORRENT and FTP traffic. In this work we go a step further, trying to understand the impact of the stability of input variables on the portability performance of classifiers. Informally, an input variable is stable if it keeps its main statistical properties across different datasets. An important question is then: what are the characteristics of input variables that must remain stable in order to assure portability? A first attempt to answer this question was given by Este et al. (2009). The authors used the mutual information measure to show that the amount of information carried by specific input variables remains constant irrespective of capture time or point of observation. However, preservation of the information content does not necessarily imply portability, since mutual information is invariant under scale or location transformations and under one-to-one transformations, that is, MI(X;Y) = MI(U;V) where u = g(x), v = g(y), and g is an invertible function (Dadkhah et al. 2010), and in general these properties do not hold for the classifiers under consideration. In this work we propose a statistical procedure that relies on the notion of effect size (Thompson et al. 2007, Cohen 1988, Hedges and Olkin 1985) to identify stable input variables. To show the merits of our proposal we use three datasets collected at two different Internet locations in France, from the same Internet Service Provider. The dataset have some important spatial and temporal characteristics that are crucial to assess the portability of statistical classifiers: traces MS-I and R-III were captured at exactly the same time at two different locations; traces R-II and R-III were captured at the same location with an offset of seventeen days between them. Each object, which corresponds to an Internet traffic flow, is characterized by four input variables which enjoy wide acceptance as good discriminators for Internet applications (Bernaille et al. 2006, Pietrzyk et al. 2009, Este et al. 2009). The C4.5 algorithm is the chosen classifier since it has been widely employed in several works including (Kim et al. 2008, Li et al. 2009, Pietrzyk et al. 2009), and in our case provides the best trade-off between accuracy and model building time. We rely on the implementation of the C4.5 algorithm provided in the Weka suite (Hall et al. 2009). We analyze the stability properties of the four input variables and show that our procedure helps explaining the poor portability performance of some applications when using these input variables as discriminators.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 87 References BERNAILLE L, TEIXEIRA R & SALAMATIAN K (2006). Early application identification. Proc. of the 2006 ACM CoNEXT Conference (CoNEXT ’06). COHEN J (1988). Statistical power analysis for the behavior sciences. 2nd edn., Laurence Erlbaum Associates: New Jersey. DADKHAH K, MIDI H & OLIMJON S (2010). The Performance of Mutual Information for Mixture of Bivariate Normal Distributions Based on Robust Kernel Estimation. Applied Mathematical Sciences, 4(29):1417–1436. DAINOTTI A, PESCAPE A & CLAFFY K (2012). Issues and future directions in traffic classification. IEEE Network, 26(1):35–40. ESTE A, GRINGOLI F & SALGARELLI L (2009). On the stability of the information carried by traffic flow features at the packet level. SIGCOMM Comput. Commun. Rev., 39(3). HALL M, FRANK E, HOLMES G, PFAHRINGER B, REUTEMANN P & WITTEN IH (2009). The Weka data mining software: An update. SIGKDD Explorations, 11(1). HEDGES LV & OLKIN I (1985). Statistical methods for meta-analysis. Academic Press. KIM H, CLAFFY K, FOMENKOV M, BARMAN D, FALOUTSOS M & LEE K (2008). Internet traffic classification demystified: myths, caveats, and the best practices. Proc. of the 2008 ACM CoNEXT Conference (CONEXT ’08). LI W, CANINI M, MOORE AW & BOLLA R (2009). Efficient application identification and the temporal and spatial stability of classification schema. Computer Networks, 53(6):790–809. MOORE AW & ZUEV D (2005). Internet traffic classification using bayesian analysis techniques. Proc. of the 2005 ACM SIGMETRICS International Conference on Measurement and Modeling of Computer Systems (SIGMETRICS’05), 50–60. OLIVEIRA MR, VALADAS R, PIETRZYK M & COLLANGE D. (2014). Portability of statistical classifiers for the identification of Internet applications. International Journal of Communication Systems, submitted. PIETRZYK M, COSTEUX JL, EN-NAJJARY T, URVOY-KELLER G (2009). Challenging statistical classification for operational usage: the ADSL case. Proc. of the 9th ACM SIGCOMM Conference on Internet Measurement (IMC ’09). THOMPSON B (2007). Effect sizes, confidence intervals, and confidence intervals for effect sizes. Psychology in the Schools, 44(5):423–432.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 89 Classificação e Análise de Dados – 5ª Feira, 10 de Abril, Salão Nobre (16h30) On circulant matrix approximation to correlation matrix: an application to sounds Eunice Carrasquinha1, Conceição Amado2, Ana M. Pires3. 1CEMAT – Instituto Superior Técnico, [email protected]; 2CEMAT – Instituto Superior Técnico, [email protected]; 3CEMAT – Instituto Superior Técnico, [email protected]; Abstract Signal processing is an important task in our days that arises in various areas such as engineering and applied mathematics. A signal represents time-varying or spatially varying physical quantities. Signals of importance can include sound, electromagnetic radiation, images, telecommunication transmission signals, and many others. A signal carries information, and the objective of signal processing is to extract useful information carried by the signal. The received signal is usually disturbed by electrical, atmospheric or deliberate interferences. Due to the random nature of the signal, statistical techniques play an important role in analyzing the signal. There are many techniques used to analyze these types of data, depending on the focus or research question of the study. Some of these techniques are Principal Component Analysis (PCA) and Fourier transform, in particular discrete Fourier transform (DFT). The main goal in this work is to exploit the relations between PCA and others mathematical transforms. To achieve that we propose a method, based on Toeplitz and circulant matrices, which the eigenvectors correspond to each column of the Fourier matrix. In this sense, the method presented relates the theory behind the Fourier transform through the Toeplitz and circulant matrices and the Principal Component Analysis. To illustrate the proposed methodology we will consider sound data. Keywords: Circulant Matrix, Fourier Transform, Principal Component Analysis, Signal Processing, Toeplitz Matrix. 1. Introduction Signal processing is an important task in our days that arise in various areas such as engineering and applied mathematics. Due to the constant presence of signs of interest, such as: sound, images, an analysis of these has become very important. There are several statistical techniques to analyze the signal processing, the most common are Principal Component Analysis (PCA) and the Fourier transform. Many signal processing algorithms rely on methods of decorrelation of the data. The advantages of techniques mentioned, are based on the principle that decorrelating the data serves to eliminate some of the redundant information. The PCA can transform a set of original, correlated, variables in a new set of uncorrelated variables, the principal components. The principal components are obtained by a linear combination of the variables, with weights chosen in a way that the principal components become mutually uncorrelated. Each component contains new information about the system, and is ordered so
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 90 that the firsts components account for most of the variability. PCA, often also known, particularly for continuous-time processing signals by Karhunen-Loève transform (KLT), or Hotelling transform. In this way KLT is closely associated with PCA, when we intend to analyze signals, including approximation, compression or classification. In the literature we can find various techniques for processing signals and images. The Fourier transform is one of the most used techniques, for processing signals due to its ability to decompose a signal into a sum of sinusoids. Fourier transform can be divided into four categories depending on the combination between: continuous or discrete signals; or periodic or aperiodic signals. One type is the discrete Fourier transform (DFT), which is used to perform Fourier analysis in signal processing. The method used to determine the DFT is called Fast Fourier transform (FFT). In general, the interpretation of the results based on DFT is not easy, and this study contributes to provide a methodology based on Toeplitz matrices and in particularly in circulant matrices, whose eigenvectors correspond to the columns of a Fourier matrix. There has been a wide array of work on the problem to find the best circulant matrix associated to a Toeplitz matrix, more details can be found in Chan, T. (1988), Huckle. T. K. (1990), and Tismenetsky, M. (1991). In addition, there have been studies on approximation covariance matrix by Toeplitz, taking advantage of the properties of the latter. One of those studies was presented by Unser (1984) who used circulant and skew-circulant matrices to approximate covariance matrices. In 2001 Kouassi and Gouton presented a similar approach. However, both proposals are only valid for first-order Markov processes. Our proposed method generalizes those approximations for a correlation matrix associated with covariance matrix with any structure. The new approach proposed is centered on Toeplitz and circulant matrices to approximate a correlation matrix based on least squares. Approximating a correlation matrix with a simple underlying structure can lead to faster computation times and the interpretation of the results becomes simpler. A brief introduction to the theory of Toeplitz and circulant matrices it will be present. Finally, the method is illustrated with sound data sets. Acknowledgement: This work has been supported by Fundação para a Ciência e Tecnologia (FCT, Portugal). References CHAN, T. (1988). An optimal preconditioner for Toeplitz systems. SIAM J. Sci. Statist.Comput., 9(4), 766-771. HUCKLE, T. K. (1990). Circulant and skew-circulant matrices for solving Toeplitz matrix problems.Copper Mountain Conference on Iterative Methods, Cooper Mountain, Colorado.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 91 KOUASSI, R.& GOUTON, P. (2001). Approximation of the Karhunen-Loève transformation and its applications to colour images.Signal Processing: Image Communication, 16, 541-551. TISMENETSKY, M. (1991). A decomposition of Toeplitz matrices and optimal circulant preconditioning. Linear Algebra and its Applications, 154-156, 105-121. UNSER, M. (1984). On the approximation of the Karhunen-Loève transform for stationary processes. Signal Processing, 7, 231-249.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 93 Classificação e Análise de Dados – 5ª Feira, 10 de Abril, Salão Nobre (16h50) Metodologia STATIS em Controlo Estatístico da Qualidade Adelaide Maria Figueiredo1, Fernanda Otília Figueiredo2 1Faculdade de Economia e LIAAD-INESC TEC, Universidade do Porto, [email protected]t; 2Faculdade de Economia, Universidade do Porto, e CEAUL, otí[email protected] Sumário Em situações reais a avaliação da qualidade global de um produto ou de um serviço depende de mais do que uma caraterística de qualidade, pelo que o desenvolvimento de cartas de controlo para dados multivariados é crucial. Com o objetivo de monitorizar processos multivariados e identificar as variáveis responsáveis por mudanças no processo, iremos utilizar a metodologia STATIS. Palavras-chave: ACP, coeficiente RV, controlo estatístico da qualidade, monitorização de processos, STATIS. 1. Introdução A avaliação da qualidade global de um produto ou de um serviço em situações reais depende de várias caraterísticas de qualidade. A utilização de técnicas univariadas para cada uma das caraterísticas é obviamente inapropriada, uma vez que estas caraterísticas de qualidade estão em geral correlacionadas, sendo necessário usar técnicas multivariadas de controlo de processos. A maior parte dos esquemas de controlo multivariados são baseados na estatística de Hotelling e são implementados sob a hipótese de dados normais multivariados. Estes esquemas consistem em monitorizar simultaneamente o valor médio e a matriz de covariâncias do processo ou então, monitorizar separadamente o vector médio e a matriz de covariâncias. Atendendo a que há várias variáveis correlacionadas em jogo para definir a qualidade de um produto, sempre que um esquema de controlo emite um sinal, é importante averiguar quais são as variáveis do processo responsáveis pela emissão desse sinal. Neste trabalho iremos aplicar a metodologia STATIS na monitorização de processos multivariados e, além disso, através desta metodologia, sempre que a carta emite sinal de fora de controlo identificaremos as variáveis responsáveis pela emissão desse sinal. 2. Metodologia STATIS A metodologia STATIS (Structuration des Tableaux à Trois Indices de la Statistique) foi introduzida por L’Hermier des Plantes (1976) e L’Hermier des Plantes e Thiebaut (1977) e, posteriormente desenvolvida por Lavit (1988a, 1988b) e Lavit et al. (1994). Esta metodologia permite analisar simultaneamente vários quadros de dados quantitativos, recolhidos em ocasiões ou circunstâncias diferentes. Consoante o objetivo do estudo está centrado na análise dos indivíduos ou das variáveis, considera-se o método STATIS ou o método STATIS dual. Se
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 100 Table 2: Estimates obtained from the fitting of model 2. Variable Coefficient Estimate 95% Confidence Interval Intercept 3.505 (3.420, 3.589) 2nd examination 0.170 (0.136, 0.203) CCA location -0.305 (-0.484, -0.126) Initial stenosis 50% 0.350 (0.284, 0.417) Uncontrolled HT at 2nd examination 0.177 (0.077, 0.277) 2nd examination* *(Initial stenosis ) -0.097 (-0.146, -0.048) Correlation parameter 0.903 (0.837, 0.943) Error variance when initial stenosis 50%* 0.698 (0.568, 0.859) Residual standard error 0.318 (0.268, 0.378) *: standardizing the variance of initial stenosis <50% to 1. LEGEND – CCA: common carotid artery; HT: arterial hypertension. 3. Conclusion The two models gave consistent results with each other. Among the several VFR, only uncontrolled HT was shown to be statistically significant. Further studies with either larger sample sizes or longer time intervals between each US may be needed in order to identify other VFR with significant effects on stenosis progression. Acknowledgements: The first and second authors were partially funded by the European Regional Development Fund through program COMPETE and by the Portuguese Government through FCT under the project PEst-C/MAT/UI0144/2013. References DELCKER, A., DIENER, H.C. & WILHELM, H. (1995). Influence of vascular risk factors for atherosclerotic carotid artery plaque progression. Stroke, 26(11), 2016-22. HERDER, M., JOHNSEN S.H., ARNTZEN K.A., MATHIESEN E.B. (2012). Risk factors for progression of carotid intima-media thickness and total plaque area: a 13-year follow-up study: the Tromso Study. Stroke, 43(7):, 1818-23. PINHEIRO, J., BATES, D. (2009). Mixed-Effects Models in S and S-Plus, New York, USA, Springer Verlag. SABETI, S., SCHLAGER, O., EXNER, M., MLEKUSCH, W., AMIGHI, J., DICK, P., MAURER, G., HUBER, K., KOPPENSTEINER, R., WAGNER, O., MINAR, E. & SCHILLINGER, M. (2007). Progression of carotid stenosis detected by duplex ultrasonography predicts adverse outcomes in cardiovascular high-risk patients. Stroke, 38(11) 2887-94.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 101 Análise de Dados em Medicina – 5ª Feira, 10 de Abril, Sala 316 (16h10) Impacto das normas de orientação clínica na evolução do padrão de prescrição de antidiabéticos orais e antihipertensores em Portugal – Exemplo prático da análise de regressão segmentada a uma série temporal interrompida José Guerreiro1, Carla Torre2, Marta Gomes3, Suzete Costa4 1 Centro de Estudos e Avaliação em Saúde (CEFAR), Associação Nacional das Farmácias (ANF), jose.guerre[email protected]; 2 Centro de Estudos e Avaliação em Saúde (CEFAR), Associação Nacional das Farmácias (ANF), [email protected]; 3 Centro de Estudos e Avaliação em Saúde (CEFAR), Associação Nacional das Farmácias (ANF), [email protected]; 4 Centro de Estudos e Avaliação em Saúde (CEFAR), Associação Nacional das Farmácias (ANF), [email protected] Palavras-chave: Diabetes, Hipertensão, Intervenção, Regressão Linear, Série Temporal 1. Introdução A análise de regressão segmentada a uma série temporal interrompida é uma técnica utilizada para identificar e quantificar o efeito de uma intervenção num outcome de interesse no tempo (Wagner, 2002). Este trabalho tem como objectivo, analisar a sua aplicação no contexto da investigação associada à utilização de medicamentos, com exemplos reais recolhidos a partir de uma base de dados Nacional sobre o consumo de medicamentos em ambulatório. 2. Metodologia A informação sobre o consumo de medicamentos foi obtida a partir da base de dados hmR/SICMED, um sistema de informação representativo do consumo de medicamentos em ambulatório em Portugal, para o período de Janeiro de 2010 a Dezembro de 2013. Os medicamentos seleccionados fazem parte do grupo dos Antidiabéticos Orais (ADO) e dos Antihipertensores (ATH), uma vez que para estes grupos foram publicadas Normas de Orientação Clínica (NOC) (DGS, 2011a; DGS, 2011b; EURO MED STAT, 2004) por parte da Direcção-Geral da Saúde (DGS), no seguimento do Memorando de Entendimento (MoU, 2011). O momento de intervenção seleccionado foram as datas da publicação das NOC, Dezembro de 2011 para ADO e Setembro de 2011 para AHT. Os resultados foram analisados em função do número de DDD (Dose Diária Definida, OMS) consumidas. Foram ajustados modelos de regressão linear com variável dicotómica de intervenção (Normas DGS) e variável de tempo após intervenção à série da proporção do consumo de Metformina (medicamento de primeira linha) no total de ADO e a série do rácio de hipertensores ARA (Antagonistas dos Receptores da Angiotensina II) no total de ARA e IECA (Inibidores da Enzima de Conversão
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 102 da Angiotensina II), sendo que um rácio mais elevado indicava um pior padrão de consumo. A análise foi efectuada utilizando o software SAS Guide v4.1. 3. Resultados Os resultados do modelo de regressão à série temporal da metformina (p<0,0001; R2=0,8692) indicam ter havido uma alteração significativa na sua utilização após a publicação da Norma da DGS, verificando-se um ligeiro crescimento na tendência (β=0,001; p<0,0001) e no nível (β=0,007; p<0,0001) de consumo dentro dos ADO. O modelo relativo ao rácio ARA/(ARA + IECA) (p<0,0001; R2=0,9630), tem vindo a aumentar de forma significativa (β=0,001; p<0,0001) mesmo após a publicação da NOC, ainda que de forma menos acentuada, mas sem alteração de nível (β=-0,0005; p=0,4787). 4. Conclusões Os modelos de regressão segmentada a séries temporais interrompidas ajustados permitiram identificar alterações significativas no padrão de consumo dos medicamentos analisados. A publicação da Normas da DGS dos ADO parece ter contribuído ligeiramente para a inverter a diminuição do consumo de metformina. Contudo, a norma da DGS dos antihipertensores não parece ter tido impacto, pois não inverteu a tendência de crescimento do rácio ARA/(ARA + IECA). Referências Direção-Geral da Saúde (2011a). Abordagem Farmacológica na Diabetes Mellitus tipo 2. https://www.dgs.pt/, (acedido em 7 de Janeiro de 2014) Direção-Geral da Saúde (2011b). Abordagem Terapêutica da Hipertensão Arterial. https://www.dgs.pt/, (acedido em 7 de Janeiro de 2014) MoU - Memorandum of understanding on specific economic policy conditionality (Mai-2011), http://www.portugal.gov.pt/media/371369/mou_20110517.pdf, (acedido em 10 Janeiro 2014) EURO MED STAT (2004). The Library of European Union Pharmaceutical Indicators Expenditure and Utilization Indicators. Final version. http://ec.europa.eu/health/ph_projects/2001/monitoring/fp_monitoring_2001_frep_12_3_en.pdf (acedido em 25/09/2013). WAGNER, A.K., SOUMERAI, S.B., ZHANG, F. & ROSS-DEGNAN, D. (2002) Segmented regression analysis of interrupted time series studies in medication use research. Journal of Clinical Pharmacy and Therapeutics, 27, 299–309.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 103 Análise de Dados em Medicina – 5ª Feira, 10 de Abril, Sala 316 (16h30) Equiparação das classificações dos cursos de Medicina A. Rita Gaio1, Joaquim Costa2, Milton Severo3 1Departamento de Matemática da Faculdade de Ciências da Universidade do Porto & CMUP-Centro de Matemática da Universidade do Porto, [email protected]; 2 Departamento de Matemática da Faculdade de Ciências da Universidade do Porto & CMUP-Centro de Matemática da Universidade do Porto, [email protected]; 3 Centro de Educação Médica e Departamento de Epidemiologia Clinica, Medicina Preditiva e Saúde Pública da Faculdade de Medicina da Universidade do Porto & ISPUP-Instituto de Saúde Pública da Universidade do Porto, mi[email protected]t Sumário Neste trabalho são apresentadas 3 propostas para definição de critérios para o concurso de especialidade médica, integrando a classificação média final do curso de Medicina (CMCM) e a classificação obtida na prova nacional de seriação. Os requisitos de equiparação e comparação entre as CMCM bem como de equivalência entre coortes de diferentes faculdades são avaliados e é efectuada uma análise crítica dos 3 critérios sugeridos. Palavras-chave: Concurso de especialidade médica, Equiparação de classificações, scores T, scores Z. 1. Introdução Neste trabalho são apresentadas e discutidas 3 propostas para definição de critérios para o concurso de especialidade médica, integrando a classificação média final do curso de Medicina (CMCM) e a classificação obtida na prova nacional de seriação (CPNS). A CMCM varia entre 10 e 20 valores enquanto que a CPNS varia entre 0 e 100 pontos. A integração da CMCM requer que os valores obtidos das várias Faculdades de Medicina portuguesas sejam comparáveis e equiparáveis. Para essa análise, precisamos de garantir que as classificações medem o mesmo conceito (construto), têm a mesma qualidade (fiabilidade), têm uma distribuição semelhante, e que a escolha da subpopulação (coorte de estudantes) não altera a equiparação. Será ainda necessário avaliar a equivalência entre coortes de estudantes de diferentes faculdades [HOLLAND e DORANS, 2007; LIVINGSTON, 2004]. 2. Avaliação dos requisitos Mostramos que a associação entre os z-scores da CMCM e da CPNS é independente da Faculdade de origem dos licenciados e que portanto as CMCM medem o mesmo constructo. Além disso, a variância total da CPNS explicada pela CMCM é de 42% pelo que ambas as classificações acrescentam informação relevante à classificação final.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 104 A questão da igualdade das distribuições das CMCM das várias Faculdades é rejeitada, uma vez que existem diferenças significativas entre as suas médias e variâncias. Mais ainda, cerca de ¼ da variação total das CMCM pode ser atribuída à Faculdade frequentada. Verificase também que não existem diferenças significativas entre as médias das CMCM das duas coortes de estudantes analisadas, correspondentes aos anos de 2011 e 2012, pelo que a escolha da subpopulação não parece ter influência sobre a equiparação a efectuar. Podemos ainda afirmar que estamos na presença de coortes de estudantes (de diferentes Faculdades) que são equivalentes, na medida em que as diferenças existentes entre Faculdades explicam menos de 4% da variação total dos scores Z da CPNS. 3. Inclusão de candidatos estrangeiros Não foi identificada qualquer associação entre os scores Z da CMCM e os scores Z da CPNS em candidatos estrangeiros, ao contrário do que se passa com os candidatos portugueses. Este facto sugere que o processo de candidatura seja diferenciado pela nacionalidade dos candidatos. 4. Propostas 4.1. Proposta 1 Esta proposta assume que as coortes de estudantes das diferentes Faculdades são equivalentes e que as CMCM são comparáveis. Sugere-se que a classificação final (CF) do candidato i da Faculdade j seja dada por onde e Xij é a CMCM do candidato i da Faculdade j. Pelo facto de as CMCM não serem comparáveis, esta proposta trará vantagens injustas a candidatos de determinadas Faculdades. 4.2. Proposta 2 Esta proposta assume que as coortes de estudantes das diferentes Faculdades são equivalentes e que as CMCM não são comparáveis. Sugere-se que a classificação final (CF) do candidato i da Faculdade j seja dada por onde , com e correspondentes à média e desvio padrão das CMCM na coorte de estudantes da Faculdade j que se estão a candidatar pela primeira vez, respectivamente.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 105 A utilização do score T permite maximizar o efeito da CMCM na CF. Para um candidato de uma Faculdade estrangeira, a CF consistirá apenas da CPNS. 4.3. Proposta 3 Esta proposta assume que as coortes de estudantes das diferentes Faculdades não são equivalentes e que as CMCM não são comparáveis. Sugere-se que a classificação final (CF) do candidato i da Faculdade j seja dada por onde com correspondente à média das CPNS obtidas pelos candidatos da Faculdade j e correspondente ao desvio padrão das CPNS entre as várias Faculdades. O termo funciona como um indicador do desempenho dos alunos da Faculdade j relativamente à PNS. Para um candidato de uma Faculdade estrangeira, a CF poderia consistir novamente apenas da CPNS. Esta proposta tem a desvantagem de depender da qualidade da PNS. 5. Conclusão A curto prazo, e a partir dos dados disponíveis, a Proposta 2 parece-nos ser a mais indicada. De futuro, poder-se-á vir a adoptar a Proposta 3 caso se verifique entretanto: que existem diferenças significativas entre as CPNS das várias Faculdades; que a qualidade da PNS e a fiabilidade das CMCM sejam elevadas. Agradecimentos: Os autores foram parcialmente financiados pelo Fundo Europeu de Desenvolvimento Regional através do programa COMPETE e pelo Governo Português através da FCT-Fundação para a Ciência e a Tecnologia através do projecto PEst- C/MAT/UI0144/2013. Referências HOLLAND, P. W., DORANS, N. J. (2007) Linking and Equating Test Scores. IN BRENNAN, R.L. (Ed.), Educational Measurement,4, ed.,187–220. Westport, CT: Praeger Publishers. LIVINGSTON, S. A. (2004). Equating Test Scores (Without IRT). Educational Testing Service.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 107 Análise de Dados em Medicina –5ª Feira, 10 de Abril, Sala 316 (16h50) M-regression, false discovery rates and outlier detection in genetic association studies Vanda M. Lourenço1, Ana M. Pires2 1FCT/UNL and CMA-FCT/UNL, vmm[email protected]; 2 IST/UTL and CEMAT-IST/UTL, [email protected]st.utl.pt Abstract Outlier detection is widely discussed in many areas of research one of which is the field of genetic association studies. Here, robust multiple linear regression methods have been shown to be a valuable asset, allowing us not to be concerned with the possibility of outliers disrupting the analysis results. Additionally these methods also provide an adequate setting to search for outliers. Therefore, we propose and discuss a robust outlier test to be used in the context of multiple M-regression illustrating the good performance of the test through a real data example application. Keywords: Robust outlier test, Robust regression, Multiple testing, Single nucleotide polymorphism. 1. Introduction Outlier detection is a widely discussed issue in many areas of research one of which is the field of genetic association studies where the main motivation is usually to clean the data so that classical models may be used in the analysis. Knowledge of these observations however, may be important in the assessment of the underlying mechanisms of that data, since outliers are not always a result of measurement errors. Robust multiple linear regression methods have been shown to be a valuable asset in genetic association studies (Lourenço et al., 2011), allowing us not to be concerned with the eventuality of outliers in the data disrupting our analysis results. These methods also provide an adequate setting to search for outliers since the residuals obtained from robust fits are not usually affected by outlying observations. To this respect, we present a robust outlier test together with an appropriate robust estimate of scale and an adequate false discovery rate (FDR) correction measure, to be used in the context of multiple M-regression. We illustrate the good performance of the robust outlier test through an application that uses a real genetic data set from the literature (Weber et al., 2008). Full results can be found in Lourenço and Pires (2014).
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 108 2. Methods 2.1. M-regression We consider the general linear regression model (1) under the usual assumptions of independence, homoscedasticity and normality of the errors, , with and 2I. In our case: is a continuous phenotypic trait; is the design matrix for categorical genotypic markers, the first column having 1’s; is a vector of unknown parameters; the number of individuals in the sample is greater than the number of unknown parameters. In robust estimation the unknown parameters are estimated by: where is the Huber function, n the sample size, some robust estimate of scale and the residuals from the robust fit of model (1). In this case the median absolute deviation (MAD) is considered. It can easily be seen that taking allocates us to the least squares/maximum likelihood estimation setting. 2.2. Robust outlier test To test the hypothesis , the robust outlier test proceeds as follows: 1- take the standardized robust residuals ; 2- calculate for each observation , where Φ is the normal p.d.f.; 3- adjust for multiple testing with an adequate FDR multiple testing correction procedure; 4- reject the null hypothesis at a given FDR threshold, e.g, 10%. 3. Application We consider the maize data of Weber et al. (2008) on 493 plants, 1 quantitative trait (FERL – female hear length) and3 61 candidate genetic markers (SNPs – single nucleotide polymorphisms) that was re-analyzed by Lourenço et al. (2011) via M-regression and Waldtype association tests. We perform the robust outlier test considering the residuals from the robust fit of the final adjusted multiple-SNP model. Results are then compared with the ones previously obtained where some rule of thumb was used to perform outlier detection. Finally,
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 109 some considerations are made to the adequacy of the proposed robust outlier test when the identified outliers are inspected further. Acknowledgements: This work received financial support from Portuguese National Funds through FCT (Fundação para a Ciência e Tecnologia) under the scope of project PTDC/MATSTA/0568/2012. References LOURENÇO, V.M., PIRES, A.M. & KIRST, M. (2011). Robust linear regression methods in association studies. Bioinformatics, 27(6), 815-821. LOURENÇO, V.M. & PIRES, A.M. (2014). M-Regression, false discovery rates and outlier detection with application to genetic association studies. Submitted. WEBER, A.L. et al. (2008). The genetic architecture of complex traits in teosinte (Zea mays ssp. parviglumis): new evidence from association mapping. Genetics, 180, 1221-1232.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 116 que influenciam as escolhas dos turistas, e como consequência a procura turística (e.g. Eilat e Einav, 2004; Zhang e Jensen, 2007), verifica-se que a maioria dos estudos sobre a procura turística doméstica se limita a estudar os impactos de variáveis económicas. Assim, neste estudo decidiu delimitar-se os possíveis determinantes da procura turística doméstica a um conjunto de variáveis económicas, tendo em conta não só o contexto económico em que o país se encontra e o período em análise, mas também a informação disponível e com qualidade. Assim, tendo em conta a literatura e os dados disponíveis para Portugal, foi considerado o conjunto de variáveis explicativas apresentadas na tabela 1. Tabela 1: Variáveis explicativas usadas na modelação da procura turística doméstica em Portugal Variável Definição Fonte PIB PIB per capita a preços constantes de 2006 INE RDF Rendimento médio disponível das famílias INE ICC Indicador de Confiança dos Consumidores INE TXD Taxa de desemprego INE DES Número de desempregados (em stock) INE TXA Taxa de actividade INE IPT IPC relativo à secção dos Transportes INE IPH IPC relativo à secção de Restaurantes e Hotéis INE PET Preço do barril de petróleo BdP TRK Variável dummy que indica a presença da Troika em Portugal --- Nota: INE – Instituto Nacional de Estatística; BdP – Banco de Portugal; IPC – Índice de Preços no Consumidor. Tendo em conta os dados em painel disponíveis (n=7, T=16), considera-se que se trata de um pequeno painel e considerou-se tal facto ao nível da estimação econométrica (Cameron e Trivedi, 2010). 2.2. Modelos Neste estudo é proposta a seguinte função da procura turística doméstica: , (1) onde t é o período de tempo (t=1, …, 16); i é a região NUTSII (i=Norte, Centro, Lisboa, Alentejo, Algarve, RA dos Açores, RA da Madeira) e é o número de dormidas de residentes no período t, nos estabelecimentos hoteleiros da região i. Tendo em consideração as especificidades do problema que está a ser investigado, então propõe-se que seja usado um modelo combinado, também conhecido como um modelo da média da população. Assim, o modelo proposto é o seguinte:
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 117 , (2) onde é a constante do modelo, é um vector com as variáveis explicativas, é um vector com variáveis dummy, e são vectores de parâmetros e é o termo de erro aleatório. O vector inclui três variáveis dummy sazonais que indicam o respectivo trimestre (segundo, terceiro e quarto trimestres, respectivamente), as quais foram incluídas no modelo de forma a evitarem a correlação seccional entre regiões. As variáveis logaritmizadas presentes no modelo (2) são representadas pelas respectivas letras minúsculas (genericamente para uma variável X, tem-se ). Uma vez que a estimação do modelo (2) é mais eficiente pelo método dos mínimos quadrados generalizados (pooled GLS) do que pelo método dos mínimos quadrados ordinários (pooled OLS) quando existe algum tipo de correlação no termo de erro (Cameron e Trivedi, 2010, p. 254), então foram aplicados os testes de diagnóstico à heterocedasticidade e à correlação seccional dos resíduos (Baum, 2001). A produção de previsões para a procura turística serão efectuadas com recurso a modelos de alisamento exponencial tradicionais. Estes modelos, desenvolvidos a partir dos trabalhos pioneiros de Holt (1957) e Winters (1960), são baseados em médias ponderadas de observações passadas, com pesos exponencialmente decrescentes para zero para observações mais antigas, e sendo o alisamento tanto mais acentuado quanto menor for o peso da observação relativa ao último período conhecido. Apesar de existirem modelos de séries temporais muito sofisticados que têm vindo a ser aplicados na produção de previsões para a procura turística internacional (e.g., Song e Li, 2008), não existe evidência clara que esses modelos produzam também previsões com melhor qualidade para a procura turística doméstica. 3. Conclusão Os resultados obtidos indicam que em Portugal, numa conjuntura de crise económica e financeira, a procura turística doméstica é explicada pelo rendimento médio disponível das famílias, pelo número de desempregados e pelo índice de preços no consumidor relativo aos transportes. As estimativas obtidas indicam que a elasticidade do rendimento disponível na procura é aproximadamente +2,1%, do número de desempregados é cerca de -0,6% e do índice de preços dos transportes é aproximadamente +1,2%. O modelo de Holt-Winters aditivo é o modelo que produz previsões com melhor qualidade para a procura turística doméstica nas regiões do Norte, Centro e Lisboa, enquanto o modelo de Holt-Winters multiplicativo é o modelo que produz previsões com melhor qualidade nas restantes regiões, bem como para a procura turística total de Portugal. Em termos globais, verifica-se que a qualidade das previsões nestes casos é boa, pois se for analisada a medida de qualidade mais popular - o Erro Percentual Absoluto Médio (EPAM), verifica-se que ela é sempre inferior a 6%. Em particular, o EPAM é inferior a 3% nas previsões da procura turística doméstica no Norte, Centro e em Portugal de forma agregada, e é inferior a 4% nas previsões relativas às regiões do Alentejo, RA dos Açores e Lisboa.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 118 Agradecimentos: O CIEO e o CEISUC são financiados pela Fundação para a Ciência e a Tecnologia do Ministério da Educação e Ciência. Referências CAMERON, A.C. & TRIVEDI, P.K. (2010). Microeconometrics using Stata. Stata Press. EILAT, Y. & EINAV, L. (2004). Determinants of international tourism: a three-dimensional panel data analysis. Applied Economics, 36(12), 1315-1327. INE (2013) Estatísticas do Turismo 2012. Lisboa: INE. Acedido em 30/09/2013 em www.ine.pt HOLT, C.C. (1957). Forecasting seasonals and trends by exponentially weighted averages. O.N.R. Memorandum 52/1957, Carnegie Institute of Technology. Reimpresso com discussão em 2004 - International Journal of Forecasting, 20, 5-13. LIM, C. (1997). Review of international tourism demand models. Annals of Tourism Research, 24, 835-849. SONG, H. & LI, G. (2008). Tourism demand modeling and forecasting – A review of recent research. Tourism Management, 29(2), 203-220. SONG, H., LI, G., WITT, S.F. & FEI, B. (2010). Tourism demand modeling and forecasting: how should demand be measured? Tourism Economics, 16(1), 63-81. WINTERS, P.R. (1960). Forecasting sales by exponentially weighted moving averages. Management Science, 6, 324–342. WTTC (2013). Travel & Tourism – Economic Impact 2013 Portugal. London: World Travel & Tourism Council. ZHANG, J. E JENSEN, C. (2007). Comparative advantage: Explaining Tourism Flows. Annals of Tourism Research, 34(1), 223-243.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 119 Modelos Longitudinais – 6ª Feira, 11 de Abril, Salão Nobre (9h40) Modelo com trajetória latente com dados gerados a partir de um planned missing design: estudo de simulação Paula C.R. Vicente1, Maria de Fátima Salgueiro2 1Instituto Universitário de Lisboa (ISCTE-IUL), BRU-IUL, Portugal, [email protected]; 2Instituto Universitário de Lisboa (ISCTE-IUL), Business Research Unit, Portugal, fatima.salgue[email protected]t Sumário Este estudo de simulação tem por objetivo analisar o efeito da existência de diferentes padrões de omissão (resultantes de um planned missing design) com diferentes percentagens de não resposta nos valores estimados dos parâmetros de um modelo com trajetória latente (latent growth curve model). São ainda considerados o efeito da dimensão da amostra e do número de momentos temporais em estudo no enviesamento dos parâmetros estimados pelo modelo de interesse. A variação do parâmetro média do declive, mantendo constantes os restantes parâmetros do modelo a partir do qual os dados são gerados, não influencia a média das estimativas dos parâmetros para cada um dos modelos considerados, exceto para a média do declive, qualquer que seja a dimensão da amostra. Por outro lado, à medida que a variância do declive aumenta, o MSE aumenta. Palavras-chave: Latent growth curve model, Planned missing design, Simulação de Monte Carlo. 1. Introdução Nas últimas décadas tem aumentado o interesse pela recolha e análise de dados longitudinais, isto é, dados que descrevem a evolução dos acontecimentos durante um determinado período de tempo. Todavia, apesar das inúmeras vantagens que os dados longitudinais apresentam, a existência de não respostas resultantes do abandono do painel constitui uma problemática bastante frequente neste tipo de dados. Num inquérito longitudinal é usual fazer a distinção entre dados omissos intermitentes e dropout, mas as omissões podem também ser consequência do desenho do estudo. Num planned missing design há uma estrutura de omissões de dados que ocorre de forma intencional e de acordo com o planeado pelo investigador, sendo o objetivo deste planeamento minimizar o esforço de inquirição por parte dos respondentes e consequente abandono do painel (ENDERS, 2010). Assim, um inquérito que resulta de um painel rotativo pode ser considerado um exemplo de um planned missing design. De acordo com RUBIN (1976) existem três diferentes mecanismos de omissão: 1) missing completely at random (MCAR), se a probabilidade de omissão de uma variável não está relacionada nem com outras variáveis, nem com o valor possível dessa mesma variável; 2) missing at random (MAR), quando a probabilidade de omissão de uma variável está
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 120 relacionada com uma outra variável presente na análise; e 3) missing not at random (MNAR), se a probabilidade de omissão de uma variável depende do valor que essa mesma variável assumiria. Quando as omissões existentes num planned mising design podem ser consideradas como tendo um mecanismo de omissão MAR, a estimação por full information maximum likelihood é uma das abordagens estatísticas mais utilizadas para lidar com dados omissos (SCHAFFER & GRAHAM, 2002). Neste trabalho pretendem apresentar-se os principais resultados de um estudo de simulação de Monte Carlo realizado com o objetivo de analisar o efeito da dimensão da amostra, de diferentes padrões de omissão (resultantes de um planned missing design), de diferentes percentagens de omissões e do número de momentos temporais considerados, nas estimativas dos parâmetros de um Latent Growth Curve Model (LGCM). 2. Estudo de simulação A modelação de trajetórias longitudinais de mudança dos indivíduos é frequentemente objeto de estudo por parte de distintas áreas do conhecimento, tais como, ciências sociais e psicologia. Este procedimento requer grande parte das vezes uma base de dados longitudinais com uma dimensão considerável. A análise estatística das trajetórias de crescimento pode ser realizada usando técnicas de modelação como os LGCM, que permitem capturar informação sobre diferenças interindividuais nas mudanças intraindivíduos ao longo do tempo (NESSELROADE, 1991; BOLLEN e CURRAN, 2006). O software estatístico Mplus 6 (MUTHÉN & MUTHÉN, 2010) permite de uma forma integrada, gerar r amostras de dados a partir da estrutura de um LGCM, cujos parâmetros populacionais são definidos a priori pelo investigador, com um determinado número de momentos temporais. Posteriormente, para cada uma das r amostras geradas, é estimado um LGCM, obtendo-se, deste modo, r estimativas para cada um dos parâmetros do modelo. Se nas amostras geradas existem omissões uma abordagem full information maximum likelihood é utilizada na estimação. Para cada um dos parâmetros do modelo o Mplus disponibiliza a média das estimativas, calculada a partir das r amostras independentes que foram geradas, e o desviopadrão das estimativas, calculado para o conjunto das amostras geradas. Quando o número de amostras r é elevado este desvio-padrão pode ser considerado como o erro padrão do parâmetro populacional. São ainda disponibilizados o erro padrão médio de estimação, calculado para cada uma das r amostras, a coverage, que indica a proporção de amostras para as quais um intervalo a 95% contém o verdadeiro parâmetro, e o Mean Square Error (MSE) uma medida simultânea de bias e variância. Num LGCM os parâmetros de interesse são as médias e as variâncias do intercepto e do declive aleatórios, bem como a covariância entre o intercepto e o declive. Para efeitos deste estudo de simulação a variância dos termos residuais assume-se como igual nos diferentes
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 121 momentos temporais. Neste estudo de simulação são apenas considerados dados com distribuição normal. 3. Resultados Neste estudo de simulação foi considerada a geração de 1000 amostras de dados com distribuição normal, a partir de um LGCM com trajectória linear e um indicador (Y) medido em três, quatro ou cinco momentos temporais (a figura 1 representa um LGCM com quatro momentos temporais). Figura 1: Diagrama de um LGCM com quatro momentos temporais Foram geradas amostras de diferentes dimensões: N=50, N=250, N=500 e N=1000. Os valores considerados para os parâmetros populacionais que definem o modelo são a média do intercepto (=0) e a variância do intercepto (=1). Foi permitido variar os valores para a média e a variância do declive, respetivamente =-4, -2, -1, 0, 1, 2, 4 e =0.2, 1, 2, 4, 16. Foram considerados os valores 0 e 0.5 para a covariância entre intercepto e declive () e a variância dos termos residuais foi fixada a valores que permitem obter uma fiabilidade de 0.5 para os indicadores, em cada um dos momentos temporais. Para cada um dos modelos considerados foi calculado o bias na estimativa média dos parâmetros. Posteriormente, foram geradas amostras com padrões de omissão (que configuram um planned missing design) com percentagens de 10%, 20%, 30%, 40% e 50% de não respostas em cada momento temporal e avaliado o bias nas estimativas dos parâmetros de um LGCM, para amostras de diferentes dimensões. Os resultados obtidos no estudo de simulação indiciam que fazer variar a média do declive, mantendo constantes os restantes parâmetros do modelo, não influencia a média das estimativas dos parâmetros para cada um dos modelos considerados, exceto para a média do declive, qualquer que seja a dimensão da amostra. Por outro lado, à medida que a variância do declive aumenta, o MSE aumenta. 11 1 1 1 30 2 y1y2y3y4
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 122 Referências BOLLEN, K.A. & Curran, P.J. (2006). Latent Curve Models – A Structural Equation Perspective, New Jersey, USA, John Wiley & Sons. ENDERS, C.K. (2010). Applied Missing Data, New York, USA, The Guilford Press. MUTHÉN, L.K. & MUTHÉN, B.O. (2010). Mplus user´s guide, Los Angeles, USA, Muthén & Muthén. NESSELROAD, J.R. (1991). Interindividual differences in intraindividual change. IN COLLINS, L.M. & HORN, J.L.(Ed.) Best Methods for the Analysis of Change. New York, Am. Psychol. Association. RUBIN, D.B. (1976). Inference and missing data. Biometrika, 63, 581-592. SCHAFFER, J.L. & GRAHAM, J.W. (2002). Missing Data: Our view of the state of the art. Psychological Methods, 7, 147-177.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 123 Modelos Longitudinais – 6ª Feira, 11 de Abril, Salão Nobre (10h00) The effect of observed data deviations from normality on the parameter estimates of a latent growth curve model: a simulation study Maria de Fátima Salgueiro1, Paula C.R. Vicente2 1Instituto Universitário de Lisboa (ISCTE-IUL), Business Research Unit, Portugal, fatima.salgue[email protected]t; 2Instituto Universitário de Lisboa (ISCTE-IUL), BRU-IUL, Portugal, [email protected]; Abstract This simulation study aims at investigating the effect of deviations from normality of the data on the estimates of the parameters of a latent growth curve model. Varying number of time points and sample sizes are considered. The effects of various levels of data skewness and kurtosis on the bias, the mean square error and the coverage of the model parameter estimates are assessed. Preliminary results show that for models with a small mean intercept, skewness levels are low and kurtosis levels increase from low to moderate with the increase of the variability of the intercept and the magnitude of the slope. Consequently, the bias and the mean square error of the parameter estimates increase and coverage decreases, in particular for smaller sample sizes. Similar, but more severe, effects are obtained for the models with high mean intercept values. Keywords: Deviations from normality, Latent growth curve model, Monte Carlo simulation study, Mplus. 1. Introduction In recent years there has been a substantial increase in longitudinal data collection. Accompanying this growing availability of longitudinal data, there has been a considerable increase in the interest of developing statistical methods to analyze such data. Additionally, the implementation of the theoretical developments in statistical software has been taking place. Latent growth curve models (LGCM) are one of the very popular longitudinal statistical techniques, subject of intense interest both in terms of theoretical developments and more applied research. They are statistical models for longitudinal data allowing each individual under analysis to have distinct trajectories of change over time. These patterns of change are summarized in relatively few parameters which, in turn, are modeled as functions of other variables. For an overview see BOLLEN and CURRAN (2006). Let be the value for variable for individual and time . The random intercept of the LGCM is given by and the random slope by . The model assumes that , where is a diagonal matrix with elements . The model also assumes that , and are mutually independent, and that ; . Also, The parameters of special
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 124 interest in this model are the means and the variances of the random effects, as well as the covariance between random effects. SALGUEIRO (2012) has proposed using LGCM to describe and explain the growth trajectories of overall job satisfaction using longitudinal survey data. Four time points and a linear growth trajectory were considered. The proposed modeling strategy has accounted for missing data. However, the normality of the data under analysis had to be assumed, despite some evidence of skewness in the observed sample. This talk presents the main results and conclusions from a Monte Carlo simulation study conducted in Mplus 6 in order to investigate the effect of observed data deviations from normality of the data on the estimates of the parameters of a latent growth curve model. Varying number of time points and sample sizes are considered. 2. Monte Carlo simulation study The potentialities of Mplus 6 (MUTHÉN and MUTHÉN, 2010) to conduct Monte Carlo simulation studies are explored, using the mixture analysis procedure to generate non-normal data. First data are generated from a population with hypothesized parameter values: in our case the parameters of the LGCM specified by the researcher. The main parameters of interest are the means ( ) and the variances ( ; ) of the random intercept and of the random slope, as well as the covariance between intercept and slope ( ). In a second step, for each of the 1000 independent samples (or replications) drawn, the specified LGCM is estimated. In a third step Mplus computes and displays the average of the parameter estimates over the repeated draws of the independent samples. For each parameter, bias can be assessed by comparing the average of the 1000 obtained estimates to the hypothesized population value. Besides the standard deviation of the parameter estimates and the mean square error, the coverage (the proportion of the replications where a 95% confidence interval covers the hypothesized parameter value) is also computed and reported for each parameter (MUTHÉN and ASPAROUHOV, 2002). In our study the hypothesized LGCM has a linear growth trajectory , three to six time points ( ) and sample sizes ( ) ranging from 50 to 1000 observations. In Mplus non-normality of the observed data is obtained by generating data from two classes with different growth model parameter values, using the mixture analysis procedure (Muthén, 2002). The majority class includes 88% of the sample, whereas the minority class includes the remaining 12%. In this study the following values for the main parameters of interest of the majority class have been assumed: = 0.2. For the minority class different combinations of parameters have been assumed in order to induce different levels of skewness and kurtosis in the generated data. In particular the mean of the intercept has taken values 2.5 and 15. The variance of the intercept has assumed values 1 and 5. The mean of the slope has been fixed at zero and at four. The variance of the slope has remained unchanged
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 125 assuming a value of 0.2. In both classes has taken values 0 and 0.5. The variance of the residuals terms has been fixed to values that ensure a reliability of 0.5 for each observed indicator. For each of the combinations mentioned above normal distributed data were generated and for each resulting mixture a LGCM was estimated. The effects of observed data deviations from non-normality on the bias, mean square root and coverage of the model parameter estimates was assessed. Preliminary results show that for models with a small mean intercept, skewness levels are low and kurtosis levels increase from low to moderate with the increase of the variability of the intercept and the magnitude of the slope. Consequently, the bias and the mean square error of the parameter estimates increase and coverage decreases, in particular for smaller sample sizes. Similar, but more severe, effects are obtained for the models with high mean intercept values. References BOLLEN, K.A. & Curran, P.J. (2006). Latent Curve Models – A Structural Equation Perspective, New Jersey, USA, John Wiley & Sons. MUTHÉN, B.O. (2002). Using Mplus Monte Carlo Simulations In Practice: A Note On Assessing Estimation Quality and Power In Latent Variable Models. Mplus Web Notes: No. 1, Version 2. MUTHÉN, B.O., & ASPAROUHOV, T. (2002). Using Mplus Monte Carlo Simulations In Practice: A Note On Non-Normal Missing Data In Latent Variable Models. Mplus Web Notes: No. 2, Version 2. MUTHÉN, L.K., & MUTHÉN, B.O. (1998-2010). Mplus user’s guide (6th Ed.). Los Angeles, CA: Muthén & Muthén. SALGUEIRO, M.F. (2012). Modelling job satisfaction growth trajectories with missing data. IN Livro de Resumos das XIX Jornadas de Classificação e Análise de Dados, 74-76.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 228 resultantes apresentem boas propriedades estatísticas, como homogeneidade e ótima separação (Brock et al., 2008). Se os resultados apresentam subestruturas semelhantes, após a aplicação de diferentes algoritmos, uma partição natural foi obtida, caso contrário, é pouco provável que os dados apresentem grupos naturais distintos. 2. Objetivo O presente trabalho tem por objetivo identificar as deficiências no uso da Análise de Agrupamentos – Métodos Hierárquicos Aglomerativos em revistas brasileiras na área de Saúde, além de apresentar alternativas adequadas para a solução dessas deficiências. 3. Material e Método Uma revisão dos procedimentos da Análise de Agrupamentos – Métodos Hierárquicos Aglomerativos foi realizada nos trabalhos publicados em revistas brasileiras da área de saúde disponíveis na base de dados Scielo no período de 1993 a 2011 de acordo com critérios 3.1. Seleção de Revistas A área de saúde é ampla e as revistas pesquisadas das mais gerais, como por exemplo, revistas de saúde pública, até as mais específicas, como revistas de enfermagem e nutrição. As revistas de psicologia e psiquiatria não foram incluídas no estudo. Artigos científicos que se referem à metodologia somente com a nomenclatura de Análise de Agrupamentos, Cluster Analysis ou Análise de Cluster, mas não indicavam outras características, não foram avaliados. 3.2. Avaliação Diversos critérios devem ser observados para a melhor conduta na aplicação da Análise de Agrupamentos, entre eles o número de variáveis, padronização para variáveis métricas, análises de colinearidade e pontos atípicos. No entanto, para o estudo em foco, os artigos foram avaliados em relação a quatro quesitos necessários sugeridos por Aldenderfer e Blashfield (1984): Algoritmos, Medida de Similaridade, Índices Internos e Programa Computacional utilizado. Os índices internos avaliam a estrutura de agrupamento exclusivamente na amostra de dados estudada, sem levar em conta informação prévia. Para a construção do índice, o algoritmo de agrupamento é executado para várias soluções possíveis, onde k representa o número de grupos. Posteriormente, os valores dos índices obtidos a partir das partições geradas podem ser apresentados em gráficos em função de k. Nesse contexto, o melhor número de grupos é dado pelo mínimo ou o máximo dessa função, dependendo de como o índice foi definido.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 229 4. Resultados A tabela 1 apresenta 20 artigos científicos dos quais 11 não indicam o algoritmo ou algoritmos utilizados, o que representa mais da metade dos trabalhos. No quesito relacionado às medidas de similaridade, excluindo os trabalhos que mencionam o algoritmo de Ward, que pode ser utilizado diretamente na matriz de dados brutos, pode-se observar que do total de 15 artigos, apenas três apresentam informações. A adoção de índices internos não é relatada em nenhum dos artigos pesquisados. Finalmente, no quesito programa computacional metade dos artigos não cita o programa computacional empregado. 5. Conclusão Este estudo revelou a necessidade de melhoria na forma de análise de cluster e do relato na área de saúde. Nenhum dos vinte artigos contempla todos os quatro itens avaliados e apenas um artigo apresenta três itens. A utilização de índices internos não é citada em nenhum dos artigos e o programa computacional SPSS é o mais empregado pelos pesquisadores. O presente estudo seguramente não identificou todos os artigos da aplicação da Análise de Agrupamentos na área de saúde, visto que a pesquisa buscou palavras chaves associadas à metodologia, o que nem sempre é localizado na busca eletrônica. No entanto, fica evidente a fragilidade da aplicação da metodologia investigada. Orientações para conduzir e relatar a aplicação da Análise de Agrupamentos na área de saúde são necessários. Por essa razão, recomenda-se as seguintes etapas para o desenvolvimento da Análise de Agrupamentos: a) Medida de similaridade aplicada deve obedecer ao nível de mensuração dos dados; b) deve-se utilizar três algoritmos para buscar um padrão quanto ao número de grupos obtidos e estabilidade entre os objetos agrupados; c) Utilização de um ou mais índices internos que possam auxiliar a decisão do número de grupos baseados nos algoritmos empregados e d) Evitar o uso automático das configurações padrão em programas computacionais, visto que as mesmas podem não oferecer a análise mais adequada. Esse conjunto de métodos deve ser mencionado com clareza nos artigos para que outros pesquisadores possam replicar tais métodos, pressuposto básico do trabalho científico. Tabela1. Características dos artigos avaliados quanto a Análise de Agrupamentos. Título do Artigo e Revista Algoritmos Medida de Utilização Programa utilizados Similaridade de índices Computacional Mortalidade Precoce por Doenças ardiovasculares e Desigualdades Sociais em Porto Alegre: da Evidência à Ação. Arq Bras Cardiol. Não citado Não citado Não Não citado Qualidade de vida, ponto de partida ou resultado final? Ciênc. saúde coletiva. Complete Linkage e K-means Distância euclidiana Não Não citado Agrupamento de países segundo indicadores de padrão de vida. Rev. Saúde Pública. UPGMA Distância euclidiana Não Não citado Distribuição espacial da dengue e determinantes socioeconômicos em localidade Não citado Não citado Não SPSS
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 230 urbana no Sudeste do Brasil. Rev. Saúde Pública. Perfil dos pacientes com perdas funcionais e dependência atendidos pelo PSF no município de São Paulo. Rev Esc Enferm USP. Método de Ward Distância euclidiana Não SPSS Análise ecológica dos acidentes e da violência letal em Vitória, ES. Rev. Saúde Pública. Não citado Não citado Não Não citado A qualidade das refeições de empresas cadastradas no Programa de Alimentação do Trabalhador na cidade de São Paulo. Rev. Nutr. Não citado Não citado Não SPSS Controlar líquidos: uma intervenção de enfermagem para o paciente com excesso de volume de líquidos. Rev. Latino-Am. Enfermagem Não citado Não citado Não Não citado Qualidade de vida na terceira idade: um conceito subjetivo. Rev. bras. Epidemiol. Método de Ward e K-means Não citado Não Statistica Desigualdades na saúde reprodutiva das mulheres no Paraná. Rev. bras. epidemiol Não citado Não citado Não Não citado Mortes por suicídio: diferenças de gênero e nível socioeconômico. Rev. Saúde Pública. Método de Ward Não citado Não SAS Desigualdades sociais e gestão em saúde: metodologia de seleção de áreas urbanas visando à diminuição das desigualdades socioespaciais em regiões metropolitanas. Ciênc. saúde coletiva Método de Ward Distância euclidiana Não Não citado Aspectos dietéticos das refeições oferecidas por empresas participantes do Programa de Alimentação do Trabalhador na Cidade de São Paulo, Brasil. Rev Panam Salud Publica. Não citado Não citado Não SPSS Diferenciais intermunicipais de condições de vida e saúde: construção de um indicador composto. Rev. Saúde Pública Não citado Não citado Não Não citado Doenças respiratórias agudas: um estudo das desigualdades em saúde. Cad. Saúde Pública Não citado Não citado Não Minitab Perfil de produção do exame citopatológico para controle do câncer do colo do útero em Minas Gerais, Brasil, em 2002. Cad. Saúde Pública Método de Ward e K-means Não citado Não SPSS Condição de vida e mortalidade infantil: diferenciais intra-urbanos no Recife, Pernambuco, Brasil. Cad. Saúde Pública, Não citado Não citado Não Não citado Polimorfismo do sistema HLA em uma amostra de mestiços da população de Teresina, Piauí. Rev Assoc Med Brás. Average Linkage Não citado Não SPSS Prevalências de sobrepeso, obesidade e hábitos de vida associados ao risco cardiovascular em alunos do ensino fundamental. Rev. Assoc. Med. Brás. Não citado Não citado Não SPAD Critérios Ecocardiográficos para Definição de Graus de Disfunção Ventricular em Ratos Portadores de Estenose Aórtica. Arquivos Brasileiros de Cardiologia Single Linkage Distância euclidiana média Não Não citado Agradecimentos: FAPESP – Fundação de Amaparo à Pesquisa do Estado de São Paulo.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 231 Referências ALDENDERFER, M.S. & BLASHFIELD, R.K. (1984). Cluster analysis. Newbury Park, CA: Sage Publishing. BROCK G., PIHUR V., DATTA S. & DATTA S. (2008) clValid: An R Package for Cluster Validation. Journal of Statistical Software, 25. DINI A.P., FUGULIN F.M.T., VERÍSSIMO M.L.Ó.R. & GUIRARDELLO E.B. (2011) Sistema de Classificação de Pacientes Pediátricos: construção e validação de categorias de cuidados. Rev Esc Enferm USP, 45, No. 3, 575-80. FREI, F. (2006) Introdução à Análise de Agrupamentos: Teoria e Prática. Editora Fundação UNESP, São Paulo. JAIN, A.K., MURTY, M.N. & FLYNN, P.J. (1999) Data Clustering: A Review. Journal ACM Computing Surveys, 31 Issue 3, 264-323. MACKERT M. & WALKER L.O. (2011) Cluster Analysis Identifies Subpopulations for Health Promotion Campaign Design. Public Health Nursing, 28, No. 5, 451–457.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 233 Sessão de Posters II – Sábado, 12 de Abril (11:20) Kidney-brain link in traumatic brain injury patients: A preliminary report A. Rita Gaio1, Óscar Felgueiras2, Celeste Dias3, José-Artur Paiva4, Marek Czosnyka5 1Departamento de Matemática da Faculdade de Ciências da Universidade do Porto & CMUP-Centro de Matemática da Universidade do Porto, [email protected]; 2Departamento de Matemática da Faculdade de Ciências da Universidade do Porto & CMUP-Centro de Matemática da Universidade do Porto, [email protected]; 3Serviço de Medicina Intensiva da Unidade de Cuidados Neurocríticos do CHSJ-Porto, mceleste.dia[email protected]; 4Serviço de Medicina Intensiva do CHSJ-Porto & Departamento de Medicina da Faculdade de Medicina da Universidade do Porto, [email protected]; 5Neurosurgery Unit, Department of Clinical Neurosciences, University of Cambridge, [email protected] Summary The relationship between brain auto-regulation and kidney glomerular filtration rate in patients with traumatic brain injury remains to be investigated. We analyzed 194 daily observations collected from 18 patients. Multiple linear regression models estimated by generalized least squares evaluated the effect of clearance creatinine on cerebrovascular reactivity pressure index throughout time. Mixed-effects models were not shown to be adequate. Norepinephrine and fatal/nonfatal outcome presented significantly confounding effects. Key-words: Augmented renal clearance, Cerebral auto-regulation, Generalized least squares, Kidney hyperfiltration, Multiple linear regression. 1. Introduction Autoregulation of blood flow is the inherent capacity of vascular bed to maintain constant perfusion despite the variations of arterial blood pressure and intracranial pressure (brain) and is an important mechanism to maintain cerebral and kidney blood flow relatively constant. Cerebrovascular autoregulation and kidney function are frequently impaired in patients with acute brain lesion [LI ET AL, 2011]. Conversely, kidney hyperfiltration with augmented renal clearance and polyuria are also frequently observed in patients with traumatic brain injury (TBI), [MINVILLE ET AL., 2011; UDY ET AL., 2010]. The aim of this study is to report preliminary findings about the relationship between brain autoregulation impairment, estimated kidney glomerular filtration rate and fatal/nonfatal outcome in critically ill patients after severe traumatic brain injury.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 234 2. Modelling and statistical analysis We retrospectively performed an analysis of data collected for a prospective cohort of 18 consecutive patients admitted to Neurocritical Care Unit (NCCU) at Hospital S. João, Porto, with multiple trauma and severe traumatic brain injury and clinical indication for intracranial pressure (ICP) monitoring. We analysed 194 complete daily observations from the 18 patients regarding cerebrovascular pressure reactivity index (PRx), creatinine (Cr), creatinine clearance (CrCl), noradrenaline dose, protein intake, water balance, sodium, and osmolarity. For one of the individuals, 38 daily observations were available but only the first 23 complete daily observations were retrieved. This cut-off value was essentially identified by two criteria: proximity to the highest number of complete daily observations from the remaining individuals in the sample, and representativeness of the mean of its remaining observations. For the remaining patients the number of complete daily values ranged from 3 to 18. Multivariate linear regression models studied the crude and adjusted effect of creatinine clearance on PRx throughout time. The generalized least squares method with normally distributed errors that were allowed to be correlated and heteroscedastic was applied [PINHEIRO e BATES, 2009]. Amongst possible clinical confounders, the crude effect of clearance creatinine on PRx was only found to be significantly altered by noradrenaline. Denoting by PRx(s,c,d) the PRx value read for creatinine clearance c and noradrenaline d in a subject with dichotomous outcome s (fatal or nonfatal), the best model fitted by maximum likelihood was given by the equation (1) Here, the residuals ε were assumed to follow a normal distribution with zero mean and were found to have a variance-covariance matrix with an intra-individual time autocorrelation structure of order 1. The reference category for the fatal/nonfatal outcome corresponded to the nonfatal result. Graphical analyses were used to assess normality and homoscedasticity of model residuals and no compromising features were detected. The obtained estimates for the regression coefficients are presented in Table 1A. Crude effects were studied with the same structure of the variance-covariance matrix as that from model (1). The obtained 95% confidence intervals for the correlation parameter and residual standard error of the adjusted model were (0.2546, 0.5376) and (0.2161, 0.2733) respectively. Intra-individual and inter-individual variations were also considered by linear mixed effects models, with observations grouped at the individual level [3]. The restricted maximum likelihood estimation provided a model with a single random effect at the intercept level. That model was discarded as only 1.9% of the response variation was explained by the random effect.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 235 Table 1: Estimates, and 95% confidence intervals, for the crude and adjusted effects of: A. creatinine clearance, fatal/nonfatal status and norepinephrine on PRx, from all patients; B. creatinine clearance and norepinephrine on PRx, from patients with normal kidney function. Generalized least squares was also shown to be the most adequate method for an analogous study carried out only for individuals with preserved renal function with creatinine <1.3 mg/dl (2 male subjects who developed kidney failure with fatal outcome having 11 complete observations were removed). The restricted maximum likelihood estimation provided again a model with a single random effect at the intercept level which explained only 3.9% of the response variation. For the above notation, the chosen model was (2) with the Gaussian distributed residuals ε having a variance-covariance matrix as in (1). Model estimates are presented in Table 1B. The obtained 95% confidence intervals for the correlation structure parameter and residual standard error of the adjusted model were (0.2606, 0.5384) and (0.2148, 0.2729) respectively. 3. Conclusion In TBI patients, better cerebral auto-regulation evaluated with cerebrovascular pressure reactivity index is significantly associated with augmented renal clearance and favorable outcome. Generalized least squares proved to be more adequate than mixed-effects regression in the modelling of this clinical situation.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 236 Acknowledgments: The first and second authors were partially funded by the European Regional Development Fund through program COMPETE and by the Portuguese Government through FCT - Fundação para a Ciência e a Tecnologia under the project PEst- C/MAT/UI0144/2013. References LI, N., ZHAO W-G., ZHANG W-F. (2011). Acute Kidney Injury in Patients with Severe Traumatic Brain Injury: Implementation of the Acute Kidney Injury Network Stage System. Neurocritical Care, 14, 377-81. MINVILLE, V., ASEHNOUNE, K., RUIZ S., ET AL. (2011). Increased creatinine clearance in polytrauma patients with normal serum creatinine: a retrospective observational study. Critical Care, 15, R49. PINHEIRO, J., BATES, D. (2009). Mixed-Effects Models in S and S-Plus, New York, USA, Springer Verlag. UDY, A., BOOTS, R., SENTHURAN, S., ET AL. (2010). Augmented creatinine clearance in traumatic brain injury. Anesthesia & Analgesia, 111, 1505-10.
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Programa e resumos 237 Sessão de Posters II – Sábado, 12 de Abril (11:20) Root resorption risk modeling S. Pereira1, N. Lavado2, L. Nogueira3, M. Lopez4, J. Abreu1, H. Silva5 1Dep. of Orthodontics, Faculty of Medicine, University of Coimbra, [email protected]; 2Polytechnic Institute of Coimbra (IPC-ISEC) and BRU-IUL, [email protected]; 3Medical Genetics Department, Faculty of Medicine, University of Coimbra; 4Faculty of Engineering, University of Porto; 5Medical Genetics Department, Faculty of Medicine, University of Coimbra and CIMAGO; Abstract We proposed to study nine clinical and treatment-related factors and polymorphisms of four genes in order to construct a model to predict orthodontic-induced external apical root resorption (EARR). We concluded that the main factors contributing to the EARR process are gender, treatment duration, use of a Hyrax appliance, premolar extractions and rs1718119 polymorphism of the P2RX7 gene. These five variables explained 27% of EARR variability, suggesting the existence of other aetiologic factors. This study has been recently published in the journal Oral Diseases (Pereira et al, 2013). Keywords: Apical Root Resorption, Gene Polymorphism, Orthodontics, P2RX7 Gene 1. Introduction External apical root resorption (EARR) is a frequent complication observed in association with orthodontic tooth movement and has been of great concern to clinical researchers. Although forces applied and tooth movement are the trigger for EARR, studies have shown that biomechanical factors may not account for more than one-tenth to one-third of the variation observed in root resorption. Many factors have been described including medication, endodontic treatment and patients’ intrinsic factors such as gender, age, tongue thrust, the existence of anterior open bite, type of malocclusion and systemic diseases. In this study we also included four genes, extensively explored as susceptible markers, as candidates for root resorption modeling. The polymorphisms chosen for this study have previously been associated with EARR or bone remodeling and might be functionally relevant: rs1143634 from IL-1B, rs3102735 from OPG gene, rs1805034 from RANK gene and rs1718119 from P2RX7. 1.1. Materials and Methods For this retrospective study, patients followed by the same orthodontist were randomly selected from the archives of two orthodontic clinics and from the Department of Orthodontics, Dentistry, Faculty of Medicine of Coimbra. The 195 selected patients included 72 males and 123 females, with an average age of 17.24 years (s.d. 6.8 years). Before and after orthodontic treatment panoramic radiographs were used to evaluate the percentage of EARR for each patient based on measurements on six teeth, the four maxillary
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Índice de Autores Abreu, J, 238 Amado, Conceição, 89 Amaro, Ana, 149 Azevedo, Elsa, 97 Bacelar-Nicolau, Helena, 57 Batista, Maria Graça, 242 Batista, Rodrigo, 39 Brazdil, Pavel, 173 Brito, Paula, 61, 159 Cabral, Joana, 216 Campos, Pedro, 29 Cardoso, Margarida G.M.S., 163 Carrasqueira, Helder, 204 Carrasquinha, Eunice, 89 Carvalho, Célia Barreto, 216 Catalão, Daniela, 183 Coelho, Carlos Agra, 141 Collange, Denis, 85 Cordeiro, Pedro, 51 Correia, Eduardo, 137 Correia, Inês, 39 Correia, Luís, 29 Costa, Joaquim, 103 Costa, Suzete, 101 Costa, Vera, 177 Czosnyka, Marek, 234 Dias, Celeste, 234 Dias, José G., 187, 191, 220 Duarte Silva, A. Pedro, 159 Duarte, Isabel, 145 Faria, Susana, 183, 208 Felgueiras, Óscar, 97, 234 Fernandes, Leonor, 224 Ferreira, Ana Sousa, 67 Figueiredo, Adelaide Maria, 93 Figueiredo, Esperança, 23 Figueiredo, Fernanda Otília, 93 Figueiredo, Mário A. T., 7 Finamore, Anna Carolina, 79 Frei, Fernando, 228 Gaio, A. Rita, 97, 103, 234 Góis, Eduarda, 23 Gomes, Luís, 169 Gomes, Marta, 101 Gomes, Paulo, 71 Gonçalves, A. Manuela, 183, 195 Gonçalves, Bruno, 127 Gonçalves, Cristina, 23 Gonçalves, Homero, 45 Grilo, Luís Miguel, 141 Guerreiro, José, 101 Hennig, Christian, 3, 13 Henriques, Roberto, 224 Ichino, Manabu, 61 Ingrassia, Salvatore, 9 João, Paulo, 131 Lavado, N., 238 Lemaître, Georges, 11
XXI Jornadas de Classificação e Análise de Dados INE, Lisboa, 10 a 12 de Abril de 2014 Lima, Filipa, 39 Lobo, Victor, 131, 224 Lopez, M., 238 Lorga da Silva, Ana, 145 Lourenço, Mário, 45 Lourenço, Vanda M., 107 Magalhães, Cloé, 51 Marques, Catarina, 127, 137, 155, 191 Marques, Nuno C., 163 Matos, Diogo, 163 Medeiros, Deanna, 242 Mendonça, Vitor H.Q., 33 Moreira, Fátima, 17 Netto, Franciele Karen, 228 Neves, Cristina, 17 Neves, Manuela, 200 Nicolau, Fernando C., 57 Nobre Pereira, Luís, 115, 204 Nogueira, L., 238 Noronha Ferreira, Lara, 115 Nunes, Sandra, 200 Oliveira, Jorge, 183 Oliveira, M. Rosário, 79, 85 Oliveira, Raquel, 195 Pacheco, António, 79 Paiva, José Artur, 234 Pascoal, Cláudia, 79 Pedro, Ilda, 204 Pegoraro, Juliana Alves, 228 Penalva, Helena, 200 Pereira, Patrícia, 23 Pereira, S., 238 Pereira, Soraia, 29 Pietrzyk, Marcin, 85 Pires, Ana M., 89, 107 Poiares, Rita, 51 Pral, Catarina, 127 Ramos, Sofia B., 220 Reis, Elizabeth, 155 Ribeiro, Edmundo Roque, 137 Saleiro, Pedro, 169, 177 Salgueiro, Maria de Fátima, 119, 123 Santos, Fernando, 145 Santos, Jorge, 208 Santos, Rosa, 97 Severo, Milton, 103 Silva, Anabela C., 33 Silva, H., 238 Silva, Isabel, 111 Silva, Maria Eduarda, 111 Silva, Osvaldo, 57, 216 Silveira, Vítor, 45 Soares, Carlos, 169, 177 Sousa, Áurea, 57, 242 Tiago de Oliveira, Isabel, 187 Torre, Carla, 101 Torres, Cristina, 111 Trigo, Luís, 173 Valadas, Rui, 85 Vasconcelos, Rosa M., 195 Vicente, Paula, 155, 212 Vicente, Paula C.R., 119, 123 Winston, Jerónimo, 149