scieee AI-readable full text Open interactive document viewer

Redes Sociais e Classificação Conceptual: Abordagem Complementar para um sistema de Recomendação de Coautorias

Tiago Filipe Pacheco Ferreira

Full text

Redes Sociais e Classificação Conceptual: Abordagem Complementar para um Sistema de Recomendação de Coautorias por Tiago Filipe Pacheco Ferreira Dissertação de Mestrado em Análise de Dados e Sistemas de Apoio à Decisão Orientada por: Prof. Dra. Maria Paula de Pinho de Brito Duarte Silva 2013 Redes Sociais e Classificação Conceptual ii Nota Biográfica Licenciado em Economia na Faculdade de Economia da Universidade do Porto em 2011. Durante a licenciatura realizou, em 2008 um estágio de Verão no Banco Santander Totta; entre 2010 e 2011 foi membro do departamento de Recursos Humanos da AIESEC - Association Internationale des Etudiants en Sciences Economiques et Commerciales. Em 2011 ingressa no Mestrado em Análise de Dados e Sitemas de Apoio à Decisão da Faculdde de Economia da Universidade do Porto. Foi colaborador no Financial Service Shared Center da adidas Group na Maia, entre 2011 e 2013, pcupando o cargo de Junior Account em 2011 e de Assistant Account entre 2012 e 2013. Em Setembro de 2013 iniciou-se como colaborador da Porto Editora, ocupando o cargo de Adjunto da Direção Comercial. Redes Sociais e Classificação Conceptual iii Agradecimentos À Professora Dra Maria Paula Brito , minha orientadora, pelas ideias, sugestões e paciência, incutindo-me ao longo do processo motivação para que este fosse levado até ao fim. Aos meus pais, irmão e restante família que sempre me deram muita força para continuar, e que estiveram presentes em todos os momentos com boa disposição para me alegrar e dar motivação. À Tânia Rocha o meu especial agradecimento, por estar sempre do meu lado para me dar boa disposição e motivação. Por todos os momentos em que o cansaço começava a vencer e mesmo assim me conseguia dar força para continuar. Finalmente, aos meus amigos que sempre me apoiaram. Redes Sociais e Classificação Conceptual iv Resumo Esta dissertação tem como o principal intuito a criação de uma aplicação de aconselhamento aliando dois métodos, a Análise de Redes e a Análise Conceptual Formal. Utilizando uma base de dados de coautorias em publicações foi possível criar uma ferramenta capaz de aconselhar a um qualquer autor da base de dados, todo um conjunto de autores que também já publicaram na mesma área. Numa sociedade que diariamente é capaz de produzir dados em massa, é cada vez mais necessária a criação de ferramentas para a sua análise e interpretação. A utilização de redes sociais e o armazenamento de dados online pela sociedade disponibiliza todo um conjunto de informações úteis para a tomada de decisões. Ao longo desta dissertação foram estudados os dois métodos mencionados, com o intuito de desenvolver um método que, aliando os resultados produzidos por ambos, pudesse usá-los em conjunto na tomada de decisões. Este sistema é a contribuição inovadora desta dissertação, dado conciliar dois métodos distintos para criar um Sistema de Recomendação. PALAVRAS CHAVE Análise Conceptual Formal, Coautorias, Redes Sociais, Sistema de Recomendação. Redes Sociais e Classificação Conceptual v Abstract This Master Dissertation’s main objective is the creation of a Recommendation System using two methods, Network Analysis and Formal Concept Analysis. Using a publication co-authoring data base, we have developed a tool capable of advising each author on the data base, a group of other authors that had also published on the same areas. In a society that is capable of producing daily a huge amount of data, it is each and every day more necessary to create new tools for its analysis and interpretation. The usage of social networks and the storage of online data by the Society, makes a large amount of data available, which is useful in the decision making. Along this dissertation we have analyzed both methods mentioned, with the objective of combining them together in the decision making application. The proposed system is the added value of this dissertation, using two distinct methods to create a Recommendation System. KEYWORDS Co-Authorship, Formal Concept Analysis, Recommendation system, Social Networks. Redes Sociais e Classificação Conceptual vi Índice NOTA BIOGRÁFICA ............................................................................................................................... ii AGRADECIMENTOS ............................................................................................................................. iii RESUMO ................................................................................................................................................... iv ABSTRACT................................................................................................................................................ v ÍNDICE ...................................................................................................................................................... vi ÍNDICE DE FIGURAS……………..…………………………………………….……………………..vii ÍNDICE DE TABELAS………………………………………………………….………………………ix 1 INTRODUÇÃO .......................................................................................................................... 1 2 ESTADO DA ARTE ..................................................................................................................... 3 3 GRAFOS, REDES E REDES SOCIAIS ............................................................................................. 6 3.1 T EORIA DOS G RAFOS ...................................................................................................................... 6 3.2 C ONCEITOS SOBRE REDES ................................................................................................................ 7 3.2.1 Ligações e nós ................................................................................................................. 8 3.3 M EDIDAS ESTATÍSTICAS PARA ANÁLISE DE GRAFOS ................................................................................ 9 3.3.1 Medidas de centralidade ............................................................................................... 13 3.4 A NÁLISE DE R EDES SOCIAIS ............................................................................................................ 16 3.4.1 Alguns conceitos específicos das redes sociais .............................................................. 16 3.5 R ELAÇÕES E LIGAÇÕES EM REDES DE LARGA ESCALA ............................................................................. 18 4 ANÁLISE CONCEPTUAL FORMAL ............................................................................................ 20 4.1 A LGORITMO FC B O: F AST C LOSE - BY -O NE ......................................................................................... 23 5 METODOLOGIAS DE ANÁLISE DE REDES E DE ANÁLISE CONCEPTUAL FORMAL ...................... 25 5.1 M ETODOLOGIA DAS R EDES ............................................................................................................ 26 5.1.1 Análises estatísticas da rede ......................................................................................... 36 5.1.2 Análise geral dos nós ..................................................................................................... 41 5.2 M ETODOLOGIA DA A NÁLISE C ONCEPTUAL ........................................................................................ 44 6 ANÁLISE DOS DADOS DE COAUTORIA .................................................................................... 49 6.1 A NÁLISE DA R EDE ........................................................................................................................ 50 6.1.1 Análises estatísticas da rede ......................................................................................... 57 6.2 A NÁLISE C ONCEPTUAL .................................................................................................................. 66 6.3 A NÁLISE C ONJUNTA : S ISTEMA DE R ECOMENDAÇÃO DE P ARCERIAS ........................................................ 68 7 CONCLUSÃO........................................................................................................................... 76 8 BIBLIOGRAFIA ........................................................................................................................ 78 Redes Sociais e Classificação Conceptual vii Índice de Figuras F IGURA 1 – R EPRESENTAÇÕES DE GRAFOS DIRIGIDOS E NÃO DIRIGIDOS . ...................................................... 7 F IGURA 2 – R EPRESENTAÇÃO DOS DIVERSOS TIPOS DE ARESTAS ................................................................ 11 F IGURA 3 – E XEMPLO DE UM GRAFO ........................................................................................................... 12 F IGURA 4 – G RAFO NÃO DIRIGIDO DIRIGIDOS COM O CÁLCULO DOS GRAUS ............................................... 14 F IGURA 5 – R ETICULADO DE CONCEITOS DO CONTEXTO DOS PLANETAS ..................................................... 22 F IGURA 6 – E XEMPLO DE UMA ÁRVORE C B O REDUZIDA PARA UMA ÁRVORE FC B O. .................................. 24 F IGURA 7 – P ARTE DA CODIFICAÇÃO DOS NÓS DA REDE . ............................................................................ 27 F IGURA 8 – P ARTE DA CODIFICAÇÃO DAS RELAÇÕES .................................................................................. 27 F IGURA 9 – R EDE DAS EXPORTAÇÕES ENTRE 28 E STADOS M EMBROS DA U NIÃO E UROPEIA .. .................... 28 F IGURA 10 – P ARÂMETROS DO ALGORITMO E A SUA EXPLICAÇÃO . ............................................................ 29 F IGURA 11 – R EDE UTILIZANDO OS PARÂMETROS DE ORIGEM DO ALGORITMO F ORCE A TLAS . ................... 29 F IGURA 12 – R EDE CRIADA COM AS ALTERAÇÕES DA FORÇA DE REPULSÃO ............................................... 30 F IGURA 13 – R EDE DE PAÍSES APÓS COLORAÇÃO DOS NÓS MEDIANTE O SEU GRAU ..................................... 31 F IGURA 14 – I MAGEM DA REDE COM FOCO NOS PAÍSES COM GRAU MAIS ELEVADO . ................................... 32 F IGURA 15 – I MAGEM DA REDE COM FOCO NOS PAÍSES COM GRAU MAIS ELEVADO .................................... 32 F IGURA 16 – R EDE HIERARQUIZADA CONSOANTE O I N -D EGREE ................................................................. 33 F IGURA 17 – R EDE HIERARQUIZADA CONSOANTE O O UT -D EGREE ............................................................. 34 F IGURA 18 – R EDE HIERARQUIZADA PELO VALOR EXPORTADO .................................................................. 35 F IGURA 19 – R EDE COM OS NÓS COLORIDOS MEDIANTE O GRAU E AS LIGAÇÕES COLORIDAS MEDIANTE O VALOR EXP . ....................................................................................................................................... 36 F IGURA 20 – G RÁFICO ILUSTRATIVO DA DISTRIBUIÇÃO DO GRAU ............................................................... 37 F IGURA 21 – G RÁFICO REPRESENTATIVO DOS RESULTADOS DO W EIGHTED O UT -D EGREE . ........................ 38 F IGURA 22 - G RÁFICO REPRESENTATIVO DOS RESULTADOS DO W EIGHTED I N -D EGREE . ............................ 39 F IGURA 23 – D ISTRIBUIÇÃO DE H UBS ......................................................................................................... 40 F IGURA 24 – D ISTRIBUIÇÃO DE A UTHORITY . .............................................................................................. 40 F IGURA 25 – O PÇÕES ASSUMIDAS PARA A DETEÇÃO DE COMUNIDADES ..................................................... 41 F IGURA 26 – G RÁFICO COM OS VALORES DA D ISTRIBUIÇÃO DO E IGENVECTOR C ENTRALITY DE CADA NÓ . 42 F IGURA 27 – C ONJUNTO DE ESTATÍSTICAS DISPONÍVEIS NO G EPHI E SEUS RESULTADOS PARA A REDE EM ANÁLISE . ........................................................................................................................................... 43 F IGURA 28 – R EPRESENTAÇÃO DO CÓDIGO PARA UTILIZAÇÃO DO SOFTWARE FC B O NO FICHEIRO DE DADOS PAÍSES . DAT ........................................................................................................................................ 44 F IGURA 29 – A MOSTRA DOS RESULTADOS OBTIDOS ATRAVÉS DA UTILIZAÇÃO DO FC B O .......................... 45 F IGURA 30 – I MAGEM SUPERIOR COM UMA AMOSTRA DOS RESULTADOS RETIRADOS DO PROGRAMA EM R 48 F IGURA 31 – R EDE DE COAUTORIAS CONFIGURADA COM O ALGORITMO F ORCE A TLAS .............................. 51 F IGURA 32 – E XEMPLOS DE CLIQUES EXISTENTES NA REDE . ....................................................................... 52 F IGURA 33 – E XEMPLO DE PONTE UNINDO DOIS PEQUENOS GRUPOS DA REDE ............................................ 52 F IGURA 34 – R EDE HIERARQUIZADA PELO GRAU ATRAVÉS DA COLORAÇÃO DOS NÓS ................................. 53 Redes Sociais e Classificação Conceptual viii F IGURA 35 – O S TRÊS GRUPOS COM OS NÓS COM MAIOR GRAU . .................................................................. 54 F IGURA 36 - R EDE HIERARQUIZADA PELO NÚMERO DE PUBLICAÇÕES ......................................................................... 55 F IGURA 37 - R EDE HIERARQUIZADA PELO NÚMERO DE PUBLICAÇÕES ......................................................... 56 F IGURA 38 – R EDE COM AS LIGAÇÕES HIERARQUIZADAS PELO PESO DO NÚMERO DE PUBLICAÇÕES NA REDE .......................................................................................................................................................... 57 F IGURA 39 – G RÁFICO DA DISTRIBUIÇÃO DO GRAU DOS NÓS .. .................................................................... 58 F IGURA 40 – G RÁFICO DA DISTRIBUIÇÃO DO GRAU PONDERADO DOS NÓS . ................................................. 59 F IGURA 41 – D ISTRIBUIÇÃO DA B ETWEENNESS C ENTRALITY DA REDE .. .................................................... 60 F IGURA 42 – G RÁFICO DA C LOSENESS C ENTRALITY D ISTRIBUTION ........................................................... 61 F IGURA 43 – G RÁFICO DA E CCENTRICITY C ENTRALITY D ISTRIBUTION ...................................................... 62 F IGURA 44 – G RÁFICOS DO H UBS E A UTHORITY D ISTRIBUTIONS ............................................................... 63 F IGURA 45 - G RÁFICO DA C LUSTERING C OEFFICIENT D ISTRIBUTION . ........................................................ 64 F IGURA 46 – G RÁFICO DA E IGENVECTOR C ENTRALITY D ISTRIBUTION ...................................................... 65 F IGURA 47 – C ÓDIGO UTILIZADO PARA DESCOBRIR SE NUMA DETERMINADA PARCERIA AMBOS OS AUTORES PERTENCEM A UM DOS GRUPOS DA LISTA . ......................................................................................... 69 F IGURA 48 - C ÓDIGO UTILIZADO PARA DESCOBRIR SE NUMA DETERMINADA PARCERIA AMBOS OS AUTORES PERTENCEM A UM DOS GRUPOS DA LISTA .......................................................................................... 70 F IGURA 49 - C ÓDIGO UTILIZADO PARA IDENTIFICAR TODAS AS PARCERIAS POSSÍVEIS NUM DETERMINADO GRUPO . .............................................................................................................................................. 71 F IGURA 50 – M ENU DE FUNCIONAMENTO DO S ISTEMA DE R ECOMENDAÇÃO .............................................. 72 F IGURA 51 – A LGORITMO DA MACRO PARA APAGAR A INFORMAÇÃO DAS PARCEIRAS ............................... 72 F IGURA 52 – F ORMULÁRIO INICIAL PARA CORRER A MACRO PARA ENCONTRAR OS AUTORES PARA PARCERIAS . ....................................................................................................................................... 72 F IGURA 53 – A LGORITMO PARA IDENTIFICAR OS AUTORES QUE JÁ FIZERAM PUBLICAÇÕES COM UM DETERMINADO AUTOR . ...................................................................................................................... 73 F IGURA 54 – C ÓDIGO PARA O PREENCHIMENTO DOS POSSÍVEIS AUTORES COM QUE O AUTOR EM ANÁLISE PODE TRABALHAR DADO ESTAREM NOS MESMOS GRUPOS . ................................................................ 74 F IGURA 55 – R EPRESENTAÇÃO DOS RESULTADOS OBTIDOS DEPOIS DE ANALISADO O AUTOR 3923. ........... 75 Redes Sociais e Classificação Conceptual ix Índice de Tabelas T ABELA 1 – C ONTEXTO FORMAL DOS PLANETAS . ................................................................................................... 21 T ABELA 3 – T ABELA ORIGINAL RETIRADA DO RELATÓRIO “2012 W ORLD P OPULATION D ATA S HEET ” .............................. 26 T ABELA 4 – T ABELA COM A COMPOSIÇÃO DAS 8 COMUNIDADES . ............................................................................. 41 T ABELA 5 – T ABELA COM CÓDIGO BINÁRIO REPRESENTANDO AS CARACTERÍSTICAS DE DOIS DOS P AÍSES EM ANÁLISE . .......... 44 T ABELA 6 – T ABELA COM A ALTERAÇÃO PARA O FORMATO . DAT ............................................................................... 44 T ABELA 7 – T ABELA COM OS ATRIBUTOS .............................................................................................................. 46 T ABELA 8 –A UTORES , NÚMERO DE CONCEITOS A QUE O AUTOR PERTENCE E RESPETIVA PERCENTAGEM . ........................... 67 T ABELA 9 –A UTORES E NÚMERO DE ISI EM QUE CADA UM JÁ PUBLICOU . ................................................................... 67 Redes Sociais e Classificação Conceptual 7 Figura 1 – Representações de grafos dirigidos e não dirigidos. O primeiro Grafo é não dirigido pois as ligações não possuem uma direção, o segundo e terceiro grafo são dirigidos pois as ligações têm uma direção (Hoppe (2007)). Os Grafos tradicionais possuem no entanto algumas limitações, nomeadamente o facto de serem estacionárias no espaço temporal. No estudo de casos reais os objetos (vértices) possuem um grande dinamismo, é complicado obter toda a informação sobre estes e acima de tudo é irrealista admitir que a rede representada não sofre alterações ao longo do tempo (Hoppe (2009)). 3.2 Conceitos sobre redes Para além dos conceitos básicos de redes, nós e ligações, existem também alguns conceitos importantes para a análise das redes. De acordo com Diestel (2005), a ordem de um grafo G é a cardinalidade de V(G), ou seja, o número total de vértices n. Analogamente, o tamanho de G é a cardinalidade de E(G), isto é, o número total de arestas m. Para os grafos indiretos o número máximo de arestas é   = ()  e para os diretos é   = ( − 1) (1) . Um loop é uma aresta que liga um nó a si mesmo, enquanto que uma aresta simples faz a ligação entre dois vértices. Um caminho (path) de um grafo corresponde a uma sequência de vértices em que pares consecutivos de vértices estão ligados por arestas. Um ciclo (cycle) é um caminho fechado, em que o nó final coincide com o nó inicial. Uma componente conexa é uma parte conexa maximal do grafo (subgrafo), onde para qualquer par de vértices existe pelo menos um caminho de um vértice para o outro. O subgrafo tem de ser uma parte autónoma do grafo, não ligada a uma parte maior (Easley e Kleinberg (2010)). (1) Se forem permitidos loops, é necessário adicionar n às referidas fórmulas, obtendo _ = ( + 1)/2 para os grafos indiretos e de _ = ( + 1) para os grafos diretos. Redes Sociais e Classificação Conceptual 8 Numa matriz de adjacência A, em que   corresponde às suas entradas,   = 1 se i e j estiverem ligados por uma aresta (vizinhos diretos), e   = 0 no caso contrário. 3.2.1 Ligações e nós Existem três tipos de ligações relevantes: as pontes (Bridges), os buracos estruturais (Structural Holes) e os cliques. As pontes são ligações entre dois nós pertencentes a redes diferentes, originando assim uma união entre duas redes distintas criando uma rede maior constituída por dois subgrupos. Num contexto de redes sociais, as pontes constituem um grande interesse para os indivíduos acederem a novas informações e recursos, dado que elas facilitam a difusão de informação entre as comunidades (Kossinets e Watts (2006)). Dentro da temática das pontes, podemos também encontrar pontes locais (Local Bridges), que ao invés de ligar dois grupos distintos, aproximam subgrupos criando uma ligação mais direta, ou seja mais rápida. Este tipo de pontes é ideal para facilitar a difusão de informações dentro da própria rede. Buracos estruturais são buracos estáticos numa rede que impedem a comunicação entre componentes conexos distintas, mas que podem estrategicamente ser preenchidos adicionando uma ligação (Burt (1992)). Estes buracos existem maioritariamente em redes grandes e diversificadas. A utilização de pontes locais é uma possível solução para aumentar a facilidade de difusão da informação dentre da rede. As redes sociais são um bom exemplo de presença destes buracos. Por exemplo, uma pessoa possui, normalmente, vários grupos de “amigos” que apesar de pertencerem todos à mesma rede podem no entanto nem se conhecer, devido às diversas atividades e diferentes ambientes que a pessoa pode possuir. Um clique é um grupo de vértices de um subgrafo em que todos os pares de vértices estão ligados entre si, ou seja, todos os vértices são vizinhos uns dos outros. Normalmente, um clique é denotado por   , onde n indica o número de vértices, ou seja, o tamanho do clique. O tipo de nós mais importante para analisar são os hubs. Estes caracterizam-se pela elevada quantidade de ligações que possuem. Naturalmente, os hubs são a principal fonte de difusão de informações dado serem os que conseguem partilhar informações com mais facilidade e para um maior número de nós. Aqui também se pode introduzir o Redes Sociais e Classificação Conceptual 9 conceito de Autoridades ou Authorities, nós que recebem muitas ligações. Este conceito só se aplica em grafos com ligações dirigidas (directed graphs). 3.3 Medidas estatísticas para análise de grafos As medidas estatísticas que irão ser estudadas contribuem para uma melhor análise de redes (Oliveira e Gama (2011)). O conceito de distância geodésica é o conceito básico necessário para todas as análises estatísticas. A distância geodésica entre dois vértices é o número de arestas que os ligam pelo caminho mais curto, ou seja, pelo caminho constituído pelo menor número de nós. No entanto, nem em todos os grafos todos os pontos possuem ligações entre si. Nestes casos, a distância entre eles é considerada infinita. A distância geodésica média entre todas as combinações de vértices numa rede é usualmente denotada por l e dada por:  =   () ∑   (3.1) onde   é a distância geodésica entre os vértices i e j. É de notar que é usado   ( + 1) em vez de   ( − 1), para incluir a distância de cada vértice a si próprio (que normalmente é nula). Como referido anteriormente, existe a possibilidade de a distância entre dois vértices ser infinita, o que iria causar que a média fosse também infinita. Para combater tal problema é possível utilizar a distância geodésica média harmonizada, alterada de modo a transformar as distâncias infinitas em distâncias nulas. É dada por:   =   () ∑  !(,)   (3.2) A excentricidade de um vértice v pertencente a um grafo G, denotada por # $ , é a distância de v ao vértice mais distante de v, utilizando o caminho mais curto. A excentricidade esta relacionada com conceitos como raio e diâmetro do grafo, em que o raio R(G) é dado pelo menor valor das excentricidades dos vértices de V(G), e o diâmetro D(G) é o maior destes valores. Redes Sociais e Classificação Conceptual 10 # $ = max ∈)(*)\$ (,, -) (3.3) A densidade de um grafo explica o nível geral de conectividade da rede e caracteriza-a como dispersa (sparse), quando possui uma densidade baixa ou densa (dense), quando a densidade é elevada. A densidade é a proporção de arestas (m) de um grafo (G) relativamente ao número máximo de arestas   (Equação 4). .(/)=  012 =   () =  () , 0 ≤ . ≤ 1 (3.4) Quando lidando com grafos diretos, a equação é similar, definida pela proporção de arcos presentes no grafo D (Equação 5). .(4)=  012 =  () , 0 ≤ . ≤ 1 (3.5) Em ambas as situações, a densidade varia de um mínimo de 0, quando o grafo não possui nenhuma aresta/arco, e um máximo de 1, quando o grafo é completo e possui arestas ligando todos os vértices, fazendo com que  =   = ()  . Relativamente às medidas orientadas para as arestas, a embeddedness de uma aresta é dada pelo número de vizinhos comuns partilhados pelos seus vértices. Uma outra medida é a reciprocidade (reciprocity), que é uma quantidade específica para os grafos dirigidos que mede a tendência de pares de vértices para formar ligações simétricas entre eles. A reciprocidade é denotada por r(D), e definida pela proporção de díades (2) num grafo (Equação 6). 5(4)= 6(7) 8 9 = :;(7):<<(7) 8 9 , 0 < 5 < 1 (3.6) onde mut(D) corresponde às díades com ligações mútuas e null(D) às díades sem ligação. (2) Segundo Wasserman e Faust (1994), as díades são subgrafos de grafos dirigidos, constituídos por dois nós e um possível arco entre eles. As díades simétricas podem nulas ou mútuas e o número de díades simétricas num grafo D é denominado de s(D). Redes Sociais e Classificação Conceptual 11 Como se pode observar na Figura 2 as díades podem ser nulas, assimétricas ou mútuas. Uma díade nula possui dois vértices sem qualquer ligação entre si. As díades assimétricas possuem uma aresta direcionada em apenas uma direção, enquanto que nas mútuas a aresta de ligação possui as duas direções (Wasserman e Faust (1994)). Assim, o número de ligações simétricas é a soma entre o número de ligações mútuas (mut(D)) e o número de ligações nulas (null(D)) –> s(D)=mut(D)+null(D). Figura 2 – Representação dos diversos tipos de arestas possíveis num grafo dirigido. [A,B] não possuem uma aresta, logo não têm qualquer ligação. [C,D] possuem uma aresta na direção C para D. [E,F] possuem uma aresta na direção F para E. [C,D] e [E,F] constituem uma díade assimétrica porque a direção é só num sentido. [G,H] é uma díade mútua a sua ligação é constituída por uma aresta com ambos os sentidos, significando que G possui uma relação com H e H com G. (Oliveira e Gama (2011)) Em suma, o valor da reciprocidade representa a probabilidade de dois vértices partilharem o mesmo tipo de ligação num grafo direto. No entanto, a definição mais popular de reciprocidade considera ligações mútuas em vez de simétricas (3) . Estas são calculadas pelo rácio entre o número de díades mútuas e o número de díades não nulas, demonstrado na Equação 7. Nos grafos indiretos, a reciprocidade é sempre máxima (r(G)=1), dado que todos os pares de vértices são simétricos (ou mútuos). (3) Simétrico é um conceito mais vago, dado que engloba as ligações mútuas e as nulas. Redes Sociais e Classificação Conceptual 12 5(4)= :;(7) :;(7)6>(7) , 0 < 5 < 1 (3.7) A betweenness of an edge (Equação 8) é definida como o número de caminhos geodésicos entre vértices que utilizam uma determinada aresta (Newman e Girvan (2004)). Esta equação mede a proporção dos caminhos mais curtos a passar por uma dada aresta; ? @ é a betweenness of an edge, A :$ (B) expressa o número de caminhos mais curtos contendo a aresta e, A :$ é o número de caminhos mais curtos entre os vértices u e v: ? @ =∑ CDE(@) CDE :,$∈)(*)\:,$ (3.8) Figura 3 – Exemplo de um grafo constituído pelos vértices {A,B,C,D,E} e pelas arestas {e1,e2,e3,e4}. (Oliveira e Gama (2011)) Na Figura 3, como existe apenas uma distância geodésica entre cada par de vértices A :$ = 1, ∀ :,$∈)(*)\:,$ , as medidas de betweenness serão as seguintes: ? @ =|H(I, J),(I, J, K),(I, J, 4),(I, J, 4, L)M| = 4 ? @ =|H(J, 4),(K, J, 4),(J, 4, L),(I, J, 4),(K, J, 4, L),(I, J, 4, L)M| = 6 ? @P =|H(K, J),(K, J, I),(K, J, 4),(K, J, 4, L)M| = 4 ? @Q =|H(L, 4),(L, 4, J),(L, 4, J, I),(L, 4, J, K)M| = 4 Redes Sociais e Classificação Conceptual 13 3.3.1 Medidas de centralidade As medidas de centralidade vão permitir determinar a posição de um determinado vértice na estrutura de um grafo. Assim vai ser possível descobrir quais os vértices mais centrais, ou seja, com mais ligações. Estes vértices são importantes pois é através deles que a informação consegue fluir com mais rapidez. As medidas mais utilizadas são o degree, betweenness, closeness e eigenvector centrality. As primeiras três medidas foram propostas por Freeman (1979), para serem utilizadas apenas em redes binárias, ou seja sem pesos ( 4 ) associados às arestas. Mais tarde, Opsahl et al. (2010) propuseram essas mesmas medidas, mas para redes com pesos, ou seja redes que podiam conter valores nos vértices e/ou arestas. A quarta e última medida foi proposta por Bonachi (1987). O grau (degree) de um vértice v mede o nível de envolvimento do mesmo na rede, é calculado utilizando a Equação 9, e determina o número de vizinhos do vértice. R $ corresponde à vizinhança do vértice v, em que no caso dos grafos indiretos é constituída por qualquer vértice que esteja ligado a v. No entanto, nos grafos diretos é necessário ter em atenção a direção da ligação, e aqui teremos dois tipos de grau, o In-degree e o Outdegree. No In-degree, a vizinhança é constituída por todos os vértices que estejam ligados ao vértice v (direcionados para v), enquanto que para o Out-degree, a vizinhança é definida por todos os vértices aos quais o vértice v se liga (direcionado para fora de v). S $ =|R $ |, 0 ≤ S $ ≤  (3.9) A níveis mais gerais, é possível determinar a conectividade do grafo (Equação 10), apenas calculando a média do grau de todos os vértices do grafo (Costa et al. (2008)). S T=   ∑S   U (3.10) ( 4 ) Uma rede com pesos é uma rede que possui arestas com forças diferentes, podendo estas serem mais fortes ou mais fracas. Estas são matematicamente representadas por uma matriz de adjacência com entradas que não são apenas zero e um, mas que são iguais aos pesos das arestas. (Newman (2004)) Redes Sociais e Classificação Conceptual 14 Figura 4 – Grafo não dirigido com o cálculo dos respetivos graus em cada vértice e dois grafos dirigidos com o cálculo do In-degree e do Out-degree, respetivamente. (Oliveira e Gama (2012)) No caso da Figura 4 o grau do vértice G é de S * = 3 para o grafo não dirigido, nos grafos dirigidos o In-degree do vértice G é de S * = 3 e o Out-degree de S * = 1. S T= 2 é a média do grau dos vértices no grafo não dirigido. Para os grafos com pesos o equivalente ao grau é a strength, dada pelo somatório dos pesos das ligações adjacentes ao vértice v (Equação 11). S $ W =∑X $::∈YE (3.11) onde X $: são os pesos das ligações adjacentes ao vértice v. A medida de betweenness de um vértice é dada pelo número de caminhos geodésicos entre dois outros vértices que passam pelo vértice (Equação 12). Vértices com elevada betweenness ocupam uma posição importante na rede, pois permitem que sejam usados como meio de ligação entre diferentes regiões da rede. ? $ =∑ CZ[($) CZ[ 6,;∈)(*)\6,; (3.12) Tomando o exemplo da Figura 3, as medidas de betweenness dos vértices seriam: ? \ =|H(I, J, K),(I, J, 4),(K, J, 4),(I, J, 4, L),(K, J, 4, L)M| = 5 ? ^ = 0 ? 8 = 0 ? 7 =|H(J, 4, L),(I, J, 4, L),(K, J, 4, L)M| = 3 ? _ = 0 Redes Sociais e Classificação Conceptual 15 A terceira medida de Freeman’s é a closeness (Equação 13), esta serve para medir a posição global do vértice na rede. Nas redes sociais, esta medida é maioritariamente utilizada para calcular o quão rápido um ator consegue chegar a qualquer outro na rede. Isto permite verificar a facilidade de difusão da informação pela rede. I $ =  ∑!(:,$) D∈`(a)\E (3.13) em que d(u,v) é a distância geodésica entre os vértices u e v. A quarta medida é a eigenvector centrality, proposta por Bonachi (1987). Esta medida é baseada na ideia de que o poder e estatuto de um vértice são definidos pelo poder e estatuto dos seus vizinhos. O eigenvector de um vértice é proporcional à soma das eigenvector centralities dos seus vizinhos diretos. A eigenvector centrality é dada pela Equação 14, em que   \  corresponde à centralidade dos vértices i e j,   é a entrada na matriz de adjacência A. Por fim λ representa o maior valor próprio de A. Esta medida será das mais adequadas para o cálculo grau do vértice, pois não tem apenas em conta a quantidade de vizinhos mas também a qualidade dos mesmos.   =  b ∑     U (3.14) Por fim a Modularidade (Modularity) permite a deteção e definição de comunidades numa rede. Uma comunidade é constituída por um grupo de nós muito próximos entre si, mas distantes dos restantes (McSweeney (2009)). Inicialmente cada nó n possui a sua comunidade, no entanto depois são analisados todos os nós vizinhos v calculando a existência de um ganho na modularidade ao retirar n da sua comunidade e incluir na comunidade v (Mendonça et al. (2009)). Dada uma partição (conjunto de nós) P e uma rede G modularidade é definida por: c(d, /)=< R, L >) = ∑ <(8f) |_| − 8f∈g ( !(8f) .|_| )  , (3.15) Redes Sociais e Classificação Conceptual 16 onde N é o conjunto total de nós da rede, E corresponde ao conjunto de ligações, I  é uma classe da partição, (I  ) é o número de ligações que ligam os nós dentro de I  e (I  ) é o grau de I  , ou seja é o número de ligações que ligam os nós de I  aos nós exteriores (McSweeney (2009)). 3.4 Análise de Redes sociais A Análise de Redes Sociais (ou SNA) foi criada com o intuito de estudar o comportamento da sociedade. Análise de Redes Sociais é o mapeamento e estudo de relações e fluxos entre pessoas, grupos, organizações, entre outros. A SNA fornece análise tanto visual como matemática das relações humanas (Krebs (2000)). Este tipo de análise foca-se em pequenas redes com dois ou três tipos de ligações, mas apenas com um tipo de nós, estudada apenas num espaço temporal estanque e com informação quase perfeita (Carley (2003)). Esta metodologia de estudo de redes sociais foi um marco importante no estudo da sociedade, pois já permitiu o estudo de redes com mais de um tipo de ligações. Atualmente estudam novos tipos de redes, as redes dinâmicas, que introduziram a análise ao longo do tempo e com diversos tipos de nós, o que permitirá um estudo mais aprofundado do comportamento da sociedade. 3.4.1 Alguns conceitos específicos das redes sociais Grande parte das teorias relativas a redes socias é baseada nos conceitos das teorias de redes e grafos. No entanto, os seguintes conceitos são característicos apenas das SNA. Triadic Closure: Este conceito é apenas aplicado quando a análise da rede é feita ao longo do tempo, pois é baseado no princípio de que se duas pessoas possuem um amigo em comum então é muito provável que estes se tornem também amigos no futuro. Este é o princípio da transitividade (Rapoport (1953)) e é mais facilmente verificado quando o conjunto de indivíduos beneficia com a relação. Structural Equivalence: É uma noção matemática que expressa as semelhanças entre atores numa rede social baseada nos vizinhos que partilham, ou seja, nas ligações idênticas que possuem (Lorrain e White (1971)). Deste modo, dois atores dizem-se estruturalmente equivalentes quando possuem exatamente os mesmos vizinhos, o que significa que podem trocar de lugares sem que se tenha de alterar a estrutura da rede. Redes Sociais e Classificação Conceptual 23 4.1 Algoritmo FCbO: Fast Close-by-One O algoritmo FCbO é uma versão refinada do algoritmo CbO (Close-by-One) de Kuznetsov (Kuznetsov (1993) e Kuznetsov (1999)). O CbO é um algoritmo para o cálculo do conjunto de conceitos associado a um contexto (G,M, I), utilizando uma ordem de “baixo para cima”. Com este algoritmo, um novo conceito é definido inicialmente calculando a interseção entre a intensão do atual conceito com alguns objetos situados no exterior da extensão do conceito. Esta será a nova intensão do conceito, a não ser que um conceito com a mesma intensão já tenha sido calculado. Depois a extensão do conceito atual é estendida de forma a incluir todos os outros objetos que contenham todos os atributos da nova intensão, assim como os seus atributos. O mecanismo de verificação da criação do conceito define uma ordem total no conjunto dos objetos. Depois é verificado se a nova intensão não está incluída num outro objeto exterior à extensão do atual conceito e possui uma ordem inferior à do objeto utilizado para calcular a intensão (Yevtushenko (2004)). O FCbO (Krajca (2010) e Outrata e Vychodil (2012)) veio resolver um problema presente na maioria dos algoritmos de Análise Conceptual Formal, o cálculo múltiplo. O algoritmo FCbO consegue atingir uma melhor performance do que o CbO ao reduzir o número total de conceitos calculados várias vezes. A redução é feita introduzindo um teste de canonicidade adicional que reduz eficazmente a árvore do CbO durante o cálculo. Neste algoritmo o teste canônico original usado no CbO é usado depois de o conceito formal ser determinado. Considerando um contexto formal (G,M,I), ↑I : 2 X → 2 Y e ↓I : 2 Y → 2X, com B ⊆ M e j ∉ B: K ⋂ m  = 4 ⋂ m  , onde 4 = (K⋃HzM) ↓|↑| B m  = H ∈ m| < zM (4.21) FCbO aplica um teste adicional realizado antes de D ser calculado, eliminando assim o cálculo de ↓|↑| . É de notar que (21) falha se K ⊘ z ≠ ∅, onde: K z = (4\K)∩ m  = ((K ∪ HzM) ↓|↑| \K) ∩ m  (22) Redes Sociais e Classificação Conceptual 24 O novo teste de canonicidade explora o facto de se (21) falha dado B e z ∉ K, a monotonia de ↓|↑| defende que o teste também falhará para cada K′⊇ K tal que z ∉ K′. Assim, o novo teste de canonicidade é baseado nas seguintes declarações: Sejam K ⊆ m, z ∉ K, e K z ≠ ∅. Então, para cada K′⊇ K tal que z ∉ K′ e K z ⊈ K′, temos que K ′ z ≠ ∅. O FCbO pode ser visto como uma extensão do CbO em que a informação é propagada sobre os conjuntos (22) que fazem parte do novo teste. De forma a aplicar o novo teste é necessário trocar a estratégia de procura do algoritmo de uma procura de “baixo para cima”, usada no CbO, para uma combinação entre a procura de “baixo para cima” com uma de “cima para baixo”. A grande alteração que melhorou o algoritmo FCbO foi que ao contrário do CbO, quando um teste tem êxito este não é processado recursivamente mas a informação sobre os conceitos é armazenada numa lista. Só depois de cada atributo ser processado é que são feitas as chamadas recursivas. Os testes de canonicidade são feitos com base na informação armazenada. Isto vai fazer com que a árvore com os conceitos do FCbO seja mais reduzida do que a do CbO, sendo assim mais sucinta e mais precisa. Figura 6 – Exemplo de uma árvore CbO reduzida para uma árvore FCbO. As linhas contínuas representam a árvore FCbO e as linhas tracejadas representam os conceitos da árvore CbO que não pertencem à árvore FCbO (Krajca et al. (2010)). Redes Sociais e Classificação Conceptual 25 5 Metodologias de Análise de Redes e de Análise Conceptual Formal Este capítulo servirá para explicar as metodologias posteriormente utilizadas na análise dos dados de coautorias, sendo estes os principais dados analisados nesta dissertação. Para o efeito, são utilizadas duas tabelas de dados para a explicação, uma retirada do website das Nações Unidas http://comtrade.un.org/db/dqBasicQuery.aspx, constituída pelas relações comerciais entre 28 Estados Membros da União Europeia, e outra criada com algumas características demográficas dos mesmos países, esta retirada da revista “2012 World Population Data Sheet” – Population Reference Bureau. Para evitar uma excessiva quantidade de informação para a primeira tabela são apenas consideradas as exportações de Cereais no ano de 2012. Devido ao seu tamanho é recomendada a visualização da base de dados originais através do link presente no Anexo 1. No entanto, desta tabela é apenas necessário retirar as ligações comerciais e os seus valores de modo a criar uma rede para posterior análise no package Gephi. Presente no Anexo 2, a rede de ligações comerciais é constituída por uma primeira coluna com o país exportador, uma segunda coluna com o país que recebe o bem e uma terceira com o valor comercial anual das transações. A segunda tabela de dados, corresponde a características demográficas dos 28 Estados Membros da União Europeia. Esta tabela possui um código binário que reflete se o país possui uma determinada característica (1) ou não (0) (Anexo 3). Como é compreensível, a tabela não possuía os dados em código binário nem estava preparada para tal. Na tabela 3 encontram-se os dados antes do pré-processamento, isto é, antes da categorização das variáveis originais (ver Anexo 3). Por exemplo, a variável “Births per 1000 Population” foi categorizada em “Nascimentos por cada mil habitantes inferiores a 10” (“Births per 1000 Population <10”) ou “Nascimentos por cada mil habitantes superiores a 10” (“Births per 1000 Population >10”). Redes Sociais e Classificação Conceptual 26 Population mid-2012 (millions) Births per 1,000 Population Deaths per 1,000 Population Rate of Natural Increase % Net Migration Rate per 1,000 2050 Population as a Multiple of 2012 Infant Mortality Rate Denmark 5,6 11 9 0,1 4 1,1 3,5 Estonia 1,3 11 11 0 0 0,9 3,3 Finland 5,4 11 9 0,2 3 1,1 2,4 Ireland 4,7 16 6 1 -7 1,4 3,5 Latvia 2 9 14 -0,5 -4 0,8 5,7 Lithuania 3,2 11 13 -0,2 -12 0,9 4,3 Sweden 9,5 12 10 0,2 5 1,1 2,1 United Kingdom 63,2 13 9 0,4 4 1,3 4,3 Austria 8,5 9 9 0 4 1,1 3,6 Belgium 11,1 12 10 0,2 7 1,2 3,5 France 63,6 13 9 0,4 1 1,1 3,5 Germany 81,8 8 10 -0,2 3 0,9 3,4 Luxembourg 0,5 11 7 0,3 16 1,3 3 Netherlands 16,7 11 8 0,2 2 1 3,8 Bulgaria 7,2 10 15 -0,5 -1 0,8 8,5 Hungary 9,9 9 13 -0,4 2 0,9 4,9 Poland 38,2 10 10 0,1 0 0,9 4,8 Romania 21,4 9 13 -0,4 0 0,9 9,9 Slovakia 5,4 11 9 0,2 0 1 5,3 Croatia 4,3 9 12 -0,2 -1 0,9 4,4 Greece 10,8 10 10 0,1 4 1 3,8 Italy 60,9 9 10 -0,1 4 1 3,4 Malta 0,4 10 7 0,2 6 0,9 5,5 Portugal 10,6 9 10 -0,1 1 1 2,5 Slovenia 2,1 11 9 0,1 1 1 3 Spain 46,2 10 8 0,2 -2 1 3,2 Tabela 2 – Tabela original retirada do relatório “2012 World Population Data Sheet” 5.1 Metodologia das Redes A criação das redes é efetuada com recurso a um software específico para criação e análise de redes denominado Gephi. Esta plataforma gratuita desenvolvida pela Gephi Consortium, vai permitir criar e analisar as redes das duas bases de dados apresentadas. Com este programa a visualização e compreensão das redes será facilitada; o programa fornece também uma ampla quantidade de estatísticas úteis para a análise. O package Gephi possui a opção de fazer o upload e configuração de uma rede através do formato csv, no entanto esta não é muito eficaz, assim a criação de um ficheiro de extensão .gdf é aconselhada. Este tipo de ficheiro necessita de dois tipos de entradas facilmente codificadas num programa de texto como o Notepad ++, uma Redes Sociais e Classificação Conceptual 27 inicial constituindo a informação dos nós e uma segunda e final com a informação das ligações (Anexo 4). Para codificar os nós são necessárias no mínimo duas entradas, uma com o código único do nó e outra com o nome atribuído a esse código. Para esta análise foi criada mais uma entrada com o valor das exportações em milhões. Cada linha representa um nó e as suas características são separadas por uma vírgula, estas podem ser classificadas como texto usando o código VARCHAR ou como número usando o código INT (números inteiros). Esta codificação da informação do nó é colocada no cabeçalho em frente ao nome atribuído a essa informação (Figura 7). Figura 7 – Parte da codificação dos nós da rede constituído por 3 entradas, código do país, nome do país e valor das exportações em milhões de Euros. A codificação das relações é similar, devendo ser colocada imediatamente abaixo do final da informação sobre os nós. Aqui usam-se apenas os códigos dos nós e não o seu nome de forma a evitar erros, pois vários nós, dependendo do tipo de informação, podem ter o mesmo nome. Nos exemplos aqui analisados vão ser utilizadas 3 entradas, uma com o nó de partida, uma com o nó de chegada e outra com um valor atribuído à relação (ver Figura 8). Figura 8 – Parte da codificação das relações, constituída pelo país exportador, pelo país recetor do bem e pelo valor do bem em Euros. A mesma codificação é utilizada para o tipo de informação aplicando VARCHAR às entradas de texto e INT às entradas numéricas. Redes Sociais e Classificação Conceptual 28 No package Gephi, o primeiro passo consiste em definir o tipo de grafo, devendo escolher-se “dirigido” ou “não dirigido”. Considerando a transferência dos cereais, o mais indicado para esta situação é escolher um grafo dirigido, pois existe um sentido na transferência. A rede inicial é criada de forma aleatória, posicionando os nós sem uma lógica aparente (ver Figura 9). Para facilitar a análise é possível utilizar um conjunto de algoritmos que alteram o posicionamento dos nós mediante uma determinada lógica. O algoritmo utilizado é denominado de Force Atlas, este algoritmo tem a capacidade de aproximar os nós mediante a força das suas ligações, criando assim grupos dentro da própria rede (Figura 10). Figura 9 – Rede das exportações entre 28 Estados Membros da União Europeia. Rede inicial sem qualquer alteração do posicionamento dos nós. Esta pode ser diferente sempre que aberta no package Gephi. Redes Sociais e Classificação Conceptual 29 Figura 10 – Parâmetros do algoritmo e a sua explicação. Como demonstra a Figura 11, a utilização do algoritmo não produziu bons resultados. Como os nós possuem uma relação muito forte entre si, o algoritmo juntou demasiadamente todos os nós. Felizmente é possível alterar os parâmetros do algoritmo, neste caso basta diminuir a força de atração (Attraction strength), aumentar a força de repulsão (Repulsion strength) ou alterar ambas. Para ser possível ter uma boa visualização da rede a força de repulsão foi alterada para 9999999999 e a força de atração para 5, criando assim a rede representada na Figura 12. Figura 11 – Rede utilizando os parâmetros de origem do algoritmo Force Atlas. Redes Sociais e Classificação Conceptual 30 Figura 12 – Rede criada com as alterações da força de repulsão para 9999999999 e a força de atração para 5. ( 7 ) A análise propriamente dita inicia-se agora, começando por fazer alterações na visualização da rede através da introdução de parâmetros de hierarquização quer dos nós quer das relações. Na Figura 12 já é possível verificar que algumas ligações têm linhas mais espessas que outras, isto tem a ver com o valor das exportações, quanto maior o valor das exportações mais espessa a linha da ligação. O package Gephi possui uma opção de identificação dos nós. Uma vez os nós identificados, é possível iniciar as análises e explicar os respetivos resultados. Começando por uma análise dos nós, foi feita na Figura 13 uma coloração, variando de verde, nos nós com grau mais elevado, para vermelho nos nós com grau baixo. Como era expectável pela utilização do algoritmo Force Atlas, os nós com mais ligações, ou (7) As falhas que se observam nas ligações são apenas problemas de resolução e não linhas descontínuas. Redes Sociais e Classificação Conceptual 31 seja com um grau maior, encontram-se localizados no centro da rede devido à Attraction Distribution Option referida na Figura 10. Figura 13 – Rede de países após coloração dos nós mediante o seu grau: verde para os nós com grau mais elevado e graduando para vermelho com a diminuição do grau dos nós. Na Figura 14 é relativamente percetível que os países com mais ligações são a Alemanha, Holanda e França. No entanto podem surgir algumas dúvidas com o Reino Unido, a Bélgica, e Espanha e talvez com a Áustria também. Para facilitar esta análise é possível aumentar o tamanho dos nós, neste caso em função do grau. Assim, analisando a Figura 15 já é mais fácil validar a teoria inicial, que os países com um grau maior são a Alemanha, Holanda e França. Quanto maior a amplitude entre o tamanho mínimo e o máximo dos nós definida nas opções desta análise, mais fácil é identificação de os nós. Redes Sociais e Classificação Conceptual 32 Isto porque o tamanho dos nós com grau baixo será muito inferior ao dos com grau elevado. Figura 14 – Imagem da rede com foco nos países com grau mais elevado. Figura 15 – Imagem da rede com foco nos países com grau mais elevado, após a alteração do tamanho dos nós consoante o grau. Foi definido um tamanho mínimo de 2 e um máximo de 25, de modo a serem mais visíveis as diferenças entre graus. Como a rede em análise é uma rede dirigida vai ser possível fazer as análises referidas acima para o In-Degree e o Out-degree, identificando assim quais os países que importam de mais países e os que exportam para mais países, respetivamente. Fazendo a hierarquização dos nós pelo In-degree com a coloração dos nós e a alteração Redes Sociais e Classificação Conceptual 39 Figura 22 - Gráfico representativo dos resultados do Weighted In-Degree. No cálculo da distância da rede o package Gephi efetua também análises para a Betweenness Centrality, Closeness Centrality e a Eccentricy. Com estas análises sãonos fornecidos a distância média de um caminho, igual a 1,24, e o número de caminhos mais curtos existentes na rede, 600. Estes resultados estão presentes no Anexo 7, assim é possível concluir que em média é necessário passar por 1,24 nós para chegar de um determinado nó até outro. Analisando a Densidade de uma rede é possível identificar o quão perto a rede está de ser uma rede completa, ou seja com a totalidade dos nós ligados entre si. A densidade da rede é de 0,602 o que indica que mais de metade das ligações já estão efetuadas, no entanto ainda faltam muitas para que a rede esteja completa perfazendo assim uma densidade de 1. Neste caso específico todos os países exportariam para todos os países, fazendo com que estivessem todos ligados. A próxima medida denominada de HITS vai analisar dois valores distintos para cada nó, o primeiro valor (denominado Authority) mede quão valiosa é a informação armazenada no nó. O segundo valor (denominado de Hub) mede a qualidade das ligações de cada nó. Observando as Figuras 23 e 24 conclui-se que a informação Redes Sociais e Classificação Conceptual 40 armazenada nos nós não é muito valiosa e que a qualidade das ligações é fraca, uma vez que os valores estão todos muito próximos de zero. Figura 23 – Distribuição de Hubs, permite medir a qualidade das ligações de cada nó. Quanto mais próximo de 1 melhor é a qualidade. Figura 24 – Distribuição de Authority, permite medir a qualidade da informação armazenada em cada nó. Quanto mais próximo de 1 melhor é a qualidade e mais valiosa é a informação. Redes Sociais e Classificação Conceptual 41 A deteção de comunidades é bastante importante na análise de redes sociais, o package Gephi possui ferramentas de deteção de comunidades. Como indicado na Figura 25, existe a possibilidade de procurar comunidades pequenas ou comunidades grandes. Como a rede é relativamente pequena não tem lógica procurar comunidades grandes, logo a Resolução escolhida foi de 0,7. Não se considerando pesos nas arestas, é necessário desseleccionar a opção Use weights. Figura 25 – Opções assumidas para a deteção de comunidades, optando por uma resolução de 0.7 para a deteção de comunidades relativamente pequenas. Como apresentado na Tabela 4 é possível identificar oito comunidades, Label Mod. Class Label Mod. Class Label Mod. Class Label Mod. Class Estonia 0 Croatia 1 U . Kingdom 2 Austria 5 Finland 0 Czech Rep 1 Belgium 3 Germany 5 Ireland 0 Greece 1 Netherlands 3 Slovakia 6 Latvia 0 Slovenia 1 Luxembourg 4 Italy 6 Lithuania 0 Romania 1 Poland 4 France 7 Denmark 0 Hungary 2 Portugal 4 Spain 7 Bulgaria 1 Malta 2 Sweden 4 Cyprus 7 Tabela 3 – Tabela com a composição das 8 comunidades em que Label corresponde à identificação do país e Mod. Class é a classe de modularidade, cada número corresponde a uma comunidade. 5.1.2 Análise geral dos nós Para a análise dos nós existem apenas duas estatísticas definidas no package Gephi, o coeficiente de agrupamento médio (Avg. Clustering Coefficient) e o Eigenvector centrality. Redes Sociais e Classificação Conceptual 42 O coeficiente de agrupamento, indica os efeitos das redes Small-World. Assim vai ser possível verificar quão integrados estão os nós nas suas vizinhanças. A média deste coeficiente fornece uma indicação generalizada dos agrupamentos da rede. A média fornecida após correr o algoritmo é de 0,67 indicando assim uma boa integração dos nós nas suas vizinhanças. O Eigenvector centrality fornece informações sobre a importância dos nós na rede baseado nas ligações de cada nó. De acordo com a Figura 26, a maioria dos nós tem um Eigenvector centrality superior a 0,5 demonstrando que estes possuem todos importância na rede. São de destacar pela positiva a Alemanha, Holanda e Itália com coeficientes próximos de 1 e pela negativa a Hungria com um coeficiente próximo de 0. Figura 26 – Gráfico com os valores da Distribuição do Eigenvector Centrality de cada nó. Cada ponto corresponde a um nó marcando assim o valor do Eigenvector. À medida que se efetuam as análises acima mencionadas, os resultados generalizados para a rede são apresentados com as estatísticas (Figura 27), no entanto os resultados relativos a cada nó são armazenados na tabela de dados com a informação dos nós. Estes resultados estão disponíveis no Anexo 8. Redes Sociais e Classificação Conceptual 43 Figura 27 – Conjunto de estatísticas disponíveis no Gephi e seus resultados para a rede em análise. 5.2 Metodologia da Análise Conceptual Neste capítulo irá ser abordada uma análise diferente com o intuito de complementar a análise de redes. A análise conceptual vai permitir agrupar os países mediante as suas intensões, ou seja atributos em comum. Para esta análise é necessária a utilização de dois programas distintos, porque não foi encontrado um software gratuito que conseguisse determinar os conceitos e calcular as intensões e respetivas extensões. Deste modo foi usado para a determinação dos conceitos e o cálculo das intensões o FCbO, um programa que faz o cálculo formal dos conceitos através do algoritmo FCbO, e foi criado um código em linguagem R capaz de determinar as extensões mediante os resultados obtidos do FCbO. Para que os dados pudessem ser utilizados no software FCbO estes tiveram de ser convertidos para o tipo de ficheiro .dat, onde é necessário converter os “1” para o número da coluna que este representa. Analisando a Tabela 5, temos dois países com “1” nas características que cada um possuí e 0 nas que não possuem. Para transformar em formato .dat é substituído o 1 pelo número da coluna ficando apenas os números das colunas com as características que o país possui (Tabela 6). Redes Sociais e Classificação Conceptual 44 Tabela 4 – Tabela com código binário representando as características de dois dos Países em análise. Tabela 5 – Tabela com a alteração para o formato .dat Apesar da apresentação na Tabela 6 o programa apenas necessita dos valores, ignorando tanto os nomes dos países como os cabeçalhos, ficando com a apresentação representada no Anexo 9. Pode ser necessário para a utilização do FCbO a criação de um executável do MsDos com o diretório apenas para abrir o programa. Este programa tem uma utilização bastante simples, sendo neste caso apenas necessário usar o código representado na Figura 28. Aqui é possível verificar que a primeira parte corresponde ao diretório da localização do programa, “fcbo” é o nome do ficheiro do programa e de seguida tem o respetivo código, em que “países.dat” é o nome do ficheiro onde estão os dados e “resultadospaises.dat” o nome para o ficheiro com os resultados que irá ser criado. Neste caso, a primeira coluna da tabela de dados (primeiro atributo da Tabela 6) é representada por 0 (zero). Figura 28 – Representação do código para utilização do software FCbO no ficheiro de dados países.dat. Representado por uma amostra na Figura 29 e na totalidade no Anexo 10, o ficheiro de dados resultantes do FCbO contém as intensões dos conceitos do conjunto dos 28 Estados Membros da EU. Cada linha representa uma intensão e cada número representa um atributo, sendo que as intensões são, neste caso, um conjunto de atributos presentes num determinado conjunto de países. Vamos então ter, por exemplo, um conjunto de Redes Sociais e Classificação Conceptual 45 países que possuem uma taxa de mortalidade infantil acima de 5 e uma população em 2050 inferior à de 2012, intensão = {14, 11}. Figura 29 – Amostra dos resultados obtidos através da utilização do FCbO, constituídos pelas intensões dos conceitos formados a partir dos dados demográficos dos países. Como os resultados do FCbO não incluem as extensões foi necessário criar um outro método para arranjar as extensões. Para tal foi usado o software R criando um código que vai usar dois tipos de dados: A tabela do Anexo 9 contendo os atributos dos países, esta necessitou de uma pequena alteração, como nem todos os países possuíam o mesmo número de características havia linhas com diferente número de colunas e portanto, para igualar o número de colunas foi usado o número “999”; A segunda entrada de dados é classificada como lista, exatamente por não ter o mesmo número de colunas, e vai ser constituída pelas intensões (tabela do Anexo 10). Redes Sociais e Classificação Conceptual 46 Páises C1 C2 C3 C4 C5 C6 C7 Denmark 0 4 5 8 10 12 13 Estonia 0 4 6 7 9 11 13 Finland 0 4 5 8 10 12 13 Ireland 0 4 5 8 9 12 13 Latvia 0 3 6 7 9 11 14 Lithuania 0 4 6 7 9 11 13 Sweden 0 4 5 8 10 12 13 United Kingdom 2 4 5 8 10 12 13 Austria 0 3 5 7 10 12 13 Belgium 4 5 8 10 12 13 999 France 2 4 5 8 10 12 13 Germany 2 3 5 7 10 11 13 Luxembourg 0 4 5 8 10 12 13 Netherlands 4 5 8 10 11 13 999 Bulgaria 0 3 6 7 9 11 14 Hungary 0 3 6 7 10 11 13 Poland 3 5 8 9 11 13 999 Romania 3 6 7 9 11 14 999 Slovakia 0 4 5 8 9 11 14 Croatia 0 3 6 7 9 11 13 Greece 3 5 8 10 11 13 999 Italy 2 3 5 7 10 11 13 Malta 0 3 5 8 10 11 14 Portugal 3 5 7 10 11 13 999 Slovenia 0 4 5 8 10 11 13 Spain 3 5 8 9 11 13 999 Tabela 6 – Tabela com os atributos e usando o número 999 para que todos os países tenham o mesmo número de colunas Presente no Anexo 11, a função criada para este caso funciona de uma maneira simples: usando como variável a lista de intensões o algoritmo vai percorrer todas as entradas da lista uma a uma gravando no final de cada análise o resultado na lista denominada res.final. O algoritmo ao abordar uma entrada (intensão) vai primeiro verificar a o seu cardinal através de uma função if (if (length(dados[[i]])==1), exemplo para testar se tem um valor apenas), caso o cardinal da intensão do conceito coincida com o valor representado na função é feito o cálculo da extensão, caso contrário passa para outra função if igualando o cardinal a um outro valor. O Código 1 representa um exemplo para a função de cálculo das extensões. Este exemplo é usado para intensões com apenas dois valores; para calcular as extensões o algoritmo vai verificar coluna a Redes Sociais e Classificação Conceptual 47 coluna nos dados da Tabela 7 se algum país possui as características presentes na intensão. Isto é feito individualmente, procurando um país que possua o primeiro valor da intensão (dados[[i]][1]) numa das 7 colunas da Tabela 7 (Código 2), utilizando o “|” representando “ou”. Isto é, verifica se o valor da intensão está na primeira coluna (C1) ou na segunda coluna (C2), ou na terceira e assim sucessivamente. Após verificar isto para o primeiro valor o algoritmo faz o mesmo para o segundo valor da intensão; se a intensão possuir mais valores faz o mesmo para todos. Como é pretendido que o país possua todos os valores das intensões, as pesquisas dos vários valores da intensão são separados por um “&”. Como este código está a fazer uma pesquisa dentro do data frame criado com os valores da Tabela 7 (teste[…]) é preciso identificar no final qual a coluna contendo a informação que é pretendido que o R devolva, sendo esta o “id”, onde estão colocados os nomes dos países. resultado<- teste[(teste$C1==dados[[i]][1]|teste$C2==dados[[i]][1]|teste$C3==dados[[i]][1]|teste$C4==dad os[[i]][1]|teste$C5==dados[[i]][1]|teste$C6==dados[[i]][1]|teste$C7==dados[[i]][1])&(teste$C1 ==dados[[i]][2]|teste$C2==dados[[i]][2]|teste$C3==dados[[i]][2]|teste$C4==dados[[i]][2]|teste$ C5==dados[[i]][2]|teste$C6==dados[[i]][2]|teste$C7==dados[[i]][2]),"id"] Código 1 – Código R para calcular as extensões de intensões com dois valores. (teste$C1==dados[[i]][1]|teste$C2==dados[[i]][1]|teste$C3==dados[[i]][1]|teste$C4==dados[ [i]][1]|teste$C5==dados[[i]][1]|teste$C6==dados[[i]][1]|teste$C7==dados[[i]][1]) Código 2 – Código R para verificar se algum país possui o primeiro atributo presente na intensão. Na Figura 30 está representada uma amostra dos resultados obtidos a partir do programa em R, os resultados completos encontram-se no Anexo 12. Na Figura 30 representam-se as extensões das 3 primeiras intensões, é no entanto de notar que não foi tida em conta a primeira intensão (verificar na Figura 29) pois esta representava todos os atributos, e nenhum país possuía todos os atributos. Relembrando a Figura 29, a segunda intensão possuía os atributos 2, 10, 5 e 13 o que significa que os países Reino Unido, França, Alemanha e Itália possuem estes 4 atributos. Já a Letónia, Bulgária, Roménia, Eslováquia e Malta têm em comum os atributos 14 e 11, e por fim a Estónia, Letónia, Lituânia, Bulgária, Hungria, Roménia e Croácia têm em comum os atributos 6, 7 e 11. Redes Sociais e Classificação Conceptual 48 Figura 30 – Imagem superior com uma amostra dos resultados retirados do programa em R, estes resultados são as extensões calculadas a partir das intensões e da tabela de dados inicial. Estas extensões representam os diversos países que possuem os vários atributos mencionados nas intensões. Imagem inferior com as intensões referentes às extensões apresentadas (ver Tabela 5 ou 6 para identificação das intensões). Com estes resultados é possível a criação de grupos, pois as extensões integram vários países com as mesmas características. Assim, esta técnica também é considerada uma técnica de agrupamento, pois vai sempre agrupando os países em pequenos grupos (as extensões dos conceitos). Redes Sociais e Classificação Conceptual 55 Figura 36 - Rede hierarquizada pelo número de publicações através da coloração dos nós, sendo verdes os nós com mais publicações e vermelhos os com menos publicações. A hierarquização é feita também através do tamanho dos nós num intervalo de tamanho [10,25] em que o tamanho aumenta em proporção do aumento do número de publicações. Foi também feita uma comparação do comportamento dos nós através do grau e através do número de publicações (Figura 37). Para esta análise apenas o nó 2744 possui bons resultados tanto no grau como nas publicações, sendo que os restantes não possuem um comportamento coincidente entre o grau de o número de publicações. Complementando estes resultados foi calculado o coeficiente de correlação entre o grau e o número de publicações, obtendo r = 0,522934. O que significa que o grau e o número de publicações possuem uma correlação não muito elevada mas positiva. Redes Sociais e Classificação Conceptual 56 Figura 37 - Rede hierarquizada pelo número de publicações através da coloração dos nós, sendo verdes os nós com mais publicações e vermelhos os com menos publicações. A hierarquização é feita também através do tamanho dos nós num intervalo de tamanho [10,25], no entanto esta é relativa ao grau. A coloração dos nós consoante o peso das publicações na rede é, como já referido acima, uma análise pouco relevante dado que as ligações estão por definição hierarquizadas pelo valor associado através do tamanho. Para além disto, já foi efetuado através do número de publicações de cada nó. Esta análise permite descobrir quais os pares com mais obras publicadas em conjunto (Figura 38). Este conjunto é sem dúvida o constituído pelos autores 11108 e 67730, que possuem um peso de 2,985 seguidos pelos grupos 14209 e 66596, 18645 e 14209 e o grupo 18645 e 66596. Este resultado é deveras interessante pois verifica-se que estas três díades são constituídas por apenas 3 Redes Sociais e Classificação Conceptual 57 autores que vão trabalhando uns com os outros. Este facto mostra a existência de uma grande cumplicidade entre os autores. Figura 38 – Rede com as ligações hierarquizadas pelo peso do número de publicações na rede através da coloração, sendo verde para as ligações com um peso elevado e vermelho com peso baixo, e por definição através do tamanho sendo as linhas mais espessas quanto maior o peso. As ligações com maior peso estão realçadas através de uma linha circular. 6.1.1 Análises estatísticas da rede Como já referido o package Gephi permite o cálculo de algumas análises estatísticas sobre a rede, dando assim uma imagem mais pormenorizada. Os resultados aqui apresentados vão centrar-se apenas nas médias e nos nós mais relevantes, sendo que os resultados para cada nó são apresentados no Anexo 18. No cálculo do grau médio agora é apenas analisado o grau dos nós, pois como as ligações são não dirigidas não existe nem o In-degree nem o Out-degree. O grau médio Redes Sociais e Classificação Conceptual 58 desta rede é de 2,009 significando que em média um autor está ligado a dois outros autores. Observa-se na Figura 39 que a maioria dos nós possuem um grau baixo, de 1 ou 2 nós. Apenas dois nós têm um grau de 10, sendo estes o 2744 e o 9111, que fazem aumentar a média. Mais uma vez, é de referir que na amostra analisada não existe muita cooperação entre os autores. Figura 39 – Gráfico da distribuição do grau dos nós. Eixo X corresponde ao valor do grau e o eixo Y corresponde ao índice de frequência de nós com esse grau. Enquanto a média do grau apenas soma o número de ligações de um nó, na Average Wheighted Degree ou média ponderada do grau, a média é calculada somando os pesos das ligações dos nós. Para esta rede de autores a média ponderada do grau é de 0,943. Apesar de esta média ser mais fidedigna é, no entanto mais difícil de interpretar. Mesmo assim, é facilmente visível pelo gráfico da Figura 40 que esta média é muito baixa. Redes Sociais e Classificação Conceptual 59 Figura 40 – Gráfico da distribuição do grau ponderado dos nós. Eixo X corresponde ao valor do grau ponderado e o eixo Y corresponde à contagem de nós. A análise do diâmetro da rede fornece-nos várias estatísticas relacionadas com as distâncias: o diâmetro, o raio, o comprimento do caminho médio e o número de caminhos mais curtos. Esta rede possui um diâmetro de 4, significando que a distância máxima entre qualquer par de nós é de apenas 4 nós. Isto pode ser causado pela existência de muitos pequenos grupos que não estão unidos, criando assim muitas falhas de ligação, falhas estas que como já referido configuram uma distância nula. O raio da rede representa a menor distância entre um par de nós, que logicamente é de 1. Na ligação de qualquer par de nós, a distância média é de 1,714, ou seja, em média a distância das ligações entre quaisquer dois autores da rede é de 1,714 nós. Mais uma vez devido à existência de muitos pequenos grupos sem ligações existem uma grande quantidade de caminhos mais curtos, 936. Na Figura 41 está representado o gráfico com a Betweenness Centrality Distribution, obtendo-se um valor interessante: a maioria dos nós não aparece no meio da ligação de um par de nós através de caminhos mais curtos. O que é compreensível devido aos Redes Sociais e Classificação Conceptual 60 resultados acima obtidos, a distância média entre dois nós é de apenas 1,714, ou seja em média existe apenas 1 nó no meio de uma ligação entre dois pares. Dado este resultado ser para caminhos normais, nos caminhos mais curtos a distância seria ainda mais curta, provocando assim este elevado número de nós que não intercedem ligações mais curtas entre nós. É no entanto possível verificar que um dos nós possui uma Betweenness Centrality de 67, este nó é o autor 1154. O autor 11108 (47,5) e o 2744 (44) também possuem bons resultados; é também de notar que estes três autores possuem um grau elevado podendo este ser um indicador justifica os bons resultados na Betweenness Centrality. Figura 41 – Distribuição da Betweenness Centrality da rede. No Eixo X estão representados os possíveis valores da Betweenness Centrality e no Eixo Y está representada a contagem. A Closeness Centrality fornece a distância média a partir de um determinado nó para todos os outros da rede. Aqui temos a maioria dos nós como uma Closeness Centrality de 1, sendo que para os restantes a distância média varia entre o 1 e 3. Mais uma vez se verifica o quão curtos os caminhos são, caso a rede estivesse mais ligada, estas distâncias seriam maiores pois existiriam mais caminhos possíveis para ligar os nós. Redes Sociais e Classificação Conceptual 61 Figura 42 – Gráfico da Closeness Centrality Distribution com o Eixo X representando os valores desta medida e no Eixo Y a contagem destes valores. A Eccentricity Distribution vai calcular a distância de um determinado nó ao correspondente nó mais longe na rede. Mais uma vez se observa que a maioria dos nós tem o seu nó mais distante a uma distância de apenas 1 nó. Isto mostra mais uma vez a falta de ligações entre os autores na rede. A maior distância é de apenas 4, muito curta para uma rede com este tamanho. Redes Sociais e Classificação Conceptual 62 Figura 43 – Gráfico da Eccentricity Centrality Distribution com o Eixo X representando os valores desta medida e no Eixo Y a contagem destes valores. Como é de esperar tanto pelos resultados obtidos como pelas conclusões já retiradas, a densidade do grafo é muito baixa, de 0,010. Como quanto mais completa a rede, mais próxima será de 1, esta rede está muito incompleta. Mesmo sendo os dados todos de publicações na área da Economia existem muito poucas ligações entre os autores. Podendo talvez existir uma especialização dos autores na área geral de publicação e mais especificamente na ISI. Na Figura 44 estão representadas as distribuições de Hubs e Authority. Infelizmente os resultados destas estão muito aquém do desejado, dado que tanto as ligações como os nós possuem informação de fraca qualidade e pouco valiosa. Redes Sociais e Classificação Conceptual 63 Figura 44 – Gráficos do Hubs e Authority Distributions com o Eixo X representando os valores destas medidas e no Eixo Y a contagem destes valores. Para a deteção de comunidades, foi novamente ignorado o peso dos nós. Para esta rede e tendo em conta os resultados já obtidos, é expectável que existam bastantes comunidades; a resolução da Modularity é de 1. Com estas características o package Gephi conseguiu detetar 61 comunidades (ver Anexo 19). Numa abordagem mais direcionada para o estudo dos nós, é verificado que em média o clustering dos nós nem é muito baixo, ficando nos 0,498. Ao analisar a rede é Redes Sociais e Classificação Conceptual 64 imaginável que tal possa acontecer pois embora a rede seja um pouco dispersa, existem muitos grupos de nós bastante unidos. Tal é verificado na Figura 45. Figura 45 - Gráfico da Clustering Coefficient Distribution com o Eixo X representando os valores desta medida e no Eixo Y a contagem destes valores. Os pontos vermelhos representam a quantidade de nós que possuem um determinado valor de Clustering Coefficient. O cálculo do Eigenvector Centrality é mais uma medida de análise dos nós da rede, possibilitando analisar se um nó é ou não importante na rede baseado nas suas ligações. É de prever que não existam muitos nós com muita importância, pois estes possuem poucas ligações e maioritariamente fracas. Como é visível na Figura 46, a maioria dos nós possuem um Eigenvector Centrality inferior a 0,5, o que significa que a maioria dos nós não possui uma grande importância na rede. Existem no entanto alguns nós que se destacam com ótimos resultados como o 9111 (1), o 1154 (0,997) e o 11108 (0,709), valores estes observáveis no Anexo 20. Já era de esperar serem estes os autores mais relevantes na rede dado que têm conseguido bons resultados em quase todas as análises efetuadas à rede. Redes Sociais e Classificação Conceptual 71 anteriores começa por selecionar o primeiro autor da primeira linha e imprime todas as parcerias que este pode fazer, e assim sucessivamente por todos os autores. Figura 49 - Código utilizado para identificar todas as parcerias possíveis num determinado grupo. O único problema deste método é que a análise das parcerias existentes num grupo e as que são passíveis de existir tem de ser feita manualmente, o que exige algum tempo. Estas análises vieram confirmar o já expectável ao analisar a rede de coautorias: que ainda existem muitas parcerias que podem ser criadas. Para uma análise futura seria interessante realizar uma análise mais individualizada, criando uma lista por autor de parcerias já criadas e de parcerias passíveis de serem criadas. Para facilitar esta análise foi criado um ficheiro em Excel capaz de restituir os coautores de um determinado autor à escolha, e um conjunto de autores com quem poderia fazer parcerias, pois pertencem aos mesmos grupos do autor escolhido (Anexo 31). A utilização do ficheiro é muito simples, na Figura 50 está representada a única parte que deve ser trabalhada pelo utilizador. Esta é composta por 3 campos e dois botões, um campo para os autores criado com uma drop down com a lista dos autores, um campo em que vão aparecer as parcerias já efetuadas e um outro campo onde irão aparecer as parcerias ainda não efetuadas mas que seriam plausíveis. Os dois botões estão associados a duas macros, o botão “Apagar info” apaga a informação relativa às parcerias (para a macro principal funcionar os campos precisam de estar limpos). O botão “Correr Macro” é o que ativa a macro que vai encontrar os autores para as parcerias. Redes Sociais e Classificação Conceptual 72 Figura 50 – Menu de funcionamento do Sistema de Recomendação A macro para apagar a informação, é uma macro muito simples que apenas seleciona toda a informação à direita e para baixo da célula “C5”. Figura 51 – Algoritmo da macro para apagar a informação das parceiras A macro para escolher os autores é feita com base em dois algoritmos, um para detetar as parcerias existentes e outro para detetar as parcerias passíveis de serem criadas. De forma a não ter muitos algoritmos incorporados no mesmo algoritmo foi criado, por motivos de segurança, um formulário que questiona se as células foram apagadas antes começar a correr a macro. Assim é possível escolher “Sim” para correr a macro ou “Não” para primeiro apagar a informação. Figura 52 – Formulário inicial para correr a macro para encontrar os autores para parcerias, se pressionar o botão Sim a macro é corrida diretamente, se pressionar Não uma macro apaga então a informação. Redes Sociais e Classificação Conceptual 73 Na Figura 53 está representada a primeira parte da macro principal, a variável X representa o número de linhas da folha “Parcerias” que contém todas as parcerias efetuadas, em que cada linha corresponde a uma parceria para uma publicação. De seguida temos duas funções FOR que fazem as variáveis “i” e “s” adotarem valores entre 1 e x, sendo que neste caso x é 213. Para cada função FOR existe uma função IF que vai procurar o autor que estamos a pesquisar inicialmente na primeira coluna, devolvendo assim o autor da segunda coluna como um coautor. E de seguida procura o autor na segunda coluna retribuindo o autor da primeira coluna presente na mesma linha como sendo um coautor. Como todos os dados dos coautores são armazenados numa única célula é preciso no final separar esses autores colocando um por cada célula. Figura 53 – Algoritmo para identificar os autores que já fizeram publicações com um determinado autor. O próximo algoritmo é já mais complicado, tendo sido preciso criar algumas condições para que os valores fossem corretos e não contivessem informações desnecessárias e/ou erradas. O algoritmo começa por fazer uma pesquisa ao longo das linhas, ou seja dos conceitos, para cada linha (a escolha é feita da primeira para a última linha) o algoritmo começa então a pesquisar nessa linha todas as células à procura do autor em análise. Quando encontra o autor é iniciada uma nova pesquisa, na mesma linha, mas começando novamente do início e cada membro do conceito é comparado com os autores que já possuem ligações com o autor principal. Se o autor do conceito já estiver presente na lista de coautores então nesse momento é colocado um 1 na célula Redes Sociais e Classificação Conceptual 74 “A6” e se não se encontrar já na lista não é feito nada. Depois de o autor do conceito selecionado ser comparado com todos os coautores é verificado a célula “A6” para aferir se o valor desta é igual a 1 ou não, se for igual a 1 significa que o autor já pertence à lista de coautores e caso contrário é escrito o código do autor na célula “C6”. É importante salientar que caso o autor do conceito não apareça na lista de coautores é verificado também se este autor é o nosso autor principal, pois como estão a ser analisados os conceitos onde o autor aparece, logicamente o autor principal também vai aparecer na análise. Figura 54 – Código para o preenchimento dos possíveis autores com que o autor em análise pode trabalhar dado estarem nos mesmos grupos. Os resultados são apresentados como demonstrado na Figura 55, retribuindo separadamente os autores que já fizeram publicações com o autor principal e os autores que pertencem ao mesmo conceito mas não fizeram até então nenhuma parceria. Como estes dados são individualizados, não serão sujeitos a nenhuma análise posterior. Este resultado pode ser utilizado por algum autor que queira saber autores que estejam Redes Sociais e Classificação Conceptual 75 relacionados consigo para publicarem juntos. A título de exemplo foi utilizado o autor 3923, este já publicou em parceria com o autor 3794 e com o 557. No entanto, podia publicar com os autores 1374, 1823, 81774, 4843, 67288, 15456, 7357, 9934, etc., porque estes autores pertencem a conceitos que o autor 3923 também pertence. Figura 55 – Representação dos resultados obtidos depois de analisado o autor 3923, indicando os autores com quem publicou e os autores com quem ainda não publicou mas pertencem aos mesmos conceitos. Devido aos bons resultados do processo de deteção de comunidades do package Gephi foi feita as análises com estas três macros de forma a comparar os resultados e verificar com qual destes se obtém melhores resultados. Iniciando as análises pelo Anexo 32, é verificado o número de publicações que existem em que os seus autores pertencem ao mesmo grupo. Ora após esta análise é verificado que 99,53 % das publicações são feitas com autores do mesmo grupo. Na análise do Anexo 33, é verificado que em média 87% das possíveis parcerias dentro de um conceito já se encontram efetuadas. Por fim através do Anexo 34 é possível verificar que analisando alguns autores aleatoriamente verifica-se que o número de coautores aconselhados diminui drasticamente. Com isto, apesar de as comunidades serem bem feitas pelo software Gephi, estas não conseguem cumprir o seu objetivo no sistema de recomendação. Redes Sociais e Classificação Conceptual 76 7 Conclusão A presente dissertação aborda dois temas que estão atualmente em voga, no entanto em poucos trabalhos se encontram a operar em conjunto. A análise de redes tem tido um crescimento exponencial nos últimos anos e muitos desenvolvimentos se têm feito nesta área. Já para a análise conceptual, apesar de se investir mais nesta área criando novos e melhorados algoritmos, poucos investimentos se têm feito na criação de programas informáticos para a sua análise. Ao considerar em conjunto estas duas metodologias de análise é criada uma forte sinergia. Conseguindo com sucesso aliar dois métodos distintos, e as respetivas mais-valias, a criação de um Sistema de Recomendação é o valor acrescentado desta dissertação. Devido à sua automatização, facilmente pode ser adaptado a dados de diferentes tipos e origens. Um possível trabalho futuro, será a utilização de um outro método de agrupamento capaz de criar grupos de indivíduos consoante as suas características, baseado em medidas de dissemelhança. Assim, seria possível analisar vários métodos e tentar apurar qual deles conseguia obter um melhor resultado a nível do sistema de recomendação. Ao longo da dissertação foram efetuadas várias análises, inicialmente à rede de coautorias estudada, foco principal deste trabalho. Posteriormente foi feita uma análise aos conceitos determinados com base nas áreas de publicação dos autores envolvidos. A análise da rede serviu para perceber a sua composição e limitações. Claramente, a rede de coautorias “necessita” de aumentar as ligações entre os nós. Logicamente, numa rede de densidade elevada o sistema proposto não fará tanto sentido, pois os nós já possuem muitas ligações e estão bem entrosados na rede. Posteriormente é então feita a análise conceptual, criando uma importante base para o sistema de recomendação. De facto, é através dos resultados da análise conceptual que se identificam grupos maximais de autores com as mesmas características, isto é, publicando nas mesmas áreas. Assim, para cada autor considerado, o sistema pode verificar quais os outros autores que trabalham nas mesmas áreas. Com o investimento em programas capazes de efetuar uma análise conceptual completa, esta análise seria mais simples. No nosso caso foi necessário o desenvolvimento de um algoritmo em linguagem R para a obtenção das extensões dos conceitos identificados. Redes Sociais e Classificação Conceptual 77 Embora os investimentos na área da análise de redes sejam já muito elevados, é compreendido que esta metodologia se aplica intensamente em muitos aspetos do nosso dia a dia, pelo que se pode prever que este tipo de análise seja cada vez mais utilizado em investigação nos próximos anos. Redes Sociais e Classificação Conceptual 78 8 Bibliografia • Albert, R. and Barabási, A.L. (2002). “Statistical mechanics of complex networks.” Reviews of Modern Physics T4, 1: 47-97. • Artin, E. (1998). “Galois Theory”, Dover Publications, ISBN 0486623424. • Bank, M. e Franke, J. (2010). “Social Networks as Data Source for recommendation Systems”. In E-Commerce and Web Technologies (pp. 49-60). Springer Berlin Heidelberg. • Barbut M., Monjardet B. (1970). “Ordre et Classification”, Algèbre et Combinatoire, Tomes I et II, Hachette, Paris. • Birkhoff G. (1940). “Lattice theory”, American Mathematical Society Colloquium Publications, Vol.XXV, 1st edition, 1940 (3rd edition, 1967). • Bonacich, P. (1987). “Power and centrality: A family of measures”. The American Journal of Sociology, 92(5):1170-1182. • Boucher-Ryan, P. du, & Bridge, D. (2006). “Collaborative recommending using formal concept analysis”. Knowledge-Based Systems, 19(5), 309-315. • Burt, R. S. (1992). “Structural Holes: The Social Structure of Competition”. Networks and organizations: Structure, form, and action. Harvard University Press, Massachusetts, USA 57-91. • Carley, Kathleen M (2003), “Dynamic Network Analysis” in the Summary of the NRC workshop on Social Network Modeling and Analysis, Ron Breiger and Kathleen M. Carley (Eds.) (pp. 133-145). National Research Council. • Carpineto, C. e Romano, G. (1993). “GALOIS: An order-theoretic approach to conceptual clustering”. In ICML (Vol. 90, pp. 33-40). Fondazione Ugo Bordoni Rome (Italy). • Chung, K. K. S., Hossain, L., and Davis, J. (2005). “Exploring sociocentric and egocentric approaches for social network analysis”. In Proceedings of the International Conference on Knowledge Management in Asia Pacic, Wellington,New Zealand, November 27-29, pages 17. • Costa, L., Jr., O. N. O., Travieso, G., Rodrigues, F. A., Boas, P. R. V., Antiqueira, L., Viana, M. P., e da Rocha, L. E. C. (2008). “Analyzing and modeling real-world Redes Sociais e Classificação Conceptual 79 phenomena with complex networks: A survey of applications”. Advances in Physics, 60(3), 329-412. • Diestel, R. (2005). “Graph Theory”. Graduate texts in mathematics, vol. 173. Springer-Verlag. • DiMaggio, P. J. e Powell W. W. (1983). “The Iron Cage Revisited: Institutional isomorphism and collectivity rationality in organizational fields.” American Sociological Review 48:147-60. • Easley, D. e Kleinberg, J. (2010). “Networks, Crowds and Markets: Reasoning about a Highly Connected World”. Cambridge of University Press, New York, USA • Eschenfelder, D., Kollewe W., Skorsky, M., & Wille, R. (2000). Ein Erkundungssystem zum Baurecht: Methoden der Entwicklung eines TOSCANASystems. In G. Stumme, & R. Wille (Eds.), Begriffliche Wissensverarbeitung. Methoden und Anwendungen. Berlin: Springer, 254-272. • Freeman, L.C. (1979). “Centrality in Social networks: Conceptual clarification”. Social Networks, 1(3):215-239. • Godin, R., Missaoui, R., Hassan, A. (1995). “Incremental concept formation algorithms based on Galois (concept) lattices” Appeared in Computational Intelligence (1995), 11(2), 246-267 Département d'Informatique, Université du Québec à Montréal. • Hoppe, B. (2007). “Introduction to Network Mathematics”. Boston University, http://webmathematics.net/ • Hoppe, B. (2009) in “Web Science” - http://webwhompers.com/courseoverview/25.html • Kossinets, G. and Watts, D. J. (2006). “Empirical analysis of an evolving social network”. Science, 311(57):88-90. • Krajca, P., Outrata, J., Vychodil, V. (2010). “Advances in algorithms based on CbO”. Department of Computer Science, Palacky University, Czech Republic. In CLA (pp. 325-337). • Krebs, V. (2000) in “Social Network Analysis , A Brief Introduction” - http://www.orgnet.com/sna.html Redes Sociais e Classificação Conceptual 80 • Kuznetsov, S.O. (1993). “A fast algorithm for computing all intersections of objects in a finite semi-lattice”, Automat. Document. Math. Linguist. 27 (5) (1993) 11-21 • Kuznetsov, S.O. (1999), “Learning of simple conceptual graphs from positive and negative examples”, PKDD (1999) 384–391. • Lorrain, F. and White, H. C. (1971). “Structural equivalence of individuals in social networks”. Journal of Mathematical Sociology, 1(1):49-80. • Lotka, A. J. (1926) in “The Frequency Distribution of Scientific Productivity”. Journal of the Washington Academy of Science 16:317-323. • Lucas, C. (2012), “Conceptual Clustering and Galois Concept Lattice”. PDMA – Doctoral Program in Applied Mathematics. Slides Presentation. University of Porto. • March, J. G. and Olsen, J. P. (1989). “Rediscovering Institutions”. New York: The Free Press (pp 278-281). • McPherson, J. M., and Smith-Lovin, L. (1987). “Homophily in voluntary organizations: Status distance and the composition of face-to-face groups.” American Sociological Review 52: 370-79. • McSweeney, P. J. (2009). “Gephi Network Statistics”. Google Summer of Code 2009 Project Proposal. • Mendonça, G., Machado, M., Dahis, R., Vasconcelos, R. (2009). “Detecção de Estruturas de Comunidades em Redes Complexas”, Disciplina de Inteligência Computacional. • Merton, R. K. (1973). “The sociology of science: Theoretical and empirical investigations. The Normative Structure of Science” Pp. 267-78 in his The Sociology of Science: University of Chicago Press. • Newman, M. E. J. (2003). “The Struture and Function of Complex Networks”. SIAM Review, 45(23):167-228. • Newman, M. E. J. (2004). “Analysis of weighted networks”. Department of Physics and Center for the Study of Complex Systems University of Michigan, and Santa Fe Institute, Physical Review E 70.5 (2004): 056131. • Newman, M. E. J. and Girvan, M. (2004). “Finding and evaluating community structure in networks”. Physical Review E, 69(2): 026113.