scieee AI-readable full text Open interactive document viewer

Reuso de dados de pesquisa em acesso aberto no SciELO Data: uma análise exploratória por meio das citações

Rosa, Júlia; Salort, Shirlei; SANCHES, JULIANA; da Silva Rodrigues, Pedro Henrique; Caregnato, Sonia

Full text

2º Congreso Iberoamericano de Ciencia Abierta Reuso de dados de pesquisa em acesso aberto no SciELO Data: uma análise exploratória por meio das citações Júlia Aquino Rosa Universidade Federal do Rio Grande do Sul, Brasil [email protected] ORCID: https://orcid.org/0009-0000-8218-2992 Shirlei Galarça Salort Universidade Federal do Rio Grande do Sul, Brasil [email protected] ORCID: https://orcid.org/0000-0002-2226-8097 Juliana Cristina Sanches Universidade Federal do Rio Grande do Sul, Brasil [email protected] ORCID: https://orcid.org/0000-0002-1888-1593 Pedro Henrique da Silva Rodrigues Universidade Federal do Rio Grande do Sul, Brasil [email protected] ORCID: https://orcid.org/0000-0001-5909-2067 Sônia Elisa Caregnato Universidade Federal do Rio Grande do Sul, Brasil [email protected] ORCID: https://orcid.org/0000-0002-5676-2763 Línea temática: Infraestructuras abiertas Palavras-chave: Conjunto de dados, Publicação de acesso aberto, Análise de dados secundários, SciELO Data. INTRODUÇÃO As citações na comunicação científica exercem um papel muito importante como instrumento de embasamento teórico, atribuições de créditos e para corroborar ou contrariar ideias. Ademais, também é um importante mecanismo de divulgação de conhecimentos e teorias através do referenciamento de outras publicações com ideias ou conteúdos relacionados. Vanz e Caregnato (2003) elaboram que a disseminação do conhecimento científico por meio das publicações é uma obrigação quase inerente aos pesquisadores para a manutenção do processo científico. As autoras também definem o termo literatura científica como a “existência de publicações que, no todo, contêm a documentação dos trabalhos produzidos pelos cientistas” (Vanz et at., 2003). Sendo assim, no presente estudo, entende-se que os dados de pesquisa se enquadram na literatura científica que, por compromisso com o progresso científico, deve ser de acesso livre e reprodutível. Em vista desta questão, este trabalho tem como objetivo averiguar se os dados de pesquisa publicados em repositórios abertos são reutilizados pela comunidade científica. Para a verificação de reuso foi estabelecido o indicador de citações aos conjuntos de dados, com foco apenas nos conjuntos 2º Congreso Iberoamericano de Ciencia Abierta publicados no repositório SciELO Data até dezembro de 2024. Este repositório foi escolhido por ser de acesso aberto, possuir grande abrangência nas áreas de pesquisa e layout intuitivo. Para assegurar que os dados de pesquisa, após publicados, possam ser integrados e reutilizados pela comunidade científica, é fundamental uma gestão de dados de qualidade. De acordo com Wilkinson et al., (2016), quando os dados são disponibilizados em alta qualidade, facilitam o processo contínuo de descoberta, avaliação e reutilização em estudos futuros. Essa necessidade motivou discussões durante e o evento científico FORCE11 (Future of Research Communications and e-Scholarship), realizado em Leiden, Holanda, em 2014, resultando no estabelecimento dos Princípios FAIR (Findable, Accessible, Interoperable, Reusable), para aplicação na gestão de dados, algoritmos, ferramentas e fluxos de trabalho. Os Princípios FAIR foram criados com objetivo de solucionar a falta de comunicação entre dados, os tornando localizáveis, acessíveis, interoperáveis e reutilizáveis, permitindo o avanço no desenvolvimento de um fazer científico cada vez mais ligado aos princípios da ciência aberta. Tornar os dados de pesquisa FAIR promove a elaboração de novas pesquisas de forma mais rápida através do acesso a dados já existentes. E possibilita atestar, contestar e debater resultados de estudos com base nos dados primários, combinar dados de origens diferentes para gerar novos conhecimentos, atribuir a autoria e reconhecimento aos pesquisadores autores, além de expandir as possibilidades de uso dos dados de forma gratuita (Henning, et al., 2019). O princípio Localizável (Findable) estabelece que os dados devem ter um identificador globalmente único e persistente, que incluam de forma transparente e explícita o identificador dos dados que descrevem, sejam detalhados com metadados ricos e, ainda, que sejam registrados ou indexados em um recurso pesquisável. No princípio Acessível (Accessible) os dados devem ser recuperáveis pelo seu identificador único e persistente, usando um protocolo de comunicação padronizado, aberto, gratuito e universalmente implementável, que permite procedimentos de autenticação e autorização quando necessário e que são acessíveis mesmo quando os dados não estão mais disponíveis. O princípio Interoperável (Interoperable) está relacionado com a linguagem formal, acessível, compartilhada e amplamente aplicável para representação de conhecimento, com vocabulários que sigam os princípios FAIR e referências qualificadas que remetem a outros dados ou metadados. Já o princípio Reutilizável (Reusable), determina que os dados devem ser bem descritos por metadados ricos, com pluralidade de atributos precisos e relevantes, liberados com licença de uso acessível, fornecendo informações sobre sua origem e com padrões em consonância à comunidade do domínio (Wilkinson et al., 2016). O repositório de dados Scielo Data além de seguir os Princípios FAIR, também considera as diretrizes que respeitem normas éticas e culturais, desenvolvendo os princípios CARE: Collective Benefit, Access, Respect, Ethics (Benefício coletivo, acesso, respeito, ética) (Scielo, 2025). Esta aplicação conjunta auxilia na criação de um ambiente de pesquisa mais justo, responsável e transparente, guiando não apenas boas práticas de reuso de dados de pesquisa, como também uso ético e responsável. Entre as vantagens, a publicação de dados de pesquisa em acesso aberto facilita seu reuso e amplia possibilidades de colaboração científica, permitindo que a autoria seja reconhecida por meio de citações, garantindo crédito e maior visibilidade aos pesquisadores. Em estudo pioneiro, Piwowar, Day e Fridsma (2007) destacam que a disponibilidade pública dos dados pode estar associada ao aumento significativo no número de citações das publicações, representando um incentivo adicional para que os pesquisadores compartilhem seus dados detalhadamente. 2º Congreso Iberoamericano de Ciencia Abierta Para Silveira, Barbosa, Ferreira e Caregnato (2020), disponibilizar dados científicos pode aumentar a percepção de valor da pesquisa, permitindo que diferentes áreas do conhecimento se beneficiem e utilizem esses conjuntos de dados sob novas perspectivas. Segundo as autoras, esse compartilhamento favorece tanto a colaboração internacional quanto o avanço científico, especialmente em países em desenvolvimento, onde a limitação de recursos pode ser compensada pelo acesso a dados compartilhados. Ademais, as citações a dados de pesquisa permitem medir e rastrear o reuso desses dados, atribuindo crédito aos pesquisadores que se dedicaram à coleta e curadoria dos conjuntos de dados. No Brasil, a prática de depósito de dados de pesquisa em repositórios ainda não é reconhecida para fins de avaliação e pontuação. Logo, essa atividade não é contabilizada nas progressões funcionais docentes, nem em editais de seleções para a pós-graduação e concursos públicos, tampouco conta com um campo específico para registro nos currículos de estudantes e pesquisadores na Plataforma Lattes. Essa falta de reconhecimento institucional reflete na desmotivação de depósito por pesquisadores, já que é uma atividade que demanda tempo e curadoria, mas que não é compensada com vantagens e incentivos adequados. Sobre este aspecto, Silva (2019) complementa: Para qualquer iniciativa em que seja necessário confiar na boa vontade de compartilhar dados, deve ser considerada a sociologia da ciência: os pesquisadores deverão ver as vantagens de compartilhá-los e necessitarão de incentivos para fazê-lo. Terão que ser compensados pelo tempo que passam fazendo com que os dados estejam disponíveis para sua reutilização, pela perda do acesso exclusivo e pela vantagem competitiva associada a este (Silva, 2019, p. 45) Com base no contexto fornecido anteriormente, o objetivo deste trabalho se dá em identificar se dados de pesquisa publicados em repositórios abertos são reutilizados pela comunidade científica. Para isso o reuso foi aferido a partir das citações aos conjuntos de dados disponíveis no repositório SciELO Data, com análise das métricas e citações relacionadas ao conjunto de dados de 22 revistas. Este repositório foi escolhido por ser de acesso aberto, abrangência de áreas de pesquisa e layout intuitivo. Este trabalho se mostra relevante no contexto da Ciência Aberta por investigar um de seus pilares: o reuso de dados de pesquisa. Mais do que analisar o acesso aberto, o estudo examina as práticas de citação no repositório SciELO Data e visa estabelecer um diagnóstico sobre o impacto das infraestruturas abertas. Assim, a pesquisa destaca a importância do reconhecimento e do crédito acadêmico, indicando que os incentivos para o compartilhamento e a citação de dados de terceiros ainda precisam ser fortalecidos. METODOLOGIA O presente estudo conta com abordagem exploratória e quali-quantitativa, com o objetivo de identificar se há citação aos dados de pesquisa publicados em acesso aberto. Busca-se verificar as particularidades na publicação, uso e reuso dos dados pela comunidade científica. Na primeira etapa da pesquisa, selecionamos as revistas ativas, com dados publicados, no repositório SciELO Data até dezembro de 2024, levantando o total de 22 revistas selecionadas. Em seguida, delimitamos a coleta de até 4 conjuntos por revista, média de 3,40 conjuntos, a fim de incluir todas as revistas ativas, inclusive aquelas que possuíam somente um conjunto publicado. Resultando em 75 conjuntos de dados publicados até dezembro de 2024, tendo seus metadados e de seus respectivos artigos coletados até julho de 2025. 2º Congreso Iberoamericano de Ciencia Abierta A segunda etapa consistiu em verificar os registros de citações do Make Data Count (MDC), ferramenta presente em todas as páginas dos conjuntos de dados no SciELO Data e que contabiliza suas visualizações, downloads e citações. Porém, todos os MDCs dos 75 conjuntos estavam zerados. Conforme o link presente no indicador de citações do MDC, a SciELO Data afirma coletar as citações aos conjuntos de dados através da Crossref via DataCite. Com isso, na terceira etapa, optamos por coletar as métricas de uso e impacto, número de downloads por revista, localização das autorreferências nos artigos de origem e citações registradas pelo DataCite. Além disso, houve a coleta de metadados descritivos, como títulos das revistas, Identificador de Objeto Digital (DOI) dos conjuntos de dados e artigos, e por fim os formatos de arquivos dos dados. A busca de citações no DataCite teve o objetivo de identificar citações de dados de trabalhos secundários, ou seja, dos que não originaram os dados. A coleta desses metadados foi realizada por meio de um script em Python1 que consultou a API2 do DataCite para recuperar informações dos DOIs do corpus. O script leu uma planilha de Excel contendo cada DOI e realizou requisições HTTP para eles, extraindo metadados como título, autores, afiliação, resumo, assuntos, contagem de citações e DOIs citantes quando disponíveis. Os resultados foram organizados em um DataFrame e exportados para um arquivo Excel para posterior análise. Por conta da aparente falta de citações, optamos então por analisar a autorreferência nos artigos dos dados, a fim de compreender de que forma as seções (ou locais) dos textos onde os dados são referenciados poderiam afetar a sua localização por outros pesquisadores. Na quarta e última etapa da coleta utilizou-se a ferramenta de localização nos textos (Ctrl+f) buscando pelos termos “SciELO Data”, “data”, “dados” e/ou pelo código final do DOI de cada conjunto para a localização das autorreferências. Quando as buscas não retornavam resultados, o artigo em questão era lido na íntegra para confirmar a presença ou ausência de referências aos dados. RESULTADOS E DISCUSSÕES A partir da análise dos 75 conjuntos de dados, revelou-se um total de 28 citações, com média de 0,38 citações por conjunto. Observou-se a predominância de autocitação, correspondendo a 27 das 28 ocorrências (96,4%) de citação aos dados. A única citação externa identificada foi proveniente de um preprint que, embora não seja um trabalho derivado, compartilha temática e coautoria com o artigo original do conjunto de dados. Os dados são apresentados na Tabela 1. Tabela 1 Indicadores de Citação (CC-BY-4.0) Citação Métrica Valor Total de Citações 28 Média por Conjunto 0.38 2 “Application Programming Interface” (ou Interface de Programação de Aplicações) são ferramentas que podem ser utilizadas na coleta, envio e troca de informações entre diferentes programas e interfaces. Disponível em: https://blog.betrybe.com/desenvolvimento-web/api/ 1 Disponível em: https://github.com/depositados/reusodados 2º Congreso Iberoamericano de Ciencia Abierta Autocitação 27 Citações Externas 1 Este padrão é consistente com a literatura, Park e Wolfram (2017) observaram que a autocitação de dados de pesquisa é de aproximadamente 8% e ocorre com frequência maior do que em artigos científicos, que é de 1,2%. Com relação às métricas de uso, até o momento da coleta, os conjuntos somaram 2.112 downloads com média de 28,16 downloads por conjunto. A soma desses valores se deu por meio de registros individuais dos arquivos dos dados, já que o MDC não apresenta valores mesmo ao realizarmos o download do conjunto completo e não somente os dados individuais. Dessa forma, entende-se que os dados vêm sendo acessados, mesmo que em pouca quantidade e sem levarem ao registro de reutilização. Entretanto, vale pontuar que, as formas de divulgação dos dados e seus formatos disponíveis podem influenciar sua acessibilidade e reutilização. A autocitação dos dados de pesquisa em artigos científicos abre um canal de acesso aos dados, pois permite contextualizar a sua aplicação e, ao mesmo tempo, funciona como uma via de acesso inicial para que outros pesquisadores conheçam e utilizem os conjuntos de dados produzidos. Nesse cenário, destaca-se que foram encontradas formas diversas de citação aos dados de pesquisa por parte dos próprios autores nos artigos de origem, a maioria (57,3%) localizada no apêndice do artigo, após a seção de referências, enquanto apenas 13,3% apareceram na seção de identificação do texto, junto com o resumo e apresentação dos autores. Informações disponíveis na Figura 1. Figura 1. Seções com ocorrência de autorreferência nos artigos (CC-BY-4.0) Fonte: Elaborado pelos autores (2025) 2º Congreso Iberoamericano de Ciencia Abierta Por outro lado, a reutilização ainda não está bem estabelecida em todas as áreas do conhecimento, fazendo com que a integração e o reuso de dados se tornem ainda mais difíceis nas áreas onde os padrões não existem ou são prematuros (Imker et al., 2021; Silveira et al., 2020). Estabelecer uma seção específica na estrutura do artigo para a localização de autorreferência aos dados pode ser uma das formas de tornar o acesso mais simplificado. Conforme a Figura 1, observou-se que grande parte dos autores disponibilizou as referências aos dados no apêndice do artigo, com títulos como “Sobre o (s) autor (es)” ou “Disponibilidade de dados”. Porém, vale ressaltar, que essas seções de autorreferência aos dados de pesquisa muitas vezes advém de recomendações ou obrigatoriedades previstas nas políticas editoriais das revistas científicas (Caregnato et al., 2024). Em contrapartida, visando maior visualização dos dados, entendemos que informar o acesso aos dados seja mais eficaz logo no início do artigo. Dessa forma, as informações se tornam mais fáceis de serem encontradas, incentivando os leitores ao uso. Entretanto, a heterogeneidade dos formatos dos arquivos pode representar outra barreira para a reutilização. Foram identificados 22 formatos distintos, com predominância de PDF (28%), seguido por Excel (21%) e TXT (18%). Valores representados a seguir na Figura 2. Figura 2. Formatos de arquivos dos dados de pesquisa (CC-BY-4.0) Fonte: Elaborado pelos autores (2025) A partir da coleta das informações ilustradas na Figura 2, observamos expressiva diversidade de formatos de arquivo nos conjuntos de dados analisados, que naturalmente apresentam variações conforme as diferentes áreas do conhecimento e as ferramentas disponíveis em cada estudo. Porém, é importante enfatizar que o uso de certos formatos podem dificultar o acesso, interoperabilidade e preservação. Conforme recomendações disponíveis no “Guia de preparação de dados de pesquisa” publicado recentemente pelo SciELO, o uso de formatos como PDF (não cifrado), CSV, TXT, DOCX, JP2 e PNG, que correspondem aos mais utilizados conforme a Figura 2, são também os mais recomendados 2º Congreso Iberoamericano de Ciencia Abierta para compartilhar e disponibilizar os dados de pesquisa, uma vez que facilitam o acesso de outros pesquisadores e auxiliam na preservação a longo prazo (SciELO, 2025). Ainda sobre os formatos de arquivo, Silva (2019), reconhece que durante o processo de coleta de dados, devem ser usados aqueles que se adequem mais ao tipo de coleta e material a ser usado na pesquisa. Mas, também é necessário pensar no futuro desses dados, sendo importante perguntas como: Qual é o plano de preservação dos dados? Há possibilidade de acesso por outros sistemas ou softwares? Os dados terão backup em outros formatos de arquivo? Onde esses dados ficarão disponíveis? Entre outros questionamentos, a fim de prever o acesso a longo prazo e estender a vida útil dos dados. O autor também elabora sobre a importância de backups em outros formatos de arquivo, além dos já utilizados nos processos de coleta e análise. Essa importância se dá tanto por uma questão de preservação, ou seja, ter a possibilidade de acesso aos dados por outros meios caso haja o desuso de certo sistema, quanto para disponibilizar os dados em formatos acessíveis ao público. A escolha de um formato de arquivo adequado para o compartilhamento dos dados de pesquisa deve almejar o acesso livre e amplo uso, de forma que possa ser acessado por, pelo menos, em mais de dois softwares e que possuam opções de acesso gratuito. Para favorecer a reutilização, a disponibilização dos dados acompanhada da indicação da pesquisa a que estão vinculados ou de uma nota contextual pode estimular o processo de reuso (Silva, 2019). Reutilizar um único conjunto de dados já representa uma tarefa difícil, mesmo quando há documentação e ferramentas adequadas. Isso ocorre porque é preciso compreender o objetivo da busca dos dados e as decisões tomadas durante o processo de coleta, limpeza e análise. Assim, a integração de conjuntos de dados é ainda mais desafiadora, pois requer informações extensas sobre cada conjunto, para que possam ser corretamente interpretados e considerados confiáveis o suficiente para apoiar conclusões (Pasquetto et al., 2017). CONSIDERAÇÕES FINAIS Tendo em vista as vantagens e dificuldades decorridas até o momento sobre a disponibilidade dos dados de pesquisa em acesso aberto e suas possibilidades de reuso, destacamos que a falta de reconhecimento dos dados de pesquisa como publicação científica pode ser um forte desmotivador da disponibilização desses materiais. A carência de reconhecimento dessas publicações nos currículos dos autores, principalmente pelo trabalho atrelado à gestão desses dados, torna este processo improdutivo, já que não geram recompensas palpáveis e equivalentes às publicações tradicionais, em avaliações curriculares e pontuações. No contexto desta pesquisa, os resultados alcançados sugerem que a cultura de reuso e citação aos dados por outros pesquisadores, exceto os próprios autores, ainda pode necessitar de adequações. A escolha sobre quais formatos de arquivos devem ser utilizados para cada etapa da pesquisa, desde a coleta até a disponibilização do material ao público, requer certa padronização e investigação por parte dos responsáveis pelos dados. Além disso, as seções de autorreferência aos dados da pesquisa também carecem de normalização, visto que este ponto pode dificultar a localização das informações de acesso aos dados por outras pessoas. Os resultados mostram ainda que, embora os dados sejam baixados e visualizados pela comunidade, ainda existem barreiras na utilização e citação aos conjuntos. Os obstáculos podem estar relacionados: a dificuldade de compreensão decorrente da desorganização dos dados, às incertezas relacionadas aos parâmetros e instrumentos utilizados na coleta, à falta de reconhecimento acadêmico na disponibilidade desses materiais, ou ainda à falta de padronização nos formatos, que compromete a interoperabilidade e a reusabilidade, pontos que são princípios do movimento FAIR. Além disso, entendemos que o reuso pode envolver questões éticas e legais, como o reconhecimento autoral, a 2º Congreso Iberoamericano de Ciencia Abierta propriedade intelectual e a contestação das conclusões originalmente sugeridas pelos produtores dos dados. Contudo, trata-se de um estudo preliminar e de caráter exploratório, obtendo quantidades limitadas de conjuntos de dados analisados com recorte temporal recente. Portanto, compreende-se que análises com corpus de pesquisa mais amplos e aprofundados são necessárias para alcançar conclusões mais assertivas. Em vista disso, é recomendável que pesquisas futuras abordem conjuntos de dados mais antigos, em grandes quantidades e de áreas específicas do conhecimento. Dessa forma, será possível alcançar resultados mais precisos sobre o reuso de dados de pesquisa, através das citações. AGRADECIMENTOS Agradecemos o financiamento da Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) e do Conselho Nacional de Desenvolvimento Científico e Tecnológico (CNPq), concedido na forma de bolsas. Licencia: Este resumen ampliado se distribuye bajo licencia Creative Commons Atribución 4.0 (CC-BY-NC 4.0). REFERÊNCIAS Caregnato, S. E., Rosa, J. A., & Rodrigues, P. H. da S. (2024). Políticas editoriais sobre dados de pesquisa em periódicos no Repositório SciELO Data. Encontro Brasileiro de Bibliometria e Cientometria, Brasília, DF, 9. Recuperado de: https://doi.org/10.22477/ix.ebbc.285. Henning, P. C., Ribeiro, C. J. S., Santos, L. O. B. S., & Santos, P. X. (2019). GO FAIR e os princípios FAIR: o que representam para a expansão dos dados de pesquisa no âmbito da Ciência Aberta. Em Questão, 25(2) 389–412. Recuperado de https://seer3.dev.ufrgs.br/index.php/EmQuestao/article/view/84753. Pasquetto, I.V., Randles, B.M. & Borgman, C. (2017). On the reuse of scientific data. Data Science Journal, 16(8), 1-9. Retrived from https://doi.org/10.5334/dsj-2017-008. Park, H., & Wolfram, D. (2017). An examination of research data sharing and re-use: Implications for data citation practice. Scientometrics, 111, 443-461. Retrived from https://doi.org/10.1007/s11192-017-2240-2. Piwowar, H. A., Day, R. S., & Fridsma, D. B. (2007). Sharing detailed research data is associated with increased citation rate. PLOS ONE, 2(3), e308. Retrived from https://doi.org/10.1371/journal.pone.0000308. SciELO. Guia de preparação de dados de pesquisa. SciELO, 2025 Recuperado de https://wp.scielo.org/wp-content/uploads/Guia_preparacao_pt.pdf. Silva, F. C. C. (2019). Gestão de dados científicos. Rio de Janeiro: Interciência; Silveira, L., Barbosa, A. D., Ferreira, M. K., & Caregnato, S. E. (2020). Citação de dados científicos: scoping review. Encontros Bibli: Revista Eletrônica de Biblioteconomia e Ciência da Informação, 25, 1–31. Recuperado de https://periodicos.ufsc.br/index.php/eb/article/view/1518-2924.2020.e72153. http://dx.doi.org/10.5007/1518-2924.2020.e72153. 2º Congreso Iberoamericano de Ciencia Abierta Vanz, S. A. de S., & Caregnato, S. E. (2003). Estudos de citação: uma ferramenta para entender a comunicação científica. Em Questão, 9(2), 295–307. Recuperado em set. 28, 2025, de http://hdl.handle.net/10183/129317. Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., Appleton, G., Axton M., Baak A., Blomberg N., Boiten, J.-W., Santos, L. B. S., Bourne, P. E., Bouwman, J., Brookes, A. J., Clark, T., Crosas, M., Dillo, I., Dumon, O., Edmunds, S., Evelo, C. T., Finkers, R., ... Mons, B. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data, 3, 1-9. Retrieved from https://doi.org/10.1038/sdata.2016.18.