A Revista Processando o Saber (eISSN: 2179-5150) é publicada pela Fatec Praia Grande Multidisciplinar - Revisão por pares - Acesso aberto - www.fatecpg.edu.br/revista -
[email protected] eISSN 2179-5150 FATEC Praia Grande • fatecpg.edu.br/revista submetido: Jan/2024 • aceito: Mar/2024 • publicado: Jun/2024 Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Prototype of a system for news-based market intelligence at the port of Santos Julianna Lerner Fatec Santos
[email protected] Natália Freitas Fatec Santos
[email protected] Guilherme Amorim Fatec Santos
[email protected] RESUMO Este artigo propõe um método inovador para a sumarização de textos relacionados a notícias portuárias, indicadores de desempenho e produtos. O método se baseia em técnicas avançadas de processamento de linguagem natural, visando identificar as informações mais relevantes e cruciais nos textos analisados. A avaliação do método foi conduzida utilizando um conjunto de dados de textos com notícias portuárias. Os resultados obtidos revelaram a capacidade do método em gerar sumários precisos e concisos, destacando sua eficácia na extração de informações cruciais. Além disso, o modelo demonstrou habilidade em identificar discrepâncias e imprecisões nos textos, sugerindo uma utilidade potencial em sistemas de verificação de notícias. A aplicação prática deste protótipo promete aprimorar significativamente a eficiência na análise e compreensão de textos relacionados ao setor portuário, proporcionando informações mais condensadas e relevantes. Sua capacidade de detecção de imprecisões também destaca sua utilidade em promover a precisão e confiabilidade das informações veiculadas, contribuindo para a integridade de sistemas de verificação de notícias. PALAVRAS-CHAVE: Sumarização de texto; Processamento de linguagem natural; Inteligência de mercado; Notícias portuárias.
138 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 ABSTRACT This article proposes an innovative method for summarizing texts related to port news, performance indicators, and products. The method is based on advanced natural language processing techniques, aiming to identify the most relevant and crucial information in the analyzed texts. The method was evaluated using a dataset of texts containing port news. The results revealed the method's ability to generate accurate and concise summaries, highlighting its effectiveness in extracting crucial information. Additionally, the model demonstrated the ability to identify discrepancies and inaccuracies in the texts, suggesting potential utility in news verification systems. The practical application of this prototype promises to significantly enhance efficiency in the analysis and understanding of texts related to the port sector, providing more condensed and relevant information. Its ability to detect inaccuracies also underscores its usefulness in promoting the accuracy and reliability of conveyed information, contributing to the integrity of news verification systems. KEY-WORDS: Text summarization; Natural language processing; Market intelligence; Port news. INTRODUÇÃO Os portos são importantes instalações para a logística nacional e internacional de um país. De acordo com dados da ANTAQ (2023), há hoje, no Brasil, 175 instalações portuárias de cargas, que incluem portos, terminais marítimos e instalações aquaviárias. O Porto de Santos, na Baixada Santista, em São Paulo, é o mais importante para a economia brasileira. A globalização dos mercados e a intensificação das transações comerciais e financeiras entre as diversas economias exigem que as empresas estabeleçam mudanças significativas na forma como lidamos com os dados. Dessa maneira, a coleta de grandes volumes de dados necessita de novas soluções, pois, se por um lado temos um volume cada vez maior de dados aumentando vertiginosamente, do outro temos cada vez menos tempo para transformá-los em informações úteis. De acordo com Probstein (2019), apesar das mudanças tecnológicas desenvolvidos nas últimas décadas para lidar com dados e informações, os usuários gastam mais tempo para recuperar informações existentes do que analisando e gerando novos conhecimentos. A sumarização de textos refere-se ao processo de resumir um texto longo ou um conjunto de textos em um resumo conciso e coerente, preservando as informações mais importantes e relevantes (HUTCHINS, 1987). Ao relatar um evento a alguém, é comum oferecer um resumo do ocorrido em vez de narrar todos os detalhes minuciosos. De forma inconsciente, todos nós praticamos a arte da sumarização regularmente.
139 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 Essa técnica é amplamente utilizada em diversas formas escritas, como em notícias veiculadas em jornais, artigos de revistas e resumos de textos científicos, entre outros contextos. Desse modo, esses textos são posteriormente analisados, proporcionando insights valiosos. Essa abordagem desempenha um papel fundamental ao conseguir identificar padrões e embasar decisões com maior precisão. Ao incorporar esse avanço tecnológico nos sistemas de verificação de notícias, é possível realizar uma rápida análise do conteúdo informativo, checar a credibilidade das fontes, examinar a estrutura e contexto do texto, além de identificar discrepâncias ou imprecisões. Isso agilizaria a detecção de notícias, possibilitando sua propagação com a certeza de que as informações são confiáveis e precisas. Para este trabalho, considera-se como objetivo geral apresentar o processo de coleta de dados em sites da web relacionados a notícias portuárias, indicadores de desempenho e produtos e garantir que as informações compartilhadas e consumidas sejam confiáveis e precisas, permitindo que as pessoas tomem decisões informadas e baseadas em fatos com a sumarização dos textos. 2 FUNDAMENTAÇÃO TEÓRICA Este segmento trata da pesquisa bibliográfica realizada para estabelecer a base teórica que sustenta cada decisão tomada durante a elaboração deste trabalho. 2.1 SUMÁRIOS, ÍNDICES E EXTRATOS Hutchins (1987) categoriza os sumários científicos em três tipos distintos: indicativos, informativos e críticos. Os sumários indicativos destacam os pontos essenciais de um texto, sem entrar em detalhes sobre resultados, argumentos ou conclusões. Enquanto isso, os sumários informativos são considerados substitutos do texto original, abarcando todos os aspectos principais. Se o texto original está organizado em seções como dados, métodos, hipóteses e conclusões, um sumário informativo deve conter as informações principais de cada uma dessas seções. Por fim, os sumários críticos atuam como avaliadores, fornecendo, por exemplo, uma análise comparativa entre o conteúdo do texto original e o contexto de outros trabalhos relacionados na mesma área específica.
140 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 Hutchins argumenta que a produção automática de sumários indicativos é mais simples do que a modelagem adequada da sumarização humana para os outros tipos de sumários, devido à complexidade envolvida. Os índices, por sua vez, têm aplicação na classificação de documentos bibliográficos de forma geral, oferecendo uma indicação do seu conteúdo e agilizando o acesso às informações relevantes. Eles permitem que um leitor de uma enciclopédia, por exemplo, vá diretamente ao volume ou página que aborda o tema de seu interesse. Assim, a utilidade dos índices é mais direta e sua função mais limitada do que a dos sumários, o que facilita uma avaliação mais sólida de sua eficiência e qualidade. Os extratos são outra forma de sumários, sendo uma composição de segmentos relevantes de um texto. Na sumarização automática, sentenças inteiras podem ser extraídas de um texto e agrupadas sem alterações para formar um sumário (PAICE, 1981). 2.2 A ESTRUTURA E CONTEÚDO TEXTUAL É fundamental que o sumarizador identifique e reproduza as ideias centrais do texto para se criar um resumo eficaz. Da mesma forma, um sistema automático de sumarização precisa compreender o conteúdo apresentado. A compreensão do discurso envolve a análise das estruturas textuais, o que torna essencial investigar essa estrutura antes da sumarização propriamente dita. Além dos sinais utilizados pelo autor - sejam eles estruturais ou linguísticos - para determinar o conteúdo relevante de um texto-fonte, outros fatores devem ser considerados pelo sumarizador humano. Isso inclui o domínio do assunto específico e o conhecimento prévio como alguém familiarizado com o campo em questão (MUSHAKOJI, 1993). Embora essas considerações sejam cruciais para a compreensão do processo de sumarização, são desafiadoras de modelar computacionalmente devido à sua subjetividade. Elas demandam uma representação complexa do conhecimento de mundo e do domínio em questão, assim como um modelo sofisticado do escritor eleitor para lidar com as decisões variáveis relacionadas ao conteúdo textual.
141 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 2.3 PROCESSAMENTO DE LINGUAGEM NATURAL E SUMARIZAÇÃO DE TEXTOS Quando se fala em sumarização, é importante lembrar que cada sumário envolve pressuposições e características diversas, assim como conteúdos e correspondência com suas fontes de teores variados. Os sumários derivados de textos desempenham papéis específicos, podendo atuar como guias ou oferecer informações completas por si só. No primeiro cenário, os sumários são consultados para identificar o tema do texto original; caso interesse, o leitor acessa o texto completo para se aprofundar. No segundo caso, os sumários são suficientemente informativos, dispensando a leitura do texto original, mas ainda oferecendo seus pontos principais. Dada sua utilidade, frequência e os avanços na área de Processamento de Linguagem Natural (PLN), a automação da sumarização tem despertado grande interesse. A partir do final dos anos 50, métodos estatísticos começaram a surgir para extrair as principais sentenças de um texto. As pesquisas prosseguiram nas décadas seguintes, trazendo avanços significativos à área, como discutido neste relatório, abordando duas perspectivas principais do PLN: a superficial e a profunda, representando métodos distintos de sumarização automática. A abordagem superficial se baseia, em sua maioria, em métodos experimentais e estatísticos, enquanto a perspectiva profunda está associada a teorias formais e linguísticas. (MARTINS, 2001). Para a automação da sumarização, essas perspectivas apresentam um desafio significativo: modelá-las de maneira apropriada para garantir que os resultados automáticos capturem a variedade de sumários sem perder sua ligação essencial com os textos originais. É importante destacar que os sumários estão diretamente ligados aos eventos ou textos de origem, e sua elaboração deve garantir a preservação do significado original, embora apresentem menos detalhes e possam adotar estruturas distintas em comparação com as fontes originais. Por isso, é fundamental estabelecer claramente os conceitos fundamentais relacionados aos sumários antes de explorar os princípios que possibilitam a modelagem automatizada. Sabendo da necessidade da sumarização, o objetivo deste estudo é de exibir o processo de sumarização de textos relacionados a notícias portuárias, indicadores de desempenho e produtos. O método se baseia em técnicas avançadas de processamento de linguagem natural, visando a organização da informação e identificar as informações mais relevantes e cruciais nos textos analisados, permitindo que as pessoas e empresas tomem decisões informadas e baseadas em fato.
142 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 3. PROCEDIMENTOS METODOLÓGICOS A metodologia de pesquisa visa classificar e especificar os métodos empregados na condução do estudo. Seu propósito é explicar as decisões tomadas e descrever os procedimentos realizados, com o intuito de fundamentar os resultados obtidos e possibilitar a replicação do experimento. 3.1 PROCESSAMENTO DE LINGUAGEM NATURAL Para Alcarde (2023), a Linguagem de Processamento Natural (PLN) é uma área multidisciplinar que engloba conhecimentos de ciência da computação, linguística e estatística, visando desenvolver algoritmos e modelos capazes de entender, interpretar e gerar texto ou fala de maneira similar à forma como os humanos se comunicam. O objetivo do PLN é permitir que os computadores compreendam, interpretem e processem a linguagem humana em seus diversos aspectos, como texto escrito, fala e diálogo. Conforme Alcarde (2023), alguns exemplos de aplicações de PLN conhecidos são: Assistentes virtuais, como Siri da Apple e a Alexa da Amazon, tradutores automáticos, como Google Tradutor e os chatbots, utilizados para atendimento de clientes. 3.2 PYTHON A principal ferramenta usada neste estudo é o Python, que é uma linguagem de programação de alto nível. Isso significa que ela se aproxima mais da linguagem humana, sendo composta por tipagem dinâmica, orientada a objetos e multiparadigma, além dos diversos recursos que podem ser encontrados nas bibliotecas e frameworks frequentemente desenvolvidos por toda a comunidade. O código Python é aberto e sua utilização é gratuita, podendo ser instalado em praticamente todos os sistemas operacionais (PYTHON, 2020). A biblioteca Pandas funciona como um bloco de construção de alto nível para elaborar análises de dados em Python, sendo uma das ferramentas mais utilizadas no mundo por ser altamente adaptável (Python, 2022). "Pandas é uma biblioteca de código aberto, licenciada pelo BSD, que fornece estruturas de dados de alto desempenho e fáceis de usar, além de ferramentas de análise de dados para a linguagem de programação Python" (PYTHON, 2022).
143 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 O Natural Language Toolkit, ou NLTK, trata-se de uma biblioteca desenvolvida em Python que funciona como uma caixa de ferramentas computacionais voltadas tanto para o Processamento de Língua Natural quanto para a análise computacional da linguagem, oferecendo uma ampla gama de recursos para processamento de linguagem natural (PLN), incluindo tokenização, stemming, lemmatização, POS tagging, parsing e análise de sentimento. Esses recursos podem ser utilizados para diversas aplicações de PLN, incluindo sumarização de texto. A sumarização de texto é uma tarefa de PLN que consiste em gerar um resumo conciso de um texto original. Existem dois principais métodos de sumarização automática de texto, a sumarização extrativa: Este método consiste em selecionar as sentenças mais relevantes do texto original para formar o resumo e a sumarização abstractiva, que consiste em gerar um novo texto que resume o conteúdo do texto original. O método utilizado nesse trabalho foi o de sumarização. 3.3 COLETA DE DADOS A coleta de dados para a realização deste trabalho foi feita por meio da extração manual de notícias portuárias durante o período de janeiro de 2023 até outubro de 2023, através dos sites: NovaCana, Conab-Companhia Nacional de Abastecimento, Forbes, Broadcast,Canal Rural, Globo Rural, Portal Celulose, Investing, Logweb , Datamar News a fim de se criar uma base de dados. As notícias foram coletadas de acordo com os seguintes critérios: a notícia deve ser sobre o Porto de Santos ou sobre o setor portuário, estar ligada às cargas movimentadas no porto referido ou foi publicada em um dos sites referenciais. Os requisitos desta base foram definidos como a data da notícia, o título, a notícia e um link para acesso, totalizando cerca de 165 registros armazenados em um arquivo de extensão CSV. Após a coleta de dados, a base foi transferida para o Python, utilizando as bibliotecas Pandas, para a manipulação dos dados, como a leitura e escrita dos dados, a criação de tabelas e a análise dos dados e NLTK foi utilizada para o processamento de linguagem natural, como a tokenização, a remoção de stop words e a criação de um dicionário para sentenças mais importantes.A tokenização divide o texto em partes menores, como palavras ou frases. A remoção de stopwords remove palavras comuns e sem significado. A criação de um dicionário
144 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 para sentenças mais importantes identifica as sentenças mais importantes e as armazena em um dicionário. A base de dados em Python permitiu realizar as seguintes operações: armazenamento das notícias para facilitar o acesso e a consulta e sumarizar das notícias para obter um resumo do conteúdo. 3.4 TOKENIZAÇÃO A tokenização, no âmbito do pré-processamento em Processamento de Linguagem Natural (PLN), consiste em fragmentar o texto em unidades menores, conhecidas como tokens. Esses tokens podem abranger palavras, números, símbolos, letras ou até mesmo frases (ALCARDE, 2023). Uma abordagem comum e simples de tokenização é dividir o texto em palavras baseando-se nos espaços existentes ou fragmentar as palavras em partes menores. O propósito da tokenização é viabilizar uma compreensão e processamento mais eficazes do texto por parte dos modelos de PLN. A sumarização de notícias segue uma metodologia rigorosa, dividida em várias etapas para extrair os dados mais cruciais de um texto informativo. Primeiramente, a notícia é tokenizada usando o método tokenize, que segmenta cada palavra na sentença e as dispõe em uma lista indexada para organização, conforme a figura 1. Figura 1 - Processo de criação Fonte: Autores (2023) A tokenização é executada utilizando a classe RegexpTokenizer do Natural Language Toolkit (NLTK). Essa classe viabiliza a segmentação baseada em expressões regulares, adotando r'[A-z]\w*' como o padrão. Esta expressão define o padrão para reconhecer palavras, abrangendo letras maiúsculas e minúsculas, bem como caracteres alfanuméricos e sublinhados, conforme exemplificado na figura 2.
145 | Protótipo de sistema de processamento de linguagem natural para inteligência de mercado baseada em notícias no porto de Santos Revista Processando o Saber - v.16 - p. 137-149 - 2024 Figura 2Tokenizer Fonte: Autores (2023) Após a tokenização, o próximo passo é lidar com as stop words, palavras comuns como "o", "a", "e", "de", que geralmente não carregam significado essencial na frase. O módulo stopwords do NLTK é usado para obter uma lista dessas palavras, permitindo sua remoção do texto e concentrando-se nas palavras mais relevantes. Segue-se a criação de uma distribuição de frequência das palavras. Nesse estágio, cada palavra na lista tokenizada é contada para determinar sua ocorrência. Um dicionário é então construído, associando as palavras às suas frequências. Esse dicionário desempenha um papel crucial na formulação do resumo da notícia. Figura 3 - Stopwords Fonte: Autores (2023) O resumo é construído iterando sobre o dicionário de frequências por meio de um loop for. Durante esse processo, as sentenças são avaliadas conforme suas frequências no texto original, e o resumo é composto, dando prioridade às sentenças mais frequentes. As sentenças escolhidas são então agregadas a uma lista, agindo como um repositório temporário para armazenar o resumo da notícia, conforme mostra as figuras 4 e 5.