scieee AI-readable full text Open interactive document viewer

Uma utilidade para o reconhecimento de topónimos em documentos medievais

Canosa Rodríguez, Xavier; Gamallo Otero, Pablo; Varela Barreiro, Francisco Xavier; Taboada González, José Ángel; Martínez Lema, Paulo; García González, Marcos

Abstract

Este artigo apresenta o método de construção duma ferramenta para a anotação de entidades geográficas mencionadas em textos medievais. A nova ferramenta foi desenvolvida a partir dos módulos de língua contemporânea do LinguaKit, pacote multilingue de ferramentas de PLN. Uma coleção de corpora anotados manualmente serviu de recurso para elaborar uma lista de topónimos medievais (gazetteers) e observar padrões para a melhora e implementação de novas regras de reconhecimento dos nomes de lugar. Depois da lista de entidades geográficas, os ativadores contextuais (triggers) foram o recurso determinante na melhora da abrangência. Para o produto final, fizeram-se também ajustes menores na procura de recolher os elementos mais comuns do léxico e os contextos gramaticais das entidades geográficas mencionadas. Ainda que muito trabalho fica por fazer na elaboração de listas para entidades não geográficas, na construção dum modelo de língua medieval e um lexicon específico, o novo módulo pode ser utilizado para anotar textos e mostra uma melhora significativa a respeito dos módulos previamente existentes

Full text

Proposta recebida em Abril 2018 e aceite para publica¸c˜ao em Junho 2019. Uma Utilidade para o Reconhecimento de Top´onimos em Documentos Medievais A Tool for Toponym Recognition in Medieval Documents Xavier Canosa CiTIUS / Univ. de Santiago de Compostela [email protected] Pablo Gamallo CiTIUS / Univ. de Santiago de Compostela [email protected] Xavier Varela ILG / Univ. de Santiago de Compostela [email protected] Jos´e ´ Angel Taboada CiTIUS / Univ. de Santiago de Compostela [email protected] Paulo Mart´ınez Lema ILS / Univ. de Santiago de Compostela [email protected] Marcos Garcia Grupo LyS, Dpto. de Letras / Univ. da Corunha [email protected] Resumo Este artigo apresenta o m´etodo de constru¸c˜ao duma ferramenta para a anota¸c˜ao de entidades geogr´aficas mencionadas em textos medievais. A nova ferramenta foi desenvolvida a partir dos m´odulos de l´ıngua contemporˆanea do LinguaKit, pacote multilingue de ferramentas de PLN. Uma cole¸c˜ao de corpora anotados manualmente serviu de recurso para elaborar uma lista de top´onimos medievais (gazetteers) e observar padr˜oes para a melhora e implementa¸c˜ao de novas regras de reconhecimento dos nomes de lugar. Depois da lista de entidades geogr´aficas, os ativadores contextuais (triggers) foram o recurso determinante na melhora da abrangˆencia. Para o produto final, fizeram-se tamb´em ajustes menores na procura de recolher os elementos mais comuns do l´exico e os contextos gramaticais das entidades geogr´aficas mencionadas. Ainda que muito trabalho fica por fazer na elabora¸c˜ao de listas para entidades n˜ao geogr´aficas, na constru¸c˜ao dum modelo de l´ıngua medieval e um lexicon espec´ıfico, o novo m´odulo pode ser utilizado para anotar textos e mostra uma melhora significativa a respeito dos m´odulos previamente existentes. Palavras chave entidades geogr´aficas mencionadas, NERC, topon´ımia Abstract This paper describes a method to build a tool aimed at recognizing geographical named entities in medieval texts. The new tool has been developed using the corresponding modules for contemporary languages contained in LinguaKit, a suite of NLP tools. A collection of manually annotated corpora served as a resource to build a gazetteer of medieval toponyms and find patterns to improve and implement new rules for the recognition of place names. In addition to the gazetteer, a list of triggers was the most determinant factor to improve recall. Final adjustments considered the most frequent terms of the lexicon and grammatical contexts for geographical named entities. In the process of building a model of medieval language and a specific lexicon, the available tool can already be used to annotate texts and shows a significant improvement when compared with previous modules. However, most work remains to be done in terms of adding specific gazetteers for entities other than geographical. Keywords geographical named entities, NERC, place names 1 Introdu¸c˜ao O reconhecimento autom´atico de top´onimos foi atendido nas ´ultimas duas d´ecadas como parte do problema NERC (Named Entity Recognition and Classification) tamb´em chamado de REM (Reconhecimento de Entidades Mencionadas) dentro do Processamento da Linguagem Natural (PLN). Dado que os top´onimos mais comuns aparecem sistematizados em nomenclatores e atlas j´a digitalizados, o uso de listas de entidades (gazetteers) sobre os que efetuar pesquisas por string match aparece como uma primeira solu¸c˜ao para a anota¸c˜ao autom´atica. Por´em, a ambiguidade que se produz na l´ıngua (ex. Santiago como cidade ou como nome de pessoa) e a necessidade DOI: 10.21814/lm.11.1.291 This work is Licensed under a Creative Commons Attribution 4.0 License Linguam´ atica — ISSN: 1647–0818 Vol. 11 N´um. 1 2019 - P´ag. 3–15 de marcar top´onimos menores ou menos comuns (ex. microtop´onimos, geografias ex´oticas e menos habituais) precisa de utilidades com capacidade de desambigua¸c˜ao e an´alise do contexto para prever os casos de formas desconhecidas nas listas. Duas aproxima¸c˜oes contribu´ıram para dar o problema como resolvido com um n´ıvel satisfat´orio de efic´acia: a aplica¸c˜ao de heur´ısticas (especialmente regras que especifiquem um contexto morfossint´atico) e o treino a partir de grandes volumes de corpora de onde se inferem regras de tipo estat´ıstico. A anota¸c˜ao NERC passou assim a formar parte dos pacotes de utilidades de PLN mais comuns na atualidade, facilitando o processamento de textos para o reconhecimento de top´onimos. Dado que as ferramentas NERC foram desenvolvidas a partir de corpora contemporˆaneos (Won et al.,2018), a aplica¸c˜ao em variedades hist´oricas da l´ıngua vˆe comprometido o desempenho em fun¸c˜ao da divergˆencia a respeito dos usos lingu´ısticos atuais. No caso galegoportuguˆes medieval, ainda conservando uma estrutura gramatical e regularidade morfol´ogica pr´oxima `as solu¸c˜oes contemporˆaneas, a dificuldade vem dada pelo grande n´umero de variantes dos top´onimos, limitando a aplicabilidade das listas (ex. as formas Mondodnedo, Mondonedo, Mondonnedo, Mondo˜nedo aparecem todas num mesmo corpus). O recurso a contextos sint´aticos activados por palavras chave (triggers) que contribuem para a dete¸c˜ao da entidade geogr´afica com maior precis˜ao, tamb´em se vˆe condicionado pelo fen´omeno da varia¸c˜ao (ex. feegresia, figleSia, figressia, figresya, figrigia, figrisia. . . at´e 438 variantes foram achadas para o mesmo tipo geogr´afico). Quanto menor seja a aplicabilidade de listas de entidades e de ativadores, mais limita¸c˜ao nos recursos da ferramenta e maior dependˆencia na especificidade das regras ou no treino estat´ıstico. Por´em, para conseguir regras mais espec´ıficas, necessita-se um maior n´ıvel de PLN, particularmente lematiza¸c˜ao e etiquetagem morfossint´atica que, da sua parte, requer o uso de lexicons espec´ıficos para a variedade de l´ıngua. Numa solu¸c˜ao estat´ıstica, o treino de modelos necessita de grandes corpora, com um volume suficiente como para serem estatisticamente relevantes. Para al´em de que este tipo de recursos s˜ao custosos e requerem aten¸c˜ao experta, existe ainda o problema de que a enorme produtividade da varia¸c˜ao, acentuada por fatores tais qual ´epoca, ´area geogr´afica, tipologia textual e ainda usos individuais, faz com que as variantes se multipliquem e reduzam as frequˆencias dos termos. Mesmo que um sistema NERC para textos medievais possa se desenhar com a mesma tecnologia e pr´aticas utilizadas para a l´ıngua contemporˆanea, a adapta¸c˜ao duma ferramenta requer a disponibilidade de recursos adicionais que comprometem o desempenho do produto final. A nossa principal contribui¸c˜ao ´e a cria¸c˜ao de recursos para o galego-portuguˆes medieval e a sua integra¸c˜ao e adapta¸c˜ao a uma ferramenta de NERC j´a existente para a l´ıngua contemporˆanea. Mais precisamente, neste artigo apresentamos uma metodologia que analisa os componentes do pacote de utilidades PLN LinguaKit (Gamallo & Garcia,2017) com maior relevˆancia para a anota¸c˜ao de top´onimos em textos medievais do dom´ınio galego-portuguˆes. Partindo dum conjunto de corpora com top´onimos anotados manualmente, preparamos uma s´erie de testes para avaliar o desempenho da ferramenta conforme se foram adicionando ou modificando componentes, nomeadamente listas de entidades e ativadores, at´e desenvolvermos um novo m´odulo NERC de LinguaKit adaptado a textos medievais do galego-portuguˆes. Mesmo se este m´odulo ´e apenas uma primeira vers˜ao a melhorar, oferece um incremento muito not´avel na abrangˆencia e medida-F para as entidades geogr´aficas a respeito dos m´odulos de l´ıngua contemporˆanea. O m´odulo cont´em tamb´em um tokenizador, um lematizador e um etiquetador morfossint´atico, ainda em fase de prot´otipo, todos eles adaptados para o galegoportuguˆes medieval. O conjunto de m´odulos para a l´ıngua hist´orica, chamado de histgz, est´a integrado em LinguaKit, com licen¸ca livre GPLv31. Para al´em da introdu¸c˜ao, o resto do artigo est´a organizado como prossegue. Na Sec¸c˜ao 2 mencionamos estrat´egias de aproxima¸c˜ao a textos hist´oricos para o reconhecimento de entidades mencionadas e revemos o desempenho de ferramentas NERC para o caso particular de entidades geogr´aficas mencionadas em portuguˆes. A Sec¸c˜ao 3descreve os corpora utilizados nos testes e introduz LinguaKit, a ferramenta sobre a que se obt´em a nova utilidade, cujas fases de desenvolvimento s˜ao atendidas na Sec¸c˜ao 4. A seguir, avaliam-se os resultados, com aten¸c˜ao particular a falsos positivos e falsos negativos que apontam para melhoras mais imediatas e trabalho futuro, recolhido, junto com as conclus˜oes, na Sec¸c˜ao 6. 2 Trabalho relacionado A dificuldade de reconhecer entidades geogr´aficas mencionadas em textos antigos favorece a anota¸c˜ao manual, mais ou menos auxiliada por ambientes que facilitem o labor experto e possibilitem o trabalho em equipa. Na procura de maior 1https://github.com/citiususc/Linguakit 4– Linguam´ atica Xavier Canosa et al. automatiza¸c˜ao, tem-se recorrido a sistemas inicialmente concebidos para o processamento de textos contemporˆaneos, com duas linhas de atua¸c˜ao, seja pela adapta¸c˜ao dos recursos utilizados pela ferramenta, particularmente listas de entidades, ou adaptando o texto, aplicando estrat´egias de normaliza¸c˜ao com o objetivo de minimizar a varia¸c˜ao lingu´ıstica e aproximar a l´ıngua hist´orica ao padr˜ao contemporˆaneo (Hendrickx & Marquilhas,2011;Marquilhas & Hendrickx,2014) As m´etricas mais comuns para a avalia¸c˜ao de ferramentas NERC s˜ao a precis˜ao, a abrangˆencia e a medida-F que combina as duas primeiras (Santos et al.,2007;Pinto et al.,2016). Na d´ecada passada celebraram-se eventos em que corpora previamente anotados serviam de padr˜oes dourados para medir o desempenho de utilidades NERC. Especialmente relevantes para o portuguˆes contemporˆaneo foram as competi¸c˜oes do HAREM (Santos & Cardoso,2007; Mota & Santos,2008;Freitas et al.,2010). Os melhores resultados para a categoria de Lugar situaram-se em 68,03% de precis˜ao e 73% de abrangˆencia no primeiro evento (Santos & Cardoso,2007) e precis˜ao 72,12%, abrangˆencia 80,17% no segundo (Chaves,2008). Ainda no dom´ınio do padr˜ao contemporˆaneo, testado no corpus Bosque (Afonso et al.,2002), o sistema NERC que deu lugar aos m´odulos correspondentes de LinguaKit atingiu 85% de precis˜ao e 57% de abrangˆencia (68% medida-F) na categoria de Lugar (Gamallo & Garcia,2011). Este mesmo sistema foi tamb´em adaptado para a variedade lingu´ıstica galega, com resultados de medida-F de entre 74,5% e 80,4%, em fun¸c˜ao do tipo de avalia¸c˜ao realizada (Garcia et al.,2012). Testes mais recentes, utilizando os mesmos corpora que o HAREM, ofereceram resultados mais baixos, de 62% precis˜ao e 66% abrangˆencia para a mesma categoria de Lugar (Amaral et al., 2014), o qual ´e indicativo de que n˜ao houve um avan¸co significativo na resolu¸c˜ao do problema. Em rela¸c˜ao com o reconhecimento de entidades em textos antigos, a maior parte dos trabalhos tˆem implementado estrat´egias determin´ısticas que combinam listas de entidades com heur´ısticas para cada tipo de entidade. Tanto as carater´ısticas deste tipo de documentos, muitas vezes digitalizados mediante OCR, como o seu tamanho fazem com que a implementa¸c˜ao de sistemas estat´ısticos seja mais custosa. Existem, contudo, sistemas baseados em aprendizagem autom´atica, tais como Byrne (2007), que treina um modelo de m´axima entropia orientado principalmente `a identifica¸c˜ao de entidades que se sobrep˜oem. Dentro dos m´etodos determin´ısticos as aproxima¸c˜oes mais frequentes s˜ao centradas no documento (i.e., utiliza-se informa¸c˜ao de todo o texto para classificar uma entidade, e n˜ao s´o o contexto da men¸c˜ao espec´ıfica a analisar). Assim, Jones & Crane (2006) classificam 10 tipos de entidades num jornal americano do s´eculo XIX, com valores de precis˜ao de entre 57% e 99% em fun¸c˜ao da classe. Borin et al. (2007) analisam as entidades mencionadas num corpus de literatura sueca do XIX, melhorando os resultados com um m´odulo de similaridade que computa a distˆancia de edi¸c˜ao entre as men¸c˜oes desconhecidas e as listas de entidades. Tamb´em mediante m´aquinas de estados finitos e um conjunto de listas (nomes, apelidos, etc.), Grover et al. (2008) identificam entidades geogr´aficas e nomes de pessoa em textos parlamentares britˆanicos dos s´eculos XVII a XIX. De modo similar a estes ´ultimos, a metodologia empregada no presente trabalho adapta os conjuntos de ativadores e de listas de entidades e implementa regras espec´ıficas para melhorar o desempenho dum sistema NERC em texto medieval. Ainda que o n´umero de trabalhos de anota¸c˜ao de top´onimos aumenta particularmente no campo das humanidades digitais, s˜ao poucos ainda os estudos espec´ıficos para a compara¸c˜ao do desempenho de ferramentas NERC em textos hist´oricos. Canosa (2017) comparou o desempenho de ferramentas para um corpus em inglˆes do s´eculo XVII atingindo resultados do 68% na medida-F com uma ferramenta estat´ıstica treinada em corpora modernos e do 62% com um sistema de regras provisto duma lista espec´ıfica. Resultados similares, com a melhor medida-F pr´oxima a 70%, foram de novo obtidos na comparativa de cinco ferramentas NERC contemporˆaneas sobre c´orpora hist´oricos tamb´em do inglˆes em Won et al. (2018). Estes mesmos autores apresentam um experimento novidoso em que se combinam as anota¸c˜oes das distintas ferramentas NERC para escolher o mais prov´avel em caso de divergˆencia, atingindo um 73,3% na medida-F como melhor resultado. 3 Materiais e ferramentas Nesta sec¸c˜ao, apresentamos os recursos textuais (corpora) e a ferramenta de processamento da l´ıngua natural utilizados na experimenta¸c˜ao (LinguaKit). Uma Utilidade para o Reconhecimento de Top´onimos em Documentos Medievais Linguam´ atica – 5 3.1 Corpora Como material de trabalho para o treino duma nova ferramenta e avalia¸c˜ao de resultados utilizou-se uma parte dos textos medievais recolhidos actualmente no Corpus informatizado Galego-Portuguˆes Antigo2(CGPA) (Varela Barreiro et al.,2016). C´odigo corpus Tokens Top´onimos Mens 18711 381 Toxosoutos 44001 2945 Toxosoutos gl 5138 295 CDMACM5 267965 2626 CDMACM5 gl 105172 844 Mens TX CD gl 128992 5760 Tabela 1: C´odigos dos corpora utilizados para extra¸c˜ao de top´onimos e tamanho dos corpora e listas obtidas. O CGPA ´e o resultado de reunir numa plataforma conjunta corpora hist´oricos do galego, do portuguˆes, do latim e do castelhano elaborados na Galiza, Portugal e Brasil. O n´ucleo de textos da Galiza forma-o o corpus pluril´ıngue Xelm´ırez,Corpus ling¨u´ıstico da Galiza medieval3 (Varela Barreiro,2009) do Instituto da Lingua Galega (USC), em que est˜ao integrados textos redigidos em galego-portuguˆes (TMILG), em latim (TMILL) e em castelhano (TMILC). Os textos de Portugal e do Brasil n˜ao contˆem obras em latim ou castelhano e est˜ao representados por duas vias. Por parte portuguesa concorre o Corpus Informatizado do Portuguˆes Medieval4(CIPM) (Xavier,2000) e por parte brasileira o Corpus Hist´orico do Portuguˆes Tycho Brahe5(Galves, 2018). Pelo momento o grande valor do CGPA ´e fazer poss´ıvel, por meio de pesquisa ´unica, o acesso `a totalidade dos corpora integrados. Os textos do CGPA selecionados para este projecto particular de desenvolvimento duma ferramenta de anota¸c˜ao de entidades geogr´aficas mencionadas tˆem a particularidade de contarem com a etiquetagem dos top´onimos, por quanto foram utilizados anteriormente no Inventario Topon´ımico da Galiza Medieval6(ITGM) (Varela Barreiro & Mart´ınez Lema,2009). O ITGM ´e um projecto lan¸cado em 2005 com o intuito de fazer acess´ıvel de forma gradual a totalidade do material topon´ımico presente 2http://ilg.usc.gal/CGPA 3http://sli.uvigo.gal/xelmirez/ 4https://cipm.fcsh.unl.pt/ 5http://www.tycho.iel.unicamp.br/~tycho/ corpus/ 6http://ilg.usc.gal/itgm na documenta¸c˜ao galega medieval, compilada e codificada no corpus Xelm´ırez. No processo de recupera¸c˜ao da informa¸c˜ao, as agrupa¸c˜oes de top´onimos obtiveram-se pela aplica¸c˜ao de crit´erios lingu´ısticos (relativos fundamentalmente ao processo de lematiza¸c˜ao) e/ou de crit´erios geogr´afico-administrativos. No seu estado actual, o ITGM acolhe 17.640 registos topon´ımicos, que remitem a um total de 3.086 top´onimos e outros tantos lemas. Destes ´ultimos, 2.876 (93% do conjunto) est˜ao referenciados com maior ou menor margem de certeza, no entanto apenas para 7% (os 210 restantes) carecemos de qualquer parˆametro geogr´afico-administrativo de atribui¸c˜ao. A tabela 1mostra os textos procedentes do ITGM, caracterizados portanto por terem os top´onimos anotados manualmente, que foram selecionados para a fase de recolhida de dados e testes no presente projecto. Cada corpus recolhe textos medievais com uma mesma origem documental, acess´ıvel no CGPA em que aparecem com c´odigo e referˆencia bibliogr´afica individual. As obras do CGPA escolhidas para o desenvolvimento foram a Colecci´on diplom´atica do mosteiro de Santiago de Mens (Zapico Barbeito,2005), Os documentos do tombo de Toxos Outos (Rodr´ıguez & Javier,2004)eaColecci´on diplom´atica medieval do Arquivo da Catedral de Mondo˜nedo (Cal Pardo,1999). Dado que nos corpora iniciais h´a tamb´em documentos em latim e castelhano, gerou-se uma segunda vers˜ao s´o com os textos em galego-portuguˆes (identificada com a extens˜ao gl). Nos experimentos finais agrupam-se todos os documentos num ´unico arquivo (MensTXCDgl), a soma de selecionar s´o os documentos galego-portugueses dos trˆes corpora. Na fase final de avalia¸c˜ao utilizou-se um novo corpus, o Livro de Notas de ´ Alvaro P´erez (LNAP) (Tato Plaza,1999), sem anota¸c˜ao de top´onimos nenhuns na vers˜ao oferecida para este projeto. 3.2 LinguaKit LinguaKit ´e um pacote livre de ferramentas multil´ıngues para o processamento da linguagem natural que pode aplicar-se ao portuguˆes, galego, inglˆes e espanhol. Cont´em m´odulos de an´alise, extra¸c˜ao, anota¸c˜ao e corre¸c˜ao lingu´ıstica. LinguaKit permite realizar um amplo conjunto de tarefas, entre as quais se encontram: segmenta¸c˜ao em frases e tokeniza¸c˜ao, lematiza¸c˜ao, etiquetagem morfossint´atica, reconhecimento e classifica¸c˜ao de entidades mencionadas (NERC), an´alise sint´atica de dependˆencias, resolu¸c˜ao de correferˆencia a n´ıvel de entidade, extra¸c˜ao de termos e de rela¸c˜oes semˆanticas, an´alise de senti6– Linguam´ atica Xavier Canosa et al. Figura 1: Arquitetura utilizada pelo Histgz e principais modifica¸c˜oes a respeito dos m´odulos j´a existentes no LinguaKit. mentos, anota¸c˜ao conceitual com liga¸c˜ao a recursos enciclop´edicos (entity linking), corre¸c˜ao e avalia¸c˜ao de l´exico e sintaxe (s´o para o galego), conjuga¸c˜ao verbal autom´atica (exceto inglˆes), resumo autom´atico, identifica¸c˜ao de l´ıngua e visualiza¸c˜ao de concordˆancias (palavras chave em contexto). O presente trabalho foca-se nas tarefas relacionadas com o NERC, tal e como mostra a figura 1, descrita mais `a frente, na sec¸c˜ao 4. O LinguaKit est´a dispon´ıvel como um servi¸co web7e ´e acess´ıvel via RESTful API4.8O c´odigo fonte est´a publicado sob licen¸ca GPLv3 e acess´ıvel desde reposit´orio de GitHub (Cf. nota de rodap´e 1). 4 M´etodos e procedimento O trabalho de adapta¸c˜ao do LinguaKit para o reconhecimento de top´onimos medievais realizou-se aplicando uma metodologia experimental. Considerado um par´ametro, aplicaram-se testes sobre os corpora para observar como contribui para a anota¸c˜ao dos top´onimos. Primeiramente atendeu-se `a incidˆencia da lista de top´onimos e a lista de ativadores. As regras e ajustes menores nos recursos de tipo morfossint´atico ocuparam o est´adio final. Os corpora foram introduzidos no 7https://www.linguakit.com 8https://market.mashape.com/linguakit/ linguakit-natural-language-processing-in-thecloud desenvolvimento gradualmente, de tal modo que uma vez conclu´ıda a necessidade de incluir um componente de melhora no m´odulo, se adicionava um novo corpus para a nova rolda de experimentos. As adapta¸c˜oes, ajustes, modifica¸c˜oes e suplementos elaborados nos sucessivos ensaios foram implementados na arquitetura do LinguaKit como m´odulo independente, chamado de Histgz (galego-portuguˆes hist´orico). A figura 1mostra graficamente as principais modifica¸c˜oes do novo m´odulo a respeito dos m´odulos pr´evios utilizados como base para o desenvolvimento. O Histgz inclui tanto tarefas b´asicas de an´alise (segmenta¸c˜ao em frases, tokeniza¸c˜ao e quebra de contra¸c˜oes ou separador), quanto processos mais complexos: etiqueta¸c˜ao morfossint´atica (PoS tagging) e NERC. As principais modifica¸c˜oes foram realizadas no NEC (que forma parte do NER) e no etiquetador. O NEC ´e a tarefa final que classifica as entidades e permite reconhecer os top´onimos. 4.1 Extra¸c˜ao e elabora¸c˜ao de listas de top´onimos Para facilitar os labores de valida¸c˜ao das anota¸c˜oes obtidas por procedimentos autom´aticos, criaram-se duas vers˜oes dos corpora: uma s´o texto, com os top´onimos sem anotar, para ser usada como input pela ferramenta NERC, e outra com os top´onimos marcados segundo a anota¸c˜ao manual facilitada pela Uma Utilidade para o Reconhecimento de Top´onimos em Documentos Medievais Linguam´ atica – 7 Lista de top´onimos Sem lista medieval Sem lista medieval lista acrescentada com Lista Mens Lista acrescentada com Lista Mens Entidade geogr´afica mencionada Verdadeiro positivo se coincide exatamente com a anota¸c˜ao manual Verdadeiros positivos a partir do nome pr´oprio Verdadeiro positivo se coincide exatamente com a anota¸c˜ao manual Verdadeiros positivos a partir do nome pr´oprio Precis˜ao 57,53% 76,88% 72,97% 93,24% Abrangˆencia 17,95% 23,99% 45,3% 57,89% Medida-F 27,36% 36,57% 55,9% 71,43% Tabela 2: Comparativa de resultados da anota¸c˜ao do LinguaKit (com o m´odulo base em galego) sobre o corpus Mens segundo lista e crit´erio de valida¸c˜ao dos verdadeiros positivos das entidades geogr´aficas mencionadas. equipa do ITGM que servir´a de padr˜ao dourado e recurso para a extra¸c˜ao de top´onimos e listas para adicionar ao LinguaKit. As listas de top´onimos obtidas relacionam-se na ´ultima coluna da tabela 1. A lista ´ultima ´e a soma das listas de top´onimos obtidas dos corpora envolvidos no desevolvimento do m´odulo NERC medieval, Lista Mens TX CD (tabela 1) e aparece integrada na lista de entidades geogr´aficas do Histgz acess´ıvel no reposit´orio de GitHub (Cf. nota 1). Os testes realizados nas fases de desenvolvimento utilizaram as listas progressivamente, para distinguir o efeito da inclus˜ao de cada nova lista segundo se processava e ensaiava sobre um novo corpus. Este efeito mostra-se na tabela 2com os resultados do LinguaKit em galego condicionados pelo uso ou n˜ao da lista de entidades geogr´aficas. As m´etricas mostram o limite de capacidade do m´odulo quando a lista cont´em todos os top´onimos presentes no texto. Na avalia¸c˜ao dos resultados apareceu tamb´em como relevante o crit´erio utilizado para definir o top´onimo. O padr˜ao dourado anota como top´onimos frases do tipo “o rr´ıo de Tallo”, “no Esto” ou o artigo mesmo quando n˜ao foi grafado com mai´uscula “o Esto”, por´em a lista de entidades limita o top´onimo ao nome pr´oprio. Nas primeiras avalia¸c˜oes discriminou-se entre os resultados que coincidiam plenamente com as anota¸c˜oes manuais (s´o se avalia como verdadeiro positivo quando se anota exatamente igual ao padr˜ao, assim “o rr´ıo de Tallo”, “no Esto”) face `aqueles em que o nome pr´oprio ´e suficiente para considerar a anota¸c˜ao como verdadeiro positivo (“Tallo”, “Esto”). Este ´ultimo crit´erio, mais adequado `as expectativas reais de desempenho duma ferramenta NERC, ser´a o que se aplique nos sucessivos experimentos. Os experimentos da tabela 2mostram como, mesmo com uma lista que cont´em todos os top´onimos presentes no corpus, ainda obtendo uma precis˜ao muito alta, apenas se recuperam 57,89% das entidades geogr´aficas mencionadas. As regras utilizadas pelos m´odulos de l´ıngua contemporˆanea precisam, portanto, melhoras para al´em das listas que, contudo, resultam determinantes para um bom desempenho (os resultados com a lista s´o de top´onimos contemporˆaneos ficam em apenas 36,57% na medida-F face ao 71,43% obtido ao acrescentar a lista medieval). 4.2 Filtrado por l´ıngua A an´alise dos primeiros testes, uma vez processados os textos e extra´ıdos os top´onimos anotados manualmente, mostraram as limita¸c˜oes da aplica¸c˜ao do m´odulo NERC mesmo com uma lista de top´onimos espec´ıfica. Por´em, o primeiro factor a considerar para a melhora de resultados n˜ao ´e devido ao pacote PLN, mas aos pr´oprios textos a anotar. Com efeito, ao trabalhar com o conjunto dos corpora, aparecem textos em latim e, em menor medida e em documentos mais tardios, espanhol, que necessariamente condicionam a efetivadade dos recursos e das heur´ısticas classificat´orias, dependentes duma sele¸c˜ao lingu´ıstica pr´evia (ex. illa ´e demonstrativo em latim, mas nome comum “terra rodeada por mar” em galego). Faz-se necess´aria, portanto, a discrimina¸c˜ao por idioma. Os corpora utilizados nos vindouros experimentos (Toxosoutos e CDMACM5) foram processados para obter apenas o texto galego(-portuguˆes), identificado com a extens˜ao gl nos c´odigos da tabela 1. 8– Linguam´ atica Xavier Canosa et al. Precis˜ao Abrangˆencia Medida-F lista com os top´onimos do corpus Lista de ativadores 82,26% 25,67% 39,13% N˜ao N˜ao 96,22 59,73% 73,71% Sim N˜ao 77,5% 36,41% 49,54% N˜ao Sim 90,31% 62,58% 73,93% Sim Sim Tabela 3: Comparativa de resultados segundo o uso de lista de ativadores e top´onimos no corpus Mens (596 entidades geogr´aficas anotadas no texto padr˜ao). Ativadores Lista de ativadores expandida por combinat´oria de caracteres Lista de ativadores recuperada por inspe¸c˜ao de concordˆancias no CGPA Precis˜ao 76,74% 76,16% Abrangˆencia 32,76% 33,06% Medida-F 45,92% 46,11% Tabela 4: Comparativa de resultados variando a lista de ativadores sobre o corpus Mens TX CDMACM5 gl (3.373 entidades geogr´aficas anotadas no corpus padr˜ao). 4.3 Lista de ativadores O primeiro componente considerado para a melhora do desempenho do m´odulo uma vez comprovada a limita¸c˜ao da lista de top´onimos foi a lista de ativadores para entidades geogr´aficas (TwLOC). Da inspec¸c˜ao experta de concordˆancias dos top´onimos extra´ıdos do primeiro corpus usado nos testes (Mens) obteve-se manualmente uma lista de 38 termos geogr´aficos, contando como unidades distintas todas as variantes dum mesmo termo. Assim, na mesma lista aparecem todas as variantes achadas no corpus associ´aveis a fregresia (freges´ıa, fijgles´ıa, fijgres´ıa, fjgres´ıa, flegres´ıa, frijgues´ıa, frigres´yas), mosteiro (moesteiro, moesteyro, mosteiro, mosteiros), vila (vila, villa, vjla) junto com termos geogr´aficos com uma ´unica ocorrˆencia (ten¸ca). Dado que uma boa parte dos termos s˜ao variantes do mesmo tipo, experimentou-se com a expans˜ao da lista de ativadores mediante a combinat´oria de caracteres equivalentes (ex. nasal palatal nn,nh,nj,ni,jn,yn,in,˜n,gn; vogais simples e geminadas o,oo; vogais nasais e termina¸c˜oes ˜o,om,on; sibilantes, lateral palatal, etc.). Paralelamente fez-se um levantamento manual de termos geogr´aficos a partir das listas de tipos extra´ıdas do CGPA de onde se obtˆem 1.900 termos geogr´aficos (dispon´ıveis na pasta de ativadores do pr´oprio m´odulo Histgz de LinguaKit). Os resultados da aplica¸c˜ao da lista de termos expandidos artificialmente n˜ao proporcionaram um incremento sobre a lista manual (tabelas 3e 4) e, toda vez que esta cont´em as formas originais dos corpora, ficou esta ´ultima como a solu¸c˜ao finalmente adoptada para o novo m´odulo. Ao tempo que se elaborou a nova lista de ativadores com termos geogr´aficos, recolheram-se termos adicionais com valor de ativador em contextos mais espec´ıficos, agrupados em uma lista, nongeo, composta principalmente por t´ıtulos, ex. arcebispo,rei. Recolhe 686 termos, com um alto n´umero de variantes para o mesmo tipo. 4.4 Regras classificat´orias O m´odulo NERC aplica a lista de ativadores por meio de regras que priorizam a classifica¸c˜ao numa classe dentro das quatro categorias de entidades mencionadas (PER Pessoa, LOC Lugar, ORG Organiza¸c˜ao e MISC Miscelˆanea). Um exemplo de regra ´e aquela que classifica um nome pr´oprio como entidade geogr´afica mencionada quando n˜ao se achar em nenhuma das listas de entidades e o termo precedente for a preposi¸c˜ao em. Outra classifica como nome de pessoa todo nome pr´oprio amb´ıguo em ausˆencia de outros condicionantes. Assim, se uma express˜ao aparece em ambas as listas de pessoas e top´onimos, ser´a considerada PER e n˜ao LOC por quanto os antrop´onimos s˜ao mais frequentes do que os nomes de lugar. Resulta ´obvio que as regras tˆem um rendimento percentual e n˜ao representam o 100% dos casos (ex. Penso em Ruy daria erro com a primeira regra citada da preposi¸c˜ao em, eSantiago seria classificado sempre como nome de pessoa se estiver em ambas as duas listas de entidades LOC e PER e n˜ao houvesse contexto nenhum para a desambigua¸c˜ao). Uma Utilidade para o Reconhecimento de Top´onimos em Documentos Medievais Linguam´ atica – 9 Regras complementares, como a aplica¸c˜ao de contextos gramaticais e as listas de ativadores, permitem corrigir parcialmente os erros derivados das regras mais gen´ericas. Como o problema ´e classificat´orio, quanto melhor se discriminem as outras categorias, melhores resultados se obter˜ao na classe de entidades geogr´aficas. Por´em, dado que nesta adapta¸c˜ao de LinguaKit o foco de estudo foram os top´onimos, as regras caracter´ısticas do m´odulo consideram exclusivamente as entidades geogr´aficas, desambiguando os contextos gramaticais e precisando formas espec´ıficas da l´ıngua medieval (caso das contra¸c˜oes da preposi¸c˜ao em, ex. enno). O recurso a listas de categorias n˜ao geogr´aficas faz-se quando ´e poss´ıvel criar uma regra que melhore a recupera¸c˜ao de top´onimos. Assim uma lista de ativadores para entidades da categoria pessoa (ex. bispo,emperatriz,rrainha,rei, etc.), extra´ıda ao tempo que se recolheram os ativadores geo, permite classificar como nomes de pessoa os nomes pr´oprios precedidos dos termos que assinalam a entidade pessoa (PER) em casos como: bispo <PER>Payo Rodrigues</PER> No entanto, ante preposi¸c˜ao em ou de e, opcionalmente, artigo, as regras aplicam a lista para reconhecer uma entidade geogr´afica: bispo de <LOC>Mondonedo</LOC> Idealmente, o sistema devia tamb´em reconhecer e classificar bispo de Mondonedo como pessoa mas o trabalho presente est´a focado no reconhecimento de top´onimos e a ferramenta de extra¸c˜ao n˜ao foi configurada para identificar entidades dentro da express˜ao duma outra entidade. 4.5 Lexicon e modelo de l´ıngua Para a etiquetagem morfossint´atica pr´evia `a classifica¸c˜ao das entidades mencionadas, LinguaKit usa um lexicon que regista o lema ou lemas e valores gramaticais de cada express˜ao. Na aussˆencia dum corpus lematizado e etiquetado morfossintamente que permitisse capturar recursos e treinar um modelo espec´ıfico de l´ıngua medieval, juntaram-se os lexicons de galego e portuguˆes acrescentados com um novo dicion´ario criado a partir dos termos de maior frequˆencia (m´ınimo 20 ocorrˆencias) nos corpora usados na fase de desenvolvimento (tabela 1). Para a desambigua¸c˜ao da etiqueta morfossint´atica (ex. era: nome comum feminino singular ou verbo imperfeito indicativo da primeira ou terceira pessoa), utilizou-se o modelo de galego, preferido por quanto mant´em os pronomes encl´ıticos ligados ao verbo sem marca nenhuma. Parte dos textos medievais anotados automaticamente nos testes mencionados nas sec¸c˜oes anteriores foram revistos para serem utilizados num treino m´ınimo de bigramas de tokens adicionado ao modelo contemporˆaneo. O modelo criado ´e utilizado por um desambiguador bayesiano para levar a cabo a etiquetagem morfossint´atica tal como descreve Garcia & Gamallo (2015).Mais concretamente, este m´odulo ´e um classificador bayesiano baseado em bigramas de pares < token, etiqueta >. Para poder atribuir uma marca (ou etiqueta morfossint´atica) a um token, o classificador calcula a probabilidade de cada marca dado o token alvo tomando em conta o contexto `a esquerda e `a direita, nomeadamente tomando em conta as etiquetas imediatamente `a esquerda e `a direira do token alvo. O algoritmo desambigua de esquerda `a direita, de tal maneira que o contexto esquerdo dum token amb´ıguo ´e um outro token j´a desambiguado, ´e dizer, ao qual j´a foi atribu´ıdo uma ´unica etiqueta. 4.6 Ajustes finais A aplica¸c˜ao do m´odulo sobre os corpora de desenvolvimento representa uma aproxima¸c˜ao ao que seria o limite m´aximo de anota¸c˜ao do novo m´odulo quando operar nas condi¸c˜oes id´oneas de abrangˆencia total da lista de entidades geogr´aficas e textos com top´onimos cujos tipos geogr´aficos aparecem recolhidos na lista de ativadores. A tabela 5mostra o resultado de variar estes componentes com as regras atualizadas. Nas melhores condi¸c˜oes, mesmo com uma lista que cont´em todos os top´onimos do corpus a anotar, a abrangˆencia m´axima apenas atinge o 60%. Os ´ultimos testes serviram para confirmar a configura¸c˜ao ´otima a respeito dos parˆametros em que a diferen¸ca no desempenho resultou ser menor (expans˜ao da lista de ativadores e regras espec´ıficas) e realizar corre¸c˜oes menores e pontuais em casos de ambiguidades que, sendo muito espec´ıficas dos documentos utilizados no treino, podiam afetar negativamente o desempenho noutros textos. 5 Avalia¸c˜ao Para a avalia¸c˜ao da configura¸c˜ao final do m´odulo Histgz utilizou-se o corpus LNAP, presente na cole¸c˜ao do CGPA, mas n˜ao utilizado nas fases de desenvolvimento. O texto tamb´em n˜ao tem nenhuma anota¸c˜ao de top´onimos e apenas requereu um pr´e-processamento b´asico para ser enviado como input para o LinguaKit. Para a valida¸c˜ao dos verdadeiros e falsos positivos e nega10– Linguam´ atica Xavier Canosa et al. Top´onimos Sem lista de top´onimos Com lista de top´onimos Ativadores Sem lista de ativadores Com lista de ativadores Precis˜ao 86,15% 85,12% Abrangˆencia 14,2% 60,36% Medida-F 24,38% 70,63% Tabela 5: Configura¸c˜oes finais do Histgz para a anota¸c˜ao dos pr´oprios corpora usados no treino Mens TX CDMACM5 gl (3.373 entidades geogr´aficas anotadas no padr˜ao) FALSOS NEGATIVOS morador morador NCMS000 ˜ena en+a SPS00+DA freigresja fregresia NCFS000 de de SPS00 Santa Co˜oba de Rri˜ajo santa co˜oba de rri˜ajo NP00SP0 En en SPS00 San Tom´e de o Mar san tom´e de o mar NP00SP0 morador morador NCMS000 ˜ena en+a SPS00+DA dita dita NCFS000 S˜a s˜a NP00O00 Mjgell mjgell NP00V00 Tabela 6: Exemplos de avalia¸c˜oes com falsos negativos sobre a anota¸c˜ao do Histgz. As etiquetas NP00SP0, NP00O00, NP00V00 representam respetivamente as classes PER(soa), ORG(aniza¸c˜ao) e MISC(el´aneo). tivos (tabela 6) reviram-se todos os outputs manualmente. Dado que este ´e um trabalho custoso, utilizaram-se apenas os documentos iniciais do corpus at´e superar os 2.000 tokens (12 documentos com 2.060 tokens em total). A tabela 6 oferece uma pequena amostra da sa´ıda de Histgz, onde cada unidade lexical do texto de entrada se divide em trˆes colunas: token, lema e etiqueta. O conjunto de etiquetas empregado tem por volta de 250 etiquetas mofossint´aticas e baseia-se nas recomenda¸c˜oes do Grupo EAGLE.9 5.1 Resultados Visto que n˜ao h´a ferramentas espec´ıficas para trabalho com l´ıngua medieval, a avalia¸c˜ao de resultados centra-se na melhora do novo m´odulo, Histgz, com os j´a existentes para l´ıngua contemporˆanea no pr´oprio LinguaKit. O gr´afico da figura 2mostra os resultados obtidos pela valida¸c˜ao manual das anota¸c˜oes obtidas com as configura¸c˜oes dos m´odulos Histgz (galego-portuguˆes 9http://www.cis.uni-muenchen.de/~schmid/tools/ TreeTagger/data/Portuguese-Tagset.html medieval), gl (galego) e pt (portuguˆes) sobre o texto com os documentos do corpus LNAP. O teste mostra o incremento do desempenho a respeito dos m´odulos j´a existentes no pacote do LinguaKit para galego e portuguˆes atuais (figura 2). A abrangˆencia, a medida que mais se vˆe condicionada pela adequa¸c˜ao da lista de top´onimos ao corpus (cf. tabelas 3,4e5), ´e a que mostra um incremento mais not´avel, ao n´ıvel mesmo da obtida nos testes mais favor´aveis durante a fase de desenvolvimento (cf. tabela 5). A precis˜ao tamb´em obt´em um melhor rendimento a respeito das vers˜oes de l´ıngua contemporˆanea, por´em o desempenho ´e menor que o obtido nos testes de desenvolvimento, mesmo nas situa¸c˜oes mais adversas (cf. tabela 3). A compara¸c˜ao com outros sistemas fica fora dos objetivos presentes, por quanto o Histgz ´e um produto operativo mas em estado muito inicial e por serem os testes realizados sobre um texto ainda que n˜ao utilizado no treino, sim presente na mesma cole¸c˜ao do CGPA a que pertencem os corpora usados na fase de desenvolvimento. Apenas como referˆencia das expectativas que se podem aguardar dum sistema de reconhecimento distinto a Uma Utilidade para o Reconhecimento de Top´onimos em Documentos Medievais Linguam´ atica – 11