scieee AI-readable full text Open interactive document viewer

Lietuvių kalbos padėtis skaitmeniniame amžiuje

Aurelija Tamulionienė

Full text

AURELIJA TAMULIONIENĖ Instituto da Língua Lituana Linhas de investigação: estudos sobre o uso contemporâneo da língua lituana e sua variabilidade. A SITUAÇÃO DA LÍNGUA LITUANA NA ERA DIGITAL Sobre a 24.ª Conferência Jono Jablonskio Direções para o desenvolvimento e possibilidades de utilização de recursos linguísticos digitais Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinka­mas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155). A conferência científica com o nome de Jono Jablonskio foi realizada pela primeira vez em 1993 pelo Departamento de Cultura da Língua do Instituto da Língua Lituana e pela Cátedra de Língua Lituana da Universidade de Vilnius. Desde então, as conferências tornaram-se uma tradição e realizam-se todos os outonos (desde 2003, alternadamente no Instituto da Língua Lituana ou na Universidade de Vilnius). Em 29 de setembro de 2017 realizou-se a 24.ª Conferência Científica Jono Jablonskio, Direções para o desenvolvimento e possibilidades de utilização de recursos linguísticos digitais (em inglês, Digital Language Resources, Directions of Their Development and Possibilities to Harness Them), no Instituto da Língua Lituana. A conferência foi organizada pelo Centro de Estudos da Língua Padrão do Instituto da Língua Lituana, em conjunto com o Instituto de Linguística Aplicada da Universidade de Vilnius. A temática desta conferência diferiu da das anteriores; o seu objetivo foi discutir os problemas que surgem na intersecção das línguas e das tecnologias digitais, com os quais nos deparamos ao desenvolver recursos digitais e criar um mercado digital único. No centro das atenções da conferência estiveram o nível semântico dos recursos digitais (a criação de redes de palavras), bem como a atribuição de uma forma sonora aos recursos digitais, a criação de novas possibilidades para divulgar recursos digitais em comunidades multilingues, entre outros temas. Participaram na conferência oradores estrangeiros: do Parlamento Europeu e de Espanha; participaram também investigadores de várias instituições lituanas: do Instituto da Língua Lituana, da Universidade de Vilnius Straipsniai / Articles 313 AURELIJA TAMULIONIENĖ da Universidade, da Universidade Vytautas Magnus, do Instituto Báltico de Tecnologias Avançadas e da UAB „Netcode“. Foram apresentados 17 trabalhos na conferência. Os oradores apresentaram os seus trabalhos e partilharam as suas investigações e experiências em quatro sessões. A conferência começou com discursos de abertura. O deputado ao Parlamento Europeu Algirdas Saudargas e a diretora do Instituto da Língua Lituana, prof.ª dr.ª Jolanta Elena Zabarskaitė, saudaram os participantes e os oradores da conferência. A palavra de abertura foi proferida pela dr.ª Rita Miliūnaitė, investigadora principal do Centro de Investigação da Língua Padrão do Instituto da Língua Lituana. Foi dito que, nos últimos anos, os vínculos entre a língua lituana e as tecnologias da informação se reforçaram muito e que temos resultados concretos tanto na digitalização dos recursos linguísticos como na criação de ferramentas de análise, reconhecimento e síntese da língua; no entanto, em comparação com a rapidez com que o mundo está a mudar nesta área, a língua lituana ainda tem muito caminho a percorrer. Como o lituano é uma língua flexiva, não podemos adaptar-lhe diretamente as tecnologias da informação desenvolvidas para o inglês; por isso, as nossas atuais ferramentas de tradução automática e outras ferramentas informáticas ainda são muito imperfeitas, enquanto o mundo já está a investigar e a avançar na direção da criação de inteligência artificial, incorporando-a em objetos e penetrando camadas cada vez mais profundas da língua. Na sessão plenária, o primeiro trabalho, «A língua viva numa mente artificial», foi apresentado pelo deputado ao Parlamento Europeu Algirdas Saudargas. O orador colocou uma questão fundamental, a que cada comunidade linguística tem de responder: em que medida deve preparar por si própria os recursos e as tecnologias da sua língua materna e o que pode adquirir já desenvolvido com base noutras línguas. O trabalho apresentou reflexões problemáticas segundo as quais o lituano, juntamente com as línguas de alguns outros países pequenos, «tem pouco ou nenhum apoio tecnológico». As tecnologias da língua não recebem a devida atenção nas agendas políticas, nem na Lituânia nem na Europa. O trabalho apresentou perspetivas que mostram que a evolução da inteligência artificial converge para uma forma híbrida, na qual as redes neuronais correspondem a mecanismos inconscientes do cérebro, enquanto a mente consciente é influenciada e modelada pela inteligência artificial tradicional, a chamada inteligência artificial simbólica. Cada comunidade linguística deve assegurar que as tecnologias da língua correspondentes à inteligência artificial simbólica reflitam de forma completa e precisa toda a estrutura da língua materna, e que seja criado um ambiente rico na língua materna (e na cultura materna) para as redes neuronais. A segunda comunicação plenária, «Language equality in the digital age: towards a human language project», foi apresentada em inglês por Rafael Rivera, diretor da empresa de consultoria «Claves». A comunicação apresentou detalhadamente o estudo do Serviço de Estudos do Parlamento Europeu sobre as Perspetivas Científicas, «Igualdade das línguas na era digital. Um projeto para as línguas maternas» (o estudo, em inglês, pode ser consultado na Internet: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf). A comunicação analisou a situação atual das tecnologias para as línguas maternas, quantificando 314 Acta Linguistica Lithuanica LXXVI Lietuvių kalbos padėtis skaitmeniniame amžiuje as consequências económicas, sociais e linguísticas da língua na era digital e abordou a política da União Europeia em matéria de tecnologias da informação e das comunicações. Na era digital, as tecnologias da língua constituem um enorme desafio para os países com poucos falantes. Tecnologias linguísticas pouco desenvolvidas criam desigualdade e obstáculos. Isso afeta os serviços transfronteiriços, a mobilidade dos trabalhadores e o comércio. A causa desses obstáculos são investigações científicas não coordenadas e financiamento insuficiente. O orador salientou que as tecnologias da língua não recebem a devida atenção dos políticos europeus. Com base na análise da situação atual, está a ser criada uma iniciativa que reunirá as políticas das instituições, da investigação, da indústria, do mercado e dos serviços públicos. A última comunicação da sessão plenária, «A língua lituana escrita e falada em meios convencionais e eletrónicos», foi apresentada por Laimutis Telksnys, professor do Instituto de Matemática e Informática da Universidade de Vilnius. Na comunicação, afirmou-se que é necessário desenvolver métodos e ferramentas — equipamento e programas informáticos — que assegurem o uso correto do lituano escrito e falado em documentos em papel e em meios eletrónicos. O orador colocou uma questão importante: como se comportará a população lituana, de alguns milhões de pessoas, para não desaparecer no oceano de mais de 7 mil milhões de pessoas que escrevem e falam, e das máquinas inteligentes que estão a chegar? O professor também apresentou uma resposta: para que isso não aconteça, é necessário desenvolver métodos e ferramentas — equipamento e programas informáticos — que assegurem o uso correto do lituano escrito e falado em documentos em papel e em meios eletrónicos e que harmonizem o uso das línguas lituana e outras, tanto escritas como faladas, em documentos em papel e em meios eletrónicos. É necessário criar transcritores que representem a língua escrita lituana por meio de caracteres de línguas não lituanas e que transcrevam os sons da fala de línguas não lituanas usando caracteres da língua falada lituana, adequados à síntese automática dos sons das palavras da fala lituana. Na primeira sessão, «Reconhecimento e síntese da fala», foram apresentados três trabalhos. No seu trabalho «Para além da prensa de Gutenberg: a fala lituana nas mais recentes tecnologias», Audrius Valotka (VU) e Gediminas Navickas (VU) falaram da fala lituana nas mais recentes tecnologias e apresentaram o projeto financiado pelos Fundos Estruturais Serviços controlados pela fala lituana – LIEPA (disponível na Internet: https://www.raštija.lt/liepa),), no âmbito do qual foi criado, entre outras coisas, um sintetizador e um reconhecedor da fala lituana. Durante a execução deste projeto, abriram-se as portas do espaço digital à fala lituana; por esse motivo, está planeado o projeto Expansão dos serviços controlados pela fala lituana – LIEPA 2. Os oradores falaram dos resultados do projeto LIEPA 2, que serão abertos e disponibilizados gratuitamente a todos os interessados, incentivando o uso da fala lituana em produtos de tecnologias da informação. O resultado mais importante do novo projeto será a possibilidade de, com uma voz natural Apžvalgos / Surveys 315 AURELIJA TAMULIONIENĖ comunicar-se com objetos (telefones celulares, tablets, relógios inteligentes, robôs), dar comandos por voz humana e compreender suas respostas. No âmbito do LIEPA 2, prevê-se criar serviços típicos que demonstrem novas possibilidades de utilização de serviços controlados por voz em lituano: um controlador de robô educativo, um serviço de chamadas, um serviço de chamada de táxi, um sintetizador móvel para pessoas cegas, um leitor de notícias da internet e um comunicador entre línguas. Laimutis Telksnys (VU) e Gediminas Navickas (VU), na comunicação «Serviços controlados por voz em lituano: situação e perspetivas», falaram sobre a situação e as perspetivas dos serviços controlados por voz em lituano, bem como sobre os trabalhos sistemáticos de criação desses serviços e de expansão da sua utilização. Os trabalhos são realizados reunindo os conhecimentos de especialistas em tecnologias da informação e de filólogos da língua lituana, assim como recursos de engenharia. Na primeira fase dos trabalhos, foram criados sete serviços controlados por voz em lituano e uma infraestrutura que garante o funcionamento dos serviços desenvolvidos. No futuro, prevê-se criar novos serviços controlados por voz em lituano para ambientes eletrónicos móveis — telemóveis inteligentes, tablets, relógios inteligentes e robôs. Pius Kasparaitis (VU) e Gintaras Skeris (VU) falaram sobre o presente e as perspetivas da síntese de voz em lituano. Na comunicação «O presente e as perspetivas da síntese de voz em lituano», foram apresentados vários serviços de conversão de texto em voz — o sintetizador LIEPA, distribuído gratuitamente juntamente com os textos-fonte, o que permite também a outras pessoas encontrar novas aplicações para ele; por exemplo, já há gravações de voz junto a artigos nos sítios da internet: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt; o serviço de conversão de texto em voz RoboBraille permite converter automaticamente quaisquer documentos de texto em ficheiros de áudio; os anúncios transmitidos por voz sintética já são ouvidos na estação rodoviária de Vilkaviškis; assistentes virtuais já funcionam no sítio do Departamento de Migração, etc. Na segunda sessão, «Recursos digitais da língua lituana», foram apresentadas quatro comunicações. A primeira comunicação, «E. kalba — uma inovação na utilização de recursos linguísticos digitais», foi apresentada por Elena Jolanta Zabarskaitė (LKI), Deimantė Budriūnaitė (LKI) e Skirmantas Šermukšnis (NetCode). A comunicação apresentou em detalhe o novo projeto do Instituto da Língua Lituana, destinado a expandir a infraestrutura de informação dos recursos da língua lituana (LKIIS) (disponível na internet: www.lkiis.lt). A comunicação abordou sobretudo os serviços gerados pela infraestrutura do novo projeto do Instituto da Língua Lituana E. kalba: «Pesquisa na rede de palavras», «E. marketing», «E. conceitos» e «E. recomendações». Os autores apresentaram as funcionalidades desses serviços e os seus aspetos tecnológicos. As funcionalidades do projeto incluirão tecnologias inovadoras de inteligência artificial destinadas à análise das opiniões dos utilizadores; o serviço «E. conceitos» proporcionará pesquisa alargada e enriquecimento de conceitos mediante a integração de recursos linguísticos adicionais, como dicionários bilingues, 316 Acta Linguistica Lithuanica LXXVI Lietuvių kalbos padėtis skaitmeniniame amžiuje redes de palavras de outras línguas; será possível utilizar um assistente interativo de formação de palavras para selecionar rápida e comodamente os métodos adequados de formação de palavras, de acordo com o significado categorial e de grupo pretendido ou com os meios de formação de palavras. A comunicação apresentou também os principais resultados do projeto E. kalba e os benefícios previstos. Na sua comunicação «Possibilidades de pesquisa no Banco de dados de neologismos da língua lituana na internet», Rita Milunaitė (LKI) apresentou como revelar, para os utilizadores da língua, características dos neologismos que correspondam às mais diversas necessidades, recorrendo ao Banco de dados de neologismos da língua lituana (disponível na internet: http://naujažodžiai.lki.lt/)). Atualmente, é possível pesquisar por parâmetros como palavra de entrada, origem do neologismo, forma original, variantes ortográficas, área de utilização, etc. Os responsáveis pela base de dados também dispõem de uma pesquisa mais ampla, necessária para editar os dados segundo vários critérios. No âmbito do projeto LKIS, será criado um sistema alargado de pesquisa de informação. A oradora salientou que o Banco de dados de neologismos da língua lituana é um recurso digital flexível e aberto à expansão. Essa característica decorre, antes de mais, dos próprios dados — a camada lexical da língua lituana, que está em constante mudança e renovação —, bem como dos novos atributos de dados que se tornam disponíveis aos investigadores de neologismos e da evolução das necessidades dos utilizadores. Prevê-se integrar este recurso no LKIS (disponível na internet: http://lkis.lki.lt/)) e incluí-lo não só no sistema geral de pesquisa do conjunto de dados aí reunidos, mas também utilizá-lo na criação de redes de palavras. A comunicação demonstrou de forma clara a utilidade que este banco de dados pode ter tanto para especialistas em língua como para todos os utilizadores interessados em neologismos. Daiva Murmulaitė (LKI) deu continuidade ao tema dos neologismos com a comunicação «Perspetivas da investigação sobre a formação de neologismos (o caso do Banco de dados de neologismos da língua lituana)», na qual falou sobre a investigação da formação de neologismos e as suas perspetivas, bem como sobre o modo de estudar os fenómenos emergentes na formação de neologismos com recurso ao Banco de dados de neologismos da língua lituana. A oradora explicou que, já na fase inicial de criação desta base de dados, se tinham feito preparativos preliminares para a análise da formação de neologismos: os campos destinados a esse fim preveem indicar os tipos de derivados, as suas formas de formação, as categorias de formação (significados), palavras aparentadas, etc.; uma parte dos dados já foi reunida. No campo dos atributos especiais, alguns neologismos estão assinalados como ocasionais (por exemplo, varškėfobija, entre outros), autorais (por exemplo, demagogėja, entre outros) e resultantes de contaminação (por exemplo, murmanas, entre outros). A oradora salientou que, para uma análise exaustiva e de qualidade da formação de palavras, é também importante ter em conta alguns elementos cuja registação já estava prevista desde o início: a classe gramatical da palavra-base do derivado, as alterações na base de formação, as analogias, o papel da tradução na criação de um neologismo, as manifestações de formação atípica, etc. É importante criar um bom sistema de índices — abrangente, flexível, fácil de utilizar, completar e corrigir. Na comunicação «Estrutura da base de dados geoinformativa dos topónimos da Lituânia, relações com outras bases de dados onomásticas e orientações para o seu desenvolvimento», Laimutis Bilkis (LKI) Apžvalgos / Surveys 317 AURELIJA TAMULIONIENĖ apresentou a base de dados geoinformacional dos topónimos da Lituânia (disponível na internet: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). Pedimos que falasse sobre a estrutura desta base e as ligações com outras bases de dados onomásticos. O orador apresentou as áreas de pesquisa criadas na página de acesso público da base de dados: tipo de objeto, estatuto do objeto, atual dependência administrativo-territorial (município, freguesia, povoado), dependência administrativo-territorial entre guerras (distrito, município rural, povoado) e afluentes dos rios. Na base de dados, é possível pesquisar informações sobre topónimos segundo as seguintes características: nome, género, número, acentuação, modo de formação e origem, segundo a pertença da palavra-base a uma língua ou a um grupo lexical. A base permite encontrar topónimos autênticos registados no período entre guerras no território do povoado pretendido (aldeia, povoado com igreja, propriedade senhorial, vila ou quinta isolada) e ver a sua localização exata ou aproximada no mapa. Na apresentação, salientou-se que, ao integrar a base no sistema LKIS, foram criadas três tipos de ligações a outras bases de dados onomásticos: para outro topónimo de que o topónimo deriva, para um antropónimo existente na base de dados de apelidos lituanos, do qual o topónimo deriva, e para registos históricos desse topónimo existentes na Base de Dados de Topónimos Históricos. Atualmente, foram carregados e descritos (ou estão em descrição) cerca de 25 000 topónimos. À tarde, os oradores e participantes reuniram-se para a terceira sessão, «Linguística de corpus». A primeira comunicação, «Corpora anotados morfológica e sintaticamente da língua lituana», foi apresentada por ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU) e ANDRIUS UŽA (VDU). Falou-se de dois corpora anotados da língua lituana, preparados no Centro de Linguística Computacional da Universidade Vytautas Magnus (disponíveis na internet: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Os corpora anotados são recursos fundamentais, sem os quais é impossível desenvolver tecnologias da linguagem. Em geral, são utilizados para criar outros recursos e ferramentas de processamento da língua natural, em áreas como os sistemas de reconhecimento automático da fala, a tradução automática, entre outras. O corpus anotado morfologicamente MATAS foi compilado entre 2002 e 2014. É composto por 1,6 milhões de palavras provenientes de textos de vários estilos. O corpus foi preparado com base num corpus de 1 milhão de palavras, compilado em 2006, mediante a aplicação de modelos estatísticos. O corpus anotado sintaticamente ALKSNIS, preparado em 2016, constitui um padrão de referência para estudos e recursos posteriores. É composto por 2 355 frases (cerca de 30 mil palavras), retiradas de textos de vários estilos. A anotação do corpus baseia-se nos princípios da anotação morfológica e sintática automática e aplica um modelo de dependências sintáticas. O tema dos corpora foi desenvolvido na comunicação «Base de dados de expressões fixas da língua lituana» por uma numerosa equipa de investigadores da conferência: ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Instituto de Tecnologias Avançadas do Báltico) e JOLANTA KOVALSKAITĖ 318 Acta Linguistica Lithuanica LXXVI Lietuvių kalbos padėtis skaitmeniniame amžiuje (VDU), Tomas Krilavičius (Instituto de Tecnologias Avançadas do Báltico), Justina Mandravikaitė (Instituto de Tecnologias Avançadas do Báltico) e Laura Vilkaitė (Instituto de Tecnologias Avançadas do Báltico). A comunicação foi apresentada na conferência por Erika Rimkutė (VDU), que falou sobretudo da metodologia para estudar as expressões fixas da língua lituana escrita contemporânea e do dicionário de colocações da língua lituana, em preparação com base em corpora. O projeto Reconhecimento automático de expressões fixas da língua lituana (PASTOVU) (n.º LIP-027/2016) (ver http://mwe.lt/), visa desenvolver uma metodologia para estudar as expressões fixas da língua lituana escrita contemporânea e elaborar um dicionário de colocações da língua lituana baseado em corpus. No âmbito do projeto, foi compilado e é utilizado um corpus de Delfi.lt dos anos de 2014–2016, com 72 milhões de palavras. O dicionário de colocações será elaborado com base numa base de dados. Esta conterá várias informações sobre as expressões fixas: informações gramaticais e lexicais, frequência de uso, secção textual, exemplos de concordâncias, entre outras. As representantes da Universidade de Vilnius Gintarė Judžentytė (VU) e Vilma Zubaitienė (VU) também apresentaram estudos de corpora. Na comunicação «Estudos de frases académicas baseados em corpora: estrutura formal e semântica», abordaram-se a estrutura e a semântica das frases da linguagem académica, com base no Corpus de Trabalhos Escritos de Estudantes, atualmente em desenvolvimento na Universidade de Vilnius e que constitui um dos resultados previstos do projeto Estudos do fraseologia de trabalhos estudantis e repertório interativo de frases, apoiado pela Comissão Estatal da Língua Lituana. O projeto visa identificar uma lista de palavras importantes para a escrita académica, destacar as principais colocações e as suas expansões, bem como sequências de palavras recorrentes em várias partes do texto académico; discutir as suas relações com as funções retóricas dessas partes; e descrever os significados de palavras académicas como: objetivo, tarefa, métodos, conclusões, resultados; realizar, analisar, determinar, basear-se, entre outras, bem como o seu uso e semântica. Na última sessão, «Análise automatizada da estrutura da língua e dos textos», foram apresentadas quatro comunicações. A sessão começou com a comunicação de Danielius Račys (VU), «Tradução automática para a língua lituana», sobre a história recente da tradução automática, os seus progressos, os projetos desenvolvidos por diversas instituições e os novos avanços possibilitados pela utilização da tradução automática neuronal. O orador falou sobre a evolução e os progressos da tradução automática, hoje aplicada com eficácia também à língua lituana. Entre 2005 e 2007, a Universidade Vytautas Magnus realizou o projeto financiado pelos Fundos Estruturais da UE Ferramenta online de tradução de informação. O resultado foi um serviço público online de tradução do inglês para o lituano (disponível na internet: http://vertimas.vdu.lt/twsas/). Entre 2012 e 2014, a Universidade de Vilnius realizou o projeto financiado pela UE Desenvolvimento de um sistema de tradução automática inglês–lituano–inglês e francês–lituano–francês baseado em métodos estatísticos. O resultado foi um serviço público online de tradução (disponível na internet: https://www.versti.eu/). No entanto Apžvalgos / Surveys 319 AURELIJA TAMULIONIENĖ Até mesmo as melhores traduções automáticas precisam da intervenção de um tradutor. Então, será que as máquinas conseguem traduzir realmente bem? Os últimos anos prometem novos avanços com o uso da tradução automática neural. A Universidade de Vilnius prepara-se para começar, em 2018, a implementar uma nova geração de tradução automática neural para as línguas inglesa, lituana, polaca, francesa, russa e alemã. Foi celebrado o facto de os avanços mais recentes na tradução automática também beneficiarem a língua lituana. Na comunicação «A gramática da língua lituana no mundo do código aberto digital», Virginijus Dudkevičius (VU) falou sobre a criação de uma nova geração de morfologia computacional da língua lituana, a análise e a síntese morfológicas de palavras, a busca inteligente de informação textual, entre outros temas. Com o aparecimento dos computadores, tornou-se necessário que a gramática e a lexicografia clássicas «vestissem uma roupa nova» e passassem a integrar plenamente as novas tecnologias. Para isso, foi criada uma nova geração de morfologia computacional da língua lituana, com os seguintes objetivos: utilizar e criar apenas código aberto; somente os dados, e não a sua forma e interpretação, podem ter características específicas da língua lituana; todo o código de software deve ser universal e adequado a qualquer outra língua; aproveitar ao máximo as soluções que foram aplicadas com sucesso a outras línguas do mundo. A base para a sua elaboração foi Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) e os corpora (cerca de 1,5 mil milhões de palavras no total). Atualmente, cerca de 99% de um texto médio que surge na internet é «reconhecível», isto é, o analisador morfológico interpreta corretamente, em média, 99 de cada 100 palavras. Este método recém-criado de análise morfológica foi aplicado com sucesso no Sistema de Análise Sintático-Semântica da Universidade Vytautas Magnus (disponível na internet: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) e no Registo de Atos Jurídicos do Parlamento da República da Lituânia (disponível na internet: www.e-tar.lt). O tema da gramática digital foi continuado por Daiva Šveikauskienė (LKI) e Vytautas Šveikauskas (LKI). Na comunicação «A gramática digital da língua lituana», falaram sobre a gramática digital da língua lituana, cuja criação foi iniciada no Instituto da Língua Lituana e que também pode ser utilizada noutras áreas do processamento computacional da língua: análise gramatical, tradução direta de dados, entre outras. Foi apresentado um projeto que prevê a adesão ao sistema internacional DIGITAL GRAMMARS, que atualmente abrange 32 línguas. O principal objetivo da criação da gramática digital é utilizá-la em sistemas de tradução automática que recorrem a métodos não estatísticos. Isto é muito relevante para a língua lituana. Segundo dados de 2017 da Tildės, a qualidade das traduções do Google para lituano e do lituano é inferior até mesmo à das traduções para letão ou estónio. Por isso, é muito importante que a Lituânia desenvolva uma alternativa de tradução automática. Atualmente, foi preparada uma versão experimental da gramática digital, que abrange algumas palavras; ainda assim, já é possível ver que a qualidade da tradução é muito melhor, especialmente nas frases que refletem características específicas da língua lituana. Enquanto se utiliza a ordem das palavras do inglês, os métodos estatísticos também produzem traduções razoáveis 320 Acta Linguistica Lithuanica LXXVI Lietuvių kalbos padėtis skaitmeniniame amžiuje mas, se a frase tiver uma ordem de palavras não convencional, a tradução do Google não perde o sentido da frase. A gramática digital também pode ser utilizada noutras áreas do processamento computacional da língua: análise gramatical, tradução direta de dados, entre outras. A criação de gramáticas digitais é coordenada pelo professor Aarne Ranta, da Universidade de Gotemburgo (Suécia). A última comunicação da conferência, «Quem copiou de quem? Automatização e visualização da investigação da história das traduções da Bíblia», foi apresentada por Mindaugas Šinkūnas (LKI). A comunicação abordou a automatização e a visualização da investigação sobre a história das traduções da Bíblia. O orador apresentou os resultados da comparação de versículos bíblicos em diagramas claros e detalhados. A abundância de citações bíblicas nos antigos textos lituanos dificulta a investigação das relações entre elas. É necessária uma plataforma de dados prática que permita agrupar os versículos bíblicos segundo as características de interesse para o investigador. A avaliação da semelhança entre citações é a principal dificuldade. Uma análise integrada do léxico, da sintaxe e da morfologia (e, em certos casos, também da ortografia) permite fazê-lo, mas esta investigação filológica é lenta e, atualmente, não é possível automatizá-la. A comparação foi automatizada com algoritmos iterativos cuja tarefa é detetar sequências idênticas em duas sequências de caracteres e calcular que parte das sequências comparadas estas abrangem. A ortografia ambígua dos textos antigos dificulta a automatização da comparação. A avaliação de versículos transliterados manual e automaticamente revelou que o método de transliteração não tem influência significativa nos resultados. Os resultados podem ser contestáveis ao comparar textos escritos em dialetos diferentes (não foi testada a nivelização das características dialetais). Os resultados de semelhança obtidos são resumidos em diagramas bidimensionais. Os resultados da comparação computacional de versículos bíblicos da Postilės (1591) de Bretkūnas correspondem às conclusões alcançadas por investigadores anteriores através de outros métodos. A conferência terminou com debates. Os artigos elaborados com base nas comunicações da conferência serão publicados nas revistas científicas Bendrinė kalba (disponível na internet: www.bendrinekalba.lt) e Lietuvių kalba (www.lietuviukalba.lt). LITERATŪRA Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155. Įteikta 2017 m. lapkričio 3 d. AURELIJA TAMULIONIENĖ Lietuvių kalbos institutas Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] Apžvalgos / Surveys 321