scieee.
LT original EN DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

AURELIJA TAMULIONIENĖ

Institut de langue lituanienne

Axes de recherche: études sur l’usage actuel du lituanien et sa variation.

LA PLACE DE LA LANGUE LITUANIENNE À L’ÈRE NUMÉRIQUE

À propos de la 24e conférence Jono Jablonskio

Orientations pour le développement des ressources linguistiques numériques et possibilités de leur exploitation

Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinka­mas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).

La conférence scientifique portant le nom de Jonas Jablonskis a été organisée pour la première fois en 1993 par la section de culture linguistique de l’Institut de langue lituanienne et le département de langue lituanienne de l’Université de Vilnius. Depuis lors, les conférences sont devenues une tradition et se tiennent chaque automne (depuis 2003, alternativement à l’Institut de langue lituanienne ou à l’Université de Vilnius).

Le 29 septembre 2017 s’est tenue la 24e conférence scientifique Jono Jablonskio Orientations pour le développement des ressources linguistiques numériques et possibilités de leur exploitation (en anglais: Digital Language Resources, Directions of Their Development and Possibilities to Harness Them), organisée à l’Institut de langue lituanienne. La conférence a été organisée par le Centre de recherche sur la langue standard de l’Institut de langue lituanienne, en collaboration avec l’Institut de linguistique appliquée de l’Université de Vilnius. Par sa thématique, cette conférence se distinguait des précédentes; son objectif était d’aborder les problèmes qui se posent à l’intersection des langues et des technologies numériques, auxquels on est confronté dans le développement des ressources numériques et la création d’un marché numérique unique. La conférence s’est intéressée au niveau sémantique des ressources numériques (la création de réseaux de mots), ainsi qu’à l’ajout d’une forme sonore aux ressources numériques, à la création de nouvelles possibilités de diffusion des ressources numériques au sein de communautés multilingues, etc.

Des intervenants venus de l’étranger ont participé à la conférence: du Parlement européen, d’Espagne, ainsi que des chercheurs issus de différentes institutions lituaniennes: l’Institut de langue lituanienne, l’Université de Vilnius

Straipsniai / Articles

313

AURELIJA TAMULIONIENĖ

de l’Université, de l’Université Vytautas Magnus et de l’Institut des technologies avancées de la Baltique, ainsi que de la société UAB « Netcode ». Dix-sept communications ont été présentées lors de la conférence. Les intervenants ont présenté leurs communications et partagé leurs recherches et leur expérience au cours de quatre sessions.

La conférence a débuté par des allocutions d’ouverture. Algirdas Saudargas, député au Parlement européen, et la professeure Jolanta Elena Zabarskaitė, directrice de l’Institut de langue lituanienne, ont souhaité la bienvenue aux participants et aux intervenants. Rita Miliūnaitė, docteure et chercheuse principale au Centre de recherche sur la langue standard de l’Institut de langue lituanienne, a prononcé le discours d’ouverture. Il a été souligné que les liens entre la langue lituanienne et les technologies de l’information se sont considérablement renforcés ces dernières années et que nous avons obtenu des résultats concrets, aussi bien dans la numérisation des ressources linguistiques que dans la création d’outils d’analyse, de reconnaissance et de synthèse de la langue. Toutefois, au regard de la rapidité des transformations mondiales dans ce domaine, la langue lituanienne a encore beaucoup de retard à rattraper. Comme le lituanien est une langue flexionnelle, nous ne pouvons pas l’adapter directement aux technologies de l’information créées pour l’anglais. Nos outils actuels de traduction automatique et autres outils informatiques sont donc encore très imparfaits, tandis que le monde poursuit déjà ses recherches, s’oriente vers le développement de l’intelligence artificielle, donne une forme concrète aux objets et pénètre dans des couches toujours plus profondes de la langue.

Lors de la séance plénière, la première communication, intitulée « La langue vivante dans l’esprit artificiel », a été présentée par Algirdas Saudargas, député au Parlement européen. L’intervenant a soulevé une question fondamentale à laquelle chaque communauté linguistique doit répondre: dans quelle mesure doit-elle développer elle-même les ressources et les technologies de sa langue maternelle, et que peut-elle acquérir déjà prêt sur la base d’autres langues? La communication a formulé des constats préoccupants: le lituanien, comme les langues de certains autres petits pays, « bénéficie de peu, voire d’aucun soutien technologique ». Les technologies linguistiques ne reçoivent pas l’attention nécessaire dans les programmes politiques, que ce soit en Lituanie ou en Europe. La communication a également présenté des analyses montrant que le développement de l’intelligence artificielle converge vers une forme hybride, dans laquelle les réseaux neuronaux correspondent aux mécanismes inconscients du cerveau, tandis que la pensée consciente est influencée et modélisée par l’intelligence artificielle traditionnelle, dite symbolique. Chaque communauté linguistique doit veiller à ce que les technologies linguistiques correspondant à l’intelligence artificielle symbolique reflètent de manière complète et précise toute la structure de sa langue maternelle, et à ce qu’un environnement riche dans cette langue (et dans la culture d’origine) soit créé pour les réseaux neuronaux.

La deuxième communication plénière, intitulée « Language equality in the digital age: towards a human language project », a été présentée en anglais par Rafael Rivera, directeur du cabinet de conseil « Claves ». Elle a présenté en détail l’étude du Service de recherche du Parlement européen sur les perspectives scientifiques et technologiques, intitulée « L’égalité des langues à l’ère numérique. Le projet sur les langues humaines » (l’étude est consultable en anglais en ligne: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf). La communication a passé en revue la situation actuelle des technologies des langues humaines, en quantifiant

314

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

les conséquences économiques, sociales et linguistiques de la langue à l’ère numérique, et a examiné la politique de l’Union européenne en matière de technologies de l’information et de la communication. À l’ère numérique, les technologies linguistiques représentent un défi majeur pour les pays comptant peu de locuteurs. Des technologies linguistiques insuffisamment développées créent des disparités et des obstacles. Cela a des conséquences sur les services transfrontaliers, la mobilité des travailleurs et le commerce. Ces obstacles sont dus à une recherche insuffisamment coordonnée et à un financement inadéquat. L’intervenant a souligné que les technologies linguistiques ne bénéficient pas de l’attention qu’elles devraient recevoir de la part des responsables politiques européens. À partir de l’analyse de la situation actuelle, une initiative est en cours d’élaboration afin d’unifier les politiques des institutions, de la recherche, de l’industrie, du marché et des services publics.

La dernière communication de la séance plénière, intitulée « La langue lituanienne écrite et parlée dans les environnements traditionnels et électroniques », a été présentée par Laimutis Telksnys, professeur à l’Institut de mathématiques et d’informatique de l’Université de Vilnius. Il a été question de la nécessité de mettre au point des méthodes et des outils — matériels et logiciels — garantissant l’usage correct du lituanien écrit et parlé dans les documents papier et dans les environnements électroniques. L’intervenant a posé une question importante: que feront les quelque deux millions de Lituaniens pour ne pas disparaître dans l’océan de plus de sept milliards de personnes qui écrivent et parlent, ainsi que des machines intelligentes à venir? Le professeur a également apporté une réponse: pour éviter cela, il faut mettre au point des méthodes et des outils — matériels et logiciels — qui garantissent l’usage correct du lituanien écrit et parlé dans les documents papier et dans les environnements électroniques, et harmonisent l’usage du lituanien et des autres langues écrites et parlées dans ces mêmes contextes. Il faut créer des transcripteurs permettant de représenter la langue écrite lituanienne au moyen de signes d’écriture non lituaniens, et de transcrire les sons des langues parlées autres que le lituanien au moyen de signes de la langue parlée lituanienne, adaptés à la synthèse automatique des sons de la parole lituanienne.

Lors de la première session, « Reconnaissance et synthèse de la parole », trois communications ont été présentées.

Dans leur communication intitulée « Au-delà de la presse de Gutenberg: le lituanien parlé dans les technologies les plus récentes », Audrius Valotka (VU) et Gediminas Navickas (VU) ont abordé la place du lituanien parlé dans les technologies les plus récentes et présenté le projet financé par les Fonds structurels Services commandés par la parole lituanienne – LIEPA (accessible en ligne: https://www.raštija.lt/liepa),), dans le cadre duquel ont notamment été créés un synthétiseur et un système de reconnaissance de la parole lituanienne. La mise en œuvre de ce projet a ouvert les portes de l’espace numérique à la parole lituanienne; c’est pourquoi un nouveau projet est prévu: Développement des services commandés par la parole lituanienne – LIEPA 2. Les intervenants ont parlé des résultats du projet LIEPA 2, qui seront accessibles gratuitement à tous ceux qui le souhaitent et encourageront l’utilisation de la parole lituanienne dans les produits des technologies de l’information. Le résultat le plus important du nouveau projet sera la possibilité, naturellement

Apžvalgos / Surveys

315

AURELIJA TAMULIONIENĖ

communiquer avec des objets (téléphones portables, tablettes, montres intelligentes, robots), leur donner des ordres à la voix et comprendre leurs réponses. Le projet LIEPA 2 prévoit de créer des services types illustrant de nouvelles possibilités d’utilisation des services commandés par la voix en lituanien: le contrôleur d’un robot éducatif, un composeur, un service d’appel de taxi, un synthétiseur mobile pour les personnes aveugles, un lecteur d’actualités en ligne et un communicateur interlinguistique.

Laimutis Telksnys (VU) et Gediminas Navickas (VU) ont évoqué, dans leur communication « Les services commandés par la voix en lituanien. Situation. Perspectives », la situation et les perspectives des services commandés par la voix en lituanien, ainsi que les travaux systématiques de création de ces services et de développement de leurs applications. Ces travaux sont menés en réunissant les connaissances de spécialistes des technologies de l’information et de philologues de langue lituanienne, ainsi que des compétences en ingénierie. Lors de la première étape, sept services commandés par la voix en lituanien ont été créés, ainsi qu’une infrastructure garantissant leur fonctionnement. À l’avenir, il est prévu de créer de nouveaux services commandés par la voix en lituanien pour les environnements électroniques mobiles – téléphones intelligents, tablettes, montres intelligentes et robots.

Pius Kasparaitis (VU) et Gintaras Skeris (VU) ont parlé de la situation actuelle et des perspectives de la synthèse vocale en lituanien. Dans la communication « Situation actuelle et perspectives de la synthèse vocale en lituanien », ils ont présenté divers services de vocalisation de textes – le synthétiseur LIEPA, distribué librement avec ses textes sources, ce qui permet à d’autres personnes de lui trouver de nouvelles applications. Par exemple, les sites Web suivants proposent déjà des enregistrements vocaux associés à de courts articles: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt; le service de vocalisation de textes RoboBraille permet de convertir automatiquement tout document textuel en fichier audio; les annonces diffusées par voix synthétique sont désormais entendues à la gare routière de Vilkaviškis; des assistants virtuels sont déjà en service sur le site Web du Département des migrations, etc.

Lors de la deuxième séance, intitulée « Ressources numériques de la langue lituanienne », quatre communications ont été présentées.

La première communication, « E. kalba – une innovation dans l’utilisation des ressources linguistiques numériques », a été présentée par Elena Jolanta Zabarskaitė (LKI), Deimantė Budriūnaitė (LKI) et Skirmantas Šermukšnis (NetCode). Elle présentait en détail le nouveau projet de l’Institut de langue lituanienne, destiné à développer l’infrastructure informationnelle des ressources de la langue lituanienne (LKIIS) (accessible en ligne: www.lkiis.lt). La communication portait principalement sur les services générés par l’infrastructure du nouveau projet de l’Institut de langue lituanienne, E. kalba: « Recherche dans le réseau de mots », « E. marketing », « E. concepts » et « E. conseils ». Les intervenants ont présenté les fonctionnalités de ces services et leurs aspects technologiques. Les fonctionnalités du projet intégreront des technologies innovantes d’intelligence artificielle destinées à l’analyse des opinions des utilisateurs; le service « E. concepts » assurera une recherche étendue et l’enrichissement des concepts grâce à l’intégration de ressources linguistiques supplémentaires, telles que des dictionnaires bilingues,

316

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

des réseaux lexicaux d’autres langues. Un assistant interactif à la dérivation des mots permettra de choisir rapidement et facilement les procédés de formation lexicale appropriés, en fonction du sens catégoriel et du groupe souhaités ou des moyens de dérivation. La communication a également présenté les principaux résultats du projet E. kalba et les bénéfices attendus.

Dans sa communication « Possibilités de recherche dans la base de données des néologismes de la langue lituanienne en ligne », Rita Milunaitė (LKI) a montré comment répondre aux besoins variés des usagers de la langue en leur permettant d’explorer la base de données des néologismes de la langue lituanienne (accessible en ligne: http://naujažodžiai.lki.lt/) les caractéristiques des néologismes. Il est actuellement possible d’effectuer des recherches selon plusieurs paramètres: le mot vedette, l’origine du néologisme, sa forme originale, ses variantes orthographiques, son domaine d’emploi, etc. Les gestionnaires de la base de données disposent également d’une recherche plus étendue, nécessaire pour modifier les données selon différentes perspectives. Dans le cadre du projet LKIS, un système étendu de recherche d’informations sera créé. L’intervenante a souligné que la base de données des néologismes de la langue lituanienne est une ressource numérique flexible et ouverte au développement. Cette caractéristique tient avant tout à la nature même des données: la couche lexicale de la langue lituanienne, en constante évolution et renouvellement, ainsi qu’aux nouveaux attributs qui s’offrent aux chercheurs en néologie et à l’évolution des besoins des utilisateurs. Il est prévu d’intégrer cette ressource au LKIS (accessible en ligne: http://lkis.lki.lt/) et de l’inclure non seulement dans le système général de recherche au sein de ce fonds de données, mais aussi de l’utiliser pour créer des réseaux lexicaux. La communication a illustré de manière concrète l’utilité de cette base de données aussi bien pour les spécialistes de la langue que pour tous les utilisateurs intéressés par les néologismes.

Daiva Murmulaitė (LKI) a poursuivi le thème des néologismes avec sa communication « Perspectives de la recherche sur la formation des néologismes (le cas de la base de données des néologismes de la langue lituanienne) ». Elle a parlé des recherches sur la formation des néologismes et de leurs perspectives, ainsi que de la manière d’étudier les phénomènes émergents de formation lexicale au moyen de la base de données des néologismes de la langue lituanienne. L’intervenante a indiqué que, dès la phase initiale de création de cette base de données, les préparatifs préliminaires de l’analyse de la formation des néologismes avaient également été entrepris: les champs correspondants doivent préciser les types de formations, leurs formes, les catégories de dérivation (sens), les mots apparentés, etc.; une partie des données a déjà été recueillie. Dans le champ consacré aux caractéristiques particulières, certains néologismes sont signalés comme isolés (par exemple, varškėfobija, etc.), créations d’auteur (par exemple, demagogėja, etc.) ou mots-valises (par exemple, murmanas, etc.). L’intervenante a souligné qu’une analyse approfondie et de qualité de la formation des mots exige également de prendre en compte certains éléments dont l’enregistrement avait été prévu dès le départ: la catégorie grammaticale du mot de base, les modifications apportées à la base de dérivation, les analogies, le rôle de la traduction dans la création d’un néologisme, les manifestations de formations atypiques, etc. Il est important de créer un bon système d’indexation – détaillé, flexible et facile à utiliser, à enrichir et à corriger.

Dans sa communication intitulée « Structure de la base de données géoinformationnelle des noms de lieux de Lituanie, liens avec d’autres bases de données onomastiques et orientations de son développement », Laimutis Bilkis (LKI)

Apžvalgos / Surveys

317

AURELIJA TAMULIONIENĖ

a présenté la base de données géoinformationnelle des toponymes de Lituanie (accessible en ligne: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). Nous avons demandé à l’intervenant de parler de la structure de cette base et de ses liens avec d’autres bases de données onomastiques. L’intervenant a présenté les champs de recherche disponibles sur la page d’accès public de la base: type d’objet, statut de l’objet, rattachement administratif et territorial actuel (municipalité, circonscription, localité), rattachement administratif et territorial de l’entre-deux-guerres (comté, canton, localité), affluents des cours d’eau. La base permet de rechercher des informations sur les toponymes selon les caractéristiques suivantes: nom, genre, nombre, accentuation, mode de formation, origine selon l’appartenance linguistique du mot de base et origine selon son appartenance à un groupe lexical. Il est possible de retrouver dans la base les toponymes authentiques relevés pendant l’entre-deux-guerres sur le territoire d’une localité donnée (village, village doté d’une église, domaine, bourg ou ferme isolée) et de voir leur emplacement exact ou approximatif sur une carte. L’exposé a souligné que, lors de l’intégration de la base au système LKIS, trois types de liens vers d’autres bases onomastiques avaient été créés: vers un autre toponyme dont le toponyme est dérivé, vers un nom de personne figurant dans la base de données des noms de famille lituaniens dont le toponyme est dérivé, et vers les attestations historiques de ce toponyme figurant dans la base de données des toponymes historiques. À ce jour, environ 25 000 toponymes ont été ajoutés à la base et décrits (ou sont en cours de description).

Après le déjeuner, les intervenants et les participants se sont réunis pour la troisième séance, intitulée « Linguistique de corpus ».

La première communication, intitulée « Corpus annotés morphologiquement et syntaxiquement du lituanien », a été présentée par ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU) et ANDRIUS UŽA (VDU). Elle portait sur deux corpus annotés du lituanien, élaborés au Centre de linguistique informatique de l’Université Vytautas Magnus (corpus accessibles en ligne: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Les corpus annotés sont des ressources essentielles, indispensables au développement des technologies linguistiques. Ils servent généralement à créer d’autres ressources et outils de traitement automatique du langage naturel dans des domaines tels que la reconnaissance automatique de la parole, la traduction automatique, etc. Le corpus annoté morphologiquement MATAS a été constitué entre 2002 et 2014. Il comprend 1,6 million de mots tirés de textes de différents styles. Il a été élaboré à partir d’un corpus d’un million de mots créé en 2006, au moyen de modèles statistiques. Le corpus annoté syntaxiquement ALKSNIS, conçu comme un étalon de référence pour les recherches et les ressources ultérieures, a été élaboré en 2016. Il comprend 2 355 phrases (environ 30 000 mots) tirées de textes de différents styles. Son annotation repose sur les principes de l’annotation morphologique et syntaxique automatique et utilise un modèle de dépendances syntaxiques.

Le thème des corpus a été poursuivi dans la communication « Base de données des expressions figées du lituanien », présentée par la nombreuse équipe composée de ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Institut des technologies avancées de la Baltique), JOLANTA KOVALSKAITĖ

318

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

(VDU), Tomas Krilavičius (Institut des technologies avancées de la Baltique), Justina Mandravikaitė (Institut des technologies avancées de la Baltique) et Laura Vilkaitė (Institut des technologies avancées de la Baltique). La communication a été présentée lors de la conférence par Erika Rimkutė (VDU), qui a surtout parlé de la méthodologie d’étude des expressions figées du lituanien écrit contemporain et du dictionnaire de collocations lituaniennes en cours d’élaboration, fondé sur des corpus. Dans le cadre du projet Reconnaissance automatique des expressions figées du lituanien (PASTOVU) (n° LIP-027/2016) (voir http://mwe.lt/),), il s’agit de créer une méthodologie d’étude des expressions figées du lituanien écrit contemporain et d’élaborer un dictionnaire de collocations lituaniennes fondé sur un corpus. Le projet a constitué et utilise un corpus de Delfi.lt de 2014 à 2016, comptant 72 millions de mots. Le dictionnaire de collocations sera élaboré à partir d’une base de données contenant diverses informations sur les expressions figées: informations grammaticales et lexicales, fréquence d’emploi, rubrique textuelle, exemples de concordance, etc.

Les recherches sur les corpus ont également été présentées par les représentantes de l’Université de Vilnius, Gintarė Judžentytė (VU) et Vilma Zubaitienė (VU). La communication « Études des expressions académiques fondées sur des corpus: structure formelle et sémantique » portait sur la structure et la sémantique des expressions de la langue académique, à partir du Corpus des travaux écrits des étudiants, actuellement élaboré à l’Université de Vilnius et comptant parmi les résultats attendus du projet soutenu par la Commission nationale de la langue lituanienne Études des phrasèmes des travaux étudiants et répertoire interactif des expressions. Le projet vise à établir une liste de mots importants pour l’écriture académique, à distinguer les principales collocations et leurs expansions ainsi que les séquences récurrentes dans diverses parties des textes universitaires, à examiner leurs liens avec les fonctions rhétoriques de ces parties et à décrire le sens et l’emploi de mots académiques tels que: objectif, tâche, méthodes, conclusions, résultats; effectuer, analyser, établir, se fonder sur, etc.

Lors de la dernière séance, intitulée « Analyse automatisée de la structure de la langue et des textes », quatre communications ont été présentées.

La séance a débuté par la communication de Danielius Račys (VU), intitulée « La traduction automatique pour le lituanien », qui portait sur l’histoire récente de la traduction automatique, ses réalisations, les projets menés par différentes institutions ainsi que les nouvelles avancées permises par la traduction automatique neuronale. L’intervenant a évoqué l’évolution et les progrès de la traduction automatique, aujourd’hui appliqués avec succès au lituanien. De 2005 à 2007, l’Université Vytautas Magnus a mené le projet financé par les fonds structurels de l’UE Outil en ligne de traduction de l’information. Il en a résulté un service public de traduction en ligne de l’anglais vers le lituanien (accessible en ligne: http://vertimas.vdu.lt/twsas/).). De 2012 à 2014, l’Université de Vilnius a mené le projet financé par l’UE Création d’un système de traduction automatique anglais-lituanien-anglais et français-lituanien-français fondé sur des méthodes statistiques. Il en a résulté un service public de traduction en ligne (accessible en ligne: https://www.versti.eu/).). Toutefois

Apžvalgos / Surveys

319

AURELIJA TAMULIONIENĖ

Même les meilleurs systèmes de traduction automatique nécessitent l’intervention d’un traducteur. Les machines peuvent-elles donc traduire vraiment bien? Ces dernières années laissent entrevoir de nouvelles percées grâce à la traduction automatique neuronale. L’Université de Vilnius prévoit de lancer en 2018 la mise en œuvre d’une nouvelle génération de traduction automatique neuronale pour l’anglais, le lituanien, le polonais, le français, le russe et l’allemand. Il est réjouissant de constater que les dernières avancées de la traduction automatique n’épargnent pas non plus la langue lituanienne.

Dans son intervention intitulée « La grammaire lituanienne dans le monde des logiciels libres de nouvelle génération », Virginijus Dudkevičius (VU) a parlé de la création d’une morphologie informatique de nouvelle génération pour le lituanien, de l’analyse et de la synthèse morphologiques des mots, de la recherche intelligente d’informations textuelles, etc. Avec l’apparition des ordinateurs, la grammaire et le lexique classiques ont dû « revêtir un nouvel habit » et devenir une composante à part entière des nouvelles technologies. C’est dans ce but qu’a été créée une morphologie informatique de nouvelle génération pour le lituanien, avec les objectifs suivants: utiliser et créer uniquement des logiciels libres; seules les données, et non leur forme ou leur interprétation, peuvent présenter des caractéristiques propres au lituanien; tout le code logiciel doit être universel et convenir à toute autre langue; tirer le meilleur parti des solutions appliquées avec succès à d’autres langues du monde. Le fondement en est Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) et des corpus (environ 1,5 milliard de mots au total). En moyenne, environ 99% du texte actuellement publié sur Internet est « reconnaissable »: autrement dit, l’analyseur morphologique interprète correctement 99 mots sur 100. Cette nouvelle méthode d’analyse morphologique a été appliquée avec succès dans le système d’analyse syntaxico-sémantique de l’Université Vytautas Magnus (accessible en ligne: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) et dans le Registre des actes juridiques de la République de Lituanie (accessible en ligne: www.e-tar.lt).

Daiva Šveikauskienė (LKI) et Vytautas Šveikauskas (LKI) ont poursuivi la réflexion sur la grammaire numérique. Dans leur intervention intitulée « La grammaire numérique de la langue lituanienne », ils ont présenté la grammaire numérique du lituanien dont la création a été lancée à l’Institut de la langue lituanienne et qui peut également être utilisée dans d’autres domaines du traitement informatique des langues, notamment l’analyse grammaticale et la traduction directe de données. Le projet présenté prévoit de rejoindre le système international DIGITAL GRAMMARS, qui couvre actuellement 32 langues. L’objectif principal de la création de cette grammaire numérique est son utilisation dans des systèmes de traduction automatique reposant sur des méthodes non statistiques. C’est un enjeu particulièrement important pour le lituanien. Selon les données de 2017 de Tildės, la qualité des traductions de Google vers le lituanien et depuis le lituanien est même inférieure à celle des traductions vers le letton ou l’estonien et depuis ces langues. Il est donc très important pour la Lituanie de créer une solution alternative de traduction automatique. Un exemple pilote de grammaire numérique a été préparé; il ne couvre que quelques mots, mais montre déjà que la qualité de la traduction est bien meilleure, en particulier pour les phrases qui reflètent des caractéristiques propres au lituanien. Tant que l’ordre des mots de l’anglais est utilisé, les méthodes statistiques fournissent également des traductions assez bonnes

320

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

; toutefois, si l’ordre des mots dans la phrase est inhabituel, la traduction de Google ne perd pas le sens de la phrase. La grammaire numérique peut également être utilisée dans d’autres domaines du traitement informatique des langues, notamment l’analyse grammaticale et la traduction directe de données. La création de grammaires numériques est dirigée par Aarne Ranta, professeur à l’Université de Göteborg (Suède).

La dernière intervention de la conférence, intitulée « Qui a copié sur qui? Automatisation et visualisation de l’étude de l’histoire des traductions de la Bible », a été présentée par Mindaugas Šinkūnas (LKI). Elle portait sur l’automatisation et la visualisation de l’étude de l’histoire des traductions de la Bible. L’intervenant a présenté les résultats de la comparaison des versets bibliques sous forme de diagrammes clairs et détaillés. L’abondance de citations bibliques dans les anciens écrits lituaniens complique l’étude de leurs liens. Une plateforme de données pratique est nécessaire pour permettre de regrouper les versets bibliques selon les caractéristiques qui intéressent les chercheurs. L’évaluation de la similarité des citations constitue la principale difficulté. Une analyse combinée du lexique, de la syntaxe et de la morphologie — et, dans certains cas, de l’orthographe — permet de l’effectuer, mais cette étude philologique est lente et ne peut actuellement pas être automatisée. La comparaison a pu être automatisée à l’aide d’algorithmes fonctionnant par cycles, dont le rôle est de détecter les séquences identiques dans deux chaînes de caractères et de calculer la proportion de chacune des séquences comparées qu’elles couvrent. L’orthographe variable des anciens écrits entrave l’automatisation de la comparaison. L’évaluation de versets translittérés manuellement et automatiquement a montré que la méthode de translittération n’a pas d’influence déterminante sur les résultats. Les résultats peuvent être contestables lors de la comparaison de textes écrits dans différents dialectes (la normalisation des caractéristiques dialectales n’a pas été testée). Les résultats de similarité obtenus sont synthétisés dans des diagrammes bidimensionnels. Les résultats de la comparaison des versets bibliques de la Postilės (1591) de Bretkūnas, obtenus par analyse informatique, concordent avec les conclusions auxquelles étaient parvenus des chercheurs antérieurs au moyen d’autres méthodes.

La conférence s’est achevée par des discussions. Les articles rédigés à partir des communications de la conférence seront publiés dans les revues scientifiques Bendrinė kalba (accessible en ligne: www.bendrinekalba.lt) et Lietuvių kalba (www.lietuviukalba.lt).

LITERATŪRA

Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.

Įteikta 2017 m. lapkričio 3 d.

AURELIJA TAMULIONIENĖ

Lietuvių kalbos institutas

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva

[email protected]

Apžvalgos / Surveys

321