scieee.
LT original EN DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

AURELIJA TAMULIONIENĖ

Instituut voor de Litouwse Taal

Onderzoeksgebieden: onderzoek naar het gebruik en de variatie van het hedendaagse Litouws.

DE POSITIE VAN HET LITOUWS IN HET DIGITALE TIJDPERK

Over de 24e Jono Jablonskio-conferentie

Ontwikkelingsrichtingen en toepassingsmogelijkheden van digitale taalbronnen

Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinka­mas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).

De wetenschappelijke conferentie, genoemd naar Jono Jablonskis, werd voor het eerst gehouden in 1993, georganiseerd door de afdeling Taalcultuur van het Instituut voor de Litouwse Taal en de leerstoel Litouwse Taal van de Universiteit van Vilnius. Sindsdien is de conferentie een traditie geworden en vindt zij elke herfst plaats (sinds 2003 afwisselend in het Instituut voor de Litouwse Taal of aan de Universiteit van Vilnius).

Op 29 september 2017 vond de 24e wetenschappelijke Jono Jablonskio-conferentie Ontwikkelingsrichtingen en toepassingsmogelijkheden van digitale taalbronnen (Eng. Digital Language Resources, Directions of Their Development and Possibilities to Harness Them) plaats bij het Instituut voor de Litouwse Taal. De conferentie werd georganiseerd door het Centrum voor Onderzoek naar de Standaardtaal van het Instituut voor de Litouwse Taal, in samenwerking met het Instituut voor Toegepaste Taalkunde van de Universiteit van Vilnius. Deze conferentie onderscheidde zich qua thematiek van eerdere conferenties; het doel was problemen te bespreken die ontstaan op het snijvlak van talen en digitale technologieën, en waarmee men te maken krijgt bij de ontwikkeling van digitale bronnen en de totstandbrenging van een gemeenschappelijke digitale markt. De conferentie richtte zich op het semantische niveau van digitale bronnen (het creëren van woordnetwerken), op het toevoegen van een gesproken vorm aan digitale bronnen, op het ontwikkelen van nieuwe mogelijkheden om digitale bronnen te verspreiden in meertalige gemeenschappen, enzovoort.

Aan de conferentie namen sprekers uit het buitenland deel: uit het Europees Parlement en uit Spanje, evenals onderzoekers van verschillende Litouwse instellingen: het Instituut voor de Litouwse Taal, de Universiteit van Vilnius

Straipsniai / Articles

313

AURELIJA TAMULIONIENĖ

universiteit, Vytautas Magnus Universiteit en het Baltische Instituut voor Geavanceerde Technologieën, UAB „Netcode“. Tijdens de conferentie werden 17 voordrachten gehouden. De sprekers presenteerden hun voordrachten en deelden hun onderzoek en ervaringen in vier sessies.

De conferentie begon met openingsredes. Europarlementariër Algirdas Saudargas en prof. dr. Jolanta Elena Zabarskaitė, directeur van het Instituut voor de Litouwse Taal, verwelkomden de aanwezige deelnemers en sprekers. De openingsrede werd uitgesproken door dr. Rita Miliūnaitė, senior onderzoeker bij het Centrum voor Onderzoek naar de Standaardtaal van het Instituut voor de Litouwse Taal. Er werd gesproken over het feit dat de verbanden tussen de Litouwse taal en informatietechnologie de afgelopen jaren aanzienlijk zijn versterkt. We hebben tastbare resultaten geboekt, zowel bij het digitaliseren van taalbronnen als bij het ontwikkelen van instrumenten voor taalanalyse, -herkenning en -synthese, maar vergeleken met de snelle veranderingen in de wereld op dit gebied moet de Litouwse taal nog veel inhalen. Omdat het Litouws een flecterende taal is, kunnen we informatietechnologie die voor het Engels is ontwikkeld niet rechtstreeks toepassen. Daarom zijn onze huidige machinevertaling en andere computerhulpmiddelen nog zeer gebrekkig, terwijl de wereld het onderzoek al verder voert in de richting van de ontwikkeling van kunstmatige intelligentie, die voorwerpen tot leven brengt en steeds dieper doordringt in de lagen van de taal.

Tijdens de plenaire sessie hield Europarlementariër Algirdas Saudargas de eerste voordracht, „De levende taal in een kunstmatig brein”. De spreker stelde een fundamentele vraag waarop elke taalgemeenschap een antwoord moet geven: in welke mate moet zij zelf bronnen en technologieën voor haar moedertaal ontwikkelen, en wat kan kant-en-klaar worden aangeschaft op basis van andere talen? In de voordracht werden zorgwekkende gedachten geuit: dat het Litouws, samen met de talen van enkele andere kleine landen, „weinig of helemaal geen technologische steun heeft”. Taaltechnologie krijgt niet de nodige aandacht op de agenda van politici, noch in Litouwen, noch in Europa. De voordracht bevatte inzichten die erop wijzen dat de ontwikkeling van kunstmatige intelligentie convergeert naar een hybride vorm, waarin neurale netwerken overeenkomen met onbewuste hersenmechanismen en het bewuste denken wordt beïnvloed en gemodelleerd door traditionele, zogenoemde symbolische kunstmatige intelligentie. Elke taalgemeenschap moet ervoor zorgen dat taaltechnologieën die aansluiten bij symbolische kunstmatige intelligentie de volledige structuur van de moedertaal uitvoerig en nauwkeurig weerspiegelen, en dat er voor de neurale netwerken een rijke omgeving van de moedertaal (en de moedercultuur) wordt gecreëerd.

De tweede plenaire voordracht, „Language equality in the digital age: towards a human language project”, werd in het Engels gehouden door Rafael Rivera, directeur van adviesbureau „Claves”. De voordracht gaf een uitvoerige presentatie van de studie „Taalkundige gelijkheid in het digitale tijdperk. Een project voor de moedertaal” van de Onderzoeksdienst Wetenschappelijke Perspectieven van het Europees Parlement (de Engelstalige studie is online te raadplegen: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf).). De voordracht besprak de huidige stand van de technologieën voor de moedertaal en kwantificeerde

314

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

de economische, sociale en taalkundige gevolgen van taal in het digitale tijdperk; ook het beleid van de Europese Unie inzake informatie- en communicatietechnologieën kwam aan bod. In het digitale tijdperk vormen taaltechnologieën een grote uitdaging voor landen met weinig sprekers. Slecht ontwikkelde taaltechnologieën veroorzaken uitsluiting en belemmeringen. Dit beïnvloedt grensoverschrijdende diensten, de mobiliteit van werknemers en de handel. De oorzaak van zulke belemmeringen ligt in ongecoördineerd onderzoek en onvoldoende financiering. De spreker benadrukte dat taaltechnologieën niet de passende aandacht krijgen van Europese politici. Op basis van een analyse van de huidige situatie wordt een initiatief ontwikkeld dat het beleid van instellingen, onderzoek, industrie, markt en openbare diensten met elkaar zal verbinden.

De laatste voordracht van de plenaire sessie, „Geschreven en gesproken Litouws in traditionele en elektronische media”, werd gehouden door Laimutis Telksnys, hoogleraar aan het Instituut voor Wiskunde en Informatica van de Universiteit van Vilnius. In de voordracht werd benadrukt dat methoden en hulpmiddelen — hardware en software — moeten worden ontwikkeld om het correcte gebruik van geschreven en gesproken Litouws in papieren documenten en elektronische media te waarborgen. De spreker stelde een belangrijke vraag: hoe zal de kleine Litouwse gemeenschap zich staande houden, zodat zij niet verdwijnt in een oceaan van meer dan 7 miljard mensen die schrijven en spreken, en van toekomstige intelligente machines? De hoogleraar gaf ook het antwoord: om dat te voorkomen moeten methoden en hulpmiddelen — hardware en software — worden ontwikkeld die het correcte gebruik van geschreven en gesproken Litouws in papieren documenten en elektronische media waarborgen, en die het gebruik van geschreven en gesproken Litouws en andere talen in papieren documenten en elektronische media harmoniseren. Er moeten transcriptiesystemen worden ontwikkeld die schrifttekens uit andere talen weergeven met Litouwse schrifttekens, en klanken uit andere gesproken talen weergeven met Litouwse spraaktekens die geschikt zijn voor de automatische synthese van Litouwse spraakklanken.

Tijdens de eerste sessie, „Spraakherkenning en -synthese”, werden drie voordrachten gehouden.

Audrius Valotka (VU) en Gediminas Navickas (VU) spraken in hun voordracht „Weg van de Gutenberg-drukpers: Litouwse spraak in de nieuwste technologieën” over Litouwse spraak in de nieuwste technologieën en presenteerden het door Structuurfondsen gefinancierde project Diensten aangestuurd door Litouwse spraak – LIEPA (online toegankelijk: https://www.raštija.lt/liepa),), waarbij onder meer een Litouwse spraaksynthesizer en spraakherkenner werden ontwikkeld. Tijdens de uitvoering van dit project werd de toegang tot de digitale ruimte voor Litouwse spraak geopend. Daarom is het project Uitbreiding van diensten aangestuurd door Litouwse spraak – LIEPA 2 gepland. De sprekers vertelden over de resultaten van project LIEPA 2, die open en gratis beschikbaar zullen zijn voor iedereen die ze wil gebruiken, en het gebruik van Litouwse spraak in informatietechnologieproducten zullen bevorderen. Het belangrijkste resultaat van het nieuwe project zal de mogelijkheid zijn om op natuurlijke

Apžvalgos / Surveys

315

AURELIJA TAMULIONIENĖ

met voorwerpen (mobiele telefoons, tablets, slimme horloges, robots) kunnen communiceren, opdrachten met de menselijke stem kunnen geven en hun antwoorden kunnen begrijpen. Binnen LIEPA 2 zullen typische diensten worden ontwikkeld die nieuwe toepassingsmogelijkheden laten zien voor diensten die met de Litouwse spraak worden aangestuurd: een bedieningspaneel voor een educatieve robot, een telefoonkiezer, een taxi-oproepdienst, een mobiele synthesizer voor blinden, een voorleesservice voor internetnieuws en een intertalige communicator.

Laimutis Telksnys (VU) en Gediminas Navickas (VU) spraken in hun lezing „Diensten aangestuurd met Litouwse spraak. Stand van zaken. Vooruitzichten“ over de stand van zaken en de vooruitzichten van diensten die met Litouwse spraak worden aangestuurd, en over het systematische werk aan de ontwikkeling en verdere toepassing van zulke diensten. Dit werk wordt uitgevoerd door de kennis en technische capaciteiten van IT-specialisten en filologen Litouwse taal te bundelen. In de eerste fase werden zeven diensten ontwikkeld die met Litouwse spraak worden aangestuurd, evenals de infrastructuur die het functioneren ervan waarborgt. In de toekomst zullen nieuwe diensten worden ontwikkeld die met Litouwse spraak worden aangestuurd, voor mobiele elektronische omgevingen: slimme mobiele telefoons, tablets, slimme horloges en robots.

Over de huidige stand en de vooruitzichten van Litouwse spraaksynthese spraken Pius Kasparaitis (VU) en Gintaras Skeris (VU). In de lezing „De huidige stand en de vooruitzichten van Litouwse spraaksynthese“ werden verschillende tekst-naar-spraakdiensten gepresenteerd: de LIEPA-synthesizer, die vrij wordt verspreid samen met de bronteksten. Daardoor kunnen ook anderen nieuwe toepassingen ervoor vinden. Zo bieden de volgende websites al geluidsopnamen bij artikelen aan: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt. De tekst-naar-spraakdienst RoboBraille kan automatisch allerlei tekstdocumenten omzetten in audiobestanden; berichten die met een synthetische stem worden afgespeeld, zijn inmiddels te beluisteren op het busstation van Vilkaviškis, en virtuele assistenten zijn al actief op de website van de Dienst Migratie enzovoort.

Tijdens de tweede zitting, „Digitale Litouwse taalbronnen“, werden vier lezingen gehouden.

De eerste lezing, „E. kalba – een innovatie in het gebruik van digitale taalbronnen“, werd gehouden door Elena Jolanta Zabarskaitė (LKI), Deimantė Budriūnaitė (LKI) en Skirmantas Šermukšnis (NetCode). De lezing gaf een uitvoerige presentatie van het nieuwe project van het Instituut voor de Litouwse taal, dat is gericht op de uitbreiding van de informatie-infrastructuur voor Litouwse taalbronnen (LKIIS) (online beschikbaar: www.lkiis.lt). Er werd vooral gesproken over de diensten die door de infrastructuur van het nieuwe project van het Instituut voor de Litouwse taal, E. kalba, worden gegenereerd: „Zoeken in het woordennetwerk“, „E-marketing“, „E-begrippen“ en „E-advies“. De sprekers presenteerden de functionaliteiten en technologische aspecten van deze diensten. De projectfunctionaliteiten omvatten innovatieve technologieën voor kunstmatige intelligentie, bedoeld voor de analyse van gebruikersmeningen. De dienst „E-begrippen“ biedt uitgebreide zoekmogelijkheden en verrijking van begrippen door aanvullende taalbronnen, zoals tweetalige woordenboeken,

316

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

woordennetwerken in andere talen, te integreren. Met behulp van een interactieve woordvormingswizard kunnen gebruikers snel en gemakkelijk geschikte woordvormingswijzen kiezen op grond van de gewenste semantische categorie en groep, of de beschikbare woordvormingsmiddelen. Ook werden de belangrijkste resultaten van het project E. kalba en de verwachte voordelen ervan gepresenteerd.

In haar lezing „Zoekmogelijkheden in het online Litouwse nieuwwoordenbestand“ presenteerde Rita Milunaitė (LKI) hoe het Litouwse nieuwwoordenbestand zo veelzijdig mogelijk tegemoetkomt aan de behoeften van taalgebruikers (online beschikbaar: http://naujažodžiai.lki.lt/)). Momenteel kan worden gezocht op parameters zoals het trefwoord, de herkomst van het nieuwwoord, de oorspronkelijke vorm, spellingsvarianten, het gebruiksdomein enzovoort. De beheerders van de databank hebben ook toegang tot uitgebreidere zoekmogelijkheden, die nodig zijn om gegevens vanuit verschillende invalshoeken te bewerken. In het kader van het LKIS-project wordt een uitgebreid informatiesysteem voor zoekopdrachten ontwikkeld. De spreker benadrukte dat het Litouwse nieuwwoordenbestand een flexibele digitale bron is die openstaat voor verdere ontwikkeling. Dit karakter wordt in de eerste plaats bepaald door de gegevens zelf: de voortdurend veranderende en vernieuwende lexicale laag van het Litouws, maar ook door de steeds nieuwe gegevenskenmerken die beschikbaar komen voor onderzoekers van nieuwwoorden en door veranderende gebruikersbehoeften. Het is de bedoeling deze bron in het LKIS te integreren (online beschikbaar: http://lkis.lki.lt/)), niet alleen op te nemen in het algemene systeem voor het doorzoeken van de daarin verzamelde gegevens, maar ook te gebruiken bij de ontwikkeling van woordennetwerken. De lezing liet op aanschouwelijke wijze zien hoe dit bestand nuttig kan zijn voor zowel taalspecialisten als alle gebruikers die belangstelling hebben voor nieuwwoorden.

Daiva Murmulaitė (LKI) zette het onderwerp nieuwwoorden voort met haar lezing „Vooruitzichten voor onderzoek naar woordvorming bij nieuwwoorden (het geval van het Litouwse nieuwwoordenbestand)“. Zij sprak over onderzoek naar de woordvorming van nieuwwoorden en de vooruitzichten daarvoor, en over hoe opkomende verschijnselen in de woordvorming van nieuwwoorden kunnen worden onderzocht met behulp van het Litouwse nieuwwoordenbestand. De spreker vertelde dat al in de beginfase van de ontwikkeling van deze databank voorlopige voorbereidingen waren getroffen voor de analyse van woordvorming bij nieuwwoorden: de daarvoor bestemde velden voorzien in het vermelden van de soorten afleidingen, hun vormingsvormen, woordvormingscategorieën (betekenissen), verwante woorden enzovoort; bovendien zijn al gegevens verzameld. In het veld voor bijzondere kenmerken zijn sommige nieuwwoorden als eenmalige vormingen aangeduid (bijvoorbeeld varškėfobija enzovoort), als eigen creaties (bijvoorbeeld demagogėja enzovoort) of als contaminaties (bijvoorbeeld murmanas enzovoort). De spreker benadrukte dat voor een grondige en kwalitatief hoogwaardige analyse van woordvorming ook rekening moet worden gehouden met enkele aspecten waarvan aanvankelijk al was voorzien dat ze zouden worden vastgelegd: de woordsoort van het grondwoord, veranderingen in de woordvormingsbasis, analogieën, de rol van vertaling bij het vormen van een nieuwwoord, atypische woordvormingsverschijnselen enzovoort. Het is belangrijk een goed indexsysteem te ontwikkelen dat uitvoerig en flexibel is en gemakkelijk te gebruiken, aan te vullen en aan te passen.

Laimutis Bilkis (LKI) sprak in zijn lezing „De structuur van de geoinformatiedatabank van Litouwse plaatsnamen, de relaties met andere naamkundige databanken en de ontwikkelingsrichtingen“

Apžvalgos / Surveys

317

AURELIJA TAMULIONIENĖ

presenteerde de geoinformatieve databank van Litouwse plaatsnamen (online beschikbaar: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). We vroegen de spreker iets te vertellen over de structuur van deze databank en de relaties met andere naamdatabanken. De spreker presenteerde de zoekcategorieën die zijn opgenomen op de openbare toegangspagina van de databank: objecttype, objectstatus, huidige administratief-territoriale indeling (gemeente, eldership, nederzetting), de administratief-territoriale indeling in het interbellum (district, landelijke gemeente, nederzetting) en zijrivieren. In de databank kan informatie over plaatsnamen worden gezocht aan de hand van de volgende kenmerken: naam, genus, getal, accentuering, wijze van vorming, herkomst op basis van de taal waartoe het grondwoord behoort, en herkomst op basis van de lexicale groep waartoe het grondwoord behoort. In de databank kunnen authentieke plaatsnamen worden opgezocht die in het interbellum zijn opgetekend binnen het grondgebied van een bepaalde nederzetting (dorp, kerkdorp, landgoed, stadje of afgelegen hoeve), en kan hun precieze of bij benadering bepaalde locatie op de kaart worden bekeken. In de presentatie werd benadrukt dat bij de integratie van de databank in het LKIS-systeem drie soorten verwijzingen naar andere naamdatabanken zijn gemaakt: naar een andere plaatsnaam waarvan de betreffende plaatsnaam is afgeleid, naar een persoonsnaam in de databank van Litouwse familienamen waarvan de plaatsnaam is afgeleid, en naar historische vermeldingen van die plaatsnaam in de databank van historische plaatsnamen. Momenteel zijn ongeveer 25.000 plaatsnamen in de databank opgenomen en beschreven (of worden ze beschreven).

Na de lunch kwamen de sprekers en deelnemers bijeen voor de derde sessie, ‘Corpuslinguïstiek’.

De eerste presentatie, ‘Morfologisch en syntactisch geannoteerde corpora van het Litouws’, werd gegeven door ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU) en ANDRIUS UŽA (VDU). Er werd gesproken over twee geannoteerde Litouwse corpora die zijn samengesteld in het Centrum voor Computationele Linguïstiek van de Vytautas Magnus Universiteit (online toegang tot de corpora: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Geannoteerde corpora zijn essentiële hulpmiddelen; zonder deze is de ontwikkeling van taaltechnologieën niet mogelijk. Ze worden doorgaans gebruikt om andere bronnen en hulpmiddelen voor natuurlijke taal te ontwikkelen op gebieden zoals automatische spraakherkenningssystemen, automatische vertaling enzovoort. Het morfologisch geannoteerde corpus MATAS is samengesteld tussen 2002 en 2014. Het bestaat uit 1,6 miljoen woorden uit teksten van uiteenlopende stijlen. Het corpus is samengesteld op basis van een corpus van 1 miljoen woorden uit 2006, met toepassing van statistische modellen. Het syntactisch geannoteerde corpus ALKSNIS, opgezet als gouden standaard voor vervolgonderzoek en -bronnen, is in 2016 samengesteld. Het bestaat uit 2.355 zinnen (ongeveer 30.000 woorden) uit teksten van uiteenlopende stijlen. De annotatie van het corpus is gebaseerd op de principes van automatische morfologische en syntactische annotatie; daarbij is een model van syntactische afhankelijkheden toegepast.

Het onderwerp corpora werd voortgezet in de presentatie ‘Een databank voor vaste woordcombinaties in het Litouws’, door het grote team van conferentiesprekers ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Baltisch Instituut voor Geavanceerde Technologieën) en JOLANTA KOVALSKAITĖ

318

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

(VDU), Tomas Krilavičius (Baltisch Instituut voor Geavanceerde Technologieën), Justina Mandravikaitė (Baltisch Instituut voor Geavanceerde Technologieën) en Laura Vilkaitė (Baltisch Instituut voor Geavanceerde Technologieën). De presentatie werd op de conferentie gegeven door Erika Rimkutė (VDU), die vooral sprak over de methodologie voor het onderzoek naar vaste woordcombinaties in het hedendaagse geschreven Litouws en over een corpusgebaseerd collocatiewoordenboek van het Litouws dat in voorbereiding is. Het project Automatische herkenning van vaste woordcombinaties in het Litouws (PASTOVU) (nr. LIP-027/2016) (zie http://mwe.lt/),) heeft als doel een methodologie te ontwikkelen voor het onderzoek naar vaste woordcombinaties in het hedendaagse geschreven Litouws en een corpusgebaseerd collocatiewoordenboek van het Litouws samen te stellen. In het project is een corpus van Delfi.lt uit 2014–2016 samengesteld en gebruikt, met een omvang van 72 miljoen woorden. Het collocatiewoordenboek zal worden samengesteld op basis van een databank. Deze zal uiteenlopende informatie over vaste woordcombinaties bevatten: grammaticale en lexicale informatie, gebruiksfrequentie, tekstcategorie, concordantievoorbeelden enzovoort.

Ook presenteerden vertegenwoordigers van de Universiteit van Vilnius corpusonderzoek: Gintarė Judžentytė (VU) en Vilma Zubaitienė (VU). De presentatie ‘Op corpora gebaseerd onderzoek naar academische frasen: formele structuur en semantiek’ behandelde de structuur en semantiek van frasen in academische taal, aan de hand van het corpus van studentenschrijfwerk dat momenteel aan de Universiteit van Vilnius wordt samengesteld en een van de beoogde resultaten is van het door de Litouwse Staatscommissie voor de Litouwse Taal gesteunde project Onderzoek naar frasen in studentenwerk en een interactieve frasegids. Het project heeft als doel een lijst samen te stellen van woorden die van belang zijn voor academisch schrijven, de belangrijkste collocaties en uitbreidingen daarvan te identificeren, evenals terugkerende woordreeksen in verschillende onderdelen van academische teksten, hun verband met de retorische functies van tekstdelen te bespreken en de betekenissen te beschrijven van academische woorden zoals: doel, taak, methoden, conclusies, resultaten; uitvoeren, analyseren, vaststellen, zich baseren op, en het gebruik en de semantiek ervan te onderzoeken.

Tijdens de laatste sessie, ‘Geautomatiseerde analyse van taalstructuur en teksten’, werden vier presentaties gehouden.

De sessie begon met de presentatie ‘Machinevertaling voor het Litouws’ van Danielius Račys (VU), over de recente geschiedenis en verwezenlijkingen van machinevertaling, projecten van diverse instellingen en nieuwe doorbraken dankzij neurale machinevertaling. De spreker besprak de ontwikkeling en resultaten van machinevertaling, die tegenwoordig ook effectief voor het Litouws worden toegepast. In 2005–2007 voerde de Vytautas Magnus Universiteit het door de structuurfondsen van de EU gefinancierde project Online vertaaltool voor informatie uit. Het resultaat was een openbare online vertaaldienst van het Engels naar het Litouws (online beschikbaar: http://vertimas.vdu.lt/twsas/).). In 2012–2014 voerde de Universiteit van Vilnius het door de EU gefinancierde project Ontwikkeling van een op statistische methoden gebaseerd systeem voor machinevertaling tussen Engels en Litouws en tussen Frans en Litouws uit. Het resultaat was een openbare online vertaaldienst (online beschikbaar: https://www.versti.eu/).). Toch

Apžvalgos / Surveys

319

AURELIJA TAMULIONIENĖ

Zelfs voor de beste automatische vertalingen is de tussenkomst van een vertaler nodig. Kunnen machines dan echt goed vertalen? De afgelopen jaren beloven nieuwe doorbraken dankzij het gebruik van neurale machinevertaling. De Universiteit van Vilnius bereidt zich erop voor om in 2018 neurale machinevertaling van de nieuwe generatie voor het Engels, Litouws, Pools, Frans, Russisch en Duits in gebruik te nemen. Er is met genoegen vastgesteld dat de nieuwste ontwikkelingen op het gebied van machinevertaling ook het Litouws ten goede komen.

In zijn lezing „De Litouwse grammatica in de wereld van open source” sprak Virginijus Dudkevičius (VU) over de ontwikkeling van een nieuwe generatie computerverwerking van de Litouwse morfologie, morfologische analyse en synthese van woorden, intelligente zoekopdrachten in tekstuele informatie enzovoort. Met de komst van computers werd het voor de klassieke grammatica en lexica noodzakelijk om „een nieuw jasje aan te trekken” en een volwaardig onderdeel van nieuwe technologieën te worden. Daartoe is een nieuwe generatie computerverwerking van de Litouwse morfologie ontwikkeld, met de volgende doelen: uitsluitend open source gebruiken en ontwikkelen; alleen de gegevens, maar niet hun vorm en interpretatie, mogen specifieke kenmerken van het Litouws hebben; alle programmacode moet universeel zijn en geschikt voor elke andere taal; maximaal gebruikmaken van oplossingen die met succes zijn toegepast op andere talen in de wereld. De basis voor de samenstelling is Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) en tekstcorpora (in totaal ongeveer 1,5 miljard woorden). Van een gemiddelde tekst die momenteel op internet verschijnt, is ongeveer 99% „herkenbaar”; dat wil zeggen dat de morfologische analysator gemiddeld 99 van de 100 woorden correct interpreteert. Deze nieuw ontwikkelde methode voor morfologische analyse is met succes toegepast in het systeem voor syntactisch-semantische analyse van de Vytautas Magnus-universiteit (online beschikbaar: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) en in het register van rechtshandelingen van de Seimas van de Republiek Litouwen (online beschikbaar: www.e-tar.lt).

Het thema van de digitale grammatica werd voortgezet door Daiva Šveikauskienė (LKI) en Vytautas Šveikauskas (LKI). In de lezing „De digitale grammatica van het Litouws” spraken zij over de digitale grammatica van het Litouws, waarvan het Litouwse Taalinstituut is begonnen met de ontwikkeling en die ook kan worden gebruikt in andere gebieden van computerverwerking van taal, zoals grammaticale analyse en directe vertaling van gegevens. Het project werd gepresenteerd; het plan is om aan te sluiten bij het internationale systeem DIGITAL GRAMMARS, dat momenteel 32 talen omvat. Het belangrijkste doel van de ontwikkeling van de digitale grammatica is gebruik ervan in automatische vertaalsystemen die niet-statistische methoden toepassen. Dit is bijzonder relevant voor het Litouws. Volgens de gegevens van 2017 van Tildės is de kwaliteit van Google-vertalingen naar en uit het Litouws zelfs slechter dan die voor het Lets of Ests. Daarom is het voor Litouwen zeer belangrijk een alternatief voor automatische vertaling te ontwikkelen. Momenteel is een proefvoorbeeld van de digitale grammatica opgesteld, dat slechts enkele woorden omvat, maar zelfs daaruit blijkt dat de vertaalkwaliteit veel beter is, vooral bij zinnen waarin specifieke kenmerken van het Litouws tot uiting komen. Zolang de Engelse woordvolgorde wordt gebruikt, leveren statistische

320

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

methoden ook behoorlijke vertalingen op, maar als de woordvolgorde in een zin niet standaard is, verliest de Google-vertaling de betekenis van de zin niet. De digitale grammatica kan ook worden gebruikt in andere gebieden van computerverwerking van taal, zoals grammaticale analyse en directe vertaling van gegevens. De ontwikkeling van digitale grammatica’s staat onder leiding van professor Aarne Ranta van de Universiteit van Göteborg (Zweden).

De laatste lezing van de conferentie, „Wie heeft van wie overgeschreven? Automatisering en visualisatie van onderzoek naar de geschiedenis van Bijbelvertalingen”, werd gegeven door Mindaugas Šinkūnas (LKI). De lezing ging over de automatisering en visualisatie van onderzoek naar de geschiedenis van Bijbelvertalingen. De spreker toonde de resultaten van de vergelijking van Bijbelverzen in heldere en uitgebreide diagrammen. De vele Bijbelcitaten in oude Litouwse geschriften bemoeilijken het onderzoek naar hun onderlinge verbanden. Er is behoefte aan een gebruiksvriendelijk dataplatform waarmee Bijbelverzen kunnen worden gegroepeerd op basis van kenmerken die voor de onderzoeker van belang zijn. De grootste moeilijkheid is het beoordelen van de gelijkenis tussen citaten. Een gecombineerde analyse van lexicon, syntaxis en morfologie (en in bepaalde gevallen ook spelling) maakt dit mogelijk, maar dit filologische onderzoek verloopt langzaam en kan momenteel niet worden geautomatiseerd. De vergelijking kon worden geautomatiseerd met behulp van algoritmen die in cycli werken en als taak hebben identieke reeksen in twee tekenreeksen op te sporen en te berekenen welk deel van de vergeleken reeksen zij beslaan. De niet-eenduidige orthografie van oude geschriften bemoeilijkt de automatisering van de vergelijking. Uit een beoordeling van handmatig en automatisch getranslitereerde verzen bleek dat de wijze van translitereren geen wezenlijke invloed heeft op de resultaten. De resultaten kunnen betwistbaar zijn bij vergelijking van teksten die in verschillende dialecten zijn geschreven (het nivelleren van dialectkenmerken is niet getest). De verkregen gelijkenisresultaten worden samengevat in tweedimensionale diagrammen. De resultaten van de programmatische analyse van de vergelijking van Bijbelverzen in Bretkūnas’ Postilė (1591) komen overeen met de conclusies die eerdere onderzoekers met andere methoden hebben getrokken.

De conferentie werd afgesloten met discussies. De op basis van de lezingen van de conferentie voorbereide artikelen zullen worden gepubliceerd in de wetenschappelijke tijdschriften Bendrinė kalba (online beschikbaar: www.bendrinekalba.lt) en Lietuvių kalba (www.lietuviukalba.lt).

LITERATŪRA

Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.

Įteikta 2017 m. lapkričio 3 d.

AURELIJA TAMULIONIENĖ

Lietuvių kalbos institutas

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva

[email protected]

Apžvalgos / Surveys

321