scieee.
LT original EN DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

AURELIJA TAMULIONIENĖ

Institutet för litauiska språket

Forskningsinriktningar: studier av det nutida litauiska språkbruket och dess variation.

DET LITAUISKA SPRÅKETS STÄLLNING I DEN DIGITALA TIDSÅLDERN

Om den 24:e Jono Jablonskio-konferensen

Utvecklingsinriktningar och användningsmöjligheter för digitala språkresurser

Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinka­mas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).

Den vetenskapliga konferensen, som fått sitt namn efter Jono Jablonskis, hölls för första gången 1993 av Institutet för litauiska språkets avdelning för språkvård och Vilnius universitets institution för litauiska språket. Sedan dess har konferenserna blivit en tradition och hålls varje höst (sedan 2003 växelvis vid Institutet för litauiska språket eller Vilnius universitet).

Den 29 september 2017 hölls den 24:e vetenskapliga Jono Jablonskio-konferensen Utvecklingsinriktningar och användningsmöjligheter för digitala språkresurser (eng. Digital Language Resources, Directions of Their Development and Possibilities to Harness Them) vid Institutet för litauiska språket. Konferensen arrangerades av Institutet för litauiska språkets centrum för studier av standardspråket tillsammans med Vilnius universitets institut för tillämpad lingvistik. Till sitt tema skilde sig konferensen från de tidigare; dess syfte var att diskutera de problem som uppstår i mötet mellan språk och digital teknik och som man stöter på vid utvecklingen av digitala resurser och skapandet av en gemensam digital marknad. I konferensens fokus stod den semantiska nivån hos digitala resurser (skapandet av ordnätverk), liksom att förse digitala resurser med ljudform, skapa nya möjligheter att sprida digitala resurser i flerspråkiga gemenskaper med mera.

Konferensen besöktes av föredragshållare från utlandet: från Europaparlamentet och Spanien, liksom forskare från olika litauiska institutioner: Institutet för litauiska språket, Vilnius

Straipsniai / Articles

313

AURELIJA TAMULIONIENĖ

universitet, Vytautas Magnus-universitetet, Baltic Institute of Advanced Technology, UAB ”Netcode”. Vid konferensen hölls 17 föredrag. Föredragshållarna presenterade sina föredrag och delade med sig av sin forskning och erfarenhet vid fyra sessioner.

Konferensen inleddes med öppningsanföranden. Europaparlamentarikern Algirdas Saudargas och professor Jolanta Elena Zabarskaitė, direktör för Institutet för litauiska språket, hälsade konferensdeltagarna och föredragshållarna välkomna. Inledningsanförandet hölls av dr Rita Miliūnaitė, seniorforskare vid centrumet för forskning om standardspråket vid Institutet för litauiska språket. Det talades om att kopplingarna mellan det litauiska språket och informationsteknik har stärkts avsevärt under de senaste åren. Vi har konkreta resultat både när det gäller digitalisering av språkresurser och utveckling av verktyg för språkanalys, språkigenkänning och språksyntes, men jämfört med hur snabbt världen förändras på detta område har det litauiska språket fortfarande mycket att ta igen. Eftersom litauiska är ett flekterande språk kan vi inte direkt anpassa informationsteknik som utvecklats för engelska. Därför är våra nuvarande maskinöversättnings- och andra datorverktyg fortfarande mycket bristfälliga, medan världen redan undersöker nästa steg, i riktning mot utveckling av artificiell intelligens, förkroppsligar den i föremål och tränger in i språkets allt djupare skikt.

Vid plenarsessionen höll Europaparlamentarikern Algirdas Saudargas det första föredraget, ”Det levande språket i artificiellt förstånd”. Föredragshållaren tog upp en grundläggande fråga som varje språkgemenskap måste besvara: i vilken utsträckning ska den själv utveckla resurser och teknik för sitt modersmål, och vad kan köpas färdigutvecklat med andra språk som grund? I föredraget framfördes problematiska tankar om att litauiska, liksom språken i vissa andra små länder, ”har ringa eller inget tekniskt stöd”. Språkteknik får inte tillräcklig uppmärksamhet på dagordningen, varken hos litauiska eller europeiska politiker. Föredraget innehöll insikter som visade att utvecklingen av artificiell intelligens konvergerar mot en hybridform, där neurala nätverk motsvarar hjärnans omedvetna mekanismer, medan det medvetna tänkandet påverkas och modelleras av traditionell, så kallad symbolisk artificiell intelligens. Varje språkgemenskap måste se till att språkteknik som motsvarar symbolisk artificiell intelligens på ett uttömmande och exakt sätt återspeglar modersmålets hela struktur, och att en rik miljö av modersmål (och modersmålskultur) skapas för de neurala nätverkens interaktion.

Det andra plenarföredraget, ”Language equality in the digital age: towards a human language project”, hölls på engelska av Rafael Rivera, chef för konsultföretaget ”Claves”. Föredraget presenterade ingående en studie från Europaparlamentets enhet för vetenskapliga framtidsfrågor: ”Språklig jämlikhet i den digitala tidsåldern. Ett projekt för mänskligt språk” (studien finns på engelska på nätet: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf).). Föredraget gav en översikt över nuläget för tekniken för mänskliga språk och kvantifierade

314

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

språkets ekonomiska, sociala och lingvistiska konsekvenser i den digitala tidsåldern och behandlade Europeiska unionens politik för informations- och kommunikationsteknik. I den digitala tidsåldern utgör språkteknik en stor utmaning för länder med få talare. Bristfälligt utvecklad språkteknik skapar utanförskap och hinder. Detta påverkar gränsöverskridande tjänster, arbetstagarnas rörlighet och handeln. Hindren beror på osamordnad forskning och otillräcklig finansiering. Föredragshållaren betonade att språkteknik inte får tillräcklig uppmärksamhet från europeiska politiker. Utifrån en analys av nuläget utformas ett initiativ som ska förena politiken för institutioner, forskning, industri, marknad och offentliga tjänster.

Det sista föredraget vid plenarsessionen, ”Litauiskt skriftspråk och talspråk i traditionella och elektroniska medier”, hölls av Laimutis Telksnys, professor vid Institutet för matematik och informatik vid Vilnius universitet. I föredraget sades att det är nödvändigt att utveckla metoder och verktyg – hårdvara och programvara – som säkerställer korrekt användning av litauiskt skriftspråk och talspråk i pappersdokument och elektroniska medier. Föredragshållaren ställde en viktig fråga: hur ska några miljoner litauer kunna hävda sig så att de inte försvinner i havet av mer än 7 miljarder människor som skriver och talar, samt framtidens smarta maskiner? Professorn gav också svaret: för att förhindra detta måste metoder och verktyg – hårdvara och programvara – utvecklas för att säkerställa korrekt användning av litauiskt skriftspråk och talspråk i pappersdokument och elektroniska medier, och för att harmonisera användningen av litauiskt och andra språks skriftspråk och talspråk i pappersdokument och elektroniska medier. Transkriberingsverktyg måste utvecklas för att återge tecken i främmande språks skriftspråk med litauiska skrivtecken och återge ljud i främmande språks talspråk med tecken för litauiskt talspråk, så att de lämpar sig för automatisk syntes av ljuden i litauiska talord.

Vid den första sessionen, ”Taligenkänning och talsyntes”, hölls tre föredrag.

I sitt föredrag ”Bort från Gutenbergs tryckpress: litauiskt tal i den senaste tekniken” talade Audrius Valotka (VU) och Gediminas Navickas (VU) om litauiskt tal i den senaste tekniken och presenterade det strukturfondsfinansierade projektet Tjänster styrda med litauiskt tal – LIEPA (tillgängligt på nätet: https://www.raštija.lt/liepa),), inom vilket bland annat en litauisk talsyntes och taligenkännare utvecklades. Under genomförandet av projektet öppnades portarna till den digitala världen för litauiskt tal. Därför planeras projektet Utveckling av tjänster styrda med litauiskt tal – LIEPA 2. Föredragshållarna talade om resultaten från projektet LIEPA 2, som kommer att vara öppna och kostnadsfritt tillgängliga för alla intresserade och uppmuntra användningen av litauiskt tal i informationstekniska produkter. Det viktigaste resultatet av det nya projektet blir möjligheten att med naturlig

Apžvalgos / Surveys

315

AURELIJA TAMULIONIENĖ

kommunicera med föremål (mobiltelefoner, surfplattor, smartklockor, robotar), ge kommandon med mänsklig röst och förstå deras svar. Inom LIEPA 2 planeras typiska tjänster som visar nya möjligheter att använda tjänster som styrs med litauiskt tal: en styrpanel för en pedagogisk robot, en uppringningstjänst, en taxibeställningstjänst, en mobil talsyntes för blinda, en läsare för nyheter på internet och en interlingval kommunikationslösning.

Laimutis Telksnys (VU) och Gediminas Navickas (VU) talade i sitt föredrag ”Tjänster som styrs med litauiskt tal. Läget. Framtidsutsikter” om läget och framtidsutsikterna för tjänster som styrs med litauiskt tal samt om det systematiska arbetet med att utveckla sådana tjänster och utvidga deras användning. Arbetet bedrivs genom att samla kunskaperna hos IT-specialister och litauiska filologer samt ingenjörsresurser. Under arbetets första fas skapades sju tjänster som styrs med litauiskt tal och en infrastruktur som säkerställer att tjänsterna fungerar. I framtiden planeras nya tjänster som styrs med litauiskt tal för mobila elektroniska miljöer – smarttelefoner, surfplattor, smartklockor och robotar.

Pius Kasparaitis (VU) och Gintaras Skeris (VU) talade om nuläget och framtidsutsikterna för litauisk talsyntes. I föredraget ”Nuläget och framtidsutsikterna för litauisk talsyntes” presenterades olika tjänster för textuppläsning – LIEPA:s talsyntes, som distribueras fritt tillsammans med källtexterna och därmed ger andra människor möjlighet att hitta nya användningsområden för den. Exempelvis erbjuder webbplatserna redan ljudinspelningar intill artiklar: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt. Textuppläsningstjänsten RoboBraille kan automatiskt omvandla alla slags textdokument till ljudfiler; meddelanden som läses upp med syntetisk röst hörs redan när man reser genom Vilkaviškis busstation, och virtuella assistenter används redan på Migrationsdepartementets webbplats med mera.

Vid det andra sammanträdet, ”Digitala resurser för det litauiska språket”, hölls fyra föredrag.

Det första föredraget, ”E. kalba – en innovation för användning av digitala språkresurser”, hölls av Elena Jolanta Zabarskaitė (LKI), Deimantė Budriūnaitė (LKI) och Skirmantas Šermukšnis (NetCode). Föredraget presenterade ingående Litauiska språkets instituts nya projekt för att utvidga informationsinfrastrukturen för litauiska språkresurser (LKIIS) (tillgängligt på internet: www.lkiis.lt). Föredraget handlade främst om de tjänster som genereras av Litauiska språkets instituts nya projekts infrastruktur E. kalba: ”Sökning i ordnätet”, ”E-marknadsföring”, ”E-begrepp” och ”E-råd”. Föredragshållarna presenterade tjänsternas funktioner och tekniska aspekter. Projektets funktioner kommer att omfatta innovativ teknik för artificiell intelligens avsedd för analys av användarnas åsikter. Tjänsten ”E-begrepp” kommer att möjliggöra utökad sökning och berikning av begrepp genom integrering av ytterligare språkresurser, såsom tvåspråkiga ordböcker,

316

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

ordnät på andra språk. Med hjälp av en interaktiv vägledning för ordbildning kommer det att gå snabbt och enkelt att välja lämpliga ordbildningssätt utifrån den önskade semantiska kategorin och gruppen eller utifrån ordbildningsmedlen. Föredraget presenterade också de viktigaste resultaten av projektet E. kalba och dess förväntade nytta.

Rita Milunaitė (LKI) presenterade i sitt föredrag ”Sökmöjligheter i den nätbaserade Databasen över litauiska nyord” hur språkbrukarnas behov kan tillgodoses genom att databasen gör så många olika egenskaper hos nyorden som möjligt sökbara Databasen över litauiska nyord (tillgänglig på internet: http://naujažodžiai.lki.lt/). För närvarande kan man söka på parametrar som uppslagsord, nyordets ursprung, originalform, stavningsvarianter, användningsområde med mera. Databasens redaktörer har också tillgång till en mer omfattande sökfunktion som behövs för att redigera data utifrån olika urval. Inom projektet LKIS ska ett utökat informationssöksystem utvecklas. Föredragshållaren betonade att Databasen över litauiska nyord är en flexibel digital resurs som är öppen för vidareutveckling. Detta beror framför allt på själva datamaterialet – det ständigt föränderliga och förnyade ordförrådsskiktet i det litauiska språket – samt på att nya dataegenskaper blir tillgängliga för nyordsforskare och att användarnas behov förändras. Resursen planeras integreras i LKIS (tillgänglig på internet: http://lkis.lki.lt/) och införlivas inte bara i systemet för gemensam sökning i dess datainsamling, utan också användas för att skapa ordnät. Föredraget visade på ett åskådligt sätt hur databasen kan vara till nytta både för språkexperter och för alla användare som intresserar sig för nyord.

Daiva Murmulaitė (LKI) fortsatte på temat nyord med föredraget ”Framtidsutsikter för forskning om nyordsbildning (fallet med Databasen över litauiska nyord)”. Hon talade om forskning om nyordsbildning och dess framtidsutsikter, samt om hur framträdande företeelser inom nyordsbildningen kan undersökas med hjälp av Databasen över litauiska nyord. Föredragshållaren berättade att man redan i den inledande fasen av databasutvecklingen preliminärt hade förberett även en analys av nyordsbildningen: särskilda fält är avsedda för att ange avledningstyper, deras bildningsformer, ordbildningskategorier (betydelser), besläktade ord med mera, och en del data har redan samlats in. I fältet för särskilda egenskaper har vissa nyord markerats som enstaka (till exempel varškėfobija med flera), författarbildade (till exempel demagogėja med flera) eller kontaminerade (till exempel murmanas med flera). Föredragshållaren betonade att en ingående och kvalitativ analys av ordbildningen också kräver att man tar hänsyn till vissa aspekter som från början var tänkta att registreras: ordklass för avledningens basord, förändringar i bildningsbasen, analogier, översättningens roll vid bildandet av ett nyord, atypiska uttryck för ordbildning med mera. Det är viktigt att skapa ett bra indexsystem – heltäckande, flexibelt och enkelt att använda, utöka och redigera.

Laimutis Bilkis (LKI) höll föredraget ”Strukturen hos Litauens geoinformationsdatabas över ortnamn, dess relationer till andra namnregisterdatabaser och utvecklingsriktningar”

Apžvalgos / Surveys

317

AURELIJA TAMULIONIENĖ

presenterade Lietuvos vietovardžių geoinformacinę duomenų bazę (tillgänglig på internet: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). Vi bad talaren berätta om databasens struktur och dess kopplingar till andra namnregister. Talaren presenterade de sökområden som skapats på databasens sida för allmän åtkomst: objekttyp, objektstatus, nuvarande administrativ territoriell tillhörighet (kommun, seniūnija, ort), administrativ territoriell tillhörighet under mellankrigstiden (län, valsčius, ort) och bifloder. I databasen kan information om ortnamn sökas med hjälp av följande egenskaper: namn, genus, numerus, accentuering, bildningssätt, ursprung utifrån vilket språk grundordet tillhör och ursprung utifrån vilken lexikal grupp grundordet tillhör. I databasen kan man hitta autentiska ortnamn som antecknades under mellankrigstiden inom en önskad orts (by, kyrkby, gods, småstad eller ensamgård) område och se deras exakta eller ungefärliga position på kartan. I föredraget betonades att det i samband med integreringen av databasen i LKIS-systemet har skapats tre slags länkar till andra namnregister: till ett annat ortnamn som ortnamnet härstammar från, till ett personnamn i Lietuvių pavardžių duomenų bazėje som ortnamnet härstammar från och till historiska belägg för ortnamnet i Istorinių vietovardžių duomenų bazėje. För närvarande har omkring 25 000 ortnamn laddats upp till databasen och beskrivits (håller på att beskrivas).

Efter lunch samlades talarna och deltagarna till det tredje mötet, ”Korpuslingvistik”.

Det första föredraget, ”Morfologiskt och syntaktiskt annoterade litauiska korpus”, hölls av ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU) och ANDRIUS UŽA (VDU). De talade om två annoterade korpus för litauiska, framtagna vid Centret för datorlingvistik vid Vytautas Magnus-universitetet (korpusen är tillgängliga på internet: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Annoterade korpus är grundläggande resurser, utan vilka det är omöjligt att utveckla språkteknologi. De används vanligen för att skapa andra resurser och verktyg för naturligt språk inom områden som automatisk taligenkänning, maskinöversättning och liknande. Det morfologiskt annoterade korpus MATAS sammanställdes 2002–2014. Det omfattar 1,6 miljoner ord från texter i olika stilar. Korpuset togs fram genom att statistiska modeller tillämpades på ett korpus om 1 miljon ord, sammanställt 2006. Det syntaktiskt annoterade korpuset ALKSNIS, utformat som guldstandard för framtida forskning och resurser, sammanställdes 2016. Korpuset består av 2 355 meningar (omkring 30 000 ord) hämtade från texter i olika stilar. Korpusannoteringen bygger på principerna för automatisk morfologisk och syntaktisk annotering och använder en modell för syntaktiska beroenderelationer.

Korpustemat fortsattes i föredraget ”Databas för fasta uttryck i litauiska” av den talrika konferensgruppen ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Baltijos pažangių technologijų institutas), JOLANTA KOVALSKAITĖ

318

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

(VDU), Tomas Krilavičius (Baltijos pažangių technologijų institutas), Justina Mandravikaitė (Baltijos pažangių technologijų institutas) och Laura Vilkaitė (Baltijos pažangių technologijų institutas). Föredraget presenterades på konferensen av Erika Rimkutė (VDU), som främst talade om metoden för att undersöka fasta ordkombinationer i nutida litauisk skriftspråk och om en korpusbaserad kollokationsordbok för litauiska som håller på att utarbetas. Inom projektet Lietuvių kalbos pastoviųjų žodžių junginių automatinis atpažinimas (PASTOVU) (nr. LIP-027/2016) (se http://mwe.lt/), är målet att utveckla en metod för att undersöka fasta ordkombinationer i nutida litauisk skriftspråk och att sammanställa en korpusbaserad kollokationsordbok för litauiska. Inom projektet har ett korpus med 72 miljoner ord från Delfi.lt, bestående av material från 2014–2016, sammanställts och används. Kollokationsordboken kommer att baseras på en databas. Den kommer att innehålla olika slags information om fasta uttryck: grammatisk och lexikal information, användningsfrekvens, textens ämneskategori, konkordans exempel och annat.

Korpusforskning presenterades också av Vilniaus universiteto atstovės Gintarė Judžentytė (VU) och Vilma Zubaitienė (VU). Föredraget ”Korpusbaserade studier av akademiska fraser: formell struktur och semantik” behandlade akademiskt språks frasstruktur och semantik med utgångspunkt i Studentų rašto darbų tekstynu, som för närvarande utvecklas vid Vilnius universitet och är ett av de förväntade resultaten av det projekt som stöds av Valstybinė lietuvių kalbos komisija: Studentų darbų frazėksėmo tyrimai ir interaktyvios fražų sąvadas. Projektets mål är att fastställa en lista över ord som är viktiga för akademiskt skrivande, identifiera centrala kollokationer och deras utvidgningar samt återkommande ordsekvenser i olika delar av akademiska texter, diskutera deras samband med de retoriska funktionerna hos textdelarna och beskriva betydelserna hos akademiska ord som tikslas, uždavinys, metodai, išvados, rezultatai; atlikti, analizuoti, nustatyti, remtis samt deras användning och semantik.

Vid det sista mötet, ”Automatiserad analys av språkstruktur och texter”, hölls fyra föredrag.

Mötet inleddes med Danielius Račys (VU) föredrag ”Maskinöversättning för litauiska”, som handlade om maskinöversättningens senaste historia och framsteg, projekt som genomförs av olika institutioner samt nya genombrott inom neural maskinöversättning. Talaren berättade om maskinöversättningens utveckling och framsteg, som i dag tillämpas effektivt även för litauiska. 2005–2007 genomförde Vytautas Magnus-universitetet projektet Internetinė informacijos vertimo priemonė, finansierat av EU:s strukturfonder. Resultatet blev en offentlig webbaserad översättningstjänst från engelska till litauiska (tillgänglig på internet: http://vertimas.vdu.lt/twsas/). 2012–2014 genomförde Vilnius universitet det EU-finansierade projektet Anglų–lietuvių–anglų ir prancūzų–lietuvių–prancūzų kalbų mašininio vertimo, paremto statistiniais metodais, sistemos sukūrimas. Resultatet blev en offentlig webbaserad översättningstjänst (tillgänglig på internet: https://www.versti.eu/). Trots detta

Apžvalgos / Surveys

319

AURELIJA TAMULIONIENĖ

Även de bästa maskinöversättningarna kräver att en översättare ingriper. Kan maskiner då översätta riktigt bra? De senaste åren bådar gott för nya genombrott med neurala maskinöversättningar. Vilnius universitet förbereder sig på att börja införa nästa generations neurala maskinöversättning för engelska, litauiska, polska, franska, ryska och tyska år 2018. Det glädjande är att de senaste framstegen inom maskinöversättning inte heller går litauiskan förbi.

I sitt föredrag ”Litauisk grammatik i den digitala världen med öppen källkod” talade Virginijus Dudkevičius (VU) om utvecklingen av nästa generations datorbaserade litauiska morfologi, morfologisk analys och syntes av ord, intelligent sökning efter textinformation med mera. När datorerna kom blev det nödvändigt för den klassiska grammatiken och lexikonet att ”iklä sig en ny skrud” och bli en fullvärdig del av den nya tekniken. Därför har en ny generation datorbaserad litauisk morfologi utvecklats, med följande mål: att enbart använda och skapa öppen källkod; att endast data, men inte deras form och tolkning, får ha egenskaper som är specifika för litauiskan; att all programkod ska vara universell och fungera för vilket annat språk som helst; samt att i största möjliga utsträckning dra nytta av lösningar som med framgång har anpassats till andra språk i världen. Grunden utgörs av Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) och textkorpusar (sammanlagt omkring 1,5 miljarder ord). Den genomsnittliga text som för närvarande publiceras på internet är ”igenkännbar” till cirka 99%, det vill säga att den morfologiska analysatorn i genomsnitt tolkar 99 av 100 ord korrekt. Denna nyutvecklade metod för morfologisk analys har framgångsrikt tillämpats i Vytautas Magnus universitets system för syntaktisk-semantisk analys (tillgängligt på internet: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) och i Republiken Litauens Seims register över rättsakter (tillgängligt på internet: www.e-tar.lt).

Temat digital grammatik fortsattes av Daiva Šveikauskienė (LKI) och Vytautas Šveikauskas (LKI). I föredraget ”Litauiskans digitala grammatik” talade de om den digitala grammatik för litauiska som börjat utvecklas vid Litauiska språkets institut och som även kan användas inom andra områden för datorbaserad språkbehandling, såsom grammatisk analys, direkt dataöversättning med mera. De presenterade ett projekt med planer på att ansluta sig till det internationella systemet DIGITAL GRAMMARS, som för närvarande omfattar 32 språk. Huvudsyftet med att utveckla en digital grammatik är att använda den i automatiska översättningssystem som bygger på icke-statistiska metoder. Detta är mycket aktuellt för litauiskan. Enligt Tildės uppgifter från 2017 är Googles översättningskvalitet till och från litauiska sämre än till och från lettiska eller estniska. Därför är det mycket viktigt för Litauen att utveckla ett alternativt system för automatisk översättning. En testversion av den digitala grammatiken har nu tagits fram. Den innehåller bara några få ord, men redan den visar att översättningskvaliteten är mycket bättre, särskilt för meningar som speglar litauiskans särdrag. Så länge engelsk ordföljd används ger även statistiska

320

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

metoder ganska bra översättningar, men om meningen har en ovanlig ordföljd förlorar Googles översättning inte meningen. Digital grammatik kan också användas inom andra områden för datorbaserad språkbehandling, såsom grammatisk analys, direkt dataöversättning med mera. Arbetet med att utveckla digitala grammatiker leds av professor Aarne Ranta vid Göteborgs universitet i Sverige.

Konferensens sista föredrag, ”Vem kopierade från vem? Automatisering och visualisering av forskning om bibelöversättningarnas historia”, hölls av Mindaugas Šinkūnas (LKI). Föredraget handlade om automatisering och visualisering av forskning om bibelöversättningarnas historia. Föredragshållaren presenterade resultaten av jämförelser mellan bibelverser med hjälp av tydliga och innehållsrika diagram. Det stora antalet bibelcitat i äldre litauiska skrifter försvårar undersökningen av sambanden mellan dem. Det behövs en smidig dataplattform som gör det möjligt att gruppera bibelverser efter egenskaper som intresserar forskaren. Den största svårigheten är att bedöma hur lika citaten är. En kombinerad analys av lexikon, syntax och morfologi (och i vissa fall även stavning) gör det möjligt, men denna filologiska undersökning är långsam och kan för närvarande inte automatiseras. Jämförelsen kunde automatiseras med hjälp av algoritmer som körs i cykler och vars uppgift är att hitta identiska sekvenser i två teckensträngar och beräkna hur stor del av de jämförda sekvenserna de utgör. Automatiseringen av jämförelsen försvåras av den gamla skriftens tvetydiga ortografi. En jämförelse av manuellt och automatiskt translittererade verser visade att translittereringsmetoden inte påverkar resultaten väsentligt. Resultaten kan ifrågasättas när texter skrivna på olika dialekter jämförs (utjämning av dialektala särdrag har inte prövats). De erhållna likhetsresultaten sammanfattas i tvådimensionella diagram. Resultaten från den datorbaserade analysen av jämförelser mellan bibelverser i Bretkūnas Postilės (1591) stämmer överens med de slutsatser som tidigare forskare har dragit med andra metoder.

Konferensen avslutades med diskussioner. Artiklar baserade på konferensföredragen kommer att publiceras i de vetenskapliga tidskrifterna Bendrinė kalba (tillgänglig på internet: www.bendrinekalba.lt) och Lietuvių kalba (www.lietuviukalba.lt).

LITERATŪRA

Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.

Įteikta 2017 m. lapkričio 3 d.

AURELIJA TAMULIONIENĖ

Lietuvių kalbos institutas

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva

[email protected]

Apžvalgos / Surveys

321