Page 1AURELIJA TAMULIONIENĖ
Institut für Litauische Sprache
Forschungsschwerpunkte: Untersuchungen zum Gebrauch und zur Variationsbreite der heutigen litauischen Sprache.
DIE LAGE DER LITAUISCHEN SPRACHE IM DIGITALEN ZEITALTER
Über die 24. Jono-Jablonskio-Konferenz
Entwicklungsrichtungen und Nutzungsmöglichkeiten digitaler Sprachressourcen
Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinkamas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).
Die nach Jono Jablonskis benannte wissenschaftliche Konferenz fand erstmals 1993 statt, veranstaltet vom Referat für Sprachkultur des Instituts für Litauische Sprache und dem Lehrstuhl für Litauische Sprache der Universität Vilnius. Seitdem sind die Konferenzen zu einer Tradition geworden und finden jeden Herbst statt (seit 2003 abwechselnd am Institut für Litauische Sprache oder an der Universität Vilnius).
Am 29. September 2017 fand die 24. wissenschaftliche Jono-Jablonskio-Konferenz Entwicklungsrichtungen und Nutzungsmöglichkeiten digitaler Sprachressourcen (engl. Digital Language Resources, Directions of Their Development and Possibilities to Harness Them) am Institut für Litauische Sprache statt. Organisiert wurde die Konferenz vom Zentrum für Untersuchungen der Standardsprache des Instituts für Litauische Sprache gemeinsam mit dem Institut für Angewandte Linguistik der Universität Vilnius. Thematisch unterschied sich diese Konferenz von den vorherigen; ihr Ziel war es, Probleme an der Schnittstelle von Sprachen und digitalen Technologien zu erörtern, die bei der Entwicklung digitaler Ressourcen und der Schaffung eines gemeinsamen digitalen Marktes auftreten. Im Mittelpunkt der Konferenz standen die semantische Ebene digitaler Ressourcen (die Entwicklung von Wortnetzen) sowie die Verleihung einer akustischen Form an digitale Ressourcen, die Schaffung neuer Möglichkeiten zur Verbreitung digitaler Ressourcen in mehrsprachigen Gemeinschaften und anderes.
An der Konferenz nahmen Vortragende aus dem Ausland teil: vom Europäischen Parlament und aus Spanien; außerdem Forschende aus verschiedenen litauischen Institutionen: dem Institut für Litauische Sprache, der Universität Vilnius
Straipsniai / Articles
313
Page 2AURELIJA TAMULIONIENĖ
… Universität, Vytautas-Magnus-Universität, Baltisches Institut für fortgeschrittene Technologien, UAB „Netcode“. Auf der Konferenz wurden 17 Vorträge gehalten. Die Vortragenden präsentierten ihre Beiträge und tauschten sich in vier Sitzungen über ihre Forschung und Erfahrungen aus.
Die Konferenz begann mit Grußworten. Die versammelten Konferenzteilnehmenden und Vortragenden begrüßten Algirdas Saudargas, Mitglied des Europäischen Parlaments, und Prof. Dr. Jolanta Elena Zabarskaitė, Direktorin des Instituts für Litauische Sprache. Das Eröffnungswort sprach Dr. Rita Miliūnaitė, leitende wissenschaftliche Mitarbeiterin am Zentrum für Forschungen zur Standardsprache des Instituts für Litauische Sprache. Es wurde darauf hingewiesen, dass sich die Verbindungen zwischen der litauischen Sprache und den Informationstechnologien in den vergangenen Jahren stark vertieft haben und dass wir greifbare Ergebnisse sowohl bei der Digitalisierung von Sprachressourcen als auch bei der Entwicklung von Werkzeugen zur Sprachanalyse, -erkennung und -synthese erzielt haben. Im Vergleich dazu, wie schnell sich die Welt in diesem Bereich verändert, muss die litauische Sprache jedoch noch viel aufholen. Da Litauisch eine flektierende Sprache ist, können wir dafür entwickelte Informationstechnologien nicht ohne Weiteres direkt übernehmen, weshalb unsere derzeitigen maschinellen Übersetzungs- und sonstigen Computerwerkzeuge noch sehr unvollkommen sind. Die Welt erforscht bereits weitere Wege in Richtung der Entwicklung künstlicher Intelligenz, bettet sie in Gegenstände ein und dringt in immer tiefere Schichten der Sprache vor.
Den ersten Vortrag der Plenarsitzung mit dem Titel „Lebendige Sprache im künstlichen Geist“ hielt Algirdas Saudargas, Mitglied des Europäischen Parlaments. Der Vortragende stellte eine grundlegende Frage, die jede Sprachgemeinschaft beantworten muss: In welchem Umfang sollte sie die Ressourcen und Technologien ihrer Muttersprache selbst entwickeln, und was kann sie bereits fertig auf der Grundlage anderer Sprachen erwerben? Im Vortrag wurden problematische Gedanken geäußert: Die litauische Sprache habe gemeinsam mit den Sprachen einiger anderer kleiner Länder „nur geringe oder gar keine technologische Unterstützung“. Sprachentechnologien erhalten nicht nur auf der politischen Tagesordnung Litauens, sondern auch Europas nicht die gebührende Aufmerksamkeit. Die im Vortrag präsentierten Überlegungen zeigten, dass sich die Entwicklung der künstlichen Intelligenz auf eine hybride Gestalt hinbewegt: Neuronale Netze entsprechen unbewussten Gehirnmechanismen, während das bewusste Denken durch traditionelle, sogenannte symbolische künstliche Intelligenz beeinflusst und modelliert wird. Jede Sprachgemeinschaft muss dafür sorgen, dass Sprachentechnologien, die der symbolischen künstlichen Intelligenz entsprechen, die gesamte Struktur der Muttersprache umfassend und präzise abbilden und dass für das Wirken neuronaler Netze ein reichhaltiges Umfeld der Muttersprache (und der eigenen Kultur) geschaffen wird.
Den zweiten Plenarvortrag mit dem Titel „Language equality in the digital age: towards a human language project“ hielt Rafael Rivera, Direktor des Beratungsunternehmens „Claves“, auf Englisch. Darin wurde die Studie der Forschungsabteilung für wissenschaftliche Perspektiven des Europäischen Parlaments „Sprachengleichheit im digitalen Zeitalter. Ein Projekt für die Muttersprache“ ausführlich vorgestellt (die Studie ist auf Englisch online verfügbar: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf).). Der Vortrag gab einen Überblick über den aktuellen Stand der Technologien für die Muttersprache und quantifizierte…
314
Acta Linguistica Lithuanica LXXVI
Page 3Lietuvių kalbos padėtis skaitmeniniame amžiuje
… die wirtschaftlichen, sozialen und linguistischen Auswirkungen von Sprache im digitalen Zeitalter; außerdem wurde die Politik der Europäischen Union im Bereich der Informations- und Kommunikationstechnologien erörtert. Im digitalen Zeitalter stellen Sprachentechnologien für Länder mit wenigen Sprecherinnen und Sprechern eine große Herausforderung dar. Unzureichend entwickelte Sprachentechnologien schaffen Ausgrenzung und Hindernisse. Das wirkt sich auf grenzüberschreitende Dienstleistungen, die Mobilität der Arbeitskräfte und den Handel aus. Ursache solcher Hindernisse sind unkoordinierte Forschungsarbeiten und unzureichende Finanzierung. Der Vortragende betonte, dass Sprachentechnologien nicht die angemessene Aufmerksamkeit der europäischen Politiker erhalten. Auf Grundlage einer Analyse der aktuellen Lage wird eine Initiative entwickelt, die die Politik von Institutionen, Forschung, Industrie, Markt und öffentlichen Dienstleistungen zusammenführen soll.
Den letzten Vortrag der Plenarsitzung mit dem Titel „Litauische Schriftsprache und gesprochene Sprache in herkömmlichen und elektronischen Medien“ hielt Laimutis Telksnys, Professor am Institut für Mathematik und Informatik der Universität Vilnius. In seinem Vortrag erklärte er, dass Methoden und Werkzeuge – Hardware und Software – entwickelt werden müssen, die den korrekten Gebrauch der litauischen Schrift- und gesprochenen Sprache in Papierdokumenten und elektronischen Medien gewährleisten. Der Vortragende stellte die wichtige Frage, wie die wenigen Millionen Litauerinnen und Litauer sich verhalten werden, damit sie nicht im Ozean der mehr als sieben Milliarden schreibenden und sprechenden Menschen und der heranwachsenden intelligenten Maschinen verschwinden. Der Professor gab auch eine Antwort: Damit dies nicht geschieht, müssen Methoden und Werkzeuge – Hardware und Software – entwickelt werden, die den korrekten Gebrauch der litauischen Schrift- und gesprochenen Sprache in Papierdokumenten und elektronischen Medien gewährleisten und den Gebrauch der litauischen und anderer Schrift- und gesprochener Sprachen in Papierdokumenten und elektronischen Medien harmonisieren. Es müssen Transkribierer entwickelt werden, die Zeichen nichtlitauischer Schriftsysteme mit litauischen Schriftzeichen wiedergeben und Laute nichtlitauischer gesprochener Sprachen mit Zeichen der litauischen gesprochenen Sprache darstellen, die sich für die automatische Lautsynthese litauischer Wörter eignen.
In der ersten Sitzung „Spracherkennung und Sprachsynthese“ wurden drei Vorträge gehalten.
Audrius Valotka (VU) und Gediminas Navickas (VU) sprachen in ihrem Vortrag „Weg von Gutenbergs Druckerpresse: Litauische Sprache in den neuesten Technologien“ über die litauische Sprache in neuesten Technologien und stellten das aus Strukturfonds finanzierte Projekt Von litauischer Sprache gesteuerte Dienste – LIEPA vor (online verfügbar: https://www.raštija.lt/liepa),), in dessen Rahmen unter anderem ein litauischer Sprachsynthesizer und Spracherkenner entwickelt wurden. Im Zuge dieses Projekts wurde der litauischen Sprache der Zugang zum digitalen Raum eröffnet. Deshalb ist das Projekt Ausbau der von litauischer Sprache gesteuerten Dienste – LIEPA 2 geplant. Die Vortragenden berichteten über die Ergebnisse des Projekts LIEPA 2, die allen Interessierten offen und kostenlos zugänglich sein und die Verwendung der litauischen Sprache in Produkten der Informationstechnologie fördern werden. Das wichtigste Ergebnis des neuen Projekts wird die Möglichkeit sein, auf natürliche Weise
Apžvalgos / Surveys
315
Page 4AURELIJA TAMULIONIENĖ
mit Gegenständen (Mobiltelefonen, Tablets, Smartwatches, Robotern) zu sprechen, ihnen Befehle mit menschlicher Stimme zu geben und ihre Antworten zu verstehen. Im Rahmen von LIEPA 2 sollen typische Dienste entwickelt werden, die neue Einsatzmöglichkeiten für durch litauische Sprache gesteuerte Dienste aufzeigen: die Steuerung eines Lernroboters, einen Anrufdienst, einen Taxirufdienst, einen mobilen Synthesizer für Blinde, einen Internet-Nachrichtenleser und einen sprachübergreifenden Kommunikator.
Laimutis Telksnys (VU) und Gediminas Navickas (VU) sprachen in ihrem Vortrag „Durch litauische Sprache gesteuerte Dienste. Lage. Perspektiven“ über die Lage und Perspektiven solcher Dienste sowie über die systematisch durchgeführten Arbeiten zu ihrer Entwicklung und zum Ausbau ihrer Nutzung. Die Arbeiten werden unter Bündelung der Kenntnisse und Ingenieurkapazitäten von Fachleuten für Informationstechnologien und litauische Sprachwissenschaftler durchgeführt. In der ersten Arbeitsphase wurden sieben durch litauische Sprache gesteuerte Dienste entwickelt und eine Infrastruktur geschaffen, die deren Funktionieren gewährleistet. Für die Zukunft ist die Entwicklung neuer durch litauische Sprache gesteuerter Dienste für mobile elektronische Umgebungen vorgesehen – für Smartphones, Tablets, Smartwatches und Roboter.
Über den aktuellen Stand und die Perspektiven der litauischen Sprachsynthese sprachen Pius Kasparaitis (VU) und Gintaras Skeris (VU). Im Vortrag „Aktueller Stand und Perspektiven der litauischen Sprachsynthese“ wurden verschiedene Dienste zur Sprachsynthese vorgestellt – darunter der LIEPA-Synthesizer, der zusammen mit seinen Quelltexten frei verbreitet wird. Dies ermöglicht es auch anderen, neue Einsatzmöglichkeiten dafür zu finden. So bieten beispielsweise die folgenden Websites neben Artikeln bereits Audioaufnahmen an: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt. Der Sprachsynthesedienst RoboBraille ermöglicht die automatische Umwandlung beliebiger Textdokumente in Audiodateien. Durch Sprachausgabe übermittelte Meldungen werden bereits am Busbahnhof Vilkaviškis vorgelesen, und virtuelle Assistenten sind schon auf der Website der Migrationsbehörde im Einsatz usw.
In der zweiten Sitzung „Digitale Ressourcen der litauischen Sprache“ wurden vier Vorträge gehalten.
Den ersten Vortrag, „E. kalba – eine Innovation bei der Nutzung digitaler Sprachressourcen“, hielten Elena Jolanta Zabarskaitė (LKI), Deimantė Budriūnaitė (LKI) und Skirmantas Šermukšnis (NetCode). Darin wurde ausführlich das neue Projekt des Instituts für Litauische Sprache vorgestellt, das auf den Ausbau der Informationsinfrastruktur für Ressourcen der litauischen Sprache (LKIIS) abzielt (online verfügbar unter: www.lkiis.lt). Im Vortrag ging es vor allem um die von der Infrastruktur des neuen Projekts des Instituts für Litauische Sprache E. kalba erzeugten Dienste – „Suche im Wortnetz“, „E. Marketing“, „E. Konzepte“ und „E. Ratschläge“. Die Vortragenden stellten die Funktionen dieser Dienste und ihre technologischen Aspekte vor. Die Projektfunktionen werden innovative Technologien der künstlichen Intelligenz zur Analyse von Nutzermeinungen umfassen. Der Dienst „E. Konzepte“ wird eine erweiterte Suche und die Anreicherung von Konzepten durch die Einbindung zusätzlicher Sprachressourcen wie zweisprachiger Wörterbücher ermöglichen,
316
Acta Linguistica Lithuanica LXXVI
Page 5Lietuvių kalbos padėtis skaitmeniniame amžiuje
Wortnetze anderer Sprachen; mithilfe eines interaktiven Wortbildungsassistenten wird es möglich sein, schnell und bequem passende Wortbildungsverfahren entsprechend der gewünschten kategorialen und gruppenspezifischen Wortbildungsbedeutung oder den Wortbildungsmitteln auszuwählen. Im Vortrag wurden außerdem die wichtigsten Ergebnisse des Projekts E. kalba und der erwartete Nutzen vorgestellt.
In ihrem Vortrag „Suchmöglichkeiten im Internet-Datenbestand litauischer Neologismen“ stellte Rita Milunaitė (LKI) vor, wie sich die Bedürfnisse der Sprachgebrauchenden möglichst vielfältig berücksichtigen lassen, und erläuterte die Datenbank litauischer Neologismen (online verfügbar unter: http://naujažodžiai.lki.lt/) sowie die Eigenschaften von Neologismen. Derzeit kann nach Parametern wie dem Stichwort, der Herkunft des Neologismus, der Originalform, Schreibvarianten, dem Verwendungsbereich usw. gesucht werden. Den Betreuern der Datenbank steht zudem eine erweiterte Suche zur Verfügung, die es erlaubt, Daten nach verschiedenen Kriterien zu bearbeiten. Im Rahmen des Projekts LKIS wird ein erweitertes Informationssuchsystem entwickelt. Die Vortragende betonte, dass die Datenbank litauischer Neologismen eine flexible und ausbaufähige digitale Ressource ist. Diese Eigenschaft ergibt sich vor allem aus dem Gegenstand selbst – dem ständig im Wandel und in Erneuerung begriffenen lexikalischen Bestand der litauischen Sprache – sowie aus den immer neuen Merkmalen, die sich Neologismenforschern erschließen, und den sich wandelnden Bedürfnissen der Nutzer. Diese Ressource soll in LKIS integriert werden (online verfügbar unter: http://lkis.lki.lt/) und nicht nur in das übergreifende System zur Suche im dortigen Datenbestand aufgenommen, sondern auch für die Erstellung von Wortnetzen genutzt werden. Der Vortrag veranschaulichte, welchen Nutzen dieser Datenbestand sowohl für Sprachexperten als auch für alle an Neologismen interessierten Nutzer haben kann.
Das Thema der Neologismen setzte Daiva Murmulaitė (LKI) mit ihrem Vortrag „Perspektiven der Erforschung der Wortbildung von Neologismen (am Beispiel des Datenbestands litauischer Neologismen)“ fort. Sie sprach über die Erforschung der Wortbildung von Neologismen und deren Perspektiven sowie darüber, wie sich abzeichnende Wortbildungsphänomene mithilfe der Datenbank litauischer Neologismen untersuchen lassen. Die Vortragende erläuterte, dass bereits in der Anfangsphase der Entwicklung dieser Datenbank erste Vorbereitungen für die Analyse der Neologismenbildung getroffen wurden: In den dafür vorgesehenen Feldern sollen die Arten der Bildungen, ihre Wortbildungsformen und -kategorien (Bedeutungen), verwandte Wörter usw. angegeben werden; ein Teil der Daten wurde bereits gesammelt. Im Feld für besondere Merkmale sind einige Neologismen als Einzelbildungen (zum Beispiel varškėfobija usw.), als Autorenbildungen (zum Beispiel demagogėja usw.) und als Kontaminationen (zum Beispiel murmanas usw.) gekennzeichnet. Die Vortragende betonte, dass für eine gründliche und hochwertige Wortbildungsanalyse auch einige der ursprünglich zur Erfassung vorgesehenen Aspekte berücksichtigt werden müssen – die Wortart des Basisworts, Veränderungen der Wortbildungsbasis, Analogien, die Rolle der Übersetzung bei der Bildung eines Neologismus, Erscheinungsformen atypischer Wortbildung usw. Wichtig ist die Entwicklung eines guten – umfassenden, flexiblen und einfach zu nutzenden, zu ergänzenden und zu bearbeitenden – Indexsystems.
Laimutis Bilkis (LKI) hielt den Vortrag „Die Struktur der geoinformationsgestützten Datenbank litauischer Ortsnamen, ihre Beziehungen zu anderen Namenbestandsdatenbanken und Entwicklungsrichtungen“
Apžvalgos / Surveys
317
Page 6AURELIJA TAMULIONIENĖ
stellte die Geoinformationsdatenbank der litauischen Ortsnamen vor (online verfügbar: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze).). Wir baten darum, über die Struktur dieser Datenbank und ihre Verbindungen zu anderen Namensdatenbanken zu sprechen. Der Referent stellte die Suchbereiche vor, die auf der öffentlichen Zugangsseite der Datenbank eingerichtet wurden: Objekttyp, Objektstatus, aktuelle administrative Zugehörigkeit (Gemeinde, Amtsbezirk, Siedlung), administrative Zugehörigkeit in der Zwischenkriegszeit (Bezirk, Amtsbezirk, Siedlung) sowie Zuflüsse von Flüssen. In der Datenbank kann nach Ortsnamen anhand folgender Merkmale gesucht werden: Name, Genus, Numerus, Akzentuierung, Wortbildungsweise, Herkunft nach der Zugehörigkeit des Basiswortes zu einer Sprache sowie Herkunft nach der Zugehörigkeit des Basiswortes zu einer lexikalischen Gruppe. In der Datenbank lassen sich authentische Ortsnamen finden, die in der Zwischenkriegszeit im Gebiet einer bestimmten Siedlung (Dorf, Kirchdorf, Gut, Kleinstadt oder Einzelhof) aufgezeichnet wurden; außerdem kann ihre genaue oder ungefähre Lage auf einer Karte angezeigt werden. Im Vortrag wurde hervorgehoben, dass bei der Integration der Datenbank in das LKIS-System drei Arten von Verweisen auf andere Namensdatenbanken geschaffen wurden: auf einen anderen Ortsnamen, von dem der Ortsname abgeleitet ist, auf einen Personennamen in der Datenbank litauischer Familiennamen, von dem der Ortsname abgeleitet ist, sowie auf historische Belege dieses Ortsnamens in der Datenbank historischer Ortsnamen. Derzeit sind etwa 25.000 Ortsnamen in die Datenbank eingepflegt und beschrieben (bzw. werden beschrieben).
Nach der Mittagspause versammelten sich Referierende und Teilnehmende zur dritten Sitzung „Korpuslinguistik“.
Den ersten Vortrag „Morphologisch und syntaktisch annotierte Korpora der litauischen Sprache“ hielten ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU) und ANDRIUS UŽA (VDU). Sie sprachen über zwei annotierte Korpora der litauischen Sprache, die am Zentrum für Computerlinguistik der Vytautas-Magnus-Universität erstellt wurden (Korpora online verfügbar: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/).). Annotierte Korpora sind grundlegende Ressourcen, ohne die die Entwicklung von Sprachtechnologien unmöglich ist. Sie werden üblicherweise zur Erstellung weiterer Ressourcen und Werkzeuge der natürlichen Sprachverarbeitung in Bereichen wie automatischer Spracherkennung, maschineller Übersetzung usw. eingesetzt. Das morphologisch annotierte Korpus MATAS wurde von 2002 bis 2014 erstellt. Es umfasst 1,6 Millionen Wörter aus Texten verschiedener Stilrichtungen. Das Korpus wurde auf der Grundlage eines 2006 zusammengestellten Korpus mit einer Million Wörtern unter Anwendung statistischer Modelle erstellt. Das syntaktisch annotierte Korpus ALKSNIS wurde 2016 als Goldstandard für weitere Forschung und Ressourcen erstellt. Es umfasst 2.355 Sätze (etwa 30.000 Wörter) aus Texten verschiedener Stilrichtungen. Die Annotation des Korpus beruht auf den Prinzipien der automatischen morphologischen und syntaktischen Annotation; dabei wurde ein Modell syntaktischer Abhängigkeiten angewandt.
Das Thema Korpora führte in ihrem Vortrag „Datenbank für feste Wortverbindungen der litauischen Sprache“ das umfangreiche Team der Konferenzreferierenden ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Institut für fortgeschrittene Technologien im Baltikum), JOLANTA KOVALSKAITĖ weiter.
318
Acta Linguistica Lithuanica LXXVI
Page 7Lietuvių kalbos padėtis skaitmeniniame amžiuje
(VDU), Tomas Krilavičius (Institut für fortgeschrittene Technologien im Baltikum), Justina Mandravikaitė (Institut für fortgeschrittene Technologien im Baltikum), Laura Vilkaitė (Institut für fortgeschrittene Technologien im Baltikum). Den Vortrag auf der Konferenz stellte Erika Rimkutė (VDU) vor; sie sprach vor allem über die Methodik zur Untersuchung fester Wortverbindungen in der gegenwärtigen geschriebenen litauischen Sprache sowie über ein in Vorbereitung befindliches, korpusbasiertes Kollokationswörterbuch der litauischen Sprache. Im Rahmen des Projekts Automatische Erkennung fester Wortverbindungen der litauischen Sprache (PASTOVU) (Nr. LIP-027/2016) (siehe http://mwe.lt/),) sollen eine Methodik zur Untersuchung fester Wortverbindungen in der gegenwärtigen geschriebenen litauischen Sprache entwickelt und ein korpusbasiertes Kollokationswörterbuch der litauischen Sprache erstellt werden. Im Projekt wurde ein Korpus von Delfi.lt aus den Jahren 2014–2016 mit einem Umfang von 72 Millionen Wörtern zusammengestellt und verwendet. Das Kollokationswörterbuch wird auf der Grundlage einer Datenbank erstellt. Diese wird verschiedene Informationen zu festen Wortverbindungen enthalten: grammatische und lexikalische Angaben, Gebrauchshäufigkeit, Textsparte, Konkordanzbeispiele usw.
Auch Vertreterinnen der Universität Vilnius, Gintarė Judžentytė (VU) und Vilma Zubaitienė (VU), stellten Korpusforschungen vor. In ihrem Vortrag „Korpusbasierte Untersuchungen akademischer Phrasen: formale Struktur und Semantik“ ging es um die Struktur und Semantik von Phrasen der akademischen Sprache, gestützt auf das derzeit an der Universität Vilnius erstellte Korpus studentischer schriftlicher Arbeiten. Dieses ist eines der geplanten Ergebnisse des von der Staatlichen Kommission für die litauische Sprache geförderten Projekts Untersuchungen zu Phrasen in studentischen Arbeiten und interaktives Phraseologiewörterbuch. Ziel des Projekts ist es, eine Liste wichtiger Wörter für das akademische Schreiben zu erstellen, zentrale Kollokationen und ihre Erweiterungen sowie wiederkehrende Wortfolgen in verschiedenen Teilen akademischer Texte herauszuarbeiten, ihre Beziehungen zu den rhetorischen Funktionen der Textabschnitte zu erörtern und die Bedeutungen akademischer Wörter wie tikslas, uždavinys, metodai, išvados, rezultatai; atlikti, analizuoti, nustatyti, remtis sowie deren Gebrauch und Semantik zu beschreiben.
In der letzten Sitzung „Automatisierte Analyse von Sprachstruktur und Texten“ wurden vier Vorträge gehalten.
Die Sitzung begann mit einem Vortrag von Danielius Račys (VU) mit dem Titel „Maschinelle Übersetzung für die litauische Sprache“. Darin ging es um die jüngste Geschichte und die Erfolge der maschinellen Übersetzung, um Projekte verschiedener Institutionen sowie um neue Durchbrüche bei der neuronalen maschinellen Übersetzung. Der Referent sprach über die Entwicklung und die Erfolge der maschinellen Übersetzung, die heute auch für die litauische Sprache wirksam eingesetzt wird. Von 2005 bis 2007 führte die Vytautas-Magnus-Universität das aus EU-Strukturfonds finanzierte Projekt Online-Informationsübersetzungstool durch. Das Ergebnis war ein öffentlich zugänglicher Online-Übersetzungsdienst vom Englischen ins Litauische (online verfügbar: http://vertimas.vdu.lt/twsas/).). Von 2012 bis 2014 führte die Universität Vilnius das von der EU finanzierte Projekt Entwicklung eines auf statistischen Methoden beruhenden maschinellen Übersetzungssystems für die Sprachpaare Englisch–Litauisch–Englisch und Französisch–Litauisch–Französisch durch. Das Ergebnis war ein öffentlich zugänglicher Online-Übersetzungsdienst (online verfügbar: https://www.versti.eu/).). Dennoch
Apžvalgos / Surveys
319
Page 8AURELIJA TAMULIONIENĖ
Selbst für die besten maschinellen Übersetzungen ist das Eingreifen eines Übersetzers erforderlich. Können Maschinen also wirklich gut übersetzen? Die vergangenen Jahre versprechen neue Durchbrüche durch den Einsatz neuronaler maschineller Übersetzung. Die Universität Vilnius bereitet sich darauf vor, 2018 mit der Implementierung einer maschinellen Übersetzung der nächsten Generation für Englisch, Litauisch, Polnisch, Französisch, Russisch und Deutsch zu beginnen. Es wurde erfreut festgestellt, dass die neuesten Fortschritte der maschinellen Übersetzung auch der litauischen Sprache zugutekommen.
In seinem Vortrag „Die Grammatik der litauischen Sprache in der Welt der quelloffenen digitalen Technologien“ sprach Virginijus Dudkevičius (VU) über die Entwicklung einer Computermorphologie der nächsten Generation für das Litauische, die morphologische Analyse und Synthese von Wörtern, die intelligente Suche nach Textinformationen und Ähnliches. Mit dem Aufkommen der Computer wurden die klassische Grammatik und Lexik gezwungen, sich „ein neues Gewand anzuziehen“ und zu einem vollwertigen Bestandteil neuer Technologien zu werden. Zu diesem Zweck wurde eine Computermorphologie der nächsten Generation für das Litauische entwickelt, für die folgende Ziele festgelegt wurden: ausschließlich quelloffenen Code zu verwenden und zu entwickeln; nur die Daten selbst, nicht aber ihre Form und Interpretation, dürfen sprachspezifische Eigenschaften aufweisen; der gesamte Programmcode muss universell sein und sich für jede andere Sprache eignen; erfolgreiche Lösungen, die für andere Sprachen der Welt entwickelt wurden, möglichst umfassend zu nutzen. Grundlage dafür ist die Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) sowie Textkorpora (insgesamt etwa 1,5 Milliarden Wörter). Derzeit sind durchschnittlich etwa 99% eines im Internet erscheinenden Textes „erkennbar“; das heißt, der morphologische Analysator interpretiert im Durchschnitt 99 von 100 Wörtern korrekt. Diese neu entwickelte Methode der morphologischen Analyse wurde erfolgreich im System der syntaktisch-semantischen Analyse der Vytautas-Magnus-Universität eingesetzt (online verfügbar unter: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) sowie im Rechtsaktregister des Seimas der Republik Litauen (online verfügbar unter: www.e-tar.lt).
Das Thema der digitalen Grammatik setzten Daiva Šveikauskienė (LKI) und Vytautas Šveikauskas (LKI) fort. In ihrem Vortrag „Die digitale Grammatik der litauischen Sprache“ sprachen sie über die am Institut für Litauische Sprache begonnene Entwicklung einer digitalen Grammatik des Litauischen, die auch in anderen Bereichen der computergestützten Sprachverarbeitung eingesetzt werden kann: für die grammatische Analyse, die direkte Datenübersetzung und anderes. Vorgestellt wurde ein Projekt, in dessen Rahmen eine Anbindung an das internationale System DIGITAL GRAMMARS geplant ist, das derzeit 32 Sprachen umfasst. Das Hauptziel der Entwicklung der digitalen Grammatik ist ihr Einsatz in automatischen Übersetzungssystemen, die mit nichtstatistischen Methoden arbeiten. Für die litauische Sprache ist dies äußerst relevant. Den Daten von 2017 zufolge ist die Übersetzungsqualität von Tildės, Google ins Litauische und aus dem Litauischen sogar schlechter als bei Lettisch oder Estnisch. Daher ist es für Litauen sehr wichtig, eine alternative Variante der automatischen Übersetzung zu entwickeln. Derzeit wurde ein Prototyp einer digitalen Grammatik erstellt, der einige Wörter umfasst; doch bereits daran lässt sich erkennen, dass die Übersetzungsqualität hier viel besser ist, insbesondere bei Sätzen, in denen sich spezifische Merkmale der litauischen Sprache widerspiegeln. Solange die englische Wortstellung verwendet wird, liefern auch statistische
320
Acta Linguistica Lithuanica LXXVI
Page 9Lietuvių kalbos padėtis skaitmeniniame amžiuje
Methoden recht gute Übersetzungen. Bei einer nicht standardmäßigen Wortstellung im Satz verliert die Übersetzung von Google jedoch nicht den Sinn des Satzes. Die digitale Grammatik kann auch in anderen Bereichen der computergestützten Sprachverarbeitung eingesetzt werden: für die grammatische Analyse, die direkte Datenübersetzung und anderes. Die Entwicklung digitaler Grammatiken wird von Aarne Ranta, Professor an der Universität Göteborg (Schweden), geleitet.
Den letzten Konferenzvortrag mit dem Titel „Wer hat von wem abgeschrieben? Automatisierung und Visualisierung der Erforschung der Geschichte der Bibelübersetzungen“ hielt Mindaugas Šinkūnas (LKI). In dem Vortrag ging es um die Automatisierung und Visualisierung der Erforschung der Geschichte der Bibelübersetzungen. Die Ergebnisse des Vergleichs biblischer Verse präsentierte der Referent anhand anschaulicher und umfangreicher Diagramme. Die zahlreichen Bibelzitate in den alten litauischen Schriften erschweren die Untersuchung ihrer Beziehungen. Benötigt wird eine praktische Datenplattform, die es ermöglicht, biblische Verse nach den für Forschende relevanten Merkmalen zu gruppieren. Die größten Schwierigkeiten bereitet die Bewertung der Ähnlichkeit von Zitaten. Eine umfassende lexikalische, syntaktische und morphologische (in bestimmten Fällen auch orthografische) Analyse ermöglicht dies; eine solche philologische Untersuchung ist jedoch langsam und lässt sich derzeit nicht automatisieren. Der Vergleich ließ sich mithilfe zyklisch arbeitender Algorithmen automatisieren, deren Aufgabe darin besteht, identische Sequenzen in zwei Zeichenfolgen zu erkennen und zu berechnen, welchen Anteil der verglichenen Sequenzen sie abdecken. Die uneinheitliche Orthografie der alten Schriften erschwert die Automatisierung des Vergleichs. Der Vergleich manuell und automatisch transliterierter Verse ergab, dass die Art der Transliteration keinen wesentlichen Einfluss auf die Ergebnisse hat. Beim Vergleich von Texten, die in verschiedenen Dialekten verfasst wurden, können die Ergebnisse strittig sein (eine Nivellierung dialektologischer Merkmale wurde nicht erprobt). Die erzielten Ähnlichkeitswerte werden in zweidimensionalen Diagrammen zusammengefasst. Die Ergebnisse des computergestützten Vergleichs biblischer Verse aus Bretkūnas Postilės (1591) stimmen mit den Schlussfolgerungen überein, zu denen frühere Forschende mit anderen Methoden gelangt sind.
Die Konferenz endete mit Diskussionen. Auf Grundlage der Konferenzvorträge verfasste Artikel werden in den wissenschaftlichen Zeitschriften Bendrinė kalba (online verfügbar unter: www.bendrinekalba.lt) und Lietuvių kalba (www.lietuviukalba.lt) veröffentlicht.
LITERATŪRA
Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.
Įteikta 2017 m. lapkričio 3 d.
AURELIJA TAMULIONIENĖ
Lietuvių kalbos institutas
Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva
[email protected]
Apžvalgos / Surveys
321