scieee.
LT original EN DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

AURELIJA TAMULIONIENĖ

Ινστιτούτο Λιθουανικής Γλώσσας

Ερευνητικές κατευθύνσεις: μελέτες της χρήσης της σύγχρονης λιθουανικής γλώσσας και της ποικιλότητάς της.

Η ΘΕΣΗ ΤΗΣ ΛΙΘΟΥΑΝΙΚΗΣ ΓΛΩΣΣΑΣ ΣΤΗΝ ΨΗΦΙΑΚΗ ΕΠΟΧΗ

Σχετικά με το 24ο Συνέδριο Jono Jablonskio

Κατευθύνσεις ανάπτυξης και δυνατότητες αξιοποίησης των ψηφιακών γλωσσικών πόρων

Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinka­mas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).

Το επιστημονικό συνέδριο, που πήρε το όνομά του από τον Jonas Jablonskis, πραγματοποιήθηκε για πρώτη φορά το 1993 από το Τμήμα Γλωσσικού Πολιτισμού του Ινστιτούτου Λιθουανικής Γλώσσας και την Έδρα Λιθουανικής Γλώσσας του Πανεπιστημίου του Βίλνιους. Έκτοτε, τα συνέδρια καθιερώθηκαν ως παράδοση και πραγματοποιούνται κάθε φθινόπωρο (από το 2003 εναλλάξ στο Ινστιτούτο Λιθουανικής Γλώσσας ή στο Πανεπιστήμιο του Βίλνιους).

Στις 29 Σεπτεμβρίου 2017 πραγματοποιήθηκε το 24ο επιστημονικό συνέδριο Jonas Jablonskis με τίτλο Κατευθύνσεις ανάπτυξης και δυνατότητες αξιοποίησης των ψηφιακών γλωσσικών πόρων (αν. Digital Language Resources, Directions of Their Development and Possibilities to Harness Them) στο Ινστιτούτο Λιθουανικής Γλώσσας. Το συνέδριο διοργανώθηκε από το Κέντρο Έρευνας της Κοινής Γλώσσας του Ινστιτούτου Λιθουανικής Γλώσσας σε συνεργασία με το Ινστιτούτο Εφαρμοσμένης Γλωσσολογίας του Πανεπιστημίου του Βίλνιους. Ως προς τη θεματολογία του, το συνέδριο διέφερε από τα προηγούμενα· στόχος του ήταν να συζητηθούν τα ζητήματα που ανακύπτουν στη διασταύρωση γλωσσών και ψηφιακών τεχνολογιών και τα οποία αντιμετωπίζονται κατά την ανάπτυξη ψηφιακών πόρων και τη δημιουργία μιας ενιαίας ψηφιακής αγοράς. Στο επίκεντρο του συνεδρίου βρέθηκε το σημασιολογικό επίπεδο των ψηφιακών πόρων (η δημιουργία δικτύων λέξεων), καθώς και η προσθήκη ηχητικής μορφής στους ψηφιακούς πόρους, η ανάπτυξη νέων δυνατοτήτων για τη διάδοση ψηφιακών πόρων σε πολυγλωσσικές κοινότητες κ.ά.

Στο συνέδριο συμμετείχαν εισηγητές από το εξωτερικό: από το Ευρωπαϊκό Κοινοβούλιο και την Ισπανία, καθώς και ερευνητές από διάφορα ιδρύματα της Λιθουανίας: το Ινστιτούτο Λιθουανικής Γλώσσας, το Πανεπιστήμιο του Βίλνιους

Straipsniai / Articles

313

AURELIJA TAMULIONIENĖ

του πανεπιστημίου, του Πανεπιστημίου Vytautas Magnus, του Ινστιτούτου Προηγμένων Τεχνολογιών της Βαλτικής, της UAB «Netcode». Στο συνέδριο παρουσιάστηκαν 17 ανακοινώσεις. Οι ομιλητές παρουσίασαν τις ανακοινώσεις τους και μοιράστηκαν τις έρευνες και την εμπειρία τους σε τέσσερις συνεδρίες.

Το συνέδριο ξεκίνησε με εισαγωγικές ομιλίες. Τους συμμετέχοντες και τους ομιλητές καλωσόρισαν ο ευρωβουλευτής Algirdas Saudargas και η διευθύντρια του Ινστιτούτου Λιθουανικής Γλώσσας, καθηγήτρια δρ Jolanta Elena Zabarskaitė. Την εναρκτήρια ομιλία εκφώνησε η δρ Rita Miliūnaitė, κύρια ερευνήτρια του Κέντρου Έρευνας της Κοινής Γλώσσας του Ινστιτούτου Λιθουανικής Γλώσσας. Έγινε λόγος για το γεγονός ότι οι δεσμοί μεταξύ της λιθουανικής γλώσσας και της τεχνολογίας των πληροφοριών έχουν ενισχυθεί σημαντικά τα τελευταία χρόνια· διαθέτουμε απτά αποτελέσματα τόσο στην ψηφιοποίηση γλωσσικών πόρων όσο και στην ανάπτυξη εργαλείων γλωσσικής ανάλυσης, αναγνώρισης και σύνθεσης, αλλά, σε σύγκριση με τις ταχύτατες αλλαγές που συντελούνται παγκοσμίως σε αυτόν τον τομέα, η λιθουανική γλώσσα έχει ακόμη πολύ δρόμο να διανύσει. Επειδή η λιθουανική είναι κλιτή γλώσσα, δεν μπορούμε να προσαρμόσουμε άμεσα τις τεχνολογίες πληροφοριών που έχουν δημιουργηθεί για την αγγλική γλώσσα· γι’ αυτό τα σημερινά εργαλεία μηχανικής μετάφρασης και άλλα υπολογιστικά εργαλεία μας παραμένουν πολύ ατελή, ενώ ο κόσμος ήδη ερευνά και προχωρά περαιτέρω, προς την κατεύθυνση της ανάπτυξης της τεχνητής νοημοσύνης, ενσωματώνοντάς την σε αντικείμενα και διεισδύοντας σε όλο και βαθύτερα στρώματα της γλώσσας.

Στην ολομέλεια, την πρώτη ανακοίνωση, με τίτλο «Η ζωντανή γλώσσα στο τεχνητό μυαλό», παρουσίασε ο ευρωβουλευτής Algirdas Saudargas. Ο ομιλητής έθεσε ένα θεμελιώδες ερώτημα στο οποίο οφείλει να απαντήσει κάθε γλωσσική κοινότητα: σε ποιον βαθμό πρέπει να αναπτύσσει η ίδια τους πόρους και τις τεχνολογίες της μητρικής της γλώσσας και τι μπορεί να προμηθευτεί έτοιμο, βασισμένο σε άλλες γλώσσες. Στην ανακοίνωση διατυπώθηκαν προβληματισμοί σύμφωνα με τους οποίους η λιθουανική, μαζί με τις γλώσσες ορισμένων άλλων μικρών χωρών, «έχει ελάχιστη ή καθόλου τεχνολογική υποστήριξη». Οι τεχνολογίες γλώσσας δεν τυγχάνουν της δέουσας προσοχής ούτε στην πολιτική ατζέντα της Λιθουανίας ούτε σε εκείνη της Ευρώπης. Η ανακοίνωση παρουσίασε ιδέες που καταδεικνύουν ότι η ανάπτυξη της τεχνητής νοημοσύνης συγκλίνει προς μια υβριδική μορφή, στην οποία τα νευρωνικά δίκτυα αντιστοιχούν στους ασυνείδητους μηχανισμούς του εγκεφάλου, ενώ η συνειδητή σκέψη διαμορφώνεται από την παραδοσιακή, λεγόμενη συμβολική τεχνητή νοημοσύνη. Κάθε γλωσσική κοινότητα οφείλει να φροντίζει ώστε οι τεχνολογίες γλώσσας που αντιστοιχούν στη συμβολική τεχνητή νοημοσύνη να αποτυπώνουν πλήρως και με ακρίβεια όλη τη δομή της μητρικής γλώσσας και να δημιουργείται ένα πλούσιο περιβάλλον της μητρικής γλώσσας (και του μητρικού πολιτισμού) για την εκπαίδευση των νευρωνικών δικτύων.

Τη δεύτερη ανακοίνωση της ολομέλειας, με τίτλο «Language equality in the digital age: towards a human language project», παρουσίασε στα αγγλικά ο Rafael Rivera, διευθυντής της συμβουλευτικής εταιρείας «Claves». Η ανακοίνωση παρουσίασε διεξοδικά τη μελέτη της Μονάδας Επιστημονικής Προοπτικής Διερεύνησης του Ευρωπαϊκού Κοινοβουλίου «Ισότητα των γλωσσών στην ψηφιακή εποχή. Το σχέδιο για τη μητρική γλώσσα» (η μελέτη είναι διαθέσιμη στα αγγλικά στο διαδίκτυο: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf).). Η ανακοίνωση εξέτασε την τρέχουσα κατάσταση των τεχνολογιών μητρικής γλώσσας, ποσοτικοποιώντας

314

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

τις οικονομικές, κοινωνικές και γλωσσικές συνέπειες της γλώσσας στην ψηφιακή εποχή, και συζητήθηκε η πολιτική της Ευρωπαϊκής Ένωσης για τις τεχνολογίες πληροφοριών και επικοινωνιών. Στην ψηφιακή εποχή, οι τεχνολογίες γλώσσας αποτελούν τεράστια πρόκληση για τις χώρες με λίγους ομιλητές. Οι ανεπαρκώς ανεπτυγμένες τεχνολογίες γλώσσας δημιουργούν αποκλεισμούς και εμπόδια. Αυτό επηρεάζει τις διασυνοριακές υπηρεσίες, την κινητικότητα των εργαζομένων και το εμπόριο. Αιτία αυτών των εμποδίων είναι ο ασυντόνιστος ερευνητικός τομέας και η ανεπαρκής χρηματοδότηση. Ο ομιλητής τόνισε ότι οι τεχνολογίες γλώσσας δεν τυγχάνουν της ανάλογης προσοχής από τους Ευρωπαίους πολιτικούς. Με βάση την ανάλυση της σημερινής κατάστασης, αναπτύσσεται μια πρωτοβουλία που θα συνενώσει τις πολιτικές των θεσμών, της έρευνας, της βιομηχανίας, της αγοράς και των δημόσιων υπηρεσιών.

Την τελευταία ανακοίνωση της ολομέλειας, με τίτλο «Η γραπτή και προφορική λιθουανική γλώσσα σε συμβατικά και ηλεκτρονικά μέσα», παρουσίασε ο Laimutis Telksnys, καθηγητής στο Ινστιτούτο Μαθηματικών και Πληροφορικής του Πανεπιστημίου του Βίλνιους. Στην ανακοίνωση επισημάνθηκε ότι είναι απαραίτητο να αναπτυχθούν μέθοδοι και εργαλεία —υλικό και λογισμικό— που θα διασφαλίζουν την ορθή χρήση της γραπτής και προφορικής λιθουανικής γλώσσας σε έντυπα έγγραφα και σε ηλεκτρονικά μέσα. Ο ομιλητής έθεσε ένα σημαντικό ερώτημα: πώς θα συμπεριφερθούν τα λίγα εκατομμύρια Λιθουανών, ώστε να μην εξαφανιστούν στον ωκεανό των περισσότερων από 7 δισεκατομμυρίων ανθρώπων που γράφουν και μιλούν, καθώς και των επερχόμενων έξυπνων μηχανών. Ο καθηγητής έδωσε και την απάντηση: για να μη συμβεί αυτό, είναι απαραίτητο να αναπτυχθούν μέθοδοι και εργαλεία —υλικό και λογισμικό— που θα διασφαλίζουν την ορθή χρήση της γραπτής και προφορικής λιθουανικής γλώσσας σε έντυπα έγγραφα και σε ηλεκτρονικά μέσα, και θα εναρμονίζουν τη χρήση της γραπτής και προφορικής λιθουανικής και άλλων γλωσσών σε έντυπα έγγραφα και σε ηλεκτρονικά μέσα. Χρειάζεται να δημιουργηθούν μεταγραφείς, ώστε τα γραπτά σύμβολα ξένων γλωσσών να αποδίδονται με λιθουανικά γραπτά σύμβολα και οι ήχοι ξένων προφορικών γλωσσών να αποδίδονται με σύμβολα της λιθουανικής προφορικής γλώσσας, κατάλληλα για την αυτόματη σύνθεση των ήχων των λέξεων της λιθουανικής ομιλίας.

Στην πρώτη συνεδρία, «Αναγνώριση και σύνθεση ομιλίας», παρουσιάστηκαν τρεις ανακοινώσεις.

Οι Audrius Valotka (VU) και Gediminas Navickas (VU), στην ανακοίνωσή τους «Μακριά από το πιεστήριο του Gutenberg: η λιθουανική ομιλία στις νεότερες τεχνολογίες», μίλησαν για τη λιθουανική ομιλία στις νεότερες τεχνολογίες και παρουσίασαν το έργο που χρηματοδοτείται από τα Διαρθρωτικά Ταμεία Υπηρεσίες ελεγχόμενες με λιθουανική ομιλία – LIEPA (διαθέσιμο στο διαδίκτυο: https://www.raštija.lt/liepa),), στο πλαίσιο του οποίου δημιουργήθηκαν, μεταξύ άλλων, ένας συνθέτης και ένας αναγνωριστής λιθουανικής ομιλίας. Κατά την υλοποίηση αυτού του έργου, άνοιξε ο δρόμος για τη λιθουανική ομιλία στον ψηφιακό χώρο· για τον λόγο αυτό σχεδιάζεται το έργο Ανάπτυξη υπηρεσιών ελεγχόμενων με λιθουανική ομιλία – LIEPA 2. Οι ομιλητές μίλησαν για τα αποτελέσματα του έργου LIEPA 2, τα οποία θα είναι ανοιχτά και δωρεάν διαθέσιμα σε όλους τους ενδιαφερομένους και θα ενθαρρύνουν τη χρήση της λιθουανικής ομιλίας σε προϊόντα τεχνολογίας πληροφοριών. Το σημαντικότερο αποτέλεσμα του νέου έργου θα είναι η δυνατότητα φυσικής

Apžvalgos / Surveys

315

AURELIJA TAMULIONIENĖ

να επικοινωνούν με αντικείμενα (κινητά τηλέφωνα, tablet, έξυπνα ρολόγια, ρομπότ), να δίνουν εντολές με ανθρώπινη φωνή και να κατανοούν τις απαντήσεις τους. Στο LIEPA 2 προβλέπεται η δημιουργία τυπικών υπηρεσιών που αναδεικνύουν νέες δυνατότητες χρήσης υπηρεσιών ελεγχόμενων με ομιλία στα λιθουανικά: ενός ελεγκτή εκπαιδευτικού ρομπότ, ενός τηλεφωνητή, μιας υπηρεσίας κλήσης ταξί, ενός κινητού συνθέτη φωνής για τυφλούς, ενός αναγνώστη διαδικτυακών ειδήσεων και ενός διαγλωσσικού επικοινωνητή.

Οι Laimutis Telksnys (VU) και Gediminas Navickas (VU), στην ανακοίνωσή τους «Υπηρεσίες ελεγχόμενες με ομιλία στα λιθουανικά. Κατάσταση. Προοπτικές», μίλησαν για την κατάσταση και τις προοπτικές των υπηρεσιών αυτών, καθώς και για τις συστηματικές εργασίες δημιουργίας και επέκτασης της χρήσης τους. Οι εργασίες πραγματοποιούνται συνδυάζοντας τις γνώσεις ειδικών στις τεχνολογίες της πληροφορίας και φιλολόγων της λιθουανικής γλώσσας με τις μηχανικές δυνατότητες. Κατά το πρώτο στάδιο των εργασιών δημιουργήθηκαν επτά υπηρεσίες ελεγχόμενες με ομιλία στα λιθουανικά, καθώς και η υποδομή που διασφαλίζει τη λειτουργία τους. Στο μέλλον προβλέπεται η δημιουργία νέων υπηρεσιών ελεγχόμενων με ομιλία στα λιθουανικά για το κινητό ηλεκτρονικό περιβάλλον – έξυπνα κινητά τηλέφωνα, tablet, έξυπνα ρολόγια και ρομπότ.

Για το παρόν και τις προοπτικές της σύνθεσης φωνής στα λιθουανικά μίλησαν οι Pius Kasparaitis (VU) και Gintaras Skeris (VU). Στην ανακοίνωση «Το παρόν και οι προοπτικές της σύνθεσης φωνής στα λιθουανικά» παρουσιάστηκαν διάφορες υπηρεσίες εκφώνησης κειμένου – ο συνθέτης φωνής LIEPA, ο οποίος διανέμεται ελεύθερα μαζί με τους πηγαίους κώδικες, γεγονός που επιτρέπει και σε άλλους να βρίσκουν νέες εφαρμογές του. Για παράδειγμα, ηχογραφήσεις φωνής δίπλα σε άρθρα παρέχονται ήδη από τους ιστοτόπους: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt, ενώ η υπηρεσία εκφώνησης κειμένου RoboBraille μετατρέπει αυτόματα οποιοδήποτε κειμενικό έγγραφο σε αρχεία ήχου. Ανακοινώσεις που εκφωνούνται με συνθετική φωνή ακούγονται ήδη στον σταθμό λεωφορείων του Vilkaviškis, ενώ εικονικοί βοηθοί λειτουργούν ήδη στον ιστότοπο του Τμήματος Μετανάστευσης κ.ο.κ.

Στη δεύτερη συνεδρία, με τίτλο «Ψηφιακοί πόροι της λιθουανικής γλώσσας», παρουσιάστηκαν τέσσερις ανακοινώσεις.

Την πρώτη ανακοίνωση, «E. kalba – μια καινοτομία στη χρήση ψηφιακών γλωσσικών πόρων», παρουσίασαν οι Elena Jolanta Zabarskaitė (LKI), Deimantė Budriūnaitė (LKI) και Skirmantas Šermukšnis (NetCode). Η ανακοίνωση παρουσίασε διεξοδικά το νέο έργο του Ινστιτούτου Λιθουανικής Γλώσσας, το οποίο αποσκοπεί στην επέκταση της πληροφοριακής υποδομής των πόρων της λιθουανικής γλώσσας (LKIIS) (διαθέσιμο στο διαδίκτυο: www.lkiis.lt). Η ανακοίνωση επικεντρώθηκε κυρίως στις υπηρεσίες που παράγονται από την υποδομή του νέου έργου του Ινστιτούτου Λιθουανικής Γλώσσας E. kalba: «Αναζήτηση στο δίκτυο λέξεων», «E. μάρκετινγκ», «E. έννοιες» και «E. συμβουλές». Οι ομιλητές παρουσίασαν τις λειτουργίες των υπηρεσιών και τις τεχνολογικές πτυχές τους. Οι λειτουργίες του έργου θα περιλαμβάνουν καινοτόμες τεχνολογίες τεχνητής νοημοσύνης για την ανάλυση των απόψεων των χρηστών, ενώ η υπηρεσία «E. έννοιες» θα εξασφαλίζει εκτεταμένη αναζήτηση και εμπλουτισμό εννοιών, με την ενσωμάτωση πρόσθετων γλωσσικών πόρων, όπως δίγλωσσα λεξικά,

316

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

δίκτυα λέξεων άλλων γλωσσών. Θα παρέχεται η δυνατότητα γρήγορης και εύκολης επιλογής κατάλληλων τρόπων σχηματισμού λέξεων μέσω ενός διαδραστικού οδηγού σχηματισμού λέξεων, ανάλογα με την επιθυμητή σημασιολογική κατηγορία και ομάδα ή με τα μέσα σχηματισμού λέξεων. Στην ανακοίνωση παρουσιάστηκαν επίσης τα κύρια αποτελέσματα του έργου E. kalba και τα αναμενόμενα οφέλη.

Στην ανακοίνωσή της «Δυνατότητες αναζήτησης στο διαδικτυακό Λεξικό νεολογισμών της λιθουανικής γλώσσας», η Rita Milunaitė (LKI) παρουσίασε τρόπους με τους οποίους μπορούν να αποκαλυφθούν οι ποικίλες ανάγκες των χρηστών της γλώσσας, μέσω του Λεξικού νεολογισμών της λιθουανικής γλώσσας (διαθέσιμο στο διαδίκτυο: http://naujažodžiai.lki.lt/)). Επί του παρόντος, είναι δυνατή η αναζήτηση με βάση παραμέτρους όπως η λημματική μορφή, η προέλευση του νεολογισμού, η αρχική μορφή, οι ορθογραφικές παραλλαγές, ο τομέας χρήσης κ.ά. Οι διαχειριστές της βάσης δεδομένων έχουν επίσης πρόσβαση σε ευρύτερη αναζήτηση, απαραίτητη για την επεξεργασία των δεδομένων από διάφορες οπτικές γωνίες. Στο πλαίσιο του έργου LKIS θα δημιουργηθεί ένα εκτεταμένο σύστημα αναζήτησης πληροφοριών. Η ομιλήτρια τόνισε ότι το Λεξικό νεολογισμών της λιθουανικής γλώσσας είναι ένας ευέλικτος ψηφιακός πόρος, ανοιχτός στην επέκταση. Αυτό οφείλεται πρωτίστως στα ίδια τα δεδομένα – στο συνεχώς μεταβαλλόμενο και ανανεούμενο λεξιλογικό επίπεδο της λιθουανικής γλώσσας – καθώς και στα νέα χαρακτηριστικά των δεδομένων που καθίστανται διαθέσιμα στους ερευνητές νεολογισμών και στις μεταβαλλόμενες ανάγκες των χρηστών. Προβλέπεται η ενσωμάτωση αυτού του πόρου στο LKIS (διαθέσιμο στο διαδίκτυο: http://lkis.lki.lt/)), καθώς και η ένταξή του όχι μόνο στο ενιαίο σύστημα αναζήτησης των συγκεντρωμένων δεδομένων, αλλά και η αξιοποίησή του για τη δημιουργία δικτύων λέξεων. Η ανακοίνωση έδειξε παραστατικά πόσο χρήσιμο μπορεί να είναι αυτό το λεξικό τόσο για τους ειδικούς της γλώσσας όσο και για όλους τους χρήστες που ενδιαφέρονται για τους νεολογισμούς.

Το θέμα των νεολογισμών συνεχίστηκε με την ανακοίνωση «Προοπτικές της έρευνας για τον σχηματισμό νεολογισμών (η περίπτωση του Λεξικού νεολογισμών της λιθουανικής γλώσσας)» της Daiva Murmulaitė (LKI), η οποία μίλησε για την έρευνα του σχηματισμού νεολογισμών και τις προοπτικές της, καθώς και για το πώς μπορούν να μελετηθούν τα αναδυόμενα φαινόμενα σχηματισμού νεολογισμών με τη χρήση του Λεξικού νεολογισμών της λιθουανικής γλώσσας. Η ομιλήτρια ανέφερε ότι ήδη από το αρχικό στάδιο δημιουργίας αυτής της βάσης δεδομένων είχε γίνει προκαταρκτική προετοιμασία για την ανάλυση του σχηματισμού νεολογισμών: τα σχετικά πεδία προβλέπουν την καταγραφή των ειδών των παραγώγων, των μορφών σχηματισμού τους, των κατηγοριών σχηματισμού (σημασιών), των συγγενικών λέξεων κ.ά., ενώ έχει ήδη συγκεντρωθεί μέρος των δεδομένων. Στο πεδίο των ειδικών χαρακτηριστικών ορισμένοι νεολογισμοί σημειώνονται ως μοναδικοί (για παράδειγμα, varškėfobija κ.ά.), προσωπικοί δημιουργημένοι (για παράδειγμα, demagogėja κ.ά.) και συμφυρματικοί (για παράδειγμα, murmanas κ.ά.). Η ομιλήτρια τόνισε ότι για μια διεξοδική και ποιοτική ανάλυση του σχηματισμού λέξεων είναι επίσης σημαντικό να λαμβάνονται υπόψη ορισμένα στοιχεία που προβλεπόταν εξαρχής να καταγράφονται: το μέρος του λόγου της λέξης-βάσης του παραγώγου, οι μεταβολές της βάσης σχηματισμού, οι αναλογίες, ο ρόλος της μετάφρασης στη δημιουργία ενός νεολογισμού, οι εκδηλώσεις μη τυπικού σχηματισμού κ.ά. Είναι σημαντικό να δημιουργηθεί ένα καλό σύστημα δεικτών – διεξοδικό, ευέλικτο και εύχρηστο για χρήση, συμπλήρωση και τροποποίηση.

Ο Laimutis Bilkis (LKI), στην ανακοίνωση «Η δομή της γεωπληροφοριακής βάσης δεδομένων των τοπωνυμίων της Λιθουανίας, οι σχέσεις της με άλλες βάσεις δεδομένων ονοματολογίας και οι κατευθύνσεις ανάπτυξής της»

Apžvalgos / Surveys

317

AURELIJA TAMULIONIENĖ

παρουσίασε τη Γεωπληροφοριακή βάση δεδομένων τοπωνυμίων της Λιθουανίας (διαθέσιμη στο διαδίκτυο: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). Ζητήσαμε να μιλήσει για τη δομή αυτής της βάσης και τις διασυνδέσεις της με άλλες βάσεις δεδομένων ονομάτων. Ο ομιλητής παρουσίασε τα πεδία αναζήτησης που δημιουργήθηκαν στη σελίδα δημόσιας πρόσβασης της βάσης: τύπος αντικειμένου, καθεστώς αντικειμένου, σημερινή διοικητική εδαφική υπαγωγή (δήμος, κοινότητα, οικισμός), διοικητική εδαφική υπαγωγή κατά τον Μεσοπόλεμο (κομητεία, δήμος, οικισμός), παραπόταμοι ποταμών. Στη βάση, οι πληροφορίες για τα τοπωνύμια είναι δυνατό να αναζητηθούν με βάση τα ακόλουθα χαρακτηριστικά: όνομα, γένος, αριθμός, τονισμός, τρόπος σχηματισμού, προέλευση ανάλογα με τη γλώσσα στην οποία ανήκει η λέξη βάσης, προέλευση ανάλογα με τη λεξική ομάδα στην οποία ανήκει η λέξη βάσης. Στη βάση είναι δυνατό να εντοπιστούν αυθεντικά τοπωνύμια που καταγράφηκαν κατά τον Μεσοπόλεμο στην περιοχή ενός συγκεκριμένου οικισμού (χωριού, εκκλησιαστικού χωριού, κτήματος, κωμόπολης, μεμονωμένου αγροκτήματος) και να εμφανιστεί η ακριβής ή κατά προσέγγιση θέση τους στον χάρτη. Στην ανακοίνωση τονίστηκε ότι, κατά την ενσωμάτωση της βάσης στο σύστημα LKIS, δημιουργήθηκαν τριών ειδών σύνδεσμοι προς άλλες βάσεις δεδομένων ονομάτων: προς άλλο τοπωνύμιο από το οποίο προήλθε το τοπωνύμιο, προς ανθρωπωνύμιο που περιλαμβάνεται στην Βάση δεδομένων λιθουανικών επωνύμων και από το οποίο προήλθε το τοπωνύμιο, καθώς και προς ιστορικές καταγραφές του συγκεκριμένου τοπωνυμίου που περιλαμβάνονται στη Βάση δεδομένων ιστορικών τοπωνυμίων. Αυτήν τη στιγμή έχουν εισαχθεί και περιγραφεί (ή περιγράφονται) στη βάση περίπου 25.000 τοπωνύμια.

Μετά το μεσημέρι, οι ομιλητές και οι συμμετέχοντες συγκεντρώθηκαν στην τρίτη συνεδρία, «Γλωσσολογία σωμάτων κειμένων».

Την πρώτη ανακοίνωση, «Μορφολογικά και συντακτικά επισημειωμένα σώματα κειμένων της λιθουανικής γλώσσας», παρουσίασαν οι ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), ANDRIUS UŽA (VDU). Έγινε λόγος για δύο επισημειωμένα σώματα κειμένων της λιθουανικής γλώσσας, τα οποία εκπονήθηκαν στο Κέντρο Υπολογιστικής Γλωσσολογίας του Πανεπιστημίου Vytautas Magnus (πρόσβαση στα σώματα κειμένων στο διαδίκτυο: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Τα επισημειωμένα σώματα κειμένων αποτελούν βασικούς πόρους, χωρίς τους οποίους είναι αδύνατη η ανάπτυξη γλωσσικών τεχνολογιών. Συνήθως χρησιμοποιούνται για τη δημιουργία άλλων πόρων και εργαλείων φυσικής γλώσσας σε τομείς όπως τα συστήματα αυτόματης αναγνώρισης ομιλίας, η αυτόματη μετάφραση κ.ά. Το μορφολογικά επισημειωμένο σώμα κειμένων MATAS εκπονήθηκε την περίοδο 2002–2014. Αποτελείται από 1,6 εκατομμύρια λέξεις από κείμενα διαφόρων υφολογικών ειδών. Το σώμα κειμένων δημιουργήθηκε με βάση ένα σώμα κειμένων ενός εκατομμυρίου λέξεων, το οποίο καταρτίστηκε το 2006, με την εφαρμογή στατιστικών μοντέλων. Το συντακτικά επισημειωμένο σώμα κειμένων ALKSNIS, το οποίο χρησιμεύει ως πρότυπο αναφοράς για μελλοντικές έρευνες και πόρους, εκπονήθηκε το 2016. Αποτελείται από 2.355 προτάσεις (περίπου 30 χιλιάδες λέξεις), αντλημένες από κείμενα διαφόρων υφολογικών ειδών. Η επισημείωση του σώματος κειμένων βασίζεται στις αρχές της αυτόματης μορφολογικής και συντακτικής επισημείωσης και εφαρμόζει μοντέλο συντακτικών εξαρτήσεων.

Το θέμα των σωμάτων κειμένων συνέχισε στην ανακοίνωσή της «Βάση δεδομένων για τις παγιωμένες φράσεις της λιθουανικής γλώσσας» η πολυμελής ομάδα ομιλητών της διάσκεψης ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Ινστιτούτο Προηγμένων Τεχνολογιών της Βαλτικής), JOLANTA KOVALSKAITĖ

318

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

(VDU), Tomas Krilavičius (Ινστιτούτο Προηγμένων Τεχνολογιών της Βαλτικής), Justina Mandravikaitė (Ινστιτούτο Προηγμένων Τεχνολογιών της Βαλτικής), Laura Vilkaitė (Ινστιτούτο Προηγμένων Τεχνολογιών της Βαλτικής). Την ανακοίνωση στη διάσκεψη παρουσίασε η Erika Rimkutė (VDU), η οποία μίλησε κυρίως για τη μεθοδολογία μελέτης των παγιωμένων φράσεων της σύγχρονης γραπτής λιθουανικής γλώσσας και για το υπό εκπόνηση λεξικό λιθουανικών συμπαραθέσεων που βασίζεται σε σώματα κειμένων. Στο πλαίσιο του έργου Αυτόματη αναγνώριση παγιωμένων φράσεων της λιθουανικής γλώσσας (PASTOVU) (αρ. LIP-027/2016) (βλ. http://mwe.lt/), επιδιώκεται η ανάπτυξη μεθοδολογίας για τη μελέτη των παγιωμένων φράσεων της σύγχρονης γραπτής λιθουανικής γλώσσας και η εκπόνηση λεξικού λιθουανικών συμπαραθέσεων βασισμένου σε σώμα κειμένων. Στο έργο καταρτίστηκε και χρησιμοποιείται σώμα κειμένων του Delfi.lt για την περίοδο 2014–2016, έκτασης 72 εκατομμυρίων λέξεων. Το λεξικό συμπαραθέσεων θα εκπονηθεί με βάση μια βάση δεδομένων. Θα περιλαμβάνει ποικίλες πληροφορίες για τις παγιωμένες φράσεις: γραμματικές και λεξικές πληροφορίες, συχνότητα χρήσης, ενότητα του κειμένου, παραδείγματα συμφραστικών εμφανίσεων κ.ά.

Έρευνες σωμάτων κειμένων παρουσίασαν επίσης οι εκπρόσωποι του Πανεπιστημίου του Βίλνιους Gintarė Judžentytė (VU) και Vilma Zubaitienė (VU). Στην ανακοίνωση «Έρευνες ακαδημαϊκών φράσεων βασισμένες σε σώματα κειμένων: τυπική δομή και σημασιολογία» έγινε λόγος για τη δομή και τη σημασιολογία των φράσεων της ακαδημαϊκής γλώσσας, με βάση το Σώμα Κειμένων Φοιτητικών Γραπτών που δημιουργείται επί του παρόντος στο Πανεπιστήμιο του Βίλνιους και αποτελεί ένα από τα προβλεπόμενα αποτελέσματα του έργου που υποστηρίζεται από την Κρατική Επιτροπή Λιθουανικής Γλώσσας, Μελέτες φρασεολογίας φοιτητικών εργασιών και διαδραστικός κατάλογος φράσεων. Στόχος του έργου είναι να προσδιοριστεί κατάλογος λέξεων σημαντικών για την ακαδημαϊκή γραφή, να εντοπιστούν οι κύριες συμπαραθέσεις και οι επεκτάσεις τους, καθώς και επαναλαμβανόμενες ακολουθίες λέξεων σε διάφορα μέρη ακαδημαϊκών κειμένων, να εξεταστούν οι σχέσεις τους με τις ρητορικές λειτουργίες των μερών του κειμένου και να περιγραφούν οι σημασίες ακαδημαϊκών λέξεων όπως: στόχος, έργο, μέθοδοι, συμπεράσματα, αποτελέσματα· εκτελώ, αναλύω, προσδιορίζω, βασίζομαι, καθώς και η χρήση και η σημασιολογία τους.

Στην τελευταία συνεδρία, «Αυτοματοποιημένη ανάλυση της γλωσσικής δομής και των κειμένων», παρουσιάστηκαν τέσσερις ανακοινώσεις.

Η συνεδρία άρχισε με την ανακοίνωση του Danielius Ratis (VU), «Μηχανική μετάφραση για τη λιθουανική γλώσσα», σχετικά με την πρόσφατη ιστορία της μηχανικής μετάφρασης, τα επιτεύγματά της, τα έργα που υλοποιούν διάφοροι φορείς, καθώς και τις νέες καινοτομίες που προέκυψαν με τη χρήση της νευρωνικής μηχανικής μετάφρασης. Ο ομιλητής μίλησε για την εξέλιξη και τα επιτεύγματα της μηχανικής μετάφρασης, τα οποία εφαρμόζονται σήμερα αποτελεσματικά και στη λιθουανική γλώσσα. Το 2005–2007 το Πανεπιστήμιο Vytautas Magnus υλοποίησε το έργο που χρηματοδοτήθηκε από τα Διαρθρωτικά Ταμεία της ΕΕ, Διαδικτυακό εργαλείο μετάφρασης πληροφοριών. Αποτέλεσμα ήταν μια δημόσια διαδικτυακή υπηρεσία μετάφρασης από τα αγγλικά στα λιθουανικά (διαθέσιμη στο διαδίκτυο: http://vertimas.vdu.lt/twsas/). Την περίοδο 2012–2014 το Πανεπιστήμιο του Βίλνιους υλοποίησε έργο χρηματοδοτούμενο από την ΕΕ, Δημιουργία συστήματος στατιστικής μηχανικής μετάφρασης για τους γλωσσικούς συνδυασμούς αγγλικά–λιθουανικά–αγγλικά και γαλλικά–λιθουανικά–γαλλικά. Αποτέλεσμα ήταν μια δημόσια διαδικτυακή υπηρεσία μετάφρασης (διαθέσιμη στο διαδίκτυο: https://www.versti.eu/). Ωστόσο

Apžvalgos / Surveys

319

AURELIJA TAMULIONIENĖ

Ακόμη και οι καλύτερες μηχανικές μεταφράσεις απαιτούν την παρέμβαση μεταφραστή. Μπορούν, λοιπόν, οι μηχανές να μεταφράζουν πραγματικά καλά; Τα τελευταία χρόνια προμηνύουν νέες τομές χάρη στη χρήση της νευρωνικής μηχανικής μετάφρασης. Το Πανεπιστήμιο του Βίλνιους ετοιμάζεται να ξεκινήσει το 2018 την υλοποίηση νευρωνικής μηχανικής μετάφρασης νέας γενιάς για τα αγγλικά, τα λιθουανικά, τα πολωνικά, τα γαλλικά, τα ρωσικά και τα γερμανικά. Εκφράστηκε ικανοποίηση για το γεγονός ότι οι πιο πρόσφατες εξελίξεις στη μηχανική μετάφραση δεν παρακάμπτουν ούτε τη λιθουανική γλώσσα.

Στην ανακοίνωσή του με τίτλο «Η γραμματική της λιθουανικής γλώσσας στον ψηφιακό κόσμο του ανοικτού κώδικα», ο Virginijus Dudkevičius (VU) μίλησε για τη δημιουργία μορφολογίας νέας γενιάς της λιθουανικής γλώσσας για υπολογιστές, τη μορφολογική ανάλυση και σύνθεση λέξεων, την ευφυή αναζήτηση κειμενικών πληροφοριών κ.ά. Με την εμφάνιση των υπολογιστών, η κλασική γραμματική και το λεξιλόγιο χρειάστηκε να «φορέσουν νέο ένδυμα» και να γίνουν πλήρες μέρος των νέων τεχνολογιών. Για τον σκοπό αυτό δημιουργήθηκε μορφολογία νέας γενιάς της λιθουανικής γλώσσας για υπολογιστές και τέθηκαν οι εξής στόχοι: να χρησιμοποιείται και να δημιουργείται μόνο ανοικτός κώδικας· μόνο τα δεδομένα, όχι όμως η μορφή και η ερμηνεία τους, μπορούν να έχουν χαρακτηριστικά ειδικά για τη λιθουανική γλώσσα· όλος ο κώδικας του λογισμικού πρέπει να είναι καθολικός και κατάλληλος για κάθε άλλη γλώσσα· να αξιοποιούνται όσο το δυνατόν περισσότερο λύσεις που έχουν εφαρμοστεί με επιτυχία σε άλλες γλώσσες του κόσμου. Βάση για τη σύνταξή της αποτέλεσαν η Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) και σώματα κειμένων (περίπου 1,5 δισεκατομμύρια λέξεις συνολικά). Περίπου το 99% ενός μέσου κειμένου που εμφανίζεται σήμερα στο διαδίκτυο είναι «αναγνωρίσιμο», δηλαδή ο μορφολογικός αναλυτής ερμηνεύει σωστά κατά μέσο όρο 99 από τις 100 λέξεις. Αυτή η νέα μέθοδος μορφολογικής ανάλυσης εφαρμόστηκε με επιτυχία στο σύστημα συντακτικής-σημασιολογικής ανάλυσης του Πανεπιστημίου Vytautas Magnus (διαθέσιμο στο διαδίκτυο: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) και στο Μητρώο Νομικών Πράξεων του Κοινοβουλίου της Δημοκρατίας της Λιθουανίας (διαθέσιμο στο διαδίκτυο: www.e-tar.lt).

Το θέμα της ψηφιοποίησης της γραμματικής συνέχισαν η Daiva Šveikauskienė (LKI) και ο Vytautas Šveikauskas (LKI). Στην ανακοίνωση «Ψηφιακή γραμματική της λιθουανικής γλώσσας» μίλησαν για την ψηφιακή γραμματική της λιθουανικής γλώσσας, την οποία άρχισε να δημιουργεί το Ινστιτούτο Λιθουανικής Γλώσσας και η οποία μπορεί να αξιοποιηθεί και σε άλλους τομείς της υπολογιστικής επεξεργασίας της γλώσσας: στη γραμματική ανάλυση, στην άμεση μετάφραση δεδομένων κ.ά. Παρουσιάστηκε ένα έργο που προβλέπει τη σύνδεση με το διεθνές σύστημα DIGITAL GRAMMARS, το οποίο περιλαμβάνει επί του παρόντος 32 γλώσσες. Κύριος στόχος της δημιουργίας της ψηφιακής γραμματικής είναι η αξιοποίησή της σε συστήματα αυτόματης μετάφρασης που λειτουργούν με μη στατιστικές μεθόδους. Αυτό είναι ιδιαίτερα σημαντικό για τη λιθουανική γλώσσα. Σύμφωνα με τα στοιχεία της Tildės του 2017, η ποιότητα της μετάφρασης του Google προς και από τα λιθουανικά είναι ακόμη χαμηλότερη από ό,τι για τα λετονικά ή τα εσθονικά. Γι’ αυτό είναι πολύ σημαντικό για τη Λιθουανία να αναπτύξει μια εναλλακτική λύση αυτόματης μετάφρασης. Προς το παρόν έχει καταρτιστεί ένα δοκιμαστικό δείγμα ψηφιακής γραμματικής, το οποίο περιλαμβάνει λίγες λέξεις, ωστόσο ακόμη και από αυτό φαίνεται ότι η ποιότητα της μετάφρασης είναι πολύ καλύτερη, ιδίως για προτάσεις στις οποίες αντανακλώνται ιδιαίτερα χαρακτηριστικά της λιθουανικής γλώσσας. Όσο χρησιμοποιείται η σειρά λέξεων της αγγλικής γλώσσας, οι στατιστικές μέθοδοι δίνουν επίσης αξιοπρεπείς μεταφράσεις.

320

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

Ωστόσο, αν η σειρά των λέξεων στην πρόταση δεν είναι η συνηθισμένη, η μετάφραση του Google δεν χάνει το νόημα της πρότασης. Η ψηφιακή γραμματική μπορεί να αξιοποιηθεί και σε άλλους τομείς της υπολογιστικής επεξεργασίας της γλώσσας: στη γραμματική ανάλυση, στην άμεση μετάφραση δεδομένων κ.ά. Τη δημιουργία ψηφιακών γραμματικών διευθύνει ο καθηγητής Aarne Ranta του Πανεπιστημίου του Γκέτεμποργκ (Σουηδία).

Την τελευταία ανακοίνωση του συνεδρίου, «Ποιος αντέγραψε από ποιον; Αυτοματοποίηση και οπτικοποίηση της έρευνας για την ιστορία των μεταφράσεων της Βίβλου», παρουσίασε ο Mindaugas Šinkūnas (LKI). Η ανακοίνωση αφορούσε την αυτοματοποίηση και την οπτικοποίηση της έρευνας για την ιστορία των μεταφράσεων της Βίβλου. Ο ομιλητής παρουσίασε τα αποτελέσματα της σύγκρισης βιβλικών στίχων με εύληπτα και αναλυτικά διαγράμματα. Η αφθονία βιβλικών παραθεμάτων στα παλαιά λιθουανικά γραπτά δυσχεραίνει τη μελέτη των μεταξύ τους σχέσεων. Χρειάζεται μια εύχρηστη πλατφόρμα δεδομένων που να επιτρέπει την ομαδοποίηση των βιβλικών στίχων σύμφωνα με τα χαρακτηριστικά που ενδιαφέρουν τον ερευνητή. Η μεγαλύτερη δυσκολία είναι η αξιολόγηση της ομοιότητας των παραθεμάτων. Η σύνθετη ανάλυση του λεξιλογίου, της σύνταξης και της μορφολογίας (και, σε ορισμένες περιπτώσεις, της ορθογραφίας) το καθιστά εφικτό, αλλά αυτή η φιλολογική έρευνα είναι αργή και προς το παρόν είναι αδύνατο να αυτοματοποιηθεί. Η σύγκριση αυτοματοποιήθηκε με αλγορίθμους επαναληπτικής εκτέλεσης, οι οποίοι εντοπίζουν πανομοιότυπες ακολουθίες σε δύο σειρές χαρακτήρων και υπολογίζουν ποιο μέρος των υπό σύγκριση ακολουθιών καλύπτουν. Η αυτοματοποίηση της σύγκρισης δυσχεραίνεται από την αμφισημία της ορθογραφίας των παλαιών γραπτών. Από την αξιολόγηση σειρών που μεταγράφηκαν χειροκίνητα και αυτόματα διαπιστώθηκε ότι ο τρόπος μεταγραφής δεν έχει ουσιώδη επίδραση στα αποτελέσματα. Τα αποτελέσματα ενδέχεται να αμφισβητηθούν κατά τη σύγκριση κειμένων γραμμένων σε διαφορετικές διαλέκτους (δεν δοκιμάστηκε η εξομάλυνση των διαλεκτικών χαρακτηριστικών). Τα αποτελέσματα ομοιότητας συνοψίζονται σε δισδιάστατα διαγράμματα. Τα αποτελέσματα της σύγκρισης των βιβλικών στίχων της Postilės (1591) του Bretkūnas, που προέκυψαν από την υπολογιστική ανάλυση, συμφωνούν με τα συμπεράσματα στα οποία είχαν καταλήξει προηγούμενοι ερευνητές με άλλες μεθόδους.

Το συνέδριο ολοκληρώθηκε με συζητήσεις. Άρθρα βασισμένα στις ανακοινώσεις του συνεδρίου θα δημοσιευτούν στα επιστημονικά περιοδικά Bendrinė kalba (διαθέσιμο στο διαδίκτυο: www.bendrinekalba.lt) και Lietuvių kalba (www.lietuviukalba.lt).

LITERATŪRA

Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.

Įteikta 2017 m. lapkričio 3 d.

AURELIJA TAMULIONIENĖ

Lietuvių kalbos institutas

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva

[email protected]

Apžvalgos / Surveys

321