Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Full text
DAIVA ŠVEIKAUSKIENĖ
Ινστιτούτο Λιθουανικής Γλώσσας
ARŪNAS RIBIKAUSKAS
Τεχνικό Πανεπιστήμιο Γκεντιμίνας του Βίλνιους
VYTAUTAS ŠVEIKAUSKAS
Ινστιτούτο Λιθουανικής Γλώσσας
Ερευνητικά πεδία: γραμματική, υπολογιστική γλωσσολογία.
ΜΙΑ ΠΟΛΥΓΛΩΣΣΗ ΙΣΤΟΣΕΛΙΔΑ ΓΙΑ ΤΗ ΓΡΑΜΜΑΤΙΚΗ ΤΗΣ ΛΙΘΟΥΑΝΙΚΗΣ ΓΛΩΣΣΑΣ
Πολύγλωσσο πληροφοριακό σύστημα γραμματικής της λιθουανικής γλώσσας στο Διαδίκτυο
ΣΧΟΛΙΑΣΜΟΣ
Πριν από ένα χρόνο, στο Ινστιτούτο Λιθουανικής Γλώσσας άρχισαν να εργάζονται σε ένα έργο που έχει ως στόχο να παρέχει στον χρήστη ελεύθερη πρόσβαση στο Διαδίκτυο για την παρουσίαση λεπτομερών δεδομένων σχετικά με τις γραμματικές ιδιότητες των λιθουανικών λέξεων. Τον Μάρτιο του 2017 ετοιμάστηκε μια δοκιμαστική έκδοση, η οποία περιλαμβάνει μόνο λέξεις με τη ρίζα «bėg» (πρβλ. το ρήμα «bėgti/τρέχω»). Η βάση δεδομένων αποτελείται από περίπου 25.000 εγγραφές. Το έργο επιδιώκει να αποφύγει τις ελλείψεις ήδη υπαρχουσών εργασιών στον τομέα της υπολογιστικής γλωσσολογίας. Αυτό αφορά το εύρος των λέξεων, την ποικιλία των γραμματικών δεδομένων, τη σαφήνεια και την κατανοητότητα της παρουσίασης των δεδομένων κ.ά. Οι γραμματικές πληροφορίες για τη λέξη που εισάγει ο χρήστης παρουσιάζονται σε τρεις ενότητες: δομή της λέξης, μορφολογικά δεδομένα και δεδομένα μορφημάτων. Πρόκειται για τον πρώτο ιστότοπο στη Λιθουανία όπου παρέχονται στον χρήστη πληροφορίες σχετικά με τους τύπους των μορφημάτων. Για κάθε λέξη που περιλαμβάνεται στη βάση δεδομένων μπορεί κανείς να λάβει έναν πίνακα κλίσης. Για ορισμένες λέξεις δίνονται επίσης παραδείγματα χρήσης. Ο ιστότοπος λειτουργεί σε επτά γλώσσες: λιθουανικά, αγγλικά, γερμανικά, γαλλικά, ιταλικά, ρωσικά και ιαπωνικά, ώστε να μπορούν να τον χρησιμοποιούν οι αλλοδαποί που ενδιαφέρονται για τη λιθουανική γλώσσα.
144
Acta Linguistica Lituanica LXXVII
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ΛΕΞΕΙΣ-ΚΛΕΙΔΙΑ: γραμματική, μορφολογία, μόρφημα, πληροφοριακό σύστημα, υπολογιστική γλωσσολογία.
ΣΧΟΛΙΑΣΜΟΣ
The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.
ΛΕΞΕΙΣ-ΚΛΕΙΔΙΑ: Γραμματική, Μορφολογία, μορφηματικός, πληροφοριακό σύστημα, υπολογιστική γλωσσολογία.
1. ΕΙΣΑΓΩΓΗ: ΥΠΟΛΟΓΙΣΤΙΚΗ ΓΛΩΣΣΟΛΟΓΙΑ
Μέχρι τα μέσα του 20ού αιώνα, όλες οι γραμματικές τυπώνονταν σε χαρτί. Μετά την εμφάνιση των υπολογιστών (το 1942 κατασκευάστηκε στο Πανεπιστήμιο του Χάρβαρντ ο πρώτος υπολογιστής στον κόσμο, ο MARK I (Schwanke 1991: 69)), άρχισαν να διεισδύουν σε όλους τους τομείς της ζωής. Οι γλώσσες δεν αποτέλεσαν εξαίρεση: σύντομα έγινε σαφές ότι οι υπολογιστές μπορούν να επεξεργάζονται όχι μόνο αριθμούς, αλλά και οποιαδήποτε σύμβολα. Κατά συνέπεια, μπορούν να επεξεργάζονται και γλώσσες. Αρκετοί γλωσσολόγοι άρχισαν να αναπτύσσουν τυπικές περιγραφές γλωσσών, ώστε να μπορούν να εφαρμοστούν στις γλώσσες και οι δυνατότητες των υπολογιστών (Winograd 1983: 23). Στον τομέα της τεχνητής νοημοσύνης, η επεξεργασία της γλώσσας έγινε ένας από τους σημαντικότερους τομείς εφαρμογής (Charis 1989: 71). Από το 1968 έως το 1978, η γραμματική ανάλυση των γλωσσών ήταν το σημαντικότερο θέμα για τους ερευνητές της τεχνητής νοημοσύνης (Nirenburg 1987: 26). Ωστόσο, οι γλώσσες, που υποτάσσονται τόσο εύκολα στους ανθρώπους, αποδείχθηκαν σκληρό καρύδι για τους υπολογιστές (Jensen, Heidorn,
Straipsniai / Articles
145
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.
1.1. ΣΤΑΤΙΣΤΙΚΕΣ ΜΕΘΟΔΟΙ
Οι στατιστικές μέθοδοι έχουν πολύ μεγάλη σημασία στην επεξεργασία της γλώσσας. Οι πρώτες προτάσεις για τη χρήση τους διατυπώθηκαν λίγο μετά την εμφάνιση των υπολογιστών. Αυτό ισχύει ιδιαίτερα για την αγγλική γλώσσα. Ο David W. Reed πραγματεύτηκε την ποσοτική γλωσσολογική ανάλυση (Reed 1949: 236). Ο Waren Weaver ήταν ο πρώτος που διατύπωσε την ιδέα της χρήσης υπολογιστών για μεταφράσεις. Το 1949 πρότεινε να χρησιμοποιηθούν γι’ αυτό στατιστικές μέθοδοι. Ωστόσο, οι επιστήμονες της εποχής απέρριψαν την ιδέα ύστερα από σύντομο διάστημα, πιθανότατα λόγω του ανεπαρκούς όγκου ηλεκτρονικά αναγνώσιμων κειμένων και της σχετικά περιορισμένης υπολογιστικής ισχύος των υπολογιστών εκείνης της εποχής. Μερικές δεκαετίες αργότερα, όταν είχαν συγκεντρωθεί σώματα κειμένων και η εφαρμογή στατιστικών μεθόδων στην αναγνώριση γλωσσών απέδιδε καλά αποτελέσματα, οι στατιστικές μέθοδοι επανήλθαν στη μετάφραση (Brown at al. 1990: 79). Στον Καναδά υπήρχαν ιδιαίτερα ευνοϊκές συνθήκες γι’ αυτό, επειδή εκεί όλο το υλικό του κοινοβουλίου αποθηκεύεται σε δύο γλώσσες (αγγλικά και γαλλικά), λόγω των δύο επίσημων γλωσσών της χώρας. Έτσι, ήταν δυνατό να συγκεντρωθεί πολύ γρήγορα επαρκής ποσότητα παράλληλων κειμένων (Al-Onaizan, Curin, Jahr 1999: 1). Η δομή των δύο γλωσσών, δηλαδή της αγγλικής και της γαλλικής, είναι πολύ παρόμοια: η σειρά των λέξεων είναι αυστηρή (στην πρώτη θέση βρίσκεται το υποκείμενο και στη δεύτερη το κατηγόρημα). Οι ομοιότητες στη δομή των γλωσσών επέτρεψαν την επίτευξη καλών αποτελεσμάτων στη μετάφραση με στατιστικές μεθόδους. Αυτό, όμως, δεν ισχύει για τη λιθουανική γλώσσα. Οι μεταφράσεις της Google, οι οποίες χρησιμοποιούν τη στατιστική μέθοδο, δεν παράγουν μέχρι σήμερα καλές μεταφράσεις προς τα λιθουανικά. Σύμφωνα με τα στοιχεία του 2017, τα αποτελέσματα τόσο της μετάφρασης από τα αγγλικά στα λιθουανικά όσο και της μετάφρασης από τα λιθουανικά στα αγγλικά είναι χειρότερα από εκείνα για τα ζεύγη αγγλικά-λετονικά, λετονικά-αγγλικά, αγγλικά-εσθονικά και εσθονικά-αγγλικά (Skadinš 2017: 22).
Οι στατιστικές μέθοδοι επεκτάθηκαν και σε άλλους τομείς της γλωσσολογίας. Οι πρώτες εργασίες αφορούσαν τη φωνητική (Zipf 1929). Το 1944 πραγματοποιήθηκαν στατιστικές έρευνες του λεξιλογίου της λογοτεχνίας, δηλαδή πόσες λέξεις χρησιμοποιήθηκαν μία φορά, πόσες δύο φορές, τρεις φορές κ.ο.κ. (Yule 194: 9).
146
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Από το 1973 χρησιμοποιείται ο όρος διαλεκτομετρία για τον χαρακτηρισμό του κλάδου της γλωσσολογίας που ασχολείται με την ποσοτική μελέτη των γλωσσών και των διαλέκτων (Köhler, Altmann, Piotrowski 2005: 498).
Στατιστικές μέθοδοι εφαρμόστηκαν επίσης στον τομέα της μορφολογίας. Ο Goldsmith περιγράφει τον αλγόριθμο για τον εντοπισμό των μορφημάτων σε μια λέξη ως εξής: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36).
Στα τέλη του περασμένου αιώνα, στη ρωσική βιβλιογραφία περιγράφονται προσπάθειες για τη διεξαγωγή αυτόματης συντακτικής ανάλυσης προτάσεων με τη βοήθεια στατιστικών υπολογισμών. Οι επιστήμονες στη Ρωσία πρότειναν να προσδιορίζεται η συντακτική δομή των προτάσεων όχι βάσει γλωσσολογικής ανάλυσης, αλλά με τη χρήση στατιστικής επεξεργασίας των κειμένων. Ισχυρίζονται ότι κάθε γλωσσική μονάδα (λέξη, συντακτική κατηγορία της λέξης, συντακτική κατασκευή) εμφανίζεται στο κείμενο με κάποια συχνότητα. Για παράδειγμα, σύμφωνα με τα στοιχεία του αγγλικού λεξικού συχνότητας σθένους, το ρήμα έχει 195 διαφορετικά πρότυπα συντακτικών σχέσεων. Ωστόσο, μόνο τα δέκα συχνότερα πρότυπα αντιστοιχούν στο 86% όλων των περιπτώσεων που χρησιμοποιούνται στα κείμενα. Στατιστικές κανονικότητες χρησιμοποιούνται επίσης για τη γραμμική δομή της πρότασης. Κάθε κατηγορία λέξεων έχει μια συχνότητα με την οποία μπορεί να εμφανίζεται σε μια ορισμένη απόσταση από την αρχή της πρότασης. Το ρήμα της αγγλικής γλώσσας μπορεί να βρίσκεται, με πιθανότητα 0,7, στη δεύτερη έως την πέμπτη θέση από την αρχή της πρότασης. Με πιθανότητα 0,95, εμφανίζεται στη δεύτερη έως τη δέκατη θέση (Церкас 1979: 124).
Αργότερα, για τη συντακτική ανάλυση χρησιμοποιήθηκαν δεδομένα από ένα σώμα κειμένων (Köhler 2012: 31).
Ωστόσο, μέχρι στιγμής καλά αποτελέσματα έχουν επιτευχθεί μόνο κατά την επεξεργασία της αγγλικής γλώσσας. Ο Vidas Daudaravičius, ο οποίος εργάζεται στον τομέα της μηχανοργάνωσης της λιθουανικής σύνταξης, υποστηρίζει: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3).
Με τη βοήθεια στατιστικών μεθόδων μπορεί κανείς να δημιουργήσει γρήγορα συστήματα που λειτουργούν γρήγορα, αλλά υπό έναν όρο: πρέπει να γίνεται ανεκτός ένας ορισμένος αριθμός σφαλμάτων (Link 1). Γι’ αυτό, στο Ινστιτούτο Λιθουανικής Γλώσσας αποφασίστηκε να στηρίζονται όσο το δυνατόν λιγότερο στη στατιστική, καθώς επιδιώκεται η μέγιστη δυνατή ακρίβεια και αξιοπιστία των δεδομένων.
1 „Είναι αφελές να πιστεύει κανείς ότι οι μέθοδοι που χρησιμοποιούνται με επιτυχία για την αγγλική γλώσσα είναι εξίσου κατάλληλες και για τις άλλες γλώσσες.“
Straipsniai / Articles
147
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
1.2. Η ΚΑΤΑΣΤΑΣΗ ΣΤΗ ΛΙΘΟΥΑΝΙΑ
Έχουν ήδη πραγματοποιηθεί πολλές εργασίες στον τομέα της μηχανοργάνωσης της λιθουανικής γραμματικής. Οι περισσότερες από αυτές είναι κατανοητές μόνο από ειδικούς στην υπολογιστική γλωσσολογία. Ορισμένες απευθύνονται επίσης στο ευρύ κοινό. Ωστόσο, αποτυπώνουν μόνο μεμονωμένες ιδιότητες και χαρακτηριστικά των λέξεων και της γραμματικής. Για παράδειγμα, στο Κάουνας, στο Πανεπιστήμιο Vytautas Magnus, δημιουργήθηκε μια βάση δεδομένων μορφημικής με βάση ένα σώμα κειμένων. Εκεί λείπουν πολλοί τύποι λέξεων και χρησιμοποιούνται πάρα πολλές συντομογραφίες, οι οποίες δεν είναι κατανοητές από όλους. Τα μορφήματα χωρίζονται με παύλα και δεν παρέχονται δεδομένα σχετικά με τον τύπο του μορφήματος. Στο Ινστιτούτο Μαθηματικών και Πληροφορικής στο Βίλνιους δημιουργήθηκε μια βάση δεδομένων για την παραγωγή και τη μορφημική. Εκεί αναφέρεται ο τύπος του μορφήματος, καθώς και οι λέξεις βάσης και οι προσδιοριστικές λέξεις (Murmulaitytė 2012: 96). Δυστυχώς, η βάση δεδομένων δεν είναι ελεύθερα προσβάσιμη. Γι’ αυτό αποφασίστηκε να δημιουργηθεί ένα ολοκληρωμένο πληροφοριακό σύστημα, το οποίο θα απευθύνεται στο ευρύ κοινό και θα μπορεί να παρέχει στον χρήστη λεπτομερή δεδομένα.
Στο διαδίκτυο μπορεί κανείς να παρατηρήσει δύο άκρα στην παρουσίαση των γραμματικών πληροφοριών της λιθουανικής γλώσσας. Αυτά είναι: η απουσία ακόμη και των συνηθισμένων τύπων λέξεων και η παρουσίαση περιττών λέξεων, ακατανόητων ακόμη και για έναν φυσικό ομιλητή. Στο πληροφοριακό σύστημα για τη λιθουανική γραμματική επιδιώκεται να αποφευχθούν και τα δύο αυτά άκρα. Όλοι οι τύποι λέξεων παράγονται αυτόματα από τον υπολογιστή με αφετηρία το λήμμα της λέξης, ώστε να προκύπτει το πλήρες σύνολο κλιτικών τύπων. Όλες οι δυνατές παράγωγες και σύνθετες λέξεις καταχωρίζονται στη βάση δεδομένων. Έτσι, δεν υπάρχει πλέον έλλειψη τύπων λέξεων. Στη συνέχεια, όλες οι λέξεις και οι τύποι λέξεων που δημιουργούνται από τον υπολογιστή ελέγχονται με το χέρι και διαγράφονται οι ανύπαρκτες παραλλαγές. Με αυτόν τον τρόπο επιτυγχάνεται ο αποκλεισμός των περιττών λέξεων.
2. ΕΡΓΑΣΙΕΣ ΥΠΟΛΟΓΙΣΤΙΚΗΣ ΓΛΩΣΣΟΛΟΓΙΑΣ ΣΤΗ ΛΙΘΟΥΑΝΙΑ
Στη Λιθουανία διακρίνονται δύο μέθοδοι υπολογιστικής επεξεργασίας της γλώσσας. Στο Κάουνας, στο Κέντρο Υπολογιστικής Γλωσσολογίας, οι εργασίες διεξάγονται με βάση ένα σώμα κειμένων. Στο Βίλνιους, στο πανεπιστήμιο και στο Ινστιτούτο Λιθουανικής Γλώσσας, η προσέγγιση βασίζεται περισσότερο στις ιδιότητες της ίδιας της λιθουανικής γλώσσας. Και οι δύο μέθοδοι έχουν πλεονεκτήματα και μειονεκτήματα. Στη συνέχεια αυτό θα παρουσιαστεί με ορισμένα παραδείγματα.
148
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
2.1. ΕΡΓΑΣΙΕΣ ΒΑΣΙΣΜΕΝΕΣ ΣΕ ΣΩΜΑ ΚΕΙΜΕΝΩΝ
Στο Πανεπιστήμιο Vytautas Magnus στο Κάουνας δημιουργήθηκε ένα σώμα κειμένων της σύγχρονης λιθουανικής γλώσσας. Χρησιμοποιείται για διάφορα είδη γλωσσικής επεξεργασίας. Στον τομέα της γραμματικής δημιουργήθηκε ένα λεξικό μορφημάτων (Rimkutė, Kazlauskienė, Rąkinis 2011) και, μερικά χρόνια αργότερα, επίσης μια βάση δεδομένων. Στον χρήστη παρέχονται τόσο μορφημικά όσο και μορφολογικά δεδομένα. Πρόκειται για την πρώτη ελεύθερα προσβάσιμη πηγή στην οποία η λέξη διαχωρίζεται στα μορφήματά της. Δυστυχώς, δεν αναφέρεται ο τύπος του μορφήματος και αυτό οδηγεί μερικές φορές σε συγκεχυμένη παρουσίαση της μορφημικής δομής της λέξης. Αυτό συμβαίνει όταν λέξεις με διαφορετική δομή παρουσιάζονται με τον ίδιο τρόπο. Ένα παράδειγμα αυτού παρουσιάζεται στην Εικόνα 1. Οι λέξεις «per-ei-ti» (περνώ) και «per-ė-ti» (κλωσώ) διαφέρουν ελάχιστα στην εξωτερική τους μορφή. Οι μορφημικές δομές των δύο λέξεων εμφανίζονται ίδιες στη βάση δεδομένων μορφημάτων. Ωστόσο, στην πρώτη λέξη το μόρφημα «per» είναι πρόθημα, ενώ στη δεύτερη λέξη το ίδιο πρώτο μόρφημα «per» είναι η ρίζα.
ΕΙΚΟΝΑ 1. Λέξεις με διαφορετική μορφημική δομή παρουσιάζονται με τον ίδιο τρόπο (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)
Ως δεύτερο μειονέκτημα μπορεί να αναφερθεί η απουσία ακόμη και συνηθισμένων τύπων λέξεων. Οι μετοχές στη λιθουανική γλώσσα έχουν έξι πτώσεις. Στον Πίνακα 1 παρουσιάζεται η παρουσία των τύπων λέξεων (ενικός αριθμός, αρσενικό γένος) της μετοχής «bėgantis / τρέχων, ρέων» στη βάση δεδομένων μορφημάτων.
Διαπιστώνεται ότι λείπει ακόμη και το λήμμα (ονομαστική, ενικός αριθμός) αυτής της λέξης. Οι άλλοι τύποι που λείπουν, π.χ. η τοπική πτώση (bėgančiame vandenyje / στο νερό που ρέει), δεν μπορούν επίσης να θεωρηθούν σπάνιοι ή ασυνήθιστοι. Επομένως, υπάρχουν μόνο 2 τύποι λέξεων από τις 6 πτώσεις.
Οι επιστήμονες της δεύτερης βαλτικής γλώσσας, της λετονικής, αναφέρουν επίσης ανεπαρκή αριθμό τύπων λέξεων στο σώμα κειμένων (Paikens, Rituma, Pretkalniņa 2013: 272).
Straipsniai / Articles
149
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS
ΠΙΝΑΚΑΣ 1.
Η εμφάνιση στη βάση δεδομένων (Σύνδεσμος 2) των τύπων λέξης της μετοχής bēgantis / τρέχων, ρέων στον ενικό, αρσενικό
Πτώση
Λέξη
Βάση δεδομένων
Ονομαστική
bēgantis
λείπει
Γενική
bēgančio
υπάρχει
Δοτική
bēgančiam
λείπει
Αιτιατική
bēgantį
υπάρχει
Οργανική
bēgančiu
λείπει
Τοπική πτώση
bēgančiame
λείπει
Συνολικά:
6
2
2.2. ΑΦΕΤΗΡΙΑ – Η ΛΙΘΟΥΑΝΙΚΗ ΓΛΩΣΣΑ
Στο Πανεπιστήμιο του Βίλνιους αφετηρία αποτελούν οι ιδιότητες της λιθουανικής γλώσσας. Ο ιστότοπος Morfologija.lt (Σύνδεσμος 3) παρουσιάζει ακόμη και τους πίνακες κλίσης της λέξης. Δυστυχώς, υπάρχουν πολλά κενά, μερικές φορές για ολόκληρο το παράδειγμα. Μερικές φορές εμφανίζονται επίσης άγνωστες λέξεις, ακατανόητες για έναν Λιθουανό, π.χ. «sutikimoji» (Σύνδεσμος 4) και παρόμοιες. Στο Ινστιτούτο Μαθηματικών και Πληροφορικής στο Βίλνιους δημιουργήθηκε μια βάση δεδομένων για τον σχηματισμό λέξεων και τη μορφημική (Murmulaitytė 2012). Περιέχει πολύτιμες πληροφορίες (τον τύπο του μορφήματος, τη λέξη βάσης, το προσδιοριστικό στοιχείο κ.ά.), αλλά τα δεδομένα, δυστυχώς, δεν είναι ελεύθερα προσβάσιμα.
3. ΤΟ ΠΛΗΡΟΦΟΡΙΑΚΟ ΣΥΣΤΗΜΑ ΓΙΑ ΤΗ ΛΙΘΟΥΑΝΙΚΗ ΓΡΑΜΜΑΤΙΚΗ
Η λιθουανική γλώσσα ανήκει στην ομάδα των λιγότερο μηχανογραφημένων γλωσσών της Ευρώπης (Vaišnienė, Zabarskaitė 2012: 35). Γι’ αυτό αποφασίστηκε η δημιουργία ενός πληροφοριακού συστήματος που θα περιλαμβάνει αναλυτικά δεδομένα για τις γραμματικές ιδιότητες των λιθουανικών λέξεων. Οι επιστήμονες που ασχολούνται με τις βαλτικές γλώσσες τονίζουν συχνά την ανάγκη δημιουργίας περισσότερου λογισμικού για ένα ευρύ κοινό χρηστών. Στις οδηγίες του συνεδρίου BSNLP (Balto-Slavic Natural Language Processing) το 2015 και το 2017 αναφέρεται: «υποβολές
150
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
που περιγράφουν συστήματα τα οποία διατίθενται στο ευρύτερο κοινό θα ενθαρρύνονται ιδιαίτερα / θα προωθούνται ιδιαίτερα οι φορείς που περιγράφουν συστήματα τα οποία διατίθενται στο ευρύ κοινό» (Σύνδεσμος 5).
Έτσι προέκυψε η ιδέα να σχεδιαστεί το πληροφοριακό σύστημα για τη λιθουανική γραμματική για ένα ευρύ κοινό χρηστών και να παρουσιάζονται τα δεδομένα με τον απλούστερο και σαφέστερο δυνατό τρόπο.
Κατά συνέπεια, επιλέχθηκε ο αποκριτικός σχεδιασμός ιστοσελίδων (RW), ώστε να ανταποκρίνεται όσο το δυνατόν καλύτερα στις ανάγκες των χρηστών. Έτσι, οι γραμματικές πληροφορίες για τη λέξη παρουσιάζονται σε πλακίδια (στα αγγλικά tiles) (Σύνδεσμος 6). Γι’ αυτό είναι δυνατή η πρόσβαση στον ιστότοπο και από κινητό τηλέφωνο.
3.1. ΜΕΘΟΔΟΣ ΔΗΜΙΟΥΡΓΙΑΣ ΤΗΣ ΒΑΣΗΣ ΔΕΔΟΜΕΝΩΝ
Στόχος της μηχανογράφησης της γραμματικής είναι να υπάρχουν σε ηλεκτρονική μορφή όλες οι γραμματικές πληροφορίες για κάθε λέξη και για όλες τις μορφές της. Υπάρχουν δύο τρόποι να επιτευχθεί αυτό. Ο πρώτος είναι να δημιουργηθεί μια τυπική περιγραφή των γραμματικών κανόνων (κάτι σαν βοήθημα) και στη συνέχεια να αφεθεί ο υπολογιστής να παράγει τα απαραίτητα στοιχεία. Ο δεύτερος τρόπος είναι να αποθηκευτούν στον υπολογιστή όλες οι γραμματικές πληροφορίες για όλες τις μορφές όλων των λέξεων και να ανακτώνται όταν χρειάζεται. Το ποια προσέγγιση απαιτεί περισσότερη εργασία μένει ακόμη να συζητηθεί. Στο Ινστιτούτο Μαθηματικών και Πληροφορικής αναπτύχθηκε λογισμικό για τη μορφολογική ανάλυση της λιθουανικής γλώσσας (Zinkevičius 2000), με τη χρήση της πρώτης μεθόδου. Ωστόσο, δεν κατέστη δυνατό να επιτευχθεί ακρίβεια 100%: υπάρχουν εσφαλμένα στοιχεία και ορισμένες λιθουανικές λέξεις δεν αναγνωρίζονται.
Κατά την ανάπτυξη του πληροφοριακού συστήματος για τη λιθουανική γραμματική, αυτή η προσέγγιση εγκαταλείφθηκε για τον ακόλουθο λόγο: για να μπορεί ο υπολογιστής να επεξεργάζεται τις λέξεις αυτόνομα, πρέπει να του υποδεικνύεται με μεγάλη ακρίβεια ποιες ενέργειες πρέπει να εκτελεί με κάθε λέξη. Επομένως, πρέπει πρώτα όλες οι λέξεις να χωριστούν σε ομάδες με τέτοιο τρόπο ώστε να ισχύουν οι ίδιες κανονικότητες για όλα τα μέλη μιας ομάδας, δηλαδή να μπορεί να χρησιμοποιείται η ίδια μέθοδος επεξεργασίας. Για να ενταχθεί μια λέξη στη μία ή την άλλη ομάδα, πρέπει να προσδιοριστούν πολλά χαρακτηριστικά βάσει των οποίων θα ομαδοποιηθούν οι λέξεις. Για παράδειγμα, στη συντακτική ανάλυση της λιθουανικής γλώσσας χρησιμοποιείται το σημασιολογικό χαρακτηριστικό [χρόνος] για τον προσδιορισμό της συντακτικής λειτουργίας της αιτιατικής των ουσιαστικών. Στην πρόταση «Visą naktį ji
Straipsniai / Articles
151
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
«skaitė šią knygą / Όλη τη νύχτα διάβαζε αυτό το βιβλίο» και «Visą knygą ji perskaitė šią naktį / Ολόκληρο το βιβλίο το διάβασε εκείνη τη νύχτα». Οι δύο λέξεις knygą/Buch και naktį/Nacht δεν διαφέρουν ως προς τις μορφολογικές κατηγορίες — και οι δύο είναι θηλυκού γένους, ενικού αριθμού και αιτιατικής πτώσης. Μόνο το σημασιολογικό χαρακτηριστικό [Χρόνος], που έχει η λέξη naktis/Nacht και δεν έχει η λέξη knyga/Buch, επιτρέπει στον υπολογιστή να θεωρήσει σωστά τη λέξη naktį/Nacht ως χρονικό προσδιορισμό και τη λέξη knygą/Buch ως αντικείμενο της πρότασης. Κάτι ανάλογο πρέπει να γίνει και για τη μορφολογία. Ένα από τα σφάλματα του λογισμικού που έχει ήδη δημιουργηθεί για τη μορφολογική ανάλυση της λιθουανικής γλώσσας είναι ότι το μόρφημα -ėj- θεωρείται επίθημα σε ρίζες με τις οποίες δεν μπορεί να συνδυαστεί. Πρέπει να προσδιοριστούν χαρακτηριστικά για τις λέξεις, τα οποία θα επιτρέπουν στον υπολογιστή να αποφασίζει με ποιες ρίζες μπορεί να συνδυαστεί αυτό το επίθημα -ėj-. Αυτό όμως είναι πολύ περίπλοκο. Ποιο χαρακτηριστικό έχουν, για παράδειγμα, από κοινού οι λέξεις geroė/Wohlhaben, žinovas/Kenner(Expert) και daržovė/Obst; Ότι όλες έχουν το επίθημα -ov-. Και τι τις διακρίνει από όλες τις υπόλοιπες λέξεις, στις ρίζες των οποίων δεν μπορεί να προστεθεί αυτό το επίθημα (δεν μπορούμε να πούμε *kėdovė — παράγωγο με το επίθημα -ov- από τη λέξη kėdė/Stuhl); Και ποιο χαρακτηριστικό το δείχνει;
Κατά την ανάπτυξη του πληροφοριακού συστήματος για τη λιθουανική γραμματική επιλέχθηκε, λοιπόν, η δεύτερη προσέγγιση: προετοιμάστηκε μια βάση δεδομένων που περιέχει λεπτομερείς γραμματικές πληροφορίες για όλες τις μορφές όλων των λέξεων της λιθουανικής γλώσσας. Εδώ δεν χρειάζεται να ξεκινήσει κανείς από τις γραμματικές κατηγορίες (όπως συμβαίνει σε όλες τις γραμματικές που εκδίδονται σε έντυπη μορφή), αλλά από την ίδια τη λέξη: για κάθε λέξη πρέπει να παρέχονται στον χρήστη όλες οι σχετικές με αυτήν πληροφορίες.
Αποφασίστηκε να ληφθεί ως αφετηρία μια ρίζα και να αναπτυχθεί λογισμικό που θα αντικατοπτρίζει ολόκληρη τη δομή της λιθουανικής γραμματικής. Ως πρώτη δοκιμή επιλέχθηκε η ρίζα bėg (από το ρήμα bėgti/τρέχω). Στη συνέχεια, δημιουργήθηκαν με υπολογιστή όλοι οι πιθανοί παράγωγοι τύποι και κατόπιν διαγράφηκαν με το χέρι όλες οι λέξεις που δεν υπάρχουν στη λιθουανική γλώσσα. Συνολικά, η βάση δεδομένων περιέχει περίπου 25.000 εγγραφές.
3.2. ΙΔΙΑΙΤΕΡΑ ΧΑΡΑΚΤΗΡΙΣΤΙΚΑ ΤΟΥ «LIGIS»
Το Πληροφοριακό Σύστημα Γραμματικής της Λιθουανικής Γλώσσας (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (Σύνδεσμος 7) έχει δύο σημαντικά χαρακτηριστικά. Πρώτον, παρέχει στον χρήστη λεπτομερέστερες πληροφορίες για μια συγκεκριμένη λέξη απ’ ό,τι οι έντυπες γραμματικές. Και
152
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
δεύτερον, περιλαμβάνει περισσότερες λέξεις από τα λεξικά. Οι γραμματικές παρουσιάζουν κανόνες που ισχύουν για μια συγκεκριμένη ομάδα λέξεων. Δεν αναφέρουν όμως όλες τις λέξεις στις οποίες εφαρμόζεται ο κανόνας. Το LIGIS συγκεντρώνει όλες τις πληροφορίες που σχετίζονται με τη λέξη που εισάγει ο χρήστης και τις παρουσιάζει σε έναν ιστότοπο. Στα λεξικά δεν περιλαμβάνονται όλες οι λέξεις της λιθουανικής γλώσσας· λείπουν πολλοί παράγωγοι τύποι και σύνθετες λέξεις. Το LIGIS περιλαμβάνει όλους τους πιθανούς παράγωγους τύπους. Ας δοθεί ένα παράδειγμα σύγκρισης. Η βάση δεδομένων για τα μορφήματα έχει περίπου 75.000 εγγραφές. Ωστόσο, αυτές αντιστοιχούν σε διαφορετικές λιθουανικές λέξεις. Η βάση δεδομένων του LIGIS αποτελείται σήμερα από 25.000 εγγραφές και περιλαμβάνει μόνο τις λέξεις που προέρχονται από μία ρίζα: beg-. Στη βάση δεδομένων για τα μορφήματα υπάρχουν 118 λέξεις με αυτή τη ρίζα.
3.3. ΔΟΜΗ ΤΗΣ ΛΕΞΗΣ
Μετά την εισαγωγή της λέξης, εξηγείται στον χρήστη η δομή της: δίνονται το λήμμα και η βασική λέξη, καθώς και η λέξη-προσδιοριστής για τους παράγωγους τύπους και τις σύνθετες λέξεις. Αν η λέξη είναι γραμματικά αμφίσημη, τότε κάθε σημασία λαμβάνει ξεχωριστό αριθμό για το λήμμα. Στη συνέχεια, τα μορφολογικά και μορφηματικά δεδομένα εμφανίζονται κάτω από αυτόν τον αριθμό. Ένα παράδειγμα αμφίσημης λέξης παρατίθεται στο Παράρτημα A.
Λοιποί τύποι. Έτσι ονομάζεται το κουμπί (αγγλικά button) που βρίσκεται στο πλαίσιο της δομής της λέξης. Ο ιστότοπος μορφολογικής ανάλυσης της ρωσικής γλώσσας (Σύνδεσμος 8) εμφανίζει κάθε φορά όλους τους τύπους της λέξης που έχει εισαχθεί. Στο πληροφοριακό σύστημα γραμματικής της λιθουανικής αποφασίστηκε να προστεθεί ένα κουμπί και να επιτρέπεται στον χρήστη να ανακτά μέσω συνδέσμου τους υπόλοιπους τύπους, επειδή δεν χρειάζεται κάθε φορά όλους τους τύπους μιας λέξης.
3.4. ΜΟΡΦΟΛΟΓΙΚΑ ΔΕΔΟΜΕΝΑ
Η μορφολογική πληροφορία περιλαμβάνει τον προσδιορισμό του μέρους του λόγου και τις γραμματικές κατηγορίες: πτώση, γένος, αριθμό για τα ουσιαστικά· πρόσωπο, χρόνο, έγκλιση για τα ρήματα κ.λπ. Οι αμφίσημες λέξεις αριθμούνται όταν, για παράδειγμα, ένα ουσιαστικό έχει ορισμένους ομόηχους τύπους πτώσης.
Στη βάση δεδομένων για τα μορφήματα (Σύνδεσμος 2) υπάρχουν επίσης μορφολογικά δεδομένα σχετικά με τη λέξη. Ωστόσο, η πληροφορία δίνεται αποκλειστικά με συντομογραφίες
Straipsniai / Articles
153
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Ένα τέτοιο παράδειγμα παρουσιάζεται στην Εικόνα 2. Για τους μη ειδικούς, τόσες πολλές συντομογραφίες μπορεί συχνά να είναι ακατανόητες. Ιδίως για τους αλλοδαπούς που μελετούν ή μαθαίνουν τη λιθουανική γλώσσα, οι πληροφορίες που παρουσιάζονται με αυτόν τον τρόπο μπορεί μερικές φορές να είναι ασαφείς.
ΕΙΚΟΝΑ 2. Δεδομένα για τη λέξη begčio, παρουσιασμένα αποκλειστικά με συντομογραφίες (Σύνδεσμος 2)
Στο πληροφοριακό σύστημα για τη λιθουανική γραμματική δεν χρησιμοποιούνται συντομογραφίες. Όλα τα στοιχεία αναγράφονται ολογράφως (Παράρτημα A).
3.5. ΜΟΡΦΗΜΙΚΑ ΔΕΔΟΜΕΝΑ
Η σημαντικότερη διαφορά σε σχέση με τις βάσεις δεδομένων στις οποίες υπάρχει ήδη πρόσβαση σήμερα1 είναι ο προσδιορισμός του τύπου κάθε μορφήματος. Μόνο έτσι επιτυγχάνεται σαφήνεια στην αναπαράσταση των μορφημάτων μιας λέξης. Διαφορετικά, για παράδειγμα, δεν μπορεί κανείς να διακρίνει τη δεύτερη ρίζα μιας σύνθετης λέξης από το επίθημα, όπως συμβαίνει στη βάση δεδομένων μορφημάτων.
Το πρώτο και καθοριστικό χαρακτηριστικό ήταν η αναπαράσταση των μορφημάτων με διαφορετικά χρώματα. Για κάθε τύπο μορφήματος (ρίζα, πρόθημα, επίθημα, κατάληξη) ορίστηκε ένα χρώμα. Τα προθήματα γράφονται με μπλε χρώμα. Για τη ρίζα χρησιμοποιήθηκε το κόκκινο. Τα επιθήματα παρουσιάζονται με πράσινο χρώμα, ενώ για την κατάληξη επιλέχθηκε το μαύρο.
Επιπλέον, η λέξη που έχει αναλυθεί σε μορφήματα παρατίθεται κατακόρυφα, ενώ δίπλα δεν αναγράφεται μόνο ο χαρακτηρισμός του τύπου κάθε μορφήματος της λέξης, αλλά δηλώνονται και οι ιδιότητες του μορφήματος, εφόσον έχει τέτοιες· για παράδειγμα, για τα επιθήματα: παραγωγικό ή κλιτικό· για τις καταλήξεις: συντετμημένες, αντωνυμικές κ.ά. Στην περίπτωση των συντετμημένων καταλήξεων, οι οποίες είναι πολύ συνηθισμένες στον προφορικό λόγο, παρατίθεται δίπλα και η πλήρης κατάληξη. Ως παράδειγμα μπορούν να αναφερθούν οι λέξεις στον προφορικό λόγο: šnekamoje kalboje – πλήρεις καταλήξεις, šnekamoj kalboj – συντετμημένες καταλήξεις. Αν η λέξη έχει πλήρη κατάληξη, δεν δηλώνεται κανένα χαρακτηριστικό μήκους, επειδή οι περισσότερες λέξεις έχουν πλήρεις καταλήξεις και μια τέτοια πληροφορία θα ήταν περιττή. Αν
154
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Εάν η κατάληξη δεν είναι pronominalized, δεν παρέχονται πληροφορίες σχετικά με αυτό.
Οι φωνητικές μεταβολές θεωρούνται ιδιότητα της ρίζας. Μπορεί να πρόκειται τόσο για μεταβολές συμφώνων όσο και για μεταβολές φωνηέντων. Μπορεί επίσης να παρατηρηθεί ακόμη ένα είδος φωνητικών μεταβολών στη λιθουανική γλώσσα: η αποβολή συμφώνων στην προστακτική. Στις φωνητικές μεταβολές της ρίζας μιας λέξης ανήκουν επίσης τα ένθετα μορφήματα. Ως ιδιότητα του προθήματος θεωρείται η προέλευσή του: προθετική, από σωματίδιο ή διεθνής.
Στην περίπτωση γραμματικής αμφισημίας των λέξεων εξετάζονται οι μορφημικές δομές. Εάν είναι ίδιες, περιγράφεται μόνο μία δομή. Εάν, ωστόσο, διαφέρουν, οι μορφημικές δομές δίνονται για κάθε σημασία της λέξης (Παράρτημα A).
3.6. ΟΛΟΙ ΟΙ ΤΥΠΟΙ ΤΗΣ ΛΕΞΗΣ
Για κάθε λέξη που περιλαμβάνεται στη βάση δεδομένων, ο πίνακας κλίσης μπορεί να ανοίξει με κλικ στο κουμπί «Υπόλοιποι τύποι». Εκεί παρατίθενται όλα τα δεδομένα από την καρτέλα μορφολογίας. Στην κορυφή του πίνακα αναφέρονται οι κατηγορίες που δεν περιλαμβάνονται στον πίνακα κλίσης· για παράδειγμα, τα ουσιαστικά στη λιθουανική γλώσσα δεν κλίνονται ως προς το γένος, οπότε στην κορυφή του πίνακα αναφέρονται το γένος, καθώς και το λήμμα και το μέρος του λόγου. Τα επίθετα και οι μετοχές έχουν τρία γένη, και ιδιαιτερότητα της λιθουανικής γλώσσας είναι ότι μόνο δύο από αυτά (το αρσενικό και το θηλυκό) έχουν και τις έξι πτώσεις. Το τρίτο γένος έχει μόνο έναν τύπο, γι’ αυτό παρατίθεται χωρίς ονομασία πτώσης (Παράρτημα B). Για τα ρήματα παρουσιάζονται όλοι οι τύποι των χρόνων σε όλες τις εγκλίσεις (Παράρτημα D).
Με αυτόν τον τρόπο οι τάξεις συζυγίας και οι τάξεις κλίσης καθίστανται περιττές, γι’ αυτό δεν παρέχονται σχετικά δεδομένα.
Για ορισμένες λέξεις έχουν επίσης καταχωριστεί παραδείγματα χρήσης στον πίνακα κλίσης. Για τον σκοπό αυτό χρησιμοποιείται η γρήγορη πληροφορία (αγγλικά tooltip). Στο Παράρτημα C παρατίθεται ως παράδειγμα η λέξη «bėgis» (αιτιατική, ενικός του ουσιαστικού bėgis / σιδηροδρομική γραμμή, τρέξιμο).
3.7. Η ΒΑΣΗ ΔΕΔΟΜΕΝΩΝ
Κατά την ανάπτυξη της βάσης δεδομένων επιδιώχθηκαν η υψηλότερη δυνατή ποιότητα και αξιοπιστία. Γι’ αυτό μεγάλο μέρος της εργασίας έγινε με το χέρι
Straipsniai / Articles
155
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
επιτεύχθηκε, επειδή μόνο με τη βοήθεια του ανθρώπου μπορεί να επιτευχθεί μια όσο το δυνατόν πιο αξιόπιστη πληροφορία (Sulger 2013: 53).
Στο Ινστιτούτο Λιθουανικής Γλώσσας πραγματοποιήθηκαν έρευνες για τα λιθουανικά προθήματα. Διαπιστώθηκε ότι στη λιθουανική γλώσσα υπάρχουν περίπου 600 συνδυασμοί προθημάτων (Šveikauskienė 2015: 195). Ως «συνδυασμοί» νοούνται διάφορες σειρές προθημάτων που μπορούν να εμφανιστούν πριν από τη ρίζα, π.χ. at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti κ.λπ. Διαπιστώθηκε ότι μόνο 220 από αυτούς τους συνδυασμούς χρησιμοποιούνται με ρηματικές ρίζες· οι υπόλοιποι, π.χ. nuo-, χρησιμοποιούνται με ουσιαστικά: nuo-monė /die Meinung. Το λογισμικό σχεδιάστηκε έτσι ώστε να συνδέει αυτόματα τη ρίζα με όλους τους πιθανούς συνδυασμούς προθημάτων. Στη συνέχεια, τα αποτελέσματα που παράγει ο υπολογιστής ελέγχονται από ανθρώπους και οι λέξεις που υπάρχουν πράγματι στη λιθουανική γλώσσα καταχωρίζονται στη βάση δεδομένων. Έτσι αποφεύγονται δύο άκρα: τόσο ο υπερβολικός αριθμός μορφών που παράγονται από τον υπολογιστή όσο και η ανεπαρκής κάλυψη των λέξεων.
Όλα τα λήμματα και οι γραμματικές πληροφορίες που τα αφορούν καταχωρίζονται με το χέρι στη βάση δεδομένων. Επειδή το λογισμικό που δημιουργήθηκε στο Ινστιτούτο Μαθηματικών και Πληροφορικής δεν κάνει λάθη κατά τη δημιουργία των μορφών της λέξης για το δεδομένο λήμμα, εμπιστεύτηκαν στον υπολογιστή τον αυτόματο σχηματισμό των καταχωρίσεων για τις υπόλοιπες μορφές της λέξης.
Αξιοσημείωτο είναι ότι στο LIGIS επεξεργάζονται επίσης λέξεις με αποκομμένες καταλήξεις. Τέτοιες λέξεις είναι πολύ συχνές στον προφορικό λόγο και καμία από τις ήδη υπάρχουσες βάσεις δεδομένων δεν επεξεργάζεται αυτές τις μορφές λέξεων. Πρέπει ακόμη να τονιστεί ότι το LIGIS περιλαμβάνει και τέτοιες παράγωγες μορφές που απουσιάζουν ακόμη και από το λεξικό της λιθουανικής γλώσσας σε 20 τόμους, καθώς και από την ηλεκτρονική του έκδοση (Σύνδεσμος 9), π.χ. neužbėgti/nicht mehr hinauflaufen.
Στη βάση δεδομένων, οι πληροφορίες αποθηκεύονται σε μορφή φιλική προς τους υπολογιστές, δηλαδή χρησιμοποιείται η κωδικοποίηση σε Prage Markup Language (Hana, Štepánek 2012). Αυτή η μορφή δεδομένων δεν παρουσιάζεται στο Διαδίκτυο, καθώς θα ήταν περιττή για όσους δεν είναι επαγγελματίες της υπολογιστικής γλωσσολογίας.
Το γεγονός ότι όλες οι πληροφορίες αποθηκεύονται σε μια βάση δεδομένων καθιστά το LIGIS χρήσιμο εργαλείο και για τους γλωσσολόγους που μελετούν τη λιθουανική γλώσσα. Μπορεί κανείς να λάβει διάφορα είδη πληροφοριών, π.χ. να αναζητήσει λέξεις με συγκεκριμένο συνδυασμό προθημάτων και επιθημάτων κ.ά.
156
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
3.8. ΠΟΛΥΓΛΩΣΣΙΑ ΤΟΥ ΙΣΤΟΤΟΠΟΥ
Ο ιστότοπος είναι διαθέσιμος σε επτά γλώσσες: λιθουανικά, αγγλικά, γερμανικά, γαλλικά, ιταλικά, ρωσικά και ιαπωνικά. Η ανάγκη ύπαρξης ενός πολύγλωσσου ιστοτόπου προέκυψε από τις μη ικανοποιητικές μεταφράσεις των λιθουανικών από το Google. Η αυτόματη μετάφραση της λιθουανικής γλώσσας είναι αναξιόπιστη. Γι’ αυτό αποφασίστηκε να γίνει πολύγλωσσος ο ιστότοπος για τη γραμματική της λιθουανικής γλώσσας και να χρησιμοποιούνται μόνο κείμενα μεταφρασμένα από ανθρώπους. Η κατάσταση στις άλλες γλώσσες προφανώς δεν είναι πολύ καλύτερη. Αυτό μαρτυρεί η επιστολή του Lingvist της 8ης Ιουνίου 2017, στην οποία ζητείται η μετάφραση της ονομασίας LINGUIST να ανατεθεί σε φυσικούς ομιλητές και σε καμία περίπτωση να μη γίνει αυτόματη μετάφραση (LinguiList 2017: 28.252).
Όταν αποφασίσαμε να κάνουμε τον ιστότοπο πολύγλωσσο, η ιδέα μας ήταν η εξής: αν ένας ξένος, για παράδειγμα ένας Νορβηγός, μαθαίνει ή μελετά τη λιθουανική γλώσσα και γνωρίζει ορισμένες λιθουανικές λέξεις, αλλά όχι ακόμη κάποιες άλλες, μπορεί να επιλέξει μια γλώσσα που γνωρίζει καλύτερα από τα λιθουανικά, για παράδειγμα τα γερμανικά, και όλες οι λιθουανικές λέξεις που δεν γνωρίζει θα γίνουν κατανοητές σε αυτόν. Για τον σκοπό αυτό προβλέφθηκε ακόμη και η αποθήκευση της λέξης που εισάγει ο χρήστης κατά την αλλαγή γλώσσας. Έτσι, όταν ένας χρήστης επιλέγει άλλη γλώσσα, δεν χρειάζεται να εισαγάγει ξανά τη λέξη.
4. ΣΧΕΔΙΑ ΓΙΑ ΤΟ ΜΕΛΛΟΝ
Στο Πανεπιστήμιο του Βίλνιους έχουν ψηφιοποιηθεί πολλά δίγλωσσα λεξικά. Στο Ινστιτούτο Λιθουανικής Γλώσσας ψηφιοποιήθηκε το μεγάλο λεξικό σε 20 τόμους, καθώς και τα άλλα μονόγλωσσα λεξικά: συνωνύμων, αντωνύμων, φρασεολογισμών κ.ά. Σχεδιάζεται η σύνδεση των δύο ειδών λεξικών με το πληροφοριακό σύστημα της λιθουανικής γραμματικής και η δημιουργία ενός αντίστοιχου της γερμανικής ιστοσελίδας CANOONET (Link 10).
Καθώς το πληροφοριακό σύστημα για τη γραμματική της λιθουανικής γλώσσας περιέχει δεδομένα για τα μορφήματα, είναι δυνατή η αναζήτηση λέξεων βάσει του μορφηματικού μοντέλου. Και ακριβώς αυτό προβλέπεται για το μέλλον.
Μια καρτέλα (αγγλ. tab) στον ιστότοπο LIGIS προορίζεται για τη θεωρία και βρίσκεται επί του παρόντος υπό επεξεργασία. Εκεί θα παρέχονται εκτενέστερες ακαδημαϊκές γνώσεις για τη λιθουανική γραμματική.
Straipsniai / Articles
157
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS
Στην πρώτη φάση ασχολούμαστε με τη μορφολογία. Στο δεύτερο στάδιο προβλέπεται να καταχωριστούν και συντακτικά δεδομένα.
5. Συμπεράσματα
1. Αυτή η προσέγγιση μπορεί να είναι χρήσιμη και εύλογη και για άλλες γλώσσες με πλούσια κλίση.
2. Το πληροφοριακό σύστημα για τη λιθουανική γραμματική μπορεί να είναι πολύ χρήσιμο για μαθητές, φοιτητές, αλλοδαπούς που μαθαίνουν λιθουανικά, καθώς και για γλωσσολόγους που μελετούν τη λιθουανική γλώσσα.
3. Τα δεδομένα που έχουν συγκεντρωθεί μπορούν επίσης να χρησιμεύσουν ως τεκμηρίωση της λιθουανικής γλώσσας.
Literaturverzeichnis
Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).
Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).
Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.
Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.
Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.
Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.
Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.
158
Acta Linguistica Lithuanica XXVII
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.
Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.
Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].
Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.
Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.
Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.
Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.
Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.
Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.
Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).
Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).
Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.
Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.
Straipsniai / Articles
159
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.
Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.
Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.
Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.
LINKS
Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)
Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)
Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)
Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)
Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)
Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)
Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)
Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)
Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)
Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)
160
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG A. GRAMMATISCHE INFORMATION.
Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.
Die grammatische Information wird in der Website in Kacheln ausgelegt.
Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.
Bemerkung: Die Farben sind im Bild entfernt.
Straipsniai / Articles
161
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
ANHANG B. FORMENtABELLE FÜR DEKLINATION.
Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.
NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta
162
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.
Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.
Straipsniai / Articles
163
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
ANANG D. FORMENTABELLE FÜR KONJUGATION.
Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.
164
Acta Linguistica Lithuanica LXXVII
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete
SANTRAUKA
Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.
Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.
Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.
Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.
Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.
Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.
Straipsniai / Articles
165
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS
Įteikta 2017 m. rugsėjo 5 d.
DAIVA ŠVEIKAUSKIENĖ
Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]
ARŪNAS RIBAUSKAS
Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected]
VYTAUTAS ŠVEIKAUSKAS
Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]
166
Acta Linguistica Lithuanica LXVII