Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti tekstynai
Full text
BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ Vytauto Didžiojo universitetas MORFOLOGICZNIE I SKŁADNIOWO ANOTOWANE KORPUSY JĘZYKA LITEWSKIEGO SŁOWA KLUCZOWE: korpus, automatyczna analiza morfologiczna, automatyczna analiza składniowa, technologie językowe. WPROWADZENIE Już od 25 lat w Centrum Lingwistyki Komputerowej (KLC) Uniwersytetu Witolda Wielkiego (VDU) tworzone i rozwijane są technologie językowe (Utka i in. 2017). Zasoby i narzędzia języka 1 litewskiego opracowane w VDU KLC stanowią podstawę, bez której nie można się obejść przy komputeryzacji języka litewskiego, a w lipcu 2015 r. VDU KLC i Wydział Informatyki VDU wraz z pritaikant jai naujas technologijas. 2015 m. pradžioje Lietuva tapo visateise CLARIN ERIC nare, o partnerami z Uniwersytetu Wileńskiego oraz Kauno technologijos universiteto założyły konsorcjum CLARIN-LT i rozpoczęły tworzenie infrastruktury zasobów i technologii”, – tym samym vykdyti projektą „Lietuvos narystė tarptautinėje mokslinių tyrimų infrastruktūroje – Bendroji kalbos włączyły się we wspólny europejski system technologii językowych. 2 Šio straipsnio tikslas – pristatyti du lietuvių kalbos išteklius, anotuotus lietuvių kalbos korpusy przygotowane w VDU KLC: morfologicznie anotowany korpus MATAS oraz składniowo tekstyną ALKSNIS. Šie ištekliai viešai prieinami CLARIN-LT saugykloje, paiešką galima atlikti per anotowany system ANNIS (szerzej zob. rozdział 3), a także wyszukiwanie w automatycznie 3 morfologicznie anotowanym technologie. Komputeryzując język i opracowując narzędzia tekstyne galima svetainėje http://corpus.vdu.lt 4 . Anotuoti tekstynai – pagrindiniai ištekliai, atliekantys svarbų vaidmenį plėtojant kalbos komputerowe przeznaczone do automatycznej analizy języka, niezbędna jest analiza gramatyczna oraz dane statystyczne dotyczące języka. Zatem korpusy uzupełnione o oznaczenia gramatyczne są niczym surowiec do dalszej automatycznej analizy języka. Takie korpusy wykorzystuje się do tworzenia innych zasobów i narzędzi języka naturalnego w takich dziedzinach, jak 1 Dostęp online: http://tekstynas.vdu.lt. 2 Dostęp online: http://clarin-lt.lt/. 3 Dostęp online: http://158.129.51.247:8080/annis-gui-3.4.4/. 4 Jest to korpus składający się z 208 mln słów, automatycznie anotowany morfologicznie. Dalej w tym artykule nie pisze się już o nim. Najwięcej uwagi poświęcono korpusowi MATAS, składającemu się z 1,6 mln słów, przejrzanemu przez językoznawcę i anotowanemu morfologicznie.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 2 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 systemy automatycznego rozpoznawania mowy, uczenie maszynowe, tłumaczenie automatyczne, ekstrakcja informacji itp. W dalszej części artykułu osobno przedstawiono wspomniane korpusy i wyszukiwanie danych w sistemą. Tekstynais ir jų duomenimis gali pasinaudoti tyrėjai bei studentai, tiriantys lietuvių kalbos nich za pośrednictwem systemu gramatycznego ANNIS, a także informacje przydatne wykładowcom i nauczycielom przy opracowywaniu zadań oraz wszystkim zainteresowanym językiem technologijomis. ANOTOWANE KORPUSY JĘZYKA LITEWSKIEGO I SPECYFIKA ICH TWORZENIA 1. Morfologiškai anotuotas tekstynas MATAS Analiza morfologiczna jest pierwszym etapem przetwarzania języka i często przygotowuje tekst tolesnei sintaksinei ar semantinei analizei, todėl labai svarbu, kad morfologiniai anotatoriai veiktų możliwie najdokładniej, ponieważ błędy popełnione na poziomie morfologii utrudniają automatyczną analizę języka na innych poziomach. Pierwszy anotator morfologiczny języka litewskiego powstał około 25 lat temu. Jego autorem jest Vytautas Zinkevičius (szerzej zob. Zinkevičius 2000). Obecnie dla języka litewskiego publicznie dostępne są dwa anotatory morfologiczne: wspomniany program V. Zinkevičiusa, najczęściej nazywany Lemuoklis (od słowa lema – forma hasłowa), oraz anotator dostępny w portalu Lietuvių kalbos 5 sintaksinės ir semantinės analizės informacinė sistema (dalej semantika.lt). Niniejszy artykuł przygotowano z wykorzystaniem anotatora morfologicznego semantika.lt. kodu. Anotator 6 Semantika.lt został stworzony na platformie Hunspell jako program o otwartym kodzie źródłowym; pristatomas tekstynas MATAS anotuotas naudojant Lemuoklį, o sintaksiškai anotuotas tekstynas anotator ten jest aktualizowany, uzupełniany o nowe słowa (obecnie obejmuje 171 000 lemów), a jego Nors Lemuoklis veikia gana gerai, bet šios programos negalima atnaujinti, nes ji yra uždaro reguły są porządkowane (szerzej Dadurkevičius 2017). W 2017 r. po przeprowadzeniu badania i ocenie jakości obu anotatorów ustalono, że dokładniej działa anotator semantika.lt (Kapočiūtė-Dzikienė i in. 2017). Poniżej przedstawiono korpus MATAS opracowywany w latach 2002–2014. Jako podstawę przyjęto korpus liczący 1 mln słów, utworzony w 2006 r.; został on uzupełniony o nowe teksty i przebudowany. W pierwszej kolejności teksty MATO zostały automatycznie anotowane morfologicznie, a następnie przejrzane i uporządkowane przez językoznawcę. 5 Dostęp online: http://tekstynas.vdu.lt/page.xhtml?id=morphological-annotator; program ten nie tylko anోటuje tekst morfologicznie, lecz może go także syntetyzować, tzn. wygenerować potrzebne formy; jest on przystosowany również do analizowania dawnych pism. 6 Prieiga internete: http://semantika.lt/SyntaticAndSemanticAnalysis/Analysis.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti tekstynai | 3 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 MATĄ składa się z 1,6 mln tekstów, obejmujących dokumenty, utwory literatury mokslinių tekstų. Kaip ir Dabartinės lietuvių kalbos tekstyne, didžiausią dalį (36 proc.) sudaro pięknej oraz teksty publicystyczne (zob. rysunek 1). RYS. 1 Budowa morfologicznie anotowanego korpusu MATAS (w procentach) MATAS jest dostępny w kilku formatach: w tak zwanym formacie KLC, w którym stosuje się nieco nietypowe skróty części mowy i kategorii gramatycznych (w tym formacie anotowany jest również korpus dostępny w repozytorium portalu http://clarin-lt.lt/), np.: <word="Tarp" lemma="tarp" type="prln"> <space> <word="tankiai" lemma="tankiai" type="prvks teig nelygin.l"> <space> <word="suaugusių" lemma="suaugti(-ga,-go)" type="dlv teig nesngr veik.r būt.kart.l neįvardž vyr.gim dgsk K"> <space>плотно <word="suaugusių" lemma="suaugti(-ga,-go)" type="dlv teig nesngr veik.r būt.kart.l neįvardž vyr.gim dgsk</word> <word="drzew" lemma="drzewo" type="dktv vyr.gim dgsk K"> <space> <word="gdzieniegdzie" lemma="gdzieniegdzie" type="prvks teig nelygin.l"> <space> <word="ciągle" lemma="ciągle" type="prvks teig nelygin.l"> <space> <word="spotykało się" lemma="spotykać się" type="vksm teig sngr tiesiog.nuos būt.d.l vnsk IIIasm"> <space> <word="dangaus" lemma="dangus" type="dktv vyr.gim vnsk K"> <space> <word="lopinėlis" lemma="lopinėlis" type="dktv vyr.gim vnsk V"> <sep=". "> <p> MATAS taip pat został zaanotowany w międzynarodowym formacie TEI P5. W nim części mowy i kategorie gramatyczne skraca się za pomocą jednej litery lub cyfry, np. vatstdv3 oznacza odpowiednio: Literatura naukowa 24% Czasopisma 36% Administracyjne tekstai 21% Teksty korpusów 19%
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti literatury pięknej | 4 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 czasownik, forma osobowa, forma twierdząca, zwrotny, tryb oznajmujący, czas przeszły częstotliwy, liczba pojedyncza, trzecia osoba. Poniżej podano ten sam fragment tekstu w formacie TEI P5: <w lemma="tarp" ana="#r">Tarp</w> <pc> </pc> <w lemma="tankiai" ana="#ptn">tankiai</w> <pc> </pc> <w lemma="suaugti(-ga,-go)" ana="#vdtnvknvdk">dorosłych</w> <pc> </pc> <w lemma="medis" ana="#dbvdk">drzew</w> <pc> </pc> <w lemma="kur ne kur" ana="#ptn">tu i ówdzie</w> <pc> </pc> <w lemma="vis" ana="#ptn">wciąż</w> <pc> </pc> <w lemma="pasimatyti(-to,-tė)" ana="#vatstdv3">pasimatydavo</w> <pc> </pc> <w lemma="dangus" ana="#dbvvk">nieba</w> <pc> </pc> <w lemma="lopinėlis" ana="#dbvvv">skrawek</w> <pc>.</pc> Jeszcze jeden format, w którym morfologicznie adnotowane teksty są dostępne na stronie http://corpus.vdu.lt, został opracowany na podstawie przykładu formatu MULTEXT-East. Zgodnie 7 z tym formatem każda część mowy ma inną liczbę kategorii morfologicznych (od 2 do 14), zapisywanych za pomocą skrótów, np. w oznaczeniu NcmpnnN N oznacza rzeczownik, c – rzeczownik pospolity, m – rodzaj męski, p – liczbę mnogą, n – mianownik, n – rzeczownik niezwrotny, a myślnik na końcu oznacza, że temu słowu, np. universitetai, nie przypisano żadnej cechy semantycznej. 8 W trzecim rozdziale przedstawimy wyszukiwanie zarówno w korpusach MATO, jak i ALKSNIS z wykorzystaniem systemu ANNIS. W niej stosuje się jeszcze jeden format oznaczeń morfologicznych, oparty na oznaczeniach glosowania lipskiego (więcej informacji zob. rozdział 3). Różne systemy anotacji są charakterystyczne nie tylko dla technologii języka litewskiego. Problem ten skłonił do stworzenia narzędzia do konwersji Pepper (Zipser i in. 2010). Pokazuje to etapy tworzenia różnych zasobów oraz wykorzystywane narzędzia anotacyjne. Jak wynika z przedstawionych wcześniej przykładów, w KLC stosowane są cztery systemy oznaczeń morfologicznych. Kilka różnych formatów anotacji powstało dlatego, że korpus anotowany morfologicznie był przygotowywany przez długi czas. Przez pewien czas w ogóle nie stosowano żadnych standardów anotacji, lecz używano skrótów nazw części mowy i kategorii gramatycznych opracowanych przez twórcę analizatora morfologicznego V. Zinkevičiusa. Są one łatwo zrozumiałe dla użytkowników. Po pewnym czasie, w wyniku współpracy międzynarodowej, morfologicznie anotowany korpus został ponownie anotowany z wykorzystaniem 7 Dostęp online: http://nl.ijs.si/ME/V4/msd/html/index.html. 8 Więcej informacji o tych oznaczeniach można znaleźć na stronie http://corpus.vdu.lt/lt/morph.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 5 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 standardów międzynarodowych. Jak wspomniano, w analizatorze morfologicznym semantika.lt (głównym celem tego systemu było stworzenie usług internetowych) stosowane są oznaczenia w formacie MULTEXT-East. Oznaczenia są krótkie, ale trudne do zrozumienia dla ludzi; lepiej nadają się do analizy komputerowej. Morfologicznie anotowany w formacie MULTEXT-East i syntaktycznie anotowany korpus ALKSNIS. Narzędzie do wyszukiwania w korpusach ANNIS (zob. rozdział 3) umożliwiło połączenie formatów anotacji morfologicznej ALKSNISU i MATE. Pierwszym pomysłem było użycie oznaczeń Universal Dependency (UD), ponieważ jest to dość rozpowszechniony system anotacji i jest łatwo czytelny (w języku angielskim). Jednak oznaczenia UD są bardzo długie i okazało się to niewygodne podczas wyszukiwania za pomocą ANNIS: oznaczenia każdego słowa zajmują dużo miejsca, dlatego podczas analizowania kontekstu wyszukiwanego słowa trzeba było przesuwać suwak okna w jedną lub drugą stronę. Z powodu tego praktycznego problemu postanowiono zaadaptować oznaczenia glosowania z Lipska, ponieważ są łatwo czytelne i dość krótkie. Pomimo różnorodności oznaczeń anotacyjnych opisanych tutaj należy podkreślić, że w interfejsie ANNIS obu korpusów używany jest tylko jeden system (zaadaptowany system glosowania z Lipska), co powinno stanowić znaczne ułatwienie dla użytkowników. Warto wspomnieć, że w MATE nie wskazano granic zdań; można to szybko zrobić automatycznie, ale otrzymane wyniki trzeba sprawdzić. MATE, podobnie jak omawiany dalej korpus 9 ALKSNIS, jest dostępny w repozytorium portalu http://clarin-lt.lt/. Można w nim przeprowadzać wyszukiwanie za pomocą systemu ANNIS (więcej informacji zob. rozdział 3). 10 2. Syntaktycznie anotowany korpus ALKSNIS Syntaktycznie anotowany korpus języka litewskiego ALKSNIS został przygotowany w 2016 r. Jego opracowanie wsparła Infrastruktura Zasobów i Technologii Językowych, Konsorcjum Europejskiej Infrastruktury Badań Naukowych (CLARIN ERIC) (MTI-02/2015). Korpus jest publicznie dostępny w repozytorium portalu http://clarin-lt.lt/. Sposób 11 korzystania z niego wyjaśniono w przewodniku użytkownika. 12 Korpus zaplanowano jako wzorzec litewskiej analizy syntaktycznej. Tego rodzaju korpusy charakteryzują się tym, że są niewielkie, mają optymalny skład gatunkowy, a analiza syntaktyczna, choć przeprowadzona automatycznie, została jednak zweryfikowana i poprawiona przez językoznawców. Na podstawie wzorca analizy syntaktycznej można tworzyć parser syntaktyczny działający na podstawie statystycznej (ang. statistically-based parser) oraz rozwijać automatyczną analizę syntaktyczną (Bielinskienė i in. 2016). 9 Dostęp online: https://clarin.vdu.lt/xmlui/handle/20.500.11821/9. 10 Dostęp online: http://158.129.51.247:8080/annis-gui-3.4.4. 11 Dostęp online: https://clarin.vdu.lt/xmlui/handle/20.500.11821/10. 12 Dostęp online: https://youtu.be/PlE0PWurb4Y.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 6 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 Ponieważ ALKSNIS jest nowszym zasobem języka litewskiego niż MATAS i mniej opisanym, dlatego w niniejszym artykule poświęcimy ALKSNIS większą uwagę, a także omówimy kwestie, które pojawiły się podczas anotacji składniowej. 2.1. Części korpusu Korpus ALKSNIS składa się z 30 599 słów i 2355 zdań poddanych anotacji składniowej. W porównaniu z korpusami języków krajów sąsiednich korpus ten jest dość podobny i można stwierdzić, że ma wystarczającą wielkość: korpus języka łotewskiego składa się z 3800 zdań i 53 tys. słów 13 (Predkalnina i in. 2016); składniowo anotowany korpus języka estońskiego PENN (USA) jest znacznie 14 – 1400 sakinių, 10 600 žodžių (Muischnek ir kt. 2014); lenkų kalbos 15 – 8227 sakinių. Pirmąjį większy – liczy około 3 mln słów. 16 ALKSNIO tekstai apima keturias žanrines dalis (žr. 2 pav.). Bendrosios bei specialiosios części czasopism i literatury pięknej są mniej więcej równe, natomiast część tekstów specifinė lietuvių kalba: sakiniai dažnai būna ilgi, juose gausu dokumentų pavadinimų, nuorodų į kitus dokumentus ir pan. Tokių sakinių anotavimas neatskleistų tipiškos sintaksinės struktūros. administracyjnych jest najmniejsza, ponieważ stanowi 2 PAV. Struktura składniowo anotowanego Tekstynui sudaryti imti ištisi, nesutrumpinti tekstai. Sakiniai atrinkti iš kuo įvairesnių korpusu ALKSNIS według gatunków tekstów. Część literatury pięknej stanowią zdania z utworów autorów litewskich. Wybrane zdania przygotowano do analizy komputerowej: sprawdzono kodowanie tekstu, usunięto tabele i ilustracje. 13 Dostęp online: http://sintakse.korpuss.lv/index.html. 14 Dostęp online: https://metashare.ut.ee/repository/browse/estoniantreebank/4eb86e5e463411e2a6e4005056b400242c46832883754ad7bd89d07f69d6a0fc/. 15 Dostęp online: http://zil.ipipan.waw.pl/Sk%C5%82adnica. 16 Dostęp online: https://catalog.ldc.upenn.edu/ldc99t42.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 7 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 2.2. Narzędzia anotowania i wizualizacji korpusu Automatyczna analiza składniowa opiera się na analizatorze składniowym opracowanym w ramach projektu WKL VDU „System składniowo-semantycznej analizy języka litewskiego dla korpusu, litewskiego internetu i zastosowań sektora publicznego”, stworzonym w języku Haskell. Analizator 17 opiera się na regułach, analizuje morfologicznie anotowane pliki modułów analizy, a w wyniku pagrįstu (angl. rule-based) metodu. Šis įrankis skaito semantika.lt segmentavimo ir morfologinės przedstawia zdania podzielone na role i funkcje składniowe (Boizou i in. 2014: 69). Usługi internetowe dėmenis ar sintagmas, generuoja sintaksinius medžius, nurodo jų teminius vaidmenis (angl. thematic generują wyłącznie pliki JSON, jednak inne narzędzie KLC konwertuje wyniki analizy składniowej do formatu PML (Prague Markup Language). Do wizualizacji i edycji drzew zależności składniowo anotowanych w formacie PML wykorzystuje segmentację zdań oraz analizę morfologiczną praskiego tekstynui yra generuojami priklausomybių medžiai (angl. dependency trees). Šis formatas leidžia Karola, a także automatyczną analizę składniową (opartą na regułach universiteto UFAL sukurtą TrED redaktorių 18 (žr. 3 pav.). Visi automatiškai suanotuoti sakiniai patikrinti ir ištaisyti kalbininkų. Taigi sintaksinė analizė apima tris lygmenis: automatinį žodžių ir metodu) ir rankinį sakinių tvarkymą (plačiau žr. 2.4). 2.3. STRUKTURA DANYCH ALKSNIO Po przeprowadzeniu automatycznej analizy składniowej zdania są przedstawiane graficznie w formie drzewa (zob. rys. 3). Każdy wierzchołek drzewa odpowiada słowu zdania, znakowi interpunkcyjnemu lub innej jednostce zdania (symbolowi, cyfrze itp.). Relacje zależności między słowami są wskazywane za pomocą „gałęzi” lub krawędzi. 17 Analizator składniowy został opracowany w Centrum Lingwistyki Komputerowej VDU przez L. Boizou i F. Zamblerę. 18 Dostęp online: https://ufal.mff.cuni.cz/tred/.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 8 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 RYS. 3. Drzewo zależności zdania z anotacją składniową w formacie edytora TrEd Przy wszystkich słowach w następującej kolejności podaje się (zob. rys. 3): 1) konkretną formę słowa użytego w zdaniu (np. gyventojai); 2) forma hasłowa (słownikowa) – lema (np. gyventojas); 3) oznaczenia morfologiczne (np. Ncmpnn-); 4) funkcja składniowa (np. Sub) (wyjaśnienia skrótów zob. poniżej). 2.4. Poziomy analizy Poziom analizy morfologicznej. Anotacja morfologiczna jest pierwszym etapem analizy automatycznej, dlatego jest niezbędna do przeprowadzenia analizy składniowej lub analizy zdania na wyższym poziomie. Analizę morfologiczną przeprowadzono przy użyciu anotatora semantika.lt (Dadurkevičius 2017). Oznaczenia morfologiczne stosowane w ALKSNIS utworzono na podstawie przykładu formatu MULTEXT-East (szerzej opisano w rozdziale 1).
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti tekstynai | 9 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 Sintaksinės analizės lygmuo. Sintaksinis analizatorius apdoroja morfologiškai anotuotus pliki i przedstawia zdania podzielone na człony lub syntagmy, generuje drzewa składniowe (ang. nurodo jų elementų sintaksines funkcijas. Analizė remiasi priklausomybių gramatikos modeliu dependency grammar). Jest on zwykle stosowany do języków typologicznie podobnych, dla których charakterystyczna jest odmiana form wyrazów i swobodny szyk wyrazów, np. języków 19 słowiańskich (PDT, SynTagRus), języka łotewskiego itp. Zależności składniowe wyrażane są 20 hierarchicznie. Rozpoczyna się od głównego członu zdania – wierzchołka drzewa, z którym łączone są pozostałe człony zdania zgodnie z ich zależnością (tj. relacjami składniowymi). Skróty oznaczeń składniowych oraz informacje o relacjach i zależnościach składniowych opierają się na dorobku czeskim (Hajič i in. 1999); jako jedni z pierwszych rozwinęli analizę składniową dla czeskiego języka typu syntetycznego. Obecnie w ALKSNYS stosuje się 18 podstawowych oznaczeń składniowych (nie licząc ich wariantów): Sub – podmiot, Pred – orzeczenie (predykat), Obj – dopełnienie itd. (zob. tabelę 1). Warianty oznaczeń pojawiają się wtedy, gdy łączy się w jednym oznaczeniu oznaczenia dwojakiego lub podwójnego rodzaju, np. przy oznaczaniu złożonego orzeczenia typu imiennego lub czasownikowego stosuje się oznaczenia dwojakiego rodzaju: odpowiednio PredN i PredV; oznaczając zdanie podrzędne przydawkowe (atrybutywne) zdania złożonego, przy orzeczeniu zdania podrzędnego zaznacza się podwójną etykietę Pred_Atr; aby pokazać relację łączenia (koordynację), przy jednorodnych częściach zdania jako część podwójnej etykiety oznacza się _Co, tzn. przy każdym z wymienionych jednorodnych dopełnień zapisuje się Obj_Co itd. Nawiasem mówiąc, w zdaniach złożonych mogą pojawić się także potrójne etykiety, na przykład gdy trzeba oznaczyć jednorodne zdania podrzędne: Pred_Atr_Co – jest to zdanie podrzędne przydawkowe (atrybutywne). TABELA 1. Funkcje składniowe i ich etykiety w korpusie Etykieta Funkcja składniowa Sub Podmiot Pred On [Sub] powiedział On Orzeczenie (lub słowo szedł [Pred]; był [Pred] Przykład PredN Był [Pred] zadowolony [PredN] pomocnicze) PredV Czasownikowa część orzeczenia zadowolony Turi [Pred] odwdzięczyć się [PredV] Imienna część orzeczenia Obj Dopełnienie Czekam na gościa [Obj]; trzeba rozwiązać [Obj] Atr Atrybut (przydawka) Szkoła średnia [Atr]; państwo członkowskie [Atr] Adj Okoliczniki Teraz [Adj] zdecyduje; Na ulicy Partyzantów [Adj] 19 Praski Bank Drzew Zależności (Prague Dependency Treebank), szerzej zob. https://ufal.mff.cuni.cz/pdt3.0. 20 Dostęp online: http://www.ruscorpora.ru/en/.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 16 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 RYS. 9 Przykład anotowania członów połączonych relacją współrzędności Jeśli występuje wieloczłonowe połączenie mieszane, spójnik znajdujący się w konstrukcji jest wierzchołkiem, a od niego odchodzą wszystkie pozostałe człony bezspójnikowe (przecinki wraz z przyporządkowanymi im wyliczanymi wyrazami znajdują się na tym samym poziomie zależności). Pozostałe znaki interpunkcyjne oznacza się jako Aux (zob. rys. 10).
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 17 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 RYS. 10 Przykład anotacji mieszanej konstrukcji współrzędnej (na rysunku widoczne są także inne przypadki relacji współrzędnej) Wierzchołkiem zdania współrzędnego jest spójnik współrzędny. Wyrazy łączące, które są tworzone przez przysłówki, zaimki lub partykuły (np. przysłówek todėl), zależą od predykatu drugiego członu zdania i pełnią funkcję okolicznika (Adj), natomiast funkcję koordynacji Coord pełni przecinek, podobnie jak w zdaniach bezspójnikowych lub w zdaniach z powtarzającymi się spójnikami, które tutaj uznaje się za partykuły (zob. rys. 12), podobnie jak w przypadku łączenia członów zdania (zob. rys. 11, 12).
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 18 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 RYS. 11 Przykład anotacji zdania współrzędnego z wyrazem łączącym RYS. 12 Anotacja konstrukcji współrzędnej korpusy | 19
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 Sudėtinga anotuoti skaitines išraiškas, pvz., valandas, metus. Jos anotuotos kaip aplinkybės z przydawkami lub jako przydawki (zob. rys. 13, 14). 13 PAV. Datos anotavimas RYS. 14. Anotowanie dat i innych wyrażeń liczbowych (na rysunku przedstawiono jedynie fragment zdania oznakowanego syntaktycznie) korpusy | 20
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 Nie zawsze łatwo jest anotować orzeczenia złożone. W niektórych przypadkach są one anotowane tak, jak są rozumiane w gramatykach języka litewskiego, tj. jako orzeczenia typu imiennego i czasownikowego (np. yra [Pred] paprastas [PredN]; gali [Pred] būti [PredV]), natomiast w niektórych przypadkach drugi człon orzeczenia uznaje się za obiekt (np. ketinu [Pred] sukviesti [Obj]). Trudne do anotowania były konstrukcje z parzystymi spójnikami, ponieważ oba spójniki są hierarchicznie równorzędne. W takim przypadku uznano, że wyższą pozycję w hierarchii zajmuje 15 RYS. Przykład pagrindinio sakinio dėmens tarinys, nuo jo priklauso šalutinio sakinio dėmuo (žr. 15 pav.). anotowania zdań złożonych z parzystymi spójnikami spójniki relacji współrzędnej postanowiono Galiausiai svarstyta dėl kai kurių kalbos dalių statuso. Pavyzdžiui, kartojamuosius uznać za partykuły, ponieważ ich funkcja w strukturze drzewa zależności jest podobna do funkcji partykuł (zob. rys. 12). Podczas ręcznego anotowania składniowego rozwiązywano niemało problemów, tutaj wymieniono tylko kilka z nich. Wiele trudności związanych z anotowaniem rozwiązano, kierując się podejściem tradycyjnej gramatyki, a jedynie uzgadniając określony sposób anotowania. W innych przypadkach anotavimo ypatumų ir anotuojant nuosekliai laikytis susitarimo. Tikimasi iškilusias problemas trzeba było dostosować się do systemu składniowego, rozwijając dalej automatyczną analizę Kitame poskyryje pristatoma duomenų paieška anotuotuose tekstynuose naudojant ANNIS składniową. systemu. Jest to jedno z wyzwań związanych z używaniem anotowanych korpusów, ponieważ wyszukiwanie danych w takich korpusach, w których znajduje się wiele adnotacji, a nawet kilka poziomów anotacji, musi być wieloaspektowe. Z tego powodu wybrano narzędzie ANNIS stworzone przez badaczy Uniwersytetu Humboldtów (Niemcy).
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 21 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 3. Wyszukiwanie za pomocą systemu ANNIS Naudoti ANNIS įrankį nėra labai sudėtinga (plačiau žr. Zeldes 2016). Reikia pasirinkti anotowany korpus (część korpusu MATO (korpus ten podzielono na dokumenty, literaturę piękną, wysłać mokslinius tekstus ir periodiką) arba ALKSNIO tekstyną (jis įvardytas taip: Alksnis_paula_1.0) ir zapytanie. Struktura zapytań została opisana w podrozdziałach 3.1 i 3.2. ANNIS przedstawia odpowiednie wiersze konkordancji wraz z powiązanymi informacjami (zob. rys. 16). Wiersz konkordancji można rozszerzyć z 5 do 25 słów (wliczane są również znaki interpunkcyjne) zarówno z lewej, jak i z prawej strony; można również eksportować wyniki. W obu korpusach stosuje się oznaczenia gramatyczne opracowane na podstawie oznaczeń glosowania lipskiego. Dodano kilka oznaczeń, których nie ma we wspomnianych oznaczeniach, np. ~COMP oznacza stopień wyższy. Przed takimi oznaczeniami zapisuje się 21 znak tyldy. Części mowy są oznaczane zgodnie z formatem Universal Dependency. 16 PAV. Paieškos per ANNIS įrankį rezultatų fragmentas Szukając lematu įsakymas w części dokumentów MATO 21 Dostęp online: https://www.eva.mpg.de/lingua/resources/glossing-rules.php. W innych anotowanych korpusach często stosuje się oznaczenia Universal Dependency (UD) (zob. http://universaldependencies.org/; zob. także rys. 18). Jak napisano w pierwszym rozdziale, oznaczenia UD są bardzo długie (np.: przypadek biernika, rodzaj żeński i liczba mnoga są oznaczane następująco: case=accusative|gender=feminine|number=plural), zajmują zbyt dużo miejsca w interfejsie ANNIS i przez to niewygodne jest odczytywanie informacji.
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti korpusy | 22 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 RYS. 17 Fragment wyników wyszukiwania za pomocą narzędzia ANNIS w korpusie ALKSNIS podczas wyszukiwania lematu įsakymas (aby relacje składniowe zostały oznaczone strzałkami, należy nacisnąć znak plus przy deps) 3.1. Wyszukiwanie proste Wyszukiwanie jednej cechy nazywa się wyszukiwaniem prostym. Prezentowane adnotacje (nazwy kategorii gramatycznych, stosowane oznaczenia gramatyczne itp.) zależą od struktury każdego korpusu, a nie od narzędzia ANNIS. Atkreipiame dėmesį, kad formuojant užklausą reikia skirti didžiąsias ir mažąsias raides. 3.1.1. Wyszukiwanie dokładnych form wyrazów (ciągów symboli) Paprastoji paieška vykdoma nurodant kategorijos pavadinimą, lygybės ženklą ir kategorijos wartość wpisaną w cudzysłowie angielskim, np.: lemma="kalba" (takie zapytanie oznacza, że wyszukiwany jest lemat kalba); pos="ADJ" (ieškoma būdvardžių); gram=".M.SG.GEN." (ieškoma tam tikrų gramatinių kategorijų, šiuo atveju vienaskaitos vyriškąja gimine kilmininko forma pavartotų žodžių).
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti tekstynai | 23 BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 Szukając konkretnej formy wyrazu w tekście, należy podać nazwę kategorii tok lub po prostu wpisać poszukiwaną formę w cudzysłowie, np. : tok="pasakė" arba "pasakė". W obu anotowanych korpusach można wyszukiwać lematów, części mowy, kategorii gramatycznych, konkrečių žodžių formų, o ALKSNYJE dar galima ieškoti sintaksinių pažymų, pvz.: syfun="Atr" (wyszukiwane są atrybuty). W ALKSNIS można również wyszukiwać relacje zależności (deps), ale wyszukuje się je według innej zasady (zob. 3.2.3). 3.1.2. Wyszukiwanie struktur symboli ANNIS umożliwia wyszukiwanie z użyciem wyrażeń regularnych (ang. regular expressions); są one oznaczane specjalnymi symbolami. Wyszukiwanie za pomocą wyrażeń regularnych zasadniczo kaip tikslių žodžių formų paieškos užklausa, tik reikia angliškas kabutes pakeisti pasviraisiais zapisuje się również między ukośnikami. 3.1.2.1. Bet kokių simbolių paieška Najważniejszym symbolem specjalnym jest kropka, która zastępuje dowolny jeden symbol (literę, cyfrę itp.), np. : lemma=/pl.t.s/ (wyszukiwane są np. platus, plotis, plitus); /p.sak.s/ lub tok=/p.sak.s/ (wyszukiwane są np. pasakys, pasakos, pasakas, pasakęs, posakis); /201./ arba tok=/201./ (ieškoma, pvz., 2010, 2011, 2012…). Ponieważ kropka może zastąpić dowolny znak, samego symbolu kropki należy szukać za pomocą kombinaciją pasvirasis kairinis brūkšnys + taškas (\.), pvz.: gram=/\..\.SG\.GEN\./ (wyszukiwane są np. .M.SG.GEN., .F.SG.GEN., ...). 3.1.2.2. Wyszukiwanie jednego z kilku symboli Zamiast wyszukiwania całkowicie nieokreślonych symboli w zapytaniu można wskazać kilka ieškomų simbolių. Jie rašomi laužtiniuose skliaustuose, pvz.: konkretnych lemma=/pl[ao]t.s/ (wyszukiwane są np. platus, plotis, ale nie plitus); /201[0124]/ /t[ei]lp./ arba tok=/t[ei]lp./ (ieškoma, pvz., telpa, tilpo, bet ne talpa); lub tok=/201./ (wyszukiwane są 2010, 2011, 2012, 2014); korpusy | 24
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 gram=/\.[MFN]\.SG\.GEN\./ (wyszukiwane są .M.SG.GEN., .F.SG.GEN., .N.SG.GEN.). Zwracamy uwagę, że w ten sposób wyszukuje się jeden symbol spośród podanego zbioru symboli: /dirb[aius]/ pozwala wyszukiwać dirba, dirbi, dirbu, dirbs, ale nie dirbau ani dirbsi. 3.1.3. Operatory powtórzeń Można powtarzać (zwykłe i specjalne) symbole, np. : lemma=/..važiuoti/ (wyszukiwane są np. nuvažiuoti, išvažiuoti, apvažiuoti, atvažiuoti, nevažiuoti); /dirb[ao][mt]e/ lub tok=/dirb[ao][mt]e/ (wyszukiwać dirbame, dirbate, dirbome, dirbote). W ten sposób liczba poszukiwanych symboli jest stała, np. dwa symbole w podanych (arba [ao][mt]), taigi pagal užklausą lemma=/..važiuoti/ negausite rezultatų su lema įvažiuoti. przykładach. Więcej możliwości dają operatory powtórzeń, ich znaczenie jest następujące: ? – dany symbol występuje jeden raz lub ani razu; + – dany symbol występuje co najmniej jeden raz (tzn. jeden, dwa, trzy, cztery i więcej razy); * – dany symbol występuje n razy (tzn. może w ogóle nie występować, występować jeden, dwa i więcej razy). Operatory te pomagają wyszukiwać symbole występujące po nich lub przed nimi, np. : /šild?o/ (wyszukiwane jest šilo lub šildo); /Ma+u/ (wyszukiwane są Mau, Maau, Maaau, Maaaau itd.); /oi*/ (wyszukiwane są o, oi, oii, oiii itd.). Wspomniane wcześniej operatory są zgodne z wyszukiwaniem dowolnego lub jednego z kilku symboli, np.: tekstynai | 25 lemma=/.*važiuoti/ (ieškoma, pvz., važiuoti, išvažiuoti, įvažiuoti, nuvažiuoti, pravažiuoti, nepravažiuoti); /šauk[aiu]*/ arba tok=/šauk[aiu]*/ (ieškoma, pvz., šauk, šauki, šaukia, šaukiu);
AGNĖ BIELINSKIENĖ, LOÏC BOIZOU, ERIKA RIMKUTĖ. Lietuvių kalbos morfologiškai ir sintaksiškai anotuoti BENDRINĖ KALBA 90 (2017) www.bendrinekalba.lt ISSN 2351-7204 /šauk[aiu]+/ lub tok=/šauk[aiu]+/ (wyszukiwane są np. šauki, šaukia, šaukiu, ale nie šauk); gram=/.*\.F\.. */ (wyszukiwana jest sekwencja .F. pomiędzy dowolnymi innymi sekwencjami symboli). Warto wspomnieć, że takie struktury jak [aiu]* lub [aiu]+ nie mają wpływu na kolejność wyszukiwanych symboli. A zatem przedstawiane są wyniki, w których występuje a lub i, lub u + a; lub i, lub u + a; lub i, lub u… Rozpoznawane są więc takie kombinacje symboli: aaa, i, uuuuu, uiua, uaa itd. 3.1.4. Wyszukiwanie alternatyw Pionowa kreska (|) umożliwia wyszukiwanie alternatyw, np. : lemma="negeras" | lemma="geras"; /d(au|ū)ž. */ albo tok=/d(au|ū)ž. */ (wyszukiwane są np. daužo, dūžta, daužymas); gram=/.*\.~(COMP|SUP)\.. */ (wyszukiwane są .~COMP. i .~SUP . pomiędzy dowolnymi sekwencjami symboli); "tik" | "tiktai" albo tok="tik" | tok="tiktai" (wyszukiwane są tik i tiktai). 3.1.5. Zapytania sformułowane negatywnie Chociaż taka możliwość jest bardziej przydatna przy łączeniu cech w wyszukiwaniu złożonym, również w wyszukiwaniu prostym można wskazać, czego nie należy wyszukiwać, np.: pos!="NOUN" (wyszukiwane są wszystkie słowa, które nie są rzeczownikami); tok!=/. *[aąeęėiįyouųū]/ (wyszukiwane są wszystkie formy wyrazów, które nie kończą się samogłoską). Jeśli nie wybiera się zapytania wyszukiwania złożonego (zob. 3.2), negatywnie sformułowane zapytania proste mogą powodować problemy, zwłaszcza jeśli obejmują wiele słów (jak w pierwszym przypadku – rzeczowników), dlatego z zapytania tego należy korzystać ostrożnie. 3.2. Wyszukiwanie złożone Wyszukiwanie złożone tworzy się z kilku wyszukiwań prostych. Potrzebna jest jeszcze dodatkowa część, która opisuje relacje między wyszukiwaniami prostymi (wskazanymi według pozycji). Każda część prostego wyszukiwania jest łączona znakiem ampersanda (&).
