This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
DAIVA ŠVEIKAUSKIENĖ
Інститут литовської мови
ARŪNAS RIBIKAUSKAS
Технічний університет Гедимінаса у Вільнюсі
VYTAUTAS ŠVEIKAUSKAS
Інститут литовської мови
Наукові напрями досліджень: граматика, комп’ютерна лінгвістика.
БАГАТОМОВНИЙ ВЕБСАЙТ З ГРАМАТИКИ ЛИТОВСЬКОЇ МОВИ
Багатомовна інформаційна система граматики литовської мови в інтернеті
АНОТАЦІЯ
Рік тому в Інституті литовської мови розпочали роботу над проєктом, мета якого — забезпечити користувачам вільний доступ в інтернеті до докладних даних про граматичні властивості литовських слів. У березні 2017 року було підготовлено пробну версію, що охоплює лише слова з коренем «bėg» (пор. дієслово «bėgti/бігти»). База даних містить близько 25 000 записів. Проєкт покликаний уникнути недоліків уже наявних праць у галузі комп’ютерної лінгвістики. Йдеться про охоплення слів, різнобічність граматичних даних, ясність і зрозумілість їхнього подання тощо. Граматична інформація про слово, введене користувачем, подається в трьох розділах: структура слова, морфологічні дані та морфемні дані. Це перший вебсайт у Литві, де користувачеві надається інформація про типи морфем. Для кожного слова, що міститься в базі даних, можна отримати таблицю відмінювання. Для деяких слів також наведено приклади вживання. Вебсайт доступний сімома мовами: литовською, англійською, німецькою, французькою, італійською, російською та японською, щоб ним могли користуватися іноземці, які цікавляться литовською мовою.
144
Acta Linguistica Lituanica LXXVII
Page 2
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.
До середини XX століття всі граматики друкувалися на папері. Після появи комп’ютерів (у 1942 році в Гарвардському університеті було створено перший у світі комп’ютер MARK I (Schwanke 1991: 69)) вони почали проникати в усі сфери життя. Мови не стали винятком: невдовзі стало зрозуміло, що комп’ютери можуть обробляти не лише числа, а й будь-які символи. Отже, вони можуть обробляти й мови. Чимало лінгвістів почали розробляти формальні описи мов, щоб можна було застосовувати можливості комп’ютерів і до мов (Winograd 1983: 23). У галузі штучного інтелекту обробка мови стала одним із найважливіших напрямів застосування (Charis 1989: 71). З 1968 до 1978 року граматичний аналіз мов був головною темою досліджень учених у галузі штучного інтелекту (Nirenburg 1987: 26). Однак мови, що так легко піддаються людям, виявилися міцним горішком для комп’ютерів (Jensen, Heidorn,
Straipsniai / Articles
145
Page 3
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.
1.1. СТАТИСТИЧНІ МЕТОДИ
У мовному опрацюванні статистичні методи мають дуже велике значення. Перші пропозиції щодо їх використання з’явилися невдовзі після появи комп’ютерів. Особливо це стосується англійської мови. Девід В. Рід обговорював кількісний лінгвістичний аналіз (Reed 1949: 236). Воррен Вівер був першим, хто висловив думку про використання комп’ютерів для перекладу. У 1949 році він запропонував застосовувати для цього статистичні методи. Однак тогочасні науковці невдовзі відмовилися від цієї ідеї, імовірно, через недостатній обсяг текстів, доступних для електронного читання, та не надто високу продуктивність тодішніх комп’ютерів. Через кілька десятиліть, коли було зібрано текстові корпуси, а застосування статистичних методів у розпізнаванні мов дало добрі результати, до статистичних методів у перекладі повернулися (Brown at al. 1990: 79). У Канаді для цього були особливо сприятливі умови, оскільки там увесь матеріал парламенту зберігається двома мовами (англійською та французькою) через наявність двох державних мов. Тому вдалося дуже швидко зібрати достатню кількість паралельних текстів (Al-Onaizan, Curin, рік 1999: 1). Структури обох мов, тобто англійської та французької, дуже подібні: порядок слів суворо визначений (на першому місці стоїть підмет, на другому — присудок). Подібність структур мов дала змогу досягти добрих результатів перекладу за допомогою статистичних методів. Але для литовської мови це не так. Переклади Google, що використовують статистичний метод, досі не забезпечують якісного перекладу литовською мовою. Згідно з даними за 2017 рік, результати перекладу як з англійської литовською, так і з литовської англійською гірші, ніж результати перекладу з англійської латиською, з латиської англійською, з англійської естонською та з естонської англійською (Skadinš 2017: 22).
Статистичні методи проникли й в інші галузі лінгвістики. Перші праці стосувалися фонетики (Zipf 1929). У 1944 році було проведено статистичні дослідження лексики літературних текстів, тобто підраховано, скільки слів ужито один раз, скільки — двічі, тричі тощо (Yule 194: 9).
146
Acta Linguistica Lithuanica LXXVI
Page 4
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
З 1973 року термін діалектометрія використовують на позначення галузі лінгвістики, що займається кількісним дослідженням мов і діалектів (Köhler, Altmann, Piotrowski 2005: 498).
Статистичні методи застосовували також у галузі морфології. Ґолдсміт описує алгоритм визначення морфем у слові так: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36).
Наприкінці минулого століття в російській літературі описували спроби здійснити автоматичний синтаксичний аналіз речень за допомогою статистичних обчислень. Науковці в Росії пропонували визначати синтаксичну структуру речень не на підставі лінгвістичного аналізу, а шляхом статистичного опрацювання текстів. Вони стверджують, що кожна мовна одиниця (слово, синтаксична категорія слова, синтаксична конструкція) трапляється в тексті з певною частотністю. Наприклад, згідно з даними англійського частотного словника валентностей, дієслову властиві 195 різних моделей синтаксичних зв’язків. Однак лише десять найчастотніших моделей становлять 86% усіх випадків їх уживання в текстах. Статистичні закономірності застосовують також до лінійної структури речення. Кожен клас слів має частоту, з якою він може стояти на певній відстані від початку речення. Англійське дієслово може з імовірністю 0,7 стояти на позиції від другої до п’ятої від початку речення. А з імовірністю 0,95 воно трапляється на позиціях від другої до десятої (Церкас 1979: 124).
Пізніше для синтаксичного аналізу почали використовувати дані з текстового корпусу (Köhler 2012: 31).
Однак наразі добрих результатів досягнуто лише під час опрацювання англійської мови. Відас Даударавічюс, який працює в галузі комп’ютеризації литовського синтаксису, стверджує: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3).
За допомогою статистичних методів можна швидко створювати системи, що працюють із високою швидкістю, але за однієї умови: потрібно миритися з певною кількістю помилок (посилання 1). Тому в Інституті литовської мови вирішили якомога менше покладатися на статистику, оскільки прагнуть до максимальної точності й надійності даних.
1 «Наївно думати, що методи, які успішно використовують для англійської мови, так само підходять і для інших мов».
Straipsniai / Articles
147
Page 5
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
1.2. СИТУАЦІЯ В ЛИТВІ
У галузі комп’ютеризації литовської граматики вже виконано багато робіт. Більшість із них зрозуміла лише фахівцям із комп’ютерної лінгвістики. Деякі призначені також для широкої громадськості. Однак вони відображають лише окремі властивості й характеристики слів і граматики. Наприклад, у Каунасі у Великому університеті Вітовта було створено базу даних морфеміки на основі текстового корпусу. У ній бракує багатьох словоформ і використовується дуже багато скорочень, зрозумілих не всім. Морфеми розділено дефісом, а даних про тип морфеми не наведено. В Інституті математики та інформатики у Вільнюсі було створено базу даних словотвору й морфеміки. У ній зазначено тип морфеми, а також твірні слова й визначальні слова (Murmulaitytė 2012: 96). На жаль, база даних не є у вільному доступі. Тому було вирішено створити комплексну інформаційну систему, призначену для широкої громадськості й таку, що має надавати користувачеві докладні дані.
В інтернеті можна спостерігати дві крайнощі в поданні граматичної інформації про литовську мову. Це: відсутність навіть загальновживаних словоформ і подання зайвих слів, незрозумілих навіть носіям мови. В інформаційній системі граматики литовської мови прагнуть уникнути обох цих крайнощів. Усі словоформи автоматично генеруються комп’ютером на основі леми слова, завдяки чому отримують повний набір словозмінних форм. Усі можливі похідні слова й складні слова вносяться до бази даних. Отже, брак словоформ усунуто. Потім усі утворені комп’ютером слова й словоформи перевіряють вручну та вилучають неіснуючі варіанти. Так вдається усунути зайві слова.
2. РОБОТИ З КОМП’ЮТЕРНОЇ ЛІНГВІСТИКИ В ЛИТВІ
У Литві можна розрізнити два методи комп’ютерного опрацювання мови. У Каунасі роботи виконуються на основі текстового корпусу в Центрі комп’ютерної лінгвістики. У Вільнюсі, в університеті та Інституті литовської мови, більше спираються на властивості самої литовської мови. Обидва методи мають як переваги, так і недоліки. Далі це буде показано на кількох прикладах.
148
Acta Linguistica Lithuanica LXXVI
Page 6
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
2.1. РОБОТИ НА ОСНОВІ ТЕКСТОВОГО КОРПУСУ
У Великому університеті Вітовта в Каунасі було створено текстовий корпус сучасної литовської мови. Його використовують для різних видів опрацювання мови. У галузі граматики було створено словник морфем (Rimkutė, Kazlauskienė, Rąkinis 2011), а за кілька років — також базу даних. Користувачеві надаються як морфемні, так і морфологічні дані. Це перше джерело у вільному доступі, у якому слово поділяється на морфеми. На жаль, тип морфеми не зазначено, і часом це призводить до неоднозначного подання морфемної структури слова. Таке трапляється, коли слова з різною структурою подано однаково. Приклад цього наведено на рисунку 1. Слова «per-ei-ti» (перейти) і «per-ė-ti» (висиджувати) зовні майже не відрізняються. Морфемні структури обох слів у базі даних морфем виглядають однаково. Однак у першому слові морфема «per» є префіксом, а в другому те саме перше морфема «per» є коренем.
РИС. 1. Слова з різною морфемною структурою подано однаково (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)
Другим недоліком можна назвати відсутність навіть загальновживаних словоформ. У литовській мові дієприкметники мають шість відмінків. У таблиці 1 показано наявність словоформ (однина, чоловічий рід) дієприкметника «bėgantis / той, що біжить, тече» в базі даних морфем.
Як виявляється, бракує навіть леми цього слова (називний відмінок, однина). Інші відсутні форми, наприклад місцевий відмінок (bėgančiame vandenyje / у проточній воді), також не можна вважати рідковживаними чи незвичними. Отже, наявні лише 2 словоформи з 6 відмінків.
Науковці, які досліджують другу балтійську мову — латиську, також говорять про недостатню кількість словоформ у текстовому корпусі (Paikens, Rituma, Pretkalniņa 2013: 272).
Straipsniai / Articles
149
Page 7
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS
ТАБЛИЦЯ 1.
Наявність у базі даних (посилання 2) словоформ дієприкметника bēgantis / laufender, fließender в однині, чоловічий рід
Відмінок
Слово
База даних
Називний відмінок
bēgantis
відсутнє
Родовий відмінок
bēgančio
наявне
Давальний відмінок
bēgančiam
відсутнє
Знахідний відмінок
bēgantį
наявний
орудний відмінок
bēgančiu
відсутній
місцевий відмінок
bēgančiame
відсутній
Усього:
6
2
2.2. ВИХІДНИЙ ПУНКТ — ЛИТОВСЬКА МОВА
У Вільнюському університеті виходять із властивостей литовської мови. Вебсайт Morfologija.lt (посилання 3) навіть відображає таблиці відмінювання слова. На жаль, у них багато порожніх місць, іноді — для цілої парадигми. Іноді трапляються також невідомі й незрозумілі литовцеві слова, наприклад «sutikimoji» (посилання 4) та подібні. В Інституті математики та інформатики у Вільнюсі створили базу даних словотвору й морфеміки (Murmulaitytė 2012). Вона містить дуже цінну інформацію (тип морфеми, твірне слово, означуване слово тощо), але дані, на жаль, не перебувають у вільному доступі.
3. ІНФОРМАЦІЙНА СИСТЕМА ДЛЯ ЛИТОВСЬКОЇ ГРАМАТИКИ
Литовська мова належить до найменш комп’ютеризованих мов Європи (Vaišnienė, Zabarskaitė 2012: 35). Тому було вирішено створити інформаційну систему, яка містить докладні дані про граматичні властивості литовських слів. Науковці, що займаються балтійськими мовами, часто наголошують на потребі створювати більше програмного забезпечення для широкого кола користувачів. У настановах конференції BSNLP (Balto-Slavic Natural Language Processing) 2015 та 2017 років зазначено: «подання
150
Acta Linguistica Lithuanica LXXVI
Page 8
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
із описом систем, доступних широкій громадськості, всіляко заохочуватимуться / особливо заохочуватимуться установи, які описують системи, доступні широкій громадськості» (посилання 5).
Тому виникла ідея спроєктувати інформаційну систему для литовської граматики для широкого кола користувачів і подавати дані якомога простіше й зрозуміліше.
Відповідно, було обрано адаптивний вебдизайн (RW), щоб якомога краще задовольнити потреби користувачів. Тож граматичну інформацію про слово розміщено на плитках (англ. tiles) (посилання 6). Завдяки цьому вебсайтом можна користуватися й із мобільного телефона.
3.1. МЕТОД СТВОРЕННЯ БАЗИ ДАНИХ
Мета комп’ютеризації граматики — мати в електронному вигляді всю граматичну інформацію про кожне слово та всі його форми. Є два способи цього досягти. Перший — створити формальний опис граматичних правил (це був би різновид довідкового засобу), а потім доручити комп’ютеру генерувати потрібні дані. Другий — зберігати в комп’ютері всю граматичну інформацію про всі форми всіх слів і за потреби зчитувати її. Ще належить обговорити, який підхід потребує більше праці. В Інституті математики та інформатики розробили програмне забезпечення для морфологічного аналізу литовської мови (Zinkevičius 2000), використавши перший метод. Однак досягти 100% точності не вдалося: дані містять помилки, деякі литовські слова не розпізнаються.
Під час розроблення інформаційної системи для литовської граматики від цього підходу відмовилися з такої причини: щоб комп’ютер міг сам обробляти слова, йому потрібно дуже точно вказати, які операції виконувати з кожним словом. Отже, спочатку всі слова потрібно поділити на групи так, щоб для всіх членів групи діяли однакові закономірності, тобто щоб можна було застосовувати той самий метод обробки. Щоб віднести слово до тієї чи іншої групи, потрібно визначити багато ознак, на підставі яких слова групуватимуться. Наприклад, у синтаксичному аналізі литовської мови для визначення синтаксичної функції знахідного відмінка іменників використовують семантичну ознаку [час]. У реченні «Visą naktį ji
Straipsniai / Articles
151
Page 9
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
«skaitė šią knygą / Усю ніч вона читала цю книжку» і «Visą knygą ji perskaitė šią naktį / Усю книжку вона прочитала цієї ночі». Два слова knygą/Buch і naktį/Nacht не відрізняються за морфологічними категоріями — обидва жіночого роду, однини, знахідного відмінка, і лише семантична ознака [час], властива слову naktis/Nacht, але відсутня у слова knyga/Buch, дає комп’ютеру змогу правильно визначити слово naktį/Nacht як обставину часу, а слово knygą/Buch — як додаток у реченні. Щось подібне потрібно зробити і для морфології. Одна з помилок у вже створеному програмному забезпеченні для морфологічного аналізу литовської мови полягає в тому, що морфему -ėj- вважають суфіксом для таких коренів, з якими вона не може поєднуватися. Потрібно визначити ознаки слів, які дали б комп’ютеру змогу встановити, з якими коренями може поєднуватися цей суфікс -ėj-. Але зробити це дуже складно. Яка, наприклад, спільна ознака слів geroė/Wohlhaben, žinovas/Kenner(Expert) і daržovė/Obst? Усі вони мають суфікс -ov-. А чим вони відрізняються від усіх інших слів, до кореня яких цей суфікс не можна додати (не можна сказати *kėdovė — похідне слово із суфіксом -ov- від слова kėdė/Stuhl)? І яка ознака це показує?
Отже, під час розроблення інформаційної системи для граматики литовської мови було обрано другий шлях, тобто підготовлено базу даних із докладною граматичною інформацією про всі форми всіх слів литовської мови. Тут потрібно виходити не з граматичних категорій (як це робиться в усіх друкованих на папері граматиках), а з самого слова: користувачеві необхідно надавати всю інформацію, пов’язану з кожним словом.
Було вирішено взяти за основу корінь і розробити програмне забезпечення, яке відображало б усю структуру литовської граматики. Для першої проби обрали корінь bėg (від дієслова bėgti/бігти). Потім комп’ютер згенерував усі можливі похідні слова, а згодом усі слова, яких немає в литовській мові, видалили вручну. Загалом база даних містить близько 25 000 записів.
3.2. ОСОБЛИВОСТІ «LIGIS»
Інформаційна система граматики литовської мови (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (посилання 7) має дві важливі особливості. По-перше, вона надає користувачеві докладнішу інформацію про конкретне слово, ніж друковані на папері граматики. І
152
Acta Linguistica Lithuanica LXXVI
Page 10
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
по-друге, вона охоплює більше слів, ніж словники. У граматиках наводяться правила, що підходять для певної групи слів. Але там згадано не всі слова, на які поширюється це правило. LIGIS збирає всю інформацію, пов’язану зі словом, уведеним користувачем, і подає її на вебсайті. До словників внесено не всі слова литовської мови; у них бракує багатьох похідних слів і складних слів. LIGIS охоплює всі можливі похідні слова. Для порівняння наведемо приклад. База даних морфем містить близько 75 000 записів. Але вони описують різні литовські слова. База даних LIGIS наразі складається з 25 000 записів і охоплює лише слова з одним коренем: beg-. У базі даних морфем є 118 слів із цим коренем.
3.3. СТРУКТУРА СЛОВА
Після введення слова користувачеві пояснюється його структура: зазначаються лема й основне слово, а також означальне слово для похідних слів і складних слів. Якщо слово має кілька граматичних значень, кожному значенню присвоюється окремий номер леми. Далі під цим номером відображаються морфологічні та морфемні дані. Приклад слова з кількома значеннями наведено в додатку A.
Інші форми. Так називається кнопка (англійською button), розташована на панелі структури слова. Вебсайт морфологічного аналізу російської мови (посилання 8) щоразу відображає всі форми введеного слова. В інформаційній системі граматики литовської мови вирішили додати кнопку, щоб користувач міг отримати інші форми за посиланням, оскільки йому не завжди потрібні всі форми слова.
3.4. МОРФОЛОГІЧНІ ДАНІ
Морфологічна інформація охоплює позначення частини мови та граматичні категорії: відмінок, рід, число для іменників; особу, час, спосіб для дієслів тощо. Багатозначним словам надають нумерацію, якщо, наприклад, іменник має кілька омонімічних відмінкових форм.
У базі даних морфем (посилання 2) також є морфологічні дані про слово. Але інформацію подано самими лише скороченнями
Straipsniai / Articles
153
Page 11
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
. Такий приклад наведено на рисунку 2. Для нефахівців така велика кількість скорочень часто може бути незрозумілою. Особливо це стосується іноземців, які вивчають або опановують литовську мову: інформація, подана таким чином, іноді може бути неясною.
РИСУНОК 2. Дані про слово begčio, подані самими лише скороченнями (посилання 2)
В інформаційній системі литовської граматики скорочень не використовують. Усі дані подано повністю (додаток A).
3.5. МОРФЕМНІ ДАНІ
Найважливіша відмінність від баз даних, до яких уже сьогодні можна отримати доступ,1 полягає у зазначенні типу кожної морфеми. Лише так можна досягти однозначності під час подання морфем слова. Інакше, наприклад, другу основу в складному слові неможливо відрізнити від суфікса, як це трапляється в базі даних з морфеміки.
Першою і вирішальною ознакою стало подання морфем різними кольорами. Для кожного типу морфеми (основа, префікс, суфікс, закінчення) визначено окремий колір. Префікси позначають синім кольором. Для основи використано червоний. Суфікси позначають зеленим, а для закінчення обрано чорний.
Крім того, слово, поділене на морфеми, розташовується вертикально; поруч записують не лише позначення типу кожної морфеми слова, а й указують властивості морфеми, якщо вона їх має, наприклад для суфікса: словотвірний або формотворчий; для закінчень: скорочене, займенникове тощо. У разі скорочених закінчень, дуже поширених у розмовній мові, поруч також показують повне закінчення. Як приклад можна навести слова з розмовної мови: šnekamoje kalboje — повні закінчення, šnekamoj kalboj — скорочені закінчення. Якщо слово має повне закінчення, ознаку довжини не зазначають, оскільки більшість слів мають повні закінчення, і така інформація була б зайвою. Якщо
154
Acta Linguistica Lithuanica LXXVI
Page 12
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Якщо закінчення не прономіналізоване, інформація про це також не зазначається.
Звукові зміни розглядаються як властивість кореня. Це можуть бути як зміни приголосних, так і голосних. У литовській мові можна відзначити ще один тип звукових змін: випадання приголосних в імперативі. Інфікси також належать до звукових змін у корені слова. Властивістю префікса вважають його походження: прийменникове, утворене від частки або міжнародне.
У разі граматичної неоднозначності слів перевіряються морфемні структури. Якщо вони однакові, описується лише одна структура. Якщо ж є відмінності, морфемні структури подаються для кожного значення слова (Додаток A).
3.6. УСІ ФОРМИ СЛОВА
Для кожного слова, що міститься в базі даних, таблицю відмінювання можна відкрити, натиснувши кнопку «Інші форми». У ній наведено всі дані з морфологічної картки. Угорі таблиці зазначаються категорії, яких немає в таблиці відмінювання: наприклад, іменники в литовській мові не відмінюються за родом, тому рід указується у верхній частині таблиці, як і лема та частина мови. Прикметники й дієприкметники мають три роди; особливість литовської мови полягає в тому, що лише два з них (чоловічий і жіночий) мають усі шість відмінків. Третій рід має лише одну форму, тому її подано без позначення відмінка (Додаток B). Для дієслів наведено всі часові форми в усіх способах (Додаток D).
Класи дієвідмінювання та відмінювання таким чином стають зайвими, тому дані про них не наводяться.
Для деяких слів у таблицю відмінювання також внесено приклади вживання. Для цього використовується підказка (англ. tooltip). У Додатку C як приклад наведено слово «bėgis» (знахідний відмінок, однина іменника bėgis / залізнична рейка, біг).
3.7. БАЗА ДАНИХ
Під час розроблення бази даних прагнули досягти якомога вищої якості та надійності. Тому значну частину роботи виконували вручну
Straipsniai / Articles
155
Page 13
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
зроблено, оскільки лише за допомогою людини можна отримати максимально достовірну інформацію (Sulger 2013: 53).
В Інституті литовської мови проводилися дослідження литовських префіксів. Було встановлено, що в литовській мові існує близько 600 комбінацій префіксів (Šveikauskienė 2015: 195). Під «комбінаціями» маються на увазі різні набори префіксів, які можуть з’являтися перед коренем, наприклад at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti тощо. З’ясувалося, що з коренями дієслів уживаються лише 220 із цих комбінацій; решта, наприклад nuo-, уживаються з іменниками: nuo-monė /die Meinung. Програмне забезпечення було розроблено так, щоб автоматично поєднувати корінь з усіма можливими комбінаціями префіксів. Потім результати, отримані комп’ютером, перевіряють люди, а слова, які справді існують у литовській мові, вносять до бази даних. Так вдається уникнути двох крайнощів: надмірної кількості форм, згенерованих комп’ютером, і недостатнього охоплення слів.
Усі леми та граматична інформація про них вносяться до бази даних вручну. Оскільки програмне забезпечення, створене в Інституті математики та інформатики, не припускається помилок під час генерування словоформ для заданої леми, комп’ютеру довірили автоматично формувати записи інших словоформ.
Варто зазначити, що в LIGIS опрацьовуються також слова зі скороченими закінченнями. Такі слова дуже часто трапляються в усному мовленні, і жодна з наявних баз даних не опрацьовує ці словоформи. Слід також підкреслити, що LIGIS містить і такі похідні слова, яких немає навіть у 20-томному словнику литовської мови та його електронній версії (Link 9), наприклад neužbėgti/nicht mehr hinauflaufen.
У базі даних інформація зберігається у формі, зручній для комп’ютерного опрацювання, тобто використовується кодування мовою розмітки Prage Markup Language (Hana, Štepánek 2012). Цю форму даних не представлено в інтернеті, оскільки для нефахівців із комп’ютерної лінгвістики вона була б зайвою.
Зберігання всієї інформації в базі даних робить LIGIS корисним інструментом і для мовознавців, які досліджують литовську мову. Можна отримувати різноманітні довідкові дані, наприклад шукати слова з певною комбінацією префіксів і суфіксів тощо.
156
Acta Linguistica Lithuanica LXXVI
Page 14
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
3.8. БАГАТОМОВНІСТЬ ВЕБСАЙТУ
Вебсайт доступний сімома мовами: литовською, англійською, німецькою, французькою, італійською, російською та японською. Необхідність створити багатомовний вебсайт була зумовлена незадовільними перекладами литовською мовою в Google. Машинний переклад з литовської мови ненадійний. Тому було вирішено зробити вебсайт із граматики литовської мови багатомовним і використовувати лише перекладені людьми тексти. Ситуація з іншими мовами, очевидно, не набагато краща. Про це свідчить лист Lingvist від 8 червня 2017 року, у якому міститься прохання доручити носіям мови переклад назви LINGUIST і в жодному разі не використовувати машинний переклад (LinguiList 2017: 28.252).
Наш задум щодо створення багатомовного вебсайту був таким: якщо іноземець, наприклад норвежець, вивчає литовську мову й знає деякі литовські слова, але ще не знає інших, він може вибрати мову, якою володіє краще, ніж литовською, наприклад німецьку, і всі незнайомі йому литовські слова стануть зрозумілими. Для цього було передбачено навіть збереження введеного користувачем слова під час перемикання мов. Отже, вибравши іншу мову, користувачеві не потрібно вводити слово знову.
4. ПЛАНИ НА МАЙБУТНЄ
У Вільнюському університеті оцифровано багато двомовних словників. В Інституті литовської мови оцифровано великий словник у 20 томах, а також інші одномовні словники: синонімів, антонімів, фразеологізмів тощо. Планується поєднати обидва типи словників з інформаційною системою литовської граматики та створити аналог німецького вебсайту CANOONET (посилання 10).
Оскільки інформаційна система граматики литовської мови містить дані про морфеми, можна здійснювати пошук слів на основі моделі морфем. Саме це й передбачено на майбутнє.
Вкладка (англ. tab) на вебсайті LIGIS призначена для теорії та наразі перебуває в розробці. Там мають бути наведені поглиблені академічні знання з литовської граматики.
Straipsniai / Articles
157
Page 15
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS
На першому етапі працюють над морфологією. На другому етапі мають бути внесені також синтаксичні дані.
5. Висновки
1. Такий підхід може бути корисним і доцільним також для інших мов із розвиненою флективною системою.
2. Інформаційна система литовської граматики може бути дуже корисною для учнів, студентів, іноземців, які вивчають литовську мову, а також для мовознавців, які досліджують литовську мову.
3. Зібрані дані можуть також слугувати документацією литовської мови.
Literaturverzeichnis
Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).
Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).
Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.
Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.
Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.
Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.
Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.
158
Acta Linguistica Lithuanica XXVII
Page 16
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.
Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.
Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].
Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.
Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.
Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.
Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.
Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.
Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.
Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).
Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).
Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.
Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.
Straipsniai / Articles
159
Page 17
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.
Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.
Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.
Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.
LINKS
Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)
Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)
Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)
Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)
Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)
Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)
Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)
Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)
Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)
Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)
160
Acta Linguistica Lithuanica LXXVI
Page 18
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG A. GRAMMATISCHE INFORMATION.
Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.
Die grammatische Information wird in der Website in Kacheln ausgelegt.
Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.
Bemerkung: Die Farben sind im Bild entfernt.
Straipsniai / Articles
161
Page 19
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
ANHANG B. FORMENtABELLE FÜR DEKLINATION.
Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.
NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta
162
Acta Linguistica Lithuanica LXXVI
Page 20
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.
Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.
Straipsniai / Articles
163
Page 21
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
ANANG D. FORMENTABELLE FÜR KONJUGATION.
Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.
164
Acta Linguistica Lithuanica LXXVII
Page 22
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete
SANTRAUKA
Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.
Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.
Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.
Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.
Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.
Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.
Straipsniai / Articles
165
Page 23
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS