This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
DAIVA ŠVEIKAUSKIENĖ
Институт литовского языка
ARŪNAS RIBIKAUSKAS
Технический университет Гедиминаса в Вильнюсе
VYTAUTAS ŠVEIKAUSKAS
Институт литовского языка
Научные направления исследований: грамматика, компьютерная лингвистика.
МНОГОЯЗЫЧНЫЙ ВЕБ-САЙТ ПО ГРАММАТИКЕ ЛИТОВСКОГО ЯЗЫКА
Многоязычная информационная система грамматики литовского языка в интернете
АННОТАЦИЯ
Год назад в Институте литовского языка началась работа над проектом, цель которого — предоставить пользователям свободный доступ в интернете к подробным данным о грамматических свойствах литовских слов. В марте 2017 года была подготовлена пробная версия, включающая только слова с корнем «bėg» (ср. глагол «bėgti/бежать»). База данных состоит примерно из 25 000 записей. В рамках проекта стремятся избежать недостатков уже существующих работ в области компьютерной лингвистики. Это касается объёма слов, многообразия грамматических данных, ясности и понятности их представления и т. д. Грамматическая информация о слове, введённом пользователем, представлена в трёх разделах: структура слова, морфологические данные и морфемные данные. Это первый в Литве сайт, на котором пользователю предоставляется информация о типах морфем. Для каждого слова, включённого в базу данных, можно получить таблицу склонения. Для некоторых слов также приведены примеры употребления. Сайт доступен на семи языках: литовском, английском, немецком, французском, итальянском, русском и японском, чтобы им могли пользоваться иностранцы, интересующиеся литовским языком.
144
Acta Linguistica Lituanica LXXVII
Page 2
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.
До середины XX века все грамматики печатались на бумаге. После появления компьютеров (в 1942 году в Гарвардском университете был создан первый в мире компьютер MARK I (Schwanke 1991: 69)) они начали проникать во все сферы жизни. Языки не стали исключением: вскоре стало ясно, что компьютеры могут обрабатывать не только числа, но и любые символы. Следовательно, они могут обрабатывать и языки. Многие лингвисты начали разрабатывать формальные описания языков, чтобы возможности компьютеров можно было применять и к языкам (Winograd 1983: 23). В сфере искусственного интеллекта обработка языка стала одной из важнейших областей применения (Charis 1989: 71). С 1968 по 1978 год грамматический анализ языков был главной темой исследований в области искусственного интеллекта (Nirenburg 1987: 26). Однако языки, которые так легко поддаются людям, оказались крепким орешком для компьютеров (Jensen, Heidorn,
Straipsniai / Articles
145
Page 3
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.
1.1. СТАТИСТИЧЕСКИЕ МЕТОДЫ
Статистические методы имеют огромное значение в обработке языка. Первые предложения использовать их появились вскоре после возникновения компьютеров. Особенно это относится к английскому языку. Дэвид У. Рид обсуждал количественный лингвистический анализ (Reed 1949: 236). Уивер был первым, кто высказал идею использовать компьютеры для перевода. В 1949 году он предложил применять для этого статистические методы. Однако вскоре учёные того времени отказались от этой идеи, вероятно, из-за недостаточного объёма электронно читаемых текстов и не слишком высокой вычислительной мощности компьютеров того времени. Спустя несколько десятилетий, когда были собраны текстовые корпуса и применение статистических методов в распознавании речи дало хорошие результаты, к статистическим методам в переводе вернулись вновь (Brown at al. 1990: 79). В Канаде для этого сложились особенно благоприятные условия, поскольку там весь парламентский материал хранится на двух языках (английском и французском) в связи с наличием двух государственных языков. Поэтому достаточное количество параллельных текстов удалось собрать очень быстро (Al-Onaizan, Curin, Jahr 1999: 1). Структура обоих языков, то есть английского и французского, очень похожа: порядок слов строгий (на первом месте стоит подлежащее, на втором — сказуемое). Сходство в структуре языков позволило добиться хороших результатов в переводе с помощью статистических методов. Но литовский язык — иной случай. Переводы Google, использующие статистический метод, до сих пор не обеспечивают качественного перевода на литовский язык. Согласно данным за 2017 год, результаты перевода как с английского на литовский, так и с литовского на английский хуже, чем результаты перевода с английского на латышский, с латышского на английский, с английского на эстонский и с эстонского на английский (Skadinš 2017: 22).
Статистические методы проникли и в другие области лингвистики. Первые работы касались фонетики (Zipf 1929). В 1944 году были проведены статистические исследования лексики, то есть подсчитывалось, сколько слов употреблялось один раз, сколько — дважды, трижды и так далее (Yule 194: 9).
146
Acta Linguistica Lithuanica LXXVI
Page 4
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
С 1973 года термин диалектометрия используется для обозначения области лингвистики, занимающейся количественным исследованием языков и диалектов (Köhler, Altmann, Piotrowski 2005: 498).
Статистические методы применялись также в области морфологии. Голдсмит описывает алгоритм определения морфем в слове следующим образом: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36).
В конце прошлого века в русскоязычной литературе описывались попытки выполнить автоматический синтаксический анализ предложений с помощью статистических вычислений. Учёные в России предложили определять синтаксическую структуру предложений не на основе лингвистического анализа, а с помощью статистической обработки текстов. Они утверждают, что каждая языковая единица (слово, синтаксическая категория слова, синтаксическая конструкция) встречается в тексте с определённой частотой. Например, согласно данным английского частотного словаря валентности, глаголу свойственны 195 различных моделей синтаксических отношений. Однако на десять наиболее часто встречающихся моделей приходится 86% всех случаев их употребления в текстах. Статистические закономерности используются также для описания линейной структуры предложения. Для каждого класса слов характерна частота, с которой он может располагаться на определённом расстоянии от начала предложения. Глагол в английском языке с вероятностью 0,7 может находиться на второй — пятой позиции от начала предложения. А с вероятностью 0,95 он встречается на второй — десятой позиции (Церкас 1979: 124).
Позднее для синтаксического анализа стали использовать данные из текстового корпуса (Köhler 2012: 31).
Однако пока хорошие результаты достигнуты лишь при обработке английского языка. Видас Даударавичюс, занимающийся компьютеризацией литовского синтаксиса, утверждает: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3).
С помощью статистических методов можно быстро создавать быстродействующие системы, но при одном условии: необходимо допускать определённое количество ошибок (Link 1). Поэтому в Институте литовского языка решили как можно меньше полагаться на статистику, поскольку стремятся к максимальной точности и достоверности данных.
1 «Наивно думать, что методы, успешно используемые для английского языка, столь же хорошо подходят и для других языков».
Straipsniai / Articles
147
Page 5
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
1.2. ПОЛОЖЕНИЕ В ЛИТВЕ
В области компьютеризации литовской грамматики уже выполнено множество работ. Большинство из них понятны только специалистам по компьютерной лингвистике. Некоторые предназначены также для широкой общественности. Однако они отражают лишь отдельные свойства и характеристики слов и грамматики. Например, в Каунасе в Университете Витаутаса Великого была создана база данных по морфемике на основе текстового корпуса. В ней отсутствуют многие словоформы и используется множество сокращений, понятных не всем. Морфемы разделяются дефисом, а данные о типе морфемы не приводятся. В Институте математики и информатики в Вильнюсе была создана база данных по словообразованию и морфемике. В ней указан тип морфемы, а также производящие и определяемые слова (Murmulaitytė 2012: 96). К сожалению, база данных находится в свободном доступе. Поэтому было решено создать всеобъемлющую информационную систему, предназначенную для широкой общественности и призванную предоставлять пользователю подробные данные.
В представлении литовской грамматической информации в интернете можно наблюдать две крайности. Это отсутствие даже общеупотребительных словоформ и представление избыточных слов, непонятных даже носителям языка. В информационной системе литовской грамматики стремятся избежать обеих этих крайностей. Все словоформы автоматически генерируются компьютером на основе леммы слова, благодаря чему получается полный набор словоизменительных форм. Все возможные производные слова и сложные слова вносятся в базу данных. Таким образом, проблема отсутствия словоформ устраняется. Затем все слова и словоформы, созданные компьютером, проверяются вручную, а несуществующие варианты удаляются. Так удается исключить избыточные слова.
2. РАБОТЫ ПО КОМПЬЮТЕРНОЙ ЛИНГВИСТИКЕ В ЛИТВЕ
В Литве можно выделить два метода компьютерной обработки языка. В Каунасе работы проводятся на основе текстового корпуса в Центре компьютерной лингвистики. В Вильнюсе, в университете и Институте литовского языка, исходят прежде всего из свойств самого литовского языка. У обоих методов есть как преимущества, так и недостатки. Далее это будет показано на нескольких примерах.
148
Acta Linguistica Lithuanica LXXVI
Page 6
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
2.1. РАБОТЫ НА ОСНОВЕ ТЕКСТОВОГО КОРПУСА
В Университете Витаутаса Великого в Каунасе был создан текстовый корпус современного литовского языка. Он используется для различных видов языковой обработки. В области грамматики был создан словарь морфем (Rimkutė, Kazlauskienė, Rąkinis 2011), а спустя несколько лет — также и база данных. Пользователю предоставляются как морфемные, так и морфологические данные. Это первый общедоступный источник, в котором слово делится на морфемы. К сожалению, тип морфемы не указывается, что порой приводит к неоднозначному представлению морфемной структуры слова. Так бывает, когда слова с разной структурой представлены одинаково. Пример приведен на рисунке 1. Слова «per-ei-ti» (перейти) и «per-ė-ti» (высиживать) внешне почти не различаются. В базе данных морфем их морфемная структура выглядит одинаково. Однако в первом слове морфема «per» является приставкой, а во втором та же первая морфема «per» — корнем.
РИСУНОК 1. Слова с разной морфемной структурой представлены одинаково (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)
В качестве второго недостатка можно отметить отсутствие даже общеупотребительных словоформ. В литовском языке причастия имеют шесть падежей. В таблице 1 показано наличие словоформ (единственное число, мужской род) причастия «bėgantis / бегущий, текущий» в базе данных морфем.
Как видно, отсутствует даже лемма этого слова (именительный падеж, единственное число). Другие отсутствующие формы, например местный падеж (bėgančiame vandenyje / в текущей воде), также нельзя считать редко встречающимися или необычными. Таким образом, представлены лишь 2 словоформы из 6 падежей.
Ученые, изучающие второй балтийский язык — латышский, также отмечают недостаточное количество словоформ в текстовом корпусе (Paikens, Rituma, Pretkalniņa 2013: 272).
Straipsniai / Articles
149
Page 7
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS
ТАБЛИЦА 1.
Наличие в базе данных (ссылка 2) словоформ причастия bēgantis / бегущий, текущий в единственном числе, мужской род
Падеж
Слово
База данных
Именительный
bēgantis
отсутствует
Родительный
bēgančio
имеется
Дательный
bēgančiam
отсутствует
Винительный
bēgantį
имеется
Творительный падеж
bēgančiu
отсутствует
Местный падеж
bēgančiame
отсутствует
Итого:
6
2
2.2. ИСХОДНЫЙ ПУНКТ — ЛИТОВСКИЙ ЯЗЫК
В Вильнюсском университете исходят из особенностей литовского языка. Сайт Morfologija.lt (ссылка 3) даже отображает таблицы склонения слова. К сожалению, в них много пустых мест, иногда не заполнена вся парадигма. Иногда встречаются также неизвестные и непонятные литовцу слова, например «sutikimoji» (ссылка 4) и подобные. В Институте математики и информатики в Вильнюсе была создана база данных по словообразованию и морфемике (Murmulaitytė 2012). В ней содержится весьма ценная информация (тип морфемы, производящее слово, определяющее слово и др.), но, к сожалению, данные недоступны свободно.
3. ИНФОРМАЦИОННАЯ СИСТЕМА ЛИТОВСКОЙ ГРАММАТИКИ
Литовский язык относится к числу наименее компьютеризированных языков Европы (Vaišnienė, Zabarskaitė 2012: 35). Поэтому было решено создать информационную систему, содержащую подробные данные о грамматических свойствах литовских слов. Необходимость создания большего количества программного обеспечения для широкого круга пользователей часто подчёркивают учёные, занимающиеся балтийскими языками. В инструкциях конференции BSNLP (Balto-Slavic Natural Language Processing) 2015 и 2017 годов говорится: «представление
150
Acta Linguistica Lithuanica LXXVI
Page 8
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
систем, доступных широкой общественности, будет всячески поощряться / особенно приветствуется описание систем, предоставленных в распоряжение широкой общественности» (ссылка 5).
Поэтому возникла идея разработать информационную систему литовской грамматики для широкого круга пользователей и представить данные как можно проще и понятнее.
В соответствии с этим был выбран адаптивный веб-дизайн (RW), чтобы как можно лучше отвечать потребностям пользователей. Грамматическая информация о слове размещается в плитках (англ. tiles) (ссылка 6). Поэтому доступ к сайту возможен также с мобильного телефона.
3.1. МЕТОД СОЗДАНИЯ БАЗЫ ДАННЫХ
Цель компьютеризации грамматики — иметь в электронном виде всю грамматическую информацию о каждом слове и всех его формах. Есть два способа достичь этого. Первый — создать формальное описание грамматических правил (это было бы своего рода инструментом), а затем поручить компьютеру генерировать необходимые сведения. Второй — хранить в компьютере всю грамматическую информацию обо всех формах всех слов и при необходимости извлекать её. Ещё предстоит обсудить, какой подход требует больше труда. В Институте математики и информатики было разработано программное обеспечение для морфологического анализа литовского языка (Zinkevičius 2000), при создании которого использовался первый метод. Однако добиться 100-процентной точности не удалось: имеются ошибочные сведения, некоторые литовские слова не распознаются.
При разработке информационной системы литовской грамматики от этого подхода отказались по следующей причине: чтобы компьютер мог самостоятельно обрабатывать слова, ему нужно очень точно указать, какие действия и с каким словом выполнять. Значит, сначала все слова необходимо разделить на группы таким образом, чтобы для всех членов группы действовали одни и те же закономерности, то есть чтобы можно было использовать один и тот же метод обработки. Чтобы отнести слово к той или иной группе, нужно определить множество признаков, на основании которых слова будут группироваться. Например, в синтаксическом анализе литовского языка семантический признак [время] используется для определения синтаксической функции винительного падежа существительных. В предложении «Visą naktį ji
Straipsniai / Articles
151
Page 9
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
skaitė šią knygą / «Всю ночь она читала эту книгу» и «Visą knygą ji perskaitė šią naktį / Всю книгу она прочитала за эту ночь». Два слова knygą/Buch и naktį/Nacht не различаются по морфологическим категориям: оба они женского рода, единственного числа, винительного падежа; только семантический признак [время], присущий слову naktis/Nacht, но отсутствующий у слова knyga/Buch, позволяет компьютеру правильно рассматривать слово naktį/Nacht как обстоятельство времени, а слово knygą/Buch — как дополнение в предложении. Нечто подобное необходимо сделать и для морфологии. Одна из ошибок уже созданного программного обеспечения для морфологического анализа литовского языка заключается в том, что морфему -ėj- считают суффиксом при таких корнях, с которыми она не может соединяться. Необходимо определить признаки слов, которые позволят компьютеру решать, с какими корнями может соединяться этот суффикс -ėj-. Но сделать это очень сложно. Например, какой признак объединяет слова geroė/Wohlhaben, žinovas/Kenner(Expert) и daržovė/Obst? Тем, что все они содержат суффикс -ov-. А чем они отличаются от всех остальных слов, к корням которых нельзя присоединить этот суффикс (нельзя сказать *kėdovė — производное с суффиксом -ov- от слова kėdė/Stuhl)? И какой признак это показывает?
Поэтому при разработке информационной системы грамматики литовского языка был выбран второй путь: была подготовлена база данных, содержащая подробную грамматическую информацию обо всех формах всех слов литовского языка. Здесь нужно исходить не из грамматических категорий (как это делается во всех печатных грамматиках), а из самого слова: пользователю должна предоставляться вся связанная с каждым словом информация.
Было решено взять за отправную точку корень и разработать программное обеспечение, которое должно отражать всю структуру грамматики литовского языка. В качестве первого опыта был выбран корень bėg (от глагола bėgti/бежать). Затем с помощью компьютера были сгенерированы все возможные производные, после чего вручную удалили все слова, не существующие в литовском языке. Всего база данных содержит около 25 000 записей.
3.2. ОСОБЕННОСТИ «LIGIS»
Информационная система грамматики литовского языка (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (ссылка 7) обладает двумя важными особенностями. Во-первых, она предоставляет пользователю более подробную информацию о конкретном слове, чем печатные грамматики. И
152
Acta Linguistica Lithuanica LXXVI
Page 10
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
во-вторых, она охватывает больше слов, чем словари. В грамматиках приводятся правила, применимые к определённой группе слов. Однако там перечислены не все слова, к которым относится то или иное правило. LIGIS собирает всю информацию, связанную со словом, введённым пользователем, и представляет её на веб-сайте. В словари внесены не все слова литовского языка: в них отсутствуют многие производные и сложные слова. LIGIS охватывает все возможные производные. Для сравнения можно привести пример. База данных морфем содержит около 75 000 записей. Однако они описывают разные литовские слова. В настоящее время база данных LIGIS состоит из 25 000 записей и охватывает только слова с одним корнем: beg-. В базе данных морфем имеется 118 слов с этим корнем.
3.3. СТРУКТУРА СЛОВА
После ввода слова пользователю показывается его структура: указываются лемма и исходное слово, а также определяемый компонент в производных и сложных словах. Если слово грамматически неоднозначно, каждому из его значений присваивается отдельный номер леммы. Затем под этим номером отображаются морфологические и морфемные данные. Пример многозначного слова приведён в приложении A.
Прочие формы. Так называется кнопка (англ. button), расположенная в карточке структуры слова. Веб-сайт морфологического анализа русского языка (ссылка 8) каждый раз показывает все словоформы введённого слова. В информационной системе грамматики литовского языка решили добавить кнопку, позволяющую пользователю по ссылке запросить остальные формы, поскольку пользователю не всегда нужны все формы слова.
3.4. МОРФОЛОГИЧЕСКИЕ ДАННЫЕ
Морфологическая информация включает обозначение части речи и грамматические категории: падеж, род, число для существительных; лицо, время, наклонение для глаголов и т. д. Многозначные слова нумеруются, если, например, существительное имеет несколько омонимичных падежных форм.
В базе данных морфем (ссылка 2) также содержатся морфологические данные о слове. Однако информация приводится сплошь в сокращениях
Straipsniai / Articles
153
Page 11
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
В таком виде. Пример приведён на рисунке 2. Для неспециалистов такое большое количество сокращений часто бывает непонятным. Особенно для иностранцев, изучающих литовский язык, информация, представленная таким образом, порой может быть неясной.
РИС. 2. Данные о слове begčio, представленные сплошь в сокращениях (ссылка 2)
В информационной системе литовской грамматики сокращения не используются. Все сведения приводятся полностью (приложение A).
3.5. МОРФЕМНЫЕ ДАННЫЕ
Главное отличие от баз данных, к которым можно получить доступ уже сегодня,1 заключается в указании типа каждой морфемы. Только таким образом можно добиться однозначности при представлении морфем слова. В противном случае, например, вторую основу в сложном слове невозможно отличить от суффикса, как это происходит в базе данных по морфемике.
Первым и решающим признаком стало представление морфем разными цветами. Для каждого типа морфемы (корень, приставка, суффикс, окончание) был определён свой цвет. Приставки выделяются синим цветом. Для корня использован красный цвет. Суффиксы обозначаются зелёным, а для окончания выбран чёрный цвет.
Кроме того, слово, разделённое на морфемы, располагается вертикально, и рядом указывается не только обозначение типа каждой морфемы слова, но и её свойства, если таковые имеются, например, для суффикса: словообразовательный или формообразовательный; для окончаний: усечённое, местоименное и т. п. В случае усечённых окончаний, широко распространённых в разговорной речи, рядом также показывается полное окончание. В качестве примера можно привести слова из разговорной речи: šnekamoje kalboje — полные окончания, šnekamoj kalboj — усечённые окончания. Если у слова полное окончание, признак длины не указывается, поскольку у большинства слов окончания полные, и такая информация была бы излишней. Если
154
Acta Linguistica Lithuanica LXXVI
Page 12
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Если окончание не прономинализировано, информация об этом также не указывается.
Звуковые изменения рассматриваются как свойство корня. Это может быть как изменение согласных, так и изменение гласных. В литовском языке можно отметить ещё один вид звуковых изменений: выпадение согласных в повелительном наклонении. Инфиксы также относятся к звуковым изменениям в корне слова. Свойством приставки считается её происхождение: от предложной основы, образование из частицы или международное происхождение.
В случае грамматической неоднозначности слов рассматриваются морфемные структуры. Если они совпадают, описывается только одна структура. Если же имеются различия, морфемные структуры приводятся для каждого значения слова (Приложение A).
3.6. ВСЕ ФОРМЫ СЛОВА
Для каждого слова, содержащегося в базе данных, можно открыть таблицу словоизменения, нажав кнопку «Остальные формы». В ней представлены все данные из морфологической карточки. В верхней части таблицы указаны категории, которые в таблице словоизменения не представлены. Например, существительные в литовском языке не изменяются по родам, поэтому в верхней части таблицы указываются род, лемма и часть речи. Прилагательные и причастия имеют три рода, и особенность литовского языка состоит в том, что только у двух из них (мужского и женского) есть все шесть падежей. У третьего рода только одна форма, поэтому она указывается без обозначения падежа (Приложение B). Для глаголов представлены все временные формы во всех наклонениях (Приложение D).
Классы спряжения и склонения в данном случае не нужны, поэтому данные о них не приводятся.
Для некоторых слов в таблицу словоизменения также включены примеры употребления. Для этого используется всплывающая подсказка (англ. tooltip). В Приложении C в качестве примера приведено слово «bėgis» (винительный падеж, единственное число существительного bėgis / железнодорожный рельс, бег).
3.7. БАЗА ДАННЫХ
При разработке базы данных стремились обеспечить максимально высокое качество и надёжность. Поэтому значительная часть работы выполнялась вручную
Straipsniai / Articles
155
Page 13
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
сделано, поскольку только с помощью человека можно получить максимально достоверную информацию (Sulger 2013: 53).
В Институте литовского языка проводились исследования литовских приставок. Было установлено, что в литовском языке существует около 600 сочетаний приставок (Šveikauskienė 2015: 195). Под «сочетаниями» понимаются различные наборы приставок, которые могут стоять перед корнем, например at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti и т. д. Выяснилось, что с корнями глаголов употребляются только 220 из этих сочетаний; остальные, например nuo-, употребляются с существительными: nuo-monė /мнение. Программное обеспечение было разработано таким образом, чтобы автоматически соединять корень со всеми возможными сочетаниями приставок. Затем результаты, полученные компьютером, проверяются людьми, а слова, действительно существующие в литовском языке, вносятся в базу данных. Так удаётся избежать двух крайностей: чрезмерного количества форм, сгенерированных компьютером, а также недостаточного охвата слов.
Все леммы и относящаяся к ним грамматическая информация вносятся в базу данных вручную. Поскольку программное обеспечение, созданное в Институте математики и информатики, при генерации словоформ для данной леммы не допускает ошибок, компьютеру доверили автоматически формировать записи остальных словоформ.
Примечательно, что в LIGIS обрабатываются также слова с усечёнными окончаниями. Такие слова очень часто встречаются в разговорной речи, и ни одна из уже существующих баз данных не обрабатывает эти словоформы. Следует также подчеркнуть, что LIGIS содержит такие производные, которых нет даже в «Словаре литовского языка» в 20 томах и его электронной версии (Link 9), например neužbėgti/больше не забегать наверх.
В базе данных информация хранится в форме, удобной для компьютера, то есть используется кодировка Prage Markup Language (Hana, Štepánek 2012). Эта форма представления данных не публикуется в интернете, поскольку для неспециалистов в области компьютерной лингвистики она была бы излишней.
Хранение всей информации в базе данных делает LIGIS полезным инструментом и для лингвистов, изучающих литовский язык. Можно получать самые разные сведения, например искать слова с определённым сочетанием приставок и суффиксов и т. п.
156
Acta Linguistica Lithuanica LXXVI
Page 14
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
3.8. МНОГОЯЗЫЧНОСТЬ ВЕБ-САЙТА
Веб-сайт доступен на семи языках: литовском, английском, немецком, французском, итальянском, русском и японском. Необходимость создать многоязычный веб-сайт возникла из-за неудовлетворительного качества переводов с литовского языка в Google. Машинный перевод с литовского языка ненадёжен. Поэтому было решено сделать веб-сайт, посвящённый грамматике литовского языка, многоязычным и использовать только тексты, переведённые людьми. Очевидно, что ситуация с другими языками ненамного лучше. Об этом свидетельствует письмо Lingvist от 8 июня 2017 года, в котором содержится просьба поручить носителям языка перевести название LINGUIST и ни в коем случае не прибегать к машинному переводу (LinguiList 2017: 28.252).
Принимая решение сделать веб-сайт многоязычным, мы исходили из следующего: если иностранец, например норвежец, изучает литовский язык и ему знакомы одни литовские слова, но незнакомы другие, он может выбрать язык, которым владеет лучше, чем литовским, например немецкий, и все незнакомые ему литовские слова станут понятны. Для этого была предусмотрена даже возможность сохранять введённое пользователем слово при переключении языков. Таким образом, выбрав другой язык, пользователю не нужно вводить слово заново.
4. ПЛАНЫ НА БУДУЩЕЕ
В Вильнюсском университете оцифровано множество двуязычных словарей. В Институте литовского языка был оцифрован большой словарь в 20 томах, а также другие одноязычные словари: синонимов, антонимов, фразеологизмов и др. Планируется связать оба типа словарей с информационной системой литовской грамматики и создать аналог немецкого сайта CANOONET (ссылка 10).
Поскольку информационная система грамматики литовского языка содержит данные о морфемах, можно выполнять поиск слов на основе модели морфем. Именно это и предусмотрено на будущее.
Веб-сайт LIGIS содержит вкладку (англ. tab), предназначенную для теории; в настоящее время она находится в разработке. Там будут представлены углублённые академические знания по грамматике литовского языка.
Straipsniai / Articles
157
Page 15
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS
На первом этапе изучается морфология. На втором этапе предполагается внести также синтаксические данные.
5. Выводы
1. Такой подход может быть полезным и целесообразным также для других языков с развитой флективной системой.
2. Информационная система литовской грамматики может быть весьма полезна школьникам, студентам, иностранцам, изучающим литовский язык, а также лингвистам, исследующим литовский язык.
3. Собранные данные могут служить также документацией литовского языка.
Literaturverzeichnis
Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).
Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).
Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.
Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.
Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.
Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.
Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.
158
Acta Linguistica Lithuanica XXVII
Page 16
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.
Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.
Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].
Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.
Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.
Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.
Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.
Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.
Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.
Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).
Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).
Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.
Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.
Straipsniai / Articles
159
Page 17
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.
Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.
Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.
Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.
LINKS
Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)
Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)
Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)
Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)
Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)
Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)
Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)
Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)
Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)
Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)
160
Acta Linguistica Lithuanica LXXVI
Page 18
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG A. GRAMMATISCHE INFORMATION.
Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.
Die grammatische Information wird in der Website in Kacheln ausgelegt.
Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.
Bemerkung: Die Farben sind im Bild entfernt.
Straipsniai / Articles
161
Page 19
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
ANHANG B. FORMENtABELLE FÜR DEKLINATION.
Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.
NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta
162
Acta Linguistica Lithuanica LXXVI
Page 20
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.
Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.
Straipsniai / Articles
163
Page 21
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
ANANG D. FORMENTABELLE FÜR KONJUGATION.
Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.
164
Acta Linguistica Lithuanica LXXVII
Page 22
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete
SANTRAUKA
Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.
Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.
Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.
Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.
Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.
Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.
Straipsniai / Articles
165
Page 23
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS