scieee.
LT original EN DE FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

Аурелия Тамулионене

Институт литовского языка

Направления научных исследований: исследования употребления современного литовского языка и его вариативности.

ПОЛОЖЕНИЕ ЛИТОВСКОГО ЯЗЫКА В ЦИФРОВУЮ ЭПОХУ

О 24-й конференции имени Йонаса Яблонскиса

Направления развития цифровых языковых ресурсов и возможности их использования

Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinka­mas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).

Научная конференция, названная именем Йонаса Яблонскиса, впервые состоялась в 1993 году. Ее организовали Отдел культуры языка Института литовского языка и кафедра литовского языка Вильнюсского университета. С тех пор конференции стали традиционными и проводятся каждую осень (с 2003 года — поочередно в Институте литовского языка или Вильнюсском университете).

29 сентября 2017 года состоялась 24-я научная конференция имени Йонаса Яблонскиса Направления развития цифровых языковых ресурсов и возможности их использования (англ. Digital Language Resources, Directions of Their Development and Possibilities to Harness Them), организованная в Институте литовского языка. Конференцию организовал Центр исследований литературного языка Института литовского языка совместно с Институтом прикладной лингвистики Вильнюсского университета. По своей тематике эта конференция отличалась от предыдущих; ее цель — обсудить проблемы, возникающие на стыке языков и цифровых технологий и с которыми сталкиваются при разработке цифровых ресурсов и создании единого цифрового рынка. В центре внимания конференции были семантический уровень цифровых ресурсов (создание сетей слов), а также придание цифровым ресурсам звуковой формы, создание новых возможностей для распространения цифровых ресурсов в многоязычных сообществах и т. д.

В конференции участвовали докладчики из-за рубежа — из Европейского парламента и Испании, а также исследователи из различных учреждений Литвы: Института литовского языка, Вильнюсского

Straipsniai / Articles

313

AURELIJA TAMULIONIENĖ

университета, Университета Витовта Великого, Балтийского института передовых технологий, ЗАО «Netcode». На конференции было прочитано 17 докладов. Докладчики выступали и делились результатами своих исследований и опытом на четырех заседаниях.

Конференция началась с приветственных речей. Участников конференции и докладчиков приветствовали депутат Европейского парламента Algirdas Saudargas и директор Института литовского языка проф. д-р Jolanta Elena Zabarskaitė. Со вступительным словом выступила главный научный сотрудник Центра исследований литературного языка Института литовского языка д-р Rita Miliūnaitė. Говорилось о том, что в последние годы взаимосвязь литовского языка и информационных технологий значительно укрепилась: у нас есть ощутимые результаты как в оцифровке языковых ресурсов, так и в создании инструментов для анализа, распознавания и синтеза речи, однако, учитывая стремительные перемены в мире в этой области, литовскому языку еще многое предстоит наверстать. Поскольку литовский язык является флективным, мы не можем напрямую адаптировать для него информационные технологии, созданные для английского языка, поэтому наши нынешние инструменты машинного перевода и другие компьютерные средства все еще весьма несовершенны, а исследования в мире уже движутся дальше — в направлении создания искусственного интеллекта, воплощения его в устройствах и проникновения во все более глубокие слои языка.

На пленарном заседании первый доклад «Живой язык в искусственном разуме» представил депутат Европейского парламента Algirdas Saudargas. Докладчик поставил принципиальный вопрос, на который должно ответить каждое языковое сообщество: в какой мере оно должно самостоятельно подготовить ресурсы и технологии для родного языка, а что можно приобрести уже готовым, созданным на основе других языков. В докладе прозвучали тревожные мысли о том, что литовский язык, как и языки некоторых других небольших стран, «имеет мало технологических средств поддержки или не имеет их вовсе». Языковым технологиям не уделяется должного внимания не только в повестке дня литовских, но и европейских политиков. В докладе были представлены наблюдения, показывающие, что развитие искусственного интеллекта сходится к гибридной форме, в которой нейронные сети соответствуют бессознательным механизмам мозга, а сознанием управляет и его моделирует традиционный, так называемый символический искусственный интеллект. Каждое языковое сообщество должно заботиться о том, чтобы технологии, соответствующие символическому искусственному интеллекту, полно и точно отражали всю структуру родного языка, а для взаимодействия с нейронными сетями была создана насыщенная среда родного языка (и родной культуры).

Второй пленарный доклад «Language equality in the digital age: towards a human language project» на английском языке представил Rafael Rivera, директор консалтинговой компании «Claves». В докладе подробно описано исследование Отдела научно-технического прогнозирования Европейского парламента «Равенство языков в цифровую эпоху. Проект родного языка» (с исследованием на английском языке можно ознакомиться в интернете: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf). В докладе дан обзор современного состояния технологий родного языка, количественно оцениваются

314

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

экономические, социальные и лингвистические последствия для языка в цифровую эпоху, а также обсуждалась политика Европейского союза в области информационных и коммуникационных технологий. В цифровую эпоху языковые технологии представляют собой серьезный вызов для стран с небольшим числом носителей языка. Недостаточно развитые языковые технологии создают разобщенность и препятствия. Это влияет на трансграничные услуги, мобильность работников и торговлю. Причина таких препятствий — несогласованные научные исследования и недостаточное финансирование. Докладчик подчеркнул, что языковые технологии не получают должного внимания европейских политиков. На основе анализа нынешней ситуации разрабатывается инициатива, которая объединит политику учреждений, научных исследований, промышленности, рынка и государственных услуг.

Последний доклад пленарного заседания «Письменный и устный литовский язык в обычной и электронной среде» представил профессор Института математики и информатики Вильнюсского университета Laimutis Telksnys. В докладе говорилось о необходимости разработать методы и инструменты — аппаратное и программное обеспечение, — обеспечивающие правильное употребление письменного и устного литовского языка в бумажных документах и электронной среде. Докладчик поднял важный вопрос: как нескольким миллионам литовцев действовать, чтобы не исчезнуть в океане более чем из 7 миллиардов пишущих и говорящих людей и появляющихся умных машин. Профессор также предложил ответ: чтобы этого не произошло, необходимо разработать методы и инструменты — аппаратное и программное обеспечение, — обеспечивающие правильное употребление письменного и устного литовского языка в бумажных документах и электронной среде, а также гармонизирующие употребление письменных и устных литовского и других языков в бумажных документах и электронной среде. Необходимо создать транскрибаторы, преобразующие знаки письменной речи на других языках в знаки письменного литовского языка, а звуки устной речи на других языках — в знаки устного литовского языка, пригодные для автоматического синтеза звуков литовской речи.

На первом заседании «Распознавание и синтез речи» было представлено три доклада.

В докладе «Дальше от печатного станка Гутенберга: литовская речь в новейших технологиях» Audrius Valotka (VU) и Gediminas Navickas (VU) рассказали о литовской речи в новейших технологиях и представили проект, финансируемый структурными фондами: Услуги, управляемые литовской речью — LIEPA (доступен в интернете: https://www.raštija.lt/liepa),), в рамках которого, помимо прочего, были созданы синтезатор и распознаватель литовской речи. В ходе реализации этого проекта для литовской речи открылись ворота в цифровое пространство, поэтому планируется проект Развитие услуг, управляемых литовской речью — LIEPA 2. Докладчики рассказали о результатах проекта LIEPA 2, которые будут открыты и бесплатно доступны всем желающим и будут способствовать использованию литовской речи в продуктах информационных технологий. Важнейшим результатом нового проекта станет возможность естественным образом

Apžvalgos / Surveys

315

AURELIJA TAMULIONIENĖ

общаться с предметами (мобильными телефонами, планшетами, умными часами, роботами), отдавать команды человеческим голосом и понимать их ответы. В рамках проекта LIEPA 2 планируется создать типовые сервисы, демонстрирующие новые возможности применения сервисов, управляемых литовской речью: пульт управления обучающим роботом, устройство для набора номера, сервис вызова такси, мобильный синтезатор для незрячих, программа для чтения интернет-новостей, межъязыковой коммуникатор.

Лаймутис Телкснис (VU) и Гедиминас Навицкас (VU) в докладе «Сервисы, управляемые литовской речью. Состояние. Перспективы» рассказали о состоянии и перспективах таких сервисов, а также о планомерно ведущейся работе по их созданию и расширению сфер применения. Работа ведётся с привлечением знаний специалистов в области информационных технологий и филологов, занимающихся литовским языком, а также инженерных ресурсов. На первом этапе было создано семь сервисов, управляемых литовской речью, и инфраструктура, обеспечивающая их функционирование. В будущем планируется создать новые сервисы для мобильной электронной среды — умных мобильных телефонов, планшетов, умных часов и роботов.

О настоящем и перспективах синтеза литовской речи рассказали Пиус Каспарайтис (VU) и Гинтарас Скерис (VU). В докладе «Настоящее и перспективы синтеза литовской речи» были представлены различные сервисы озвучивания текста — синтезатор LIEPA, который свободно распространяется вместе с исходными текстами, что позволяет и другим людям находить для него новые способы применения. Например, аудиозаписи рядом с небольшими статьями уже размещают сайты: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt; сервис озвучивания текста RoboBraille позволяет автоматически преобразовывать любые текстовые документы в аудиофайлы; сообщения синтезированным голосом уже звучат на автовокзале Вилкавишкиса, а виртуальные помощники работают на сайте Департамента миграции и т. д.

На втором заседании «Цифровые ресурсы литовского языка» были заслушаны четыре доклада.

Первый доклад — «Э. язык — инновация в использовании цифровых языковых ресурсов» — представили Елена Йоланта Забараускайте (LKI), Дейманте Будрюнайте (LKI) и Скирмантас Шермукшнис (NetCode). В докладе подробно представили новый проект Института литовского языка, направленный на развитие информационной инфраструктуры языковых ресурсов Института литовского языка (LKIIS) (доступ в интернете: www.lkiis.lt). В основном доклад был посвящён сервисам, создаваемым инфраструктурой нового проекта Института литовского языка E. kalba: «Поиск в сети слов», «Э. маркетинг», «Э. понятия» и «Э. советы». Докладчики рассказали о функциональных возможностях этих сервисов и их технологических аспектах. В функциональность проекта будут включены инновационные технологии искусственного интеллекта для анализа мнений пользователей; сервис «Э. понятия» обеспечит расширенный поиск и обогащение понятий за счёт интеграции дополнительных языковых ресурсов, таких как двуязычные словари,

316

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

сети слов других языков; интерактивный помощник по словообразованию позволит быстро и удобно выбирать подходящие способы словообразования в соответствии с требуемым категориальным и групповым значением либо средствами словообразования. В докладе также были представлены основные результаты проекта E. kalba и ожидаемая польза.

В своём докладе «Возможности поиска в интернет-Lietuvių kalbos naujažodžių duomenyne» Рита Милунайте (LKI) рассказала, как выявлять разнообразные потребности пользователей языка и удовлетворять их с помощью Lietuvių kalbos naujažodžių duomenyno (доступ в интернете: http://naujažodžiai.lki.lt/)). Сейчас поиск можно вести по таким параметрам, как заглавное слово, происхождение неологизма, форма оригинала, варианты написания, сфера употребления и т. д. Составителям базы данных доступен и более широкий поиск, необходимый для редактирования данных в различных разрезах. В рамках проекта LKIS будет создаваться расширенная система поиска информации. Докладчица подчеркнула, что Lietuvių kalbos naujažodžių duomenynas — гибкий цифровой ресурс, открытый для развития. Его характер в первую очередь определяется самим предметом — постоянно меняющимся и обновляющимся пластом лексики литовского языка, а также новыми признаками данных, открывающимися исследователям неологизмов, и меняющимися потребностями пользователей. Планируется интегрировать этот ресурс в LKIS (доступ в интернете: http://lkis.lki.lt/)), включить его не только в общую систему поиска по накопленным в ней данным, но и использовать при создании сетей слов. На примерах в докладе было наглядно показано, чем эта база данных может быть полезна как специалистам по языку, так и всем, кто интересуется неологизмами.

Тему неологизмов продолжила Дайва Мурмулайте̇ (LKI) в докладе «Перспективы исследования словообразования неологизмов (на примере Lietuvių kalbos naujažodžių duomenyno)». Она рассказала об исследованиях словообразования неологизмов, их перспективах и о том, как изучать выявляющиеся словообразовательные явления с помощью Lietuvių kalbos naujažodžių duomenyno. Докладчица отметила, что уже на начальном этапе создания этой базы данных была предварительно подготовлена основа для анализа словообразования неологизмов: в предназначенных для этого полях предусмотрено указывать типы производных слов, формы их образования, словообразовательные категории (значения), родственные слова и т. д.; часть данных уже собрана. В поле особых признаков некоторые неологизмы отмечены как единичные (например, varškėfobija и др.), авторские (например, demagogėja и др.), контаминационные (например, murmanas и др.). Докладчица подчеркнула, что для подробного и качественного анализа словообразования важно также учитывать некоторые параметры, предусмотренные для фиксации с самого начала: часть речи производящего слова, изменения производящей основы, аналогии, роль перевода в образовании неологизма, нетипичные проявления словообразования и т. д. Важно создать хорошую систему индексов — подробную, гибкую и удобную для использования, пополнения и корректировки.

Лаймутис Билкис (LKI) в докладе «Структура геоинформационной базы данных литовских топонимов, связи с другими базами данных ономастики и направления развития»

Apžvalgos / Surveys

317

AURELIJA TAMULIONIENĖ

представил Геоинформационную базу данных топонимов Литвы (доступ в интернете: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). Мы попросили рассказать о структуре этой базы и её связях с другими базами данных ономастики. Докладчик представил разделы поиска, созданные на странице публичного доступа к базе данных: тип объекта, статус объекта, его нынешняя административно-территориальная принадлежность (самоуправление, староство, населённый пункт), административно-территориальная принадлежность в межвоенный период (уезд, волость, населённый пункт), притоки рек. В базе можно искать сведения о топонимах по следующим признакам: название, род, число, акцентуация, способ образования, происхождение по языковой принадлежности производящего слова, происхождение по принадлежности производящего слова к лексической группе. В базе можно найти аутентичные топонимы, зафиксированные в межвоенный период на территории нужного населённого пункта (деревни, церковной деревни, усадьбы, местечка, хутора), а также увидеть их точное или приблизительное местоположение на карте. В докладе подчёркивалось, что при интеграции базы в систему LKIS были созданы три типа ссылок на другие ономастические базы данных: на другой топоним, от которого произошло данное название, на антропоним, содержащийся в Базе данных литовских фамилий и являющийся источником топонима, и на исторические фиксации этого топонима в Базе данных исторических топонимов. В настоящее время в базу загружено и описано (описывается) около 25 000 топонимов.

После обеда докладчики и участники собрались на третье заседание — «Лингвистика корпусов».

Первый доклад — «Морфологически и синтаксически аннотированные корпуса литовского языка» — представили ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), ANDRIUS UŽA (VDU). Речь шла о двух аннотированных корпусах литовского языка, подготовленных в Центре компьютерной лингвистики Университета Витаутаса Великого (доступ к корпусам в интернете: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Аннотированные корпуса — основные ресурсы, без которых невозможно развитие языковых технологий. Обычно их используют для создания других ресурсов и инструментов обработки естественного языка в таких областях, как системы автоматического распознавания речи, машинный перевод и т. п. Морфологически аннотированный корпус MATAS создавался в 2002–2014 годах. Он состоит из 1,6 млн слов из текстов разных стилей. Корпус подготовлен на основе корпуса объёмом 1 млн слов, составленного в 2006 году, с применением статистических моделей. Синтаксически аннотированный корпус ALKSNIS, подготовленный в 2016 году как золотой стандарт для дальнейших исследований и разработки ресурсов, включает 2 355 предложений (около 30 тыс. слов), взятых из текстов разных стилей. Аннотирование корпуса основано на принципах автоматической морфологической и синтаксической разметки; применена модель синтаксических зависимостей.

Тему корпусов продолжил доклад «База данных устойчивых словосочетаний литовского языка», подготовленный многочисленным коллективом участников конференции: ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Институт передовых технологий Балтийского региона), JOLANTA KOVALSKAITĖ

318

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

(VDU), Tomas Krilavičius (Институт передовых технологий Балтийского региона), Justina Mandravikaitė (Институт передовых технологий Балтийского региона), Laura Vilkaitė (Институт передовых технологий Балтийского региона). На конференции доклад представила Erika Rimkutė (VDU); в основном она рассказала о методике исследования устойчивых словосочетаний в современном письменном литовском языке и о создаваемом на основе корпусов словаре коллокаций литовского языка. В рамках проекта Автоматическое распознавание устойчивых словосочетаний литовского языка (PASTOVU) (№ LIP-027/2016) (см. http://mwe.lt/), ставится цель разработать методику исследования устойчивых словосочетаний в современном письменном литовском языке и подготовить основанный на корпусе словарь коллокаций литовского языка. В проекте составлен и используется корпус Delfi.lt за 2014–2016 годы объёмом 72 млн слов. Словарь коллокаций будет подготовлен на основе базы данных, в которой будет представлена различная информация об устойчивых словосочетаниях: грамматическая и лексическая информация, частотность употребления, рубрика текста, примеры из конкорданса и т. п.

Исследования корпусов представили также представительницы Вильнюсского университета Gintarė Judžentytė (VU) и Vilma Zubaitienė (VU). В докладе «Исследования академических фраз на основе корпусов: формальная структура и семантика» говорилось о структуре и семантике фраз академического языка на материале создаваемого в настоящее время в Вильнюсском университете Корпуса студенческих письменных работ, который является одним из запланированных результатов проекта, поддерживаемого Государственной комиссией по литовскому языку: Исследования фразеологии студенческих работ и интерактивный сборник фраз. Проект направлен на выявление списка слов, важных для академического письма, выделение основных коллокаций и их расширений, а также повторяющихся последовательностей слов в различных частях академического текста, рассмотрение их связи с риторическими функциями частей текста и описание значений академических слов, таких как: цель, задача, методы, выводы, результаты; выполнять, анализировать, устанавливать, опираться на и др., а также их употребления и семантики.

На последнем заседании «Автоматизированный анализ структуры языка и текстов» было заслушано четыре доклада.

Заседание началось с доклада Danielius Račys (VU) «Машинный перевод для литовского языка», посвящённого новейшим этапам истории машинного перевода и его достижениям, проектам различных учреждений, а также новым прорывам в области нейронного машинного перевода. Докладчик рассказал о развитии машинного перевода и достижениях, которые сегодня эффективно применяются и для литовского языка. В 2005–2007 годах Университет Витаутаса Великого осуществлял финансируемый фондами ЕС проект «Средство перевода интернет-информации». Результатом стала общедоступная интернет-служба перевода с английского на литовский (доступ в интернете: http://vertimas.vdu.lt/twsas/). В 2012–2014 годах Вильнюсский университет осуществлял финансируемый ЕС проект «Создание системы машинного перевода с английского на литовский и обратно, а также с французского на литовский и обратно, основанной на статистических методах». Результатом стала общедоступная интернет-служба перевода (доступ в интернете: https://www.versti.eu/). Тем не менее

Apžvalgos / Surveys

319

AURELIJA TAMULIONIENĖ

даже для самых качественных машинных переводов необходимо вмешательство переводчика. Так могут ли машины переводить действительно хорошо? Последние несколько лет сулят новые прорывы благодаря использованию нейронного машинного перевода. Вильнюсский университет готовится в 2018 году приступить к внедрению нейронного машинного перевода нового поколения для английского, литовского, польского, французского, русского и немецкого языков. Отмечалось, что новейшие достижения машинного перевода не обходят стороной и литовский язык.

Виргиниюс Дудкявичюс (VU) в докладе «Грамматика литовского языка в мире цифровых технологий с открытым исходным кодом» рассказал о создании компьютерной морфологии литовского языка нового поколения, морфологическом анализе и синтезе слов, интеллектуальном поиске текстовой информации и т. п. С появлением компьютеров классической грамматике и лексике пришлось «облечься в новые одежды» и стать полноценной частью новых технологий. Для этого была создана компьютерная морфология литовского языка нового поколения и поставлены следующие цели: использовать и разрабатывать только открытый исходный код; специфические для литовского языка свойства могут быть только у данных, но не у их формы и интерпретации; весь программный код должен быть универсальным и подходить для любого другого языка; максимально использовать решения, успешно адаптированные для других языков мира. В основу положены Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) и текстовые корпуса (всего около 1,5 млрд слов). В среднем «распознаваемость» текста, появляющегося сейчас в интернете, составляет около 99%, то есть морфологический анализатор правильно интерпретирует в среднем 99 из 100 слов. Этот недавно разработанный метод морфологического анализа был успешно применён в системе синтаксико-семантического анализа Университета Витаутаса Великого (доступ в интернете: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) и в Реестре правовых актов Сейма Литовской Республики (доступ в интернете: www.e-tar.lt).

Тему цифровой грамматики продолжили Дайва Швейкаускене (LKI) и Витаутас Швейкаускас (LKI). В докладе «Цифровая грамматика литовского языка» речь шла о создаваемой в Институте литовского языка цифровой грамматике литовского языка, которую можно использовать и в других областях компьютерной обработки языка: для грамматического анализа, прямого перевода данных и т. д. Был представлен проект, в рамках которого планируется подключиться к международной системе DIGITAL GRAMMARS, охватывающей в настоящее время 32 языка. Главная цель создания цифровой грамматики — использовать её в системах автоматического перевода, работающих нестатистическими методами. Для литовского языка это очень актуально. Согласно данным Tildės за 2017 год, качество переводов Google на литовский язык и с литовского языка ниже даже, чем для латышского или эстонского. Поэтому для Литвы очень важно создавать альтернативный вариант автоматического перевода. В настоящее время подготовлен пробный образец цифровой грамматики, охватывающий несколько слов, однако уже по нему видно, что здесь качество перевода намного лучше, особенно для предложений, отражающих специфические особенности литовского языка. Пока используется английский порядок слов, неплохие переводы дают и статистические

320

Acta Linguistica Lithuanica LXXVI

Lietuvių kalbos padėtis skaitmeniniame amžiuje

методы, однако если в предложении нестандартный порядок слов, перевод Google не теряет смысла предложения. Цифровую грамматику можно использовать и в других областях компьютерной обработки языка: для грамматического анализа, прямого перевода данных и т. д. Разработкой цифровых грамматик руководит профессор Гётеборгского университета (Швеция) Аарне Ранта.

Последний доклад конференции — «Кто у кого списал? Автоматизация и визуализация исследования истории переводов Библии» — представил Миндаугас Шинкунас (LKI). В докладе речь шла об автоматизации и визуализации исследований истории переводов Библии. Результаты сравнения библейских стихов докладчик представил в наглядных и подробных диаграммах. Обилие библейских цитат в старых литовских письменных источниках затрудняет изучение связей между ними. Необходима удобная платформа данных, позволяющая группировать библейские стихи по признакам, интересующим исследователя. Наибольшие трудности вызывает оценка сходства цитат. Комплексный анализ лексики, синтаксиса и морфологии (а в некоторых случаях — и орфографии) позволяет это сделать, однако такое филологическое исследование занимает много времени, и в настоящее время автоматизировать его невозможно. Сравнение удалось автоматизировать с помощью алгоритмов циклического действия, задача которых — обнаруживать идентичные последовательности в двух строках знаков и вычислять, какую долю сравниваемых последовательностей они охватывают. Автоматизации сравнения препятствует неоднозначная орфография старых письменных источников. Сопоставление строк, транслитерированных вручную и автоматически, показало, что способ транслитерации существенно не влияет на результаты. Результаты могут быть спорными при сравнении текстов, написанных на разных диалектах (нивелирование диалектных особенностей не проверялось). Полученные результаты сходства обобщаются в двумерных диаграммах. Результаты программного сравнения библейских стихов из Postilės Бреткуна (1591) соответствуют выводам, к которым ранее пришли исследователи, использовавшие другие методы.

Конференция завершилась дискуссиями. Подготовленные на основе докладов конференции статьи будут опубликованы в научных журналах Bendrinė kalba (доступ в интернете: www.bendrinekalba.lt) и Lietuvių kalba (www.lietuviukalba.lt).

LITERATŪRA

Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.

Įteikta 2017 m. lapkričio 3 d.

AURELIJA TAMULIONIENĖ

Lietuvių kalbos institutas

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva

[email protected]

Apžvalgos / Surveys

321