Lietuvių kalbos padėtis skaitmeniniame amžiuje
Full text
АУРЕЛІЯ ТАМУЛЬОНЕНЕ
Інститут литовської мови
Напрями наукових досліджень: вивчення вживання сучасної литовської мови та її варіативності.
СТАН ЛИТОВСЬКОЇ МОВИ В ЦИФРОВУ ЕПОХУ
Про 24-ту конференцію імені Йонаса Яблонскіса
Напрями розвитку цифрових мовних ресурсів і можливості їх використання
Jono Jablonskio (1860–1930) – žymiausio lietuvių kalbos normintojas, reikšmingų lietuvių kalbos mokslui ir praktikai darbų autorius. Pasak Zigmo Zinkevičiaus, „[V]isa Jablonskio veikla – tai ištisa epocha lietuvių bendrinės kalbos istorijoje. Iš mūsų rašomą kalbą į tinkamas vėžes [...], jos raidą pasuko sveika linkmė“ (Zinkevičius 1992: 155).
Наукову конференцію, названу на честь Йонаса Яблонскіса, уперше провели 1993 року Інститут литовської мови — відділ культури мови — та кафедра литовської мови Вільнюського університету. Відтоді конференції стали традиційними й відбуваються щоосені (з 2003 року — почергово в Інституті литовської мови або Вільнюському університеті).
29 вересня 2017 року в Інституті литовської мови відбулася 24-та наукова конференція імені Йонаса Яблонскіса Напрями розвитку цифрових мовних ресурсів і можливості їх використання (англ. Digital Language Resources, Directions of Their Development and Possibilities to Harness Them). Конференцію організував Центр досліджень стандартної мови Інституту литовської мови спільно з Інститутом прикладної лінгвістики Вільнюського університету. За тематикою ця конференція відрізнялася від попередніх; її метою було обговорити проблеми, що виникають на перетині мов і цифрових технологій, з якими стикаються під час розвитку цифрових ресурсів і створення єдиного цифрового ринку. У центрі уваги конференції були семантичний рівень цифрових ресурсів (створення мереж слів), а також надання цифровим ресурсам звукової форми, створення нових можливостей для поширення цифрових ресурсів у багатомовних спільнотах тощо.
У конференції взяли участь доповідачі з-за кордону — з Європейського парламенту та Іспанії, а також дослідники з різних установ Литви: Інституту литовської мови, Вільнюського
Straipsniai / Articles
313
AURELIJA TAMULIONIENĖ
університету, Університету Вітовта Великого, Балтійського інституту передових технологій, ЗАТ «Netcode». На конференції було прочитано 17 доповідей. Доповідачі виступали зі своїми доповідями та ділилися результатами досліджень і досвідом на чотирьох засіданнях.
Конференція розпочалася зі вступних промов. Учасників конференції та доповідачів привітали депутат Європейського парламенту Algirdas Saudargas і директорка Інституту литовської мови проф. д-р Jolanta Elena Zabarskaitė. Вступне слово виголосила старша наукова співробітниця Центру досліджень стандартної мови Інституту литовської мови д-р Rita Miliūnaitė. Йшлося про те, що зв’язок литовської мови з інформаційними технологіями за останні роки значно зміцнився: маємо відчутні результати як у цифровізації мовних ресурсів, так і у створенні інструментів для аналізу, розпізнавання та синтезу мовлення, проте, з огляду на те, як швидко змінюється світ у цій галузі, литовській мові ще багато чого потрібно надолужити. Оскільки литовська мова є флективною, ми не можемо безпосередньо застосовувати до неї інформаційні технології, створені для англійської мови, тому наші сучасні інструменти машинного перекладу та інші комп’ютерні засоби ще дуже недосконалі, а світ уже досліджує і рухається далі, у напрямі розвитку штучного інтелекту, втілює його у пристроях і проникає в дедалі глибші мовні шари.
На пленарному засіданні першу доповідь «Жива мова у штучному розумі» виголосив депутат Європейського парламенту Algirdas Saudargas. Доповідач порушив принципове питання, на яке має відповісти кожна мовна спільнота: якою мірою вона повинна сама підготувати ресурси й технології для своєї рідної мови, а що можна придбати вже готовим, створеним на основі інших мов. У доповіді прозвучали проблемні міркування про те, що литовська мова, як і мови деяких інших малих країн, «має незначну технологічну підтримку або не має її зовсім». Мовні технології не отримують належної уваги в порядку денному не лише литовських, а й європейських політиків. У доповіді наведено міркування, які свідчать, що розвиток штучного інтелекту сходиться до гібридної форми, у якій нейронні мережі відповідають несвідомим механізмам мозку, а свідомий розум формується традиційним, так званим символічним штучним інтелектом. Кожна мовна спільнота повинна дбати про те, щоб мовні технології, що відповідають символічному штучному інтелекту, повно й точно відображали всю структуру рідної мови, а для взаємодії з нейронними мережами було створено змістовне середовище рідної мови (і рідної культури).
Другу пленарну доповідь «Language equality in the digital age: towards a human language project» англійською мовою виголосив Rafael Rivera, директор консалтингової компанії «Claves». У доповіді докладно представлено дослідження Відділу досліджень наукових перспектив Європейського парламенту «Рівність мов у цифрову добу. Проєкт рідної мови» (з дослідженням англійською мовою можна ознайомитися в інтернеті: http://www.europarl.europa.eu/RegData/etudes/STUD/2017/598621/EPRS_STU(2017)598621_EN.pdf). У доповіді оглянуто сучасний стан технологій рідної мови, кількісно оцінюючи
314
Acta Linguistica Lithuanica LXXVI
Lietuvių kalbos padėtis skaitmeniniame amžiuje
економічні, соціальні та лінгвістичні наслідки для мов у цифрову добу, обговорено політику Європейського Союзу у сфері інформаційних і комунікаційних технологій. У цифрову добу мовні технології становлять величезний виклик для країн із невеликою кількістю мовців. Недостатньо розвинені мовні технології створюють ізоляцію та перешкоди. Це впливає на транскордонні послуги, мобільність працівників і торгівлю. Причина таких перешкод — неузгоджені наукові дослідження та недостатнє фінансування. Доповідач наголосив, що мовні технології не отримують належної уваги європейських політиків. На основі аналізу сучасного стану розробляється ініціатива, яка об’єднає політику установ, наукових досліджень, промисловості, ринку та державних послуг.
Останню доповідь пленарного засідання «Литовська писемна й усна мова у звичайному та електронному середовищі» виголосив професор Інституту математики та інформатики Вільнюського університету Laimutis Telksnys. У доповіді йшлося про необхідність розробити методи й засоби — апаратне та програмне забезпечення, — що забезпечуватимуть правильне вживання литовської писемної й усної мови в паперових документах та в електронному середовищі. Доповідач порушив важливе питання: як поводитимуться кілька мільйонів литовців, щоб не зникнути в океані понад 7 мільярдів людей, які пишуть і говорять, та прийдешніх розумних машин. Професор також запропонував відповідь: щоб цього не сталося, необхідно розробити методи й засоби — апаратне та програмне забезпечення, — що забезпечуватимуть правильне вживання литовської писемної й усної мови в паперових документах та в електронному середовищі й гармонізуватимуть уживання литовської та інших мов у письмовій та усній комунікації — у паперових документах і в електронному середовищі. Потрібно створити транслітератори — для передавання знаків писемної мови інших мов знаками литовської писемної мови, а звуків усного мовлення інших мов — знаками литовської усної мови, придатними для автоматичного синтезу звуків слів литовського мовлення.
На першому засіданні «Розпізнавання та синтез мовлення» було прочитано три доповіді.
Audrius Valotka (VU) і Gediminas Navickas (VU) у доповіді «Далі від друкарського преса Гутенберга: литовське мовлення в новітніх технологіях» розповіли про литовське мовлення в найновіших технологіях і представили проєкт, що фінансується структурними фондами: Послуги, керовані литовським мовленням — LIEPA (доступ в інтернеті: https://www.raštija.lt/liepa),), у межах якого, серед іншого, було створено синтезатор і розпізнавач литовського мовлення. Під час реалізації цього проєкту литовському мовленню відчинили ворота до цифрового простору, тому заплановано проєкт Розвиток послуг, керованих литовським мовленням — LIEPA 2. Доповідачі розповіли про результати проєкту LIEPA 2, які будуть відкритими й безкоштовно доступними для всіх охочих та сприятимуть використанню литовського мовлення в продуктах інформаційних технологій. Найважливішим результатом нового проєкту стане можливість природною
Apžvalgos / Surveys
315
AURELIJA TAMULIONIENĖ
спілкуватися з пристроями (мобільними телефонами, планшетами, розумними годинниками, роботами), віддавати команди людським голосом і розуміти їхні відповіді. У межах LIEPA 2 передбачається створити типові послуги, які демонструють нові можливості використання послуг, керованих литовським мовленням: пульт керування навчальним роботом, телефонний сервіс, виклик таксі, мобільний синтезатор для незрячих, засіб читання інтернет-новин, міжмовний комунікатор.
Лаймутіс Телксніс (VU) і Гедімінас Навіцкас (VU) у доповіді «Послуги, керовані литовським мовленням. Стан. Перспективи» розповіли про стан і перспективи послуг, керованих литовським мовленням, а також про систематичну роботу зі створення таких послуг і розширення їх використання. Роботу ведуть, об’єднавши знання фахівців з інформаційних технологій і філологів литовської мови та інженерні ресурси. На першому етапі було створено сім послуг, керованих литовським мовленням, а також інфраструктуру, що забезпечує їх функціонування. Надалі планується створити нові послуги, керовані литовським мовленням, для мобільного електронного середовища — розумних мобільних телефонів, планшетів, розумних годинників і роботів.
Про сучасний стан і перспективи синтезу литовського мовлення розповіли Піус Каспарайтіс (VU) і Гінтарас Скеріс (VU). У доповіді «Сучасний стан і перспективи синтезу литовського мовлення» було представлено різноманітні послуги озвучування тексту — синтезатор LIEPA, який вільно поширюється разом із вихідними текстами, що дає змогу й іншим людям знаходити нові способи його застосування. Наприклад, аудіозаписи біля статей уже публікують вебсайти: zinios.lt, unikopedarejas.lt, vilnius.lt, m.delfi.lt, vle.lt; послуга озвучування тексту RoboBraille дає змогу автоматично перетворювати будь-які текстові документи на аудіофайли; оголошення синтетичним голосом під час поїздки вже лунають на автовокзалі міста Вілкавішкіс, а віртуальні асистенти вже працюють на вебсайті Департаменту міграції тощо.
На другому засіданні «Цифрові ресурси литовської мови» було заслухано чотири доповіді.
Першу доповідь «E. kalba — інновація у використанні цифрових мовних ресурсів» виголосили Елена Йоланта Забаркшайте (LKI), Дейманте Будрюнце (LKI) і Скірмантас Шермукшніс (NetCode). У доповіді докладно представлено новий проєкт Інституту литовської мови, спрямований на розширення інформаційної інфраструктури ресурсів литовської мови (LKIIS) (доступ в інтернеті: www.lkiis.lt). Переважно йшлося про послуги, що генеруються інфраструктурою нового проєкту Інституту литовської мови E. kalba: «Пошук у мережі слів», «Електронний маркетинг», «Електронні поняття» та «Електронні поради». Доповідачі представили функціональні можливості цих послуг і їхні технологічні аспекти. Функціонал проєкту охоплюватиме інноваційні технології штучного інтелекту для аналізу думок користувачів; послуга «Електронні поняття» забезпечить розширений пошук і збагачення понять завдяки інтеграції додаткових мовних ресурсів, таких як двомовні словники,
316
Acta Linguistica Lithuanica LXXVI
Lietuvių kalbos padėtis skaitmeniniame amžiuje
мережі слів інших мов; за допомогою інтерактивного помічника зі словотвору можна буде швидко й зручно добирати відповідні способи словотвору згідно з бажаним категорійним і груповим значенням або словотвірними засобами. У доповіді також представлено основні результати проєкту E. kalba та очікувану користь.
Ріта Мілунайте (LKI) у своїй доповіді «Можливості пошуку в інтернет Литовському сховищі неологізмів» розповіла, як розкрити потреби мовців, надаючи їм якомога різноманітніші можливості пошуку в Литовському сховищі неологізмів (доступ в інтернеті: http://naujažodžiai.lki.lt/) за характеристиками неологізмів. Наразі можна шукати за такими параметрами: заголовним словом, походженням неологізму, формою оригіналу, варіантами написання, сферою вживання тощо. Упорядникам бази даних доступний і розширений пошук, потрібний для редагування даних за різними зрізами. У межах проєкту LKIS створюватиметься розширена система пошуку інформації. Доповідачка наголосила, що Литовське сховище неологізмів — це гнучкий цифровий ресурс, відкритий для розвитку. Такий його характер насамперед зумовлює сам матеріал — постійно змінюваний і оновлюваний пласт лексики литовської мови, а також нові характеристики даних, що відкриваються дослідникам неологізмів, і мінливі потреби користувачів. Цей ресурс планується інтегрувати до LKIS (доступ в інтернеті: http://lkis.lki.lt/) і включити не лише до спільної системи пошуку в накопиченні даних, а й використовувати для створення мереж слів. У доповіді наочно показано, чим це сховище може бути корисним як фахівцям з мови, так і всім користувачам, які цікавляться неологізмами.
Тему неологізмів продовжила Даіва Мурмулайте (LKI) у доповіді «Перспективи дослідження словотвору неологізмів (на прикладі Литовського сховища неологізмів)». Вона розповіла про дослідження словотвору неологізмів і перспективи, а також про те, як досліджувати виразні явища словотвору неологізмів за допомогою Литовського сховища неологізмів. Доповідачка зазначила, що вже на початковому етапі створення цієї бази даних було попередньо підготовлено основу й для аналізу словотвору неологізмів: у призначених для цього полях передбачено вказувати типи похідних слів, їхні словотвірні форми, словотвірні категорії (значення), споріднені слова тощо; частину даних уже накопичено. У полі особливих ознак деякі неологізми позначено як поодинокі (наприклад, varškėfobija тощо), авторські (наприклад, demagogėja тощо), контамінаційні (наприклад, murmanas тощо). Доповідачка наголосила, що для докладного й якісного аналізу словотвору важливо також враховувати деякі аспекти, які планували фіксувати від початку: частину мови твірного слова, зміни твірної основи, аналогії, роль перекладу у творенні неологізму, нетипові вияви словотвору тощо. Важливо створити якісну — докладну, гнучку, зручну для використання, доповнення та коригування — систему індексів.
Лаймутіс Білкіс (LKI) у доповіді «Структура геоінформаційної бази даних топонімів Литви, зв’язки з іншими базами власних назв і напрями розвитку»
Apžvalgos / Surveys
317
AURELIJA TAMULIONIENĖ
представив геоінформаційну базу даних литовських топонімів (доступ в інтернеті: http://lkis.lk.lt/lietuvos-vietovardziu-geoinformacine-duomenu-baze). Ми попросили розповісти про структуру цієї бази та її зв’язки з іншими базами даних ономастики. Доповідач представив пошукові поля, створені на сторінці публічного доступу до бази даних: тип об’єкта, статус об’єкта, сучасну адміністративно-територіальну належність (муніципалітет, староство, населений пункт), адміністративно-територіальну належність у міжвоєнний період (повіт, волость, населений пункт), притоки річок. Інформацію про топоніми в базі можна шукати за такими ознаками: назва, рід, число, наголос, спосіб творення, походження за належністю твірного слова до мови, походження за належністю твірного слова до лексичної групи. У базі можна знайти автентичні топоніми, записані в міжвоєнний період на території відповідного населеного пункту (села, церковного села, маєтку, містечка, хутору), а також побачити їхнє точне чи приблизне розташування на карті. У доповіді наголошувалося, що під час інтеграції бази до системи LKIS створено три типи посилань на інші бази ономастики: на інший топонім, від якого походить цей топонім; на антропонім із Бази даних литовських прізвищ, від якого походить топонім; на історичні написання цього топоніма, наявні в Базі даних історичних топонімів. Наразі до бази завантажено й описано (описується) близько 25 000 топонімів.
Після обіду доповідачі й учасники зібралися на третє засідання «Лінгвістика корпусів».
Першу доповідь «Морфологічно та синтаксично анотовані корпуси литовської мови» виголосили ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), ANDRIUS UŽA (VDU). Йшлося про два анотовані корпуси литовської мови, підготовлені в Центрі комп’ютерної лінгвістики Університету Вітовта Великого (доступ до корпусів в інтернеті: http://nl.ijs.si/ME/V4/msd/html/index.html; https://ufal.mff.cuni.cz/tred/). Анотовані корпуси — основні ресурси, без яких неможливо розвивати мовні технології. Зазвичай їх використовують для створення інших ресурсів та інструментів обробки природної мови в таких сферах, як системи автоматичного розпізнавання мовлення, автоматичний переклад тощо. Морфологічно анотований корпус MATAS готували у 2002–2014 роках. Він містить 1,6 млн слів із текстів різних стилів. Корпус підготовлено на основі корпусу обсягом 1 млн слів, укладеного 2006 року, із застосуванням статистичних моделей. Синтаксично анотований корпус ALKSNIS, підготовлений 2016 року як еталон для подальших досліджень і розроблення ресурсів, містить 2 355 речень (близько 30 тис. слів), узятих із текстів різних стилів. Анотування корпусу ґрунтується на принципах автоматичного морфологічного та синтаксичного анотування; застосовано модель синтаксичних залежностей.
Тему корпусів у доповіді «База даних сталих словосполучень литовської мови» продовжила численна група доповідачів конференції: ERIKA RIMKUTĖ (VDU), AGNĖ BIELINSKIENĖ (VDU), LOÏC BOIZOU (VDU), IEVA BUMBULIENĖ (Інститут передових технологій Балтійського регіону), JOLANTA KOVALSKAITĖ
318
Acta Linguistica Lithuanica LXXVI
Lietuvių kalbos padėtis skaitmeniniame amžiuje
(VDU), Tomas Krilavičius (Інститут передових технологій Балтійського регіону), Justina Mandravikaitė (Інститут передових технологій Балтійського регіону), Laura Vilkaitė (Інститут передових технологій Балтійського регіону). На конференції доповідь представила Erika Rimkutė (VDU); вона переважно розповіла про методику дослідження сталих словосполучень у сучасній писемній литовській мові та про словник колокацій литовської мови, який укладають на основі корпусів. У межах проєкту Автоматичне розпізнавання сталих словосполучень литовської мови (PASTOVU) (№ LIP-027/2016) (див. http://mwe.lt/),) поставлено за мету розробити методику дослідження сталих словосполучень сучасної писемної литовської мови та укласти словник колокацій литовської мови на основі корпусу. У проєкті створено й використовується корпус Delfi.lt за 2014–2016 роки обсягом 72 млн слів. Словник колокацій укладатимуть на основі бази даних. У ній буде наведено різноманітну інформацію про сталі словосполучення: граматичну й лексичну інформацію, частотність уживання, рубрику тексту, приклади конкордансів тощо.
Корпусні дослідження представили також представниці Вільнюського університету Gintarė Judžentytė (VU) та Vilma Zubaitienė (VU). У доповіді «Дослідження академічних фраз на основі корпусів: формальна структура та семантика» йшлося про структуру й семантику фраз академічного мовлення на основі Корпусу студентських письмових робіт, який нині створюють у Вільнюському університеті та який є одним із запланованих результатів проєкту, підтриманого Державною комісією литовської мови: Studentų darbų frazėksėmo tyrimai ir interaktyvios fražų sąvadas. Мета проєкту — визначити перелік слів, важливих для академічного письма, виокремити основні колокації та їхні розширення, а також повторювані послідовності слів у різних частинах академічного тексту, розглянути їхні зв’язки з риторичними функціями частин тексту й описати значення академічних слів, таких як: tikslas, uždavinys, metodai, išvados, rezultatai; atlikti, analizuoti, nustatyti, remtis, а також їхнє вживання та семантику.
На останньому засіданні «Автоматизований аналіз мовної структури й текстів» було заслухано чотири доповіді.
Засідання розпочалося доповіддю Danielius Račys (VU) «Машинний переклад для литовської мови» про найновіші розробки в історії машинного перекладу, його досягнення, проєкти різних установ, а також нові прориви у використанні нейронного машинного перекладу. Доповідач розповів про розвиток і досягнення машинного перекладу, які сьогодні ефективно застосовуються також до литовської мови. У 2005–2007 роках Університет Вітовта Великого виконував проєкт, фінансований структурними фондами ЄС, Інтернет-засіб перекладу інформації. Результат — загальнодоступна онлайн-служба перекладу з англійської на литовську (доступ в інтернеті: http://vertimas.vdu.lt/twsas/). У 2012–2014 роках Вільнюський університет виконував фінансований ЄС проєкт Створення системи машинного перекладу з англійської на литовську й назад та з французької на литовську й назад на основі статистичних методів. Результат — загальнодоступна онлайн-служба перекладу (доступ в інтернеті: https://www.versti.eu/). Однак
Apžvalgos / Surveys
319
AURELIJA TAMULIONIENĖ
Навіть для найкращих машинних перекладів потрібне втручання перекладача. То чи можуть машини перекладати справді добре? Останні кілька років обіцяють нові прориви у використанні нейронного машинного перекладу. Вільнюський університет готується у 2018 році розпочати впровадження машинного перекладу нового покоління на основі нейронних мереж для англійської, литовської, польської, французької, російської та німецької мов. Відзначили, що найновіші досягнення машинного перекладу не оминають і литовської мови.
У доповіді «Граматика литовської мови у світі цифрових технологій із відкритим кодом» Virginijus Dudkevičius (VU) розповів про створення комп’ютерної морфології литовської мови нового покоління, морфологічний аналіз і синтез слів, інтелектуальний пошук текстової інформації тощо. З появою комп’ютерів постала необхідність, щоб класична граматика й лексика «вдягнули нове вбрання» та стали повноцінною частиною нових технологій. Для цього створено комп’ютерну морфологію литовської мови нового покоління та визначено такі цілі: використовувати й створювати лише відкритий код; лише дані, але не їхня форма й інтерпретація, можуть мати специфічні для литовської мови властивості; весь програмний код має бути універсальним і придатним для будь-якої іншої мови; максимально використовувати рішення, успішно адаптовані для інших мов світу. Основою стали Dabartinės lietuvių kalbos gramatika (Vilnius, 2006) і корпуси текстів (загалом близько 1,5 млрд слів). Морфологічний аналізатор «розпізнає» приблизно 99% середнього тексту, який нині з’являється в інтернеті, тобто в середньому правильно інтерпретує 99 зі 100 слів. Цей новостворений спосіб морфологічного аналізу успішно застосовано в системі синтаксично-семантичного аналізу Університету Вітовта Великого (доступ в інтернеті: https://semantika.lt/SyntacticAndSemanticAnalysis/Analysis) і в Реєстрі правових актів Сейму Литовської Республіки (доступ в інтернеті: www.e-tar.lt).
Тему цифрової граматики продовжили Daiva Šveikauskienė (LKI) та Vytautas Šveikauskas (LKI). У доповіді «Цифрова граматика литовської мови» йшлося про цифрову граматику литовської мови, розробку якої розпочато в Інституті литовської мови і яку можна використовувати також в інших галузях комп’ютерної обробки мови: для граматичного аналізу, безпосереднього перекладу даних тощо. Було представлено проєкт, у межах якого планується приєднатися до міжнародної системи DIGITAL GRAMMARS, що охоплює нині 32 мови. Основна мета створення цифрової граматики — використовувати її в системах автоматичного перекладу, що працюють не на статистичних методах. Для литовської мови це дуже актуально. За даними за 2017 рік Тільде, якість перекладів Google литовською та з литовської мови гірша навіть, ніж для латиської чи естонської мов. Тому для Литви дуже важливо створити альтернативний варіант автоматичного перекладу. Нині підготовлено пробний зразок цифрової граматики, що охоплює кілька слів, однак уже й з нього видно, що якість перекладу тут набагато краща, особливо для речень, у яких відображено специфічні риси литовської мови. Поки використовується порядок слів англійської мови, непогані переклади дають і статистичні
320
Acta Linguistica Lithuanica LXXVI
Lietuvių kalbos padėtis skaitmeniniame amžiuje
методи, однак якщо в реченні нестандартний порядок слів, переклад Google не втрачає змісту речення. Цифрову граматику можна використовувати й в інших галузях комп’ютерного опрацювання мови: для граматичного аналізу, безпосереднього перекладу даних тощо. Розробкою цифрових граматик керує професор Aarne Ranta з Гетеборзького університету (Швеція).
Останню доповідь конференції «Хто в кого переписав? Автоматизація та візуалізація дослідження історії перекладів Біблії» виголосив Mindaugas Šinkūnas (LKI). У доповіді йшлося про автоматизацію та візуалізацію досліджень історії перекладів Біблії. Доповідач показав результати порівняння біблійних віршів у наочних і докладних діаграмах. Велика кількість біблійних цитат у старих литовських писемних пам’ятках ускладнює дослідження зв’язків між ними. Потрібна зручна платформа даних, яка дає змогу групувати біблійні вірші за ознаками, що цікавлять дослідника. Найбільші труднощі становить оцінювання подібності цитат. Комплексний лексичний, синтаксичний і морфологічний аналіз (а в окремих випадках — і орфографічний) дає змогу це зробити, проте таке філологічне дослідження повільне, і наразі його неможливо автоматизувати. Порівняння вдалося автоматизувати за допомогою алгоритмів, що працюють циклами: їхнє завдання — виявляти ідентичні послідовності у двох рядах знаків і обчислювати, яку частину порівнюваних рядів вони охоплюють. Автоматизації порівняння перешкоджає неоднозначна орфографія старих писемних пам’яток. Після оцінювання рядків, транслітерованих вручну й автоматично, встановлено, що спосіб транслітерації істотно не впливає на результати. Результати можуть бути дискусійними під час порівняння текстів, написаних різними діалектами (нівеляцію діалектних особливостей не перевіряли). Отримані результати подібності узагальнюють у двовимірних діаграмах. Результати програмного аналізу порівняння біблійних віршів у Postilės Bretkūnas (1591) відповідають висновкам, до яких попередні дослідники дійшли іншими методами.
Конференція завершилася дискусіями. Статті, підготовлені на основі доповідей конференції, буде опубліковано в наукових журналах Bendrinė kalba (доступ в інтернеті: www.bendrinekalba.lt) і Lietuvių kalba (www.lietuviukalba.lt).
LITERATŪRA
Zinkevičius Zigmas 1992: Lietuvių kalbos istorija 5. Bendrinės kalbos iškilimas. Vilnius: Mokslas, 144–155.
Įteikta 2017 m. lapkričio 3 d.
AURELIJA TAMULIONIENĖ
Lietuvių kalbos institutas
Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva
[email protected]
Apžvalgos / Surveys
321