scieee AI-readable full text Open interactive document viewer

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Daiva Šveikauskienė; Arūnas Ribikauskas; Vytautas Šveikauskas

Full text

DAIVA ŠVEIKAUSKIENĖ Litvanca Dili Enstitüsü ARŪNAS RIBIKAUSKAS Vilnius Gediminas Teknik Üniversitesi VYTAUTAS ŠVEIKAUSKAS Litvanca Dili Enstitüsü Bilimsel araştırma alanları: dilbilgisi, bilgisayarlı dilbilim. LİTVANCA DİLBİLGİSİ ÜZERİNE ÇOK DİLLİ BİR WEB SİTESİ İnternette Litvanca dilbilgisi için çok dilli bir bilgi sistemi AÇIKLAMA Bir yıl önce Litvanya Dili Enstitüsünde, Litvanca sözcüklerin dilbilgisel özelliklerine ilişkin ayrıntılı verilerin sunumunu kullanıcılara internette ücretsiz olarak sunmayı amaçlayan bir proje üzerinde çalışılmaya başlandı. Mart 2017’de yalnızca “bėg” köklü sözcükleri (krş. “bėgti/koşmak” fiili) içeren bir deneme sürümü hazırlandı. Veritabanı yaklaşık 25.000 kayıttan oluşmaktadır. Proje, bilgisayarlı dilbilim alanındaki mevcut çalışmaların eksikliklerinden kaçınmayı amaçlamaktadır. Bu eksiklikler; sözcüklerin kapsamı, dilbilgisel verilerin çeşitliliği, verilerin sunumunun açıklığı ve anlaşılabilirliği vb. ile ilgilidir. Kullanıcının girdiği sözcüğe ilişkin dilbilgisel bilgi üç alanda sunulur: sözcüğün yapısı, biçimbilimsel veriler ve morfem verileri. Bu, Litvanya’da morfem türlerine ilişkin bilginin kullanıcıya sunulduğu ilk web sitesidir. Veritabanında bulunan her sözcük için bir çekim tablosu alınabilir. Bazı sözcükler için kullanım örnekleri de verilir. Web sitesi, Litvancayla ilgilenen yabancıların da kullanabilmesi için yedi dilde sunulmaktadır: Litvanca, İngilizce, Almanca, Fransızca, İtalyanca, Rusça ve Japonca. 144 Acta Linguistica Lituanica LXXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANAHTAR KELİMELER: Dilbilgisi, biçimbilim, morfem, bilgi sistemi, bilgisayarlı dilbilim. AÇIKLAMA The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well. ANAHTAR KELİMELER: Dilbilgisi, biçimbilim, morfemik, bilgi sistemi, bilgisayarlı dilbilim. 1. GİRİŞ: BİLGİSAYARLI DİLBİLİM 20. yüzyılın ortalarına kadar bütün dilbilgisi kitapları kâğıda basılıyordu. Bilgisayarların ortaya çıkmasının ardından (dünyanın ilk bilgisayarı MARK I, 1942 yılında Harvard Üniversitesinde yapıldı (Schwanke 1991: 69)), bilgisayarlar yaşamın bütün alanlarına girmeye başladı. Diller de istisna değildi: bilgisayarların yalnızca sayıları değil, her türlü simgeyi de işleyebildiği kısa sürede anlaşıldı. Dolayısıyla dilleri de işleyebilirler. Bilgisayarların yeteneklerinin dillere de uygulanabilmesi için çeşitli dilbilimciler dillerin biçimsel betimlemelerini geliştirmeye başladı (Winograd 1983: 23). Yapay zekâ alanında dil işleme, en önemli uygulama alanlarından biri hâline geldi (Charis 1989: 71). 1968’den 1978’e kadar dillerin dilbilgisel çözümlemesi, yapay zekâ araştırmacılarının başlıca konusuydu (Nirenburg 1987: 26). Ancak insanlara kolayca boyun eğen diller, bilgisayarlar için çetin bir ceviz gibi görünüyordu (Jensen, Heidorn, Straipsniai / Articles 145 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden. 1.1. İSTATİSTİKSEL YÖNTEMLER Dil işlemede istatistiksel yöntemler büyük önem taşır. Bunları kullanmaya yönelik ilk öneriler, bilgisayarların ortaya çıkışından kısa süre sonra sunulmuştu. Bu, özellikle İngilizce için geçerlidir. David W. Reed, nicel dilbilimsel çözümlemeyi ele almıştır (Reed 1949: 236). Weaver, çeviri için bilgisayar kullanma düşüncesini dile getiren ilk kişiydi. 1949 yılında bunun için istatistiksel yöntemlerin kullanılmasını önerdi. Ancak dönemin bilim insanları, muhtemelen elektronik olarak okunabilir metinlerin hacmi yetersiz ve o zamanki bilgisayarların işlem gücü pek yüksek olmadığı için, kısa süre sonra bu öneriyi reddettiler. Birkaç on yıl sonra, metin derlemleri toplandığında ve istatistiksel yöntemlerin konuşma tanımada kullanılması iyi sonuçlar verdiğinde, çeviride istatistiksel yöntemlere yeniden dönüldü (Brown at al. 1990: 79). Kanada’da bunun için özellikle elverişli koşullar vardı; çünkü ülkenin iki resmî dili nedeniyle parlamentoya ait tüm materyaller iki dilde (İngilizce ve Fransızca) saklanıyordu. Bu nedenle yeterli miktarda paralel metin çok hızlı bir şekilde derlenebildi (Al-Onaizan, Curin, Jahr 1999: 1). Her iki dilin, yani İngilizce ile Fransızcanın yapısı birbirine çok benzer: sözcük dizilişi katıdır (ilk sırada özne, ikinci sırada yüklem bulunur). Dillerin yapısındaki benzerlikler, istatistiksel yöntemlerle çeviride iyi sonuçlar elde edilmesini sağladı. Ancak Litvanca için durum böyle değildir. İstatistiksel yöntemi kullanan Google çevirileri, Litvancaya yapılan çevirilerde şimdiye kadar iyi sonuçlar vermemektedir. 2017 yılı verilerine göre hem İngilizceden Litvancaya hem de Litvancadan İngilizceye çeviri sonuçları, İngilizce-Latvanca, Latvanca-İngilizce, İngilizce-Estonca ve Estonca-İngilizce çeviri sonuçlarından daha kötüdür (Skadinš 2017: 22). İstatistiksel yöntemler dilbilimin başka alanlarına da girmiştir. İlk çalışmalar fonetikle ilgiliydi (Zipf 1929). 1944 yılında edebî metinler üzerinde istatistiksel araştırmalar yapıldı; yani hangi sözcüklerin bir kez, hangilerinin iki, üç vb. kez kullanıldığı incelendi (Yule 194: 9). 146 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 1973’ten beri, dillerin ve ağızların nicel araştırmasıyla ilgilenen dilbilim alanını adlandırmak için diyalektometri terimi kullanılmaktadır (Köhler, Altmann, Piotrowski 2005: 498). İstatistiksel yöntemler morfoloji alanında da uygulanmıştır. Goldsmith, sözcükteki morfemleri belirlemeye yönelik algoritmayı şöyle tanımlar: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36). Geçen yüzyılın sonlarında, Rusça literatürde istatistiksel hesaplamalar yardımıyla cümlelerin otomatik sözdizimsel çözümlemesini yapmaya yönelik girişimler anlatılmaktadır. Rusya’daki bilim insanları, cümlelerin sözdizimsel yapısının dilbilimsel çözümlemeye dayalı olarak değil, metinlerin istatistiksel olarak işlenmesiyle belirlenmesini önermişlerdir. Her dilsel birimin (sözcük, sözcüğün sözdizimsel kategorisi, sözdizimsel yapı) metinde belli bir sıklıkta ortaya çıktığını ileri sürmektedirler. Örneğin, İngilizce sıklık sözlüğünün valans verilerine göre fiile özgü 195 farklı sözdizimsel ilişki örüntüsü vardır. Ancak en sık görülen on örüntü, metinlerde kullanılan tüm örneklerin yalnızca%86’sını oluşturur. İstatistiksel düzenliliklerden cümlenin doğrusal yapısını incelemede de yararlanılır. Her sözcük sınıfının, başlangıç noktasından belli bir uzaklıkta bulunma sıklığı vardır. İngilizce fiil, cümle başından itibaren ikinci ila beşinci konumda 0,7 olasılıkla yer alabilir. İkinci ila onuncu konumda görülme olasılığı ise 0,95’tir (Церкас 1979: 124). Daha sonra, sözdizimsel çözümleme için bir metin derleminden elde edilen veriler kullanılmıştır (Köhler 2012: 31). Ancak şimdiye kadar iyi sonuçlar yalnızca İngilizcenin işlenmesinde elde edilmiştir. Litvanca sözdiziminin bilgisayarlaştırılması alanında çalışan Vidas Daudaravičius şöyle belirtmektedir: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3). İstatistiksel yöntemlerin yardımıyla hızlı çalışan sistemler çabucak oluşturulabilir; ancak bunun bir koşulu vardır: belirli sayıda hatayı tolere etmek gerekir (Link 1). Bu nedenle Litvanca Enstitüsünde istatistiğe olabildiğince az başvurmaya karar verilmiştir; çünkü verilerde en yüksek doğruluk ve güvenilirlik hedeflenmektedir. 1 „İngilizce için başarıyla kullanılan yöntemlerin diğer diller için de uygun olduğunu düşünmek saflıktır.“ Straipsniai / Articles 147 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS 1.2. LİTVANYA’DAKİ DURUM Litvanca dilbilgisinin bilgisayarlaştırılması alanında pek çok çalışma zaten yapılmıştır. Bunların çoğu yalnızca bilgisayarlı dilbilim uzmanları tarafından anlaşılabilir. Bazıları geniş kitlelere de yöneliktir. Ancak bunlar, sözcüklerin ve dilbilgisinin yalnızca belirli özelliklerini ve niteliklerini yansıtır. Örneğin, Kaunas’ta Büyük Vytautas Üniversitesi’nde bir metin derlemi temel alınarak morfemik bir veritabanı oluşturulmuştur. Burada pek çok sözcük biçimi eksiktir ve herkesin anlayamayacağı çok sayıda kısaltma kullanılır. Morfemler kısa çizgiyle ayrılmış, morfem türüne ilişkin hiçbir veri verilmemiştir. Vilnius’taki Matematik ve Bilişim Enstitüsü’nde türetme ve morfemik için bir veritabanı oluşturulmuştur. Burada morfem türünün yanı sıra temel sözcükler ve belirleyici sözcükler de belirtilmiştir (Murmulaitytė 2012: 96). Ne yazık ki veritabanına serbestçe erişilemiyor. Bu nedenle, geniş kitlelere yönelik olacak ve kullanıcılara ayrıntılı veriler sunabilecek kapsamlı bir bilgi sistemi oluşturulmasına karar verilmiştir. İnternette Litvancanın dilbilgisel bilgilerinin sunumunda iki uç durum gözlemlenebilir. Bunlar, en yaygın sözcük biçimlerinin bile bulunmaması ve ana dili konuşanların dahi anlayamayacağı gereksiz sözcüklerin sunulmasıdır. Litvanca dilbilgisi bilgi sisteminde bu iki uç durumdan da kaçınılmaya çalışılır. Tüm sözcük biçimleri, sözcüğün lemmasından hareketle bilgisayar tarafından otomatik olarak üretilir; böylece çekim biçimlerinin tamamı elde edilir. Olası tüm türetmeler ve birleşik sözcükler veritabanına kaydedilir. Böylece sözcük biçimlerinin eksik olması sorunu ortadan kalkar. Ardından, bilgisayar tarafından oluşturulan tüm sözcükler ve sözcük biçimleri elle kontrol edilir ve var olmayan biçimler silinir. Böylece gereksiz sözcüklerin ayıklanması sağlanır. 2. LİTVANYA’DA BİLGİSAYARLI DİLBİLİM ÇALIŞMALARI Litvanya’da dilin bilgisayarla işlenmesinde iki yöntem ayırt edilebilir. Kaunas’ta Bilgisayarlı Dilbilim Merkezi’nde çalışmalar bir metin derlemi temelinde yürütülür. Vilnius’ta, üniversitede ve Litvanca Enstitüsü’nde ise daha çok Litvancanın kendi özelliklerinden hareket edilir. Her iki yöntemin de hem avantajları hem de dezavantajları vardır. Aşağıda bu durum birkaç örnekle gösterilecektir. 148 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 2.1. METİN DERLEMİ TEMELLİ ÇALIŞMALAR Kaunas’taki Büyük Vytautas Üniversitesi’nde çağdaş Litvanca metin derlemi oluşturulmuştur. Bu derlem, çeşitli dil işleme türleri için kullanılır. Dilbilgisi alanında bir morfem sözlüğü (Rimkutė, Kazlauskienė, Rąkinis 2011) ve birkaç yıl sonra bir veritabanı da oluşturulmuştur. Kullanıcıya hem morfemik hem de morfolojik veriler sunulur. Bu, sözcüğün morfemlerine ayrıldığı, serbestçe erişilebilen ilk kaynaktır. Ne yazık ki morfem türü belirtilmez ve bu bazen sözcüğün morfemik yapısının kafa karıştırıcı biçimde sunulmasına yol açar. Farklı yapılara sahip sözcüklerin aynı biçimde gösterildiği durumlarda bu sorun ortaya çıkar. Bunun bir örneği Şekil 1’de gösterilmiştir. „per-ei-ti“ (karşıya geçmek) ve „per-ė-ti“ (kuluçkaya yatmak) sözcüklerinin dış görünüşleri birbirinden çok az farklıdır. Her iki sözcüğün morfemik yapısı da morfem veritabanında aynı görünür. Oysa ilk sözcükte „per“ morfemi önektir; ikinci sözcükte ise aynı ilk morfem „per“ köktür. ŞEKİL 1. Farklı morfemik yapılara sahip sözcükler aynı biçimde gösterilmiştir (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35) İkinci bir eksiklik olarak, yaygın sözcük biçimlerinin bile bulunmamasından söz edilebilir. Litvancada ortaçların altı hâli vardır. Tablo 1’de, „bėgantis / koşan, akan“ ortaç biçiminin sözcük biçimlerinin (tekil, eril) morfem veritabanındaki mevcudiyeti gösterilmiştir. Görüldüğü üzere, bu sözcüğün lemması (yalın hâl, tekil) bile eksiktir. Eksik olan diğer biçimler, örneğin bulunma hâli (bėgančiame vandenyje / akan suda), da nadir ya da alışılmadık biçimler olarak değerlendirilemez. Dolayısıyla altı hâlden yalnızca iki sözcük biçimi mevcuttur. Baltık dillerinin ikincisi olan Letoncayı inceleyen bilim insanları da metin derlemindeki sözcük biçimlerinin sayısının yetersiz olduğundan söz eder (Paikens, Rituma, Pretkalniņa 2013: 272). Straipsniai / Articles 149 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS TABLO 1. Tekil eril biçimdeki bēgantis / laufender, fließender ortaç biçimlerinin veritabanında bulunma durumu (Bağlantı 2) Durum Sözcük Veritabanı Yalın hâl bēgantis yok Genitif bēgančio mevcut Yönelme hâli bēgančiam yok Belirtme hâli bēgantį mevcut Araç hâli bēgančiu yok Yerel hâl bēgančiame yok Toplam: 6 2 2.2. BAŞLANGIÇ NOKTASI – LİTVANYA DİLİ Vilnius Üniversitesi’nde Litvanya dilinin özelliklerinden hareket edilir. Morfologija.lt web sitesi (Bağlantı 3), sözcüğün çekim tablolarını bile gösterir. Ne yazık ki, bazen tüm paradigma için olmak üzere, pek çok boş alan vardır. Bilinmeyen ve bir Litvanyalı için anlaşılmaz sözcüklere de bazen rastlanır; örneğin “sutikimoji” (Bağlantı 4) ve benzerleri. Vilnius’taki Matematik ve Bilişim Enstitüsü’nde sözcük türetme ve morfem bilimi için bir veritabanı oluşturulmuştur (Murmulaitytė 2012). Bu veritabanı çok değerli bilgiler (morfemin türü, temel sözcük, belirleyici sözcük vb.) içerir, ancak verilere ne yazık ki serbestçe erişilemez. 3. LİTVANYA DİLİ İÇİN BİLGİ SİSTEMİ Litvanya dili, Avrupa’da bilgisayarlaşma düzeyi en düşük diller grubuna girer (Vaišnienė, Zabarskaitė 2012: 35). Bu nedenle Litvanca sözcüklerin dilbilgisel özellikleri hakkında ayrıntılı veriler içeren bir bilgi sistemi oluşturulmasına karar verilmiştir. Geniş bir kullanıcı kitlesi için daha fazla yazılım oluşturma gerekliliği, Baltık dilleri üzerine çalışan bilim insanları tarafından sık sık vurgulanmaktadır. BSNLP (Balto-Slavic Natural Language Processing) konferansının 2015 ve 2017 yönergelerinde şöyle yazılmıştır: “submissions 150 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache sistemleri tanımlayan, daha geniş bir kamuoyunun kullanımına sunulmuş çalışmalar güçlü biçimde teşvik edilecektir / geniş kamuoyunun kullanımına sunulan sistemleri tanımlayan çalışmalar özellikle desteklenecektir” (Bağlantı 5). Bu nedenle, Litvanya dili için bilgi sisteminin geniş bir kullanıcı kitlesine yönelik tasarlanması ve verilerin olabildiğince basit ve anlaşılır biçimde sunulması fikri ortaya çıktı. Buna göre, kullanıcıların gereksinimlerini olabildiğince iyi karşılayabilmek için duyarlı web tasarımı (RW) seçildi. Dolayısıyla sözcük hakkındaki dilbilgisel bilgiler kutucuklar (İngilizce tiles) halinde düzenlenir (Bağlantı 6). Bu sayede web sitesine cep telefonundan da erişilebilir. 3.1. VERİTABANININ OLUŞTURULMASI YÖNTEMİ Dilbilgisini bilgisayar ortamına aktarmanın amacı, her sözcük ve onun tüm biçimleri hakkında bütün dilbilgisel bilgilerin elektronik biçimde elde bulunmasıdır. Bunu gerçekleştirmenin iki yolu vardır. İlk yol, dilbilgisi kurallarının biçimsel bir betimlemesini (bir tür yardımcı araç) oluşturmak ve ardından gerekli bilgileri bilgisayara ürettirmektir. İkinci yol, tüm sözcüklerin tüm biçimleri hakkındaki bütün dilbilgisel bilgileri bilgisayarda saklamak ve gerektiğinde bunları almaktır. Hangi yaklaşımın daha fazla emek gerektirdiği henüz tartışmaya açıktır. Matematik ve Bilişim Enstitüsü’nde Litvanya dilinin morfolojik analizi için bir yazılım geliştirilmiştir (Zinkevičius 2000); bu yazılımda ilk yöntem kullanılmıştır. Ancak%100 doğruluğa ulaşmak mümkün olmamıştır: Hatalı bilgiler vardır ve bazı Litvanca sözcükler tanınmamaktadır. Litvanya dili için bilgi sistemi geliştirilirken, aşağıdaki nedenle bu yöntemden vazgeçilmiştir: Bilgisayarın sözcükleri kendisinin işleyebilmesi için, hangi sözcük üzerinde hangi işlemleri yapması gerektiği ona çok kesin biçimde belirtilmelidir. Dolayısıyla önce tüm sözcükler, aynı gruptaki tüm üyeler için aynı düzenliliklerin geçerli olacağı, yani aynı işleme yönteminin kullanılabileceği biçimde gruplara ayrılmalıdır. Sözcüğü şu ya da bu gruba yerleştirmek için, sözcüklerin hangi temelde gruplandırılacağını belirleyen çok sayıda özelliği saptamak gerekir. Örneğin Litvanya dilinin sözdizimsel çözümlemesinde, isimlerin belirtme durumunun sözdizimsel işlevini belirlemek için [zaman] anlamsal özelliği kullanılır. “Visą naktį ji Straipsniai / Articles 151 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS skaitė šią knygą / Bütün gece bu kitabı okudu.“ ve „Visą knygą ji perskaitė šią naktį / Kitabın tamamını o gece okudu.“ İki sözcük knygą/Buch ve naktį/Nacht biçimbilimsel kategoriler bakımından farklı değildir; ikisi de dişil, tekil ve belirtme durumundadır. Yalnızca naktis/Nacht sözcüğünün sahip olduğu, knyga/Buch sözcüğünün ise sahip olmadığı [Zaman] anlamsal özelliği, bilgisayarın naktį/Nacht sözcüğünü zaman zarfı, knygą/Buch sözcüğünü ise cümlede nesne olarak doğru biçimde değerlendirmesini sağlar. Morfoloji için de benzer bir şey yapmak gerekir. Litvanca dilinin morfolojik çözümlemesi için daha önce geliştirilmiş yazılımdaki hatalardan biri, -ėj- biçimbiriminin, birleşemeyeceği köklerde sonek olarak değerlendirilmesidir. Bu sonekin -ėj- hangi köklerle birleşebileceğine bilgisayarın karar vermesini sağlayacak sözcük özelliklerini belirlemek gerekir. Ancak bunu yapmak çok karmaşıktır. Örneğin geroė/Wohlhaben, žinovas/Kenner(Expert) ve daržovė/Obst sözcüklerinin ortak özelliği nedir? Hepsinin -ov- soneki vardır. Peki onları, bu sonekin köklerine eklenemediği diğer bütün sözcüklerden ayıran nedir (*kėdovė denemez; bu, kėdė/Stuhl sözcüğünün -ov- sonekiyle türetilmiş biçimidir)? Ve bunu hangi özellik gösterir? Bu nedenle Litvanca dilinin dilbilgisi bilgi sistemi geliştirilirken ikinci yol seçildi; başka bir deyişle, Litvanca dilindeki bütün sözcüklerin bütün biçimleri hakkında ayrıntılı dilbilgisel bilgiler içeren bir veritabanı hazırlandı. Burada, basılı dilbilgisi kitaplarının tümünde olduğu gibi dilbilgisi kategorilerinden değil, sözcüğün kendisinden hareket etmek gerekir: her sözcükle ilgili bütün bilgiler kullanıcıya sunulmalıdır. Başlangıç noktası olarak bir kök alınmasına ve Litvanca dilbilgisinin bütün yapısını yansıtacak bir yazılım geliştirilmesine karar verildi. İlk deneme için bėg kökü (bėgti/koşmak fiilinden) seçildi. Ardından bilgisayar yardımıyla olası bütün türetmeler oluşturuldu ve Litvancada var olmayan sözcükler daha sonra elle silindi. Veritabanında toplam yaklaşık 25.000 madde bulunmaktadır. 3.2. “LIGIS”İN ÖZELLİKLERİ Litvanca Dilbilgisi Bilgi Sistemi (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (Bağlantı 7) iki temel özelliğe sahiptir. İlk olarak, kullanıcıya belirli bir sözcük hakkında basılı dilbilgisi kitaplarından daha ayrıntılı bilgi verir. Ve 152 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache İkinci olarak, sözlüklerden daha fazla sözcük içerir. Dilbilgisi kitaplarında, belirli bir sözcük grubuna uyan kurallar verilir. Ancak bu kuralın geçerli olduğu bütün sözcüklerden söz edilmez. LIGIS, kullanıcının girdiği sözcükle ilgili bütün bilgileri derler ve bunları bir web sitesinde sunar. Sözlüklerde Litvanca dilindeki bütün sözcükler yer almaz; birçok türetme ve birleşik sözcük eksiktir. LIGIS, olası bütün türetmeleri içerir. Karşılaştırma için bir örnek verilebilir. Morfem veritabanında yaklaşık 75.000 madde bulunur. Ancak bunlar farklı Litvanca sözcükleri betimler. LIGIS veritabanı şu anda 25.000 maddeden oluşur ve yalnızca tek bir köke ait sözcükleri kapsar: beg-. Morfem veritabanında bu köke sahip 118 sözcük vardır. 3.3. SÖZCÜĞÜN YAPISI Sözcük girildikten sonra kullanıcıya sözcüğün yapısı açıklanır: lemma ve temel sözcüğün yanı sıra türetmelerin ve birleşik sözcüklerin belirleyici öğeleri de belirtilir. Sözcük dilbilgisel açıdan birden fazla anlam taşıyorsa, lemma için bu anlamların her birine ayrı bir numara verilir. Daha sonra morfolojik ve morfemik veriler bu numara altında gösterilir. Çok anlamlı bir sözcük örneği Ek A’da verilmiştir. Diğer biçimler. Sözcüğün yapısını gösteren kutucukta bulunan düğmenin adı budur (İngilizce button). Rusçanın morfolojik çözümlemesi web sitesi (Bağlantı 8), girilen sözcüğün bütün biçimlerini her seferinde gösterir. Litvanca dilbilgisi bilgi sisteminde ise bir düğme eklenmesine ve kullanıcının diğer biçimlere bağlantı aracılığıyla erişmesine karar verilmiştir; çünkü kullanıcı her seferinde bir sözcüğün bütün biçimlerine ihtiyaç duymaz. 3.4. BİÇİMBİLİMSEL VERİLER Biçimbilimsel bilgi; sözcük türünün belirtilmesini ve dilbilgisel kategorileri kapsar: isimler için hâl, cinsiyet ve sayı; fiiller için kişi, zaman, kip vb. Örneğin bir isim birkaç eş adlı hâl biçimine sahipse, çok anlamlı sözcüklere numara verilir. Morfem veritabanında (Bağlantı 2) sözcükle ilgili biçimbilimsel veriler de bulunmaktadır. Ancak bilgiler yalnızca kısaltmalarla Straipsniai / Articles 153 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS verilmiştir. Böyle bir örnek Şekil 2’de gösterilmiştir. Uzman olmayanlar için bu kadar çok kısaltmayı anlamak çoğu zaman güç olabilir. Özellikle Litvanca öğrenen veya çalışan yabancılar için bu şekilde sunulan bilgiler zaman zaman belirsiz olabilir. ŞEKİL 2. begčio sözcüğüyle ilgili veriler, yalnızca kısaltmalarla gösterilmiştir (Bağlantı 2) Litvanca dilbilgisi bilgi sisteminde kısaltma kullanılmamaktadır. Tüm bilgiler açık biçimde yazılmaktadır (Ek A). 3.5. MORFEMİK VERİLER Bugün erişilebilen veritabanlarından en önemli farkı, her morfemin türünün belirtilmesidir.1 Morfemlerin bir sözcükte sunulmasında kesinliği ancak bu şekilde sağlamak mümkündür. Aksi hâlde, örneğin birleşik bir sözcükteki ikinci kökü son ekten ayırt etmek mümkün olmaz; morfemik veritabanında durum böyledir. İlk ve belirleyici özellik, morfemlerin farklı renklerle gösterilmesiydi. Her morfem türü (kök, önek, son ek, çekim eki) için bir renk belirlendi. Önekler mavi yazılır. Kök için kırmızı kullanılır. Son ekler yeşil gösterilir; çekim ekleri içinse siyah seçilmiştir. Ayrıca morfemlerine ayrılmış sözcük dikey yönde düzenlenir; yanında yalnızca sözcüğün her morfeminin türü belirtilmekle kalmaz, morfemin varsa özellikleri de gösterilir; örneğin son ekler için türetimsel veya biçimbilimsel, çekim ekleri içinse kısaltılmış, zamirleşmiş vb. özellikler belirtilir. Konuşma dilinde çok yaygın olan kısaltılmış çekim eklerinde, yanında tam çekim eki de gösterilir. Örnek olarak konuşma dilindeki şu sözcükler verilebilir: šnekamoje kalboje – tam çekim ekleri, šnekamoj kalboj – kısaltılmış çekim ekleri. Sözcük tam çekim ekine sahipse uzunluk özelliği belirtilmez; çünkü çoğu sözcükte tam çekim ekleri bulunur ve bu tür bir bilgi gereksiz olur. Eğer 154 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache Ek pronominal değilse, buna ilişkin bilgi de verilmez. Ses değişimleri kökün bir özelliği olarak kabul edilir. Bunlar ünsüz değişimi de ünlü değişimi de olabilir. Litvancada dikkate alınabilecek bir başka ses değişimi türü de emir kipinde ünsüzlerin düşmesidir. Ekler de bir sözcüğün kökündeki ses değişimlerine dahildir. Önekin kökeni ise onun bir özelliği olarak kabul edilir: edat kökenli, bir parçacıktan türemiş ya da uluslararası kökenli. Sözcüklerde dilbilgisel çok anlamlılık söz konusu olduğunda biçimbirimsel yapılar incelenir. Bunlar aynıysa yalnızca bir yapı açıklanır. Ancak farklılıklar varsa sözcüğün her anlamı için biçimbirimsel yapılar belirtilir (Ek A). 3.6. SÖZCÜĞÜN TÜM BİÇİMLERİ Veritabanında yer alan her sözcüğün çekim tablosuna “Diğer biçimler” düğmesine tıklanarak erişilebilir. Burada biçimbilim kutucuğundaki tüm veriler gösterilir. Tablonun üst kısmında, çekim tablosunda yer almayan kategoriler belirtilir; örneğin Litvancada isimler cinsiyete göre çekimlenmediğinden, cinsiyetin yanı sıra lemma ve sözcük türü de tablonun üst kısmında belirtilir. Sıfatların ve ortaçların üç cinsiyeti vardır; Litvancanın bir özelliği de bunlardan yalnızca ikisinin (eril ve dişil) altı hâlin tümüne sahip olmasıdır. Üçüncü cinsiyetin yalnızca tek bir biçimi vardır; bu nedenle hâl adı belirtilmeden verilir (Ek B). Fiiller için tüm kiplerdeki bütün zaman biçimleri gösterilir (Ek D). Bu sayede çekim ve ad çekimi sınıflarına gerek kalmadığından, bunlarla ilgili herhangi bir veri verilmez. Bazı sözcükler için çekim tablosuna kullanım örnekleri de eklenmiştir. Bunun için hızlı bilgi (İngilizce tooltip) kullanılır. Ek C'de, “bėgis” sözcüğü (isim bėgis / demiryolu rayı, koşu sözcüğünün tekil belirtme hâli) örnek olarak verilmiştir. 3.7. VERİTABANI Veritabanı geliştirilirken mümkün olduğunca yüksek kalite ve güvenilirlik hedeflenmiştir. Bu nedenle çalışmanın büyük bir bölümü elle Straipsniai / Articles 155 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS çünkü mümkün olan en güvenilir bilgiye ancak insanın yardımıyla ulaşılabilir (Sulger 2013: 53). Litvanya Dili Enstitüsünde Litvanca önekler üzerine araştırmalar yürütülmüştür. Litvancada yaklaşık 600 önek birleşimi bulunduğu saptanmıştır (Šveikauskienė 2015: 195). „Birleşim“ ile, kökten önce gelebilen çeşitli önek dizileri kastedilir; örneğin at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti vb. Bu birleşimlerden yalnızca 220’sinin fiil kökleriyle kullanıldığı; diğerlerinin, örneğin nuo- biçiminin, isimlerle kullanıldığı görülmüştür: nuo-monė /fikir. Yazılım, kökü olası tüm önek birleşimleriyle otomatik olarak eşleştirecek biçimde tasarlanmıştır. Ardından bilgisayarın ürettiği sonuçlar insanlar tarafından denetlenir ve Litvancada gerçekten bulunan sözcükler veritabanına kaydedilir. Böylece iki uçtan kaçınılır: Bilgisayarın oluşturduğu biçimlerin aşırı sayıda olması önlenirken sözcük kapsamının yetersiz kalması da engellenir. Tüm lemmalar ve bunlara ilişkin dilbilgisel bilgiler veritabanına elle girilir. Matematik ve Bilişim Enstitüsünde geliştirilen yazılım, verilen lemmaya ait sözcük biçimlerini üretirken hata yapmadığından, diğer sözcük biçimlerinin kayıtlarını otomatik olarak oluşturma işi bilgisayara bırakılmıştır. LIGIS’te kısaltılmış ekleri olan sözcüklerin de işlendiği dikkate değerdir. Bu tür sözcüklere konuşma dilinde çok sık rastlanır ve mevcut veritabanlarının hiçbiri bu sözcük biçimlerini işlemez. Ayrıca LIGIS’in, Litvanca Sözlüğü’nün 20 ciltlik baskısında ve elektronik sürümünde (Link 9) bulunmayan türetmeleri de içerdiği vurgulanmalıdır; örneğin neužbėgti/bir daha yukarı koşmamak. Veritabanındaki bilgiler bilgisayarların işleyebileceği bir biçimde saklanır; başka bir deyişle Prage Markup Language kodlaması kullanılır (Hana, Štepánek 2012). Bu veri biçimi internette sunulmaz; çünkü bilgisayarlı dilbilim uzmanı olmayanlar için gereksiz olurdu. Tüm bilgilerin bir veritabanında saklanması, LIGIS’i Litvancayı araştıran dilbilimciler için de yararlı bir araç hâline getirir. Örneğin belirli önek ve sonek birleşimlerine sahip sözcükler gibi çeşitli türlerde bilgi aranabilir. 156 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 3.8. WEB SİTESİNİN ÇOK DİLLİLİĞİ Web sitesi yedi dilde sunulmaktadır: Litvanca, İngilizce, Almanca, Fransızca, İtalyanca, Rusça ve Japonca. Çok dilli bir web sitesine duyulan gereksinim, Litvanca için Google Çeviri’nin tatmin edici olmayan sonuçlarından kaynaklanmıştır. Litvancanın makine çevirisi güvenilir değildir. Bu nedenle Litvanca dilbilgisi web sitesinin çok dilli hâle getirilmesine ve yalnızca insanlar tarafından çevrilmiş metinlerin kullanılmasına karar verilmiştir. Diğer dillerdeki durumun da pek farklı olmadığı açıktır. Bunun kanıtı, 8 Haziran 2017 tarihli Lingvist mektubudur: mektupta LINGUIST adının çevirisinin ana dili bu olan kişilerce yapılması ve hiçbir şekilde makine çevirisi kullanılmaması istenmektedir (LinguiList 2017: 28.252). Web sitesini çok dilli hâle getirme kararını alırken şöyle düşündük: Örneğin bir Norveçli Litvanca öğreniyor ya da çalışıyor ve bazı Litvanca sözcükleri biliyor, bazılarını ise henüz bilmiyorsa, Litvancadan daha iyi bildiği bir dili, örneğin Almancayı seçebilir; böylece bilmediği tüm Litvanca sözcükleri anlayabilir. Bu amaçla, diller değiştirilirken kullanıcının girdiği sözcüğün korunması da sağlanmıştır. Dolayısıyla kullanıcı başka bir dil seçtiğinde sözcüğü yeniden girmek zorunda kalmaz. 4. GELECEK PLANLARI Vilnius Üniversitesinde birçok iki dilli sözlük dijital ortama aktarılmıştır. Litvanya Dili Enstitüsünde 20 ciltlik büyük sözlük ile diğer tek dilli sözlükler —eş anlamlılar, zıt anlamlılar ve deyimler sözlükleri vb.— dijitalleştirilmiştir. Bu iki sözlük türünün Litvanca dilbilgisi bilgi sistemiyle birleştirilmesi ve Alman CANOONET web sitesine (Link 10) benzer bir site oluşturulması planlanmaktadır. Litvanca dilbilgisi bilgi sistemi morfemlerle ilgili verileri içerdiğinden, morfem modeline dayanarak sözcük araması yapmak mümkündür. Gelecek için öngörülen de tam olarak budur. LIGIS web sitesindeki bir sekme (İngilizce tab), kurama ayrılmıştır ve şu anda üzerinde çalışılmaktadır. Burada Litvanca dilbilgisine ilişkin ileri düzey akademik bilgilerin sunulması amaçlanmaktadır. Straipsniai / Articles 157 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS İlk aşamada morfoloji üzerinde çalışılmaktadır. İkinci aşamada sözdizimsel verilerin de sisteme girilmesi amaçlanmaktadır. 5. Sonuçlar 1. Bu yaklaşım, çekim bakımından zengin diğer diller için de yararlı ve anlamlı olabilir. 2. Litvanca dilbilgisi bilgi sistemi; öğrenciler, Litvanca öğrenen yabancılar ve Litvancayı araştıran dilbilimciler için büyük yarar sağlayabilir. 3. Toplanan veriler, Litvanca dilinin belgelenmesine de hizmet edebilir. Literaturverzeichnis Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017). Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017). Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin. Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas. Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393. Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21. Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers. 158 Acta Linguistica Lithuanica XXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton. Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter. Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected]. Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102. Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press. Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277. Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355. Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU. Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag. Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21). Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21). Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197. Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer. Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company. Straipsniai / Articles 159 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press. Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273. Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95. Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125. LINKS Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017) Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017) Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017) Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017) Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017) Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017) Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017) Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017) Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017) Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017) 160 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANHANG A. GRAMMATISCHE INFORMATION. Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen. Die grammatische Information wird in der Website in Kacheln ausgelegt. Diese Darstellungsweise ist günstig für responsives Webdesign – RWD. Bemerkung: Die Farben sind im Bild entfernt. Straipsniai / Articles 161 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS ANHANG B. FORMENtABELLE FÜR DEKLINATION. Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt. NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta 162 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE. Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt. Straipsniai / Articles 163 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS ANANG D. FORMENTABELLE FÜR KONJUGATION. Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt. 164 Acta Linguistica Lithuanica LXXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete SANTRAUKA Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai. Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių. Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose. Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje. Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių. Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų. Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų. Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą. Straipsniai / Articles 165 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS Įteikta 2017 m. rugsėjo 5 d. DAIVA ŠVEIKAUSKIENĖ Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] ARŪNAS RIBAUSKAS Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected] VYTAUTAS ŠVEIKAUSKAS Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] 166 Acta Linguistica Lithuanica LXVII