This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
DAIVA ŠVEIKAUSKIENĖ
معهد اللغة الليتوانية
ARŪNAS RIBIKAUSKAS
جامعة جيديميناس التقنية في فيلنيوس
VYTAUTAS ŠVEIKAUSKAS
معهد اللغة الليتوانية
مجالات البحث العلمي: القواعد، واللغويات الحاسوبية.
موقع إلكتروني متعدد اللغات لقواعد اللغة الليتوانية
نظام معلومات متعدد اللغات لقواعد اللغة الليتوانية على الإنترنت
تعليق
قبل عام، بدأ العمل في معهد اللغة الليتوانية على مشروع يهدف إلى إتاحة عرض بيانات مفصلة عن الخصائص النحوية للكلمات الليتوانية للمستخدم مجانًا على الإنترنت. وفي مارس 2017، أُعدّت نسخة تجريبية لا تشمل سوى الكلمات ذات الجذر «bėg» (قارن الفعل «bėgti/الجري»). وتتألف قاعدة البيانات من نحو 25,000 سجل. ويسعى المشروع إلى تجنب أوجه القصور في الأعمال القائمة في مجال اللغويات الحاسوبية. ويتعلق ذلك بنطاق الكلمات، وتنوع البيانات النحوية، ووضوح عرض البيانات وسهولة فهمه، وغير ذلك. وتُعرض المعلومات النحوية المتعلقة بالكلمة التي يُدخلها المستخدم في ثلاثة أقسام: بنية الكلمة، والبيانات الصرفية، والبيانات المورفيمية. وهذا أول موقع إلكتروني في ليتوانيا يتيح للمستخدم معلومات عن أنواع المورفيمات. ويمكن الحصول على جدول تصريف لكل كلمة مدرجة في قاعدة البيانات. كما تُقدَّم أمثلة على الاستعمال لبعض الكلمات. ويُتاح الموقع بسبع لغات: الليتوانية والإنجليزية والألمانية والفرنسية والإيطالية والروسية واليابانية، لكي يتمكن الأجانب المهتمون باللغة الليتوانية من استخدامه.
144
Acta Linguistica Lituanica LXXVII
Page 2
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
الكلمات المفتاحية: القواعد، علم الصرف، المورفيم، نظام المعلومات، اللغويات الحاسوبية.
تعليق
The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.
الكلمات المفتاحية: القواعد، علم الصرف، مورفيمي، نظام المعلومات، اللغويات الحاسوبية.
1. المقدمة: اللغويات الحاسوبية
حتى منتصف القرن العشرين، كانت جميع كتب القواعد تُطبع على الورق. وبعد ظهور الحواسيب (في عام 1942، صُنع أول حاسوب في العالم، MARK I، في جامعة هارفارد (Schwanke 1991: 69))، بدأت تتغلغل في جميع مجالات الحياة. ولم تكن اللغات استثناءً؛ وسرعان ما اتضح أن الحواسيب لا تستطيع معالجة الأرقام فحسب، بل والرموز الاعتباطية أيضًا. وبالتالي، يمكنها معالجة اللغات كذلك. وبدأ عدد من اللغويين تطوير أوصاف شكلية للغات، لكي يتسنى تطبيق قدرات الحواسيب على اللغات أيضًا (Winograd 1983: 23). وأصبحت معالجة اللغة أحد أهم مجالات التطبيق في ميدان الذكاء الاصطناعي (Charis 1989: 71). ومنذ عام 1968 حتى عام 1978، كان التحليل النحوي للغات أهم موضوع لدى باحثي الذكاء الاصطناعي (Nirenburg 1987: 26). غير أن اللغات، التي تنقاد للإنسان بسهولة، بدت للحواسيب لغزًا صعبًا (Jensen, Heidorn,
Straipsniai / Articles
145
Page 3
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.
1.1. الأساليب الإحصائية
للأساليب الإحصائية أهمية كبيرة في معالجة اللغات. وقد طُرحت الاقتراحات الأولى لاستخدامها بعد وقت قصير من ظهور الحواسيب. وينطبق ذلك بوجه خاص على اللغة الإنجليزية. تناول ديفيد دبليو. ريد التحليل اللغوي الكمي (Reed 1949: 236). وكان ويفر أول من عبّر عن فكرة استخدام الحواسيب في الترجمة. وفي عام 1949، اقترح استخدام الأساليب الإحصائية لهذا الغرض. غير أن علماء ذلك العصر تخلوا عن الفكرة بعد فترة وجيزة، على الأرجح بسبب قلة النصوص المتاحة للقراءة إلكترونيًا، وبسبب ضعف القدرة الحاسوبية آنذاك. وبعد بضعة عقود، حين جُمعت المدونات النصية وأفضى تطبيق الأساليب الإحصائية في التعرف على اللغات إلى نتائج جيدة، عاد الاهتمام بالأساليب الإحصائية في الترجمة (Brown at al. 1990: 79). وفي كندا، توافرت ظروف مواتية على نحو خاص، إذ تُحفظ هناك جميع مواد البرلمان بلغتين (الإنجليزية والفرنسية) بسبب وجود لغتين رسميتين للدولة. لذلك أمكن جمع قدر كافٍ من النصوص المتوازية بسرعة كبيرة (Al-Onaizan, Curin, Jahr 1999: 1). وبنية اللغتين، أي الإنجليزية والفرنسية، متشابهة جدًا: فترتيب الكلمات ثابت (يأتي الفاعل في الموضع الأول، والمسند في الموضع الثاني). وقد أتاح التشابه بين بنية اللغتين تحقيق نتائج جيدة في الترجمة بالأساليب الإحصائية. لكن الأمر ليس كذلك في اللغة الليتوانية. فالترجمات التي تقدمها خدمة ترجمة Google باستخدام الأسلوب الإحصائي لا تزال حتى الآن غير جيدة إلى الليتوانية. ووفقًا لبيانات عام 2017، فإن نتائج الترجمة من الإنجليزية إلى الليتوانية ومن الليتوانية إلى الإنجليزية أسوأ من نتائج الترجمة من الإنجليزية إلى اللاتفية، ومن اللاتفية إلى الإنجليزية، ومن الإنجليزية إلى الإستونية، ومن الإستونية إلى الإنجليزية (Skadinš 2017: 22).
امتدت الأساليب الإحصائية أيضًا إلى مجالات أخرى من علم اللغة. وتناولت الأعمال الأولى علم الأصوات (Zipf 1929). وفي عام 1944، أُجريت دراسات إحصائية للمعجم الأدبي، أي بحث عدد الكلمات التي استُخدمت مرة واحدة، وعدد الكلمات التي استُخدمت مرتين أو ثلاثًا، وهكذا (Yule 194: 9).
146
Acta Linguistica Lithuanica LXXVI
Page 4
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
منذ عام 1973، يُستخدم مصطلح قياس اللهجات للدلالة على فرع علم اللغة الذي يُعنى بالدراسة الكمية للغات واللهجات (Köhler, Altmann, Piotrowski 2005: 498).
كما استُخدمت الأساليب الإحصائية في مجال الصرف. ويصف غولدسميث الخوارزمية المستخدمة لتحديد المورفيمات في الكلمة على النحو الآتي: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36).
تصف مؤلفات روسية من أواخر القرن الماضي محاولاتٍ لإجراء تحليل نحوي آلي للجمل باستخدام الحسابات الإحصائية. وقد اقترح العلماء في روسيا تحديد البنية النحوية للجمل لا استنادًا إلى التحليل اللغوي، بل باستخدام المعالجة الإحصائية للنصوص. وهم يرون أن كل وحدة لغوية (كلمة، أو فئة نحوية للكلمة، أو تركيب نحوي) ترد في النص بتواتر معين. فعلى سبيل المثال، وفقًا لبيانات معجم التواتر الإنجليزي للتلازم، توجد 195 بنية مختلفة للعلاقات النحوية الخاصة بالفعل. لكن البنى العشر الأكثر شيوعًا وحدها تمثل 86% من جميع الحالات الواردة في النصوص. وتُستخدم الانتظامات الإحصائية أيضًا في تحديد البنية الخطية للجملة. فلكل فئة من الكلمات تواترٌ يحدد مدى بُعدها عن نقطة البداية. ويمكن أن يرد الفعل في اللغة الإنجليزية، باحتمال قدره 0,7، في المواقع من الثاني إلى الخامس من بداية الجملة. ويقع، باحتمال قدره 0,95، في أحد المواقع من الثاني إلى العاشر (Церкас 1979: 124).
استُخدمت لاحقًا بيانات من مدونة نصية في التحليل النحوي (Köhler 2012: 31).
لكن النتائج الجيدة لم تتحقق حتى الآن إلا في معالجة اللغة الإنجليزية. ويقول فيداس داودارافيتشيوس، الذي يعمل في مجال حوسبة النحو الليتواني: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3).
يمكن إنشاء أنظمة سريعة الأداء باستخدام الأساليب الإحصائية، ولكن بشرط واحد: لا بد من تقبّل عدد معين من الأخطاء (Link 1). لذلك قرر معهد اللغة الليتوانية ألا يعتمد على الإحصاء إلا بالقدر الأدنى الممكن، إذ يسعى إلى تحقيق أكبر قدر من الدقة والموثوقية في البيانات.
1 «من السذاجة الاعتقاد بأن الأساليب التي تُستخدم بنجاح مع اللغة الإنجليزية تناسب اللغات الأخرى أيضًا.»
Straipsniai / Articles
147
Page 5
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
1.2. الوضع في ليتوانيا
أُنجزت بالفعل أعمال كثيرة في مجال حوسبة قواعد اللغة الليتوانية. ولا يفهم معظمها إلا المتخصصون في اللغويات الحاسوبية. كما أن بعض هذه الأعمال موجّهة إلى الجمهور العام، لكنها لا تعكس سوى خصائص وسمات منفردة للكلمات والقواعد. فعلى سبيل المثال، أُنشئت في كاوناس، بجامعة فيتوتاس الكبير، قاعدة بيانات للصرفيات بالاستناد إلى مدوّنة نصية. وتفتقر هذه القاعدة إلى كثير من الصيغ اللفظية، كما تُستخدم فيها اختصارات كثيرة لا يفهمها الجميع. وتُفصل الصرفيمات بشرطة، ولا تُقدَّم أي بيانات عن نوع الصرفيم. وفي معهد الرياضيات والمعلوماتية في فيلنيوس، أُنشئت قاعدة بيانات للاشتقاق والصرفيات. ويُبيَّن فيها نوع الصرفيم، وكذلك الكلمات الأساسية والكلمات المحدِّدة (Murmulaitytė 2012: 96). وللأسف، لا تتاح قاعدة البيانات للجمهور. لذلك تقرر إنشاء نظام معلومات شامل موجّه إلى الجمهور العام، ويُفترض أن يتيح للمستخدم بيانات وافية.
يمكن ملاحظة طرفين متناقضين في عرض المعلومات النحوية الليتوانية على الإنترنت: غياب حتى الصيغ اللفظية الشائعة، وعرض كلمات زائدة لا يفهمها حتى الناطقون باللغة الأم. ويسعى نظام المعلومات الخاص بقواعد اللغة الليتوانية إلى تجنب هذين الطرفين. تُولَّد جميع الصيغ اللفظية آليًا بواسطة الحاسوب انطلاقًا من لِمّة الكلمة، وبذلك نحصل على المجموعة الكاملة لصيغ التصريف. وتُدرج جميع المشتقات والمركّبات الممكنة في قاعدة البيانات. وهكذا لا يعود هناك نقص في الصيغ اللفظية. ثم تُراجع يدويًا جميع الكلمات والصيغ اللفظية التي أنشأها الحاسوب، وتُحذف الصيغ غير الموجودة. وبذلك يُستبعَد وجود الكلمات الزائدة.
2. أعمال اللغويات الحاسوبية في ليتوانيا
يمكن التمييز في ليتوانيا بين منهجين للمعالجة الحاسوبية للغة. ففي كاوناس، تُجرى الأعمال في مركز اللغويات الحاسوبية بالاستناد إلى مدوّنة نصية. أما في فيلنيوس، في الجامعة ومعهد اللغة الليتوانية، فينطلق العمل أساسًا من خصائص اللغة الليتوانية ذاتها. ولكل من المنهجين مزايا وعيوب. وستُوضَّح هذه المسألة فيما يلي ببعض الأمثلة.
148
Acta Linguistica Lithuanica LXXVI
Page 6
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
2.1. أعمال قائمة على المدوّنات النصية
أُنشئت في جامعة فيتوتاس الكبير في كاوناس مدوّنة نصية للغة الليتوانية المعاصرة. وتُستخدم في أنواع مختلفة من المعالجة اللغوية. وفي مجال القواعد، أُنشئ معجم للصرفيمات (Rimkutė, Kazlauskienė, Rąkinis 2011)، وبعد بضع سنوات أُنشئت أيضًا قاعدة بيانات. وتُتاح للمستخدم بيانات صرفيمية وصرفية. وهذا أول مصدر متاح مجانًا تُقسَّم فيه الكلمة إلى صرفيماتها. لكن نوع الصرفيم لا يُبيَّن، وهو ما يؤدي أحيانًا إلى عرض مُربك للبنية الصرفيمية للكلمة. ويحدث ذلك عندما تُمثَّل الكلمات ذات البنى المختلفة بالطريقة نفسها. ويُعرض مثال على ذلك في الصورة 1. فالكلمتان «per-ei-ti» (العبور) و«per-ė-ti» (الحضانة) لا تختلفان ظاهريًا إلا قليلًا. وتبدو البنيتان الصرفيميتان للكلمتين متماثلتين في قاعدة بيانات الصرفيمات. غير أن الصرفيم «per» في الكلمة الأولى بادئة، بينما الصرفيم الأول نفسه «per» في الكلمة الثانية هو الجذر.
الصورة 1. تمثيل الكلمات ذات البنى الصرفيمية المختلفة بالطريقة نفسها (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)
ومن أوجه القصور الأخرى غياب حتى الصيغ اللفظية الشائعة. ولأسماء الفاعل في اللغة الليتوانية ست حالات إعرابية. ويبيّن الجدول 1 ورود الصيغ اللفظية (المفرد، المذكر) لاسم الفاعل «bėgantis / جارٍ، متدفق» في قاعدة بيانات الصرفيمات.
يتضح أن اللِمّة نفسها (حالة الرفع، المفرد) لهذه الكلمة غير موجودة. كما لا يمكن اعتبار الصيغ الأخرى المفقودة، مثل صيغة المكان (bėgančiame vandenyje / في الماء الجاري)، نادرة الورود أو غير مألوفة. ولذلك لا تتوفر سوى صيغتين لفظيتين من الحالات الإعرابية الست.
ويتحدث علماء اللغة اللاتفية، وهي اللغة البلطيقية الثانية، أيضًا عن عدم كفاية عدد الصيغ اللفظية في المدوّنة النصية (Paikens, Rituma, Pretkalniņa 2013: 272).
Straipsniai / Articles
149
Page 7
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS
الجدول 1.
ورود صيغ اسم الفاعل bēgantis / جارٍ، متدفق في قاعدة البيانات (الرابط 2)، في المفرد والمذكر
الحالة الإعرابية
الكلمة
قاعدة البيانات
حالة الرفع
bēgantis
غير موجود
حالة الجر
bēgančio
موجود
حالة المجرور
bēgančiam
غير موجود
حالة النصب
bēgantį
موجود
الحالة الآلية
bēgančiu
غير موجود
الحالة المكانية
bēgančiame
غير موجود
الإجمالي:
6
2
2.2. نقطة الانطلاق – اللغة الليتوانية
تنطلق جامعة فيلنيوس من خصائص اللغة الليتوانية. ويعرض الموقع الإلكتروني Morfologija.lt (الرابط 3) حتى جداول تصريف الكلمة. وللأسف، توجد مواضع فارغة كثيرة، وأحيانًا يشمل ذلك كامل النموذج التصريفي. كما تظهر أحيانًا كلمات مجهولة وغير مفهومة لليتواني، مثل «sutikimoji» (الرابط 4) وما شابهها. وقد أُنشئت في معهد الرياضيات وعلوم الحاسوب في فيلنيوس قاعدة بيانات للاشتقاق الصرفي والمورفيمات (Murmulaitytė 2012). وهي تتضمن معلومات قيّمة جدًا (نوع المورفيم، والكلمة الأساسية، والكلمة المحدِّدة، وغير ذلك)، لكن البيانات غير متاحة مجانًا للأسف.
3. نظام المعلومات الخاص بقواعد اللغة الليتوانية
تنتمي اللغة الليتوانية إلى مجموعة اللغات الأقل حوسبةً في أوروبا (Vaišnienė, Zabarskaitė 2012: 35). لذلك تقرر إنشاء نظام معلومات يتضمن بيانات مفصلة عن الخصائص النحوية للكلمات الليتوانية. وكثيرًا ما يؤكد العلماء الذين يدرسون اللغات البلطيقية ضرورة إنشاء مزيد من البرمجيات لفائدة شريحة واسعة من المستخدمين. وفي تعليمات مؤتمر BSNLP (معالجة اللغات الطبيعية البلطيقية-السلافية) لعامي 2015 و2017، ورد ما يلي: «submissions
150
Acta Linguistica Lithuanica LXXVI
Page 8
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
التي تصف الأنظمة المتاحة لعامة الناس، يُشجَّع عليها بشدة / ينبغي تشجيع المؤسسات التي تصف الأنظمة الموضوعة في متناول الجمهور الأوسع تشجيعًا كبيرًا» (الرابط 5).
لذلك طُرحت فكرة تصميم نظام المعلومات الخاص بقواعد اللغة الليتوانية ليستفيد منه نطاق واسع من المستخدمين، وعرض البيانات بأبسط صورة ممكنة وأكثرها وضوحًا.
وبناءً على ذلك، اختير تصميم ويب متجاوب (RW) لتلبية احتياجات المستخدمين على أفضل وجه ممكن. ومن ثم تُعرض المعلومات النحوية المتعلقة بالكلمة في مربعات (بالإنجليزية tiles) (الرابط 6). ولهذا يمكن أيضًا الوصول إلى الموقع الإلكتروني عبر الهاتف المحمول.
3.1. منهجية إنشاء قاعدة البيانات
يتمثل هدف حوسبة القواعد في إتاحة المعلومات النحوية الكاملة عن كل كلمة وجميع صيغها إلكترونيًا. وهناك طريقتان لتحقيق ذلك. تتمثل الطريقة الأولى في إنشاء وصف صوري للقواعد النحوية (يكون ذلك نوعًا من الأدوات المساعدة)، ثم جعل الحاسوب يولّد البيانات المطلوبة. أما الطريقة الثانية فتتمثل في تخزين المعلومات النحوية الكاملة عن جميع صيغ جميع الكلمات في الحاسوب، ثم استرجاعها عند الحاجة. ولا يزال النقاش قائمًا حول أي النهجين يتطلب جهدًا أكبر. وقد طُوّر في معهد الرياضيات وعلوم الحاسوب برنامج للتحليل الصرفي للغة الليتوانية (Zinkevičius 2000)، استُخدمت فيه الطريقة الأولى. لكن لم يتسنَّ تحقيق دقة تبلغ 100%: فهناك بيانات غير صحيحة، وبعض الكلمات الليتوانية لا يتعرف عليها البرنامج.
أثناء تطوير نظام المعلومات الخاص بقواعد اللغة الليتوانية، عُزف عن هذا النهج للسبب الآتي: لكي يتمكن الحاسوب من معالجة الكلمات بنفسه، ينبغي تحديد العمليات التي عليه إجراؤها لكل كلمة تحديدًا دقيقًا. ومن ثم يجب أولًا تقسيم جميع الكلمات إلى مجموعات بحيث تنطبق الانتظامات نفسها على جميع أفراد كل مجموعة، أي بحيث يمكن استخدام طريقة المعالجة نفسها. ولإدراج الكلمة في مجموعة بعينها، يجب تحديد سمات عديدة تُستخدم أساسًا لتجميع الكلمات. فعلى سبيل المثال، يُستخدم في التحليل النحوي للغة الليتوانية السمة الدلالية [زمن] لتحديد الوظيفة النحوية لحالة النصب في الأسماء. في الجملة «Visą naktį ji
Straipsniai / Articles
151
Page 9
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
skaitė šią knygą / قرأت هذا الكتاب طوال الليل.» و«Visą knygą ji perskaitė šią naktį / قرأت الكتاب كله في تلك الليلة.» لا تختلف الكلمتان knygą/كتاب وnaktį/ليل من حيث الفئات الصرفية: فكلاهما مؤنث ومفرد وفي حالة النصب، ولا يتيح للحاسوب أن يتعامل على نحو صحيح مع كلمة naktį/ليل بوصفها ظرفًا للزمان وكلمة knygą/كتاب بوصفها مفعولًا به في الجملة سوى السمة الدلالية [الزمن] التي تتصف بها كلمة naktis/ليل ولا تتصف بها كلمة knyga/كتاب. وينبغي فعل شيء مماثل في علم الصرف أيضًا. ومن الأخطاء في البرمجيات التي أُنشئت بالفعل للتحليل الصرفي للغة الليتوانية اعتبار المورفيم -ėj- لاحقةً مع جذور لا يجوز أن يتصل بها. ينبغي تحديد سمات الكلمات التي تتيح للحاسوب أن يقرر الجذور التي يمكن أن تتصل بها هذه اللاحقة -ėj-. لكن القيام بذلك بالغ التعقيد. ما السمة المشتركة، مثلًا، بين الكلمات geroė/Wohlhaben وžinovas/Kenner(Expert) وdaržovė/Obst؟ إنها جميعًا تحتوي على اللاحقة -ov-. وما الذي يميزها عن سائر الكلمات التي لا يمكن أن تُضاف فيها هذه اللاحقة إلى الجذر (فلا يمكن أن نقول *kėdovė، أي الاشتقاق باللاحقة -ov- من كلمة kėdė/كرسي)؟ وما السمة التي تدل على ذلك؟
لذلك اختير المسار الثاني عند تطوير نظام المعلومات الخاص بقواعد اللغة الليتوانية؛ أي أُعدّت قاعدة بيانات تضم معلومات نحوية مفصلة عن جميع صيغ جميع كلمات اللغة الليتوانية. ولا ينبغي هنا الانطلاق من الفئات النحوية (كما هو الحال في جميع كتب القواعد المطبوعة على الورق)، بل من الكلمة نفسها: إذ يجب إتاحة جميع المعلومات المرتبطة بكل كلمة للمستخدم.
تقرر اتخاذ الجذر نقطةَ انطلاق وتطوير برمجية تعكس البنية الكاملة لقواعد اللغة الليتوانية. واختير الجذر bėg (من الفعل bėgti/يركض) بوصفه التجربة الأولى. ثم وُلّدت جميع الاشتقاقات الممكنة باستخدام الحاسوب، وبعد ذلك شُطبت يدويًا جميع الكلمات غير الموجودة في اللغة الليتوانية. وتضم قاعدة البيانات نحو 25,000 مدخل.
3.2. السمات المميزة لـ«LIGIS»
لنظام المعلومات الخاص بقواعد اللغة الليتوانية (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (الرابط 7) سمتان أساسيتان. أولًا، يتيح للمستخدم معلومات أكثر تفصيلًا عن كلمة معينة مما تتيحه كتب القواعد المطبوعة على الورق. و
152
Acta Linguistica Lithuanica LXXVI
Page 10
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ثانيًا، يضم كلمات أكثر مما تضمّه المعاجم. تورد كتب القواعد القواعد التي تنطبق على مجموعة معينة من الكلمات، لكنها لا تذكر جميع الكلمات التي تنطبق عليها تلك القاعدة. يجمع LIGIS جميع المعلومات المرتبطة بالكلمة التي يُدخلها المستخدم ويعرضها على موقع إلكتروني. ولا تتضمن المعاجم جميع كلمات اللغة الليتوانية؛ إذ تغيب عنها اشتقاقات ومركبات كثيرة. ويضم LIGIS جميع الاشتقاقات الممكنة. ويمكن تقديم مثال للمقارنة. تضم قاعدة بيانات المورفيمات نحو 75,000 مدخل، لكنها تصف كلمات ليتوانية مختلفة. أما قاعدة بيانات LIGIS فتتألف حاليًا من 25,000 مدخل، ولا تضم إلا كلمات ذات جذر واحد: beg-. وتوجد في قاعدة بيانات المورفيمات 118 كلمة بهذا الجذر.
3.3. بنية الكلمة
بعد إدخال الكلمة، تُشرح للمستخدم بنية الكلمة: فيُعرض المدخل والكلمة الأساس، وكذلك المحدِّد في الاشتقاقات والمركبات. وإذا كانت للكلمة دلالات نحوية متعددة، يُخصّص لكل دلالة رقم مدخل مستقل. ثم تُعرض البيانات الصرفية والمورفيمية تحت هذا الرقم. ويرد في الملحق أ مثال لكلمة متعددة الدلالات.
الصيغ الأخرى. هذا هو اسم الزر (بالإنجليزية button) الموجود في مربع بنية الكلمة. يعرض موقع التحليل الصرفي للغة الروسية (الرابط 8) جميع صيغ الكلمة المُدخلة في كل مرة. أما في نظام المعلومات الخاص بقواعد اللغة الليتوانية، فقد تقرر إضافة زر يتيح للمستخدم استدعاء الصيغ الأخرى عبر رابط، لأن المستخدم لا يحتاج في كل مرة إلى جميع صيغ الكلمة.
3.4. البيانات الصرفية
تشمل المعلومات الصرفية تحديد نوع الكلمة والفئات النحوية: الحالة والجنس والعدد للأسماء؛ والشخص والزمن والصيغة للأفعال، وما إلى ذلك. وتُرقَّم الكلمات متعددة المعاني إذا كان للاسم، مثلاً، عدة صيغ إعرابية متجانسة اللفظ.
توجد في قاعدة بيانات المورفيم (الرابط 2) أيضاً بيانات صرفية عن الكلمة. لكن المعلومات تُعرض كلها باستخدام اختصارات
Straipsniai / Articles
153
Page 11
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
فقط. ويُعرض مثال على ذلك في الصورة 2. وقد يصعب على غير المتخصصين فهم هذا العدد الكبير من الاختصارات. وقد تكون المعلومات المعروضة بهذه الطريقة غير واضحة أحياناً، ولا سيما للأجانب الذين يدرسون اللغة الليتوانية أو يتعلمونها.
الصورة 2. بيانات عن الكلمة begčio، معروضة كلها باستخدام الاختصارات (الرابط 2)
لا تُستخدم الاختصارات في نظام المعلومات الخاص بقواعد اللغة الليتوانية. بل تُكتب جميع البيانات كاملةً (الملحق A).
3.5. البيانات المورفيمية
يتمثل أهم اختلاف عن قواعد البيانات التي يمكن الوصول إليها بالفعل اليوم1 في تحديد نوع كل مورفيم. وهذه هي الطريقة الوحيدة لتحقيق الوضوح في عرض مورفيمات الكلمة. وإلا، فلا يمكن مثلاً تمييز الجذر الثاني في الكلمة المركبة من اللاحقة، كما هو الحال في قاعدة بيانات المورفيمات.
كانت السمة الأولى والحاسمة هي عرض المورفيمات بألوان مختلفة. وقد خُصص لون لكل نوع من المورفيمات (الجذر، والبادئة، واللاحقة، والنهاية). وتُكتب البادئات باللون الأزرق. واستُخدم الأحمر للجذر، وتُعرض اللواحق باللون الأخضر، أما النهايات فاختير لها اللون الأسود.
إضافة إلى ذلك، تُرتَّب الكلمة المقسمة إلى مورفيمات في اتجاه عمودي، ويُكتب بجانبها ليس فقط اسم نوع كل مورفيم في الكلمة، بل تُذكر أيضاً خصائص المورفيم إن وُجدت، مثل: اشتقاقي أو تصريفي بالنسبة إلى اللاحقة؛ ومختصرة أو ضميرية ونحو ذلك بالنسبة إلى النهايات. وفي حالة النهايات المختصرة، الشائعة جداً في اللغة المحكية، تُعرض بجانبها أيضاً النهاية الكاملة. ومن أمثلة ذلك الكلمات في اللغة المحكية: šnekamoje kalboje – نهايات كاملة، šnekamoj kalboj – نهايات مختصرة. وإذا كانت للكلمة نهاية كاملة، فلا تُذكر سمة الطول، لأن معظم الكلمات لها نهايات كاملة، ومن ثم تكون هذه المعلومة زائدة. وإذا
154
Acta Linguistica Lithuanica LXXVI
Page 12
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
إذا لم تكن النهاية مُضمَّرةً، فلا تُذكر المعلومات المتعلقة بذلك أيضًا.
تُعدّ التغيرات الصوتية خاصيةً للجذر. وقد تكون تحولاتٍ في الصوامت أو في الصوائت. وثمة نوع آخر من التغيرات الصوتية يمكن ملاحظته في اللغة الليتوانية: سقوط الصوامت في صيغة الأمر. كما تُعدّ اللواصق الداخلية من التغيرات الصوتية في جذر الكلمة. ويُعدّ أصل السابقة خاصيةً لها: فقد يكون أصلها حرف جر، أو تكون مشتقةً من أداة، أو ذات أصل دولي.
عند وجود تعدد دلالي نحوي للكلمات، تُفحَص البُنى الصرفية. وإذا كانت متماثلة، يُعرض تركيب واحد فقط. أما إذا اختلفت، فتُذكر البُنى الصرفية لكل معنى من معاني الكلمة (الملحق A).
3.6. جميع صيغ الكلمة
يمكن عرض جدول التصريف لكل كلمة واردة في قاعدة البيانات بالنقر على زر «الصيغ الأخرى». وتُعرض فيه جميع البيانات الواردة في المربع الصرفي. وتُذكر في أعلى الجدول الفئات التي لا يتضمنها جدول التصريف؛ فعلى سبيل المثال، لا تُصرَّف الأسماء في اللغة الليتوانية بحسب الجنس، ولذلك يُذكر الجنس في أعلى الجدول، إلى جانب اللمّة وقسم الكلام. وللصفات واسمَي الفاعل والمفعول ثلاثة أجناس، ومن خصائص اللغة الليتوانية أن اثنين منها فقط (المذكر والمؤنث) لهما الحالات الإعرابية الست كلها. أما الجنس الثالث فله صيغة واحدة فقط، ولذلك تُذكر من دون تحديد الحالة الإعرابية (الملحق B). وبالنسبة إلى الأفعال، تُعرض جميع صيغ الأزمنة في جميع الصيغ (الملحق D).
وبذلك تصبح فئات التصريف للأفعال وفئات الإعراب للأسماء غير ضرورية، لذا لا تُقدَّم عنها أي بيانات.
أُدرجت أيضًا أمثلة على الاستعمال في جدول التصريف لبعض الكلمات. ويُستخدم لهذا الغرض التلميح السريع (بالإنجليزية tooltip). ويُورَد في الملحق C مثالٌ على الكلمة «bėgis» (النصب، المفرد من الاسم bėgis / Eisenbahnschiene, Lauf).
3.7. قاعدة البيانات
سعى القائمون على تطوير قاعدة البيانات إلى تحقيق أعلى مستوى ممكن من الجودة والموثوقية. ولذلك أُنجز جزء كبير من العمل يدويًا
Straipsniai / Articles
155
Page 13
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
لأن الحصول على معلومات موثوقة إلى أقصى حد لا يكون ممكنًا إلا بمساعدة الإنسان (Sulger 2013: 53).
أُجريت الأبحاث المتعلقة بالسوابق الليتوانية في معهد اللغة الليتوانية. وقد تبيّن أن في اللغة الليتوانية نحو 600 تركيب من السوابق (Šveikauskienė 2015: 195). ويُقصد بـ«التراكيب» مجموعات مختلفة من السوابق التي يمكن أن تسبق الجذر، مثل at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti، وما إلى ذلك. وتبيّن أن 220 تركيبًا فقط من هذه التراكيب تُستخدم مع جذور الأفعال؛ أما التراكيب الأخرى، مثل nuo-، فتُستخدم مع الأسماء: nuo-monė /الرأي. صُمّم البرنامج بحيث يربط الجذر تلقائيًا بجميع تراكيب السوابق الممكنة. بعد ذلك، يتحقق أشخاص من النتائج التي يولّدها الحاسوب، وتُدرج في قاعدة البيانات الكلمات الموجودة بالفعل في اللغة الليتوانية. وبهذا يمكن تجنب طرفي النقيض: العدد المفرط للصيغ التي يولّدها الحاسوب، وكذلك القصور في نطاق الكلمات.
تُدرج جميع المداخل المعجمية والمعلومات النحوية المتعلقة بها يدويًا في قاعدة البيانات. ولأن البرنامج الذي أُنشئ في معهد الرياضيات والمعلوماتية لا يرتكب أخطاء عند توليد صيغ الكلمات انطلاقًا من المدخل المعجمي المحدد، فقد أُسند إلى الحاسوب إنشاء مداخل بقية صيغ الكلمات تلقائيًا.
ومن الجدير بالذكر أن LIGIS يعالج أيضًا الكلمات ذات النهايات المختزلة. فكثيرًا ما ترد هذه الكلمات في اللغة المنطوقة، ولا تعالج أيٌّ من قواعد البيانات الموجودة مسبقًا هذه الصيغ للكلمات. وينبغي التأكيد كذلك على أن LIGIS يتضمن مشتقات لا ترد حتى في معجم اللغة الليتوانية المؤلف من 20 مجلدًا ولا في نسخته الإلكترونية (الرابط 9)، مثل neužbėgti/ألا يركض صعودًا بعد الآن.
تُحفظ المعلومات في قاعدة البيانات بصيغة ملائمة للحاسوب، أي باستخدام ترميز Prage Markup Language (Hana, Štepánek 2012). ولا تُعرض البيانات بهذه الصيغة على الإنترنت، إذ لا حاجة إليها لغير المتخصصين في اللغويات الحاسوبية.
إن حفظ المعلومات كلها في قاعدة بيانات يجعل LIGIS أداة مفيدة أيضًا لعلماء اللغة الذين يدرسون اللغة الليتوانية. ويمكن الحصول على أنواع شتى من المعلومات؛ فعلى سبيل المثال، يمكن البحث عن كلمات تتضمن تركيبًا محددًا من السوابق واللواحق، وغير ذلك.
156
Acta Linguistica Lithuanica LXXVI
Page 14
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
3.8. تعدد لغات الموقع الإلكتروني
يتاح الموقع الإلكتروني بسبع لغات: الليتوانية والإنجليزية والألمانية والفرنسية والإيطالية والروسية واليابانية. وقد نشأت الحاجة إلى موقع متعدد اللغات بسبب تدني جودة ترجمات Google من الليتوانية. فالترجمة الآلية من اللغة الليتوانية غير موثوقة. ولذلك تقرر جعل موقع قواعد اللغة الليتوانية متعدد اللغات، والاقتصار على النصوص التي ترجمها بشر. ومن الواضح أن الوضع ليس أفضل كثيرًا بالنسبة إلى اللغات الأخرى. ويشهد على ذلك خطاب من Lingvist مؤرخ في 8 يونيو 2017، ورد فيه طلب بأن يتولى الناطقون الأصليون ترجمة التسمية LINGUIST، وألا تُستخدم ترجمة آلية بأي حال (LinguiList 2017: 28.252).
كانت فكرتنا عند اتخاذ قرار جعل الموقع الإلكتروني متعدد اللغات كما يلي: إذا كان أجنبي، كالنرويجي مثلًا، يتعلم اللغة الليتوانية أو يدرسها، وكانت بعض الكلمات الليتوانية مألوفة له وبعضها الآخر غير مألوف، أمكنه اختيار لغة يجيدها أكثر من الليتوانية، كالألمانية مثلًا، فتغدو جميع الكلمات الليتوانية التي لا يعرفها مفهومة له. ولهذا الغرض، تقرر أيضًا حفظ الكلمة التي يُدخلها المستخدم عند التبديل بين اللغات. أي إن المستخدم لا يحتاج إلى إعادة إدخال الكلمة عندما يختار لغة أخرى.
4. خطط المستقبل
تتوفر في جامعة فيلنيوس العديد من القواميس ثنائية اللغة بصيغة رقمية. وفي معهد اللغة الليتوانية، رُقمن المعجم الكبير المؤلف من 20 مجلدًا، إلى جانب القواميس الأحادية اللغة الأخرى، مثل قواميس المترادفات والأضداد والتعابير الاصطلاحية وغيرها. ومن المخطط ربط نوعَي القواميس بنظام المعلومات الخاص بقواعد اللغة الليتوانية، وإنشاء نظير للموقع الألماني CANOONET (الرابط 10).
وبما أن نظام المعلومات الخاص بقواعد اللغة الليتوانية يحتوي على بيانات عن المورفيمات، فمن الممكن البحث عن الكلمات استنادًا إلى نموذج المورفيم. وهذا تحديدًا ما يُخطط لإنجازه مستقبلًا.
تُخصّص علامة التبويب (بالإنجليزية tab) في موقع LIGIS للنظرية، وهي قيد الإعداد حاليًا. ومن المقرر أن تتضمن هناك معارف أكاديمية معمّقة عن قواعد اللغة الليتوانية.
Straipsniai / Articles
157
Page 15
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS
في المرحلة الأولى، ينصبّ العمل على علم الصرف. وفي المرحلة الثانية، يُفترض إدخال بيانات نحوية أيضًا.
5. الاستنتاجات
1. يمكن أن يكون هذا النهج مفيدًا وملائمًا أيضًا للغات أخرى شديدة التصريف.
2. يمكن أن يكون نظام المعلومات الخاص بقواعد اللغة الليتوانية ذا فائدة كبيرة للتلاميذ والطلاب والأجانب الذين يتعلمون الليتوانية، وكذلك لعلماء اللغة الذين يدرسون اللغة الليتوانية.
3. يمكن أيضًا أن تكون البيانات المجمّعة بمثابة توثيق للغة الليتوانية.
Literaturverzeichnis
Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).
Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).
Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.
Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.
Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.
Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.
Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.
158
Acta Linguistica Lithuanica XXVII
Page 16
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.
Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.
Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].
Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.
Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.
Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.
Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.
Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.
Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.
Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).
Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).
Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.
Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.
Straipsniai / Articles
159
Page 17
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.
Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.
Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.
Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.
LINKS
Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)
Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)
Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)
Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)
Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)
Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)
Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)
Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)
Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)
Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)
160
Acta Linguistica Lithuanica LXXVI
Page 18
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG A. GRAMMATISCHE INFORMATION.
Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.
Die grammatische Information wird in der Website in Kacheln ausgelegt.
Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.
Bemerkung: Die Farben sind im Bild entfernt.
Straipsniai / Articles
161
Page 19
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
ANHANG B. FORMENtABELLE FÜR DEKLINATION.
Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.
NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta
162
Acta Linguistica Lithuanica LXXVI
Page 20
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.
Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.
Straipsniai / Articles
163
Page 21
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
ANANG D. FORMENTABELLE FÜR KONJUGATION.
Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.
164
Acta Linguistica Lithuanica LXXVII
Page 22
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete
SANTRAUKA
Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.
Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.
Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.
Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.
Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.
Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.
Straipsniai / Articles
165
Page 23
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS