scieee Open visual document viewer

„Dabartinės rašomosios lietuvių kalbos dažninis žodynas“ ir jo bazė

Laima Grumadienė

Full text

ACTA LINGUISTICA LITHUANICA XLVI (2002), 19 - 37 Dabartinės rašomosios lietuvių kalbos dažninis žodynas ir jo bazė LAIMAGRUMADIENE Lietuviy kalbos institutas There are few electronic databases for Lithuanian. The largest are the Frequency Dictionary of Modern Written Lithuanian, compiled by V. Zilinskiené and L. Grumadiené, and the Lithuanian Language Corpus of Kaunas University. The former is presented in detail here: the principles of its compilation and its possible uses are discussed, and the hitherto published work in statistical lin- guistics based on it is briefly characterised. The main problems in connection with the databases for modern Lithuanian are: (1) their insufficient differentiation (they reflect only the written, not the spo- ken language), (2) their not being optimally used, as the Lithuanian scholarly community lacks the preparation needed for working with such tools, and (3) tne fact that the efforts of scholars compiling them receive too little public recognition and are not valued as original scholarly achievements. 1. ELEKTRONINIU DUOMENŲ BAZIU SENEJIMAS IR ,NEREIKALINGUMAS*“ Kaip tik dabar lietuvių kalbotyra yra tarsi sustingusi tigro Suolyje: po daugiausia i$ struktūralizmo gauto impulso atsiradę išsiskiriantys darbai jau parašyti, tačiau ore tvyrote tvyro naujų, ne menkesnių darbų laukimas. Tam reikia ne tik kitokio požiūrio į kalbos reiškinius, bet ir naujų, dar neišbandytų metodų ir darbo priemonių. Šiais informacinių technologijų laikais naujos kalbininkų darbo priemonės neretai yra susijusios su elektroninėmis duomenų bazėmis, o šios — su lingvostatistiniais leidiniais. Atrodytų, kad savaime aišku, jog vieni nuo kitų skiriasi, nes elektroninės bazės yra dina- miškos, su jomis galima dirbti savarankiškai, o leidiniai yra statiški, jie tėra autorių pageidavimu pateiktų duomenų sankaupa. Tačiau anksčiau, o kartais ir dabar Lietuvoje tokios bazės ir leidiniai buvo ar yra tapatinami. Tai rodo atgalinių (dar vadinamų at- virkštiniais) žodynų istorija. Pirmasis lietuviškas atgalinis žodynas, amerikiečio Davido F. Robinsono (1976) parengtas 1954 m. DLKZ leidimo pagrindu, aprėpė apie 45 000 žodžių, jis gal nė neturėjo savo elektroninės bazės, bent autorius apie ją neužsimena. Be to, tais laikais tokia elektroninė bazė Lietuvoje būtų buvusi nė neprieinama, nesir patį žodyną maža kas tebuvo vartęs, kadangi jis buvo nedideliu tiražu išleistas Amerikoje. Šiauliškis Juozas Korsakas (1991) atrankos principu parengė Lietuvių kalbos inversinį 20 | LAIMA GRUMADIENĖ žodyną, aprėpusį beveik 22 000 žodžių, jo pagrindas taip pat buvo DLKŽ, bet jau 1972 m. leidimas. Dirbama buvo naudojantis savo susidarytąja elektronine duomenų baze, bet pastaroji nėra viešo naudojimo (tikriausiai dėl techninių priežasčių), taigi prieinama tik spausdintos knygos pavidalu. Vidos Žilinskienės Atgalinis dabartinės lietuvių kalbos žody- nas (1995) nėra vien DLKŽ perrašas, nes žodžiai atgaline tvarka pateikiami suskirstyti kalbos dalimis, pridedama statistinė analizė. Dabar jis iš esmės prieinamas taip pat tik spausdinta forma, nors egzistuoja ir elektroninė. Ja buvo gana nedaug pasinaudota (E. Ja- kaitienės vadovautai darbo grupei rašant lietuvių-norvegų žodyną, Daivos Murmulaitytės straipsniams (1998, 1999 ir kt.)). Beje, pastarasis žodynas ir analizė parengti naudojantis kompiuterine DLKŽ (1993 m.) versija ir jos statistine analize, o ne, kaip savo apžvalgoje nurodo Rūta Marcinkevičienė (2000a: 16), Dažninio dabartinės rašomosios lietuvių kal- bos žodyno (Grumadienė, Žilinskienė 1997; 1998) baze. Bendromis Matematikos ir in- formatikos bei Lietuvių kalbos instituto mokslininkų pastangomis parengta DLKŽ (1993 m. leidimo) elektroninė versija buvo negausiai tiražuota (1995), nes tiesiog neturėta teisės platinti leidinius elektronine forma. Dabar Lietuvių kalbos institutas vėl ėmėsi DLKŽ, bet jau 2000 m. leidimo, kompiuterizavimo (vadovas Stasys Keinys), yra gavęs finansinę para- mą iš Lietuvos mokslo fondo. Kaip žinia, 1993 m. ir 2000 m. DLKŽ leidimai maža kuo tesiskiria, todėl verčia suklusti tas faktas, kad nuspręsta ankstesne elektronine versija nesinaudoti vien dėl to, kad ji parengta jau moraliai senstelėjusioje DOS aplinkoje ir FOX- PRO bazėje: vėl imtasi kompiuterio skaitliu nuskaityti jau turimą elektroninį tekstą, reikalingą tik nedidelių pataisymų, tuo didinant darbo sąnaudas ir išlaidas. Gal net ir statistinė analizė bus atliekama iš naujo? Bet juk taip, kaip kompiuterinė 1993 m. DLKZ leidimo versija, moraliai sensta ne viena elektroninė duomenų bazė, todėl akivaizdu, kad reikia susirūpinti jų priežiūra. Ar pana- šiai, kaip DLKŽ (1993) elektroninei versijai, neatsitiks ir bendromis minėtų institutų labiau vertinami nei brangiai kainuojančios ir daug naujoviško darbo galimybių teikiančios elektroninės duomenų bazės. Lituanistai turėtų susitarti dėl tokių elektroninių duomenų bazių, kuriose naudojami specifiniai ženklai, pvz., senųjų raštų, transkribuotų tarmių tekstų, nes jau dabar tenka iš naujo perrinkti straipsnius su tokio tipo pavyzdžiais, jeigu dėl vienokių ar kitokių priežas- čių apsisprendžiama juos pateikti ne, tarkime, Lietuvių kalbos instituto leidiniams, o kuriai nors iš Vilniaus universiteto leidinių redakcijų. Dabar leidžiami tarmių žodynai, tarmių tekstai, nors ir būdami elektroninės formos, yra tik spaustuvės modernėjimo žen- klas, nes jų tekstais naudotis kaip elektronine duomenų baze neįmanoma. Taigi nesant lituanistų susitarimo dėl bendros kodavimo sistemos (pvz., UNICODE ar kitos), viešas naudojimasis elektroniniais duomenų bankais labai apsunkinamas, nekalbant jau apie tai, kad labai ribotas, o kartais ir neįmanomas tampa elektroninių technologijų, programų panaudojimas jų analizei. Negi turime jų tiek daug, kad nebepajėgiame aprėpti? Problema yra ta, kad nei kalbininkai, nei jiems talkinantys informatikos specialistai iki šiol tinkamai nesuvokia, kad duomenų bazės turi būti dinamiškos, dirbant su jomis turi būti sudarytos galimybės taikyti gausybę vis atsirandančių naujų programų ir technologijų, jos turi turėti konvertavimo į aukštesnę kompiuterinę versiją galimybę. Iki šiol dauguma Lietuvoje ku- riamų elektroninių duomenų bazių sudaromos taip, tarsi tai būtų tie patys lapeliai su DABARTINĖS KALBOS DAZNINIS ŽODYNAS IR JO BAZĖ |21 kalbos duomenimis, tik surinkti kompiuterio klaviatūra. Netrukus tie duomenys gali pri- lygti akmenyje iškaltam dantiraščiui: naujos kartos kompiuterių ekranuose bus matyti tik „vėliavėlės“ ir „kvadratukai“, kurių šifravimo, nelyginant runų skaitymo, galės imtis atei- ties kalbininkai. Iki šiol rengtos diskusijos šiuo klausimu buvo bevaisės, bet, matyt, nerei- kia prarasti vilties, vėl verta kviesti diskutuoti ir tartis. Beje, atkreiptinas dėmesys į terminus: elektroninės formos BAZĖ, BANKAS, TEKSTYNAS (KORPUSAS), ARCHYVAS. Pats madingiausias iš jų — TEKSTYNAS (KORPUSAS). Jis įvairiai apibrėžiamas, bet bendra visiems apibrėžimams yra tai, kad TEKSTYNU laikomas elektro- ninės formos tekstų rinkinys, todėl neretai beveik viskas, kas anksčiau vadinta duomenų bazėmis, imta vadinti tekstynais (juk atskirų tekstų dydis nereglamentuojamas). BANKO terminas dažniausiai siejamas su terminologija: paprastai terminų bankai nevadinami tekstynais. Dabar ARCHYVO terminas vis dažniau siejamas su laiko dimensija: elektroninė senų duomenų sankaupa gali būti vadinama archyvu arba baze. Taigi pats neutraliausias terminas išlieka ELEKTRONINĖ DUOMENŲ BAZĖ, todėl čia jis dažniausiai ir vartojamas (plg. Kennedy 1998: 3 tt.). 2. ELEKTRONINES DABARTINES LIETUVIŲ KALBOS DUOMENŲ BAZES IR LINGVOSTATISTINIAI LEIDINIAI Elektroninės formos dabartinės lietuvių kalbos duomenų bazių pertekliaus nėra. Ati- tinkamai negausu ir lingvostatistinių leidinių, šiek tiek dažniau naudojamasi tik lingvosta- tistiniais metodais. Čia išsiskiria vienintelė fonetika ir jos rezultatais besiremianti fonolo- gija. Gal taip atsitiko dėl pačios fonetikos prigimties, t. y. dėl to, kad dažnai kartojantis tiems patiems vienetams — garsams — tiesiog peršasi statistika grįstos išvados, o gal dėl subjektyvių veiksnių, t. y. dėl to, kad atsirado naujoviško mąstymo tyrėjų: visų pirma Aleksas Girdenis ir jo mokiniai, taip pat Antanas Pakerys. Šiaip ar taip, abu šie veiksniai lėmė lietuvių fonetikos bei fonologijos šuolį ir net savotišką atotrūkį nuo kitų kalbotyros šakų. Tiesa, pati fonetika yra tarpinė sritis tarp tiksliųjų mokslų ir lingvistikos. Kita pagal pasikartojančių vienetų dažnumą einanti kalbotyros sritis yra morfologija. Taigi logiška būtų manyti, kad visų pirma šioje srityje jau turėtų rastis poreikis operuoti ir lingvostatistiniais duomenimis, ir elektroninėmis duomenų bazėmis. Kol kas taip neatsi- tiko, nors tokių darbų ir darbo priemonių jau yra. Pirmąjį lingvostatistinį leksikos ir morfologijos darbą Lietuvoje, naudodamasi ESM, parengė Vida Žilinskienė (1990). Jos Lietuvių kalbos dažninis žodynas remiasi vieno iš funkcinių stilių — publicistikos — duome- nimis, jame pateikiama 300 000 žodžių pavartojimų analizė (t. y. tiek tų pačių leksemų, tiek ir skirtingų, o tokių būta 18 776, dėl visuotinai priimtų dažninių žodynų sudarymo taisyklių atsisakius toliau tirti 11 956 tikrinius žodžius). Visi ištisiniai tekstai, susidedan- tys iš atkarpų (imčių) po 1000 žodžių pavartojimų, buvo morfologiškai išanalizuoti, su- kirčiuoti, po to perforuoti ir suleisti į dabar jau moraliai pasenusias ir nebenaudojamas ESM „Minsk-22“. Elektroninių duomenų bankas yra, bet juo jau labai sunku būtų pasi- naudoti. Gaila, bet nei leksikologine, nei morfologine, nei akcentologine vienos iš dabar- tinės lietuvių kalbos atmainų — publicistikos — teksty lingvostatistine analize iki šiol tinka- mai taip ir nebuvo pasinaudota nei moksliniais, nei praktiniais, ypač vadovėlių ir mokomųjų žodynų rašymo, tikslais. Vienas iš elektroninėmis priemonėmis rengtų (dalyvauta tarp- 22 | LAIMA GRUMADIENĖ tautinėje CHILD programoje) ir nagrinėtų sinchroninės morfologijos darbų pavyzdžių galėtų būti Inetos Savickienės (1999) daktaro disertacija, skirta vaikų kalbos morfologijai. Beje, reikėtų paminėti, kad kitų lygmenų, stilistikos ir iš dalies sintaksės, kurių vienetų dažnumas daug mažesnis, lingvostatistiniais duomenimis besiremiančių darbų, visų pir- ma Audronės Bitinienés (1983, 1997, 1998 ir kt.), radosi jau prieš keliolika metų. Jau yra ir vienas kitas lingvostatistiniais duomenimis grįstas bandymas tirti dabartinę leksiką. Pastaruoju metu dažniausiai tokie darbai dirbami Vytauto Didžiojo universiteto Dabarti- nės lietuvių kalbos tekstyno (apie 60 000 000 žodžių pavartojimų) bazėje (pvz., Rūtos Marcinkevičienės (2000a; 2000b) atlikti kolokacijų tyrimai, Jurgitos Mikelionienės (2000) daktaro disertacija apie neologizmus ir kt.). Nedidelių elektroninių duomenų bazių pa- grindu rengiama vis daugiau leksikos darbų, kartais gana specifinių, pvz., Astos Ryklienės (2000) daktaro disertacija apie interneto naršytojų vartojamą leksiką ir jos darybą, bet apskritai tokių darbų nedaug, į šį procesą menkokai yra įsitraukusi studentija (išskyrus nebent Vytauto Didžiojo universitetą). Elektroninę leksikos nagrinėjimui skirtą bazę bai- gia rengti Antano Pakerio vadovaujama grupė Vilniaus pedagoginiame universitete, tuo- met gal ir čia padaugės tokio pobūdžio studentų darbų. Šiame straipsnyje apsiribojama dabartinės rašytinės lietuvių kalbos tyrimams reikalin- gų darbo priemonių aprašymu, todėl neaptariama jau pasipylusi senųjų raštų tyrimų, besi- remiančių savąja elektronine Lietuvių kalbos instituto duomenų baze, serija. Savų elektro- ninių duomenų bazių atsiradimas, be jokios abejonės, naują postūmį suteiks lietuvių dialektologijai: Lietuvių kalbos institute jau ruošiamasi steigti Tarmių centrą, kuriame elektronine forma būtų rengiami tarmių įrašai ir iš jų iššifruoti transkribuoti tekstai. Tame pačiame institute pradėti elektroninių onomastikos bei toponimikos duomenų bazės kū- rimo darbai. Jau rengiama didžiojo Lietuvių kalbos žodyno elektroninė duomenų bazė turėtų tapti tikru posūkiu lietuvių leksikografijoje, daug tikimasi ir iš Bendrinės lietuvių kalbos žodyno elektroninės duomenų bazės. Vilniaus universiteto dėstytojai, vadovaujami Evaldos Jakaitienės, yra įsitraukę į vieną iš Europos Sąjungos projektų ir rengia elektroni- nį vadinamąjį universalųjį lietuvių kalbos žodžių sąrašą, kurio pagrindu turėtų pratrūkti naujoji dvikalbių žodynų serija. Tam tikru mastu tai lyg ir konkuruojanti su Bendrinės lietuvių kalbos žodyno redakcija firma. Daugiausia Valstybinės lietuvių kalbos komisijos jėgomis, Europos Sąjungai paakinus, pradėti rengti elektroniniai vadinamieji Terminų ar Svetimžodžių portfeliai, savotiški naujausių ir labai dažnai vartojamų įvairių sričių terminų ir žodžių samplaikų sąrašai, Europos Sąjungos platinami visoms jos narėms ir kandida- tėms, kad kalbos galėtų prisitaikyti ir pasiruošti kylančiai vertimų bangai, taip pat mašini- niam vertimui. Elektroninės dabartinės sakytinės kalbos duomenų bazės, kaip ir lenkų, rengiamos radijo ir televizijos kalbos įrašų pagrindu, pradžią yra padariusi grupė Vilniaus universiteto mokslininkų (vadovė Meilutė Ramonienė). Tame pačiame universitete ruo- šiamasi kaupti elektroninę slavizmų bazę (vadovas Vytautas Kardelis), kurioje turėtų būti tiek garso įrašų, tiek ir iš jų išrinktų bei transkribuoty pavyzdžių. Kaip rodo patirtis, rezultatų galima bus tikėtis tik išmokus dirbti su tokio pobūdžio duomenimis, įgavus įgūdžių naudotis naujomis galimybėmis. Tuo tikslu reikalingos labo- ratorijos, kur šito būtų mokomasi, geriausia — nuo jaunumės. Pati elektroninių duomenų bazių prigimtis suponuoja viešumą, sutvarkytos jos turėtų būti prieinamos visiems to reikalingiems. Didžiausios lietuvių kalbos duomenų sankaupos yra Lietuvių kalbos insti- DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |23 tute, todėl modernėdamas būtent jis turėtų tapti didžiausiu elektroninių lietuvių kalbos duomenų bazių rengimo centru, viešo jų naudojimosi šaltiniu, tokio pobūdžio darbų ir idėjų traukos bei spinduliavimo centru — galbūt šį vaidmenį ir atliks Lietuvių kalbos instituto bazėje steigiamas Lituanistikos centras? Tos elektroninės duomenų bazės, kurios pateks į internetą, taps dar atviresnės. Beje, vieta, kur naudotis kompiuteriu, kai atsiranda galimybė prisijungti prie interneto, tampa nebesvarbi, svarbu tik tai, kas yra patekę į internetą. Bet tai ateities planai. Iki šiol Lietuvoje nėra įteisinta lingvostatistinių darbų leidyba elektroniniu pavidalu, nesuderintas autorinių teisių klausimas, todėl tebėra aktualūs ir popieriuje spausdinti tokie darbai. Tačiau elektroninės duomenų bazės ir lingvostatistiniai leidiniai skiriasi iš esmės, pastarieji tėra ledkalnio viršūnė. Toliau čia aptariamas konkretus klausimas: elektroninės dabartinės rašomosios lietu- vių kalbos duomenų bazės ir lingvostatistinių žodynų santykis. Pastarųjų be bazės būti negali, tačiau bazės teikiamos galimybės toli gražu nesiriboja tik žodynų leidyba. 3. ELEKTRONINĖS DABARTINĖS RAŠOMOSIOS LIETUVIŲ KALBOS DUOMENŲ BAZES IR DAZNINIAI ZODYNAI Elektronines kalbos duomenų bazes, savaime aišku, iš kitokių kalbos duomenų sankau- pų išskiria visų pirma jų elektroninė forma ir su tuo susijusių kompiuterinių technologijų naudojimo specifika. Elektroninių duomenų bazių atsiradimas suteikė visiškai naujų gali- mybių tirti kalbą, bet pačios jos nesietinos tik su šiuolaikinių elektroninių laikmenų atsi- radimu. Tai, kad skirtingomis priemonėmis gaunama iš esmės analogiškų rezultatų, visų pirma dažninių gramatinių formų ir leksemų charakteristikų, rodo, kad tarp šiuolaikinių elektroninių duomenų bazių ir daug senesnių jų analogų esama nemaža bendrumo. Pran- cūzijoje Larousse leidykla jau nuo 1956 m. žodynų rengimui pradėjo naudotis masinine (senosios kartos elektroninių skaičiuojamųjų mašinų, ESM) žodynų kartoteka (Rozenc- vejg 1986: 82). Klausimas dėl to, kaip sudarytinos šiuolaikinės elektroninės kalbos duomenų bazės, kilo, viena vertus, todėl, kad atsiradus naujoms technologijoms jau buvo įmanoma susido- roti su dideliu informacijos kiekiu, tuomet ėmė didėti teksto, skirto iliustruoti vieną žodį (t. y.jo konteksto), apimtis. Taip radosi naujų galimybių tirti žodžio, o vėliau ir didesnių kalbos vienetų, prezumpcijas, taigi ir sintaksę, semantiką. Imta žavėtis vis didesnėmis tekstų atkarpomis, galų gale pereita net prie ištisų baigtinių tekstų, kol to nesutramdė autorinių kūrėjų teisių įsigijimo kainos. Kita vertus, ko gero, Gutenbergo išradimo povei- kiui prilygo kompiuterių atsiradimas, o svarbiausia — jų plitimas neregėtu greičiu, todėl geometrine progresija išaugus įvairiapusiams Žmonių ryšiams per atstumą tiek su ta pačia kalba kalbančiais, tiek ir su kitakalbiais radosi skubus socialinis užsakymas gauti įvairia- lypės su kalba susijusios statistinės informacijos, kad būtų galima automatizuoti kuo dau- giau bendravimo procesų: kalbų mokymo, vertimo, atpažinimo, informacijos suspaudi- mo, persiuntimo ir kt. Lietuvių kalbotyra neliko nuošaly nuo šio bendro proceso, tik, žinoma, gerokai atsiliko laiko atžvilgiu. Pasaulyje per visą XX amžių, ypač antrąją jo pusę, jau tarsi buvo ruošiamasi naujam šuoliui. Visų pirma tai buvo dažniniai kalbų žodynai. Pirmieji pasirodė dar XIX a. 24 | LAIMA GRUMADIENĖ pabaigoje — XX a. pradžioje. Pats pirmasis — vokiečių kalbos, kurį stenografas E Kaedin- gas (1898), naudodamasis lapelių kartoteka, parengė net 11 000 000 žodžių pavartojimų pagrindu. Gerokai vėliau G. Vander Beke (1929) išleido tokio pobūdžio prancūzų kalbos žodyną. H. Eatonas (1934) parengė keturių kalbų — anglų, prancūzų, vokiečių ir ispanų — tūkstančio pirmųjų dažniausių žodžių lyginamąjį žodyną. Pirmąjį anglų kalbos dažninį žodyną parengė E. Thorndike’as ir L. Lorge (1944), ispanų — V. Garcia Hozas (1953). Pirmąjį dažninį rusų kalbos žodyną Amerikoje parengė H. Josselsonas (1953), o N. P. Va- caras (1966), taip pat Amerikoje, išleido tarybinio laikotarpio rusų šnekamosios kalbos dažninį žodyną, bet iš esmės jis yra parengtas tik dramaturginių kūrinių kalbos pagrin- du. E. Šteinfeldtas (Štejnfel'dt 1963) Taline išleido Puškino kalbos dažninį žodyną. Remdamasis 1 000 000 žodžių tekstynu, sudarytu iš per pusę grožinės literatūros ir vadinamosios informacinės prozos (publicistika, kanceliariniai raštai ir mokslo litera- tūra), dažninį rusų kalbos žodyną Upsaloje parengė L. Lonngrenas (1993). Pirmieji ne tik rusų, bet ir rumunų, italų kalbų dažniniai žodynai taip pat buvo parengti Amerikoje — A. Juillando, P. M. Edwardso, I. Juillando (1965), A. Juillando, V. Traversos (1973) (beje, A. Juillandas, E. Ch. Rodriguesas (1964) ten pat jau buvo parengę dar vieną ispanų kal- bos dažninį žodyną, vėliau dar tokį parengė J. R. Alameda ir E. Cuetos (1995)). Ištisa serija dažninių žodynų buvo grindžiama Prahos lingvistinio būrelio funkcinių kalbos stilių koncepcija, taip pat Boriso Larino bendrinės kalbos samprata: pirmasis, kaip ir dera, buvo čekų kalbos, iš pradžių atskirų funkcinių stilių, o vėliau ir bendrasis, kuriuos parašė Marie Tėšitelovos vadovaujamas autorių kolektyvas (J. Jelinekas, J. V. Bečka ir kt., žr. Tėšitelova 1983). Anksti suskubo latviai, kaip ir čekai, iš pradžių parengę atskirų funkcinių stilių, o vėliau dviejų dalių bendrąjį žodyną — T. Jakubaite, D. Kristovska, D. Gulevska, V. Ozola, R. Prūse, A. Rubine, N. Sika (1966-1976). Ta pačia metodika rėmėsi ir V. A. Agrajevas, V. V. Borodinas, V. M. Muratova, E. V. Tisenko, vadovaujami L. N. Zasorinos (1977), rengdami dažninį dabartinės rusų kalbos žodyną 1 000 000 žodžių pavartojimų iš keturių funkcinių stilių pagrindu. Tik vieno funkcinio stiliaus — grožinės literatūros — yra dažninis baltarusių kalbos žodynas, kurį parengė N. S. Mazei- ka ir A. J. Suprunas (Mažejka, Suprun 1976). Tik publicistikos stiliaus yra ir bulgarų kalbos dažninis žodynas (Todorova, Pančovska 2001). Pirmasis V. Žilinskienės (1990) parengtas lietuvių kalbos dažninis žodynas taip pat buvo tik vieno funkcinio stiliaus — publicistikos, dirbant buvo naudojamasi ta pačia čekų metodika, daug bendradarbiauja- ma su latviais. Laikui bėgant, nors lietuvių kalba tuo pasigirti ir negali, pasaulyje atsirado įvairiausių dažninių žodynų: atskirų autorių kalbos, funkcinių stilių, regioninių kalbų atmainų, rašy- tinės ir sakytinės kalbos ir t. t. Nefunkcionalūs tapo „apskritai m kalbos“ dazniniai žody- nai, nes jų prireikė tenkinant konkrečius tikslus, taigi žodžių atranka turėjo būti daroma iš kurios nors srities tekstų, o ne iš jų visumos. Kita vertus, dažninių žodynų sudarymo problema „pateko į kitą matavimą“, kai Amerikos biheivioristams ir pozityvistams ieš- kant vartosenos pavyzdžių radosi elektroninių tekstynų: elektroninių technologijų raida buvo sparti, todėl galima buvo ne tik kaupti, bet ir apdoroti didžiulius tekstų masyvus. Tekstynų lingvistikos pradžia laikomi 1961 m., kai Nelsonas Francis ir Henry Kučera anonsavo ir ėmėsi kurti garsųjį elektroninį rašytinės kalbos Browno tekstyną (Brown university), Johnas Sinclairas — to paties formato LOB (Lancaster-Oslo/Birmingen) teks- DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |25 tyną; dar 1959 m. Randolphas Ouirkas anonsavo rašytinės ir sakytinės kalbos tekstyną SEU (Survey of English Usage), jį tęsė Janas Svartvikas, Lundo universitete ėmęsis kurti sakytinės kalbos tekstyną LLC (London-Lund Corpus of Spoken English). Visų minėtų tekstynų apimtis tuomet buvo apie 1-1,15 mln. žodžių pavartojimų, po to atsirado daugiau panašių tekstynų (žr. Aijmer, Altenberg 1991: 1tt.). Antrosios generacijos tekstynų apim- tis skaičiuojama dešimtimis milijonų, trečiosios — jau šimtais ir tūkstančiais. Pasaulyje išlieka aktuali kompiuterių programinės įrangos ir atskirų darbo programų suderinamu- mo problema: sukaupta jau nepaprastai didelės apimties tekstynų — šimtų milijonų žodžių (tai iš esmės bibliotekos elektronine forma), bet kaip patogiai jais naudotis, kaip suskai- čiuoti elementariausius dažnius, kaip nepasimesti žodžių vandenyne? Galų gale ar kieky- bė visuomet lemia kokybę? Sudarant įvairiausius dažninius žodynus daugybę kartų įsiti- kinta, kad pusė tirtų žodžių būna pavartota vos vieną kartą. Todėl kiekvieną kartą imantis darbo reikia gerai apsvarstyti, ar išsikeltieji uždaviniai tikrai reikalauja dirbti su gausybe medžiagos, ieškant rečiausių žodžių. Kartais, kai tiriami kurie nors gramatiniai ar žodžių darybos dėsningumai, tikrai būna neracionalu itin didinti tiriamosios aibės apimtį, viską dera įvertinti ir statistiniais kriterijais, juk jie parodys tikimybę, kada atranka pakankama daryti reprezentatyvias išvadas. Ypač atkreiptinas dėmesys į tai, iš kurių tekstų sudaroma tiriamoji aibė, t. y., kaip sudaromas tiriamojo objekto modelis. Lietuvių kalbotyroje bene daugiausia klausimų šiuo atžvilgiu dabar kelia problema, ką laikyti bendrine lietuvių kalba, kokiomis dalimis joje turėtų būti atstovaujami funkciniai kalbos stiliai ar pagal kitus kriterijus išskirti kalbos sluoksniai. Štai minėtasis Vytauto Didžiojo universiteto tekstynas sudarytas pagal vienus atrankos principus, o Dabartinės rašomosios lietuvių kal- bos dažninio žodyno — pagal kitus, todėl ir rezultatai gaunami skirtingi. Reikia labai ati- džiai ir objektyviai vertinti statistinius duomenis apie, pvz., atskiras kalbos dalis, gautus iš skirtingų tekstynų. Pastebėta, kad jau parašytuose ar rašomuose tokio pobūdžio darbuose nepakankamai skiriama dėmesio tam, kokie tekstai buvo tirti, ir daromi apibendrinimai apie „dabartinę lietuvių kalbą“. Darbas su skaičiais reikalauja preciziškumo, kitaip gauna- mos klaidinančios išvados. Straipsnyje aptariamo Dabartinės rašomosios lietuvių kalbos dažninio žodyno elektroni- nis tekstynas (1,2 mln. žodžių pavartojimų) skirtinas pirmosios generacijos tekstynams (Brown, LOB tipo) — per milijoną žodžių apimties. Su šiais garsiaisiais tekstynais jį sieja dar viena bendrybė — kaip retas kuris vėlesnis pasaulyje, ir mūsiškis yra anotuotas. Kom- piuterinės technologijos analitinėms kalboms suteikė išskirtines sąlygas: specialios, bet gana plačiai paplitusios programos (ypač žinoma Oksfordo universiteto — Oxford Concor- dance Program, taip pat KWIC, KAYE, CLAN, OCE, WordCruncher ir kt.) leidžia gana nesunkiai parengti dažniausių žodžių sąrašus, pateikti jų konkordansijas (Leech 1991: 10; Utka 2000). Tokio pobūdžio programomis paprastai naudojasi ir Vytauto Didžiojo uni- versiteto Dabartinės lietuvių kalbos tekstyno tyrėjai, bet tuomet galima analizuoti tik žodžius, t.y.leksiką, nes pristingama žinių apie žodžio galą, o jis, kaip žinia, lietuvių kalbai itin svarbus. Taigi sintetinėms kalboms sudėtingiau: juk naudojantis aprašytosiomis pro- gramomis parengiami žodžių formų, o ne antraštinių žodžių sąrašai. Reikia gana daug papildomo darbo, kol žodžių formos subendravardiklinamos ir tampa tik antraštiniais žodžiais. Tokie žodžių sąrašai, turintys ir gramatinį nagrinėjimą, jau vadinami anotuotais, pasaulyje jų nėra daug, jie labai vertinami, nes reikalauja nemažų darbo sąnaudų, todėl yra 26 | LAIMA GRUMADIENĖ labai brangūs (mudvi su V. Žilinskiene esame suskaičiavusios, kad mūsų atveju vien tekstų parinkimas, surinkimas kompiuterio klaviatūra, pusiau automatizuotas morfologinis jų nagrinėjimas (vadinamasis LEMAVIMAS), koregavimas ir duomenų suleidimas į kompiute- rį iš vieno žmogaus pareikalautų šešerių darbo metų). Skaičiavimams ir tolesnėms korek- tūroms vėl reikia kelerių metų, nes bet koks netikslumas atliekant matematinius veiksmus gali virsti absurdu. Apskritai dažninių žodynų, ypač atsiradus elektroniniams tekstynams, dabar galima susidaryti įvairiai ir įvairių — nelygu ko ieškai. Svarbiausia priežastis, kodėl rengiami vis nauji dažniniai žodynai, ypač pretenduojantys vadintis, pvz., dabartinės n kalbos žodynais, yra ta, kad pagrindinė lingvostatistikos, kaip ir apskirtai statistikos, sąlyga yra ta, kad atranka turi būti reprezentatyvus tiriamosios visumos, arba aibės, modelis. Žodžiu, nuolat suabejojama, ar tirtoji atranka tikrai atspindi numatytąją visumą. Pavyzdžiui, Vytauto Didžiojo universiteto Dabartinės lietuvių kalbos tekstyno, kuris sudarytas net iš 60 mln. žodžių pavartojimų, parengtas dažninis dabartinės lietuvių kalbos žodynas būtų kitoks nei jau išleistieji L. Grumadienės ir V. Žilinskienės (1997, 1998), nes jo rezultatai atspindėtų tekstų visumą, kurių pagrindą sudaro 70% periodinių, 2696 neperiodiniy ir 4% verstinių leidinių kalba (Marcinkevičienė 2000a: 16). Išleistų minėtųjų žodynų tekstai atrinkti visai kitu pamatu: tai originalūs, ne verstiniai, keturių funkcinių kalbos stilių — publicis- tinio, kanceliarinio, beletristinio ir mokslinio — tekstai. Taip pasielgta todėl, kad lietuvių bendrinė, ypač rašomoji kalba, iki šiol tebėra formuojama, normuojama ir kodifikuojama Prahos lingvistinio būrelio idėjų dvasia (beje, atkreiptinas dėmesys į tai, kad dabar pats STILIAUS terminas įvairiausių kalbotyros mokyklų yra gana skirtingai apibrėžiamas). Lai- kytasi kitų dažninių žodynų sudarytojų principų, visų pirma čekų, rusų, latvių, kurie irgi laikėsi anksčiau čia išdėstytos bendrinės kalbos — funkcinių kalbos stilių sumos — sampra- tos, nuostatų, taikyta jų patirtis, todėl, kaip ir jų, pasirinktos 300 000 žodžių pavartojimų atrankos iš keturių funkcinių stilių, nes manyta, kad rašomajai lietuvių kalbai dar per ankstyvi Vytauto Didžiojo universiteto tekstyno (jis, beje, atsirado vėliau nei mūsiškis) sudarymo principai, artimesni amerikiečių bendrinės (ar standartinės, kaip ten įprasta) kalbos sampratai. Dabartinės rašomosios lietuvių kalbos dažninio žodyno duomenų bazėje kartais pasigendama buitinės leksikos, nes pamirštama, kad ji suformuota tik viešosios rašytinės kalbos pamatu: joje nėra nei privačių laiškų, dienoraščių, nei sienų užrašų ar pan. Tačiau ir dabar į žodyną pateko šnekamosios kalbos žodžių, tarp jų ne tik svetimybių, tarmybių, bet ir netoleruotinų bendrinėje kalboje pejoratyvinės leksikos pavyzdžių, dėl ko žodyno autorės nuolat susilaukia priekaištų. Kyla klausimas, ką laikyti grožine literatūra: tie žodžiai buvo grožinės literatūros tekstuose (Lietuvoje spausdintuose daugiau nei 100 egzempliorių tiražu redaguotuose originaliuose tekstuose), o dažninio žodyno sudarymo postulatas yra neišmesti nė vieno prasminio žodžio, jeigu jis tik nėra tikrinis, skaičius, santrumpa ar korektūros klaida. Beje, duomenys rodo, kad kiekvieno iš keturių funkcinių stilių parinkus 300 000 žodžių pavartojimų atrankas, publicistiniame stiliuje rasta 284 687 prasminių žodžių (15 313 vadinamųjų „Ššiukšlių“), dalykiniame stiliuje — 279 505 (dėl minėtų priežasčių nepatekusių į žodyną — 20 495), moksliniame — 278 311 (21 689), beletristiniame — 290 561 (9 439). Širdis neleido išmesti tikrinio žodžio Lietuva, todėl jis kaip išimtis vienintelis tikrinis pateko į žodyną (jis, pasirodo, 16-as pagal dažnumą žodis, pirmasis iš daiktavardžių, jo dažnis 5151 net 614 imčių: čia lėmė oficialiųjų dokumentų, DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |27 įstaigų ir pan. pavadinimai, kuriuose dažnai būta šio žodžio, pavartoto kilmininko links- niu). Sąlygiškai tikriniais gali būti laikomi ir patekę religinių bei kitų švenčių pavadinimai (dažnai vartojami ir kaip bendriniai), pvz., Joninės, Kūčios, Žolinė, arba pasaulio šalių pavadinimai Rytai, Vakarai, Pietūs, Šiaurė. Laikantis reprezentatyvumo principo, kiekvieno iš minėtųjų stilių buvo atrenkami tik tokie tekstai, kurie skirtini grynajam stiliui: atsisakyta paribiniais laikomų vadovėlinių tekstų, mokslinės publicistikos, siauram skaitytojų ratui skirtos publicistikos, dramos, poezijos ir pan. Publicistikos tekstus parinko Vida Žilinskienė, juos sudarė 1994-1995 m. 19-os redaguojamų centrinių dienraščių ar savaitraščių ir plačiai skaitomų žurnalų teks- tai, reprezentuojantys penkias temines grupes: 1) politika, 2) pramonė ir žemės ūkis, 3) švietimasir teisė, 4) menas ir 5) pramogos (sportas, horoskopai, orų prognozės). Daly- kinio stiliaus tekstus parinko Pranas Kniūkšta ir Danutė Vainauskienė iš 1990-1995 m. leidinių ir dokumentų pagal septynias temines grupes: 1) įstatymai ir juos lydintys doku- mentai, komentarai, 2) teisės dokumentai, 3) ekonomikos ir verslo žinynai bei dokumen- tai, 4) politologijos leidiniai, partijų dokumentai, 5) standartai ir statistikos leidiniai, 6) informacijos šaltiniai (bibliografijos, katalogai, žodynai), 7) atskirų socialinių sričių (krašto apsaugos, socialinės saugos, švietimo, kultūros ir kt. dokumentai). Mokslo stiliaus tekstai parinkti Irenos Andriukaitienės iš 1990-1995 m. Lietuvoje išleistų mokslo leidi- nių arba mokslo institucijų aprobuotų darbų pagal aštuonias temines grupes (mokslo kryptis): 1) agrariniai mokslai, 2) gamtos, 3) humanitariniai, 4) matematikos, 5) medici- nos, 6) socialiniai, 7) technikos, 8) teologijos. Beletristikos stiliaus tekstus parinko Laima Grumadienė iš 1985-1990 m. (su nedidelėmis išimtimis) Lietuvoje išleistų grožinės lite- ratūros prozos kūrinių, 0 jų šešios „teminės“ grupės suskirstytos pagal rašytojų gimtines: 1) žemaičiai, 2) rytų aukštaičiai, 3) vakarų aukštaičiai, 4) pietų aukštaičiai, 5) miestiečiai, 6) išeiviai (į tikrąją pastarųjų gimtinę nebuvo atsižvelgiama). Buvo nuspręsta, kad būtent šie tekstai gali reprezentuoti dabartinę rašomąją lietuvių kalbą. Iš jų atsitiktine tvarka (puslapiai ir eilutės parenkamos pagal atsitiktinių skaičių lentelę) būdavo pasirenkama po vieną 1000 žodžių pavartojimų apimties atkarpą, vadina- mąją imtį, ir kompiuterio klaviatūra surenkama (maždaug dviejų valandų darbas). Po to imtys buvo lemuojamos, t. y. morfologiškai nagrinėjamos Vytauto Zinkevičiaus parengta MAN (Morfologinio Analizavimo ir Normalizavimo) programa. Ją autorius pritaikė spe- cialiai šiam darbui iš savo paties seniau parengtos kompiuterinės žodžių rašybos koregavi- mo programos, 2000 m. Vytauto Didžiojo universiteto užsakymu ją šiek tiek patobulino, perkėlė į aukštesnę versiją ir pavadino lemuokliu (Zinkevičius 2000). Tas darbas atrodė maždaug taip: gaunama kompiuterinė išklotinė, iš kurios reikia „iš- mėtyti“ nereikalingas (mano pabraukta) eilutes. Pvz., jau žmogaus, ne tik mašinos apdoro- tos teksto atkarpos (...) manęs visa ši komedija (...) išklotinė tokia: 1 PAV. TEKSTO LEMAVIMO PAVYZDYS aš manyti manęs įvr vns K manęs vks dlv veik bk neįv vyr vns V 28 | LAIMA GRUMADIENĖ visas visa įvr mot vns V visa _jvr_ mot vns Į visa įvr mot vns Š visa įvr bvr šis ši įvr neįvr mot vns V komedija komedija dkt mot vns V komedija dkt mot vns Į komedija dkt mot vns Š Pirmojoje eilutėje lieka atstatytas antraštinis žodis, antrojoje (likusioje neišbrauktoje) — žodžio forma su gramatinėmis charakteristikomis. Toks darbas su 1000 žodžių užtrunka apie 4 val., bet spartesnio būdo morfologiškai išnagrinėti lietuviškus žodžius, ko gero, dar nėra. Po to ieškoma homonimų ir homoformų, imtys koreguojamos Vytauto Zinkevičiaus programa MAN-K ir suleidžiamos į kompiuterį — visa tai trunka dar valandą. Iš viso taip buvo apdorota 1 200 imčių po 1000 žodžių pavartojimų. Atlikus šį didžiulį darbą, duomenys toliau buvo apdorojami Valentino Černiausko ir Snieguolės Meškauskienės (abu iš Matematikos ir informatikos instituto) parengtomis skaičiavimo programomis: buvo suskaičiuoti įvairūs dažniai. Spaudai buvo parengti trys žodynai, du iš jų jau išleisti (Grumadienė, Žilinskienė 1997; 1998), o trečiasis išvys dienos šviesą, tikėkimės, šiemet. Pirmieji du žodynai — tai antraštinių žodžių dažniniai sąrašai. Pirmasis — mažėjančio dažnio tvarka, antrasis — abėcėlės. Į juos atitinkamai pateko 38 337 skirtingi žodžiai. Trečiasis — žodžių formų žodynas — keliskart didesnis (31 a. 1.), turintis maždaug 150 000 žodžių formų, atspindi skirtingų ir tų pačių žodžių vartojimą įvairiomis gramatinėmis formomis (jis turėtų būti pateikiamas tiek abėcėlės, tiek atgaline tvarka). Parengta dar kelios dešimtys įvairiai išdėstytų dažninių žodynų, skirtų vartoti elektronine forma: visų keturių stilių, visų kiekvieno stiliaus teminių grupių ir kt. (tiek antraštinių žodžių, tiek ir žodžių formų). Palyginus kai kuriuos statistinius duomenis, jau dabar matyti, kad lietuvių rašomojoje kalboje daugiausia vartojama skirtingų daiktavardžių — iš visų skirtingų žodžių net 45,2596 yra daiktavardžiai, gausu veiksmažodžių ir veiksmažodinių formų — 32,65%, reikšminga ir būdvardžių dalis — 15,31%, skirtingų prieveiksmių rasta 5,03%. Kitų kalbos dalių nėra nė po pusę procento (iš viso jų tėra 0,88%). Bet tai dar nereiškia, kad ir tekste jų pasiskirs- tymas būtent toks. Kitas rodiklis — tų pačių žodžių dažnumo tekste — rodo, kad pagrindi- nių kalbos dalių ir prieveiksmio procentas gerokai sumažėja tarnybinių kalbos dalių ir įvardžio sąskaita, nes tekstuose pastarieji sudaro jau daugiau nei ketvirtadalį — 26,71%. Atkreiptinas dėmesys ne tik į dažnumo rodiklį, bet ir į žodžio ar žodžio formos pasirody- mo atskirose imtyse skaičių: taip galima nustatyti, ar kurio nors žodžio dažnį yra lėmęs atsitiktinai patekęs vienas tekstas su daug kartų jame pasikartojančiu žodžiu, ar vis dėlto jo dažnumas nėra atsitiktinis, nes jo dispersija įvairiose imtyse tolygi. DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |29 Leksikos įvairovė vertintina iteracijos koeficientu (žodžių pavartojimų ir antraštinių žodžių santykiu), kuris minimame žodyne lygus 20,06 (kuo šis dydis mažesnis, tuo, vadi- nasi, daugiau rasta skirtingų žodžių). Iš suskaičiuotų, bet nepublikuotų kiekvieno iš ketu- rių funkcinių stilių antraštinių žodžių ir žodžių formų žodynų (apie kai kuriuos juose pastebėtus lingvostatistinius ypatumus jau rašė V. Žilinskienė (1998, 2001, spausd. ir kt.)) aiškėja, kad, pvz., grožinės literatūros leksika net dukart įvairesnė už dalykinio stiliaus tekstų leksiką (iteracijos koeficientai atitinkamai lygūs 9,53 ir 20,78). Įdomiau- sia Cia tai, kad visų keturių stilių kartu paėmus iteracijos koeficientas gana nedaug tesiski- ria nuo dalykinio stiliaus, bet labai daug — nuo grožinės literatūros stiliaus (publicistikos lygus 10,51, mokslo — 12,63). Šie rodikliai yra svarus argumentas apsisprendžiant dėl, pvz., bendrinės kalbos žodyno sudarymo principų: kokiomis dalimis turėtų būti atsto- vaujami funkciniai kalbos stiliai; ar iš viso dar tęstina praktika, kai bendrinė kalba siejama su funkciniais stiliais; jeigu taip, būtina atsižvelgti į statistinius funkcinių stilių rodiklius ir kt. Įdomių duomenų gauta sugretinus Vytauto Didžiojo universiteto tekstyno pagrindu sudarytą dažniausių žodžių sąrašą (jame žodžiai fiksuoti ir skaičiuoti tomis formomis, kuriomis jie pasitaiko tekste, neatstatinėjant, priešingai nei Dabartinės rašomosios lietuvių kalbos dažniniame žodyne, antraštinių jų lyčių). Palyginus 50 dažniausių nekaitomų žo- džių ir kaitomų žodžių formų 60 mln. žodžių lietuvių tekstyne (Utka 2000: 278) su Dažninio žodyno (Grumadienė, Žilinskienė 1997: 3) pirmaisiais 50 antraštinių žodžių, galima akivaizdžiai įsitikinti, kad jie iš esmės sutampa. Tik pirmajame dažniniame sąraše yra šiek tiek mažiau skirtingų žodžių, nes ten minimos įvairios to paties žodžio formos, pvz., buvo, būti; jis, jo, jų, jos, jie, 0 antrajame sąraše, t. y. žodyne, jas atitinkamai reprezen- tuoja būti ir jis. Į Dažninį žodyną, laikantis tokio tipo žodynų sudarymo principų, nepateko santrumpos, bet vis tiek iš minėtame dažniausių žodžių sąraše buvusių santrumpų m, d, a — atitinkamai metai, diena, amžius — palyginimo su Dažninio žodyno duomenimis aiškė- ja, kad pirmieji du žodžiai dažni ir žodyne —30-as ir 57-as pagal dažnį, t. y. rangą (to paties rango žodžiais laikomi vienodą dažnumą turintys žodžiai), o amžius patenka tik į 3-iąjį šimtą. Beje, santrumpa ir visas šis žodis gana dažnai vartojami ir šiek tiek skirtingomis reikšmėmis. Kaip patvirtinta daugelio sintetinių kalbų dažninių žodynų sudarymo prakti- kos, patys dažniausi Dabartinės rašomosios lietuvių kalbos dažniniame žodyne yra kai kurie jungtukai (ir; kad, o, kaip, ar; bet, bei, kai ir kt.), prielinksniai (į, iš, su, nuo, apie, po, už, dėl, per; prie ir kt.), įvardžiai (jis, tas, aš, kuris, šis, visas, kitas, savas, toks, kas, tu ir kt.), dalelytės (ir, ne, tik ir kt.), populiariausi veiksmažodžiai yra būti, galėti, turėti, nebūti, reikėti, žinoti, nustatyti ir kt., o daiktavardžiai — Lietuva, darbas, žmogus, metai ir kt. Iš skaitvardžių dažniausi vienas, pirmas, du, o iš būdvardžių, patenkančių į pirmąjį dažniau- sių žodžių šimtą — didelis, naujas, aukštas, įvairus, svarbus, pagrindinis. Beje, ir analitinių kalbų duomenys rodo, kad, pvz., anglų kalbos tekstuose įvardis I, jungtukas and ir artikelis the sudaro 1096 tekstų (Hillerich www: eduplace.com). Svarbus ir tarptautinių žodžių klausimas — kiek jų ir kuriuos reikėtų dėti į bendrinės kalbos žodyną? Įsigilinus gali duoti naudos ir žinojimas to, kad, pvz., Dabartinės rašomo- sios lietuvių kalbos dažninio žodyno (1998, XXXIV-XXXVI) antraštinių žodžių sąraše rasta 27,52% tarptautinių žodžių ir kad tekstuose jie užėmė 13,34% vietos, taip pat gali būti naudingi patys tų žodžių sąrašai. 30 | LAIMA GRUMADIENĖ Rengiantis rašyti naują lietuvių kalbos gramatiką, svarbu žinoti ir žodžių formų statisti- ką: kurio tipo žodžiai kaip kaitomi, kodėl ir kurių žodžių gramatinių formų įvairovė didelė, o kitų — ne. Tokių duomenų gausu rengiamame spaudai žodžių formų žodyne. V. Žilinskienė (2001) vien apie publicistikos stilių jau paskelbė įdomių duomenų. Pasirodo, kad trys daiktavardžių linksniai sudaro 82,29% visų daiktavardžių pavartojimo atvejų (kilm. — 38,91%, vard. — 26,62%, gal. — 16,76%, o tai, kad, pvz., naud. vartojamas tik 3,88% atvejų, gal jau rodo analitiškėjimo tendencijas?). Būdvardžiai, beje, dažniausiai vartojami vard. linksniu — 36,93% atvejų. Išsiaiškinta, kad vyrauja daiktavardžių vienaskai- ta —68,86% visų pavartojimy. Publicistikos tekstuose palyginti nedaug terasta padalyvių (2,34%) ir pusdalyvių (1,84%), o dalyvių — net 24,46%, bendratis vartota 15,85% atvejų. Įdomių ir neįprastų rezultatų, ypač pedagogams ir specialistams, rengiantiems vadovė- lius, mokymo programas, žodynus, gauta pažvelgus į V. Žilinskienės ir L. Grumadienės (1998; 1999a; 1999b) parengtus ir išleistus tris Valstybinės kalbos mokėjimo kvalifikaci- nių kategorijų lietuvių-rusų kalbų minimaliuosius žodynus, taip pat į kitus šešis parengtus, bet dar neišleistus analogiškus lietuviy-angly kalbų ir lietuvių-lenkų kalbų žodynus. Čia dar kartą atkreiptinas dėmesys į tai, kad imtys rinktos iš lietuvių rašomosios kalbos tekstų, taigi šnekamosios kalbos žodžių čia galima ir pasigesti. Šie žodynėliai yra orientuoti į rašomosios kalbos mokymąsi, nes valstybinės kalbos mokėjimo kvalifikaciniai reikalavi- mai yra susiję su valstybinės kalbos vartojimu viešai, visų pirma oficialiomis situacijomis, ypačvalstybinėse įstaigose, todėl čia ir reikalingesnė yra ne buitinė, o neutralioji ir dalyki- nė leksika: reikalaujama sugebėti perskaityti ir parašyti dalykinius raštus, suprasti Zi- niasklaidos tekstus. Ateityje rengtini ir šnekamosios kalbos minimalieji žodynai. Lietuvo- je yra išleistas Vytauto Šerno (1994) vadovėlis Kaip racionaliau mokytis kalbų, kuriame yra ir minimalusis dvikalbis anglų-lietuvių kalbų žodynas: išverstas garsusis Ch. K. Ogde- no 1942 m. publikuotas Basic English, sudarytas iš 850 žodžių (jį, beje, galima rasti ir Encyclopaedia Britannica 3-iajame tome). Bėgant laikui vieni žodžiai sensta, kiti atsiran- da, todėl tų 850 žodžių sąrašas gali atitinkamai kisti. Nustatant valstybinės lietuvių kalbos mokėjimo trijų kvalifikacinių kategorijų reikalavimus, buvo atsižvelgta ir į Da- bartinės rašomosios lietuvių kalbos dažninio žodyno autorių nuomonę dėl minimaliųjų žodynų apimties: apsispręsta, kad I-osios kategorijos reikalavimus atitiktų apie 800 žo- džių, II-osios — apie 1200, III-iosios — apie 2500 žodžių mokėjimas. Remtasi tiek visuoti- nai priimtu Ogdeno postulatu dėl 850 žodžių, tiek savosios ir kitų kalbų dažnumų tyrimų rezultatais, tiek kitų valstybių analogiška praktika. Tai, kad šie skaičiavimai nėra iš piršto laužti, matyti ir iš priede pateikiamų trijų lentelių, kur aiškiai matyti, kokią dalį tekstų sudaro atitinkamai 800, 1200 ir 2500 dažniausių rašomosios lietuvių kalbos žodžių: 56,66%, 65,70% ir 78,04%. Jau tampa jprasta, kad dabar visi didieji Zodynai pateikia nuorodas apie dazniausius kalbos žodžius. Pvz., anglų kalbos COBUILD žodyne (www.antimoon.com) 680 daz- niausiy žodžių atitinkamai žymimi 1-4 rombeliais. Longmano anglų kalbos žodyne 3000 dažniausių žodžių pažymėti atitinkamai S1, S2 (S — spoken English), W1, W2 (W — written English). Macmillano anglų kalbos žodyne dažniausi žodžiai spausdinami raudona spal- va, kitų dažnumas žymimas atitinkamai 1—3 žvaigždutėmis. Artėja metas, kai, matyt, teks ir lietuvių leksikografijai tuo užsiimti. DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |31 4. IŠVADOS Elektroninių dabartinės lietuvių kalbos duomenų bazių nėra daug, didžiausios iš jų yra V. Žilinskienės ir L. Grumadienės Dabartinės rašomosios lietuvių kalbos dažninio žodyno (morfologiškai anotuota ir statistiškai apdorota, 1 200 000 žodžių pavartojimų) ir Vytauto Didžiojo universiteto Lietuvių kalbos tekstynas (neanotuotas, apie 60 000 000 žodžių pavartojimų). Lituanistikoje dar nėra tinkamos praktikos naudotis tiek elektroninėmis dabartinės kalbos duomenų bazėmis, tiek lingvostatistiniais leidiniais. Visų pirma, per mažai pratinama taip dirbti Lietuvos aukštosiose mokyklose, bet yra ir kita medalio pusė — per maža viešai prieinamų elektroninių lietuvių kalbos duomenų bazių. Viena iš atsili- kimo priežasčių yra ir ta, kad elektroninės duomenų bazės nėra įteisinamos kaip autorinis darbas. Viena iš aktualiausių problemų Lietuvoje, susijusių su elektroninėmis duomenų bazėmis, yra jų sudarymo koncepcijos silpnumas: dažnai elektroninėmis duomenų bazė- mis numatoma naudotis tik kaip elektronine forma pateiktu tekstu, nenumatant kompiu- terinių technologijų pritaikymo duomenims apdoroti. 32 | LAIMA GRUMADIENĖ 1 LENTELĖ: VALST.LIETUVIŲ KALBOS MOKĖJIMO I KVALIFIKACINĖS KALBOS DALIŲ IR BENDRASIS ŽODŽIŲ DAŽNUMAS Rangas Dažnis dkt vks bdv prv ivr 1-10 39582-7001 - 21262 - - 52221 14,38% 35,31% 11-20 6877-4274 - 10582 - - 21221 19,96% 40,02% 21-30 4113-2989 10763 - - - 11048 28,9596 29,7196 31-40 2950-2637 - - - 5619 - 20,35% 41-50 2631-2053 —- 6843 2053 4782 2113 30,5096 9,15% 21,32% 9.42% 51-60 2015-1781 9284 - - 3867 - 45,22% 18,83% 61-70 1754-1557 10014 1739 = = 1593 60,4196 10,4996 9,6296 71-80 1548-1461 6036 3046 1507 3009 - 40,04% 20,20% 10,00% 19,96% 81-90 1460-1373 1422 2828 1373 2888 2792 10,03% 19,94% 9,68% 20,36% 19,68% 91-100 1351-1148 7421 1305 - 1232 1159 54,63% 9,61% 9,07% 8,53% 101-150 1442-905 23551 12523 7419 3116 943 43,03% 22.88% 13,55% 5,69% 1,72% 151-200 900-706 22744 10742 870 4203 1583 52,48% 24,79% 2,01% 9,70% 3,65% 201-250 702-564 14059 6315 4906 3178 3148 42,09% 18,90% 14,69% 9,51% 9,42% 251-300 562-462 17325 7962 1451 3605 1041 49,59% 22,79% 4,15% 10,32% 2,98% DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |33 KATEGORIJOS MINIMALIOJO ŽODYNO LINGVOSTATISTINĖ ANALIZĖ: skt prl jng dll ist; jst Suma - 25050 49371 - - 147904 16,93% 33,38% 12,33% — - 16902 4320 - 53025 31,87% 8,15% 4,42% - 7156 4102 4113 - 37182 19,25% 11,03% 11,06% 3,10% 2641 8282 8281 2791 - 27614 9,56% 29,99% 29,99% 10,11% 2,30% 2116 4526 - - - 22433 9,43% 20,18% 1,87% - 3589 3793 = - 20533 17,48% 18,47% 1,71% 1557 1673 - = - 16576 9,39% 10,09% 1,38% - - 1478 - - 15076 9,80% 1,26% - 1427 - 1454 J 14184 10,06% 10,25% 1,18% - - 1237 1230 - 13584 9,11% 9,05% 1,13% 1007 2164 2986 1028 - 54737 1,84% 3,95% 5,46% 1,88% 4.56% 738 - 900 1557 - 43337 1,70% 2,08% 3,59% 3,61% — - 574 1225 - 33405 1,72% 3,67% 2,78% - 1035 512 2007 - 34938 2,96% 1,47% 5.74% 291% 34 | LAIMA GRUMADIENĖ Rangas Dažnis dkt vks bdv prv įvr 301-350 460-374 19646 10424 2420 2073 393 54,28% 28,80% 6,69% 5,73% 1,09% 351-400 373-313 18504 7550 3381 1347 654 53,04% 21,64% 9,69% 3,86% 1,87% 401-450 312-260 19156 7865 3976 522 304 57,20% 23,49% 11,87% 1,56% 0,91% 451-500 259-205 21718 9987 4806 2486 471 53,17% 24,45% 11,76% 6,08% 1,15% Valstybinės lietuvių kalbos I-osios kvalifikacinės kategorijos minimalusis žodynas (apie 800 2 LENTELĖ: VALST. LIETUVIŲ KALBOS MOKĖJIMO II KVALIFIKACINĖS KALBOS DALIŲ IR BENDRASIS ŽODŽIŲ DAŽNUMAS Rangas Dažnis dkt vks bdv prv jvr 501-550 204-155 22494 13153 7023 2481 525 46,97% 27,46% 14,66% 5,18% 1,10% 551-600 154-106 30834 17197 6221 4419 151 50,91% 28,39% 10,27% 7,29% 0,25% Valstybinės lietuvių kalbos II-osios kvalifikacinės kategorijos minimalusis žodynas (apie 1200 3 LENTELĖ: VALST. LIETUVIŲ KALBOS MOKĖJIMO III KVALIFIKACINĖS KALBOS DALIŲ IR BENDRASIS ŽODŽIŲ DAŽNUMAS Rangas Dažnis dkt vks bdv prv pvr 601-650 105-56 45751 20328 12145 5822 433 52,31% 23,25% 13,88% 6,66% 0,50% Valstybinės lietuvių kalbos III-osios kvalifikacinės kategorijos minimalusis žodynas (apie 2500 DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ | 35 skt prl jng dll ist; jst Suma 426 - & 812 — 36194 1,1796 2,2496 3,02% - — 1407 2043 — 34886 4,03% 5,87% 291% 276 — 272 1118 — 33489 0,82% 0,81% 3,34% 2,79% 255 224 210 700 3 40857 0,6296 0,55% 0,51% 1,71% 3,40% žodžių) dengia 56,66% teksto (atranka iš 1,2 min. žodžių pavartojimų). 56,66% KATEGORIJOS MINIMALIOJO ZODYNO LINGVOSTATISTINE ANALIZE: skt prl jng dll ist; jst Suma 530 342 177 795 371 47891 1,11% 0,71% 0,37% 1,66% 0,78% 3,99% 520 275 132 713 109 60571 0,86% 0,45% 0,22% 1,18% 0,18% 5,05% žodžių) dengia 65,70% teksto (atranka iš 1,2 mln. žodžių pavartojimų). 9,0496 Iš viso: (=65,7096) KATEGORIJOS MINIMALIOJO ŽODYNO LINGVOSTATISTINĖ ANALIZĖ: skt prl jng dll ist; jst Suma 460 341 372 1697 102 87446 0,52% 0,40% 0,42% 1,94% 0,12% 7,29% žodžių) dengia 78,04% teksto (atranka iš 1,2 mln. žodžių pavartojimų). 7,2996 Iš viso: (=78,04%) 36 | LAIMA GRUMADIENĖ LITERATŪRA AUMER, K., ALTENBERG, B. 1991: Introduction. Aijmer, K., Altenberg, B., eds., English Corpus Linguistics. Studies in Honour of Jan Svartvik, London-New York: Longman. ALAMEDA, J. R., CuEros, E 1995: Diccionario de frecuencias de las unidades lingiiisticas del castel- lano, Universidad de Oviedo. BITINIENE, A. 1983: Mokslinis stilius, Vilnius: Aukštojo ir specialiojo mokslo ministerija. BITINIENĖ, A. 1997: Funkciniai stiliai: sakinio ilgis ir struktūra, Vilnius: Vilniaus pedagoginio univer- siteto leidykla. BITINIENĖ, A. 1998: Administracinis stilius ir jo sakinio ilgis. Kalbotyra 47 (1), 17—28. EATON, H. 1934: Comparative freguency list on the first thousand words in English, French, German and Spanish. Coleman, A., ed., Experiments and Studies in Modern Language Teaching, Chicago. Garcia Hoz, V. 1953: Vocabulario usual, comun y fundamental. Madrid: Consejo Superior de Investigaciones Cientificas — Instituto „San José de Calasanz®. GRUMADIENE, L., ZILINSKIENE, V. 1997: Dabartinés rasomosios lietuviy kalbos dazninis Zodynas (mažėjančio dažnio tvarka), Vilnius: Matematikos ir informatikos institutas, Lietuvių kalbos institutas. GRUMADIENĖ, L., ŽILINSKIENĖ, V. 1998: Dabartinės rašomosios lietuvių kalbos dažninis žodynas (abėcėlės tvarka), Vilnius: Matematikos ir informatikos institutas, Lietuvių kalbos institutas. HiLLERICH, R., www: eduplace. com: High-frequency words and vocabulary. JAKUBAITE, T. e.a. 1966-1976: Latviešu valodas biezuma vardnica, 1.4. séjumi, Riga: Zinatne. JosseLsoN, H. 1953: The Russian Word Count and Frequency Analysis of Grammatical Categories of Standard Literary Russian, Detroit: Periodical Service Co. JuiLLAND, A., RODRIGUES, E. Ch. 1964: Frequency Dictionary of Spanish words, The Hague: Mouton. JUILLAND, A., EDWARDS, P. M., JUILLAND, I. 1965: Frequency Dictionary of Roumanian Words, The Hague: Mouton. JUILLAND, A., TRAVERSA, V. 1973: Frequency Dictionary of Italian Words, The Hague: Mouton. KAEDING, E. 1898: Haufigkeitsworterbuch der deutschen Sprache, Steigliz bei Berlin (Selbstverlag). KEINYS, S., red. 1993: Dabartinės lietuvių kalbos žodynas, Vilnius: Mokslo ir enciklopedijų leidykla. KEINYS, S., red. 2000: Dabartinės lietuvių kalbos žodynas, Vilnius: Mokslo ir enciklopedijų leidykla. KENNEDY, G. 1998: An Introduction to Corpus Linguistics, London-New York: Longman. KORSAKAS, J. 1991: Lietuvių kalbos inversinis žodynas, Kaunas: Šviesa. KRUOPAS, J., red. 1954: Dabartinės lietuvių kalbos žodynas, Vilnius: Valstybinė politinės ir mokslinės literatūros leidykla. KRUOPAS, J., red., 1972: Dabartinės lietuvių kalbos žodynas, Vilnius: Mintis. LEECH, G. 1991: The state of the art in corpus linguistics, Aijmer, K., Altenberg, B., eds., English Corpus Linguistics. Studies in Honour of Jan Svartvik, London-New York: Longman. LONNGREN, L. 1993: Yacmomnoiū crosape cospemennozo pycckozo aswika. Uppsala. (Acta Universi- tatis Upsaliensis, Studia Slavica Upsaliensia 32.) MARCINKEVICIENE, R. 2000a: Tekstyny lingvistika (teorija ir praktika). Darbai ir dienos 24, 7-64. MARCINKEVICIENE, R. 2000b: Patterns of word usage in corpus linguistics. Kalbotyra 49 (3), 71-80. MAZEJKA, N. S. (Max3iika, H. C.), SUPRUN, A. Ja. 1976: Yacmomnoi: cnoynix Genapyckaii Moet (macmaykas nposza), Minck: Beinasenrsa BJ1V ims V. Jlenina. MIKELIONIENE, J. 2000: Naujoji lietuviy kalbos leksika (1991-1996 m. kompiuterinio periodikos tekstyno pagrindu). Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas. MURMULAITYTĖ, D. 1998: Žodžių sąsajos žymėjimas „Dabartinės lietuvių kalbos žodyne“ (santrum- pos žr. vartojimas). Lietuvių kalbotyros klausimai 39, 240-247. MURMULAITYTĖ, D. 1999: „Bendrinės lietuvių kalbos žodyno“ kompiuterizavimo klausimu. Lituanis- tica 2 (38), 92-98. RYKLIENĖ, A. 2000: Bendravimas internetu: kalbėjimas rašant. Darbai ir dienos 24, 99-107. DABARTINĖS KALBOS DAŽNINIS ŽODYNAS IR JO BAZĖ |37 ROBINSON, D. E. 1976: Lithuanian Reverse Dictionary, Michigan: Slavica Publishers Inc. ROZENCVEIG, V. Ju. 1986: Onsir co3nanus HaUHOHANBLHBIX JIEKCHKOTpaOHUeCKHX CJIyxO 3a pybexom. Kapaynos IO. H., pea., Mauunnor pono pycckozo asvika: udeu u cymcoenus, Mocksa: Hayka, 75-83. SAVICKIENE, I. 1999: Lietuvio vaiko daiktavardžio morfologija. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas. ŠERNAS, V. 1994: Kaip racionaliau mokytis kalbų (Basic English), Vilnius: Žodynas. ŠTEJNFEL'DT, E. A. 1963: Yacmomnbtū crosaps COBPEMEHHO20 PYCCKO20 iumepamypno2o A3bIKA, Tannun. TESITELOVA, M. e.a. 1983: Frekvenéni slovnik češtiny vécného stylu, Praha: Academia-Nakladatelstvi Ceskoslovenské Akademie Véd. THORNDIKE, E., LORGE, L. 1944: A Teacher's Word Book of the Twenty Thousand Words Found Most Frequently and Widely in General Reading for Children and Young People, New York: Appleton— Century Crofts. TopoRova, E., PANCOVSKA, R. 2001: Yecmomen peunux na 6wrzapckama nybauyucmuxa (1944— 1989), Codus: Ilencodr. UTkA, A. 2000: Kalbinė įranga ir jos galimybės. Darbai ir dienos 24, 275-285. VACAR, N. P. 1966: A Word Count of Spoken Russian. The Soviet Usage, Ohio: Ohio State University Press. VANDER BEKE, G. 1929: French Word Book, New York: Macmillan. ZASORINA, L. N., red., 1977: Yacmomuwiit caoeape pycckozo aswika, Mocksa: UsnatensctBo «Pycck- HH A3BIKY. ZINKEVICIUS, V. 2000: Lemuoklis — morfologinei analizei. Darbai ir dienos 24, 246-273. ZILINSKIENE, V. 1990: Lietuvių kalbos dazninis žodynas, Vilnius: Mokslas. ŽILINSKIENĖ, V. 1995: Atgalinis dabartinės lietuvių kalbos žodynas, Vilnius: Matematikos ir informa- tikos institutas. ŽILINSKIENĖ, V. 1998: Dažninis dabartinės rašomosios lietuvių kalbos žodynas (pirmieji tyrimo rezul- tatai). Lietuvių kalbotyros klausimai 39, 219-227. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1998: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuvių-rusų kalbų minimalusis žodynas (pirmoji kvalifikacinė kategorija), Kaunas: Šviesa. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1999a: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuvių-rusų kalbų minimalusis žodynas (antroji kvalifikacinė kategorija), Vilnius: UAB „Nacionalinių tyrimų centro“ leidykla. ŽILINSKIENĖ, V., GRUMADIENĖ, L. 1999b: Valstybinės kalbos mokėjimo kvalifikacinių kategorijų lietuviy-rusy kalbų minimalusis žodynas (trečioji kvalifikacinė kategorija), Vilnius: UAB „Nacionalinių tyrimų centro“ leidykla. ŽILINSKIENĖ, V. 2001: Lietuvių ir latvių kalbų publicistikos leksikos ir morfologijos raida statistiniu požiūriu. Linguistica Lettica 9, 155-168. ZILINSKIENE, V. spausd.: Lietuviy kalbos dalykinio stiliaus morfologijos statistinés charakteristikos ir ju lyginimas su atitinkamomis publicistikos charakteristikomis. Lituanistica. Laima Grumadiené Gauta 2002 04 19 Lietuvių kalbos institutas P. Vileišio g. 5, LT-2055 Vilnius, Lietuva laigruma(dtakas.lt