Full text
4 Jana Levická Tarptautinio doi.org naudojimas ir empirinis Adjectival Suffixes in Slovak Revisited produktyvumas (10.35321/term28-03). Tarptautinių būdvardžių sufiksų vartojimas ir empirinis produktyvumas slovakų kalboje Jana Levická Ľ. Štúr Lingvistikos institutas, Slovakijos mokslų akademija ORCID id: https://orcid.org/0000-0001-6027-604X Abstrakcija Šis straipsnis yra ankstesnių tyrimų, kuriuose daugiausia dėmesio buvo skiriama penkių lotynų sufiksų vartojimui ir produktyvumui slovakų kalboje, tęsinys. Analizė orientuota į realią ir potencialią produktyvumą dviejų etapų palyginime: 1) žetonai ir lemos, atsirandančios visuotiniame subalansuotame korpuse, palyginti su visuotiniu specializuotų ir akademinių tekstų korpusu; 2) visuotinis specializuotų ir akademinių tekstų korpusas, palyginti su specializuotais medicinos, teisės, ekonomikos ir religinių tekstų (sub) korpusais. Pirmasis tęsinys buvo nustatyti, ar mažo dažnio lemos apima naujus monetus, kurie gali prisidėti prie produktyvumo svyravimų įvairiose srityse. Antrasis tikslas buvo nustatyti ir įgyvendinti tinkamą statistinį rodiklį, kuris leistų lyginti skirtingo dydžio korpusų produktyvumo duomenis. Raktiniai žodžiai: produktyvumas, būdvardis, sufiksas, bendras korpusas, specializuotas korpusas, hapax legomena, mažo dažnio lemma, didelis retų įvykių pasiskirstymo skaičius. ANOTACIJA Šiame straipsnyje aprašomas tyrimas yra ankstesnio tyrimo, nagrinėjančio penkių lotynų kalbos priesagų vartojimą ir produktyvumą slovakų kalboje, tęsinys. Tyrime siekiama nustatyti realų ir potencialų produktyvumą atliekant palyginimą dviem etapais: 1) žodžių formos (angl. tokens) ir antraštinių žodžių formos, arba lemos (angl. lemmas), esančios bendrajame subalansuotame tekstyne, lyginamos su esančiomis bendrajame specialiųjų ir akademinių tekstų tekstyne; 2) lyginamos bendrajame specialiųjų ir akademinių tekstų tekstyne ir specialiajame medicininių, teisinių, ekonominių ir religinių tekstų patekstynyje esančios žodžių formos ir lemos. Pagrindinis tęstinio tyrimo tikslas nustatyti, ar tarp retai vartojamų lemų yra naujažodžių, kurie galėtų prisidėti prie produktyvumo skirtumų skirtingose srityse. Tyrimu taip pat siekiama nustatyti ir pritaikyti statistinę priemonę, kuri leistų palyginti tekstyno medžiagos produktyvumą skirtingos apimties tekstynuose. ESMINIAI ŽODŽIAI: produktyvumas, būdvardis, priesaga, bendrasis tekstynas, specialusis tekstynas, hapaksas, retai vartojama lema, didelis retų įvykių pasiskirstymas
5 5Terminologija | 2021 | 28 1. INTRODUCTION Mūsų tyrimų motyvacija atsirado dėl susidomėjimo terminologine sinonimija ir, pagal šią platesnę temą, sinoniminiais pavadinimais pavadinimais kaip daugiažodžių terminų sudedamosiomis dalimis. Terminologijos tyrimuose dėmesys skiriamas būdvardžiams nėra naujovė. Išsamų analizę, skirtą būdvardžiams, galima rasti daugelio terminologų darbuose, ypač 1990-aisiais ir 2000-aisiais metais1. Slovakijos terminologijos istorijoje į būdvardžių centrinius tyrimus, sukeltus poreikio suvienyti ir standartizuoti slovakų terminologiją, galima atsekti iki 1950 m. (žr. Ján Horecký 1956 m.). Adjektivų svarbą terminologijoje ir specializuotose kalbose taip pat gali iliustruoti statistiniai duomenys, kuriuos teikia korpusai. Daugumoje specializuotų korpusų, atsiradusių iš Slovakijos nacionalinio korpusų projekto (t. y. tik SNC projekto), yra didesnis būdvardžių santykis, palyginti su atskaitos korpusu (prim-7.0-frk), t. y. korpusas, sudarytas iš lygiavertės fiktyvių, specializuotų ir žurnalistinių tekstų dalies2. Kaip matyti iš 1 lentelės, šis skirtumas yra beveik 2%, išskyrus religinį korpusą (blf-2.0), kuriame būdvardžių santykis yra maždaug toks pat, kaip ir atskaitos korpusas (7,46%). Antrajame 1 lentelės eilutėje pateikiamas gerundų santykis, kurie taip pat naudojami su diferencijuojančiomis ir klasifikuojančiomis funkcijomis slovakų daugiakalbėse sąvokose. SNC projekto morfologinės anotacijos sistemoje jie klasifikuojami kaip specifinė grupė, todėl jie pažymėti atskirai nuo veiksmažodžių (Garabík et al. 2004). Adjektivų kartu egzistavimas ir konkurencija buvo identifikuoti ir išanalizuoti kalbų kontekste apskritai (pvz., Nábělková 1996). Tačiau jų įtraukimas į daugiažodžius terminus yra gana nepakankamai ištirtas dalykas. Paplitęs reiškinys, sukeliantis būdvardžių sinonimiškumą ir konkurenciją, yra lotynų būdvardžių ir jų (slovakų) atitikmenų (vnútrožilový […] intravenózny […] intravenous[…]) egzistavimas. Pastarąją grupę taip pat sudaro pogrupis, kuriame yra ir slovakų, ir, etimologiniu požiūriu, lotynų arba tarptautinio sufikso, sujungto su ta pačia tarptautine šaknim (pvz., bakterialinis […] baktériový […] bakterinis […]). Kartais dviejų tarptautinių sufiksų variacija su tuo pačiu 1 žr., pavyzdžiui, H. Assadi ir D. Bourigault 1995; S. Normand ir D. Bourigault 2001; B. Daille 2001; F. Maniez 2001; M.-C. L[…]Homme 2002, 2003; arba I. Carrière 2008. 2 Daugiau informacijos apie analizei naudojamus korpusus galima rasti 3.2 dalyje.
5 Jana Levická Tarptautinio tarptautinio šaknio naudojimas ir empirinis Adjectival Suffixes in Slovak Revisited produktyvumas gali atsirasti (pvz., hypersonórny […] hypersonický, kontradiktorický […] kontradiktórny). This study, focusing on the usage of specific suffixes in the Slovak kalbą, siekiama nustatyti, ar kai kurie iš jų labiau gali palengvinti tokį bendravimą arba dažniau pasitaiko terminologiniuose būdvardžiuose, todėl morfologinio produktyvumo sąvoka šiuo atveju tampa aktuali. Analizei atrinkti sufiksai yra nedidelė grupė, naudojama vardiniams būdvardžiams išleistiems Slovakijos būdvardžių sufiksuose3. Kalbant apie jų sudėtį, penkis sufiksus sudaro (pritaikytas) tarptautinis būdvardžių sufiksas, sujungtas su semantiškai lygiaverčiu slovakų -ný/ny: -alny, -árny, -itny, -ívny, -ózny, todėl jų būdvardžių statusas šiek tiek padidėja. Akivaizdu, kad visi penki lotynų kilmės sufiksai buvo naudojami lotynų vardinių vardų (-alis su variantu -aris, -ītus, -ōsus) arba veiksmažodžių (-ōrius) būdvardžiams. Tačiau verta atkreipti dėmesį į tai, kad daugelis slovakų būdvardžių su analizuotais sufiksais (3 Martin Ološtiak ir Lucia Ološtiaková (2015: 230) paminėja net 38 sufiksus, nors 25 sufiksai jų pavyzdyje […] išvestas iš Slovník koreňových morfém slovenčiny, sudarantis 66 500 leksikinių vienetų […] sudaro tik 1% būdvardžių. 1 lentelė. Žodžių ir būdvardžių ir gerundų santykiai SNC projekto CORreFer-ScieNTIF-MEDICAL LEGAL RELI-ECOPUS ENCE IC CORPUS SUB-SUBCORPUS -SUB-GIOCORPUS US NOMIC CORPUS CORPUS CORPUS Korpuso žetonų skaičius 253,137,609 149,581,785 7,099,555 33,600,183 65,920,357 164,987,015 Ženklių būdvardžių skaičius 19,090,396 7.54% 13,415,554 8.97% 660,025 9.3% 4,841,400 9.88% 4,914,860 7.46% 15,540,381 9.42% Undų of gerskaičius žetonų pavidalu 3,174,567 1.25% 2,394,914 1.6% 112,164 1.58% 1,267,598 2.59% 761,719 1.16% 2,154,124 1.31%
Slovakijos žodynas ne tik tiesiogiai iš lotynų, bet dažniau per prancūzų ar anglų kalbą per pastaruosius dešimtmečius (Horecký 1999) ir buvo pritaikytas naudojant pirmiau minėtą slovakų būdvardžių sufiksą. Svarbu, kad ši skolinimasis ir vėlesnis prisitaikymas buvo įgalintas ir sustiprintas papildomų lingvistinių veiksnių. Dėl daugiausia istorinių priežasčių slovakų kalba buvo labai atvira naujiems žodžiams, kilusiems iš lotynų kalbos, todėl lotynų kalbos žodžių dalis yra didelė, net ir visuotinėje slovakų kalbos leksikone (Horecký 1999: 81). Šiandien, dėka masinės žiniasklaidos, interneto ir socialinių tinklų poveikio, šis jungtinis žodžių formavimas yra labai svarbus lingvistiniam ir terminologiniam tyrimui. Mūsų straipsnis yra mūsų process of both borrowing and derivation is exceedingly profitable and ankstesnių tyrimų tęsinys, todėl, siekiant palyginti ir aiškinti skaitytojui, mes manėme, kad būtina įtraukti ankstesnių motyvų ir išvadų santrauką, research topic, which is currently in print (Levická 2021). For the sake papildytą naujomis įžvalgomis ir teoriniu pagrindu. Taigi, kai kurios lentelės (1[…]4), nors jos pasirodė mūsų pirmame straipsnyje, čia kartojamos. 2. Teorinis pagrindas Morfologinio produktyvumo teorinė sąvoka buvo išvystyta, teorinis mąstymas ir tyrimai XX by quite a number of researchers and scholars. An overview of previous amžiuje buvo apibendrinti ir komentuoti daugelyje tyrimų ir straipsnių, pvz., Jesús Fernández-Dominguez (2013) ar Victoria Hulse (2011). Čia mes sutelksime dėmesį tik į keletą teorinių svarstymų, kurie mums suteikė įkvėpimą ir paveikė mūsų požiūrio ir metodikos pasirinkimą. Seniausią čia cituojamą apibrėžimą 1948 m. parašė amerikietis lingvistas Dwight L. Bolingeris (cituojamas Säily 2018: 198), kuris padarė išvadą, kad produktyvumas yra "statistiškai nustatomas pasirengimas", kuriuo elementas įžengia į naujus derinius. Nyderlandų lingvistas Henkas Schultingas (cituotas Stefan Evert ir Anke Lüdeling 2001: 165) apibrėžė produktyvumą kaip "kalbos naudotojų galimybę netyčia ir, iš esmės, neribotą skaičių naujų formacijų, naudodamas morfologinę procedūrą, kuri yra už kai kurių žinomų žodžių formos ir reikšmės atitikties". 4 Žodžiai ar frazės, pažymėti stambiomis raidėmis, simbolizuoja pagrindines mūsų tyrimų ypatybes.
"Kalbų formavimo teoriją išnagrinėjo Čekijos lingvistas Miloš Dokulil, kuris 1962 Adjectival Suffixes in Slovak Revisited m. savo knygoje ""Teorie tvoření slov"" (Teorija žodžių formavimo) pristatė sudėtingą žodžių formavimo teoriją." Visų pirma, Dokulil apibrėžė kalbos prietaiso produktyvumą apskritai kaip šio kalbos prietaiso (būtų tai bazė, afiksas ar žodžių formavimo modelis) gebėjimą aktyviai dalyvauti naujų žodžių sukūrime (1962: 78). Jis nurodė, kad šis sugebėjimas gali būti absoliutus, t. y. jo panaudojimas naujų žodžių sukūrime bet kuriuo metu ir bet kokiame žodžių formavimo modelyje, arba santykinis, kuris yra semantiškai, arba labiau priklausomas nuo stiliaus, taip pat nuo žodžių formavimo modelio. Dokulilo teorijoje produktyvumas yra "sinchroninio pobūdžio sąvoka", o šio gebėjimo įgyvendinimas - naujų žodžių sukūrimas pagal konkrečias taisykles - yra, priešingai, diakroninio pobūdžio sąvoka" (1962: 80). Dokulil taip pat atskyrė sisteminį ir empirinį produktyvumą (Framtišek Štícha 2012) (taip pat vadinamas "parole" arba "realiu produktyvumu"), kuris suteikia "bendrą idėją apie tam tikro žodžių formavimo modelio ar kalbos įtaiso bendrą išnaudojimą kalbos sistemoje tam tikru laiku" (Dokulil 1962: 80). Dokulil manė, kad net ir "apytiksliai duomenys, susiję su tam tikro žodžių formavimo proceso ar elemento kiekybiniu naudojimu, yra labai svarbūs tam tikros kalbos bendram vaizdui apskritai ir jo leksikono savybėms konkrečiai" (77 punktas). Šiuolaikiniai čekų lingvistai, remdamiesi Dokulilo produktyvumo teorija ir tikrindami jo prielaidas apie korpusų duomenis (žr. pvz., Štícha 2002, 2007, 2009, 2012 ar Magda Ševčíková 2014), Štícha siūlo analizuoti empirinį ir žodinį produktyvumą ne tik dideliuose korpusuose, bet ir naudojant įvairių dydžių ir sudėties korpusų seriją. (2012: 104). Galima teigti, kad Dokulilo prielaidas dėl santykinės produktyvumo pakartojo Haraldas Baayenas ir kiti, kurių metodus ir metodus mes apžvelgsime vėliau šioje analizėje. 1999 m. Baayen ir jo kolegos Ingo Plag ir Christiane Dalton-Puffer rašė, kad "teiginiai apie tam tikro afikso produktyvumą paprastai pateikiami ne atskirant produktyvumo pagal diskurso tipą, nors paprastai daroma prielaida, kad tam tikri išvestinių sufiksų tipai yra svarbesni tam tikruose tekstuose nei kituose" (1999: 209). Turint prieinamus didelius korpusus, galima išmatuoti, identifikuoti ir analizuoti žodžių formavimo modelio ar elemento produktyvumą ne tik bendroje kalboje tam tikru metu, bet ir specializuotose srityse ir registruose.
5Terminologija | 2021 | 28 3. PREVIOUS RESEARCH Atsižvelgiant į ankstesnėje dalyje cituotus lingvistų mąstymą ir prielaidas, mes iš pradžių suformuliavome tris pagrindinius mokslinių tyrimų klausimus, kuriais siekiama nustatyti būdvardžių sufikso morfologinį produktyvumą: 1) Ar pasirinktos grupės atskirų būdvardžių sufiksų morfologinis produktyvumas skiriasi visuotiniuose ir specializuotuose tekstuose? Ar šie skirtumai yra statistiškai reikšmingi? 2) Ar atskirų adjektyvų sufiksų morfologinis produktyvumas iš pasirinktos grupės gali skirtis priklausomai nuo konkrečios srities? Ar kai kurie iš šių penkių sufiksų yra labiau "tinkami" prisidėti prie lauko ar domeno specifinių sąvokų kodavimo? 3) Kokie metodai yra svarbūs šiai konkrečiai korpusinių duomenų analizei? Visų pirma, atsižvelgiant į šio tipo žodžių formavimo modelio - lotynų pagrindas + lotynų sufiksas + etimologiškai vietinis sufiksas - specifiškumą, mes nusprendėme atidėti kokybinę analizę, susijusią su ribomis ir taisyklėmis, reglamentuojančiomis atskirų lotynų pagrindų derinimą su vienu iš pasirinktų būdvardžių sufikso slovakų kalbos kontekste. Nors kiekybinis metodas negali pateikti viso sufikso ar bet kurios kitos morfologinės formos produktyvumo būsenos vaizdo, jo nauda šiam tyrimų tipui yra perspektyvos, konkrečio modelio pagal sukurtų žodžių naudojimo konteksto, kartu su konkrečiais palyginimais su semantiškai ir funkciškai lygiavertėmis formomis. Paprastai pripažįstamas požiūris, kad morfologinio produktyvumo analizės kiekybinis metodas yra reikšmingas, papildomas kokybinių tyrimų metodas (žr. pavyzdžiui, Evert ir Lüdeling 2001). Kaip teigia Plagas: "Kvantitatyvinės ir kokybinės produktyvumo sąvokos [...] yra glaudžiai susijusios. Taigi potencialumo idėja, kuri yra esminė kokybinėms produktyvumo apibrėžtims, gali būti išreiškiama statistinėmis tikimybės sąlygomis […] (cituota Naccarato 2016: 135). Panašiai Baayenas ir jo bendraautoriai tvirtina, kad produktyvumas […]atrodo, kad yra skalarinė sąvoka [...] su kai kuriais afiksų yra labiau tikėtina, kad susidursime su naujai suformuotais žodžiais nei su kitais, tai daro produktyvumą tikimybės sąvoka, kuri yra jautri statistinei analizei[…] (1999: 10).
6 0 Jana Levická Tarptautinės prekybos naudojimas ir empirinis produktyvumas Adjectival Suffixes in Slovak Revisited 3.1. Statistical methods Analizės 1 etape mes ėmėmėmės Harald Baayen ir jo kolegų bei pasekėjų (1991, 1992, 1993, 1994, 1996, 1997) metodinio kelio. Mes nustatėme vadinamąjį realizuotą produktyvumą, t. y. pasirinktų sufiksų suformuluotų būdvardžių naudojimo dažnį, taip pat skirtingų būdvardžių, suformuluotų su šiais sufiksų, skaičių skirtinguose korpusuose. Šie korpuso statistiniai duomenys apibūdina sufiksų produktyvumą atsižvelgiant į praeities ir dabartinę lingvistinę situaciją. Kitas žingsnis buvo nustatyti analizuotų sufiksų potencialų produktyvumą, t. y. apskaičiuoti, kaip tikimasi, kad pasirodys nauji tipai5. 2009 Baayen: 7 siūlo jį apskaičiuoti kaip hapax legomena6 santykį su afiksu X ir visais žetonų su afiksu X korpuse. "Hapax legomena" naudojimas produktyvumo skaičiavimui buvo plačiai kritikuojamas, nes ši grupė tiesiogiai nepateikia naujų monetų, kurios turėtų atspindėti elemento ar modelio produktyvumą. Plag, DaltonPuffer ir Baayen teigia, kad potencialus produktyvumas yra tikimybės matas, ir kad didėjant korpuso dydžiui, […]neologizmų dalis tarp hapax legomena didėja ir buvo parodyta, kad būtent tarp hapax legomena atsiranda didžiausias neologizmų skaičius[…] (1999: 12). Ankstesniame mūsų tyrimų etape mes nusprendėme nenaudoti hapax/token metodo, bet priėmėme hapax/type metodą pagal van Marle'o (1992) motyvaciją, kad token dažnis nėra toks svarbus kintamasis produktyvumo matavime, kaip lemų skaičius. Tačiau rimčiausias šios priemonės trūkumas yra tai, kad neįmanoma palyginti skirtingų dydžių korpuso statistinių duomenų (Naccarato 2016: 133). Apie tai kalbėsime penktoje dalyje. 3.2 Analizėje naudojamos korporacijos7 Visos trys korporacijos ir trys subkorporacijos, naudojamos šioje analizėje, buvo išleistos SNC departamento 2013-2020 metais ir yra prieinamos visiems registruotiems vartotojams. 5 Korpusų lingvistikos tipai atstovauja unikaliems žodžiams, jie yra lemų sinonimai (Baker et al. 2006). 6x hapax legomena (grikiška frazė, reiškianti […] kartą sakė[…]), taip pat sutrumpinta kaip hapax, yra žodis, kuris atsiranda tik vieną kartą tam tikroje korpuse (Baker et al. 2006). 7 Didžioji dalis šio skyriaus yra iš straipsnio, kuriame aprašomas ankstesnis mūsų tyrimų etapas (Levická 2021), tačiau šis pakartotinis aprašymas yra būtinas, kad būtų galima paaiškinti korpusų duomenų pobūdį.
1Terminologija | 2021 | 28 Pirmasis, nuorodų korpusas (prim-7.0-frk), sudarantis daugiau nei 253 ir million tokens, is composed of an even share of journalistic, specialised išgalvotus tekstus (64,12% jų yra iš pradžių parašyti slovakų kalba, o 29,51% yra vertimai), parašyti 1991-2015 metais. Korpusas buvo 2018 m., taip pat used in the compilation of two frequency dictionaries of Slovak (2017, atvirkštinis žodynas (2018 m.). Antrasis korpusas, prim-9.0-public-prf, yra viešai prieinamas SNC projekto pagrindinio korpuso subkorpusas ( toliau vadinamas moksliniu subkorpusu). Šis subkorpusas, sudarytas iš specializuotų, akademinių ir nefikcinių tekstų, apima daugiau nei 149 milijonų žetonų ir dokumentų, taip pat bendrą mokslo ir mokslinių tyrimų diskursą, įskaitant specializuotą žurnalistiką. Jo tekstai buvo parašyti nuo 1955 iki 2019 metų. 1955-1991 m. parašytų tekstų procentinė dalis yra 8,7% (daugiau nei 13 milijonų žetonų). Mažiausias (sub) korpusas iš visų ieškomų korpusų yra SNC projekto pagrindinio korpuso filtravimo rezultatas [9], versija Jį sudaro 1976-2019 m. parašyti medicinos srities tekstai, kurių skaičius yra šiek tiek didesnis nei 7 milijonai žetonų. 1955-1991 m. parašytų tekstų procentinė dalis yra 1,09%. Visame tekste mes jį vadinsime medicininiais padaliniais. Siekiant turėti lyginamą šaltinį, kilusį iš kitų specializuotų rinkinių ir etaloninio rinkinio, specializuotas teisinis rinkinys (angl. specialized corpus legal - 1.1 (angl. specialized corpus legal - 1.1), sudarytas bendradarbiaujant su Slovakijos teisingumo ministerija, buvo sutrumpintas iki 1991-2011 m. sukurtų teisės aktų tekstų. Taigi buvo sumažinta beveik 49 milijonų žetonų. to 33.5 million tokens. Specializuotas korpusas […] blf-2.0 […], orientuotas į religinę sritį, buvo išleistas 2014 m. Jo tekstus sudaro beveik 66 milijonai žetonų, parašytų nuo 1989 iki 2014 m. (t. y. religinis korpusas). Jį sudaro daugiau nei 80% teminių žurnalų ir laikraščių. Panašiai specializuotas corpus ecn-2.0-public ( toliau vadinamas ekonominiu korpusu), skirtas ekonomikos sričiai, apima net 96,24% specializuotų tekstų, paskelbtų teminiuose žurnaliuose ir laikraščiuose. Šio korpuso tekstai yra iš 1992-2014 m. ir apima beveik 165 mln. žetonų Tačiau reikia atkreipti dėmesį į tai, kad šie korpusai yra heterogeniški ir apima įvairius tekstus.
2 Jana Levická Usage and Empirical Productivity of International Kalbant Adjectival Suffixes in Slovak Revisited apie korpusų paiešką, mes nepagrindėme užklausų morfologiniu ženklinimu, suteiktu kiekvienam (sub) korpusui, įtrauktam į analizę, remdamiesi tuo, kad lotyniškų žodžių ženklinimas pasirodė nepakankamas ir klaidingas. Todėl mes pasirinkome paprastą tam tikro žetonų pabaigos paiešką, pvz., [lemma=.*álny], kartu su automatiniu žodžių, kurie atsitiktinai turi tą pačią simbolių eilutę, filtravimu (žr. 4.1). 3.3 Ankstesnio etapo rezultatai Ankstesniame etape statistiniai duomenys iš korpuso leido mums sukurti analizuotų sufikso realizuoto produktyvumo reitingą. Sufiksas -álny yra akivaizdžiai plačiausiai naudojamas visuose (sub) korpusuose, o -órny yra priešais dažnių ašies polių 5 (sub) korpusuose. Kaip matyti iš normalizuotų keturių iš penkių sufiksų naudojimo dažnių, jie dažniau pasirodo specializuotuose ir akademiniuose tekstuose (taip, kad normalizuoti sufiksų dažniai medicinos subkorpusuose yra lygūs arba gerokai viršija ipm moksliniame subkorpusame, o ifestly mažesni nei referencinėje entific subcorpus) compared to the reference corpus. It is also noteworthy korpusoje). Tai iš dalies galima paaiškinti tekstų, įtrauktų į šiuos (sub) korpusus, rūšimi. 2 lentelė. Analizuotų sufiksų dažnis ir normalizuotas dažnis (IPM, atvejai milijone) atitinkamuose (sub) the ipm of suffixes (instances per million) in the religious corpus is mankorpusuose. Korpusai suskirstyti pagal mažiausią iki didžiausios SuF-MEDICAL LEGAL RELI-SCIENTIF-ECOreFerFIx SUB-SUBCORPUS -GIOUS IC CORPUS SUB-NOMCORPUS IC ENCE CORPUS CORPUS CORPUS Žetonai Žetonai Žetonai Žetonai Žetonai Žetonai IPM IPM IPM IPM IPM - 31,408 102,863 128,472 537,682 597 005 547,742 4423.94 3061.38 1948.9 3594.57 3618.5 2163.81 - 4,529 25,980 14,253 94,586 38,178 84,780 637.93 773.21 216.22 634.14 231.40 334.92 -itný 2,683 2,256 9,176 30,402 52,574 44,655 377.91 67.14 139.20 203.25 318.66 176.41
9Terminologija | 2021 | 28 duotas sufiksas. Palyginus su 4 lentele, reitingas pasikeitė visose (sub) korpusose, išskyrus referencinį korpusą. Taigi, atrodo, kad mažo dažnio lemų įtraukimas buvo vertas. Sufiksas "órny" yra produktyviausias dviejuose korpusuose (palyginus su trimis 4 lentelėje), o "ózny" išliko dviejų reitingų viršuje, o "itný" - ekonominio korpuso reitingų viršuje. Teisės korpuse produktyviausias sufiksas, atrodo, yra -árny, o šis pats sufiksas yra tuo pačiu metu produktyvumo reitingai yra užimtas sufiksas -órny tiek nuorodų korpuse, tiek medicinos tekstuose, sufiksas least productive in medical texts and economic texts. The last place in the -ózny bendruose moksliniuose tekstuose ir sufiksas -itný išliko mažiausiai produktyvus teisiniuose ir religiniuose korpusuose. 5. COMPARING PRODUCTIVITY ACROSS (SuB) COrPOrA Kaip pažymėjome 3.1 dalyje, statistiniai matavimai, kuriuose naudojami neapdoroti dažniai ir tipų skaičiavimai, neleidė mums palyginti ankstesnių rezultatų, gautų iš skirtingų (sub) korpusų. Jei mes sutinkame su teiginiu, ar tiksliau hipoteze, kad bet kokio žodžio formavimo elemento arba lentelės 9 produktyvumas Galimų neologizmų santykis tarp mažo dažnio lemų grupės (4 […] 1 atvejis) ir tipų skaičiaus. Išryškintų sufiksų eilutė pasikeitė, palyginti su 4 lentele W-FrequeNCy LeMMAS/TyPe ratiuo referencinis korpus mokslinis subkorpus medicininis subkorpus -ózny 0.2689075 -órny 0.2727272 -ózny 0.2638888 -árny 0.246666 -álny 0.2716468 -álny 0.1682785 -árny 0.2053838 -árny 0.2712328 -órny 0.1538461 -itný 0.133333 -itný 0.2653061 -itný 0.888813 -órny 0.12 -ózny 0.2436974 -árny 0.1284916 teisinis subkorpus religinis korpus ekonominis korpus -árny 0.1212121 -órny 0,3 -itný 0,3504273 - Gerai. - 0,1álny 0.2651391 -álny 0.2647849 - Ožny - 0.1ózny 0.2115384 -ózny 0.2560975 -álny 0.0776397 -árny 0.1985815 -órny 0.2307692 -itný 0-itný 0,1818181 -árny 0,225
Iš naujų monetų galima daryti išvadą (ir tuo pačiu metu 4.2 dalyje įrodėme, kad Adjectival Suffixes in Slovak Revisited šios naujos monetos gali atsirasti ne tik hapax grupėse, bet ir žemo dažnio tipų viduje), galima pagrįsti tolesnę analizę žodžių dažnio pasiskirstymu ir dažnio spektrais. "Frekvencijos spektras" reiškia sąrašą, kuriame nurodoma, kiek dažnių sąrašo tipų galima stebėti (Baroni 2009: 807). Iš žodžių dažnio pasiskirstymo perspektyvos evert ir Lüdeling (2001: 166) pagal Schultink apibrėžimą tvirtina, kad "produktyvus modelis teoriniu požiūriu pasižymi begaliniais žodžiais (žr. Schultink apibrėžimo neriboto sąvokos sąvoką), o visiškai neproduktyvus modelis turėtų turėti ribotą ir dažnai gana mažą žodyną". Jie atkreipia dėmesį į tai, kad "mažo dažnio tipai (įskaitant hapax legomena, bet taip pat tipai, kurie pasitaiko du, trys ir t. t.) sudaro didžiąją dalį produktyvių modelių žodynų" ir daro išvadą, kad toks palyginimas negali būti pagrįstas standartiniais statistiniais modeliais (2001: 167). Statistinio modeliavimo tikslais 2001 m. Baayen įvedė vadinamąjį LNRE10 pasiskirstymą. Šių specializuotų modelių privalumas yra galimybė ekstrapoluoti tipų žetonų statistiką iš konkrečios atrankos į didesnes žetonų vertes ir taip įvertinti galimus neologizmus už šios atrankos ribų. Jie grindžiami prognozuotais žodynų dydžiais, gautais iš korpusų žemo dažnio tipų skaičiaus. Vienas iš šio modeliavimo rezultatų yra žodynų augimo kreivės arba, vietoj tipų žetonų augimo kreivės, kurios skaičiuoja tipų skaičių kaip žetonų skaičiaus funkciją. Tipiška šio kreivės forma neproduktyviam procesui prasideda pakylėjimu, bet tada jis "sumažėja ir konverguoja į pastovią vertę, visą žodynų dydį" (2001: 168). Priešingai, tipiškas produktyvus modelis turi begalinį žodyną, t. y. atrodo, kad kreivė auga neribotą laiką. LNRE (Large Number of Rare Events) teorija, kaip nepriklausoma statistikos sritis, atsirado 1988 m., kai Gruzijos statistikas Estetas Chmaladze išleido knygą The Statistical Analysis of a Large Number of Rare Events (The Statistical Analysis of a Large Number of Rare Events). Kaip rašė jo mokinys Giorgi Kvizhinadze: "Šių pavyzdžių bendras bruožas yra tas, kad kartu su keliais dažniais įvykiais yra ir labai didelis skaičius labai retų įvykių, pavyzdžiui, su dažniu 0,1,2. Bendras šių retų įvykių skaičius, palyginti su knygoje tik vieną kartą aptariamų žodžių skaičiumi, negali būti laikomas gyvybiškai svarbiu šiai knygai, tačiau labai aišku, kad šie žodžiai yra absoliučiai svarbūs, nes jie sudaro pusę autoriaus žodynų. servations typically is not large but the number of these events among all the different observed events is always very significant. These rare events are usually very important. For instance, the number of words
1Terminologija | 2021 | 28 žodžių formavimo modelio visoje "populacijoje", t. y. kalboje kaip tokioje. Tuo pačiu metu galima apskaičiuoti ar prognozuoti tipų skaičių to paties dydžio mėginiuose, gautais iš didesnių korpų. Kaip minėta 4.1 dalyje, ši statistinė procedūra taip pat reikalauja tipų ir žetonų kokybės skaičiavimo, kitaip apskaičiuoto žodynų dydžio ar tipų skaičiavimas būtų klaidingas […] vietoj to, kad išpjaustytų ir konverguotų į pastovią vertę, kreivė galėtų toliau augti. 5.1 LNRE pasiskirstymas Mes nusprendėme taikyti LNRE modelius, kad identifikuotume 11 produktyvumą skirtingo dydžio korpusuose, iš dalies dėl to, kad internete taip pat yra prieinamas atviro kodo įrankis […] Zipfr, kurį sukūrė evert ir Marco Baroni (2007). Šis atviro kodo įrankis apima keletą modelių, iš kurių mes naudojome ribinį Zipf-Mandelbrot modelį (fZM), pagrįstą Zipf-Mandelbrot dėsniu12. Kaip teigia autoriai, jo naudojimas peržengia lingvistikos ribas. ZipfR priima keletą įvesties formatų, įskaitant paprastus dažnių sąrašus ir paprastus pavyzdžius, vieno žetonų per eilutę formatu. Galime naudoti ankstesnių tyrimų dažnių sąrašus, kurie buvo rankiniu būdu valyti 1 etape (žr. 4.1. dalį), o tai buvo dar vienas šio metodo privalumas. Mūsų dažnių sąrašai buvo atlikti keturiomis pagrindinėmis operacijomis (Evert, Baroni 2007): i) parametrų įvertinimas, kai LNRE modelio M parametrai nustatomi iš mokymo mėginio dydžio, lyginant tikėtiną dažnių spektrą su stebimu dažnių spektru; (ii) tinkamumo gerumo vertinimas, pagrįstas tipų skaičiaus ir tiksliai m kartų pasitaikančių tipų skaičiaus kovariancijos matrica; (iii) žodynų augimo interpoliacija ir ekstrapoliacija, naudojant tikėtinas vertes; (iv) laukiamo dažnių spektro prognozavimas savavališkam mėginio dydžiui. Kaip atkreipė dėmesį Evert ir Baroni (2007), šis modeliavimas sutelkia dėmesį ne į atskirų žodžių tipų dažnius, o į tokių dažnių pasiskirstymą (mėginyje) ir tikimybę (populacijoje). 11 Norėtume padėkoti už neįkainojamą mūsų kolegos Ján Mášíko pagalbą, kuris užtikrino imple12. Išsamų Zipf-Mandelbrot įstatymo aprašymą skaitytojas gali rasti, pvz., Baroni 2009 m. mentation of the fZM model for our corpus data.
7 Jana Levická Tarptautinės ekonomikos naudojimas ir empirinis produktyvumas Adjectival Suffixes in Slovak Revisited 5.2 LNRE paskirstymo ir vertinimo taikymas "ZipfR" įrankis suteikė mums žodžių dažnio spektrus ir tipų ženklų kreives kiekvienam ir kiekvienam sufiksui kiekviename (sub) korpuse. Dėl vietos trūkumo pateikiame tik grafikus, rodančius tipo ženklų kreives, kurios buvo sureguliuotos taip, kad x ašyje būtų tas pats skalė. Y ašis skiriasi, nes ji priklauso ir atsiranda, nuo faktinio tam tikro sufikso tipų skaičiaus tam tikroje (sub) korpuse. Mes siūlome palyginti grafikų poras ir galiausiai įvertinti sufiksų produktyvumą mūsų korpusų duomenimis. X ašis rodo žetonų skaičių, o y ašis rodo (laukiamą) skirtingų tipų skaičių, kurį sukuria žodžių formavimo modelis, kuriame yra vienas iš analizuotų sufiksų. Abu korpusai, referenciniai ir moksliniai, rodo tą patį sufiksų reitingą, virš kurio yra sufiksas -alny ir baigiasi sufiksas -órny. Nuorodos korpuse trijų sufiksų -alny, -árny, -ózny kreivė didėja ir taip rodo jų produktyvumą, o -itný ir, ypač, -órny kreivės sušvelnėja. Moksliniame subkorpusyje du sufiksai gali būti laikomi produktyviais: - ir -árny. Likusių trijų (-ózny, -itný, -órny) kreivės auga labai lėtai, tačiau rodo tendenciją išlyginti grafike esančios x ašies gale. Medicinos subkorpusų ir teisinių korpusų grafikai rodo tik vieną labai greitai plokštumą (galbūt jie pasiekia savo didžiausią žodynų dydį), o -itný ir -órny auga lėtai, bet pastoviai, jie peržengia 100-tipo tašką ir galbūt plokštėja po 200-tipo tašku. Teisės tekstų sufiksas -alijus nukreiptas į 350 tipo tašką, o medicinos tekstų - productive suffix: -álny13. In the medical subcorpus, both -árny and -ózny į 800 tipo tašką (žr. y ašies skalę). Tačiau teisiniame korpuse reitingas šiek tiek skiriasi […] sufiksas -itný yra trečioje vietoje, praeidamas sufikso -ózny, kuris atrodo beveik visiškai neproduktyvus, kai kreivė eina lygiagrečiai su x ašimi. Paskutinis sufiksas -órny pasižymi labai lėtu pakilimu ir vėlesne tendencija susilpnėti. Nors religinio korpuso grafike pateikiami trys produktyvūs sufiksai -álny, -árny ir -ózny, verta atkreipti dėmesį į tai, kad visi penki analizuoti sufiksai, atrodo, yra produktyvūs ekonominiuose tekstuose. Sufikso eilutė abiejuose corpora remains the same. 13 Šiuose dviejuose grafikuose trūksta interpoliacijos kreivės sufikso -alny. To priežastis yra x ašies skalės pritaikymas ir suvienijimas visiems (sub) korpusiams, kurie neleido sukurti tokio tipo kreivės.
3Terminologija | 2021 | 28 3 paveikslas. Analizuotų sufiksų žodynų augimo kreivės korpuse teisinėje korpuse 4. Analizuotų sufiksų žodynų augimo kreivės medicinos 1 paveikslas. Analizuotų sufiksų žodynų augimo kreivės kreivės mokslinių subkorpusų etaloniniame korpuse 2. paveikslėlyje. Analizuotų sufiksų žodynų augimo Religiniame korpusas, abu kreivės -itný ir -órny išlyginti gerai po 100 tipo tašku. Jei apibendriname pirmiau minėtus rezultatus, susijusius su analizuotų sufiksų produktyvumu mūsų korpusų duomenimis, galime teigti, kad produktyviausias sufiksas yra -alny, viršijantis reitingą visuose (sub) korpusuose. Atrodo, kad jo produktyvumas yra didžiausias mokslo ir academic texts and in the medical subcorpus, followed by the reference korpuso subkorpusuose (kurva siekia 700 tipų), religiniuose korpusuose.
7 Jana Levická Naudojimas ir empirinis tarptautinio korpuso Adjectival Suffixes in Slovak Revisited produktyvumas (kurva kerta 600 tipo tašką), ekonominis korpusas (kurva nukreipta į 500 tipo tašką) ir galiausiai teisinis korpusas (didžiausias kreivė yra arti 350 tipo taško). Antrą vietą užima sufiksas -árny, kuris yra produktyvus 4 iš 6 (sub) korpuso. Kurvų forma rodo, kad jis nėra naudingas teisiniais ir medicininiais tekstais. Aukščiausias šio sufikso produktyvumas gali būti 400 tipo taškas), tada atskaitos korpusas (kraivė kerta 300 tipo seen in the subcorpus of scientific and academic texts (the curve crosses tašką), o religiniuose ir ekonominiuose tekstuose kreivė eina netoli 300 tipo taško. Panašiai ir sufiksas -ózny, atrodo, yra produktyvus 4 iš 6 korpuso. Įdomu tai, kad jis, regis, yra neproduktyvus toje pačioje (sub) korporacijoje, kaip ir sufiksas -árny teisinėse ir medicinos korporacijose. Tai yra labiausiai produktyvus ekonominiuose tekstuose, kur kreivė eina gerai per 200-tipo tašką, tada atskaitos korpuse, kur kreivė kerta tą patį tašką, o likusiuose dviejuose korpusuose kreivė arba palietė tą patį tašką, bet atrodo, kad ten išlygsta (prim-9.0-public-prf) arba tik eina į šį tašką religiniame korpuse. Be to, užrašas -itný, regis, yra produktyvus keturiuose iš šešių korpuso. Išlyginimo kreivę, rodančią neproduktyvumą, galima pamatyti teisinės ir religinės korporacijos grafikuose. Jis yra produktyviausias ekonominiuose tekstuose, kuriuose kreivė eina gerokai virš 100 tipų taškų, o trijuose likusiuose (sub) korpusuose ji kerta šį tašką ir eina žemiau. ekonominiame Fig. 6. Vocabulary growth curves of analysed suffixes korpuse religiniame korpuse Fig. 5. Vocabulary growth curves of analysed suffixes
5Terminologija | 2021 | 28 The final suffix in the ranking -órny – is productive in 4 out of 6 corPora, taip pat. Jo neproduktyvumas buvo identifikuotas referencinėse ir religinėse knygose. Didžiausias jo našumas yra medicinos ir ekonomikos tekstuose, kur kreivė kerta 100 tipo tašką, akademiniuose ir moksliniuose tekstuose kreivė eina netoli šio taško, o teisiniuose tekstuose ji vargu ar kerta 100 tipo tašką. 25 tipo taškas. Galiausiai galima pasakyti, kad analizuojami sufiksai yra produktyviausi moksliniuose ir akademiniuose tekstuose arba specialios srities (ekonomikos ar medicinos) tekstuose, o tai nenuostabu, atsižvelgiant į jų etimologiją. Jų produktyvumas, t. y. produktyvumo laipsnis, labai skiriasi tarp (sub) korpusų. Galbūt įdomiausias stebėjimas yra trijų sufikso neproduktyvumas teisinėje srityje ir mažiausias likusių dviejų sufikso produktyvumas toje pačioje srityje. Tai gali reikšti, kad teisiniai tekstai nepalankiai vertina leksikos kūrybiškumą, sukuriant tokius naujus būdvardžius. Palyginus su 4 dalimi, priedėlių reitingo skirtumą iš dalies galima paaiškinti Václav Cvrček (2012) pastebėtu reiškiniu, susijusiu su hapax tipo santykis. Remiantis Cvrčeko eksperimentais, šis santykis linkęs mažėti nuo didžiausios vertės 1 iki vietinio minimumo (ibid: 5). Tačiau po šio taško santykis vėl pradeda didėti. Cvrček tvirtina, kad tai yra "kažkoks bendras didelių tekstų rinkinių kiekybinis principas" (ibid: 14). Panašu, kad hapax tipo funkcijos forma yra maždaug tokia pati net ir tipologiškai skirtingoms kalboms, tačiau tekstinio mėginio dydis priklauso nuo kalbos tipo. Norint pasiekti minimalią hapax tipo santykį, Cvrček teigia, kad anglų korpusas turėtų apimti bent 3 milijonus žetonų, o čekų korpusas (ir mes tikime, kad slovakų korpusas taip pat dėl dviejų kalbų tipologinio ryšio) turėtų apimti net 58 milijonus žetonų. Kadangi du mūsų analizės subkorporai yra mažesni už Cvrčeko ribą, jų hapax tipo santykis yra hapax tipo funkcijos mažėjančioje dalyje. 6. Išvados Tęsdami savo tyrimus, kuriuose daugiausia dėmesio buvo skiriama pasirinktų sufiksų produktyvumui skirtinguose korpusuose ir srityse, mums pavyko atsakyti į abu ketvirtame skyriuje pateiktus klausimus. 1. Mes sugebėjome įrodyti, kad iš korpuso išgautos mažo dažnio lemos taip pat apima galimus neologizmus ir, nors jų pasiskirstymas gali skirtis priklausomai nuo korpuso
7 6 Jana Levická Usage and Empirical Productivity of International Adjectival Suffixes in Slovak Revisited duomenų, jos gali pakeisti produktyvumo reitingą, pagrįstą hapax/tipo formulė. 2. Mes nustatėme ir taikėme statistinį modeliavimą, kad įvertintume produktyvumą visose korporacijose […] LNre pasiskirstymuose. Įdiegdami atvirosios šaltinės įrankį su mūsų korpuso duomenimis, mes gavome vizualų produktyvumo modeliavimą, kuris leido mums teigti, kad analizuotų sufiksų produktyvumas skiriasi ne tik lyginant bendrus ir mokslinius tekstus, bet ir tarp skirtingų specializuotų sričių. Mes manome, kad modeliavimas aiškiai parodo kiekvieno iš analizuotų sufiksų tikrąjį potencialą gaminti naujus tipus atitinkamoje srityje. Tačiau šio straipsnio 4 ir 5 dalių rezultatai ir reitingai yra gana tarpusavyje nesuderinami, nes pirmasis yra pagrįstas tiesiogiai neapdorotais duomenimis - tipų ir hapaxų arba mažo dažnio tipų skaičiumi konkrečiame (sub) korpuse, o antrasis - tikėtinais dažnio spektrais kiekvienam (sub) korpusiui. Trumpai tariant, tuo tarpu, kai pirmasis rodo faktinius duomenis, antrasis siekia įvertinti konkretaus kalbos elemento produktyvumą. Todėl didesniems medicinos ir teisės tekstų korpusams turėtume identifikuoti daugiau hapaxų, o tai gali sukelti kitokį sufiksų reitingą. Mūsų prielaidos galiausiai gali būti patikrintos ateityje atliekant tyrimus, analizuojant platesnius korpusus, kuriuose yra reprezentatyvus konkrečių domenų atitinkamų tekstų tipų pavyzdys, nes tekstų žanrai taip pat gali vaidinti vaidmenį morfologiniame elemento produktyvumo srityje. Atsižvelgiant į tai, kad net ir didžiausias korpusas neapimtų visų žodžių, mes manome, kad yra protingiau įvertinti bet kokio elemento morfologinį produktyvumą naudojant sudėtingesnius metodus nei neapdorotas tipų ar žetonų skaičius. Galiausiai galima sakyti, kad mes galime identifikuoti praeities produktyvumą žodžių formavimo modeliu ar elementu. Mes taip pat galime pateikti skirtingus jo būsimo eksploatavimo, t. y. Baayen potencialaus produktyvumo, įvertinimus. Be to, net jei statistinius matavimus papildysime kokybine analize, turėtume atsižvelgti į dar vieną faktą: kaip teisingai teigia Fernández-Domínguez, morfologinio produktyvumo tikimybės prognozes reikėtų suvokti extralinguistinių veiksnių kontekste ir ypač tų, kurie susiję su kalbos bendruomenės pavadinimų poreikiais. "Jei nėra pavadinimo poreikio, negali būti produktyvaus žodžių formavimo" (Fernández-Domínguez 2013: 438).
7 7Terminologija | 2021 | 28 Pripažinimai Straipsnis buvo parašytas Slovakijos nacionalinio korpuso projekte, kurį rėmė by the Slovak Academy of Sciences, Ministry of education, Science, research and Slovakijos Respublikos sporto ministerija, Slovakijos Respublikos kultūros ministerija ir Slovakijos mokslų akademijos Ľudovít Štúr lingvistikos institutas. Šaltinių sąrašas Slovėnijos nacionalinis korpusas. Korpus prim-7,0 frk. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2018. Galima susipažinti su: https://korpus.sk. Slovėnijos nacionalinis korpusas. Korpus prim-9.0-public-prf. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2020. Galima susipažinti su: https://korpus.sk. Slovėnijos nacionalinis korpusas. Korpus prim-9.0-juls-all. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2020. Galima susipažinti su: https://korpus.sk. Slovėnijos nacionalinis korpusas. Korpus Legal-1.1. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2013. Galima susipažinti su: https://korpus.sk. Slovėnijos nacionalinis korpusas. Korpusas BF-2.0. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2014. Galima susipažinti su: https://korpus.sk. Slovėnijos nacionalinis korpusas. Korpus ecn-2.0-public. Bratislava: Jazykovedný ústav Ľ. Štúra SAv 2016. Galima susipažinti su: https://korpus.sk. Slovníkový portál Jazykovedného ústavu Ľ. Štúra SAv https://slovnik.juls.savba.sk. "ZipfR" paketas. Galima rasti adresu: http://zipfr.r-forge.r-project.org. REFERENCES Assadi Houssem, Bourigault Didier 1995: Classification d’adjectifs extraits d’un corpus pour l’aide à la modélisation de connaissances. – Troisièmes journées internationales d’analyse des données textuelles, 313–320. Baayen r. Harald, Lieber rochelle 1991: Productivity and english derivation: a corpus-based study. – Linguistics 29, 801–843. Baayen r. Harald 1992: quantitative aspects of morphological productivity. – Yearbook of Morphology 1991, eds. g. e. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 109–149. Baayen r. Harald 1993: On frequency, transparency, and productivity. – Yearbook of Morphology 1992, eds. g. e. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 181–208. Baayen R. Harald 1994: Productivity in production. – Language and Cognitive Processes 9, 447–469. Baayen R. Harald, Renouf Antoinette 1996: Chronicling The Times: Productive Lexical Innovations in an english Newspaper. – Language 72, 69–96. Baayen r. Harald, Lieber rochelle 1997: Word frequency distributions and lexical semantics. – Computers and the Humanities 30, 281–291. Baayen r. Harald 2009: Corpus linguistics in morphology: morphological productivity. – Corpus Linguistics. An international handbook, eds. A. Lüdeling, M. Kyto, Berlin, Mouton De gruyter, 900–919. Baker Paul, Hardie Andrew, Mcenery Tony 2006: A Glossary of Corpus Linguistics, Edinburgh: Edinburgh University Press Ltd. Available at: https://pdfs.semanticscholar.org/856a/9640311005ff8a97ab98976c9209 aa12120a.pdf. Baroni Marco 2009: Distributions in text. – Corpus Linguistics. An international handbook, eds. A. Lüdeling, M. Kyto, Berlin, Mouton De gruyter, 803–822. Available at: https://home.sslmit.unibo.it/~baroni/publications/hsk_39_dist_rev2.pdf. Carrière Isabelle 2008: Méditerm: encodage des adjectifs médicaux. – Corpus et dicionnaires de langues de spécialités, eds. F. Manize, P. Dury, N. Arlin, C. rougemont, grenoble: Presses universitaires de grenoble, 175–196. Cvrček václav 2012: How Large is the Core of Language. – Corpus Linguistics 2011 [online], Birmingham. Available at: https://www.birmingham.ac.uk/Documents/college-artslaw/corpus/conference-archives/2011/Paper-145.pdf. Daille Béatrice 2001: qualitative terminology extraction: Identifying relational adjectives. – Recent advances in computational terminology, eds. D. Bourigault, C. Jacquemin, M.-C. L’Homme, Amsterdam: John Benjamins Publishing Co, 149–166.
7 8 Jana Levická Usage and Empirical Productivity of International Adjectival Suffixes in Slovak Revisited Dokulil Miloš 1962: Teorie tvoření slov, Praha: Nakladatelství ČSAv. Evert Stefan, Lüdeling Anke 1991: Constraining psycholinguistic models of morphological processing and representation: the role of productivity. – Yearbook of morphology 1991, eds. g. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 165–183. evert Stefan, Baroni Marco 2007: The zipfR library: Words and other rare events in R. Presentation at useR! 2006: The Second R User Conference, Vienna, Austria. Available at: https://zipfr.r-forge.r-project.org. evert Stefan 2004: A simple LNre model for random character sequences. – Proceedings of JADT 2004, 411–422. Fernández-Domínguez Jesús 2013: Morphological Productivity Measurement: exploring qualitative versus Quantitative Approaches. – English Studies 94, 4, 422–447. garabík radovan, gianitsová Lucia, Horák Alexander, Šimková Mária 2004: Tokenizácia, lematizácia a morfologická anotácia Slovenského národného korpusu: internal document for manual morphological annotation. Unpublished. Available at: https://korpus.sk/attachments/publications/2004-garabik-gianitsova-horak-simkova-tokenizacia.pdf. Horecký Ján 1956: Základy slovenskej terminológie, Bratislava: VEDA. Horecký Ján 1999: Internacionalizácia a europeizácia slovenčiny. – Internacionalizácia v súčasných slovanských jazykoch: za a proti, ed. J. Bosák, Bratislava: veda, 80–82. Hulse Victoria 2011: Productivity in morphological negation: a corpus based approach, The university of Manchester. Available at: https://www.research.manchester.ac.uk/portal/en/theses/productivity-in-morphological-negation-a-corpusbased-approach(266d2241-a266-4b99-8fab-e19571381d8f).html. Kvizhinadze Giorgi 2010: Large number of rare events: Diversity analysis in multiple choice questionnaires and related topics, Victoria University of Wellington doctor thesis. Available at https://core.ac.uk/download/ pdf/41336663.pdf Levická Jana 2021: Usage and empirical productivity of international adjectival suffixes in Slovak based on general and specialised corpora. – Jazykovedný časopis 72, 2 (in print). L’Homme Marie-Claude 2002: Fonctions lexicales pour représenter les relations entre termes. – Traitement automatique des langues 43, 1, 19–41. L’Homme Marie-Claude 2003: Adjectifs dérivés sémantiques dans la structuration des terminologies. – Journées d’étude Terminologie, Ontologie et représentation des connaissance, Lyon. Maniez François 2002: Distinguer les termes des collocations: études sur corpus du patron < Adjectif – Nom > en anglais médical. – Actes du colloque TALN de Nancy 1, 24–27 juin 2002, 345–350. van Marle Jaap 1992: The relationship between Morphological Productivity and Frequency: A Comment on Baayen’s Performance-Orientated Conception of Morphological Productivity. – Yearbook of Morphology 1991, eds. g. Booij, J. van Marle, Dordrecht: Kluwer Academic Publishers, 151–163. Nábělková Mira 1996: variantnosť ako prvok dynamiky v adjektívnej paradigme. – Slovenská reč 61, 257–266. Naccarato Chiara 2016: A corpus-based quantitative approach to the study of morphological productivity in diachrony: The case of samo-compounds in russian. – A Blend of MaLT Hanna Christ, eds. D. Kle nov šak, L. Sönning, v. Werner, Bamberg: university of Bamberg Press, 133–153. Normand Sylvie, Bourigault Didier 2001: Analysing adjectives used in a histopathology corpus with NLP tools. – Terminology 7, 2, 155–164. Plag Ingo, Dalton-Puffer Christiane, Baayen Harald 1999: Morphological productivity across speech and writing. – English Language and Linguistics 3, 2, 209–228. Säily Tanja 2018: Change or variation? Productivity of the suffixes -ness and -ity. – Patterns of Change in 18th Century English. A Sociolinguistic Approach, eds. T. Nevalainen, M. Palander-Collin, T. Säily, Amsterdam: John Benjamins, 197–218. Ševčíková Magda 2014: Zjišťování slovotvorné produktivity z korpusových dat: přípony odvozující názvy vlastností. – Naše reč 97, 228–240. Štícha František 2012: Jak v epoše elektronických korpusů následovat Miloše Dokulila (Miloši Dokulilovi ke stému výročí narození). – Jazykovědné aktuality 49, 95–107. Štícha František 2002: K Dokulilovu pojmu slovotvorné produktivity (z hlediska korpusové analýzy). – Čeština doma a ve světě 4, 302–310. Štícha František 2007: Korpusové statistiky a slovotvorná produktivita. – Grammar & Corpora/Gramatika a korpus 2005, eds. F. Štícha, J. Šimandl, Praha: Academia, 250–257. Štícha František 2009: Slovotvorná produktivita a gramatičnost: gradační expresivní adjektiva s prefixy pra-, přea velev současné psané češtině. – Eslavística Complutense 9, 145–170.