scieee AI-readable full text Open interactive document viewer

Corpus-Driven Analysis of Multi-Word Terms Including the Word ‘Risk’ in English, French and Lithuanian

Oksana Smirnova; Sigita Rackevičienė

Abstract

ANGLŲ, PRANCŪZŲ IR LIETUVIŲ KALBŲ DAUGIA ŽODŽIŲ TERMINŲ SU ŽODŽIU RIZIKA ANALIZĖ TEKSTYNŲ LINGVISTIKOS METODAIS    Straipsnyje pristatomi deskriptyviosios terminologijos tyrimo principai bei empirinis daugiažodžių terminų su žodžiu rizika tyrimas, kurio tikslas – taikant tekstynų lingvistikos metodus, surinkti terminus iš ES finansų srities dokumentų tekstynų ir atlikti jų formaliosios sandaros analizę.    Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglų–prancūzų–lietuvių kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 angliškų terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis buvo dažniausias visų trijų kalbų tekstynuose.    Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės progra-mos – AntConc ir AntPConc. Dirbta tokiais etapais:    • dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei;    • žodžio rizika kolokacijų ir daiktavardinių junginių su pagrindiniu dėmeniu rizika ir jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne;    • daiktavardinių junginių, laikytinų daugiažodžiais terminais, atrinkimas;    • atrinktų angliškų terminų prancūziškų ir lietuviškų atitikmenų nustatymas.    Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams.    Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose:    • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai rodo, kad ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus;    • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 2–3 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų;    • anglų ir lietuvių kalbų terminų darybos modeliuose vyrauja prepozicinė ir post­ pozicinė modifikacija, o prancūzų kalbos – postpozicinė modifikacija;    • daugumos anglų ir lietuvių kalbų terminų priklausomieji dėmenys yra daiktavardžiai ir būdvardžiai, o prancūzų kalboje – prielinksninės konstrukcijos.    Formaliosios sandaros analizės rezultatai suteikia informacijos, kuri gali būti naudinga terminų kūrėjams ir vertėjams. Tyrimo metu nustatyti sintaksinių struktūrų modeliai gali būti taikomi, kuriant kompiuterinius lingvistinius metodus automatiniam terminų atpažinimui be iš anksto pasirinktų raktinių žodžių.

Full text

Oksana Smirnova - Korpusinė daugiakalbinių terminų analizė, įskaitant Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian daugiakalbinių terminų korpusinę analizę Sąvokos, kuriose yra žodis "Risk" anglų, prancūzų ir lietuvių kalbomis OKSANA SMIRNOVA Mykolas Romeris universitetas, Lietuva SIGITA RACKEVIČIENĖ Mykolas Romeris universitetas, Lietuva KEYWORDS: apibūdinamoji terminologija, korpusų analizė, finansiniai terminai, terminų ekstrakcija, terminų formavimo modeliai 1. Įžanga Kompiuterinės technologijos atvėrė naujas galimybes lingvistiniams tyrimams: skaitmeniniai korpusai ir korpusų analizės programinė įranga palengvino prieigą prie giliausių kalbos struktūrų ir santykių tarp skirtingų kalbos vienetų bei atskleidė jų naudojimo ypatumus skirtingose srityse skirtingais laiko laikotarpiais. Todėl natūralios kalbos analizė, pagrįsta korpusu, šiandien taikoma įvairiose lingvistinėse srityse: leksikografijoje, kalbos mokyme, mašininio vertimo kūrime, lingvistinių duomenų bazių sudaryme ir t. t. Terminologijos tyrimai taip pat iš esmės tapo korpuso pagrindu. Skaitmeniniai korpusai leidžia terminologams dirbti su dideliu dokumentų kiekiu, stebėti tam tikrų specializuotos kalbos bruožų, rinkti informaciją apie tikrąjį terminų naudojimą ir jų evoliuciją, užfiksuoti naujus terminus, kurių negalima intuityviai pajusti ar prognozuoti, taip pat atlikti kontrastišką kelių kalbų duomenų analizę. Korpusų analizės programinė įranga, automatinės ir pusiau automatinės terminų ekstrakcijos priemonės taip pat prisideda prie terminologijos standartizacijos, pavyzdžiui, sinonimų dažnio skaičiavimas gali suteikti naudingų paskirstymo įrodymų, rodančių statistiškai pageidaujamus terminus (Khurshid, Rogers 1992: 36). Taigi skaitmeniniai korporai leidžia naudoti nologists to revise terminographical information about terms in existing terminų duomenų bazes ir nuolat jas atnaujina. 8Terminologija | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, Šiuolaikinės terminologijos tikslas yra pateikti formalius, semantinius ir funkcinius leksikinių vienetų, turinčių terminologinę vertę, aprašymus, taip to explain their relation with the rest of the units of the linguistic system. pat terminologijos tyrimų objektas yra "gyva terminologija" (terminologija, kuri natūraliai pasitaiko specializuotuose tekstuose) ir terminų naudojimo komunikacinis aspektas, kuris geriausiai patvirtinamas korpuse (Cabré, Montané, Nazar 2012). Tyrimo tikslas, objektas ir tikslai. Tyrimo tikslas - taikyti korpusinės lingvistikos metodiką finansinių daugiakalbių terminų, įskaitant žodį "rizikas" kaip pagrindinį vardinį, ekstrakcijai ir formalinės struktūros analizei anglų, prancūzų ir lietuvių kalbose. Norint pasiekti šį tikslą, buvo nustatyti šie tikslai: 1) išanalizuoti aprašomosios korpusinės terminologijos principus, įskaitant kolokacijos-koligacijos analizės metodus; 2) surinkti ES teisės aktų finansų srityje korpusus trimis kalbomis (anglų, prancūzų ir lietuvių kalbomis) ir pasirinkti tinkamą programinę įrangą, skirtą tyrimams, pagrįstiems korpusu; 3) ištirti dažniausius žodžius iš ištirtų kalbų korpuso ir pasirinkti dažniausią raktinį žodį (vardinį vardą) tolesnei analizei; 4) atlikti pasirinkto raktinio žodžio kolokacinę analizę anglų kalbos korpusas ir ištraukti daugiažodžius terminus, įskaitant pasirinktą raktinį žodį kaip semantinę ir sintaktinę terminų viršūnę iš anglų kalbos korpuso medžiaga; 5) nustatyti pasirinktų anglų terminų prancūzų ir lietuvių ekvivalentus lygiagrečiame anglų, prancūzų ir lietuvių korpusas; 6) atlikti išrinktų daugiakalbių terminų formalios struktūros kiekybinę analizę ir nustatyti, kurie terminų modifikacijos modeliai ir sintaktinės struktūros yra vyraujantys tiriamose kalbose. Tyrimo duomenys ir apimtis. Tyrimo tikslais - trys vienkalbiai korpusai four corpora of the EU documents of financial domain were compiled: (anglų, prancūzų ir lietuvių kalbos) ir vienas lygiagrečias korpusas (EN-FR-LT). Korpusų dydžiai yra tokie: EN 802 933 žodžiai, FR 940 655 žodžiai, LT 639 279 žodžiai. Iš viso buvo suteikta 210 finansinių lėšų. 8 Oksana Smirnova Daugiažodžių terminų korpusinė analizė Įskaitant terminus, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian įskaitant žodį "rizikas" kaip pagrindinį vardinį, ištrauktus iš korpusų: 70 anglų terminų ir jų ekvivalentų prancūzų ir lietuvių kalbomis. Žodžio "rizikas" pasirinkimas buvo nustatytas pagal duomenų rinkinį, iš kurio paaiškėjo, kad šis žodis buvo dažniausias atrinktuose ES dokumentuose. 2. Mokslinių tyrimų teoriniai principai 2.1 Preskripcinės ir aprašomosios terminologijos valdymas Naturalinių kalbų tyrimų skaičiavimo technologijų evoliucija aiškiai atskyrė tradicinę terminologiją nuo šiuolaikinės. Terminologų požiūris į terminų koncepciją, terminų šaltinius, terminų standartizaciją ir kitus terminologijos klausimus pasikeitė, nes buvo atskirta: preskripcinė terminologija ir siderably. Two directions of terminology research and management have aprašomoji terminologija (Zeller 2005; Bielinskienė et al. 2015). Preskripcinės terminologijos gynėjai sutelkia dėmesį į terminologijos standartizaciją, pagrįstą terminologijos žodynų, duomenų bazių, patvirtintos terminologijos sąrašų ir standardizacijos principų dokumentų pagrindu. Preskripcinėje terminologijoje termino koncepcija grindžiama joje aprašytos sąvokos vieta domeno sąvokinėje hierarchinėje sistemoje ir jos santykiais su kitomis sąvokomis (Pearson 1998: 10; Marcinkevičienė 2000: 6). Pagal preskripcinės terminologijos principus vieną terminą reikėtų naudoti apibūdinti vienai sąvokai, nes toks abipusiškumas sumažina dviprasmybės tikimybę, palengvina bendravimą ir tuo pačiu metu skatina domeno sąvokinės hierarchijos sistemos plėtrą. Aprašomieji terminologai atsiskiria nuo griežto požiūrio į terminų koncepciją, terminų vienareikšmiškumą, hierarchinės koncepcinės sistemos plėtrą ir standartizaciją. Aprašomojoje terminologijoje, priešingai nei preskripcinėje, kontekstas atlieka gyvybiškai svarbų vaidmenį analizuojant terminą, o terminas laikomas leksikiniu vienetu, priklausomu nuo jo konteksto. Jų tikslas nėra suformuoti terminą pagal tam tikrus principus, bet užrašyti jo naudojimą, jo formų įvairovę skirtinguose tekstuose ir apibūdinti jo ypatumus, taip sudarant jo standartizacijos pagrindą (Bielinskienė et al. 2015: 10[…]11). Technologijų vystymasis sukėlė milžinišką informacijos srautą, pateiktą įvairių tipų tekstuose, ir tuo pačiu metu nuolat didėjantį juose naudojamų terminų skaičių. Šioje nuolat besikeičiančioje realybėje terminas 9Terminologija | 2018 | 25 Nologai nebegali kontroliuoti greito terminologijos vystymosi, nes terminai keičiasi greičiau nei jie yra apdorojami. Todėl terminologijos valdymui reikalingas lankstesnis požiūris, pagrįstas aprašymu, o ne recepto metodika. Pagrindinis dėmesys buvo sutelktas nuo terminologijos standartizavimo į terminologijos analizę korpusuose (Bielinskienė et al. 2015: 11). Komunikacinė terminologijos teorija (angl. Communicative Theory of Terminology) - terminologijos, kuri sutelkia dėmesį į gyvą terminologiją, kuri naudojama specializuotuose diskursuose, ir akcentuoja terminų naudojimo komunikacinį aspektą (Cabré, Montané, Nazar, 2012). Pagal šią teoriją, pagrindinis terminų vaidmuo yra perduoti ekspertines žinias; Taigi jie yra suvokiami kaip "trijų poliedras, turintis kognityvinį komponentą (konceptą), lingvistinį komponentą (terminą) ir komunikacinį komponentą (situaciją) " (Cabré, Montané, Nazar 2012: 1). Terminologiniai tyrimai, pagrįsti komunikacinės teorijos, domisi ne tik terminologija, nustatyta standartais arba randama oficialiose duomenų bazėse, bet ir (ypač) tais terminais, kurie iš tikrųjų naudojami kalbos tekstuose tam tikriems tikslams. Taigi, komunikacinė teorija […] ne tik priima in vitro metodą, bet taip pat domisi in vivo sąlygomis[…] (Cabré, Montané, Nazar 2012: 1[…]2). Gyvojo terminologijos tyrimai atskleidžia, kad tradicinė terminų vienareikšmybės (vienos sąvokos ir tam tikrų terminų atitikimas skirtingose kalbose) sąvoka realioje kalboje nėra gerai pagrįsta. Varijacija (sinonimija, dviprasmiškumas, perifrazės, redundancija) būdinga ne tik bendriems kalbos vienetams, bet ir terminologijai; Taigi sąvokos ir terminai turi būti tiriami "jų dinamiškoje sąveikoje" (Cabré, Montané, Nazar 2012: 2 […] 3). Dėmesys terminų naudojimui padarė korpusus pagrindine šiuolaikinės terminologijos analizės darbo erdve. Skaitmeninės korpuso ir korpuso analizės programinė įranga sustiprino terminologiją turtingais ištekliais ir įrankiais, kurie leidžia terminologams ištraukti terminus iš didelio dokumentų kiekio, užfiksuoti naujausius konkrečios srities terminologijos pokyčius, analizuoti jos evoliuciją, taip pat nustatyti sąvokos tarpusavio ryšį tarp tos pačios srities terminų. Korpora leidžia gauti patikimą, statistiniu pagrindu pagrįstą, anksčiau visiškai nepasiekiamą informaciją apie terminų naudojimą natūralioje kalboje. Todėl korpusų pagrįsta metodika tapo vyraujančia metodika, kuri suteikia būtiną terminologijos tyrimų ir valdymo įrankių rinkinį (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015). 9 0 Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including (Corpus-Driven Analysis of Multi-Word Terms Including) Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms (Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including) Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2 Korpusų analizės principai: kolokacijos ir koligacijos metodai Korpusų terminologijos ekstrakcija ir analizė atliekama naudojant statistinius ir lingvistinius metodus. Duodamuose tyrimuose naudojami kolokaciniai ir koligaciniai metodai. Collocations refer to syntagmatic attraction between lexical units. AcPasak Tomas Lehecka (2015), "kolokacijos sąvoka grindžiama idėja, kad kiekvienas kalbos žodis pirmenybę teikia tam tikriems leksikiniams kontekstams, t. y. kad bet kuris žodis linkęs dažniau pasitaikyti kartu su tam tikrais žodžiais nei su kitais" (Lehecka 2015: 2). Korpusų duomenų statistinė analizė naudojama žodžių patrauklumo laipsniui išmatuoti, jos rezultatai leidžia nustatyti, kurie žodžių deriniai pasirodo kartu žymiai dažniau, nei būtų tikimasi atsitiktinai, atsižvelgiant į žodžių bendrą dažnį korpusuose (Lehecka 2015: 2). Tokiu būdu nustatomos svarbiausios pasirinktų žodžių kolokacijos analizuojamame korpusas. Šis metodas dažniausiai naudojamas leksikinių vienetų kontekstualinės semantinės analizės tikslais, nes jis leidžia stebėti visą ištirtų žodžių žodžių įvairovę, nustatyti vyraujančius žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių žodžių. Kolokacinė analizė tapo nepakeičiama leksikografų priemonė, ji taip pat plačiai taikoma kompiuterinėje lingvistikos srityje mašininio vertimo, natūralios kalbos apdorojimo ir kitų sričių tikslais (Lehecka 2015). Kolokacinis metodas dažnai naudojamas kartu su koligaciniu metodu. Koligacijos sąvoka reiškia leksikinio vieneto ir gramatinio modelio pritraukimą ir yra pagrįsta idėja, kad žodžiai labiau mėgsta būti naudojami tam tikruose gramatiniuose modeliuose ir vengia kitų gramatinių modelių (Sinclair 1998; Lehecka 2015). Koligacinė analizė gali būti pozicija frazėje, extended and encompass the relationship between the lexical unit and klausime, sakinyje, tekste ar diskurse, kur gali būti naudojamas leksikinis vienetas (Hoey 2005: 49 […] 52). Koligacinė analizė buvo plačiai naudojama kartu su lingvistiniais tyrimais, kurie collocational analysis to study the meanings of near-synonyms as corpus atskleidė, kad jie dažnai naudojami skirtinguose leksikiniuose ir gramatiniuose kontekstuose (Lehecka 2015). Korpusų lingvistikos tyrimai 1Terminologija | 2018 | 25 ferentiniai kolokaciniai ir koligaciniai modeliai (Aston, have shown that even different senses of polysemous words may have difBurnard 1998). Taigi kolokacinės ir koligacinės analizės įrodė, kad semantika ir gramatikos neturėtų būti laikomos nepriklausomomis, o analizėse turėtų būti atsižvelgiama taip pat glaudžiai, kaip kolokacinės ir koligacinės ir skirtingų tipų interconnected systems (Lehecka 2015). pragmatic aspect should also be tekstai (Butler 2004: 157; Newman, Rice 2006). 2.3 Kolokacijos-koligacijos metodo preferences of a lexical unit vary significantly between different domains taikymas terminologijos ištraukimui ir analizei Kolokacijos-koligacijos metodą taip pat galima naudoti daugiakalbių terminų ištraukimui; tai ypač tinkama terminologijos išgaunimui, įskaitant iš anksto pasirinktus raktinius žodžius […] žodžius, kurie gali būti terminologiniu požiūriu svarbūs, būdingi domenei, kuriai priklauso korpusas. Ši metodika grindžiama prielaida, kad sudėtingi terminai yra sudaryti iš esamų paprastų terminų (Nakagawa 2001). Korpusų analizės įrankiai ištraukia iš anksto pasirinktų raktinių žodžių kartu pasitaikančius žodžius ir leidžia nustatyti dominuojančias kolokacijas. Šių kolokacijų dalis yra vardinių frazių, kurios turi būti parinktos iš kolokacijų sąrašų naudojant lingvistinius metodus. Pasirinktos vardinės frazės naudojamos tolesnei korpusinių duomenų analizei ir daugiakalbinių terminų, sudarytų iš pasirinktų vardinių frazių ir galbūt papildomų kolokacijų, išgavimui. Atitinkame tyrime išgauti terminai toliau analizuojami naudojant koligacinės analizės principus, siekiant atskleisti formalios terminologijos struktūros modelius tiriamosiose kalbose ir prisidėti prie kontrastiškų terminų formavimo modelių daugiakalbių tyrimų (žr. Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3. Korporatyvumo ir atrankos plėtra Specifinės srities dokumentų korpuso sudarymo tikslas yra tris kartus According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, didesnis. Pirma, terminologai turi susipažinti su tipo minologijos ekstrakcija ir atlikti terminų statistinę analizę; ir of language of the domain; secondly, a corpus is needed to perform ter- 2 Oksana Smirnova Daugiažodžių terminų korpusinė analizė Galiausiai, Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian tekstai naudojami siekiant gauti papildomos informacijos apie terminus, tokias kaip semantinės, sintaktinės ar kolokacinės užuominos (Cabré, Montané, Nazar 2012: 3[…]4). Surinktas korpusas turėtų būti pakankamai didelis ir kokybiškas, kad būtų laikomas atstovaujančiu pasirinktą sritį. Nėra tikslių korpuso dydžio reikalavimų; Tačiau jame turėtų būti kuo daugiau dokumentų, nes kuo didesnis jis, tuo patikimesnės išvados gali būti daromos apie terminologijos naudojimą domene (Cabré, Montané, Nazar 2012: 4). Atsižvelgiant į visus šiuos aspektus, buvo sudarytos ES teisės aktų kopijos anglų, prancūzų ir lietuvių kalbomis. Teisiniai aktai buvo atsisiųsti iš Europos Sąjungos oficialiojo leidinio, kuris yra laisvai prieinamas internetinis šaltinis. Buvo surinkta 101 teisės aktas, susijęs su ES finansiniais klausimais ir priimtas 2014-2017 m. laikotarpiu. Dokumentai buvo transformuoti į paprastą tekstą ir suderinti, kad būtų galima ištraukti terminus ir juos analizuoti. Kompiluoti, suderinti tekstus ir iš jų ištraukti reikalingus duomenis buvo naudojamos trys programos: AntConc (2014), AntPConc (2017), sukurtos ir sertifikuotos Laurence Anthony ir NOVA Text Aligner (2014). AntConc yra nemokama daugialypės platformos įrankių rinkinys, skirtas korpusų lingvistiniams tyrimams ir duomenų pagrįstam mokymuisi, o AntPConc skirtas lygiagrečiam kelių kalbų korpusui sukurti. Abi programos leidžia tyrėjui dirbti su dideliu duomenų kiekiu ir atlikti išsamią daugiakalbią lingvistinę analizę. Įrankiai, kuriuos "AntConc" programa teikia vartotojams, yra šie: žodžių sąrašas, kolokacijos, klasteriai, raktiniai žodžiai, konkordansas, konkordanso plotas, failų peržiūros įrankis. Atitinkame tyrime buvo panaudotos keturios "AntConc" priemonės: • Žodžių sąrašas, leidžiantis nustatyti dažniausius žodžius korpusuose; • Collocates enabled to determine the dominant collocates of the žodį "rizikas" ir išmatuoti jų sintagmatinio patrauklumo žodžiui "rizikas" laipsnį; • Grupėms leista atskleisti dominuojančius daugiakalbius terminus, įskaitant žodį "rizikas" kaip pagrindinį vardinį vardą; • Concordances gave a wide variety of samples illustrating the usage tekstų terminų. AntConc programos momentinis vaizdas pateikiamas 1 paveiksle. 3 Terminologija | 2018 | 25 Prieš sudarant lygiagrečią korpusą, atsisiųsti tekstai trimis kalbomis buvo rankiniu būdu suderinti naudojant programą "NOVA Text Aligner". Po tekstų suderinimo buvo sukurtas lygiagrečias korpusas naudojant AntpConc programą (žr. 2 paveikslą). 2 paveikslas. AntPConc programa 1 paveikslas. "AntConc" programa 4 Oksana Smirnova Daugiažodžių terminų korpusinė analizė, įskaitant Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian AntpConc programą, leido tuo pačiu metu atskleisti pavyzdžius iš trijų kalbų: galima paspausti ant pasirinkto sakinio, kad pamatytumėte ekvivalentus kitomis kalbomis. Programa taip pat leido atskirti raktinius žodžius ir jų kairę ar dešinę išdėstymą naudojant skirtingas spalvas. Tačiau nebuvo galima pamatyti dokumento, iš kurio buvo paimtas pavyzdys. Naudojant lygiagrečią korpusą, buvo ištraukti 70 anglų terminų prancūzų ir lietuvių ekvivalentai. 4.CORPUS ANALYSIS AND TERM EXTRACTION USINg AntConc ir AntpConc programų įrankiai 4.1 Dažniausių žodžių nustatymas korpusuose Norint nustatyti dažniausius žodžius finansinių dokumentų korpuse, buvo naudojamas programos AntConc įrankis "Word list". Jis pateikė žodžių dažnio rezultatus anglų, prancūzų ir lietuvių korpusuose, kurie leido palyginti žodžių dažnį tiriamose kalbose ir sukurti trijų kalbų TOP 10 dažniausių žodžių sąrašą (žr. 1 lentelę). Žodžių sąrašas taip pat suteikė informaciją apie tai, kiek žodžių ženklų ir žodžių tipų buvo korpusuose, ir suteikė prieigą prie konteksto, kuriame buvo naudojami terminai (žr. 1 lentelę). 1 lentelė. TOP 10 dažniausių žodžių korpusuose EN (korpusas) LT (korpusas 933 24727 žodžių "F.R. (corpus 940 655 word tokens, 12365 word types) " 639 279, žetonai, tipai) 1. rizika (3252), rizika rizika (592) rizika (2855), rizika rizika (997) (536), (2549), rizika (1063), rizikai (355), rizikas (4) 2. kreditas (3183), kreditas (3307), kreditą (28), kreditas (8), kreditai kredito (3103), kreditų (52), kredito (6), kreditais (4), kreditus (3), kreditai (18) kreditai (222) (29), kreditams (2) Rinkos (1641), rinkos (1355), rinkose (76), rinkose (75), rinkai rinkų (310), rinkų (424), žygių (51), rinkoms (182), rinkas (7), (484) (229), rinkoje (226), rinkomis (2) 101Terminologija | 2018 | 25 6 lentelė. Terminų postnominalinių modifikacijų modelių sintaktinės struktūros Sintatinės struktūros EN FR LT […] rizika + p. 13 terminai, įstaigos rizika, kredito koncentracijos rizika, rizika pvz.: 22 terminai, pvz.: rizika, […] finansų nuostolių rizika, modelio sistemos rizika, […] rizika + […]risk A 20 terminų, pvz. : intrajournalier, risque spécifique […]risk interne, […] rizika + A + […]specifinė pp 4 terminai, pvz. : koreliacijos rizika, koreliacijos rizika, bendra koreliacijos rizika reikšminga […]risk […] + pp + A […]15 terminų, pvz.: risque de de crédit quotidien, risque sur matière première crédit spécifique […] risque […] rizika + pp risque de crédit + pp + A + […]9 terminai, pvz., : intrajournalier à 24h, risque de liquidité intrajournalier à 24h Diagrama 1. Sąvokų pakeitimo modeliai Oksana Smirnova Daugiažodžių terminų, įskaitant žodžius, korpusinė analizė Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Rezultatai rodo, kad prenominalinė modifikacija dominuoja anglų ir lietuvių kalbose, o postnominalinė modifikacija būdinga prancūzų kalbai. Lietuvių kalboje nenustatyta prenominalinės modifikacijos modelio terminų. Tik anglų kalbos found in French, and no terms of postnominal modification patterns were terminai buvo abiejų tipų, nors visi ištirtos terminai apima vieną ar kelis number of terms with postnominal modifiers is rather low. modifikatorius, kurie yra vardiniai, būdvardžiai ar prepozicinės frazės, užimančios skirtingas pozicijas terminologiniuose vienetuose. Analizės rezultatai rodo, kad anglų ir lietuvių kalbų modifikuotojai yra vardiniai ir būdvardžiai, o prancūzų kalbų žodis "risk" daugiausia modifikuojamas prepozicinėmis frazėmis. Terminai, kurių sudėtyje yra 3 ir daugiau žodžių, gali būti toliau klasifikuojami pagal jų modifikavimo lygius (terminai, įskaitant modifikatorius, modifikuojančius pagrindinį vardinį vardą, ir terminai, įskaitant modifikatorius, modifikuojančius kitus modifikatorius), tačiau dėl ribotos vietos ši analizė šiame straipsnyje nepateikta. Tabelėse apibendrinti rezultatai taip pat rodo, kad terminai skiriasi savo sudedamųjų dalių skaičiumi. Buvo atlikta termino ilgio kiekybinė analizė, kad būtų nustatytas dominuojantis terminų sudedamųjų dalių skaičius tiriamose kalbose; Jos rezultatai pateikiami 2 diagramoje. Diagrama atskleidžia dvi pagrindines tendencijas. Pirma, ES terminų kūrėjai laikosi pagrindinio kalbos ekonomikos reikalavimo (terminų trumpumas): dviejų žodžių terminai yra paplitę visose trijose kalbose. Antra, tik keli anglų ir prancūzų terminai turi daugiau nei 2-3 žodžius, o 2 diagramoje. Terminų sudedamųjų dalių skaičius, kurį nustatė kiti terminologijos tyrėjai. Mokymosi ir mokslo terminologijos domeno automatinio 103Terminologija | 2018 | 25 Svarbi pasirinktų duomenų dalis (17 iš 70) sudaro lietuvių kalbos terminai, kurių yra 4 ar daugiau žodžių. The tendency of prevalence of two-word terms coincides with the teništraukimo ir apibrėžimo tyrime yra dviejų žodžių terminai: jie sudarė daugiau nei du trečdalius iš terminų, atrinktų iš kandidato termino, automatiškai ištraukto iš by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this konstitucinės teisės terminologijos Liudmila Mockienė atskleidė tą pačią tendenciją trijose skirtingose kalbose. Ištirtose anglų, rusų ir lietuvių specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research konstitucinio pobūdžio teisės aktuose daugumą ištrauktų daugiakalbinių terminų sudarė du komponentai: jie sudarė 78,5% anglų daugiakalbinių terminų, 62% rusų daugiakalbinių terminų ir 74,5% lietuvių daugiakalbinių terminų (Mockienė 2016: 43-45). Taigi skirtingų sričių ir skirtingų kalbų terminų kūrėjai linkę laikytis to paties kalbos ekonomijos ir naudotojui palankumo principo. 6. Išvados Programinė įranga "AntCont", naudojama vienkalbinei korpuso analizei, ir "AntpConc", naudojama lygiagrečiai korpuso analizei, leido ištirti anglų, prancūzų ir lietuvių kalbų terminus, įskaitant žodį "rizikas" kaip pagrindinį vardinį vardą, iš specializuotų ES finansinių dokumentų korpuso, sudarytų mokslinių tyrimų tikslais. Ekstrakcija buvo atlikta šiais etapais: • ištraukti anglų, prancūzų ir lietuvių kalbų žodžius (žodžius, turinčius galimą terminologinį reikšmę, būdingą domenei, kurią atstovauja žodžiai) ir pasirinkti dažniausią raktinį žodį (žodį "rizikas") tolesnei analizei; • ištraukiant žodžio "risk" ir vardinių frazių, įskaitant žodį "risk", kaip pagrindinį vardinį žodį su kairės ir (arba) dešinės kolokacijomis iš anglų korpuso; • pasirinkti leksikinius vienetus, kurie turi terminologinę vertę iš ištrauktų vardinių frazių sąrašo; • pasirinktų anglų terminų prancūzų ir lietuvių ekvivalentų nustatymas lygiagrečiame anglų, prancūzų ir lietuvių korpusas. Oksana Smirnova "Corpus-Driven Analysis of Multi-Word Terms Including" Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian taikoma metodika pasirodė tinkama efektyviam terminologijos išgaunimui daugiakalbiškai, kuris gali būti naudojamas terminų bazės kūrimui ar atnaujinimui arba terminų mokslinei analizei. Ištrauktų terminų formalios struktūros analizė atskleidė kai kuriuos pagrindinius term formation tendencies in the investigated languages: • prenominalinė modifikacija dominuoja anglų ir lietuvių kalbose, o postnominalinė modifikacija būdinga prancūzų kalba; • dominuojantys anglų ir lietuvių terminų modifikatoriai yra vardiniai ir būdvardžiai, o prancūzų terminų žodis "risk" dažniausiai modifikuojamas prepozicinėmis frazėmis; • labiausiai paplitęs terminų tipas pagal rinkėjų skaičių yra dviejų žodžių terminai […] jie sudaro didžiausią terminų skaičių TOP 70 sąrašuose anglų, prancūzų ir lietuvių kalbomis; Tai rodo, kad ES terminų kūrėjai laikosi pagrindinio kalbos reikalavimų. guage economy (brevity of terms); • tik keli anglų ir prancūzų terminai turi daugiau nei 2-3 žodžių, o Lietuvos TOP 70 sąraše terminai, kurių yra 4 ir daugiau žodžių, sudaro didelę pasirinktų duomenų dalį (17 iš 70). Formalios struktūros analizės rezultatai atskleidžia terminų formavimo tendencijas tiriamose kalbose ir suteikia terminologinę informaciją, kuri gali būti naudinga terminų kūrėjams ir vertėjams. Tyrime nustatyti sintaktiniai modeliai gali būti naudojami automatinių lingvistinių terminų ekstrakcijos metodų kūrimui be iš anksto pasirinktų raktinių žodžių. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20. 105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. Šaltiniai Europos Sąjungos oficialusis leidinys: https: eur-lex.europa.eu/oj/direct-access.html COMPUTER SOTFWARE uSED FOR THE ANALYSiS Anthony L. 2014: AntConc (Versija 3.4.4w) [Kompiuterinė programinė įranga]. Tokijas, Japonija: Waseda universitetas. Galima rasti adresu http: www.antlab.sci.waseda.ac.jp Anthony L. AntpConc (Versija 1.2.0) [Computer Software 2017:]. Tokijas, Japonija: Waseda universitetas. Galima rasti adresu http: www.antlab.sci.waseda.ac.jp Supernova-soft. "NOVA" tekstų suderinimo įtaisas. Galima rasti interneto svetainėje www.nova-text-aligner.soft112.com. ANgLų, PRANCūzų iR LiETuvių KALbų DAugiAžODžių TERMINų Su žODžiu rizika ANALizė TEKSTYNų LiNgviSTiKOS METODAiS pristatyje Straips empiromi deskriptyvios terminologijos principai bei daugiažodžių terminų su žodžiu tyrimas, tyrimo tikslas taikant tekstynų lingvistikos metodus, surinkti terminus iš finansų srities dokumentų tekstynų ir jų formalios analizės. Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglųprancūzųlietuvių kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 angliškų terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis buvo dažniausias visų trijų kalbų tekstynuose. mos AntConc ir AntPConc. Dirbta tokiais Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės prograetapais: • dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei; 106 Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including • žodžio Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian rizika kolokacijų ir daiktavardinių junginių su pagrindiniu dėmeniu rizika ir jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne; • daiktavardinių junginių, laikytinų daugiažodžių terminais, atrinkimas; • atrinktų angliškų terminų prancūziškų ir lietuviškų atitikmenų nustatymas. Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams. Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose: • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai rodo, kad ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus; • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 23 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų; • anglų ir lietuvių kalbų terminų darybos modeliuose vyrauja prepozicinė ir postpozicinė modifikacija, o prancūzų kalbos postpozicinė modifikacija; • anglų ir lietuvių kalbų terminų priklausomieji dėmenys yra daiktavardžiai ir būdvardžiai, o prancūzų kalboje prielinksninės konstrukcijos. Formaliosios sandaros analizės rezultatai suteikia informacijos, kuri gali būti naudinga terminų kūrėjams ir vertėjams. Tyrimo metu nustatyti sintaksinių struktūrų modeliai gali būti taikomi, kuriant kompiuterinius lingvistinius metodus automatiniam terminų atpažinimui be iš anksto pasirinktų raktinių žodžių. Gauta 2018-05-21 Oksana Smirnova Mykolo Romerio universitetas Ateities g. 20, LT-08303 Vilnius E. paštas [email protected] Sigita Rackevičienė Mykolo Romerio universitetas Ateities g. 20, LT-08303 Vilnius E. paštas [email protected]