scieee AI-readable full text Open interactive document viewer

Corpus-Driven Analysis of Multi-Word Terms Including the Word ‘Risk’ in English, French and Lithuanian

Oksana Smirnova; Sigita Rackevičienė

Abstract

ANGLŲ, PRANCŪZŲ IR LIETUVIŲ KALBŲ DAUGIA ŽODŽIŲ TERMINŲ SU ŽODŽIU RIZIKA ANALIZĖ TEKSTYNŲ LINGVISTIKOS METODAIS    Straipsnyje pristatomi deskriptyviosios terminologijos tyrimo principai bei empirinis daugiažodžių terminų su žodžiu rizika tyrimas, kurio tikslas – taikant tekstynų lingvistikos metodus, surinkti terminus iš ES finansų srities dokumentų tekstynų ir atlikti jų formaliosios sandaros analizę.    Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglų–prancūzų–lietuvių kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 angliškų terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis buvo dažniausias visų trijų kalbų tekstynuose.    Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės progra-mos – AntConc ir AntPConc. Dirbta tokiais etapais:    • dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei;    • žodžio rizika kolokacijų ir daiktavardinių junginių su pagrindiniu dėmeniu rizika ir jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne;    • daiktavardinių junginių, laikytinų daugiažodžiais terminais, atrinkimas;    • atrinktų angliškų terminų prancūziškų ir lietuviškų atitikmenų nustatymas.    Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams.    Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose:    • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai rodo, kad ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus;    • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 2–3 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų;    • anglų ir lietuvių kalbų terminų darybos modeliuose vyrauja prepozicinė ir post­ pozicinė modifikacija, o prancūzų kalbos – postpozicinė modifikacija;    • daugumos anglų ir lietuvių kalbų terminų priklausomieji dėmenys yra daiktavardžiai ir būdvardžiai, o prancūzų kalboje – prielinksninės konstrukcijos.    Formaliosios sandaros analizės rezultatai suteikia informacijos, kuri gali būti naudinga terminų kūrėjams ir vertėjams. Tyrimo metu nustatyti sintaksinių struktūrų modeliai gali būti taikomi, kuriant kompiuterinius lingvistinius metodus automatiniam terminų atpažinimui be iš anksto pasirinktų raktinių žodžių.

Full text

8 6 Oksana Smirnova Analiza korpusowa terminów wielowyrazowych, w tym Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian analiza korpusowa terminów wielowyrazowych obejmujących słowo „Risk” w języku angielskim, francuskim i litewskim OKSANA SMIRNOVA Uniwersytet im. Mykolasa Romerisa, Litwa SIGITA RACKEVIČIENĖ Uniwersytet im. Mykolasa Romerisa, Litwa SŁOWA KLUCZOWE: terminologia opisowa, analiza korpusowa, terminy finansowe, ekstrakcja terminów, wzorce tworzenia terminów 1. WPROWADZENIE Technologie komputerowe otworzyły nowe możliwości dla badań lingwistycznych: korpusy cyfrowe i oprogramowanie do analizy korpusów ułatwiły dostęp do najgłębszych struktur języka i relacji między różnymi jednostkami językowymi oraz umożliwiły ujawnienie osobliwości ich użycia w różnych dziedzinach i na przestrzeni różnych okresów. Dlatego analiza języka naturalnego oparta na korpusach jest obecnie stosowana w szerokim zakresie obszarów lingwistyki: leksykografii, nauczaniu języków, rozwoju tłumaczenia maszynowego, opracowywaniu językowych baz danych itd. Badania terminologiczne również w dużej mierze stały się oparte na korpusach. Korpusy cyfrowe pozwalają terminologom pracować z dużą liczbą dokumentów, obserwować określone cechy języka specjalistycznego, gromadzić informacje o rzeczywistym użyciu terminów i ich ewolucji, wychwytywać nowe terminy, których nie można było intuicyjnie odczuć ani przewidzieć, a także przeprowadzać analizę kontrastywną danych kilku języków. Oprogramowanie do analizy korpusów oraz automatyczne i półautomatyczne narzędzia do ekstrakcji terminów również przyczyniają się do standaryzacji terminologii; na przykład zliczenie częstotliwości synonimów może dostarczyć użytecznych danych dystrybucyjnych wskazujących nologists to revise terminographical information about terms in existing statystycznie preferowane terminy (Khurshid, Rogers 1992: 36). W ten sposób korpusy cyfrowe umożliwiają tworzenie terminobaz i ich stałą aktualizację. 8 7Terminologija | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, celem współczesnej terminologii jest opracowanie formalnych, semantycznych i funkcjonalnych opisów jednostek leksykalnych mających to explain their relation with the rest of the units of the linguistic system. wartość terminologiczną, a przedmiotem badań terminologicznych jest „żywa terminologia” (terminologia, która naturalnie występuje w tekstach specjalistycznych) oraz komunikacyjny aspekt użycia terminów, najlepiej odzwierciedlony w korpusie (Cabré, Montané, Nazar 2012). Cel, przedmiot i zadania badania. Celem badania jest zastosowanie metodologii lingwistyki korpusowej do ekstrakcji i analizy struktury formalnej finansowych terminów wielowyrazowych, w których rzeczownik ‘risk’ występuje jako rzeczownik nadrzędny w języku angielskim, francuskim i litewskim. Aby osiągnąć ten cel, wyznaczono następujące zadania: 1) analiza zasad terminologii opisowej opartej na korpusie, w tym metod analizy kolokacyjnej i koligacyjnej; 2) opracować korpusy aktów prawnych UE z dziedziny finansów w trzech językach (angielskim, francuskim i litewskim) oraz wybrać oprogramowanie odpowiednie do badań opartych na korpusie; 3) wyodrębnić z korpusów najczęściej występujące słowa w badanych językach oraz wybrać najczęściej występujące słowo kluczowe (rzeczownik) do dalszej analizy; 4) przeprowadzić analizę kolokacyjną wybranego słowa kluczowego w korpusie angielskim oraz wyodrębnić terminy wielowyrazowe zawierające wybrane słowo kluczowe jako semantyczną i syntaktyczną głowę terminów z materiału korpusu angielskiego; 5) ustalić francuskie i litewskie odpowiedniki wybranych terminów angielskich w równoległym korpusie angielsko-francusko-litewskim; 6) przeprowadzić ilościową analizę formalnej struktury wybranych terminów wielowyrazowych oraz określić, które wzorce modyfikacji i struktury syntaktyczne terminów dominują w badanych językach. Dane i zakres badań. Na potrzeby badań utworzono trzy korpusy four corpora of the EU documents of financial domain were compiled: jednojęzyczne (angielski, francuski i litewski) oraz jeden korpus równoległy (EN-FR-LT). Rozmiary korpusów są następujące: EN 802 933 słowa, FR 940 655 słów, LT 639 279 słów. Łącznie 210 finan- 8 8 Oksana Smirnova Analiza wielowyrazowych terminów oparta na korpusie, w Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian tym cjalnych terminów, w których rzeczownik „risk” występował jako wyraz nadrzędny, wyodrębniono z korpusów: 70 terminów angielskich oraz ich odpowiedniki w języku francuskim i litewskim. Wybór słowa „risk” został uwarunkowany danymi korpusowymi, które wykazały, że słowo to występowało najczęściej w wybranych dokumentach UE. 2. ZASADY TEORETYCZNE BADANIA 2.1. Preskryptywne i deskryptywne zarządzanie terminologią Rozwój technologii komputerowych na potrzeby badań nad językiem naturalnym wyraźnie odróżnił terminologię tradycyjną od współczesnej. Stosunek terminologów do koncepcji terminu, źródeł terminów, standaryzacji terminów i innych zagadnień terminologicznych uległ zmianie; wyróżniono siderably. Two directions of terminology research and management have terminologię preskryptywną i terminologię deskryptywną (Zeller 2005; Bielinskienė et al. 2015). Zwolennicy terminologii preskryptywnej koncentrują się na standaryzacji terminologii opartej na słownikach terminologicznych, bazach danych, wykazach zatwierdzonej terminologii oraz dokumentach dotyczących zasad standaryzacji. W terminologii preskryptywnej pojmowanie terminu opiera się na miejscu opisywanego przez niego pojęcia w hierarchicznym systemie pojęciowym danej dziedziny oraz na jego relacji z innymi pojęciami (Pearson 1998: 10; Marcinkevičienė 2000: 6). Zgodnie z zasadami terminologii preskryptywnej jeden termin powinien być używany do opisu jednego pojęcia, ponieważ taka wzajemna odpowiedniość zmniejsza prawdopodobieństwo niejednoznaczności, ułatwia komunikację, a jednocześnie rozwój hierarchicznego systemu pojęciowego danej dziedziny. Terminolodzy deskryptywni dystansują się od rygorystycznego podejścia do pojmowania terminu, jednoznaczności terminu, rozwoju hierarchicznego systemu pojęciowego oraz standaryzacji. W terminologii deskryptywnej, w przeciwieństwie do preskryptywnej, kontekst odgrywa istotną rolę w analizie terminu, a termin jest postrzegany jako jednostka leksykalna zależna od swojego kontekstu. Ich celem nie jest tworzenie terminu zgodnie z określonymi zasadami, lecz rejestrowanie jego użycia, różnorodności jego form w różnych tekstach oraz opisywanie jego osobliwości, a tym samym tworzenie podstawy do jego standaryzacji (Bielinskienė et al. 2015: 10–11). Rozwój technologii doprowadził do powstania ogromnego przepływu informacji przedstawianych w różnego rodzaju tekstach, a jednocześnie do stałego wzrostu liczby używanych w nich terminów. W tej nieustannie zmieniającej się rzeczywistości termin- 8 9Terminologija | 2018 | 25 terminolodzy nie są już w stanie kontrolować szybkiego rozwoju terminologii, ponieważ terminy zmieniają się szybciej, niż są opracowywane. Dlatego zarządzanie terminologią wymaga bardziej elastycznego podejścia opartego na metodologii opisowej, a nie preskryptywnej. Punkt ciężkości przesunął się ze standaryzacji terminologii na analizę terminologii w korpusach (Bielinskienė et al. 2015: 11). Terminologia opisowa doprowadziła do rozwoju Komunikacyjnej Teorii Terminologii, która koncentruje się na żywej terminologii używanej w dyskursach specjalistycznych i kładzie nacisk na komunikacyjny aspekt użycia terminów (Cabré, Montané, Nazar 2012). Zgodnie z tą teorią główną rolą terminów jest przekazywanie wiedzy eksperckiej; dlatego są one ujmowane „jako trójwymiarowy poliedr mający komponent kognitywny (pojęcie), komponent językowy (termin) oraz komponent komunikacyjny (sytuacja)” (Cabré, Montané, Nazar 2012: 1). Badania terminologiczne oparte na teorii komunikacyjnej interesują się nie tylko terminologią ustanowioną przez normy lub znajdującą się w oficjalnych bazach danych, lecz także (a w szczególności) terminami, które są faktycznie używane w tekstach języka specjalistycznego. Zatem teoria komunikacyjna „nie tylko przyjmuje podejście in vitro, lecz także interesuje się terminami in vivo” (Cabré, Montané, Nazar 2012: 1–2). Badania żywej terminologii ujawniają, że tradycyjne pojęcie jednoznaczności terminu (relacja jeden do jednego między pojęciem a określonymi terminami w różnych językach) nie znajduje potwierdzenia w języku rzeczywistym. Zmienność (synonimia, wieloznaczność, peryfrazy, redundancja) jest charakterystyczna nie tylko dla jednostek języka ogólnego, lecz także dla terminologii; w związku z tym pojęcia i terminy należy badać „w ich dynamicznej wzajemnej interakcji” (Cabré, Montané, Nazar 2012: 2–3). Skupienie się na użyciu terminów uczyniło korpusy głównym warsztatem współczesnej analizy terminologicznej. Cyfrowe korpusy i oprogramowanie do analizy korpusowej wzbogaciły terminologię o bogate zasoby i narzędzia, które umożliwiają terminologom wydobywanie terminów z dużej liczby dokumentów, uchwycenie najnowszych zmian w terminologii określonej dziedziny, analizowanie jej ewolucji, a także ustalanie powiązań pojęciowych między terminami należącymi do tej samej dziedziny. Korpusy umożliwiają uzyskanie wiarygodnych, opartych na statystyce informacji o użyciu terminów w języku naturalnym, które wcześniej były całkowicie niedostępne. Dlatego metodologia oparta na korpusach stała się dominującą metodologią, zapewniającą niezbędny zestaw narzędzi do badań i zarządzania terminologią (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015). 9 0 Oksana Smirnova Analiza korpusowa terminów wielowyrazowych obejmujących Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2. Zasady analizy korpusowej: metody kolokacyjne i koligacyjne Ekstrakcję i analizę terminologii sterowaną korpusem przeprowadza się z wykorzystaniem metod statystycznych i lingwistycznych. W niniejszych badaniach zastosowano metody kolokacyjne i koligacyjne. Collocations refer to syntagmatic attraction between lexical units. AcZgodnie z Tomasem Lehecką (2015), „koncepcja kolokacji opiera się na założeniu, że każde słowo w języku preferuje pewne konteksty leksykalne względem innych, tj. że dane słowo ma tendencję do współwystępowania z pewnymi słowami częściej niż z innymi” (Lehecka 2015: 2). Analiza statystyczna danych korpusowych służy do pomiaru stopnia przyciągania między słowami, a jej wyniki umożliwiają określenie, które połączenia wyrazowe występują razem istotnie częściej, niż można by oczekiwać przypadkowo, biorąc pod uwagę całkowitą frekwencję tych słów w korpusie (Lehecka 2015: 2). W ten sposób ustala się najbardziej istotne kolokacje wybranych słów w analizowanym korpusie. Metodę tę stosuje się przede wszystkim do kontekstowej analizy semantycznej jednostek leksykalnych, ponieważ umożliwia ona zaobserwowanie całej różnorodności słów współwystępujących z badanymi słowami, ustalenie dominujących wzorców współwystępowania, a tym samym opisanie ich znaczeń na podstawie ich środowiska kontekstowego (Atkins, Rundell, Sato 2003: 340–341). Analiza kolokacyjna stała się niezbędnym narzędziem dla leksykografów; jest również szeroko stosowana w lingwistyce komputerowej na potrzeby tłumaczenia maszynowego, przetwarzania języka naturalnego i innych dziedzin (Lehecka 2015). Metoda kolokacyjna jest często stosowana w połączeniu z metodą koligacyjną. Pojęcie koligacji odnosi się do przyciągania jednostki leksykalnej i wzorca gramatycznego oraz opiera się na założeniu, że wyrazy preferują użycie w określonych wzorcach gramatycznych i unikają innych wzorców gramatycznych (Sinclair 1998; Lehecka 2015). extended and encompass the relationship between the lexical unit and Analiza koligacyjna może dotyczyć pozycji w wyrażeniu, zdaniu podrzędnym, zdaniu, tekście lub dyskursie, w której można użyć danej jednostki leksykalnej (Hoey 2005: 49–52). Analiza koligacyjna była szeroko stosowana w połączeniu z badaniami collocational analysis to study the meanings of near-synonyms as corpus lingwistycznymi, które wykazały, że są one często używane w różnych kontekstach leksykalnych i gramatycznych (Lehecka 2015). Badania z zakresu lingwistyki korpusowej 9 1Terminologija | 2018 | 25 nych wzorców kolokacyjnych i koligacyjnych (Aston, have shown that even different senses of polysemous words may have difBurnard 1998). Analizy kolokacyjne i koligacyjne wykazały zatem, że semantyki i gramatyki nie należy traktować niezależnie, lecz raczej ściśle uwzględniać je w analizach kolokacyjnych i koligacyjnych oraz różnych typów tekstów interconnected systems (Lehecka 2015). pragmatic aspect should also be (Butler 2004: 157; Newman, Rice 2006). 2.3. Zastosowanie metody preferences of a lexical unit vary significantly between different domains kolokacyjno-koligacyjnej w ekstrakcji i analizie terminów Metoda kolokacyjno-koligacyjna może być również stosowana do ekstrakcji terminów wielowyrazowych; jest szczególnie odpowiednia do ekstrakcji terminologii, w tym wcześniej wybranych słów kluczowych – słów o potencjalnym znaczeniu terminologicznym, charakterystycznych dla dziedziny, do której należy korpus. Metodologia ta opiera się na założeniu, że terminy złożone składają się z istniejących terminów prostych (Nakagawa 2001). Narzędzia do analizy korpusów wyodrębniają współwystępujące słowa wcześniej wybranych słów kluczowych i umożliwiają ustalenie dominujących kolokacji. Część tych kolokacji stanowią frazy rzeczownikowe, które należy wybrać z list kolokacji za pomocą metod lingwistycznych. Wybrane frazy rzeczownikowe są wykorzystywane do dalszej analizy danych korpusowych i ekstrakcji terminów wielowyrazowych, składających się z wybranych fraz rzeczownikowych oraz potencjalnie dodatkowych kolokatów. W niniejszym badaniu wyekstrahowane terminy są następnie analizowane z wykorzystaniem zasad analizy koligacyjnej, mającej na celu ujawnienie formalnych modeli struktury terminologii w badanych językach oraz wniesienie wkładu w kontrastywne, wielojęzyczne badania wzorców tworzenia terminów (por. Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3. ROZWÓJ KORPUSÓW I WYBÓR OPROGRAMOWANIA DO ANALIZY celem opracowania korpusu dokumentów z According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, określonej dziedziny jest trojaki. Po pierwsze, terminolodzy muszą zapoznać się z typologią ekstrakcji terminów i przeprowadzać analizy of language of the domain; secondly, a corpus is needed to perform terstatystyczne terminów; oraz 9 2 Oksana Smirnova Analiza terminów wielowyrazowych oparta na korpusie Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Wreszcie teksty są wykorzystywane do uzyskania dodatkowych informacji o terminach, takich jak wskazówki semantyczne, syntaktyczne lub kolokacyjne (Cabré, Montané, Nazar 2012: 3–4). Skompilowany korpus powinien mieć wystarczający rozmiar i odpowiednią jakość, aby można go było uznać za reprezentatywny dla wybranej dziedziny. Nie ma precyzyjnych wymagań dotyczących rozmiaru korpusu; powinien jednak zawierać jak najwięcej dokumentów, ponieważ im jest większy, tym bardziej wiarygodne mogą być wnioski dotyczące użycia terminologii w danej dziedzinie (Cabré, Montané, Nazar 2012: 4). Uwzględniając wszystkie te aspekty, skompilowano korpusy aktów prawnych UE w językach angielskim, francuskim i litewskim. Akty prawne pobrano z Dziennika Urzędowego Unii Europejskiej, który jest ogólnodostępnym źródłem internetowym. Zebrano 101 aktów prawnych dotyczących kwestii finansowych UE, uchwalonych w okresie 2014–2017. Dokumenty przekształcono w zwykły tekst i zestawiono w celu wyodrębnienia terminów oraz ich analizy. Do zestawienia i wyrównania tekstów oraz wyodrębnienia z nich niezbędnych danych wykorzystano trzy programy: AntConc (2014), AntPConc (2017), stworzone i certyfikowane przez Laurence’a Anthony’ego, oraz NOVA Text Aligner (2014). AntConc to bezpłatny, wieloplatformowy zestaw narzędzi do prowadzenia badań z zakresu lingwistyki korpusowej i uczenia się opartego na danych, natomiast AntPConc służy do tworzenia korpusu równoległego w kilku językach. Oba programy umożliwiają badaczowi pracę z dużą ilością danych oraz przeprowadzenie kompleksowej wielojęzycznej analizy lingwistycznej. Narzędzia udostępniane użytkownikom przez program AntConc są następujące: Word list, Collocates, Clusters, Keywords, Concordance, Concordance plot, File view tool. W niniejszym badaniu zastosowano cztery narzędzia programu AntConc: • Wordlist umożliwiło określenie najczęściej występujących słów w korpusach; • Collocates enabled to determine the dominant collocates of the słowo „risk” i zmierzyć stopień ich syntagmatycznej atrakcyjności względem słowa „risk”; • Klastry pozwalające ujawnić najbardziej dominujące terminy wielowyrazowe zawierające słowo „risk” jako rzeczownik nadrzędny; • Concordances gave a wide variety of samples illustrating the usage terminów w tekstach. Zrzut ekranu programu AntConc przedstawiono na rysunku 1. 9 3Terminologija | 2018 | 25 Przed opracowaniem korpusu równoległego pobrane teksty w trzech językach zostały ręcznie wyrównane za pomocą programu NOVA Text Aligner. Po wyrównaniu tekstów zbudowano korpus równoległy przy użyciu programu AntpConc (zob. rysunek 2). Rysunek 2. Program AntPConc Rysunek 1. Program AntConc 9 4 Oksana Smirnova Analiza sterowana korpusem terminów Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian wielowyrazowych, w tym Program AntpConc umożliwiał wyświetlanie przykładów z trzech języków jednocześnie: można było kliknąć wybrane zdanie, aby zobaczyć jego odpowiedniki w innych językach. Program umożliwiał również rozróżnienie słów kluczowych oraz ich lewych lub prawych kolokatów za pomocą różnych kolorów. nie można było jednak zobaczyć dokumentu, z którego zaczerpnięto przykład. Za pomocą korpusu równoległego wyodrębniono francuskie i litewskie odpowiedniki 70 terminów angielskich. 4. ANALIZA KORPUSU I EKSTRAKCJA TERMINÓW Z WYKORZYSTANIEM NARZĘDZIA PROGRAMÓW AntConc I AntpConc 4.1. Ustalenie najczęściej występujących słów w korpusach W celu ustalenia najczęściej występujących słów w korpusie dokumentów finansowych wykorzystano narzędzie Word list programu AntConc. Dostarczyło ono wyników dotyczących częstotliwości występowania słów w korpusach angielskim, francuskim i litewskim, co umożliwiło porównanie częstotliwości słów w badanych językach oraz opracowanie trójjęzycznej listy TOP 10 najczęściej występujących słów (zob. Tabela 1). Word list dostarczyło również informacji o liczbie tokenów słownych i typów słów w korpusach oraz zapewniło dostęp do kontekstu, w którym użyto terminów (zob. Tabela 1). Tabela 1. 10 najczęściej występujących słów w korpusach EN (korpus 802 933 słów LT tokenów, 9333 słów) typów słów) FR (korpus 940 655 tokenów słów, 12365 typów słów) (korpus 639 279 24727 typów 1. ryzyko (3252), (1063), rizika risks risque (2855), (592) risques (997) rizikos (2549), riziką (536), rizikai (355), rizikas (4) 2. kredyt (3183), credit (3307), kreditą (28), kreditas (8), kreditai kredito (3103), kreditų (52), kreditu (6), kreditais (4), kreditus (3), credits (18) credits (222) (29), kreditams (2) 3. market (1642), marché (1631), (229), rinkoje (226), rinką (76), rinkos (1355), rinkų (310), rinka rinkose (75), rinkai (51), markets (424) marches (484) rinkoms (18), rinkas (7), rinkomis (2) 101Terminologija | 2018 | 25 Tabela 6. Struktury składniowe wzorców postnominalnej modyfikacji terminów Struktury składniowe EN FR LT „risk” + pp 13 terminów, of the institution, risque de concentration, risk of np.: 22 terminy, np.: risk de crédit, – risk to loss risque de modèle financial system, risque „risk” + A –ryzyko 20 terminów, np. : śróddzienne, – wewnętrzne, ryzyko specyficzne ryzyko „risk” + A + –specyficzne ryzyko pp 4 terminy, np. : korelacji, znaczące ogólne ryzyko korelacji ryzyko korelacji, ‘risk’ + pp + A –15 terminów, np.: specyficzne ryzyko kredytowe, ryzyko surowcowe kredytowe – dzienne ryzyko „risk” + + pp ryzyko pp + A + –9 terminów, np. : kredytowe – śróddzienne do 24h risque de liquidité śróddzienne do 24h, Diagram 1. Wzorce modyfikacji terminów 102 Oksana Smirnova Analiza wielowyrazowych terminów oparta na korpusie Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Wyniki pokazują, że modyfikacja przydawkowa prenominalna dominuje w językach angielskim i litewskim, podczas gdy modyfikacja przydawkowa postnominalna jest charakterystyczna dla języka francuskiego. W języku found in French, and no terms of postnominal modification patterns were litewskim nie wykryto terminów o prenominalnym wzorcu modyfikacji. Tylko number of terms with postnominal modifiers is rather low. terminy angielskie należały do obu typów, chociaż wszystkie analizowane terminy zawierają jeden lub kilka modyfikatorów, którymi są rzeczowniki, przymiotniki lub wyrażenia przyimkowe zajmujące różne pozycje w jednostkach terminologicznych. Wyniki analizy pokazują, że dominującymi modyfikatorami terminów angielskich i litewskich są rzeczowniki i przymiotniki, podczas gdy w terminach francuskich słowo „risk” jest najczęściej modyfikowane przez wyrażenia przyimkowe. Terminy obejmujące 3 i więcej słów można dalej klasyfikować według poziomów modyfikacji (terminy obejmujące modyfikatory modyfikujące rzeczownik nadrzędny oraz terminy obejmujące modyfikatory modyfikujące inne modyfikatory), jednak ze względu na ograniczoną objętość niniejsza analiza nie została przedstawiona w tym artykule. Podsumowane wyniki przedstawione w tabelach pokazują również, że terminy różnią się liczbą swoich składników. Przeprowadzono analizę ilościową długości terminów w celu ustalenia dominującej liczby składników terminów w badanych językach; jej wyniki przedstawiono na Diagramie 2. Diagram ukazuje dwie główne tendencje. Po pierwsze, twórcy terminów UE przestrzegają głównego wymogu ekonomii języka (zwięzłości terminów): we wszystkich trzech językach przeważają terminy dwuwyrazowe. Po drugie, tylko kilka angielskich i francuskich terminów ma więcej niż 2–3 słowa, jak pokazano na Diagramie 2. Liczba składników terminów Tendencje ustalone przez innych badaczy 103Terminologija | 2018 | 25 Terminy litewskie obejmujące 4 i więcej słów stanowią znaczącą część wybranych danych (17 z 70). The tendency of prevalence of two-word terms coincides with the tenterminologii. Badania nad automatycznym wydobywaniem i definiowaniem terminologii z dziedziny edukacji i nauki wykazały, że terminy dwuwyrazowe by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this stanowiły ponad dwie trzecie terminów wybranych spośród kandydatów terminologicznych automatycznie wydobytych z korpusu terminologii prawa specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research konstytucyjnego; badania Liudmili Mockienė ujawniły tę samą tendencję w trzech różnych językach. W badanych angielskich, rosyjskich i litewskich aktach prawnych o charakterze konstytucyjnym większość wydobytych terminów wielowyrazowych składała się z dwóch składników: stanowiły one 78,5% angielskich terminów wielowyrazowych, 62% rosyjskich terminów wielowyrazowych i 74,5% litewskich terminów wielowyrazowych (Mockienė 2016: 43-45). Zatem twórcy terminów z różnych dziedzin i różnych języków mają tendencję do przestrzegania tej samej zasady ekonomii języka i przyjazności dla użytkownika. 6. WNIOSKI Oprogramowanie AntCont, używane do analizy korpusów jednojęzycznych, oraz AntpConc, używane do analizy korpusów równoległych, umożliwiło ekstrakcję angielskich, francuskich i litewskich terminów wielowyrazowych, w tym terminów, w których słowo „risk” występuje jako rzeczownik nadrzędny, ze specjalistycznych korpusów dokumentów UE z dziedziny finansów, zestawionych na potrzeby badania. Ekstrakcję przeprowadzono w następujących etapach: • wyodrębnienie słów kluczowych z korpusów angielskiego, francuskiego i litewskiego (słów o potencjalnym znaczeniu terminologicznym, charakterystycznych dla dziedziny reprezentowanej przez korpusy) oraz wybór najczęściej występującego słowa kluczowego (słowa „risk”) do dalszej analizy; • wyodrębnienie kolokacji słowa „risk” oraz fraz rzeczownikowych zawierających słowo „risk” jako rzeczownik nadrzędny, wraz z kolokatami lewostronnymi i/lub prawostronnymi, z korpusu angielskiego; • wybranie jednostek leksykalnych o wartości terminologicznej z listy wyodrębnionych fraz rzeczownikowych; • ustalenie francuskich i litewskich ekwiwalentów wybranych terminów angielskich w równoległym korpusie angielsko-francusko-litewskim. 104 Oksana Smirnova Analiza wielowyrazowych terminów oparta na korpusie Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian Zastosowana metodologia okazała się odpowiednia do skutecznej wielojęzycznej ekstrakcji terminologii, którą można wykorzystać do opracowywania/aktualizowania baz terminologicznych lub do naukowej analizy terminów. Analiza struktury formalnej wyodrębnionych terminów ujawniła kilka głównych term formation tendencies in the investigated languages: • modyfikacja prenominalna dominuje w językach angielskim i litewskim, podczas gdy modyfikacja postnominalna jest charakterystyczna dla języka francuskiego; • dominującymi modyfikatorami terminów angielskich i litewskich są rzeczowniki i przymiotniki, podczas gdy w terminach francuskich słowo „risk” jest najczęściej modyfikowane przez wyrażenia przyimkowe; • najczęściej występującym typem terminu pod względem liczby składników są terminy dwuwyrazowe – stanowią one największą liczbę terminów na listach TOp 70 w językach angielskim, francuskim i litewskim; co pokazuje, że twórcy terminów UE respektują główny wymóg jęguage economy (brevity of terms); • tylko nieliczne terminy angielskie i francuskie mają więcej niż 2–3 słowa, podczas gdy na litewskiej liście TOp 70 terminy obejmujące 4 i więcej słów stanowią znaczącą część wybranych danych (17 z 70). Wyniki analizy struktury formalnej ujawniają tendencje w tworzeniu terminów w badanych językach i dostarczają informacji terminologicznych, które mogą być przydatne dla twórców terminów i tłumaczy. Wzorce składniowe ustalone w badaniu mogą być wykorzystywane do opracowywania automatycznych metod lingwistycznych ekstrakcji terminów bez uprzednio wybranych słów kluczowych. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20. 105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. ŹRÓDŁA Dziennik Urzędowy Unii Europejskiej: https://eur-lex.europa.eu/oj/direct-access.html OPROGRAMOWANIE KOMPUTEROWE WYKORZYSTANE DO ANALIZY Anthony L. 2014: AntConc (Version 3.4.4w) [Oprogramowanie komputerowe]. Tokio, Japonia: Waseda University. Dostępne pod adresem http://www.antlab.sci.waseda.ac.jp Anthony L. 2017: AntpConc (Version 1.2.0) [Oprogramowanie komputerowe]. Tokio, Japonia: Waseda University. Dostępne pod adresem http://www.antlab.sci.waseda.ac.jp Supernova-soft. NOVA Text Aligner. Dostępne na stronie https://nova-text-aligner.soft112.com/. ANALIZA WIELOFRAZOWYCH TERMINÓW ANGIELSKICH, FRANCUSKICH I LITEWSKICH Z WYRAZEM RYZYKO METODAMI LINGWISTYKI KORPUSOWEJ W artykule przedstawiono zasady badań terminologii deskryptywnej oraz empiryczne badanie wielowyrazowych terminów z wyrazem ryzyko, którego celem jest – przy zastosowaniu metod lingwistyki korpusowej – zebranie terminów z korpusów dokumentów z dziedziny finansów UE i przeprowadzenie analizy ich budowy formalnej. Na potrzeby badania zgromadzono cztery korpusy: korpus dokumentów z dziedziny finansów w języku angielskim (802 933 słowa), francuskim (940 655 słów) i litewskim (639 279 słów) oraz równoległy korpus języków angielskiego–francuskiego–litewskiego. Z korpusów zebrano 210 terminów, w których wyraz ryzyko jest głównym członem: 70 terminów angielskich oraz po tyle samo ich odpowiedników w języku francuskim i litewskim. Wybór wyrazu ryzyko wynikał z tego, że wyraz ten był najczęstszy we Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės prograwszystkich trzech korpusach językowych. mos – AntConc i AntPConc. Pracowano w następujących etapach: • ustalenie w korpusach angielskim, francuskim i litewskim najczęstszych wyrazów, które mogą stanowić rdzeń terminów, oraz wybranie jednego z nich (wyrazu ryzyko) do dalszej analizy; 106 Oksana Smirnova Analiza korpusowa wielowyrazowych terminów zawierających Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian • ustalenie kolokacji wyrazu ryzyko oraz połączeń rzeczownikowych z głównym członem ryzyko i jego lewostronnymi oraz prawostronnymi kolokatami w korpusie angielskim; • wyselekcjonowanie połączeń rzeczownikowych uznawanych za terminy wielowyrazowe; • ustalenie francuskich i litewskich odpowiedników wybranych terminów angielskich. Zastosowana metodologia umożliwiła skuteczne zebranie terminów wielowyrazowych z wielojęzycznych korpusów. Daje to podstawę do stwierdzenia, że może być ona stosowana do gromadzenia terminów oraz badań nad nimi. Analiza formalnej struktury zebranych terminów ujawniła kilka istotnych tendencji słowotwórczych terminów w badanych językach: • dominującym typem terminów pod względem liczby członów we wszystkich trzech badanych językach są terminy dwuwyrazowe; wskazuje to, że twórcy terminów UE przestrzegają zasady ekonomii językowej i starają się tworzyć możliwie najkrótsze terminy wielowyrazowe; • tylko kilka terminów angielskich i francuskich ma więcej niż 2–3 człony; tymczasem terminy litewskie składające się z 4 i większej liczby członów stanowią niemal jedną czwartą zebranych terminów; • w modelach słowotwórczych terminów języka angielskiego i litewskiego dominuje modyfikacja prepozycyjna i postpozycyjna, natomiast w języku francuskim – modyfikacja postpozycyjna; • zależnymi członami większości terminów języka angielskiego i litewskiego są rzeczowniki i przymiotniki, natomiast w języku francuskim – konstrukcje przyimkowe. Wyniki analizy struktury formalnej dostarczają informacji, które mogą być przydatne twórcom terminów i tłumaczom. Ustalone w toku badania modele struktur syntaktycznych mogą być stosowane przy tworzeniu komputerowych metod lingwistycznych do automatycznego rozpoznawania terminów bez wcześniej wybranych słów kluczowych. otrzymano 2018-05-21 Oksana Smirnova Uniwersytet Michała Römera ul. Ateities 20, LT-08303 Wilno E-mail: [email protected] Sigita Rackevičienė Uniwersytet Michała Römera ul. Ateities 20, LT-08303 Wilno E-mail: [email protected]