8 Oksana Smirnova Analyse basée sur le corpus des termes à plusieurs Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian mots, y compris l'analyse basée sur le corpus des termes à plusieurs mots Termes comprenant le mot "risque" en anglais, français et lituanien OKSANA SMIRNOVA Université Mykolas Romeris, en Lituanie SIGITA RACKEVIČIENĖ Université Mykolas Romeris, Lituanie KEYWORDS: terminologie descriptive, analyse basée sur le corpus, termes financiers, extraction de termes, modèles de formation de termes 1. INTRODUCTION (présentation de la présente décision) Les technologies informatiques ont ouvert de nouvelles possibilités à la recherche linguistique: les corpus numériques et les logiciels d'analyse des corpus ont facilité l'accès aux structures linguistiques les plus profondes et aux relations entre les différentes unités linguistiques et ont révélé les particularités de leur utilisation dans différents domaines sur différentes périodes de temps. Par conséquent, l'analyse du langage naturel basée sur le corpus est aujourd'hui appliquée dans un large éventail de domaines linguistiques: lexicographie, enseignement des langues, développement de la traduction automatique, compilation de bases de données linguistiques, etc. La recherche sur la terminologie est également devenue en grande partie axée sur le corpus. Les corpus numériques permettent aux terminologues de travailler avec une grande quantité de documents, d'observer des caractéristiques particulières d'une langue spécialisée, de recueillir des informations sur l'utilisation réelle des termes et leur évolution, de capturer de nouveaux termes qui ne pouvaient pas être intuitivement ressentis ou prévus, ainsi que de procéder à une analyse contrastée des données de plusieurs langues. Les logiciels d'analyse de corpus, les outils d'extraction automatique et semi-automatique de termes contribuent également à la normalisation de la terminologie, par exemple, le compte de fréquence des nologists to revise terminographical information about terms in existing synonymes peut fournir des preuves de distribution utiles indiquant les termes statistiquement préférés (Khurshid, Rogers 1992: 36). Ainsi, les corpus numériques permettent des bases de données et les mettent constamment à jour.
8Terminologie | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, L'objectif de la terminologie moderne est de produire des descriptions formelles, sémantiques et fonctionnelles d'unités lexicales ayant une to explain their relation with the rest of the units of the linguistic system. valeur terminologique ainsi que l'objet de la recherche terminologique est "la terminologie vivante" (terminologie qui se produit naturellement dans des textes spécialisés) et l'aspect communicatif de l'utilisation des termes qui est le mieux instancié dans un corpus (Cabré, Montané, Nazar 2012). Le but, l'objet et les objectifs de la recherche. L'objectif de la recherche est d'appliquer la méthodologie de la linguistique des corpus pour l'extraction et l'analyse de la structure formelle de termes financiers à plusieurs mots, y compris le mot "risque" en tant que nom principal en anglais, français et lituanien. Pour atteindre cet objectif, les objectifs suivants ont été fixés: 1) analyser les principes de la terminologie descriptive basée sur le corpus, y compris les méthodes d'analyses de collocation et de colligation; 2) compiler des corpus d'actes juridiques de l'UE dans le domaine financier en trois langues (anglais, français et lituanien) et sélectionner le logiciel approprié pour la recherche basée sur le corpus; 3) extraire les mots les plus fréquents des corpus dans les langues étudiées et sélectionner le mot-clé (nom) le plus fréquent pour l'analyse ultérieure; 4) effectuer une analyse de collocation du mot-clé sélectionné dans le corpus anglais et extraire des termes à plusieurs mots, y compris le mot-clé sélectionné en tant que chef sémantique et syntaxique des termes du corpus anglais. Matériel du corpus en anglais; 5) établir des équivalents français et lituaniens des termes anglais sélectionnés dans le corpus parallèle anglais-français-lituanien; 6) effectuer une analyse quantitative de la structure formelle des termes à plusieurs mots sélectionnés et déterminer quels modèles de modification et structures syntaxiques des termes sont prédominants dans les langues étudiées. Données et portée de la recherche. Aux fins de la recherche, trois four corpora of the EU documents of financial domain were compiled: corpus monolingues (anglais, français et lituanien) et un corpus parallèle (EN-FR-LT). Les tailles des corpus sont les suivantes: EN 802 933 mots, FR 940 655 mots, LT 639 279 mots. Au total, 210 projets ont été financés.
8 Oksana Smirnova Analyse basée sur le corpus de termes à mots multiples, y Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian compris des termes généraux dont le mot "risque" en tant que nom principal ont été extraits des corpus: 70 termes anglais et leurs équivalents en français et en lituanien. Le choix du mot "risque" a été déterminé par les données du corpus qui ont révélé que ce mot était le plus fréquent dans les documents de l'UE sélectionnés. 2. Les principes théoriques de la recherche 2.1 Gestion de la terminologie prescriptive et descriptive L'évolution des technologies informatiques pour la recherche sur le langage naturel a clairement différencié la terminologie traditionnelle de la terminologie moderne. L'attitude des terminologues à l'égard de la conception d'un terme, des sources de termes, de la normalisation des termes et d'autres questions siderably. Two directions of terminology research and management have terminologiques a changé et une distinction a été faite entre la terminologie prescriptive et la terminologie descriptive (Zeller 2005; Bielinskienė et al. 2015). Les défenseurs de la terminologie prescriptive se concentrent sur la normalisation de la terminologie basée sur des dictionnaires de terminologie, des bases de données, des listes de terminologie approuvée et des documents sur les principes de normalisation. Dans la terminologie prescriptive, la conception d'un terme est basée sur la place du concept, décrit par lui, dans le système hiérarchique conceptuel du domaine et sa relation avec d'autres concepts (Pearson 1998: 10; Marcinkevičienė 2000: 6). Selon les principes de la terminologie prescriptive, un terme devrait être utilisé pour décrire un concept, car une telle réciprocité réduit la probabilité d'ambiguïté, facilite la communication et, simultanément, le développement du système hiérarchique conceptuel d'un domaine. Les terminologues descriptifs s'éloignent de l'attitude stricte envers la conception des termes, l'ambiguïté des termes, le développement d'un système conceptuel hiérarchique et la normalisation. Dans la terminologie descriptive, contrairement à la terminologie prescriptive, un contexte joue un rôle essentiel dans l'analyse d'un terme, et un terme est supposé comme une unité lexicale dépendante de son contexte. Leur objectif n'est pas de former un terme selon certains principes, mais d'enregistrer son utilisation, la variété de ses formes dans différents textes et de décrire ses particularités, formant ainsi une base pour sa normalisation (Bielinskienė et al. 2015: 10[…]11). Le développement des technologies a donné lieu à un énorme flux d'informations présentées dans divers types de textes et, en même temps, à un nombre de termes utilisés dans ces textes en constante augmentation. Dans cette réalité en perpétuel changement,
9Terminologija | 2018 | 25 Les nologues ne sont plus en mesure de contrôler le développement rapide de la terminologie car les termes changent plus vite qu'ils ne sont traités. Par conséquent, la gestion de la terminologie nécessite une approche plus flexible basée sur la description plutôt que sur la méthodologie de prescription. L'accent est passé de la normalisation de la terminologie à l'analyse de la terminologie dans les corpus. (Bielinskienė et al. 2015: 11). L'analyse de l'effet de la consommation d'énergie sur l'environnement a été réalisée à l'aide d'une étude réalisée par l'Institut de recherche sur l'environnement et l'environnement. La terminologie descriptive a conduit au développement de la théorie communicative de la terminologie qui met l'accent sur la terminologie vivante utilisée dans les discours spécialisés et met l'accent sur l'aspect communicatif de l'utilisation des termes (Cabré, Montané, Nazar 2012). Selon cette théorie, le rôle principal des termes est de communiquer des connaissances d'experts; Ils sont donc conçus […]comme un polyèdre triple ayant une composante cognitive (le concept), une composante linguistique (le terme) et une composante communicative (la situation)[…] (Cabré, Montané, Nazar 2012: 1). Les études terminologiques basées sur la théorie communicative ne s'intéressent pas seulement à la terminologie établie par les normes ou trouvée dans les bases de données officielles, mais aussi (et en particulier) à ces termes qui sont réellement utilisés dans les textes de la langue à des fins spécifiques. Ainsi, la théorie communicative […]adopte non seulement une approche in vitro, mais s'intéresse également aux termes in vivo[…] (Cabré, Montané, Nazar 2012: 1[…]2). La recherche sur la terminologie vivante révèle que la notion traditionnelle d'univocité des termes (correspondance un-à-un entre un concept et des termes particuliers dans différentes langues) n'est pas bien fondée dans le langage réel. La variation (synonymie, ambiguïté, périphrases, redondance) est caractéristique non seulement des unités linguistiques générales, mais aussi de la terminologie; Ainsi, les concepts et les termes doivent être étudiés […]dans leur interaction dynamique[…] (Cabré, Montané, Nazar 2012: 2[…]3). L'accent mis sur l'utilisation des termes a fait des corpora le principal espace de travail de l'analyse terminologique moderne. Les logiciels d'analyse de corpus numériques et de corpus ont amélioré la terminologie avec de riches ressources et outils qui permettent aux terminologues d'extraire des termes d'une grande quantité de documents, de capturer les derniers changements de terminologie d'un domaine spécifique, d'analyser son évolution ainsi que d'établir une interconnexion conceptuelle entre les termes du même domaine. Corpora permettent d'obtenir des informations fiables, basées sur des statistiques, auparavant totalement indisponibles sur l'utilisation des termes dans le langage naturel. Par conséquent, la méthodologie basée sur le corpus est devenue la méthodologie prédominante fournissant une boîte à outils indispensable pour la recherche et la gestion de la terminologie (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015).
9 0 Oksana Smirnova Analyse basée sur le corpus des termes à plusieurs mots, y compris Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2 Principes d'analyse basée sur le corpus: méthodes de collocalisation et de colligation L'extraction et l'analyse de la terminologie basée sur le corpus sont effectuées à l'aide de méthodes statistiques et linguistiques. Dans la recherche donnée, des méthodes de collocation et de colligation sont appliquées. Collocations refer to syntagmatic attraction between lexical units. AcSelon Tomas Lehecka (2015), […]le concept de collocation est basé sur la notion que chaque mot dans une langue préfère certains contextes lexicaux à d'autres, c'est-à-dire que n'importe quel mot tend à co-apparaître avec certains mots plus souvent qu'avec d'autres[…] (Lehecka 2015: 2). L'analyse statistique des données du corpus est utilisée pour mesurer le degré d'attraction entre les mots, ses résultats permettant de déterminer quelles combinaisons de mots apparaissent ensemble de manière significativement plus fréquente qu'il ne serait prévu par hasard compte tenu de la fréquence totale des mots dans le corpus (Lehecka 2015: 2). De cette façon, les collocations les plus significatives des mots choisis dans le corpus analysé sont établies. Cette méthode est principalement utilisée pour l'analyse sémantique contextuelle des unités lexicales car elle permet d'observer toute la variété des mots coexistants des mots étudiés, d'établir les modèles de coexistence prédominants et ainsi de décrire leurs significations en fonction de leur environnement contextuel (Atkins, Rundell, Sato 2003: 340 […] 341). L'analyse collocationnelle est devenue un outil indispensable pour les lexicographes, elle est également largement appliquée en linguistique computationnelle aux fins de la traduction automatique, du traitement du langage naturel et d'autres domaines (Lehecka 2015). La méthode collocationnelle est souvent utilisée en combinaison avec la méthode colligationnelle. Le concept de colligation se réfère à l'attraction d'une unité lexicale et d'un modèle grammatical et est basé sur la notion que les mots préfèrent être utilisés dans certains modèles grammaticales et évitent d'autres modèles grammaticales (Sinclair 1998; extended and encompass the relationship between the lexical unit and Lehecka 2015). L'analyse colligationnelle peut être la position dans une phrase, une clause, une phrase, un texte ou un discours où l'unité lexicale peut être utilisée (Hoey 2005: 49 […] 52). L'analyse colligationnelle a été largement utilisée en combinaison avec des collocational analysis to study the meanings of near-synonyms as corpus études linguistiques qui ont révélé qu'elles sont souvent utilisées dans différents contextes lexicaux et grammaticaux (Lehecka 2015). Enquêtes linguistiques sur le corpus
9 1Terminologija | 2018 | 25 modèles de collocation et de colligation ferents have shown that even different senses of polysemous words may have dif- (Aston, Burnard 1998). Ainsi, les analyses de collocation et de colligation ont prouvé que la sémantique et la grammaire ne devraient pas être traitées comme indépendantes, mais plutôt prises en considération dans les analyses interconnected systems (Lehecka 2015). pragmatic aspect should also be comme collocation et colligation et différents types de textes (Butler 2004: 157; preferences of a lexical unit vary significantly between different domains Newman, Rice 2006). 2.3 Application de la méthode de collocation-colligation dans l'extraction et l'analyse de la terminologie La méthode de collocation-colligation peut également être utilisée pour l'extraction de termes à plusieurs mots; il est particulièrement approprié pour l'extraction de la terminologie, y compris les mots-clés pré-choisis […] des mots de pertinence terminologique potentielle caractéristique du domaine auquel le corpus appartient. Cette méthodologie est basée sur l'hypothèse que les termes complexes sont constitués de termes simples existants (Nakagawa 2001). Les outils d'analyse du corpus extraient les mots coexistants des mots-clés pré-choisis et permettent d'établir les collocations dominantes. Une partie de ces collocations sont des phrases substantives qui doivent être sélectionnées à partir de listes de collocalisation à l'aide de méthodes linguistiques. Les phrases de noms sélectionnées sont utilisées pour une analyse plus approfondie des données du corpus et l'extraction de termes à plusieurs mots composés des phrases de noms sélectionnées et éventuellement de collocations supplémentaires. Dans la recherche donnée, les termes extraits sont analysés plus en détail à l'aide de principes d'analyse colligative visant à révéler des modèles de structure formelle de la terminologie dans les langues étudiées et à contribuer à des études multilingues contrastées des modèles de formation de termes (cf. Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3. Développement de la corporation et de la sélection L'objectif de la compilation d'un corpus de documents d'un domaine According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, spécifique est triple. Premièrement, les terminologues doivent se familiariser avec l'extraction de la minologie de type et effectuer des of language of the domain; secondly, a corpus is needed to perform teranalyses statistiques des termes; et
9 Oksana Smirnova Analyse basée sur le corpus des termes à plusieurs Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian mots, y compris enfin, les textes sont utilisés pour obtenir des informations complémentaires sur les termes telles que des indices sémantiques, syntaxiques ou de collocation (Cabré, Montané, Nazar 2012: 3[…]4). Le corpus compilé doit être d'une taille et d'une qualité suffisantes pour être considéré comme représentatif du domaine choisi. Il n'existe pas d'exigences précises quant à la taille d'un corpus; mais il devrait contenir le plus de documents possible car plus il est grand, plus des conclusions fiables peuvent être tirées sur l'utilisation de la terminologie dans le domaine (Cabré, Montané, Nazar 2012: 4). En tenant compte de tous ces aspects, les corpus des actes juridiques de l'UE en anglais, en français et en lituanien ont été compilés. Les actes juridiques ont été téléchargés du Journal officiel de l'Union européenne, qui est une source en ligne librement accessible. 101 actes juridiques relatifs aux questions financières de l'UE et promulgués au cours de la période 2014-2017 ont été recueillis. Les documents ont été transformés en texte brut et alignés pour l'extraction des termes et leur analyse. Trois programmes ont été utilisés pour compiler, aligner les textes et en extraire les données nécessaires: AntConc (2014), AntPConc (2017) créé et certifié par Laurence Anthony et NOVA Text Aligner (2014). AntConc est une boîte à outils multiplateforme freeware pour la réalisation de recherches linguistiques de corpus et d'apprentissage basé sur les données, tandis qu'AntPConc est destiné à créer un corpus parallèle de plusieurs langues. Les deux programmes permettent au chercheur de traiter une grande quantité de données et d'effectuer une analyse linguistique multilingue complète. Les outils fournis aux utilisateurs par le programme AntConc sont les suivants: liste de mots, collocations, clusters, mots-clés, concordance, parcelle de concordance, outil de vue de fichier. Dans la recherche donnée, quatre outils d'AntConc ont été appliqués: • Liste des mots permettant de déterminer les mots les plus fréquents dans les corpus; • Collocates enabled to determine the dominant collocates of the le mot "risque" et mesurer le degré d'attraction syntagmatique pour le mot "risque"; • Les groupes sont autorisés à divulguer les termes à plusieurs mots les plus dominants, y compris le mot "risque" comme nom principal; • Concordances gave a wide variety of samples illustrating the usage des termes dans les textes. L'instantané du programme AntConc est présenté à la figure 1.
3Terminologie | 2018 | 25 ans Avant de compiler un corpus parallèle, les textes téléchargés en trois langues ont été alignés manuellement à l'aide du programme NOVA Text Aligner. Après l'alignement des textes, un corpus parallèle a été construit à l'aide du programme AntpConc (voir figure 2). Figure 2. Ce n'est pas le cas. Le programme AntPConc Figure 1. Ce qui suit est une illustration de ce qui s'est passé. Le programme AntConc
9 Oksana Smirnova Analyse basée sur le corpus de termes à plusieurs mots, y Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian compris Le programme AntpConc a permis d'exposer les exemples de trois langues en même temps: on pouvait cliquer sur une phrase choisie pour voir les équivalents dans d'autres langues. Le programme a également permis de distinguer les mots-clés et leurs collocations gauche ou droite par l'utilisation de couleurs différentes. Cependant, il n'a pas été possible de voir le document à partir duquel l'exemple a été extrait. À l'aide du corpus parallèle, des équivalents français et lituaniens de 70 termes anglais ont été extraits. 4.Analyse du corps et extraction des termes Les outils des programmes AntConc et AntpConc 4.1 Détermination des mots les plus fréquents dans les corpus Afin de déterminer les mots les plus fréquents dans le corpus des documents financiers, l'outil Word list du programme AntConc a été utilisé. Il a fourni les résultats de la fréquence des mots dans les corpus anglais, français et lituanien, ce qui a permis de comparer les fréquences des mots dans les langues étudiées et d'élaborer une liste trilingue des 10 mots les plus fréquents (voir tableau 1). La liste des mots fournissait également des informations sur le nombre de tokens de mots et de types de mots présents dans les corpus et donnait accès au contexte dans lequel les termes étaient utilisés (voir le tableau 1). Le tableau 1. TOP 10 des mots les plus fréquents dans les corpus En anglais (corpus) 802 933 mots LT jetons, 933 mots) types de mots) FR (corpus de 940 655 mots de marque, 12365 types de mots) (corpus 639 279, 24727 types de 1. risque (3252), risque (592) risques risque (2855), risque (997) (536), rizikai (2549), risque (1063), (355), rizikas (4) 2. crédit (3183), crédit (3307), crédit créditas (8), créditai (6), créditais (3103), crédit (52), crédits de crédit (4), kreditus (3), créditsams (2) (18) crédits (222) (29), crédit (28), 3. marché (1643), marché (1631), marches (484) (229), rinkoje marchés (1355), rinkų (310), (226), rink (76), rinkose (75), marchés de rinque (424) rinkai (51), rinkoms (182), rinkas (7), rinkomis (2)
101Terminologie | 2018 | 25 Le tableau 6. Structures syntaxiques des modèles de modification postnominale des termes Structures syntaxiques EN FR LT […] risque + page 13 termes, par exemple: de crédit, […] risque pour risque de concentration, termes, par exemple: 22 risque de le système financier, risque de perte risque de modèle l'établissement, risque […] risque + […] risque A 20 termes, par exemple: : intrajournalier, interne, risque spécifique […] risque […] risque + A Le risque spécifique + pp 4 termes, par exemple : de corrélation, le corrélation, le risque général de corrélation risque significatif de […] risque + pp + A […]15 termes, par exemple: risque risque de crédit quotidien, risque sur matière première de crédit spécifique […] […] risque + pp risque de crédit + pp + A + […] 9 termes, par exemple: : […] intrajournalier à 24h risque de liquidité 24h, intrajournalier à Diagramme numéro 1. Modèles de modification des termes
Les résultats montrent que la modification prénominale est dominante dans les Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian langues anglaise et lituanienne, tandis que la modification postnominale est caractéristique de la langue française. Aucun terme de modèle de modification prénominale n'a été détecté en lituanien. Seuls les termes anglais étaient des found in French, and no terms of postnominal modification patterns were deux types, bien que tous les termes étudiés incluent un ou plusieurs number of terms with postnominal modifiers is rather low. modificateurs qui sont des noms, des adjectifs ou des phrases prépositionnelles prenant des positions différentes dans les unités terminologiques. Les résultats de l'analyse révèlent que les modificateurs dominants des termes anglais et lituaniens sont les noms et les adjectifs, tandis que dans les termes français, le mot "risque" est principalement modifié par des phrases prépositionnelles. Les termes comprenant trois mots et plus peuvent être classés en fonction de leurs niveaux de modification (termes comprenant des modificateurs modifiant le nom principal et termes comprenant des modificateurs modifiant d'autres modificateurs), mais, en raison de l'espace limité, cette analyse n'est pas présentée dans ce document. Les résultats résumés dans les tableaux révèlent également que les termes diffèrent par le nombre de leurs constituants. L'analyse quantitative de la longueur du terme a été effectuée pour établir le nombre dominant de constituants du terme dans les langues étudiées; ses résultats sont présentés au diagramme 2. Le diagramme révèle deux tendances principales. Tout d'abord, les développeurs de termes de l'UE respectent l'exigence principale de l'économie linguistique (brèveur des termes): les termes à deux mots sont répandus dans les trois langues. Deuxièmement, seuls quelques termes anglais et français ont plus de 2-3 mots dans le diagramme 2. Nombre de constituants de termes déncies
103Terminologie | 2018 | 25 Les termes lituaniens comprenant au moins quatre mots constituent une partie importante des données sélectionnées (17 sur 70). The tendency of prevalence of two-word terms coincides with the tenétablies par d'autres chercheurs en terminologie. La recherche sur l'extraction automatique et la définition du domaine de la terminologie de l'éducation et de la by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this science sont des termes à deux mots: ils constituaient plus des deux tiers des termes sélectionnés parmi les candidats à un terme extrait automatiquement specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research d'une terminologie de droit constitutionnel par Liudmila Mockienė a révélé la même tendance dans trois langues différentes. Dans les actes juridiques de nature constitutionnelle étudiés en anglais, russe et lituanien, la majorité des termes à plusieurs mots extraits se composaient de deux constituants: ils constituaient 78,5% des termes à plusieurs mots en anglais, 62% des termes à plusieurs mots en russe et 74,5% des termes à plusieurs mots en lituanien (Mockienė 2016: 43-45). Ainsi, les développeurs de termes de différents domaines et de différentes langues ont tendance à adhérer au même principe d'économie linguistique et de convivialité. 6. Conclusions à tirer Le logiciel AntCont, utilisé pour l'analyse des corpus monolingues, et AntpConc, utilisé pour l'analyse des corpus parallèles, ont permis d'extraire des termes à plusieurs mots en anglais, français et lituanien, y compris le mot "risque" en tant que nom principal des corpus spécialisés des documents de l'UE du domaine financier compilés aux fins de la recherche. L'extraction a été effectuée dans les étapes suivantes: • extraire les mots-clés des corpora anglais, français et lituaniens (les mots de pertinence terminologique potentielle caractéristique du domaine que les corpora représentent) et choisir le mot-clé le plus fréquent (le mot "risque") pour une analyse ultérieure; • extraire des collocations du mot "risque" et des phrases substantives comprenant le mot "risque" comme le nom principal avec les collocations gauche et/ou droite du corpus anglais; • sélectionner les unités lexicales qui ont une valeur terminologique dans la liste des phrases substantives extraites; • l'établissement d'équivalents français et lituaniens des termes anglais sélectionnés dans le corpus parallèle anglais-français-lituanien.
La méthodologie appliquée s'est avérée appropriée pour une extraction Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian multilingue efficace de la terminologie qui peut être utilisée pour le développement ou la mise à jour de bases de termes ou l'analyse scientifique des termes. L'analyse de la structure formelle des termes extraits a révélé certains éléments importants. term formation tendencies in the investigated languages: La modification prénominale est dominante dans les langues anglaise et lituanienne, tandis que la modification postnominale est caractéristique de la langue lituanienne. la langue française; • les modificateurs dominants des termes anglais et lituaniens sont des noms et des adjectifs tandis que dans les termes français, le mot "risque" est principalement modifié par des phrases prépositives; • le type de terme le plus répandu en fonction du nombre de constituants est celui des termes à deux mots […] ils constituent le plus grand nombre de termes dans les listes TOP 70 en anglais, français et lituanien; Cela montre que les développeurs de termes de l'UE respectent l'exigence principale de la guage economy (brevity of terms); • seuls quelques termes anglais et français contiennent plus de 2-3 mots, tandis que dans la liste des TOP 70 lituaniennes, les termes comprenant 4 mots et plus constituent une partie importante des données sélectionnées (17 sur 70). Les résultats de l'analyse de la structure formelle révèlent les tendances de formation des termes dans les langues étudiées et fournissent des informations terminologiques qui pourraient être utiles pour les développeurs de termes et les traducteurs. Les modèles syntaxiques établis dans la recherche peuvent être utilisés pour le développement de méthodes linguistiques automatiques d'extraction de termes sans mots-clés pré-choisis. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20.
105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. Les sources Le journal officiel de l'Union européenne: https: eur-lex.europa.eu/oj/direct-access.html COMPUTER SOTFWARE uSED FOR THE ANALYSiS Anthony L. 2014: AntConc (Version 3.4.4w) [Programme informatique] Le logiciel informatique est conçu pour être utilisé dans le traitement de données. Tokyo, Japon: Université de Waseda. Elle est située à Tokyo. Disponible à l'adresse suivante: http: www.antlab.sci.waseda.ac.jp Anthony L. AntpConc (Version 1.2.0) [Software informatique 2017:]. Tokyo, Japon: Université de Waseda. Elle est située à Tokyo. Il est disponible à l'adresse suivante: www.antlab.sci.waseda.ac.jp Supernova-soft. L'alignement de texte NOVA. Disponible à l'adresse suivante: www.nova-text-aligner.soft112.com. ANALISE TEKSTYNų LiNgviSTiKOS METHODAiS pristatyje Straips empiromi descriptivios terminologijos principai bei daugiažodžių terminų su žodžiu tyrimo, tikslas taikant tekstynų lingvistikos metodus, surinkti terminus iš finansų srities ES dokumentų tekstynų ir jų formalių sandaros analizę. Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglųprancūzųlietu kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 termes anglais et po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis buvo dažniausias visų trijų kalbų tekstynuose. Mos […] AntConc ir AntPConc. Ce n'est Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės prograpas le cas. Dirbta tokiais etapais: Il s'agit d'une étape qui se déroule à l'intérieur de la ville. • les termes des dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei;
106 Oksana Smirnova Analyse basée sur le corpus de termes à mots multiples, y Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian compris: • le risque de localisation et le risque de daiktavardinių junginių su pagrindiniu dėmeniu et le risque de jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne; • les jungins de daiktavardinių, les terminaux de filles de laikytinų, les atrinkimas; • détermination des termes anglais, français et lituaniens correspondants. Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Il s'agit d'une méthode qui permet de déterminer le résultat des assemblages. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams. (C'est la raison pour laquelle on dit que les commerçants doivent être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être tenus d'être. Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose: • les types de terminaux de vyraujantis selon le nombre de dėmenų visose trijose tiriamose kalbose yra dvižodžiai terminai; tai, kad rodo ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus; • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 23 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų; • anglais et lituanien kalbų terminų darybos modeliuose vyrauja prepozicinė ir postpozicinė modifikacija, o prancūzų kalbos postpozicinė modifikacija; • les filles anglaises et lituaniennes ont des termes de langue et des termes d'appartenance qui sont des daiktavardžiai et des būdvardžiai, ou des kalboje français […] des constructions de prielinksninės. Les résultats des analyses formelles des sandaros fournissent des informations, qui peuvent être utiles aux terminateurs et aux vendeurs. Il s'agit d'une méthode permettant d'établir les modèles de structure syntaxique et les modèles d'application des termes automatiques. Je suis gauta 2018-05-21 Oksana Smirnova L'université de Mykolo Romerio est située dans la région de Mykolo Romerio. Ateities g. 20, LT-08303 à Vilnius E. paštas
[email protected] Il s'agit d'une affaire qui a été déclarée par la Commission. Sigita Rackevičienė L'université de Mykolo Romerio est située dans la région de Mykolo Romerio. Ateities g. 20, LT-08303 à Vilnius E. paštas
[email protected] Il s'agit d'une affaire qui a été déclarée par la Commission.