8 Oksana Smirnova Análise impulsionada pelo corpo de termos Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian multi-palavras, incluindo análise impulsionada pelo corpo de termos multi-palavras Termos que incluem a palavra "Risco" em inglês, francês e lituano OKSANA SMIRNOVA Universidade Mykolas Romeris, Lituânia SIGITA RACKEVIČIENĖ Universidade Mykolas Romeris, Lituânia PAZES-CHAPEL: terminologia descritiva, análise orientada por corpus, termos financeiros, extração de termos, padrões de formação de termos 1. INTRODUÇÃO As tecnologias computacionais abriram novas possibilidades para a pesquisa linguística: corpora digitais e softwares de análise de corpus facilitaram o acesso às estruturas linguísticas mais profundas e às relações entre diferentes unidades linguísticas e revelaram as peculiaridades de seu uso em diferentes domínios ao longo de diferentes períodos de tempo. Portanto, a análise impulsionada por corpus da linguagem natural é aplicada hoje em dia em uma ampla gama de áreas linguísticas: lexicografia, ensino de línguas, desenvolvimento de tradução automática, compilação de bancos de dados linguísticos, etc. A pesquisa terminológica também se tornou em grande parte impulsionada por corpus. Os corpus digitais permitem que os terminólogos trabalhem com uma grande quantidade de documentos, observem características particulares de uma linguagem especializada, coletem informações sobre o uso real de termos e sua evolução, capturem novos termos que não poderiam ser intuitivamente sentidos ou previstos, bem como realizar análises contrastantes de dados de vários idiomas. O software de análise de corpus, as ferramentas de extração automática e semiautomática de termos também contribuem para a padronização da terminologia, por exemplo, a contagem de frequência de sinônimos pode fornecer evidências de distribuição úteis indicando termos nologists to revise terminographical information about terms in existing estatisticamente preferidos (Khurshid, Rogers 1992: 36). Assim, os corpora digitais permitem bases de dados de termos e os atualizam constantemente.
8Terminologia | 2018 | 25 According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, O objetivo da terminologia moderna é produzir descrições formais, semânticas e funcionais de unidades lexicais que tenham valor to explain their relation with the rest of the units of the linguistic system. terminológico, bem como o objeto da pesquisa terminológica é a terminologia viva (terminologia que ocorre naturalmente em textos especializados) e o aspecto comunicativo do uso de termos que é melhor instanciado em um corpus (Cabré, Montané, Nazar 2012). O objectivo, o objectivo e os objectivos da investigação. O objectivo da investigação é aplicar a metodologia da linguística do corpus para a extracção e a análise da estrutura formal de termos financeiros com várias palavras, incluindo a palavra "risco" como substantivo principal em inglês, francês e lituano. A fim de alcançar este objectivo, foram fixados os seguintes objectivos: 1) analisar os princípios da terminologia descritiva baseada em corpus, incluindo os métodos de análises de colocação e coligação; 2) compilar corpus dos atos jurídicos da UE no domínio financeiro em três línguas (inglês, francês e lituano) e selecionar o software adequado para a investigação baseada no corpus; 3) extrair as palavras mais frequentes dos corpus nas línguas investigadas e selecionar a palavra-chave (substantivo) mais frequente para a análise posterior; 4) realizar a análise de colocação da palavra-chave selecionada no corpus inglês e extrair termos de várias palavras, incluindo a palavra-chave selecionada como o chefe semântico e sintático de termos do corpus inglês; Material do corpus em inglês; 5) estabelecer equivalentes em francês e lituano dos termos ingleses selecionados no corpus paralelo inglês-francês-lituano; 6) realizar uma análise quantitativa da estrutura formal dos termos multi-palavras selecionados e determinar quais padrões de modificação e estruturas sintáticas dos termos são predominantes nas línguas investigadas. Dados e âmbito da investigação. Para efeitos da investigação, três four corpora of the EU documents of financial domain were compiled: corpus monolingues (inglês, francês e lituano) e um corpus paralelo (EN-FR-LT). Os tamanhos dos corpora são os seguintes: EN 802 933 palavras, FR 940 655 palavras, LT 639 279 palavras. No total, foram concedidos 210 financiamentos.
8 Oksana Smirnova Análise impulsionada pelo corpus de termos de várias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palavras, incluindo termos oficiais, incluindo a palavra "risco" como substantivo principal, extraídos dos corpus: 70 termos em inglês e seus equivalentes em francês e lituano. A escolha da palavra "risco" foi determinada pelos dados do corpus, que revelaram que esta palavra era a mais frequente nos documentos da UE selecionados. 2. Princípios teóricos da investigação 2.1 Gestão da terminologia prescritiva e descritiva A evolução das tecnologias computacionais para a pesquisa da linguagem natural diferenciou claramente a terminologia tradicional da moderna. A atitude dos terminólogos em relação à concepção de um termo, às fontes de termos, à padronização de termos e a outras questões terminológicas mudou, sendo siderably. Two directions of terminology research and management have distinguidas: terminologia prescritiva e terminologia descritiva (Zeller 2005; Bielinskienė et al. 2015). Os defensores da terminologia prescritiva concentram-se na padronização da terminologia com base em dicionários de terminologia, bases de dados, listas de terminologia aprovada e documentos sobre princípios de padronização. Na terminologia prescritiva, a concepção de um termo baseia-se no lugar do conceito, descrito por ele, no sistema hierárquico conceitual do domínio e sua relação com outros conceitos (Pearson 1998: 10; Marcinkevičienė 2000: 6). De acordo com os princípios da terminologia prescritiva, um termo deve ser usado para descrever um conceito, pois tal reciprocidade reduz a probabilidade de ambiguidade, facilita a comunicação e, simultaneamente, o desenvolvimento do sistema hierárquico conceitual de um domínio. Os terminólogos descritivos distanciam-se da atitude estrita em relação à concepção de termos, à univocidade de termos, ao desenvolvimento de um sistema conceitual hierárquico e à padronização. Na terminologia descritiva, ao contrário da prescritiva, um contexto desempenha um papel vital na análise de um termo, e um termo é assumido como uma unidade léxica dependente de seu contexto. O seu objectivo não é formar um termo de acordo com certos princípios, mas registar o seu uso, a variedade das suas formas em diferentes textos e descrever as suas peculiaridades, formando assim uma base para a sua padronização (Bielinskienė et al. 2015: 10[…]11). O desenvolvimento das tecnologias deu origem a um enorme fluxo de informações apresentadas em vários tipos de textos e, simultaneamente, a um número constantemente crescente de termos usados neles. Nesta realidade em constante mudança, os termos
9Terminologija | 2018 | 25 os nólogos já não são capazes de controlar o rápido desenvolvimento da terminologia, uma vez que os termos mudam mais rápido do que são processados. Por conseguinte, a gestão da terminologia requer uma abordagem mais flexível baseada na descrição e não na metodologia de prescrição. O foco passou da padronização da terminologia para a análise da terminologia em corpora (Bielinskienė et al. 2015: 11). A terminologia descritiva levou ao desenvolvimento da Teoria Comunicativa da Terminologia, que coloca o foco na terminologia viva que é usada em discursos especializados e coloca a ênfase no aspecto comunicativo do uso de termos (Cabré, Montané, Nazar, 2012). De acordo com esta teoria, o papel principal dos termos é comunicar o conhecimento especializado; Assim, são concebidos como um poliedro triplo com um componente cognitivo (o conceito), um componente linguístico (o termo) e um comunicativo (a situação) (Cabré, Montané, Nazar 2012: 1). Os estudos terminológicos baseados na teoria comunicativa não se interessam apenas pela terminologia estabelecida por padrões ou encontrada em bases de dados oficiais, mas também (e particularmente) pelos termos que são realmente usados em textos de linguagem para fins específicos. Assim, a teoria comunicativa […]não apenas adota uma abordagem in vitro, mas também está interessada em termos in vivo[…] (Cabré, Montané, Nazar 2012: 1[…]2). A pesquisa da terminologia viva revela que a noção tradicional de univocidade de termos (correspondência um-a-um entre um conceito e termos particulares em línguas diferentes) não é bem fundamentada na linguagem real. A variação (sinonimia, ambiguidade, perifrasia, redundância) é característica não apenas das unidades linguísticas gerais, mas também da terminologia; Assim, os conceitos e termos têm de ser estudados "na sua interação dinâmica" (Cabré, Montané, Nazar 2012: 2 […]3). O foco no uso de termos fez dos corpora o principal espaço de trabalho da análise terminológica moderna. Os softwares de análise de corpora digitais e de corpus reforçaram a terminologia com recursos e ferramentas ricas que permitem aos terminólogos extrair termos de uma grande quantidade de documentos, capturar as mudanças mais recentes na terminologia de um domínio específico, analisar sua evolução, bem como estabelecer interconexão conceitual entre termos do mesmo domínio. Corpora permite obter informações confiáveis, baseadas em estatísticas, anteriormente totalmente indisponíveis sobre o uso de termos em linguagem natural. Portanto, a metodologia orientada por corpus tornou-se a metodologia predominante que fornece um conjunto de ferramentas indispensáveis para a pesquisa e gestão de terminologia (Zeller 2005; Cabré, Montané, Nazar 2012; Bielinskienė et al. 2015).
9 0 Oksana Smirnova Análise impulsionada por corpus de termos multi-palavras, incluindo Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian 2.2 Princípios de análise impulsionada por corpus: métodos de colocação e coligação A extração e análise de terminologia impulsionada por corpus são realizadas utilizando métodos estatísticos e linguísticos. Na investigação dada, são aplicados métodos de colocação e coligação. Collocations refer to syntagmatic attraction between lexical units. AcDe acordo com Tomas Lehecka (2015), "o conceito de colocação baseia-se na noção de que cada palavra em uma língua prefere certos contextos léxicos sobre outros, ou seja, que qualquer palavra tendem a co-ocorrer com certas palavras mais frequentemente do que com outras" (Lehecka 2015: 2). A análise estatística dos dados do corpus é usada para medir o grau de atração entre palavras, seus resultados permitem determinar quais combinações de palavras aparecem juntas significativamente mais frequentemente do que seria esperado por acaso, dada a frequência total das palavras no corpus (Lehecka 2015: 2). Desta forma, são estabelecidas as colocações mais significativas das palavras escolhidas no corpus analisado. Este método é usado principalmente para a análise semântica contextual de unidades lexicais, pois permite observar toda a variedade de palavras co-ocorrentes das palavras investigadas, estabelecer os padrões predominantes de co-ocorrência e, assim, descrever seus significados com base em seu ambiente contextual (Atkins, Rundell, Sato 2003: 340 […] 341). A análise colocacional tornou-se uma ferramenta indispensável para os lexicógrafos, também é amplamente aplicada na linguística computacional para fins de tradução automática, processamento de linguagem natural e outras áreas (Lehecka 2015). O método colocacional é frequentemente usado em combinação com o método coligacional. O conceito de coligação refere-se à atração de uma unidade léxica e de um padrão gramatical e baseia-se na noção de que as palavras preferem ser usadas em certos padrões gramaticais e evitam outros padrões gramaticais (Sinclair, 1998; Lehecka, 2015). A análise extended and encompass the relationship between the lexical unit and coligacional pode ser a posição em uma frase, cláusula, frase, texto ou discurso onde a unidade léxica pode ser usada (Hoey 2005: 49 […] 52). A análise coligacional tem sido amplamente empregada em combinação com collocational analysis to study the meanings of near-synonyms as corpus estudos linguísticos que revelaram que eles são frequentemente usados em diferentes contextos léxicos e gramaticais (Lehecka 2015). Investigações linguísticas de corpus
9 1Terminologia | 2018 | 25 padrões de colocação e coligação ferentes (Aston, have shown that even different senses of polysemous words may have difBurnard 1998). Assim, as análises de colocação e coligação provaram que a semântica e a gramática não devem ser tratadas como independentes, mas, em vez disso, devem ser levadas em consideração nas análises como colocação e interconnected systems (Lehecka 2015). pragmatic aspect should also be coligação e diferentes tipos de textos (Butler 2004: 157; Newman, Rice 2006). 2.3 preferences of a lexical unit vary significantly between different domains Aplicação do método de colocação-colligação na extração e análise de terminologia O método de colocação-colligação também pode ser utilizado para a extração de termos de várias palavras; é especialmente adequado para a extração de terminologia, incluindo palavras-chave pré-escolhidas […] palavras de potencial relevância terminológica características do domínio ao qual o corpus pertence. Esta metodologia baseia-se na suposição de que os termos complexos são feitos de termos simples existentes (Nakagawa 2001). As ferramentas de análise de corpus extraem palavras co-ocorrentes das palavras-chave pré-escolhidas e permitem estabelecer as colocações dominantes. Uma parte dessas colocações são frases substantivas que têm de ser selecionadas a partir de listas de colocação usando métodos linguísticos. As frases substantivas selecionadas são utilizadas para uma análise mais aprofundada dos dados do corpus e para a extração de termos com várias palavras, constituídos pelas frases substantivas selecionadas e, potencialmente, por colocações adicionais. Na pesquisa dada, os termos extraídos são analisados ainda mais usando princípios de análise de coligação que procuram revelar modelos de estrutura formal de terminologia nas línguas investigadas e contribuir para estudos multilíngues contrastantes de padrões de formação de termos (cf. Janulevičienė, Rackevičienė 2014; Mockienė 2016). 3.Desenvolvimento da Corporação e Seleção O objectivo da compilação de um corpus de documentos de um domínio According to M. Teresa Cabré, M. Amor Montané and Rogelio Nazar, específico é triplo. Em primeiro lugar, os terminólogos devem familiarizar-se com a extração de minologia de tipos e realizar análises of language of the domain; secondly, a corpus is needed to perform terestatísticas dos termos; e
9 Oksana Smirnova Análise impulsionada por corpus de termos de várias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palavras, incluindo, finalmente, textos são usados para obter informações complementares sobre os termos, como pistas semânticas, sintáticas ou de colocação (Cabré, Montané, Nazar 2012: 3[…]4). O corpus compilado deve ser de tamanho e qualidade suficientes para ser considerado representativo do domínio escolhido. Não existem requisitos precisos para o tamanho de um corpus; mas deve conter o maior número possível de documentos, porque quanto maior for, mais conclusões confiáveis sobre o uso da terminologia no domínio podem ser feitas (Cabré, Montané, Nazar 2012: 4). Tendo em conta todos estes aspectos, foram compilados os corpus dos atos jurídicos da UE em inglês, francês e lituano. Os atos jurídicos foram descarregados do Jornal Oficial da União Europeia, que é uma fonte em linha livremente acessível. Foram recolhidos 101 atos jurídicos relativos a questões financeiras da UE promulgados no período de 2014 a 2017. Os documentos foram transformados em texto simples e alinhados para extração de termos e sua análise. Três programas foram usados para compilar, alinhar os textos e extrair os dados necessários deles: AntConc (2014), AntPConc (2017) criado e certificado por Laurence Anthony e NOVA Text Aligner (2014). AntConc é um kit de ferramentas multiplataforma freeware para realizar pesquisa linguística de corpus e aprendizagem orientada a dados, enquanto AntPConc destina-se a criar um corpus paralelo de várias línguas. Ambos os programas permitem ao pesquisador lidar com uma grande quantidade de dados e realizar uma análise linguística multilíngue abrangente. As ferramentas fornecidas para os usuários pelo programa AntConc são as seguintes: Lista de palavras, Colocações, Clusters, Palavras-chave, Concordância, Ploto de Concordância, Ferramenta de visualização de arquivo. Na investigação em questão, foram aplicadas quatro ferramentas do AntConc: • Lista de palavras que permite determinar as palavras mais frequentes nos corpus; • Collocates enabled to determine the dominant collocates of the palavra "risco" e medir o grau de sua atração sintagmática pela palavra "risco"; • Os agrupamentos autorizados a divulgar os termos multi-palavras mais dominantes, incluindo a palavra "risco" como substantivo principal; • Concordances gave a wide variety of samples illustrating the usage dos termos nos textos. O instantâneo do programa AntConc é apresentado na Figura 1.
3Terminologia | 2018 | 25 Antes de compilar um corpus paralelo, os textos descarregados em três línguas foram alinhados manualmente com a ajuda do programa NOVA Text Aligner. Após o alinhamento dos textos, foi construído um corpus paralelo utilizando o programa AntpConc (ver Figura 2). Figura 2. Programa AntPConc Figura 1. Programa AntConc
9 Oksana Smirnova Análise impulsionada por corpus de termos de várias Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palavras, incluindo O programa AntpConc permitiu expor os exemplos de três línguas ao mesmo tempo: podia-se clicar em uma frase escolhida para ver os equivalentes em outras línguas. O programa também permitiu distinguir as palavras-chave e as suas colocações à esquerda ou à direita através do uso de cores diferentes. No entanto, não foi possível ver o documento a partir do qual o exemplo foi extraído. Utilizando o corpus paralelo, foram extraídos equivalentes em francês e lituano de 70 termos em inglês. 4.Análise do corpo e extração de termos As ferramentas dos programas AntConc e AntpConc 4.1 Estabelecimento das palavras mais frequentes nos corpus A fim de determinar as palavras mais frequentes no corpus dos documentos financeiros, foi utilizada a ferramenta Word list do programa AntConc. Forneceu os resultados da frequência das palavras nos corpora em inglês, francês e lituano, o que permitiu comparar as frequências das palavras nas línguas investigadas e desenvolver uma lista trilíngue das dez palavras mais frequentes (ver quadro 1). A lista de palavras também forneceu informações sobre o número de tokens de palavras e tipos de palavras que havia nos corpora e deu acesso ao contexto em que os termos foram usados (ver quadro 1). Quadro 1. Top 10 palavras mais frequentes nos corpora (corpus) 802 933 palavras 279, tokens, 933 palavras) tipos de palavras) FR (corpus 940 655 tokens de palavras, 12365 tipos de palavras) LT (corpus 639 24727 tipos de 1. risco (3252), risco (592) riscos (997) (2855), risco (2549), (536), rizikai (355), risco (1063), risco rizikas (4) 2. crédito (3183), crédito (3307), (222) (29), créditos (28), créditas (8), crédito (3103), créditos (52), créditai (6), créditais (4), kreditus créditos de crédito (18) créditos (3), kreditams (2) 3. mercado (1643), mercado marchas (484) (229), rinkoje (1631), mercados (1355), rinkų (226), rink (76), rinkose (75), (310), mercados de rinca (424) rinkai (51), rinkoms (182), rinkas (7), rinkomis (2)
101Terminologia | 2018 | 25 Quadro 6. Estruturas sintáticas dos padrões de modificação postnominal dos termos Estruturas sintáticas EN FR LT […] risco + p 13 termos, por exemplo: risco da sistema financeiro, risco de perda, risco de modelo por exemplo: 22 termos, instituição, risco de de concentração, risco crédito, […] risco para o […] risco + A […] risco 20 termos, por exemplo: : intrajornal, […] risco específico risco interno, […] risco + A + Risco específico de pp 4 termos, por exemplo: : correlação, risco correlação, risco geral de correlação significativo de […] risco + pp + A […] 15 termos, por exemplo: risco risco de crédito quotidiano, risco sur matière première de crédito específico […] […] risco + + pp risque de crédit pp + A + […] 9 termos, por exemplo: : intrajournalier à 24h, risque de liquidité intrajournalier à 24h Diagrama 1. Padrões de modificação dos termos
102 Oksana Smirnova Análise Corpus-Driven de Termos Multi-Word Incluindo Os Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian resultados mostram que a modificação prenominal é dominante nas línguas inglesa e lituana, enquanto a modificação postnominal é característica da língua francesa. Não foram detectados termos de padrão de modificação pré-nominal found in French, and no terms of postnominal modification patterns were no lituano. Apenas os termos ingleses eram de ambos os tipos, embora todos os number of terms with postnominal modifiers is rather low. termos investigados incluam um ou vários modificadores que são substantivos, adjetivos ou frases prepositórias que ocupam posições diferentes nas unidades terminológicas. Os resultados da análise revelam que os modificadores dominantes dos termos em inglês e lituano são substantivos e adjetivos, enquanto nos termos em francês a palavra "risco" é principalmente modificada por frases prepositivas. Os termos que incluem 3 ou mais palavras podem ser classificados de acordo com os seus níveis de modificação (termos que incluem modificadores que modificam o substantivo principal e termos que incluem modificadores que modificam outros modificadores), mas, devido ao espaço limitado, esta análise não é apresentada neste artigo. Os resultados resumidos nos quadros revelam também que os termos diferem no número de seus constituintes. A análise quantitativa do comprimento do termo foi realizada para estabelecer o número dominante de constituintes do termo nas línguas investigadas; Os seus resultados são apresentados no diagrama 2. O diagrama revela duas tendências principais. Em primeiro lugar, os desenvolvedores de termos da UE respeitam o principal requisito da economia linguística (brevedade dos termos): os termos de duas palavras são predominantes nas três línguas. Em segundo lugar, apenas alguns termos em inglês e francês têm mais de 2-3 palavras, enquanto no diagrama 2. Número de
103Terminologia | 2018 | 25 Os termos lituanos com 4 palavras ou mais constituem uma parte significativa dos dados selecionados (17 de 70). The tendency of prevalence of two-word terms coincides with the tenconstituintes de termos estabelecidos por outros investigadores de terminologia. A pesquisa sobre extração automática e definição do domínio da by Agnė Bielinskienė et al. revealed that most Lithuanian terms of this terminologia da educação e da ciência são termos de duas palavras: eles constituíram mais de dois terços dos termos selecionados a partir do termo specialised corpus (Bielinskienė et al. 2015: 62). The contrastive research candidatos automaticamente extraídos de uma terminologia de direito constitucional por Liudmila Mockienė revelou a mesma tendência em três línguas diferentes. Nos atos jurídicos de natureza constitucional investigados em inglês, russo e lituano, a maioria dos termos de várias palavras extraídos consistia em dois constituintes: constituíam 78,5% dos termos de várias palavras em inglês, 62% dos termos de várias palavras em russo e 74,5% dos termos de várias palavras em lituano (Mockienė 2016: 43-45). Assim, os desenvolvedores de termos de diferentes domínios e diferentes línguas tendem a aderir ao mesmo princípio de economia de linguagem e facilidade de uso. 6. Conclusões O software AntCont, utilizado para a análise de corpus monolíngues, e o AntpConc, utilizado para a análise de corpus paralelos, permitiram extrair termos de várias palavras em inglês, francês e lituano, incluindo a palavra "risco" como substantivo principal dos corpus especializados dos documentos da UE de domínio financeiro compilados para fins de investigação. A extracção foi efectuada nas seguintes fases: • extração das palavras-chave dos corpus ingleses, franceses e lituanos (as palavras de potencial relevância terminológica características do domínio que os corpus representam) e escolha da palavra-chave mais frequente (a palavra "risco") para análise posterior; • extração de colocações da palavra "risk" e frases substantivas, incluindo a palavra "risk" como o substantivo principal com colocações à esquerda e/ou à direita do corpus inglês; • selecção de unidades léxicas que tenham valor terminológico da lista de frases substantivas extraídas; • estabelecer equivalentes em francês e lituano dos termos ingleses selecionados no corpus paralelo inglês-francês-lituano.
104 Oksana Smirnova Análise impulsionada por corpus de termos Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian multi-palavras, incluindo A metodologia aplicada provou ser adequada para a extração multilíngue eficaz de terminologia que pode ser usada para o desenvolvimento/atualização de bases de termos ou análise científica de termos. A análise da estrutura formal dos termos extraídos revelou alguns grandes term formation tendencies in the investigated languages: • a modificação pré-nominal é dominante nas línguas inglesa e lituana, enquanto a modificação pós-nominal é característica do Língua francesa; • os modificadores dominantes dos termos ingleses e lituanos são substantivos e adjetivos, enquanto nos termos franceses a palavra "risco" é principalmente modificada por frases prepositivas; • o tipo de termo predominante de acordo com o número de constituintes são termos de duas palavras […] constituem o maior número de termos nas listas TOP 70 em inglês, francês e lituano; que mostra que os desenvolvedores de termos da UE respeitam o principal requisito de guage economy (brevity of terms); • apenas alguns termos em inglês e francês têm mais de 2-3 palavras, enquanto na lista lituana TOP 70, os termos com 4 palavras ou mais constituem uma parte significativa dos dados selecionados (17 de 70). Os resultados da análise da estrutura formal revelam as tendências de formação de termos nas línguas investigadas e fornecem informações terminológicas que podem ser úteis para os desenvolvedores e tradutores de termos. Os padrões sintáticos estabelecidos na pesquisa podem ser usados para o desenvolvimento de métodos linguísticos automáticos de extração de termos sem palavras-chave pré-escolhidas. REFERENCES Aston g., Burnard L. 1998: The BNC Handbook. Exploring the British National Corpus with SARA, Edinburgh: Edinburgh University press. Atkins S., Rundell M., Sato H. 2003: The contribution of FrameNet to practical lexicography. – Internation al Journal of Lexicography 16(3), 333–357. Bielinskienė A., Boizou L, Grigonytė G., Kovalevskaitė J., Rimkutė E., Utka A. 2015: Lietuvių kalbos terminų automatinis atpažinimas ir apibrėžimas. Monografija, Kaunas: Vytauto Didžiojo universitetas. Butler C. S. 2004: Corpus studies and functional linguistic theories. – Functions of Language 11(2), 147–186. Cabré M. T., Montané M. A., Nazar R. 2012: Corpus-based Terminology Processing. TKE 2012 Tutorial. Available at http://terminus.iula.upf.edu/tke2012/. hoey M. 2005: Lexical Priming: A New Theory of Words and Language, London: Routledge. Janulevičienė V., Rackevičienė S. 2014: Formation of criminal law terms in English, Lithuanian and Norwegian. – LSP journal – Language for special purposes, professional communication, knowledge management and cognition 15(1), 4–20.
105Terminologija | 2018 | 25 Lehecka T. 2015: Collocation and colligation. – Handbook of Pragmatics Online. J.-O. Östman, & J. Verschueren (Eds.), Amsterdam: John Benjamins Publishing Company, 1–23. Khurshid A., Rogers M. 1992: Terminology management: a corpus-based approach. – Translating and the Computer 14, 33–44. Marcinkevičienė R. 2000: Terminografija ir tekstynas. – Terminologija 6, 5–23. Mockienė L. 2016: Formation of terminology of constitutional law in English, Lithuanian and Russian. Doctoral Thesis, Vilnius: Mykolas Romeris University. Nakagawa H. 2001: Experimental evaluation of ranking and selection methods in term extraction. – Recent Advances in Computational Terminology. D. Bourigault, Ch. Jacquenim and M.-C. L’homme (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 303–325. Newman J., Rice S. 2006: Transitivity schemas of English EAT and DRINK in the BNC. – Corpora in Cognitive Linguistics: Corpus-Based Approaches to Syntax and Lexis. S.T. gries and A. Stefanowitsch (Eds.), Berlin/New York: Mouton de Gruyter, 225–260. pearson J. 1998: Terms in Context, Amsterdam/philadelphia: John Benjamins publishing Company. Sinclair J. 1998: The lexical item. – Contrastive Lexical Semantics. E. Weigand (Ed.), Amsterdam: John Benjamins Publishing Company, 1–24. Zeller I. 2005: Automatinis terminų atpažinimas ir apdorojimas. Daktaro disertacija, Kaunas: Vytauto Didžiojo universitetas, Vilnius: Lietuvių kalbos institutas. Fontes Jornal Oficial da União Europeia: https: eur-lex.europa.eu/oj/direct-access.html COMPUTER SOTFWARE uSED FOR THE ANALYSiS Anthony L. 2014: AntConc (Versão 3.4.4w) [Programa informático]. Tóquio, Japão: Universidade de Waseda. Disponível em http: www.antlab.sci.waseda.ac.jp Anthony L. AntpConc (Versão 1.2.0) [Computer Software 2017:]. Tóquio, Japão: Universidade de Waseda. Disponível em www.antlab.sci.waseda.ac.jp Supernova-soft. Alinhador de texto NOVA. Disponível no endereço www.nova-text-aligner.soft112.com. ANALISE TEKSTYNų LiNgviSTiKOS METODAiS pristatyje Straips empiromi deskriptyviosios terminologijos principai bei daugiažodžių terminų su žodžiu tyrimo, tikslas taikant tekstynų lingvistikos metodus, surinkti terminus iš finansų srities ES dokumentų tekstynų ir jų formali sandaros analizę. Tyrimo tikslams buvo sukaupti keturi tekstynai: finansų srities dokumentų anglų kalba (802 933 žodžiai), prancūzų kalba (940 655 žodžiai) ir lietuvių kalba (639 279 žodžiai) bei lygiagretusis anglųprancūzųlietu kalbų tekstynas. Iš tekstynų surinkta 210 terminų, kuriuose žodis rizika eina pagrindiniu dėmeniu: 70 angliškų terminų ir po tiek pat jų atitikmenų prancūzų ir lietuvių kalbomis. Žodžio rizika pasirinkimą lėmė tai, kad šis žodis buvo dažniausias visų trijų kalbų tekstynuose. mos […] AntConc ir AntPConc. Dirbta Terminų atpažinimui ir surinkimui buvo naudojamos dvi kompiuterinės progratokiais etapais: • dažniausių žodžių, galinčių būti terminų branduoliu, angliškame, prancūziškame ir lietuviškame tekstynuose nustatymas ir vieno iš jų (žodžio rizika) atrinkimas tolesnei analizei;
106 Oksana Smirnova Corpus-Driven Analysis of Multi-Word Terms Including • Sigita Rackevičienė the Word ‘Risk’ in English, French and Lithuanian palavras risco kolokacijų ir daiktavardinių junginių su pagrindiniu dėmeniu risco ir jo kairiaisiais bei dešiniaisiais kolokatais nustatymas angliškame tekstyne; • daiktavardinių junginių, laikytinų daugiažodžiais terminais, atrinkimas; • determinação de termos em inglês, francês e lituano. Pritaikyta metodologija leido rezultatyviai surinkti daugiažodžius terminus iš daugiakalbių tekstynų. Tai duoda pagrindą teigti, kad ji gali būti taikoma terminų kaupimui bei tyrimams. Surinktų terminų formaliosios sandaros analizė atskleidė keletą svarbių terminų darybos tendencijų tiriamose kalbose: • vyraujantis terminų tipas pagal dėmenų skaičių visose trijose tiriamose kalbose yra dvižodžiai terminai; tai, kad rodo ES terminų kūrėjai laikosi kalbos ekonomijos principo ir stengiasi kurti kuo trumpesnius daugiažodžius terminus; • tik keletas angliškų ir prancūziškų terminų turi daugiau kaip 23 dėmenis; tuo tarpu lietuviški terminai, susidedantys iš 4 ir daugiau dėmenų, sudaro beveik ketvirtadalį surinktų terminų; • inglês e lituano kalbų terminų darybos modeliuose vyrauja prepozicinė ir postpozicinė modifikacija, o prancūzų kalbos postpozicinė modifikacija; • as filhas inglesas e lituanas têm termos de dependência que são daiktavardžiai e būdvardžiai, ou o kalboje francês […] prielinksninės konstrukcijos. Os resultados das análises de sandaros formais dão informações, kuri gali būti naudinga terminų kūrėjams ir vertėjams. Tyrimo metu nustatyti sintaksinių struktūrų modeliai gali būti taikomi, kuriant kompiuterinius lingvistinius metodus automatiniam terminų atpažinimui be iš anksto pasirinktų raktinių žodžių. Gauta, em 2018-05-21 Oksana Smirnova Universidade de Mykolo Romerio Ateities g. 20, LT-08303 Vilnius E. paštas
[email protected] Sigita Rackevičienė Universidade de Mykolo Romerio Ateities g. 20, LT-08303 Vilnius E. paštas
[email protected]