Automatinis švietimo ir mokslo terminų nustatymas lingvistiniais metodais
Full text
54 Erika Rimkutė | Automático da educação e ciência terminų | nustatymaslingvistiniaismetodais Automatic identification of education and science terms by linguisticiniais methods ERIKA RIMKUTė Universidade Vytautas o Grande ESMINIaI VOZŽIaI: tekstynas, termos de educação e ciência, linguvistiniai métodos, titraštinė forma, gramatinė forma ĮVADAS Tekstynų lingvistika ir kompiuterinė lingvistika na Lituânia já contauioja antrą dešimtmetį deste ramo da ciência pode ligar o início com Vytautas Didžiojo universitário Kompuuterinės lingvistikos centro (žr. http://tekstynas.vdu.lt) fundação 1994 m. Parengta alguns tekstynų, automatinių kalbos analizės ir sintezės programų1. No entanto, os princípios da textynų linguvistica ainda escassamente aplicados terminologia e terminografia. 2010 m. Artigo Lituvians idiomas terminos de fixação automático possibil (Rimkutė 2010) resumiu-se, quanto tekstynai usados formando vários trabalhos de terminologia na Lituânia. termos de língua Lituânia podem ser encontrados em várias bases de dados internacionais, bancos de termos; consideráveis preparada de terminynas eletrônicas ou bases de dados2, mas todos Lituviški eletroniniai terminynai em essencial são constituir termos de dicynos base. Muitos lietuviškų žodynų preparengti baseado bastante menores quantidades de textos, kalbine intuicija, taigi pode-se afirmar, que na Lituânia ainda prevalece preskriptivusis modo de obtenção e descrição de termos. O artigo neste pretende apresentar os resultados de um projecto3 destinado a estabelecer e descrever os termos da educação e da ciência, relacionados com o automático terminų nu1 Išsamų lituanistinių išteklių, preparados até 2011 m., sąvadą pode encontrar http://sruoga.vdu.lt/lituanistiniaiskaitmeniai-istekliai-lituanistiniu-istekliu-sarasas. 2 As referências dadas no citado artigo. 3 Este é o projecto financiado pelo Conselho de ciência da Lituânia Švietimo ir mokslo terminų automatinis identifikavimas (ŠIMTAI 2) (sutarties nr LIT-2-44). Os objetivos mais importantes deste projeto: 1) criar e testar automático de reconhecimento de termos da língua lituânica tekstyne metodologia como novo instrumentá de manejo de terminologia, 2) criar specialųjį švietimo ir mokslo tekstyną, 3) especialaliojo tekstyno pagrindu preparengti aiškinamąjį terminų žodyną švietimo ir mokslo ir šios srities ontologiją.
55Terminology | 2012 | 19 construiu, suas descrição. Idėja de projecto para o automático estabelecimento de termos surge tendo notado que as existentes fontes normamiais4 são bastante neišcompletús, quanto não orientuoti į pačius bendriausius švietimo politikos terminus ir beveik nė abrangem área de ciência política, nelas nespėjama fornecer novos, de trabalho prático kylančių terminų; termos de normintojai nespėja seus sunorminti. O normminamento tradicional ainda assim é bastante subjetivo, portanto vartoseną e normas precisa basear-se textos de linguística. Então neste artigo será escrito sobre na Lituânia ainda bastante novo termo de selecção e análise de maneira, que pudesse bem facilitar o trabalho dos terminologos, proporcionar mais objetividade. AUTOMATIS TERMIN NUSTATYMAS Para estabelecer automaticamente e definir os termos de certa área, selecionada uma sarea ciência e educação. Acumulado 4 milhões. palavras de volume de educação e ciência (SchM), textynos que na compilação orientaotase em dois temas principais: 1) pesquisas científicas e 2) ugdymą. Da área de pesquisas, principalmente foco está dedicada à política de pesquisas e à política de ensino superior. Do domínio ugdymo é tomado povidurio educacão, e a maior atenção destina-se ao alçtajomoção e ao contínuo ensino(si). Como sarea adicional incluída e profissional treino. Sugerindo texto procurou abranger textos de vários gênrões e tipos, ex.: leis, outros documentos politicos das mais altas autoridades (Lietuvos Respublikos Seimo, Lietuvos Respublikos Vyriausybės, Lietuvos Respublikos Prezidento nutarimus, pareiškimus, Constitucinio Teismo decisões e kt.); documentos estratégicos; actos implementadores das leis; documentos de instituições e projetos de implementação de política de ciência e educação; documentos de instituições de ciência e estudos; publicações informativas, estudos de condição da área, avaliações, estudos de possibilidade; comunicados de imprensa, materiais de discussões. Terint representativos, bem subalansado textyną da área de inquéramo5, pode estabelecer automaticamente termos. Para este propósito geralmente usa4 Pode mencionar o Banco de termos da República da Lituânia, L. Jovaišos Enciklopedinį edukologijos terminų žodyną (2007), TESE tezaurą [žiūrėta 2012-05-20], acesso por internet: http://eacea.ec.europa.eueducation/ eurydice/documents/tesepdf/teselt_005_alphabetic.pdf. 5 Texstynów reprezentatividade, tamanho umas das mais complexas textynów questões linguísticas. Considera-se que ŠM textynos bastante bem representa a área escolhida. Mais discutida por causa de seu tamanho, por exemplo, inglêsital dos idiomas o texto jurídico Bononia Legal Corpus (BOLC) é aproximadamente 18 milhões. palavras de tamanho (Rossini Favretti et al. 2001).
56 Erika Rimkutė | Automático da educação e ciência terminos mi trejopi | nustatymaslingvistiniaismetodais métodos: estatísticos, lingvistiniai e hibridiniai estatísticos e lingvistinių metodų modeliai. Realizar algumas experimentos, pelos quais procurou determinar os mais adequados métodos de fixação de termos. Os seguintes métodos estatísticos foram testados: 1) função WordSmith Tools do programa Keyword Clusters; 2) método de aprendizagem automática KEA; 3) o método de extração de colocações usando a ferramenta LICE (plačiau ver Grigonytė et al. 2011). Tendo feito estas pesquisas, feita a conclusão, que os mais adequados línguas lituãs são os métodos lingvistiniai. A seguir explicam brevemente as peculiaridades destes métodos. A principal vantagem dos sistemas de definição de termos estatísticos é o de que eles não precisam de grandes bases de dados com pessoas indicadas exemplos de termos. Além disso, elas são independentes da linguagem. O princípio principal de atividade dos sistemas estatísticos baseia-se no que palavras frequentemente usadas junto são relacionadas e trattuotini como possíveis termos. Os métodos linguísticos geralmente baseiam-se em marcas morfológicas, ordem das palavras. Para ser possível adaptar métodos linguísticos, necessários morfologicamente anotuar textos. Utilizando linguísticos métodos de definição de termos, geralmente determina-se, quais de formas gramatinais podem ser termos. Setting formas gramaticais, é preciso considerar nas peculiaridades das línguas. Por exemplo, às linguagens analíticas é importante estabelecer termos da parte da linguagem. A parte do idioma terminos da língua Lituânia também é muito importante, mas é preciso saber, e quais de outras categorias gramatinais informação é necessária automaticamente estabelecendo termos. Pontou-se que para línguas lituanas ainda importantes de número, mais categorias, e gimines categoria, automaticamente estabelecendo termos, não é particularmente significativa6. Tyrinėtojų (pvz., Bowker 2002) determinou que quase impossível adaptar a outras línguas criurtas terminus estabelecetanços instrumentos, especialmente aqueles que usam métodos linguísticos. Por exemplo, típica estrutura de termos do inglês é bdv. + dkt., dkt. + dkt., e fracūzas línguas característicos modelos é dkt. + bdv., dkt. + prl. + dkt. Assim, para aplicar linguísticos métodos de reconhecimento de termos, é preciso criar um programa, na qual fosse levado em conta o sistema gramatical de determinada língua. Daqui em diante neste artigo será apresentada tentativas automaticamente estabelecer termos da língua lituãs usando métodos linguísticos. Atkreiptinas 6 Giminė torna-se actuais naqueles casos, quando surge linksnių sinkretism, exemplo., do ensino dos trabalhadores: automaticas morfologicas analises programa formą dos trabalhadores atpazįsta e como varriškosios, e como femeriškosios gimimokslo empregada. Como termo deveria ser dada virriškosios giminės forma, t. y. cientista trabalhador. nės daiktavardžio daugiskaitos kilmininką, todėl kaip antraštinę formą nurodo ir mokslodarbuotojas, ir
57Terminologija | 2012 | 19 Atenção que para estabelecer os possíveis termos (toliau GT)7 usado o programa desenvolvido VDU Kompuuterinės lingvistikos centre. Neste programa foram usadas regras linguísticas, nas quais indica, quais partes da linguagem combinações ou formas de palavras analisuotini. Como mencionado, usando métodos linguísticos, necessários morfologicamente anotados textos, portanto principalmente acumulado ŠM textoynos foi morfologicamente anotado usando VDU Komputerinės lingvistikos centre criada morfológico anotatorių8. Aqui apresenta-se um exemplo de texto automaticamente morfologicamente anotado: <word=PROJEKT lemma=projektas type=dktv vyr.gim dgsk K>9 <space> <word=FINANSAVIMO lemma=financiamento type=dktv vyr.gim vnsk K> <space> <word=SLYG lemma=sąlyga type=dktv mot.gim dgsk K> <space> <word=APRAŠAS lemma=aprašas type=dktv vyr.gim vnsk V> <p> <word=I lemma=I type=rom skaič> <sep=.> <space> <word=BENDROSIOS lemma=bendras type=bdvr teig nelygin.l įvardž mot.gim vnsk K> <space> <word=NUOSTATOS lemma=nuostata type=dktv mot.gim vnsk K>10 <p> <number=1> <sep=.> <space> <number=2007> <sep=> 7Vários métodos que usam programas automaticamente terminus estabelecentes geralmente reconhecem possíveis termos, terminus candidatus (žr. Zeller 2005), embora entre as palavras ou combinações automaticamente estabelecidas muitas vezes ocorra de modo totalmente neprasmingos de palavras sampicanos ou significmingos de combinações de palavras neterminadas, ej., colocações. A partir dessas palavras e conjuntos verdadeiros terminus estabelece geralmente um perito de determinado ramo. 8 Foram mais pormenores consul. http://tekstynas.vdu.lt/page.xhtml?id=morphological-annotator-how-to-use. 9 Word indica a específica texto pavimentada da palavra formá, lemma titulação formá (lemă), type detalhada informação morfológica. 10 Atkreiptina atenção, que morfologicamente anota-se automaticamente, por isso ocorreto e erros, por exemplo, neste exemplozdy por causa linksnių sinkretismo indicada forma inadequada: ao invés de moteriškosios giminės daugiskaitos nomeador indicado moteriškosios giminės vienaskaitos kilmininkas. Em detalhe sobre inexikslums, surgidos devido ao morfologio anotatoriaus especificas, consulte. capítulos Problemas de Determinação Automático de termos.
58 Erika Rimkutė | Automático da educação e ciência terminų | nustatymaslingvistiniaismetodais <number=2013> <space> <word=m lemma=m type=sntrmp> <sep=.> <space> Automaticamente GT estabelecendo o princípio de funcionamento do programa brevemente e geralmente seria possível unsagiti assim: analisado morfologicamente sužymėtas texto, eiskoma relacionadas palavras chaininėlių. Primeirois critério de acordo sužymėtas texto, sakinių skirtis atlockti nepertrauktus palavras conjuninius. Parte dos skirts de texto são marcados como separadores, outras podem ser marcadas como HTML marcadores, ex., parágrafo de marca <p>, espaço entre palavras de marca <space> e etc. A taisykles, kurios būtų pritaikytos programoje. Nustatant švietimo ir moksseguir é preciso elaborar certos linguísticos lo terminus, preparadas e adaptadas estas regras básicas11: 1. Analisar apenas aqueles conjuntos, nos quais há pelo menos um itiktavardis. Se GT é dvižodis ou ilgesnis, é outras partes da língua, situadas em tal conjunção, podem ser atribvrzii e participai. 2. Analisar apenas aqueles conjuntos cujas a última palavra necessariamente deve ser itiktavardis12. 3. Bíjodjes GT nãoanalizarem verificiai daiktavardžiai, porque eles geralmente entram em pessoas, empresas, instituições e kt. nomes, que não likikytini terminos do ramo (determinando ilgesnius terminus incluir em GT terminos listas e verificiai daiktavardžiai). 4. De compoções expulsar números gravar números. 5. Nãoanalisarem aqueles palavras ou conjuntos, que constituem pelo menos uma palavra não reconhecida do anotador morfológico. Trata-se geralmente de línguas estrangeiras intarpas, com erros de escrita palavras, sucurėjusies formas de palavras13. Aplicando tais regras, foram estabelecidos GT, dos quais expert14 selectou ŠM terminus. Estes termos analisados mais detalhadamente, sua estrutura descrita no capítulo Educação e ciência estrutura de termos. 11 Taisyklės são universais e, em essência, adequam a termos de qualquer área automaticamente estabelecidos. 12 Possível e outra forma de terminos estrutura, exemplo., daiktavardis com prišlieta bendratimi, daiktavardis com prielinksnine konstrukcija. Este tipo de termos não há muitos, portanto eles neanalizarem. No futuro prosseguindo investigação deveria paanalizar-se e neste artigo não incluídas estruturas de termos. 13 Aplicar certas limitações de seleção GT, pode perder-se informação valiosa. Nesse estudo não contou-se, quanto não reconhecida reais terminos. Utilizando programa de reconhecimento automático de termos, é preciso nos acalmar com o fato de que parte da informação será perdida, mas automaticamente determinada informação será mais fácil de processar, obter junções será gramaticamente regrasingesni. 14 O especialista deste projeto é lituanistas Giedrius Viliūnas, com havendo grande pedagógica, administrativa, gerencial experiência no campo da educação e ciência.
59Terminologia | 2012 | 19 TERMINŲ ATRANKA Aplicando-se a método descrita no capítulo anterior, programa e nela usado regras, foi determinado sobre 11 mil. GT, constituídos a partir um foi adaptados iki penkiolikos žodžių15. Susidūrus su tokiu dideliu duomenų kiekiu, vários critérios de seleção. Primeiro termos de comprimento: tendo em conta as tendências gerais da estrutura de termos, decreussta analisar não ilgesnius nem septyniazodžius terminus. Segundo critério frequência de pautartojamento de termos. Optou-se seguir a analisar mais detalhadamente singularôzis GT, que ŠM tekstyne pavartoti pelo menos 20 vezes; dvižodžius GT, que pavartoti pelo menos 10 vezes; trižodžius GT, pavimentotos não menos do que 8 vezes; keturžodžius GT, empregados pelo menos 6 vezes; penkiažodžius GT, cujas frequências sejam pelo menos 4 vezes; seisšiažodžius GT, pavimentados pelo menos 3 vezes, e septyniažodžius GT, cuja frequência não menor do que 2 vezes. Automaticamente calculando GT aparecimento freqüência, baseias palavras em formadinhas (žodyninėmis) formas, t. y. lemas. Aplicando estes critérios de selecção estabelecer datas para investigar mais em detalhe (a sua estrutura presata em outra secção). Expertui reviu após de acordo anteriormente mencionadous critérios estabelecidos GT, selecionados verdadeiras ŠM terminas. Aí se a distribuição por comprimento dada 1 tabela. Tabela 1. Educação e ciência terminos de se distribuir por duração Terminus constituindo termos número Terminos quantidade, % número de palavras quantidade de Terminos, 1155 19,87 2474 60,77 3125 16,03 422 2,82 5 4 0,51 Do total 780 100,00 15 Aqui listados alguns mais longos encontrados prazos: casos referidos no ponto descrito por decisão de uma comissão constituída pelo diretor do fundo reembolso do empréstimo apoiado pelo Estado ao beneficiário do empréstimo (15 palavras; aqui passaristi skaičiai, i. i. leinto ponto); endereço do lugar de residência do beneficiário do empréstimo no contrato de empréstimo apoiado pelo Estado concluído pela instituição de crédito (13 palavras); ordem de pagamento de contribuições de estudos de estudantes universitários para ano académico é estabelecida por ordem do reitor (11 palavras). Obviamente vê-se que estes fragmentos de texto não podem ser considerados possíveis termosis.
60 Erika Rimkutė | Automático da educação e ciência terminų | nustatymaslingvistiniaismetodais Da tabela de dados vê-se que cerca de 97 % de todos os ŠM termos de constituem de 13 palavras compostos termos. Entrep seisšiažodžių e septyniažodžių GT da educação e ciência termos não encontra, portanto eles continuar neanalizarem. SHVIETIMO IR MOKSLO TERMIN STRUKTŪRA Neste capítulo descreve em detalhe a estrutura dos termos ŠM determinados automaticamente e selecionados pelo especialista, fornecidos seus modelos gramatiniai. Terminais descrever a partir mais curtos, t. y. únicažodžių, até mais longos, t. y. penkiažodžių. 1.Unavoodžiai termininai. Do total estabelecer 7635 uma-syllable GT, de eles 1311 tekstyne pavartota mais de 20 vezes. A seguir analisamos mais detalhadamente só essas palavras. De 1311 palavras, 155 podem ser consideradas ŠM terminais, i.e. cerca de 20 %. Mais frequentemente tekstyne porvartidos estes termos ŠM: estudante (420816), universidade (3959), estudos (1562), mokslas (1508), sritis (1403). 2. Dvižodžiai terminai. 4 mln. palavras de tekstyne encontrar 145 468 dvižodžiai GT. Como escrito anteriormente, continuar a analisar apenas aqueles dvižodžiai GT, cuja frequência não menos de 10 vezes desses termos rasta 4889. Peržiūrėjus GT, na final ŠM lista de termos restou apenas 474 dvižodžiai termos e eles constituem a maior parte de todos os termos analisados mais de dois terçdalius (žr. 1 tabelę.). Dvižodžius terminus pode ser subdividado em tres tipos, tendo em conta as suas formas gramaticas. 1) dkt. K. + dkt. tipo ŠM termos de são 250, i. i. 52,7 % de todos termini doisžodžių. Os mais comuns desta estrutura ŠM termos, pavartoti tekstyne, são programa de estudos (1432), estágio de estudos (306), direção de estudos (303), cientista trabalhador (289), qualidade de estudos (253). 2) bdv. + dkt.17 junginiai constituem 200 ŠM termos de (dos quais 42,2 % dvižodžių terminų). Os mais frequentes termos ŠM são escola superior (2160), pesquisas científicas (918), alto ensino (730), ensino à distância (453), ensino profissional (403). Bdv. + dkt. conjuntos tipo são considerados GT naquele caso, quando būdvardis com daiktavardžiu harmonizado gimine, númeroum e alegrniu. Caso contrário gau16 Skliaustues indica a frequência daquele termo 4 mln. palavras de volume ŠM tekstyne. 17 Próximo dois-jodícios terminos modelos alegrnios não urodam, porque atributos e participos combinam com daiktavardzis, e daiktavardzis geralmente são unicascaitos substantivo alegrnio.
61Terminologia | 2012 | 19 mais importante direitos, mais importantes de aprendizado, nami gramatiškai netaisyklingi18 junginiai, pvz., glaudesnisuniversitetų, melhor do ano, ou compoinys é regulamentig, embora muitas vezes incompleto, e isso não ŠM terminai, например., maior do mundo, dinamškiausia no mundo, favoranku aos estudantes. 3) dlv. + dkt. conjuntos como ŠM termos é apenas 24, i. e. 5 %. Os mais frequentes Termos ŠM: finalisam trabalho (162), opcionkamasis assunto (109), educação de adultos (19 (65), retornamasse ligação (63), aplicomieis estudos (45). 3. Trižodžiai terminai. De total, foram estabelecidos 119 881 trižodis GT. Em mais detalhe analisados 2438 compoiniai, cuja freqüência tekstyne não menor que 8 caras. ŠM termos rasta 125, i. i. 16,03 % de todos os termos. Os mais frequentes ŠM termos: instituição de ensino superior (251), instituição de ensino profissional (205), paskola apoiada pelo Estado (149), escola de ensino geral (147), instituição de ensino profissional (77). Trižodžiai ŠM terminai são septynių gramatinių modelos. Entre trižodžių ŠM termos de bdv. K. + dkt. K. + dkt.20 mais frequentes tipo junginiai (eles constituem 48 % de todos os trižodžių terminų), ej.: instituição de ensino superior (251), instituição de ensino profissional (205), escola de ensino geral (147). Segundori entre trižodžių ŠM terminų segundo freqüência a é dkt. K. + dkt. K. + dkt. tipo junginiai (24,8 %, ex.: regulamento de direcções de estudos (66), descrição de direcções de estudos (60), instituto de ciência estatal (50). Terças de acordo freqüência a estruturação trižodžių ŠM terminų modelis é bdv. V. + bdv. V. + dkt. (12%), por exemplo: nacionalidade complexo programa (69), fundamental estudo científico (61), primário formação profissional (52). A seguir por freqüência pode dar apenas por alguns exemplos, contendo estruturais trižodžių ŠM terminų modelius: dkt. K. + dlv. V. + dkt. (4%), por exemplo: paskola apoiada pelo Estado (149), qualificação reconhecida pelo Estado (33), estudante financiado pelo Estado (21); dkt. K. + bdv. V. + dkt. (4%), por exemplo: escola superior estrangeira (41), colegia acadêmica conselho (32), diretor científico de doutorado (20); dlv. V. K. + dkt. K. + dkt. / (3,2%), ex: avaliação de qualificação final (36), lugar de estudos gratuito (13), estudos de natureza aplicada (13); bdv. V. + 18 Gramaticamente regularigis conjuntos neste trabalho consideram-se tais conjuntos, nos quais dependomieji palavras harmonizar com o principal, claras sintaksiniai relações entre palavras conjuno dėmenų. 19 Presso participantes incluídos e sudaiktavardėję participantes. 20 O derradeiro raiktavórcio mais divertido não é nurodido, porque ele geralmente é nomeador.
62 Erika Rimkutė | Automático da educação e ciência terminos dlv. V. (Ou K., se | nustatymaslingvistiniaismetodais participiv sudaiktavardėjęs) + dkt. (2,4 %, por exemplo: competitivo matéria de ensino (15), nãoformal ensino de adultos (13), científico trabalho de pesquisa (12); dlv. V. + bdv. V. + dkt. (1,6 %, por exemplo: atividade científica aplicada (20), pesquisas científicas por encomenda (8). 4. Keturžodžiai terminai. Do total encontrado 77.961 keturžodis GT, mais de 7 vezes pavimentados junções 760. Destes, o perito identificou 22 ŠM termos (eles representam 2,82 % de todos os termos). As mais frequentes neste grupo de termos junginiai são instituição de ciência e estudos (568), parque de ciência e tecnologias (62), comum nacionalidade complexo programa (40), ensino profissional do mercado de trabalho (40). ŠM tekstyne pavartoti keturžodžiai termininai são devynių diferentes gramatinių modelos. Já que keturžodžių termos de pavartota pouco, portanto e cada modelį ilustrava só po poucos ou só po um exemplo. Aqui segundo a freqüência fornecida agrupar todos os keturžodžių ŠM terminų estruturários modelos e indicar-se por um aquele modelo ilustrando exemplo: bdv. V. + dkt. K. + dkt. K. + dkt. (22,7 % de todos keturžodžių terminų): internacional científica base de dados (13); bdv. V. + bdv. K. + dkt. K. + dkt. (18,2 %): geral de ensino universitário (8); bdv. K. + dkt. K. + dlv. V. + dkt. (13,6 %): aprendiz com necessidades especiais (8); dkt. K. + jng. + dkt. K. + dkt. (13,6 %): instituição de ciência e estudos (568); bdv. K. + dkt. K. + bdv. V. + dkt. (9,1 %): pesquisas científicas de alto nível (18); dlv. V. + bdv. V. + dkt. K. + dkt. (9,1 %): reconhecida base de dados internacional (11); bdv. V. + bdv. V. + bdv. V. + dkt. (4,5 %): conjunto nacional integrado (40); dkt. K. + bdv. K. + dkt. K. + dkt. (4,5 %): instituição pública de pesquisa científica (31); dct. K. + dct. K. + dct. K. + dct. (4,5 %): sestruturas de estudos de ciências tecnológicas (28); 5. Penkiazodžiai terminai. Nunciar 49 768 penkiažodžiai GT, mais do que 5 vezes pavartotos conjuntos rasta 601, deles ŠM terminų - 4, i. y. 0,51 % de todos os terminų. A partir de tão pequeno número de termos, é difícil fazer generendrinas sobre sua estrutura, portanto, os termos estruturalmente não eskirstyti. Todos ŠM tekstyne pavartoti penkiažodžiai termos: pesquisas e desenvolvimento experimental (124), pesquisas e desenvolvimento tecnológico (67), pesquisas e desenvolvimento tecnológico (13), centro de pesquisa de alto nível (7).
69Terminologija | 2012 | 19 aAutomatic IDENTIFICatION OF SCIENCE aND EDUCatION TERMS USING LINGUISTIC MEtHODS The paper deals with possibilities and problems of automatic Lithuanian term extraction. Especificamente, linguistic methods are discussed in the domain of Education and Science. Other researchers have shown that it is almost impossible to have language-independent term extraction tools; this is especially true for tools which are based on linguistic rules. Therefore a linguistic term extraction tool should incorporate methods that would deal with a languages grammatical system. This paper presents a tool developed at the Centre of Computational Linguistics of Vytautas Magnus that employs linguistic rules for extracting domain-specific terminology. University In order to extract domain-specific terms automatically, some preparatory work should be completed: compilation of domain-specific corpus (a corpus of four million words has been compiled for this research), morphological annotation of the corpus, formulation of appropriate linguistic rules, and creation of methodology for filtering out irrelevant word combinations. O paper apresenta the linguistic rules that have been used for the extraction of Education and Science terms and the results of the extraction procedure. The identified terms are contrasted with approved terms in the Term Bank of the Republic of Lithuania. Some specific problems of automatic term extraction are discussed in the paper, e.g. number and case agreement of terms in a multi word term. Recebido 2012-05-17 Erika Rimkutė Universidade Vytautas o Grande K. Donelaičio g. 52, LT-44248 Kaunas E-mail [email protected]