Multi-word patterns in the corpus of Information and Communication Technology. Terminological bundles in the genre – ‘Textbooks in ICT’
Full text
39Terminologia | 2012 | 19 Multi-word patterns in the corpus of Information and Communication Tecnologia. Pacotes terminológicos do gênero […] […] Livros de texto em TIC[…] Marek Weber (em inglês) "O termo ""corpus linguístico"" (linguística de corpus), ""tecnologia da informação e da comunicação"" (tecnologia da informação e da comunicação), ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico,"" ""corpus léxico"" e ""corpus léxico,""") é um termo genérico que inclui todas as tecnologias desenvolvidas para fins de processamento e transferência de dados." Os textos foram selecionados para representar uma secção transversal do domínio das TIC. Os textos foram divididos em sete categorias que podem ser consideradas como gêneros dentro do domínio das TIC: Gênero 1: Artigos profissionais em TIC; Gênero 2: Artigos acadêmicos em TIC; Gênero 3: Documentação técnica de aplicações de software em TIC; Gênero 4: Documentação técnica de hardware de TIC; Gênero 5: Livros de texto em TIC; Gênero 6: Documentação técnica de linguagens de programação e ambientes de programação; Gênero 7: Documentação técnica de tecnologias de rede. O corpus contém uma coleção de 973 textos com um total de quase 24 milhões de palavras. A escolha de dados para um corpus é uma das preocupações mais importantes para o pesquisador, pois o corpus deve ser representativo do domínio de uso analisado. Como Douglas Biber sugere, a quantidade de textos é crucial para a pesquisa em que o estudioso se concentra no texto como a principal unidade de escrutínio. Deve ser incluído um número suficiente de textos em cada género para ter em conta a variação entre categorias e autores (Biber, 2006). A Comissão considera que a Comissão não tem competência para determinar a compatibilidade de uma medida de auxílio com o mercado interno.
40 Marek Weber Padrões de várias palavras no corpus de informação tabela 1. andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ Composição do género do corpus de tecnologias da informação e das comunicações Número Número de tokens de textos (palavras correntes) Artigos profissionais 391 225551 Artigos acadêmicos 95 1272001 Documentação técnica de 2472839 em ict aplicações de software 92 Documentação técnica do hardware de TIC 100 2471772 Livros de texto 99 15315237 Documentação técnica de programação 90 1282175 línguas e tecnologias de rede 106 725418 ambientes de programação Documentação técnica de TOTAL 973 23764993 (incluindo os seguintes) BUNDEL LEXICAL: O TERM Sequências recorrentes de palavras que aparecem juntas com mais frequência do que o esperado por acaso são uma parte importante da produção linguística. "O termo ""bundle léxico"" foi usado pela primeira vez por Douglas Biber, Stig Johansson, Geoffrey Leech, Susan Conrad e Edward Finegan na agora clássica gramática Longman de inglês falado e escrito para se referir a combinações de várias palavras identificadas com base no único critério de frequência (Biber et al., 1999), enquanto Mike Scott os chama de ""clusters de palavras"" no manual do aplicativo WordSmith Tools versão 46 e WordSmith Tools versão 5." A única consideração na identificação de feixes léxicos é a sua frequência. "Os aglomerados são palavras que se encontram repetidamente juntas em companhia umas das outras, em sequência" (Scott 2010: 337). Scott aponta essa palavra com clusters may involve semantic prosody i.e. the tendency for certain lexemes to co-occur with certain other lexemes (e.g. the tendency for cause to come efeitos negativos, como acidente, problema, etc.) (Scott 2010: 337). Biber, Johansson, Leech, Conrad e Finegan definem feixes léxicos como expressões recorrentes, independentemente de suas propriedades estruturais, ou seja, são sequências de formas de palavras que frequentemente co-ocorrem no discurso e apontam que feixes mais curtos são frequentemente incorporados em mais de um feixe léxico mais longo. Observam igualmente que, na maioria dos casos, os feixes léxicos não formam unidades estruturais e que a maioria deles são
41Terminologija | 2012 | 19 não expressões que os usuários da linguagem reconhecessem como idioma ou outras expressões léxicas fixas. Biber, Johansson, Leech, Conrad e Finegan estabelecem os seguintes limiares de corte para que as sequências de várias palavras se qualifiquem como feixes léxicos: elas devem ocorrer em pelo menos 10 vezes por milhão de palavras e em pelo menos cinco textos (Biber et al. 1999). Biber observa que um resultado surpreendente de uma abordagem impulsionada pela frequência é que os feixes léxicos têm duas características inesperadas (Biber 2006: 134). Em primeiro lugar, a maioria deles não é idiomática em significado, mas os significados são geralmente transparentes de formas de palavras individuais. Ken Hyland também aponta para o fato de que a maioria dos feixes são semanticamente transparentes e "formalmente regulares, fornecendo os blocos de construção de um discurso coerente" (Hyland 2008: 6). Em segundo lugar, a maioria dos feixes não são estruturas gramaticais completas. Biber, Johansson, Leech, Conrad e Finegan observaram que aproximadamente 15% dos feixes léxicos em conversação formavam unidades estruturais completas, enquanto apenas aproximadamente 5% dos feixes léxicos em prosa acadêmica poderiam ser considerados frases ou cláusulas completas (Biber et al. 1999: 1000). Uma descoberta valiosa sobre a natureza sintática dos feixes léxicos por Biber é que eles são unidades léxicas que frequentemente atravessam estruturas gramaticais, por exemplo, eles podem conectar duas frases ou cláusulas de tal forma que as últimas palavras de um feixe são as partes iniciais de uma segunda estrutura sintática. Hyland também enfatiza que os feixes léxicos identificados exclusivamente com base em sua frequência geralmente abrangem unidades estruturais (Hyland 2008: 6). Uma série de estudos de corpus foram dedicados à análise de cadeias recorrentes de formas de palavras ininterruptas e demonstram quão importantes são em vários tipos de discurso, bem como mostram uma variação considerável de feixes léxicos em diferentes gêneros e registros (p. Biber 2006; Biber, Conrad, Cortes 2004; Hyland 2008; Scott, Tribble 2006; Gozdz-Roszkowski em 2011). A decisão foi tomada de concentrar-se na análise de feixes de quatro palavras porque, por um lado, as frequências de feixes de quatro palavras são substancialmente mais elevadas do que as sequências de cinco palavras e, por outro lado, contêm frequentemente cadeias de três palavras e permitem identificar padrões e estruturas mais aparentes do que as expressões de três palavras. Listas de pacotes de 4 palavras em cada um dos
42 Marek Weber Padrões de várias palavras no corpus de Informação sete andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ gêneros de TIC foram gerados usando o WordSmith Tools v. […] o pacote de software 5.0 para pesquisa de padrões em corpora. Os dois pontos de corte seguintes foram fixados neste estudo: uma frequência mínima de ocorrência de 20 vezes por milhão de palavras e outro critério de que um feixe deveria ocorrer em pelo menos cinco textos. O processo de aplicação dos critérios de corte exigiu cálculos apropriados em cada um dos sete ficheiros que contêm a lista de feixes de um determinado género. Os cálculos são descritos nas seguintes etapas: 1. Criação de uma coluna adicional denominada "Frequência por milhão" na folha de cálculo obtida a partir do software WordSmith Tools. 2. Inserir o valor das palavras em execução numa célula livre da folha de cálculo do Excel dentro de uma determinada categoria. 3. Preenchimento da primeira célula da coluna "Frequência por milhão" com a seguinte fórmula: Copia da fórmula para outras células clicando no canto inferior direito da célula preenchida e arrastando para baixo para outras células. 5. Destaque da coluna "Número de textos". 6.Escolha o menu "Dados" e selecione o campo "Sortear e Filtrar" na ferramenta de classificação. 7. Escolha da ordem de classificação decrescente. 8. Supressão de todas as linhas do quadro para as quais os valores do campo "Número de textos" são inferiores a 5. 9. Destacando a coluna "Frequência por milhão". 10. Escolha o menu "Dados" e selecione o campo "Sortear e Filtrar" na ferramenta de classificação. 11. Escolha da ordem de classificação decrescente. 12. Supressão de todas as linhas do quadro para as quais os valores no campo "Frequência por milhão" são inferiores a 20. 1886 feixes diferentes foram encontrados no corpus após a aplicação dos critérios de corte acima. O número total de feixes identificados em todos os dados ascendeu a 197 553.
43Terminologia | 2012 | 19 tabela 2. Distribuição de feixes léxicos em gêneros de TIC O número total Número de difer-% da execução de feixes após ent feixes após palavras em feixes aplicando cut-off aplicando critérios de cut-off critérios Artigos profissionais 1057 131 1,8 Artigos acadêmicos 5548 120 1,7 Aplicações de software 44669 403 7,2 Hardware 55296 672 8,9 Livros de texto 72483 119 1,9 Programação indicadores e ambientes de programação lan-10984 180 3,4 tecnologias de rede 7516 261 4,1 Total de 1975 a 53 anos 1886 A percentagem de palavras correntes em feixes foi obtida multiplicando o número de casos totais para um determinado gênero por 4 (analisam-se feixes de quatro palavras) e dividindo pelo número de palavras correntes em um determinado gênero e, em seguida, multiplicando por 100 % de acordo com a fórmula: Em nosso ponto de vista, dois parâmetros: a gama de diferentes feixes e a percentagem de palavras correntes em feixes podem ser considerados indicadores do grau em que um determinado gênero é formulaico e repetitivo em comparação com outros gêneros. Em outras palavras, o grau de formulaicidade e repetitividade de um gênero pode ser medido pela gama de diferentes feixes empregados em um gênero e pela porcentagem de palavras correntes em feixes. Os gêneros de TIC podem ser divididos em três grupos de acordo com o critério de formulação e repetitividade. O gênero 3 […] "documentação técnica de aplicações de software em TIC" e o gênero 4 […] "documentação técnica de hardware de TIC" são caracterizados por altos graus de formulação e repetitividade, uma vez que apresentam padrões comparáveis, empregando o maior âmbito de diferentes pacotes (403 e 672 respectivamente) e a maior percentagem de palavras correntes em pacotes (7,2 % e 8,9 % respectivamente).
44 Marek Weber Padrões de múltiplas palavras no corpus de informação andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ Figura 1: Gêneros com altos graus de formulaicidade e repetitividade Em contraste, o gênero 1 […] "artigos profissionais em TIC", o gênero 2 […] "artigos acadêmicos em TIC" e o gênero 5 […] "livros de texto em TIC" caracterizam-se por graus relativamente baixos de formulaicidade e repetitividade, uma vez que utilizam o menor escopo de diferentes feixes (1, 1, 120 e 119, respectivamente) e o menor percentual de palavras correntes em feixes (1, 8, 1,7 e 119) 1,9 % respectivamente). Os dois gêneros restantes: gênero 6 […] […] documentação técnica de linguagens de programação e ambientes de programação […] e gênero 7 […] […] documentação técnica de tecnologias de rede […] formam o terceiro grupo, com os valores de ambos os parâmetros no meio da faixa (números de diferentes feixes: 180 e 261 respectivamente; percentagem de palavras correntes em feixes 3,4 % e 4,1 % respectivamente). No entanto, vale a pena ter em mente que, como Stanislaw Gozdz-Roszkowski corretamente aponta, comparações diretas só podem ser feitas com segurança entre gêneros com contagens de palavras semelhantes. A fim de ter em conta essa consideração, a porcentagem do parâmetro de palavras correntes em feixes é calculada para cada gênero de forma a refletir a contagem de palavras de cada um dos subcorpos que representam os respectivos gêneros (Gozdz-Roszkowski 2011: 111). Classificação funcional dos feixes Um quadro para a análise funcional dos feixes obtidos neste corpus foi estabelecido a partir das taxonomias de Biber (Biber 2006; Biber et al. 2004), Hyland (2008) e Gozdz-Roszkowski (2011). A classificação de Biber resultou do escrutínio de um amplo corpus de registros falados e escritos que cobriam, entre outros, tipos de discurso como: conversas ocasionais, fitas de sessões de aula, ensino em sala de aula, horas de escritório, grupos de estudo, encontros de serviço no campus, livros didáticos, pacotes de cursos, textos institucionais (por exemplo, catálogos universitários, brochuras).
45Terminologia | 2012 | 19 O corpus do estudo de Hyland (2008) (tamanho de 3,5 milhões de palavras) compreende artigos de pesquisa, dissertações de doutorado e teses de disciplines: electrical engineering and microbiology from the applied and pure sciences, and business studies and applied linguistics from the social mestrado em quatro ciências. Gozdz-Roszkowski (2011) analisou um corpus de direito americano contendo mais de 5,5 milhões de palavras e representando sete gêneros dentro da cultura e educação jurídica americana: artigos acadêmicos, resumos, contratos, legislação, opiniões, artigos profissionais e livros didáticos. Com base nas taxonomias acima mencionadas, os feixes léxicos nas TIC foram funcionalmente divididos em três grandes categorias em relação aos seus significados nos textos: centrados na pesquisa, centrados no texto e centrados no participante. Os pacotes agrupados na primeira categoria ajudam os escritores a organizar as suas actividades e experiências no domínio das TIC. Os feixes centrados no texto são empregados para indicar a organização do texto e seu significado. Finalmente, os feixes centrados no participante são usados para sinalizar diferentes atitudes ou avaliações e são focados no escritor ou no leitor do texto. Figura 2: Taxonomia funcional dos feixes léxicos Cada uma das três principais categorias funcionais de feixes léxicos foi subdividida em várias subcategorias. Os feixes centrados na pesquisa incluem as seguintes subcategorias: feixes de quantidade (por exemplo, um dos maiores; um grande número de; um dos seguintes; o número de elementos); feixes de referência de tempo (por exemplo, no momento de; fim de ano; as próximas semanas; nas próximas semanas); Colocar feixes de referência de direção (por exemplo, nos Estados Unidos; da janela principal; parte inferior da janela; na barra de estado);
46 Marek Weber Padrões de várias palavras no corpus de pacotes de procedimentos de andCommunicationTechnology.Terminological bundlesinthegenre–‘TextbooksinICT’ informação […] usados para descrever diversas funções relacionadas com as TIC (por exemplo, o uso de; o uso de um); Pacotes de indicadores temáticos relacionados com a área de investigação (por exemplo, procedimentos do IEEE; linguagens e sistemas de programação; o menu suspenso; as seguintes opções de configuração); feixes de referência multifuncionais […] feixes que podem ser utilizados como referência de texto de localização temporal (por exemplo, o final do; o início do; a esquerda do; no início do); Os feixes de descrição especificam as características do substantivo seguinte (por exemplo, a complexidade do; a superfície do; o âmbito do; a altura do). Os pacotes centrados no texto incluem as seguintes subcategorias: Pacotes de elaboração […] elaboram mais sobre o tópico analisado e o esclarecem (por exemplo, ao mesmo tempo, bem como o, isto significa que o, neste caso o); Os feixes de transição fornecem conexões aditivas ou contrastantes entre partes de textos (por exemplo, por outro lado, em oposição ao, além do, em contraste com o); Framing atributos feixes […] […] situar argumentos especificando condições limitantes […] (Hyland 2008: 14) para fazer alegações ou argumentos (por exemplo, em termos do, no contexto de, na presença do, o conteúdo do); Pacotes de condições […] expressam condições (por exemplo, se você quiser, se você não quiser, se você tem um, se você tem um); Os feixes de resultados indicam ligações lógicas entre os elementos em termos de relações de causa e resultado (por exemplo, para que possa, como resultado de, como resultado do, como função de); Os feixes de marcadores de estrutura […] são usados para apontar para outras partes do texto (por exemplo, como mostrado na figura, como discutido na secção, é mostrado em exemplo, mais adiante neste capítulo). Os pacotes centrados no participante incluem as seguintes subcategorias: Pacotes de engajamento […] dirigem-se diretamente aos leitores; […] dirigir-se ativamente aos leitores como participantes no discurso em andamento […] (Hyland 2008: 18) (por exemplo, fazer um dos, selecionar o tipo de, é recomendado que você, selecionar um dos); Pacotes de postura […] transmitem emoções, atitudes, julgamentos de valor e avaliações; […]fornecer um quadro para a interpretação da seguinte proposição[…] (Biber, 2006: 139) (por exemplo, é necessário, não é garantido que, é importante, não é possível, é possível); quadro 3: Distribuição dos feixes léxicos entre as categorias funcionais
47Terminologia | 2012 | 19 Pacotes de modalidades […] expressam que algo é provável, permissível ou necessário (por exemplo, deve ser cumprido um, pode ser usado para, como pode ser visto, no qual você pode, não pode ser exibido, pode ser reproduzido ou, deve aceitar qualquer interferência, interferência que pode causar, que pode causar indesejado); Pacotes de previsão […] expressam a previsão do escritor de alguma ação futura (por exemplo, espera-se que seja, você será solicitado, será exibido em, isso abrirá o, será solicitado). Table 3 shows the numbers of bundles belonging to the three major functional categories in each genre. Pesquisaos -Texto-Pcentrado articipancentrado centrado te-OutrArtigos profissionais 45 23 13 45 Artigos acadêmicos 48 35 928 Aplicações de software 123 55 122 83 Hardware 207 51 138 187 Livros de texto 32 35 18 20 Linguagens de programação programação 39 39 26 62 e ambientes de tecnologias de rede 91 24 11 91 Figura 3: Classificação dos feixes centrados na investigação