scieee AI-readable full text Open interactive document viewer

Multi-word patterns in the corpus of Information and Communication Technology. Terminological bundles in the genre – ‘Textbooks in ICT’

Marek Weber

Full text

39Terminología | 2012 | 19 Multi-word patterns in the corpus of Information and Communication La tecnología. paquetes terminológicos en el género […] […]Libros de texto en TIC[…] Marek Weber. ¿Qué es esto? BIALYSTOK University of Technology KEYWORDS: corpus linguística, Tecnología de la Información y la Comunicación, paquetes léxicos, clasificación funcional de paquetes léxicos, paquetes terminológicos, escrutinio léxico DATOS PARA EL Estudio, EL CORPUS DE TECNOLOGIA DE INFORMACIÓN Y COMUNICACIÓN Los datos para el estudio consisten en un corpus electrónico del amplio dominio de la Tecnología de la Información y la Comunicación (TIC) un término general que incluye todas las tecnologías desarrolladas con el propósito de procesar y transferir datos. Los textos fueron seleccionados para representar una sección transversal del campo de las TIC. Los textos se dividieron en siete categorías que pueden considerarse como géneros dentro del dominio de las TIC: Género 1: Artículos profesionales en TIC; Género 2: Artículos académicos en las TIC; Género 3: Documentación técnica de aplicaciones de software en las TIC; Género 4: Documentación técnica del hardware de las TIC; Género 5: libros de texto en TIC; Género 6: Documentación técnica de lenguajes de programación y entornos de programación; Género 7: Documentación técnica de las tecnologías de red. El corpus contiene una colección de 973 textos con un total de casi 24 millones de palabras. La elección de los datos para un corpus es una de las preocupaciones más importantes para el investigador, ya que el corpus debe ser representativo del dominio de uso analizado. Como sugiere Douglas Biber, la cantidad de textos es crucial para la investigación en la que el erudito se concentra en el texto como la unidad primaria de escrutinio. Debe incluirse un número suficiente de textos en cada género para tener en cuenta la variación entre categorías y autores (Biber, 2006) En el caso de los productos agrícolas que se utilizan para la fabricación de productos alimenticios, el valor de la ayuda es igual o superior al valor de la ayuda. 40 Marek Weber Patrones de varias palabras en el corpus de la tabla de  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ información 1. Composición del género del corpus de tecnologías de la información y la comunicación Número Número de fichas de textos (palabras corrientes) Artículos profesionales 391 225551 Artículos académicos 95 1272001 Documentación técnica de las 2472839 en TIC aplicaciones de software 92 Documentación técnica del hardware de las TIC 100 2471772 Libros de texto 99 15315237 Documentación técnica de la programación 90 1282175 Lenguas tecnologías de red 106 725418 y entornos de programación Documentación técnica de las Total de las operaciones 973 23764993 Conjunto léxico: el término Las secuencias recurrentes de palabras que aparecen juntas con más frecuencia de lo esperado por casualidad son una parte importante de la producción lingüística. El término "bundle léxico" fue utilizado por primera vez por Douglas Biber, Stig Johansson, Geoffrey Leech, Susan Conrad y Edward Finegan en la ahora clásica gramática Longman del inglés hablado y escrito para referirse a combinaciones de varias palabras identificadas sobre la base del único criterio de frecuencia (Biber et al., 1999), mientras que Mike Scott las llama grupos de palabras en el manual de la aplicación de software WordSmith Tools versión 46 y WordSmith Tools versión 5 (2010). La única consideración en la identificación de paquetes léxicos es su frecuencia. "Los grupos son palabras que se encuentran repetidamente juntas en la compañía de los demás, en secuencia" (Scott 2010: 337). clusters may involve semantic prosody i.e. the tendency for certain lexemes to co-occur with certain other lexemes (e.g. the tendency for cause to come Scott señala esa palabra con efectos negativos como accidente, problemas, etc.) (Scott 2010: 337). Biber, Johansson, Leech, Conrad y Finegan definen los paquetes léxicos como expresiones recurrentes independientemente de sus propiedades estructurales, es decir, son secuencias de formas de palabras que frecuentemente co-ocurren en el discurso y señalan que los paquetes más cortos a menudo se incorporan en más de un paquete léxico más largo (Biber et al. 1999). También observan que en la mayoría de los casos los haces léxicos no forman unidades estructurales y la mayoría de ellos son 41Terminologija | 2012 | 19 no son expresiones que los usuarios de la lengua reconocerían como idiomas u otras expresiones léxicas fijas. Biber, Johansson, Leech, Conrad y Finegan establecen los siguientes umbrales de corte para que las secuencias de varias palabras califiquen como paquetes léxicos: deben ocurrir al menos 10 veces por millón de palabras y al menos en cinco textos (Biber et al. 1999). Biber señala que un resultado sorprendente de un enfoque impulsado por la frecuencia es que los paquetes léxicos tienen dos características inesperadas (Biber 2006: 134). En primer lugar, la mayoría de ellos no son idiomáticos en el significado, pero los significados suelen ser transparentes de las formas de palabras individuales. Ken Hyland también señala el hecho de que la mayoría de los paquetes son semánticamente transparentes y "formalmente regulares, proporcionando los bloques de construcción de un discurso coherente" (Hyland 2008: 6). En segundo lugar, la mayoría de los paquetes no son estructuras gramaticales completas. Biber, Johansson, Leech, Conrad y Finegan observaron que aproximadamente el 15% de los paquetes léxicos en la conversación formaban unidades estructurales completas, mientras que solo aproximadamente el 5% de los paquetes léxicos en la prosa académica podrían considerarse frases o cláusulas completas (Biber et al. 1999: 1000). Un hallazgo valioso en la naturaleza sintáctica de los paquetes léxicos por Biber es que son unidades léxicas que con frecuencia atraviesan estructuras gramaticales, por ejemplo, pueden unir dos frases o cláusulas de tal manera que las últimas palabras de un paquete son las partes iniciales de una segunda estructura sintáctica. Hyland también hace hincapié en que los paquetes léxicos que se identifican únicamente sobre la base de su frecuencia suelen abarcar unidades estructurales (Hyland 2008: 6) El Consejo de Administración y el Consejo de Administración de la Unión Europea han adoptado una decisión sobre la compatibilidad de la ayuda con el mercado interior. Una serie de estudios de corpus se han dedicado al análisis de cadenas recurrentes de formas de palabras ininterrumpidas y demuestran lo importantes que son en varios tipos de discurso, así como muestran una considerable variación de paquetes léxicos en diferentes géneros y registros (p. Biber 2006; Biber, Conrad, Cortes 2004; Hyland 2008; Scott, Tribble 2006; y otros, incluidos los que se indican a continuación. Gozdz-Roszkowski 2011) y el Consejo de la Unión Europea. METODOLOGÍA USADA EN EL Estudio Se decidió concentrarse en el análisis de paquetes de cuatro palabras porque, por un lado, las frecuencias de paquetes de cuatro palabras son sustancialmente más altas que las secuencias de cinco palabras y, por otro lado, contienen con frecuencia cadenas de tres palabras y permiten identificar patrones y estructuras más aparentes que las expresiones de tres palabras. Listas de paquetes de cuatro palabras en cada uno de los 42 Marek Weber Los patrones de palabras múltiples en el corpus de  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ información de siete géneros de TIC se generaron utilizando las herramientas de WordSmith v. […] el paquete de software 5.0 para la búsqueda de patrones en corpora. En este estudio se establecieron los siguientes dos puntos de corte: una frecuencia mínima de ocurrencia de 20 veces por millón de palabras y otro criterio de que un paquete debe aparecer en al menos cinco textos. El proceso de aplicación de los criterios de corte requirió cálculos apropiados en cada uno de los siete archivos que contienen la lista de paquetes de un género dado. Los cálculos se describen en los siguientes pasos: 1. Creación de una columna adicional llamada "Frecuencia por millón" en la hoja de cálculo obtenida del software WordSmith Tools. Insertar el valor de las palabras en ejecución en una celda de hoja de cálculo de Excel libre dentro de una categoría dada. 3. Rellenar la primera celda de la columna "Frecuencia por millón" con la siguiente fórmula: 4. Copiar la fórmula a otras celdas haciendo clic en la esquina inferior derecha de la celda llenada y arrastrándola hacia abajo a otras celdas. 5. Destacar la columna "Número de textos". 6. Elegir el menú […]Datos[…] y seleccionar el campo […]Sort &Filter[…] en la herramienta de clasificación. 7. Elegir el orden de clasificación descendente. 8. Supresión de todas las filas del cuadro para las cuales los valores del campo "Número de textos" son inferiores a 5. 9. Destacar la columna "Frecuencia por millón". 10. Elegir el menú "Datos" y seleccionar el campo "Sortar y filtrar" en la herramienta de clasificación. 11. Elegir el orden de clasificación descendente. 12. Supresión de todas las filas del cuadro para las cuales los valores en el campo "frecuencia por millón" son inferiores a 20. 1886 se encontraron diferentes paquetes en el corpus después de aplicar los criterios de corte anteriores. El número total de paquetes identificados en todos los datos ascendió a 197 553. 43Terminología | 2012 | 19 cuadro 2. Distribución de paquetes léxicos en géneros de TIC El número total Número de diferencias-% de la ejecución de aplicando criterio de corte paquetes después de ent paquetes después de palabras en paquetes aplicando criterio de corte Artículos profesionales 1057 131 1,8 Artículos académicos 5548 120 1,7 Aplicaciones de software 44669 403 7,2 El equipo 55296 672 8,9 Libros de texto 72483 119 1,9 Programación indicadores y entornos de programación lan-10984 180 3,4 tecnologías de red 7516 261 4,1 Total de 1975 a 53 años y 1886 El porcentaje de palabras corrientes en los paquetes se obtuvo multiplicando el número de casos totales para un género dado por 4 (se analizan paquetes de cuatro palabras) y dividiendo por el número de palabras corrientes en un género dado y luego multiplicando por 100 % de acuerdo con la fórmula: En nuestra opinión, dos parámetros: el rango de diferentes paquetes y el porcentaje de palabras corrientes en paquetes pueden considerarse como indicadores del grado en que un género dado es formulario y repetitivo en comparación con otros géneros. En otras palabras, el grado de formula y repetitividad de un género se puede medir por el rango de diferentes paquetes empleados en un género y el porcentaje de palabras corrientes en paquetes. Los géneros de las TIC se pueden dividir en tres grupos de acuerdo con el criterio de formulación y repetitividad. El género 3 […] "documentación técnica de aplicaciones de software en las TIC" y el género 4 […] "documentación técnica de hardware de las TIC" se caracterizan por un alto grado de formulación y repetitividad, ya que muestran patrones comparables al emplear el mayor alcance de diferentes paquetes (403 y 672 respectivamente) y el mayor porcentaje de palabras en paquetes (7,2 % y 8,9 % respectivamente). 44 Marek Weber Patrones de palabras múltiples en el corpus de información  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ Figura 1: Géneros con altos grados de formulación y repetitividad En contraste, el género 1 […] […] artículos profesionales en TIC[…], el género 2 […] […] artículos académicos en TIC[…] y el género 5 […] libros de texto en TIC[…] se caracterizan por grados relativamente bajos de formulación y repetitividad ya que utilizan el alcance más bajo de diferentes paquetes (11, 120 y 119, respectivamente) y el porcentaje más bajo de palabras corrientes en paquetes (1,8 y 1,7%) 1,9 % respectivamente). Los dos géneros restantes: el género 6 […] […] documentación técnica de lenguajes de programación y entornos de programación[…] y el género 7 […] […] documentación técnica de tecnologías de red[…] forman el tercer grupo con los valores de ambos parámetros en el centro del rango (números de diferentes paquetes: 180 y 261 respectivamente; porcentaje de palabras en curso en paquetes 3,4 % y 4,1 % respectivamente). Sin embargo, vale la pena tener en cuenta que, como señala con razón Stanislaw Gozdz-Roszkowski, las comparaciones directas solo se pueden hacer con seguridad entre géneros con un número de palabras similar. Con el fin de tener en cuenta esa consideración, el porcentaje de parámetros de palabras corrientes en paquetes se calcula para cada género de manera que refleje el número de palabras de cada uno de los subcorporaciones que representan los respectivos géneros (Gozdz-Roszkowski 2011: 111). CLASIFICACIÓN FUNCIONAL DE BUNDLES Se estableció un marco para el análisis funcional de los paquetes obtenidos en este corpus a partir de las taxonomías de Biber (Biber 2006; Biber et al. 2004), Hyland (2008) y Gozdz-Roszkowski (2011). La clasificación de Biber fue el resultado del escrutinio de un amplio corpus de registros hablados y escritos que cubrían, entre otros, tipos de discursos como: conversaciones ocasionales, cintas de sesiones de clase, enseñanza en clase, horas de oficina, grupos de estudio, encuentros de servicio en el campus, libros de texto, paquetes de cursos, textos institucionales (por ejemplo, catálogos universitarios, folletos). 45Terminología | 2012 | 19 El corpus en el estudio de Hyland (2008) (tamaño 3,5 millones de palabras) comprende artículos de investigación, disertaciones de doctorado y tesis disciplines: electrical engineering and microbiology from the applied and pure sciences, and business studies and applied linguistics from the social de maestría o maestría en cuatro ciencias. Gozdz-Roszkowski (2011) analizó un corpus de derecho estadounidense que contiene más de 5,5 millones de palabras y representa siete géneros dentro de la cultura y la educación jurídica estadounidense: artículos académicos, resúmenes, contratos, legislación, opiniones, artículos profesionales y libros de texto. Basándose en las taxonomías mencionadas anteriormente, los paquetes léxicos en las TIC se dividieron funcionalmente en tres grandes categorías con respecto a sus significados en los textos: centrados en la investigación, centrados en el texto y centrados en el participante. Los paquetes agrupados en la primera categoría ayudan a los escritores a organizar sus actividades y experiencias en el ámbito de las TIC. Los paquetes centrados en el texto se emplean para indicar la organización del texto y su significado. Por último, los paquetes centrados en el participante se utilizan para señalar diferentes actitudes o evaluaciones y se centran en el escritor o lector del texto. Figura 2: Taxonomía funcional de los paquetes léxicos Cada una de las tres principales categorías funcionales de los paquetes léxicos se subdividió en una serie de subcategorías. Los paquetes centrados en la investigación incluyen las siguientes subcategorías: paquetes cuantitativos (por ejemplo, uno de los más grandes; un gran número de; uno de los siguientes; el número de elementos); paquetes de referencia de tiempo (por ejemplo, en el momento de; fin de año; las próximas semanas; en las próximas semanas); Colocar paquetes de referencia de dirección (por ejemplo, en los Estados Unidos; de la ventana principal; parte inferior de la ventana; en la barra de estado); 46 Marek Weber Patrones de varias palabras en el corpus de paquetes de  andCommunicationTechnology.Terminological  bundlesinthegenre–‘TextbooksinICT’ procedimientos de información utilizados para describir diversas funciones relacionadas con las TIC (por ejemplo, el uso de; el uso de un); paquetes de indicadores temáticos relacionados con el área de investigación (por ejemplo, actas del IEEE; lenguajes y sistemas de programación; el menú desplegable; las siguientes opciones de configuración); paquetes de referencia multifuncionales […] paquetes que se pueden utilizar como referencia de texto de tiempo y lugar (por ejemplo, el final del; el comienzo del; la izquierda del; al comienzo del); Los paquetes de descripción […] especifican las características del siguiente sustantivo (por ejemplo, la complejidad del; la superficie del; el alcance del; la altura del). Los paquetes centrados en el texto incluyen las siguientes subcategorías: paquetes de elaboración que elaboran más sobre el tema analizado y lo aclaran (por ejemplo, al mismo tiempo, así como el, esto significa que el, en este caso el); Los paquetes de transición […] proporcionan conexiones aditivas o contrastantes entre partes de textos (por ejemplo, por otro lado, en oposición a la, además de la, en contraste con la); Enmarcar conjuntos de atributos […] […] situar argumentos especificando condiciones limitantes […] (Hyland 2008: 14) para hacer afirmaciones o argumentos (por ejemplo, en términos de, en el contexto de, en presencia de, el contenido de); Grupos de condiciones […] expresan condiciones (por ejemplo, si quieres, si no quieres, si tienes un, si tienes un); Los paquetes de resultados indican vínculos lógicos entre los elementos en términos de relaciones de causa y resultado (p. ej., para que pueda, como resultado de, como resultado de, como función de); Los conjuntos de marcadores de estructura […] se utilizan para señalar a otras partes del texto (por ejemplo, como se muestra en la figura, como se discute en la sección, se muestra en ejemplo, más adelante en este capítulo). Los paquetes centrados en el participante incluyen las siguientes subcategorías: paquetes de compromiso […] se dirigen directamente a los lectores; […]dirigir activamente a los lectores como participantes en el discurso que se desarrolla[…] (Hyland 2008: 18) (por ejemplo, hacer uno de los, seleccionar el tipo de, se recomienda que usted, seleccionar uno de los); Los paquetes de posturas transmiten emociones, actitudes, juicios de valor y evaluaciones. […]proporcionar un marco para la interpretación de la siguiente proposición[…] (Biber, 2006: 139) (por ejemplo, es necesario, no es garantía de que, es importante, no es posible, es posible); cuadro 3: Distribución de 47Terminología | 2012 | 19 paquetes de modalidades […] expresan que algo es probable, permisible o necesario (por ejemplo, debe cumplirse un, puede ser utilizado para, como se puede ver, en el que se puede, no puede ser exhibido, puede ser reproducido o, debe aceptar cualquier interferencia, interferencia que puede causar, que puede causar indeseados); Los paquetes de predicción expresan la predicción del escritor de alguna acción futura (por ejemplo, se espera que sea, se le pedirá, se mostrará en, esto abrirá el, se le pedirá). Table 3 shows the numbers of bundles belonging to the three major functional categories in each genre. los paquetes léxicos entre las categorías funcionales InvestigaOtros ción-Texcentrado to-Particentrado centrado cipante-- Artículos profesionales 45 23 13 45 Artículos académicos 48 35 928 Aplicaciones de software 123 55 122 83 Hardware y equipos de construcción 207 51 138 187 Libros de texto 32 35 18 20 Lenguas de programación y 39 39 26 62 entornos de programación tecnologías de red 91 24 11 91 Gráfico 3: Clasificación de los paquetes centrados en la investigación