Verbos y sustantivos en textos científicos. Análisis de variación en un corpus de textos de ciencas aplicadas, naturales, sociales y humanidades
Full text
VERBOS Y SUSTANTIVOS EN TEXTOS CIENTÍFICOS. ANÁLISIS DE VARIACIÓN EN UN CORPUS DE TEXTOS DE CIENCIAS APLICADAS, NATURALES, SOCIALES Y HUMANIDADES1 Guillermo Soto Ricardo Martínez Scott Sadowsky Universidad de Chile The present investigation proposes that the nominalization index (the ratio of nouns to verbs in a given text) successfully predicts the academic-scientific character of a text. The results of a computer-assisted analysis of a 12.7 million word corpus show that this index is sensitive to the opposition between scientific/academic texts and letters to the editor/journalistic texts. It is likewise sensitive to the differences between applied sciences, natural sciences, social sciences and humanities texts, although there is a certain amount of overlap between these last two. When contrasting expert and novice texts, the index is only sensitive in the case of applied and natural sciences. It is suggested that the greater relative occurrence of nouns could be related to the construction of an object-centric depersonalized discourse in which the vicissitudes of actors' mental processes are believed to be irrelevant in the interpretation of discourse-coherence relationships. 1. INTRODUCCIÓN 1.1. La determinación de géneros discursivos y registros lingüísticos en la lingüística computacional La determinación de géneros y registros discursivos constituye una tarea tradicional de los estudios del discurso (Ciapuscio, 1997; De Beaugrande y Dressler, 1997; Calsamiglia y Tuson, 1999; Van Dijk, 1997). En términos muy generales, pueden distinguirse dos grandes perspectivas en esta materia: de un lado, estudios trascendentes que intentan caracterizar los géneros atendiendo a la relación entre los textos y sus contextos sociales y cognitivos; del otro, indagaciones inmanentes que persiguen dar cuenta de los registros considerando sus rasgos lingüísticos formales. Mientras los primeros predominan en estudios de corte retórico y literario, los segundos son desarrollados en su mayoría por lingüistas. Ciertamente, ambas orientaciones no son incompatibles, toda vez que, en primer término, la determinación de rasgos lingüísticos presupone, normalmente, alguna referencia al valor en uso de estos, y, en segundo lugar, la relación entre texto y contexto se manifiesta en 1 Este trabajo forma parte del proyecto de investigación DID SOC-01/01-2 de la Universidad de Chile. Guillermo Soto: [email protected]; Ricardo Martínez: [email protected]; Scott Sadowsky: [email protected]. I.S.S.N. 1132-0265 PHILOLOGIA HISPALENSIS 19 (2005) 169-187
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 170 determinados fenómenos lingüísticos. De ahí, pues, que en general la determinación de los géneros o los registros obedezca a alguna combinación de rasgos inmanentes y trascendentes2. En las últimas décadas ha habido un importante avance en la caracterización y determinación de géneros o registros a partir de análisis cuantitativos automáticos sobre corpora extensos. Gran parte de estos estudios se centran en propiedades inmanentes puramente formales, esto es, no operan sobre categorías léxico-gramaticales dotadas de expresión y contenido sino sobre unidades de expresión carentes de significado3. Si bien estos trabajos pueden resultar útiles para tareas prácticas como la clasificación automática de documentos, desde el punto de vista estrictamente lingüístico tienen un interés limitado precisamente por no analizar el discurso y sus constituyentes como hechos de lenguaje. Más pertinentes, en este sentido, pueden ser indagaciones que, empleando las herramientas de la lingüística computacional y de corpus, intenten operar sobre categorías lingüísticas. Este último tipo de investigaciones podría aportar información tanto sobre el funcionamiento textual de las categorías consideradas como sobre el funcionamiento global de los textos como hechos de lenguaje. Entre los estudios que intentan combinar fenómenos inmanentes y trascendentes mediante análisis automático computarizado de categorías léxico-gramaticales, destaca el trabajo seminal de Biber (1988). En este, a partir de un estudio multidimensional en que se emplea el análisis factorial, se determinan seis dimensiones de covariación de rasgos lingüísticos. Estas, interpretadas sociocognitivamente, sirven para proponer una categorización de registros escritos y orales del inglés. El análisis propuesto por Biber consta de tres momentos. Primero, una etapa cualitativa de determinación de las unidades por considerar (variables y textos); segundo, un análisis cuantitativo que considera tanto la frecuencia de las variables como sus correlaciones; y tercero, una interpretación cualitativa de los resultados globales. Desde el punto de vista metodológico, se trata de un estudio mixto en que tanto la primera etapa como la tercera dependen de estudios previos que han establecido relaciones funcionales específicas o generales a partir de indagaciones que han considerado otros métodos y otros corpora. El método propuesto por Biber se ha aplicado, con mayores o menores ajustes, a diversos estudios sincrónicos, diacrónicos y de desarrollo del lenguaje en distintas lenguas (Sardinha, 2000), entre ellas el español (Parodi, 2005; Soto/Sadowsky/Martínez, en preparación). La magnitud de rasgos considerados en este tipo de análisis y el ingenio diseñado para conformar constelaciones explica, probablemente, su adopción como modelo por un número creciente de investigadores. La aplicación del método de Biber en el análisis de corpus relativamente extensos del orden de cientos de miles de palabras ha tenido como resultado, primero, una complejización de dicotomías clásicas como oralidad-escritura4; segundo, un apoyo cuantitativo a estudios funcionales previos que caracterizaban fenómenos léxico2 Para una caracterización más detenida de la oposición entre géneros y registros, v. MacDonald (2002), quien, además, discute el concepto relacionado de ‘estilo’. La perspectiva social de los géneros se presenta en Bajtín, 1986; el enfoque retórico, en Miller, 1984; una propuesta lingüístico-retórica puede encontrarse en Swales, 1990; una aproximación a los géneros como tecnologías cognitivas se expone en Soto (2005b). 3 Un listado de este tipo de herramientas se encuentra en http://tinyurl.com/3qw3q. 4 Esta complejización no es exclusiva del trabajo de Biber (cfr., entre otros, Tannen, 1982a, 1982b; Chafe y Tannen, 1987; Ludwig, 1989).
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 171 gramaticales; y, tercero, una organización de registros textuales en un espacio multidimensional estructurado a partir de vectores interpretados funcionalmente. No obstante sus importantes logros, este tipo de metodología presenta algunos problemas. Como en el estudio de Biber no se analizan los datos del corpus desde el punto de vista de un análisis del discurso que considere el funcionamiento efectivo de unidades dotadas de expresión y contenido, esto es, signos en uso, no existe garantía con respecto a la conexión propuesta entre rasgos y funciones. Este problema, evidente en el nivel de las construcciones gramaticales, que no se reducen de manera simple e indiscutible a rasgos formales explícitos, está presente, también, en todo tipo de signo, dado que la relación forma-función no es biunívoca y la frontera entre semántica y pragmática es difusa. Proyectado al análisis biberiano, lo anterior significa que si bien puede determinarse que hay rasgos con mayor frecuencia en textos en que predominan ciertas funciones, no se puede aseverar que el rasgo cumpla siempre esa función ni que determinada función se instrumente sólo en determinados rasgos. De hecho, incluso cuando el rasgo se manifiesta predominantemente en discursos con cierta función no hay garantía de una relación funcional directa. Un ejemplo extremo se advierte en el caso de la argumentación. Como ha expuesto Hyland (2002), el hecho de que rasgos asociados a ciertos tipos de argumentación no aparezcan en determinados textos no significa que en ese texto la argumentación no sea relevante, menos aun cuando esos rasgos no instrumentan directamente la argumentación sino que son rasgos que estarían presentes en unidades léxico-gramaticales o discursivas que realizan la argumentación5. En síntesis, el estudio de Biber, más allá de sus innegables méritos, presenta las siguientes limitaciones: emplea caracterizaciones funcionales previas que no son sometidas a un análisis discursivo; pretende operar con unidades gramaticales complejas que, no obstante, son identificadas sólo en su polo expresivo; no indaga en recursos específicos que, en determinados géneros, podrían instrumentar ciertas funciones; y propone interpretaciones funcionales globales que no se detienen en el funcionamiento textual. En general, estas restricciones obedecen tanto a la ambición del proyecto de Biber, que se propone un análisis variacionista automático de categorías gramaticales complejas, como a la ausencia en este de un análisis del discurso cualitativo que observe el funcionamiento efectivo de las unidades en el texto-discurso. En términos más amplios, la presente discusión intenta mostrar que una adopción acrítica de la lingüística de corpus de matriz biberiana puede llevar a creer que es posible el análisis puramente empírico del lenguaje a partir del conteo, más o menos sofisticado, de recurrencias de datos presentes en un corpus. En una posición extrema, el analista se limitaría a generar inducciones a partir de un estudio cuantitativo de la realidad del lenguaje, tal y como esta se manifiesta en el corpus, sin la necesidad, incluso, de una teoría del lenguaje. Sin embargo, como se ha esbozado, el análisis automático de corpus presenta una serie de limitaciones. Como señala Weigand (2004), el texto es solo parte del objeto de estudio del lingüista interesado en el funcionamiento real del lenguaje, toda vez que no da cuenta directa del aspecto cognitivo y del contextual implicados en los procesos de producción y comprensión del discurso (van Dijk, 1997). La determinación del funcionamiento efectivo tanto del texto globalmente considerado como de las unidades que lo constituyen requiere normalmente de acceso al contexto extralingüístico y al 5 Una discusión más amplia de esta crítica en Soto (2004).
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 172 conocimiento de mundo, dos dimensiones que los corpora no registran y que, por tanto, no pueden ser directamente investigadas en ellos. Más específicamente, una misma forma puede tener distintos significados o funciones dependiendo de su papel en la actividad comunicativa concreta, lo que restringe, desde el punto de vista lingüístico, el alcance de los análisis puramente cuantitativos que operan sobre expresiones y no sobre signos. Además de lo anterior, las funciones, esto es, los significados o sentidos en los textos, pueden implementarse de manera indirecta a través de procesos complejos que implican no solo el empleo de recursos gramaticales y léxicos sino también la generación de inferencias de distinto tipo y diverso alcance (Tomlin et al, 2000), cuestiones, estas últimas, externas al texto explícito. Las críticas formuladas hasta aquí no apuntan a un rechazo de los proyectos de análisis automático computarizado de categorías léxico-gramaticales, sino, más bien, a una precisión de su alcance y, consecuentemente, de su valor para el análisis del discurso. En este sentido, sugieren una actitud cautelosa con respecto a los análisis de este tipo, en especial cuando, como en el caso de Biber (1988), se proponen interpretaciones funcionales no observadas directamente en los discursos y se consideran categorías gramaticales que, aun en el análisis manual, son difíciles de precisar como ocurre con frecuencia, por ejemplo, con las construcciones pasivas. 1.2. Verbos y sustantivos en el discurso científico Considerando lo anterior, parece haber espacio para estudios que intenten analizar automáticamente la variación de fenómenos gramaticalmente relevantes sin proponer, por otra parte, un nivel interpretativo funcional que trate de caracterizar de modo automático el funcionamiento de dichas unidades en los textos (o, más ampliamente, el funcionamiento discursivo-textual de las unidades léxico-gramaticales), lo que requeriría de una metodología de análisis cualitativo. Una investigación de este tipo debería centrarse, primero, en el examen cuantitativo computarizado de elementos léxico-gramaticales de aceptación general y baja discutibilidad en su determinación, y, segundo, a partir de ello proponer una interpretación mínima que permitiera distinguir de manera sencilla grupos de textos. En otro trabajo, actualmente en preparación, los autores del presente estudio han realizado una exploración en que, siguiendo el modelo de análisis cuantitativo de Biber, se simplifican los rasgos considerados, se aumenta el corpus en un orden de magnitud, y se minimizan las interpretaciones. Por su parte, en el presente trabajo se explora otra alternativa de análisis que, haciéndose cargo también de las críticas ya expuestas, compara, en el mismo corpus, la frecuencia relativa de dos categorías léxico-gramaticales básicas, de aceptación general y altamente relevantes desde el punto de vista lingüístico. A partir de este análisis, el trabajo propone tanto una distinción entre textos académico-científicos y textos no académicos como un ordenamiento de textos científicos de distintas áreas disciplinarias: ciencias aplicadas, ciencias naturales, ciencias sociales y humanidades. Adicionalmente, el trabajo considera la eventual incidencia que el expertizaje del autor puede tener en la proporción relativa de verbos y sustantivos. Las categorías léxico-gramaticales seleccionadas para el análisis son las de verbo y sustantivo, dos nociones fundamentales que, además de su aceptación extendida, son portadoras, normalmente, de los significados extralingüísticos relativos a las entidades y los procesos, por lo que contribuyen sustancialmente al contenido informativo de los textos. Si bien la aseveración de Gutiérrez Rodilla (1998) en el sentido de que el vocabulario es “el
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 173 elemento caracterizador del lenguaje científico” (p. 37) puede discutirse, ella parece especialmente atendible, como lo indica la propia autora, en lo que respecta a sustantivos, verbos y, en menor grado, al parecer, adjetivos. Además de las razones ya aportadas, la decisión de centrar el análisis en estas dos categorías radica, primero, en que ambas, como es de conocimiento general, constituyen las piezas básicas de la organización de cláusulas, oraciones y enunciados gramaticales 6, y, segundo, en que diversos estudios realizados en corpora de distintas lenguas muestran que los textos científicos, y más ampliamente la prosa académica, presentan un fuerte incremento de sustantivos y sintagmas nominales con respecto al común de los textos (cfr. Biber, 1988; Halliday y Martin, 1993; Gutiérrez Rodilla, 1998; Gross y Harmon, 1999; Wolters y Kirsten, 1999; Albentosa y Moya, 2000). El estilo fuertemente nominalizado de los textos científicos ha recibido diversas interpretaciones. Aunque típicamente los estudios se han realizado en inglés, estas también parecen ser, en mayor o menor medida, atendibles para textos escritos en otras lenguas. Según algunos, dicho estilo obedecería a la construcción discursiva de una realidad fija y determinada en que predominarían los objetos (Halliday y Martin, 1993); para otros, respondería a la capacidad entificatoria de los especialistas, que se manifestaría en una elevada presencia de nominalizaciones y sintagmas nominales complejos (Zenteno, 1996). Por su parte, Gutiérrez Rodilla (1998) relaciona este fenómeno con la presencia de tecnicismos, un factor observado, asimismo, por Halliday y Martin. También se ha propuesto que daría cuenta del privilegio que este tipo de discurso otorga a los objetos por sobre los procesos (Gross y Harmon, 1999); o que funcionaría como un recurso de la despersonalización del discurso científico (Albentosa y Moya 2000). Soto y Zenteno (2004) muestran, en todo caso, que, al menos con respecto a los sintagmas nominales, existen variadas funciones que estas estructuras pueden desempeñar en los artículos de investigación científica, las que van desde las referenciales hasta las de organización textual y de estructuración jerárquica de la información en el discurso. En este sentido, es posible que la elevada presencia de sustantivos obedezca a más de una razón simple. Más ampliamente, Heylighen y Dewaele (2002) plantean que los sustantivos comunes son más frecuentes en textos con baja dependencia de contexto (instancias de expresión “formal”7) mientras que los verbos son más frecuentes en estilos fuertemente contextuales. Como recuerda Anderson (1996), la mayor frecuencia de sustantivos comunes respecto de verbos finitos suele indicar mayor longitud de las oraciones, lo que podría, a su vez, connotar una mayor distancia entre los participantes del discurso. Desde esta perspectiva, la razón entre sustantivos y verbos podría indicar cierta posición en el continuo distanciacompromiso. Finalmente, Wolters y Kirsten (1999) proponen que una gran frecuencia de verbos finitos es característica de textos narrativos o de “ficción” y de ciertos textos periodísticos, mientras que textos académicos, legales y políticos presentan baja frecuencia de estos verbos. En su conjunto, los planteamientos anteriores pueden relacionarse ya con el estilo epistémico del discurso académico y científico, como señala MacDonald (2002), ya 6 El concepto de ‘enunciado gramatical’ se entiende, en el presente trabajo, en el sentido propuesto por Daneš (1966). 7 Heylighen y Dewaele (2002) emplean ‘formal’ en el sentido que tiene en frases como ‘lenguaje formal’ o ‘teoría formal’, no en el sentido superficial de ‘propio de una ceremonia o convención’.
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 174 con la dicotomía entre el “modo de pensamiento” narrativo y el paradigmático, propuesto por Bruner (1986), aunque se requiere de mayor investigación para asentar estas relaciones8. Estamos conscientes de que, más allá de los argumentos entregados hasta aquí, puede discutirse aun la existencia de una distinción clara entre la categoría sustantivo y la categoría verbo, problema que, en última instancia, tiene que ver con el estatus de las categorías lingüísticas en general. Contra el enfoque tradicional de categorías discretas, se han desarrollado, en particular desde la década de 1970, posturas que plantean tanto categorías de fronteras difusas como de estructura prototípica, radial o cohesionadas por la semejanza de familia de sus miembros. En este marco, se ha propuesto la existencia de grados de “sustantividad” (“nouniness”) y se han explorado, entre otras, funciones verbales de tipo nominal y nominales de tipo verbal, todo ello con alcances semánticos y de forma. No obstante, ni el reconocimiento de fenómenos de prototipicidad ni la evidencia de un desempeño funcional complejo fuerzan a la adopción de un modelo de categorización que deseche la dicotomía verbo/sustantivo (Lakoff, 1987; Langacker, 1987). Una discusión amplia del estatus de las categorías lingüísticas puede hallarse en los trabajos recogidos por Aarts et al (2004); y con respecto a los conceptos en general, Margolis y Laurence (1999). 1.3. La presente investigación La presente indagación se origina en la idea de que la relación entre sustantivos y verbos no solo permite distinguir los textos académicos y científicos de los que no lo son, sino que, junto con ello, en los propios textos académicos y científicos dicha relación es sensible al área disciplinaria a la que pertenece el texto. Más específicamente, se propone que mientras más se aproxima un texto a las ciencias naturales y a las ciencias aplicadas y la tecnología, más aumenta la proporción de sustantivos respecto de la de verbos. De acuerdo con esta hipótesis, si se estableciera una secuencia de textos que, partiendo de los no científicos, concluyera en los de ciencias naturales y tecnologías, pasando por los de humanidades y de ciencias sociales, esta secuencia sería correlativa con una gradiente en que la proporción de sustantivos respecto de la de verbos iría aumentando. Por otra parte, en cada área disciplinaria los expertos deberían mostrar una mayor proporción de sustantivos que los sujetos que aún no alcanzan expertizaje. La proporción de sustantivos respecto de verbos en un texto determinado se denominará ‘índice de nominalización’. La presente investigación propone que el índice de nominalización es un buen predictor tanto del carácter académico-científico de un texto como de su pertenencia a un área disciplinaria específica. Es importante tener claro que el ‘índice de nominalización’, tal y como aquí se define, no es una medida de la densidad informativa o referencial del texto, toda vez que se limita a comparar sustantivos con verbos sin establecer la proporción de sustantivos o de sintagmas nominales con respecto al total de elementos léxico-gramaticales. Tampoco puede entenderse como un índice de procesos morfológicos de nominalización ni de procesos semánticos de entificación, aunque intuitivamente pareciera haber una relación entre todos ellos. Finalmente, este estudio es agnóstico respecto de las interpretaciones funcionales propuestas en relación con la presencia de sustantivos en los discursos académicos y científicos, tarea para la que sería 8 En Soto (2005) se explora la posibilidad de que las exigencias del modo de pensamiento paradigmático propio del discurso científico expliquen ciertas opciones gramaticales que supondrían una disminución del grado de narratividad en los artículos científicos.
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 175 necesario un análisis cualitativo que observara directamente el funcionamiento de las unidades en el texto/discurso. 2. MÉTODO 2.1. Criterios de elaboración del corpus Los criterios de elaboración del corpus tuvieron por objeto, primero, cubrir un amplio espectro de campos disciplinarios que permitiera vislumbrar las propiedades del discurso académico especializado escrito en el español de Chile; segundo, dar cuenta de las propiedades de textos escritos tanto por sujetos expertos como por aprendices; y tercero, garantizar la calidad de los textos como ejemplares de discurso académico escrito. Con estos fines, se seleccionó un corpus constituido por textos académicos auténticos escritos por investigadores y por estudiantes chilenos en las áreas de ciencias aplicadas, naturales, sociales y humanidades. En el caso de los investigadores, se seleccionaron artículos científicos publicados en revistas especializadas, mientras que en el caso de los estudiantes, se seleccionaron tesis de grado. Para identificar el área disciplinaria específica de los artículos de investigadores, se consideró la publicación en que aparecía el texto (fuente). Así, por ejemplo, los artículos publicados en la Revista Geológica de Chile se agruparon en el área geología-oceanografía. Los textos de estudiantes se organizaron atendiendo al programa de estudios que estos cursaban. Posteriormente, las áreas disciplinarias se ordenaron en cuatro grandes categorías de aceptación general: ciencias aplicadas, ciencias naturales, ciencias sociales y humanidades. Para esta tarea, se consideró el estándar propuesto por el Fondo Nacional de Desarrollo Científico y Tecnológico de Chile, Fondecyt9, el que se adaptó a los objetivos de la presente investigación reduciendo la cantidad de agrupaciones y reordenando algunas fuentes. Así, los textos de música se incluyeron en la categoría humanidades, al igual que los de teología, que no se consideran en el estándar Fondecyt; los de lingüística-filología, por su parte, se trasladaron desde la categoría humanidades a la de ciencias sociales, donde, además, se incluyó la fuente análisis del discurso; por último, en la agrupación ciencias aplicadas se incluyeron fuentes que el estándar Fondecyt subsume en el área de tecnología y ciencias silvoagropecuarias. Como control del análisis, se utilizaron artículos periodísticos y cartas dirigidas a los medios de comunicación. Con la primera variedad de textos, se intentó dar cuenta de una situación de escritura profesional no académica, mientras que con la segunda, de una situación de escritura no profesional y no académica. El cuadro 1 muestra las variedades textuales básicas incluidas en el corpus, ordenadas de acuerdo con el grado de expertizaje de los autores respecto de la tarea de escritura específica (variable “profesional”) y el carácter académico o no académico de los textos. [+ Académicos] [- Académicos] [+ Profesionales] Artículos científicos Artículos periodísticos [- Profesionales] Tesis Cartas a medios de prensa Cuadro 1: Variedades textuales básicas incluidas en el corpus 9 http://www.fondecyt.cl/DOCUMENTOS/DISCIPLINAS%20FONDECYT.xls (15 de marzo de 2003).
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 176 2.2. Elaboración del corpus A partir de los criterios anteriores, se elaboró un corpus de 12,7 millones de palabras, seleccionado del megacorpus de lengua escrita Corpus Dinámico del Castellano de Chile (Codicach), creado por Sadowsky entre los años 2001-2003. La selección del corpus se realizó de manera automática, de forma que no hubo un análisis cualitativo más allá de las categorizaciones expuestas en el apartado anterior. Con esto, se intentó eliminar los potenciales sesgos interpretativos de los investigadores. Al momento del análisis (noviembre de 2003) el megacorpus Codicach estaba compuesto de 830 millones de palabras de texto continuo10 en 1,4 millones de archivos. Los textos extraídos del Codicach fueron sometidos a un proceso de depuración, poda y estandarización que permitió su análisis como texto plano. En los cuadros que siguen, se muestra la distribución de los diferentes grupos de textos completos que constituyen el corpus, ordenados por variedad (académica o no académica), expertizaje de sus autores, área disciplinaria y fuente de los textos (tesis, artículos de investigación, cartas, artículos periodísticos). Además, en cada caso se indica el número de palabras. El Cuadro 2a presenta el corpus de textos académicos escritos por estudiantes; el Cuadro 2b, el de textos académicos de profesionales; el Cuadro 2c, el de textos no académicos de no profesionales; y el Cuadro 2d, el de textos no académicos escritos por profesionales. El corpus total considerado para el análisis estuvo compuesto de 12.683.960 palabras (6.231 archivos). Area Fuente Nº palabras CIENCIAS APLICADAS Agricultura Tesis 20.185 Gestión ambiental Tesis 53.750 CIENCIAS NATURALES Biología-ZoologíaBotánica Tesis 243.716 Medicina Tesis 117.590 Química Tesis 148.003 CIENCIAS SOCIALES Economía Tesis 265.463 Lingüística-Filología Tesis 38.977 Periodismo Tesis 54.147 HUMANIDADES Literatura Tesis 163.969 TOTAL 1.105.800 Cuadro 2a: Corpus: textos académicos, autores no profesionales Area Fuente Nº palabras CIENCIAS APLICADAS Agricultura Agricultura Técnica 469.539 10 Running words.
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 177 Nutrición Revista Chilena de Nutrición 29.139 CIENCIAS NATURALES Biología-Zoología-Botánica Biological Research 74.561 Biología-Zoología-Botánica Gayana Botánica 86.185 Biología-Zoología-Botánica Gayana Concepción 91.768 Biología-Zoología-Botánica Revista Chilena de Historia Natural 374.839 Geología-Oceanografía Investigaciones Marinas 157.300 Geología-Oceanografía Revista Geológica de Chile 160.890 Medicina Archivos de Medicina Veterinaria 428.508 Medicina Boletín Chileno de Parasitología 41.260 Medicina Parasitología al día 70.627 Medicina Revista Chilena de Anatomía 232.646 Medicina Revista Chilena de Enfermedades Respiratorias 55.379 Medicina Revista Chilena de Infectología 169.207 Medicina Revista Chilena de Obstetricia y Ginecología 45.190 Medicina Revista Chilena de Pediatría 611.391 Medicina Revista Médica de Chile 1.231.355 Química Boletín de la Sociedad Chilena de Química 180.997 CIENCIAS SOCIALES Análisis del discurso Misceláneos 32.748 Economía Cuadernos de Economía 71.379 Lingüística-Filología Estudios Filológicos 285.268 Lingüística-Filología Literatura y Lingüística 261.976 Lingüística-Filología Misceláneos 111.440 Sociología-Antropología Chungará 65.561 Sociología-Antropología Misceláneos 114.858 Urbanismo EURE 166.851 HUMANIDADES Historia Historia Santiago 291.132 Historia Revista de Estudios Histórico-Jurídicos 1.011.546 Literatura Acta Literaria 82.356 Música Revista Musical Chilena 678.170 Teología-Filosofía Teología y Vida 668.281 TOTAL 8.352.347 Cuadro 2b: Corpus: textos académicos, autores profesionales Area Fuente Nº palabras Control Cartas a medios de prensa 566.649 TOTAL 566.649 Cuadro 2c: Corpus: textos no académicos, autores no profesionales Area Fuente Nº palabras Control Artículos periodísticos 2.659.164
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 184 las propiedades de esta variedad de discurso, en otras palabras, no construyen un discurso tan centrado en objetos y relaciones de propiedad y causación físicas como el producido por los profesionales13. La no diferenciación en el caso de los textos de profesionales y estudiantes de humanidades podría relacionarse, por su parte, con la mayor proximidad relativa que este campo tiene con el formato narrativo. Con todo, no resulta claro el que, entre los textos de estudiantes, los de ciencias sociales se ubiquen en un lugar más alto del ranking que los de ciencias naturales y aplicadas, toda vez que nuestro marco interpretativo sugiere para los trabajos de los primeros un índice más bajo que el de los segundos. Específicamente, y como ya se indicó en la sección de resultados, el índice de nominalización en las tesis de estudiantes de ciencias sociales es inesperadamente alto. En efecto, estas presentan un índice mayor no solo al de los otros trabajos de estudiantes sino que, incluso, al de los de profesionales de ciencias sociales. Estos últimos, por su parte, son prácticamente iguales a los de los artículos de humanidades, lo que no va en contra de la interpretación sugerida. Si bien en la sección anterior se esbozaron algunas posibles explicaciones de este fenómeno, es claro que este requiere de una indagación específica de corte cualitativo. Más allá de las limitaciones expuestas, pensamos que este trabajo muestra, de modo convincente, que el índice de nominalización es sensible a la oposición entre, por una parte, textos científicos y académicos y, por otra, escritos periodísticos y cartas a medios de comunicación. Asimismo, se relaciona directamente con una escala descendente que, partiendo con los textos de ciencias aplicadas, sigue con los de ciencias naturales, de ciencias sociales y de humanidades, aunque con importantes traslapos entre estos últimos. En cuanto al contraste entre expertos y novatos, el estudio muestra que el índice es sensible solo en el caso de las ciencias aplicadas y naturales. Junto con ello, los resultados son concordantes con el marco interpretativo sugerido en este y en otros trabajos de nuestro equipo. Si bien investigaciones posteriores con corpora aun más diversificados podrían debilitar algunas de las interpretaciones de este trabajo, ampliando, por ejemplo, el alcance del índice de nominalización más allá del dominio académico y científico, la noción misma de índice de nominalización –que, hasta donde nuestro conocimiento alcanza, no había sido propuesta hasta ahora—, parece ser lo suficientemente simple y poderosa como para ser de utilidad en el análisis computarizado de géneros textuales. Además de los estudios ya sugeridos, tanto los resultados como el marco interpretativo de esta investigación permiten proyectar diversas indagaciones. En primer término, la incorporación de nuevas variedades textuales, como las leyes y los documentos burocráticos, permitiría precisar el alcance del índice de nominalización. Por otro lado, la indagación en recursos lingüísticos como los verbos mentales podría aportar más apoyo a la interpretación propuesta, en el sentido de que esta sugiere que dichos verbos deberían correlacionarse de manera inversa con el índice de nominalización. También parece interesante, por último, realizar una indagación más profunda en la relación entre las creencias sobre la actividad científica y la expresión lingüística de los discursos, especialmente en el campo de las ciencias humanas. A partir de lo ya expuesto, puede especularse que textos de autores que siguen programas de investigación vinculados más fuertemente con concepciones de las ciencias naturales, como el conductismo, tendrían un mayor índice de nominalización que trabajos de autores menos asociados con estas concepciones. 13 Subyace a esta interpretación el supuesto de que el formato narrativo tendría un estatus más básico que el paradigmático, idea de aceptación generalizada (cfr. Bocaz y Soto 2000).
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 185 REFERENCIAS BIBLIOGRÁFICAS AARTS, Bas., DENISON, David, KEIZER Evelien y POPOVA, Gergana (eds.), Fuzzy grammar. A reader, Oxford, Oxford University Press, 2004. ALBENTOSA, José Ignacio y MOYA, Arsenio Jesús, “La reducción del grado de transitividad de la oración en el discurso científico en lengua inglesa”, Revista Española de Lingüística, 30 (2), pp. 445-468, 2000. ANDERSON, RICHARD, “‘Look at all those nouns in a row!’ –Authoritarianism and the iconicity of political Russian”, Political Communication, 13, pp. 145-164, 1996. BAJTÍN, Mijail, “The problem of speech genres”, Speech genres and other late essays, Austin, University of Texas Press, 1986 (original: "Problema rechevykh zhanrov", en Estetika slovesnogo tvorchestva, Moscú, Iskusstvo, 1979). BAZERMAN, Charles, Shaping written knowledge. The genre and activity of experimental article in science, Madison, WI, University of Wisconsin Press, 1988. BIBER, Douglas, Variation across speech and writing, Cambridge, Cambridge University Press, 1988. BOCAZ, Aura y SOTO, Guillermo, “Narrar y exponer: el tratamiento del discurso en la reforma educacional”, El Mercurio, suplemento Artes y Letras, 26 de noviembre, pp. 20-21, 2000. BRUNER, Jerome, Actual minds, posible worlds, Cambridge, Mass., Harvard University Press, 1986. CALSAMIGLIA, Helena y TUSON, Amparo, Las cosas del decir. Manual de análisis del discurso, Barcelona, Ariel, 1999. CARRERAS, Xavier y PADRÓ, Luis, “A flexible distributed architecture for natural language analyzers”, Proceedings of the 3rd International Conference on Language Resources and Evaluation, Las Palmas de Gran Canaria, LREC, 2002. CHAFE, Wallace y TANNEN, Deborah, “The relation between written and spoken language”, Annual Review of Anthropology, 16, pp. 383-407, 1987. CIAPUSCIO, Guiomar, Tipos textuales, Buenos Aires, Universidad de Buenos Aires, 1997. DANEŠ, Frantisek, “A three-level approach to syntax”, Travaux linguistiques de Prague, 1, “L’école de Prague d’aujourd’hui”, pp. 225-240, 1966. DE BEAUGRANDE, Robert y DRESSLER, Wolfgang, Introducción a la lingüística del texto, Barcelona, Ariel, 1997. (Traducido de la versión inglesa: Introduction to text linguistics, Londres, Longman, 1981.) DENNETT, Daniel, The intentional stance, Cambridge, Mass., MIT Press, 1987. GROSS, Alan y HARMON, Joseph “What’s right about scientific writing”, The Scientist, 13 (24), p. 20, 1999. GUTIÉRREZ RODILLA, Bertha M., La ciencia empieza en la palabra. Análisis e historia del lenguaje científico, Barcelona, Península, 1998. HALLIDAY, Michael, KIRKWOOD Alexander y MARTIN, James, Writing science: Literacy and discursive power, Londres, Falmer Press, 1993. HYLAND, Ken, Teaching and Researching Writing, Londres, Longman/Pearson, 2002.
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 186 HEYLIGHEN, Francis y DEWAELE, Jean-Marc “Variation in the contextuality of language: An empirical measure”, Foundations of Science, 7, pp. 293-340, 2002. LAKOFF, George, Women, fire, and dangerous things: What categories reveal about the mind, Chicago, University of Chicago, 1987. LANGACKER, Ronald, “Nouns and Verbs”, Language, 63, pp. 53-94, 1987. LUDWIG, Ralph, “L’oralité des langues créoles – agrégation et integration”. En Les créoles français entre l’oral et l’écrit, Tübingen, Gunter Narr Verlag, 1989. MACDONALD, Susan Peck, “Prose styles, genres, and levels of analysis”, Style, 36 (4), pp. 618-639, 2002. MARGOLIS, Eric y LAURENCE, Stephen (eds.), Concepts: Core readings, Cambridge, Mass., MIT Press, 1999. MILLER, Carolyn, “Genre as social action”, Quarterly Journal of Speech, 70, pp. 151-167, 1984. PARODI, Giovanni, “Lingüística de corpus y análisis multidimensional: exploración de la variación en el corpus PUCV-2003”. En G. Parodi (ed.), Discurso especializado e instituciones formadoras, Valparaíso, Ediciones Universitarias de Valparaíso, 2005. SARDINHA, Tony Berber, “Análise multidimensional”, Delta, 16 (1), pp. 99-127, 2000. SOTO, Guillermo, “Una propuesta de caracterización del artículo científico”, ponencia presentada en el III Encuentro Nacional de Análisis del Discurso, Valdivia, Universidad Austral de Chile, 28 de septiembre a 1 de diciembre, 2004. SOTO, Guillermo, “Construcciones de agente degradado en la sección método de los artículos científicos”. En A. M. Harvey (comp.), En torno al discurso: estudios y perspectivas, Santiago, Ediciones de la Universidad Católica de Chile, 2005a. SOTO, GUILLERMO, “Los géneros discursivos como tecnologías cognitivas”, RASAL, Revista de la Sociedad Argentina de Lingüística, 1, pp. 37-51, 2005b. SOTO, Guillermo, Scott SADOWSKY y Ricardo MARTÍNEZ, “Análisis factorial de rasgos gramáticales en artículos de investigación en ciencias naturales, aplicadas y humanas en escritos en español”, en preparación. SOTO, Guillermo y Carlos ZENTENO, “Los sintagmas nominales en textos científicos escritos en español”, Estudios de Lingüística (Universidad de Alicante), nº 18, pp. 275-292, 2004. SWALES, James, Genre análisis: English in academic and research settings, Cambridge, Cambridge University Press, 1990. TANNEN, Deborah, “The myth of orality and literacy”, en W. Frawley (ed.), Linguistics and literacy, Nueva York – Londres, Plenum Press, 1982a. TANNEN, DEBORAH, “Oral and written strategies in spoken and written narratives”, Language, 58 (1), pp. 1-21, 1982b. TOMLIN, Russell S., FORREST, Linda Ming MING PU y Myung HEE KIM, “Semántica del discurso”. En T. van Dijk (comp.), El discurso como estructura y proceso, Barcelona, Gedisa, 2000. (original: “Discourse semantics”, en T. Van Dijk (comp.), Discourse as structure and process, Londres, Sage, 1997.)
Verbos y sustantivos en textos científicos. Análisis de variación en un corpus… 187 VAN DIJK, Teun, “El estudio del discurso”, en T. van Dijk (comp.), El discurso como estructura y proceso, Barcelona, Gedisa, 2000. (original: “The study of discourse”, en T. Van Dijk (comp.), Discourse as structure and process, Londres, Sage, 1997.) WEIGAND, EDDA, “Possibilities and Limitations of Corpus Linguistics”. En K. Aijmer (ed.), Understanding and Misunderstanding in Dialogue. Selected papers from the 8th international conference on Dialogue Analysis, Tübingen, Niemeyer (Beiträge zur Dialogforschung), 2004. WOLTERS, Maria y Mathias KIRSTEN, “Exploring the use of linguistic features in domain and genre classification”, Proceedings of the Meeting of the European Chapter of the Association forComputational Linguistics, Bergen, Noruega, 1999. ZENTENO, Carlos, “La tendencia entificatoria en el discurso del especialista”, en M. Rodríguez y M. A. Farías (eds.) Investigación multidisciplinaria. Estrategias integradas de investigación en lingüística, literatura y disciplinas afines, Santiago, Universidad de Santiago de Chile, 1997.