Extracción automática de nexos léxicos
Abstract
Programa de doctorado: Simulación numérica en Ciencias y Tecnología
Full text
PROGRAMA DE DOCTORADO SIMULACIÓN NUMÉRICA EN CIENCIAS Y TECNOLOGÍA TESIS DOCTORAL EXTRACCIÓN AUTOMÁTICA DE NEXOS LÉXICOS AUTORA: ISABEL SÁNCHEZ BERRIEL LAS PALMAS DE GRAN CANARIA, MAYO DE 2015
PROGRAMA DE DOCTORADO SIMULACIÓN NUMÉRICA EN CIENCIAS Y TECNOLOGÍA DEPARTAMENTO DE MATEMÁTICAS TESIS DOCTORAL EXTRACCIÓN AUTOMÁTICA DE NEXOS LÉXICOS AUTORA: ISABEL SÁNCHEZ BERRIEL DIRECTOR: CO-DIRECTOR: DR. OCTAVIO SANTANA SUÁREZ DR. JOSÉ RAFAEL PÉREZ AGUIAR LAS PALMAS DE GRAN CANARIA, MAYO DE 2015
Agradecimientos Este trabajo de tesis supone el punto de arribo gracias a los esfuerzos realizados por un numeroso grupo de personas que han persistido en apoyar la trayectoria seguida desde que emprendí mis primeros pasos con las colocaciones hasta que comencé a “vislumbrar la luz al final del túnel”. A todos ellos quiero agradecer su aportación, cada uno en su especialidad y vocación universitaria. En primer lugar quiero referirme, al Dr. Octavio Santana Suárez, director de esta tesis, quien no sólo abrió la puerta de su ciencia e interés por el tema, sino que la ha mantenido de par en par sin ambages, alimentando la obstinación, el tesón y la ilusión de las que me he armado para recorrer este camino; quisiera agradecerle el esfuerzo, todo el tiempo dedicado, el conocimiento compartido y los recursos facilitados sin los que no hubiese podido llevar a buen puerto este proyecto. Al Dr. José Pérez Aguiar le agradezco sinceramente todo el apoyo como co-director, y cada una de sus orientaciones que han contribuido a la consecución de este trabajo. Reservo un lugar para mis compañeros de la Universidad de La Laguna: Luzma, Jesús y Macu, que alguna que otra vez les ha tocado sustituirme en mis estancias en Las Palmas. Inestimable ha sido la ayuda de José Luis Roda, que siempre que lo he necesitado ha aportado la tecnología que tantas palabras parecían devorar. A Félix García, mi maestro, mil gracias por además ayudar en todo lo que estaba en su mano para que yo pudiera desempeñar esta tarea. Un recuerdo especial para mis amigos Bea y Robert, que con sus risas y todo lo demás siempre han estado ahí. Por último a todas esas personas que, como en el cuento del zapatero y los duendes, silenciosamente han propiciado cada uno de los pasos dados. Mis padres, mis hijas, Cristo, Vicky, Rafa, Sayo, mi familia, todos ellos mis duendes.
Resumen En el presente trabajo se presentan análisis y soluciones al problema de la extracción automática de colocaciones léxicas. Con independencia de la lengua de que se trate, a partir de la propuesta de Sinclair estudia las frecuencias de aparición en corpus textuales, las técnicas resuelven el problema desde el punto de vista estadístico: una combinación de palabras se considera colocación si su aparición conjunta queda motivada en lugar de provenir del puro azar. Aunque este enfoque sea demasiado simplista para el lingüista, aporta la herramienta básica para resolver el problema desde la perspectiva computacional. Bajo la premisa de implementar una solución que requiera el menor número posible de recursos léxicos, se conjuga el conocimiento lingüístico con un planteamiento estadístico. Las conclusiones y aportaciones que se derivan dan respuesta a la extracción de colocaciones de un corpus textual sea cual sea su volumen. Se maneja un corpus textual de 11 000 textos literarios y no literarios con un número aproximado de 300 000 000 palabras de la lengua española. A partir de esta amplia muestra del español, se procede a la extracción de colocaciones mediante técnicas basadas en las frecuencias de palabras; se analizan los resultados que se obtienen y se contrastan con las combinaciones del Diccionario Combinatorio del Español Contemporáneo, Redes (DCECR). Se dan soluciones a la inestabilidad que producen las marcadas diferencias entre las frecuencias de uso de las distintas palabras en el corpus, que se ve acentuada por el uso de un corpus con tan amplio volumen. Por una parte, se diseña una metodología de análisis centrada en la palabra, y por otra se proponen nuevos indicadores, basados en las técnicas de detección de outliers, que tratan de captar las características de uso preferentes de las uniones presentes en este tipo de combinaciones. Las propuestas se orientan de modo que sean válidas en corpus menos extensos: se utiliza como corpus reducido las novelas de D. Benito Pérez Galdós. Se resuelve también el problema de extracción automática de nexos semánticos motivados por la selección de argumentos por parte de los predicados; se enfoca el estudio hacia la determinación de clases semánticas entre los elementos que combinan con una determinada palabra, se lleva a cabo un repaso de las técnicas que permiten extraer tales grupos de forma automática. En este caso, se opta por adaptar el indicador asociación de selección (Resnik, 1 997), que mide el vínculo entre un grupo de argumentos y su predicado, utilizando para evaluarlos diccionarios ideológicos del español como clasificaciones de palabras presentes en el corpus. Las pruebas se realizaron con el Diccionario Ideológico Vox (DIV); en concreto, el trabajo se centra en los casos: verbo + grupos de sustantivos, adjetivo + grupos de sustantivos y adverbio + grupos de verbos.
Por último, se aporta una aplicación software que permite consultar las propiedades combinatorias de una palabra de la lengua española a través de Internet, así como la extracción automática de las colocaciones en textos en español de forma amigable para el usuario.
Índice 1. INTRODUCCIÓN ................................................................................................................... 1 1.1. INTRODUCCIÓN ................................................................................................................ 1 1.2. ENFOQUE ESTADÍSTICO. ................................................................................................... 2 1.3. ENFOQUE LÉXICO-SEMÁNTICO. ......................................................................................... 4 1.4. LAS COLOCACIONES EN ESPAÑOL. .................................................................................... 6 1.5. CARACTERÍSTICAS. .......................................................................................................... 8 1.5.1. Flexibilidad ............................................................................................................. 8 1.5.2. Determinación. .................................................................................................... 10 1.5.3. Frecuencia, Preferencia. ..................................................................................... 13 1.5.4. Composicionalidad. ............................................................................................. 14 1.5.5. Gradualidad. ........................................................................................................ 15 1.6. CLASIFICACIÓN. ............................................................................................................. 16 1.6.1. Categoría gramatical de los colocados. .............................................................. 16 1.6.2. Grado de restricción de los colocados. ............................................................... 22 1.6.3. Semántica. ........................................................................................................... 23 1.7. CARACTERÍSTICAS POR CATEGORÍAS. ............................................................................. 26 1.7.1. Sustantivo + Verbo. ............................................................................................. 26 1.7.2. Verbo deslexicalizado + sustantivoCD .................................................................. 28 1.7.3. Verbo deslexicalizado + (sustantivoCD) + preposición + sustantivo. ................... 31 1.7.4. Selección de una acepción especial en el verbo. ............................................... 32 1.7.5. Colocaciones léxicas. .......................................................................................... 33 1.7.6. Sustantivosujeto + verbo. ....................................................................................... 34 1.7.7. Sutantivo1 + de + Sustantivo2. ............................................................................. 35 1.7.8. Sustantivo + Adjetivo. .......................................................................................... 35 1.7.9. Verbo + Adverbio. ................................................................................................ 39 1.7.10. Adverbio + Adjetivo. ............................................................................................ 40 1.7.11. Verbo + Adjetivo. ................................................................................................. 40 1.7.12. Verbo + como + sustantivo. ................................................................................. 41 1.8. LAS COLOCACIONES EN LOS DICCIONARIOS. .................................................................... 41 1.8.1. Colocaciones en el DEA. ..................................................................................... 41 1.8.2. Colocaciones en el DUE. .................................................................................... 44 1.8.3. Diccionario VOX .................................................................................................. 44 1.9. ELEMENTOS AJENOS A LAS COLOCACIONES. .................................................................... 45 2. EXTRACCIÓN AUTOMÁTICA DE COLOCACIONES UTILIZANDO CRITERIOS ESTADÍSTICOS. ......................................................................................................................... 47 2.1. MEDIDAS DE ASOCIACIÓN ............................................................................................... 47 2.1.1. Frecuencia Relativa ............................................................................................. 48
4 medida drástica Frecuencia medida 250 drástica 8 coocurrencia 4 drástica con medida %50100 8 4 medida con drástica %6'1100 250 4 Tabla 1-1. Ejemplo del cálculo de la frecuencia de coocurrencia. A lo que Koike llama frecuencia de aparición de A con B, no tiene por qué presentar el mismo valor que la frecuencia de aparición de B con A; en realidad, es un indicador del porcentaje de veces que una palabra aparece con otra respecto al número total de veces que aparece. Si este valor es elevado, quiere decir que si aparece A es muy posible que también aparezca B. Para Koike es suficiente indicio de colocación que el valor sea superior al 20%. Las medidas del z-score e información mutua constituyen valores más complejos y precisos utilizados para la extracción de colocaciones en Lingüística de Corpus. Este tema será tratado en profundidad en el capítulo 2, donde se analizarán estos y otros indicadores que permiten detectar colocaciones de forma automática en textos electrónicos. 1.3. Enfoque léxico-semántico. Trabajos posteriores en la materia Benson, Haussman, Mitchell, Coseriu, Cruse, Haensch o Mel’čuk tratan las colocaciones como un fenómeno más complejo que la mera combinación usual de palabras. Apuestan porque las colocaciones ponen de manifiesto relaciones sintagmáticas o semánticas entre palabras. Mitchell considera que tales vínculos se producen entre lexemas (Koike, 2 001). Benson distingue entre 1) colocaciones gramaticales que se componen de una palabra dominante seguida de una preposición o estructura sintáctica consistir en y 2) colocaciones léxicas que se forman exclusivamente con nombres, adjetivos, verbos y adverbios entre sus aportaciones a la teoría colocacional figura la primera clasificación establecida en la materia (Carballo, 1 998), (Alonso, 1 997) y (Koike, 2 001). Coseriu define las solidaridades léxicas que coinciden parcialmente con el concepto de colocación. Una solidaridad léxica es una relación orientada en la que existe un lexema determinante y un lexema determinado en el sentido de que el determinado implica al determinante, pero no a la inversa. Por ejemplo, caballo alazán es una solidaridad léxica, porque alazán implica a caballo, pero no el recíproco. Una solidaridad léxica unilateral es del
5 tipo morder dientes, lamer lengua no suelen coocurrir. Sin embargo, caballo alazán, ladrar perro... que pertenecen al conjunto de las solidaridades léxicas multilaterales sí son colocaciones. Por otra parte, radicalmente opuesto es una colocación pero no es una solidaridad, puesto que no hay ninguna implicación en los lexemas que la forman, por ello no se puede afirmar que las colocaciones coincidan plenamente con las solidaridades léxicas, sino que algunas colocaciones coinciden con las solidaridades léxicas multilaterales (Corpas 1 996, Koike 2 001). De especial importancia es la aportación de Haussman: llevó a cabo una taxonomía de las colocaciones y construyó una teoría sobre el estatus semántico de los elementos que intervienen en las colocaciones definió base y colocativo. Para referirse a los dos lexemas que coocurren en una colocación, los lingüistas que tratan del tema en la actualidad usan el par de términos. Cada uno juega un papel distinto en la colocación, la base selecciona una acepción especial en el colocativo, que no puede ser descodificado sin la presencia de la base. Este rol diferenciado de los elementos que conforman la colocación se ilustra en la Tabla 1-2 Colocación base colocativo Acepción del colocativo seleccionada levantar veda veda levantar 19. tr. Hacer que cesen ciertas penas, prohibiciones o vejámenes impuestos por autoridad competente. Levantar el entredicho, el destierro, el arresto, el embargo café fuerte café fuerte 9. adj. Dicho de un color o de un sabor: intenso. lógica aplastante lógica aplastante 2. adj. Abrumador, terminante, definitivo. Tabla 1-2 Semántica de los elementos de la colocación Mel’čuk desarrolla sus trabajos desde la perspectiva de las funciones léxicas definidas para representar las posibilidades combinatorias de un determinado lexema que expresan un cierto sentido. Al igual que una función matemática, una función léxica asocia un conjunto de valores al elemento al que se aplica o elemento llave y que se corresponde con la base de Hausmann el valor que toma la función es el colocativo o un conjunto de ellos. El vínculo establecido entre los elementos que forman una colocación determina la función que se debe escoger; se permiten utilizar funciones compuestas como combinación de varias funciones léxicas para expresar relaciones más complejas. Algunas funciones léxicas con los sentidos que expresan se recogen en la Tabla 1-3.
6 Función Sentido Ejemplo Son Emitir sonido típico Son(gato) = maullar Magn Muy, Intenso Magn(enemigo) = acérrimo Mult Conjunto de Mult(oveja) = rebaño Facti Realizarse, Llevarse a cabo Fact0(sospecha)=confirmarse, corroborarse Bon Bueno Bon(clima) = benigno Ver Tal como debe ser Ver(cuchillo) = afilado Sign Porción de Sign(pan) = tostada Funci(C) Verbo semánticamente vacío que toma C como sujeto gramatical e i como su primer complemento Funci(viento) = soplar Operi(C) Verbo semánticamente vacío que toma C como sujeto gramatical e i como su primer complemento Operi(atención) = prestar Incep Comenzar IncepFunc0(epidemia)=declararse Tabla 1-3. Ejemplos de funciones léxicas. Las funciones léxicas constituyen una herramienta útil a la hora de representar las relaciones comunes que conectan distintos lexemas presentes en las colocaciones; sin embargo, entre las críticas que reciben se mencionan aquí las siguientes: 1. Pueden producir combinaciones que no lo son, como en el caso de: Sing(biblioteca) = libro. 2. Existen colocaciones que no pueden ser descritas con las funciones léxicas, como en el caso de discusión bizantina (Koike, 2 001). 1.4. Las colocaciones en español. Los estudios sobre colocaciones en español se producen a partir de la década de los 90, si bien a finales de los 70 Seco introduce el concepto de contorno de la definición lexicográfica que hace referencia al término colocación (Corpas, 1 996), (Penadés, 2 001) y (Castillo, 1 998). Corpas las considera un tipo de unidades fraseológicas3. Bosque las supone una manifestación de selección léxica4, en las que los colocativos que actúan como predicados seleccionan sus argumentos, no de forma individual, sino grupal 3 Una unidad fraseológica es una construcción formada por al menos dos palabras ortográficas puede ser una oración compuesta con las siguientes características potenciales: uso habitual, presenta cierta fijación, idiomaticidad su significado no es composicional, presenta variantes. Todos estos aspectos no aparecen en la misma medida en los distintos tipos de unidad fraseológica: colocaciones, locuciones, y enunciados fraseológicos (paremias y fórmulas rutinarias), sino que se dan en distinto grado (Corpas, 1 996). 4Las colocaciones constituyen una manifestación de selección léxica. Los predicados verbales, adjetivales, adverbiales o preposicionales seleccionan sus argumentos, y al hacerlo restringen el
7 del mismo, o de varios campos semánticos que conforman lo que se denomina clase léxica. De esta manera, lo realmente importante radica en detectar la clase que selecciona un determinado colocativo; entre los ejemplos que presenta en su trabajo aparecen: supino {ignorancia, incompetencia, inutilidad, necedad, desconocimiento, estupidez, ridiculez, imbecilidad, irresponsabilidad, egoísmo, cinismo}. terminantemente {prohibir, negar, desmentir, excluir, rechazar, oponerse} En algunos casos establece la relación entre el colocativo y algún rasgo definitorio de la clase, como en el caso: “universalmente + verbos que denotan aceptación” Zuluaga se refiere a las colocaciones como un tipo de combinación de al menos dos lexemas, en las que puede aparecer algún elemento gramatical y de las que no se puede decir que sean combinaciones libres, ni tampoco unidades fraseológicas, pero que comparten propiedades de unas y otras. Por último citamos a Alonso que estudia las colocaciones en el marco de la teoría Sentido-Texto de Mel’čuk. Si bien se aprecian distintas interpretaciones del fenómeno colocacional entre los lingüistas españoles, aparece como un denominador común de sus trabajos el que descartan la interpretación exclusivamente estadística de las colocaciones por presentar los siguientes problemas: 1. No todas las combinaciones frecuentes cuentan como colocaciones. 2. Puede que no se considere colocación aquella que forman unas palabras de baja frecuencia. 3. El uso exclusivo de la frecuencia no puede manifestar fenómenos semánticos presentes en las mismas. conjunto de entidades que pueden denotar en función de unos rasgos semánticos a veces muy abiertos y en otras considerablemente restringidos. Frente a lo que parece sugerir una buena parte de la bibliografía, en muchísimos casos las unidades seleccionadas por los predicados no son piezas léxicas aisladas, sino clases léxicas de mayor o menor intensión. (Bosque, 2 001).
8 1.5. Características. En los siguientes epígrafes se ahonda en los rasgos específicos que resultan fundamentales a la hora de discriminar si una combinación de lexemas constituye o no una colocación. En general, existe una serie de características propias de las colocaciones, algunas de ellas diferenciadoras de otros tipos de combinaciones y otras que comparten al menos en parte debido a la transición gradual combinación librecolocaciónlocución (Zuluaga, 2 002), (Blasco, 2 002), (Penadés, 2 001) y (Corpas, 1 996) he aquí una de las causas por las que es difícil decidir si una determinada construcción es o no una colocación. Cabe destacar las discrepancias entre autores a la hora de catalogar como colocaciones determinadas construcciones; por ejemplo, pueden ser controvertidos los siguientes casos (Bosque, 2 001): ejecutar un castigo empantanarse un proyecto enfilar la calle principal disminución progresiva... Penadés advierte que el Diccionario fraseológico del español moderno (Varela, Kubarth, 1 994) existen numerosas colocaciones incluidas como locuciones; entre otras: dar corte dar el cambiazo dar el espectáculo dar el golpe. 1.5.1. Flexibilidad En contraposición con las estructuras por lo general fijas de las locuciones (Koike, 2 001), la primera propiedad que se trata en este apartado se refiere a la flexibilidad formal de las colocaciones. Admiten5: 1. Cambios de categoría gramatical: comida frugal / comer frugalmente 2. Modificación adjetival: En las colocaciones es lícito incluir un adjetivo que modifique al sustantivo, la colocación: hacer un aterrizaje también se puede usar: hacer un aterrizaje forzoso 5 Todos los ejemplos se obtuvieron de (Koike, 2 001).
9 sin embargo, esto no es válido en las locuciones, por ejemplo, la locución: quemarse las pestañas no admite ser utilizada en la forma: quemarse las pestañas largas 3. Transformación a pasiva. Podemos transformar a pasiva una colocación sustantivo + verbo: trasplantar órganos en pasiva: el órgano fue transplantado lo que no es posible en el caso de las locuciones: escurrir el bulto no se utiliza : el bulto fue escurrido 4. Relativización: seguir la línea / Este libro marca la línea que deben seguir sus partidarios. echar el ojo (a algo) / El ojo que acabo de echar a ese vestido. 5. Nominalización: Es posible en las colocaciones como se observa en el ejemplo: trasplantar un órgano / el trasplante de órganos pero no en las locuciones: escurrir el bulto no se usa: el bulto que fue escurrido 6. Pronominalización: Asumió el cargo de alcalde, pero su repentina enfermedad le impidió desempeñarlo (desempeñar cargo)
10 De aquí que se afirme que la combinación realmente se da entre los lexemas6 y no entre las lexías simples. Tal aseveración explica las colocaciones que se forman con una unidad léxica simple y una locución, como: dar un golpe de Estado. Por tanto, la exploración de un texto para la extracción de colocaciones no puede llevarse a cabo sobre palabras gráficas. Por otra parte, los elementos que intervienen pueden sustituirse en general por otros relacionados, bien porque: 1. Pertenecen al mismo campo semántico: desempeñar {un cargo, una función o un papel} (Corpas, 1 996) 2. Son sinónimos: {mantener, sostener} una conversación armar {alboroto, algarabía, barullo} 3. Son hiperónimos, hipónimos: cariarse {un diente, la dentadura} escamar {pescado, besugo} En virtud de esta característica se pueden describir propiedades combinatorias mediante definiciones del tipo: “dar combina con sustantivos de golpe”, o bien ”dar selecciona sustantivo de golpe” que expresamos en forma de reglas: “dar + sustantivos de golpe” “universalmente + verbos que denotan aceptación” 1.5.2. Determinación. Los elementos que forman una colocación reciben el nombre de colocados, uno de ellos goza de autonomía semántica y recibe el nombre de base, el significado del otro depende precisamente de ésta, está determinado por ella y se denomina colocativo. Como se mencionó con anterioridad, esta nomenclatura fue introducida por Hausmann en la terminología colocacional y en la actualidad su uso se ha generalizado entre todos los estudiosos del tema consultados. Respecto a las características señaladas de los dos colocados, se dice que la base es una palabra autosemántica no necesita del colocativo para ser definida y el colocativo es sinsemántica 6 .lexema. 1. m. Ling. Unidad mínima con significado léxico que no presenta morfemas gramaticales, por ejemplo, sol; o que, poseyéndolos, prescinde de ellos por un proceso de segmentación; por ejemplo, terr en enterráis. (DRAE).
11 su definición necesita ser completada por la base. Esta característica es fundamental en las siguientes definiciones de colocación que aportan Alonso (1 994) y García Platero (2 002): Una colocación o “semi-frasema” (FL) AB es una combinación de dos lexemas A y B, de tal forma que su significante es la suma regular de los significantes de los lexemas constituyentes y su significado incluye el significado del lexema A y un significado C que es: a) Bien C <> B y i. C es vacío: el lexema B es un auxiliar que se usa para sostener una configuración sintáctica dar un paseo... ii. C no es vacío, pero el lexema B expresa C solo en combinación con A o con otros pocos lexemas similares odio mortal interés vivo... b) Bien C = B y El lexema B se selecciona de modo restringido: en combinación con A no se puede reemplazar por otro sinónimo café fuerte... c) C incluye el sentido de A pelo rubio nariz aguileña... Todos los casos posibles se pueden explicar mediante alguna de las posibilidades: 1. La base selecciona una acepción especial en el colocativo; generalmente se usa en sentido figurado y se reconoce su significado gracias a la base con la que aparece. Los tres primeros casos en la definición de Alonso se ajustan a este tipo. Es el caso de colocaciones como: banco de peces precio astronómico levantar sesión locamente enamorado dar envidia... Se han subrayado los colocativos. Se incluyen las definiciones que proporciona el DRAE para la acepción en que se utilizan tales términos:
12 banco. 5. m. Conjunto de peces que van juntos en gran número. astronómico. 2. adj. coloq. Que se considera desmesuradamente grande. Sumas, distancias astronómicas. sesión. levantar la ~. 1. Concluirla. locamente fr. 2. adv. m. Excesivamente, sin prudencia ni moderación dar. 23. tr. Causar, ocasionar, mover. Dar gusto, gana. Se advierte en estas definiciones que los significados de banco, astronómico, levantar, locamente y dar están determinados por cada uno de los otros colocados; si no estuvieran presentes, no se sabría con qué acepción se utiliza el colocativo respectivo tal comportamiento refleja la precisión semántica que sustenta la colocación. 2. No se puede definir el colocativo sin la base, pero en este caso lo que existe es una relación típica entre los dos elementos colocados. Los colocativos son términos que especifican propiedades, acciones o procesos específicos de las bases; por eso se dice que existe un vínculo típico entre ambos. Valen como ejemplos: triángulo isósceles querochar abeja pelo lacio zarpar barco trinchar carne... Así, isósceles es un tipo de triángulo y no existe ambigüedad respecto a este término. En tales ocasiones, por estar la base contenida en el colocativo, se consideran las colocaciones como casos de solidaridades léxicas. isósceles. v. triángulo isósceles querochar. 1. intr. Dicho de las abejas y de otros insectos: Poner la querocha. Uno de los significados de lacio en el DRAE manifiesta que es una propiedad específica del pelo. lacio, cia. 3. Dicho del cabello: Que cae sin formar ondas ni rizos. Además de existir una relación típica entre los colocados, se observa que el significado de lacio queda determinado por la base.
13 El caso de zarpar barco es similar al anterior, puesto que la segunda acepción de este verbo requiere para su definición la presencia de la base de la colocación, y ésta a su vez selecciona una de las acepciones posibles, pero no en un sentido figurado. zarpar. 2. intr. Dicho de un barco o de un conjunto de ellos: Salir del lugar en que estaban fondeados o atracados. Lo mismo sucede con el último ejemplo: trinchar. 1. Partir en trozos la comida para servirla. Si los dos elementos que configuran una determinada combinación son vocablos autosemánticos estamos ante una combinación libre, en cambio, si una unidad es autosemántica y la otra sinsemántica se está ante una colocación. Los elementos que forman una locución son palabras extrasemánticas, porque el significado de la misma no proviene de los significados de sus constituyentes. (García Platero, 2 002). 1.5.3. Frecuencia, Preferencia. Las colocaciones son combinaciones usuales de palabras que los hablantes nativos de una lengua repiten tan habitualmente en situaciones comunicativas similares que las han convertido en estereotipos. Aunque teóricamente se podría escoger como colocación cualquier combinación posible, en muchas ocasiones ¿no son usuales o de uso preferente; así que no todas las posibilidades de elección más o menos amplia de los colocativos deberían considerarse como colocaciones, sino las que han sido sancionadas por la comunidad. Así, fervorosamente y fervientemente se combinan de forma preferente, o casi exclusivamente con rezar (u orar), aunque los diccionarios suelen dar como sinónimos vivamente, ardientemente, o vehementemente. De este modo, fervientemente y fervorosamente se especializan en su empleo con rezar, en detrimento de otros adverbios de manera (GarcíaPage, 2 001). En lanzarse al ataque, lanzarse ha sido preferido a arrojarse, y ataque ha sido preferido a lucha. (Zuluaga, 2 002). En guerra mundial, mundial ha sido preferido a internacional (Zuluaga, 2 002). Tal perspectiva supone un problema a la hora de buscar generalizaciones sobre las propiedades combinatorias de algún lexema dado. A pesar de que la elevada frecuencia de uso de una combinación respecto a otras posibles no sea un criterio determinante para asegurar que forme una colocación, constituye una
20 Tabla 1-8. Clasificación de Penadés. y propone considerar las que reproducen una estructura comparativa, que para Koike es una colocación compleja del tipo: verbo + locución adverbial La propuesta de Koike recoge las anteriores pero detalla algunos subgrupos; también abarca las colocaciones complejas no contempladas en otras tipologías, al menos específicamente. Como novedad, en esta clasificación se considera un único tipo sustantivo + verbo pero que se subdivide en: sustantivo sujeto + verbo, verbo + sustantivoCD y en: verbo + preposición + sustantivo. Subtipo Base Ejemplos verbo + SN verbo + nombre sustantivo correr un rumor estallar una guerra zarpar un barco verbo + determinante + nombre desempeñar un cargo dar comienzo verbo + SP verbo+preposición + determinante+ nombre sustantivo poner en cuestión verbo + adverbio verbo caer pesadamente negar rotundamente fracasar estrepitosamente verbo + adjetivo adjetivo resultar ileso salir malparado Estructura comparativa dormir como un lirón dar vueltas como un trompo
21 Tipo Subtipo Base Ejemplos Simples sustantivo+verbo sustantivosujeto+ verbo sustantivo correr un rumor estallar una guerra zarpar un barco verbo + sustantivoCD desempeñar un cargo dar comienzo verbo+preposición+ sustantivo poner en cuestión adjetivo+ sustantivo sustantivo fuente fidedigna enemigo acérrimo oído fino sustantivo+de+ sustantivo sustantivo tableta de chocolate enjambre de abejas verbo + adverbio verbo caer pesadamente negar rotundamente adverbio+ adjetivo / participio adjetivo firmemente convencido rematadamente loco verbo + adjetivo adjetivo resultar ileso salir malparado Complejas verbo+locución nominal dar un golpe de estado levantar castillos en el aire locución verbal+SN poner en juego un recurso pasar a limpio un borrador sustantivo+ locución adjetival dinero contante y sonante verbo+locución adverbial reírse a mandíbula batiente llorar a moco tendido adjetivo+locución adverbial bruto como un arado sano como una manzana Tabla 1-9. Clasificación de Koike
22 1.6.2. Grado de restricción de los colocados. Según el grado de restricción Cowie diferencia entre colocaciones libres, restringidas, estables y categoría puente (Corpas, 1 998). El grado de restricción va aumentando gradualmente en el orden citado. El significado en las colocaciones libres es totalmente composicional y pueden aparecer en numerosas colocaciones. En las colocaciones restringidas se está ante una acepción especial del colocativo que selecciona la base. El campo colocacional en las estables es mínimo, se limita a uno o dos colocados. Por último, el uso figurado del colocativo y el que quepa la sustitución sinonímica señalan las características de la categoría puente7 (Tabla 1-10). Libres provocar una pelea / guerra / discusión empezar una pelea / guerra / discusión ganar una pelea / guerra / discusión Restringidas correr peligro / suerte / aventuras Estables conciliar el sueño Categoría Puente levantar una calumnia / una mentira 8 Tabla 1-10. Clasificación de Cowie según el grado de restricción. En la misma línea, Koike establece dos categorías: colocaciones amplias y colocaciones estrechas como aparecen en la Tabla 1-11. En las primeras, el colocativo tiene la capacidad de combinarse con numerosas bases debido a que su significado es general y polisémico en la mayoría de las ocasiones. En las segundas, el vínculo entre los dos lexemas es fuerte, las bases obligatoriamente tendrán que ser compatibles con el significado específico del colocativo9. Las colocaciones amplias abarcan las categorías libres y restringidas de Cowie y las estrechas recogen la estable y la categoría puente. Colocaciones estrechas Colocaciones amplias escrutar votos recontar {votos, reses, presos} extirpar quiste quitar {quiste, muela} asestar puñetazo dar {puñetazo, consejo, paseo} Tabla 1-11. Colocaciones amplias y estrechas de Koike. Una distinción similar propone García Platero al hablar de colocaciones libres y restringidas. En las primeras existe una gran cantidad de elementos que pueden combinarse con la base, mientras que en las restringidas como: 7 Ejemplos recogidos del Manual de Fraseología 8 Levantar una calumnia es una colocación, al contrario que levantar una mentira que no lo es. 9 Ejemplos recogidos de (Koike, 2001).
23 fruncir el ceño el colocativo es difícilmente sustituible. 1.6.3. Semántica. El significado de la colocación también lleva a Koike a proponer dos categorías diferenciadas dentro de los tipos: sustantivo + verbo y sustantivo + adjetivo que son: las funcionales y las léxicas. Colocaciones funcionales: el colocativo pierde su significado y pasa a tener un valor funcional. En el caso de las sustantivo + verbo de la Tabla 1-12, el verbo habilita al sustantivo para funcionar como un verbo complejo, aporta la información de número, persona y tiempo, mientras que el sustantivo aporta el significado. En general, existe un verbo simple relacionado morfológicamente con el sustantivo, aunque no siempre. Funcional verbo+ sustantivo Verbo relacionado tener miedo temer hacer una aclaración aclarar dar un golpe golpear albergar esperanza esperar Tabla 1-12. Colocaciones funcionales: verbo + sustantivo. En las sustantivo+adjetivo, el adjetivo intensifica cuantitativa o cualitativamente al sustantivo como se muestra en la Tabla 1-13. Funcionales sustantivo+adjetivo error garrafal cuantitativa módico precio cuantitativa dolor atroz cuantitativa comida atroz cualitativa tiempo horroroso cualitativa chico fenomenal cualitativa Tabla 1-13. Colocaciones funcionales: adjetivo + sustantivo.
24 Colocaciones léxicas: Los elementos que conforman la colocación conservan su significado léxico plenamente, de tal forma que en tal caso se está ante colocaciones totalmente composicionales, como aparecen en la Tabla 1-14. Verbo + sustantivo Sustantivo + adjetivo moler café pelo lacio cruzarse de brazos poder adquisitivo zarpar barco barrio céntrico amasar fortuna cuchillo afilado afrontar riesgo gobierno autoritario Tabla 1-14. Colocaciones léxicas. En las colocaciones sustantivo + verbo hay que incluir las aspectuales; se llaman así porque su significado indica alguno de los siguientes aspectos: incoativo (comienzo), durativo-reiterativo (duración), o terminativo-resultativo (final). A diferencia de las funcionales, el verbo tiene en tal caso una cierta carga semántica; por ejemplo, en asaltar duda asaltar indica acometer de pronto algo, en este caso una duda. Aspecto Colocación Incoativo asaltar duda durativo-reiterativo sostener conversación terminativo-resultativo cerrar sesión Tabla 1-15. Colocaciones aspectuales. Sobre la base de estos grupos, y recurriendo a la definición de Alonso se consideran los siguientes casos: Colocativo con valor plenamente funcional. Se está ante un verbo deslexicalizado10 y un sustantivo generalmente deverbal, o bien ante un adjetivo que juega un papel meramente intensificador en alguno de los siguientes sentidos de: muy grande, magnífico, extraordinario, etc. Se puede considerar dentro de este grupo el caso ‘a). i’ de la definición de Alonso. dar un golpe golpear DRAE: golpear. Dar un golpe o golpes repetidos. 10 Un verbo deslexicalizado contribuye mínimamente al significado de la colocación, su función principal es aportar el tiempo y número a la construcción que conjuntamente funciona como un verbo cuyo significado proviene del significado del sustantivo.
25 tener miedo temer DRAE: temer. Tener a una persona o cosa por objeto de temor. tener esperanzas esperar DRAE. esperar. Tener esperanza de conseguir lo que se desea. hacer una aclaración aclarar DRAE. aclarar. 10. Hacer clara, perceptible, manifiesta o inteligible alguna cosa, ponerla en claro, explicarla. soberana paliza DEA. soberano –na. 2. Superior o extraordinario. Frec con intención ponderativa. dolor atroz DEA. atroz. 2. Muy grande o extraordinario. inteligencia colosal DEA. colosal. 2. Magnífico o extraordinario. Vínculo típico. El colocativo expresa alguna propiedad, acción, o proceso característico de la base. Es el caso que aparece en el punto ‘c)’ de la definición de Alonso. zarpar barco DEA. zarpar. 1. Salir [un barco] del lugar en que estaba fondeado o atracado. libar abeja DEA. libar. 1. Chupar [un insecto el néctar, u otra sustancia azucarada, de las flores]. enhebrar aguja DEA. enehebrar. 1. Pasar la hebra por el ojo [de la aguja (cd)]. dilapidar fortuna DEA. dilapidar Derrochar o despilfarrar. iglesia católica DEA. católico. 1. b) De los católicos o de la Iglesia católica. pelo lacio DEA. lacio. 3. [Cabello] que cae liso y blando. Selección de acepción en el colocativo. Abarca los casos ‘a).ii’ y ‘b)’ de la definición de Alonso. albergar esperanza DEA. albergar. 4. Tener de manera estable [un sentimiento]. administrar anestesia
26 DEA. administrar. 4. Dar o aplicar [algo, esp. medicamentos]. asaltar la duda DEA. asaltar. 3. (col) Acometer repentinamente [a alguien una idea o un sentimiento]. perder el tren DEA. perder. 7. No llegar a tiempo de poder utilizar [un medio de transporte (cd)]. tocar el piano DEA. tocar. 6. b) Hacer sonar [un instrumento musical o un dispositivo de señales acústicas]. amasar una fortuna DEA. amasar. 3. Acumular o reunir [bienes o dinero]. calar melón DEA. calar. 2. Cortar un pedazo [de un melón o de otra fruta (cd)] para probarlos. color crudo DEA crudo. 8. [Color].blanco o amarillento. alimentación equilibrada DEA. equilibrada. 2. Que tiene equilibrio [4, 5 y 6]. equilibrio. 5. Justa proporción de los elementos [de algo]. cuestión vital DEA. vital. 2. b) De suma importancia. 1.7. Características por categorías. En los apartados siguientes se exponen las características propias de los distintos tipos de colocaciones que se recopilaron de la bibliografía analizada. Los epígrafes se corresponden con cada una de las categorías según la función gramatical de los colocados, si bien en cada uno se alude a las categorías establecidas según la semántica, en caso de ser necesario. 1.7.1. Sustantivo + Verbo. La información sobre las colocaciones sustantivo + verbo es más numerosa que las restantes, debido a que son las más abundantes y también las más estudiadas del español.
27 Los verbos que forman parte de colocaciones se denominan colocacionales, los que no, se llaman no colocacionales; figuran en la Tabla 1-16 (Koike, 2 001). Los colocacionales11, a su vez se dividen en: Funcionales: No mantienen su significado léxico. Por ejemplo, hacer o sacar en: hacer una aclaración sacar la conclusión... Léxicos: Mantienen su significado léxico. Por ejemplo afinar el piano... Según con qué se combine un mismo verbo puede tener valor funcional o léxico. Por otra parte, tanto unos como otros pueden ser generales o específicos. Generales: Los verbos generales tienen un número elevado de acepciones y forman numerosas colocaciones. El campo colocacional es amplio. Específicos: Forman colocaciones estrechas que reflejan relaciones típicas entre el verbo y el sustantivo. Colocacionales Funcionales Generales dar, tener, hacer, sentir, poner, echar Específicos 12 abrigar, albergar, fraguar, brindar, tejer, tramar, etc. Léxicos Generales tocar, gastar Específicos tañer, dilapidar No colocacionales querer, pensar, indicar, afirmar, preguntar, verbos de decir, asegurar, advertir, vender, comprar, agradecer, obligar, invitar, gustar, parecer, interesar, considerar, creer, hallar, poder, saber, querer, intentar, etc. Tabla 1-16. Clasificación de los verbos. En cuanto a los sustantivos, cabe la división entre concretos y abstractos de la Tabla 1-17 (Koike, 2 001), ya que los primeros son los que intervienen en las colocaciones léxicas y los segundos los que seleccionan los sentidos figurados de los verbos. 11 Koike, 2 001 12 Koike incluye aquí blandir, pero si es blandir espada, arma, etc. es léxico.
28 Concretos instrumentos musicales guitarra, piano, cuerdas Colocaciones léxicas utensilios plancha, mordaza, tornillo medios de transporte tren, barco, guagua partes del cuerpo humano corazón, pelo, barba prendas de vestir sombrero, gafas, descosido alimentos café, pan, plato animales balidos, paloma, ganado otros Abstractos de acción discusión, vigilancia, pago Colocaciones funcionales. Selección de acepción especial en el colocativo. de situación o estado de cosas crisis, norma, reputación de cualidad paciencia, habilidad, sensibilidad de evento boda, aniversario, congreso de sentimiento o sensación cariño, abatimiento, desesperación otros rumor, proyecto, indicio Tabla 1-17. Clasificación de los sustantivos. 1.7.2. Verbo deslexicalizado + sustantivoCD Compuesta por verbos funcionales generales, donde el sustantivo generalmente es deverbal: “dar + sustantivo de golpe”: dar golpe dar bofetón dar empujón dar puñetazo dar tropezón... “dar + sustantivo terminado en –azo excepto los aumentativos y algunas palabras primitivas como cazo o cedazo”: dar bocinazo dar cambiazo dar frenazo... “dar + sustantivo de voz o sonido”: dar berrido...
29 dar: dar albergue dar alcance dar aprobación dar asentimiento dar asilo dar cobijo... dar un: dar un abrazo dar un aviso dar un barrido... darse un(a): darse un atracón (de) darse un batacazo darse una ducha... darse: darse autobombo darse maquillaje darse postín... “tener + sustantivo referido a cualidad; generalmente terminado en el sufijo –“dad”: tener piedad tener curiosidad tener habilidad tener conocimiento tener costumbre... “tener + sustantivo referido a sentimiento”: tener amor tener cariño tener angustia tener pasión... “tener + sustantivo referido a estado físico”: tener jaqueca tener sueño tener tos tener fatiga tener apetito...
36 Relacionales Nacionalidad, religión, instituciones, clase social, étc. francés, republicano, carnívoro, musical, etc. Cualitativos Cualidades físicas Tamaño, altura, anchura, volumen, color, temperatura, peso, velocidad, tiempo, gusto, tacto, vista, olfato, oído, sonido, etc. alto, bajo, largo, corto, ancho, estrecho, gordo, delgado, rojo, blanco, caliente, frío, pesado, ligero, rápido, veloz, joven, viejo, efímero, insípido, amargo, claro, oscuro, fragante, ruidosos, silenciososo. Cualidades no físicas espirituales, vicios y virtudes, estado anímico, afecto, etc. audaz, temeroso, orgulloso, perezoso, contento, aburrido, alegre, enemigo, indiferente Situacionales cuasi determinativos, siguiente, próximo, pasado, referido adverbiales modales posible, probable, presunto, marcadores de la intensión único, propio, principal circustanciales antiguo, próximo, actual aspectuales frecuente, constante Tabla 1-18. Clasificación de los adjetivos calificativos, (Koike, 2 001). El colocativo en este caso es el adjetivo y al igual que en la construcción sustantivo + verbo o bien adquiere un valor funcional (adjetivos funcionales) o su significado léxico (adjetivos léxicos). Los adjetivos funcionales intensifican cuantitativa o cualitativamente el sustantivo; cuentan con dos posibilidades: que el sentido literal del adjetivo sea intensificador (adjetivos funcionales), o bien que el adjetivo se convierta en intensificador cuando se usa en sentido figurado (adjetivos funcionalizados). Un mismo adjetivo puede actuar como léxico o como funcional según el sustantivo con el que se combina. En la Tabla 1-19 se recogen ejemplos de ambos tipos de adjetivos colocacionales.
37 Funcional Recto Dimensión física grande profundo pena grande profundo dolor Cantidad mucho bastante poco Intensidad intenso fuerte débil genio fuerte carácter débil Figurado mortal terrible atroz susto mortal prisa terrible actuación atroz Léxico Recto afilado elocuente, mortal cuchillo afilado orador elocuente veneno mortal Tabla 1-19. Clasificación de los adjetivos colocacionales, (Koike, 2 001). Las combinaciones sustantivo abstracto + adjetivo funcional como pena grande son colocaciones, el adjetivo se usa con valor intensificador; sin embargo, sustantivo concreto + adjetivo funcional como casa grande no pasa de ser una combinación libre. Las colocaciones funcionales en las que interviene un adjetivo funcional son amplias, mientras que en las que se usa un adjetivo léxico en sentido figurado son estrechas. En los ejemplos siguientes se presentan las definiciones de algunos adjetivos funcionalizados; como se aprecia, alguno de los significados son: muy grande, extraordinario, muy bueno, etc. en general se está ante una intensificación positiva superlativa.
38 horroroso –sa DRAE: Que causa horror. 2. fam. Muy feo. DEA 2. (col) Muy grande o extraordinario. atroz DRAE: 2. Enorme, grave. 3. fam. Muy grande o desmesurado. DEA: 2. Muy grande o extraordinario. fenomenal DRAE: 3. Fam. Tremendo, muy grande. 4. fig. Estupendo, admirable. DEA: 1. Muy bueno o extraordinario. 2. Muy grande o tremendo. 3. Muy bien. Al contrario de lo que sucedía en las colocaciones sustantivo + verbo en este caso sí que se pueden tener sustantivos referidos a persona como en: tonto redomado lector empedernido soldado bisoño... En la definición de los adjetivos suele hacerse referencia a las bases con las que puede combinarse; en general, tales bases que no son únicas, sino que el vínculo se puede establecer con un conjunto de sustantivos pertenecientes al mismo campo semántico: fino se puede combinar con sustantivos que denotan sentidos, como oído, vista u olfato. (Corpas, 1 996). Por último se señala que existe un tipo de construcción: sustantivo + sustantivo que autores como Corpas o Castillo incluyen dentro de esta categoría, porque uno de los sustantivos actúa en realidad con función de adjetivo dentro de la misma, como en: hombre clave viaje relámpago... sin embargo, para Koike es un tipo de compuesto.
39 1.7.9. Verbo + Adverbio. El adverbio es el colocativo en estas combinaciones, en la mayoría de los casos es de modo terminado en mente funciona como un intensificador de la acción denotada por el verbo como se ve en los siguientes ejemplos: llover torrencialmente desear ardientemente... Algunas excepciones a esta característica son: hablar claro pisar firme... La mayoría de las colocaciones de este grupo presentan una variante en la forma: sustantivo + adjetivo de manera que el sustantivo de éstas es deverbal y se corresponde con el verbo de aquéllas y el adverbio–terminado en mente derivado del adjetivo como se aprecia en los ejemplos de la Tabla 1-20. sustantivo + adjetivo verbo +adverbio lluvia torrencial comida opípara cierre hermético llover torrencialmente comer opíparamente cerrar herméticamente Tabla 1-20. Algunas colocaciones sustantivo + adjetivo y la correspondiente verbo + adverbio Sin embargo, las colocaciones sustantivo + adjetivo que se citan a continuación no tienen correspondencia con las verbo + adverbio: diferencia abismal cuestión capital sueldo ridículo error garrafal fe ciega… ni tampoco: diametralmente opuesto clínicamente muerto guardar celosamente… presentan la versión sustantivo + adjetivo. Por último incluimos en este apartado el caso: verbo + gerundio con valor adverbial como:
40 salir zumbando salir pitando. 1.7.10. Adverbio + Adjetivo. En este caso también el adverbio es el colocativo y actúa como intensificador, pero de un adjetivo en muchas ocasiones es un participio con valor adjetival, como en: locamente enamorado firmemente convencido profundamente dormido materialmente imposible... aunque hay casos en que la base es un verdadero adjetivo como en: locamente enamorado mundialmente famoso... Nótese que en el caso adverbio + participio suele existir la correspondiente versión: verbo del que proviene el participio + adverbio o bien: sustantivo deverbal + adjetivo como se observa en la Tabla 1-21. Se pone de manifiesto la flexibilidad formal en las colocaciones, en las que se puede dar el cambio de categoría gramatical de los colocados. sustantivo + adjetivo verbo + adverbio adverbio + adjetivo relación estrecha relacionado estrechamente dormir profundamente profundamente dormido afectar visiblemente visiblemente afectado Tabla 1-21. Correspondencia entre las colocaciones adverbio + adjetivo y otras estructuras sintácticas 1.7.11. Verbo + Adjetivo. Son muy pocas las colocaciones en este grupo, incluso hay autores que no contemplan tal caso en sus clasificaciones; ejemplos de ellas son: {salir, resultar} ileso (de) {salir, quedar} incólume (de)
41 {resultar, salir} redondo (el negocio) andar {ajetreado, liado} caer simpático, dejar frío... 1.7.12. Verbo + como + sustantivo. Este tipo de colocaciones las introdujo Penadés en la tipología colocacional;.reproducen una estructura comparativa: dar vueltas como un trompo dormir como un tronco... 1.8. Las colocaciones en los diccionarios. En español se dispone del DICE (Diccionario de Colocaciones del Español) de Alonso en el que se describen las restricciones combinatorias de un lexema mediante las funciones léxicas de Mel’čuk y los diccionarios Redes y Práctico de Bosque en el que se recogen las clases léxicas cuyos miembros coaparecen con un colocativo dado. Hay que mencionar también el Diccionario Fraseológico del Español Moderno (Varela, Kubarth, 1 994), pero que solo recoge locuciones, complejos fraseológicos con casillas vacías y expresiones. Las dos primeras son locuciones, mientras que las expresiones coinciden con las fórmulas rutinarias de la clasificación de Corpas. En definitiva, tampoco recoge las colocaciones. Además de los diccionarios específicos de colocaciones se puede explotar la información presente en los diccionarios tradicionales, especialmente en los de uso Diccionario de Uso del Español (DUE, María Moliner) y el DEA (Diccionario del Español Actual, Seco) sobre las restricciones combinatorias de las palabras. 1.8.1. Colocaciones en el DEA. En las definiciones de este diccionario se especifica el contorno14 de la misma, delimitado por corchetes y formado, en muchas ocasiones, por una lista de unidades léxicas que forman colocación con la unidad léxica que se define. panorámico -ca I adj 1 De(l) panorama. | FQuintana-Velarde Política 59: Tales son los rasgos básicos y generales .. Es preciso ahora obtener, además de la visión panorámica general que ya poseemos, algunos detalles concretos. b) [Imagen] que representa una vasta extensión de terreno. Tb n f. | * Es una fotografía panorámica del pueblo. c) [Autocar o vagón] que permite ver 14 La definición está constituida por dos clases de elementos, el contenido abarca el significado en sí y el contorno recoge el contexto.
42 cómodamente el paisaje en todas direcciones. | J. Oyarzun Abc 15.10.70, 11: Estas viejecitas de trajes floreados y sombreros de paja que a veces vemos circular por Madrid en grandes autobuses panorámicos .. esconden bajo su aparente fragilidad una gran entereza. d) (Cine) [Pantalla] de superficie cóncava y más ancha que la normal, destinada a películas en cinemascope y similares. | * Este cine tiene pantalla panorámica. paranormal adj (Psicol) [Cosa, esp. fenómeno] que no tiene explicación científica. | Ya 13.2.75, 43: La autora estudia el tema agrupándolo así: creencias fantásticas y supersticiones; los muertos; .. facultades y fenómenos paranormales. sentir1 (conjug 60) A tr 1 Experimentar [una sensación o sensaciones]. Tb abs. | Arce Testamento 20: Comenzaba a sentir sed. Gambra Filosofía 135: Hay algunos que defienden el conocimiento en los vegetales, aduciendo a su favor ciertos hechos que parecen probar que los vegetales sienten. b) Experimentar [un estado afectivo o de ánimo]. | CNavarro Perros 92: Pensó en lo que sería la vida íntima de un ser como Fidel y sintió una lástima inmensa por su mujer. c) Ser afectado [por algo (cd)]. | Ama casa 1 972 91: Los rododendros. Es un árbol hermoso .. Se cultiva en tierra de brezo y siente mucho el frío. A la vista de los ejemplos se observa que en algunos casos se dan rasgos generales para especificar el contorno como “una sensación o sensaciones” en la acepción 1 de sentir, “estado afectivo o de ánimo”, en el b). En el caso de paranormal se tiene un elemento general como “cosa” y uno específico como “fenómeno” y en panorámico solo se dan elementos específicos en el contorno como “imagen” en b), “autocar o vagón” en c) y “pantalla” en d). Obsérvese que en todos estos casos se puede decir que se está ante colocaciones formadas por el lexema de la entrada y los elementos del contorno; aunque esto no sucede siempre, sí son numerosas las oportunidades en las que se da. Nótese que en algunos casos se obtiene una restricción combinatoria entre la entrada y una clase léxica: “sentir + sustantivo de estado afectivo o de ánimo”15 mientras que en los restantes aparecen colocaciones específicas: imagen panorámica autocar panorámico vagón panorámico pantalla panorámica fenómeno paranormal 15 Koike también resalta esta característica para indicar las posibilidades de combinación del verbo sentir: “el verbo sentir puede combinarse con sustantivos que expresan ‘estado anímico o físico’ y ‘sentimiento’”.
43 Si bien “cosa paranormal” no es una colocación, en el ejemplo aparece facultad paranormal que sí lo es. En general, cuando el lexema que se está definiendo es el colocativo, las bases de las colocaciones se recogen en el contorno, aunque en el caso de que el colocativo sea un adjetivo también se pueden encontrar en las explicaciones en cursiva que utilizan expresiones del tipo: “Dicho normalmente de, Referido esp. a, etc.”. Por otra parte, si en el contorno se habla de rasgos generales que definen una clase léxica, no quiere decir que todos los elementos que presenten ese rasgo formen colocación, puede haber excepciones. Además, como se aprecia en el apartado b) de panorámico solo hay un elemento en el contorno: “imagen”; sin embargo, fotografía panorámica también es colocación, si bien fotografía es un vocablo que se refiere a un tipo de imagen. En definitiva, a pesar de que en algunos casos si se consideran estrictamente los contornos, se puede incurrir en un exceso o defecto de producción de las bases que combinan con un colocativo, no supone un obstáculo para afirmar que la información contenida en el contorno es muy valiosa a la hora de caracterizar las restricciones combinatorias de los colocativos. En algunos casos, también se dispone de los verbos con los que se combina un determinado sustantivo, como ejemplifica la Tabla 1-22; en muchos casos, el marcador frec con el v en la definición de algunos sustantivos en el DEA se corresponde con colocaciones. Sustantivo Frec con el v gustirrinín dar leñazo dar golpe dar golletazo dar Tabla 1-22. Ejemplos del DEA.
44 1.8.2. Colocaciones en el DUE. En las bases es donde se presentan las posibilidades combinatorias de los lexemas en forma de enlaces frecuentes. Para los sustantivos se dan: los adjetivos y verbos; para los verbos, los adverbios y las preposiciones con que se construyen. En el caso de los adjetivos, las colocaciones o las solidaridades léxicas pueden aparecer señaladas por “se aplica a”, “aplicado a”, “dícese de” o “se dice (de)”. También se introducen en los ejemplos que aparecen en letras simples y entrecomilladas, en el apartado de palabras afines o bien en el de frases y modismos, en cursiva y al final del artículo (Corpas, 1 992). 1.8.3. Diccionario VOX Este diccionario se puede considerar como paradigma de la precisión semántica que aportan las colocaciones a la lengua, abundando su uso en las definiciones de los lemas que recoge. Algunos ejemplos en los que se manifiesta este fenómeno animar: Infundir ánimo y energía ilusionar: Despertar esperanzas, gralte. atractivas truncar: Quitar [a uno] las ilusiones o esperanzas confiar: Dar confianza o esperanza [a uno] desahuciar: Quitar [a uno] las esperanzas de conseguir lo que desea hechizar: Cautivar el ánimo, embelesar Del mismo modo que en el DEA, se observan colocaciones en los sustantivos marcados como contornos de los verbos: arriar: Bajar [una vela o bandera que estaba izada] enarbolar: Levantar en alto [estandarte, bandera, etc.] largar: Desplegar [la bandera, las velas, etc.] vibrar: Agitar en el aire [la pica, la lanza, etc.]; arrojar con ímpetu y violencia [una cosa que vibre] suspender: especialmente, figurado. Privar temporalmente [a uno del sueldo o empleo] que tenía levantar: Vigorizar [el ánimo, la moral, etc.]; engrandecer, ensalzar; impulsar hacia cosas altas [el pensamiento, el corazón, etc.] Aparecen colocaciones funcionales cuando se definen verbos relacionados con un sustantivo:
45 desesperanzar: Quitar la esperanza [a uno] esperanzar: Dar esperanza [a uno] esperanzar: Tener esperanza apasionar: Causar, excitar alguna pasión [a uno] apasionar: Llenarse de pasión respetar: Tener respeto En cuanto a los adjetivos, las colocaciones se observan en el contorno: acéfalo: [sociedad, secta, etc.] Que no tiene jefe. acéfalo: [feto] Sin cabeza o sin parte considerable de ella. abisal: [zona del mar profundo] [zona del mar profundo] Que se extiende más allá del talud continental, y corresponde a profundidades mayores de 2000 m frío: por extensión. [color] Que produce efectos sedantes como el azul, el verde, etc. imberbe: [joven] Que no tiene barba. interactivo: [programa] Que permite una interacción, a modo de diálogo, entre el ordenador y el usuario. recurrente: [fenómeno] Que vuelve a su punto de partida. visceral: [impresión, sentimiento, etc.] Intenso, profundo y arraigado: odio visceral. 1.9. Elementos ajenos a las colocaciones. Por la utilidad que puede suponer a la hora de implementar un reconocedor automático de colocaciones, se incluye una recopilación de elementos que se deben descartar por no formar parte de las mismas. El verbo ser no puede formar colocaciones sustantivo + verbo. Los adjetivos demostrativos, indefinidos y relativos. Verbos auxiliares. Los verbos derivados de sustantivos que son bases de colocaciones funcionales: dar un consejo / aconsejar.
52 Tipo novela 2053 teatro 1265 relato 2248 cuentos 632 otros 596 Total 7758 Tabla 2-2 Distribución de las obras literarias En definitiva, una amplia muestra del español con un número total de palabras que está en torno a los 300 000 000, cuya distribución se resalta en el Gráfico 2-1 y Gráfico 2-2 Gráfico 2-1 Distribución de las obras no literarias del corpus 0,0 2,0 4,0 6,0 8,0 10,0 arte; 0,2% biografías; 0,7% ciencias; 0,3% cine; 1,9% cristianismo; 0,4% derecho; 4,3% economía; 0,3% educación; 0,3% esoterismo; 0,2% etnología; 0,2% filosofía; 1,4% geografía; 0,7% historia; 2,2% lingüística; 0,2% literatura; 9,0% política; 2,9% psicología; 0,6% religión; 0,9% teatro; 0,5% otros; 7,4%
53 Gráfico 2-2 Distribución de las obras literarias del corpus 2.2.1.1. Tratamiento del corpus El primer proceso llevado a cabo en esta investigación lo constituye la obtención de todas las combinaciones que se toman en consideración así como su frecuencia de aparición en el corpus. Los cálculos se realizan a partir de las llamadas líneas de concordancia extraídas de éste. Una línea de concordancia es un determinado fragmento de una longitud fija, en términos de cantidad de palabras que abarca, en el que aparece una palabra dada en un texto o corpus textual. La aparición conjunta de una determinada combinación en el ámbito de la línea de concordancia se considera una manifestación del uso conjunto de la misma o muestra de la combinación. En la Figura 2-1 se exponen líneas de concordancias obtenidas en el corpus de referencia del español actual (CREA) cuando se consulta sobre la palabra arrojar. 0,0 5,0 10,0 15,0 20,0 poesía; 8,1% novela; 17,3% teatro; 10,7% relato; 18,9% cuentos; 5,3% otros; 5,0% puesto muy cuesta arriba para su equipo, pero sin arrojar la toalla, porque "restan 90 minutos y no se cuatro años. Pero al nuevo presidente le será difícil arrojar de sí la mala conciencia de tenerse de presta el exilio no significa que el volcán deje de arrojar incertidumbre. Florentino Pérez vuelve a la carga, reclamando la profesionales y características psicológicas de cada persona, así como arrojar un listado de arrojar un listado de los quince Figura 2-1 Líneas de concordancia de la palabra arrojar en el CREA
54 Se salva en parte la falta de cualquier tipo de información lingüística en los textos gracias a las pautas marcadas por algunas características fundamentales de las colocaciones léxicas en español que se expusieron en el capítulo 1 y que se enumeran a continuación: a) Debido a la flexibilidad formal de las colocaciones se recuentan combinaciones de formas canónicas en lugar de combinaciones de palabras gráficas. Según esto se consideran muestras de la combinación progreso-civilización: el progreso de las civilizaciones, la civilización progresó o los progresos de una civilización, o bien de reprobar-condena: reprobaron la condena, reprobó la condena, las condenas fueron reprobadas o de guerra-civil: guerra civil, las guerras civiles, la guerra entre civiles. Para ello se ha utilizado el “Flexionador y Lematizador de palabras del español” del Grupo de Estructura de Datos y Lingüística Computacional de la Universidad de Las Palmas de Gran Canaria (Santana et al, 2 007, 1 999, 1 997). b) Se considera un catálogo de palabras vacías como artículos, preposiciones, conjunciones, interjecciones, determinantes numerales, determinantes ordinales, adjetivos demostrativos, indefinidos y el relativo cuanto, los verbos ser, estar y haber, etc. descartándose del proceso todas las que se incluyeron en él. (Koike, 2 001). c) Se consideran exclusivamente las estructuras colocacionales (Koike, 2 001) que se pueden encontrar en el español, desde la perspectiva del Lematizador se pueden agrupar en los casos: sustantivo + verbo sustantivo + adjetivo sustantivo + de + sustantivo verbo + adverbio verbo + adjetivo adverbio + adjetivo por lo que en el recuento se contabilizan solo aquellas combinaciones que se corresponden con alguno de estos patrones en orden indistinto. El programa simula la obtención de líneas de concordancias para cada una de las formas canónicas en el corpus, generando un diccionario de formas canónicas y otro de combinaciones de formas canónicas a partir de ellas. Cada línea de concordancia está dentro del ámbito de una frase y se toma un ancho de ventana 10. Es decir, se recopilan los valores de las frecuencias conjuntas para distancias entre palabras que van desde 1 hasta 10, tanto a la izquierda como a la derecha. Se obtienen las combinaciones de formas canónicas que se corresponden con alguna de las estructuras de las colocaciones en español y su frecuencia en el corpus. Si el tamaño de frase es menor que la amplitud fijada para la concordancia, no se complementa con palabras en la
55 siguiente frase. Cada elemento en la línea de concordancia actual que no sea una palabra vacía se procesa con el lematizador que proporciona la correspondiente información morfológica. Para una mayor eficiencia en el procesamiento, cada palabra en el corpus solo se lee una vez; se almacena temporalmente la información morfológica que se genera gracias a una estructura de cinta circular, con tamaño igual a la distancia colocacional. En cada iteración se determina el elemento de dicha cola donde se deben registrar las formas canónicas con las que tiene correspondencia la palabra actual, en los restantes estarán almacenadas las formas canónicas que se obtuvieron cuando fueron procesadas las palabras previas en el corpus. Cuando se lee la palabra siguiente, pasará a ser palabra actual. Las palabras previas permanecen en la cinta siempre que se esté en el ámbito de la línea de concordancia. Para lograr esto, en cada iteración antes de insertar la información de la palabra actual extraída del corpus, se agregan al diccionario las combinaciones compuestas por las formas canónicas en el registro de la cinta que se va a actualizar y las formas canónicas en todos los restantes elementos en ella, siempre que correspondan a alguna de las estructuras colocacionales del español. En cada caso se actualizará la frecuencia si fue registrado previamente o creando la nueva entrada en caso contrario. Por último, es necesario especificar que si la palabra actual es vacía, no se lematiza y se deja la posición correspondiente en la cola vacía. De esta forma se logra obtener las parejas de formas canónicas con palabras previas y con palabras posteriores en la línea de concordancia. A continuación se ilustra el procesamiento realizado al corpus sobre un fragmento de Odisea 2001, de Arthur C. Clarke, novela que forma parte del corpus, en concreto, el primer párrafo: La sequía había durado ya diez millones de años, y el reinado de los terribles saurios tiempo a que había terminado. Aquí en el ecuador, en el continente que había de ser conocido un día como África, la batalla por la existencia había alcanzado un nuevo clímax de ferocidad, no avistándose aún al victorioso. En este terreno baldío y disecado solo podía medrar, o aun esperar sobrevivir, lo pequeño, lo raudo o lo feroz. (Odisea 2001, Arthur C. Clarke). La tabla se utiliza para representar la cola circular en la que se irá insertando temporalmente la información morfológica de cada palabra que se va leyendo en el fichero. Se muestra dicha estructura después de haber leído las 5 primeras palabras, las casillas sin información se corresponden a palabras vacías (Figura 2-2).
56 Figura 2-2 Inicialización de la cinta para la extracción de combinaciones En la siguiente iteración la ventana se desplaza hacia la palabra diez, que será la siguiente que se lea en el corpus. La palabra actual es diez y se inserta en la cinta, no es necesario agregar información a los diccionarios de combinaciones, porque en la posición en la cola circular no hay elementos que correspondan previamente a una palabra vacía. Por el contrario, el diccionario de formas canónicas procesadas será actualizado con la información que produce la lematización de diez (Figura 2-3). Figura 2-3 Actualización de la cinta para la extracción de combinaciones. A continuación, se inserta la información morfológica relativa a millones; debe actualizarse las combinaciones de formas canónicas, es decir, la forma canónica sequía / sustantivo y sus combinaciones factibles con todas las formas canónicas en la cinta en ese instante: sequía + durado, sequía + durar, sequía + diez, sequía + diez la sequía sequía había durado - adj durar - v durado ya diezsust diezadj diez sequía sequía había durado - adj durar - v durado ya La sequía había durado ya diez millones de años, y el reinado de los terribles saurios tiempo a que había terminado. Aquí en el ecuador, en el continente que había de ser conocido un día como Africa, la batalla por la existencia había alcanzado un nuevo clímax de ferocidad, no avistándose aún al victorioso. En este terreno baldío y disecado soo podía medrar, o aun esperar sobrevivir, lo pequeño, lo raudo o lo feroz. La sequía había durado ya diez millones de años, y el reinado de los terribles saurios tiempo a que había terminado. Aquí en el ecuador, en el continente que había de ser conocido un día como Africa, la batalla por la existencia había alcanzado un nuevo clímax de ferocidad, no avistándose aún al victorioso. En este terreno baldío y disecado solo podía medrar, o aun esperar sobrevivir, lo pequeño, lo raudo o lo feroz.
57 Una vez actualizado el diccionario de combinaciones, se elimina sequía de la cinta y se agrega en su lugar millones, quedando con la configuración en la Figura 2-4. Figura 2-4 Actualización de una posición no vacía de la cinta de combinaciones. Para mantener ambos diccionarios, el de formas canónicas y el de combinaciones de éstas se utiliza tablas hash cuyo tipo base permite registrar tanto el elemento como la frecuencia de aparición del mismo. De esta forma la ejecución permite generar la información de formas canónicas correspondientes a palabras no vacías y sus frecuencias en el corpus. El lematizador del GEDLC permite identificar las formas canónicas cuya flexión o derivación produce la palabra por la que se consulta. Sin sumar la ampliación inherente a los prefijos y a los pronombres enclíticos, el universo está compuesto por alrededor de cuatro millones y medio de formas flexionadas y derivadas obtenidas a partir de las más de ciento veinticuatro mil formas canónicas con que opera el sistema. En los verbos, trata la conjugación simple y compuesta, los pronombres enclíticos, la flexión del participio como adjetivo verbal (género, número, grado superlativo y adverbialización) y el diminutivo del gerundio. Con las formas no verbales, considera: género y número en los sustantivos, adjetivos, pronombres y artículos; heteronimia por cambio de sexo en los sustantivos; grado superlativo en los adjetivos y adverbios; adverbialización y adverbialización del superlativo en los adjetivos; derivación apreciativa en los sustantivos, adjetivos y adverbios; variantes gráficas en todas las categorías gramaticales; formas invariantes tales como preposiciones, conjunciones, exclamaciones, palabras de otros idiomas y locuciones o frases. Se contempla la prefijación. (Santana et al, 2007). Por motivos de rendimiento, debido a la extensión del corpus, se ha utilizado la versión local, si bien está disponible como servicio web. En la Figura 2-6 se muestra la información que se obtiene al lematizar una palabra, se ha utilizado para generar el ejemplo la aplicación web disponible para consultas. diezsust diezadj diez millón - sust millón - adj millones había durado - adj durar - v durado ya
58 Figura 2-5 Lematizador del GEDLC de la ULPGC http://www.gedlc.ulpgc.es/investigacion/scogeme02/lematiza.htm Figura 2-6 Respuesta a una consulta realizada al lematizador Se hace necesario hacer notar que al utilizar exclusivamente información morfológica es inviable determinar qué forma canónica es la que produce flexión o palabra derivada que se haya leído del corpus. Por este motivo para cada palabra se contemplan todas las formas canónicas posibles. Desde el punto de vista de las colocaciones, en una gran parte de los casos se producirán combinaciones de formas canónicas con distintas categorías correspondientes a la misma colocación, como manifestación de la característica de la flexibilidad formal. La ejecución del programa sobre el corpus de trabajo produce un total de 14 475 136 combinaciones distintas con frecuencia de aparición mayores o iguales que 3 en alguna de las
59 distancias. Las combinaciones con frecuencia 1 ó 2 se desprecian debido a la explosión de combinaciones irrelevantes que producen. 2.3. La Base de Datos Con el objetivo de manipular la cantidad ingente de información generada a partir del tratamiento del corpus de la forma más eficiente posible se almacenaron los resultados en una BDD (Base de Datos) en la que inicialmente se recogen formas canónicas y su frecuencia de uso así como combinaciones de formas canónicas y su frecuencia de uso. Se muestra en el Gráfico 2-3 la distribución de las combinaciones registradas en la BDD según las categorías gramaticales de los dos elementos de la combinación, como grupos más numerosos se catalogan 6 551 979en el tipo sustantivo + verbo y 3 743 476 en el tipo sustantivo + adjetivo. Gráfico 2-3 Clasificación de las combinaciones por categorías gramaticales de los elementos A partir de la información inicial de frecuencias extraídas mediante el tratamiento del corpus, y utilizando el sistema gestor se amplía el conjunto de datos con los valores de los indicadores: frecuencia relativa, z-score, t-score y test de Dunning evaluados sobre todos los datos del corpus. Se incorpora también el catálogo de colocaciones recopiladas en los artículos que versan sobre colocaciones léxicas en español consultados para el desarrollo del trabajo (Alonso, 1 994-1 995), (Alonso, 2 002), (Bargalló, 1 997-1 998), (Blasco, 2 002), (Bosque, 2 001), (Castillo, 1 997-1 998), (Castillo, 1 998), (Castillo, 2 001), (Corpas, 1 996), (Corpas, 2 001), (Corpas, 2 003), (García 2 002), (García-Page, 2 001), (Koike, 2 001), (Moreno, 1 998), (Penadés, 2 001), (Varela, 1 994), (Zuluaga, 2 002) y en el DCECR. Tanto unas como otras se usan para contrastar Verbo + Sust.; 3883949 Verbo + Sust.- Adj.; 2668030 Sust. + Sust.-Adj.; 3743476 Sust. + Sust.; 2636948 Verbo + Adv.; 143578 Adjetivo + Adv.; 109220 Sust.- Adj.+Sust.-Adj.; 1289935
60 la capacidad de las distintas técnicas basadas en la frecuencia a la hora de detectar colocaciones. El primer grupo se denominará a partir de ahora combinaciones recopiladas, donde se encontraron 2 356 combinaciones, y en el DCECR se registran 55 052. En la Figura 2-7 se muestra el grafo relacional que refleja cómo está organizada la información. Figura 2-7 Grafo relacional de la Base de Datos de Combinaciones A continuación se describen cada una de las entidades y sus atributos. Entidad Ejemplo Descripción Entidad que contiene la información de las combinaciones recopiladas y del DCECR. Atributos FC_Base: Forma Canónica que es base de la colocación. FC_Colocativo Forma Canónica que es colocativo de la colocación. Fuente: Puede ser Recopilada o DCECR.
61 Entidad Palabra Descripción Entidad que contiene la información de la palabra que se toma para la forma canónica, a diferencia de ésta que abarca también la categoría, la frecuencia entre otros. Atributos FormaCanonica: Palabra que corresponde a una forma canónica. Entidad Forma Descripción Entidad que contiene la información de una Forma Canónica. Atributos id_Forma: identificador de la Forma Canónica FormaCanonica: Forma Canónica Categoría: Categoría de la Forma Canónica Frecuencia: Frecuencia de aparición de la forma canónica en el corpus. Entidad pg Descripción Entidad que contiene para cada grupo del Diccionario Ideológico Vox su probabilidad a priori. Pueden ser grupos de verbos, sustantivos, adjetivos o adverbios. Atributos idGrupo: identificador del grupo pg: probabilidad a priori del grupo idGrupo
68 Gráfico 2-6 Distancia entre los colocados en los conjuntos de prueba Palabra x Palabra y Inf. Mutua candonguero candonguear 26,5754247590989 carroñoso lapidífico 25,8384591649327 amentáceo balanífero 25,8384591649327 formiato propilo 25,8384591649327 antuviador piltraca 25,8384591649327 lairén pedrojiménez 25,5754247590989 hiperlipidemia lipemia 25,5165310700453 espigadilla zollipar 25,3530323762343 amarguero morrilla 25,3530323762343 helenización panhelenismo 25,1603872598201 cochinita pibil 25,1603872598201 adarguero algareador 25,1603872598201 mandilejo oracionero 24,768069909176 cespitoso flexuoso 24,7009556796546 abstergente restringente 24,6160667596262 abstergente cefalálgico 24,6160667596262 epigénesis preformismo 24,5754247590989 norato redel 24,5754247590989 rupicapra rupicapra 24,5754247590989 ruado ruado 24,5456775383339 Tabla 2-7 Combinaciones en el corpus con valores máximos de Información mutua 0 20 40 60 80 100 Recopiladas DCECR Porcentajes de combinaciones según la distancia >5 <=5
69 Asimismo, la revisión de los casos en que la combinación solo se da a distancias grandes revela que éstos no aportan información sobre la combinatoria de los lexemas, por lo que se desechan todas aquellas muestras de la combinación a distancias mayores que 5 (Gráfico 2-6) En síntesis, se puede concluir que la metodología de trabajo exige fijar un número mínimo de muestras y una distancia máxima entre los elementos de la colocación. Empíricamente, se determina que si no se llega al menos a 0,0001 en la frecuencia relativa o de 1,5 en la información mutua no se deben tomar en consideración. Por otra parte, parecía suficiente indicio de colocación el disponer de al menos 10 muestras de la combinación y frecuencia relativa que supere el valor de 0,05 o la información mutua mayor que 6. Fruto de los hallazgos realizados surge la catalogación de las combinaciones extraídas en: combinaciones libres, casos dudosos y colocaciones aplicando los criterios expuestos anteriormente y que se resumen en la Tabla 2-8. Frec. absoluta Frec. Relativa Inf. mutua Combinaciones libres ≤ 0,0001 O ≤ 1,5 Casos dudosos < 10 O > 0,0001 Y < 0,05 Y > 1,5 Y < 6 Colocaciones ≥ 10 Y ≥ 0,05 O ≥ 6 Tabla 2-8. Catalogación de las combinaciones del corpus. El grupo de combinaciones que ni se aceptan como colocaciones ni como combinaciones libres será identificado como combinaciones sin catalogar. Entre ellas se pueden encontrar combinaciones libres, intimidar-ciclo cobrar-madera y colocaciones, enternecer-caricia acunar-sueño estirar-cabello Si se aplican estas reglas sobre las colocaciones con estructura sustantivo + verbo se observa la gran cantidad de combinaciones rechazadas como colocaciones (Gráfico 2-7) y que el conjunto de combinaciones que se identifican por ambos indicadores tiene un alto grado de coincidencia (Gráfico 2-8).
70 Gráfico 2-7 Combinaciones sustantivo + verbo que no cumplen ninguna de las reglas establecidas Gráfico 2-8 Combinaciones sustantivo + verbo aceptadas según las reglas establecidas. 2.4.2. Test estadísticos Se analizan los datos obtenidos para el z-score, t-score y test de Dunning, los rangos en que varían tanto el z-score como el t-score no presentan gran diferencia entre las colocaciones recopiladas o las del DCECR. Este resultado parece útil para automatizar la catalogación de combinaciones como colocaciones si pertenecen a dicho intervalo respetando un cierto margen (Tabla 2-9). Distancia grande 11% Frecuencia relativa baja 0% Información mutua baja 65% Distancia grande + Frecuencia relativa baja 0% Distancia grande + Información mutua baja 24% Frecuencia relativa baja + Información mutua baja 0% Todas 0% Frecuencia relativa alta 8% Información mutua alta 9% Frecuencia relativa alta + Información mutua alta 83%
71 z-score t-score Dunning Recopiladas [-55,41 695,99] [-1,57 127,55] [-2293,62 1904484,55] D. CC .RR. [-72,64 695,99] [-2,38 197,37] [357,84 19664670] CORPUS [-172,32 5539,22 ] [-28,66 304,99] [-36533,65 19664695,48] Tabla 2-9 Rangos de variación de los estadísticos z-score, t-score y test de Dunning Son pocas las combinaciones cuyo valor del z-score superan el umbral marcado por los conjuntos de ensayo, en total 567. En este grupo se recogen anomalías como matarile-rilar o bien palabras del mismo campo semántico como fulano-mengano, iza-rabiza, antineutrón-antiprotón que también presentan como característica la baja frecuencia de los elementos que las componen. En este rango del z-score, al ceñirse a los casos en que las formas canónicas constituyentes tienen frecuencias altas, aparece una alta densidad de colocaciones (Tabla 2-10). z-score FC x Frec x FC y Frec y 876,01 administrativo 8842 contencioso 1505 1189,47 ceja 10904 enarcar 1620 1160,71 ceño 11392 fruncido 3040 2388,16 ceño 11392 fruncir 14661 700,07 distrito 12837 federal 10248 796,14 barro 15357 recreativo 1639 719,03 archivo 15515 protocolo 3227 795,52 columna 19662 vertebral 965 1673,44 estado 40175 unido 42708 1226,58 estado 40175 unir 79751 711,36 presidenta 47988 república 42959 711,36 presidente 47988 república 42959 1407,71 hombro 61358 encoger 20376 770,38 puerta 203887 abrir 207390 Tabla 2-10 Combinaciones cuyos elementos aparecen con elevada frecuencia y z-score alto. La representación de la frecuencia de la combinación frente al valor alcanzado por el zscore muestra que valores altos del indicador se dan en todos los espectros de frecuencia, tanto si ésta es alta como si no (Gráfico 2-9). Otro aspecto a destacar en el comportamiento del zscore es que los valores negativos corresponden a colocaciones funcionales (Tabla 2-11).
72 Recopiladas DCECR. z-score FC A FC B z-score FC A FC B -27,29 embargo levantar -36,75 profundo saber -27,63 tristeza tener -38,17 clase dar -28,05 locura tener -38,13 clases dar -28,40 reflejo tener -38,754 sitio dar -28,43 función tener -39,15 aire dar -29,73 angustia tener -39,21 amor dar -30,38 solución hacer -40,21 fuerza dar -30,81 término dar -40,25 imagen dar -32,49 sueño tener -40,77 vivo dar -32,78 idea llevar -41,42 colores dar -32,89 belleza tener -41,59 color dar -35,00 pasión tener -42,92 voz dar -35,68 terror tener -43,00 espacio dar -35,76 fin dar -43,29 atenciones dar -37,36 metro ir -43,29 atención dar -41,35 problema señor -49,53 pie dar -41,35 problema señor -51,97 guerra dar -42,97 relación hacer -53,65 forma dar -46,09 bajo hombre -58,67 cuerpo dar -52,17 causa tener -64,27 alto dar -55,41 amor tener -68,23 ver dar -72,62 tiempo dar Tabla 2-11 Combinaciones con z-score negativo
73 Gráfico 2-9 Valores del z-score según la frecuencia de la combinación En contraste con los resultados observados para el z-score ocurre que los valores negativos del t-score se pueden considerar prácticamente inexistentes entre las colocaciones recopiladas y las del DCECR: 2 y 93 respectivamente. En el total del corpus se observa que estos casos se obtienen en combinaciones de frecuencias mínimas. También destaca la dependencia directa entre el valor del t-score y la cantidad de veces que aparece la combinación, a mayor frecuencia mayor t-score. Por tanto, no se recomienda establecer un ranking en el que se entremezclen palabras poco usadas con aquellas de frecuencia de aparición alta. En la Tabla 2-12 se resalta, a modo de ejemplo, una combinación libre que queda igual o mejor catalogada que colocaciones cuya frecuencia de aparición es igual o menor a la de ella. Este error está inducido por utilizar un único ranking entre todas las combinaciones en un texto o corpus dado, basado en este indicador. Gráfico 2-10 Valores máximos de t-score entre las combinaciones agrupadas por frecuencia de aparición. -1.000 0 1.000 2.000 3.000 4.000 5.000 6.000 0 10.000 20.000 30.000 40.000 50.000 60.000 70.000 80.000 90.000 100.000 z-score 0 50 100 150 200 250 300 350 0 20.000 40.000 60.000 80.000 100.000 t_score
74 Pal x Pal y Frec (x,y) t-score dar discípulo 681 22,8 fuerte emoción 426 20,29 dar emoción 681 23,86 controlar emoción 165 12,73 dominar emoción 390 19,6 prestar colaboración 143 11,86 Tabla 2-12 Influencia de la frecuencia de la combinación en el t-score Respecto al test de Dunnig, se atenúa la influencia de la cantidad de muestras de una combinación en la puntuación que se obtiene. Este resultado es de esperar, ya que está diseñado para hacerlo más estable ante las variaciones en la cantidad de muestras. En la Tabla 2-13 se observan las colocaciones recopiladas para el verbo ir, destacando el amplio rango de variación de las frecuencias computadas para cada una de ellas, y la baja variabilidad del test de Dunning. FC x FC y Frec(x, y) t-Dunning coche ir 3088 11394028,69 metro ir 669 11432604,93 automóvil ir 250 11441127,50 automóvil ir 250 11441127,50 taxi ir 249 11441428,53 autobús ir 223 11441910,29 detrimento ir 60 11444571,56 descrédito ir 7 11445482,55 desdoro ir 7 11445487,50 Tabla 2-13 Test de Dunning evaluado en colocaciones recopiladas para el verbo ir Para finalizar, se aprecia inviable la evaluación del test de Poisson en un corpus tan extenso. Se recuerda que la expresión incluye valores de k!, siendo k la frecuencia de la combinación. 2.4.3. Análisis por tipos de combinación según la categoría gramatical Un segundo análisis de los resultados obtenidos se llevó a cabo según el tipo de combinación. Los grupos se han establecido según la categoría gramatical de las formas canónicas de los elementos que intervienen en las mismas, teniéndose en cuenta los casos:
75 sustantivo + verbo sustantivo + adjetivo verbo + adverbio. 2.4.3.1. Combinaciones sustantivo + verbo De ellas se reconocen aproximadamente un 55% de las colocaciones recopiladas que se encuentran en el corpus y un 23 % de las que se encuentran en el DCECR. De las colocaciones recopiladas ninguna infringe el requisito de la frecuencia relativa, sin embargo 11 solo aparecen a una distancia de más de 5 palabras, 18 no superan el umbral de la información mutua y 153 no cumplen el requisito de la frecuencia absoluta mínima. En cuanto a las combinaciones del DCECR., 4 se descartarían por no llegar a la frecuencia relativa mínima, 1 065 por no superar el valor impuesto de 1,5 a la información mutua, 1 332 casos solo aparecen a distancia alta y 9 995 no cumplen el criterio de contar con al menos 10 muestras de las mismas en el corpus (Tabla 2-14). Distancia > 5 Frec. Relativa < 0,05 Inf. Mutua < 1,5 Frec. Total ≤ 10 Recopiladas 11 - 18 153 DCECR. 1 332 4 1 065 9 995 Tabla 2-14 Colocaciones que infringen las restricciones determinadas en los conjuntos de prueba Se comprueban los rangos de variación de z-score, t-score y test de Dunning evaluados para cada uno de los grupos de ensayo; en todos los casos, de uno u otro modo, se observa la influencia de la frecuencia de uso de los elementos de la combinación con la puntuación obtenida: valores mínimos de z-score para verbos como hacer, tener, formar, decir, etc. o valores máximos de t-score cuando ambos elementos de la combinación tienen una frecuencia alta de aparición (Tabla 2-15), o el caso del test de Dunning, donde ocurre que los puestos más altos en el ranking corresponden a las llamadas colocaciones funcionales producidas por verbos de elevada frecuencia de uso: hacer, dar, tener, ir, poner, haber, … + sustantivo z-score t-score Dunning Recopiladas [-55,41 695,99] [-0,66 127,55] [83,53 1904484] D. CC .RR. [-72,64 695,99] [-2,38 197,37] [1712,65 19664670] Corpus [-172,32 5539,22 ] [-20,31 268,26] [83,53 19044484,55] Tabla 2-15 rangos de variación de los estadísticos en los conjuntos de prueba y en el corpus
76 Se puede considerar que los criterios establecidos en el caso de las frecuencias relativas y la información mutua para descartar combinaciones son efectivos; sin embargo, la cobertura del método en cuanto a la catalogación de las colocaciones resulta insuficiente. Se concluye además que cuando se usa cualquiera de los indicadores estudiados no parece muy útil la comparación mediante rankings, o valores de corte sobre el total del corpus, ya que su comportamiento queda determinado por la cantidad de muestras de la combinación y por la frecuencia de aparición de los elementos que la componen, es decir, el uso que se le da a una palabra. No se puede comparar el valor de un indicador basado en la frecuencia entre los verbos dar (1 118 012), desempeñar (18 903), o traspirar (100). z-score, valores máximos Frecuencia Combinación >=10 z-score valores mínimos aranzada majolar nobel premiar capitán poder antiguo poder ruga rugar monóxido carbonar vuelto poder amor hacer puerta cerrar pistilo estambrar negro hacer ante tener cloruro clorurar rodilla hincar bienes seguir llama poder vito vitar dactilar hollar bien seguir siglo tener cigarro fumar viento soplar alrededores decir hombre formar i her café tazar alrededor decir año parecer mamante piantar salce pitar alto querer propio dar holístico agenciar diamela engraciar artículo saber negro poder hidrato carbonar atenciones prestar mesa decir junto saber sant sacramentar atención prestar gobierno ver voz ir vistazo echar iris arcar español hacer colores poder vida llegar capitana poder Tabla 2-16 combinaciones del corpus con valores extremos del z-score 2.4.4. Combinaciones sustantivo + adjetivo En este grupo se incluyó el total de combinaciones del tipo sustantivo – adjetivo o sustantivo – sustantivo (que puede usarse como adjetivo en el corpus). El resumen de los datos registrados revela ligeras diferencias con las correspondientes a la estructura sustantivo + verbo. Se destaca que la distancia colocacional no debe restringirse a 5, las frecuencias relativas alcanzan valores mayores cuando se evalúan respecto al adjetivo en lugar del sustantivo (Gráfico 2-11). Entre las coincidencias en el comportamiento se observa la necesidad de exigir un número mínimo de
77 muestras, el que las combinaciones con frecuencia relativa 1 se deben descartar, el valor del t -score está directamente relacionado con la cantidad de veces que aparece la combinación en el corpus, y que el rango de variación de la información mutua es similar entre las colocaciones recopiladas y las del DCECR. Gráfico 2-11 Frecuencias relativas en las combinaciones Sustantivo + Adjetivo Corpus Recopiladas DCECR. Frec. Total ≥ 10 41,34% 87,56% 57,58% Frec. Relat. Sust. [0,000014 1] [0,000012 0,13826] [0,0000051 0,14894] Frec. Relat. Adj. [0,000005 1] [0,00015 0,86667] [0,000014 0,65165] Inf. Mutua [-3,41759 25,83846] [-0,71624 15,45569] [-0,73025 16,50326] z-score [-104,74 2634,92] [-46,1 607,86] [-17,32 335,7] t-score [-16,78 191,71] [1,57 100,58] [-1,61 40,41] Dunning [-19846,94 971272,33] [-2293,62 6740597,91] [357,85 5320378,84] Tabla 2-17 Valores obtenidos por las combinaciones Sustantivo + Adjetivo. En el caso del t-score se entremezclan numerosas combinaciones libres que obtienen buenas puntuaciones por ser palabras de uso frecuente en lengua española: madre padre, hijo parte, don señor, aire bueno 0,00 0,20 0,40 0,60 0,80 1,00 max Corpus max DCECR max Recopiladas Frec. Relat. Adjetivo Frec. Relat. Sustantivo
84 Recopiladas DCECR Corpus ZChebyshev ≥ 3 Max dar golpe dar vuelta dar vuelta hacer pregunta dar paso don doña poner marcha dar gracia estado unido tener intención tomar decision tener razón tomar decision dar salto hacer falta dar salto dar orden tener miedo latir corazón soplar viento decir verdad ZChebyshev ≥ 3 Min alisar cabello sumir cuidado cavado fosa alisar pelo reponer fuerza alternativo formar salir crisis camino accidentado llamada recibir viajar coche perder control dar evento dar taconazo poner objection día evento haber relación dar ubicación torre elevado poner crisis reinar tranquilidad enemigo padre Tabla 2-24 Ejemplos de combinaciones que superan el criterio de Chebyshev La Tabla 2-25 y el Gráfico 2-13 recogen el resumen de los datos según la estructura de la colocación, se muestran los rangos alcanzados y los porcentajes de combinaciones que serían reconocidas según este criterio. Se aprecia escasa cobertura entre las combinaciones del DCECR. Sin embargo, los listados que se obtienen se consideran mejores desde el punto de vista de la precisión, logrando filtrar la gran cantidad de ruido en el proceso automatizado. ZChebyshev Verbo + Sustantivo [0 78,6076] Sustantivo + Adjetivo [0 68,8782] Verbo + Adverbio [0 41,06655] Tabla 2-25 Rango de ZChebyshev según la estructura de la combinación 2.6.2. Métodos robustos Una fuente de error en los métodos de identificación de outliers la constituye precisamente el uso de los datos anómalos en el cálculo de la media aritmética y de la desviación típica usados para evaluar los estadísticos. El valor de la media y la desviación típica muestral están fuertmente influenciados por la presencia de outliers en la muestra, además la desigualdad de Chebyshev se cumple para distribuciones normales. El siguiente ejemplo ilustra estos problemas. Sea la muestra en (1), en la que el valor 1000 claramente es atípico, no sería
85 detectado mediante el indicador ZChebyshev como tal debido a la distorsión que él mismo provoca en los estimadores muestrales que se usan en su cálculo. Este ejemplo (Leys et al., 2013) ilustra los problemas que se originan al considerar este indicador, aunque su uso es habitual. 1,3,3,6,8,10,10,1000 130,13 328.8 31116,52 3856.27 1 La mediana, sin embargo, es un estimador para la medida de tendencia central que es invariante a la presencia de outliers, lo que sugiere que se utilicen indicadores basados en este estadístico para resolver el problema que estamos tratando. En este epígrafe se presenta la adaptación de dos métodos de detección de outliers a la extracción automática de colocaciones, ambos basados en los cuartiles de la muestra. 2.6.3. Método basado en el diagrama de cajas y bigotes En el análisis exploratorio de datos estadísticos se utilizan cálculos sencillos para resumir los datos. El diagrama de cajas y bigotes de Tukey, o Box-Plot es una herramienta para la visualización de 5 valores que aportan información sobre la tendencia, la simetría y la variación de la distribución del conjunto. Además permite localizar la existencia de outliers. En un diagrama de cajas y bigotes se representan ,y, cuartiles 1, 2 y 3 de la distribución y se utilizan para delimitar la caja. Los bigotes se marcan en los puntos 1,5∙y1,5∙ . Estos últimos fijan la zona a partir de la que se considerarán valores atípicos moderados en la distribución. Finalmente, destacan los valores atípicos extremos, que rebasan las fronteras del intervalo 3∙y3∙. Los valores en esta zona se marcan con un símbolo que los identifica como tales, un ejemplo puede verse en la Figura 2-8. En el interior de la caja se representa el valor de la mediana, si éste no aparece centrado la distribución de la variable es asimétrica. En la Figura 2-9 se muestra el diagrama de cajas de las frecuencias relativas del verbo palpitar con los sustantivos en su contexto en el corpus, la mayor parte de combinaciones se concentran en la zona de frecuencia relativa inferior a 0,002 apreciándose un conjunto de valores atípicos extremos. El perfil de la representación en un diagrama de cajas y bigotes del resumen de la variable “frecuencia relativa fijada una palabra” (FrecRel(Palabra)) por lo general será similar al que se muestra en la Figura 2-9. Se observa que corresponde a una variable totalmente asimétrica, y en la que aparecen valores atípicos extremos, por lo que se justifica la propuesta de utilizar indicadores más robustos frente a outliers que ZChebyshev.
86 media desv. típica Q1 Q2 Q3 n 0.0112348 0.02690609 0.003634361 0.005947137 0.009581498 167 Tabla 2-26 Estadísticos resumen de las frecuencias relativas cuando se fija el verbo palpitar. Se define a continuación otro indicador basado en estas consideraciones, que identificaremos como Box-plot(palabra, xi). Este método también se encuentra en la literatura con el nombre método de los cuartiles. Para calcularlo, se debe fijar de antemano sobre qué palabra se calculará, y habrá que determinar el primer y tercer cuartil (Q1, Q3) de las frecuencias relativas respecto a la palabra de interés así como el rango intercuartílico (RI). , ,3 ,eslafrecuenciarelativarespectoa palabra de con palabra En la Tabla 2-27, Tabla 2-28 y la Tabla 2-29 se presentan las combinaciones sustantivo + verbo, sustantivo + adjetivo y verbo + adverbio que alcanzan los valores máximos que se obtienen al calcular este indicador fijando el colocativo en cada uno de esos 3 casos respectivamente. La cobertura que se alcanza se recoge en el Gráfico 2-14, donde se puede apreciar cómo suben los resultados frente al método de Chebyshev. Q3 Q1 Q3 +1,5*RI Q1 -1,5*RI Outliers, valores atípicos extremos Figura 2-8 Explicación del diagrama de cajas de Tukey
87 palabra xi FrecRelativa(palabra, xi) Box-plot (palabra, xi) encoger hombro 0,6348646 993,846208698718 trizar hecho 0,3452381 688,999867633008 enguantar mano 0,7609428 673,999826155181 abrir puerta 0,210825 671,584602763095 enguantar manos 0,7485971 662,999835490524 cerrar puerta 0,2387841 576,282633476278 fruncir ceño 0,5443012 530,800016942488 menear cabeza 0,617914 481,083363372164 atrancar puerta 0,6423659 462,999946849891 decir señora 0,04031934 456,767419796828 decir señor 0,04031934 456,767419796828 pronunciar palabra 0,3318395 434,450978686954 vezar mucho 0,1426878 431,531244894402 cerrar ojo 0,1766763 426,108704142493 latir corazón 0,3690867 412,812470856838 unir estado 0,2274454 393,239122510575 mirar ojo 0,07979666 382,259992494583 decir hombre 0,03339114 378,098820930561 pablar san 0,3634326 374,421032936214 roncar voz 0,4186728 362,363633128052 Tabla 2-27 Combinaciones Sustantivo + Verbo con máximo valor de Box-plot
88 palabra xi FrecRelativa(palabra, xi) Box-plot(palabra, xi) pecado venial 0,6516464 185,499984013151 prueba fehaciente 0,278481 149,999992789701 fuerza centrífugo 0,5914894 137,000007441268 nota discordante 0,1366623 100,000013820363 camino trillado 0,3438228 96,3333324454725 testigo ocular 0,3409549 90,6363666121319 mirada penetrante 0,1941656 87,214282613629 precio irrisorio 0,094 86,999982304874 necesidad imperioso 0,2272065 85,3333331557094 voz estridente 0,2045455 84,7142806504476 ojo penetrante 0,1874216 84,1428532289289 edad avanzado 0,1275232 82,1249971597993 edad avanzada 0,1275232 82,1249971597993 movimiento brusco 0,1216772 79,6315753950049 documento fehaciente 0,1500904 78,9999953648077 pregunta formular 0,2516515 78,6999982346979 discusión acalorado 0,1558185 76,9999971669168 libertad condicional 0,1933497 76,0000066170476 luz cegador 0,3292156 74,7142820524585 luces cegador 0,3292156 74,7142820524585 Tabla 2-28 Combinaciones Sustantivo + Adjetivo con máximo valor de Box-plot Figura 2-9 Diagrama de cajas para la distribución de las frecuencias relativas del verbo palpitar
89 Gráfico 2-14 Cobertura en el caso de aplicar Box-Plot palabra xi FrecRelativa(palabra, xi) Box-plot(palabra, xi) herméticamente cerrar 0,7858796 153,805255159383 comercialmente estrenar 0,08759124 144,595113843274 olímpicamente ignorar 0,3606557 139,279349376819 alfabéticamente ordenar 0,508772 118,27913930758 celosamente guardar 0,3695652 106,073907808064 rematadamente locar 0,2102564 105,617925682556 activamente participar 0,2290419 102,565217422258 frontalmente chocar 0,2113821 100,519609091312 herméticamente sellar 0,05555556 93,2356047672532 gratamente sorprender 0,3082192 82,7287324380578 encarecidamente rogar 0,2931243 81,9901037563911 ardientemente desear 0,4692623 78,9741632248684 descaradamente mentir 0,08625731 73,420234354581 terminantemente prohibir 0,25459 65,3472818468441 rotundamente negar 0,3542977 63,152643313143 acaloradamente discutir 0,2864321 62,5256543244676 fervientemente desear 0,3698225 61,957777978053 atentamente escuchar 0,2001596 60,3643561695563 copiosamente sudar 0,1366384 60,3583868324945 cordialmente detestar 0,03237743 59,4035125720244 Tabla 2-29 Combinaciones sustantivo + verbo con máximo valor de Box-plot 65,4 55,5 35,1 26,1 70,4 62,7 32,8 23,3 37,8 25,3 Recopiladas >=1.5 Recopiladas >=3 DCECR>= 1.5 DCECR >= 3 Verbo + Sustantivo Sustantivo + Adjetivo Verbo + Adverbio
90 2.6.4. Método de Hampel El estadístico MAD 2, basado en la MEDA de los datos, es robusto frente a observaciones atípicas, por lo que métodos más efectivos para la identificación de outliers se basan en él, si bien los cálculos son más complejos (Leys y otros, 2013). La MEDA 3 es la mediana de las desviaciones a la mediana de los datos en valores absolutos 3 y b 4) en caso de distribuciones normales debe ser: 1,4826. 2∗ 3||,||,⋯,|| 4 ,,⋯, es la muestra de la variable. MAD es un estadístico más adecuado para el problema por las siguientes propiedades: El punto de ruptura de MAD es de 0,5, superior al del rango intercuartílico que es de 0,25, o 0 en el caso de la media. Este valor indica la proporción máxima de observaciones que pueden ser infinito (estar contaminadas) sin que el estimador se resienta, es decir, que de un valor falso. MAD no tiene restricciones respecto al tamaño muestral. Permite establecer un criterio objetivo fácilmente automatizable para discriminar entre las combinaciones que se consideran outliers y las que no. Por extensión proporciona un mecanismo para identificar automáticamente los candidatos a colocaciones. El método de Hampel acepta como outlier los valores xi que cumplen la condición ||4,5 . || La adaptación del método a este trabajo lleva a considerar: ,|,| Siendo: mediana,⋯ y
91 ,⋯ Las Tabla 2-31 y Tabla 2-32 muestran los rangos obtenidos en ambos corpus cuando se intentan detectar los outliers a partir de las desviaciones respecto a la mediana de las frecuencias relativas. Hay que tener en cuenta que se pueden realizar los cálculos en los casos en que la MEDA sea distinta de cero y que es necesario calcular los valores del indicador para cada uno de los colocados, ya que si el uso respecto a la base no es preferente si lo puede ser respecto al colocativo y viceversa. En este caso, la cobertura aumenta significativamente, si bien en los ejemplos extraídos en torno al punto de corte teórico se aprecian falsas colocaciones (Tabla 2-30). Recopiladas DCECR. Corpus MAD≥4,5 Max hacer alarde dar vuelta encoger hombro echar vistazo echar vistazo dar vuelta dar palmada dar gracia don doña hacer pregunta dar paso abrir puerta ladrar perro soplar viento decir señor latir corazón dar prisa don quijo poder ejecutivo dar salto menear cabeza MAD≥4,5 Min andar barco dorar fama juir cerrado incurrir ira arranque patriotismo servido regentar cifra grande fórmula predicción botón suicidio memoria frágil sofocar levantamiento adquirir círculo fuente fidedigno influenciar dominante sensación huir acarrear molestia distorsionar versión maldito amenazar abrir crisis estrechar acuerdo pluma relación Tabla 2-30 Ejemplos de combinaciones que superan el criterio MAD≥4,5 Rango Combinaciones con MAD ≥ 4,5 Recopiladas [0 2087,0032] 1532 DCECR [0 4304,111] 15039 Corpus [0 4309,9998] 4318191 Tabla 2-31 Resultados obtenidos en el corpus para MAD
92 Rango Combinaciones con MAD ≥ 4.5 Recopiladas [0 68,00004] 933 DCECR [0 344,9999] 2735 Corpus [0 344,9999] 455738 Tabla 2-32 Resultados obtenidos en el corpus de Galdós para MAD Los ejemplos extraídos reflejan cierta tendencia a que los verbos ocupen las posiciones más altas del ranking, y entre éstos, los funcionales como dar, echar o hacer. Los rangos alcanzados en cada uno de los grupos, según la estructura de la combinación, se muestran en la Tabla 2-33. Se aprecian intervalos similares en los grupos sustantivo + adjetivo y verbo + dverbio, y destaca la amplitud mucho mayor en el caso verbo + sustantivo. Respecto a la cobertura en los conjuntos de ensayo, en todas las estructuras sube drásticamente respecto a los resultados obtenidos con el criterio de ZChebyshev. MAD Verbo + Sustantivo [0 4309,9999] Sustantivo + Adjetivo [0 2531,476] Verbo + Adverbio [0 2332,5601] Tabla 2-33 Rango de Mad según la estructura de la combinación. Gráfico 2-15 Combinaciones de los conjuntos de ensayo que superan el criterio de MAD ≥4,5 Para finalizar, se contrasta la cobertura de los distintos criterios barajados sobre los conjuntos de ensayo, teniendo en cuenta también la estructura de la colocación. Los resultados se resumen en 90,06 86,67 78,53 78,26 79,08 Sustantivo + Verbo Sustantivo + Adjetivo Verbo + Adverbio Recopiladas DCECR
93 el Gráfico 2-16; en él se aprecia la gran diferencia de cobertura entre MAD y el resto. Se observa que en orden de más restrictivos a menos se tiene: frecuencia relativa (≥0,05), información mutua (≥6), Zchebyshev (≥3), Box-Plot y MAD (≥4,5) respectivamente. Sin embargo, ya se ha advertido que la frontera teórica marcada por MAD introduce ruido en los resultados. Gráfico 2-16 Comparativa de los criterios de extracción automática 2.7. Estrategia para la extracción de información colocacional generada por un corpus extenso Fruto del análisis de los resultados registrados en la BD de colocaciones surgen las líneas que marcan su explotación en el desarrollo de un módulo de software que dé soporte a la presentación de las características combinatorias de las palabras en español: sugieren consideraciones a tener en cuenta a la hora de explotar corpus textuales extensos cuando se utilizan indicadores basados en las frecuencias de uso para medir las relaciones de asociación entre palabras. Los resultados de los epígrafes previos llevan a la necesidad de considerar la composición del corpus como una muestra en la que el uso que se da en él a las palabras influye en la posición en cualquier ranking que se intente establecer, y no solo el fenómeno fraseológico. Una muestra muy extensa del lenguaje agranda las diferencias de comportamiento según factores tales como el tipo de elementos que conformen la combinación, la estructura de la colocación o si intervienen palabras funcionales, de gran frecuencia de uso. Por otra parte, el límite entre lo que es colocación cuando los indicadores se basan en la independencia se debe variar en función del tamaño del corpus; sin embargo, los indicadores que pretenden captar el uso preferente permiten establecer un criterio objetivo de forma independiente a este factor. Sobre la base de estas consideraciones se propone seguir una estrategia en la que dada una palabra se muestren sus capacidades combinatorias, de forma que se presente al usuario un Frec. Relativa ≥0,05 Inf. Mutua≥6MAD >4.5 Zchebyshev ≥3Box-Plot≥3 Sustantivo + Verbo 2,24948659 6,870332459 47,60672671 8,62319746 17,0239228 Sustantivo + Adjetivo 1,966144696 12,10707363 49,55359021 5,683497238 19,0904178 Verbo + Adverbio 4,731611071 10,47555826 28,81930999 7,42564216 6,41699397 0 10 20 30 40 50 60 % Recuperadas
100 Max Box-Plot Punto de corte Box-Plot Min Box-Plot hacer 182,07 tronco 3,05 desasir -0,03 tener 169,93 social 3,04 yate -0,03 poder 166,53 recibido 3,04 languidecer -0,03 decir 150,53 morado 3,04 empedernir -0,03 ver 144,07 morada 3,04 amordazar -0,03 cielo 125,70 rumbo 3,03 erar -0,03 dar 123,11 cruel 3,02 reportar -0,03 hombre 109,40 cortés 3,02 violar -0,03 ir 101,36 dilatar 3,02 tortuoso -0,03 mar 95,42 acostumbrar 3,02 traicionero -0,03 Tabla 2-43 Resultados Box-Plot, sustantivo tierra + Adjetivo Max ZChebyshev Punto de corte ZChebyshev Min ZChebyshev poder 15,93 firmado 3,54 fundamento 0 hacer 15,79 ver 3,44 idea 0 firmar 14,88 contrato 3,41 ideo 0 tener 13,55 contrato 3,40 número 0 celebrar 11,16 hecho 3,38 recordar 0 decir 9,83 cancelar 3,25 reinar 0 matrimonial 7,97 gobierno 3,23 solar 0 firmar 7,10 haber 3,21 ir 0 social 6,48 contrato 3,16 mercantil 0 dar 6,27 nuevo 3,06 contrato 0 Tabla 2-44 Resultados ZChebyshev, sustantivo contrato + Adjetivo
101 Max MAD Punto de corte MAD Min MAD poder 192,33 fecho 3,22 condicional 0 hacer 190,66 contrato 4,62 bastir 0 firmar 179,83 promesa 4,62 destruir 0 matrimonial 174,00 millo 4,59 demasiar 0 tener 164,16 millón 4,57 encargar 0 celebrar 135,83 nombre 4,57 dotar 0 firmar 134,62 pueblo 4,52 extinguir 0 decir 119,99 mercantil 4,52 manifestar 0 celebrar 116,28 arrendatario 4,50 salariar 0 rescindir 86,999 usar 4,50 cincuenta 0 Tabla 2-45 Resultados MAD, sustantivo contrato + Adjetivo Max Box-Plot Punto de corte Box-Plot Min Box-Plot poder 49,39 vido 3,17 auxiliador -1,04 hacer 48,96 parecer 3,17 contracto -1,04 firmar 46,13 vida 3,17 contracto -1,04 tener 42,04 padre 3,17 comodato -1,04 celebrar 34,65 conocer 3,09 ayuno -1,04 decir 30,52 pago 3,09 acordado -1,04 social 20,17 volver 3,09 contacto -1,04 dar 19,52 pueblo 3,04 abuelo -1,04 partir 17,87 conseguir 3,04 ayunas -1,04 deber 17,78 nombre 3,04 condesa -1,04 Tabla 2-46 Resultados Box-Plot, sustantivo contrato + Adjetivo
102 Max ZChebyshev Punto de corte ZChebyshev Min ZChebyshev hacer 29,05 judicial 3,03 animal 0 poder 27,70 económico 3,03 terma 0 privado 25,57 acogida 3,03 distraído 0 funcionario 24,70 gasto 3,02 intrigante 0 privar 24,27 caso 3,02 imprescriptible 0 instrucciones 23,51 universidad 3,02 precaución 0 instrucción 23,51 dirigir 3,01 latas 0 ministerio 20,97 ilustrar 3,01 gana 0 administración 20,54 tener 3,01 arriesgar 0 tener 20,47 militar 3,01 trimestralmente 0 Tabla 2-47 Resultados ZChebyshev, adjetivo público Max MAD Punto de corte, MAD Min MAD hacer 636,21 mentalidad 4,50 suficiencia 0 poder 606,85 adaptar 4,50 inválido 0 subastar 591,00 estampa 4,50 público 0 privar 481,14 suelo 4,50 quieto 0 privado 469,14 ventana 4,50 público 0 tener 449,99 transformación 4,50 conminar 0 privada 427,00 gubernamental 4,5 etiquetar 0 instrucción 416,75 bofetada 4,5 mortificar 0 instrucciones 416,75 sobrevenir 4,5 semillar 0 funcionario 370,00 agencia 4,5 público 0 Tabla 2-48 Resultados MAD, adjetivo público + Adjetivo
103 Max Box-Plot Punto de corte, Box-Plot Min Box-Plot bien 54,41 género 3,09 prosa -0,93 bienes 54,41 tarde 3,07 rienda -0,93 leyes 51,77 consideración 3,07 romería -0,93 ley 51,77 decreto 3,06 acabo -0,93 obra 51,03 garantía 3,04 basura -0,93 servicio 48,64 voluntad 3,03 basuras -0,93 instrucción 47,41 gestión 3,03 calificación -0,93 instrucciones 47,41 comunidad 3,03 cuestor -0,93 opinión 46,43 presencia 3,01 aristocracia -0,93 orden 46,13 sentimiento 3,01 cuánto -0,93 Tabla 2-49 Resultados Box-Plot, adjetivo público + Adjetivo Se destaca el comportamiento de formas canónicas fácilmente decodificables por tener una única acepción como el adjetivo omiso: en la zona de transición cuando se utiliza MAD, las combinaciones que aparecen tienen una relación estrecha que induce a catalogarlas como colocaciones: remitente omiso, insulto omiso, parte omiso, protesta omiso. Se observan también los efectos excesivamente restrictivos de ZChebyshev en palabras con estas características. En este caso, solo las formas canónicas que provienen de hacer caso omiso, superan la restricción impuesta por este indicador (Tabla 2-50). También destaca el buen comportamiento de Box-Plot que parece mejorar los resultados, introduciendo entre los casos anómalos palabras con menor frecuencia de uso. Max ZChebyshev omiso hacer 10,04 omiso casar 10,01 omiso caso 9,889 omiso hacendar 2,980 omiso omiso 2,814 omiso hacendar 1,871 omiso casar 1,855 omiso hacer 0,563 omiso vanguardia 0,492 omiso convención 0,479 Tabla 2-50 Resultados ZChebyshev, adjetivo omiso + Adjetivo
104 Max MAD Punto de corte, MAD Min MAD hacer 1495,00 remitente 6,00 culpar 0 casar 1491,00 señalar 6,00 insultar 0 caso 1472,00 soler 6,00 observar 0 hacendar 457,000 insulto 6,00 padre 0 caso 91,0625 llamar 6,00 procurar 0 poder 76,0000 sentir 6,00 recomendación 0 casar 73,6000 parte 5,00 regla 0 decir 69,0000 partes 5,00 sugerencia 0 tener 58,0000 ser 5,00 teléfono 0 hecho 51,0000 protesta 5,00 texto 0 Tabla 2-51 Resultados MAD, adjetivo omiso + Adjetivo Max Box-Plot Min Box-Plot caso 367,25 órdenes 2,25 hombre 9,50 mano 2,25 pregunta 8,50 manos 2,00 palabra 7,00 advertencia 2,00 mujer 6,25 presencia 1,75 comentario 5,25 interrupción 1,50 comentarios 5,25 bien 1,50 dolor 4,50 bienes 1,50 dolores 4,50 voz 1,00 ley 3,50 cámara 0,75 leyes 3,5 insulto 0,75 protesta 3,5 Tabla 2-52 Resultados Box-Plot, omiso + Sustantivo Nótese como el comportamiento se reproduce también en los adverbios seleccionados para ilustrar los resultados, destacando el efecto restrictivo de ZChebyshev que excluye todas las combinaciones halladas del conjunto de colocaciones.
105 Max ZChebyshev Punto de corte, ZChebyshev Min ZChebyshev hacer 29,05 relacionado 4,24 cierto 0,01 poder 27,70 vincular 4,07 entrelazar 0,01 privado 25,57 poder 4,03 limitado 0,01 funcionario 24,70 relacionado 3,90 social 0,01 privar 24,27 emparentado 3,69 llamar 0,01 instrucciones 23,51 abrazado 3,53 pasar 0,01 instrucción 23,51 vinculado 3,30 permanecer 0,01 ministerio 20,97 tener 3,22 tratar 0,01 administración 20,54 emparentar 3,21 humanar 0,01 tener 20,47 abrazar 3,19 entrelazado 0,00 Tabla 2-53 Resultados ZChebyshev, adverbio estrechamente + Verbo Max MAD Punto de corte MAD Min MAD unir 165,66 bajar 5,00 suficiencia 0 abrazar 120,99 guardar 5,00 inválido 0 unido 110,99 ideo 5,00 público 0 ligar 107,99 general 5,00 quieto 0 relacionar 103,33 señor 5,00 público 0 ligado 92,666 conectar 4,74 conminar 0 ligado 92,666 puntar 4,66 etiquetar 0 abrazar 90,500 sentido 4,66 mortificar 0 ligar 80,749 poblar 4,66 semillar 0 relacionado 71,999 apretar 4,60 público 0 Tabla 2-54 Resultados MAD, adverbio estrechamente + Verbo
106 Max Box-Plot Min Box-Plot unir 39,97 preguntar -1,27 relacionar 33,93 resultar -1,27 ligar 33,45 esperar -1,27 vincular 24,17 dirigir -1,29 abrazar 21,14 pensar -1,30 enlazar 9,08 sentar -1,30 vigilar 8,05 escribir -1,32 asociar 6,69 salir -1,36 aliar 5,55 vezar -1,39 ceñir 4,44 llevar -1,45 Tabla 2-55 Resultados Box-Plot, adverbio estrechamente + Verbo ZChebyshev frugalmente comer 1,76 frugalmente desayunar 0,72 frugalmente almorzar 0,38 frugalmente vivir 0,38 frugalmente desayunar 0,33 frugalmente cenar 0,27 frugalmente cenar 0,24 frugalmente almorzar 0,24 frugalmente vivir 0,24 frugalmente comer 0,20 Tabla 2-56 Resultados ZChebyshev, adverbio frugalmente + Verbo
107 Box-Plot frugalmente comer 72,30 frugalmente cenar 68,09 frugalmente desayunar 45,83 frugalmente almorzar 21,45 frugalmente vivir 7,56 Tabla 2-57 Resultados Box-Plot, adverbio frugalmente + Verbo MAD frugalmente comer 18,99 frugalmente desayunar 3 frugalmente comer 1,399 frugalmente cenar 1 frugalmente almorzar 0,666 frugalmente vivir 0,642 frugalmente desayunar 0,500 frugalmente cenar 0,199 frugalmente vivir 0 frugalmente almorzar 0 Tabla 2-58 Resultados MAD, adverbio frugalmente + Verbo Para finalizar, cabe resaltar en este apartado la necesidad del tratamiento diferencial de los datos según la semántica de la palabra, ya que incide directamente en su uso. Véase en los ejemplos que palabras con valor funcional como el verbo dar, o el adverbio estrechamente abarcan un espectro más amplio de combinaciones, frente a propinar, omiso o frugalmente, que no solo son palabras de menor frecuencia de uso, sino que en el DRAE. solo disponen de una acepción (Tabla 2-59).
108 Acepciones Frecuencia dar 53 1.118.012 propinar 3 2.970 contrato 1 12.244 tierra 10 286.387 público 8 109.763 omiso 1 1.581 estrechamente 4 3.188 frugalmente 1 73 Tabla 2-59 Acepciones y frecuencias en el corpus de los casos analizados. Cuando se contrastan las combinaciones mejor posicionadas según cada indicador analizado se manifiestan nuevamente las diferencias entre palabras cuya frecuencia de uso es dispar. Las tablas Tabla 2-60 y Tabla 2-61 muestran que en general los casos mejor posicionados coinciden cuando se trata de una palabra cuya frecuencia no es alta y presenta pocas acepciones. Por el contrario, la información mutua arroja resultados similares a las mayores frecuencias relativas evaluadas respecto al otro elemento de la combinación. El resto de los indicadores aportan resultados similares. FrecRel FrecRel InfMutua ZScore t-Score ZChebyshev MAD BoxPlot dar adestrador vuelto adestrador vuelta vuelto vuelto vuelta vuelto moravedí vuelta moravedí vuelto vuelta vuelta vuelto vuelta carpetazo hombre carpetazo palmada hombre golpe palmado hombre traspié señora traspié palmado dios pasa palmada señor palmada señor palmada salto diosa paso gracia señora palmado dios palmado golpe pasa gracia pasa diosa respingo diosa respingo gracia paso muestra paso dios golpecito mujer golpecito golpecito señora salto priso mujer Tabla 2-60 Colocaciones según el indicador, verbo dar + Sustantivo
109 Frec. Rel. Frec. Rel. propinar InfMutua ZScore t-Score ZChebyshev MAD BoxPlot propinar paliza golpe paliza paliza golpe golpe golpe golpe puntapié paliza puntapié puntapié paliza paliza paliza paliza puñetazo bueno puñetazo puñetazo patada bueno paliza bueno puñete patada puñete puñete bueno patada bueno patada patada buena patada patada puntapié buena patada buena codazo puntapié codazo golpe buena puntapié buena puntapié bofetada puñete bofetada bofetada puñetazo puñetazo puntapié puñetazo bofetón puñetazo bofetón codazo puñete puñete puñete puñete Tabla 2-61 Colocaciones según el indicador, verbo propinar + Sustantivo Frec. RelAdj Frec. Reltierra . Inf. Mutua ZScore t-Score ZChebys hev Box Plot MAD tierra temporejado tanto temporejado firme baja firme baja baja lejas baja lejas fértil bajo cielo bajo bajo estercolado bajo estercolado apisonad o mucho firmar nuevo firme labrantío mucho labrantío natal grande adentrar bien medio apisonado grande apisonado baldío nuevo hacer padre vido lantánido nuevo lantánido labrantío tanto mar firme indio cultivable señor cultivable lejas firme cultivar medio alto alquiladizo señora alquiladizo poblado señora tener vido visto Tabla 2-62 Colocaciones según el indicador, sustantivo tierra + Adjetivo
116 que permita agrupar mediante criterios semánticos las bases; se trata de establecer el nexo entre el predicado y sus argumentos de forma extensional. El problema consiste en delimitar el subconjunto formado por aquellas que responden al fenómeno de la selección léxica dentro del conjunto de combinaciones posibles para un predicado dado. Desde un punto de vista lingüístico, el subconjunto de las colocaciones se encuentra en un nivel más profundo de las restricciones combinatorias. Si se traslada este esquema a la automatización del proceso, se parte de todas las combinaciones extraídas del corpus, entre las que se incluyen grupos semánticos y en el nivel más profundo, los casos que destacan por su uso frecuente o outliers (Figura 3-1). Rasgo Semántico Clase SUSTANTIVOS QUE DESIGNAN EMOCIONES Y SENTIMIENTOS PRINCIPALMENTE LOS DE NATURALEZA PASIONAL amor, deseo, emoción, pasión, pulsión SUSTANTIVOS QUE DENOTAN MIEDO ODIO O PREOCUPACIÓN TAMBIÉN CON ALGUNOS QUE DESIGNAN OTRAS ACTITUDES QUE EXPRESAN LA INTRANQUILIDAD MANIFESTADA CON RELACIÓN A ALGO angustia, ansiedad, desconfianza, miedo, odio, preocupación, resentimiento, temor SUSTANTIVOS QUE DENOTAN FUERZA O VITALIDAD fuerza, vida, vitalidad SUSTANTIVOS QUE DESIGNAN ARTES TÉCNICAS Y TENDENCIAS ARTÍSTICAS ASÍ COMO ALGUNAS DE SUS MANIFESTACIONES acorde, creación, cubismo, flamenco, literatura, melodía, obra, partitura, poesía, tendencia SUSTANTIVOS QUE DENOTAN LUGAR CASI SIEMPRE USADOS EN SENTIDO METONÍMICO CON LA INTERPRETACIÓN DE GRUPO HUMANO banquillo, ciudad, país Tabla 3-3 Clases semánticas en el DCECR para el verbo palpitar
117 Rasgo Semántico Clase VERBOS QUE DENOTAN OPOSICIÓN O RECHAZO A MENUDO MANIFESTADAS VERBALMENTE condenar, criticar, denunciar, descartar, oponerse, protestar, rechazar, reprobar, repudiar LOS VERBOS DEFENDER Y APOYAR apoyar, defender VERBOS QUE DENOTAN LA ACCIÓN DE AFIRMAR O NEGAR ALGUNA COSA afirmar, asegurar, desmentir, negar VERBOS QUE DENOTAN SOLICITUD demandar, exigir, pedir, preguntar, reclamar VERBOS QUE DENOTAN ENFRENTAMIENTO O CONFRONTACIÓN, A MENUDO NO FÍSICA combatir, discutir, luchar VERBOS QUE DESIGNAN DIVERSAS MANIFESTACIONES VERBALES CARACTERIZADAS POR LA REITERACIÓN O EL ÉNFASIS recalcar, reiterar, repetir VERBOS QUE DENOTAN AMENAZA O ADMONICIÓN advertir, amenazar, recomendar Tabla 3-4 Clases Semánticas en el DCECR. para el adverbio enérgicamente Figura 3-1 Esquema del problema en el nivel lingüístico y en el nivel computacional.
118 Rasgo Semántico Clase SUSTANTIVOS QUE DENOTAN CAMBIO REFORMA O MODIFICACIÓN TAMBIÉN CON OTROS QUE DESIGNAN DIVERSOS ESTADOS SUCESIVOS DE ALTERNANCIA alteración, altibajo, corrección, fluctuación, mutación, oscilación, reforma, transformación, vaivén, variación SUSTANTIVOS QUE DENOTAN AUMENTO O ASCENSO alza, ascensión, ascenso, aumento, crecimiento, elevación, incremento, subida SUSTANTIVOS QUE DENOTAN DISMINUCIÓN O DESCENSO bajada, bajada, caída, derrumbe, descenso, disminución, rebaja, recorte, reducción SUSTANTIVOS QUE DENOTAN MOVIMIENTO, Y A MENUDO CAMBIO RÁPIDO DE DIRECCIÓN giro, maniobra, movimiento, quiebro, viraje, volantazo, vuelco SUSTANTIVOS QUE DENOTAN DETENCIÓN O VARIACIÓN REPENTINA DE VELOCIDAD aceleración, acelerón, desaceleración, detención, frenada, frenazo, paralización, parón SUSTANTIVOS QUE DENOTAN DIVISIÓN, CORTE O RUPTURA corte, escisión, interrupción, quiebra, rotura, ruptura, separación EL SUSTANTIVO GESTO Y CON OTROS QUE DESIGNAN ACCIONES Y MOVIMIENTOS CORPORALES, A MENUDO RÁPIDOS O REPENTINOS abrazo, ademán, brinco, cabezada, gesto, pirueta SUSTANTIVOS QUE DENOTAN GOLPE, CHOQUE, ENCUENTRO VIOLENTO O MOVIMIENTO IMPULSIVO O IMPETUOSO chapuzón, choque, embestida, empujón, encontronazo, golpe, remezón, sacudida, tirón, vapuleo, zapatillazo, zarpazo SUSTANTIVOS QUE DENOTAN APARICIÓN, INICIO O SURGIMIENTO DE ALGO, O DESIGNAN ALGUNAS DE LAS ACCIONES QUE LLEVAN A CABO ESOS PROCESOS aparición, apertura, arrancada, arranque, eclosión, irrupción, rebrote, surgimiento Tabla 3-5 clases semánticas en el DCECR. para el adjetivo brusco (I)
119 Rasgo Semántico Clase VERBOS DE CAMBIO DE ESTADO ESPECIALMENTE LOS QUE DESIGNAN LA ACCIÓN DE PROPORCIONAR HACER ADQUIRIR O LOGRAR QUE ALGO O ALGUIEN PASE A ESTAR EN DISPOSICIÓN DE ALGUNA COSA dotar, engrasar, financiar, pintar, premiar, proporcionar, suministrar, untar VERBOS QUE DENOTAN CONSUMICIÓN GENERALMENTE DE ALIMENTOS abrevar, beber, cenar, comer, consumir, leer VERBOS QUE DENOTAN EXISTENCIA O INCREMENTO DE ALGO almacenar(se), crecer, dar(se), encontrar(se), existir, extender(se), practicar(se), presentar(se), prodigar(se), producir(se), realizar(se), sobrar VERBOS QUE DESIGNAN EL PROCESO DE SURGIR O FLUIR UN LÍQUIDO U OTRAS MATERIAS QUE SE LE ASIMILAN FÍSICA O FIGURADAMENTE TAMBIÉN CON OTROS VERBOS QUE EXPRESAN LA ACCIÓN QUE DESENCADENA ESE PROCESO brotar, correr, desbordar, fluir, llover, manar, nevar, perder sangre, regar, remojar, rociar, sangrar, sudar, verter VERBOS QUE DESIGNAN LA ACCIÓN DE EXPRESAR O MANIFESTAR ALGO GENERALMENTE COMO MEDIOS VERBALES PERO TAMBIÉN CON OTROS anunciar, citar, comentar, contar, describir, dialogar, discutir, escribir, hablar, informar, mencionar VERBOS QUE DESIGNAN LA ACCIÓN DE PROBAR ALGO demostrar, probar, dar propaganda VERBOS QUE DESIGNAN LA ACCIÓN DE REPRODUCIR DIFUNDIR O HACER PÚBLICA ALGUNA COSA exhibir, filmar, grabar, ilustrar, representar, reproducir, reseñar, traducir, versionear VERBOS QUE DESIGNAN LA ACCIÓN DE USAR ALGO emplear, recurrir, usar, utilizar Tabla 3-6 Clases Semánticas en el DCECR. para el adverbio abundantemente.
120 3.2. Similitud semántica Se propone aplicar técnicas que permitan automatizar el proceso de generación de clases léxicas; deben estar formadas por palabras que estén próximas en el espacio semántico, de manera que se puedan construir grupos formados por elementos similares en cuanto a su significado. La generación automática de grupos semánticos obliga a cuantificar las relaciones semánticas existentes entre las palabras del texto que se analiza. Se debe hacer uso de medidas que reflejen la relación entre palabras que representan un mismo concepto, y así conformar grupos que hagan referencia a las mismas entidades conceptuales. El problema de cuantificar las relaciones semánticas ha sido ampliamente estudiado por su utilidad en distintas tareas del Procesamiento del Lenguaje Natural. Se emplean diferentes términos concernientes a métricas que evalúan tanto la existencia de una relación semántica entre dos palabras como su fuerza. En este sentido se pueden encontrar en la literatura referencias a relación, similitud o distancia semántica. 3.2.1. Técnicas para determinar la similitud semántica Desde el punto de vista algorítmico, los métodos comparan los términos en la representación topológica de algún recurso léxico que incluya relaciones semánticas, o bien se analizan contextos en los que aparecen en muchas ocasiones se representan mediante vectores. En cualquier caso, una medida de similitud debe verificar los siguientes requisitos (Lin, 1 998): i. Cuando las dos unidades son idénticas, el valor de la similitud debe ser máximo. ii. Dos unidades son más similares cuantos más elementos comparten. Por tanto, la similitud está relacionada con los elementos en común. iii. Dos unidades son menos similares cuantas más diferencias haya entre ellos. La similitud está relacionada con las diferencias entre ellas. 3.2.1.1. Métodos basados en Bases de Conocimientos léxicas. Se utilizan bases de conocimiento léxicas, ya sean diccionarios, tesauros, ontologías o redes semánticas: algún recurso léxico con relaciones semánticas bien de forma explícita o bien que se puedan inferir como en el caso de los diccionarios convencionales. Kozima y Furugori (1 993) evalúan la similitud semántica a partir de una red neuronal en la que los nodos son entradas del diccionario. Dos entradas tienen relación si una de ellas se usa para definir a la otra. Sobre esta red se calcula la similitud a partir de la activación de los nodos.
121 Otros autores como Morris y Hirst (1 998) utilizan un tesauros, que agrupa las palabras sin especificar qué tipo de relación motiva el agrupamiento. Dos palabras se consideran cercanas semánticamente si comparten alguna categoría, están en la misma subcategoría, etc. Existe un grupo importante de medidas de similitud que toman como espacio topológico en el que proyectar las palabras a WordNet red semántica de la lengua inglesa. Se agrupan las palabras en conjuntos de sinónimos o SynSets, que proporcionan definiciones cortas y generales, y almacenan las relaciones semánticas entre estos conjuntos de sinónimos. De esta base de datos también se ha creado una versión multilingüe para varios idiomas europeos (Holandés, Italiano, Español, Alemán, Francés, Checo y Estonio) llamada EuroWordNet. Si bien este grupo de técnicas considera la similitud semántica en función de la longitud del camino que las une en el grafo que representa la red, esta aproximación es demasiado simple. Considerar exclusivamente el número de arcos que unen los synsets equivale a asumir que todas las taxonomías registradas son equidistantes, sin embargo, la estructura de la red no cumple con tal suposición. Es necesario determinar pesos que reequilibren su naturaleza no homogénea, de forma que los parámetros a contemplar incluyan tanto la longitud del camino Figura 3-2 Grafos de las consultas albañil y empresa en EuroWordNet.
122 como la especificidad de los sentidos de las palabras en el camino (Agirre, 1 995). Este problema se ilustra en (Resnik, 1 999) en donde se presentan los enlaces: Rabbit Ears is-a Television Antenna, o Phytoplankton is-a Living Thing. Para resolver este problema existen diferentes propuestas que incorporan datos adicionales, como la profundidad del concepto en la jerarquía. A profundidades mayores se deben obtener mayores puntuaciones; también deben ser más próximos semánticamente hablando aquellos que se encuentren en zonas de mayor concentración de conceptos frente a los que estén en zonas dispersas (Agirre, 1 995). 3.2.1.2. A partir de los contextos de uso El segundo grupo de técnicas para la detección de similitud semántica se basa en la información que se puede extraer de las palabras a partir de los contextos en que se emplean. Su uso exige como requisito indispensable disponer de corpus extensos para que las medidas sean fiables y precisas. Se evalúa la relación de las palabras mediante distancias que representan la similitud o la fuerza de la relación existente se basan en la frecuencia de aparición conjunta en los textos. En general, la idea subyacente es que la relación semántica es más fuerte en aquellos grupos de palabras cuyos contextos estén próximos. Se proyecta la información lingüística sobre un espacio vectorial N dimensional, habitualmente vectores de coocurrencias en el corpus. Sobre dicho espacio se calculan distancias geométricas entre sus elementos: distancia euclídea, distancia de Manhattan, distancia del coseno, etc. Autores como Manning y Schütze (1 999) indican una representación de vectores binarios, a los que se pueden aplicar la distancia de Dice, Jaccard, etc. Además de poder aplicar las distancias anteriores, cuando los vectores representan distribuciones de probabilidad de los objetos lingüísticos en el corpus, surgen otras distancias que explotan las propiedades inherentes a las distribuciones de probabilidad: la Divergencia de Jensen-Shannon, el coeficiente de correlación de Pearson, la divergencia de Kullback-Leibler, o el coeficiente de -Kendall, entre otras. 3.3. Obtención de clases léxicas Se pretende construir los grupos semánticos a partir de los datos registrados en la BDD de combinaciones léxicas. El problema que se pretende resolver sobre nuestros datos es el
123 siguiente: dada una forma canónica, agrupar en clases semánticas el conjunto de formas canónicas con las que aparece en alguna de las estructuras admisibles para colocaciones del español. Por ejemplo, dada una forma canónica con categoría gramatical verbo, se deben obtener, en caso de que existan, grupos dentro de la bolsa de sustantivos con los que aparece en las combinaciones verbo + sustantivo. El criterio que regirá su formación es la similitud semántica entre sus miembros. Otra posibilidad, que consideraremos de forma independiente sería realizar agrupamientos entre los adverbios con los que se ha registrado en el corpus. 3.3.1. Agrupamiento mediante técnicas estadísticas En este epígrafe revisamos dos técnicas estadísticas que permiten generar grupos semánticos, analizando si su aplicación sobre los datos que manejamos es recomendable. Por una parte se presenta el análisis clúster, dentro de las técnicas convencionales de clasificación estadística, y por otro el análisis de semántica latente. 3.3.1.1. Análisis clúster La generación de grupos semánticos o clases léxicas puede resolverse a partir de técnicas basadas en análisis clúster, tradicionalmente utilizadas para la creación de clasificaciones. Se conoce como análisis clúster al conjunto de técnicas multivalentes diseñadas para extraer grupos o clústeres de un conjunto de observaciones de un conjunto de variables aleatorias. Estos métodos dividen un conjunto de objetos en grupos o clústeres con cohesión interna, es decir, los objetos en un mismo grupo serán muy similares entre sí. Por otra parte, también se impone la restricción de aislamiento externo del grupo, es decir, que los elementos en clústeres distintos sean muy diferentes. En esta técnica se hace fundamental la selección de la medida de similitud, siendo importante que se determine en función de una distancia :→ debe verificar (Rodríguez, 2003): , 0 , 0 , , , , , Generalmente, los métodos de análisis clúster se clasifican en jerárquicos o no jeráquicos. En el primer caso se presupone una estructura jerárquica en la clasificación, además los resultados son muy sensibles a los outliers. Dadas las características de la distribución de las combinaciones en las que interviene una forma canónica, totalmente asimétrica y con presencia de valores extremos hace que se descarten estas técnicas en este problema. En el segundo, no se
124 impone ningún tipo de estructura de antemano, pero se debe prefijar el número de clases que se van a generar. Lo más común en estos casos es aplicar algún método de reasignación: se asignan individuos a una configuración inicial de grupos y a lo largo de las sucesivas iteraciones se permite reasignar individuos a grupos, de manera que se optimice el criterio de selección; el proceso acaba cuando no existan objetos que al ser reasignados provoquen mejoras. Es necesario por tanto, determinar algún mecanismo de evaluación de la bondad de la configuración de los grupos que permita establecer la reasignación de individuos orientada a la optimización. Con este fin se define el centroide del clúster como representante de la clase en cada iteración, consistiendo en el vector formado por la media aritmética de los valores en el grupo de cada dimensión. Cada componente del centroide del grupo i es el promedio de los valores de la variable correspondiente a esa componente para todos los elementos que conforman dicho grupo. Es decir: 1 Cuánto de bueno es el agrupamiento se mide a partir de este vector, los elementos del grupo tienen que tener distancias pequeñas al centroide y los grupos deben estar lo más diferenciados posible, lo cual se puede lograr maximizando las distancias entre centroides. En cualquier caso, se hace necesario medir las distancias entre los objetos que se pretende agrupar, para lo que se dispone de diferentes funciones tanto para variables cuantitativas como categóricas. En este caso se establece como contexto de una forma canónica dada, todas las formas canónicas con las que aparece en alguna combinación en el corpus. La Tabla 3-7 ilustra los contextos de algunos sustantivos que se revelan como colocaciones del verbo sentir. Cada entrada corresponde a la frecuencia de coocurrencia de las dos formas canónicas, también se pueden utilizar las de frecuencias relativas. En el ejemplo seleccionado, la construcción de la matriz de contextos conlleva extraer todas las bases del verbo sentir, éstas constituirán las filas, es decir, los objetos a clasificar. Las columnas, o variables utilizadas para clasificarlas, corresponden a cada uno de los verbos o colocativos con los que aparecen esas bases. Algoritmos de análisis clúster sobre esta matriz permiten obtener agrupamientos bajo el principio de que sustantivos similares se usan en contextos similares: los grupos se construyen bajo la premisa de que sustantivos similares combinan con verbos similares.
125 Sustantivo abajar abalanzar abandoner abarcar abatir abismar ablandar abordar … escalofrío 12 miedo 79 11 322 4 38 29 4 6 náusea 6 terror 34 3 111 9 35 Tabla 3-7 Extracto de vectores de contexto de algunos sustantivos en las colocaciones sentir + Sust. La matriz de vectores de contexto del verbo sentir, restringida a los sustantivos que se detectan como colocaciones desde el punto de vista frecuentista, es de 125457494; cuando se trata del verbo palpitar, la matriz es de rango 6616955. Si se restringen los casos a aquellos que aparecen al menos 10 veces en el corpus se obtiene una matriz de 82855606 y 2244955 respectivamente. La construcción de dicha matriz a partir de la BDD es inviable en tiempo real, para cada caso es necesario extraer la bolsa de palabras base y cada una de las formas canónicas que combinan con ellas, luego se asignará la frecuencia de coocurrencia en caso de que la combinación exista en el corpus o 0 en caso contrario. Además se aconseja aplicar alguna técnica de reducción de dimensiones para poder aplicar los algoritmos de análisis clúster, en caso contrario sobre matrices tan extensas sería muy costoso computacionalmente hablando. Nuevamente surgen las restricciones marcadas por el gran volumen de datos que se maneja, lo que obliga a elegir una técnica viable desde el punto de vista del tratamiento computacional. Dado que el objetivo es obtener clases léxicas se opta por valorar el Análisis de Semántica Latente, que es una técnica de reducción de dimensiones capaz de extraer conceptos y agrupar términos en torno a ellos. 3.3.1.2. Análisis de Semántica Latente El Análisis de Semántica Latente (LSA, del inglés Latent Semantic Analysis) utiliza la representación de contextos de términos o palabras para determinar la similaridad de significados de palabras y conjuntos de palabras (Landauer, T. K., Foltz, P.W., Laham, 1998). Esta técnica, diseñada para aplicarse a grandes corpus textuales, revela conceptos implícitos en los datos, y permite representar relaciones semánticas entre documentos, palabras o palabras con documentos. En este caso documentos hace referencia al contexto que se considere para cada término o palabra. En LSA se parte de la matriz de términos-documentos o matriz de contextos, en la que cada fila representa las frecuencias de aparición de un término en el contexto (documento)
132 Gráfico 3-22 Zoom 2, resultados de palpitar G3
133 Gráfico 3-23 Zoom 3, resultados de palpitar Si bien en los grupos obtenidos, el método del análisis de la semántica latente resulta adecuado, hay varias cuestiones que no aconsejan aplicarlo sobre los registros extraídos del corpus. Por una parte, generar la matriz de datos que se requiere consume un tiempo inasumible en una aplicación de consulta de información de características combinatorias del español. Por otra parte, los resultados conllevan la supervisión manual para establecer la configuración de grupos. 3.3.2. Obtención de grupos semánticos a partir de la relación predicado-argumentos La obtención de clases léxicas mediante las técnicas expuestas anteriormente requiere un tiempo de cómputo y recursos de memoria excesivos, además, se hace necesaria la toma de decisiones como el número de dimensiones o conceptos presentes, para lo que no hay un criterio claro. Abundando en los aspectos negativos, no quedan claramente marcados los grupos, por ejemplo, en el caso de perpetrar (Gráfico 3-19) se observan muy próximas las formas canónicas G4 G5
134 hombre-mujer, nuevo y matanza, o persona y robo. También se suma a estas dificultades la necesidad de reconstruir en cada caso la matriz de contextos a partir de los datos registrados en la BD. Por esta razón se acomete la solución del problema a partir del modelo lingüístico de la selección predicado-argumentos, mediante las preferencias de selección. En algunos trabajos de desambiguación semántica de palabras se utilizan medidas de las relaciones entre un predicado y sus argumentos. En Resnik (1 999) se define como asociación de selección una medida entre verbos y sustantivos que se formaliza según la teoría de la información. Utiliza probabilidades que se estiman a partir de las coocurrencias de un predicado dado con los elementos de una determinada clase de sustantivos. Las clases están formadas por los elementos en synsets de WordNet que contienen hipónimos de un sustantivo o por synsets correspondientes a hiperónimos del mismo. También en Agirre (1 994) se evalúa una medida similar, aunque establece la asociación entre clases de predicados con clases de argumentos. El método de Resnik requiere disponer de un recurso léxico que provea de clases semánticas ya establecidas, para tal fin se propone utilizar algún Diccionario Ideológico del español como base de conocimiento léxico contrastada por los lingüistas. 3.3.3. Diccionarios Ideológicos, bases de conocimientos léxicas. Un diccionario ideológico agrupa las palabras en torno a una idea, según un orden conceptual. Representan, por tanto, una fuente de información sobre relaciones semánticas similares a los tesauros. En español se dispone del Diccionario Ideológico Vox (DIV) (Vox, 1 995) y del Diccionario Ideológico de la Lengua Española de Julio Casares (DILE) (Casares, 1 959). Ya que se propone el uso de este tipo de recursos en la extracción de preferencias de selección en sustitución de WordNet o su equivalente EuroWordNet en español, en los siguientes epígrafes se describe la estructura de ambos diccionarios. 3.3.3.1. Estructura del Diccionario Ideológico Vox. El Diccionario Ideológico Vox se estructura en varios niveles diferentes (Figura 3-3): Cuadro General, recoge los grandes grupos de ideas: Relaciones Generales, Materia, Naturaleza, Seres Vivos, Individuo y Modos de Vida. Parte Sinóptica: Incluye los cuadros, corresponde a otro nivel de agrupación y representan identificadores de títulos de grupos conceptuales (Tabla 3-8). Parte Analógica: Aparecen todas las palabras ordenadas en grupos según un criterio conceptual. Dentro de los grupos pueden aparecer subgrupos, motivados por una mayor afinidad entre sus componentes y también marcadores que representan relaciones entre
135 grupos y subgrupos, sin especificar el tipo. Los grupos a su vez se dividen en bloques por categoría gramatical de los elementos (Tabla 3-9). Se presentan las palabras como se asocian en la mente del hablante (Vox, 1 995). Cuadro Grupo dolor cantar, doler, entortijarse, entrepunzar, latir, punzar, rabiar, suposición, traspasar, ver las estrellas, sentir juicio cantar, doler, entortijarse, entrepunzar, latir, punzar, rabiar, suposición, traspasar, ver las estrellas, sentir juicio conceptualizar, conceptuar, conocerse, considerar, contar, creer, dar por, decir, encasillar, entender, estimar, juzgar, opinar , pasar, reputar, sentir, tenerse, tomar por, ver, reconocerse sentimiento afección, corazón, entretelas, podredumbre, psicología, sentir, sentimiento sentimiento acoger, cobrar, coger, concebir, dar, morir, anidar tristeza deplorar, llorar, sentir balbuceo declamar, monologar, recitar, responder, sentir Tabla 3-8 Cuadros y grupos en los que aparece sentir Dolor acritud, analgesia, clavo, dolor, puntada, punzada, ramalazo, rayo, sinalgia, tormento, yaya agujetas, ciática, entuertos, ijada, lumbago, mastalgia, mialgia, ostealgia, retortijón cálculos, cólico, cólico nefrítico, cólico renal, litiasis, mal de piedra arenillas, bezoar, cálculo, piedra ardor, comecome, comezón, escozor, fogaje, fuego, hormiguilla, hormiguillo, picazón, picor, piquiña, prurito, quemazón, rascazón agudo, dolorido, doloroso, lacerante, lancinante, pedregoso, pruriginoso, terebrante, urente indolente, indoloro cantar, entortijarse, entrepunzar, latir, punzar, rabiar, sentir, traspasar, ver las estrellas abrasar, comer, enardecerse, encender, escaldarse, escarabajear, irritar, picar, quemar Tabla 3-9 Grupos en el Cuadro dolor
136 3.3.3.2. Diccionario Ideológico Casares En la parte sinóptica de este diccionario, se establecen los distintos niveles de agrupamiento que se emplean. En un primer nivel se tienen las grandes materias que estructuran la clasificación (Figura 3-4), donde se encuadran las 38 categorías básicas en las que se distribuyen las palabras; estas categorías se denominan cuadros y se subdividen a su vez en 2000 grupos de palabras conceptualmente relacionadas (Tabla 3-10). Figura 3-4 Grandes materias, Diccionario Ideológico Casares El universo Mundo inorgánico Mundo orgánico Reino vegetal Reino animal Los irracionales El hombre El individuo Como ser vivo Como sujeto racional Como agente La sociedad Comunicación Instituciones sociales Industrias y oficios Figura 3-3 Estructura del Diccionario Ideológico VOX
137 Cuadro Cuadro Religión Colocación Física y Química Tiempo Geografía, Astronomía, Meteorología Cantidad Geología, Mineralogía Intelección Botánica Apreciación, juicio Zoología Voluntad Anatomía Conducta Fisiología Acción Medicina Lenguaje Alimentación Arte Vestido Estado, Nación Vivienda Costumbres Sensibilidad, Sentidos Derecho y Justicia Sentimientos Propiedad Existencia, Cambio Milicia Relación, Orden, Causalidad Comercio, Banca y Bolsa Espacio Agricultura, Zootecnia Forma Zootecnia Movimiento Transportes Tabla 3-10 Cuadros de la clasificación del DIC . En la parte analógica se enumeran los grupos, divididos en subgrupos, y encabezados por un término, normalmente sustantivo, que corresponde con los que se detallan en los diferentes cuadros. Puede incluir remisiones a otros grupos relacionados conceptualmente a través de elementos marcados en negrilla para indicar que son otras cabeceras. También se diferencian subgrupos según la categoría gramatical de sus componentes: sustantivos, verbos, adjetivos, adverbios, modos adverbiales, preposiciones e interjecciones. En la parte alfabética se recogen los significados de todas las palabras que aparecen en la parte analógica y se muestran referencias a los grupos a los que pertenece.
138 Cuadro Encabezado Grupo Conducta, lenguaje ademán accionar, amanerarse, chistar, cocar, enzainarse, expresar, gestear, gesticular, gesticular, guiñar, guiznar, hablar con los ojos, hablar por señas, hacer cocos, hacer del ojo, hacer figuras, hacer telégrafos, momear, pujar, remilgarse, sentir, timarse, torcer el gesto Sentimientos aflicción ahogarse en poco agua, añorar, apurarse, atravesarse un nudo en la garganta, atribularse, caerse, cariñar, clamar a Dios, cubrirse el corazón, dar el pésame, deplorar, deprimirse, desolarse, dolerse, echar de menos, endecharse, engurruñarse, enmantarse, ensombrecerse, entristecer, lamentar, llorar lágrimas de sangre, llorar lágrimas de sangre, no caber el corazón en el pecho, nublársele el cielo, padecer, partirse el alma, pasar la pena negra, pasar las penas del purgatorio, penarse, poderse ahogar con un cabello, sentir , sentir de muerte Sentimientos, conducta arrepentimiento acusar la conciencia, arrepentirse, compungir, compungirse, concomerse, corroer, deplorar, dolerse, escarabajear la conciencia, lamentar, llorar, llorar con lágrimas de sangre, morderse las manos, pesarle a uno, recomerse, sentir Sensibilidad, sentidos audición abrir el oído, abrir los oídos, abrir tanto el oído, aguzar el sentido, aguzar las orejas, aplicar el oído, atender, auscultar, beber las palabras, dar oídos, dejarse de oír, entreoír, escuchar, estar colgado de los labios, estar pendiente de la boca, herir el oído, no perder ripio, oír, perderse, sentir, taparse los oídos, trasoír Sentimientos, costumbres compasión ablandarse, adolecer, apiadarse, arrancársele a uno las entrañas, compadecer, compadecerse, compartir, compungirse, condolerse, conmoverse, contristarse, deplorar, dolerse, emblandecerse, lamentar, lastimarse, sentir Tabla 3-11 Cuadros y Encabezados de Grupo para el verbo sentir en D.I.C (I)
139 Cuadro Encabezado Grupo Intelección, conducta conciencia acusar la conciencia, advertir, ajustarse con la conciencia, apercibir, argüir la conciencia, caer en la cuenta, cargar la conciencia, comprender, conocerse, darse cuenta, encargar la conciencia, enconar, entenderse, escarabajear, escarbar, escrupulizar, percibir, reflexionar, remorder, sentir, tener conciencia de Intelección experiencia advertir, aprender, ensayar, experimentar, foguear, notar, sentir, sufrir, tocar, ver ApreciaciónJuicio juicio apreciar, calificar, censurar, conocer de, conocerse, considerar, creer, criticar, dictaminar, discernir, echar el fallo, emitir, enjuiciar, entender en, estimar, existimar, fallar, hacer distinción, informar, juzgar, librar, opinar, parecerle a uno, reputar, sentir, someter, tener por, tomarle las medidas (a uno), valorar Acción pasividad aceptar, aguantar, experimentar, expiar, incurrir en, lastar, padecer, pasar, pasar por las picas, penar, percibir, permitir, recibir, sentir, ser objeto de, soportar, sufrir, tener buenas espaldas, tolerar, tomar, tomarle a uno Intelección, conducta previsión agorar, antever, anunciar, aprevenir, augurar, barruntar, darle el aire de, darle el corazón, decirle el corazón, haberse tragado, mirar las cosas con anteojo de aumento, mirar las cosas con anteojo de larga vista, ominar, preconocer, predecir, prenotar, presentir, presumir, prevenir, prever, pronosticar, remusgar, sentir, sospechar, tenerse tragado, ver, ver las cosas con anteojo de aumento, ver las cosas con anteojo de larga vista Fisiología, Sensibilidadsentidos, sentimientos sensibilidad advertir, apreciar, entrar en, experimentar, impresionarse, notar, observar, padecer, percibir, sentir, sufrir Sentimientos sentimiento abrigar, cobrar, coger, concebir, experimentar, profesar, sentir, tener, tomar Tabla 3-12 Cuadros y Encabezados de Grupo para el verbo sentir en D.I.C (II)
140 3.3.4. Extracción de preferencias de selección En este apartado se expone la medida de asociación de selección (Resnik, 1 993), su adaptación a las Bases de Conocimiento sobre las que se trabaja y los resultados obtenidos. 3.3.4.1. Asociación de selección La medida de asociación de selección de Resnik cuantifica las restricciones de selección de un predicado respecto a una clase de argumentos. Este valor surge a partir de la entropía de una variable aleatoria que se utiliza como herramienta para determinar qué cantidad de incertidumbre se tiene sobre los argumentos que pudieran aparecer junto a un predicado dado, es decir, qué “ha sucedido”. Este artificio se construye sobre la Teoría de la Información, que se fundamenta en la idea de que un suceso poco probable aporta más información que uno altamente probable. Por ejemplo, el verbo palpitar aporta más información sobre qué palabras se pueden esperar en su contexto que el verbo dar. La cantidad de información de un suceso dada por: log1 La entropía de una variable aleatoria es la información media que aporta la misma: ∙log1 La entropía relativa, dadas dos distribuciones de probabilidad ,: ∥ ∙log También es conocida como la distancia de Kullback-Leibler y verifica: ∥0 ∥0⇔,idénticas ∥∑ ∙log log =∑ ∙ es el promedio de diferencias de cantidad de información.
141 Se interpreta como el coste, en bits de información, que tiene el hecho de asumir que la distribución de probabilidad es cuando en realidad es . Resnik recurre a la entropía relativa para evaluar si existen diferencias entre la distribución de probabilidades de una clase léxica de argumentos , supuesto que ha sucedido el predicado , frente a la probabilidad de la clase sin tal supuesto, es decir: |∥| ∙log| Siendo: ladistribucióndelaclaseC,odistribución a priori |ladistribucióndelaclaseC,conocido,distribución a posteriori. Si un predicado restringe sus argumentos, selecciona una clase léxica, por tanto, las distribuciones a priori y posteriori deben diferir. Además, el rango de selección puede ser amplio o estrecho según la fuerza de la restricción que imponga a sus argumentos. En caso de rangos estrechos, la diferencia entre las dos distribuciones será grande, la distribución a priori debe ser muy diferente a la distribución a posteriori. Por este motivo se denomina fuerza de la selección a |∥, y es el coste de asumir que no tiene ninguna motivación para aparecer en el contexto de . Las clases a las que hace referencia son synsets de hipónimos o hiperónimos del lexicón. Sin embargo, un sustantivo consta en un conjunto de synsets en la taxonomía, correspondientes a los diferentes sentidos. La asociación de selección, A(pi,C), de un predicado, pi, se define para cada clase, C, como la contribución de la clase en la fuerza de la selección, ponderada por el factor de escala respecto al total normaliza el indicador y permite comparar los valores independientemente de la fuerza de la selección. ,|log| ∑|∙ log| El numerador corresponde a cada sumando de |∥ y el denominador es dicho valor.