scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

El trabajo realizado está dividido en dos fases principales. Primero se estudia la comprensibilidad de sentencias escritas y la representación en planos bidimensionales de las situaciones referidas por dichas sentencias. Posteriormente, el modelo desarrollado se utiliza para estudiar su adecuación en tareas de Traducción Máquina en las que se ha de tener en cuenta información contextual. En la primera fase del proyecto se desarrolla un modelo que posibilita la representación de situaciones en un micromundo utilizando el mapa auto-organizativo SOM y el procesamiento de frases sencillas que describen dichas situaciones mediante el uso de una red neuronal recurrente simple (SRN). El mapa SOM es entrenado sobre un conjunto de situaciones ejemplo que conforman la experiencia del sistema y posibilitan la representación en el espacio de salida SOM del modelo cualquier situación posible. A continuación, un conjunto de frases es entrenado mediante la red SRN para posibilitar la transformación de frases a situaciones, resultando en su conjunto un modelo que recibe como valor de entrada una frase describiendo una determinada situación y muestra como salida, en el caso ideal, la representación de dicha situación sobre el mapa SOM. La red SRN permite contar con información contextual basada en la información recibida en entradas previas, por lo que el modelo desarrollado resulta adecuado para tareas relacionadas con el procesamiento de lenguaje y, más concretamente, con la comprensión de frases e historias. Además, el espacio SOM de salida del modelo resulta ser independiente tanto del lenguaje utilizado en la entrada y su estructura proposicional como del número de situaciones que forman el conjunto de entrenamiento o experiencia, posibilitando la formación de un espacio sobre el cual poder realizar razonamientos lógicos básicos como si de un diagrama Venn se tratara. En los experimentos realizados se muestra cómo el modelo no sólo es capaz de comprender frases a las que había sido entrenado, sino que también es capaz de generalizar, comprendiendo frases que no habían sido presentadas en el entrenamiento y que describen situaciones nuevas. En la segunda fase del proyecto se diseña e implementa un sistema basado en el trabajo realizado en la primera fase con el que se pretende estudiar qué posibilidades ofrece el modelo siendo base o componente de un modelo que permita llevar a cabo tareas de Traducción Máquina (MT), prestando especial atención a aquellos casos donde la frase o palabra de entrada puede presentar diversas traducciones y esta ambigüedad ha de resolverse atendiendo al contexto de la situación. El espacio de salida SOM se utiliza ahora como espacio único de representación conceptual compartido por dos microlenguajes que difieren en la manera en la que relacionan los símbolos léxicos con los conceptos, uno de ellos basado en el español y el otro en el inglés. Dicho espacio situacional compartido por ambos microlenguajes realiza la función de componente intermedio en la tarea de traducción a partir del cual se extrae información contextual y conceptual de la situación descrita por la frase de entrada, útil para producir como salida la nueva frase traducida. De manera paralela al entrenamiento del espacio SOM, dos nuevos mapas SOM de mismo tamaño, uno para cada microlenguaje, son entrenados tomando como entrada la información conceptual presente en las situaciones del conjunto experiencia. Cada uno de estos mapas presenta la organización de las palabras del microlenguaje en base a su relación conceptual, de forma que aquellas palabras que poseen mayor similitud conceptual y/o son utilizadas para expresar situaciones similares aparecen dispuestas más próximas en estos mapas de vocabulario, que se utilizan en el proceso de producción de la frase traducida. Este proyecto es una extensión de un trabajo publicado junto con el profesor Timo Honkela en la Conferencia Internacional de Redes Neuronales Artificiales (ICANN) de Septiembre de 2010: Elementary Logical Reasoning in the SOM Output Space. Ramón Letosa, Jorge; Honkela, Timo

Full text

Aalto University School of Science and Technology Faculty of Information and Natural Sciences Degree programme of Computer Science and Engineering Espoo (Finland) Director: Timo Honkela Universidad de Zaragoza Centro Politécnico Superior Informática e Ingeniería de Sistemas Ingeniería Informática Superior Zaragoza (España) Tutor: Manuel González Bedía Jorge Ramón Letosa Modelo de Comprensión de Frases en un Micromundo y Posible Aplicación al Campo de la Traducción Máquina Proyecto Fin de Carrera i Modelo de Comprensión de Frases en un Micromundo y Posible Aplicación al Campo de la Traducción Máquina RESUMEN El trabajo realizado está dividido en dos fases principales. Primero se estudia la comprensibilidad de sentencias escritas y la representación en planos bidimensionales de las situaciones referidas por dichas sentencias. Posteriormente, el modelo desarrollado se utiliza para estudiar su adecuación en tareas de Traducción Máquina en las que se ha de tener en cuenta información contextual. En la primera fase del proyecto se desarrolla un modelo que posibilita la representación de situaciones en un micromundo utilizando el mapa auto-organizativo SOM y el procesamiento de frases sencillas que describen dichas situaciones mediante el uso de una red neuronal recurrente simple (SRN). El mapa SOM es entrenado sobre un conjunto de situaciones ejemplo que conforman la experiencia del sistema y posibilitan la representación en el espacio de salida SOM del modelo cualquier situación posible. A continuación, un conjunto de frases es entrenado mediante la red SRN para posibilitar la transformación de frases a situaciones, resultando en su conjunto un modelo que recibe como valor de entrada una frase describiendo una determinada situación y muestra como salida, en el caso ideal, la representación de dicha situación sobre el mapa SOM. La red SRN permite contar con información contextual basada en la información recibida en entradas previas, por lo que el modelo desarrollado resulta adecuado para tareas relacionadas con el procesamiento de lenguaje y, más concretamente, con la comprensión de frases e historias. Además, el espacio SOM de salida del modelo resulta ser independiente tanto del lenguaje utilizado en la entrada y su estructura proposicional como del número de situaciones que forman el conjunto de entrenamiento o experiencia, posibilitando la formación de un espacio sobre el cual poder realizar razonamientos lógicos básicos como si de un diagrama Venn se tratara. En los experimentos realizados se muestra cómo el modelo no sólo es capaz de comprender frases a las que había sido entrenado, sino que también es capaz de generalizar, comprendiendo frases que no habían sido presentadas en el entrenamiento y que describen situaciones nuevas. En la segunda fase del proyecto se diseña e implementa un sistema basado en el trabajo realizado en la primera fase con el que se pretende estudiar qué posibilidades ofrece el modelo siendo base o componente de un modelo que permita llevar a cabo tareas de Traducción Máquina (MT), prestando especial atención a aquellos casos donde la frase o palabra de entrada puede presentar diversas traducciones y esta ambigüedad ha de resolverse atendiendo al contexto de la situación. El espacio de salida SOM se utiliza ahora como espacio único de representación conceptual compartido por dos microlenguajes que difieren en la manera en la que relacionan los símbolos léxicos con los conceptos, uno de ellos basado en el español y el otro en el inglés. Dicho espacio situacional compartido por ambos microlenguajes realiza la función de componente intermedio en la tarea de traducción a partir del cual se extrae información contextual y conceptual de la situación descrita por la frase de entrada, útil para producir como salida la nueva frase traducida. De manera paralela al entrenamiento del espacio SOM, dos nuevos mapas SOM de mismo tamaño, uno para cada microlenguaje, son entrenados tomando como entrada la información conceptual presente en las situaciones del conjunto experiencia. Cada uno de estos mapas presenta la organización de las palabras del microlenguaje en base a su relación conceptual, de forma que aquellas palabras que poseen mayor similitud conceptual y/o son utilizadas para expresar situaciones similares aparecen dispuestas más próximas en estos mapas de vocabulario, que se utilizan en el proceso de producción de la frase traducida. Este proyecto es una extensión de un trabajo publicado junto con el profesor Timo Honkela en la Conferencia Internacional de Redes Neuronales Artificiales (ICANN) de Septiembre de 2010: Elementary Logical Reasoning in the SOM Output Space. Abreviaturas y Acrónimos SOM Self-Organizing Map SRN Simple Recurrent Network NLP Natural Language Processing PLN Procesamiento de Lenguaje Natural MT Machine Translation iii Índice general Abreviaturas y Acrónimos iii 1. Introducción 1 1.1. Estructura del Proyecto . . . . . . . . . . . . . . . . . . . . . 4 2. Modelado del Conocimiento para PLN 5 2.1. CasoMonolingüe ......................... 5 2.1.1. Denición del Micromundo . . . . . . . . . . . . . . . . 5 2.1.2. Representación de Situaciones de Micromundo . . . . . 7 2.1.3. Valores de Conanza . . . . . . . . . . . . . . . . . . . 10 2.1.4. Comprensión de Frases . . . . . . . . . . . . . . . . . . 10 2.2. CasoBilingüe........................... 12 2.2.1. Mapa Situacional . . . . . . . . . . . . . . . . . . . . . 12 2.2.2. Mapas de Palabras . . . . . . . . . . . . . . . . . . . . 15 2.2.3. Cómo Obtener la Traducción . . . . . . . . . . . . . . 20 3. Experimentos 28 3.1. Formación de Situaciones . . . . . . . . . . . . . . . . . . . . . 28 3.2. Entrenamiento de Frases . . . . . . . . . . . . . . . . . . . . . 29 3.3. Traducción de Frases . . . . . . . . . . . . . . . . . . . . . . . 32 4. Conclusiones y discusión 37 4.1. Discusión ............................. 39 4.2. TrabajoFuturo .......................... 40 iv A. Métodos 44 B. Elementary Logical Reasoning in the SOM Output Space 54 v Índice de cuadros 2.1. Diecisiete eventos básicos en el micromundo y su signicado. . 6 2.2. Grámatica del microlenguaje. . . . . . . . . . . . . . . . . . . 11 2.3. 42 conceptos básicos en el micromundo y su signicado. . . . . 13 2.4. Gramática inglesa. . . . . . . . . . . . . . . . . . . . . . . . . 15 2.5. Gramática española. . . . . . . . . . . . . . . . . . . . . . . . 16 3.1. Conjunto de nuevas frases mencionando situaciones ya presentes en el conjunto de entrenamiento. . . . . . . . . . . . . . 31 3.2. Conjunto de nuevas frases mencionando nuevas situaciones. . . 31 vi Índice de guras 2.1. Razonamiento lógico básico al nivel de salida SOM. . . . . . . 8 2.2. Los planos de componentes de un mapa situacional. . . . . . . 9 2.3. Conjunción de los dos eventos básicos lcHome y lcConcert. 9 2.4. Los planos de componentes de un mapa situacional. . . . . . . 14 2.5. Posible traducción a aplicar para cada palabra en ambos microlenguajes............................. 17 2.6. Correspondencia usada entre conceptos y palabras y organización de los conceptos. Los elementos en negrita son conceptos de primer nivel, los cuales están directamente relacionados con una palabra a su derecha, coloreada en rojo para el idioma inglés y en verde para el conjunto español. El concepto person es el único en todo el conjunto que no pertenece al subconjunto de conceptos de primer nivel y está relacionado directamente con una palabra. . . . . . . . . . . . . . . . . . . 19 2.7. Mapas de vocabulario para ambos microlenguajes, inglés y español. .............................. 21 2.8. Máscaras de rol para el microlenguaje español. . . . . . . . . . 24 2.9. Mapas de vocabulario incluyendo información sobre roles para ambos microlenguajes, inglés y español. . . . . . . . . . . . . . 25 3.1. Situaciones ejemplo denidas a partir de la combinación de proposiciones básicas. . . . . . . . . . . . . . . . . . . . . . . . 28 3.2. Valores de la conjunción de todas las combinaciones de eventos p y q , donde p6=q . ........................ 29 3.3. Resultados de acierto para cada palabra al traducir frases en inglés. El color rojo indica el total de apariciones en las frases de entrada, mientras el azul el número total de aciertos. . . . . 33 vii 3.4. Resultados de acierto para cada palabra al traducir frases en español. El color rojo indica el total de apariciones en las frases de entrada, mientras el azul el número total de aciertos. . . . . 34 3.5. Resultados de acierto al traducir frases en inglés. El color azul indica el número total de aciertos, el color rojo el número de errores ligeros y el color amarillo son errores graves. . . . . . . 35 3.6. Resultados de acierto al traducir frases en español. El color azul indica el número total de aciertos, el color rojo el número de errores ligeros y el color amarillo son errores graves. . . . . 36 A.1. Arquitectura SOM. . . . . . . . . . . . . . . . . . . . . . . . . 45 A.2. Celdas vecinas, mostrando un decrecimiento monótono. En el paso k , la función Nq(k) cubre las celdas vecinas coloreadas en gris, naranja y rojo. Para el siguiente paso, k+ 1 , el conjunto de vecinos cubre las celdasnaranjas y rojas y, nalmente, para el paso k+ 2 el conjunto ha sido reducido a las celdas rojas. . 46 A.3. Arquitectura SRN. . . . . . . . . . . . . . . . . . . . . . . . . 50 A.4. Arquitectura SRN en este trabajo. La capa de entrada muestra una representación localista de cada palabra, mientras los vectores coloreados expresan representación distribuida. . . . . 53 viii Capítulo 1 Introducción La mayor parte de las frases describen un escenario de acontecimientos o eventos en el mundo. De la comprensión de una de esas frases se deriva la construcción de una representación mental de ese escenario o situación a la cual se reere la frase. Esta representación situacional es comparable a lo que Johnson-Laird [24] llama un modelo mental , y tiene la característica de que no es lingüistica sino que está basada en la experiencia del agente que comprende y que tiene un determinado conocimiento sobre el mundo. Aunque el objetivo del lector o la persona que escucha es construir una representación situacional, la mayoría de los modelos de comprensión de lenguaje se centran en las estructuras gramaticales o proposicionales del lenguaje, sin involucrar o involucrando mínimamente conocimiento sobre el mundo. En este trabajo, se presenta un modelo que no tiene en cuenta las estructuras proposicionales. En su lugar, el modelo implementado transforma cada frase de entrada en su correspondiente representación de la situación. El proyecto está dividido en dos estudios principales, el segundo de los cuales viene motivado por los resultados obtenidos en el primero. En la primera de las partes, una red neuronal recurrente simple (SRN) es utilizada para llevar a cabo comprensión de frases sencillas, entendidas como secuencia de palabras, construidas a partir de la denición de una microgramática en inglés que permite construir un conjunto de 396 posibles frases, cada una de las cuales describe una situación. Estas representaciones de una situación se obtienen mediante el entrenamiento no supervisado de un conjunto de situaciones ejemplo proposicionalmente denidas sobre un 'self-organizing map' (SOM) de tamaño jo. Los principales objetivos de este primer estudio son: 1 CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 8 Figura 2.1: Razonamiento lógico básico al nivel de salida SOM. Siguiendo esta idea, un Self-Organizing Map (SOM, [14]) es usado para construir automáticamente la representación del mapa de las situaciones del micromundo. Una situación en el micromundo está representada por un vector de 150 componentes. Esta implementación en la que una situacion está contenida en un vector de tamaño jo de n elementos permite una representación en la que n es independiente del tamaño del conjunto de situaciones ejemplo, aunque, al mismo tiempo, al reducir la dimensión desde k , tamaño del conjunto de situaciones ejemplo, a n= 150 , parte de la información contenida en las situaciones ejemplo se puede perder. Un vector de situación está en la forma s(p) = (s1(p), s2(p), ..., sn(p)) , donde cada si(p) tiene un valor entre 0 y 1 para cada evento p ( p puede ser, de hecho, cualquier combinación de eventos si(p) ) que indica la medida para la cual cada componente, o más precisamente, la celda en el SOM, es parte de la representación de p (véase [3]). La gura 2.2 muestra el mapa representacional para cada proposicion básica del micromundo. Como se puede observar en la gura, el patrón que representa lcHome se solapa con el patrón de lcWrites , mostrando que si LC está escribiendo un libro, LC está en su país natal. En este punto, se advierte que el área de una proposición en una representación SOM no está estrictamente denida sino de manera difusa. Por esta razón la teoría de conjunto difusos tiene que ser usada ahora para denir las correspondientes áreas de las diferentes combinaciones lógicas de proposiciones, de forma que el valor de cada celda en el mapa es dado por: si(¬p) = 1 −si(p). (2.3) si(p∧q) = si(p)si(q). (2.4) De las ecuaciones 2.3 y 2.4, es decir, negación y conjunción, todas las posibles combinaciones lógicas pueden ser obtenidas. De hecho, la disjunción p ó q CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 9 Figura 2.2: Los planos de componentes de un mapa situacional. está denida por si(p∨q) = si(p) + si(q)−si(p)si(q) , mientras si(p⊕q) = si(p) + si(q)−2si(p∧q) . La gura 2.3 muestra una situación ejemplo en la que LC da un concierto en su país natal. Esta situación es el resultado de la conjunción (ecuación 2.4) de situaciones lcConcert y lcHome. Figura 2.3: Conjunción de los dos eventos básicos lcHome y lcConcert. CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 10 2.1.3. Valores de Conanza Ya que no existe correspondencia uno a uno entre proposiciones y dimensiones en la representación tomada de situaciones, usamos belief values para calcular los resultados dados como vectores de situación. Denimos X= (x1, x2, ..., xn) como un vector de situación, con n el número de dimensiones del espacio de situaciones. Como resultado de entrenar el SOM, la probabilidad (la estimación de la probabilidad es aproximada) de que la situación X suceda en el micromundo es igual a la fracción del mapa que cubre (véase [3]). El valor de conanza τ de una situación X está denido del siguiente modo: τ(X) = 1 nΣixi. (2.5) Además, del hecho de que Pr(p(X)) = Pr(p∧X)/Pr(X) , se puede obtener la probabilidad subjetiva de una determinada proposición p dado que la situación X es el caso. El valor de conanza de p en la situación X se dene como: τ(p|X) = Σisi(p)xi Σixi . (2.6) 2.1.4. Comprensión de Frases Llegados a este punto se requiere una manera de comprender un pequeño conjunto de frases simples. En otras palabras, es necesario convertir frases de un microlenguaje a la representación de la correspondiente situación en el micromundo. Microlenguaje El microlenguaje está fromado por las siguientes 13 palabras: LC, BD, and, is, gets_success, fails, performs_concert, writes_book, records_CD, at_home, in_Europe, single, accompanied . Con estas palabras y siguiendo las reglas de la gramática en la gura 2.2, 396 frases diferentes pueden ser obtenidas re- riéndose, cada una de ellas, a una situación del micromundo. CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 11 Cuadro 2.2: Grámatica del microlenguaje. S → NP VP NP → LC | BD | LC and BD | BD and LC VP → Action [Place | and is State | and Result] → is Place [and Action | and State | and Result] → is State [and Action | Place | and Result] → Result [and Action | Place | and is State] Action → writes_book | performs_concert | records_CD Place → at_home | in_Europe | at_home and in_Europe | in_Europe and at_home State → single | accompanied Result → gets_success | fails Desde las Frases hasta las Situaciones Las frases del microlenguaje son transformadas en representaciones situacionales en forma de vector por medio del entrenamiento de una red neuronal recurrente simple [2]. La capa de entrada de la red está formada por 13 unidades, una por cada palabra en el microlenguaje. La capa oculta tiene 50 unidades y la capa de salida 150 unidades, una por cada dimensión del espacio de situaciones. Las palabras de una frase son procesadas una por una, de manera que sólo una de las unidades de entrada está activa en cada momento. De esta forma, la salida de la red se puede observar en cada paso y es posible analizar cómo la representación de las situaciones se dene a medida que la frase de entrada se completa. Resultados de la Comprensión Después de entrenar la red, los valores de conanza que fueron explicados anteriormente resultan útiles para medir el rendimiento del modelo. La idea es que la situación X(P) representada por la salida de una determida frase deberían tener un valor de conanza mayor que el valor de conanza a priori τ(p) de la situación p correspondiente a esa frase: Resultado de comprensión for p: compr(p) = τ(p|X(p)) −τ(p) τ(p|p)−τ(p). (2.7) Cuando τ(p|X(p)> τ(p) , el resultado de comprensión es mayor que 0 y CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 12 la red reeja que la frase ha sido comprendida, siendo el caso ideal cuando τ(p|X(p) = τ(p|p) , y el resultado es 1. Por otra parte, cuando el resultado es negativo la red malinterpreta la frase, y no hay comprensión cuando el resultado es igual a cero. 2.2. Caso Bilingüe 2.2.1. Mapa Situacional La idea es similar a la ya implementada en el caso monolingüe [16]. Un conjunto de situaciones ejemplo conforma los datos de entrada de un único mapa SOM del que se espera que muestre la representación de las situaciones. Sin embargo, en este caso, cada una de las situaciones del conjunto de situaciones ejemplo no está representada exactamente como una combinación de eventos básicos en el micromundo. La idea de evento básico es ahora cambiada a la idea de concepto básico de forma que una situación ejemplo se construye por la combinación de conceptos o características de dicha situación. Algunos ejemplos de conceptos básicos pueden incluir: persona, instrumento, juego, resultado, etc... La lista completa de 42 conceptos básicos usados en el caso bilingüe en este trabajo aparece en la tabla 2.3. En este punto, el proceso es idéntico al ya llevado a cabo en la sección 2.1.2 del caso monolingüe para obtener las representaciones situacionales. En este caso, un conjunto de 433 situaciones ejemplo, cada una de ellas creada de combinar los conceptos básicos como ha sido ya visto para el caso monolingüe es la entrada para un único mapa auto-organizativo de 432 unidades. Los mapas resultantes para cada uno de los conceptos básicos es mostrado en la gura 2.4. Los mismos razonamientos lógicos presentados para el caso monolingüe son ahora aplicables a las representaciones situacionales de la gura 2.4. Además, los resultados también muestran la relación que aparece entre los diferentes conceptos básicos de la tabla 2.3. De hecho, es posible ver cómo las celdas más activas de los conceptos piano (14) y guitar (17) están incluidas en la región que el concepto instr (15) cubre, en concordancia con la denición del micromundo en la cual las ideas piano y guitar son consideradas un instrumento. CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 13 Cuadro 2.3: 42 conceptos básicos en el micromundo y su signicado. No. Name Meaning No. Name Meaning 1 person Person. 22 have To have. 2 man Man. 23 fail To fail (concepts 24 and 25). 3 woman Woman. 24 miss To miss a game or fail a performance. 4 playgame To play a game/sport. 25 failexam To fail a test. 5 playinstr To play a musical instrument. 26 test Test. 6 earn To earn something. 27 takeout To take out. 7 win To win a game/competition. 28 success Success. 8 bank Bank. 29 exam Exam. 9 bench Bench (to sit on it). 30 pass To pass. 10 football Football. 31 chair Chair (to sit on it). 11 sport Sport. 32 rest To rest. 12 game Game. 33 letter Letter (written message). 13 cards Playing cards. 34 gift Gift (present). 14 piano Piano. 35 getrec To receive. 15 instr Instrument. 36 seat Seat. 16 music Music. 37 present Present (gift). 17 guitar Guitar. 38 result Result of an action. 18 money Money. 39 building Building. 19 sit To sit. 40 banking The banking sector. 20 get To get something. 41 mail Mail. 21 obtain To obtain something. 42 ownership Ownership. CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 14 Figura 2.4: Los planos de componentes de un mapa situacional. CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 15 2.2.2. Mapas de Palabras El lenguaje de una persona está basado en las experiencias subjetivas del individuo [10]. De hecho, es más probable que una persona no experta describa un evento en términos generales, mientras un experto usa términos más especícos [10]. De esta manera, el mapa conceptual de una persona y los correspondientes enlaces con el conjunto de símbolos de su vocabulario es subjetivo y, por consiguiente, puede ser diferente para cada individuo que comparta el mismo lenguaje. Este asunto desemboca en un estudio más difícil y desaante del procesamien- to del lenguaje natural cuando varios lenguajes diferentes son considerados en la comunicación. Microlenguaje Los dos lenguajes diferentes usados en este estudio son el español y el inglés. De forma similar a lo que sucedía en el caso monolingüe, se necesita una microgramática para construir las frases referidas a su correspondiente situación en le micromundo. De esta forma, cada posible situación en el micromundo puede ser expresada en cualquiera de los dos lenguajes diferentes por medio del uso de su microgramática. la denición de la gramática inglesa es mostrada en la tabla 2.4, mientras la española se puede ver en 2.5. Cuadro 2.4: Gramática inglesa. S → NP VP NP → Joe | Sophie | Somebody VP → plays [Game] [Result] → plays Instr [Result2] → Result | passes | rests → gets [Object] → sits [Seat] [Rest] → has Sth → does_exam [ResExam] Game → football | cards Result → wins | fails | gets success | earns money Instr → piano | guitar Result2 → fails | gets success | earns money Object → gift | letter | money [Bank] Bank → bank Seat → chair | bench Rest → rests Sth → piano | guitar | money | chair | letter | gift | cards ResExam → passes | fails CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 16 Cuadro 2.5: Gramática española. S → NP VP NP → Jose | Sofía | Alguien VP → juega [Game] [ResultG] → toca Instr [Result2] → saca Object1 → recibe Object2 → se_sienta [Seat] [Rest] → tiene Sth → hace_examen [ResExam] → resultG | aprueba | suspende | descansa Game → fútbol | cartas ResultG → gana | fracasa | tiene éxito | gana dinero Instr → piano | guitarra Result2 → fracasa | tiene éxito | gana dinero Object1 → dinero [Bank] Object2 → regalo | carta Bank → banco Seat → silla | banco Rest → descansa Sth → piano | guitarra | dinero | silla | carta | regalo | cartas ResExam → aprueba | suspende El microlenguaje inglés está formado por 24 palabras: Joe, Sophie, somebody, has, plays, sits, does_exam, football, gets, piano, cards, guitar, letter, gift, money,chair, bench, wins, fails, passes, earns, rests, bank, success . Por otra parte, para conseguir las frases equivalentes de la gramática inglesa en español, se necesitan 25 palabras: Jose, Sofía, alguien, tiene, juega, se_sienta, hace_examen, fútbol, recibe, saca, guitarra, toca, carta, regalo, dinero, silla, banco, gana, fracasa, suspende, aprueba, descansa, éxito, piano, cartas . Los microlenguajes previos han sido diseñados de forma que algunas características interesantes puedan ser analizadas. La mayoría de las palabras en ambos microlenguajes tienen una única traducción directa en el otro microlenguaje; de hecho, palabras en el subconjunto inglés como somebody, gift y chair están enlazadas unívocamente con alguien, regalo y silla en el subconjunto español, respectivamente. Sin embargo, existen algunas otras palabras en ambos microlenguajes que conducen a una traducción ambigua que puede ser resuelta correctamente sólamente teniendo en cuenta el contexto de la situación en el que la palabra está siendo usada. Como ejemplo, el verbo inglés to play debería ser traducido en español como jugar cuando se reere a un juego, un deporte o un rol mientras tocar tiene que ser usado cuando se reere a un instrumento musical. La lista completa de palabras en ambos microlenguajes y la posible traducción que puede ser aplicada se muestra en CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 17 Figura 2.5: Posible traducción a aplicar para cada palabra en ambos microlenguajes. la gura 2.5. Apendizaje de Vocabulario Para cada situación del conjunto de entrenamiento de entrada previamente descrito en la sección "Situational Map", una frase reriéndose a esa situación es añadida. De esta forma, la entrada del modelo puede ser vista como un par situation-sentence que permite: (1) conseguir como salida un único mapa situacional basado en los conceptos básicos que componen cada situación y (2) relacionar las palabras que aparecen en cada frase con la situación emparejada así como con los conceptos básicos de la denición del micromundo. Las situaciones ejemplo de entrada son vectores de la forma Si= (s1, s2, .., sn) , donde n es el número de conceptos básicos , n= 42 , y i= 1..m , m= 433 , el número de situaciones ejemplo en el conjunto de entrada de entrenamiento. De esta manera, en cada situación Si , el evento sj(j= 1..n) es igual a 1 si el concepto j está presente en la situación i o 0 si no lo está. Hasta este punto ya es posible crear el mapa situacional mostrado en la gura 2.4. Además, cada situación Si está acompañada por una frase relacionada Ti CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 24 Figura 2.8: Máscaras de rol para el microlenguaje español. analizadas, incluso aunque diferentes caminos de decisión hacia una solución concreta puedan quedar abiertos por ello. El proceso seguido para traducir una frase es el siguiente: 1. Obtener la representación de la situación. 2. Extraer los componentes básicos del mapa de situación. 3. Obtener los valores correctos del mapa de palabras. 4. Aplicar las máscaras para cada rol. 1.- Obtener la representación de la situación. De manera similar a lo que sucedía en el caso monolingüe, cada frase, ya sea en inglés o en español, está relacionada con una representación situacional, que es un mapa autoorganizativo obtenido a partir de las correspondientes combinaciones lógicas. 2.- Extraer los componentes básicos del mapa de situación. El paso anterior crea una representación independiente del lenguaje a partir de una frase expresada en uno de los dos microlenguajes. La salida SOM obtenida es una matriz en la que cada componente (o celda del mapa µi ) está etiquetada de forma que contiene información sobre si una situación del conjunto ejemplo de entrada es parte de ella o no. Además, cada componente posee un valor, µi∈[0,1] indicando la medida en la que µi es parte de la representación situacional. Así, la celda con valor máximo de la matriz obtenida CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 25 Figura 2.9: Mapas de vocabulario incluyendo información sobre roles para ambos microlenguajes, inglés y español. CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 26 contiene información sobre aquellas situaciones ejemplo del conjunto de entrenamiento que poseen una mayor relación con la situación a la que la frase de entrada hace referencia. Siguiendo esta idea, el algoritmo busca la celda con valor máximo que esté etiquetada y, entonces, se busca alguna etiqueta de una situación ejemplo que tenga tantos de conceptos básicos de primer nivel como número de roles tenga la frase de entrada. El algoritmo de búsqueda procede del siguiente modo: 1. La celda contiene alguna situación con el mismo número de conceptos básicos que roles hay en la frase. Si la celda contiene información sobre un único patrón de situación con el número de conceptos básicos requeridos, el algoritmo devuelve dicho patrón. Si más de un patrón diferente es encontrado, se devuelve el patrón más repetido. En el caso de que se encuentren diferentes patrones con la longitud requerida un mismo número de veces, uno de esos patrones es seleccionado aleatoriamente. 2. La celda contiene alguna situación con más conceptos básicos que roles. Si, al aplicar el caso previo, no se encuentra resultado, este segundo caso es aplicado. La misma forma de proceder que en el caso anterior es aplicada, ahora sobre patrones con más componentes de los que la frase de entrada requiere. Esto signica que se busca un patrón de situación más especíco de lo que la frase de entrada requiere. 3. La celda contiene algún patrón de situación con menos conceptos básicos que roles. Si ninguno de los pasos previos ha encontrado resultado se aplica este caso con la misma metodología de búsqueda, ahora sobre patrones con menos componentes de los que requiere la farse de entrada. De esta manera, se procede a buscar un patrón de situación más general de lo que la frase de entrada requiere. 3.- Obtener los valores correctos del mapa de palabras. Se selecciona cada uno de los mapas correspondientes a los conceptos básicos obtenidos en el paso anterior para el microlenguaje objetivo. Entonces, se aplica la conjunción sobre el subconjunto de mapas de vocabulario. Cada mapa es, en realidad, un vector donde cada componente xi∈[0,1] , de forma que la conjunción se obtiene como resultado de la multiplicación escalar de todos los mapas seleccionados. Si los mapas de vocabulario de la gura 2.7 fueran usados, el vector resultante contendría información acerca de las palabras con más posibilidades para la traducción codicadas como aquellas componentes con los valores más altos; sin embargo, la tarea de construcción de una frase CAPÍTULO 2. MODELADO DEL CONOCIMIENTO PARA PLN 27 correcta quedaría incompleta. 4.- Aplicar las máscaras para cada rol. De nuevo, diferentes caminos pueden seguidos en este punto para alcanzar el objetivo de la traducción. En esta solución, los roles presentes en la frase a ser traducida son tenidos en cuenta para conseguir la traducción correspondiente de cada rol. El siguiente algoritmo es usado: translatedSentence:= ∅ for every role ri∈S aux:= ApplyMask( ri , Solution) w:= GetWord(aux); Concatenate(translatedSentence, w) end loop Capítulo 3 Experimentos En las siguientes líneas se describen los experimentos realizados en este trabajo incluyendo tanto la formación del mapa auto-organizativo de las situaciones como el modelo de red recurrente simple para las frases que describen situaciones en el micromundo. 3.1. Formación de Situaciones El conjunto de situaciones ejemplo constituye la entrada del SOM y consiste en 227 situaciones ejemplo que siguen las limitaciones del micromundo de manera que cada situación en este conjunto se obtiene de una o más proposiciones combinadas. Estos son algunos ejemplos de posibles situaciones ejemplo correctas en nuestro micromundo: LC(writes) ∧ decade(70) BD(records) ∧ decade(80) ∧ BD(home) ∧ BD(success) LC(europe) ∧ BD(europe) ∧ accompanied Figura 3.1: Situaciones ejemplo denidas a partir de la combinación de proposiciones básicas. Una situación de entrada es un vector X= (x1, x2, ..., xv) , v= 17 , número de eventos en el micromundo. Una componente xi es igual a 1 si es el caso de la situación ejemplo o 0 si no lo es. Esta representación implica, como se puede observar de la tabla 2.1, que el evento accompanied o su negación estarán 28 CAPÍTULO 3. EXPERIMENTOS 29 Figura 3.2: Valores de la conjunción de todas las combinaciones de eventos p y q , donde p6=q . siempre presentes en una situación ejemplo, mientras otras, como el caso de getting success o no ( failing ) permiten representar situaciones donde la información sobre el resultado de alguna acción por parte de los protagonistas del micromundo no es dada al modelo, es decir, getting success and failing tienen ambos un valor igual a 0. Después de entrenar el SOM con el conjunto ejemplo, un error de cuanticación nal de 0.873 y un error topográco nal de 0.0 son obtenidos, mostrando el resultado de la gura 2.2. Para comprobar la relación entre la probabilidad real inherente en el conjunto ejemplo con los valores de conanza de cada vector de situación en la salida, los valores de conjunción de cada evento p y q , son calculados en cada caso, mostrando los resultados de la gura 3.2. El coeciente de correlación obtenido es muy alto, r= 0,9773 , y no hay datos distantes del resto. 3.2. Entrenamiento de Frases La red neural recurrente simple es entrenada con un conjunto de 368 frases que son presentadas a la red de manera aleatoria. El resto de frases (28) no son entrenadas y son usadas para medir el rendimiento de la red con frases que no fueron presentadas en el entrenamiento. Una frase se construye como la concatenación de las palabras que la componen, de manera que el resultado es una matriz de 13 las, una por cada posible palabra en el microlenguaje, y c columnas, c el número de palabras contenidas en la frase. A modo de ejemplo, la ecuación 3.1 muestra la matriz correspondiente para la frase "LC is single at_home" . CAPÍTULO 3. EXPERIMENTOS 30 [lc, is, single, at _ home] =                       1 0 0 0 0 0 0 0 0 0 0 0 0 1 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 1 0 0 0 0 0 0 1 0 0 0 0 0                       (3.1) El conjunto mencionado de 368 frases es presentado a la red recurrente durante 400 iteraciones de tal manera que el error cuadrático medio es calculado y retropropagado para encontrar los gradientes del error para cada peso y bias. Después de entrenar y calcular los resultados de comprensión para las frases presentes en el conjunto de entrenamiento, el porcentaje de frases comprendidas es 89,7 y la media del resultado es 0,3931 . Por otro lado, un conjunto de 20 frases no presentadas a la red durante el entrenamiento pero reriéndose a situaciones en el micromundo que estaban ya presentes en el conjunto de entrenamiento son también consideradas, obteniendo una media de 0,3330 sobre las 18 de las 20 frases que fueron comprendidas. Estas 20 frases, mostradas en la gura 3.1, son frases no presentadas en el conjunto de entrenamien- to pero que se reeren a situaciones ya referidas por otras frases presentes en el conjunto de entrenamiento. Por ejemplo, la frase "LC is in_Europe and performs_concert" no es parte del conjunto (segunda frase), mientras la frase " LC performs_concert in_Europe. "se encuentra en el conjunto de entrenamiento. Finalmente, un conjunto de 8 frases no presentadas describiendo nuevas situaciones (gura 3.2) resultó en una media de 0,3799 y 7 del conjunto de 8 frases tuvieron un resultado mayor que 0. Estas ocho frases que no están presentes en el entrenamiento describen situaciones no descritas por ninguna otra frase en el conjunto de entrenamiento. Además, los resultados muestran cómo las frases cortas conducen hacia mayores resultados de comprensión que las largas. CAPÍTULO 3. EXPERIMENTOS 31 Cuadro 3.1: Conjunto de nuevas frases mencionando situaciones ya presentes en el conjunto de entrenamiento. No. sentence 1 LC performs_concert in_Europe and a_home. 2 LC is in_Europe and performs_concert. 3 LC is accompanied and performs_concert. 4 LC fails and records_CD. 5 LC and BD records_CD at_home and in_Europe. 6 LC and BD is at_home and in_Europe. 7 LC and BD is in_Europe and gets_success. 8 BD is at_home and performs_concert. 9 BD is in_Europe and records_CD. 10 BD and LC performs_concert at_home and in_Europe. 11 BD and LC performs_concert in_Europe. 12 BD and LC performs_concert at_home. 13 BD and LC performs_concert and is single. 14 BD and LC performs_concert and is accompanied. 15 BD and LC is at_home and in_Europe. 16 BD and LC fails and records_CD. 17 BD and LC fails at_home and in_Europe. 18 BD and LC fails at_home. 19 BD and LC fails in_Europe. 20 BD and LC fails in_Europe and at_home. Cuadro 3.2: Conjunto de nuevas frases mencionando nuevas situaciones. No. sentence 1 LC is accompanied and performs_concert. 2 LC performs_concert and is accompanied. 3 LC and BD is accompanied and performs_concert. 4 LC and BD performs_concert and is accompanied. 5 BD and LC performs_concert and is accompanied. 6 BD and LC is accompanied and performs_concert. 7 BD performs_concert and is accompanied. 8 BD is accompanied and performs_concert. CAPÍTULO 3. EXPERIMENTOS 32 3.3. Traducción de Frases Para analizar el rendimiento del sistema en el proceso de traducción de frases se presenta como entrada y se analizan los resultados obtenidos después de presentar todas las frases posibles creadas a partir de la gramática de cada microlenguaje. Durante el proceso de ejecución de la tarea de traducción, la presencia de una frase en la entrada del modelo es transformada en la salida como la conjunción de las representaciones básicas de aquellos conceptos de la gura 2.4 que están ligados a las palabras de la frase de entrada, tal y como se muestra en la gura 2.6. Teniendo R como la representación que se obtiene en la salida a partir de una determinada frase de entrada, formada como la concatenación de palabras wi , w1w2..wn:R=c1·c2·.. ·cn , donde ci es la representación que se obtiene como salida para cada wi . Además, wi:ci=ci1+ci2+..+cim , donde cada cij es la representación situacional que se obtiene para cada uno de los conceptos básicos diferentes ligados a una misma palabra. Para analizar los resultados del experimento se comprueba, para cada frase de entrada Ti y cada wj∈Ti , si la palabra obtenida como traducción de wj∈Ti es la traducción correcta y si ocupa el rol que le corresponde en la frase que resulta de la traducción. En caso de que así sea y ambas condiciones se cumplan, la traducción de wi ha sido un acierto, en caso contrario ha sido un error. CAPÍTULO 3. EXPERIMENTOS 33 En la gura 3.3 se muestran los resultados obtenidos al presentar todas las posibles frases del microlenguaje inglés. Los resultados muestran un acierto global del 82,61%, porcentaje de acierto que se incrementa hasta el 88,91% si no se tiene en cuenta la palabra somebody que, como ya se observó en la gura 2.6, es el único caso especial de palabra que no está relacionada con ningún concepto de primer nivel. Figura 3.3: Resultados de acierto para cada palabra al traducir frases en inglés. El color rojo indica el total de apariciones en las frases de entrada, mientras el azul el número total de aciertos. CAPÍTULO 4. CONCLUSIONES Y DISCUSIÓN 40 4.2. Trabajo Futuro El trabajo desarrollado abre varias líneas de posible desarrollo futuro. Una de esas vías de estudio está relacionada con el conjunto de datos a utilizar por el modelo. Un modelo más completo de procesamiento de frases y traducción debería ser capaz de manejar un conjunto más grande y variado de datos de entrada. Además este conjunto debería contener ejemplos reales extraídos del mundo que nos rodea. Tener en cuenta un conjunto de datos de este tipo permitiría evaluar y estudiar el rendimiento del sistema en esos casos e investigar cuáles son las vías a seguir para conseguir un modelo escalable a la vez que funcional. Por otro lado, este trabajo comparte con la gran mayoría de los trabajos actuales sobre procesamiento del lenguaje natural la problemática de la producción de frases. Esta es una de las tareas más complejas en NLP y, aunque no formaba parte de los objetivos a cubrir por este trabajo, un sistema de MT debería contar con las herramientas y componentes necesarios que permitan la producción de frases siguiendo las reglas gramáticales y proposicionales propias de cada lenguaje. Bibliografía [1] Duch, W. Neurocognitive informatics manifesto. In Proceedings of IMS'09, the 8th International Conference on Information and Management Sciences , pp. 264282. [2] Elman, J. L. Finding structure in time. Cognitive Science 14 , 2 (1990), 179211. [3] Frank, S. Sentence comprehension as the construction of a situational representation: A connectionist model. In Proceedings of AMKLC'05, International Symposium on Adaptive Models of Knowledge, Language and Cognition (Espoo, Finland, 2005), Helsinki University of Technology, pp. 2733. [4] Frank, S. Sentence comprehension without propositional structure. In Modeling language, cognition and action (New Jersey, London, 2005), World Scientic, pp. 119128. [5] Frank, S. L., Koppen, M., Noordman, L. G. M., and Vonk, W. Modeling knowledge-based inferences in story comprehension. Cognitive Science 27 , 6 (2003), 875910. [6] French, R. M. A simple recurrent network model of bilingual memory. In TProceedings of the Twentieth Annual Cognitive Science Society Conference (Amsterdam, 1998), NJ:LEA, pp. 368373. [7] Gasser, M. Connectionism and universals of second language acquisition michael, 1990. [8] Ham, F., and Kostanic, I. Principles of Neurocomputing for Science and Engineering . McGrawHill, Singapore, 2001. [9] Harris, J. Fuzzy Logic Applications in Engineering Science . Springer, Dordrecht, 2006. 41 BIBLIOGRAFÍA 42 [10] Honkela, T., Virpioja, S., and Väyrynen, J. Adaptive translation: Finding interlingual mappings using self-organizing maps. In ICANN '08: Proceedings of the 18th international conference on Articial Neural Networks, Part I (Berlin, Heidelberg, 2008), Springer-Verlag, pp. 603 612. [11] III, M. R. M., and Miikkulainen, R. Incremental nonmonotonic sentence interpretation through semantic self-organization. Tech. Rep. AI08-12, Department of Computer Sciences, University of Texas at Austin. [12] Kangas, J., Torkkola, K., and Kokkonen, M. Using SOMs as feature extractors for speech recognition. In Proc. ICASSP-92, International Conference on Acoustics, Speech and Signal Processing (Piscataway, NJ, 1992), IEEE Service Center. [13] Kaski, S., Honkela, T., Lagus, K., and Kohonen, T. Websom self-organizing maps of document collections. Neurocomputing 21 , 1 (1998), 101117. [14] Kohonen, T. Self-Organizing Maps . Springer, 2001. [15] Kohonen, T., Kaski, S., Lagus, K., Salojärvi, J., nad V. Paatero, J. H., and Saarela, A. Self-organization of a massive document collection. IEEE Transactions on Neural Networks 11 (2000), 57485. [16] Letosa, J. R., and Honkela, T. Elementary logical reasoning in the som output space. In ICANN (2) (2010), K. I. Diamantaras, W. Duch, and L. S. Iliadis, Eds., vol. 6353 of Lecture Notes in Computer Science , Springer, pp. 432437. [17] Mayberry, M. R., and Miikkulainen, R. SARDSRN: a neural network shift-reduce parser. In IJCAI'99: Proceedings of the 16th international joint conference on Articial intelligence (San Francisco, CA, USA, 1999), Morgan Kaufmann, pp. 820825. [18] Mayberry, III, M. R., and Miikkulainen, R. Incremental nonmonotonic parsing through semantic selforganization. In Proceedings of the 25th Annual Conference of the Cognitive Science Society (Boston, MA, 2003), Cognitive Science Society, pp. 798803. [19] Mayberry III, M. R., and Miikkulainen, R. Using a sequential SOM to parse long-term dependencies. In Proceedings of the 21st Annual BIBLIOGRAFÍA 43 Meeting of the Cognitive Science Society (COGSCI-98) (Hillsdale, NJ, 1999), Erlbaum. [20] Mcclelland, L., John, M. F. S., and Mcclell, J. L. Learning and applying contextual constraints in sentence comprehension. Articial Intelligence 46 (1990), 217257. [21] Miikkulainen, R. DISCERN: A Distributed Articial Neural Network Model of Script Processing and Memory . PhD thesis, Computer Science Department, University of California, Los Angeles, 1990. (Tech. Rep UCLA-AI-9005). [22] Miikkulainen, R. Subsymbolic Natural Language Processing: An Integrated Model of Scripts, Lexicon, and Memory . MIT Press, Cambridge, MA, 1993. [23] Noelle, D. C., and Cottrell, G. W. A connectionist model of instruction following. In Moore, J. D., and Lehman, J. F., editors, Proceedings of the 17th Annual Conference of the Cognitive Science Society (Pittsburg, 1995), Erlbaum, pp. 369374. [24] Press, H. U. , Ed. Mental Models (Cambridge, 1983). [25] Rohde, D. L. T. A connectionist model of sentence comprehension and production . PhD thesis, Pittsburgh, PA, USA, 2002. Chair-Plaut, David C. [26] Steels, L. Social language learning. In Tokoro, M. and L. Steels, editors, The Future of Learning (Amsterdam, 2003), IOS Press, pp. 133 162. [27] Zadeh, L. A. Fuzzy sets. Information and Control 8 (1965), 338353. Apéndice A Métodos Algoritmo Self-Organizing Map El mapa auto-organizativo (Self-Organizing Map) es un tipo de red neuronal articial en el que el aprendizaje es llamado competitive, unsupervised o selforganizing . Por medio del algoritmo SOM, la red desarrolla un clustering de pequeñas dimensiones (típicamente dos dimensiones) del espacio de entrada de las muestras de entrenamiento a la vez que preserva las propiedades topológicas de ese espacio por medio del mapeo de patrones de entrada similares a unidades cercanas en el mapa de salida. Estas unidades del Self-Organizing Map, llamadas nodos o neuronas, están dispuestas normalmente en un espacio regular en una cuadrícula rectangular o hexagonal, y cada una de ellas está asociada con un vector de pesos de la misma dimension que los vectores de datos de entrada. Durante el algoritmo auto-organizativo, el nodo del mapa cuyos pesos se encuentran más cercanos a un patrón de entrada es activado. Entonces, estos pesos y los pesos de los nodos de alrededor son adaptados hacia el patrón de activación de la entrada, dirigiéndose a una situación en la que los nodos cercanos se hacen similares y responden a patrones similares de entrada. Algoritmo de Entrenamiento El primer paso en el algoritmo de entrenamiento pasa por inicializar los vectores de pesos ya sea de manera aleatoria o seleccionando un conjunto de pesos que reeje algún tipo de conocimiento a priori sobre los datos de entrada. 44 APÉNDICE A. MÉTODOS 45 Figura A.1: Arquitectura SOM. Las entradas de la red mostrada en la gura A.1 pueden ser escritos en forma de vector como x= [x1, x2, ..., xn]T (A.1) y el vector de pesos sináptico de la neurona i es dado por wi= [wi1, wi2, ..., win]Ti= 1,2, ..., m (A.2) donde m es el número total de neuronas en el vector de salida. La mejor coincidencia del vector de entrada x con el vector de pesos sináptico wi está determinado por q(x) = min ∀ikx−wik2i= 1,2, ..., m (A.3) donde q(x) es el índice del vector de salida que identica especícamente la neurona ganadora , y k•k2 es la norma euclídea. La respuesta podría ser también el vector de pesos sináptico más cercano a la entrada en vez de un índice de posición. El siguiente paso en el algoritmo consiste en actualizar el vector de pesos sináptico asociado con la neurona ganadora y las neuronas que se encuentran dentro de un espacio de proximidad denido. La regla de aprendizaje viene dada por wi(k+ 1) = wi(k) + ηqi(k)[x(k)−wi(k)] (A.4) donde APÉNDICE A. MÉTODOS 46 Figura A.2: Celdas vecinas, mostrando un decrecimiento monótono. En el paso k , la función Nq(k) cubre las celdas vecinas coloreadas en gris, naranja y rojo. Para el siguiente paso, k+ 1 , el conjunto de vecinos cubre las celdasnaranjas y rojas y, nalmente, para el paso k+2 el conjunto ha sido reducido a las celdas rojas. ηqi(k) =          µ(k) en el conjunto vecindario Nq para la neurona ganadora q donde 0< µ(k)<1 , el parámetro de ratio de aprendizaje que debería decrecer con el tiempo 0 fuera de Nq (A.5) es una función de proximidad. Teniendo en cuenta las ecuaciones A.4 y A.5, la regla de aprendizaje puede ser escrita como wi(k+ 1) = (wi(k) + µ(k)[x(k)−wi(k)] if i∈Nq(k) wi(k) if i /∈Nq(k) (A.6) donde el parámetro de ratio de aprendizaje , µ(k)∈(0,1) , y Nq(k) es una función del índice de tiempo discreto k . Se ha demostrado que es bene- cioso hacer que el conjunto de proximidad Nq(k) sea relativamente ancho al comienzo del entrenamiento para después reducirlo monótonamente con el tiempo. La gura A.2 muestra un decremento monótono del conjunto de proximidad. Durante el proceso de aprendizaje hay dos fases relacionadas: la fase de ordenación y la fase de convergencia . Durante la fase de ordenación (proceso APÉNDICE A. MÉTODOS 47 de aprendizaje inicial) la ordenación topológica de los vectores de pesos es llevada a cabo. La segunda fase, la fase de convergencia , es generalmente la parte más larga del aprendizaje, y es durante esta fase cuando el algoritmo tiene que llevar a cabo los ajustes más precisos del mapa. Trabajo Relacionado El algoritmo Self-Organizing Map ha sido usado antes en muchas tareas relacionadas con el Procesamiento del Lenguaje Natural (NLP) y la traducción máquina (MT). Algunos ejemplos de estos trabajos incluyen minería de datos [15], [13], reconocimiento del habla [12], o parsing [19]. En [21], un doble mapa es usado como un diccionario que enlaza por medio de aprendizaje no supervisado el símbolo ortográco de una palabra con su representación semántica. Cada uno de los dos mapas del diccionario están organizados independientemente. De esta manera, en el mapa físico, las representaciones de las palabras que son más parecidas desde un punto de vista léxico aparecen mapeadas unas cerca de las otras; mientras el mapa semántico reeja una división de tres áreas principales: verbos, objetos animados y objetos inanimados. La asociación resultante entre los dos mapas es un mapeo muchos a muchos entre la representación física y la semántica de las palabras, permitiendo una conexión bidireccional entre palabras físicas que pueden estar relacionadas con varias representaciones semánticas y viceversa. Posteriormente, Mayberry y Miikkulainen [18, 11] usan una versión del SOM para su modelo INSOMNet para desarrollar representaciones semánticas a partir de un corpus. INSOMNet es un modelo supervisado de comprensión y parsing . Este sistema interpreta frases de manera no monótona, generando expectativas y revisándolas, aplicando futuras entradas basadas en semántica, y coactivando propiamente múltiples interpretaciones de expresiones [11]. Su arquitectura está formada por tres módulos operacionales principales: sequence processor, semantic frame encoder and decoder y frame selector . El primero de ellos incluye el mapa SARDNet ([19]), que es un mapa autoorganizativo para resolver el problema de memoria a largo plazo del SRN. Un segundo mapa auto-organizativo es usado, el Frame Node Indicator Map , que es parte del módulo frame selector . Sus resultados muestran que IN- SOMNet aprende a representar dependencias semánticas de manera precisa y generaliza a estructuras originales. APÉNDICE A. MÉTODOS 48 El Self-Organizing Map ha sido usado también en el estudio de Machine Translation como fue mencionado en el primer párrafo de esta sección. En [10], un mapa auto-organizativo sirve de espacio conceptual en el que surgen ciertas clases de representación interlingual entre dos lenguajes (alemán e inglés, en este caso) [10]. Se llevan a cabo dos experimentos. En el primero de ellos, una colección de palabras de los lenguajes inglés y alemán son considerados en diferentes contextos situacionales de la vida real. Este primer experimento muestra cómo los contextos de situación están organizados en el mapa de manera que el mapa está dividido en diferentes áreas conceptuales y, al mismo tiempo, cómo un mapeo entre las palabras de ambos lenguajes ha sido producido. Este trabajo destaca la idea de que diferentes lenguajes conceptualizan la realidad de manera diferente [26]. Finalmente, el trabajo de Frank ha sido mencionado ya que este trabajo está próximamente relacionado a la aproximación de Frank. Comenzando con un modelo básicamente centrado en el uso de mapas auto-organizativos para llevar a cabo representación del conocimiento basado en la comprensión de situaciones de una historia creada por la combinación de proposiciones básicas y el estudio sobre cómo extraer inferencias de esta representación [5], Frank añade un modelo de comprensión de frases [4, 3] basado en un microlenguaje que pretende aprender cómo relacionar un conjunto de frases de entrada con las situaciones del micromundo representadas sobre el mapa SOM, y desempeñar cierto aprendizaje de abstracción en la comprensión de frases. Simple Recurrent Neural Network La Red Recurrente Simple (SRN; [2]) es una red neuronal feedforward de una sola capa oculta. Sin embargo, la salida de esta capa oculta es retropropagada a la entrada de la red por medio de una capa de contexto (o capa oculta previa ), que es un ensamblaje extra de neuronas. La función de la capa oculta previa es replicar la salida de la capa oculta en el paso anterior, sirviendo, de esta manera, como contexto temporal para la entrada en el siguiente paso. La SRN ofrece un modo de implementar un tipo de sistema que potencialmente almacena memoria. De hecho, en el marco de este trabajo, este tipo de red permite distinguir cuál es la situación correcta especicada por la frase incluso si el mismo vector de entrada (palabra de la frase, wi ) en el paso k puede aparecer en diferentes frases reriéndose -cada frase - a una situación APÉNDICE A. MÉTODOS 49 diferente. Esto es posible teniendo en cuenta que las palabras anteriores de la frase han sido ya presentadas a la red y la capa oculta representa el contexto apropiado para la palabra wi . Sin embargo, la SRN tiene el problema de que la información representada por la capa de contexto se degrada a medida que cada nueva entrada es presentada a la red. Este problema de memoria se debe al hecho de que la longitud de la capa de contexto es ja, y la información de la señal recibida de pasos anteriores puede decrecer para adaptarse a la llegada de señales más recientes. La gura A.3 muestra la arquitectura genérica para una red recurrente simple. El vector de entrada x (k) es presentado a la red y propagado a través de la capa oculta , que recibe en el mismo paso la señal de la capa de contexto , x '(k), estableciendo de esta manera un contexto para el vector de entrada x (k). La salida de la capa oculta es, entonces, propagada a la capa de salida y, al mismo tiempo, una copia de esta salida de la capa oculta es retropropagada a través de las unidades de contexto para preparar el contexto del siguiente vector de entrada. Trabajo Relacionado Desde su aparición, las redes SRN han sido una de las herramientas más usadas para sistemas conexionistas de procesamiento de lenguaje natural [18]. En las publicaciones de St. John y McClelland [20] y McClelland, St. John, and Taraban, la mitad de la entrada del modelo es una red neuronal recurrente simple cuyo objetivo es aprender a compilar una representación de un solo mensaje a partir de una secuencia de componentes de una frase. Los componentes de la frase pueden ser una simple frase sustantiva, una frase preposicional, o una verbal [25]. El modelo exhibe características interesantes, teniendo la habilidad de hacer uso tanto de las pistas sintácticas como semánticas para inferir signicado, además de ser capaz de inferir constituyentes no presentes. Por ejemplo, que la acción comer sopa se realiza probablemente con una cuchara. Otros modelos inspirados en el trabajo de St. John y McClelland [20] son el trabajo de Noelle y Cottrell [23] y el modelo conexionista de producción y comprensión de frases (CSCP) de Rohde [25]. En el trabajo de Noelle y Cottrell la suposición de que la mayoría del lenguaje es aprendido durante la ejecución de diferentes tareas está presente en el sentido en que están interesados en la capacidad de realizar una tarea después de recibir algunas future inputs based on semantics, and properly coactivating multiple interpretations of expressions [8]. Frank has presented a model in which basic logical operations can be represented as a certain kind of Venn diagram manipulations on the SOM surface [9]. Our current work is closely related to Frank’s approach. We verify his experimental results, provide some extensions, and build further the underlying theoretical framework. Starting with a model basically focused in the use of self-organizing maps to carry out knowledge representation based on the comprehension of situations from a story created from the combination of basic propositions and the study about how to extract inferences from this representation [10], Frank adds a sentence comprehension model [11, 9] based on a microlanguage that intends to learn how to relate a set of input sentences with the microworld situations represented onto a SOM map, and accomplish some kind of abstraction learning in the sentence comprehension. As the main objectives in this paper, we consider how to represent propositionally defined situations using the SOM, how to represent the processing and structural representation of related sentences using recurrent neural networks, and how to evaluate the comprehensibility of the sentences in the framework of this methodology. We also consider how logical reasoning can be conducted using the SOM output space as grounding for the propositional elements. We present the underlying theory and methodology as well as an illuminative experiment. 2 Methods The objective of this work is threefold: (1) to represent world knowledge using the self-organizing map (SOM), (2) to use a simple recurrent network (SRN) to device sentence comprehension, and (3) to use the output space to represent situations and facilitate grounded logical reasoning. We will apply set theory and fuzzy set theory [12], clause logic, neural networks (specifically simple recurrent neural networks [13] and the self-organizing map [1]). The degree of fit between an input value and a particular prototype in the SOM is interpreted as an membership value in the fuzzy set theory. We also assume that the proportional size of the distribution on the map related to a specific input approximates the probability of this input. Furthermore, we assume that the distributions on the map can be interpreted as fuzzy Venn diagrams allowing for basic set-theoretic operations (see e.g. [14]). Venn diagrams show possible logical relations among a finite collection of sets. Simple recurrent network is a variant multilayer perceptrons. In a simple recurrent network, a set of context units is added to the three-layer network. The connections from the hidden layer to context units allow the network to model time-dependent phenomena and perform tasks like sequence prediction. [13] 2.1 World Knowledge Representation In order to implement world knowledge, we shall begin by constructing a defined microworld framework in which a set of situations takes place. After defining the microworld and its constraints, we explain how the microworld knowledge can be represented by means of the help of the Self-Organizing Maps. Following the model presented in [10], the knowledge of a microworld is learned implicitly by means of training a set of example situations that fulfill the microworld definition; each one of them is created from combining the events such as presented in Table 1. Thus, the SOM output of the model is expected to reflect the inherent regularities, constraints and the a priori probabilities of occurrences of the concrete events within the microworld. This serves as a kind of “experience” the system has after being trained with a set of microworld example situations. Table 1. Examples of the basic events in the microworld. No. Name Meaning 1 70s In the 70s decade. 2 80s In the 80s decade. 3 lcSuccess LC gets success. .. ... ... 15 bdHome BD is at the home country. 16 bdEurope BD is in Europe. 17 accompanied He is/they are accompanied. After training, a situation in the microworld is represented by a high-dimen- sional vector of n= 150 components (a SOM map). This implementation in which a situation is contained in a vector of fixed size of nelements allows a representation in which nis independent of the size of the example set, although, at the same time, by reducing the dimensionality from k, size of the example set, 227 in this case, to n= 150, some of the information contained in the previous example situations set may be lost. A situation vector is in the form s(p) = (s1(p), s2(p), ..., sn(p)), where every si(p) has a value between 0 and 1 for every event p(pcan, in fact, be any combination of events) that indicates the extent to which the component, or more precisely, the cell in the SOM, is a part of the representation of p([9]). As it can be observed in Fig. 1, the pattern representing ”lcHome” overlaps with the pattern in which ”lcWrites”, showing that if LC is writing a book, LC is at the home country. In general, a situation can be represented on a map so that it is possible to obtain the probability of occurrence of such situation and any combination of situations by means of fuzzy set theory. Taking the example shown in Fig. 2 where pand qare situations with a probability of 0.5 each one in the microworld and taking into account the equations si(¬p) = 1−si(p) and si(p∧q) = si(p)si(q) every logical combination of situations can be represented. Since there is no one-to-one correspondence between propositions and dimensions in the taken representation of situations, we use belief values in order to figure out the results that are given as situation vectors. Let X= (x1, x2, ..., xn) Fig. 1. A subset of the component planes of a situation map. be a situation vector, with nas the number of situation-space dimensions. As a result of training the SOM, the probability (the probability estimate is approximated) that situation Xoccurs in the microworld equals the fraction of the map it covers ([9]). The belief values τfor a situation Xand for a situation pin X are defined as: τ(X) = 1 nΣixi. τ(p|X) = Σisi(p)xi Σixi .(1) 2.2 Sentence Comprehension Next, we convert sentences from a microlanguage to the representation of the corresponding microworld situation. The microlanguage used in the experiments consists of 13 words: LC, BD, and, is, gets success, fails, performs concert, writes book, records CD, at home, in Europe, single, accompanied. With these words and following the rules of the grammar in Table 2, 396 different sentences can be obtained by associating each of them with a microworld situation. Microlanguage sentences are transformed into situational vector representations by training a simple recurrent neural network [13]. The input layer of the network consists of 13 units, one for each word in the microlanguage. The hidden layer has 50 units and the output layer 150 units, one for each dimension of the situational space. The words of a sentence are processed one-by-one, so only one of the input units is active at any moment. This way, the output of the network can be Fig. 2. Basic logical reasoning at the SOM output level. Table 2. Grammar of the microlanguage. S→NP VP NP →LC |BD |LC and BD |BD and LC VP →Action [Place |and is State |and Result] →is Place [and Action |and State |and Result] →is State [and Action |Place |and Result] →Result [and Action |Place |and is State] Action →writes book |performs concert |records CD Place →at home |in Europe |at home and in Europe |in Europe and at home State →single |accompanied Result →gets success |fails observed at any moment and it is possible to analyze how the representation of the situations gets defined as the sentence gets completed. Belief values are useful in measuring the performance of the model after the network has been trained. The belief value of a situation X(p), represented by the output for a certain sentence, should be larger than the a priori belief value of the situation pcorresponding to that sentence: compr(p) = τ(p|X(p)) −τ(p) τ(p|p)−τ(p).(2) When τ(p|X(p)) > τ(p), the comprehension score is higher than 0 and the network reflects a comprehension of the sentence, having the ideal case when τ(p|X(p)) = τ(p|p), and the score is 1. On the other hand, when the score is negative the network is misunderstanding the sentence and there is no comprehension when the result equals 0. 3 Experiments In the following, we describe the experiments conducted in this work including both the formation of the self-organizing map of the situations and simple recurrent network model of the sentences describing the situations in a microworld. The example situations set constitutes the input of the SOM and consists of 227 example situations that follow the microworld constraints so that every situation in this set is obtained by one or more propositions combined. Each of the input example situations is a vector µ= (µ1, µ2, ..., µm), m= 17, which is the number of events in the microworld, so that a component µiis equal to 1 if it is the case of the example situation or 0 if it is not. The SRN network is trained with a set of 368 sentences that are presented to the network randomly. The rest of the sentences are not trained and they are used as a test set. After training and calculating the comprehension scores for the sentences present in the training set, the percentage of comprehended sentences is 89.7% and the mean of the score is 0.3931. In the other hand, a set of 20 sentences not presented to the network during the training but referring to situations in the microworld that were already present in the training set are considered as well, obtaining a score mean of 0.3330 within the 18 of the 20 sentences that were comprehended. Finally, a set of 8 sentences not presented describing new situations resulted in a score mean of 0.3799 and 7 of this set of 8 sentences had a comprehension score above 0. Furthermore, the results show how the short sentences lead to higher comprehension scores than the long ones. 4 Conclusions In this paper, we have described an approach which enables representation of situations in a microworld using the self-organizing map algorithm and processing of sentences that describe the situations using simple recurrent network. We have also considered how to conduct basic logical reasoning at the output level of the self-organizing map in a Venn diagram like manner. The approach seems to facilitate well a grounded approach for modeling story comprehension. The present study is based on a microworld in which the number of different situations and sentences is small. Future research is needed to test how well the methodology scales up to large real-world applications. References 1. Kohonen, T.: Self-Organizing Maps. Springer (2001) 2. G¨ardenfors, P.: Conceptual spaces: The Geometry of Thought. MIT Press (2000) 3. Honkela, T.: Self-Organizing Maps in Symbol Processing. In: Hybrid Neural Systems. Springer (2000) 348–362 4. Harnad, S.: The symbol grounding problem. Phys. D 42(1-3) (1990) 335–346 5. Duch, W.: Neurocognitive informatics manifesto. In: Proc. of IMS’09. 264–282 6. Miikkulainen, R.: Subsymbolic Natural Language Processing: An Integrated Model of Scripts, Lexicon, and Memory. MIT Press, Cambridge, MA (1993) 7. Mayberry, M.R., Miikkulainen, R.: SARDSRN: a neural network shift-reduce parser. In: Proc. of IJCAI’99, San Francisco, CA, Morgan Kaufmann (1999) 820– 825 8. Mayberry, M.R., Miikkulainen, R.: Incremental nonmonotonic sentence interpretation through semantic self-organization. Technical Report AI08-12, Department of Computer Sciences, University of Texas at Austin 9. Frank, S.L.: Sentence comprehension as the construction of a situational representation: A connectionist model. In: Proceedings of AMKLC’05, International Symposium on Adaptive Models of Knowledge, Language and Cognition, Espoo, Finland, Helsinki University of Technology (2005) 27–33 10. Frank, S.L., Koppen, M., Noordman, L.G.M., Vonk, W.: Modeling knowledgebased inferences in story comprehension. Cognitive Science 27(6) (2003) 875–910 11. Frank, S.L.: Sentence comprehension without propositional structure. In: Modeling language, cognition and action, New Jersey, World Scientific (2005) 119–128 12. Zadeh, L.A.: Fuzzy sets. Information and Control 8(1965) 338–353 13. Elman, J.L.: Finding structure in time. Cognitive Science 14(2) (1990) 179–211 14. Harris, J.: Fuzzy Logic Applications in Engineering Science. Springer, Dordrecht (2006)