scieee Open visual document viewer

Reconocimiento de Entidades Nombradas en Textos Legales en Español

López Olmos, Álvaro; Chen, ZhenBo

Abstract

En el presente trabajo se lleva a cabo una exhaustiva investigación del uso de modelos de lenguaje para el reconocimiento de entidades nombradas en textos en español y de las técnicas de recopilación, extracción de información y reentrenamiento de los modelos. El objetivo principal de este trabajo consiste en desarrollar un modelo basado en RoBERTa, utilizando un conjunto de datos balanceado que garantice la solidez y fiabilidad del mismo. En el estudio, se hace énfasis en el campo del procesamiento del lenguaje natural, aprovechando los avances en aprendizaje automático para mejorar el reconocimiento de entidades nombradas en textos legales en español. Se evalúa y compara el rendimiento de RoBERTa con otros modelos de lenguaje, tales como BERT y ALBERT, para elegir el modelo m ́as apropiado para el análisis de textos en español. Para la selección del conjunto de datos, se recolecta una amplia variedad de textos legales en español, cubriendo distintas ́áreas y a los que se aplican diferentes técnicas de preprocesamiento. Los resultados obtenidos tras el reentrenamiento reflejan un buen desempeño del modelo RoBERTa en el reconocimiento de entidades en textos legales en español. Se presentan métricas de evaluación que demuestran su eficacia y precisión en la identificación de entidades mencionadas.

Full text

Reconocimien o de En idades Nomb adas en Tex os Legales en Espa˜nol Recogni ion o Named En i ies in Spanish Legal Tex s TRABAJO FIN DE GRADO GRADO EN INGENIER´ IA INFORM ´ ATICA CURSO 2022–2023 ´ Al a o L´opez Olmos ZhenBo Chen Di ec o es Luis Ja ie Ga c´ıa Villalba Luis Albe o Ma ´ınez He n´andez Depa amen o de Ingenie ´ıa del So wa e e In eligencia A i icial Facul ad de In o m´a ica Uni e sidad Complu ense de Mad id Mad id, Junio de 2023 Ag adecimien os Que emos exp esa nues o m´as since o ag adecimien o a odas las pe sonas que con ibuye on en el abajo de in de g ado. En p ime luga , nos gus a ´ıa ag adece a nues os di ec o es de TFG Luis Ja ie Ga c´ıa Villalba y Luis Albe o Ma ´ınez He n´andez, po su gu´ıa y apoyo incondicional a lo la go de odo el p oceso de in es igaci´on. Tambi´en que emos ag adece a Robson de Oli ei a Albuque que, Ana Lucila Sando al O ozco, Daniel Po edano ´ Al a ez y Sand a P´e ez A eaga po sus aliosas con ibuciones en di e en es e apas del p oyec o. Su colabo aci´on ue c ucial pa a el desa ollo del abajo y el log o de los esul ados espe ados. Adem´as, nos gus a ´ıa exp esa nues o ag adecimien o a odos nues os p o eso es, compa˜ne os y amilia es que nos die on su apoyo y mo i aci´on du an e el eco ido del p oyec o. Sus comen a ios, suge encias y c ´ı icas cons uc i as nos pe mi ie on mejo a cons an emen e nues o abajo y alcanza los obje i os p opues os. Sin el apoyo y la colabo aci´on de odas es as pe sonas, nues o p oyec o de in de g ado no hab ´ıa sido posible. iii ´ Indice Gene al ´ Indice de Figu as IX ´ Indice de Tablas XI Lis a de Ac ´ onimos XV Abs ac XIX Resumen XXI 1. In oducci´ on 1 1.1. Mo i aci´on .................................... 1 1.2. Con ex o ..................................... 2 1.3. Obje o de la In es igaci´on ............................ 2 1.4. Plan de T abajo ................................. 3 1.5. Es uc u a del T abajo .............................. 4 2. Con ex o de la In es igaci´ on 5 2.1. P ocesamien o del Lenguaje Na u al ...................... 5 2.2. Concep os espec´ı icos ............................... 6 2.3. His o ia de los P ocesado es del Lenguaje Na u al .............. 7 2.4. A qui ec u a T ans o me ............................ 8 2.4.1. Embeddings ................................ 9 2.4.2. Vec o Posicional ............................. 9 2.4.3. Mecanismo de a enci´on ......................... 10 i ´ INDICE GENERAL 2.4.4. Codi icado ................................ 10 2.4.5. Decodi icado ............................... 11 2.5. Modelos de Lenguaje P een enados ...................... 12 2.5.1. BERT ................................... 12 2.5.2. RoBERTa ................................. 15 2.5.3. ALBERT ................................. 15 2.5.4. Dis ilBERT ................................ 16 2.5.5. SpanBERT ................................ 17 3. Es ado del A e 19 3.1. Sc aping ...................................... 19 3.2. Modelos de P ocesamien o de Lenguaje Na u al ................ 20 4. Me odologia del P oyec o 25 4.1. Recolecci´on de los da os ............................. 26 4.1.1. Web Sc aping ............................... 26 4.1.2. PDF Sc aping .............................. 26 4.2. Da os de en ada ................................. 27 4.3. P e-P ocesamien o ................................ 27 4.3.1. P epa aci´on del e ique ado ....................... 27 4.3.2. P epa aci´on de los a chi os de en enamien o ............. 28 4.4. En enamien o del modelo ............................ 30 4.5. Lib e ´ıas U ilizadas ................................ 30 5. Expe imen os y Resul ados 33 5.1. Desc ipci´on del co pus .............................. 33 5.2. P e-P ocesamien o ................................ 34 5.3. En enamien o .................................. 35 5.3.1. RoBERTa Base BNE ........................... 36 5.3.2. XLM RoBERTa Base .......................... 37 5.4. E aluaci´on .................................... 37 ´ INDICE GENERAL ii 5.4.1. P ecisi´on ................................. 38 5.4.2. Recall ................................... 38 5.4.3. F-sco e .................................. 38 5.4.4. Ma iz de con usi´on ........................... 39 5.5. Ejemplo salida del modelo ............................ 39 6. Con ibuciones 43 6.1. ZhenBo Chen ................................... 43 6.2. ´ Al a o L´opez Olmos ............................... 44 7. Conclusiones y T abajo Fu u o 47 7.1. Conclusiones ................................... 47 7.2. T abajo Fu u o .................................. 47 8. In oduc ion 49 8.1. Mo i a ion .................................... 49 8.2. Con ex ...................................... 50 8.3. Objec o he In es iga ion ........................... 50 8.4. Wo kplan ..................................... 51 8.5. S u u e o he Wo k ............................... 52 9. Conclusions and Fu u e Wo k 53 9.1. Conclusions .................................... 53 9.2. Fu u e Wo k ................................... 53 Bibliog a ´ ıa 55 ´ Indice de Figu as 1.1. Diag ama de Gan del p oyec o ........................ 4 2.1. A qui ec u a ans o me s [VSP+17] ...................... 8 2.2. Ejemplo espacio Embedding ........................... 9 2.3. Es uc u a del codi icado ............................ 11 2.4. Es uc u a del decodi icado ........................... 11 2.5. En ada Be [DCLT19] ............................. 13 2.6. A qui ec u a Be [DCLT19] ........................... 13 2.7. Ejemplo usos de BERT - Clasi icaci´on [DCLT19] ............... 14 2.8. Ejemplo usos de BERT - P egun a Respues a y NER [DCLT19] ....... 14 2.9. Una ilus aci´on del en enamien o SpanBERT [JCL+20] ........... 17 4.1. Pipeline ...................................... 25 4.2. Ejemplo de Reconocimien o de En idades ................... 25 4.3. N´ume o de apa iciones po e ique a ...................... 29 5.1. Debug ....................................... 36 5.2. Ma iz de con usi´on de Legal-GASS ...................... 39 5.3. Ma iz de con usi´on de Legal-GASS-li e .................... 40 5.4. Salida de la p edicci´on .............................. 41 ix x i Lis a de Ac ´ onimos LOPD Ley O ganica de P o ecci´on de Da os LSTM Long Sho Te m Memo y ML Machine Lea ning MLM Modelado del Lenguaje Enmasca ado NER Name En i y Recogni ion NLP Na u al Language P occessing NSP P edicci´on de la F ase Siguien e RACE ReAding Comp ehension om Examina ions RNN Recu en Neu al Ne wo ks RoBERTa Robus ly Op imized BERT P e aining App oach SBO span-bounda y objec i e SOP Sen ence O de P edic ion SpanBERT BERT o Span-based Ex ac i e Ques ion Answe ingT SQuAD S an o d Ques ion Answe ing Da ase TA T aducci´on Au om´a ica TFG T abajo de Final de G ado TSV Tab Sepa a ed Values XML Ex ensible Ma kup Language Abs ac In his wo k, an exhaus i e in es iga ion o he use o language models o named en i y ecogni ion in Spanish ex s and o he echniques o collec ing, ex ac ing in o ma ion and e aining he models is ca ied ou . The main objec i e o his wo k is o de elop a model based on RoBERTa, using a balanced da ase ha gua an ees he obus ness and eliabili y o he model. In he s udy, emphasis is placed on he ield o na u al language p ocessing, aking ad an age o ad ances in machine lea ning o imp o e he ecogni ion o named en i ies in legal ex s in Spanish. The pe o mance o RoBERTa is e alua ed and compa ed wi h o he language models, such as BERT and ALBERT, in o de o choose he mos app op ia e model o he analysis o Spanish ex s. Fo he selec ion o he da ase , a wide a ie y o Spanish legal ex s a e collec ed, co e ing di e en a eas and o which di e en p ep ocessing echniques a e applied. The esul s ob ained a e e aining e lec a good pe o mance o he RoBERTa model in en i y ecogni ion in Spanish legal ex s. E alua ion me ics a e p esen ed ha demons a e i s e iciency and accu acy in he iden i ica ion o he men ioned en i ies. Keywo ds: In o ma ion Collec ion and Ex ac ion, Named En i y Recogni ion, Na u al Language P ocessing. xix Resumen En el p esen e abajo se lle a a cabo una exhaus i a in es igaci´on del uso de modelos de lenguaje pa a el econocimien o de en idades nomb adas en ex os en espa˜nol y de las ´ecnicas de ecopilaci´on, ex acci´on de in o maci´on y een enamien o de los modelos. El obje i o p incipal de es e abajo consis e en desa olla un modelo basado en RoBERTa, u ilizando un conjun o de da os balanceado que ga an ice la solidez y iabilidad del mismo. En el es udio, se hace ´en asis en el campo del p ocesamien o del lenguaje na u al, ap o echando los a ances en ap endizaje au om´a ico pa a mejo a el econocimien o de en idades nomb adas en ex os legales en espa˜nol. Se e al´ua y compa a el endimien o de RoBERTa con o os modelos de lenguaje, ales como BERT y ALBERT, pa a elegi el modelo m´as ap opiado pa a el an´alisis de ex os en espa˜nol. Pa a la selecci´on del conjun o de da os, se ecolec a una amplia a iedad de ex os legales en espa˜nol, cub iendo dis in as ´a eas y a los que se aplican di e en es ´ecnicas de p ep ocesamien o. Los esul ados ob enidos as el een enamien o e lejan un buen desempe˜no del modelo RoBERTa en el econocimien o de en idades en ex os legales en espa˜nol. Se p esen an m´e icas de e aluaci´on que demues an su e icacia y p ecisi´on en la iden i icaci´on de en idades mencionadas. Palab as cla e: P ocesamien o del Lenguaje Na u al, Reconocimien o de En idades, Recopilaci´on y Ex acci´on de in o maci´on. xxi Cap´ı ulo 1 In oducci´on 1.1. Mo i aci´on Los nume osos a ances cien ´ı icos de los ´ul imos a˜nos han dado luga a un aumen o exponencial de la ecnolog´ıa. G acias a In e ne , se ha hecho posible accede a g andes can idades de da os, conc e amen e en o ma de ex o esc i o en di e en es idiomas, lo que esul a muy ´u il pa a el ap endizaje humano o a i icial, conc e amen e pa a el P ocesamien o del Lenguaje Na u al (NLP). T as la apa ici´on de la p ime a a qui ec u a de NLP mode na, Wo d2Vec [MSC+13] en 2013, se p odujo un ´apido desa ollo de es a ecnolog´ıa, con a ios a ances, como los Recu en Neu al Ne wo ks (RNN) y los Long Sho Te m Memo y (LSTM) que son una modi icaci´on de los an e io es. En e los a˜nos 2015 y 2016 se popula iza on las edes basadas en a enci´on, que pe mi en al dise˜nado que especi ique en que ipo de da os quie e que se cen e el sis ema, a cuales p es a a enci´on. De en e es os, uno de los que mas des aca son los T ans o me , in oducidos en 2017 y que ac ualmen e copa el pa adigma del p ocesamien o del lenguaje. En la ac ualidad p edominan modelos como Bidi ec ional Encode Rep esen a ions om T ans o me s (BERT) [DCLT19], p esen ado en 2018, y sus especializaciones y op imizaciones, como Robus ly Op imized BERT P e aining App oach (RoBERTa) [LOG+19], 2019. Al se ambos modelos an ac uales, oda ´ıa no se han ealizado en enamien os pa a odos los lenguajes, ni pa a odos los ´ambi os de posible especializaci´on, po ello se p opone en es e abajo, la c eaci´on y p esen aci´on de an o un pipeline, como de un modelo en enado espec´ı icamen e pa a el ´ambi o legal en espa˜nol. Tambi´en cabe ci a o os modelos de i ados de BERT ales como A Li e BERT (ALBERT) [LCG+20], Dis illed BERT (Dis ilBERT) [SDCW20] y BERT o Span-based Ex ac i e Ques ion Answe ingT (SpanBERT) [JCL+20]. 1 2Cap´ ı ulo 1. In oducci´ on 1.2. Con ex o El p esen e T abajo Fin de G ado se enma ca den o de un p oyec o de in es igaci´on i ulado No el S a egies o Figh Child Sexual Exploi a ion and Human T a icking C imes and P o ec hei Vic ims – HEROES, ap obado po la Comisi´on Eu opea den o del P og ama Ma co Ho izon e 2020 (con oca o ia H2020-SU-SEC-2020) en i ud del acue do de sub enci´on n´ume o 101021801 y en el que pa icipa como coo dinado del p oyec o el G upo GASS de la Uni e sidad Complu ense de Mad id (G upo de An´alisis, Segu idad y Sis emas, h ps://gass.ucm.es, g upo 910623 del ca ´alogo de g upos de in es igaci´on econocidos po la UCM). Adem´as de la Uni e sidad Complu ense de Mad id pa icipan en HEROES 21 en idades ubicadas en 17 pa´ıses: 11 de pa´ıses de la UE (Aus ia, B´elgica, Bulga ia, F ancia, G ecia, I landa, Le onia, Li uania, Po ugal, Espa˜na, Reino Unido), 1 pa´ıs asociado (Suiza) y 5 e ce os pa´ıses (Bangladesh, B asil, Colombia, Pe ´u, U uguay). Dichas en idades son: Uni e si y o Ken (Reino Unido), The F ee Uni e si y o B ussels (B´elgica), The F ench Na ional Resea ch Ins i u e o Digi al Science and Technology – INRIA (F ancia), Cen e o Secu i y S udies – KEMEA (G ecia), In e na ional Cen e o Mig a ion Policy De elopmen – ICMPD (Aus ia), In e na ional Cen e o Missing and Exploi ed Child en – ICMEC (Suiza), IDENER Resea ch De elopmen Ag upaci´on de In e ´es Econ´omico (Espa˜na), A hena Resea ch Cen e – ARC (G ecia), T ila e al Resea ch and Consul ing (Reino Unido), Cen e o Women and Child en S udies – CWCS (Bangladesh), Cen e Agains Human T a icking and Exploi a ion – KOPZI (Li uania), Po uguese Associa ion o Vic im Suppo – APAV (Po ugal), Fundaci´on Renace (Colombia), The G eek Council o Re ugees – GCR (G ecia), B azilian Associa ion o he De ense o Child en o Child en and You h – ASBRAD (B asil), Hellenic Police (G ecia), La ia Na ional Police (Le onia), Gene al Di ec o a e o he Figh agains O ganized C ime (Bulga ia), Di ecci´on Gene al de la Polic´ıa – DGP (Espa˜na), Fede al Police (B asil), Fede al Highway Police (B asil), Sec e a ´ıa de In eligencia Es a ´egica de Es ado – P esidencia de la Rep´ublica O ien al del U uguay (U uguay). Tienen m´as in o maci´on en: h ps://co dis.eu opa.eu/p ojec /id/101021801 h ps://he oes- c .eu 1.3. Obje o de la In es igaci´on El obje i o de es e p oyec o es el dise˜no e implemen aci´on de un modelo de NLP capaz de econoce en idades nomb adas en idioma espa˜nol en un ex o con una o ien aci´on a p ocesos legales. Con es e modelo se p e ende au oma iza el p oceso que ealiza un 1.4. Plan de T abajo 3 in es igado al ealiza una an´alisis de los a chi os con enidos en un disposi i o incau ado en idioma espa˜nol. Po lo an e io es necesa io ealiza una an´alisis de los di e en es algo i mos de p ocesamien o de NLP que pe mi an un p ocesamien o ´agil y la iden i icaci´on p ecisa del con ex o de la ase analizada y ealiza el econocimien o de en idades. Adem´as, es e es udio a a de comp ende el p oceso de ex acci´on de en idades nomb adas, analiza su es uc u a e iden i ica los p incipales e os a los que se en en an los ingenie os in o m´a icos a la ho a de c ea es os modelos. Es e abajo p opone un modelo que pe mi a educi el iempo empleado po pa e de los in es igado es pa a el an´alisis de a chi os en espa˜nol con enidos en disposi i os incau ados en un p oceso judicial. 1.4. Plan de T abajo El desa ollo de es e p oyec o es a es uc u ado en es e apas ( e Figu a 1.1): 1. In es igaci´ on del Es ado del A e: Es a e apa se cen a en la in es igaci´on de los abajos y p oyec os pun e os ele an es pa a es e abajo, an o as´ı como la adquisici´on de los conocimien os necesa ios pa a la ealizaci´on de es e abajo. Una ez aco dado el T abajo de Final de G ado (TFG), se ealizo una euni´on in oduc o ia pa a explica la inalidad y los pun os a lle a a cabo a lo la go de es e p oceso. Es a euni´on ue seguida de euniones semanales pa a con el in de ealiza un seguimien o del p oyec o y pa a esol e las dudas que su gie an. En es as euniones ambi´en se explica on las co ec as o mas de busca documen aci´on acad´emica, los o ma os eque idos y las he amien as usadas, siendo una de ellas Google Schola , que se decidi´o que se ia la usada pa a es e p oyec o. Como los in eg an es del equipo no dispon´ıan de odos lo conocimien os necesa ios elacionados con las In eligencias A i iciales, se ealiza on a ios cu sos pa a ob ene dichos conocimien os. Finalmen e, una ez adqui idos los conocimien os base y es udiado los emas cen ales del p oyec o basados en los obje i os del mismo, el equipo comenz´o con el desa ollo de modelo. 2. Desa ollo: Una ez ob enida la in o maci´on necesa ia, se empez´o a abaja en el desa ollo del modelo, pe o sin deja de lado la in es igaci´on de soluciones ´op imas. Po ello, en es a ase se examin´o el lenguaje de p og amaci´on Py hon y concep os a anzados de biblio ecas como Spacy yTo ch. Adem´as, los ex os ecogidos de las uen es p opo cionadas po las ob as le´ıdas du an e la ase an e io se e ique a on con en idades pa a p opo ciona los conjun os de en enamien o del modelo. Tambi´en se ealizo el despliegue del en o no donde se ealiza ´ıan an o los en enamien os, como las e aluaciones del modelo. 10 Cap´ ı ulo 2. Con ex o de la In es igaci´ on 2.4.3. Mecanismo de a enci´on Sabiendo es o, lo p ime o es en ende el mecanismo de a enci´on en el que se basa es a ecnolog´ıa, o mado po un dicciona io ipo hashmap. La inalidad es encon a la simili ud en e dos Embeddings. Es o se ealiza median e la Funci´on 2.1. Z=So max(QKT √dk )V(2.1) Siendo Qla ma iz que con iene el Embedding de los Tokens que se es ´a e aluando, la ma iz Kcon iene los Tokens como las cla es del dicciona io y la ma iz Vque con iene el Embedding de salida. La unci´on So max() con ie e los alo es de a enci´on en alo es del ango [0-1] pa a as´ı pode en ende los como po cen ajes e e en es a la a enci´on o elaci´on que se p esen a en e dos Tokens ( e Tabla 2.1). Conociendo es o, ya es posible con inua con la explo aci´on de los dis in os componen es. Tabla 2.1: Ejemplo a enci´on - El abuelo do m´ıa en la habi aci´on anquilamen e El 0.5 0 0 0 0 0 0 abuelo 0 0.5 0.8 0 0 0.4 0.8 do m´ıa 0 0.8 0.5 0 0 0 0 en 0 0 0 0.5 0 0 0 la 0 0 0 0 0.5 0 0 habi aci´on 0 0.4 0 0 0 0.5 0 anquilamen e 0 0.8 0 0 0 0 0.5 2.4.4. Codi icado Cada codi icado se cons uye po una capa de sel -a en ion y una ed neu onal eed- o wa d, a la salida gene ada po ambos elemen os se le aplica un p oceso de Add & No m an es de se en egada al elemen o siguien e. La Figu a 2.3 mues a es a es uc u a. En es e apa ado se explica la inalidad y el m´e odo de uso de los dis in os componen es an e io men e mencionados. Sel -a en ion: En es a capa se p oduce una compa aci´on de cada uno de los Tokens con el es o de los Tokens de la misma ase, median e el uso de la Funci´on 2.1, siendo los alo es de las ma ices los elemen os de la misma ase. Red neu onal eed- o wa d: Es un ipo de ed neu onal que cons a de nen adas ynsalidas, en la que la in o maci´on luye en un ´unico sen ido, desde la en ada has a la salida sin la exis encia de bucles ni eg esiones. 2.4. A qui ec u a T ans o me 11 Add &No m: Es la uni´on de dos a eas, la p ime a, es una conexi´on esidual que une la en ada de cada capa con la salida de la misma, es o nos pe mi e man ene los pesos a lo la go del iempo de ejecuci´on. Dicha me odolog´ıa ue ampliamen e explo ada en las edes ResNe [HZRS15]. Y la segunda es una a ea de no malizaci´on de capa [BKH16], que se asegu a de que no se p oduzcan cambios muy b uscos sob e los da os al pasa de una capa a o a y as´ı acele a el en enamien o del modelo y con un mayo ni el de gene alizaci´on. Figu a 2.3: Es uc u a del codi icado 2.4.5. Decodi icado Aho a se con inua con la es uc u a de decodi icado , que como se obse a en la Figu a 2.4, es muy simila a la del codi icado (Figu a 2.3). Figu a 2.4: Es uc u a del decodi icado 12 Cap´ ı ulo 2. Con ex o de la In es igaci´ on Las ´unicas di e encias son la apa ici´on de una nue a capa de a enci´on, en es e caso de a enci´on enmasca ada, y o a de Add &No m. La a enci´on enmasca ada no es mas que el mecanismo de a enci´on an e io men e mencionado, pe o ocul ando la pa e supe io de echa, con es o se e i a que el modelo conozca el alo de cie as a enciones an es de llega a ellas, ya que en el decodi icado se gene an en o den de apa ici´on, al ocu i es o y como se mues a en la Tabla 2.2, no puede conoce la a enci´on de “abuelo- anquilamen e”, ya que es a a´un no se ha gene ado. Tabla 2.2: Ejemplo a enci´on enmasca ada - El abuelo do m´ıa en la habi aci´on anquilamen e El 0.5 - - - - - - abuelo 0 0.5 - - - - - do m´ıa 0 0.8 0.5 - - - - en 0 0 0 0.5 - - - la 0 0 0 0 0.5 - - habi aci´on 0 0.4 0 0 0 0.5 - anquilamen e 0 0.8 0 0 0 0 0.5 La salida del codi icado es a conec ada al decodi icado median e la capa segunda capa de a enci´on del mismo, donde se uel en a ealiza las unciones sob es las ma ices Q,K, V, solo que en es e caso Q,Kson las salidas del codi icado y Ves lo que se ecibe del mecanismo de a enci´on enmasca ada. En el caso de ealiza el en enamien o pa a la a ea de TA el modelo ecibi ´ıa “El abuelo do m´ıa” y “G andpa was sleeping”, mien as que en el momen o de ealiza la a ea el modelo ecibi ´a solamen e “El abuelo do m´ıa” y as pasa po ncodi icado es yndecodi icado es se ia capaz de gene a la salida “G andpa was sleeping” de o ma au ´onoma. Los ncodi icado es y ndecodi icado es p esen an el mismo uso que las capas de las ampliamen e conocidas RNN. 2.5. Modelos de Lenguaje P een enados En es a secci´on se p esen an los modelos BERT,RoBERTa,ALBERT,Dis ilBERT y SpanBERT. La Tabla 2.3 p esen a un esumen de las ca ac e ´ıs icas m´as ep esen a i as de es os modelos. 2.5.1. BERT La Rep esen aci´on de Codi icado Bidi eccional de T ans o mado es (BERT del ingl´es Bidi ec ional Encode Rep esen a ions om T ans o me s), p esen ado po p ime a ez en [DCLT19], es una me odolog´ıa basada en la a qui ec u a T ans o me pa a la 2.5. Modelos de Lenguaje P een enados 13 Tabla 2.3: Resumen de modelos NLP p e-en enados Modelo #Pa ´ ame os Laye /Hidden/Heads M´ e odo BERT [DCLT19] Base:110M 12/768/12 T ans o mado bidi eccional MLM, NSP BERT [DCLT19] La ge:340M 24/1024/16 T ans o mado bidi eccional MLM, NSP RoBERTa [LOG+19] Base:123M 12/768/12 BERT sin NSP usando enmasca amien o din´amico RoBERTa [LOG+19] La ge:355M 24/1024/16 BERT sin NSP usando enmasca amien o din´amico ALBERT [LCG+20] Base:11M 12/768/12 BERT con pa ´ame os educidos, SOP (no NSP) ALBERT [LCG+20] La ge:17M 24/1024/16 BERT con pa ´ame os educidos, SOP (no NSP) Dis ilBERT [SDCW20] 66M 6/768/12 T ans o me s, des ilaci´on de BERT SpanBERT [JCL+20] Base:110M 12/768/12 T ans o me s, Ap endizaje supe isado SpanBERT [JCL+20] La ge:340M 24/1024/16 T ans o me s, Ap endizaje supe isado MLM: M´asca a de Lenguaje, NSP: P edicci´on de la siguien e o aci´on, SOP: P edicci´on de o aciones ep esen aci´on del lenguaje [VSP+17]. Pa a es e modelo se u iliza la ep esen aci´on ec o ial de las palab as jun o con el ec o de posici´on, como se mues a en la Figu a 2.5, pe o modi ica dicha a qui ec u a y solo se u ilizan los codi icado es. Figu a 2.5: En ada Be [DCLT19] Es e mismo p esen a dos es uc u as, con di e encias m´ınimas, dependiendo de si el p oyec o se encuen a en la ase de p e-en ena el modelo o de ealiza el ine- uning del mismo ( e Figu a 2.6). Figu a 2.6: A qui ec u a Be [DCLT19] Den o de la ase de p e-en enamien o, se pueden dis ingui dos a eas dis in as, Modelado del Lenguaje Enmasca ado (MLM), del ingl´es Masked Language Modeling y P edicci´on 14 Cap´ ı ulo 2. Con ex o de la In es igaci´ on de la F ase Siguien e (NSP), del ingl´es Nex Sen ence P edic ion. MLM: pa a es a a ea, du an e la ase de p e-p ocesamien o, se enmasca an el 15 % de los okens de una ase de o ma alea o ia y se in en a p edeci el alo de ese oken, den o de ese 15 % de okens enmasca ados no siemp e se enmasca a, el 80 % ealmen e se enmasca a, el 10 % se le asigna el alo de o o oken alea o io, y el ´ul imo 10 % se deja con el alo o iginal. NSP: se en ena el modelo pa a que dadas dos ases, A y B, es e sea capaz de de ec a si la ase B es la siguien e a la ase A. Pa a consegui es o, el 50 % de las eces se ma ca la ase B como isNex y el o o 50 % como No Nex . Es o es ex emadamen e ´u il pa a la a ea de espues a a p egun as. En la ase de ine- uning, la idea es een ena el modelo con nue os da os pa a el uso especi ico que se quie e da al modelo ( ´ease en las Figu as 2.7,2.8), bas´andose en los pesos ya conocidos po el mismo. Al ealiza se sob e es os pesos ya conocidos, es a a ea se ealiza con m´ınimo cos e en ecu sos. (a) Ta ea de Clasi icaci´on de Pa es de F ases: MNLI, QQP, STS-B, MRPC, RTE, SWAG. (b) Ta eas de Clasi icaci´on de F ases Indi iduales: SST-2, CoLA Figu a 2.7: Ejemplo usos de BERT - Clasi icaci´on [DCLT19] (a) Ta ea de Respues a a P egun as SQuAd V1.1 (b) Ta ea de E ique ado de F ases Indi iduales: CoNLL-2003 NER Figu a 2.8: Ejemplo usos de BERT - P egun a Respues a y NER [DCLT19] 2.5. Modelos de Lenguaje P een enados 15 2.5.2. RoBERTa RoBERTa, p esen ado en [LOG+19] y es una op imizaci´on de BERT [DCLT19] implemen ada en Py o ch [PGM+19] que se cen a en la a ea del MLM, en la que se modi ican an o algunos pa ´ame os cla e y el co pus de en enamien o como algunos m´e odos del p opio en enamien o. En e los cambios conc e os, se p oduce una sus i uci´on del m´e odo de enmasca ado es ´a ico usado en BERT, po un enmasca ado din´amico, que consis e en duplica la ase 10 eces y en ega la en cada ´epoca cambiando el oken enmasca ado. Con es o se consigue que el modelo ea dis in as e siones de la misma ase, cosa que mejo a la p ecisi´on. Tambi´en se elimina el obje i o de NSP que p o ocaba una pe dida de endimien o y p ecisi´on al ealiza a eas de downs eam, en el a iculo [LOG+19] se p opone la hip´o esis de que es o se debe a la incapacidad del modelo de ap ende elaciones si uadas a una g an dis ancia. Es a pe dida se consigui´o educi ag upando ases con iguas, que pueden no p ocede de un mismo documen o. O o de los cambios ealizados en el en enamien o es el aumen o del ama˜no de los mini-ba ches y del By e-Pai Encoding (BPE) [SHB16] a ni el de by e. Es o, sumado al aumen o de i e aciones y del ama˜no del co pus de en enamien o, en e lo que se encuen a el uso de los conjun os “BOOKCORPUS” [ZKZ+15] y “CC-NEWS”, es e ´ul imo ecolec ado po ellos, jun o con o os que no se pudie on publica , es o se aduce en un aumen o de la p ecisi´on del modelo, que se e leja al ejecu a la e aluaci´on sob e los benchma ks.RoBERTa consigui´o una pun uaci´on de 88.5 de media sob e odas las a eas p opues as po GLUE [WSM+19],lo que lo si ´ua como el mejo modelo seg´un es e benchma k. Tambi´en se ealiza on e aluaciones sob e los benchma ks SQuAD yRACE [LXL+17] en los que RoBERTa consigui´o pun uaciones que igualan a las del es ado del a e sin ealiza en enamien o especi ico pa a las a eas que p oponen dichos benchma ks. Sus esul ados demues an la impo ancia de un co pus de ama˜no adecuado y de la op imizaci´on an o como la ele ancia. 2.5.3. ALBERT ALBERT [LCG+20] en compa aci´on con el modelo BERT, que es conocido po se cos oso en memo ia y iempo, debido a los nume osos pa ´ame os usados en su en enamien o, 110 millones en la e si´on base y 340 millones en la e si´on ampliada, ALBERT a i ma ene una educci´on del 89 % en pa ´ame os en compa aci´on con BERT, con casi el mismo endimien o en el benchma k, y odo es o es g acias a sus mejo as aplicadas, ales como , ac o izaci´on de los pa ´ame os de inc us aci´on, compa i pa ´ame os en e capas, ´ecnicas de educci´on de pa ´ame os, e c [LCG+20]. 16 Cap´ ı ulo 2. Con ex o de la In es igaci´ on Compa i pa ´ame os en e capas, lo que educe la can idad de pa ´ame os ´unicos, es una de las p incipales inno aciones y modi icaciones de ALBERT, mien as que en el BERT con iene un conjun o de pa ´ame os ´unicos pa a cada codi icado . Ag ega una capa de ama˜no m´as peque˜no en e el ocabula io y la capa ocul a pa a descompone la ma iz de inc us aci´on de ama˜no V·Hen dos ma ices m´as peque˜nas de ama˜no V·EyE ·H. O a inno aci´on que des aca en ALBERT es la p´e dida de P edicci´on de O den de O aciones (Sen ence O de P edic ion (SOP),del ingl´es Sen ence O de P edic ion), que es p edeci +1 pa a pa es consecu i os de o aciones en el mismo documen o y -1 si se in e cambia el o den de las o aciones o si son de documen os di e en es. En gene al, es as mejo as de i an a una educci´on signi ica i a en el n´ume o de pa ´ame os, 11 millones en la e si´on base y 17 millones en la e si´on ampliada, lo que se aduce en una educci´on de la memo ia necesa ia pa a almacena los pa ´ame os del modelo. A pesa de ene menos pa ´ame os, ALBERT alcanza un endimien o simila e incluso mejo (GLUE benchma k 0.894, en la e si´on ensamble) al de BERT(GLUE benchma k 0.821, e sion ampliada) en el benchma k. 2.5.4. Dis ilBERT Dis ilBERT es un modelo T ans o me peque˜no, ´apido, econ´omico, lige o p een enado con des ilaci´on del conocimien o y ue en enado median e el co pus con el que el modelo BERT ue en enado o iginalmen e. Tiene un 40 % menos de pa ´ame os que be -base-uncased, unciona un 60 % m´as ´apido mien as p ese a m´as del 95 % del endimien o de BERT seg´un se mide en la GLUE [WSM+19]. La des ilaci´on del conocimien o [SDCW20] es un m´e odo de comp esi´on de modelos en el que un modelo m´as peque˜no se en ena pa a imi a las acciones de un modelo o g upo de modelos m´as g andes. En su abajo, el modelo compac o,Dis ilBERT yBERT compa en una a qui ec u a gene al simila pe o a meno escala. Se eliminan las inc us aciones de ipo de oken y el poole mien as que el n´ume o de capas se educe a la mi ad. La mayo ´ıa de las ope aciones u ilizadas en la a qui ec u a del T ans o me han sido muy op imizadas po los amewo ks mode nos de ´algeb a lineal, y sus in es igaciones han demos ado que los cambios en la dimensi´on inal del enso , ambi´en conocida como dimensi´on de ama˜no ocul o, ienen poco impac o en la e iciencia compu acional pa a un n´ume o ijo de pa ´ame os. Po lo an o, se cen an en educi el n´ume o de capas. En conclusi´on, Dis ilBERT es una e si´on m´as peque˜na y ´apida de BERT que se en ena median e des ilaci´on del conocimien o, lo que pe mi e una educci´on signi ica i a en el n´ume o de pa ´ame os mien as se man iene un al o ni el de endimien o en a eas de comp ensi´on del lenguaje na u al. 2.5. Modelos de Lenguaje P een enados 17 2.5.5. SpanBERT Figu a 2.9: Una ilus aci´on del en enamien o SpanBERT [JCL+20] SpanBERT [JCL+20] es un modelo de lenguaje basado en BERT que se p e-en ena en selecci´on de agmen os de ex o. A di e encia de BERT, que enmasca a okens indi iduales, SpanBERT u iliza una dis ibuci´on geom´e ica pa a enmasca a agmen os comple os de palab as. Adem´as, in oduce un span-bounda y objec i e (SBO) que impulsa al modelo a p edeci odo el agmen o enmasca ado a pa i de los okens obse ados en su l´ımi e. Es as di e encias pe mi en que SpanBERT ep esen e y p ediga mejo compa aci´on con BERT. SpanBERT puede u iliza se pa a di e sas ac i idades de GLUE, as´ı como pa a una amplia gama de a eas de PNL, como la ex acci´on de elaciones, la esoluci´on de elaciones y la espues a a p egun as. En los expe imen os [JCL+20], SpanBERT supe a no ablemen e a BERT y o os modelos en es as a eas. Po ejemplo, en GLUE,SpanBERT log a el mejo endimien o en sie e de las nue e a eas. Pe o al igual que BERT,SpanBERT equie e una g an can idad de da os de en enamien o y ecu sos compu acionales pa a log a un endimien o ´op imo. En cuan o a la mejo a de la ep esen aci´on y p edicci´on de las pa es del ex o, SpanBERT ha ob enido en gene al esul ados alen ado es. Cap´ı ulo 3 Es ado del A e En es a secci´on se hace un epaso de los abajos ecien es pe inen es pa a es e TFG. 3.1. Sc aping La ´ecnica sc aping [Zha17]consis e en la ex acci´on au oma izada de da os. Es deci , es un p oceso al que un sc ip cap u a in o maci´on de algun luga de mane a es uc u ada y au oma izada. El p oceso de sc aping se equie e el uso de he amien as de so wa e, y seg´un el luga que es as ecopilan usas de e minadas he amien as, en web sc aping algunas de las he amien as m´as popula es son: 1. Beau i ulSoup: Es un m´odulo de Py hon que acili a y hace m´as e icaz el es udio y la ex acci´on de da os de Hype ex T ans e P o ocol (HTML) yEx ensible Ma kup Language (XML). 2. Sc apy: un amewo k de Py hon que se u iliza pa a cons ui sc ape s de o ma ´apida y e icien e. 3. Selenium: una he amien a que pe mi e au oma iza la in e acci´on con una p´agina web, lo que es ´u il pa a ex ae in o maci´on de p´aginas web que equie en m´ul iples in e acciones ya sea como inicia sesi´on, egis a , e c. A di e encia de las dos an e io es selenium es m´as so is icado. Pa a el p oceso de sc aping de a chi os PDF, algunas de las he amien as m´as u ilizadas son: 1. PyPDF2: una biblio eca de Py hon que pe mi e analiza a chi os PDF y ex ae su con enido an o im´agenes como ex os, es sencillo de maneja y e icien e pa a pd que solo nos in e ese su ex o o la imagen. 19 26 Cap´ ı ulo 4. Me odologia del P oyec o 4.1. Recolecci´on de los da os Es e p ime paso del pipeline p opues o, in oluc a la ecopilaci´on de los ex o de em´a icas legal que cons i ui ´an los co pus necesa ios pa a el en enamien o de los modelo de NLP. La a ea de ecopilaci´on de da os se e ie e a la adquisici´on de los da os de ex o que se p ocesa ´an. Es os da os pueden p o eni de di e sas uen es, como bases de da os, si ios web, cha s, documen os, e c. Hay que ecopila los da os y limpia los an o como sea posible, eliminando in o maci´on innecesa ia y e isando los ex os pa a ob ene los mejo es esul ados. 4.1.1. Web Sc aping Web Sc aping [Zha17] es una ´ecnica que si e pa a ex ae o ecolec a in o maci´on de in e ne , y gua da lo en un sis ema de base de da os, donde pos e io men e se le aplica an ´ecnicas de p ocesamien o. Los pasos a segui : 1. Iden i icaci´on del si io web del cual ex ae la in o maci´on. 2. Se ealiza la inspecci´on del c´odigo HTML del si io pa a de e mina qu´e in o maci´on se desea ex ae y d´onde se encuen a ubicada. 3. C eaci´on de un sc ip que au oma iza el p oceso de ex acci´on de da os. 4. Ejecuci´on del sc ip , en es e paso hay que ene en cuen a las pol´ı icas de p i acidad y ´e minos de se icio del si io web escogido. 5. Fil ado del con enido ecopilado, como la eliminaci´on de ca ac e es especiales innecesa ios o e a as p oducido a la ho a de la desca ga, en e o as. 6. Almacena los da os ex a´ıdos en un o ma o es uc u ado, pa a su u ilizaci´on m´as a de ya sea pa a an´alisis u o a aplicaciones. 4.1.2. PDF Sc aping Se pa e de una idea simila a la de web Sc aping siguiendo los siguien es pasos: 1. Se iden i ica el pd que se necesi a ex ae in o maci´on. 2. Se selecciona la he amien a de pd sc aping PyPDF2 y se c ea un sc ip que au oma iza el p oceso de ex acci´on de da os. 3. Se ealiza el il ado del con enido. 4. Almacena los da os. 4.2. Da os de en ada 27 4.2. Da os de en ada El segundo paso del pipeline se en oca en la en ada de da os de ex o, los cuales son oda la in o maci´on ecolec ada du an e el paso an e io . Es os da os pueden se de cualquie ipo, desde a ´ıculos de no icias has a his o iales de cha . Sin emba go, el conjun o de ex o en s´ı no es su icien e pa a en ena los modelos de NLP, ya que es necesa io e ique a los da os con in o maci´on adicional. Es e e ique ado pe mi i ´a a los modelos ap ende a iden i ica y ex ae en idades y elaciones espec´ı icas de los ex os de en ada. Es e e ique ado se lle a ´a a cabo en el siguien e paso del p oceso. 4.3. P e-P ocesamien o Una ez ob enidos los ex os que se an a u iliza , en es a secci´on se expond ´an y explica ´an las acciones necesa ias que hay que segui an es de en ena el modelo. 4.3.1. P epa aci´on del e ique ado El p ime paso ue ealiza el anonimizado de los da os de ca a al cumplimien o de la Ley O ganica de P o ecci´on de Da os (LOPD), median e un so wa e que sus i u´ıa los alo es ele an es po o os con simila es uc u a, pe o sin ninguna elaci´on con el o iginal. T as es o se de inie on las e ique as ele an es pa a la cues i´on dada. Debido a la em´a ica legal que se p e ende da al modelo, las e ique as deben se ele an es en el ´ambi o o “je ga” delic i o-judicial, po es o las e ique as seleccionadas ue on: 1. PER : Nomb es de Pe sonas, eales o ic icios. 2. ORG : O ganizaciones, compa˜n´ıas, agencias, ins i uciones, e c. 3. LOC : Ubicaciones. 4. DATE : Fechas en cualquie o ma os. 5. DRUGS : Nomb es de d ogas. 6. WEAPON : Nomb es o ca ego ´ıas de a mas. 7. NAL : Nacionalidades. 8. LAW : Nomb es de documen os legales. 9. DI : Documen os de Iden idad. 10. PASP : Pasapo es. 28 Cap´ ı ulo 4. Me odologia del P oyec o 11. MISC : P o esiones, pues os, en e medades..., concep os ele an es sin ca ego ´ıa especi ica. Pa a ealiza el e ique ado de los co pus se u iliza on he amien a p´ublicas que son compa ible con el modelo p opues o. La he amien a elegida po el equipo de in es igaci´on dada sus en ajas ´ecnicas ue UBIAI, la cual es una he amien a eemium de ano aci´on que ayuda a e ique a da os, con unciones de ano aci´on de ex o au om´a ico pa a agiliza el p oceso de e ique ado, adem´as ans o ma los da os no es uc u ado en in o maci´on ´u il. Los pasos que se ealiza on pa a el e ique ado son: 1. De alla el e ique ado y selecci´on de ipo, en el p esen e abajo se u iliz´o Ano aci´on basado en in e alo. 2. A˜nadi el dicciona io de e ique a. 3. En el paso de a˜nadi dicciona io de elaciones se a˜nade de la misma o ma que la del e ique a, luego se selecciona la clasi icaci´on bina ia y se selecciona a chi o que se a a abaja . 4. Se selecciona la opci´on de Au o De ec si uado en la pa e de la izquie da, es o es la de ecci´on au om´a ica, que una ez que se e ique a una palab a, las epe idas se e ique an au om´a icas. Y Label dialog mues a una abla de ipos de e ique as pa a selecciona , una ez que se sub ayan las palab as o conjun os de palab as que in e esen, se escoge su e ique a adecuada. 5. Una ez inalizado, se desca ga el p oyec o en el o ma o necesa io dependiendo de la u ilidad que se le da, la salida que se busca es de IOB Fo ma , es o nos da un a chi o en o ma o .Tab Sepa a ed Values (TSV) modi icable. 4.3.2. P epa aci´on de los a chi os de en enamien o Una ez ya ob enido el co pus del modelo, se ealiza la sepa aci´on del mismo en los spli s de en enamien o y p ueba. Es a sepa aci´on se hizo man eniendo in ac a la es uc u a de cada una de la ases pa a no pe de el con ex o de la misma de ca a al en enamien o. Es o se ealiz´o median e una unci´on de la lib e ´ıa sklea n que pe mi e la sepa aci´on equilib ada po e ique a y ase, lle ando el 80 % del co pus a en enamien o y el 20 % es an e a es eo. Es o pe mi i´o ealiza una dis ibuci´on de e ique as equilib adas ( e Figu a 4.3), siendo o al, en enamien o y p ueba espec i amen e, pe o se obse ´o que la e ique a PASP solo apa ec´ıa una ez en los 33 documen os que componen el co pus. Con es o se decidi´o elimina dicha e ique a po los p oblemas y la imposibilidad de en enamien o que gene aba. 4.3. P e-P ocesamien o 29 (a) Conjun o de da os Comple o (b) Conjun o En enamien o (c) Conjun o de P ueba Figu a 4.3: N´ume o de apa iciones po e ique a Adem´as se ealiz´o una comp obaci´on manual con el in de e i ica que las e ique as es u ie an equilib adas en cuan o al n´ume o de apa iciones en las po ciones pa a en enamien o y p ueba y con es o minimiza el iesgo del ing esa uido a los modelos de Machine Lea ning (ML). Se man u o el po cen aje de spli 80/20 % lo que se aduce en 26 a chi os de los 33 o ales pa a en enamien o y los 7 es an es pa a p ueba. Debido a la g an di e encia en longi ud de los a chi os, se decidi´o que inalmen e ue an 23 pa a en enamien o y 10 pa a es eo. Una ez gene ados los dos a chi os TSV se usa la biblio eca SpaCy pa a con e i es os en a chi os bina ios que la llamada ain pueda sopo a . Es a no ue el p ime plan de p epa aci´on de los a chi os que se p opuso, o iginalmen e se p opuso con e i es os a chi os TSV en a chi os JSON, pa a pode comp oba la in eg idad y es uc u a de los mismo. Pe o es o supuso la co upci´on de cie os okens po el ipo de codi icaci´on del a chi o, cosa que imped´ıa que el modelo ap endie an dichas palab as. Con lo cual se paso a ealiza la con e si´on an e io men e explicada, que es la que se usa pa a odas las pos e io es ejecuciones y p uebas. En es e pun o se gene a el a chi o de con igu aci´on, que con iene los pa ´ame os bajo los cuales se ealiza an los en enamien os de los dis in os modelos. Es os pa ´ame os se explica an en la siguien e secci´on. Sob e es e a chi o de con igu aci´on se ealizan una se ie de comp obaciones sob e su in eg idad y es uc u a. Pa a ealiza es a comp obaciones se u iliza la biblio eca SpaCy an e io men e mencionada. Tambi´en median e el uso de es a biblio eca se comp ueba el es ado de los a chi os en enamien o y es eo, pe mi iendo comp oba si el n´ume o de mues as de cada e ique a cumple el m´ınimo ecomendable pa a el en enamien o y o as m´e icas ecomendables pa a el en endimien o de la calidad del en enamien o. Ya ealizadas es as comp obaciones es posible en ena el modelo. 30 Cap´ ı ulo 4. Me odologia del P oyec o 4.4. En enamien o del modelo Se dispone de dos conjun os de da os: el p ime o comple o con X e ique as y el segundo un poco mas educido con Y e ique as. El en enamien o se ealiza median e la biblio eca SpaCy, que simpli ica eno memen e es a a ea. Pa a el modelo de NLP p e-en enado se ha seleccionado RoBERTa, que ha demos ado un excelen e endimien o en a eas de p ocesamien o de lenguaje na u al, y lo is o en el Cap´ı ulo 3en el es ado del a e. An es de p ocede al en enamien o, se ealiza el ajus e del modelo RoBERTa u ilizando un spli alea o io. De es a o ma, se consigue una mejo ajus e de los pesos del modelo y una mayo e icacia en la a ea de ex acci´on de en idades. Una ez ajus ado, se inicia el p oceso de en enamien o con los pa ´ame os especi icados en el a chi o de con igu aci´on. Es e paso es undamen al pa a log a un modelo de calidad que sea capaz de ex ae las en idades co ec amen e del ex o. Una ez ya ealizado el en enamien o el siguien e paso se ia el es udio de las m´e icas espec o a la e icacia del modelo. 4.5. Lib e ´ıas U ilizadas Beau i ul Soup (BS): es una lib e ´ıa ex e na de Py hon, que pe mi e ex ae in o maci´on de documen os HTML yXML, con i i´endolo en un ´a bol de obje os de Py hon que puede se eco ido. De es a mane a se puede ealiza un il ado a base del nomb e de la e ique a de la pagina web escogida pa a as´ı pode il a con el con enido necesa io pa a la a ea. Una ez il ado el con enido se u iliza la he amien a MongoDB pa a el gua dado de da os. PyPDF2: es una lib e ´ıa de Py hon que pe mi e ex ae ex o y me ada os del pd escogido To ch: es un paque e de c´odigo abie o que pe mi e gene a a eas y asigna las a la G aphics P ocessing Uni s (GPU). De es a o ma se consigue acele a el p ocesamien o de g andes can idades de da os debido a la es uc u a de las GPU. Fue c eado en el lenguaje de sc ip ing Lua. Py o ch: es un amewo k de Py hon basado en la biblio eca To ch y que pe mi e la c eaci´on de edes neu onales p o undas basado en el manejo de GPU que apo a To ch. Jun o a Tenso Flow es una de las pla a o mas mas usadas en es e campo. Py o ch es la m´as usada pa a la in es igaci´on debido a su g an capacidad de pa ame izaci´on. SpaCy: es una biblio eca de c´odigo abie o cuyo in es el manejo de NLP en Py hon. Es a biblio eca pe mi e el uso de Py o ch sin ene que modi ica odos 4.5. Lib e ´ ıas U ilizadas 31 los pa ´ame os disponibles en el mismo, cosa que acili a mucho la c eacion de modelos NLP. Tambi´en pe mi e el uso de la a qui ec u a T ans o me explicada an e io men e. En e las ca ac e ´ıs icas disponibles en SpaCy es a la de pode e alua an o el co pus, como las m´e icas del modelo, as´ı como ealiza el en enamien o del modelo en si y mul i ud de a eas di e sas elacionadas con la c eaci´on, e aluaci´on y gua dado de un modelo NLP. Cap´ı ulo 5 Expe imen os y Resul ados En es a secci´on se an a discu i el o mulado de los expe imen o y los esul ados ob enidos. En e es os pun os es ´an an o la desc ipci´on del co pus como del p oceso de en enamien o y e aluaci´on del modelo. 5.1. Desc ipci´on del co pus Los dis in os documen os que con o man el co pus gene ado pa a es e TFG co pus p o ienen de la base de da os de sen encias judiciales del Consejo Gene al del Pode Gene al (CGPJ), odos es os ex os p esen an una em´a ica com´un de los deli os que e lejan, siendo es a, la ag esi´on al bienes a psicol´ogico y ´ısico de las ´ıc imas. Es os ex os p esen a una amplia can idad de e e encias a no mas legales. El co pus co pus es ´a compues o po dis in os documen os que e lejan casos judiciales elacionados con deli os que suponen la ag esi´on al bienes a psicol´ogico y ´ısico de las ´ıc imas. Es os documen os han sido ecopilados a pa i de la base de da os de em´a icas legales. Todos ellos con ienen e e encias a no mas legales ele an es pa a el caso, lo que les con ie e un al o g ado de complejidad ´ecnica y ju ´ıdica. Es impo an e des aca que se dispone de dos co pus iguales, pe o con algunas di e encias. El p ime o, denominado ”da ase comple o”, con iene cua o e ique as adicionales, DRUGS(d ogas), WEAPON(a mas), NAL(nacionalidad), DI(documen o de iden idad). Po su pa e, el segundo co pus, denominado ”li e”, se cen a en las e ique as m´as gen´e icas, que son: PER (pe sona), LOC (localizaci´on), DATE ( echa), ORG (o ganizaci´on), MISC (miscel´anea) y LAW (leyes y no ma i as). Ambos co pus se han some ido a un me iculoso a amien o p e io pa a ga an iza la exac i ud de la in o maci´on. Adem´as, se han ealizado di e sas a eas de limpieza y no malizaci´on, como la eliminaci´on de ca ac e es especiales, signos de pun uaci´on y 33 34 Cap´ ı ulo 5. Expe imen os y Resul ados palab as ac´ıas, as´ı como la lema izaci´on y la eliminaci´on de palab as epe idas. De es a mane a, se ha ob enido un conjun o de da os de al a calidad y consis encia que se u iliza pa a el en enamien o y e aluaci´on de modelos de p ocesamien o de lenguaje na u al en el ´ambi o ju ´ıdico. Tabla 5.1: N´ume o e ique as po clase del da ase comple o -TRAIN TEST TOTAL PER 5645 1796 7440 LOC 927 344 1271 DATE 5223 1663 6886 WEAPON 102 4 106 DRUGS 31 6 37 MISC 1702 668 2370 ORG 6014 1848 7862 DI 13 5 18 LAW 11864 3745 15609 NAL 9 4 13 La Tabla 5.1 mues a la dis ibuci´on de las dis in as e ique as (PER, LOC, DATE, WEAPON, DRUGS, MISC, ORG, DI, LAW y NAL) del da ase comple o. La e ique a LAW es la que iene mayo can idad de mues as, con un o al de 15609 en el co pus comple o. Le sigue ORG con 7862 mues as, PER con 7440, DATE con 6886, MISC con 2370, LOC con 1271, WEAPON con 106, DI con 18 y NAL con 13. DRUGS es la e ique a con meno can idad de mues as, con un o al de 37 en el co pus comple o. Pos e io men e, se ealiza un spli alea o io pa a o ma dos conjun o, uno de en enamien o y o o de p ueba. El conjun o de en enamien o con iene la mayo ´ıa de las mues as y se dis ibuye de la siguien e mane a: PER 5645, LOC 927, DATE 5223, WEAPON 102, DRUGS 31, MISC 1702, ORG 6014, DI 13, LAW 11864 y NAL 9. El conjun o de p ueba, po su pa e, con iene menos mues as en odas las e ique as: PER 1796, LOC 344, DATE 1663, WEAPON 4, DRUGS 6, MISC 668, ORG 1848, DI 5, LAW 3745 y NAL 4. Y en la siguien e Tabla 5.2 se mues a el mismo spli que la Tabla del da ase comple o, solo que sin las e ique as DRUGS, WEAPON, NAL, DI. 5.2. P e-P ocesamien o Pa a la p epa aci´on de los spli s se ealiz´o median e la siguien e unci´on de la biblio eca sklea n. 1 om sklea n . model_selec ion impo ain_ es _spli 2T_ ain , T_ es , E_ ain , E_ es = ain_ es _spli (X, y, 5.3. En enamien o 35 Tabla 5.2: N´ume o e ique as po clase del conjun o de da os li e -TRAIN TEST TOTAL PER 5645 1796 7440 LOC 927 344 1271 DATE 5223 1663 6886 MISC 1702 668 2370 ORG 6014 1848 7862 LAW 11864 3745 15609 3 es _size =0.2 , andom_s a e =0) C´odigo 5.1: Gene aci´on de Spli s con Sklea n. Es o gene a cua o lis as T ain, T es , E ain, E es , siendo las Tlas lis as de okens y las Elas lis as de e ique as de los a chi os de en enamien o y es eo espec i amen e. Una ez almacenadas las lis as se p ocedi´o a ealiza las comp obaciones an e io men e mencionadas, pa a es o es necesa io ene ya gene ado el a chi o de con igu aci´on, es e se explica ´a m´as adelan e, y los a chi os en el o ma o de ex o bina io Spacy. 1$ ! py hon -m spacy con e . ( A chi o de en enamien o ) 2. ( Ca pe a des ino ) - spacy -c ne Es o con ie e los a chi os al o ma o SpaCy pa a el en enamien o y es eo de modelos NER. Es as coomp obaciones de los a chi os de en enamien os se ealiza on median e la siguien e llamada de la biblio eca SpaCy: 1$ ! py hon -m spacy debug da a -V . ( A chi o de c o n i g u a c i n ). c g Es as comp obaciones son ejecu adas pa a cualquie a de los dos m´e odos de sepa aci´on. En el caso de la sepa aci´on au om´a ica se de uel e un mensaje de incompa ibilidad de a chi os, pa a el o o caso no se mues a ning´un mensaje de e o , solamen e las in o maciones ela i as a la ep esen aci´on de las clases ( e Figu a 5.1). Con es as comp obaciones ealizadas se consigue asegu a el co ec o uncionamien o del p oceso de en enamien o. 5.3. En enamien o Todos los en enamien os y p uebas se lle a on a cabo en una compu ado a con Windows 10, con un p ocesado In el Co e i7-7920HQ a 3.10 GHz y una memo ia RAM de 16 GB. Adem´as, se u iliz´o una GPU con las siguien es especi icaciones: GeFo ce RTX 3070 OC Edi ion con 8 GDDR6. Pa a la comunicaci´on en e la compu ado a y la GPU, se u iliz´o una caja ex e na Raze Co e X Ch oma. En es e pun o, como se ha mencionado an e io men e, Cap´ı ulo 6 Con ibuciones El equipo de dos pe sonas enca gado de lle a a cabo es e TFG en´ıa que comunica se bien en e s´ı. Del mismo modo, desde el inicio del p oyec o, ap oximadamen e a mediados de sep iemb e de 2022, has a su conclusi´on en mayo de 2023, se han man enido euniones pe i´odicas con los miemb os del G upo GASS y el es o de compa˜ne os median e encuen os celeb ados odos los jue es a a ´es de Google Mee . Adem´as, las aplicaciones de mensaje ´ıa m´o il ab ie on un canal de comunicaci´on m´as luido que pe mi i´o esol e p oblemas de o ma m´as ´apida y di ec a. En es e apa ado se desc iben las apo aciones que han ealizado los pa icipan es en es e T abajo de in de G ado. 6.1. ZhenBo Chen Lle ´e a cabo una in es igaci´on pun e a a lo la go de la p ime a ase del p oyec o, que du ´o desde p incipios de sep iemb e has a inales de diciemb e, u ilizando la he amien a Google Schola suge ida po el G upo GASS. Tambi´en me en oqu´e en es udia las he amien as y ´ecnicas necesa ias pa a nues o TFG, con el obje i o de comp ende sus ca ac e ´ıs icas y de alles de implemen aci´on. Una ez adqui idos los conocimien os necesa ios, los compa ´ı con mis compa˜ne os a a ´es de euniones en Google Mee . Una ez comple ada e minada la mayo pa e de la ase de in es igaci´on, al ededo de p incipios de ene o, comenzamos con el desa ollo de la p opues a, que du ´o has a inales de ab il. Du an e es a e apa, mi p incipal a ea ue la c eaci´on del conjun o de da os (da ase ), pa a lo cual desa oll´e sc ip s en Py hon pa a ealiza Web Sc aping y PDF Sc aping. U ilic´e biblio ecas como Beau i ul Soup,PyPDF2, en e o as. Adem´as, jun o con la ayuda de mi compa˜ne o, ealizamos la clasi icaci´on de e ique as u ilizando UBIAI. Al mismo iempo, lle ´e a cabo di e sas p uebas de en enamien o de modelos con conjun os de da os peque˜nos, con el obje i o p incipal de comp ende su uncionamien o. Du an e es e p oceso, compa ´ı mis conocimien os adqui ido con las peque˜nas p uebas de 43 44 Cap´ ı ulo 6. Con ibuciones en enamien os con mi compa˜ne o, quien es aba abajando en el desa ollo del modelo de ini i o. Una ez concluida la ase de desa ollo, mi compa˜ne o y yo empezamos a edac a el in o me pa a el T abajo de Fin de G ado. En dicha edacci´on ealic´e: Resumen. El Cap´ı ulo de In oducci´on del TFG (Cap´ı ulo 1). Desc ipci´on de los Modelos de Lenguaje P e-en enados(el pun o 2.5) (Cap´ı ulo2). Desc ipci´on del Es ado del A e (Cap´ı ulo 3). Los apa ados pa a la desc ipci´on del p oceso de ecolecci´on de da os, desc ipci´on de los da os necesa ios pa a el TFG y el apa ado de p e-p ocesamien o de los da os necesa ios pa a el en enamien o de los modelos de la Me odolog´ıa del P oyec o (Cap´ı ulo 4). Desc ipci´on del co pus de los Expe imen os y Resul ados (Cap´ı ulo 5). Cap´ı ulo de Conclusiones y abajo u u o (7). 6.2. ´ Al a o L´opez Olmos La p ime a ase del p oyec o aba c´o desde mi inicio en el g upo has a inales de diciemb e. En es a e apa, comenc´e ealizando una in es igaci´on exhaus i a de nume osos a ´ıculos cien ´ı icos elacionados con emas simila es. Una ez adqui idos los conocimien os necesa ios, me en oqu´e en in es iga las ´ecnicas exis en es pa a el desa ollo de modelos. Todos los conocimien os adqui idos sob e es os emas, he amien as y ´ecnicas, los compa ´ı con mis compa˜ne os a a ´es de euniones semanales que se celeb aban median e Google Mee . Una ez inalizada la p ime a ase, a p incipios de ene o comenzamos la segunda ase, que consis ´ıa en la c eaci´on del da ase y el desa ollo de la he amien a. A inales de ab il, despu´es de que la he amien a hubie a pasado po un amplio p oceso de desa ollo y p uebas, es a ase es aba e minada. Dado que se u iliz´o Py hon pa a el desa ollo, u e que es udia cie as ideas elacionadas con las dis in as biblio ecas, unciones y plugins que pueden u iliza se en la c eaci´on de la he amien a. Adem´as, lib e ´ıas como PyTo ch yspaCY me ense˜na on nue as ideas y he amien as. Empezamos a desa olla el p og ama u ilizando el en o no de desa ollo Jupy e No ebook despu´es de habe e isado y ap endido odos los p incipios ele an es. Mien as mi compa˜ne o ealizaba p uebas de en enamien o de modelos, yo comenc´e a desa olla el modelo inal. El p ime paso ue ealiza el p e-p ocesamien o del da ase con una di isi´on de en enamien o de 80 % 6.2. ´ Al a o L´ opez Olmos 45 de en enamien o y 20 % de p ueba, con la ayuda de la lib e ´ıa sklea n. A con inuaci´on, ajus amos los pa ´ame os de en enamien o en el a chi o de con igu aci´on y, una ez inalizado el en enamien o, analizamos los esul ados y ealizamos ajus es en los modelos pa a ob ene mejo es esul ados. Aunque oda ´ıa quedaban muchas p uebas po hace cuando e min´o la ase de desa ollo, mi compa˜ne o de g upo y yo empezamos a edac a el in o me pa a el p oyec o de in de ca e a despu´es de eso. Pa icip´e en odas las secciones siguien es de la edacci´on de la memo ia: In oducci´on del TFG (Cap´ı ulo 1). Los apa ados de P ocesamien o de Lenguaje na u al, concep os base pa a en ende la e molog´ıa del abajo y la a qui ec u a de los ans o me s del Con ex o de la In es igaci´on (Cap´ı ulo 2). Los apa ados de la explicaci´on de las uncionalidades de To ch y PyTo ch, Spaycy, y una desc ipci´on gene al del en enamien o del modelo de la Me odolog´ıa del P oyec o (Cap´ı ulo 4). Desc ipci´on de los a eas de P e-P ocesamien o, en enamien o, e aluaci´on y salida del modelo de los expe imen os y esul ados (Cap´ı ulo 5). Cap´ı ulo de Conclusiones y abajo u u o (7). T aducci´on de la in oducci´on y conclusi´on (Cap´ı ulo 8y9). Es impo an e se˜nala que odos los miemb os del g upo pa icipa on en la co ecci´on de las e a as o e o es que su gie on du an e la edacci´on del in o me. Cap´ı ulo 7 Conclusiones y T abajo Fu u o 7.1. Conclusiones El an´alisis de con ex o es un m´e odo que ha a anzado mucho en los ´ul imos a˜nos y iene nume osos usos en di e sos sec o es. Dicha ´ecnica se en oca en el p ocesamien o del lenguaje na u al (NLP). En es e sen ido, el p esen e abajo ha p o undizado en la his o ia del NLP, los modelos que exis en en la ac ualidad y sus es ados del a e. Se mencionan modelos como BERT,RoBERTa,ALBERT,Dis ilBERT,SpanBERT, en e o os, que han enido un g an impac o en la comunidad de NLP. Es os modelos p e-en enados son u ilizados como base pa a se e-en enado, de i ando a modelos pa a a a eas m´as espec´ı icas, como an´alisis de sen imien o, ex acci´on de in o maci´on, e c. En es e abajo se p esen a el uso de modelos p een enados (RoBERTa) pa a en ena un modelo espec´ı ico pa a la ex acci´on de en idades en ocado a la em´a ica legal, y pa a es o se a seleccionado un conjun o de da os de em´a ica legal, y es o es jus amen e uno de los pasos m´as impo an e del en enamien o del modelo, es deci el conjun o de da os debe se lo su icien e amplio y di e so pa a cub i la mayo can idad de casos, y a su ez ene una calidad que pe mi a la c eaci´on de un modelo s´olido y con iable. Finalmen e los esul ados ob enidos en el abajo mues an la capacidad del modelo pa a ealiza a eas de ex acci´on de en idades en ex os legales, con una p ecisi´on signi ica i a. La exac i ud del modelo es impo an e, ya que los esul ados ob enidos pueden ene implicaciones legales en casos donde se u ilice como p ueba. 7.2. T abajo Fu u o Como posibles abajos u u os pueden se˜nala se los siguien es: •Se pueden explo a m´e odos m´as e icien es y p ecisos pa a la iden i icaci´on de 47 48 Cap´ ı ulo 7. Conclusiones y T abajo Fu u o en idades complejas y en idades de m´ul iples palab as, que, po su complejidad y a iedad, suelen se m´as di ´ıciles de iden i ica . Adem´as, se pueden in es iga ´ecnicas pa a mejo a la de ecci´on de en idades ambiguas, i ´onicas, el sa casmo, e c. •Es posible abaja en la c eaci´on de modelos que pe mi an ex ae y analiza los ´ınculos en e en idades, ya que es o pod ´ıa pe mi i la iden i icaci´on de pa ones y elaciones sem´an icas ele an es en ex os complejos, lo que end ´ıa aplicaciones impo an es en a eas como la gene aci´on de de e minados ex os y la ex acci´on de in o maci´on. •La in eg aci´on de conocimien os ex e nos, po ejemplo a˜nadi bases de da os de ´a eas especi icas a pa e de la que ya es a p ede e minadas, puede mejo a la calidad de las elaciones ex a´ıdas. Es os conocimien os pueden p opo ciona in o maci´on adicional sob e las en idades •En esumen, el abajo u u o en elaci´on al econocimien o de en idades puede abo da se desde m´ul iples pe spec i as, incluyendo el desa ollo de ´ecnicas m´as e icien es y p ecisas pa a la iden i icaci´on de en idades complejas, as´ı como la explo aci´on y desa ollo de modelos que pe mi an la ex acci´on y an´alisis de elaciones en e en idades pa a mejo a el p ocesamien o del lenguaje na u al Cap´ı ulo 8 In oduc ion 8.1. Mo i a ion Nume ous scien i ic ad ances in ecen yea s ha e led o an exponen ial inc ease in echnology. Thanks o he In e ne , i has become possible o access la ge amoun s o da a speci ically in w i en ex in di e en languages, which is e y use ul o human o a i icial lea ning, speci ically o NLP. A e he appea ance o he i s mode n NLP a chi ec u e, Wo d2Vec [MSC+13] in 2013, he e was a apid de elopmen o his echnology, wi h se e al ad ances, such as he RNN and he LSTM, which a e a modi ica ion o he p e ious ones. Be ween 2015 and 2016, a en ion-based ne wo ks became popula , which allow he designe o speci y he ype o da a he o she wan s he sys em o ocus on and pay a en ion o. Among hese, one o he mos p ominen is he T ans o me , in oduced in 2017 and cu en ly he op o he language p ocessing pa adigm. A p esen , he e is a p edominance o models such as BERT [DCLT19], in oduced in 2018, and i s specialisa ions and op imisa ions, such as RoBERTa [LOG+19], 2019. As bo h models a e s ill s a e o he a , aining has no ye been ca ied ou o all languages, no o all possible a eas o specialisa ion, so we p opose in his pape he c ea ion and p esen a ion o bo h a pipeline and a model ained speci ically o he legal en i onmen in Spanish. O he models de i ed om BERT such as ALBERT [LCG+20], Dis ilBERT [SDCW20] and SpanBERT [JCL+20] a e also wo h men ioning. 49 50 Cap´ ı ulo 8. In oduc ion 8.2. Con ex This Final Deg ee P ojec is pa o a esea ch p ojec called No el S a egies o Figh Child Sexual Exploi a ion and Human T a icking C imes and P o ec hei Vic ims - HEROES, app o ed by he Eu opean Commission wi hin he Ho izon 2020 F amewo k P og amme (call H2020-SU-SEC-2020) unde g an ag eemen numbe 101021801 and in which he GASS G oup o he Uni e sidad Complu ense de Mad id (G upo de An´alisis, Segu idad y Sis emas, h ps://gass.ucm.es, g oup 910623 o he ca alogue o esea ch g oups ecognised by he UCM). In addi ion o he Uni e sidad complu ense de Mad id, 21 o ganisa ions om 17 coun ies a e pa icipa ing in HEROES: 11 om EU coun ies (Aus ia, Belgium, Bulga ia, F ance, G eece, I eland, La ia, Li huania, Po ugal, Spain, Uni ed Kingdom), 1 associa ed coun y (Swi ze land) and 5 hi d coun ies (Bangladesh, B azil, Colombia, Pe u, U uguay). These en i ies a e: Uni e si y o Ken (UK), The F ee Uni e si y o B ussels (Belgium), The F ench Na ional Resea ch Ins i u e o Digi al Science and Technology - INRIA (F ance), Cen e o Secu i y S udies - KEMEA (G eece), In e na ional Cen e o Mig a ion Policy De elopmen - ICMPD (Aus ia), In e na ional Cen e o Missing and Exploi ed Child en - ICMEC (Swi ze land), IDENER Resea ch & De elopmen Ag upaci´on de In e ´es Econ´omico (Spain), A hena Resea ch Cen e - ARC (G eece), T ila e al Resea ch and Consul ing (Uni ed Kingdom), Cen e o Women and Child en S udies - CWCS (Bangladesh), Cen e Agains Human T a icking and Exploi a ion - KOPZI (Li huania), Po uguese Associa ion o Vic im Suppo - APAV (Po ugal), Fundaci´on Renace (Colombia), The G eek Council o Re ugees - GCR (G eece), B azilian Associa ion o he De ense o Child en o Child en and You h - ASBRAD (B azil), Hellenic Police (G eece), La ia Na ional Police (La ia), Gene al Di ec o a e o he Figh agains O ganized C ime (Bulga ia), Di ecci´on Gene al de la Polic´ıa - DGP (Spain), Fede al Police (B azil), Fede al Highway Police (B azil), Sec e a ia de In eligencia Es a ´egica de Es ado - P esidencia de la Republica O ien al del U uguay (U uguay). Mo e in o ma ion is a ailable a : h ps://co dis.eu opa.eu/p ojec /id/101021801 h ps://he oes- c .eu 8.3. Objec o he In es iga ion The aim o his p ojec is he design and implemen a ion o a NLP model capable o ecognising named en i ies in Spanish in a ex wi h a legal p ocess o ien a ion. The aim o his model is o au oma e he p ocess ha an in es iga o pe o ms when analysing he iles con ained in a seized Spanish-language de ice. The e o e, i is necessa y o ca y 8.4. Wo kplan 51 ou an analysis o he di e en NLP p ocessing algo i hms ha allow o agile p ocessing and accu a e iden i ica ion o he con ex o he analysed sen ence and o ca y ou en i y ecogni ion. In addi ion, his p ojec aims o unde s and how he named en i y ex ac ion p ocess wo ks, o analyse how i is s uc u ed and o ind he main di icul ies ha compu e enginee s encoun e when de eloping hese models. This wo k p oposes a model o educe he ime spen by esea che s in he analysis o Spanish iles con ained in de ices seized in a judicial p ocess. 8.4. Wo kplan The de elopmen o his p ojec is s uc u ed in h ee s ages: 1. S a e-o - he-a esea ch This s age ocuses on he esea ch o leading wo ks and p ojec s ele an o his wo k, as well as he acquisi ion o he necessa y knowledge o ca y ou his wo k. Once he TFG was ag eed upon, an in oduc o y mee ing was held o explain he pu pose and he poin s o be ca ied ou h oughou his p ocess. This mee ing was ollowed by weekly mee ings o moni o he p ojec and o esol e any doub s ha a ose. These mee ings also explained he co ec ways o sea ching o academic documen a ion, he o ma s equi ed and he ools used, one o hem being Google Schola , which i was decided would be used o his p ojec . As he membe s o he eam did no ha e all he necessa y knowledge ela ed o A i icial In elligences, se e al cou ses we e ca ied ou o ob ain his knowledge. Finally, once hey had acqui ed he basic knowledge and s udied he cen al hemes o he p ojec based on he p ojec objec i es, he eam s a ed wi h he de elopmen o he model. 2. De elopmen : Once he necessa y knowledge was ob ained, he de elopmen o he model began, bu wi hou neglec ing he in es iga ion o op imal solu ions. Fo his eason, du ing his phase, ad anced concep s o lib a ies such as Spacy and To ch and he p og amming language o Py hon we e in es iga ed. In addi ion, he aining se s o he model we e cons uc ed, ca ying ou he labelling o en i ies on he ex s ob ained om he sou ces p o ided by he wo ks ead du ing he p e ious phase. We also deployed he en i onmen whe e bo h he aining and he e alua ions o he model would be ca ied ou . 3. Resul s: A his poin , and wi h he model al eady ained, we p oceeded o e alua e he model on he main me ics, using di e en ools p o ided by he same lib a ies explained abo e. The model was also es ed wi h ex s gene a ed by he eam. Once he esul s we e ob ained, we p oceeded o w i e his documen .