scieee AI-readable full text Open interactive document viewer

Aportacions a la millora d'un sistema interactiu d'ajuda a la traducció basat en mètodes estadístics

Silvestre Cerdà, Joan Albert

Abstract

El propòsit d'aquest treball és, doncs, millorar les prestacions d'aquests sistemes. S'han plantejat una sèrie de millores que afecten directament al sistema de traducció automàtica subjacent, ja que és aquest el que s'encarrega de generar les propostes de traducció, i és on resideix el punt clau de millora: a major qualitat de la traducció, major qualitat del sistema. Per tant, aquest Projecte de Final de Carrera es centrarà fonamentalment en la disciplina de la traducció automàtica.

Full text

memoria  2010/11/17  19:32  page i  #1 i i UNIVERSITAT POLITÈCNICA DE VALÈNCIA ESCOLA TÈCNICA SUPERIOR D'ENGINYERIA INFORMÀTICA DEPARTAMENT DE SISTEMES INFORMÀTICS I COMPUTACIÓ Ap ortaions a la millora d'un sistema interatiu d'a juda a la traduió basat en mèto des estadístis. Pro jete Final de Carrera - Enginyeria Informàtia Joan Alb ert Silvestre Cerdà Sup ervisat p er: Dr. Jorge Civera Saiz Dr. Jesús Andrés Ferrer 17 de novembre de 2010 memoria  2010/11/17  19:32  page ii  #2 i i memoria  2010/11/17  19:32  page iii  #3 i i A la memòria del meu pare, Luis. memoria  2010/11/17  19:32  page iv  #4 i i memoria  2010/11/17  19:32  page v  #5 i i Agraïments No és molt habitual esriure aquestes línies en un pro jete de nal de arrera, i realment no enten el p er què. Aquest treball representa la ulminaió dels estudis universitaris, una etapa molt imp ortant de la nostra vida, larament marada p er la inuènia de les p ersones del nostre entorn: familiars, amis, enemis, oneguts, professors, et. Totes aquestes persones són el nostre referent so ial i la prinipal font de oneixements de la que es no drim en el dia a dia (la universitat de la vida), sent la seva interaió amb nosaltres un fator determinant en la nostra eduaió, esp e- ialment en la universitària, on els estudiants omenem a mostrar-nos al món om p ersones formades, madures i indep endents. Per aquest motiu trob e que tota la gent que ha inuït de forma p ositiva en la meva p ersona durant aquest p erío de de temps es mereix, p er la meva part, una menió esp eial, una esp èie de reoneixement p ersonal. I són preisament aquestes línies les més idònies p er expressar el més siner i profund agraïment a totes aquelles p ersones que m'han aompanyat en aquest reorregut. He de onfessar que aquestes són les línies més difíils d'esriure de tot el do ument, dons les paraules que segueixen no són més que meres aproximaions a l'afete i estima que tin a les p ersones que, sense llo  a dubte, formen part d'aquest pro jete de nal de arrera, i més enara, de la meva formaió om a enginyer informàti i om a p ersona. En primer llo , i om a prinipal impulsor d'aquest treball, vull donar les grà- ies a Alfons Juan p er haver-me brindat l'op ortunitat de realitzar aquest apassionant pro jete, preo upar-se p el meu futur immediat om a enginyer informàti i aollir-me al seu grup. Un tren així no passa tots els dies p er la vida d'una p ersona, i, fran- ament, em sent molt afortunat de no haver-lo deixat esapar. En la mateixa línia, vull fer esp eial menió als diretors d'aquest pro jete, Jorge Civera i Jesús Andrés, p er la gran impliaió que han mostrat en tot moment durant l'elaboraió d'aquest treball, p er la omuniaió onstant i uïda que hem mantingut al llarg d'aquests quasi in mesos, p els seus grans oneixements i passió p er la traduió automàtia i el reoneixement de formes, p el seu altruisme, p er preo upar-se pel meu futur, p er la seva enorme simpatia, i sobretot, p er la paiènia innita que han tingut amb mi. He de destaar, a més, el gran llegat que han deixat en mi en forma de nous oneixements i habilitats, que no són p o s. Moltes gràies a tots dos. Per proximitat tamb é voldria donar les gràies al meus ompanys de laboratori del DSIC: Adrià, Ihab, Miguel, Nio, Isaías i Riardo (la omunitat del lúster), el quals m'han aollit molt amablement i m'han a judat en moltes oses durant la realitzaió d'aquest treball, esp eialment Miguel, p er prestar-me la plantilla Latex d'aquest prov memoria  2010/11/17  19:32  page vi  #6 i i jete i p els seus onsells, i Adrià p er les seves ap ortaions de Latex, C++, i els seus xilets de després de dinar. Tots ells m'han fet passar una estança al lab oratori molt agradable. No al oblidar tamp o  als meus ompanys de arrera, tant de l'Enginyeria Tènia om de l'Enginyeria Sup erior, on he trobat amis i amigues que, enara que les nostres vides ara segueixen amins diferents, almenys tenim el grat reord d'haver-nos reuat i ompartir uns b ons ratets junts. De tots ells vull fer esp eial menió de Jordi, Kike, Miguel i Berni, els meus primers ompanys de lasse amb els que he passat molt b ons moments; Cèsar, p els dos magnís anys que hem ompartit al segon ile d'informàtia; a Raül (Rulo), amb qui mantin una estreta amistat a p esar dels anys que fa que des que es deixà la arrera; i sobretot, a un gran ami meu de tota la vida i ompany de pis durant aquests 5 anys: Àngel, una b ellíssima p ersona a la qual po dria ns i tot atribuir-li l'obtenió del meu títol d'enginyer tèni (ell sap que vull dir amb això). No m'agradaria deixar en el tinter a la gent que he onegut en la meva vessant musial om a trompista, la ma jor de les meves passions que, malauradament, per motius de salut, entre d'altres, no m'he p ogut dediar de forma més intensa o inlús de forma professional om m'hagués agradat. Reorde amb nostàlgia a professors i ompanys de lasse de l'esola de músia de Boairent, del onservatori d'Ontinyent i del onservatori de Valènia. Vull fer menió esp eial, d'una banda, als ompanys que fundarem el Grup Instrumental Simfonies, un gran grup d'amis apassionats de la músia simfònia, així om a Àngela i Cèsar, dos ompanys del onservatori d'Ontinyent amb els que enara mantin una b ona amistat; i d'altra banda, als professors que més m'han marat en la meva formaió musial: Rosell, gran trompista i millor p ersona, p erò sobretot, Titín, un trompista exep ional i un professor exel · lent que em va ontagiar la seva passió p er la Músia i que va aonseguir pro duir la meva millor versió om a trompista, al fer-me reup erar la onança amb mi mateix, ns al punt que l'úni que desitjava era menjar-me l'esenari. No vull oblidar tamp o  a Luís Serrano, un gran do ent i magní omp ositor de músia simfònia del que vaig aprendre molt, i que em va donar la p ossibilitat d'explorar nous horitzons musials. També és molt imp ortant per a mi el meu ex-alumne i ami Asensio, a qui vaig p o der transferir gran part dels meus oneixements musials ensenyant-li des de zero solfeig musial i Trompa durant 3 anys. I om no, a l'Asso iaió Unió Musial Bo airent, la banda dels meus amors i bressol de la meva eduaió musial, en la que he visut vivènies inoblidables i on trob e b ons amis i oneguts, entre ells amis de tota la vida. Esti molt trist p er no p o der partiipar ativament en ella, p erò promet que prompte o tard tornaré. El meu os ho demana a rits. També vull aprotar per menionar, d'una banda, els meus ompanys de la delegaió d'àrbitres d'Aloi del Comité Tèni d'Àrbitres de la FFCV, estament arbitral al que p ertany des de fa 4 anys, i amb els que he passat molts bons moments en la pràtia d'una feina molt gratiant i útil p er al desenvolupament de la meva p ersona, enara que de vegades p erillosa, tot s'ha de dir. D'altra banda, també vull reordar als membres de la que fou l'Asso iaió d'Informàtia Boairent.net ja fa bastants anys, als quals de, en erta manera, la meva aió al món de la informàtia, i vi JASC-DSIC-UPV memoria  2010/11/17  19:32  page vii  #7 i i d'entre els quals destaque a Manel Espinós i a Pere Cresp o, dos grandíssimes persones amb les que enara mantin una bona relaió, i amb les que en el seu dia vaig passar molts b ons ratets junts, gestionant i muntant les suessives bekiparty's, entre d'altres ativitats. Vull menionar esp eialment a Pere, qui ha marat molt la meva vida om a informàti, dons la seva p ersona ha estat el meu referent om a futur enginyer. Els meus amis i amigues han estat la base fonamental no sols d'aquesta titulaió que esti apunt d'assolir, sinó tamb é de la meva vida: amb ells he visut experiènies genials que m'han servit p er desonnetar dels estudis, i sobretot, p er gaudir de la vida. N'esti molt agraït p el reolzament que he trobat en ells i p er tot allò que han aguantat, sobretot en aquests 4 mesos en els que he realitzat el pro jete: re que tots ells tenen més ganes d'aabar-lo que jo! Po dria omençar a parlar, un p er un, de tots ells, p erò en son tants i tant b ons que p o dria estendre'm pàgines i pàgines parlant meravelles d'ells, així que esp ere que em donen la lliènia d'evitar aquest desprop òsit, que ja trob e que me n'esti exedint bastant en quant a extensió. Tots ells sab en quant me'ls estime, així que esti tranquil. Sobren les paraules. Gràies p er estar ahí, genteta. He de destaar, a més, aquelles p ersones que més han estat en ontate amb mi durant aquests 5 anys, que són els meus ompanys de pis a Valènia. Tots ells, Adrià, Àngel, Rub én, i Vítor, ompanys i amis de tota la vida, són les persones amb les que més vivènies, de lluny, he ompartit, molt divertides i gratiants, p er ert. Sobretot és de lloar om de b é m'han tratat i tot el que han tingut que sup ortar. Que em feren el sopar els dies que tornava tardíssim a asa p erquè em trobava a lasses del onservatori, o el gran esforç que realitzaven aguantant les meves dues hores d'estudi diàries de Trompa a asa, són dues mostres de om m'han mimat. Inlús en irumstànies extremes, om per exemple aquests els últims 5 mesos, quan em passava hores i hores al lab oratori elab orant aquest treball: sempre que tornava a asa em trobava amb el dinar i el sopar fet (reentment amb un nou ompanyer de pis, Raül). Això no té preu. Sols l'amistat de deb ò p ot fer eixes oses. A tots ells l'úni que pu dir-los és que gràies, moltes gràies p er ser tant b ons ompanys i amis, de tot or, aquest pro jete també és vostre. També tin paraules de gratitud ap a Teresa Llavador i als seus dos lls, Pep e i Paqui Tomàs, amis del meu pare i meus p er afortunada herènia, p er aollir-nos tant b é al seu pis de Valènia durant els últims 3 anys, p erò sobretot p er ser tant b ones p ersones, i p er la gran amistat i ordialitat que mantin amb ells om amb la resta de la seva família. Per damunt de tot està el pap er fonamental que ha jugat la meva família en la meva eduaió. Vull agrair el reolzament inondiional que he rebut p er part dels meus familiars, tant en aquests 5 anys om en tota la meva vida. Esp eialment, he de donar les gràies al meu germà Luís, p er la seva inestimable ompanyia, el seu afete, p er iniiar-me al món de la informàtia i de la músia, i sobretot, pels seus onsells i p er la seva saviesa om a germà ma jor que tant apreie om a germà xiotet; i om no, a la meva mare, Mari Carmen, per dur-me al món, uidar-me, estimar-me i eduar-me JASC-DSIC-UPV vii memoria  2010/11/17  19:32  page viii  #8 i i de la forma apropiada per fer-me arribar ns on esti ara: ella és la prinipal ulpable de la redaió d'aquestes línies, no s'equivoquem. Estaré eternament agraït amb la meva núvia Lídia, p er tot el que ha fet p er mi i la paiènia que ha tingut en tot el temps que estem junts, tot a p esar de la distània, que malauradament se'ns fa eterna. Per estar sempre al meu ostat, per uidar-me i mimar-me, p er a judar-me en els moments més difíils, p er fer-me gaudir de tants b ons moments... p er moltes raons, p erò sobretot, p el seu amor inondiional que he ompartit i que esp ere ompartir amb ella ns que s'apague la llum del sol, i de la lluna. Per últim, m'agradaria reordar amb aquestes paraules la persona que més mereix la meva admiraió: el meu pare Luís, un gran home, p ersona patidora i lluitadora, que es va desviure p el b enestar de la seva família i p er po der assegurar un futur millor als seus lls, osa que sense dubte ha aonseguit. De segur que estaria molt orgullós de veure om els seus lls han resp ost al seu sarii, als valors que ens ha inulat, al seu esp erit lluitador. Malauradament, la seva vida es va esvair de forma prematura, p erò no així el seu reord. És p er això que aquest treball vull dediar-lo íntegrament a la memòria del meu pare, sobretot p erquè m'agradaria que sab era, allà on estiga, que l'ob jetiu que va p erseguir ns l'últim dia de la seva vida s'ha assolit. I que p er això, i p er moltes més raons, n'esti molt agraït i orgullós d'ell. Gràies a tots i totes. Joan Alb ert Silvestre Cerdà Valènia, 17 de novembre de 2010 viii JASC-DSIC-UPV memoria  2010/11/17  19:32  page ix  #9 i i Índex 1 Intro duió 1 1.1 Visió general de la traduió automàtia . . . . . . . . . . . . . . . . . 3 1.1.1 Un breu repàs a la història . . . . . . . . . . . . . . . . . . . . 3 1.1.2 Aproximaions a la traduió automàtia . . . . . . . . . . . . 4 1.1.3 Sistemes d'a juda a la traduió . . . . . . . . . . . . . . . . . . 7 1.2 Traduió automàtia estadístia . . . . . . . . . . . . . . . . . . . . . 9 1.2.1 Coneptes bàsis de probabilitat . . . . . . . . . . . . . . . . . 9 1.2.2 Traduió estadístia . . . . . . . . . . . . . . . . . . . . . . . . 11 1.2.3 Mo dels de llenguatge . . . . . . . . . . . . . . . . . . . . . . . . 14 1.2.4 Mo dels de traduió . . . . . . . . . . . . . . . . . . . . . . . . 18 1.3 Aproximaions a la traduió automàtia estadístia . . . . . . . . . . 19 1.3.1 Mo dels basats en paraules . . . . . . . . . . . . . . . . . . . . . 19 1.3.2 Mo dels basats en seqüènies de paraules . . . . . . . . . . . . . 26 1.3.3 Mo dels basats en transdutors . . . . . . . . . . . . . . . . . . 31 1.3.4 Mo dels jeràrquis o basats en arbres . . . . . . . . . . . . . . . 33 2 Traduió automàtia estadístia basada en seqüènies de paraules 37 2.1 El sistema de TA Moses . . . . . . . . . . . . . . . . . . . . . . . . . . 37 2.1.1 Mo dels logarítmi-lineals . . . . . . . . . . . . . . . . . . . . . 38 2.1.2 Extensions del mo del original . . . . . . . . . . . . . . . . . . . 39 2.1.3 El mo del logarítmi-lineal de Moses . . . . . . . . . . . . . . . 43 2.1.4 Entrenament del mo del . . . . . . . . . . . . . . . . . . . . . . 44 2.1.5 Pro és de traduió . . . . . . . . . . . . . . . . . . . . . . . . 46 2.1.6 Avaluaió de la qualitat de la traduió . . . . . . . . . . . . . 48 2.1.7 Ajustament de paràmetres . . . . . . . . . . . . . . . . . . . . . 50 2.2 Mananes del mo del de seqüènies de paraules . . . . . . . . . . . . . 50 3 Mo dels de Longitud 55 3.1 Mo del de longitud estàndard . . . . . . . . . . . . . . . . . . . . . . . 55 3.1.1 Estimaió del mo del i implementaió . . . . . . . . . . . . . . . 56 3.1.2 Integraió en Moses . . . . . . . . . . . . . . . . . . . . . . . . 61 3.2 Mo del de longitud esp eialitzat . . . . . . . . . . . . . . . . . . . . . . 62 3.2.1 Estimaió del mo del i implementaió . . . . . . . . . . . . . . . 62 3.2.2 Integraió . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 70 ix memoria  2010/11/17  19:32  page 6  #16 i i Capítol 1. Intro duió de les frases origen a una representaió equivalent en el llenguatge destí, tot mitjançant l'apliaió de regles que indiquen la orresp ondènia dels fragments de l'arbre sintàti origen als de l'arbre sintàti destí. Per últim, l'arbre destí es transforma en un text llegible per a l'usuari. • Interlingua : Aquesta aproximaió és el as extrem de la traduió per transferènia, dons es realitza un minuiós i exhaustiu pro és d'anàlisi del text origen ns aonseguir una representaió oneptual ompletament indep endent dels llenguatges origen i destí anomenada Interlingua . Aquesta aproximaió presenta el gran avantatge de que, en llo  de denir orresp ondènies entre ada parell de p ossibles llenguatges a traduir, és suient amb denir la orresp ondènia entre ada llenguatge i l' Interlingua . Ara b é, la omplexitat d'aquesta aproximaió resideix en dissenyar un Interlingua adequat, que p ermeta tant representar on- eptes de forma únia om establir orresp ondènies úniques (ada paraula de l' Interlingua estarà relaionada amb una i sols una paraula d'un llenguatge on- ret). Aproximaió basada en orpus D'altra banda, l'aproximaió basada en orpus es onep om una aproximaió empíri- a, ja que la informaió emprada p er onstruir el sistema s'obté a partir d'un orpus d'exemples de traduions del llenguatge font al llenguatge destí. El gran avantatge que presenten aquests sistemes és que la tenologia que els implementa pot ser fà- ilment reutilitzada p er a altres dominis d'apliaió o inlús altres parells d'idiomes, p erò p er ontra requereixen reopilar grans quantitats d'informaió p er tal de apturar una representaió signiativa del domini en el que es pretén realitzar el pro és de traduió. A trets generals, aquests sistemes parteixen d'un orpus d'entrenament onformat p er parells de frases traduïdes p er un grup d'exp erts, i que en la ma joria del asos requereixen una fase prepro és (separar signes de puntuaió de les paraules, transformar ma júsules en minúsules, et.) p er tal de failitar i garantir l'adquisiió de fonts de oneixement robustes i de qualitat durant la fase d'entrenament. Amb el sistema entrenat es pot dur a terme la tasa de traduió d'una frase d'entrada, onstruint de la forma més òptima p ossible la frase en l'idioma destí, en base a tota la informaió que el sistema té al seu abast. Si en la fase d'entrenament s'ha realitzat un prepro és de les dades, aleshores és impresindible que la frase a traduir siga sotmesa al mateix preproés, i p osteriorment, a una fase de p ostpro és, en la que es desfan els anvis realitzats al prepro és. Dins d'aquesta ategoria existeixen dues grans aproximaions: els sistemes basats en exemples 6 i els sistemes estadístis 7 [GV03℄. • Sistemes Basats en Exemples : L'idea prinipal d'aquesta aproximaió és que durant el pro és de traduió la frase d'entrada es ompara en una base de dades onstruïda a partir del orpus d'entrenament, generant-se hip òtesis i ombinant-les de forma apropiada ns obtindre la traduió orresp onent. Per 6 EBMT, Example-Based Mahine Translation . 7 SMT, Stadistial Mahine Translation . 6 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 7  #17 i i 1.1. Visió general de la traduió automàtia ser un p o  més onrets, en primer llo  es desomp osa la frase d'entrada en fragments, donant llo a un gran nombre de p ossibles hipòtesis o amins de traduió (ja que la desomp osiió es pot realitzar de moltes maneres diferents); en segon llo , els fragments es omparen amb la base de dades d'exemples i s'identiquen les seves traduions orresp onents; i en terer llo, es ombinen de forma adequada els fragments traduïts, originant la frase nal. • Sistemes Estadístis : L'aproximaió estadístia a la TA és molt similar a la seguida p els sistemes basats en exemples, p erò es desmara larament en el proés de omparaió-ombinaió emprat per aquests, ja que en el seu llo  s'empren tèniques estadístiques tant en l'entrenament del sistema om en el pro és de traduió. Aquest treball es entra en el mar estadísti de la TA, amb la qual osa en la Seió 1.2 s'expliarà en ma jor detall els asp etes més imp ortants que onerneixen a la traduió automàtia estadístia. 1.1.3 Sistemes d'a juda a la traduió Com ja sab em, el prinipal prop òsit de la traduió automàtia és dissenyar sistemes apaços de traduir texts sense la partiipaió humana, és a dir, de forma ompletament automàtia. No obstant, la tenologia atual no p ermet assolir tal prop òsit [Kay97℄, amb la qual osa es requereix una p ost-ediió manual de les traduions proveïdes p er aquests sistemes. Aquests dos pro essos aïllats imp edeixen, d'una banda, que el sistema aprenga del oneixement del tradutor humà, i d'altra banda, que el tradutor humà obtinga beneis de les apaitats adaptatives i de l'eiènia que presenta d'un sistema de TA. Una forma de resoldre aquesta mana de feedbak és, preisament, donar llo  a un espai oop eratiu on màquina i humà partiip en interativament en el pro és de tradu- ió [IC97℄, en entorns oneguts om sistemes d'a juda a la traduió 8 . Històriament, els sistemes d'a juda a la traduió i els sistemes de traduió automàtia han estat onsiderats sistemes diferents, enara que tenològiament semblants, dons po dem onsiderar que els sistemes d'a juda a la traduió són un superonjunt dels sistemes de traduió automàtia. Històriament, la interativitat entre sistemes de traduió i humans s'ha materialitzat en diferents enfo aments. Un dels més exitosos ha estat el basat en memòries de traduió, en el que l'usuari fa ús d'un sistema que ompta amb una base de dades immensa d'exemples de traduió. Un altre enfoament fou requerir la intervenió dels humans p er tal de resoldre ambigüitats de aire lèxi, sintàti o semànti del text d'entrada, o inlús mantindre i atualitzar diionaris d'usuari o busar a través d'ells [Slo85, WWC + 86℄, amb més o menys èxit. Posteriorment, el pro jete TransType [LFL00, LLL02, FLL02, Fos02℄ va aportar un nou enfo ament que onsistia en entrar la interativitat diretament al text traduït, integrant sistemes autònoms de TA en l'entorn interatiu. Aquest darrer enfoament va donar origen al que oneixem p er 8 En anglès, Computer-Assisted Translation Systems . JASC-DSIC-UPV 7 memoria  2010/11/17  19:32  page 8  #18 i i Capítol 1. Intro duió sistemes de traduió interatius-preditius, el quals estan reb ent en l'atualitat un ampli sup ort de la omunitat investigadora [Civ08, BBC + 09℄. Tot seguit detallem el funionament de les dues aproximaions més importants de la traduió assistida: els sistemes de memòria de traduió, i els sistemes interatiuspreditius. Sistemes de memòria de traduió Aquesta aproximaió es basa en la reopilaió d'exemples de traduió en una (presumiblement) extensa base de dades [UoG95℄. Durant el pro és de traduió, la frase origen és segmentada, de forma que p er a ada segment es realitza una era de l'exemple de traduió més semblant emmagatzemat a la base de dades. Si aquesta onté un segment en l'idioma origen que oinideix exatament en el segment busat, aleshores la traduió orresp onent és mostrada p er pantalla, amb un grau de similitud del 100%. Per ontra, si no s'ha trobat un segment idènti, aleshores es prop oriona la traduió més similar existent a la base de dades. Siga om siga, el sistema presenta a l'usuari la prop osta de traduió, de forma que aquest pot, b é aeptar la prop osta, o b é mo diar-la / orregir-la. En aquest darrer as, la traduió mo diada és emmagatzemada a la base de dades. Pot haver-hi asos en els que no es prop orione ap prop osta de traduió (p.e. no existeix a la base de dades ap segment amb un grau de similitud sup erior a un llindar mínim preestablert), amb la qual osa l'usuari ha de realitzar manualment la traduió que p osteriorment és emmagatzemada a la base de dades. Notar la gran similitud tenològia existent entre aquest tipus de sistemes i els sistemes de TA basats en exemples de traduió (Capítol 1.1.2): p o dem onsiderar aquests om una extensió dels sistemes de TA originals. Amb tot, aquests sistemes milloren les seves prestaions amb el pas del temps, ja que la realimentaió existent entre el sistema i l'usuari p ermet inrementar el nombre d'exemples existents a la base de dades, a la vegada que el sistema s'esp eialitza si es treballa amb dominis molt onrets. És p er això que aquests sistemes funionen esp e- ialment b é amb texts que presenten moltes rep etiions, o en traduions inrementals realitzades sobre do uments prèviament traduïts. Cal remarar que en aquests sistemes el motor de era és el punt ríti, ja que p er trobar oinidènies s'ha d'explorar grans quantitats d'informaió, així om identiar patrons i similituds en el as en que no es troben oinidènies. Per tant, la rapidesa del motor de era deneix en gran mesura les prestaions del sistema, donat que la latènia dels resultats de la era afeta diretament a l'usuari que es troba interatuant amb el sistema. D'altra banda, al notar que la qualitat de les traduions dep èn de la grandària de la base de dades, però al mateix temps una grandària exessiva de la base de dades p ot induir a latènies de era elevades (degut a la ma jor omplexitat del pro és de era). Existeixen diferent sistemes omerials de memòria de traduió om són Trados (SLD Trados Studio) [HK℄, Dejavú [Dej℄ o Google Translate Toolkit [Go o℄. 8 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 9  #19 i i 1.2. Traduió automàtia estadístia Sistemes interatius-preditius Aquesta aproximaió pretén fusionar els paradigmes de la traduió assistida i la traduió automàtia. Davant d'un text d'entrada, un sistema omplet de TA pro dueix hip òtesis de traduió de frases ompletes o de p orions d'aquestes, que po den ser aeptades o orregides p er l'usuari. Però la araterístia més interessant d'aquests sistemes és que són apaços de prop orionar prediions de traduió [Civ08℄: davant d'una traduió parial intro duïda p er l'usuari d'una frase origen (prex), el sistema prediu les traduions més probables que ompleten la frase (suxos), de les quals l'usuari p o drà aeptar o modiar una d'elles. Siga om siga, ada segment orregit és pro essat p el sistema de TA sub jaent p er tal de millorar la qualitat tant de les traduions om de les prediions. Així dons, aquests sistemes són requerits p er generar prediions adequades i de forma eient. 1.2 Traduió automàtia estadístia En aquesta seió intro duirem alguns oneptes bàsis p er entendre de forma intuïtiva l'enfo ament estadísti de la TA. D'ara endavant onsiderarem el problema de traduir una frase f d'un voabulari 9 d'entrada F a una frase e d'un voabulari d'eixida E 10 . 1.2.1 Coneptes bàsis de probabilitat En primer llo  introduirem una sèrie de no ions bàsiques estadístiques que seran àmpliament emprades en aquest doument, esp eialment el àlul de probabilitats, expliant intuïtivament el seu signiat dins del ontext de la TA. El àlul de probabilitats, om b é sab em, és una forma de quantiar la inertesa que tenim sobre les oses, om per exemple la possibilitat de si demà plourà o no, o la p ossibilitat de que la nostra partiipaió en un sorteig ens onvertisa en milionaris. Aquesta inertesa es p ot apturar fàilment amb l'ús de variables aleatòries: una variable aleatòria X representa el resultat d'un esdeveniment en onret i pren una sèrie de valors dependents del resultat d'eixe esdeveniment. Per exemple, si la variable aleatòria X representa l'esdeveniment resultat del llançament d'una moneda, i onsiderem om a p ossible resultat de l'esdeveniment ara ( X= ara ), aleshores la probabilitat de que el resultat de llançar una moneda siga ara és P(X= ara ) = 1/2 (p er simpliitat esriurem P( ara ) = 1/2 ). Tota variable aleatòria segueix una distribuió de probabilitat, que és la forma en que es reparteix la totalitat de la massa de probabilitat entre tots els suessos p ossibles. Hi ha asos en els que és fatible estimar la distribuió de probabilitat que segueixen els valors que p ot prendre d'una variable aleatòria mitjançant un anàlisi freqüenial (reopilar dades de p ossibles suessos i estimar la probabilitat d'o urrènia de adasun d'ells), p erò hi ha d'altres en els que la mesura d'inertesa dels 9 Anomenarem voabulari al onjunt de totes les paraules que p ertanyen un llenguatge. 10 Per onveni, s'utilitza f ( frenh, foreign ) i e ( english ) per denotar les frases d'entrada i d'eixida resp etivament. JASC-DSIC-UPV 9 memoria  2010/11/17  19:32  page 10  #20 i i Capítol 1. Intro duió suessos es pot a justar a alguna distribuió de probabilitat ja oneguda que es dona llo  en altres esenaris 11 . Per exemple, el llançament d'una moneda segueix una distribuió de probabilitat uniforme, en la que tots els possibles esdeveniments són equiprobables: P( ara ) = P( reu ) = 1/2 . Imaginem que p er uns moments no se'n reem i deidim llançar, p er exemple, un milió de vegades una moneda a l'aire, a veure que passa. Comprovaríem om aproximadament la meitat de vegades apareixeria ara, i l'altra meitat apareixeria reu: hauríem estimat la distribuió de probabilitat mitjançant un anàlisi freqüenial, que no és més que omptar freqüènies d'apariió d'un esdeveniment i normalitzar amb total d'esdeveniments. Aquest tipus d'estimaió, en la qual hem tratat d'a justar la nostra distribuió de probabilitat el màxim p ossible a les dades que hem reaptat, s'anomena estimaió p er màxima versemblança. Per exemple, sup osem que al llançar un milió de vegades una moneda a l'aire hem obtingut ara 500.427 vegades: P( ara ) = N( ara ) N( llançaments )=500427 1000000 = 0.500427 ≈1/2 (1.1) Com p o dem omprovar, no és neessari invertir tant de temps reopilant dades sobre aquesta variable aleatòria: sab em que el resultat del llançament d'una moneda ve mo delat p er una distribuió uniforme. En denitiva, p o dem veure una distribuió de probabilitat om una funió que assigna, a ada sués denit sobre una variable aleatòria, la probabilitat de que aquest sués s'esdevinga. Tota distribuió de probabilitat ompleix dues propietats: en primer llo , la probabilitat d'un sués en onret pren valors entre 0 i 1 (veure Equaió (1.2)), i en segon llo , la suma de les probabilitats de tots els p ossibles suessos deu sumar 1 (veure Equaió (1.3)). ∀x: 0 ≤p(x)≤1 (1.2) X x p(x) = 1 (1.3) Amb aquestes no ions bàsiques, es entrarem ara en el ontext de la TA. En aquest do ument tratarem prinipalment amb dues variables aleatòries: F (frase d'entrada) i E (frase d'eixida), amb valors e i f , resp etivament. Tot seguit detallem les expressions de probabilitat que emprarem a aquest do ument: p(e) És la probabilitat a priori . Representa la p ossibilitat de que e s'esdevinga. Per exemple, si e representa a la frase en anglès I like b ees, aleshores p(e) expressa la probabilitat de que una persona onreta pronunie en un moment donat la frase I like b ees. Notar que tamb é ens trobarem p(f) , amb un signiat anàleg. 11 Hi existeixen nombroses distribuions de probabilitat om són la uniforme, la normal (o gaussiana), la binomial o la multinomial, entre d'altres. 10 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 11  #21 i i 1.2. Traduió automàtia estadístia p(f|e) És la probabilitat ondiional. Representa la p ossibilitat que s'esdevinga f donat que e s'ha esdevingut. Per exemple, si e representa la frase en anglès I like b ees, i f representa la frase en atalà "Demà plourà", aleshores p(f|e) expressa la probabilitat de que un tradutor exp ert, després de llegir la frase e , la traduïsa en f (no sembla molt probable). Ara b é, si en anvi onsiderem que f representa la frase en atalà "M'agraden les ab elles", aleshores la osa anvia. Cal notar que tamb é ens trobarem p(e|f) , amb un signiat anàleg. p(e, f) És la probabilitat onjunta. Representa la possibilitat de que s'esdevinguen simultàniament e i f . Si e i f són indep endents (no existeix ap inuenia entre una i altra), aleshores p(e, f) = p(e)p(f) . Per exemple, si e representa l'event Llançar una moneda i treure ara, i e Llançar una moneda i treure reu, òbviament aquests esdeveniments no interfereixen l'un en l'altre, amb la qual osa la p ossibilitat de que a l'efetuar dos llançaments de moneda, en primer llo s'obtinga ara i després reu és p(e, f) = p(e)p(f) = 1/2×1/2 = 1/4 . D'altra banda, si e i f estan relaionades, aleshores s'aplia l'anomenada regla de la adena, de forma que p(e, f) = p(e)p(f|e) (o de forma equivalent, p(e, f) = p(f)p(e|f) ). Això signia que la probabilitat de que e i f s'esdevinguen simultàniament ve donada per la probabilitat de que  e s'esdevinga multipliat p er la probabilitat de que si e s'esdevé, aleshores f tamb é s'esdevé. En el as de la TA, si e i f són traduions mútues, aleshores existeix una lara relaió d'inuènia entre elles. Cal notar que p(e, f) i p(f, e) representen el mateix onepte. Per aabar, intro duïm la regla de Bayes, que és el pilar estadísti sobre el qual es fonamenta la TAE: p(e|f) = p(f, e) p(f)=p(e)p(f|e) p(f) (1.4) La regla de Bayes ens p ermetrà reformular la forma de alular om de b ona o dolenta és una frase e om a traduió d'una frase f . Més endavant raonarem sobre açò. 1.2.2 Traduió estadístia Po dem denir més formalment el problema al que s'afronta la TAE de la següent forma: donada una frase f d'un voabulari origen F , desitgem trobar aquella frase e d'un vo abulari destí E que maximitza p(e|f) , és a dir, busquem la traduió més probable ˆe : ˆe= argmax e p(e|f) (1.5) La funió argmax la po dem llegir de la següent forma: de totes les p ossibles frases (traduions) e , busquem aquella que maximitze el valor de p(e|f) , és a dir, la traduió més probable ˆe . Ara b é, om obtenim el valor de p(e|f) p er a ada p ossible JASC-DSIC-UPV 11 memoria  2010/11/17  19:32  page 12  #22 i i Capítol 1. Intro duió Transformació Cerca global ê = argmax_e p(e) · p(f|e) Transformació Frase d’eixida Frase d’entrada f e Model de Traducció p(f|e) Model de Llenguatge p(e) Figura 1.2: Arquitetura general del pro és de traduió basat en el raonament sobre la regla de Bayes. adena e ? La regla de Bayes ens p ermet raonar sobre el àlul d'aquesta distribuió de probabilitat: ˆe= argmax e p(e|f) = argmax e p(e)p(f|e) p(f)= argmax e p(e)p(f|e) (1.6) Cal notar que, om busquem la traduió més probable, p o dem estalviar-nos mo delar la distribuió de probabilitat p(f) , ja que no dep èn d' e i p er tant no afeta a la funió argmax . D'aquesta manera, la traduió ˆe més probable és aquella que maximitza el produte de dos termes: d'una banda, la probabilitat que s'esdevinga la frase e (p.e. la p ossibilitat de que algú pronunie en un moment donat la frase e ), i d'altra banda, la probabilitat de generar f havent observat e (p.e. la possibilitat de que algú traduïsa e en f ). Aquesta aproximaió es oneix om el mo del de la font i del anal [B + 90℄, el qual deneix l'equaió fonamental de la traduió automàtia estadístia [B + 93℄. Com veurem més endavant, p(e) es alula mitjançant mo dels de llenguatge (veure Seió 1.2.3), i p(f|e) mitjançant mo dels de traduió (veure Seió 1.2.4). A la Figura 1.2 p o dem observar l'arquitetura general de la traduió automàtia estadístia basada en la inferènia de Bayes [GV03℄. 12 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 13  #23 i i 1.2. Traduió automàtia estadístia Apliaió de la regla de Bayes Si analitzem un p o  més el signiat de l'Equaió (1.6), p o dem omprovar om se'ns insta a generar una frase e en l'idioma destí p er p osteriorment onvertir-la en una frase f en l'idioma origen, quan en realitat el que ens interessa és justament el ontrari, onvertir una frase f en una frase e en un idioma destí. Per que això, i no mo delar diretament p(e|f) ? Tot seguit entendrem per què amb un senzill exemple [Kni99b℄. Anem a raonar sobre la relaió existent entre infermetats i símptomes. Si onsiderem que f és un onjunt de símptomes i e és una infermetat en onret, des d'un punt de vista mèdi seria molt interessant p o der diagnostiar immediatament una infermetat a partir d'uns símptomes, és a dir, mo delar diretament p(e|f) . No obstant, és molt ompliat onstruir diretament aquest model, ja que hi ha moltes infermetats que p o den provo ar els mateixos símptomes. En anvi, sí que es oneix amb ertesa quins símptomes són provo ats p er una infermetat en onret, amb la qual osa és molt més viable onstruir un mo del p(f|e) . D'altra banda, tamb é seria fatible mo delar p(e) , la freqüènia d'apariió d'una infermetat en la p oblaió. Així dons, p er p o der soluionar el problema de mo delar diretament p(e|f) , p o dem raonar sobre la probabilitat de que una infermetat e s'esdevinga ( p(e) ), així om en la probabilitat de que els símptomes f que pateix un paient siguen provo ats p er eixa infermetat e en onret ( p(f|e )). Tanmateix, des d'un punt de vista lingüísti no sembla tant obvi que mo delar p(f|e) resulte menys omplex que p(e|f) : en realitat, i om veurem més endavant, a partir de la mateixa informaió p o drem onstruir indistintament ambdós mo dels. L'únia raó p er la qual s'aplia la regla de Bayes és que s'inlou una font d'informaió addiional i indep endent, p(e) , que ens p ermetrà millorar la qualitat de les traduions, i que a més resulta molt més fàil de onstruir, ja que aquest mo del dep èn úniament del llenguatge destí i p er tant p ot ser onstruït a partir d'un orpus monolingüe (om és obvi, és molt més fàil obtindre text monolingüe que text bilingüe). Ap ortaions dels mo dels al pro és de traduió Anem a expliar de forma intuïtiva allò que ap orten adasun dels mò duls que hem obtingut al raonar mitjançant la regla de Bayes: el mo del de llenguatge p(e) , i el mo del de traduió p(f|e) [Kni99b℄. D'una banda, sup osem que s'assigna un valor alt a p(f|e) sols si les paraules de la frase f són en general traduions de les paraules de la frase e . Baix aquesta assump ió, les paraules de f p o drien aparèixer en qualsevol ordre, així que p(f|e) no seria un b on mo del p er traduir frases de F a frases de E . D'altra banda, sup osem que assignarem un valor alt a p(e) si i sols si e és una frase gramatialment orreta, osa raonable p erò molt ompliada en la pràtia. Aleshores, si utilitzem amb dues fonts d'informaió en el pro és de onvertir la frase observada f en la seva traduió més probable e , d'aord amb l'Equaió (1.6) a ada p ossible e se li assignarà una puntuaió p(e)p(f|e) . El mo del p(f|e) ens garantirà que una hip òtesi e ontindrà paraules que en general seran traduions de les paraules de f . Per exemple, si onsiderem la frase f= la bruixa verda , les frases JASC-DSIC-UPV 13 memoria  2010/11/17  19:32  page 14  #24 i i Capítol 1. Intro duió e1= the green with i e2= with the green són dues traduions a les quals el mo del que estem onsiderant atorgarà una b ona puntuaió (molt p ossiblement la mateixa), p erò és obvi que e2 no és una b ona traduió de f . És en aquest aspete on intervé el fator p(e) , ja que aquest assignarà una puntuaió més baixa a aquelles frases no gramatials, i vieversa. Aleshores, en el òmput global de p(e|f) , e1 obtindrà una puntuaió ma jor que e2 . Donada aquesta p ersp etiva, p(e) efetivament es preoupa per l'ordre de les paraules de la frase d'eixida, mentre que p(f|e) no, amb la qual osa sembla més fàil onstruir p(f|e) que mo delar diretament p(e|f) . No obstant, seguir aquesta assump ió presenta ertes deiènies. Imaginem que el nostre mo del de traduió p(e|f) ens prop oriona la següent seqüènia de paraules: vaig del i vaig blava l'altre meu a anar una ami dia Toni serp asa trobar . Sembla bastant omplex reordenar aquesta frase, ns i tot per a un ésser humà, el qual disp osa d'una font de oneixement molt més ompleta que la d'una màquina. Per tant, arrib em a la onlusió de que p(f|e) deuria de saber almenys un p o  sobre l'ordre de les paraules, i no limitar-se a prop orionar un onjunt de paraules sense més. De la mateixa forma, resultaria molt útil si el mo del de llenguatge p(e) ap orta informaió sobre quines paraules elegir en la traduió nal. Per p osar un exemple, la prep osiió en anglès in p ot traduir-se al atalà de forma equivalent om a o en . Imaginem que, om a traduió a la frase I live in Beniolet , el mo del de traduió ens prop oriona dues p ossibles hip òtesis equiprobables: Vis en Beniolet i Vis a Beni- olet . La segon frase es troba en un atalà més orrete, amb la qual osa el mo del de llenguatge li assignarà ma jor probabilitat, i p er tant s'erigirà om la traduió més probable. Fins al moment hem presentat de forma intuïtiva om es modelitza el pro és de traduió, en el qual intervenen dos mò duls indep endents: un mo del de llenguatge p(e) i un mo del de traduió p(f|e) . Tot seguit desrivim més a fons aquests dos mo dels. 1.2.3 Mo dels de llenguatge Com ja hem esmentat adés, el mo del de llenguatge és l'esp eialista de l'idioma destí, dons és apaç de donar ma jor imp ortània a aquelles traduions gramatialment orretes, en detriment d'altres traduions més impreises. Ara b é, om obté aquest mo del tot el oneixement que té al seu abast? Els as ideal seria onferir al mo del informaió sobre les propietats gramatials, sintàtiques i semàntiques del llenguatge, i inlús informaió sobre allò que diuen i esriuen les p ersones. Ara b é, obtindre i representar tota aquesta informaió és una tasa tant exessivament omplexa que no és assumible. En la pràtia, resulta molt més senzill emmagatzemar frases que es p o den esriure o pronuniar en el llenguatge que es mo delitza, reopilades a partir d'un orpus monolingüe d'exemples de frases, estimant la distribuió de probabilitat de les frases en E p er màxima versemblança. Per exemple, si al reopilar 10000 frases en atalà detetem que la frase M'agrada la assola al forn apareix 12 vegades, aleshores la probabilitat de que aquesta frase s'esdevinga és p( M'agrada la assola al forn ) = 14 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 15  #25 i i 1.2. Traduió automàtia estadístia 12/10000 = 0.0012 . Seguir aquesta aproximaió presenta un problema: és imp ossible apturar totes les frases que es p o den generar en un llenguatge (p.e. la frase El meu besnét menja gossos verds i àguiles blaves és ompletament orreta, però p o  freqüent). Aleshores, ap la p ossibilitat que durant el pro és de traduió s'assigne una p(e) igual a zero a frases p erfetament orretes degut a que mai s'han vist en l'entrenament del mo del. Per tant, no serviria de res tenir un b on mo del de traduió p(f|e) si el mo del de llenguatge p(e) assigna probabilitat zero a frases orretes, ja que en el òmput total de p(e|f) obtindríem una probabilitat nul · la. Arribats a aquest punt, ens donem ompte que no és neessari emmagatzemar una gran base de dades de frases p er jutjar si una frase és gramatialment orreta o no (p ensem en l'exemple anterior). En anvi, si trossegem la frase i els segments resultants són gramatialment orretes, i després aquests segments els p o dem ombinar de forma raonable, aleshores p o dem armar que la frase és b ona. I és preisament aquesta aproximaió la que més b ones prestaions onfereix als mo dels de llenguatges i la més omunament emprada als sistemes estadístis de traduió automàtia [GV03℄. Mo dels d' n -grames D'aord amb l'aproximaió que aab em d'exp osar, la frase d'eixida e es trosseja en segments o sub adenes. Una sub adena d' n paraules s'anomena n -grama, de forma que, p er exemple, si n= 2 parlem de bigrames, si n= 3 parlem de trigrames, o si n= 1 parlem d'unigrames (o simplement paraules). Aleshores, si una frase està formada p er una sèrie d' n -grames raonables, és molt probable que siga una frase gramatialment orreta [Kni99b℄. En general, i més formalment, un mo del d' n -grames es deneix de la següent forma [GV03℄: p(e) = I Y i=1 p(ei|e1,...,ei−1) (1.7) on I és la longitud de la frase e , ei és la paraula i -èsima de la frase e , i e0=e−1= . . . =e−n+1 =eI+1 = $ , que és un símbol emprat p er delimitar les frases. En realitat, l'Equaió (1.7) és el resultat apliar a p(e) la regla de la adena a nivell de paraula [Ko e10℄: p(e) = p(e1, e2, ..., eI) = p(e1)p(e2|e1)p(e3|e2, e1). . . p(eI|e1, ..., eI−1) (1.8) D'aquesta forma, la probabilitat del model p(e1, e2, ..., eI) és el pro dute de les probabilitats de ada paraula ei donada la història de la mateixa 12 . Ara b é, és molt ostós i 12 Conjunt de paraules preedents a la paraula onsiderada. JASC-DSIC-UPV 15 memoria  2010/11/17  19:32  page 22  #32 i i Capítol 1. Intro duió ple lletde the glass està el got is full of milk 1 1 2 2 3 3 4 4 5 5 6 6 a:{1→4,2→5,3→6,4→3,5→1,6→2} Figura 1.4: Exemple d'alineament en el que les paraules alineades o up en p osiions diferents en adasuna de les frases. els bonics pobles the nicest villages 1 1 2 2 3 3 4 més a:{1→1,2→3,3→2,4→2} Figura 1.5: Exemple d'alineament en el que una paraula d'eixida es troba relaionada amb més d'una paraula d'entrada. Cal notar que, a p esar d'estar mo delitzant la traduió d'anglès a atalà (mo del invers), la funió d'alineament assigna p osiions de paraules en atalà a p osiions de paraules en anglès. Com p o dem observar, l'alineament de la Figura 1.3 és molt senzill, ja que les paraules alineades presenten el mateix ordre a la frase d'entrada i d'eixida. En general, p o dem trobar-nos en aquests asos: 1. Les paraules alineades apareixen en el mateix ordre a la frase d'entrada i d'eixida (Figura 1.3). 2. Les paraules alineades p o den aparèixer en ordres diferents a adasuna de les frases (Figura 1.4). 3. Una paraula de la frase d'eixida e p ot estar alineada amb més d'una paraula de la frase d'entrada f p er expressar el mateix onepte (Figura 1.5). 22 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 23  #33 i i 1.3. Aproximaions a la traduió automàtia estadístia és un it is xiulet ! whistle ! 1 1 2 2 3 3 4 4 5 a a:{1→2,2→3,3→4,4→5} Figura 1.6: Exemple d'alineament en el que paraules de la frase d'eixida no han estat alineades amb ap paraula de la frase d'entrada. hi haver van NULL yesterday discussions there were discussions 1 1 2 2 3 3 4 4 5 ahir 0 a:{1→1,2→0,3→3,4→3,5→4} Figura 1.7: Exemple d'alineament en el que paraules de la frase origen es trob en alineades amb la paraula destí esp eial NULL . 4. Poden haver-hi paraules de la frase d'eixida e que no tenen un lar equivalent en la frase d'entrada f , i que p er tant no són alineades. (Figura 1.6). 5. De la mateixa forma, p o den haver-hi paraules de la frase d'entrada f que no tenen relaió amb ap paraula de la frase d'eixida. Aquest as rep un trate esp eial: donat que la funió d'alineament és ompleta i p er tant totes les paraules de la frase d'entrada deuen estar alineades amb exatament una paraula de la frase d'eixida, s'intro dueix una paraula esp eial, NULL 16 , que s'alinea amb les paraules de la frase d'entrada que es trob en en aquest as (Figura 1.7). Com hem esmentat abans, els nostres orpus d'entrenament no es trob en alineats a nivell de paraula, sinó a nivell de frase, amb la qual osa resulta neessari alular aquests alineaments p er p o der estimar els paràmetres del mo del de tradu- ió. Aleshores, un model de traduió basat en paraules presenta de forma implíita un mo del d'alineament que haurem d'estimar, de forma que estarem mo delitzant 16 Paraula nul · la. JASC-DSIC-UPV 23 memoria  2010/11/17  19:32  page 24  #34 i i Capítol 1. Intro duió p(f, a |e) (és a dir, donada la frase e , quina és la probabilitat d'obtenir la frase f amb un alineament a ). Mo dels d'IBM Amb tot, aab em de prop osar un mo del de traduió p(f, a |e) que onsidera l'alineament existent entre les paraules de les frases d'entrada i d'eixida om una variable o ulta (no disp osem d'aquests alineaments). Aquest model és onegut om el Mo del 1 d'IBM, prop osat p er P.F. Brown i altres investigadors d'IBM a l'any 1990 [B + 90, B + 93℄, i que va sup osar una gran revoluió en el amp de la TA. El primer mo del d'IBM deneix la probabilitat de traduir una frase d'eixida e= e1. . . eI de longitud I en una frase destí f=f1...fJ de longitud J , amb una funió d'alineament a que relaiona ada p osiió (paraula) de la frase d'entrada fj amb una p osiió (paraula) de la frase d'eixida ei , d'aquesta forma [Ko e10℄: p(f, a |e) = J Y j=1 1 I+ 1 t(fj|ea(j)) = 1 (I+ 1)J J Y j=1 t(fj|ea(j)) (1.22) és a dir, la probabilitat de traduir una frase e en una frase f d'aord amb un alineament a és el pro dute de les probabilitats del mo del de traduió lèxia p er traduir adasuna de les J paraules de la frase d'entrada a la posiió j en les seves respetives paraules d'eixida a la p osiió a(j) , normalitzat p el nombre total d'alineaments p ossibles (notar que p er la inlusió de la paraula NULL hi ha un total de I+ 1 paraules d'eixida, a ombinar amb J paraules d'entrada). Si a l'exemple de la Figura 1.3 li apliquem la deniió d'aquest mo del, la probabilitat de traduir la frase the glass is ful l of milk en el got està ple de l let és: p(f, a |e) = 1 76·t( el | the )·t( got | glass )·t( està | is )·t( ple | ful l )·t( de | of )·t( l let | milk ) La relaió existent entre un mo del de traduió i el mo del d'alineament sub jaent ve donat p er la següent expressió [Ko e10, GV03℄: p(f|e) = X a p(f, a |e) (1.23) és a dir, la probabilitat de que la frase e es traduisa en la frase f onsidera tot p ossible alineament entre e i f . En la pràtia sols es onsidera l'alineament més probable (l'anomenat alineament de Viterbi) p er aproximar el àlul del sumatori denit sobre a [GV03℄: X a p(f, a |e)≈max ap(f, a |e) (1.24) 24 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 25  #35 i i 1.3. Aproximaions a la traduió automàtia estadístia Cal notar que l'alineament més probable és aquell que maximitza la probabilitat de que la frase e es traduisa en la frase f : ˆa= argmax a p(f, a |e) (1.25) Un mo del de traduió basat en paraules dep èn d'una sèrie de paràmetres θ que són estimats maximitzant la versemblança per a un orpus d'entrenament {(fn, en)∈C: n= 1,...,N} [GV03℄: ˆ θ= argmax θ N Y n=1 X a pθ(fn, a |en) (1.26) Ara bé, p er a realitzar aquesta estimaió de paràmetres tenim un problema. Des d'un primer moment hem assumit que disp osàvem dels alineaments paraula p er paraula p er a ada parell de frases del orpus d'entrenament, amb la qual osa estimar les probabilitats de traduió lèxia (o siga, estimar els paràmetres del mo del de traduió lèxia) p er màxima versemblança ha estat quasi trivial. Però om sabem, no disp osem de ap mo del d'alineament. No p o dem estimar el nostre mo del de traduió a partir d'informaió inompleta: és p er això que l'alineament entre paraules és onsiderat una variable o ulta al nostre mo del. D'una banda, si oneixerem els alineaments entre paraules, resultaria fàil estimar el model de traduió de paraules. Per l'altra banda, si disp osarem del mo del ja estimat, seria p ossible obtindre els alineaments de paraules més probables p er a ada parell de frases. Malauradament, no disp osem ni d'una osa ni de l'altra. Ara b é, existeix una tènia amb la qual sí p o dem fer front a aquest problema. L'algoritme EM 17 [DLR77℄ permet enarar el problema de la informaió inompleta i de l'estimaió de paràmetres de mo dels probabilístis amb variables o ultes. Podem trobar més informaió al resp ete a [Koe10, B + 93℄. A més del Mo del 1 d'IBM, existeixen quatre models de omplexitat reixent que intro dueixen millores resp ete als mo dels anteriors. Aquests són: • Mo del 2 d'IBM : Afegeix al mo del original un mo del d'alineament absolut. • Mo del 3 d'IBM : Afegeix un mo del de fertilitats 18 . • Mo del 4 d'IBM : Afegeix un mo del d'alineament relatiu. • Mo del 5 d'IBM : Esmena la deiènia que presenten onjuntament els models 3 i 4. Per a més informaió sobre els models d'IBM, remetem al letor a [Ko e10, GV03, B + 90, B + 93℄. 17 Expetation-Maximization Algorithm . 18 Mo dela la probabilitat de que una paraula de la frase origen s'alinee amb n paraules de la frase destí. JASC-DSIC-UPV 25 memoria  2010/11/17  19:32  page 26  #36 i i Capítol 1. Intro duió my best friend ’s girlfriend la nuvia has lived for del meu millor amic ha viscut durant 10 anys 10 years in bocairent . a bocairent . Figura 1.8: Exemple del pro és de traduió automàtia en sistemes basats en seqüènies de paraules. 1.3.2 Mo dels basats en seqüènies de paraules En la seió anterior hem presentat un mo del que es basa en la traduió de paraules aïllades. Ara bé, om ja s'ha esmentat, traduir a nivell de paraula no és molt reomanable, dons hi ha paraules d'un llenguatge origen que es p o den traduir en dues o més paraules del llenguatge destí, i vieversa. Considerar solament paraules aïllades, a més, imp edeix apturar el ontext en que es trob en, i en onseqüènia, la semàntia o signiat de la paraula, informaió que resultaria molt valuosa a l'hora d'esollir entre múltiples aep ions. Aquests són els prinipals motius p els quals resulta més onvenient esollir una unitat bàsia de traduió de ma jor grandària que p ermeta apturar informaió ontextual. Aquest element bàsi, que p ot englobar una o més paraules, s'anomena seqüènia de paraules 19 . Les seqüènies de paraules s'obtenenen dividint una frase ompleta en segments de paraules ontigues i de longitud variable. La Figura 1.8 il · lustra om funionen aquests sistemes: la frase d'eixida e és segmentada en seqüènies de paraules, de forma que ada seqüènia e és traduïda al llenguatge origen F , originant seqüènies f que són reordenades a posteriori (si s'esau). Si ens xem en l'exemple, la seqüènia de paraules en anglès girlfriend es tradueix de forma òptima al atalà om la núvia . Per tal de onèixer les traduions més probables p er a ada seqüènia de paraules, haurem de disposar d'una distribuió de probabilitat que ens prop orione la probabilitat d'obtindre una seqüènia de paraules d'entrada f om a traduió d'una seqüènia e d'eixida (atès que onsiderem el mo del de traduió invers). Cal destaar que els sistemes de TA basats en seqüènies de paraules no empren ap mèto de lingüísti p er segmentar una frase. Per exemple, si ens xem novament en l'exemple de la Figura 1.8, una de les seqüènies de paraules obtingudes és has lived for , la qual, baix un d'un punt de vista sintàti, representa un agrupament inorrete, dons seria més lògi segmentar de forma separada verb ( has lived ) i omplement ( for 10 years ). No obstant, realitzar aquest tipus d'agrupaions ( has lived for ) resulta molt útil, ja que p ermet apturar fàilment el signiat sempre onfús de les prep osiions. Vegem un exemple: si tratarem de traduir de forma aïllada la prep osiió for p o dríem esollir entre per, per a, a ausa de, en, a favor de, durant, , et. Ara b é, atenent al ontext en que apareix, la traduió més apropiada sembla ser durant . Aquesta valuosa informaió es aptura agrupant verb i prep osiió en la segmentaió, i generant 19 Phrase , en anglès. 26 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 27  #37 i i 1.3. Aproximaions a la traduió automàtia estadístia la orresp onent seqüènia de paraules traduió (en el nostre as has lived for , en ha visut durant ). Per tant, realitzar agrupaments de paraules en llo de onsiderar paraules aïllades ens p ermetrà resoldre moltes de les ambigüitats que se'ns puguen presentar al pro és de traduió. Addiionalment, emprar aquest enfo ament basat en seqüènies de paraules omp orta un b enei extra. El p o der obtenir segments de longitud variable a partir de les frases origen del orpus d'entrenament ens p ermet memoritzar les seves resp e- tives traduions, p o dent arribar a emmagatzemar ns i tot traduions de frases ompletes. Ara b é, en la pràtia el nombre de paraules que p ot abastar una seqüèn- ia és limitat (típiament a 7), dons la omplexitat d'aquests mo dels (el nombre de paràmetres) reix exponenialment onforme a la longitud o grandària màxima que p o den assolir les seqüènies de paraules. Deniió del mo del de seqüènies de paraules Formalment, un mo del de traduió invers p(f|e) basat en seqüènies de paraules deneix la probabilitat de traduir una frase d'eixida e=e1, e2,...,eK , segmentada en K seqüènies de paraules, en una frase d'entrada f=f1, f2, . . . , fK de la següent forma: p(f|e) = K Y k=1 p(fk|ek) (1.27) és a dir, p(f|e) es deneix om el pro dute de les probabilitats de traduir ada seqüènia de paraules ek en fk . Cal notar que ambdues frases e i f presenten el mateix nombre de segmentaions, fet p el qual tota seqüènia de paraules d'eixida ek genera una seqüènia de paraules d'entrada fk durant el pro és de traduió. Extraió de seqüènies de paraules Com ja sab em, partim d'un orpus de parells de frases {(fn, en)∈C:n= 1,...N} , a partir del qual s'obtenen els parells de seqüènies de paraules (f, e) , que són els paràmetres del nostre model. Com s'obtenen aquestes seqüènies de paraules? És obvi que un riteri aleatori no té gens de sentit, dons a banda de que p er ada parell de frases es po drien extraure desenes, entenars, o inlús milers de parells de seqüèn- ies, osa que seria impossible de gestionar, extraure per exemple un hip otèti parell de seqüènies de paraules ( 10 anys , my best friend ), és inútil i ontrapro duent. Un p ossible mèto de seria onsiderar la segmentaió de les frases del orpus d'entrenament om una variable o ulta en el mo del, i estimar les segmentaions més probables per màxima versemblança apliant un entrenament Expetation-Maximization [DLR77℄. No obstant, emprar aquesta tènia d'estimaió és una tasa molt ostosa, així que optarem p er una estratègia alternativa més manejable basada en tèniques heurístiques, a osta de p erdre erta orreió i rigor estadísti. Es trata de partir dels alineaments de paraules p er a ada parell de frases (que es po den obtindre mitjançant els mo dels d'IBM, Seió 1.3.1) en amb dues direions de traduió, ombinar-los JASC-DSIC-UPV 27 memoria  2010/11/17  19:32  page 28  #38 i i Capítol 1. Intro duió pense que Lídia serà molt bona directora I think that Lídia will be a very good head teacher Figura 1.9: Exemple d'extraió de parells de seqüènies de paraules a partir de l'alineament entre paraules d'un parell de frases. apliant un algorisme heurísti, i extraure aquells parells de seqüènies de paraules que siguen onsistents amb els alineaments ombinats. Un parell de seqüènies de paraules (f, e) és vàlid i onsistent amb un alineament A si totes les paraules f1,...,fn∈f que presenten alineaments en A trob en totes les seves paraules alineades en la seqüènia e , i vieversa. Més formalment [Koe10℄: (f, e) és onsistent amb A⇔ ∀fj∈f: (fj, ei)∈A⇒ei∈e∧ ∧ ∀ei∈e: (fj, ei)∈A⇒fj∈f∧ ∧ ∃fj∈f, ei∈e: (fj, ei)∈A (1.28) Cal notar que l'última ondiió determina que un parell de seqüènies de paraules deu ontenir almenys un alineament entre paraules. Per desomptat, es p o den inloure paraules no alineades, ja que no es violaria ap de les ondiions estipulades a l'Equaió (1.28). Això signia que, quant menys alineaments, més p ossibles parells de seqüènies de paraules a extraure, a exep ió del as extrem (ap alineament), dons no es p o dria extraure ap seqüènia de paraules al violar-se la terera ondiió. 28 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 29  #39 i i 1.3. Aproximaions a la traduió automàtia estadístia Figura 1.10: Exemples de p ossibles seqüènies de paraules onsistents i in- onsistents, dep enent de l'alineament entre les paraules d'un parell de frases qualsevol. A la Figura 1.9 p o dem observar un exemple d'extraió de seqüènies de paraules a partir d'un alineament entre paraules d'un parell de frases. En la quadríula es mostren els alineaments existents entre les paraules que formen part de la frase en anglès I think that Lídia wil l be a very good teaher i en atalà pense que Lídia serà molt bona diretora . Les zones negres denoten l'existènia d'un alineament entre paraules, mentre que la zona gris (inlo ent les zones negres dels alineaments) determina un parell de seqüènies de paraules extretes de forma vàlida ( serà molt bona diretora - wil l be a very good head teaher ). Fixem-nos en que les restriions adés formulades (veure Equaió (1.28)) es ompleixen: d'una banda existeix almenys un alineament entre les paraules que formen part de les seqüènies de paraules extretes, i d'altra banda s'abasta tot p ossible alineament de les paraules inloses. Aquest és només un dels nombrosos parells de seqüènies de paraules que es p o den extraure partint d'aquest alineament. Podem observar, a ontinuaió, part dels p ossibles parells de seqüènies de paraules que es po den extreure de forma vàlida: pense  I think pense que  I think that que  that pense que Lídia  I think that Lídia Lídia  Lídia que Lídia  that Lídia pense que Lídia serà  I think that Lídia wil l be ... pense que Lídia serà molt bona diretora  I think that Lídia wil l be a very good teaher D'altra banda, la Figura 1.10, extreta de [Ko e10℄, mostra asos en els que un p ossible parell de seqüènies de paraules és onsistent o no donat l'alineament entre paraules d'un parell de frases. Tenint en ment que totes les paraules que formen part del parell de seqüènies deuen d'estar alineades les unes amb les altres (si és que presenten algun alineament), p o dem determinar que el primer exemple (esquerra) és ompletament vàlid; el segon exemple (entre) viola una de les ondiions, ja que JASC-DSIC-UPV 29 memoria  2010/11/17  19:32  page 30  #40 i i Capítol 1. Intro duió un punt d'alineament marat amb una reu es troba fora del rang de paraules que abasta la seqüènia; i p er últim, el terer exemple (dreta) representa una extraió vàlida, dons inlou la paraula de la terera olumna que no es troba alineada amb ap paraula. Cal remarar que les seqüènies de paraules que s'extrauran p o den tenir una longitud variable, dons p o den abastar des de paraules aïllades ns frases seneres. No obstant, om ja hem esmentat adés, és molt onvenient que la longitud de les seqüèn- ies de paraules extretes siga limitada. D'altra banda, al tenir en ompte que les seqüènies de paraules llargues permeten apturar ma jor informaió de ontext, motiu p el qual aquestes són esp eialment útils en la traduió d'expressions fetes (seria un sistema de TA apaç de traduir orretament l'expressió feta en atalà a burro barra , que signia aleatòriament ?). Ara, al notar que les seqüènies de paraules de ma jor longitud es donen llo  amb molt menor freqüènia que les seqüènies més urtes, molt més freqüentment emprades per onstruir les traduions de les frases d'entrada, p erò que presenten l'inonvenient d'ap ortar menys informaió de ontext. La onlusió és que neessitarem tant de segments urts que p o drem apliar en nombroses o asions, om segments llargs que ens p ermetran realitzar traduions molt més preises. Estimaió del mo del L'estimaió d'un model de traduió de seqüènies de paraules invers es realitza, a partir de les seqüènies de paraules extretes de forma heurístia a partir d'un orpus d'entrenament de parells de frases {(fn, en)∈C:n= 1,...N} , de la següent forma [Ko e10℄: p(f|e) = N(f, e) Pf′N(f′, e) (1.29) on N(f, e) és el nombre de vegades que s'ha extret el parell de seqüènies de paraules (f, e) . Reordenament de seqüènies de paraules Com hem vist a l'Equaió 1.27, el mo del de traduió s'ha denit úniament a partir de les probabilitats de traduió de ada seqüènia de paraules en que s'ha segmentat la frase origen. Com hem esmentat al prinipi d'aquesta seió, durant el pro és de traduió la frase origen és segmentada en seqüènies de paraules que p osteriorment són traduïdes i, p ossiblement, reordenades, ja que l'ordre en que apareixen les paraules p ot ser diferent en adasun dels idiomes onsiderats. En general, preferim que les seqüènies de paraules destí no es reordenen (és a dir, que les seqüènies es traduïsquen de forma monòtona, seguint el mateix ordre que les seqüènies de paraules de la frase origen), o b é que anvien la seva p osiió el mínim p ossible, dons salts llargs són infreqüents i, p er tant, p o  probables (tot i que això dep èn del parell de llenguatges). Per tant, premiarem la immobilitat de les seqüènies de paraules traduïdes, i p enalitzarem els salts llargs al reordenar-les. 30 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 31  #41 i i 1.3. Aproximaions a la traduió automàtia estadístia En aquest sentit, s'introdueix un mo del de distorsió o reordenament que es deneix om una funió exp onenial d(x) = αx amb un valor apropiat del paràmetre α∈[0,1] , on x és la distània en paraules del salt efetuat p er la seqüènia de paraules al ser reordenada. La distània del salt x es alula de la següent forma: x=| inii k−  k−1−1| (1.30) on inii k és la p osiió, resp ete a la frase origen, de la primera paraula de la seqüènia de paraules d'entrada que es tradueix a la k -èsima seqüènia de paraules d'eixida, i  k−1 és la p osiió de l'última paraula de la seqüènia de paraules d'entrada que es tradueix a la ( k−1 )-èsima seqüènia de paraules d'eixida (és a dir, la seqüènia d'eixida preedent a la onsiderada). Aleshores, si ombinem aquest mo del amb el mo del de traduió de seqüènies de paraules, obtenim un nou mo del prop orional al presentat a l'Equaió (1.27): p(e|f)∝ K Y k=1 p(ek|fk)d(| inii k−  k−1−1|) (1.31) Com veiem, aquest mo del de distorsió és extremadament simple, dons no té en ompte ap informaió sobre les paraules i/o seqüènies de paraules que intervenen en la traduió. Per exemple, p o den haver-hi ertes seqüènies que, al traduir-les a un llenguatge onret, siguen més prop enses a ser reordenades que altres. Un as típi és el que oorre amb els noms i els adjetius, que al traduir de l'anglès al atalà anvien molt freqüentment la seva p osiió. Existeixen altres models de reordenament més omplexos que p ermeten apturar aquesta informaió que estudiarem al següent apítol. Per onloure aquesta seió, remarar que, en el moment en que s'esriuen aquestes línies, els sistemes de TA basats en seqüènies de paraules són els que millors prestaions ofereixen en omparaió amb altres aproximaions, i un dels prinipals ob jetes de la omunitat investigadora [CBKM + 10, Ko e10℄. 1.3.3 Mo dels basats en transdutors Aquesta aproximaió trata de mo delar la relaió entre el llenguatge origen i el llenguatge destí mitjançant autòmates o transdutors d'estats nits esto àstis 20 (TEFS). La araterístia més interessant d'aquesta aproximaió és que els TEFS inlouen de forma implíita un mo del de llenguatge de l'idioma destí. Conseqüentment, es p ot mo delar diretament la probabilitat onjunta de la frase origen f i destí e . Aleshores, baix aquest prinipi, la traduió més probable e ve donada p er la següent expressió: ˆe= argmax e p(f, e) (1.32) 20 Amb probabilitats asso iades a transiions i/o estats. JASC-DSIC-UPV 31 memoria  2010/11/17  19:32  page 38  #48 i i Capítol 2. Traduió automàtia estadístia basada en seqüènies de paraules 2.1.1 Mo dels logarítmi-lineals Un mo del logarítmi-lineal 1 (log-lineal, d'ara endavant) és un mo del emprat reentment al món del reoneixement de formes que p ermet onstruir una distribuió de probabilitat integrant diverses distribuions de probabilitat (o mo dels), que en aquest ontext s'anomenem araterístiques o features , tot mitjançant una ombinaió lineal dels logaritmes de les probabilitats en forma exp onenial. Formalment, es deneixen de la següent manera: p(x) = exp N X i=1 λihi(x)!1 Z (2.1) on p(x) és la distribuió de probabilitat a mo delar, N és el nombre de araterístiques a onsiderar en el mo del omplet, hi és la araterístia i -èsima, els λi són els paràmetres del mo del asso iats a la araterístia i -èsima, i Z és el fator de normalitzaió, denit així: Z=X x′ exp N X i=1 λihi(x′)! (2.2) En el as onret de la TA basada en seqüènies de paraules, d'aord amb l'Equaió (1.5) la distribuió de probabilitat que volem mo delar amb un mo del log-lineal és p(e|f) : p(e|f) = exp K X k=1 N X i=1 λihi(f, e, fk, ek)!1 Z(f) (2.3) on K és el nombre de seqüènies de paraules en que es desomposa la frase d'entrada, de forma que ada araterístia hi(f, e, fk, ek) dep èn del k -èsim segment, mentre que Z(f) es deneix de forma a anàloga a l'Equaió (2.2). Si integrem aquest mo del en el riteri de deisió de l'Equaió (1.5), tenim que: ˆe= argmax e"exp K X k=1 N X i=1 λihi(f, e, fk, ek)!1 Z(f)# (2.4) Donat que busquem aquella frase e que maximitze la probabilitat del mo del mitjançant la funió argmax , p o dem simpliar aquesta expressió: en primer llo  p o dem presindir de Z(f) , ja que és una onstant respete a e , i p er tant no afeta al riteri de deisió argmax ; i en segon llo, p o dem eliminar la funió exp , dons és una funió monòtona reixent, i p er tant tampo  afeta al resultat de la funió argmax , ja que tots els termes sobre els quals es alularia el màxim serien prop orionals a la funió exp . 1 Log-linear model , en anglès. 38 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 39  #49 i i 2.1. El sistema de TA Moses ˆe= argmax e"K X k=1 N X i=1 λihi(f, e, fk, ek)# (2.5) Si instaniem un mo del log-lineal emprant els mo dels vists a la Seió 1.3.2, tenim un total de tres araterístiques, que són: •h1(f, e, fk, ek) : Mo del de traduió de seqüènies de paraules log p(fk|ek) •h2(f, e, fk, ek) : Mo del de distorsió log d(| inii k−  k−1−1|) •h3(f, e, fk, ek) : Mo del de llenguatge log p(ek) Integrar tota aquesta informaió en un mo del log-lineal presenta una sèrie d'avantatges: en primer llo , p ermet a justar l'ap ortaió de adasun dels mo dels, amb els paràmetres λi . En segon llo , se'ns p ermet afegir de forma natural nous mo dels que p o den ontribuir a millorar la qualitat de les traduions. Per últim, se'ns dona la p ossibilitat d'entrenar adasun dels mo dels de forma separada, ja que s'assumeix que són indep endents els uns dels altres. A la Seió 2.1.2 desriurem les araterístiques addiionals, no presentades en- ara, que s'inlouen al mo del log-lineal de Moses , i p osteriorment, a la Seió 2.1.3 desriurem el model omplet d'aquest sistema, que integra totes les araterístiques que s'exp osen a aquest do ument. 2.1.2 Extensions del mo del original En aquesta seió desriurem les araterístiques, no presentades enara, que implementa Moses al mo del log-lineal. Mo del de traduió de seqüènies de paraules direte Com hem vist al apítol intro dutori, a l'apliar la regla de Bayes (veure Equaió (1.6)) hem onsiderat un mo del de traduió invers p(f|e) , el qual hem aproximat a la traduió de seqüènies de paraules (veure Equaió (1.27)). Al passar d'un mo del purament generatiu a un mo del log-lineal, s'habilita la p ossibilitat d'inloure el model de traduió direte p(e|f) om una nova araterístia del mo del log-lineal, ja que p o dem trobar asos partiulars en els que disp osar del raonament direte és molt útil. En Moses s'empren ambdues direions del mo del de traduió de seqüènies de paraules, p(f|e) i p(e|f) , que amb un a just adequat dels p esos asso iats s'ha demostrat que onjuntament milloren de forma signiativa les prestaions globals del sistema [Koe10℄. JASC-DSIC-UPV 39 memoria  2010/11/17  19:32  page 40  #50 i i Capítol 2. Traduió automàtia estadístia basada en seqüènies de paraules Mo del de suavitzat lèxi A l'entrenar el model de traduió de seqüènies de paraules p o dem trobar-nos amb asos no desitjats relaionats amb el tratament de seqüènies de paraules po  freqüents, om és el as en que un parell de seqüènies f i e s'han extret una únia vegada del orpus d'entrenament i a més de forma onurrent, fet que implia una sobreestimaió del mo del, dons p(f|e) = p(e|f) = 1 . En aquest ontext s'intro dueix un mèto de de suavitzat om una araterístia addiional en el mo del log-lineal, anomenat model de suavitzat lèxi 2 , el qual mo dela la probabilitat de traduió, paraula p er paraula, de la seqüènia de paraules f en la seqüènia e a partir d'un alineament a entre les paraules d'amb dós seqüènies. Dit mo del es troba larament inspirat en el mo del 1 d'IBM vist a la Seió 1.3.1. Així, la falta d'informaió que es deriva, en erts asos, en una sobreestimaió del mo del de traduió de seqüènies de paraules, es omp ensa inlo ent un mo del de traduió lèxi, estadístiament més signiatiu i robust. L'estimaió d'aquest mo del ve donada p er la següent equaió [Koe10℄: lex (e|f, a) = I Y i=1 1 |{j|(i, j)∈a}| X ∀(i,j)∈a t(ei|fj) (2.6) on t(ei|fj) és la probabilitat de traduir la paraula fj en ei , i a és un alineament entre les paraules de les seqüènies f i e . Donat que una paraula ei p ot estar alineada amb més d'una paraula de f , la probabilitat de traduió lèxia per a ada ei és normalitzada p el nombre d'alineaments que presenta la paraula ei . El sistema Moses inlou ambdues direions del mo del lèxi: lex (e|f, a) i lex (f| e, a) . Penalitzaió p er paraula Una araterístia del mo del log-lineal de Moses que en o asions dona problemes és el mo del de llenguatge. Com hem vist a la Seió 1.2.3, la ma joria dels sistemes TA inlouen un mo del de llenguatge d' n -grames, om és el as de Moses . El que no hem esmentat a dita seió és que els mo dels de llenguatge basats en n -grames són deients per naturalesa, dons aquests mo delen tant frases orretes om inorretes del llenguatge destí, des d'un punt de vista lingüísti. En altres paraules, po dem veure el mo del de llenguatge om un element que mo dela E∗ (totes les p ossibles ombinaions de paraules del voabulari destí E ), de forma que p ot onferir probabilitats altes a frases sintàtiament no vàlides. A més, els mo dels de llenguatge basats en n -grames són deients p er un altre motiu: en general, assignen ma jor probabilitat a frases urtes que a frases llargues. Això és així p erquè, a ma jor longitud de frase (ma jor nombre de paraules), ma jor nombre d' n -grames a onsiderar, fet que es tradueix en un ma jor nombre de termes de probabilitats multipliant-se, obtenint un valor de probabilitat ada op més baix. En 2 Lexial weighting , en anglès. 40 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 41  #51 i i 2.1. El sistema de TA Moses denitiva, p o dem onsiderar que un mo del de llenguatge basat en n -grames assumeix, p er a qualsevol llenguatge, que les frases urtes són molt més probables que les frases llargues. L'efete negatiu que provo a la deiènia del model de llenguatge, des de la p ersp etiva del pro és de traduió, es tradueix en una tendènia del sistema a deantar-se p er traduions de menor longitud i p ossiblement inorretes des d'un punt de vista lingüísti, en detriment de traduions de ma jor longitud i p ossiblement orretes. En termes de deisió de la traduió més probable, aquesta irumstània s'observa en que la baixa puntuaió atorgada p el mo del de llenguatge a les traduions més llargues i l'alta puntuaió onferida a les traduions més urtes p ot alterar aquesta deisió (veure Equaió (2.5)). Per orregir aquest omportament no desitjat del sistema p o dem onsiderar dues op ions: b é emprar un mo del de llenguatge més omplex (no neessàriament basat en n -grames) que reduïsa o elimine p er omplet la deiènia que presenta el mo del atual, o b é inloure al mo del log-lineal un fator o araterístia que ompense l'efete negatiu del mo del de llenguatge. El sistema Moses implementa la segon op ió, amb la inlusió al mo del log-lineal d'un fator ω anomenat penalitzaió per paraula 3 , el qual b onia les traduions generades de ma jor longitud p er ontrarestar la sobrevaloraió de les traduions de menor longitud. Penalitzaió p er seqüènies de paraules De la mateixa forma que resulta interessant ontrolar la longitud en paraules de la frase senera, també hi és b eneiós afavorir onstruió d'hip òtesis a partir de seqüènies de paraules de ma jor o menor longitud, mitjançant la inlusió d'un fator ρ anomenat penalitzaió per seqüènies de paraules 4 . Açò ve motivat p erquè totes les p ossibles segmentaions de la frase origen són equiprobables, sent la resta de fators (models de traduió, reordenament, llenguatge) els qui determinen, de forma indireta, la millor segmentaió p ossible. Més onretament, la inlusió d'aquest fator ve motivada p erquè l'ús de seqüèn- ies de paraules molt llargues per generar la frase d'eixida provoa, en molts asos, que les seqüènies de paraules emprades per ompletar la traduió siguen de p o a longitud (p ossiblement paraules aïllades) i p er tant de mala qualitat, generant nalment una traduió dolenta, p erò que, no obstant, p ot tenir assignada una probabilitat alta, degut a que les seqüènies de paraules molt llargues solen tenir assoiades probabilitats de traduió molt altes (inlús la màxima probabilitat, 1). Llavors, aquestes traduions es p o den p erlar om serioses andidates a erigir-se om les traduions més probables, fet que no és desitjable. En aquest sentit, la nalitat que es p ersegueix amb la inlusió d'aquest fator és afavorir aquelles segmentaions de la frase d'entrada que originen un ma jor nombre de seqüènies de paraules, i en onseqüènia, que generen seqüènies de paraules de longitud mo derada. Així, p er ada seqüènia de paraules emprada p er onstruir la frase d'eixida, s'afegeix un fator de b oniaió ρ a la puntuaió o probabilitat 3 Word penalty , en anglés. 4 Phrase penalty , en anglès. JASC-DSIC-UPV 41 memoria  2010/11/17  19:32  page 42  #52 i i Capítol 2. Traduió automàtia estadístia basada en seqüènies de paraules Figura 2.1: Exemples dels tres tipus d'orientaions que p o den donar-se llo  a un mo del de reordenament lexialitzat. asso iada a la traduió. D'aquesta forma, s'atenua l'efete negatiu del model de traduió, que sobrevalora traduions possiblement inorretes generades a partir de l'apliaió de seqüènies de paraules molt llargues (opions de traduió de gran longitud). Mo del de reordenament lexialitzat A la Seió 1.3.2 hem presentat un model de distorsió d(| inii k−  k−1−1|) molt senzill que tant sols es troba ondiionat p er la distània del moviment realitzat p er ada seqüènia de paraules de la frase destí al ser reubiat, i p osteriorment hem disutit sobre la onveniènia de ondiionar el mo del a seqüènies de paraules onretes, ja que p o den haver-hi ertes seqüènies més suseptibles a ser reordenades, om havem vist que passa, p er exemple, amb els sintagmes nominals formats p er nom i adjetiu en llenguatges om el atalà o l'espanyol, on amb dues ategories gramatials interanvien les seves posiions al traduir a l'anglès. Aquest és el motiu p el qual Moses inlou un mo del de reordenament addiional que p ermet ap ortar aquest tipus d'informaió, rep el nom de model de reordenament lexialitzat 5 . En termes generals, aquest nou mo del ontempla tres tipus diferents de reordenament d'una seqüènia de paraules resp ete a la seqüènia anterior: monòton (m), interanvi (s) i disontinu (d) 6 , el signiat dels quals es p ot entendre de forma intuïtiva a la Figura 2.1. Més formalment, presentem una distribuió de probabilitat que prediu el tipus d'orientaió més probable que seguirà un parell de seqüènies de paraules f, e : 5 Lexialized reordering model , en anglès. 6 En anglès: monotone (m), swith (s), i disontinous (d). 42 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 43  #53 i i 2.1. El sistema de TA Moses orientaió ∈ {m, s, d} p( orientaió |f, e) (2.7) Aquest mo del s'estima, a partir de les seqüènies de paraules extretes heurístiament del orpus d'entrenament (veure Seió 1.3.2), de la següent forma: en primer llo s'ha de determinar el tipus d'orientaió que segueix ada parell de seqüènies de paraules, p er a p osteriorment obtindre estadístiques que revelen amb quina freqüènia un parell de seqüènies de paraules onret ha seguit un determinat tipus de reordenament, és a dir: p( orientaió |f, e) = N( orientaió , f, e) PoN(o, f, e) (2.8) on N(o, f, e) és el nombre de vegades que s'ha vist al orpus el parell de seqüènies de paraules (f, e) seguint una orientaió o resp ete al parell de seqüènies anterior. En la pràtia, p er evitar la sobreestimaió del mo del, es suavitza el nombre d'o urrènies dels diferents esdeveniments amb la probabilitat a priori de l'orientaió, estimada de forma similar a la probabilitat ondiionada, omptant esdeveniments i normalitzant: p( orientaió ) = PfPeN( orientaió , f, e) PoPfPeN(o, f, e) (2.9) i p er tant, l'estimaió suavitzada del model de l'Equaió, (2.8) amb un valor apropiat del fator σ , es realitza d'aquesta forma: p( orientaió |f, e) = σ p( orientaió ) + N( orientaió , f, e) σ+PoN(o, f, e) (2.10) Existeixen moltes variants d'aquest mo del de reordenament: p er exemple, p o dem onsiderar el tipus de reordenament existent no sols resp ete a la seqüènia de paraules anterior, sinó tamb é resp ete a la seqüènia de paraules p osterior. Per obtindre informaió més detallada sobre aquestes variants i ampliar allò exp osat a aquesta seió, remetem al letor a [Ko e10℄. 2.1.3 El mo del logarítmi-lineal de Moses Com hem vist, a la Seió 2.1.1 s'han intro duït els models log-lineals, instaniant-los p er al as de la TA. Posteriorment, a la Seió 2.1.2 s'han exp osat les araterístiques que formen part del mo del log-lineal de Moses , p erò de forma aïllada. Resta p er tant integrar aquestes araterístiques en el model log-lineal de Moses, que sumen un total de 14, sis de les quals p ertanyen al model de reordenament lexialitzat. • Asso iades al mo del de traduió: JASC-DSIC-UPV 43 memoria  2010/11/17  19:32  page 44  #54 i i Capítol 2. Traduió automàtia estadístia basada en seqüènies de paraules  Mo del de traduió de seqüènies de paraules direte i invers: p(ek|fk) i p(fk|ek) .  Mo del de suavitzat lèxi direte i invers: lex (ek|fk) i lex (fk|ek) .  Penalitzaió p er seqüènies de paraules ρ . • Penalitzaió p er paraula ω . • Mo del de distorsió uniforme d(| inii k−  k−1−1|) . • Asso iades al mo del de reordenament (onguraió msd-bidiretional-fe ):  Mo dels d'orientaió ( m,s,d ) resp ete al parell de seqüènies de paraules anterior: p(m, p |fk, ek) , p(s, p |fk, ek) , i p(d, p |fk, ek)  Mo dels d'orientaió ( m,s,d ) resp ete al parell de seqüènies de paraules p osterior: p(m, n |fk, ek) , p(s, n |fk, ek) , i p(d, n |fk, ek) • Mo del de llenguatge p(e) . 2.1.4 Entrenament del mo del En la present seió desriurem el pro és d'entrenament d'un sistema Moses , dividit en 8 etapes. En primer llo al resoldre la dep endènia dels mo dels de Moses amb l'alineament entre paraules de les frases d'entrenament (passos 1, 2 i 3) mitjançant el programari GIZA++ que és una implementaió lliure dels models d'IBM. Una vegada estimats els alineaments, el sistema pot obtindre els mo dels de traduió lèxia (pas 4), de traduió de seqüènies de paraules (passos 5 i 6), i el mo del de reordenament (pas 7). Per últim, es genera un txer que arreplega la onguraió del sistema. 1. Preparar dades p er al GIZA++ to olkit : Es pro essa el orpus paral · lel d'entrenament p er a p o der ser utilitzat amb el programari GIZA++ . 2. Exeutar GIZA++ : Obté els alineaments més probables entre les paraules de ada parell de frases del orpus d'entrenament en ambdues direions de traduió d'aord amb els mo dels d'IBM (veure Seió 1.3.1). 3. Obtindre alineaments bidireionals : S'aplia un mèto de heurísti p er ombinar els alineaments d'amb dós direions de traduió, obtenint els alineaments nals neessaris p er a la extraió de seqüènies de paraules a partir del orpus. 4. Generar taula de traduió lèxia : S'estimen, a partir dels alineaments de paraules obtinguts als pas 3, els mo dels de traduió lèxia lex(f|e) i lex(e|f) (veure Seió 2.1.2). 5. Extraure seqüènies de paraules : S'obtenen tots els parells de seqüènies de paraules onsistents amb els alineaments de paraules (veure Seió 1.3.2) obtinguts al nal del pas 3, els quals es desen a un txer omprimit anomenat 44 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 45  #55 i i 2.1. El sistema de TA Moses extrat.gz . Aquest txer presenta, línia a línia, tots els parells de seqüènies de paraules extrets del orpus d'entrenament. Les línies d'aquest txer tenen un asp ete similar a aquest: resumption ||| reanudaión ||| 0-0 resumption of the ||| reanudaión del ||| 0-0 1-1 2-1 resumption of the session ||| reanudaión del p erío do de sesiones ||| 1-1 2-1 3-2 3-4 of the ||| del ||| 0-0 1-0 of the session ||| del p erío do de sesiones ||| 0-0 1-0 2-1 2-3 session ||| p erío do de sesiones ||| 0-0 0-2 Les seqüènies de paraules apareixen delimitades p el símbol |||, de forma que la primera seqüènia de paraules representa a la seqüènia en el llenguatge origen f , mentre que la segona seqüènia de paraules representa a la seqüènia en el llenguatge destí e . Per últim, l'últim amp delimitat p er ||| mostra els alineaments existents entre les paraules que onformen amb dues seqüènies. 6. Generar taula de seqüènies de paraules : A partir del txer extrat.gz es genera la taula de seqüènies de paraules 7 , que és la implementaió físia de les araterístiques del mo del log-lineal asso iades al mo del de traduió de Moses (veure Seió 2.1.3). En aquesta taula apareixen tots els parells de seqüènies de paraules observats al txer extrat.gz sense rep etiions, aompanyats de les probabilitats asso iades a les araterístiques del mo del de traduió, per al as partiular del parell de seqüènies de paraules onsiderat. Les línies d'aquesta taula presenten un asp ete om aquest: a gradual resumption of ||| una reanudaión paulatina de ||| 1 0.0407673 1 0.011889 2.718 a gradual resumption ||| una reanudaión paulatina ||| 1 0.123856 1 0.0183073 2.718 a legal presumption of ||| una presunión judiial de ||| 1 0.0173598 1 0.00322516 2.718 a legal presumption ||| una presunión judiial ||| 1 0.0527413 1 0.00496625 2.718 a presumption against ||| una presunión en ontra de ||| 1 0.0811048 0.5 0.00329944 2.718 a presumption against ||| una presunión en ontra ||| 1 0.0811048 0.5 0.0152981 2.718 Po dem observar tres amps delimitats pel separador |||. En primer llo , trob em la seqüènia de paraules en el llenguatge origen f , en segon llo , la seqüènia de paraules en el llenguatge destí e , i en terer i darrer llo , les probabilitats, separades p er espais en blan, de les araterístiques assoiades al model de traduió. En l'exemple trob em, d'esquerra a dreta, p(f|e) , lex(f|e) , p(e|f) , lex(e|f) i ρ , que en el nostre as sempre és exp(1) = 2.718 . 7. Construir mo del de reordenament : Es genera un txer omprimit que onté la informaió relaionada amb el mo del de reordenament estimat d'aord amb la onguraió elegida (veure Seió 2.1.2). En el nostre as emprarem la onguraió p er defete ( msd-bidiretional-fe ). 7 Phrase Table , en anglès. JASC-DSIC-UPV 45 memoria  2010/11/17  19:32  page 46  #56 i i Capítol 2. Traduió automàtia estadístia basada en seqüènies de paraules 8. Crear arxiu de onguraió : Per nalitzar el pro és d'entrenament del sistema, es rea un txer de onguraió que arreplega tota la informaió neessària p er fer funionar el sistema: p esos asso iats a les araterístiques del mo del log-lineal, rutes on es trob en la taula de seqüènies de paraules, el mo del de reordenament, et. D'aquest pro és al tenir en ompte dos asp etes imp ortants: en primer llo , els p esos assignats a les araterístiques del mo del log-lineal després d'entrenar el mo del prenen uns valors predenits (típiament 0.1 ó 0.2 p er a la ma joria de araterístiques), els quals s'han d'a justar p er balanejar les ap ortaions de adasuna d'aquestes araterístiques al model global, en termes de millorar les prestaions - nals del sistema, tot d'aord amb les araterístiques del orpus (aquest pro ediment és expliat breument a la Seió 2.1.7). En segon llo , al onstruir un mo del de llenguatge amb alguna ferramenta externa, om p er exemple la ferramenta SRILM [Sto02℄, la qual p ermet onstruir un mo del d' n -grames a partir de la part monolingüe del orpus paral · lel emprat p er entrenar el sistema, si b é p o dria emprar-se un orpus monolingüe indep endent. 2.1.5 Pro és de traduió La tasa de traduió o deso diaió és el pro és en el que el sistema genera un gran nombre de p ossibles traduions de la frase d'entrada, elegint aquella que maximitza la probabilitat o puntuaió onferida p el mo del log-lineal: ˆe= argmax e"K X k=1 N X i=1 λihi(f, e, fk, ek)# (2.11) instaniat amb les araterístiques exp osades a la Seió 2.1.3. No obstant, aquesta tasa és molt omplexa, tant que existeix un nombre exponenial de p ossibles traduions resp ete a la longitud de la frase d'entrada. De fet s'ha demostrat que el problema de la era de la traduió més probable és NP-Complet [Kni99a℄, amb la qual osa, l'exploraió de tot l'espai de era en busa de la traduió més probable és una tasa tant ostosa om imp ossible. El pro és de traduió onsisteix en segmentar de totes les formes p ossibles la frase d'entrada, p er a p osteriorment traduir de diferents formes ada seqüènia de paraules denida per la segmentaió de la frase d'entrada, i p er últim es genera la frase d'eixida de forma monòtona (d'esquerra a dreta i de forma inremental), reordenant de tota forma p ossible les seqüènies de paraules traduïdes (un as onret de traduió l'havem vist a la Figura 1.8). Com veiem, existeix un gran nombre d'alternatives (segmentaió, traduió i reordenament) a onsiderar, o el que és el mateix, un gran espai de era, fet que demostra larament la omplexitat de trobar la traduió més probable. L'espai de era és denit p er estats o hip òtesis que, entre altres oses, determinen el nombre de paraules de la frase origen que han estat obertes (traduïdes) i l'última 46 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 47  #57 i i 2.1. El sistema de TA Moses seqüènia de paraules de la frase destí generada. Durant el proés de era aquestes hip òtesis són expandides amb l'ús de noves op ions de traduió (traduió de seqüènies de paraules de la frase d'entrada que englob en paraules no ob ertes) per donar llo a noves hip òtesis que abasten (tradueixen) paraules de la frase origen no ob ertes anteriorment. Una hip òtesi que obreix totes les paraules de la frase origen és un estat soluió, i la traduió asso iada a tal estat s'obté reorrent el amí que parteix des de la hip òtesi iniial (ap paraula ob erta) ns la hip òtesi soluió. El pro és de era de la traduió més probable es realitza mitjançant un algorisme de era heurísti A*. Els algorismes heurístis utilitzen una funió de puntuaió f(n) , que serveix per valorar el prometedor que és un estat o hip òtesi n , i que es deneix om el ost per arribar des de l'estat iniial ns l'estat n , denotat p er g(n) , més una estimaió heurístia del ost restant p er trobar la soluió (traduió) òptima, denotada p er h(n) . És a dir, de forma matemàtia: f(n) = g(n) + h(n) . Cal notar que, en aquest ontext, a menor ost, ma jor probabilitat asso iada a la p ossible traduió, i vieversa. L'algorisme heurísti emprat al sistema Moses presenta les següents araterístiques: • No Complet : L'algorisme no pot garantir trobar la traduió d'una frase d'entrada enara que el mo del siga apaç de proveir-la, ja que durant el pro és de era s'apliquen tèniques de p o da (expliades a ontinuaió) que p o den eliminar els estats que ondueixen a alguna soluió fatible (traduió ompleta). • Admissible : La funió d'estimaió del ost restant p er arribar a la traduió òptima no sobreestima el ost restant real per arribar a la mateixa, de forma que es ompleix que: F(n)≥g(n) + h(n)∀n F(n) = g(n) + h(n)n∈S on F(n) representa el ost real d'arribar a l'estat o hip òtesi n , i S representa al onjunt traduions ompletes (estats soluió) de la frase d'entrada. • Estratègia de era p er amplària : S'expandeixen totes les hip òtesis de nivell i abans d'expandir hip òtesis de nivell i+1 . El nivell i -èsim engloba totes aquelles hip òtesis generades després d'apliar i op ions de traduió. Per tal d'aotar l'espai de era i, en onseqüènia, reduir la omplexitat omputaional del pro és de traduió, s'empren les següents tèniques: • Reombinaió d'hip òtesis : Les hip òtesis semblants, que són aquelles obreixen les mateixes paraules de la frase d'entrada, són reombinades, onservant úniament aquella que presenta menor funió de ost g(n) . JASC-DSIC-UPV 47 memoria  2010/11/17  19:32  page 54  #64 i i Capítol 2. Traduió automàtia estadístia basada en seqüènies de paraules mt (o |ek| ), ja que és redundant si es oneix y(t) (o ek ). Aquesta variant del mo del és la que al Capítol 3 presentarem om el mo del de longitud esp eialitzat. De la mateixa forma que al mo del de longitud estàndard, p o dem obtindre una variant del mo del esp eialitzat onsiderant que la probabilitat de la segmentaió de la frase origen p(f|e, J) és uniforme, de forma que el mo del quedaria reesrit de la següent forma: p(f|e, J) := Y k p(|fk|/ ek)p(fk|ek) (2.28) En denitiva, tant l'Equaió (2.23) om l'Equaió (2.27) ens mostren om modelar la longitud dels segments juntament amb un mo del de traduió invers de seqüènies de paraules. Al Capítol 3 veurem om implementar i integrar aquests mo dels al sistema Moses . 54 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 55  #65 i i Capítol 3 Models de Longitud En el apítol anterior hem presentat els sistemes log-lineals, els quals ens brinden la p ossibilitat d'afegir fonts d'informaió addiionals al proés de traduió. En aquest ontext, a la Seió 2.2 hem disutit la p ossibilitat d'inloure informaió sobre la longitud de les seqüènies de paraules al mo del, donades les b ones p ersp etives que es desprenen del treball menionat. Aquesta p ossibilitat es onverteix en realitat en aquest Capítol, on prop osarem la inlusió del mo delat de les longituds de les seqüènies de paraules al mo del de traduió de Moses . 3.1 Mo del de longitud estàndard El primer dels dos mo dels de longitud que hem onsiderat a aquest treball és aquell que mo dela les relaions existents entre les longituds de les seqüènies de paraules d'entrada i d'eixida a partir d'un orpus d'entrenament. D'aord amb l'Equaió (2.23), el mo del de traduió invers p(f|e) ve donat p er tres termes (que en realitat p o dríem onsiderar-ne úniament dos, donat que p(|e|)p(|f|/|e|) = p(|f|,|e|) ): • Un mo del de traduió de seqüènies de paraules p(f|e) (veure Seió 1.3.2). • Un mo del de longitud inondiional p(|e|) , que representa la probabilitat de trobar una seqüènia de paraules del llenguatge destí de longitud |e| . Aquest mo del és apaç de resp ondre a preguntes om la següent: quina és la probabilitat d'observar una seqüènia de 5 paraules de longitud en anglès? • Un mo del de longitud ondiional p(|f|/|e|) , que representa la probabilitat de traduir una seqüènia de paraules del llenguatge destí de longitud |e| en una seqüènia de paraules del llenguatge origen de longitud |f| . Aquest mo del p o dria resp ondre, p er exemple, la següent pregunta: quina és la probabilitat de traduir una seqüènia (qualsevol) de 6 paraules de longitud en anglès, en una seqüènia (qualsevol) de 4 paraules de longitud en atalà? 55 memoria  2010/11/17  19:32  page 56  #66 i i Capítol 3. Mo dels de Longitud Cal notar que, si invertim la direió de la traduió, obtindrem mo dels de longitud anàlegs: p(|f|) i p(|e|/|f|) , en addiió al mo del de traduió de seqüènies de paraules invers p(e|f) . 3.1.1 Estimaió del mo del i implementaió El mo del de traduió de seqüènies de paraules s'estima onforme a l'esmentat a la Seió 1.3.2, mentre que que els mo dels relaionats amb la longitud s'estimen p er màxima versemblança resp ete a un onjunt de seqüènies de paraules (f, e) extretes d'un orpus d'entrenament de parells de frases {(fn, en)∈C:n= 1,...N} . D'una banda, el model de longitud inondiional s'estima de la següent forma: p(|e|) = N(|e|) N (3.1) on N(|e|) és el nombre de vegades que s'han observat seqüènies de paraules de longitud |e| en el llenguatge d'eixida, i N és el nombre total de seqüènies de paraules observades. No obstant, p er evitar una sobreestimaió del mo del es realitza un suavitzat mitjançant la interp olaió lineal entre el mo del de longitud i la distribuió uniforme de la longitud, amb un valor adequat d' ǫ : pǫ(|e|) = (1 −ǫ)N(|e|) N+ǫ1 L (3.2) on L és la longitud màxima que p o den assolir les seqüènies de paraules (reordar que la longitud està aotada per termes d'eiènia, veure Seió 1.3.2). L'estimaió de p(|f|) es realitza de forma similar. D'altra banda, l'estimaió del mo del de longitud ondiional s'efetua om segueix: p(|f|/|e|) = N(|f|,|e|) N(|e|) (3.3) on N(|f|,|e|) és el nombre de vegades que s'han observat de forma onjunta seqüènies de paraules de longitud |e| en el llenguatge d'eixida i seqüènies de paraules de longitud |f| en el llenguatge d'entrada. L'estimaió de p(|e|/|f|) tamb é es realitza de forma similar. De nou, aquesta distribuió de probabilitat és suavitzada p er evitar la seva sobreestimaió: pǫ(|f|/|e|) = (1 −ǫ)N(|f|,|e|) N(|e|)+ǫ1 L (3.4) Fins al moment hem vist om estimar aquests models, p erò no d'on extraure la informaió neessària p er estimar-los. El pro és desrit no és més que una simpliaió del 56 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 57  #67 i i 3.1. Mo del de longitud estàndard pro és d'estimaió dels mo dels de longitud, dons resulta omplex estimar-lo diretament p er màxima versemblança a partir del orpus d'entrenament (s'hauria d'apliar un entrenament basat en l'algorisme Expetation-Maximization [DLR77℄, ja que no disp osem de les segmentaions de les frases). En el ontext de Moses , trob em dues maneres d'obtindre seqüènies de paraules a partir del orpus d'entrenament: d'una banda, a partir de les seqüènies de paraules extretes de forma onsistent respete a un heurísti d'alineaments de paraules (veure Seió 1.3.2), i d'altra banda, a partir de les segmentaions de Viterbi proveïdes p el sistema en un pro és de traduió restringit (dirigit) a obtindre la traduió orreta. Amb dues alternatives es basen en l'ús de tèniques heurístiques, tal i om hem vist a les Seions 1.3.2 i 2.1.5 resp etivament, amb la qual osa l'estimaió dels models no serà estritament orreta. Anem a detallar adasuna de les vies prop osades. Estimaió a partir de seqüènies de paraules extretes en la fase d'entrenament Com ja sab em, el sistema Moses , en llo  d'obtindre les seqüènies de paraules a partir de les segmentaions més probables estimades p er màxima versemblança a partir del orpus d'entrenament, aplia un algorisme que extrau, p er a ada parell de frases del orpus, totes les seqüènies de paraules onsistents amb un heurísti dels alineaments entre paraules estimats prèviament mitjançant una implementaió dels mo dels d'IBM. Això es tradueix en que, p er ada parell de frases del orpus, existeixen moltes segmentaions p ossibles que donen llo a múltiples parells de seqüènies de paraules, la ma joria de les quals no tenen p er què expliar la forma més idònia de traduir la frase origen en la frase destí, p erò tot i això, formen part dels paràmetres del mo del de traduió de seqüènies de paraules, i p er extensió, multipliquen el nombre d'esdeveniments a observar en la estimaió del mo del de longitud. A p esar de la inorreió que presenta aquesta tènia des d'un punt de vista teòri, la primera de les dues fonts d'informaió que onsiderarem p er estimar els nostres mo dels és aquest onjunt de seqüènies de paraules extretes de forma heurístia. Com hem vist a la Seió 2.1.4, els parells de seqüènies de paraules extretes amb aquest heurísti es desen, línia p er línia, al txer extrat.gz . Cal dons pro essar ada línia d'aquest txer, alular la longitud de les seqüènies de paraules i inrementar els omptes dels esdeveniments observats. Una vegada s'ha pro essat tot el txer, es normalitzen els omptes i es suavitzen les distribuions de probabilitat resultants onforme a les Equaions (3.2) i (3.4). Estimaió a partir de les segmentaions de Viterbi Com ja s'ha esmentat adés, la forma més natural i estadístiament orreta d'estimar els mo dels que aí prop osem és l'entrenament p er màxima versemblança a partir del orpus d'entrenament de parells de frases. Mitjançant aquest mèto de onsiderem que el nostre model és un mo del paramètri, els paràmetres del qual són denotats per θ i estimats a partir de les dades del orpus apliant una funió de versemblança L , que en el nostre as es deneix així: JASC-DSIC-UPV 57 memoria  2010/11/17  19:32  page 58  #68 i i Capítol 3. Mo dels de Longitud L(θ) = N Y n=1 pθ(fn|en, Jn) (3.5) on pθ és el mo del de traduió paramètri i N és el nombre de mostres del orpus. Ja que el nostre riteri és maximitzar la versemblança resp ete el orpus d'entrenament, neessitem trobar els paràmetres òptims ˆ θ que maximitzen aquest riteri: ˆ θ= argmax θ L(θ) (3.6) En aquesta literatura és habitual emprar la funió log-versemblança, atès que la funió log és monòtona reixent i no afeta al òmput de la funió argmax . Aleshores, tenim que: ˆ θ= argmax θ (log L(θ)) = argmax θ N X n=1 log pθ(fn|en, Jn)! (3.7) Ara b é, en realitat el nostre mo del de traduió paramètri pθ(f|e, J) és inomplet: no explia la forma de segmentar les frases d'eixida i d'entrada, om tamp o  la forma de reordenar els segments de la frase d'eixida p er generar, de forma monòtona, la frase d'entrada (reordem que estem mo delant el mo del de traduió invers). Per tant, el mo del requereix tres variables addiionals: l i m , que denoten resp etivament la segmentaió de les frases f i e en seqüènies de paraules, i r , que representa un reordenament de les seqüènies de paraules de la frase d'eixida e expliades p er m . Aquestes variables són o ultes al nostre mo del, dons el orpus d'entrenament no es troba etiquetat amb tal informaió, i p er tant neessitem estimar aquesta informaió p er p o der p osteriorment estimar el mo del. Llavors, si destap em les variables o ultes del mo del de traduió, tenim que: ˆ θ= argmax θ N X n=1 log X lX mX r pθ(fn, l, m, r |en, Jn)!! (3.8) Així, no és p ossible estimar el mo del apliant una maximitzaió del riteri de la logversemblança, dons no tenim informaió sobre les variables o ultes l , m i r . Hauríem de reórrer a l'apliaió d'un entrenament Expetation-Maximization [DLR77℄, ja que sols aquesta tènia ens p ermet estimar el nostre mo del amb variables o ultes p er màxima versemblança. No obstant, aquest tipus d'estimaió és molt ostosa, així que optarem p er realitzar una aproximaió heurístia d'aquest pro és. La idea és que la traduió més probable d'una frase, d'aord amb el mo del log-lineal de Moses , és aquella que explia la forma més òptima de segmentar i reordenar la frase d'eixida p er generar de forma monòtona les seqüènies de paraules que onformen la frase d'entrada. En altres paraules, la traduió més probable f d'una frase d'eixida e prop oriona una aproximaió heurístia dels valors òptims de les variables o ultes del nostre mo del: 58 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 59  #69 i i 3.1. Mo del de longitud estàndard ˆ l, ˆm, ˆr= argmax l,m,r p(f, l, m, r |e, J) (3.9) Les segmentaions denides p er ˆ l i ˆm són aquelles que expliquen la generaió de la traduió més probable segons el mo del log-lineal de Moses , i reb en el nom de segmentaions de Viterbi. Per tant, p o dem aonseguir extraure parells de seqüènies de paraules del orpus d'entrenament d'una forma més preisa emprant el deso di- ador de Moses : al prop orionar-li tant el onjunt de frases d'entrenament p er a ser traduïdes om les seves respetives referènies, orientant el pro és de deso diaió a la produió de les referènies prop orionades. La generaió p er part del deso di- ador de la traduió de referènia (la millor traduió p ossible) p ermet obtindre les segmentaions de les frases d'eixida i d'entrada i les relaions o asso iaions entre les seqüènies de paraules resultants, que és preisament una aproximaió a la informaió que prop orionen les variables o ultes del mo del l , m i r , resp etivament. Cal reordar que el proés de traduió es basa en una tènia de era heurístia que trata de trobar més probable segons el mo del log-lineal (veure Seió 2.1.5). Aleshores, p er p o der realitzar aquest pro és es requereix un sistema base Moses entrenat i optimitzat. En primer llo , al entrenar el sistema amb un onjunt d'entrenament (veure Seió 2.1.4). Posteriorment, és aonsellable a justar els p esos de les araterístiques del mo del log-lineal amb un onjunt de validaió (veure Seió 2.1.7), deixant així el sistema enllestit p er ab ordar el següent pas, que és traduir el onjunt d'entrenament, obligant al deso diador a obtindre les traduions de referènia, de forma que el sistema prop orionarà les segmentaions de les frases d'entrada i d'eixida que millor expliquen el pro és de traduió d'aord amb els paràmetres del mo del. Llavors, a partir d'aquesta informaió es p o den estimar els mo dels de longitud onforme a les Equaions (3.2) i (3.4). Un exemple d'eixida proveïda p el deso diador, al traduir de l'anglès a l'espanyol el orpus Europarl-v3 (veure Seió 4.1), és la següent: aprobaión |0-0| del |1-2| ata |3-3| Aquesta eixida india, p er exemple, que la seqüènia de paraules del es troba alineada amb la seqüènia de paraules determinada p el rang de posiions de paraules en la frase origen 1-2 (les paraules en les p osiions 1 i 2), que onsultant la referènia és of the . En realitat no ens preoupa sab er quina és la seqüènia de paraules rela- ionada amb la seqüènia origen, sinó la seva longitud, que en el as de l'exemple es p ot alular de forma trivial: (2 −1) + 1 = 2 . Hem implementat un programa que p ermet pro essar aquesta eixida de forma adient p er obtindre la informaió neessària p er estimar els mo dels d'una forma similar a la realitzada a partir del txer extrat.gz . Cal destaar un asp ete imp ortant relaionat amb el pro és de traduió guiat p er les referènies: el sistema no sempre serà apaç de generar om a traduió més probable la referènia proporionada, i en aquests asos, el deso diador no mostrarà JASC-DSIC-UPV 59 memoria  2010/11/17  19:32  page 60  #70 i i Capítol 3. Mo dels de Longitud el parlamento ha intervenido y , muy apropiadamente parliament has stepped in and , correctly , pointed , así lo ha puesto de relieve . this out . Figura 3.1: Exemple d'alineament entre paraules d'un parell de frases, extret del orpus Europarl-v3 p er al parell de llenguatges anglès - espanyol (veure Seió 4.1). Aquest alineament requereix, en el pro és de traduió, l'extraió d'una seqüènia d'11 paraules de longitud om a mínim (denotada per la franja grisa), segons l'algorisme d'extraió de seqüènies de paraules de Moses . ap eixida: simplement ignorarà la frase pro essada. Això p ot o órrer prinipalment p er dos motius: b é p el problema derivat de la inompletitud de l'algorisme heurísti de era de la traduió més probable (generalment motivat p el límit de distorsió en la era, veure Seió 2.1.5), o b é degut a que p o den haver-hi seqüènies de paraules que no es p o den extraure de forma onsistent de ap de les maneres resp ete a l'alineament entre paraules prop orionat, generalment a ausa de que la longitud màxima a la que estan limitades les seqüènies de paraules imp edeix abastar una seqüènia de paraules de suient longitud que resp ete la propietat de onsistènia amb els alineaments. És p er això que aquest efete negatiu és inversament prop orional a la longitud màxima de les seqüènies de paraules: a menor longitud màxima, ma jor és el nombre de frases que no es p o den traduir forçadament en les seves referènies, i vieversa. A la gura 3.1 p o dem observar un exemple d'alineament 1 entre paraules d'un parell de frases extret del orpus Europarl-v3 p er al parell de llenguatges anglès - espanyol (veure Seió 4.1). Si ens xem, aquest alineament no p ermetria obtindre una segmentaió vàlida d'amb dós frases si onsiderarem seqüènies de paraules amb una longitud màxima limitada, p er exemple, a 7 paraules, dons es requereix l'extraió d'un parell de seqüènies de paraules (denotat per la franja grisa) format p er una seqüènia en espanyol d'almenys 11 paraules de longitud i una seqüènia en anglès d'almenys 8 paraules de longitud. Llavors, en aquest as el deso diador de Moses 1 Cal reordar que aquests alineaments són estadístis, és dir, no s'estableixen a partir de oneixements lingüístis. 60 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 61  #71 i i 3.1. Mo del de longitud estàndard no seria apaç d'obtindre la traduió de referènia si el mo del s'entrena limitant la longitud màxima de les seqüènies de paraules a menys d'11 paraules. En denitiva, aquesta forma d'obtindre la informaió neessària per estimar els mo dels presenta un gran avantatge i un gran inonvenient. D'una banda, onsiderar sols les seqüènies de paraules que millor expliquen les traduions orretes (referènies), o en altres paraules, les segmentaions més probables, implia augmentar la preisió del mo del de longitud. Però d'altra banda, el fet que el deso diador no puga, en ertes o asions, obtindre om a traduió més probable la referènia prop or- ionada, a part que és un mostra de la deiènia del model de traduió de Moses (veure Seió 1.2.4), això provo a que el nombre d'events disp onibles p er estimar els mo dels disminuïsa rítiament, amb la qual osa el sistema serà menys onable i robust. No obstant, en el as del mo del de longitud estàndard, al onsiderar úniament esdeveniments de tipus longitud de seqüènies de paraules, l'impate negatiu no és tant signiatiu om en el as del mo del de longitud esp eialitzat, om omprovarem més endavant. 3.1.2 Integraió en Moses La inlusió d'aquests mo dels al sistema es realitza mo diant el mo del log-lineal de Moses (veure Seió 2.1.3). Es onsideren tres variants del sistema original: • Moses-LConjunta : Substitueix les araterístiques de traduió de seqüènies de paraules direta i inversa p els mo dels de traduió direte i invers prop osats a l'Equaió (2.23). • Moses-LCondiional : Aquest sistema és similar a l'anterior, p erò implementa la variant del model de longitud estàndard presentada a l'Equaió (2.25) (no es mo dela la probabilitat de longitud inondiional). Aquest nou sistema permetrà onferir ma jor expressivitat al model de longitud ondiional, de forma que, si la informaió que ap orta és realment útil, aleshores ma jor efete benigne tindrà sobre el pro és de traduió, dons onsiderar el mo del onjunt implia que els mo dels de traduió de seqüènies de paraules direte i invers ap orten la mateixa funió de probabilitat de longitud: p(|e|)p(|f|/|e|) = p(|f|)p(|e|/|f|) = p(|f|,|e|) . • Moses + LCondiional : Aquest sistema inlou les araterístiques del sistema base Moses sense mo diar, més dues araterístiques addiionals: les probabilitats ondiionades de les longituds en amb dues direions de la traduió, és a dir, els mo dels p(|f|/|e|) i p(|e|/|f|) . Aquest sistema ens p ermetrà avaluar d'una forma més transparent l'aportaió real del model de longitud al pro és de traduió, donat que es trata d'una araterístia (en realitat dues) addiional i indep endent. A més, al destaar que amb aquest sistema ens evitem p ertorbar el mo del de traduió de seqüènies de paraules de Moses . Com ja havem vist a la Seió 2.1.4, les araterístiques que formen part del mo del de traduió de seqüènies de paraules s'integren a la taula de seqüènies de paraules, JASC-DSIC-UPV 61 memoria  2010/11/17  19:32  page 62  #72 i i Capítol 3. Mo dels de Longitud en l'apartat de puntuaions. Hem desenvolupat una ferramenta que proessa íntegrament aquesta taula, de forma que, p er a ada parell de seqüènies de paraules f i e es alulen les seves resp etives longituds | f |i| e | i es mo diquen les probabilitats de les araterístiques en funió del parell de seqüènies de paraules onsiderat i del sistema que s'està onstruint ( Moses-LConjunta, Moses-LCondiional, Moses + LCondiional ). Per exemple, al onstruir el sistema Moses-LCondiional , p er a tot parell de seqüènies de paraules es mo diaran les puntuaions p(f|e) i p(e|f) p er p(|f|/|e|)p(f|e) i p(|e|/|f|)p(e|f) ) resp etivament. Al Capítol 4 s'analitzaran les prestaions d'aquests tres sistemes en omparaió amb el sistema Moses onvenional. 3.2 Mo del de longitud esp eialitzat L'altre model de longitud que proposem a aquest apítol, originat om una variant del primer, és el que anomenem mo del de longitud esp eialitzat. Resp ete al mo del de longitud estàndard, i d'aord amb la deniió formal del mo del esp eialitzat (veure Equaió (2.27)), l'úni terme que anvia és el model de longitud ondiional, que en aquest as és ondiionat a una seqüènia de paraules: aquest mo del l'anomenarem mo del de longitud ondiionat a seqüènies de paraules p(|f|/ e) , que representa la probabilitat de traduir una seqüènia de paraules e onreta del llenguatge destí en una seqüènia de paraules del llenguatge origen de longitud |f| . Aquest mo del p ermet resp ondre a preguntes om aquesta: quina és la probabilitat de traduir la seqüènia de paraules en anglès La meva mare és universitària en una seqüènia (qualsevol) de 2 paraules de longitud en atalà? Es p ot omprovar om la naturalesa d'aquest mo del és la que motiva la nomen- latura del mateix (mo del de longitud esp eialitzat), dons ap orta informaió sobre la longitud dels segments en que es p ot traduir ada seqüènia de paraules onreta. Si invertim la direió de la traduió, obtindrem mo dels de longitud anàlegs: p(|f|) i p(|e|/ f) , en addiió al model de traduió de seqüènies de paraules direte p(e|f) . 3.2.1 Estimaió del mo del i implementaió L'estimaió d'aquests models es realitza, a l'igual que els mo dels de longitud estàndard, p er màxima versemblança resp ete a un onjunt de seqüènies de paraules (f, e) extretes d'un orpus d'entrenament de parells de frases {(fn, en)∈C:n= 1,...N} i onsistents amb uns alineaments entre paraules p er a ada parell de frases. D'una banda, el mo del de longitud inondiional s'estima tal i om s'india a l'Equaió (3.2). D'altra banda, l'estimaió del mo del de longitud ondiionat a seqüènies de paraules es realitza de forma similar al mo del de longitud ondiionat del mo del estàndard: p(|f|/ e) = N(|f|, e) N(e) (3.10) 62 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 63  #73 i i 3.2. Mo del de longitud esp eialitzat vesprada bona Àngel Raül nit Rubén hola Víctor Adrià els meus companys Figura 3.2: Exemple d'una estrutura de dades trie. on N(|f|, e) és el nombre de vegades que s'han observat onjuntament seqüènies de paraules de longitud |f| en el llenguatge d'entrada i la seqüènia de paraules e en el llenguatge d'eixida. Novament suavitzarem aquest mo del p er evitar problemes de sobreestimaió, mitjançant una interpolaió lineal amb el mo del de longitud ondiional estàndard amb un valor d' ǫ adequat: pǫ(|f|/ e) = (1 −ǫ)N(|f|, e) N(e)+ǫN(|f|,|e|) N(|e|) (3.11) Cal notar que l'estimaió de p(|e|/ f) es realitza de forma similar. Ara b é, estimar el mo del ondiional presenta una omplexitat afegida, dons p er a la part dreta del mo del (la ondiió) no onsiderem longituds de segments (valors enters), sinó seqüènies de paraules (adenes de text de longitud variable). L'esp eialitzaió del mo del de longitud implia una ma jor omplexitat de l'algorisme d'estimaió, p erò sobretot, de l'estrutura de dades enarregada d'emmagatzemar, p er a totes les seqüènies de paraules e , els omptadors N(|f|, e) , neessaris p er p o der estimar dit mo del (veure Equaió (3.11)). Per p o der satisfer aquest requeriment de la forma més eient p ossible, s'ha implementat una estrutura de dades anomenada trie , una estrutura en forma d'arbre molt apropiada p er emmagatzemar grans quantitats de dades que presenten la propietat de prex entre elles, om és el as partiular de les seqüènies de paraules (reordar la forma en que s'extrauen, veure Seió 1.3.2). Emprar una estrutura jeràrquia d'aquest tipus en llo  de ap altra estrutura de dades p ermet reduir la omplexitat espaial del model, ja no s'emmagatzemen prexos rep etits, i p er extensió, també redueix la omplexitat temp oral de les op eraions elementals a realitzar sobre l'arbre, ja que existiran menys elements a pro essar. Po dem observar un exemple d'un trie a la Figura 3.2. En una estrutura de dades trie adaptada i implementada onforme a les nostres neessitats, ada no de representa una únia adena de text (una paraula, signe de puntuaió, et.). L'arbre de prexos JASC-DSIC-UPV 63 memoria  2010/11/17  19:32  page 70  #80 i i Capítol 3. Mo dels de Longitud Estimaió a partir de les segmentaions de Viterbi Una altra font d'informaió més preisa p erò menys robusta són les segmentaions de Viterbi proveïdes p el sistema al traduir el onjunt d'entrenament de forma guiada p er les referènies de traduió. L'estimaió es realitza de forma molt similar a la vista en el as del mo del de longitud estàndard, p erò al tenir en ompte una sèrie de onsideraions partiulars de l'estrutura de dades trie . Com ja sab em, el prinipal inonvenient que presenta aquesta font d'informaió és que el nombre d'esdeveniments a observar es redueix de forma onsiderable resp ete a l'altra font d'informaió onsiderada (seqüènies de paraules extretes durant l'entrenament del sistema), fet que p ot provo ar no sols problemes de sobreestimaió dels mo dels (atenuats gràies a l'apliaió de tèniques de suavitzat), sinó tamb é problemes relaionats amb la no observaió de seqüènies de paraules que sí s'han observat en l'entrenament del sistema p er mitjà de l'heurísti d'extraió de seqüènies de paraules, i que per tant formen part dels paràmetres del model de traduió de seqüènies de paraules de Moses (de la mateixa forma que apareixen al txer extrat.gz o a la taula de seqüènies de paraules). Aleshores el problema real el trobarem al tratar d'integrar aquests mo dels al sistema Moses , dons això requereix pro essar la taula de seqüènies de paraules (txer phrase-table.gz ), en la que p o den aparèixer seqüènies de paraules que no s'han observat en la onstruió del mo del de longitud esp eialitzat. Teoria en mà, en aquests asos la probabilitat asso iada al mo del de longitud esp eialitzat deuria ser nul · la, p erò om que això no és ert (realment és degut a una estimaió p o  robusta del mo del), i donat que la distribuió de probabilitat ondiionada és suavitzada amb la probabilitat del mo del de longitud estàndard ondiional (veure Equaió (3.4)), en la pràtia s'assigna íntegrament la informaió ap ortada p el mo del de longitud estàndard ondiional, molt millor estimat. 3.2.2 Integraió A l'igual que en el mo del de longitud estàndard, integrarem el mo del de longitud esp eialitzat al mo del log-lineal de Moses de tres maneres diferents: • Moses-SConjunta : Substitueix els mo dels de traduió de seqüènies de paraules direte i invers p els mo dels de traduió direte i invers prop osats a l'Equaió (2.27). • Moses-SCondiional : A l'igual que en el as del mo del de longitud estàndard, aquest sistema implementa la variant del mo del de longitud esp eialitzat presentada a l'Equaió (2.28). • Moses + SCondiional : Aquest sistema inlou les araterístiques del sistema base Moses sense mo diar, més dues araterístiques addiionals: les probabilitats ondiionades de les longituds en amb dós direions de la traduió, és a dir, els mo dels p(|f|/ e) i p(|e|/ f) . De nou, aquest sistema ens p ermetrà avaluar d'una forma més transparent l'aportaió real del mo del de longitud al pro és de traduió. 70 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 71  #81 i i 3.2. Mo del de longitud esp eialitzat De forma similar al as en el que integràvem el model de longitud estàndard a Moses (veure Seió 3.1.2), hem desenvolupat un programa que pro essa íntegrament la taula de segments, línia p er línia, de forma que, p er a ada parell de seqüènies de paraules ( f , e ), es busa al trie la seqüènia de paraules que ondiiona el mo del ondiional, i llavors es modiquen els valors de les probabilitats de les araterístiques d'aord amb les seqüènies de paraules identiades i el sistema que s'està onstruint ( Moses-SConjunta, Moses-SCondiional, Moses + SCondiional ). Al Capítol 4 també s'analitzaran les prestaions d'aquests tres sistemes en omparaió amb el sistema base de Moses . JASC-DSIC-UPV 71 memoria  2010/11/17  19:32  page 72  #82 i i memoria  2010/11/17  19:32  page 73  #83 i i Capítol 4 Corpora i Experimentaió Al present apítol avaluarem les prestaions dels sistemes prop osats al apítol anterior. En primer llo , presentarem el orpus que s'ha emprat p er dur a terme aquestes proves, i en segon llo , detallarem els exp eriments realitzats amb els sistemes prop osats i els seus resp etius resultats. 4.1 Corp ora Com ja sab em, un sistema de TAE basat en seqüènies de paraules om Moses requereix, en primer llo , un orpus d'entrenament de parells de frases per p o der entrenar els models que s'integren al mo del log-lineal; en segon llo , un onjunt de validaió p er a justar de forma adequada els paràmetres del mo del log-lineal; i en terer i darrer llo , un onjunt de test p er avaluar les prestaions del sistema. Per tal de obrir aquestes neessitats i p o der dur a terme les exp erimentaions que proposem a la Seió 4.2, s'ha emprat el orpus Europarl-v3 [Ko e05℄. Aquest orpus arreplega les transrip ions de les sessions plenàries de l'Europarlament i les seves orresp onents traduions a un total d'11 llenguatges: Anglès, Alemany, Franès, Italià, Holandès, Portuguès, Danès, Sue, Finès, Gre i Espanyol. Per anitat lingüístia s'ha esollit el orpus assoiat al parell de llenguatges Anglès - Espanyol, en la seva versió 3, que arreplega totes les transrip ions i traduions entre aquests dos llenguatges generades en les sessions esdevingudes entre abril de 1996 i o tubre de 2006. A la taula 4.1 po dem observar les estadístiques d'aquest orpus p er als tres onjunts proveïts (entrenament, validaió i test), abans de ser prepro essats 1 : el nombre total de parells de frases, i p er a adasun dels idiomes, la longitud mitjana en paraules de les frases, la grandària del voabulari (nombre de paraules úniques), el nombre total de paraules, i la p erplexitat del onjunt alulada p er a un mo del de llenguatge de 5-grames, entrenat amb el onjunt d'entrenament i suavitzat amb el mèto de de Kneser-Ney mo diat. 1 Cal notar que: M = Mega = 1.000.000 i K = Kilo = 1.000 73 memoria  2010/11/17  19:32  page 74  #84 i i Capítol 4. Corp ora i Exp erimentaió C. Entrenament C. Validaió C. Test Llenguatge An Es An Es An Es Nombre Frases 730740 2000 2000 Longitud Mitjana (paraules) 20.8 21.5 29.3 30.3 30.0 30.2 Tamany Vo abulari 72.7K 113.9K 6.5K 8.2K 6.5K 8.3K Total paraules 15.2M 15.7M 58.7K 60.6K 58.0K 60.3K Perplexitat (5-grames) - - 79.6 78.8 78.3 79.8 Taula 4.1: Estadístiques del orpus Europarl-v3. Aquest orpus requereix un prepro és (veure Seió 1.1.2) p er ser utilitzat amb el sistema Moses , que onsisteix en tres passos: 1. Tokenitzar les frases ( Tokenize ): Converteix la frase en una adena de text equivalent en la que les unitats bàsiques (paraules, signes de puntuaió, et.) apareixen separades mitjançant espais en blan. Cada unitat bàsia s'anomena token . 2. Filtrar frases llargues ( Filter ): S'eliminen del orpus les frases amb un nombre de tokens ma jor o igual a 40. 3. Transformar aràters a minúsules ( Lowerase ): Els aràters en ma jús- ula es transformen en minúsula. Després de prepro essar el orpus, ens trob em en disp osiió d'entrenar els nostres sistemes i provar les seves prestaions. 4.2 Exp erimentaió En la present seió detallarem adasun dels experiments realitzats, destinats a avaluar si les millores proposades del sistema base de Moses es tradueixen efetivament en una millora de les prestaions. En primera instània exp erimentarem amb el sistema base, p er dues raons: en primer llo , p erquè les seves prestaions seran la referèn- ia p er avaluar si els nous sistemes proposats representen una millora signiativa de l'estat d'art de la disiplina; i en segon llo, p erquè a partir del sistema entrenat ens és molt fàil obtindre la informaió neessària p er estimar els mo dels de longitud prop osats (veure Seions 3.1.1 i 3.2.1). Això té un altre avantatge, i és que p o dem estalviar-nos l'entrenament dels nous sistemes proposats, ja que en tots els asos partirem del sistema base entrenat, al qual se li mo diarà la taula de seqüènies de paraules i el txer de onguraió moses.ini (veure Seió 2.1.4). Tots els sistemes s'han avaluat p er a les dues direions de traduió (an-es i es-en), limitant la longitud màxima de les seqüènies de paraules amb valors que osil · len entre 2 i 7. L'avaluaió de resultats es realitza mitjançant la mètria BLEU (presentada a la Seió 2.1.6) apliant una tènia anomenada b o otstrapping [Koe04, 74 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 75  #85 i i 4.2. Exp erimentaió 28.0 28.2 28.4 28.6 28.8 29.0 29.2 29.4 29.6 29.8 30.0 30.2 30.4 30.6 30.8 31.0 31.2 31.4 2 3 4 5 6 7 Taxa BLEU Max. Longitud de Phrase Sistema Base Moses-LCondicional Moses-LConjunta Moses + LCondicional Figura 4.1: Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes prop osats que implementen el mo del de longitud estàndard, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarlv3, p er a la direió de traduió Anglès - Espanyol. BN04℄, que ens p ermet obtindre la taxa BLEU del onjunt d'hipòtesis amb un interval del 95% de onança. Com a resultats dels exp eriments prop orionarem la mitjana dels extrems de l'interval, arro donida a dèimes. 4.2.1 Sistema base Els exp eriments amb el sistema base s'han realitzat de la següent forma: p er a ada direió de traduió (an-es i es-an), s'ha entrenat el sistema base limitant la longitud màxima de les seqüènies de paraules entre 2 i 7, donant llo a 2×6 = 12 sistemes diferents. El mo del log-lineal del sistema base, om hem desrit a la Seió 2.1.3, presenta les següents araterístiques: • Mo dels de traduió de seqüènies de paraules direte i invers. • Mo dels de suavitzat lèxi direte i invers. • Penalitzaió de seqüènies de paraules (amb ρ= 2.718 ). • Penalitzaió p er paraula. • Mo del de distorsió uniforme. JASC-DSIC-UPV 75 memoria  2010/11/17  19:32  page 76  #86 i i Capítol 4. Corp ora i Exp erimentaió 28.4 28.6 28.8 29.0 29.2 29.4 29.6 29.8 30.0 30.2 30.4 30.6 30.8 31.0 31.2 31.4 31.6 31.8 32.0 2 3 4 5 6 7 Taxa BLEU Max. Longitud de Phrase Sistema Base Moses-LCondicional Moses-LConjunta Moses + LCondicional Figura 4.2: Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes prop osats que implementen el mo del de longitud estàndard, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarlv3, p er a la direió de traduió Espanyol - Anglès. • Mo del de reordenament (onguraió msd-bidiretional-fe ). • Mo del de llenguatge de 5-grames, suavitzat p er interpolaió lineal amb el desompte mo diat de Kneser-Ney. Per laritat i p er evitar redundànies, els resultats dels exp eriments amb el sistema base p er ambdues direions de traduió (an-es i es-en) es mostren onjuntament amb els resultats dels exp eriments realitzats amb els sistemes que implementen ambdós aproximaions del mo del de longitud. A la Seió 4.2.2 s'exposen els resultats del mo del de longitud estàndard, mentre que a la Seió 4.2.3 es mostren els resultats del mo del de longitud esp eialitzat. 4.2.2 Mo del de longitud estàndard En aquesta seió es presenten els resultats obtinguts a l'exp erimentar amb els sistemes que afegeixen informaió del mo dels de longitud estàndard, difereniant els resultats p er a ada via d'estimaió dels mo dels i p er ada direió de traduió. 76 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 77  #87 i i 4.2. Exp erimentaió 28.0 28.2 28.4 28.6 28.8 29.0 29.2 29.4 29.6 29.8 30.0 30.2 30.4 30.6 30.8 31.0 31.2 31.4 2 3 4 5 6 7 Taxa BLEU Max. Longitud de Phrase Sistema Base Moses-LCondicional Moses-LConjunta Moses + LCondicional Figura 4.3: Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes prop osats que implementen el mo del de longitud estàndard, estimat a partir de les segmenta- ions de Viterbi extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Anglès - Espanyol. Estimaió a partir de seqüènies de paraules extretes en la fase d'entrenament En primer llo  onsiderarem els resultats dels experiments realitzats amb els tres sistemes prop osats, estimant els mo dels de longitud a partir del onjunt de seqüènies de paraules extretes de orpus. D'una banda, a la Figura 4.1 p o dem observar els resultats p er a la direió de traduió Anglès - Espanyol. Com es p ot apreiar, els sistemes Moses-LCondiional i Moses-LConjunta presenten en general prestaions inferiors al sistema base, mentre que el sistema Moses + LCondiional presenta un omp ortament similar al del sistema base, p erò ap ortant ertes millores puntuals, om s'observa als resultats d'aquest sistema entrenat amb una longitud de seqüènies de paraules limitada a 4 i 7, on es millora el sistema base en 3 i 4 dèimes de BLEU, resp etivament. Crida esp eialment l'atenió el punt oinident p er a tots els sistemes entrenats limitant la longitud de les seqüènies de paraules a un màxim de 5, ja que és molt improbable que aquesta irumstània s'esdevinga. No obstant, en realitat els resultats no són idèntis, dons es diferenien en entèsimes de BLEU, però l'arro doniment dels resultats a dèimes ha propiiat aquesta uriosa oinidènia de resultats. Tamb é s'observa JASC-DSIC-UPV 77 memoria  2010/11/17  19:32  page 78  #88 i i Capítol 4. Corp ora i Exp erimentaió 28.4 28.6 28.8 29.0 29.2 29.4 29.6 29.8 30.0 30.2 30.4 30.6 30.8 31.0 31.2 31.4 31.6 31.8 32.0 2 3 4 5 6 7 Taxa BLEU Max. Longitud de Phrase Sistema Base Moses-LCondicional Moses-LConjunta Moses + LCondicional Figura 4.4: Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes prop osats que implementen el mo del de longitud estàndard, estimat a partir de les segmenta- ions de Viterbi extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Espanyol - Anglès. una erta inestabilitat en el omp ortament dels sistemes prop osats: p er exemple, el sistema Moses-LConjunta entrenat amb una màxima longitud de 7 avantatja en 2 dèimes al sistema base i en 5 al sistema Moses-LCondiional , quan en la resta de ondiions mostra resultats inferiors al sistema base i molt similars al sistema MosesLCondiional . Trob em que això és degut a un pro és d'a justament de paràmetres p o  estable i amb moltes utuaions que deneix uns p esos p o  adequats p er a les araterístiques del mo del log-lineal. D'altra banda, a la Figura 4.2 p o dem observar els resultats per a la direió de traduió Espanyol - Anglès. Els sistemes Moses-LCondiional i Moses-LConjunta mostren unes prestaions larament inferiors al sistema base, mentre que el sistema Moses + LCondiional mostra un omp ortament similar al sistema base, o inlús p o dríem dir que lleugerament millor, p er a longituds màximes més urtes (de 2 a 5 paraules). A partir d'una longitud màxima de 6 les prestaions auen p er baix del sistema base. 78 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 79  #89 i i 4.2. Exp erimentaió 28.2 28.4 28.6 28.8 29.0 29.2 29.4 29.6 29.8 30.0 30.2 30.4 30.6 30.8 31.0 31.2 31.4 2 3 4 5 6 7 Taxa BLEU Max. Longitud de Phrase Sistema Base Moses-SCondicional Moses-SConjunta Moses + SCondicional Figura 4.5: Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes prop osats que implementen el mo del de longitud espeialitzat, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarlv3, p er a la direió de traduió Anglès - Espanyol. Estimaió a partir de les segmentaions de Viterbi En segon llo, es mostren els resultats de la exp erimentaió amb els sistemes prop osats, amb els mo dels de longitud onstruïts a partir de les segmentaions de Viterbi. D'una banda, a la Figura 4.3 p o dem observar els resultats p er a la direió de traduió Anglès - Espanyol. De nou ens trob em en que els sistemes Moses-LCondiional i Moses-LConjunta són omparativament inferiors al sistema base. Ara b é, en aquest as el sistema Moses + LCondiional sí que presenta un omp ortament larament millor al sistema base, destaant l'inrement de 5 dèimes de BLEU en el as de la longitud de seqüènies limitada a 2 paraules, o l'inrement de 3 dèimes per a longituds màximes de 5 i 7 paraules. D'altra banda, a la Figura 4.4 p o dem observar els resultats p er a la direió de traduió Espanyol - Anglès. Els resultats són molt similars als observats a la Figura 4.2: els sistemes Moses-LCondiional i Moses-LConjunta mostren unes prestaions larament inferiors al sistema base, mentre que el sistema Moses + LCondiional presenta una qualitat de resultats molt similar al sistema base, si b é en aquest as el grau de similitud és ma jor, i mostrant novament que les prestaions d'aquest sistema JASC-DSIC-UPV 79 memoria  2010/11/17  19:32  page 86  #96 i i Capítol 5. Conlusions i treball futur • Emprar altres tèniques alternatives a la interp olaió lineal p er suavitzar el mo del de longitud esp eialitzat (p er exemple el desompte de Kneser-Ney emprat als mo dels de llenguatges d' n -grames), donat que presenta ma jors indiis de sobreestimaió. • Inloure informaió de la longitud de les seqüènies de paraules al mo del de reordenament lexialitzat, de forma anàloga a la inlusió d'aquesta informaió al mo del de traduió. La realitzaió d'aquestes ampliaions po drien traduir-se en un inrement signi- atiu de les prestaions del sistema base, que és un dels ob jetius que s'ha p erseguit a aquest treball, i que s'ha aonseguit de forma parial. 86 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 87  #97 i i Bibliografia [AdT82℄ D. Arnold and L. des Tomb e. Basi theory and methodology in eurotra. In S. Niremburg, editor, Mahine Translation: Theoretial and Methodologial Issues , pages 114135, 1982. [AF10℄ Jesús Andrés-Ferrer. Statistial approahes for natural language model ling and monotone statistial mahine translation . PhD thesis, Universidad Politénia de Valenia, Valenia (Spain), Feb 2010. Advisors: A. Juan and F. Casaub erta. [AFJ09℄ Jesús Andrés-Ferrer and Alfons Juan. A phrase-based hidden semimarkov approah to mahine translation. In Proedings of European Assoiation for Mahine Translation (EAMT) , pages 168175, Barelona, Spain, May 2009. Europ ean Asso iation for Mahine Translation. [B + 90℄ P. F. Brown et al. A Statistial Approah to Mahine Translation. Computational Linguistis , 16(2):7985, 1990. [B + 93℄ P. F. Brown et al. The Mathematis of Statistial Mahine Translation: Parameter Estimation. Computational Linguistis , 19(2):263311, 1993. [BBC + 09℄ Sergio Barrahina, Oliver Bender, Franiso Casaub erta, Jorge Civera, Elsa Cub el, Shahram Khadivi, Antonio Lagarda, Hermann Ney, Jesús Tomás, Enrique Vidal, and Juan M. Vilar. Statistial approahes to omputer-assisted translation. Comput. Linguist. , 35(1):328, 2009. [BF81℄ A. Ban and A. Feigenbann. The Handbook of Artiial Intel ligene . Pitman, 1981. [BH60℄ Y. Bar-Hillel. The present status of automati translation of languages. Advanes in Computers , 1:91163, 1960. [Bil82℄ R. Billmeyer. Zu den linguistishen Grundlagen von SYSTRAN. Multilingua , 2(1):8396, 1982. [BN04℄ M. Bisani and H. Ney. Bo otstrap estimates for ondene intervals in asr p erformane evaluation. In IEEE International Conferene on Aoustis, Speeh, and Signal Proessing , volume 1, pages 409412, Montreal, may 2004. [CBKM + 10℄ Chris Callison-Burh, Philipp Koehn, Christof Monz, Kay Peterson, Mark Przyb o ki, and Omar Zaidan. Findings of the 2010 joint workshop on statistial mahine translation and metris for mahine translation. In 87 memoria  2010/11/17  19:32  page 88  #98 i i Bibliograa Proeedings of the Joint Fifth Workshop on Statistial Mahine Translation and MetrisMATR , pages 1753, Uppsala, Sweden, July 2010. Asso iation for Computational Linguistis. [Civ08℄ J. Civera. Novel statistial approahes to text lassiation, mahine translation and omputer-assisted translation . PhD thesis, Universidad Politénia de Valenia, Valenia (Spain), Juny 2008. Advisors: A. Juan and F. Casaub erta. [CV04℄ Franiso Casaub erta and Enrique Vidal. Mahine translation with inferred sto hasti nite-state transduers. Comput. Linguist. , 30(2):205 225, 2004. [CV07℄ F. Casaub erta and E. Vidal. Learning nite-state mo dels for mahine translation. Mahine Learning , 66(1):6991, 2007. [CVP05℄ F. Casaub erta, E. Vidal, and D. Pió. Inferene of nite-state transduers from regular languages. Pattern Reognition , 38:14311443, 2005. [Dej℄ Dejavú. http://www.atril.om. [DLR77℄ A. P. Dempster, N. M. Laird, and D. B. Rubin. Maximum likeliho o d from inomplete data via the em algorithm. JOURNAL OF THE ROYAL STATISTICAL SOCIETY, SERIES B , 39(1):138, 1977. [Do d02℄ George Do ddington. Automati evaluation of mahine translation quality using n-gram o-o urrene statistis. In HLT '02: Proeedings of the seond international onferene on Human Language Tehnology Researh , pages 138145, San Franiso, CA, USA, 2002. Morgan Kaufmann Publishers In. [FLL02℄ G. Foster, P. Langlais, and G. Lapalme. User-friendly text predition for translators. In Pro. of EMNLP'02 , pages 148155, Morristown, NJ, USA, July 2002. Asso iation for Computational Linguistis. [Fos02℄ G. Foster. Text Predition for Translators . PhD thesis, Université de Montréal, May 2002. [Go o℄ Go ogle translate to olkit. http://translate.go ogle.om/supp ort/to olkit/. [GV03℄ I. Garía-Varea. Traduión automátia estadístia: modelos de tradu- ión basados en máxima entropía y algoritmos de búsqueda . PhD thesis, Departamento de Sistemas Informátios y Computaión, Universidad Politénia de Valenia, Deemb er 2003. [HK℄ Johen Hummel and Iko Knyphausen. Trados. http://www.trados.om. [IC97℄ P. Isab elle and K. Churh. Sp eial issue on new tools for human translators. Mahine Translation , 12(12), 1997. 88 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 89  #99 i i Bibliograa [Kay97℄ M. Kay. The prop er plae of men and mahines in language translation. Mahine Translation , 12:323, 1997. [KHB + 07℄ Philipp Koehn, Hieu Hoang, Alexandra Birh, Chris Callison-Burh, Marello Federio, Niola Bertoldi, Bro oke Cowan, Wade Shen, Christine Moran, Rihard Zens, Chris Dyer, Ondrej Bo jar, Alexandra Constantin, and Evan Herbst. Moses: Op en soure to olkit for statistial mahine translation. In ACL . The Asso iation for Computer Linguistis, 2007. [Kni99a℄ K. Knight. Deo ding omplexity in word-replaement translation mo dels. Computional Linguistis , 25(4):607615, 1999. [Kni99b℄ Kevin Knight. A stadistial mahine translation tutorial workb o ok. http://www.isi.edu/natural-language/mt/wkbk.p df, August 1999. [Ko e04℄ Philipp Ko ehn. Statistial signiane tests for mahine translation evaluation, 2004. [Ko e05℄ P. Ko ehn. Europarl: A parallel orpus for statistial mahine translation. In Pro. of the MT Summit X , pages 7986, Septemb er 2005. [Ko e10℄ Philipp Ko ehn. Stadistial Mahine Translation . Cambridge University Press, Edinburgh (United Kingdom), 2010. [LFL00℄ P. Langlais, G. Foster, and G. Lapalme. Unit ompletion for a omputeraided translation typing system. Mahine Translation , 15(4):267294, 2000. [LLL02℄ P. Langlais, G. Lapalme, and M. Loranger. Transtyp e: Developmentevaluation yles to b o ost translator's pro dutivity. Mahine Translation , 15(4):7798, 2002. [MS99℄ Christopher D. Manning and Hinrih Shütze. Foundations of Statistial Natural Language Proessing . The MIT Press, Cambridge, Massahusetts, 1999. [Mur66℄ Hub ert Murray. Methods for Satisfying the Needs of the Sientist and the Engineer for Sienti and Tehnial Communiation . In a Press Release, Washington D.C., 1966. [NGW95℄ Hermann Ney, M. Generet, and F. Wessel. Extensions of absolute dis- ounting for language mo deling. In Pro. of the Fourth European Conferene on Speeh Communiation and Tehnology , pages 12451248, Madrid, Spain, September 1995. [Oh03℄ F. J. Oh. Minimum error rate training in statistial mahine translation. In Pro. of ACL'03 , pages 160167, Morristown, NJ, USA, July 2003. Assoiation for Computational Linguistis. JASC-DSIC-UPV 89 memoria  2010/11/17  19:32  page 90  #100 i i Bibliograa [ON03℄ Franz Josef Oh and Hermann Ney. A systemati omparison of various statistial alignment mo dels. Computational Linguistis , 29, 2003. [PC66℄ John R. Piere and John B. Carroll. Languages and mahines  omputers in translation and linguistis. Tehnial rep ort, Automati Language Pro essing Advisory Committe (ALPAC), National Aademy of Sienes, 1966. [PRWZ01℄ K. Papineni, S. Roukos, T. Ward, and W. Zhu. BLEU: a Metho d for Automati Evaluation of Mahine Translation. Tehnial Rep ort RC22176, Thomas J. Watson Researh Center, 2001. [SDS + 06℄ Matthew Snover, Bonnie Dorr, Rihard Shwartz, Linnea Miiulla, and John Makhoul. A study of translation edit rate with targeted human annotation. In In Proeedings of Assoiation for Mahine Translation in the Amerias , pages 223231, 2006. [Slo85℄ J. Slo um. A survey of mahine translation: its history, urrent status and future prosp ets. Computational Linguistis , 11(1):117, 1985. [Sto02℄ A. Stolke. Srilm  an extensible language mo deling to olkit. http://www.sp eeh.sri.om, 2002. [Tih82℄ B. Tihouin. The Meteo System. In Veronia Lawson, editor, Pro. of Pratial Experiene of Mahine Translation , pages 3944, 1982. [TVN + 97℄ C. Tillmann, S. Vogel, H. Ney, A. Zubiaga, and H. Sawaf. Aelerated dp based searh for statistial translation. In In European Conf. on Speeh Communiation and Tehnology , pages 26672670, 1997. [UoG95℄ Multilingual Information Proessing Department University of Geneva. Evaluation of natural language proessing systems. http://www.isso.unige.h/en/researh/pro jets/ewg95/, 1995. [VB85℄ Bernard Vauquois and Christian Boitet. Automated translation at grenoble university. Comput. Linguist. , 11(1):2836, 1985. [Wea55℄ W. Weaver. Translation. In W. N. Loke and A. D. Bo oth, editors, Mahine Translation of Languages: fourteen essays , pages 1523. MIT Press, Cambridge, MA., 1955. [WWC + 86℄ P. J. Whitelo k, M. MGee Wo o d, B. J. Chandler, N. Holden, and H. J. Horsfall. Strategies for interative mahine translation: the exp eriene and impliations of the UMIST Japanese pro jet. In Pro. of COLING'86 , pages 329334, Bonn, Germany, August 1986. 90 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 91  #101 i i Índex de figures 1.1 Triangle de Vauquois . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 1.2 Arquitetura general del pro és de traduió basat en el raonament sobre la regla de Bayes. . . . . . . . . . . . . . . . . . . . . . . . . . . 12 1.3 Exemple senzill d'alineament de paraules entre dues frases. . . . . . . 21 1.4 Exemple d'alineament en el que les paraules alineades o up en p osiions diferents en adasuna de les frases. . . . . . . . . . . . . . . . . . . . 22 1.5 Exemple d'alineament en el que una paraula d'eixida es troba rela- ionada amb més d'una paraula d'entrada. . . . . . . . . . . . . . . . . 22 1.6 Exemple d'alineament en el que paraules de la frase d'eixida no han estat alineades amb ap paraula de la frase d'entrada. . . . . . . . . . 23 1.7 Exemple d'alineament en el que paraules de la frase origen es trob en alineades amb la paraula destí esp eial NULL . . . . . . . . . . . . . . 23 1.8 Exemple del pro és de traduió automàtia en sistemes basats en seqüènies de paraules. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26 1.9 Exemple d'extraió de parells de seqüènies de paraules a partir de l'alineament entre paraules d'un parell de frases. . . . . . . . . . . . . 28 1.10 Exemples de p ossibles seqüènies de paraules onsistents i inonsistents, dep enent de l'alineament entre les paraules d'un parell de frases qualsevol. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29 1.11 Exemple d'un transdutor esto àsti d'estats nits (sense probabilitats asso iades). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 1.12 Exemple d'arbre que representa la frase en anglès I shal l be passing on to you some omments mo delada amb una gramàtia d'estruturaió de frases. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34 2.1 Exemples dels tres tipus d'orientaions que p o den donar-se llo a un mo del de reordenament lexialitzat. . . . . . . . . . . . . . . . . . . . . 42 3.1 Exemple d'alineament entre paraules d'un parell de frases, extret del orpus Europarl-v3 per al parell de llenguatges anglès - espanyol (veure Seió 4.1). Aquest alineament requereix, en el pro és de traduió, l'extraió d'una seqüènia d'11 paraules de longitud om a mínim (denotada p er la franja grisa), segons l'algorisme d'extraió de seqüènies de paraules de Moses . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60 3.2 Exemple d'una estrutura de dades trie. . . . . . . . . . . . . . . . . . 63 91 memoria  2010/11/17  19:32  page 92  #102 i i Índex de gures 3.3 Distribuió del nombre de no des emmagatzemats a ada nivell de trie . S'apreia, en esala logarítmia, el nombre mitjà de no des residents a ada nivell d'un trie onstruït a partir de les seqüènies de paraules en espanyol extretes de forma heurístia a partir del onjunt d'entrenament del orpus Europarl-v3 (veure Seió 4.1), onsiderant seqüènies de paraules limitades a 7 paraules de longitud. S'observa una lara tendènia exp onenial inversa del nombre mitjà de no des onforme s'aprofundeix en l'arbre. . . . . . . . . . . . . . . . . . . . . . . . . . . 66 3.4 Distribuió del la longitud de les seqüènies de paraules, estimada a partir de les seqüènies de paraules en espanyol extretes de forma heurístia a partir del onjunt d'entrenament del orpus Europarl-v3 (veure Se- ió 4.1), onsiderant seqüènies de paraules limitades a 7 paraules de longitud. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 68 4.1 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud estàndard, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Anglès - Espanyol. 75 4.2 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud estàndard, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Espanyol - Anglès. 76 4.3 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud estàndard, estimat a partir de les segmentaions de Viterbi extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Anglès - Espanyol. . 77 4.4 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud estàndard, estimat a partir de les segmentaions de Viterbi extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Espanyol - Anglès. . 78 4.5 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud esp eialitzat, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Anglès - Espanyol. 79 4.6 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud esp eialitzat, estimat a partir del onjunt de seqüènies de paraules extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Espanyol - Anglès. 80 92 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 93  #103 i i Índex de gures 4.7 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud esp eialitzat, estimat a partir de les segmentaions de Viterbi extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Anglès - Espanyol. . 81 4.8 Taxa BLEU, en funió de la màxima longitud que p o den assolir les seqüènies de paraules, del sistema base i dels tres sistemes proposats que implementen el mo del de longitud esp eialitzat, estimat a partir de les segmentaions de Viterbi extretes del onjunt d'entrenament del orpus Europarl-v3, p er a la direió de traduió Espanyol - Anglès. . 82 JASC-DSIC-UPV 93 memoria  2010/11/17  19:32  page 94  #104 i i Índex de gures 94 JASC-DSIC-UPV memoria  2010/11/17  19:32  page 95  #105 i i Índex de taules 1.1 Exemple d'anàlisi freqüenial de trigrames i estimaió de probabilitats d'o urrènia d'una paraula donada la història the red al orpus Europarl (on the red s'esdevé 225 vegades). . . . . . . . . . . . . . . . . . . . . . 17 1.2 Exemple d'estimaió de probabilitats de traduió lèxiques p er a la paraula glass (on N( glass ) = 1000 ). . . . . . . . . . . . . . . . . . . . . 20 3.1 Anàlisi de la omplexitat temp oral de les op eraions de era i inserió al trie original i al trie optimitzat. . . . . . . . . . . . . . . . . . . . . 69 4.1 Estadístiques del orpus Europarl-v3. . . . . . . . . . . . . . . . . . . . 74 95