scieee Open visual document viewer

De los datos a la imitación: estudio y modelado del comportamiento de jugadores en Wordle

Calvet Sisó, Óscar

Abstract

Este proyecto se centra en el estudio del comportamiento de jugadores humanos y en la imitación de sus estilos de juego. Para ello utilizaremos Wordle un popular rompecabezas de palabras del cuál se dispone un gran número partidas publicadas en redes sociales. El proyecto comienza con la recopilación de un conjunto de datos de partidas y su preprocesamiento. A continuación, se aplican técnicas de análisis de datos para explorar el conjunto. Esto incluye estadísticas descriptivas, visualización de datos y algoritmos de aprendizaje automático. Después de la fase de análisis, se desarrolla un marco de modelado para simular el comportamiento del jugador. Los modelos están diseñados para imitar las estrategias y los procesos de toma de decisiones observados. Se emplean técnicas de aprendizaje automático, como algoritmos genéticos, para entrenar estos modelos utilizando los datos procesados. El rendimiento de los modelos desarrollados se evalúa a través de métricas rigurosas con el objetivo de evaluar su capacidad de imitar a los jugadores humanos y si pueden lograr tasas de éxito similares. Los resultados obtenidos ayudan a comprender el comportamiento de los jugadores de Wordle y mejorar potencialmente el rendimiento de estos. Además, los modelos desarrollados en este proyecto podrían aplicarse a varios otros rompecabezas basados en palabras, proporcionando información sobre estrategias y procesos de toma de decisiones que pueden mejorar las experiencias de juego de los jugadores humanos.

Full text

De los da os a la imi ación: es udio y modelado del compo amien o de jugado es en Wo dle F om Da a o Imi a ion: S udy and modeling Playe Beha io in Wo dle T abajo de Fin de G ado Cu so 2022–2023 Au o Ósca Cal e Sisó Di ec o An onio Alejand o Sánchez Ruíz-G anados Doble g ado en Ma emá icas e Ingenie ía In o má ica Facul ad de In o má ica Uni e sidad Complu ense de Mad id De los da os a la imi ación: es udio y modelado del compo amien o de jugado es en Wo dle F om Da a o Imi a ion: S udy and modeling Playe Beha io in Wo dle T abajo de Fin de G ado en Ingenie ía In o má ica Au o Ósca Cal e Sisó Di ec o An onio Alejand o Sánchez Ruíz-G anados Con oca o ia: Junio 2023 Doble g ado en Ma emá icas e Ingenie ía In o má ica Facul ad de In o má ica Uni e sidad Complu ense de Mad id 29 de MAYO de 2023 Resumen Es e p oyec o se cen a en el es udio del compo amien o de jugado es humanos y en la imi ación de sus es ilos de juego. Pa a ello u iliza emos Wo dle un popula ompecabezas de palab as del cuál se dispone un g an núme o pa idas publicadas en edes sociales. El p oyec o comienza con la ecopilación de un conjun o de da os de pa idas y su p ep ocesamien o. A con inuación, se aplican écnicas de análisis de da os pa a explo a el conjun o. Es o incluye es adís icas desc ip i as, isualización de da os y algo i mos de ap endizaje au omá ico. Después de la ase de análisis, se desa olla un ma co de modelado pa a simula el compo amien o del jugado . Los modelos es án diseñados pa a imi a las es a egias y los p ocesos de oma de decisiones obse ados. Se emplean écnicas de ap endizaje au omá ico, como algo i mos gené- icos, pa a en ena es os modelos u ilizando los da os p ocesados. El endimien o de los modelos desa ollados se e alúa a a és de mé icas igu osas con el obje i o de e alua su capacidad de imi a a los jugado es humanos y si pueden log a asas de éxi o simila es. Los esul ados ob enidos ayudan a comp ende el compo amien o de los jugado es de Wo dle y mejo a po encialmen e el endimien o de es os. Además, los modelos desa ollados en es e p oyec o pod ían aplica se a a ios o os ompecabezas basados en palab as, p opo cionando in o mación sob e es a egias y p ocesos de oma de decisiones que pueden mejo a las expe iencias de juego de los jugado es humanos. Palab as cla e Wo dle, análisis de da os, modelado de jugado es, algo i mos gené icos, juegos. Abs ac This p ojec ocuses on he s udy o he beha io o human playe s and he imi- a ion o hei playing s yles. Fo his we will use Wo dle, a popula wo d puzzle o which a la ge numbe o games a e published on social ne wo ks. The p ojec s a s wi h collec ing a game da a se and p e-p ocessing i . Da a analysis echniques a e hen applied o explo e he se . This includes desc ip i e s a is ics, da a isualiza ion, and machine lea ning algo i hms. A e he analysis phase, a modeling amewo k is de eloped o simula e playe beha io . The models a e designed o mimic obse ed s a egies and decision-making p ocesses. Machine lea ning echniques such as gene ic algo i hms a e used o ain hese models using he p ocessed da a. The pe o mance o he de eloped models is e alua ed h ough igo ous me ics wi h he aim o e alua ing he abili y o he models o imi a e hu- man game s and whe he hey can achie e simila success a es. The esul s ob ained help o unde s and he beha io o Wo dle playe s and po- en ially imp o e hei pe o mance. Addi ionally, he models de eloped in his p ojec could be applied o a ious o he wo d-based puzzles, p o iding insigh s in o s a egies and decision-making p ocesses ha can imp o e gaming expe iences o human playe s. Keywo ds Wo dle, da a analysis, playe imi a ion, gene ic algo i hms, games. ii Índice 1. In oducción 1 1.1. Mo i ación................................. 1 1.2. Obje i os ................................. 5 1.3. Plande abajo.............................. 6 1.4. Código uen e............................... 6 2. In oduc ion 7 2.1. Mo i a ion................................. 7 2.2. Goals.................................... 11 2.3. Wo kplan................................. 11 2.4. Sou cecode ................................ 12 3. T abajos elacionados 13 3.1. Mas e mind................................ 13 3.2. Algo i mos de educción de la en opía . . . . . . . . . . . . . . . . . 14 3.2.1. Algo i mo de los cinco in en os de Knu h . . . . . . . . . . . . 15 3.2.2. Algo i mo pa a Wo dle . . . . . . . . . . . . . . . . . . . . . . 16 3.3. Algo i mos gené icos . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 3.3.1. Algo i mo gené ico pa a Mas e mind . . . . . . . . . . . . . . 18 3.4. Modelado de jugado es . . . . . . . . . . . . . . . . . . . . . . . . . . 19 3.4.1. DQN................................ 19 3.4.2. Ap endizaje po e ue zo p o undo a pa i de p e e encias humanas.............................. 20 3.4.3. Ap endizaje po imi ación a a és de la es imación de polí i- cas de apoyo expe as . . . . . . . . . . . . . . . . . . . . . . 22 4. Recopilación y limpieza de las pa idas 23 4.1. Recopilación de los wee s . . . . . . . . . . . . . . . . . . . . . . . . 23 4.1.1. Ex acción de las a iables . . . . . . . . . . . . . . . . . . . . 25 4.2. Limpiezadelosda os........................... 25 4.2.1. Eliminación de pa idas con o ma o inco ec o . . . . . . . . 25 4.2.2. Eliminación de pa idas alseadas . . . . . . . . . . . . . . . . 26 ix 2Capí ulo 1. In oducción Figu a 1.1: Pa ida de ejemplo Pa a ejempli ica mejo las no mas desc i as, en la igu a 1.1 se pueden obse a las combinaciones de colo es de uel as po las palab as in oducidas en una pa ida cuyo obje i o es abbey. El éxi o de Wo dle se puede a ibui a los p incipios de ludi icación que inco po a. Una de las azones p incipales po las que a la gen e le gus a juga es la sensación de log o y supe ación asociada al éxi o. Wo dle es á diseñado pa a p opo ciona eedback ins an áneo y ecompensas a los jugado es, lo que lo hace más sa is ac o io y a ac i o que un juego de palab as adicional. La simplicidad y acilidad de uso del juego ambién lo hacen accesible a una amplia gama de jugado es, desde juga- do es casuales has a en usias as más se ios [29]. O a o ma en que Wo dle u iliza la ludi icación pa a mo i a a los jugado es es a a és de la compe encia. El juego anima a los jugado es a compe i con a sus amigos y o os jugado es, omen ando un sen ido de comunidad y cama ade ía. La na u aleza compe i i a del juego c ea una sensación de u gencia y emoción que man iene a los jugado es comp ome idos y mo i ados a segui jugando. Es o ha p o ocado una g an a ición po Wo dle y consecuen emen e su comuni- dad de jugado es ha aumen ado y e olucionado, di e si icándose en el p oceso y gene ando jugado es con es a egias a iadas [46]. Pese a que no exis en da os ace - ca de los jugado es p e ios a la adquisición po pa e del New Yo k Times y que es e pe iódico man iene en p i ado las es adís icas que posee del juego, sí que exis en a ios a ículos de la p opia emp esa donde se de allan a ios ipos de jugado es y sus es a egias [2], [16]. T as ecopila los hemos ob enido las siguien es ca ego ías: 1.1. Mo i ación 3 El jugado ocasional: El jugado casual se elaciona con Wo dle como una ac i idad de ocio, en busca de en e enimien o y es imulación men al. Dis u- an de la simplicidad del juego y, a menudo, juegan de o ma in e mi en e. Los jugado es casuales gene almen e con ían en la in uición, la asociación de palab as y el conocimien o del ocabula io medio pa a ealiza sus in en os. Suelen u iliza únicamen e palab as candida as a se solución aunque no las eligen de mane a idónea pa a disminui el amaño del conjun o de palab as es an es. El cazado de pa ones: Los cazado es de pa ones p es an una g an a en- ción al eedback p opo cionado po el juego. Obse an cómo cambia la palab a con cada espues a y usan es a in o mación e icien emen e pa a disminui na- ablemen e el conjun o de palab as es an es. Pese a es o, siguen u ilizando casi exclusi amen e palab as candida as a se solución en cada in en o. El es a ega: Los es a egas juegan a Wo dle con una es a egia p emedi ada de p ueba y e o . Sus in en os iniciales ep esen an una amplia gama de posi- bilidades buscando educi al máximo el espacio de soluciones y luego ajus an sus in en os pos e io es en unción del eedback ecibido. Es e p oceso cla a- men e di e enciado en dos pa es cuyo cambio se da en e el segundo y e ce in en o pe mi e a es e g upo adi ina la palab a con una media de in en os in e io a los o os dos. Es as ca ac e izaciones nos pe mi en ob ene una p ime a ap oximación de los ipos de jugado es, no obs an e al no posee los da os de los que se ha in e ido la in o - mación no nos esul an pa icula men e ú iles. A pesa de es o, Wo dle cuen a con una uncionalidad que nos a a pe mi i ob ene millones de pa idas. En la p ime a semana del año 2022, Wo dle enía al ededo de escien os mil usua- ios dia ios ac i os [46], en la segunda semana es e núme o aumen ó has a los es millones [21]. Es e inc emen o coincidió con la implemen ación de la uncionalidad de compa i las pa idas en di e sas edes sociales que ue lanzada el p ime día del año, es a mejo a pe mi ió a los usua ios gene a publicaciones que con enían ca ac- e es UTF-8 co espondien es a cuad ados con los colo es ob enidos en sus in en os. Es e o ma o pe mi ió que los jugado es pudie an publica y compa i sus pa idas sin des elaba la palab a obje i o del día. La popula idad de es os pos s sacudió Twi e po comple o, en las dos p ime as semanas del año 2022 se publica on más de un millón doscien as mil pa idas en o ma o wee [8]. La ed social no a dó en se inundada po pa idas de cien os de miles de usua ios y Wo dle se con i ió en un enómeno de masas. Du an e el anscu so del año Twi e se ha con e ido en un eposi o io de pa idas de Wo dle gigan esco. Pese a que las publicaciones no con ienen las palab as li e a- les in oducidas po los usua ios, la in o mación p opo cionada po los colo es y los me ada os de los pos s nos pe mi en a en u a la di icul ad de las palab a obje i o del día y cons ui una idea gene al de la e olución de la habilidad de los jugado es. 4Capí ulo 1. In oducción Es e inusual enómeno, acompañado de la masi a can idad de da os eales gene- ados y de mi a ición po los puzzles de palab as me ha mo i ado a cen a el ema de es e abajo en la ob ención, análisis y es udio de es as pa idas. Es amos an e una g an can idad de da os que oda ía no se han analizado en p o undidad. Po ello en es e abajo p e endemos accede a es os, p ocesa los, gene a un conjun o de pa idas, hace lo público, analiza el compo amien o de los jugado es, clasi ica los e in en a imi a los median e algo i mos de ap endizaje au omá ico. El uso de algo i mos de ap endizaje au omá ico y de la in eligencia a i icial (IA) no es a bi a io, la IA ha enido un impac o signi ica i o en muchas indus ias, inclu- yendo la de los juegos. Si bien los ideojuegos han sido uno de los ocos p incipales de la in es igación en es a, los juegos más casuales ambién han is o un impac o impo an e de es e desa ollo. La elación en e la in es igación en IA y los juegos se puede e en muchas á eas, como el diseño, la jugabilidad y la expe iencia del jugado [50] y, además, se ha u ilizado en el diseño de juegos pa a c ea oponen es in eligen es y desa ian es pa a es os [41]. Analizando los da os de la jugabilidad y las es a egias humanas, se pueden desa olla algo i mos e icaces e in eligen es que simulan el compo amien o de los jugado es humanos [37]. Es o ha esul ado en una jugabilidad más desa ian e y es a égica pa a los jugado es, así como en una expe iencia más ag adable pa a aquellos que p e ie en ba i se con a oponen es no humanos [7]. En é minos de jugabilidad, la IA se ha u ilizado pa a c ea expe iencias más ea- lis as e inme si as. La IA puede c ea oponen es in eligen es que ajus an su juego en unción de los mo imien os ealizados po el jugado humano. Es o c ea una ex- pe iencia más ealis a e inme si a pa a los jugado es, así como una jugabilidad más desa ian e y dinámica. El uso de la IA en el que nos amos a cen a en es e p oyec o es el de imi a el compo amien o humano, exis en múl iples ap oximaciones en e las cuales des- acamos las siguien es: Ap endizaje po imi ación: ambién conocido como clonación conduc ual. Implica en ena a agen es de IA pa a imi a a jugado es humanos ap endiendo de demos aciones de expe os. Es a écnica se ha aplicado con éxi o en a ios dominios de juego. Po ejemplo, en los juegos de A a i [35] donde se en enó una ed neu onal con olucional median e una a ian e del algo i mo de Q-lea ning [48], ambién se pueden u iliza es as écnicas pa a acele a el ap endizaje de algunos algo i mos como el ‘DQN’ de DeepMind que ap ende a juga de mane a au ónoma a pa i de un conjun o de dimensionalidad muy al a [36], con un no able cos e compu acional, no obs an e, el uso de pa idas humanas en el comienzo del en enamien o, pe mi e educi no ablemen e el iempo de ap endizaje [14]. Es e en oque esul a muy ú il ya que pe mi e a los agen es imi a a jugado es humanos de cualquie ni el siemp e que se disponga de su icien es da os y capacidad de cómpu o. 1.2. Obje i os 5 IA adap a i a: Imi a jugado es no solo se limi a a eplica sus acciones, sino que ambién implica comp ende sus p ocesos de oma de decisiones y su compo amien o. El modelado de jugado es iene como obje i o cap u a y p edeci las acciones, p e e encias y es a egias de los jugado es humanos. A di e encia de los sis emas de ap endizaje po imi ación, los sis emas de mo- delado son lexibles y pueden adap a se a nue os da os, son pa icula men e ú iles en la c eación de ad e sa ios que mejo an sus capacidades a lo la go de la pa ida g acias a los inpu s p opo cionados po los jugado es [51]. Los algo i mos u ilizados en es os casos son mucho más a iados, po ejemplo se u ilizan edes de des ilación expe a que se en enan median e a iables adap- a i as del algo i mo Q-lea n [47] y ambién exis en ap oximaciones median e edes neu onales gene a i as ad e sa ias (GAN) [17, 20]. Re oalimen ación humana: O o en oque pa a imi a a los jugado es im- plica sesga el ap endizaje di ec amen e usando el eedback p opo cionado po los jugado es. Es deci , los modelos se en enan con pa idas eales y as ob- se a las acciones ealizadas, se e alúa su compo amien o. Pos e io men e los jugado es pueden ealiza indicaciones o cambios que modi ican el compo - amien o del agen e en una si uación de e minada sesgando así el ap endizaje u u o. Es e mé odo, ambién conocido como ap endizaje in e ac i o a pa - i de demos aciones, pe mi e que los sis emas de IA imi en y se adap en a las p e e encias y ma ices de los jugado es humanos aunque equie e una supe isión cons an e [10, 33, 32]. 1.2. Obje i os Con es e abajo se p e ende: O1. Recopila , limpia y publica un conjun o de da os de pa idas. O2. Analiza los da os de pa idas y del ocabula io usado. O3. Encon a pa ones en los da os analizados, especialmen e aquellos co espon- dien es a dis in os ipos de jugado es. O4. C ea p og amas capaces de imi a a los di e en es ipos de jugado encon a- dos. O5. Compa a los esul ados de los modelos con pa idas eales. O6. E alua los di e sos modelos gene ados y ob ene da os sob e su ap endizaje y los usua ios que in en an modela . O7. Comp ende la base de jugado es, en pa icula la elación del endimien o de es os y su ocabula io, así como, las es a egias empleadas. O8. Ca ac e iza a los jugado es según los pa ones encon ados y su ocabula io in e ido. 6Capí ulo 1. In oducción En gene al, es e p oyec o busca p opo ciona in o mación aliosa sob e el compo - amien o del jugado y ca ac e iza lo. 1.3. Plan de abajo Pa a log a los obje i os desc i os en el apa ado an e io , se ha aco dado ealiza euniones cada dos semanas en e el au o y el di ec o del abajo. Conside ando lo an e io , se han es ablecido los siguien es hi os pa a o ganiza el abajo a ealiza en es e p oyec o: Ob ención de los da os. (Del 5 al 19 de oc ub e de 2022) Limpieza de los da os. (Del 19 de oc ub e al 16 de no iemb e de 2022) Realización del análisis explo a o io de los da os. (Del 16 de no iemb e al 8 de diciemb e de 2022) P ocesamien o y c eación de clús e s sob e los da os. (Del 8 de diciemb e de 2022 al 22 de eb e o de 2023) C eación de modelos de in eligencia a i icial basados en los esul ados ob e- nidos en la e apa an e io . (Del 22 de eb e o al 29 de ma zo de 2023) E aluación de los modelos y selección de los modelos. (Del 29 de ma zo al 12 de ab il de 2023) Ob ención de in o mación a pa i de los modelos y el p ocesamien o de da os. (Del 12 al 26 de ab il de 2023) Den o del iempo de cada obje i o ambién se con abiliza el iempo dedicado a la edacción de la memo ia del p oyec o. Hemos decidido man ene la úl ima quincena an es de la en ega sin asigna pa a e mina la memo ia y ambién como iempo ex a en caso de que su ja algún con a iempo. 1.4. Código uen e El desa ollo de los dis in os apa ados de es e p oyec o se ha ealizado en su in- eg idad en el lenguaje Py hon, haciendo uso de la he amien a Jupy e No ebook que pe mi e almacena los g á icos gene ados. El p oyec o en su o alidad se encuen- a en el eposi o io de Gi hub público siguien e h ps://gi hub.com/Osca Cal/ Imi a ingWo dlePlaye s con licencia MIT o ganizado po capí ulos. Además el conjun o de pa idas gene ado se encuen a ambién en un eposi o- io público de la página Kaggle bajo la u l: h ps://www.kaggle.com/da ase s/ sca cal e sis/wo dle-games con una licencia CC BY-SA 4.0. Cap´ ı ulo 2 In oduc ion “E en hough I play i e e y day, I s ill eel a sense o accomplishmen when I do i : i makes me eel sma , and people like ha ” — Josh Wa dle, c eado de Wo dle 2.1. Mo i a ion Wo dle is a wo d game ha e olu ionized he social ne wo k Twi e a he beginning o he yea 2022, was c ea ed by Josh Wa dle and cu en ly belongs o he newspape The New Yo k Times, being pa o he epe oi e o pas imes o digi al edi ions. The game in ol es guessing a i e-le e wo d ha changes e e y day, wi h he goal o guessing i in six o ewe ies. The playe ecei es eedback on how simila he wo d en e ed is o he sec e wo d a e each a emp in he o m o colo ed squa es ha indica e whe he a le e in he guessed wo d is co ec , inco ec o in he w ong place. The game has gained immense popula i y, wi h playe s sha ing hei achie emen s on social ne wo ks and compe ing wi h hei iends o ge he longes s eak o co ec guesses in he ewes numbe o ies. On each a emp he playe en e s a wo d in o a g id and he game colo s he le e s in he g id g een, yellow o g ay based on he ollowing ules: The en e ed le e is colo ed g een i i is in he a ge wo d and occupies he same posi ion. The en e ed le e is colo ed yellow i i appea s in he a ge wo d bu is no in he same posi ion. The en e ed le e is colo ed g ay i i does no appea in he a ge wo d. Mul iple occu ences o he same le e in he en e ed wo d will be colo ed g een o yellow ollowing he abo e ules only i hey appea mul iple imes in he a ge . In any o he case, he emaining epea ed le e s will be colo ed g ay. 7 8Capí ulo 2. In oduc ion Figu a 2.1: Example o a game To be e exempli y he ules desc ibed abo e, in igu e 2.1 you can see he colo combina ions e u ned by he wo ds en e ed in a game whose a ge wo d is abbey. Wo dle’s success can be a ibu ed o he p inciples o gami ica ion i embodies. One o he main easons people like o play is he sense o accomplishmen and achie emen associa ed wi h success. Wo dle is designed o p o ide ins an eedback and ewa ds o playe s, making i mo e sa is ying and engaging han a adi ional wo d game. The game’s simplici y and ease o use also make i accessible o a wide ange o playe s, om casual game s o mo e se ious en husias s [29]. Ano he way Wo dle uses gami ica ion o mo i a e playe s is h ough compe i ion. The game en- cou ages playe s o compe e agains hei iends and o he playe s, os e ing a sense o communi y and cama ade ie. The compe i i e na u e o he game c ea es a sense o u gency and exci emen ha keeps playe s engaged and mo i a ed o keep playing. This has led o a g ea ondness o Wo dle and consequen ly i s communi y o playe s has g own and e ol ed, di e si ying in he p ocess and gene a ing playe s wi h a ied s a egies [46]. Al hough he e is no da a on playe s p io o he ac- quisi ion by he New Yo k Times and he newspape keeps i s s a is ics on he game p i a e, he e a e se e al a icles by he company i sel de ailing a ious ypes o playe s and hei s a egies [2, 16]. A e compiling hem we ha e ob ained he ollowing ca ego ies: The casual game : The casual game ela es o Wo dle as a leisu e ac i i y, seeking en e ainmen and men al s imula ion. They enjoy he simplici y o he game and o en play in e mi en ly. Casual playe s gene ally ely on in ui ion, 2.1. Mo i a ion 9 wo d associa ion and knowledge o a e age ocabula y o make hei a emp s. They end o use only candida e solu ion wo ds al hough hey do no choose hem ideally o dec ease he size o he emaining wo d se . Pa e n hun e : Pa e n hun e s pay close a en ion o he eedback p o ided by he game. They obse e how he wo d changes wi h each esponse and use his in o ma ion e icien ly o na ably disc imina e he emaining se o wo ds. Despi e his, hey s ill almos exclusi ely use candida e solu ion wo ds on each a emp . The s a egis : S a egis s app oach Wo dle wi h a p emedi a ed ial-and- e o s a egy. Thei ini ial a emp s ep esen a wide ange o possibili ies seeking o educe he solu ion space as much as possible and hen adjus hei subsequen a emp s based on he eedback ecei ed. This clea ly di e en ia ed wo-pa p ocess whose change occu s be ween he second and hi d a emp allows his g oup o guess he wo d wi h a lowe a e age numbe o a emp s han he o he wo. These cha ac e iza ions allow us o ob ain a i s app oxima ion o he ypes o playe s, bu since we do no ha e he da a om which he in o ma ion has been in e ed, hey a e no pa icula ly use ul. Howe e , Wo dle has a unc ionali y ha will allow us o ob ain millions o games. In he i s week o he yea 2022, Wo dle had a ound h ee hund ed housand ac i e daily use s [46], in he second week his numbe inc eased o h ee million [21]. This inc ease coincided wi h he implemen a ion o he game sha ing unc io- nali y on a ious social ne wo ks ha was launched on he i s day o he yea , his enhancemen allowed use s o gene a e pos s con aining UTF-8 cha ac e s co es- ponding o squa es wi h he colo s ob ained in hei a emp s. This o ma allowed playe s o pos and sha e hei games wi hou e ealing he a ge wo d o he day. The popula i y o hese pos s shook Twi e comple ely, in he i s wo weeks o he yea 2022 mo e han one million wo hund ed housand games we e published in he wee o ma [8]. The social ne wo k was soon looded wi h games om hund eds o housands o use s and Wo dle became a mass phenomenon. O e he cou se o he yea Twi e has become a gigan ic eposi o y o Wo dle games. Al hough he pos s do no con ain he li e al wo ds en e ed by use s, he in o ma ion p o ided by he colo s and me ada a o he pos s allow us o guess he di icul y o he day’s a ge wo ds and o build a gene al idea o he e olu ion o he playe s’ skill. This unusual phenomenon, oge he wi h he massi e amoun o eal da a gene- a ed and my ondness o wo d puzzles, has mo i a ed me o ocus he subjec o his pape on he collec ion, analysis and s udy o hese games. We a e aced wi h a la ge amoun o da a ha ha e no ye been analyzed in dep h. The e o e, in his wo k we in end o access hese da a, p ocess hem, gene a e a se o games, make 10 Capí ulo 2. In oduc ion hem public, analyze he beha io o he playe s, classi y hem and y o imi a e hem by means o machine lea ning algo i hms. The use o machine lea ning algo i hms and a i icial in elligence (AI) is no a - bi a y; AI has had a signi ican impac on many indus ies, including gaming. While ideo games ha e been a majo ocus o AI esea ch, mo e casual games ha e also seen a signi ican impac om his de elopmen . The ela ionship be ween AI esea ch and games can be seen in many a eas, such as design, gameplay and playe expe ience [50], and has also been used in game design o c ea e in elligen and challenging opponen s o games [41]. By analyzing gameplay da a and human s a egies, e icien and in elligen algo i hms can be de eloped ha simula e he beha io o human playe s [37]. This has esul ed in mo e challenging and s a egic gameplay o playe s, as well as a mo e enjoyable expe ience o hose who p e e o ba le agains non-human opponen s [7]. In e ms o gameplay, AI has been used o c ea e mo e ealis ic and imme si e expe iences. The AI can c ea e in elligen opponen s ha adjus hei gameplay based on he mo es made by he human playe . This c ea es a mo e ealis ic and imme si e expe ience o playe s, as well as mo e challenging and dynamic gameplay. The use o AI ha we a e going o ocus on in his p ojec is o imi a e human beha io , he e a e mul iple app oaches among which we highligh he ollowing: Imi a ion lea ning: also known as beha io al cloning. I in ol es aining AI agen s o mimic human playe s by lea ning om expe demons a ions. This echnique has been success ully applied in se e al gaming domains. Fo example, in A a i [35] games whe e a con olu ional neu al ne wo k was ained using a a ian o he Q-lea ning algo i hm. [48], i is also possible o use hese echniques o accele a e he lea ning o some algo i hms such as he ‘DQN’ o DeepMind which lea ns o play au onomously om a e y high dimensionali y se [36], wi h a ema kable compu a ional cos , howe e , he use o human games a he beginning o he aining, allows o educe signi ican ly he lea ning ime [14]. This app oach is e y use ul as i allows agen s o imi a e human playe s o any le el as long as su icien da a and compu a ional powe a e a ailable. Adap a i e AI: Mimicking playe s is no only limi ed o eplica ing hei ac ions, bu also in ol es unde s anding hei decision-making p ocesses and beha io . Playe modeling aims o cap u e and p edic he ac ions, p e e ences and s a egies o human playe s, unlike imi a ion lea ning sys ems, modeling sys ems a e lexible and can adap o new da a, hey a e pa icula ly use ul in he c ea ion o ad e sa ies ha imp o e hei capabili ies h oughou he game hanks o he inpu s p o ided by he playe s [51]. The algo i hms used in hese cases a e much mo e a ied, o example expe dis illa ion ne wo ks a e used ha a e ained by adap i e a iables o he algo i hm Q-lea n [47] and he e a e also app oaches using gene a i e ad e sa ial neu al ne wo ks (GAN) [17, 20]. 2.2. Goals 11 Human eedback: Ano he app oach o imi a e playe s in ol es biasing lea - ning di ec ly using he eedback p o ided by he playe s. Tha is, models a e ained wi h eal games and a e obse ing he ac ions pe o med, hei beha- io is e alua ed. Subsequen ly, he playe s can make indica ions o changes ha modi y he agen ’s beha io in a gi en si ua ion, hus biasing u u e lea - ning. This me hod, also known as in e ac i e lea ning om demons a ions, allows AI sys ems o mimic and adap o he p e e ences and nuances o human playe s al hough i equi es cons an moni o ing [10, 33, 32]. 2.2. Goals Wi h his p ojec we aim o: O1 Collec , clean and publish a da ase o Wo dle games. O2 Analyze he games and he ocabula y used in hem. O3 Find pa e ns in he analyzed da a, especially hose co esponding o di e en ypes o playe s. O4 C ea e p og ams capable o imi a ing he di e en ypes o playe s ound O5 Compa e he esul s o he models wi h eal games. O6 E alua e he a ious models gene a ed and ob ain da a on hei lea ning and he use s hey a emp o model. O7 Unde s and he playe base, in pa icula he ela ionship o playe pe o man- ce and ocabula y, as well as he s a egies employed. O8 Cha ac e ize playe s acco ding o he pa e ns ound and hei in e ed oca- bula y. O e all, his p ojec seeks o p o ide aluable in o ma ion on playe beha io and cha ac e ize he playe . 2.3. Wo k plan In o de o achie e he objec i es desc ibed in he p e ious sec ion, i has been ag eed o hold mee ings e e y wo weeks be ween he au ho and he di ec o o he wo k. Conside ing he abo e, he ollowing miles ones ha e been es ablished o o ganize he wo k o be done in his p ojec : Da a collec ion (F om Oc obe 5 o Oc obe 19, 2022) Da a cleaning (F om Oc obe 19 o No embe 16, 2022) Explo a o y da a analysis (F om No embe 16 o Decembe 8, 2022) 18 Capí ulo 3. T abajos elacionados 3.3.1. Algo i mo gené ico pa a Mas e mind Los algo i mos gené icos han o ecido una isión nue a al p oblema de esol- e Mas e mind y es o ha lle ado a la c eación de modelos que a an minimiza el núme o in en os po debajo del lími e es ablecido po Knu h. A con inuación se p esen an los di e sos pa áme os empleados po Be ghman, Goossens y Leus pa a gene a un decodi icado con una media de in en os in e io al algo i mo de Knu h [4], la es uc u a de es e se de ine en el pseudocódigo 1 donde el conjun o de a- lo es posibles en cada in en o se ep esen a como ˆ Eiy donde se añaden dos ases adicionales al p oceso de mu ación: la pe mu ación y la in e sión. Algo i mo 1: Algo i mo gené ico pa a Mas e mind i←1; Fija y e alua selección inicial pa a g1; Ob ene espues a X1eY1; while Xi=Pdo i←i+ 1; ˆ Ei← {}; h←1; Inicializa población; while h≤maxgen AND |ˆ Ei| ≤ maxsize do Gene a nue a población median e el c uce de indi iduos; Aplica las unciones de mu ación, pe mu ación e in e sión a los indi iduos; Calcula el alo de i ness; Añadi combinaciones posibles a ˆ Ei; h←h+ 1; end while E alua gi∈ˆ Ei; Ob ene espues a XieYi; end while Rep esen ación c omosómica: Los indi iduos de cada gene ación se ep e- sen an como una lis a de lis as de cua o núme os na u ales del uno al seis que ep esen an cada uno de los colo es del código, cada lis a del indi iduo se co esponde con un in en o. La p ime a lis a de cada indi iduo se inicializa con una combinación alea o ia. Núme o de indi iduos po gene ación: Cada gene ación posee cien o cincuen a indi iduos. Función de i ness: Pa a calcula el alo de i ness del código cdel úl imo in en o de un indi iduo se deben conside a los alo es de i ness de sus in en os an e io es giy de e mina el núme o de ichas neg as X′ i(c)y ichas blancas Y′ i(c)que se hubie an ob enido si el código sec e o hubie a sido gicon los alo es ealmen e ob enidos Xi(C)yYi(c). A p io i pod ía pa ece que se debe ía da un mayo peso a las ichas neg as pues el obje i o del juego es 3.4. Modelado de jugado es 19 ob ene cua o de ellas, no obs an e como solo se comp ueban combinaciones álidas (según las ichas ob enidas en los in en os an e io es) las ichas de colo es ue a de luga apo an in o mación ele an e en los conjun os educidos. En pos de gene aliza la unción al máximo, se incluye un ac o a > 0que mul iplica a las di e encias de ichas neg as. Pa a e mina , se añade un é mino Pp opo cional al núme o de in en os y un peso bque de e mina la impo ancia ela i a de es e é mino con espec o a las di e encias de las ichas ob enidas. Resul an emen e, la unción en unción de la combinación cy el núme o de in en o ise puede ep esen a median e la ó mula 3.2. (c;i) = a  i X q=1   X′ q(c)−Xq(c)    + i X q=1   Y′ q(c)−Yq(c)  +bP(i−1) (3.2) C uce: T as la gene ación del alo de i ness se ealiza un c uce de uno o dos pun os (cada opción con una p obabilidad de 0,5) sob e los indi iduos, la p obabilidad de selección de un indi iduo es p opo cional a su alo de i ness. Mu ación: Con una p obabilidad del 0,03, después de e mina el c uce se ealiza una mu ación que modi ica alea o iamen e el colo de una posición. Pe mu ación: Con una p obabilidad del 0,03, después de in en a ealiza una mu ación se pueden pe mu a la posición de dos colo es de la ep esen ación del indi iduo. In e sión: Con una p obabilidad de 0,02, después de in en a ealiza una in e sión se pueden selecciona alea o iamen e dos posiciones y la secuencia comp endida en e es as se in ie e. Eliminación de in iduos: Si as el p oceso de c uce, mu ación, pe mu a- ción e in e sión el código esul an e ya igu a en la nue a población, es e es desca ado. 3.4. Modelado de jugado es Las aplicaciones de la IA que más nos in e esan en es e p oyec o son las de imi- ación de jugado es. La capacidad de simula y eplica el compo amien o humano no es ácil, y en la mayo ía de casos esul a incluso más complicado que a a de e- sol e óp imamen e el juego [38]. A pesa de es o, exis en múl iples ap oximaciones a es e p oblema que de allamos a con inuación: 3.4.1. DQN Las Deep Q-lea ning ne wo ks son un ipo de algo i mo que p esen a un en o- que inno ado que combina edes neu onales p o undas y ap endizaje po e ue zo pa a log a un compo amien o igual o supe io al humano en un en o no complejo de e minado [35]. 20 Capí ulo 3. T abajos elacionados La idea p incipal de ás del algo i mo es el ap endizaje di ec o a pa i de una en ada senso ial en c udo, como imágenes o ídeos, sin ningún conociemien o p e- io y que los agen es omen decisiones y ealicen acciones en en o nos complejos. Pa a ap oxima la unción Q, que ep esen a las ecompensas u u as espe adas pa- a cada acción en un es ado dado se u iliza una ed neu onal p o unda. Al es ima la unción Q, un agen e puede de e mina la mejo acción a oma en un es ado pa icula pa a maximiza su ecompensa acumulada a lo la go del iempo. A con inuación desc ibimos los mecanismos y elemen os empleados po el algo i mo: Expe ience eplay: El agen e almacena sus expe iencias (que consis en en es- ado, acción, ecompensa y siguien e es ado) en un bú e de epe ición. Luego, es e bú e se mues ea alea o iamen e du an e el p oceso de ap endizaje pa a ompe las co elaciones empo ales y mejo a la e iciencia del ap endizaje. Red neu onal p o unda: DQN u iliza una ed neu onal p o unda, no mal- men e una ed neu onal con olucional (CNN), como un ap oximado de un- ciones. La ed oma el es ado ac ual como en ada y p oduce un alo -Q pa a cada posible acción. La ed se en ena pa a minimiza la di e encia en e los alo es-Q p edichos y los alo es-Q obje i o. Red obje i o: Pa a es abiliza el p oceso de ap endizaje, DQN in oduce una ed obje i o sepa ada, que es una copia de la ed p incipal. La ed obje i o se ac ualiza pe iódicamen e con los pesos de la ed p incipal pe o no con la misma ecuencia, p opo cionando un obje i o consis en e en el iempo pa- a la es imación de los alo es-Q man eniendo la a ención del modelo en los obje i os p incipales. Explo ación s. Explo ación: DQN equilib a la explo ación (p oba nue as acciones) y la explo ación (u iliza el conocimien o ac ual pa a maximiza las ecompensas). Es o se log a ípicamen e median e una polí ica ϵ-g eedy, donde el agen e elige una acción alea o ia con una cie a p obabilidad ϵy selecciona la acción con el alo -Q p edicho más al o en caso con a io. Al mejo a i e a i amen e la es imación de la unción Q a a és del p oceso de en enamien o, DQN pe mi e que el agen e imi e el compo amien o de su en ada senso ial y ambién es capaz de desa olla es a egias óp imas o casi óp imas pa a un en o no dado. DQN ha log ado éxi os des acados, como domina a ios juegos de A a i 2600 y log a un endimien o humano en dominios complejos [35, 36]. Si bien en un comienzo se ha u ilizado pa a c ea jugado es óp imos, la imi ación de jugado es apa ece cada ez más en es e ipo de algo i mos, ya sea como el obje i o inal del abajo [52] o como u ilidad pa a acele a el ap endizaje en las p ime as e apas de un modelo de jugado óp imo [39]. 3.4.2. Ap endizaje po e ue zo p o undo a pa i de p e e- encias humanas El ap endizaje po e ue zo p o undo a pa i de las p e e encias humanas es p o- ceso que pe mi e a un agen e ap ende a pa i de la e oalimen ación o p e e encias 3.4. Modelado de jugado es 21 humanas en luga de las señales de ecompensa adicionales en el ap endizaje po e ue zo [10]. En muchos escena ios del mundo eal, puede esul a desa ian e o consumi mu- cho iempo diseña una unción de ecompensa que cap u e de mane a p ecisa el compo amien o deseado. En es e mé odo, se u ilizan e aluado es humanos que p o- po cionan compa aciones bina ias o clasi icaciones de di e en es ayec o ias o ac- ciones, indicando sus p e e encias al agen e que se desea en ena . A con inuación p esen amos los mecanismos y componen es p incipales de es os algo i mos: Re oalimen ación basada en compa aciones: En luga de p opo ciona ecompensas explíci as, los e aluado es humanos b indan p e e encias en e pa es de ayec o ias o acciones. Po ejemplo, pa a compa a dos es a egias de conducción di e en es o elegi la mejo acción en una si uación de e mina- da. Es a e oalimen ación basada en compa aciones se u iliza pa a guia el p oceso de ap endizaje. Ag egación de la e oalimen ación humana: La e oalimen ación hu- mana se debe adap a como una única señal de ecompensa o polí ica. Un en- oque posible consis e en en ena un modelo de ecompensa u ilizando ap en- dizaje supe isado pa a p edeci los juicios de p e e encia de los e aluado es humanos. Es e modelo de ecompensa se u iliza jun o con el ap endizaje po e ue zo pa a op imiza el compo amien o del agen e. Ap endizaje de ecompensa ad e sa ial: Se u iliza un en oque ad e sa ial en el que se en ena un modelo de ecompensa que compi e con a un segundo modelo llamado polí ica de compo amien o. La polí ica de compo amien o iene como obje i o gene a ayec o ias que sean di íciles de clasi ica co ec- amen e po el modelo de ecompensa. Median e ac ualizaciones i e a i as de ambos modelos, el agen e puede ap ende una polí ica op imizada basada en las p e e encias humanas. E aluación del endimien o: Pa a e alua el endimien o de la polí ica ap endida se debe ealiza una compa ación con la polí ica de compo amien o y, además, u iliza e oalimen ación adicional de los e aluado es humanos. Es e en oque iene aplicaciones en di e sos campos donde esul a desa ian e de i- ni explíci amen e una unción de ecompensa, como la conducción au ónoma, la obó ica y los sis emas de ecomendación pe sonalizados. Al in oluc a a los e alua- do es humanos en el p oceso de ap endizaje, se ayuda a ce a la b echa en e los algo i mos de ap endizaje au omá ico y las p e e encias humanas, lo que conduce a compo amien os más in ui i os, deseables y humanos. 22 Capí ulo 3. T abajos elacionados 3.4.3. Ap endizaje po imi ación a a és de la es imación de polí icas de apoyo expe as El ap endizaje po imi ación a a és de la es imación de polí icas de apoyo expe as es un en oque no edoso pa a el ap endizaje po imi ación, una ama del ap endizaje au omá ico en la que un agen e ap ende a imi a el compo amien o de un expe o obse ando sus demos aciones [47]. En el ap endizaje po imi ación adicional, el agen e ap ende di ec amen e de las demos aciones del expe o minimizando la disc epancia en e sus p opias acciones y las acciones del expe o. Sin emba go, es e en oque iene limi aciones, como el p oblema del cambio co a ian e, donde la dis ibución de es ados encon ados po el agen e du an e el en enamien o puede di e i de las demos aciones del expe o. Es o puede lle a a un endimien o subóp imo. Pa a abo da es e p oblema, se p opone un mé odo que es ima la polí ica del ex- pe o, que ep esen a la p obabilidad de que el expe o ome acciones especí icas en di e en es es ados. Al es ima es a polí ica, el agen e puede adap a se mejo a di e en es es ados e imi a de mane a más p ecisa el compo amien o del expe o. De allamos los mecanismos y componen es más impo an es de es e mé odo: Es imación del sopo e de la polí ica del expe o: El mé odo se cen a en es ima la polí ica del expe o, que ep esen a la dis ibución de p obabilidad de las acciones en unción de los di e en es es ados. Es a es imación se ealiza u ilizando un modelo de ecompensa, que p edice la ecompensa acumulada espe ada al oma una acción especí ica en un es ado dado, y un modelo de azón de densidad, que es ima la densidad ela i a de las acciones del expe o en compa ación con las acciones del agen e. Clonación de compo amien o con sopo e: Se combina la clonación de compo amien o, una écnica en la que el agen e imi a di ec amen e las ac- ciones del expe o, con el sopo e de la polí ica es imado. La clonación de compo amien o se u iliza pa a en ena la polí ica del agen e pa a imi a al expe o. Al inco po a el sopo e de la polí ica es imado, el agen e puede ene en cuen a las di e encias en el compo amien o en e el expe o y el agen e, lo que mejo a el endimien o gene al de la imi ación. Ap endizaje de imi ación ad e sa ial: Se u iliza una a ian e ad e sa ial que implica en ena una ed disc imina o ia que iene como obje i o dis in- gui en e las acciones del expe o y las acciones del agen e. La polí ica se en ena pa a maximiza el e o del disc iminado , engañándolo e ec i amen e e imi ando el compo amien o del expe o. Es e mé odo p opues o supe a a los en oques adicionales de clonación de com- po amien o, especialmen e en escena ios con cambio co a ian e. El sopo e de la polí ica es imado ayuda al agen e a adap a se a di e en es es ados, lo que esul a en una mejo a en el endimien o de la imi ación. Cap´ ı ulo 4 Recopilación y limpieza de las pa idas Como p ime paso de es e p oyec o, al y como se de alló en la plani icación, se p ocede a ecopila pa idas publicadas en Twi e . La ecopilación de wee s puede se una excelen e mane a de ob ene da os pa a un p oyec o de ciencia de da os, ya que pe mi e a los in es igado es accede a una g an can idad de con enido gene ado po los usua ios. La API de Twi e b inda a los desa ollado es acceso y pe misos especiales a la pla a o ma, incluidos wee s, pe iles de usua io y mé icas de pa ici- pación. Sin emba go, ecopila wee s pa a un p oyec o de ciencia de da os equie e una cuidadosa conside ación de cues iones é icas y legales, como la p i acidad del usua io, la p opiedad de los da os y los é minos de se icio de Twi e . Además, la calidad y la ele ancia de los da os ecopilados deben e alua se cuidadosamen e pa a ga an iza que se alineen con los obje i os y la me odología de la in es igación. Po ello conside amos ele an e explici a el p oceso de ob ención así como la ma- nipulación ealizada pos e io men e y así acili a la comp ensión del conjun o con el que se abaja á en los capí ulos pos e io es. 4.1. Recopilación de los wee s Pa a pode ealiza una ecopilación au oma izada de los wee s, en p ime lu- ga se deben ija los p e equisi os que los es os debían cumpli . En es e p oyec o nos cen a emos únicamen e en las pa idas en inglés publicadas en e los días 1 de ene o y el 15 de no iemb e de 2022. La imagen 4.1 mues a el o ma o de los wee s álidos, como podemos comp oba , es os degen con ene la abla con los cuad ados co espondien es al eedback ob enido, en núme o de in en os y el iden i icado de pa ida. Pa a conc e a el c i e io pa a ecolec a un wee u ilizamos el o ma o de inido po Wo dle pa a compa i una pa ida que especi icamos a con inuación: la p ime- a ase sigue la siguien e exp esión egula : Wo dle [0-9]{3} [1-6,X]/6 donde el p ime bloque de nume os después de la palab a Wo dle hace e e encia al núme o de juego (que aumen a en uno cada día) y el segundo bloque hace e e encia al núme o de in en os en los que se ha inalizado la pa ida (en caso de pe de la pa ida se coloca una equis mayúscula pa a en luga de un dígi o). Es a p ime a exp esión es 23 24 Capí ulo 4. Recopilación y limpieza de las pa idas Figu a 4.1: Ejemplo de wee s ecopilados p ecedida po an as líneas como in en os ealizados que con ienen cinco cuad ados de es colo es dis in os: e de, ama illo o neg o. Al depende del núme o de in en os, no podemos gene a una exp esión egula pa a ellas in e p e able po el buscado de Twi e [44] y po lo an o ecopila emos los wee s que con engan solamen e la p ime a exp esión egula . El p oceso de au oma ización se ha ealizado median e la lib e ía snsc ape de Py hon que implemen a el módulo snsc ape.modules. wi e que pe mi e ea- liza búsquedas y ecopilaciones de wee s de mane a ela i amen e simple. Es as búsquedas se han con igu ado de mane a que de cada día en nues a anja em- po al de explo ación ex aiga has a cinco mil wee s de cada uno de los in en os, es deci , que de cada día ex aiga a lo sumo ein a y cinco mil wee s. Pa a ace- le a es e p oceso de ecopilación, se ha pa alelizado el abajo median e la lib e ía mul ip ocessing y ambién se han di idido los da os en paque es co espondien es a días. De cada wee se gua da la siguien e in o mación: Fecha y ho a de publicación o iginal. Twee Id, un ID p opia de la pla a o ma que es único pa a cada wee publi- cado po un usua io. Tex o del wee , que debe con ene la exp esión egula de inida an e io - men e. Nomb e de usua io: indica el nomb e del au o . URL con el enlace al wee público, es posible que algunos ya no es én dispo- nibles ya que en cualquie momen o una cuen a puede decidi bo a u ocul a sus wee s. 4.2. Limpieza de los da os 25 Figu a 4.2: Fo ma o de ini i o de los da os con el nomb e de usua io ocul o 4.1.1. Ex acción de las a iables T as ob ene las a iables en c udo hemos p ocedido a p ocesa las pa a ex ae la in o mación necesa ia de cada una. Sal o po el ex o del wee , el es o de a iables p opo cionadas po snsc ape no equie en ningún a amien o p e io. Pa a ex ae los da os de las pa idas hemos u ilizado la lib e ía e de Py hon que nos pe mi e analiza y manipula s ings median e exp esiones egula es, en nues o caso hemos u ilizado una expe sión que encon aba odas las cadenas de cinco cuad ados de colo es den o de un wee y hemos colocado cada apa ición en un a ay que es el alo que hemos u ilizado en abla de da os. Además hemos gua dado el ex o o iginal po edundancia, una ez ex aídos los in en os hemos gene ado una a iable ex a que con iene el núme o de in en os de la pa ida, que se co esponde con la longi ud del a ay ob enido. En la igu a 4.2 podemos e el o ma o de ini i o. 4.2. Limpieza de los da os Realiza la limpieza de da os es un paso c ucial en cualquie p oyec o de análisis de da os, incluido el análisis de wee s sob e juegos de Wo dle. Twi e es una pla- a o ma con un con ol de con enido ela i amen e pequeño, lo que puede esul a en da os uidosos, i ele an es o engañosos. La limpieza de da os es el p oceso de iden i ica y co egi o elimina e o es, inconsis encias e imp ecisiones en los da os pa a mejo a su calidad y con iabilidad. En el con ex o del análisis de wee s sob e juegos de Wo dle, la limpieza de da os puede ayuda a elimina spam,bo s, wee s i ele an es y pa idas engañosas. Al ealiza es a limpieza nos asegu a emos de que los da os que u ilizamos pa a el análisis son p ecisos, consis en es y ep esen a i os, lo que puede gene a conocimien os más con iables y p ocesables. 4.2.1. Eliminación de pa idas con o ma o inco ec o A pa i de las a iables gene adas en el apa ado an e io , hemos p ocedido a elimina las pa idas que p esen aban las siguien es disc epancias: Se han eliminado odas las en adas cuyo núme o de in en os no coincidía con el núme o de cadenas encon adas, Se han eliminado aquellas pa idas ales que supues amen e se ha ganado la pa ida pe o no e minan con cinco cuad ados e des. 26 Capí ulo 4. Recopilación y limpieza de las pa idas Núme o de wee s inicial 7.102.548 Núme o de pa idas con disc epancias en e los in en os 147.085 Pa idas ganadas con disc epancias en el alo inal 278 Pa idas pe didas con disc epancias en alo inal 998 Pa idas con una ic o ia en una posición in álida 116 Twee s es an es as la limpieza p elimina 6.954.106 Tabla 4.1: Núme o de pa idas eliminadas po el p oceso de limpieza p elimina Se han eliminado las pa idas que supues amen e se habían pe dido pe o sí e minaban con cinco cuad ados e des. Se han eliminado las pa idas que con enían cinco cuad os e des en una po- sición dis in a a la inal, ya que una ez se ha ganado no se puede segui jugando. Finalmen e, se han con e ido odos los cuad ados de colo neg o en cuad ados de colo blanco pa a es anda iza la en ada. La p esencia de la di e encia de colo es es debida a la posibilidad de usa el modo noche al juga , es e hace modo únicamen e modi ica el colo de los cuad ados sin comple a en el ex o a compa i . En la abla 4.1 analizamos el núme o de en adas que se han eliminado en cada pa e del p oceso de limpieza. 4.2.2. Eliminación de pa idas alseadas Con el abajo de la sección 4.2.1 hemos podido elimina de nues o conjun o de da os aquellos wee s que cla amen e no se ajus aban al o ma o de las pa i- das de Wo dle usuales, no obs an e, es a me odología no pe mi e encon a aquellas pa idas alseadas, es deci , aquellas que con ienen códigos de colo es imposibles de gene a con la palab a obje i o del día. Es e ipo de pa idas no son ep esen a i as de los da os que que emos analiza y, po ello, una limpieza más minuciosa es pe - inen e. Pa a pode ealiza es o hemos gene ado un algo i mo que imi a el uncionamien o del juego y que además es capaz de gene a odas las posibles combinaciones de cuad ados de colo es que se pueden ob ene a pa i de un conjun o de palab as álidas y una palab a obje i o. Seguidamen e se ha gene ado un conjun o que con enga odas las palab as que el juego admi e como en ada a pa i del documen o que se encuen a en [43]. Tam- bién se ha gene ado una abla con la co espondencia en e el id de pa ida y la palab a obje i o co espondien e a es e, es a in o mación se ha ob enido a pa i de la siguien e uen e [1]. Cabe des aca que desde la adquisición del juego po pa e de pe iódico The New Yo k Times no exis en egis os o iciales de la palab a del día ni ampoco de las palab as de en ada álidas, po an o la iabilidad de es os conjun- os, especialmen e del segundo puede se cues ionada, pese a es o hemos u ilizado como uen e páginas web popula es y que conside amos iables. 4.2. Limpieza de los da os 27 Figu a 4.3: Núme o de pa idas imposibles encon adas en e los id 480 y 515 Pese al uso de páginas iables hemos p e e ido analiza el núme o de pa idas alsea- das pa a cada día pa a a a de encon a algún en nues os conjun os de palab as obje i o. Pa a ello se ha pasado a gene a el conjun o de odas las posibles espues as pa a cada palab a obje i o según el id de las pa idas p esen es en nues o conjun o de da os. Finalmen e, pa a cada wee se ha comp obado si odas las espues as de su pa ida co espondien e pe enecían al conjun o de espues as posibles pa a esa palab a del día. Una ez se han iden i icado las pa idas p oblemá icas se ha p ocedido a analiza la dis ibución de es as. Al hace lo encon amos un único un alo a ípico muy des acado en el id 507 ya que en es e se encuen an ap oximadamen e el 25 % de odas las pa idas e óneas. El g á ico esul an e es demasiado amplio como pa a p esen a lo y, po ello, en la igu a 4.3 solo mos amos la sección donde se encuen a el alo a ípico. Al indaga en es a pa ida podemos obse a de que la palab a obje i o es sna l, que pa ece se complicada de adi ina en is a de su al o con enido de consonan es, no obs an e, es o no nos pa ece su ien e pa a explica es e no able aumen o en el núme o de pa idas alseadas. Al segui in es igando ace ca sob e es a p oblemá ica nos pe ca amos de que es as pa idas da an del 8 de no iemb e de 2022. Al busca no icias elacionadas con Wo dle sob e es as echas encon amos que el día an e io se habían anunciado cambios en el conjun o de palab as suje as a se palab a del día po pa e de la nue a compañía p opie a ia del juego [28]. Es o nos mo i ó a e alua la posibilidad de que la palab a que igu aba como palab a del día en nues a lis a no ue a la co ec a. T as consul a a ias páginas que ecolec aban las pa idas dia ias y encon a un g an núme o de disc epancias con la palab a obje i o con id 507 decidimos que e a muy p obable que la que habíamos omado no ue a la que e dade amen e se eligió ese día. T as p oba a ias combinaciones, decidimos usa la palab a spell que igu aba en 34 Capí ulo 5. Análisis de las pa idas Figu a 5.4: Dis ibución del núme o de le as ue a de luga po in en o Figu a 5.5: P opo ción de le as ue a de luga po in en o 5.1.3. Tasa de le as en una posición equi ocada De mane a simila a la que hemos p ocedido en la sección 5.1 p ocedemos a analiza la dis ibución del núme o de le as ue a de luga (cuad ados ama illos). En los g á icos 5.4 y 5.5 podemos e que el la dis ibución iende a se dominada po la can idad ce o a medida que aumen a el núme o de in en os lo cuál concue da con el la noción de que a una ez se conocen odas o la mayo ía de las le as de la palab a, los jugado es a an de ealiza combinaciones con es as has a gana , lo cual explica la disminución an acele ada que se da, especialmen e a pa i del 5.1. Dis ibución de las a iables de juego 35 in en o núme o 3. Cabe desca aca ambién que, a di e encia de la dis ibución de los acie os, en es e caso odas las dis ibuciones ienen una endencia dominan e cla a y las mayo es dis inciones se dan en los in en os 1 y 2 y es os p esen an cla as simili udes en e ellos. Figu a 5.6: Dis ibución del núme o de allos po in en o Figu a 5.7: P opo ción de allos po in en o 36 Capí ulo 5. Análisis de las pa idas Figu a 5.8: Media de acie os, allos y le as ue a de luga 5.1.4. Tasa de allos Seguimos aho a con el análisis de la dis ibución del núme o de allos (cuad ados neg os) de las pa idas que es amos es udiando. En los g á icos 5.6 y 5.7 podemos e que el núme o de allos disminuye a medida que aumen a el núme o de in en os, como podíamos imagina ya que la dis ibución de los allos debe se p ác icamen e opues a a la de los acie os. Des aca la he e ogeneidad de las dis ibuciones sal o las de los in en os 5 y 6 lo cúal con as a con el núme o de le as ue a de luga pe o esul a simila a las del núme o de acie os. 5.1.5. E olución de las medias Finalmen e analizamos la dis ibución de las medias de cada una de las asas p esen adas en las secciones an e io es, p e endemos analiza el c ecimien o y dec e- cimien o de es os alo es ya que pod ían se usados como a iables pa a ca ac e iza a los jugado es. En la igu a 5.8 podemos e cla amen e que el núme o de acie os iene un c ecimien o p ác icamen e lineal que disminuye su pendien e en el in en o 3, algo que pa ece e o za la hipó esis de que es un conjun o de in e és pa a nues o abajo. La media de allos y le as ue a de luga es cla amen e dec ecien e, cabe des aca que la dis ibución de los allos disminuye su pendien e ambién en el in en- o 3, lo cuál es de espe a daba la co elación en e es a y la dis ibución de acie os. Resul a so p enden e el bajo alo que oma la dis ibución de las le as ue a de 5.2. Análisis según la palab a obje i o 37 luga , pues es á aco ada p ác icamen e po 1 y iene un dec ecimien o mucho más len o que el es o, es o indica que la mayo ía de jugado es ob iene una le a en una posición inco ec a y a lo la go de sus in en os la coloca en una posición co ec a y ob iene o a nue a le a en una posición e ónea, dado el aumen o cons an e de los acie os. 5.2. Análisis según la palab a obje i o Con inuamos nues o análisis aho a a ando de encon a elaciones en e los da os de las pa idas y su palab a obje i o. Es o nos pe mi i á gene a nue as a- iables que posiblemen e con engan in o mación ele an e a la ho a de encon a di e encias en e jugado es. 5.2.1. Dis ibución de las pa idas según su du ación P ocedemos a analiza el núme o de pa idas según su palab a obje i o y conside- ando su du ación y compa ándola con la du ación media. Es e análisis es necesa io pa a asegu a la uni o midad de los da os disponibles an o en ep esen a i idad de cada palab a obje i o así como de a iabilidad de pa idas. Los esul ados han sido los espe ados: la dis ibución no p esen a ningún alo anómalo, sí ap eciamos una endencia hacia la disminución del núme o o al de pa idas a media que inc emen- a la echa de las pa idas pe o no es es adís icamen e signi ican e y se asocia a la pé dida g adual de popula idad del juego. En la igu a 5.9 podemos e una mues a de es a dis ibución donde las ba as ojas ep esen an las pa idas con un núme o de in en os po encima de la media y las azules las que se encuen an po debajo. Obse amos la uni o midad de los da os y la lige a p edominancia de pa idas más co as. Figu a 5.9: Mues a de 45 elemen os del núme o de pa idas po palab a obje i o y según su du ación 38 Capí ulo 5. Análisis de las pa idas 5.2.2. Di icul ad de las palab as P ocedemos a e alua la complejidad de cada palab a basándonos en la longi ud media de las pa idas que la ienen como obje i o. Calculando la media de la longi ud de odas las pa idas y compa ándola con la de cada palab a, pod emos es ablece un c i e io simple pa a dis ingui si una palab a es ácil o di ícil, si la media de sus pa idas es in e io a la media global la clasi icamos como ácil y en caso con a io como di icil. En la igu a 5.10 podemos e es a ca ac e ización pa a un conjun o educido de palab as obje i o, donde las ba as ojas ep esen an las di íciles y las azules las áciles. Desca amos que la media global de in en os se encuen a en 4,2, que la endencia gene al de la dis ibución de la di icul ad no p esen a ningún pa ón cla o y que la apa ición de palab as áciles y di íciles no pa ece ene elación con ninguna a iable. Figu a 5.10: Mues a de 45 elemen os de la media de in en os po palab a obje i o En la abla 5.3 mos amos las cinco palab as más di íciles y las 5 más áciles jun o a la media de in en os de sus pa idas co espondien es, des acamos que odas las palab as áciles con ienen al menos dos ocales y no p esen an le as epe idas sal- o en el caso de TREAT, además son ecuen es en el lenguaje, po o a pa e las di íciles p esen an dos o más le as epe idas en odos los casos sal o en la palab a GAWKY y con ienen únicamen e una ocal sal o en el caso de PARER, además ecuencia de odas ellas en el lenguaje coloquial es educida. 5.2. Análisis según la palab a obje i o 39 Palab ás más áciles Media Palab as más di íciles Media TRAIN 3,283 PARER 5,514 RAINY 3,449 MUMMY 5,389 DREAM 3,471 COYLY 5,241 ALIEN 3,477 GAWKY 5,028 TREAT 3,525 DANDY 4,920 Tabla 5.3: Palab as con meno y mayo media de in en os Es a in o mación nos esul a á ú il a pa a ca ac e iza los g upos que encon emos en la ase de clús e ing y ambién pe mi i án e alua a los agen es que c ea emos en apa ados pos e io es. Cap´ ı ulo 6 Tipos de jugado es En es e apa ado a a emos de clasi ica a los di e sos jugado es p esen es en el conjun o de da os ecolec ado. Pa a ello los ag upa emos según el iden i icado de usua io, que es un alo único y pe mi e dis ingui inequí ocamen e a cada jugado y es udia emos las pa idas que haya ealizado. A con inuación gene a emos a iables a pa i de es os da os que u iliza emos pa a ca ac e iza los, aplica emos algo i mos de clús e ing pa a ob ene clases de jugado es, e alua emos los esul ados u ilizando dis in as mé icas. Finalmen e a a emos de ca ac e iza a los g upos ob enidos median e un análisis de las a iables que esul en más ele an es. 6.1. Dis ibución del núme o de pa idas de cada jugado El p ime paso pa a ob ene la clasi icación de jugado es es el de ag upa pa - idas. Necesi amos conoce el núme o de usua ios dis in os que poseemos así como la dis ibución del núme o de pa idas del que disponemos de cada uno, es a in o - mación queda esumida en la abla 6.1, en ella podemos in ui que nos encon amos an e una dis ibución muy sesgada hacia la de echa pues o que los dos p ime os cua iles con inen únicamen e jugado es con una o dos pa idas pe o alcanzando el máximo en 295. Además la des iación ípica es de un o den de magni ud supe io a los es cua iles y eso indica que exis i á una g an a ianza de los alo es más alla del e ce cua il. Es o queda explici ado en la igu a 6.1 donde podemos e el ex emo sesgo de la dis ibución. En a as de ealiza un es udio ealis a y es adís icamen e ele an e de los da os hemos decidido es ablece un umb al en el núme o mínimo de pa idas de los usua- ios pa a ene su icien es da os pa a analiza el es ilo de juego del jugado . Po es o hemos omado el umb al más ce cano a la media de la dis ibución y, consecuen e- men e, lo hemos si uado en sie e pa idas. El núme o de jugado es se e educido de mane a impo an e en el subconjun o, pasamos de casi un millón a menos de 154,000. Po o a pa e la media de pa idas pasa a ele a se eno memen e y se si úa en las 33,72 pa idas y la des iación ípica pasa a es a en el mismo o den de mag- 41 42 Capí ulo 6. Tipos de jugado es ni ud que la media, al y como podemos ap ecia en la abla 6.2. A pesa de es a mejo ía, la dis ibución segui á es ando ue emen e sesgada a la de echa aunque en la igu a 6.2 podemos ap ecia la educción de es e enómeno no ablemen e. En base a las simili ud de las dis ibuciones y de la can idad de da os p esen es en el subconjun o lo conside amos su icien emen e ele an e y p ocede emos a u ili- za lo en los siguien es apa ados como conjun o base pa a ealiza clús e ing. Pa a e mina p esen amos la dis ibución en escala loga í mica en la igu a 6.3 donde podemos ap ecia mejo como se epa en los alo es. Obse amos que el sesgo a la de echa es impe an e. Es imado es de la dis ibución del núme o de pa idas Nºde usua ios 977.510 Media 7,035 Des iación ípica 19,436 Mínimo 1 Máximo 295 25 % 1 50 % 2 75 % 4 Tabla 6.1: Es imado es de la dis ibución del núme o de pa idas po jugado Figu a 6.1: Dis ibución del núme o de pa idas po jugado Es imado es de la dis ibución del subconjun o de jugado es Nºde usua ios 153.893 Media 33,721 Des iación ípica 39,262 Mínimo 7 Máximo 295 25 % 10 50 % 17 75 % 37 Tabla 6.2: Es imado es de la dis ibución del núme o de pa idas pa a jugado es con sie e o más pa idas Figu a 6.2: Dis ibución pa a jugado es con sie e o más pa idas 6.2. Gene ación de las a iables pa a el ag upamien o 43 Figu a 6.3: Dis ibución del subconjun o de jugado es con 7 o más pa idas en escala loga í mica 6.2. Gene ación de las a iables pa a el ag upamien- o Dada la na u aleza de los da os p esen es en nues o conjun o, esul a complica- do aplica les algún algo i mo de clús e ing. Debido a es o, debemos gene a a iables in e p e ables po los dis in os mé odos basadas en los conocimien os que hemos ob- enido al ealiza el análisis p e io. Además, dado el obje i o de clasi ica jugado es, deno amos ambién la ele ancia de gene a a iables elacionadas con las mé icas empleadas pa a e alua los, oma emos como e e encia las que u iliza el pe iódico The New Yo k Times en su bo o icial [25] y, consecuen emen e, ha emos incapié en la media de in en os de las pa idas de cada jugado e in en a emos ap oxima el po cen aje de disminución del espacio de soluciones dado po cada palab a que in oduce. Comenza emos gene ando las a iables que podemos ob ene más ácilmen e a pa i de los da os que poseemos. Longi ud media de pa ida: Gene amos una a iable que con iene la lon- gi ud media de las pa idas de cada jugado p esen e en el conjun o de da os. Es a a iable pe mi e e alua ácilmen e a un jugado ya que den o de las mé icas de e aluación del endimien o, es a es la más u ilizada y ácilmen e econocible. Nos e e i emos a ella como mean_leng h. Media de pa idas pe didas: Pa a usua io calculamos el po cen aje de pa idas que ha pe dido. Añadimos es a mé ica pa a complemen a la longi ud media ya que es a no iene en cuen a si un juego de longi ud seis ha esul ado en ic o ia o de o a. Además ambién puede ayuda a ca ac e iza jugado es 50 Capí ulo 6. Tipos de jugado es Figu a 6.9: Longi ud media de las pa idas según la ag upación po clús e s Figu a 6.10: Núme o de acie os en el e ce in en o según la ag upación po clús e s media de sus pa idas, no obs an e si es udiamos la dis ibución de las medias de acie os, le as ue a de luga y allos de los es g upos, p esen es en los g á icos de la igu a 6.11 podemos e una cla a di e enciación en e los es, que se e acen- úa e ce in en o. C eemos que es as g á icas pe mi en ap ecia el desa ollo de las pa idas y el es ilo de juego de los g upos encon ados así como las di e encias en e es os, po ejemplo, el g upo 1 suele educi su núme o de e o es en una unidad po cada dos in en os y ob eniendo una media de una le a en posición inco ec a en los es p ime os in en os; el g upo 2 en cambio educe su núme o de allos en una unidad po in en o y, a su ez, ob iene educe muy ápidamen e la p esencia le as en una posición e ónea. Es o sugie e que los jugado es del g upo 1 en los p ime os in en os u ilizan palab as muy simila es en e sí y ob ienen esul ados malos en los p ime os in en os mien as que, el g upo 2, u iliza palab as que man ienen las le- as co ec as en su posición pe o a ían el es o de posiciones e óneas. Ejemplos como es e pueden indica una elación en e el ocabula io de los jugado es y su endimien o, po ello, hemos conside ado ele an e es udia el posible ocabula io de cada g upo. 6.4. Análisis de los g upos 51 Figu a 6.11: Dis ibución de la media de acie os, le as ue a de luga y allos de cada g upo 6.4.1. Es udio de las palab as iniciales La elección de la palab a del p ime in en o es di e en e al es o pues o que no se iene ninguna in o mación ace ca de la palab a obje i o, conside amos impo an- e es udia con de enimien o las posibles palab as que cada g upo pod ía u iliza . Cada posible palab a inicial disminuye un po cen aje medio di e en e del espacio de soluciones, en pa icula , las mejo es palab as son aquellas que no con ienen le as epe idas e incluyen las consonan es más ecuen es en la lengua inglesa [3]. Así pues, palab as como TARES,SLATE oCRATE suelen se las más u ilizadas pa a inicializa los algo i mos, no obs an e, en es e p oyec o no buscamos minimiza la longi ud de las pa idas, sino imi a en la mejo medida de lo posible a los jugado es. Pa a a a de encon a las palab as iniciales más comunes en cada g upo hemos analizado las combinaciones iniciales de cada pa ida de cada usua io y c eado un conjun o de posibles palab as in oducidas dado el código ob enido y la palab a ob- je i o y, a con inuación, hemos con abilizado la apa ición de cada palab a en cada g upo. Es e mé odo nos ha p opo cionado una lis a o denada de mayo a meno ecuencia de apa ición de cada palab a pa a cada g upo, no obs an e, los esul ados es án lejos de se ealis as pues o que apa ecen palab as que p obablemen e no sean 52 Capí ulo 6. Tipos de jugado es conocidas po la mayo ía de jugado es como PZAZZ, es o se debe a que es e ipo de palab as con una g an can idad de le as epe idas y pocas ocales son las que p oducen en la mayo ía de casos combinaciones con cinco allos o cua o allos y una le a ue a de luga , que son las ecuen es en e las pa idas que disponemos. Pa a ap oxima mejo el ocabula io de nues os jugado es hemos pensado en ene en cuen a la ecuencia de apa ición en la lengua inglesa de las palab as y ambién el núme o de le as no epe idas de cada una. Conside amos que el p ime c i e io es á jus i icado debido a que las pa idas se han ob enido de cuen as de habla inglesa y el segundo se basa en la hipó esis de que la mayo ía de jugado es u ilizan como es a- egia inicial el educi el espacio de posibles soluciones eliminando la mayo can idad posible de le as. Pa a inco po a es os dos c i e ios adicionales hemos ecu ido a la écnica de análisis de decisión mul ic i e io más simple, la media ponde ada. La e- cuencia de apa ición de cada palab a se ha calculado g acias a la lib e ía wo d ecs y el po cen aje de le as epe idas en cada palab a lo hemos calculado con una un- ción p opia. Una ez ob enidas odas las dis ibuciones las hemos no malizado y hemos calculado el nue o alo en base a la ó mula 6.1 donde alue(i)co esponde al alo asignado a la palab a i, ec_ini(i)es el alo no malizado de la ecuencia de apa ición de la palab a en la dis ibución calculada al inicio del subapa ado, ec_na es el alo no malizado de ecuencia de apa ición de la palab a ien la lengua inglesa y epea _cha (i)es el po cen aje no malizado de le as que apa ecen más de una ocasión en la palab a i. alue(i) = ec_ini(i)+0,1· ec_na (i)+0,2· epea _cha (i)(6.1) Es e en oque ha p opocionado esul ados mucho más plausibles. eEn las ablas 6.4, podemos obse a las es palab as con mayo pun uación pa a cada g upo. Desca- amos la simili ud en e las del g upo 0 y las del g upo 2, odas e minan en Ey con ienen la le a Aen la segunda posición, además, la mayo ía con ienen las le as TyRque son las consonan es más comunes en la lengua inglesa. Las di e encuas más no ables se hallan en las palab as del g upo 1, en es e pa ece que las palab as con a ias ocales dis in as ienen una mayo ecuencia de apa ición y en la palab a con mayo alo encon amos una única consonan e, a di e encia de las o as mejo es palab as de cada g upo que incluyen es. Palab as iniciales pa a el g upo 0 Palab a Valo STATE 4,91 BRAZE 4,78 CRAZE 4,46 Palab as iniciales pa a el g upo 1 Palab a Valo ADIEU 4,43 BRAZE 4,28 ABOUT 4,07 Palab as iniciales pa a el g upo 2 Palab a Valo STARE 6,42 STATE 6,18 SPARE 5,31 Tabla 6.4: Palab as iniciales pa a cada g upo con la media ag egada más al a 6.4. Análisis de los g upos 53 6.4.2. Es udio del ocabula io de cada g upo Te minamos el análisis de los g upos gene ados con el es udio del ocabula io de cada uno de ellos, en conc e o, p e endemos gene a un alo numé ico pa a cada palab a que ep esen e cuán habi ual es en el ocabula io de cada ipo de jugado . Pa a ello hemos analizado cada pa ón ob enido en cada in en o de cada pa ida gene ando una nue a lis a de ecuencias de apa ición, ambién hemos ecupe ado las ecuencias en el lenguaje na u al pe o no hemos enido en cuen a la epe ición de las le as pues o que las palab as u ilizadas po cada jugado es án ue emen e in luenciadas po los esul ados ob enidos en in en os p e ios. Pa a combina es as dos mé icas hemos uel o a usa una media ponde ada pe o es a ez eajus ando los pesos de cada dis ibución no malizada, en pa icula hemos usado la ó mula 6.2 donde podemos e que el coe icien e de la ecuencia en el lenguaje na u al es seis y en el ob enido median e el análisis de los pa ones es uno, es e cla o sesgo hacia el lenguaje na u al lo jus i icamos pa a a a de compensa la g an can idad de da os e óneos que se ob ienen al ealiza el análisis de los pa ones pues o que solamen e podemos ecupe a un conjun o de posibilidades no la palab a in oducida po el usua io. alue_ ocab(i) = ec_ini(i)+6· ec_na (i)(6.2) T as gene a los alo es pa a cada g upo hemos ob enido es ánkings de palab as. Todos ellos p esen an coincidencias en e sí pe o sus dis ibuciones es án su icien- emen e di e enciadas, podemos e en las g á icas p esen es en la igu a 6.12 las ein a palab as con mayo media ag egada pa a cada ipo de jugado . A di e encia de lo obse ado en la subsección 6.4.1, no obse amos cambios d ás icos en ninguna de las es dis ibuciones, aunque sí exis en a iaciones en e las posiciones de cada palab a. En el p óximo capí ulo iliza emos es e conjun o de da os pa a modela el com- po amien o de cada g upo de jugado es e in en a ap oxima su media de in en os así como las dis ibuciones de los acie os, allos y le as ue a de luga según cada in en o. 54 Capí ulo 6. Tipos de jugado es 6.4. Análisis de los g upos 55 Figu a 6.12: 30 palab as más ecuen es en el ocabula io de cada g upo Cap´ ı ulo 7 Imi ando jugado es En es a sección implemen a emos un algo i mo gené ico pa a imi a a cada g upo de jugado es eniendo en cuen a las ablas de ecuencias gene adas en el apa ado an e io . De ini emos los di e sos componen es del algo i mo inspi ándonos en la implemen ación de Mas e mind explicada en la sección 3.3. Una ez implemen ados ealiza emos un ajus e de hipe pa áme os pa a encon a aquellos que modelicen mejo a mues os usua ios y inalmen e p esen a emos los esul ados ob enidos. 7.1. Desc ipción del modelo El modelo que amos a implemen a se basa en la ejecución de un algo i mo gené ico pa a cada in en o. En cada in en o se ac ualiza á la unción de i ness pa a ene en cuen a los alo es in oducidos an e io men e y los códigos de colo es ob enidos, es a se basa á en un coe icien e de simili ud en e las palab as elegidas y las candida as a se lo. La población inicial de cada in en o se i á educiendo pues o que se elimina án odas las palab as que no encajen con los pa ones ob enidos. La p ime a i e ación se ealiza de mane a di e en e, la elección de la palab a inicial se basa á en las ablas de ecuencias de palab as iniciales calculadas en el capí ulo an e io y se ha á uso del ocabula io in e ido a la ho a de ealiza las unciones de selección, c uce, mu ación, pe mu ación e in e sión. El modelo inaliza su ejecución cuando se acie a la palab a o cuando se supe a el lími e de los seis in en os. El p ocedimien o u ilizado queda plasmado en el pseudocódigo 2. 7.2. Desc ipción de las unciones En las subsecciones pos e io es de inimos cada una de las pa es del algo i mo implemen ado: 7.2.1. Rep esen ación c omosómica Cada indi iduo de la población se á una palab a de cinco le as pe enecien e al conjun o de palab as admi idas. La selección de la p ime a palab a in oducida 57 58 Capí ulo 7. Imi ando jugado es Algo i mo 2: Algo i mo gené ico pa a imi a jugado es de Wo dle a emp ←1; X1←Elección po ule a de la palab a inicial a pa i de la abla de ecuencias; E alua X1y ob ene el código Y1; while Ya emp =código e de AND a emp ≤6do Gene amos Ea emp como el conjun o de palab as posibles es an es dado Xa emp eYa emp ; a emp ←a emp + 1; h←1; Inicializamos el núme o de gene aciones a 1; ˆ Eh← {}; Inicializamos la población acía; Seleccionamos po ule a indi iduos pe enecien es a Ea emp −1usando la abla de ecuencias; while h≤maxgen do Calcula el alo de i ness de los indi iduos de la población; Realizamos el c uce de los indi iduos con p obabilidad pc uce; Realizamos la mu ación con p obabilidad pmu acion; Realizamos la pe mu ación con p obabilidad ppe mu acion; Realizamos la in e sión con p obabilidad pin e sion; Gua da los descendien es esul an es en ˆ Eh; h←h+ 1; end while Encon amos el indi iduo Xa emp con mejo i ness, en caso de que exis an a ios seleccionamos aquel con mayo alo en la abla de ecuencias; E alua Xa emp y ob ene un nue o Ya emp ; end while se ealiza á median e ule a u ilizando los alo es ob enidos pa a cada palab a en el apa ado 6.4.1. La inicialización de la p ime a gene ación de indi iduos de cada in en o se ealiza á po ule a a pa i de las palab as posibles es an es eniendo en cuen a los esul ados ob enidos en los in en os an e io es, las p obabilidades se ob end án u ilizando las ablas de ecuencias gene adas en el apa ado 6.4.2. 7.2.2. Función de i ness La unción de i ness se ac ualiza á as cada in en o pa a ene en cuen a los esul ados ob enidos. Se basa á en la ó mula 7.1, donde wes la palab a sob e la que se e alua á el i ness, gico esponde a la palab a in oducida en el in en o i,ciindica el núme o de le as co ec as ob enidas en el in en o i,miindica el núme o de le as ue a de luga ob enidas en el in en o i,co ec (gi, w)es una unción que de uel e el núme o de le as co ec as que se hubie an ob enido in oduciendo giy eniendo como obje i o la palab a wymisplaced(gi, w)es una unción que de uel e el núme o de le as ue a de luga que se hubie an ob enido in oduciendo giy eniendo como obje i o la palab a w. 7.2. Desc ipción de las unciones 59 i ness(w) = in en os X i=1 (|co ec (gi, w)−ci|) + |misplaced(gi, w)−mi|)(7.1) Con es a unción p e endemos e alua cuan simila es una palab a a la posible solución de la pa ida, el mejo alo de i ness se ob ienen en el ce o pe o es posible que exis a más de una palab a pa a que se alcalce en mínimo. 7.2.3. Función de c uce El c uce de los indi iduos es una unción indispensable en los algo i mos gené i- cos. Debido a que, en nues o caso, el c uce de uno o dos pun os de dos palab as no ienen po qué gene a dos indi iduos álidos ya que solamen e se admi en palab as exis en es y el in e cambio de segmen os de le as en e dos indi iduos no suele ge- ne a palab as eales, hemos decidido implemen a una unción más compleja que ga an ice la gene ación de indi iduos álidos y a su ez que con engan la in o mación de sus p ogeni o es. Pa a ello hemos ealizado lo siguien e: ealizamos un c uce de un pun o en e los dos p ogeni o es, en caso de que alguna de las palab as esul an es pe enezcan al conjun o de palab as posibles las man enemos, en caso con a io, buscamos palab as que con engan las mismas le as que el descendien e y en caso de que haya más de un candida o elegimos aquel con mejo i ness. En caso de que no exis a ninguna com- binación álida, sus i uimos al descendien e po una palab a álida alea o ia. Pa a acele a el cálculo de es a unción hemos p ecalculado el conjun o de las palab as álidas que se pueden o ma con cada posible combinación de cinco le as. 7.2.4. Función de mu ación Al implemen a la unción de mu ación hemos encon ado con un p oblema si- mila al de la unción de c uce, cambia una le a po o a den o de una palab a no siemp e p oduce un indi iduo álido, po ello hemos modi icado la unción pa a que solamen e de uel a indi iduos álidos. Pa a ealiza ácilmen e es e p oceso hemos gene ado una abla que, pa a cada palab a, con iene el conjun o de palab as que di ie en de ella únicamen e en una le a. En caso de que al mu a exis a más de una opción seleccionamos aquella con el mejo alo de i ness y, en caso de que no haya ninguna, no se ealiza la mu ación. 7.2.5. Función de pe mu ación La pe mu ación ambién ha es ado condicionada po la necesidad de gene a palab as álidas, po ello la unción de pe mu ación únicamen e pe mu a dos le as di e en es siemp e y cuando el esul ado sea o a palab a. En caso de que exis an a ias posibilidades siemp es se escoge la que enga un meno alo de i ness. Pa a 66 Capí ulo 7. Imi ando jugado es Figu a 7.5: Compa ación de acie os, le as ue a de luga y allos en e el g upo 2 y el algo i mo que lo modela mejo ado na u al en el modelo hemos ob enido la mejo a más signi ica i a en el endimien o de odos los algo i mos e isados en la sección 7.4.1. Concluimos pues que los mejo es jugado es ienen pa ones de juego más complejos y más di íciles de p edeci que la ecuencia de palab as que u ilizan pa a adi ina la solución consecuen emen e, se necesi a más in es igación pa a iden i ica los ac o es que con ibuyen al endimien o de los mejo es jugado es y desa olla modelos que puedan imi a los con mayo p ecisión. 7.5. Resul ados 67 Mé icas de los modelos inales G upo 0 Modelo 0 G upo 1 Modelo 1 G upo 2 Modelo 2 Acie os in en o 1 0.55 0.43 0.42 0.31 0.90 0.78 Acie os in en o 2 1.56 1.38 0.93 1.03 2.61 2.46 Acie os in en o 3 2.91 2.77 1.77 1.82 4.02 3.67 Acie os in en o 4 3.95 4.11 2.84 2.76 4.57 4.28 Acie os in en o 5 4.60 4.66 3.86 3.72 4.83 4.67 Acie os in en o 6 4.93 4.88 4.69 4.65 4.97 4.85 Fue a luga 1 1.05 0.85 1.00 1.05 1.11 0.93 Fue a luga 2 1.03 0.95 1.10 1.04 0.74 0.89 Fue a luga 3 0.62 0.64 0.96 0.87 0.26 0.51 Fue a luga 4 0.26 0.14 0.64 0.46 0.09 0.17 Fue a luga 5 0.08 0.02 0.30 0.15 0.03 0.05 Fue a luga 6 0.01 0.00 0.07 0.02 0.00 0.01 Fallos in en o 1 3.40 3.72 3.57 3.69 2.99 3.09 Fallos in en o 2 2.41 2.67 2.97 2.92 1.65 1.85 Fallos in en o 3 1.47 1.60 2.28 2.11 0.72 1.05 Fallos in en o 4 0.79 0.74 1.52 1.38 0.34 0.54 Fallos in en o 5 0.32 0.32 0.82 0.73 0.14 0.28 Fallos in en o 6 0.06 0.11 0.24 0.31 0.03 0.14 Media de in en os 4.23 4.36 5.00 4.92 3.31 3.75 Tabla 7.2: Valo es de las mé icas de cada modelo y del g upo de jugado es al que imi a Cap´ ı ulo 8 Conclusiones y abajo u u o En es e p oyec o hemos eunido más de seis millones de pa idas de Wo dle ex aí- das de Twi e . T as ealiza una limpieza exhaus i a hemos ob enido un conjun o de da os que hemos hecho público en la pla a o ma Kaggle donde se puede acce- de y desca ga lib emen e desde el siguien e h ps://www.kaggle.com/da ase s/ sca cal e sis/wo dle-games, cumpliendo así el obje i o O1. Al analiza es e conjun o hemos encon ado a ios da os ele an es como que la media de in en os se encuen a en 4,19, que el 6,66 % de las pa idas se pie den y que el núme o de in en os po pa ida obedece una dis ibución no mal con media 4,19 y des iación ípica 1,46. En elación a es o hemos podido comp oba que el e ce in en o es el más decisi o de odos pues o que el núme o de acie os, allos y le as ue a de es e luga de un jugado en él es uno de los ac o es más co ela- cionados con la longi ud de su pa ida. Es o nos ha lle ado a conside a lo ele an e en el es udio de la clasi icación de jugado es. Finalmen e hemos ealizado un b e e es udio de la di icul ad de cada pa ida basándonos en su longi ud y clasi icado nu- mé icamen e cada una de es as. Hemos podido conclui que las palab as más áciles son aquellas que con ienen las le as más ecuen es en el idioma inglés, es deci que con ienen las ocales ‘a’ y ‘e’ y consonan es como ‘n’, ‘ ’ y ‘ ’ así como combinaciones consonán icas de es as como ‘ ’. Las más di íciles, en cambio, no se ca ac e izan an ácilmen e, una baja ecuencia en el lenguaje usual pa ece se el ac o más decisi o lo cual es azonable ya que el desconocimien o de la palab a po pa e del jugado elimina cualquie posibilidad de gana la pa ida, sin emba go, ambién encon a- mos ac o es como la p esencia de dos o más le as epe idas así como la al a de las ocales ‘a’ y ‘e’ a a o de la p esencia de ‘y’ en la posición inal. Es e análisis nos ha pe mi ido cumpli el obje i o O2. Seguidamen e hemos u ilizado el análisis de los da os pa a gene a a iables pa- a ca ac e iza los jugado es. Median e el uso de clús e ing hemos encon ado 3 g upos di e enciados ca ac e izados po lo siguien e: G upo 0: Se ca ac e iza po el g upo más nume oso compues o po más de la mi ad de los jugado es, su long i ud media de pa ida es de 4,23 y ep esen an a los jugado es medios. Analizando las dis ibuciones de las medias de acie os, 69 70 Capí ulo 8. Conclusiones y abajo u u o allos y le as ue a de luga podemos comp oba que es os jugado es suelen ace a una media de 0,5le as en su in en o inicial y suelen ob ene ambién una le a en la posición equi ocada. A pa i del segundo in en o sus acie os aumen an en una asa del 1,4de media y suelen consegui es acie os en el e ce in en o. Su es a egia se basa en educi el núme o de palab as posibles en los dos p ime os in en os, en el e ce o coloca en la posición co ec a las le as ue a de luga ob enidas en los in en os an e io es y en los in en os pos e io es in oducen palab as que se adap en al pa ón de acie os. G upo 1: Se a a del segundo g upo más nume oso de los es encon ados, su longi ud media de pa ida es de 4,99 y ep esen an a los jugado es con peo endimien o y posiblemen e con menos expe iencia. T as analiza sus dis ibu- ciones concluimos que en su p ime in en o no suelen ob ene ningún acie o pe o sí una única le a ue a de luga , además su segundo in en o se ca ac e- iza po p esen a esul ados muy simila es al p ime o lo cual es indicado de que usan palab as pa ecidas o con le as en común. Es o hace que en su e ce in en o engan una media in e io a 2acie os lo cual di icul a sus posibilida- des de gana la pa ida. En pa icula es os jugado es no siemp e ob ienen un acie o nue o en cada in en o pe o sí le as ue a de luga . Concluimos que u ilizan palab as muy simila es en e sí, posiblemen e po limi aciones en el ocabula io y que consecuen emen e son el g upo con más pa idas pe didas. G upo 2: Se a a del g upo mino i a io con una longi ud media de pa ida de 3,31 in en os. Rep esenan a los jugado es con mejo endimien o y posible- men e expe os. Se ca ac e izan po ob ene un acie o y una le a ue a de luga en el p ime in en o y en una g an capacidad de aumen a los acie os muy ápidamen e en e los in en o 1 y 3. En el e ce in en o suelen habe ganado o han conseguido 4 acie os de media lo cual educe sus ancialmen- e el conjun o de palab as posibles. Su es a egia se basa en u iliza los dos p ime os in en os pa a educi al máximo el conjun o de palab as posibles, lo consiguen u ilizando palab as con las mismas le as en la posición co ec a que en su p ime y segundo in en o pe o a iando las es an es deno ando un g an dominio del ocabula io. A con inuación, si no han ganado en el e ce in en o, ealizan in en os adap ados al pa ón ob enido que es al amen e es ic i o y po ello equie en de menos in en os que el g upo 0. Los esul ados ob enidos nos han hecho conside a el es udio del ocabula io de los jugado es, así como su palab a p e e en e en el p ime in en o. Al no posee las palab as in oducidas po cada jugado si no el pa ón de uel o, hemos ecu ido a he amien as de in e encia pa a gene a los di e en es conjun os de ecuencias pa a cada ipo de jugado y cumpli así con los obje i os O3 y O8. Usando es os da os jun o a los pa ones ex aídos de cada jugado , desa ollamos a ios modelos que a aban de imi a el compo amien o de cada g upo u ilizando algo i mos gené icos con una unción de i ness basada en la simili ud en e pa ones ob enidos en cada in en o. T as ealiza los ajus es necesa ios a los hipe pa áme os de los modelos y de ealiza un es udio del endimien o dependiendo del peso dado 8.1. T abajo u u o 71 a la ecuencia de las palab as en el lenguaje, ob u imos es modelos inales consi- guiendo cumpli los obje i os O4 y O5. Cada uno de ellos nos apo ó in o mación adicional sob e los g upos, en pa icula el modelo ob enido pa a el g upo 0 se ajus a no ablemen e bien al pa ón de juego obse ado, es e modelo da una impo ancia seis eces supe io a la ecuencia de las palab as en el lenguaje usual que a la ob- enida median e la in e encia de los pa ones. Es o indica una ue e elación en e el compo amien o de es e g upo y el lenguaje habi ual, lo cual no esul a so p en- den e ya que se a a de los jugado es medios. Pa a el modelo del g upo 1 ambién se ob u ie on esul ados no ablemen e ce e os aunque en es e caso las ecuencias en el lenguaje pasa on a ene la misma impo ancia que las ecuencias in e idas, es o sugie e que los jugado es del g upo 2 ienen un ocabula io más educido que el es o de g upos y que es o es un ac o decisi o en su endimien o en el juego. Finalmen e en modelo del g upo 2 es el que p esen a el peo endimien o espec o a las mé icas u ilizadas pa a compa a lo con los jugado es eales. Pese a habe con- seguido imi a la dis ibución de acie os, allos y le as ue a de luga , el modelo no consigue alcanza el endimien o de los jugado es eales. Fue en enado dando el doble de peso al lenguaje na u al que a las ecuencias in e idas y, pese a es o, los esul ados sugie en que exis en o os aspec os compo amien o de los jugado es del g upo 2 que aún no se comp enden po comple o y que no es án elacionados con el ocabula io de es os. Es e análisis nos pe mi e da espues a a los obje i os O6 y O7 de nues o p oyec o. En gene al, es e abajo nos ha b indado in o mación aliosa sob e el compo a- mien o de los jugado es de Wo dle y nos ha ayudado a c ea modelos más p ecisos que pueden imi a su juego. Si bien aún queda mucho po ap ende sob e las com- plejidades del compo amien o de los jugado es, es e p oyec o sen ó las bases pa a u u as in es igaciones en es a á ea y des acó el po encial del uso de modelos compu- acionales pa a comp ende mejo el compo amien o humano. 8.1. T abajo u u o En is as a un p oyec o u u o, es e iden e que se equie e un análisis más p o- undo de las es a egias del g upo 2 y cómo es as a ec an al endimien o de los jugado es y su capacidad pa a educi an d ás icamen e el espacio de soluciones, posiblemen e u ilizando écnicas más so is icadas como la educción de la en opía o el uso de palab as iniciales conc e as. También se ía con enien e a a de mejo a las ap oximaciones del ocabula io de cada g upo, ya sea con écnicas de in e encia más so is icadas o median e la ecopilación di ec a de los in en os de los usua ios. O o ac o a ene en conside ación es la mejo ía de los jugado es con el iempo y a a de obse a luc uaciones de usua ios en e g upos. También se ía in e esan- e in es iga cómo los modelos ob enidos pueden ayuda a mejo a a los jugado es ac uales, ya sea u ilizándolos pa a p edeci la palab a que debe ían in oduci , su- ge í sela y posiblemen e amplia su ocabula io, explica les la es a egia que es án siguiendo e in en a mejo a la o incluso alo a la idoneidad de las palab as in o- ducidas en cada in en o. 72 Capí ulo 8. Conclusiones y abajo u u o Como se pod á ap ecia , exis e una amplia a iedad de posibles con inuaciones del abajo comenzado en es e p oyec o y espe amos que an o es e documen o como el conjun o de da os que lo acompaña sean ú iles a odas las pe sonas que quie an ealiza apo aciones. Conclusions and Fu u e Wo k In his p ojec we ha e collec ed mo e han six million Wo dle ma ches ex ac ed om Twi e . A e an exhaus i e cleaning we ha e ob ained a da ase ha we ha e made public on he pla o m Kaggle whe e i can be eely accessed and down- loaded om he ollowing h ps://www.kaggle.com/da ase s/sca cal e sis/ wo dle-games, hus ul illing ou i s objec i e. When analyzing his se we ha e ound se e al ele an da a such as ha he mean numbe o a emp s is 4.19, ha 6.66% o he games a e los and ha he numbe o a emp s pe game obeys a no mal dis ibu ion wi h mean 4.19 and s anda d de ia ion 1.46. In ela ion o his we ha e been able o e i y ha he hi d y is he mos decisi e o all since he numbe o hi s, misses and le e s ou o his place o a playe in i is one o he ac o s mos co ela ed wi h he leng h o his game. This has led us o conside i ele an in he s udy o playe anking. Finally, we ha e made a b ie s udy o he di icul y o each game based on i s leng h and nume ically anked each o hem. We ha e been able o conclude ha he easies wo ds a e hose ha con ain he mos equen le e s in he English language, i.e. ha con ain he owels ‘a’ and ‘e’ and consonan s such as ‘n’, ‘ ’ and ‘ ’ as well as consonan combina ions o hese such as ‘ ’. The mo e di icul ones, on he o he hand, a e no so easily cha ac e ized, a low equency in he usual language seems o be he mos decisi e ac o which is easonable since he playe ’s igno ance o he wo d elimina es any chance o winning he game, howe e , we also ound ac o s such as he p esence o wo o mo e epea ed le e s as well as he lack o he owels ‘a’ and ‘e’ in a o o he p esence o ‘y’ in he inal posi ion. This analysis has allowed us o ul ill ou second objec i e. We hen used da a analysis o gene a e a iables o cha ac e ize he playe s. Th ough he use o clus e ing we ha e ound 3 di e en ia ed g oups cha ac e ized by he ol- lowing: G up 0: I is cha ac e ized by he la ges g oup composed o mo e han hal o he playe s, hei a e age s a ing la i ude is 4.23 and hey ep esen he a e age playe s. Analyzing he dis ibu ions o he a e ages o hi s, misses and misplaced le e s we can see ha hese playe s usually hi an a e age o 0.5le e s in hei ini ial a emp and usually also ge a le e in he w ong posi ion. F om he second y onwa ds hei hi s inc ease a a a e o 1.4on 73 74 Capí ulo 8. Conclusiones y abajo u u o a e age and hey usually ge h ee hi s on he hi d y. Thei s a egy is based on educing he numbe o possible wo ds in he i s wo a emp s, in he hi d a emp hey place in he co ec posi ion he misplaced le e s ob ained in he p e ious a emp s and in he subsequen a emp s hey in oduce wo ds ha i he pa e n o hi s. G up 1: This is he second la ges g oup o he h ee ound, hei a e age game leng h is 4.99 and hey ep esen he playe s wi h he wo s pe o mance and possibly he leas expe ience. A e analyzing hei dis ibu ions we con- clude ha in hei i s a emp hey usually do no ge any hi s bu only one le e ou o place, and hei second a emp is cha ac e ized by e y simila esul s o he i s one, which is an indica o ha hey use simila wo ds o wo ds wi h le e s in common. This means ha in hei hi d a emp hey ha e an a e age o less han 2 hi s, which hinde s hei chances o winning he game. In pa icula , hese playe s do no always ge a new hi on each y bu hey do ge misplaced le e s. We conclude ha hey use wo ds e y simila o each o he , possibly because o ocabula y limi a ions, and ha consequen ly hey a e he g oup wi h mo e los games. G up 2: This is he mino i y g oup wi h an a e age s a ing leng h o 3.31 a emp s. They ep esen he bes pe o ming and possibly expe playe s. They a e cha ac e ized by ge ing one hi and one le e ou o place on he i s y and a g ea abili y o inc ease hi s e y quickly be ween ies 1 and 3. By he hi d y hey usually ha e won o ha e go en 4 hi s on a e age which subs an ially educes he se o possible wo ds. Thei s a egy is based on using he i s wo a emp s o educe he se o possible wo ds as much as possible, hey achie e his by using wo ds wi h he same le e s in he co ec posi ion as in hei i s and second a emp s bu a ying he emaining le e s, deno ing a g ea mas e y o ocabula y. Then, i hey ha e no won on he hi d a emp , hey make a emp s adap ed o he pa e n ob ained, which is highly es ic i e and he e o e equi es ewe a emp s han g oup 0. The esul s ob ained made us conside he s udy o he ocabula y o he playe s, as well as hei p e e ed wo d in he i s a emp . Since we do no possess he wo ds en e ed by each playe bu he e u ned pa e n, we ha e eso ed o in e ence ools o gene a e he di e en se s o equencies o each ype o playe and hus ul ill ou hi d and eigh h objec i es. Using hese da a along wi h he pa e ns ex ac ed om each playe , we de el- oped se e al models ha a emp ed o mimic he beha io o each g oup using gene ic algo i hms wi h a i ness unc ion based on he simila i y be ween pa e ns ob ained a each a emp . A e making he necessa y adjus men s o he hype - pa ame e s o he models and pe o ming a s udy o he pe o mance depending on he weigh gi en o he equency o wo ds in he language, we ob ained h ee inal models achie ing ou ou h and i h objec i es. Each o hem p o ided us wi h addi ional in o ma ion abou he g oups, in pa icula he model ob ained o g oup 0 i s ema kably well o he obse ed pa e n o play, his model gi es six 8.2. Fu u e wo k 75 imes mo e impo ance o he equency o wo ds in he o mal language han ha ob ained by pa e n in e ence. This indica es a s ong ela ionship be ween he beha io o his g oup and he usual language, which is no su p ising since hese a e a e age playe s. Fo he g oup 1 model we also ob ained ema kably accu a e esul s, al hough in his case he language equencies became as impo an as he in e ed equencies, sugges ing ha g oup 2 playe s ha e a smalle ocabula y han he o he g oups and ha his is a decisi e ac o in hei pe o mance in he game. Finally, he model o g oup 2 is he one ha p esen s he wo s pe o mance wi h espec o he me ics used o compa e i wi h he eal playe s. Despi e ha ing managed o mimic he dis ibu ion o hi s, misses and misplaced le e s, he model ails o achie e he pe o mance o eal playe s. I was ained by gi ing wice as much weigh o na u al language as o in e ed equencies and, despi e his, he esul s sugges ha he e a e o he aspec s o he beha io o g oup 2 playe s ha a e no ye ully unde s ood and a e no ela ed o hei ocabula y. This analysis allows us o answe objec i es 6 and 7 o ou p ojec . O e all, his wo k has p o ided us wi h aluable in o ma ion abou he beha io o Wo dle playe s and has helped us o c ea e mo e accu a e models ha can mimic hei play. While he e is s ill much o lea n abou he complexi ies o playe beha - io , his p ojec laid he g oundwo k o u u e esea ch in his a ea and highligh ed he po en ial o using compu a ional models o be e unde s and human beha io . 8.2. Fu u e wo k In iew o a u u e p ojec , i is clea ha u he analysis o g oup 2 s a egies and how hese a ec playe pe o mance and hei abili y o educe he solu ion space so d as ically is equi ed, possibly using mo e sophis ica ed echniques such as en opy educ ion o he use o speci ic ini ial wo ds. I would also be wo hwhile o y o imp o e he ocabula y app oxima ions o each g oup, ei he wi h mo e sophis ica ed in e ence echniques o by di ec collec ion o use a emp s. Ano he ac o o ake in o conside a ion is he imp o emen o playe s o e ime and o y o obse e luc ua ions o use s be ween g oups. I would also be in e es ing o in es iga e how he models ob ained can help imp o e cu en playe s, ei he by using hem o p edic he wo d hey should en e , sugges i o hem and possibly expand hei ocabula y, explain he s a egy hey a e ollowing and y o imp o e i , o e en assess he app op ia eness o he wo ds en e ed in each a emp . As will be seen, he e is a wide a ie y o possible con inua ions o he wo k be- gun in his p ojec and we hope ha bo h his documen and he accompanying da a se will be use ul o all who wish o con ibu e.