scieee Science in your language
[es] (orig)

De los datos a la imitación: estudio y modelado del comportamiento de jugadores en Wordle

Abstract

Este proyecto se centra en el estudio del comportamiento de jugadores humanos y en la imitación de sus estilos de juego. Para ello utilizaremos Wordle un popular rompecabezas de palabras del cuál se dispone un gran número partidas publicadas en redes sociales. El proyecto comienza con la recopilación de un conjunto de datos de partidas y su preprocesamiento. A continuación, se aplican técnicas de análisis de datos para explorar el conjunto. Esto incluye estadísticas descriptivas, visualización de datos y algoritmos de aprendizaje automático. Después de la fase de análisis, se desarrolla un marco de modelado para simular el comportamiento del jugador. Los modelos están diseñados para imitar las estrategias y los procesos de toma de decisiones observados. Se emplean técnicas de aprendizaje automático, como algoritmos genéticos, para entrenar estos modelos utilizando los datos procesados. El rendimiento de los modelos desarrollados se evalúa a través de métricas rigurosas con el objetivo de evaluar su capacidad de imitar a los jugadores humanos y si pueden lograr tasas de éxito similares. Los resultados obtenidos ayudan a comprender el comportamiento de los jugadores de Wordle y mejorar potencialmente el rendimiento de estos. Además, los modelos desarrollados en este proyecto podrían aplicarse a varios otros rompecabezas basados en palabras, proporcionando información sobre estrategias y procesos de toma de decisiones que pueden mejorar las experiencias de juego de los jugadores humanos.

Read accessible full text

De los datos a la imitación: estudio y modelado del comportamiento de jugadores en Wordle

Author: Calvet Sisó, Óscar
Year: 2023
Source: https://docta.ucm.es/bitstreams/f375de48-04de-4e8d-bb61-15cb7fcca889/download
De los da os a la imi ación: es udio y modelado
del compo amien o de jugado es en Wo dle
F om Da a o Imi a ion: S udy and modeling
Playe Beha io in Wo dle
T abajo de Fin de G ado
Cu so 2022–2023
Au o
Ósca Cal e Sisó
Di ec o
An onio Alejand o Sánchez Ruíz-G anados
Doble g ado en Ma emá icas e Ingenie ía In o má ica
Facul ad de In o má ica
Uni e sidad Complu ense de Mad id
De los da os a la imi ación: es udio y
modelado del compo amien o de
jugado es en Wo dle
F om Da a o Imi a ion: S udy and
modeling Playe Beha io in Wo dle
T abajo de Fin de G ado en Ingenie ía In o má ica
Au o
Ósca Cal e Sisó
Di ec o
An onio Alejand o Sánchez Ruíz-G anados
Con oca o ia: Junio 2023
Doble g ado en Ma emá icas e Ingenie ía In o má ica
Facul ad de In o má ica
Uni e sidad Complu ense de Mad id
29 de MAYO de 2023
Resumen
Es e p oyec o se cen a en el es udio del compo amien o de jugado es humanos
y en la imi ación de sus es ilos de juego. Pa a ello u iliza emos Wo dle un popula
ompecabezas de palab as del cuál se dispone un g an núme o pa idas publicadas
en edes sociales.
El p oyec o comienza con la ecopilación de un conjun o de da os de pa idas y
su p ep ocesamien o. A con inuación, se aplican écnicas de análisis de da os pa a
explo a el conjun o. Es o incluye es adís icas desc ip i as, isualización de da os y
algo i mos de ap endizaje au omá ico. Después de la ase de análisis, se desa olla
un ma co de modelado pa a simula el compo amien o del jugado . Los modelos
es án diseñados pa a imi a las es a egias y los p ocesos de oma de decisiones
obse ados. Se emplean écnicas de ap endizaje au omá ico, como algo i mos gené-
icos, pa a en ena es os modelos u ilizando los da os p ocesados. El endimien o
de los modelos desa ollados se e alúa a a és de mé icas igu osas con el obje i o
de e alua su capacidad de imi a a los jugado es humanos y si pueden log a asas
de éxi o simila es.
Los esul ados ob enidos ayudan a comp ende el compo amien o de los jugado es
de Wo dle y mejo a po encialmen e el endimien o de es os. Además, los modelos
desa ollados en es e p oyec o pod ían aplica se a a ios o os ompecabezas basados
en palab as, p opo cionando in o mación sob e es a egias y p ocesos de oma de
decisiones que pueden mejo a las expe iencias de juego de los jugado es humanos.
Palab as cla e
Wo dle, análisis de da os, modelado de jugado es, algo i mos gené icos, juegos.

Abs ac
This p ojec ocuses on he s udy o he beha io o human playe s and he imi-
a ion o hei playing s yles. Fo his we will use Wo dle, a popula wo d puzzle o
which a la ge numbe o games a e published on social ne wo ks.
The p ojec s a s wi h collec ing a game da a se and p e-p ocessing i . Da a
analysis echniques a e hen applied o explo e he se . This includes desc ip i e
s a is ics, da a isualiza ion, and machine lea ning algo i hms. A e he analysis
phase, a modeling amewo k is de eloped o simula e playe beha io . The models
a e designed o mimic obse ed s a egies and decision-making p ocesses. Machine
lea ning echniques such as gene ic algo i hms a e used o ain hese models using
he p ocessed da a. The pe o mance o he de eloped models is e alua ed h ough
igo ous me ics wi h he aim o e alua ing he abili y o he models o imi a e hu-
man game s and whe he hey can achie e simila success a es.
The esul s ob ained help o unde s and he beha io o Wo dle playe s and po-
en ially imp o e hei pe o mance. Addi ionally, he models de eloped in his
p ojec could be applied o a ious o he wo d-based puzzles, p o iding insigh s
in o s a egies and decision-making p ocesses ha can imp o e gaming expe iences
o human playe s.
Keywo ds
Wo dle, da a analysis, playe imi a ion, gene ic algo i hms, games.
ii
Índice
1. In oducción 1
1.1. Mo i ación................................. 1
1.2. Obje i os ................................. 5
1.3. Plande abajo.............................. 6
1.4. Código uen e............................... 6
2. In oduc ion 7
2.1. Mo i a ion................................. 7
2.2. Goals.................................... 11
2.3. Wo kplan................................. 11
2.4. Sou cecode ................................ 12
3. T abajos elacionados 13
3.1. Mas e mind................................ 13
3.2. Algo i mos de educción de la en opía . . . . . . . . . . . . . . . . . 14
3.2.1. Algo i mo de los cinco in en os de Knu h . . . . . . . . . . . . 15
3.2.2. Algo i mo pa a Wo dle . . . . . . . . . . . . . . . . . . . . . . 16
3.3. Algo i mos gené icos . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
3.3.1. Algo i mo gené ico pa a Mas e mind . . . . . . . . . . . . . . 18
3.4. Modelado de jugado es . . . . . . . . . . . . . . . . . . . . . . . . . . 19
3.4.1. DQN................................ 19
3.4.2. Ap endizaje po e ue zo p o undo a pa i de p e e encias
humanas.............................. 20
3.4.3. Ap endizaje po imi ación a a és de la es imación de polí i-
cas de apoyo expe as . . . . . . . . . . . . . . . . . . . . . . 22
4. Recopilación y limpieza de las pa idas 23
4.1. Recopilación de los wee s . . . . . . . . . . . . . . . . . . . . . . . . 23
4.1.1. Ex acción de las a iables . . . . . . . . . . . . . . . . . . . . 25
4.2. Limpiezadelosda os........................... 25
4.2.1. Eliminación de pa idas con o ma o inco ec o . . . . . . . . 25
4.2.2. Eliminación de pa idas alseadas . . . . . . . . . . . . . . . . 26
ix
2Capí ulo 1. In oducción
Figu a 1.1: Pa ida de ejemplo
Pa a ejempli ica mejo las no mas desc i as, en la igu a 1.1 se pueden obse a
las combinaciones de colo es de uel as po las palab as in oducidas en una pa ida
cuyo obje i o es abbey.
El éxi o de Wo dle se puede a ibui a los p incipios de ludi icación que inco po a.
Una de las azones p incipales po las que a la gen e le gus a juga es la sensación
de log o y supe ación asociada al éxi o. Wo dle es á diseñado pa a p opo ciona
eedback ins an áneo y ecompensas a los jugado es, lo que lo hace más sa is ac o io
y a ac i o que un juego de palab as adicional. La simplicidad y acilidad de uso
del juego ambién lo hacen accesible a una amplia gama de jugado es, desde juga-
do es casuales has a en usias as más se ios [29]. O a o ma en que Wo dle u iliza
la ludi icación pa a mo i a a los jugado es es a a és de la compe encia. El juego
anima a los jugado es a compe i con a sus amigos y o os jugado es, omen ando
un sen ido de comunidad y cama ade ía. La na u aleza compe i i a del juego c ea
una sensación de u gencia y emoción que man iene a los jugado es comp ome idos
y mo i ados a segui jugando.
Es o ha p o ocado una g an a ición po Wo dle y consecuen emen e su comuni-
dad de jugado es ha aumen ado y e olucionado, di e si icándose en el p oceso y
gene ando jugado es con es a egias a iadas [46]. Pese a que no exis en da os ace -
ca de los jugado es p e ios a la adquisición po pa e del New Yo k Times y que es e
pe iódico man iene en p i ado las es adís icas que posee del juego, sí que exis en
a ios a ículos de la p opia emp esa donde se de allan a ios ipos de jugado es y
sus es a egias [2], [16]. T as ecopila los hemos ob enido las siguien es ca ego ías:

1.1. Mo i ación 3
El jugado ocasional: El jugado casual se elaciona con Wo dle como una
ac i idad de ocio, en busca de en e enimien o y es imulación men al. Dis u-
an de la simplicidad del juego y, a menudo, juegan de o ma in e mi en e.
Los jugado es casuales gene almen e con ían en la in uición, la asociación de
palab as y el conocimien o del ocabula io medio pa a ealiza sus in en os.
Suelen u iliza únicamen e palab as candida as a se solución aunque no las
eligen de mane a idónea pa a disminui el amaño del conjun o de palab as
es an es.
El cazado de pa ones: Los cazado es de pa ones p es an una g an a en-
ción al eedback p opo cionado po el juego. Obse an cómo cambia la palab a
con cada espues a y usan es a in o mación e icien emen e pa a disminui na-
ablemen e el conjun o de palab as es an es. Pese a es o, siguen u ilizando
casi exclusi amen e palab as candida as a se solución en cada in en o.
El es a ega: Los es a egas juegan a Wo dle con una es a egia p emedi ada
de p ueba y e o . Sus in en os iniciales ep esen an una amplia gama de posi-
bilidades buscando educi al máximo el espacio de soluciones y luego ajus an
sus in en os pos e io es en unción del eedback ecibido. Es e p oceso cla a-
men e di e enciado en dos pa es cuyo cambio se da en e el segundo y e ce
in en o pe mi e a es e g upo adi ina la palab a con una media de in en os
in e io a los o os dos.
Es as ca ac e izaciones nos pe mi en ob ene una p ime a ap oximación de los ipos
de jugado es, no obs an e al no posee los da os de los que se ha in e ido la in o -
mación no nos esul an pa icula men e ú iles. A pesa de es o, Wo dle cuen a con
una uncionalidad que nos a a pe mi i ob ene millones de pa idas.
En la p ime a semana del año 2022, Wo dle enía al ededo de escien os mil usua-
ios dia ios ac i os [46], en la segunda semana es e núme o aumen ó has a los es
millones [21]. Es e inc emen o coincidió con la implemen ación de la uncionalidad
de compa i las pa idas en di e sas edes sociales que ue lanzada el p ime día del
año, es a mejo a pe mi ió a los usua ios gene a publicaciones que con enían ca ac-
e es UTF-8 co espondien es a cuad ados con los colo es ob enidos en sus in en os.
Es e o ma o pe mi ió que los jugado es pudie an publica y compa i sus pa idas
sin des elaba la palab a obje i o del día.
La popula idad de es os pos s sacudió Twi e po comple o, en las dos p ime as
semanas del año 2022 se publica on más de un millón doscien as mil pa idas en
o ma o wee [8]. La ed social no a dó en se inundada po pa idas de cien os de
miles de usua ios y Wo dle se con i ió en un enómeno de masas.
Du an e el anscu so del año Twi e se ha con e ido en un eposi o io de pa idas
de Wo dle gigan esco. Pese a que las publicaciones no con ienen las palab as li e a-
les in oducidas po los usua ios, la in o mación p opo cionada po los colo es y los
me ada os de los pos s nos pe mi en a en u a la di icul ad de las palab a obje i o
del día y cons ui una idea gene al de la e olución de la habilidad de los jugado es.
4Capí ulo 1. In oducción
Es e inusual enómeno, acompañado de la masi a can idad de da os eales gene-
ados y de mi a ición po los puzzles de palab as me ha mo i ado a cen a el ema
de es e abajo en la ob ención, análisis y es udio de es as pa idas. Es amos an e
una g an can idad de da os que oda ía no se han analizado en p o undidad. Po
ello en es e abajo p e endemos accede a es os, p ocesa los, gene a un conjun o de
pa idas, hace lo público, analiza el compo amien o de los jugado es, clasi ica los
e in en a imi a los median e algo i mos de ap endizaje au omá ico.
El uso de algo i mos de ap endizaje au omá ico y de la in eligencia a i icial (IA) no
es a bi a io, la IA ha enido un impac o signi ica i o en muchas indus ias, inclu-
yendo la de los juegos. Si bien los ideojuegos han sido uno de los ocos p incipales
de la in es igación en es a, los juegos más casuales ambién han is o un impac o
impo an e de es e desa ollo. La elación en e la in es igación en IA y los juegos
se puede e en muchas á eas, como el diseño, la jugabilidad y la expe iencia del
jugado [50] y, además, se ha u ilizado en el diseño de juegos pa a c ea oponen es
in eligen es y desa ian es pa a es os [41]. Analizando los da os de la jugabilidad y
las es a egias humanas, se pueden desa olla algo i mos e icaces e in eligen es que
simulan el compo amien o de los jugado es humanos [37]. Es o ha esul ado en
una jugabilidad más desa ian e y es a égica pa a los jugado es, así como en una
expe iencia más ag adable pa a aquellos que p e ie en ba i se con a oponen es no
humanos [7].
En é minos de jugabilidad, la IA se ha u ilizado pa a c ea expe iencias más ea-
lis as e inme si as. La IA puede c ea oponen es in eligen es que ajus an su juego
en unción de los mo imien os ealizados po el jugado humano. Es o c ea una ex-
pe iencia más ealis a e inme si a pa a los jugado es, así como una jugabilidad más
desa ian e y dinámica.
El uso de la IA en el que nos amos a cen a en es e p oyec o es el de imi a
el compo amien o humano, exis en múl iples ap oximaciones en e las cuales des-
acamos las siguien es:
Ap endizaje po imi ación: ambién conocido como clonación conduc ual.
Implica en ena a agen es de IA pa a imi a a jugado es humanos ap endiendo
de demos aciones de expe os. Es a écnica se ha aplicado con éxi o en a ios
dominios de juego. Po ejemplo, en los juegos de A a i [35] donde se en enó una
ed neu onal con olucional median e una a ian e del algo i mo de Q-lea ning
[48], ambién se pueden u iliza es as écnicas pa a acele a el ap endizaje
de algunos algo i mos como el ‘DQN’ de DeepMind que ap ende a juga de
mane a au ónoma a pa i de un conjun o de dimensionalidad muy al a [36],
con un no able cos e compu acional, no obs an e, el uso de pa idas humanas
en el comienzo del en enamien o, pe mi e educi no ablemen e el iempo de
ap endizaje [14]. Es e en oque esul a muy ú il ya que pe mi e a los agen es
imi a a jugado es humanos de cualquie ni el siemp e que se disponga de
su icien es da os y capacidad de cómpu o.
1.2. Obje i os 5
IA adap a i a: Imi a jugado es no solo se limi a a eplica sus acciones,
sino que ambién implica comp ende sus p ocesos de oma de decisiones y
su compo amien o. El modelado de jugado es iene como obje i o cap u a
y p edeci las acciones, p e e encias y es a egias de los jugado es humanos.
A di e encia de los sis emas de ap endizaje po imi ación, los sis emas de mo-
delado son lexibles y pueden adap a se a nue os da os, son pa icula men e
ú iles en la c eación de ad e sa ios que mejo an sus capacidades a lo la go
de la pa ida g acias a los inpu s p opo cionados po los jugado es [51]. Los
algo i mos u ilizados en es os casos son mucho más a iados, po ejemplo se
u ilizan edes de des ilación expe a que se en enan median e a iables adap-
a i as del algo i mo Q-lea n [47] y ambién exis en ap oximaciones median e
edes neu onales gene a i as ad e sa ias (GAN) [17, 20].
Re oalimen ación humana: O o en oque pa a imi a a los jugado es im-
plica sesga el ap endizaje di ec amen e usando el eedback p opo cionado po
los jugado es. Es deci , los modelos se en enan con pa idas eales y as ob-
se a las acciones ealizadas, se e alúa su compo amien o. Pos e io men e
los jugado es pueden ealiza indicaciones o cambios que modi ican el compo -
amien o del agen e en una si uación de e minada sesgando así el ap endizaje
u u o. Es e mé odo, ambién conocido como ap endizaje in e ac i o a pa -
i de demos aciones, pe mi e que los sis emas de IA imi en y se adap en
a las p e e encias y ma ices de los jugado es humanos aunque equie e una
supe isión cons an e [10, 33, 32].
1.2. Obje i os
Con es e abajo se p e ende:
O1. Recopila , limpia y publica un conjun o de da os de pa idas.
O2. Analiza los da os de pa idas y del ocabula io usado.
O3. Encon a pa ones en los da os analizados, especialmen e aquellos co espon-
dien es a dis in os ipos de jugado es.
O4. C ea p og amas capaces de imi a a los di e en es ipos de jugado encon a-
dos.
O5. Compa a los esul ados de los modelos con pa idas eales.
O6. E alua los di e sos modelos gene ados y ob ene da os sob e su ap endizaje
y los usua ios que in en an modela .
O7. Comp ende la base de jugado es, en pa icula la elación del endimien o de
es os y su ocabula io, así como, las es a egias empleadas.
O8. Ca ac e iza a los jugado es según los pa ones encon ados y su ocabula io
in e ido.
6Capí ulo 1. In oducción
En gene al, es e p oyec o busca p opo ciona in o mación aliosa sob e el compo -
amien o del jugado y ca ac e iza lo.
1.3. Plan de abajo
Pa a log a los obje i os desc i os en el apa ado an e io , se ha aco dado ealiza
euniones cada dos semanas en e el au o y el di ec o del abajo. Conside ando lo
an e io , se han es ablecido los siguien es hi os pa a o ganiza el abajo a ealiza
en es e p oyec o:
Ob ención de los da os. (Del 5 al 19 de oc ub e de 2022)
Limpieza de los da os. (Del 19 de oc ub e al 16 de no iemb e de 2022)
Realización del análisis explo a o io de los da os. (Del 16 de no iemb e al 8
de diciemb e de 2022)
P ocesamien o y c eación de clús e s sob e los da os. (Del 8 de diciemb e de
2022 al 22 de eb e o de 2023)
C eación de modelos de in eligencia a i icial basados en los esul ados ob e-
nidos en la e apa an e io . (Del 22 de eb e o al 29 de ma zo de 2023)
E aluación de los modelos y selección de los modelos. (Del 29 de ma zo al 12
de ab il de 2023)
Ob ención de in o mación a pa i de los modelos y el p ocesamien o de da os.
(Del 12 al 26 de ab il de 2023)
Den o del iempo de cada obje i o ambién se con abiliza el iempo dedicado a la
edacción de la memo ia del p oyec o. Hemos decidido man ene la úl ima quincena
an es de la en ega sin asigna pa a e mina la memo ia y ambién como iempo
ex a en caso de que su ja algún con a iempo.
1.4. Código uen e
El desa ollo de los dis in os apa ados de es e p oyec o se ha ealizado en su in-
eg idad en el lenguaje Py hon, haciendo uso de la he amien a Jupy e No ebook
que pe mi e almacena los g á icos gene ados. El p oyec o en su o alidad se encuen-
a en el eposi o io de Gi hub público siguien e h ps://gi hub.com/Osca Cal/
Imi a ingWo dlePlaye s con licencia MIT o ganizado po capí ulos.
Además el conjun o de pa idas gene ado se encuen a ambién en un eposi o-
io público de la página Kaggle bajo la u l: h ps://www.kaggle.com/da ase s/
sca cal e sis/wo dle-games con una licencia CC BY-SA 4.0.
Cap´
ı ulo 2
In oduc ion
“E en hough I play i e e y day, I s ill eel a sense o
accomplishmen when I do i : i makes me eel sma , and
people like ha ”
— Josh Wa dle, c eado de Wo dle
2.1. Mo i a ion
Wo dle is a wo d game ha e olu ionized he social ne wo k Twi e a he
beginning o he yea 2022, was c ea ed by Josh Wa dle and cu en ly belongs o
he newspape The New Yo k Times, being pa o he epe oi e o pas imes o
digi al edi ions. The game in ol es guessing a i e-le e wo d ha changes e e y
day, wi h he goal o guessing i in six o ewe ies. The playe ecei es eedback
on how simila he wo d en e ed is o he sec e wo d a e each a emp in he
o m o colo ed squa es ha indica e whe he a le e in he guessed wo d is co ec ,
inco ec o in he w ong place. The game has gained immense popula i y, wi h
playe s sha ing hei achie emen s on social ne wo ks and compe ing wi h hei
iends o ge he longes s eak o co ec guesses in he ewes numbe o ies. On
each a emp he playe en e s a wo d in o a g id and he game colo s he le e s in
he g id g een, yellow o g ay based on he ollowing ules:
The en e ed le e is colo ed g een i i is in he a ge wo d and occupies he
same posi ion.
The en e ed le e is colo ed yellow i i appea s in he a ge wo d bu is no
in he same posi ion.
The en e ed le e is colo ed g ay i i does no appea in he a ge wo d.
Mul iple occu ences o he same le e in he en e ed wo d will be colo ed
g een o yellow ollowing he abo e ules only i hey appea mul iple imes in
he a ge . In any o he case, he emaining epea ed le e s will be colo ed
g ay.
7

8Capí ulo 2. In oduc ion
Figu a 2.1: Example o a game
To be e exempli y he ules desc ibed abo e, in igu e 2.1 you can see he colo
combina ions e u ned by he wo ds en e ed in a game whose a ge wo d is abbey.
Wo dle’s success can be a ibu ed o he p inciples o gami ica ion i embodies.
One o he main easons people like o play is he sense o accomplishmen and
achie emen associa ed wi h success. Wo dle is designed o p o ide ins an eedback
and ewa ds o playe s, making i mo e sa is ying and engaging han a adi ional
wo d game. The game’s simplici y and ease o use also make i accessible o a wide
ange o playe s, om casual game s o mo e se ious en husias s [29]. Ano he way
Wo dle uses gami ica ion o mo i a e playe s is h ough compe i ion. The game en-
cou ages playe s o compe e agains hei iends and o he playe s, os e ing a sense
o communi y and cama ade ie. The compe i i e na u e o he game c ea es a sense
o u gency and exci emen ha keeps playe s engaged and mo i a ed o keep playing.
This has led o a g ea ondness o Wo dle and consequen ly i s communi y o
playe s has g own and e ol ed, di e si ying in he p ocess and gene a ing playe s
wi h a ied s a egies [46]. Al hough he e is no da a on playe s p io o he ac-
quisi ion by he New Yo k Times and he newspape keeps i s s a is ics on he
game p i a e, he e a e se e al a icles by he company i sel de ailing a ious ypes
o playe s and hei s a egies [2, 16]. A e compiling hem we ha e ob ained he
ollowing ca ego ies:
The casual game : The casual game ela es o Wo dle as a leisu e ac i i y,
seeking en e ainmen and men al s imula ion. They enjoy he simplici y o he
game and o en play in e mi en ly. Casual playe s gene ally ely on in ui ion,
2.1. Mo i a ion 9
wo d associa ion and knowledge o a e age ocabula y o make hei a emp s.
They end o use only candida e solu ion wo ds al hough hey do no choose
hem ideally o dec ease he size o he emaining wo d se .
Pa e n hun e : Pa e n hun e s pay close a en ion o he eedback p o ided
by he game. They obse e how he wo d changes wi h each esponse and use
his in o ma ion e icien ly o na ably disc imina e he emaining se o wo ds.
Despi e his, hey s ill almos exclusi ely use candida e solu ion wo ds on each
a emp .
The s a egis : S a egis s app oach Wo dle wi h a p emedi a ed ial-and-
e o s a egy. Thei ini ial a emp s ep esen a wide ange o possibili ies
seeking o educe he solu ion space as much as possible and hen adjus hei
subsequen a emp s based on he eedback ecei ed. This clea ly di e en ia ed
wo-pa p ocess whose change occu s be ween he second and hi d a emp
allows his g oup o guess he wo d wi h a lowe a e age numbe o a emp s
han he o he wo.
These cha ac e iza ions allow us o ob ain a i s app oxima ion o he ypes o
playe s, bu since we do no ha e he da a om which he in o ma ion has been
in e ed, hey a e no pa icula ly use ul. Howe e , Wo dle has a unc ionali y ha
will allow us o ob ain millions o games.
In he i s week o he yea 2022, Wo dle had a ound h ee hund ed housand
ac i e daily use s [46], in he second week his numbe inc eased o h ee million
[21]. This inc ease coincided wi h he implemen a ion o he game sha ing unc io-
nali y on a ious social ne wo ks ha was launched on he i s day o he yea , his
enhancemen allowed use s o gene a e pos s con aining UTF-8 cha ac e s co es-
ponding o squa es wi h he colo s ob ained in hei a emp s. This o ma allowed
playe s o pos and sha e hei games wi hou e ealing he a ge wo d o he day.
The popula i y o hese pos s shook Twi e comple ely, in he i s wo weeks o he
yea 2022 mo e han one million wo hund ed housand games we e published in he
wee o ma [8]. The social ne wo k was soon looded wi h games om hund eds o
housands o use s and Wo dle became a mass phenomenon.
O e he cou se o he yea Twi e has become a gigan ic eposi o y o Wo dle
games. Al hough he pos s do no con ain he li e al wo ds en e ed by use s, he
in o ma ion p o ided by he colo s and me ada a o he pos s allow us o guess he
di icul y o he day’s a ge wo ds and o build a gene al idea o he e olu ion o
he playe s’ skill.
This unusual phenomenon, oge he wi h he massi e amoun o eal da a gene-
a ed and my ondness o wo d puzzles, has mo i a ed me o ocus he subjec o
his pape on he collec ion, analysis and s udy o hese games. We a e aced wi h
a la ge amoun o da a ha ha e no ye been analyzed in dep h. The e o e, in his
wo k we in end o access hese da a, p ocess hem, gene a e a se o games, make
10 Capí ulo 2. In oduc ion
hem public, analyze he beha io o he playe s, classi y hem and y o imi a e
hem by means o machine lea ning algo i hms.
The use o machine lea ning algo i hms and a i icial in elligence (AI) is no a -
bi a y; AI has had a signi ican impac on many indus ies, including gaming.
While ideo games ha e been a majo ocus o AI esea ch, mo e casual games
ha e also seen a signi ican impac om his de elopmen . The ela ionship be ween
AI esea ch and games can be seen in many a eas, such as design, gameplay and
playe expe ience [50], and has also been used in game design o c ea e in elligen
and challenging opponen s o games [41]. By analyzing gameplay da a and human
s a egies, e icien and in elligen algo i hms can be de eloped ha simula e he
beha io o human playe s [37]. This has esul ed in mo e challenging and s a egic
gameplay o playe s, as well as a mo e enjoyable expe ience o hose who p e e o
ba le agains non-human opponen s [7].
In e ms o gameplay, AI has been used o c ea e mo e ealis ic and imme si e
expe iences. The AI can c ea e in elligen opponen s ha adjus hei gameplay
based on he mo es made by he human playe . This c ea es a mo e ealis ic and
imme si e expe ience o playe s, as well as mo e challenging and dynamic gameplay.
The use o AI ha we a e going o ocus on in his p ojec is o imi a e human
beha io , he e a e mul iple app oaches among which we highligh he ollowing:
Imi a ion lea ning: also known as beha io al cloning. I in ol es aining
AI agen s o mimic human playe s by lea ning om expe demons a ions.
This echnique has been success ully applied in se e al gaming domains. Fo
example, in A a i [35] games whe e a con olu ional neu al ne wo k was ained
using a a ian o he Q-lea ning algo i hm. [48], i is also possible o use
hese echniques o accele a e he lea ning o some algo i hms such as he
‘DQN’ o DeepMind which lea ns o play au onomously om a e y high
dimensionali y se [36], wi h a ema kable compu a ional cos , howe e , he use
o human games a he beginning o he aining, allows o educe signi ican ly
he lea ning ime [14]. This app oach is e y use ul as i allows agen s o imi a e
human playe s o any le el as long as su icien da a and compu a ional powe
a e a ailable.
Adap a i e AI: Mimicking playe s is no only limi ed o eplica ing hei
ac ions, bu also in ol es unde s anding hei decision-making p ocesses and
beha io . Playe modeling aims o cap u e and p edic he ac ions, p e e ences
and s a egies o human playe s, unlike imi a ion lea ning sys ems, modeling
sys ems a e lexible and can adap o new da a, hey a e pa icula ly use ul
in he c ea ion o ad e sa ies ha imp o e hei capabili ies h oughou he
game hanks o he inpu s p o ided by he playe s [51]. The algo i hms used in
hese cases a e much mo e a ied, o example expe dis illa ion ne wo ks a e
used ha a e ained by adap i e a iables o he algo i hm Q-lea n [47] and
he e a e also app oaches using gene a i e ad e sa ial neu al ne wo ks (GAN)
[17, 20].
2.2. Goals 11
Human eedback: Ano he app oach o imi a e playe s in ol es biasing lea -
ning di ec ly using he eedback p o ided by he playe s. Tha is, models a e
ained wi h eal games and a e obse ing he ac ions pe o med, hei beha-
io is e alua ed. Subsequen ly, he playe s can make indica ions o changes
ha modi y he agen ’s beha io in a gi en si ua ion, hus biasing u u e lea -
ning. This me hod, also known as in e ac i e lea ning om demons a ions,
allows AI sys ems o mimic and adap o he p e e ences and nuances o human
playe s al hough i equi es cons an moni o ing [10, 33, 32].
2.2. Goals
Wi h his p ojec we aim o:
O1 Collec , clean and publish a da ase o Wo dle games.
O2 Analyze he games and he ocabula y used in hem.
O3 Find pa e ns in he analyzed da a, especially hose co esponding o di e en
ypes o playe s.
O4 C ea e p og ams capable o imi a ing he di e en ypes o playe s ound
O5 Compa e he esul s o he models wi h eal games.
O6 E alua e he a ious models gene a ed and ob ain da a on hei lea ning and
he use s hey a emp o model.
O7 Unde s and he playe base, in pa icula he ela ionship o playe pe o man-
ce and ocabula y, as well as he s a egies employed.
O8 Cha ac e ize playe s acco ding o he pa e ns ound and hei in e ed oca-
bula y.
O e all, his p ojec seeks o p o ide aluable in o ma ion on playe beha io and
cha ac e ize he playe .
2.3. Wo k plan
In o de o achie e he objec i es desc ibed in he p e ious sec ion, i has been
ag eed o hold mee ings e e y wo weeks be ween he au ho and he di ec o o
he wo k. Conside ing he abo e, he ollowing miles ones ha e been es ablished o
o ganize he wo k o be done in his p ojec :
Da a collec ion (F om Oc obe 5 o Oc obe 19, 2022)
Da a cleaning (F om Oc obe 19 o No embe 16, 2022)
Explo a o y da a analysis (F om No embe 16 o Decembe 8, 2022)
18 Capí ulo 3. T abajos elacionados
3.3.1. Algo i mo gené ico pa a Mas e mind
Los algo i mos gené icos han o ecido una isión nue a al p oblema de esol-
e Mas e mind y es o ha lle ado a la c eación de modelos que a an minimiza
el núme o in en os po debajo del lími e es ablecido po Knu h. A con inuación se
p esen an los di e sos pa áme os empleados po Be ghman, Goossens y Leus pa a
gene a un decodi icado con una media de in en os in e io al algo i mo de Knu h
[4], la es uc u a de es e se de ine en el pseudocódigo 1 donde el conjun o de a-
lo es posibles en cada in en o se ep esen a como ˆ
Eiy donde se añaden dos ases
adicionales al p oceso de mu ación: la pe mu ación y la in e sión.
Algo i mo 1: Algo i mo gené ico pa a Mas e mind
i←1;
Fija y e alua selección inicial pa a g1;
Ob ene espues a X1eY1;
while Xi=Pdo
i←i+ 1;
ˆ
Ei← {};
h←1;
Inicializa población;
while h≤maxgen AND |ˆ
Ei| ≤ maxsize do
Gene a nue a población median e el c uce de indi iduos;
Aplica las unciones de mu ación, pe mu ación e in e sión a los indi iduos;
Calcula el alo de i ness;
Añadi combinaciones posibles a ˆ
Ei;
h←h+ 1;
end while
E alua gi∈ˆ
Ei;
Ob ene espues a XieYi;
end while
Rep esen ación c omosómica: Los indi iduos de cada gene ación se ep e-
sen an como una lis a de lis as de cua o núme os na u ales del uno al seis
que ep esen an cada uno de los colo es del código, cada lis a del indi iduo
se co esponde con un in en o. La p ime a lis a de cada indi iduo se inicializa
con una combinación alea o ia.
Núme o de indi iduos po gene ación: Cada gene ación posee cien o
cincuen a indi iduos.
Función de i ness: Pa a calcula el alo de i ness del código cdel úl imo
in en o de un indi iduo se deben conside a los alo es de i ness de sus in en os
an e io es giy de e mina el núme o de ichas neg as X′
i(c)y ichas blancas
Y′
i(c)que se hubie an ob enido si el código sec e o hubie a sido gicon los
alo es ealmen e ob enidos Xi(C)yYi(c). A p io i pod ía pa ece que se
debe ía da un mayo peso a las ichas neg as pues el obje i o del juego es

3.4. Modelado de jugado es 19
ob ene cua o de ellas, no obs an e como solo se comp ueban combinaciones
álidas (según las ichas ob enidas en los in en os an e io es) las ichas de
colo es ue a de luga apo an in o mación ele an e en los conjun os educidos.
En pos de gene aliza la unción al máximo, se incluye un ac o a > 0que
mul iplica a las di e encias de ichas neg as. Pa a e mina , se añade un é mino
Pp opo cional al núme o de in en os y un peso bque de e mina la impo ancia
ela i a de es e é mino con espec o a las di e encias de las ichas ob enidas.
Resul an emen e, la unción en unción de la combinación cy el núme o de
in en o ise puede ep esen a median e la ó mula 3.2.
(c;i) = a

i
X
q=1


X′
q(c)−Xq(c)



+
i
X
q=1


Y′
q(c)−Yq(c)

+bP(i−1) (3.2)
C uce: T as la gene ación del alo de i ness se ealiza un c uce de uno o
dos pun os (cada opción con una p obabilidad de 0,5) sob e los indi iduos, la
p obabilidad de selección de un indi iduo es p opo cional a su alo de i ness.
Mu ación: Con una p obabilidad del 0,03, después de e mina el c uce se
ealiza una mu ación que modi ica alea o iamen e el colo de una posición.
Pe mu ación: Con una p obabilidad del 0,03, después de in en a ealiza una
mu ación se pueden pe mu a la posición de dos colo es de la ep esen ación
del indi iduo.
In e sión: Con una p obabilidad de 0,02, después de in en a ealiza una
in e sión se pueden selecciona alea o iamen e dos posiciones y la secuencia
comp endida en e es as se in ie e.
Eliminación de in iduos: Si as el p oceso de c uce, mu ación, pe mu a-
ción e in e sión el código esul an e ya igu a en la nue a población, es e es
desca ado.
3.4. Modelado de jugado es
Las aplicaciones de la IA que más nos in e esan en es e p oyec o son las de imi-
ación de jugado es. La capacidad de simula y eplica el compo amien o humano
no es ácil, y en la mayo ía de casos esul a incluso más complicado que a a de e-
sol e óp imamen e el juego [38]. A pesa de es o, exis en múl iples ap oximaciones
a es e p oblema que de allamos a con inuación:
3.4.1. DQN
Las Deep Q-lea ning ne wo ks son un ipo de algo i mo que p esen a un en o-
que inno ado que combina edes neu onales p o undas y ap endizaje po e ue zo
pa a log a un compo amien o igual o supe io al humano en un en o no complejo
de e minado [35].
20 Capí ulo 3. T abajos elacionados
La idea p incipal de ás del algo i mo es el ap endizaje di ec o a pa i de una
en ada senso ial en c udo, como imágenes o ídeos, sin ningún conociemien o p e-
io y que los agen es omen decisiones y ealicen acciones en en o nos complejos.
Pa a ap oxima la unción Q, que ep esen a las ecompensas u u as espe adas pa-
a cada acción en un es ado dado se u iliza una ed neu onal p o unda. Al es ima
la unción Q, un agen e puede de e mina la mejo acción a oma en un es ado
pa icula pa a maximiza su ecompensa acumulada a lo la go del iempo.
A con inuación desc ibimos los mecanismos y elemen os empleados po el algo i mo:
Expe ience eplay: El agen e almacena sus expe iencias (que consis en en es-
ado, acción, ecompensa y siguien e es ado) en un bú e de epe ición. Luego,
es e bú e se mues ea alea o iamen e du an e el p oceso de ap endizaje pa a
ompe las co elaciones empo ales y mejo a la e iciencia del ap endizaje.
Red neu onal p o unda: DQN u iliza una ed neu onal p o unda, no mal-
men e una ed neu onal con olucional (CNN), como un ap oximado de un-
ciones. La ed oma el es ado ac ual como en ada y p oduce un alo -Q pa a
cada posible acción. La ed se en ena pa a minimiza la di e encia en e los
alo es-Q p edichos y los alo es-Q obje i o.
Red obje i o: Pa a es abiliza el p oceso de ap endizaje, DQN in oduce una
ed obje i o sepa ada, que es una copia de la ed p incipal. La ed obje i o
se ac ualiza pe iódicamen e con los pesos de la ed p incipal pe o no con la
misma ecuencia, p opo cionando un obje i o consis en e en el iempo pa-
a la es imación de los alo es-Q man eniendo la a ención del modelo en los
obje i os p incipales.
Explo ación s. Explo ación: DQN equilib a la explo ación (p oba nue as
acciones) y la explo ación (u iliza el conocimien o ac ual pa a maximiza las
ecompensas). Es o se log a ípicamen e median e una polí ica ϵ-g eedy, donde
el agen e elige una acción alea o ia con una cie a p obabilidad ϵy selecciona
la acción con el alo -Q p edicho más al o en caso con a io.
Al mejo a i e a i amen e la es imación de la unción Q a a és del p oceso de
en enamien o, DQN pe mi e que el agen e imi e el compo amien o de su en ada
senso ial y ambién es capaz de desa olla es a egias óp imas o casi óp imas pa a
un en o no dado. DQN ha log ado éxi os des acados, como domina a ios juegos
de A a i 2600 y log a un endimien o humano en dominios complejos [35, 36]. Si
bien en un comienzo se ha u ilizado pa a c ea jugado es óp imos, la imi ación de
jugado es apa ece cada ez más en es e ipo de algo i mos, ya sea como el obje i o
inal del abajo [52] o como u ilidad pa a acele a el ap endizaje en las p ime as
e apas de un modelo de jugado óp imo [39].
3.4.2. Ap endizaje po e ue zo p o undo a pa i de p e e-
encias humanas
El ap endizaje po e ue zo p o undo a pa i de las p e e encias humanas es p o-
ceso que pe mi e a un agen e ap ende a pa i de la e oalimen ación o p e e encias
3.4. Modelado de jugado es 21
humanas en luga de las señales de ecompensa adicionales en el ap endizaje po
e ue zo [10].
En muchos escena ios del mundo eal, puede esul a desa ian e o consumi mu-
cho iempo diseña una unción de ecompensa que cap u e de mane a p ecisa el
compo amien o deseado. En es e mé odo, se u ilizan e aluado es humanos que p o-
po cionan compa aciones bina ias o clasi icaciones de di e en es ayec o ias o ac-
ciones, indicando sus p e e encias al agen e que se desea en ena .
A con inuación p esen amos los mecanismos y componen es p incipales de es os
algo i mos:
Re oalimen ación basada en compa aciones: En luga de p opo ciona
ecompensas explíci as, los e aluado es humanos b indan p e e encias en e
pa es de ayec o ias o acciones. Po ejemplo, pa a compa a dos es a egias
de conducción di e en es o elegi la mejo acción en una si uación de e mina-
da. Es a e oalimen ación basada en compa aciones se u iliza pa a guia el
p oceso de ap endizaje.
Ag egación de la e oalimen ación humana: La e oalimen ación hu-
mana se debe adap a como una única señal de ecompensa o polí ica. Un en-
oque posible consis e en en ena un modelo de ecompensa u ilizando ap en-
dizaje supe isado pa a p edeci los juicios de p e e encia de los e aluado es
humanos. Es e modelo de ecompensa se u iliza jun o con el ap endizaje po
e ue zo pa a op imiza el compo amien o del agen e.
Ap endizaje de ecompensa ad e sa ial: Se u iliza un en oque ad e sa ial
en el que se en ena un modelo de ecompensa que compi e con a un segundo
modelo llamado polí ica de compo amien o. La polí ica de compo amien o
iene como obje i o gene a ayec o ias que sean di íciles de clasi ica co ec-
amen e po el modelo de ecompensa. Median e ac ualizaciones i e a i as de
ambos modelos, el agen e puede ap ende una polí ica op imizada basada en
las p e e encias humanas.
E aluación del endimien o: Pa a e alua el endimien o de la polí ica
ap endida se debe ealiza una compa ación con la polí ica de compo amien o
y, además, u iliza e oalimen ación adicional de los e aluado es humanos.
Es e en oque iene aplicaciones en di e sos campos donde esul a desa ian e de i-
ni explíci amen e una unción de ecompensa, como la conducción au ónoma, la
obó ica y los sis emas de ecomendación pe sonalizados. Al in oluc a a los e alua-
do es humanos en el p oceso de ap endizaje, se ayuda a ce a la b echa en e los
algo i mos de ap endizaje au omá ico y las p e e encias humanas, lo que conduce a
compo amien os más in ui i os, deseables y humanos.
22 Capí ulo 3. T abajos elacionados
3.4.3. Ap endizaje po imi ación a a és de la es imación de
polí icas de apoyo expe as
El ap endizaje po imi ación a a és de la es imación de polí icas de apoyo
expe as es un en oque no edoso pa a el ap endizaje po imi ación, una ama del
ap endizaje au omá ico en la que un agen e ap ende a imi a el compo amien o de
un expe o obse ando sus demos aciones [47].
En el ap endizaje po imi ación adicional, el agen e ap ende di ec amen e de las
demos aciones del expe o minimizando la disc epancia en e sus p opias acciones
y las acciones del expe o. Sin emba go, es e en oque iene limi aciones, como el
p oblema del cambio co a ian e, donde la dis ibución de es ados encon ados po
el agen e du an e el en enamien o puede di e i de las demos aciones del expe o.
Es o puede lle a a un endimien o subóp imo.
Pa a abo da es e p oblema, se p opone un mé odo que es ima la polí ica del ex-
pe o, que ep esen a la p obabilidad de que el expe o ome acciones especí icas
en di e en es es ados. Al es ima es a polí ica, el agen e puede adap a se mejo a
di e en es es ados e imi a de mane a más p ecisa el compo amien o del expe o.
De allamos los mecanismos y componen es más impo an es de es e mé odo:
Es imación del sopo e de la polí ica del expe o: El mé odo se cen a en
es ima la polí ica del expe o, que ep esen a la dis ibución de p obabilidad
de las acciones en unción de los di e en es es ados. Es a es imación se ealiza
u ilizando un modelo de ecompensa, que p edice la ecompensa acumulada
espe ada al oma una acción especí ica en un es ado dado, y un modelo de
azón de densidad, que es ima la densidad ela i a de las acciones del expe o
en compa ación con las acciones del agen e.
Clonación de compo amien o con sopo e: Se combina la clonación de
compo amien o, una écnica en la que el agen e imi a di ec amen e las ac-
ciones del expe o, con el sopo e de la polí ica es imado. La clonación de
compo amien o se u iliza pa a en ena la polí ica del agen e pa a imi a al
expe o. Al inco po a el sopo e de la polí ica es imado, el agen e puede ene
en cuen a las di e encias en el compo amien o en e el expe o y el agen e, lo
que mejo a el endimien o gene al de la imi ación.
Ap endizaje de imi ación ad e sa ial: Se u iliza una a ian e ad e sa ial
que implica en ena una ed disc imina o ia que iene como obje i o dis in-
gui en e las acciones del expe o y las acciones del agen e. La polí ica se
en ena pa a maximiza el e o del disc iminado , engañándolo e ec i amen e
e imi ando el compo amien o del expe o.
Es e mé odo p opues o supe a a los en oques adicionales de clonación de com-
po amien o, especialmen e en escena ios con cambio co a ian e. El sopo e de la
polí ica es imado ayuda al agen e a adap a se a di e en es es ados, lo que esul a en
una mejo a en el endimien o de la imi ación.
Cap´
ı ulo 4
Recopilación y limpieza de las pa idas
Como p ime paso de es e p oyec o, al y como se de alló en la plani icación, se
p ocede a ecopila pa idas publicadas en Twi e . La ecopilación de wee s puede
se una excelen e mane a de ob ene da os pa a un p oyec o de ciencia de da os, ya
que pe mi e a los in es igado es accede a una g an can idad de con enido gene ado
po los usua ios. La API de Twi e b inda a los desa ollado es acceso y pe misos
especiales a la pla a o ma, incluidos wee s, pe iles de usua io y mé icas de pa ici-
pación. Sin emba go, ecopila wee s pa a un p oyec o de ciencia de da os equie e
una cuidadosa conside ación de cues iones é icas y legales, como la p i acidad del
usua io, la p opiedad de los da os y los é minos de se icio de Twi e . Además,
la calidad y la ele ancia de los da os ecopilados deben e alua se cuidadosamen e
pa a ga an iza que se alineen con los obje i os y la me odología de la in es igación.
Po ello conside amos ele an e explici a el p oceso de ob ención así como la ma-
nipulación ealizada pos e io men e y así acili a la comp ensión del conjun o con
el que se abaja á en los capí ulos pos e io es.
4.1. Recopilación de los wee s
Pa a pode ealiza una ecopilación au oma izada de los wee s, en p ime lu-
ga se deben ija los p e equisi os que los es os debían cumpli . En es e p oyec o
nos cen a emos únicamen e en las pa idas en inglés publicadas en e los días 1 de
ene o y el 15 de no iemb e de 2022. La imagen 4.1 mues a el o ma o de los wee s
álidos, como podemos comp oba , es os degen con ene la abla con los cuad ados
co espondien es al eedback ob enido, en núme o de in en os y el iden i icado de
pa ida.
Pa a conc e a el c i e io pa a ecolec a un wee u ilizamos el o ma o de inido
po Wo dle pa a compa i una pa ida que especi icamos a con inuación: la p ime-
a ase sigue la siguien e exp esión egula : Wo dle [0-9]{3} [1-6,X]/6 donde el
p ime bloque de nume os después de la palab a Wo dle hace e e encia al núme o de
juego (que aumen a en uno cada día) y el segundo bloque hace e e encia al núme o
de in en os en los que se ha inalizado la pa ida (en caso de pe de la pa ida se
coloca una equis mayúscula pa a en luga de un dígi o). Es a p ime a exp esión es
23

24 Capí ulo 4. Recopilación y limpieza de las pa idas
Figu a 4.1: Ejemplo de wee s ecopilados
p ecedida po an as líneas como in en os ealizados que con ienen cinco cuad ados
de es colo es dis in os: e de, ama illo o neg o. Al depende del núme o de in en os,
no podemos gene a una exp esión egula pa a ellas in e p e able po el buscado
de Twi e [44] y po lo an o ecopila emos los wee s que con engan solamen e la
p ime a exp esión egula .
El p oceso de au oma ización se ha ealizado median e la lib e ía snsc ape de
Py hon que implemen a el módulo snsc ape.modules. wi e que pe mi e ea-
liza búsquedas y ecopilaciones de wee s de mane a ela i amen e simple. Es as
búsquedas se han con igu ado de mane a que de cada día en nues a anja em-
po al de explo ación ex aiga has a cinco mil wee s de cada uno de los in en os,
es deci , que de cada día ex aiga a lo sumo ein a y cinco mil wee s. Pa a ace-
le a es e p oceso de ecopilación, se ha pa alelizado el abajo median e la lib e ía
mul ip ocessing y ambién se han di idido los da os en paque es co espondien es
a días. De cada wee se gua da la siguien e in o mación:
Fecha y ho a de publicación o iginal.
Twee Id, un ID p opia de la pla a o ma que es único pa a cada wee publi-
cado po un usua io.
Tex o del wee , que debe con ene la exp esión egula de inida an e io -
men e.
Nomb e de usua io: indica el nomb e del au o .
URL con el enlace al wee público, es posible que algunos ya no es én dispo-
nibles ya que en cualquie momen o una cuen a puede decidi bo a u ocul a
sus wee s.
4.2. Limpieza de los da os 25
Figu a 4.2: Fo ma o de ini i o de los da os con el nomb e de usua io ocul o
4.1.1. Ex acción de las a iables
T as ob ene las a iables en c udo hemos p ocedido a p ocesa las pa a ex ae la
in o mación necesa ia de cada una. Sal o po el ex o del wee , el es o de a iables
p opo cionadas po snsc ape no equie en ningún a amien o p e io. Pa a ex ae
los da os de las pa idas hemos u ilizado la lib e ía e de Py hon que nos pe mi e
analiza y manipula s ings median e exp esiones egula es, en nues o caso hemos
u ilizado una expe sión que encon aba odas las cadenas de cinco cuad ados de
colo es den o de un wee y hemos colocado cada apa ición en un a ay que es
el alo que hemos u ilizado en abla de da os. Además hemos gua dado el ex o
o iginal po edundancia, una ez ex aídos los in en os hemos gene ado una a iable
ex a que con iene el núme o de in en os de la pa ida, que se co esponde con la
longi ud del a ay ob enido. En la igu a 4.2 podemos e el o ma o de ini i o.
4.2. Limpieza de los da os
Realiza la limpieza de da os es un paso c ucial en cualquie p oyec o de análisis
de da os, incluido el análisis de wee s sob e juegos de Wo dle. Twi e es una pla-
a o ma con un con ol de con enido ela i amen e pequeño, lo que puede esul a
en da os uidosos, i ele an es o engañosos. La limpieza de da os es el p oceso de
iden i ica y co egi o elimina e o es, inconsis encias e imp ecisiones en los da os
pa a mejo a su calidad y con iabilidad. En el con ex o del análisis de wee s sob e
juegos de Wo dle, la limpieza de da os puede ayuda a elimina spam,bo s, wee s
i ele an es y pa idas engañosas. Al ealiza es a limpieza nos asegu a emos de que
los da os que u ilizamos pa a el análisis son p ecisos, consis en es y ep esen a i os,
lo que puede gene a conocimien os más con iables y p ocesables.
4.2.1. Eliminación de pa idas con o ma o inco ec o
A pa i de las a iables gene adas en el apa ado an e io , hemos p ocedido a
elimina las pa idas que p esen aban las siguien es disc epancias:
Se han eliminado odas las en adas cuyo núme o de in en os no coincidía con
el núme o de cadenas encon adas,
Se han eliminado aquellas pa idas ales que supues amen e se ha ganado la
pa ida pe o no e minan con cinco cuad ados e des.
26 Capí ulo 4. Recopilación y limpieza de las pa idas
Núme o de wee s inicial 7.102.548
Núme o de pa idas con
disc epancias en e los in en os 147.085
Pa idas ganadas con
disc epancias en el alo inal 278
Pa idas pe didas con
disc epancias en alo inal 998
Pa idas con una ic o ia
en una posición in álida 116
Twee s es an es as
la limpieza p elimina 6.954.106
Tabla 4.1: Núme o de pa idas eliminadas po el p oceso de limpieza p elimina
Se han eliminado las pa idas que supues amen e se habían pe dido pe o sí
e minaban con cinco cuad ados e des.
Se han eliminado las pa idas que con enían cinco cuad os e des en una po-
sición dis in a a la inal, ya que una ez se ha ganado no se puede segui
jugando.
Finalmen e, se han con e ido odos los cuad ados de colo neg o en cuad ados de
colo blanco pa a es anda iza la en ada. La p esencia de la di e encia de colo es es
debida a la posibilidad de usa el modo noche al juga , es e hace modo únicamen e
modi ica el colo de los cuad ados sin comple a en el ex o a compa i . En la abla
4.1 analizamos el núme o de en adas que se han eliminado en cada pa e del p oceso
de limpieza.
4.2.2. Eliminación de pa idas alseadas
Con el abajo de la sección 4.2.1 hemos podido elimina de nues o conjun o
de da os aquellos wee s que cla amen e no se ajus aban al o ma o de las pa i-
das de Wo dle usuales, no obs an e, es a me odología no pe mi e encon a aquellas
pa idas alseadas, es deci , aquellas que con ienen códigos de colo es imposibles de
gene a con la palab a obje i o del día. Es e ipo de pa idas no son ep esen a i as
de los da os que que emos analiza y, po ello, una limpieza más minuciosa es pe -
inen e.
Pa a pode ealiza es o hemos gene ado un algo i mo que imi a el uncionamien o
del juego y que además es capaz de gene a odas las posibles combinaciones de
cuad ados de colo es que se pueden ob ene a pa i de un conjun o de palab as
álidas y una palab a obje i o.
Seguidamen e se ha gene ado un conjun o que con enga odas las palab as que el
juego admi e como en ada a pa i del documen o que se encuen a en [43]. Tam-
bién se ha gene ado una abla con la co espondencia en e el id de pa ida y la
palab a obje i o co espondien e a es e, es a in o mación se ha ob enido a pa i de
la siguien e uen e [1]. Cabe des aca que desde la adquisición del juego po pa e de
pe iódico The New Yo k Times no exis en egis os o iciales de la palab a del día ni
ampoco de las palab as de en ada álidas, po an o la iabilidad de es os conjun-
os, especialmen e del segundo puede se cues ionada, pese a es o hemos u ilizado
como uen e páginas web popula es y que conside amos iables.
4.2. Limpieza de los da os 27
Figu a 4.3: Núme o de pa idas imposibles encon adas en e los id 480 y 515
Pese al uso de páginas iables hemos p e e ido analiza el núme o de pa idas alsea-
das pa a cada día pa a a a de encon a algún en nues os conjun os de palab as
obje i o. Pa a ello se ha pasado a gene a el conjun o de odas las posibles espues as
pa a cada palab a obje i o según el id de las pa idas p esen es en nues o conjun o
de da os. Finalmen e, pa a cada wee se ha comp obado si odas las espues as
de su pa ida co espondien e pe enecían al conjun o de espues as posibles pa a
esa palab a del día. Una ez se han iden i icado las pa idas p oblemá icas se ha
p ocedido a analiza la dis ibución de es as.
Al hace lo encon amos un único un alo a ípico muy des acado en el id 507 ya
que en es e se encuen an ap oximadamen e el 25 % de odas las pa idas e óneas.
El g á ico esul an e es demasiado amplio como pa a p esen a lo y, po ello, en la
igu a 4.3 solo mos amos la sección donde se encuen a el alo a ípico.
Al indaga en es a pa ida podemos obse a de que la palab a obje i o es sna l,
que pa ece se complicada de adi ina en is a de su al o con enido de consonan es,
no obs an e, es o no nos pa ece su ien e pa a explica es e no able aumen o en el
núme o de pa idas alseadas. Al segui in es igando ace ca sob e es a p oblemá ica
nos pe ca amos de que es as pa idas da an del 8 de no iemb e de 2022. Al busca
no icias elacionadas con Wo dle sob e es as echas encon amos que el día an e io
se habían anunciado cambios en el conjun o de palab as suje as a se palab a del
día po pa e de la nue a compañía p opie a ia del juego [28]. Es o nos mo i ó a
e alua la posibilidad de que la palab a que igu aba como palab a del día en nues a
lis a no ue a la co ec a. T as consul a a ias páginas que ecolec aban las pa idas
dia ias y encon a un g an núme o de disc epancias con la palab a obje i o con id
507 decidimos que e a muy p obable que la que habíamos omado no ue a la que
e dade amen e se eligió ese día.
T as p oba a ias combinaciones, decidimos usa la palab a spell que igu aba en
34 Capí ulo 5. Análisis de las pa idas
Figu a 5.4: Dis ibución del núme o de le as ue a de luga po in en o
Figu a 5.5: P opo ción de le as ue a de luga po in en o
5.1.3. Tasa de le as en una posición equi ocada
De mane a simila a la que hemos p ocedido en la sección 5.1 p ocedemos a
analiza la dis ibución del núme o de le as ue a de luga (cuad ados ama illos).
En los g á icos 5.4 y 5.5 podemos e que el la dis ibución iende a se dominada
po la can idad ce o a medida que aumen a el núme o de in en os lo cuál concue da
con el la noción de que a una ez se conocen odas o la mayo ía de las le as de
la palab a, los jugado es a an de ealiza combinaciones con es as has a gana ,
lo cual explica la disminución an acele ada que se da, especialmen e a pa i del

5.1. Dis ibución de las a iables de juego 35
in en o núme o 3. Cabe desca aca ambién que, a di e encia de la dis ibución de
los acie os, en es e caso odas las dis ibuciones ienen una endencia dominan e
cla a y las mayo es dis inciones se dan en los in en os 1 y 2 y es os p esen an cla as
simili udes en e ellos.
Figu a 5.6: Dis ibución del núme o de allos po in en o
Figu a 5.7: P opo ción de allos po in en o
36 Capí ulo 5. Análisis de las pa idas
Figu a 5.8: Media de acie os, allos y le as ue a de luga
5.1.4. Tasa de allos
Seguimos aho a con el análisis de la dis ibución del núme o de allos (cuad ados
neg os) de las pa idas que es amos es udiando. En los g á icos 5.6 y 5.7 podemos
e que el núme o de allos disminuye a medida que aumen a el núme o de in en os,
como podíamos imagina ya que la dis ibución de los allos debe se p ác icamen e
opues a a la de los acie os. Des aca la he e ogeneidad de las dis ibuciones sal o
las de los in en os 5 y 6 lo cúal con as a con el núme o de le as ue a de luga pe o
esul a simila a las del núme o de acie os.
5.1.5. E olución de las medias
Finalmen e analizamos la dis ibución de las medias de cada una de las asas
p esen adas en las secciones an e io es, p e endemos analiza el c ecimien o y dec e-
cimien o de es os alo es ya que pod ían se usados como a iables pa a ca ac e iza
a los jugado es. En la igu a 5.8 podemos e cla amen e que el núme o de acie os
iene un c ecimien o p ác icamen e lineal que disminuye su pendien e en el in en o
3, algo que pa ece e o za la hipó esis de que es un conjun o de in e és pa a nues o
abajo. La media de allos y le as ue a de luga es cla amen e dec ecien e, cabe
des aca que la dis ibución de los allos disminuye su pendien e ambién en el in en-
o 3, lo cuál es de espe a daba la co elación en e es a y la dis ibución de acie os.
Resul a so p enden e el bajo alo que oma la dis ibución de las le as ue a de
5.2. Análisis según la palab a obje i o 37
luga , pues es á aco ada p ác icamen e po 1 y iene un dec ecimien o mucho más
len o que el es o, es o indica que la mayo ía de jugado es ob iene una le a en una
posición inco ec a y a lo la go de sus in en os la coloca en una posición co ec a y
ob iene o a nue a le a en una posición e ónea, dado el aumen o cons an e de los
acie os.
5.2. Análisis según la palab a obje i o
Con inuamos nues o análisis aho a a ando de encon a elaciones en e los
da os de las pa idas y su palab a obje i o. Es o nos pe mi i á gene a nue as a-
iables que posiblemen e con engan in o mación ele an e a la ho a de encon a
di e encias en e jugado es.
5.2.1. Dis ibución de las pa idas según su du ación
P ocedemos a analiza el núme o de pa idas según su palab a obje i o y conside-
ando su du ación y compa ándola con la du ación media. Es e análisis es necesa io
pa a asegu a la uni o midad de los da os disponibles an o en ep esen a i idad de
cada palab a obje i o así como de a iabilidad de pa idas. Los esul ados han sido
los espe ados: la dis ibución no p esen a ningún alo anómalo, sí ap eciamos una
endencia hacia la disminución del núme o o al de pa idas a media que inc emen-
a la echa de las pa idas pe o no es es adís icamen e signi ican e y se asocia a la
pé dida g adual de popula idad del juego.
En la igu a 5.9 podemos e una mues a de es a dis ibución donde las ba as
ojas ep esen an las pa idas con un núme o de in en os po encima de la media y
las azules las que se encuen an po debajo. Obse amos la uni o midad de los da os
y la lige a p edominancia de pa idas más co as.
Figu a 5.9: Mues a de 45 elemen os del núme o de pa idas po palab a obje i o y
según su du ación
38 Capí ulo 5. Análisis de las pa idas
5.2.2. Di icul ad de las palab as
P ocedemos a e alua la complejidad de cada palab a basándonos en la longi ud
media de las pa idas que la ienen como obje i o. Calculando la media de la longi ud
de odas las pa idas y compa ándola con la de cada palab a, pod emos es ablece
un c i e io simple pa a dis ingui si una palab a es ácil o di ícil, si la media de sus
pa idas es in e io a la media global la clasi icamos como ácil y en caso con a io
como di icil. En la igu a 5.10 podemos e es a ca ac e ización pa a un conjun o
educido de palab as obje i o, donde las ba as ojas ep esen an las di íciles y las
azules las áciles. Desca amos que la media global de in en os se encuen a en 4,2,
que la endencia gene al de la dis ibución de la di icul ad no p esen a ningún pa ón
cla o y que la apa ición de palab as áciles y di íciles no pa ece ene elación con
ninguna a iable.
Figu a 5.10: Mues a de 45 elemen os de la media de in en os po palab a obje i o
En la abla 5.3 mos amos las cinco palab as más di íciles y las 5 más áciles jun o
a la media de in en os de sus pa idas co espondien es, des acamos que odas las
palab as áciles con ienen al menos dos ocales y no p esen an le as epe idas sal-
o en el caso de TREAT, además son ecuen es en el lenguaje, po o a pa e las
di íciles p esen an dos o más le as epe idas en odos los casos sal o en la palab a
GAWKY y con ienen únicamen e una ocal sal o en el caso de PARER, además
ecuencia de odas ellas en el lenguaje coloquial es educida.
5.2. Análisis según la palab a obje i o 39
Palab ás más áciles Media Palab as más di íciles Media
TRAIN 3,283 PARER 5,514
RAINY 3,449 MUMMY 5,389
DREAM 3,471 COYLY 5,241
ALIEN 3,477 GAWKY 5,028
TREAT 3,525 DANDY 4,920
Tabla 5.3: Palab as con meno y mayo media de in en os
Es a in o mación nos esul a á ú il a pa a ca ac e iza los g upos que encon emos
en la ase de clús e ing y ambién pe mi i án e alua a los agen es que c ea emos en
apa ados pos e io es.

Cap´
ı ulo 6
Tipos de jugado es
En es e apa ado a a emos de clasi ica a los di e sos jugado es p esen es en el
conjun o de da os ecolec ado. Pa a ello los ag upa emos según el iden i icado de
usua io, que es un alo único y pe mi e dis ingui inequí ocamen e a cada jugado y
es udia emos las pa idas que haya ealizado. A con inuación gene a emos a iables
a pa i de es os da os que u iliza emos pa a ca ac e iza los, aplica emos algo i mos
de clús e ing pa a ob ene clases de jugado es, e alua emos los esul ados u ilizando
dis in as mé icas. Finalmen e a a emos de ca ac e iza a los g upos ob enidos
median e un análisis de las a iables que esul en más ele an es.
6.1. Dis ibución del núme o de pa idas de cada
jugado
El p ime paso pa a ob ene la clasi icación de jugado es es el de ag upa pa -
idas. Necesi amos conoce el núme o de usua ios dis in os que poseemos así como
la dis ibución del núme o de pa idas del que disponemos de cada uno, es a in o -
mación queda esumida en la abla 6.1, en ella podemos in ui que nos encon amos
an e una dis ibución muy sesgada hacia la de echa pues o que los dos p ime os
cua iles con inen únicamen e jugado es con una o dos pa idas pe o alcanzando el
máximo en 295. Además la des iación ípica es de un o den de magni ud supe io
a los es cua iles y eso indica que exis i á una g an a ianza de los alo es más
alla del e ce cua il. Es o queda explici ado en la igu a 6.1 donde podemos e el
ex emo sesgo de la dis ibución.
En a as de ealiza un es udio ealis a y es adís icamen e ele an e de los da os
hemos decidido es ablece un umb al en el núme o mínimo de pa idas de los usua-
ios pa a ene su icien es da os pa a analiza el es ilo de juego del jugado . Po es o
hemos omado el umb al más ce cano a la media de la dis ibución y, consecuen e-
men e, lo hemos si uado en sie e pa idas. El núme o de jugado es se e educido
de mane a impo an e en el subconjun o, pasamos de casi un millón a menos de
154,000. Po o a pa e la media de pa idas pasa a ele a se eno memen e y se si úa
en las 33,72 pa idas y la des iación ípica pasa a es a en el mismo o den de mag-
41
42 Capí ulo 6. Tipos de jugado es
ni ud que la media, al y como podemos ap ecia en la abla 6.2. A pesa de es a
mejo ía, la dis ibución segui á es ando ue emen e sesgada a la de echa aunque en
la igu a 6.2 podemos ap ecia la educción de es e enómeno no ablemen e.
En base a las simili ud de las dis ibuciones y de la can idad de da os p esen es
en el subconjun o lo conside amos su icien emen e ele an e y p ocede emos a u ili-
za lo en los siguien es apa ados como conjun o base pa a ealiza clús e ing. Pa a
e mina p esen amos la dis ibución en escala loga í mica en la igu a 6.3 donde
podemos ap ecia mejo como se epa en los alo es. Obse amos que el sesgo a la
de echa es impe an e.
Es imado es de la dis ibución
del núme o de pa idas
Nºde usua ios 977.510
Media 7,035
Des iación ípica 19,436
Mínimo 1
Máximo 295
25 % 1
50 % 2
75 % 4
Tabla 6.1: Es imado es de la dis ibución
del núme o de pa idas po jugado
Figu a 6.1: Dis ibución del núme o de
pa idas po jugado
Es imado es de la dis ibución
del subconjun o de jugado es
Nºde usua ios 153.893
Media 33,721
Des iación ípica 39,262
Mínimo 7
Máximo 295
25 % 10
50 % 17
75 % 37
Tabla 6.2: Es imado es de la dis ibución
del núme o de pa idas pa a jugado es
con sie e o más pa idas
Figu a 6.2: Dis ibución pa a jugado es
con sie e o más pa idas
6.2. Gene ación de las a iables pa a el ag upamien o 43
Figu a 6.3: Dis ibución del subconjun o de jugado es con 7 o más pa idas en escala
loga í mica
6.2. Gene ación de las a iables pa a el ag upamien-
o
Dada la na u aleza de los da os p esen es en nues o conjun o, esul a complica-
do aplica les algún algo i mo de clús e ing. Debido a es o, debemos gene a a iables
in e p e ables po los dis in os mé odos basadas en los conocimien os que hemos ob-
enido al ealiza el análisis p e io. Además, dado el obje i o de clasi ica jugado es,
deno amos ambién la ele ancia de gene a a iables elacionadas con las mé icas
empleadas pa a e alua los, oma emos como e e encia las que u iliza el pe iódico
The New Yo k Times en su bo o icial [25] y, consecuen emen e, ha emos incapié
en la media de in en os de las pa idas de cada jugado e in en a emos ap oxima
el po cen aje de disminución del espacio de soluciones dado po cada palab a que
in oduce.
Comenza emos gene ando las a iables que podemos ob ene más ácilmen e a pa i
de los da os que poseemos.
Longi ud media de pa ida: Gene amos una a iable que con iene la lon-
gi ud media de las pa idas de cada jugado p esen e en el conjun o de da os.
Es a a iable pe mi e e alua ácilmen e a un jugado ya que den o de las
mé icas de e aluación del endimien o, es a es la más u ilizada y ácilmen e
econocible. Nos e e i emos a ella como mean_leng h.
Media de pa idas pe didas: Pa a usua io calculamos el po cen aje de
pa idas que ha pe dido. Añadimos es a mé ica pa a complemen a la longi ud
media ya que es a no iene en cuen a si un juego de longi ud seis ha esul ado
en ic o ia o de o a. Además ambién puede ayuda a ca ac e iza jugado es
50 Capí ulo 6. Tipos de jugado es
Figu a 6.9: Longi ud media de las pa idas según la ag upación po clús e s
Figu a 6.10: Núme o de acie os en el e ce in en o según la ag upación po clús e s
media de sus pa idas, no obs an e si es udiamos la dis ibución de las medias de
acie os, le as ue a de luga y allos de los es g upos, p esen es en los g á icos de
la igu a 6.11 podemos e una cla a di e enciación en e los es, que se e acen-
úa e ce in en o. C eemos que es as g á icas pe mi en ap ecia el desa ollo de las
pa idas y el es ilo de juego de los g upos encon ados así como las di e encias en e
es os, po ejemplo, el g upo 1 suele educi su núme o de e o es en una unidad po
cada dos in en os y ob eniendo una media de una le a en posición inco ec a en
los es p ime os in en os; el g upo 2 en cambio educe su núme o de allos en una
unidad po in en o y, a su ez, ob iene educe muy ápidamen e la p esencia le as
en una posición e ónea. Es o sugie e que los jugado es del g upo 1 en los p ime os
in en os u ilizan palab as muy simila es en e sí y ob ienen esul ados malos en los
p ime os in en os mien as que, el g upo 2, u iliza palab as que man ienen las le-
as co ec as en su posición pe o a ían el es o de posiciones e óneas. Ejemplos
como es e pueden indica una elación en e el ocabula io de los jugado es y su
endimien o, po ello, hemos conside ado ele an e es udia el posible ocabula io
de cada g upo.

6.4. Análisis de los g upos 51
Figu a 6.11: Dis ibución de la media de acie os, le as ue a de luga y allos de
cada g upo
6.4.1. Es udio de las palab as iniciales
La elección de la palab a del p ime in en o es di e en e al es o pues o que no
se iene ninguna in o mación ace ca de la palab a obje i o, conside amos impo an-
e es udia con de enimien o las posibles palab as que cada g upo pod ía u iliza .
Cada posible palab a inicial disminuye un po cen aje medio di e en e del espacio de
soluciones, en pa icula , las mejo es palab as son aquellas que no con ienen le as
epe idas e incluyen las consonan es más ecuen es en la lengua inglesa [3]. Así
pues, palab as como TARES,SLATE oCRATE suelen se las más u ilizadas pa a
inicializa los algo i mos, no obs an e, en es e p oyec o no buscamos minimiza la
longi ud de las pa idas, sino imi a en la mejo medida de lo posible a los jugado es.
Pa a a a de encon a las palab as iniciales más comunes en cada g upo hemos
analizado las combinaciones iniciales de cada pa ida de cada usua io y c eado un
conjun o de posibles palab as in oducidas dado el código ob enido y la palab a ob-
je i o y, a con inuación, hemos con abilizado la apa ición de cada palab a en cada
g upo. Es e mé odo nos ha p opo cionado una lis a o denada de mayo a meno
ecuencia de apa ición de cada palab a pa a cada g upo, no obs an e, los esul ados
es án lejos de se ealis as pues o que apa ecen palab as que p obablemen e no sean
52 Capí ulo 6. Tipos de jugado es
conocidas po la mayo ía de jugado es como PZAZZ, es o se debe a que es e ipo
de palab as con una g an can idad de le as epe idas y pocas ocales son las que
p oducen en la mayo ía de casos combinaciones con cinco allos o cua o allos y una
le a ue a de luga , que son las ecuen es en e las pa idas que disponemos.
Pa a ap oxima mejo el ocabula io de nues os jugado es hemos pensado en ene
en cuen a la ecuencia de apa ición en la lengua inglesa de las palab as y ambién el
núme o de le as no epe idas de cada una. Conside amos que el p ime c i e io es á
jus i icado debido a que las pa idas se han ob enido de cuen as de habla inglesa y el
segundo se basa en la hipó esis de que la mayo ía de jugado es u ilizan como es a-
egia inicial el educi el espacio de posibles soluciones eliminando la mayo can idad
posible de le as. Pa a inco po a es os dos c i e ios adicionales hemos ecu ido a la
écnica de análisis de decisión mul ic i e io más simple, la media ponde ada. La e-
cuencia de apa ición de cada palab a se ha calculado g acias a la lib e ía wo d ecs
y el po cen aje de le as epe idas en cada palab a lo hemos calculado con una un-
ción p opia. Una ez ob enidas odas las dis ibuciones las hemos no malizado y
hemos calculado el nue o alo en base a la ó mula 6.1 donde alue(i)co esponde
al alo asignado a la palab a i, ec_ini(i)es el alo no malizado de la ecuencia
de apa ición de la palab a en la dis ibución calculada al inicio del subapa ado,
ec_na es el alo no malizado de ecuencia de apa ición de la palab a ien la
lengua inglesa y epea _cha (i)es el po cen aje no malizado de le as que apa ecen
más de una ocasión en la palab a i.
alue(i) = ec_ini(i)+0,1· ec_na (i)+0,2· epea _cha (i)(6.1)
Es e en oque ha p opocionado esul ados mucho más plausibles. eEn las ablas 6.4,
podemos obse a las es palab as con mayo pun uación pa a cada g upo. Desca-
amos la simili ud en e las del g upo 0 y las del g upo 2, odas e minan en Ey
con ienen la le a Aen la segunda posición, además, la mayo ía con ienen las le as
TyRque son las consonan es más comunes en la lengua inglesa. Las di e encuas
más no ables se hallan en las palab as del g upo 1, en es e pa ece que las palab as
con a ias ocales dis in as ienen una mayo ecuencia de apa ición y en la palab a
con mayo alo encon amos una única consonan e, a di e encia de las o as mejo es
palab as de cada g upo que incluyen es.
Palab as iniciales
pa a el g upo 0
Palab a Valo
STATE 4,91
BRAZE 4,78
CRAZE 4,46
Palab as iniciales
pa a el g upo 1
Palab a Valo
ADIEU 4,43
BRAZE 4,28
ABOUT 4,07
Palab as iniciales
pa a el g upo 2
Palab a Valo
STARE 6,42
STATE 6,18
SPARE 5,31
Tabla 6.4: Palab as iniciales pa a cada g upo con la media ag egada más al a
6.4. Análisis de los g upos 53
6.4.2. Es udio del ocabula io de cada g upo
Te minamos el análisis de los g upos gene ados con el es udio del ocabula io de
cada uno de ellos, en conc e o, p e endemos gene a un alo numé ico pa a cada
palab a que ep esen e cuán habi ual es en el ocabula io de cada ipo de jugado .
Pa a ello hemos analizado cada pa ón ob enido en cada in en o de cada pa ida
gene ando una nue a lis a de ecuencias de apa ición, ambién hemos ecupe ado
las ecuencias en el lenguaje na u al pe o no hemos enido en cuen a la epe ición
de las le as pues o que las palab as u ilizadas po cada jugado es án ue emen e
in luenciadas po los esul ados ob enidos en in en os p e ios. Pa a combina es as
dos mé icas hemos uel o a usa una media ponde ada pe o es a ez eajus ando
los pesos de cada dis ibución no malizada, en pa icula hemos usado la ó mula 6.2
donde podemos e que el coe icien e de la ecuencia en el lenguaje na u al es seis
y en el ob enido median e el análisis de los pa ones es uno, es e cla o sesgo hacia el
lenguaje na u al lo jus i icamos pa a a a de compensa la g an can idad de da os
e óneos que se ob ienen al ealiza el análisis de los pa ones pues o que solamen e
podemos ecupe a un conjun o de posibilidades no la palab a in oducida po el
usua io.
alue_ ocab(i) = ec_ini(i)+6· ec_na (i)(6.2)
T as gene a los alo es pa a cada g upo hemos ob enido es ánkings de palab as.
Todos ellos p esen an coincidencias en e sí pe o sus dis ibuciones es án su icien-
emen e di e enciadas, podemos e en las g á icas p esen es en la igu a 6.12 las
ein a palab as con mayo media ag egada pa a cada ipo de jugado . A di e encia
de lo obse ado en la subsección 6.4.1, no obse amos cambios d ás icos en ninguna
de las es dis ibuciones, aunque sí exis en a iaciones en e las posiciones de cada
palab a.
En el p óximo capí ulo iliza emos es e conjun o de da os pa a modela el com-
po amien o de cada g upo de jugado es e in en a ap oxima su media de in en os
así como las dis ibuciones de los acie os, allos y le as ue a de luga según cada
in en o.
54 Capí ulo 6. Tipos de jugado es
6.4. Análisis de los g upos 55
Figu a 6.12: 30 palab as más ecuen es en el ocabula io de cada g upo

Cap´
ı ulo 7
Imi ando jugado es
En es a sección implemen a emos un algo i mo gené ico pa a imi a a cada g upo
de jugado es eniendo en cuen a las ablas de ecuencias gene adas en el apa ado
an e io . De ini emos los di e sos componen es del algo i mo inspi ándonos en la
implemen ación de Mas e mind explicada en la sección 3.3. Una ez implemen ados
ealiza emos un ajus e de hipe pa áme os pa a encon a aquellos que modelicen
mejo a mues os usua ios y inalmen e p esen a emos los esul ados ob enidos.
7.1. Desc ipción del modelo
El modelo que amos a implemen a se basa en la ejecución de un algo i mo
gené ico pa a cada in en o. En cada in en o se ac ualiza á la unción de i ness
pa a ene en cuen a los alo es in oducidos an e io men e y los códigos de colo es
ob enidos, es a se basa á en un coe icien e de simili ud en e las palab as elegidas y
las candida as a se lo. La población inicial de cada in en o se i á educiendo pues o
que se elimina án odas las palab as que no encajen con los pa ones ob enidos. La
p ime a i e ación se ealiza de mane a di e en e, la elección de la palab a inicial se
basa á en las ablas de ecuencias de palab as iniciales calculadas en el capí ulo
an e io y se ha á uso del ocabula io in e ido a la ho a de ealiza las unciones de
selección, c uce, mu ación, pe mu ación e in e sión. El modelo inaliza su ejecución
cuando se acie a la palab a o cuando se supe a el lími e de los seis in en os. El
p ocedimien o u ilizado queda plasmado en el pseudocódigo 2.
7.2. Desc ipción de las unciones
En las subsecciones pos e io es de inimos cada una de las pa es del algo i mo
implemen ado:
7.2.1. Rep esen ación c omosómica
Cada indi iduo de la población se á una palab a de cinco le as pe enecien e
al conjun o de palab as admi idas. La selección de la p ime a palab a in oducida
57
58 Capí ulo 7. Imi ando jugado es
Algo i mo 2: Algo i mo gené ico pa a imi a jugado es de Wo dle
a emp ←1;
X1←Elección po ule a de la palab a inicial a pa i de la abla de ecuencias;
E alua X1y ob ene el código Y1;
while Ya emp =código e de AND a emp ≤6do
Gene amos Ea emp como el conjun o de palab as posibles es an es dado
Xa emp eYa emp ;
a emp ←a emp + 1;
h←1; Inicializamos el núme o de gene aciones a 1;
ˆ
Eh← {}; Inicializamos la población acía;
Seleccionamos po ule a indi iduos pe enecien es a Ea emp −1usando la abla
de ecuencias;
while h≤maxgen do
Calcula el alo de i ness de los indi iduos de la población;
Realizamos el c uce de los indi iduos con p obabilidad pc uce;
Realizamos la mu ación con p obabilidad pmu acion;
Realizamos la pe mu ación con p obabilidad ppe mu acion;
Realizamos la in e sión con p obabilidad pin e sion;
Gua da los descendien es esul an es en ˆ
Eh;
h←h+ 1;
end while
Encon amos el indi iduo Xa emp con mejo i ness, en caso de que exis an
a ios seleccionamos aquel con mayo alo en la abla de ecuencias;
E alua Xa emp y ob ene un nue o Ya emp ;
end while
se ealiza á median e ule a u ilizando los alo es ob enidos pa a cada palab a en
el apa ado 6.4.1. La inicialización de la p ime a gene ación de indi iduos de cada
in en o se ealiza á po ule a a pa i de las palab as posibles es an es eniendo
en cuen a los esul ados ob enidos en los in en os an e io es, las p obabilidades se
ob end án u ilizando las ablas de ecuencias gene adas en el apa ado 6.4.2.
7.2.2. Función de i ness
La unción de i ness se ac ualiza á as cada in en o pa a ene en cuen a los
esul ados ob enidos. Se basa á en la ó mula 7.1, donde wes la palab a sob e la que
se e alua á el i ness, gico esponde a la palab a in oducida en el in en o i,ciindica
el núme o de le as co ec as ob enidas en el in en o i,miindica el núme o de le as
ue a de luga ob enidas en el in en o i,co ec (gi, w)es una unción que de uel e
el núme o de le as co ec as que se hubie an ob enido in oduciendo giy eniendo
como obje i o la palab a wymisplaced(gi, w)es una unción que de uel e el núme o
de le as ue a de luga que se hubie an ob enido in oduciendo giy eniendo como
obje i o la palab a w.
7.2. Desc ipción de las unciones 59
i ness(w) =
in en os
X
i=1
(|co ec (gi, w)−ci|) + |misplaced(gi, w)−mi|)(7.1)
Con es a unción p e endemos e alua cuan simila es una palab a a la posible
solución de la pa ida, el mejo alo de i ness se ob ienen en el ce o pe o es posible
que exis a más de una palab a pa a que se alcalce en mínimo.
7.2.3. Función de c uce
El c uce de los indi iduos es una unción indispensable en los algo i mos gené i-
cos. Debido a que, en nues o caso, el c uce de uno o dos pun os de dos palab as no
ienen po qué gene a dos indi iduos álidos ya que solamen e se admi en palab as
exis en es y el in e cambio de segmen os de le as en e dos indi iduos no suele ge-
ne a palab as eales, hemos decidido implemen a una unción más compleja que
ga an ice la gene ación de indi iduos álidos y a su ez que con engan la in o mación
de sus p ogeni o es.
Pa a ello hemos ealizado lo siguien e: ealizamos un c uce de un pun o en e los
dos p ogeni o es, en caso de que alguna de las palab as esul an es pe enezcan al
conjun o de palab as posibles las man enemos, en caso con a io, buscamos palab as
que con engan las mismas le as que el descendien e y en caso de que haya más de un
candida o elegimos aquel con mejo i ness. En caso de que no exis a ninguna com-
binación álida, sus i uimos al descendien e po una palab a álida alea o ia. Pa a
acele a el cálculo de es a unción hemos p ecalculado el conjun o de las palab as
álidas que se pueden o ma con cada posible combinación de cinco le as.
7.2.4. Función de mu ación
Al implemen a la unción de mu ación hemos encon ado con un p oblema si-
mila al de la unción de c uce, cambia una le a po o a den o de una palab a no
siemp e p oduce un indi iduo álido, po ello hemos modi icado la unción pa a que
solamen e de uel a indi iduos álidos. Pa a ealiza ácilmen e es e p oceso hemos
gene ado una abla que, pa a cada palab a, con iene el conjun o de palab as que
di ie en de ella únicamen e en una le a. En caso de que al mu a exis a más de una
opción seleccionamos aquella con el mejo alo de i ness y, en caso de que no haya
ninguna, no se ealiza la mu ación.
7.2.5. Función de pe mu ación
La pe mu ación ambién ha es ado condicionada po la necesidad de gene a
palab as álidas, po ello la unción de pe mu ación únicamen e pe mu a dos le as
di e en es siemp e y cuando el esul ado sea o a palab a. En caso de que exis an
a ias posibilidades siemp es se escoge la que enga un meno alo de i ness. Pa a
66 Capí ulo 7. Imi ando jugado es
Figu a 7.5: Compa ación de acie os, le as ue a de luga y allos en e el g upo 2
y el algo i mo que lo modela mejo ado
na u al en el modelo hemos ob enido la mejo a más signi ica i a en el endimien o
de odos los algo i mos e isados en la sección 7.4.1.
Concluimos pues que los mejo es jugado es ienen pa ones de juego más complejos
y más di íciles de p edeci que la ecuencia de palab as que u ilizan pa a adi ina la
solución consecuen emen e, se necesi a más in es igación pa a iden i ica los ac o es
que con ibuyen al endimien o de los mejo es jugado es y desa olla modelos que
puedan imi a los con mayo p ecisión.

7.5. Resul ados 67
Mé icas de los modelos inales
G upo 0 Modelo 0 G upo 1 Modelo 1 G upo 2 Modelo 2
Acie os in en o 1 0.55 0.43 0.42 0.31 0.90 0.78
Acie os in en o 2 1.56 1.38 0.93 1.03 2.61 2.46
Acie os in en o 3 2.91 2.77 1.77 1.82 4.02 3.67
Acie os in en o 4 3.95 4.11 2.84 2.76 4.57 4.28
Acie os in en o 5 4.60 4.66 3.86 3.72 4.83 4.67
Acie os in en o 6 4.93 4.88 4.69 4.65 4.97 4.85
Fue a luga 1 1.05 0.85 1.00 1.05 1.11 0.93
Fue a luga 2 1.03 0.95 1.10 1.04 0.74 0.89
Fue a luga 3 0.62 0.64 0.96 0.87 0.26 0.51
Fue a luga 4 0.26 0.14 0.64 0.46 0.09 0.17
Fue a luga 5 0.08 0.02 0.30 0.15 0.03 0.05
Fue a luga 6 0.01 0.00 0.07 0.02 0.00 0.01
Fallos in en o 1 3.40 3.72 3.57 3.69 2.99 3.09
Fallos in en o 2 2.41 2.67 2.97 2.92 1.65 1.85
Fallos in en o 3 1.47 1.60 2.28 2.11 0.72 1.05
Fallos in en o 4 0.79 0.74 1.52 1.38 0.34 0.54
Fallos in en o 5 0.32 0.32 0.82 0.73 0.14 0.28
Fallos in en o 6 0.06 0.11 0.24 0.31 0.03 0.14
Media de in en os 4.23 4.36 5.00 4.92 3.31 3.75
Tabla 7.2: Valo es de las mé icas de cada modelo y del g upo de jugado es al que
imi a
Cap´
ı ulo 8
Conclusiones y abajo u u o
En es e p oyec o hemos eunido más de seis millones de pa idas de Wo dle ex aí-
das de Twi e . T as ealiza una limpieza exhaus i a hemos ob enido un conjun o
de da os que hemos hecho público en la pla a o ma Kaggle donde se puede acce-
de y desca ga lib emen e desde el siguien e h ps://www.kaggle.com/da ase s/
sca cal e sis/wo dle-games, cumpliendo así el obje i o O1.
Al analiza es e conjun o hemos encon ado a ios da os ele an es como que la
media de in en os se encuen a en 4,19, que el 6,66 % de las pa idas se pie den y
que el núme o de in en os po pa ida obedece una dis ibución no mal con media
4,19 y des iación ípica 1,46. En elación a es o hemos podido comp oba que el
e ce in en o es el más decisi o de odos pues o que el núme o de acie os, allos
y le as ue a de es e luga de un jugado en él es uno de los ac o es más co ela-
cionados con la longi ud de su pa ida. Es o nos ha lle ado a conside a lo ele an e
en el es udio de la clasi icación de jugado es. Finalmen e hemos ealizado un b e e
es udio de la di icul ad de cada pa ida basándonos en su longi ud y clasi icado nu-
mé icamen e cada una de es as. Hemos podido conclui que las palab as más áciles
son aquellas que con ienen las le as más ecuen es en el idioma inglés, es deci que
con ienen las ocales ‘a’ y ‘e’ y consonan es como ‘n’, ‘ ’ y ‘ ’ así como combinaciones
consonán icas de es as como ‘ ’. Las más di íciles, en cambio, no se ca ac e izan an
ácilmen e, una baja ecuencia en el lenguaje usual pa ece se el ac o más decisi o
lo cual es azonable ya que el desconocimien o de la palab a po pa e del jugado
elimina cualquie posibilidad de gana la pa ida, sin emba go, ambién encon a-
mos ac o es como la p esencia de dos o más le as epe idas así como la al a de las
ocales ‘a’ y ‘e’ a a o de la p esencia de ‘y’ en la posición inal. Es e análisis nos
ha pe mi ido cumpli el obje i o O2.
Seguidamen e hemos u ilizado el análisis de los da os pa a gene a a iables pa-
a ca ac e iza los jugado es. Median e el uso de clús e ing hemos encon ado 3
g upos di e enciados ca ac e izados po lo siguien e:
G upo 0: Se ca ac e iza po el g upo más nume oso compues o po más de la
mi ad de los jugado es, su long i ud media de pa ida es de 4,23 y ep esen an
a los jugado es medios. Analizando las dis ibuciones de las medias de acie os,
69
70 Capí ulo 8. Conclusiones y abajo u u o
allos y le as ue a de luga podemos comp oba que es os jugado es suelen
ace a una media de 0,5le as en su in en o inicial y suelen ob ene ambién
una le a en la posición equi ocada. A pa i del segundo in en o sus acie os
aumen an en una asa del 1,4de media y suelen consegui es acie os en el
e ce in en o. Su es a egia se basa en educi el núme o de palab as posibles
en los dos p ime os in en os, en el e ce o coloca en la posición co ec a las
le as ue a de luga ob enidas en los in en os an e io es y en los in en os
pos e io es in oducen palab as que se adap en al pa ón de acie os.
G upo 1: Se a a del segundo g upo más nume oso de los es encon ados,
su longi ud media de pa ida es de 4,99 y ep esen an a los jugado es con peo
endimien o y posiblemen e con menos expe iencia. T as analiza sus dis ibu-
ciones concluimos que en su p ime in en o no suelen ob ene ningún acie o
pe o sí una única le a ue a de luga , además su segundo in en o se ca ac e-
iza po p esen a esul ados muy simila es al p ime o lo cual es indicado de
que usan palab as pa ecidas o con le as en común. Es o hace que en su e ce
in en o engan una media in e io a 2acie os lo cual di icul a sus posibilida-
des de gana la pa ida. En pa icula es os jugado es no siemp e ob ienen un
acie o nue o en cada in en o pe o sí le as ue a de luga . Concluimos que
u ilizan palab as muy simila es en e sí, posiblemen e po limi aciones en el
ocabula io y que consecuen emen e son el g upo con más pa idas pe didas.
G upo 2: Se a a del g upo mino i a io con una longi ud media de pa ida
de 3,31 in en os. Rep esenan a los jugado es con mejo endimien o y posible-
men e expe os. Se ca ac e izan po ob ene un acie o y una le a ue a de
luga en el p ime in en o y en una g an capacidad de aumen a los acie os
muy ápidamen e en e los in en o 1 y 3. En el e ce in en o suelen habe
ganado o han conseguido 4 acie os de media lo cual educe sus ancialmen-
e el conjun o de palab as posibles. Su es a egia se basa en u iliza los dos
p ime os in en os pa a educi al máximo el conjun o de palab as posibles, lo
consiguen u ilizando palab as con las mismas le as en la posición co ec a que
en su p ime y segundo in en o pe o a iando las es an es deno ando un g an
dominio del ocabula io. A con inuación, si no han ganado en el e ce in en o,
ealizan in en os adap ados al pa ón ob enido que es al amen e es ic i o y
po ello equie en de menos in en os que el g upo 0.
Los esul ados ob enidos nos han hecho conside a el es udio del ocabula io de los
jugado es, así como su palab a p e e en e en el p ime in en o. Al no posee las
palab as in oducidas po cada jugado si no el pa ón de uel o, hemos ecu ido a
he amien as de in e encia pa a gene a los di e en es conjun os de ecuencias pa a
cada ipo de jugado y cumpli así con los obje i os O3 y O8.
Usando es os da os jun o a los pa ones ex aídos de cada jugado , desa ollamos
a ios modelos que a aban de imi a el compo amien o de cada g upo u ilizando
algo i mos gené icos con una unción de i ness basada en la simili ud en e pa ones
ob enidos en cada in en o. T as ealiza los ajus es necesa ios a los hipe pa áme os
de los modelos y de ealiza un es udio del endimien o dependiendo del peso dado
8.1. T abajo u u o 71
a la ecuencia de las palab as en el lenguaje, ob u imos es modelos inales consi-
guiendo cumpli los obje i os O4 y O5. Cada uno de ellos nos apo ó in o mación
adicional sob e los g upos, en pa icula el modelo ob enido pa a el g upo 0 se ajus a
no ablemen e bien al pa ón de juego obse ado, es e modelo da una impo ancia
seis eces supe io a la ecuencia de las palab as en el lenguaje usual que a la ob-
enida median e la in e encia de los pa ones. Es o indica una ue e elación en e
el compo amien o de es e g upo y el lenguaje habi ual, lo cual no esul a so p en-
den e ya que se a a de los jugado es medios. Pa a el modelo del g upo 1 ambién
se ob u ie on esul ados no ablemen e ce e os aunque en es e caso las ecuencias
en el lenguaje pasa on a ene la misma impo ancia que las ecuencias in e idas,
es o sugie e que los jugado es del g upo 2 ienen un ocabula io más educido que
el es o de g upos y que es o es un ac o decisi o en su endimien o en el juego.
Finalmen e en modelo del g upo 2 es el que p esen a el peo endimien o espec o a
las mé icas u ilizadas pa a compa a lo con los jugado es eales. Pese a habe con-
seguido imi a la dis ibución de acie os, allos y le as ue a de luga , el modelo
no consigue alcanza el endimien o de los jugado es eales. Fue en enado dando el
doble de peso al lenguaje na u al que a las ecuencias in e idas y, pese a es o, los
esul ados sugie en que exis en o os aspec os compo amien o de los jugado es del
g upo 2 que aún no se comp enden po comple o y que no es án elacionados con
el ocabula io de es os. Es e análisis nos pe mi e da espues a a los obje i os O6 y
O7 de nues o p oyec o.
En gene al, es e abajo nos ha b indado in o mación aliosa sob e el compo a-
mien o de los jugado es de Wo dle y nos ha ayudado a c ea modelos más p ecisos
que pueden imi a su juego. Si bien aún queda mucho po ap ende sob e las com-
plejidades del compo amien o de los jugado es, es e p oyec o sen ó las bases pa a
u u as in es igaciones en es a á ea y des acó el po encial del uso de modelos compu-
acionales pa a comp ende mejo el compo amien o humano.
8.1. T abajo u u o
En is as a un p oyec o u u o, es e iden e que se equie e un análisis más p o-
undo de las es a egias del g upo 2 y cómo es as a ec an al endimien o de los
jugado es y su capacidad pa a educi an d ás icamen e el espacio de soluciones,
posiblemen e u ilizando écnicas más so is icadas como la educción de la en opía o
el uso de palab as iniciales conc e as. También se ía con enien e a a de mejo a
las ap oximaciones del ocabula io de cada g upo, ya sea con écnicas de in e encia
más so is icadas o median e la ecopilación di ec a de los in en os de los usua ios.
O o ac o a ene en conside ación es la mejo ía de los jugado es con el iempo y
a a de obse a luc uaciones de usua ios en e g upos. También se ía in e esan-
e in es iga cómo los modelos ob enidos pueden ayuda a mejo a a los jugado es
ac uales, ya sea u ilizándolos pa a p edeci la palab a que debe ían in oduci , su-
ge í sela y posiblemen e amplia su ocabula io, explica les la es a egia que es án
siguiendo e in en a mejo a la o incluso alo a la idoneidad de las palab as in o-
ducidas en cada in en o.

72 Capí ulo 8. Conclusiones y abajo u u o
Como se pod á ap ecia , exis e una amplia a iedad de posibles con inuaciones del
abajo comenzado en es e p oyec o y espe amos que an o es e documen o como
el conjun o de da os que lo acompaña sean ú iles a odas las pe sonas que quie an
ealiza apo aciones.
Conclusions and Fu u e Wo k
In his p ojec we ha e collec ed mo e han six million Wo dle ma ches ex ac ed
om Twi e . A e an exhaus i e cleaning we ha e ob ained a da ase ha we ha e
made public on he pla o m Kaggle whe e i can be eely accessed and down-
loaded om he ollowing h ps://www.kaggle.com/da ase s/sca cal e sis/
wo dle-games, hus ul illing ou i s objec i e.
When analyzing his se we ha e ound se e al ele an da a such as ha he mean
numbe o a emp s is 4.19, ha 6.66% o he games a e los and ha he numbe
o a emp s pe game obeys a no mal dis ibu ion wi h mean 4.19 and s anda d
de ia ion 1.46. In ela ion o his we ha e been able o e i y ha he hi d y
is he mos decisi e o all since he numbe o hi s, misses and le e s ou o his
place o a playe in i is one o he ac o s mos co ela ed wi h he leng h o his
game. This has led us o conside i ele an in he s udy o playe anking. Finally,
we ha e made a b ie s udy o he di icul y o each game based on i s leng h and
nume ically anked each o hem. We ha e been able o conclude ha he easies
wo ds a e hose ha con ain he mos equen le e s in he English language, i.e.
ha con ain he owels ‘a’ and ‘e’ and consonan s such as ‘n’, ‘ ’ and ‘ ’ as well as
consonan combina ions o hese such as ‘ ’. The mo e di icul ones, on he o he
hand, a e no so easily cha ac e ized, a low equency in he usual language seems
o be he mos decisi e ac o which is easonable since he playe ’s igno ance o
he wo d elimina es any chance o winning he game, howe e , we also ound ac o s
such as he p esence o wo o mo e epea ed le e s as well as he lack o he owels
‘a’ and ‘e’ in a o o he p esence o ‘y’ in he inal posi ion. This analysis has
allowed us o ul ill ou second objec i e.
We hen used da a analysis o gene a e a iables o cha ac e ize he playe s. Th ough
he use o clus e ing we ha e ound 3 di e en ia ed g oups cha ac e ized by he ol-
lowing:
G up 0: I is cha ac e ized by he la ges g oup composed o mo e han hal
o he playe s, hei a e age s a ing la i ude is 4.23 and hey ep esen he
a e age playe s. Analyzing he dis ibu ions o he a e ages o hi s, misses
and misplaced le e s we can see ha hese playe s usually hi an a e age o
0.5le e s in hei ini ial a emp and usually also ge a le e in he w ong
posi ion. F om he second y onwa ds hei hi s inc ease a a a e o 1.4on
73
74 Capí ulo 8. Conclusiones y abajo u u o
a e age and hey usually ge h ee hi s on he hi d y. Thei s a egy is based
on educing he numbe o possible wo ds in he i s wo a emp s, in he hi d
a emp hey place in he co ec posi ion he misplaced le e s ob ained in
he p e ious a emp s and in he subsequen a emp s hey in oduce wo ds
ha i he pa e n o hi s.
G up 1: This is he second la ges g oup o he h ee ound, hei a e age
game leng h is 4.99 and hey ep esen he playe s wi h he wo s pe o mance
and possibly he leas expe ience. A e analyzing hei dis ibu ions we con-
clude ha in hei i s a emp hey usually do no ge any hi s bu only one
le e ou o place, and hei second a emp is cha ac e ized by e y simila
esul s o he i s one, which is an indica o ha hey use simila wo ds o
wo ds wi h le e s in common. This means ha in hei hi d a emp hey
ha e an a e age o less han 2 hi s, which hinde s hei chances o winning he
game. In pa icula , hese playe s do no always ge a new hi on each y bu
hey do ge misplaced le e s. We conclude ha hey use wo ds e y simila o
each o he , possibly because o ocabula y limi a ions, and ha consequen ly
hey a e he g oup wi h mo e los games.
G up 2: This is he mino i y g oup wi h an a e age s a ing leng h o 3.31
a emp s. They ep esen he bes pe o ming and possibly expe playe s.
They a e cha ac e ized by ge ing one hi and one le e ou o place on he
i s y and a g ea abili y o inc ease hi s e y quickly be ween ies 1 and
3. By he hi d y hey usually ha e won o ha e go en 4 hi s on a e age
which subs an ially educes he se o possible wo ds. Thei s a egy is based
on using he i s wo a emp s o educe he se o possible wo ds as much as
possible, hey achie e his by using wo ds wi h he same le e s in he co ec
posi ion as in hei i s and second a emp s bu a ying he emaining le e s,
deno ing a g ea mas e y o ocabula y. Then, i hey ha e no won on he
hi d a emp , hey make a emp s adap ed o he pa e n ob ained, which is
highly es ic i e and he e o e equi es ewe a emp s han g oup 0.
The esul s ob ained made us conside he s udy o he ocabula y o he playe s, as
well as hei p e e ed wo d in he i s a emp . Since we do no possess he wo ds
en e ed by each playe bu he e u ned pa e n, we ha e eso ed o in e ence ools
o gene a e he di e en se s o equencies o each ype o playe and hus ul ill
ou hi d and eigh h objec i es.
Using hese da a along wi h he pa e ns ex ac ed om each playe , we de el-
oped se e al models ha a emp ed o mimic he beha io o each g oup using
gene ic algo i hms wi h a i ness unc ion based on he simila i y be ween pa e ns
ob ained a each a emp . A e making he necessa y adjus men s o he hype -
pa ame e s o he models and pe o ming a s udy o he pe o mance depending
on he weigh gi en o he equency o wo ds in he language, we ob ained h ee
inal models achie ing ou ou h and i h objec i es. Each o hem p o ided us
wi h addi ional in o ma ion abou he g oups, in pa icula he model ob ained o
g oup 0 i s ema kably well o he obse ed pa e n o play, his model gi es six
8.2. Fu u e wo k 75
imes mo e impo ance o he equency o wo ds in he o mal language han ha
ob ained by pa e n in e ence. This indica es a s ong ela ionship be ween he
beha io o his g oup and he usual language, which is no su p ising since hese
a e a e age playe s. Fo he g oup 1 model we also ob ained ema kably accu a e
esul s, al hough in his case he language equencies became as impo an as he
in e ed equencies, sugges ing ha g oup 2 playe s ha e a smalle ocabula y han
he o he g oups and ha his is a decisi e ac o in hei pe o mance in he game.
Finally, he model o g oup 2 is he one ha p esen s he wo s pe o mance wi h
espec o he me ics used o compa e i wi h he eal playe s. Despi e ha ing
managed o mimic he dis ibu ion o hi s, misses and misplaced le e s, he model
ails o achie e he pe o mance o eal playe s. I was ained by gi ing wice as
much weigh o na u al language as o in e ed equencies and, despi e his, he
esul s sugges ha he e a e o he aspec s o he beha io o g oup 2 playe s ha
a e no ye ully unde s ood and a e no ela ed o hei ocabula y. This analysis
allows us o answe objec i es 6 and 7 o ou p ojec .
O e all, his wo k has p o ided us wi h aluable in o ma ion abou he beha io
o Wo dle playe s and has helped us o c ea e mo e accu a e models ha can mimic
hei play. While he e is s ill much o lea n abou he complexi ies o playe beha -
io , his p ojec laid he g oundwo k o u u e esea ch in his a ea and highligh ed
he po en ial o using compu a ional models o be e unde s and human beha io .
8.2. Fu u e wo k
In iew o a u u e p ojec , i is clea ha u he analysis o g oup 2 s a egies
and how hese a ec playe pe o mance and hei abili y o educe he solu ion
space so d as ically is equi ed, possibly using mo e sophis ica ed echniques such
as en opy educ ion o he use o speci ic ini ial wo ds. I would also be wo hwhile
o y o imp o e he ocabula y app oxima ions o each g oup, ei he wi h mo e
sophis ica ed in e ence echniques o by di ec collec ion o use a emp s. Ano he
ac o o ake in o conside a ion is he imp o emen o playe s o e ime and o
y o obse e luc ua ions o use s be ween g oups. I would also be in e es ing
o in es iga e how he models ob ained can help imp o e cu en playe s, ei he by
using hem o p edic he wo d hey should en e , sugges i o hem and possibly
expand hei ocabula y, explain he s a egy hey a e ollowing and y o imp o e
i , o e en assess he app op ia eness o he wo ds en e ed in each a emp .
As will be seen, he e is a wide a ie y o possible con inua ions o he wo k be-
gun in his p ojec and we hope ha bo h his documen and he accompanying
da a se will be use ul o all who wish o con ibu e.