scieee Science in your language
[es] (orig)

Robots capaces de aprender y adaptarse al entorno a partir de sus propias experiencias

Author: Quintía Vidal, Pablo
Year: 2013
Source: https://minerva.usc.es/bitstreams/3d3b8b1f-43e6-4190-aad9-fb9426fb5e53/download
Robo s capaces de ap ende y
adap a se al en o no a pa i de sus
p opias expe iencias
Pablo Quin ía Vidal
DEPARTAMENTO DE ELECTRÓNICA E COMPUTACIÓN
UNIVERSIDADE DE SANTIAGO DE COMPOSTELA
UNIVERSIDADE DE SANTIAGO DE COMPOSTELA
Depa amen o de Elec ónica e Compu ación
Tesis doc o al
ROBOTS CAPACES DE APRENDER Y ADAPTARSE AL
ENTORNO A PARTIR DE SUS PROPIAS EXPERIENCIAS
P esen ada po :
Pablo Quin ía Vidal
Di igida po :
Robe o Iglesias Rod íguez
Ca los Vázquez Reguei o
Mayo 2013
Robe o Iglesias Rod íguez, P o eso Ti ula de Uni e sidad del Á ea de Ciencia de la Compu ación
e In eligencia A i icial de la Uni e sidade de San iago de Compos ela e in es igado adsc i o
al Cen o Singula de In es igación en Tecnoloxías da In o mación (CITIUS)
Ca los Vázquez Reguei o, P o eso Ti ula de Uni e sidad del Á ea de A qui ec u a y Tecnología de
Compu ado es de la Uni e sidade da Co uña
HACEN CONSTAR:
Que la memo ia i ulada ROBOTS CAPACES DE APRENDER Y ADAPTARSE AL ENTORNO A
PARTIR DE SUS PROPIAS EXPERIENCIAS ha sido ealizada po D. Pablo Quin ía Vidal bajo
nues a di ección en el Depa amen o de Elec ónica e Compu ación de la Uni e sidade de San iago de
Compos ela, y cons i uye la Tesis que p esen a pa a op a al í ulo de Doc o .
Mayo 2013
Robe o Iglesias Rod íguez
Di ec o de la esis
Ca los Vázquez Reguei o
Di ec o de la esis
Pablo Quin ía Vidal
Au o de la esis

Ag adecimen os
Es a esis es el esul ado del abajo de muchas pe sonas, a las cuales quie o ag adece su
ayuda y apoyo du an e odo es e iempo:
En p ime luga a mis di ec o es de esis, Robe o Iglesias Rod íguez y Ca los Vázquez
Reguei o, po su ayuda, sus consejos y la con ianza que deposi a on en mí.
A Miguel Rod íguez po su ines imable ayuda y al que conside o como un codi ec o más
de la esis. También a Theocha is Ky iacou po la colabo ación p es ada y a E a Ce nadas po
sus consejos.
Al Depa amen o de Elec ónica e Compu ación y al CITIUS de la Uni e sidade de San-
iago de Compos ela, po p opo ciona los ecu sos necesa ios pa a la ealización de es a esis.
Al Depa amen o de Elec ónica e Sis emas de la Uni e sidade da Co uña, po da me la
opo unidad de inicia me como docen e y po odo el apoyo y ayuda que me ha p opo cionado.
A odos los p eca ios de Co uña y San iago con los que compa í las ince idumb es de un
es udian e de doc o ado y g acias a los que los días en el labo a o io e an más ag adables.
A la Xun a de Galicia, po p opo ciona median e su p og ama de becas p edoc o ales la
inanciación con la que pude dedica me a iempo comple o a es e abajo.
En el úl imo y más impo an e luga , g acias a mis pad es, amilia y amigos, po hace -
me ol ida odo en los a os lib es (excep o cuando p egun aban ¿pe o aún no acabas e?).
Especialmen e a Ca olina, po apoya me odo es e iempo y el que queda.
Mayo 2013
Índice gene al
In oducción 1
1 Con ex o y mo i ación 7
1.1. Tiposde obo s ................................. 7
1.2. Robó icadese icio .............................. 12
1.3. Au onomía en los obo s de se icio pe sonal . . . . . . . . . . . . . . . . . 13
1.4. Es a egias de ap endizaje . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
1.4.1. Ap endizaje po demos ación . . . . . . . . . . . . . . . . . . . . . 21
1.4.2. Ap endizaje a pa i de la expe iencia . . . . . . . . . . . . . . . . . 25
1.5. Discusión .................................... 26
2 Ap endizaje po e ue zo en obó ica 29
2.1. An eceden es .................................. 29
2.2. El p oblema de ap endizaje po e ue zo . . . . . . . . . . . . . . . . . . . . 31
2.2.1. P ocesos de Decisión de Ma ko . . . . . . . . . . . . . . . . . . . . 32
2.2.2. P ocesos de Decisión de Ma ko Pa cialmen e Obse ables . . . . . 33
2.2.3. Polí ica de con ol . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
2.2.4. Funciones de alo . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
2.3. Algo i mos de ap endizaje po e ue zo . . . . . . . . . . . . . . . . . . . . 37
2.3.1. P og amación dinámica . . . . . . . . . . . . . . . . . . . . . . . . 38
2.3.2. Mé odos de Mon e Ca lo . . . . . . . . . . . . . . . . . . . . . . . . 41
2.3.3. Di e encias empo ales . . . . . . . . . . . . . . . . . . . . . . . . . 42
2.4. Con inuidad del espacio de es ados y acciones . . . . . . . . . . . . . . . . . 48
2.5. O os algo i mos de ap endizaje po e ue zo . . . . . . . . . . . . . . . . . 49
4In oducción
egias eque ían del ajus e de nume osos pa áme os y la elocidad de ap endizaje conseguida
con ellas no pe mi ía su uso en obo s eales. En es a esis se p esen a una nue a es a egia
donde no se á necesa io dispone de in o mación p e ia sob e la a ea y donde el núme o de
pa áme os a ajus a se educe al mínimo. Aho a bien, con es a esis ambién se p e enden
da los p ime os pasos pa a log a el ap endizaje con inuo. Que emos ompe la p opues a
clásica de dos e apas cla amen e di e enciadas: una p ime a e apa de ap endizaje a pa i de
la in e acción obo -en o no, y una segunda e apa donde el obo pone en uso lo ap endido
an e io men e. No se p e ende ob ene un con olado y aplica lo pa a un obo y un en o no
sin oca lo jamás, sino que po con a, buscamos lexibilidad y p e endemos que los u u os
obo s dispongan de con olado es que siemp e es én suje os a posibles cambios, adap ándose
a las di e en es si uaciones que pueda encon a el obo en cualquie momen o.
Es uc u a de la esis
En es a esis amos a desc ibi el abajo ealizado pa a consegui los obje i os menciona-
dos an e io men e. En el capí ulo 1 se con ex ualiza la in es igación, in oduciendo concep os
gene ales sob e la obó ica y el po qué es necesa io el ap endizaje en obo s. Pa a inaliza
es e capí ulo se mos a án dis in as es a egias de ap endizaje de uso habi ual en obó ica de
se icios, en conc e o el ap endizaje po demos ación y el ap endizaje a pa i de la expe ien-
cia.
El capí ulo 2 abo da en de alle el ap endizaje po e ue zo, sus undamen os ma emá icos
y la impo ancia de las unciones de alo . Se hace una e lexión de la e isión bibliog á ica,
donde no solo se mues an los algo i mos clásicos que apo an las bases a pa i de las cua-
les se debe hace cualquie p opues a, sino que ambién se mos a án algunos algo i mos de
ap endizaje po e ue zo más no edosos.
En el capí ulo 3 p esen amos nues a p opues a pa a hace en e al p ime e o que nos
ma camos: aumen a la in e p e abilidad de los algo i mos de ap endizaje po e ue zo. Al
u iliza un algo i mo debemos se capaces de in e p e a de mane a ápida e in ui i a si el
ap endizaje p og esa de la mane a espe ada o si po el con a io hay algún p oblema. La
mayo pa e de los algo i mos son muy poco anspa en es, en ellos no malmen e se acaba
con g andes ma ices dispe sas que no pe mi en sabe si el ap endizaje es á uncionando bien
o mal. Pa a esol e lo p esen amos una nue a o mulación de la unción obje i o, la cual se
basa en p edeci el iempo que anscu i á has a que el obo come a un e o . A pa i de es a

5
nue a unción obje i o cons uimos el algo i mo de ap endizaje Inc easing he ime be o e
ailu e (I_ b ). Es e nue o algo i mo es la base sob e la que se sus en an una buena pa e de
las soluciones apo adas en es a esis.
El capí ulo 4 se cen a en el p oblema de la ep esen ación de es ados o si uaciones ep e-
sen a i as po las que pasa el obo . Una ca ac e ís ica de los algo i mos de ap endizaje po
e ue zo en los que se apoya es a esis es la necesidad de clasi ica el en o no en un conjun o
ini o de es ados a pa i de la in o mación senso ial que ecibe el obo . Es e conjun o debe se
lo su icien emen e g ande como pa a ep esen a inequí ocamen e las di e en es si uaciones
que encuen a el obo , pe o no puede se excesi amen e g ande ya que eso inc emen a ía el
iempo de ap endizaje de mane a exponencial. También, si como se comen ó en los obje i os
de la esis, se desea que el obo se adap e a nue as ci cuns ancias, la ep esen ación de es a-
dos no puede se es á ica o p ediseñada ad hoc. El obo debe se capaz de inco po a nue o
conocimien o a su ep esen ación de es ados sin que ello suponga ol ida lo ya ap endido.
Pa a log a que el obo sea capaz de encon a las si uaciones ele an es du an e el ap endi-
zaje decidimos usa una ed Fuzzy ART [26]. Es e ipo de edes son capaces de gene a de
o ma dinámica y no supe isada una clasi icación de es ados, además ienen la ca ac e ís ica
de se obus as an e si uaciones poco ecuen es. En es a esis hemos adap ado la ed Fuzzy
ART pa a su uso en nues o sis ema de ap endizaje y mos amos cómo es posible gene a un
espacio de es ados a medida que a anza el ap endizaje.
Llegados a es e pun o disponemos de un sis ema capaz de ap ende a “ e y hace ”. Si
como se expuso en los obje i os de la esis, se desea ap ende a pa i del mínimo núme o
de ejemplos, se nos p esen a un dilema, común a odos los p ocesos de ap endizaje y clasi i-
cación, que es el equilib io en e bias y a ianza. Es o es, llega a un equilib io en e cómo
de bien debe el algo i mo de ap endizaje ajus a se a los da os p oceden es de la in e acción
obo -en o no, y al mismo iempo man ene la capacidad de gene aliza co ec amen e an e
nue as si uaciones. El capí ulo 5 mues a una p opues a basada en comi és de ap endedo es
pa a esol e el dilema bias- a ianza. Es a es a egia se basa en un conjun o de ap endedo es
donde cada uno de ellos ap ende de mane a independien e y los e o es que come en no es án
co elacionados. Con es a p opues a alcanzamos una solución que nos pe mi e aslada los
p ocesos de ap endizaje a un obo ope ando en el en o no eal, lo cual e a uno de los obje i os
de la esis. A su ez, al y como se e leja á en es e capí ulo 5, el uso de es os comi és ab e
nue as ías in e esan es de ca a al log o de p ocesos de ap endizaje con inuos.
6In oducción
O o p oblema que enlaza con la ep esen ación del en o no es el g an olumen de in o -
mación senso ial disponible. Una pa e c í ica de cualquie sis ema au ónomo es la pe cepción
senso ial. Al inal del capí ulo 4 alcanzábamos un sis ema capaz de ap ende a “ e y hace ”.
Los comi és del capí ulo 5 nos han pe mi ido acele a es os p ocesos de ap endizaje, aho a
bien, la exis encia de es os comi és ambién acili a á que la pe cepción del en o no se pueda
condiciona aún más a la a ea que el obo es á a ando de esol e . Po es o en el capí ulo 6
se mos a á cómo analiza las señales senso iales pa a ex ae la in o mación ele an e e iden-
i ica los senso es más impo an es pa a la a ea que el obo es á ealizando. Cada ez los
obo s ienen equipados con más senso es que p opo cionan más in o mación y con mayo
ecuencia de ac ualización. Es e olumen c ecien e de in o mación hace que los algo i mos
de ap endizaje a den más en con e ge si la in o mación no es ele an e pa a lo que el obo
quie e hace en cada momen o. Pa a e i a lo aplicamos a los da os senso iales écnicas de la
eo ía de la in o mación con el in de de ec a aquellos senso es más ele an es pa a la a ea.
De es a mane a el algo i mo de ap endizaje dispond á de una mayo calidad en la in o mación
senso ial a medida que a ance el p oceso de ap endizaje.
Po úl imo, se cie a la memo ia con el capí ulo 7, donde se ealiza una e lexión sob e las
p incipales conclusiones que se de i an del abajo desc i o es a esis, y se p oponen nue as
ías de a ance.
CAPÍTULO 1
CONTEXTO Y MOTIVACIÓN
Las his o ias de au óma as humanoides son ecu en es en la mi ología de a ias ci ili-
zaciones (China, G ecia, el impe io islámico). La palab a obo o ma pa e de la an asía
popula desde que el esc i o checo Ka el ˘
Capek la in oduje a en su ob a R.U.R. (Robo s
Uni e sales Rossum) en 1920, pa a e e i se a la gen e a i icial c eada pa a abaja en el
luga de humanos. Desde en onces los obo s son un elemen o ecu en e en las his o ias de
ciencia icción, donde se mues an obo s an o o más in eligen es y capaces que los humanos
e incluso obo s con sen imien os. La ealidad es que la obó ica oda ía es á lejos de alcanza
lo que se mues a en la icción.
En es e capí ulo se mues a una in oducción a los di e en es ipos de obo s exis en es,
con especial de alle en los obo s de se icio. A con inuación se in oduce el concep o de
au onomía y su necesidad en la obó ica de se icio pe sonal. Po úl imo se p esen an dos
es a egias de ap endizaje de g an u ilidad: el ap endizaje po demos ación y el ap endizaje a
pa i de la in e acción con el en o no.
1.1. Tipos de obo s
Según la Robo ics Indus y Associa ion un obo es un manipulado ep og amable y mul-
i uncional diseñado pa a mo e ma e iales o disposi i os con mo imien os p og amados y
con el obje i o de ealiza una a ea. Es a puede se una buena de inición pa a los obo s in-
dus iales aunque es muy es ic i a pa a lo que hoy se conoce como obo s de se icio. A kin
[7] p opone una de inición en la que dice que un obo es una máquina capaz de ex ae in-
8Capí ulo 1. Con ex o y mo i ación
Clasificación de obo s
Mo ilidad Con ol Aplicación
Manipulado es
Mó iles
Teleope ados
Guiado au omá ico
Semiau ónomos
Au ónomos
Indus iales
Se icio P o esional
Pe sonal
Figu a 1.1: Clasi icación de los obo s en unción de su mo ilidad, el ipo de con ol y su aplicación.
o mación del en o no y u iliza el conocimien o que posee sob e el mundo pa a mo e se de
o ma segu a y con un p opósi o.
Exis en muchos ipos de obo s capaces de ealiza di e en es a eas. En la igu a 1.1 se
mues a un esquema gene al de di e en es clasi icaciones de los obo s en unción de a ios
c i e ios: su mo ilidad, su sis ema de con ol, y po úl imo su aplicación.
En unción de su mo ilidad podemos clasi ica a los obo s como obo s manipulado es o
obo s mó iles. Los obo s manipulado es ( igu a 1.2), son aquellos que ealizan, en gene al,
a eas epe i i as y de g an p ecisión. Suelen se b azos a iculados con un e ec o u he a-
mien a en su ex emo, es án anclados en una posición y ope an en un en o no muy delimi ado
y es uc u ado. Su uso más habi ual es en cadenas de ensamblaje pa a la ealización de a eas
como soldadu a, pin ado, pe o ación o desplazamien o de obje os. En la ac ualidad se es án
in oduciendo obo s manipulado es eleope ados en qui ó anos pa a la ealización de cie as
in e enciones.
Los obo s mó iles ( igu a 1.3) se ca ac e izan po la capacidad de desplaza se po el
en o no, sea és e ie a, ai e o agua. Exis en obo s mó iles que se desplazan po en o nos
diseñados pa a acili a su mo imien o, es o sucede p incipalmen e en ámbi os indus iales.
Pe o el log a que un obo se mue a de mane a segu a y au ónoma po un en o no co idiano,
no es uc u ado y que pueda es a densamen e poblado, es aún un e o. Es a memo ia p e ende
se un a ance en es a di ección.
An es de expone la clasi icación de obo s en unción de su au onomía, con iene p o-
po ciona una de inición de dicho é mino. Según Webs e [79] exis en dos de iniciones de
au onomía o, lo que es lo mismo, se pueden es ablece dos g andes ca ego ías: ac uación sin
con ol ex e no y capacidad de au o-gobie no.
1.1. Tipos de obo s 9
(a) (b)
Figu a 1.2: Dos ejemplos de obo s manipulado es: a) b azo a iculado de uso en ins alaciones indus-
iales, y b) obo qui ú gico.
En el p ime caso, cualquie sis ema que anspo e su p opia uen e de ene gía y su p opio
sis ema de con ol se dice que es au ónomo, ya que no depende del ex e io , es deci , es
au osu icien e. Sin emba go, es e ipo de au onomía se conside a “débil”, ya que cualquie
al e ación del en o no o si uación no especi icada gene almen e conlle a un uncionamien o
inco ec o del sis ema.
La segunda de inición implica un mayo g ado de au onomía que podemos denomina
“au onomía ue e”. En es e ni el un sis ema es au ónomo cuando iene capacidad pa a decidi ,
a pa i de sus p opios p ocesos de azonamien o, las acciones que ha de oma en ez de
segui y ejecu a una secuencia ija e inmu able de pasos o ins ucciones. La au onomía ue e
equie e la habilidad pa a cons ui ep esen aciones in e nas del mundo, pa a planea , y pa a
ap ende a pa i de la expe iencia [84].
La ca ac e ís ica más impo an e de un sis ema au ónomo es su capacidad pa a ope a du-
an e la gos pe iodos de iempo en un en o no “na u al” (es deci , sin al e aciones que acili en
su uncionamien o) y sin ningún ipo de in e ención humana di ec a. Es a cualidad conlle a,
ine i ablemen e, la adap ación a los cambios que se p oduzcan en el en o no, una ac uación

10 Capí ulo 1. Con ex o y mo i ación
acep able an e si uaciones no p e is as, el ap endizaje y modi icación del compo amien o a
pa i de la p opia expe iencia, y la cons ucción de ep esen aciones in e nas del mundo pa a
u iliza las en los p ocesos in e nos de azonamien o, como po ejemplo la na egación.
Según P ei e y Scheie [91] la au onomía comple a no exis e, ya que odos los sis emas
dependen, de uno u o o modo, de su en o no. La au onomía es, po an o, una cues ión de
g ado.
Una palab a asociada a los obo s y a su au onomía es la in eligencia. El é mino in eli-
gencia es ampliamen e u ilizado en la bibliog a ía, aunque has a aho a se ha esis ido a una
de inición cla a, ú il y ampliamen e acep ada po oda la comunidad cien í ica. Po es e mo-
i o, es ablece si un sis ema se compo a de o ma in eligen e no deja de se , has a cie o
pun o, subje i o y suje o a la p opia in e p e ación del obse ado y, po lo an o, a su educa-
ción, en endimien o y pun o de is a. Po odo ello, en es e abajo se e i a á conside a si un
sis ema es o no in eligen e, y nos cen a emos más en su g ado de au onomía.
Una ez explicado qué es la au onomía podemos es ablece una nue a clasi icación de
obo s en unción de ella ( igu a 1.1):
– Robo s eleope ados: son aquellos obo s donde odo el con ol lo ealiza un ope ado
humano. Ejemplos de es e ipo de obo son los usados pa a la desac i ación de explo-
si os, o los ehículos aé eos no ipulados (UAV).
– Vehículos de guiado au omá ico (AGV): los AGV son ehículos que se desplazan po
en o nos adap ados con aíles, balizas u o o ipo de ma cado es que pe mi an que es os
obo s sigan u as p ees ablecidas. Habi ualmen e es e ipo de obo s se enca gan de a-
eas de anspo e de me cancías en plan as indus iales. Su au onomía es muy limi ada
ya que, aunque no necesi an ningún humano que los maneje, su uso es á es ingido a
en o nos con olados.
– Robo s semiau ónomos: los obo s semiau ónomos son obo s eleope ados con un g a-
do de au onomía débil. Gene almen e los obo s semiau ónomos poseen con olado es
eac i os, capaces de ealiza a eas sencillas de bajo ni el, lo que les o o ga un g ado
de au onomía bajo. Un ejemplo son los o e s de explo ación espacial usados en Ma -
e. Debido al e a do de las comunicaciones es imposible con ola en iempo eal los
obo s desde la Tie a, po ello los con olado es de misión mandan al obo las consig-
nas ela i as a la misión que debe ealiza , y el obo las ejecu a g acias a su capacidad
limi ada de na egación y adquisición de da os au ónomas.
1.1. Tipos de obo s 11
(a) (b)
(c) (d)
Figu a 1.3: Robo s mó iles con di e sos g ados de au onomía: a) UAV eleguiado P eda o en uso po
el ejé ci o de EE.UU., b) AGV pa a la ca ga de me cancías, c) Ma s Ro e Spi i , obo semiau ónomo
de explo ación ma ciana de la NASA, y d) aspi ado au ónomo Roomba de iRobo .
– Robo s au ónomos: en [12] se de ine a los sis emas au ónomos como aquellos capaces
de ope a en el mundo eal, sin ningún ipo de con ol ex e no, po la gos pe íodos de
iempo. La on e a en e obo s au ónomos y semiau ónomos es di usa en an o que un
mismo obo puede se au ónomo en unos aspec os y eque i ayuda humana pa a o os.
En es a memo ia nos cen a emos en es e úl imo ipo. La in es igación con obo s au ó-
nomos se di ige a la ob ención de sis emas de con ol pa a la ealización co ec a de a eas y
capaces de ges iona la ince idumb e asociada al en o no en el que el obo se encuen a.
12 Capí ulo 1. Con ex o y mo i ación
1.2. Robó ica de se icio
La úl ima clasi icación de las mos adas en la igu a 1.1 es la clasi icación a endiendo al
uso del obo . Según su p opósi o se puede es ablece una di e enciación en e obo s indus-
iales y obo s de se icio. És os a su ez se di iden en obo s de se icio pe sonal y obo s
de se icio p o esional.
La no ma ISO 8373 de ine un obo indus ial como: un manipulado con olado au o-
má icamen e, ep og amable y mul ip opósi o, p og amable en es o más ejes, que puede
es a an o anclado en un luga como se mó il, y de uso en aplicaciones de au oma ización
indus ial.
La de inición de obo de se icio es más compleja y no hay un consenso sob e qué se
puede de ini como obo de se icio y qué no. Según la Fede ación In e nacional de Robó ica
un obo de se icio es aquel que ope a de mane a au ónoma o semiau ónoma pa a ealiza
se icios ú iles al bienes a de los humanos o su equipamien o, excluyendo las ope aciones de
ab icación. Ac ualmen e una comisión de expe os es á abajando pa a ac ualiza la no ma
ISO 8373, dicha ac ualización inclui á una de inición de obo s de se icio.
Den o de los obo s de se icio se puede di e encia en e obo s de se icio de uso p o-
esional o aquellos de uso pe sonal. Nos cen a emos en es os úl imos. Los obo s de se icio
de uso pe sonal son aquellos con capacidades de con i i con las pe sonas y de ealiza a eas
que in luyan di ec amen e en su o ma de ida. És os son obo s domés icos, de igilancia, de
en e enimien o, guías en biblio ecas y museos, e c. ( igu a 1.4). Los obo s de se icio de uso
p o esional son aquellos usados en aplicaciones p o esionales, como puede se ag icul u a,
anspo e, uso mili a , e c. ( igu a 1.5).
Al con a io que la obó ica indus ial, que ya es á bien es ablecida en odas las ases
de la manu ac u a de p oduc os, la obó ica de se icio es oda ía eme gen e ( igu a 1.6).
Según las p e isiones an o de la Fede ación In e nacional de Robó ica como del gobie no
japonés la obó ica de se icio c ece á de mane a exponencial en los p óximos años, an o
a co o plazo ( igu a 1.7) como a medio-la go plazo ( igu a 1.6). Según el Lib o Blanco de
la Robó ica en España [30] nos encon amos al inicio de una e olución que nos lle a á a un
me cado obó ico de consumo, median e la u ilización en el hoga de nue os obo s, au én icos
elec odomés icos mó iles, que complemen a án a los ac uales es á icos. Es po es o que oda
la in es igación dedicada a la obó ica, y especialmen e a la obó ica de se icio, se á c ucial
pa a cumpli es as p e isiones y end á un g an impac o social y económico.
1.3. Au onomía en los obo s de se icio pe sonal 13
(a) (b)
(c) (d)
Figu a 1.4: Robo s de se icio pe sonal: a) Nao, obo humanoide u ilizado en la RoboCup, b) obo
limpia piscinas Dolphin, c) Pa o, una oca obó ica usada en Japón pa a la compañía de ancianos, y d)
Ca e-O-bo un obo asis en e del hoga .
1.3. Au onomía en los obo s de se icio pe sonal
Los en o nos donde ope an los obo s de se icio pe sonal son en o nos co idianos, donde
la gen e i e y abaja, y sus usua ios no se án expe os en obó ica. Es o hace necesa io que
es os obo s sean lo más au ónomos que sea posible, desca gando al usua io inal de a eas
como la con igu ación del obo o el en o no, y la p og amación de las a eas a ealiza .
Las p incipales ca ac e ís icas que se le piden a un obo de se icio pe sonal son las
siguien es:
20 Capí ulo 1. Con ex o y mo i ación
Tabla 1.2: Ca ac e ís icas básicas de la p og amación de obo s, el ap endizaje po expe iencia y el
ap endizaje po demos ación.
Ap endizaje Diseño ad hoc Expe iencia Demos ación
Cómo P og amando Explo ación Ejemplos
Qué Sin ap endizaje Una polí ica de con ol Una polí ica de con ol
De dónde El diseñado P ueba ye o El p o eso
Cuándo Du an e el diseño Du an e ydespués del diseño Du an e ydespués del diseño
Pun os c í icos Se equie e mucho
conocimien o expe o.
Diseño median e
p ueba y e o
La unción de e ue zo
equie e conocimien o
expe o
Rendimien o del p o eso y
el mapeo en e los ejemplos
y el obo
ap ende de sus p opios e o es o de las indicaciones que les p opo ciona un humano. No se
a a consegui un a ance de ini i o de la obó ica de se icio pe sonal has a que los obo s
dispongan de la capacidad de adap a se. La adap ación es lo que hace que el compo amien o
del obo se pueda adecua a los cambios du an e el uncionamien o del mismo. La adap ación
puede ene luga en di e en es escalas de iempo (co o y la go plazo), y puede a ec a a
cualquie ni el del sis ema. Es a necesidad de adap ación es uno de los eque imien os que
ins i uciones como la Eu opean Robo ics Technology Pla o m (EUROP), econocen como
cla es pa a log a el éxi o y la di usión de la obó ica de se icio [38].
1.4. Es a egias de ap endizaje
Una ez is a la necesidad de que el obo adquie a conocimien o du an e su unciona-
mien o amos a e en es e apa ado dos de las es a egias más u ilizadas pa a la adap ación y
el ap endizaje de los obo s.
Como se ha is o en la sección an e io , pa a log a obo s que hagan a eas ú iles en
en o nos complejos se á necesa io do a los de la capacidad de ap endizaje. Exis en di e sas
es a egias de ap endizaje, siendo las más comunes pa a obó ica el ap endizaje po demos-
ación y el ap endizaje po in e acción con el en o no. La abla 1.2 mues a algunas de las
ca ac e ís icas y di e encias básicas en e ambas es a egias de ap endizaje y la p og amación
de con olado es. A con inuación se da á una b e e in oduccion a las écnicas de ap endizaje
po demos ación y ap endizaje po in e acción con el en o no.

1.4. Es a egias de ap endizaje 21
s
Figu a 1.10: Esquema gene al del p oceso de ap endizaje po demos ación. P ime o se obse a al p o-
eso y se de i a una polí ica de con ol. A con inuación esa polí ica es u ilizada pa a ejecu a la a ea.
1.4.1. Ap endizaje po demos ación
En el ap endizaje po demos ación una polí ica de con ol es ap endida median e ejem-
plos o demos aciones p opo cionados po un p o eso . Un ejemplo es una se ie de pa es
es ado-acción que son g abados mien as el p o eso mues a el compo amien o deseado del
obo . Den o del ap endizaje po demos ación exis en di e en es ap oximaciones, si bien no
exis e una e minología es ánda pa a e e i se a ellas. En nues o caso usa emos la e mino-
logía u ilizada en [6].
En el ap endizaje po demos ación es necesa io abo da a ios p oblemas. El p ime o de
ellos es cómo consegui un conjun o de ejemplos álido pa a que el obo pueda ap ende a
pa i de ellos. A con inuación se debe calcula una polí ica de con ol que pe mi a ep odu-
ci el compo amien o obse ado en los ejemplos. Es os pasos se pueden e en el esquema
mos ado en la igu a 1.10.
Cons ui el conjun o de ejemplos es un p oceso en dos e apas: el p ime paso es la g aba-
ción de la a ea mien as la ejecu a un p o eso . El segundo paso es aduci dicha g abación
a un conjun o de en enamien o pa a el ap endizaje de un con olado . Du an e el p ime pa-
so es necesa io ecopila in o mación ela i a a lo que el p o eso pe cibe en cada ins an e
(es adop o eso ), y lo que hace (acciónp o eso ). La p oyección de la in o mación g abada du-
an e el p oceso de demos ación en un conjun o de pa es es ado-acción del p o eso , es lo que
22 Capí ulo 1. Con ex o y mo i ación
Teleope ación Senso es en
el p o eso
Obse ación
ex e na
Demos ación Imi ación
Mapeo del ap endedo
Mapeo de la g abación
Di ec o Indi ec o
Indi ec o Di ec o
Rep oducción
del
compo amien o
Figu a 1.11: Tipos de ap endizaje po demos ación dependiendo de cómo se haga el mapeo de la g a-
bación y el mapeo del ap endedo .
se denomina mapeo de la g abación. Es impo an e des aca que es os pa es es ado-acción es-
án e e idos al p o eso , y se á necesa io aduci los a lo que en cada caso end ía que hace el
obo : es ado obo −acción obo . Es p ecisamen e es e segundo conjun o de da os el que pe mi-
i á el ap endizaje de un con olado . Es a p oyección de in o mación, desde el pun o de is a
del p o eso al pun o de is a del obo que ap ende á la a ea, es lo que denominamos mapeo
del ap endedo . En unción de cómo se ealicen es os dos p ocesos de mapeo se habla á de
di e en es ipos de ap endizaje po demos ación, que son los que se mues an en la igu a
1.11: eleope ación,senso es en el p o eso , ep oducción del compo amien o yobse ación
ex e na.
En el caso de la eleope ación, un ope ado humano con ola á de o ma emo a el mo-
imien o de un obo mien as és e ep oduce la a ea que se p e ende ap ende . Tal y como
se e leja en la igu a 1.11, los p ocesos de mapeo son di ec os dado que du an e el p oceso
de demos ación se g aba lo que el p o eso pe cibe y hace. Aho a bien, conside ando que
la demos ación la hace el p opio obo los pa es es ado-acción g abados ep esen an en sí
mismos la in o mación necesa ia pa a el ap endizaje del con olado .
1.4. Es a egias de ap endizaje 23
En el ap endizaje de senso es en el p o eso se colocan senso es en el demos ado (habi-
ualmen e un humano) que ejecu a la a ea que se p e ende ap ende . De es a mane a du an e
la demos ación se ob iene in o mación de lo que el p o eso pe cibe y hace, azón po la que
al y como se mues a en la igu a 1.11 el mapeo de la g abación es un p oceso di ec o. No
obs an e, lo que el p o eso pe cibe no iene po qué coincidi con lo que e ía el obo . A su
ez, alguna de las acciones ejecu adas po el p o eso pueden no se ealizables po el obo
debido a sus limi aciones ísicas. Es o hace que el mapeo del ap endedo sea más complejo
(indi ec o en la igu a 1.11).
Pa a e i a la complejidad del mapeo del ap endedo de es a segunda opción, una al e -
na i a consis e en log a que un obo obse e lo que hace el humano du an e el p oceso de
demos ación y lo ep oduzca, es el ap endizaje mos ado en la igu a 1.11 como ep oduc-
ción del compo amien o. Con es a al e na i a, du an e la demos ación se g aba lo que el
obo pe cibe y hace, azón po la que el mapeo del ap endedo es di ec o. Sin emba go, es
necesa io algún mecanismo que pe mi a que el obo ep oduzca lo que e du an e el p oceso
de demos ación. Es a es la azón po la que en la igu a 1.11 el mapeo de la g abación se
desc ibe como indi ec o.
Finalmen e, en el cua o y úl imo caso, obse ación ex e na ( igu a 1.11), un humano
(p o eso ) ejecu a la a ea mien as se g aba lo que sucede desde agen es ex e nos (po ejemplo
cáma as ubicadas en el en o no). Es a opción es la más simple desde el pun o de is a del
p o eso (dado que no end ía que po a senso es especí icos o eleope a un obo ), pe o
o ece la mayo complejidad desde el pun o de is a de los mapeos. En es e caso es p eciso
diseña alguna es a egia pa a ob ene lo que el humano pe cibe del en o no y lo que hace en
cada ins an e a pa i de la in o mación g abada (mapeo de la g abación indi ec o). Po o a
pa e ambién es necesa io aduci es a in o mación a lo que el obo debe ejecu a en cada
uno de es os ins an es (mapeo del ap endedo indi ec o).
Es impo an e des aca que en las opciones de eleope ación y ep oducción del compo -
amien o, el obo que ejecu a á la a ea pa icipa en el p oceso de demos ación, mien as
que en las dos opciones es an es, la demos ación se es inge a un ope ado humano. En
consecuencia la g abación de la demos ación en los dos p ime os casos se hace en el p opio
espacio de es ados y acciones del obo . Es po es a azón po la que en la igu a 1.11 las dos
p ime as opciones se encie an en lo que se llama “p oceso de demos ación”, mien as que
las dos opciones es an es se conside an como opciones de “imi ación”.
24 Capí ulo 1. Con ex o y mo i ación
Una ez se iene un conjun o de ejemplos p epa ados pa a su uso po el ap endedo , el
siguien e paso es de i a la polí ica de con ol. Exis en es ap oximaciones p incipales a la
ho a de ob ene la polí ica de con ol [6]:
– C eación de una p oyección pe cepción-acción: con es a écnica se ap ende una unción
que ap oxima el mapeo de es ados a acciones obse ado en los ejemplos. Las écnicas
más comunes pa a ealiza es a ap oximación son las écnicas de clasi icación y de
eg esión.
– Modelo del sis ema: se ap ende un modelo de la dinámica del mundo, po lo que se
conocen las ansiciones en e es ados. G acias a es a in o mación se puede de i a una
polí ica cohe en e con el modelo que esuel a la a ea.
– Planes: una al e na i a es ep esen a el compo amien o deseado del obo como un
plan, es deci , una secuencia de acciones que lle an al sis ema de un es ado inicial a
un es ado inal. Las acciones gene almen e se de inen median e una se ie de p econdi-
ciones y pos condiciones. A di e encia de o as ap oximaciones, en el ap endizaje de
planes no sólo in e iene la secuencia de ejemplos, sino que se incluye cie a in o ma-
ción sob e las in enciones del p o eso .
T as la g abación de los ejemplos y la de i ación de la polí ica de con ol se iene un con-
olado que en el mejo de los casos se i á pa a ejecu a la a ea al y como el p o eso la
enseñó. La calidad de la polí ica ap endida depende eno memen e de la calidad de las demos-
aciones. En gene al se asume que el conjun o de da os de ejemplo con iene demos aciones
de calidad, sin emba go, las demos aciones del p o eso pueden se ambiguas, subóp imas
o allidas. Incluso en el caso de ene demos aciones pe ec as, el compo amien o del obo
sólo es a á ap endido pa a aquellos es ados que el p o eso haya enseñado. Po lo an o, se
hace necesa io que los ejemplos hagan un epaso exhaus i o po odo el espacio de es ados,
o la implemen ación de algún mé odo que gene alice lo ap endido a pa i de los ejemplos
g abados an e nue as si uaciones.
Debido a los p oblemas ecién mencionados es muy p obable que usando di ec amen e
ap endizaje po demos ación el obo no consiga adqui i una buena polí ica de con ol. Una
es a egia que se es á siguiendo ac ualmen e pa a mejo a la polí ica ob enida median e ap en-
dizaje po demos ación es el u iliza ap endizaje a pa i de la expe iencia pa a mejo a la. Un
ejemplo de es o se puede e en [2], donde se enseña a un helicóp e o de ae omodelismo au-
ónomo a ejecu a maniob as ac obá icas. P ime o un pilo o expe o ejecu a las maniob as,
1.4. Es a egias de ap endizaje 25
Pe cepción
Figu a 1.12: Esquema gene al del p oceso de ap endizaje a pa i de la expe iencia: el obo in e ac úa
con el en o no y ecibe una ecompensa a sus acciones. El obje i o del ap endizaje es maximiza dicha
ecompensa.
a pa i de es os da os se ob iene un con olado que a con inuación es mejo ado median e
ap endizaje po e ue zo. En [73] un b azo obó ico ap ende a da la uel a a una o illa. El
ap endizaje po demos ación se hace median e un humano que mue e el b azo pa a ejecu a
la a ea. T as la demos ación el obo no es capaz de da la uel a a la o illa, pe o as di e -
sos ciclos de p ueba y e o consigue un compo amien o exi oso. Una aplicación simila es
la mos ada en [67], donde un b azo obó ico ap ende a juga al boliche, donde el obje i o es
in oduci una pequeña bola en una ecipien e sos enido en la mano. Al igual que en el ejem-
plo an e io , p ime o un humano mue e el b azo mien as ejecu a la a ea y a con inuación se
e ina el compo amien o median e ap endizaje po e ue zo.
1.4.2. Ap endizaje a pa i de la expe iencia
El ap endizaje a pa i de la expe iencia es una es a egia de ap endizaje donde el obo
ap ende una polí ica median e p ueba y e o al in e ac ua con el en o no. Desde el pun o de
is a del usua io es e ap endizaje iene la en aja de que se puede pe cibi una mejo a en el
compo amien o del obo , ya que el obo ap ende de sus allos y e i a los e o es come idos
en el pasado. La mayo i ud de es e ipo de ap endizaje es que no es necesa io que un demos-
ado de ina o ejecu e el compo amien o deseado, únicamen e se necesi a p opo ciona una
ecompensa en unción de la calidad de la a ea ejecu ada. Así el obo i á p obando di e en-

26 Capí ulo 1. Con ex o y mo i ación
es acciones, y según el esul ado de la ejecución ecibi á una ecompensa posi i a o nega i a.
El algo i mo de ap endizaje i á eco dando qué acciones son las que p opo cionan mayo e-
compensa pa a así cons ui una polí ica de con ol que maximice el e ue zo ecibido a la go
plazo ( igu a 1.12).
Tene una unción que le indique al obo cuándo lo es á haciendo bien o mal nos libe a de
ene que p opo ciona lo que se ía la acción co ec a en cada caso, pe o ob ene esa unción
no es i ial, y una unción de e ue zo e ónea p o oca á que el compo amien o ob enido no
sea el deseado o incluso que el obo sea incapaz de ap ende .
Una opción pa a e i a es e p oblema es la o mulación au omá ica de la unción de e-
ue zo. Una o ma de consegui lo es median e el ap endizaje po e ue zo in e so, con es a
es a egia el obje i o es encon a una unción de e ue zo que explique el compo amien o
obse ado [86]. O a opción es la gene ación de e ue zo a pa i de la obse ación del com-
po amien o humano. En el G upo de Sis emas In elixen es de la Uni e sidade de San iago
de Compos ela hemos abajado en es a línea. En [100, 103] se gene a au omá icamen e una
señal de e ue zo que hace que el obo ap enda a mo e se po las mismas á eas po las que
ansi an habi ualmen e las pe sonas que abajan en ese en o no.
O a opción pa a e i a el diseño de una unción de e ue zo es que sea un humano el que
le indique al obo cuándo su compo amien o no es co ec o. De es a mane a, un obse ado
humano puede p opo ciona la señal de e ue zo sin necesidad de conocimien os de obó ica,
únicamen e obse ando al obo y juzgando su compo amien o. En es a esis se mos a á una
implemen ación de es a es a egia, la cual se puede conside a como una ap oximación en e
el ap endizaje po e ue zo y el ap endizaje po demos ación.
En el Capí ulo 2 se da á una explicación po meno izada del ap endizaje po e ue zo, así
como de los di e en es algo i mos desa ollados pa a log a es e ipo de ap endizaje.
1.5. Discusión
En es e capí ulo se ha expues o una clasi icación de los di e en es ipos de obo s, y den o
de ella dónde se engloba la obó ica de se icios pe sonales. Se espe a que los obo s pe so-
nales sean an comunes en el u u o como lo son hoy los elé onos mó iles, pe o pa a log a
es o uno de los p incipales e os es el de do a a es os obo s de au onomía y adap ación.
Una ca ac e ís ica deseable y espe ada de los obo s de se icio pe sonales es la au onomía
a anzada, es o es, el pode ope a co ec amen e du an e un de e minado pe íodo de iempo
1.5. Discusión 27
en un en o no no es uc u ado y sin la ayuda de un ope ado humano. Pa a alcanza dicha
au onomía no se pueden aplica las écnicas clásicas de p og amación de au óma as, ya que
el en o no se á cambian e, las condiciones de la a ea pueden al e a se o el obo puede su i
cambios. Exis e una g an ince idumb e que impide modela cualquie a de es os es aspec-
os, po lo que se hace necesa io encon a écnicas al e na i as pa a do a a los obo s de la
capacidad de adap ación y la posibilidad de que una pe sona no expe a pueda condiciona el
compo amien o del obo .
Pa a un obo de se icio una buena ap oximación es el ap endizaje po demos ación. Se
ha is o cómo exis en écnicas que pe mi en a un obo adqui i un compo amien o a pa i
de los ejemplos que le p opo ciona un humano. Se ía deseable que un usua io de un obo ,
que no iene po qué posee conocimien os de obó ica ni de p og amación pueda enseña a
su obo a ejecu a las a eas que quie a que és e haga.
O a es a egia de ap endizaje álida pa a el ámbi o de la obó ica de se icios es el ap en-
dizaje a pa i de la expe iencia. En es e ipo de ap endizaje se á el obo el que se desplace po
el en o no y a pa i de obse a el esul ado de sus acciones i á mejo ando el compo amien o
has a log a esol e la a ea.
El ap endizaje po demos ación y el ap endizaje a pa i de la expe iencia no son écnicas
incompa ibles, y al y como se mos ó en la Sección 1.4.1 es común el combina las pa a
consegui un con olado sa is ac o io. Ambas es a egias es án abie as a la in es igación y
en el u u o se ealiza án impo an es a ances an o en el ap endizaje po e ue zo como en el
ap endizaje po demos ación. Desde nues o pun o de is a conside amos que el ap endizaje
po in e acción con el en o no p opo ciona la capacidad de en ena a un obo desde ce o
has a la ob ención de un con olado que esuel e la a ea, además de pe mi i la adap ación
de dicho con olado du an e odo el ciclo de ida del obo . Po ello la in es igación mos ada
en es a esis es á o ien ada a la adquisición de compo amien os median e el ap endizaje po
e ue zo.
CAPÍTULO 2
APRENDIZAJE POR REFUERZO EN
ROBÓTICA
En la sección 1.4.2 se in odujo el ap endizaje po e ue zo como un pa adigma capaz de
pe mi i que un obo ap enda a pa i de su in e acción con el en o no. En es e capí ulo se
explica á más de alladamen e es e pa adigma de ap endizaje, p es ando especial a ención a su
aplicación en obó ica. Es e capí ulo no p e ende se un análisis exhaus i o de los algo i mos
de ap endizaje po e ue zo, sino que se in oduci án las di e en es al e na i as exis en es en
la ac ualidad.
2.1. An eceden es
Los p ime os es udios sob e el e ec o del e ue zo en el ap endizaje se emon an al p in-
cipio del siglo XX. Los expe imen os lle ados a cabo po Edwa d L. Tho ndike [127, 128],
donde se obse aba el iempo eque ido po unos ga os pa a escapa de cajas-puzle, demos-
a on que en base a la expe iencia acumulada las acciones poco e ec i as iban siendo cada
ez menos ecuen es. En pa icula , cuando los ga os e an ence ados po p ime a ez ne-
cesi aban mucho iempo pa a escapa , a medida que las acciones co ec as iban siendo más
ecuen es los ga os e an capaces de escapa en un meno iempo. De las a ias acciones que
había pa a una misma si uación, se o alecían aquellas a las que inmedia amen e o en un
co o pe íodo de iempo seguía una espues a sa is ac o ia pa a el animal. Po el con a io, se
debili aban aquellas acciones donde la espues a e a nega i a. Cuan o mayo uese la espues-
36 Capí ulo 2. Ap endizaje po e ue zo en obó ica
Una p opiedad undamen al de las unciones de alo es que sa is acen elaciones ecu -
si as pa icula es. Pa a cualquie polí ica πy cualquie es ado s, la siguien e condición se
man iene en e el alo de sy el alo de sus posibles es ados suceso es:
Vπ(s) = Eπ{R |s =s}
=Eπ(∞
∑
k=0
γk +ks =s)
=Eπ( +γ
∞
∑
k=0
γk +k+1s =s)
=∑
s0
Pπ(s)
ss0"Rπ(s)
ss0+γEπ(∞
∑
k=0
γk +k+1s +1=s0)#
=∑
s0
Pπ(s)
ss0hRπ(s)
ss0+γVπ(s0)i.(2.9)
La ecuación 2.9 es la ecuación de Bellman pa a Vπ. Exp esa la elación en e el alo
de un es ado y los alo es de sus es ados suceso es. La ecuación de Bellman es la base pa a
calcula , ap oxima y ap ende Vπ[135].
De la misma mane a, se puede ob ene la ecuación de Bellman pa a Qπ:
Qπ(s,a) = Eπ{R |s =s,a =a}
=Eπ{ +γVπ(s +1)|s =s,a =a}
=∑
s0
Pa
ss0Ra
ss0+γVπ(s0),(2.10)
Una o ma muy común de ep esen a las unciones de alo ación es en unción de la
polí ica de con ol óp ima en luga de una polí ica de e minada. La polí ica de con ol óp ima
es aquella que maximiza las unciones de alo pa a cada es ado, y po lo an o no exis e
ninguna polí ica mejo que ella. Dado que du an e el ap endizaje no se conoce la polí ica
óp ima, se oma como mejo polí ica has a el momen o la polí ica egoís a o polí ica g eedy.
La polí ica egoís a es aquella que pa a cada es ado selecciona la acción con mayo alo ación
de acue do a lo ap endido has a ese momen o, po lo an o oda polí ica egoís a se á egoís a

2.3. Algo i mos de ap endizaje po e ue zo 37
con espec o a una unción de alo :
π∗(s) = a g max
aQπ(s,a)
=a g max
aE{ +γVπ(s +1)|s = ,a =a}(2.11)
=a g max
a∑
s0
Pa
ss0Ra
ss0+γVπ(s0),
Las unciones de alo de la polí ica óp ima se denominan V∗yQ∗. Las ecuaciones de
Bellman pa a las unciones de alo óp imas V∗yQ∗son:
V∗(s) = max
aE{ +γV∗(s +1)|s =s,a =a}
=max
a∑
s0
Pa
ss0Ra
ss0+γV∗(s0)(2.12)
Q∗(s,a) = E +γmax
a0Q∗(s +1,a0)|s =s,a =a
=∑
s0
Pa
ss0Ra
ss0+γmax
a0Q∗(s0,a0)(2.13)
Las ecuaciones an e io es pe mi en conoce cómo de bueno es un es ado o un pa es ado-
acción. En onces, pa a consegui una nue a polí ica que sea mejo , o al menos igual de buena,
que la mejo de las polí icas ac uales se elegi á pa a cada es ado la acción con mejo alo a-
ción, la acción egoís a.
2.3. Algo i mos de ap endizaje po e ue zo
Los algo i mos de ap endizaje po e ue zo compa en muchos aspec os comunes, pe o
p esen an cie as ca ac e ís icas que pe mi en es ablece una di e enciación en e ellos.
Una p ime a di isión que ha emos espec o a los algo i mos de ap endizaje po e ue zo
se á en base a si és os necesi an un modelo del en o no o no. Un modelo del en o no consis e
en la in o mación sob e la p obabilidad de ansición en e es ados, el e ue zo que se ecibi á
en cada es ado o en cada ansición en e es ados, y cualquie o a in o mación que pe mi a
p edeci el es ado u u o del obo en base al es ado y acción ac uales. Aquellos algo i mos
que u ilicen un modelo se á más complicado que puedan se implemen ados en un obo eal,
es o es debido a la imposibilidad de ob ene un modelo iable de un en o no eal ( e sección
38 Capí ulo 2. Ap endizaje po e ue zo en obó ica
1.3). Po o a pa e, el dispone de un modelo del sis ema pe mi e aplica écnicas que acele an
el ap endizaje, ya que no es necesa ia una ase de explo ación pa a conoce el esul ado de la
ejecución de las acciones.
Los algo i mos que no u ilizan un modelo del en o no se basa án en el e ue zo ob enido
as cada i e ación pa a calcula las unciones de alo . Es os modelos no necesi an almacena
una ma iz de p obabilidades de ansición ni la ma iz de e ue zos (sección 2.2.1). En es a
sección se mos a án algunos de los algo i mos u ilizados en ambos ipos de ap endizaje po
e ue zo: la p og amación dinámica, la cual u iliza un modelo, los mé odos de Mon e Ca lo y
los mé odos de di e encias empo ales. Es os dos úl imos mé odos no equie en el uso de un
modelo.
2.3.1. P og amación dinámica
La p og amación dinámica es una écnica de op imización ú il en la oma de una se ie
de decisiones in e elacionadas [13], ya que p opo ciona un p ocedimien o sis emá ico pa a
de e mina la combinación de decisiones que maximiza el e ue zo ecibido. El ap endizaje
po e ue zo se puede en ende como un p oblema de op imización, y po lo an o es posible
aplica p og amación dinámica pa a esol e lo. En es e caso se debe encon a la polí ica
de con ol que maximiza las unciones de alo , y la in e elación de las decisiones iene
dada po el hecho de que exis a una cadena de es ados y acciones, lo cual implica que las
decisiones omadas en un es ado a ec a án a los demás. Una p opiedad de la p og amación
dinámica es que, dada la solución óp ima a un p oblema, és a con iene la solución óp ima a
cualquie subp oblema del mismo. G acias a es o, la polí ica de con ol ob enida median e
p og amación dinámica se á la polí ica de con ol óp ima pa a cada uno de los es ados.
Dado un modelo pe ec o del en o no la p og amación dinámica puede usa se pa a calcu-
la la polí ica óp ima. Si se conoce a la pe ección la dinámica del en o no, la ecuación 2.9 es
un sis ema de |S|ecuaciones lineales con |S|incógni as (los alo es Vπ(s),s∈S). Aunque la
solución es di ec a, equie e mucha compu ación. O a solución es usa un mé odo i e a i o
que aya ap oximando la unción de alo ación en unción del alo en la i e ación an e-
io . Den o del con ex o del ap endizaje po e ue zo, la p og amación dinámica se di ide en
dos es a egias: i e ación de polí ica e i e ación de alo [123]. Es os algo i mos se ob ienen
adap ando las ecuaciones de Bellman a eglas de ac ualización pa a mejo a las unciones de
alo .
2.3. Algo i mos de ap endizaje po e ue zo 39
Algo i mo 2.1 I e ación de polí ica
Inicializa alea o iamen e V(s)∈ℜyπ(s)∈A∀s∈S
epe i
E aluación de polí ica
epe i
∆←0
pa a odo s∈Shace
←V(s)
V(s)←∑s0Pπ(s)
ss0[Rπ(s)
ss0+γV(s0)]
∆←max(∆,| −V(s)|)
in pa a
has a que ∆<θ(un núme o posi i o pequeño)
Mejo a de polí ica
poli ica_es able ← e dade o
pa a odo s∈Shace
b←π(s)
π(s)←a g max
a∑s0Pa
ss0[Ra
ss0+γV(s0)]
si b6=π(s)en onces
poli ica_es able ← also
in si
in pa a
has a que poli ica_es able = e dade o
I e ación de polí ica
El p oceso de i e ación de polí ica se basa en i al e nando e apas de e aluación y mejo a
de la polí ica de con ol has a encon a una solución sa is ac o ia. En la e apa de e aluación
de polí ica se calcula Vπde una polí ica πcons an e, y en la e apa de mejo a de polí ica se
modi ica la polí ica πcon el in de busca o a al e na i a π0que p opo cione mayo alo a-
ción, Vπ0>Vπ. El algo i mo 2.1 mues a el algo i mo de i e ación de polí ica pa a polí icas
de e minis as.
Conside ando una secuencia de unciones de alo ap oximadas V0,V1,V2,..., la ap oxi-
mación inicial V0escoge un alo a bi a io pa a odos los es ados, excep uando el es ado
e minal, si exis e, donde su alo debe se 0. Siguiendo un p oceso i e a i o se puede i a i-
nando el alo de V eniendo en cuen a el alo en el ins an e an e io . Du an e la e apa de
40 Capí ulo 2. Ap endizaje po e ue zo en obó ica
e aluación de polí ica (algo i mo 2.1) cada ap oximación sucesi a de Ves ob enida usando la
ecuación de Bellman como egla de ac ualización:
Vk+1(s) = Eπ{ +γVk(s +1)|s =s}
=∑
s0
Pπ(s)
ss0[Rπ(s)
ss0+γVk(s0)],(2.14)
∀s∈S. La secuencia {Vk}con e ge a Vπcuando k→∞, en la p ác ica se asume que el
algo i mo alcanza la con e gencia cuando el cambio de Ves ce cano a 0. Es e algo i mo es
llamado e aluación i e a i a de polí ica.
Una ez se iene una unción de alo Vπpa a una polí ica a bi a ia π, lo que in e esa
es encon a una polí ica al e na i a mejo , es la e apa de mejo a de polí ica. Po lo an o, lo
que debemos sabe es si la alo ación mejo a ía al escoge una acción di e en e en un es ado
dado. La o ma de hace lo es conside ando la selección de la acción egoís a π∗(s)(ecuación
2.11), y siguiendo a con inuación la polí ica exis en e π. En onces, la nue a polí ica se á igual
de buena o mejo que πsi
Qπ(s,π∗(s)) ≥Vπ(s).(2.15)
La ecuación 2.11 nos pe mi e mejo a una polí ica πa una nue a polí ica π0a pa i de Vπ.
En onces es posible calcula Vπ0y mejo a o a ez pa a ob ene una polí ica aún mejo π00.
Aplicado sucesi as mejo as y e aluaciones se ob iene una secuencia de polí icas y unciones
de alo :
π0E
−→ Vπ0I
−→ π1E
−→ Vπ1I
−→ π2E
−→ ··· I
−→ π∗E
−→ V∗,
donde E
−→ ep esen a una e aluación de polí ica y I
−→ ep esen a una mejo a de polí ica.
Dado que un MDP iene un núme o ini o de polí icas, es e p oceso con e ge a una polí ica
óp ima y a una unción de alo óp ima en un núme o ini o de i e aciones.
I e ación de alo
Un p oblema de la i e ación de polí ica es que cada una de sus i e aciones implica un p o-
ceso de e aluación de polí ica (algo i mo 2.1), lo que puede aca ea un cos o compu acional
ele ado. Una mane a de aco a el p oceso es combina la e aluación de polí ica con la mejo a
de polí ica en un único paso. De es a mane a se ac ualiza Vsob e la polí ica egoís a en cada
momen o, po lo que no hab á una polí ica cons an e. El algo i mo 2.2 mues a el p oceso
esul an e, donde se ac ualiza el alo de V(s)en unción de la acción que p opo ciona mayo
2.3. Algo i mos de ap endizaje po e ue zo 41
Algo i mo 2.2 I e ación de alo
Inicializa alea o iamen e V(s)∈ℜ∀s∈S
epe i
∆←0
pa a odo s∈Shace
←V(s)
V(s)←max
a∑s0Pa
ss0[Ra
ss0+γV(s0)]
∆←max(∆,| −V(s)|)
in pa a
has a que ∆<θ(un núme o posi i o pequeño)
de ol e Polí ica de e minis a π al que π(s) = a g max
a∑s0Pa
ss0[Ra
ss0+γV(s0)]
e ue zo. A es a ecuación se llega ans o mando la ecuación óp ima de Bellman (ecuación
2.12) en una egla de ac ualización.
Al igual que en la i e ación de polí ica, en el caso de la i e ación de alo la con e gencia
aV∗se alcanza ía en el in ini o. En la p ác ica lo que se hace es pa a una ez que el cambio
en la unción de alo en e i e aciones sucesi as alcanza un alo mínimo.
Los algo i mos clásicos de p og amación dinámica son de una u ilidad limi ada en el
ap endizaje po e ue zo en obó ica debido a la asunción de un modelo pe ec o. A con i-
nuación se p esen a una se ie de algo i mos que no equie en un modelo del en o no.
2.3.2. Mé odos de Mon e Ca lo
Los mé odos de Mon e Ca lo, al igual que la p og amación dinámica, p e enden ap oxi-
ma unciones de alo . Pe o a di e encia de la p og amación dinámica, los mé odos de Mon e
Ca lo no necesi an un conocimien o comple o del en o no, no equie en un modelo. En luga
de la dinámica del en o no los mé odos de Mon e Ca lo se basan en la expe iencia, secuencias
de es ados, acciones y e ue zos ob enidos median e in e acción di ec a con el en o no, po
lo que es necesa io que el obo in e ac úe con su en o no pa a ob ene es as obse aciones
a pa i de las cuales se calculan las unciones de alo . Se asume que el conjun o de expe-
iencias se di ide en episodios, y que odos los episodios e minan en un momen o dado. Sólo
cuando el episodio e mina se cambian las alo aciones y las polí icas de con ol.

42 Capí ulo 2. Ap endizaje po e ue zo en obó ica
Pa a calcula las unciones de alo pa a una polí ica de con ol dada a pa i de la expe-
iencia, la idea más simple es p omedia los e ue zos obse ados as cada isi a a un es ado.
En pa icula , supongamos que que emos es ima Vπ(s)a pa i de un conjun o de episodios
en los que se pasa po el es ado smien as se ejecu a la polí ica π. Dado que en un episodio
puede apa ece el mismo es ado en a ias ocasiones, se puede calcula Vπ(s)de dos mane as:
si se calcula Vπ(s)como la media de los e ue zos ob enidos as cada apa ición de sse le
llama mé odo de Mon e Ca lo de cada- isi a. Si en luga de p omedia odas las apa iciones
de sse u iliza únicamen e el e ue zo as la p ime a apa ición se le llama mé odo de Mon e
Ca lo de p ime a- isi a. Ambos mé odos con e gen a V∗(s)en el in ini o.
Sin un modelo del en o no disponible se hace más adecuado el cálculo de alo es de acción
que de alo es de es ado. Ya que no conocemos la dinámica del en o no no se puede escoge
la acción que nos lle e al siguien e es ado mejo alo ado. Es po eso que se hace necesa io
conoce el alo de cada acción pa a pode escoge la mejo alo ada en cada es ado.
La o ma de calcula la unción de alo de acción es simila al cálculo de la unción
de alo de es ado. Dada una se ie de episodios, pa a es ima Qπ(s,a)se p omedia en e los
e ue zos ob enidos as cada isi a (o as la p ime a en el caso de un mé odo de p ime a-
isi a) a sy la ejecución de a. El p oblema es que en el caso de una polí ica de e minis a
muchas acciones no se ejecu a án, con lo que no se pod á calcula su unción de alo y no
se pod á mejo a la polí ica. La solución se á o bien obliga a que cada episodio empiece
con un pa es ado-acción di e en e, lo que puede se imposible en una p ueba eal; o bien
u iliza polí icas es ocás icas, donde cada acción iene una p obabilidad dis in a de ce o de se
seleccionada en cada es ado. Po lo an o con los mé odos de Mon e Ca lo se debe alcanza un
comp omiso en e la explo ación de acciones conocidas y la explo ación de nue as acciones
aún no ejecu adas.
El algo i mo 2.3 mues a el mé odo de Mon e Ca lo pa a alo aciones de pa es es ado-
acción y pa a p ime a- isi a. Como se puede obse a en el algo i mo, la mejo a de polí ica
se ealiza calculando la polí ica egoís a espec o a la ac ual unción de alo :
πk+1(s)←a g max
aQπk(s,a).(2.16)
2.3.3. Di e encias empo ales
El ap endizaje basado en di e encias empo ales es una combinación de las ideas de la
p og amación dinámica y de los mé odos de Mon e Ca lo. Los mé odos de di e encias em-
2.3. Algo i mos de ap endizaje po e ue zo 43
Algo i mo 2.3 Mé odo de Mon e Ca lo de p ime a- isi a
pa a odo s∈S,a∈Ahace
Q(s,a)←Inicializa alea o iamen e
π(s)←Inicializa alea o iamen e
Re ue zo(s,a)←Lis a acía
in pa a
epe i
Gene a un episodio u ilizando es ados iniciales explo a o ios y π
pa a odo pa s,aen el episodio hace
R← e ue zo as la p ime a ocu encia de s,a
Añadi Ra la lis a Re ue zo(s,a)
Q(s,a)←p omedio Re ue zo(s,a)
in pa a
pa a odo sen el episodio hace
π(s)←a g max
aQ(s,a)
in pa a
in epe i
po ales ac ualizan las es imaciones de las unciones de alo en base a o as es imaciones, sin
espe a a que el episodio inalice. Y al y como ocu e con los mé odos de Mon e Ca lo, el
ap endizaje po di e encias empo ales puede ap ende di ec amen e a pa i de la expe iencia
sin un modelo del en o no.
Al igual que los mé odos de Mon e Ca lo, las di e encias empo ales u ilizan la expe iencia
pa a ac ualiza las unciones de alo . El caso más simple de di e encias empo ales se conoce
como TD(0). El 0 hace e e encia a que la unción de alo ación de un es ado se ac ualiza en
base a la alo ación del es ado siguien e. Pa a lle a a cabo dicha ac ualización se ecu e a la
ecuación de Bellman:
V(s )←V(s )+α[ +γV(s +1)−V(s )],(2.17)
donde es el e ue zo ecibido as isi a el es ado s , y αes un pa áme o cons an e que
con ola el cambio de V.
Al igual que con la p og amación dinámica y los mé odos de Mon e Ca lo, con las di e-
encias empo ales se sigue un mé odo i e a i o pa a consegui una polí ica de con ol óp ima.
Con el ap endizaje de di e encias empo ales se á necesa io un comp omiso en e explo ación
y explo ación, lo que di ide los algo i mos de di e encias empo ales en on-policy yo -policy.
44 Capí ulo 2. Ap endizaje po e ue zo en obó ica
Algo i mo 2.4 Algo i mo Sa sa
Q(s,a)← alo es iniciales alea o ios
epe i
Obse a es ado inicial s
Selecciona apa a sa pa i de una polí ica de i ada de Q(p.ej. egoís a)
epe i
Ejecu a acción a, obse a ,s0
Selecciona a0pa a s0a pa i de una polí ica de i ada de Q(p.ej. egoís a)
Q(s,a)←Q(s,a)+ α[ +γQ(s0,a0)−Q(s,a)]
s←s0;a←a0;
has a que Fin del episodio
has a que Con e gencia alcanzada
En los algo i mos on-policy la polí ica que se es á ejecu ando es la misma que la que se es-
á e aluando. Los algo i mos o -policy e alúan una polí ica mien as que la polí ica siendo
ejecu ada no iene po qué se la misma. A con inuación amos a desc ibi algunos de los
algo i mos más conocidos de ap endizaje po di e encias empo ales.
Sa sa
Sa sa es un algo i mo on-policy pa a encon a una polí ica de con ol median e di e en-
cias empo ales. Pa a un algo i mo de es e ipo se debe es ima la unción de alo de acción
Qπ(s,a)pa a la polí ica ac ual πy pa a odos los es ados sy acciones a. La egla de ac uali-
zación usando TD(0)es:
Q(s ,a )←Q(s ,a )+α[ +γQ(s +1,a +1)−Q(s ,a )].(2.18)
Es a ac ualización se ealiza as cada ansición desde un es ado no e minal s al es ado
siguien e s +1. Si s +1es e minal, en onces Q(s +1,a +1) = 0. Es a egla u iliza la upla de
elemen os (s ,a , ,s +1,a +1), que es de donde p ocede el nomb e del algo i mo (Sa sa).
Q-Lea ning
Uno de los a ances más impo an es en el ap endizaje po e ue zo ha sido el desa ollo
del algo i mo de ap endizaje de di e encias empo ales o -policy conocido como Q-lea ning
[135]. Q-lea ning es uno de los algo i mos de ap endizaje po e ue zo más popula es. Su
2.3. Algo i mos de ap endizaje po e ue zo 45
Algo i mo 2.5 Algo i mo Q-lea ning
Q(s,a)← alo es iniciales alea o ios
epe i
Obse a es ado inicial s
epe i
Selecciona apa a sa pa i de una polí ica de i ada de Q(p.ej. egoís a)
Ejecu a acción a, obse a ,s0
Q(s,a)←Q(s,a)+ α[ +γmax
a0Q(s0,a0)−Q(s,a)]
s←s0
has a que Fin del episodio
has a que Con e gencia alcanzada
o ma más simple, Q(0), se de ine po
Q(s ,a )←Q(s ,a )+αh +γmax
aQ(s +1,a)−Q(s ,a )i.(2.19)
En es e caso, la unción de alo de acción ap endida, Q, ap oxima di ec amen e Q∗, la unción
de alo de acción egoís a, independien emen e de la polí ica que se es é ejecu ando.
Mé odos ac o -c í ico
La p incipal ca ac e ís ica de los mé odos ac o -c í ico [72] es que disponen de una es-
uc u a de memo ia pa a almacena la polí ica de con ol de mane a explíci a e independien e
de las unciones de alo . Son mé odos on-policy ya que la polí ica, conocida como ac o , se
usa pa a selecciona las acciones, y las unciones de alo , el c í ico, e alúan dicha polí i-
ca. La alo ación end á la o ma de un e o de di e encias empo ales como el mos ado a
con inuación:
δ = +γV(s +1)−V(s ),(2.20)
donde Ves la unción de alo implemen ada po el c í ico. Es e e o se u iliza pa a e alua
la acción a que se acaba de ejecu a en el es ado s , de mane a que si el e o es posi i o se
debe inc emen a la posibilidad de ejecu a a en s , o disminui la en caso con a io. Si, po
ejemplo, la p obabilidad de selecciona una acción en un es ado es:
P {a =a,s =s}=ep(s,a)
∑bep(s,b),(2.21)
52 Capí ulo 2. Ap endizaje po e ue zo en obó ica
Se de ine φ(s,a)como el ec o columna de amaño kdonde cada en ada jes el alo de
la unción φje aluado en (s,a):
φ(s,a) =








φ1(s,a)
···
φ2(s,a)
···
φk(s,a)








Aho a, b
Qπpuede exp esa se de mane a compac a como b
Qπ=Φwπ, donde wπes un ec o
columna de longi ud kque con iene los pa áme os y Φes una ma iz (|S|·|A|×k)de la o ma
Φ=








φ(s1,a1)T
···
φ(s,a)T
···
φ(s|S|,a|A|)T








Cada ila de Φcon iene el alo de odas las unciones base pa a un cie o pa (s,a), y cada
columna con iene el alo de una unción base pa a odos los pa es (s,a).
Asumiendo que las k unciones base son linealmen e independien es, el p oblema de
ap ende los pa áme os wπde b
Qπ=Φwπse esuel e esol iendo el sis ema lineal de (k×k)
ecuaciones:
Awπ=b,
donde A=ΦT∆µ(Φ−γPΠπΦ)yb=ΦT∆µR, siendo ∆µla ma iz diagonal que ep esen a
la impo ancia de la ap oximación del e o pa a cada pa es ado-acción, y Ππla ma iz que
desc ibe la polí ica π. No se en a á en de alle sob e Ayb, pe o dado que con ienen las
ma ices PyRes ob io que se necesi a un modelo del sis ema. Sin emba go, exis e una
solución i e a i a basada en la in e acción con el en o no que e i a la necesidad de c ea y
almacena de o ma explíci a un modelo (algo i mos 2.7 y 2.8).
Dado un conjun o de ejemplos Dde la o ma (s,a, ,s0), el núme o de unciones base k, el
conjun o de unciones base φ, el coe icien e de descuen o γ, y una polí ica π, el algo i mo 2.7
p esen a el p oceso pa a calcula una ap oximación de los pa áme os w.
El algo i mo 2.7 pe mi e ap ende la unción de alo Qπde los pa es es ado-acción.
Con dicho algo i mo se puede ealiza un p oceso de i e ación de polí ica que encuen e una

2.5. O os algo i mos de ap endizaje po e ue zo 53
Algo i mo 2.7 Algo i mo LSTDQ
˜
A←0 // ma iz (k×k)
˜
b←0 // ma iz (k×1)
pa a cada (s,a, ,s0)∈Dhace
˜
A←˜
A+φ(s,a)(φ(s,a)−γφ(s0,π(s0)))T
˜
b←˜
b+φ(s,a)
in pa a
˜wπ←˜
A−1˜
b
de ol e ˜wπ
Algo i mo 2.8 Algo i mo LSPI
w0←w0
epe i
w←w0
w0←LSTDQ(D,k,φ,γ,w)
has a que (kw−w0k<ε)
de ol e w
ap oximación de los pa áme os capaz de esol e la a ea. Es a i e ación de polí ica da luga
al algo i mo LSPI, mos ado en el algo i mo 2.8. Es e algo i mo p opo ciona un ec o wa
pa i del cual se puede ob ene la polí ica egoís a como:
π(s) = a g max
aQ(s,a) = a g max
aφ(s,a)Tw.(2.31)
En [75] se mues an esul ados pa a es a eas en simulación donde el algo i mo mues a
un buen endimien o. Los au o es indican que una de las p incipales des en ajas de su mé odo
es que si los ejemplos no son su icien emen e ep esen a i os no se log a un buen ap endizaje,
aunque es o es un p oblema común a odos los algo i mos de ap endizaje po e ue zo. O o
p oblema es que las unciones de alo pueden a o ece aquellos pa es es ado-acción más
isi ados dependiendo de la dis ibución de los ejemplos. Po úl imo, el endimien o del algo-
i mo depende de la elección de las unciones base, algo que debe se decidido po un expe o
y que depende del p oblema a a a .
54 Capí ulo 2. Ap endizaje po e ue zo en obó ica
0 0 2 0 4 0 6 0 8 1
0
-0 1
-0 4
-0 2
-0 6
-1
-0 3
-0 7
-0 9
-0 8
-0 5
a
Q
,
,
,
,
,
,
,
,
,
, , , ,
Figu a 2.2: Ejemplo de wi e- i ing. En es a imagen se mues a cómo los Q- alo es de una acción unidi-
mensional ason ep esen ados median e una unción con inua de inida median e es cables, mos ados
como ◦.
2.5.3. Algo i mos sob e espacios con inuos
Ad an age Lea ning
En [41] se p esen a una a iación del Q-lea ning con un mejo endimien o y capaz de
ap ende en espacios de es ados y acciones con inuos. Pa a ap oxima la unción Qse u iliza
una combinación de una ed de neu onas eed o wa d y un in e polado . La en ada de la ed
de neu onas a i iciales se á la pe cepción ac ual y como salida p opo ciona un conjun o de
acciones y su alo ación en la o ma de pa es acción- alo ación [u,q], donde ues el ec-
o de acción (la acción en cada una de las dimensiones), y qes la alo ación. Es a ed de
neu onas se ocupa de gene aliza en e es ados simila es, sin emba go, pa a esol e el p o-
blema de la con inuidad de las acciones se u iliza el in e polado an e io men e mencionado.
En es e caso el in e polado es una unción de wi e- i ing [10]. Es a unción ep esen a los
alo es de los pa es es ado-acción como una supe icie mul idimensional in e polando en e
una se ie de pun os, llamados cables. En es e caso los cables son los pa es acción- alo ación
p opo cionados po la ed neu onal. La igu a 2.2 mues a un ejemplo en el que una acción
unidimensional es in e polada median e 3 cables. La unción de wi e- i ing in e pola en e los
cables pa a pe mi i una ep esen ación con inua de la unción de alo Qque aba que odo el
espacio de acciones.
2.5. O os algo i mos de ap endizaje po e ue zo 55
El algo i mo de ap endizaje cons a de los siguien es pasos:
1. Pa a un es ado dado se ejecu a la acción con mayo alo ación qde en e las acciones
p opo cionadas po la ed neu onal. A con inuación se obse a el esul ado.
2. Se calcula una nue a es imación de Qpa a la acción ejecu ada a pa i del alo ac-
ual, el e ue zo y la alo ación del es ado siguien e. Pa a ello se sigue la unción de
ac ualización de Q-lea ning.
3. La nue a es imación de la unción de alo implica modi ica la cu a o supe icie que
ep esen a la unción Qpa a odo el espacio de acciones ( igu a 2.2). Es o supone ea-
liza nue os cálculos pa a uyqde cada cable con el in de ap oxima co ec amen e la
cu a. A con inuación se ealiza un en enamien o de la ed neu onal pa a que p oduzca
como salidas los nue os alo es de uyq.
Es a p opues a mejo a de mane a signi ica i a el endimien o en compa ación con Q-
lea ning. Un p oblema que iene al usa edes de neu onas como medio pa a gene aliza los
es ados es que necesi an inyec a en adas a i icialmen e pa a no ol ida e en os pasados. De
es a mane a, ejemplos de es ado-acción-es ado son almacenados y se le uel en a p esen a a
la ed cada cie o iempo.
Ac o -C í ico Na u al
Uno de los algo i mos de ap endizaje po e ue zo que más éxi o es á eniendo en los
úl imos años es NAC [90]. Como su nomb e indica se basa en una a qui ec u a ac o -c í ico,
po lo an o es una es a egia de i e ación de polí ica. Pa a a a el p oblema de la con inuidad
el algo i mo u iliza polí icas pa ame izadas y la ac ualización de los pa áme os se ha á en
base al g adien e del e ue zo espe ado de las polí icas. El nomb e de Ac o -C í ico Na u al
p o iene del uso del g adien e “na u al” [5], es o es el ascenso más p onunciado espec o
a la mé ica de in o mación de Fishe . Pa a aplica es e algo i mo se asume que se abaja
sob e un P oceso de Decisión de Ma ko , aunque los au o es a i man que se puede aplica en
p oblemas con in o mación pa cial de los es ados.
Se p esen an dos e siones del algo i mo NAC:
– NAC con LSTD-Q(λ): u ilizan una e sión mejo ada de LSTD pa a ap oxima las un-
ciones de alo . Necesi a añadi al conjun o de unciones base unas nue as unciones
56 Capí ulo 2. Ap endizaje po e ue zo en obó ica
de i adas a pa i del g adien e na u al. Dichas unciones pueden causa des iaciones
en el ap endizaje.
– eNAC: pa a mejo a el p oblema de la des iación de la e sión an e io , se p esen a una
e sión episódica donde la única unción base a mayo es es una cons an e. Al se un al-
go i mo episódico se pueden ap oxima las unciones de alo a pa i de los esul ados
eales obse ados al inal de cada episodio.
En [90] se p esen an esul ados an o en simulación como con un obo eal. En simulación
el algo i mo se en en a a la a ea de sos ene un péndulo in e ido anclado a una base mó il,
conocida como Ca -Pole Balancing. El sis ema esuel e la a ea en 10 minu os, en e a las
2 ho as que a da el algo i mo analí ico con a el que se compa a. En es e mismo abajo
ambién se mues an los esul ados ob enidos al aplica el algo i mo a un b azo obó ico que
debe ap ende a ba ea una pelo a. El b azo obó ico iene 7 g ados de libe ad. En un p incipio
al obo se le enseña median e ap endizaje supe isado, pe o el compo amien o ob enido no
es capaz de golpea la pelo a. Es e compo amien o es mejo ado median e el Ac o -C í ico
Na u al (NAC) y se consigue que golpee la pelo a as unos cien os de episodios.
PoWER
J. Kobe y J. Pe e s desa olla on el algo i mo PoWER (Policy lea ning by Weigh ing
Explo a ion wi h he Re u ns [66]) con la in ención de c ea un algo i mo pa a el ap endi-
zaje de p imi i as mo o as en p oblemas con un g an núme o de dimensiones. Como o os
algo i mos p esen ados an e io men e, PoWER ep esen a las polí icas como un conjun o de
unciones base pa ame izadas, y en es e caso se busca op imiza los pa áme os de dichas
unciones median e un mé odo de Maximización de la Espe anza (EM) con el in de ob ene
el mayo e ue zo. Un aspec o impo an e de es e algo i mo es que se eu ilizan los episodios
pasados asignándoles a cada uno una impo ancia en unción del esul ado ob enido. Pa a
ello ep esen an la ponde ación de una a iable xen base a la impo ancia de un episodio
τ= [s1:T+1,a1:T]de T+1 es ados y Tacciones como hxiw(τ). Aquellos episodios de baja
impo ancia se desca an, y el es o se án u ilizados pa a mejo a la polí ica de con ol pon-
de ando los episodios en unción de su impo ancia. El algo i mo 2.9 mues a el p oceso de
ap endizaje de los pa áme os θ.
Los au o es mues an esul ados an o en simulación como con un obo eal. En simula-
ción compa an su algo i mo con o as p opues as y PoWER se mues a mejo que odos los
2.6. Fo mulación del e ue zo 57
Algo i mo 2.9 Algo i mo PoWER
Dados un conjun o de unciones base φ, sus pa áme os θy una unción de explo ación ε
epe i
Toma de da os: ejecu a episodio(s) u ilizando a= (θ+ε )Tφ(s)con [ε ]i j ∼N(0,σ2
i j)
y almacena las uplas ( ,s ,a ,s +1,ε , )pa a ={1,2,...T+1}.
Es imación:ˆ
Qπ(s,a, ) = ∑T
˜
= (s˜
,a˜
,s˜
+1,˜
).
Ponde ación: calcula un conjun o de pesos que ponde en la impo ancia de los episodios
desca ando los de poca impo ancia.
Ac ualización polí ica:θk+1=θk+h∑T
=1ε Qπ(s,a, )iw(τ)
h∑T
=1Qπ(s,a, )iw(τ)
has a que θk+1≈θk
demás algo i mos. Como esul ados en un en o no eal mues an cómo un b azo obó ico con
sie e g ados de libe ad ap ende a juga al boliche. Dado que la a ea es ex emadamen e com-
pleja pa a se ap endida sin ningún conocimien o p e io, como paso p e io al ap endizaje po
e ue zo se ealiza un ap endizaje po demos ación pa a inicializa las p imi i as de con ol.
T as la ase de ap endizaje po demos ación los au o es aplican el algo i mo PoWER y as
unos 75 in en os el obo es capaz de comple a el juego con éxi o.
2.6. Fo mulación del e ue zo
Todos los algo i mos mos ados en es e capí ulo dependen de una señal de e ue zo que
indique cuándo el obo es á ejecu ando el compo amien o de mane a co ec a. El diseño e
implemen ación de es a señal de e ue zo es una a ea c ucial pa a consegui que el obo
alcance el compo amien o deseado. Po lo an o, no se puede conside a que el p oceso de
ap endizaje es o almen e au ónomo, y no es ac ible pedi a pe sonas no expe as en obó ica
que especi iquen adecuadamen e el conjun o de eglas necesa ias pa a indica cuándo el obo
lo es á haciendo bien o mal. A con inuación se exponen b e emen e dos al e na i as pa a la
ob ención au omá ica de la señal e ue zo: el ap endizaje po e ue zo in e so y la ob ención
de la señal de e ue zo a pa i de la obse ación del compo amien o humano.
Ap endizaje po e ue zo in e so
El p oblema del ap endizaje po e ue zo in e so es ob ene la unción de e ue zo a pa i
de la obse ación de un agen e ejecu ando un compo amien o [86]. La mo i ación del ap en-

58 Capí ulo 2. Ap endizaje po e ue zo en obó ica
dizaje po e ue zo in e so iene dos e ien es. Po un lado se ideó como un mé odo ú il a la
ho a de ob ene la unción siendo op imizada po un sis ema na u al (p.ej. la búsqueda de néc-
a po pa e de abejas). Po o o lado se io su u ilidad pa a el ap endizaje en obó ica, ya que
si se dispone de un agen e o demos ado capaz de ejecu a co ec amen e el compo amien o
es posible ex ae la unción de e ue zo pa a aplica ese e ue zo en nue os ap endizajes.
El obje i o del ap endizaje po e ue zo in e so es ob ene una unción de e ue zo Rque
maximice el e ue zo ob enido po la polí ica óp ima. La unción de e ue zo se á de la o ma
R(s) = w1φ1(s)+ w2φ2(s)+··· +wNφN(s),(2.32)
donde φnes una unción base que ep esen a una componen e del e ue zo y wn ealiza la
ponde ación de cada una de las unciones. Po lo an o, lo que se desea ob ene es el ec o
w∈RN. Pa a ello se debe op imiza la siguien e ecuación:
max
w
K
∑
k=1
Vπ∗
w(s0)−Vπk
w(s0).(2.33)
El p oceso de ob ención de wconsis e en obse a los episodios del agen e demos ado eje-
cu ando la polí ica óp ima. A pa i de esas obse aciones se ob iene una ap oximación de la
unción de alo pa a el es ado inicial. En onces se gene a y ejecu a una polí ica y se obse -
a su esul ado, a con inuación se modi ican los pesos wde mane a que es a nue a polí ica
ob enga una meno alo ación que la polí ica óp ima. I e ando en e el p oceso de gene ación
y alo ación de polí icas y el p oceso de modi icación del e ue zo se alcanza una unción R
que pe mi e ap ende una polí ica de alo simila a la óp ima.
Ob ención del e ue zo obse ando el compo amien o humano
Como paso p e io a la in es igación en la mejo a del ap endizaje po e ue zo p esen ada
en es a esis, hemos desa ollado un sis ema de ob ención au omá ica de e ue zo a pa i de la
obse ación del compo amien o humano [100, 103]. Median e cáma as si uadas en el en o no
se obse ó el mo imien o de las pe sonas y se es ablecie on cuáles e an las ayec o ias que la
gen e suele segui . Con es a in o mación se gene ó de o ma au omá ica una señal de e ue zo
que simplemen e disc imina cuándo el obo se es á mo iendo po las mismas á eas po donde
se mue e la gen e.
El sis ema que se implemen ó cons a de cua o e apas ( igu a 2.3): de ección de mo imien-
o, de ección y seguimien o de las pe sonas, posicionamien o en el en o no y segmen ación
2.6. Fo mulación del e ue zo 59
Figu a 2.3: E apas pa a la gene ación au omá ica de e ue zo: a) de ección de mo imien o; b) de ección
y seguimien o de las pe sonas; c) posicionamien o en el en o no; y d) segmen ación del en o no en
egiones de Vo onoi. Las egiones e des ep esen an zonas ansi ables, las neg as ep esen an las zonas
donde el obo ecibe e ue zo nega i o.
del en o no. Las e apas de de ección de mo imien o y seguimien o de pe sonas se pueden ea-
liza pa i de cualquie a de las nume osas écnicas exis en es [87], en nues o caso se u ilizó
la de ección de mo imien o po di e encia con una imagen de ondo. Pa a la de ección de
pe sonas se selecciona on aquellos agmen os de la imagen en mo imien o que se ajus aban
a las p opo ciones de una pe sona.
La ase de posicionamien o consis ió en calcula la ayec o ia de cada pe sona sob e un
mapa del en o no. Como la posición de cada cáma a en el en o no e a conocida se calib ó el
sis ema pa a de e mina la ans o mación p oyec i a que asocia cada pun o del suelo en la
imagen con la posición eal en el en o no [47]. Pa a calcula la ma iz de ans o mación sólo
es necesa io conoce la posición eal de cua o pun os que pe enezcan al plano del suelo y
asocia los con sus espec i as coo denadas en píxeles de la imagen cap u ada.
Después de un pe íodo de obse ación se ob u o un conjun o signi ica i o de ayec o ias
de las pe sonas du an e sus quehace es co idianos. La úl ima ase de nues o esquema consis-
ió en la aducción au omá ica de dicha in o mación en un e ue zo álido pa a se usado en
écnicas de ap endizaje po e ue zo. El obje i o es ca ego iza odas las posiciones (aunque
ealmen e debe ía ealiza se a ni el de “ ayec o ias”) ob enidas y de e mina cuáles son las
á eas del en o no más comúnmen e u ilizadas. Pa a es a clasi icación se han u ilizado edes
neu onales a i iciales del ipo LVQ [69, 68] con el obje i o de consegui una adecuada ge-
60 Capí ulo 2. Ap endizaje po e ue zo en obó ica
ne alización de los da os. La salida es una segmen ación del en o no en egiones de Vo onoi,
cada una de las cuales indica el e ue zo ob enido po el obo al posiciona se den o de ella.
Se ealiza on p uebas expe imen ales en el Depa amen o de Elec ónica e Compu ación
de la Uni e sidade de San iago de Compos ela. Con los da os ob enidos as la obse ación de
pe sonas du an e un pe íodo de 10 minu os se gene ó una señal de e ue zo que se u ilizó pa a
ealiza un ap endizaje en simulación. T as el ap endizaje se asladó la polí ica de con ol
ob enida a un obo eal, el cual log ó mo e se po el en o no de mane a sa is ac o ia.
Si bien es e abajo es una con ibución ne a de la esis, ep esen a un abajo inicial que
no u iliza los algo i mos que se desc ibi án en el es o de los capí ulos de es a esis. En los
ap endizajes mos ados en [100, 103] se u ilizó una es a egia de ap endizaje basada en la
combinación del ap endizaje po e ue zo y algo i mos gené icos.
2.7. Discusión
En es e capí ulo hemos p esen ado los undamen os del ap endizaje po e ue zo. Se ha
is o la impo ancia de las unciones de alo , las cuales pe mi en es ima el e ue zo u u o
que se ob end á as la ejecución de una acción o una polí ica en un es ado de e minado.
Se han p esen ado di e sos algo i mos an o clásicos como más no edosos, haciendo una
dis inción en e aquellos que cons uyen un modelo y los que se basan únicamen e en la
expe iencia. El obje i o de es a esis es desa olla un sis ema de ap endizaje ap o pa a su
aplicación en obo s, y en pa icula en el ámbi o de la obó ica de se icio, ya que c eemos
que es especialmen e in e esan e po el ipo de abajos que ealizan y los usua ios que los
manejan. Pa a ello se á necesa io esol e los siguien es p oblemas que hemos iden i icado en
el ap endizaje po e ue zo:
Len i ud
El mayo p oblema del ap endizaje po e ue zo es que puede se muy len o [20]. Se ne-
cesi an muchas i e aciones pa a ene unas alo aciones iables de cada uno de los es ados y
acciones posibles. El ap endizaje po e ue zo su e la llamada maldición de la dimensiona-
lidad: el iempo de ap endizaje c ece exponencialmen e con el núme o de es ados. Es o hace
que muchos algo i mos sean en la p ác ica imposibles de aplica a un obo eal. En un obo
eal cada i e ación iene un al o cos e de iempo y ene gía, po lo an o hay que consegui
algo i mos capaces de ap ende en un núme o educido de i e aciones (es deci , ejemplos o
2.7. Discusión 61
p uebas). Con el in de acele a el p oceso de ap endizaje se ha p opues o la combinación
del ap endizaje con e ue zo con di e en es écnicas como la p og amación gené ica [60] o
heu ís icas basadas en casos [28].
P oblemas de gene alización
Lo comen ado an e io men e nos lle a a uno de los p oblemas clásicos del ap endizaje
máquina, el dilema bias- a ianza. Es o es el cómo de bien se ajus a nues o sis ema al con-
jun o de ejemplos mien as es capaz de gene aliza y mos a un compo amien o co ec o
an e si uaciones di e en es de aquellas que ha is o p e iamen e. El bias ep esen a el ni el al
que el sis ema se ajus a al conjun o de en enamien o, un bajo bias signi ica que el sis ema se
ajus a muy bien a es os da os. La a ianza es la medida de cómo de sensible es el sis ema a
los da os con los que ue ob enido, ¿se hab ía ob enido el mismo con olado con un conjun o
de da os di e en e? Po lo gene al una baja a ianza implica una buena gene alización.
Si, como se dijo an e io men e, el obo debe ap ende de muy pocos ejemplos es p obable
que se ob enga un sis ema que se ajus e bien a esos pocos da os (bajo bias) pe o que no sea
capaz de gene aliza a nue as si uaciones (al a a ianza). Gene almen e hay un comp omiso
en e el bias y la a ianza: si se in en a disminui uno el o o aumen a á.
Es a egias mul ipa amé icas
En es a esis asumimos que dado que el obo debe ap ende , se come e án allos du an e
el p oceso de ap endizaje y puede que sea necesa io ealiza algún ajus e de los pa áme os
del algo i mo de ap endizaje. Es a es una a ea que un usua io no expe o en obó ica no
puede hace , ya que no iene po qué posee los conocimien os necesa ios pa a ajus a el
algo i mo a las ci cuns ancias pa icula es del en o no. Es po es a azón que los algo i mos
de ap endizaje clásicos son di íciles de usa pa a quien no iene una o mación adecuada.
Son algo i mos que dependen de múl iples pa áme os y donde la modi icación de sus alo es
no es algo i ial. Sin emba go, al y como ya se ha comen ado, en la obó ica de se icios se
necesi an algo i mos capaces de ap ende en un g an núme o de si uaciones o a eas di e en es
pe o aplicando el mínimo núme o de ajus es a sus pa áme os.
68 Capí ulo 3. Algo i mo I_Tb
Asumamos que enemos un obo mo iéndose po el en o no. Es e obo se es a á mo ien-
do siguiendo una polí ica π, que de e mina pa a cada posible es ado qué acción debe ejecu a
el obo :
π:S→A
s∈S→π(s)∈A,(3.2)
donde Ses el conjun o de es ados median e los cuales el obo ep esen a el en o no, y Aes
el conjun o ini o de odas las acciones posibles. Asumamos ambién que podemos conoce si
el obo es á ac uando de la mane a co ec a o no, es o es, exis e una unción de e ue zo que
penaliza al obo cuando mues a un compo amien o inco ec o ( e ue zo = -1), o se inhibe
( e ue zo = 0) en o o caso.
En es e con ex o, de inimos el alo de un es ado s∈S, con espec o a la polí ica πen
unción del iempo espe ado an es de que el obo haga algo mal ( eciba e ue zo nega i o),
empezando en el es ado sy siguiendo la polí ica πcomo:
Vπ(s) = En−e−T b π(s)/50To.(3.3)
Según la ecuación 3.3 el é mino −e−Tb /50Tes una unción con inua que oma alo es en el
in e alo [−1,0], y que a ía sua emen e a medida que el iempo es imado de allo aumen a
( igu a 3.1).
Po o a pa e, la unción Q, la unción de alo ación de los pa es es ado-acción, ep esen a
el iempo espe ado a allo si en el es ado sse ejecu a la acción ay a con inuación se sigue la
polí ica egoís a:
Q(s,a) = En−e−T b (s,a)/50To.(3.4)
Es impo an e eco da que la polí ica egoís a π∗selecciona la acción con el Q- alo má-
ximo pa a cada es ado:
π∗(s) = a g max
a{Q(s,a)}.(3.5)
Dado queVπ(s)yT b π(s)son desconocidos, hab á que u iliza sus es imaciones ac uales
Vπ
(s)yTb π
(s):
Tb π
(s) = −50 T Ln(−Vπ
(s)),(3.6)
o, en el caso de Q (s,a)yTb (s,a):
Tb (s,a) = −50 T Ln(−Q (s,a)),(3.7)

3.2. Algo i mo I_Tb 69
La de inición de Q(s,a),Tb (s,a)y la polí ica egoís a de e mina la elación en e los
Q- alo es de dos es ados consecu i os:
Tb (s ,a ) = (Tsi <0
T+max
a{Tb (s +1,a)}en o o caso,(3.8)
donde es el e ue zo que el obo ecibe cuando ejecu a la acción a en el es ado s .
Si combinamos las ecuaciones 3.7 y 3.8, se puede a i ma que:
Q +1(s,a) = (−e−1/50 si <0
Q (s ,a )+δen o o caso,(3.9)
donde,
δ=e−1
50 max
a{Q(s +1,a)}−Q(s ,a ).(3.10)
Siguiendo un azonamien o simila se puede ob ene la elación en e las alo aciones de
dos es ados consecu i os:
Vπ
(s) = −e−Tb (s)/50T
=−e−(T+Tb π
(s +1))/50T
=Vπ
(s +1)e−1/50 (3.11)
3.2. Algo i mo I_Tb
U ilizando las ecuaciones mos adas en la sección an e io se pueden eesc ibi los algo-
i mos clásicos de ap endizaje po e ue zo. De odas mane as, hemos decidido p opone un
nue o algo i mo de ap endizaje con el in de minimiza el núme o de pa áme os u ilizado po
el algo i mo.
Un p oceso i e a i o aplicando la ecuación 3.9 pe mi i á la ob ención de la unción de
alo de una polí ica de con ol π. Básicamen e el obo empieza con un conjun o inicial de
alo es nega i os alea o ios, Q(s,a)∈[−0,7,−0,675],∀s∈S,a∈A, y en onces se mo e á
in e ac uando con el en o no. En cada ins an e de iempo el obo obse a el es ado ac ual
del en o no s , y ejecu a la acción suge ida po la polí ica, π(s ). Du an e la explo ación, el
obo i á haciendo p edicciones de la ecompensa que ecibi á, de mane a que median e las
p edicciones y el e ue zo que ealmen e ecibe se ac ualiza á el alo de Q(s,a). La ecuación
3.9 desc ibe la e sión más simple de ap endizaje de la unción de alo , ya que únicamen e
70 Capí ulo 3. Algo i mo I_Tb
ac ualiza los alo es basándose en la ansición en e dos es ados consecu i os. Cuando los e-
ue zos nega i os son poco ecuen es, puede que se necesi en muchas p uebas de ap endizaje
pa a que esos alo es se p opaguen a los es ados an e io es. Debido a es o, lo que llamamos
TD-lea ning [123] in en a acele a el p oceso simplemen e añadiendo más memo ia al sis e-
ma. En nues o caso se hace eniendo en cuen a oda la ejecución de la polí ica π. Se ejecu a á
cada polí ica has a que el obo come a un allo o la ejecución alcance una du ación lími e,
as la cual se conside a que el algo i mo ha con e gido a una solución y el ap endizaje ina-
liza. Con es a in o mación conocemos con exac i ud cómo de bien esul ó cada acción en el
episodio ac ual y po lo an o podemos ac ualiza la unción de alo de acue do a lo ocu ido
en el expe imen o.
El algo i mo I_Tb cons a de dos e apas (algo i mo 3.1): una p ime a ase du an e la cual
el obo se mue e po el en o no has a que come e un allo; y una segunda e apa consis en e
en la ac ualización de los Q- alo es y que iene luga una ez ha inalizado el episodio. Dado
que en un ap endizaje se abaja con alo es es ocás icos y las unciones de alo ación se an
ap oximando poco a poco, a la ho a de ac ualiza los Q- alo es de los pa es es ado acción se
ha añadido un pa áme o β∈[0,1]que ac úa como coe icien e de ap endizaje, y es el único
pa áme o que debe se ajus ado po el usua io.
3.3. Dilema explo ación-explo ación
A la ho a de ejecu a un algo i mo de ap endizaje po e ue zo se debe alcanza un equi-
lib io en e la explo ación de nue as acciones y la explo ación de acciones conocidas. Pa a
ob ene un e ue zo al o, el obo debe ejecu a acciones que se p oba on en el pasado y que
p opo cionaban un e ue zo al o, pe o pa a encon a dichas acciones el obo debe explo a
acciones que no ejecu ó an e io men e. Si hay excesi a explo ación el algo i mo puede no
con e ge o demo a se demasiado. Po o o lado, si no se explo a lo su icien e y únicamen e
se explo an las acciones conocidas se di icul a la apa ición de nue as soluciones, lo que puede
hace que el algo i mo no con e ja o lo haga a una solución sub-óp ima.
Exis en di e en es es a egias pa a alcanza un equilib io en e explo ación y explo ación.
Una de las más popula es se conoce como ε−g eedy. Con es a es a egia se ejecu a á la
acción egoís a (g eedy) pe o hab á una pequeña p obabilidad εde ejecu a una acción ex-
plo a o ia escogida al aza de en e odas las posibles acciones. Po no ma gene al se escoge
ε≤0,1. El p oblema de es a es a egia es que en el caso de que se escoja una acción explo-
3.3. Dilema explo ación-explo ación 71
Algo i mo 3.1 Algo i mo de ap endizaje I_Tb
P ime a e apa: Recolec ando in o mación
m=0
epe i
Obse a el es ado ac ual, s :s[m] = s
Selecciona una acción a pa a s :a[m] = a
Ejecu a acción a , obse a el nue o es ado s +1y el alo de e ue zo , [m] =
Ob ene Tb es imado:u[m] = −50 T ln(−max
a{Q (s +1,a)})
si >=0en onces
m←m+1
in si
has a que <0om>=mmax
Segunda e apa: Ac ualiza los Q- alo es
pa a k=m−1,m−2,··· ,0hace
si k=m−1en onces
Tb =Tsi [m−1]<0
u[m−1]en o o caso
si no
Tb ←Tb +T
in si
∆Q (s[k],a[k]) = β−e−Tb /50T−Q (s[k],a[k])
in pa a
a o ia odas las acciones son equip obables, sin que se enga en cuen a que algunas acciones,
pese a no se la acción egoís a, pueden es a mucho mejo alo adas que o as.
La solución ob ia al p oblema mencionado an e io men e es a ia la p obabilidad de es-
coge una acción en unción de su alo ación ac ual. De es a mane a la acción egoís a segui á
eniendo la mayo p obabilidad de se escogida, pe o el es o de acciones se án o denadas
en unción de su calidad. En base a es a idea se p opuso el mé odo de selección de acciones
so max, el cual usa la dis ibución de Bol zmann pa a escoge las acciones:
P
(s,a) = eQ (s,a)/τ
∑|A|
b=1eQ (s,b)/τ,(3.12)
72 Capí ulo 3. Algo i mo I_Tb
donde τes un pa áme o posi i o llamado empe a u a. Al as empe a u as causan que las ac-
ciones sean p ác icamen e equip obables, lo que bene icia la explo ación. Bajas empe a u as
causan mayo es di e encias en las p obabilidades, a o eciendo la selección de acciones con
mayo es alo aciones. Cuando τ→0 se selecciona á siemp e la acción con mayo alo ación.
En muchas implemen aciones de so max inicialmen e el alo de τes al o y a disminuyen-
do a medida que pasa el iempo. El p oblema de es a es a egia es que el pa áme o τimplica
un lími e empo al a la explo ación, po lo que si cuando τ=0 aún no se ha alcanzado una
solución co ec a la al a de explo ación di icul a á el ap endizaje.
Un pa áme o de empe a u a común pa a odos los es ados p o oca á que si unos es ados
se isi an en nume osas ocasiones, aquellos es ados que se isi an de mane a menos ecuen e
no log en ap ende . Po el con a io, si se pe mi e que los es ados con pocas isi as explo en
en e apas a anzadas del ap endizaje, se p o oca que los es ados que debe ían es a ya ap en-
didos explo en de mane a innecesa ia, lo que causa á ines abilidades. Una solución a es e
p oblema es incula un pa áme o τa cada es ado. De es a mane a, alo es de empe a u a
independien es pe mi en un ni el de explo ación di e en e pa a cada es ado.
Con inuando nues os es ue zos po educi el núme o de pa áme os, en los expe imen os
que se desc iben en es e capí ulo hemos decidido aplica un mé odo simila al so max, pe o
donde se elimina el pa áme o de la empe a u a. G acias a la a iación exponencial de los a-
lo es de Q debido a la nue a unción obje i o ( igu a 3.1), es posibile elimina el pa áme o de
empe a u a y man ene la explo ación en aquellos es ados sin una solución conocida mien as
los es ados ya ap endidos son explo ados. La p obabilidad de elegi una acción depende á de
la ponde ación de su alo ación espec o a odas las demás acciones del mismo es ado:
P
(s,a) = eQ (s,a)
∑|A|
b=1eQ (s,b).(3.13)
3.4. Espacio de es ados
Uno de los aspec os cla e de un sis ema de ap endizaje po e ue zo es el espacio de es-
ados. Pa a que los algo i mos aquí empleados puedan con e ge se debe educi el in ini o
núme o de lec u as senso iales que ecibe el obo en un núme o ini o y manejable de es a-
dos, en endidos como si uaciones ele an es y dis inguibles unas de o as. Es impo an e que
el núme o de es ados sea lo su icien emen e pequeño como pa a que los algo i mos de ap en-
dizaje con e jan en un iempo acep able. Po o o lado, el espacio de es ados debe ene la
su icien e iqueza como pa a pe mi i dis ingui aquellas si uaciones donde el obo necesi a
3.4. Espacio de es ados 73
ejecu a acciones di e en es. En los esul ados que se mues an en es e capí ulo la c eación de
un espacio de es ados es una a ea ad hoc, su diseño se hace eniendo en cuen a los di e sos
ac o es que a ec an a la ejecución del obo : los senso es u ilizados po el obo , la a ea a
ejecu a y el en o no donde se lle a á a cabo.
Pa a ans o ma la señal de en ada a un conjun o ini o de si uaciones se u iliza on écni-
cas de cuan i icación ec o ial, en pa icula una ed de neu onas a i iciales ipo SOM (Mapa
Au o-O ganizable, ambién conocidas como edes de Kohonen [70, 68]). La c eación de las
edes SOM es un paso p e io al ap endizaje del obo . El conjun o de en enamien o p ocedía
de los da os cap u ados po un obo ejecu ando un compo amien o simila al buscado. Cada
neu ona de la ed SOM ep esen a cada uno de los posibles es ados en los que puede es a el
obo .
3.4.1. Reducción dinámica del núme o de es ados
El núme o de es ados u ilizados pa a ep esen a el en o no al ededo del obo in luye
di ec amen e en el iempo eque ido pa a encon a una polí ica óp ima. Po esa azón es
posible usa las p opiedades de las cadenas de Ma ko [14] pa a ajus a dinámicamen e el
núme o de es ados que in e ienen en el ap endizaje.
Al ans o ma las di e en es si uaciones que de ec a el obo median e sus senso es a un
conjun o ini o de es ados, S={s1,..,sN}, se puede c ea una ma iz de p obabilidades de
ansición Pde amaño N×N, donde cada componen e Pi j ep esen a la p obabilidad de que
el obo pase del es ado sial es ado sj:
Pi j =P {s =j|s −1=i}.
Po lo an o, si enemos alguna in o mación sob e el es ado en el que el obo es á en el
ins an e , podemos in en a p edeci el es ado en el que el obo es a á en +1:
−−→
χ +1= (χ +1(s0),χ +1(s1),...,χ +1(sN)) = −→
χ P,(3.14)
donde χ +1(si)es una dis ibución de p obabilidad que ep esen a la p obabilidad de que en
el ins an e +1 el obo es é en el es ado si,∀i=1,...,N.−→
χ ep esen a la dis ibución de
p obabilidad co espondien e al ins an e de iempo .
Si Pes la ma iz de ansición de un sis ema de Ma ko , y −−→
χ +kes un ec o de dis ibución
con la p opiedad de que −−−−→
χ +k+1=−−→
χ +1Pk=−−→
χ +k, en onces nos e e imos a −−→
χ +kcomo un
ec o es á ico. Es o signi ica que la p obabilidad de encon a al obo en el es ado ies la

74 Capí ulo 3. Algo i mo I_Tb
misma odo el iempo: aunque el obo pasa de un es ado a o o es ado, la dis ibución de
p obabilidad pe manece cons an e. Como el ec o es á ico −−→
χ +kno depende de , se elimina á
el su ijo y se deno a á únicamen e como −→
χ. Cuando la ma iz de ansición Psa is ace la
condición de que exis e alguna po encia de Pdonde odos sus elemen os son no nulos, es á
p obado que −→
χexis e y es único, es lo que llamamos el es ado es aciona io de Ma ko [53].
En nues o caso, du an e el p oceso de ap endizaje se es ima la ma iz de ansición pa a
pode calcula −→
χ. Una ez se hace es o, y ya que −→
χde ine cómo el obo e el en o no a la go
plazo, únicamen e aquellos es ados sjpa a los que la p obabilidad a la go plazo es no nula
(χ(sj)6=0)se conside an en el p oceso de ap endizaje.
La desc ipción de es a écnica se incluye aquí ya que es un mé odo que se p obó con éxi o
en el pasado [53] y es ú il pa a ep esen aciones ad hoc. Du an e las p uebas de es a esis no
se usa á es a écnica ya que, si bien su aplicación pe mi e educi el iempo de ap endizaje,
únicamen e es ú il si se aplica a una ep esen ación es á ica de es ados. Como e emos a
pa i del capí ulo 4 nues os algo i mos usa án una ep esen ación dinámica del espacio de
es ados. Po o a pa e, la educción dinámica del núme o de es ados equie e un modelo de
las ansiciones en e es ados, algo que que emos e i a .
Una u ilidad del es ado es aciona io de Ma ko a mayo es de la educción del núme o de
es ados es que pe mi e comp oba la es abilidad, en el sen ido clásico de Lyapuno , de los
algo i mos de ap endizaje [53]. Es o pe mi e conoce si un algo i mo es capaz de con e ge
a la misma solución independien emen e de las condiciones iniciales, en endiendo po condi-
ciones iniciales los Q- alo es inicializados alea o iamen e. Hay que acla a que pa a el caso
que nos ocupa, la solución a la que nos e e imos es la ayec o ia inal seguida po el obo , la
cual se puede ca ac e iza po los es ados po los que pasa el obo a lo la go de esa ayec o-
ia, lo que pe mi e asocia un es ado es aciona io a cada solución. Se ealizó un es udio de la
es abilidad de di e en es écnicas de ap endizaje median e el análisis del es ado es aciona io
de Ma ko . Pa a ello se cons uyó una ed bayesiana con la que se mide la p oximidad de las
soluciones, y que si e pa a clasi ica cada ap endizaje en base al algo i mo u ilizado. Po o o
lado se midió di ec amen e la dis ancia en e soluciones u ilizando la mé ica euclídea. Los
esul ados de es e es udio mues an que los es ados es aciona ios ob enidos as ap endizajes
con el mismo algo i mo se pa ecen más en e sí que a los log ados con di e en es algo i mos.
Es o quie e deci que cada uno de los algo i mos u ilizados en el es udio iende a con e ge a
la misma solución.
3.5. Aplicación expe imen al 75
3.5. Aplicación expe imen al
Vamos a aplica el algo i mo I_Tb pa a dos a eas en pa icula . La p ime a es segui
pa ed, donde el obo debe ci cula man eniendo cie a dis ancia con la pa ed si uada a su
de echa. Se ha escogido la a ea segui pa ed ya que es una a ea muy ep esen a i a y habi ual
en obó ica mó il. Es a a ea es la que usa emos como compa a i a a lo la go de oda es a
esis y con la que ya hemos abajado en el pasado [104, 106, 34, 95]. La segunda a ea
donde aplica emos el algo i mo I_Tb es la a ea c uza pue a. En es e caso el obo debe
c uza una pue a si uada a escasos me os en e a él. Al igual que con el compo amien o
de segui pa ed, la inalidad de es os ap endizajes no adica únicamen e en el ap endizaje de
un con olado ú il, sino que se i án como banco de p uebas pa a alida la e iciencia de los
algo i mos. Es po ello que es os dos compo amien os son u ilizados a lo la go de oda es a
esis.
Pa a pode compa a el algo i mo I_Tb con algo i mos clásicos se ealiza án nue os
ap endizajes en las mismas condiciones u ilizando los algo i mos Q-lea ning [135], Wa kins’s
Q(λ)[135] y Nai e Q(λ)[123]. Es os algo i mos se han p esen ado en la sección 2.3.3. Todas
las implemen aciones de los algo i mos mos ados en es as p uebas u ilizan la misma es a-
egia de selección de acciones (ecuación 3.13). Los pa áme os u ilizados son: coe icien e de
ap endizaje β=0,288282, y pa a los algo i mos Wa kins’s Q(λ)yNai e Q(λ)se usó γ=0,9
yλ=0,869965.
Todas las p uebas se han ealizado en un en o no simulado u ilizando el so wa e Pla-
ye /S age [43]. El ejecu a las p uebas en simulación pe mi e epe i los expe imen os bajo las
mismas condiciones y p omedia los esul ados. Al comienzo del ap endizaje el obo es co-
locado en una posición segu a, donde no ecibe e ue zo nega i o, y se mue e has a come e
un e o . Al conjun o de expe iencias acumuladas desde el posicionamien o del obo has a el
allo se le llama episodio. T as cada allo end á luga un p oceso de ac ualización de las a-
lo aciones de los pa es es ado-acción isi ados du an e el episodio y el obo se á ecolocado
au omá icamen e en una nue a posición sin e ue zo, ce cana y an e io al pun o en el que se
come ió el e o , desde donde comenza á un nue o episodio.
Cuando la polí ica de con ol es capaz de con ola al obo po un in e alo de 10 minu os,
se conside a que el algo i mo ha con e gido a una buena polí ica de con ol y se inaliza el
p oceso de ap endizaje. Si po el con a io, el algo i mo no es capaz de encon a una polí ica
de con ol álida en un iempo in e io a 4 ho as se conside a que no se pudo alcanza la
76 Capí ulo 3. Algo i mo I_Tb
(a) (b)
Figu a 3.2: En o nos de ap endizaje y ayec o ias seguidas po los obo s una ez que el compo amien o
segui pa ed ue ap endido.
con e gencia y el ap endizaje se da po inalizado. Con el in de ob ene da os iables sob e el
endimien o de los algo i mos cada p ueba se ha epe ido 15 eces.
El obo usado es un Pionee P3-DX equipado con un senso láse SICK LMS-200 y la
du ación del ciclo de con ol es de 300 ms. El senso láse p opo ciona medidas de dis an-
cia cada g ado en un a co de 180◦. De es a o ma se ob ienen 181 medidas que ep esen an la
dis ancia a los obs áculos ubicados en la di ección de a ance del obo . Du an e es os ap endi-
zajes el obo se mue e a una elocidad lineal cons an e de 0,15 m/s y el conjun o de acciones
disponibles se á un g upo de 19 elocidades angula es en el ango [−0,7,0,7] ad/s. Pa e de
las p uebas que se mues an aquí se co esponden con las publicadas en [93].
3.5.1. Segui pa ed
Pa a ap ende es a a ea el obo ecibe un e ue zo que penaliza aquellas si uaciones don-
de el obo es á demasiado ce ca o demasiado alejado de la pa ed que se sigue ( <0), en o o
caso =0. Los algo i mos de ap endizaje se aplica on pa a el ap endizaje de es a a ea en los
en o nos simulados mos ados en la igu a 3.2.
Pa a educi la dimensionalidad de los es ados se ag upa on los da os del láse en 8 haces
de 22,5o, donde la medida p opo cionada po cada uno se co esponde con el mínimo de las
3.5. Aplicación expe imen al 77
...
...
...
...
...
...
...
...
senso es
...
12 3 4 5 6 7 8
15
8
P ime a capa
...
...
...
...
...
...
...
...
...
10
22
Segunda capa
(x1, x2, x3, x4, ..., x8)
es ado
Figu a 3.3: Esquema de la es uc u a je á quica de edes SOM u ilizada pa a la ep esen ación de es ados
a pa i de las lec u as senso iales. Los senso es u ilizados son los haces láse desc i os en la ecuación
3.15.
medidas ag upadas en el mismo haz:
hazi=minlase i·22,··· ,lase (i+1)·22∀i∈[0,7].(3.15)
Pa a aslada el eno me núme o de si uaciones di e en es que los senso es pueden de ec-
a a un núme o manejable de es ados se u iliza una es uc u a je á quica de edes de Kohonen
[51]. Dicha es uc u a consis e en dos capas de edes SOM ( igu a 3.3). La p ime a capa con-
sis e en un conjun o de edes unidimensionales, cada una de las cuales p ocesa la in o mación
84 Capí ulo 3. Algo i mo I_Tb
que su e el sis ema p esen ado en es e capí ulo es la necesidad de dispone de una pe cepción
c eada a p io i especí icamen e pa a la a ea a ap ende . En el capí ulo siguien e se mos a á
cómo se soluciona es e p oblema median e la c eación dinámica del espacio de es ados.

CAPÍTULO 4
REPRESENTACIÓN DINÁMICA DEL
ENTORNO
Como se ha comen ado en el capí ulo 1, una ca ac e ís ica necesa ia de los obo s, si
que emos que ope en en en o nos eales, es la capacidad de adap a se a cambios en el en o no.
Pa a es a a ea es necesa io po un lado adap a el compo amien o, y po o o adap a la o ma
que el obo iene de pe cibi dicho en o no. En es e capí ulo se p esen a á una es a egia capaz
de de ec a e en os ele an es en el lujo de in o mación senso ial, y así adap a la o ma en
que el obo pe cibe el en o no.
Con el sis ema de pe cepción que se p esen a en es e capí ulo se á posible aplica el ap en-
dizaje a di e en es a eas, en o nos o senso es, sin ealiza ningún ajus e p e io del espacio de
es ados. Cada ez que el obo deba ap ende una a ea empeza á sin ningún conocimien o
sob e el espacio de es ados, y a medida que el obo aya explo ando el en o no se i án aña-
diendo nue os es ados pa a ep esen a las dis in as si uaciones que el obo encuen a du an e
su in e acción con el en o no.
Es a a ea se ha á median e la c eación dinámica de es ados u ilizando pa a ello una ed
de neu onas basada en la eo ía de la esonancia adap a i a, más conocida po sus siglas en
inglés ART [44]. En conc e o se usa á una ed Fuzzy ART [26].
Al igual que en el capí ulo an e io , que emos cuan i ica la in o mación p oceden e de
los senso es del obo , de mane a que se ob enga un conjun o ini o de di e en es es ados
adecuado pa a el ap endizaje. A di e encia de la es a egia mos ada en el capí ulo 3, la ed
Fuzzy ART no necesi a un diseño ad hoc p e io al en enamien o, sino que el p opio sis ema
86 Capí ulo 4. Rep esen ación dinámica del en o no
se á capaz de i c eando dinámicamen e el espacio de es ados a medida que explo a el en o no.
Es a ca ac e ís ica acili a eno memen e la aplicación del sis ema de ap endizaje a di e en es
en o nos, a eas y senso es.
Una ca ac e ís ica necesa ia en nues o sis ema es que el obo debe se capaz de iden i ica
si uaciones impo an es aún cuando és as ocu an de mane a muy poco ecuen e. La ed
Fuzzy ART pe mi e la c eación de es ados que ep esen en es as si uaciones sin que pasen
desape cibidas al habe o as si uaciones más comunes. Po ejemplo, en un compo amien o
de segui pa ed la si uación de es a pa alelo a la pa ed se á muy común. Po el con a io
un si uación donde se es á en e a una esquina se á muy in ecuen e en compa ación a la
an e io . Nues o sis ema debe se capaz de iden i ica ambas si uaciones y de e i a que la
al a ecuencia de apa ición de una si uación a ec e a la o a.
A con inuación se explica á el uncionamien o de las edes Fuzzy ART y su adap ación
pa a nues o sis ema. T as e el uncionamien o de la ed Fuzzy ART se in eg a á con el algo-
i mo de ap endizaje I_Tb p esen ado en el capí ulo an e io (aunque se ía posible aplica lo
a cualquie algo i mo de ap endizaje po e ue zo) pa a p opo ciona un espacio de es ados
adecuado pa a la a ea que es á siendo ap endida.
4.1. Teo ía de la esonancia adap a i a (ART)
Una de las ca ac e ís icas de la memo ia humana consis e en su habilidad pa a ap ende
nue os concep os sin necesidad de ol ida o os ap endidos en el pasado. Se ía deseable que
es a misma capacidad se pudie a consegui en las edes neu onales. Sin emba go, muchas de
es as edes ienden a ol ida in o maciones pasadas al a a de ap ende o as nue as.
Muchas de las edes de neu onas a i iciales, o incluso es imaciones es adís icas des ina-
das a la clasi icación de pa ones, se en enan de o ma supe isada. Es o es, se emplea un
conjun o de pa ones de ejemplo, de los cuales se conoce la salida deseada del sis ema, que
se án u ilizados du an e la ase de en enamien o. Una ez concluido el ap endizaje, y iendo
que la ed unciona co ec amen e, ya no se pe mi e ningún cambio adicional en és a. Es e p o-
cedimien o es ac ible si el p oblema que se p e ende esol e po la ed es á bien limi ado y
puede de ini se un adecuado conjun o de en enamien o. Sin emba go, en muchas si uaciones
eales los p oblemas no ienen unos lími es cla os.
Es o es lo que S. G ossbe g denomina como el dilema de la es abilidad y plas icidad en el
ap endizaje [45]. Es e dilema plan ea los siguien es in e ogan es:
4.1. Teo ía de la esonancia adap a i a (ART) 87
– Cómo una ed pod ía ap ende nue os pa ones (plas icidad del ap endizaje).
– Cómo una ed pod ía e ene los pa ones p e iamen e ap endidos (es abilidad del ap en-
dizaje).
En espues a a es e dilema, G ossbe g, Ca pen e y o os colabo ado es desa olla on la
denominada eo ía de la esonancia adap a i a (Adap a i e Resonance Theo y: ART) [23].
Lo que se p e ende es ca ego iza dinámicamen e los da os que se in oducen en la ed. Las
in o maciones simila es son clasi icadas o mando pa e de la misma ca ego ía, y po an o
deben ac i a la misma neu ona de salida, la neu ona encedo a. Las clases o ca ego ías deben
se c eadas po la p opia ed, pues o que se a a de un ap endizaje no supe isado.
Pa a soluciona el p oblema de la plas icidad y es abilidad, el modelo ART p opone añadi
a las edes un mecanismo de ealimen ación en e las neu onas compe i i as de la capa de sali-
da de la ed y la capa de en ada. Es e mecanismo acili a el ap endizaje de nue a in o mación
sin des ui la ya almacenada.
La eo ía de la esonancia adap a i a se basa en la idea de hace esona la in o mación
de en ada con los ep esen an es o p o o ipos de las ca ego ías que econoce la ed. Si en a
en esonancia con alguno, es su icien emen e simila , la ed conside a que pe enece a di-
cha ca ego ía y únicamen e ealiza una pequeña adap ación del p o o ipo almacenado como
ep esen an e de la ca ego ía pa a que inco po e algunas ca ac e ís icas del da o p esen ado.
Cuando no esuena con ninguno de los pa ones almacenados po la ed, la ed se enca ga de
c ea una nue a ca ego ía con el da o de en ada como p o o ipo de la misma.
Como esul ado de es e en oque, los au o es mencionados p esen a on a ias edes neu-
onales especialmen e adecuadas pa a a eas de clasi icación de pa ones. És as son ART-1 (o
ART) [23], ART-2 [22], ART-3 [24], Fuzzy ART [26] y ARTMAP [25]. La ed ART-1 aba-
ja con ec o es de en ada bina ios; ART-2 es capaz de p ocesa in o maciones con inuas o
analógicas; ART-3 es una e olución de ART-2 con un mayo pa ecido en su uncionamien o
a las neu onas na u ales, puede ejecu a búsquedas pa alelas de pa ones dis ibuidos en una
je a quía de ed mul ini el; Fuzzy ART es una mejo a de ART-1 combinándola con la eo ía
de conjun os di usos, es a ed es capaz de clasi ica an o ec o es de en ada bina ios como
analógicos; po úl imo ARTMAP combina dos unidades ART-1 o ART-2 lige amen e modi i-
cadas en una es uc u a de ap endizaje supe isado, la p ime a unidad oma la in o mación de
en ada y la segunda unidad oma la salida deseada, que se á u ilizada pa a ealiza el mínimo
ajus e posible de los pa áme os de la p ime a ed.
88 Capí ulo 4. Rep esen ación dinámica del en o no
Capa F2
Capa F1
wji Wij
a
I
Nodo de
ese
ρ
Subsis ema de
a ención
Subsis ema de
o ien ación
Figu a 4.1: Vis a esquemá ica de una ed Fuzzy ART. La en ada I se in oduce en la ed y a con inuación
se ealiza un p oceso compe i i o (Wi j). Se comp ueba la esonancia de la neu ona ganado a (wji) y en
caso de no supe a la se pone dicha neu ona a ese .
La na u aleza de nues o p oblema hace que no sea posible el u iliza un sis ema de clasi-
icación supe isada. Cuando el obo se es é mo iendo po el en o no no se á posible sabe
si una pe cepción conc e a debe pe enece o no al es ado al que ha sido asignada. Po es a
azón pa a nues o sis ema se ha elegido u iliza una ed Fuzzy ART.
4.1.1. Fuzzy ART
La ed Fuzzy ART es capaz de ealiza un ap endizaje ápido y es able de es ados (gene-
almen e llamados ca ego ías) en espues a a secuencias a bi a ias de en adas analógicas o
bina ias. Aquí ap o echa emos es a ca ac e ís ica pa a ealiza el ap endizaje dinámico del
espacio de es ados.
En la igu a 4.1 se mues a una is a esquemá ica de una ed Fuzzy ART. Dicha ed se
compone de dos subsis emas: el subsis ema de a ención se enca ga de la memo ización de
las ca ego ías. Es e subsis ema con iene las capas F1 y F2, las conexiones en e las capas
ep esen an los p ocesos de ac i ación y esonancia de neu onas. El subsis ema de o ien ación
4.1. Teo ía de la esonancia adap a i a (ART) 89
x2
x1
Ia
Ib
wj
Figu a 4.2: Rep esen ación del uncionamien o de una ed ART.La en ada Iase asigna a la ca ego ía
wjdado que es á den o del adio de igilancia ρ. La en ada Ibno en a en esonancia con ninguna
ca ego ía, po lo que se c ea á una nue a ca ego ía pa a ep esen a dicha en ada.
se enca ga de inhibi las neu onas de la capa F2 que no han en ado en esonancia con la
en ada I pa a pe mi i con inua la búsqueda de ca ego ías. A con inuación se mues a en
de alle el uncionamien o de la ed Fuzzy ART ( igu a 4.2):
Vec o de en ada: cada en ada Ide una ed Fuzzy ART, capa F1, se á un ec o M-
dimensional (I1,...,IM), donde cada componen e Iipe enece al in e alo [0, 1].
Vec o es p o o ipo: cada neu ona jde la capa F2 se co esponde á con un ec o p o o ipo
de pesos adap a i os wj≡(wj1,...,wjM), el núme o de ca ego ías po enciales es a bi a io.
Pa áme os: la dinámica de una ed Fuzzy ART es á de e minada po un pa áme o de
elección α>0; un coe icien e de ap endizaje β∈[0,1]; y un pa áme o de igilancia ρ∈
[0,1].
P oceso compe i i o de elección de ca ego ía: as la p esen ación de un pa ón de en-
ada Ise p oduce un p oceso compe i i o en e las neu onas (es ados) de la capa F2, as el
cual los es ados se o dena án en unción de su alo de ac i ación. Pa a cada en ada Iy un

90 Capí ulo 4. Rep esen ación dinámica del en o no
es ado j, la unción de ac i ación Tjse de ine como:
Tj(I) = |I∧wj|
α+|wj|.(4.1)
Las o mas más comunes de de ini el ope ado di uso AND (∧)son a a és de la unción
mínimo o el p oduc o. En nues o caso elegi emos el mínimo:
(x∧y)i≡min(xi,yi),(4.2)
y donde la no ma |·|se de ine como
|x| ≡
M
∑
i=1
|xi|.(4.3)
El pa áme o αhace que, en el caso de que dos neu onas de la capa F2 se exci en po igual,
ienda a ac i a se la neu ona más nue a. Es o se debe a que pa a un mismo alo de α, se
a o ece la elección de aquellas neu onas con mayo no ma; y gene almen e los p o o ipos
a o ecidos son los úl imos in oducidos en la ed, ya que, debido a la unción de ac ualización
usada que se e á más adelan e, la no ma de un p o o ipo únicamen e pod á disminui con el
iempo.
Po simplicidad en la no ación, Tj(I)en la ecuación 4.1 se esc ibe como Tjcuando la
en ada Ies ija. Pa a elegi una ca ego ía és as se indexan po J, donde
J=a g max
j{Tj:j=1...N}.(4.4)
Si hay a ias ca ego ías que compa en el alo máximo Tjse escoge aquella con meno índice
j.
Resonancia o ese : as el p oceso compe i i o an e io , se comp ueba pa a la ca ego ía
ganado a jsi la ed en a en esonancia. Se p oduce esonancia si la unción de semejanza
supe a al pa áme o de igilancia ρ; es o es, si
|I∧wj|
|I|≥ρ.(4.5)
En caso de que dicha elación no se cumpla ocu i á un ese . En onces, en a en uncio-
namien o el nodo de ese y el alo de la unción de elección Tjse asigna a -1 pa a que dicha
ca ego ía no uel a a se seleccionada du an e la búsqueda pa a el pa ón de en ada ac ual.
4.1. Teo ía de la esonancia adap a i a (ART) 91
Un nue o índice Jse escoge siguiendo la ecuación 4.4 y el p oceso con inúa has a que un ele-
men o sa is aga la ecuación 4.5 o no se encuen e ninguna ca ego ía que en e en esonancia
con la en ada.
Ap endizaje: cuando la ed en a en esonancia an e una en ada, el ec o p o o ipo wj
que ep esen a el es ado se ac ualiza a pa i de la siguien e ecuación:
w(new)
j=β(I∧w(old)
j)+(1−β)w(old)
j.(4.6)
El ap endizaje ápido se co esponde con β=1.
C eación de nue as ca ego ías: en el caso de que ninguna de las ca ego ías ac uales
p o oque que la ed en e en esonancia se debe á c ea una nue a ca ego ía que ep esen e al
ec o de en ada. Es a nue a ca ego ía se á inicialmen e igual al ec o de en ada:
w(new)
j=I.(4.7)
No malización de las en adas: pa a e i a la p oli e ación de ca ego ías las en adas
pueden se no malizadas, es o es, pa a algún γ>0, |I| ≡ γ, pa a odas las en adas I.
Una egla de no malización, llamada codi icación complemen a ia o complemen coding,
no maliza las en adas a la ez que man iene la in o mación de ampli ud. El complemen a io
de un ec o de en ada a, ep esen ado como ac, es
ac
i≡1−ai.(4.8)
La codi icación complemen a ia de una en ada Ies un ec o 2M-dimensional
I= (a,ac)≡(a1,...,aM,ac
1,...,ac
M).(4.9)
En es e caso
|I|=|(a,ac)|=M.(4.10)
De odos los pa áme os, el más impo an e es la igilancia, ρ. Dicho pa áme o de e mina
la g anula idad de la clasi icación. Valo es bajos de ρp oduci án clasi icaciones con menos
es ados que alo es al os de ρ. A medida que ρse ap oxima a 1, hab á p ác icamen e un
es ado po cada ec o de en ada.
4.1.2. Adap ación de Fuzzy ART pa a el ap endizaje en el obo eal
Tal y como se señala en el a ículo donde se p esen a la ed Fuzzy ART [26], la egla
de ap endizaje de la ed Fuzzy ART – ecuación 4.6– puede se modi icada pa a adap a la a
92 Capí ulo 4. Rep esen ación dinámica del en o no
las necesidades especí icas de cada p oblema. En nues o caso la unción de ap endizaje que
u ilizamos es de la o ma:
w(new)
j=βI+(1−β)w(old)
j.(4.11)
Es a unción de ap endizaje es u ilizada po Moo e en [80]. En dicho abajo se indica que el
ap endizaje puede se ines able debido a que los p o o ipos no siemp e dec ecen. An e es o
Ca pen e y colabo ado es a i man que el uso de la codi icación complemen a ia con es a
unción de ac ualización e i a la p oli e ación de ca ego ías.
El uso de es a unción de ac ualización nos p opo ciona cla as en ajas a la ho a de im-
plemen a el algo i mo Fuzzy ART pa a su uso en el ap endizaje en iempo eal. Al abaja
con codi icación complemen a ia y al u iliza la ecuación 4.11 pa a ac ualiza los p o o ipos
se cumpli á que: |I|=|wj|=M. Es o implica que, si se elimina el pa áme o αde la unción
de ac i ación (ecuación 4.1) és a sea igual a la unción de semejanza (ecuación 4.5). Es o nos
p opo ciona una g an mejo a en el cos o compu acional: si la ca ego ía ganado a del p oceso
compe i i o, aquella con mayo Tj, no en a en esonancia, ninguna o a ca ego ía pod á ha-
ce lo, po lo que se e i an los ciclos de búsqueda de esonancia habi uales en las edes Fuzzy
ART.
4.2. Ap endizaje simul áneo de pe cepción y acción
Es a sección p esen a la in eg ación del algo i mo de ap endizaje po e ue zo con la ed
Fuzzy ART, es o pe mi i á a los obo s ap ende simul áneamen e cómo pe cibi y cómo ac ua
a pa i de su in e acción con el en o no ( igu a 4.3). El sis ema que p oponemos cons a de dos
módulos: uno de ellos esponsable de la pe cepción y el o o de la acción. El obo cons uye
una ep esen ación del en o no median e una ed Fuzzy ART que a c eciendo dinámicamen e
pa a inclui nue as si uaciones que no han sido is as an es (ap endizaje de pe cepción en
la igu a 4.3). Es as nue as si uaciones se án los es ados del sis ema. Po o o lado, la ep e-
sen ación dinámica del en o no se combina con una es a egia de ap endizaje (ap endizaje de
acción en la igu a 4.3) capaz de adap a el compo amien o del obo en aquellas si uaciones
ele an es (es ados) que son iden i icadas po el módulo de pe cepción.
An e io men e se in en ó log a es e mismo obje i o [49], sin emba go el sis ema, aunque
p ome edo , necesi aba demasiados pa áme os y p esen aba ap endizajes len os. Con el algo-
i mo I_Tb aho a podemos p opone una nue a al e na i a donde el núme o de pa áme os
se educe al mínimo y se consiguen ap endizaje ápidos.
4.2. Ap endizaje simul áneo de pe cepción y acción 93
Ap endizaje de
pe cepción
Ap endizaje de
acción
es ado
acción
En o no
pe cepción
e ue zo
SOM
ART
LVQ
Q-lea ning
Nai e Q(λ)
I_Tb
{
{
Figu a 4.3: Esquema gene al de nues a p opues a pa a el ap endizaje simul áneo de pe cepción y acción.
Median e la combinación de la ed Fuzzy ART, con la egla de ap endizaje modi icada, y
el algo i mo de ap endizaje I_Tb se puede log a el ap endizaje simul áneo de pe cepción y
acción. La pa ición del espacio senso ial en egiones depende únicamen e de las pe cepcio-
nes ecibidas y no de la e olución del p oceso de ap endizaje. Deseamos incula el amaño
de las egiones al p oceso de ap endizaje, de mane a que se adap en au omá icamen e a las
necesidades del ap endizaje. De es a mane a se e i a la necesidad de ajus a el pa áme o de
igilancia.
A con inuación se p esen an dos al e na i as al ajus e del pa áme o de igilancia, es as
al e na i as pe mi en el ap endizaje de di e en es a eas sin la necesidad de ajus a p e ia-
men e un alo de igilancia adecuado pa a ellas. La p ime a p opues a ajus a el pa áme o
de igilancia en unción del ap endizaje. Es e pa áme o se á independien e pa a cada es ado,
po lo que pod á habe una di isión más pequeña allí donde se necesi e. La segunda p opues-
a consis e en añadi c i e ios adicionales pa a inse a un nue o es ado. En es e caso odos
los es ados compa i án el mismo alo de igilancia, in encionadamen e bajo, y se inse a án
nue os es ados donde se equie a una ep esen ación más densa.
4.2.1. Red Fuzzy ART de igilancia a iable
La p ime a p opues a pa a esol e el p oblema del ajus e del pa áme o de igilancia, ρ,
es una modi icación de la ed Fuzzy ART, la llamamos Red Fuzzy ART de igilancia a iable
(Fuzzy ART VV) [102]. En es e caso no hab á un pa áme o de igilancia común pa a odos
los es ados, sino que cada es ado con a á con su p opio pa áme o que pod á se modi icado
en unción del p og eso del ap endizaje. Tene di e en es alo es de igilancia pe mi i á a la
100 Capí ulo 4. Rep esen ación dinámica del en o no
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
Eligibili y aces
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
I_Tb
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
Wa kins Q(λ)
I_Tb
Vigilancia
Tiempo medio de ap endizaje
Nai e Q(λ)
,,, , , , , ,
(a)
0
20
40
60
80
100
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age numbe o s a es c ea ed
Vigilance
Eligibili y aces
0
20
40
60
80
100
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age numbe o s a es c ea ed
Vigilance
I_Tb
Wa kins Q(λ)
I_Tb
Vigilancia
Núme o medio de es ados c eados
Nai e Q(λ)
, , , , , , , ,
(b)
Figu a 4.6: Resul ados de los ap endizajes pa a la a ea segui pa ed combinando Fuzzy ART yI_T b
oNai e Q(λ)pa a dis in os alo es de igilancia. No se u iliza codi icación complemen a ia: a) iempo
medio de ap endizaje y des iación es ánda , y b) núme o medio de es ados c eados.

4.3. Aplicación expe imen al 101
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
Eligibili y aces
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
I_Tb
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
00:00:00
00:30:00
01:00:00
01:30:00
02:00:00
02:30:00
03:00:00
03:30:00
04:00:00
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age lea ning ime
Vigilance
Wa kins Q(λ)
I_Tb
Vigilancia
Tiempo medio de ap endizaje
Nai e Q(λ)
,,, , , , , ,
(a)
10
100
1000
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age numbe o s a es c ea ed
Vigilance
Eligibili y aces
10
100
1000
0.84 0.86 0.88 0.9 0.92 0.94 0.96 0.98
A e age numbe o s a es c ea ed
Vigilance
I_Tb
Wa kins Q(λ)
I_Tb
Núme o medio de es ados c eados
Vigilancia
Nai e Q(λ)
,, , , , , , ,
(b)
Figu a 4.7: Resul ados de los ap endizajes pa a la a ea segui pa ed combinando Fuzzy ART yI_T b o
Nai e Q(λ)pa a dis in os alo es de igilancia. Las en adas u ilizan codi icación complemen a ia: a)
iempo medio de ap endizaje y des iación es ánda , y b) núme o medio de es ados c eados.
102 Capí ulo 4. Rep esen ación dinámica del en o no
(a)
(b)
Figu a 4.8: T ayec o ias del obo mien as ejecu a la a ea segui pa ed en el en o no eal. Mapas ge-
ne ados a pa i de los da os de odome ía y del senso láse du an e la ejecución del compo amien o.
Las es ellas ma can las posiciones iniciales. Los cí culos ma can las posiciones donde el obo come ió
un e o . Los píxeles blancos ep esen an espacio lib e, los neg os espacio ocupado y los g ises espacio
desconocido.
senso láse . En la igu a 4.8(b) el e o ue debido a que la en ada no esonó y el es ado
asignado no ejecu aba la acción co ec a en esa si uación.
4.3.2. C uza pue a
Siguiendo el esquema de las p uebas mos ado en la igu a 4.5, as e alua el endimien o
de la ed Fuzzy ART y selecciona el mejo alo pa a el pa áme o de igilancia (ρ=0,9125),
4.3. Aplicación expe imen al 103
se ha examinado el compo amien o del sis ema en un nue o en o no y con una a ea di e en e.
Pa a es a a ea ambién se ha p obado la espues a de la ed Fuzzy ART an e en adas de mayo
amaño ( igu a 4.5). Al igual que en la sección an e io , se han ealizado 15 ap endizajes con
cada con igu ación del sis ema, incluyendo p uebas pa a medi el endimien o del uso o no de
la codi icación complemen a ia. En la sección an e io se io cómo el uso de la codi icación
complemen a ia mejo aba el endimien o, pa a las p uebas que se mos a án a con inuación
se decidió man ene las dos codi icaciones dado que en alguno de los expe imen os se inc e-
men ó el amaño del ec o de en ada y desconocemos cómo eacciona á la ed Fuzzy ART
an e ec o es de al a dimensionalidad.
Al cambia de a ea, y g acias a u iliza la ed Fuzzy ART pa a la c eación dinámica del
espacio de es ados, únicamen e es necesa io cambia la de inición de la unción de e ue zo
y ajus a los pa áme os del algo i mo de ap endizaje (en el caso de I_Tb no es necesa io el
ajus e de ningún pa áme o). Si se quisie a usa una ed p ede inida, al y como se hizo en el
capí ulo 3 con edes SOM, se ía necesa io en ena una nue a ed pa a el en o no y la a ea.
Es en es e caso donde se e la mayo en aja de usa una ed dinámica pa a la c eación del
espacio de es ados.
Elegimos p oba el sis ema u ilizando los alo es de igilancia que mejo es esul ados
nos die on pa a el compo amien o segui pa ed. La abla 4.1 mues a los esul ados de los
expe imen os usando Nai e Q(λ)con las di e en es con igu aciones de la ed Fuzzy ART y
del ec o de en ada. La abla 4.2 mues a los esul ados pa a las mismas p uebas si se usa
I_Tb . En la sección 3.5.2 ya se comen ó el hecho de que si se ag upa la in o mación del láse
en haces demasiado g andes, en es e caso 22,5o, es imposible dis ingui la pue a desde cie as
posiciones y dis ancias ( e igu a 3.7). Pa a soluciona es e p oblema op amos po ealiza
p uebas u ilizando odas las componen es del láse (181) como en ada senso ial, po lo que
se dispond á de su icien e p ecisión pa a de ec a la pue a (somb eado ojo en la igu a 3.7).
Como se puede e en las ablas 4.1 y 4.2, el mapeo de senso es a es ados escala de mane a
co ec a cuando se aumen an las dimensiones del ec o de en ada de 8 a 181. El núme o
de es ados c eados se man iene en unos alo es acep ables y los iempos de ap endizaje se
educen al usa los da os indi iduales p opo cionados po el senso láse .
Combinando la ed Fuzzy ART con los algo i mos de ap endizaje se mejo a el iempo de
ap endizaje espec o a si se usa la ed SOM u ilizada en el capí ulo 3. Nai e Q(λ)mejo a
con Fuzzy ART su mejo iempo de ap endizaje un 58% del iempo empleado con SOM, de
01:36:53 ho as a 39:56 minu os. El iempo de ap endizaje de I_Tb se educe, pe o dado que
104 Capí ulo 4. Rep esen ación dinámica del en o no
Tabla 4.1: Resul ados del ap endizaje del compo amien o c uza pue a con Nai e Q(λ)yFuzzy ART.
Se ealiza on p uebas con dos o mas di e en es de p ocesa el láse y aplicando o no codi icación
complemen a ia.
Tiempo medio Des iación Núme o medio
Vigilancia Láse CC de ap endizaje es ánda de es ados
0,9125
8No NA NA 63,22
Sí 01:37:12 01:00:55 94,87
181 No 01:57:48 01:05:31 134,33
Sí 00:39:56 00:23:20 82,87
0,925
8No 02:51:36 00:48:41 78,77
Sí 01:41:19 00:38:23 146,30
181 No 02:26:24 01:12:13 172,27
Sí 00:56:18 00:39:50 123,33
Tabla 4.2: Resul ados del ap endizaje del compo amien o c uza pue a con I_Tb yFuzzy ART.
Tiempo medio Des iación Núme o medio
Vigilancia Láse CC de ap endizaje es ánda de es ados
0,9125
8No 02:43:00 01:13:19 71,47
Sí 01:34:37 01:03:26 99,13
181 No 01:23:56 01:02:58 149,47
Sí 00:34:11 00:14:38 88,40
0,925
8No 02:54:28 01:11:49 73,73
Sí 01:12:35 00:42:17 129,87
181 No 01:29:59 01:00:16 187,40
Sí 00:40:26 00:22:32 135,13
ya e a un iempo más co o la mejo a no es an signi ica i a - se educe un 39% del iempo de
e e encia con SOM, pasando de 46:33 minu os a 34:11 minu os.
Tal y como ocu ió con la a ea segui pa ed, el uso de codi icación complemen a ia mejo a
los iempos de ap endizaje y pe mi e la con e gencia con un ango más amplio de alo es de
igilancia.
Al igual que con el compo amien o segui pa ed, una ez ap endidas las polí icas de con-
ol en simulación u ilizando el algo i mo I_Tb se ealiza on p uebas en un en o no eal pa a
e alua el endimien o de dichas polí icas. La igu a 4.9 mues a algunas de las ayec o ias del
obo mien as ejecu a la a ea c uza pue a. Es as ayec o ias ue on cap u adas median e
un senso láse ex e no. La imagen con iene algunos e o es en la es imación de la o ien ación
del obo debido a e o es de lec u a y p ocesamien o de los da os de dicho láse ex e no.
4.3. Aplicación expe imen al 105
Figu a 4.9: T ayec o ias gene adas po el obo du an e la ejecución del compo amien o c uza pue a.
Es a imagen se gene ó u ilizando un láse ex e no pa a segui la localización del obo .
4.3.3. Modi icación del espacio de es ados inculado al ap endizaje
En es a sección se mues an los esul ados expe imen ales del ap endizaje de los compo -
amien os segui pa ed y c uza pue a u ilizando las es a egias de modi icación del espacio
de es ados en unción del ap endizaje. En p ime luga e emos los esul ados con la ed Fuzzy
ART de igilancia a iable. A con inuación se mues an los esul ados ob enidos u ilizando
la inse ción dinámica de neu onas. En ambos casos se u ilizó el mismo obo Pionee P3-DX
u ilizado en an e io es expe imen os. El alo de M, u ilizado pa a conside a a un es ado
ce cano al e o se ijó en 20 ciclos. Dicho alo depende de la ecuencia de con ol y la
elocidad del obo , en nues o caso, con un ciclo de con ol cada 300 ms el alo M=20
equi ale a 6 segundos.
Red Fuzzy ART de igilancia a iable
Aquí se p esen an los esul ados ob enidos en los expe imen os lle ados a cabo con la
ed Fuzzy ART de igilancia a iable. Pa a es os expe imen os el senso láse se con igu ó de
mane a que se ag upa on las lec u as en 8 haces de 22,5◦. Como decíamos an e io men e, se
han ealizado expe imen os con el compo amien o segui pa ed y el compo amien o c uza
pue a. Se ha conside ado que se debía inc emen a la igilancia de un es ado cuando el 75%
de sus acciones e an e óneas. La igilancia se aumen ó en inc emen os de 0,0125, empezando
el p ime es ado con ρ=0.

106 Capí ulo 4. Rep esen ación dinámica del en o no
Pa a el compo amien o segui pa ed se ob u o un iempo medio de ap endizaje de 20:45
minu os, con una des iación de 16:09 minu os y c eándose una media de 21 es ados. Es os
esul ados son muy simila es a los ob enidos con una ed Fuzzy ART sin modi icaciones ( abla
4.3).
En el compo amien o c uza pue a el iempo medio de ap endizaje ue de 47:02 minu os,
con una des iación de 40:32 minu os. Se c ea on una media de 45 es ados po ap endizaje. En
es e compo amien o se obse a una g an des iación en los iempos de ap endizaje, dándose
ap endizajes que lle a on unos pocos minu os mien as que o os ap endizajes se demo a on
más de una ho a. Al igual que ocu ió an e io men e, es os iempos an al os se deben al uso
del láse en haces de 22,5◦, los cuales impiden de ec a la pue a en cie as si uaciones.
Un p oblema de es a ap oximación es que al p incipio de cada ap endizaje se pie de g an
can idad de iempo has a que se inc emen a la igilancia a alo es ce canos al necesa io pa a
el ap endizaje. El uso de un alo inicial de ρmás al o acele a ía el p oceso de ap endizaje.
Inse ción dinámica de neu onas
Reco demos que en la es a egia de inse ción dinámica de neu onas no es necesa io ajus a
el pa áme o de igilancia ρ, únicamen e debe se un alo in e io al óp imo pa a la a ea
que se a a ap ende . Pa a es as p uebas se escogió un alo de igilancia de 0,85, bas an e
po debajo del alo óp imo pa a ap ende es as a eas. Nues o sis ema puede unciona con
cualquie ango de alo es en e 0 y el alo de igilancia óp imo. A medida que la igilancia
disminuye un mayo po cen aje de es ados se án c eados po inse ción dinámica. Uno de
los c i e ios de inse ción es el allo de un es ado con un Tb al o. En es os expe imen os
conside amos al o odo alo de T b mayo de 40 ciclos de con ol.
Pa a es as p uebas se con igu ó el obo pa a usa las 181 componen es del láse y las 16
del anillo de ul asonidos, po lo que no se le in oduce ningún sesgo a la capacidad pe cep ual
del sis ema.
En el compo amien o segui pa ed el iempo medio de ap endizaje ue de 09:41 minu os
con una des iación de 06:19 minu os. Mucho mejo que cualquie iempo conseguido an e-
io men e con una ep esen ación de es ados es á ica o dinámica. El núme o medio de es ados
c eados ue de 13,1 es ados, con una des iación de 5,5 es ados.
Las p uebas con el compo amien o c uza pue a p opo ciona on un iempo medio de
ap endizaje de 16:16 minu os y una des iación de 09:41 minu os. Se c ea on una media de
28,6 es ados, con una des iación de 8,5 es ados.
4.4. Discusión 107
Tabla 4.3: Mejo es iempos de ap endizaje ob enidos con cada combinación de módulos de ap endizaje
de acción y de ap endizaje de pe cepción. Tiempo medido en ho as:minu os:segundos.
Rep esen ación Tiempo medio Des iación
Ta ea Algo i mo de es ados de ap endizaje es ánda
Segui Nai e Q(λ)Es á ica 00:17:21 00:08:21
Fuzzy ART 00:14:50 00:09:27
pa ed I_Tb
Es á ica 00:16:39 00:08:14
Fuzzy ART 00:22:18 00:14:10
Fuzzy ART VV 00:20:45 00:16:09
Inse ción dinámica 00:09:41 00:06:19
C uza Nai e Q(λ)Es á ica 01:36:53 00:57:55
Fuzzy ART 00:39:56 00:23:20
pue a I_Tb
Es á ica 00:46:33 00:36:14
Fuzzy ART 00:34:11 00:14:38
Fuzzy ART VV 00:47:02 00:40:32
Inse ción dinámica 00:16:16 00:09:41
Con es os esul ados se puede a i ma o undamen e que el u iliza el algo i mo de inse -
ción dinámica de neu onas inculada al ap endizaje, no solamen e e i a el ajus a un alo
de igilancia, sino que p opo ciona unos iempos de ap endizaje mucho mejo es que o as
al e na i as es udiadas has a el momen o.
4.4. Discusión
En la abla 4.3 se pueden e los mejo es iempos de ap endizaje ob enidos pa a cada a ea
con di e en es con igu aciones. Los esul ados ob enidos al u iliza una ep esen ación de es-
ados dinámica son compa ables o mejo es a los de usa un espacio de es ados es á ico. Es o,
añadido al no emplea iempo en la c eación de un espacio de es ados ad hoc, pe mi e a i ma
que el uso de la ed Fuzzy ART es una mejo a signi ica i a pa a el sis ema de ap endizaje. En
lo e e en e al endimien o de los algo i mos, al compa a los bajo las mismas condiciones se
e que en algunas si uaciones Nai e Q(λ)ob iene unos esul ados lige amen e mejo es que
I_Tb . Decidimos segui u ilizando el algo i mo I_Tb en lo que es a de esis ya que con-
side amos que las en ajas ela i as a la educción de pa áme os y la in e p e abilidad del
algo i mo compensan esa lige a bajada de endimien o.
El es udio de los di e en es alo es de igilancia nos p opo ciona un alo ρóp imo pa-
a los dos compo amien os aquí p obados. No podemos a i ma que dicho alo sea álido
pa a o os nue os compo amien os, pe o se puede usa como pun o de pa ida pa a nue os
108 Capí ulo 4. Rep esen ación dinámica del en o no
ap endizajes. La c eación de es ados en unción de la e olución del ap endizaje es una ap o-
ximación in e esan e pa a esol e el p oblema del ajus e de la igilancia, p incipalmen e la
es a egia basada en la inse ción dinámica de es ados, la cual p opo ciona unos esul ados
mucho mejo es que cualquie o o mé odo de los u ilizados du an e las p uebas. Pese a es os
buenos esul ados, las es a egias de modi icación de la pe cepción en unción del ap endizaje
no se án u ilizadas en lo que es a de esis. Con el sis ema p esen ado en el capí ulo siguien e,
se dispond á de di e en es edes Fuzzy ART independien es en e sí que p opo ciona án la
iqueza necesa ia pa a dispone de un espacio de es ados adecuado pa a cada a ea.
Los es ealizados en el en o no eal demues an que los compo amien os ap endidos
con nues a p opues a son ú iles, pe o ambién que es necesa io p oba el mayo núme o de
si uaciones posibles a las que se puede en en a el obo pa a consegui un ap endizaje ade-
cuado. El sis ema de ap endizaje mos ado en es e capí ulo sigue p esen ando un p oblema de
gene alización, ya que un pequeño cambio del en o no pod ía a ec a al con olado . A me-
dida que se acele a el ap endizaje y se mejo an los iempos medios ob enidos, se inc emen a
po cen ualmen e la des iación de los ap endizajes. El p oblema es que al mejo a el iempo de
ap endizaje el obo explo a á menos su en o no, po lo que su espacio de es ados no inclui á
una g an a iación de si uaciones. Dado que en muchos casos el en o no donde se ejecu a á el
compo amien o es complejo, y a menudo cambia con el iempo, se hace necesa io un sis ema
de ap endizaje con inuo, ya que se á imposible ap ende odas las posibles si uaciones. En el
capí ulo siguien e desc ibimos una nue a p opues a que hace en e a es os p oblemas.
CAPÍTULO 5
APRENDIZAJE MEDIANTE COMITÉS
En el capí ulo an e io se mos ó un sis ema que pe mi e el ap endizaje de mane a si-
mul ánea de pe cepción y acción, capaz de adqui i un compo amien o sin ningún ipo de
conocimien o p e io sob e el en o no o la a ea. Pese a que los esul ados ob enidos con dicha
es a egia ue on sa is ac o ios, el sis ema no esponde a odas las cues iones plan eadas en el
capí ulo 1. Es necesa io acele a el p oceso de ap endizaje pa a pe mi i su uso en un obo
eal o incluso pa a consegui que dicho ap endizaje sea con inuo.
En es e capí ulo se p esen an dos es a egias de ap endizaje donde, combinando un conjun-
o de ap endedo es subóp imos independien es en un comi é, el obo se á capaz de ap ende
a pa i de un conjun o mínimo de ejemplos mien as se man iene una buena gene alización
de lo ap endido. G acias a la combinación de ap endedo es se pod á ap o echa al máximo
cada conjun o de ejemplos sin que ello implique un sob eajus e a dichos ejemplos, lo que se
conoce como dilema bias- a ianza.
Una en aja adicional p opo cionada po el uso de comi és es que pe mi e añadi , sup imi
o modi ica ap endedo es sin que ello implique una deses abilización del sis ema, lo que ayu-
da en g an medida a consegui ap endizajes con inuos. T abaja con una única polí ica de
con ol supone un p oblema cuando hay cambios en el en o no que equie en una eadap a-
ción del obo o simplemen e la misma a ea se lle a a cabo en en o nos di e en es. La idea
es que el obo , bien pa iendo de un compo amien o ap endido en simulación, bien sin nin-
gún conocimien o p e io, sea capaz de adap a y modi ica su compo amien o de acue do al
en o no en el que se es á mo iendo. Bajo es as condiciones se p esupone que el ap endizaje
nunca inaliza, ya que an e cualquie a cambio o nue a si uación a la que se en en e el o-
116 Capí ulo 5. Ap endizaje median e comi és
π1
π2
π3
π4
π5
π6
in e alo elegido
Figu a 5.4: Ejemplo del p ocedimien o de o ación. Cada ap endedo sugie e un in e alo de acciones.
La acción ejecu ada se elegi á alea o iamen e en e aquellas que eciban el máximo núme o de o os.
5.3.1. Función de u ilidad de cada ap endedo
Pa a inc emen a la obus ez de nues a p opues a y esol e el dilema explo ación-explo-
ación (sección 3.3), se conside a á una nue a unción de alo que de e mina cómo de buena
es una polí ica en pa icula pa a un es ado dado. Rep esen amos es a nue a unción de alo
como U( igu a 5.3). La idea as la inclusión de la unción de u ilidad es e i a cambia las
polí icas de con ol si és as son exi osas, aun cuando no sean la polí ica óp ima (egoís a).
Po lo an o la unción U egula á cuándo se cambia la polí ica o ada po cada miemb o del
comi é.
Es o nos lle a a di e encia el cambio de polí ica pa a cada es ado de un ap endedo en
unción del alo U:
– Un ap endedo no cambia á su polí ica en un es ado dado mien as el in e alo p opues-
o no implique un allo del obo .
– En caso de que la polí ica sea “sospechosa” de habe causado algún allo, el ap endedo
pe de á pa e de su in luencia en el p oceso de o ación, pe o no cambia á su polí ica y
pod á ecupe a su in luencia si en o o episodio apa ece y no es esponsable del allo.

5.3. Comi és de e aluado es de acción 117
– Si se conside a a la polí ica esponsable del allo se cambia en base a la polí ica egoís a
(ecuación 5.7).
El uso de las polí icas egoís as pa a ac ualiza las polí icas de con ol pe mi e una ecupe-
ación más ápida de e o es debido al uso de expe iencias pasadas ap endidas po el obo .
Po o o lado, se debe ene en cuen a el hecho de que cada ez que el obo come e un e o ,
el uso de la unción Ulimi a el núme o de cambios y e i a que el sis ema caiga en g andes
ines abilidades, ya que un ap endedo solamen e cambia á su polí ica en caso de que la acción
sea conside ada e ónea.
Al p incipio del ap endizaje cada ap endedo calcula su polí ica óp ima. Dado que en ese
momen o los Q- alo es son alea o ios, es as polí icas se án ambién alea o ias. Aho a bien,
en luga de ac ualiza las polí icas al inal de cada episodio, cada polí ica se á modi icada
únicamen e en aquellos es ados donde se demues a que hubo un e o . Es o pe mi e que la
polí ica de cada ap endedo del comi é sea pseudo-egoís a, y po lo an o subóp ima, lo que
acili a que haya cie a explo ación y esul a bene icioso pa a el conjun o del comi é.
El alo de Ude cada una de las polí icas que in e ienen en el p oceso de o ación se
calcula pa a cada es ado al inaliza cada episodio, y ep esen a el po cen aje de eces que la
ejecución de una acción del in e alo p opues o po la polí ica de con ol pa a dicho es ado
p o ocó el allo que inalizó el episodio. También se end á en conside ación un umb al δ,
al que si un alo Ues mayo que dicho umb al se conside a á que la polí ica es e ónea y
debe á se cambiada.
El cambio en las polí icas de con ol se lle a á a cabo cuando el alo de Usob epase el
alo umb al δ. En es e caso las polí icas de con ol π1,··· ,πNp opues as po cada ap ende-
do son ac ualizadas u ilizando las polí icas egoís as π1∗,··· ,πN∗(ecuación 5.7). Básicamen e
cada polí ica se á modi icada en aquellas acciones que se conside an e óneas (Ui(s)>δ), en
es e caso el nue o in e alo de acciones coincidi á con la polí ica egoís a (algo i mo 5.1).
Como consecuencia de la inclusión de U, podemos ponde a la impo ancia del in e alo
p opues o po cada miemb o del subconjun o de o o. La siguien e ecuación esume el p oceso
de o ación:
a =a g max
a(N
∑
1
δ[a∈πl(sl( ))] ∗1−Ul(sl
)),∀a∈A,(5.4)
donde δes la Del a de K onecke :
δ[a∈πl(sl( ))] = (1 si a∈πl(sl
)
0 si a/∈πl(sl
)(5.5)
118 Capí ulo 5. Ap endizaje median e comi és
Algo i mo 5.1 Algo i mo de ac ualización de la polí ica en el comi é de e aluado es de acción
pa a i=1,··· ,Nhace
pa a odo sij∈Sihace
si Ui(sij)>δen onces
πi(sij) = πi∗(sij)
Ui(sij) = 0
in si
in pa a
in pa a
Po lo an o, Ul(s) = 1 signi ica que la polí ica de con ol les in álida pa a el es ado sy
en consecuencia su o o no se á enido en cuen a. Po el con a io, Ul(s) = 0 signi ica que la
polí ica lpa ece adecuada pa a el es ado sy po lo an o su o o se á omado en conside ación.
Cualquie o o alo in e medio ponde a á el o o educiendo así su in luencia.
5.3.2. Cons ucción de los in e alos de acciones
Reco demos que en es a p opues a cada uno de los ap endedo es ( igu a 5.3) dispone de su
p opia pa ición del espacio de acciones en in e alos ( igu a 5.4). Cada pa ición Al e i ica
las siguien es p opiedades:
Al=···
... ={Al(1) = [al
1,bl
1),Al(2) = [al
2,bl
2),···
...,Al(P) = [al
P,bl
P]},∀l=1,··· ,N.(5.6)
–Alcub e odo el espacio de acciones A,∀l=1,··· ,N:
[
j
Al(j) = A.
–Ales una colección disjun a de in e alos, ∀l=1,··· ,N:
j
Al(j) = /0.
El núme o de in e alos Pes el mismo pa a odas las pa iciones:
P=|Ai|=|Aj|,∀i,j=1,··· ,N.
5.3. Comi és de e aluado es de acción 119
Cada ap endedo ldel comi é ap ende á una unción de u ilidad Ql(Sl×Al), de al o ma
que Ql(s∈Sl,Al(j)) ep esen a el iempo que anscu i á an es del allo si el obo ejecu a
alguna de las acciones incluidas en Al(j)y a con inuación sigue una polí ica de con ol óp ima.
En es e sen ido, la polí ica de con ol óp ima, o egoís a, pa a cada ap endedo lse puede
ob ene de la o ma habi ual, es o es, a pa i de los Q- alo es:
πl∗(s∈Sl) = a g max
j{Q(s,Al(j))},∀l=1,..,N,∀j=1,..,P.(5.7)
Siendo Nel núme o de ap endedo es, y Pel núme o de in e alos en los que se pa iciona el
espacio de acciones.
5.3.3. Ac ualización de las unciones de alo ación
Como se comen ó an e io men e, la acción que el obo ejecu a en cada ins an e iene
de e minada po un p oceso de o ación en el que in e ienen dos unciones QyU( igu a
5.3). Ambas unciones de alo ación son independien es pa a cada ap endedo del comi é:
Q1,··· ,QNyU1,··· ,UN.
T as cada episodio el Q- alo de odos los ap endedo es que pa icipa on en el p oceso
de o ación se á ac ualizado. Es o implica que el algo i mo de ap endizaje I_Tb desc i o
en la sección 3.1 debe se modi icado pa a inclui es os nue os elemen os. El algo i mo 5.2
mues a las adap aciones ealizadas al algo i mo I_Tb pa a el ap endizaje con comi és de
e aluado es de acción. Reco demos que se puede ob ene el alo de Tb a pa i de los Q-
alo es siguiendo la ecuación 3.7.
En es e algo i mo a −mes la acción ejecu ada en el ins an e −m, y Al
a −mes el in e alo de
Alque con iene a −m. El pa áme o λes un pa áme o que ponde a la impo ancia del episodio
ac ual en e a la expe iencia pasada y acumulada en los Q- alo es. A alo es más al os de λ
mayo se á la in luencia de las úl imas in e acciones en los Q- alo es. Se ecomienda alo es
bajos de λcuando los e ue zos o las lec u as senso iales con ienen g an can idad de uido.
La ac ualización de la unción de u ilidad Ues di ec a: aquellas polí icas que o a on po
acciones ejecu adas lejos del e o e án disminuido su alo U(has a el alo mínimo de
0). Po el con a io, a aquellas polí icas que o a on po acciones ejecu adas jus o an es del
e o se les aumen a á el alo U(has a el alo máximo de 1). Po úl imo, las polí icas que
o a on po acciones que no se ejecu a on no e án al e ado su alo U. Es a ac ualización de
Up o oca que el obo ienda a epe i aquellas acciones ejecu adas en el pasado y que no
lle a on di ec amen e a un e o y a e i a aquellas acciones ce canas al e o .
120 Capí ulo 5. Ap endizaje median e comi és
Algo i mo 5.2 Algo i mo de ap endizaje I_Tb con comi és de e aluado es de acción
epe i
P ime a e apa: Selección de ap endedo es
Selecciona alea o iamen e un subconjun o de o o de Map endedo es
Segunda e apa: Recolec ando in o mación
m=0
epe i
Obse a el es ado ac ual en cada ap endedo del subconjun o de o o,sl
Selecciona median e un p oceso de o ación una acción a pa a se ejecu ada
Ejecu a acción a , obse a el nue o es ado sl
+1pa a cada miemb o del subconjun o
de o o y el alo de e ue zo
m←m+1
has a que <0om>=mmax
Te ce a e apa: Ac ualiza los Q- alo es
1. Ac ualiza el iempo a allo de cada ap endedo del subconjun o de o o:
pa a k=0,1,··· ,mhace
si k=0en onces
Tb l=Tsi −k<0
Tb l(s −k)en o o caso
si no
Tb l←λ∗(T b l+T)+(1−λ)∗T b l(s −k)
in si
in pa a
2. Ac ualiza el Q- alo de cada ap endedo del subconjun o de o o:
∆Ql
(s −m,Al
a −m) = βL∗(−e−T b l/50T−Ql
(s −m,Al
a −m))
∀l∈subcon jun o de o o
has a que Con e gencia alcanzada
Hay que eco da que, pa a man ene la independencia de los e o es en e miemb os del
comi é, únicamen e aquellos ap endedo es que pa icipa on en el p oceso de o ación e án
sus alo aciones cambiadas.
5.3. Comi és de e aluado es de acción 121
5.3.4. Aplicación expe imen al
Pa a p oba el sis ema de ap endizaje se ha seguido una es a egia simila a la empleada
en expe imen os an e io es. El obo mó il, un Pionee P3-DX, debe á ap ende a ejecu a
la a ea segui pa ed con una con igu ación senso ial consis en e en un láse SICK LMS-200
y un anillo de 16 ul asonidos. La elocidad lineal se man iene cons an e a 15,24 cm/s y el
ciclo de con ol se ejecu a cada 300 ms. La unción de e ue zo se á la misma que se usó en
an e io es ap endizajes del compo amien o segui pa ed. La aplicación de es e algo i mo se
p esen ó inicialmen e en [55, 94]. En p ime luga hemos ealizado un análisis del sis ema en
simulación, que se pasa a explica a con inuación.
En el p ime conjun o de expe imen os se escala on los alo es p o enien es de los senso-
es del in e alo [0,8]al in e alo [0,1)median e la unción:
Ii=1
1+inpu i
−1
9.(5.8)
Es impo an e des aca que en es e caso u ilizamos oda la in o mación p oceden e del láse
sin ag upa la en haces de 22,5◦como hacíamos has a aho a. Los pa áme os u ilizados pa a
es as p uebas ue on: coe icien e de ap endizaje del algo i mo I_Tb β1=0,25, λ=0,5.
El pa áme o de igilancia de cada ed Fuzzy ART se selecciona alea o iamen e en el ango
[0,86,0,92], y inalmen e el coe icien e de ap endizaje de las edes Fuzzy ART es β2=0.
Cada expe imen o con ó con un comi é de 435 ap endedo es, cada uno de los cuales di idía el
espacio de acciones en 7 in e alos alea o ios. En lo e e en e a la unción U, el umb al δpa a
conside a e ónea una polí ica se es ableció en 0,1. Pa a conside a a una acción ce cana al
allo se eligió alea o iamen e, as cada allo, un núme o de ciclos de con ol nen el in e alo
[0,35]. Po lo an o, oda acción ejecu ada nciclos de con ol an es del allo se conside a
causan e del mismo e inc emen a á el alo de U.
Las p uebas ejecu adas en simulación p opo ciona on un iempo medio de 14:33 minu-
os y una des iación de 8:48 minu os pa a un o al de 30 expe imen os. Es os iempos son
mucho mejo es que los conseguidos con la e sión simple de I_Tb yFuzzy ART: 22:18 de
iempo medio de ap endizaje y 14:10 de des iación. Aho a bien, es a educción del iempo
de ap endizaje es aún más signi ica i a si conside amos que en el caso del comi é se abaja
con las 181 componen es del escáne láse , en luga de ag upa es a in o mación en haces de
22,5◦, que es lo que se ha hecho al aplica el algo i mo I_Tb combinado con la ed Fuzzy
ART (sección 4.3.1).

122 Capí ulo 5. Ap endizaje median e comi és
Du an e las p uebas de es e sis ema hemos que ido comp oba el e ec o sob e el ap endi-
zaje del uso de una unción de p ep ocesado senso ial más e icien e. Po lo an o, as el p ime
conjun o de expe imen os se lle ó a cabo o a ba e ía de p uebas donde el p ep ocesado de la
in o mación senso ial se cambió a la unción:
Ii=(8−inpu i)2∗e−inpu i
1.5
64 .(5.9)
Dado que el obje i o de es a esis no es el ealiza un análisis exhaus i o de dis in os algo i -
mos de ap endizaje, sino el log a un sis ema de ap endizaje que uncione de mane a con inua
y en un obo eal, no se han epe ido las p uebas ealizadas en capí ulos an e io es con es a
nue a unción. Pa a los expe imen os ealizados con es e nue o p ep ocesado odos los pa-
áme os del sis ema se man u ie on con los mismos alo es, a excepción del in e alo de
elección alea o ia de la igilancia de las edes Fuzzy ART, el cual ue ampliado a [0,8,0,92].
T as 30 expe imen os se ob u o un iempo medio de ap endizaje de 06:36 minu os y una
des iación de 04:27 minu os. Es e esul ado pe mi e des aca la impo ancia de una buena
pe cepción senso ial pa a el ap endizaje po e ue zo, ya que an o el iempo de ap endizaje
como la des iación es ánda se han educido de o ma muy ap eciable.
En gene al, en es os expe imen os se obse a la impo ancia de la unción U, la cual
pe mi e que los dis in os ap endedo es o en o no en unción de sus acie os o e o es pasados.
Median e el uso de Use consigue una con e gencia más ápida al compo amien o deseado.
Dado que el algo i mo de ap endizaje mues a an buenos esul ados en simulación se
decidió da el sal o al obo eal y p oba el algo i mo en un en o no eal. En es e caso el obo
ap ende á ambién la a ea de segui la pa ed. En la igu a 5.5 se puede obse a el p og eso
del ap endizaje de un obo eal mo iéndose en un en o no eal, y como en pocas uel as es
capaz de ap ende una polí ica de con ol álida. Lo más ele an e de nues a p opues a es que
el obo empieza sin ningún conocimien o p e io ni de la a ea ni del en o no. Es o se puede
ap ecia cla amen e en la p ime a uel a que el obo ealiza al en o no, mos ada en la igu a
5.5(a).
Cada ez que el obo ecibe e ue zo nega i o, de iene su a ance y e ocede has a al-
canza una posición segu a, ca ac e izada po la ausencia de e ue zo nega i o, desde la que
con inúa el ap endizaje. Ha sido necesa io el desa ollo de un con olado que pe mi a mo e
al obo a una posición segu a. No obs an e, dicho con olado de ecupe ación es un aspec o
delicado del algo i mo, el simple hecho de ecoloca al obo en una nue a posición de pa ida
álida no es algo i ial y no siemp e unciona de mane a e icien e, lo que p o oca un e aso
5.3. Comi és de e aluado es de acción 123
(a) (b)
(c) (d)
Figu a 5.5: T ayec o ias del obo eal mien as ap ende la a ea segui pa ed de echa en un en o no eal:
a) P ime a uel a al en o no. El obo e ocede cada ez que ecibe un e ue zo. b) Te ce a uel a al
en o no, el obo no ecibe an os e ue zos nega i os. c) En la cua a uel a es capaz de ejecu a la a ea
sin e o . d) Úl imas uel as con el compo amien o ya ap endido an es de la inalización del ap endizaje.
en el ap endizaje. El de ini el con olado de ecupe ación, así como la unción de e ue zo,
son a eas que dependen del compo amien o que se busca, y que po lo an o impiden una
ápida adap ación del sis ema en caso de que e ap ende di e en es compo amien os. En la
siguien e sección se p esen a una p opues a di e en e donde an o el con olado de ecupe a-
ción como la señal de e ue zo son p opo cionadas di ec amen e po un obse ado humano.
124 Capí ulo 5. Ap endizaje median e comi és
5.4. Comi é de e aluado es de polí icas
Dado que ya hemos comp obado la aplicabilidad de la cons ucción de un comi é pa-
a el ap endizaje en el obo eal, que emos ambién o ien a su diseño hacia el ap endizaje
con inuo. En el nue o comi é que p esen amos en es a sección buscamos dos aspec os: la ca-
pacidad de in oduci nue o conocimien o sin deses abiliza lo ya ap endido, y la posibilidad
de ac ualiza las alo aciones sin que ocu a un allo.
La p opues a que se p esen a en es e apa ado u iliza, al igual que en el caso an e io , un
comi é de ap endedo es. En el comi é de e aluado es de acción p esen ado an e io men e,
cada ap endedo lap ende una unción de u ilidad Qlpa a cada pa es ado-in e alo de ac-
ciones Ql(Sl×Al). Po es e mo i o la polí ica de con ol p opues a po cada ap endedo del
comi é e oluciona a lo la go del iempo. En es e apa ado desc ibimos una nue a p opues a
en la que la polí ica de con ol p opues a po cada ap endedo no e oluciona a lo la go del
p oceso de ap endizaje. En es e caso cada ap endedo del comi é simplemen e e alúa una de-
e minada polí ica de con ol, po lo que no end á la capacidad de e alua la u ilidad de cada
acción. G acias a es o con es e algo i mo se necesi a á almacena menos in o mación (una
única polí ica de con ol en e a odos los in e alos del espacio de acciones de la p opues a
an e io ). O as en ajas ela i as al ap endizaje p opo cionadas po es a p opues a son una
mayo acilidad pa a su implemen ación en el obo eal y la simpli icación del algo i mo.
En es e caso cada uno de los Nap endedo es e alúa una polí ica de con ol, π1,··· ,πN,
c eada inicialmen e al aza . Cada una de es as polí icas p opone un in e alo de acciones pa a
cada es ado:
πl:Sl→Al
s∈Sl→πl(s)∈A= [a,b),a∈A,b∈A,a<b.(5.10)
Cada ap endedo l ambién cons uye su p opia ep esen ación del mundo median e una ed
Fuzzy ART ( igu a 5.6). Cada ez que apa ece un nue o es ado se le asocia á un in e alo de
acciones c eado de o ma alea o ia y que no cambia á du an e odo el p oceso de ap endizaje.
Hab á dos conjun os de polí icas ( igu a 5.6). El p ime o de ellos in e iene en el p oce-
dimien o de o o pa a elegi la acción a ejecu a , es el Conjun o de polí icas de decisión. El
segundo conjun o de polí icas, llamado Conjun o de polí icas de obse ación, no in e iene
en el p oceso de o ación, pe o obse a el esul ado de las acciones del obo . A lo la go de
es a sección se i á iendo el uncionamien o de cada uno de ellos.
5.4. Comi é de e aluado es de polí icas 125
In o mación
senso ial
.
.
.
Fuzzy ART - 1
Fuzzy ART - 2 Polí ica π2
Fuzzy ART - N Polí ica πN
Mecanismo
de o o
Acción
del obo
L1
L2
LN
Polí ica π1
Fuzzy ART - 1
Fuzzy ART - R Polí ica πR
L1
LR
Polí ica π1
Conjun o de polí icas de decisión
Conjun o de polí icas de obse ación
.
.
.
Figu a 5.6: Esquema gene al de la p opues a pa a ap endizaje en el obo eal. El conjun o de polí icas de
decisión de e mina qué acción ejecu a el obo en cada ins an e. El conjun o de polí icas de obse ación
a cons uyendo nue as polí icas a pa i de las acciones que no han enido e ue zo nega i o. Cada
ap endedo gene a su p opio espacio de es ados.
5.4.1. Ac ualización de los Q- alo es
Dado que cada una de las polí icas del comi é se cons uye de mane a alea o ia se á nece-
sa io calcula la idoneidad de cada una de ellas. Po lo an o se c ea á una unción de u ilidad
Qpa a cada una de las polí icas con alo aciones alea o ias Ql(s)∈[−1,−0,95],∀s∈Sl. A
con inuación se inicia á la explo ación del en o no ejecu ando las acciones de e minadas me-
dian e un p oceso de o ación. En es a o ación pa icipan odas las polí icas pe enecien es al
Conjun o de polí icas de decisión ( igu a 5.6). La acción que el obo ejecu a en cada ins an e
132 Capí ulo 5. Ap endizaje median e comi és
Figu a 5.7: Joys ick inalámb ico u ilizado po el obse ado humano pa a p opo ciona la señal de e-
ue zo al obo .
a indica le al obo que lo que es á haciendo no es sa is ac o io desde el pun o de is a del
obse ado . Es impo an e ema ca el hecho de que es a o ma de indica el e ue zo es al-
amen e no de e minis a, el mismo usua io puede da al obo un e ue zo nega i o en cie as
si uaciones y más adelan e pe manece impasible en o os escena ios muy simila es. Po o a
pa e, es posible que el obse ado humano cambie de pa ece du an e el ap endizaje sob e
el compo amien o deseado. Po lo an o nues o algo i mo debe hace en e a e ue zos in-
consis en es y nada sis emá icos. Cuando el usua io pulsa el bo ón de e ue zo nega i o el
obo en a en un es ado pasi o y se ans ie e el con ol al joys ick, de mane a que el usua io
puede mo e el obo y coloca lo en una nue a posición de einicio álida pa a e oma el
ap endizaje. En ese momen o se pulsa un segundo bo ón que de uel e el con ol al obo y el
ap endizaje con inúa.
No en a den o de los obje i os de es e abajo el combina ap endizaje po demos ación
con ap endizaje po e ue zo, po lo an o el algo i mo no ap ende á lo que el obo haga
du an e el iempo que el usua io iene el con ol. Decidimos p ocede de es a mane a pa a
esal a la habilidad del algo i mo de ap endizaje po e ue zo de ob ene ap endizajes ápidos
a pa i de la in e acción di ec a en e el obo y el en o no, a pesa de que la o ma en la que
el usua io p opo ciona el e ue zo cambia du an e el p oceso de ap endizaje.

5.4. Comi é de e aluado es de polí icas 133
5.4.4. Aplicación expe imen al
Al igual que hicimos con el ap endizaje basado en un comi é de e aluado es de acción,
se ealiza on una se ie de p uebas pa a e alua el endimien o de la p opues a de ap endizaje
median e un comi é de ap endedo es de polí icas. Debido a los buenos esul ados mos ados
en el obo eal ob enidos median e el comi é de e aluado es de acción, las p uebas aquí mos-
adas se ealiza on di ec amen e en el en o no eal, sin ningún paso p e io po simulación.
Se usó el mismo obo Pionee P3-DX u ilizado en p uebas an e io es. En es a ocasión se
sus i uyó el láse SICK LMS-200 po un modelo SICK LMS-100. El LMS-100 p opo ciona
di e sas en ajas sob e el LMS-200 pa a su aplicación en un obo mó il: es más compac o,
iene un meno consumo ene gé ico y aba ca un a co de 270◦– p opo ciona un ec o de 541
lec u as de dis ancia, una lec u a cada medio g ado en el in e alo [−135◦,135◦]. Los pa á-
me os del algo i mo I_Tb son: λ1=0,99, β1=0,05, λ2=0,15 y β2=0,95. La elocidad
lineal se man u o cons an e en 15,24 cm/s, y el espacio de acciones a escoge po el obo
es un conjun o de acciones equidis an es po una décima de g ado que disc e izan las eloci-
dades angula es en el ango [−0,8,0,8] ad/s, 900 acciones en o al. Los esul ados de es a
in es igación ue on publicados en [99, 97].
En odas las p uebas el obo empieza sin ningún conocimien o p e io ni del en o no ni
de la a ea, la abla de Q- alo es es á inicializada a alo es alea o ios en [−1,−0,95]y las
edes Fuzzy ART no con ienen ningún es ado. Dado que en es a p opues a el e ue zo es p o-
po cionado po un humano y es cla amen e no de e minis a, la noción de a ea se di umina.
Du an e las p uebas aquí mos adas el obo ap endió un compo amien o de na egación e-
niendo como e e encia la pa ed de echa en di e en es en o nos. Hay que ol e a señala que
du an e odas es as p uebas el obo es á ap endiendo de mane a con inua, incluso en ausencia
de e ue zos nega i os.
La p ime a p ueba u o luga en el en o no mos ado en la igu a 5.8, que consis ía en
un pequeño espacio aco ado po planchas de espuma. La igu a 5.9 mues a las ayec o ias
seguidas po el obo en las p ime as uel as al ci cui o. Las zonas donde el obo come ió
un e o se ma can con un cí culo. Tal y como se puede e en las imágenes, los e o es se
concen an en los p ime os ins an es del ap endizaje, y a pa i de la sex a uel a el obo no
come e ningún e o .
La segunda p ueba consis ió en dos pa es. En la p ime a pa e el obo ap endió a mo e se
en un en o no pa cialmen e obs uido con unos obs áculos, el es íbulo del Depa amen o de
Elec ónica e Compu ación ( igu a 5.10). Como se puede obse a en la igu a 5.11 el obo
134 Capí ulo 5. Ap endizaje median e comi és
Figu a 5.8: En o no en el que el obo debe á ap ende a segui pa ed si uada a su de echa.
ap endió ápidamen e cómo mo e se en ese en o no. En la segunda pa e del expe imen o
se elimina on los obs áculos que delimi aban el en o no y se le pe mi ió al obo mo e se
lib emen e po el edi icio ( igu a 5.12). Es eseñable el hecho de que en es a segunda pa e,
pese a que el obo debía ci cula po un en o no muy di e en e, con pasillos, pue as y una
disposición muy di e en e de obs áculos, no ecibió muchos e ue zos nega i os.
Es os buenos esul ados ambién se mues an en un e ce expe imen o ealizado en un
en o no co idiano, en pa icula en los pasillos del Depa amen o de Elec ónica e Compu-
ación de la Uni e sidade de San iago de Compos ela ( igu a 5.13). En es e caso no se aco ó
el mo imien o del obo du an e las ases emp anas del ap endizaje, po lo que el obo se
encon ó desde el comienzo del ap endizaje con pe sonas, muebles y equipamien o.
La igu a 5.14 mues a las ayec o ias ejecu adas po el obo du an e su ap endizaje en el
en o no del depa amen o. Al igual que ocu ió en el en o no aco ado, la mayo ía de los e o-
es, ma cados con cí culos en la igu a, se come ie on al p incipio del ap endizaje. Al llega
al es íbulo en la p ime a uel a ( igu a 5.14.(a)) se puede obse a cómo el compo amien o
no ue co ec o, es o se debe a que la zona del es íbulo es muy di e en e a los pasillos po
donde el obo había ci culado an e io men e, po lo que se gene an es ados nue os y el obo
debía ap ende la acción co ec a pa a cada uno de ellos. Como se e en la igu a 5.14.(b) la
segunda uel a la ealizó p ác icamen e sin e o es y con una ayec o ia más sua e.
Es impo an e eco da el hecho de que el obo ap endía – ac ualizando los Q- alo es –
con inuamen e, incluso en la ausencia de e ue zo nega i o.
5.4. Comi é de e aluado es de polí icas 135
Figu a 5.9: P ime as uel as del p ime expe imen o en el que el obo debe ap ende el compo amien o
segui pa ed de echa en el en o no mos ado en la igu a 5.8. La línea con inua mues a la ayec o ia del
obo . Los cí culos indican las p incipales zonas donde el obo ecibió e ue zo nega i o p o enien e
del obse ado humano. T as 6 uel as el obo es capaz de ejecu a la a ea sin e o es.
5.4.5. Ap endizaje con usua ios no expe os
Du an e el desa ollo de la in es igación p esen ada en es a sección se han ealizado p ue-
bas de ap endizaje en el obo eal con pe sonas ajenas a la obó ica. Es as p uebas e an pa e
de di e en es alle es de di ulgación cien í ica donde el pe il de los usua ios e a el de una
pe sona de en e 18 y 50 años con es udios uni e si a ios.
La a ea del usua io consis ía en consegui que el obo ap endiese un compo amien o de
segui pa ed pa iendo de un obo con un sis ema de ap endizaje sin ningún conocimien o
136 Capí ulo 5. Ap endizaje median e comi és
Figu a 5.10: Es as igu as mues an el es íbulo del Depa amen o de Elec ónica e Compu ación donde
el obo empeza á a ap ende en el segundo de los expe imen os. En es a p ime a pa e el obo da á
a ias uel as a es e en o no an es de que se le pe mi a mo e se a a és de los pasillos del edi icio. Pa a
limi a el mo imien o del obo se si ua on planchas que bloqueaban los pasillos.
sob e la a ea y el en o no. Pa a ello se mon ó un pequeño en o no de ap endizaje donde el
obo debía ap ende a segui la ba e a que delimi a el en o no. A los usua ios se les die on
unas sencillas ins ucciones y consejos:
– An es de empeza el p oceso de ap endizaje es necesa io que el usua io enga una idea
cla a de qué compo amien o quie e consegui . Al obo se le deben da e ue zos lo
más consis en es posible.
– Cuando el usua io obse e que el obo es á haciendo algo inadecuado debe p opo cio-
na un e ue zo nega i o ap e ando el ga illo del joys ick.
– T as el e ue zo el usua io debe con ola el obo con el joys ick has a ecoloca lo en
una posición y después pulsa un segundo bo ón pa a que el sis ema de con ol del obo
pueda con inua con el ap endizaje.
En gene al los usua ios ap ecian el p og eso del obo du an e el ap endizaje, y les ag ada
e cómo a mejo ando el compo amien o. Aquellos usua ios que log an en ende el meca-
nismo de ap endizaje po e ue zo, las capacidades senso iales del obo y log an hace se un
modelo men al del sis ema son capaces de p opo ciona un e ue zo más adecuado y consi-
guen que el obo ap enda en menos iempo.
Se encon a on algunos p oblemas y di icul ades du an e es as p uebas:
5.4. Comi é de e aluado es de polí icas 137
Figu a 5.11: P ime a pa e del segundo expe imen o ealizado pa a enseña a un obo a mo e se po el
Depa amen o de Elec ónica e Compu ación. Como se puede e al obse a la ayec o ia del obo ,
únicamen e en la p ime a uel a el obo ecibió e ue zos nega i os (indicados con cí culos).
– El e ue zo p opo cionado al obo no es consis en e du an e la du ación de odo el
ap endizaje. El compo amien o buscado po el usua io cambia a medida que a anza
el ap endizaje. En ocasiones es un cambio meno , como a ia la dis ancia a la que
se sigue la pa ed. En o as ocasiones el usua io busca simplemen e el compo amien o
segui pa ed sin ninguna p e e encia po el lado izquie do o de echo, y al ecoloca el
obo cambia de sen ido, p e endiendo que siga la pa ed del lado con a io.
– En ocasiones el obo a da en esol e un p oblema y el usua io in e p e a que el obo
es á haciendo siemp e lo mismo sin obedece a los e ue zos indicados. La solución
que se le da al usua io es que ecoloque al obo en una posición más alejada de la zona
con lic i a con el in de que el obo enga más opciones a la ho a de supe a la.
– Cuando el obo come e un e o , el usua io le indica al obo que lo es á haciendo mal
median e la oz, pe o no se da cuen a de pulsa el bo ón de e ue zo has a pasados unos

138 Capí ulo 5. Ap endizaje median e comi és
Figu a 5.12: Segunda pa e del expe imen o mos ado en la igu a 5.11. Una ez el obo comple ó es
uel as en el ecibido del depa amen o se elimina on los obs áculos que bloqueaban el acceso a los
pasillos. Se puede obse a el pequeño núme o de e ue zos ecibidos – indicados con cí culos – pese a
que el obo se encon aba en un en o no comple amen e nue o.
ciclos. Es e e aso en la gene ación del e ue zo puede conlle a unas consecuencias
muy nega i as pa a el ap endizaje.
– En o as ocasiones el usua io no le da iempo al obo pa a co egi su compo amien-
o y le indica un e ue zo nega i o demasiado p on o, cuando el obo aún no es aba
cla amen e en una si uación de e ue zo.
– Algunos usua ios espe an demasiado del obo y p e enden que siga la pa ed a una
dis ancia muy p ecisa, indicando e ue zo an p on o el obo se aleja lige amen e de la
dis ancia espe ada.
5.4. Comi é de e aluado es de polí icas 139
Figu a 5.13: Es as imágenes mues an el en o no del Depa amen o de Elec ónica e Compu ación de la
Uni e sidade de San iago de Compos ela, donde el obo ap endió a mo e se siguiendo la pa ed si uada
a su de echa. Es e en o no con iene an o pasillos (a) como espacios abie os (b).
Figu a 5.14: T ayec o ia seguida po el obo en las dos p ime as uel as al en o no mos ado en la igu a
5.13. T as la p ime a uel a el obo no ecibe e ue zo nega i o (indicados con cí culos).
– T as indica un e ue zo, algunos usua ios colocan al obo en una posición más ade-
lan ada a aquella en la que ecibió el e ue zo. Es o impide que el obo se en en e al
p oblema en el que e ó, con lo que no ap ende á a soluciona lo.
140 Capí ulo 5. Ap endizaje median e comi és
(a) (b)
Figu a 5.15: Expe imen o del ap endizaje con usua ios no expe os en obó ica. a) En o no de ap endi-
zaje u ilizado. b) Algunos de los usua ios ecibiendo indicaciones sob e cómo di igi el ap endizaje.
5.5. Discusión
El sis ema de ap endizaje p esen ado en es e capí ulo nos pone un paso más ce ca del
ap endizaje con inuo en obo s ope ando en en o nos eales. En es e capí ulo se han p esen-
ado dos p opues as pa a esol e el dilema bias- a ianza. Ambas p opues as se basan en el
mismo p incipio, la c eación de un comi é de expe os, los cuales se án capaces de esol e
la a ea ac uando de o ma conjun a. Las dos p opues as se han demos ado álidas en los
esul ados expe imen ales y cada una iene sus en ajas e incon enien es.
Un aspec o común es que los miemb os de cada comi é deben come e e o es no co e-
lacionados, po lo que se necesi a que ean y ac úen de mane a di e en e. Pa a ello cada uno
de los miemb os de los comi és cuen a con su p opia ep esen ación de es ados, po lo que
hay una ed Fuzzy ART independien e pa a cada uno de los miemb os. El uso de comi és de
ap endedo es p opo ciona la en aja de que pe mi i ía abaja con salidas con inuas, en luga
del conjun o de acciones disc e o que p opo ciona el algo i mo I_Tb o iginal
La p ime a p opues a consis e en un comi é de e aluado es de acción, donde cada uno de
los ap endedo es cuen a con una di isión de odo el espacio de acciones en in e alos alea o-
ios y ap ende á cuáles son los in e alos álidos pa a cada es ado. Es a p opues a incluye una
nue a unción de alo ación, a la que llamamos unción de u ilidad U, con la que se consi-
gue añadi es abilidad al sis ema. Median e Use puede disce ni qué ap endedo es p oponen
5.5. Discusión 141
buenas polí icas y cuáles no lo hacen, impidiendo que se les enga en cuen a en el p oceso de
o ación. Los esul ados en simulación mues an que es a es a egia de ap endizaje p opo -
ciona con e gencias ápidas, y que es po lo an o álida pa a su aslado al obo eal. Las
p uebas de ap endizaje con el obo eal die on esul ados sa is ac o ios, ya que el obo ad-
quie e una polí ica de con ol co ec a en unos pocos minu os. Un p oblema de es a p opues a
es que el algo i mo se hace más complejo, consume más memo ia y iene un mayo núme o de
pa áme os. Po o o lado, al ap ende las alo aciones de odos los in e alos del espacio de
acciones no se á necesa io que el comi é es é o mado po un g an núme o de ap endedo es.
La segunda p opues a, el ap endizaje median e comi é de e aluado es de polí ica, es una
al e na i a a la an e io , donde se in oducen ca ac e ís icas pa a pe mi i el ap endizaje con-
inuo y se simpli ica el sis ema pa a alige a los eque imien os de memo ia. En es e sis ema
cada miemb o del comi é se limi a a e alua una única polí ica de con ol (inicialmen e ge-
ne ada de o ma alea o ia). La p incipal mejo a de es e sis ema es el pe mi i el ap endizaje
con inuo, po lo que no es necesa io que un episodio inalice pa a ac ualiza las alo aciones.
O a ca ac e ís ica impo an e de la segunda p opues a es la exis encia de un comi é de po-
lí icas de obse ación, las cuales i án ecopilando in o mación sob e qué acciones dan buenos
esul ados con el in de ocaliza la a ención y es abiliza el ap endizaje. Cada cie o iempo
se ans ie en polí icas del comi é de obse ación al comi é de decisión, añadiendo así cono-
cimien o sob e las acciones con mejo expec a i a de iempo a allo. El comi é de obse ación
p opo ciona la es abilidad necesa ia pa a que el algo i mo con e ja aun cuando el e ue zo
p opo cionado sea al amen e no de e minis a.
Todas es as mejo as pe mi en que sea un usua io humano el que p opo cione el e ue zo
al obo a a és de un disposi i o inalámb ico. Un posible p oblema del uso de e ue zo
p opo cionado po un humano es la al a de cohe encia, po lo que el e ue zo ecibido po
el algo i mo no se á de e minis a ya que an e las mismas si uaciones el e ue zo puede se
di e en e. Nues o sis ema se compo a bien siemp e que el usua io se man enga den o de
unos má genes ole ables. No hemos ealizado un es udio exhaus i o sob e la in luencia del
e ue zo humano en el algo i mo de ap endizaje, si bien en las p uebas lle adas a cabo con
usua ios no en enados se ha is o que la mayo ía son capaces de enseña al obo as ecibi
unas sencillas indicaciones sob e el uncionamien o del mismo.
Una des en aja del ap endizaje median e un comi é de e aluado es de polí icas espec o
al comi é de e aluado es de acción es que, si una polí ica de con ol no es álida el sis ema
ap ende a no ene la en cuen a, pe o dicha polí ica no e oluciona á y pe manece á de mane a