De ecci´on Facial en V´ıdeos Digi ales
Facial De ec ion On Digi al Videos
TRABAJO FIN DE GRADO
GRADO EN INGENIER´
IA INFORM ´
ATICA
GRADO EN INGENIER´
IA DEL SOFTWARE
CURSO 2019–2020
A u o Ba be o P´e ez
Alejand o Cabezas Ga ´ıguez
Jos´e Mo cuende Sie a
Di ec o es
Luis Ja ie Ga c´ıa Villalba
Es eban Alejand o A mas Vega
Depa amen o de Ingenie ´ıa del So wa e e In eligencia A i icial
Facul ad de In o m´a ica
Uni e sidad Complu ense de Mad id
Mad id, Junio de 2020
Ag adecimien os
A u o Ba be o P´e ez
An es de comenza , me gus a ´ıa pa a asea una exp esi´on a ibuida al il´oso o Be na do
de Cha es, la cual dice as´ı: ((Somos como enanos sob e los homb os de gigan es, de modo
que podemos e las cosas a una mayo dis ancia. No en i ud de nues a agudeza isual,
o cualquie dis inci´on ´ısica, sino po que nos ele an al o po su g an al u a)).
Pa a m´ı, aquellos gigan es a los que hace e e encia, son odas las pe sonas que, de una
o ma u o a, han in luido en que hoy pueda se como soy y, g acias a ello, me encuen e
inalizando es os es udios. Po ello, me gus a ´ıa dedica y ag adece el p esen e abajo a
los que yo conside o mis gigan es:
A mis pad es, po odo lo que me han dado du an e oda la ida. Po habe es ado
al lado, an o en los log os como, sob e odo, en los opiezos. Po habe me ansmi ido
desde siemp e los alo es del es ue zo y la cons ancia y habe con iado en m´ı cuando yo
no lo hac´ıa.
A mi he mano, po odos los momen os que hemos pasado y po se la pe sona que me
dio a descub i la in o m´a ica desde peque˜no, haciendo que me acaba a in e esando cada
ez m´as po es e mundo. G acias a ello, aho a s´e qu´e es lo que quie o hace con mi ida.
A mis p imos, en especial a Edu y Bea, po oda la ayuda y consejos que me han
b indado a lo la go de los a˜nos. Po que, adem´as de amilia, son ejemplos y modelos a
segui an o pe sonal como p o esionalmen e. No pod ´ıa es a m´as ag adecido.
A Da id y Ma iano, po es a p ´ac icamen e desde el p incipio de los iempos y se
desde en onces un g an apoyo. Po odas las buenas expe iencias que hemos pasado jun os
y po habe me ense˜nado lo que es ealmen e el alo de la amis ad y la leal ad.
A odos mis mas odon es, ie as y leyendas —ellos saben qui´enes son—, po odas las
isas, quedadas y el apoyo con inuo en p ´ac icas y ex´amenes. G acias a ellos, aho a la ase
((¡Feliz a˜no!)) iene un signi icado a´un m´as especial. Mi expe iencia uni e si a ia hab ´ıa sido
muy dis in a sin oso os.
iii
i
A los p o eso es que he ido eniendo a lo la go de la ca e a po que, adem´as de
habe me ense˜nado el campo de la Ingenie ´ıa In o m´a ica, me han hecho da me cuen a
de que en en a se a p oblemas complejos po los que nunca an es has pasado es una de
las mejo es o mas de c ece como pe sona.
Y po ´ul imo, no pod ´ıa ol ida me an o de nues os di ec o es como de mis
compa˜ne os, as´ı como de Ana Lucila y Alexand a. G acias po da me la opo unidad
de ealiza es e abajo con odos oso os y habe me acompa˜nado en es e e o. Es oy
segu o de que, de no habe sido po ues a ayuda, la ealizaci´on de es e p oyec o se
hab ´ıa di icul ado en g an medida.
Alejand o Cabezas Ga ´ıguez
En p ime luga , me gus a ´ıa ag adece a nues os di ec o es, Luis Ja ie y Es eban po
habe nos dado la opo unidad de in es iga sob e es os campos que, pe sonalmen e, me
han hecho ama aun m´as es a ca e a y el mundo del so wa e y la in o m´a ica en gene al.
G acias po acep a aquella euni´on en mi ad de e ano y g acias po acep a nos pa a
ealiza es e p oyec o. Adem´as, c eo que el abajo que hemos ealizado conjun amen e
con Ana ha sido muy sa is ac o io y p oduc i o, y le ag adezco a es a pe sona la labo
de o ganizaci´on que ha enido con noso os a lo la go del desa ollo de odo el abajo.
Tambi´en debo ag adece a Alexand a po la labo que ealiz´o a p incipio de cu so pa a
ense˜na nos los concep os b´asicos con los que pode comenza a in es iga y a ap ende
po noso os mismos. Sin duda alguna no hab ´ıamos podido comenza con an a sol u a
si ella no nos hubiese explicado concep os an b´asicos sob e In eligencia A i icial y Redes
Neu onales.
Po supues o, ambi´en debo ag adece le la labo y el empe˜no pues o en es e abajo a
mis compa˜ne os de p oyec o, Jos´e y A u o. Tengo muy cla o que sin ellos, el desa ollo
de la idea hab ´ıa sido imposible y la labo de in es igaci´on hab ´ıa supues o muchas m´as
complicaciones y queb ade os de cabeza. Es oy segu o de que ha sido nues o abajo en
equipo lo que nos he hecho pode a anza de mane a e ec i a, siemp e dando pasos i mes.
En especial, quie o ag adece a A u o el conocimien o que ha apo ado a el p oyec o,
pues o que ´el conoc´ıa p e iamen e concep os del mundo de la In eligencia A i icial.
G acias a ´el hemos podido ap ende y aplica conocimien os de una mane a mucho m´as
´apida y e ec i a.
Tambi´en quie o ag adece a la Uni e sidad y a los p o eso es que me han ense˜nado
odos los concep os necesa ios du an e odos es os a˜nos de ca e a. G acias a ellos he
podido conoce el mundo del so wa e y de la in o m´a ica en odo su esplendo y me han
hecho da me cuen a de cual es mi luga en la ida y qu´e es lo que quie o hace con ella.
Me han guiado con sus asigna u as a a ´es de un camino di ´ıcil, lleno de e os, y me han
hecho supe a me y o ece lo mejo de m´ı.
Po ´ul imo, me gus a ´ıa en a en una pa e de mi co az´on que no suelo compa i
con los dem´as po que c eo que a´un no es oy p epa ado pa a ello. Hoy, mien as e mino
lo que puede pa ece un p´a a o insigni ican e en compa aci´on a odo lo que es ´a po
eni en es a memo ia, cada palab a que esc ibo me ae a la men e odos los momen os
que he pasado en mi ida. Me hacen da me cuen a de quienes han sido los apoyos, los
cimien os, las bases... el odo de mi ida. Hola pap´a, hola mam´a, es oy segu o de que en
alg´un momen o lee ´eis es o, es oy segu o de que os eco da ´e que e is´eis es a pa e, es oy
segu o de que sen i ´e ne ios po sabe ues a eacci´on. C eo que he dejado bas an e
cla o lo que signi ic´ais pa a mi y lo que supon´eis en mi ida, pe o no pienso deja pasa
los d´ıas sin que os los ecue de: sois mi ´exi os, mis acasos, mis i udes, mis de ec os,
i
mi se y es a , mi aye , hoy y ma˜nana, mi odo y mi nada. No puedo deja es e apa ado
sin aco da me de oso os, aunque nunca deja ´e de ene os en mi men e. A oso os os
debo en p ime luga mi ida, y en segundo luga odo. G acias a oso os hoy puedo
esc ibi es a memo ia, hoy puedo ce a es e cap´ı ulo inal pa a e mina es a ca e a an
ma a illosa. G acias, soy mejo pe sona hoy en d´ıa po habe omado como ejemplo a dos
pe sonas an inc e´ıbles como oso os.
G acias F an po se mi en e me o, mi he mano mayo y mi amigo. G acias a i engo
cla o que, no solo soy una pe sona sana de cue po, sino ambi´en de alma. G acias po se
el escudo de mi men e, po sal a me de mi p opio ma de ideas que a eces me ahoga y
po libe a me de las cadenas que a eces me pongo a mi mismo y me impiden dis u a .
Finalmen e, me gus a ´ıa eco da unos e sos de un poema esc i o po Rudya d
Kipling: ((Si puedes llena cada implacable minu o, con sesen a segundos de comba e b a ´ıo,
uya es la Tie a y sus codiciados u os, y —lo que es m´as—: ¡se ´as un Homb e, hijo
m´ıo!)). A´un ecue do cuando ´u, pap´a, me mos as e es e poema en e l´ag imas y me
hicis e p ome e que es os e sos uesen el mo o de mi ida, mien as enma cabas el
poema en mi habi aci´on. Pues bi´en, as´ı ha sido, y as´ı se ´a, pues o que no pa a ´e ni un
segundo en consegui aquello que me p opongo, y es o es g acias a oso os.
Pap´a, mam´a, F an, abuela, abuelo, i o, i a, p ima, p imo... amilia, desde lo m´as
p o undo de mi alma, os lo ag adezco odo y os debo lo que es ´a po llega en mi ida.
Simplemen e, g acias.
ii
Jos´e Mo cuende Sie a
Es a esc ibiendo es o me da que pensa , es o supone el in de una e apa. Supone abandona
una de las mejo es ases, de la que mejo es ecue dos engo y mas apoyo he ecibido, donde
conside o que he ganado e dade os amigos.
En es os cua o a˜nos ha habido an o buenos momen os como malos, pe o odos
ellos o man pa e de lo que llaman ”la ida uni e si a ia”. Me gus a ´ıa empeza
ag adeci´endoselo mi pad e y a mi mad e, si no ue a po ellos no hubie a podido i i
es a expe iencia, apoy´andome a˜no as a˜no, impuls´andome a con inua y saca lo m´aximo
de mi, a no pone me limi aciones, en gene al me han ense˜nado a con ia en mi mismo.
G acias a ellos he ap endido que in en a lo siemp e me ece la pena, que es as expe iencias
son ealmen e impo an e en la ida. Asimismo ag adec´e selo a mis ´ıos y a mi abuela po
es a siemp e pendien es, po llama me cada ez que ealizaba un examen o en egaba una
a ea pa a p egun a que al me hab´ıa ido y da me ´animos uese cual uese el esul ado.
Tambi´en ag adezco el habe conocido a Alejand o desde los inicios de de la ca e a,
g acias po odo el apoyo que me has o ecido, engo cla o que sin u ayuda hoy d´ıa no
es a ´ıa donde es oy. No me ol ido de A u o, que a pesa de solo conoce le de is a po
la acul ad conside o que me lle o una amis ad m´as. Sin ellos odo es o no hubie a sido
posible, ambos han sido p imo diales pa a la ealizaci´on y inalizaci´on de es e abajo,
adem´as de lo lle ade o que han conseguido que sea es e du o camino.
O a pa e impo an e es es o de las pe sonas de la Uni e sidad, el es o de amigos con
los que he enido la sue e de compa i clases y iajes. Asimismo, los p o eso es han enido
un papel muy ele an e en es os cua o a˜nos, han sido los enca gados de ense˜na nos poco
a poco en que consis e de e dad es a ca e a. No me ol ido de nues os di ec o es, Luis
Ja ie y Es eban, que nos die on la opo unidad de ealiza es e abajo de in es igaci´on,
que a pesa de no es a nada acos umb ados, que jun o con Ana Lucila nos han ayudado
a comple a lo, y m´as siendo en el campo de la In eligencia A i icial, que pe sonalmen e
no hab´ıa is o nada nunca.
Po ul imo me gus a ´ıa ag adec´e selo a esa pe sona que conoc´ı a mediados de agos o
del a˜no pasado, a la que en es e iempo he cogido mucho ca i˜no, po odo lo que has
hecho po mi, po odo el apoyo que me has o ecido de mane a con inuada desde que e
conozco, po p eocupa e odos los d´ıas an o de mi como de mis es udios, ni e imaginas
lo mucho que e ag adezco que me hayas acompa˜nado en el inal de e apa, simplemen e
g acias Lidia.
´
Indice Gene al
´
Indice de Figu as XIII
´
Indice de Tablas XV
´
Indice de Con igu aciones XVII
Lis a de Ac ´
onimos XXI
Abs ac XXIII
Resumen XXV
1. In oducci´
on 1
1.1. Mo i aci´on .................................... 1
1.2. Con ex o ..................................... 2
1.3. Obje o de la In es igaci´on ............................ 2
1.4. Plan de T abajo ................................. 3
1.5. Es uc u a del T abajo .............................. 6
2. Ma co Concep ual 7
2.1. His o ia de la In eligencia A i icial ....................... 7
2.2. T´ecnicas U ilizadas en In eligencia A i icial .................. 9
2.2.1. Ap endizaje Au om´a ico ......................... 10
2.2.2. Ap endizaje P o undo .......................... 13
2.2.3. Ap endizaje Po T ans e encia ..................... 14
2.3. Visi´on A i icial .................................. 15
ix
x i ´
INDICE DE TABLAS
5.14. Resul ados usando el modelo SSD con Incep ion en ´ıdeos y s eaming . . . 63
5.15. P ecisi´on media usando SSD con ResNe .................... 65
5.16. P ecisi´on media a dis in as dis ancias usando SSD con ResNe ....... 65
5.17. Exhaus i idad media usando SSD con ResNe ................. 65
5.18. Exhaus i idad media en dis in as dis ancias usando SSD con ResNe . . . . 65
5.19. Resul ados m´as espec´ı icos usando SSD con ResNe .............. 66
5.20. Resul ados usando el modelo SSD con ResNe en ´ıdeos y s eaming . . . . 66
5.21. P ecisi´on media usando Fas e R-CNN con Incep ion ............. 68
5.22. P ecisi´on media en dis in as dis ancias usando R-CNN con Incep ion . . . . 68
5.23. Exhaus i idad media usando Fas e R-CNN con Incep ion .......... 69
5.24. Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
Incep ion ..................................... 69
5.25. Resul ados m´as espec´ı icos usando Fas e R-CNN con Incep ion ....... 69
5.26. Resul ados usando el modelo Fas e R-CNN con Incep ion en ´ıdeos y
s eaming ..................................... 70
5.27. P ecisi´on media usando Fas e R-CNN con ResNe .............. 71
5.28. P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con ResNe . 71
5.29. Exhaus i idad media usando Fas e R-CNN con ResNe ........... 72
5.30. Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
ResNe ....................................... 72
5.31. Resul ados m´as espec´ı icos usando Fas e R-CNN con ResNe ........ 72
5.32. Resul ados usando el modelo Fas e -RCNN con ResNe en ´ıdeos y s eaming 73
5.33. P ecisi´on media usando Fas e R-CNN con Incep ion-ResNe ........ 74
5.34. P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe ................................. 74
5.35. Exhaus i idad media usando Fas e R-CNN con Incep ion-ResNe ..... 75
5.36. Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe ................................. 75
5.37. Resul ados m´as espec´ı icos usando Fas e R-CNN con Incep ion-ResNe . . 75
5.38. Resul ados usando el modelo Fas e R-CNN con Incep ion-ResNe en ´ıdeos
ys eaming .................................... 76
´
INDICE DE TABLAS x ii
8.1. Table o miles ones ollowed by he eam ollowed by hei iden i ie s . . . . 96
´
Indice de Con igu aciones
4.1. Con igu aci´on enida en cuen a en Model ................... 44
4.2. Con igu aci´on enida en cuen a pa a el en enamien o ............ 45
4.3. Con igu aci´on enida en cuen a pa a la alidaci´on ............... 46
xix
Lis a de Ac ´onimos
AFEW AFEW 6.0
AI A i icial In elligence
ALSTM Associa ion Long Sho Te m Memo y
ANN A i icial Neu al Ne wo k
C3D 3D Con olu ional Neu al Ne wo ks
CB Celeb i y-1000
CNN Con olu ional Neu al Ne wo ks
CSV Comma-Sepa a ed Values
CV Compu e Vision
DL Deep Lea ning
FER FER-2013
FPS F ames Pe Second
IOU In e sec ion o e Union
LFW Labeled Faces in he Wild
LSTM Long Sho Te m Memo y
xxi
xxii Lis a de Ac ´
onimos
mAP Mean A e age P ecision
ML Machine Lea ning
NAN Neu al Agg ega ion Ne wo k
RL Rein o cemen Lea ning
RNN Recu en Neu al Ne wo ks
SL Supe ised Lea ning
SSD Single Sho De ec o
SSH Secu e Shell
SVM Suppo Vec o Machine
TL T ans e Lea ning
UL Unsupe ised Lea ning
URL Uni o m Resou ce Loca o
XML eX ensible Ma kup Language
YF YouTube Faces
YO YouTube-Objec
Abs ac
Today, neu al ne wo ks a e a undamen al pilla in he de elopmen o in elligen
applica ions. Howe e , his ield is s ill in a phase o expansion and many ad ances a e
being made e e y day. A i icial in elligence is esponsible o c ea ing au onomous sys ems
and o au oma ing asks ha equi e a g ea in es men o ime and e o o be ca ied ou
by human beings, such as he iden i ica ion o objec s in bo h images and ideos. On he
o he hand, digi al o ensic analysis has unde gone a conside able ad ance in ecen yea s
hanks o he con inuous echnological e olu ion ha is cu en ly aking place. I a i icial
in elligence and o ensic analysis a e b ough oge he , his wo k can be conside ably
imp o ed, hus opening he doo o u u e ad ances ha will gi e way o unc ionali ies
ha a e s ill unknown.
This wo k is ocused on ying o c ea e op imal sys ems specialized in inding aces
in ideos wi h e y un a o able condi ions, in o de o ind c iminal beha io quickly and
e icien ly, hus acili a ing he wo k o o ensic analysis and hus ge id o he need o
analyze he ideos manually.
Fo his pu pose, ex ensi e esea ch has been ca ied ou bo h in he concep s ha
encompass he ield o acial de ec ion, as well as in p e ious wo k ela ed o his opic, in
o de o unde s and in dep h which a e he cu en echniques in use ha could se e o
his wo k.
A e ca ying ou ex ensi e expe imen a ion by es ing six di e en models based on
deep lea ning, he conclusion has been eached ha wo models should be p oposed: one
specialized in he de ec ion o ideos in p emises capable o in e ing wi h an accu acy o
74.83 %, and ano he adap ed o eal ime ope a ion wi h which an accu acy o 74.59 %
is achie ed.
Keywo ds: Fo ensics, Iden i ica ion, De ec ion, Video, Neu al Ne wo ks, A i icial
In elligence, Faces, Deep Lea ning
xxiii
Resumen
Hoy en d´ıa, las edes neu onales cons i uyen un pila undamen al en el desa ollo de
aplicaciones in eligen es. No obs an e, dicho campo se encuen a a´un en ase de expansi´on
y son muchos los a ances que se consiguen dia iamen e. La in eligencia a i icial es la
esponsable de c ea sis emas au ´onomos y de au oma iza a eas que suponen una g an
in e si´on de iempo y es ue zo de se ealizadas po se es humanos, como la iden i icaci´on
de obje os an o en im´agenes como en ´ıdeos. Po o o lado, el an´alisis o ense digi al
ha su ido un a ance conside able en los ´ul imos a˜nos g acias a la e oluci´on ecnol´ogica
con inua que se es ´a i iendo ac ualmen e. Si se jun an la in eligencia a i icial y el an´alisis
o ense, se puede mejo a conside ablemen e dicha labo , y pe mi i as´ı ab i las pue as
a u u os a ances que den paso a uncionalidades que a´un es ´an po conoce .
Es e abajo se cen a en in en a c ea sis emas ´op imos especializados en
encon a os os en ´ıdeos con condiciones muy des a o ables, con el in de encon a
compo amien os delic i os de mane a ´apida y e icien e, acili ando as´ı la labo del an´alisis
o ense y desp ende se as´ı de la necesidad de analiza los ´ıdeos manualmen e.
Pa a ello, se ha ealizado una ex ensa in es igaci´on an o en los concep os que engloban
el campo de la de ecci´on acial, como en abajos p e ios elacionados con es e ema, pa a
comp ende en p o undidad cu´ales son las ´ecnicas ac uales en uso que pod ´ıan se i pa a
es e abajo.
T as ealiza una amplia expe imen aci´on p obando con seis modelos dis in os basados
en ap endizaje p o undo, se ha llegado a la conclusi´on de p opone dos modelos: uno
especializado en la de ecci´on de ´ıdeos en local capaz de in e i con una exac i ud del
74,83 %, y o o adap ado pa a su uncionamien o en iempo eal con el que se alcanza
una exac i ud del 74,59 %.
Palab as Cla e: An´alisis Fo ense, Iden i icaci´on, De ecci´on, V´ıdeo, Redes Neu onales,
In eligencia A i icial, Ros os, Deep Lea ning.
xx
6Cap
´
ı ulo 1. In oducci´
on
1.5. Es uc u a del T abajo
El es o del abajo es ´a o ganizado en 9 cap´ı ulos con la es uc u a que se comen a a
con inuaci´on:
El Cap´ı ulo 2explica concep os b´asicos an o las bases de la AI como la de ecci´on de
obje os. Conc e amen e, es e cap´ı ulo cen a ambos campos de es udio en el ´e mino que
concie ne a es e abajo, que es la de ecci´on de os os en im´agenes digi ales y ´ıdeos.
Po an o, en es e cap´ı ulo se habla an o de la his o ia que en uel e a la AI como de las
´ecnicas u ilizadas y los dis in os modelos de Redes Neu onales.
El Cap´ı ulo 3comienza mos ando un es ado del a e en el que se p esen an dis in as
´ecnicas e in es igaciones ealizadas sob e el campo de la iden i icaci´on de os os
en im´agenes, as´ı como dis in as a qui ec u as y modelos p esen ados. Dichos abajos
ep esen an la si uaci´on en la que se encuen a ac ualmen e el campo de la de ecci´on de
os os en im´agenes y ´ıdeos. De cada a ´ıculo, se ex ae an o la idea y las ´ecnicas
u ilizadas pa a el desa ollo de es a, como el conjun o de en enamien o u ilizado y
las conclusiones a des aca en base a los esul ados ob enidos. Dichos esul ados se
almacenan en dis in as ablas pa a pode ob ene compa a i as en e los dis in os abajos.
Finalmen e se ealiza una pues a en com´un de los dis in os a ´ıculos pa a pode ex ae as´ı
conclusiones ace ca del es ado ac ual del obje o de es udio en es e abajo, la iden i icaci´on
de ca as en im´agenes y ´ıdeos digi ales.
El Cap´ı ulo 4p esen a las con ibuciones de es e abajo. As´ı pues, en p ime luga
se p esen a una ex ensa desc ipci´on de las ecnolog´ıas aplicadas pa a la c eaci´on de los
modelos que pos e io men e se pond ´an a p ueba en cap´ı ulos pos e io es. Tambi´en se
explica de alladamen e los dis in os conjun os de im´agenes u ilizados en el en enamien o
de los modelos y las dis in as m´e icas u ilizadas en las e aluaciones de la ase de
expe imen aci´on.
El Cap´ı ulo 5desc ibe los expe imen os ealizados pa a e alua la e ec i idad de los
modelos p opues os a pa i de las ecnolog´ıas explicadas en el Cap´ı ulo 4y p esen a
los esul ados ob enidos, as´ı como la a iaci´on de dichos esul ados en unci´on de la
op imizaci´on de la con igu aci´on inicial.
El Cap´ı ulo 6 ela a las apo aciones pe sonales de cada uno de los in eg an es del
equipo al desa ollo de es e abajo.
El Cap´ı ulo 7mues a las p incipales conclusiones de es e abajo, las l´ıneas u u as
de in es igaci´on.
Po ´ul imo, los Cap´ı ulos 8y9son las aducciones al ingl´es de la In oducci´on y de
las Conclusiones.
Cap´ı ulo 2
Ma co Concep ual
En es e cap´ı ulo se p e ende explica los concep os, endencias y las di e en es ´ecnicas
e e en es a la AI y la de ecci´on de obje os, cen ´andonos sob e odo en el obje i o de
de ecci´on de os os en im´agenes digi ales y ´ıdeos. Pa a ello, se explica ´a de d´onde su ge
la AI y los hi os que se han conseguido p e ios a es e abajo, las ´ecnicas m´as usadas a
d´ıa de hoy en el campo de la AI, las bases sob e las que se cimien a el DL y las Redes
Neu onales y, po ´ul imo, c´omo se ha aplicado odo es e conocimien o pa a c ea de ec o es
capaces de encon a un obje o, o os o en es e caso, de mane a e icien e.
2.1. His o ia de la In eligencia A i icial
¿Se pueden c ea m´aquinas in eligen es? Du an e siglos, los g andes pensado es han
u ilizado es a p egun a como uen e de mo i aci´on pa a pe mi i el a ance de la AI. Con
el iempo, el desa ollo de la AI ha dado luga a que es a cues i´on se empiece a elaciona
cada ez m´as con el uncionamien o del ce eb o, has a al pun o que, ac ualmen e, la
in es igaci´on pasa po conside a el ce eb o como un sis ema compu acional y la AI como
un modelo que se enca ga de emula el uncionamien o de es e. Debido a es o, se pod ´ıa
deci que el in ´ul imo de la AI es consegui que la m´aquina enga una in eligencia simila
a la humana, a ´andose as´ı de uno de los obje i os m´as ambiciosos que se han podido
plan ea en la ciencia.
Pese a que en los a˜nos 40 se publica on algunos abajos, la AI no goz´o de una g an
epe cusi´on has a el a˜no 1950, con la di usi´on de un abajo i mado po el ma em´a ico
b i ´anico Alan Tu ing.
Alan Tu ing “conside ado pad e de la in o m´a ica y p ecu so de la AI” dio sus p ime os
pasos en es a ama del conocimien o dise˜nando un p og ama que pe mi ´ıa a los usua ios
juga al ajed ez. A˜nos despu´es, esc ibi´o un a ´ıculo pa a la e is a Mind [Tu 50], en el
que de endi´o el compo amien o in eligen e que pod ´ıan llega a ene las maquinas; y
p opuso un es , aho a conocido como el Tes de Tu ing, que pe mi ´ıa de e mina si se
pod´ıa conside a in eligen e a un compu ado o no. A d´ıa de hoy, se piensa que es e es
no es muy iable y se han p opues o o as e siones que lo complemen an.
7
8Cap
´
ı ulo 2. Ma co Concep ual
A su ez, en los ´
Angeles, Belmon Fa ley y Wesley Cla k ealiza on en la Wes e n Join
Compu e Con e ence una p esen aci´on de cua o abajos: es de ellos a aban sob e
econocimien o de pa ones y el es an e sob e m´aquinas pa a juga al ajed ez. En uno de
ellos, se pod´ıa e c´omo se es aba buscando la mane a de elaciona el ce eb o con una
AI, y desc ibie on la mane a de econoce pa ones median e el ajus e de los pesos de una
ed neu onal a i icial.
En e los a˜nos 1955 y 1956, Allen Newell y He be Simon, di undie on un p og ama
conocido po el nomb e Logic Theo is , que pe mi ´ıa demos a eo emas de l´ogica
p oposicional que es aban con enidos en el lib o P incipia Ma hema ica [WR10]. A pa i
de aqu´ı, la in es igaci´on en la AI comenz´o a aumen a y se consiguie on dis in os a ances.
En los a˜nos 60, en el S an o d Resea ch Ins i u e, Duda y Ha c ea on con el lenguaje
Fo an el p ime sis ema basado en edes neu onales que e a capaz de ap ende . M´as
a de, se comenza on a da los p ime os pasos en cuan o al p ocesamien o del lenguaje
na u al se e ie e. [LdMM17]
Es impo an e des aca que, has a 1980, no se ol ie on a e g andes a ances en es e
campo. Aunque los o denado es e an cada ez m´as po en es y econ´omicamen e menos
cos osos, a´un se es aba lejos de consegui un compo amien o e dade amen e in eligen e
po pa e de las m´aquinas. Es a si uaci´on se ag a ´o debido a una escasa inanciaci´on po
pa e de los gobie nos y al desa ollo de unos algo i mos que no e an muy e icien es en el
´ambi o de la AI.
A pa i de los a˜nos 90, empeza on a su gi di e sas apo aciones de alo pa a
posibili a el p og eso en es e ´a ea. Conc e amen e, un hi o muy sonado es el que se
consigui´o en 1997, cuando una AI de IBM consigui´o gana al campe´on del mundo de
ajed ez [FH99]. A˜nos m´as a de, se consigui´o c ea un obo que in e p e aba emociones
y, a su ez, e a capaz de exp esa las [B e20]. O o pun o de in lexi´on se p odujo en 2006
[HOT06], cuando G. E. Hin on, S. Osinde o, y Yee-Whye Teh die on a conoce median e
una publicaci´on lo que m´as a de se conoci´o como Ap endizaje P o undo. En ´e minos
gene ales, el abajo explicaba a qui ec u as de edes neu onales con m´ul iples capas, que
pe mi ´ıan que es as ap endie an de una o ma m´as aguda.
A es os diez ´ul imos a˜nos se los conoce como la ´epoca do ada de la AI, debido a los
g andes a ances que se es ´an p oduciendo, impulsados ambi´en po una mejo a de los
algo i mos y una mayo capacidad de c´ompu o. En 2012, Google se enca g´o de c ea una
ed neu onal a i icial que con aba con 16.000 p ocesado es a la que le suminis a on 10
millones de minia u as de ´ıdeos de YouTube al aza [Cla20]. Como esul ado, el sis ema
ap endi´o a econoce os os con una p ecisi´on del 81,7 %, pa es del cue po humano con
una p ecisi´on de 76,7 %, e iden i icaba ga os el 74,8 % de las eces. Po o o lado, en 2014,
un bo supe ´o po p ime a ez el amoso Tes de Tu ing. Es e sis ema consigui´o enga˜na a
30 de los 150 jueces a los que ue some ido el p og ama du an e el es , haci´endose pasa
po un ni˜no de 13 a˜nos y man eniendo una con e saci´on con ellos.
En la ac ualidad, la AI se es ´a iendo muy a o ecida po el uso del Big Da a, g acias
al cual se ecogen una can idad inmensa de da os y se p ocesan pa a pode ex ae
conocimien o pos e io men e de ellos. [Sch97]. El bene icio de es o es que se es ´a empezando
a aplica a di e sos campos, como pueden se la medicina, ob´o ica, segu idad, anspo e,
comunicaci´on, inanzas, sociedad, e c. Adem´as, es e iden e que g andes emp esas como
Amazon, Google, Apple, IBM y Mic oso , es ´an ealizando una g an in e si´on y gene ando
un alioso desa ollo en es e ´a ea, que acaba ´a dando luga a un mayo p og eso con el
paso de los a˜nos.
2.2. T´
ecnicas U ilizadas en In eligencia A i icial 9
2.2. T´ecnicas U ilizadas en In eligencia A i icial
A lo la go de los ´ul imos 20 a˜nos, los in es igado es se han cen ado mayo men e en
di e en es concep os pa a pode de ini el ´e mino de AI. Es o ha d´ıa de hoy ha cambiado.
Aho a se quie e que las m´aquinas se compo en de mane a acional median e la capacidad
de ac ua , sen i , pensa y azona , po lo que se iene que en oca la AI de dis in as
o mas.
El lado posi i o de es o eside en que, odas es as o mas de en ende lo que es una AI,
ienen algo en com´un: se basan en encon a eo ´ıas y me odolog´ıas que puedan ayuda a
las m´aquinas a en ende el mundo y eacciona a las si uaciones de la misma o ma que lo
ha ´ıa un humano. Es as eo ´ıas se pueden clasi ica en dis in os ma cos de abajo seg´un
el en oque y el p oblema que esuel an en el mundo eal. Es a clasi icaci´on se mues a en
la Figu a 2.1.
Figu a 2.1: P incipales aplicaciones de la In eligencia A i icial
Ap endizaje Au om´
a ico: Posiblemen e es a sea la disciplina m´as usada
ac ualmen e pa a c ea compo amien os in eligen es. El obje i o es dise˜na y
desa olla modelos que ap endan de da os ya exis en es y ealiza p edicciones con
nue os da os. La mayo es icci´on de es os algo i mos es que es ´an p o undamen e
10 Cap
´
ı ulo 2. Ma co Concep ual
limi ados po los da os que se le suminis en. De es a o ma, si enemos un conjun o
de da os peque˜no, el modelo esul an e se ´a bas an e imp eciso ambi´en. Es e campo
iene dis in as e ien es a su ez, como los que se pueden e en la Figu a 2.1.
Adem´as, cuen a con algunas ´ecnicas como el Ap endizaje po T ans e encia (del
ingl´es, T ans e Lea ning (TL)), que nos con ie e la habilidad de modi ica modelos
que ya han ap endido pa a ajus a lo a nues as necesidades.
Sis emas Expe os: Son sis emas que oman decisiones o p opo cionan consejos
usando ´ecnicas de AI. En gene al, se u iliza en campos como las inanzas, ma ke ing,
medicina, e c. y ex aen el conocimien o de una bases de da os pa a da los consejos
p e iamen e dicho.
P ocesamien o del Lenguaje Na u al: Es e campo se enca ga de p ocesa y
en ende ex os. Gene almen e, es e ipo de ´ecnicas se u ilizan en mo o es de
b´usqueda, de mane a que al usua io solo se le mues an los mejo es esul ados
posibles en elaci´on con su b´usqueda ealizada.
Plani icaci´
on: Es e campo se ocupa de b inda el m´aximo endimien o con unos
cos os m´ınimos en una plani icaci´on. Comienzan con unos de e minados hechos y
una especi icaci´on del obje i o a consegui y gene an el plan m´as ´op imo pa a log a
los esul ados.
Rob´
o ica: En la ob´o ica se combinan a ios concep os de la AI, ya que los obo s
ienen dis in os senso es que, dependiendo de la si uaci´on, les pe mi en ac ua de
una mane a u o a. Son capaces de adap a se a nue as si uaciones pudiendo e
obje os, medi empe a u as, mo imien os, e c.
Visi´
on A i icial: Como su p opio nomb e indica, hay sis emas que acili an la
a ea de o o ga la capacidad de isi´on a un compu ado , median e el a amien o
de im´agenes y ´ıdeos. Es os algo i mos comp enden el con enido que se le suminis a
y ex aen in o maci´on de ello. Ac ualmen e, la in es igaci´on se cen a en aplica lo a
conducci´on au ´onoma y la ealidad aumen ada en e o os.
Reconocimien o del Habla: Es os sis emas se enca gan de o´ı y econoce el
habla. D´ıa a d´ıa, se u ilizan com´unmen e en asis en es pe sonales que son capaces
de en ende y ealiza acciones espec´ı icas en base a lo que se les ha pedido.
Una ez se ha en endido cu´ales son las dis in as aplicaciones exis en es en la AI, se
a a p o undiza a´un m´as en aquellas ´ecnicas que son necesa ias pa a el obje i o de la
de ecci´on de os os en ´ıdeos.
2.2.1. Ap endizaje Au om´a ico
Como se explica en [SF18], el ML es el campo de es udio que es ´a ca ac e izado po se un
so wa e que ap ende de expe iencias p e ias. En es e ipo de p og amas lo que se in en a
consegui que es os algo i mos ap endan pa ones que se hallan en los da os p e ios y
p oduzcan unos esul ados in eligen es pa a da os nue os de en ada. O o nomb e po
el que se conoce al ML es Ap endizaje Induc i o debido a que el c´odigo a a de in e i
es uc u as a a ´es de los da os.
2.2. T´
ecnicas U ilizadas en In eligencia A i icial 11
En ocasiones, modela el compo amien o que iene segui un de e minado p og ama
puede se una a ea bas an e compleja, debido a que no es posible hace lo median e una
secuencia de pasos cla amen e de inida y en el algo i mo es ´a in oluc ado alg´un ipo de
pa ´on que deno a o equie e cie a in eligencia. Pa a es os casos, el ML puede se la
he amien a co ec a a u iliza .
Lo que es e ipo de algo i mos p opo ciona es un conjun o de he amien as pa a esc ibi
c´odigo sin de ini odos y cada uno de los de alles del algo i mo. El p og amado se enca ga
de ajus a algunos pa ´ame os y el es o se in ie en median e un p oceso de ap endizaje
llamado en enamien o. Es e p oceso pe mi e encon a au om´a icamen e los pa ´ame os
que mejo de inen nues o modelo. Gene almen e, el endimien o del modelo se puede
mejo a median e la disponibilidad de una mayo can idad de ejemplos o da os que deben
suminis a se como en ada del sis ema en la ase de en enamien o.
Se a a supone el caso de que se es ´a a ando de cocina una ece a. Si nunca an es se
ha cocinado nada, puede lle a d´ıas descub i cu´al es la mejo combinaci´on de ing edien es
pa a hace que el pla o sea de buen gus o. Es es a c eaci´on de ece as la que da la capacidad
de eco da ´apidamen e c´omo hace nues o pla o. Del mismo modo, el ML compa e es a
idea. Como mues a la Figu a 2.2, se puede deci que un algo i mo de ML se puede desc ibi
en dos e apas: en enamien o yp edicci´on.
Figu a 2.2: Fases de un algo i mo de Ap endizaje Au om´a ico
En la ase de en enamien o, el obje i o que se pe sigue es desc ibi los da os median e
el llamado ec o de ca ac e ´ıs icas, capaz de ep esen a obje os del mundo eal en una
lis a de a ibu os. Es os ec o es son los que el algo i mo de ap endizaje u iliza pa a
ealiza su en enamien o y ob ene nues o modelo. Es a ase es la que consume la mayo
pa e del iempo, pudiendo du a ho as, d´ıas o incluso semanas en comple a se.
12 Cap
´
ı ulo 2. Ma co Concep ual
Po o o lado, se iene la ase de p edicci´on en la que el modelo p e iamen e c eado
ecibe un ec o de ca ac e ´ıs icas nue o pa a ´el, es deci , un da o con el que no ha sido
en enado. Es a ase lle a mucho menos iempo que la de ap endizaje —pudiendo se
incluso en iempo eal— y se enca ga inalmen e de hace la p edicci´on deseada.
Como es de espe a , el ML cuen a con dis in os ipos de algo i mos de ap endizaje que
pueden clasi ica se a menudo en a ios g upos. Los m´as impo an es son los siguien es:
Ap endizaje Supe isado,Ap endizaje No Supe isado,Ap endizaje Po Re ue zo y
Ap endizaje P o undo.
Debido a la impo ancia de es e ´ul imo en la consecuci´on de nues o obje i o, se
dedica ´a m´as adelan e un apa ado en e o donde se explica ´a con m´as de alle.
Ap endizaje Supe isado: El Ap endizaje Supe isado (del ingl´es Supe ised
Lea ning (SL)), se e ie e a aquellos algo i mos que u ilizan da os que deben
se e ique ados p e iamen e po un humano an es de pode in oduci se en el
algo i mo. El obje i o que se pe sigue es pode e ique a un nue o da o bas´andose
en las ca ac e ´ıs icas encon adas en los da os de en enamien o. La Figu a 2.2
p ecisamen e mues a es os ipos de algo i mos. Suponiendo que se quie e p edeci
los ing esos de una pe sona en base a su edad, localizaci´on, educaci´on, e c. Pa a ello,
se end ´ıa que ene un conjun o de da os con es a in o maci´on de las pe sonas y
e ique a a cada una de ellas con los ing esos que ecibe. De es a mane a, se le di ´ıa
al algo i mo qu´e pa ´ame os co esponden con qu´e ing esos y el algo i mo ap ende ´ıa
a ealiza ese mapeado. Las p incipales ´ecnicas que se u ilizan en ML son las
siguien es: Reg esi´on Lineal,Reg esi´on Log´ıs ica,K-Vecinos M´as Ce canos,´
A boles
de Decisi´on,Redes Neu onales A i iciales yM´aquinas de Vec o es de Sopo e
Ap endizaje No Supe isado: El Ap endizaje No Supe isado (del ingl´es
Unsupe ised Lea ning (UL)), se e ie e a aquellos algo i mos que no necesi an da os
e ique ados pa a pode c ea un modelo de ap endizaje. En cie a mane a, es jus o
lo con a io a lo que hemos comen ado en el apa ado p e io. Debido a que no
hay e ique as, se deben ex ae pa ones di ec amen e de los da os. En es e caso,
si suponemos que exis e una aplicaci´on que se ap o echa de la a iedad de usua ios
que la u ilicen y se quie e clasi ica a es os pa a sabe con qu´e ipo de pe sonas se
cuen an. Aqu´ı no se sab ´ıa exac amen e qu´e c i e io segui pa a pode sepa a las.
Po lo an o, en es a si uaci´on en a ´ıa en juego el UL pa a clasi ica de mane a
´op ima a es as pe sonas en dis in os g upos. Las p incipales ´ecnicas que se u ilizan
en UL son las siguien es: Ag upaci´on yReducci´on de la Dimensi´on
Ap endizaje Po Re ue zo: El Ap endizaje Po Re ue zo (del ingl´es
Rein o cemen Lea ning (RL)), se e ie e a aquellos algo i mos que, a di e encia del
SL y del UL que es ´an elacionados con el e ique ado, en enan con la in o maci´on
que eciben del en o no cuando es e eacciona a cie as acciones. El obje i o es
ap ende qu´e combinaci´on de acciones p oduce los esul ados m´as a o ables.
Es e ipo de algo i mos se suelen p incipalmen e pa a c ea la AI de ideojuegos o
en el campo de la ob´o ica.
2.2. T´
ecnicas U ilizadas en In eligencia A i icial 13
2.2.2. Ap endizaje P o undo
El DL es el subcampo del ML que pe enece a la amilia de algo i mos de Redes Neu onales
A i iciales y p o undiza en ellos an o uncional como es uc u almen e. Es as se inspi an
en el uncionamien o del ce eb o humano y, como al, ienen unos nodos conec ados unos
a o os y di ididos en capas, los cuales se pasan in o maci´on en e s´ı de mane a que, cada
capa de la ed, se enca ga de ap ende unas de e minadas ca ac e ´ıs icas de la en ada
en cues i´on. Debido a la ele ancia del uncionamien o de es as edes en es e abajo, se
explica ´an en secciones pos e io es con m´as de alle.
Como se puede e en la Figu a 2.3, a di e encia de los algo i mos de ML donde la
ex acci´on de ca ac e ´ıs icas de los da os la ealiza expl´ıci amen e un humano, en DL
pasa a se esponsabilidad de la a qui ec u a del p opio algo i mo. Como consecuencia, la
complejidad de la a qui ec u a aumen a conside ablemen e dado que es necesa io pode
ene m´as capas que p ocesen esa in o maci´on.
Figu a 2.3: Di e encia en e algo i mo de Ap endizaje Au om´a ico y Ap endizaje P o undo
Pese a que los algo i mos de DL consiguen mejo es esul ados que un humano en
la mayo ´ıa de los casos, no siemp e es necesa ia su u ilizaci´on; es o depende ´a de la
complejidad del p oblema que es emos a ando de esol e . Al a a se de algo i mos
mucho m´as complejos que los ela i os al ML, la capacidad compu acional que pueden
llega a eque i puede se inmensa en compa aci´on con es os y, po an o, es de ex ema
ele ancia sabe en qu´e momen o enemos que u iliza ML yDL. Dominando es o, se
pod ´ıan educi cos es an o en iempo de ejecuci´on como econ´omicos, en caso de se
necesa io u iliza pla a o mas de compu aci´on en la nube pa a ello.
En el caso de es e abajo, si se quisie an ex ae las ca ac e ´ıs icas que de inan una
imagen en conc e o de o ma manual, se ´ıa una a ea demasiado di icul osa, po lo que la
u ilizaci´on de DL se uel e casi necesa ia. Po an o, median e DL no solo se de ec a ´an
los os os en una imagen dada, sino que adem´as se ha ´a sin necesidad de deci le a la ed
neu onal qu´e ca ac e ´ıs icas de inen un os o.
14 Cap
´
ı ulo 2. Ma co Concep ual
2.2.3. Ap endizaje Po T ans e encia
Como se expone en [B o20b], el TL es una ´ecnica usada en ML en la que un modelo que
ya ha sido desa ollado y en enado se eu iliza como base pa a c ea o o modelo que
ealice una a ea simila .
Com´unmen e, es e m´e odo se u iliza en DL eu ilizando modelos p een enados pa a
a eas de Visi´on A i icial y P ocesamien o del Lenguaje Na u al debido a la masi a
can idad de da os, ecu sos compu acionales y iempo que necesi an los modelos de DL
pa a p oduci un algo i mo que uncione e dade amen e bien.
Pa a pode eu iliza el modelo sin pe de el g ado de ap endizaje que han alcanzado
las capas en su ´ul imo en enamien o, se debe en ena ´unicamen e la capa de salida, la
cu´al debe emos adap a la a nues as necesidades seg´un el ipo de a ea que que amos
ealiza .
Du an e el p oceso pa a ealiza el TL, puede que se u ilice odo o pa e del modelo
p een enado dependiendo de la ´ecnica que se u ilice y el endimien o que se quie a llega
a alcanza . La ´ecnica llamada A inamien o (del ingl´es, Fine-Tune) es m´as complicada de
ealiza y con ella, no solo se eemplaza la ´ul ima capa, sino que ambi´en se een enan
algunas de las capas an e io es de mane a selec i a. [Sa 20]
El TL, po an o, es una op imizaci´on que puede pe mi i aho a iempo y ob ene
mejo es esul ados, aunque no iene po qu´e se as´ı. Has a que no se desa olle y e al´ue el
modelo c eado no se pod ´a sabe si se ha desa ollado un bene icio o no, en cuan o a usa
TL se e ie e.
Como se puede e en la Figu a 2.4, hay es o mas po las que se puede a e igua si
el modelo ha mejo ado u ilizando TL.
Figu a 2.4: Signos de mejo a usando Ap endizaje Po T ans e encia
La p ime a es comp obando si el endimien o inicial con el que se ha comenzado a
en ena el algo i mo es mayo de lo que se ´ıa de o a o ma. La segunda opci´on que exis e
se ´ıa comp oba su pendien e. Cuan o m´as p onunciada sea la asa de mejo a du an e el
en enamien o, mejo se ´a el modelo. Po ´ul imo, se pod ´ıa comp oba que la con e gencia
inal del modelo en enado es supe io en cuan o a endimien o se e ie e.
2.3. Visi´
on A i icial 15
2.3. Visi´on A i icial
La Visi´on A i icial (del ingles Compu e Vision (CV)) es el campo de la AI que o o ga
la p opiedades de la isi´on humana a un compu ado , pudiendo a a se de un d on,
sma phone,scanne , e c. con a ias c´ama as in eg adas. El compu ado en cues i´on debe
se el esponsable de p ocesa y ex ae in o maci´on de las im´agenes digi ales que gene e
dicha c´ama a. [Sha18]
Exis en di e sas ´ecnicas de DL que pe mi en pode soluciona los p oblemas que
su gen a menudo en el campo de la CV:
Clasi icaci´
on: Es el p oceso median e el cual se e ique a una imagen eniendo
en cuen a su con enido isual, es deci , se a a de a e igua cu´al es el concep o
que apa ece en ella. Po ejemplo, un algo i mo de clasi icaci´on de im´agenes pod ´ıa
de e mina si apa ece una igu a humana, un animal, una ca a, e c.
De ecci´
on y Segmen aci´
on: Se denomina De ecci´on a la a ea de encon a un
de e minado obje o o igu a en una imagen y enma ca lo con una caja delimi ado a
con su co espondien e e ique a. Sin emba go, la Segmen aci´on es di e en e. Es a se
enca ga de hace una clasi icaci´on po p´ıxeles, bo deando la igu a de aquello que
que emos encon a , en luga de enma ca lo con una caja delimi ado a. Es a ´ecnica
se suele u iliza sob e odo en el p ocesamien o de im´agenes m´edicas o im´agenes
ob enidas de sa ´eli es.
Ap endizaje Po Simili ud: En es a ´ecnica se busca ap ende de dos im´agenes
que son simila es d´andole impo ancia al signi icado sem´an ico que eside en e ellas
dos. Son algo i mos que se suelen u iliza a menudo en la iden i icaci´on acial.
Sub i ulado de Im´
agenes: Como su p opio nomb e indica, se a a del p oceso
de desc ibi la a ea que es ´a sucediendo en la imagen.
Modelos Gene a i os: Son aquellos modelos enca gados de gene a o as im´agenes
eniendo o as p e iamen e como e e encia.
2.4. Modelo Neu onal
A lo la go de los a˜nos, el DL se ha is o muy in luenciado po el uncionamien o de nues o
ce eb o y se ha inspi ado en es e pa a c ea modelos compu acionales y ma em´a icos que
pe mi an simula su compo amien o. Pa a ello, es necesa ia la c eaci´on de un modelo que
ep oduzca las neu onas biol´ogicas y, de es a mane a, se pe mi a el paso de in o maci´on
de unas a o as. El modelo que se u iliza a d´ıa de hoy es el conocido como Pe cep ´on o
Neu ona A i icial.
Como se puede e en la Figu a 2.5, la neu ona a i icial unciona de al mane a que
ecibe un ec o de en ada X, el cual se u iliza pa a ealiza una suma ponde ada con
los pesos Wasignados en e las en adas y el cue po de la neu ona. Es os pesos son una
ep esen aci´on de la impo ancia dada a cada en ada en conc e o y su alo puede cambia
du an e la ase de en enamien o.
22 Cap
´
ı ulo 2. Ma co Concep ual
2.6.1. P oceso de En enamien o
Como deja cla o el au o Jo di To es [To 18], el p oceso de en enamien o queda ma cado
po un cons an e “i y eni ” po las capas de la ANN. El hecho de i hacia delan e se
conoce como o wa d p opaga ion, mien as que su opues o es com´unmen e conocido po
backp opaga ion.
El p ime paso se p oduce cuando los da os de en enamien o se exponen a oda la ed
y es os la c uzan pa a acaba calculando las p edicciones. Du an e es a p opagaci´on, cada
neu ona aplica su unci´on de ac i aci´on al da o que eciben y se lo pasan a la neu ona
siguien e. Una ez se ha eco ido, se usa la unci´on de loss o e o , pa a es ima y medi
c´omo de bueno o malo ha sido nues o esul ado en compa aci´on con el que debe ´ıa da ,
el cual queda es ablecido po la e ique a que se o ece con cada da o de en enamien o.
El segundo paso se ealiza cuando ya enemos calculado el e o . Es e se p opaga hacia
a ´as, pa iendo desde la capa de salida y pasando po odas y cada una de las neu onas
que iene la ed y que han con ibuido a las p edicciones ealizadas. No obs an e, cada
neu ona solo ecibe un e o p opo cional a la con ibuci´on que han ealizado pa a p oduci
la salida.
Es a ´ul ima p opagaci´on es la que pe mi e inalmen e ajus a odos los pesos exis en es
en las conexiones que unen las neu onas. El obje i o que se p e ende consegui de es a
o ma, es que el e o se ap oxime cada ez m´as a ce o pa a ealiza mejo es p edicciones
cada ez que se uel a a u iliza la ed.
Pa a minimiza el loss hay di e sas ´ecnicas, pe o la m´as conocida es el descenso de
g adien e. Es a se ocupa de u iliza la de i ada de la unci´on de e o pa a encon a el
m´ınimo global median e la a iaci´on de los pesos en peque˜nos inc emen os. En gene al,
es o se ealiza en unos lo es de da os llamados ba ches du an e una se ie de i e aciones
conocidas como epochs.
2.6.2. Sesgo y Va ianza
El sesgo y a ianza (del ingl´es, unde i ing yo e i ing espec i amen e) son dos
concep os con apues os que cons i uyen uno de los p oblemas undamen ales del ML,
ya que lidian con la op imizaci´on y la gene alizaci´on del modelo [F.18].
La op imizaci´on se ocupa de ajus a el modelo a los da os de en enamien o
p opo cionados, con el obje i o de consegui el mejo endimien o posible, mien as que
la gene alizaci´on hace e e encia a c´omo de bien o mal se ealiza la p edicci´on sob e da os
que nunca se han is o.
Un modelo de ML puede encon a se en dis in os du an e su en enamien o. Puede
halla se en un es ado de unde i ing, es deci , no ha podido ap ende de los da os
co ec amen e y a´un es incapaz de gene aliza de mane a adecuada. Po an o, es o indica
que puede op imiza se a´un m´as. Po o o lado, ambi´en puede encon a se en un es ado
de o e i ing, o dicho de o o modo, ha ap endido a ajus a an bien a los da os de
en enamien o que le esul a imposible gene aliza bien sob e da os nue os. Es o indica
que es ´a demasiado op imizado.
El obje i o es encon a el balance en e es os dos ex emos y, pa a ello, se pueden usa
la gene aci´on cu as de ap endizaje pa a diagnos ica su endimien o, las cuales mues an
c´omo ha ido a anzando el e o con los da os de en enamien o y alidaci´on.
2.6. En enamien o de las Redes Neu onales 23
Un modelo que su a sesgo, puede se iden i icado ´unicamen e po su cu a de
en enamien o. Se pod ´a de ec a si es a pe manece plana, sigue disminuyendo has a el
inal del en enamien o o ma ca un e o demasiado al o. En la Figu a 2.10, se mues an
algunos ejemplos [B o20a].
Figu a 2.10: Ejemplos de Cu as de Ap endizaje con Sesgo
Po el con a io, un modelo que su a a ianza, se debe iden i ica con las dos cu as:
an o la de en enamien o como la de alidaci´on. Es e es ado se ca ac e iza po ene una
cu a de en enamien o con bajo e o y con endencia a disminui con cada expe iencia,
y po cu a de alidaci´on que dec ece has a un pun o y m´as a de comienza a c ece .
La si uaci´on ideal que se busca eside en ene una cu a de en enamien o op imizada
en cos e y una de alidaci´on que se adap e a ella du an e odas las i e aciones.
En la Figu a 2.11 se pueden e unos ejemplos [B o20a].
Figu a 2.11: Ejemplo de Va ianza y de un Ap endizaje Ideal
Con el obje i o de ob ene el mejo endimien o y e i a las si uaciones ex emas que
se acaban de explica , se pueden ealiza una se ie de ´ecnicas que pe mi en abo da lo de
una mane a ap opiada. Po ello, se ci a ´an algunas de las m´as u ilizadas a d´ıa de hoy,
seg´un a ´ıculos cien ´ı icos publicados ecien emen e [Sil20].
24 Cap
´
ı ulo 2. Ma co Concep ual
Pa a soluciona el sesgo:
Inc emen a la complejidad del modelo.
Aumen a el n´ume o o ama˜no de pa ´ame os que es e u iliza.
En ena el modelo du an e un mayo iempo.
Pa a co egi la a ianza:
U iliza egula izaci´on, lo cual lle a al modelo a ene ecuaciones menos complejas.
P oba con el m´e odo de alidaci´on c uzada.
Pa a el en enamien o an es de que la cu a de alidaci´on comience a ascende .
U iliza la ´ecnica de d opou , seg´un la cual se igno an neu onas du an e el
en enamien o.
A˜nadi m´as da os de en enamien o.
2.7. De ecci´on Facial
Dos ´e minos que suelen con undi se muy a menudo son la de ecci´on acial y el
econocimien o acial. La de ecci´on acial es una ecnolog´ıa que o ma pa e de una m´as
gene al: la de ecci´on de obje os. Es a se enca ga de encon a obje os en ´ıdeos e im´agenes
digi ales y iene un cos e compu acional mucho mayo que aquellas que pe mi en clasi ica
obje os ´unicamen e, ya que no solo se p edice la clase a la que pe enece una de e minada
imagen, sino que adem´as se enca ga de se˜nala en qu´e coo denadas se encuen a dicha
p edicci´on. Sin emba go, el econocimien o acial es una ecnolog´ıa que, adem´as de ealiza
la a ea de de ecci´on, iden i ica qui´en es la pe sona que ha de ec ado.
Con el iempo, algunas ´ecnicas de CV se han uel o cada ez m´as udimen a ias y
se han is o sus i uidas po ML yANN que pe mi en ealiza la misma unci´on de una
mane a m´as e icien e y e icaz. A d´ıa de hoy, exis en di e sos m´e odos pa a ealiza es a
a ea y se di iden en el n´ume o de e apas en el que consiguen ealiza la de ecci´on. Po
ello, se ienen de ec o es de dos e apas yde ec o es de una e apa.
2.7.1. De ec o es de Dos E apas
Como queda expues o en [JZL+19], los de ec o es de dos e apas, ienen una al a p ecisi´on
de localizaci´on y de econocimien o de obje os. U ilizan una ANN llamada Region P oposal
Ne wo k pa a ealiza una b´usqueda de egiones de in e ´es que m´as a de deben pasa se
a una e apa de clasi icaci´on y delimi aci´on de las coo denadas que iden i ican el obje o.
2.7. De ecci´
on Facial 25
2.7.1.1. Red Neu onal Con olucional Basada en Regiones
La Red Neu onal Con olucional Basada en Regiones (del ingl´es, Region-Based
Con olu ional Neu al Ne wo k) conocida m´as com´unmen e po R-CNN, ue p opues a
po Ross Gi shick [GDDM14] como uno de los p ime os abajos en demos a que una
CNN pod ´ıa ele a el endimien o en a eas de de ecci´on de obje os.
La R-CNN se compone de es m´odulos que in e ac ´uan de mane a secuencial:
El p ime o, se enca ga de gene a y ex ae 2000 egiones llamadas p opues as
de egi´on. Es as son unos cuad os que delimi an los po enciales candida os a se
de ec ados.
El segundo, ecoge las egiones p oducidas en el m´odulo an e io y se enca ga de
ex ae las ca ac e ´ıs icas de las im´agenes median e una CNN, como se explic´o en
apa ados p e ios. La ed, p oduce un ec o de salida de 4096 elemen os que desc ibe
el con enido de la imagen.
El ´ul imo m´odulo, u iliza el ec o del paso an e io pa a in oduci lo en una Suppo
Vec o Machine que se ocupa de clasi ica la p esencia del obje o deseado en la egi´on
p opues a. Adem´as de ello, se p edicen ambi´en cua o alo es con las coo denadas
en las que se si ´ua el obje o.
Una de las p incipales des en ajas que p esen a es a ap oximaci´on eside en que
equie e que cada egi´on sea pasada po una CNN, haci´endolo de es a mane a un algo i mo
len o, pues o que iene 2000 egiones pa a analiza . Se puede e la a qui ec u a en la
Figu a 2.12
Figu a 2.12: A qui ec u a del Modelo R-CNN
26 Cap
´
ı ulo 2. Ma co Concep ual
2.7.1.2. Red Neu onal Con olucional R´
apida Basada en Regiones
Ross Gi shick al e que u o ´exi o en su implemen aci´on de la R-CNN, se decidi´o a
implemen a una mejo a del modelo, cen ´andose sob e odo en hace la con un mayo
endimien o y m´as ´apida. Pa a ello, p opuso una Fas R-CNN, es deci , una Red Neu onal
Con olucional Basada en Regiones (del ingl´es, Fas Region-Based Con olu ional Neu al
Ne wo k) [Gi 15].
En su implemen aci´on, om´o como base el modelo an e io pe o aho a, en luga de
pasa cada p opues a po una CNN, gene a un mapa de ca ac e ´ıs icas con olucional
pas´andole la imagen en e a una sola CNN. A pa i de es e mapa, se a a de iden i ica
las p opues as de egi´on, se ag upan en una capa y pos e io men e se pasan a o a capa
o almen e conec ada. Finalmen e, acaba us´andose So max pa a p edeci la clase y, como
en el modelo an e io , se uel en a p edeci las coo denadas en las que se si ´ua la egi´on.
Como puede e se en la Figu a 2.13, se puede in ui que es a ap oximaci´on es mucho
m´as ´apida que la an e io , ya que no iene que u iliza una CNN po cada egi´on que se
ha p opues o, es deci , no u iliza 2000 CNN.
Figu a 2.13: A qui ec u a del Modelo Fas R-CNN
2.7.1.3. Red Neu onal Con olucional M´
as R´
apida Basada en Regiones
Hace apenas cua o a˜nos, Shaoqing Ren consigui´o mejo a a´un m´as la elocidad de
en enamien o del Fas R-CNN y p opuso el Fas e R-CNN o, dicho de o o modo, la Red
Neu onal Con olucional M´as R´apida Basada en Regiones (del ingl´es, Fas e Region-Based
Con olu ional Neu al Ne wo k) [RHGS15].
En las dos p opues as an e io es, se iene que ealiza una b´usqueda pa a pode conoce
cu´ales son las egiones p opues as. Es o hace que sea un p oceso len o y p o oca un g an
impac o en el endimien o. Po ello, en es e modelo y, al igual que en Fas R-CNN, se
alimen a una ´unica CNN con la imagen y se u iliza o a ed que pe mi e p edeci las
p opues as. Es as se uel en a ag upa en una nue a capa y pos e io men e se clasi ican
y p edicen las coo denadas del obje o. Se puede e su a qui ec u a en la Figu a 2.14.
Has a el d´ıa de hoy, el Fas e R-CNN es el modelo m´as ´apido y e icaz en cuan o
a de ecci´on de obje os se e ie e. Po ello, es una opci´on a ene muy en cuen a en el
desa ollo de es e abajo.
2.7. De ecci´
on Facial 27
Figu a 2.14: A qui ec u a del Modelo Fas e R-CNN
2.7.2. De ec o es de Una E apa
A di e encia de los de ec o es an e io es, los de una e apa son buenos cuando se quie e
consegui una al a elocidad de in e encia, po lo que se ´ıan con enien es en a eas que
se deban ealiza en iempo eal ya que son bas an e m´as ´apidos que los comen ados
p e iamen e.
Funcionan de al mane a que se les p opo ciona una imagen a la ed y p oponen cuad os
pa a ealiza las p edicciones, e i ´andose as´ı la e apa de b´usqueda de egiones de in e ´es.
2.7.2.1. Solo Mi as Una Vez
El modelo Solo Mi as Una Vez o YOLO (del ingl´es, You Only Look Once), ue p opues o
po Josheph Redmon y Ross Gi shick en 2015 [RDGF16].
Es a ap oximaci´on de modelo de de ecci´on unciona de mane a muy dis in a a odos
los p opues os an e io men e. En YOLO, se coge una imagen y se u iliza una sola CNN.
Conc e amen e, lo que se hace es di idi la imagen en una cuad ´ıcula de ama˜no NxN y
cada cuad o esul an e se uel e a di idi en M cuad os delimi ado es.
Pa a cada uno de es os, la CNN p edice la clase a la que pe enece de ol iendo una
p obabilidad y unos alo es de des iaci´on asignados a cada cuad o delimi ado . Si es a
p obabilidad supe a un cie o umb al, se end ´a en cuen a el cuad o y o ma ´a pa e del
cuad o delimi ado o al que se˜nala ´a la de ecci´on. Su a qui ec u a se puede e en la
Figu a 2.15.
Figu a 2.15: A qui ec u a del Modelo YOLO
28 Cap
´
ı ulo 2. Ma co Concep ual
La des en aja que o ece YOLO se basa p incipalmen e en que no es capaz de de ec a
obje os de mane a p ecisa cuando es os son demasiado peque˜nos, po lo que no se ´ıa una
buena opci´on pa a de ec a os os si es os se encuen an alejados de la c´ama a que los
cap u a.
2.7.2.2. De ec o de Un Solo Vis azo
El De ec o de Un Solo Vis azo (del ingl´es, Single Sho De ec o (SSD)), ue una p opues a
de C. Szegedy que lanz´o en 2016 [LAE+16a] y con la que alcanz´o g andes esul ados en
cuan o a p ecisi´on y endimien o en a eas de de ecci´on se e ie e, alcanzando una p ecisi´on
media del 74 % en conjun os de im´agenes como COCO o PascalVOC.
Se puede e en la Figu a 2.16 que la a qui ec u a de la SSD se componen
p incipalmen e de la CNN conocida po VGG-16. Es o se debe a su g an endimien o
en cuan o a clasi icaci´on de im´agenes de al a calidad se e ie e. A es a CNN le siguen
di e sas capas m´as que se enca gan de ex ae una mayo can idad de ca ac e ´ıs icas en
m´ul iples escalas.
Figu a 2.16: A qui ec u a del Modelo SSD
Debido a es a ´ul ima peculia idad de la ed, se conside a que el SSD pod ´ıa se capaz
de de ec a os os con una mayo e icacia en obje os peque˜nos, a di e encia de YOLO que
no e a capaz.
Cap´ı ulo 3
Es ado del A e
En es e cap´ı ulo se p e ende ilus a como es ´a la si uaci´on ac ual e e en e a la de ecci´on
de os os en im´agenes digi ales y ´ıdeos en unci´on de los abajos le´ıdos.
De cada uno de ellos se desa olla ´a qu´e es lo que quie en consegui , la ´ecnica u ilizada
pa a lle a lo a cabo y los conjun os de da os que u ilizan, pa a pos e io men e e los
esul ados que han ob enido.
En la ac ualidad hay mucha in o maci´on e e en e a la de ecci´on de obje os an o en
im´agenes [LWZ11,PVZ15,DAHG+15] como en ´ıdeos [DAHG+15,MMdRM16,KOLW16,
FLLL16,YRZ+17,LLT17]. Adem´as [LWZ11,PVZ15,YRZ+17] se cen an en la de ecci´on
de os os.
En odos ellos se ap ecia el g an po encial que ienen las edes CNN pa a es e come ido
que adem´as se pueden conca ena con o as como las LSTM [DAHG+15] o las Redes
Neu onales Con olucionales 3D (del ingl´es, 3D Con olu ional Neu al Ne wo ks (C3D))
[FLLL16] pa a ob ene mejo as no o ias en la de ecci´on.
Se ha decidido explica es os a ´ıculos [PVZ15,FLLL16,YRZ+17,LLT17] ya que cada
uno se cen a en una a qui ec u a di e en e en la ed pa a comple a la de ecci´on.
3.1. Red de Ag egaci´on Neu onal pa a el Reconocimien o
Facial en V´ıdeos
En [YRZ+17] se p opone una Red de Ag egaci´on Neu onal (del ingl´es, Neu al Agg ega ion
Ne wo k (NAN)), que puede se en enada median e SL pa a econoce ca as en ´ıdeos o
en conjun os de im´agenes. Los au o es explican que el p oblema de los ´ıdeos es que es
di ´ıcil consegui una ep esen aci´on ace ada del os o debido al cons an e mo imien o
de los obje os y el uido que gene a es os, una ap oximaci´on pa a esol e lo es di idi el
´ıdeo en o og amas y pasa cada uno a edes que ya saben econoce os os pe o es o es
demasiado cos oso.
Es a ed es ´a compues a po dos m´odulos que pueden se en enados po sepa ado. El
p ime o es un ex ac o de ca ac e ´ıs icas a ni el de o og ama que usa un modelo de CNN
p o undo. El o o es un m´odulo de ag egaci´on que usiona los ec o es de ca ac e ´ıs icas de
los o og amas del ´ıdeo. En gene al la ed oma de en ada un conjun o de im´agenes con
ca as y de uel e un ec o con las ca ac e ´ıs icas pa a la a ea de econocimien o acial.
29
30 Cap
´
ı ulo 3. Es ado del A e
Uno de sus obje i os es dise˜na un mejo esquema pa a las ponde aciones pa a
consegui lo p oponen que el m´odulo de ag egaci´on debe se capaz de p ocesa un n´ume o
di e en e de im´agenes, que la ag egaci´on se debe ealiza de o ma independien e al o den
de en ada y que el m´odulo debe adap a se a la en ada y ene pa ´ame os que se puedan
en ena a a ´es del SL. Pa a ello emplean bloques de a enci´on inspi ados en el mecanismo
de a enci´on de la memo ia desc i os en [GWD14,SWF15,VBK15].
Un bloque de a enci´on se enca ga de lee los ec o es de las ca ac e ´ıs icas del p ime
m´odulo y gene a pesos lineales pa a cada uno.
Solo usando un bloque de a enci´on, se obse a como los pesos son ele ados en las
im´agenes con os os de m´as calidad, como las de al a esoluci´on y ondos simples, y es m´as
educido en las im´agenes con la ca a desen ocada, pa cialmen e ocul a o con una exposici´on
inadecuada. Pa a mejo a oda ´ıa m´as el endimien o deciden usa dos bloques de a enci´on
en cascada, de es a o ma se es ablecen los pesos de las im´agenes po cada iden idad pa a
que los pesos no queden in luenciados po las im´agenes de las dem´as iden idades.
El en enamien o se decide ealiza po sepa ado pa a exp imi al m´aximo las
capacidades de cada uno de los m´odulos. Pa a la CNN del ex ac o usan es millones
de im´agenes con os os de cincuen a mil iden idades di e en es. Las ca as son de ec adas
usando el m´e odo de JDA [CRW+14], y alineadas con el m´e odo LBF [RCWS14]. El
modulo de ag egaci´on se en ena sob e las ca ac e ´ıs icas ex a´ıdas con la CNN.
Una ez es a en enadas ambas, se ob iene como esul ado un 95.72 ±0.64 % de
exac i ud pa a el conjun o de im´agenes de YouTube Faces (YF) [WHM11] donde
compa ado con o os modelos como DeepFace-single [TYRW14], DeepID2+ [SWT15] y
Wen e al [WZLQ16] ob iene mejo es esul ados, aunque no supe a el 97.3 % de FaceNe
[SKP15].
En la Tabla 3.1 y en la Tabla 3.2 se pueden e los esul ados con el conjun o de
im´agenes Celeb i y-1000 (CB) [LZLY14], donde compa ado con los m´e odos de MTJSR
[LZLY14] y Eigen-PEP [LHS+14] ob iene unos alo es no ablemen e m´as ele ados an o
en el conjun o ce ado como abie o.
Tabla 3.1: Resul ados de NAN sob e el conjun o de da os de CB con conjun o ce ado
N´
ume o de Suje os
M´
e odo 100 200 500 1000
NAN - VideoAgg 88.04 82.95 82.27 76.24
NAN - Subjec Agg 90.44 83.33 82.27 77.17
Tabla 3.2: Resul ados de NAN sob e el conjun o de da os de CB con conjun o abie o
N´
ume o de Suje os
M´
e odo 100 200 400 800
NAN - Subjec Agg 88.76 85.21 82.74 79.87
El conjun o de im´agenes de YF [WHM11] es ´a dise˜nado pa a la e i icaci´on de os os
en ´ıdeos. Con iene 3425 ´ıdeos con 1595 pe sonas di e en es. La longi ud de los ´ıdeos
a ia en e 48 y 6,070 o og amas con una du aci´on de p omedio de 181,3 o og amas.
3.2. Reconocimien o P o undo de Ros os 31
El conjun o de im´agenes de CB [LZLY14] es ´a dise˜nado pa a la iden i icaci´on de os os
en ´ıdeos, con iene 159.726 secuencias de ´ıdeo de 1.000 pe sonas di e en es. La longi ud
de los ´ıdeos es de 2.4M de o og amas en o al, con 15 o og amas po secuencia. Tiene
dos ipos de p o ocolos, uno de conjun o abie o y o o de conjun o ce ado. Se pueden
encon a los de alles de es os p o ocolos en [LZLY14].
3.2. Reconocimien o P o undo de Ros os
En [PVZ15], los au o es iene dos me as: in es iga cual es la mejo a qui ec u a y CNN
pa a econoce y e i ica ca as; y es ablece un p ocedimien o pa a c ea conjun os de
da os a g an escala.
En cuan o a las a qui ec u as se cen an en DeepFace [TYRW14]. Es e m´e odo
usa una CNN p o unda en enada con 4 millones de im´agenes, Tambi´en u iliza una
a qui ec u a de ed siamesa, donde se aplica la misma CNN a pa es de ca as pa a ob ene
desc ip o es que luego se compa an usando la dis ancia euclidiana. Adem´as, las im´agenes
son p e-p ocesadas. Ese p oceso consis e en “ ecoloca ” las im´agenes, si uando las ca as
en una pose can´onica usando un modelo 3D.
La es a egia que p oponen cons a de a ias e apas pa a ecopila de mane a e ec i a
un g an conjun o de da os aciales que con enga cien os de im´agenes.
Lo p ime o es ob ene una g an lis a de nomb es de los que po encialmen e se pudie an
ob ene in o maci´on, pa a ello se eligen celeb idades, pol´ı icos, e c, en gene al pe sonajes
p´ublicos. La lis a inicial la ob ienen de IMDB con un g an n´ume o de nomb es de
celeb idades. Esos nomb es los c uza on con F eebase knowledge g aph [BEP+08], que es
una base de da os con in o maci´on de much´ısimas celeb idades. T as odo es o ob u ie on
un o al de 5000 nomb es de pe sonas pa a los que se consiguie on 200 im´agenes po
pe sona simplemen e usando el buscado de im´agenes de Google. Pos e io men e ealiza on
un il ado, eliminando las pe sonalidades cuyo conjun o de 200 o os no supe aba el 90 %
de pu eza (llamando pu eza a la he e ogeneidad de las im´agenes del conjun o). Es o edujo
la lis a de candida os a 3250. Po ´ul imo, elimina on las celeb idades que apa ec´ıan en o os
conjun os de da os pa a ene da os nue os con los que en ena a la ed. T as es e il ado,
e mina on con 2622 nomb es de celeb idades.
El segundo paso es ob ene m´as im´agenes de esas pe sonas. Pa a ello busca on los
nomb es en el buscado de im´agenes de Google y en el de Bing, que les p opo ciona on
como esul ado 2000 im´agenes po cada pe sona.
El e ce paso es mejo a la pu eza del nue o conjun o de im´agenes. Pa a ello po
cada celeb idad se en ena una ed SVM lineal usando en desc ip o Fishe Vec o Faces
[SPVZ13,PSVZ14] que es capaz de il a au om´a icamen e las mejo es im´agenes, en las
que las 1000 mejo es pe manecen y el es o de desechan.
El cua o paso es elimina duplicados ya que al usa dos mo o es de b´usqueda puede
habe im´agenes iguales. Tambi´en en es a ase se eliminan las im´agenes que solo se
di e encian po el balance de colo o con ex o supe pues o. Es o lo ealiza on calculando
el desc ip o VLAD [JPD+11,AZ13] pa a cada imagen.
38 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
Conjun o de im´
agenes I: Labeled Faces in he Wild [HMBLM08].
Conjun o de im´
agenes II: Wide Face Da ase [YLLT16].
4.1.1. Conjun o de im´agenes I
LFW [HMBLM08] es un conjun o de im´agenes publico dise˜nado pa a e i ica si una
pa eja de im´agenes pe enecen a la misma iden idad. Es ´a compues o po 13233 im´agenes
de 250x250 de ca as almacenadas en 5749 ca pe as con sus iden idades.
A pesa de que el p op´osi o de es e abajo no e a el de la iden i icaci´on sino el de la
de ecci´on, y aunque el p opio se icio web que o ece acceso al eposi o io de im´agenes no
ecomendaba el uso de es e pa a a eas de de ecci´on po la escasez de a iedad en lo que
a edad de los suje os p esen es en las im´agenes se e ie e, el se decidi´o usa lo debido a,
no solo los buenos esul ados que se pueden obse a en [PVZ15], sino ambi´en al ama˜no
del conjun o, dado que es e hecho daba la opo unidad de ans o ma las im´agenes al
o ma o eque ido po Tenso Flow sin in e i mucho iempo en ello.
El p oceso de adap aci´on del conjun o de im´agenes sigue los siguien es pasos:
1. El p ime paso consis i´o en una in es igaci´on ace ca de c´omo c ea los TFReco ds
que necesi aba Tenso Flow a pa i de un conjun o de im´agenes sin e ique a . T as
la in es igaci´on, se encon ´o un eposi o io con un conjun o de im´agenes e ique adas
que es aba compues o po dos sc ip s en Py hon. El p ime o se enca gaba de con e i
las e ique as de o ma o XML aCSV y el segundo ans o maba de o ma o CSV
aTFReco d. Modi icando es os dos sc ip s y cambiando algunas con igu aciones
pa a adap a lo a lo que se eque ´ıa, el equip´o encon ´o el m´e odo pa a ealiza la
ans o maci´on con im´agenes e ique adas.
2. El siguien e paso que se ealiz´o ue el de e ique ado de las im´agenes. La he amien a
que pe mi i´o ealiza es a a ea y gene a im´agenes e ique adas en o ma o XML
ue labelimg [lab17]. Se decidi´o usa es a he amien a ya que, adem´as de con a con
in e az g ´a ica, su con igu aci´on pe mi ´ıa es ablece una e ique a po de ec o, de
al o ma que al selecciona la egi´on deseada, es a se au o-e ique a a, acele ando el
p oceso. Se ealiz´o un sc ip de Ba ch que cen alizaba las im´agenes en un mismo
di ec o io pa a pos e io men e impo a lo a labelimg y pe mi i as´ı la na egaci´on
en e las im´agenes. Una ez den o de la aplicaci´on, se seleccionaban la o las
ca as que es aban con enidas en cada imagen, se e ique aban con la e ique a po
de ec o mencionada an e io men e y, po ´ul imo, se gua daban, de al o ma que
la aplicaci´on gene aba el a chi o XML con la in o maci´on del e ique ado, necesa ia
pa a su pos e io con e si´on.
3. Po ´ul imo, se aplica on dis in os p ocedimien os pa a ans o ma las im´agenes
e ique adas en el an e io paso al o ma o de TFReco d y pa a sepa a odas im´agenes
en los subconjun os de p uebas y alidaci´on. Pa a ealiza dicha labo , p ime o se
ag upa on odos los a chi os XML gene ados en el an e io paso en los di ec o ios
mencionados an e io men e y se us´o el p ocedimien o comen ado en el p ime paso
pa a gene a los TFReco ds co espondien es.
4.2. C eaci´
on de los Modelos de De ecci´
on 39
4.1.2. Conjun o de im´agenes II
Wide Face [YLLT16] es un conjun o de im´agenes dise˜nado pa a la de ecci´on de os os.
U iliza las im´agenes publicas del conjun o de WIDER [XZLT15] que con ienen os os en
dis in as dis ancias, poses, con pa es apadas o pin adas, con dis in as exp esiones y con
dis in os ni eles de luminosidad.
En o al se ienen 32203 im´agenes con 393703 os os e ique ados, de los cuales un 40 %
son pa a en enamien o (∼12876 im´agenes), un 50 % pa a p uebas (∼16101 im´agenes) y
un 10 % pa a alidaci´on (∼3226 im´agenes).
A la ho a de busca como pasa es e conjun o de im´agenes al eque ido po Tenso low,
se encon ´o en un eposi o io un sc ip pa a ealiza es a a ea sob e es e conjun o en
espec´ı ico [wid20] de mane a au om´a ica. G acias a es o, solo ue necesa io ins ala dicho
eposi o io y ejecu a , pa a ob ene as´ı los TFReco d necesa ios.
4.2. C eaci´on de los Modelos de De ecci´on
Se han c eado dos modelos pa a ealiza la de ecci´on de los os os, una pa a cada inalidad
de uso, explicadas an e io men e.
El p ime modelo ha sido op imizado pa a la de ecci´on de os os en ´ıdeos de mane a
local, es deci , con ´ıdeos con du aci´on limi ada. Se a a, po an o, de una ed m´as
en ocada en la p ecisi´on que en la elocidad de de ecci´on. Se decidi´o dise˜na es a ed pues o
que pa a ealiza la de ecci´on en un ´ıdeo, es necesa io un p ocesamien o p e io comple o
de es e an es de ob ene los esul ados inales, po lo que no es demasiado ele an e, en
es e caso, la elocidad de de ecci´on del modelo po o og ama.
Po o o lado, en es e abajo se ha desa ollado una segunda opci´on op imizada pa a
su uso en ´ıdeos en iempo eal, conocidos como ´ıdeos en s eaming. Dado que pa a el
p ocesamien o de un ´ıdeo en iempo eal es c ucial el iempo en el que se ealiza dicha
de ecci´on, se ha dise˜nado es e modelo con un en oque mucho m´as di ec o en la elocidad de
p ocesamien o de o og amas que la an e io , man eniendo ambi´en un buen endimien o
en cuan o a p ecisi´on se e ie e.
Ambos modelos han demos ado du an e la ase de expe imen aci´on se capaces de
de ec a a ios os os simul ´aneamen e y en dis in as condiciones, ales como os os
a dis in as dis ancias, poses poco comunes, exp esiones a iopin as, condiciones de luz
des a o ables, e incluso os os maquillados y/o apados con dis in os a uendos, como
masca illas.
Pa a cada una de los modelos, se explica ´a de qu´e es ´an o mados, cu´al es el p oceso
que siguen pa a ealiza la de ecci´on y la con igu aci´on que se ha u ilizado pa a pode
consegui el obje i o.
4.2.1. Modelo pa a la De ecci´on en V´ıdeos Rep oducidos Localmen e
Dado que el obje i o con es e modelo es asegu a la e ec i idad en e a la elocidad de
de ecci´on, se ha u ilizado la combinaci´on o mada po un de ec o Fas e R-CNN y el
ex ac o de ca ac e ´ıs icas Incep ion-ResNe .
40 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
La a qui ec u a in e na del p ime modelo desa ollado cons a de es pa es bien
di e enciadas, como se puede e en la Figu a 2.14: La ex acci´on de ca ac e ´ıs icas, la
p opues a de os os y po ´ul imo una capa donde se ag upan esas p opues as y se ealiza
la p edicci´on.
La p ime a hace e e encia a la CNN que se enca ga de la ex acci´on de ca ac e ´ıs icas.
En es e caso se ha usado la ed neu onal llamada Incep ion-ResNe , desa ollada po
Google, cuya es uc u a in e na puede e se en la Figu a 4.1.
Figu a 4.1: A qui ec u a In e na de Incep ion-ResNe
Como se obse a en la Figu a 4.1, se ha p ocedido a mos a su e si´on comple a y
o a m´as comp imida de la a qui ec u a de la ed pa a en ende con m´as acilidad c´omo
es a hecha. Como se puede obse a , la ed es ´a c eada po una g an can idad de capas
simbolizadas con dis in as o mas de colo es, en las que se incluyen capas de con oluci´on
(explicadas con m´as de alle en la Secci´on 2.5.1.1), capas de pooling (Secci´on 2.5.1.2),
capas de ag upaci´on o conca enaci´on, capas de d opou enca gadas de apaga una se ie de
neu onas pa a e i a el sob e ajus e, capas o almen e conec adas, capas esiduales p opias
de la ed ResNe y, po ´ul imo, las unciones de ac i aci´on so max, simila es a las is as
en la Secci´on 2.4.
Todas ellas o man es uc u as que pueden se suscep ibles a epe i se en andas de 10
y 20, como se puede ap ecia en la imagen.
El segundo paso es ealiza la p opues a de egiones que puedan se los os os. En es a
segunda ase, se ecibe las ca ac e ´ıs icas en o ma de mapa ex a´ıdas con la ed an e io
y se p ocesan usando una ed neu onal especial capaz de gene a egiones, como se puede
e en la Figu a 4.2.
Es a ed, adem´as, clasi ica cada egi´on pa a sabe si lo que ha p opues o pe enece al
ondo de la imagen o es una ca a en cues i´on.
4.2. C eaci´
on de los Modelos de De ecci´
on 41
Figu a 4.2: Ejemplo m´as isual de las egiones p opues as
Las p opues as esul an es que no pe enecen al ondo de la imagen, inalmen e se
p opagan a a ´es de una capa de ag upaci´on como las que con iene Incep ion-ResNe
pa a que pos e io men e se clasi iquen cada una de ellas y se ob enga una p obabilidad
que indique cu´an semejan e es la p opues a a un os o.
Po ´ul imo, aquellas p opues as que supe en un cie o umb al, el cual se explica en
la Secci´on 4.3, se ´an conside adas de ecciones y se acaba ´an dibujando los l´ımi es que
ecuad en la ca a en la imagen o o og ama del ´ıdeo en cues i´on.
Una ez conseguido el co ec o uncionamien o del de ec o , pa a pode se usado con
´ıdeos, e a necesa io ene el modelo expo ado de o ma que pudie a admi i im´agenes y
de ol e como esul ado las coo denadas del os o den o de es as.
Pa a p ocesa el ´ıdeo, ´unicamen e hab ´ıa que ealiza un bucle donde se leye a
o og ama a o og ama y, pa a cada uno, se u ilizase es e modelo pa a in e i el luga
donde se encuen an las ca as. Como ya se ha dicho, una ez hecho es o, ´unicamen e se ´ıa
necesa io dibuja los limi es de es a en la ca a e i c eando un ´ıdeo nue o con ello.
4.2.2. Modelo pa a la De ecci´on en V´ıdeos en Tiempo Real
El obje i o que debe cumpli se con es e modelo debe se e o za la elocidad de in e encia
y pasa a un segundo plano la e ec i idad, sin descuida es a en exceso. Es po ello, que
se ha usado una combinaci´on del de ec o Fas e R-CNN con el ex ac o Incep ion
Es e segundo modelo c eado es ´a basado en la CNN Incep ion, desa ollada po Google.
Debido a que su es uc u a y p oceso es simila al explicado en la Secci´on an e io ,
´unicamen e se de alla ´a la a qui ec u a in e na que es a CNN sigue pa a pode ex ae las
ca ac e ´ıs icas. Su es uc u a in e na es simila a la que se mues a en la Figu a 4.3.
Al igual que se pod´ıa obse a en el modelo p opues o pa a la de ecci´on en ´ıdeos,
Incep ion ambi´en dispone de una amplia a iedad de capas, las mismas que se pod´ıan
encon a en la Secci´on an e io . La di e encia en e es as dos edes eside en que la p ime a
con iene una se ie de capas esiduales pe enecien es a ResNe y la p o undidad de la ed
es conside ablemen e mayo , mien as que Incep ion no cuen a con es as ca ac e ´ıs icas.
42 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
Figu a 4.3: A qui ec u a In e na de Incep ion
Es a ´ul ima ca ac e ´ıs ica es la que hace que sea la ap opiada pa a usa se en en o nos
donde la elocidad del p ocesamien o es cla e. Al no habe an as capas, la can idad de
neu onas po capa disminuye y, en consecuencia, el n´ume o de c´alculos ma em´a icos se e
educido conside ablemen e.
El p oceso de la de ecci´on en iempo eal se ealiza de la misma o ma que en ´ıdeos.
Pa a ello, es necesa io u iliza las lib e ´ıas Pa y yS eamlink pa a pode ob ene los
o og amas de la uen e en iempo eal. La di e encia espec o a la de ecci´on en ´ıdeo local
eside en mos a la salida po pan alla o edi igi la salida a un canal donde se equie a
isualiza los esul ados a medida que es os se gene an, en luga de c ea un ´ıdeo pa a
se obse ado con pos e io idad.
4.2.3. Con igu aci´on de los Modelos
Pa a pode ejecu a los modelos en cues i´on, Tenso Flow o ece una se ie de iche os que
deben se con igu ados de o ma que en es e se incluya el ipo de de ec o deseado, el
ex ac o de ca ac e ´ıs icas, la con igu aci´on del en enamien o y alidaci´on, y oda una
se ie de pa ´ame os asociados a cada cada uno de es os campos pa a op imiza la de ecci´on.
Todas es as opciones de con igu aci´on hacen e e encia en ealidad a unciones, clases y
pa ´ame os pe enecien es a Tenso Flow que, en ul ima ins ancia, son los que inalmen e
se ´an ejecu ados. En gene al, la es uc u a que debe segui es e iche o, iene que segui
unas pau as igu osas di e enciando de es a o ma en e cinco pa es que an a pe mi i
ealiza la con igu aci´on. Es as pa es son las siguien es:
Model: De ine el ipo de modelo que a a se u ilizado, es deci : el de ec o , la CNN
y los pa ´ame os que de inen a la a qui ec u a en gene al.
T ain Con ig: En ´el se indican los pa ´ame os que deben usa se pa a ealiza el
en enamien o, como puede se un p ep ocesamien o en la en ada a la ed o los
alo es de inicializaci´on de la CNN.
T ain Inpu Reade : U ilizado pa a indica los da os de en enamien o en o ma o
TFReco d.
4.2. C eaci´
on de los Modelos de De ecci´
on 43
E al Con ig: Pe mi e ajus a las m´e icas que an a se moni o izadas du an e el
en enamien o.
E al Inpu Reade : Se de inen el conjun o de da os de alidaci´on a usa . Debe se
dis in o al de en enamien o.
Los aspec os m´as ele an es pa a la c eaci´on del modelo son: Con igu aci´on del
de ec o , Con igu aci´on del en enamien o y Con igu aci´on de la e aluaci´on.
Dado que los modelos p opues os en es e cap´ı ulo se basan ambos en el de ec o Fas e
R-CNN y ienen pa e de la con igu aci´on en com´un, se explica ´an los aspec os m´as
ele an es que se han enido en cuen a du an e la con igu aci´on de es os, y se de alla ´an
las pa icula idades que ienen cada uno de ellos.
4.2.3.1. Con igu aci´
on del De ec o
El p ime paso pa a la con igu aci´on del modelo es la decla aci´on del de ec o a usa , en
es e caso se a a de Fas e R-CNN. A con inuaci´on se de ine el n´ume o de obje os que se
an a de ec a en el campo num classes, que en es e caso el alo debe se 1 ya que solo
se an a de ec a os os.
A con inuaci´on, se con igu an los es componen es del de ec o . ( e Secciones 2.7.1.3
y4.2.1).
1. ea u e ex ac o : Hace e e encia a la CNN que se u iliza ´a. En e o os campos
que apa ecen en es a es uc u a, se encuen a el campo ype que iden i ica el ipo
de ed (Incep ion-ResNe , pa a el caso de ´ıdeos en local, o Incep ion en el caso de
s eaming). El alo depende del modelo que se quie a c ea .
2. i s s age: Es la e apa en la que se ealizan p opues as sob e las ca ac e ´ıs icas
que en´ıa como salida la CNN. Es a e apa queda e e enciada po los
pa ´ame os que comienzan po i s s age. En es a e apa se con igu an
los 3 pa ´ame os: i s s age nms sco e h eshold, i s s age nms iou h eshold y
i s s age max p oposals. Los dos p ime os u ilizan sup esi´on no m´axima (del ingl´es,
Non-maximum Supp ession) pa a e i a muchas p opues as sob e un mismo os o.
i s s age nms sco e h eshold: Se u iliza pa a il a las p opues as que
se hacen en es a e apa. Al es ablece se en 0.0 se indica que odas las
p opues as que se hagan an a se ´alidas, ya que no an a ene que
supe a ning´un umb al de con ianza. De la misma o ma se iene el pa ´ame o
i s s age nms iou h eshold, que al ajus a se en 0.69, se conside a ´a dos
p opues as simila es cuando es ´en sob e es e umb al de In e secci´on sob e Uni´on
(del ingl´es, In e sec ion o e Union (IOU)), qued´andose con la que enga una
pun uaci´on mayo y eliminando la o a. En la Secci´on 4.3 se explican m´as
ampliamen e los umb ales que es ´an in oluc ados en es os pa ´ame os.
i s s age max p oposals: Po con enci´on iene los alo es que apa ecen en
el c´odigo: 300 y 100, pa a Incep ion-ResNe eIncep ion espec i amen e. Es e
es uno de los mo i os que hace que Incep ion-ResNe sea m´as p ecisa y len a a
la ho a de in e i y se en enada. Al ealiza un mayo n´ume o de p opues as
sob e una imagen, su endimien o puede aumen a pe o el iempo pa a ealiza
la de ecci´on ambi´en aumen a ´a.
44 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
3. second s age: Se enca ga de ecibi las p opues as que gene a la p ime a e apa y
clasi ica las pa a gene a un esul ado inalmen e. Al igual que en la p ime a e apa, se
es ablece una pun uaci´on (sco e h eshold) y un alo de IOU (iou h eshold) po los
cuales las p opues as se ´an conside adas de ecciones. Tambi´en se es ablece el n´ume o
m´aximo de de ecciones po clase que se an a ealiza (max de ec ions pe class), el
cual coincide con el n´ume o o al de de ecciones (max o al de ec ions) al habe
una sola clase. Pa a inaliza , se modi ic´o sco e con e e poniendo la unci´on
de ac i aci´on Sigmoide (Secci´on 2.4), ya que unciona mejo que So max pa a
p oblemas donde solo hay que clasi ica un elemen o.
El C´odigo 4.1 mues a la con igu aci´on ealizada.
Con igu aci´
on 4.1: Con igu aci´on enida en cuen a en Model
1 model {
2 a s e c n n {
3 num classes :1
4
5 e a u e e x a c o {
6 ype :” as e cnn incep ion esne 2” |” as e cnn incep ion 2”
7}
8
9 i s s age nms sco e h eshold :0.0
10 i s s age nms iou h eshold :0.69
11 i s s age max p oposals :300 |100
12
13 s e c o n d s a g e p o s p o c e s s i n g {
14 ba ch non max supp ession {
15 sco e h eshold :0.30
16 iou h eshold :0.60
17 m a x d e e c i o n s p e c l a s s :100
18 max o al de ec ions :100
19 }
20 sco e con e e :SIGMOID
21 }
22 }
23 }
4.2.3.2. Con igu aci´
on del En enamien o
Como se ha explicado p e iamen e, el en enamien o necesi a se con igu ado ambi´en y,
conc e amen e, cons a de dos pa es: ain con ig y ain inpu eade , como se puede e
en el C´odigo 4.2.
Den o de ain con ig, se encuen an los siguien es pa ´ame os:
1. ba ch size: Indica el ama˜no de los paque es de da os que i ´a u ilizando el algo i mo
pa a en ena al de ec o . En es e caso, se ha es ablecido en 1, lo cual signi ica que
i ´a p opagando las im´agenes sob e las edes de una en una.
2. da a augmen a ion op ions: Hace e e encia a la ´ecnica aplicada en DL que
pe mi e aumen a sus ancialmen e el conjun o de en enamien o median e la
modi icaci´on de las im´agenes que ya es ´an con enidas en ´el. En conc e o, se ha
u ilizado andom ho izon al lip que ealiza un gi o ho izon al y alea o io sob e las
im´agenes, pe o se pod ´ıa habe ealizado cualquie o a modi icaci´on.
4.2. C eaci´
on de los Modelos de De ecci´
on 45
Con igu aci´
on 4.2: Con igu aci´on enida en cuen a pa a el en enamien o
25 ain con ig {
26 ba ch size :1
27
28 da a augmen a ion op ions {
29 andom ho izon al lip {
30 }
31 }
32
33 num s eps :200000
34
35 om de ec ion checkpoin : ue
36 ine une checkpoin :” u a al modelo ya e n enado ”
37 }
38
39
40 ain inpu eade {
41 label map pa h :” u a a las e ique as del da ase ”
42
43 e c o d i n p u e a d e {
44 inpu pa h :” u a al eco d de en enamien o”
45 }
46 }
3. num s eps: Pe mi e ajus a el n´ume o de pasos de ejecuci´on pa a el en enamien o.
Tenso Flow asegu a que con 200000 se puede encon a un buen ajus e del modelo
y se es ableci´o de esa o ma.
4. om de ec ion checkpoin y ine une checkpoin : Quiz´as sean de los m´as
impo an es que hay en el iche o, ya que son los que o ecen la opci´on de pode
ealiza la ´ecnica de TL. Pa a abo da es a ´ecnica, los ex ac o es de ca ac e ´ıs icas
que se han u ilizado en el p esen e p oyec o han sido en enados p e iamen e con una
se ie de im´agenes que aba can casi cualquie ipo de obje o. Es o quie e deci que
las edes es ´an p epa adas pa a clasi ica co ec amen e en e los dis in os obje os
con los que ha sido en enado y, sin emba go, no son capaces de clasi ica un
os o cuando se quie a u iliza la CNN pa a es e come ido. Es po ello que es
es ic amen e necesa io capaci a a la ed pa a pode ealiza es a a ea. Median e
es os pa ´ame os, Tenso Flow o ece la posibilidad de indica la u a donde se
encuen a el modelo que ya ha sido en enado y cuyo ap endizaje se equie e eu iliza
pa a p opo ciona un mejo endimien o al nue o modelo que se es ´e c eando.
In e namen e, Tenso Flow ealiza la ´ecnica de Fine-Tune, explicada en la Secci´on
2.2.3.
Po ´ul imo, den o del campo ain inpu eade , se encuen an los siguien es
pa ´ame os:
1. label map pa h: Hace e e encia a la u a de un iche o que con iene odas las
e ique as que se u iliza ´an en la de ecci´on. Pa a pode ealiza TL, se ha modi icado
es e a chi o a˜nadiendo una e ique a (Face) pa a los os os, y eliminando cualquie
o a e ique a que pudie a encon a se en el modelo p een enado.
2. inpu pa h: En ´el se debe indica la u a a los TFReco d del conjun o de da os que
eque idos pa a en ena el modelo.
46 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
Con es os ´ul imos cua o pa ´ame os se es a ´ıa implemen ando la ´ecnica de TL. Al
es ablece : una sola e ique a posible (Face), un conjun o de da os de un solo ipo, el
pa ´ame o num classes del modelo a 1, y pe mi i a la CNN adqui i el ap endizaje de o o
en enamien o p e io; lo que ocu e es que el de ec o uel e a ealiza el en enamien o
con la mayo ´ıa de las capas de la ed ya ajus adas, pe o es a ez se ue za a Tenso Flow a
que modi ique in e namen e la ed de al o ma que, aho a, solo a a se capaz de de ec a
os os.
Po esa az´on, aunque se u ilice el ajus e de las capas que se consigui´o du an e el
ap endizaje de o os obje os, el nue o de ec o solo de ec a ca as. Es a ´ecnica pe mi e
pode en ena de una o ma m´as ´apida y e icien e, pues o que en las capas iniciales de la
ed siemp e se ap enden una se ie de ca ac e ´ıs icas que son comunes a odos los obje os.
4.2.3.3. Con igu aci´
on de la E aluaci´
on
La con igu aci´on m´as ele an e en el p oceso de e aluaci´on. En el agmen o de C´odigo 4.3,
se obse a que en el campo e al con ig se ha es ablecido el n´ume o de da os de alidaci´on a
3226 en el pa ´ame o num examples, que en es e caso es el n´ume o de im´agenes des inadas
a la alidaci´on del conjun o de im´agenes Wide Face. Adem´as, al igual que ocu ´ıa en el
caso del en enamien o, hay que indica la u a de las e ique as que se an a usa pa a
la de ecci´on (label map pa h) y la u a al conjun o de da os que u iliza ´a pa a ealiza la
e aluaci´on (inpu pa h)
Con igu aci´
on 4.3: Con igu aci´on enida en cuen a pa a la alidaci´on
48 e al con ig {
49 num examples :3226
50 }
51
52
53 e al inpu eade {
54 label map pa h :” u a a las e ique as del da ase ”
55
56 e c o d i n p u e a d e {
57 inpu pa h :” u a al eco d de alidacion”
58 }
59 }
4.3. M´e icas de E aluaci´on en la De ecci´on Facial
En el campo del ML se uel e necesa io el hecho de pode medi cu´al es el endimien o de
los modelos en enados, pa a pode compa a los en e s´ı de una mane a obje i a y conoce
cu´al de ellos es el que mejo se puede ajus a .
M´as conc e amen e, en la ama de la de ecci´on acial, el conjun o de m´e icas que
se suelen u iliza se basan en las conocidas compe iciones de PASCAL VOC [pas20],
COCO [LMB+20] y Open Images [ope20b], que de inen una se ie de pau as pa a e alua
el algo i mo p opues o con los espec i os conjun os de da os de alidaci´on.
4.3. M´
e icas de E aluaci´
on en la De ecci´
on Facial 47
Es as compe iciones ienen algo en com´un, y es que odas ienen la p ecisi´on media
como medida p incipal. Sin emba go, pa a la e aluaci´on del endimien o de los modelos
c eados en es e p oyec o, se ha escogido el conjun o de m´e icas de inidos po COCO,
debido a que es el que mayo n´ume o de m´e icas o ece, dando incluso la opo unidad de
pode ob ene el endimien o basado en la lejan´ıa del os o en una imagen.
A con inuaci´on, se desc iben dichas m´e icas y se adicionan o as que no pe enecen a
COCO y que se han u ilizado debido a su g an impo ancia en p oblemas de ML.
4.3.1. Conjun o de M´e icas Usadas
An es de explica las m´e icas se u ilizan en COCO, es necesa io conoce el ma co en el
que se basan y de qu´e se enca gan cada una.
In e secci´
on sob e Uni´
on: Como se ha comen ado p e iamen e, en la de ecci´on
acial, no solo hay que p eocupa se de e alua la p obabilidad de que un os o en
conc e o apa ezca en la imagen, sino que ambi´en se debe se capaz de localiza la.
Es o supone un p oblema, ya que las m´e icas comunes u ilizadas sob e modelos
de clasi icaci´on deben se ex endidos. Aqu´ı es donde en a en acci´on la IOU. La
IOU es una mane a de cuan i ica la simili ud que exis e en e el cuad o delimi ado
p edicho po el modelo y el o iginal que a asociado con los da os de en ada. Su
umb al puede a ia de 0 a 1, siendo m´as al o cuan o m´as supe pues os es ´en en e
los dos. Se puede e un ejemplo en la Figu a 4.4.
Figu a 4.4: Ejemplo de la In e secci´on sob e Uni´on
Pun uaci´
on de Con ianza: Se e ie e a la p obabilidad con la que se clasi ica
una cie a imagen y ep esen a el po cen aje de segu idad po el que una clase
de e minada ha sido de ec ada.
Umb al de Con ianza: Es el po cen aje que indica a pa i de qu´e alo de
Pun uaci´on de Con ianza se a a conside a una p edicci´on como una de ecci´on. Si
se es ablece, po ejemplo, un umb al del 30 %, odas las p edicciones que no supe en
esa pun uaci´on, no se ´an conside adas una de ecci´on.
Tipos de P edicciones: Las p edicciones se pueden clasi ica en los siguien es
pun os:
Cap´ı ulo 5
Expe imen os y Resul ados
En es e cap´ı ulo se desc iben los expe imen os que se han ealizado y se e alua ´a el
endimien o y e icacia de cada uno de ellos, ob eniendo inalmen e unos esul ados de
los que se pod ´an ob ene pos e io men e conclusiones. Pa a ello, se explica ´a p ime o
el con ex o sob e cual se ha ealizado la expe imen aci´on y, pos e io men e, se ha ´a
una peque˜na in oducci´on a los expe imen os ealizados pa a pasa luego a explica los
de alladamen e cada uno de ellos. Se e mina ´a con una secci´on donde se compa en los
mejo es expe imen os ealizados y se de e mine cu´ales son los m´as ap opiados pa a el
abajo.
5.1. Con ex o de la Expe imen aci´on
Pa a lle a a cabo la expe imen aci´on, se han escogido los dos mejo es de ec o es que
exis en ac ualmen e y que m´as ga an ´ıas han dado en abajos p e ios: SSD yFas e
R-CNN. Pa a cada uno de ellos, se han u ilizado di e en es ex ac o es de ca ac e ´ıs icas
p een enados con el conjun o de da os de COCO pa a comp oba cu´ales de ellos consegu´ıa
ex ae mejo la in o maci´on de nues o conjun o de da os escogido. A su ez, se ha aplicado
la ´ecnica de TL de mane a que el modelo sea capaz de de ec a os os ambi´en. El
conjun o de da os elegido pa a es a expe imen aci´on ha sido Wide Face, pues o que en´ıa
o os de mayo a iedad, en dis in as si uaciones y en mayo can idad.
Pa a cada modelo que se ha c eado, se ha ejecu ado las eces necesa ias has a que se ha
ob enido la in o maci´on ap opiada y se han podido gene a odos los checkpoin s necesa ios
pa a c ea el modelo pos e io men e en un pun o que se encon a a en un ajus e pe ec o,
es deci , que no hubie a O e i ing ni Unde i ing. Adem´as, pa a pode e alua los en
igualdad de condiciones, se ha dejado po de ec o la con igu aci´on m´as impo an e de
las edes, eniendo po delan e cada uno de ellos 200000 pasos de ejecuci´on: la can idad
ecomendada po Tenso Flow pa a los modelos seleccionados.
En cuan o a la ase de e aluaci´on hay que des aca que, po de ec o, es aba es ablecido
que se ealiza ´an pe i´odicamen e e aluaciones sob e los ´ul imos 10 checkpoin s gene ados,
de mane a que du an e el en enamien o se han ido ob eniendo unos esul ados basados
no solo en el pun o ac ual, sino en los an e io es ambi´en. La en aja de es o eside en que
se puede ob ene una isi´on m´as globalizada del endimien o del modelo. No obs an e, se
ha ealizado una e aluaci´on comple a inal sob e el pun o de in lexi´on del modelo, es deci ,
donde es e ac ´ua con mayo endimien o.
55
56 Cap
´
ı ulo 5. Expe imen os y Resul ados
Es a ´ul ima e aluaci´on se ha ealizado de la misma mane a en la que es ´a especi icado
en las m´e icas de COCO. Se ha es ablecido un umb al de con ianza de 0.3 y se ha hecho
la media a i m´e ica sob e 10 umb ales de IOU, penalizando as´ı al modelo cuando ealice
una mala localizaci´on de la ca a en cues i´on.
Se han analizado los esul ados no solo en ´ıdeos, sino ambi´en con webcam y en
pla a o mas de s eaming. Las pla a o mas escogidas han sido las que mayo uso ienen
ac ualmen e, es deci , YouTube yTwi ch. Pa a cada una de es as opciones se mos a ´a
el iempo de in e encia y los o og amas po segundo (del ingles FPS) esul an es. En el
caso de la webcam y las pla a o mas de s eaming, el iempo de lec u a del o og ama
puede a ia seg´un di e en es ac o es, como pod ´ıa se la conexi´on a in e ne y/o el
p ocesamien o que ealicen las lib e ´ıas u ilizadas pa a la ob enci´on de es e. Debido a
es o, los FPS en es os casos puede e se a ec ado.
Po ´ul imo, odas las p uebas se han hecho en dos equipos dis in os. Los p ime os
en enamien os se ealiza on en un equipo p opio, el cual ealizaba es os de una mane a
muy len a y no iba a pe mi i pode hace una g an can idad de expe imen os con ´el.
Debido a ello, se busca on o as al e na i as. Finalmen e se decidi´o usa Google Cloud
pa a pode c ea una ins ancia mejo y ealiza odos los en enamien os en ella.
El p ime en o no de expe imen aci´on u ilizado se pod ´ıa esumi con las ca ac e ´ıs icas
desc i as en la Tabla 5.1.
Tabla 5.1: P ime en o no de expe imen aci´on
CPU Memo ia RAM Ta je a G ´
a ica
In el Co e i5-7600K CPU 3.8GHz 8 GB MSI GeFo ce GTX 1060 x 6 GB
El segundo equipo u ilizado basado en compu aci´on en la nube posee las ca ac e ´ıs icas
que se mues an en la Tabla 5.2.
Tabla 5.2: Segundo en o no de expe imen aci´on
CPU Memo ia RAM Ta je a G ´
a ica
P ocesado de In el de 16 n´ucleos 60 GB NVIDIA Tesla P100 x 16 GB
5.2. Expe imen os
Los ex ac o es de ca ac e ´ıs icas seleccionados son los siguien es: MobileNe V1,
Incep ionV2,ResNe 50 yIncep ion-ResNe V2. Cada uno de ellos cuen a con unas
ca ac e ´ıs icas y complejidad di e en e. Se ha decidido desca a o as CNN, pues o que
su complejidad e a demasiado g ande y pod ´ıa a ec a an o al iempo de en enamien o,
como a su endimien o, ya que se pod ´ıan O e i ea muy ´acilmen e.
MobileNe se ca ac e iza po se la CNN m´as simple con 4 millones de pa ´ame os
con igu ables y una p o undidad de 88, lo cual simboliza el n´ume o de il os o
ca ac e ´ıs icas que se an a ex ae de cada imagen.
Incep ion cuen a con 23 millones de pa ´ame os y una p o undidad mucho mayo que
MobileNe , siendo es a de 159 il os. De la misma o ma, ResNe iene una complejidad
simila eniendo la can idad de 25 millones de pa ´ame os con igu ables.
5.2. Expe imen os 57
Po ´ul imo, Incep ion-ResNe es la ed m´as elabo ada. Tiene 55 millones de pa ´ame os
y la can idad de 572 il os pa a ex ae di e en es ca ac e ´ıs icas de las im´agenes.
La expe imen aci´on comienza con dos ases di e enciadas donde se p ueba con los dos
de ec o es mencionados p e iamen e. Pa a cada uno de ellos, se han aplicado de mane a
com´un las CNN Incep ion yResNe .
Adem´as, en pa icula , se ha aplicado MobileNe al de ec o SSD, ya que al se la ed
m´as simple pod ´ıa po encia a´un m´as la elocidad de in e encia que os en an los de ec o es
de una e apa y, po o o lado, se ha aplicado Incep ion-ResNe aFas e R-CNN pa a
po encia el endimien o de los de ec o es de dos e apas con un ex ac o m´as complejo.
5.2.1. Fase 1: Expe imen os Realizados con el De ec o SSD
Se ealiz´o una p ime a ase donde se p ob´o con el De ec o SSD. En ´el se u iliza on
p incipalmen e 3 ex ac o es de ca ac e ´ıs icas di e en es, en e los que se encuen an:
MobileNe ,Incep ion yResNe .
5.2.1.1. MobileNe
El p ime modelo que se ha p obado, se bas´o en MobileNe . Con es a se hicie on odas
las p uebas necesa ias pa a en ende como uncionaba la de ecci´on con Tenso Flow y se
en en´o el modelo an as eces has a que se consigui´o en ende como consegui oda la
in o maci´on necesa ia pa a un an´alisis pos e io .
Es e modelo ue el de onan e pa a pensa o as al e na i as m´as po en es pa a pode
ealiza las p uebas, debido a que se en en´o en el o denado en local y a d´o 5 d´ıas
en e ec ua 200000 pasos de ejecuci´on. Esa p ueba que se hizo, no gene ´o odos los
checkpoin s necesa ios pa a pode c ea luego un modelo del cual se pueda in e i sob e
nue as im´agenes, po lo que qued´o desechada.
Mien as se buscaba la soluci´on al p oblema de los checkpoin s y se es aba comenzando
a hace la ins alaci´on necesa ia en una m´aquina disponible en la nube, se sigui´o haciendo
p uebas con es e modelo in en ando pa a el en enamien o cuando se comenza a a e
O e i ing en ´el.
Finalmen e, se pudo comple a el en enamien o en 40 ho as en la m´aquina local y se
gene ´o el modelo que se e en la Figu a 5.1.
Figu a 5.1: Cu as de ap endizaje de SSD con MobileNe
58 Cap
´
ı ulo 5. Expe imen os y Resul ados
Como se puede e en la g ´a ica, se e ec ua on 70000 pasos de ejecuci´on y se ap ecia
que no se consigue un buen ajus e en e las dos cu as gene adas.
Si se sigue la ayec o ia de es as dos cu as, se e que ambas ienen un cos e bas an e
al o pe o con in´uan disminuyendo has a los 43200 pasos de ejecuci´on ap oximadamen e.
En ese pun o, el cos e de alidaci´on comienza a ascende , mien as que el de en enamien o
sigue bajando, po lo que se pod ´ıa de e mina que a pa i de ese pun o comienza a habe
un sob eajus e.
En ese ins an e del en enamien o, se ha gene ado el modelo y se han ob enido los
siguien es esul ados:
En la Tabla 5.3, se obse a la p ecisi´on media ob enida du an e el en enamien o, jun o
con la p ecisi´on media sob e los umb ales IOU de 0.5 y 0.75. Como se puede e , no es
una media muy buena y, como es ob io, empeo a bas an e cuan o mayo es el umb al de
la localizaci´on.
Tabla 5.3: P ecisi´on media usando SSD con MobileNe
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
30.35 63.92 23.22
La Tabla 5.4, ep esen a los esul ados que se ob ienen en cuan o a p ecisi´on se e ie e
dependiendo de la dis ancia a la que se encuen e la ca a en la imagen. Pa a ca as que se
encuen a muy alejadas, la p ecisi´on es bas an e mala, con solo un 5.94 %. Sin emba go,
seg´un an haci´endose m´as g ande, la p ecisi´on aumen a has a un 53.11 % en su mayo
ama˜no.
Tabla 5.4: P ecisi´on media en dis in as dis ancias usando SSD con MobileNe
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
5.94 26.32 53.11
En cuan o a la exhaus i idad, se ap ecia que ealizando una sola de ecci´on, se ob iene
un esul ado bas an e malo ambi´en con un 13.36 %. Es e po cen aje aumen a seg´un se
inc emen a el n´ume o de de ecciones ealizadas. Es o se puede e en la Tabla 5.5.
Tabla 5.5: Exhaus i idad media usando SSD con MobileNe
AR@1 ( %) AR@10 ( %) AR@100 ( %)
13.36 32.82 35.76
Es os esul ados mejo an cuando las ca as que se es ´an de ec ando es ´an bas an e
ce ca en la imagen, a ´andose as´ı un 58.47 % en es e caso. Al igual que con la p ecisi´on,
en os os lejanos, es bas an e malo el esul ado y, con ca as a dis ancia media, se man iene
de o ma pa ecida que en AR@100. Se mues a es o en la Tabla 5.6.
Tabla 5.6: Exhaus i idad media en dis in as dis ancias usando SSD con MobileNe
AR Small ( %) AR Medium ( %) AR La ge ( %)
8.67 32.54 58.47
5.2. Expe imen os 59
Es de debida impo ancia des aca y ecalca que los esul ados que se acaban de
menciona con las dis in as ablas, es ´an basados no solo en el pun o de los 43.200 pasos
de ejecuci´on, sino ambi´en en los 10 checkpoin s an e io es a ´el. En es e caso, es a ´ıan
incluidos odos los checkpoin s desde el paso de ejecuci´on 0. Al habe an a di e encia de
endimien o, los esul ados se en empeo ados. Debido a ello, se a a calcula an o la
p ecisi´on, como la exhaus i idad y a ealiza un ecuen o de los ipos de p edicciones que
se han ealizado ´unicamen e en el pun o de mayo endimien o.
Como se mues a en la Tabla 5.7, se han pues o los esul ados seg´un el umb al de IOU,
como es ipulan las m´e icas de COCO.
Tabla 5.7: Resul ados m´as espec´ı icos usando SSD con MobileNe
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 94.52 64.44 7573 4178 439 0 62.12
@.55 IOU 94.48 64.40 7568 4183 442 0 62.06
@.60 IOU 94.41 64.31 7558 4193 447 0 61.96
@.65 IOU 94.41 64.28 7554 4197 447 0 61.92
@.70 IOU 94.26 64.16 7540 4211 459 0 61.75
@.75 IOU 94.24 64.13 7536 4215 460 0 61.71
@.80 IOU 94.04 63.95 7515 4236 476 0 61.46
@.85 IOU 93.72 63.65 7480 4271 501 0 61.05
@.90 IOU 93.33 63.18 7425 4326 530 0 60.45
@.95 IOU 89.55 58.64 6891 4860 804 0 54.88
Media 93.69 63.51 7464 4287 500 0 60.92
Se puede e que la p ecisi´on mejo a bas an e en compa aci´on con el endimien o
an e io , siendo es e de un 93.69 %. Es o signi ica que casi el 94 % de las eces, los obje os
de ec ados coinciden con los o iginales. Sin emba go, la exhaus i idad es bas an e peo
siendo de un 63.51 %. Es o e leja que el modelo no es capaz de de ec a muchas ca as y,
en consecuencia, el n´ume o de alsos nega i os es bas an e g ande.
Todo es o da una exac i ud de casi un 61 %, signi icando que el 61 % de las eces, una
ca a a a se co ec amen e de ec ada.
Se an a conside a aho a a explica los esul ados que se han ob enido u ilizando es e
modelo pa a in e i no solo en ´ıdeos, sino ambi´en en s eaming en Twi ch yYouTube y
con una Webcam.
Como se puede e en la Tabla 5.8, esul a se un modelo bas an e ´apido en cuan o
a iempo de in e encia se e ie e, siendo el iempo de de ecci´on casi ins an ´aneo: 0.013
segundos. Pa a el n´ume o de 3398 o og amas, es capaz de p ocesa los con un a io de 33
FPS en ´ıdeos y 18 en webcam. Es una can idad bas an e al a pa a ambos y le hace un
buen candida o pa a usa en o ma o s eaming.
En de ini i a, usando MobileNe como ex ac o de ca ac e ´ıs icas p opo ciona ´ıa un
modelo ´apido a la ho a de de ec a sob e los o og amas de un ´ıdeo, no obs an e, peca ´ıa
de no ene una g an exac i ud. P incipalmen e es o se debe a que con iene muchos alsos
nega i os, que hace que muchos os os no sean de ec ados. En la Figu a 5.2 se pueden
mos a algunos ejemplos de de ecciones ealizados con es e modelo.
60 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.8: Resul ados usando el modelo SSD con MobileNe en ´ıdeos y s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.013 segundos 33
Webcam 3398 0.013 segundos 18
YouTube 3398 0.013 segundos 5
Twi ch 3398 0.013 segundos 8
Figu a 5.2: Ejemplos de de ecci´on usando SSD con MobileNe
En las im´agenes se pueden ap ecia como ac ´ua con un g upo de pe sonas a co a,
media y la ga dis ancia, as´ı como con pe sonas de o igen asi´a ico.
5.2.1.2. Incep ion
El segundo modelo que se ha c eado, se bas´o en la CNN Incep ion. Es a inalmen e se
ejecu ´o en la ins ancia que c eada en la nube y se pudo pe cibi los p ime os a isbos
de la g an decisi´on que se hab´ıa omado al busca o a al e na i a pa a ealiza los
en enamien os. El iempo de ejecuci´on ue ´unicamen e de 22 ho as, en compa aci´on con
las 111 ho as que hubiese a dado ap oximadamen e en ejecu a se en nues o o denado
en local.
En es e pun o ambi´en se hab´ıa en endido po comple o como gene a odos los a chi os
ycheckpoin s necesa ios pa a pode c ea un modelo m´as a de pa a se analizado. Debido
a es o, se pas´o a en ena el modelo y se consigui´o la cu a de ap endizaje que se ap ecia
en la Figu a 5.3.
Como se puede e en ella, es a ez se dej´o m´as iempo en enando, llegando a los
200000 pasos de ejecuci´on. Pa a pode analiza de mane a adecuada es a cu a, se ha ´a
po pa es.
5.2. Expe imen os 61
Figu a 5.3: Cu as de ap endizaje de SSD con Incep ion
En p ime luga , se e que an o el cos e de en enamien o como de alidaci´on
comienzan desde un pun o m´as bajo que MobileNe , lo que pod ´ıa se una se˜nal de que es
un mejo modelo. Al comienzo y has a los 10000 pasos de ejecuci´on ap oximadamen e, el
cos e de alidaci´on es meno que el de en enamien o, lo cual signi ica que en ese ins an e
el conjun o de alidaci´on e a mucho m´as ´acil de p edeci que el de en enamien o.
Sin emba go, cuando se pasa es a ba e a, el cos e de en enamien o comienza a
descende m´as ´apidamen e que el de alidaci´on, llegando has a los 42000 pasos de
ejecuci´on, donde los dos es ´an en el pun o m´as bajo en com´un.
A pa i de aqu´ı, el cos e de alidaci´on comienza de nue o a ascende y el de
en enamien o con inua bajando, po lo que se puede conside a el pun o de sob eajus e
del modelo. Es e es el paso de ejecuci´on elegido pa a gene a el modelo.
Al igual que pas´o con MobileNe , los esul ados que se an a mos a a con inuaci´on
es ´an basados no solo en el ins an e escogido, sino ambi´en en los 10 checkpoin s an e io es.
En es e caso, se es a ´ıan eniendo en cuen a los esul ados ob enidos desde el p incipio
ambi´en, po lo que el endimien o en el pun o 42000 debe se mejo .
Como se e en la Tabla 5.9, se ob iene una p ecisi´on media de 35.31 % que es simila
a la ob enida con un umb al de 0.75 IOU y casi la mi ad eniendo un 0.5 de IOU. Pese a
no se p ecisiones muy buenas ampoco, se obse a que son mejo es que las ob enidas con
el modelo an e io .
Tabla 5.9: P ecisi´on media usando SSD con Incep ion
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
35.31 67.12 33.03
Si se p es a a enci´on con m´as de alle en la p ecisi´on ob enida seg´un la dis ancia a la
que es ´e el os o 5.10, se e ´a que la de ecci´on sigue siendo bas an e mala pa a las ca as
que se encuen an alejadas. Lo mismo ocu e pa a os os a media y la ga dis ancia, siendo
es e ´ul imo donde mejo p ecisi´on se ob iene. No obs an e, los es esul ados uel en a
se mejo que usando MobileNe .
62 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.10: P ecisi´on media a dis in as dis ancias usando SSD con Incep ion
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
7.73 31.78 58.27
Se pasa aho a a analiza la exhaus i idad. Como se puede e en la Tabla 5.11, es a
uel e a se mejo en odos los aspec os, espec o al modelo an e io eniendo como m´aximo
esul ado un 41 % en 100 de ecciones. De igual mane a pasa con la exhaus i idad si se mide
con espec o a la dis ancia (Tabla 5.12): pese a se bas an e mala, mejo a en compa aci´on
con MobileNe , eniendo como m´aximo esul ado un 64 % cuando la ca a se encuen a en
una posici´on ce cana.
Tabla 5.11: Exhaus i idad media usando SSD con Incep ion
AR@1 ( %) AR@10 ( %) AR@100 ( %)
14.51 37.09 40.95
Tabla 5.12: Exhaus i idad media en dis in as dis ancias usando SSD con Incep ion
AR Small ( %) AR Medium ( %) AR La ge ( %)
11.44 37.89 64.21
Una ez se han mos ado los esul ados ob enidos mien as el en enamien o se es aba
ealizando, se p ocede a e cu´ales son ealmen e los que se ob ienen jus o en el pun o en
el que se ha c eado el modelo, u ilizando pa a ello di e sos umb ales de IOU.
Como se e en la Tabla 5.13, la p ecisi´on mejo a bas an e ambi´en con espec o a
los esul ados mos ados en las ablas an e io es. Lo mismo ocu e con la exhaus i idad,
mejo a aunque en meno medida que la p ecisi´on.
Tabla 5.13: Resul ados m´as espec´ı icos usando SSD con Incep ion
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 92.44 75.04 8818 2933 721 0 70.70
@.55 IOU 92.34 74.93 8806 2945 730 0 70.55
@.60 IOU 92.31 74.90 8802 2949 733 0 70.50
@.65 IOU 92.24 74.83 8794 2957 739 0 70.40
@.70 IOU 92.14 74.75 8784 2967 749 0 70.27
@.75 IOU 92.06 74.66 8774 2977 756 0 70.15
@.80 IOU 91.87 74.48 8753 2998 774 0 69.88
@.85 IOU 91.47 74.11 8709 3042 812 0 69.32
@.90 IOU 90.91 73.49 8636 3115 863 0 68.46
@.95 IOU 87.88 69.82 8205 3546 1131 0 63.69
Media 91.56 74.10 8708 3043 801 0 69.37
El 91.56 % de las eces los obje os de ec ados coinciden con los o iginales, sin emba go,
hay oda ´ıa una can idad conside able de alsos nega i os que hace baja su exhaus i idad.
5.2. Expe imen os 63
No obs an e, si se compa a con los esul ados ob enidos en MobileNe , se es ´a an e
un modelo m´as equilib ado en cuan o a p ecisi´on y exhaus i idad se e ie e y, po an o,
la exac i ud esul an e es conside ablemen e mayo : un 69 %, haciendo de es e el mejo
modelo p obado has a el momen o.
Una ez se ha hallado la exac i ud, se p ocede a e qu´e endimien o o ece el modelo
al in e i en s eaming y en ´ıdeos, con la Tabla 5.14.
Tabla 5.14: Resul ados usando el modelo SSD con Incep ion en ´ıdeos y s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.019 segundos 28
Webcam 3398 0.021 segundos 15
YouTube 3398 0.021 segundos 4
Twi ch 3398 0.020 segundos 7
En ella se obse a que el iempo de in e encia, y en consecuencia los FPS, es bas an e
simila al ob enido con el modelo que usa MobileNe . Tan o pa a ´ıdeo como pa a c´ama a
web, sigue siendo una can idad bas an e al a pa a pode conside a lo un g an modelo
que pe mi a su uso en s eaming y dado que el endimien o en ´e minos gene ales es
conside ablemen e mayo , se pod ´ıa pensa que es e modelo es bas an e mejo que el
an e io p obado.
Finalmen e, en la Figu a 5.4, se puede e algunos ejemplos de su endimien o en el
momen o de de ecci´on.
Figu a 5.4: Ejemplos de de ecci´on usando SSD con Incep ion
En los ejemplos se e un g upo de pe sonas asi´a icas, una euni´on que con iene algunos
os os gi ados y es beb´es cub i´endose la ca a con unas ga as de sol.
70 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.26: Resul ados usando el modelo Fas e R-CNN con Incep ion en ´ıdeos y
s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.058 segundos 13
Webcam 3398 0.055 segundos 13
YouTube 3398 0.058 segundos 3
Twi ch 3398 0.061 segundos 4
Adem´as de eso, p opo ciona una mejo exac i ud po lo que pod ´ıa conside a se o o
buen candida o pa a usa en iempo eal.
En la Figu a 5.8 se mues an algunos ejemplos de de ecciones ealizados con es e
modelo. En ella se ap ecia como se de ec a a la pe ecci´on os os ya sea con la ca a
pin ada o po ando un casco. Adem´as, a di e encia de los modelos que usan SSD como
de ec o , se e que los esul ados a la gas dis ancias son m´as a o ables.
Figu a 5.8: Ejemplos de de ecci´on usando Fas e R-CNN con Incep ion
5.2.3.2. ResNe
El modelo ResNe es el segundo que se ha p obado con es e de ec o . Las p uebas se
hicie on de nue o en Cloud y el en enamien o du ´o unas 18 ho as. De no habe sido po
es a pla a o ma, hubie a demo ado 51 ho as, es deci , un poco m´as de dos d´ıas comple os
en pode ob ene unos esul ados.
En la Figu a 5.9, se puede e las cu as de ap endizaje gene adas al ealiza el
en enamien o.
5.2. Expe imen os 71
Figu a 5.9: Cu as de Ap endizaje de Fas e R-CNN con ResNe
En ella se ap ecia que el cos e an o de en enamien o como de alidaci´on es lige amen e
supe io al que usa Incep ion, al igual que la di e encia exis en e en e el pun o m´as al o
y el m´as bajo. Adem´as, el cos e ambi´en es bas an e in e io al que se puede halla en
Incep ion con SSD.
Pese a se m´as bajo el cos e de alidaci´on al comienzo de la cu a, ´apidamen e
se adap a y consigue un ajus e bas an e bueno has a el paso de ejecuci´on 95000
ap oximadamen e: el pun o donde se ha gene ado el modelo. A pa i de ah´ı comienza
a sucede un lige o o e i ing el cual debe e i a se.
En la Tabla 5.27 se pueden e los esul ados que se ob ienen en cuan o a p ecisi´on
media.
Tabla 5.27: P ecisi´on media usando Fas e R-CNN con ResNe
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
47.01 82.75 48.63
Los es alo es supe an los p oducidos usando Incep ion como CNN. El alo en el
que m´as aumen o se ha p oducido ha sido especialmen e cuando se es ablece la es icci´on
de 0.75 en el IOU, po lo que se p oduci ´ıa una localizaci´on m´as e ec i a.
Si se compa an eniendo en cuen a la lejan´ıa del os o en la Tabla 5.28, se uel e a e
que los esul ados son de nue o a o ables an o pa a la gas como pa a medias dis ancias.
Sin emba go, en co as dis ancias se man iene el mismo esul ado.
Tabla 5.28: P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con ResNe
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
13.97 44.53 63.84
Se p ocede po ´ul imo a analiza qu´e ha ocu ido con la exhaus i idad. Si se p es a
a enci´on en la exhaus i idad media (Tabla 5.29), no ha aumen ado demasiado con espec o
aIncep ion. El alo m´as des acable es 52.46 % cuando se ealizan 100 de ecciones,
supe ando en un 4 % al ob enido con el modelo an e io . Lo mismo ocu e con 5.30,
p oduci´endose un lige o aumen o en las es m´e icas.
72 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.29: Exhaus i idad media usando Fas e R-CNN con ResNe
AR@1 ( %) AR@10 ( %) AR@100 ( %)
16.37 45.91 52.46
Tabla 5.30: Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con ResNe
AR Small ( %) AR Medium ( %) AR La ge ( %)
32.31 50.42 68.14
En es e caso, uel e a pasa lo mismo que ocu i´o usando SSD con ResNe . La g ´a ica
p esen a una endencia bas an e ec a desde el paso de ejecuci´on 40000 has a el 100000
ap oximadamen e. En es e ango se e in oluc ado los 10 checkpoin s an e io es al que se
ha elegido pa a gene a el modelo. Po lo an o, los esul ados du an e el en enamien o en
es a pa e, es u ie on menos in luenciados po la al a a iabilidad de la cu a y se ace can
m´as a la ealidad que en el caso de Fas e R-CNN con Incep ion, el cual debe ´ıan se unos
esul ados mayo es si no se hubiese is o a ec ado po es e mo i o.
Los esul ados que se han gene ado al cen a se ´unicamen e en los 95000 pasos de
ejecuci´on son los que se pueden e en la Tabla 5.31. En p ime a ins ancia, se e que la
elaci´on p ecisi´on-exhaus i idad es m´as desequilib ada que la ob enida en Fas e R-CNN
con Incep ion. Se ca ac e iza po ene una exhaus i idad mayo que la p ecisi´on, po lo
que el modelo se ´a capaz de de ec a m´as os os, pe o ambi´en sucede ´a un mayo n´ume o
de alsos posi i os.
Tabla 5.31: Resul ados m´as espec´ı icos usando Fas e R-CNN con ResNe
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 79.52 89.60 10529 1222 2711 0 72.80
@.55 IOU 79.50 89.56 10525 1226 2713 0 72.76
@.60 IOU 79.49 89.53 10521 1230 2714 0 72.73
@.65 IOU 79.44 89.48 10515 1236 2720 0 72.66
@.70 IOU 79.38 89.41 10507 1244 2728 0 72.56
@.75 IOU 79.16 89.27 10491 1260 2743 0 72.38
@.80 IOU 79.16 89.09 10470 1281 2756 0 72.17
@.85 IOU 78.93 88.79 10434 1317 2785 0 71.78
@.90 IOU 78.61 88.17 10362 1389 2819 0 71.11
@.95 IOU 77.01 85.09 9999 1752 2984 0 67.85
Media 79.02 88.79 10435 1315 2767 0 71.88
Es o se e cla amen e e lejado en su exac i ud, siendo un poco meno que en Incep ion,
pe o lige amen e mayo que en el mejo modelo de SSD, donde los esul ados ue on jus o
al e ´es eniendo una p ecisi´on mayo que la exhaus i idad.
El esul ado que se obse a en ´ıdeos y s eaming (Tabla 5.32) es pa ecido a su
hom´onimo usando el de ec o SSD. Es de los peo es modelos analizados has a el momen o
en es e sen ido, eniendo la capacidad de p ocesa 8 FPS en el caso de los ´ıdeos y la
webcam. Po lo que, has a el momen o, no le ha ´ıa me ecedo de se mejo que el modelo
compues o po Fas e R-CNN eIncep ion, debido a su exac i ud y el endimien o que se
acaba de e en ´ıdeos y s eaming.
5.2. Expe imen os 73
Tabla 5.32: Resul ados usando el modelo Fas e -RCNN con ResNe en ´ıdeos y s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.112 segundos 8
Webcam 3398 0.103 segundos 8
YouTube 3398 0.110 segundos 1
Twi ch 3398 0.109 segundos 3
En la Figu a 5.10 se pueden e algunos de ejemplos de c´omo se compo a es e
modelo en di e sas im´agenes. En ellas se ap ecia como, a pesa de habe una se ie de
pe sonas con la ca a apada con masca illas o indumen a ia mili a , es capaz de de ec a les
pe ec amen e.
Figu a 5.10: Ejemplos de de ecci´on usando Fas e R-CNN con ResNe
5.2.3.3. Incep ion-ResNe
Incep ion-ResNe ue el ´ul imo ex ac o que se ha usado pa a conclui con es a ase de
expe imen aci´on. La a qui ec u a de es a CNN se basa en hace una ed h´ıb ida en e
Incep ion yResNe . Du an e su en enamien o, llam´o la a enci´on que ue una de las que
m´as a d´o en ejecu a se, llegando a la can idad de 44 ho as en la ins ancia albe gada en
la nube, lo que se hubie a aducido en 109 ho as ap oximadamen e en nues o o denado
en local.
74 Cap
´
ı ulo 5. Expe imen os y Resul ados
Finalmen e se consigui´o ejecu a el modelo y gene a las g ´a icas co espondien es, las
cuales se pueden e en la Figu a 5.11.
Figu a 5.11: Cu as de Ap endizaje de Fas e R-CNN con Incep ion-ResNe
Como se puede e en ella, se ol ie on a ejecu a 200000 pasos de ejecuci´on en los
que el cos e ol i´o a se simila a los modelos p obados con Fas e R-CNN. Pese a que
el cos e de alidaci´on se man u o bas an e lineal du an e odo el en enamien o, el de
en enamien o ue cada ez siendo meno , llegando a c uza se al ededo de los 100000
pasos de ejecuci´on y eniendo como pun o com´un m´as bajo el ins an e de los 123000 pasos
de ejecuci´on.
Los esul ados ob enidos en cuan o a p ecisi´on media en la Tabla 5.33 son
p ome edo es. Si se compa an con odos los que se han ob enido has a el momen o se
pod ´a e que son los mejo es. En compa aci´on con SSD eIncep ion, se puede e que
la p ecisi´on media aumen a un 19 % y casi un 28 % pa a el caso en el que se impone la
es icci´on de IOU en 0.75.
Tabla 5.33: P ecisi´on media usando Fas e R-CNN con Incep ion-ResNe
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
54.37 87.79 61.36
Con espec o a Fas e R-CNN eIncep ion, se ob ienen muy buenos esul ados ambi´en,
p oduci´endose un inc emen o del 20 % eniendo un 0.75 de IOU y casi un 12 % en la
p ecisi´on media.
A endiendo a la p ecisi´on con espec o a la dis ancia (Tabla 5.34, se e que donde se
p oduce un mayo endimien o en compa aci´on con SSD eIncep ion yFas e R-CNN e
Incep ion es a media dis ancia, donde aumen a un 22 % y un 15 % espec i amen e.
Tabla 5.34: P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
20.40 53.12 67.07
5.2. Expe imen os 75
Se p ocede aho a a mos a los esul ados que se han ob enido de exhaus i idad.
Como se puede ap ecia en las Tablas 5.35 y5.36, los esul ados uel en a aumen a
conside ablemen e. Se e leja un cla o inc emen o sob e odo en la m´e ica AR@100 y AR
Small, con espec o a las Tablas 5.23 y5.24.
Tabla 5.35: Exhaus i idad media usando Fas e R-CNN con Incep ion-ResNe
AR@1 ( %) AR@10 ( %) AR@100 ( %)
17.61 51.98 60.62
Tabla 5.36: Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe
AR Small ( %) AR Medium ( %) AR La ge ( %)
43.26 59.34 72.30
No solo ah´ı consiguen mejo a se los esul ados, sino que en compa aci´on con las Tablas
5.11 y5.12, pe enecien es al de ec o SSD, el inc emen o es a´un m´as acusado.
Pa a asegu a se de que es os esul ados pueden se iables, se a a e qu´e endimien o
iene el modelo sin ene en cuen a los ´ul imos checkpoin s:
En la Tabla 5.37 se puede e que la p ecisi´on ob enida no es de las mejo es, po lo que
se pueden p oduci una can idad conside able de alsos posi i os. No obs an e, iene una
exhaus i idad muy al a haciendo que es e modelo no deje sin de ec a una g an can idad de
os os. Es as medidas quedan e lejadas cla amen e en la columna de los alsos posi i os
y alsos nega i os, donde se e que, en cuan o a alsos posi i os, se p oducen casi 1100
m´as que en el caso de Fas e R-CNN con Incep ion. A su ez, se p oduce la mi ad de
alsos nega i os que en dicho modelo. Es os esul ados quedan e lejados en su exac i ud,
haciendo que sea el mejo con casi un 75 %.
Tabla 5.37: Resul ados m´as espec´ı icos usando Fas e R-CNN con Incep ion-ResNe
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 79.65 93.72 11014 737 2814 0 75.61
@.55 IOU 79.62 93.69 11010 741 2817 0 75.57
@.60 IOU 79.62 93.66 11006 745 2817 0 75.54
@.65 IOU 79.61 93.63 11003 748 2817 0 75.52
@.70 IOU 79.54 93.54 10992 759 2827 0 75.40
@.75 IOU 79.47 93.45 10982 769 2837 0 75.28
@.80 IOU 79.39 93.36 10971 780 2848 0 75.14
@.85 IOU 79.22 93.11 10942 809 2869 0 74.84
@.90 IOU 78.95 92.56 10877 874 2899 0 74.24
@.95 IOU 77.41 89.98 10574 1177 3085 0 71.27
Media 79.24 93.07 10937 814 2863 0 74.83
76 Cap
´
ı ulo 5. Expe imen os y Resul ados
Se obse a aho a c´omo se compo a con ´ıdeos y en pla a o mas de s eaming.
En la Tabla 5.38 se obse a que su endimien o en ´ıdeos es bas an e malo, p ocesando
un o og ama po segundo y, po an o, ob eniendo 1 FPS como esul ado. En cuan o a
s eaming, se puede e que se ob ienen unos esul ados bas an es malos ambi´en, po lo
que se pod ´ıa conclui que es e modelo no puede se usado en s eaming. No obs an e,
pese a los esul ados ob enidos en ´ıdeos, es un modelo que iene una exac i ud bas an e
buena y debe ene se en cuen a.
Tabla 5.38: Resul ados usando el modelo Fas e R-CNN con Incep ion-ResNe en ´ıdeos
ys eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.938 segundos 1
Webcam 3398 0.892 segundos 1
YouTube 3398 0.948 segundos 0.3
Twi ch 3398 0.943 segundos 0.5
En la Figu a 5.12 se e lejan algunos ejemplos de como ac ´ua es e de ec o . En las
im´agenes se ap ecia c´omo es capaz de de ec a a pe sonas bajo unas condiciones de luz
escasas y algunas le as ap´andoles la ca a. Adem´as, es capaz de encon a al conduc o
del coche y la ca a de o a pe sona pese a ene la apada y pin ada de colo es.
Figu a 5.12: Ejemplos de de ecci´on usando Fas e R-CNN con Incep ion-ResNe
5.2.4. Resul ados de la Fase 2
Como se ha podido e en el an´alisis de es a segunda ase, los modelos basadas en Fas e
R-CNN ac ´uan de una o ma m´as len a en cuan o a iempo de in e encia se e ie e, llegando
en algunos casos a p ocesa un o og ama po segundo.
5.2. Expe imen os 77
Sin emba go, queda demos ado que son las m´as e ec i as a la ho a de ealiza la
de ecci´on y su endimien o en es e sen ido es mucho mejo , eniendo como m´axima
exac i ud un 75 % ap oximadamen e en el caso de Incep ion-ResNe .
En p ime luga , el modelo basado en ResNe ol e ´ıa a queda desca ado pues o
que el endimien o que o ece an o en iempo como en exac i ud no es lo su icien emen e
bueno como pa a u iliza lo en es e caso.
Po o o lado, se end ´ıa a los modelos basados en Incep ion eIncep ion-ResNe .
Incep ion ha demos ado se bas an e bueno en exac i ud con un 74.59 %, una can idad de
alsos posi i os y alsos nega i os equilib ada y un iempo de in e encia en s eaming
semejan e al mejo modelo ob enido en la p ime a ase. En cambio, se ha is o que
Incep ion-ResNe es el mejo modelo que se ha podido c ea con un 74.83 % de exac i ud
y un escaso n´ume o de alsos nega i os que pe mi i ´ıan ealiza un mayo n´ume o de
de ecciones. Adem´as, pese a se bas an e len o en la in e encia, se pod ´ıa ap o echa es a
i ud pa a la de ecci´on en ´ıdeos, pues o que en esa si uaci´on no es c ucial el iempo que
se a da en p ocesa un o og ama.
Po an o, se pod ´ıa conclui que es os dos ´ul imos modelos comen ados son los mejo es
de es a segunda ase.
5.2.5. Elecci´on del Mejo Modelo
Dado que la expe imen aci´on se ha cen ado en di e encia los modelos no solo po
su exac i ud, sino ambi´en po su endimien o en ´ıdeos y s eaming, lo co ec o se ´ıa
p esen a un modelo po cada uno de es os dos usos. Se elegi ´a un modelo que es ´e mejo
adap ado pa a ´ıdeos y o o cuyo endimien o en s eaming sob esalga espec o al es o.
Pa a ello, se compa a ´an aquellos que se han p opues o como encedo es de cada una de
las dos ases, mos ando su exac i ud y los FPS de aquella pla a o ma en la que mejo
hayan endido. En es e caso, los modelos se han compo ado mejo con la webcam
En la Figu a 5.13 se puede e de mane a muy esumida el compo amien o de los es
modelos elegidos. En ella se obse a que la di e encia de FPS en e los modelos que usan
s´olo Incep ion no es muy g ande, pe mi iendo que puedan usa se ambos en iempo eal.
Es o no sucede as´ı con el caso del ´ul imo modelo, donde los esul ados en es e sen ido
dejan bas an e que desea .
Sin emba go, en el caso de la exac i ud, se obse a que Fas e R-CNN con Incep ion
ha ob enido mejo es esul ados que su e si´on con SSD. Adem´as, se obse a ambi´en que
son un poco in e io es a los que Incep ion-ResNe pod ´ıa p opo ciona .
Po an o, po odo lo analizado en es e cap´ı ulo, pod ´ıa conclui se que el modelo m´as
ap opiado pa a usa en ´ıdeos es Fas e R-CNN con Incep ion-ResNe , mien as que se
p opone usa Fas e R-CNN con Incep ion en el caso de s eaming.
78 Cap
´
ı ulo 5. Expe imen os y Resul ados
Figu a 5.13: Compa a i a inal de los mejo es modelos c eados
Cap´ı ulo 6
Apo aciones Indi iduales
6.1. A u o Ba be o P´e ez
Pese a habe cu sado la asigna u a de Ap endizaje Au om´a ico en la uni e sidad, es e
p oyec o supuso pa a m´ı un e o pues o que dicha asigna u a no ue su icien e pa a
en ende la p oblem´a ica que en´ıamos delan e y a la que nos es ´abamos en en ando.
Las a eas en las que me he is o in oluc ado y apo aciones que he ealizado al p oyec o
son las siguien es:
Lo p ime o que hice cuando conoc´ı a mis compa˜ne os ue p opo ciona les un eposi o io
con los apun es y p ´ac icas que hab´ıa ealizado du an e la asigna u a comen ada
p e iamen e. Dado que e a la ´unica pe sona del g upo con nociones en ML, decid´ı lle a
a cabo es o con el obje i o de que pudie an en ende es e campo con la mayo b e edad
posible y u i´e amos odos el mismo ni el a la ho a de abaja jun os.
Poco despu´es me di cuen a de que, pa a alige a el a ance del p oyec o, necesi ´abamos
un m´e odo pa a que odos supi´e amos qu´e cosas se han in en ado y qu´e conocimien o
ha adqui ido el g upo en gene al. Po ello, ab ´ı una unidad compa ida en Google D i e
donde a˜nad´ı unos documen os pa a que odos apun ´a amos los descub imien os que´ıbamos
haciendo y concep os di ´ıciles que hubi´e amos en endido has a el momen o. Adem´as, hice
una peque˜na in es igaci´on sob e la bibliog a ´ıa ecomendada y la a˜nad´ı al D i e. Con
el iempo, el equipo uimos subiendo a ´ıculos cien ´ı icos y es´umenes que nos se ´ıan a
odos.
Pa a en ende m´as la p oblem´a ica que en´ıamos an e noso os, ealic´e una se ie de
u o iales que es aban en la l´ınea de es e p oyec o. En e ellos se encon aban un so wa e
que pe mi ´ıa clasi ica im´agenes de pe os y ga os, y o o que pe mi ´ıa ealiza una
de ecci´on median e webcam di e enciando cuando un os o que sal´ıa en escena e a eal
o no. Los u o iales me si ie on pa a a ianza los conocimien os de ML que ya en´ıa y
empeza a in oduci me en el campo de CV.
En pa alelo a es os u o iales, ui haciendo una lec u a y sub ayado de los concep os
m´as impo an es que encon aba en unos abajos cien ´ı icos que nos p opo ciona on
nues os u o es, in en ando elaciona es os concep os con los u o iales que ealizaba,
pa a pode explic´a selos a mis compa˜ne os y u o es en euniones pos e io es.
Dado que hab´ıa ealizado un u o ial muy elacionado con nues a p oblem´a ica,
nues o u o p opuso di idi el g upo pa a que yo ue a in es igando m´as en la pa e
79
Cap´ı ulo 7
Conclusiones y T abajo Fu u o
7.1. Conclusiones
Una ez que el desa ollo del T abajo ha concluido, el equipo ha conseguido llega a las
siguien es conclusiones:
T as la ase de in es igaci´on y los esul ados ob enidos en los di e en es modelos,
los mejo es sis emas elegidos han dado un po cen aje de acie o del 74,59 % y 74,83 %,
espec i amen e. El equipo conside a es os esul ados bas an e acep ables aunque
mejo ables, eniendo en cuen a, en p ime a ins ancia, que es la p ime a ez que se
en en aban a un p oblema como el expues o en es e abajo. El equipo ha conseguido
a ios modelos an o pa a ealiza de ecciones en ´ıdeos como en s eaming. No han
enido en cuen a el p ep ocesamien o de las im´agenes, al igual que han enido muchos
desa ´ıos e´o icos a lo la go del p oceso y, sin emba go, han conseguido sis emas e icien es
en condiciones de imagen pob es, de ecci´on de m´ul iples os os po o og ama y una
elocidad de p ocesamien o acep able pa a pode ealiza de ecciones en iempo eal.
Adem´as, el equipo ha con ado con el iempo su icien e pa a asegu a se de que los modelos
elegidos son los m´as e icien es, pues o que en la ase de expe imen aci´on ha podido
ealiza m´ul iples p uebas con di e en es combinaciones, las cuales no han dado los mismos
esul ados en compa aci´on con los elegidos.
Po o o lado, el habe expe imen ado con una amplia a iedad de a qui ec u as, ha
pe mi ido que se ea de una mane a m´as cla a cu´ales son los modelos que se debe ´ıan usa
dependiendo de los obje i os que se es ´an pe siguiendo. Adem´as de es o, los in eg an es
del g upo c een que puede se un g an apo e pa a la comunidad cien ´ı ica el ene una
e e encia donde se compa en dis in as ´ecnicas pa a que cada pe sona u ilice la que m´as
le con enga. El equipo de abajo c ee i memen e en que los esul ados, son bas an e
posi i os eniendo en cuen a la di icul ad del p oblema p opues o y ambi´en conside ando
que se pa ´ıa de ninguna base, m´as all´a de los conocimien os b´asicos sob e el ema.
Adem´as, as una exhaus i a in es igaci´on en la que se explo a on una pa e de los
concep os que aba can es e ´a ea de es udio, muchos ue on los p oblemas pa a con inua
y hace le en e a los desa ´ıos que se plan eaban a dia io, aunque el equipo ha sido capaz
de hace les en e de mane a sa is ac o ia. El equipo de abajo piensa, po consiguien e,
que la complejidad que implica es e ´a ea de in es igaci´on es mucho m´as de la que se
puede imagina a simple is a. Son muchos los ac o es a ene en cuen a a la ho a de
c ea modelos p ecisos y es mucho el iempo que es necesa io in e i pa a consegui
87
88 Cap
´
ı ulo 7. Conclusiones y T abajo Fu u o
esul ados uc ´ı e os. Adem´as, y m´as conc e amen e en el ´a ea de la de ecci´on acial, es
necesa io un conocimien o y expe iencia p e ia pa a pode en ende la p oblem´a ica en
su o alidad. C ea un modelo p eciso no consis e ´unicamen e en elegi capas y nodos de
mane a alea o ia, es necesa ia una expe imen aci´on muy p ecisa pa a consegui esul ados
dignos y aco des a los espe ados. En lo que se e ie e a es e abajo, aunque los esul ados
son so p enden emen e buenos, el equipo iene la ce eza de que pod ´ıa se mucho mejo es
si se conociese el ´a ea y con ex o de abajo y es udio, lo que implica ´ıa una educci´on de
la complejidad y una mayo acilidad pa a cons ui un sis ema al amen e pun e o.
Po ´ul imo, as la ase de expe imen aci´on, se descub i´o la complejidad que supone
encon a el equilib io en e la e ec i idad y la e iciencia de un modelo de de ecci´on. Lo
que quie e deci es o es que cuando un sis ema es al amen e p eciso y e ec i o, su e iciencia
disminuye exponencialmen e, como se ha podido llega a e en los esul ados ob enidos en
el p oceso de expe imen aci´on. En algunos casos, la e iciencia e a an baja que se p ocesaba
solo una imagen po segundo, y es e no es pa a nada el esul ado espe ado pa a consegui
an´alisis de ´ıdeos de mane a ´apida. Po o o lado, si se consigue un modelo que p ocese
las im´agenes a una g an elocidad, es e con a ´a con una asa de inexac i ud m´as al a y con
una p ecisi´on inal m´as baja, consigui´endose as´ı un sis ema poco e ec i o aunque e icien e.
Es po ello que nues a elecci´on inal ha sido aquella que consegu´ıa el equilib io en e
es as dos m´e icas, apa en emen e con a ias e imposibles de explo a en su o alidad de
mane a simul ´anea. A´un as´ı, como se explica ´a en el siguien e apa ado, es e equilib io
en e e ec i idad y e iciencia puede llega a se mejo de lo que se ha conseguido si se
in es iga su icien emen e en la con igu aci´on de los modelos elegidos.
7.2. T abajo Fu u o
Como posibles abajos u u os pueden se˜nala se los siguien es:
•LSTM pa a la ex acci´
on de ca ac e ´
ıs icas: Aunque du an e oda la ase
de expe imen aci´on el equipo es u o p obando con nume osas con igu aciones de
modelos, es cie o que no se p oba on las ´ecnicas usadas en el a ´ıculo acad´emico
[LLT17], elacionadas con el uso de LSTM, debido a la inexpe iencia en implemen a
es e ipo de sis emas po la complejidad que es o conlle aba, an o a ni el e´o ico
como a ni el ´ecnico. Como se puede obse a en el es ado del a e de es a memo ia
si uado en el cap´ı ulo 3, es e a ´ıculo mues a una posible a qui ec u a aplicando es e
ipo de Red Neu onal, con la que se consiguen unas ex acciones de ca ac e ´ıs icas
de mejo calidad. Es po ello que el equipo c ee que pod ´ıan mejo a las asas de
acie os de los modelos si se aplica an dichas soluciones, y, po an o, se conside a
que pod ´ıa se un buen pun o de pa ida de ca a a mejo a la p ecisi´on inal de los
modelos elegidos.
•Mejo a de los pa ´
ame os de con igu aci´
on: Aunque, como se ha explicado
an e io men e, el equipo piensa que los esul ados que se han ob enido son
sa is ac o ios, y ha conseguido sis emas e icien e a la pa que e ec i os, el equipo
c ee que la con igu aci´on de es os modelos pod ´ıa mejo a se de ca a a consegui un
mejo equilib io en e la apidez de de ecci´on y la e ec i idad a la ho a de ealiza la.
Po ello, se c ee que un p oceso de in es igaci´on sob e los pa ´ame os de con igu aci´on
de los modelos puede se muy posi i o de ca a a mejo a la asa de acie os sin que
es o a ec e a la elocidad de p ocesamien o.
7.2. T abajo Fu u o 89
•P ep ocesado de las im´
agenes: T as ealiza la expe imen aci´on, el equipo c ee
que es posible que, aunque se mi igue en cie a medida, el p oblema con la calidad de
la imagen puede segui siendo un ac o que disminuya la e ec i idad de la de ecci´on.
Si una imagen posee cie os aspec os como baja iluminaci´on, pixelaci´on, di uminaci´on
o, simplemen e, esoluci´on pob e, la a ea de la de ecci´on del os o puede supone
un g an e o incluso pa a una ed muy pun e a y bien en enada.
Es po ello que se piensa que la idea de un p ep ocesamien o de la imagen puede
supone un aumen o signi ica i o en la p ecisi´on y e ec i idad del modelo en cues i´on.
Dicho sis ema de p ep ocesamien o se enca ga ´ıa de calib a cie as p opiedades de
la imagen, como el b illo, el con as e o el colo . Tambi´en pod ´ıa enca ga se de a˜nadi
p´ıxeles ex as a la imagen inal, pa a a˜nadi le calidad a es a y pode as´ı a˜nadi m´as
in o maci´on pa a el modelo. Es o pod ´ıa ealiza se de mane a p og am´a ica, es deci ,
con alg´un ipo de algo i mo que ealice la calib aci´on en unci´on de los pa ´ame os
iniciales de la imagen, o, po o o lado, se puede c ea un modelo m´as que es ´e
en enado pa a aumen a la calidad inal de la composici´on.
•Inco po aci´
on de la es imaci´
on de la edad: T as ealiza es e abajo, el equipo
sien e que el p oyec o inal ealizado pod ´ıa se i como un g an sis ema de de ecci´on
acial pa a el an´alisis o ense. Se c ee que los modelos inales pueden llega a se , si
bien no pe ec os, bas an e ce e os a la ho a de ealiza de ecciones aciales en ´ıdeo
e, incluso, en s eaming. Sin emba go, no se ha podido iempo a c ea un sis ema que
ealice p edicciones de la edad de mane a ce e a y e icien e. Es posible que dicho
sis ema, en combinaci´on con el abajo inal, pueda se de mucha mayo u ilidad
pa a el an´alisis o ense, pues o que, en nume ables ocasiones, la edad de los suje os
implicados es de e minan e pa a pode acla a la g a edad o la legalidad de los hechos
ocu idos en el me aje. Es po ello que el equipo c ee que una es imaci´on de la edad
puede se un g an paso a ealiza pa a pode consegui un sis ema plenamen e capaz
de se usado pa a el an´alisis o ense.
•E ique ado de las de ecciones: A la ho a de ealiza el an´alisis o ense sob e ´ıdeo
es posible que sea necesa io sabe , no solo el o los os os que apa ecen en ella, sino
ambi´en cie as ca ac e ´ıs icas sob e ellos que puedan se c uciales pa a el p oceso de
in es igaci´on, como puede se el nomb e, el colo de piel, la aza o, incluso, el colo
del pelo. Po ello, el equipo a i ma que pod ´ıa se in e esan e a˜nadi e ique ado en las
de ecciones de los os os, do ando a los modelos de la capacidad de iden i icaci´on.
Ac ualmen e, cuando los modelos inales consiguen de ec a una ca a en una imagen,
es a apa ece con la e ique a de Face. Aunque dicha e ique a deja bas an e cla o lo
que es ´a de ec ando, es cie o que pod ´ıan apa ece cie as p opiedades del os o
en cues i´on, como un conjun o de e ique as ales como Face, blue eyes, caucasian o
algo elacionado. A˜nadi m´as in o maci´on a la de ecci´on pod ´ıa llega a se muy ´u il
pa a, po ejemplo, sabe en cues i´on de muy poco iempo si un indi iduo en conc e o
apa ece en los me ajes obse ados po el modelo.
•So wa e de sopo e: T as la ase de expe imen aci´on, se con aba con los modelos
m´as p ecisos pa a ealiza las de ecciones. Pa a c ea las salidas del modelo, se
codi ica on di e en es sc ip s que pe mi ´ıan que el modelo consiguiese de ec a los
os os en una imagen o un ´ıdeo, el cual e a la en ada de dichos sc ip s. Pa a la
ejecuci´on de es os, e a necesa io que el p oceso se ealizase en una e minal, pues o
que no exis ´ıa ning´un sopo e so wa e pa a la ejecuci´on de dichos sc ip s. Es po ello
que el equipo c ee opo uno el desa ollo de un componen e so wa e que pe mi a
90 Cap
´
ı ulo 7. Conclusiones y T abajo Fu u o
u iliza los modelos inales de es e abajo pa a ealiza la de ecci´on pod ´ıa se muy
in e esan e pa a pode as´ı simpli ica la complejidad que aho a supone pode ealiza
de ecci´on en un ´ıdeo.
•M´
as aplicaciones: El obje i o que se ha man enido desde el comienzo de es e
abajo ha sido el de c ea un sis ema ´op imo pa a la de ecci´on de os os a la
ho a de ealiza an´alisis o ense sob e ´ıdeos. Aunque es e es un campo muy amplio
que aba ca mul i ud de u ilidades conc e as, el equipo c ee que es e sis ema puede
ene m´as aplicaciones en el mundo ac ual. Con la ecien e si uaci´on que se es ´a
su iendo a causa del COVID-19, una u ilidad nue a pod ´ıa se el del con ol de las
medidas de segu idad aplicadas pa a e i a el con agio. Conc e amen e, el sis ema
pod ´ıa de ec a os os pa a as´ı pode iden i ica , de mane a manual con in e enci´on
humana o incluso ambi´en au om´a ica si se aplica el e ique ado en las de ecciones, si
el indi iduo es ´a espe ando las medidas de segu idad es ablecidas, espec´ı icamen e
si el os o lle a consigo una masca illa o no. Es o conciencia ´ıa a la sociedad de ca a
a espe a las medidas p opues as y as´ı asegu a que se cumplen, consiguiendo as´ı
un impac o posi i o en la e oluci´on de la si uaci´on.
Resumen del T abajo en Ingl´es
91
Cap´ı ulo 8
In oduc ion
8.1. Mo i a ion
O e he pas 70 yea s, nume ous scien i ic ad ances ha e led o exponen ial g ow h in
he wo ld o echnology. Speci ically, in he audio isual ield, hese de elopmen s ha e
led o nume ous ad ances ha ha e had a posi i e impac on he quali y, p ocessing
speed and s o age capaci y o images and audio. Un il ecen ly, a specialized came a was
equi ed o eco d a ideo and an innume able amoun o ex a componen s o i s co ec
ep oduc ion. In addi ion, he quali y ob ained was much lowe han oday, esul ing in a
loss o impo an in o ma ion when pe o ming o ensic analysis on ideo.
Wi h he a i al o he digi al e a, digi al came as eme ged and his managed o ix he
p oblems discussed abo e. Wi h hem, no special equipmen was needed and he quali y
ob ained was no ably supe io . In addi ion, o e ime, new o ms o s o age eme ged ha
allowed o longe -las ing ideo, making ideo o ensics a mo e e icien and p oduc i e
ask.
E en so, he quali y o he ideo was no as high as desi ed, and he ask o iden i ica ion
was di icul when he quali y o he en i onmen in which he ideo was made was unde
e y un a o able condi ions, such as da k places. Wi h he ad ancemen o so wa e and
he eme gence o ea ly image and ideo edi ing p og ams, oo age could be modi ied o
imp o e ce ain aspec s o composi ion, such as b igh ness, sa u a ion, con as , and so on.
Fo ensic analysis hus became an e en mo e p oduc i e ask, bu he e was s ill a p oblem
ha hinde ed i s e olu ion: i equi ed oo much manual wo k and human in e en ion o
he iden i ica ion wo k, and his slowed down he p ocess.
On he o he hand, he ield o AI was s ill unde in es iga ion. I was no un il 1958
ha he i s neu al ne wo k a chi ec u e appea ed, [Sim20] Pe cep on. Since hen, neu al
ne wo ks and AI began o g ow a g ea speed, la gely hanks o he e olu ion o ha dwa e
ha allowed he c ea ion o mo e powe ul machines capable o suppo ing he cons uc ion
o mo e complex and e icien a chi ec u es.
So wa e de elopmen changed comple ely wi h he inco po a ion and de elopmen
o Neu al Ne wo ks. As hei u ili y co e s any ask, many companies de eloped neu al
ne wo ks o he iden i ica ion o objec s in images o implemen au onomous sys ems ha
eac and make decisions in eal ime aking in o accoun he en i onmen in which hey
we e loca ed.
93
94 Cap
´
ı ulo 8. In oduc ion
I migh seem ha he use o AI in o ensic analysis would sol e all he p oblems.
This ask would be comple ely au oma ed, and ex ensi e analysis would be pe o med in
a ma e o minu es and in a massi e way. Image quali y becomes a lesse p io i y issue,
because sys ems analyze images di e en ly han he human eye does, inding pa e ns and
anomalies ha a e impe cep ible o anyone. Bu , e en so, a new ype o p oblem a ises: he
need o a cu ing-edge and ex emely e icien ne wo k, o a oid e oneous iden i ica ions
which, o he iden i ica ion o objec s and mo e speci ically aces, is a e y complex job.
The e o e, a good ace iden i ica ion sys em, which is able o make e y eliable and
accu a e de ec ions, as well as o make iden i ica ions in low quali y ideos, is c ucial o
be able o inco po a e a i icial in elligence in he o ensic analysis in a ull way and hus
be able o dispense wi h human in e en ion, which is an inc edible slowing down o he
p ocess. The sea ch o such sys ems is he d i ing o ce behind his wo k.
8.2. Con ex
This Final Deg ee P ojec has been ca ied ou wi hin he Analysis, Secu i y and
Sys ems G oup (GASS G oup, h ps://gass.ucm.es/, G oup 910623 o he ca alogue o
g oups ecognized by he UCM) as pa o he ac i i ies o he esea ch p ojec THEIA
(Techniques o In eg i y and Au hen ica ion o Mul imedia Files o MobileDe ices) wi h
e e ence FEI-EU-19-04
8.3. Objec o he In es iga ion
A pic u e con ains many simple ea u es which can be seen by human eye, such as he
silhoue es o objec s o he colo hey ha e. These pa e ns oge he make i possible
o iden i y objec s in an image and he e o e o d aw conclusions abou i , such as he
numbe o people in i o he ime o day i was made. Howe e , i has been ound ha
a su icien ly ained AI can iden i y ce ain pa e ns in images ha a e beyond human
unde s anding, and hese a e c i ical in iden i ying objec s o any o he ask in ol ing he
analysis o a pho og aph.
In addi ion, he e a e many al eady c ea ed and es ed iden i ie s dedica ed o
iden i ying whole bodies, and no aces speci ically, and his can be a disad an age when
a body is no ully displayed in an image.
This pape p oposes di e en echniques, algo i hms and DL models ha y o make
an e icien ace iden i ica ion in s eaming images and ideos.
8.4. Wo kplan
The de elopmen o his wo k has been ca ied ou in ou phases:
1. In es iga ion: Du ing he i s h ee mon hs, a pe iod o adap a ion o he wo k
con ex and acquisi ion o he necessa y knowledge was ca ied ou in o de o s a
wi h he subsequen de elopmen . A he beginning, a gene al mee ing was held in
which he s a ing poin o he wo k was explained, wha he objec i es we e o be
achie ed and wha he necessa y knowledge was o be. A e his, nume ous mee ings
8.4. Wo kplan 95
we e ag eed upon wi h he di ec o s o ollow up on he p og ess o he esea ch and
o esol e any doub s ha migh a ise. Ano he eason why hese mee ings we e
a anged was o ecei e alks on he basic concep s o he di e en ields in ol ed
in his wo k. These will be discussed in he ollowing chap e s. Some membe s o
he eam al eady had such knowledge hanks o he subjec s o A i icial In elligence
and Machine Lea ning, augh in his Facul y. Du ing he mee ings, many ools
ha would acili a e he esea ch wo k we e also explained. One o hese ools was
’Google Schola ’, which he eam would use o sea ch o scien i ic a icles on p e ious
esea ch in he same ield o s udy. Finally, once se e al conclusions had been eached
abou wha was wan ed and how i was o be achie ed, he eam began o p io i ise
de elopmen .
2. De eloping: Once he necessa y knowledge was acqui ed o be able o s a c ea ing
a solid e sion o he p ojec , i was decided o spend less ime on esea ch and o s a
wi h he codi ica ion o he p ojec . Al hough he esea ch phase did no cease, i was
a he pu in he backg ound, wi h esea ch being ca ied ou on speci ic concep s
ha eme ged du ing de elopmen . The e o e, du ing his phase, ad anced concep s
o he Py hon p og amming language and lib a ies such as Ke as and Tenso Flow
we e in es iga ed. Du ing his phase he aining se s o he model we e also buil ,
ob ained om he sou ces p o ided by he a icles ead du ing he p e ious phase.
3. Expe imen ing: In his phase, he e alua ion o he de eloped p o o ype was
ca ied ou and he esul s ob ained we e analysed. Di e en ools p o ided by he
same lib a ies explained abo e we e used, he esul s we e compa ed wi h hose
ob ained in he di e en wo ks e iewed and he con igu a ion o he pa ame e s
o he model e inemen was ca ied ou . Fo example, i was decided o adjus he
aining da a se s o analyze hei in luence on he imp o emen o he esul s. I
should be no ed ha he de elopmen phase did no cease du ing he expe imen al
phase, since he model was cons an ly compa ed wi h o he s and modi ied o
op imiza ion.
4. Documen a ion: Hal way h ough he de elopmen , he eam began he phase
ha would consis o w i ing and cons an ly e iewing he inal p ojec epo .
This phase an in pa allel be ween he de elopmen and expe imen a ion s ages.
Fo he w i ing o he epo , he eam made cons an upda es o he con en , as
he de elopmen included some new echnology, he expe imen a ion concluded in
di e en conclusions, o e en new a icles we e in es iga ed. A e an upda e, he
eam e iewed he changes made o e o s o possible sec ions o imp o e. Finally,
his phase ended a e comple ing he las miles one o he expe imen al s age,
compiling all he esul s ob ained om ha phase and adding hem o he Wo k.
In he Figu e 8.1 you can see in mo e de ail he o ganiza ion ha he eam has ollowed
du ing he cou se o his p ojec , as well as he du a ion o each phase and he sub- asks
ha compose hem. Also, below is a able showing he miles ones ollowed by he eam
ollowed by an iden i ie , used in he Figu e 8.1 o be e unde s anding.
102 Cap
´
ı ulo 9. Conclusions and Fu u e Wo k
he de ec ions, whe he he indi idual is espec ing he es ablished sa e y measu es,
speci ically whe he he ace is wea ing a mask o no . This would make socie y
awa e o he need o espec he p oposed measu es and hus ensu e ha hey a e
complied wi h, hus achie ing a posi i e impac on he e olu ion o he si ua ion.
Bibliog a ´ıa
[AZ13] R. A andjelo ic and A. Zisse man. All Abou VLAD. In P oceedings o he IEEE
con e ence on Compu e Vision and Pa e n Recogni ion, pages 1578–1585, 2013.
[BEP+08] K. Bollacke , C. E ans, P. Pa i osh, T. S u ge, and J. Taylo . F eebase: A
Collabo a i ely C ea ed G aph Da abase o S uc u ing Human Knowledge. In
P oceedings o he 2008 ACM SIGMOD in e na ional con e ence on Managemen o
da a, pages 1247–1250, 2008.
[B e20] C. B eazeal. MIT Team Building Social Robo . h p://news.mi .edu/2001/
kisme , Janua y 2020.
[B o20a] J B owniee. How o use Lea ning Cu es o Diagnose Machine
Lea ning Model Pe o mance. h ps://machinelea ningmas e y.com/
lea ning-cu es- o -diagnosing-machine-lea ning-model-pe o mance/,
Janua y 2020.
[B o20b] J. B ownlee. A Gen le In oduc ion o T ans e Lea ning o Deep Lea ning. h ps:
//machinelea ningmas e y.com/ ans e -lea ning- o -deep-lea ning/,
Janua y 2020.
[CBL+16] T. Cooijmans, N. Ballas, C. Lau en , C¸. G¨ul¸ceh e, and A. Cou ille. Recu en
Ba ch No maliza ion. a Xi p ep in a Xi :1603.09025, 2016.
[CCG+13] PL. Ca ie , A. Cou ille, IJ. Good ellow, M. Mi za, and Y. Bengio. FER-2013 Face
Da abase. Uni e si de Mon al, 2013.
[Cla20] L. Cla k. Google’s A i icial B ain Lea ns o Find Ca Videos. h ps://www.wi ed.
com/2012/06/google-x-neu al-ne wo k/, Janua y 2020.
[CRW+14] D. Chen, S. Ren, Y. Wei, X. Cao, and J. Sun. Join Cascade Face De ec ion and
Alignmen . In Eu opean con e ence on compu e ision, pages 109–122. Sp inge ,
2014.
[DAHG+15] J. Donahue, L. Anne Hend icks, S. Guada ama, M. Roh bach, S. Venugopalan,
K. Saenko, and T. Da ell. Long-Te m Recu en Con olu ional Ne wo ks o Visual
Recogni ion and Desc ip ion. In P oceedings o he IEEE con e ence on compu e
ision and pa e n ecogni ion, pages 2625–2634, 2015.
[DGG15] A. Dhall, R. Goecke, and T. Gedeon. Au oma ic G oup Happiness In ensi y
Analysis. IEEE T ansac ions on A ec i e Compu ing, 6(1):13–26, 2015.
[DGJ+16] A. Dhall, R. Goecke, J. Joshi, J. Hoey, and T. Gedeon. Emo iw 2016: Video and
G oup-Le el Emo ion Recogni ion Challenges. In P oceedings o he 18 h ACM
in e na ional con e ence on mul imodal in e ac ion, pages 427–432, 2016.
[DGLG12] A. Dhall, R. Goecke, S. Lucey, and T. Gedeon. Collec ing La ge, Richly Anno a ed
Facial-Exp ession Da abases om Mo ies. IEEE mul imedia, (3):34–41, 2012.
[F.18] Cholle F. Deep Lea ning wi h Py hon. Manning, 2018.
[FH99] H. Feng-Hsiung. IBM’s Deep Blue Chess G andmas e Chips. IEEE Mic o,
19(2):70–81, Ma ch 1999.
103
104 BIBLIOGRAF´
IA
[FLLL16] Y. Fan, X. Lu, D. Li, and Y. Liu. Video-Based Emo ion Recogni ion Using
CNN-RNN and C3D Hyb id Ne wo ks. In P oceedings o he 18 h ACM
In e na ional Con e ence on Mul imodal In e ac ion, pages 445–450, 2016.
[GDDM14] R Gi shick, J Donahue, T Da ell, and J Malik. Rich Fea u e Hie a chies o
Accu a e Objec De ec ion and Seman ic Segmen a ion. In P oceedings o he IEEE
con e ence on compu e ision and pa e n ecogni ion, pages 580–587, 2014.
[Gi 15] R Gi shick. Fas R-CNN. In P oceedings o he IEEE in e na ional con e ence on
compu e ision, pages 1440–1448, 2015.
[GLF+08] A. G a es, M. Liwicki, S. Fe n´andez, R. Be olami, H. Bunke, and J. Schmidhube .
A No el Connec ionis Sys em o Uncons ained Handw i ing Recogni ion. IEEE
ansac ions on pa e n analysis and machine in elligence, 31(5):855–868, 2008.
[GWD14] A. G a es, G. Wayne, and I. Danihelka. Neu al Tu ing Machines. a Xi p ep in
a Xi :1410.5401, 2014.
[HGDG17] K. He, G. Gkioxa i, P Doll´a , and R Gi shick. Mask R-CNN. In P oceedings o he
IEEE in e na ional con e ence on compu e ision, pages 2961–2969, 2017.
[HMBLM08] GB. Huang, M. Ma a , T. Be g, and E. Lea ned-Mille . Labeled Faces in he Wild:
A Da abase Fo S udying Face Recogni ion in Uncons ained En i onmen s. 2008.
[HOT06] G. E. Hin on, S. Osinde o, and Y. Teh. A Fas Lea ning Algo i hm o Deep Belie
Ne s. Neu al Compu a ion, 18(7):1527––1554, May 2006.
[HS97] S. Hoch ei e and J. Schmidhube . Long Sho -Te m Memo y. Neu al compu a ion,
9(8):1735–1780, 1997.
[Hui18] J. Hui. mAP (mean A e age P ecision) o Objec De ec ion. 2018.
[HZRS16] K. He, X. Zhang, S. Ren, and J. Sun. Deep Residual Lea ning o Image Recogni ion.
In P oceedings o he IEEE con e ence on compu e ision and pa e n ecogni ion,
pages 770–778, 2016.
[JPD+11] H. Jegou, F. Pe onnin, M. Douze, J. S´anchez, P. Pe ez, and C. Schmid. Agg ega ing
Local Image Desc ip o s In o Compac Codes. IEEE ansac ions on pa e n
analysis and machine in elligence, 34(9):1704–1716, 2011.
[JSD+14] Y. Jia, E. Shelhame , J. Donahue, S. Ka aye , J. Long, R. Gi shick, S. Guada ama,
and T. Da ell. Ca e: Con olu ional A chi ec u e o Fas Fea u e Embedding.
In P oceedings o he 22nd ACM in e na ional con e ence on Mul imedia, pages
675–678, 2014.
[JZL+19] Licheng J., Fan Z., Fang L., Shuyuan Y., Lingling L., Zhixi F., and Rong Q. A
Su ey o Deep Lea ning-Based Objec De ec ion. IEEE Access, 7:1––22, Oc obe
2019.
[KCL+15] S. Kwak, M. Cho, I. Lap e , J. Ponce, and C. Schmid. Unsupe ised Objec
Disco e y and T acking in Video Collec ions. In P oceedings o he IEEE
in e na ional con e ence on compu e ision, pages 3173–3181, 2015.
[KOLW16] K. Kang, W. Ouyang, H. Li, and X. Wang. Objec De ec ion om Video Tubele s
wi h Con olu ional Neu al Ne wo ks. In P oceedings o he IEEE con e ence on
compu e ision and pa e n ecogni ion, pages 817–825, 2016.
[KSH12] A. K izhe sky, I. Su ske e , and GE. Hin on. Imagene Classi ica ion wi h Deep
Con olu ional Neu al Ne wo ks. In Ad ances in neu al in o ma ion p ocessing
sys ems, pages 1097–1105, 2012.
[lab17] LabelImg. h ps://gi hub.com/ zu alin/labelImg, Oc obe 2017.
[LAE+16a] W. Liu, D. Anguelo , D. E han, C. Szegedy, S. Reed, C. Fu, and A. Be g. SSD:
Single Sho Mul iBox De ec o . Lec u e No es in Compu e Science, pages 21—-37,
No embe 2016.
BIBLIOGRAF´
IA 105
[LAE+16b] W. Liu, D. Anguelo , D. E han, C. Szegedy, S. Reed, C. Fu, and A.C. Be g. SSD:
Single Sho Mul ibox De ec o . In Eu opean con e ence on compu e ision, pages
21–37. Sp inge , 2016.
[LdMM17] R. L´opez de M´an a as and P. Mesegue . In eligencia A i icial, chap e 1, pages
7–29. CSIC Consejo Supe io de In es igaciones Cien ´ı icas, 2017.
[LGRYTN11] H. Lee, R. G osse, R. Rangana h, and A. Yan-Tak Ng. Unsupe ised
Lea ning o Hie a chical Rep esen a ions wi h Con olu ional Deep Belie Ne wo ks.
Communica ions o he ACM, 54(10):95–103, Oc obe 2011.
[LHS+14] H. Li, G. Hua, X. Shen, Z. Lin, and J. B and . Eigen-Pep o Video Face Recogni ion.
In Asian con e ence on compu e ision, pages 17–33. Sp inge , 2014.
[LLT17] Y. Lu, C. Lu, and C. Tang. Online Video Objec De ec ion Using Associa ion
LSTM. In P oceedings o he IEEE In e na ional Con e ence on Compu e Vision,
pages 2344–2352, 2017.
[LMB+20] TY Lin, M Mai e, S Belongie, J Hays, P Pe ona, D Ramanan, P Doll´a , L Zi nick,
G Pa e son, MR Ronchi, Y Cui, L Bou de , and R Gi shick. COCO - Common
Objec s in Con ex . h p://cocoda ase .o g/#de ec ion-e al, Ma ch 2020.
[LWZ11] J. Li, T. Wang, and Y. Zhang. Face De ec ion Using Su Cascade. In 2011 IEEE
in e na ional con e ence on compu e ision wo kshops (ICCV wo kshops), pages
2183–2190. IEEE, 2011.
[LZLY14] L. Liu, L. Zhang, H. Liu, and S. Yan. Towa d La ge-Popula ion Face Iden i ica ion
in Uncons ained Videos. IEEE T ansac ions on Ci cui s and Sys ems o Video
Technology, 24(11):1874–1884, 2014.
[MMdRM16] N. McLaughlin, J. Ma inez del Rincon, and P. Mille . Recu en Con olu ional
Ne wo k o Video-Based Pe son Re-iden i ica ion. In P oceedings o he IEEE
con e ence on compu e ision and pa e n ecogni ion, pages 1325–1334, 2016.
[num20] NumPy, The Fundamen al Package o Scien i ic Compu ing wi h Py hon. h ps:
//numpy.o g/, Ma ch 2020.
[NZH+17] G. Ning, Z. Zhang, C. Huang, X. Ren, H. Wang, C. Cai, and Z. He. Spa ially
Supe ised Recu en Con olu ional Neu al Ne wo ks o Visual Objec T acking.
In 2017 IEEE In e na ional Symposium on Ci cui s and Sys ems (ISCAS), pages
1–4. IEEE, 2017.
[Ola20] C Olah. Unde s anding LSTM Ne wo ks. h ps://colah.gi hub.io/pos s/
2015-08-Unde s anding-LSTMs/, Augus 2020.
[ope20a] Open Compu e Vision Lib a y (OpenCV). h ps://openc .o g/, Ma ch 2020.
[ope20b] Open Images Da ase V6. h ps://s o age.googleapis.com/openimages/web/
challenge_o e iew.h mle, Ma ch 2020.
[pa 20] Pa y - A Py hon lib a y o download YouTube con en and e ie e me ada a.
h ps://py honhos ed.o g/pa y/, Ma ch 2020.
[pas20] The PASCAL Visual Objec Classes Homepage. h p://hos . obo s.ox.ac.uk/
pascal/VOC/, Ma ch 2020.
[PLC+12] A. P es , C. Leis ne , J. Ci e a, C. Schmid, and V. Fe a i. Lea ning Objec Class
De ec o s om Weakly Anno a ed Video. In 2012 IEEE Con e ence on Compu e
Vision and Pa e n Recogni ion, pages 3282–3289. IEEE, 2012.
[PSVZ14] OM. Pa khi, K. Simonyan, A. Vedaldi, and A. Zisse man. A Compac and
Disc imina i e Face T ack Desc ip o . In P oceedings o he IEEE Con e ence on
Compu e Vision and Pa e n Recogni ion, pages 1693–1700, 2014.
[PVZ15] OM. Pa khi, A. Vedaldi, and A. Zisse man. Deep Face Recogni ion. 2015.
106 BIBLIOGRAF´
IA
[RCWS14] S. Ren, X. Cao, Y. Wei, and J. Sun. Face Alignmen a 3000 FPS Via Reg essing
Local Bina y Fea u es. In P oceedings o he IEEE Con e ence on Compu e Vision
and Pa e n Recogni ion, pages 1685–1692, 2014.
[RDGF16] J Redmon, S Di ala, R Gi shick, and A Fa hadi. You Only Look Once: Uni ied,
Real-Time Objec De ec ion. In P oceedings o he IEEE con e ence on compu e
ision and pa e n ecogni ion, pages 779–788, 2016.
[RHGS15] S Ren, K He, R Gi shick, and J Sun. Fas e R-CNN: Towa ds Real-Time Objec
De ec ion wi h Region P oposal Ne wo ks. In Ad ances in neu al in o ma ion
p ocessing sys ems, pages 91–99, 2015.
[Sa 20] D. Sa ka . A Comp ehensi e Hands-on Guide o T ans e Lea ning wi h Real-Wo ld
Applica ions in Deep Lea ning. h ps:// inyu l.com/y7ehja7h, Janua y 2020.
[Sch97] RR. Schalle . Moo e’s Law: Pas , P esen and Fu u e. IEEE Spec um, 34(6):52––59,
June 1997.
[SF18] N. Shukla and K. F icklas. Machine Lea ning Wi h Tenso Flow, chap e 1, pages
5–20. Manning, 2018.
[Sha18] R. Shanmugamani. Deep Lea ning o Compu e Vision, chap e 1, pages 8–25.
Pack , 2018.
[Sil20] V Silapa ase y. How o Handle O e i ing and Unde i ing
in Machine Lea ning. h ps://medium.com/da ad i enin es o /
how- o-handle-o e i ing-and-unde i ing-470a1 7389 e, Janua y
2020.
[Sim20] Simplilea n. Wha is Pe cep on. h ps://www.simplilea n.com/
wha -is-pe cep on- u o ial, Janua y 2020.
[SKP15] F. Sch o , D. Kalenichenko, and J. Philbin. Facene : A Uni ied Embedding o Face
Recogni ion and Clus e ing. In P oceedings o he IEEE con e ence on compu e
ision and pa e n ecogni ion, pages 815–823, 2015.
[SLJ+15] C. Szegedy, W. Liu, Y. Jia, P. Se mane , S. Reed, D. Anguelo , D. E han,
V. Vanhoucke, and A. Rabino ich. Going Deepe wi h Con olu ions. In P oceedings
o he IEEE con e ence on compu e ision and pa e n ecogni ion, pages 1–9, 2015.
[SPVZ13] K. Simonyan, OM Pa khi, A. Vedaldi, and A. Zisse man. Fishe Vec o Faces in he
Wild. In BMVC, olume 2, page 4, 2013.
[SSB14] H. Sak, AW. Senio , and F. Beau ays. Long Sho -Te m Memo y Recu en Neu al
Ne wo k A chi ec u es o La ge Scale Acous ic Modeling. 2014.
[s 20] S eamlink - A CLI u ili y which pipes ideo s eams om a ious se ices in o a
ideo playe . h ps://s eamlink.gi hub.io/, Ma ch 2020.
[SVI+15] C. Szegedy, V. Vanhoucke, S. Io e, J. Shlens, and Z. Wojna. Re hinking he
Incep ion A chi ec u e o Compu e Vision. Decembe 2015.
[SVZ14] K. Simonyan, A. Vedaldi, and A. Zisse man. Lea ning Local Fea u e Desc ip o s
Using Con ex Op imisa ion. IEEE T ansac ions on Pa e n Analysis and Machine
In elligence, 36(8):1573–1585, 2014.
[SWF15] S. Sukhbaa a , J. Wes on, and R. Fe gus. End-To-End Memo y Ne wo ks. In
Ad ances in neu al in o ma ion p ocessing sys ems, pages 2440–2448, 2015.
[SWT15] Y. Sun, X. Wang, and X. Tang. Deeply Lea ned Face Rep esen a ions a e Spa se,
Selec i e, and Robus . In P oceedings o he IEEE con e ence on compu e ision
and pa e n ecogni ion, pages 2892–2900, 2015.
[SZ14] K. Simonyan and A. Zisse man. Ve y Deep Con olu ional Ne wo ks o La ge-Scale
Image Recogni ion. a Xi p ep in a Xi :1409.1556, 2014.
BIBLIOGRAF´
IA 107
[TBF+15] D. T an, L. Bou de , R. Fe gus, L. To esani, and M. Palu i. Lea ning
Spa io empo al Fea u es wi h 3D Con olu ional Ne wo ks. In P oceedings o he
IEEE in e na ional con e ence on compu e ision, pages 4489–4497, 2015.
[TBHN16] S. T ipa hi, S. Belongie, Y. Hwang, and T. Nguyen. De ec ing Tempo ally Consis en
Objec s in Videos Th ough Objec Class Label P opaga ion. In 2016 IEEE Win e
Con e ence on Applica ions o Compu e Vision (WACV), pages 1–9. IEEE, 2016.
[ en20] Tenso low Objec De ec ion API. h ps://gi hub.com/ enso low/models/
blob/mas e / esea ch/objec _de ec ion/README.md, Janua y 2020.
[TLBN16] S. T ipa hi, ZC. Lip on, S. Belongie, and T. Nguyen. Con ex Ma e s: Re ining
Objec De ec ion in Video wi h Recu en Neu al Ne wo ks. a Xi p ep in
a Xi :1607.04648, 2016.
[To 18] J. To es. Deep Lea ning. In oducci´on P ´ac ica con Ke as. Wa ch This Space, 2018.
[Tu 50] AM. Tu ing. Compu ing Machine y and In elligence. Mind, 49:433–460, 1950.
[TYRW14] Y. Taigman, M. Yang, MA. Ranza o, and L. Wol . Deep ace: Closing he Gap
o Human-Le el Pe o mance in Face Ve i ica ion. In P oceedings o he IEEE
con e ence on compu e ision and pa e n ecogni ion, pages 1701–1708, 2014.
[TYRW15] Y. Taigman, M. Yang, MA. Ranza o, and L. Wol . Web-Scale T aining o Face
Iden i ica ion. In P oceedings o he IEEE con e ence on compu e ision and pa e n
ecogni ion, pages 2746–2754, 2015.
[Val20] S. Valda ama. Con usion Ma ix in Objec De ec ion wi h Tenso Flow. Technical
Repo , Gi Hub, Ma ch 2020.
[VBK15] O. Vinyals, S. Bengio, and M. Kudlu . O de Ma e s: Sequence o Sequence o
Se s. a Xi p ep in a Xi :1511.06391, 2015.
[WHM11] L. Wol , T. Hassne , and I. Maoz. Face Recogni ion in Uncons ained Videos wi h
Ma ched Backg ound Simila i y. In CVPR 2011, pages 529–534. IEEE, 2011.
[wid20] Wide Face Da ase o TF Reco d. h ps://gi hub.com/ii zco/
wide ace- o- eco d, Ma ch 2020.
[WR10] AN. Whi ehead and B. Russell. P incipia Ma hema ica. Camb idge Uni e si y
P ess, 1910.
[WZLQ16] Y. Wen, K. Zhang, Z. Li, and Y. Qiao. A Disc imina i e Fea u e Lea ning App oach
o Deep Face Recogni ion. In Eu opean con e ence on compu e ision, pages
499–515. Sp inge , 2016.
[XZLT15] Y. Xiong, K. Zhu, D. Lin, and X. Tang. Recognize Complex E en s om S a ic
Images by Fusing Deep Channels. In Compu e Vision and Pa e n Recogni ion
(CVPR), 2015 IEEE Con e ence on. IEEE, 2015.
[YLLT16] S. Yang, P. Luo, C. Change Loy, and X. Tang. WIDER FACE: A Face De ec ion
Benchma k. In IEEE Con e ence on Compu e Vision and Pa e n Recogni ion
(CVPR), 2016.
[YRZ+17] J. Yang, P. Ren, D. Zhang, D. Chen, F. Wen, H. Li, and G. Hua. Neu al Agg ega ion
Ne wo k o Video Face Recogni ion. In P oceedings o he IEEE con e ence on
compu e ision and pa e n ecogni ion, pages 4362–4371, 2017.
[YSMC15] A. Yao, J. Shao, N. Ma, and Y. Chen. Cap u ing AU-Awa e Facial Fea u es and
Thei La en Rela ions o Emo ion Recogni ion in he Wild. In P oceedings o he
2015 ACM on In e na ional Con e ence on Mul imodal In e ac ion, pages 451–458,
2015.