scieee Science in your language
[es] (orig)

Detección facial en vídeos digitales

Abstract

Hoy en día, las redes neuronales constituyen un pilar fundamental en el desarrollo de aplicaciones inteligentes. No obstante, dicho campo se encuentra aún en fase de expansión y son muchos los avances que se consiguen diariamente. La inteligencia artificial es la responsable de crear sistemas autónomos y de automatizar tareas que suponen una gran inversión de tiempo y esfuerzo de ser realizadas por seres humanos, como la identificación de objetos tanto en imágenes como en vídeos. Por otro lado, el análisis forense digital ha sufrido un avance considerable en los últimos años gracias a la evolución tecnológica continua que se está viviendo actualmente. Si se juntan la inteligencia artificial y el análisis forense, se puede mejorar considerablemente dicha labor, y permitir así abrir las puertas a futuros avances que den paso a funcionalidades que aún están por conocer. Este trabajo se centra en intentar crear sistemas óptimos especializados en encontrar rostros en vídeos con condiciones muy desfavorables, con el fin de encontrar comportamientos delictivos de manera rápida y eficiente, facilitando así la labor del análisis forense y desprenderse así de la necesidad de analizar los vídeos manualmente. Para ello, se ha realizado una extensa investigación tanto en los conceptos que engloban el campo de la detección facial, como en trabajos previos relacionados con este tema, para comprender en profundidad cuáles son las técnicas actuales en uso que podrían servir para este trabajo. Tras realizar una amplia experimentación probando con seis modelos distintos basados en aprendizaje profundo, se ha llegado a la conclusión de proponer dos modelos: uno especializado en la detección de vídeos en local capaz de inferir con una exactitud del 74,83 %, y otro adaptado para su funcionamiento en tiempo real con el que se alcanza una exactitud del 74,59%.

Read accessible full text

Detección facial en vídeos digitales

Author: Barbero Pérez, Arturo; Cabezas Garríguez, Alejandro; Morcuende Sierra, José
Year: 2020
Source: https://docta.ucm.es/bitstreams/e5fe9bee-feac-4910-8fe7-a06e11c8673e/download
De ecci´on Facial en V´ıdeos Digi ales
Facial De ec ion On Digi al Videos
TRABAJO FIN DE GRADO
GRADO EN INGENIER´
IA INFORM ´
ATICA
GRADO EN INGENIER´
IA DEL SOFTWARE
CURSO 2019–2020
A u o Ba be o P´e ez
Alejand o Cabezas Ga ´ıguez
Jos´e Mo cuende Sie a
Di ec o es
Luis Ja ie Ga c´ıa Villalba
Es eban Alejand o A mas Vega
Depa amen o de Ingenie ´ıa del So wa e e In eligencia A i icial
Facul ad de In o m´a ica
Uni e sidad Complu ense de Mad id
Mad id, Junio de 2020
Ag adecimien os
A u o Ba be o P´e ez
An es de comenza , me gus a ´ıa pa a asea una exp esi´on a ibuida al il´oso o Be na do
de Cha es, la cual dice as´ı: ((Somos como enanos sob e los homb os de gigan es, de modo
que podemos e las cosas a una mayo dis ancia. No en i ud de nues a agudeza isual,
o cualquie dis inci´on ´ısica, sino po que nos ele an al o po su g an al u a)).
Pa a m´ı, aquellos gigan es a los que hace e e encia, son odas las pe sonas que, de una
o ma u o a, han in luido en que hoy pueda se como soy y, g acias a ello, me encuen e
inalizando es os es udios. Po ello, me gus a ´ıa dedica y ag adece el p esen e abajo a
los que yo conside o mis gigan es:
A mis pad es, po odo lo que me han dado du an e oda la ida. Po habe es ado
al lado, an o en los log os como, sob e odo, en los opiezos. Po habe me ansmi ido
desde siemp e los alo es del es ue zo y la cons ancia y habe con iado en m´ı cuando yo
no lo hac´ıa.
A mi he mano, po odos los momen os que hemos pasado y po se la pe sona que me
dio a descub i la in o m´a ica desde peque˜no, haciendo que me acaba a in e esando cada
ez m´as po es e mundo. G acias a ello, aho a s´e qu´e es lo que quie o hace con mi ida.
A mis p imos, en especial a Edu y Bea, po oda la ayuda y consejos que me han
b indado a lo la go de los a˜nos. Po que, adem´as de amilia, son ejemplos y modelos a
segui an o pe sonal como p o esionalmen e. No pod ´ıa es a m´as ag adecido.
A Da id y Ma iano, po es a p ´ac icamen e desde el p incipio de los iempos y se
desde en onces un g an apoyo. Po odas las buenas expe iencias que hemos pasado jun os
y po habe me ense˜nado lo que es ealmen e el alo de la amis ad y la leal ad.
A odos mis mas odon es, ie as y leyendas —ellos saben qui´enes son—, po odas las
isas, quedadas y el apoyo con inuo en p ´ac icas y ex´amenes. G acias a ellos, aho a la ase
((¡Feliz a˜no!)) iene un signi icado a´un m´as especial. Mi expe iencia uni e si a ia hab ´ıa sido
muy dis in a sin oso os.
iii
i
A los p o eso es que he ido eniendo a lo la go de la ca e a po que, adem´as de
habe me ense˜nado el campo de la Ingenie ´ıa In o m´a ica, me han hecho da me cuen a
de que en en a se a p oblemas complejos po los que nunca an es has pasado es una de
las mejo es o mas de c ece como pe sona.
Y po ´ul imo, no pod ´ıa ol ida me an o de nues os di ec o es como de mis
compa˜ne os, as´ı como de Ana Lucila y Alexand a. G acias po da me la opo unidad
de ealiza es e abajo con odos oso os y habe me acompa˜nado en es e e o. Es oy
segu o de que, de no habe sido po ues a ayuda, la ealizaci´on de es e p oyec o se
hab ´ıa di icul ado en g an medida.
Alejand o Cabezas Ga ´ıguez
En p ime luga , me gus a ´ıa ag adece a nues os di ec o es, Luis Ja ie y Es eban po
habe nos dado la opo unidad de in es iga sob e es os campos que, pe sonalmen e, me
han hecho ama aun m´as es a ca e a y el mundo del so wa e y la in o m´a ica en gene al.
G acias po acep a aquella euni´on en mi ad de e ano y g acias po acep a nos pa a
ealiza es e p oyec o. Adem´as, c eo que el abajo que hemos ealizado conjun amen e
con Ana ha sido muy sa is ac o io y p oduc i o, y le ag adezco a es a pe sona la labo
de o ganizaci´on que ha enido con noso os a lo la go del desa ollo de odo el abajo.
Tambi´en debo ag adece a Alexand a po la labo que ealiz´o a p incipio de cu so pa a
ense˜na nos los concep os b´asicos con los que pode comenza a in es iga y a ap ende
po noso os mismos. Sin duda alguna no hab ´ıamos podido comenza con an a sol u a
si ella no nos hubiese explicado concep os an b´asicos sob e In eligencia A i icial y Redes
Neu onales.
Po supues o, ambi´en debo ag adece le la labo y el empe˜no pues o en es e abajo a
mis compa˜ne os de p oyec o, Jos´e y A u o. Tengo muy cla o que sin ellos, el desa ollo
de la idea hab ´ıa sido imposible y la labo de in es igaci´on hab ´ıa supues o muchas m´as
complicaciones y queb ade os de cabeza. Es oy segu o de que ha sido nues o abajo en
equipo lo que nos he hecho pode a anza de mane a e ec i a, siemp e dando pasos i mes.
En especial, quie o ag adece a A u o el conocimien o que ha apo ado a el p oyec o,
pues o que ´el conoc´ıa p e iamen e concep os del mundo de la In eligencia A i icial.
G acias a ´el hemos podido ap ende y aplica conocimien os de una mane a mucho m´as
´apida y e ec i a.
Tambi´en quie o ag adece a la Uni e sidad y a los p o eso es que me han ense˜nado
odos los concep os necesa ios du an e odos es os a˜nos de ca e a. G acias a ellos he
podido conoce el mundo del so wa e y de la in o m´a ica en odo su esplendo y me han
hecho da me cuen a de cual es mi luga en la ida y qu´e es lo que quie o hace con ella.
Me han guiado con sus asigna u as a a ´es de un camino di ´ıcil, lleno de e os, y me han
hecho supe a me y o ece lo mejo de m´ı.
Po ´ul imo, me gus a ´ıa en a en una pa e de mi co az´on que no suelo compa i
con los dem´as po que c eo que a´un no es oy p epa ado pa a ello. Hoy, mien as e mino
lo que puede pa ece un p´a a o insigni ican e en compa aci´on a odo lo que es ´a po
eni en es a memo ia, cada palab a que esc ibo me ae a la men e odos los momen os
que he pasado en mi ida. Me hacen da me cuen a de quienes han sido los apoyos, los
cimien os, las bases... el odo de mi ida. Hola pap´a, hola mam´a, es oy segu o de que en
alg´un momen o lee ´eis es o, es oy segu o de que os eco da ´e que e is´eis es a pa e, es oy
segu o de que sen i ´e ne ios po sabe ues a eacci´on. C eo que he dejado bas an e
cla o lo que signi ic´ais pa a mi y lo que supon´eis en mi ida, pe o no pienso deja pasa
los d´ıas sin que os los ecue de: sois mi ´exi os, mis acasos, mis i udes, mis de ec os,

i
mi se y es a , mi aye , hoy y ma˜nana, mi odo y mi nada. No puedo deja es e apa ado
sin aco da me de oso os, aunque nunca deja ´e de ene os en mi men e. A oso os os
debo en p ime luga mi ida, y en segundo luga odo. G acias a oso os hoy puedo
esc ibi es a memo ia, hoy puedo ce a es e cap´ı ulo inal pa a e mina es a ca e a an
ma a illosa. G acias, soy mejo pe sona hoy en d´ıa po habe omado como ejemplo a dos
pe sonas an inc e´ıbles como oso os.
G acias F an po se mi en e me o, mi he mano mayo y mi amigo. G acias a i engo
cla o que, no solo soy una pe sona sana de cue po, sino ambi´en de alma. G acias po se
el escudo de mi men e, po sal a me de mi p opio ma de ideas que a eces me ahoga y
po libe a me de las cadenas que a eces me pongo a mi mismo y me impiden dis u a .
Finalmen e, me gus a ´ıa eco da unos e sos de un poema esc i o po Rudya d
Kipling: ((Si puedes llena cada implacable minu o, con sesen a segundos de comba e b a ´ıo,
uya es la Tie a y sus codiciados u os, y —lo que es m´as—: ¡se ´as un Homb e, hijo
m´ıo!)). A´un ecue do cuando ´u, pap´a, me mos as e es e poema en e l´ag imas y me
hicis e p ome e que es os e sos uesen el mo o de mi ida, mien as enma cabas el
poema en mi habi aci´on. Pues bi´en, as´ı ha sido, y as´ı se ´a, pues o que no pa a ´e ni un
segundo en consegui aquello que me p opongo, y es o es g acias a oso os.
Pap´a, mam´a, F an, abuela, abuelo, i o, i a, p ima, p imo... amilia, desde lo m´as
p o undo de mi alma, os lo ag adezco odo y os debo lo que es ´a po llega en mi ida.
Simplemen e, g acias.
ii
Jos´e Mo cuende Sie a
Es a esc ibiendo es o me da que pensa , es o supone el in de una e apa. Supone abandona
una de las mejo es ases, de la que mejo es ecue dos engo y mas apoyo he ecibido, donde
conside o que he ganado e dade os amigos.
En es os cua o a˜nos ha habido an o buenos momen os como malos, pe o odos
ellos o man pa e de lo que llaman ”la ida uni e si a ia”. Me gus a ´ıa empeza
ag adeci´endoselo mi pad e y a mi mad e, si no ue a po ellos no hubie a podido i i
es a expe iencia, apoy´andome a˜no as a˜no, impuls´andome a con inua y saca lo m´aximo
de mi, a no pone me limi aciones, en gene al me han ense˜nado a con ia en mi mismo.
G acias a ellos he ap endido que in en a lo siemp e me ece la pena, que es as expe iencias
son ealmen e impo an e en la ida. Asimismo ag adec´e selo a mis ´ıos y a mi abuela po
es a siemp e pendien es, po llama me cada ez que ealizaba un examen o en egaba una
a ea pa a p egun a que al me hab´ıa ido y da me ´animos uese cual uese el esul ado.
Tambi´en ag adezco el habe conocido a Alejand o desde los inicios de de la ca e a,
g acias po odo el apoyo que me has o ecido, engo cla o que sin u ayuda hoy d´ıa no
es a ´ıa donde es oy. No me ol ido de A u o, que a pesa de solo conoce le de is a po
la acul ad conside o que me lle o una amis ad m´as. Sin ellos odo es o no hubie a sido
posible, ambos han sido p imo diales pa a la ealizaci´on y inalizaci´on de es e abajo,
adem´as de lo lle ade o que han conseguido que sea es e du o camino.
O a pa e impo an e es es o de las pe sonas de la Uni e sidad, el es o de amigos con
los que he enido la sue e de compa i clases y iajes. Asimismo, los p o eso es han enido
un papel muy ele an e en es os cua o a˜nos, han sido los enca gados de ense˜na nos poco
a poco en que consis e de e dad es a ca e a. No me ol ido de nues os di ec o es, Luis
Ja ie y Es eban, que nos die on la opo unidad de ealiza es e abajo de in es igaci´on,
que a pesa de no es a nada acos umb ados, que jun o con Ana Lucila nos han ayudado
a comple a lo, y m´as siendo en el campo de la In eligencia A i icial, que pe sonalmen e
no hab´ıa is o nada nunca.
Po ul imo me gus a ´ıa ag adec´e selo a esa pe sona que conoc´ı a mediados de agos o
del a˜no pasado, a la que en es e iempo he cogido mucho ca i˜no, po odo lo que has
hecho po mi, po odo el apoyo que me has o ecido de mane a con inuada desde que e
conozco, po p eocupa e odos los d´ıas an o de mi como de mis es udios, ni e imaginas
lo mucho que e ag adezco que me hayas acompa˜nado en el inal de e apa, simplemen e
g acias Lidia.
´
Indice Gene al
´
Indice de Figu as XIII
´
Indice de Tablas XV
´
Indice de Con igu aciones XVII
Lis a de Ac ´
onimos XXI
Abs ac XXIII
Resumen XXV
1. In oducci´
on 1
1.1. Mo i aci´on .................................... 1
1.2. Con ex o ..................................... 2
1.3. Obje o de la In es igaci´on ............................ 2
1.4. Plan de T abajo ................................. 3
1.5. Es uc u a del T abajo .............................. 6
2. Ma co Concep ual 7
2.1. His o ia de la In eligencia A i icial ....................... 7
2.2. T´ecnicas U ilizadas en In eligencia A i icial .................. 9
2.2.1. Ap endizaje Au om´a ico ......................... 10
2.2.2. Ap endizaje P o undo .......................... 13
2.2.3. Ap endizaje Po T ans e encia ..................... 14
2.3. Visi´on A i icial .................................. 15
ix
x i ´
INDICE DE TABLAS
5.14. Resul ados usando el modelo SSD con Incep ion en ´ıdeos y s eaming . . . 63
5.15. P ecisi´on media usando SSD con ResNe .................... 65
5.16. P ecisi´on media a dis in as dis ancias usando SSD con ResNe ....... 65
5.17. Exhaus i idad media usando SSD con ResNe ................. 65
5.18. Exhaus i idad media en dis in as dis ancias usando SSD con ResNe . . . . 65
5.19. Resul ados m´as espec´ı icos usando SSD con ResNe .............. 66
5.20. Resul ados usando el modelo SSD con ResNe en ´ıdeos y s eaming . . . . 66
5.21. P ecisi´on media usando Fas e R-CNN con Incep ion ............. 68
5.22. P ecisi´on media en dis in as dis ancias usando R-CNN con Incep ion . . . . 68
5.23. Exhaus i idad media usando Fas e R-CNN con Incep ion .......... 69
5.24. Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
Incep ion ..................................... 69
5.25. Resul ados m´as espec´ı icos usando Fas e R-CNN con Incep ion ....... 69
5.26. Resul ados usando el modelo Fas e R-CNN con Incep ion en ´ıdeos y
s eaming ..................................... 70
5.27. P ecisi´on media usando Fas e R-CNN con ResNe .............. 71
5.28. P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con ResNe . 71
5.29. Exhaus i idad media usando Fas e R-CNN con ResNe ........... 72
5.30. Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
ResNe ....................................... 72
5.31. Resul ados m´as espec´ı icos usando Fas e R-CNN con ResNe ........ 72
5.32. Resul ados usando el modelo Fas e -RCNN con ResNe en ´ıdeos y s eaming 73
5.33. P ecisi´on media usando Fas e R-CNN con Incep ion-ResNe ........ 74
5.34. P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe ................................. 74
5.35. Exhaus i idad media usando Fas e R-CNN con Incep ion-ResNe ..... 75
5.36. Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe ................................. 75
5.37. Resul ados m´as espec´ı icos usando Fas e R-CNN con Incep ion-ResNe . . 75
5.38. Resul ados usando el modelo Fas e R-CNN con Incep ion-ResNe en ´ıdeos
ys eaming .................................... 76

´
INDICE DE TABLAS x ii
8.1. Table o miles ones ollowed by he eam ollowed by hei iden i ie s . . . . 96
´
Indice de Con igu aciones
4.1. Con igu aci´on enida en cuen a en Model ................... 44
4.2. Con igu aci´on enida en cuen a pa a el en enamien o ............ 45
4.3. Con igu aci´on enida en cuen a pa a la alidaci´on ............... 46
xix
Lis a de Ac ´onimos
AFEW AFEW 6.0
AI A i icial In elligence
ALSTM Associa ion Long Sho Te m Memo y
ANN A i icial Neu al Ne wo k
C3D 3D Con olu ional Neu al Ne wo ks
CB Celeb i y-1000
CNN Con olu ional Neu al Ne wo ks
CSV Comma-Sepa a ed Values
CV Compu e Vision
DL Deep Lea ning
FER FER-2013
FPS F ames Pe Second
IOU In e sec ion o e Union
LFW Labeled Faces in he Wild
LSTM Long Sho Te m Memo y
xxi

xxii Lis a de Ac ´
onimos
mAP Mean A e age P ecision
ML Machine Lea ning
NAN Neu al Agg ega ion Ne wo k
RL Rein o cemen Lea ning
RNN Recu en Neu al Ne wo ks
SL Supe ised Lea ning
SSD Single Sho De ec o
SSH Secu e Shell
SVM Suppo Vec o Machine
TL T ans e Lea ning
UL Unsupe ised Lea ning
URL Uni o m Resou ce Loca o
XML eX ensible Ma kup Language
YF YouTube Faces
YO YouTube-Objec
Abs ac
Today, neu al ne wo ks a e a undamen al pilla in he de elopmen o in elligen
applica ions. Howe e , his ield is s ill in a phase o expansion and many ad ances a e
being made e e y day. A i icial in elligence is esponsible o c ea ing au onomous sys ems
and o au oma ing asks ha equi e a g ea in es men o ime and e o o be ca ied ou
by human beings, such as he iden i ica ion o objec s in bo h images and ideos. On he
o he hand, digi al o ensic analysis has unde gone a conside able ad ance in ecen yea s
hanks o he con inuous echnological e olu ion ha is cu en ly aking place. I a i icial
in elligence and o ensic analysis a e b ough oge he , his wo k can be conside ably
imp o ed, hus opening he doo o u u e ad ances ha will gi e way o unc ionali ies
ha a e s ill unknown.
This wo k is ocused on ying o c ea e op imal sys ems specialized in inding aces
in ideos wi h e y un a o able condi ions, in o de o ind c iminal beha io quickly and
e icien ly, hus acili a ing he wo k o o ensic analysis and hus ge id o he need o
analyze he ideos manually.
Fo his pu pose, ex ensi e esea ch has been ca ied ou bo h in he concep s ha
encompass he ield o acial de ec ion, as well as in p e ious wo k ela ed o his opic, in
o de o unde s and in dep h which a e he cu en echniques in use ha could se e o
his wo k.
A e ca ying ou ex ensi e expe imen a ion by es ing six di e en models based on
deep lea ning, he conclusion has been eached ha wo models should be p oposed: one
specialized in he de ec ion o ideos in p emises capable o in e ing wi h an accu acy o
74.83 %, and ano he adap ed o eal ime ope a ion wi h which an accu acy o 74.59 %
is achie ed.
Keywo ds: Fo ensics, Iden i ica ion, De ec ion, Video, Neu al Ne wo ks, A i icial
In elligence, Faces, Deep Lea ning
xxiii
Resumen
Hoy en d´ıa, las edes neu onales cons i uyen un pila undamen al en el desa ollo de
aplicaciones in eligen es. No obs an e, dicho campo se encuen a a´un en ase de expansi´on
y son muchos los a ances que se consiguen dia iamen e. La in eligencia a i icial es la
esponsable de c ea sis emas au ´onomos y de au oma iza a eas que suponen una g an
in e si´on de iempo y es ue zo de se ealizadas po se es humanos, como la iden i icaci´on
de obje os an o en im´agenes como en ´ıdeos. Po o o lado, el an´alisis o ense digi al
ha su ido un a ance conside able en los ´ul imos a˜nos g acias a la e oluci´on ecnol´ogica
con inua que se es ´a i iendo ac ualmen e. Si se jun an la in eligencia a i icial y el an´alisis
o ense, se puede mejo a conside ablemen e dicha labo , y pe mi i as´ı ab i las pue as
a u u os a ances que den paso a uncionalidades que a´un es ´an po conoce .
Es e abajo se cen a en in en a c ea sis emas ´op imos especializados en
encon a os os en ´ıdeos con condiciones muy des a o ables, con el in de encon a
compo amien os delic i os de mane a ´apida y e icien e, acili ando as´ı la labo del an´alisis
o ense y desp ende se as´ı de la necesidad de analiza los ´ıdeos manualmen e.
Pa a ello, se ha ealizado una ex ensa in es igaci´on an o en los concep os que engloban
el campo de la de ecci´on acial, como en abajos p e ios elacionados con es e ema, pa a
comp ende en p o undidad cu´ales son las ´ecnicas ac uales en uso que pod ´ıan se i pa a
es e abajo.
T as ealiza una amplia expe imen aci´on p obando con seis modelos dis in os basados
en ap endizaje p o undo, se ha llegado a la conclusi´on de p opone dos modelos: uno
especializado en la de ecci´on de ´ıdeos en local capaz de in e i con una exac i ud del
74,83 %, y o o adap ado pa a su uncionamien o en iempo eal con el que se alcanza
una exac i ud del 74,59 %.
Palab as Cla e: An´alisis Fo ense, Iden i icaci´on, De ecci´on, V´ıdeo, Redes Neu onales,
In eligencia A i icial, Ros os, Deep Lea ning.
xx
6Cap
´
ı ulo 1. In oducci´
on
1.5. Es uc u a del T abajo
El es o del abajo es ´a o ganizado en 9 cap´ı ulos con la es uc u a que se comen a a
con inuaci´on:
El Cap´ı ulo 2explica concep os b´asicos an o las bases de la AI como la de ecci´on de
obje os. Conc e amen e, es e cap´ı ulo cen a ambos campos de es udio en el ´e mino que
concie ne a es e abajo, que es la de ecci´on de os os en im´agenes digi ales y ´ıdeos.
Po an o, en es e cap´ı ulo se habla an o de la his o ia que en uel e a la AI como de las
´ecnicas u ilizadas y los dis in os modelos de Redes Neu onales.
El Cap´ı ulo 3comienza mos ando un es ado del a e en el que se p esen an dis in as
´ecnicas e in es igaciones ealizadas sob e el campo de la iden i icaci´on de os os
en im´agenes, as´ı como dis in as a qui ec u as y modelos p esen ados. Dichos abajos
ep esen an la si uaci´on en la que se encuen a ac ualmen e el campo de la de ecci´on de
os os en im´agenes y ´ıdeos. De cada a ´ıculo, se ex ae an o la idea y las ´ecnicas
u ilizadas pa a el desa ollo de es a, como el conjun o de en enamien o u ilizado y
las conclusiones a des aca en base a los esul ados ob enidos. Dichos esul ados se
almacenan en dis in as ablas pa a pode ob ene compa a i as en e los dis in os abajos.
Finalmen e se ealiza una pues a en com´un de los dis in os a ´ıculos pa a pode ex ae as´ı
conclusiones ace ca del es ado ac ual del obje o de es udio en es e abajo, la iden i icaci´on
de ca as en im´agenes y ´ıdeos digi ales.
El Cap´ı ulo 4p esen a las con ibuciones de es e abajo. As´ı pues, en p ime luga
se p esen a una ex ensa desc ipci´on de las ecnolog´ıas aplicadas pa a la c eaci´on de los
modelos que pos e io men e se pond ´an a p ueba en cap´ı ulos pos e io es. Tambi´en se
explica de alladamen e los dis in os conjun os de im´agenes u ilizados en el en enamien o
de los modelos y las dis in as m´e icas u ilizadas en las e aluaciones de la ase de
expe imen aci´on.
El Cap´ı ulo 5desc ibe los expe imen os ealizados pa a e alua la e ec i idad de los
modelos p opues os a pa i de las ecnolog´ıas explicadas en el Cap´ı ulo 4y p esen a
los esul ados ob enidos, as´ı como la a iaci´on de dichos esul ados en unci´on de la
op imizaci´on de la con igu aci´on inicial.
El Cap´ı ulo 6 ela a las apo aciones pe sonales de cada uno de los in eg an es del
equipo al desa ollo de es e abajo.
El Cap´ı ulo 7mues a las p incipales conclusiones de es e abajo, las l´ıneas u u as
de in es igaci´on.
Po ´ul imo, los Cap´ı ulos 8y9son las aducciones al ingl´es de la In oducci´on y de
las Conclusiones.

Cap´ı ulo 2
Ma co Concep ual
En es e cap´ı ulo se p e ende explica los concep os, endencias y las di e en es ´ecnicas
e e en es a la AI y la de ecci´on de obje os, cen ´andonos sob e odo en el obje i o de
de ecci´on de os os en im´agenes digi ales y ´ıdeos. Pa a ello, se explica ´a de d´onde su ge
la AI y los hi os que se han conseguido p e ios a es e abajo, las ´ecnicas m´as usadas a
d´ıa de hoy en el campo de la AI, las bases sob e las que se cimien a el DL y las Redes
Neu onales y, po ´ul imo, c´omo se ha aplicado odo es e conocimien o pa a c ea de ec o es
capaces de encon a un obje o, o os o en es e caso, de mane a e icien e.
2.1. His o ia de la In eligencia A i icial
¿Se pueden c ea m´aquinas in eligen es? Du an e siglos, los g andes pensado es han
u ilizado es a p egun a como uen e de mo i aci´on pa a pe mi i el a ance de la AI. Con
el iempo, el desa ollo de la AI ha dado luga a que es a cues i´on se empiece a elaciona
cada ez m´as con el uncionamien o del ce eb o, has a al pun o que, ac ualmen e, la
in es igaci´on pasa po conside a el ce eb o como un sis ema compu acional y la AI como
un modelo que se enca ga de emula el uncionamien o de es e. Debido a es o, se pod ´ıa
deci que el in ´ul imo de la AI es consegui que la m´aquina enga una in eligencia simila
a la humana, a ´andose as´ı de uno de los obje i os m´as ambiciosos que se han podido
plan ea en la ciencia.
Pese a que en los a˜nos 40 se publica on algunos abajos, la AI no goz´o de una g an
epe cusi´on has a el a˜no 1950, con la di usi´on de un abajo i mado po el ma em´a ico
b i ´anico Alan Tu ing.
Alan Tu ing “conside ado pad e de la in o m´a ica y p ecu so de la AI” dio sus p ime os
pasos en es a ama del conocimien o dise˜nando un p og ama que pe mi ´ıa a los usua ios
juga al ajed ez. A˜nos despu´es, esc ibi´o un a ´ıculo pa a la e is a Mind [Tu 50], en el
que de endi´o el compo amien o in eligen e que pod ´ıan llega a ene las maquinas; y
p opuso un es , aho a conocido como el Tes de Tu ing, que pe mi ´ıa de e mina si se
pod´ıa conside a in eligen e a un compu ado o no. A d´ıa de hoy, se piensa que es e es
no es muy iable y se han p opues o o as e siones que lo complemen an.
7
8Cap
´
ı ulo 2. Ma co Concep ual
A su ez, en los ´
Angeles, Belmon Fa ley y Wesley Cla k ealiza on en la Wes e n Join
Compu e Con e ence una p esen aci´on de cua o abajos: es de ellos a aban sob e
econocimien o de pa ones y el es an e sob e m´aquinas pa a juga al ajed ez. En uno de
ellos, se pod´ıa e c´omo se es aba buscando la mane a de elaciona el ce eb o con una
AI, y desc ibie on la mane a de econoce pa ones median e el ajus e de los pesos de una
ed neu onal a i icial.
En e los a˜nos 1955 y 1956, Allen Newell y He be Simon, di undie on un p og ama
conocido po el nomb e Logic Theo is , que pe mi ´ıa demos a eo emas de l´ogica
p oposicional que es aban con enidos en el lib o P incipia Ma hema ica [WR10]. A pa i
de aqu´ı, la in es igaci´on en la AI comenz´o a aumen a y se consiguie on dis in os a ances.
En los a˜nos 60, en el S an o d Resea ch Ins i u e, Duda y Ha c ea on con el lenguaje
Fo an el p ime sis ema basado en edes neu onales que e a capaz de ap ende . M´as
a de, se comenza on a da los p ime os pasos en cuan o al p ocesamien o del lenguaje
na u al se e ie e. [LdMM17]
Es impo an e des aca que, has a 1980, no se ol ie on a e g andes a ances en es e
campo. Aunque los o denado es e an cada ez m´as po en es y econ´omicamen e menos
cos osos, a´un se es aba lejos de consegui un compo amien o e dade amen e in eligen e
po pa e de las m´aquinas. Es a si uaci´on se ag a ´o debido a una escasa inanciaci´on po
pa e de los gobie nos y al desa ollo de unos algo i mos que no e an muy e icien es en el
´ambi o de la AI.
A pa i de los a˜nos 90, empeza on a su gi di e sas apo aciones de alo pa a
posibili a el p og eso en es e ´a ea. Conc e amen e, un hi o muy sonado es el que se
consigui´o en 1997, cuando una AI de IBM consigui´o gana al campe´on del mundo de
ajed ez [FH99]. A˜nos m´as a de, se consigui´o c ea un obo que in e p e aba emociones
y, a su ez, e a capaz de exp esa las [B e20]. O o pun o de in lexi´on se p odujo en 2006
[HOT06], cuando G. E. Hin on, S. Osinde o, y Yee-Whye Teh die on a conoce median e
una publicaci´on lo que m´as a de se conoci´o como Ap endizaje P o undo. En ´e minos
gene ales, el abajo explicaba a qui ec u as de edes neu onales con m´ul iples capas, que
pe mi ´ıan que es as ap endie an de una o ma m´as aguda.
A es os diez ´ul imos a˜nos se los conoce como la ´epoca do ada de la AI, debido a los
g andes a ances que se es ´an p oduciendo, impulsados ambi´en po una mejo a de los
algo i mos y una mayo capacidad de c´ompu o. En 2012, Google se enca g´o de c ea una
ed neu onal a i icial que con aba con 16.000 p ocesado es a la que le suminis a on 10
millones de minia u as de ´ıdeos de YouTube al aza [Cla20]. Como esul ado, el sis ema
ap endi´o a econoce os os con una p ecisi´on del 81,7 %, pa es del cue po humano con
una p ecisi´on de 76,7 %, e iden i icaba ga os el 74,8 % de las eces. Po o o lado, en 2014,
un bo supe ´o po p ime a ez el amoso Tes de Tu ing. Es e sis ema consigui´o enga˜na a
30 de los 150 jueces a los que ue some ido el p og ama du an e el es , haci´endose pasa
po un ni˜no de 13 a˜nos y man eniendo una con e saci´on con ellos.
En la ac ualidad, la AI se es ´a iendo muy a o ecida po el uso del Big Da a, g acias
al cual se ecogen una can idad inmensa de da os y se p ocesan pa a pode ex ae
conocimien o pos e io men e de ellos. [Sch97]. El bene icio de es o es que se es ´a empezando
a aplica a di e sos campos, como pueden se la medicina, ob´o ica, segu idad, anspo e,
comunicaci´on, inanzas, sociedad, e c. Adem´as, es e iden e que g andes emp esas como
Amazon, Google, Apple, IBM y Mic oso , es ´an ealizando una g an in e si´on y gene ando
un alioso desa ollo en es e ´a ea, que acaba ´a dando luga a un mayo p og eso con el
paso de los a˜nos.
2.2. T´
ecnicas U ilizadas en In eligencia A i icial 9
2.2. T´ecnicas U ilizadas en In eligencia A i icial
A lo la go de los ´ul imos 20 a˜nos, los in es igado es se han cen ado mayo men e en
di e en es concep os pa a pode de ini el ´e mino de AI. Es o ha d´ıa de hoy ha cambiado.
Aho a se quie e que las m´aquinas se compo en de mane a acional median e la capacidad
de ac ua , sen i , pensa y azona , po lo que se iene que en oca la AI de dis in as
o mas.
El lado posi i o de es o eside en que, odas es as o mas de en ende lo que es una AI,
ienen algo en com´un: se basan en encon a eo ´ıas y me odolog´ıas que puedan ayuda a
las m´aquinas a en ende el mundo y eacciona a las si uaciones de la misma o ma que lo
ha ´ıa un humano. Es as eo ´ıas se pueden clasi ica en dis in os ma cos de abajo seg´un
el en oque y el p oblema que esuel an en el mundo eal. Es a clasi icaci´on se mues a en
la Figu a 2.1.
Figu a 2.1: P incipales aplicaciones de la In eligencia A i icial
Ap endizaje Au om´
a ico: Posiblemen e es a sea la disciplina m´as usada
ac ualmen e pa a c ea compo amien os in eligen es. El obje i o es dise˜na y
desa olla modelos que ap endan de da os ya exis en es y ealiza p edicciones con
nue os da os. La mayo es icci´on de es os algo i mos es que es ´an p o undamen e
10 Cap
´
ı ulo 2. Ma co Concep ual
limi ados po los da os que se le suminis en. De es a o ma, si enemos un conjun o
de da os peque˜no, el modelo esul an e se ´a bas an e imp eciso ambi´en. Es e campo
iene dis in as e ien es a su ez, como los que se pueden e en la Figu a 2.1.
Adem´as, cuen a con algunas ´ecnicas como el Ap endizaje po T ans e encia (del
ingl´es, T ans e Lea ning (TL)), que nos con ie e la habilidad de modi ica modelos
que ya han ap endido pa a ajus a lo a nues as necesidades.
Sis emas Expe os: Son sis emas que oman decisiones o p opo cionan consejos
usando ´ecnicas de AI. En gene al, se u iliza en campos como las inanzas, ma ke ing,
medicina, e c. y ex aen el conocimien o de una bases de da os pa a da los consejos
p e iamen e dicho.
P ocesamien o del Lenguaje Na u al: Es e campo se enca ga de p ocesa y
en ende ex os. Gene almen e, es e ipo de ´ecnicas se u ilizan en mo o es de
b´usqueda, de mane a que al usua io solo se le mues an los mejo es esul ados
posibles en elaci´on con su b´usqueda ealizada.
Plani icaci´
on: Es e campo se ocupa de b inda el m´aximo endimien o con unos
cos os m´ınimos en una plani icaci´on. Comienzan con unos de e minados hechos y
una especi icaci´on del obje i o a consegui y gene an el plan m´as ´op imo pa a log a
los esul ados.
Rob´
o ica: En la ob´o ica se combinan a ios concep os de la AI, ya que los obo s
ienen dis in os senso es que, dependiendo de la si uaci´on, les pe mi en ac ua de
una mane a u o a. Son capaces de adap a se a nue as si uaciones pudiendo e
obje os, medi empe a u as, mo imien os, e c.
Visi´
on A i icial: Como su p opio nomb e indica, hay sis emas que acili an la
a ea de o o ga la capacidad de isi´on a un compu ado , median e el a amien o
de im´agenes y ´ıdeos. Es os algo i mos comp enden el con enido que se le suminis a
y ex aen in o maci´on de ello. Ac ualmen e, la in es igaci´on se cen a en aplica lo a
conducci´on au ´onoma y la ealidad aumen ada en e o os.
Reconocimien o del Habla: Es os sis emas se enca gan de o´ı y econoce el
habla. D´ıa a d´ıa, se u ilizan com´unmen e en asis en es pe sonales que son capaces
de en ende y ealiza acciones espec´ı icas en base a lo que se les ha pedido.
Una ez se ha en endido cu´ales son las dis in as aplicaciones exis en es en la AI, se
a a p o undiza a´un m´as en aquellas ´ecnicas que son necesa ias pa a el obje i o de la
de ecci´on de os os en ´ıdeos.
2.2.1. Ap endizaje Au om´a ico
Como se explica en [SF18], el ML es el campo de es udio que es ´a ca ac e izado po se un
so wa e que ap ende de expe iencias p e ias. En es e ipo de p og amas lo que se in en a
consegui que es os algo i mos ap endan pa ones que se hallan en los da os p e ios y
p oduzcan unos esul ados in eligen es pa a da os nue os de en ada. O o nomb e po
el que se conoce al ML es Ap endizaje Induc i o debido a que el c´odigo a a de in e i
es uc u as a a ´es de los da os.
2.2. T´
ecnicas U ilizadas en In eligencia A i icial 11
En ocasiones, modela el compo amien o que iene segui un de e minado p og ama
puede se una a ea bas an e compleja, debido a que no es posible hace lo median e una
secuencia de pasos cla amen e de inida y en el algo i mo es ´a in oluc ado alg´un ipo de
pa ´on que deno a o equie e cie a in eligencia. Pa a es os casos, el ML puede se la
he amien a co ec a a u iliza .
Lo que es e ipo de algo i mos p opo ciona es un conjun o de he amien as pa a esc ibi
c´odigo sin de ini odos y cada uno de los de alles del algo i mo. El p og amado se enca ga
de ajus a algunos pa ´ame os y el es o se in ie en median e un p oceso de ap endizaje
llamado en enamien o. Es e p oceso pe mi e encon a au om´a icamen e los pa ´ame os
que mejo de inen nues o modelo. Gene almen e, el endimien o del modelo se puede
mejo a median e la disponibilidad de una mayo can idad de ejemplos o da os que deben
suminis a se como en ada del sis ema en la ase de en enamien o.
Se a a supone el caso de que se es ´a a ando de cocina una ece a. Si nunca an es se
ha cocinado nada, puede lle a d´ıas descub i cu´al es la mejo combinaci´on de ing edien es
pa a hace que el pla o sea de buen gus o. Es es a c eaci´on de ece as la que da la capacidad
de eco da ´apidamen e c´omo hace nues o pla o. Del mismo modo, el ML compa e es a
idea. Como mues a la Figu a 2.2, se puede deci que un algo i mo de ML se puede desc ibi
en dos e apas: en enamien o yp edicci´on.
Figu a 2.2: Fases de un algo i mo de Ap endizaje Au om´a ico
En la ase de en enamien o, el obje i o que se pe sigue es desc ibi los da os median e
el llamado ec o de ca ac e ´ıs icas, capaz de ep esen a obje os del mundo eal en una
lis a de a ibu os. Es os ec o es son los que el algo i mo de ap endizaje u iliza pa a
ealiza su en enamien o y ob ene nues o modelo. Es a ase es la que consume la mayo
pa e del iempo, pudiendo du a ho as, d´ıas o incluso semanas en comple a se.

12 Cap
´
ı ulo 2. Ma co Concep ual
Po o o lado, se iene la ase de p edicci´on en la que el modelo p e iamen e c eado
ecibe un ec o de ca ac e ´ıs icas nue o pa a ´el, es deci , un da o con el que no ha sido
en enado. Es a ase lle a mucho menos iempo que la de ap endizaje —pudiendo se
incluso en iempo eal— y se enca ga inalmen e de hace la p edicci´on deseada.
Como es de espe a , el ML cuen a con dis in os ipos de algo i mos de ap endizaje que
pueden clasi ica se a menudo en a ios g upos. Los m´as impo an es son los siguien es:
Ap endizaje Supe isado,Ap endizaje No Supe isado,Ap endizaje Po Re ue zo y
Ap endizaje P o undo.
Debido a la impo ancia de es e ´ul imo en la consecuci´on de nues o obje i o, se
dedica ´a m´as adelan e un apa ado en e o donde se explica ´a con m´as de alle.
Ap endizaje Supe isado: El Ap endizaje Supe isado (del ingl´es Supe ised
Lea ning (SL)), se e ie e a aquellos algo i mos que u ilizan da os que deben
se e ique ados p e iamen e po un humano an es de pode in oduci se en el
algo i mo. El obje i o que se pe sigue es pode e ique a un nue o da o bas´andose
en las ca ac e ´ıs icas encon adas en los da os de en enamien o. La Figu a 2.2
p ecisamen e mues a es os ipos de algo i mos. Suponiendo que se quie e p edeci
los ing esos de una pe sona en base a su edad, localizaci´on, educaci´on, e c. Pa a ello,
se end ´ıa que ene un conjun o de da os con es a in o maci´on de las pe sonas y
e ique a a cada una de ellas con los ing esos que ecibe. De es a mane a, se le di ´ıa
al algo i mo qu´e pa ´ame os co esponden con qu´e ing esos y el algo i mo ap ende ´ıa
a ealiza ese mapeado. Las p incipales ´ecnicas que se u ilizan en ML son las
siguien es: Reg esi´on Lineal,Reg esi´on Log´ıs ica,K-Vecinos M´as Ce canos,´
A boles
de Decisi´on,Redes Neu onales A i iciales yM´aquinas de Vec o es de Sopo e
Ap endizaje No Supe isado: El Ap endizaje No Supe isado (del ingl´es
Unsupe ised Lea ning (UL)), se e ie e a aquellos algo i mos que no necesi an da os
e ique ados pa a pode c ea un modelo de ap endizaje. En cie a mane a, es jus o
lo con a io a lo que hemos comen ado en el apa ado p e io. Debido a que no
hay e ique as, se deben ex ae pa ones di ec amen e de los da os. En es e caso,
si suponemos que exis e una aplicaci´on que se ap o echa de la a iedad de usua ios
que la u ilicen y se quie e clasi ica a es os pa a sabe con qu´e ipo de pe sonas se
cuen an. Aqu´ı no se sab ´ıa exac amen e qu´e c i e io segui pa a pode sepa a las.
Po lo an o, en es a si uaci´on en a ´ıa en juego el UL pa a clasi ica de mane a
´op ima a es as pe sonas en dis in os g upos. Las p incipales ´ecnicas que se u ilizan
en UL son las siguien es: Ag upaci´on yReducci´on de la Dimensi´on
Ap endizaje Po Re ue zo: El Ap endizaje Po Re ue zo (del ingl´es
Rein o cemen Lea ning (RL)), se e ie e a aquellos algo i mos que, a di e encia del
SL y del UL que es ´an elacionados con el e ique ado, en enan con la in o maci´on
que eciben del en o no cuando es e eacciona a cie as acciones. El obje i o es
ap ende qu´e combinaci´on de acciones p oduce los esul ados m´as a o ables.
Es e ipo de algo i mos se suelen p incipalmen e pa a c ea la AI de ideojuegos o
en el campo de la ob´o ica.
2.2. T´
ecnicas U ilizadas en In eligencia A i icial 13
2.2.2. Ap endizaje P o undo
El DL es el subcampo del ML que pe enece a la amilia de algo i mos de Redes Neu onales
A i iciales y p o undiza en ellos an o uncional como es uc u almen e. Es as se inspi an
en el uncionamien o del ce eb o humano y, como al, ienen unos nodos conec ados unos
a o os y di ididos en capas, los cuales se pasan in o maci´on en e s´ı de mane a que, cada
capa de la ed, se enca ga de ap ende unas de e minadas ca ac e ´ıs icas de la en ada
en cues i´on. Debido a la ele ancia del uncionamien o de es as edes en es e abajo, se
explica ´an en secciones pos e io es con m´as de alle.
Como se puede e en la Figu a 2.3, a di e encia de los algo i mos de ML donde la
ex acci´on de ca ac e ´ıs icas de los da os la ealiza expl´ıci amen e un humano, en DL
pasa a se esponsabilidad de la a qui ec u a del p opio algo i mo. Como consecuencia, la
complejidad de la a qui ec u a aumen a conside ablemen e dado que es necesa io pode
ene m´as capas que p ocesen esa in o maci´on.
Figu a 2.3: Di e encia en e algo i mo de Ap endizaje Au om´a ico y Ap endizaje P o undo
Pese a que los algo i mos de DL consiguen mejo es esul ados que un humano en
la mayo ´ıa de los casos, no siemp e es necesa ia su u ilizaci´on; es o depende ´a de la
complejidad del p oblema que es emos a ando de esol e . Al a a se de algo i mos
mucho m´as complejos que los ela i os al ML, la capacidad compu acional que pueden
llega a eque i puede se inmensa en compa aci´on con es os y, po an o, es de ex ema
ele ancia sabe en qu´e momen o enemos que u iliza ML yDL. Dominando es o, se
pod ´ıan educi cos es an o en iempo de ejecuci´on como econ´omicos, en caso de se
necesa io u iliza pla a o mas de compu aci´on en la nube pa a ello.
En el caso de es e abajo, si se quisie an ex ae las ca ac e ´ıs icas que de inan una
imagen en conc e o de o ma manual, se ´ıa una a ea demasiado di icul osa, po lo que la
u ilizaci´on de DL se uel e casi necesa ia. Po an o, median e DL no solo se de ec a ´an
los os os en una imagen dada, sino que adem´as se ha ´a sin necesidad de deci le a la ed
neu onal qu´e ca ac e ´ıs icas de inen un os o.
14 Cap
´
ı ulo 2. Ma co Concep ual
2.2.3. Ap endizaje Po T ans e encia
Como se expone en [B o20b], el TL es una ´ecnica usada en ML en la que un modelo que
ya ha sido desa ollado y en enado se eu iliza como base pa a c ea o o modelo que
ealice una a ea simila .
Com´unmen e, es e m´e odo se u iliza en DL eu ilizando modelos p een enados pa a
a eas de Visi´on A i icial y P ocesamien o del Lenguaje Na u al debido a la masi a
can idad de da os, ecu sos compu acionales y iempo que necesi an los modelos de DL
pa a p oduci un algo i mo que uncione e dade amen e bien.
Pa a pode eu iliza el modelo sin pe de el g ado de ap endizaje que han alcanzado
las capas en su ´ul imo en enamien o, se debe en ena ´unicamen e la capa de salida, la
cu´al debe emos adap a la a nues as necesidades seg´un el ipo de a ea que que amos
ealiza .
Du an e el p oceso pa a ealiza el TL, puede que se u ilice odo o pa e del modelo
p een enado dependiendo de la ´ecnica que se u ilice y el endimien o que se quie a llega
a alcanza . La ´ecnica llamada A inamien o (del ingl´es, Fine-Tune) es m´as complicada de
ealiza y con ella, no solo se eemplaza la ´ul ima capa, sino que ambi´en se een enan
algunas de las capas an e io es de mane a selec i a. [Sa 20]
El TL, po an o, es una op imizaci´on que puede pe mi i aho a iempo y ob ene
mejo es esul ados, aunque no iene po qu´e se as´ı. Has a que no se desa olle y e al´ue el
modelo c eado no se pod ´a sabe si se ha desa ollado un bene icio o no, en cuan o a usa
TL se e ie e.
Como se puede e en la Figu a 2.4, hay es o mas po las que se puede a e igua si
el modelo ha mejo ado u ilizando TL.
Figu a 2.4: Signos de mejo a usando Ap endizaje Po T ans e encia
La p ime a es comp obando si el endimien o inicial con el que se ha comenzado a
en ena el algo i mo es mayo de lo que se ´ıa de o a o ma. La segunda opci´on que exis e
se ´ıa comp oba su pendien e. Cuan o m´as p onunciada sea la asa de mejo a du an e el
en enamien o, mejo se ´a el modelo. Po ´ul imo, se pod ´ıa comp oba que la con e gencia
inal del modelo en enado es supe io en cuan o a endimien o se e ie e.
2.3. Visi´
on A i icial 15
2.3. Visi´on A i icial
La Visi´on A i icial (del ingles Compu e Vision (CV)) es el campo de la AI que o o ga
la p opiedades de la isi´on humana a un compu ado , pudiendo a a se de un d on,
sma phone,scanne , e c. con a ias c´ama as in eg adas. El compu ado en cues i´on debe
se el esponsable de p ocesa y ex ae in o maci´on de las im´agenes digi ales que gene e
dicha c´ama a. [Sha18]
Exis en di e sas ´ecnicas de DL que pe mi en pode soluciona los p oblemas que
su gen a menudo en el campo de la CV:
Clasi icaci´
on: Es el p oceso median e el cual se e ique a una imagen eniendo
en cuen a su con enido isual, es deci , se a a de a e igua cu´al es el concep o
que apa ece en ella. Po ejemplo, un algo i mo de clasi icaci´on de im´agenes pod ´ıa
de e mina si apa ece una igu a humana, un animal, una ca a, e c.
De ecci´
on y Segmen aci´
on: Se denomina De ecci´on a la a ea de encon a un
de e minado obje o o igu a en una imagen y enma ca lo con una caja delimi ado a
con su co espondien e e ique a. Sin emba go, la Segmen aci´on es di e en e. Es a se
enca ga de hace una clasi icaci´on po p´ıxeles, bo deando la igu a de aquello que
que emos encon a , en luga de enma ca lo con una caja delimi ado a. Es a ´ecnica
se suele u iliza sob e odo en el p ocesamien o de im´agenes m´edicas o im´agenes
ob enidas de sa ´eli es.
Ap endizaje Po Simili ud: En es a ´ecnica se busca ap ende de dos im´agenes
que son simila es d´andole impo ancia al signi icado sem´an ico que eside en e ellas
dos. Son algo i mos que se suelen u iliza a menudo en la iden i icaci´on acial.
Sub i ulado de Im´
agenes: Como su p opio nomb e indica, se a a del p oceso
de desc ibi la a ea que es ´a sucediendo en la imagen.
Modelos Gene a i os: Son aquellos modelos enca gados de gene a o as im´agenes
eniendo o as p e iamen e como e e encia.
2.4. Modelo Neu onal
A lo la go de los a˜nos, el DL se ha is o muy in luenciado po el uncionamien o de nues o
ce eb o y se ha inspi ado en es e pa a c ea modelos compu acionales y ma em´a icos que
pe mi an simula su compo amien o. Pa a ello, es necesa ia la c eaci´on de un modelo que
ep oduzca las neu onas biol´ogicas y, de es a mane a, se pe mi a el paso de in o maci´on
de unas a o as. El modelo que se u iliza a d´ıa de hoy es el conocido como Pe cep ´on o
Neu ona A i icial.
Como se puede e en la Figu a 2.5, la neu ona a i icial unciona de al mane a que
ecibe un ec o de en ada X, el cual se u iliza pa a ealiza una suma ponde ada con
los pesos Wasignados en e las en adas y el cue po de la neu ona. Es os pesos son una
ep esen aci´on de la impo ancia dada a cada en ada en conc e o y su alo puede cambia
du an e la ase de en enamien o.
22 Cap
´
ı ulo 2. Ma co Concep ual
2.6.1. P oceso de En enamien o
Como deja cla o el au o Jo di To es [To 18], el p oceso de en enamien o queda ma cado
po un cons an e “i y eni ” po las capas de la ANN. El hecho de i hacia delan e se
conoce como o wa d p opaga ion, mien as que su opues o es com´unmen e conocido po
backp opaga ion.
El p ime paso se p oduce cuando los da os de en enamien o se exponen a oda la ed
y es os la c uzan pa a acaba calculando las p edicciones. Du an e es a p opagaci´on, cada
neu ona aplica su unci´on de ac i aci´on al da o que eciben y se lo pasan a la neu ona
siguien e. Una ez se ha eco ido, se usa la unci´on de loss o e o , pa a es ima y medi
c´omo de bueno o malo ha sido nues o esul ado en compa aci´on con el que debe ´ıa da ,
el cual queda es ablecido po la e ique a que se o ece con cada da o de en enamien o.
El segundo paso se ealiza cuando ya enemos calculado el e o . Es e se p opaga hacia
a ´as, pa iendo desde la capa de salida y pasando po odas y cada una de las neu onas
que iene la ed y que han con ibuido a las p edicciones ealizadas. No obs an e, cada
neu ona solo ecibe un e o p opo cional a la con ibuci´on que han ealizado pa a p oduci
la salida.
Es a ´ul ima p opagaci´on es la que pe mi e inalmen e ajus a odos los pesos exis en es
en las conexiones que unen las neu onas. El obje i o que se p e ende consegui de es a
o ma, es que el e o se ap oxime cada ez m´as a ce o pa a ealiza mejo es p edicciones
cada ez que se uel a a u iliza la ed.
Pa a minimiza el loss hay di e sas ´ecnicas, pe o la m´as conocida es el descenso de
g adien e. Es a se ocupa de u iliza la de i ada de la unci´on de e o pa a encon a el
m´ınimo global median e la a iaci´on de los pesos en peque˜nos inc emen os. En gene al,
es o se ealiza en unos lo es de da os llamados ba ches du an e una se ie de i e aciones
conocidas como epochs.
2.6.2. Sesgo y Va ianza
El sesgo y a ianza (del ingl´es, unde i ing yo e i ing espec i amen e) son dos
concep os con apues os que cons i uyen uno de los p oblemas undamen ales del ML,
ya que lidian con la op imizaci´on y la gene alizaci´on del modelo [F.18].
La op imizaci´on se ocupa de ajus a el modelo a los da os de en enamien o
p opo cionados, con el obje i o de consegui el mejo endimien o posible, mien as que
la gene alizaci´on hace e e encia a c´omo de bien o mal se ealiza la p edicci´on sob e da os
que nunca se han is o.
Un modelo de ML puede encon a se en dis in os du an e su en enamien o. Puede
halla se en un es ado de unde i ing, es deci , no ha podido ap ende de los da os
co ec amen e y a´un es incapaz de gene aliza de mane a adecuada. Po an o, es o indica
que puede op imiza se a´un m´as. Po o o lado, ambi´en puede encon a se en un es ado
de o e i ing, o dicho de o o modo, ha ap endido a ajus a an bien a los da os de
en enamien o que le esul a imposible gene aliza bien sob e da os nue os. Es o indica
que es ´a demasiado op imizado.
El obje i o es encon a el balance en e es os dos ex emos y, pa a ello, se pueden usa
la gene aci´on cu as de ap endizaje pa a diagnos ica su endimien o, las cuales mues an
c´omo ha ido a anzando el e o con los da os de en enamien o y alidaci´on.

2.6. En enamien o de las Redes Neu onales 23
Un modelo que su a sesgo, puede se iden i icado ´unicamen e po su cu a de
en enamien o. Se pod ´a de ec a si es a pe manece plana, sigue disminuyendo has a el
inal del en enamien o o ma ca un e o demasiado al o. En la Figu a 2.10, se mues an
algunos ejemplos [B o20a].
Figu a 2.10: Ejemplos de Cu as de Ap endizaje con Sesgo
Po el con a io, un modelo que su a a ianza, se debe iden i ica con las dos cu as:
an o la de en enamien o como la de alidaci´on. Es e es ado se ca ac e iza po ene una
cu a de en enamien o con bajo e o y con endencia a disminui con cada expe iencia,
y po cu a de alidaci´on que dec ece has a un pun o y m´as a de comienza a c ece .
La si uaci´on ideal que se busca eside en ene una cu a de en enamien o op imizada
en cos e y una de alidaci´on que se adap e a ella du an e odas las i e aciones.
En la Figu a 2.11 se pueden e unos ejemplos [B o20a].
Figu a 2.11: Ejemplo de Va ianza y de un Ap endizaje Ideal
Con el obje i o de ob ene el mejo endimien o y e i a las si uaciones ex emas que
se acaban de explica , se pueden ealiza una se ie de ´ecnicas que pe mi en abo da lo de
una mane a ap opiada. Po ello, se ci a ´an algunas de las m´as u ilizadas a d´ıa de hoy,
seg´un a ´ıculos cien ´ı icos publicados ecien emen e [Sil20].
24 Cap
´
ı ulo 2. Ma co Concep ual
Pa a soluciona el sesgo:
Inc emen a la complejidad del modelo.
Aumen a el n´ume o o ama˜no de pa ´ame os que es e u iliza.
En ena el modelo du an e un mayo iempo.
Pa a co egi la a ianza:
U iliza egula izaci´on, lo cual lle a al modelo a ene ecuaciones menos complejas.
P oba con el m´e odo de alidaci´on c uzada.
Pa a el en enamien o an es de que la cu a de alidaci´on comience a ascende .
U iliza la ´ecnica de d opou , seg´un la cual se igno an neu onas du an e el
en enamien o.
A˜nadi m´as da os de en enamien o.
2.7. De ecci´on Facial
Dos ´e minos que suelen con undi se muy a menudo son la de ecci´on acial y el
econocimien o acial. La de ecci´on acial es una ecnolog´ıa que o ma pa e de una m´as
gene al: la de ecci´on de obje os. Es a se enca ga de encon a obje os en ´ıdeos e im´agenes
digi ales y iene un cos e compu acional mucho mayo que aquellas que pe mi en clasi ica
obje os ´unicamen e, ya que no solo se p edice la clase a la que pe enece una de e minada
imagen, sino que adem´as se enca ga de se˜nala en qu´e coo denadas se encuen a dicha
p edicci´on. Sin emba go, el econocimien o acial es una ecnolog´ıa que, adem´as de ealiza
la a ea de de ecci´on, iden i ica qui´en es la pe sona que ha de ec ado.
Con el iempo, algunas ´ecnicas de CV se han uel o cada ez m´as udimen a ias y
se han is o sus i uidas po ML yANN que pe mi en ealiza la misma unci´on de una
mane a m´as e icien e y e icaz. A d´ıa de hoy, exis en di e sos m´e odos pa a ealiza es a
a ea y se di iden en el n´ume o de e apas en el que consiguen ealiza la de ecci´on. Po
ello, se ienen de ec o es de dos e apas yde ec o es de una e apa.
2.7.1. De ec o es de Dos E apas
Como queda expues o en [JZL+19], los de ec o es de dos e apas, ienen una al a p ecisi´on
de localizaci´on y de econocimien o de obje os. U ilizan una ANN llamada Region P oposal
Ne wo k pa a ealiza una b´usqueda de egiones de in e ´es que m´as a de deben pasa se
a una e apa de clasi icaci´on y delimi aci´on de las coo denadas que iden i ican el obje o.
2.7. De ecci´
on Facial 25
2.7.1.1. Red Neu onal Con olucional Basada en Regiones
La Red Neu onal Con olucional Basada en Regiones (del ingl´es, Region-Based
Con olu ional Neu al Ne wo k) conocida m´as com´unmen e po R-CNN, ue p opues a
po Ross Gi shick [GDDM14] como uno de los p ime os abajos en demos a que una
CNN pod ´ıa ele a el endimien o en a eas de de ecci´on de obje os.
La R-CNN se compone de es m´odulos que in e ac ´uan de mane a secuencial:
El p ime o, se enca ga de gene a y ex ae 2000 egiones llamadas p opues as
de egi´on. Es as son unos cuad os que delimi an los po enciales candida os a se
de ec ados.
El segundo, ecoge las egiones p oducidas en el m´odulo an e io y se enca ga de
ex ae las ca ac e ´ıs icas de las im´agenes median e una CNN, como se explic´o en
apa ados p e ios. La ed, p oduce un ec o de salida de 4096 elemen os que desc ibe
el con enido de la imagen.
El ´ul imo m´odulo, u iliza el ec o del paso an e io pa a in oduci lo en una Suppo
Vec o Machine que se ocupa de clasi ica la p esencia del obje o deseado en la egi´on
p opues a. Adem´as de ello, se p edicen ambi´en cua o alo es con las coo denadas
en las que se si ´ua el obje o.
Una de las p incipales des en ajas que p esen a es a ap oximaci´on eside en que
equie e que cada egi´on sea pasada po una CNN, haci´endolo de es a mane a un algo i mo
len o, pues o que iene 2000 egiones pa a analiza . Se puede e la a qui ec u a en la
Figu a 2.12
Figu a 2.12: A qui ec u a del Modelo R-CNN
26 Cap
´
ı ulo 2. Ma co Concep ual
2.7.1.2. Red Neu onal Con olucional R´
apida Basada en Regiones
Ross Gi shick al e que u o ´exi o en su implemen aci´on de la R-CNN, se decidi´o a
implemen a una mejo a del modelo, cen ´andose sob e odo en hace la con un mayo
endimien o y m´as ´apida. Pa a ello, p opuso una Fas R-CNN, es deci , una Red Neu onal
Con olucional Basada en Regiones (del ingl´es, Fas Region-Based Con olu ional Neu al
Ne wo k) [Gi 15].
En su implemen aci´on, om´o como base el modelo an e io pe o aho a, en luga de
pasa cada p opues a po una CNN, gene a un mapa de ca ac e ´ıs icas con olucional
pas´andole la imagen en e a una sola CNN. A pa i de es e mapa, se a a de iden i ica
las p opues as de egi´on, se ag upan en una capa y pos e io men e se pasan a o a capa
o almen e conec ada. Finalmen e, acaba us´andose So max pa a p edeci la clase y, como
en el modelo an e io , se uel en a p edeci las coo denadas en las que se si ´ua la egi´on.
Como puede e se en la Figu a 2.13, se puede in ui que es a ap oximaci´on es mucho
m´as ´apida que la an e io , ya que no iene que u iliza una CNN po cada egi´on que se
ha p opues o, es deci , no u iliza 2000 CNN.
Figu a 2.13: A qui ec u a del Modelo Fas R-CNN
2.7.1.3. Red Neu onal Con olucional M´
as R´
apida Basada en Regiones
Hace apenas cua o a˜nos, Shaoqing Ren consigui´o mejo a a´un m´as la elocidad de
en enamien o del Fas R-CNN y p opuso el Fas e R-CNN o, dicho de o o modo, la Red
Neu onal Con olucional M´as R´apida Basada en Regiones (del ingl´es, Fas e Region-Based
Con olu ional Neu al Ne wo k) [RHGS15].
En las dos p opues as an e io es, se iene que ealiza una b´usqueda pa a pode conoce
cu´ales son las egiones p opues as. Es o hace que sea un p oceso len o y p o oca un g an
impac o en el endimien o. Po ello, en es e modelo y, al igual que en Fas R-CNN, se
alimen a una ´unica CNN con la imagen y se u iliza o a ed que pe mi e p edeci las
p opues as. Es as se uel en a ag upa en una nue a capa y pos e io men e se clasi ican
y p edicen las coo denadas del obje o. Se puede e su a qui ec u a en la Figu a 2.14.
Has a el d´ıa de hoy, el Fas e R-CNN es el modelo m´as ´apido y e icaz en cuan o
a de ecci´on de obje os se e ie e. Po ello, es una opci´on a ene muy en cuen a en el
desa ollo de es e abajo.
2.7. De ecci´
on Facial 27
Figu a 2.14: A qui ec u a del Modelo Fas e R-CNN
2.7.2. De ec o es de Una E apa
A di e encia de los de ec o es an e io es, los de una e apa son buenos cuando se quie e
consegui una al a elocidad de in e encia, po lo que se ´ıan con enien es en a eas que
se deban ealiza en iempo eal ya que son bas an e m´as ´apidos que los comen ados
p e iamen e.
Funcionan de al mane a que se les p opo ciona una imagen a la ed y p oponen cuad os
pa a ealiza las p edicciones, e i ´andose as´ı la e apa de b´usqueda de egiones de in e ´es.
2.7.2.1. Solo Mi as Una Vez
El modelo Solo Mi as Una Vez o YOLO (del ingl´es, You Only Look Once), ue p opues o
po Josheph Redmon y Ross Gi shick en 2015 [RDGF16].
Es a ap oximaci´on de modelo de de ecci´on unciona de mane a muy dis in a a odos
los p opues os an e io men e. En YOLO, se coge una imagen y se u iliza una sola CNN.
Conc e amen e, lo que se hace es di idi la imagen en una cuad ´ıcula de ama˜no NxN y
cada cuad o esul an e se uel e a di idi en M cuad os delimi ado es.
Pa a cada uno de es os, la CNN p edice la clase a la que pe enece de ol iendo una
p obabilidad y unos alo es de des iaci´on asignados a cada cuad o delimi ado . Si es a
p obabilidad supe a un cie o umb al, se end ´a en cuen a el cuad o y o ma ´a pa e del
cuad o delimi ado o al que se˜nala ´a la de ecci´on. Su a qui ec u a se puede e en la
Figu a 2.15.
Figu a 2.15: A qui ec u a del Modelo YOLO

28 Cap
´
ı ulo 2. Ma co Concep ual
La des en aja que o ece YOLO se basa p incipalmen e en que no es capaz de de ec a
obje os de mane a p ecisa cuando es os son demasiado peque˜nos, po lo que no se ´ıa una
buena opci´on pa a de ec a os os si es os se encuen an alejados de la c´ama a que los
cap u a.
2.7.2.2. De ec o de Un Solo Vis azo
El De ec o de Un Solo Vis azo (del ingl´es, Single Sho De ec o (SSD)), ue una p opues a
de C. Szegedy que lanz´o en 2016 [LAE+16a] y con la que alcanz´o g andes esul ados en
cuan o a p ecisi´on y endimien o en a eas de de ecci´on se e ie e, alcanzando una p ecisi´on
media del 74 % en conjun os de im´agenes como COCO o PascalVOC.
Se puede e en la Figu a 2.16 que la a qui ec u a de la SSD se componen
p incipalmen e de la CNN conocida po VGG-16. Es o se debe a su g an endimien o
en cuan o a clasi icaci´on de im´agenes de al a calidad se e ie e. A es a CNN le siguen
di e sas capas m´as que se enca gan de ex ae una mayo can idad de ca ac e ´ıs icas en
m´ul iples escalas.
Figu a 2.16: A qui ec u a del Modelo SSD
Debido a es a ´ul ima peculia idad de la ed, se conside a que el SSD pod ´ıa se capaz
de de ec a os os con una mayo e icacia en obje os peque˜nos, a di e encia de YOLO que
no e a capaz.
Cap´ı ulo 3
Es ado del A e
En es e cap´ı ulo se p e ende ilus a como es ´a la si uaci´on ac ual e e en e a la de ecci´on
de os os en im´agenes digi ales y ´ıdeos en unci´on de los abajos le´ıdos.
De cada uno de ellos se desa olla ´a qu´e es lo que quie en consegui , la ´ecnica u ilizada
pa a lle a lo a cabo y los conjun os de da os que u ilizan, pa a pos e io men e e los
esul ados que han ob enido.
En la ac ualidad hay mucha in o maci´on e e en e a la de ecci´on de obje os an o en
im´agenes [LWZ11,PVZ15,DAHG+15] como en ´ıdeos [DAHG+15,MMdRM16,KOLW16,
FLLL16,YRZ+17,LLT17]. Adem´as [LWZ11,PVZ15,YRZ+17] se cen an en la de ecci´on
de os os.
En odos ellos se ap ecia el g an po encial que ienen las edes CNN pa a es e come ido
que adem´as se pueden conca ena con o as como las LSTM [DAHG+15] o las Redes
Neu onales Con olucionales 3D (del ingl´es, 3D Con olu ional Neu al Ne wo ks (C3D))
[FLLL16] pa a ob ene mejo as no o ias en la de ecci´on.
Se ha decidido explica es os a ´ıculos [PVZ15,FLLL16,YRZ+17,LLT17] ya que cada
uno se cen a en una a qui ec u a di e en e en la ed pa a comple a la de ecci´on.
3.1. Red de Ag egaci´on Neu onal pa a el Reconocimien o
Facial en V´ıdeos
En [YRZ+17] se p opone una Red de Ag egaci´on Neu onal (del ingl´es, Neu al Agg ega ion
Ne wo k (NAN)), que puede se en enada median e SL pa a econoce ca as en ´ıdeos o
en conjun os de im´agenes. Los au o es explican que el p oblema de los ´ıdeos es que es
di ´ıcil consegui una ep esen aci´on ace ada del os o debido al cons an e mo imien o
de los obje os y el uido que gene a es os, una ap oximaci´on pa a esol e lo es di idi el
´ıdeo en o og amas y pasa cada uno a edes que ya saben econoce os os pe o es o es
demasiado cos oso.
Es a ed es ´a compues a po dos m´odulos que pueden se en enados po sepa ado. El
p ime o es un ex ac o de ca ac e ´ıs icas a ni el de o og ama que usa un modelo de CNN
p o undo. El o o es un m´odulo de ag egaci´on que usiona los ec o es de ca ac e ´ıs icas de
los o og amas del ´ıdeo. En gene al la ed oma de en ada un conjun o de im´agenes con
ca as y de uel e un ec o con las ca ac e ´ıs icas pa a la a ea de econocimien o acial.
29
30 Cap
´
ı ulo 3. Es ado del A e
Uno de sus obje i os es dise˜na un mejo esquema pa a las ponde aciones pa a
consegui lo p oponen que el m´odulo de ag egaci´on debe se capaz de p ocesa un n´ume o
di e en e de im´agenes, que la ag egaci´on se debe ealiza de o ma independien e al o den
de en ada y que el m´odulo debe adap a se a la en ada y ene pa ´ame os que se puedan
en ena a a ´es del SL. Pa a ello emplean bloques de a enci´on inspi ados en el mecanismo
de a enci´on de la memo ia desc i os en [GWD14,SWF15,VBK15].
Un bloque de a enci´on se enca ga de lee los ec o es de las ca ac e ´ıs icas del p ime
m´odulo y gene a pesos lineales pa a cada uno.
Solo usando un bloque de a enci´on, se obse a como los pesos son ele ados en las
im´agenes con os os de m´as calidad, como las de al a esoluci´on y ondos simples, y es m´as
educido en las im´agenes con la ca a desen ocada, pa cialmen e ocul a o con una exposici´on
inadecuada. Pa a mejo a oda ´ıa m´as el endimien o deciden usa dos bloques de a enci´on
en cascada, de es a o ma se es ablecen los pesos de las im´agenes po cada iden idad pa a
que los pesos no queden in luenciados po las im´agenes de las dem´as iden idades.
El en enamien o se decide ealiza po sepa ado pa a exp imi al m´aximo las
capacidades de cada uno de los m´odulos. Pa a la CNN del ex ac o usan es millones
de im´agenes con os os de cincuen a mil iden idades di e en es. Las ca as son de ec adas
usando el m´e odo de JDA [CRW+14], y alineadas con el m´e odo LBF [RCWS14]. El
modulo de ag egaci´on se en ena sob e las ca ac e ´ıs icas ex a´ıdas con la CNN.
Una ez es a en enadas ambas, se ob iene como esul ado un 95.72 ±0.64 % de
exac i ud pa a el conjun o de im´agenes de YouTube Faces (YF) [WHM11] donde
compa ado con o os modelos como DeepFace-single [TYRW14], DeepID2+ [SWT15] y
Wen e al [WZLQ16] ob iene mejo es esul ados, aunque no supe a el 97.3 % de FaceNe
[SKP15].
En la Tabla 3.1 y en la Tabla 3.2 se pueden e los esul ados con el conjun o de
im´agenes Celeb i y-1000 (CB) [LZLY14], donde compa ado con los m´e odos de MTJSR
[LZLY14] y Eigen-PEP [LHS+14] ob iene unos alo es no ablemen e m´as ele ados an o
en el conjun o ce ado como abie o.
Tabla 3.1: Resul ados de NAN sob e el conjun o de da os de CB con conjun o ce ado
N´
ume o de Suje os
M´
e odo 100 200 500 1000
NAN - VideoAgg 88.04 82.95 82.27 76.24
NAN - Subjec Agg 90.44 83.33 82.27 77.17
Tabla 3.2: Resul ados de NAN sob e el conjun o de da os de CB con conjun o abie o
N´
ume o de Suje os
M´
e odo 100 200 400 800
NAN - Subjec Agg 88.76 85.21 82.74 79.87
El conjun o de im´agenes de YF [WHM11] es ´a dise˜nado pa a la e i icaci´on de os os
en ´ıdeos. Con iene 3425 ´ıdeos con 1595 pe sonas di e en es. La longi ud de los ´ıdeos
a ia en e 48 y 6,070 o og amas con una du aci´on de p omedio de 181,3 o og amas.
3.2. Reconocimien o P o undo de Ros os 31
El conjun o de im´agenes de CB [LZLY14] es ´a dise˜nado pa a la iden i icaci´on de os os
en ´ıdeos, con iene 159.726 secuencias de ´ıdeo de 1.000 pe sonas di e en es. La longi ud
de los ´ıdeos es de 2.4M de o og amas en o al, con 15 o og amas po secuencia. Tiene
dos ipos de p o ocolos, uno de conjun o abie o y o o de conjun o ce ado. Se pueden
encon a los de alles de es os p o ocolos en [LZLY14].
3.2. Reconocimien o P o undo de Ros os
En [PVZ15], los au o es iene dos me as: in es iga cual es la mejo a qui ec u a y CNN
pa a econoce y e i ica ca as; y es ablece un p ocedimien o pa a c ea conjun os de
da os a g an escala.
En cuan o a las a qui ec u as se cen an en DeepFace [TYRW14]. Es e m´e odo
usa una CNN p o unda en enada con 4 millones de im´agenes, Tambi´en u iliza una
a qui ec u a de ed siamesa, donde se aplica la misma CNN a pa es de ca as pa a ob ene
desc ip o es que luego se compa an usando la dis ancia euclidiana. Adem´as, las im´agenes
son p e-p ocesadas. Ese p oceso consis e en “ ecoloca ” las im´agenes, si uando las ca as
en una pose can´onica usando un modelo 3D.
La es a egia que p oponen cons a de a ias e apas pa a ecopila de mane a e ec i a
un g an conjun o de da os aciales que con enga cien os de im´agenes.
Lo p ime o es ob ene una g an lis a de nomb es de los que po encialmen e se pudie an
ob ene in o maci´on, pa a ello se eligen celeb idades, pol´ı icos, e c, en gene al pe sonajes
p´ublicos. La lis a inicial la ob ienen de IMDB con un g an n´ume o de nomb es de
celeb idades. Esos nomb es los c uza on con F eebase knowledge g aph [BEP+08], que es
una base de da os con in o maci´on de much´ısimas celeb idades. T as odo es o ob u ie on
un o al de 5000 nomb es de pe sonas pa a los que se consiguie on 200 im´agenes po
pe sona simplemen e usando el buscado de im´agenes de Google. Pos e io men e ealiza on
un il ado, eliminando las pe sonalidades cuyo conjun o de 200 o os no supe aba el 90 %
de pu eza (llamando pu eza a la he e ogeneidad de las im´agenes del conjun o). Es o edujo
la lis a de candida os a 3250. Po ´ul imo, elimina on las celeb idades que apa ec´ıan en o os
conjun os de da os pa a ene da os nue os con los que en ena a la ed. T as es e il ado,
e mina on con 2622 nomb es de celeb idades.
El segundo paso es ob ene m´as im´agenes de esas pe sonas. Pa a ello busca on los
nomb es en el buscado de im´agenes de Google y en el de Bing, que les p opo ciona on
como esul ado 2000 im´agenes po cada pe sona.
El e ce paso es mejo a la pu eza del nue o conjun o de im´agenes. Pa a ello po
cada celeb idad se en ena una ed SVM lineal usando en desc ip o Fishe Vec o Faces
[SPVZ13,PSVZ14] que es capaz de il a au om´a icamen e las mejo es im´agenes, en las
que las 1000 mejo es pe manecen y el es o de desechan.
El cua o paso es elimina duplicados ya que al usa dos mo o es de b´usqueda puede
habe im´agenes iguales. Tambi´en en es a ase se eliminan las im´agenes que solo se
di e encian po el balance de colo o con ex o supe pues o. Es o lo ealiza on calculando
el desc ip o VLAD [JPD+11,AZ13] pa a cada imagen.
38 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
Conjun o de im´
agenes I: Labeled Faces in he Wild [HMBLM08].
Conjun o de im´
agenes II: Wide Face Da ase [YLLT16].
4.1.1. Conjun o de im´agenes I
LFW [HMBLM08] es un conjun o de im´agenes publico dise˜nado pa a e i ica si una
pa eja de im´agenes pe enecen a la misma iden idad. Es ´a compues o po 13233 im´agenes
de 250x250 de ca as almacenadas en 5749 ca pe as con sus iden idades.
A pesa de que el p op´osi o de es e abajo no e a el de la iden i icaci´on sino el de la
de ecci´on, y aunque el p opio se icio web que o ece acceso al eposi o io de im´agenes no
ecomendaba el uso de es e pa a a eas de de ecci´on po la escasez de a iedad en lo que
a edad de los suje os p esen es en las im´agenes se e ie e, el se decidi´o usa lo debido a,
no solo los buenos esul ados que se pueden obse a en [PVZ15], sino ambi´en al ama˜no
del conjun o, dado que es e hecho daba la opo unidad de ans o ma las im´agenes al
o ma o eque ido po Tenso Flow sin in e i mucho iempo en ello.
El p oceso de adap aci´on del conjun o de im´agenes sigue los siguien es pasos:
1. El p ime paso consis i´o en una in es igaci´on ace ca de c´omo c ea los TFReco ds
que necesi aba Tenso Flow a pa i de un conjun o de im´agenes sin e ique a . T as
la in es igaci´on, se encon ´o un eposi o io con un conjun o de im´agenes e ique adas
que es aba compues o po dos sc ip s en Py hon. El p ime o se enca gaba de con e i
las e ique as de o ma o XML aCSV y el segundo ans o maba de o ma o CSV
aTFReco d. Modi icando es os dos sc ip s y cambiando algunas con igu aciones
pa a adap a lo a lo que se eque ´ıa, el equip´o encon ´o el m´e odo pa a ealiza la
ans o maci´on con im´agenes e ique adas.
2. El siguien e paso que se ealiz´o ue el de e ique ado de las im´agenes. La he amien a
que pe mi i´o ealiza es a a ea y gene a im´agenes e ique adas en o ma o XML
ue labelimg [lab17]. Se decidi´o usa es a he amien a ya que, adem´as de con a con
in e az g ´a ica, su con igu aci´on pe mi ´ıa es ablece una e ique a po de ec o, de
al o ma que al selecciona la egi´on deseada, es a se au o-e ique a a, acele ando el
p oceso. Se ealiz´o un sc ip de Ba ch que cen alizaba las im´agenes en un mismo
di ec o io pa a pos e io men e impo a lo a labelimg y pe mi i as´ı la na egaci´on
en e las im´agenes. Una ez den o de la aplicaci´on, se seleccionaban la o las
ca as que es aban con enidas en cada imagen, se e ique aban con la e ique a po
de ec o mencionada an e io men e y, po ´ul imo, se gua daban, de al o ma que
la aplicaci´on gene aba el a chi o XML con la in o maci´on del e ique ado, necesa ia
pa a su pos e io con e si´on.
3. Po ´ul imo, se aplica on dis in os p ocedimien os pa a ans o ma las im´agenes
e ique adas en el an e io paso al o ma o de TFReco d y pa a sepa a odas im´agenes
en los subconjun os de p uebas y alidaci´on. Pa a ealiza dicha labo , p ime o se
ag upa on odos los a chi os XML gene ados en el an e io paso en los di ec o ios
mencionados an e io men e y se us´o el p ocedimien o comen ado en el p ime paso
pa a gene a los TFReco ds co espondien es.

4.2. C eaci´
on de los Modelos de De ecci´
on 39
4.1.2. Conjun o de im´agenes II
Wide Face [YLLT16] es un conjun o de im´agenes dise˜nado pa a la de ecci´on de os os.
U iliza las im´agenes publicas del conjun o de WIDER [XZLT15] que con ienen os os en
dis in as dis ancias, poses, con pa es apadas o pin adas, con dis in as exp esiones y con
dis in os ni eles de luminosidad.
En o al se ienen 32203 im´agenes con 393703 os os e ique ados, de los cuales un 40 %
son pa a en enamien o (∼12876 im´agenes), un 50 % pa a p uebas (∼16101 im´agenes) y
un 10 % pa a alidaci´on (∼3226 im´agenes).
A la ho a de busca como pasa es e conjun o de im´agenes al eque ido po Tenso low,
se encon ´o en un eposi o io un sc ip pa a ealiza es a a ea sob e es e conjun o en
espec´ı ico [wid20] de mane a au om´a ica. G acias a es o, solo ue necesa io ins ala dicho
eposi o io y ejecu a , pa a ob ene as´ı los TFReco d necesa ios.
4.2. C eaci´on de los Modelos de De ecci´on
Se han c eado dos modelos pa a ealiza la de ecci´on de los os os, una pa a cada inalidad
de uso, explicadas an e io men e.
El p ime modelo ha sido op imizado pa a la de ecci´on de os os en ´ıdeos de mane a
local, es deci , con ´ıdeos con du aci´on limi ada. Se a a, po an o, de una ed m´as
en ocada en la p ecisi´on que en la elocidad de de ecci´on. Se decidi´o dise˜na es a ed pues o
que pa a ealiza la de ecci´on en un ´ıdeo, es necesa io un p ocesamien o p e io comple o
de es e an es de ob ene los esul ados inales, po lo que no es demasiado ele an e, en
es e caso, la elocidad de de ecci´on del modelo po o og ama.
Po o o lado, en es e abajo se ha desa ollado una segunda opci´on op imizada pa a
su uso en ´ıdeos en iempo eal, conocidos como ´ıdeos en s eaming. Dado que pa a el
p ocesamien o de un ´ıdeo en iempo eal es c ucial el iempo en el que se ealiza dicha
de ecci´on, se ha dise˜nado es e modelo con un en oque mucho m´as di ec o en la elocidad de
p ocesamien o de o og amas que la an e io , man eniendo ambi´en un buen endimien o
en cuan o a p ecisi´on se e ie e.
Ambos modelos han demos ado du an e la ase de expe imen aci´on se capaces de
de ec a a ios os os simul ´aneamen e y en dis in as condiciones, ales como os os
a dis in as dis ancias, poses poco comunes, exp esiones a iopin as, condiciones de luz
des a o ables, e incluso os os maquillados y/o apados con dis in os a uendos, como
masca illas.
Pa a cada una de los modelos, se explica ´a de qu´e es ´an o mados, cu´al es el p oceso
que siguen pa a ealiza la de ecci´on y la con igu aci´on que se ha u ilizado pa a pode
consegui el obje i o.
4.2.1. Modelo pa a la De ecci´on en V´ıdeos Rep oducidos Localmen e
Dado que el obje i o con es e modelo es asegu a la e ec i idad en e a la elocidad de
de ecci´on, se ha u ilizado la combinaci´on o mada po un de ec o Fas e R-CNN y el
ex ac o de ca ac e ´ıs icas Incep ion-ResNe .
40 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
La a qui ec u a in e na del p ime modelo desa ollado cons a de es pa es bien
di e enciadas, como se puede e en la Figu a 2.14: La ex acci´on de ca ac e ´ıs icas, la
p opues a de os os y po ´ul imo una capa donde se ag upan esas p opues as y se ealiza
la p edicci´on.
La p ime a hace e e encia a la CNN que se enca ga de la ex acci´on de ca ac e ´ıs icas.
En es e caso se ha usado la ed neu onal llamada Incep ion-ResNe , desa ollada po
Google, cuya es uc u a in e na puede e se en la Figu a 4.1.
Figu a 4.1: A qui ec u a In e na de Incep ion-ResNe
Como se obse a en la Figu a 4.1, se ha p ocedido a mos a su e si´on comple a y
o a m´as comp imida de la a qui ec u a de la ed pa a en ende con m´as acilidad c´omo
es a hecha. Como se puede obse a , la ed es ´a c eada po una g an can idad de capas
simbolizadas con dis in as o mas de colo es, en las que se incluyen capas de con oluci´on
(explicadas con m´as de alle en la Secci´on 2.5.1.1), capas de pooling (Secci´on 2.5.1.2),
capas de ag upaci´on o conca enaci´on, capas de d opou enca gadas de apaga una se ie de
neu onas pa a e i a el sob e ajus e, capas o almen e conec adas, capas esiduales p opias
de la ed ResNe y, po ´ul imo, las unciones de ac i aci´on so max, simila es a las is as
en la Secci´on 2.4.
Todas ellas o man es uc u as que pueden se suscep ibles a epe i se en andas de 10
y 20, como se puede ap ecia en la imagen.
El segundo paso es ealiza la p opues a de egiones que puedan se los os os. En es a
segunda ase, se ecibe las ca ac e ´ıs icas en o ma de mapa ex a´ıdas con la ed an e io
y se p ocesan usando una ed neu onal especial capaz de gene a egiones, como se puede
e en la Figu a 4.2.
Es a ed, adem´as, clasi ica cada egi´on pa a sabe si lo que ha p opues o pe enece al
ondo de la imagen o es una ca a en cues i´on.
4.2. C eaci´
on de los Modelos de De ecci´
on 41
Figu a 4.2: Ejemplo m´as isual de las egiones p opues as
Las p opues as esul an es que no pe enecen al ondo de la imagen, inalmen e se
p opagan a a ´es de una capa de ag upaci´on como las que con iene Incep ion-ResNe
pa a que pos e io men e se clasi iquen cada una de ellas y se ob enga una p obabilidad
que indique cu´an semejan e es la p opues a a un os o.
Po ´ul imo, aquellas p opues as que supe en un cie o umb al, el cual se explica en
la Secci´on 4.3, se ´an conside adas de ecciones y se acaba ´an dibujando los l´ımi es que
ecuad en la ca a en la imagen o o og ama del ´ıdeo en cues i´on.
Una ez conseguido el co ec o uncionamien o del de ec o , pa a pode se usado con
´ıdeos, e a necesa io ene el modelo expo ado de o ma que pudie a admi i im´agenes y
de ol e como esul ado las coo denadas del os o den o de es as.
Pa a p ocesa el ´ıdeo, ´unicamen e hab ´ıa que ealiza un bucle donde se leye a
o og ama a o og ama y, pa a cada uno, se u ilizase es e modelo pa a in e i el luga
donde se encuen an las ca as. Como ya se ha dicho, una ez hecho es o, ´unicamen e se ´ıa
necesa io dibuja los limi es de es a en la ca a e i c eando un ´ıdeo nue o con ello.
4.2.2. Modelo pa a la De ecci´on en V´ıdeos en Tiempo Real
El obje i o que debe cumpli se con es e modelo debe se e o za la elocidad de in e encia
y pasa a un segundo plano la e ec i idad, sin descuida es a en exceso. Es po ello, que
se ha usado una combinaci´on del de ec o Fas e R-CNN con el ex ac o Incep ion
Es e segundo modelo c eado es ´a basado en la CNN Incep ion, desa ollada po Google.
Debido a que su es uc u a y p oceso es simila al explicado en la Secci´on an e io ,
´unicamen e se de alla ´a la a qui ec u a in e na que es a CNN sigue pa a pode ex ae las
ca ac e ´ıs icas. Su es uc u a in e na es simila a la que se mues a en la Figu a 4.3.
Al igual que se pod´ıa obse a en el modelo p opues o pa a la de ecci´on en ´ıdeos,
Incep ion ambi´en dispone de una amplia a iedad de capas, las mismas que se pod´ıan
encon a en la Secci´on an e io . La di e encia en e es as dos edes eside en que la p ime a
con iene una se ie de capas esiduales pe enecien es a ResNe y la p o undidad de la ed
es conside ablemen e mayo , mien as que Incep ion no cuen a con es as ca ac e ´ıs icas.
42 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
Figu a 4.3: A qui ec u a In e na de Incep ion
Es a ´ul ima ca ac e ´ıs ica es la que hace que sea la ap opiada pa a usa se en en o nos
donde la elocidad del p ocesamien o es cla e. Al no habe an as capas, la can idad de
neu onas po capa disminuye y, en consecuencia, el n´ume o de c´alculos ma em´a icos se e
educido conside ablemen e.
El p oceso de la de ecci´on en iempo eal se ealiza de la misma o ma que en ´ıdeos.
Pa a ello, es necesa io u iliza las lib e ´ıas Pa y yS eamlink pa a pode ob ene los
o og amas de la uen e en iempo eal. La di e encia espec o a la de ecci´on en ´ıdeo local
eside en mos a la salida po pan alla o edi igi la salida a un canal donde se equie a
isualiza los esul ados a medida que es os se gene an, en luga de c ea un ´ıdeo pa a
se obse ado con pos e io idad.
4.2.3. Con igu aci´on de los Modelos
Pa a pode ejecu a los modelos en cues i´on, Tenso Flow o ece una se ie de iche os que
deben se con igu ados de o ma que en es e se incluya el ipo de de ec o deseado, el
ex ac o de ca ac e ´ıs icas, la con igu aci´on del en enamien o y alidaci´on, y oda una
se ie de pa ´ame os asociados a cada cada uno de es os campos pa a op imiza la de ecci´on.
Todas es as opciones de con igu aci´on hacen e e encia en ealidad a unciones, clases y
pa ´ame os pe enecien es a Tenso Flow que, en ul ima ins ancia, son los que inalmen e
se ´an ejecu ados. En gene al, la es uc u a que debe segui es e iche o, iene que segui
unas pau as igu osas di e enciando de es a o ma en e cinco pa es que an a pe mi i
ealiza la con igu aci´on. Es as pa es son las siguien es:
Model: De ine el ipo de modelo que a a se u ilizado, es deci : el de ec o , la CNN
y los pa ´ame os que de inen a la a qui ec u a en gene al.
T ain Con ig: En ´el se indican los pa ´ame os que deben usa se pa a ealiza el
en enamien o, como puede se un p ep ocesamien o en la en ada a la ed o los
alo es de inicializaci´on de la CNN.
T ain Inpu Reade : U ilizado pa a indica los da os de en enamien o en o ma o
TFReco d.
4.2. C eaci´
on de los Modelos de De ecci´
on 43
E al Con ig: Pe mi e ajus a las m´e icas que an a se moni o izadas du an e el
en enamien o.
E al Inpu Reade : Se de inen el conjun o de da os de alidaci´on a usa . Debe se
dis in o al de en enamien o.
Los aspec os m´as ele an es pa a la c eaci´on del modelo son: Con igu aci´on del
de ec o , Con igu aci´on del en enamien o y Con igu aci´on de la e aluaci´on.
Dado que los modelos p opues os en es e cap´ı ulo se basan ambos en el de ec o Fas e
R-CNN y ienen pa e de la con igu aci´on en com´un, se explica ´an los aspec os m´as
ele an es que se han enido en cuen a du an e la con igu aci´on de es os, y se de alla ´an
las pa icula idades que ienen cada uno de ellos.
4.2.3.1. Con igu aci´
on del De ec o
El p ime paso pa a la con igu aci´on del modelo es la decla aci´on del de ec o a usa , en
es e caso se a a de Fas e R-CNN. A con inuaci´on se de ine el n´ume o de obje os que se
an a de ec a en el campo num classes, que en es e caso el alo debe se 1 ya que solo
se an a de ec a os os.
A con inuaci´on, se con igu an los es componen es del de ec o . ( e Secciones 2.7.1.3
y4.2.1).
1. ea u e ex ac o : Hace e e encia a la CNN que se u iliza ´a. En e o os campos
que apa ecen en es a es uc u a, se encuen a el campo ype que iden i ica el ipo
de ed (Incep ion-ResNe , pa a el caso de ´ıdeos en local, o Incep ion en el caso de
s eaming). El alo depende del modelo que se quie a c ea .
2. i s s age: Es la e apa en la que se ealizan p opues as sob e las ca ac e ´ıs icas
que en´ıa como salida la CNN. Es a e apa queda e e enciada po los
pa ´ame os que comienzan po i s s age. En es a e apa se con igu an
los 3 pa ´ame os: i s s age nms sco e h eshold, i s s age nms iou h eshold y
i s s age max p oposals. Los dos p ime os u ilizan sup esi´on no m´axima (del ingl´es,
Non-maximum Supp ession) pa a e i a muchas p opues as sob e un mismo os o.
i s s age nms sco e h eshold: Se u iliza pa a il a las p opues as que
se hacen en es a e apa. Al es ablece se en 0.0 se indica que odas las
p opues as que se hagan an a se ´alidas, ya que no an a ene que
supe a ning´un umb al de con ianza. De la misma o ma se iene el pa ´ame o
i s s age nms iou h eshold, que al ajus a se en 0.69, se conside a ´a dos
p opues as simila es cuando es ´en sob e es e umb al de In e secci´on sob e Uni´on
(del ingl´es, In e sec ion o e Union (IOU)), qued´andose con la que enga una
pun uaci´on mayo y eliminando la o a. En la Secci´on 4.3 se explican m´as
ampliamen e los umb ales que es ´an in oluc ados en es os pa ´ame os.
i s s age max p oposals: Po con enci´on iene los alo es que apa ecen en
el c´odigo: 300 y 100, pa a Incep ion-ResNe eIncep ion espec i amen e. Es e
es uno de los mo i os que hace que Incep ion-ResNe sea m´as p ecisa y len a a
la ho a de in e i y se en enada. Al ealiza un mayo n´ume o de p opues as
sob e una imagen, su endimien o puede aumen a pe o el iempo pa a ealiza
la de ecci´on ambi´en aumen a ´a.

44 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
3. second s age: Se enca ga de ecibi las p opues as que gene a la p ime a e apa y
clasi ica las pa a gene a un esul ado inalmen e. Al igual que en la p ime a e apa, se
es ablece una pun uaci´on (sco e h eshold) y un alo de IOU (iou h eshold) po los
cuales las p opues as se ´an conside adas de ecciones. Tambi´en se es ablece el n´ume o
m´aximo de de ecciones po clase que se an a ealiza (max de ec ions pe class), el
cual coincide con el n´ume o o al de de ecciones (max o al de ec ions) al habe
una sola clase. Pa a inaliza , se modi ic´o sco e con e e poniendo la unci´on
de ac i aci´on Sigmoide (Secci´on 2.4), ya que unciona mejo que So max pa a
p oblemas donde solo hay que clasi ica un elemen o.
El C´odigo 4.1 mues a la con igu aci´on ealizada.
Con igu aci´
on 4.1: Con igu aci´on enida en cuen a en Model
1 model {
2 a s e c n n {
3 num classes :1
4
5 e a u e e x a c o {
6 ype :” as e cnn incep ion esne 2” |” as e cnn incep ion 2”
7}
8
9 i s s age nms sco e h eshold :0.0
10 i s s age nms iou h eshold :0.69
11 i s s age max p oposals :300 |100
12
13 s e c o n d s a g e p o s p o c e s s i n g {
14 ba ch non max supp ession {
15 sco e h eshold :0.30
16 iou h eshold :0.60
17 m a x d e e c i o n s p e c l a s s :100
18 max o al de ec ions :100
19 }
20 sco e con e e :SIGMOID
21 }
22 }
23 }
4.2.3.2. Con igu aci´
on del En enamien o
Como se ha explicado p e iamen e, el en enamien o necesi a se con igu ado ambi´en y,
conc e amen e, cons a de dos pa es: ain con ig y ain inpu eade , como se puede e
en el C´odigo 4.2.
Den o de ain con ig, se encuen an los siguien es pa ´ame os:
1. ba ch size: Indica el ama˜no de los paque es de da os que i ´a u ilizando el algo i mo
pa a en ena al de ec o . En es e caso, se ha es ablecido en 1, lo cual signi ica que
i ´a p opagando las im´agenes sob e las edes de una en una.
2. da a augmen a ion op ions: Hace e e encia a la ´ecnica aplicada en DL que
pe mi e aumen a sus ancialmen e el conjun o de en enamien o median e la
modi icaci´on de las im´agenes que ya es ´an con enidas en ´el. En conc e o, se ha
u ilizado andom ho izon al lip que ealiza un gi o ho izon al y alea o io sob e las
im´agenes, pe o se pod ´ıa habe ealizado cualquie o a modi icaci´on.
4.2. C eaci´
on de los Modelos de De ecci´
on 45
Con igu aci´
on 4.2: Con igu aci´on enida en cuen a pa a el en enamien o
25 ain con ig {
26 ba ch size :1
27
28 da a augmen a ion op ions {
29 andom ho izon al lip {
30 }
31 }
32
33 num s eps :200000
34
35 om de ec ion checkpoin : ue
36 ine une checkpoin :” u a al modelo ya e n enado ”
37 }
38
39
40 ain inpu eade {
41 label map pa h :” u a a las e ique as del da ase ”
42
43 e c o d i n p u e a d e {
44 inpu pa h :” u a al eco d de en enamien o”
45 }
46 }
3. num s eps: Pe mi e ajus a el n´ume o de pasos de ejecuci´on pa a el en enamien o.
Tenso Flow asegu a que con 200000 se puede encon a un buen ajus e del modelo
y se es ableci´o de esa o ma.
4. om de ec ion checkpoin y ine une checkpoin : Quiz´as sean de los m´as
impo an es que hay en el iche o, ya que son los que o ecen la opci´on de pode
ealiza la ´ecnica de TL. Pa a abo da es a ´ecnica, los ex ac o es de ca ac e ´ıs icas
que se han u ilizado en el p esen e p oyec o han sido en enados p e iamen e con una
se ie de im´agenes que aba can casi cualquie ipo de obje o. Es o quie e deci que
las edes es ´an p epa adas pa a clasi ica co ec amen e en e los dis in os obje os
con los que ha sido en enado y, sin emba go, no son capaces de clasi ica un
os o cuando se quie a u iliza la CNN pa a es e come ido. Es po ello que es
es ic amen e necesa io capaci a a la ed pa a pode ealiza es a a ea. Median e
es os pa ´ame os, Tenso Flow o ece la posibilidad de indica la u a donde se
encuen a el modelo que ya ha sido en enado y cuyo ap endizaje se equie e eu iliza
pa a p opo ciona un mejo endimien o al nue o modelo que se es ´e c eando.
In e namen e, Tenso Flow ealiza la ´ecnica de Fine-Tune, explicada en la Secci´on
2.2.3.
Po ´ul imo, den o del campo ain inpu eade , se encuen an los siguien es
pa ´ame os:
1. label map pa h: Hace e e encia a la u a de un iche o que con iene odas las
e ique as que se u iliza ´an en la de ecci´on. Pa a pode ealiza TL, se ha modi icado
es e a chi o a˜nadiendo una e ique a (Face) pa a los os os, y eliminando cualquie
o a e ique a que pudie a encon a se en el modelo p een enado.
2. inpu pa h: En ´el se debe indica la u a a los TFReco d del conjun o de da os que
eque idos pa a en ena el modelo.
46 Cap
´
ı ulo 4. T´
ecnica de De ecci´
on de Ros os en V
´
ıdeos
Con es os ´ul imos cua o pa ´ame os se es a ´ıa implemen ando la ´ecnica de TL. Al
es ablece : una sola e ique a posible (Face), un conjun o de da os de un solo ipo, el
pa ´ame o num classes del modelo a 1, y pe mi i a la CNN adqui i el ap endizaje de o o
en enamien o p e io; lo que ocu e es que el de ec o uel e a ealiza el en enamien o
con la mayo ´ıa de las capas de la ed ya ajus adas, pe o es a ez se ue za a Tenso Flow a
que modi ique in e namen e la ed de al o ma que, aho a, solo a a se capaz de de ec a
os os.
Po esa az´on, aunque se u ilice el ajus e de las capas que se consigui´o du an e el
ap endizaje de o os obje os, el nue o de ec o solo de ec a ca as. Es a ´ecnica pe mi e
pode en ena de una o ma m´as ´apida y e icien e, pues o que en las capas iniciales de la
ed siemp e se ap enden una se ie de ca ac e ´ıs icas que son comunes a odos los obje os.
4.2.3.3. Con igu aci´
on de la E aluaci´
on
La con igu aci´on m´as ele an e en el p oceso de e aluaci´on. En el agmen o de C´odigo 4.3,
se obse a que en el campo e al con ig se ha es ablecido el n´ume o de da os de alidaci´on a
3226 en el pa ´ame o num examples, que en es e caso es el n´ume o de im´agenes des inadas
a la alidaci´on del conjun o de im´agenes Wide Face. Adem´as, al igual que ocu ´ıa en el
caso del en enamien o, hay que indica la u a de las e ique as que se an a usa pa a
la de ecci´on (label map pa h) y la u a al conjun o de da os que u iliza ´a pa a ealiza la
e aluaci´on (inpu pa h)
Con igu aci´
on 4.3: Con igu aci´on enida en cuen a pa a la alidaci´on
48 e al con ig {
49 num examples :3226
50 }
51
52
53 e al inpu eade {
54 label map pa h :” u a a las e ique as del da ase ”
55
56 e c o d i n p u e a d e {
57 inpu pa h :” u a al eco d de alidacion”
58 }
59 }
4.3. M´e icas de E aluaci´on en la De ecci´on Facial
En el campo del ML se uel e necesa io el hecho de pode medi cu´al es el endimien o de
los modelos en enados, pa a pode compa a los en e s´ı de una mane a obje i a y conoce
cu´al de ellos es el que mejo se puede ajus a .
M´as conc e amen e, en la ama de la de ecci´on acial, el conjun o de m´e icas que
se suelen u iliza se basan en las conocidas compe iciones de PASCAL VOC [pas20],
COCO [LMB+20] y Open Images [ope20b], que de inen una se ie de pau as pa a e alua
el algo i mo p opues o con los espec i os conjun os de da os de alidaci´on.
4.3. M´
e icas de E aluaci´
on en la De ecci´
on Facial 47
Es as compe iciones ienen algo en com´un, y es que odas ienen la p ecisi´on media
como medida p incipal. Sin emba go, pa a la e aluaci´on del endimien o de los modelos
c eados en es e p oyec o, se ha escogido el conjun o de m´e icas de inidos po COCO,
debido a que es el que mayo n´ume o de m´e icas o ece, dando incluso la opo unidad de
pode ob ene el endimien o basado en la lejan´ıa del os o en una imagen.
A con inuaci´on, se desc iben dichas m´e icas y se adicionan o as que no pe enecen a
COCO y que se han u ilizado debido a su g an impo ancia en p oblemas de ML.
4.3.1. Conjun o de M´e icas Usadas
An es de explica las m´e icas se u ilizan en COCO, es necesa io conoce el ma co en el
que se basan y de qu´e se enca gan cada una.
In e secci´
on sob e Uni´
on: Como se ha comen ado p e iamen e, en la de ecci´on
acial, no solo hay que p eocupa se de e alua la p obabilidad de que un os o en
conc e o apa ezca en la imagen, sino que ambi´en se debe se capaz de localiza la.
Es o supone un p oblema, ya que las m´e icas comunes u ilizadas sob e modelos
de clasi icaci´on deben se ex endidos. Aqu´ı es donde en a en acci´on la IOU. La
IOU es una mane a de cuan i ica la simili ud que exis e en e el cuad o delimi ado
p edicho po el modelo y el o iginal que a asociado con los da os de en ada. Su
umb al puede a ia de 0 a 1, siendo m´as al o cuan o m´as supe pues os es ´en en e
los dos. Se puede e un ejemplo en la Figu a 4.4.
Figu a 4.4: Ejemplo de la In e secci´on sob e Uni´on
Pun uaci´
on de Con ianza: Se e ie e a la p obabilidad con la que se clasi ica
una cie a imagen y ep esen a el po cen aje de segu idad po el que una clase
de e minada ha sido de ec ada.
Umb al de Con ianza: Es el po cen aje que indica a pa i de qu´e alo de
Pun uaci´on de Con ianza se a a conside a una p edicci´on como una de ecci´on. Si
se es ablece, po ejemplo, un umb al del 30 %, odas las p edicciones que no supe en
esa pun uaci´on, no se ´an conside adas una de ecci´on.
Tipos de P edicciones: Las p edicciones se pueden clasi ica en los siguien es
pun os:

Cap´ı ulo 5
Expe imen os y Resul ados
En es e cap´ı ulo se desc iben los expe imen os que se han ealizado y se e alua ´a el
endimien o y e icacia de cada uno de ellos, ob eniendo inalmen e unos esul ados de
los que se pod ´an ob ene pos e io men e conclusiones. Pa a ello, se explica ´a p ime o
el con ex o sob e cual se ha ealizado la expe imen aci´on y, pos e io men e, se ha ´a
una peque˜na in oducci´on a los expe imen os ealizados pa a pasa luego a explica los
de alladamen e cada uno de ellos. Se e mina ´a con una secci´on donde se compa en los
mejo es expe imen os ealizados y se de e mine cu´ales son los m´as ap opiados pa a el
abajo.
5.1. Con ex o de la Expe imen aci´on
Pa a lle a a cabo la expe imen aci´on, se han escogido los dos mejo es de ec o es que
exis en ac ualmen e y que m´as ga an ´ıas han dado en abajos p e ios: SSD yFas e
R-CNN. Pa a cada uno de ellos, se han u ilizado di e en es ex ac o es de ca ac e ´ıs icas
p een enados con el conjun o de da os de COCO pa a comp oba cu´ales de ellos consegu´ıa
ex ae mejo la in o maci´on de nues o conjun o de da os escogido. A su ez, se ha aplicado
la ´ecnica de TL de mane a que el modelo sea capaz de de ec a os os ambi´en. El
conjun o de da os elegido pa a es a expe imen aci´on ha sido Wide Face, pues o que en´ıa
o os de mayo a iedad, en dis in as si uaciones y en mayo can idad.
Pa a cada modelo que se ha c eado, se ha ejecu ado las eces necesa ias has a que se ha
ob enido la in o maci´on ap opiada y se han podido gene a odos los checkpoin s necesa ios
pa a c ea el modelo pos e io men e en un pun o que se encon a a en un ajus e pe ec o,
es deci , que no hubie a O e i ing ni Unde i ing. Adem´as, pa a pode e alua los en
igualdad de condiciones, se ha dejado po de ec o la con igu aci´on m´as impo an e de
las edes, eniendo po delan e cada uno de ellos 200000 pasos de ejecuci´on: la can idad
ecomendada po Tenso Flow pa a los modelos seleccionados.
En cuan o a la ase de e aluaci´on hay que des aca que, po de ec o, es aba es ablecido
que se ealiza ´an pe i´odicamen e e aluaciones sob e los ´ul imos 10 checkpoin s gene ados,
de mane a que du an e el en enamien o se han ido ob eniendo unos esul ados basados
no solo en el pun o ac ual, sino en los an e io es ambi´en. La en aja de es o eside en que
se puede ob ene una isi´on m´as globalizada del endimien o del modelo. No obs an e, se
ha ealizado una e aluaci´on comple a inal sob e el pun o de in lexi´on del modelo, es deci ,
donde es e ac ´ua con mayo endimien o.
55
56 Cap
´
ı ulo 5. Expe imen os y Resul ados
Es a ´ul ima e aluaci´on se ha ealizado de la misma mane a en la que es ´a especi icado
en las m´e icas de COCO. Se ha es ablecido un umb al de con ianza de 0.3 y se ha hecho
la media a i m´e ica sob e 10 umb ales de IOU, penalizando as´ı al modelo cuando ealice
una mala localizaci´on de la ca a en cues i´on.
Se han analizado los esul ados no solo en ´ıdeos, sino ambi´en con webcam y en
pla a o mas de s eaming. Las pla a o mas escogidas han sido las que mayo uso ienen
ac ualmen e, es deci , YouTube yTwi ch. Pa a cada una de es as opciones se mos a ´a
el iempo de in e encia y los o og amas po segundo (del ingles FPS) esul an es. En el
caso de la webcam y las pla a o mas de s eaming, el iempo de lec u a del o og ama
puede a ia seg´un di e en es ac o es, como pod ´ıa se la conexi´on a in e ne y/o el
p ocesamien o que ealicen las lib e ´ıas u ilizadas pa a la ob enci´on de es e. Debido a
es o, los FPS en es os casos puede e se a ec ado.
Po ´ul imo, odas las p uebas se han hecho en dos equipos dis in os. Los p ime os
en enamien os se ealiza on en un equipo p opio, el cual ealizaba es os de una mane a
muy len a y no iba a pe mi i pode hace una g an can idad de expe imen os con ´el.
Debido a ello, se busca on o as al e na i as. Finalmen e se decidi´o usa Google Cloud
pa a pode c ea una ins ancia mejo y ealiza odos los en enamien os en ella.
El p ime en o no de expe imen aci´on u ilizado se pod ´ıa esumi con las ca ac e ´ıs icas
desc i as en la Tabla 5.1.
Tabla 5.1: P ime en o no de expe imen aci´on
CPU Memo ia RAM Ta je a G ´
a ica
In el Co e i5-7600K CPU 3.8GHz 8 GB MSI GeFo ce GTX 1060 x 6 GB
El segundo equipo u ilizado basado en compu aci´on en la nube posee las ca ac e ´ıs icas
que se mues an en la Tabla 5.2.
Tabla 5.2: Segundo en o no de expe imen aci´on
CPU Memo ia RAM Ta je a G ´
a ica
P ocesado de In el de 16 n´ucleos 60 GB NVIDIA Tesla P100 x 16 GB
5.2. Expe imen os
Los ex ac o es de ca ac e ´ıs icas seleccionados son los siguien es: MobileNe V1,
Incep ionV2,ResNe 50 yIncep ion-ResNe V2. Cada uno de ellos cuen a con unas
ca ac e ´ıs icas y complejidad di e en e. Se ha decidido desca a o as CNN, pues o que
su complejidad e a demasiado g ande y pod ´ıa a ec a an o al iempo de en enamien o,
como a su endimien o, ya que se pod ´ıan O e i ea muy ´acilmen e.
MobileNe se ca ac e iza po se la CNN m´as simple con 4 millones de pa ´ame os
con igu ables y una p o undidad de 88, lo cual simboliza el n´ume o de il os o
ca ac e ´ıs icas que se an a ex ae de cada imagen.
Incep ion cuen a con 23 millones de pa ´ame os y una p o undidad mucho mayo que
MobileNe , siendo es a de 159 il os. De la misma o ma, ResNe iene una complejidad
simila eniendo la can idad de 25 millones de pa ´ame os con igu ables.
5.2. Expe imen os 57
Po ´ul imo, Incep ion-ResNe es la ed m´as elabo ada. Tiene 55 millones de pa ´ame os
y la can idad de 572 il os pa a ex ae di e en es ca ac e ´ıs icas de las im´agenes.
La expe imen aci´on comienza con dos ases di e enciadas donde se p ueba con los dos
de ec o es mencionados p e iamen e. Pa a cada uno de ellos, se han aplicado de mane a
com´un las CNN Incep ion yResNe .
Adem´as, en pa icula , se ha aplicado MobileNe al de ec o SSD, ya que al se la ed
m´as simple pod ´ıa po encia a´un m´as la elocidad de in e encia que os en an los de ec o es
de una e apa y, po o o lado, se ha aplicado Incep ion-ResNe aFas e R-CNN pa a
po encia el endimien o de los de ec o es de dos e apas con un ex ac o m´as complejo.
5.2.1. Fase 1: Expe imen os Realizados con el De ec o SSD
Se ealiz´o una p ime a ase donde se p ob´o con el De ec o SSD. En ´el se u iliza on
p incipalmen e 3 ex ac o es de ca ac e ´ıs icas di e en es, en e los que se encuen an:
MobileNe ,Incep ion yResNe .
5.2.1.1. MobileNe
El p ime modelo que se ha p obado, se bas´o en MobileNe . Con es a se hicie on odas
las p uebas necesa ias pa a en ende como uncionaba la de ecci´on con Tenso Flow y se
en en´o el modelo an as eces has a que se consigui´o en ende como consegui oda la
in o maci´on necesa ia pa a un an´alisis pos e io .
Es e modelo ue el de onan e pa a pensa o as al e na i as m´as po en es pa a pode
ealiza las p uebas, debido a que se en en´o en el o denado en local y a d´o 5 d´ıas
en e ec ua 200000 pasos de ejecuci´on. Esa p ueba que se hizo, no gene ´o odos los
checkpoin s necesa ios pa a pode c ea luego un modelo del cual se pueda in e i sob e
nue as im´agenes, po lo que qued´o desechada.
Mien as se buscaba la soluci´on al p oblema de los checkpoin s y se es aba comenzando
a hace la ins alaci´on necesa ia en una m´aquina disponible en la nube, se sigui´o haciendo
p uebas con es e modelo in en ando pa a el en enamien o cuando se comenza a a e
O e i ing en ´el.
Finalmen e, se pudo comple a el en enamien o en 40 ho as en la m´aquina local y se
gene ´o el modelo que se e en la Figu a 5.1.
Figu a 5.1: Cu as de ap endizaje de SSD con MobileNe
58 Cap
´
ı ulo 5. Expe imen os y Resul ados
Como se puede e en la g ´a ica, se e ec ua on 70000 pasos de ejecuci´on y se ap ecia
que no se consigue un buen ajus e en e las dos cu as gene adas.
Si se sigue la ayec o ia de es as dos cu as, se e que ambas ienen un cos e bas an e
al o pe o con in´uan disminuyendo has a los 43200 pasos de ejecuci´on ap oximadamen e.
En ese pun o, el cos e de alidaci´on comienza a ascende , mien as que el de en enamien o
sigue bajando, po lo que se pod ´ıa de e mina que a pa i de ese pun o comienza a habe
un sob eajus e.
En ese ins an e del en enamien o, se ha gene ado el modelo y se han ob enido los
siguien es esul ados:
En la Tabla 5.3, se obse a la p ecisi´on media ob enida du an e el en enamien o, jun o
con la p ecisi´on media sob e los umb ales IOU de 0.5 y 0.75. Como se puede e , no es
una media muy buena y, como es ob io, empeo a bas an e cuan o mayo es el umb al de
la localizaci´on.
Tabla 5.3: P ecisi´on media usando SSD con MobileNe
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
30.35 63.92 23.22
La Tabla 5.4, ep esen a los esul ados que se ob ienen en cuan o a p ecisi´on se e ie e
dependiendo de la dis ancia a la que se encuen e la ca a en la imagen. Pa a ca as que se
encuen a muy alejadas, la p ecisi´on es bas an e mala, con solo un 5.94 %. Sin emba go,
seg´un an haci´endose m´as g ande, la p ecisi´on aumen a has a un 53.11 % en su mayo
ama˜no.
Tabla 5.4: P ecisi´on media en dis in as dis ancias usando SSD con MobileNe
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
5.94 26.32 53.11
En cuan o a la exhaus i idad, se ap ecia que ealizando una sola de ecci´on, se ob iene
un esul ado bas an e malo ambi´en con un 13.36 %. Es e po cen aje aumen a seg´un se
inc emen a el n´ume o de de ecciones ealizadas. Es o se puede e en la Tabla 5.5.
Tabla 5.5: Exhaus i idad media usando SSD con MobileNe
AR@1 ( %) AR@10 ( %) AR@100 ( %)
13.36 32.82 35.76
Es os esul ados mejo an cuando las ca as que se es ´an de ec ando es ´an bas an e
ce ca en la imagen, a ´andose as´ı un 58.47 % en es e caso. Al igual que con la p ecisi´on,
en os os lejanos, es bas an e malo el esul ado y, con ca as a dis ancia media, se man iene
de o ma pa ecida que en AR@100. Se mues a es o en la Tabla 5.6.
Tabla 5.6: Exhaus i idad media en dis in as dis ancias usando SSD con MobileNe
AR Small ( %) AR Medium ( %) AR La ge ( %)
8.67 32.54 58.47
5.2. Expe imen os 59
Es de debida impo ancia des aca y ecalca que los esul ados que se acaban de
menciona con las dis in as ablas, es ´an basados no solo en el pun o de los 43.200 pasos
de ejecuci´on, sino ambi´en en los 10 checkpoin s an e io es a ´el. En es e caso, es a ´ıan
incluidos odos los checkpoin s desde el paso de ejecuci´on 0. Al habe an a di e encia de
endimien o, los esul ados se en empeo ados. Debido a ello, se a a calcula an o la
p ecisi´on, como la exhaus i idad y a ealiza un ecuen o de los ipos de p edicciones que
se han ealizado ´unicamen e en el pun o de mayo endimien o.
Como se mues a en la Tabla 5.7, se han pues o los esul ados seg´un el umb al de IOU,
como es ipulan las m´e icas de COCO.
Tabla 5.7: Resul ados m´as espec´ı icos usando SSD con MobileNe
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 94.52 64.44 7573 4178 439 0 62.12
@.55 IOU 94.48 64.40 7568 4183 442 0 62.06
@.60 IOU 94.41 64.31 7558 4193 447 0 61.96
@.65 IOU 94.41 64.28 7554 4197 447 0 61.92
@.70 IOU 94.26 64.16 7540 4211 459 0 61.75
@.75 IOU 94.24 64.13 7536 4215 460 0 61.71
@.80 IOU 94.04 63.95 7515 4236 476 0 61.46
@.85 IOU 93.72 63.65 7480 4271 501 0 61.05
@.90 IOU 93.33 63.18 7425 4326 530 0 60.45
@.95 IOU 89.55 58.64 6891 4860 804 0 54.88
Media 93.69 63.51 7464 4287 500 0 60.92
Se puede e que la p ecisi´on mejo a bas an e en compa aci´on con el endimien o
an e io , siendo es e de un 93.69 %. Es o signi ica que casi el 94 % de las eces, los obje os
de ec ados coinciden con los o iginales. Sin emba go, la exhaus i idad es bas an e peo
siendo de un 63.51 %. Es o e leja que el modelo no es capaz de de ec a muchas ca as y,
en consecuencia, el n´ume o de alsos nega i os es bas an e g ande.
Todo es o da una exac i ud de casi un 61 %, signi icando que el 61 % de las eces, una
ca a a a se co ec amen e de ec ada.
Se an a conside a aho a a explica los esul ados que se han ob enido u ilizando es e
modelo pa a in e i no solo en ´ıdeos, sino ambi´en en s eaming en Twi ch yYouTube y
con una Webcam.
Como se puede e en la Tabla 5.8, esul a se un modelo bas an e ´apido en cuan o
a iempo de in e encia se e ie e, siendo el iempo de de ecci´on casi ins an ´aneo: 0.013
segundos. Pa a el n´ume o de 3398 o og amas, es capaz de p ocesa los con un a io de 33
FPS en ´ıdeos y 18 en webcam. Es una can idad bas an e al a pa a ambos y le hace un
buen candida o pa a usa en o ma o s eaming.
En de ini i a, usando MobileNe como ex ac o de ca ac e ´ıs icas p opo ciona ´ıa un
modelo ´apido a la ho a de de ec a sob e los o og amas de un ´ıdeo, no obs an e, peca ´ıa
de no ene una g an exac i ud. P incipalmen e es o se debe a que con iene muchos alsos
nega i os, que hace que muchos os os no sean de ec ados. En la Figu a 5.2 se pueden
mos a algunos ejemplos de de ecciones ealizados con es e modelo.

60 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.8: Resul ados usando el modelo SSD con MobileNe en ´ıdeos y s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.013 segundos 33
Webcam 3398 0.013 segundos 18
YouTube 3398 0.013 segundos 5
Twi ch 3398 0.013 segundos 8
Figu a 5.2: Ejemplos de de ecci´on usando SSD con MobileNe
En las im´agenes se pueden ap ecia como ac ´ua con un g upo de pe sonas a co a,
media y la ga dis ancia, as´ı como con pe sonas de o igen asi´a ico.
5.2.1.2. Incep ion
El segundo modelo que se ha c eado, se bas´o en la CNN Incep ion. Es a inalmen e se
ejecu ´o en la ins ancia que c eada en la nube y se pudo pe cibi los p ime os a isbos
de la g an decisi´on que se hab´ıa omado al busca o a al e na i a pa a ealiza los
en enamien os. El iempo de ejecuci´on ue ´unicamen e de 22 ho as, en compa aci´on con
las 111 ho as que hubiese a dado ap oximadamen e en ejecu a se en nues o o denado
en local.
En es e pun o ambi´en se hab´ıa en endido po comple o como gene a odos los a chi os
ycheckpoin s necesa ios pa a pode c ea un modelo m´as a de pa a se analizado. Debido
a es o, se pas´o a en ena el modelo y se consigui´o la cu a de ap endizaje que se ap ecia
en la Figu a 5.3.
Como se puede e en ella, es a ez se dej´o m´as iempo en enando, llegando a los
200000 pasos de ejecuci´on. Pa a pode analiza de mane a adecuada es a cu a, se ha ´a
po pa es.
5.2. Expe imen os 61
Figu a 5.3: Cu as de ap endizaje de SSD con Incep ion
En p ime luga , se e que an o el cos e de en enamien o como de alidaci´on
comienzan desde un pun o m´as bajo que MobileNe , lo que pod ´ıa se una se˜nal de que es
un mejo modelo. Al comienzo y has a los 10000 pasos de ejecuci´on ap oximadamen e, el
cos e de alidaci´on es meno que el de en enamien o, lo cual signi ica que en ese ins an e
el conjun o de alidaci´on e a mucho m´as ´acil de p edeci que el de en enamien o.
Sin emba go, cuando se pasa es a ba e a, el cos e de en enamien o comienza a
descende m´as ´apidamen e que el de alidaci´on, llegando has a los 42000 pasos de
ejecuci´on, donde los dos es ´an en el pun o m´as bajo en com´un.
A pa i de aqu´ı, el cos e de alidaci´on comienza de nue o a ascende y el de
en enamien o con inua bajando, po lo que se puede conside a el pun o de sob eajus e
del modelo. Es e es el paso de ejecuci´on elegido pa a gene a el modelo.
Al igual que pas´o con MobileNe , los esul ados que se an a mos a a con inuaci´on
es ´an basados no solo en el ins an e escogido, sino ambi´en en los 10 checkpoin s an e io es.
En es e caso, se es a ´ıan eniendo en cuen a los esul ados ob enidos desde el p incipio
ambi´en, po lo que el endimien o en el pun o 42000 debe se mejo .
Como se e en la Tabla 5.9, se ob iene una p ecisi´on media de 35.31 % que es simila
a la ob enida con un umb al de 0.75 IOU y casi la mi ad eniendo un 0.5 de IOU. Pese a
no se p ecisiones muy buenas ampoco, se obse a que son mejo es que las ob enidas con
el modelo an e io .
Tabla 5.9: P ecisi´on media usando SSD con Incep ion
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
35.31 67.12 33.03
Si se p es a a enci´on con m´as de alle en la p ecisi´on ob enida seg´un la dis ancia a la
que es ´e el os o 5.10, se e ´a que la de ecci´on sigue siendo bas an e mala pa a las ca as
que se encuen an alejadas. Lo mismo ocu e pa a os os a media y la ga dis ancia, siendo
es e ´ul imo donde mejo p ecisi´on se ob iene. No obs an e, los es esul ados uel en a
se mejo que usando MobileNe .
62 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.10: P ecisi´on media a dis in as dis ancias usando SSD con Incep ion
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
7.73 31.78 58.27
Se pasa aho a a analiza la exhaus i idad. Como se puede e en la Tabla 5.11, es a
uel e a se mejo en odos los aspec os, espec o al modelo an e io eniendo como m´aximo
esul ado un 41 % en 100 de ecciones. De igual mane a pasa con la exhaus i idad si se mide
con espec o a la dis ancia (Tabla 5.12): pese a se bas an e mala, mejo a en compa aci´on
con MobileNe , eniendo como m´aximo esul ado un 64 % cuando la ca a se encuen a en
una posici´on ce cana.
Tabla 5.11: Exhaus i idad media usando SSD con Incep ion
AR@1 ( %) AR@10 ( %) AR@100 ( %)
14.51 37.09 40.95
Tabla 5.12: Exhaus i idad media en dis in as dis ancias usando SSD con Incep ion
AR Small ( %) AR Medium ( %) AR La ge ( %)
11.44 37.89 64.21
Una ez se han mos ado los esul ados ob enidos mien as el en enamien o se es aba
ealizando, se p ocede a e cu´ales son ealmen e los que se ob ienen jus o en el pun o en
el que se ha c eado el modelo, u ilizando pa a ello di e sos umb ales de IOU.
Como se e en la Tabla 5.13, la p ecisi´on mejo a bas an e ambi´en con espec o a
los esul ados mos ados en las ablas an e io es. Lo mismo ocu e con la exhaus i idad,
mejo a aunque en meno medida que la p ecisi´on.
Tabla 5.13: Resul ados m´as espec´ı icos usando SSD con Incep ion
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 92.44 75.04 8818 2933 721 0 70.70
@.55 IOU 92.34 74.93 8806 2945 730 0 70.55
@.60 IOU 92.31 74.90 8802 2949 733 0 70.50
@.65 IOU 92.24 74.83 8794 2957 739 0 70.40
@.70 IOU 92.14 74.75 8784 2967 749 0 70.27
@.75 IOU 92.06 74.66 8774 2977 756 0 70.15
@.80 IOU 91.87 74.48 8753 2998 774 0 69.88
@.85 IOU 91.47 74.11 8709 3042 812 0 69.32
@.90 IOU 90.91 73.49 8636 3115 863 0 68.46
@.95 IOU 87.88 69.82 8205 3546 1131 0 63.69
Media 91.56 74.10 8708 3043 801 0 69.37
El 91.56 % de las eces los obje os de ec ados coinciden con los o iginales, sin emba go,
hay oda ´ıa una can idad conside able de alsos nega i os que hace baja su exhaus i idad.
5.2. Expe imen os 63
No obs an e, si se compa a con los esul ados ob enidos en MobileNe , se es ´a an e
un modelo m´as equilib ado en cuan o a p ecisi´on y exhaus i idad se e ie e y, po an o,
la exac i ud esul an e es conside ablemen e mayo : un 69 %, haciendo de es e el mejo
modelo p obado has a el momen o.
Una ez se ha hallado la exac i ud, se p ocede a e qu´e endimien o o ece el modelo
al in e i en s eaming y en ´ıdeos, con la Tabla 5.14.
Tabla 5.14: Resul ados usando el modelo SSD con Incep ion en ´ıdeos y s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.019 segundos 28
Webcam 3398 0.021 segundos 15
YouTube 3398 0.021 segundos 4
Twi ch 3398 0.020 segundos 7
En ella se obse a que el iempo de in e encia, y en consecuencia los FPS, es bas an e
simila al ob enido con el modelo que usa MobileNe . Tan o pa a ´ıdeo como pa a c´ama a
web, sigue siendo una can idad bas an e al a pa a pode conside a lo un g an modelo
que pe mi a su uso en s eaming y dado que el endimien o en ´e minos gene ales es
conside ablemen e mayo , se pod ´ıa pensa que es e modelo es bas an e mejo que el
an e io p obado.
Finalmen e, en la Figu a 5.4, se puede e algunos ejemplos de su endimien o en el
momen o de de ecci´on.
Figu a 5.4: Ejemplos de de ecci´on usando SSD con Incep ion
En los ejemplos se e un g upo de pe sonas asi´a icas, una euni´on que con iene algunos
os os gi ados y es beb´es cub i´endose la ca a con unas ga as de sol.
70 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.26: Resul ados usando el modelo Fas e R-CNN con Incep ion en ´ıdeos y
s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.058 segundos 13
Webcam 3398 0.055 segundos 13
YouTube 3398 0.058 segundos 3
Twi ch 3398 0.061 segundos 4
Adem´as de eso, p opo ciona una mejo exac i ud po lo que pod ´ıa conside a se o o
buen candida o pa a usa en iempo eal.
En la Figu a 5.8 se mues an algunos ejemplos de de ecciones ealizados con es e
modelo. En ella se ap ecia como se de ec a a la pe ecci´on os os ya sea con la ca a
pin ada o po ando un casco. Adem´as, a di e encia de los modelos que usan SSD como
de ec o , se e que los esul ados a la gas dis ancias son m´as a o ables.
Figu a 5.8: Ejemplos de de ecci´on usando Fas e R-CNN con Incep ion
5.2.3.2. ResNe
El modelo ResNe es el segundo que se ha p obado con es e de ec o . Las p uebas se
hicie on de nue o en Cloud y el en enamien o du ´o unas 18 ho as. De no habe sido po
es a pla a o ma, hubie a demo ado 51 ho as, es deci , un poco m´as de dos d´ıas comple os
en pode ob ene unos esul ados.
En la Figu a 5.9, se puede e las cu as de ap endizaje gene adas al ealiza el
en enamien o.

5.2. Expe imen os 71
Figu a 5.9: Cu as de Ap endizaje de Fas e R-CNN con ResNe
En ella se ap ecia que el cos e an o de en enamien o como de alidaci´on es lige amen e
supe io al que usa Incep ion, al igual que la di e encia exis en e en e el pun o m´as al o
y el m´as bajo. Adem´as, el cos e ambi´en es bas an e in e io al que se puede halla en
Incep ion con SSD.
Pese a se m´as bajo el cos e de alidaci´on al comienzo de la cu a, ´apidamen e
se adap a y consigue un ajus e bas an e bueno has a el paso de ejecuci´on 95000
ap oximadamen e: el pun o donde se ha gene ado el modelo. A pa i de ah´ı comienza
a sucede un lige o o e i ing el cual debe e i a se.
En la Tabla 5.27 se pueden e los esul ados que se ob ienen en cuan o a p ecisi´on
media.
Tabla 5.27: P ecisi´on media usando Fas e R-CNN con ResNe
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
47.01 82.75 48.63
Los es alo es supe an los p oducidos usando Incep ion como CNN. El alo en el
que m´as aumen o se ha p oducido ha sido especialmen e cuando se es ablece la es icci´on
de 0.75 en el IOU, po lo que se p oduci ´ıa una localizaci´on m´as e ec i a.
Si se compa an eniendo en cuen a la lejan´ıa del os o en la Tabla 5.28, se uel e a e
que los esul ados son de nue o a o ables an o pa a la gas como pa a medias dis ancias.
Sin emba go, en co as dis ancias se man iene el mismo esul ado.
Tabla 5.28: P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con ResNe
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
13.97 44.53 63.84
Se p ocede po ´ul imo a analiza qu´e ha ocu ido con la exhaus i idad. Si se p es a
a enci´on en la exhaus i idad media (Tabla 5.29), no ha aumen ado demasiado con espec o
aIncep ion. El alo m´as des acable es 52.46 % cuando se ealizan 100 de ecciones,
supe ando en un 4 % al ob enido con el modelo an e io . Lo mismo ocu e con 5.30,
p oduci´endose un lige o aumen o en las es m´e icas.
72 Cap
´
ı ulo 5. Expe imen os y Resul ados
Tabla 5.29: Exhaus i idad media usando Fas e R-CNN con ResNe
AR@1 ( %) AR@10 ( %) AR@100 ( %)
16.37 45.91 52.46
Tabla 5.30: Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con ResNe
AR Small ( %) AR Medium ( %) AR La ge ( %)
32.31 50.42 68.14
En es e caso, uel e a pasa lo mismo que ocu i´o usando SSD con ResNe . La g ´a ica
p esen a una endencia bas an e ec a desde el paso de ejecuci´on 40000 has a el 100000
ap oximadamen e. En es e ango se e in oluc ado los 10 checkpoin s an e io es al que se
ha elegido pa a gene a el modelo. Po lo an o, los esul ados du an e el en enamien o en
es a pa e, es u ie on menos in luenciados po la al a a iabilidad de la cu a y se ace can
m´as a la ealidad que en el caso de Fas e R-CNN con Incep ion, el cual debe ´ıan se unos
esul ados mayo es si no se hubiese is o a ec ado po es e mo i o.
Los esul ados que se han gene ado al cen a se ´unicamen e en los 95000 pasos de
ejecuci´on son los que se pueden e en la Tabla 5.31. En p ime a ins ancia, se e que la
elaci´on p ecisi´on-exhaus i idad es m´as desequilib ada que la ob enida en Fas e R-CNN
con Incep ion. Se ca ac e iza po ene una exhaus i idad mayo que la p ecisi´on, po lo
que el modelo se ´a capaz de de ec a m´as os os, pe o ambi´en sucede ´a un mayo n´ume o
de alsos posi i os.
Tabla 5.31: Resul ados m´as espec´ı icos usando Fas e R-CNN con ResNe
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 79.52 89.60 10529 1222 2711 0 72.80
@.55 IOU 79.50 89.56 10525 1226 2713 0 72.76
@.60 IOU 79.49 89.53 10521 1230 2714 0 72.73
@.65 IOU 79.44 89.48 10515 1236 2720 0 72.66
@.70 IOU 79.38 89.41 10507 1244 2728 0 72.56
@.75 IOU 79.16 89.27 10491 1260 2743 0 72.38
@.80 IOU 79.16 89.09 10470 1281 2756 0 72.17
@.85 IOU 78.93 88.79 10434 1317 2785 0 71.78
@.90 IOU 78.61 88.17 10362 1389 2819 0 71.11
@.95 IOU 77.01 85.09 9999 1752 2984 0 67.85
Media 79.02 88.79 10435 1315 2767 0 71.88
Es o se e cla amen e e lejado en su exac i ud, siendo un poco meno que en Incep ion,
pe o lige amen e mayo que en el mejo modelo de SSD, donde los esul ados ue on jus o
al e ´es eniendo una p ecisi´on mayo que la exhaus i idad.
El esul ado que se obse a en ´ıdeos y s eaming (Tabla 5.32) es pa ecido a su
hom´onimo usando el de ec o SSD. Es de los peo es modelos analizados has a el momen o
en es e sen ido, eniendo la capacidad de p ocesa 8 FPS en el caso de los ´ıdeos y la
webcam. Po lo que, has a el momen o, no le ha ´ıa me ecedo de se mejo que el modelo
compues o po Fas e R-CNN eIncep ion, debido a su exac i ud y el endimien o que se
acaba de e en ´ıdeos y s eaming.
5.2. Expe imen os 73
Tabla 5.32: Resul ados usando el modelo Fas e -RCNN con ResNe en ´ıdeos y s eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.112 segundos 8
Webcam 3398 0.103 segundos 8
YouTube 3398 0.110 segundos 1
Twi ch 3398 0.109 segundos 3
En la Figu a 5.10 se pueden e algunos de ejemplos de c´omo se compo a es e
modelo en di e sas im´agenes. En ellas se ap ecia como, a pesa de habe una se ie de
pe sonas con la ca a apada con masca illas o indumen a ia mili a , es capaz de de ec a les
pe ec amen e.
Figu a 5.10: Ejemplos de de ecci´on usando Fas e R-CNN con ResNe
5.2.3.3. Incep ion-ResNe
Incep ion-ResNe ue el ´ul imo ex ac o que se ha usado pa a conclui con es a ase de
expe imen aci´on. La a qui ec u a de es a CNN se basa en hace una ed h´ıb ida en e
Incep ion yResNe . Du an e su en enamien o, llam´o la a enci´on que ue una de las que
m´as a d´o en ejecu a se, llegando a la can idad de 44 ho as en la ins ancia albe gada en
la nube, lo que se hubie a aducido en 109 ho as ap oximadamen e en nues o o denado
en local.
74 Cap
´
ı ulo 5. Expe imen os y Resul ados
Finalmen e se consigui´o ejecu a el modelo y gene a las g ´a icas co espondien es, las
cuales se pueden e en la Figu a 5.11.
Figu a 5.11: Cu as de Ap endizaje de Fas e R-CNN con Incep ion-ResNe
Como se puede e en ella, se ol ie on a ejecu a 200000 pasos de ejecuci´on en los
que el cos e ol i´o a se simila a los modelos p obados con Fas e R-CNN. Pese a que
el cos e de alidaci´on se man u o bas an e lineal du an e odo el en enamien o, el de
en enamien o ue cada ez siendo meno , llegando a c uza se al ededo de los 100000
pasos de ejecuci´on y eniendo como pun o com´un m´as bajo el ins an e de los 123000 pasos
de ejecuci´on.
Los esul ados ob enidos en cuan o a p ecisi´on media en la Tabla 5.33 son
p ome edo es. Si se compa an con odos los que se han ob enido has a el momen o se
pod ´a e que son los mejo es. En compa aci´on con SSD eIncep ion, se puede e que
la p ecisi´on media aumen a un 19 % y casi un 28 % pa a el caso en el que se impone la
es icci´on de IOU en 0.75.
Tabla 5.33: P ecisi´on media usando Fas e R-CNN con Incep ion-ResNe
mAP ( %) [email p o ec ed] IOU ( %) [email p o ec ed] IOU ( %)
54.37 87.79 61.36
Con espec o a Fas e R-CNN eIncep ion, se ob ienen muy buenos esul ados ambi´en,
p oduci´endose un inc emen o del 20 % eniendo un 0.75 de IOU y casi un 12 % en la
p ecisi´on media.
A endiendo a la p ecisi´on con espec o a la dis ancia (Tabla 5.34, se e que donde se
p oduce un mayo endimien o en compa aci´on con SSD eIncep ion yFas e R-CNN e
Incep ion es a media dis ancia, donde aumen a un 22 % y un 15 % espec i amen e.
Tabla 5.34: P ecisi´on media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe
mAP Small ( %) mAP Medium ( %) mAP La ge ( %)
20.40 53.12 67.07
5.2. Expe imen os 75
Se p ocede aho a a mos a los esul ados que se han ob enido de exhaus i idad.
Como se puede ap ecia en las Tablas 5.35 y5.36, los esul ados uel en a aumen a
conside ablemen e. Se e leja un cla o inc emen o sob e odo en la m´e ica AR@100 y AR
Small, con espec o a las Tablas 5.23 y5.24.
Tabla 5.35: Exhaus i idad media usando Fas e R-CNN con Incep ion-ResNe
AR@1 ( %) AR@10 ( %) AR@100 ( %)
17.61 51.98 60.62
Tabla 5.36: Exhaus i idad media en dis in as dis ancias usando Fas e R-CNN con
Incep ion-ResNe
AR Small ( %) AR Medium ( %) AR La ge ( %)
43.26 59.34 72.30
No solo ah´ı consiguen mejo a se los esul ados, sino que en compa aci´on con las Tablas
5.11 y5.12, pe enecien es al de ec o SSD, el inc emen o es a´un m´as acusado.
Pa a asegu a se de que es os esul ados pueden se iables, se a a e qu´e endimien o
iene el modelo sin ene en cuen a los ´ul imos checkpoin s:
En la Tabla 5.37 se puede e que la p ecisi´on ob enida no es de las mejo es, po lo que
se pueden p oduci una can idad conside able de alsos posi i os. No obs an e, iene una
exhaus i idad muy al a haciendo que es e modelo no deje sin de ec a una g an can idad de
os os. Es as medidas quedan e lejadas cla amen e en la columna de los alsos posi i os
y alsos nega i os, donde se e que, en cuan o a alsos posi i os, se p oducen casi 1100
m´as que en el caso de Fas e R-CNN con Incep ion. A su ez, se p oduce la mi ad de
alsos nega i os que en dicho modelo. Es os esul ados quedan e lejados en su exac i ud,
haciendo que sea el mejo con casi un 75 %.
Tabla 5.37: Resul ados m´as espec´ı icos usando Fas e R-CNN con Incep ion-ResNe
Medida mAP ( %) AR ( %) VP FN FP VN Exac i ud ( %)
@.50 IOU 79.65 93.72 11014 737 2814 0 75.61
@.55 IOU 79.62 93.69 11010 741 2817 0 75.57
@.60 IOU 79.62 93.66 11006 745 2817 0 75.54
@.65 IOU 79.61 93.63 11003 748 2817 0 75.52
@.70 IOU 79.54 93.54 10992 759 2827 0 75.40
@.75 IOU 79.47 93.45 10982 769 2837 0 75.28
@.80 IOU 79.39 93.36 10971 780 2848 0 75.14
@.85 IOU 79.22 93.11 10942 809 2869 0 74.84
@.90 IOU 78.95 92.56 10877 874 2899 0 74.24
@.95 IOU 77.41 89.98 10574 1177 3085 0 71.27
Media 79.24 93.07 10937 814 2863 0 74.83

76 Cap
´
ı ulo 5. Expe imen os y Resul ados
Se obse a aho a c´omo se compo a con ´ıdeos y en pla a o mas de s eaming.
En la Tabla 5.38 se obse a que su endimien o en ´ıdeos es bas an e malo, p ocesando
un o og ama po segundo y, po an o, ob eniendo 1 FPS como esul ado. En cuan o a
s eaming, se puede e que se ob ienen unos esul ados bas an es malos ambi´en, po lo
que se pod ´ıa conclui que es e modelo no puede se usado en s eaming. No obs an e,
pese a los esul ados ob enidos en ´ıdeos, es un modelo que iene una exac i ud bas an e
buena y debe ene se en cuen a.
Tabla 5.38: Resul ados usando el modelo Fas e R-CNN con Incep ion-ResNe en ´ıdeos
ys eaming
Pla a o ma Fo og amas T. In e encia FPS
V´ıdeo 3398 0.938 segundos 1
Webcam 3398 0.892 segundos 1
YouTube 3398 0.948 segundos 0.3
Twi ch 3398 0.943 segundos 0.5
En la Figu a 5.12 se e lejan algunos ejemplos de como ac ´ua es e de ec o . En las
im´agenes se ap ecia c´omo es capaz de de ec a a pe sonas bajo unas condiciones de luz
escasas y algunas le as ap´andoles la ca a. Adem´as, es capaz de encon a al conduc o
del coche y la ca a de o a pe sona pese a ene la apada y pin ada de colo es.
Figu a 5.12: Ejemplos de de ecci´on usando Fas e R-CNN con Incep ion-ResNe
5.2.4. Resul ados de la Fase 2
Como se ha podido e en el an´alisis de es a segunda ase, los modelos basadas en Fas e
R-CNN ac ´uan de una o ma m´as len a en cuan o a iempo de in e encia se e ie e, llegando
en algunos casos a p ocesa un o og ama po segundo.
5.2. Expe imen os 77
Sin emba go, queda demos ado que son las m´as e ec i as a la ho a de ealiza la
de ecci´on y su endimien o en es e sen ido es mucho mejo , eniendo como m´axima
exac i ud un 75 % ap oximadamen e en el caso de Incep ion-ResNe .
En p ime luga , el modelo basado en ResNe ol e ´ıa a queda desca ado pues o
que el endimien o que o ece an o en iempo como en exac i ud no es lo su icien emen e
bueno como pa a u iliza lo en es e caso.
Po o o lado, se end ´ıa a los modelos basados en Incep ion eIncep ion-ResNe .
Incep ion ha demos ado se bas an e bueno en exac i ud con un 74.59 %, una can idad de
alsos posi i os y alsos nega i os equilib ada y un iempo de in e encia en s eaming
semejan e al mejo modelo ob enido en la p ime a ase. En cambio, se ha is o que
Incep ion-ResNe es el mejo modelo que se ha podido c ea con un 74.83 % de exac i ud
y un escaso n´ume o de alsos nega i os que pe mi i ´ıan ealiza un mayo n´ume o de
de ecciones. Adem´as, pese a se bas an e len o en la in e encia, se pod ´ıa ap o echa es a
i ud pa a la de ecci´on en ´ıdeos, pues o que en esa si uaci´on no es c ucial el iempo que
se a da en p ocesa un o og ama.
Po an o, se pod ´ıa conclui que es os dos ´ul imos modelos comen ados son los mejo es
de es a segunda ase.
5.2.5. Elecci´on del Mejo Modelo
Dado que la expe imen aci´on se ha cen ado en di e encia los modelos no solo po
su exac i ud, sino ambi´en po su endimien o en ´ıdeos y s eaming, lo co ec o se ´ıa
p esen a un modelo po cada uno de es os dos usos. Se elegi ´a un modelo que es ´e mejo
adap ado pa a ´ıdeos y o o cuyo endimien o en s eaming sob esalga espec o al es o.
Pa a ello, se compa a ´an aquellos que se han p opues o como encedo es de cada una de
las dos ases, mos ando su exac i ud y los FPS de aquella pla a o ma en la que mejo
hayan endido. En es e caso, los modelos se han compo ado mejo con la webcam
En la Figu a 5.13 se puede e de mane a muy esumida el compo amien o de los es
modelos elegidos. En ella se obse a que la di e encia de FPS en e los modelos que usan
s´olo Incep ion no es muy g ande, pe mi iendo que puedan usa se ambos en iempo eal.
Es o no sucede as´ı con el caso del ´ul imo modelo, donde los esul ados en es e sen ido
dejan bas an e que desea .
Sin emba go, en el caso de la exac i ud, se obse a que Fas e R-CNN con Incep ion
ha ob enido mejo es esul ados que su e si´on con SSD. Adem´as, se obse a ambi´en que
son un poco in e io es a los que Incep ion-ResNe pod ´ıa p opo ciona .
Po an o, po odo lo analizado en es e cap´ı ulo, pod ´ıa conclui se que el modelo m´as
ap opiado pa a usa en ´ıdeos es Fas e R-CNN con Incep ion-ResNe , mien as que se
p opone usa Fas e R-CNN con Incep ion en el caso de s eaming.
78 Cap
´
ı ulo 5. Expe imen os y Resul ados
Figu a 5.13: Compa a i a inal de los mejo es modelos c eados
Cap´ı ulo 6
Apo aciones Indi iduales
6.1. A u o Ba be o P´e ez
Pese a habe cu sado la asigna u a de Ap endizaje Au om´a ico en la uni e sidad, es e
p oyec o supuso pa a m´ı un e o pues o que dicha asigna u a no ue su icien e pa a
en ende la p oblem´a ica que en´ıamos delan e y a la que nos es ´abamos en en ando.
Las a eas en las que me he is o in oluc ado y apo aciones que he ealizado al p oyec o
son las siguien es:
Lo p ime o que hice cuando conoc´ı a mis compa˜ne os ue p opo ciona les un eposi o io
con los apun es y p ´ac icas que hab´ıa ealizado du an e la asigna u a comen ada
p e iamen e. Dado que e a la ´unica pe sona del g upo con nociones en ML, decid´ı lle a
a cabo es o con el obje i o de que pudie an en ende es e campo con la mayo b e edad
posible y u i´e amos odos el mismo ni el a la ho a de abaja jun os.
Poco despu´es me di cuen a de que, pa a alige a el a ance del p oyec o, necesi ´abamos
un m´e odo pa a que odos supi´e amos qu´e cosas se han in en ado y qu´e conocimien o
ha adqui ido el g upo en gene al. Po ello, ab ´ı una unidad compa ida en Google D i e
donde a˜nad´ı unos documen os pa a que odos apun ´a amos los descub imien os que´ıbamos
haciendo y concep os di ´ıciles que hubi´e amos en endido has a el momen o. Adem´as, hice
una peque˜na in es igaci´on sob e la bibliog a ´ıa ecomendada y la a˜nad´ı al D i e. Con
el iempo, el equipo uimos subiendo a ´ıculos cien ´ı icos y es´umenes que nos se ´ıan a
odos.
Pa a en ende m´as la p oblem´a ica que en´ıamos an e noso os, ealic´e una se ie de
u o iales que es aban en la l´ınea de es e p oyec o. En e ellos se encon aban un so wa e
que pe mi ´ıa clasi ica im´agenes de pe os y ga os, y o o que pe mi ´ıa ealiza una
de ecci´on median e webcam di e enciando cuando un os o que sal´ıa en escena e a eal
o no. Los u o iales me si ie on pa a a ianza los conocimien os de ML que ya en´ıa y
empeza a in oduci me en el campo de CV.
En pa alelo a es os u o iales, ui haciendo una lec u a y sub ayado de los concep os
m´as impo an es que encon aba en unos abajos cien ´ı icos que nos p opo ciona on
nues os u o es, in en ando elaciona es os concep os con los u o iales que ealizaba,
pa a pode explic´a selos a mis compa˜ne os y u o es en euniones pos e io es.
Dado que hab´ıa ealizado un u o ial muy elacionado con nues a p oblem´a ica,
nues o u o p opuso di idi el g upo pa a que yo ue a in es igando m´as en la pa e
79

Cap´ı ulo 7
Conclusiones y T abajo Fu u o
7.1. Conclusiones
Una ez que el desa ollo del T abajo ha concluido, el equipo ha conseguido llega a las
siguien es conclusiones:
T as la ase de in es igaci´on y los esul ados ob enidos en los di e en es modelos,
los mejo es sis emas elegidos han dado un po cen aje de acie o del 74,59 % y 74,83 %,
espec i amen e. El equipo conside a es os esul ados bas an e acep ables aunque
mejo ables, eniendo en cuen a, en p ime a ins ancia, que es la p ime a ez que se
en en aban a un p oblema como el expues o en es e abajo. El equipo ha conseguido
a ios modelos an o pa a ealiza de ecciones en ´ıdeos como en s eaming. No han
enido en cuen a el p ep ocesamien o de las im´agenes, al igual que han enido muchos
desa ´ıos e´o icos a lo la go del p oceso y, sin emba go, han conseguido sis emas e icien es
en condiciones de imagen pob es, de ecci´on de m´ul iples os os po o og ama y una
elocidad de p ocesamien o acep able pa a pode ealiza de ecciones en iempo eal.
Adem´as, el equipo ha con ado con el iempo su icien e pa a asegu a se de que los modelos
elegidos son los m´as e icien es, pues o que en la ase de expe imen aci´on ha podido
ealiza m´ul iples p uebas con di e en es combinaciones, las cuales no han dado los mismos
esul ados en compa aci´on con los elegidos.
Po o o lado, el habe expe imen ado con una amplia a iedad de a qui ec u as, ha
pe mi ido que se ea de una mane a m´as cla a cu´ales son los modelos que se debe ´ıan usa
dependiendo de los obje i os que se es ´an pe siguiendo. Adem´as de es o, los in eg an es
del g upo c een que puede se un g an apo e pa a la comunidad cien ´ı ica el ene una
e e encia donde se compa en dis in as ´ecnicas pa a que cada pe sona u ilice la que m´as
le con enga. El equipo de abajo c ee i memen e en que los esul ados, son bas an e
posi i os eniendo en cuen a la di icul ad del p oblema p opues o y ambi´en conside ando
que se pa ´ıa de ninguna base, m´as all´a de los conocimien os b´asicos sob e el ema.
Adem´as, as una exhaus i a in es igaci´on en la que se explo a on una pa e de los
concep os que aba can es e ´a ea de es udio, muchos ue on los p oblemas pa a con inua
y hace le en e a los desa ´ıos que se plan eaban a dia io, aunque el equipo ha sido capaz
de hace les en e de mane a sa is ac o ia. El equipo de abajo piensa, po consiguien e,
que la complejidad que implica es e ´a ea de in es igaci´on es mucho m´as de la que se
puede imagina a simple is a. Son muchos los ac o es a ene en cuen a a la ho a de
c ea modelos p ecisos y es mucho el iempo que es necesa io in e i pa a consegui
87
88 Cap
´
ı ulo 7. Conclusiones y T abajo Fu u o
esul ados uc ´ı e os. Adem´as, y m´as conc e amen e en el ´a ea de la de ecci´on acial, es
necesa io un conocimien o y expe iencia p e ia pa a pode en ende la p oblem´a ica en
su o alidad. C ea un modelo p eciso no consis e ´unicamen e en elegi capas y nodos de
mane a alea o ia, es necesa ia una expe imen aci´on muy p ecisa pa a consegui esul ados
dignos y aco des a los espe ados. En lo que se e ie e a es e abajo, aunque los esul ados
son so p enden emen e buenos, el equipo iene la ce eza de que pod ´ıa se mucho mejo es
si se conociese el ´a ea y con ex o de abajo y es udio, lo que implica ´ıa una educci´on de
la complejidad y una mayo acilidad pa a cons ui un sis ema al amen e pun e o.
Po ´ul imo, as la ase de expe imen aci´on, se descub i´o la complejidad que supone
encon a el equilib io en e la e ec i idad y la e iciencia de un modelo de de ecci´on. Lo
que quie e deci es o es que cuando un sis ema es al amen e p eciso y e ec i o, su e iciencia
disminuye exponencialmen e, como se ha podido llega a e en los esul ados ob enidos en
el p oceso de expe imen aci´on. En algunos casos, la e iciencia e a an baja que se p ocesaba
solo una imagen po segundo, y es e no es pa a nada el esul ado espe ado pa a consegui
an´alisis de ´ıdeos de mane a ´apida. Po o o lado, si se consigue un modelo que p ocese
las im´agenes a una g an elocidad, es e con a ´a con una asa de inexac i ud m´as al a y con
una p ecisi´on inal m´as baja, consigui´endose as´ı un sis ema poco e ec i o aunque e icien e.
Es po ello que nues a elecci´on inal ha sido aquella que consegu´ıa el equilib io en e
es as dos m´e icas, apa en emen e con a ias e imposibles de explo a en su o alidad de
mane a simul ´anea. A´un as´ı, como se explica ´a en el siguien e apa ado, es e equilib io
en e e ec i idad y e iciencia puede llega a se mejo de lo que se ha conseguido si se
in es iga su icien emen e en la con igu aci´on de los modelos elegidos.
7.2. T abajo Fu u o
Como posibles abajos u u os pueden se˜nala se los siguien es:
•LSTM pa a la ex acci´
on de ca ac e ´
ıs icas: Aunque du an e oda la ase
de expe imen aci´on el equipo es u o p obando con nume osas con igu aciones de
modelos, es cie o que no se p oba on las ´ecnicas usadas en el a ´ıculo acad´emico
[LLT17], elacionadas con el uso de LSTM, debido a la inexpe iencia en implemen a
es e ipo de sis emas po la complejidad que es o conlle aba, an o a ni el e´o ico
como a ni el ´ecnico. Como se puede obse a en el es ado del a e de es a memo ia
si uado en el cap´ı ulo 3, es e a ´ıculo mues a una posible a qui ec u a aplicando es e
ipo de Red Neu onal, con la que se consiguen unas ex acciones de ca ac e ´ıs icas
de mejo calidad. Es po ello que el equipo c ee que pod ´ıan mejo a las asas de
acie os de los modelos si se aplica an dichas soluciones, y, po an o, se conside a
que pod ´ıa se un buen pun o de pa ida de ca a a mejo a la p ecisi´on inal de los
modelos elegidos.
•Mejo a de los pa ´
ame os de con igu aci´
on: Aunque, como se ha explicado
an e io men e, el equipo piensa que los esul ados que se han ob enido son
sa is ac o ios, y ha conseguido sis emas e icien e a la pa que e ec i os, el equipo
c ee que la con igu aci´on de es os modelos pod ´ıa mejo a se de ca a a consegui un
mejo equilib io en e la apidez de de ecci´on y la e ec i idad a la ho a de ealiza la.
Po ello, se c ee que un p oceso de in es igaci´on sob e los pa ´ame os de con igu aci´on
de los modelos puede se muy posi i o de ca a a mejo a la asa de acie os sin que
es o a ec e a la elocidad de p ocesamien o.
7.2. T abajo Fu u o 89
•P ep ocesado de las im´
agenes: T as ealiza la expe imen aci´on, el equipo c ee
que es posible que, aunque se mi igue en cie a medida, el p oblema con la calidad de
la imagen puede segui siendo un ac o que disminuya la e ec i idad de la de ecci´on.
Si una imagen posee cie os aspec os como baja iluminaci´on, pixelaci´on, di uminaci´on
o, simplemen e, esoluci´on pob e, la a ea de la de ecci´on del os o puede supone
un g an e o incluso pa a una ed muy pun e a y bien en enada.
Es po ello que se piensa que la idea de un p ep ocesamien o de la imagen puede
supone un aumen o signi ica i o en la p ecisi´on y e ec i idad del modelo en cues i´on.
Dicho sis ema de p ep ocesamien o se enca ga ´ıa de calib a cie as p opiedades de
la imagen, como el b illo, el con as e o el colo . Tambi´en pod ´ıa enca ga se de a˜nadi
p´ıxeles ex as a la imagen inal, pa a a˜nadi le calidad a es a y pode as´ı a˜nadi m´as
in o maci´on pa a el modelo. Es o pod ´ıa ealiza se de mane a p og am´a ica, es deci ,
con alg´un ipo de algo i mo que ealice la calib aci´on en unci´on de los pa ´ame os
iniciales de la imagen, o, po o o lado, se puede c ea un modelo m´as que es ´e
en enado pa a aumen a la calidad inal de la composici´on.
•Inco po aci´
on de la es imaci´
on de la edad: T as ealiza es e abajo, el equipo
sien e que el p oyec o inal ealizado pod ´ıa se i como un g an sis ema de de ecci´on
acial pa a el an´alisis o ense. Se c ee que los modelos inales pueden llega a se , si
bien no pe ec os, bas an e ce e os a la ho a de ealiza de ecciones aciales en ´ıdeo
e, incluso, en s eaming. Sin emba go, no se ha podido iempo a c ea un sis ema que
ealice p edicciones de la edad de mane a ce e a y e icien e. Es posible que dicho
sis ema, en combinaci´on con el abajo inal, pueda se de mucha mayo u ilidad
pa a el an´alisis o ense, pues o que, en nume ables ocasiones, la edad de los suje os
implicados es de e minan e pa a pode acla a la g a edad o la legalidad de los hechos
ocu idos en el me aje. Es po ello que el equipo c ee que una es imaci´on de la edad
puede se un g an paso a ealiza pa a pode consegui un sis ema plenamen e capaz
de se usado pa a el an´alisis o ense.
•E ique ado de las de ecciones: A la ho a de ealiza el an´alisis o ense sob e ´ıdeo
es posible que sea necesa io sabe , no solo el o los os os que apa ecen en ella, sino
ambi´en cie as ca ac e ´ıs icas sob e ellos que puedan se c uciales pa a el p oceso de
in es igaci´on, como puede se el nomb e, el colo de piel, la aza o, incluso, el colo
del pelo. Po ello, el equipo a i ma que pod ´ıa se in e esan e a˜nadi e ique ado en las
de ecciones de los os os, do ando a los modelos de la capacidad de iden i icaci´on.
Ac ualmen e, cuando los modelos inales consiguen de ec a una ca a en una imagen,
es a apa ece con la e ique a de Face. Aunque dicha e ique a deja bas an e cla o lo
que es ´a de ec ando, es cie o que pod ´ıan apa ece cie as p opiedades del os o
en cues i´on, como un conjun o de e ique as ales como Face, blue eyes, caucasian o
algo elacionado. A˜nadi m´as in o maci´on a la de ecci´on pod ´ıa llega a se muy ´u il
pa a, po ejemplo, sabe en cues i´on de muy poco iempo si un indi iduo en conc e o
apa ece en los me ajes obse ados po el modelo.
•So wa e de sopo e: T as la ase de expe imen aci´on, se con aba con los modelos
m´as p ecisos pa a ealiza las de ecciones. Pa a c ea las salidas del modelo, se
codi ica on di e en es sc ip s que pe mi ´ıan que el modelo consiguiese de ec a los
os os en una imagen o un ´ıdeo, el cual e a la en ada de dichos sc ip s. Pa a la
ejecuci´on de es os, e a necesa io que el p oceso se ealizase en una e minal, pues o
que no exis ´ıa ning´un sopo e so wa e pa a la ejecuci´on de dichos sc ip s. Es po ello
que el equipo c ee opo uno el desa ollo de un componen e so wa e que pe mi a
90 Cap
´
ı ulo 7. Conclusiones y T abajo Fu u o
u iliza los modelos inales de es e abajo pa a ealiza la de ecci´on pod ´ıa se muy
in e esan e pa a pode as´ı simpli ica la complejidad que aho a supone pode ealiza
de ecci´on en un ´ıdeo.
•M´
as aplicaciones: El obje i o que se ha man enido desde el comienzo de es e
abajo ha sido el de c ea un sis ema ´op imo pa a la de ecci´on de os os a la
ho a de ealiza an´alisis o ense sob e ´ıdeos. Aunque es e es un campo muy amplio
que aba ca mul i ud de u ilidades conc e as, el equipo c ee que es e sis ema puede
ene m´as aplicaciones en el mundo ac ual. Con la ecien e si uaci´on que se es ´a
su iendo a causa del COVID-19, una u ilidad nue a pod ´ıa se el del con ol de las
medidas de segu idad aplicadas pa a e i a el con agio. Conc e amen e, el sis ema
pod ´ıa de ec a os os pa a as´ı pode iden i ica , de mane a manual con in e enci´on
humana o incluso ambi´en au om´a ica si se aplica el e ique ado en las de ecciones, si
el indi iduo es ´a espe ando las medidas de segu idad es ablecidas, espec´ı icamen e
si el os o lle a consigo una masca illa o no. Es o conciencia ´ıa a la sociedad de ca a
a espe a las medidas p opues as y as´ı asegu a que se cumplen, consiguiendo as´ı
un impac o posi i o en la e oluci´on de la si uaci´on.
Resumen del T abajo en Ingl´es
91

Cap´ı ulo 8
In oduc ion
8.1. Mo i a ion
O e he pas 70 yea s, nume ous scien i ic ad ances ha e led o exponen ial g ow h in
he wo ld o echnology. Speci ically, in he audio isual ield, hese de elopmen s ha e
led o nume ous ad ances ha ha e had a posi i e impac on he quali y, p ocessing
speed and s o age capaci y o images and audio. Un il ecen ly, a specialized came a was
equi ed o eco d a ideo and an innume able amoun o ex a componen s o i s co ec
ep oduc ion. In addi ion, he quali y ob ained was much lowe han oday, esul ing in a
loss o impo an in o ma ion when pe o ming o ensic analysis on ideo.
Wi h he a i al o he digi al e a, digi al came as eme ged and his managed o ix he
p oblems discussed abo e. Wi h hem, no special equipmen was needed and he quali y
ob ained was no ably supe io . In addi ion, o e ime, new o ms o s o age eme ged ha
allowed o longe -las ing ideo, making ideo o ensics a mo e e icien and p oduc i e
ask.
E en so, he quali y o he ideo was no as high as desi ed, and he ask o iden i ica ion
was di icul when he quali y o he en i onmen in which he ideo was made was unde
e y un a o able condi ions, such as da k places. Wi h he ad ancemen o so wa e and
he eme gence o ea ly image and ideo edi ing p og ams, oo age could be modi ied o
imp o e ce ain aspec s o composi ion, such as b igh ness, sa u a ion, con as , and so on.
Fo ensic analysis hus became an e en mo e p oduc i e ask, bu he e was s ill a p oblem
ha hinde ed i s e olu ion: i equi ed oo much manual wo k and human in e en ion o
he iden i ica ion wo k, and his slowed down he p ocess.
On he o he hand, he ield o AI was s ill unde in es iga ion. I was no un il 1958
ha he i s neu al ne wo k a chi ec u e appea ed, [Sim20] Pe cep on. Since hen, neu al
ne wo ks and AI began o g ow a g ea speed, la gely hanks o he e olu ion o ha dwa e
ha allowed he c ea ion o mo e powe ul machines capable o suppo ing he cons uc ion
o mo e complex and e icien a chi ec u es.
So wa e de elopmen changed comple ely wi h he inco po a ion and de elopmen
o Neu al Ne wo ks. As hei u ili y co e s any ask, many companies de eloped neu al
ne wo ks o he iden i ica ion o objec s in images o implemen au onomous sys ems ha
eac and make decisions in eal ime aking in o accoun he en i onmen in which hey
we e loca ed.
93
94 Cap
´
ı ulo 8. In oduc ion
I migh seem ha he use o AI in o ensic analysis would sol e all he p oblems.
This ask would be comple ely au oma ed, and ex ensi e analysis would be pe o med in
a ma e o minu es and in a massi e way. Image quali y becomes a lesse p io i y issue,
because sys ems analyze images di e en ly han he human eye does, inding pa e ns and
anomalies ha a e impe cep ible o anyone. Bu , e en so, a new ype o p oblem a ises: he
need o a cu ing-edge and ex emely e icien ne wo k, o a oid e oneous iden i ica ions
which, o he iden i ica ion o objec s and mo e speci ically aces, is a e y complex job.
The e o e, a good ace iden i ica ion sys em, which is able o make e y eliable and
accu a e de ec ions, as well as o make iden i ica ions in low quali y ideos, is c ucial o
be able o inco po a e a i icial in elligence in he o ensic analysis in a ull way and hus
be able o dispense wi h human in e en ion, which is an inc edible slowing down o he
p ocess. The sea ch o such sys ems is he d i ing o ce behind his wo k.
8.2. Con ex
This Final Deg ee P ojec has been ca ied ou wi hin he Analysis, Secu i y and
Sys ems G oup (GASS G oup, h ps://gass.ucm.es/, G oup 910623 o he ca alogue o
g oups ecognized by he UCM) as pa o he ac i i ies o he esea ch p ojec THEIA
(Techniques o In eg i y and Au hen ica ion o Mul imedia Files o MobileDe ices) wi h
e e ence FEI-EU-19-04
8.3. Objec o he In es iga ion
A pic u e con ains many simple ea u es which can be seen by human eye, such as he
silhoue es o objec s o he colo hey ha e. These pa e ns oge he make i possible
o iden i y objec s in an image and he e o e o d aw conclusions abou i , such as he
numbe o people in i o he ime o day i was made. Howe e , i has been ound ha
a su icien ly ained AI can iden i y ce ain pa e ns in images ha a e beyond human
unde s anding, and hese a e c i ical in iden i ying objec s o any o he ask in ol ing he
analysis o a pho og aph.
In addi ion, he e a e many al eady c ea ed and es ed iden i ie s dedica ed o
iden i ying whole bodies, and no aces speci ically, and his can be a disad an age when
a body is no ully displayed in an image.
This pape p oposes di e en echniques, algo i hms and DL models ha y o make
an e icien ace iden i ica ion in s eaming images and ideos.
8.4. Wo kplan
The de elopmen o his wo k has been ca ied ou in ou phases:
1. In es iga ion: Du ing he i s h ee mon hs, a pe iod o adap a ion o he wo k
con ex and acquisi ion o he necessa y knowledge was ca ied ou in o de o s a
wi h he subsequen de elopmen . A he beginning, a gene al mee ing was held in
which he s a ing poin o he wo k was explained, wha he objec i es we e o be
achie ed and wha he necessa y knowledge was o be. A e his, nume ous mee ings
8.4. Wo kplan 95
we e ag eed upon wi h he di ec o s o ollow up on he p og ess o he esea ch and
o esol e any doub s ha migh a ise. Ano he eason why hese mee ings we e
a anged was o ecei e alks on he basic concep s o he di e en ields in ol ed
in his wo k. These will be discussed in he ollowing chap e s. Some membe s o
he eam al eady had such knowledge hanks o he subjec s o A i icial In elligence
and Machine Lea ning, augh in his Facul y. Du ing he mee ings, many ools
ha would acili a e he esea ch wo k we e also explained. One o hese ools was
’Google Schola ’, which he eam would use o sea ch o scien i ic a icles on p e ious
esea ch in he same ield o s udy. Finally, once se e al conclusions had been eached
abou wha was wan ed and how i was o be achie ed, he eam began o p io i ise
de elopmen .
2. De eloping: Once he necessa y knowledge was acqui ed o be able o s a c ea ing
a solid e sion o he p ojec , i was decided o spend less ime on esea ch and o s a
wi h he codi ica ion o he p ojec . Al hough he esea ch phase did no cease, i was
a he pu in he backg ound, wi h esea ch being ca ied ou on speci ic concep s
ha eme ged du ing de elopmen . The e o e, du ing his phase, ad anced concep s
o he Py hon p og amming language and lib a ies such as Ke as and Tenso Flow
we e in es iga ed. Du ing his phase he aining se s o he model we e also buil ,
ob ained om he sou ces p o ided by he a icles ead du ing he p e ious phase.
3. Expe imen ing: In his phase, he e alua ion o he de eloped p o o ype was
ca ied ou and he esul s ob ained we e analysed. Di e en ools p o ided by he
same lib a ies explained abo e we e used, he esul s we e compa ed wi h hose
ob ained in he di e en wo ks e iewed and he con igu a ion o he pa ame e s
o he model e inemen was ca ied ou . Fo example, i was decided o adjus he
aining da a se s o analyze hei in luence on he imp o emen o he esul s. I
should be no ed ha he de elopmen phase did no cease du ing he expe imen al
phase, since he model was cons an ly compa ed wi h o he s and modi ied o
op imiza ion.
4. Documen a ion: Hal way h ough he de elopmen , he eam began he phase
ha would consis o w i ing and cons an ly e iewing he inal p ojec epo .
This phase an in pa allel be ween he de elopmen and expe imen a ion s ages.
Fo he w i ing o he epo , he eam made cons an upda es o he con en , as
he de elopmen included some new echnology, he expe imen a ion concluded in
di e en conclusions, o e en new a icles we e in es iga ed. A e an upda e, he
eam e iewed he changes made o e o s o possible sec ions o imp o e. Finally,
his phase ended a e comple ing he las miles one o he expe imen al s age,
compiling all he esul s ob ained om ha phase and adding hem o he Wo k.
In he Figu e 8.1 you can see in mo e de ail he o ganiza ion ha he eam has ollowed
du ing he cou se o his p ojec , as well as he du a ion o each phase and he sub- asks
ha compose hem. Also, below is a able showing he miles ones ollowed by he eam
ollowed by an iden i ie , used in he Figu e 8.1 o be e unde s anding.
102 Cap
´
ı ulo 9. Conclusions and Fu u e Wo k
he de ec ions, whe he he indi idual is espec ing he es ablished sa e y measu es,
speci ically whe he he ace is wea ing a mask o no . This would make socie y
awa e o he need o espec he p oposed measu es and hus ensu e ha hey a e
complied wi h, hus achie ing a posi i e impac on he e olu ion o he si ua ion.

Bibliog a ´ıa
[AZ13] R. A andjelo ic and A. Zisse man. All Abou VLAD. In P oceedings o he IEEE
con e ence on Compu e Vision and Pa e n Recogni ion, pages 1578–1585, 2013.
[BEP+08] K. Bollacke , C. E ans, P. Pa i osh, T. S u ge, and J. Taylo . F eebase: A
Collabo a i ely C ea ed G aph Da abase o S uc u ing Human Knowledge. In
P oceedings o he 2008 ACM SIGMOD in e na ional con e ence on Managemen o
da a, pages 1247–1250, 2008.
[B e20] C. B eazeal. MIT Team Building Social Robo . h p://news.mi .edu/2001/
kisme , Janua y 2020.
[B o20a] J B owniee. How o use Lea ning Cu es o Diagnose Machine
Lea ning Model Pe o mance. h ps://machinelea ningmas e y.com/
lea ning-cu es- o -diagnosing-machine-lea ning-model-pe o mance/,
Janua y 2020.
[B o20b] J. B ownlee. A Gen le In oduc ion o T ans e Lea ning o Deep Lea ning. h ps:
//machinelea ningmas e y.com/ ans e -lea ning- o -deep-lea ning/,
Janua y 2020.
[CBL+16] T. Cooijmans, N. Ballas, C. Lau en , C¸. G¨ul¸ceh e, and A. Cou ille. Recu en
Ba ch No maliza ion. a Xi p ep in a Xi :1603.09025, 2016.
[CCG+13] PL. Ca ie , A. Cou ille, IJ. Good ellow, M. Mi za, and Y. Bengio. FER-2013 Face
Da abase. Uni e si de Mon al, 2013.
[Cla20] L. Cla k. Google’s A i icial B ain Lea ns o Find Ca Videos. h ps://www.wi ed.
com/2012/06/google-x-neu al-ne wo k/, Janua y 2020.
[CRW+14] D. Chen, S. Ren, Y. Wei, X. Cao, and J. Sun. Join Cascade Face De ec ion and
Alignmen . In Eu opean con e ence on compu e ision, pages 109–122. Sp inge ,
2014.
[DAHG+15] J. Donahue, L. Anne Hend icks, S. Guada ama, M. Roh bach, S. Venugopalan,
K. Saenko, and T. Da ell. Long-Te m Recu en Con olu ional Ne wo ks o Visual
Recogni ion and Desc ip ion. In P oceedings o he IEEE con e ence on compu e
ision and pa e n ecogni ion, pages 2625–2634, 2015.
[DGG15] A. Dhall, R. Goecke, and T. Gedeon. Au oma ic G oup Happiness In ensi y
Analysis. IEEE T ansac ions on A ec i e Compu ing, 6(1):13–26, 2015.
[DGJ+16] A. Dhall, R. Goecke, J. Joshi, J. Hoey, and T. Gedeon. Emo iw 2016: Video and
G oup-Le el Emo ion Recogni ion Challenges. In P oceedings o he 18 h ACM
in e na ional con e ence on mul imodal in e ac ion, pages 427–432, 2016.
[DGLG12] A. Dhall, R. Goecke, S. Lucey, and T. Gedeon. Collec ing La ge, Richly Anno a ed
Facial-Exp ession Da abases om Mo ies. IEEE mul imedia, (3):34–41, 2012.
[F.18] Cholle F. Deep Lea ning wi h Py hon. Manning, 2018.
[FH99] H. Feng-Hsiung. IBM’s Deep Blue Chess G andmas e Chips. IEEE Mic o,
19(2):70–81, Ma ch 1999.
103
104 BIBLIOGRAF´
IA
[FLLL16] Y. Fan, X. Lu, D. Li, and Y. Liu. Video-Based Emo ion Recogni ion Using
CNN-RNN and C3D Hyb id Ne wo ks. In P oceedings o he 18 h ACM
In e na ional Con e ence on Mul imodal In e ac ion, pages 445–450, 2016.
[GDDM14] R Gi shick, J Donahue, T Da ell, and J Malik. Rich Fea u e Hie a chies o
Accu a e Objec De ec ion and Seman ic Segmen a ion. In P oceedings o he IEEE
con e ence on compu e ision and pa e n ecogni ion, pages 580–587, 2014.
[Gi 15] R Gi shick. Fas R-CNN. In P oceedings o he IEEE in e na ional con e ence on
compu e ision, pages 1440–1448, 2015.
[GLF+08] A. G a es, M. Liwicki, S. Fe n´andez, R. Be olami, H. Bunke, and J. Schmidhube .
A No el Connec ionis Sys em o Uncons ained Handw i ing Recogni ion. IEEE
ansac ions on pa e n analysis and machine in elligence, 31(5):855–868, 2008.
[GWD14] A. G a es, G. Wayne, and I. Danihelka. Neu al Tu ing Machines. a Xi p ep in
a Xi :1410.5401, 2014.
[HGDG17] K. He, G. Gkioxa i, P Doll´a , and R Gi shick. Mask R-CNN. In P oceedings o he
IEEE in e na ional con e ence on compu e ision, pages 2961–2969, 2017.
[HMBLM08] GB. Huang, M. Ma a , T. Be g, and E. Lea ned-Mille . Labeled Faces in he Wild:
A Da abase Fo S udying Face Recogni ion in Uncons ained En i onmen s. 2008.
[HOT06] G. E. Hin on, S. Osinde o, and Y. Teh. A Fas Lea ning Algo i hm o Deep Belie
Ne s. Neu al Compu a ion, 18(7):1527––1554, May 2006.
[HS97] S. Hoch ei e and J. Schmidhube . Long Sho -Te m Memo y. Neu al compu a ion,
9(8):1735–1780, 1997.
[Hui18] J. Hui. mAP (mean A e age P ecision) o Objec De ec ion. 2018.
[HZRS16] K. He, X. Zhang, S. Ren, and J. Sun. Deep Residual Lea ning o Image Recogni ion.
In P oceedings o he IEEE con e ence on compu e ision and pa e n ecogni ion,
pages 770–778, 2016.
[JPD+11] H. Jegou, F. Pe onnin, M. Douze, J. S´anchez, P. Pe ez, and C. Schmid. Agg ega ing
Local Image Desc ip o s In o Compac Codes. IEEE ansac ions on pa e n
analysis and machine in elligence, 34(9):1704–1716, 2011.
[JSD+14] Y. Jia, E. Shelhame , J. Donahue, S. Ka aye , J. Long, R. Gi shick, S. Guada ama,
and T. Da ell. Ca e: Con olu ional A chi ec u e o Fas Fea u e Embedding.
In P oceedings o he 22nd ACM in e na ional con e ence on Mul imedia, pages
675–678, 2014.
[JZL+19] Licheng J., Fan Z., Fang L., Shuyuan Y., Lingling L., Zhixi F., and Rong Q. A
Su ey o Deep Lea ning-Based Objec De ec ion. IEEE Access, 7:1––22, Oc obe
2019.
[KCL+15] S. Kwak, M. Cho, I. Lap e , J. Ponce, and C. Schmid. Unsupe ised Objec
Disco e y and T acking in Video Collec ions. In P oceedings o he IEEE
in e na ional con e ence on compu e ision, pages 3173–3181, 2015.
[KOLW16] K. Kang, W. Ouyang, H. Li, and X. Wang. Objec De ec ion om Video Tubele s
wi h Con olu ional Neu al Ne wo ks. In P oceedings o he IEEE con e ence on
compu e ision and pa e n ecogni ion, pages 817–825, 2016.
[KSH12] A. K izhe sky, I. Su ske e , and GE. Hin on. Imagene Classi ica ion wi h Deep
Con olu ional Neu al Ne wo ks. In Ad ances in neu al in o ma ion p ocessing
sys ems, pages 1097–1105, 2012.
[lab17] LabelImg. h ps://gi hub.com/ zu alin/labelImg, Oc obe 2017.
[LAE+16a] W. Liu, D. Anguelo , D. E han, C. Szegedy, S. Reed, C. Fu, and A. Be g. SSD:
Single Sho Mul iBox De ec o . Lec u e No es in Compu e Science, pages 21—-37,
No embe 2016.
BIBLIOGRAF´
IA 105
[LAE+16b] W. Liu, D. Anguelo , D. E han, C. Szegedy, S. Reed, C. Fu, and A.C. Be g. SSD:
Single Sho Mul ibox De ec o . In Eu opean con e ence on compu e ision, pages
21–37. Sp inge , 2016.
[LdMM17] R. L´opez de M´an a as and P. Mesegue . In eligencia A i icial, chap e 1, pages
7–29. CSIC Consejo Supe io de In es igaciones Cien ´ı icas, 2017.
[LGRYTN11] H. Lee, R. G osse, R. Rangana h, and A. Yan-Tak Ng. Unsupe ised
Lea ning o Hie a chical Rep esen a ions wi h Con olu ional Deep Belie Ne wo ks.
Communica ions o he ACM, 54(10):95–103, Oc obe 2011.
[LHS+14] H. Li, G. Hua, X. Shen, Z. Lin, and J. B and . Eigen-Pep o Video Face Recogni ion.
In Asian con e ence on compu e ision, pages 17–33. Sp inge , 2014.
[LLT17] Y. Lu, C. Lu, and C. Tang. Online Video Objec De ec ion Using Associa ion
LSTM. In P oceedings o he IEEE In e na ional Con e ence on Compu e Vision,
pages 2344–2352, 2017.
[LMB+20] TY Lin, M Mai e, S Belongie, J Hays, P Pe ona, D Ramanan, P Doll´a , L Zi nick,
G Pa e son, MR Ronchi, Y Cui, L Bou de , and R Gi shick. COCO - Common
Objec s in Con ex . h p://cocoda ase .o g/#de ec ion-e al, Ma ch 2020.
[LWZ11] J. Li, T. Wang, and Y. Zhang. Face De ec ion Using Su Cascade. In 2011 IEEE
in e na ional con e ence on compu e ision wo kshops (ICCV wo kshops), pages
2183–2190. IEEE, 2011.
[LZLY14] L. Liu, L. Zhang, H. Liu, and S. Yan. Towa d La ge-Popula ion Face Iden i ica ion
in Uncons ained Videos. IEEE T ansac ions on Ci cui s and Sys ems o Video
Technology, 24(11):1874–1884, 2014.
[MMdRM16] N. McLaughlin, J. Ma inez del Rincon, and P. Mille . Recu en Con olu ional
Ne wo k o Video-Based Pe son Re-iden i ica ion. In P oceedings o he IEEE
con e ence on compu e ision and pa e n ecogni ion, pages 1325–1334, 2016.
[num20] NumPy, The Fundamen al Package o Scien i ic Compu ing wi h Py hon. h ps:
//numpy.o g/, Ma ch 2020.
[NZH+17] G. Ning, Z. Zhang, C. Huang, X. Ren, H. Wang, C. Cai, and Z. He. Spa ially
Supe ised Recu en Con olu ional Neu al Ne wo ks o Visual Objec T acking.
In 2017 IEEE In e na ional Symposium on Ci cui s and Sys ems (ISCAS), pages
1–4. IEEE, 2017.
[Ola20] C Olah. Unde s anding LSTM Ne wo ks. h ps://colah.gi hub.io/pos s/
2015-08-Unde s anding-LSTMs/, Augus 2020.
[ope20a] Open Compu e Vision Lib a y (OpenCV). h ps://openc .o g/, Ma ch 2020.
[ope20b] Open Images Da ase V6. h ps://s o age.googleapis.com/openimages/web/
challenge_o e iew.h mle, Ma ch 2020.
[pa 20] Pa y - A Py hon lib a y o download YouTube con en and e ie e me ada a.
h ps://py honhos ed.o g/pa y/, Ma ch 2020.
[pas20] The PASCAL Visual Objec Classes Homepage. h p://hos . obo s.ox.ac.uk/
pascal/VOC/, Ma ch 2020.
[PLC+12] A. P es , C. Leis ne , J. Ci e a, C. Schmid, and V. Fe a i. Lea ning Objec Class
De ec o s om Weakly Anno a ed Video. In 2012 IEEE Con e ence on Compu e
Vision and Pa e n Recogni ion, pages 3282–3289. IEEE, 2012.
[PSVZ14] OM. Pa khi, K. Simonyan, A. Vedaldi, and A. Zisse man. A Compac and
Disc imina i e Face T ack Desc ip o . In P oceedings o he IEEE Con e ence on
Compu e Vision and Pa e n Recogni ion, pages 1693–1700, 2014.
[PVZ15] OM. Pa khi, A. Vedaldi, and A. Zisse man. Deep Face Recogni ion. 2015.
106 BIBLIOGRAF´
IA
[RCWS14] S. Ren, X. Cao, Y. Wei, and J. Sun. Face Alignmen a 3000 FPS Via Reg essing
Local Bina y Fea u es. In P oceedings o he IEEE Con e ence on Compu e Vision
and Pa e n Recogni ion, pages 1685–1692, 2014.
[RDGF16] J Redmon, S Di ala, R Gi shick, and A Fa hadi. You Only Look Once: Uni ied,
Real-Time Objec De ec ion. In P oceedings o he IEEE con e ence on compu e
ision and pa e n ecogni ion, pages 779–788, 2016.
[RHGS15] S Ren, K He, R Gi shick, and J Sun. Fas e R-CNN: Towa ds Real-Time Objec
De ec ion wi h Region P oposal Ne wo ks. In Ad ances in neu al in o ma ion
p ocessing sys ems, pages 91–99, 2015.
[Sa 20] D. Sa ka . A Comp ehensi e Hands-on Guide o T ans e Lea ning wi h Real-Wo ld
Applica ions in Deep Lea ning. h ps:// inyu l.com/y7ehja7h, Janua y 2020.
[Sch97] RR. Schalle . Moo e’s Law: Pas , P esen and Fu u e. IEEE Spec um, 34(6):52––59,
June 1997.
[SF18] N. Shukla and K. F icklas. Machine Lea ning Wi h Tenso Flow, chap e 1, pages
5–20. Manning, 2018.
[Sha18] R. Shanmugamani. Deep Lea ning o Compu e Vision, chap e 1, pages 8–25.
Pack , 2018.
[Sil20] V Silapa ase y. How o Handle O e i ing and Unde i ing
in Machine Lea ning. h ps://medium.com/da ad i enin es o /
how- o-handle-o e i ing-and-unde i ing-470a1 7389 e, Janua y
2020.
[Sim20] Simplilea n. Wha is Pe cep on. h ps://www.simplilea n.com/
wha -is-pe cep on- u o ial, Janua y 2020.
[SKP15] F. Sch o , D. Kalenichenko, and J. Philbin. Facene : A Uni ied Embedding o Face
Recogni ion and Clus e ing. In P oceedings o he IEEE con e ence on compu e
ision and pa e n ecogni ion, pages 815–823, 2015.
[SLJ+15] C. Szegedy, W. Liu, Y. Jia, P. Se mane , S. Reed, D. Anguelo , D. E han,
V. Vanhoucke, and A. Rabino ich. Going Deepe wi h Con olu ions. In P oceedings
o he IEEE con e ence on compu e ision and pa e n ecogni ion, pages 1–9, 2015.
[SPVZ13] K. Simonyan, OM Pa khi, A. Vedaldi, and A. Zisse man. Fishe Vec o Faces in he
Wild. In BMVC, olume 2, page 4, 2013.
[SSB14] H. Sak, AW. Senio , and F. Beau ays. Long Sho -Te m Memo y Recu en Neu al
Ne wo k A chi ec u es o La ge Scale Acous ic Modeling. 2014.
[s 20] S eamlink - A CLI u ili y which pipes ideo s eams om a ious se ices in o a
ideo playe . h ps://s eamlink.gi hub.io/, Ma ch 2020.
[SVI+15] C. Szegedy, V. Vanhoucke, S. Io e, J. Shlens, and Z. Wojna. Re hinking he
Incep ion A chi ec u e o Compu e Vision. Decembe 2015.
[SVZ14] K. Simonyan, A. Vedaldi, and A. Zisse man. Lea ning Local Fea u e Desc ip o s
Using Con ex Op imisa ion. IEEE T ansac ions on Pa e n Analysis and Machine
In elligence, 36(8):1573–1585, 2014.
[SWF15] S. Sukhbaa a , J. Wes on, and R. Fe gus. End-To-End Memo y Ne wo ks. In
Ad ances in neu al in o ma ion p ocessing sys ems, pages 2440–2448, 2015.
[SWT15] Y. Sun, X. Wang, and X. Tang. Deeply Lea ned Face Rep esen a ions a e Spa se,
Selec i e, and Robus . In P oceedings o he IEEE con e ence on compu e ision
and pa e n ecogni ion, pages 2892–2900, 2015.
[SZ14] K. Simonyan and A. Zisse man. Ve y Deep Con olu ional Ne wo ks o La ge-Scale
Image Recogni ion. a Xi p ep in a Xi :1409.1556, 2014.
BIBLIOGRAF´
IA 107
[TBF+15] D. T an, L. Bou de , R. Fe gus, L. To esani, and M. Palu i. Lea ning
Spa io empo al Fea u es wi h 3D Con olu ional Ne wo ks. In P oceedings o he
IEEE in e na ional con e ence on compu e ision, pages 4489–4497, 2015.
[TBHN16] S. T ipa hi, S. Belongie, Y. Hwang, and T. Nguyen. De ec ing Tempo ally Consis en
Objec s in Videos Th ough Objec Class Label P opaga ion. In 2016 IEEE Win e
Con e ence on Applica ions o Compu e Vision (WACV), pages 1–9. IEEE, 2016.
[ en20] Tenso low Objec De ec ion API. h ps://gi hub.com/ enso low/models/
blob/mas e / esea ch/objec _de ec ion/README.md, Janua y 2020.
[TLBN16] S. T ipa hi, ZC. Lip on, S. Belongie, and T. Nguyen. Con ex Ma e s: Re ining
Objec De ec ion in Video wi h Recu en Neu al Ne wo ks. a Xi p ep in
a Xi :1607.04648, 2016.
[To 18] J. To es. Deep Lea ning. In oducci´on P ´ac ica con Ke as. Wa ch This Space, 2018.
[Tu 50] AM. Tu ing. Compu ing Machine y and In elligence. Mind, 49:433–460, 1950.
[TYRW14] Y. Taigman, M. Yang, MA. Ranza o, and L. Wol . Deep ace: Closing he Gap
o Human-Le el Pe o mance in Face Ve i ica ion. In P oceedings o he IEEE
con e ence on compu e ision and pa e n ecogni ion, pages 1701–1708, 2014.
[TYRW15] Y. Taigman, M. Yang, MA. Ranza o, and L. Wol . Web-Scale T aining o Face
Iden i ica ion. In P oceedings o he IEEE con e ence on compu e ision and pa e n
ecogni ion, pages 2746–2754, 2015.
[Val20] S. Valda ama. Con usion Ma ix in Objec De ec ion wi h Tenso Flow. Technical
Repo , Gi Hub, Ma ch 2020.
[VBK15] O. Vinyals, S. Bengio, and M. Kudlu . O de Ma e s: Sequence o Sequence o
Se s. a Xi p ep in a Xi :1511.06391, 2015.
[WHM11] L. Wol , T. Hassne , and I. Maoz. Face Recogni ion in Uncons ained Videos wi h
Ma ched Backg ound Simila i y. In CVPR 2011, pages 529–534. IEEE, 2011.
[wid20] Wide Face Da ase o TF Reco d. h ps://gi hub.com/ii zco/
wide ace- o- eco d, Ma ch 2020.
[WR10] AN. Whi ehead and B. Russell. P incipia Ma hema ica. Camb idge Uni e si y
P ess, 1910.
[WZLQ16] Y. Wen, K. Zhang, Z. Li, and Y. Qiao. A Disc imina i e Fea u e Lea ning App oach
o Deep Face Recogni ion. In Eu opean con e ence on compu e ision, pages
499–515. Sp inge , 2016.
[XZLT15] Y. Xiong, K. Zhu, D. Lin, and X. Tang. Recognize Complex E en s om S a ic
Images by Fusing Deep Channels. In Compu e Vision and Pa e n Recogni ion
(CVPR), 2015 IEEE Con e ence on. IEEE, 2015.
[YLLT16] S. Yang, P. Luo, C. Change Loy, and X. Tang. WIDER FACE: A Face De ec ion
Benchma k. In IEEE Con e ence on Compu e Vision and Pa e n Recogni ion
(CVPR), 2016.
[YRZ+17] J. Yang, P. Ren, D. Zhang, D. Chen, F. Wen, H. Li, and G. Hua. Neu al Agg ega ion
Ne wo k o Video Face Recogni ion. In P oceedings o he IEEE con e ence on
compu e ision and pa e n ecogni ion, pages 4362–4371, 2017.
[YSMC15] A. Yao, J. Shao, N. Ma, and Y. Chen. Cap u ing AU-Awa e Facial Fea u es and
Thei La en Rela ions o Emo ion Recogni ion in he Wild. In P oceedings o he
2015 ACM on In e na ional Con e ence on Mul imodal In e ac ion, pages 451–458,
2015.