scieee Science in your language
[es] (orig)

Detección de armas en vídeos digitales

Abstract

Este trabajo ha sido realizado con el propósito de detectar pistolas en vídeos mediante el uso de algoritmos de inteligencia artificial, en concreto, aprendizaje profundo. Está centrado en la detección de pistolas en vídeos, aunque las técnicas usadas se pueden aplicar a cualquier tipo de objetos como drogas, matrículas, caras, personas... Se ha hecho una amplia investigación previa para observar las técnicas y modelos que forman parte del estado del arte, comparando los resultados de los mismos para saber cuáles son los mejores para las necesidades del trabajo. Para la obtención de los mejores resultados, se ha decidido hacer 3 experimentos, en los que se han ido mejorando partes del programa. El primer experimento se centra en elegir el modelo que se va a usar, que finalmente es Faster RCNN con la red neuronal base Inception. El segundo experimento es una mejora incremental en la colección de datos, siendo 4 las mejoras. El tercer experimento son cambios en la configuración del modelo, obteniendo así los parámetros que más se ajustan a la detección de pistolas. En este último experimento se hace también una ampliación sobre la colección de datos, así como un balanceo en las imágenes. Para conseguir este resultado ha sido imprescindible la investigación previa realizada sobre la detección de objetos en el estado del arte. Se ha conseguido mejorar la configuración de un modelo para adaptarlo a la detección de pistolas. Esto ha sido posible gracias al entendimiento de los múltiples parámetros que conforman un modelo. Una de las grandes aportaciones de este trabajo, que puede pasar desapercibida, es la colección de imágenes que se ha generado gracias al etiquetado manual mediante un programa. Esta colección consta de miles de imágenes de gran relevancia para la detección de pistolas ya sea en vídeos o imágenes. Se ha conseguido un programa que detecta pistolas en vídeos con una precisión del 90%, una efectividad del 92% y una exactitud del 91%.

Read accessible full text

Detección de armas en vídeos digitales

Author: Esteve Calzado, Pablo; Mendoza Silva, Alejandro
Year: 2019
Source: https://docta.ucm.es/bitstreams/d73d2a2b-53e2-40c2-a67b-4511a4e6e934/download
De ecci´on de A mas en V´ıdeos Digi ales
T abajo
Fin de G ado
TRABAJO FIN DE GRADO
GRADO EN INGENIER´
IA INFORM´
ATICA
CURSO 2018–2019
PABLO ESTEVE CALZADO
ALEJANDRO MENDOZA SILVA
Di ec o es
Luis Ja ie Ga c´ıa Villalba
Ana Lucila Sando al O ozco
Depa amen o de Ingenie ´ıa del So wa e e In eligencia A i icial
Facul ad de In o m´a ica
Uni e sidad Complu ense de Mad id
Mad id, Junio de 2019
Ag adecimien os
Pablo Es e e Calzado
En p ime a ins ancia me gus a ´ıa ag adece a mis u o es, Ana y Ja ie , la ayuda que
me han dado du an e odo el p oceso de desa ollo del TFG.
Ag adezco a mi compa˜ne o de TFG y g an amigo, ´
Alex, quien ha hecho que el TFG
sea di e ido. Me lle o una g an amis ad con igo.
Ag adezco a mis amigos Pepe, Pelayo, Paimei, No e˜na, D ue , Chemas, Ne o, Ma ´ın,
y muchos m´as, que han es ado en los momen os di ´ıciles y en los momen os elices. Han
hecho en g an medida que sea la pe sona que soy y es a ´e e e namen e ag adecido.
Ag adezco a mi amilia el apoyo incondicional que me han demos ado a lo la go
de oda mi ida. A mi o a ”mad e”, po se la mejo abuela del mundo. A Raya, po
oda la elicidad que me dis e. A mi he mano Al onso, po que siemp e me ha apo ado
pe sepec i as de la ida que nadie m´as me apo a. A mi he mano Jo ge, po que consigui´o
que cambia a mi ida po comple o. A mi pad e, po que me ense˜na que hay muchas
o mas de que e , y ayuda no es siemp e deci lo que se quie e oi . A mi mad e, a quien
le debo odo lo que he conseguido y lo que oy a consegui en la ida, po que me ha
demos ado que la elicidad se consigue con es ue zo.
Quie o ag adece especialmen e a Ca olina odo lo que ha hecho po mi. Me haces se
eliz en odas sus e ien es. Todas las palab as son pocas pa a exp esa los sen imien os
que engo hacia i. Sin i nada hubie a sido posible. Nada. G acias po es a en los
mejo es y en los peo es momen os. Te quiego.
iii
i
Alejand o Mendoza Sil a
Quie o da las g acias en p ime luga a mis pad es. Me si i´o de ayuda la con ianza
que ambos deposi a on hacia mi. Menciona a mi mad e, que me con enci´o de que yo e a
capaz de hace cualquie cosa que me p opusie a. Es o ue un ac o de e minan e y lo
se ´a a lo la go de mi ida an o en mi desa ollo p o esional como pe sonal.
A mi pad e po su inago able ene g´ıa que me p o ey´o de odo lo necesa io pa a
lle a a cabo mis es udios, con su ejemplo de es ue zo y dedicaci´on me mo i o cada d´ıa
a le an a me y pone empe˜no en el desa ollo de mi ca e a. Tambi´en ag adece a m´ı
he mana po su con inua p eocupaci´on po la p og esi´on de mis es udios, sin i ampoco
hubie a sido posible es o.
Menciona a mi compa˜ne o y amigo Pablo, sin i es a a en u a no hab ´ıa sido la
misma, espe o que no sea la ´ul ima y nues os caminos uel an a jun a se.
Ag adece a mis u o es Ana y Ja ie po acep a el e o y uni se con Pablo y conmigo
a es a ama an compleja y no edosa de la in o m´a ica.
Quie o conclui diciendo que an o mi pad e, mi mad e y mi he mana han sido, y
se ´an, mis pila es en es a ida y me es o za ´e pa a hace les sen i o gullosos, pa a que
cada momen o que in i ie on en mi no sea en ano. Os quie o amilia.

´
Indice Gene al
´
Indice de Figu as XI
´
Indice de Tablas XIII
Abs ac XVII
Resumen XIX
1. In oducci´
on 1
1.1. Mo i aci´on .................................... 1
1.2. Con ex o ..................................... 1
1.3. Obje i os y en oque ............................... 2
1.4. Plan de abajo .................................. 3
1.5. Es uc u a de la Memo ia ............................ 5
2. In eligencia A i icial 7
2.1. His o ia de la In eligencia A i icial ....................... 7
2.2. Modelo Neu onal ................................. 9
2.3. Redes Neu onales A i iciales .......................... 10
2.4. En enamien o de las Redes Neu onales A i iciales .............. 10
2.4.1. En enamien o Supe isado ....................... 11
2.4.1.1. En enamien o po Co ecci´on de E o ........... 11
2.4.1.2. En enamien o po Re ue zo ................. 11
2.4.1.3. En enamien o Es oc´as ico .................. 11
2.4.2. En enamien o no Supe isado ..................... 12
2.4.2.1. En enamien o Hebbiano ................... 12
2.4.2.2. En enamien o Compe i i o y Compa a i o ......... 12
2.5. T´ecnicas en la In eligencia A i icial ...................... 12
2.5.1. Ap endizaje Au om´a ico ......................... 12
2.5.2. Ap endizaje P o undo .......................... 13
2.6. In eligencia A i icial s Ap endizaje Au om´a ico s Ap endizaje P o undo . 14
2.7. Visi´on A i icial .................................. 15
2.8. Clasi icaci´on de Obje os ............................. 15
2.9. De ecci´on de Obje os ............................... 16
2.10. T´ecnicas de De ecci´on de Obje os ........................ 17
ii
iii ´
INDICE GENERAL
2.11. Modelos ...................................... 25
2.11.1. De ec o es de una E apa ......................... 25
2.11.1.1. De ec o de Un Solo Vis azo ................. 25
2.11.1.2. Solo Mi as Una Vez ...................... 26
2.11.2. De ec o es de Dos E apas ........................ 28
2.11.2.1. Red Neu onal Con olucional Basada en Regiones ...... 28
2.11.2.2. Red Neu onal Con olucional R´apida Basada en Regiones . 29
2.11.2.3. Red Neu onal Con olucional M´as R´apida Basada en
Regiones ............................ 30
2.11.2.4. LSTM .............................. 31
3. Modelo de De ecci´
on de A mas en V´
ıdeos Digi ales 33
3.1. Colecci´on de Im´agenes .............................. 33
3.1.1. Ca ac e ´ıs icas .............................. 34
3.2. Con igu aci´on del Modelo ............................ 34
3.2.1. Keep Aspec Ra io Resize ....................... 35
3.2.2. Fea u e Ex ac o ............................ 35
3.2.3. Fi s S age Ancho Gene a o ...................... 35
3.2.4. Ini ialize ................................. 36
3.2.5. E apas ................................... 36
3.2.5.1. P ime a E apa ......................... 36
3.2.5.2. Segunda E apa ......................... 37
3.2.6. ROI Polling (Regiones de In e ´es) ................... 38
3.2.7. Op imize ................................. 38
3.2.8. O os Pa ´ame os ............................ 39
3.2.9. En ada de E aluaci´on del En enamien o ............... 40
3.2.10. Con igu aci´on de la E aluaci´on ..................... 40
4. Expe imen aci´
on y Compa a i a 41
4.1. Expe imen o 1 .................................. 42
4.2. Expe imen o 2 .................................. 44
4.2.1. Fas e RCNN con P ime a Colecci´on de Da os ............ 44
4.2.2. Fas e RCNN con Segunda Colecci´on de Da os ............ 44
4.2.3. Fas e RCNN con Te ce a Colecci´on de Da os ............. 44
4.2.4. Fas e RCNN con Cua a Colecci´on de Da os ............. 45
4.2.5. Compa a i a ............................... 45
4.3. Expe imen o 3 .................................. 46
4.3.1. P ime as Con igu aciones ........................ 47
4.3.2. Segundas Con igu aciones ........................ 48
4.3.3. ´
Ul ima Colecci´on de Im´agenes ..................... 50
4.4. Resul ados ..................................... 51
4.4.1. Im´agenes de Ejemplo ........................... 52
´
INDICE GENERAL ix
5. Conclusiones y T abajo Fu u o 55
5.1. Conclusiones ................................... 55
5.2. T abajo Fu u o .................................. 56
6. In oduc ion 57
6.1. Mo i a ion .................................... 57
6.2. Con ex ...................................... 58
6.3. Objec i es and app oach ............................. 58
6.4. Wo k schedule .................................. 59
6.5. S uc u e ..................................... 61
7. Conclusions and Fu u e Wo k 63
7.1. Conclusions .................................... 63
7.2. Fu u e Wo k ................................... 64
8. Apo aciones Indi iduales 65
8.1. Pablo Es e e Calzado .............................. 65
8.2. Alejand o Mendoza Sil a ............................. 67
Bibliog a ´
ıa 69

Abs ac
This wo k has been done wi h he pu pose o de ec ing handguns on ideos using
a i icial in elligence algo i hms, o mo e speci ic, deep lea ning. We ha e ocused on
handgun de ec ion on ideos, e en hough he echniques used a e ele an o any o he
ype o objec like d ugs, pla es, aces, people...
The e was a p e ious wide esea ch o obse e he echniques and models ha a e pa
o he s a e-o - he-a , compa ing hei esul s o know which ones a e he be e o he
needs o his wo k.
Fo ob aining he bes esul s, he e a e 5 expe imen s, whe e he e we e imp o emen s
on each pa o he p og am. The i s expe imen was use ul o choose he bes model
o he p og am, which was he Fas e RCNN wi h he backbone Incep ion. The second
expe imen was an inc emen al imp o emen o he da ase , being ou he numbe
o imp o emen s done in his expe imen . The hi d expe imen we e changes on he
model con igu a ion, ob aining his way he pa ame e s ha be e i ed o he handgun
de ec ion. In his expe imen whe e was also an ex ension o he da ase .
Fo achie ing his esul i has been manda o y he ini ial esea ch ha was done o e
he objec de ec ion on he s a e-o - he-a . The e was an imp o emen in he con igu a ion
o he model adap ing i o he handgun de ec ion. This has been possible hanks o he
unde s anding o he mul iple pa ame e s ha a e pa o he model.
One o he bigges accomplishmen s o his wo k, ha migh go unno iced, is he
da ase ha was gene a ed hanks o he manual labeling done wi hin a p og am. This
da ase consis s o housends o images o g ea ele ance o handgun de ec ion ei he on
ideos o images.
I was achie ed a p og am which de ec s handguns on ideos wi h a p ecision o 90 %,
a ecall o 92 % and an accu acy o 91 %.
Keywo ds: A i icial in elligence, machine lea ning, deep lea ning, compu e ision,
de ec ion, ideos, Fas e RCNN, SSD, YOLO, Incep ion, Da ase .
x ii
Resumen
Es e abajo ha sido ealizado con el p op´osi o de de ec a pis olas en ´ıdeos median e
el uso de algo i mos de in eligencia a i icial, en conc e o, ap endizaje p o undo. Es ´a
cen ado en la de ecci´on de pis olas en ´ıdeos, aunque las ´ecnicas usadas se pueden aplica
a cualquie ipo de obje os como d ogas, ma ´ıculas, ca as, pe sonas. . .
Se ha hecho una amplia in es igaci´on p e ia pa a obse a las ´ecnicas y modelos que
o man pa e del es ado del a e, compa ando los esul ados de los mismos pa a sabe
cu´ales son los mejo es pa a las necesidades del abajo.
Pa a la ob enci´on de los mejo es esul ados, se ha decidido hace 3 expe imen os, en
los que se han ido mejo ando pa es del p og ama. El p ime expe imen o se cen a en
elegi el modelo que se a a usa , que inalmen e es Fas e RCNN con la ed neu onal
base Incep ion. El segundo expe imen o es una mejo a inc emen al en la colecci´on de
da os, siendo 4 las mejo as. El e ce expe imen o son cambios en la con igu aci´on del
modelo, ob eniendo as´ı los pa ´ame os que m´as se ajus an a la de ecci´on de pis olas. En
es e ´ul imo expe imen o se hace ambi´en una ampliaci´on sob e la colecci´on de da os, as´ı
como un balanceo en las im´agenes.
Pa a consegui es e esul ado ha sido imp escindible la in es igaci´on p e ia ealizada
sob e la de ecci´on de obje os en el es ado del a e. Se ha conseguido mejo a la
con igu aci´on de un modelo pa a adap a lo a la de ecci´on de pis olas. Es o ha sido posible
g acias al en endimien o de los m´ul iples pa ´ame os que con o man un modelo.
Una de las g andes apo aciones de es e abajo, que puede pasa desape cibida, es
la colecci´on de im´agenes que se ha gene ado g acias al e ique ado manual median e un
p og ama. Es a colecci´on cons a de miles de im´agenes de g an ele ancia pa a la de ecci´on
de pis olas ya sea en ´ıdeos o im´agenes.
Se ha conseguido un p og ama que de ec a pis olas en ´ıdeos con una p ecisi´on del
90 %, una e ec i idad del 92 % y una exac i ud del 91 %.
Palab as cla e: In eligencia a i icial, ap endizaje au om´a ico, ap endizaje p o undo,
isi´on compu acional, de ecci´on, ´ıdeos, Fas e RCNN, SSD, YOLO, Incep ion, colecci´on
de im´agenes.
xix
Cap´ı ulo 1
In oducci´on
Hoy en d´ıa exis e mucha in o maci´on sin explo a . En es e caso, nos e e imos a la
in o maci´on con enida en ´ıdeos. Se gene a al can idad de con enido digi al, que es
imposible supe isa lo con medios humanos. Es po es o que su ge la necesidad del uso
de ´ecnicas de in eligencia a i icial pa a p ocesa la in o maci´on de o ma masi a.
En es e abajo se a a aplica el AP pa a la de ecci´on de pis olas en ´ıdeos. Se p oba ´an
a ios modelos, y se aplica ´an mejo as sob e el modelo elegido pa a aumen a la de ecci´on.
Pa a pode hace es o se c ea ´a una colecci´on de im´agenes con e ique as indicando d´onde
se encuen an las pis olas den o de la imagen. Se ha ´a es o de o ma manual debido a la
escasez de colecciones de im´agenes de pis olas en in e ne .
1.1. Mo i aci´on
La de ecci´on de a mas en ´ıdeos es una p oblem´a ica que aumen a dia iamen e, ya
que a ec a a la segu idad de las pe sonas. Si bien es un p oblema impo an e, no se
encuen an muchos p og amas que se dediquen exclusi amen e a ello. De las aplicaciones
que se han encon ado las colecciones de im´agenes que usan son escasas y poco ele an es
pa a el obje i o de es e abajo. Exis en ambi´en abajos elacionados con la de ecci´on
de cuchillos en ´ıdeos, pe o no son aplicables a la de ecci´on de pis olas.
Desde luego queda mucho po a anza en el campo de la de ecci´on de a mas en ´ıdeos,
pues o que con los ecien es modelos de de ecci´on de obje os, se puede hace un so wa e
de de ecci´on de a mas que sea m´as p eciso que los an e io es.
1.2. Con ex o
El p esen e T abajo Fin de G ado se enma ca den o de un p oyec o de in es igaci´on
i ulado RAMSES ap obado po la Comisi´on Eu opea den o del P og ama Ma co de
In es igaci´on e Inno aci´on Ho izon e 2020 (Con oca o ia H2020-FCT-2015, Acci´on de
Inno aci´on, N´ume o de P opues a: 700326) y en el que pa icipa el G upo GASS del
Depa amen o de Ingenie ´ıa del So wa e e In eligencia A i icial de la Facul ad de
In o m´a ica de la Uni e sidad Complu ense de Mad id (G upo de An´alisis, Segu idad
y Sis emas, h p://gass.ucm.es, g upo 910623 del ca ´alogo de g upos de in es igaci´on
econocidos po la UCM).
1

2Cap
´
ı ulo 1. In oducci´
on
Adem´as de la Uni e sidad Complu ense de Mad id pa icipan las siguien es en idades:
•T eelogic Telem´a ica y L´ogica Racional pa a la Emp esa Eu opea SL (Espa˜na)
•Minis ´e io da Jus i¸ca (Po ugal)
•Uni e si y o Ken (Reino Unido)
•Cen o Rice che e S udi su Sicu ezza e C iminali `a (I alia)
•Fachhochschule u O en liche Ve wal ung und Rech sp lege in Baye n (Alemania)
•T ila e al Resea ch & Consul ing LLP (Reino Unido)
•Poli ecnico di Milano (I alia)
•Se ice Public Fede al In e ieu (B´elgica)
•Uni e si ¨a des Saa landes (Alemania)
•Di ecci´on Gene al de Polic´ıa - Minis e io del In e io (Espa˜na)
1.3. Obje i os y en oque
El p incipal obje i o de es e abajo es la c eaci´on de un p og ama que sea capaz de
de ec a a mas den o de un ´ıdeo, encuad ando el a ma a lo la go del ´ıdeo. El abajo
se cen a en la de ecci´on de a mas de uego en ´ıdeos median e el uso de ´ecnicas de
in eligencia a i icial (en nues o caso usa emos el algo i mo Fas e RCNN con la ed
neu onal base Incep ion), lo que implica su clasi icaci´on y localizaci´on den o de la imagen.
Es o iene muchas aplicaciones como la p e enci´on de ac os delic i os cuando se aplica
el algo i mo a ´ıdeos de ideo igilancia. De es a o ma se pod ´ıa de ec a un a ma en
una c´ama a de un ae opue o y ale a a las au o idades de d´onde se halla el sospechoso,
qu´e ipo de a ma po a, qui´en es, e c. Tambi´en puede ene o as aplicaciones, como la
e isi´on de ´ıdeos pa a e si con ienen a mas en el mismo, y en qu´e ins an e (al segundo)
del ´ıdeo se localiza el a ma.
Se conside a mas impo an e la p ecisi´on sob e la apidez, ya que no puede pe mi i se
que el so wa e no de ec e una a ma, o que anuncie alsos posi i os cons an emen e.
1.4. Plan de abajo 3
1.4. Plan de abajo
El abajo se di ide en 4 ases: In es igaci´on, implemen aci´on, expe imen aci´on y
documen aci´on. Se p esen an las ac i idades con enidas en cada ase en la siguien e Tabla
1.1:
Tabla 1.1: Plan de abajo
Ta ea Du aci´
on FechaInicio FechaF in
In es igaci´
on 87 01/10/2018 27/12/2018
Es udio de Py hon 20 01/10/2018 21/10/2018
Es udio de Ap endizaje au om´a ico 15 21/10/2018 05/11/2018
Es udio de Ap endizaje p o undo 15 05/11/2018 20/11/2018
Es udio de modelos pa a de ecci´on de obje os 15 20/11/2018 05/12/2018
Lec u a de abajos de in es igaci´on 32 25/11/2018 27/12/2018
Implemen aci´
on 120 20/12/2018 19/04/2019
Clasi icado inicial 7 20/12/2018 27/12/2018
Colecci´on de im´agenes 1 7 27/12/2018 03/01/2019
Colecci´on de im´agenes 2 7 03/01/2019 10/01/2019
Colecci´on de im´agenes 3 10 10/01/2019 20/01/2019
Colecci´on de im´agenes 4 14 20/01/2019 03/02/2019
Con igu aciones 1 25 03/02/2019 28/02/2019
Con igu aciones 2 25 28/02/2019 25/03/2019
Colecci´on de im´agenes 5 25 25/03/2019 19/04/2019
Expe imen aci´
on 128 27/12/2018 04/05/2019
Expe imen o 1 10 27/12/2018 06/01/2019
Expe imen o 2 38 06/01/2019 13/02/2019
Expe imen o 3 15 28/02/2019 04/05/2019
Documen aci´
on 180 20/11/2018 19/05/2019
Res´umenes 30 20/11/2018 20/12/2018
Recopilaci´on in o maci´on 120 20/12/2018 19/04/2019
An´alisis expe imen os 124 06/01/2019 10/05/2019
Redacci´on memo ia 30 19/04/2019 19/05/2019
4Cap
´
ı ulo 1. In oducci´
on
Figu a 1.1: Diag ama de Gan
1.5. Es uc u a de la Memo ia 5
1.5. Es uc u a de la Memo ia
La memo ia del p oyec o es ´a di idida en cap´ı ulos seg´un la ase a la que co esponden,
como a con inuaci´on se acla a:
En el Cap´ı ulo 1 se hace una b e e in oducci´on al p oyec o, as´ı como la mo icaci´on
que lo impulsa.
En el Cap´ı ulo 2 se edac a un ma co e´o ico de la in eligencia a i icial pa a
con ex ualiza el p oyec o.
En el Cap´ı ulo 3 se mues a el Modelo usado en nues o p og ama.
El Cap´ı ulo 4 se compone de a ios expe imen os en los que se ponen a p ueba los
desa ollos que se an haciendo, y se analizan los esul ados pa a sabe en qu´e l´ınea
con inua el desa ollo. Tambi´en se mues an los esul ados que se han ob enido en el
abajo.
El Cap´ı ulo 5 es la conclusi´on del abajo y ambi´en se comen an las posibles mejo as
que pod ´ıa ene .
El Cap´ı ulo 6 es la in oducci´on en ingl´es.
El Cap´ı ulo 5 es la conclusi´on y abajo u u o en ingl´es.
El Cap´ı ulo 8 es el ´ul imo cap´ı ulo, y desc ibe c´ual es el camino que ha lle ado cada
uno de los pa icipan es en el p oyec o. Se explican ambi´en las con ibuciones que ha
apo ado cada uno.
12 Cap
´
ı ulo 2. In eligencia A i icial
2.4.2. En enamien o no Supe isado
El conjun o de ec o es de en enamien o cons a ´unicamen e de ec o es de en ada.
El algo i mo de en enamien o cambia los pesos de la ed neu onal, de al mane a que
p oduzca ec o es de salida consis en es. El p oceso de en enamien o saca las p opiedades
comunes del conjun o de ec o es de en enamien o y ag upa en sec o es los ec o es
pa ecidos.
2.4.2.1. En enamien o Hebbiano
Es un ipo de en enamien o no supe isado. P e ende medi la co elaci´on o ex ae
ca ac e ´ıs icas de los da os in oducidos en la en ada. El undamen o sob e el que se basa
es: si dos neu onas NiyNj ienen el mismo es ado simul ´aneamen e (ac i o o inac i o),
el peso de la conexi´on en e ambas neu onas aumen a.
2.4.2.2. En enamien o Compe i i o y Compa a i o
O o ipo de en enamien o no supe isado es el en enamien o compe i i o y
compa a i o, cuyo obje i o es ´a o ien ado a la clasi icaci´on de los da os que se in oducen
en la en ada. Su p incipal ca ac e ´ıs ica es que si un pa ´on nue o se de e mina que
pe enece a una clase econocida p e iamen e, en onces es e pa ´on ha ´a que se modi ique
la o ma de la clase.
2.5. T´ecnicas en la In eligencia A i icial
Den o de la IA exis en a ias ´ecnicas que ienen dis in os obje i os y me odolog´ıas.
Es as ´ecnicas es ´an englobadas en la IA, po lo que compa en muchas ca ac e ´ıs icas.
2.5.1. Ap endizaje Au om´a ico
El AA es la disciplina cien ´ı ica que pe mi e a un p og ama ap ende a oma
decisiones a pa i de unos da os dados pa a as´ı hace p edicciones. El AA hace uso de
edes neu onales 2.3 pa a hace las p edicciones. Es as edes neu onales oman como
en ada unos alo es, pasan po un de e minado n´ume o de capas, y luego dan como
salida la p edicci´on.
Se le dan cie as eglas al p og ama, en o ma de pesos en la ed neu onal, pa a que
in e p e e los da os de una mane a de e minada, pe o el p og ama puede cambia las
eglas pa a aumen a la p ecisi´on en la p edicci´on. Es e m´e odo acili a las p edicciones,
ya que no es necesa io sabe la l´ogica que iene que segui el p og ama pa a que ´es e
aya mejo ando. Un cla o ejemplo es el il o de spam de los co eos elec ´onicos, ya que
sin ene unas eglas comple as sob e qu´e co eos son spam y cu´ales no, el algo i mo de
p edicci´on a mejo ando con el iempo.
Una de las ca ac e ´ıs icas p incipales del AA es la capacidad de in e p e a unas
ca ac e ´ıs icas dadas pa a saca conclusiones. Es as ca ac e ´ıs icas, que se p opo cionan
como en ada a la ed neu onal, han de se ex a´ıdas po un humano. Es a necesidad
de p opo ciona las ca ac e ´ıs icas, hacen del AA una ´ecnica con cie as des en ajas
espec o al ap endiaje p o undo.

2.5. T´
ecnicas en la In eligencia A i icial 13
Las en ajas del uso del AA espec o de o a ´ecnica de IA es que, al usa edes
neu onales, se le do a al p og ama de la capacidad de ap ende con el iempo. Una cla a
des en aja en cuan o al uso de es a ´ecnica es la capacidad compu acional que equie e
espec o a o as ´ecnicas m´as simples. Es a necesidad de capacidad compu acional iene
dada po el n´ume o de conexiones que se gene an en e las neu onas de la ed, y los
algo i mos que han de se ejecu ados pa a el en enamien o de los pesos de las conexiones
en el en enamien o.
2.5.2. Ap endizaje P o undo
El Ap endizaje P o undo es ´a englobado den o del AA, pe o da un paso m´as. La
ex acci´on de ca ac e ´ıs icas deja de se compe encia de un se humano, y se in oduce
den o de la a qui ec u a de la ed neu onal. Es o hace que la complejidad de la
a qui ec u a aumen e, ya que es necesa io el uso de un mayo n´ume o de capas.
El AP es una o ma de da libe ad a un o denado pa a decidi lo que es y lo que no
es impo an e, ya que la ex acci´on de ca ac e ´ıs icas depende del mismo. En ocasiones
es o es innecesa io, pues las ca ac e ´ıs icas a eces son ´aciles de implemen a . Aun as´ı, en
la mayo ´ıa de casos, el AP pe mi e ob ene esul ados mejo es que los humanos haciendo
uso de su p opia in e p e aci´on de lo que es impo an e y lo que no.
En elaci´on a es e abajo, la di icul ad de ex ae de o ma manual las ca ac e ´ıs icas
de una imagen es demasiado al a, po lo que el uso del AP es casi obliga o io. G acias
al AP no s´olo se a a pode de ec a el obje o, sino que se a a de ec a sin ene que
deci le a la ed neu onal cu´ales son las ca ac e ´ıs icas del obje o de o ma expl´ıci a.
La ob enci´on de las ca ac e ´ıs icas que hacen a una pis ola se una pis ola las ob iene
la ed neu onal median e el en enamien o, que hace a ia los pesos de las conexiones
en e las neu onas de las capas que o man pa e de la ex acci´on de ca ac e ´ıs icas.
La mayo en aja del ap endizaje p o undo espec o al AA es que no necesi a
supe isi´on humana pa a la ex acci´on de las ca ac e ´ıs icas. La des en aja del ap endizaje
p o undo, con mucha di e encia, es la inmensa capacidad compu acional que puede llega
a eque i , dependiendo ambi´en de cu´an so is icada sea la ed neu onal que se use.
14 Cap
´
ı ulo 2. In eligencia A i icial
2.6. In eligencia A i icial s Ap endizaje Au om´a ico s
Ap endizaje P o undo
Es impo an e des aca que el AP es una o ma de lle a a cabo el AA, y que el AA
es ´a englobado den o de la IA, al y como se mues a en la Figu a 2.3.
Figu a 2.3: In eligencia a i icial s ap endizaje au om´a ico s ap endizaje p o undo
Cuando se habla de di e encias en e AA eIA, se quie e hace e e encia a las
ca ac e ´ıs icas que iene que cumpli el AA pa a se lo, y que no iene po qu´e cumpli la
IA. Po ejemplo, el uso de edes neu onales es obliga o io pa a el AA, aunque no lo es en
la IA.
De es a o ma se an a explica las “di e encias” en e IA,AA yAP que se en de
o ma esumida en la Tabla 2.1. Tan o la IA como el AA y el AP ienen como obje i o la
oma de decisiones pa ecidas a un humano. En el AA yelAP es necesa io el uso de edes
neu onales, ya que son la base sob e la que se asien an es as ´ecnicas. Tambi´en en es as
dos ´ecnicas se iene la capacidad de cambia , mien as que en la IA no es algo in ´ınseco.
La ex acci´on de ca ac e ´ıs icas au om´a ica es algo ´unico del ap endizaje p o undo,
que aunque es ´e englobado en la IA y en el AA, s´olo en el AP es necesa io. Debido
a es o, en el AP no se equie e supe isi´on humana, y es o lo “di e encia” de o as ´ecnicas.
Debido a que la ex acci´on de ca ac e ´ıs icas en el AP se hace con una ed neu onal,
y a que se equie en m´as capas ocul as, la complejidad a qui ec ´onica y la capacidad
compu acional eque ida en el AP es necesa iamen e g ande, mien as que en el AA no lo
es necesa iamen e.
2.7. Visi´
on A i icial 15
Tabla 2.1: AI s AA s AP
AI ML DL
Toma decisiones como un humano S´ı S´ı S´ı
Uso de edes neu onales No S´ı S´ı
Capacidad de cambia No S´ı S´ı
Ex acci´on de ca ac e ´ıs icas de o ma au om´a ica No No S´ı
Supe isi´on humana S´ı S´ı No
Complejidad de la a qui ec u a Simple Media Compleja
Requie e al a capacidad compu acional No No S´ı
En la Figu a 2.4 se ense˜na de o ma isual la di e encia que exis e en e el AA yelAP
en cuan o a la ex acci´on de ca ac e ´ıs icas.
Figu a 2.4: Ap endizaje au om´a ico s ap endizaje p o undo
2.7. Visi´on A i icial
Hay un concep o ans e sal al p oyec o, que es la isi´on a i icial. Es e concep o
se e ie e a la capacidad de un o denado de p ocesa una imagen dada, e in e p e a la
pa a saca la ca ac e ´ıs icas undamen ales y ene un en endimien o de lo que ocu e
en la imagen. Usando ´ecnicas de ap endizaje p o undo, las ca ac e ´ıs icas se sacan
“au om´a icamen e” con las capas p o undas, po lo que el uso del ap endizaje p o undo es
lo m´as adecuado pa a es e p oyec o.
2.8. Clasi icaci´on de Obje os
La clasi icaci´on de obje os es un p oblema de isi´on a i icial que consis e en in e p e a
una imagen y decidi a qu´e clase de las p opo cionadas pe enece. Es a es una pa e
undamen al del p oyec o, pues hay que decidi si en un ame de un ´ıdeo hay un obje o
o no, y de habe lo, cu´al es.
Como se puede ap ecia en la Figu a 2.5, la imagen es la en ada de una ed neu onal,
que decide si es un pe a o una manzana.
16 Cap
´
ı ulo 2. In eligencia A i icial
Figu a 2.5: Clasi icaci´on de obje os
Pa a hace clasi icaci´on en un conjun o de im´agenes, se equie e en ena el modelo con
muchas im´agenes e ique adas con la clase a la que pe enecen. La clasi icaci´on puede se
decidi si una imagen pe enece a una clase o no, pe o ambi´en puede se decidi a qu´e clae,
espec o de un conjun o de clases p ede inidas, pe enece. La clasi icaci´on de im´agenes con
m´ul iples clases se puede abo da de a ias o mas, po ejemplo, en un abajo [GN09]
se hace una combinaci´on de las ca ac e ´ıs icas de las clases pa a la clasi icaci´on de las
mismas.
2.9. De ecci´on de Obje os
La de ecci´on de obje os a un paso m´as all´a que la clasi icaci´on de obje os, y
consis e en 2 pa es: Clasi icaci´on yLocalizaci´on. La de ecci´on de obje os iene un
cos e mucho mayo que hace s´olo la clasi icaci´on, ya que no s´olo se calcula a qu´e
clase pe enece una imagen (1 pa ´ame o) sino que ambi´en se calcula la posici´on
en la que se encuen a el obje o den o de la imagen (4 pa ´ame os). Es po es o que
la capacidad necesa ia de p ocesamien o es mucho mayo que o o ipo de ap oximaciones.
La de ecci´on de obje os iene como obje i o no s´olo de ec a de o ma co ec a el
obje o, sino e i a hace alsas de ecciones. Es o iene mayo o meno impo ancia seg´un
el obje i o del p og ama que haga uso de es a ´ecnica. En es e abajo se hace de ecci´on
de pis olas en en o nos de ideos de segu idad y ideo igilancia, po lo que es impo an e
hace la de ecci´on con el meno n´ume o de allos posible.
Hay a ios modelos que es ´an dise˜nados pa a hace la de ecci´on de la o ma m´as e icaz
y e icien e posible, aunque cada uno iene sus ca ac e ´ıs icas. Al se la de ecci´on una
p oblem´a ica que consume muchos ecu sos, muchos modelos se cen an en la apidez en
la de ecci´on, y no an o en la p ecisi´on.
2.10. T´
ecnicas de De ecci´
on de Obje os 17
2.10. T´ecnicas de De ecci´on de Obje os
La aplicaci´on de las ´ecnicas de de ecci´on de obje os m´as conocida es la de ecci´on de
ca as. En es e con ex o, se encuen a el de ec o de ca as Py amidBox [TDHL18]. Es e
de ec o de ca as iene en cuen a el en o no pa a saca conclusiones con mayo p ecisi´on,
supe ando a o os de ec o es de ca a del es ado del a e en benchma ks econocidos como
FDDB [JLM10] y WIDER FACE [YLLT16]. Es mucho mejo que o os cuando la ca a
es peque˜na o cuando la ca a es ´a bo osa en la imagen, ya que el con ex o de la imagen
juega un papel adicional, y consigue mejo a la p ecisi´on.
Como se obse a en la Figu a 2.6, la a qui ec u a del modelo es pi amidal. Es e ipo
de implemen aci´on iene implicaciones en los esul ados de la ed al analiza la imagen.
Figu a 2.6: Py amidBox
O o de ec o , aunque es a ez no es de ca as, es el Re ineDe [ZWB+18]. Es e es
un de ec o de una sola e apa que consis e en 2 m´odulos in e conec ados: el M´odulo de
e inamien o de anclas (ARM po sus siglas en ingl´es) y el M´odulo de de ecci´on de obje os
(ODM po sus siglas en ingl´es).
Pa a conec a un m´odulo con o o, se usan Bloques de ans e encia de conexi´on
(TCB po sus siglas en ingl´es), que con ie en y ans ie en la in o maci´on del ARM al
ODM. Es o se hace pa a educi el espacio en el que se hace la clasi icaci´on y pa a a ina
la localizaci´on y ama˜no de las anclas o cajas.

18 Cap
´
ı ulo 2. In eligencia A i icial
Como se obse a en la Tabla 2.2, los esul ados que se ob ienen con Re ineDe son
muy buenos. Consigue un pun o in e medio (o incluso mejo ) en e la apidez de modelos
como SSD o YOLO y la e icacia de modelos como Fas e -RCNN. O o modelo p opues o
es el YOLO 3 [RF18], que es la ´ul ima e si´on de YOLO. Tiene a ias mejo as sob e el
modelo o iginal, y aho a iene m´as capas, aunque eso no a ec a a la apidez.
Tabla 2.2: Re ineDe
Modelo Red Tama˜
no # Cajas FPS mAP VOC mAP VOC
base en ada 2007 2012
Two s age de ec o s
Fas R-CNN VGG-16 1000 x 600 2000 0,5 70 % 68,4 %
Fas e R-CNN VGG-16 1000 x 600 300 7 73,2 % 70,4 %
OHEM VGG-16 1000 x 600 300 7 74,6 % 71,9 %
Hype Ne VGG-16 1000 x 600 100 0,88 76,3 % 71,4 %
Fas e R-CNN ResNe -101 1000 x 600 300 2,4 76,4 % 73,8 %
One s age de ec o s
YOLO GoogleNe 448 x 448 98 45 63,4 % 57,9 %
SSD300 VGG-16 300 x 300 8732 46 77,2 % 75,8 %
YOLO 2 Da kne -19 544 x 544 1445 40 78,6 % 73,5 %
SSD512 VGG-16 512 x 512 24564 19 79,8 % 78,5 %
Re ineDe 512 VGG-16 512 x 512 16320 24,1 81,8 % 80,1 %
La a qui ec u a del modelo se puede e en la Tabla 2.3. Ya no usa la unci´on So max
pa a p edeci la clase po que gene aba p oblemas en la p edicci´on en cajas en las que
hay a ias clases; aho a se usa una ap oximaci´on mul iclase (bina y c oss-en opy loss).
Incluye ex acci´on de ca ac e ´ıs icas usando 3 escalas dis in as, que es pa ecido a las edes
pi amidales.
Algunos de los esul ados m´as des acables son:
•Misma p ecisi´on media que modelos SSD, pe o 3 eces m´as ´apido (usando COCO).
•El iempo de in e encia es una e ce a pa e del iempo de in e encia de o as edes
de de ecci´on del es ado del a e.
Siguiendo con p opues as de modelo, una de las p opues as de modelo m´as inno ado as
en el es ado del a e es la de Spiking-YOLO [KPNY19]. Es a es una implemen aci´on
de una Red Neu onal de Impulsos. En ez de usa las adicionales edes neu onales
p o undas, se p opone el uso de edes neu onales de impulso. Es e ipo de edes ienen un
ca ´ac e m´as ealis a, y su cos e en iempo es m´as ele ado.
No malmen e es as edes se usaban s´olo pa a la clasi icaci´on, pe o en es e caso se ha
usado pa a la de ecci´on de obje os debido al aumen o de la capacidad compu acional que
hay a medida que pasan los a˜nos. Es el p ime de ec o de obje os que usa es e ipo de
ed ob eniendo esul ados pa ecidos a o os de ec o es del es ado del a e que usan edes
p o undas.
2.10. T´
ecnicas de De ecci´
on de Obje os 19
Tabla 2.3: YOLO 3
Tipo Fil os Tama˜
no Salida
Con olucional 32 3 x 3 256 x 256
Con olucional 64 3 x 3 / 2 128 x 128
Con olucional 32 1 x 1
1x Con olucional 64 3 x 3
Residual 128 x 128
Con olucional 128 3 x 3 / 2 64 x 64
Con olucional 64 1 x 1
2x Con olucional 128 3 x 3
Residual 64 x 64
Con olucional 256 3 x 3 / 2 32 x 32
Con olucional 128 1 x 1
8x Con olucional 256 3 x 3
Residual 32 x 32
Con olucional 512 3 x 3 / 2 16 x 16
Con olucional 256 1 x 1
8x Con olucional 512 3 x 3
Residual 16 x 16
Con olucional 1024 3 x 3 / 2 8 x 8
Con olucional 512 1 x 1
4x Con olucional 1024 3 x 3
Residual 8 x 8
A gpool Global
Connec ed 1000
So max
Figu a 2.7: Spiking-YOLO
En la Figu a 2.7 se e la no malizacion seg´un el canal que se p opone; p ime o los
pesos se no malizan con la m´axima ac i aci´on de cada canal pa a ene ac i aciones
no malizadas, despu´es se mul iplica po λl−1las ac i aciones no malizadas pa a ob ene
de nue o las ac i aciones o iginales.
20 Cap
´
ı ulo 2. In eligencia A i icial
Adem´as de modelos, hay ambi´en p opues as de mejo a de modelos, como es el caso
de la De ecci´on con sem´an ica en iquecida [ZQX+18]. Es una mejo a sob e los modelos de
de ecci´on de obje os. Como se e en la Figu a 2.8, la a qui ec u a cambia y se le aplican
mejo as que consis en en a˜nadi una ama de segmen aci´on sem´an ica y un m´odulo de
ac i aci´on global, lo que hace mejo a los esul ados en la de ecci´on.
Figu a 2.8: De ec ion wi h En iched Seman ics
En es e caso usan el modelo SSD como base, y aplican el m´odulo de segmen aci´on y
el m´odulo de ac i aci´on global pa a hace mejo as sem´an icas a bajo ni el y mejo as en
las capas de de ecci´on de al o ni el espec i amen e.
O o ipo de mejo a sob e el SSD es la que se p opone en [XZYA18], que su ge de
la necesidad de mejo a la p ecisi´on del modelo SSD en los obje os peque˜nos, ya que los
de ec o es de una sola e apa ienen m´as p oblemas pa a de ec a los obje os de meno
ama˜no. Es e modelo demues a que, usando la in o maci´on que el con ex o p opo ciona,
se mejo a sus ancialmen e la e icacia de la de ecci´on.
Figu a 2.9: Con ex awa e single sho de ec o
2.10. T´
ecnicas de De ecci´
on de Obje os 21
Como se e en la Figu a 2.9, es a mejo a p opone el uso de una ed base VGGNe
sob e la que se aplican capas con olucionales adicionales a las de SSD, que si en como
en ada pa a las capas de p edicci´on. La salida de es as capas de p edicci´on son la en ada
de las capas de con ex o, que son la mejo a de la p opues a. Los esul ados de aplica es e
modelo dan un 3,2 % de mejo a en la p ecisi´on media en los obje os peque˜nos compa ado
con el ´ul imo modelo SSD, man eniendo la elocidad de p ocesamien o.
O a de las posibles mejo as aplicadas a SSD es la que se p opone en [KSL+19],
que consis e en ealiza una mejo a consis en e sob e el modelo SSD. Se en oca en hace
coincidi las hip´o esis de en enamien o y la calidad de in e encia u ilizando los anclajes
e inados du an e el en enamien o.
Tabla 2.4: Consis en Op imiza ion
Modelo Red base AP AP50 AP75 APSAPMAPL
Two s age
Fas e R-CNN ResNe -101 34.9 55.7 37.4 15.6 38.7 50.9
Mask R-CNN ResNe -101 88.2 60.3 41.7 20.1 41.1 50.2
One s age
SSD513 ResNe -101 31.2 50.4 33.3 10.2 34.5 49.8
YOLO 2 Da kne -19 21.6 44.0 19.2 5.0 22.4 35.5
YOLO 3 Da kne -53 33.0 57.9 34.4 18.3 35.4 41.9
Re ineDe 512 ResNe -101 36.4 57.5 39.5 16.6 39.9 51.4
ConRe inaNe ResNe -101 40.1 59.6 43.5 23.4 44.2 53.3
Los esul ados de aplica la op imizaci´on en el modelo SSD con Re inaNe sob e
COCO son isibles en la Tabla 2.4. Mejo a la p ecisi´on media de 39.1 % a 40.1 %.
Hay ambi´en p opues as de mejo as de o os modelos, como la que se p opone en
Complex-YOLO [SMAG18]. Es una ed de de ecci´on de obje os basada en YOLO 2 que
se cen a en la de ecci´on de obje os en un en o no 3D (aplicable a eh´ıculos, ealidad
aumen ada, obo s. . . ).
Consis e en una Red de P opues as de Regi´on de Eule espec´ı ica (E-RPN) pa a es ima
la pos u a del obje o ag egando una acci´on imagina ia y eal a la ed de eg esi´on.
28 Cap
´
ı ulo 2. In eligencia A i icial
Como el modelo ap ende a p edeci cajas delimi ado as a pa i de da os, le cues a
gene aliza con obje os con un nue o o inusual a io de apa iencia o con igu aci´on.
Finalmen e, cuando se en ena con una unci´on de p´e dida que mejo a el endimien o
de de ecci´on, la unci´on de p´e dida a a e o es po igual en cajas peque˜nas y cajas
g andes. Un peque˜no e o en una caja g ande, no es signi ica i o, pe o un e o
peque˜no en una caja peque˜na, iene un e ec o mayo .
La p incipal uen e de e o es en YOLO son las localizaciones inco ec as.
2.11.2. De ec o es de Dos E apas
Los de ec o es de dos e apas se sal an la ase de b´usqueda de RoI y alimen a la ed
di ec amen e con la imagen.
2.11.2.1. Red Neu onal Con olucional Basada en Regiones
El modelo Red neu onal con olucional basada en egiones, o RCNN po sus siglas en
ingles (Region-based con olu ional neu al ne wo k) es un de ec o de dos e apas. Pa a
sol en a el p oblema de selecciona un g an n´ume o de egiones, Ross Gi shik [GDDM14]
p opuso un m´e odo donde se usa una b´usqueda selec i a pa a ex ae 2000 egiones de
una imagen, y las llam´o p opues as de egi´on. Usando es e m´e odo, en ez de ex ae
much´ısimas p opues as, abajas con 2000 p opues as de egi´on exac amen e. El algo i mo
de b´usqueda selec i a es el siguien e:
•Se gene an sub-segmen aciones iniciales ( egiones candida as).
•Usa el algo i mo g eedy pa a combina de o ma ecu si a egiones simila es en
egiones m´as g andes.
•Usa las egiones gene adas pa a p oduci las p opues as de egi´on inales.
Es as 2000 p opues as de egi´on se jun an y se me en en una ed neu onal con olucional
que p oduce un ec o de ca ac e ´ıs icas de 4096 dimensiones como salida. La ed neu onal
con olucional ac ´ua como un ex ac o de ca ac e ´ıs icas.

2.11. Modelos 29
Figu a 2.16: RCNN
Es as ca ac e ´ıs icas se in oducen como en ada a una M´aquina ec o ial de sopo e,
o SVM po sus siglas en ingl´es (suppo ec o machine), pa a clasi ica la p esencia
de obje os den o de la p opues a de egi´on, como se e en la Figu a 2.16. Adem´as de
p edeci la p esencia de un obje o en las p opues as de egi´on, el modelo p edice ambi´en
4 alo es que dicen la posici´on y ama˜no de la caja pa a aumen a la p ecisi´on de la caja
delimi ado a.
P oblemas con RCNN:
•Consume mucho iempo en en ena la ed po que clasi ica 2000 p opues as de egi´on
po cada imagen.
•No puede se implemen ado en iempo eal ya que a da unos 47 segundos po cada
imagen de es .
•El algo i mo de b´usqueda selec i a es un algo i mo ijado. Po lo an o, no hay
ap endizaje en esa pa e, y pod ´ıa desencadena malas p opues as de egi´on.
2.11.2.2. Red Neu onal Con olucional R´
apida Basada en Regiones
El modelo Red neu onal con olucional ´apida basada en egiones, o Fas RCNN po
sus siglas en ingl´es (Fas Region-based Con olu ional Neu al Ne wo k), usa como base el
algo i mo RCNN mos ado en el apa ado an e io , pe o con di e encias y mejo as que se
explican a con inuaci´on.
En ez de gene a una pi ´amide de capas, Fas RCNN de o ma las egiones de in e ´es
en una sola capa usando RoI pooling. El RoI pooling usa Max pooling pa a con e i las
ca ac e ´ıs icas con enidas en una egi´on de in e ´es en un mapa de ca ac e ´ıs icas peque˜no
de dimensiones HxW .
30 Cap
´
ı ulo 2. In eligencia A i icial
Figu a 2.17: Fas RCNN
Se puede deci que Fas RCNN es un caso especial de SPPNe , pe o en ez de usa
m´ul iples capas, Fas RCNN usa solo una. Es o se puede e cla amen e en la Figu a
2.17. Es a capa alimen a a un ed comple amen e conec ada pa a la clasi icaci´on usando
eg esi´on lineal y so max. La caja delimi ado a es despu´es e inada con eg esi´on lineal.
En Fas RCNN, odos los pa ´ame os den o de la ed neu onal con olucional pueden
se en enados jun os. Es os pa ´ame os se en enan jun os con una unci´on loga ´ı mica
de p´e dida de la clasi icaci´on de clase y con una unci´on de p´e dida L1 de la p edicci´on de
la caja delimi ado a.
2.11.2.3. Red Neu onal Con olucional M´
as R´
apida Basada en Regiones
El modelo Red neu onal con olucional m´as ´apida basada en egiones, o Fas e RCNN
po sus siglas en ingl´es (Fas e Region-based Con olu ional Neu al Ne wo k), es ´a basado
en el modelo Fas RCNN que se explica en el apa ado an e io . A con inuaci´on se
explican di e encias y mejo as espec o al mismo.
Tan o el modelo RCNN como el Fas RCNN usan la b´usqueda selec i a pa a ob ene
las p opues as de egi´on. Es a b´usqueda es muy len a y consume mucho iempo, a ec ando
al endimien o de la ed. Po es o, Shaoqing Ren p opuso usa una ed con olucional que
si ie a pa a hace las p opues as de egi´on, aho ando as´ı mucho iempo y mejo ando la
e iciencia del modelo, que se puede obse a en la Figu a 2.18.
La di e encia en e Fas RCNN y Fas e RCNN es que no se usa un m´e odo de
p opues as de egi´on pa a c ea las p opues as de egi´on. En ez de eso, se en ena una
ed de p oposici´on de egiones que coge los mapas de ca ac e ´ıs icas como en ada, y da
como salida las p opues as de egi´on. Es as p opues as alimen an la capa RoI pooling en
la Fas RCNN.
2.11. Modelos 31
Figu a 2.18: Fas e RCNN
2.11.2.4. LSTM
Es e modelo es ´a englobado en las a qui ec u as ecu en es, que se basan en pode
accede a in o maci´on del pasado, y no solo a la del p esen e. Es o pe mi e a es e ipo de
edes oma mejo es decisiones eniendo en cuen a las omadas en el pasado.
La p incipal idea de la a qui ec u a de es e modelo, como se e en la Figu a 2.19, es
el uso de una celda de memo ia que man iene su es ado a lo la go del iempo, y unidades
de acceso no lineales que egulan el lujo de in o maci´on hacia den o y hacia ue a de la
celda de memo ia. Los ´ul imos es udios a˜naden nue as mejo as a la a qui ec u a LSTM
o iginal [HS95] [HS97].
Figu a 2.19: LSTM
32 Cap
´
ı ulo 2. In eligencia A i icial
La impo ancia del modelo LSTM es que es un modelo que usa una ed neu onal
ecu en e, lo que implica que los hechos sucedidos en el pasado se ienen en cuen a en
el u u o. Es po es o que son muy in e esan es a la ho a de a a con ´ıdeos o con
p oblem´a icas como la in e p e aci´on de oz a ex o. Sin emba go, al se de ecien e
c eaci´on, no es ´a bien documen ada, y oda ´ıa no es ´a bien aplicada en ´ıdeos. Adem´as,
la capacidad de p ocesamien o que equie e es demasiado al a pa a pode e esul ados
con la capacidad de compu aci´on disponible pa a la ealizaci´on de es e abajo.
Cap´ı ulo 3
Modelo de De ecci´on de A mas en
V´ıdeos Digi ales
Es e abajo se compone de dos pa es bien di e enciadas: La colecci´on de im´agenes y
el modelo. A con inuaci´on se mues a c´omo es ´an o madas es as dos pa es, explicando
en p o undidad las ca ac e ´ıs icas de cada una de ellas.
3.1. Colecci´on de Im´agenes
Una colecci´on de im´agenes es un conjun o de im´agenes con sus e ique as asociadas,
en es e abajo, las e ique as indican la posici´on y la clase del obje o den o de la imagen.
La colecci´on de im´agenes se usa pa a en ena y pa a es ea el modelo.
En es e abajo la colecci´on de im´agenes se di ide siemp e en la p opo ci´on 80-20
pa a en enamien o-p uebas. Se elige es a p opo ci´on ya que es la m´as ecomendada
pa a no malgas a muchas im´agenes en las p uebas, pe o que pe mi a al p og ama saca
conclusiones de los esul ados de la misma.
Las ca ac e ´ıs icas que hacen de una colecci´on de im´agenes se buena son las siguien es:
•Tene muchas im´agenes.
•Tene muchos escena ios a iados en los que se usan las a mas.
•Que haya muchas posiciones dis in as de las a mas.
•Que haya m´as o menos la misma can idad de im´agenes po escena io.
•Que haya m´as o menos la misma can idad de im´agenes po posici´on.
•Que las im´agenes engan de ´ıdeos pa ecidos a los que se an a usa pa a la de ecci´on.
•Que la can idad de im´agenes con a ma, y sin a ma sea balanceada.
33

34 Cap
´
ı ulo 3. Modelo de De ecci´
on de A mas en V
´
ıdeos Digi ales
3.1.1. Ca ac e ´ıs icas
La colecci´on de im´agenes que se u iliza con iene im´agenes que se han adqui ido y que
se han c eado a lo la go del segundo expe imen o, y de una pa e del e ce expe imen o.
La colecci´on de im´agenes cons a de 1200 im´agenes de pis olas seleccionadas de una
colecci´on de 3000 im´agenes. 120 im´agenes de pis olas siendo usadas en el con ex o que se
necesi a. Fo og amas ele an es de 9 ´ıdeos de a acos. Fo og amas ele an es de ´ıdeos
case os hechos pa a mejo a la de ecci´on.
Fo man ambi´en pa e del da ase muchas im´agenes sin pis ola has a llega a la
p opo ci´on 50-50 de Pis ola-No pis ola.
3.2. Con igu aci´on del Modelo
El modelo se compone de 3 edes neu onales. La p ime a ed se enca ga de la
ex acci´on de ca ac e ´ıs icas. Es a ed es la ed neu onal base, que en es e caso es la
Incep ion. La segunda y e ce a ed pe enecen a Fas e RCNN. Fas e RCNN se di ide en
es as dos edes en las que la p ime a ed iene como obje i o c ea egiones de p opues a,
o lo que es lo mismo, localiza el obje o de in e ´es, y la segunda ed se enca ga de la
clasi icaci´on de cada egi´on p opo cionada po la ed an e io . En la Figu a 3.1 se e un
esquema del modelo comple o.
La ed neu onal base Incep ion, es ´a compues a po 467 capas, cuya unci´on es ex ae
las ca ac e ´ıs icas de la imagen de en ada. La mayo ´ıa de ellas sigue el esquema: 6 x con 2d
-me ge -max pooling2d -con 2d -me ge -ba ch no maliza ion -ac i a ion. Es e esquema
se epi e 43 eces, ambi´en se a˜naden o as capas como lambda,a e age pooling2d,d opou ,
la en ydense. La in o maci´on comple a ace ca de es a ed se encuen a en [Maj19].
Figu a 3.1: Modelo comple o
Adem´as del modelo, que se explica en el apa ado 2.11.2.3, es muy impo an e
con igu a lo pa a adap a lo lo mejo posible a la de ecci´on del obje o que se desee. La
con igu aci´on de los modelos puede a ia , y es in e esan e hace lo pues dependiendo del
ipo de obje os a de ec a , unos pa ´ame os son mejo es que o os. En es e caso, que se
quie e de ec a pis olas, se an a busca los alo es pa a los pa ´ame os de la con igu aci´on
que mejo se adap en al p og ama.
3.2. Con igu aci´
on del Modelo 35
3.2.1. Keep Aspec Ra io Resize
Es e pa ´ame o si e pa a el cambio de ama˜no en las imagenes. Pa a que las
imagenes esul an es siemp e engan la misma elaci´on de aspec o. Con min dimension se
especi ica el ama˜no del bo de m´as peque˜no pe mi ido y con max dimension el m´aximo
pe mi ido. El da ase UCM - Pis olas se compone gene almen e po im´agenes de 848 x
480. Si se quie e ajus a es as im´agenes con al u a 600, se iene que calcula la dimension
m´axima as´ı: 848∗600
480 = 1060. Po lo que max dimension end ´a el alo 1060.
3.2.2. Fea u e Ex ac o
Con es e pa ´ame o de con igu aci´on se especi ica en p ime luga qu´e ipo de ex ac o
o ed neu onal base se escoge ´a pa a el modelo median e ype.
El pa ´ame o con igu able se a a del i s s age ea u es s ide, que signi ica cu´an o
a a p o undiza , hablando en ´e minos de con oluci´on, pa a ex ae las ca ac e ´ıs icas.
Po las compa a i as ealizadas 4.1, se decidi´o usa la ed neu onal base Incep ion
[SVI+16], que es un ed o mada po a ias capas con olucionales consecu i as de 55,
33 y max-pool de o ma con inuada. Se necesi a que la ed p o undice en ´e minos de
con oluci´on pa a ex ae las ca ac e ´ıs icas po lo que i s s age ea u es s ide se
es ableci´o en 16.
Se ha op ado po el op imizado l2, ya que disminuye los coe icien es y es o minimiza
el e ec o de co elaci´on de en ada y hace que el modelo gene alice mejo . Es o es muy
impo an e en un de ec o de a mas dada la di e sidad de escena ios en el que a a se
expues o.
3.2.3. Fi s S age Ancho Gene a o
Los cuad os de anclaje se u ilizan en modelos de de ecci´on pa a ayuda a iden i ica
obje os de di e en es o mas. Pa a ello median e g id ancho gene a o se puede
modi ica opciones como:
Scales: se de inen pa a usa un conjun o de escalas expl´ıci amen e de inido.
Aspec a ios: Relaci´on de aspec os pa a los cuad os de anclajes en cada pun o de
ejilla. Es o es un a ibu o de p oyecci´on de imagen que desc ibe la elaci´on p opo cional
en e el ancho de una imagen y su al u a.
Heigh s ide: La al u a de pixeles pa a cada cuad o de anclaje.
Wid h s ide: La anchu a de p´ıxeles pa a cada cuad o de anclaje.
36 Cap
´
ı ulo 3. Modelo de De ecci´
on de A mas en V
´
ıdeos Digi ales
3.2.4. Ini ialize
Se u iliza el inicializado unca ed no mal ini ialize ya que gene a n´ume os
alea o ios cuya media es ce cana al 0. El alo de i s s age max p oposals se
ajus a, ya que no se quie e que haya demasiadas p opues as a e alua en el modelo. Po
an o se asigna el alo 150. No se u iliza d opou ya que la ed no es a en iesgo de
sob ealimen aci´on.
Se ajus an los alo es max de ec ions pe class ymax o al de ec ions po ene
s´olo una clase y no se quie e que haya un sob ep ocesamien o. Se pone, po an o, los
alo es 50 y 150 espec i amen e. Se u iliza la unci´on Sigmoide ya que So max es
u ilizado pa a clasi icaciones mul iclase.
3.2.5. E apas
Fas e RCNN se compone de dos edes, la p ime a p opone egiones en las cuales se
puede encon a obje os (RPN). La segunda ed in en a de ec a obje os en las p opues as
dadas po la p ime a. Po con enci´on a la p ime a ed se le denomina i s s age y a la
segunda second s age.
3.2.5.1. P ime a E apa
Pa ´ame os pa a la p ime a e apa:
• i s s age nms sco e h eshold: El umb al de pun uci´on de no sup esi´on
m´axima.
• i s s age nms iou h eshold: El umb al de IOU sin sup esi´on m´axima.
• i s s age max p oposals: El m´aximo de p opues as pe mi idas pa a la p ime a
ed.
• i s s age localiza ion loss weigh : Fac o de Pe dida de peso po localizaci´on.
• i s s age objec ness loss weigh : Fac o de p´e dida de peso obje i o.
El umb al de no sup esi´on m´axima se u iliza pa a e i a que los cuad os de anclaje
delimi ado es se supo pongan se˜nalando el mismo obje o. Pa a que no exis an a ias
de ecciones sob e un mismo obje i o.
El ´ındice de Jacca d mide el g ado de simili ud en e dos conjun os.
T=Nc
Na +Nb +Nc
Na =Elemen osA
Nb =Elemen osB
Nc =Elemen osIn e cep ados
Umb al IOU: du an e el en enamien o se p ocede a jun a el cuad o eal con el
p edicho sob e in e secci´on sob e uni´on que es el ´ındice de Jacca d. Los mejo es cuad os
se e ique a an como posi i os si es ´an po encima del umb al IOU.
3.2. Con igu aci´
on del Modelo 37
3.2.5.2. Segunda E apa
mask cnn box p edic o Se enca ga de p edeci clases; opcionalmen e pe mi e la
p edicci´on de m´asca as o pun os cla e den o de las cajas de de ecci´on.
Los pa ´ame os de con igu aci´on del mismo son los siguien es:
use d opou : Gene almen e se u iliza cuando la ed es a en iesgo de
sob ealimen aci´on, es deci cuando la ed es demasiado g ande, en enas du an e mucho
iempo o si no ienes su icien es da os. Como se e en la Figu a 3.2, se desac i an neu onas
de o ma alea o ia.
Figu a 3.2: D opou
Se ecomienda no u iliza el d opou , debido a las elaciones codi icadas en los mapas
de ca ac e ´ıs icas, las ac i aciones pueden se al amen e co elacionadas. Ac ualmen e se
u iliza ba ch no maliza ion pa a es abiliza la ed neu onal.
d opou keep p obabili y: Se u iliza pa a calcula si la neu ona end a dese ci´on o
no, es deci , se calcula la con ibuci´on de cada neu ona con la p obabilidad que se indica
en es e pa ´ame o.
Regulize : Cuando se u ilizan egula izado es, ´es os ac uan de mane a que e i an
el sob eajus e (o e i ing), sua izando los esul ados. E i ando que la m´aquina in en e
adap a se lo m´aximo posible a los da os de en anamien o, ya que no da abs acci´on
a sus p edicciones, se ienen que consegui esul ados lo m´as gen´e icos posibles. Es ´an
disponibles los siguien es:
•L1 egula ize Ag ega el alo absolu o del coe icien e de peso como ´e mino a la
unci´on de pe dida.
•L2 egula ize Ag ega el cuad ado del coe icien e de peso como ´e mino de
penalizaci´on en la unci´on de p´e dida.
La unci´on de p´e dida mide con los esul ados de las p edicciones y la espues a
co ec a que an buenas son las p edicciones. Exis en a ias unciones de pe dida como el
e o cuad ´a ico medio o la en op´ıa c uzada.
El e o cuad ´a ico medio MSE, es la media de la di e encia en e los pun os eales y
la salida p edicha al cuad ado. Es e m´e odo penaliza las di e encias mayo es.
44 Cap
´
ı ulo 4. Expe imen aci´
on y Compa a i a
4.2. Expe imen o 2
El obje i o de es e expe imen o es consegui una colecci´on de im´agenes que p opo cione
los mejo es esul ados posibles. po ello, a lo la go del expe imen o se i ´an haciendo mejo as
con inuas sob e cada una de las colecciones de im´agenes, mos ando en cada mejo a los
esul ados que se ob ienen.
Se usa el modelo Fas e RCNN + Incep ion en odos los expe imen os en adelan e debido
a que p opo ciona los mejo es esul ados, como se demues a en el an e io expe imen o
4.1.
4.2.1. Fas e RCNN con P ime a Colecci´on de Da os
En in e ne hay a ias colecciones de im´agenes de a mas. ´
Es as con ienen im´agenes de
a ios ipos de a mas en posiciones a iadas, pe o en la mayo ´ıa de eces no es ´an siendo
usadas po nadie y simplemen e es ´an expues as.
La p ime a colecci´on de im´agenes que se decide hace consis e en una colecci´on de im´agenes
[dG19] de 3000 a mas que se usa en muchos p og amas de de ecci´on de a mas y una
colecci´on de im´agenes de cuchillos de 1000 im´agenes.
4.2.2. Fas e RCNN con Segunda Colecci´on de Da os
Los esul ados de la colecci´on de da os 4.2.1 son muy malos, al como se puede obse a
en la Tabla 4.2 debido a que las im´agenes de la colecci´on de im´agenes no se asemejan a
las im´agenes de los ´ıdeos que se usan pa a hace las de ecciones ( ´ıdeos de c´ama as de
ideo igilancia o pa ecido).
Es os esul ados demues an que hab´ıa que inclui im´agenes en las que apa ezcan las
pis olas siendo usadas. Pa a ello se coge o a colecci´on de im´agenes de in e ne que con iene
120 im´agenes que ienen elaci´on con el ipo de ´ıdeos que an a se usados po el p og ama.
Se deja de usa la clase de cuchillos, y se usan exclusi amen e im´agenes de una sola clase
pa a op imiza el en enamien o del modelo.
4.2.3. Fas e RCNN con Te ce a Colecci´on de Da os
T as comp oba los esul ados se decide hace una colecci´on de im´agenes case a de
pis olas cogiendo los o og amas de 3 ´ıdeos, y con un p og ama llamado “OpenLabeling”
[Ca 19] se decide hace una po una las e ique as de odos los o og amas de los 3 ´ıdeos.
Se jun a la nue a colecci´on de im´agenes con la colecci´on de im´agenes an e io , y se decide
en ena de nue o el modelo.

4.2. Expe imen o 2 45
4.2.4. Fas e RCNN con Cua a Colecci´on de Da os
Los esul ados de la colecci´on de im´agenes 4.2.3 son mejo es que los de la colecci´on
4.2.2, al y como se obse a en la Tabla 4.2, pe o siguen sin se buenos po las siguien es
azones:
•La can idad de im´agenes que se cogen de los ´ıdeos es mucho mayo a la que se
iene en las o as colecciones de im´agenes, po lo que la colecci´on de im´agenes es ´a
desp opo cionada.
•Al usa s´olo 3 ´ıdeos no se consigue en ena el modelo pa a una a iedad amplia de
si uaciones, y s´olo se hacen de ecciones en si uaciones cuyo con ex o es muy pa ecido
al de los ´ıdeos.
•Se cogen odos los o og amas de los ´ıdeos, y al habe muchos o og amas po
segundo, la di e encia en e o og amas es m´ınima, y no apo a in o maci´on ´u il
ene 15 o og amas casi iguales.
Teniendo oda es a in o maci´on se decide hace una colecci´on de im´agenes, que consis e
de:
•La p ime a colecci´on de im´agenes (s´olo las pis olas) se some e a un il ado de
im´agenes una po una y se eliminan las im´agenes que se conside a que no ienen
ele ancia y no apo an bene icios al en enamien o. (1200 im´agenes).
•La segunda colecci´on de im´agenes.
•Las im´agenes de los 3 ´ıdeos se some en al mismo il ado que el p ime o, pa a e i a
im´agenes epe idas que a ec en al en enamien o.
•Se seleccionan 30 nue os ideos de los cuales se cogen los 6 m´as ele an es y se oman
las im´agenes m´as ele an es y se e ique an.
4.2.5. Compa a i a
Como se obse a en la Tabla 4.2 y en la Figu a 4.2, cada colecci´on de im´agenes a ec a
a la e icacia del modelo. Sin duda, la mejo colecci´on de im´agenes es la ´ul ima, que es la
que se decide usa pa a hace el siguien e expe imen o 4.3.
Compa aci´on 4.2: Expe imen o 2
Colecci´
on 1 Colecci´
on 2 Colecci´
on 3 Colecci´
on 4
P ecisi´on 24 % 54 % 59 % 61 %
E ec i idad 21 % 48 % 71 % 84 %
Exac i ud 27 % 53 % 61 % 66 %
Ve dade o Posi i o 21 48 71 84
Ve dade o Nega i o 33 59 51 48
Falso Posi i o 67 41 49 52
Falso Nega i o 79 52 29 16
FPS 0,5 0,5 0,5 0,5
46 Cap
´
ı ulo 4. Expe imen aci´
on y Compa a i a
(a) Colecci´on de da os 1 (b) Colecci´on de da os 2
(c) Colecci´on de da os 3 (d) Colecci´on de da os 4
Figu a 4.2: Expe imen o 2
4.3. Expe imen o 3
En es e expe imen o se lle an a cabo cambios en la con igu aci´on del modelo. Se
modi ican los pa ´ame os que a ec an al modelo, al y como se explica en el apa ado
3.2.
Es e expe imen o cons a de es pa e. P ime o se ealizan 3 con igu aciones dis in as
4.3.1, pa iendo de la p ede e minada que o ece el modelo. Despu´es se ealizan 3 nue as
con igu aciones 4.3.2 pa iendo de la mejo con igu aci´on de la p ime a pa e. Po ´ul imo,
se ealiza una mejo a 4.3.3 a la colecci´on de da os, y se usa la mejo con igu aci´on.
4.3. Expe imen o 3 47
4.3.1. P ime as Con igu aciones
Se aplican lige os cambios en la con igu aci´on del modelo, pa a as´ı in en a mejo a los
esul ados que se ob ienen en la de ecci´on de pis olas. Es posible que una con igu aci´on
sea buena pa a la de ecci´on de un ipo de obje os, pe o no pa a la de ecci´on de o os.
Es po es o que se in en an peque˜nos cambios pa a e de qu´e o ma mejo a la de ecci´on
aplicando los cambios.
(a) Con igu aci´on 1 (b) Con igu aci´on 2
(c) Con igu aci´on 3
Figu a 4.3: Expe imen o 3a
48 Cap
´
ı ulo 4. Expe imen aci´
on y Compa a i a
Compa aci´on 4.3: Expe imen o 3a
Con igu aci´
on 1 Con igu aci´
on 2 Con igu aci´
on 3
P ecisi´on 66 % 71 % 76 %
E ec i idad 78 % 90 % 90 %
E ec i idad 69 % 77 % 81 %
Ve dade o Posi i o 78 90 90
Ve dade o Nega i o 60 64 72
Falso Posi i o 40 36 28
Falso Nega i o 22 10 10
FPS 0,5 0,5 0,5
4.3.2. Segundas Con igu aciones
En es a segunda pa e del expe imen o 3, se analizan los esul ados de la p ime a
pa e del expe imen o, y se deciden eajus a los pa ´ame os de la con igu aci´on 3, pa a
as´ı ob ene mejo es esul ados. Como se obse a en la Tabla 4.4 y en la Figu a 4.4, la
con igu aci´on 4 es la que mejo es esul ados p opo ciona se puede e explicada en el
apa ado 3.2.
Compa aci´on 4.4: Expe imen o 3b
Con igu aci´
on 4 Con igu aci´
on 5 Con igu aci´
on 6
P ecisi´on 87 % 85 % 84 %
E ec i idad 91 % 89 % 92 %
Exac i ud 89 % 89 % 87 %
Ve dade o Posi i o 91 89 92
Ve dade o Nega i o 87 84 82
Falso Posi i o 13 16 18
Falso Nega i o 9 11 8
FPS 0,5 0,5 0,5
4.3. Expe imen o 3 49
(a) Con igu aci´on 4 (b) Con igu aci´on 5
(c) Con igu aci´on 6
Figu a 4.4: Expe imen o 3b

50 Cap
´
ı ulo 4. Expe imen aci´
on y Compa a i a
4.3.3. ´
Ul ima Colecci´on de Im´agenes
El ´ul imo expe imen o es una peque˜na mejo a en la colecci´on de da os, que consis e
en iguala el n´ume o de im´agenes en las que apa ecen pis olas y en las que no. Es o se
hace po que se es ´a sob een enando a la ed pa a que diga que hay una pis ola m´as eces
de las que debe ´ıa. Es o p o oca un g an n´ume o de FP , que como bien se obse a en la
Tabla 4.5 y en la Figu a 4.5, se e educido as la implemen aci´on de la quin a colecci´on
de im´agenes.
Tabla 4.5: Expe imen o 3c
Pa ´
ame o Valo
P ecisi´on 90 %
E ec i idad 92 %
Exac i ud 91 %
Ve dade o Posi i o 92
Ve dade o Nega i o 90
Falso Posi i o 10
Falso Nega i o 8
FPS 0,5
Figu a 4.5: Expe imen o 3c
4.4. Resul ados 51
4.4. Resul ados
Los esul ados inales son p ome edo es. T as habe hecho los expe imen os inales
con los modelos elegidos 4.1, y iendo que el modelo Fas e RCNN + Incep ion es el que
mejo es esul ados ha dado. Se p esen an los esul ados del modelo y el da ase inales,
que son los que mejo hacen la de ecci´on:
Los esul ados de los expe imen os son muy buenos. A con inuaci´on se mues an los
esul ados de las dis in as mejo as que se han ido haciendo en los expe imen os:
(a) P ecisi´on (b) E ec i idad
(c) Exac i ud
Figu a 4.6: Resumen expe imen os
Como se puede obse a en la Figu a 4.6, con cada paso en los expe imen os, se han
ido mejo ando la p ecisi´on, e ec i idad y exac i ud del p og ama, llegando a una p ecisi´on
del 90 %, e ec i idad del 92 % y exac i ud del 91 %.
52 Cap
´
ı ulo 4. Expe imen aci´
on y Compa a i a
4.4.1. Im´agenes de Ejemplo
A con inuaci´on se mues an im´agenes que se han pasado po el p og ama:
Figu a 4.7: An es y depu´es 1
Figu a 4.8: An es y depu´es 2
Figu a 4.9: An es y depu´es 3
4.4. Resul ados 53
Figu a 4.10: An es y depu´es 4
Figu a 4.11: An es y depu´es 5
Figu a 4.12: An es y depu´es 6
60 Cap
´
ı ulo 6. In oduc ion
Figu a 6.1: Diag ama de Gan

6.5. S uc u e 61
6.5. S uc u e
The memo y o he wo k is di ided in o chap e s acco ding o he phase o which hey
co espond as cla i ied below:
Chap e 1 p o ides a b ie in oduc ion o he p ojec , as well as he mo i e behind i .
In Chap e 2 a heo e ical amewo k o a i icial in elligence is w i en o con ex ualize
he p ojec .
Chap e 3 shows he Model used in ou p og am.
Chap e 4 is made up o se e al expe imen s in which he de elopmen s ha a e being
made a e es ed and he esul s a e analysed in o de o know in which line o con inue
he de elopmen . I also shows he esul s ob ained in he wo k.
Chap e 5 is he conclusion o he wo k and also discusses possible imp o emen s i
could ha e.
Chap e 6 is he in oduc ion in English.
Chap e 5 is he conclusion and u u e wo k in English.
Chap e 8 is he las chap e , and desc ibes he pa h aken by each o he pa icipan s
in he p ojec . I also explains he con ibu ions ha each one has made.
Cap´ı ulo 7
Conclusions and Fu u e Wo k
7.1. Conclusions
The inal p og am undoub edly manages o make an accep able de ec ion o weapons
in ideos. Much has been lea ned in he p ocess o c ea ing he p og amme, and g ea e
s eps ha e been aken as he de elopmen o he p og amme has p og essed.
Ini ially he e was a good a chi ec u e in he model 4.1, bu he esul s did no
accompany i . This is because i is essen ial o ha e a good collec ion o images o he
esul s o be good, as seen in he expe imen 4.2.
The ele ance o he images con ained in he image collec ion is e y impo an . I
ook a long ime o ge a good collec ion, as i equi es no only a lo o images, bu
quali y in hese. This was demons a ed in he expe imen 4.3.3.
I was hough ha you could ge good accu acy in he de ec o and make i as
as well, bu wi h a no mal p ocesso you can’ ge bo h, as demons a ed in he
expe imen 4.1.
The model is no only he a chi ec u e o he laye s ha make i up, bu also he
con igu a ion ha i has. I has been shown ha modi ying he con igu a ion o he
model gi es be e esul s in he de ec o .
The sou ce code o he p og amm can be ound in he ollowing link:
h ps://gi hub.com/Alejand omndza/UCM-Tenso low [EM19].
63
64 Cap
´
ı ulo 7. Conclusions and Fu u e Wo k
7.2. Fu u e Wo k
Due o he long ime i akes o ain a model, 1 day in ou p ocesso , we could
no es all he imp o emen s you would wan . So i would be ad isable o use a be e
p ocesso wi h GPU. You could y using a di e en model, because i you use a good
GPU you can ge be e esul s wi h ano he model.
The con igu a ions ha ha e been es ed a e no all possible. We ha e ied o
make small changes in he con igu a ion ile, and measu e he esul s o know wha had
o change and wha alue had o be gi en o each pa ame e o op imize he esul s o
he p og am, as well as o educe he high aining ime, which has been undoub edly
one o he bigges p oblems ha has been had. Howe e , i could be imp o ed by doing
mo e aining and expe imen s.
We ha e no been able o dedica e enough ime o da ase , and a u u e job would
be o pu mo e a ie y o ideos and mo e quan i y. I is also p oposed o p e-p ocess he
images o educe he a e o alse posi i es, as i is one o he alues ha has cos us he
mos o imp o e and ha is conside ed he mos impo an .
Ano he imp o emen ela ed o da ase would be o apply ex Da a augmen a ion.
Ha dly any da a augmen a ion has been done in he image collec ion ( andom wis s ha e
been applied in he aining images). One way o imp o e he da ase would be o change
he esolu ion, b igh ness, scale, o a ion, zoom, inc ease sa u a ion, e c.
I is p oposed o c ea e a g aphical in e ace, o acili a e he use ’s use o he
ool. This should consis o an en y o he ideo, and he possibili y o using he classes
you wan wi h as many en ies o collec ions o images as numbe o classes a e selec ed.
A inal p oposed imp o emen would be o implemen new classes. The model p oposed
in his wo k al eady has he implemen a ion in he model o do so, so i would only be
necessa y o make a collec ion o images o ano he class o ain he model.
Cap´ı ulo 8
Apo aciones Indi iduales
8.1. Pablo Es e e Calzado
Mi p ime a a ea ue ap ende Py hon, ya que no en´ıa conocimien os p e ios en es e
lenguaje, e iba a necesi a ap ende lo pa a pode desa olla e implemen a p og amas
basados en IA. Pa a ap ende es e lenguaje hice uso de una pla a o ma web llamada
Udemy. Es a pla a o ma me pe mi i´o inicia me en el lenguaje con ejemplos p ´ac icos.
T as es a p ime a ap oximaci´on con el lenguaje me i obligado a ap ende los
p incipios b´asicos del AA 2.5.1 y del AP 2.5.2, ya que en nues o p oyec o ´ıbamos a usa
es os m´e odos pa a la de ecci´on 2.9. Hice uso de la misma pla a o ma que u ilic´e pa a el
es udio de Py hon.
Con inu´e con el es udio de isi´on a i icial 2.7, pa a lo cual nues os u o es nos
acili a on un lib o [PyI19] que me pe mi i´o en ende c´omo uncionaba el AP con isi´on
a i icial.
Cabe des aca que mi compa˜ne o y yo nos eun´ıamos una ez a la semana pa a
compa a nues os a ances y discu i lo que hab´ıamos ap endido.
Hice, jun o a mi compa˜ne o, un p og ama que clasi icaba im´agenes. Conside amos
que la de ecci´on e a un p oblema de mayo en e gadu a, y el clasi icado nos pe mi i ´ıa
ap ende concep os m´as b´asicos. Pa a el co ec o uncionamien o de es e p og ama me
enca gu´e de las conexiones de la colecci´on de im´agenes con el modelo. El clasi icado
cons aba de una colecci´on de im´agenes Ci a , la cual con iene 10 clases y un o al de
60.000 im´agenes, dis ibuidas en 10.000 pa a es y 50.000 pa a en enamien o.
T as la implemen aci´on de es e clasi icado , mi compa˜ne o y yo pusimos en com´un
c´omo hab´ıamos hecho nues a pa e, pa a que ambos en endi´e amos c´omo uncionaba el
clasi icado .
Pa a aden a me en la de ecci´on de obje os en ´ıdeos, me dispuse a lee muchos
pape s cien ´ı icos, algunos p opo cionados po nues os u o es y o os que encon aba en
google. De mane a ans e sal, ui haciendo es´umenes de es os pape s pa a en ende los y
ene una idea gene al sob e los modelos que se usan en el es ado del a e de la de ecci´on.
Cabe des aca que la g an mayo ´ıa de la in o maci´on que se encuen a es en ingl´es. Es o
me di icul ´o, al p incipio, comp ende la e minolog´ıa que se usaba en es e campo.
65

66 Cap
´
ı ulo 8. Apo aciones Indi iduales
En es e momen o es ´abamos eniendo p oblemas con la elocidad de c´ompu o, po lo
que decid´ı cambia el o denado pa a hace los en enamien os de los modelos en o o
o denado con a je a g ´a ica dedicada. Finalmen e, mi compa˜ne o u o la idea de ejecu a
el c´odigo en la nube, pe o no pudimos segui haci´endolo mucho iempo po que e a de pago.
Mi compa˜ne o y yo nos di idimos pa a busca implemen aciones de modelos pa a
en ena los con colecciones de im´agenes pe sonalizadas. Es u e buscando du an e a ios
d´ıas, p obando a ios modelos e implemen aciones. Uno de los modelos que implemen ´e
ue un de ec o de ca as hecho con YOLO a a ´es de la webcam. Al inal decidimos
usa una API de Tenso low que hab´ıa encon ado mi compa˜ne o. Ten´ıamos que elegi
qu´e modelos ´ıbamos a p oba en la API, po lo que hice acopio de la in es igaci´on
ealizada an e io men e y la ampli´e un poco m´as con modelos que e an del es ado
del a e. Decid´ı que deb´ıamos usa el modelo Fas e RCNN 2.11.2.3 y el SSD 2.11.1.1
ya que son los m´as p obados, y los que mejo es esul ados han dado en o os expe imen os.
Seguidamen e, hice un es udio sob e c´omo iene que se una colecci´on de im´agenes
pa a que sea e ec i a. Despu´es empec´e a busca colecciones de im´agenes en in e ne , pe o
no hab´ıa casi ninguna colecci´on acep able. Me puse en con ac o con el Depa amen o de
In eligencia A i icial de la Uni e sidad de G anada, ya que hab´ıan ealizado un so wa e
de de ecci´on de a mas ambi´en, pe o la colecci´on de im´agenes que usaban ya la en´ıamos.
Empec´e a ecopila im´agenes y ´ıdeos de in e ne en los que apa ecie an pis olas, y se los
pasaba a mi compa˜ne o pa a que hicie a el e ique ado de los mismos.
T as hace a ios expe imen os 4.2 con las dis in as colecciones de pis olas pas´e
a es udia c´omo modi ica la con igu aci´on del modelo. Hay muchos pa ´ame os a
con igu a , po lo que los di idimos en e ambos pa a es udia los y, m´as a de, pone los
en com´un. Despu´es de es udia los, hice 2 ejemplos de modi icaci´on de la con igu aci´on
pa a el siguien e expe imen o 4.3.1.
Cuando inaliz´o el expe imen o, decid´ı ealiza uno nue o 4.3.2, donde hice una nue a
con igu aci´on de los pa ´ame os del modelo espec o al an e io expe imen o 4.3.1. En
es e expe imen o ya conseguimos una con igu aci´on acep able, po lo que decidimos hace
una nue a mejo a sob e la colecci´on de da os que en´ıamos.
Pa a hace dicha mejo a me g ab´e en a ios ´ıdeos usando una pis ola de pl´as ico
en a ios escena ios. Es os ´ıdeos se los pas´e a mi compa˜ne o pa a que hicie a el e ique ado.
Los esul ados con es a ´ul ima colecci´on de im´agenes ue on muy buenos 4.3.3, po lo
que empezamos a edac a la memo ia usando oda la documen aci´on que hab´ıamos ido
acumulando en odos los expe imen os. G acias a una pla a o ma en l´ınea de LaTex que
nues os u o es nos p opo ciona on, pude hace la memo ia a la ez que mi compa˜ne o,
poniendo siemp e en com´un los a ances sob e la misma.
8.2. Alejand o Mendoza Sil a 67
8.2. Alejand o Mendoza Sil a
Al p incipio u e que dedica mucho iempo al en endimien o de Py hon, ya que
aunque en´ıa conocimien os p e ios al cu sa Bid Da a en la uni e sidad como asigna u a
op a i a (donde ap end´ı la uncionalidad b´asica del lenguaje), desconoc´ıa su aplicaci´on en
los campos de IA 2.5. Lib e ias como pandas pa a la manipulaci´on de da os es uc u ados,
numPy po su acilidad al abaja con ma ices Ma plo lib pa a la ep esen aci´on de
his og amas, g ´a icos de l´ıneas, e c.
En e o as muchas lib e ´ıas u ilizadas ac ualmen e pa a el desa ollo en el ´ambi o
de IA. T as es e es udio po encima de las ca ac e ´ıs icas de py hon, ealic´e un es udio
m´as in ensi o pa a ene conocimien os m´as amplios. U ilice una pla a o ma denominada
Da aCamp, en la que ealic´e un cu so de AP 2.5.2, donde explicaban concep os como
qu´e es una neu ona, capas ocul as, unci´on de ac i aci´on, op imizado es, y as´ı i
comp endiendo la impo ancia de la limpieza de da os pa a modelos p edic i os de
eg esi´on lineal y o as p oblem´a icas.
Es a pla a o ma me esul ´o muy in e esan e, y me eci´o la pena la apo aci´on
econ´omica pa a ing esa en ella. Ya que al pe mi i e ejecu a el c´odigo online en el p opio
na egado , acili aba el en endimien o sin ene que pelea con las lib e ´ıas, en o nos
i uales o e siones.
Tu e euniones semanales con mi compa˜ne o, lo que me pe mi i´o pone a p ueba mis
conocimien os y discu i c´omo uncionaban los m´e odos que hab´ıamos ap endido. T as
a ias euniones con nues os u o es encamin´e el ap endizaje hacia nues o obje i o,
la de ecci´on en ideos de pis olas 2.9. Mi compa˜ne o y yo decidimos desa olla un
clasi icado , ya que el en enamien o de un de ec o e a m´as complejo po que en an en
juego m´as ac o es como los a chi os xml donde si ´uan al obje o a de ec a en la imagen.
Pa a el desa ollo de es e clasi icado me enca gu´e de con igu a el modelo de la ed
neu onal que ´ıbamos a usa .
Despu´es de una la ga in es igaci´on po a ´ıculos de google y leyendo pape s
cien ´ı icos de desa ollo en AP u e una idea de c´omo uncionaban las edes neu onales
con olucionales. Hay que ema ca aqu´ı el hecho de que al se algo complejo, hay mucha
in o maci´on con usa que di icul ´o el es udio sob e es os emas. Fue in e esan e con a con
una in es igado a de AP la cual, nos ayud´o a comp ende y escla ece odas las dudas
que nos hab´ıan su gido has a el momen o.
T as las euniones me dispuse a ap ende de una mane a m´as p o unda el
uncionamien o de las edes neu onales con olucionales. Ke as om´o un papel undamen al
desde el p ime momen o, ya que al se una lib e ´ıa de al o ni el de enso low su ni el de
abs acci´on hizo m´as ´acil la comp ensi´on de los modelos como el clasi icado de im´agenes
que se desa oll´o an e io men e. Adem´as con las acla aciones desc i as an e io men e se
pudo con inua su desa ollo y no se ol i´o algo an edioso. Pa a el dise˜no del modelo
se u o como e e encia a qui ec u as como la VGG-16, que se basan en hace c ecien e
el n´ume o de neu onas de las capas con olucionales. Se ob u ie on buenos esul ados
modi icando los pa ´ame os del modelo has a llega al de ini i o que es el que se encuen a
en nues o Jupy e no ebook.
68 Cap
´
ı ulo 8. Apo aciones Indi iduales
Como la elocidad de c´ompu o e a un p oblema, mi compa˜ne o y yo buscamos
al e na i as a es e p oblema, en p ime a ins ancia mi compa˜ne o cambi´o el po ´a il
po uno mejo , con la en aja de ene una a je a g ´a ica dedicada, lo que pe mi i´o el
c´ompu o en gpu. Se ob u ie on buenos esul ados, pe o no lo espe ado. Po lo an o
decidid´ı hace la ejecuci´on en cloud, pa a ello Google dispone de un Jupy e no ebook,
que me pe mi i´o ejecu a c´odigo con una GPU Tesla de g an po encia.
Ya que nues o obje i o e a un de ec o y no un clasi icado , se busc´o la mane a de
en ena modelos p ede inidos como el Fas e RCNN 2.11.2.3 o el modelo SSD 2.11.1.1.
Tu e que ealiza a ios expe imen os, busca in o maci´on ele an e y as a ios in en os
allidos, di con la API o icial de Tenso Flow donde e explican c´omo en ena obje os
cus om. T as la lec u a y comp ensi´on sob e c´omo unciona es e API. Lle ´e a cabo, jun o
con mi compa˜ne o, un es udio pa a de e mina qu´e modelos y edes neu onales base de
los disponibles nos in e esaban pa a la expe imen aci´on.
Al cabo de a ios d´ıas de es udio decid´ı usa Incep ion y Resne como edes neu onales
base. Pa a el en enamien o u e que en ende el uncionamien o del API y g acias a
un c´odigo de gi hub, pude en ende c´omo se gene an los eco ds necesa ios pa a el
en enamien o.
Hicimos el p ime expe imen o con los modelos elegidos po mi compa˜ne o y las edes
neu onales base elegidas po mi. T as los esul ados del expe imen o decidimos hace una
colecci´on de im´agenes. En un p incipio me enca gu´e yo de e ique a im´agenes mien as
mi compa˜ne o buscaba las im´agenes.
El p oceso m´as labo ioso ha sido hace el e ique ado de odas las im´agenes con un
p og ama llamado OpenLabeling [Ca 19]. Sumando odas las colecciones de im´agenes 3.1
he in e ido mucho iempo en hace el e ique ado de casi 25k im´agenes. De las cuales
muchas se desecha on po simili ud con las o as im´agenes y no apo aban in o maci´on
ele an e pa a la ed. Despu´es de la mejo a de las colecciones de im´agenes u e un p oceso
de es udio de la con igu aci´on del modelo en e o de Fas e RCNN di iediendo con mi
compa˜ne o los pa ´ame os que hab´ıa que cambia . T as pone en com´un la in o maci´on
sob e los pa ´ame o, hice una mejo a de la con igu aci´on pa a el p ime expe imen o 4.3
con las con igu aciones.
T as es e expe imen o hice dos nue as con igu aciones pa a hace el segundo
expe imen o 4.3.2 con las con igu aciones. De es e expe imen o sacamos la con igu aci´on
inal que ´ıbamos a usa .
Hice un ´ul imo e ique ado de im´agenes con ´ıdeos de mi compa˜ne o pa a a˜nadi lo a
la colecci´on de im´agenes 4.3.3, y a˜nad´ı ambi´en im´agenes en las que no apa ec´ıan a mas,
pa a equilib a la p opo ci´on de im´agenes con pis olas y sin pis olas.
La documen aci´on de la memo ia la ui haciendo a medida que a anz´abamos, y la
edacci´on inal de la misma ue simplemen e esc ibi la de o ma m´as o denada usando
el p og ama LaTex. G acias a una pla a o ma de LaTex en la nube p opo cionada po
nues os u o es pude hace , jun o a mi compa˜ne o, la edacci´on de la memo ia en l´ınea.
Bibliog a ´ıa
[AmAaP+18] M. Al-masni, M. A. Al-an a i, J. Pa k, G. Gi, T. Kim, P. Ri e a, E. Vala ezo,
M. Choi, S. Han, and T. Kim. Simul aneous De ec ion and Classi ica ion o B eas
Masses in Digi al Mammog ams ia a Deep Lea ning YOLO-based CAD Sys em.
Compu e Me hods and P og ams in Biomedicine, 157, Ap il 2018.
[B e01] C. B eazeal. MIT eam building social obo . h p://news.mi .edu/2001/kisme ,
Feb ua y 2001.
[Ca 19] Ca ucho. OpenLabeling. h ps://gi hub.com/Ca ucho/OpenLabeling, May
2019.
[Com19] His o y Compu e . Logic Theo is : His o y. h ps://his o y-compu e .com/
Mode nCompu e /So wa e/LogicTheo is .h ml, May 2019.
[CTP+19] A. Cas illo, S. Tabik, F. P´e ez, R. Olmos, and F. He e a. B igh ness guided
p ep ocessing o au oma ic cold s eel weapon de ec ion in su eillance ideos wi h
deep lea ning. Neu ocompu ing, 330:151 – 161, 2019.
[dG19] Uni e sidad de G anada. Weapons de ec ion. h ps://sci2s.ug .es/
weapons-de ec ion, May 2019.
[EM19] P. Es e e and A. Mendoza. De ec o a mas. h ps://gi hub.com/
Alejand omndza/UCM-Tenso low, May 2019.
[FH99] H. Feng-Hsiung. IBM’s Deep Blue Chess g andmas e chips. IEEE Mic o,
19(2):70–81, Ma ch 1999.
[GDDM14] R. Gi shick, J. Donahue, T. Da ell, and J. Malik. Rich Fea u e Hie a chies o
Accu a e Objec De ec ion and Seman ic Segmen a ion. In The IEEE Con e ence
on Compu e Vision and Pa e n Recogni ion (CVPR), Ohio, USA, June 2014.
[GN09] P. Gehle and S. Nowozin. On ea u e combina ion o mul iclass objec classi ica ion.
In 2009 IEEE 12 h In e na ional Con e ence on Compu e Vision, pages 221–228,
Kyo o, Japan, Sep. 2009.
[HOT06] G. E. Hin on, S. Osinde o, and Y. Teh. A as lea ning algo i hm o deep belie
ne s. Neu al Compu a ion, 18(7):1527–1554, May 2006.
[HS95] S. Hoch ei e and J. Schmidhube . Long Sho - e m Memo y. h p://ci esee x.
is .psu.edu/ iewdoc/summa y?doi=10.1.1.51.3117, Augus 1995.
[HS97] S. Hoch ei e and J. Schmidhube . Long Sho -Te m Memo y. Neu al Compu a ion,
9(8):1735–1780, No embe 1997.
[JLM10] V. Jain and E. Lea ned-Mille . FDDB: A Benchma k o Face De ec ion in
Uncons ained Se ings. Technical Repo , Uni e si y o Massachuse s, Amhe s ,
June 2010.
[KPNY19] S. Kim, S. Pa k, Byunggook Na, and S. Yoon. Spiking-YOLO: Spiking Neu al
Ne wo k o Real- ime Objec De ec ion. a Xi e-p in s, Ma ch 2019.
[KSL+19] T. Kong, F. Sun, H. Liu, Y. Jiang, and J. Shi. Consis en Op imiza ion o
Single-Sho Objec De ec ion. Technical Repo , Tsinghua Uni e si y, Janua y 2019.
69