Uni e sidad Complu ense de Mad id/Uni e sidad de G anada (SICUE)
Facul ad de In o má ica
TRABAJO DE FIN DE GRADO
EVALUACIÓN DE ALGORITMOS DE MACHINE
LEARNING PARA CONDUCCIÓN
MACHINE LEARNING ALGORITHM EVALUATION
ON ADVANCED DRIVER ASSISTANCE
Alumnos
Alejand o Simón Rod íguez
Ra ael Ruz Gómez
Di ec o es
Ca los Ga cía Sánchez
Guille mo Bo ella Juan
Doble G ado Ingenie ía In o má ica y Ma emá icas
2019/2020
1
Índice
1 In oducción y mo i ación 8
2 His o ia 9
3 Con ibución de cada es udian e 12
3.1 Con ibución de Alejand o . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
3.2 Con ibución de Ra ael . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
4 Es ado del a e 14
4.1 In oducción a la Visión po Compu ado . . . . . . . . . . . . . . . . . . 14
4.1.1 P oblemas den o de la Visión po Compu ado . . . . . . . . . . . 15
4.2 DeepLea ning ................................. 16
4.2.1 Redes Con olucionales . . . . . . . . . . . . . . . . . . . . . . . . . 18
4.2.2 T ans e Lea ning . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
5 A qui ec u as de De ección de Obje os 22
5.1 A qui ec u as de dos ases . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
5.2 A qui ec u as de una ase . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
5.2.1 Single Sho De ec o o SSD . . . . . . . . . . . . . . . . . . . . . . 28
5.2.2 YOLO.................................. 32
6 P esen ación de conjun os de da os u ilizados 38
6.1 KITTI...................................... 40
6.2 Tshingua-Daimle ................................ 42
6.3 Be keley Deepd i e Da ase . . . . . . . . . . . . . . . . . . . . . . . . . . 42
6.4 Conjun os de da os c eados . . . . . . . . . . . . . . . . . . . . . . . . . . 45
7 Disposi i os ha dwa e u ilizados 45
7.1 CPU In el R
Xeon R
E3-1225 3 ....................... 46
7.2 GPUGEFORCEGTX980 .......................... 46
7.3 GPU UHD In el R
620............................. 46
7.4 In el R
Neu al Compu e S ick 2 . . . . . . . . . . . . . . . . . . . . . . . . 47
8 Medidas de p ecisión en la de ección de obje os 47
8.1 P ecisiónyRecall................................ 47
8.2 IOU ....................................... 48
8.3 APymAP ................................... 49
9 F amewo ks 50
9.1 Tenso low.................................... 50
9.1.1 Objec De ec ion API . . . . . . . . . . . . . . . . . . . . . . . . . 50
9.1.2 Tenso boa d............................... 52
2
9.2 Open ino oolki ................................ 53
9.2.1 Ca ac e ís icas p incipales . . . . . . . . . . . . . . . . . . . . . . . 53
9.3 Da kne ..................................... 54
9.4 Módulos..................................... 54
10 Expe imen os ealizados 55
10.1Ancho Boxes.................................. 56
10.2Da aaugmen a ion............................... 58
10.3 Ha d Nega i e Mining . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
11 Resul ados del Reen enamien o 60
11.1 Resul ados de la ed SSD Incep ion V2 . . . . . . . . . . . . . . . . . . . . 60
11.1.1 Resul ados SSD Incep ion V2 sob e KITTI . . . . . . . . . . . . . 60
11.1.2 Resul ados SSD Incep ion V2 sob e el da ase comple o . . . . . . 61
11.1.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 62
11.2 Resul ados de la ed Fas e R-CNN . . . . . . . . . . . . . . . . . . . . . . 64
11.2.1 Resul ados Fas e R-CNN sob e KITTI . . . . . . . . . . . . . . . 64
11.2.2 Resul ados Fas e R-CNN sob e el da ase comple o . . . . . . . . 65
11.2.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 66
11.3 Resul ados de la ed SSD Mobile Li e . . . . . . . . . . . . . . . . . . . . . 68
11.3.1 Resul ados SSD Mobile Li e sob e KITTI . . . . . . . . . . . . . . 68
11.3.2 Resul ados SSD Mobile Li e sob e el da ase comple o . . . . . . . 69
11.3.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 70
11.4 Resul ados de la ed YOLO 3 . . . . . . . . . . . . . . . . . . . . . . . . . 72
11.4.1 Resul ados YOLO 3 sob e KITTI . . . . . . . . . . . . . . . . . . 73
11.4.2 Resul ados YOLO 3 sob e el da ase comple o . . . . . . . . . . . 73
11.5 Resul ados de la ed YOLO 3 iny . . . . . . . . . . . . . . . . . . . . . . 74
11.5.1 Resul ados YOLO 3 iny sob e KITTI . . . . . . . . . . . . . . . . 74
11.5.2 Resul ados YOLO 3 iny sob e el da ase comple o . . . . . . . . . 75
12 Resul ado de In e encia 75
12.1 In e encia de SSD Incep ion V2 en Open ino . . . . . . . . . . . . . . . . 76
12.2 In e encia de SSD Mobile Li e en Open ino . . . . . . . . . . . . . . . . . 77
12.3 In e encia de Fas e R-CNN en Open ino . . . . . . . . . . . . . . . . . . 78
12.4 In e encia YOLO 3 en Da kne . . . . . . . . . . . . . . . . . . . . . . . . 79
12.5 In e encia YOLO 3 Tiny en Da kne . . . . . . . . . . . . . . . . . . . . . 79
13 Compa ación 80
13.1MAP....................................... 80
13.2 Velocidad de in e encia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
13.3 In e cambio elocidad-consumo . . . . . . . . . . . . . . . . . . . . . . . . 82
14 Conclusiones 84
14.1Fu u ospasos.................................. 87
3
14.2Fu u es eps................................... 90
4
Índice de ablas
12.1 In e encia del modelo SSD Incep ion V2 usando el amewo k Open ino . 76
12.2 In e encia del modelo SSD Mobile Li e usando el amewo k Open ino . . 77
12.3 In e encia del modelo Fas e R-CNN usando el amewo k Open ino . . . 78
12.4 In e encia del modelo YOLO 3 ejecu ado en la GPU de al o endimien o
usando el amewo k Da kne . . . . . . . . . . . . . . . . . . . . . . . . . 79
12.5 In e encia del modelo YOLO 3 Tiny ejecu ado en la GPU de al o endi-
mien o usando el amewo k Da kne . . . . . . . . . . . . . . . . . . . . . 79
5
PALABRAS CLAVE:
Visión po o denado , conducción au ónoma, ed neu onal con olucional, de-
ección de obje os, ap endizaje p o undo, ap endizaje au omá ico, My iad,
Tenso low, Open ino, Da kne .
RESUMEN
El p incipal obje i o de es e p oyec o de in es igación y desa ollo es el análisis e imple-
men ación de a qui ec u as deep lea ning pa a la de ección en iempo eal de pea ones,
ciclis as y ehículos en el ámbi o de la conducción au ónoma.
El e iginoso c ecimien o de la capacidad de p ocesamien o ha p o ocado el su gimien o
de nue as amas de in es igación ecnológica, en e ellas la de la In eligencia A i icial
(IA). En pa icula , den o de la IA podemos des aca la apa ición de las edes neu onales
p o undas como écnica pa a abo da p oblemas elacionados con la pe cepción isual,
como puede se la clasi icación de obje os o la de ección de obje os.
Uno de los campos donde la IA que es á eniendo una mayo in luencia es la c eación de
sis emas a anzados de asis encia pa a la conducción (ADAS). Es os sis emas de conduc-
ción se apoyan en una amplia a iedad de cáma as y senso es que p opo cionan oda la
in o mación necesa ia pa a oma decisiones con p ecisión y segu idad.
Un sis ema ADAS es á compues o po dis in os módulos. Uno de ellos se enca ga de la
de ección en iempo eal de obje os. En es e p oyec o nos cen amos en la de ección en
iempo eal de ehículos, ciclis as y pea ones, aunque pod ían inclui se líneas de ca e e a
y señales de á ico, en e o os obje os.
Pa a consegui dicho obje i o di idi emos en dos pa es di e enciadas el abajo:
Reen enamien o de una ed gene alis a pa a ap ende a iden i ica ehículos, pea-
ones y ciclis as.
Es udio del endimien o de la in e encia ealizada po la ed een enada en é mi-
nos de p ecisión, elocidad de in e encia y consumo sob e un conjun o de disposi-
i os ha dwa e.
6
KEYWORDS:
Compu e ision, au onomous d i ing, con olu ional neu onal ne wo k, ob-
jec de ec ion, deep lea ning, machine lea ning, My iad, Tenso low, Open-
ino, Da kne .
ABSTRACT
The main aim o his esea ch and de elopmen p ojec is he analysis and implemen a-
ion o deep lea ning’s a chi ec u es o eal- ime objec de ec ion o pedes ians, cyclis s
and ca s on he scope o au onomous d i ing.
The b eakneck g ow h o he compu ing capaci y has caused he eme gence o new ech-
nological esea ch ields such as A i icial In elligence (AI). Especi ically, we can highligh
he unco e ing o deep neu al ne wo ks as a echnique o app oach challenges ela ed o
isual pe cep ion, o example objec classi ica ion o objec de ec ion.
One o he a eas whe e he a i icial in elligence is ha ing a g ea in luence is on he
c ea ion o ad anced d i e -assis ance sys ems (ADAS). These sys ems ake ad an age o
cu ing-edge came as and senso s ha eed he sys ems wi h all he necessa y in o ma ion
o ake decisions wi h accu acy and secu i y.
An ad anced d i e -assis ance sys em is made o se e al modules. One o hem pe o m
objec de ec ion in eal- ime. The main ocus o his p ojec is eal- ime de ec ion o
pedes ians, cyclis s and ca s.
To achie e his objec i e, we will di ide he wo k in o wo pa s:
Fine- uning o a gene alis ne wo k o lea n how o iden i y pedes ians, cyclis s
and ca s.
Pe omance analysis in e ms o e iciency, speed and powe consump ion du ing
he in e ence pe o med by he ine- uned ne wo k o e a se o ha dwa e de ices.
7
1. In oducción y mo i ación
El desa ollo de sis emas a anzados de asis encia al conduc o (ADAS) es una ealidad
a día de hoy y no un sueño u u is a. Ac ualmen e es una ecnología cuyo desa ollo se
ha di ido en ases con el obje i o de i cumpliendo obje i os p og esi amen e en p o de
log a un sis ema de conducción comple amen e au ónomo.
La Sociedad de Ingenie os de Au omoción [53] es ablece una di e enciación en cuan o al
ni el de au onomía en la conducción en la que se dis inguen seis ca ego ías o ni eles:
Ni el 0: Ninguna au oma ización, el conduc o debe ealiza odas las a eas ela-
i as a la conducción.
Ni el 1: Asis encia en la conducción, se cuen a con algún sis ema au oma izado,
como po ejemplo pa a con ola el mo imien o la e al o longi udinal, pe o no
ambos a la ez, y no se dispone de sis emas pa a esponde an e obje os. Debiendo
ealiza el es o de las a eas el conduc o .
Ni el 2: Au oma ización pa cial, apa ecen sis emas pa a an o el con ol la e al
como longi udinal, eximiendo al conduc o de con ola el mo imien o, pe o no del
es o de a eas como la de ección de obje os y espues a an e ellos.
Ni el 3: Au oma ización condicional, se con ola au omá icamen e an o el mo i-
mien o como se moni o iza el en o no, pe o se equie e al conduc o disponible en
segundos po si ocu ie a algún allo, sal ando una ale a.
Ni el 4: Au oma ización ele ada, se iene un sis ema au ónomo, en casi cualquie
si uación, con olando el mo imien o, de ec ando obje os y ac uando an e allos,
eniendo que oma el con ol el conduc o en a a ocasión.
Ni el 5: Au oma ización comple a, se cuen a con sis emas au ónomos an e cualquie
si uación, y el conduc o nunca es á obligado a oma con ol manualmen e si no
lo desea.
Ac ualmen e, nos encon amos a medio camino en e el e ce y el cua o ni el. Se e-
quie e de una ecnología mas a anzada con o me aumen an los ni eles, siendo ecnologías
imp escindibles la senso ización, el p ocesado de las señales de es os y la oma de deci-
siones basándose en la in o mación de los senso es p ocesada. Una pa e de es e abajo
se enma ca á en apo a soluciones den o de una de es as a eas, la de ección de obje os
con écnicas de In eligencia A i icial.
O o aspec o a ene en cuen a pa a el despliegue de la conducción au ónoma es la ene gía
que deben consumi odos los sis emas de de ección, p ocesamien o y oma de decisiones
en unción de la in o mación ecabada. Po ello, o a pa e de es e p oyec o se dedica á
a analiza la e iciencia ene gé ica de los sis emas u ilizados.
Podemos esumi la mo i ación de es e abajo en dos cues iones abie as:
8
¿Cómo p ocesa oda la in o mación ecabada po el ehículo de o ma que pe mi a
oma decisiones en iempo eal?
¿Cómo c ea un Sis ema de Con ol Au ónomo óp imo en é minos de e iciencia
ene gé ica?
Ambas cues iones son de i al impo ancia pa a el desa ollo de la ecnología necesa ia
pa a el coche au ónomo. Pa a esponde a la p ime a cues ión nos apoya emos en el
á ea de la isión po compu ado , donde los mayo es éxi os en cuan o a endimien o han
llegado con el c ecimien o exponencial de las edes neu onales p o undas, en conc e o, con
la e olución de las edes neu onales con olucionales. Es as edes han demos ado bajas
asas de e o y una meno necesidad de ecu sos compu acionales que sus p edeceso as,
las edes neu onales comple amen e conec adas ( ully-connec ed).
Po o o lado, es un e o mayúsculo el c ea un sis ema de conducción au ónoma e icien e
en consumo. Es e desa ío podemos di idi lo en dos subp oblemas:
Es udia el so wa e que sea capaz de p ocesa las imágenes en iempo eal y cumpla
las es icciones de ene gía necesa ias.
Es udia el ha dwa e más adecuado pa a dicho so wa e en búsqueda de la e iciencia
ene gé ica.
El p ocesamien o de imágenes ha sido es udiado ampliamen e, y se ha demos ado que lo
más óp imo es hace uso de a ios núcleos en luga de unos pocos, como suele ocu i en
CPUs es ánda . En es e abajo a a emos el uso de GPU y My iad, es e úl imo consis e
en ha dwa e especí ico pa a o ece ecu sos o ien ados a implemen a edes neu onales,
desa ollado po In el.
Po úl imo es á el desa ío de o ques a odo es e so wa e y ha dwa e. Pa a el desa o-
llo de es e p oyec o se han u ilizado los da ase s KITTI, Tshingua-Daimle y Be kely
Deepd i e. Es os conjun os son p esen ados mas de alladamen e en la sección 6. La de-
ección de obje os se ha ealizado usando es ipos de edes: SSD, Fas e y YOLO, que
se p esen a án en la sección 5.
El een enamien o de las edes se ha ealizado usando el amewo k Tenso low, del cual
amplia emos más in o mación en las sección 9. La e aluación de las edes se ha ealiza-
do ap o echando el conjun o de he amien as desa olladas po In el, en el amewo k
OpenVINO, el cual pe mi e la ejecución en disposi i os especí icos de in e encia de e-
des neu onales p o undas, como My iad. En la sección 9 se expond án los disposi i os
u ilizados.
2. His o ia
T as el nacimien o de los coches mo o izados lle o poco iempo a los in en o es de la época
comenza a pensa en los ehículos au ónomos. En 1925, el in en o F ancis Houdina [20]
demos ó como un coche con olado median e ondas de adio conducía po las calles de
9
Figu a 4.1: Desa íos en la Visión po Compu ado . Fuen e: [11]
En pa icula , noso os nos amos a cen a en el econocimien o de obje os, es deci ,
iden i ica que obje o hay en la imagen y dónde se encuen a. Al es a cen ados en
la conducción au ónoma, los obje os a econoce y si ua se án: pea ones, ciclis as y
ehículos.
4.2. Deep Lea ning
Deep Lea ning [23] es una ama den o del ap endizaje au omá ico cuya me a es ap en-
de ca ac e ís icas de al o ni el a pa i de un conjun o de da os usando a qui ec u as
je á quicas. Es e en oque pe mi e a los modelos compu acionales basados en múl iples
capas, ap ende y ex ae in o mación imi ando como el ce eb o pe cibe y asimila la
in o mación, pe mi iendo cap u a pa ones subyacen es en conjun os de da os a g an
escala.
El su gimien o del in e és po es a ecnología se ha p oducido debido a que ha supe ado
ampliamen e el endimien o de las écnicas pun e as p e ias en muchas á eas de in e és
de la in eligencia a i icial, como pueden se p ocesamien o del lenguaje na u al [58], i-
sión po compu ado [15, 1], ans e lea ning [14, 28] y muchas más.
La ambición de c ea un modelo que simula a el ce eb o humano p o ocó el inicio del
desa ollo de las edes neu onales. En 1943, McCulloch and Pi s [39] in en a on com-
p ende como el ce eb o podía p oduci pa ones de al a complejidad usando células
básicas in e conec adas, llamadas neu onas. El modelo de una neu ona de McCulloh
y Pi s, llamado el modelo MCP, ue una con ibución i al al desa ollo de las edes
16
neu onales a i iciales. En la siguien e abla [6] se mues an cuales han sido las mayo es
con ibuciones a es e campo que han con ibuido a llega a la e a ac ual del deep lea ning:
Figu a 4.2: Hi os más impo an es en la his o ia de las edes neu onales y el ap endizaje
au omá ico, que han conducido a la e a del deep lea ning. Fuen e: [24]
El nacimien o de la e a del deep lea ning se p odujo con la dis up i a con ibución de
Hil on [21] en el año 2006, cuando in odujo la Deep Belie Ne wo k. Es a ed ue la p in-
cipal causan e del desa ollo exponencial de la úl ima década en cuan o a a qui ec u as
p o undas y algo i mos de deep lea ning.
Sin emba go, las edes neu onales exis en desde ha mediados del siglo XX. Una p egun a
na u al que su ge es po qué las edes neu onales p o undas han comenzado a ene un
in e és masi o ecien emen e. Hay muchos ac o es que con ibuyen al ascenso me eó ico
de la popula idad de las edes neu onales p o undas, algunos de ellos son:
Apa ición de da ase s de en enamien o masi os con e ique as de al a calidad.
A ances en las capacidades de compu ación pa alela e implemen aciones mul i-co e
y mul i- h ead.
Aumen o de la capacidad de p ocesamien o, especialmen e debido al uso de GPUs,
así como, la disminución del cos e del ha dwa e de compu ación.
Su gimien o de nume osas pla a o mas de so wa e como Tenso low [36], PyTo ch
[2], Ca e [65], Chaine [52], e c, que pe mi en una in eg ación sencilla y a al o
ni el de di e sas a qui ec u as en un amewo k de compu ación de GPU, sin la
necesidad de en a en de alles de bajo ni el.
In oducción de nue as écnicas de egula ización que ayudan a e i a el o e i -
ing y mejo an el endimien o con o me se escala . Algunas de es as écnicas son:
d opou , da a augmen a ion, ea ly s opping e c.
A ances en la op imización de los algo i mos de ap endizaje au omá ico que son
capaces de p oduci soluciones muy ce canas a las óp imas.
17
4.2.1. Redes Con olucionales
Los a ances en isión po compu ado con la llegada del deep lea ning han sido desa-
ollados y pe eccionados con el iempo g acias a un algo i mo en pa icula : las Redes
Neu onales Con olucionales [67].
Figu a 4.3: A qui ec u a Gene al de Redes Neu onales Con olucionales. Fuen e: [12]
Una Red Neu onal Con olucional(CNN) es un algo i mo de Deep Lea ning que oma una
imagen de en ada, asigna impo ancia (conjun o de pesos ap endidos) a los aspec os/-
ca ac e ís icas de la imagen y es capaz de di e encia unos de o os. Mien as que an es
de la llegada de es as edes se aplicaban il os diseñados a mano pa a de ec a los as-
pec os ele an es de una imagen, con su icien e en enamien o, las CNN han conseguido
ap ende esas ca ac e ís icas eseñables de las imágenes.
La a qui ec u a de una CNN in en a eplica los pa ones de conec i idad de las neu o-
nas del ce eb o humano y es á inspi ada en la o ganización del có ex isual [34]. Es a
a qui ec u a pe mi e ealiza un balance en e una al a capacidad de ap endizaje de las
ca ac e ís icas ele an es de la imagen y la escalabilidad de la ed sob e da ase s masi os
[68].
Con el in de cumpli con esas expec a i as, la CNN ealiza una educción de las imá-
genes a una o ma mucho mas sencilla de p ocesa , sin pe de las ca ac e ís icas c í icas
necesa ias pa a ealiza una buena p edicción. Pa a ello se basa en la sucesi a aplicación
de dos capas: la capa de Con olución y la capa de Pooling.
La capa de con olución se basa en la ope ación de con olución sob e la imagen. El obje i o
de es a ope ación es ex ae las ca ac e ís icas de al o ni el de la imagen de en ada. El
é mino con olución en ma emá icas hace e e encia a la combinación de dos unciones
pa a p oduci una e ce a unción. En el caso de una CNN, la con olución se ealiza sob e
una imagen de en ada usando un il o( ambién llamado ke nel) que p oduce un mapa
de ca ac e ís icas. Más especí icamen e, la con olución es ejecu ada deslizando el il o
sob e la imagen de en ada. En cada localización, la mul iplicación ma icial se ealiza y
la suma del esul ado se gua da en el mapa de ca ac e ís icas. La siguien e imagen e leja
es a ope ación:
18
Figu a 4.4: El il o se desliza sob e la en ada y la ope ación iene un esul ado que se
almacena en la nue a capa. Fuen e [13]
Una CNN necesi a no es a limi ada en el núme o de capas con olucionales, así que, se
suelen aplica sucesi amen e. T adicionalmen e, la p ime a capa con olucional es espon-
sable de cap u a ca ac e ís icas de bajo ni el como los bo des, el colo , la o ien ación del
g adien e, e c. Con o me se añaden capas, la a qui ec u a se adap a a las ca ac e ís icas
de al o ni el, p opo cionando a la ed una comp ensión o al de las imágenes del da ase .
La capa Pooling se enca ga de educi el amaño espacial de las ca ac e ís icas con olu-
cionadas. El obje i o es educi el cos e compu acional eque ido pa a p ocesa los da os
educiendo la dimensionalidad de es os. Además, pe mi e ex ae las ca ac e ís icas do-
minan es que son in a ian es en e a o aciones y cambios de posición, man eniendo la
e ec i idad del modelo du an e el en enamien o.
Se dis inguen dos ipos de capas pooling: Max Pooling y A e age Pooling. Max Pooling
de uel e el máximo alo de la po ción de imagen analizada, mien as que po o o
lado, A e age Pooling de uel e la media de odos los alo es de la po ción de imagen
analizada. En gene al, Max Pooling o ece un mejo endimien o. La siguien e imagen
ilus a la ope ación max pooling desc i a:
19
Figu a 4.5: Max pooling oma los alo es más g andes. Fuen e [13]
La capa Con olucional y la capa Pooling, o man jun as la capa i-ésima de una CNN.
Dependiendo de la complejidad de la imagen, el núme o de capas puede aumen a pa a
cap u a incluso mas de alles a bajo ni el, pe o con un inc emen o del cos e compu acio-
nal.
Figu a 4.6: Capa Fully-Connec ed y Red Neu onal Feed-Fo wa d. Fuen e [12]
T as la sucesi a aplicación de es as capas, el modelo es capaz de econoce las p incipales
ca ac e ís icas. La salida de es e p oceso suele se la en ada de una capa Fully-Connec ed.
Es a capa pe mi e ap ende las elaciones no-lineales en e las ca ac e ís icas cap u adas
po las capas an e io es.
20
Finalmen e, la salida la capa Fully-Connec ed pe mi e alimen a a una ed neu onal
Feed-Fo wa d. Es a ed neu onal, median e los sucesi os en enamien os ap ende á a
dis ingui en e las ca ac e ís icas dominan es y las ca ac e ís icas a bajo ni el de las
imágenes, pe mi iéndole clasi ica las imágenes en la ca ego ía co espondien e.
Finalmen e menciona que aunque en es e abajo se ha que ido ealiza un b e e in o-
ducción de las CNN, exis en nume osas a qui ec u as de CNN disponibles, cada una con
sus ca ac e ís icas especi icas y sus en ajas pa a de e minados p oblemas. Algunas de
las más conocidas son:
LeNe [66]
AlexNe [1]
GoogLeNe [9]
ResNe [30]
4.2.2. T ans e Lea ning
T ans e Lea ning es una écnica que pe mi e abo da dos de los p incipales p oblemas
del deep lea ning:
Al a in e sión en iempo de een enamien o de edes neu onales debido a conjun os
de da os con can idades de da os masi as.
Eno me gas o de ecu sos compu acionales pa a el een enamien o de edes.
Es e mé odo basado en la u ilización del conocimien o ap endido po un modelo as se
en enado sob e un da ase con el in de educi el iempo de een enamien o [51]. La
idea es een ena el modelo sob e un nue o da ase pa iendo del conocimien o adqui-
ido po el modelo sob e el da ase an e io , con el obje i o de acele a el p oceso de
een enamien o. A menudo, la ans e encia del ap endizaje se p oduce de un modelo
mas complejo hacia un modelo mas sencillo. En nues o caso, las edes es án en enadas
sob e el da ase gene alis a COCO [33]. Es e conjun o de da os es a en ocado en la de-
ección y localización de 90 ipos de obje os, y usamos ans e lea ning, pa a acele a
el een enamien o sob e los conjun os de da os de conducción au ónoma usados en es e
p oyec o.
En la siguien e imagen ilus amos como se p oduce es e p oceso de ans e encia de
conocimien o desde un modelo mas complejo hacia un modelo mas sencillo:
21
Figu a 4.7: T ans e Lea ning. Fuen e [62]
En el con ex o de las CNN, ans e lea ning se implemen a omando los pa áme os de
la capa de cap ación de ca ac e ís icas pa a inicializa la capa de cap ación de ca ac e ís-
icas sob e el nue o da ase . En conc e o, se suelen coge los pa áme os de las capas que
se enca gan de cap a las ca ac e ís icas de bajo ni el como los bo des, ex u as, esquinas
y o mas; pues es ás son ca ac e ís icas p esen es en odos los conjun os de da os.
En el campo de la de ección de obje os, se equie e aun mas p ocesamien o po pa e
de las capas as la ex acción de ca ac e ís icas, pues se sigue de un clasi icado , ya
que la de ección de obje os debe p edeci no solo la clase del obje o, sino su localización
ambién. Es o implica que el een enaminen o de es as edes sea muy cos oso en iempo
y capacidad de cómpu o. G acias a es e mé odo, e i amos necesi a de semanas pa a
een ena las edes.
5. A qui ec u as de De ección de Obje os
Den o de las a qui ec u as deep lea ning se dis inguen dos líneas de in es igación a día
de hoy, siendo la p ime a mas an igua que la segunda. La p ime a se conoce como a -
qui ec u a de dos ases, gene ando p ime o egiones candida as de la localización del
obje o en la imagen y pos e io men e clasi icando los obje os asignándole una ca ego ía,
po ejemplo en es e caso: coche, ciclis a o pea ón. Es e ipo de de ec o es ambién se les
conoce po de ec o es de obje os basados en egiones.
Po o o lado, el segundo ipo de de ec o es se conocen po ene una a qui ec u a de
una sola ase. Es os ealizan una abs acción mayo , pues en el p oblema de de ec-
ción de obje os como un p oblema de eg esión(es imación de las cajas delimi ado as)
22
y clasi icación. De es a o ma, en una sola ase, son capaces de in e i la localización y
clasi icación del obje o.
5.1. A qui ec u as de dos ases
Las a qui ec u as de dos ases son ambién conocidas como las a qui ec u as basadas
en egiones. El nacimien o de es as a qui ec u as se p odujo en 2012, cuando AlexNe
[1] ganó el desa ío ILSVRC, ayendo consigo el dominio de las CNN al campo de la
de ección de obje os. Un en oque po ue za b u a de de ección de obje os es usa una
en aja deslizan e de izquie da a de echa, de a iba a abajo pa a iden i ica obje os
usando clasi icación. Un ejemplo se ía la imagen in e io :
Figu a 5.1: Ven ana deslizan e de izquie da a de echa sob e la imagen. Fuen e: [49]
Como emos en la igu a supe io , si que emos de ec a di e en es obje os debemos usa
en anas de amaños y o mas a iadas. En cada paso de deslizamien o de la en ana
se eco an pa ches de la imagen según es as en anas. P e iamen e a alimen a la ed
con olucional clasi icado a, el pa che es edimensionado a la en ada de la ed, que a
menudo suele se ija. Es e ipo de ans o maciones no impac an la p ecisión de la ed,
ya que es án en enados pa a maneja es as imágenes. Es a ed se enca ga de ex ae un
núme o de e minado de ca ac e ís icas del pa che. Luego se aplica SVM(suppo ec o
machine) sob e las ca ac e ís icas ex aídas pa a iden i ica a que clase pe enece el
obje o encuad ado en el pa che. Además, usamos un mé odo de eg esión lineal sob e las
ca ac e ís icas pa a es ima los lími es de la cajas delimi ado as. En la imagen in e io
podemos e como se ía es a a qui ec u a:
23
Figu a 5.2: A qui ec u a basada en un en oque de ue za b u a. Fuen e: [49]
Sin emba go el en oque po ue za b u a es demasiado cos oso en iempo de in e encia
y en enamien o, así como in ensi o en ecu sos compu acionales. Una mejo a ob ia es
educi el núme o de en ajas deslizan es. De es a o ma, se c ea un mé odo que se
enca gue de p opone egiones de in e és oROIs a pa i de una imagen. Un ejemplo
de es e mé odo es la búsqueda selec i a.
Al comienzo cada píxel es un g upo en si mismo. Pos e io men e, se calcula la ex u a
de cada g upo y se unen aquellos que sean mas simila es. Con el obje i o de e i a
que los g upos g andes se coman a los pequeños, end án p io idad la unión de g upos
pequeños en e a los g andes. Se con inua es e p oceso de unión has a que se cumpla
alguna condición de con e gencia. En la imagen in e io , podemos e como es os g upos
se an o mando en la p ime a ila, mien as que los ec ángulos azules de la segunda
ila mues a odas las posibles egiones de in e és gene adas en cada paso de la búsqueda
selec i a.
24
Figu a 5.3: Mé odo de p oposición de egiones: búsqueda selec i a. Fuen e: [31]
En 2013 Ross Gi shick [50] p opone la p ime a a qui ec u a que hace uso de mé odos
de p oposición de egiones de in e és, R-CNN. Es a a qui ec u a p opone ce ca de 2000
ROIs po imagen. Luego cada egión se u iliza como en ada de una ed neu onal con-
olucional, de o ma que cada egión es p ocesada de mane a indi idual. Es e p oceso es
seguido de capas o almen e conexas que pe mi en ealiza la clasi icación del obje o y la
es imación de la caja delimi ado a. En la imagen in e io podemos e es a a qui ec u a:
Figu a 5.4: A qui ec u a del de ec o R-CNN. Fuen e: [49]
25
5.2.2. YOLO
Los sis emas de de ección ac uales eu ilizan clasi icado es pa a ealiza la de ección. Pa a
de ec a un obje o, es os sis emas oman un clasi icado pa a ese obje o y lo e alúan a lo
la go de la imagen en a ios luga es y escalas. Los sis emas como los modelos de pa es
de o mables o de o mable pa s models (DPM) u ilizan un en oque de en ana co ediza
en el que el clasi icado se ejecu a en luga es uni o memen e espaciados en oda la imagen.
En oques más ecien es como el R-CNN u ilizan mé odos como p opues a de egiones
pa a gene a p ime o las po enciales cajas delimi ado as en una imagen y luego ejecu-
a un clasi icado en cada una de es as cajas p opues as. Después de la clasi icación, el
pos -p ocesamien o se u iliza pa a e ina las cajas delimi ado as, elimina las de eccio-
nes duplicadas, y ol e a clasi ica las cajas en base a o os obje os de la imagen. Es os
sis emas son len os y di íciles de op imiza po que cada componen e indi idual debe se
en enado po sepa ado.
YOLO [46] eplan ea la de ección de obje os como un único p oblema de eg esión, di-
ec amen e de los píxeles de la imagen a las coo denadas de la caja delimi ado a y las
p obabilidades de clase. En es a nue a o ma de a on a la de ección p opues a po
YOLO, una sola ed con olucional p edice simul áneamen e múl iples cajas delimi a-
do as y p obabilidades de clase pa a esas cajas. Podemos e una ilus ación de es e
uncionamien o en la igu a 5.13. YOLO se en ena en imágenes comple as y op imiza
di ec amen e el endimien o de la de ección. Es e modelo uni icado iene a ios bene icios
sob e los mé odos adicionales de de ección de obje os:
YOLO es ex emadamen e ápido. Al en oca la de ección como un p oblema
de eg esión, no se necesi an sis emas complejos. Simplemen e se ejecu a la ed neu-
onal en una nue a imagen pa a p edeci las de ecciones. Además, YOLO alcanza
más del doble de la p ecisión media de o os sis emas en iempo eal.
YOLO abaja globalmen e sob e la imagen. A di e encia de las écnicas de
en ana co ede a y p opues as de egiones, YOLO e oda la imagen du an e
el iempo de en enamien o y p ueba, de mane a que implíci amen e codi ica la
in o mación con ex ual sob e las clases, así como su apa iencia.
YOLO ap ende ep esen aciones gene alizables de obje os. Cuando se en ena
en imágenes na u ales, YOLO supe a los mé odos de de ección más a anzados
como el DPM y R-CNN po un amplio ma gen. Dado que YOLO es al amen e
gene alizable, es menos p obable que se descomponga cuando se aplica a nue os
dominios o en adas inespe adas.
A pesa de es as en ajas, YOLO oda ía se queda a ás de los sis emas de de ección de
úl ima gene ación en la p ecisión. Aunque puede iden i ica ápidamen e los obje os en
las imágenes, iene p oblemas pa a localiza con p ecisión algunos obje os, especialmen e
los pequeños.
32
Figu a 5.12: Es uc u a de la es uc u a de ed con olucional de la p ime a e sión de
YOLO, con 24 capas con olucionales seguidas po dos capas o almen e
conec adas. Fuen e [46].
YOLO ha ido publicando a ias e siones, desde la e sion inicial cuya es uc u a pode-
mos e en la igu a 5.12 has a la úl ima de ellas YOLO 4[8] publicada el 23 de Ab il de
2020, pasando po las e siones YOLO 3[48] y YOLO 3 iny[25], la cual se á de especial
in e és debido a su meno amaño y po an o mayo apidez, una ca ac e ís ica un-
damen al en la conducción au ónoma pa a in en a consegui p ocesamien o en iempo
eal.
Funcionamien o global de es uc u as YOLO
La iloso ía de las es uc u as YOLO consis e en uni ica los di e en es componen es de
la de ección de obje os en una sola ed. El uncionamien o global de la in e encia, que
podemos e de mane a isual en la igu a 5.13, es el siguien e:
1. P ime amen e, la imagen es di idida en una cuad ícula de amaño SxS. Si el cen o
de un obje o cae en una celda de la cuad ícula, esa celda es la esponsable de
de ec a el obje o.
2. Cada celda de ec a Bcajas delimi ado as y ni el de con ianza pa a dichas cajas,
que e lejan cómo de segu o es á el modelo de que esa caja con iene un obje o y
cómo de segu o es á de que e ec i amen e la caja se co esponde al obje o que ha
de ec ado, es deci , Con ianza =P(Obje o)∗IOU u h
p ed . Si no hay obje o en esa
celda, la con ianza debe ía de se 0, en o o caso debe ía se el IOU en e la caja
de ec ada y la ead.
3. Cada una de las cajas delimi ado as es á compues a po 5 p edicciones: x, y, w, h
y la con ianza. (x, y) ep esen a el cen o de la caja de ec ada y (w, h)la anchu a
33
Figu a 5.13: Ilus ación del uncionamien o global de YOLO, donde p ime o se di ide la
imagen en cuad ículas más pequeñas, sob e és as se calculan di e en es cajas
delimi ado as o bounding boxes y las p obabilidades de las dis in as clases,
y inalmen e se ob ienen las de ecciones. Fuen e [46].
y al u a espec i amen e.
4. Además, cada celda de la cuad ícula ambién p edice Cp obabilidades condicio-
nales P(Clasei|Obje o), una po cada clase, que ep esen an las p obabilidades de
que en esa celda se encuen e el obje o de la clase i. Rema ca que se p edice un
ec o de Cp obabilidades condicionales po cada celda, independien emen e del
núme o de cajas de ec adas B.
5. En la in e encia, se mul iplican las p obabilidades condicionales de cada clase y la
con ianza de cada caja de ec ada, ob eniendo así las p obabilidades especí icas de
cada clase po cada caja de ec ada:
P(Clasei|Obje o)∗P(Obje o)∗IOU u h
p ed =P(Clasei)∗IOU u h
p ed
Es a medida nos indica la p obabilidad de que cada clase apa ezca en las cajas
de ec adas y cómo de bien se ajus a dicha caja.
YOLO 3
Vamos a menciona b e emen e las mejo as que implemen a YOLO 3 con espec o a la
p ime a e sión, alguna de es as mejo as implemen adas en YOLO 2 y o as inalmen e
en YOLO 3:
34
No malización de los lo es en las capas con olucionales.
Clasi icado de al a esolución
Úl ima capa con olucional con ancho boxes o cajas de anclaje, ambién llamadas
cajas a p io i. En ez de p edeci di ec amen e las cajas, se p edicen los o se s
con espec o a unas cajas de anclaje p e iamen e p ede inidas. Es o es muy ú il
pues podemos de ini dichas cajas de anclaje pa a que se adecuen a la o ma de los
obje os de nues o da ase .
Clus e s dimensionales: Como hemos mencionado, en muchos p oblemas de de ec-
ción los obje os ienen una o ma de e minada. Pa a calcula las Kcajas a p io i
que mejo cub en es a gama de o mas en un da ase , se u iliza el algo i mo K-
Means.
P edicción di ec a de la localización
P edicción de cajas delimi ado as
Pa a la p edicción de las cajas delimi ado as u iliza la misma me odología que YOLO9000[47].
La ed p edice 4 coo denadas pa a cada caja delimi ado a x, y. w, h, de o ma que si
la celda de la cuad ícula iene un o se con espec o a la esquina supe io izquie da de
la imagen de (cx, xy)y la caja delimi ado a a p io i iene anchu a pw, ph, en onces las
p edicciones inales son:
bx=σ( x) + cx
by=σ( y) + cy
bw=pwe w
bh=phe h
Es deci , la ed p edice o se s con espec o a cajas a p io i o cajas de anclaje (ancho
boxes). Podemos e una isualización de es as ecuaciones en la igu a 5.14 Es o es muy
ú il pues en muchos p oblemas de de ección los obje os ienen una o ma de e minada.
Po an o, podemos de ini dichas cajas de anclaje pa a que se adecuen a la o ma de
los obje os de nues o da ase . Pa a calcula las Kcajas a p io i que mejo cub en es a
gama de o mas en un da ase , se u iliza el algo i mo K-Means.
Du an e el en enamien o se usa la suma de cuad ados como unción de pé dida, de o ma
que el g adien e iene dado po ˆ
∗− ∗donde ˆ
∗es el o se p edicho po la ed y ∗es el
o se eal.
YOLO 3 p edice una pun uación de obje o pa a cada caja delimi ado a usando eg esión
logís ica. Si el cuad o delimi ado a p io i no es la mejo , pe o se supe pone a un obje o
po encima de un umb al (en es e caso 0.5), se igno a la p edicción.
35
Figu a 5.14: Cajas delimi ado as con dimensiones p e ias y p edicciones. Se p edice el
ancho y la al u a de la caja como o se s desde el cen o de la caja. Fuen e
[48].
P edicción de clases
Cada casilla p edice las clases que puede con ene la caja delimi ado a u ilizando la clasi-
icación mul i-e ique a, usando pa a ello clasi icado es logís icos independien es. Du an e
el en enamien o se usa como unción de pé dida la en opía c uzada bina ia.
P edicciones en di e en es escalas
YOLO 3 ealiza p edicciones en 3 escalas di e en es. El sis ema ex ae ea u es o ca-
ac e ís icas de cada una de es as 3 escalas u ilizando un concep o simila a las edes
pi amidales de ca ac e ís icas o ea u e py amid ne wo ks[32]. En la es uc u a, después
de las capas de ex acción de ca ac e ís icas se añaden di e en es capas con olucionales,
la úl ima de ellas enca gada de p edeci un enso 3d codi icando las p edicciones de cajas
delimi ado as, p obabilidad de con ene un obje o y p edicciones de clase. Así, el enso
inal es de la o ma N×N×(Nboxes ∗(4+1+Nclasses)donde Nboxes es el núme o de
cajas p edichas en cada escala, 4 se co esponde a los o se s de la caja delimi ado a, 1 a
la p edicción del obje o o p obabilidad de con ene un obje o y Nclasses es el núme o de
clases del da ase .
A se coge el ea u e map o mapa de ca ac e ís icas de las dos capas an e io es y se
aumen a en 2×. También se coge un mapa de ca ac e ís icas de las capas an e io es de la
ed y se usiona con las ca ac e ís icas aumen adas usando conca enación. Es e mé odo
nos pe mi e ob ene in o mación semán ica más signi ica i a.
Se ealiza el mismo p oceso una ez más pa a p edeci cajas pa a la escala inal. Así, las
p edicciones pa a la 3aescala se bene ician de odos los cálculos p e ios.
36
Figu a 5.15: Ex ac o de ca ac e ís icas Da kne -53. Fuen e[48].
Ex ac o de ca ac e ís icas
Se u iliza un en oque híb ido en e el ex ac o de ca ac e ís icas u ilizado po YOLO 2
(Da kne -19) y capas esiduales. U iliza capas con olucionales sucesi as de 3×3y1×1,
con algunas in e conexiones o a ajos. Tiene 53 capas con olucionales en o al y ecibe el
nomb e de Da kne -53. Podemos e un esumen de su es uc u a en la igu a 5.15.
En el caso de YOLO 3 iny la es uc u a se educe conside ablemen e a un o al de 15
capas con olucionales, lo que aumen a conside ablemen e su elocidad en la in e encia
pe o sac i ica p ecisión, sob e odo en obje os muy pequeños.
Compa ación con o as es uc u as
Podemos e una compa ación en los esul ados inales con o as es uc u as popula es
pa a la de ección de obje os en la igu a 5.16
37
Figu a 5.16: Compa ación dis in as es uc u as de edes neu onales con olucionales don-
de podemos obse a el adeo o balance en e elocidad y p ecisión pa a .5
IOU, des acando YOLO 3 po su g an elocidad y man eniendo una buena
p ecisión. Fuen e[48].
YOLO 4
Ha emos un b e e comen a io sob e la úl ima e sión de YOLO, YOLO 4 [8], que p e-
sen a mejo as conside ables con espec o a su p edeceso , YOLO 3, an o en elocidad
de in e encia como en p ecisión de en o no a un 10-12%, como podemos obse a en
la igu a 5.16. Podemos además encon a una desc ipción muy de allada jun o a los
pa áme os que u iliza la ed en es e enlace.
Sin emba go, aunque es una p opues a muy in e esan e pa a la conducción au ónoma po
su g an elocidad en cuan o a FPS y man eniendo una muy buena p ecisión con espec o
a o os de ec o es de úl ima gene ación, no lo a a emos en es e abajo debido a que uno
de los obje i os inales es la e aluación de es as es uc u as o edes en disposi i os de bajo
consumo, u ilizando pa a ello el amewo k openVINO 9.2, el cual no iene implemen ado
aún sopo e pa a es a es uc u a.
6. P esen ación de conjun os de da os u ilizados
Los esul ados de las edes de más conocidas de de ección de obje os han sido decepcio-
nan es sob e el da ase KITTI como se mues a en la sección 11.1. En ellos se obse a un
cla o p oblema pa a la localización y de ección de los obje os en las imágenes p esen es
en el da ase KITTI. El p oblema se e especialmen e acen uado en las clases pea ón
y ciclis a. Uno de los p incipales desa íos que in en a emos sol en a en es e p oyec o
38
Figu a 5.17: Compa ación de la p opues a YOLO 4 y o os de ec o es de obje os de
úl ima gene ación. YOLO 4 mejo a la p ecisión media (AP) y los FPS de
YOLO 3 en un 10 % y un 12 %, espec i amen e. Fuen e[8].
es como mejo a la p ecisión de nues as edes en las clases pea ón y ciclis a sin pe de
p ecisión a la ho a de localiza un clasi ica obje os de la clase coche.
En e las soluciones p esen adas, en es a sección de alla emos como hemos aumen ado
el núme o de obje os po clase, log ando así un mayo conjun o de en enamien o. La
idea es que es e aumen o de obje os de las es clases pe mi a aumen a la capacidad
de de ección y localización de las edes es udiadas. Pa iendo del da ase KITTI, donde
ealizamos una sepa ación alea o ia en e los conjun os de en enamien o y es , eniendo
así un 80% pa a en enamien o y un 20% pa a es .
Los da ase s u ilizados pa a aumen a las imágenes de las clases coche, pea ón y ciclis a
deben se simila es a las imágenes ecolec adas en el da ase KITTI. Como e emos en
es a sección, es os conjun os han sido c eados basados en un en o no de conducción, es
deci , g abadas desde un coche. Pos e io men e las imágenes son il adas de o ma que
omemos aquellas imágenes g abadas du an e el día y en buenas condiciones clima oló-
gicas. La azón de es e il o se debe a que el obje i o es mejo a la p ecisión sob e el
conjun o de es del da ase KITTI, luego el conjun o de en enamien o debe se simila
al conjun o de es . En pa icula , las imágenes del es cumplen es as condiciones. So-
mos conscien es que en un p oblema eal de conducción au ónoma un ehículo debe ía
se capaz de conduci de o ma au ónoma en cualquie si uación clima ológica ad e sa,
sin emba go es e p oyec o se cen a en una simpli icación del p oblema eal.
39
6.1. KITTI
El conjun o de da os KITTI [5] ue p esen ado en 2012. El da ase de de ección de obje os
consis e en 7481 imágenes a colo de di e en es escenas, almacenadas como imágenes png.
El amaño de las imágenes es ap oximadamen e 375×1275, ya que el amaño no es ijo y
cambia lige amen e a lo la go del da ase . Las imágenes ue on omadas po una cáma a
colocada sob e un coche mien as se conducía po zonas u ales y u banas en buenas
condiciones clima ológicas y du an e el día. El ehículo que g abó las imágenes es el
siguien e:
Figu a 6.1: Coche que ealizó los ídeos en los que se basa el da ase KITTI. Fuen e [5]
En cada imagen se e ique an odos los obje os que pe enezcan a alguna de la siguien e
ca ego ías:
Ca
Van
T uck
Pedes ian
Pe son(si ing)
Cyclis
T am
Miscelanous
En la igu a 6.2 emos el núme o de ins ancias po clase de obje o:
40
Figu a 6.2: Núme o de ins ancias po clase en el da ase KITTI.Fuen e [5]
Es ácilmen e ap eciable el desbalanceo de clases p esen e en el conjun o de da os KITTI.
En nues o caso, es ingimos el p oblema a las clases coche, pea ón y ciclis as. Su ge de
o ma na u al la necesidad de aumen a el conjun o de imágenes de en enamien o con
p esencia de pea ones y ciclis as, pues se obse a un cla o desequilib io en e el núme o
de obje os po clase. Además de la e ique a de clase, ambién con ienen in o mación
de las cajas delimi ado as en 2D, cuyas coo denadas son exp esadas en píxeles. Toda
la in o mación de las e ique as es almacenada en un a chi o . x que se c ea pa a cada
imagen. Un ejemplo de es e da ase podemos e lo en la siguien e imagen:
Figu a 6.3: Ejemplo e ique ado del da ase KITTI.
41
donde TP ep esen a ue posi i e, FP ep esen a alse posi i e y FN ep esen a
alse nega i e.
2. Recall: mide la capacidad del modelo de de ec a casos posi i os, en es e caso,
obje os que pe enezcan a alguna de las clases del da ase . Una de inición mas
ma emá ica se ía:
Recall =T P
T P +F N
po an o ecall es un po cen aje de los casos posi i os co ec amen e ace ados.
8.2. IOU
Además de los concep os de p ecision y ecall, necesi amos de ini IOU pa a pode ex-
plica mAP. In e sec ion O e Union o IOU mide el á ea de in e sección en e dos cajas
delimi ado as. Ma emá icamen e se ia el cocien e del á ea de in e sección y el á ea de la
unión de las cajas:
IOU =a ea de in e seccion
a ea o al de la union
Es a mé ica nos pe mi e es ablece cuando una p edicción ealizada po un obje o es
buena o no. Habi ualmen e se es ablece un umb al a pa i del cual damos po buena
una p edicción, en es e p oyec o hemos omado po buenas aquellas p edicciones que
supe a an el 0,5de es e alo . La siguien e igu a mues a la in e sección en e una caja
delimi ado a p edicha y la eal e ique ada en la imagen, conocida po g ound u h:
48
Figu a 8.1: In e sec ion O e Union. Fuen e [27]
8.3. AP y mAP
Po o o lado in oducimos a e age p ecision o AP. Si ep esen amos en un g á ico o-
mando como ejes y = p ecisión y eje x = ecall, AP es el á ea bajo la cu a, es deci ,
bajo el g á ico gene ado po ambas mé icas. Un ejemplo lo emos en la siguien e g á ica:
Figu a 8.2: A ea bajo la cu a de la g á ica p ecición- ecall. Fuen e [27]
49
La de inición ma emá ica mas conocida es:
AP =Z1
0
p( )d
donde p( )es la cu a o mada po el g á ico p ecisión- ecall. Finalmen e de inimos mAP
como la media de AP pa a un umb al de IOU dado. Un umb al clásico pa a IOU es [0.5,
0.05, 0.95], de es a o ma mAP se á la media de los alo es AP pa a cada alo de IOU,
que a desde 0.5 a 0.95 con un paso de 0.05.
9. F amewo ks
En es e capí ulo amos a p esen a b e emen e los amewo ks u ilizados an o pa a el
en enamien o de los modelos como pa a ealiza la in e encia en dis in os disposi i os
9.1. Tenso low
Tenso Flow es una pla a o ma o amewo k de código abie o de ex emo a ex emo pa a
el ap endizaje au omá ico. Cuen a con un ecosis ema in eg al y lexible de he amien as,
biblio ecas y ecu sos de la comunidad que les pe mi e a los in es igado es impulsa un
ap endizaje au omá ico inno ado y, a los desa ollado es, compila e implemen a con
acilidad aplicaciones con ecnología de ap endizaje au omá ico. Fue o iginalmen e desa-
ollado po el equipo de Google B ain, eemplazando a su p edeceso de código ce ado,
Dis Belie .
Tenso low pone a nues a disposición una se ie de ecu sos que acili an la c eación,
en enamien o y alidación de modelos pa a el ap endizaje au omá ico:
Modelos y conjun os de da os: Modelos p e iamen e en enados y conjun os de
da os que Google y la comunidad han desa ollado
He amien as: Ecosis ema de he amien as pa a ayuda al usua io con Tenso Flow
Biblio ecas y ex ensiones: Biblio ecas y ex ensiones c eadas en Tenso Flow
P og ama de ce i icación de Tenso Flow
Ap ende AA: Recu sos educa i os pa a ap ende los aspec os básicos del AA con
Tenso Flow
9.1.1. Objec De ec ion API
En nues o caso, u iliza emos en conc e o la API de de ección de obje os [60] pa a el en-
enamien o de los siguien es modelos o edes neu onales con olucionales p opo cionadas
50
po Tenso low p e iamen e en enados sob e el conjun o gene alis a COCO[10]. Es os
modelos los podemos encon a en el objec de ec ion model zoo [59] de enso low.
SSD mobilene incep ion V2 COCO
SSDLi e mobilene incep ion V2 COCO
Fas e R-CNN incep ion V2 COCO
Den o de es a API encon amos a ios elemen os que usa emos du an e los en enamien-
os:
model_main.py: Se a a del sc ip de py hon que se u iliza pa a el en enamien o
de las edes con olucionales pa a la de ección de obje os. Implemen a además la
e aluación del modelo sob e un conjun o de alidación cada cie o iempo pa a e
la e olución del modelo y no solo de la unción de pé dida. En e sus pa áme os
podemos encon a :
•pipeline_con ig_pa h: Ru a al a chi o de con igu ación, que pasamos a ilus a
b e emen e más abajo.
•model_di : Ru a donde que emos que se gua de el modelo een enado jun o
a los úl imos checkpoin s gene ados.
•num_ ain_s eps: Núme o máximo de pasos a ealiza en el en enamien o.
•sample_1_o _n_e al_examples: Tamaño ela i o del da ase de alidación
omado pa a cada e aluación
model zoo [59]: Ca pe a con los modelos p een enados o ecidos po el amewo k.
Aquí podemos encon a los modelos an e io men e mencionados.
samples: En es a ca pe a encon amos algunos ejemplos. Nos se á de especial u i-
lidad la subca pe a con igs, donde podemos encon a plan illas de con igu ación
pa a las dis in as edes.
me ics: Ca pe a con dis in as mé icas a usa . En nues o caso u iliza emos las
mé icas de COCO.
da ase _ ools: Ca pe a donde podemos encon a dis in as he amien as. En
nues o caso u iliza emos el sc ip c ea e_ki i_ _ eco d pa a gene a los a chi os
enso low eco ds, que u iliza á el amewo k an o pa a el en enamien o como
las alidaciones.
Cabe des aca que, como hemos mencionado an e io men e, nues as imágenes deben
se ans o madas p e iamen e a Tenso low eco ds pa a pode se p ocesadas po el
amewo k. El o ma o TFReco d es un o ma o simple pa a almacena una secuencia
de egis os bina ios, de mane a que sea más e icien e el almacenamien o y lec u a en
ba ches o lo es de los mismos.
51
Pasamos a desc ibi aho a b e emen e la composición del a chi o de con igu ación
a se usado en el een enamien o median e el sc ip model_main.py. Es e a chi o iene
es uc u a de JSON y nos encon amos los siguien es campos:
model: Nos pe mi e especi ica el modelo que amos a een ena jun o a los pa-
áme os especí icos del modelo y o o más gene ales como el núme o de clases, la
gene ación de ancho s, las unciones de pé dida y pos -p ocesamien o.
ain_con ig: En es e campo podemos especi ica pa áme os como el núme o de
imágenes po lo e, el op imizado a se u ilizado en el een enamien o (RMPS p op,
ADAM, e c), el checkpoin del que pa i si que emos ealiza un ine uning y no
un een enamien o desde 0, da a augmen a ion y dónde se encuen an nues as
imágenes en o ma o eco d pa a el een enamien o.
e al_con ig: Nos pe mi e especi ica las mé icas a u iliza (en nues o caso COCO),
el núme o de imágenes a u iliza en la e aluación, núme o de imágenes a isualiza
en cada e aluación, inclui mé icas po cada ca ego ía y dónde se encuen an
nues as imágenes en o ma o eco d pa a las e aluaciones.
9.1.2. Tenso boa d
Además, enso low pone a nues a disposición la he amien a Tenso boa d. Tenso Boa d
p opo ciona la isualización y las he amien as necesa ias pa a expe imen a con el ap en-
dizaje au omá ico, como po ejemplo:
Segui y isualiza mé icas, como la pé dida y la exac i ud o accu acy.
Visualiza el g a o del modelo (ope aciones y capas)
Mos a imágenes
Podemos e un ejemplo de su in e az g á ica en la igu a 9.1.
52
Figu a 9.1: In e az g á ica de Tenso boa d.
Usa emos es a he amien a pa a supe isa el ap endizaje de nues as edes, ya que
pod emos i iendo en cada i e ación las unciones de pé dida, el accu acy y algunas
imágenes mos ando las de ecciones que ealiza nues a ed.
9.2. Open ino oolki
OpenVINO [43] (Open Visual In e ence and Neu al ne wo k Op imiza ion) oolki es un
ki de he amien as g a ui o que acili a la op imización de un modelo de Deep Lea -
ning o Ap endizaje P o undo p oceden e de di e en es amewo ks y la implemen ación y
ejecución median e un mo o de in e encia en el ha dwa e de In el. El ki de he amien-
as iene dos e siones: OpenVINO oolki , que es apoyado po la comunidad de código
abie o y la dis ibución de In el(R) de OpenVINO oolki , que es apoyado po In el.
El p incipal componen e de es e ki de he amien as es el Deep Lea ning Deploymen
Toolki (DLDT), que nos o ece dos uncionalidades p incipales:
1. Gene a a chi os IR (Rep esen ación In e media) haciendo uso del op imizado
de modelos a pa i de un modelo en enado o uno público.
2. Ejecu a la in e encia haciendo uso del mo o de in e encia en los disposi i os
ha dwa e especi icados
9.2.1. Ca ac e ís icas p incipales
Pe mi e ealiza in e encia sob e modelos de ap endizaje p o undo basados en edes
neu onales con olucionales
53
Admi e la ejecución he e ogénea a a és de una CPU In el R
, G á icos In eg ados
In el R
, In el R
FPGA, In el R
Mo idiusTM Neu al Compu e S ick, In el R
Neu al
Compu e S ick 2 e In el R
Vision Accele a o Design con VPU In el R
Mo idiusTM.
Acele a el iempo de come cialización a a és de una biblio eca ácil de usa con
uncionalidades de isión po o denado y núcleos p eop imizados
Incluye llamadas op imizadas pa a los es ánda es de isión a i icial, incluyendo
OpenCV* y OpenCLTM
9.3. Da kne
Da kne [45] es un amewo k o en o no pa a edes neu onales de código abie o esc i o
en C y CUDA. Es ápido, ácil de ins ala y sopo a compu ación de CPU y GPU. En
nues o caso u iliza emos la e sión de AlexeyAB, que podemos encon a en su eposi-
o io de gi hub[16].
En e las uncionalidades que nos o ece es e en o no, des acan las edes neu onales YO-
LO (You Only Look Once, sólo mi as una ez) que se ca ac e izan po aplica una sola
ed neu onal a oda la imagen, la cual di ide la imagen en egiones más pequeñas, luego
p edice las cajas delimi ado as y asigna p obabilidades pa a cada una de es as egiones.
És e hecho hace que la in e encia en es e ipo de es uc u as sea más ápida que en o o
ipo de es uc u as de edes con encionales.
P opo ciona dis in as uncionalidades, en e las que encon amos:
da kne .exe de ec o : Es el sc ip p incipal e implemen a las siguien es uncio-
nalidades en unción del segundo pa áme o que in oduzcamos:
• ain: En enamien o
• alid: Validación
•demo: Nos pe mi e ejecu a la ed sob e un a chi o de ideo o en iempo eal
u ilizando una cáma a.
c g: Ca pe a con plan illas de con igu aciones sob e dis in as edes.
sc ip s: Ca pe a con di e en es sc ip s que nos se an de u ilidad, como po ejem-
plo gen_ancho s.py, el cual u iliza K-Means pa a calcula de o ma óp ima las
dimensiones de los ancho s que u iliza an las dis in as capas de la ed.
9.4. Módulos
El ki de he amien as se encuen a encapsulado di e en es módulos o componen es.
Los p incipales y de los que ha emos uso se án los siguien es:
54
Deep Lea ning Deploymen Toolki : Es el componen e p incipal. Se subdi ide
en:
•Op imizado de modelos: Pe mi e impo a modelos y p epa a los pa a una
ejecución óp ima median e el mo o de in e encia. El Op imizado de Modelos
impo a, con ie e (a IR) y op imiza modelos de amewo ks como Ca e,
Tenso Flow, MXNe , Kaldi y ONNX.
•Mo o de in e encia: Una API uni icada pa a pe mi i la in e encia de al o
endimien o en dis in os ipos de ha dwa e.
•Samples: Un conjun o de aplicaciones sencillas de consola que demues an
cómo u iliza el mo o de in e encia.
•Tools: He amien as adicionales
Open Model Zoo: Nos o ece un conjun o de demos pa a u iliza el mo o de
in e encia, he amien as adicionales pa a desca ga modelos y medi la p ecisión
de los mismos y un conjun o de modelos p een enados jun o a documen ación
sob e los mismos.
Pos -T aining Op imiza ion ool: He amien a que pe mi e calib a modelos y
ealiza in e encia usando en e os de 8 bi s.
Deep Lea ning Wo kbench: En o no g á ico basado en la web que pe mi e u ili-
za ácilmen e a ios componen es so is icados del ki de he amien as OpenVINOTM.
Podemos e un ejemplo de la in e az g á ica en la igu a 9.2.
Figu a 9.2: In e az g á ica de la he amien a Deep Lea ning Wo kbench.
10. Expe imen os ealizados
Habla de la mejo a de la p ecisión y educción del e o g acias a dis in as écnicas como
da a augmen a ion, de ini nue os ancho s, ha d nega i e mining e c
55
En algun lado hay que p esen a las medidas de p ecision es udiadas, IOU,MAP, e c
10.1. Ancho Boxes
En la e apa de p edicción de múl iples obje os en una imagen, las edes neu onales como
SSD o YOLO, ealizan miles de p edicciones y solo mues an aquellas que deciden que
son un obje o.
El es ado del a e de los sis emas de de ección de obje os unciona de la siguien e mane a:
1. C ea miles de cajas po de ec o oancho boxes pa a cada p edic o de o ma que
ep esen e la o ma, amaño y localización del obje o que se especializa.
2. Pa a cada ancho box, calcula que obje o de la imagen iene la caja delimi ado a
con mayo IOU.
3. Si el IOU máximo es mayo del 50 %, en onces el ancho box que p edice el obje o
de la imagen que ob u o mayo IOU.
4. En caso con a io, el ancho box decidi á que no hay obje o.
Es e mé odo unciona bien en la p ác ica, pe o como emos las cajas po de ec o son
o almen e i ales pa a que nues o de ec o de obje os enga una buena capacidad de
p edicción. Po ejemplo si obse á amos los ancho s boxes gene ados po nues a ed
se ía algo así:
56
Figu a 10.1: Ancho Boxes gene ados po un de ec o de obje os. Fuen e [4]
Y en es a imagen solo es amos mos ando un bajísmo po cen aje de los ancho boxes
exis en es. Usa los ancho boxes po de ec o puede c ea p edic o es que es án demasiado
especializados y los obje os de la imagen se án incapaces de log a un IOU mayo de 50%
con alguna de las cajas po de ec o gene adas. De o ma que, la ed neu onal no sab á
que esos obje os exis en y nunca ap ende á de ellos. Po ello debemos de adap a las
cajas po de ec o pa a ene una o ma y amaño ideal pa a nues os obje os, log ando
cajas po de ec o mucho mas ajus adas. Un ejemplo de esas modi icaciones se ía:
57
conjun o KITTI. Como se ha comen ado an e io men e, es e hecho se debe a las di e en-
cias exis en es en e los conjun os de da os de en enamien o. Finalmen e compa amos
los esul ados ob enidos sob e la clase pea ón:
Figu a 11.5: Compa ación del mAP sob e la clase pea ón log ado po la ed SSD Incep-
ion en enada sob e KITTI y el da ase comple o.
En la igu a 11.5, se mues a una disminución sus ancial de la capacidad de de ección
de pea ones de la ed, siendo una disminución ce cana al 80 % en la capacidad de de ec-
ción de pea ones. La a ianza de los esul ados ob enidos sob e el da ase comple o ha
disminuido lige amen e, pe o un modelo mas es able no compensa la poca capacidad de
in e encia de pea ones.
Las azones del endimien o de la ed se han de allado an e io men e, señalando espe-
cialmen e al edimensionamien o de es a ed, a las di e encias de amaño de imagen de
los da ase s y la di e encia en la localización de los obje os en la imagen como g andes
p oblemas que in luyen eno memen e en la capacidad de de ección de la ed.
11.2. Resul ados de la ed Fas e R-CNN
En es a subsección amos a expone los esul ados de pa ida log ados po la ed Fas e
R-CNN sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado
po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una
compa ación del endimien o po clase log ado po la ed en ase de een enamien o.
11.2.1. Resul ados Fas e R-CNN sob e KITTI
Los esul ados de la ed sob e el conjun o de da os KITTI son los siguien es:
64
Figu a 11.6: mAP de las clases coche, ciclis a y pea ón
En la igu a 11.6, se obse a como es a ed iene una mayo capacidad de de ección que
SSD a simple is a. Es a ed po o o lado es mucho mas len a, algo que p oba emos
mas adelan e, siendo in iable pa a la in e encia en iempo eal sob e un ehículo. La
p ecisión log ada en la clase coche es supe io al 0,6, mien as que la de ección de
ciclis as p ác icamen e llega al 0,5 as 1000000 de épocas. Pea ón es la clase que mas
cues a localiza y clasi ica a es a ed, con una p ecisión supe io al 0,3. Finalmen e,
obse amos que es e modelo es mucho mas es able en sus de ecciones que SSD al ene
una meno a iabilidad en sus in e encias y iene una capacidad de p edicción en ase de
en enamien o mucho mayo a la de SSD, log ando una p ecisión ap oximada del 60 %
en coches, del 50 % en ciclis as y del 30 % en pea ones.
11.2.2. Resul ados Fas e R-CNN sob e el da ase comple o
Los esul ados de la ed sob e el conjun o de da os comple o son los siguien es:
65
Figu a 11.7: mAP de las clases coche, ciclis a y pea ón
En la igu a 11.7 se obse an unos esul ados peo es a los p esen ados sob e KITTI. Se
educe la capacidad de p edicción en odas las clases y se obse a una lige o aumen o
en la a ianza de la capacidad de de ección de obje os. Es e compo amien o se debe
a las di e encias en la localización de los obje os y el amaño de las imágenes comen-
adas an e io men e en e lo conjun os de da os KITTI, Be keley Deepd i e Da ase y
Tshingua-Daimle .
11.2.3. Compa ación de esul ados
En es a sección compa a emos clase a clase los esul ados ob enidos po es a ed has a
el momen o. Comenza emos compa ando la clase coche:
Figu a 11.8: Compa ación del mAP sob e la clase coche conseguido po la ed Fas e
R-CNN en enada sob e KITTI y el da ase comple o.
66
El núme o de épocas en enadas es de 1000000, dónde emos que al comienzo la p ecisión
es mayo sob e KITTI, pe o al inal e mina siendo lige amen e supe io sob e el conjun o
de da os comple o. En pa icula , se ha conseguido el obje i o de man ene o supe a la
p ecisión de la ed sob e KITTI en es a clase. Aho a emos los esul ados sob e la clase
ciclis a:
Figu a 11.9: Compa ación del mAP sob e la clase ciclis a conseguido po la ed Fas e
R-CNN en enada sob e KITTI y el da ase comple o.
En es a clase emos que se ha p oducido una descenso conside able en la p ecisión,
siendo es a di e encia mayo al comienzo del een enamien o y meno con o me es e
a anza. El obje i o de mejo a la p ecisión sob e es a clase no se ha log ado. Una de las
posibles azones es que es a ed ealiza un edimensionamien o meno de las imágenes,
a un amaño 600 ×1024, eniendo como consecuencia una educción del amaño de los
ciclis as. Además, los ancho boxes po de ec o de la ed no han sido uneados, luego
puede que no es én ajus ados una o ma adecuada pa a la clase ciclis a. O o posible
p oblema es que si los ciclis as se encuen an al inal de la imagen, y son pequeños,
pueden no se p opues os como egiones de in e és, eniendo como consecuencia que la
ed no ap enda las ca ac e ís icas necesa ias pa a la de ección p ecisa de ciclis as.
Finalmen e emos los esul ados sob e la clase pea ón:
67
Figu a 11.10: Compa ación del mAP sob e la clase pea ón conseguido po la ed Fas e
R-CNN en enada sob e KITTI y el da ase comple o.
Al comienzo del een enamien o se obse a una g an di e encia en e la p ecisión en la
de ección de la clase pea ón sob e ambos da ase s, sin emba go, al inal podemos e
como esa di e encia se ha educido comple amen e. El obje i o de mejo a la capacidad
p edic i a sob e la clase pea ón no se ha log ado, eniendo el mismo p oblema que la clase
ciclis a. Las azones son simila es a las expues as en la clase ciclis a, es deci , se a a
de obje os di íciles de de ec a debido a la posible ausencia de ancho boxes adecuados o
bien que su amaño en la imagen no es signi ica i o a se señalado como egión de in e és,
luego la ed no ap ende de los casos en el ondo de la imagen.
11.3. Resul ados de la ed SSD Mobile Li e
En es a subsección amos a expone los esul ados de pa ida log ados po la ed SSD
Mobile Li e sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado
po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una
compa ación del endimien o po clase log ado po la ed en ase de een enamien o.
11.3.1. Resul ados SSD Mobile Li e sob e KITTI
Los esul ados de la ed sob e KITTI son los siguien es:
68
Figu a 11.11: mAP de las clases coche, ciclis a y pea ón
Obse amos los esul ados sob e el een enamien o de 200000 épocas ealizado. A p ime-
a is a, emos unos esul ados in e io es a los log ados con la ed Fas e R-CNN, aunque
es os an en la línea de los log ados son SSD Incep ion, e incluso son mejo es que los de
es a ed. En la clase coche iene una p ecisión del 0,4, mien as que en la clase ciclis a
es de 0,15. La clase pea ón es la que mas p oblemas iene pa a localiza y clasi ica , con
un mAp ce cano al 0,1. En esumen, es capaz de de ec a ap oximadamen e el 40% de
los coches, el 15 % de ciclis as y el 10 % de pea ones. O a ca ac e ís ica de es a ed, es
que mues a una mayo es abilidad, al mos a esul ados menos olá iles en las dis in as
e aluaciones ealizadas du an e el en enamien o.
11.3.2. Resul ados SSD Mobile Li e sob e el da ase comple o
Los esul ados de la ed sob e el conjun o de da os comple o son los siguien es:
69
Figu a 11.12: mAP de las clases coche, ciclis a y pea ón
A p io i los esul ados son peo es que los conseguidos en KITTI, algo que e emos mas
de alladamen e en la siguien e sección. Al menos se man iene la es abilidad de las p e-
dicciones, aunque la p ecisión ha bajado en odas las clases de ec adas. En la clase coche
mues a una p ecisión po debajo de 0,4 as 120000 épocas, mien as que po o o lado
las clases pea ón y ciclis a ienen un mAp po debajo del 0,1. En la siguien e sección
e emos cla amen e que el da ase comple o disminuye la p ecisión de la ed, compo a-
mien o simila al is o en las edes SSD Incep ion y Fas e R-CNN.
11.3.3. Compa ación de esul ados
En es a sección compa a emos clase a clase los esul ados ob enidos po es a ed has a
el momen o. Comenza emos compa ando la clase coche:
70
Figu a 11.13: Compa ación del mAP sob e la clase coche conseguido po la ed SSD
Mobile Li e en enada sob e KITTI y el da ase comple o.
La igu a 11.13 mues a la meno capacidad de p ecisión sob e la clase coche en el da ase
comple o una ez se compa a con el KITTI. Es a di e encia no es supe io a dos pun os
po décima. Po o o lado emos los esul ados en la clase ciclis a:
Figu a 11.14: Compa ación del mAP sob e la clase ciclis a conseguido po la ed SSD
Mobile Li e en enada sob e KITTI y el da ase comple o.
La igu a 11.14 ep esen a la di e encia exis en e en e la capacidad de p edicción de
ciclis as po la ed una ez een enada sob e dis in os conjun os, siendo mucho meno
en el caso del conjun o de da os comple o. Finalmen e emos los esul ados sob e la clase
pea ón:
71
Figu a 11.15: Compa ación del mAP sob e la clase pea ón conseguido po la ed SSD
Mobile Li e en enada sob e KITTI y el da ase comple o.
Los esul ados ilus ados en la igu a 11.15 an en la línea de lo comen ado p e iamen e,
es deci , que la capacidad de p ecisión de la ed ha disminuido al aumen a el conjun o
de en enamien o con mas imágenes.
Además de ob se a un endimien o bajo en odas las clases, especialmen e acen uado
en las clases pea ón y ciclis a. Es e compo amien o se debe p incipalmen e a a ias
azones:
La a qui ec u a de la ed, de o ma que el edimensionamien o que ealiza penaliza
especialmen e a los obje os pequeños, como pueden se los ciclis a y pea ones en
una imagen.
Las di e encias de amaño de imagen de los conjun os KITTI, Be keley Deepd i e
Da ase y Tshingua-Daimle .
En el apa ado de conclusiones amplia emos las causas y mo i os de es e compo amien o.
11.4. Resul ados de la ed YOLO 3
En es a subsección amos a expone los esul ados de pa ida log ados po la ed YOLO 3
sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado po KITTI,
Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una compa ación
del endimien o po clase log ado po la ed.
72
11.4.1. Resul ados YOLO 3 sob e KITTI
Figu a 11.16: MAP du an e el een enamien o de la ed YOLO 3 sob e KITTI.
Como podemos e , el ap endizaje inicial es g ande g acias a ac o es como que el ex ac-
o de ca ac e ís icas es á p e iamen e en enado. El mAP sob e el conjun o de alidación
sigue aumen ando y iende a es abiliza se sob e odo en la clase coche en o no a las 20000
i e aciones, que con un amaño de 64 imágenes po lo e, equi ale a 1280000 imágenes
p ocesadas.
11.4.2. Resul ados YOLO 3 sob e el da ase comple o
Figu a 11.17: MAP du an e el een enamien o de la ed YOLO 3 sob e el da ase com-
ple o.
73
como al en ena sob e el da ase comple o, se pie de p ecisión, al se las imágenes de los
da ase s an dis in as y se meno el en enamien o o al.
13. Compa ación
13.1. MAP
En la siguien e igu a podemos obse a una compa ación del mAP ob enido en la in e-
encia inal sob e la pa ición es de KITTI de las dis in as edes, een enadas sob e
KITTI en azul y sob e el da ase inal en na anja:
Figu a 13.1: Compa ación del mAP ob enido po las dis in as edes.
Podemos obse a cómo en odas las edes se pie de p ecisión al een ena sob e el
da ase comple o o aumen ado. Es o no necesa iamen e indica que el modelo sea peo ,
simplemen e puede debe se a a ios ac o es como:
La e aluación únicamen e sob e un subconjun o del da ase KITTI.
La a iedad en los amaños y o mas de las cajas delimi ado as en e los dis in os
da ase s, al a a se el da ase KITTI de imágenes pano ámicas.
La exis encia de cajas delimi ado as con un á ea muy pequeña en el da ase aumen-
ado que, al abaja con edes que edimensionan y disminuyen mucho el amaño
de la imagen, puede no solo no apo a nada al en enamien o si no di icul a lo.
Al aumen a el amaño del da ase , se necesi e más iempo de en enamien o.
80
13.2. Velocidad de in e encia
En es e apa ado amos a compa a las dis in as edes en cuan o a elocidad de in e encia
se e ie e. Pa a ello, usa emos la mé ica FPS oF ames Po Segundo, que nos indica el
núme o de imágenes po segundo que es capaz de p ocesa dicha ed. Des aca que uno
de los obje i os es supe a el umb al de p ocesamien o en iempo eal de 20FPS.
Figu a 13.2: FPS alcanzado po las edes SSD, SDDLi e y Fas e -R-CNN ejecu adas
sob e di e en es disposi i os ha dwa e.
Podemos e como en e los dis in os disposi i os, My iad es el más len o y la CPU el más
ápido. También podemos obse a una di e encia in e esan e en cuan o a la GPU con un
modelo cuan izado con una p ecisión FP32, es deci , que abajo con a iables lo an es
de 32 bi s con espec o al mismo modelo cuan izado con FP16, mejo ando no ablemen e
la elocidad de la in e encia y sac i icando muy poca p ecisión en los esul ados inales.
És o es un concep o impo an e a ene en cuen a bajo el con ex o de la conducción,
donde la pé dida de un poco de p ecisión puede supone alcanza una elocidad de
p ocesamien o acep able. Po úl imo, emos como edes con más p ecisión como Fas e -R-
CNN se quedan muy lejos del umb al de p ocesamien o en iempo eal de 20FPS, mien as
que edes más lige as como SSD o SSDLi e lo supe an en casi odos los disposi i os.
81
Figu a 13.3: FPS alcanzado po ambas edes YOLO ejecu adas sob e una GPU de al o
endimien o.
Podemos e la g an di e encia en e ambas e siones de YOLO 3, siendo la e sión
YOLO 3 Tiny casi 5 eces más ápida a cambio de sac i ica algo de p ecisión, como
hemos is o en los esul ados. De nue o ecalca que la in e encia de es as dos edes se
ha ealizado en una GPU de al o endimien o, así que los FPS no debe ían compa a se
con el es o de edes.
13.3. In e cambio elocidad-consumo
Debido a que una de las a iables c í icas a conside a en la conducción au ónoma es la
au onomía del ehículo, amos a compa a los FPS ob enidos po cada ed eniendo en
cuen a el consumo de los di e en es disposi i os ha dwa e, pa a ob ene así un a io de
es a elocidad-consumo.
82
Figu a 13.4: Compa ación de los FPS po a io de las dis in as edes a endiendo a los
consumos medios de los dis in os disposi i os ha dwa e.
Vemos, como e a de espe a , cómo el disposi i o My iad des aca po su g an endimien o.
Es e disposi i o es á diseñado pa a la ejecución de edes neu onales de mane a e icien e
o eciendo un consumo muy bajo, de an solo 1W, y podemos ap ecia como cumple su
come ido en la g á ica an e io . Es e ipo de disposi i os es muy in e esan e pa a el pun o
de is a de la conducción, pudiendo se la in e encia en pa alelo una buena opción pa a
log a una elocidad de in e encia acep able man eniendo un consumo bajo.
Vamos a compa a es e a io de FPS/W ob enido po las 5 edes in en ando que la
compa ación sea lo más álida posible. Pa a ello amos a los esul ados ob enidos po las
edes SSD, SSD Li e y Fas e R-CNN al ejecu a la in e encia sob e la GPU in eg ada de
bajo consumo y po las edes YOLO 3 y YOLO 3 Tiny sob e la GPU de al o endimien o.
Recalca que no son el mismo disposi i o, pe o en ambos casos se a a de una GPU po
lo que la es uc u a y p ocesamien o son simila es.
83
Figu a 13.5: Compa ación del a io elocidad/po encia (FPS/W) al ealiza in e encia
con las dis in as edes, en el caso de SSD, SSDLi e y Fas e R-CNN sob e
una GPU in eg ada de bajo consumo(15W) y en el caso de YOLO 3 y
YOLO 3 Tiny sob e una GPU de al o endimien o (165W).
Es a g á ica nos mues a cómo la es uc u a de ed neu onal YOLO 3 Tiny sigue siendo
la que o ece mejo a io elocidad-consumo y, como hemos is o an e io men e, siendo
ambién una de las que mejo es esul ados en cuan o a p ecisión se e ie e.
14. Conclusiones
Es e p oyec o enía p incipalmen e dos obje i os que se desc i os al comienzo de la me-
mo ia:
Reen enamien o de una ed gene alis a pa a ap ende a iden i ica ehículos, pea-
ones y ciclis as.
Es udio del endimien o de la in e encia ealizada po la ed een enada en é mi-
nos de p ecisión, elocidad de in e encia y consumo sob e un conjun o de disposi-
i os ha dwa e.
Pa a esponde a la p ime a p egun a nos cen amos en el es udio de las dis in as solucio-
nes so wa e que nos pe mi en p ocesa las imágenes en iempo eal, usando de es a o ma
amewo ks conocidos en el campo de la de ección de obje os como Da kne , Open ino
y Tenso low. Es os amewo ks nos han pe mi ido een ena edes neu onales de p o-
pósi o gene alis a pa a ap ende a iden i ica ehículos, pea ones y ciclis as. En conc e o
se han abajado con las siguien es edes:
1. SSD Incep ion V2
2. SSD Mobile Li e
84
3. Fas e R-CNN
4. YOLO 3
5. YOLO 3 Tiny
El een enamien o se ha ealizado sob e el conjun o de da os KITTI y o o conjun o de
da os que consis e en la ampliación del conjun o de da os KITTI con algunas imágenes de
los conjun os Tshingua-Daimle y Be keley Deepd i e Da ase . En la sección 11 se han
analizado los esul ados ob enidos du an e los een enamien os de las dis in as edes.
A pa i de ellos deducimos que al amplia el conjun o de da os inicial con una mayo
a iedad de cajas delimi ado as di icul a el ap endizaje de la ed, lo cual podemos e
e lejado en una unción de pé dida más ines able y que dec ece más len amen e.
En cuan o a los esul ados inales ealizados sob e el conjun o de alidación, deducimos
que no se consigue un mejo endimien o aumen ando el conjun o de en enamien o, ya
que odas las edes han is o educido no ablemen e su p ecisión. En pa icula , si se
quie e aumen a el conjun o de en enamien o, es e aumen o debe se con imágenes muy
simila es a las del conjun o de es .
En es e caso, los conjun os de da os omados son imágenes omadas desde un ehículo,
odas de día y en condiciones a o ables. Sin emba go, hay dispa idades impo an es en-
e los conjun os de da os. KITTI es un conjun o de imágenes pano ámicas, po an o el
ancho es 4 eces el al o de la imagen. Es a di e encia es c ucial a la ho a de edimensiona
imágenes como se hace en las edes SSD Incep ion V2 y SSD Mobile Li e en las que se
edimensiona a unas dimensiones ijas de 300x300, con la consecuencia de que los obje os
con poca anchu a inicial pueden llega a se impe cep ibles.
Po o o lado, Be keley Deepd i e Da ase cuen a con obje os con una supe icie más
educida que en el KITTI. Es o se debe a que las imágenes de es e conjun o e ique an
odos los obje os isibles en la imagen, incluso algunos an en el ondo de la imagen
que su supe icie es meno a 20 píxeles. Po an o, en las edes donde se p oduce un
edimensionamien o, se educen las dimensiones de las imágenes, p o ocando que es os
obje os pasan a ene una supe icie mínima. De es a mane a es muy complicado que
los de ec o es de obje os puedan iden i ica los en la imagen. Además el amaño de los
ancho s no ha sido modi icado pa a adap a lo a las peculia idades del conjun o de da os,
siendo una di icul ad más añadida.
En cuan o al segundo obje i o, en la secciones 12 y 13 se han compa ado la p ecisión,
consumo y elocidad de in e encia de las edes sob e ambos conjun os de da os y sob e
es disposi i os en el caso de las edes SSD Incep ion V2, SSD Mobile Li e y Fas e
R-CNN:
CPU
85
GPU in eg ada de bajo consumo
My iad
y en el caso de las edes YOLO 3 y YOLO 3 Tiny sob e una GPU de al o endimien o.
Los esul ados de e minan que las mejo es edes pa a log a el obje i o de la conducción
au ónoma eniendo en cuen a la p ecisión son YOLO 3 y YOLO 3 Tiny. Ambas edes
o ecen una p ecisión po clase no ablemen e supe io al es o de edes es udiadas. O o
aspec o i al en el con ex o de la conducción au ónoma es la elocidad de in e encia,
en ese caso YOLO 3 Tiny es has a cinco eces mas ápida que YOLO 3. No se han
podido ejecu a és as edes en los mismos disposi i os que el es o. Sin emba go, como
podemos ap ecia en la g á ica compa a i a 13.5, e aluando el in e cambio elocidad de
p ocesamien o-consumo medido sob e dos a qui ec u as simila es, en es e caso ambas
GPUs, podemos e cómo igualmen e siguen siendo más p ome edo as que el es o de
edes.
Además de la elocidad de in e encia, la au onomía del ehículo es c ucial en la con-
ducción au ónoma y, po an o, el consumo de los dis in os disposi i os e aluados. En
la sección 13.3 se ha analizado el consumo de los disposi i os y los modelos ejecu ados
bajo los mismos. Pa a pode e alua conjun amen e el endimien o de un modelo y la
e iciencia del disposi i o ha dwa e sob e el que se ha ejecu ado, se ha de inido la mé i-
ca FPS/W que elaciona elocidad de in e encia con consumo. El esul ado es que los
modelos que ienen una a qui ec u a de una ase, es deci , las edes SSD y YOLO, son
mas e icien es en é minos de elocidad/consumo. Es a conclusión es na u al eniendo en
cuen a la baja elocidad de in e encia de Fas e R-CNN en compa ación con el es o.
Cen ándonos en los disposi i os ha dwa e, hay uno que esal a po encima del es o, y
és e es My iad. És e disposi i o diseñado pa a ealiza in e encia de edes neu onales de
mane a óp ima o ece un consumo mínimo, en conc e o de 1W, y po an o es el disposi-
i o mas e icien e en é minos de elocidad/consumo. Es no able cómo a pesa de su bajo
consumo, llega a ealiza in e encia en iempo eal las edes SSD Incep ion V2 y SSD
Mobile Li e. La GPU in eg ada con p ecisión FP16 o ece unas elocidades de in e encia
acep ables bajo un consumo de 15W, siendo po an o la GPU de al o endimien o y
la CPU los disposi i os menos e icien es, po su consumo ele ado, especialmen e en el
p ime caso; y po no es a especializada en es as a eas en el caso de la CPU.
Como conclusión inal, después del es udio y compa aciones ealizadas, la a qui ec u a o
modelo de de ección de obje os de en e odas las analizadas en el es ado del a e es, sin
duda, YOLO 3 Tiny, o eciendo una elocidad de in e encia muy no able y supe ando
en p ecisión al es o, llegando a alcanza sin p oblemas el p ocesamien o en iempo eal.
86
14.1. Fu u os pasos
Es e p oyec o es á basado en un campo de in es igación que es á en pleno lo ecimien o.
Debido a es o, hay muchas posibles ideas a p oba con el obje i o de con inua es a in-
es igación.
Una opción es abaja con conjun os de da os mas mode nos que con engan imágenes en
3D, además de in o mación de senso es como LIDAR en e o os. Es a in o mación puede
mejo a eno memen e la p ecisión log ada con imágenes en 2D, aunque p obablemen e
enga una elocidad de in e encia meno . Es udia como equilib a cuan a in o mación
inco po a al modelo de o ma que no sea pe judicial en é minos de elocidad de in e-
encia y consumo es una posible línea de in es igación.
O a opción es abaja con edes mas mode nas, como puede se YOLOV4 [8] publicada
en es e año. Es as edes son el es ado del a e en es e campo, y po an o conoce a ondo
su uncionamien o e in es iga como pode inco po a las o c ea e siones educidas es
o a posible línea de in es igación.
Finalmen e, o a posible línea de in es igación se ía la de usa un mayo núme o de
disposi i os My iad pa a ealiza in e encia en pa alelo, con la inalidad de mejo a la
elocidad de in e encia con espec o a un solo My iad al meno cos e posible, es deci ,
con o o My iad.
87
CLOSURE
This p ojec had wo main objec i es which we e se a he beginning o he epo . The
aim was o answe he ollowing wo ques ions:
Fine- uning o a gene alis ne wo k in o de o lea n how o iden i y ehicles, pe-
des ians and cyclis s.
Pe omance analysis o he in e ence in e ms o p ecision, in e ence speed and
powe consump ion o he ine- uned ne wo k o e a se o ha dwa e de ices.
To add ess he i s ques ion we ocused on he s udy o di e en so wa e solu ions ha
allowed us o p ocess he images in eal ime, using well known amewo ks in he ield o
objec de ec ion as Da kne , Open ino and Tenso low. These amewo ks ha e allowed
us o ine- une gene alis neu al ne wo ks o lea n how o iden i y ehicles, pedes ians
and cyclis s. In pa icula , we ha e wo ked wi h he ollowing ne wo ks:
1. SSD Incep ion V2
2. SSD Mobile Li e
3. Fas e R-CNN
4. YOLO 3
5. YOLO 3 Tiny
The ine- uning has been done on he KITTI da ase and ano he da ase consis ing o
he ex ension o he KITTI da ase wi h some images om he Tshingua-Daimle and
Be keley Deepd i e Da ase se s. In sec ion 11 we ha e analysed he esul s ob ained
du ing he ine- uning o he di e en ne wo ks, om which we deduce ha ex ending
he ini ial da ase wi h a highe a ie y o bounding boxes makes i di icul o lea n he
ne wo k, which can be seen in a mo e uns able and slowly dec easing loss unc ion.
As o he inal esul s o e he alida ion se , we deduce ha a be e pe o mance is no
achie ed by inc easing he aining se , since all he ne wo ks ha e seen hei accu acy
educed signi ican ly. In pa icula , i he aining se is o be inc eased, his inc ease
mus be wi h images e y simila o hose o he es se .
In his case, he da ase s consis o images aken om a ehicle, all du ing he day and
unde a ou able condi ions. Howe e , he e a e signi ican dispa i ies be ween he da a
se s. KITTI is a se o pano amic images, he e o e he wid h is 4 imes he heigh o he
image. This di e ence is c ucial when esizing images as is done in he SSD Incep ion V2
and SSD Mobile Li e ne wo ks whe e he image is esized o a ixed dimension o 300x300,
wi h he consequence ha objec s wi h a small ini ial wid h can become impe cep ible.
88
On he o he hand, Be keley Deepd i e Da ase has objec s wi h a smalle su ace a ea
han in he KITTI. This is due o he ac ha he labels in his se consis o all he
objec s isible in he image, e en some so a back in he image ha hei su ace a ea is
less han 20 pixels. The e o e, in ne wo ks whe e esizing occu s, he dimensions o he
images a e educed, causing hese objec s o ha e a minimum su ace a ea. This makes
i e y di icul o objec de ec o s o iden i y hem in he image. Mo eo e , he size o
he ancho s has no been modi ied o adap i o he peculia i ies o he da a se , being
an addi ional di icul y.
As o he second objec i e, in he sec ions ?? and ?? we ha e compa ed he accu acy,
consump ion and in e ence speed o he ne wo ks on bo h da ase s and on h ee de ices
in he case o he SSD Incep ion V2, SSD Mobile Li e and Fas e R-CNN ne wo ks:
CPU
In eg a ed low-powe GPU
My iad
and in he case o YOLO 3 and YOLO 3 Tiny ne wo ks on a high pe o mance GPU.
The esul s de e mine ha he bes ne wo ks o achie e he goal o au onomous d i ing
wi h ega d o accu acy a e YOLO 3 and YOLO 3 Tiny. Bo h ne wo ks o e signi i-
can ly be e accu acy pe class han he o he ne wo ks s udied. Ano he i al aspec in
he con ex o au onomous d i ing is he in e ence speed. In his case YOLO 3 Tiny is
up o i e imes as e han YOLO 3. These ne wo ks ha e no been able o un on he
same de ices as he es . Howe e , as we can see in he compa a i e g aph ??, e alua ing
he exchange o p ocessing-consump ion speed measu ed on wo simila a chi ec u es, in
his case bo h GPUs, we can see how hey con inue o be mo e p omising han he es
o he ne wo ks.
In addi ion o he in e ence speed, he ehicle au onomy is c ucial in au onomous d i ing
and, he e o e, he consump ion o he di e en de ices e alua ed. The consump ion o
he de ices and he models execu ed unde hem ha e been analysed in he sec ion çon-
sump ion". In o de o join ly e alua e he pe o mance o a model and he e iciency o
he ha dwa e de ice on which i has been execu ed, he FPS/W me ic has been de ined,
which ela es in e ence speed wi h consump ion. The esul is ha models ha ha e a
one phase a chi ec u e, i.e. SSD and YOLO ne wo ks, a e mo e e icien in e ms o spee-
d/consump ion. This conclusion is na u al conside ing he low in e ence speed o Fas e
R-CNN compa ed o he es .
Focusing on he ha dwa e de ices, he e is one ha s ands ou om he es , and ha
is My iad. This de ice designed o pe o m neu al ne wo k in e ence in an op imal way
o e s a minimum consump ion, speci ically 1W, and he e o e is he mos e icien de ice
89