scieee Science in your language
[es] (orig)

Evaluación de algoritmos de machine learning para conducción

Abstract

El principal objetivo de este proyecto de investigación y desarrollo es el análisis e implementación de arquitecturas deep learning para la detección en tiempo real de peatones, ciclistas y vehículos en el ámbito de la conducción autónoma. El vertiginoso crecimiento de la capacidad de procesamiento ha provocado el surgimiento de nuevas ramas de investigación tecnológica, entre ellas la de la Inteligencia Artificial (IA). En particular, dentro de la IA podemos destacar la aparición de las redes neuronales profundas como técnica para abordar problemas relacionados con la percepción visual, como puede ser la clasificación de objetos o la detección de objetos. Uno de los campos donde la IA que está teniendo una mayor influencia es la creación de sistemas avanzados de asistencia para la conducción (ADAS). Estos sistemas de conducción se apoyan en una amplia variedad de cámaras y sensores que proporcionan toda la información necesaria para tomar decisiones con precisión y seguridad. Un sistema ADAS está compuesto por distintos módulos. Uno de ellos se encarga de la detección en tiempo real de objetos. En este proyecto nos centramos en la detección en tiempo real de vehículos, ciclistas y peatones, aunque podrían incluirse líneas de carretera y señales de tráfico, entre otros objetos. Para conseguir dicho objetivo dividiremos en dos partes diferenciadas el trabajo: -Reentrenamiento de una red generalista para aprender a identificar vehículos, peatones y ciclistas. -Estudio del rendimiento de la inferencia realizada por la red reentrenada en términos de precisión, velocidad de inferencia y consumo sobre un conjunto de dispositivos hardware.

Read accessible full text

Evaluación de algoritmos de machine learning para conducción

Author: Simón Rodríguez, Alejandro; Ruz Gómez, Rafael
Year: 2020
Source: https://docta.ucm.es/bitstreams/bb1a8e13-13dd-4707-9658-973fc6a58fb1/download
Uni e sidad Complu ense de Mad id/Uni e sidad de G anada (SICUE)
Facul ad de In o má ica
TRABAJO DE FIN DE GRADO
EVALUACIÓN DE ALGORITMOS DE MACHINE
LEARNING PARA CONDUCCIÓN
MACHINE LEARNING ALGORITHM EVALUATION
ON ADVANCED DRIVER ASSISTANCE
Alumnos
Alejand o Simón Rod íguez
Ra ael Ruz Gómez
Di ec o es
Ca los Ga cía Sánchez
Guille mo Bo ella Juan
Doble G ado Ingenie ía In o má ica y Ma emá icas
2019/2020
1
Índice
1 In oducción y mo i ación 8
2 His o ia 9
3 Con ibución de cada es udian e 12
3.1 Con ibución de Alejand o . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
3.2 Con ibución de Ra ael . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
4 Es ado del a e 14
4.1 In oducción a la Visión po Compu ado . . . . . . . . . . . . . . . . . . 14
4.1.1 P oblemas den o de la Visión po Compu ado . . . . . . . . . . . 15
4.2 DeepLea ning ................................. 16
4.2.1 Redes Con olucionales . . . . . . . . . . . . . . . . . . . . . . . . . 18
4.2.2 T ans e Lea ning . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
5 A qui ec u as de De ección de Obje os 22
5.1 A qui ec u as de dos ases . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
5.2 A qui ec u as de una ase . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
5.2.1 Single Sho De ec o o SSD . . . . . . . . . . . . . . . . . . . . . . 28
5.2.2 YOLO.................................. 32
6 P esen ación de conjun os de da os u ilizados 38
6.1 KITTI...................................... 40
6.2 Tshingua-Daimle ................................ 42
6.3 Be keley Deepd i e Da ase . . . . . . . . . . . . . . . . . . . . . . . . . . 42
6.4 Conjun os de da os c eados . . . . . . . . . . . . . . . . . . . . . . . . . . 45
7 Disposi i os ha dwa e u ilizados 45
7.1 CPU In el R
Xeon R
E3-1225 3 ....................... 46
7.2 GPUGEFORCEGTX980 .......................... 46
7.3 GPU UHD In el R
620............................. 46
7.4 In el R
Neu al Compu e S ick 2 . . . . . . . . . . . . . . . . . . . . . . . . 47
8 Medidas de p ecisión en la de ección de obje os 47
8.1 P ecisiónyRecall................................ 47
8.2 IOU ....................................... 48
8.3 APymAP ................................... 49
9 F amewo ks 50
9.1 Tenso low.................................... 50
9.1.1 Objec De ec ion API . . . . . . . . . . . . . . . . . . . . . . . . . 50
9.1.2 Tenso boa d............................... 52
2
9.2 Open ino oolki ................................ 53
9.2.1 Ca ac e ís icas p incipales . . . . . . . . . . . . . . . . . . . . . . . 53
9.3 Da kne ..................................... 54
9.4 Módulos..................................... 54
10 Expe imen os ealizados 55
10.1Ancho Boxes.................................. 56
10.2Da aaugmen a ion............................... 58
10.3 Ha d Nega i e Mining . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
11 Resul ados del Reen enamien o 60
11.1 Resul ados de la ed SSD Incep ion V2 . . . . . . . . . . . . . . . . . . . . 60
11.1.1 Resul ados SSD Incep ion V2 sob e KITTI . . . . . . . . . . . . . 60
11.1.2 Resul ados SSD Incep ion V2 sob e el da ase comple o . . . . . . 61
11.1.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 62
11.2 Resul ados de la ed Fas e R-CNN . . . . . . . . . . . . . . . . . . . . . . 64
11.2.1 Resul ados Fas e R-CNN sob e KITTI . . . . . . . . . . . . . . . 64
11.2.2 Resul ados Fas e R-CNN sob e el da ase comple o . . . . . . . . 65
11.2.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 66
11.3 Resul ados de la ed SSD Mobile Li e . . . . . . . . . . . . . . . . . . . . . 68
11.3.1 Resul ados SSD Mobile Li e sob e KITTI . . . . . . . . . . . . . . 68
11.3.2 Resul ados SSD Mobile Li e sob e el da ase comple o . . . . . . . 69
11.3.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 70
11.4 Resul ados de la ed YOLO 3 . . . . . . . . . . . . . . . . . . . . . . . . . 72
11.4.1 Resul ados YOLO 3 sob e KITTI . . . . . . . . . . . . . . . . . . 73
11.4.2 Resul ados YOLO 3 sob e el da ase comple o . . . . . . . . . . . 73
11.5 Resul ados de la ed YOLO 3 iny . . . . . . . . . . . . . . . . . . . . . . 74
11.5.1 Resul ados YOLO 3 iny sob e KITTI . . . . . . . . . . . . . . . . 74
11.5.2 Resul ados YOLO 3 iny sob e el da ase comple o . . . . . . . . . 75
12 Resul ado de In e encia 75
12.1 In e encia de SSD Incep ion V2 en Open ino . . . . . . . . . . . . . . . . 76
12.2 In e encia de SSD Mobile Li e en Open ino . . . . . . . . . . . . . . . . . 77
12.3 In e encia de Fas e R-CNN en Open ino . . . . . . . . . . . . . . . . . . 78
12.4 In e encia YOLO 3 en Da kne . . . . . . . . . . . . . . . . . . . . . . . . 79
12.5 In e encia YOLO 3 Tiny en Da kne . . . . . . . . . . . . . . . . . . . . . 79
13 Compa ación 80
13.1MAP....................................... 80
13.2 Velocidad de in e encia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
13.3 In e cambio elocidad-consumo . . . . . . . . . . . . . . . . . . . . . . . . 82
14 Conclusiones 84
14.1Fu u ospasos.................................. 87
3
14.2Fu u es eps................................... 90
4
Índice de ablas
12.1 In e encia del modelo SSD Incep ion V2 usando el amewo k Open ino . 76
12.2 In e encia del modelo SSD Mobile Li e usando el amewo k Open ino . . 77
12.3 In e encia del modelo Fas e R-CNN usando el amewo k Open ino . . . 78
12.4 In e encia del modelo YOLO 3 ejecu ado en la GPU de al o endimien o
usando el amewo k Da kne . . . . . . . . . . . . . . . . . . . . . . . . . 79
12.5 In e encia del modelo YOLO 3 Tiny ejecu ado en la GPU de al o endi-
mien o usando el amewo k Da kne . . . . . . . . . . . . . . . . . . . . . 79
5

PALABRAS CLAVE:
Visión po o denado , conducción au ónoma, ed neu onal con olucional, de-
ección de obje os, ap endizaje p o undo, ap endizaje au omá ico, My iad,
Tenso low, Open ino, Da kne .
RESUMEN
El p incipal obje i o de es e p oyec o de in es igación y desa ollo es el análisis e imple-
men ación de a qui ec u as deep lea ning pa a la de ección en iempo eal de pea ones,
ciclis as y ehículos en el ámbi o de la conducción au ónoma.
El e iginoso c ecimien o de la capacidad de p ocesamien o ha p o ocado el su gimien o
de nue as amas de in es igación ecnológica, en e ellas la de la In eligencia A i icial
(IA). En pa icula , den o de la IA podemos des aca la apa ición de las edes neu onales
p o undas como écnica pa a abo da p oblemas elacionados con la pe cepción isual,
como puede se la clasi icación de obje os o la de ección de obje os.
Uno de los campos donde la IA que es á eniendo una mayo in luencia es la c eación de
sis emas a anzados de asis encia pa a la conducción (ADAS). Es os sis emas de conduc-
ción se apoyan en una amplia a iedad de cáma as y senso es que p opo cionan oda la
in o mación necesa ia pa a oma decisiones con p ecisión y segu idad.
Un sis ema ADAS es á compues o po dis in os módulos. Uno de ellos se enca ga de la
de ección en iempo eal de obje os. En es e p oyec o nos cen amos en la de ección en
iempo eal de ehículos, ciclis as y pea ones, aunque pod ían inclui se líneas de ca e e a
y señales de á ico, en e o os obje os.
Pa a consegui dicho obje i o di idi emos en dos pa es di e enciadas el abajo:
Reen enamien o de una ed gene alis a pa a ap ende a iden i ica ehículos, pea-
ones y ciclis as.
Es udio del endimien o de la in e encia ealizada po la ed een enada en é mi-
nos de p ecisión, elocidad de in e encia y consumo sob e un conjun o de disposi-
i os ha dwa e.
6
KEYWORDS:
Compu e ision, au onomous d i ing, con olu ional neu onal ne wo k, ob-
jec de ec ion, deep lea ning, machine lea ning, My iad, Tenso low, Open-
ino, Da kne .
ABSTRACT
The main aim o his esea ch and de elopmen p ojec is he analysis and implemen a-
ion o deep lea ning’s a chi ec u es o eal- ime objec de ec ion o pedes ians, cyclis s
and ca s on he scope o au onomous d i ing.
The b eakneck g ow h o he compu ing capaci y has caused he eme gence o new ech-
nological esea ch ields such as A i icial In elligence (AI). Especi ically, we can highligh
he unco e ing o deep neu al ne wo ks as a echnique o app oach challenges ela ed o
isual pe cep ion, o example objec classi ica ion o objec de ec ion.
One o he a eas whe e he a i icial in elligence is ha ing a g ea in luence is on he
c ea ion o ad anced d i e -assis ance sys ems (ADAS). These sys ems ake ad an age o
cu ing-edge came as and senso s ha eed he sys ems wi h all he necessa y in o ma ion
o ake decisions wi h accu acy and secu i y.
An ad anced d i e -assis ance sys em is made o se e al modules. One o hem pe o m
objec de ec ion in eal- ime. The main ocus o his p ojec is eal- ime de ec ion o
pedes ians, cyclis s and ca s.
To achie e his objec i e, we will di ide he wo k in o wo pa s:
Fine- uning o a gene alis ne wo k o lea n how o iden i y pedes ians, cyclis s
and ca s.
Pe omance analysis in e ms o e iciency, speed and powe consump ion du ing
he in e ence pe o med by he ine- uned ne wo k o e a se o ha dwa e de ices.
7
1. In oducción y mo i ación
El desa ollo de sis emas a anzados de asis encia al conduc o (ADAS) es una ealidad
a día de hoy y no un sueño u u is a. Ac ualmen e es una ecnología cuyo desa ollo se
ha di ido en ases con el obje i o de i cumpliendo obje i os p og esi amen e en p o de
log a un sis ema de conducción comple amen e au ónomo.
La Sociedad de Ingenie os de Au omoción [53] es ablece una di e enciación en cuan o al
ni el de au onomía en la conducción en la que se dis inguen seis ca ego ías o ni eles:
Ni el 0: Ninguna au oma ización, el conduc o debe ealiza odas las a eas ela-
i as a la conducción.
Ni el 1: Asis encia en la conducción, se cuen a con algún sis ema au oma izado,
como po ejemplo pa a con ola el mo imien o la e al o longi udinal, pe o no
ambos a la ez, y no se dispone de sis emas pa a esponde an e obje os. Debiendo
ealiza el es o de las a eas el conduc o .
Ni el 2: Au oma ización pa cial, apa ecen sis emas pa a an o el con ol la e al
como longi udinal, eximiendo al conduc o de con ola el mo imien o, pe o no del
es o de a eas como la de ección de obje os y espues a an e ellos.
Ni el 3: Au oma ización condicional, se con ola au omá icamen e an o el mo i-
mien o como se moni o iza el en o no, pe o se equie e al conduc o disponible en
segundos po si ocu ie a algún allo, sal ando una ale a.
Ni el 4: Au oma ización ele ada, se iene un sis ema au ónomo, en casi cualquie
si uación, con olando el mo imien o, de ec ando obje os y ac uando an e allos,
eniendo que oma el con ol el conduc o en a a ocasión.
Ni el 5: Au oma ización comple a, se cuen a con sis emas au ónomos an e cualquie
si uación, y el conduc o nunca es á obligado a oma con ol manualmen e si no
lo desea.
Ac ualmen e, nos encon amos a medio camino en e el e ce y el cua o ni el. Se e-
quie e de una ecnología mas a anzada con o me aumen an los ni eles, siendo ecnologías
imp escindibles la senso ización, el p ocesado de las señales de es os y la oma de deci-
siones basándose en la in o mación de los senso es p ocesada. Una pa e de es e abajo
se enma ca á en apo a soluciones den o de una de es as a eas, la de ección de obje os
con écnicas de In eligencia A i icial.
O o aspec o a ene en cuen a pa a el despliegue de la conducción au ónoma es la ene gía
que deben consumi odos los sis emas de de ección, p ocesamien o y oma de decisiones
en unción de la in o mación ecabada. Po ello, o a pa e de es e p oyec o se dedica á
a analiza la e iciencia ene gé ica de los sis emas u ilizados.
Podemos esumi la mo i ación de es e abajo en dos cues iones abie as:
8
¿Cómo p ocesa oda la in o mación ecabada po el ehículo de o ma que pe mi a
oma decisiones en iempo eal?
¿Cómo c ea un Sis ema de Con ol Au ónomo óp imo en é minos de e iciencia
ene gé ica?
Ambas cues iones son de i al impo ancia pa a el desa ollo de la ecnología necesa ia
pa a el coche au ónomo. Pa a esponde a la p ime a cues ión nos apoya emos en el
á ea de la isión po compu ado , donde los mayo es éxi os en cuan o a endimien o han
llegado con el c ecimien o exponencial de las edes neu onales p o undas, en conc e o, con
la e olución de las edes neu onales con olucionales. Es as edes han demos ado bajas
asas de e o y una meno necesidad de ecu sos compu acionales que sus p edeceso as,
las edes neu onales comple amen e conec adas ( ully-connec ed).
Po o o lado, es un e o mayúsculo el c ea un sis ema de conducción au ónoma e icien e
en consumo. Es e desa ío podemos di idi lo en dos subp oblemas:
Es udia el so wa e que sea capaz de p ocesa las imágenes en iempo eal y cumpla
las es icciones de ene gía necesa ias.
Es udia el ha dwa e más adecuado pa a dicho so wa e en búsqueda de la e iciencia
ene gé ica.
El p ocesamien o de imágenes ha sido es udiado ampliamen e, y se ha demos ado que lo
más óp imo es hace uso de a ios núcleos en luga de unos pocos, como suele ocu i en
CPUs es ánda . En es e abajo a a emos el uso de GPU y My iad, es e úl imo consis e
en ha dwa e especí ico pa a o ece ecu sos o ien ados a implemen a edes neu onales,
desa ollado po In el.
Po úl imo es á el desa ío de o ques a odo es e so wa e y ha dwa e. Pa a el desa o-
llo de es e p oyec o se han u ilizado los da ase s KITTI, Tshingua-Daimle y Be kely
Deepd i e. Es os conjun os son p esen ados mas de alladamen e en la sección 6. La de-
ección de obje os se ha ealizado usando es ipos de edes: SSD, Fas e y YOLO, que
se p esen a án en la sección 5.
El een enamien o de las edes se ha ealizado usando el amewo k Tenso low, del cual
amplia emos más in o mación en las sección 9. La e aluación de las edes se ha ealiza-
do ap o echando el conjun o de he amien as desa olladas po In el, en el amewo k
OpenVINO, el cual pe mi e la ejecución en disposi i os especí icos de in e encia de e-
des neu onales p o undas, como My iad. En la sección 9 se expond án los disposi i os
u ilizados.
2. His o ia
T as el nacimien o de los coches mo o izados lle o poco iempo a los in en o es de la época
comenza a pensa en los ehículos au ónomos. En 1925, el in en o F ancis Houdina [20]
demos ó como un coche con olado median e ondas de adio conducía po las calles de
9
Figu a 4.1: Desa íos en la Visión po Compu ado . Fuen e: [11]
En pa icula , noso os nos amos a cen a en el econocimien o de obje os, es deci ,
iden i ica que obje o hay en la imagen y dónde se encuen a. Al es a cen ados en
la conducción au ónoma, los obje os a econoce y si ua se án: pea ones, ciclis as y
ehículos.
4.2. Deep Lea ning
Deep Lea ning [23] es una ama den o del ap endizaje au omá ico cuya me a es ap en-
de ca ac e ís icas de al o ni el a pa i de un conjun o de da os usando a qui ec u as
je á quicas. Es e en oque pe mi e a los modelos compu acionales basados en múl iples
capas, ap ende y ex ae in o mación imi ando como el ce eb o pe cibe y asimila la
in o mación, pe mi iendo cap u a pa ones subyacen es en conjun os de da os a g an
escala.
El su gimien o del in e és po es a ecnología se ha p oducido debido a que ha supe ado
ampliamen e el endimien o de las écnicas pun e as p e ias en muchas á eas de in e és
de la in eligencia a i icial, como pueden se p ocesamien o del lenguaje na u al [58], i-
sión po compu ado [15, 1], ans e lea ning [14, 28] y muchas más.
La ambición de c ea un modelo que simula a el ce eb o humano p o ocó el inicio del
desa ollo de las edes neu onales. En 1943, McCulloch and Pi s [39] in en a on com-
p ende como el ce eb o podía p oduci pa ones de al a complejidad usando células
básicas in e conec adas, llamadas neu onas. El modelo de una neu ona de McCulloh
y Pi s, llamado el modelo MCP, ue una con ibución i al al desa ollo de las edes
16

neu onales a i iciales. En la siguien e abla [6] se mues an cuales han sido las mayo es
con ibuciones a es e campo que han con ibuido a llega a la e a ac ual del deep lea ning:
Figu a 4.2: Hi os más impo an es en la his o ia de las edes neu onales y el ap endizaje
au omá ico, que han conducido a la e a del deep lea ning. Fuen e: [24]
El nacimien o de la e a del deep lea ning se p odujo con la dis up i a con ibución de
Hil on [21] en el año 2006, cuando in odujo la Deep Belie Ne wo k. Es a ed ue la p in-
cipal causan e del desa ollo exponencial de la úl ima década en cuan o a a qui ec u as
p o undas y algo i mos de deep lea ning.
Sin emba go, las edes neu onales exis en desde ha mediados del siglo XX. Una p egun a
na u al que su ge es po qué las edes neu onales p o undas han comenzado a ene un
in e és masi o ecien emen e. Hay muchos ac o es que con ibuyen al ascenso me eó ico
de la popula idad de las edes neu onales p o undas, algunos de ellos son:
Apa ición de da ase s de en enamien o masi os con e ique as de al a calidad.
A ances en las capacidades de compu ación pa alela e implemen aciones mul i-co e
y mul i- h ead.
Aumen o de la capacidad de p ocesamien o, especialmen e debido al uso de GPUs,
así como, la disminución del cos e del ha dwa e de compu ación.
Su gimien o de nume osas pla a o mas de so wa e como Tenso low [36], PyTo ch
[2], Ca e [65], Chaine [52], e c, que pe mi en una in eg ación sencilla y a al o
ni el de di e sas a qui ec u as en un amewo k de compu ación de GPU, sin la
necesidad de en a en de alles de bajo ni el.
In oducción de nue as écnicas de egula ización que ayudan a e i a el o e i -
ing y mejo an el endimien o con o me se escala . Algunas de es as écnicas son:
d opou , da a augmen a ion, ea ly s opping e c.
A ances en la op imización de los algo i mos de ap endizaje au omá ico que son
capaces de p oduci soluciones muy ce canas a las óp imas.
17
4.2.1. Redes Con olucionales
Los a ances en isión po compu ado con la llegada del deep lea ning han sido desa-
ollados y pe eccionados con el iempo g acias a un algo i mo en pa icula : las Redes
Neu onales Con olucionales [67].
Figu a 4.3: A qui ec u a Gene al de Redes Neu onales Con olucionales. Fuen e: [12]
Una Red Neu onal Con olucional(CNN) es un algo i mo de Deep Lea ning que oma una
imagen de en ada, asigna impo ancia (conjun o de pesos ap endidos) a los aspec os/-
ca ac e ís icas de la imagen y es capaz de di e encia unos de o os. Mien as que an es
de la llegada de es as edes se aplicaban il os diseñados a mano pa a de ec a los as-
pec os ele an es de una imagen, con su icien e en enamien o, las CNN han conseguido
ap ende esas ca ac e ís icas eseñables de las imágenes.
La a qui ec u a de una CNN in en a eplica los pa ones de conec i idad de las neu o-
nas del ce eb o humano y es á inspi ada en la o ganización del có ex isual [34]. Es a
a qui ec u a pe mi e ealiza un balance en e una al a capacidad de ap endizaje de las
ca ac e ís icas ele an es de la imagen y la escalabilidad de la ed sob e da ase s masi os
[68].
Con el in de cumpli con esas expec a i as, la CNN ealiza una educción de las imá-
genes a una o ma mucho mas sencilla de p ocesa , sin pe de las ca ac e ís icas c í icas
necesa ias pa a ealiza una buena p edicción. Pa a ello se basa en la sucesi a aplicación
de dos capas: la capa de Con olución y la capa de Pooling.
La capa de con olución se basa en la ope ación de con olución sob e la imagen. El obje i o
de es a ope ación es ex ae las ca ac e ís icas de al o ni el de la imagen de en ada. El
é mino con olución en ma emá icas hace e e encia a la combinación de dos unciones
pa a p oduci una e ce a unción. En el caso de una CNN, la con olución se ealiza sob e
una imagen de en ada usando un il o( ambién llamado ke nel) que p oduce un mapa
de ca ac e ís icas. Más especí icamen e, la con olución es ejecu ada deslizando el il o
sob e la imagen de en ada. En cada localización, la mul iplicación ma icial se ealiza y
la suma del esul ado se gua da en el mapa de ca ac e ís icas. La siguien e imagen e leja
es a ope ación:
18
Figu a 4.4: El il o se desliza sob e la en ada y la ope ación iene un esul ado que se
almacena en la nue a capa. Fuen e [13]
Una CNN necesi a no es a limi ada en el núme o de capas con olucionales, así que, se
suelen aplica sucesi amen e. T adicionalmen e, la p ime a capa con olucional es espon-
sable de cap u a ca ac e ís icas de bajo ni el como los bo des, el colo , la o ien ación del
g adien e, e c. Con o me se añaden capas, la a qui ec u a se adap a a las ca ac e ís icas
de al o ni el, p opo cionando a la ed una comp ensión o al de las imágenes del da ase .
La capa Pooling se enca ga de educi el amaño espacial de las ca ac e ís icas con olu-
cionadas. El obje i o es educi el cos e compu acional eque ido pa a p ocesa los da os
educiendo la dimensionalidad de es os. Además, pe mi e ex ae las ca ac e ís icas do-
minan es que son in a ian es en e a o aciones y cambios de posición, man eniendo la
e ec i idad del modelo du an e el en enamien o.
Se dis inguen dos ipos de capas pooling: Max Pooling y A e age Pooling. Max Pooling
de uel e el máximo alo de la po ción de imagen analizada, mien as que po o o
lado, A e age Pooling de uel e la media de odos los alo es de la po ción de imagen
analizada. En gene al, Max Pooling o ece un mejo endimien o. La siguien e imagen
ilus a la ope ación max pooling desc i a:
19
Figu a 4.5: Max pooling oma los alo es más g andes. Fuen e [13]
La capa Con olucional y la capa Pooling, o man jun as la capa i-ésima de una CNN.
Dependiendo de la complejidad de la imagen, el núme o de capas puede aumen a pa a
cap u a incluso mas de alles a bajo ni el, pe o con un inc emen o del cos e compu acio-
nal.
Figu a 4.6: Capa Fully-Connec ed y Red Neu onal Feed-Fo wa d. Fuen e [12]
T as la sucesi a aplicación de es as capas, el modelo es capaz de econoce las p incipales
ca ac e ís icas. La salida de es e p oceso suele se la en ada de una capa Fully-Connec ed.
Es a capa pe mi e ap ende las elaciones no-lineales en e las ca ac e ís icas cap u adas
po las capas an e io es.
20
Finalmen e, la salida la capa Fully-Connec ed pe mi e alimen a a una ed neu onal
Feed-Fo wa d. Es a ed neu onal, median e los sucesi os en enamien os ap ende á a
dis ingui en e las ca ac e ís icas dominan es y las ca ac e ís icas a bajo ni el de las
imágenes, pe mi iéndole clasi ica las imágenes en la ca ego ía co espondien e.
Finalmen e menciona que aunque en es e abajo se ha que ido ealiza un b e e in o-
ducción de las CNN, exis en nume osas a qui ec u as de CNN disponibles, cada una con
sus ca ac e ís icas especi icas y sus en ajas pa a de e minados p oblemas. Algunas de
las más conocidas son:
LeNe [66]
AlexNe [1]
GoogLeNe [9]
ResNe [30]
4.2.2. T ans e Lea ning
T ans e Lea ning es una écnica que pe mi e abo da dos de los p incipales p oblemas
del deep lea ning:
Al a in e sión en iempo de een enamien o de edes neu onales debido a conjun os
de da os con can idades de da os masi as.
Eno me gas o de ecu sos compu acionales pa a el een enamien o de edes.
Es e mé odo basado en la u ilización del conocimien o ap endido po un modelo as se
en enado sob e un da ase con el in de educi el iempo de een enamien o [51]. La
idea es een ena el modelo sob e un nue o da ase pa iendo del conocimien o adqui-
ido po el modelo sob e el da ase an e io , con el obje i o de acele a el p oceso de
een enamien o. A menudo, la ans e encia del ap endizaje se p oduce de un modelo
mas complejo hacia un modelo mas sencillo. En nues o caso, las edes es án en enadas
sob e el da ase gene alis a COCO [33]. Es e conjun o de da os es a en ocado en la de-
ección y localización de 90 ipos de obje os, y usamos ans e lea ning, pa a acele a
el een enamien o sob e los conjun os de da os de conducción au ónoma usados en es e
p oyec o.
En la siguien e imagen ilus amos como se p oduce es e p oceso de ans e encia de
conocimien o desde un modelo mas complejo hacia un modelo mas sencillo:
21

Figu a 4.7: T ans e Lea ning. Fuen e [62]
En el con ex o de las CNN, ans e lea ning se implemen a omando los pa áme os de
la capa de cap ación de ca ac e ís icas pa a inicializa la capa de cap ación de ca ac e ís-
icas sob e el nue o da ase . En conc e o, se suelen coge los pa áme os de las capas que
se enca gan de cap a las ca ac e ís icas de bajo ni el como los bo des, ex u as, esquinas
y o mas; pues es ás son ca ac e ís icas p esen es en odos los conjun os de da os.
En el campo de la de ección de obje os, se equie e aun mas p ocesamien o po pa e
de las capas as la ex acción de ca ac e ís icas, pues se sigue de un clasi icado , ya
que la de ección de obje os debe p edeci no solo la clase del obje o, sino su localización
ambién. Es o implica que el een enaminen o de es as edes sea muy cos oso en iempo
y capacidad de cómpu o. G acias a es e mé odo, e i amos necesi a de semanas pa a
een ena las edes.
5. A qui ec u as de De ección de Obje os
Den o de las a qui ec u as deep lea ning se dis inguen dos líneas de in es igación a día
de hoy, siendo la p ime a mas an igua que la segunda. La p ime a se conoce como a -
qui ec u a de dos ases, gene ando p ime o egiones candida as de la localización del
obje o en la imagen y pos e io men e clasi icando los obje os asignándole una ca ego ía,
po ejemplo en es e caso: coche, ciclis a o pea ón. Es e ipo de de ec o es ambién se les
conoce po de ec o es de obje os basados en egiones.
Po o o lado, el segundo ipo de de ec o es se conocen po ene una a qui ec u a de
una sola ase. Es os ealizan una abs acción mayo , pues en el p oblema de de ec-
ción de obje os como un p oblema de eg esión(es imación de las cajas delimi ado as)
22
y clasi icación. De es a o ma, en una sola ase, son capaces de in e i la localización y
clasi icación del obje o.
5.1. A qui ec u as de dos ases
Las a qui ec u as de dos ases son ambién conocidas como las a qui ec u as basadas
en egiones. El nacimien o de es as a qui ec u as se p odujo en 2012, cuando AlexNe
[1] ganó el desa ío ILSVRC, ayendo consigo el dominio de las CNN al campo de la
de ección de obje os. Un en oque po ue za b u a de de ección de obje os es usa una
en aja deslizan e de izquie da a de echa, de a iba a abajo pa a iden i ica obje os
usando clasi icación. Un ejemplo se ía la imagen in e io :
Figu a 5.1: Ven ana deslizan e de izquie da a de echa sob e la imagen. Fuen e: [49]
Como emos en la igu a supe io , si que emos de ec a di e en es obje os debemos usa
en anas de amaños y o mas a iadas. En cada paso de deslizamien o de la en ana
se eco an pa ches de la imagen según es as en anas. P e iamen e a alimen a la ed
con olucional clasi icado a, el pa che es edimensionado a la en ada de la ed, que a
menudo suele se ija. Es e ipo de ans o maciones no impac an la p ecisión de la ed,
ya que es án en enados pa a maneja es as imágenes. Es a ed se enca ga de ex ae un
núme o de e minado de ca ac e ís icas del pa che. Luego se aplica SVM(suppo ec o
machine) sob e las ca ac e ís icas ex aídas pa a iden i ica a que clase pe enece el
obje o encuad ado en el pa che. Además, usamos un mé odo de eg esión lineal sob e las
ca ac e ís icas pa a es ima los lími es de la cajas delimi ado as. En la imagen in e io
podemos e como se ía es a a qui ec u a:
23
Figu a 5.2: A qui ec u a basada en un en oque de ue za b u a. Fuen e: [49]
Sin emba go el en oque po ue za b u a es demasiado cos oso en iempo de in e encia
y en enamien o, así como in ensi o en ecu sos compu acionales. Una mejo a ob ia es
educi el núme o de en ajas deslizan es. De es a o ma, se c ea un mé odo que se
enca gue de p opone egiones de in e és oROIs a pa i de una imagen. Un ejemplo
de es e mé odo es la búsqueda selec i a.
Al comienzo cada píxel es un g upo en si mismo. Pos e io men e, se calcula la ex u a
de cada g upo y se unen aquellos que sean mas simila es. Con el obje i o de e i a
que los g upos g andes se coman a los pequeños, end án p io idad la unión de g upos
pequeños en e a los g andes. Se con inua es e p oceso de unión has a que se cumpla
alguna condición de con e gencia. En la imagen in e io , podemos e como es os g upos
se an o mando en la p ime a ila, mien as que los ec ángulos azules de la segunda
ila mues a odas las posibles egiones de in e és gene adas en cada paso de la búsqueda
selec i a.
24
Figu a 5.3: Mé odo de p oposición de egiones: búsqueda selec i a. Fuen e: [31]
En 2013 Ross Gi shick [50] p opone la p ime a a qui ec u a que hace uso de mé odos
de p oposición de egiones de in e és, R-CNN. Es a a qui ec u a p opone ce ca de 2000
ROIs po imagen. Luego cada egión se u iliza como en ada de una ed neu onal con-
olucional, de o ma que cada egión es p ocesada de mane a indi idual. Es e p oceso es
seguido de capas o almen e conexas que pe mi en ealiza la clasi icación del obje o y la
es imación de la caja delimi ado a. En la imagen in e io podemos e es a a qui ec u a:
Figu a 5.4: A qui ec u a del de ec o R-CNN. Fuen e: [49]
25
5.2.2. YOLO
Los sis emas de de ección ac uales eu ilizan clasi icado es pa a ealiza la de ección. Pa a
de ec a un obje o, es os sis emas oman un clasi icado pa a ese obje o y lo e alúan a lo
la go de la imagen en a ios luga es y escalas. Los sis emas como los modelos de pa es
de o mables o de o mable pa s models (DPM) u ilizan un en oque de en ana co ediza
en el que el clasi icado se ejecu a en luga es uni o memen e espaciados en oda la imagen.
En oques más ecien es como el R-CNN u ilizan mé odos como p opues a de egiones
pa a gene a p ime o las po enciales cajas delimi ado as en una imagen y luego ejecu-
a un clasi icado en cada una de es as cajas p opues as. Después de la clasi icación, el
pos -p ocesamien o se u iliza pa a e ina las cajas delimi ado as, elimina las de eccio-
nes duplicadas, y ol e a clasi ica las cajas en base a o os obje os de la imagen. Es os
sis emas son len os y di íciles de op imiza po que cada componen e indi idual debe se
en enado po sepa ado.
YOLO [46] eplan ea la de ección de obje os como un único p oblema de eg esión, di-
ec amen e de los píxeles de la imagen a las coo denadas de la caja delimi ado a y las
p obabilidades de clase. En es a nue a o ma de a on a la de ección p opues a po
YOLO, una sola ed con olucional p edice simul áneamen e múl iples cajas delimi a-
do as y p obabilidades de clase pa a esas cajas. Podemos e una ilus ación de es e
uncionamien o en la igu a 5.13. YOLO se en ena en imágenes comple as y op imiza
di ec amen e el endimien o de la de ección. Es e modelo uni icado iene a ios bene icios
sob e los mé odos adicionales de de ección de obje os:
YOLO es ex emadamen e ápido. Al en oca la de ección como un p oblema
de eg esión, no se necesi an sis emas complejos. Simplemen e se ejecu a la ed neu-
onal en una nue a imagen pa a p edeci las de ecciones. Además, YOLO alcanza
más del doble de la p ecisión media de o os sis emas en iempo eal.
YOLO abaja globalmen e sob e la imagen. A di e encia de las écnicas de
en ana co ede a y p opues as de egiones, YOLO e oda la imagen du an e
el iempo de en enamien o y p ueba, de mane a que implíci amen e codi ica la
in o mación con ex ual sob e las clases, así como su apa iencia.
YOLO ap ende ep esen aciones gene alizables de obje os. Cuando se en ena
en imágenes na u ales, YOLO supe a los mé odos de de ección más a anzados
como el DPM y R-CNN po un amplio ma gen. Dado que YOLO es al amen e
gene alizable, es menos p obable que se descomponga cuando se aplica a nue os
dominios o en adas inespe adas.
A pesa de es as en ajas, YOLO oda ía se queda a ás de los sis emas de de ección de
úl ima gene ación en la p ecisión. Aunque puede iden i ica ápidamen e los obje os en
las imágenes, iene p oblemas pa a localiza con p ecisión algunos obje os, especialmen e
los pequeños.
32

Figu a 5.12: Es uc u a de la es uc u a de ed con olucional de la p ime a e sión de
YOLO, con 24 capas con olucionales seguidas po dos capas o almen e
conec adas. Fuen e [46].
YOLO ha ido publicando a ias e siones, desde la e sion inicial cuya es uc u a pode-
mos e en la igu a 5.12 has a la úl ima de ellas YOLO 4[8] publicada el 23 de Ab il de
2020, pasando po las e siones YOLO 3[48] y YOLO 3 iny[25], la cual se á de especial
in e és debido a su meno amaño y po an o mayo apidez, una ca ac e ís ica un-
damen al en la conducción au ónoma pa a in en a consegui p ocesamien o en iempo
eal.
Funcionamien o global de es uc u as YOLO
La iloso ía de las es uc u as YOLO consis e en uni ica los di e en es componen es de
la de ección de obje os en una sola ed. El uncionamien o global de la in e encia, que
podemos e de mane a isual en la igu a 5.13, es el siguien e:
1. P ime amen e, la imagen es di idida en una cuad ícula de amaño SxS. Si el cen o
de un obje o cae en una celda de la cuad ícula, esa celda es la esponsable de
de ec a el obje o.
2. Cada celda de ec a Bcajas delimi ado as y ni el de con ianza pa a dichas cajas,
que e lejan cómo de segu o es á el modelo de que esa caja con iene un obje o y
cómo de segu o es á de que e ec i amen e la caja se co esponde al obje o que ha
de ec ado, es deci , Con ianza =P(Obje o)∗IOU u h
p ed . Si no hay obje o en esa
celda, la con ianza debe ía de se 0, en o o caso debe ía se el IOU en e la caja
de ec ada y la ead.
3. Cada una de las cajas delimi ado as es á compues a po 5 p edicciones: x, y, w, h
y la con ianza. (x, y) ep esen a el cen o de la caja de ec ada y (w, h)la anchu a
33
Figu a 5.13: Ilus ación del uncionamien o global de YOLO, donde p ime o se di ide la
imagen en cuad ículas más pequeñas, sob e és as se calculan di e en es cajas
delimi ado as o bounding boxes y las p obabilidades de las dis in as clases,
y inalmen e se ob ienen las de ecciones. Fuen e [46].
y al u a espec i amen e.
4. Además, cada celda de la cuad ícula ambién p edice Cp obabilidades condicio-
nales P(Clasei|Obje o), una po cada clase, que ep esen an las p obabilidades de
que en esa celda se encuen e el obje o de la clase i. Rema ca que se p edice un
ec o de Cp obabilidades condicionales po cada celda, independien emen e del
núme o de cajas de ec adas B.
5. En la in e encia, se mul iplican las p obabilidades condicionales de cada clase y la
con ianza de cada caja de ec ada, ob eniendo así las p obabilidades especí icas de
cada clase po cada caja de ec ada:
P(Clasei|Obje o)∗P(Obje o)∗IOU u h
p ed =P(Clasei)∗IOU u h
p ed
Es a medida nos indica la p obabilidad de que cada clase apa ezca en las cajas
de ec adas y cómo de bien se ajus a dicha caja.
YOLO 3
Vamos a menciona b e emen e las mejo as que implemen a YOLO 3 con espec o a la
p ime a e sión, alguna de es as mejo as implemen adas en YOLO 2 y o as inalmen e
en YOLO 3:
34
No malización de los lo es en las capas con olucionales.
Clasi icado de al a esolución
Úl ima capa con olucional con ancho boxes o cajas de anclaje, ambién llamadas
cajas a p io i. En ez de p edeci di ec amen e las cajas, se p edicen los o se s
con espec o a unas cajas de anclaje p e iamen e p ede inidas. Es o es muy ú il
pues podemos de ini dichas cajas de anclaje pa a que se adecuen a la o ma de los
obje os de nues o da ase .
Clus e s dimensionales: Como hemos mencionado, en muchos p oblemas de de ec-
ción los obje os ienen una o ma de e minada. Pa a calcula las Kcajas a p io i
que mejo cub en es a gama de o mas en un da ase , se u iliza el algo i mo K-
Means.
P edicción di ec a de la localización
P edicción de cajas delimi ado as
Pa a la p edicción de las cajas delimi ado as u iliza la misma me odología que YOLO9000[47].
La ed p edice 4 coo denadas pa a cada caja delimi ado a x, y. w, h, de o ma que si
la celda de la cuad ícula iene un o se con espec o a la esquina supe io izquie da de
la imagen de (cx, xy)y la caja delimi ado a a p io i iene anchu a pw, ph, en onces las
p edicciones inales son:
bx=σ( x) + cx
by=σ( y) + cy
bw=pwe w
bh=phe h
Es deci , la ed p edice o se s con espec o a cajas a p io i o cajas de anclaje (ancho
boxes). Podemos e una isualización de es as ecuaciones en la igu a 5.14 Es o es muy
ú il pues en muchos p oblemas de de ección los obje os ienen una o ma de e minada.
Po an o, podemos de ini dichas cajas de anclaje pa a que se adecuen a la o ma de
los obje os de nues o da ase . Pa a calcula las Kcajas a p io i que mejo cub en es a
gama de o mas en un da ase , se u iliza el algo i mo K-Means.
Du an e el en enamien o se usa la suma de cuad ados como unción de pé dida, de o ma
que el g adien e iene dado po ˆ
∗− ∗donde ˆ
∗es el o se p edicho po la ed y ∗es el
o se eal.
YOLO 3 p edice una pun uación de obje o pa a cada caja delimi ado a usando eg esión
logís ica. Si el cuad o delimi ado a p io i no es la mejo , pe o se supe pone a un obje o
po encima de un umb al (en es e caso 0.5), se igno a la p edicción.
35
Figu a 5.14: Cajas delimi ado as con dimensiones p e ias y p edicciones. Se p edice el
ancho y la al u a de la caja como o se s desde el cen o de la caja. Fuen e
[48].
P edicción de clases
Cada casilla p edice las clases que puede con ene la caja delimi ado a u ilizando la clasi-
icación mul i-e ique a, usando pa a ello clasi icado es logís icos independien es. Du an e
el en enamien o se usa como unción de pé dida la en opía c uzada bina ia.
P edicciones en di e en es escalas
YOLO 3 ealiza p edicciones en 3 escalas di e en es. El sis ema ex ae ea u es o ca-
ac e ís icas de cada una de es as 3 escalas u ilizando un concep o simila a las edes
pi amidales de ca ac e ís icas o ea u e py amid ne wo ks[32]. En la es uc u a, después
de las capas de ex acción de ca ac e ís icas se añaden di e en es capas con olucionales,
la úl ima de ellas enca gada de p edeci un enso 3d codi icando las p edicciones de cajas
delimi ado as, p obabilidad de con ene un obje o y p edicciones de clase. Así, el enso
inal es de la o ma N×N×(Nboxes ∗(4+1+Nclasses)donde Nboxes es el núme o de
cajas p edichas en cada escala, 4 se co esponde a los o se s de la caja delimi ado a, 1 a
la p edicción del obje o o p obabilidad de con ene un obje o y Nclasses es el núme o de
clases del da ase .
A se coge el ea u e map o mapa de ca ac e ís icas de las dos capas an e io es y se
aumen a en 2×. También se coge un mapa de ca ac e ís icas de las capas an e io es de la
ed y se usiona con las ca ac e ís icas aumen adas usando conca enación. Es e mé odo
nos pe mi e ob ene in o mación semán ica más signi ica i a.
Se ealiza el mismo p oceso una ez más pa a p edeci cajas pa a la escala inal. Así, las
p edicciones pa a la 3aescala se bene ician de odos los cálculos p e ios.
36
Figu a 5.15: Ex ac o de ca ac e ís icas Da kne -53. Fuen e[48].
Ex ac o de ca ac e ís icas
Se u iliza un en oque híb ido en e el ex ac o de ca ac e ís icas u ilizado po YOLO 2
(Da kne -19) y capas esiduales. U iliza capas con olucionales sucesi as de 3×3y1×1,
con algunas in e conexiones o a ajos. Tiene 53 capas con olucionales en o al y ecibe el
nomb e de Da kne -53. Podemos e un esumen de su es uc u a en la igu a 5.15.
En el caso de YOLO 3 iny la es uc u a se educe conside ablemen e a un o al de 15
capas con olucionales, lo que aumen a conside ablemen e su elocidad en la in e encia
pe o sac i ica p ecisión, sob e odo en obje os muy pequeños.
Compa ación con o as es uc u as
Podemos e una compa ación en los esul ados inales con o as es uc u as popula es
pa a la de ección de obje os en la igu a 5.16
37

Figu a 5.16: Compa ación dis in as es uc u as de edes neu onales con olucionales don-
de podemos obse a el adeo o balance en e elocidad y p ecisión pa a .5
IOU, des acando YOLO 3 po su g an elocidad y man eniendo una buena
p ecisión. Fuen e[48].
YOLO 4
Ha emos un b e e comen a io sob e la úl ima e sión de YOLO, YOLO 4 [8], que p e-
sen a mejo as conside ables con espec o a su p edeceso , YOLO 3, an o en elocidad
de in e encia como en p ecisión de en o no a un 10-12%, como podemos obse a en
la igu a 5.16. Podemos además encon a una desc ipción muy de allada jun o a los
pa áme os que u iliza la ed en es e enlace.
Sin emba go, aunque es una p opues a muy in e esan e pa a la conducción au ónoma po
su g an elocidad en cuan o a FPS y man eniendo una muy buena p ecisión con espec o
a o os de ec o es de úl ima gene ación, no lo a a emos en es e abajo debido a que uno
de los obje i os inales es la e aluación de es as es uc u as o edes en disposi i os de bajo
consumo, u ilizando pa a ello el amewo k openVINO 9.2, el cual no iene implemen ado
aún sopo e pa a es a es uc u a.
6. P esen ación de conjun os de da os u ilizados
Los esul ados de las edes de más conocidas de de ección de obje os han sido decepcio-
nan es sob e el da ase KITTI como se mues a en la sección 11.1. En ellos se obse a un
cla o p oblema pa a la localización y de ección de los obje os en las imágenes p esen es
en el da ase KITTI. El p oblema se e especialmen e acen uado en las clases pea ón
y ciclis a. Uno de los p incipales desa íos que in en a emos sol en a en es e p oyec o
38
Figu a 5.17: Compa ación de la p opues a YOLO 4 y o os de ec o es de obje os de
úl ima gene ación. YOLO 4 mejo a la p ecisión media (AP) y los FPS de
YOLO 3 en un 10 % y un 12 %, espec i amen e. Fuen e[8].
es como mejo a la p ecisión de nues as edes en las clases pea ón y ciclis a sin pe de
p ecisión a la ho a de localiza un clasi ica obje os de la clase coche.
En e las soluciones p esen adas, en es a sección de alla emos como hemos aumen ado
el núme o de obje os po clase, log ando así un mayo conjun o de en enamien o. La
idea es que es e aumen o de obje os de las es clases pe mi a aumen a la capacidad
de de ección y localización de las edes es udiadas. Pa iendo del da ase KITTI, donde
ealizamos una sepa ación alea o ia en e los conjun os de en enamien o y es , eniendo
así un 80% pa a en enamien o y un 20% pa a es .
Los da ase s u ilizados pa a aumen a las imágenes de las clases coche, pea ón y ciclis a
deben se simila es a las imágenes ecolec adas en el da ase KITTI. Como e emos en
es a sección, es os conjun os han sido c eados basados en un en o no de conducción, es
deci , g abadas desde un coche. Pos e io men e las imágenes son il adas de o ma que
omemos aquellas imágenes g abadas du an e el día y en buenas condiciones clima oló-
gicas. La azón de es e il o se debe a que el obje i o es mejo a la p ecisión sob e el
conjun o de es del da ase KITTI, luego el conjun o de en enamien o debe se simila
al conjun o de es . En pa icula , las imágenes del es cumplen es as condiciones. So-
mos conscien es que en un p oblema eal de conducción au ónoma un ehículo debe ía
se capaz de conduci de o ma au ónoma en cualquie si uación clima ológica ad e sa,
sin emba go es e p oyec o se cen a en una simpli icación del p oblema eal.
39
6.1. KITTI
El conjun o de da os KITTI [5] ue p esen ado en 2012. El da ase de de ección de obje os
consis e en 7481 imágenes a colo de di e en es escenas, almacenadas como imágenes png.
El amaño de las imágenes es ap oximadamen e 375×1275, ya que el amaño no es ijo y
cambia lige amen e a lo la go del da ase . Las imágenes ue on omadas po una cáma a
colocada sob e un coche mien as se conducía po zonas u ales y u banas en buenas
condiciones clima ológicas y du an e el día. El ehículo que g abó las imágenes es el
siguien e:
Figu a 6.1: Coche que ealizó los ídeos en los que se basa el da ase KITTI. Fuen e [5]
En cada imagen se e ique an odos los obje os que pe enezcan a alguna de la siguien e
ca ego ías:
Ca
Van
T uck
Pedes ian
Pe son(si ing)
Cyclis
T am
Miscelanous
En la igu a 6.2 emos el núme o de ins ancias po clase de obje o:
40
Figu a 6.2: Núme o de ins ancias po clase en el da ase KITTI.Fuen e [5]
Es ácilmen e ap eciable el desbalanceo de clases p esen e en el conjun o de da os KITTI.
En nues o caso, es ingimos el p oblema a las clases coche, pea ón y ciclis as. Su ge de
o ma na u al la necesidad de aumen a el conjun o de imágenes de en enamien o con
p esencia de pea ones y ciclis as, pues se obse a un cla o desequilib io en e el núme o
de obje os po clase. Además de la e ique a de clase, ambién con ienen in o mación
de las cajas delimi ado as en 2D, cuyas coo denadas son exp esadas en píxeles. Toda
la in o mación de las e ique as es almacenada en un a chi o . x que se c ea pa a cada
imagen. Un ejemplo de es e da ase podemos e lo en la siguien e imagen:
Figu a 6.3: Ejemplo e ique ado del da ase KITTI.
41
donde TP ep esen a ue posi i e, FP ep esen a alse posi i e y FN ep esen a
alse nega i e.
2. Recall: mide la capacidad del modelo de de ec a casos posi i os, en es e caso,
obje os que pe enezcan a alguna de las clases del da ase . Una de inición mas
ma emá ica se ía:
Recall =T P
T P +F N
po an o ecall es un po cen aje de los casos posi i os co ec amen e ace ados.
8.2. IOU
Además de los concep os de p ecision y ecall, necesi amos de ini IOU pa a pode ex-
plica mAP. In e sec ion O e Union o IOU mide el á ea de in e sección en e dos cajas
delimi ado as. Ma emá icamen e se ia el cocien e del á ea de in e sección y el á ea de la
unión de las cajas:
IOU =a ea de in e seccion
a ea o al de la union
Es a mé ica nos pe mi e es ablece cuando una p edicción ealizada po un obje o es
buena o no. Habi ualmen e se es ablece un umb al a pa i del cual damos po buena
una p edicción, en es e p oyec o hemos omado po buenas aquellas p edicciones que
supe a an el 0,5de es e alo . La siguien e igu a mues a la in e sección en e una caja
delimi ado a p edicha y la eal e ique ada en la imagen, conocida po g ound u h:
48

Figu a 8.1: In e sec ion O e Union. Fuen e [27]
8.3. AP y mAP
Po o o lado in oducimos a e age p ecision o AP. Si ep esen amos en un g á ico o-
mando como ejes y = p ecisión y eje x = ecall, AP es el á ea bajo la cu a, es deci ,
bajo el g á ico gene ado po ambas mé icas. Un ejemplo lo emos en la siguien e g á ica:
Figu a 8.2: A ea bajo la cu a de la g á ica p ecición- ecall. Fuen e [27]
49
La de inición ma emá ica mas conocida es:
AP =Z1
0
p( )d
donde p( )es la cu a o mada po el g á ico p ecisión- ecall. Finalmen e de inimos mAP
como la media de AP pa a un umb al de IOU dado. Un umb al clásico pa a IOU es [0.5,
0.05, 0.95], de es a o ma mAP se á la media de los alo es AP pa a cada alo de IOU,
que a desde 0.5 a 0.95 con un paso de 0.05.
9. F amewo ks
En es e capí ulo amos a p esen a b e emen e los amewo ks u ilizados an o pa a el
en enamien o de los modelos como pa a ealiza la in e encia en dis in os disposi i os
9.1. Tenso low
Tenso Flow es una pla a o ma o amewo k de código abie o de ex emo a ex emo pa a
el ap endizaje au omá ico. Cuen a con un ecosis ema in eg al y lexible de he amien as,
biblio ecas y ecu sos de la comunidad que les pe mi e a los in es igado es impulsa un
ap endizaje au omá ico inno ado y, a los desa ollado es, compila e implemen a con
acilidad aplicaciones con ecnología de ap endizaje au omá ico. Fue o iginalmen e desa-
ollado po el equipo de Google B ain, eemplazando a su p edeceso de código ce ado,
Dis Belie .
Tenso low pone a nues a disposición una se ie de ecu sos que acili an la c eación,
en enamien o y alidación de modelos pa a el ap endizaje au omá ico:
Modelos y conjun os de da os: Modelos p e iamen e en enados y conjun os de
da os que Google y la comunidad han desa ollado
He amien as: Ecosis ema de he amien as pa a ayuda al usua io con Tenso Flow
Biblio ecas y ex ensiones: Biblio ecas y ex ensiones c eadas en Tenso Flow
P og ama de ce i icación de Tenso Flow
Ap ende AA: Recu sos educa i os pa a ap ende los aspec os básicos del AA con
Tenso Flow
9.1.1. Objec De ec ion API
En nues o caso, u iliza emos en conc e o la API de de ección de obje os [60] pa a el en-
enamien o de los siguien es modelos o edes neu onales con olucionales p opo cionadas
50
po Tenso low p e iamen e en enados sob e el conjun o gene alis a COCO[10]. Es os
modelos los podemos encon a en el objec de ec ion model zoo [59] de enso low.
SSD mobilene incep ion V2 COCO
SSDLi e mobilene incep ion V2 COCO
Fas e R-CNN incep ion V2 COCO
Den o de es a API encon amos a ios elemen os que usa emos du an e los en enamien-
os:
model_main.py: Se a a del sc ip de py hon que se u iliza pa a el en enamien o
de las edes con olucionales pa a la de ección de obje os. Implemen a además la
e aluación del modelo sob e un conjun o de alidación cada cie o iempo pa a e
la e olución del modelo y no solo de la unción de pé dida. En e sus pa áme os
podemos encon a :
•pipeline_con ig_pa h: Ru a al a chi o de con igu ación, que pasamos a ilus a
b e emen e más abajo.
•model_di : Ru a donde que emos que se gua de el modelo een enado jun o
a los úl imos checkpoin s gene ados.
•num_ ain_s eps: Núme o máximo de pasos a ealiza en el en enamien o.
•sample_1_o _n_e al_examples: Tamaño ela i o del da ase de alidación
omado pa a cada e aluación
model zoo [59]: Ca pe a con los modelos p een enados o ecidos po el amewo k.
Aquí podemos encon a los modelos an e io men e mencionados.
samples: En es a ca pe a encon amos algunos ejemplos. Nos se á de especial u i-
lidad la subca pe a con igs, donde podemos encon a plan illas de con igu ación
pa a las dis in as edes.
me ics: Ca pe a con dis in as mé icas a usa . En nues o caso u iliza emos las
mé icas de COCO.
da ase _ ools: Ca pe a donde podemos encon a dis in as he amien as. En
nues o caso u iliza emos el sc ip c ea e_ki i_ _ eco d pa a gene a los a chi os
enso low eco ds, que u iliza á el amewo k an o pa a el en enamien o como
las alidaciones.
Cabe des aca que, como hemos mencionado an e io men e, nues as imágenes deben
se ans o madas p e iamen e a Tenso low eco ds pa a pode se p ocesadas po el
amewo k. El o ma o TFReco d es un o ma o simple pa a almacena una secuencia
de egis os bina ios, de mane a que sea más e icien e el almacenamien o y lec u a en
ba ches o lo es de los mismos.
51
Pasamos a desc ibi aho a b e emen e la composición del a chi o de con igu ación
a se usado en el een enamien o median e el sc ip model_main.py. Es e a chi o iene
es uc u a de JSON y nos encon amos los siguien es campos:
model: Nos pe mi e especi ica el modelo que amos a een ena jun o a los pa-
áme os especí icos del modelo y o o más gene ales como el núme o de clases, la
gene ación de ancho s, las unciones de pé dida y pos -p ocesamien o.
ain_con ig: En es e campo podemos especi ica pa áme os como el núme o de
imágenes po lo e, el op imizado a se u ilizado en el een enamien o (RMPS p op,
ADAM, e c), el checkpoin del que pa i si que emos ealiza un ine uning y no
un een enamien o desde 0, da a augmen a ion y dónde se encuen an nues as
imágenes en o ma o eco d pa a el een enamien o.
e al_con ig: Nos pe mi e especi ica las mé icas a u iliza (en nues o caso COCO),
el núme o de imágenes a u iliza en la e aluación, núme o de imágenes a isualiza
en cada e aluación, inclui mé icas po cada ca ego ía y dónde se encuen an
nues as imágenes en o ma o eco d pa a las e aluaciones.
9.1.2. Tenso boa d
Además, enso low pone a nues a disposición la he amien a Tenso boa d. Tenso Boa d
p opo ciona la isualización y las he amien as necesa ias pa a expe imen a con el ap en-
dizaje au omá ico, como po ejemplo:
Segui y isualiza mé icas, como la pé dida y la exac i ud o accu acy.
Visualiza el g a o del modelo (ope aciones y capas)
Mos a imágenes
Podemos e un ejemplo de su in e az g á ica en la igu a 9.1.
52
Figu a 9.1: In e az g á ica de Tenso boa d.
Usa emos es a he amien a pa a supe isa el ap endizaje de nues as edes, ya que
pod emos i iendo en cada i e ación las unciones de pé dida, el accu acy y algunas
imágenes mos ando las de ecciones que ealiza nues a ed.
9.2. Open ino oolki
OpenVINO [43] (Open Visual In e ence and Neu al ne wo k Op imiza ion) oolki es un
ki de he amien as g a ui o que acili a la op imización de un modelo de Deep Lea -
ning o Ap endizaje P o undo p oceden e de di e en es amewo ks y la implemen ación y
ejecución median e un mo o de in e encia en el ha dwa e de In el. El ki de he amien-
as iene dos e siones: OpenVINO oolki , que es apoyado po la comunidad de código
abie o y la dis ibución de In el(R) de OpenVINO oolki , que es apoyado po In el.
El p incipal componen e de es e ki de he amien as es el Deep Lea ning Deploymen
Toolki (DLDT), que nos o ece dos uncionalidades p incipales:
1. Gene a a chi os IR (Rep esen ación In e media) haciendo uso del op imizado
de modelos a pa i de un modelo en enado o uno público.
2. Ejecu a la in e encia haciendo uso del mo o de in e encia en los disposi i os
ha dwa e especi icados
9.2.1. Ca ac e ís icas p incipales
Pe mi e ealiza in e encia sob e modelos de ap endizaje p o undo basados en edes
neu onales con olucionales
53

Admi e la ejecución he e ogénea a a és de una CPU In el R
, G á icos In eg ados
In el R
, In el R
FPGA, In el R
Mo idiusTM Neu al Compu e S ick, In el R
Neu al
Compu e S ick 2 e In el R
Vision Accele a o Design con VPU In el R
Mo idiusTM.
Acele a el iempo de come cialización a a és de una biblio eca ácil de usa con
uncionalidades de isión po o denado y núcleos p eop imizados
Incluye llamadas op imizadas pa a los es ánda es de isión a i icial, incluyendo
OpenCV* y OpenCLTM
9.3. Da kne
Da kne [45] es un amewo k o en o no pa a edes neu onales de código abie o esc i o
en C y CUDA. Es ápido, ácil de ins ala y sopo a compu ación de CPU y GPU. En
nues o caso u iliza emos la e sión de AlexeyAB, que podemos encon a en su eposi-
o io de gi hub[16].
En e las uncionalidades que nos o ece es e en o no, des acan las edes neu onales YO-
LO (You Only Look Once, sólo mi as una ez) que se ca ac e izan po aplica una sola
ed neu onal a oda la imagen, la cual di ide la imagen en egiones más pequeñas, luego
p edice las cajas delimi ado as y asigna p obabilidades pa a cada una de es as egiones.
És e hecho hace que la in e encia en es e ipo de es uc u as sea más ápida que en o o
ipo de es uc u as de edes con encionales.
P opo ciona dis in as uncionalidades, en e las que encon amos:
da kne .exe de ec o : Es el sc ip p incipal e implemen a las siguien es uncio-
nalidades en unción del segundo pa áme o que in oduzcamos:
• ain: En enamien o
• alid: Validación
•demo: Nos pe mi e ejecu a la ed sob e un a chi o de ideo o en iempo eal
u ilizando una cáma a.
c g: Ca pe a con plan illas de con igu aciones sob e dis in as edes.
sc ip s: Ca pe a con di e en es sc ip s que nos se an de u ilidad, como po ejem-
plo gen_ancho s.py, el cual u iliza K-Means pa a calcula de o ma óp ima las
dimensiones de los ancho s que u iliza an las dis in as capas de la ed.
9.4. Módulos
El ki de he amien as se encuen a encapsulado di e en es módulos o componen es.
Los p incipales y de los que ha emos uso se án los siguien es:
54
Deep Lea ning Deploymen Toolki : Es el componen e p incipal. Se subdi ide
en:
•Op imizado de modelos: Pe mi e impo a modelos y p epa a los pa a una
ejecución óp ima median e el mo o de in e encia. El Op imizado de Modelos
impo a, con ie e (a IR) y op imiza modelos de amewo ks como Ca e,
Tenso Flow, MXNe , Kaldi y ONNX.
•Mo o de in e encia: Una API uni icada pa a pe mi i la in e encia de al o
endimien o en dis in os ipos de ha dwa e.
•Samples: Un conjun o de aplicaciones sencillas de consola que demues an
cómo u iliza el mo o de in e encia.
•Tools: He amien as adicionales
Open Model Zoo: Nos o ece un conjun o de demos pa a u iliza el mo o de
in e encia, he amien as adicionales pa a desca ga modelos y medi la p ecisión
de los mismos y un conjun o de modelos p een enados jun o a documen ación
sob e los mismos.
Pos -T aining Op imiza ion ool: He amien a que pe mi e calib a modelos y
ealiza in e encia usando en e os de 8 bi s.
Deep Lea ning Wo kbench: En o no g á ico basado en la web que pe mi e u ili-
za ácilmen e a ios componen es so is icados del ki de he amien as OpenVINOTM.
Podemos e un ejemplo de la in e az g á ica en la igu a 9.2.
Figu a 9.2: In e az g á ica de la he amien a Deep Lea ning Wo kbench.
10. Expe imen os ealizados
Habla de la mejo a de la p ecisión y educción del e o g acias a dis in as écnicas como
da a augmen a ion, de ini nue os ancho s, ha d nega i e mining e c
55
En algun lado hay que p esen a las medidas de p ecision es udiadas, IOU,MAP, e c
10.1. Ancho Boxes
En la e apa de p edicción de múl iples obje os en una imagen, las edes neu onales como
SSD o YOLO, ealizan miles de p edicciones y solo mues an aquellas que deciden que
son un obje o.
El es ado del a e de los sis emas de de ección de obje os unciona de la siguien e mane a:
1. C ea miles de cajas po de ec o oancho boxes pa a cada p edic o de o ma que
ep esen e la o ma, amaño y localización del obje o que se especializa.
2. Pa a cada ancho box, calcula que obje o de la imagen iene la caja delimi ado a
con mayo IOU.
3. Si el IOU máximo es mayo del 50 %, en onces el ancho box que p edice el obje o
de la imagen que ob u o mayo IOU.
4. En caso con a io, el ancho box decidi á que no hay obje o.
Es e mé odo unciona bien en la p ác ica, pe o como emos las cajas po de ec o son
o almen e i ales pa a que nues o de ec o de obje os enga una buena capacidad de
p edicción. Po ejemplo si obse á amos los ancho s boxes gene ados po nues a ed
se ía algo así:
56
Figu a 10.1: Ancho Boxes gene ados po un de ec o de obje os. Fuen e [4]
Y en es a imagen solo es amos mos ando un bajísmo po cen aje de los ancho boxes
exis en es. Usa los ancho boxes po de ec o puede c ea p edic o es que es án demasiado
especializados y los obje os de la imagen se án incapaces de log a un IOU mayo de 50%
con alguna de las cajas po de ec o gene adas. De o ma que, la ed neu onal no sab á
que esos obje os exis en y nunca ap ende á de ellos. Po ello debemos de adap a las
cajas po de ec o pa a ene una o ma y amaño ideal pa a nues os obje os, log ando
cajas po de ec o mucho mas ajus adas. Un ejemplo de esas modi icaciones se ía:
57
conjun o KITTI. Como se ha comen ado an e io men e, es e hecho se debe a las di e en-
cias exis en es en e los conjun os de da os de en enamien o. Finalmen e compa amos
los esul ados ob enidos sob e la clase pea ón:
Figu a 11.5: Compa ación del mAP sob e la clase pea ón log ado po la ed SSD Incep-
ion en enada sob e KITTI y el da ase comple o.
En la igu a 11.5, se mues a una disminución sus ancial de la capacidad de de ección
de pea ones de la ed, siendo una disminución ce cana al 80 % en la capacidad de de ec-
ción de pea ones. La a ianza de los esul ados ob enidos sob e el da ase comple o ha
disminuido lige amen e, pe o un modelo mas es able no compensa la poca capacidad de
in e encia de pea ones.
Las azones del endimien o de la ed se han de allado an e io men e, señalando espe-
cialmen e al edimensionamien o de es a ed, a las di e encias de amaño de imagen de
los da ase s y la di e encia en la localización de los obje os en la imagen como g andes
p oblemas que in luyen eno memen e en la capacidad de de ección de la ed.
11.2. Resul ados de la ed Fas e R-CNN
En es a subsección amos a expone los esul ados de pa ida log ados po la ed Fas e
R-CNN sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado
po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una
compa ación del endimien o po clase log ado po la ed en ase de een enamien o.
11.2.1. Resul ados Fas e R-CNN sob e KITTI
Los esul ados de la ed sob e el conjun o de da os KITTI son los siguien es:
64

Figu a 11.6: mAP de las clases coche, ciclis a y pea ón
En la igu a 11.6, se obse a como es a ed iene una mayo capacidad de de ección que
SSD a simple is a. Es a ed po o o lado es mucho mas len a, algo que p oba emos
mas adelan e, siendo in iable pa a la in e encia en iempo eal sob e un ehículo. La
p ecisión log ada en la clase coche es supe io al 0,6, mien as que la de ección de
ciclis as p ác icamen e llega al 0,5 as 1000000 de épocas. Pea ón es la clase que mas
cues a localiza y clasi ica a es a ed, con una p ecisión supe io al 0,3. Finalmen e,
obse amos que es e modelo es mucho mas es able en sus de ecciones que SSD al ene
una meno a iabilidad en sus in e encias y iene una capacidad de p edicción en ase de
en enamien o mucho mayo a la de SSD, log ando una p ecisión ap oximada del 60 %
en coches, del 50 % en ciclis as y del 30 % en pea ones.
11.2.2. Resul ados Fas e R-CNN sob e el da ase comple o
Los esul ados de la ed sob e el conjun o de da os comple o son los siguien es:
65
Figu a 11.7: mAP de las clases coche, ciclis a y pea ón
En la igu a 11.7 se obse an unos esul ados peo es a los p esen ados sob e KITTI. Se
educe la capacidad de p edicción en odas las clases y se obse a una lige o aumen o
en la a ianza de la capacidad de de ección de obje os. Es e compo amien o se debe
a las di e encias en la localización de los obje os y el amaño de las imágenes comen-
adas an e io men e en e lo conjun os de da os KITTI, Be keley Deepd i e Da ase y
Tshingua-Daimle .
11.2.3. Compa ación de esul ados
En es a sección compa a emos clase a clase los esul ados ob enidos po es a ed has a
el momen o. Comenza emos compa ando la clase coche:
Figu a 11.8: Compa ación del mAP sob e la clase coche conseguido po la ed Fas e
R-CNN en enada sob e KITTI y el da ase comple o.
66
El núme o de épocas en enadas es de 1000000, dónde emos que al comienzo la p ecisión
es mayo sob e KITTI, pe o al inal e mina siendo lige amen e supe io sob e el conjun o
de da os comple o. En pa icula , se ha conseguido el obje i o de man ene o supe a la
p ecisión de la ed sob e KITTI en es a clase. Aho a emos los esul ados sob e la clase
ciclis a:
Figu a 11.9: Compa ación del mAP sob e la clase ciclis a conseguido po la ed Fas e
R-CNN en enada sob e KITTI y el da ase comple o.
En es a clase emos que se ha p oducido una descenso conside able en la p ecisión,
siendo es a di e encia mayo al comienzo del een enamien o y meno con o me es e
a anza. El obje i o de mejo a la p ecisión sob e es a clase no se ha log ado. Una de las
posibles azones es que es a ed ealiza un edimensionamien o meno de las imágenes,
a un amaño 600 ×1024, eniendo como consecuencia una educción del amaño de los
ciclis as. Además, los ancho boxes po de ec o de la ed no han sido uneados, luego
puede que no es én ajus ados una o ma adecuada pa a la clase ciclis a. O o posible
p oblema es que si los ciclis as se encuen an al inal de la imagen, y son pequeños,
pueden no se p opues os como egiones de in e és, eniendo como consecuencia que la
ed no ap enda las ca ac e ís icas necesa ias pa a la de ección p ecisa de ciclis as.
Finalmen e emos los esul ados sob e la clase pea ón:
67
Figu a 11.10: Compa ación del mAP sob e la clase pea ón conseguido po la ed Fas e
R-CNN en enada sob e KITTI y el da ase comple o.
Al comienzo del een enamien o se obse a una g an di e encia en e la p ecisión en la
de ección de la clase pea ón sob e ambos da ase s, sin emba go, al inal podemos e
como esa di e encia se ha educido comple amen e. El obje i o de mejo a la capacidad
p edic i a sob e la clase pea ón no se ha log ado, eniendo el mismo p oblema que la clase
ciclis a. Las azones son simila es a las expues as en la clase ciclis a, es deci , se a a
de obje os di íciles de de ec a debido a la posible ausencia de ancho boxes adecuados o
bien que su amaño en la imagen no es signi ica i o a se señalado como egión de in e és,
luego la ed no ap ende de los casos en el ondo de la imagen.
11.3. Resul ados de la ed SSD Mobile Li e
En es a subsección amos a expone los esul ados de pa ida log ados po la ed SSD
Mobile Li e sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado
po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una
compa ación del endimien o po clase log ado po la ed en ase de een enamien o.
11.3.1. Resul ados SSD Mobile Li e sob e KITTI
Los esul ados de la ed sob e KITTI son los siguien es:
68
Figu a 11.11: mAP de las clases coche, ciclis a y pea ón
Obse amos los esul ados sob e el een enamien o de 200000 épocas ealizado. A p ime-
a is a, emos unos esul ados in e io es a los log ados con la ed Fas e R-CNN, aunque
es os an en la línea de los log ados son SSD Incep ion, e incluso son mejo es que los de
es a ed. En la clase coche iene una p ecisión del 0,4, mien as que en la clase ciclis a
es de 0,15. La clase pea ón es la que mas p oblemas iene pa a localiza y clasi ica , con
un mAp ce cano al 0,1. En esumen, es capaz de de ec a ap oximadamen e el 40% de
los coches, el 15 % de ciclis as y el 10 % de pea ones. O a ca ac e ís ica de es a ed, es
que mues a una mayo es abilidad, al mos a esul ados menos olá iles en las dis in as
e aluaciones ealizadas du an e el en enamien o.
11.3.2. Resul ados SSD Mobile Li e sob e el da ase comple o
Los esul ados de la ed sob e el conjun o de da os comple o son los siguien es:
69

Figu a 11.12: mAP de las clases coche, ciclis a y pea ón
A p io i los esul ados son peo es que los conseguidos en KITTI, algo que e emos mas
de alladamen e en la siguien e sección. Al menos se man iene la es abilidad de las p e-
dicciones, aunque la p ecisión ha bajado en odas las clases de ec adas. En la clase coche
mues a una p ecisión po debajo de 0,4 as 120000 épocas, mien as que po o o lado
las clases pea ón y ciclis a ienen un mAp po debajo del 0,1. En la siguien e sección
e emos cla amen e que el da ase comple o disminuye la p ecisión de la ed, compo a-
mien o simila al is o en las edes SSD Incep ion y Fas e R-CNN.
11.3.3. Compa ación de esul ados
En es a sección compa a emos clase a clase los esul ados ob enidos po es a ed has a
el momen o. Comenza emos compa ando la clase coche:
70
Figu a 11.13: Compa ación del mAP sob e la clase coche conseguido po la ed SSD
Mobile Li e en enada sob e KITTI y el da ase comple o.
La igu a 11.13 mues a la meno capacidad de p ecisión sob e la clase coche en el da ase
comple o una ez se compa a con el KITTI. Es a di e encia no es supe io a dos pun os
po décima. Po o o lado emos los esul ados en la clase ciclis a:
Figu a 11.14: Compa ación del mAP sob e la clase ciclis a conseguido po la ed SSD
Mobile Li e en enada sob e KITTI y el da ase comple o.
La igu a 11.14 ep esen a la di e encia exis en e en e la capacidad de p edicción de
ciclis as po la ed una ez een enada sob e dis in os conjun os, siendo mucho meno
en el caso del conjun o de da os comple o. Finalmen e emos los esul ados sob e la clase
pea ón:
71
Figu a 11.15: Compa ación del mAP sob e la clase pea ón conseguido po la ed SSD
Mobile Li e en enada sob e KITTI y el da ase comple o.
Los esul ados ilus ados en la igu a 11.15 an en la línea de lo comen ado p e iamen e,
es deci , que la capacidad de p ecisión de la ed ha disminuido al aumen a el conjun o
de en enamien o con mas imágenes.
Además de ob se a un endimien o bajo en odas las clases, especialmen e acen uado
en las clases pea ón y ciclis a. Es e compo amien o se debe p incipalmen e a a ias
azones:
La a qui ec u a de la ed, de o ma que el edimensionamien o que ealiza penaliza
especialmen e a los obje os pequeños, como pueden se los ciclis a y pea ones en
una imagen.
Las di e encias de amaño de imagen de los conjun os KITTI, Be keley Deepd i e
Da ase y Tshingua-Daimle .
En el apa ado de conclusiones amplia emos las causas y mo i os de es e compo amien o.
11.4. Resul ados de la ed YOLO 3
En es a subsección amos a expone los esul ados de pa ida log ados po la ed YOLO 3
sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado po KITTI,
Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una compa ación
del endimien o po clase log ado po la ed.
72
11.4.1. Resul ados YOLO 3 sob e KITTI
Figu a 11.16: MAP du an e el een enamien o de la ed YOLO 3 sob e KITTI.
Como podemos e , el ap endizaje inicial es g ande g acias a ac o es como que el ex ac-
o de ca ac e ís icas es á p e iamen e en enado. El mAP sob e el conjun o de alidación
sigue aumen ando y iende a es abiliza se sob e odo en la clase coche en o no a las 20000
i e aciones, que con un amaño de 64 imágenes po lo e, equi ale a 1280000 imágenes
p ocesadas.
11.4.2. Resul ados YOLO 3 sob e el da ase comple o
Figu a 11.17: MAP du an e el een enamien o de la ed YOLO 3 sob e el da ase com-
ple o.
73
como al en ena sob e el da ase comple o, se pie de p ecisión, al se las imágenes de los
da ase s an dis in as y se meno el en enamien o o al.
13. Compa ación
13.1. MAP
En la siguien e igu a podemos obse a una compa ación del mAP ob enido en la in e-
encia inal sob e la pa ición es de KITTI de las dis in as edes, een enadas sob e
KITTI en azul y sob e el da ase inal en na anja:
Figu a 13.1: Compa ación del mAP ob enido po las dis in as edes.
Podemos obse a cómo en odas las edes se pie de p ecisión al een ena sob e el
da ase comple o o aumen ado. Es o no necesa iamen e indica que el modelo sea peo ,
simplemen e puede debe se a a ios ac o es como:
La e aluación únicamen e sob e un subconjun o del da ase KITTI.
La a iedad en los amaños y o mas de las cajas delimi ado as en e los dis in os
da ase s, al a a se el da ase KITTI de imágenes pano ámicas.
La exis encia de cajas delimi ado as con un á ea muy pequeña en el da ase aumen-
ado que, al abaja con edes que edimensionan y disminuyen mucho el amaño
de la imagen, puede no solo no apo a nada al en enamien o si no di icul a lo.
Al aumen a el amaño del da ase , se necesi e más iempo de en enamien o.
80

13.2. Velocidad de in e encia
En es e apa ado amos a compa a las dis in as edes en cuan o a elocidad de in e encia
se e ie e. Pa a ello, usa emos la mé ica FPS oF ames Po Segundo, que nos indica el
núme o de imágenes po segundo que es capaz de p ocesa dicha ed. Des aca que uno
de los obje i os es supe a el umb al de p ocesamien o en iempo eal de 20FPS.
Figu a 13.2: FPS alcanzado po las edes SSD, SDDLi e y Fas e -R-CNN ejecu adas
sob e di e en es disposi i os ha dwa e.
Podemos e como en e los dis in os disposi i os, My iad es el más len o y la CPU el más
ápido. También podemos obse a una di e encia in e esan e en cuan o a la GPU con un
modelo cuan izado con una p ecisión FP32, es deci , que abajo con a iables lo an es
de 32 bi s con espec o al mismo modelo cuan izado con FP16, mejo ando no ablemen e
la elocidad de la in e encia y sac i icando muy poca p ecisión en los esul ados inales.
És o es un concep o impo an e a ene en cuen a bajo el con ex o de la conducción,
donde la pé dida de un poco de p ecisión puede supone alcanza una elocidad de
p ocesamien o acep able. Po úl imo, emos como edes con más p ecisión como Fas e -R-
CNN se quedan muy lejos del umb al de p ocesamien o en iempo eal de 20FPS, mien as
que edes más lige as como SSD o SSDLi e lo supe an en casi odos los disposi i os.
81
Figu a 13.3: FPS alcanzado po ambas edes YOLO ejecu adas sob e una GPU de al o
endimien o.
Podemos e la g an di e encia en e ambas e siones de YOLO 3, siendo la e sión
YOLO 3 Tiny casi 5 eces más ápida a cambio de sac i ica algo de p ecisión, como
hemos is o en los esul ados. De nue o ecalca que la in e encia de es as dos edes se
ha ealizado en una GPU de al o endimien o, así que los FPS no debe ían compa a se
con el es o de edes.
13.3. In e cambio elocidad-consumo
Debido a que una de las a iables c í icas a conside a en la conducción au ónoma es la
au onomía del ehículo, amos a compa a los FPS ob enidos po cada ed eniendo en
cuen a el consumo de los di e en es disposi i os ha dwa e, pa a ob ene así un a io de
es a elocidad-consumo.
82
Figu a 13.4: Compa ación de los FPS po a io de las dis in as edes a endiendo a los
consumos medios de los dis in os disposi i os ha dwa e.
Vemos, como e a de espe a , cómo el disposi i o My iad des aca po su g an endimien o.
Es e disposi i o es á diseñado pa a la ejecución de edes neu onales de mane a e icien e
o eciendo un consumo muy bajo, de an solo 1W, y podemos ap ecia como cumple su
come ido en la g á ica an e io . Es e ipo de disposi i os es muy in e esan e pa a el pun o
de is a de la conducción, pudiendo se la in e encia en pa alelo una buena opción pa a
log a una elocidad de in e encia acep able man eniendo un consumo bajo.
Vamos a compa a es e a io de FPS/W ob enido po las 5 edes in en ando que la
compa ación sea lo más álida posible. Pa a ello amos a los esul ados ob enidos po las
edes SSD, SSD Li e y Fas e R-CNN al ejecu a la in e encia sob e la GPU in eg ada de
bajo consumo y po las edes YOLO 3 y YOLO 3 Tiny sob e la GPU de al o endimien o.
Recalca que no son el mismo disposi i o, pe o en ambos casos se a a de una GPU po
lo que la es uc u a y p ocesamien o son simila es.
83
Figu a 13.5: Compa ación del a io elocidad/po encia (FPS/W) al ealiza in e encia
con las dis in as edes, en el caso de SSD, SSDLi e y Fas e R-CNN sob e
una GPU in eg ada de bajo consumo(15W) y en el caso de YOLO 3 y
YOLO 3 Tiny sob e una GPU de al o endimien o (165W).
Es a g á ica nos mues a cómo la es uc u a de ed neu onal YOLO 3 Tiny sigue siendo
la que o ece mejo a io elocidad-consumo y, como hemos is o an e io men e, siendo
ambién una de las que mejo es esul ados en cuan o a p ecisión se e ie e.
14. Conclusiones
Es e p oyec o enía p incipalmen e dos obje i os que se desc i os al comienzo de la me-
mo ia:
Reen enamien o de una ed gene alis a pa a ap ende a iden i ica ehículos, pea-
ones y ciclis as.
Es udio del endimien o de la in e encia ealizada po la ed een enada en é mi-
nos de p ecisión, elocidad de in e encia y consumo sob e un conjun o de disposi-
i os ha dwa e.
Pa a esponde a la p ime a p egun a nos cen amos en el es udio de las dis in as solucio-
nes so wa e que nos pe mi en p ocesa las imágenes en iempo eal, usando de es a o ma
amewo ks conocidos en el campo de la de ección de obje os como Da kne , Open ino
y Tenso low. Es os amewo ks nos han pe mi ido een ena edes neu onales de p o-
pósi o gene alis a pa a ap ende a iden i ica ehículos, pea ones y ciclis as. En conc e o
se han abajado con las siguien es edes:
1. SSD Incep ion V2
2. SSD Mobile Li e
84
3. Fas e R-CNN
4. YOLO 3
5. YOLO 3 Tiny
El een enamien o se ha ealizado sob e el conjun o de da os KITTI y o o conjun o de
da os que consis e en la ampliación del conjun o de da os KITTI con algunas imágenes de
los conjun os Tshingua-Daimle y Be keley Deepd i e Da ase . En la sección 11 se han
analizado los esul ados ob enidos du an e los een enamien os de las dis in as edes.
A pa i de ellos deducimos que al amplia el conjun o de da os inicial con una mayo
a iedad de cajas delimi ado as di icul a el ap endizaje de la ed, lo cual podemos e
e lejado en una unción de pé dida más ines able y que dec ece más len amen e.
En cuan o a los esul ados inales ealizados sob e el conjun o de alidación, deducimos
que no se consigue un mejo endimien o aumen ando el conjun o de en enamien o, ya
que odas las edes han is o educido no ablemen e su p ecisión. En pa icula , si se
quie e aumen a el conjun o de en enamien o, es e aumen o debe se con imágenes muy
simila es a las del conjun o de es .
En es e caso, los conjun os de da os omados son imágenes omadas desde un ehículo,
odas de día y en condiciones a o ables. Sin emba go, hay dispa idades impo an es en-
e los conjun os de da os. KITTI es un conjun o de imágenes pano ámicas, po an o el
ancho es 4 eces el al o de la imagen. Es a di e encia es c ucial a la ho a de edimensiona
imágenes como se hace en las edes SSD Incep ion V2 y SSD Mobile Li e en las que se
edimensiona a unas dimensiones ijas de 300x300, con la consecuencia de que los obje os
con poca anchu a inicial pueden llega a se impe cep ibles.
Po o o lado, Be keley Deepd i e Da ase cuen a con obje os con una supe icie más
educida que en el KITTI. Es o se debe a que las imágenes de es e conjun o e ique an
odos los obje os isibles en la imagen, incluso algunos an en el ondo de la imagen
que su supe icie es meno a 20 píxeles. Po an o, en las edes donde se p oduce un
edimensionamien o, se educen las dimensiones de las imágenes, p o ocando que es os
obje os pasan a ene una supe icie mínima. De es a mane a es muy complicado que
los de ec o es de obje os puedan iden i ica los en la imagen. Además el amaño de los
ancho s no ha sido modi icado pa a adap a lo a las peculia idades del conjun o de da os,
siendo una di icul ad más añadida.
En cuan o al segundo obje i o, en la secciones 12 y 13 se han compa ado la p ecisión,
consumo y elocidad de in e encia de las edes sob e ambos conjun os de da os y sob e
es disposi i os en el caso de las edes SSD Incep ion V2, SSD Mobile Li e y Fas e
R-CNN:
CPU
85

GPU in eg ada de bajo consumo
My iad
y en el caso de las edes YOLO 3 y YOLO 3 Tiny sob e una GPU de al o endimien o.
Los esul ados de e minan que las mejo es edes pa a log a el obje i o de la conducción
au ónoma eniendo en cuen a la p ecisión son YOLO 3 y YOLO 3 Tiny. Ambas edes
o ecen una p ecisión po clase no ablemen e supe io al es o de edes es udiadas. O o
aspec o i al en el con ex o de la conducción au ónoma es la elocidad de in e encia,
en ese caso YOLO 3 Tiny es has a cinco eces mas ápida que YOLO 3. No se han
podido ejecu a és as edes en los mismos disposi i os que el es o. Sin emba go, como
podemos ap ecia en la g á ica compa a i a 13.5, e aluando el in e cambio elocidad de
p ocesamien o-consumo medido sob e dos a qui ec u as simila es, en es e caso ambas
GPUs, podemos e cómo igualmen e siguen siendo más p ome edo as que el es o de
edes.
Además de la elocidad de in e encia, la au onomía del ehículo es c ucial en la con-
ducción au ónoma y, po an o, el consumo de los dis in os disposi i os e aluados. En
la sección 13.3 se ha analizado el consumo de los disposi i os y los modelos ejecu ados
bajo los mismos. Pa a pode e alua conjun amen e el endimien o de un modelo y la
e iciencia del disposi i o ha dwa e sob e el que se ha ejecu ado, se ha de inido la mé i-
ca FPS/W que elaciona elocidad de in e encia con consumo. El esul ado es que los
modelos que ienen una a qui ec u a de una ase, es deci , las edes SSD y YOLO, son
mas e icien es en é minos de elocidad/consumo. Es a conclusión es na u al eniendo en
cuen a la baja elocidad de in e encia de Fas e R-CNN en compa ación con el es o.
Cen ándonos en los disposi i os ha dwa e, hay uno que esal a po encima del es o, y
és e es My iad. És e disposi i o diseñado pa a ealiza in e encia de edes neu onales de
mane a óp ima o ece un consumo mínimo, en conc e o de 1W, y po an o es el disposi-
i o mas e icien e en é minos de elocidad/consumo. Es no able cómo a pesa de su bajo
consumo, llega a ealiza in e encia en iempo eal las edes SSD Incep ion V2 y SSD
Mobile Li e. La GPU in eg ada con p ecisión FP16 o ece unas elocidades de in e encia
acep ables bajo un consumo de 15W, siendo po an o la GPU de al o endimien o y
la CPU los disposi i os menos e icien es, po su consumo ele ado, especialmen e en el
p ime caso; y po no es a especializada en es as a eas en el caso de la CPU.
Como conclusión inal, después del es udio y compa aciones ealizadas, la a qui ec u a o
modelo de de ección de obje os de en e odas las analizadas en el es ado del a e es, sin
duda, YOLO 3 Tiny, o eciendo una elocidad de in e encia muy no able y supe ando
en p ecisión al es o, llegando a alcanza sin p oblemas el p ocesamien o en iempo eal.
86
14.1. Fu u os pasos
Es e p oyec o es á basado en un campo de in es igación que es á en pleno lo ecimien o.
Debido a es o, hay muchas posibles ideas a p oba con el obje i o de con inua es a in-
es igación.
Una opción es abaja con conjun os de da os mas mode nos que con engan imágenes en
3D, además de in o mación de senso es como LIDAR en e o os. Es a in o mación puede
mejo a eno memen e la p ecisión log ada con imágenes en 2D, aunque p obablemen e
enga una elocidad de in e encia meno . Es udia como equilib a cuan a in o mación
inco po a al modelo de o ma que no sea pe judicial en é minos de elocidad de in e-
encia y consumo es una posible línea de in es igación.
O a opción es abaja con edes mas mode nas, como puede se YOLOV4 [8] publicada
en es e año. Es as edes son el es ado del a e en es e campo, y po an o conoce a ondo
su uncionamien o e in es iga como pode inco po a las o c ea e siones educidas es
o a posible línea de in es igación.
Finalmen e, o a posible línea de in es igación se ía la de usa un mayo núme o de
disposi i os My iad pa a ealiza in e encia en pa alelo, con la inalidad de mejo a la
elocidad de in e encia con espec o a un solo My iad al meno cos e posible, es deci ,
con o o My iad.
87
CLOSURE
This p ojec had wo main objec i es which we e se a he beginning o he epo . The
aim was o answe he ollowing wo ques ions:
Fine- uning o a gene alis ne wo k in o de o lea n how o iden i y ehicles, pe-
des ians and cyclis s.
Pe omance analysis o he in e ence in e ms o p ecision, in e ence speed and
powe consump ion o he ine- uned ne wo k o e a se o ha dwa e de ices.
To add ess he i s ques ion we ocused on he s udy o di e en so wa e solu ions ha
allowed us o p ocess he images in eal ime, using well known amewo ks in he ield o
objec de ec ion as Da kne , Open ino and Tenso low. These amewo ks ha e allowed
us o ine- une gene alis neu al ne wo ks o lea n how o iden i y ehicles, pedes ians
and cyclis s. In pa icula , we ha e wo ked wi h he ollowing ne wo ks:
1. SSD Incep ion V2
2. SSD Mobile Li e
3. Fas e R-CNN
4. YOLO 3
5. YOLO 3 Tiny
The ine- uning has been done on he KITTI da ase and ano he da ase consis ing o
he ex ension o he KITTI da ase wi h some images om he Tshingua-Daimle and
Be keley Deepd i e Da ase se s. In sec ion 11 we ha e analysed he esul s ob ained
du ing he ine- uning o he di e en ne wo ks, om which we deduce ha ex ending
he ini ial da ase wi h a highe a ie y o bounding boxes makes i di icul o lea n he
ne wo k, which can be seen in a mo e uns able and slowly dec easing loss unc ion.
As o he inal esul s o e he alida ion se , we deduce ha a be e pe o mance is no
achie ed by inc easing he aining se , since all he ne wo ks ha e seen hei accu acy
educed signi ican ly. In pa icula , i he aining se is o be inc eased, his inc ease
mus be wi h images e y simila o hose o he es se .
In his case, he da ase s consis o images aken om a ehicle, all du ing he day and
unde a ou able condi ions. Howe e , he e a e signi ican dispa i ies be ween he da a
se s. KITTI is a se o pano amic images, he e o e he wid h is 4 imes he heigh o he
image. This di e ence is c ucial when esizing images as is done in he SSD Incep ion V2
and SSD Mobile Li e ne wo ks whe e he image is esized o a ixed dimension o 300x300,
wi h he consequence ha objec s wi h a small ini ial wid h can become impe cep ible.
88
On he o he hand, Be keley Deepd i e Da ase has objec s wi h a smalle su ace a ea
han in he KITTI. This is due o he ac ha he labels in his se consis o all he
objec s isible in he image, e en some so a back in he image ha hei su ace a ea is
less han 20 pixels. The e o e, in ne wo ks whe e esizing occu s, he dimensions o he
images a e educed, causing hese objec s o ha e a minimum su ace a ea. This makes
i e y di icul o objec de ec o s o iden i y hem in he image. Mo eo e , he size o
he ancho s has no been modi ied o adap i o he peculia i ies o he da a se , being
an addi ional di icul y.
As o he second objec i e, in he sec ions ?? and ?? we ha e compa ed he accu acy,
consump ion and in e ence speed o he ne wo ks on bo h da ase s and on h ee de ices
in he case o he SSD Incep ion V2, SSD Mobile Li e and Fas e R-CNN ne wo ks:
CPU
In eg a ed low-powe GPU
My iad
and in he case o YOLO 3 and YOLO 3 Tiny ne wo ks on a high pe o mance GPU.
The esul s de e mine ha he bes ne wo ks o achie e he goal o au onomous d i ing
wi h ega d o accu acy a e YOLO 3 and YOLO 3 Tiny. Bo h ne wo ks o e signi i-
can ly be e accu acy pe class han he o he ne wo ks s udied. Ano he i al aspec in
he con ex o au onomous d i ing is he in e ence speed. In his case YOLO 3 Tiny is
up o i e imes as e han YOLO 3. These ne wo ks ha e no been able o un on he
same de ices as he es . Howe e , as we can see in he compa a i e g aph ??, e alua ing
he exchange o p ocessing-consump ion speed measu ed on wo simila a chi ec u es, in
his case bo h GPUs, we can see how hey con inue o be mo e p omising han he es
o he ne wo ks.
In addi ion o he in e ence speed, he ehicle au onomy is c ucial in au onomous d i ing
and, he e o e, he consump ion o he di e en de ices e alua ed. The consump ion o
he de ices and he models execu ed unde hem ha e been analysed in he sec ion çon-
sump ion". In o de o join ly e alua e he pe o mance o a model and he e iciency o
he ha dwa e de ice on which i has been execu ed, he FPS/W me ic has been de ined,
which ela es in e ence speed wi h consump ion. The esul is ha models ha ha e a
one phase a chi ec u e, i.e. SSD and YOLO ne wo ks, a e mo e e icien in e ms o spee-
d/consump ion. This conclusion is na u al conside ing he low in e ence speed o Fas e
R-CNN compa ed o he es .
Focusing on he ha dwa e de ices, he e is one ha s ands ou om he es , and ha
is My iad. This de ice designed o pe o m neu al ne wo k in e ence in an op imal way
o e s a minimum consump ion, speci ically 1W, and he e o e is he mos e icien de ice
89