scieee Open visual document viewer

Evaluación de algoritmos de machine learning para conducción

Simón Rodríguez, Alejandro; Ruz Gómez, Rafael

Abstract

El principal objetivo de este proyecto de investigación y desarrollo es el análisis e implementación de arquitecturas deep learning para la detección en tiempo real de peatones, ciclistas y vehículos en el ámbito de la conducción autónoma. El vertiginoso crecimiento de la capacidad de procesamiento ha provocado el surgimiento de nuevas ramas de investigación tecnológica, entre ellas la de la Inteligencia Artificial (IA). En particular, dentro de la IA podemos destacar la aparición de las redes neuronales profundas como técnica para abordar problemas relacionados con la percepción visual, como puede ser la clasificación de objetos o la detección de objetos. Uno de los campos donde la IA que está teniendo una mayor influencia es la creación de sistemas avanzados de asistencia para la conducción (ADAS). Estos sistemas de conducción se apoyan en una amplia variedad de cámaras y sensores que proporcionan toda la información necesaria para tomar decisiones con precisión y seguridad. Un sistema ADAS está compuesto por distintos módulos. Uno de ellos se encarga de la detección en tiempo real de objetos. En este proyecto nos centramos en la detección en tiempo real de vehículos, ciclistas y peatones, aunque podrían incluirse líneas de carretera y señales de tráfico, entre otros objetos. Para conseguir dicho objetivo dividiremos en dos partes diferenciadas el trabajo: -Reentrenamiento de una red generalista para aprender a identificar vehículos, peatones y ciclistas. -Estudio del rendimiento de la inferencia realizada por la red reentrenada en términos de precisión, velocidad de inferencia y consumo sobre un conjunto de dispositivos hardware.

Full text

Uni e sidad Complu ense de Mad id/Uni e sidad de G anada (SICUE) Facul ad de In o má ica TRABAJO DE FIN DE GRADO EVALUACIÓN DE ALGORITMOS DE MACHINE LEARNING PARA CONDUCCIÓN MACHINE LEARNING ALGORITHM EVALUATION ON ADVANCED DRIVER ASSISTANCE Alumnos Alejand o Simón Rod íguez Ra ael Ruz Gómez Di ec o es Ca los Ga cía Sánchez Guille mo Bo ella Juan Doble G ado Ingenie ía In o má ica y Ma emá icas 2019/2020 1 Índice 1 In oducción y mo i ación 8 2 His o ia 9 3 Con ibución de cada es udian e 12 3.1 Con ibución de Alejand o . . . . . . . . . . . . . . . . . . . . . . . . . . . 12 3.2 Con ibución de Ra ael . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13 4 Es ado del a e 14 4.1 In oducción a la Visión po Compu ado . . . . . . . . . . . . . . . . . . 14 4.1.1 P oblemas den o de la Visión po Compu ado . . . . . . . . . . . 15 4.2 DeepLea ning ................................. 16 4.2.1 Redes Con olucionales . . . . . . . . . . . . . . . . . . . . . . . . . 18 4.2.2 T ans e Lea ning . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 5 A qui ec u as de De ección de Obje os 22 5.1 A qui ec u as de dos ases . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 5.2 A qui ec u as de una ase . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 5.2.1 Single Sho De ec o o SSD . . . . . . . . . . . . . . . . . . . . . . 28 5.2.2 YOLO.................................. 32 6 P esen ación de conjun os de da os u ilizados 38 6.1 KITTI...................................... 40 6.2 Tshingua-Daimle ................................ 42 6.3 Be keley Deepd i e Da ase . . . . . . . . . . . . . . . . . . . . . . . . . . 42 6.4 Conjun os de da os c eados . . . . . . . . . . . . . . . . . . . . . . . . . . 45 7 Disposi i os ha dwa e u ilizados 45 7.1 CPU In el R Xeon R E3-1225 3 ....................... 46 7.2 GPUGEFORCEGTX980 .......................... 46 7.3 GPU UHD In el R 620............................. 46 7.4 In el R Neu al Compu e S ick 2 . . . . . . . . . . . . . . . . . . . . . . . . 47 8 Medidas de p ecisión en la de ección de obje os 47 8.1 P ecisiónyRecall................................ 47 8.2 IOU ....................................... 48 8.3 APymAP ................................... 49 9 F amewo ks 50 9.1 Tenso low.................................... 50 9.1.1 Objec De ec ion API . . . . . . . . . . . . . . . . . . . . . . . . . 50 9.1.2 Tenso boa d............................... 52 2 9.2 Open ino oolki ................................ 53 9.2.1 Ca ac e ís icas p incipales . . . . . . . . . . . . . . . . . . . . . . . 53 9.3 Da kne ..................................... 54 9.4 Módulos..................................... 54 10 Expe imen os ealizados 55 10.1Ancho Boxes.................................. 56 10.2Da aaugmen a ion............................... 58 10.3 Ha d Nega i e Mining . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59 11 Resul ados del Reen enamien o 60 11.1 Resul ados de la ed SSD Incep ion V2 . . . . . . . . . . . . . . . . . . . . 60 11.1.1 Resul ados SSD Incep ion V2 sob e KITTI . . . . . . . . . . . . . 60 11.1.2 Resul ados SSD Incep ion V2 sob e el da ase comple o . . . . . . 61 11.1.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 62 11.2 Resul ados de la ed Fas e R-CNN . . . . . . . . . . . . . . . . . . . . . . 64 11.2.1 Resul ados Fas e R-CNN sob e KITTI . . . . . . . . . . . . . . . 64 11.2.2 Resul ados Fas e R-CNN sob e el da ase comple o . . . . . . . . 65 11.2.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 66 11.3 Resul ados de la ed SSD Mobile Li e . . . . . . . . . . . . . . . . . . . . . 68 11.3.1 Resul ados SSD Mobile Li e sob e KITTI . . . . . . . . . . . . . . 68 11.3.2 Resul ados SSD Mobile Li e sob e el da ase comple o . . . . . . . 69 11.3.3 Compa ación de esul ados . . . . . . . . . . . . . . . . . . . . . . 70 11.4 Resul ados de la ed YOLO 3 . . . . . . . . . . . . . . . . . . . . . . . . . 72 11.4.1 Resul ados YOLO 3 sob e KITTI . . . . . . . . . . . . . . . . . . 73 11.4.2 Resul ados YOLO 3 sob e el da ase comple o . . . . . . . . . . . 73 11.5 Resul ados de la ed YOLO 3 iny . . . . . . . . . . . . . . . . . . . . . . 74 11.5.1 Resul ados YOLO 3 iny sob e KITTI . . . . . . . . . . . . . . . . 74 11.5.2 Resul ados YOLO 3 iny sob e el da ase comple o . . . . . . . . . 75 12 Resul ado de In e encia 75 12.1 In e encia de SSD Incep ion V2 en Open ino . . . . . . . . . . . . . . . . 76 12.2 In e encia de SSD Mobile Li e en Open ino . . . . . . . . . . . . . . . . . 77 12.3 In e encia de Fas e R-CNN en Open ino . . . . . . . . . . . . . . . . . . 78 12.4 In e encia YOLO 3 en Da kne . . . . . . . . . . . . . . . . . . . . . . . . 79 12.5 In e encia YOLO 3 Tiny en Da kne . . . . . . . . . . . . . . . . . . . . . 79 13 Compa ación 80 13.1MAP....................................... 80 13.2 Velocidad de in e encia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81 13.3 In e cambio elocidad-consumo . . . . . . . . . . . . . . . . . . . . . . . . 82 14 Conclusiones 84 14.1Fu u ospasos.................................. 87 3 14.2Fu u es eps................................... 90 4 Índice de ablas 12.1 In e encia del modelo SSD Incep ion V2 usando el amewo k Open ino . 76 12.2 In e encia del modelo SSD Mobile Li e usando el amewo k Open ino . . 77 12.3 In e encia del modelo Fas e R-CNN usando el amewo k Open ino . . . 78 12.4 In e encia del modelo YOLO 3 ejecu ado en la GPU de al o endimien o usando el amewo k Da kne . . . . . . . . . . . . . . . . . . . . . . . . . 79 12.5 In e encia del modelo YOLO 3 Tiny ejecu ado en la GPU de al o endi- mien o usando el amewo k Da kne . . . . . . . . . . . . . . . . . . . . . 79 5 PALABRAS CLAVE: Visión po o denado , conducción au ónoma, ed neu onal con olucional, de- ección de obje os, ap endizaje p o undo, ap endizaje au omá ico, My iad, Tenso low, Open ino, Da kne . RESUMEN El p incipal obje i o de es e p oyec o de in es igación y desa ollo es el análisis e imple- men ación de a qui ec u as deep lea ning pa a la de ección en iempo eal de pea ones, ciclis as y ehículos en el ámbi o de la conducción au ónoma. El e iginoso c ecimien o de la capacidad de p ocesamien o ha p o ocado el su gimien o de nue as amas de in es igación ecnológica, en e ellas la de la In eligencia A i icial (IA). En pa icula , den o de la IA podemos des aca la apa ición de las edes neu onales p o undas como écnica pa a abo da p oblemas elacionados con la pe cepción isual, como puede se la clasi icación de obje os o la de ección de obje os. Uno de los campos donde la IA que es á eniendo una mayo in luencia es la c eación de sis emas a anzados de asis encia pa a la conducción (ADAS). Es os sis emas de conduc- ción se apoyan en una amplia a iedad de cáma as y senso es que p opo cionan oda la in o mación necesa ia pa a oma decisiones con p ecisión y segu idad. Un sis ema ADAS es á compues o po dis in os módulos. Uno de ellos se enca ga de la de ección en iempo eal de obje os. En es e p oyec o nos cen amos en la de ección en iempo eal de ehículos, ciclis as y pea ones, aunque pod ían inclui se líneas de ca e e a y señales de á ico, en e o os obje os. Pa a consegui dicho obje i o di idi emos en dos pa es di e enciadas el abajo: Reen enamien o de una ed gene alis a pa a ap ende a iden i ica ehículos, pea- ones y ciclis as. Es udio del endimien o de la in e encia ealizada po la ed een enada en é mi- nos de p ecisión, elocidad de in e encia y consumo sob e un conjun o de disposi- i os ha dwa e. 6 KEYWORDS: Compu e ision, au onomous d i ing, con olu ional neu onal ne wo k, ob- jec de ec ion, deep lea ning, machine lea ning, My iad, Tenso low, Open- ino, Da kne . ABSTRACT The main aim o his esea ch and de elopmen p ojec is he analysis and implemen a- ion o deep lea ning’s a chi ec u es o eal- ime objec de ec ion o pedes ians, cyclis s and ca s on he scope o au onomous d i ing. The b eakneck g ow h o he compu ing capaci y has caused he eme gence o new ech- nological esea ch ields such as A i icial In elligence (AI). Especi ically, we can highligh he unco e ing o deep neu al ne wo ks as a echnique o app oach challenges ela ed o isual pe cep ion, o example objec classi ica ion o objec de ec ion. One o he a eas whe e he a i icial in elligence is ha ing a g ea in luence is on he c ea ion o ad anced d i e -assis ance sys ems (ADAS). These sys ems ake ad an age o cu ing-edge came as and senso s ha eed he sys ems wi h all he necessa y in o ma ion o ake decisions wi h accu acy and secu i y. An ad anced d i e -assis ance sys em is made o se e al modules. One o hem pe o m objec de ec ion in eal- ime. The main ocus o his p ojec is eal- ime de ec ion o pedes ians, cyclis s and ca s. To achie e his objec i e, we will di ide he wo k in o wo pa s: Fine- uning o a gene alis ne wo k o lea n how o iden i y pedes ians, cyclis s and ca s. Pe omance analysis in e ms o e iciency, speed and powe consump ion du ing he in e ence pe o med by he ine- uned ne wo k o e a se o ha dwa e de ices. 7 1. In oducción y mo i ación El desa ollo de sis emas a anzados de asis encia al conduc o (ADAS) es una ealidad a día de hoy y no un sueño u u is a. Ac ualmen e es una ecnología cuyo desa ollo se ha di ido en ases con el obje i o de i cumpliendo obje i os p og esi amen e en p o de log a un sis ema de conducción comple amen e au ónomo. La Sociedad de Ingenie os de Au omoción [53] es ablece una di e enciación en cuan o al ni el de au onomía en la conducción en la que se dis inguen seis ca ego ías o ni eles: Ni el 0: Ninguna au oma ización, el conduc o debe ealiza odas las a eas ela- i as a la conducción. Ni el 1: Asis encia en la conducción, se cuen a con algún sis ema au oma izado, como po ejemplo pa a con ola el mo imien o la e al o longi udinal, pe o no ambos a la ez, y no se dispone de sis emas pa a esponde an e obje os. Debiendo ealiza el es o de las a eas el conduc o . Ni el 2: Au oma ización pa cial, apa ecen sis emas pa a an o el con ol la e al como longi udinal, eximiendo al conduc o de con ola el mo imien o, pe o no del es o de a eas como la de ección de obje os y espues a an e ellos. Ni el 3: Au oma ización condicional, se con ola au omá icamen e an o el mo i- mien o como se moni o iza el en o no, pe o se equie e al conduc o disponible en segundos po si ocu ie a algún allo, sal ando una ale a. Ni el 4: Au oma ización ele ada, se iene un sis ema au ónomo, en casi cualquie si uación, con olando el mo imien o, de ec ando obje os y ac uando an e allos, eniendo que oma el con ol el conduc o en a a ocasión. Ni el 5: Au oma ización comple a, se cuen a con sis emas au ónomos an e cualquie si uación, y el conduc o nunca es á obligado a oma con ol manualmen e si no lo desea. Ac ualmen e, nos encon amos a medio camino en e el e ce y el cua o ni el. Se e- quie e de una ecnología mas a anzada con o me aumen an los ni eles, siendo ecnologías imp escindibles la senso ización, el p ocesado de las señales de es os y la oma de deci- siones basándose en la in o mación de los senso es p ocesada. Una pa e de es e abajo se enma ca á en apo a soluciones den o de una de es as a eas, la de ección de obje os con écnicas de In eligencia A i icial. O o aspec o a ene en cuen a pa a el despliegue de la conducción au ónoma es la ene gía que deben consumi odos los sis emas de de ección, p ocesamien o y oma de decisiones en unción de la in o mación ecabada. Po ello, o a pa e de es e p oyec o se dedica á a analiza la e iciencia ene gé ica de los sis emas u ilizados. Podemos esumi la mo i ación de es e abajo en dos cues iones abie as: 8 ¿Cómo p ocesa oda la in o mación ecabada po el ehículo de o ma que pe mi a oma decisiones en iempo eal? ¿Cómo c ea un Sis ema de Con ol Au ónomo óp imo en é minos de e iciencia ene gé ica? Ambas cues iones son de i al impo ancia pa a el desa ollo de la ecnología necesa ia pa a el coche au ónomo. Pa a esponde a la p ime a cues ión nos apoya emos en el á ea de la isión po compu ado , donde los mayo es éxi os en cuan o a endimien o han llegado con el c ecimien o exponencial de las edes neu onales p o undas, en conc e o, con la e olución de las edes neu onales con olucionales. Es as edes han demos ado bajas asas de e o y una meno necesidad de ecu sos compu acionales que sus p edeceso as, las edes neu onales comple amen e conec adas ( ully-connec ed). Po o o lado, es un e o mayúsculo el c ea un sis ema de conducción au ónoma e icien e en consumo. Es e desa ío podemos di idi lo en dos subp oblemas: Es udia el so wa e que sea capaz de p ocesa las imágenes en iempo eal y cumpla las es icciones de ene gía necesa ias. Es udia el ha dwa e más adecuado pa a dicho so wa e en búsqueda de la e iciencia ene gé ica. El p ocesamien o de imágenes ha sido es udiado ampliamen e, y se ha demos ado que lo más óp imo es hace uso de a ios núcleos en luga de unos pocos, como suele ocu i en CPUs es ánda . En es e abajo a a emos el uso de GPU y My iad, es e úl imo consis e en ha dwa e especí ico pa a o ece ecu sos o ien ados a implemen a edes neu onales, desa ollado po In el. Po úl imo es á el desa ío de o ques a odo es e so wa e y ha dwa e. Pa a el desa o- llo de es e p oyec o se han u ilizado los da ase s KITTI, Tshingua-Daimle y Be kely Deepd i e. Es os conjun os son p esen ados mas de alladamen e en la sección 6. La de- ección de obje os se ha ealizado usando es ipos de edes: SSD, Fas e y YOLO, que se p esen a án en la sección 5. El een enamien o de las edes se ha ealizado usando el amewo k Tenso low, del cual amplia emos más in o mación en las sección 9. La e aluación de las edes se ha ealiza- do ap o echando el conjun o de he amien as desa olladas po In el, en el amewo k OpenVINO, el cual pe mi e la ejecución en disposi i os especí icos de in e encia de e- des neu onales p o undas, como My iad. En la sección 9 se expond án los disposi i os u ilizados. 2. His o ia T as el nacimien o de los coches mo o izados lle o poco iempo a los in en o es de la época comenza a pensa en los ehículos au ónomos. En 1925, el in en o F ancis Houdina [20] demos ó como un coche con olado median e ondas de adio conducía po las calles de 9 Figu a 4.1: Desa íos en la Visión po Compu ado . Fuen e: [11] En pa icula , noso os nos amos a cen a en el econocimien o de obje os, es deci , iden i ica que obje o hay en la imagen y dónde se encuen a. Al es a cen ados en la conducción au ónoma, los obje os a econoce y si ua se án: pea ones, ciclis as y ehículos. 4.2. Deep Lea ning Deep Lea ning [23] es una ama den o del ap endizaje au omá ico cuya me a es ap en- de ca ac e ís icas de al o ni el a pa i de un conjun o de da os usando a qui ec u as je á quicas. Es e en oque pe mi e a los modelos compu acionales basados en múl iples capas, ap ende y ex ae in o mación imi ando como el ce eb o pe cibe y asimila la in o mación, pe mi iendo cap u a pa ones subyacen es en conjun os de da os a g an escala. El su gimien o del in e és po es a ecnología se ha p oducido debido a que ha supe ado ampliamen e el endimien o de las écnicas pun e as p e ias en muchas á eas de in e és de la in eligencia a i icial, como pueden se p ocesamien o del lenguaje na u al [58], i- sión po compu ado [15, 1], ans e lea ning [14, 28] y muchas más. La ambición de c ea un modelo que simula a el ce eb o humano p o ocó el inicio del desa ollo de las edes neu onales. En 1943, McCulloch and Pi s [39] in en a on com- p ende como el ce eb o podía p oduci pa ones de al a complejidad usando células básicas in e conec adas, llamadas neu onas. El modelo de una neu ona de McCulloh y Pi s, llamado el modelo MCP, ue una con ibución i al al desa ollo de las edes 16 neu onales a i iciales. En la siguien e abla [6] se mues an cuales han sido las mayo es con ibuciones a es e campo que han con ibuido a llega a la e a ac ual del deep lea ning: Figu a 4.2: Hi os más impo an es en la his o ia de las edes neu onales y el ap endizaje au omá ico, que han conducido a la e a del deep lea ning. Fuen e: [24] El nacimien o de la e a del deep lea ning se p odujo con la dis up i a con ibución de Hil on [21] en el año 2006, cuando in odujo la Deep Belie Ne wo k. Es a ed ue la p in- cipal causan e del desa ollo exponencial de la úl ima década en cuan o a a qui ec u as p o undas y algo i mos de deep lea ning. Sin emba go, las edes neu onales exis en desde ha mediados del siglo XX. Una p egun a na u al que su ge es po qué las edes neu onales p o undas han comenzado a ene un in e és masi o ecien emen e. Hay muchos ac o es que con ibuyen al ascenso me eó ico de la popula idad de las edes neu onales p o undas, algunos de ellos son: Apa ición de da ase s de en enamien o masi os con e ique as de al a calidad. A ances en las capacidades de compu ación pa alela e implemen aciones mul i-co e y mul i- h ead. Aumen o de la capacidad de p ocesamien o, especialmen e debido al uso de GPUs, así como, la disminución del cos e del ha dwa e de compu ación. Su gimien o de nume osas pla a o mas de so wa e como Tenso low [36], PyTo ch [2], Ca e [65], Chaine [52], e c, que pe mi en una in eg ación sencilla y a al o ni el de di e sas a qui ec u as en un amewo k de compu ación de GPU, sin la necesidad de en a en de alles de bajo ni el. In oducción de nue as écnicas de egula ización que ayudan a e i a el o e i - ing y mejo an el endimien o con o me se escala . Algunas de es as écnicas son: d opou , da a augmen a ion, ea ly s opping e c. A ances en la op imización de los algo i mos de ap endizaje au omá ico que son capaces de p oduci soluciones muy ce canas a las óp imas. 17 4.2.1. Redes Con olucionales Los a ances en isión po compu ado con la llegada del deep lea ning han sido desa- ollados y pe eccionados con el iempo g acias a un algo i mo en pa icula : las Redes Neu onales Con olucionales [67]. Figu a 4.3: A qui ec u a Gene al de Redes Neu onales Con olucionales. Fuen e: [12] Una Red Neu onal Con olucional(CNN) es un algo i mo de Deep Lea ning que oma una imagen de en ada, asigna impo ancia (conjun o de pesos ap endidos) a los aspec os/- ca ac e ís icas de la imagen y es capaz de di e encia unos de o os. Mien as que an es de la llegada de es as edes se aplicaban il os diseñados a mano pa a de ec a los as- pec os ele an es de una imagen, con su icien e en enamien o, las CNN han conseguido ap ende esas ca ac e ís icas eseñables de las imágenes. La a qui ec u a de una CNN in en a eplica los pa ones de conec i idad de las neu o- nas del ce eb o humano y es á inspi ada en la o ganización del có ex isual [34]. Es a a qui ec u a pe mi e ealiza un balance en e una al a capacidad de ap endizaje de las ca ac e ís icas ele an es de la imagen y la escalabilidad de la ed sob e da ase s masi os [68]. Con el in de cumpli con esas expec a i as, la CNN ealiza una educción de las imá- genes a una o ma mucho mas sencilla de p ocesa , sin pe de las ca ac e ís icas c í icas necesa ias pa a ealiza una buena p edicción. Pa a ello se basa en la sucesi a aplicación de dos capas: la capa de Con olución y la capa de Pooling. La capa de con olución se basa en la ope ación de con olución sob e la imagen. El obje i o de es a ope ación es ex ae las ca ac e ís icas de al o ni el de la imagen de en ada. El é mino con olución en ma emá icas hace e e encia a la combinación de dos unciones pa a p oduci una e ce a unción. En el caso de una CNN, la con olución se ealiza sob e una imagen de en ada usando un il o( ambién llamado ke nel) que p oduce un mapa de ca ac e ís icas. Más especí icamen e, la con olución es ejecu ada deslizando el il o sob e la imagen de en ada. En cada localización, la mul iplicación ma icial se ealiza y la suma del esul ado se gua da en el mapa de ca ac e ís icas. La siguien e imagen e leja es a ope ación: 18 Figu a 4.4: El il o se desliza sob e la en ada y la ope ación iene un esul ado que se almacena en la nue a capa. Fuen e [13] Una CNN necesi a no es a limi ada en el núme o de capas con olucionales, así que, se suelen aplica sucesi amen e. T adicionalmen e, la p ime a capa con olucional es espon- sable de cap u a ca ac e ís icas de bajo ni el como los bo des, el colo , la o ien ación del g adien e, e c. Con o me se añaden capas, la a qui ec u a se adap a a las ca ac e ís icas de al o ni el, p opo cionando a la ed una comp ensión o al de las imágenes del da ase . La capa Pooling se enca ga de educi el amaño espacial de las ca ac e ís icas con olu- cionadas. El obje i o es educi el cos e compu acional eque ido pa a p ocesa los da os educiendo la dimensionalidad de es os. Además, pe mi e ex ae las ca ac e ís icas do- minan es que son in a ian es en e a o aciones y cambios de posición, man eniendo la e ec i idad del modelo du an e el en enamien o. Se dis inguen dos ipos de capas pooling: Max Pooling y A e age Pooling. Max Pooling de uel e el máximo alo de la po ción de imagen analizada, mien as que po o o lado, A e age Pooling de uel e la media de odos los alo es de la po ción de imagen analizada. En gene al, Max Pooling o ece un mejo endimien o. La siguien e imagen ilus a la ope ación max pooling desc i a: 19 Figu a 4.5: Max pooling oma los alo es más g andes. Fuen e [13] La capa Con olucional y la capa Pooling, o man jun as la capa i-ésima de una CNN. Dependiendo de la complejidad de la imagen, el núme o de capas puede aumen a pa a cap u a incluso mas de alles a bajo ni el, pe o con un inc emen o del cos e compu acio- nal. Figu a 4.6: Capa Fully-Connec ed y Red Neu onal Feed-Fo wa d. Fuen e [12] T as la sucesi a aplicación de es as capas, el modelo es capaz de econoce las p incipales ca ac e ís icas. La salida de es e p oceso suele se la en ada de una capa Fully-Connec ed. Es a capa pe mi e ap ende las elaciones no-lineales en e las ca ac e ís icas cap u adas po las capas an e io es. 20 Finalmen e, la salida la capa Fully-Connec ed pe mi e alimen a a una ed neu onal Feed-Fo wa d. Es a ed neu onal, median e los sucesi os en enamien os ap ende á a dis ingui en e las ca ac e ís icas dominan es y las ca ac e ís icas a bajo ni el de las imágenes, pe mi iéndole clasi ica las imágenes en la ca ego ía co espondien e. Finalmen e menciona que aunque en es e abajo se ha que ido ealiza un b e e in o- ducción de las CNN, exis en nume osas a qui ec u as de CNN disponibles, cada una con sus ca ac e ís icas especi icas y sus en ajas pa a de e minados p oblemas. Algunas de las más conocidas son: LeNe [66] AlexNe [1] GoogLeNe [9] ResNe [30] 4.2.2. T ans e Lea ning T ans e Lea ning es una écnica que pe mi e abo da dos de los p incipales p oblemas del deep lea ning: Al a in e sión en iempo de een enamien o de edes neu onales debido a conjun os de da os con can idades de da os masi as. Eno me gas o de ecu sos compu acionales pa a el een enamien o de edes. Es e mé odo basado en la u ilización del conocimien o ap endido po un modelo as se en enado sob e un da ase con el in de educi el iempo de een enamien o [51]. La idea es een ena el modelo sob e un nue o da ase pa iendo del conocimien o adqui- ido po el modelo sob e el da ase an e io , con el obje i o de acele a el p oceso de een enamien o. A menudo, la ans e encia del ap endizaje se p oduce de un modelo mas complejo hacia un modelo mas sencillo. En nues o caso, las edes es án en enadas sob e el da ase gene alis a COCO [33]. Es e conjun o de da os es a en ocado en la de- ección y localización de 90 ipos de obje os, y usamos ans e lea ning, pa a acele a el een enamien o sob e los conjun os de da os de conducción au ónoma usados en es e p oyec o. En la siguien e imagen ilus amos como se p oduce es e p oceso de ans e encia de conocimien o desde un modelo mas complejo hacia un modelo mas sencillo: 21 Figu a 4.7: T ans e Lea ning. Fuen e [62] En el con ex o de las CNN, ans e lea ning se implemen a omando los pa áme os de la capa de cap ación de ca ac e ís icas pa a inicializa la capa de cap ación de ca ac e ís- icas sob e el nue o da ase . En conc e o, se suelen coge los pa áme os de las capas que se enca gan de cap a las ca ac e ís icas de bajo ni el como los bo des, ex u as, esquinas y o mas; pues es ás son ca ac e ís icas p esen es en odos los conjun os de da os. En el campo de la de ección de obje os, se equie e aun mas p ocesamien o po pa e de las capas as la ex acción de ca ac e ís icas, pues se sigue de un clasi icado , ya que la de ección de obje os debe p edeci no solo la clase del obje o, sino su localización ambién. Es o implica que el een enaminen o de es as edes sea muy cos oso en iempo y capacidad de cómpu o. G acias a es e mé odo, e i amos necesi a de semanas pa a een ena las edes. 5. A qui ec u as de De ección de Obje os Den o de las a qui ec u as deep lea ning se dis inguen dos líneas de in es igación a día de hoy, siendo la p ime a mas an igua que la segunda. La p ime a se conoce como a - qui ec u a de dos ases, gene ando p ime o egiones candida as de la localización del obje o en la imagen y pos e io men e clasi icando los obje os asignándole una ca ego ía, po ejemplo en es e caso: coche, ciclis a o pea ón. Es e ipo de de ec o es ambién se les conoce po de ec o es de obje os basados en egiones. Po o o lado, el segundo ipo de de ec o es se conocen po ene una a qui ec u a de una sola ase. Es os ealizan una abs acción mayo , pues en el p oblema de de ec- ción de obje os como un p oblema de eg esión(es imación de las cajas delimi ado as) 22 y clasi icación. De es a o ma, en una sola ase, son capaces de in e i la localización y clasi icación del obje o. 5.1. A qui ec u as de dos ases Las a qui ec u as de dos ases son ambién conocidas como las a qui ec u as basadas en egiones. El nacimien o de es as a qui ec u as se p odujo en 2012, cuando AlexNe [1] ganó el desa ío ILSVRC, ayendo consigo el dominio de las CNN al campo de la de ección de obje os. Un en oque po ue za b u a de de ección de obje os es usa una en aja deslizan e de izquie da a de echa, de a iba a abajo pa a iden i ica obje os usando clasi icación. Un ejemplo se ía la imagen in e io : Figu a 5.1: Ven ana deslizan e de izquie da a de echa sob e la imagen. Fuen e: [49] Como emos en la igu a supe io , si que emos de ec a di e en es obje os debemos usa en anas de amaños y o mas a iadas. En cada paso de deslizamien o de la en ana se eco an pa ches de la imagen según es as en anas. P e iamen e a alimen a la ed con olucional clasi icado a, el pa che es edimensionado a la en ada de la ed, que a menudo suele se ija. Es e ipo de ans o maciones no impac an la p ecisión de la ed, ya que es án en enados pa a maneja es as imágenes. Es a ed se enca ga de ex ae un núme o de e minado de ca ac e ís icas del pa che. Luego se aplica SVM(suppo ec o machine) sob e las ca ac e ís icas ex aídas pa a iden i ica a que clase pe enece el obje o encuad ado en el pa che. Además, usamos un mé odo de eg esión lineal sob e las ca ac e ís icas pa a es ima los lími es de la cajas delimi ado as. En la imagen in e io podemos e como se ía es a a qui ec u a: 23 Figu a 5.2: A qui ec u a basada en un en oque de ue za b u a. Fuen e: [49] Sin emba go el en oque po ue za b u a es demasiado cos oso en iempo de in e encia y en enamien o, así como in ensi o en ecu sos compu acionales. Una mejo a ob ia es educi el núme o de en ajas deslizan es. De es a o ma, se c ea un mé odo que se enca gue de p opone egiones de in e és oROIs a pa i de una imagen. Un ejemplo de es e mé odo es la búsqueda selec i a. Al comienzo cada píxel es un g upo en si mismo. Pos e io men e, se calcula la ex u a de cada g upo y se unen aquellos que sean mas simila es. Con el obje i o de e i a que los g upos g andes se coman a los pequeños, end án p io idad la unión de g upos pequeños en e a los g andes. Se con inua es e p oceso de unión has a que se cumpla alguna condición de con e gencia. En la imagen in e io , podemos e como es os g upos se an o mando en la p ime a ila, mien as que los ec ángulos azules de la segunda ila mues a odas las posibles egiones de in e és gene adas en cada paso de la búsqueda selec i a. 24 Figu a 5.3: Mé odo de p oposición de egiones: búsqueda selec i a. Fuen e: [31] En 2013 Ross Gi shick [50] p opone la p ime a a qui ec u a que hace uso de mé odos de p oposición de egiones de in e és, R-CNN. Es a a qui ec u a p opone ce ca de 2000 ROIs po imagen. Luego cada egión se u iliza como en ada de una ed neu onal con- olucional, de o ma que cada egión es p ocesada de mane a indi idual. Es e p oceso es seguido de capas o almen e conexas que pe mi en ealiza la clasi icación del obje o y la es imación de la caja delimi ado a. En la imagen in e io podemos e es a a qui ec u a: Figu a 5.4: A qui ec u a del de ec o R-CNN. Fuen e: [49] 25 5.2.2. YOLO Los sis emas de de ección ac uales eu ilizan clasi icado es pa a ealiza la de ección. Pa a de ec a un obje o, es os sis emas oman un clasi icado pa a ese obje o y lo e alúan a lo la go de la imagen en a ios luga es y escalas. Los sis emas como los modelos de pa es de o mables o de o mable pa s models (DPM) u ilizan un en oque de en ana co ediza en el que el clasi icado se ejecu a en luga es uni o memen e espaciados en oda la imagen. En oques más ecien es como el R-CNN u ilizan mé odos como p opues a de egiones pa a gene a p ime o las po enciales cajas delimi ado as en una imagen y luego ejecu- a un clasi icado en cada una de es as cajas p opues as. Después de la clasi icación, el pos -p ocesamien o se u iliza pa a e ina las cajas delimi ado as, elimina las de eccio- nes duplicadas, y ol e a clasi ica las cajas en base a o os obje os de la imagen. Es os sis emas son len os y di íciles de op imiza po que cada componen e indi idual debe se en enado po sepa ado. YOLO [46] eplan ea la de ección de obje os como un único p oblema de eg esión, di- ec amen e de los píxeles de la imagen a las coo denadas de la caja delimi ado a y las p obabilidades de clase. En es a nue a o ma de a on a la de ección p opues a po YOLO, una sola ed con olucional p edice simul áneamen e múl iples cajas delimi a- do as y p obabilidades de clase pa a esas cajas. Podemos e una ilus ación de es e uncionamien o en la igu a 5.13. YOLO se en ena en imágenes comple as y op imiza di ec amen e el endimien o de la de ección. Es e modelo uni icado iene a ios bene icios sob e los mé odos adicionales de de ección de obje os: YOLO es ex emadamen e ápido. Al en oca la de ección como un p oblema de eg esión, no se necesi an sis emas complejos. Simplemen e se ejecu a la ed neu- onal en una nue a imagen pa a p edeci las de ecciones. Además, YOLO alcanza más del doble de la p ecisión media de o os sis emas en iempo eal. YOLO abaja globalmen e sob e la imagen. A di e encia de las écnicas de en ana co ede a y p opues as de egiones, YOLO e oda la imagen du an e el iempo de en enamien o y p ueba, de mane a que implíci amen e codi ica la in o mación con ex ual sob e las clases, así como su apa iencia. YOLO ap ende ep esen aciones gene alizables de obje os. Cuando se en ena en imágenes na u ales, YOLO supe a los mé odos de de ección más a anzados como el DPM y R-CNN po un amplio ma gen. Dado que YOLO es al amen e gene alizable, es menos p obable que se descomponga cuando se aplica a nue os dominios o en adas inespe adas. A pesa de es as en ajas, YOLO oda ía se queda a ás de los sis emas de de ección de úl ima gene ación en la p ecisión. Aunque puede iden i ica ápidamen e los obje os en las imágenes, iene p oblemas pa a localiza con p ecisión algunos obje os, especialmen e los pequeños. 32 Figu a 5.12: Es uc u a de la es uc u a de ed con olucional de la p ime a e sión de YOLO, con 24 capas con olucionales seguidas po dos capas o almen e conec adas. Fuen e [46]. YOLO ha ido publicando a ias e siones, desde la e sion inicial cuya es uc u a pode- mos e en la igu a 5.12 has a la úl ima de ellas YOLO 4[8] publicada el 23 de Ab il de 2020, pasando po las e siones YOLO 3[48] y YOLO 3 iny[25], la cual se á de especial in e és debido a su meno amaño y po an o mayo apidez, una ca ac e ís ica un- damen al en la conducción au ónoma pa a in en a consegui p ocesamien o en iempo eal. Funcionamien o global de es uc u as YOLO La iloso ía de las es uc u as YOLO consis e en uni ica los di e en es componen es de la de ección de obje os en una sola ed. El uncionamien o global de la in e encia, que podemos e de mane a isual en la igu a 5.13, es el siguien e: 1. P ime amen e, la imagen es di idida en una cuad ícula de amaño SxS. Si el cen o de un obje o cae en una celda de la cuad ícula, esa celda es la esponsable de de ec a el obje o. 2. Cada celda de ec a Bcajas delimi ado as y ni el de con ianza pa a dichas cajas, que e lejan cómo de segu o es á el modelo de que esa caja con iene un obje o y cómo de segu o es á de que e ec i amen e la caja se co esponde al obje o que ha de ec ado, es deci , Con ianza =P(Obje o)∗IOU u h p ed . Si no hay obje o en esa celda, la con ianza debe ía de se 0, en o o caso debe ía se el IOU en e la caja de ec ada y la ead. 3. Cada una de las cajas delimi ado as es á compues a po 5 p edicciones: x, y, w, h y la con ianza. (x, y) ep esen a el cen o de la caja de ec ada y (w, h)la anchu a 33 Figu a 5.13: Ilus ación del uncionamien o global de YOLO, donde p ime o se di ide la imagen en cuad ículas más pequeñas, sob e és as se calculan di e en es cajas delimi ado as o bounding boxes y las p obabilidades de las dis in as clases, y inalmen e se ob ienen las de ecciones. Fuen e [46]. y al u a espec i amen e. 4. Además, cada celda de la cuad ícula ambién p edice Cp obabilidades condicio- nales P(Clasei|Obje o), una po cada clase, que ep esen an las p obabilidades de que en esa celda se encuen e el obje o de la clase i. Rema ca que se p edice un ec o de Cp obabilidades condicionales po cada celda, independien emen e del núme o de cajas de ec adas B. 5. En la in e encia, se mul iplican las p obabilidades condicionales de cada clase y la con ianza de cada caja de ec ada, ob eniendo así las p obabilidades especí icas de cada clase po cada caja de ec ada: P(Clasei|Obje o)∗P(Obje o)∗IOU u h p ed =P(Clasei)∗IOU u h p ed Es a medida nos indica la p obabilidad de que cada clase apa ezca en las cajas de ec adas y cómo de bien se ajus a dicha caja. YOLO 3 Vamos a menciona b e emen e las mejo as que implemen a YOLO 3 con espec o a la p ime a e sión, alguna de es as mejo as implemen adas en YOLO 2 y o as inalmen e en YOLO 3: 34 No malización de los lo es en las capas con olucionales. Clasi icado de al a esolución Úl ima capa con olucional con ancho boxes o cajas de anclaje, ambién llamadas cajas a p io i. En ez de p edeci di ec amen e las cajas, se p edicen los o se s con espec o a unas cajas de anclaje p e iamen e p ede inidas. Es o es muy ú il pues podemos de ini dichas cajas de anclaje pa a que se adecuen a la o ma de los obje os de nues o da ase . Clus e s dimensionales: Como hemos mencionado, en muchos p oblemas de de ec- ción los obje os ienen una o ma de e minada. Pa a calcula las Kcajas a p io i que mejo cub en es a gama de o mas en un da ase , se u iliza el algo i mo K- Means. P edicción di ec a de la localización P edicción de cajas delimi ado as Pa a la p edicción de las cajas delimi ado as u iliza la misma me odología que YOLO9000[47]. La ed p edice 4 coo denadas pa a cada caja delimi ado a x, y. w, h, de o ma que si la celda de la cuad ícula iene un o se con espec o a la esquina supe io izquie da de la imagen de (cx, xy)y la caja delimi ado a a p io i iene anchu a pw, ph, en onces las p edicciones inales son: bx=σ( x) + cx by=σ( y) + cy bw=pwe w bh=phe h Es deci , la ed p edice o se s con espec o a cajas a p io i o cajas de anclaje (ancho boxes). Podemos e una isualización de es as ecuaciones en la igu a 5.14 Es o es muy ú il pues en muchos p oblemas de de ección los obje os ienen una o ma de e minada. Po an o, podemos de ini dichas cajas de anclaje pa a que se adecuen a la o ma de los obje os de nues o da ase . Pa a calcula las Kcajas a p io i que mejo cub en es a gama de o mas en un da ase , se u iliza el algo i mo K-Means. Du an e el en enamien o se usa la suma de cuad ados como unción de pé dida, de o ma que el g adien e iene dado po ˆ ∗− ∗donde ˆ ∗es el o se p edicho po la ed y ∗es el o se eal. YOLO 3 p edice una pun uación de obje o pa a cada caja delimi ado a usando eg esión logís ica. Si el cuad o delimi ado a p io i no es la mejo , pe o se supe pone a un obje o po encima de un umb al (en es e caso 0.5), se igno a la p edicción. 35 Figu a 5.14: Cajas delimi ado as con dimensiones p e ias y p edicciones. Se p edice el ancho y la al u a de la caja como o se s desde el cen o de la caja. Fuen e [48]. P edicción de clases Cada casilla p edice las clases que puede con ene la caja delimi ado a u ilizando la clasi- icación mul i-e ique a, usando pa a ello clasi icado es logís icos independien es. Du an e el en enamien o se usa como unción de pé dida la en opía c uzada bina ia. P edicciones en di e en es escalas YOLO 3 ealiza p edicciones en 3 escalas di e en es. El sis ema ex ae ea u es o ca- ac e ís icas de cada una de es as 3 escalas u ilizando un concep o simila a las edes pi amidales de ca ac e ís icas o ea u e py amid ne wo ks[32]. En la es uc u a, después de las capas de ex acción de ca ac e ís icas se añaden di e en es capas con olucionales, la úl ima de ellas enca gada de p edeci un enso 3d codi icando las p edicciones de cajas delimi ado as, p obabilidad de con ene un obje o y p edicciones de clase. Así, el enso inal es de la o ma N×N×(Nboxes ∗(4+1+Nclasses)donde Nboxes es el núme o de cajas p edichas en cada escala, 4 se co esponde a los o se s de la caja delimi ado a, 1 a la p edicción del obje o o p obabilidad de con ene un obje o y Nclasses es el núme o de clases del da ase . A se coge el ea u e map o mapa de ca ac e ís icas de las dos capas an e io es y se aumen a en 2×. También se coge un mapa de ca ac e ís icas de las capas an e io es de la ed y se usiona con las ca ac e ís icas aumen adas usando conca enación. Es e mé odo nos pe mi e ob ene in o mación semán ica más signi ica i a. Se ealiza el mismo p oceso una ez más pa a p edeci cajas pa a la escala inal. Así, las p edicciones pa a la 3aescala se bene ician de odos los cálculos p e ios. 36 Figu a 5.15: Ex ac o de ca ac e ís icas Da kne -53. Fuen e[48]. Ex ac o de ca ac e ís icas Se u iliza un en oque híb ido en e el ex ac o de ca ac e ís icas u ilizado po YOLO 2 (Da kne -19) y capas esiduales. U iliza capas con olucionales sucesi as de 3×3y1×1, con algunas in e conexiones o a ajos. Tiene 53 capas con olucionales en o al y ecibe el nomb e de Da kne -53. Podemos e un esumen de su es uc u a en la igu a 5.15. En el caso de YOLO 3 iny la es uc u a se educe conside ablemen e a un o al de 15 capas con olucionales, lo que aumen a conside ablemen e su elocidad en la in e encia pe o sac i ica p ecisión, sob e odo en obje os muy pequeños. Compa ación con o as es uc u as Podemos e una compa ación en los esul ados inales con o as es uc u as popula es pa a la de ección de obje os en la igu a 5.16 37 Figu a 5.16: Compa ación dis in as es uc u as de edes neu onales con olucionales don- de podemos obse a el adeo o balance en e elocidad y p ecisión pa a .5 IOU, des acando YOLO 3 po su g an elocidad y man eniendo una buena p ecisión. Fuen e[48]. YOLO 4 Ha emos un b e e comen a io sob e la úl ima e sión de YOLO, YOLO 4 [8], que p e- sen a mejo as conside ables con espec o a su p edeceso , YOLO 3, an o en elocidad de in e encia como en p ecisión de en o no a un 10-12%, como podemos obse a en la igu a 5.16. Podemos además encon a una desc ipción muy de allada jun o a los pa áme os que u iliza la ed en es e enlace. Sin emba go, aunque es una p opues a muy in e esan e pa a la conducción au ónoma po su g an elocidad en cuan o a FPS y man eniendo una muy buena p ecisión con espec o a o os de ec o es de úl ima gene ación, no lo a a emos en es e abajo debido a que uno de los obje i os inales es la e aluación de es as es uc u as o edes en disposi i os de bajo consumo, u ilizando pa a ello el amewo k openVINO 9.2, el cual no iene implemen ado aún sopo e pa a es a es uc u a. 6. P esen ación de conjun os de da os u ilizados Los esul ados de las edes de más conocidas de de ección de obje os han sido decepcio- nan es sob e el da ase KITTI como se mues a en la sección 11.1. En ellos se obse a un cla o p oblema pa a la localización y de ección de los obje os en las imágenes p esen es en el da ase KITTI. El p oblema se e especialmen e acen uado en las clases pea ón y ciclis a. Uno de los p incipales desa íos que in en a emos sol en a en es e p oyec o 38 Figu a 5.17: Compa ación de la p opues a YOLO 4 y o os de ec o es de obje os de úl ima gene ación. YOLO 4 mejo a la p ecisión media (AP) y los FPS de YOLO 3 en un 10 % y un 12 %, espec i amen e. Fuen e[8]. es como mejo a la p ecisión de nues as edes en las clases pea ón y ciclis a sin pe de p ecisión a la ho a de localiza un clasi ica obje os de la clase coche. En e las soluciones p esen adas, en es a sección de alla emos como hemos aumen ado el núme o de obje os po clase, log ando así un mayo conjun o de en enamien o. La idea es que es e aumen o de obje os de las es clases pe mi a aumen a la capacidad de de ección y localización de las edes es udiadas. Pa iendo del da ase KITTI, donde ealizamos una sepa ación alea o ia en e los conjun os de en enamien o y es , eniendo así un 80% pa a en enamien o y un 20% pa a es . Los da ase s u ilizados pa a aumen a las imágenes de las clases coche, pea ón y ciclis a deben se simila es a las imágenes ecolec adas en el da ase KITTI. Como e emos en es a sección, es os conjun os han sido c eados basados en un en o no de conducción, es deci , g abadas desde un coche. Pos e io men e las imágenes son il adas de o ma que omemos aquellas imágenes g abadas du an e el día y en buenas condiciones clima oló- gicas. La azón de es e il o se debe a que el obje i o es mejo a la p ecisión sob e el conjun o de es del da ase KITTI, luego el conjun o de en enamien o debe se simila al conjun o de es . En pa icula , las imágenes del es cumplen es as condiciones. So- mos conscien es que en un p oblema eal de conducción au ónoma un ehículo debe ía se capaz de conduci de o ma au ónoma en cualquie si uación clima ológica ad e sa, sin emba go es e p oyec o se cen a en una simpli icación del p oblema eal. 39 6.1. KITTI El conjun o de da os KITTI [5] ue p esen ado en 2012. El da ase de de ección de obje os consis e en 7481 imágenes a colo de di e en es escenas, almacenadas como imágenes png. El amaño de las imágenes es ap oximadamen e 375×1275, ya que el amaño no es ijo y cambia lige amen e a lo la go del da ase . Las imágenes ue on omadas po una cáma a colocada sob e un coche mien as se conducía po zonas u ales y u banas en buenas condiciones clima ológicas y du an e el día. El ehículo que g abó las imágenes es el siguien e: Figu a 6.1: Coche que ealizó los ídeos en los que se basa el da ase KITTI. Fuen e [5] En cada imagen se e ique an odos los obje os que pe enezcan a alguna de la siguien e ca ego ías: Ca Van T uck Pedes ian Pe son(si ing) Cyclis T am Miscelanous En la igu a 6.2 emos el núme o de ins ancias po clase de obje o: 40 Figu a 6.2: Núme o de ins ancias po clase en el da ase KITTI.Fuen e [5] Es ácilmen e ap eciable el desbalanceo de clases p esen e en el conjun o de da os KITTI. En nues o caso, es ingimos el p oblema a las clases coche, pea ón y ciclis as. Su ge de o ma na u al la necesidad de aumen a el conjun o de imágenes de en enamien o con p esencia de pea ones y ciclis as, pues se obse a un cla o desequilib io en e el núme o de obje os po clase. Además de la e ique a de clase, ambién con ienen in o mación de las cajas delimi ado as en 2D, cuyas coo denadas son exp esadas en píxeles. Toda la in o mación de las e ique as es almacenada en un a chi o . x que se c ea pa a cada imagen. Un ejemplo de es e da ase podemos e lo en la siguien e imagen: Figu a 6.3: Ejemplo e ique ado del da ase KITTI. 41 donde TP ep esen a ue posi i e, FP ep esen a alse posi i e y FN ep esen a alse nega i e. 2. Recall: mide la capacidad del modelo de de ec a casos posi i os, en es e caso, obje os que pe enezcan a alguna de las clases del da ase . Una de inición mas ma emá ica se ía: Recall =T P T P +F N po an o ecall es un po cen aje de los casos posi i os co ec amen e ace ados. 8.2. IOU Además de los concep os de p ecision y ecall, necesi amos de ini IOU pa a pode ex- plica mAP. In e sec ion O e Union o IOU mide el á ea de in e sección en e dos cajas delimi ado as. Ma emá icamen e se ia el cocien e del á ea de in e sección y el á ea de la unión de las cajas: IOU =a ea de in e seccion a ea o al de la union Es a mé ica nos pe mi e es ablece cuando una p edicción ealizada po un obje o es buena o no. Habi ualmen e se es ablece un umb al a pa i del cual damos po buena una p edicción, en es e p oyec o hemos omado po buenas aquellas p edicciones que supe a an el 0,5de es e alo . La siguien e igu a mues a la in e sección en e una caja delimi ado a p edicha y la eal e ique ada en la imagen, conocida po g ound u h: 48 Figu a 8.1: In e sec ion O e Union. Fuen e [27] 8.3. AP y mAP Po o o lado in oducimos a e age p ecision o AP. Si ep esen amos en un g á ico o- mando como ejes y = p ecisión y eje x = ecall, AP es el á ea bajo la cu a, es deci , bajo el g á ico gene ado po ambas mé icas. Un ejemplo lo emos en la siguien e g á ica: Figu a 8.2: A ea bajo la cu a de la g á ica p ecición- ecall. Fuen e [27] 49 La de inición ma emá ica mas conocida es: AP =Z1 0 p( )d donde p( )es la cu a o mada po el g á ico p ecisión- ecall. Finalmen e de inimos mAP como la media de AP pa a un umb al de IOU dado. Un umb al clásico pa a IOU es [0.5, 0.05, 0.95], de es a o ma mAP se á la media de los alo es AP pa a cada alo de IOU, que a desde 0.5 a 0.95 con un paso de 0.05. 9. F amewo ks En es e capí ulo amos a p esen a b e emen e los amewo ks u ilizados an o pa a el en enamien o de los modelos como pa a ealiza la in e encia en dis in os disposi i os 9.1. Tenso low Tenso Flow es una pla a o ma o amewo k de código abie o de ex emo a ex emo pa a el ap endizaje au omá ico. Cuen a con un ecosis ema in eg al y lexible de he amien as, biblio ecas y ecu sos de la comunidad que les pe mi e a los in es igado es impulsa un ap endizaje au omá ico inno ado y, a los desa ollado es, compila e implemen a con acilidad aplicaciones con ecnología de ap endizaje au omá ico. Fue o iginalmen e desa- ollado po el equipo de Google B ain, eemplazando a su p edeceso de código ce ado, Dis Belie . Tenso low pone a nues a disposición una se ie de ecu sos que acili an la c eación, en enamien o y alidación de modelos pa a el ap endizaje au omá ico: Modelos y conjun os de da os: Modelos p e iamen e en enados y conjun os de da os que Google y la comunidad han desa ollado He amien as: Ecosis ema de he amien as pa a ayuda al usua io con Tenso Flow Biblio ecas y ex ensiones: Biblio ecas y ex ensiones c eadas en Tenso Flow P og ama de ce i icación de Tenso Flow Ap ende AA: Recu sos educa i os pa a ap ende los aspec os básicos del AA con Tenso Flow 9.1.1. Objec De ec ion API En nues o caso, u iliza emos en conc e o la API de de ección de obje os [60] pa a el en- enamien o de los siguien es modelos o edes neu onales con olucionales p opo cionadas 50 po Tenso low p e iamen e en enados sob e el conjun o gene alis a COCO[10]. Es os modelos los podemos encon a en el objec de ec ion model zoo [59] de enso low. SSD mobilene incep ion V2 COCO SSDLi e mobilene incep ion V2 COCO Fas e R-CNN incep ion V2 COCO Den o de es a API encon amos a ios elemen os que usa emos du an e los en enamien- os: model_main.py: Se a a del sc ip de py hon que se u iliza pa a el en enamien o de las edes con olucionales pa a la de ección de obje os. Implemen a además la e aluación del modelo sob e un conjun o de alidación cada cie o iempo pa a e la e olución del modelo y no solo de la unción de pé dida. En e sus pa áme os podemos encon a : •pipeline_con ig_pa h: Ru a al a chi o de con igu ación, que pasamos a ilus a b e emen e más abajo. •model_di : Ru a donde que emos que se gua de el modelo een enado jun o a los úl imos checkpoin s gene ados. •num_ ain_s eps: Núme o máximo de pasos a ealiza en el en enamien o. •sample_1_o _n_e al_examples: Tamaño ela i o del da ase de alidación omado pa a cada e aluación model zoo [59]: Ca pe a con los modelos p een enados o ecidos po el amewo k. Aquí podemos encon a los modelos an e io men e mencionados. samples: En es a ca pe a encon amos algunos ejemplos. Nos se á de especial u i- lidad la subca pe a con igs, donde podemos encon a plan illas de con igu ación pa a las dis in as edes. me ics: Ca pe a con dis in as mé icas a usa . En nues o caso u iliza emos las mé icas de COCO. da ase _ ools: Ca pe a donde podemos encon a dis in as he amien as. En nues o caso u iliza emos el sc ip c ea e_ki i_ _ eco d pa a gene a los a chi os enso low eco ds, que u iliza á el amewo k an o pa a el en enamien o como las alidaciones. Cabe des aca que, como hemos mencionado an e io men e, nues as imágenes deben se ans o madas p e iamen e a Tenso low eco ds pa a pode se p ocesadas po el amewo k. El o ma o TFReco d es un o ma o simple pa a almacena una secuencia de egis os bina ios, de mane a que sea más e icien e el almacenamien o y lec u a en ba ches o lo es de los mismos. 51 Pasamos a desc ibi aho a b e emen e la composición del a chi o de con igu ación a se usado en el een enamien o median e el sc ip model_main.py. Es e a chi o iene es uc u a de JSON y nos encon amos los siguien es campos: model: Nos pe mi e especi ica el modelo que amos a een ena jun o a los pa- áme os especí icos del modelo y o o más gene ales como el núme o de clases, la gene ación de ancho s, las unciones de pé dida y pos -p ocesamien o. ain_con ig: En es e campo podemos especi ica pa áme os como el núme o de imágenes po lo e, el op imizado a se u ilizado en el een enamien o (RMPS p op, ADAM, e c), el checkpoin del que pa i si que emos ealiza un ine uning y no un een enamien o desde 0, da a augmen a ion y dónde se encuen an nues as imágenes en o ma o eco d pa a el een enamien o. e al_con ig: Nos pe mi e especi ica las mé icas a u iliza (en nues o caso COCO), el núme o de imágenes a u iliza en la e aluación, núme o de imágenes a isualiza en cada e aluación, inclui mé icas po cada ca ego ía y dónde se encuen an nues as imágenes en o ma o eco d pa a las e aluaciones. 9.1.2. Tenso boa d Además, enso low pone a nues a disposición la he amien a Tenso boa d. Tenso Boa d p opo ciona la isualización y las he amien as necesa ias pa a expe imen a con el ap en- dizaje au omá ico, como po ejemplo: Segui y isualiza mé icas, como la pé dida y la exac i ud o accu acy. Visualiza el g a o del modelo (ope aciones y capas) Mos a imágenes Podemos e un ejemplo de su in e az g á ica en la igu a 9.1. 52 Figu a 9.1: In e az g á ica de Tenso boa d. Usa emos es a he amien a pa a supe isa el ap endizaje de nues as edes, ya que pod emos i iendo en cada i e ación las unciones de pé dida, el accu acy y algunas imágenes mos ando las de ecciones que ealiza nues a ed. 9.2. Open ino oolki OpenVINO [43] (Open Visual In e ence and Neu al ne wo k Op imiza ion) oolki es un ki de he amien as g a ui o que acili a la op imización de un modelo de Deep Lea - ning o Ap endizaje P o undo p oceden e de di e en es amewo ks y la implemen ación y ejecución median e un mo o de in e encia en el ha dwa e de In el. El ki de he amien- as iene dos e siones: OpenVINO oolki , que es apoyado po la comunidad de código abie o y la dis ibución de In el(R) de OpenVINO oolki , que es apoyado po In el. El p incipal componen e de es e ki de he amien as es el Deep Lea ning Deploymen Toolki (DLDT), que nos o ece dos uncionalidades p incipales: 1. Gene a a chi os IR (Rep esen ación In e media) haciendo uso del op imizado de modelos a pa i de un modelo en enado o uno público. 2. Ejecu a la in e encia haciendo uso del mo o de in e encia en los disposi i os ha dwa e especi icados 9.2.1. Ca ac e ís icas p incipales Pe mi e ealiza in e encia sob e modelos de ap endizaje p o undo basados en edes neu onales con olucionales 53 Admi e la ejecución he e ogénea a a és de una CPU In el R , G á icos In eg ados In el R , In el R FPGA, In el R Mo idiusTM Neu al Compu e S ick, In el R Neu al Compu e S ick 2 e In el R Vision Accele a o Design con VPU In el R Mo idiusTM. Acele a el iempo de come cialización a a és de una biblio eca ácil de usa con uncionalidades de isión po o denado y núcleos p eop imizados Incluye llamadas op imizadas pa a los es ánda es de isión a i icial, incluyendo OpenCV* y OpenCLTM 9.3. Da kne Da kne [45] es un amewo k o en o no pa a edes neu onales de código abie o esc i o en C y CUDA. Es ápido, ácil de ins ala y sopo a compu ación de CPU y GPU. En nues o caso u iliza emos la e sión de AlexeyAB, que podemos encon a en su eposi- o io de gi hub[16]. En e las uncionalidades que nos o ece es e en o no, des acan las edes neu onales YO- LO (You Only Look Once, sólo mi as una ez) que se ca ac e izan po aplica una sola ed neu onal a oda la imagen, la cual di ide la imagen en egiones más pequeñas, luego p edice las cajas delimi ado as y asigna p obabilidades pa a cada una de es as egiones. És e hecho hace que la in e encia en es e ipo de es uc u as sea más ápida que en o o ipo de es uc u as de edes con encionales. P opo ciona dis in as uncionalidades, en e las que encon amos: da kne .exe de ec o : Es el sc ip p incipal e implemen a las siguien es uncio- nalidades en unción del segundo pa áme o que in oduzcamos: • ain: En enamien o • alid: Validación •demo: Nos pe mi e ejecu a la ed sob e un a chi o de ideo o en iempo eal u ilizando una cáma a. c g: Ca pe a con plan illas de con igu aciones sob e dis in as edes. sc ip s: Ca pe a con di e en es sc ip s que nos se an de u ilidad, como po ejem- plo gen_ancho s.py, el cual u iliza K-Means pa a calcula de o ma óp ima las dimensiones de los ancho s que u iliza an las dis in as capas de la ed. 9.4. Módulos El ki de he amien as se encuen a encapsulado di e en es módulos o componen es. Los p incipales y de los que ha emos uso se án los siguien es: 54 Deep Lea ning Deploymen Toolki : Es el componen e p incipal. Se subdi ide en: •Op imizado de modelos: Pe mi e impo a modelos y p epa a los pa a una ejecución óp ima median e el mo o de in e encia. El Op imizado de Modelos impo a, con ie e (a IR) y op imiza modelos de amewo ks como Ca e, Tenso Flow, MXNe , Kaldi y ONNX. •Mo o de in e encia: Una API uni icada pa a pe mi i la in e encia de al o endimien o en dis in os ipos de ha dwa e. •Samples: Un conjun o de aplicaciones sencillas de consola que demues an cómo u iliza el mo o de in e encia. •Tools: He amien as adicionales Open Model Zoo: Nos o ece un conjun o de demos pa a u iliza el mo o de in e encia, he amien as adicionales pa a desca ga modelos y medi la p ecisión de los mismos y un conjun o de modelos p een enados jun o a documen ación sob e los mismos. Pos -T aining Op imiza ion ool: He amien a que pe mi e calib a modelos y ealiza in e encia usando en e os de 8 bi s. Deep Lea ning Wo kbench: En o no g á ico basado en la web que pe mi e u ili- za ácilmen e a ios componen es so is icados del ki de he amien as OpenVINOTM. Podemos e un ejemplo de la in e az g á ica en la igu a 9.2. Figu a 9.2: In e az g á ica de la he amien a Deep Lea ning Wo kbench. 10. Expe imen os ealizados Habla de la mejo a de la p ecisión y educción del e o g acias a dis in as écnicas como da a augmen a ion, de ini nue os ancho s, ha d nega i e mining e c 55 En algun lado hay que p esen a las medidas de p ecision es udiadas, IOU,MAP, e c 10.1. Ancho Boxes En la e apa de p edicción de múl iples obje os en una imagen, las edes neu onales como SSD o YOLO, ealizan miles de p edicciones y solo mues an aquellas que deciden que son un obje o. El es ado del a e de los sis emas de de ección de obje os unciona de la siguien e mane a: 1. C ea miles de cajas po de ec o oancho boxes pa a cada p edic o de o ma que ep esen e la o ma, amaño y localización del obje o que se especializa. 2. Pa a cada ancho box, calcula que obje o de la imagen iene la caja delimi ado a con mayo IOU. 3. Si el IOU máximo es mayo del 50 %, en onces el ancho box que p edice el obje o de la imagen que ob u o mayo IOU. 4. En caso con a io, el ancho box decidi á que no hay obje o. Es e mé odo unciona bien en la p ác ica, pe o como emos las cajas po de ec o son o almen e i ales pa a que nues o de ec o de obje os enga una buena capacidad de p edicción. Po ejemplo si obse á amos los ancho s boxes gene ados po nues a ed se ía algo así: 56 Figu a 10.1: Ancho Boxes gene ados po un de ec o de obje os. Fuen e [4] Y en es a imagen solo es amos mos ando un bajísmo po cen aje de los ancho boxes exis en es. Usa los ancho boxes po de ec o puede c ea p edic o es que es án demasiado especializados y los obje os de la imagen se án incapaces de log a un IOU mayo de 50% con alguna de las cajas po de ec o gene adas. De o ma que, la ed neu onal no sab á que esos obje os exis en y nunca ap ende á de ellos. Po ello debemos de adap a las cajas po de ec o pa a ene una o ma y amaño ideal pa a nues os obje os, log ando cajas po de ec o mucho mas ajus adas. Un ejemplo de esas modi icaciones se ía: 57 conjun o KITTI. Como se ha comen ado an e io men e, es e hecho se debe a las di e en- cias exis en es en e los conjun os de da os de en enamien o. Finalmen e compa amos los esul ados ob enidos sob e la clase pea ón: Figu a 11.5: Compa ación del mAP sob e la clase pea ón log ado po la ed SSD Incep- ion en enada sob e KITTI y el da ase comple o. En la igu a 11.5, se mues a una disminución sus ancial de la capacidad de de ección de pea ones de la ed, siendo una disminución ce cana al 80 % en la capacidad de de ec- ción de pea ones. La a ianza de los esul ados ob enidos sob e el da ase comple o ha disminuido lige amen e, pe o un modelo mas es able no compensa la poca capacidad de in e encia de pea ones. Las azones del endimien o de la ed se han de allado an e io men e, señalando espe- cialmen e al edimensionamien o de es a ed, a las di e encias de amaño de imagen de los da ase s y la di e encia en la localización de los obje os en la imagen como g andes p oblemas que in luyen eno memen e en la capacidad de de ección de la ed. 11.2. Resul ados de la ed Fas e R-CNN En es a subsección amos a expone los esul ados de pa ida log ados po la ed Fas e R-CNN sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una compa ación del endimien o po clase log ado po la ed en ase de een enamien o. 11.2.1. Resul ados Fas e R-CNN sob e KITTI Los esul ados de la ed sob e el conjun o de da os KITTI son los siguien es: 64 Figu a 11.6: mAP de las clases coche, ciclis a y pea ón En la igu a 11.6, se obse a como es a ed iene una mayo capacidad de de ección que SSD a simple is a. Es a ed po o o lado es mucho mas len a, algo que p oba emos mas adelan e, siendo in iable pa a la in e encia en iempo eal sob e un ehículo. La p ecisión log ada en la clase coche es supe io al 0,6, mien as que la de ección de ciclis as p ác icamen e llega al 0,5 as 1000000 de épocas. Pea ón es la clase que mas cues a localiza y clasi ica a es a ed, con una p ecisión supe io al 0,3. Finalmen e, obse amos que es e modelo es mucho mas es able en sus de ecciones que SSD al ene una meno a iabilidad en sus in e encias y iene una capacidad de p edicción en ase de en enamien o mucho mayo a la de SSD, log ando una p ecisión ap oximada del 60 % en coches, del 50 % en ciclis as y del 30 % en pea ones. 11.2.2. Resul ados Fas e R-CNN sob e el da ase comple o Los esul ados de la ed sob e el conjun o de da os comple o son los siguien es: 65 Figu a 11.7: mAP de las clases coche, ciclis a y pea ón En la igu a 11.7 se obse an unos esul ados peo es a los p esen ados sob e KITTI. Se educe la capacidad de p edicción en odas las clases y se obse a una lige o aumen o en la a ianza de la capacidad de de ección de obje os. Es e compo amien o se debe a las di e encias en la localización de los obje os y el amaño de las imágenes comen- adas an e io men e en e lo conjun os de da os KITTI, Be keley Deepd i e Da ase y Tshingua-Daimle . 11.2.3. Compa ación de esul ados En es a sección compa a emos clase a clase los esul ados ob enidos po es a ed has a el momen o. Comenza emos compa ando la clase coche: Figu a 11.8: Compa ación del mAP sob e la clase coche conseguido po la ed Fas e R-CNN en enada sob e KITTI y el da ase comple o. 66 El núme o de épocas en enadas es de 1000000, dónde emos que al comienzo la p ecisión es mayo sob e KITTI, pe o al inal e mina siendo lige amen e supe io sob e el conjun o de da os comple o. En pa icula , se ha conseguido el obje i o de man ene o supe a la p ecisión de la ed sob e KITTI en es a clase. Aho a emos los esul ados sob e la clase ciclis a: Figu a 11.9: Compa ación del mAP sob e la clase ciclis a conseguido po la ed Fas e R-CNN en enada sob e KITTI y el da ase comple o. En es a clase emos que se ha p oducido una descenso conside able en la p ecisión, siendo es a di e encia mayo al comienzo del een enamien o y meno con o me es e a anza. El obje i o de mejo a la p ecisión sob e es a clase no se ha log ado. Una de las posibles azones es que es a ed ealiza un edimensionamien o meno de las imágenes, a un amaño 600 ×1024, eniendo como consecuencia una educción del amaño de los ciclis as. Además, los ancho boxes po de ec o de la ed no han sido uneados, luego puede que no es én ajus ados una o ma adecuada pa a la clase ciclis a. O o posible p oblema es que si los ciclis as se encuen an al inal de la imagen, y son pequeños, pueden no se p opues os como egiones de in e és, eniendo como consecuencia que la ed no ap enda las ca ac e ís icas necesa ias pa a la de ección p ecisa de ciclis as. Finalmen e emos los esul ados sob e la clase pea ón: 67 Figu a 11.10: Compa ación del mAP sob e la clase pea ón conseguido po la ed Fas e R-CNN en enada sob e KITTI y el da ase comple o. Al comienzo del een enamien o se obse a una g an di e encia en e la p ecisión en la de ección de la clase pea ón sob e ambos da ase s, sin emba go, al inal podemos e como esa di e encia se ha educido comple amen e. El obje i o de mejo a la capacidad p edic i a sob e la clase pea ón no se ha log ado, eniendo el mismo p oblema que la clase ciclis a. Las azones son simila es a las expues as en la clase ciclis a, es deci , se a a de obje os di íciles de de ec a debido a la posible ausencia de ancho boxes adecuados o bien que su amaño en la imagen no es signi ica i o a se señalado como egión de in e és, luego la ed no ap ende de los casos en el ondo de la imagen. 11.3. Resul ados de la ed SSD Mobile Li e En es a subsección amos a expone los esul ados de pa ida log ados po la ed SSD Mobile Li e sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una compa ación del endimien o po clase log ado po la ed en ase de een enamien o. 11.3.1. Resul ados SSD Mobile Li e sob e KITTI Los esul ados de la ed sob e KITTI son los siguien es: 68 Figu a 11.11: mAP de las clases coche, ciclis a y pea ón Obse amos los esul ados sob e el een enamien o de 200000 épocas ealizado. A p ime- a is a, emos unos esul ados in e io es a los log ados con la ed Fas e R-CNN, aunque es os an en la línea de los log ados son SSD Incep ion, e incluso son mejo es que los de es a ed. En la clase coche iene una p ecisión del 0,4, mien as que en la clase ciclis a es de 0,15. La clase pea ón es la que mas p oblemas iene pa a localiza y clasi ica , con un mAp ce cano al 0,1. En esumen, es capaz de de ec a ap oximadamen e el 40% de los coches, el 15 % de ciclis as y el 10 % de pea ones. O a ca ac e ís ica de es a ed, es que mues a una mayo es abilidad, al mos a esul ados menos olá iles en las dis in as e aluaciones ealizadas du an e el en enamien o. 11.3.2. Resul ados SSD Mobile Li e sob e el da ase comple o Los esul ados de la ed sob e el conjun o de da os comple o son los siguien es: 69 Figu a 11.12: mAP de las clases coche, ciclis a y pea ón A p io i los esul ados son peo es que los conseguidos en KITTI, algo que e emos mas de alladamen e en la siguien e sección. Al menos se man iene la es abilidad de las p e- dicciones, aunque la p ecisión ha bajado en odas las clases de ec adas. En la clase coche mues a una p ecisión po debajo de 0,4 as 120000 épocas, mien as que po o o lado las clases pea ón y ciclis a ienen un mAp po debajo del 0,1. En la siguien e sección e emos cla amen e que el da ase comple o disminuye la p ecisión de la ed, compo a- mien o simila al is o en las edes SSD Incep ion y Fas e R-CNN. 11.3.3. Compa ación de esul ados En es a sección compa a emos clase a clase los esul ados ob enidos po es a ed has a el momen o. Comenza emos compa ando la clase coche: 70 Figu a 11.13: Compa ación del mAP sob e la clase coche conseguido po la ed SSD Mobile Li e en enada sob e KITTI y el da ase comple o. La igu a 11.13 mues a la meno capacidad de p ecisión sob e la clase coche en el da ase comple o una ez se compa a con el KITTI. Es a di e encia no es supe io a dos pun os po décima. Po o o lado emos los esul ados en la clase ciclis a: Figu a 11.14: Compa ación del mAP sob e la clase ciclis a conseguido po la ed SSD Mobile Li e en enada sob e KITTI y el da ase comple o. La igu a 11.14 ep esen a la di e encia exis en e en e la capacidad de p edicción de ciclis as po la ed una ez een enada sob e dis in os conjun os, siendo mucho meno en el caso del conjun o de da os comple o. Finalmen e emos los esul ados sob e la clase pea ón: 71 Figu a 11.15: Compa ación del mAP sob e la clase pea ón conseguido po la ed SSD Mobile Li e en enada sob e KITTI y el da ase comple o. Los esul ados ilus ados en la igu a 11.15 an en la línea de lo comen ado p e iamen e, es deci , que la capacidad de p ecisión de la ed ha disminuido al aumen a el conjun o de en enamien o con mas imágenes. Además de ob se a un endimien o bajo en odas las clases, especialmen e acen uado en las clases pea ón y ciclis a. Es e compo amien o se debe p incipalmen e a a ias azones: La a qui ec u a de la ed, de o ma que el edimensionamien o que ealiza penaliza especialmen e a los obje os pequeños, como pueden se los ciclis a y pea ones en una imagen. Las di e encias de amaño de imagen de los conjun os KITTI, Be keley Deepd i e Da ase y Tshingua-Daimle . En el apa ado de conclusiones amplia emos las causas y mo i os de es e compo amien o. 11.4. Resul ados de la ed YOLO 3 En es a subsección amos a expone los esul ados de pa ida log ados po la ed YOLO 3 sob e los conjun os de da os KITTI y el conjun o de da os comple o, o mado po KITTI, Tshingua-Daimle y Be keley Deepd i e Da ase . Además se ealiza á una compa ación del endimien o po clase log ado po la ed. 72 11.4.1. Resul ados YOLO 3 sob e KITTI Figu a 11.16: MAP du an e el een enamien o de la ed YOLO 3 sob e KITTI. Como podemos e , el ap endizaje inicial es g ande g acias a ac o es como que el ex ac- o de ca ac e ís icas es á p e iamen e en enado. El mAP sob e el conjun o de alidación sigue aumen ando y iende a es abiliza se sob e odo en la clase coche en o no a las 20000 i e aciones, que con un amaño de 64 imágenes po lo e, equi ale a 1280000 imágenes p ocesadas. 11.4.2. Resul ados YOLO 3 sob e el da ase comple o Figu a 11.17: MAP du an e el een enamien o de la ed YOLO 3 sob e el da ase com- ple o. 73 como al en ena sob e el da ase comple o, se pie de p ecisión, al se las imágenes de los da ase s an dis in as y se meno el en enamien o o al. 13. Compa ación 13.1. MAP En la siguien e igu a podemos obse a una compa ación del mAP ob enido en la in e- encia inal sob e la pa ición es de KITTI de las dis in as edes, een enadas sob e KITTI en azul y sob e el da ase inal en na anja: Figu a 13.1: Compa ación del mAP ob enido po las dis in as edes. Podemos obse a cómo en odas las edes se pie de p ecisión al een ena sob e el da ase comple o o aumen ado. Es o no necesa iamen e indica que el modelo sea peo , simplemen e puede debe se a a ios ac o es como: La e aluación únicamen e sob e un subconjun o del da ase KITTI. La a iedad en los amaños y o mas de las cajas delimi ado as en e los dis in os da ase s, al a a se el da ase KITTI de imágenes pano ámicas. La exis encia de cajas delimi ado as con un á ea muy pequeña en el da ase aumen- ado que, al abaja con edes que edimensionan y disminuyen mucho el amaño de la imagen, puede no solo no apo a nada al en enamien o si no di icul a lo. Al aumen a el amaño del da ase , se necesi e más iempo de en enamien o. 80 13.2. Velocidad de in e encia En es e apa ado amos a compa a las dis in as edes en cuan o a elocidad de in e encia se e ie e. Pa a ello, usa emos la mé ica FPS oF ames Po Segundo, que nos indica el núme o de imágenes po segundo que es capaz de p ocesa dicha ed. Des aca que uno de los obje i os es supe a el umb al de p ocesamien o en iempo eal de 20FPS. Figu a 13.2: FPS alcanzado po las edes SSD, SDDLi e y Fas e -R-CNN ejecu adas sob e di e en es disposi i os ha dwa e. Podemos e como en e los dis in os disposi i os, My iad es el más len o y la CPU el más ápido. También podemos obse a una di e encia in e esan e en cuan o a la GPU con un modelo cuan izado con una p ecisión FP32, es deci , que abajo con a iables lo an es de 32 bi s con espec o al mismo modelo cuan izado con FP16, mejo ando no ablemen e la elocidad de la in e encia y sac i icando muy poca p ecisión en los esul ados inales. És o es un concep o impo an e a ene en cuen a bajo el con ex o de la conducción, donde la pé dida de un poco de p ecisión puede supone alcanza una elocidad de p ocesamien o acep able. Po úl imo, emos como edes con más p ecisión como Fas e -R- CNN se quedan muy lejos del umb al de p ocesamien o en iempo eal de 20FPS, mien as que edes más lige as como SSD o SSDLi e lo supe an en casi odos los disposi i os. 81 Figu a 13.3: FPS alcanzado po ambas edes YOLO ejecu adas sob e una GPU de al o endimien o. Podemos e la g an di e encia en e ambas e siones de YOLO 3, siendo la e sión YOLO 3 Tiny casi 5 eces más ápida a cambio de sac i ica algo de p ecisión, como hemos is o en los esul ados. De nue o ecalca que la in e encia de es as dos edes se ha ealizado en una GPU de al o endimien o, así que los FPS no debe ían compa a se con el es o de edes. 13.3. In e cambio elocidad-consumo Debido a que una de las a iables c í icas a conside a en la conducción au ónoma es la au onomía del ehículo, amos a compa a los FPS ob enidos po cada ed eniendo en cuen a el consumo de los di e en es disposi i os ha dwa e, pa a ob ene así un a io de es a elocidad-consumo. 82 Figu a 13.4: Compa ación de los FPS po a io de las dis in as edes a endiendo a los consumos medios de los dis in os disposi i os ha dwa e. Vemos, como e a de espe a , cómo el disposi i o My iad des aca po su g an endimien o. Es e disposi i o es á diseñado pa a la ejecución de edes neu onales de mane a e icien e o eciendo un consumo muy bajo, de an solo 1W, y podemos ap ecia como cumple su come ido en la g á ica an e io . Es e ipo de disposi i os es muy in e esan e pa a el pun o de is a de la conducción, pudiendo se la in e encia en pa alelo una buena opción pa a log a una elocidad de in e encia acep able man eniendo un consumo bajo. Vamos a compa a es e a io de FPS/W ob enido po las 5 edes in en ando que la compa ación sea lo más álida posible. Pa a ello amos a los esul ados ob enidos po las edes SSD, SSD Li e y Fas e R-CNN al ejecu a la in e encia sob e la GPU in eg ada de bajo consumo y po las edes YOLO 3 y YOLO 3 Tiny sob e la GPU de al o endimien o. Recalca que no son el mismo disposi i o, pe o en ambos casos se a a de una GPU po lo que la es uc u a y p ocesamien o son simila es. 83 Figu a 13.5: Compa ación del a io elocidad/po encia (FPS/W) al ealiza in e encia con las dis in as edes, en el caso de SSD, SSDLi e y Fas e R-CNN sob e una GPU in eg ada de bajo consumo(15W) y en el caso de YOLO 3 y YOLO 3 Tiny sob e una GPU de al o endimien o (165W). Es a g á ica nos mues a cómo la es uc u a de ed neu onal YOLO 3 Tiny sigue siendo la que o ece mejo a io elocidad-consumo y, como hemos is o an e io men e, siendo ambién una de las que mejo es esul ados en cuan o a p ecisión se e ie e. 14. Conclusiones Es e p oyec o enía p incipalmen e dos obje i os que se desc i os al comienzo de la me- mo ia: Reen enamien o de una ed gene alis a pa a ap ende a iden i ica ehículos, pea- ones y ciclis as. Es udio del endimien o de la in e encia ealizada po la ed een enada en é mi- nos de p ecisión, elocidad de in e encia y consumo sob e un conjun o de disposi- i os ha dwa e. Pa a esponde a la p ime a p egun a nos cen amos en el es udio de las dis in as solucio- nes so wa e que nos pe mi en p ocesa las imágenes en iempo eal, usando de es a o ma amewo ks conocidos en el campo de la de ección de obje os como Da kne , Open ino y Tenso low. Es os amewo ks nos han pe mi ido een ena edes neu onales de p o- pósi o gene alis a pa a ap ende a iden i ica ehículos, pea ones y ciclis as. En conc e o se han abajado con las siguien es edes: 1. SSD Incep ion V2 2. SSD Mobile Li e 84 3. Fas e R-CNN 4. YOLO 3 5. YOLO 3 Tiny El een enamien o se ha ealizado sob e el conjun o de da os KITTI y o o conjun o de da os que consis e en la ampliación del conjun o de da os KITTI con algunas imágenes de los conjun os Tshingua-Daimle y Be keley Deepd i e Da ase . En la sección 11 se han analizado los esul ados ob enidos du an e los een enamien os de las dis in as edes. A pa i de ellos deducimos que al amplia el conjun o de da os inicial con una mayo a iedad de cajas delimi ado as di icul a el ap endizaje de la ed, lo cual podemos e e lejado en una unción de pé dida más ines able y que dec ece más len amen e. En cuan o a los esul ados inales ealizados sob e el conjun o de alidación, deducimos que no se consigue un mejo endimien o aumen ando el conjun o de en enamien o, ya que odas las edes han is o educido no ablemen e su p ecisión. En pa icula , si se quie e aumen a el conjun o de en enamien o, es e aumen o debe se con imágenes muy simila es a las del conjun o de es . En es e caso, los conjun os de da os omados son imágenes omadas desde un ehículo, odas de día y en condiciones a o ables. Sin emba go, hay dispa idades impo an es en- e los conjun os de da os. KITTI es un conjun o de imágenes pano ámicas, po an o el ancho es 4 eces el al o de la imagen. Es a di e encia es c ucial a la ho a de edimensiona imágenes como se hace en las edes SSD Incep ion V2 y SSD Mobile Li e en las que se edimensiona a unas dimensiones ijas de 300x300, con la consecuencia de que los obje os con poca anchu a inicial pueden llega a se impe cep ibles. Po o o lado, Be keley Deepd i e Da ase cuen a con obje os con una supe icie más educida que en el KITTI. Es o se debe a que las imágenes de es e conjun o e ique an odos los obje os isibles en la imagen, incluso algunos an en el ondo de la imagen que su supe icie es meno a 20 píxeles. Po an o, en las edes donde se p oduce un edimensionamien o, se educen las dimensiones de las imágenes, p o ocando que es os obje os pasan a ene una supe icie mínima. De es a mane a es muy complicado que los de ec o es de obje os puedan iden i ica los en la imagen. Además el amaño de los ancho s no ha sido modi icado pa a adap a lo a las peculia idades del conjun o de da os, siendo una di icul ad más añadida. En cuan o al segundo obje i o, en la secciones 12 y 13 se han compa ado la p ecisión, consumo y elocidad de in e encia de las edes sob e ambos conjun os de da os y sob e es disposi i os en el caso de las edes SSD Incep ion V2, SSD Mobile Li e y Fas e R-CNN: CPU 85 GPU in eg ada de bajo consumo My iad y en el caso de las edes YOLO 3 y YOLO 3 Tiny sob e una GPU de al o endimien o. Los esul ados de e minan que las mejo es edes pa a log a el obje i o de la conducción au ónoma eniendo en cuen a la p ecisión son YOLO 3 y YOLO 3 Tiny. Ambas edes o ecen una p ecisión po clase no ablemen e supe io al es o de edes es udiadas. O o aspec o i al en el con ex o de la conducción au ónoma es la elocidad de in e encia, en ese caso YOLO 3 Tiny es has a cinco eces mas ápida que YOLO 3. No se han podido ejecu a és as edes en los mismos disposi i os que el es o. Sin emba go, como podemos ap ecia en la g á ica compa a i a 13.5, e aluando el in e cambio elocidad de p ocesamien o-consumo medido sob e dos a qui ec u as simila es, en es e caso ambas GPUs, podemos e cómo igualmen e siguen siendo más p ome edo as que el es o de edes. Además de la elocidad de in e encia, la au onomía del ehículo es c ucial en la con- ducción au ónoma y, po an o, el consumo de los dis in os disposi i os e aluados. En la sección 13.3 se ha analizado el consumo de los disposi i os y los modelos ejecu ados bajo los mismos. Pa a pode e alua conjun amen e el endimien o de un modelo y la e iciencia del disposi i o ha dwa e sob e el que se ha ejecu ado, se ha de inido la mé i- ca FPS/W que elaciona elocidad de in e encia con consumo. El esul ado es que los modelos que ienen una a qui ec u a de una ase, es deci , las edes SSD y YOLO, son mas e icien es en é minos de elocidad/consumo. Es a conclusión es na u al eniendo en cuen a la baja elocidad de in e encia de Fas e R-CNN en compa ación con el es o. Cen ándonos en los disposi i os ha dwa e, hay uno que esal a po encima del es o, y és e es My iad. És e disposi i o diseñado pa a ealiza in e encia de edes neu onales de mane a óp ima o ece un consumo mínimo, en conc e o de 1W, y po an o es el disposi- i o mas e icien e en é minos de elocidad/consumo. Es no able cómo a pesa de su bajo consumo, llega a ealiza in e encia en iempo eal las edes SSD Incep ion V2 y SSD Mobile Li e. La GPU in eg ada con p ecisión FP16 o ece unas elocidades de in e encia acep ables bajo un consumo de 15W, siendo po an o la GPU de al o endimien o y la CPU los disposi i os menos e icien es, po su consumo ele ado, especialmen e en el p ime caso; y po no es a especializada en es as a eas en el caso de la CPU. Como conclusión inal, después del es udio y compa aciones ealizadas, la a qui ec u a o modelo de de ección de obje os de en e odas las analizadas en el es ado del a e es, sin duda, YOLO 3 Tiny, o eciendo una elocidad de in e encia muy no able y supe ando en p ecisión al es o, llegando a alcanza sin p oblemas el p ocesamien o en iempo eal. 86 14.1. Fu u os pasos Es e p oyec o es á basado en un campo de in es igación que es á en pleno lo ecimien o. Debido a es o, hay muchas posibles ideas a p oba con el obje i o de con inua es a in- es igación. Una opción es abaja con conjun os de da os mas mode nos que con engan imágenes en 3D, además de in o mación de senso es como LIDAR en e o os. Es a in o mación puede mejo a eno memen e la p ecisión log ada con imágenes en 2D, aunque p obablemen e enga una elocidad de in e encia meno . Es udia como equilib a cuan a in o mación inco po a al modelo de o ma que no sea pe judicial en é minos de elocidad de in e- encia y consumo es una posible línea de in es igación. O a opción es abaja con edes mas mode nas, como puede se YOLOV4 [8] publicada en es e año. Es as edes son el es ado del a e en es e campo, y po an o conoce a ondo su uncionamien o e in es iga como pode inco po a las o c ea e siones educidas es o a posible línea de in es igación. Finalmen e, o a posible línea de in es igación se ía la de usa un mayo núme o de disposi i os My iad pa a ealiza in e encia en pa alelo, con la inalidad de mejo a la elocidad de in e encia con espec o a un solo My iad al meno cos e posible, es deci , con o o My iad. 87 CLOSURE This p ojec had wo main objec i es which we e se a he beginning o he epo . The aim was o answe he ollowing wo ques ions: Fine- uning o a gene alis ne wo k in o de o lea n how o iden i y ehicles, pe- des ians and cyclis s. Pe omance analysis o he in e ence in e ms o p ecision, in e ence speed and powe consump ion o he ine- uned ne wo k o e a se o ha dwa e de ices. To add ess he i s ques ion we ocused on he s udy o di e en so wa e solu ions ha allowed us o p ocess he images in eal ime, using well known amewo ks in he ield o objec de ec ion as Da kne , Open ino and Tenso low. These amewo ks ha e allowed us o ine- une gene alis neu al ne wo ks o lea n how o iden i y ehicles, pedes ians and cyclis s. In pa icula , we ha e wo ked wi h he ollowing ne wo ks: 1. SSD Incep ion V2 2. SSD Mobile Li e 3. Fas e R-CNN 4. YOLO 3 5. YOLO 3 Tiny The ine- uning has been done on he KITTI da ase and ano he da ase consis ing o he ex ension o he KITTI da ase wi h some images om he Tshingua-Daimle and Be keley Deepd i e Da ase se s. In sec ion 11 we ha e analysed he esul s ob ained du ing he ine- uning o he di e en ne wo ks, om which we deduce ha ex ending he ini ial da ase wi h a highe a ie y o bounding boxes makes i di icul o lea n he ne wo k, which can be seen in a mo e uns able and slowly dec easing loss unc ion. As o he inal esul s o e he alida ion se , we deduce ha a be e pe o mance is no achie ed by inc easing he aining se , since all he ne wo ks ha e seen hei accu acy educed signi ican ly. In pa icula , i he aining se is o be inc eased, his inc ease mus be wi h images e y simila o hose o he es se . In his case, he da ase s consis o images aken om a ehicle, all du ing he day and unde a ou able condi ions. Howe e , he e a e signi ican dispa i ies be ween he da a se s. KITTI is a se o pano amic images, he e o e he wid h is 4 imes he heigh o he image. This di e ence is c ucial when esizing images as is done in he SSD Incep ion V2 and SSD Mobile Li e ne wo ks whe e he image is esized o a ixed dimension o 300x300, wi h he consequence ha objec s wi h a small ini ial wid h can become impe cep ible. 88 On he o he hand, Be keley Deepd i e Da ase has objec s wi h a smalle su ace a ea han in he KITTI. This is due o he ac ha he labels in his se consis o all he objec s isible in he image, e en some so a back in he image ha hei su ace a ea is less han 20 pixels. The e o e, in ne wo ks whe e esizing occu s, he dimensions o he images a e educed, causing hese objec s o ha e a minimum su ace a ea. This makes i e y di icul o objec de ec o s o iden i y hem in he image. Mo eo e , he size o he ancho s has no been modi ied o adap i o he peculia i ies o he da a se , being an addi ional di icul y. As o he second objec i e, in he sec ions ?? and ?? we ha e compa ed he accu acy, consump ion and in e ence speed o he ne wo ks on bo h da ase s and on h ee de ices in he case o he SSD Incep ion V2, SSD Mobile Li e and Fas e R-CNN ne wo ks: CPU In eg a ed low-powe GPU My iad and in he case o YOLO 3 and YOLO 3 Tiny ne wo ks on a high pe o mance GPU. The esul s de e mine ha he bes ne wo ks o achie e he goal o au onomous d i ing wi h ega d o accu acy a e YOLO 3 and YOLO 3 Tiny. Bo h ne wo ks o e signi i- can ly be e accu acy pe class han he o he ne wo ks s udied. Ano he i al aspec in he con ex o au onomous d i ing is he in e ence speed. In his case YOLO 3 Tiny is up o i e imes as e han YOLO 3. These ne wo ks ha e no been able o un on he same de ices as he es . Howe e , as we can see in he compa a i e g aph ??, e alua ing he exchange o p ocessing-consump ion speed measu ed on wo simila a chi ec u es, in his case bo h GPUs, we can see how hey con inue o be mo e p omising han he es o he ne wo ks. In addi ion o he in e ence speed, he ehicle au onomy is c ucial in au onomous d i ing and, he e o e, he consump ion o he di e en de ices e alua ed. The consump ion o he de ices and he models execu ed unde hem ha e been analysed in he sec ion çon- sump ion". In o de o join ly e alua e he pe o mance o a model and he e iciency o he ha dwa e de ice on which i has been execu ed, he FPS/W me ic has been de ined, which ela es in e ence speed wi h consump ion. The esul is ha models ha ha e a one phase a chi ec u e, i.e. SSD and YOLO ne wo ks, a e mo e e icien in e ms o spee- d/consump ion. This conclusion is na u al conside ing he low in e ence speed o Fas e R-CNN compa ed o he es . Focusing on he ha dwa e de ices, he e is one ha s ands ou om he es , and ha is My iad. This de ice designed o pe o m neu al ne wo k in e ence in an op imal way o e s a minimum consump ion, speci ically 1W, and he e o e is he mos e icien de ice 89