scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

El procesado automático de imágenes y secuencias de imágenes es una necesidad que aparece por la gran cantidad de información que se puede recopilar actualmente en forma de imágenes y vídeos. El tratamiento manual de tal cantidad de información resulta imposible. Este trabajo se centra en la detección y clasificación de objetos y/o regiones de interés en secuencias de imágenes tomadas en ambientes de interior. La idea es que el procesado de las secuencias se realice de manera semiautomática, el usuario solo actúa sobre la primera imagen de la secuencia, procesándose las demás de un modo autónomo.\\ En particular, este trabajo se centra en el procesado automático de secuencias de interiores adquiridas por un robot móvil. En este entorno, el tipo de regiones y objetos que vamos a detectar son: regiones características principales para la navegación en secuencias de interior, como suelo, pared y techo; objetos importantes para la navegación, como puertas; el resto de objetos que pertenezcan a otras clases han sido asociados a un grupo genérico.\\ Para el procesamiento automático de una secuencia, se han desarrollado los siguientes módulos partiendo de un proceso base inicial, respecto del cual todos los pasos han sido rediseñados para mejorar los resultados: Segmentación de las imágenes; descripción de cada segmento; estudio de posibles descriptores de las características de cada uno de los segmentos que forman la imagen. Los descriptores se pueden dividir en cuatro grandes grupos: de color, textura, forma y posición; modelado de las regiones a detectar; cada uno de los segmentos que forman la imagen es comparado con los grupos que componen el modelo y se estima la probabilidad que tiene cada segmento de pertenecer a cada una de las regiones u objetos a detectar. Finalmente, el procesado de cada fotograma, incluye un filtrado que tiene en cuenta tanto la probabilidad de cada segmento de pertenecer a un objeto/región como la relación de el segmento con los segmentos vecinos. Rituerto Sin, Jorge; Murillo Arnal, Ana Cristina

Full text

Reconocimiento autom´atico de ´areas de inter´es en secuencias de interiores Jorge Rituerto Sin Directora: Ana Cristina Murillo Arnal Ingenier´ıa Industrial Automatizaci´on Industrial y Rob´otica Departamento de Inform´atica e Ingenier´ıa de Sistemas Centro Polit´ecnico Superior Universidad de Zaragoza Febrero 2011 Resumen El procesado autom´atico de im´agenes y secuencias de im´agenes es una necesidad que aparece por la gran cantidad de informaci´on que se puede recopilar actualmente en forma de im´agenes y v´ıdeos. El tratamiento manual de tal cantidad de informaci´on resulta imposible. Este trabajo se centra en la detecci´on y clasificaci´on de objetos y/o regiones de inter´es en secuencias de im´agenes tomadas en ambientes de interior. La idea es que el procesado de las secuencias se realice de manera semiautom´atica, el usuario solo act´ua sobre la primera imagen de la secuencia, proces´andose las dem´as de un modo aut´onomo. En particular, este trabajo se centra en el procesado autom´atico de secuencias de interiores adquiridas por un robot m´ovil. En este entorno, el tipo de regiones y objetos que vamos a detectar son: regiones caracter´ısticas principales para la navegaci´on en secuencias de interior, como suelo, pared y techo; objetos importantes para la navegaci´on, como puertas; el resto de objetos que pertenezcan a otras clases han sido asociados a un grupo gen´erico. Para el procesamiento autom´atico de una secuencia, se han desarrollado los siguientes m´odulos partiendo de un proceso base inicial, respecto del cual todos los pasos han sido redise˜nados para mejorar los resultados: - Segmentaci´on de las im´agenes. Las im´agenes que forman la secuencia son segmentadas en conjuntos de p´ıxeles con caracter´ısticas similares, los cuales son llamados superpixels. Se han estudiado distintos m´etodos de segmentaci´on de im´agenes. Se ha desarrollado e implementado un m´etodo de evaluaci´on y comparaci´on entre las im´agenes segmentadas mediante cada uno de los m´etodos, y se ha elegido el m´as adecuado. - Descripci´on de cada segmento. Se ha realizado un estudio de posibles descriptores de las caracter´ısticas de cada uno de los segmentos que forman la imagen. Los descriptores se pueden dividir en cuatro grandes grupos: de color, textura, forma y posici´on. - Modelado de las regiones a detectar. Se ha dise˜nado un modelo del entorno, el cual se inicializa utilizando los descriptores de unas cuantas regiones identificadas a mano en el primer fotograma de la secuencia, y se va actualizando autom´aticamente con las medidas que se obtienen de los siguientes fotogramas. - Cada uno de los segmentos que forman la imagen es comparado con los grupos que componen el modelo y se estima la probabilidad que tiene cada segmento de pertenecer a cada una de las regiones u objetos a detectar. Finalmente, el procesado de cada fotograma, incluye un filtrado que tiene en cuenta tanto la probabilidad de cada segmento de pertenecer a un objeto/regi´on como la relaci´on de el segmento con los segmentos vecinos. i ii ´ Indice Resumen i ´ Indice ii 1 Introducci´on 1 1.1 Objetivos ............................... 1 1.2 Trabajoprevio ............................ 2 1.3 Proceso de reconocimiento dise˜nado . . . . . . . . . . . . . . . . 3 2 Representaci´on de las im´agenes 5 2.1 Segmentaci´on de la imagen. Superpixels .............. 5 2.1.1 M´etodos de segmentaci´on basados en superpixels ..... 5 2.1.2 Comparaci´on de los distintos m´etodos de segmentaci´on . 6 2.2 Descriptores.............................. 8 3 Modelado y reconocimiento 11 3.1 Inicializaci´on del modelo del entorno . . . . . . . . . . . . . . . . 11 3.1.1 M´etodo1 ........................... 13 3.1.2 M´etodo2 ........................... 13 3.1.3 M´etodo3 ........................... 13 3.2 Relaci´on imagen-modelo . . . . . . . . . . . . . . . . . . . . . . . 14 3.2.1 An´alisis individual de cada superpixel: distancias superpixel-modelo.......................... 14 3.2.2 An´alisis de cada imagen en conjunto: optimizaci´on de las asignaciones a cada superpixel. . . . . . . . . . . . . . . . 16 3.3 Actualizaci´on del modelo . . . . . . . . . . . . . . . . . . . . . . 17 3.3.1 Criterios para establecer correspondencias entre superpixels 18 3.4 M´etodo de actualizaci´on . . . . . . . . . . . . . . . . . . . . . . . 19 3.4.1 Creaci´on de nuevos clusters ................. 20 4 Experimentos 21 4.1 M´etodos de evaluaci´on . . . . . . . . . . . . . . . . . . . . . . . . 21 4.2 Evaluaci´on del proceso de actualizaci´on . . . . . . . . . . . . . . 21 4.3 Evaluaci´on las distancias superpixel-modelo . . . . . . . . . . . . 23 4.4 Comparaci´on de resultados seg´un el tama˜no de los superpixels . . 26 4.5 Configuraci´on final propuesta . . . . . . . . . . . . . . . . . . . . 28 iii iv ´ INDICE 5 Conclusiones 37 5.1 Conclusiones personales . . . . . . . . . . . . . . . . . . . . . . . 37 5.2 Conclusiones trabajo . . . . . . . . . . . . . . . . . . . . . . . . . 37 5.3 TrabajoFuturo............................ 38 Anexos 40 A Comparaci´on del tama˜no de los superpixels 41 B Descriptores 45 B.1 Descriptores de color . . . . . . . . . . . . . . . . . . . . . . . . . 45 B.2 Descriptores de textura . . . . . . . . . . . . . . . . . . . . . . . 48 B.3 Descriptores de forma . . . . . . . . . . . . . . . . . . . . . . . . 50 B.4 Descriptores de posici´on . . . . . . . . . . . . . . . . . . . . . . . 51 C C´odigos de cadena 53 D Distancia EMD entre histogramas 57 E CD-ROM 61 Bibliograf´ıa 63 Cap´ıtulo 1 Introducci´on Actualmente, es muy com´un conseguir acceso o adquirir grandes galer´ıas de im´agenes y v´ıdeos, los cuales es pr´acticamente imposible procesar de manera manual. Este hecho lleva consigo la necesidad del procesamiento e interpretaci´on de la informaci´on capturada en im´agenes y v´ıdeos de un modo lo m´as autom´atico posible. La detecci´on y clasificaci´on de objetos y/o regiones de inter´es es uno de los objetivos importantes en este ´area. En este proyecto se ha trabajado en la detecci´on/clasificaci´on de objetos y regiones presentes en secuencias de im´agenes tomadas en ambientes interiores, de manera semiautom´atica ya que la ´unica supervisi´on del usuario se lleva a cabo en la primera imagen de la secuencia. El objetivo general en nuestro trabajo es distinguir e identificar las ´areas y objetos que ocupan la mayor parte de las im´agenes (en nuestro caso suelo, pared y puertas) y agrupar en ”otros” el resto de zonas ”minoritarias” que suelen representar otro tipo de objetos mas peque˜nos. El inter´es de separar estas zonas dominantes del resto es m´ultiple. Por un lado, obtener elementos b´asicos para la navegaci´on aut´onoma de un robot y por otro lado restringir y reducir el procesado de reconocedores de muchos otros objetos mas peque˜nos. Por ejemplo, a la hora de buscar personas en las secuencias, solo habr´ıa que procesar las zonas de ”otros” y que ademas cumplan ciertas restricciones (como que las personas est´en aproximadamente en contacto con el suelo). 1.1 Objetivos Los objetivos y tareas concretos planteados en este proyecto son: •Estudio de diferentes tipos de segmentaci´on de im´agenes. Desarrollo de un m´etodo de evaluaci´on y comparaci´on para la selecci´on del m´as adecuado para las siguientes tareas a realizar con ellos. •Estudio de descriptores de los distintos segmentos en los que se divide la imagen. En primer lugar, implementar tanto descriptores conocidos de 1 2CAP´ ITULO 1. INTRODUCCI ´ ON la literatura como nuevas propuestas o adaptaciones adecuadas al tipo de im´agenes y entornos en los que vamos a trabajar. •Dise˜nar distintas medidas de similitud que permitan comparar descriptores de distintos segmentos. •Dise˜no y realizaci´on de experimentos exhaustivos con secuencias de im´agenes realistas para evaluar los descriptores y distancias. El objetivo es encontrar los que mejor discriminan entre segmentos correspondientes a los distintos conceptos, clases y objetos que se quieren reconocer o identificar en la secuencia. •Estudiar distintos tipos de t´ecnicas de clasificaci´on para reconocer y etiquetar a qu´e objeto, zona o concepto pertenecen los distintos segmentos de las im´agenes, utilizando los descriptores seleccionados. Implementar el m´etodo de clasificaci´on m´as adecuado para realizar experimentos realistas con secuencias reales de entornos de interior y evaluar la correcci´on de los resultados de reconocimiento. •Documentar los estudios, el c´odigo implementado y experimentos realizados, los cuales, si son satisfactorios se redactar´an en forma de art´ıculo de investigaci´on. 1.2 Trabajo previo En el campo de la rob´otica, se han obtenido resultados muy interesantes en los ´ultimos a˜nos respecto a la clasificaci´on y reconocimiento autom´atico de lugares, utilizando distintos tipos de sensores [1], [2]. M´as recientemente, ha surgido el inter´es de aumentar la representaci´on que los robots aut´onomos tienen de su entorno (mapas) con informaci´on sem´antica para facilitar la autonom´ıa de los sistemas y la interacci´on humano-robot. El problema ha sido tratado desde diferentes puntos de vista. En [3] los autores abordan el problema de la obtenci´on de un modelo del entorno defini´endolo con representaciones de objetos de las clases predefinidas (puertas, paredes) dado un rango de datos e im´agenes a color de una c´amara omnidireccional. En [4] los autores recurren a redes de Markov para clasificar im´agenes segmentadas. Las regiones del entorno son clasificadas como pared, puerta y otros, bas´andose en datos adquiridos por l´aser. M´as recientemente, en el contexto de las t´ecnicas de etiquetado denso de las im´agenes, se han obtenido muy buenos resultados integrando varios sensores tanto visuales como l´aser, para el reconocimiento de objetos y regiones [5], [6]. Tambi´en ha aumentado el inter´es en procesar secuencias de im´agenes, ya que en los ´ambitos de rob´otica es la manera natural de obtener la informaci´on. Esto implica un procesado de la informaci´on conforme va llegando, lo cual sugiere construir modelos que se adapten con el tiempo y aprovechen una serie de restricciones temporales. Por ejemplo en [7] se propone un modelo que se va actualizando conforme el veh´ıculo avanza para clasificaciones de carretera/no carretera utilizando informaci´on visual. En [8] se presenta un modelo para reconocer objetos que se puede ir actualizando on-line, tambi´en a partir de informaci´on visual. Por otro lado, encontramos otro grupo de trabajos sobre segmentaci´on de im´agenes 1.3. PROCESO DE RECONOCIMIENTO DISE ˜ NADO 3 en visi´on por computador muy relacionados con nuestros objetivos. Se han propuesto distintas t´ecnicas de segmentaci´on de im´agenes que permiten reducir el numero de elementos a procesar (en vez de cada p´ıxel, se trabaja con cada segmento) y facilitan el poder tener un resultado final en el que se clasifiquen de manera densa todos los p´ıxeles sin un coste computacional demasiado alto [9], [10]. 1.3 Proceso de reconocimiento dise˜nado En esta secci´on se resumen todos los pasos del proceso dise˜nado. En la Figura 1.1 se puede ver un diagrama del proceso propuesto de reconocimiento de ´areas de inter´es en secuencias. El primer paso es la inicializaci´on de un modelo del entorno que queremos reconocer/interpretar, a partir de la primera imagen de la secuencia. La imagen se carga, tras lo cual se segmenta tal y como se explica en la secci´on 2.1. Las propiedades de cada segmento de la imagen son caracterizadas por medio de los descriptores, los cuales est´an detallados en la secci´on 2.2. Tras esto, los segmentos son agrupados seg´un sus caracter´ısticas, el usuario realiza un etiquetado manual de inicializaci´on y se crea el modelo del entorno tal y como se expone en la secci´on 3.1. Una vez se ha generado el modelo a partir de la primera imagen y el etiquetado manual de ejemplo en ella, para conseguir un etiquetado denso de todas las zonas de la primera imagen, se realiza una comparaci´on de los segmentos de la imagen con los grupos del modelo y se estima la probabilidad de cada segmento de pertenecer a cada uno tal y como se explica en la secci´on 3.2. Finalmente, una vez que hemos clasificado los elementos de una imagen seg´un el modelo que tenemos, aplicamos un modelo gr´afico que tiene en cuenta las distintas conexiones entre segmentos contiguos en la imagen para optimizar la clasificaci´on o etiquetado de todas las partes de la imagen en bloque. El modelo gr´afico que utilizamos son los ”Markov Random Fields” (MRF), que se detallan en la secci´on 3.2.2, tras el cual se obtiene la primera imagen de la secuencia etiquetada completamente (todos los p´ıxeles). Una vez que hemos procesado por completo el primer fotograma de la secuencia, se pasa a procesar los siguientes fotogramas. Los pasos para procesar cada uno son parecidos a los del primero, pero sin necesidad ya de ning´un etiquetado manual: se carga la imagen, se segmenta, se calculan los descriptores de cada segmento y se asignan las probabilidades de cada segmento de pertenecer a cada una de las clases que estamos analizando. Esta asignaci´on, al igual que antes, se hace en un primer paso que depende del modelo y un segundo paso que intenta optimizar globalmente todas las asignaciones en la imagen. El paso nuevo en todos los frames a partir de ahora es la actualizaci´on del modelo con las caracter´ısticas de los segmentos una vez clasificados, lo cual est´a detallado en la secci´on 3.3. 10 CAP´ ITULO 2. REPRESENTACI ´ ON DE LAS IM ´ AGENES Cap´ıtulo 3 Modelado y reconocimiento de los objetos y ´areas de inter´es Con el fin de reconocer objetos y regiones de inter´es en los distintos fotogramas de una secuencia, es necesario definir de alguna manera las caracter´ısticas que las identifiquen y diferencien unas de otras. Este cap´ıtulo describe el proceso dise˜nado e implementado para interpretar autom´aticamente el contenido de una secuencia. Partiendo de los superpixels y sus descriptores, el primer objetivo es crear un modelo que almacene los descriptores t´ıpicos de las distintas regiones que aparecen en la secuencia [17]. La manera de inicializar este modelo es mediante el etiquetado manual hecho por el usuario, el cual debe se˜nalar, en el primer fotograma de la secuencia, los objetos y regiones caracter´ısticas que son de inter´es a lo largo del v´ıdeo. A partir de este etiquetado manual de la primera imagen, se crea un modelo estad´ıstico que sirve de relaci´on entre los descriptores de los segmentos de la imagen y los conceptos que se quiere identificar. El modelo representa las clases t´ıpicas de superpixels. Cada una de estas ”clases” ser´a un grupo o cluster del modelo. Cada cluster tendr´a una probabilidad de pertenecer a cada uno de los objetos o ´areas a reconocer. 3.1 Inicializaci´on del modelo del entorno El primer paso es agrupar los superpixels que componen la primera imagen en grupos, que llamaremos clusters, del modelo. Para realizar este agrupamiento se utiliza el algoritmo de clustering k-means con los descriptores de los superpixels de esta imagen. Cada cluster tiene asociadas las caracter´ısticas de los superpixels que lo componen, que definir´an las caracter´ısticas del propio cluster. En este caso se definen los descriptores de un cluster como la media de los descriptores de los superpixels que lo forman. Adem´as de esto, cada cluster almacenar´a el n´umero de superpixels que lo forman, as´ı como el ´area total de los mismos. El conjunto de clusters obtenido van a componer el modelo inicial. Una vez creados los clusters del modelo, hay que estimar las probabilidades 11 12 CAP´ ITULO 3. MODELADO Y RECONOCIMIENTO 1 descriptores del cluster 1 n´umero total en 1 ´areas de 1 2 descriptores del cluster 2 n´umero total en 2 ´areas de 2 ... ... ... ... N descriptores del cluster N n´umero en N ´areas de N Tabla 3.1: Estructura del modelo del entorno Figura 3.1: Primer fotograma de una secuencia con etiquetas de referencia asignadas por el usuario. Azul = pared/techo; Verde = suelo; Rojo = puertas; Amarillo = otros de cada cluster de pertenecer a cada una de las etiquetas que se quieren identificar a lo largo de la secuencia. Para ello es necesario haber realizado un etiquetado manual de algunos ejemplos en el primer fotograma de la secuencia, donde el usuario indica qu´e regiones quiere identificar (Figura 3.1). Cada cluster del modelo tendr´a asociado un vector de probabilidades P. P(Cj|E1) Pj=P(Cj|E2) ... P(Cj|EL) (3.1) La probabilidad de que un superpixel que pertenece al cluster Cjcorresponda a una determinada etiqueta Elviene dada por el n´umero de superpixels con clase asignada/conocida que haya en ese cluster. En base a esto se han implementado 3.1. INICIALIZACI ´ ON DEL MODELO DEL ENTORNO 13 tres m´etodos distintos para estimar dichas probabilidades. En todos ellos, como se ver´a mas adelante, se intenta evitar que se asignen probabilidades de 0% o 100% a ninguna clase, de manera ”preventiva”, ya que nunca se sabe qu´e m´as queda en la secuencia que pueda pertenecer a cierto cluster. 3.1.1 M´etodo 1: asignaci´on de probabilidades a cada cluster seg´un el n´umero de elementos etiquetados. Como se ha comentado anteriormente, cada cluster almacena, adem´as de la informaci´on de los descriptores, el n´umero de superpixels que contiene. La probabilidad de que los superpixels de un cluster j pertenezcan a la regi´on etiquetada como kviene dada por P(Cj|Ek) = PNjk PNj (3.2) Siendo Njk los superpixels pertenecientes al cluster jetiquetados con la etiqueta kyNilos superpixels almacenados en el cluster j (incluidos 4 superpixels ”virtuales”). Se aumenta en un superpixel ”virtual” cada una de las etiquetas para evitar probabilidades iguales a 0% o a 100% ya que as´ı Njk ser´a al menos 1 para todo ky nunca ser´a Njk =Nj. Uno de los principales problemas de este m´etodo es que, si un cluster tiene almacenados muchos superpixels peque˜nos etiquetados como Ay uno solo grande etiquetado como B, la probabilidad global del cluster ser´a mayor para la etiqueta A, generando un error en los superpixels parecidos al de etiqueta B. 3.1.2 M´etodo 2: asignaci´on de probabilidades a cada cluster ponderada por ´areas. Cada cluster almacena el ´area total de los superpixels que los forman. La probabilidad de que los superpixels de un cluster jpertenezcan a la regi´on etiquetada como kviene dada por P(Cj|Ek) = PAjk PAj (3.3) Donde Ajk es el ´area de los superpixels pertenecientes al cluster j etiquetados como kyAjes el ´area de los superpixels almacenados en el cluster j. Se a˜nade un el ´area media de los superpixels de la imagen por cada una de las etiquetas para evitar probabilidades iguales a 0% o a 100%. El problema de este m´etodo viene dado, al contrario que el anterior, por no tener en cuenta la informaci´on sobre el n´umero de superpixels etiquetados. 3.1.3 M´etodo 3: asignaci´on de probabilidades a cada cluster ponderada por ´areas y cantidad de superpixels en cada uno. Como consecuencia a los problemas encontrados en los m´etodos anteriores, este ´ultimo m´etodo tiene en cuenta la informaci´on correspondiente al n´umero de 14 CAP´ ITULO 3. MODELADO Y RECONOCIMIENTO superpixels etiquetados, as´ı como las ´areas de los mismos. En este caso, la probabilidad de que los superpixels de un cluster j pertenezcan a la regi´on etiquetada como kviene dada por P(Cj|Ek) = PNjk ∗PAjk PNj∗PAj (3.4) Se a˜nade el ´area media de los superpixels de la imagen por cada una de las etiquetas para evitar probabilidades iguales a 0% o a 100%. 3.2 Relaci´on entre una imagen y el modelo del entorno Una vez inicializado el modelo, se pasa al procesado de los siguientes fotogramas de la secuencia. El objetivo es el c´alculo de un vector de probabilidades P(Si|Ek) que represente la probabilidad de que el superpixel i pertenezca a cada una de las ketiquetas a identificar. Se busca relacionar cada superpixel de la nueva imagen con los ”tipos” de superpixel del modelo. Esto puede ser definido como un problema de clasificaci´on. Hay varios tipos de superpixel y se quiere ver la probabilidad de los nuevos superpixels de pertenecer a cada uno y clasificarlos como la clase o etiqueta del m´as probable. Para ello se establece una medida basada en la distancia de cada superpixel con los clusters del modelo. Se han implementado y comparado tres m´etodos distintos, que se detallan en el apartado 3.2.1. Esta medida permite estimar la probabilidad de cada superpixel de manera individual de pertenecer a cada clase. Sin embargo, en la asignaci´on final, teniendo en cuenta que en una escena real los superpixels tender´an a pertenecer al mismo objeto que sus vecinos, se aplica una optimizaci´on de las asignaciones en conjunto a todos los superpixels de una imagen, mediante un modelo grafico que optimiza los costes de hacer unas u otras asignaciones, seg´un las probabilidades individuales de cada superpixel y seg´un la consistencia respecto a los ”vecinos” (apartado 3.2.2). 3.2.1 An´alisis individual de cada superpixel: distancias superpixel-modelo. Se han implementado tres m´etodos para medir la semejanza entre cada superpixel, de manera individual, y los clusters del modelo del entorno. El primer paso de cada uno de ellos consiste en calcular la distancia Eucl´ıdea (todos los componentes del vector de descriptores est´an normalizados entre 0-1) entre el vector de descriptores del superpixel i y los vectores de descriptores de todos los clusters del modelo. A continuaci´on, hay que decidir a qu´e clusters del modelo se parece m´as el superpixel evaluado, y para asignar finalmente al superpixel un vector de probabilidades Pide pertenecer a los distintos objetos o clases a reconocer. Como acabamos de mencionar, los tres m´etodos est´an basados en el c´alculo de la distancia Eucl´ıdea dij, definida en la ecuaci´on 3.5. dij =v u u t M X k=1 (mi(k)−mj(k))2(3.5) 3.2. RELACI ´ ON IMAGEN-MODELO 15 Figura 3.2: Representaci´on gr´afica del funcionamiento de los m´etodos 1 y 2, utilizando el m´etodo 1 la distancia Eucl´ıdea y el m´etodo 2 la exponencial de la distancia Eucl´ıdea Donde dij es la distancia Eucl´ıdea entre el vector de descriptores del superpixel i y el vector de descriptores del cluster j, M es el n´umero de descriptores utilizados por cada superpixel,mi(k) es el descriptor kdel superpixel i ymj(k) es el descriptor kdel cluster j. A partir de la ecuaci´on 3.5, se define el vector de distancias Eucl´ıdeas entre un superpixel y los clusters del modelo en la ecuaci´on 3.6 di= [di1;di2;...;diN ] (3.6) Donde dies el vector de distancias Eucl´ıdeas entre el superpixel i y los N clusters del modelo. 1. Asignaci´on directa o simple Se considera que el superpixel i pertenece al cluster j cuya distancia Eucl´ıdea con ies la menor de todas. Por lo tanto, el vector de probabilidades del cluster es asignado directamente al superpixel, as´ı que para cada posible clase o etiqueta k, la probabilidad del superpixel i ser´a: P(Si|Ek) = P(Cj|Ek),donde iyjcumplen que dij =min(di) (3.7) 2. Asignaci´on ponderada En este caso la probabilidad de que un superpixel pertenezca a un cluster se calcula como la exponencial de la distancia de ese superpixel a ese cluster del modelo, ponderado con la desviaci´on t´ıpica σde ese cluster y con el par´ametro δque permite mantener las probabilidades en un rango no muy peque˜no. Por lo tanto, una vez que estimamos que cluster es m´as probable de contener al superpixel, le asignamos las probabilidades de ser uno u otro objeto/etiqueta del cluster elegido: P(Si|Ek) = P(Cj|Ek)para cada una de las etiquetas k. Donde i y j (3.8) cumplen que Pijes la m´axima de las posibles, donde Pij =δ∗e −dij σ 3. Asignaci´on con V pr´oximos En este ultimo m´etodo propuesto, en vez de considerar la menor distancia a la hora de relacionar el superpixel con el modelo, se van a tener en cuenta los V clusters con distancia Eucl´ıdea menor. Cuando uno o m´as de estos V clusters seleccionados tiene una distancia Eucl´ıdea 16 CAP´ ITULO 3. MODELADO Y RECONOCIMIENTO Figura 3.3: Representaci´on del funcionamiento del m´etodo de relaci´on con V pr´oximos siendo en este caso V=3 con el superpixel evaluado mucho menor que la de los dem´as, los dem´as son descartados. A la hora del c´alculo del vector de probabilidades se pondera teniendo en cuenta la distancia a cada uno de los V clusters, de manera que cuanto m´as cercano es el cluster j al superpixel i, m´as peso tendr´a su vector de probabilidades P(Cj|Ek) en el vector resultante P(Si|Ek). P(Si|Ek) = V X j=1 (Pd−dij Pd∗P(Cj|Ek)) (3.9) donde d es la suma de las distancias de los V clusters con el superpixel evaluado. 3.2.2 An´alisis de cada imagen en conjunto: optimizaci´on de las asignaciones a cada superpixel. Con el fin de tener en cuenta las relaciones espaciales entre superpixels, el problema de clasificaci´on de los superpixels va a ser tratado en conjunto. Se busca optimizar la asignaci´on de etiquetas teniendo en cuenta la informaci´on de toda la imagen. La formulaci´on y resoluci´on de esta optimizaci´on se realiza, de la misma manera que en [18] modelando la imagen, sus superpixels y sus relaciones de adyacencia con un Markov Random Field (MRF), un modelo gr´afico no dirigido, donde cada superpixel es un nodo del diagrama, y cada relaci´on de adyacencia se representa con una conexi´on en el diagrama/grafo. Dados los vectores de probabilidades de cada uno de los superpixels que forman la imagen, este modelo gr´afico valora el coste de asignar una u otra etiqueta a cada superpixel, teniendo en cuenta las probabilidades asignadas al superpixel de manera individual y las probabilidades de los superpixels vecinos. El modelo gr´afico considera que cada superpixel es un nodo y establece las conexiones entre nodos, que corresponden a superpixels adyacentes. Se asignan unos costes individuales a cada nodo basados en el vector de probabilidades P(Si|Ek), as´ı como unos costes binarios basados en la comparaci´on con los superpixels y los vectores de probabilidades de estos ´ultimos. Una vez establecidos todos los costes, se utiliza una librer´ıa est´andar para resolver el MRF [19]. En la figura 3.4 se muestra la clasificaci´on inicial de la imagen utilizando el modelo de probabilidades asignadas de manera individual a cada superpixel (a la izquierda) y la clasificaci´on resultante despu´es de la optimizaci´on del etiquetado 3.3. ACTUALIZACI ´ ON DEL MODELO 17 (a) (b) Figura 3.4: (a) Etiquetado de la imagen sin utilizar MRF; (b) Etiquetado de la imagen utilizando MRF mediante el MRF (derecha), que resulta en un etiquetado ”suavizado”, con cambios menos bruscos. Se han establecido dos restricciones para reducir errores en el etiquetado: •Se ha establecido una l´ınea de horizonte por encima de la cual ning´un superpixel puede ser etiquetado como ”suelo”. La linea del horizonte se puede estimar mediante m´etodos est´andar para la primera imagen, y mantenerlo en la misma posici´on para el resto. En las secuencias que usamos corresponde aproximadamente a 2/3 de la altura de la imagen. •Los superpixels que est´an en contacto con el l´ımite superior de la imagen, tampoco podr´an ser etiquetados como ”suelo”. 3.3 Actualizaci´on del modelo El avance de la secuencia conlleva determinados cambios en la posici´on y enfoque de los objetos y en la iluminaci´on del entorno (Figura 3.5) entre otros. Estos cambios hacen que sea necesaria una actualizaci´on del modelo para que el modelo se adapte al entorno cambiante. Se han implementado cuatro m´etodos de actualizaci´on de los componentes del modelo seg´un los criterios que se sigan, detallados en 3.3.1. Figura 3.5: Ejemplo de variaci´on de iluminaci´on entre dos im´agenes consecutivas 18 CAP´ ITULO 3. MODELADO Y RECONOCIMIENTO 3.3.1 Criterios para establecer correspondencias entre superpixels Conforme vamos identificando el contenido de los superpixels de los fotogramas tenemos que decidir cu´ales son fiables para actualizar los clusters que ya existen en el modelo y sus descriptores en el modelo. Para tomar esta decisi´on hemos implementado los distintos m´etodos explicados a continuaci´on que relacionan superpixels nuevos con los que ya est´an incluidos en el modelo. Superposici´on de p´ıxeles. Al estar trabajando con secuencias de im´agenes parece razonable pensar que la probabilidad de que un p´ıxel de una imagen y el p´ıxel que se encuentra en la misma posici´on en la imagen inmediatamente posterior pertenezcan a la misma regi´on caracter´ıstica es alta. Este razonamiento puede ser ampliado a los superpixels, de forma que dados un superpixel de una imagen iy un superpixel de una imagen i+1, si su intersecci´on contiene un n´umero de p´ıxeles mayor del PX% de los p´ıxeles totales de cada superpixel, se pueden considerar coincidentes y, por tanto, la probabilidad de que el superpixel de la imagen i+1 pertenezca al mismo objeto o regi´on que el de la imagen iser´a alta. Siguiendo este criterio, el cluster al que pertenece el superpixel iser´a actualizado por los descriptores del superpixel i+1. Se han realizado pruebas para valores de PX entre 60% y 90% y se ha observado que, aunque el planteamiento pueda parecer l´ogico, su funcionamiento no es robusto en muchas situaciones. Por ejemplo, ante cambios bruscos en la imagen el resultado de este tipo de actualizaci´on a˜nade ruido al modelo. Ante la entrada o salida de objetos nuevos en la secuencia ocurre lo mismo. La variabilidad de forma de los superpixels tambi´en afecta negativamente al funcionamiento de este tipo de actualizaci´on. . M´etodo de distancia Eucl´ıdea. Este m´etodo calcula en primer lugar la distancia Eucl´ıdea entre el vector de descriptores de cada superpixel y los descriptores de cada cluster del modelo. Aquellos superpixels cuya distancia Eucl´ıdea m´ınima con uno de los clusters del modelo sea menor que el valor umbral de ”aceptaci´on” (ED), se utilizar´an para actualizar el modelo. El valor de ED es variable en funci´on del m´aximo que pueda alcanzar la distancia Eucl´ıdea, dependiendo, por lo tanto, del n´umero de descriptores. El umbral ED debe ser suficientemente estricto para no a˜nadir ruido y bajar la representatividad de los clusters del modelo. Ha sido ajustado experimentalmente en un valor de ED =n´umero de descriptores 100 M´etodo de semejanza de color. En este m´etodo se propone que el modelo sea actualizado utilizando aquellos superpixels cuyos intensidades de color RGB son muy pr´oximas a las de un cluster determinado. Para que el resultado de esta actualizaci´on no lleve a errores se debe ser muy estricto con la desviaci´on aceptada, de esta forma solo los objetos con el mismo color en im´agenes consecutivas se considerar´an iguales. Se ha tomado como un valor suficientemente estricto 5/255, lo que equivale a variaciones de color menores del 1.96%. 3.4. M ´ ETODO DE ACTUALIZACI ´ ON 19 Distancia EMD. La distancia EMD (Earth Mover’s Distance) es una manera de medir la similitud entre histogramas. Esta distancia ha sido utilizada para establecer relaciones entre superpixels del fotograma icon el fotograma anterior i-1 (Figura 3.6). En el anexo D se pueden ver algunos resultados de la aplicaci´on de este tipo de distancia. Se ha establecido un umbral tal que, las distancias que est´an por encima del mismo, no se consideran a la hora de la actualizaci´on. La distancia EMD solo ha sido calculada para superpixels cuya ´area as mayor que un umbral, evitando as´ı emparejamientos de superpixels demasiado peque˜nos. El resultado de establecer correspondencias mediante este m´etodo es muy robusto y fiable. El principal problema radica en que al estar relacionando superpixels de una imagen con los de la imagen anterior, si el superpixel que se va a propagar tiene una etiqueta err´onea o est´a ubicado en un cluster que no es el apropiado, la el m´etodo propagar´a el error. Debido a esto se debe estar muy seguro de que lo que se propaga es correcto antes de hacerlo, evitando umbrales demasiado bajos (>50%). Figura 3.6: Ejemplo de la propagaci´on de etiquetas por medio de la distancia EMD 3.4 M´etodo de actualizaci´on Una vez definidos los criterios para seleccionar con qu´e nuevos superpixels podemos actualizar clusters ya existentes, se procede a fijar la manera en la que el modelo va a ser actualizado con ellos. Caso 1. El superpixel evaluado cumple uno o m´as criterios de actualizaci´on. En este caso, los descriptores del cluster al que dicho superpixel se ha asignado, son actualizados con los descriptores del superpixel, haciendo una media ponderada por su ´area. Caso 2. El superpixel evaluado cumple el criterio de ”Distancia EMD” y la probabilidad asociada a la etiqueta que le ha sido asignada es mayor del 70%. En este caso se considera muy fiable la asignaci´on de la etiqueta, por lo que el superpixel pasa a formar parte del modelo al mismo nivel que los superpixels etiquetados a mano, modificando el vector de probabilidades del cluster seg´un lo expuesto en la secci´on 3.1.3. 26 CAP´ ITULO 4. EXPERIMENTOS 010 20 30 40 50 0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1 imagen precisión wall 010 20 30 40 50 0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1 imagen precisión floor (a) (b) 010 20 30 40 50 0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1 imagen precisión door 010 20 30 40 50 0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1 imagen precisión other (c) (d) Figura 4.6: Secuencia 1. Comparaci´on de la precisi´on seg´un el tama˜no de los superpixels. Las curvas azules representan los resultados utilizando unos superpixels de gran tama˜no (configuraci´on 1). Las curvas rojas representan los resultados utilizando superpixels de tama˜no medio (configuraci´on 2). (a) pared, (b) suelo, (c) puerta, (d) otros. 4.4 Comparaci´on de resultados seg´un el tama˜no de los superpixels El tama˜no de los superpixels puede variar en funci´on de unos par´ametros espec´ıficos de las librer´ıas utilizadas. El n´umero y tama˜no de los superpixels segmentados en la imagen son una decisi´on importante en el proceso. Cuanto menor sea el n´umero de segmentos a procesar, menor es el tiempo consumido, pero si el n´umero de superpixels es demasiado bajo, puede que se mezclen zonas de distintos objetos de inter´es en un mismo superpixel, provocando errores obligatoriamente en la clasificaci´on. En el anexo A se muestra las distintas segmentaciones que se obtienen en funci´on de los par´ametros del m´etodo de segmentaci´on utilizado [13]: sigma,ky min. Se ha procesado la secuencia de im´agenes con dos segmentaciones distintas: la configuraci´on 1 utiliza sigma=0.4,k=300 ymin=100; la configuraci´on 2 utiliza sigma=0.3,k=200 ymin=100. La figura 4.6 muestra la precisi´on en el etiquetado utilizando estas dos configuraciones. En la Figura 4.7 se muestran los resultados obtenidos con superpixels de las dos configuraciones, y se puede apreciar claramente que si los superpixels son 4.4. COMPARACI ´ ON DE RESULTADOS SEG ´ UN EL TAMA ˜ NO DE LOS SUPERPIXELS27 fotograma inicial fotograma intermedio fotograma final (a) (b) Figura 4.7: (a) clasificaci´on de los superpixels de las im´agenes inicial, intermedia y final segmentadas con la configuraci´on 1. (b) clasificaci´on de los superpixels de las im´agenes inicial, intermedia y final segmentadas con la configuraci´on 2. 28 CAP´ ITULO 4. EXPERIMENTOS secuencia 1 secuencia 2 secuencia 3 secuencia 4 secuencia 5 Figura 4.8: Im´agenes iniciales de cada una de las secuencias procesadas. demasiado grandes los resultados son peores, sobretodo a la hora de detectar los superpixels que pertenecen al suelo. 4.5 Resultados de reconocimiento obtenidos con la configuraci´on final propuesta Teniendo en cuenta los resultados anteriores y las configuraciones de los par´ametros con las que han sido obtenidas, se han procesado varias secuencias de im´agenes capturadas en entornos de interior de edificios. Las zonas a detectar han sido, en todos los casos las que ya hemos ido utilizando: pared, suelo, puerta, otros. En la Figura 4.5 se muestran los primeros fotogramas de cada una de las cinco secuencias que se han utilizado en los experimentos. A continuaci´on se muestran los resultados de interpretaci´on de cada una de las secuencias. Para las secuencias 1 y 2 se muestran no solo resultados cualitativos del reconocimiento de las distintas ´areas, sino tambi´en evaluaciones 4.5. CONFIGURACI ´ ON FINAL PROPUESTA 29 cuantitativas de la precisi´on ya que tenemos datos de referencia obtenidos a mano solo para esas dos secuencias. Las secuencias 1 y 2 se muestra, adem´as de las im´agenes etiquetadas, los resultados obtenidos tras la comparaci´on con el ’ground truth’. Secuencia 1 En la Figura 4.9 se muestran los resultados finales obtenidos para la secuencia 1. En el caso de la pared (Figura 4.9 (a)), se ha detectado muy bien en todos los casos salvo en la ´ultima imagen (41), donde se confunde casi el 100% de la pared con el tipo puerta. En el caso del suelo (Figura 4.9 (b)) se observa un alto ´ındice de precisi´on en la detecci´on de suelos, ya que casi no se ven zonas que no sean verdes (suelo). En el caso de las puertas (Figura 4.9 (c)), tambi´en predomina el color correcto (rojo), aunque no tanto como en el caso anterior. Si atendemos el ´ultimo grupo, Figura 4.9 (d), confirmamos el punto m´as d´ebil del proceso, las zonas ”otros”, donde vemos muchas zonas donde el algoritmo se confunde. No resulta sorprendente que esta zona sea la mas complicada, ya que representa un conjunto de objetos inciertos, porque intenta englobar todo lo que no sea conocido. En el v´ıdeo del CD adjunto (./videos/secuencia 1.m4v) se incluyen los resultados de procesar todos los fotogramas de esta secuencia de manera similar a la figura 4.10. Secuencia 2 En la Figura 4.11 se muestra un resumen similar. El procesado de la secuencia completa puede verse en el v´ıdeo: ./videos/secuencia 4.m4v, del cual se muestran varios ejemplos de fotogramas en la figura 4.12. Secuencia 3 La Figura 4.13 muestra varios ejemplos de fotogramas de la secuencia 3 una vez han sido procesados y etiquetados, el procesado de la secuencia completa puede verse en el v´ıdeo: ./videos/secuencia 3.m4v. Secuencia 4 La Figura 4.14 muestra varios fotogramas de la secuencia 4 una vez han sido procesados y etiquetados, el procesado de la secuencia completa puede verse en el v´ıdeo: ./videos/secuencia 4.m4v. Secuencia 5 La Figura 4.15 muestra varios fotogramas de la secuencia 5 una vez han sido procesados y etiquetados, el procesado de la secuencia completa puede verse en el v´ıdeo: ./videos/secuencia 5.m4v. 30 CAP´ ITULO 4. EXPERIMENTOS 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 1 2 3 6 8 11 13 16 18 21 23 26 28 31 33 38 41 Imagen de referencia wall other door floor wall 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 1 2 3 6 8 11 13 16 18 21 23 26 28 31 33 38 41 Imagen de referencia floor other door floor wall (a) (b) 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 1 2 3 6 8 11 13 16 18 21 23 26 28 31 33 38 41 Imagen de referencia door other door floor wall 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 1 2 3 6 8 11 13 16 18 21 23 26 28 31 33 38 41 Imagen de referencia other other door floor wall (c) (d) Figura 4.9: Secuencia 1. Resultados de la clasificaci´on en cada frame para cada una de las regiones de interes: pared (azul), verde (suelo), rojo (puertas) y amarillo (otros). 4.5. CONFIGURACI ´ ON FINAL PROPUESTA 31 Fotograma inicial Fotograma intermedio Fotograma final (a) (b) (c) Figura 4.10: Ejemplos de fotogramas etiquetados a lo largo de la secuencia 1. (a) es la imagen original segmentada (b) es el etiquetado de la imagen sin usar el MRF (c) es el etiquetado final. 32 CAP´ ITULO 4. EXPERIMENTOS 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 2 4 5 10 15 20 25 30 35 40 precisión imagen wall other door floor walls 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 3 4 5 10 15 20 25 30 35 40 precisión imagen floor other door floor wall (a) (b) 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 3 4 5 10 15 20 25 30 35 40 precisión imagen door other door floor wall 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 3 4 5 10 15 20 25 30 35 40 precisión imagen other other door floor wall (c) (d) Figura 4.11: Secuencia 2. Resultados de la clasificaci´on en cada frame para cada una de las regiones de interes: pared (azul), verde (suelo), rojo (puertas) y amarillo (otros). 4.5. CONFIGURACI ´ ON FINAL PROPUESTA 33 Fotograma inicial Fotograma intermedio Fotograma final (a) (b) (c) Figura 4.12: Ejemplos de fotogramas etiquetados a lo largo de la secuencia 2. (a) es la imagen original segmentada (b) es el etiquetado de la imagen sin usar el MRF (c) es el etiquetado final. 34 CAP´ ITULO 4. EXPERIMENTOS Fotograma inicial Fotograma intermedio Fotograma final (a) (b) (c) Figura 4.13: Ejemplos de fotogramas etiquetados a lo largo de la secuencia 3. (a) es la imagen original segmentada (b) es el etiquetado de la imagen sin usar el MRF (c) es el etiquetado final. 4.5. CONFIGURACI ´ ON FINAL PROPUESTA 35 Fotograma inicial Fotograma intermedio Fotograma final (a) (b) (c) Figura 4.14: Ejemplos de fotogramas etiquetados a lo largo de la secuencia 4. (a) es la imagen original segmentada (b) es el etiquetado de la imagen sin usar el MRF (c) es el etiquetado final.