scieee AI-readable full text Open interactive document viewer

Clasificación de información táctil para la detección de personas

Gandarias, Juan Manuel,Gómez-de-Gabriel, Jesús Manuel,García-Cerezo, Alfonso José

Abstract

Este artículo presenta el diseño de un efector final táctil y la aplicación de técnicas de inteligencia artificial para la detección de personas mediante un brazo manipulador ligero de 6 grados de libertad. Este efector está compuesto por un sensor táctil de alta resolución que permite obtener imágenes de presión. El sistema extrae información háptica en situaciones de catástrofe en las que, generalmente, existe baja visibilidad, con el propósito de evaluar el estado de las víctimas en función de la urgencia de atención (triaje). Se han implementado dos métodos de inteligencia artificial para clasificar imágenes obtenidas por el sensor táctil, distinguiendo los contactos con personas de objetos inertes en escenarios de desastre. Cada método dispone de un extractor de características de imágenes de presión y un clasificador, obtenido por aprendizaje supervisado. Para validar los métodos se han realizado experimentos de clasificación en clases Humano y No humano. Finalmente, se ha realizado una comparación de ambos métodos en términos de porcentaje de acierto y tiempo empleado para la clasificación, en base a los resultados de los experimentos.

Full text

Clasificaci´on de informaci´on t´actil para la detecci´on de personas Juan M. Gandarias, Jes´us M. G´omez-de-Gabriel y Alfonso Garc´ıa-Cerezo Dto. de Ingenier´ıa de Sistemas y Autom´atica Universidad de M´alaga [email protected] Resumen Este art´ıculo presenta el dise˜no de un efector final t´actil y la aplicaci´on de t´ecnicas de inteligencia artificial para la detecci´on de personas mediante un brazo manipulador ligero de 6 grados de libertad. Este efector est´a compuesto por un sensor t´actil de alta resoluci´on que permite obtener im´agenes de presi´on. El sistema extrae informaci´on h´aptica en situaciones de cat´astrofe en las que, generalmente, existe baja visibilidad, con el prop´osito de evaluar el estado de las v´ıctimas en funci´on de la urgencia de atenci´on (triaje). Se han implementado dos m´etodos de inteligencia artificial para clasificar im´agenes obtenidas por el sensor t´actil, distinguiendo los contactos con personas de objetos inertes en escenarios de desastre. Cada m´etodo dispone de un extractor de caracter´ısticas de im´agenes de presi´on y un clasificador, obtenido por aprendizaje supervisado. Para validar los m´etodos se han realizado experimentos de clasificaci´on en clases Humano y No humano. Finalmente, se ha realizado una comparaci´on de ambos m´etodos en t´erminos de porcentaje de acierto y tiempo empleado para la clasificaci´on, en base a los resultados de los experimentos. Palabras clave: Sensores t´actiles, rob´otica de rescate, reconocimiento de objetos, aprendizaje autom´atico. 1. INTRODUCCI ´ ON La teleoperaci´on supone un elemento fundamental en el campo de la rob´otica de rescate, debido a la complejidad de las operaciones a realizar en un entorno no estructurado [7]. Experiencias previas en situaciones reales han evidenciado la problem´atica de los sistemas basados en percepci´on visual. En entornos con escasa iluminaci´on, polvo o humo, los sistemas con percepci´on h´aptica aportan informaci´on adicional que puede compensar las limitaciones visuales [13]. Una de las primeras tareas de la rob´otica de rescate consiste en clasificar el estado de las v´ıctimas, una vez localizadas, en funci´on de la urgencia de atenci´on (triaje). Esta tarea presenta retos tecnol´ogicos como la interacci´on robot-humano o Human-Robot Interaction (HRI), considerado uno de los mayores desaf´ıos de la rob´otica de rescate [12]. Un primer enfoque a la resoluci´on del problema supondr´ıa el reconocimiento de v´ıctimas y de las distintas partes del cuerpo, de cara a poder realizar mediciones posteriormente. Utiliz´andose para ello percepci´on t´actil ´unicamente. En este sentido, existen diversos trabajos cuyo objeto consiste en reconocer objetos utilizando sensores t´actiles. La mayor´ıa de estos trabajos est´an basados en el uso de algoritmos de inteligencia artificial. Algunos sugieren el uso de herramientas de aprendizaje profundo o Deep Learning. As´ı, en [14] se presenta el uso de aprendizaje profundo con t´ecnicas de dropout para la reducci´on del sobreajuste (overfitting), y se presentan las mejoras obtenidas al mezclar informaci´on t´actil y la posici´on del robot para el reconocimiento. En [1], por el contrario, se aplican herramientas de aprendizaje profundo para la clasificaci´on de los materiales en contacto. Por otro lado, en [10, 9] se presenta el uso de herramientas de aprendizaje autom´atico o machine learning para el reconocimiento de objetos utilizando el descriptor SIFT (Scale-Invariant Feature Transform) [8] y m´etodos de clasificaci´on basados en bolsas de palabras o Bag of Words (BoW). Un trabajo posterior incorpora informaci´on de la posici´on del objeto para crear un algoritmo de clasificaci´on m´as robusto y eficiente [11]. El Departamento de Ingenier´ıa de Sistemas de la Universidad de M´alaga ha contribuido a la aplicaci´on de sensores t´actiles a la rob´otica de rescate [15], mediante un sensor de presi´on que proporciona una imagen de las fuerzas de contacto con el entorno, o las v´ıctimas, instalado en la pinza del brazo hidr´aulico de un robot de rescate [4]. Este art´ıculo presenta una aplicaci´on de los sensores t´actiles al campo de la rob´otica de rescate, consistente en el desarrollo de un efector final de un manipulador ligero de 6 grados de libertad, en el que se ha dispuesto un sensor t´actil con el objetivo de obtener im´agenes de presi´on del en- (a) (b) Figura 1: Desarrollo del sensor. (a) Recubrimiento del sensor con caucho de silicona. (b) Montaje del sensor en el brazo manipulador. torno. Asimismo, se presentan y comparan dos m´etodos de inteligencia artificial para la clasificaci´on de im´agenes de presi´on. El primer m´etodo est´a compuesto por el descriptor Speeded-Up Robust Features (SURF) [2], un modelo Bag of Words (BoW) y una Supported Vector Machine (SVM) [3]. Mientras que el segundo m´etodo se basa en el uso de una Deep Convolutional Neural Network (CNN AlexNet) [6] y una SVM. De esta forma, un clasificador mediante aprendizaje supervisado, identifica si el contacto se realiza con un humano o con objetos. Finalmente, se eval´uan ambos m´etodos comparando sus porcentajes de aciertos y tiempos de c´omputo empleados. El resto del art´ıculo se organiza de la siguiente manera. En la secci´on 2 se resume la aplicaci´on junto con el efector t´actil desarrollado. En la secci´on 3 se describen las implementaciones realizadas de los m´etodos de clasificaci´on utilizados. Posteriormente, en la secci´on 4 se describen los experimentos y se discuten los resultados obtenidos. Finalmente, se incluyen conclusiones y se plantean trabajos futuros. 2. SENSOR T ´ ACTIL PARA ROB ´ OTICA DE RESCATE Los escenarios de desastre suelen caracterizarse por la limitada percepci´on visual debido a la presencia de humo o polvo, tanto en suspensi´on como en superficie. La informaci´on t´actil puede ser crucial para la identificaci´on de v´ıctimas potenciales. En este sentido, un primer enfoque consistir´ıa en saber con qu´e clase de objeto se va a interactuar. Esta primera aproximaci´on permite conocer, de forma autom´atica, si se est´a tratando con una v´ıctima o no, utilizando ´unicamente informaci´on t´actil en forma de mapas de presi´on. De manera que se pretende obtener una distinci´on de estos mapas en dos clases, Humano oNo humano. Para lo que se han desarrollado dos m´etodos de aprendizaje autom´atico, cuyas caracter´ısticas se detallan en el apartado 3. El sistema que se presenta pretende dotar de capacidad t´actil a un brazo manipulador de 6 grados de libertad, el modelo OUR-i5 de la familia AUBO. En las im´agenes de la figura 1 se presenta el desarrollo del sensor t´actil que se ha acoplado al robot. El sensor est´a dispuesto sobre una base de PVC y recubierto de una capa protectora de caucho de silicona que permite la percepci´on de fuerzas externas.Todo el conjunto se ha dise˜nado en SolidWorks y se han utilizado t´ecnicas de fabricaci´on aditivas de prototipado r´apido para la construcci´on de los soportes y el acoplamiento al brazo. 3. IMPLEMENTACI ´ ON DE LOS CLASIFICADORES Se han implementado dos algoritmos de inteligencia artificial. Ambos m´etodos se basan en un extractor de caracter´ısticas de las im´agenes de presi´on y en la obtenci´on de un clasificador aplicando m´etodos de aprendizaje autom´atico. 3.1. Extracci´on de caracter´ısticas con SURF, agrupamiento con k-means y BoW y clasificaci´on con SVM El esquema de la figura 2 representa las fases de implementaci´on de este m´etodo, que consta de dos fases: entrenamiento y prueba. En la fase de entrenamiento se extraen las caracter´ısticas de las im´agenes del conjunto de entrenamiento mediante el algoritmo de visi´on por computador SURF, que proporciona un detector y descriptor invarian- te a escala y rotaci´on convirti´endolo en un m´etodo r´apido y robusto para describir im´agenes. Posteriormente, bas´andonos en un modelo BoW, se genera un diccionario en el que las palabras se corresponden con las caracter´ısticas previamente extra´ıdas, de manera que los descriptores de las im´agenes se agrupan en funci´on de las similitudes encontradas por el m´etodo de agrupamiento k-means no supervisado. Finalmente, se obtiene un clasificador utilizando un m´etodo de aprendizaje supervisado, que se basa en el entrenamiento de una SVM. Cabe aclarar que las im´agenes pertenecientes al conjunto de entrenamiento son distintas a las del conjunto de prueba. BoW SVM Clasificador Conjunto de entrenamiento SURF K-means etiqueta Clasificador Conjunto de prueba SURF etiqueta Matriz de confusión Comprobación etiqueta Extracción de características Aprendizaje no supervisado Aprendizaje supervisado Figura 2: Esquema del m´etodo 1. Extracci´on de caracter´ısticas con SURF, agrupamiento con kmeans yBoW y clasificaci´on con SVM. Este clasificador permite identificar im´agenes de presi´on dentro de unas clases pre-determinadas durante la fase de entrenamiento. Para evaluar el clasificador, en la fase de prueba se obtienen los descriptores de las im´agenes del conjunto de pruebas mediante el descriptor SURF y se eval´ua el m´etodo comparando la clase obtenida de cada imagen con la clase real que le corresponde, de forma que se puede obtener la matriz de confusi´on y el porcentaje de acierto. Una vez evaluado el funcionamiento del m´etodo, se pueden identificar nuevas im´agenes de presi´on, cuya clase es desconocida a priori, obteniendo los descriptores mediante SURF y utilizando el clasificador obtenido en la fase de entrenamiento y evaluado en la fase de pruebas. As´ı, se puede calcular el tiempo que se emplea en clasificar una nueva imagen, lo que sirve tambi´en como herramienta para evaluar el rendimiento. Clasificador Conjunto de entrenamiento CNN AlexNet SVM etiqueta Clasificador Conjunto de prueba CNN AlexNet etiqueta Matriz de confusión Comprobación etiqueta Extracción de características Aprendizaje supervisado Figura 3: Esquema del m´etodo 2. Extracci´on de caracter´ısticas con la CNN AlexNet y clasificaci´on con SVM 3.2. Extracci´on de caracter´ısticas con la CNN AlexNet y clasificaci´on con SVM Por otro lado, el segundo m´etodo emplea una red neuronal convolucional profunda (CNN), conocida como AlexNet [6]. La red se ha importado del repositorio de caffe [5], y posee 650000 neuronas distribuidas en 8 capas, de forma que las 5 primeras son convolucionales y las 3 ´ultimas son completamente conectadas. La red importada ha sido entrenada previamente con el fin de clasificar im´agenes dentro de 1000 clases diferentes. En concreto, el m´etodo desarrollado implementa una variante de esta red, aprovechando el concepto utilizado en [16]. Esta idea consiste en utilizar una red neuronal como extractor de caracter´ısticas en lugar de como m´etodo de clasificaci´on. De forma que se toman las activaciones de la ´ultima capa previa a la clasificaci´on, para entrenar una SVM. En este sentido, se puede elaborar un esquema similar al del m´etodo 1 que describa el flujo de trabajo desarrollado. Este esquema se encuentra en la figura 3 y sigue las dos mismas fases del m´etodo 1: entrenamiento y prueba. En la fase de entrenamiento se obtienen las activaciones de la capa 7 de la red neuronal, llamada fc7. Estas activaciones se corresponden con las activaciones de la ´ultima capa previa a la clasificaci´on, y se utilizan para realizar un entrenamiento supervisado con una SVM que genera un clasificador. Este clasificador se eval´ua extrayendo las caracter´ısticas de las im´agenes del conjunto de prueba y comparando las clases generadas con las clases conocidas. De manera que se puede obtener la matriz de confusi´on y el porcentaje de acierto del clasificador. Finalmente, el clasificador se puede utilizar para identificar nuevas im´agenes de presi´on cuya clase es desconocida a priori. 0.96 0.02 0.04 0.98 Humano No Humano Humano No Humano 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 Figura 4: Matriz de confusi´on resultante de la evaluaci´on del m´etodo 1 para clasificar im´agenes de presi´on en las 2 clases Humano yNo humano 0.99 0.00 0.01 1.00 Humano No Humano Humano No Humano 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Figura 5: Matriz de confusi´on resultante de la evaluaci´on del m´etodo 2 para clasificar im´agenes de presi´on en las 2 clases Humano yNo humano 4. EXPERIMENTOS Y RESULTADOS 4.1. Descripci´on Para llevar a cabo los experimentos se ha utilizado el sensor t´actil modelo 6077 de Tekscan. Este sensor posee un total de 1400 sensels resistivos de presi´on distribuidos en una matriz de 28 filas por 50 columnas con un tama˜no de 53.3 mm x 95.3 mm y una densidad de 27,6 sensels/cm2. Adem´as, la presi´on m´axima admitida es de 34kPa y el rango de temperatura de trabajo es -40oC a 60oC. El sensor est´a cubierto por una capa de caucho de silicona que sirve como elemento protector y conductor de fuerzas externas. Para evaluar los m´etodos desarrollados para la aplicaci´on de detecci´on de personas en situaciones de cat´astrofe, se han utilizado 300 im´agenes etiquetadas en las clase Humano(150) y No humano(150). De las cuales 120 se han utilizado para la fase de entrenamiento, y 180 para la fase de pruebas, siendo la mitad de cada conjunto de una clase diferente. Hay que aclarar que las im´agenes incluidas en la clase Humano se han escogido de las partes: mano, brazo y dedos, debido a que en una situaci´on de cat´astrofe ser´ıan las m´as propensas a encontrarse desnudas. Por tanto, ser´ıan accesibles al robot para realizar la identificaci´on. Adem´as, todas las im´agenes de presi´on etiquetadas en la clase Humano se han tomado de una misma persona. Por otro lado, los objetos utilizados en la clase No humano han sido un bol´ıgrafo, unos alicates y unas tijeras. En las im´agenes de la figura 6 se pueden ver algunas de las im´agenes de presi´on utilizadas, y etiquetadas en sus correspondientes clases. 4.2. Resultados En la figura 4 se muestra la matriz de confusi´on resultante de la fase de evaluaci´on del m´etodo 1. A partir de la cual se obtiene un ´ındice de acierto del 96.67 %. Por otro lado, el tiempo que se tarda en clasificar una nueva imagen de presi´on es del orden de 10ms. En cuanto al segundo m´etodo, se puede observar la matriz de confusi´on resultante en la figura 5. A partir de la cual se determina un ´ındice de acierto del 99.44 %. El tiempo de clasificaci´on es del orden de 700ms. En resumen, se ha obtenido una mejora del segundo m´etodo con respecto al primero del 2.77 % en la clasificaci´on Humano - No humano. Sin embargo, el tiempo empleado es, aproximadamente, 70 veces mayor en el segundo. En la tabla 1 se recogen los resultados de tiempo y porcentaje de acierto de cada m´etodo, as´ı como el porcentaje de mejora, tomando el primer m´etodo como referencia. 5. CONCLUSIONES Y TRABAJO FUTURO Se ha presentado el desarrollo de un sensor t´actil y su aplicaci´on al campo de la rob´otica de rescate. Para ello, el sensor se ha instalado en un brazo manipulador ligero, con objeto de identificar el estado de v´ıctimas potenciales en funci´on de la urgencia de atenci´on (triaje). Adem´as, se han implementado dos m´etodos de inteligencia artificial para clasificar im´agenes de presi´on. Cada m´etodo dispone de un extractor de caracter´ısticas y un clasificador. El clasificador, en ambos m´etodos, se ha obtenido mediante aprendizaje supervisado utilizando una (a) Brazo (b) Dedos (c) Mano (d) Bol´ıgrafo (e) Alicates (f) Tijeras Figura 6: Ejemplos de im´agenes de presi´on. Las im´agenes superiores (a), (b) y (c) pertenecen a la clase Humano y las inferiores (d), (e) y (f) pertenecen a clase No humano M´etodo Acierto ( %) Mejora ( %) Tiempo (s) SURF + SVM 96.67 - 0.01 CNN + SVM 99.44 2.77 0.7 Tabla 1: Resumen de los resultados de los experimentos SVM (Supported Vector Machine). En cuanto al extractor de caracter´ısticas, el primer m´etodo incorpora el descriptor SURF (Speeded-Up Robust Features), mientras que el segundo m´etodo utiliza una variante de la red neuronal convolucional conocida com´unmente como AlexNet. Para validar los m´etodos se han realizado experimentos de clasificaci´on en las clases Humano yNo-humano, y en subclases de estas. Finalmente, se han realizado los experimentos que sirven como comparativa de ambos m´etodos. En este sentido, se ha comprobado que el m´etodo 2 obtiene una mejora del 2.77 % con respecto al m´etodo 1. Sin embargo, el tiempo empleado en la clasificaci´on de una nueva imagen de presi´on es mayor de un orden de magnitud en el m´etodo 2 (del orden de 0.7s) que en el primero (del orden de 0.01s). Es decir, pese a que el m´etodo 2 obtiene un ´ındice de aciertos mayor que el primero, esta diferencia no resulta significativa en comparaci´on la diferencia de tiempo de ejecuci´on de ambos clasificadores. Por lo tanto, se puede concluir que, para llevar a cabo la clasificaci´on entre humanos y objetos, resulta m´as apropiado el uso del m´etodo 1. Actualmente se est´an llevando a cabo nuevos experimentos que permitan, no s´olo distinguir si el contacto se realiza con un humano o no, si no ser capaces de detectar, en el caso de que el contacto se realice con un humano, la parte del cuerpo concreta que se est´a tocando. Futuros trabajos consistir´an en utilizar algoritmos basados en gradientes de presi´on y palpaci´on activa. Asimismo, se pretende observar el comportamiento de ambos m´etodos en un entorno de desastre simulado en el que las subclases de objetos sean las t´ıpicas de estas situaciones, como piedras o ramas por ejemplo. Agradecimientos Este trabajo ha sido parcialmente financiado por el proyecto DPI2015-65186-R y por la ayuda BES2016-078237 del fondo social europeo FSE. Referencias [1] Baishya, S. S. and Bauml, B. (2016). Robust material classification with a tactile skin using deep learning. In 2016 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pages 8–15. IEEE. [2] Bay, H., Ess, A., Tuytelaars, T., and Van Gool, L. (2008). Speeded-Up Robust Features (SURF). Computer Vision and Image Understanding, 110(3):346–359. [3] Cortes, C. and Vapnik, V. (1995). Supportvector networks. Machine Learning, 20(3):273– 297. [4] Garc´ıa-Cerezo, A., Mandow, A., Mart´ınez, J. L., G´omez-de Gabriel, J., Morales, J., Cruz, A., Reina, A., and Ser´on, J. (2007). Development of ALACRANE: A mobile robotic assistance for exploration and rescue missions. In SSRR2007 - IEEE International Workshop on Safety, Security and Rescue Robotics Proceedings, pages 1–6. IEEE. [5] Jia, Y., Shelhamer, E., Donahue, J., Karayev, S., Long, J., Girshick, R., Guadarrama, S., and Darrell, T. (2014). Caffe. Proceedings of the ACM International Conference on Multimedia - MM ’14, 1436:675–678. [6] Krizhevsky, A., Sutskever, I., and Hinton, G. E. (2012). ImageNet Classification with Deep Convolutional Neural Networks. [7] Liu, Y. and Nejat, G. (2013). Robotic Urban Search and Rescue: A Survey from the Control Perspective. Journal of Intelligent & Robotic Systems, 72(2):147–165. [8] Lowe, D. (1999). Object recognition from local scale-invariant features. In Proceedings of the Seventh IEEE International Conference on Computer Vision, pages 1150–1157. IEEE. [9] Luo, S., Liu, X., Althoefer, K., and Liu, H. (2015a). Tactile object recognition with semisupervised learning. In Lecture Notes in Computer Science (including subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics), volume 9245, pages 15–26. Springer, Cham. [10] Luo, S., Mou, W., Althoefer, K., and Liu, H. (2015b). Novel Tactile-SIFT Descriptor for Object Shape Recognition. IEEE Sensors Journal, 15(9):5001–5009. [11] Luo, S., Mou, W., Althoefer, K., and Liu, H. (2016). Iterative Closest Labeled Point for Tactile Object Shape Recognition. In IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE. [12] Murphy, R. R., Tadokoro, S., Nardi, D., Jacoff, A., Fiorini, P., Choset, H., and Erkmen, A. M. (2008). Search and Rescue Robotics. In Springer Handbook of Robotics, pages 1151– 1173. [13] Ranasinghe, A., Sornkarn, N., Dasgupta, P., Althoefer, K., Penders, J., and Nanayakkara, T. (2016). Salient Feature of Haptic-Based Guidance of People in Low Visibility Environments Using Hard Reins. IEEE Transactions on Cybernetics, 46(2):568–579. [14] Schmitz, A., Bansho, Y., Noda, K., Iwata, H., Ogata, T., and Sugano, S. (2014). Tactile object recognition using deep learning and dropout. 2014 IEEE-RAS International Conference on Humanoid Robots, pages 1044–1050. [15] Vidal-Verd´u, F., Barquero, M. J., Castellanos-Ramos, J., Navas-Gonz´alez, R., S´anchez, J. A., Ser´on, J., and Garc´ıa-Cerezo, A. (2011). A Large Area Tactile Sensor Patch Based on Commercial Force Sensors. Sensors, 11(12):5489–5507. [16] Wang, Y. and Cottrell, G. W. (2015). Bikers are like tobacco shops, formal dressers are like suits: Recognizing urban tribes with caffe. In Proceedings - 2015 IEEE Winter Conference on Applications of Computer Vision, WACV 2015, pages 876–883. IEEE.