scieee AI-readable full text Open interactive document viewer

Representación de caras mediante eigenfaces

Lorente Giménez, Luis

Full text

REPRESENTACIÓN DE CARAS MEDIANTE EIGENFACES Lu is Lorente Giménez Proyec li s/a d el Dp/ o. de Teo rí a del S e/ia/y Co muni cacion es, Grupo de Pr ocesado de Imagen, Unil/ ers/dad Po/¡jécll ic a de COIa/lIl/ya 1. INTRODUCCIÓN El proyecto de fin de carrera en el que est oy trabajando desde hace casi un año co nsiste en el desarrollo de un sistema de r eco nocimiento de caras. Las tecnologías de r eco n ocim iento de caras (lace recogll/lio /l t ecl mologies o FRT) on un área de in vestigación muy ac ti va en los últimos años que engl oba varias disciplinas como el procesado de imagen, redes neuronales, parr em recogllilioll y visión por ordenador. Tiene varias aplicaciones potenciales, tanto co merciales como de seg uridad, co mo por ejemp lo la identificación de fotos de carnets, pasapo rt es o id entifi cac ión en ti e mp o real de personas desde im áge nes de cámaras de vig il anci a. El reconocimiento de caras, aunque fácilmente rea li za bl e por las personas, es difícilmente impl emen ta bl e de una manera totalmente automa ti zada en ordenador. El objetivo de un sistema de re co nocimiento de caras es, ge neralmente, el siguiente: dada una imagen de una ca ra "desconocida " (o imagen de test) en co ntrar una imagen de la mi sma ca ra en un co njunto de imágenes "conoc id as" (conjunto de entrena mi ento). Esto, que es tan sencillo de d ec ir, pl ant ea un as terribles dificultades para su implementación en un sistema automá ti co. Las personas r eco n oce mos las caras con gran facilidad, rapid ez e incluso en circunstancias adversas de iluminación, o ri entación y otros factores. Sin embar go los sistemas automá ti cos de r eco nocimiento por ordenador todavía están muy lejos de la efec ti vidad del ce re br o humano, aunque los result ados son esperanzadores. Las m ayo re dificultades a las que se pue de enfrentar un sist ema de r eco n oc imiento de caras son: las variaciones en la exp resión de las caras, las variaciones en las condiciones de iluminación y las rotaciones en profundidad. Las rotaciones en profundidad son aque ll as en que la ca ra no gira en el pl ano de la Imagen y por lo tanto parte de la cara puede quedar oculta. 2. PARTES DE UN SISTEMA DE RECONOCIMIENTO DE CARAS A pesar de la gran variedad de si ste mas existentes, todo sistema de FR puede dividirse en tres partes: .preprocesado de las imágenes: consiste en intentar co mpensar t odo lo que puede provocar qu e dos imá- .. RA MAS DE EST UDI ANTES DEL 1 EEE a/oren/e @gps. /s c. llp c.es gen es de la misma cara sean diferentes. Esto incluye nonnalizar el tamaño y el contraste de la imagen. A veces t ambié n se in tentan co mp ensar los cambios de iluminación, la rotación y otras caracterís ti cas de la im age n que pu ede n perjudicar los resultados del sistema. Existe un a buena cantidad de in ves ti gaciones dedi ca das únicamente e esta parte, debido a su complejidad. .extracción de caracterís ti cas: en esta fase se extraen una se ri e de valores caracterís ti cos de ca da ima ge n, co mo pueden ser los coeficientes de algún desarro ll o, la salida de un filtro, etc. Independientemente de su o ri ge n estos valores deben intentar carac te ri zar co n la mayor exactitud cada cara (lo que se considera ef iciencia) y, al mi smo ti empo, deben ten er ca pacidad de di scr iminación. Esto significa que los va lore s extraídos de las imágenes de una cara y los de las imágenes de otras ca ra deben fo rmar dos grupos lo más compactos y separados posible .comparación de ca racterísticas: se comparan los valores característicos de la imagen de te t (la que se quiere reconocer) con lo s de la s imágenes de entrenamiento y se calc ul a un a medida de semejanza. Los rnftodos van de sde la distancia euclidea (cons id erando que el conjunto de valores ca racterísticos fo nnan un vector) a otros mucho más so fi s ti ca dos. La ima ge n de entre namiento que más seme jant e sea a la de test se co nsiderará que es de la mi sma persona En un a primera fase que ll ama rem os fase de entrenamiento, las dos primeras partes se aplican a la imágenes del co njunto de entrenamiento, para extraer las caracterís ti cas que caracterizan a las imágenes de este conjunt o. Poste ri ormente, en la fase de test, las imágenes del conjunto de test que queremos r eco n oce r pasan por las dos primeras partes y la fase de co mpar ación determina f in almente la imagen de entr enam iento que más se parece a la de test. La parte más importante es la de extracción de características. En e ll a, se intenta carac te ri za r un a ca ra con independencia de factores ex ternos como la iluminación, expresión, etc. En ge neral el obje ti vo es hallar un a serie de caracterís ti cas de la imagen que pueden ser des de las dimensiones de los elementos de la ca ra como la boca, ojos, etc. hasta los coeficientes que nos da un filtro o una transformada al apli car lo a la imagen de la cara. Lo importante es que caractericen co n gran fidelidad a cada cara y que sea n in variantes a los ca mbios en 13 los factores externos que se han mencionado anteriormente. 3. TIPOS DE TÉCNICAS DE RECONOCIMIENTO DE CARAS Las técnicas de reconocimiento de caras se pueden clasificar en tres tipos, en función de los métodos utilizados para la extracción de las características de la cara: • técnicas baSadas en la extracción de características geométricas de la cara como las posiciones relativas y dimensiones de ciertos elementos de la cara (cejas, ojos ,nariz, boca y contorno de la barbilla principalmente) • técnicas basadas en procedimientos de template matching ( emparejamiento de plantillas ), en las que zonas de la imagen son comparadas con zonas equivalentes de otra imagen utilizando alguna distancia ( pe la distancia Euclidea ) para poder calibrar su grado de semejanza o discrepancia. Los sistemas que utilizan este tipo de técnicas carecen de la fase de extracción de características, ya que utilizan directamente la información de niveles de gris (o color) de los pixels de la imagen • técnicas basadas en la aplicación de transformadas: las características de la imagen son los coeficientes resultantes de aplicar algún procedimiento numérico o alguna transformada, como la transformada Karhunen-Loeve A pesar de esta sencilla división, existen gran cantidad de técnicas y no resulta sencillo escoger entre ellas. Al comenzar el proyecto se definieron una serie características que debía cumplir el sistema y que limitaron las alternativas entre las que escoger. Se decidió buscar un sistema que utilizara una sola vista frontal de cada cara como conjunto de entrenamiento. En otras palabras, el sistema debía ser capaz de poder identificar a una persona teniendo sólo una imagen (una vista frontal) de ésta. Sin embargo se pueden encontrar técnicas de reconocimiento de caras que utilizan vistas laterales o perfiles, información 3D de la cara u otros tipos de información. Tras una intensa etapa de documentación y búsqueda se decidió implementar un sistema de reconocimiento basado en la representación mediante eigerifaces. Una de las razones es que este tipo de sistemas tiene probablemente el mejor compromiso entre complejidad, rapidez de ejecución y resultados. 3. REPRESENTACIÓN DE CARAS MEDIANTE EIGENFACES 3.1. Introducción El origen de los sistemas de FR que utilizan eigenfaces se remonta a unos trabajos de Sirovich y Kirby ([1]). El objetivo de Sirovich y Kirby era caracte14 rizar un conjunto de caras con un mínimo número de parámetros. Para ello, se utilizaba el análisis de componentes principales o PCA (principal components analysis ) para generar unas imágenes semejantes a caras llamadas eigenpictures. Las imágenes de caras se caracterizaban como una combinación lineal de eigenpictures. Fueron Turk y Pentland ([2]) quienes utilizaron esta representación de la imagen, mucho más compacta que los valores de los pixels de la imagen, para implementar un sistema de FR, además de rebautizar las eigenpictures como eigenfaces. El primer paso para comprender los sistemas de reconocimiento basados en eigerifaces es conocer la filosofía que se oculta detrás del PCA, que se utiliza para generarlas, y que permite un mejor entendimiento de la representación de las imágenes de caras mediante eigenfaces. 3.2. Motivación Consideremos el conjunto de todas las imágenes posibles cuyas dimensiones son w pixels de ancho por h pixels de alto. El número de componentes de estas imágenes es w*h. Si concatenamos las filas de estas imágenes podemos considerarlas como vectores de dimensión w*h. Utilizando esta representación vectorial, el conjunto de imágenes forman un espacio vectorial de dimensión w*h. Este espacio se puede generar a partir de la base canónica (1,0,0, ... ,0), (0,1,0,0, ... ,0), ... , (0,0, ... ,0,1). Consideremos ahora el conjunto de las imágenes de caras. En relación al resto de todas las posibles imágenes son todas relativamente semejantes: todas tienen los mismos elementos, situados de forma semejante, con textura parecida, etc. Además, los pixeles están altamente correlados con sus vecinos. Es razonable, por lo tanto, suponer que el conjunto de las imágenes de caras ocupa sólo una pequeña región de este espacio. Una consecuencia de esto es que la representación de las Figuro L E;jemplo simplificado del espacio de las imágenes (en este caso de dimensión 3) y región ocupada por las imágenes de caras. BURAN N°ll MAYO 1998 imágenes de caras utilizando la base del espacio de las imágenes es claramente ineficiente. Además, debido a que todas las imágenes de caras son relativamente semejantes, podemos suponer que las imágenes de caras están en una zona reducida del espacio de las imágenes (llamémoslo el espacio de las caras). En ese caso, podríamos intentar hallar una base de vectores cuyo número sería mucho menor que el de una base del espacio de las imágenes. A pesar de que no existe ninguna evidencia al respecto, la rapidez con la que el cerebro humano es capaz de reconocer las caras sugiere que su representación en el cerebro es de una dimensionalidad baja, aunque nadie sabe cual es ni como se maneja la información. En la Figura 1 se muestra un ejemplo simplificado en el que el espacio de las imágenes es de dimensión tres (imágenes de tres pixels). Finalmente, llegamos a la conclusión debería ser posible generar las imágenes de caras (o al menos una muy buena aproximación) con muchos menos vectores que los necesarios para representar el espacio de las imágenes completo. El objetivo pasa a ser encontrar esta base de vectores. El PCA (análisis de componentes principales o principal components analysis) permite hallar una nueva base con un máximo de eficiencia. El PCA fue desarrollado por estadísticos, aunque también ha sido formulado en el campo de las redes neuronales. En este proyecto se utiliza la concepción estadística del PCA. 3.3. EIPCA Como ya se ha dicho, las componentes (los pixels) de las imágenes de caras están altamente correladas entre sí. El PCA se basa precisamente en las propiedades estadísticas de las imágenes y es un método óptimo para reducir el número de dimensiones necesarias para representar un conjunto de vectores (en nuestro caso, imágenes de caras). Consideremos un vector aleatorio X de dimensión n, con su correspondiente media ~ ,u=E{X} La matriz de covariancia se define como donde ij representa la covariancia entre el componente número i y el número j del vector X. El análisis de componentes principales consiste en hallar los vectores propios de esta matriz y expresar X en función de estos vectores. De esta manera, el vector aleatorio X se puede • RAMAS DE ESTUDIANTES DEL IEEE representar sin error mediante una combinación lineal de vectores de la forma n X = Ly;A¡ ;=1 donde los vectores Ai son los vectores propios de la matriz de covariancia. La cualidad más importante de esta representación es que si queremos representar X con sólo m (menor que n) componentes la mejor elección posible en términos del error que se comete son losm vectores propios de la matriz de covariancia con mayores valores propios asociados. 3.4. Aplicación del PCA para la representación de caras: las eigenfaces Como se acaba de ver, el PCA se reduce básicamente a encontrar los vectores propios de la matriz de covariancia l:x del vector al que aplicamos el PCA. Apliquemos toda esta teoría a nuestro problema particular de reconocimiento de caras: nuestro objetivo es caracterizar un conjunto de caras (que serán las del conjunto de entrenamiento) en un espacio de menor dimensionalidad. Tal y como se ha expuesto anteriormente, consideremos las imágenes de caras de este conjunto (de anchura w y altura h) como realizaciones del vector aleatorio X de dimensión w*h, con su correspondiente vector media ~. A este vector, al que llamaremos vector cara, deseamos aplicarle el PCA. La media de este vector cara no la podemos obtener al no conocer la función de densidad de probabilidad, pero la podemos estimar a partir las imágenes que tenemos: La matriz de covariancia tampoco la conocemos pero se también se puede estimar: Llegados a este punto, en teoría sólo queda el cálculo de los vectores propios de la matriz de covariancia, para lo que existen varios algoritmos automáticos fácilmente implementables. Pero la implementación de este algoritmo plantea un problema: la cantidad memoria necesaria para almacenar la matriz es demasiado grande. Si los vectores cara de la base de entrenamiento son de dimensión w*h, las dimensiones de la matriz de covariancia estimada l:x serán de w*h de ancho y w*h de alto. Por ejemplo, si utilizamos imágenes de entrenamiento con unas dimensiones contenidas de w= 128 y h= 128, el número de elementos de la matriz de covariancia 15 sería de 128 ~, o sea más de 268 mj]lones, lo que está fuera del alcance de las memo ri as de los ordenadores actuales. La solución es aplicar una SVD ( descomposición en valores s in g ul ares o si ng u la r va / ue decompos it ion ) a la matriz Mx' Esta operación descompone una matriz en un producto de tres matrices M = VA 112 V T x donde si Mx es una matriz de w*h f il as y co lumn as con w*h mayor que N (lo que siempre será nuestro caso) la matriz U es de las mi smas dimensiones y las matrices V y A 1/2 son cuadradas de dimensiones N por N. Además, la matriz A 1/2 es diagona l. La propiedad que nos es útil de la SVD es que las N columnas de la matriz U son vectores propios de la matriz XX r, y los elementos de la matriz A 1/2 son las raíces cuadr adas de los v al ores propios con'espondientes a estos vectores propios. Si recordamos la estimación de la matriz L vemos que esta no era exactamente XX T, x sino que además se di vidía este producto por N. Pero esto no importa ya que los vectores y valores pro pi os de un a matriz y los de la mi sma matriz dividida por un escalar son iguales, salvo por el hecho de que los v al ores propios también quedan di vididos por el mi smo número. Este método está al alcan ce de un ordenador, ya que la matriz Mx es de dimensiones w*h por N, Y N (que es el número de caras del conjunto de entrenamiento) sue le estar a lr ededor de un centenar, lo que la convie rt e en una ma tri z manejable por un o rd enado r. Sin e mb ar go este método no calcula todos los vectores propios de Sx ya que esta matriz, al ser real y simé tri ca, ti ene siempre w*h vectores propios (en la práctica muchos más que N que es el número de imágenes del conjunto de entrenamient o). Pero se puede demostrar que los N vectores propios conseguidos con la SVD son los únicos vectores propios de Lx que pueden tener un valor pro pi o di stinto de cero. Desde el punto de vista teórico del PCA, esto quiere decir que el resto de vectores pro pi os (los que siempre ti enen un valor pro pi o igual a ce ro) no capturan ning un a información del vector X al que estamos aplicando el PCA, y por lo ta nt o los eliminaríamos del anál is is tal y como se ha exp li cado en el punto a nt e ri o r. Volviendo a nu estro pro bl ema de represe nt ación, todo esto sig ni fica que los N vectores pro pi os que genera la SVD son capaces de caracte ri zar a los vectores correspondientes al co njunto de imágenes de caras de entrenamiento, y el resto de vectores pro pi os sólo nos po dr ían se rvir para abarcar el resto del espacio o ri g in al de X (el espacio de las im ágenes de w por h pi xels), p ero no nos s er virían para repr ese nt ar las caras. De entre estos vectores propios el número de e ll os que co ntienen información útil (valor propio mayor de cero) es igual al número de vectores linealmente independientes del conjunto de entrenamiento menos uno (ya que al restar la media se reduce siempre en uno el número de vectores linealmente independientes). 16 De esta manera obtenemos los deseados vectores pro pi os que definen nu estro nu evo espacio, el espacio de las cara s. Estos vectores ti enen realme nt e apariencia de caras, y por ello han sido ll amados primero eigenpictures (imágenes pro pi as) y poste ri ormente eigenfaces (caras pro pi as). En la fi gura 2 se muestran las S primeras eigenfaces generadas con un conjunto de S7 imágenes de entrenamiento. Figura 2. Cara media y 5 primeras eigenfaces de un TO T al de 56 generadas a panirde 57 imágenes de car as sin barba ni gafas. La posición de los ojos y la boca está nor malizada y los c ampo - nemes vectores propios han sido remapeados enel rango [0,255 } para p oder visualizarlos 3.5. Reducción de la dimensionalidad Ll egados a este punto, la situación es la sig ui ente: tenemos un conjunto de N imágenes de caras Xi ( que utilizamos como conjunto de entrenamient o) que queremos repr ese ntar en un espacio de menor dimensión. Para ello hemos considerado estás imágenes co mo real izaciones del proceso aleatorio vecto ri al " im ágenes de caras" y hemos aplicado el PCA a este vecto r. Co mo resultado, obtenemos N vectores pro pi os (eigenfaces) o rt o no rm ales y con -1 de e ll os se pueden generar sin error las N caras del conjunto de entrenamient o. En la figura 3 se muestra de un a manera gráf ica pa rt e de la repr ese nt ación de un a de las caras utilizadas para generar las eigenfaces de la figura 2. Para ha ll ar las coordenadas Y. de una cara X. sobre I I este nuevo espacio no tenemos más que proyectar Xi + .. Figura 3, RepreselUación de una cara a panirde laseigenfaces: a la cara se la reS Ta la ca ra media y es Ta dif erencia se puede expr esar co mo una combinación lineal de la s eigenfaces. Para que la representación sea exaCTa la imagen debe eSfar incluida en el conjun TO al que se la aplica el PCA (el co nj u nTO de enrrenamienlO ) BURAN N° ]l MAYO 1998 obre l as eigetifaces. Para h al lar la proyección de X¡ sobre cada eigen/ace bastará con calc ul ar el producto escalar. ya que las eigetifaces son o rt ono rm ales. Por lo tan to , si la s column as de la ma tri z A so n l as eigetifaces, ha ll aremos l as nuevas coordenad as en el es p ac io de l as caras de la siguie nt e ma nera: Al haber N -I etgetifacesladimensión de l os vec tores Y¡ es NI (recordemos que es el número de im ágenes de entrena mi e nt o). Es to su po ne un a fue rt e re du cción de dimensiona li da d fre nt e al es pacio de l as im ágenes (w*h) pero esto no es nin g un a sorpresa ya qu e como ya se ha co me nt ado obviame nt e para represe nt ar a N vectore a lo s que se ha restado su media b as ta con N-I vectores. La ve rdadera re du cción de dimensiona lid ad de la re presentación m ed ia nt e e /g e l1fa ce s consiste en utilizar só lo las etge /?/a ces con mayor va lor p rop io asociado. Reco rd emos que el va lor p ro pi o asociado a un a et getif ace es igual a la va ri ancia de la proyección de las caras sobre esa e/ getif a ce . De esta manera se pu ede re du c ir nota bl eme nt e el nú mero de dimensiones de la represe nt ac ión s in perder apen as ca lid ad en la represe nt ac ión de l as caras. En es te aspect o. l as elgerifaces consiguen la m áx im a e fi ciencia que se pu ede conseguir ya qu e l as plimeras e/ ge n fa ces (l as de mayor va lor p ro pi o asociad o) consiguen capt ur ar la info rm ac ión m ás impo rt a nt e de l as caras, la qu e ex pli ca la m áx im a va ri anci a, mi entr as qu e l as últim as apenas apo rt an info rm ación (s us va lor es p ro pi os son mu y bajos). Di cho de o tr a manera: la mejor representación pos ibl e de un conjunto de N im ágen es de car as utili za nd o sólo M di mensiones (con M<N) se consigue proyectá nd olas Figura 4. R ep r ese llla cio n ej ' de 6 lill áge ll es de ca ras l//¡/i :;o lld o las pn i71 eras 8. 16, 24. 32, 4 0. 48)' 56 eigenfaces de tI/1 /O/al de 56 eige l/fa ces , ge l/e rad os a par/ti· de tln peA de 57 lillágelles de caras)' ordelladas de m ayo r a menor v al or prop io. La recolls- /rtlcción Ii' c! l/I 'e la s um a de la ca ra media para poder apreciar me jo r la cal Idad .. R AMAS DE E STUDIANTES DEL fEEE Figura S. Im áge n es de personas 11 0 lil c! lIldas en el CO lljÚIII O de ell/renallliell/o r ep resell/ adas CO I/ tll/ cO lljt m/ o de 56 ei ge l!laces. El er r or es cOI lSIde rabl e debIdo a que e llllímer o dee igen fac es es d emas iad o bCljo sobre l as M eigenfaces con mayor valor p ro pi o. En la fi g ur a 5 se pu ede ve r la evo lu ción de la ca lid ad en la represe nt ac ión de alg un as caras del conjunto de entren ami ento utili za do para ge nerar l as etge/ifacesde la fi g ur a 2. Como se pu ede apreciar, con un número mu y bajo de etgerifaces se consigue un a represe nt ación con un a notable calidad, lo qu e de mu es tr a qu e las primeras eigenfaces consiguen capturar la mayor pa rt e de la info rm ac ión de l as car as. Como se ha di cho a nt e ri o rm e nt e, si l as e/ ge /ifaces se generan a partir de un conjunto de entrenamie nt o suficie nt emente gra nd e de im ágen es entonces son cap aces de represe nt ar con f id e lid ad im ágen es de caras de person as qu e no están en el conjunto de entrenamient o. Para e ll o el tamaño del conjunto de entrena mi ento debe ser como mínimo de un as 10 0 im ágenes. En el prese nt e proyecto no se di sponía de tal núme ro y por lo ta nt o no se consigue un a bu ena representación. En la fi gura 5 se mu estran alg un os eje mpl os de reconstrucción de car as de person as no in cl uidas en el conjunto de entrenamient o. Sin e mb argo, lo qu e siempre se consigue es un a bu ena represe nt ac ión de im ágenes de car as qu e ti enen alg un a otra im agen (de la mi sma ca ra o person a) en el conjunto de entrena mi e nt o, aunque est as tengan va ri aciones en la ex presión respecto a la im agen del conjunto de entrena mi e nt o. En estos casos, aunque la im agen represe nt ada con l as etgetifaces te nga un error cons id er ab le la id entidad de la cara siempre se preser va con gran fid e lid a d. lo qu e es especia lm e nt e importa nt e de cara a su a pli cación al reconoc imi en to de caras. En la fig ur a 6 ve mos un os eje mpl os qu e ilu s tr an este hech o. La fig ur a 4 da un a id ea visual de la información capturada por l as primer as eigenfaces pero ¿h as ta qu é punto consiguen se concentra esta info rm ac ión en un bajo número de ei ge nfaces? En la figura 7 se mues tr a la gr áf ica de la evo lu ción de los va lores propios (igual es a la va ri ancia de la proyección de l as car as sobre la etgeriface asociada), o rd enados de m ay or a menor. La gr áf ica sigue un a evo lu ción s em eja nt e a un a e xp onencial, 17 Figura 6. Primera fila: imágenes pertenecientes al conjunto de entrena mi ento. Seg und a fila: imágenes de la s mi smas personas con cambios de expresión. Tercerafila: imáge ll es de la segunda fi la re pr esellladas a partir de las eigenfaces ge l/ eradas con las imágenes de la prime ra grá fi ca sigue una evo lu ción semejante a un a exponencial, lo que demuestra la gran co n ce ntración de va ri ancia que se produce en las primeras eigenfaces. Esto se refleja claramente en la calidad obtenida en la repr ese nt ación. Para expresar esta calidad numé ri came nte debemo s hallar una medida del error co metido al representar una cara. Si la representación de una cara X con M eigenfaces (de un total de ) es M X"" /1+ L y¡A¡ ¡= 1 donde I.l. es el vector media A¡ son las eigenfaces ordenadas de mayor a menor valor propio y y¡ la proyección de X sobre A¡ , el error de representación se define como = ("X -X IIJ 2 e II XII El error está normalizado y su rango de valor es va de cero a uno. Sin embargo, debido a que la media es un a buena es timación de todas las caras en la prác ti ca l os valores siempre son mucho más reducidos. La evo lu ción de sus valores se ve en la figura 8 para los tres casos de representación vistos. Como se podía esperar, esta gráfica co nfirma que co n un bajo número de eigenfaces se consiguen representacion es con bajos porcentajes de error. 4. EL SISTEMA DE RECONOCIMIENTO DE CARAS En el capítulo ant er ior se ha visto la co nve ni encia de representar las im ágenes de caras mediante eigenfaces. En este ca pítulo se verá co mo se aplica esta representación al r eco nocimiento de caras. Recordaremos el plant ea miento del probl ema a resolver por un sistema de r eco nocimiento de caras: dado un co njunto de imágenes de ca ra s que ll amaremos co njunto de entrenamiento, el 18 sist ema debe ser capaz de emparejar una nueva imagen co n la imagen del co njunto de entrenamie nt o que perten ece a la misma person a. 4.1. Etapas de entrenamiento y de test Para que el sistema esté preparado para rea li zar la parte de comparación es necesa ri o disponer de las ca racterísticas de las im ágenes de entrenamiento. P or ello es necesario r ea lizar una vez una etapa de entrena mi ento. Esta consiste en aplicar las dos primeras fases a las imágenes del conjunto de entrenamiento. A partir de entonces se puede efectu ar el re co nocimiento con un co njunto de im ágenes de tes t. El esquema general se muestra en la Fi gura 9. 8 x 10 10 20 30 40 50 60 E¡genface Figura 7. Créifica de los valores propios asociados alase ige nf aces ordenados de m ayor a menor. La disminución es mI/ y rápida. lo que indica U/l a gran concentraciól/ de la variancia de las imágenes en las primeras eigenfaces o 0.08 . '5 I ~ 0.07 o "O '" ~ 0.06 '" E g 0.05 g w 0.04 ~ 0.03 0.02 0. 01 10 20 30 40 50 60 Núm ero de eigenfaces utilizadas Figura 8. Error de re pr esentación de las caras del CO l/jullto de entrenamiento (media de las 57) en función del n/Í mero de eigenJaces wili ;adaspara representar imágenes del conjunto de entrenamiento (+ ). otras imágenes de persollas in cluidas en el conjunto de entrenamiento con diJere l1l es expresio l/ es (X) y imágenes de caras "desconocida s" (O ). El error decae rápid a· mente con las primeras eige nJa ces y la reducció lI de error de bid a al resto de eige nJa ces es mínima ETAPA DE El\TR..ENAMIEJ'I,'TO ETAPA DE TEST ~ I..ASlMA:a:NESL·[ ~ r ENTRf.NAMIENT'Q \~ Figura f}. Esquema d el sis r el7lo de reco/loCliniellfo de caras. 4.2. Implementación de las partes del sistema de reconocimiento A co ntinuación se describe la implementación concreta de las partes del sistema de r eco nocimiento. 4.2.1. Normalizaci6n o preprocesado La fa se de norma li zación es de una gran importanc ia en los sistemas que utilizan eigerifaces. Com o se ha visto anteriormente, la potencia de las ei ge l7 Jaces reside en su gran cap ac id ad para caracte ri zar co n un mínimo error una imagen de una cara. Esta ca pa cidad si emp re es muy alta co n las im áge nes co n las que se han ge nerado las eigelifaces, p ero co n otras imágenes de ca ras ( pe. las que se tendrán que r eco n oce r, que ll amaremos co njunto de test ) depende mucho del procesado que se le aplique a la imagen antes de proyectarla sobre las eigerifaces. Nuestra implementación de esta fase intenta co mpensar las dif erencias en los siguientes aspecto s: • tamaño: se normaliza la di stancia entre los ojos y entre los ojos y la b oca . En otras palabra s: se normaliza la altura y la anchura de la ca r a. Como se ha co mentado antes, esto supone una pequeña distorsión en la forma de la ca ra, pero los resultados demuestran una mejora. La l oca li zación de los o jo s y la b oca se rea li za ma nu almente al no ser un o bj etivo del proyecto, pero existen métodos a ut omá ti cos muy ef icientes ([3]) • rotación en el pl ano de la imagen: utilizando las posiciones de l os dos ojos, se efectúa una rotación de la imagen de manera que los dos ojos queden en ho ri zontal • zona de la cara utilizada: la cara se recorta de manera que no apar ezca n zonas del fondo de la imagen ni zonas del pelo, cuyo asp ec to es muy va ri a bl e y que perjudicaría la robust ez del sistema • contraste y ni vel de iluminación: se expande el ran go de ni veles de g ri s de la imagen al máxim o. Al estar representadas el 8 bits, esto hace que el valor mínimo de los pi xels pase a cero y el máximo a 255. Esta etapa sólo d ebe ría rea li zarse d esp ués de la de r eco rte de la ca ra, de lo co ntra ri o el pelo y el fondo po dr ían di storsionar los resultados • R AMAS DE E STUDIA TES DEL IEEE La normalización del tamaño y de la rotación e co nsigue realizando un nu evo muestr eo so br e la imagen en el que las posi cione s de los ojos y la boca sea n fijas. El proceso se puede ver en la figura 10. Figura Jo. El pr oceso de rellllles /r eo. 4.2.2. Cálculo de las eigenfaces En esta fase se rea li za el PCA con el que se extraen las eigenfaces, mediante los sig ui entes paso s: • se ca lc ul a de la cara media y se resta de todas las ca ras normal izadas • se forma la matriz ~ cuyas columnas son las imágenes del co njunto de entrena mi ento normali zadas • se r ea liza la SVD de la matriz ~ , da nd o como resultado tres matrices, una de e ll as co nteniendo los vectores propios (las eigen.laces) y otra las raíces cua dr adas de los valores propios • se guardan las ei geifaces así como la proyección de las imágen eJ de entren amie nto sobre e ll as (coeficientes de las imágenes de entrena mi ento) 4.2.3. Proyecci6n sobre las eigellfaces Las eige/ifaces forman un co njunto orton or ma l. Por lo tanto, para ha ll ar la proyección de una imagen sobre e ll as ba sta co n r ea li zar el producto escalar de la imagen so br e cada un a de las ei ge ifa ces. 4.2.4. Fase de comparaci6n/decisi6n El objetivo es determinar que imagen del conjunto de entrena mi ento es más parecida a la imagen de test, a partir de sus re pr ese ntaciones me di ante las ei ge nfaces (sus pr oyecciones ). Para e ll o se co mp ara el vector YTEST formado por las proyecciones de la im age n de test so br e las eige nf aces co n cada uno de los vectores YEN1 ,. El cr iterio que se utiliza es el de la menor distancia euclíd ea , es decir, menor lyTEST -y ENTI I Figura JI. Ej el7lplode la bosededorosde Berna 19 S.RESULTADOS 5.1. Imágenes utilizadas Para probar el sistema e utilizaron dos conjuntos de im ágenes. La base de datos de Berna consiste en im ágene s de 30 perso na s (todas de sexo ma sculino). De cada perso na se seleccionaron un a vista frontal , otra vista frontal con li ge ro s cambios de expresión y una vis ta lateral con un li gera rotación en profundidad. Va ri as person as ll evan gafas y alg un as ba rb a. En la fi gura 11 ve mos un eje mplo. La base de datos de Stirling consiste en im ágenes de 17 mujeres y 15 hombre s, s in gafas ni ba rb a. De cada perso na se seleccionaron tres vistas equivalentes a la s a nt erior es pero con un grado de dificultad más elevado que en la anterior base de dato s: en la segunda vista frontal los cambios de ex presión son m ás acusados y en la vista lateral la rotación hace que parte de la cara no se vea. FiglU'tl I2. Ejemplo de imágen es de la base de datos de Slidlilg 5.2. Pruebas Se realizaron dos pru eb as . En a mb as se utilizaron como conjunto de entrenamiento l as 62 vis ta s frontales de perso na s diferente s. En la primera pru e ba se utilizaron l as 62 segund as vist as frontales co mo conjunto de t es t, mi entras que en la segunda se utilizaron la s vist as latera le s. Lo s r es ult ados e muestran en la figura 13. También se indican los resultados parc ial es con l as im ágenes de cada base de dato (con el conjunto de entrenamie nt o total de 62 imágenes). Como se puede ve r, lo s cambios de expresIOn apenas afectan a la eficacia del sistema. Sin embargo, la s rotaciones en profundidad producen tal cambio en la im agen que la representación mediante eigerifaces deja 20 PRUEBA CON J m.r-rO 1 CON J UNTO TOTAL BERNA STIRUNG ! DE ENTREN DE ITST Pru~b a 1 I 62 fron t alu I 62 tr on talt'5 6062 3030 30 JZ I ( I POr DeoR _ t 1 DOr' peon. ) Prut-ba 1: I 62 frontalu 61laltrall's 2962 2 ~ JO 432 I (1 DOr~rs . ) loorD e n.) Figura I3. R esul tad os del sistema de ser adecuada y se producen errores. Partic ul arme nt e con la s im ágenes de la base de datos de Stirling se producen mu y malo re s ult a do s debido a qu e la rot ac ión es mu y pr onunciada 6. CONCLUSIONES El sistema qu e se ha presentado ob ti ene unos buenos re sultados, pero con cie rt as limit ac iones. En concreto la s rotaciones en profundidad pro du cen ca mbios qu e la represe nt ac ión mediante eigenfaces no pu ede as imila r. Este problema es co mún a casi tod os l os sistema s de recon oc imiento, y de momento no se ha conseg ui - do resol ve r utilizando un a sola imagen por persona en el conjunto de entrena mi e nt o. La s úni cas so lu ciones so n utili za r un múltipl es vist as de cada persona en el conjunto de entrena mi e nt o, pero estas vistas no rm a lm e nt e no están di sponibles y se ne cesitan mu ch as para poder abarcar todas l as rotaciones pos ibl es, neces it ándose ad em ás much as m ás memoria y cálc ul os ind epe ndi e nt emente del sistema utilizado. Otro proble ma qu e no se ha tratado en este artículo pe ro que también produce di ficultades son lo s cambios de iluminación, en concreto de la dirección de ilumin ac ión. En algunos trabajos de nu evo se recurre a tener múltiple vis ta s de cada perso na (una pa ra cada co ndi ción de iluminación difere nt e) pa ra poder saber co mp ensar esos ca mbi os, pero los proble ma s siguen sie nd o los mi smos, sie nd o el princ ip al qu e no rm a lm e nt e sólo se va a di sponer de un a vista (frontal) para el conjunto de entrena mi e nt o. Como conclusión se puede dec ir que aunque es tán en continuo avance y los r es ult ad os son ace pt abl es , los sistemas de reconocimiento de ca ra s tod av ía deben s up erar alg un as limitaciones. 7. BmLIOGRAFÍA [1] L. SI ROVICH A o M. K IRBY, "Low-d im ensional procedure for th e char ac te ri za ti on of faces". J. Opt. Soco Am. A. vo l. 4, num o 3, 19 87, pp . 519-5 24. [2] M. TU RK ANO A. P EN TLA N O, "E igenfaces for re cognition", J. Cognitive euroscie nc e, vo l. 3, num o 1, 1991. [3] A. PE TLANO, B. M OG HAOO AM A NO T. S TARNER , "Viewbased and modulareigenspaces for face recognition", lEE Conf. On Computer Vision & Pattern Recognition. Seattle, WA , July 19 94. B R AN N° ] I M AYO 1998