scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

En el contexto de la interacción hombre maquina a través de agentes conversacionales existe una problemática conocida como el Uncanny Valley (Valle desconocido) que hace referencia al rechazo que los modelos de texturización sintética producen en el espectador conforme su realismo va aumentando y mientras este no sea de una calidad prácticamente indistinguible de un ser humano. El modelado basado en imagen es la técnica de generación de mallas 3D que permite reconstruir un modelo real en un computador a través de una serie de fotografías del mismo y es la técnica utilizada para generar mallas 3D que intenten solventar ese problema. La memoria recoge un primer bloque en el que se hace un análisis de los conceptos básicos del modelado basado en imagen. Se estudia la aplicación de esta técnica en el desarrollo de un agente conversacional analizando sus ventajas e inconvenientes así como un análisis de la teoría del Uncanny Valley. En un segundo parte se presenta el caso de dos modelos humanos obtenidos a través de fotografías múltiples con el software 123D Catch. Se analizan los programas necesarios para su edición y procesado, Zbrush , así como procedimiento seguido para la adaptación de estos modelos al desarrollo de un agente conversacional humano. Finalmente se presenta un modelo 3D con los modificadores necesarios para generar las imágenes básicas necesarias para realizar una animación de un agente conversacional humano. Parra Castillo, Ibón; Serón Arbeloa, Francisco José

Full text

Agradecimientos Al Dr. Francisco José Serón por su ayuda y colaboración en el proyecto . A mi familia, por su apoyo y confi anza. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 3 Resumen del proyecto En el contexto de la interacción hombre maquina a través de agentes conversacionales existe una problemática conocida como el Uncanny Valley (Valle desconocido) que hace referencia al rechazo que los modelos de texturización sintética producen en el espectador conforme su realismo va aumentando y mientras este no sea de una calidad prácticamente indistinguible de un ser humano. El modelado basado en imagen es la técnica de generación de mallas 3D que permite reconstruir un modelo real en un computador a través de una serie de fotografías del mismo y es la técnica utilizada para generar mallas 3D que intenten solventar ese problema. La memoria recoge un primer bloque en el que se hace un análisis de los conceptos básicos del modelado basado en imagen. Se estudia la aplicación de esta técnica en el desarrollo de un agente conversacional analizando sus ventajas e inconvenientes asi como un análisis de la teoría del Uncanny Valley. En un segundo parte se presenta el caso de dos modelos humanos obtenidos a través de fotografías múltiples con el software 123D Catch. Se analizan los programas necesarios para su edición y procesado, Zbrush , así como procedimiento seguido para la adaptación de estos modelos al desarrollo de un agente conversacional humano. Finalmente se presenta un modelo 3D con los modifi cadores necesarios para generar las imágenes básicas de una animación de un agente conversacional humano. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 4 ÍNDICE 1Introducción 6 1.1-Contexto 6 1.2-Objetivos 6 1.3Descripción de la memoria 6 2) Fundamentos, defi niciones y problemas: 7 2.1Image based modeling (modelado basado en imágenes). 7 2.1.1 Concepto, geometría y matemáticas 7 2.1.1.1 Geometría epipolar. 8 2.1.1.2 Análisis de imágenes y correspondencia entre puntos. 11 2.1.1.3Reconstrucción modelo 3D 12 2.1.1.4Triangulación Delaunay 13 2.1.2Texturizado 15 2.1.3Análisis y ventajas del método. 15 2.2Embodied Conversational Agent (Agente conversacional humano) 16 2.2.1Ejemplos de agentes conversacionales 17 2.2.2.1 Aplicaciones de los ECAS: 19 2.2.2Elementos de un agente conversacional 19 2.2.2.1Modelo 3D 20 2.2.2.1.1Malla 3D 20 2.2.2.1.2-Textura 20 2.2.2.1.3Nivel de poligonación. 21 2.2.2.2Animación 22 2.2.2.2.1-Lip Sync. 22 2.2.2.2.2-Fonemas y expresiones faciales: 23 2.2.2.2.3 Técnicas de animación 25 2.2.2.2.3.1-Morphing. 25 2.2.2.2.3.2-Animación con huesos 27 2.2.3Retos y objetivos de las técnicas 28 2.3) Uncanny Valley 29 2.3.1-Hipótesis 30 2.3.2-Explicación 30 2.3.2.1-Errores 31 2.3.2.2-Exitos 31 2.3.3-Cómo evitarlo 32 2.3.3.1-Ejemplo Emily 32 Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 5 3-Software utilizado. 34 3.1-123D Catch®. 34 3.2-Zbrush® 34 3.3-3ds Max® 34 3.4Vray® 35 3.5Photoshop® 35 4-Contruccion de modelo validos para ACH 36 4.1 Presentación 36 4.1.1 Modelo de un hombre. 36 4.1.2Modelo de una mujer. 36 4.2-Procediemiento 37 4.2.1 Sesión fotográfi ca. 37 4.2.2-123D Catch 38 . 4.2.3 Edición de mallas en Zbrush 39 4.2.4 3ds max 42 4.2.5-Vray 43 5-Imágenes fi nales 44 5.1-Modelo 3D del hombre 44 5.2-Modelo 3D de la mujer 49 5.3-Expresiones faciales 54 6Conclusiones 56 7Trabajo futuro 57 8-Programación 58 Anexo I Software uilizado 1-12 Anexo II Procedimiento 1-30 Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 6 1Introducción 1.1-Contexto Entre las diferentes técnicas ofrecidas por el área de los gráfi cos por computador que se conocen como Modelado Basado en Imagen se pueden destacar aquellas que permiten crear modelos 3D texturizados de un objeto a partir de un conjunto de imágenes de dicho objeto. De entre sus numerosas aplicaciones, existe una que esta relacionada con obtención de Agentes Humanos Conversacionales como los que se utilizan en entornos de interfaz de usuario, realidad virtual y aumentada, videojuegos... Las representaciones de estos agentes con apariencia humana han chocado hasta el momento con la psicología de los seres humanos que muestran un rechazo visceral a los modelos 3D texturizados sintéticos según estos van avanzando en calidad y realismo si no llegan a un nivel de calidad prácticamente indistinguible de otro ser humano. 1.2-Objetivos Este proyecto pretende analizar la problemática asociada a este tipo de innovaciones, aprovechando la aparición de aplicaciones para usuarios capaces de ofrecer estas funcionalidades (123D Catch) y herramientas de refi namiento y modifi cación de mallas como Zbrush. Los objetivos de este proyecto consisten en: -Conocer las posibilidades de las tecnologías estudiadas. - Utilizarlas para el desarrollo de un conjunto de visualizaciones básicas como en las que se basan aplicaciones que utilizan agentes conversacionales humanos. 1.3Descripción de la memoria En la primera parte de la memoria se describen los conceptos en los que se basan las técnicas de reconstrucción 3D a través de fotografías múltiples, la visión estereoscópica, la geometría epipolar y el fl ujo óptico. En la segunda parte se explica que es un agente conversacional y sus elementos básicos, el modelado 3D y su animación de fonemas y expresiones. Conocidos estos dos temas, se explicará la utilidad de la reconstrucción 3D para solventar uno de los problemas a los que se enfrentan los modelos de apariencia humana: el Uncanny Valley. Finalmente se describe el procedimiento seguido para realizar dos modelos 3D de apariencia humana basados en modelos reales y las imágenes para su visualización. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 7 2) Fundamentos, definiciones y problemas: 2.1) Image based modeling1 (modelado basado en imágenes). Dentro del modelado 3D existen varias técnicas para obtener información del mundo real y poder hacer uso de ella en un ordenador. Una de estas técnicas es el Modelado Basado en Imagen (Image Based Modeling). Los siguientes conceptos hacen referencia a la base teórica sobre la que se sustenta y de la que hacen uso los diferentes programas de reconstrucción 3D. Figura 1. Ejemplo de sesión fotográfi ca El modelado basado en imagen es un sistema que nos permite, mediante una secuencia de fotografías desde diferentes ángulos de un mismo objeto, obtener un modelo 3D del mismo con todas sus características físicas, ya sean geometrías, de color o iluminación. Esto se consigue por medio de operaciones y algoritmos matemáticos los cuales se encargan de relacionar dos puntos de dos fotografías diferentes y obtener el punto situado en el espacio al que hacen referencia . A partir de este planteamiento se puede interpolar la posición de la cámara y del resto de los puntos del modelo en el espacio pudiendo así obtener fi nalmente una nube de puntos y posteriormente un modelo 3D. Figura 2. Esquema de una escena y las imágenes captadas. 2.1.1 Concepto, geometría y matemáticas Esta técnica de reconstrucción 3D se basa en el concepto de la visión estereoscópica producida por la disparidad binocular Se conoce como disparidad binocular (fi gura 3) o retinal a la ligera diferencia entre los imágenes generadas por los dos puntos de vista proporcionados por ambos ojos. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 8 La disparidad binocular2 es la forma de percibir profundidad y relieve más utilizada por el cerebro humano. Figura 3. Esquema de disparidad binocular. Como se puede ver en la fi gura 4, la imagen tridimensional, se obtiene a través del análisis, ya sea por el cerebro o por un computador, de las pequeñas diferencias que existen entre las imágenes tomadas desde dos puntos de vista diferentes del mismo objeto o escena. Figura 4. Ejemplo de imágenes diferentes a través de visión binocular 2.1.1.1 Geometría epipolar3. La geometría epipolar (fi gura 5) es la geometría de la visión estereoscópica. Cuando dos cámaras observan una escena 3D desde dos posiciones distintas, existe una relación geométrica entre los puntos 3D y sus proyecciones sobre las imágenes en 2D que conducen a las restricciones entre los puntos de la imagen. Figura 5.Geometría epipolar En la fi gura 5, OL y OR representan los centros de proyección de las dos cámaras. X representa el punto de interés por ambas cámaras. Puntos XLy XR son las proyecciones del punto X en los planos de imagen. Sé define el plano epipolar para cada punto de la imagen como aquel que contiene los dos centros ópticos Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 9 (ojos, OLy OR) y el punto bajo estudio (objeto, X). Una vez establecido el plano epipolar, se puede determinar la recta epipolar, que se define para cada punto y cada cámara como la intersección del plano epipolar con el plano de la imagen captada. Por tanto: Si la posición del punto de proyección xL es conocida, entonces la línea epipolar eR - xR es conocida y el punto X proyectado en la imagen de la derecha, en un punto xR que debe estar en esta línea epipolar particular. Esto signifi ca que por cada punto observado en una imagen se debe observar el mismo punto en la otra imagen en una línea epipolar conocida. Esto proporciona una restricción epipolar a los puntos de la imagen y signifi ca que es posible probar si dos puntos realmente corresponden al mismo punto 3D. Si los puntos xL y xR son conocidos, también se conocen sus líneas de proyección. Si los dos puntos de imagen corresponden a los mismos puntos 3D las líneas de proyección deben intersectar precisamente en X . Esto signifi ca que X puede calcularse a partir de las coordenadas de los dos puntos de la imagen, un proceso llamado triangulación . En la fi gura 6, se consideran los puntos P, piy pd. Dado pi, P puede caer en cualquier punto del rayo defi nido por Oi y pi. Pero dado que la imagen de este rayo en la imagen derecha es la línea epipolar a través del punto correspondiente pd dicho punto debe estar sobre la línea epipolar. Esta correspondencia establece una aplicación entre puntos de la imagen izquierda y rectas de la imagen derecha y viceversa. Figura 6. Esquema de la geometría epipolar con vectores. La fi gura 6 muestra las dos cámaras, sus centros de proyección, Ol y Or, y sus planos imagen o retinas en coordenadas normalizadas. Las longitudes focales de la cámara se nombran como fi y fd. Cada cámara identifi ca un sistema de referencia 3D, el origen del cual se sitúa en el centro de proyección de la cámara y el eje Z con el eje de óptico. Los vectores se refi eren al mismo punto en el espacio, P, como vectores en los sistemas de referencia de la cámara izquierda y derecha respectivamente. Estos vectores defi nen por tanto las proyecciones del punto P en la imagen izquierda y derecha y están expresados en su correspondiente sistema de referencia. Evidentemente, para todos los puntos de las imágenes se tiene zi=fi fi o zd=fd de acuerdo a la imagen que sea. Los sistemas de referencia de las cámaras izquierda y derecha están relacionados a través de los parámetros extrínsecos. Estos defi nen una transformación rígida en el espacio 3D defi nida por un vector de traslación y una matriz de rotación R. Dado un punto P en el espacio la relación entre Pi y Pd es por tanto Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 16 2.2) Embodied Conversational Agent (Agente conversacional humano) Un agente conversacional humano es una interfaz de interacción hombre-máquina diseñada para mantener una comunicación con el interlocutor a través de su apariencia y movimientos similares a los humanos, y tiene como objetivo convertir esta relación en lo más natural posible. Figura 13. Agentes conversacionales humanos. Entendemos pues, que un agente conversacional es ese modelo 3D de apariencia humana que mediante una pantalla, proyector u holograma permite interaccionar con una máquina mediante una conversación similar a la que se tendría con un humano. Esta conversación se puede llevar a cabo mediante texto, de forma oral o incluso una conversación no verbal. En la relación de interacción entre hombre y un ordenador hay algo que el usuario no puede obviar, y es que fi nalmente está interactuando con una máquina. Es en este punto donde los agentes conversacionales buscan minimizar esa sensación de frialdad o lejanía con la máquina haciendo que esta relación, fi nalmente, sea lo más humana posible. Los agentes conversacionales o ECA llevan a cabo esta comunicación humanizada con el usuario mediante una morfología, gestos, expresiones y lenguaje lo más realista posibles. Agentes conversacionales animados o ECA (Embodied conversational Agents) son interfaces gráfi cas capaces de comunicarse de manera verbal y no verbal con el usuario. Mediante el uso de movimientos y expresiones faciales básicos, un sintetizador de voz y la sincronización de esta con el movimiento de los labios (Lip Sync) son capaces de responder a los requerimientos hechos por el usuario manteniendo así una conversación a nivel gestual, escrita o verbal. Todo esto unido a una representación 3D del modelo humano a imitar generan un conjunto que es capaz de comunicarse en varios niveles con el usuario de la interfaz. Realizar un ECA es una tarea que reúne a muchas disciplinas, incluye desde problemas tradicionales de la Inteligencia artifi cial, de cómo procesa la información recibida y como responde, a los propios de las Ciencias sociales, qué responde y de qué forma. Es por tanto que el lenguaje verbal, gestual y el contenido mismo de la conversación afectan directamente a la relación del usuario con el ECA. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 17 2.2.1Ejemplos de agentes conversacionales Podemos encontrar algunos ejemplos de ECAS y se pueden ordenar según su complejidad, tanto de modelo 3d, como de animaciones o nivel de su conversación. En un primer nivel de complejidad podemos encontrar ejemplos de ECA con pequeñas animaciones: - Asistente de microsoft offi ce (fi gura 14). Fue utilizado para proporcionar la ayuda al usuario del paquete Offi ce de Microsoft. Carecía de forma humana realista siendo generalmente una representación amigable del propio menú de ayuda a través de un personaje cartoon. La comunicación era escrita haciendo preguntas básicas al usuario que podía responder haciendo click en algunas en las opciones que le ofrecía. Contaba con algunas animaciones básicas que buscaban captar la atención del usuario. Se ha hecho famoso por en ocasiones ser algo molesto por su insistencia. Figura 14. Agente conversacional Microsft Offi ce. Si avanzamos en complejidad, ya no tanto de las animaciones si no de la relación con el usuario podemos encontrar: -Anna de Ikea (fi gura 15). Figura 15. Agente conversacional Anna de Ikea. Se trata de un avatar virtual que actúa a modo de asistente en la búsqueda de productos dentro de la página web de IKEA . El usuario de la página web puede expresar el motivo de la búsqueda en un campo de texto como si de una conversación se tratara, con una pregunta de estructura completa y esperar que el asistente le conteste de manera acorde. Reconoce la estructura e intención de la consulta ofreciendo una respuesta en el mismo nivel de comunicación. Se trata de un avatar con un número limitado de expresiones dado su campo de aplicación, el mundo web, donde Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 18 prima la velocidad de descarga y respuesta sobre la calidad del mismo. Aun así, las intenciones y reacciones del avatar animado van siempre en relación con el contenido de la conversación, expresando por ejemplo, alegría o repulsión en función de la conversación que se esté manteniendo. -Mobile secretary (fi gura 16) Figura 16. Mobile secretary En el siguiente nivel complejidad aparecen ejemplos como Mobile Secretary, un avatar que gestiona y proporciona avisos de los eventos del teléfono móvil, y que acompaña sus mensajes con gestos, imitando el lenguaje corporal que seguiría una persona en esas situaciones concretas. Un lenguaje corporal adecuado, además de complementar visualmente el discurso, proporciona numerosos elementos de naturalidad -aunque el parpadeo del avatar no proporcione información, le hace parecer más realistaque provocan en el interlocutor una mayor sensación de confi anza, lo que incrementa automáticamente el nivel de credibilidad. -Proyecto RED6. (Figura 17) Se trata de una gente conversacional desarrollado para su uso en hospitales que busca reducir la tasa de rehospitalización utilizando avatares en representación de enfermeros para realizar un mejor diagnóstico de los pacientes y sus síntomas Nos encontramos ante un ECA de alta complejidad técnica en cuanto al nivel de la conversación que ha de llevar a cabo pero que tiene su punto más fl aco en el aspecto realista de la interacción, tanto el avatar como sus gestos y expresiones son todavía muy primitivas. Figura 17. Proyecto RED Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 19 2.2.2.1 Aplicaciones de los ECAS: En esencia un ECA es una interfaz, y como tal tiene múltiples aplicaciones. Si pensamos en la cantidad de veces que interactuamos con un máquina en una jornada normal, muchas de ellas pueden estar apoyadas o sustituidas por un ECA. Desde la máquina de billetes de autobús, un cajero o una ventanilla de cualquier administración. Por hacer un ejemplo de clasifi cación, podríamos hablar de: -Asistentes Virtuales Sociales: Su propósito es conversar libremente acerca de algo con cualquier usuario, así como lo haría con un amigo. Usados principalmente para el entretenimiento. -Asistentes Virtuales Educacionales: Su propósito es ayudar a aprender acerca de algo,como un nuevo lenguaje, historia, geografía, etc. Tienen uso en centro educativos. -Asistentes Virtuales Orientados a Servicios: Estos generalmente son utilizados por empresas que ofrecen servicios.. Su propósito es ayudar a los clientes a encontrar el camino en el sitio web o en el uso concreto de algún dispositivo así como contestar preguntas acerca de sus productos y servicios. Por lo tanto, si vamos a introducir un ECA en alguna de las facetas de la vida diaria, a la hora de llevar una conversación con una persona deben ser capaces de realizar acciones comunes como: -Representar rasgos en su personalidad. De ser un elemento amigable, cariñoso, gracioso o por el contrario autoritario y estricto debe ser capaz de representarlo a través de su actitud tanto en lenguajes verbal como gestual. -Emociones, objetivos e intenciones. A la hora de llevar una conversación un ECA debería ser capaz de expresar emociones que hagan referencia al contenido de la conversación, así como posibles objetivos o intenciones de la misma. -Representación de la conversación. La representación gestual de la conversación debe ser acorde con el contenido de la misma. Es por esto que los gestos faciales deberán ir sincronizados con los sonidos o el texto emitido por el agente conversacional. Como podemos observar, en todos elementos que el ECA debe ser capaz de llevar a cabo en una conversación entran en juego muchas expresiones tanto faciales como corporales apoyadas en un lenguaje verbal. 2.2.2Elementos de un agente conversacional Una vez analizados algunos tipos de ECA podemos apreciar que tienen 3 grandes apartados y que son los que forman fi nalmente la totalidad del agente conversacional. -La conversación: Hace referencia a cómo interpretan lo que el usuario les dice y posteriormente a cómo llevan a cabo su respuesta, en cualquiera de los niveles en los que se esté desarrollando la conversación, verbal, escrita o gestual. Es un campo que afecta más a la inteligencia artifi cial, reconocimiento de voz, rostro, etc. -Su apariencia humana. (Modelo 3D) La apariencia real que toma el avatar. Su formas y colores que le llevan a ser similar a un humano. Afectan al modelado y texturizado 3D. -Sus movimientos. (Animación 3D) Enmarca las animaciones de las que hace uso el avatar para llevar a cabo la conversación. Van desde los corporales, como pueden ser los movimientos con las manos o las piernas hasta las posiciones que adopta la cara al generar un fonema o una expresión concreta. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 20 2.2.2.1Modelo 3D Al desarrollar un humano en 3D tenemos que tener en cuenta que cualquier modelo 3D estático, sin animación, tiene las siguientes características o componentes. 2.2.2.1.1Malla 3D Comprende todos los polígonos que generan el modelo del personaje. La acumulación de los mismos y la posición relativa entre ellos acaba dando forma a un modelo. Esta malla está compuesta por tres elementos básicos. El punto, la recta o arista y el polígono. De tratarse de una malla poligonal triangular, cada polígono estará delimitado por tres segmentos o aristas y cada una de estas por dos vértices o puntos. Figura 18. Modelo humano 3D. 2.2.2.1.2-Textura Hace referencia al color que toman los polígonos del modelo. La aplicación de esta textura sobre el modelo le permite a éste adoptar un color u otro en la visualización fi nal del modelo. Esta textura es una representación 2D de una superfi cie 3D y por esto responde a una coordenadas determinadas y sufre una deformación como podemos ver en la fi gura 19. Figura 19: Esquema de un modelo 3D. Todo esto se hace mediante la aplicación de un mapa UV. El proceso de creación de un UV consiste en la asignación de los píxeles de la imagen 2D a la superfi cie de los polígonos 3D. Esto se hace mediante un desplegado de los polígonos del modelo 3D en un superfi cie 2D. En este proceso se produce una rotura del mismo a través de unas costuras para conseguir situar los polígonos sobre una superfi cie bidimensional. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 21 Una vez que el modelo está desenvuelto, se puede aplicar una textura en cada triángulo individualmente o a todos en conjunto para que cuando el modelo sea reconstruido, esta textura se aplique a modo de calco sobre el modelo 3D. En muchos casos este mapa UV puede estar generado automáticamente, pero lo más normal es que a la hora del modelado se elijan las zonas de rotura del modelo para obtener así una mejor aplicación de las texturas (ejemplo rotura de cabeza) Figura 20. Textura y mapa UV. 2.2.2.1.3Nivel de poligonación. En un agente conversacional, al tratarse de un elemento animado, se debe tener especial cuidado con el número de polígonos que conforman el modelo fi nal. La calidad de visualización de un avatar 3D depende directamente de la cantidad y tamaño de los polígonos utilizados, siendo más detallado cuando más cantidad y más pequeños son. Esto está enfrentado directamente con la capacidad de computación y la facilidad a la hora de animar un personaje. Cuanto mayor sea la cantidad de polígonos, más compleja y costosa computacionalmente será llevar a cabo la animación. Figura 21: Nivel de poligonación Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 22 2.2.2.2Animación En conjunto con el modelo 3D con apariencia humana va la animación del mismo. Su movimientos la sincronía de los mismos no harán sino incrementar más el realismo de la animación. Figura 22. LipSync En la animación de personajes y muy en concreto en aquellos con los que se quiere realizar una simulación de habla o conversación se ha de tener en cuenta un concepto como es el Lip Sync o sincronía de labios. 2.2.2.2.1-Lip Sync7. El lip sync es el concepto que hace referencia a la sincronía de los labios y si se quiere, de la cara en general, con el audio que acompaña la animación. Se trata de una técnica cuyos conceptos básicos nos van a permitir realizar un acercamiento a las técnicas de animación de personajes y más en concreto a las referentes a la animación facial. No existen las letras en los diálogos. A la hora de realizar una animación que acompaña a un diálogo, lo primero que tenemos que tener en cuenta y debemos observar es que un sonido no es una letra, y por lo tanto una letra no implica directamente una posición concreta en la boca. Las letras son símbolos representados en una página (con un sonido correspondiente arbitrariamente asignado) que cuando se colocan juntas forman palabras, que comunican un pensamiento. Pero las letras no están hechas para el habla. No hay letras en el dialogo, solo sonidos, y la fi gura (forma) que nuestra cara toma para hacer dichos sonidos. Las formas de la boca para los sonidos deben ser animadas en contexto. La forma de sonido que precede afecta a la forma de sonido actual. De igual modo, la siguiente forma de sonido es anticipada por la forma de sonido actual. Así las formas deben presentarse todas en contexto con la forma/sonido que las precede y la que la sigue. Es animar el “fl ujo” de formas que son necesarias para representar los sonidos dentro de lo que se esta comunicando. La mejor estrategia es interpretar el diálogo, capturar los elementos esenciales de la comunicación como fueron grabados en la pista de sonido. Interpretar la animación como un todo. Se deben interpretar las formas principales dejando un poco de lado los pequeños detalles. Una animación donde las aperturas de boca llevan una relación correcta con el audio es una animación, que aun sin grandes detalles parece sincronizada, cumpliendo totalmente el objetivo. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 23 Captar las poses abiertas y cerradas de forma correcta y construye a partir de ellas. Gran parte de la sincronización labial reside en colocar correctamente las formas abiertas y cerradas dentro de la animación. El resto, lo hace la conjunción del audio con las transiciones que se realizan entre los momentos claves de la animación. Elementos a tener en cuenta 1) Realizar una transición suave entre formas abiertas y cerradas. 2) No mantener las formas de sonido estáticas. Una cara esta en constante movimiento aunque no esté realizando sonidos. 3) Anticipar las formas de los fonemas a que se escuche fi nalmente el sonido. Los humanos vemos las cosas más rápidas que lo que escuchamos, por lo que tomamos las referencias de la forma antes que el sonido. 4) Rompe los ángulos y simetría de la boca. Podemos hablar y sonreír, hablar y bostezar, hablar y estar serios, etc. 5) Los dientes superiores no se mueven. Están unidos al cráneo. 6) No olvidar el movimiento de las mejillas y nariz cuando se adoptan los movimiento de los fonemas. Las mejillas y la nariz son estupendos conectores en la animación facial, cruzando el puente desde la animación de la boca a los ojos y a la animación de las cejas. Manteniendo la nariz y las mejillas en acción tú unes la cara del personaje, creando un personaje mucho más creíble el cual puede actuar. 2.2.2.2.2-Fonemas y expresiones faciales: Fonemas Existen una serie de fonemas que debemos tener en cuenta a la hora de hacer una sincronización labial. Cada fonema tendrá una posición diferente de labios, dientes y lengua. Hay que tener en cuenta que son formas de referencia y en cada animación o personaje puede haber pequeñas modifi caciones. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 24 Fonema: C, Z: Cero, caza , cepo, zoo Fonema L: Elección, alegrar,. Lucia Fonema, M, B, P: Mar, bien, perro Resto de fonemas y posición de transición: Fonema: G, W: Guapa, whisky Fonema A-E: Cara, reto, acto, plato, escena Fonema I: Vivo, frío, pirado, higo. Fonema O: Olor, odio, loco, exótico Fonema U. Funda, universo, tú Fonema C, CH, G, J. K,LL Casa, chapa, jirafa Fonema F: Fonema, feo, fantástico Figura 23. Fonemas Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 25 Expresiones faciales Figura 24. Ejemplos de expresiones en animación 2D. Durante la animación de un personaje con el cual se busca simular una conversación se ha de tener en cuenta que el agente conversacional a de ser capaz de adoptar una serie de expresiones faciales que permiten comunicar en su totalidad el mensaje pretendido. Es por esto que se han de tener en cuenta ejemplos de expresión facial tales como: Sorpresa, sospecha, duda, cansancio, indiferencia… En caso de necesitar una expresión en concreto, la mejor forma de obtenerla es observar cuales son los movimientos que se producen en la cara de un ser humano real l cuando la realiza. Figura 25. Ejemplos de expresiones 2.2.2.2.3 Técnicas de animación 2.2.2.2.3.1-Morphing. Comúnmente se conoce con el nombre Morphing a una técnica de manipulación de imágenes digitales que permite obtener una animación -transición controladaentre dos imágenes diferentes. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 32 2.3.3-Cómo evitarlo Uno de los métodos utilizados para evitar el valle inexplicable es la reconstrucción 3D a través de fotografías. 2.3.3.1-Ejemplo Emily10 Uno de los más claros ejemplos de animación facial que ha evitado a todos los niveles el valle inexplicable es el desarrollo de un actor virtual fotorealista como es Emily. “Es absolutamente increíble. Yo soy uno de los críticos más duros de la captura de la cara, e incluso tengo que admitir que estos chicos han dado en el clavo. Esta es la primera secuencia animada humano virtual que evita por completo todas mis advertencias subconscientes. Me da la sensación de Emily como persona. Toda la sutileza está ahí. Esto no es un trabajo publicidad, es la cosa real ... Yo declaro ofi cialmente que Image Metrics fi nalmente ha construido un puente sobre el valle inquietante, y trasladado al otro lado.” Peter Plantec, “ El Ojo Digital: Image Metrics intentos de Salto del valle inquietante “, VFXWorld, 07 de agosto 2008 Figura 35.Emily y las fotografías captadas Este proyecto buscaba generar un modelo 3D fotorealista mediante la captura de las expresiones de una actriz real en un entorno controlado y mediante el uso de múltiples fotografías. Figura 36. Malla base de Emily Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 33 Figura 37. Expresiones Emily Con esta fotografías buscaban captar la totalidad de los tonos de piel de la actriz en diferentes estados lumínicos así como algunas de las expresiones más características. Posteriormente, generando una geometría de alta resolución y otra de baja resolución realizan una animación facial mediante el uso de morphers. La animación de la actriz generada por ordenador, se incrusta en un vídeo real tomando como referencia el marco de la cara de la actriz real previamente grabada. Figura 38. Fotograma animación Emily Todo este conjunto, la información captada del modelo físico, su forma tridimensional, su color de piel, las deformaciones de la cara en cada una de las expresiones es lo que fi nalmente hacen que esta animación se un ejemplo de buenas prácticas y un referente en cuanto a cómo hacer una animación facial que busca solventar el valle inexplicable. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 34 3-Software utilizado. Durante el proyecto se ha hecho uso de varios tipos de software, los cuales se describen brevemente a continuación. Los detalles sobre sus herramientas y características se encuentran en el anexo I de este proyecto. 3.1-123D Catch®11. Existen diferentes aplicaciones con la capacidad de generar modelos 3D a través de múltiples imágenes. Durante el desarrollo de este proyecto se ha utilizado 123D Catch. Se trata de un programa en fase Beta, que enmarcado dentro de la suite 123d App de Autodesk, permite a cualquier usuario obtener un modelo 3D mediante una serie de fotografías de una escena u objeto. Se trata de un programa preparado para un usuario con poco nivel técnico asi que con unos conocimientos básicos sobre como tomar las fotografías se puede conseguir un modelo 3D con un buen nivel de detalle. Se ha escogido este programa por ser un programa de descarga gratuita, su sencillez de uso y su gran capacidad de procesamiento. Durante el proyecto permitirá generar reconstrucciones 3D haciendo uso de las fotografías de los modelos escogidos exportandolo todo después al programa de edición. 3.2-Zbrush®12 ZBrush es un software de modelado 3d, escultura y pintura digital que constituye un nueva forma de afrontar los trabajos de modelado debido a su característica forma de trabajo. ZBrush es un programa con el que es posible esculpir detallados modelos de un modo semejante a pintar o trabajar la arcilla y es lo que ha popularizado entre los artistas 3D de las industrias del cine, videojuego e ilustración. El software se basa en el concepto de esculpir pintando sobre un objeto 3D y la posibilidad de aumentar cómodamente la cantidad de polígonos según vamos añadiendo detalle. Tiene la capacidad de trabajar con modelos de varios millones de polígonos, cosa impensable en otros software similares. En el proyecto es utilizado como el principal programa de edición y procesamiento de los modelos generados por la reconstrucción 3D. Se ha escogido este programa por ser capaz de manejar mallas de gran cantidad de polígonos con mucha fl uidez y por su característico fl ujo de trabajo. 3.3-3ds Max® 3ds max es un software de modelado y animación 3D comercializado por la empresa Autodesk. Se trata de un programa generalista que permite desarrollar todas las tareas necesarias para crear modelos, texturizarlos, animarlos y renderizarlos. Durante el desarrollo del proyecto ha permitido unir en un único modelo los diferentes componentes del agente conversacional generados asi como su texturizacion y edición. Se ha escogido este software por se uno de los programas con mas herramientas y posibilidades del mercado a la hora de resolver las necesidades del proyecto. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 35 Figura 39. Ejemplo de visualización de un modelo en 123D Catch Figura 40. Ejemplo modelo complejo en Zbrush 3.4Vray® V-Ray es el motor de render que funciona como plugin de programas como 3ds Max y que permite generar imagenes de los modelos 3D generados en dicho software. Se ha utilizado en conjunto con 3ds Max para generar las visualización del modelo fi nal del agente conversacional. 3.5Photoshop® Photoshop es un software de creación y edición de imagenes comercializado por la empresa Adobe. Se ha escogido este programa por estar ya familiarizado con su uso y caracteristicas generales. Durante el proyecto se ha utilizado para la edición y corrección de las fotografías utilizadas en la reconstrucción y para la generación y edición de mapas de textura para los modelos. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 36 4-Contruccion de modelo validos para ACH 4.1 Presentación En el desarrollo de este proyecto se ha llevado a cabo el desarrollo de 2 modelos 3D enfocados a generar las imagenes básicas necesarias para animar un agente conversacional humano. 4.1.1 Modelo de un hombre. Se trata de un modelo humano de un hombre cuyas fotografías se realizaron con un iPad en un entorno de iluminación exterior no controlada. Las imágenes, no fueron tomadas con el propósito de ser utilizadas en este proyecto y tenían como fi n ser usadas en una prueba del software 123D Catch. Son por tanto un caso extremo de fotografías tomadas por un usuario no experimentado y como tal no han sido retocadas. Son un total de 21 fotografías, tomadas en torno al modelo humano a una altura constante. 4.1.2Modelo de una mujer. En este caso se trata de una mujer a la que se le hicieron 56 fotografías a diferentes alturas y desde todos los ángulos. Se realizaron en un entorno con luz natural controlada y con un apoyo de luz artifi cial. Fueron tomadas con una cámara refl ex Olympus E-1 en formato RAW aunque fi nalmente se utilizarán convertidas en JPEG por ser el único formato admitido por 123D Catch. Figura 41. Imágenes del modelo del hombre. Figura 42. Modelo Mujer Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 37 4.2-Procediemiento A continuación se detalla el proceso seguido para generar las mallas 3D de ambos modelos y las tareas realizadas. Para mas detalles sobre el proceso seguido durante este desarrollo consultar anexo II. -Toma de fotografías: Unicamente se pudo realizar sesión fotográfi ca en un entorno controlado para el modelo de la mujer. El procedimiento utilizado responde a los directrices proporcionadas por la propia distribuidora del software y a los diferentes experimentos realizados. -Conversión de las fotografías RAW-JPEG: Las fotografías fueron tomadas en formato RAW dada su mayor calidad, para ser procesadas por 123D cach deberán ser convertidas a formato JPEG. -Parámetros de entrada Una sesión fotográfi ca en entorno controlado y con equipo fotográfi co profesional: -Parámetros de salida: Un conjunto de 56 imagenes en formato JPEG para el modelo de la mujer. Uno de 21 fotografías en formato JPEG para el modelo del hombre Figura43. Fotografías sesión fotográfi ca Figura 44. Fotografías sesión fotográfi ca 4.2.1 Sesión fotográfica. Procedimiento: (Apartado 1.1, anexo II) Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 38 -Generación de modelo 3D: Con las fotografías de los dos modelos se han generado las reconstrucciones 3D de ambas personas. -Eliminación de elementos sobrantes de la escena y corrección de errores: En las dos reconstrucciones aparecen elementos externos al modelo que se deben eliminar. -Exportación modelo 3d: El software permite exportar el modelo en formato Obj generando un archivo JPEG para la textura -Parámetros de entrada Conjunto de fotografías de ambos modelos, tanto del hombre como el de la mujer. -Parámetros de salida: Mallas 3D texturizadas en formato Obj y una textura en JPEG 4.2.2-123D Catch Procedimiento: (Apartado 1.3, anexo II) Figura 45. Modelos 123d Catch y sus texturas Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 39 -Importación de las mallas de 123D Catch a Zbrush Las modelos 3D obtenidos se deben importar a ZBrush para ser editados. -Selección de zona de trabajo: De ambos modelos seleccionaremos una parte el modelo para trabajar. En ambos casos se trata de la zona de la cara siendo lo menos importante el pelo y la zona de la nuca por tener menos detalle. -Adecuación de la malla al programa. Zbrush trabaja con malla basada en cuadrados mientras que la importada esta basada en triángulos. -Corrección de errores en la geometría y el color. Ambos modelos tienen una serie de errores comunes como son, la geometría de los ojos, las orejas, los labios y la nariz. En el caso del modelo del hombre es especialmente complejo ya que las fotografías fueron tomadas con una postura determinada y ha tenido que ser corregida. -Traspaso de información a un modelo animable. El modelo que fi nalmente animaremos debe tener unas características geométricas básicas como son las lineas de expresión y la simetria. Se deberá pasar la información del modelo escaneado al modelo animable. -Generación de detalle. Cuando la información ha sido traspasada al modelo animable se puede generar detalles en la textura tales como imperfecciones en la piel o arrugas. -Creación de mapas UV y mapas de textura. Los modelos que se están editando en ZBrush no tienen mapa UV y por lo tanto deben ser generados para poder exportar las texturas del modelo a otro programa. -Generación de morphers objetivo. Para el desarrollo de los diferentes fonemas y expresiones del agente conversacional habrá que desarrollar las formas básicas de dichas expresiones. Estas formas son las que conoceremos como morphers objetivo. Los morphers objetivo generados están clasifi cados de la siguiente manera: -Movimiento de mandíbula: Tanto para fonemas abiertos como fonemas cerrados. -Movimiento de parpados y cejas. -Movimientos de la cabeza. .2.3 Edición de mallas en Zbrush Procedimiento: (Apartado 2.1, anexo II) Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 40 -Parámetros de entrada 2 mallas de 123D Catch y sus texturas -Parámetros de salida: Modelos animables y mapas de texturas Morphers objetivo de cada uno de los modelos Modelos del interior de la boca Figura 46.Modelo del hombre y mapas de textura -Exportación de los morphers objetivo: Estas formas deben ser exportadas en formato Obj para poder generar en 3Ds Max un modelo animable mediante los correspondientes modifi cadores de forma. -Modelado de dientes y encías Como el modelo va a realizar movimientos de vocalización, debe tener generada la geometría del interior de la boca. Estos elementos serán modelados en ZBrush partiendo de sus formas primitivas y haciendo uso de sus herramientas de modelado y pintura hasta conseguir un modelo y su textura. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 41 Figura 47. Modelo de la mujer y mapas de textura Figura 48. Modelo del interior de la boca Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 48 Figura 64. Movimiento lateral de mandibula Figura 65. Movimiento lateral de mandibula Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 49 Figura 65Malla base de la mujer 5.2-Modelo 3D de la mujer -Malla 3D de base Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 50 -Movimiento de la cabeza. Figura 66. Giros de la cabeza Figura 67. Ladeos de la cabeza Figura 68. Mirada arriba y abajo Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 51 -Movimientos de labios y mandibula Figura 69. Fonemas abiertos y cerrados Figura 70. Labios apretados y sonrisa Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 52 Figura 71. Parpadeo normal Figura 72. Ceño fruncido Figura 73. Guiño -Movimientos de cejas y parpados Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 53 Figura 74. Wireframe del modelo y superposición de ojos, boca y piel. Figura 75. Wireframe del modelo y superposición de ojos, boca y piel. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 54 En esta posición de asustada se han utilizado: -El movimiento de los ojos hacia una esquina de la escena. -El movimiento de arqueo de cejas -Apertura de la boca -Movimiento hacia atrás y a un lado de la cabeza En esta posición de abatida se han utilizado: -El movimiento de los ojos hacia la parte baja de la escena -El movimiento negativa del morpher de la sonrisa -El 50% del parpadeo normal. Figura 76. Mirada de terror. Figura 77. Mirada de cansancio. 5.3-Expresiones faciales Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 55 En esta posición de carcajada se han incluido los siguientes morphers: -El parpadeo total. -La apertura de la boca. -La sonrisa y la media sonrisa. -Arqueo de cejas. En esta posición de mirada sospechosa se han utilizado: -El arqueo de cejas. -25% de parpadeo normal y 40% de parpadeo inferior -La sonrisa y la media sonrisa. -El movimiento de los ojos. Figura 78. Carcajada Figura 79. Mirada sospechosa. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 56 6Conclusiones Este este proyecto busca analizar la problemáticas asociadas al desarrollo de un modelo 3D para un agente conversacional a través la técnica del modelado basado en imagen. Aprovechando la aparición de aplicaciones para usuarios capaces de ofrecer estas funcionalidades (123D Catch) y herramientas de refi namiento y modifi cación de mallas como Zbrush. Los objetivos de este proyecto consisten en: -Conocer las posibilidades de las tecnologías estudiadas. -Utilizarlas para el desarrollo de un conjunto de visualizaciones básicas como en las que se basan aplicaciones que utilizan agentes conversacionales humanos. Para obtener los objetivos del proyecto se han realizado las siguientes tareas -Estudio de las técnicas y conceptos del modelado basado en imagen y las posibilidades para el desarrollo de un modelo para un agente conversacional. -Defi nición y análisis de los elementos y posibles aplicaciones de los agentes conversacionales como elementos de interacción hombre-maquina. -Estudio de las problemáticas asociadas al desarrollo de modelos de apariencia humana, como el Uncanny Valley, y el rechazo que estos pueden producir según aumenta su realismo. Para el desarrollo de los modelos 3D de apariencia humana se ha seguido un procedimiento consistente en: - Generar una reconstrucción 3D del modelo humano a través de fotografías mediante el uso de 123D Catch -Someterlo a un proceso de edición y adaptación en Zbrush que permita hacer uso de la información obtenida en la reconstrucción. -Desarrollo de fonemas y expresiones necesarias para un agente conversacional. -Generación de mapas de textura y UV para los modelos. -Generación de elementos 3D que no se habían obtenido en la reconstrucción 3D tales como los ojos y el interior de la boca. -Unión de todos los elementos en 3Ds Max. Como resultado fi nal del proyecto se han obtenido dos mallas 3D con los modifi cadores necesarios para poder desarrollar un animación mediante morphing de fonemas y expresiones de un agente conversacional humano. Este proyecto ha hecho uso de conocimientos adquiridos durante el Grado en Ingeniería de Diseño Industrial y Desarrollo de Producto, en concreto las asignaturas de interacción usuario-producto, fotografía o entornos 3D han aportado los elementos básicos para llevarlo a cabo. Por otro lado ha sido necesario adquirir otros conocimientos como de anatomía humana, animación 2D y 3D asi como los conocimientos para hacer uso de herramientas informáticas como 123D Catch, Zbrush, 3DsMax, Vray o Photoshop. Las principales difi cultades en el desarrollo del proyecto se han encontrado en el aprendizaje de las técnicas necesarias para conservar la informacion del modelo obtenido con las fotografías y hacer que esta fuera realmente útil. La edición en Zbrush para conseguirlo ha sido la fase mas laboriosa y que mas difi cultades ha generado. Trabajo de Fin de Grado. Grado en Diseño Industrial y Desarrollo de Producto. Ibón Parra Castillo Memoria 57 7Trabajo futuro De poder seguir desarrollando los modelos que se han obtenido durante este proyecto los esfuerzos deberían centrarse en maximizar el detalle obtenido en la primera reconstrucción en 123D Catch. Las fotografías deben estar aun mas controladas tanto en iluminación como en posición para poder conseguir minizar aun mas los errores. Otro aspecto al que también se debería prestar atención sería el desarrollo de los detalles del modelo tales como el pelo y las pestañas que en este proyecto se han quedado sin profundizar. Son elementos que unidos al máximo detalle posible en el modelo de la cabeza y su textura marcaran una gran diferencia en cuanto a calidad se refi ere. Figura 80. Ambos modelos en reposo