scieee AI-readable full text Open interactive document viewer

Hacia un sistema de reconocimiento del lenguaje corporal en presentaciones orales utilizando técnicas de machine learning

Hoyos Vera, Yulieth

Abstract

Departamento de Teoría de la Señal y Comunicaciones e Ingeniería Telemática

Full text

UNIVERSIDAD DE VALLADOLID ESCUELA TÉCNICA SUPERIOR DE INGENIEROS DE TELECOMUNICACIÓN TRABAJO FIN DE MÁSTER MÁSTER UNIVERSITARIO EN INVESTIGACIÓN EN TECNOLOGÍAS DE LA INFORMACIÓN Y LAS COMUNICACIONES HACIA UN SISTEMA DE RECONOCIMIENTO DEL LENGUAJE CORPORAL EN PRESENTACIONES ORALES UTILIZANDO TÉCNICAS DE MACHINE LEARNING Autora: Yulieth Hoyos Vera Tutor: Ioannis Dimitriadis Damouils Valladolid, 20 de septiembre de 2024 ETSIT. Universidad de Valladolid. TÍTULO: Hacia un sistema de reconocimiento del lenguaje corporal en presentaciones orales utilizando técnicas de machine learning AUTORA: Yulieth Hoyos Vera TUTOR: Ioannis Dimitriadis Damoulis DEPARTAMENTO: Departamento de Teoría de la Señal y Comunicaciones e Ingeniería Telemática TRIBUNAL PRESIDENTE: D. Ignacio de Miguel Jiménez VOCAL: D. Mario Martínez Zarzuela SECRETARIO: D. Santiago Aja Fernández SUPLENTE: Dña. Miriam Antón Rodríguez SUPLENTE: D. Jesús Poza Crespo SUPLENTE: D. José Ramón Durán Barroso FECHA: 20 de septiembre de 2024 CALIFICACIÓN: ETSIT. Universidad de Valladolid. 3 Resumen Las instituciones educativas enfrentan el desafío de evaluar y mejorar las competencias del siglo 21 en los estudiantes. Estas competencias son fundamentales para su desarrollo académico y profesional. La comunicación no verbal, que incluye gestos y posturas, es especialmente importante para enriquecer la competencia de comunicación oral. Esta habilidad permite mostrar emociones y actitudes que respaldan una presentación oral efectiva. Para complementar la evaluación integral de estas competencias, se propone utilizar un sistema de evaluación objetiva del lenguaje corporal. Este sistema utiliza algoritmos de machine learning y visión por computadora para analizar el lenguaje corporal de los estudiantes y proporciona datos cuantitativos que identifican áreas específicas de mejora para cada estudiante. A diferencia de las evaluaciones manuales, que son subjetivas y sesgadas, este sistema automatizado puede ahorrar tiempo y mejorar la eficacia de la evaluación en entornos académicos y profesionales. El sistema de evaluación automática del lenguaje corporal puede brindar a los profesores una visión cuantificable de los gestos positivos y negativos durante las presentaciones de los estudiantes. Además, brinda a los alumnos la oportunidad de ver cómo obtuvieron esos resultados de manera consistente a través del sistema. Esto les permite mejorar su comunicación efectiva durante las presentaciones. El sistema desarrollado tiene el potencial de mejorar significativamente la efectividad de la comunicación en diversos contextos, desde la educación hasta los entornos empresariales y políticos. Al proporcionar información útil sobre el lenguaje corporal de los presentadores, el sistema propuesto puede contribuir a un mejor desempeño en estas áreas. Palabras clave Visión por computadora, habilidades comunicativas, machine learning ETSIT. Universidad de Valladolid. 4 Abstract Educational institutions face the challenge of assessing and improving 21st century competencies in students. These competencies are critical to their academic and professional development. Nonverbal communication, which includes gestures and postures, is especially important to enrich oral communication competence. This skill allows for the display of emotions and attitudes that support an effective oral presentation. To complement the comprehensive assessment of these competencies, it is proposed to use an objective body language assessment system. This system uses machine learning and computer vision algorithms to analyze students' body language and provides quantitative data that identifies specific areas of improvement for each student. Unlike manual assessments, which are subjective and biased, this automated system can save time and improve the effectiveness of assessment in academic and professional settings. The automatic body language assessment system can give teachers quantifiable insight into positive and negative gestures during students' presentations. In addition, it gives students the opportunity to see how they consistently achieved those results across the system. This allows them to improve their effective communication during presentations. The developed system has the potential to significantly improve the effectiveness of communication in various contexts, from education to business and political settings. By providing useful information about the body language of presenters, the proposed system can contribute to better performance in these areas. Keywords: computer vision, communication skills, machine learning ETSIT. Universidad de Valladolid. 5 Agradecimientos Me gustaría agradecer a mi tutor Ioannis por toda la paciencia y dedicación que me ha brindado a lo largo del desarrollo de este trabajo, y a mi familia por siempre apoyarme en cada paso que doy. ETSIT. Universidad de Valladolid. 6 Índice 1. Introducción ....................................................................................................... 8 1.1. Objetivos ................................................................................................... 13 1.2. Metodología ............................................................................................... 14 2. Estado del arte .................................................................................................. 22 2.1. Teoría del lenguaje corporal ......................................................................... 22 2.2. Psicología de la comunicación ...................................................................... 24 2.3. Teoría de la persuasión y la efectividad de la presentación .............................. 26 2.4. Trabajos previos relacionados ...................................................................... 27 2.5. Ética y privacidad en la evaluación automática de posturas en presentaciones orales 34 2.6. Evaluación de la efectividad de la retroalimentación ....................................... 35 2.7. Aplicaciones prácticas ................................................................................. 37 2.8. Evaluación de la calidad de la presentación oral con base en la detección automática de posturas .......................................................................................................... 39 3. Tecnologías usadas para la detección de posturas .................................................. 41 3.1. Tecnologías de detección de lenguaje corporal ............................................... 41 3.2. Bibliotecas y herramientas utilizadas en machine learning y su aplicación en la clasificación de posturas........................................................................................ 44 3.3. Selección de tecnología ............................................................................... 46 4. Implementación ................................................................................................ 49 4.1. Aprendizaje automático y redes neuronales de convolución (CNN) en la evaluación de posturas en presentaciones orales ....................................................................... 49 4.2. Detección y segmentación de posturas con MediaPipe .................................... 51 4.3. Implementación del sistema para clasificación y evaluación del lenguaje corporal 52 4.3.1. Recolección de datos ............................................................................... 52 ETSIT. Universidad de Valladolid. 7 4.3.2. Preprocesamiento de las imágenes ............................................................. 54 4.3.2.1. Redimensionamiento ............................................................................ 54 4.3.2.2. Utilización de la biblioteca MediaPipe ................................................... 55 4.3.2.3. Generación del lienzo negro .................................................................. 57 4.3.2.4. Normalización ..................................................................................... 58 4.3.2.5. Aumento de datos ................................................................................. 59 4.3.3. Entrenamiento del modelo ........................................................................ 61 4.3.4. Evaluación del modelo ............................................................................. 66 4.3.5. Implementación de la interfaz final de usuario del sistema ........................... 71 5. Análisis de los resultados ................................................................................... 76 6. Conclusiones .................................................................................................... 80 7. Líneas futuras de investigación ........................................................................... 83 Referencias ............................................................................................................. 84 Anexos ................................................................................................................... 93 A. Consentimiento informado para la participación en el estudio .......................... 93 B. Código generado para el aumento de imágenes en el conjunto de datos ............ 96 C. Código de entrenamiento y evaluación del modelo ......................................... 98 D. Encuesta para evaluar la facilidad de uso de la interfaz ................................. 102 ETSIT. Universidad de Valladolid. 8 1. Introducción La comunicación es una parte fundamental de la interacción humana, y en un mundo cada vez más impulsado por las Tecnologías de Información y las Comunicaciones (TIC), las presentaciones orales desempeñan un papel crucial en la transmisión efectiva de información, ideas y emociones. En este contexto, la comunicación no verbal, que incluye gestos y posturas, ha demostrado ser un componente esencial para comprender y enriquecer la comunicación oral (Holland et al., 2017). La comunicación no verbal a menudo revela emociones, intenciones y actitudes que complementan el discurso verbal (Carney et al., 2010). La comunicación no verbal, como aspecto fundamental de la comunicación oral, cobra una importancia destacada en contextos académicos, donde la transmisión de información de manera clara y convincente es esencial. Sin embargo, la pandemia de COVID-19 planteó un gran desafío para la comunicación no verbal, dado que el uso generalizado de mascarillas dificultó la expresión facial y la percepción de las emociones. Por consiguiente, el desarrollo de estrategias que fortalezcan el lenguaje corporal en presentaciones orales, reforzando elementos como la postura, los gestos y el contacto visual cobró una importancia aun mayor (Castro, 2023). La implementación de un sistema automático para la evaluación de presentaciones orales es crucial, ya que ofrece la posibilidad de analizar la comunicación no verbal de manera rápida, eficiente, objetiva y detallada. Utilizando avanzadas técnicas de aprendizaje automático (machine learning), este sistema puede identificar y valorar con precisión los elementos del lenguaje corporal, proporcionando así una retroalimentación valiosa para mejorar las habilidades de presentación. Así pues, contar con un sistema que permita una evaluación más objetiva y precisa del desempeño de los presentadores, ayudaría a complementar la evaluación subjetiva de los presentadores con datos cuantitativos sobre el lenguaje corporal, lo que puede ayudar a identificar áreas de mejora específicas y proporcionar retroalimentación concreta para el desarrollo de habilidades de presentación (D'Mello & Graesser, 2010). ETSIT. Universidad de Valladolid. 9 En este sentido, el desarrollo de un sistema basado en MediaPipe que es una biblioteca de código abierto desarrollada por Google que facilita el reconocimiento de la posición de las manos, la cara y otras partes del cuerpo humano en imágenes y videos, sería de gran ayuda e interés para este estudio. Este código abierto se utiliza principalmente en aplicaciones de visión por computadora para detectar y rastrear posturas humanas en tiempo real. MediaPipe utiliza modelos de aprendizaje automático para identificar puntos clave del cuerpo (landmarks) y así analizar patrones de lenguaje corporal, lo que es particularmente útil en tareas como la clasificación de gestos y la evaluación de presentaciones orales (Lugaresi et al., 2019). Sin embargo, hasta el momento, la mayoría de las herramientas de evaluación se centran en aspectos verbales o en técnicas tradicionales de evaluación manual, como escalas de puntaje o rúbricas. Estas soluciones no son suficientes debido a varias limitaciones: en primer lugar, las herramientas de evaluación manual pueden ser subjetivas y tener sesgos, ya que dependen de la percepción individual de los evaluadores, lo que puede llevar a inconsistencias en la evaluación y a resultados poco confiables (Chen et al., 2014). Por otro lado, evaluación manual del lenguaje corporal en presentaciones orales puede resultar excesivamente laboriosa y consumir un tiempo valioso, lo que a menudo la convierte en una opción poco viable para entornos académicos y profesionales. Por ello, la implementación de un sistema automatizado mediante técnicas de machine learning no solo optimizaría este proceso, sino que también proporcionaría una herramienta objetiva y eficiente para su análisis. De esta forma, se limita la capacidad de proporcionar retroalimentación oportuna y efectiva a los presentadores para que puedan mejorar sus habilidades de presentación (Quiao et al., 2017). En este trabajo se propone un sistema de evaluación de lenguaje corporal en presentaciones orales, que utiliza algoritmos de machine learning para detectar y valorar la postura corporal de los presentadores (Baltrusaitis et al., 2018; Bhatt et al., 2023). El objetivo último de este sistema es habilitar una eventual retroalimentación objetiva que ayude a los presentadores a mejorar su lenguaje corporal y, en consecuencia, su comunicación oral (Hanani, et al., 2017). El objetivo de esta investigación es desarrollar un sistema que permita el reconocimiento de posturas y su evaluación en presentaciones orales mediante técnicas de aprendizaje ETSIT. Universidad de Valladolid. 16 ya que un mismo gesto puede interpretarse de diversas formas según la cultura. Además, se registran los ángulos y condiciones de captura para futuras referencias. Unos ejemplos de posturas empleadas en el estudio se pueden ver en la Figura 1: Fuente: Elaboración propia. Figura 1 Ejemplos de posturas para el dataset de entrenamiento ETSIT. Universidad de Valladolid. 17 4. Captura de imágenes: Se dispone de un grupo de 26 voluntarios, compuesto por 12 hombres y 11 mujeres, con edades entre 22 y 35 años, estudiantes y profesionales universitarios. A cada participante se le indica que tome una postura específica, y se le capten cuatro fotografías por postura: de frente, de espaldas y de perfil derecho. Se realizan tareas de preprocesamiento en las imágenes, como ajuste de tamaño, normalización de colores y recorte, para garantizar la uniformidad y calidad de la base de datos. La Tabla 1 muestra una esquematización del proceso de captura de imágenes: Tabla 1 Posturas para el dataset de entrenamiento del modelo Etiqueta Posición del cuerpo respecto a la cámara Descripción Clasificación Brazos abajo o caídos Frente Lado izquierdo Lado derecho De espaldas Expresa poca emocionalidad, poca energía Negativa Brazos a 90° Frente Lado izquierdo Lado derecho De espaldas Es una posición expansiva del cuerpo, que denota seguridad, confianza y momento de explicación del tema Positiva Manos en los bolsillos Frente Lado izquierdo Lado derecho De espaldas En esta pose se busca ocultar las manos o "protegerlas" de la vista de la audiencia Negativa Manos detrás del cuerpo Frente Lado izquierdo Lado derecho De espaldas En esta pose se busca ocultar las manos o "protegerlas" de la vista de la audiencia Negativa Brazos cruzados Frente Lado izquierdo Lado derecho De espaldas En esta pose se busca ocultar las manos o "protegerlas" de la vista de la audiencia Negativa Brazo derecho agarrando el brazo izquierdo por el frente del cuerpo Frente Lado izquierdo Lado derecho De espaldas En esta pose se busca ocultar las manos o "protegerlas" de la vista de la audiencia Negativa Brazo izquierdo agarrando el brazo derecho por el frente del cuerpo Frente Lado izquierdo Lado derecho De espaldas En esta pose se busca ocultar las manos o "protegerlas" de la vista de la audiencia Negativa ETSIT. Universidad de Valladolid. 18 Manos con las palmas abiertas y de frente Frente Lado izquierdo Lado derecho De espaldas Se busca mostrar las partes blandas del cuerpo o ventralidad con el fin de expresar cercanía con el público, confianza Positiva Manos mostrando el dorso hacia el frente Frente Lado izquierdo Lado derecho De espaldas Se busca mostrar las partes blandas del cuerpo o ventralidad con el fin de expresar cercanía con el público, confianza Positiva Manos entrelazadas Frente Lado izquierdo Lado derecho De espaldas Es un gesto que denota seguridad Positiva Fuente: Elaboración propia a partir de Castro (2023) y Lubienetzki & Schüler-Lubienetzki (2022). 5. Procesamiento con MediaPipe: Las imágenes se procesan con MediaPipe para obtener las coordenadas de los puntos clave del cuerpo humano (landmarks) y se almacenan en una base de datos junto con la etiqueta de la pose correspondiente. En esta base de datos se disponen conjuntos de entrenamiento y prueba para evaluar la precisión del modelo durante el proceso de entrenamiento. En la Figura 2 se ilustra visualmente este proceso y los pasos descritos anteriormente. ETSIT. Universidad de Valladolid. 19 Figura 2 Diagrama de bloques del proceso Fuente: Elaboración propia ETSIT. Universidad de Valladolid. 20 En esta fase del proceso, se emplea MediaPipe para identificar puntos clave de articulación en el cuerpo, como las manos, el rostro y otras áreas significativas. Mediante el análisis de video con MediaPipe, se extraen las coordenadas de los puntos de referencia del cuerpo humano en momentos específicos, por ejemplo, cada segundo. Estas coordenadas se cotejan con una base de datos para asignar la postura más similar en cada intervalo de tiempo. Posteriormente, el sistema analiza la postura de los participantes en imágenes capturadas y evalúa la cantidad de posturas positivas vs la cantidad de posturas negativas, arrojando como resultado un mensaje de recomendación si la presentación tenía más posturas negativas o un mensaje de felicitación si la presentación contenía más posturas positivas que negativas. 6. Detección de landmarks: En la cuarta fase, se mide la calidad de la presentación oral de los participantes. Se busca establecer una correlación entre las posturas positivas y la calidad de la presentación, así como entre las posturas negativas y una menor calidad de la misma. Se anticipa que este análisis revele una conexión directa entre la expresión corporal y la efectividad de la comunicación oral. Cabe mencionar que los landmarks son puntos clave específicos en el cuerpo humano que se utilizan para identificar y seguir partes importantes del cuerpo, como las articulaciones, en imágenes y videos. Estos puntos clave son detectados y ubicados mediante algoritmos de visión por computadora y aprendizaje automático, permitiendo así el análisis detallado de las poses y movimientos corporales. En el contexto del reconocimiento del lenguaje corporal, los landmarks son esenciales para mapear y clasificar las posturas como "positivas" o "negativas", proporcionando una representación estructurada de la postura del cuerpo. En el análisis del lenguaje corporal, estos puntos clave son detectados automáticamente utilizando herramientas como MediaPipe. Posteriormente, se analizan para clasificar las posturas de los individuos en categorías como "positivas" o "negativas". Este proceso permite obtener una evaluación detallada y objetiva del lenguaje corporal en presentaciones orales y otras aplicaciones. (Cao et al., 2021). La Figura 3 muestra ejemplos de detección de landmarks con MediaPipe: ETSIT. Universidad de Valladolid. 21 Figura 3 Ejemplos de detección de landmarks con MediaPipe Fuente: Elaboración propia. ETSIT. Universidad de Valladolid. 22 2. Estado del arte El estudio actual se encuentra en la intersección de la comunicación no verbal y la inteligencia artificial. Por ello el estudio se enfoca en el desarrollo de algoritmos capaces de interpretar y analizar el lenguaje corporal humano, lo que constituye un área de gran interés debido a su aplicabilidad en diversos contextos, desde la educación hasta la negociación empresarial (Gunes & Schuller, 2013: Pantic et al., 2005; Vinciarelli et al., 2009). La utilización de técnicas de machine learning permite que el sistema aprenda de manera autónoma a reconocer patrones y gestos, mejorando su precisión con el tiempo a partir del eventual incremento de los datos de entrenamiento (Jegham et al., 2020). Este enfoque innovador promete transformar la manera en que entendemos y evaluamos las presentaciones orales, proporcionando herramientas para mejorar la comunicación y la expresión personal (Baltrusaitis et al., 2018). La investigación actual se basa en un corpus de estudios previos que han explorado desde los fundamentos teóricos del lenguaje corporal hasta aplicaciones prácticas de la inteligencia artificial, estableciendo un marco sólido para futuras investigaciones y desarrollos tecnológicos en este ámbito (Caridakis et al., 2007; Pantic et al., 2005). Un somero análisis de dichos estudios previos se presenta en las siguientes secciones de este capítulo. 2.1. Teoría del lenguaje corporal La teoría del lenguaje corporal se basa en el principio de que la comunicación humana no se limita a las palabras habladas o escritas, sino que involucra una serie de señales no verbales, como gestos, posturas, expresiones faciales y movimientos, que transmiten información adicional. Estas señales no verbales pueden ser tan importantes, o incluso más, que las palabras mismas a la hora de comunicar emociones, actitudes y mensajes en general (Mehrabian, 1981). Esta teoría proporciona un marco fundamental para comprender la relevancia del análisis del lenguaje corporal en la evaluación de presentaciones orales. Mehrabian (1981) es considerado un autor clave en el campo de la comunicación no verbal, debido al efecto de su investigación en otros trabajos de este ámbito (Petty & Cacioppo, 1986; Holland et al., 2017; Kaur et al., 2020; Lubienetzki & Schüler-Lubienetzki, 2022). Su ETSIT. Universidad de Valladolid. 23 investigación sugiere que, en situaciones donde el contenido de un mensaje es ambiguo o contradictorio con la comunicación no verbal, la gente tiende a confiar en las señales no verbales para interpretar la comunicación. De acuerdo con sus estudios, el lenguaje corporal y las expresiones faciales representan aproximadamente el 55% de la comunicación, mientras que el tono de voz contribuye con el 38%, y las palabras en sí mismas solo con el 7%. Esto subraya la importancia del lenguaje corporal en la interpretación de las intenciones y emociones de un orador durante una presentación oral. Al trasladar la teoría del lenguaje corporal al contexto de la evaluación de posturas en presentaciones orales, se puede extender la idea de que analizar gestos y posturas puede proporcionar información valiosa sobre el desempeño del presentador y su efectividad en la comunicación con la audiencia. Un sistema de detección mediante visión por computador puede capturar información con un nivel de detalle casi imposible para un ser humano (Gulati, 2022). Considerando la importancia de los gestos, un ejemplo podría ser un presentador quien, con una pose abierta y gestos positivos puede transmitir confianza y entusiasmo, mientras que un presentador con posturas cerradas y gestos negativos puede transmitir falta de confianza o nerviosismo. Además, la teoría del lenguaje corporal también destaca que las señales no verbales pueden variar en su interpretación según el contexto cultural y situacional. Por lo tanto, es esencial tener en cuenta la diversidad cultural al desarrollar algoritmos de evaluación de posturas para que sean aplicables en diferentes contextos y audiencias. Por otra parte, Carney et al. (2010), en su investigación, exploraron el concepto de "power posing", que se refiere a adoptar posturas abiertas y expansivas que reflejan confianza y dominio. Los resultados del estudio mostraron que las personas que adoptaron estas posturas durante tan solo dos minutos experimentaron cambios en los niveles de hormonas, específicamente un aumento en los niveles de testosterona y una disminución en los niveles de cortisol, hormonas asociadas con la confianza y el estrés, respectivamente. La relevancia del estudio de (Carney et al., 2010), para la teoría del lenguaje corporal y la evaluación de posturas o posturas en presentaciones orales, radica en que sugiere que las posturas o posturas corporales no solo son indicadores visuales de la comunicación no verbal, ETSIT. Universidad de Valladolid. 24 sino que también pueden tener un impacto biológico en el estado emocional y la confianza de un individuo. Por lo tanto, si un presentador adopta posturas positivas y de poder durante una presentación, no solo puede transmitir confianza a la audiencia, sino que también podría experimentar un aumento en su propia confianza y reducción del estrés, lo que puede mejorar su desempeño. Así pues, el análisis de la teoría del lenguaje corporal subraya la importancia de las posturas corporales en la comunicación no verbal. Este fundamento teórico destaca que las posturas no solo comunican emociones y actitudes, sino que también pueden influir en el estado emocional y la confianza del presentador. El análisis de la teoría del lenguaje corporal enfatiza la trascendencia de las posturas corporales en la comunicación no verbal. La relevancia de desarrollar algoritmos para la evaluación automática de posturas en presentaciones orales se sustenta en la necesidad de complementar los métodos de evaluación tradicionales, como las escalas de puntaje o las rúbricas (Rayón, Guenaga & Núñez, 2014). Mediante el empleo de técnicas de detección de posturas, se pueden construir sistemas que (i) proporcionen información de aquellos que han sido usados, con mayor frecuencia, por un ponente, durante un discurso o presentación, y que permitan que (ii) esta información se transformase en retroalimentación que, a su vez, pueda contribuir a la mejora de las habilidades de presentación y la eficacia de la comunicación. 2.2. Psicología de la comunicación La comprensión de la teoría del lenguaje corporal proporciona la base para adentrarse en el estudio de la psicología de la comunicación. La teoría del lenguaje corporal examina cómo los gestos, expresiones faciales y posturas corporales influyen en la percepción y comprensión durante las interacciones comunicativas. Este conocimiento es fundamental para comprender cómo el lenguaje corporal contribuye a la efectividad de la comunicación. Al explorar la psicología de la comunicación, se profundiza en los procesos mentales y emocionales que subyacen a la interacción humana, incluyendo la forma en que se procesa la información, se construyen las percepciones y se establecen relaciones sociales. La psicología de la comunicación es un campo interdisciplinario que investiga cómo las personas procesan, interpretan y responden a los mensajes en diversos contextos. Esta ETSIT. Universidad de Valladolid. 25 disciplina es especialmente relevante en la evaluación de la comunicación no verbal en presentaciones orales, ya que proporciona un marco teórico para comprender cómo el lenguaje corporal puede influir en la percepción del orador y la efectividad de su mensaje. Los siguientes cuatro elementos clave ayudan a explicar la relación entre el procesamiento de la información, la persuasión, la percepción y la influencia de la comunicación no verbal en este contexto (Shu et al., 2020). Procesamiento de la información: La teoría del procesamiento de la información se centra en cómo las personas perciben y retienen la información. En presentaciones orales, esto implica cómo los espectadores asimilan las señales no verbales, como gestos y posturas. Un lenguaje corporal coherente y eficaz facilita la comprensión y la memoria de la audiencia (Jaramillo et al., 2013). Teoría de la persuasión: La teoría de la persuasión se enfoca en cómo influir en la audiencia. En presentaciones orales, el lenguaje corporal desempeña un papel crucial en la persuasión, influyendo en la aceptación del mensaje por parte de la audiencia. Modelos como el de probabilidad de elaboración explican cómo gestos y posturas pueden impactar en la persuasión (Holland et al., 2017; Petty y& Cacioppo, 1986). Percepción y empatía: La percepción del orador por parte de la audiencia es esencial. Los gestos y posturas influyen significativamente en cómo se percibe al orador, y un lenguaje corporal empático puede fortalecer la conexión con la audiencia, facilitando la empatía y la receptividad del mensaje (Cialdini, 2021). Influencia de la comunicación no verbal: Investigaciones han demostrado que la comunicación no verbal puede tener mayor influencia que las palabras habladas. Gestos, posturas y expresiones faciales juegan un papel clave en cómo se recibe e interpreta el mensaje, y su eficacia puede variar según el contexto cultural, lo que exige un enfoque sensible y adaptativo en la evaluación del lenguaje corporal (Carney, 2010; Cialdini, 2021; Lubienetzki & Schüler-Lubienetzki, 2022). En resumen, la psicología de la comunicación ofrece un marco integral para entender el impacto del lenguaje corporal en la efectividad de las presentaciones orales. El procesamiento ETSIT. Universidad de Valladolid. 32 La inclusión de esta tabla ofrece una visión clara y comparativa de los sistemas evaluados en el estudio de Ochoa, permitiendo destacar no solo las diferencias tecnológicas, sino también la efectividad de cada sistema en proporcionar retroalimentación. Al comparar estos sistemas, Ochoa concluye que, aunque todos ofrecen algún nivel de retroalimentación, los más avanzados combinan múltiples modos de análisis para ofrecer una retroalimentación más rica y detallada, destacando la importancia de un enfoque integral en la mejora de las habilidades de presentación. La revisión de estos trabajos previos proporciona un contexto importante para el proyecto de evaluación automática de posturas en presentaciones orales. Las investigaciones que se han presentado abordan temas relacionados con el lenguaje corporal, la evaluación de presentaciones y la detección de emociones, lo que puede servir como punto de partida y fuente de inspiración para el desarrollo de algoritmos y sistemas efectivos de evaluación y retroalimentación. Por otro lado, se identifican aspectos que necesitan ser abordados. Aunque se utiliza aprendizaje automático, se sugiere que la precisión de la detección de características del lenguaje corporal aún puede mejorarse, como señalan los estudios de Chen et al. (2014) y Schneider et al. (2015). Asimismo, se plantea la necesidad de clarificar si los sistemas proporcionan retroalimentación clara sobre el lenguaje corporal detectado, como se menciona en (Schneider et al., 2015), donde se destaca la falta de interpretabilidad como una limitación. Por otro lado, se cuestiona la capacidad de generalización de los sistemas, puesto que, aunque Wörtwein et al. (2015) apunta a la evaluación multimodal del desempeño en presentaciones públicas, no se profundiza si el sistema se adapta a diferentes tipos de presentaciones y oradores. Además, se destaca la ausencia de un abordaje explícito sobre la influencia del contexto en la interpretación del lenguaje corporal. Por ejemplo, una sonrisa puede tener significados distintos en una charla de Technology, Entertainment, and Design (TED) o una entrevista de trabajo, aspecto que no es tratado específicamente en los trabajos revisados. El análisis de los sistemas previos de retroalimentación automatizada para presentaciones orales revela varias limitaciones importantes que no han sido completamente abordadas en ETSIT. Universidad de Valladolid. 33 investigaciones anteriores. Estas limitaciones incluyen la falta de integración de múltiples modalidades de retroalimentación, la limitada capacidad para ofrecer feedback en tiempo real, y la dependencia de hardware especializado que reduce la accesibilidad y escalabilidad de los sistemas. 1. Falta de integración multimodal: La mayoría de los sistemas analizados, como se muestra en la tabla de (Ochoa, 2022), tienden a enfocarse en un solo tipo de feedback (como el análisis de voz o gestos), dejando de lado un enfoque más holístico que considere múltiples modalidades de retroalimentación de manera simultánea. Esto reduce la efectividad del feedback en mejorar la competencia comunicativa global del presentador. 2. Feedback en tiempo real: Algunos sistemas ofrecen retroalimentación post-evento, lo que limita la capacidad del presentador para ajustar su desempeño en el momento. La retroalimentación en tiempo real es crucial para la corrección inmediata y para la mejora continua durante la presentación misma. 3. Dependencia de hardware especializado: Varios sistemas requieren dispositivos específicos o sensores avanzados que pueden no estar disponibles en todos los entornos educativos o profesionales, limitando así la adopción generalizada de estas tecnologías. Aporte del trabajo actual: Está investigación hace un análisis de los diferentes sistemas que se han creado para la evaluación de presentaciones orales, mostrando sus limitaciones y la importancia que tiene seguir desarrollando trabajos que impliquen las mejoras de las habilidades comunicativas de los estudiantes. Este trabajo pretende crear una herramienta que sea de fácil utilización, y entendimiento para los usuarios, en principio podría ser usado por estudiantes y profesores, que deseen evaluar sus posturas en su presentación. Por otra parte, también puede servir como base para las investigaciones que pretenden mejorar los sistemas de reconocimiento y seguimiento de posturas en presentaciones orales. Este proyecto, ha sido desarrollado con la finalidad de realizar una investigación que contemple todos los pasos para la creación de un modelo de machine learning que pueda ser ETSIT. Universidad de Valladolid. 34 usado para futuras investigaciones en el campo de la evaluación automática de presentaciones orales y aportar una pequeña parte en esta área de investigación. Para ello se han utilizado tecnologías accesibles y de bajo costo, como las bibliotecas de MediaPipe y OpenCV. El sistema es capaz de proporcionar retroalimentación al usuario, y por usuario se hace referencia al estudiante, profesor o investigador que desee evaluar su postura a lo largo de su presentación, lo que le permite al presentador ajustar su desempeño de manera congruente con sus gestos, es decir que sepa reconocer las posturas positivas y negativas que ha realizado a lo largo de su presentación. Además, la utilización de tecnologías de código abierto asegura que el sistema sea escalable y accesible para una amplia gama de usuarios, desde estudiantes hasta profesionales, ya que este proyecto no hace uso de hardware especializado ni de alto costo, y ofrece a los investigadores una herramienta que puede ser útil en cualquier etapa de investigación. Comparación y justificación del enfoque: Las investigaciones previas se han centrado en (i) tratar de abordar todas las modalidades que se pueden encontrar en una evaluación de presentaciones orales, pero (ii) sin hacer una investigación profunda que le muestre al estudiante o profesor la importancia de las posturas en una presentación oral. Sin embargo, este trabajo pretende centrarse en la investigación de una sola modalidad, es decir la evaluación de las posturas, que constituye como se ha mencionado en los capítulos anteriores, una de las partes más relevantes para mejorar significativamente la presentación del estudiante, una buena postura influye positivamente en las demás modalidades de la presentación y se ha demostrado que psicológicamente ayuda a que el estudiante tenga mayor confianza en sí mismo lo que puede impactar positivamente en la atención y el comportamiento de la audiencia. 2.5. Ética y privacidad en la evaluación automática de posturas en presentaciones orales La evaluación automática de posturas en presentaciones orales, a través de algoritmos de procesamiento de imágenes y el uso de inteligencia artificial, plantea cuestiones éticas y de privacidad significativas: en primer lugar, la recopilación de datos visuales de individuos durante sus presentaciones puede plantear preocupaciones éticas relacionadas con el ETSIT. Universidad de Valladolid. 35 consentimiento informado. Es esencial garantizar que los participantes estén conscientes de que sus acciones y movimientos serán registrados y utilizados con fines de evaluación (Sánchez-Mena & Martí-Parreño, 2017). En este sentido, la primera consideración que debe tomarse en cuenta es que, antes de recopilar datos de lenguaje corporal de los presentadores, es esencial obtener su consentimiento informado (véase anexo A). Los participantes deben comprender cómo se utilizarán sus datos, quién tendrá acceso a ellos y las medidas de seguridad para proteger su privacidad (Behoora & Tucker, 2015). Por otra parte, dado que se trata de un proyecto de investigación, se abre la posibilidad de que otros trabajos se basen en todo o parte de la investigación previa, inclusive los datos recopilados, por lo que estos deben ser anonimizados para evitar la identificación de los presentadores (Chen et al., 2014). Además, de acuerdo con Wörtwein et al. (2015) las personas deben ser informadas de manera transparente sobre cómo se utilizarán sus datos de lenguaje corporal y cómo se realizará la evaluación de sus posturas. Esto para evitar la opacidad en la recopilación y el análisis de datos, desde una perspectiva ética. Así mismo, los datos de lenguaje corporal deben almacenarse y procesarse de manera segura para evitar brechas de seguridad y accesos no autorizados, particularmente en caso de que los datos incluyen información biométrica (Domínguez et al., 2021). Los desarrolladores de sistemas de evaluación de posturas deben asumir la responsabilidad de garantizar que sus aplicaciones sean éticas y respetuosas de la privacidad. Esto incluye la revisión constante de políticas y prácticas. 2.6. Evaluación de la efectividad de la retroalimentación La retroalimentación desempeña un papel crucial en la evaluación automática de posturas en presentaciones orales, ya que proporciona a los presentadores información valiosa sobre su desempeño y les ayuda a mejorar. Evaluar la efectividad de la retroalimentación es esencial para garantizar que cumple su propósito de manera óptima. En este sentido, la retroalimentación debe tener objetivos claros y específicos (Schneider et al., 2015). Antes de proporcionar retroalimentación, es esencial definir qué aspectos del lenguaje corporal se evaluarán y en qué áreas se espera que mejoren los presentadores. Por ETSIT. Universidad de Valladolid. 36 otra parte, se deben establecer criterios de evaluación sólidos y relevantes. Esto implica definir qué se considera "positivo" y "negativo" en términos de posturas y gestos en el contexto de la presentación (Chen et al., 2014). Debe considerarse también la diversidad cultural y contextual en la interpretación de posturas. Lo que se considera "positivo" o "negativo" puede variar según la cultura, y los sistemas deben ser sensibles a estas diferencias (Schneider et al., 2015), es importante evaluar y mitigar cualquier sesgo que pueda surgir en la detección y clasificación de posturas (Carney et al., 2010). En muchos casos puede ser útil también la comparación con el desempeño previo: la retroalimentación efectiva a menudo implica comparar el desempeño actual con el desempeño anterior. Esto permite a los presentadores ver su progreso y comprender en qué áreas han mejorado y en cuáles necesitan trabajar más (Wörtwein et al., 2015). También debe tenerse en cuenta que la retroalimentación debe basarse en datos objetivos y cuantificables. Por ejemplo, en lugar de decir "tu postura no fue buena", la retroalimentación podría ser "mantuviste una postura inclinada durante el 30% de la presentación" (Behoora y Tucker, 2015). No debe olvidarse que la retroalimentación debe ser constructiva, alentadora y no perjudicial. Los comentarios negativos o destructivos pueden tener un impacto emocional en los presentadores y deben evitarse (Carney et al., 2010). Se deben resaltar los aspectos positivos del desempeño del presentador y, al señalar áreas de mejora, proporcionar sugerencias concretas y prácticas para el cambio (Holland et al., 2017). Además, la retroalimentación en tiempo real puede ser particularmente efectiva, ya que permite a los presentadores ajustar su lenguaje corporal de inmediato (Schneider et al., 2015). Finalmente, los presentadores deben tener la oportunidad de evaluar la retroalimentación que reciben. Esto puede proporcionar información valiosa sobre la utilidad y efectividad de la retroalimentación proporcionada (Domínguez et al., 2021). Los sistemas de evaluación automática pueden incorporar adaptaciones en la retroalimentación en función de las necesidades y preferencias de los presentadores. Esto asegura que esta sea personalizada y relevante (Wörtwein et al., 2015). ETSIT. Universidad de Valladolid. 37 2.7. Aplicaciones prácticas La evaluación automática de posturas en presentaciones orales mediante el uso de algoritmos de detección de lenguaje corporal tiene una amplia gama de aplicaciones prácticas en diversos campos. A continuación, se detallan algunas de las aplicaciones más relevantes: 1. Entrenamiento en Oratoria: Una de las aplicaciones más directas es el entrenamiento en oratoria. Los sistemas de evaluación automática pueden proporcionar retroalimentación en tiempo real a los oradores en formación. Esto les ayuda a mejorar su lenguaje corporal y presentación en general (Schneider et al., 2015). 2. Evaluación de Entrevistas de Trabajo: Las entrevistas de trabajo son momentos críticos para evaluar la comunicación verbal y no verbal de los candidatos. La evaluación automática de posturas puede ayudar a los entrevistadores a identificar rasgos de lenguaje corporal relevantes para la toma de decisiones de contratación (Chen et al., 2014). 3. Entrenamiento de Venta y Negociación: Los profesionales de ventas y negociadores pueden beneficiarse al recibir retroalimentación sobre su lenguaje corporal. Esto puede ayudar a mejorar la persuasión y la influencia en situaciones de venta y negociación (Behoora & Tucker, 2015). 4. Educación: En entornos educativos, la evaluación automática de posturas puede ser utilizada para enseñar habilidades de presentación. Los estudiantes pueden practicar y recibir retroalimentación sin la necesidad de la presencia constante de un instructor (Wörtwein et al., 2015). Por otra parte, el sistema RAP (Retroalimentación Automática de Presentaciones), está diseñado para proporcionar retroalimentación automática sobre habilidades básicas de presentación oral a estudiantes de nivel inicial. Su propósito es ayudar a los estudiantes a mejorar sus habilidades de comunicación mediante el uso de análisis multimodal y sensores de bajo costo (Ochoa et at., 2018). ETSIT. Universidad de Valladolid. 38 5. Coaching Personal: Los profesionales del coaching personal pueden utilizar estas herramientas para ayudar a sus clientes a mejorar sus habilidades de comunicación. La retroalimentación basada en datos objetivos es valiosa en el proceso de desarrollo personal (Carney et al, 2010). 6. Evaluación de Políticas Públicas: En el ámbito de la política y la toma de decisiones, la evaluación automática de posturas puede utilizarse para analizar y comparar el lenguaje corporal de los políticos durante discursos y debates. Esto puede proporcionar información sobre la autenticidad y la efectividad de su comunicación (Domínguez et al., 2021). 7. Investigación en Comportamiento Humano: Los investigadores pueden utilizar estos sistemas para analizar el comportamiento humano en contextos sociales. Esto es relevante para estudios en psicología, sociología y comunicación (Mehrabian, 1981). 8. Desarrollo de Habilidades Sociales: Las personas que buscan mejorar sus habilidades sociales, ya sea en presentaciones públicas, entrevistas o interacciones cotidianas, pueden utilizar la evaluación automática de posturas como una herramienta de autoevaluación y mejora continua (Schneider et al., 2015). 9. Evaluación de Entrenadores y Profesores: En entornos educativos y deportivos, los entrenadores y profesores pueden ser evaluados en su capacidad para comunicar instrucciones y liderar grupos utilizando la retroalimentación sobre su lenguaje corporal (Schneider et al., 2015). 10. Terapia y Rehabilitación: En el campo de la terapia y la rehabilitación, la evaluación de posturas puede ayudar a los terapeutas a trabajar con pacientes que necesitan mejorar su comunicación no verbal, como aquellos con trastornos del espectro autista (Shu, Wang & Zhan, 2020). ETSIT. Universidad de Valladolid. 39 2.8. Evaluación de la calidad de la presentación oral con base en la detección automática de posturas La calidad de una presentación oral basada en el número de posturas positivas detectadas por el proceso de detección de posturas con MediaPipe (Lugaresi et al., 2019) puede evaluarse de la siguiente manera: en primer lugar, y como ya se ha mencionado, debe definirse claramente cuáles son las posturas que se consideran "positivas" y "negativas" en el contexto de la presentación. Esto puede implicar identificar gestos corporales, posturas o movimientos específicos que se consideren deseables o indeseables para la audiencia o propósito. Entre los criterios más utilizados para evaluar una pose en presentaciones orales, se encuentran los siguientes (Laborda, 2019): Aspectos positivos: 1. Proyección de Confianza: Una postura que demuestra seguridad y dominio del tema incluye tener la espalda recta y los hombros hacia atrás, mantener la cabeza en alto y la mirada firme para establecer contacto visual con la audiencia, y usar gestos abiertos y naturales que refuercen el mensaje verbal y generen confianza. 2. Claridad y Expresividad: La articulación precisa y el volumen adecuado permiten que el mensaje se escuche con claridad y se entienda. Un tono de voz variado y un ritmo adecuado mantienen la atención del público. Las expresiones faciales y los movimientos corporales congruentes con el mensaje verbal generan interés. 3. Conexión con la Audiencia: Un movimiento fluido y natural no distrae al público y permite una mejor comunicación. Orientarse hacia todo el público por igual y usar el espacio de manera adecuada, desplazándose con seguridad y sin invadir el espacio del público, también son importantes. ETSIT. Universidad de Valladolid. 40 Aspectos negativos: 1. Falta de confianza: Una espalda encorvada o hombros hundidos, una cabeza baja o mirada evasiva, y gestos cerrados o nerviosos pueden demostrar inseguridad y falta de dominio del tema, generar desconfianza y distraer al público. 2. Falta de claridad y expresividad: Una articulación deficiente o un volumen bajo pueden dificultar la comprensión del mensaje. Un tono de voz monótono o un ritmo acelerado pueden aburrir al público y dificultar la atención. Las expresiones faciales y los movimientos corporales incongruentes con el mensaje verbal pueden confundir al público y restar credibilidad al mensaje. 3. Desconexión con la audiencia: Un movimiento rígido puede distraer al público y dificultar la comunicación. Orientarse hacia un solo punto o grupo puede hacer sentir excluidos a algunos presentes. Un uso inadecuado del espacio puede ser perjudicial, como por ejemplo invadiendo el espacio del público. Otros aspectos a tener en consideración son (Laborda, 2019): 1. Contexto de la presentación: Adaptar la postura al tipo de público, la formalidad del evento y el tema de la presentación. 2. Cultura y tradiciones: Tener en cuenta las normas culturales que pueden afectar la percepción de la postura. 3. Características Físicas del Orador: Adaptar la postura a la altura, peso y condición física del orador. ETSIT. Universidad de Valladolid. 41 3. Tecnologías usadas para la detección de posturas En este capítulo se describen las tecnologías más empleadas para la detección de posturas, y a partir de este estudio se ha escogido la tecnología más adecuada para emplearse en el presente proyecto. 3.1. Tecnologías de detección de lenguaje corporal Del análisis de la teoría de la persuasión y la efectividad de la presentación se puede comprender cómo los elementos no verbales, como el lenguaje corporal, pueden influir en la persuasión y la efectividad de una presentación oral. Dado que ciertas posturas y gestos pueden impactar en la percepción del público y en la persuasión del mensaje, se puede apreciar la relevancia de implementar tecnologías que permitan analizar y evaluar estos aspectos. La transición de la teoría a la aplicación tecnológica permite avanzar hacia un enfoque práctico para mejorar la calidad y el impacto de las presentaciones orales. Para la revisión de las tecnologías de detección, se utilizó la técnica de snowballing, que implica comenzar con una referencia inicial y luego expandir el listado de fuentes a través de la identificación de nuevas fuentes a partir de las referencias bibliográficas de la fuente inicial y de las fuentes ya identificadas. El "snowballing" es un método de revisión bibliográfica que consiste en utilizar las referencias de un artículo relevante para identificar otros estudios relacionados. Este proceso se realiza de manera iterativa: primero, se selecciona un artículo base, luego se revisan sus referencias para encontrar otros trabajos relevantes, y así sucesivamente, expandiendo progresivamente la lista de artículos revisados. Este enfoque es útil para asegurar que se cubren de manera exhaustiva los estudios más pertinentes en un área de investigación (Kotsiantis et al., 2007). En este caso, se inició con el trabajo de (Chen et al., 2014), seleccionando aquellas que parecen relevantes para el tema de la evaluación automatizada de habilidades de oratoria. En este trabajo, se ha considerado la investigación de (Chen et al., 2014) debido a que proporciona una base sólida para el análisis de habilidades de presentación utilizando señales multimodales. Aunque el estudio data de 2014, su relevancia radica en el enfoque pionero ETSIT. Universidad de Valladolid. 48 utilizado en dispositivos con capacidades computacionales limitadas, como smartphones y laptops. A partir de esta representación vectorial se puede realizar la clasificación de gestos y posturas utilizando diferentes algoritmos o modelos de machine learning, los cuales se pueden entrenar con conjuntos de datos etiquetados que contengan ejemplos de diferentes gestos o posturas a reconocer. ETSIT. Universidad de Valladolid. 49 4. Implementación En este capítulo se describe el procedimiento seguido durante el desarrollo del proyecto, cuyo objetivo fue desarrollar un sistema de reconocimiento y evaluación del lenguaje corporal en presentaciones orales mediante técnicas de machine learning. Primero, se explica por qué el análisis de las bibliotecas y herramientas utilizadas es fundamental para la construcción del sistema. Luego, se detallan los pasos realizados para crear, entrenar y evaluar el modelo. 4.1. Aprendizaje automático y redes neuronales de convolución (CNN) en la evaluación de posturas en presentaciones orales El análisis de las bibliotecas y herramientas utilizadas en machine learning (ML) y su aplicación en la clasificación de gestos y posturas sienta las bases para adentrarnos en el uso específico de técnicas de aprendizaje automático y redes neuronales de convolución (CNN) en la evaluación de posturas en presentaciones orales. El aprendizaje automático, y en particular las redes neuronales de convolución desempeñan un papel crucial en el desarrollo de algoritmos (IBM, 2020) los cuales pueden emplearse en la evaluación automática de posturas en presentaciones orales. Estas tecnologías permiten el procesamiento, análisis y clasificación de datos de lenguaje corporal de manera eficiente y precisa. 1. Extracción de características: Las redes neuronales de convolución son especialmente adecuadas para extraer características significativas de datos de imágenes (IBM, 2020), como los generados por tecnologías de detección de lenguaje corporal. Al igual que el cerebro humano descompone la información en diferentes características, como bordes, formas y texturas, antes de unirlas para entender la imagen en su conjunto, las CNN hacen algo similar. Esto permite a las CNN identificar y aprender patrones complejos en los datos de imágenes, lo que las hace especialmente adecuadas para tareas como la detección del lenguaje corporal. En el contexto de la evaluación de posturas, las CNN pueden identificar patrones y ETSIT. Universidad de Valladolid. 50 características clave en los gestos y las posturas, como la posición de las articulaciones y la orientación del cuerpo. 2. Entrenamiento de modelos: Para evaluar y clasificar posturas como "positivas" o "negativas", es necesario entrenar un modelo de aprendizaje automático. Este proceso implica proporcionar al modelo un conjunto de datos etiquetado que contenga ejemplos de gestos y posturas clasificados. El modelo aprende a partir de estos ejemplos y desarrolla la capacidad de reconocer patrones y relaciones en los datos. 3. Selección de características relevantes: Las CNN pueden ser utilizadas para seleccionar las características más relevantes del lenguaje corporal que están relacionadas con la efectividad de una presentación. Esto incluye gestos específicos, como movimientos de las manos, la orientación del cuerpo, la expresión facial y otros indicadores no verbales que contribuyen a la percepción de la audiencia. 4. Clasificación de gestos y posturas: Una vez que el modelo está entrenado y las características relevantes se han extraído, el siguiente paso es clasificar posturas en categorías, como "positivas" o "negativas". Esto implica la aplicación de algoritmos de clasificación, que asignan etiquetas a los datos de entrada en función de las características identificadas (Gulati, 2022). 5. Evaluación continua: Los modelos de aprendizaje automático pueden utilizarse para evaluar el lenguaje corporal en tiempo real durante una presentación (Gulati, 2022). Esto permite el seguimiento de la efectividad de las posturas y la generación de retroalimentación instantánea. 6. Mejora con la experiencia: A medida que se recopila más información sobre presentaciones y retroalimentación proporcionada, los modelos de aprendizaje automático pueden mejorar su precisión y capacidad de evaluación (IBM, 2020). El aprendizaje continuo y la adaptación a diferentes estilos de presentación son aspectos clave de estos sistemas. ETSIT. Universidad de Valladolid. 51 7. Transparencia y explicabilidad: Es importante que los modelos de aprendizaje automático utilizados en la evaluación de posturas en presentaciones orales sean transparentes y explicables (IBM, 2020). Esto permite que los presentadores comprendan por qué se han dado ciertas calificaciones y retroalimentación, lo que es fundamental para la mejora de sus habilidades. 4.2. Detección y segmentación de posturas con MediaPipe La detección y segmentación de posturas con MediaPipe (Lugaresi et al., 2019) es un proceso que se basa en la capacidad de esta biblioteca de visión por computadora para detectar puntos clave en el cuerpo y seguir la postura de una persona en tiempo real. A continuación, se describe el proceso de detección y segmentación de posturas con este software de manera general: 1. Una vez que se ha instalado MediaPipe y cargado las bibliotecas correspondientes en el entorno de desarrollo, debe inicializarse MediaPipe para utilizar sus modelos de detección de posturas. 2. Se abre la cámara o se carga un video, que se desee analizar. Para esto se puede utilizar la librería OpenCV (Itseez, 2015) (cv2) para realizar la captura de video. 3. El proceso principal implica el procesamiento de cada fotograma del video. Debe capturarse cada fotograma, convertirlo a un espacio de color uniforme (RGB, escala de grises) y luego utilizar el modelo de MediaPipe para detectar la pose en ese fotograma. 4. Una vez que se ha detectado la pose en el fotograma, se puede dibujar la postura identificada en el mismo. MediaPipe proporciona herramientas para dibujar los puntos clave y las conexiones entre ellos en el fotograma. Finalmente, se puede mostrar el resultado visualizado en una ventana. El proceso descrito anteriormente es un flujo básico para la detección y segmentación de posturas con MediaPipe. La biblioteca se encarga de detectar puntos clave en el cuerpo, lo que permite identificar la pose. A continuación, se describe detalladamente el proceso que se ETSIT. Universidad de Valladolid. 52 ha llevado a cabo para adaptar el sistema a las necesidades y aplicaciones específicas, que requiere el presente proyecto. 4.3. Implementación del sistema para clasificación y evaluación del lenguaje corporal En adelante se explicará detalladamente la construcción del sistema, desde la recolección de la información hasta la interfaz desarrollada para probar el sistema de clasificación y evaluación del lenguaje corporal. 4.3.1. Recolección de datos Se dispone de un grupo de 26 voluntarios, compuesto por 13 hombres y 13 mujeres, con edades entre 22 y 35 años, estudiantes y profesionales universitarios de diferentes nacionalidades entre las cuales se incluyen: española, chilena, colombiana y ecuatoriana. Este rango de edad se eligió debido a que representa una etapa en la que las habilidades de presentación oral son altamente valoradas y requeridas tanto en el ámbito académico como profesional, permitiendo así una evaluación precisa de las competencias comunicativas y del lenguaje corporal en contextos que reflejan situaciones reales de presentaciones. El procedimiento de reclutamiento se inició con la difusión de la convocatoria a través de diversos canales, incluyendo anuncios en las plataformas internas de la universidad, correos electrónicos a estudiantes de cursos avanzados y redes de contacto profesional dentro del entorno académico. Los datos demográficos de los participantes mostraron una diversidad en términos de formación académica y experiencia profesional, incluyendo estudiantes de diversas disciplinas como ciencias sociales, ingeniería y artes, así como jóvenes profesionales con experiencia en campos como la consultoría, la docencia, y el emprendimiento. Esta variedad proporcionó una base de datos para analizar el lenguaje corporal en un espectro amplio de contextos de presentación, permitiendo a su vez extrapolar los resultados del estudio a diferentes escenarios profesionales y académicos. A cada participante se le indica que realice una pose específica, y se le toman cuatro fotografías por cada pose: de frente, de espaldas, de perfil derecho e izquierdo. El conjunto de datos consta de un total de 1040 imágenes, esto incluye las posturas que se han ETSIT. Universidad de Valladolid. 53 mencionado en la Tabla 1. Este repositorio de imágenes se puede encontrar en la carpeta de Google drive7. Para el proceso de etiquetado de las imágenes se le ha pedido a un entrenador en oratoria que realizase el trabajo, que consistió en clasificar el conjunto de datos de entrenamiento en posturas positivas y posturas negativas, por cada participante. Este entrenador posee una formación sólida en técnicas de expresión oral y lenguaje corporal, habiendo trabajado extensamente en la capacitación de estudiantes y profesionales para mejorar sus habilidades de presentación y comunicación efectiva. Su experiencia abarca tanto el ámbito académico como el empresarial, lo que le permite comprender las diversas demandas comunicativas que pueden surgir en diferentes contextos. El conjunto de datos se etiqueta manualmente en función de los criterios derivados de la literatura y presentados en la Tabla 1, asignando a cada imagen una etiqueta de "positiva" o "negativa". Estas etiquetas se utilizarán como las clases que el modelo debe aprender a predecir. A continuación, se presenta la figura 5 que muestra ejemplos de captura del conjunto de datos mediante la cámara de un dispositivo móvil. Estas imágenes son realistas y se toman con la mayor calidad posible. 7 https://bit.ly/3XLnmh7 ETSIT. Universidad de Valladolid. 54 Figura 5 Ejemplos de captura del conjunto de datos mediante la cámara de un dispositivo móvil Fuente: Elaboración propia. 4.3.2. Preprocesamiento de las imágenes Una vez que las imágenes están etiquetadas, se realiza el preprocesamiento para prepararlas para el entrenamiento. Para este proyecto se llevaron a cabo los siguientes pasos: 4.3.2.1. Redimensionamiento Las imágenes se redimensionan a un tamaño uniforme para que puedan ser procesadas por el modelo. Se proporciona al sistema la imagen de entrada. El sistema tomará la imagen, la convertirá al tamaño de (224,224) i.e., altura y ancho. La resolución elegida para el análisis de las imágenes y videos en este proyecto fue de X píxeles por Y píxeles (224,224). Este tamaño de entrada es escogido por ser el más utilizado en muchas arquitecturas de redes neuronales convolucionales (CNN), (i) es compatible con redes preentrenadas en grandes conjuntos de datos (ii) equilibrio entre la calidad de la imagen y la eficiencia computacional, lo que quiere decir que este tamaño es lo suficientemente pequeño para realizar procesos computacionales eficientes pero lo suficientemente grande para capturar información visual relevante (iii) simplifica el preprocesamiento de las imágenes, ya que asegura que todas las imágenes tengan la misma resolución y tamaño, lo que es necesario para alimentar consistentemente a la red (iv) es el tamaño estándar en ETSIT. Universidad de Valladolid. 55 conjunto de datos populares, por ello es practico escoger este tamaño ya que facilitaría un posible proceso de comparar diferentes arquitecturas y enfoques de manera justa y estandarizada. Cabe mencionar que, la resolución se seleccionó también para asegurar la compatibilidad con los dispositivos de captura de imágenes utilizados en el estudio, como cámaras de smartphones y webcams estándar, que suelen operar en esta resolución de manera predeterminada. Esto facilita la recolección de datos y asegura que el sistema sea aplicable en un entorno realista y accesible. Además, se revisó estudios previos que emplean técnicas de visión por computadora para la detección de posturas, y se observó que resoluciones similares han sido efectivas en aplicaciones comparables, como se evidencia en trabajos de investigación recientes. Esta resolución, por tanto, no es arbitraria, sino que se seleccionó cuidadosamente para optimizar la precisión del modelo y su aplicabilidad en condiciones reales. 4.3.2.2. Utilización de la biblioteca MediaPipe El sistema utiliza la biblioteca MediaPipe, que emplea dos modelos distintos para identificar y analizar posturas humanas dentro de imágenes. El proceso comienza con el primer modelo, cuya función es reconocer si hay personas en la imagen y, de ser así, determinar ciertos puntos clave de su postura. Estos puntos clave son esenciales porque actúan como una guía inicial para entender la pose general del cuerpo. Una vez que se ha confirmado la presencia de personas y se han identificado los puntos clave, entra en acción el segundo modelo. Este segundo modelo tiene una tarea más detallada: se encarga de mapear la postura completa de la persona, proporcionando una imagen más precisa y exhaustiva de la pose mediante la estimación de 33 puntos de referencia por defecto. Estos puntos no son solo bidimensionales; ofrecen una perspectiva tridimensional, lo que significa que pueden mostrar la profundidad y el contorno completo del cuerpo en el espacio. La Figura 6, a la que se hace referencia en adelante, ilustra este mapeo tridimensional, mostrando cómo el modelo de referencia de pose puede crear una representación detallada y volumétrica de la postura humana. En resumen, ETSIT. Universidad de Valladolid. 56 MediaPipe detecta personas y puntos clave de la postura y luego los utiliza para construir un modelo tridimensional completo de la pose humana. Figura 6 Modelo de landmarks para detección de posturas utilizado por MediaPipe Fuente: Elaboración propia ETSIT. Universidad de Valladolid. 57 En el presente proyecto se utiliza MediaPipe para extraer y visualizar puntos clave de posturas a partir de imágenes y generar sus puntos clave (landmarks) como se muestra en la Figura 7. Figura 7 Ejemplos de landmarks generados mediante la biblioteca MediaPipe Fuente: Elaboración propia. 4.3.2.3. Generación del lienzo negro En el siguiente paso, se genera una imagen negra aleatoria, es decir, todos los valores de píxeles son 0, luego los puntos clave generados anteriormente se dibujan en esa imagen, como se muestra en Figura 8. La razón de utilizar un lienzo negro es permitir que el modelo comprenda las diferentes posturas relacionadas con respecto a cada clase. ETSIT. Universidad de Valladolid. 64 Figura 12 Parámetros de entrenamiento del modelo Fuente: Elaboración propia Para el siguiente paso que es probar el modelo, con el conjunto de prueba que se ha descrito anteriormente. Se realiza la evaluación del modelo mediante la función que se observa en la Figura 13. Figura 13 Evaluación del modelo Fuente: Elaboración propia Con la finalidad de que el código que se ha descrito anteriormente pueda ser fácilmente replicado, se ha creado el anexo C en él se adjunta el código con el que se ha entrenado y probado el modelo. Igualmente se ha guardado en el repositorio de Google drive18 En la siguiente tabla a modo de resumen se presenta la arquitectura del modelo, en esta se observan las capas del modelo, las formas de salida y el número de parámetros en cada capa. La capa de entrada (Inputlayer) define la entrada al modelo, que en este caso caso corresponde a una resolución de 224x224 y 3 canales de color (RGB). Se observan los modelos pre-entrenados descritos anteriormente (i) MobileNetV2, una red para la clasificación de imágenes pre-entrenada, su salida es de tamaño (None, 7, 7, 1280), lo que significa que después de procesar la imagen, reduce su dimensionalidad a un mapa de 18 https://drive.google.com/drive/folders/1PxJWT1_AQiwn6BoGkEkYzkc_9z5RHzwR?usp=drive_link ETSIT. Universidad de Valladolid. 65 características de 7x7 con 1280 canales (ii) densenet169 que es otro modelo preentrenado, que también es una arquitectura de red profunda pero más densa. Su salida es de tamaño (none, 7, 7, 1664). La capa concatenación, concatena la salida de los dos modelos pre entrenados, lo que produce un vector de tamaño (none, 2944) (iii) la capa final (dense_2), tiene 2 unidades de activación con softmax, produce una salida con una probabilidad para las dos clases (positivo y negativo). Tabla 3 Arquitectura del modelo Fuente: Elaboración propia A continuación, en la Figura 14 se observa una muestra del lote (batch)19 que se ha usado en este proyecto. Se observa un ejemplo del lote del total de datos que es utilizado para entrenar el modelo en una única iteración. Este proceso se hace para inspeccionar 19 https://pytorch.org/docs/stable/data.html ETSIT. Universidad de Valladolid. 66 visualmente un lote de imágenes durante el entrenamiento del modelo, y comprobar que las etiquetas y el conjunto de imágenes es correcto. Figura 14 Ejemplo del lote usado en el proyecto Fuente: Elaboración propia 4.3.4. Evaluación del modelo El proceso de evaluación del modelo tiene como objetivo medir el rendimiento y su capacidad para generalizar a nuevos datos. Luego de entrenar el modelo y su posterior evaluación con el conjunto de prueba, se han escogido las siguientes métricas de evaluación accuracy20, precision21, y recall22. En un sistema de clasificación binario como es el caso de este proyecto, la métrica accuracy se utiliza para medir la proporción que existe entre las predicciones correctas realizadas por 20 https://keras.io/api/metrics/accuracy_metrics/#accuracy-class 21 https://keras.io/api/metrics/classification_metrics/#precision-class 22 https://keras.io/api/metrics/classification_metrics/#recall-class ETSIT. Universidad de Valladolid. 67 el modelo en comparación con el total de predicciones realizadas. En la Ecuación 1 se observa la definición de esta métrica. Ecuación 1 𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂 =𝒏𝒏ú𝒎𝒎𝒎𝒎𝒂𝒂𝒎𝒎 𝒅𝒅𝒎𝒎 𝒑𝒑𝒂𝒂𝒎𝒎𝒅𝒅𝒑𝒑𝒂𝒂𝒂𝒂𝒑𝒑𝒎𝒎𝒏𝒏𝒎𝒎𝒑𝒑 𝒂𝒂𝒎𝒎𝒂𝒂𝒂𝒂𝒎𝒎𝒂𝒂𝒄𝒄𝒂𝒂𝒑𝒑 𝒏𝒏ú𝒎𝒎𝒎𝒎𝒂𝒂𝒎𝒎 𝒄𝒄𝒎𝒎𝒄𝒄𝒂𝒂𝒍𝒍 𝒅𝒅𝒎𝒎 𝒑𝒑𝒂𝒂𝒎𝒎𝒅𝒅𝒑𝒑𝒂𝒂𝒂𝒂𝒑𝒑𝒎𝒎𝒏𝒏𝒎𝒎𝒑𝒑 Lo que es igual a Ecuación 2 𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂𝒂 = 𝑻𝑻𝑻𝑻+𝑻𝑻𝑻𝑻 𝑻𝑻𝑻𝑻+𝑻𝑻𝑻𝑻+𝑭𝑭𝑻𝑻+𝑭𝑭𝑻𝑻 Donde: TP (True Positives): Predicciones correctas de la clase positiva. TN (True Negatives): Predicciones correctas de la clase negativa. FP (False Positives): Predicciones incorrectas donde el modelo predijo la clase positiva incorrectamente. FN (False Negatives): Predicciones incorrectas donde el modelo no predijo la clase positiva cuando debería haberlo hecho. Para el presente proyecto, el modelo ha arrojado un accuracy de 0.86, lo que significa que el modelo tiene una precisión del 86% al hacer predicciones. En este proyecto se busca que el sistema de evaluación de las posturas sea lo más preciso posible. Un 86% de precisión se puede considerar como un buen desempeño para el sistema. En la literatura se han reportado otros sistemas que pretendían evaluar las posturas de los presentadores como por ejemplo en (Ochoa et at., 2018) con el sistema RAP (Retroalimentación Automática de Presentaciones), reportó un accuracy del 80%. Siendo este sistema uno de los referentes en la literatura sobre evaluación de presentaciones automáticas de presentaciones orales, se puede inferir que el modelo obtenido para la evaluación de posturas en el presente proyecto tiene un resultado aceptable. La métrica precision se define por la proporción de predicciones correctas entre todas las predicciones positivas que hizo el modelo. Dicho de otra forma, responde a la siguiente pregunta: De todas las posturas que ha predicho el modelo como positivas, ¿cuántas lo son realmente? ETSIT. Universidad de Valladolid. 68 Se define por la siguiente formula: Ecuación 3 𝑻𝑻𝒂𝒂𝒎𝒎𝒂𝒂𝒑𝒑𝒑𝒑𝒑𝒑𝒎𝒎𝒏𝒏 =𝑻𝑻𝑻𝑻 𝑻𝑻𝑻𝑻+𝑭𝑭𝑻𝑻 Donde: TP (True Positives): Número de posturas correctamente predichas como positivas. FP (False Positives): Número de posturas incorrectamente predichas como positivas (es decir, se predijeron como positivas, pero en realidad eran negativas). Para el presente proyecto, el modelo ha arrojado una precision de 0.85. Este valor sigue siendo aceptable dados los resultados encontrados en la literatura (Ochoa et at., 2018). La métrica recall, también llamada sensibilidad, se utiliza para medir la capacidad del modelo de identificar correctamente las posturas positivas entre todas las posturas s que realmente lo son. Es decir, el recall contesta el siguiente interrogante: De todas las posturas que realmente pertenecen a la clase positiva, ¿cuántas fueron correctamente identificadas por el modelo? La Ecuación 4 muestra la formula asociada. Ecuación 4 𝑹𝑹𝒎𝒎𝒂𝒂𝒂𝒂𝒍𝒍𝒍𝒍 = 𝑻𝑻𝑻𝑻 𝑻𝑻𝑻𝑻+𝑭𝑭𝑻𝑻 Donde: TP (True Positives): Número de posturas correctamente predichas como positivas. FN (False Negatives): Número de posturas que son realmente positivas, pero fueron incorrectamente predichas como negativas por el modelo. Para el presente proyecto, el modelo ha arrojado un recall de 0.89. En la literatura se han reportado otros sistemas que pretendían evaluar las posturas de los presentadores como por ejemplo en (Ochoa et at., 2018) con el sistema RAP (Retroalimentación Automática de Presentaciones), reportó un recall del 93%, mientras que en (Alshammari, Abd Rahman, Arshad, & Albahri, 2023) con su sistema Real-Time Robotic Presentation Skill, desarrollaron un sistema de puntuación de habilidades de presentación en tiempo real, emplearon un análisis multimodal y el proceso de jerarquía analítica difusa Delphi. Este modelo específicamente para evaluar la detección del movimiento de las manos, arrojó una medida ETSIT. Universidad de Valladolid. 69 de precision de 53% y recall del 95%. Dada la comparación de estos sistemas con el sistema presentado en el proyecto, las métricas obtenidas se encuentran en un rango aceptable. Otra herramienta que se utilizó para evaluar el modelo fue la matriz de confusión, la cual muestra el rendimiento del modelo de clasificación, mostrando cómo se distribuyen las predicciones del modelo en relación con las etiquetas verdaderas de las clases. En la Figura 15 se observa la matriz de confusión del modelo. Figura 15 Matriz de confusión del modelo Fuente: Elaboración propia La matriz de confusión nos indica que el modelo en el conjunto de test que consta de 1410 imágenes, ha predicho correctamente con la etiqueta negativa 548 imágenes y ha predicho correctamente con la etiquete positiva 663 imágenes, lo que corresponde a los porcentajes obtenidos en las métricas presentadas anteriormente, y como se ha mencionado en el apartado ETSIT. Universidad de Valladolid. 70 de las métricas, estos valores son aceptables para el presente proyecto, ya que contrastado con la literatura, los valores obtenidos en el modelo son muy similares. Los sistemas de presentaciones orales tienen como objetivo encontrar un balance entre las métricas precision y recall ya que un valor alto en cualquiera de estas métricas, en algunos casos puede implicar un bajo rendimiento en la otra. En la Figura 16 se muestra la gráfica de accuracy del modelo durante el entrenamiento y la prueba en función de los epochs. La curva roja muestra el rendimiento del modelo sobre el conjunto de entrenamiento, se observa que la precisión del entrenamiento aumenta rápidamente en la primeras epochs, casi alcanzando el 100% lo que significa que el modelo se está ajustando muy bien a los datos de entrenamiento. La curva azul representa el rendimiento del modelo en el conjunto de prueba, se observa que se estabiliza en torno a una precisión del 85% y muestra algunas oscilaciones en torno a este valor. El hecho de que no suba significativamente después de las primeras epochs sugiere que el modelo ha aprendido los patrones generales del conjunto de datos, pero no mejora más allá de cierto punto en los datos de prueba. Por lo que esta diferencia de precisiones sugiere que el sistema está sobreajustado (overfitting), no obstante, el sistema muestra un buen rendimiento, aunque sugiere que se puede mejorar los signos de sobreajuste, tal vez realizando cambios en la arquitectura del modelo, generando un conjunto de datos mucho más grande con una muestra aleatoria, entre otros. ETSIT. Universidad de Valladolid. 71 Figura 16 Gráfica de accuracy durante el entrenamiento. Fuente: elaboración propia 4.3.5. Implementación de la interfaz final de usuario del sistema Con la finalidad de cumplir con el objetivo de presentar un sistema que sea de fácil uso para la evaluación de posturas, se llevó a cabo la implementación de una interfaz muy sencilla. Como la idea final del sistema es poder evaluar una presentación, es decir un video y no solo una imagen, se le pidió de nuevo a los 26 participantes de este proyecto que realizaran un pequeño video de 3 minutos, en donde se les pedía que expusieran un tema de su elección y que lo hicieran de forma natural, se les explicó que el contenido verbal no sería evaluado, ya que para los objetivos de este proyecto no es relevante. Para la implementación de esta parte del proyecto se desarrolló una interfaz utilizando Tkinter23 es la librería GUI (Graphical User Interface) estándar en Python. Esta librería se ha escogido para este proyecto, debido a su fácil integración con Python, no es necesario instalar dependencias adicionales, su tasa de aprendizaje es muy buena, ya que tiene bastante documentación y una comunidad activa de usuarios lo que es muy útil para encontrar 23 https://docs.python.org/3/library/tkinter.html ETSIT. Universidad de Valladolid. 72 soluciones, es compatible con múltiples sistemas operativos como lo son Windows, macOS y Linux. En este proyecto, Tkinter se utiliza para construir la GUI que permite a los usuarios cargar imágenes o vídeos, ejecutar el modelo de estimación de pose y visualizar los resultados directamente dentro de la aplicación. También se utilizó la biblioteca Matplotlib24, cuya función es crear visualizaciones estáticas, animadas e interactivas en Python. En este proyecto, Matplotlib se utiliza para generar gráficos de barras que visualizan las puntuaciones de pose positivas y negativas predichas por el modelo. Estos gráficos se muestran en la interfaz gráfica Tkinter. Junto con Matplotlib, se empleó la librería de visualización Seaborn25 de Python, que proporciona una interfaz de alto nivel para dibujar gráficos estadísticos atractivos e informativos. Aunque su uso en este proyecto es limitado, Seaborn se incluye para mejorar el atractivo visual de los gráficos generados. Para facilitar la lectura de la retroalimentación automática, que se presenta al orador al finalizar el análisis de su video (tal y como se hizo por (Ochoa et at., 2018)), se utilizó la biblioteca de Python Pandas26, que es una herramienta de código abierto para el análisis y la manipulación de datos basada en Python. Se utiliza en este proyecto para gestionar y analizar los datos de retroalimentación almacenados en archivos Excel, que luego se utilizan para proporcionar mensajes de retroalimentación basados en las predicciones del modelo. De igual forma la biblioteca Pillow27, ampliamente utilizada para la manipulación y procesamiento de imágenes, permite cargar imágenes desde archivos en formatos populares como JPEG, PNG, BMP, GIF y muchos otros. En este proyecto, Pillow se utiliza para convertir imágenes entre diferentes formatos y prepararlas para su visualización en la interfaz gráfica Tkinter. A continuación, en Figura 17 se presenta el resultado final de la interfaz gráfica, su código fuente se encuentra en el mismo repositorio del Google drive28. 24 https://matplotlib.org/ 25 https://seaborn.pydata.org/ 26 https://interactivechaos.com/es/manual/tutorial-de-pandas/tutorial-de-pandas 27 https://pillow.readthedocs.io/en/stable/ 28 https://bit.ly/3XLnmh7 ETSIT. Universidad de Valladolid. 73 Figura 17 Interfaz gráfica del sistema En la Figura 17 se muestra un ejemplo de evaluación del sistema, se ha cargado una imagen de un participante en la postura “brazos detrás del cuerpo” y se ha utilizado para evaluar el sistema, el cual ha arrojado que efectivamente es una pose negativa o cerrada. Automáticamente el sistema arroja el mensaje que se presenta en la Figura 18, este mensaje se ha cargado de forma predeterminada en el sistema, mediante un archivo de Excel, y el sistema muestra el mensaje dependiendo si el resultado de la postura es positiva o negativa. ETSIT. Universidad de Valladolid. 80 6. Conclusiones El objetivo central de este proyecto fue la creación de un sistema capaz de identificar y valorar el lenguaje corporal en presentaciones orales, utilizando para ello métodos de aprendizaje automático. Durante el proceso investigativo, se establecieron y cumplieron metas particulares que, en conjunto, facilitaron la consecución del propósito principal. Las conclusiones alcanzadas, basadas en los resultados obtenidos de cada meta específica, son fundamentales para comprender el impacto y la eficacia del sistema desarrollado. Estas conclusiones no solo reflejan el cumplimiento de los objetivos individuales, sino que también demuestran la integración efectiva de las técnicas de machine learning en la evaluación del lenguaje no verbal, un componente esencial en la comunicación humana. Identificación y Recopilación de Datos de Entrenamiento: El primer paso fundamental y primer objetivo en este proyecto fue la identificación y recopilación del conjunto de datos. Estos datos consistieron en imágenes de oradores ejecutando posturas y gestos específicos. Luego, se implementó un algoritmo utilizando MediaPipe para extraer landmarks y llevarlos a una imagen con fondo negro la cual proporcionó la información esencial para el entrenamiento de modelos de machine learning. Principios de Visión por Computadora y Técnicas de Detección de Puntos de Articulación: El objetivo de comprender los principios de visión por computadora y el uso de técnicas como OpenPose se logró mediante la implementación de MediaPipe. Esta biblioteca demostró ser una herramienta poderosa para la detección y seguimiento de puntos de articulación del cuerpo en videos, proporcionando landmarks cruciales para la evaluación del lenguaje corporal en presentaciones orales. Definición y Aplicación de Criterios de Clasificación: La definición y aplicación de criterios para clasificar gestos y posturas como "positivas" o "negativas" en el contexto de una presentación oral fue un aspecto crucial del proyecto. Se estableció un sistema de evaluación mediante expertos y con la revisión sistemática de la literatura que sirvió como guía para la ETSIT. Universidad de Valladolid. 81 clasificación de las posturas detectadas. Este paso proporcionó la base para la creación de modelos de machine learning capaces de realizar clasificaciones automáticas. Aplicación de Técnicas de Machine Learning: La aplicación de técnicas de machine learning, específicamente el uso de redes neuronales de convolución (CNN), permitió entrenar modelos capaces de clasificar posturas. Estos modelos demostraron ser efectivos para generalizar a nuevas instancias y adaptarse a condiciones variadas. Evaluación Crítica de la Metodología y Resultados: Se llevó a cabo una evaluación crítica de la metodología, los resultados y las conclusiones del proyecto. Se reconocieron los desafíos, como la variabilidad en las condiciones de iluminación, y se identificaron posibles mejoras, como la expansión del conjunto de datos y la inclusión de más categorías de posturas. La comunicación efectiva de estos hallazgos es crucial para fomentar el desarrollo continuo y la aplicación futura del sistema. Con la finalidad de evaluar sí la interfaz cumple con un diseño de uso fácil, se le ha preguntado a los 26 participantes mediante una encuesta se incluye en el anexo D, que tan fácil es el uso de la interfaz, obteniendo los siguientes resultados: (i) los encuestados se encuentran en una edad entre 25 y 36 años repartidos equitativamente entre hombres y mujeres, (ii) el 32% de los encuestados manifestó tener experiencia básica con interfaces similares, mientras que un 31% manifestó que no había tenido ninguna experiencia el 21% experiencia moderada y el 16% avanzada, (iv) el 49% de los encuestados manifestó haber experimentado problemas con la funcionalidad de ciertos elementos de la interfaz, mientras que el 51% no encontró problemas, (v) con respecto a la facilidad de interacción con los botones, el 73% indicó fácil, el 20% neutral y el 7% difícil, (vi) en relación con problemas con la funcionalidad de la interfaz el 49% respondió si y el 51% no, (vii) en términos de satisfacción general el 68% se encuentra muy satisfecho y el 32% se mostró insatisfecho. En conclusión, este proyecto ha cumplido en gran medida con los objetivos planteados, logrando la creación de un sistema que emplea visión por computadora y técnicas de machine learning para evaluar el lenguaje corporal en presentaciones orales. El sistema ofrece una herramienta valiosa para mejorar las habilidades de presentación y establece una base sólida para futuras investigaciones y aplicaciones en los campos de la inteligencia artificial y la ETSIT. Universidad de Valladolid. 82 comunicación humana. No obstante, no se puede afirmar sobre su generalización, principalmente debido a la cantidad limitada de datos reales utilizados, lo que podría afectar la precisión del modelo al aplicarse en entornos más diversos. Para futuras investigaciones, sería fundamental ampliar el conjunto de datos, incluir una mayor variedad de contextos y presentadores, y mejorar el equilibrio de las clases, con el fin de desarrollar un sistema más robusto y adaptable a diferentes situaciones. A pesar de estas limitaciones, el sistema es de bajo coste y escalable, lo que lo hace accesible para cualquier persona interesada en utilizarlo y perfeccionarlo. ETSIT. Universidad de Valladolid. 83 7. Líneas futuras de investigación Para conseguir mejores desempeños y lograr una integración real con el sistema educativo, es necesario seguir investigando y adaptando los nuevos sistemas de evaluación de presentaciones automáticas, a continuación, se plantean algunas investigaciones que se pueden desarrollar en este campo. 1. Evaluación de la efectividad de diferentes modalidades de retroalimentación: Es necesario realizar estudios empíricos que comparen los efectos de la retroalimentación en tiempo real versus la retroalimentación posterior a la presentación, con el objetivo de determinar cuál es la más efectiva para mejorar las habilidades orales específicas. 2. Mejorar la usabilidad y accesibilidad de los sistemas: En futuros trabajos deberían centrarse en mejorar la usabilidad y reducir la intrusividad de los sistemas, facilitando su uso tanto por parte de estudiantes como de instructores, lo que aumentaría su adopción en entornos educativos. 3. Estudios prolongados en entornos educativos reales: La mayoría de los estudios hasta ahora se han realizado en entornos controlados. Sería valioso realizar estudios prolongados en contextos educativos reales para evaluar el impacto a largo plazo de estos sistemas en el desarrollo de habilidades de presentación. Tal y como se menciona, en (Ochoa, 2022), en este documento el autor plantea como próximos pasos a seguir para la investigación de Sistemas Multimodales de Retroalimentación Automatizada de Presentaciones Orales (OPAF) debería conectarse con los sistemas de gestión del aprendizaje existentes, en los que se pueden asignar sesiones de prácticas y almacenar las evaluaciones. El OPAF en su conjunto debería plantearse no como un sistema independiente, sino como una parte de un diseño instruccional más completo. 4. Desarrollo de marcos multimodales compartidos: Para futuros trabajos se debería tener en cuenta desarrollar marcos o plataformas compartidas que permitan a los investigadores reutilizar soluciones existentes y facilitar la integración de nuevas funcionalidades. Esto podría mejorar la escalabilidad y la adopción de los sistemas en ambientes educativos reales, como se plantea en (Ochoa, 2022), en lugar de compartir el código en bruto, los investigadores podrían compartir los sistemas predefinidos y los complementos dentro de estos marcos, de este modo se establecerían las mejores prácticas y se incrementaría la eficacia y eficiencia de los nuevos OPAF. ETSIT. Universidad de Valladolid. 84 Referencias Abadi, M., et al. (2015). TensorFlow: Large-scale machine learning on heterogeneous systems. [Software]. Disponible en https://www.tensorflow.org. Alshammari, R. F. N.; Abd Rahman, A. H.; Arshad, H., & Albahri, O. S. (2023). Real-time robotic presentation skill scoring using multi-model analysis and fuzzy Delphi– analytic hierarchy process. Sensors, 23(24), 9619. https://doi.org/10.3390/s23249619 Baltrusaitis, T.; Ahuja, C., & Morency, L.-P. (2018). Multimodal machine learning: A survey and taxonomy. IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(2), 423-443. https://doi.org/10.1109/TPAMI.2018.2798607 Baron, R. (1981). Mechanisms of human facial recognition. International Journal of ManMachine Studies, 15(2), 137-178. Barua, A.; Ahmed, M. U. & Begum, S. (2023). A Systematic literature review on multimodal machine learning: Applications, challenges, gaps and future directions, IEEE Access, 11, 14804-14831, doi: 10.1109/ACCESS.2023.3243854. Behoora, I. & Tucker, C. (2015). Machine learning classification of design team members' body language patterns for real time emotional state detection. Design Studies, 39, 100–127. doi: 10.1016/j.destud.2015.04.003 Bhatt, P.; Sethi, A.; Tasgaonkar, V., et al. (2023). Aprendizaje automático para el análisis cognitivo conductual: conjuntos de datos, métodos, paradigmas y direcciones de investigación. Brain Informatics. 10, 18 (2023). https://doi.org/10.1186/s40708-02300196-6 Cao, Z.; Hidalgo, G.; Simon, T.; Wei, S. & Sheikh, Y. (2021). OpenPose: Realtime multiperson 2D pose Estimation using part affinity fields. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(1). 172-186. doi: 10.1109/TPAMI.2019.2929257. ETSIT. Universidad de Valladolid. 85 Caridakis, G.; Raouzaiou, A.; Bevacqua, E.; Mancini, M.,; Karpouzis, K.; Malatesta, L., & Pelachaud, C. (2007). Virtual agent multimodal mimicry of humans. Language Resources and Evaluation, 41(3-4), 367-388. https://doi.org/10.1007/s10579-0079057-1 Carney, D.; Cuddy, A. & Yap, A. (2010). Power posing: Brief nonverbal Ddisplays affect neuroendocrine levels and risk tolerance. Psychological Science, 21(10), 1363–1368. doi:10.1177/0956797610383437. Carter, B. & Luke, S. (2020). Best practices in eye tracking research. International Journal of Psychophysiology, 155, 49-62. Castro, S. (2023). Lenguaje no verbal y lenguaje corporal: Ejemplos y Técnicas. Instituto Europeo de Psicología Positiva. Disponible en: https://www.iepp.es/lenguaje-noverbal-corporal/ Chen, M. & Risen, J. (2010). How choice affects and reflects preferences: Revisiting the freechoice paradigm. Journal of Personality and Social Psychology. 99 (4): pp. 573 - 594. Chen, L.; Feng, G.; Joe, J.; Leong, C. W.; Kitchen, C. & Lee, C. M. (2014). Towards automated assessment of public speaking skills using multimodal Ccues. Proceedings of the 16th International Conference on Multimodal Interaction - ICMI '14. doi:10.1145/2663204.2663265. Chollet, F., et al. (2015). Keras. [Software]. Disponible en: https://keras.io CEDEC (2024). Rúbrica para evaluar una exposición oral. Materiales del REA Cuando vivían en blanco y negro del Proyecto EDIA. CEDEC – INTEF. Cialdini, R. (2021). Influence, The Psychology of Persuasion. New and Expanded. Harper Business. ETSIT. Universidad de Valladolid. 86 Cummings, M. L.,; Roff, H. M.; Cukier, K.,; Parakilas, J., & Bryce, H. (2018). Artificial intelligence and international affairs: Disruption anticipated (Chatham House Report). Royal Institute of International Affairs. Del Río, M., & Martín-Gutiérrez, J. (2020). Evaluation of full-body gestures performed by individuals with Down syndrome: Proposal for designing user interfaces for all based on Kinect sensor. Sensors, 20(14), 3930. https://doi.org/10.3390/s20143930 Domínguez, F.; Ochoa, X.; Zambrano, D.; Camacho, K. & Castells, J. (2021). Scaling and adopting a multimodal learning analytics application in an Iinstitution-wide setting. IEEE Transactions on Learning Technologies, 14(3), 400-414. doi: 10.1109/TLT.2021.3100778. D'Mello, S. & Graesser, A. (2010). Multimodal semi-automated affect detection from conversational cues, gross body language, and facial features. User Modeling and User-Adapted Interaction, 20(2), 147–187. doi:10.1007/s11257-010-9074-4. Gan, T.; Li, J., Wong, Y., & Kankanhalli, M. S. (2019). A multi-sensor framework for personal presentation analytics. ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM), 15(2), Article 30. https://doi.org/10.1145/330094 Goodfellow, I.; Bengio, Y., & Courville, A. (2016). Deep learning. MIT Press. Gulati, A. P. (2022). Pose detection in image using Media Pipe Library. Analytics Vidhya. Gunes, H., & Schuller, B. W. (2013). Categorical and dimensional affect analysis in continuous input: Current trends and future directions. Image and Vision Computing, 31(2), 120-136. https://doi.org/10.1016/j.imavis.2012.06.016 Hanani, A.; Mohammad, A.; Bazbus, W. & Salameh, S. (2017). Automatic Estimation of Presentation Skills Using Speech, Slides and gestures, International Conference on Speech and Computer. http://dx.doi.org/10.1007/978-3-319-66429-3_17 ETSIT. Universidad de Valladolid. 87 Harris, C., et al. (2020). Array programming with NumPy. Nature, 585(7825), 357–362. https://doi.org/10.1038/s41586-020-2649-2 Hidalgo, G. (2019). OpenPose: Whole-Body Pose Estimation. Carnegie Mellon University. Holland, E.; Wolf, E. B.; Looser, C. & Cuddy, A. (2017). Visual attention to powerful postures: People avert their gaze from nonverbal dominance displays. Journal of Experimental Social Psychology, 68, 60–67. doi:10.1016/j.jesp.2016.05.001. Hsiao, K. & Rashvand, H. (2011). Integrating body language movements in augmented reality learning environment. Human-centric Computing and Information Sciences, 1, 1-10. Hunter, J. (2007). Matplotlib: A 2D graphics environment. Computing in Science & Engineering, 9(3), 90–95. https://doi.org/10.1109/MCSE.2007.55. IBM (2020). Descubra cómo las redes neuronales convolucionales utilizan datos tridimensionales para tareas de clasificación de imágenes y reconocimiento de objetos. IBM. https://www.ibm.com/es-es/topics/convolutional-neural-networks Itseez (2015). Open Source Computer Vision Library. Disponible en: https://github.com/itseez/opencv Jaramillo, N.; Santacruz, J. & Bolaños, M. (2013). Metodología para la construcción de algoritmos, estructurada en el procesamiento de información - Teoría ACT de Anderson. Encuentro Internacional de educación en Ingeniería. https://doi.org/10.26507/ponencia.1508 Jegham, I.; Ben Khalifa, A.; Alouani, I. & Ali Mahjoub, M. (2020). Vision-based human action recognition: An overview and real-world challenges. Forensic Science International: Digital Investigation, 32, 200901, https://doi.org/10.1016/j.fsidi.2019.200901 Jia, J., He, Y., & Le, H. (2020). A multimodal human-computer interaction system and its application in smart learning environments. In Blended learning. Education in a smart ETSIT. Universidad de Valladolid. 88 learning environment: 13th International Conference, ICBL 2020, Bangkok, Thailand, August 24–27, 2020, Proceedings (Vol. 12218, pp. 3–14). Springer. https://doi.org/10.1007/978-3-030-51968-1_1 Kaur, P.; Krishan, K.; Sharma, S. K. & Kanchan, T. (2020). Facial-recognition algorithms: A literature review. Medicine, Science and the Law, 60(2), 131-139. Kim, J.-W., Choi, J.-Y., Ha, E.-J., & Choi, J.-H. (2023). Human pose estimation using MediaPipe Pose and optimization method based on a humanoid model. Applied Sciences, 13(4), 2700. https://doi.org/10.3390/app13042700 Knapp, M. L., Hall, J. A., & Horgan, T. G. (2013). Nonverbal communication in human interaction (8th ed.). Cengage Learning. Kotsiantis, S. B.; Zaharakis, I. D., & Pintelas, P. E. (2007). Supervised machine learning: A review of classification techniques. In Emerging artificial intelligence applications in computer engineering (Vol. 160, pp. 3-24). IOS Press. https://datajobs.com/datascience-repo/Supervised-Learning- [SB-Kotsiantis].pdf Laborda, X. (2019). Claves de la comunicación oral. Prácticas para el orador afable. Editorial UOC Lubienetzki, U., & Schüler-Lubienetzki, H. (2022). How we talk to each other: The messages we send with our words and body language. Springer. Lugaresi, C., et al. (2019). MediaPipe: A framework for building perception pipelines. arXiv preprint arXiv:1906.08172. McNeill, D. (2005). Gesture and thought. University of Chicago Press. Mehrabian, A. (1981). Silent messages: implicit communication of emotions and attitudes. 2da Ed. Wadsworth Publishing Company. Mehrabian, A. (2017). Nonverbal communication. Transaction Publishers. ETSIT. Universidad de Valladolid. 89 Meng, T.; Jing, X.; Yan, Z. & Pedrycz, W. (2020). A survey on machine learning for data fusion. Information Fusion, 57, 115-129, https://doi.org/10.1016/j.inffus.2019.12.001 Mittelstadt, B. D.; Allo, P.,; Taddeo, M.,; Wachter, S., & Floridi, L. (2016). The ethics of algorithms: Mapping the debate. Big Data & Society, 3(2), 2053951716679679. https://doi.org/10.1177/2053951716679679 Murata, T. & Shin, J. (2014). Hand gesture and character recognition based on kinect sensor. International Journal of Distributed Sensor Networks, 10(7). doi:10.1155/2014/278460 Noda, K.; Arie, H.; Suga, Y. y& Ogata, T. (2014). Multimodal integration learning of robot behavior using deep neural networks. Robotics and Autonomous Systems, 62(6), 721736, https://doi.org/10.1016/j.robot.2014.03.003 Ochoa, X.; Domínguez, F.; Guamán, B.; Maya, R.; Falcones, G., & Castells, J. (2018). The RAP system: Automatic feedback of oral presentation skills using multimodal analysis and low-cost sensors. In Proceedings of the 8th International Conference on Learning Analytics and Knowledge (LAK '18) (pp. 360–364). Association for Computing Machinery. https://doi.org/10.1145/3170358.3170406 Ochoa, X. (2022). Multimodal Ssystems for qutomated oral Ppresentation Ffeedback: A comparative Aanalysis. En: Giannakos, M.; Spikol, D.; Di Mitri, D.; Sharma, K.; Ochoa, X.; Hammad, R. (Eds) The Multimodal Learning Analytics Handbook. Springer. doi: 10.1007/978-3-031-08076-0_3 Ojeda-Castelo, J. J.,; Capobianco-Uriarte, M. d. L. M.; Piedra-Fernandez, J. A., & Ayala, R. (2022). A survey on intelligent gesture recognition techniques. IEEE Access, 10, 87135-87156. https://doi.org/10.1109/ACCESS.2022.3199358 Pan, S. J., & Yang, Q. (2016). A survey on transfer learning. IEEE Transactions on Knowledge and Data Engineering, 22(10), 1345-1359. https://doi.org/10.1109/TKDE.2009.191 ETSIT. Universidad de Valladolid. 96 B. Código generado para el aumento de imágenes en el conjunto de datos ETSIT. Universidad de Valladolid. 97 ETSIT. Universidad de Valladolid. 98 C. Código de entrenamiento y evaluación del modelo A continuación, se presenta el código del notebook con el cual se entrenó el modelo. ETSIT. Universidad de Valladolid. 99 ETSIT. Universidad de Valladolid. 100 ETSIT. Universidad de Valladolid. 101 ETSIT. Universidad de Valladolid. 102 D. Encuesta para evaluar la facilidad de uso de la interfaz A continuación, se presenta la encuesta utilizada para evaluar la interfaz Encuesta para Evaluar la Interfaz Instrucciones: Por favor, responde las siguientes preguntas sobre tu experiencia al utilizar la interfaz. Tus respuestas son esenciales para ayudarnos a mejorar la usabilidad del sistema. 1. Edad: • 18-25 • 26-35 • 36-45 • 46 o más 2. Género: • Femenino • Masculino • Prefiero no decir • Otro (especificar): ___________ 3. Experiencia previa con interfaces similares: • Ninguna • Básica • Moderada • Avanzada 4. Interacción con los elementos de la interfaz 4.1. ¿Te resultó fácil interactuar con los botones de la interfaz? • 1 - Muy difícil • 2 - Difícil • 3 - Neutral • 4 - Fácil • 5 - Muy fácil 4.2. ¿Tuviste algún problema con la funcionalidad de algún elemento de la interfaz? • Sí • No • Si respondiste "Sí", por favor explica: ETSIT. Universidad de Valladolid. 103 5. Satisfacción General 5.1. ¿Qué tan satisfecho estás con la experiencia general de uso de la interfaz? • 1 - Muy insatisfecho • 2 - Insatisfecho • 3 - Neutral • 4 - Satisfecho • 5 - Muy satisfecho