scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

El objetivo de este trabajo es proponer hipótesis sobre cómo los mecanismos emocionales influyen en el pensamiento racional, con el objetivo de mejorar las técnicas de inteligencia artificial y sistemas adaptativos; ya que consideramos que las emociones constituyen mecanismos biológicos que la naturaleza ha construido ante determinados problemas [Damasio, 1994] que, desde la inteligencia artificial, no sabemos cómo resolver. Sin embargo, ante la dificultad de entender el funcionamiento de las emociones únicamente desde la biología y la neurofisiología, especialmente los aspectos derivados de la idea de que estas constituyen sistemas complejos, no lineales y acoplados, consideramos que la inteligencia artificial puede tener un papel importante a la hora de proponer modelos que iluminen el funcionamiento de las emociones en agentes inteligentes. La pretensión de la inteligencia artificial de proporcionar explicaciones acerca del funcionamiento de los sistemas biológicos inteligentes es algo que ha existido desde las décadas de los 80 y 90 [Russell y Norvig, 2003] y, ante la pregunta de si la creación de sistemas artificiales puede mejorar el conocimiento científico sobre los procesos cognitivos, en concreto conocimiento respecto a mecanismos emocionales, respondemos afirmativamente. Mediante la metodología científica conocida como el “enfoque sintético” [Damiano y Cañamero, 2009], que propone la creación de modelos artificiales emergentes de sistemas cognitivos para explorar aspectos no accesibles en sistemas naturales, estudiaremos algunos aspectos sobre la interacción entre los sistemas emocionales y racionales. Desde esta perspectiva, pretendemos estudiar la inteligencia evolutiva que hay detrás de nuestros mecanismos emocionales a la hora de resolver problemas a los que sistemas puramente racionales no son capaces de enfrentarse, así como sus funciones como complemento de nuestros sistemas deliberativos. Esto no quiere decir que al abordar las emociones desde la inteligencia artificial pretendamos programar máquinas para que vivan experiencias emocionales, sino entender los modelos de procesamiento de información que utilizan los sistemas emocionales. Por otro lado, el objetivo de este trabajo no es explicar la fisiología ni el funcionamiento detallado de sistemas emocionales humanos o animales concretos. Por el contrario, consideramos que la biología como ciencia (y el interés de la ingeniería en los sistemas biológicos) no consiste únicamente en capturar aspectos específicos de seres vivos concretos, sino que también (y quizás esto es lo más importante), llegar a comprender principios generales de organización, desarrollo, evolución y comportamiento de sistemas biológicos. Por tanto, nuestro interés estará centrado en estudiar los modelos matemáticos formales que hay detrás de esos modelos biológicos. Siguiendo esta idea, este trabajo se organizará en tres capítulos en los que se analizarán las emociones desde los puntos de vista de (1) sistemas dinámicos no lineales, (2) sistemas integrados en el tiempo y (3) redes de sistemas complejos. Cada uno de los 3 capítulos consistirá en (1) una crítica las teorías actuales sobre las emociones desde el punto de vista propuesto, (2) una justificación teórica de la hipótesis propuesta, (3) desarrollo de un modelo formal de nuestra hipótesis y (4) simulación de agentes virtuales en los cuales hemos integrado nuestro modelo formal. En los diferentes apéndices incluiremos información acerca de las teorías sobre las emociones en las que nos basamos, la metodología que hemos seguido a la hora de desarrollar este trabajo y desarrollos matemáticos de los resultados que se exponen en los diferentes capítulos. Aguilera Lizarraga, Miguel; González Bedia, Manuel

Full text

Efectos no lineales de la integración de capacidades emocionales en agentes inteligentes en blanco PROYECTO DE FIN DE CARRERA Autor: Miguel Aguilera Lizarraga Director: Manuel González Bedia Ponente: Francisco Serón Arbeloa Ingeniería de Telecomunicación Curso 2009-2010 Departamento de Informática e Ingeniería de Sistemas Centro Politécnico Superior Universidad de Zaragoza Septiembre de 2010 en blanco Resumen El objetivo de este trabajo es proponer hipótesis sobre cómo los mecanismos emocionales influyen en el pensamiento racional, con el objetivo de mejorar las técnicas de inteligencia artificial y sistemas adaptativos; ya que consideramos que las emociones constituyen mecanismos biológicos que la naturaleza ha construido ante determinados problemas [Damasio, 1994] que, desde la inteligencia artificial, no sabemos cómo resolver. Sin embargo, ante la dificultad de entender el funcionamiento de las emociones únicamente desde la biología y la neurofisiología, especialmente los aspectos derivados de la idea de que estas constituyen sistemas complejos, no lineales y acoplados, consideramos que la inteligencia artificial puede tener un papel importante a la hora de proponer modelos que iluminen el funcionamiento de las emociones en agentes inteligentes. La pretensión de la inteligencia artificial de proporcionar explicaciones acerca del funcionamiento de los sistemas biológicos inteligentes es algo que ha existido desde las décadas de los 80 y 90 [Russell y Norvig, 2003] y, ante la pregunta de si la creación de sistemas artificiales puede mejorar el conocimiento científico sobre los procesos cognitivos, en concreto conocimien- to respecto a mecanismos emocionales, respondemos afirmativamente. Mediante la metodología científica conocida como el “enfoque sintético” [Damiano y Cañamero, 2009], que propone la creación de modelos artificiales emergentes de sistemas cognitivos para explorar aspectos no accesibles en sistemas naturales, estudiaremos algunos aspectos sobre la interacción entre los sistemas emocionales y racionales. Desde esta perspectiva, pretendemos estudiar la inteligencia evolutiva que hay detrás de nuestros mecanismos emocionales a la hora de resolver problemas a los que sistemas puramente racionales no son capaces de enfrentarse, así como sus funciones como complemento de nuestros sistemas deliberativos. Esto no quiere decir que al abordar las emociones desde la inteligencia artificial pretendamos programar máquinas para que vivan experiencias emocionales, sino entender los modelos de procesamiento de información que utilizan los sistemas emocionales. Por otro lado, el objetivo de este trabajo no es explicar la fisiología ni el funcionamiento detallado de sistemas emocionales humanos o animales concretos. Por el contrario, consideramos que la biología como ciencia (y el interés de la ingeniería en los sistemas biológicos) no consiste únicamente en capturar aspectos específicos de seres vivos concretos, sino que también (y quizás esto es lo más importante), llegar a comprender principios generales de organización, desarrollo, evolución y comportamiento de sistemas biológicos. Por tanto, nuestro interés estará centrado en estudiar los modelos matemáticos formales que hay detrás de esos modelos biológicos. Siguiendo esta idea, este trabajo se organizará en tres capítulos en los que se analizarán las emociones desde los puntos de vista de (1) sistemas dinámicos no lineales, (2) sistemas integrados en el tiempo y (3) redes de sistemas complejos. Cada uno de los 3 capítulos consistirá en (1) una crítica las teorías actuales sobre las emociones desde el punto de vista propuesto, (2) una justificación teórica de la hipótesis propuesta, (3) desarrollo de un modelo formal de nuestra hipótesis y (4) simulación de agentes virtuales en los cuales hemos integrado nuestro modelo formal. En los diferentes apéndices incluiremos información acerca de las teorías sobre las emociones en las que nos basamos, la metodología que hemos seguido a la hora de desarrollar este trabajo y desarrollos matemáticos de los resultados que se exponen en los diferentes capítulos. en blanco Índice general I Memoria 7 1. Introducción 9 1.1. Objetivo y alcance del proyecto ............................ 9 1.2. Contexto en el que se realiza ............................. 9 1.3. Metodología: “entender construyendo” ........................ 10 1.4. Herramientas utilizadas ................................ 10 1.5. Estructura del trabajo ................................. 10 1.6. Planificación ...................................... 11 2. Serendipia: malas decisiones que traen buenos resultados 13 2.1. Introducción ....................................... 13 2.2. Teoría de los marcadores somáticos .......................... 13 2.3. Representación formal de la SMH ........................... 14 2.4. Modelos estocásticos de Markov ............................ 17 2.4.1. Modelo (D+E1+E2) markoviano ....................... 17 2.5. Implementación en agentes virtuales ......................... 21 2.5.1. Simulaciones .................................. 23 2.6. Conclusiones: efecto “desatascador” de los mecanismos emocionales y robustez distribuida ........................................ 25 3. Dinámica de los mecanismos emocionales 27 3.1. Introducción ....................................... 27 3.2. Acoplamiento del tiempo de decisión y acción en la toma de decisiones ...... 27 3.2.1. Tiempo y emociones .............................. 27 3.2.2. Sistema mínimo de toma de decisiones .................... 28 3.2.3. Resolución del sistema............................. 30 3.2.4. Solución óptima del problema ......................... 31 3.2.5. Contribución del sistema emocional a la hora de elegir soluciones subóptimas 31 3.3. Implementación del modelo en agentes virtuales ................... 34 3.3.1. Valores óptimos de umbral .......................... 35 3.3.2. Papel de las emociones a la hora de encontrar los umbrales óptimos . . . 36 3.4. Conclusiones: integración dinámica de los sistemas emocionales .......... 38 4. Redes de emociones 41 4.1. Integrar la Teoría de los Marcadores Somáticos en un contexto computacional . . 41 4.1.1. Computación Somática y Cognición Corporizada (CSCC) ......... 41 4.1.2. Creación de mapas somáticos: redes de mundo pequeño .......... 42 4.2. Implementación en agentes virtuales ......................... 43 4.2.1. Algoritmo evolutivo .............................. 44 4.2.2. Topología de las redes de mundo pequeño .................. 45 4.3. Significado de las redes somáticas ........................... 46 4.4. Conclusiones: espacio de planes y representación de emociones ........... 47 1 5. Conclusiones: mecanismos emocionales en un marco no lineal 49 5.1. Mecanismos emocionales dinámicos y acoplados ................... 49 5.2. Sistemas de toma de decisiones integrados en el tiempo ............... 49 5.3. Redes de mecanismos emocionales .......................... 50 5.4. Trabajo futuro ..................................... 50 II Apéndices 51 A. Emociones y razón 53 A.1. Damasio: Hipótesis del marcador somático ...................... 53 A.1.1. Modelo emocional de Damasio ........................ 53 A.1.2. La fría cognición no es suficiente ....................... 57 A.2. De Sousa: Irracionalidad sin emociones ........................ 60 B. Emociones e inteligencia artificial 61 B.1. Limitaciones de los mecanismos de racionalidad pura para explicar el comportamiento .......................................... 61 B.2. Inteligencia de los mecanismos emocionales ..................... 62 C. Metodología: construir emociones 64 C.1. El enfoque sintético: “entender construyendo” .................... 64 C.2. Artificial Intelligence-Inspired Biology: Animats ................... 65 D. Herramientas: modelos basados en agentes 67 D.1. Comparación de diferentes plataformas de ABMs .................. 67 E. Resolución del sistema de Markov 70 E.1. Modelo (D+E1+E2) markoviano ........................... 70 E.2. Efectos contraintuitivos: paradojas markovianas ................... 72 F. Caracterización de modelo de serendipia en cadenas de Markov en una y dos dimensiones 74 G. Resolución del algoritmo de Bellman 78 G.1. Modelo alternativo: sistema mínimo de toma de decisiones ............. 78 G.1.1. Condiciones del problema ........................... 78 H. Escala de las redes de mundo pequeño 83 III Bibliografía 85 2 Índice de figuras 1.1. Diagrama de Gantt de las actividades realizadas. .................... 11 2.1. Marcadores somáticos. .................................. 14 2.2. Capacidad deliberativa. ................................. 15 2.3. Capacidad emocional primaria. ............................. 16 2.4. Capacidad emocional secundaria. ............................ 16 2.5. Recubrimiento del espacio de acción. .......................... 16 2.6. Sistema (D+E1)..................................... 17 2.7. Acoplamiento del sistema (D + E1+E 2)........................ 18 2.8. Regiones de acoplamiento de E2. La zona del espacio delimitada por las tres superficies representadas contiene el conjunto de parámetros para los que el sistema (D+E1+E2) es mejor que el sistema (D+E1) teniendo en cuenta las limitaciones PE2<P DE1yPE2 <0,5........................................... 19 2.9. Regiones de acoplamiento de E2proyectadas sobre el plano PD,PE1para diferentes valores de PE2....................................... 20 2.10. (a) PDE1E2: Probabilidad efectiva del sistema (D+E1+E2). (b) Zoom de la gráfica anterior en la que se muestran los resultados del modelo acoplado (PDE1E2) frente a los del sistema (D+E1) y los resultados que deberían darse según la el modelo de Damasio. Se observa también una zona "Z"de acoplamiento positivo, en la que introducir marcadores somáticos erróneos nos proporciona mejores resultados. ................ 21 2.11. Escenario de las simulaciones. Los triángulos rojos representan cazadores, los azules claros y oscuros los recolectores (D+E1) + y (D+E1+E2)................ 22 2.12. Resultados de las poblaciones de agentes (D+E1+E 2) compitiendo contra agentes (D+E1). La línea discontinua representa los resultados de agentes con un sistema E2 desacoplado. La zona rallada representa la zona Z en la que existe un acoplamiento positivo de marcadores somáticos erróneos, en las que las emociones secundarias se equivocan más veces que el azar y, sin embargo, hacen que los agentes con marcadores somáticos tengan más probabilidades de sobrevivir que los agentes simples ............ 24 3.1. Función generadora de solución. ............................. 29 3.2. Desajuste en la interacción con el mundo. ........................ 29 3.3. Modelo clásico de toma de decisiones. .......................... 30 3.4. Comparación de estrategias. Representación de la función de ajuste a(t), y el valor de ajuste p(t)para (a) el modelo clásico, en el que se maximiza la solución, y (b) el modelo acoplado. Podemos comprobar que el valor de ajuste es mayor para el modelo acoplado. 32 3.5. Representación de diferentes funciones y valores de ajustes para diferentes valores de τ yε. Vemos que la calidad de la solución escogida en cada caso varía dependiendo de los parámetros. (a) τ=1,ε=1;(b) τ=0,25,ε=1;(c) τ=1,ε=0,25........... 33 3.6. Modelo interno de toma de soluciones de los cazadores Sk,Usuperior =7yUinferior =3.35 3.7. Error medio introducido por unidad de distancia: E[e(Sk)/d]............... 35 3.8. Porcentaje de las presas atrapadas por diferentes cazadores Ui,j compitiendo contra un cazador U5,1. El eje horizontal representa el valor de Usuperior , y cada tipo de línea representa un valor de Usuperior −Uinferior entre1y5.................. 36 3.9. Las diferentes filas muestran los resultados para Pm=0,0,005 y0,02. La primera columna muestra el histograma en dos dimensiones de los resultados del algoritmo genético, y la segunda el histograma de X1para valores de X2=1................. 39 4.1. Tipos de redes ...................................... 43 3 4.2. Redes neuronales y red somática ............................. 44 4.3. Error relativo de la comparación entre Hevolucionada yH aleatoria con diferentes Hα,q ..45 4.4. Dependencia de la eficiencia del algoritmo de búsqueda con el factor α.......... 46 4.5. Ciclo de vida de los agentes. ............................... 47 4.6. a) Histograma de posiciones en la red. b) Densidad de probabilidad de encuentros con cazadores en cada posición de la red. c) Densidad de probabilidad de cercanía de alimento en cada posición de la red. d) Densidad de probabilidad de niveles de energía en cada posición de la red. .................................... 48 A.1. Emociones primarias. Modelo de Damasio ...................... 54 A.2. Emociones secundarias. Modelo de Damasio ..................... 55 A.3. Procesos emocionales y arquitectura de tres capas ................. 56 A.4. Esquema de bucles reales y bucles “como si” ..................... 57 C.1. Tipos de modelos. Copyright (c) 2009 Xabier E. Barandiaran under a Creative Commons Attribution Share-Alike licence, freedom to copy, modify and distribution provided that this notice is preserved. ................................. 66 F.1. (a) PDE1E2: Probabilidad efectiva del sistema (D+E1+E2). (b) Zoom de la gráfica anterior en la que se muestran los resultados del modelo acoplado (PDE1E2) frente a los del sistema (D+E1) y los resultados que deberían darse según la el modelo de Damasio. Se observa también una zona "Z"de acoplamiento positivo, en la que introducir marcadores somáticos erróneos nos proporciona mejores resultados. ................ 75 F.2. Derivada de la función de probabilidad efectiva: ∂(PDE1E2) ∂(PE2)............... 75 F.3. Punto de acoplo positivo para un sistema con PE1=0,1................ 75 F.4. PDE1E2, Probabilidad efectiva del sistema (D + E1+E 2) de dos dimensiones. En linea discontinua el valor de PDE1en dos dimensiones. Se observa que es necesario un valor menor de PE2para obtener un acoplamiento positivo que en el resultado de una dimensión (Figura F.1). ................................. 77 F.5. Zona de acoplo positivo para un sistema de dos dimensiones con PE1= 0,1. En linea de puntos el resultado obtenido en el sistema de una dimensión. Observamos que la zona de acoplamiento aparece para valores de PE2más pequeños .............. 77 G.1. Función generadora de solución. ............................. 78 G.2. Desajuste en la interacción con el mundo. ........................ 79 G.3. Dependencia funcional inicial. .............................. 79 G.4. Representación de diferentes funciones y valores de ajustes para diferentes valores de τ yε. Vemos que la calidad de la solución escogida en cada caso varía dependiendo de los parámetros. ....................................... 82 H.1. Resultados al calcular la escala de cuatro de las redes surgidas del algoritmo evolutivo. En la columna de la izquierda está el ajuste de los datos de 10.000 conexiones utilizadas mediante una función gaussiana. A la derecha está la representación log-log de dicha función. Para que las redes fueran sin escala, la representación log-log debería ser lineal, y sin embargo muestra una caída rápida, lo que significa que lo que tenemos son redes de escala única ...................................... 84 4 Índice de cuadros 2.1. Características de las simulaciones del fenómeno de serendipia en agentes virtuales ... 21 2.2. Resultados de las simulaciones para el sistema E2desacoplado ............. 23 2.3. Resultados de las simulaciones para el sistema E2acoplado ............... 24 3.1. Comportamiento de los diferentes agentes. ....................... 36 3.2. Comportamiento de los diferentes agentes en el algoritmo evolutivo que calcula las redes neuronales óptimas de determinan los umbrales de decisión. .............. 37 4.1. Características de las simulaciones de redes somáticas en agentes virtuales ....... 44 5 en blanco Capítulo 2 Serendipia: malas decisiones que traen buenos resultados 2.1. Introducción La perspectiva tradicional en inteligencia artificial considera que la capacidad de resolución de problemas de un agente inteligente depende básicamente de su modelo interno, y entiende que la incertidumbre en el entorno juega siempre un rol negativo a la hora de encontrar soluciones eficientes. Estos modelos no son capaces de integrar entre sus éxitos aquellos resultados positivos fruto de situaciones inesperadas que se realizan accidentalmente (serendipias). Cuando los humanos nos enfrentamos a entornos con incertidumbre, aprovechamos nuestros mecanismos “emocionales”, los cuales nos permiten mejorar los procesos de toma de decisiones y resolver casos de indeterminación, al hacer posible que nos centremos en los rasgos más destacados de la situación a la que nos enfrentamos. En este apartado proponemos analizar fenómenos de serendipia y sus relaciones con el sistema emocional en los procesos de decisión cotidianos. Buscaremos contrastar algunas de las hipótesis menos sólidas en la “Teoría de los marcadores somáticos” [A. Damasio, 1994, para una explicación en detalle, ver apéndice A acerca del efecto negativo que los daños en el cortex prefrontal ventromedial (uno de los nodos emocionales del cerebro) tienen en el comportamiento inteligente y, como consecuencia, en el diseño de las redes de marcadores somáticos o emocionales asociadas. Nuestra hipótesis es que la estructura de la teoría de Damasio no es la única compatible con sus resultados experimentales, y que éstos pueden interpretarse en otro marco más general que incluye efectos no lineales. Propondremos un modelo que cuantifica el efecto del acoplamiento entre el modelo deliberativo, emocional primario y emocional secundario (en terminología de Damasio) y evaluaremos su dinámica. Veremos entonces que si asumimos marcos adecuados para representar fenómenos acoplados, esto implica nuevas consideraciones sobre el efecto de las emociones en procesos de decisión y reconsiderar algunas de nuestras asunciones sobre modelos de inteligencia artificial. 2.2. Teoría de los marcadores somáticos La teoría de los marcadores somáticos de Damasio defiende que las emociones constituyen un mecanismo de ayuda en ciertos procesos de toma de decisiones. En este contexto, las emociones se definen como “cambios en los estados corporales y cerebrales”. Estos cambios son disparados por sistemas cerebrales que responden a contenidos específicos de nuestra percepción, relativos a objetos o eventos particulares [Damasio, 1994, 1999, 2003]. Muy simplificadamente, Damasio defiende que el efecto de las emociones en los procesos de decisión es exactamente el opuesto al que tradicionalmente se les atribuye: las emociones no son obstáculos en los procesos de decisión sino condiciones de posibilidad [Damasio, 1994]. Esquemáticamente (Figura 2.1) el modelo de los marcadores somáticos propone que los seres humanos poseemos funcionalmente una red de emociones primarias (E1) y un sistema deliberativo (D), y que la integración entre ambas (a lo largo del tiempo y basándose en experiencias donde las emociones se despliegan) generan una segunda red (E2, que incluye emociones secundarias y 13 emociones secundarias “como si”) que constituye un mecanismo de ayuda en ciertos procesos de toma de decisiones. Figura 2.1: Marcadores somáticos. Estas emociones secundarias permiten salir del cuello de botella en el que se encontraría un agente que sólo poseyese un sistema deliberativo en situaciones en las que existiera indiferencia entre opciones (“A es tan buena como B”) o inconmensurabilidad entre opciones (“no está definida la relación entre A y B”, o “los costes de adquirir esta información son tan elevados que superan los beneficios de tomar la decisión correcta”) [apéndice B]. Algunas de las críticas a Damasio [Colombetti, 2003] señalan que, en su teoría, mientras que, fisiológicamente, la red emocional secundaria se va tejiendo e integrando en el sistema emocional primario y deliberativo, Damasio la presenta funcionalmente desacoplada. Esto tiene dos consecuencias principales: 1. Para Damasio el valor predictivo de un marcador somático depende exclusivamente de su “calidad” (si es correcto el sistema se comporta bien, si no, se comporta mal). 2. El éxito global a lo largo del tiempo del sistema depende del éxito de las decisiones en cada una de las etapas. Estos dos presupuestos de Damasio olvidan que el resultado final de un proceso de decisión puede verse afectado por procesos de realimentación, y que el efecto de tomar decisiones incorrectas pueden abrir espacios de oportunidades diferentes, permitiendo que por efecto de marcadores somáticos erróneos el resultado global pueda ser mejor que el conseguido por marcadores somáticos correctos en determinadas situaciones. 2.3. Representación formal de la SMH Vamos a reformular las hipótesis de la SMH en términos de un lenguaje formal y más preciso que nos permita explicar nuestro enfoque. 14 Para hacer más fáciles de entender los conceptos introducidos, presentaremos, para cada uno de los términos introducidos, el ejemplo de un agente decisor que tiene que recolectar alimento en diferentes tipos de plantas, conduciéndole su búsqueda eventualmente a encontrarse con depredadores (que supondrán una amenaza para su supervivencia). Definición 1 Llamaremos “capacidad deliberativa de X” a una aplicación D: D:Ω−→ A s−→ D(s)=a definida sólo para cierto conjunto de s ∈S⊂Ω(por ejemplo, estados del mundo que no exijan respuesta inmediata ni de supervivencia, con tiempo para que el agente X valore el efecto de distintas opciones). Figura 2.2: Capacidad deliberativa. En el caso de nuestro agente recolector, el conjunto S podría estar compuesto por situaciones en las que el agente debe elegir entre diferentes plantas en las que buscar alimento. El agente puede utilizar sus sentidos para detectar cuánto alimento tiene cada tipo de planta, lo nutritivo que es cada tipo de alimento, lo fácil que es obtenerlo, etc. Empleando un tiempo suficiente, el agente será capaz de decidir de qué planta debe comer y dirigirse hacia las zonas donde esta planta sea más abundante. Definición 2 Llamaremos “capacidad de emociones primarias de X” a una aplicación E1: E1:Ω−→ A s−→ E1(s)=a definida sólo para cierto conjunto discreto de estados del mundo s∈S={s1,s 2,...,s m}⊂Ω (por ejemplo, estados del mundo que exijan acciones inmediatas para la supervivencia). La misión del sistema E1es actuar como “valvula de seguridad del agente X” identificando cada elemento de S’ con una acción de protección. Los diferentes estados sipodrían representar la presencia de depredadores (o un ruido o una forma que recordaran una situación de peligro), lo cual provocaría cambios inmediatos en el cuerpo del agente (el corazón bombea más rápido, las pupilas se dilatan, la sangre fluye a los músculos de las extremidades inferiores) que facilitarían una reacción de huída. Definición 3 Llamaremos “memoria emocional del agente X” a una aplicación M, tal que asocia a cada pareja estado-acción (s,a) un valor de v ∈[0,1] que cuantifica el valor de esa acción en ese estado. M:Ω×A−→ [0,1] (s, a)−→ M(s, a)=v 15 Figura 2.3: Capacidad emocional primaria. Definición 4 Llamaremos “capacidad de emociones secundarias de X” a una una aplicación E2: E2:Ω×M−→ A (s, (s∗,a ∗,v∗)) −→ E2(s, s∗,a ∗,v∗)=a tal que establece una relación entre un s ∈Ωy una terna (s*,a*, v*) registrada en la memoria emocional del agente X, lo que le permite poner en marcha una acción a ∈A en el estado s ∈ Ωa partir de la analogía con (s*,a*, v *). sk ak ' '' Figura 2.4: Capacidad emocional secundaria. Damasio propone que los marcadores somáticos se construyen a partir de las relaciones entre E1(si)=aiyD(Ω1)=A. “Si al poner en marcha una emoción primaria como mecanismo de supervivencia, la conciencia nos permite registrar el evento, podremos en el futuro asociar una acción similar a estados desconocidos que puedan vincularse al escenario de partida, extendiendo así la capacidad de respuesta del agente decisor”. De esta forma, mediante los marcadores somáticos, un agente decisor podrá ir recubriendo el conjunto de estados del mundo asociándoles acciones. A s 1 E2 s 2 s 3 s 4 s 5 Figura 2.5: Recubrimiento del espacio de acción. 16 Imaginemos un agente que, mientras buscase alimento en un determinado tipo de planta haya sufrido un ataque de un depredador, viéndose obligado a huír de él, será capaz de almacenar esa experiencia en su memoria. De esta manera, podrá marcar emocionalmente el conjunto de estado-acción que le llevó a encontrarse con el depredador. La próxima vez que se encuentre en una situación que le recuerde a aquella que vivió, aunque sea una situación en la que no puede emplear su sistema deliberativo, el agente volverá a representar la emoción de miedo que sintió, evitando acercarse al tipo de planta en la que sufrió el ataque, resolviendo así posibles situaciones de indeterminación. A partir de ahora distinguiremos entre “sistemas cognitivos primarios” (D+E1) y “sistemas cognitivos con marcadores somáticos” (D+E1+E2), según posean o no capacidades emocionales secundarias. 2.4. Modelos estocásticos de Markov Como hemos dicho, nuestra crítica a la teoría de Damasio de centra en dos aspectos: (1) se presenta el resultado de los marcadores somáticos como lineal, mientras que nosotros consideramos que deberían tomarse en cuenta efectos de no linealidad y (2) su efecto se considera estático a lo largo del tiempo, sin considerar las consecuencias de integrar los marcadores somáticos en un modelo dinámico. Para explorar los resultados de nuestras propuestas, hemos diseñado un marco matemático en el que observar las consecuencias de considerar la teoría de los marcadores somáticos desde una perspectiva dinámica y no lineal. El marco elegido son las cadenas de Markov, ya que nos permitirán desarrollar un modelo sencillo en el que comprobar nuestras hipótesis. En concreto, hemos diseñado nuestro modelo de Markov basándonos en la siguiente idea: “Las emociones E2 resuelven problemas de indefinición, donde un sistema no es capaz de determinar qué acción emprender, abriendo espacios de decisión distintos. Su función es la de desatascar el estado en que se encuentra un sistema cognitivo para llevarlo a otro estado diferente en el que sí pueda decidir” 2.4.1. Modelo (D+E1+E2) markoviano Denominamos cadena de Markov, y representamos como −→ V*= {Xt}, a una secuencia de estados más un conjunto de valores que determina las probabilidades de transición, {Pij}i,j=1,...,n, donde Pij= P(Xt=X i|Xt+1 =X j). Supongamos que el comportamiento de un sistema cognitivo X de tipo (D+E1) viene caracterizado por la cadena −→ V*={X t}. Supongamos, sin pérdida de generalidad, que 2/3de las situaciones son conocidas y permiten utilizar las capacidades deliberativas del agente (que acertarán con probabilidad PD), mientras que 1/3de las situaciones son consideradas como peligrosas por el sistema E1(con una probabilidad PE1de acertar) (Figura 2.6). En este caso, intuitivamente, consideraríamos que la capacidad predictiva global del sistema, PX, en los estados {Xt}, puede representarse por, PX=2 3PD+1 3PE1 esto es, un tercio de las decisiones que toma el sistema serían consideradas peligrosas por E1. Figura 2.6: Sistema (D+E1). 17 Resolviendo el sistema de Markov [apéndice E] obtenemos que, sin embargo, la probabilidad global efectiva del sistema no es lineal y se calcula como: PDE1=PE1+2PD−P2 D−2PDPE1+3P2 DPE1 3−PE1−2PD+2PD·PE1+P2 D Veamos un caso numérico. Si, por ejemplo, PE1= 0.1 y PD= 0.8, intuitivamente pensaríamos que la probabilidad de avanzar en el sistema debería ser igual a: PX=2 3PD+1 3PE1= 0.57 Sin embargo, al analizar el sistema (D+E1) como una estructura acoplada y modelizable por cadenas de Markov, nos lleva a un resultado distinto. Al calcular la probabilidad efectiva del sistema obtenemos: PDE1= 0.51 Esta reducción de la probabilidad predictiva global es debido al acoplamiento. Calculando el peso de los diferentes estados en la cadena [apéndice E] descubrimos que el peso de los estados E1 no es de un 33% como se podría pensar a priori, sino que al recorrer la cadena nos encontramos en estos estados el 39% de las veces. Este resultado refleja un hecho, por otro lado, esperable. Si un agente cognitivo X tiene un bajo poder predictivo en estados considerados peligrosos el efecto realimenta el uso de los mecanismos de E1, puesto que el sistema se conserva en el mismo estado para el que no tiene respuesta. El primero de los efectos del uso de un marco no lineal para modelar un sistema (D+E1) nos advierte: el mecanismo de precaución de un sistema puede reducir la probabilidad de uso de su maquinaria predictiva. Efectos contraintuitivos: “malas estrategias que cooperan para tener éxito” Ahora vamos a modelar la incorporación de emociones secundarias (E2) en el sistema (D+E1) (Figura 2.7) para explorar los efectos de acoplamiento que se generan. Para ello creamos una nueva cadena de Markov, −→ W*, representando un sistema cognitivo en el que los marcadores secundarios representados por (E2) influyen la mitad de las veces en las que el sistema debe tomar una decisión, esto es: PX=1 2PE2+1 2[2 3PD+1 3PE1] Figura 2.7: Acoplamiento del sistema (D+E1+E2). 18 Resolver el sistema acoplado es inmediato a partir del resultado anterior, sólo tenemos que sustituir PD=⇒1 2[PD+PE2]yPE1=⇒1 2[PE1+PE2] Hemos mostrado cómo, si modelamos un sistema cognitivo (D+E1) o (D+E1+E2) mediante cadenas de Markov, no se cumple la propiedad aritmética en sus capacidades predictivas. De hecho, hemos demostrado [apéndice E] que existen condiciones en las que la incorporación de una estructura de emociones E2errónea (PE2<1/2) y con una probabilidad menor que la del sistema (D+E1)(PE2<P DE1) a un sistema X puede hacer que mejore su capacidad predictiva global, esto es, PDE1E2>P DE1. Este efecto, denominado “losing strategies cooperate to win”, se ha relacionado con problemas en econom´ ia [Boman et al, 2008], física [Buceta et al, 2002] y teoría de juegos [Harmer y Abbott, 1999], y surge en condiciones especiales donde se solapan fenómenos aleatorios. La importancia de este resultado es que constituye un contraejemplo a la primera de las hipótesis destacadas del modelo de marcadores somáticos de Damasio: en ocasiones en las que no funciona correctamente la estructura E2de un sistema cognitivo, su comportamiento podría mejorar. Si esto es cierto, la función de los marcadores somáticos no residiría, al menos completamente, en el valor predictivo de las experiencias registradas. Al calcular [apéndice E] las condiciones en las que este fenómeno no lineal se manifiesta, obtenemos que viene determinado por el cumplimiento de las siguientes ecuaciones: ⎧ ⎪ ⎨ ⎪ ⎩ (1 −PE1)·(1 −PD)2>P E1·P2 D PE2<1−PE2 [1 −1 2(PE1+PE2)] ·[1 −1 2(PD+PE2)]2<1 2(PE1+PE2)·[1 2(PD+PE2)]2 ⎫ ⎪ ⎬ ⎪ ⎭ Si representamos la región del espacio dado por los parámetros (PD,PE1,PE2) limitados por las tres condiciones, además de la condición de que el sistema E2añadido sea peor que el sistema (D+E1) (esto es, PE2<P DE1), obtenemos la zona del espacio representada en la Figura 2.8. 0 0.02 0.04 0.06 0.08 0.1 0.12 0.14 0.7 0.75 0.8 0.85 0.9 0.95 1 -0.5 -0.45 -0.4 -0.35 -0.3 PD PE1 PE2 Figura 2.8: Regiones de acoplamiento de E2. La zona del espacio delimitada por las tres superficies representadas contiene el conjunto de parámetros para los que el sistema (D+E1+E2) es mejor que el sistema (D+E1) teniendo en cuenta las limitaciones PE2<P DE1yPE2<0,5. 19 PE1 PD Zona de acoplamiento. PE2 = 0.4 0.02 0.04 0.06 0.08 0.1 0.12 0.14 0.75 0.8 0.85 0.9 0.95 1 PE1 PD Zona de acoplamiento. PE2 = 0.425 0.02 0.04 0.06 0.08 0.1 0.12 0.14 0.75 0.8 0.85 0.9 0.95 1 PE1 PD Zona de acoplamiento. PE2 = 0.45 0.02 0.04 0.06 0.08 0.1 0.12 0.14 0.75 0.8 0.85 0.9 0.95 1 PE1 PD Zona de acoplamiento. PE2 = 0.475 0.02 0.04 0.06 0.08 0.1 0.12 0.14 0.75 0.8 0.85 0.9 0.95 1 Figura 2.9: Regiones de acoplamiento de E2proyectadas sobre el plano PD,PE1para diferentes valores de PE2. Observamos en la figura que, cuando PE2es mayor que 0.3, aparece una región del plano PD, PE1en la que existe un acoplamiento positivo de los marcadores somáticos. Esta región se hace mayor según incrementa PE2. Representando la región de acoplamiento de E2proyectada sobre el plano PD,PE1obtenemos que las regiones de acoplamiento para los diferentes PE2tienen la forma que se representa en la Figura 2.8. Tomando como referencia el ejemplo numérico anterior, podemos calcular la probabilidad global del sistema (D+E1+E2) con PE1= 0.1 y PD= 0.8 para diferentes valores de PE2, los resultados que se muestran en la Figura 2.10.a, en la que se representan PDE1E2,PDE1, así como el valor que debería tener PDE1E2si aceptáramos una visión desacoplada de las emociones como propone Damasio. Existe, según este trabajo, una zona que podemos denominar “zona de acoplamiento positivo”, o “zona Z” (Figura 2.10.b). En este espacio de acoplamiento, el registro/memorización de experiencias por sí mismo mejora el funcionamiento del sistema independientemente del valor de las mismas. Esta mejora de capacidad no viene por experiencias de mayor calidad”, sino exclusivamente por experiencias” (sean estas del valor que sean). El simple hecho de pasar de ser conservativo a interaccionar con el entorno, mejora las probabilidades de éxito. La conclusión más relevante que hasta ahora podría formularse sería la siguiente: “ Si asumimos marcos no-lineales para representar procesos estocásticos, la calidad de las predicciones no siempre son fundamentales, sí lo es sin embargo el acoplamiento” . Es, por tanto, el carácter “desatascador” lo que hace que el acoplamiento de E2mejore el comportamiento del sistema y no tanto la calidad de sus predicciones. Para una caracterización más detallada del comportamiento del modelo de cadenas de Markov propuesto, así como su extensión de una a varias dimensiones, consultar el apéndice F. 20 a) b) 0 0.2 0.4 0.6 0.8 1 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 PE2 0.45 0.5 0.55 0.48 0.49 0.5 0.51 0.52 0.53 0.54 0.55 0.56 PE2 Modelo E2 de Damasio Sistema E2 acoplado Zona "Z" Sistema E1 Figura 2.10: (a) PDE1E2: Probabilidad efectiva del sistema (D+E1+E2). (b) Zoom de la gráfica anterior en la que se muestran los resultados del modelo acoplado (PDE1E2) frente a los del sistema (D+E1) y los resultados que deberían darse según la el modelo de Damasio. Se observa también una zona “Z ”triangular de acoplamiento positivo, en la que introducir marcadores somáticos erróneos nos proporciona mejores resultados. 2.5. Implementación en agentes virtuales Con el fin de probar el funcionamiento de modelo propuesto en agentes cognitivos, hemos diseñado un entorno virtual en el que realizar simulaciones (Cuadro 2.1). En este entorno competirán agentes (D+E1) y agentes (D+E1+E2) para comprobar cómo afecta la calidad del sistema E2a la hora de mejorar o empeorar los resultados de los agentes con marcadores somáticos. Tipo de agente Cazadores Recolectores (D+E1) Recolectores (D+E1+E2) Número de agentes 2 2 5 Comportamiento hacia plantas Buscan las que les proporcionan más alimento Buscan las que les proporcionan más alimento Buscan las que les proporcionan más alimento, a no ser que sean de un color marcado como peligroso por E2 Comportamiento hacia cazadores - Activan E1y huyen Activan E1y huyen. Actualizan E2con el color en el que han visto al cazador Comportamiento hacia recolectores Si están suficientemente cerca, los perseguirán hasta comerlos - - Reproducción - Cuando hay menos de 10 recolectores, el recolector que haya conseguido más alimento se podrá reproducir, creando uno del mismo tipo (con E2o sin E2), y pondrá su contador de alimento a cero Cuadro 2.1: Características de las simulaciones del fenómeno de serendipia en agentes virtuales. En el entorno creado convivirán diferentes tipos de agentes con diferentes sistemas cognitivos: cazadores, recolectores simples (D+E1) y recolectores con marcadores somáticos (D+E1+E2). Tanto cazadores como recolectores se moverán por el mundo buscando alimento, que encontrarán en forma de plantas de tres colores diferentes (los colores estarán determinados por el terreno en 21 Damasio en una ocasión intentó decidir el momento de la siguiente cita con Elliot, el resultado fue que Elliot, que estaba desempleado y por tanto tenía todos los días libres, comenzó a enumerar argumentos a favor y en contra de cada una de las fechas y horas que Damasio le propuso, sin conseguir llegar a tomar ninguna decisión. Cuando una persona sana realiza este tipo de decisión [Damasio, 1994], llega un momento en que siente que ya ha gastado demasiado tiempo pensando cuál es la decisión óptima, y elige aquella solución que en ese momento le parece mejor, aunque disponga de más tiempo para decidir.. Estudios en humanos y animales proponen que el cortex prefrontal ventromedial, a través del cual se inducen las emociones secundarias, así como diferentes neurotransmisores, están implicados en diferentes formas de memoria temporal [Fuster, 1996; Nichelli, 2002]: 1. Orden temporal, que se refiere a la ocurrencia secuencial de eventos. 2. Duración temporal, referida a la memoria de los intervalos entre eventos 3. Perspectiva temporal, que implica la memoria para anticipar eventos futuros Damasio propone [Bechara y Damasio, 2005] que evocar cada una de estas memorias activaría representaciones de estados somáticos (sobre los futuros resultados o consecuencias de una decisión concreta) relacionados con las diferentes representaciones del tiempo en memoria Así, los sistemas que responden a representaciones de duración temporal hacen emerger representaciones que son más cercanas o lejanas en el tiempo, siendo las primeras más intensas que las segundas. Por su parte, las memorias de orden y perspectiva temporal, representarían el tiempo en forma de ‘cuántos pasos’ son necesarios y ‘en qué orden’, a la hora de conseguir un determinado objetivo; haciendo emerger representaciones de futuros resultados o consecuencias. Los pacientes con daños en el cortex ventromedial tienen en general problemas a la hora de anticipar consecuencias de sus decisiones, en especial las decisiones con consecuencias lejanas en el tiempo o consecuencias no tangibles o abstractas [Damasio, 1994]. A pesar de compartir la perspectiva de Damasio sobre la importancia de las emociones en los diferentes tipos de memoria temporal, consideramos que se puede realizar una crítica a esta visión en el mismo sentido que la primera parte de este trabajo: la hipótesis presentada por Damasio sobre la interacción entre emociones y memoria temporal está funcionalmente desacoplada. Es decir, Damasio no tiene en cuenta que si integramos el tiempo como un factor en la toma de decisiones, acoplando los procesos de generación de soluciones y los procesos encargados de su ejecución, las relaciones entre causas y efectos ya no son tan simples, y la diferencia entre buenas y malas decisiones ya no está tan clara. En este apartado propondremos un nuevo modelo de toma de decisiones que integrará el factor tiempo de forma dinámica, demostrando que a veces puede ser preferible ‘utilizar soluciones peores pudiendo generar soluciones mejores’. 3.3. Sistema mínimo de toma de decisiones En primer lugar, buscamos representar en un modelo mínimo las condiciones necesarias para llevar a cabo un proceso de toma de decisiones. Las asunciones de nuestro modelo serán muy básicas para que las conclusiones del modelo sean generales: 1. El agente tiene un mecanismo para generar soluciones {x1, ..., xi,x i+1, ..., xj,x j+1, ..., xk, ...}, en el que {x1, ..., xi}son compatibles con la ventana temporal Δt1,{x1, ..., xi,x i+1, ..., xj} son compatibles con Δt2,{x1, ..., xi,x i+1, ..., xj,x j+1, ..., xk}compatibles con Δt3; es decir, soluciones más ajustadas que son más ‘caras’ (en tiempo) de obtener y otras más simples y más fáciles de obtener. 2. Ajuste del sistema: buscamos calcular el ajuste medio del sistema en un tiempo T. El ajuste medio será una medida de la capacidad media para encontrar soluciones a problemas del entorno. Llamaremos ajuste de la solución del sistema en un instante t, y denotaremos a(t), a una medida de similitud entre la solución puesta en práctica, x(t), y la ideal x∗(t). a(t)=⎧ ⎪ ⎨ ⎪ ⎩ 1,si x(t)=x∗(t) 1−|x(t)−x∗(t)| x(t),si |x(t)−x∗(t)| x(t)<1 0,si |x(t)−x∗(t)| x(t)≥1 ⎫ ⎪ ⎬ ⎪ ⎭ 28 3. Se conoce la relación funcional entre tiempo de generación de soluciones y ajuste. La función más general no es lineal (el esfuerzo en obtener soluciones muy ajustadas crece en términos relativos con el tiempo), que podemos suponer exponencial, a(t)=S(1 −e−t/τ ). 0 0.5 1 1.5 2 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 Figura 3.1: Función generadora de solución. 4. Suponemos que las soluciones van degradándose a lo largo del tiempo y el agente conoce el tiempo de vida promedio de éstas aunque no puede anticipar qué estado del mundo se alcanzará (conoce que el entorno va a cambiar pero no sabe en qué sentido). Suponemos igualmente una dependencia exponencial para modelar la dependencia funcional entre el ajuste de la solución aplicada y el tiempo, esto es, a(t)=S(e−t/ε). 0 0.5 1 1.5 2 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Figura 3.2: Desajuste en la interacción con el mundo. 5. El agente posee un modelo sobre las condiciones de generación de sus soluciones: que el agente pueda tomar decisiones ajustadas a una ventana temporal implica que conoce a priori el tiempo del que dispone y el tiempo que sus mecanismos emplean en generarlas. Una vez descritas las condiciones para del modelo de toma de decisiones, especificaremos cuál sería su comportamiento según la teoría clásica de toma de decisiones, y después calcularemos cuál es el comportamiento de un sistema óptimo y lo compararemos con el primero. Modelo clásico de toma de decisiones Un sistema deliberativo selecciona cuál es la mejor opción ante un problema tras un proceso de análisis entre las oportunidades que se le presentan. Se supone que el tiempo que necesita es un tiempo del que en principio dispone. Si el sistema debe generar una solución en un tiempo menor, es necesario poner en marcha una solución menos ajustada a la situación pero más rápida de obtener. En otras palabras, podría decirse: ‘si no conozco cómo va a cambiar el entorno pero conozco el tiempo medio en que una decisión es válida, entonces optimizo la ventana de oportunidad’. De esta hipótesis se obtiene la siguiente ecuación, asumida en este tipo de modelos: dado un periodo de tiempo T, resultado de una secuencia de ventanas temporales n i=1 Δti, la mejor estrategia será una estrategia avariciosa, que será aquella que cumpla: 29 Optimo(T)= n  i=1 optimo(Δti) 0 1 2 3 4 5 6 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 Figura 3.3: Modelo clásico de toma de decisiones. En este trabajo nos preguntamos si esta asunción es correcta, esto es, si la estrategia óptima, en condiciones de incertidumbre, debe ser una estrategia avariciosa. Pretendemos mostrar en las siguientes secciones que no tiene por qué ser así. Para formularla de un modo más sugerente podríamos plantearla: ‘¿En un entorno con una dinámica conocida, si tengo posibilidad de generar la mejor solución y no tengo información sobre los estados futuros, ¿tiene sentido poner en práctica una de peor calidad?’ 3.4. Resolución del sistema Se supone que maximizar cada una de las etapas constituye el máximo del sistema. Para tener una medida que permita hacer comparaciones cuantitativas calculemos la ley de la dinámica del sistema y calculemos el valor de la solución ‘ambiciosa’. Compararemos este resultado con el óptimo del sistema a partir del criterio de Bellman [Oviedo, 2005]. Llamaremos ajuste global de la solución de un sistema,en un periodo T, al promedio del ajuste, a(T)= 1 T T  0 a(t)dt Denotamos como γ(t)∈{γ0,γ1}la decision binaria que, para cada instante de tiempo tiene el sistema (γ0: generar una solución; γ1: ejecutar una solución) y queremos que optimice su ajuste global. Veamos qué ecuación resulta del modelo propuesto. Conocemos las soluciones y debemos obtener las ecuaciones de las que provienen: Fase de generación: a(t)=aM(1 −e−t/τ ) Fase de ejecución: a(t)=aM(e−t/ε) Para el caso γ(t)=γ0, integrando en el intervalo t∈{t0,t 1}tenemos: d dt a(t)= 1 τ(aM−a(t)) Para el caso γ(t)=γ1,entre t∈{t1,t 2}se tiene: d dt a(t)=−1 εa(t) Ambas pueden combinarse, tomando como valores γ0=0,γ1=1, obteniendo la ecuación global del comportamiento: d dt a(t)=−1 εa(t)+1 τaM(1 −γ(t)) 30 Evaluamos el comportamiento en un intervalo (0,T). Para calcular el valor promedio, ¿Cuál es el valor del ajuste en un tiempo T? Si integramos p(T)= 1 TT 0γ(t)·a(t)dt Si consideramos el modelo clásico, obtendríamos un resultado como el representado en la Figura 3.4.a. 3.4.1. Solución óptima del problema Calcular el máximo del sistema significará calcular los valores de γ0yγ1que maximizan el valor de p(T). Para comprobar si el modelo clásico de toma de decisiones nos proporciona un resultado óptimo en este tipo de sistemas, aplicamos la regla de Bellman [Oviedo, 2005], obteniendo un resultado muy diferente [apéndice ??]. El modelo clásico nos decía que calculáramos la mejor solución posible en el tiempo disponible y la ejecutáramos hasta que dejara de ser buena para nosotros. Sin embargo, el óptimo del sistema es en realidad un modelo que llega hasta una solución subóptima y, en lugar de seguir mejorándola, la mantiene a lo largo del tiempo (Figura 3.4.b). Podemos comprobar en nuestros resultados que el resultado global no depende de la calidad de la solución elegida, sino cómo se acopla ésta en la ventana de tiempo que tenemos disponible (Figura G.4). El resultado obtenido nos dice lo siguiente: ‘cuando el entorno cambia, son mejores soluciones cortas y rápidas de generar, que las que tarden más tiempo en generarse’. Comprobamos como en este caso, soluciones consideradas como “malas” nos proporcionan la respuesta óptima. Y vemos como al analizar sistemas dinámicos, por simples que sean, la solución puede resultar sorprendente al tener la visión de conjunto. 3.5. Contribución del sistema emocional a la hora de elegir soluciones localmente subóptimas De una forma similar al capítulo 2, definiremos de una manera más formal los mecanismos emocionales que nos permiten tomar decisiones de forma acoplada en el tiempo. Definición 5 Si definiéramos como “capacidad deliberativa desacoplada en el tiempo de X” a una aplicación D: D:Ω×T−→ X (s,Δt) −→ D(S, Δt)=x/a(t+Δt)=a m|t=t+Δt definida para un conjunto de estados del mundo s ∈Ω, y un conjunto de ventanas temporales Δt∈T, que proporcionan aquella solución que alcanza el máximo ajuste en el tiempo disponible. Dicha aplicación nos proporcionará soluciones óptimas sólo en el caso en el que el tiempo no sea una parte importante del problema y las condiciones del problema no cambien rápidamente, pero como hemos visto no puede aplicarse en entornos dinámicos, en los que necesitamos otros modelos de toma de decisiones, como el que se describe a continuación. Definición 6 Definimos “memoria temporal del agente X” a una aplicación M, tal que asocia a una ventana temporal y una de las soluciones que se ajustan a ella (Δt,x) con un valor de v ∈ [0,1] que cuantifica el valor de esa acción en ese estado. M:Ω×T×X−→ [0,1] (s,Δt,x) −→ M(Δt, x)=v Definición 7 Llamaremos “capacidad de toma de decisiones emocional de X” a una una aplicación E: E:Ω×T×M−→ A (s, Δt, (S∗,Δt∗,x ∗,v∗)) −→ E2(s, Δt, s∗,Δt∗,x ∗,v∗)=x 31 a) 0 1 2 3 4 5 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Funcion de ajuste 0 1 2 3 4 5 0 10 20 30 40 50 60 Valor de ajuste b) 0 1 2 3 4 5 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Funcion de ajuste. τ = 1, ε = 1 0 1 2 3 4 5 0 10 20 30 40 50 60 Valor de ajuste. τ = 1, ε =1 Figura 3.4: Comparación de estrategias. Representación de la función de ajuste a(t), y el valor de ajuste p(t)para (a) el modelo clásico, en el que se maximiza la solución, y (b) el modelo acoplado. Podemos comprobar que el valor de ajuste es mayor para el modelo acoplado. 32 a) 0 1 2 3 4 5 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Funcion de ajuste. τ = 1, ε = 1 0 1 2 3 4 5 0 10 20 30 40 50 60 Valor de ajuste. τ = 1, ε =1 b) 0 1 2 3 4 5 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Funcion de ajuste. τ = 0.25, ε =1 0 1 2 3 4 5 0 10 20 30 40 50 60 70 80 90 100 Valor de ajuste. τ = 0.25, ε = 1 c) 0 1 2 3 4 5 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 Funcion de ajuste. τ = 1, ε =0.25 0 1 2 3 4 5 0 5 10 15 20 25 Valor de ajuste. τ = 1, ε = 0.25 Figura 3.5: Representación de diferentes funciones y valores de ajustes para diferentes valores de τy ε. Vemos que la calidad de la solución escogida en cada caso varía dependiendo de los parámetros. (a) τ=1,ε=1;(b) τ=0,25,ε=1;(c) τ=1,ε=0,25. 33 Tal que establece una relación entre un conjunto de estados del mundo s ∈Ω, un conjunto de ventanas temporales Δt∈Ty un grupo (s,Δt*,x*, v*) registrado en la memoria temporal del agente X, lo que permite poner en marcha una solución x ∈X ajustada a la ventana temporal Δt∈Ta partir de la analogía con (Δt*,x*, v*). Siguiendo el esquema propuesto por Damasio, soluciones representadas en los diferentes tipos de memoria temporal se asocian con estados buenos o malos, y esto nos permite tener referencias a la hora de elegir en situaciones similares. Al no considerar el tiempo como un factor imprescindible a la hora de tomar decisiones, Damasio ofrece una visión en la que, funcionalmente, los resultados del sistema (D) y el sistema (E) son equivalentes. Pero tras comprobar que el ajuste del sistema no depende tanto de la calidad de las soluciones sino de cómo éstas estén acopladas en el tiempo, la existencia de un sistema de tipo (E) se vuelve necesario para poder escoger soluciones subóptimas que finalmente nos lleven a resultados mejores. 3.6. Implementación del modelo en agentes virtuales Para probar el modelo propuesto, lo implementaremos en agentes dentro de un entorno virtual similar al del capítulo 2. Distinguiremos agentes cazadores y presas, siendo los agentes cazadores quienes implementen el modelo de toma de decisiones propuesto. Los cazadores tendrán que perseguir a las presas, pero no serán capaces de verlas. Su única opción de darles alcance será rastrear su posición. Para rastrear la posición de las presas podrán emplear todo el tiempo que deseen, mejorando la estimación de la posición que tienen de la presa de forma exponencial. De esta manera, los cazadores elegirán entre quedarse en una posición fija estimando la posición de la presa (γk= 0), o moverse hacia la dirección en la que hayan estimado la dirección de la presa la última vez (γk= 1). Para tener una representación interna cómo de buena es la estimación de la posición que está manejando el agente, los cazadores utilizarán un indicador de calidad de la posición estimada, Sk(t) (Figura 3.6), que incrementará una unidad cada vez que decidan rastrear, y decrementará una unidad cada vez que decidan moverse: Sk=Sk+1,γ k=0 Sk−1,γ k=1 La forma de elegir si, en un momento dado, el cazador avanza o rastrea, sera mediante dos umbrales, Usuperior yU inferior, de la siguiente manera: Si Sk≥Usuperior,γk+1 =1 Si Sk≤Uinferior,γk+1 =0 En cualquier otro caso, γk+1 =γk 0 5 10 15 20 25 30 35 40 0 1 2 3 4 5 6 7 8 9 10 Figura 3.6: Modelo interno de toma de soluciones de los cazadores Sk,Usuperior =7yUinferior =3. 34 Tipo de agente Cazadores Recolectores Número de agentes 2 6 Comportamiento Cada cazador elige entre dos opciones: (1) Rastrear al recolector más cercano (mejorar la estimación de la posición en la que cree que está el recolector). (2) Avanzar hacia la dirección estimada Se mueven por el mundo modificando aleatoriamente su dirección Reproducción - Cada vez que un recolector muera nacerá otro igual Cuadro 3.1: Comportamiento de los diferentes agentes. Aun así hemos de tener en cuenta que la representación interna de la calidad de la solución no coincide con la calidad real. Ésta la modelaremos de la misma forma que en el modelo propuesto, mediante una función exponencial. Sea {x,y} la posición real de la presa más cercana, el cazador podrá calcular una posición {x’,y’} mediante la siguiente función: x=x+e(S∗ k·)·a·d, y=y+e(S∗ k·)·a·d, donde: S∗ k=Sk·u1,siendo u1U(0,1),yUuna función aleatoria uniformemente distribuida entre0y1. a=0,5,u 2>0,5 −0,5,u 2≤0,5,u 2U(0,1) d:distancia entre cazador y presa Podemos calcular el error medio introducido para cada valor de calidad de la solución e(Sk)= E[(x−x)2+(y−y)2], obteniendo la función representada en la Figura 3.7. 1 2 3 4 5 6 7 8 9 10 0 0.05 0.1 0.15 0.2 0.25 calidad de la solución Figura 3.7: Error medio introducido por unidad de distancia: E[e(Sk)/d]. 3.6.1. Valores óptimos de umbral El primer escenario de simulación diseñado (Cuadro 3.1) tiene como objetivo calcular cuáles son los valores óptimos de Usuperior yUinferior, para comprobar si los resultados teóricos obtenidos en los apartados anteriores se reproducen en un entorno más realista. En esta simulación tendremos dos cazadores, con el modelo descrito en el apartado anterior implementado, y 6 presas que se moverán por el mundo de forma aleatoria. Uno de los cazadores, al que denominaremos 35 cazador de referencia, tendrá unos valores de Usuperior =5yUinferior =4, y variaremos en cada simulación los umbrales del otro cazador. Definición 8 Por simplicidad representaremos los umbrales como Ui,j, siendo i=Usuperior y j=Usuperior −Uinferior. De esta forma nos referiremos a los valores del cazador de referencia como U5,1. Así, durante las simulaciones competirán al mismo tiempo el cazador de referencia contra otro cazador Ui,j . Durante la simulación, se contarán las presas que atrapa cada uno de los dos cazadores para calcular el porcentaje de las presas cazadas han sido atrapadas por cada cazador. Los resultados (Figura 3.8) indican que la mejor combinación de valores es U4,1, y que en general las combinaciones Ui,1se comportan mejor que el resto, por lo que podemos dar por probados los resultados teóricos demostrados anteriormente, demostrando que los agentes que alcanzan una determinada calidad de solución (que además es subóptima) y a partir de ese momento se mueven una vez y estiman la posición siguiente otra tienen mejores resultados que los que llevan a cabo la misma acción más de una vez seguida. Figura 3.8: Porcentaje de las presas atrapadas por diferentes cazadores Ui,j compitiendo contra un cazador U5,1. El eje horizontal representa el valor de Usuperior, y cada tipo de línea representa un valor de Usuperior −Uinferior entre1y5.Encontramos que la mejor combinación de valores es U4,1. 3.6.2. Papel de las emociones a la hora de encontrar los umbrales óptimos Tras verificar que el funcionamiento de nuestro modelo teórico es el esperado en el entorno virtual que hemos diseñado, pasamos a tener en cuenta el papel de los mecanismos emocionales de procesamiento de información a la hora de establecer los umbrales de decisión. El objetivo es comprobar si, tan sólo procesando información (a través de unos mecanismos obtenidos de forma evolutiva) sobre la situación del agente en el entorno y sobre el propio estado corporal del agente, es posible realizar este control del momento adecuado para tomar una decisión de forma acoplada en el tiempo. Para ello, diseñamos un nuevo escenario virtual en el que los agentes tendrán nuevas capacidades (Cuadro 3.2) Para ello, dotamos a los agentes con dos neuronas que procesarán información del ambiente, en concreto la cantidad de alimento recogido o ‘energía’ (que aumentará cada vez que coma una planta y se irá reduciendo poco a poco al pasar el tiempo), y la distancia ponderada a la planta más cercana de cada uno de los tres colores (entre aquellas que estén a su distancia de visión), determinando de esta forma el valor de los umbrales: Xi=wi1·energ´ıa +wi2·PcolorA +wi3·PcolorB +wi4·PcolorC , Pcolor =distanciamax −distanciacolor distanciamax ,i=1,2,3; color =colorA, colorB, colorC. 36 Tipo de agente Cazadores Presas Número de agentes 8 8 Comportamiento hacia plantas Procesarán emocionalmente la cercanía de plantas de cada uno de los colores, así como su propio nivel de energía, para decidir si estimar la posición de un recolector o moverse en la dirección en la que creen que está. Buscan las que les dan más alimento Comportamiento hacia cazadores Si se encuentran con otro cazador y no hay recolectores a la vista, se enfrentará a él. El cazador de los dos que tenga menos energía morirá - Comportamiento hacia recolectores Cada cazador elige entre dos opciones: (1) Rastrear al recolector más cercano (mejorar la estimación de la posición que tiene). (2) Avanzar hacia la dirección estimada hasta el momento. - Reproducción Cuando hay menos de 8 cazadores, los dos cazadores que tuvieran mayor energía podrán reproducirse, creando un nuevo cazador cuya red neuronal será una mezcla de las de sus padres. Tanto los padres como el hijo tendrán energía cero. Cada vez que un recolector muera nacerá otro igual Cuadro 3.2: Comportamiento de los diferentes agentes en el algoritmo evolutivo que calcula las redes neuronales óptimas de determinan los umbrales de decisión. Usuperior =X1 X2=Usuperior −Uinferior =⇒Uinferior =X2+X1 Esta vez crearemos un escenario con 8 cazadores, 8 presas y 12 plantas (tabla 4), y programaremos a los recolectores para que coman de las diferentes plantas, y aprendan cada color de planta les proporciona una cantidad diferente de alimento. De esta manera, las presas preferirán unos colores sobre otros. Los pesos de las neuronas se inicializarán de una forma aleatoria, y mediante un algoritmo genético seleccionaremos aquellas combinaciones mejores. Para que funcione el algoritmo genético, los cazadores ganarán un punto de energía cada vez que alcancen una presa, y, cada vez que dos cazadores se encuentren, se enfrentarán entre ellos, de forma que sólo sobreviva aquel que tenga más punto s en ese momento. Además, cada vez que un cazador muera, se escogerán a los dos cazadores de los restantes que más energía tengan y se les permitirá reproducirse, creando un nuevo cazador con unos pesos neuronales que serán combinación de los de sus padres, con un factor de mutación del 1 por 1.000. Tras la reproducción, tanto padres como hijo tendrán energía cero. Como el número de cazadores iniciales no es muy alto, el algoritmo evolutivo no siempre va a converger en el mismo punto. Así que llevaremos a cabo 40 simulaciones diferentes. En cada una de las simulaciones, como los valores de X1yX 2no son constantes, sino que varían dinámicamente con la situación del cazador, tomaremos los valores de X1yX 2en 1.000 instantes diferentes, para representar su distribución de probabilidad para esos valores concretos de pesos. Finalmente, sumaremos las distribuciones de cada simulación para tener una idea de hacia dónde converge el algoritmo. Sin embargo, debido a la forma en la que hemos definido a los agentes nos encontramos con un problema, ya que no podemos tener valores de X1yX2que sean menores que uno. Una posible solución a esto es hacer que cuando esto pase, actualicemos los valores de X1oX2a1 automáticamente. Sin embargo, esto nos provoca que el algoritmo evolutivo converja con mucha más frecuencia de la que debería hacia el valor U1,1(Figura 3.9.a). Para solucionar esto, cada vez que un agente tenga un valor de X1oX2menor que uno, sufrirá, con una probabilidad 37 La red de salida tendrá como parámetros la posición en la red, y dará como salida las tres posibles decisiones (comer planta de color A, color B o color C), eligiendo la acción cuya neurona de salida tenga un nivel mayor de activación. Yj=wj1·X1+wj2·X2,j=1,2,3. color elegido=⎧ ⎨ ⎩ colorA, si max({Yj})=Y1 colorB, si max({Yj})=Y2 colorC, si max({Yj})=Y3 Figura 4.2: Redes neuronales y red somática. Tipo de agente Cazadores Recolectores Número de agentes 210 Representación de estados somáticos Dos neuronas situarán al agente en una posición en una red de tipo malla Comportamiento hacia plantas Buscan las que les proporcionan más alimento A partir de la posición en la malla, tres neuronas eligen qué color de planta se va a comer Comportamiento hacia cazadores Activan E1y huyen. Comportamiento hacia recolectores Si están suficientemente cerca, los perseguirán hasta comerlos Reproducción Cuando hay menos de 10 recolectores, los dos recolectores que hayan recogido más alimento se reproducirán, creando un nuevo recolector cuyas neuronas tendrán como pesos una combinación de los de sus padres. Cuadro 4.1: Características de las simulaciones de redes somáticas en agentes virtuales. 4.4.1. Algoritmo evolutivo Nuestro objetivo es analizar la topología de las redes que permiten a los agentes interaccionar con el mundo a partir de la computación de sus estados somáticos. Para ello vamos a usar una estrategia evolutiva. Comenzaremos creando diez recolectores estableciendo de forma aleatoria los pesos de sus redes neuronales. Caza vez que un recolector muera, se escogerá a aquellos dos que más éxito hayan tenido (hayan recogido más alimento sin haber sido comidos por un cazador) 44 Figura 4.3: Error relativo de la comparación entre Hevolucionada yH aleatoria con diferentes Hα,q . y se les permitirá reproducirse, creando un nuevo recolector cuya red de estados somáticos es una mezcla de la de sus progenitores (los pesos de sus neuronas serán una mezcla de los de sus padres). De esta manera, cada vez tendremos individuos mejor adaptados para la supervivencia, hasta que todos los individuos que existan sean del mismo tipo (el mejor adaptado). Una vez que hemos conseguido esto, analizamos la topología de las redes que se forman en individuos evolucionados e individuos con pesos aleatorios. Para ello tomamos un individuo con una red evolucionada y un individuo con una red de pesos aleatorios y analizamos la distribución de distancias de los saltos que se toman en la red, obteniendo el histograma de la distancia de los saltos tomados en la red. Observamos que de un individuo con una red evolucionada a otro que también la tenga no hay diferencias significativas en los resultados, igualmente para los individuos con redes de pesos aleatorias, así que podremos analizar la topología de la red de un sólo individuo evolucionado y otro sin evolucionar sin pérdida de generalidad. Una vez que tenemos el histograma de los saltos en la red de los dos individuos - Hevolucionada yHaleatoria - comparamos ambos con el histograma de la distancia de los saltos en diferentes tipos de redes simuladas mediante Matlab, con diferentes valores de αyq, siendo p=1.En la Figura 4.3 representamos el error relativo entre el histograma de cada tipo de red Hα,q,yel histograma de cada uno de los dos individuos, obteniendo que las redes que más se ajustan a cada una de las dos son: Hevolucionada =⇒H2,1yHaleatoria =⇒H2‘7,3. 4.4.2. Topología de las redes de mundo pequeño En el apartado anterior, observábamos como la red de estados somáticos de los agentes convergía desde una red con α=2,7a otra con α=2. Este hecho no es trivial, ya que John Kleinberg demostró la importancia del parámetro αa la hora de encontrar los caminos más cortos en las redes de mundo pequeño [Kleinberg, 1999]. En concreto, en una red de mundo pequeño, utilizando un algoritmo que utilice únicamente información local, será más fácil encontrar los caminos más cortos cuando αsea igual a D, siendo D el número de dimensiones de la red (α=2en el caso de una malla bidimensional). Kleinberg calculó el tiempo mínimo empleado por cualquier algoritmo en llegar de un punto a otro de la red, obteniendo que cuando α=2, el tiempo empleado por cualquier algoritmo en una red de tamañonxn esproporcional a nβ, siendo β=(2−α)/3cuando α<2yβ=(α−2)/(α−1) cuando α>2(Figura 4.4). Cuando α=2, el tiempo empleado por cualquier algoritmo es proporcional a log2(n)2. Por otro lado, un algoritmo que poseyera un conocimiento perfecto sobre las conexiones de la red, emplearía un tiempo medio proporcional a log2(n). El algoritmo propuesto por Kleinberg que cumple estos límites de tiempo mínimo empleado entre dos puntos de la red es un simple algoritmo avaricioso que simplemente elige, entre los nodos a los cuales tenemos acceso en un salto, aquel que está más cerca de su destino. Un algoritmo alternativo es el propuesto por Martel y Nguyen, que demuestran en un trabajo 45 0 0.5 1 1.5 2 2.5 3 3.5 4 0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 β α Figura 4.4: Dependencia de la eficiencia βdel algoritmo de búsqueda con el factor α. posterior que si se modifica el algoritmo propuesto por Kleinberg de forma que, en lugar de conocer sólo las conexiones del nodo actual, conozca las conexiones del nodo actual y de los nodos adyacentes a él, el tiempo empleado será proporcional a log2(n)1,5(Martel y Nguyen, 2004) Además, demostraron que este resultado es extensible a N dimensiones, siendo de esta manera el tiempo utilizado proporcional a log2(n)1+1/k, de forma que, para un número suficientemente elevado de dimensiones, estaríamos en una situación similar a aquella en la que tenemos un conocimiento perfecto sobre las conexiones de la red. En nuestro caso, la red resultante del algoritmo evolutivo tiene la misma distribución de conexiones que una red de mundo pequeño con α=2, por lo que podemos afirmar que el algoritmo evolutivo utilizado converge hacia agentes que tienen una red de estados somáticos que le permita encontrar los caminos más cortos entre el estado actual y el estado somático deseado que maximice sus posibilidades de supervivencia para cada situación. La importancia de este tipo de estructuras intervengan en los procesos de toma de decisiones es que, si en cada paso la mejor opción es escoger aquella conexión que nos acerque más a nuestro destino, deja de ser necesaria la elaboración de planes. Las redes propuestas para guiar la toma de decisiones de los agentes evolucionan hacia redes en las que elegir la mejor opción a nivel local es equivalente a elegir la mejor opción a nivel global. Finalmente, en el apéndice H se hace un análisis del tipo de escala de la red, concluyendo que las redes obtenidas son redes de escala única, caracterizadas porque no hay unos pocos nodos que posean casi todas las conexiones de la red, sino que el número de conexiones por nodo tiene una distribución gaussiana. 4.5. Significado de las redes somáticas Una vez mostrada la importancia de una topología de mundo pequeño a la hora de construir el entramado de funciones emocionales, nos preguntamos si es posible identificar emociones concretas en las diferentes posiciones de nodos en la red. Para comprobar esto, vamos a llevar a cabo una simulación de agentes con una red somática implementada, y vamos a calcular el histograma de posiciones en la red, así como la función de densidad de probabilidad de los siguientes factores en función de su posición en la red: Encuentros con cazadores Energía obtenida de recoger alimentos Distancia de alimento (cantidad de alimento de las plantas más cercanas ponderado por la distancia a cada planta) Calculamos los parámetros de la redes somáticas de los 10 agentes simulados en un escenario concreto, después de que el algoritmo genético haya convergido. Se recoge información de 10.000 instantes aleatorios. Posteriormente realizamos un histograma bidimensional de las posiciones en la red, así como calculamos la función de densidad de probabilidad bidimensional de cada uno de los tres parámetros propuestos anteriormente. En la Figura 4.6 podemos observar como se forman dos zonas diferenciadas. De esta manera denominamos zonaAalazona en la cual los agentes tienen niveles bajos de energía y buscan 46 zonas con alta presencia de alimento, lo que conlleva tener que enfrentarse a una mayor probabilidad de encuentros con depredadores. Sin embargo, en la zona B, los agentes tienen niveles altos de energía, y ya no necesitan ir a las zonas con mayor alimento, por lo que se dirigen a zonas en las que es menos probable encontrarse con cazadores. Por lo tanto podemos pensar en un ciclo de vida de los agentes (Figura 4.5), que nacen con energía 0, buscan elevar sus niveles de energía rápidamente, arriesgándose a ser comidos por cazadores, e inmediatamente buscan zonas más tranquilas en las que sobrevivir preocupándose únicamente de mantener un nivel alto de energía. Figura 4.5: Ciclo de vida de los agentes. 4.6. Conclusiones: espacio de planes y representación de emociones En los apartados anteriores hemos propuesto un modelo de redes de mecanismos emocionales con el propósito de proporcionar a un agente un sistema de computación somática, permitiéndole llevar a cabo operaciones sobre representaciones de su estado corporal. A través de la implementación de este modelo en un entorno virtual, hemos encontrado que este tipo de redes cumplen unas características determinadas: Tienen una probabilidad de conectividad entre nodos proporcional a [d(u, v)]−2, siendo d(u, v)la distancia entre dos nodos ”u”y”v”, lo que permite que se puedan encontrar rápidamente los caminos más cortos en la red. Esta topología permite que la mejor estrategia a la hora de moverse por la red sea una estrategia avariciosa, permitiendo a los agentes crear un espacio de representación interna (de estados emocionales) en el que no tienen que preocuparse por las consecuencias a largo plazo, sino que estas ya están implícitas en sus marcadores emocionales. 47 a) b) histograma -40 -30 -20 -10 0 10 20 30 40 50 -40 -30 -20 -10 0 10 20 30 40 50 Zona A Zona B encuentros con cazadores -40 -30 -20 -10 0 10 20 30 40 50 -40 -30 -20 -10 0 10 20 30 40 50 Zona A Zona B c) d) cercanía de alimento -40 -30 -20 -10 0 10 20 30 40 50 -40 -30 -20 -10 0 10 20 30 40 50 Zona A Zona B energía -40 -30 -20 -10 0 10 20 30 40 50 -40 -30 -20 -10 0 10 20 30 40 50 Zona A Zona B Figura 4.6: a) Histograma de posiciones en la red. b) Densidad de probabilidad de encuentros con cazadores en cada posición de la red. c) Densidad de probabilidad de cercanía de alimento en cada posición de la red. d) Densidad de probabilidad de niveles de energía en cada posición de la red. 48 Capítulo 5 Conclusiones: mecanismos emocionales en un marco no lineal Una vez que hemos propuesto modelos que nos permiten caracterizar los diferentes efectos de considerar los mecanismos emocionales dentro de sistemas no lineales, y detallados los efectos emergentes producto de dichos modelos, procedemos a detallar e integrar las conclusiones que se recogen de ellos, así como su utilidad en un contexto más amplio. 5.1. Mecanismos emocionales dinámicos y acoplados Hemos propuesto que la teoría de los marcadores somáticos de Damasio falla en dos aspectos fundamentales, ya que el efecto de los marcadores dinámicos sobre la toma de decisiones es : lineal: el efecto de la suma de varios marcadores somáticos se suma linealmente estático: tener éxito a nivel global es equivalente a tener éxito a nivel local la mayor parte del tiempo. Estos dos aspectos llevan a un escenario en el que hacemos una equivalencia entre: marcadores somáticos “correctos” =⇒buenos resultados marcadores somáticos “erróneos” =⇒malos resultados Por el contrario, en nuestra propuesta los marcadores somáticos se implementan en un marco de cadenas de Markov, que es: acoplado: el efecto de la suma de varios marcadores somáticos depende de su interacción con el entorno dinámico: el efecto de una decisión no sólo depende del éxito a nivel local, sino de las posibilidades que nos abre. Hemos comprobado como esto nos permite evitar la equivalencia entre la calidad de los marcadores somáticos y la calidad de los resultados obtenidos. Y hemos observado que utilizar un marco de este tipo nos proporciona una resistencia a fallos, incluso cuando los mecanismos que poseemos se equivocan la mayoría de las veces. La característica de este sistema es que posee una robustez distribuida [Macia y Solé, 2008], que no se encuentra en ninguno de los elementos individuales del sistema, sino que emerge del conjunto de todos sus elementos. 5.2. Sistemas de toma de decisiones integrados en el tiempo Hemos criticado un modelo de tomas de decisiones que se caracteriza por: Desacoplar los espacios de decisión y acción en el tiempo. 49 Considerar la presencia de incertidumbre (sobre los cambios futuros en el mundo) como ‘ruido’ e ignorarla. Al no tener información sobre cómo va a cambiar el mundo, se maximiza el ajuste de la solución elegida en el tiempo del que se dispone, y se mantiene esa solución hasta que deje de ser buena. El modelo que proponemos, en cambio: No ignora la presencia de incertidumbre, sino que se aprovecha de mecanismos de inteligencia evolutiva (emociones) para aprovecharla. Consigue desarrollar un comportamiento en el que se acoplen los espacios de decisión y acción en el tiempo sin necesidad de conocer explícitamente cómo va a cambiar el mundo. Dicho comportamiento no elige las soluciones con máximo ajuste, sino que mediante soluciones subóptimas consigue encontrar la estrategia que es óptima a nivel global. 5.3. Redes de mecanismos emocionales La importancia de los resultados del modelo de red de mundo pequeño propuesto por Kleinberg está en que este tipo de redes constituyen estructuras en las que se cumple que: La eficiencia a nivel global es equivalente a elegir de forma eficiente en cada paso a nivel local, por lo tanto una estrategia ‘avariciosa’ es la que da mejores resultados. Esto puede parecer contradictorio con los resultados de los dos apartados anteriores, en los que demostrábamos que elegir localmente la solución con máxima calidad no tiene por qué ser siempre la mejor solución a largo plazo. Sin embargo, nuestra hipótesis es que las redes de mundo pequeño son utilizadas para implementar los mecanismos emocionales que nos permiten tomar esas decisiones que, aunque localmente sean peores, nos llevan a conseguir resultados mejores globalmente. Las emociones son la solución biológica frente a las limitaciones de nuestra racionalidad, permitiéndonos implementar representationes internas del mundo en las que se cumple la estrategia avariciosa. Esto es, pasar de una situación en la que decisiones que racionalmente parecen equivocadas a nivel local son las que a largo plazo permiten desarrollar la estrategia óptima: decisiones racionales erróneas =⇒buenos resultados a otra en la que la que esas decisiones tienen una etiqueta emocional positiva: marcadores emocionales positivos =⇒buenos resultados de forma que elegir localmente las decisiones que parecen mejores sí que nos va a llevar a situaciones globales mejores. Haciendo que tomar decisiones “utilizando nuestra intuición” sea una buena estrategia en la mayor parte de las situaciones a las que nos enfrentamos, como demuestra nuestra experiencia cotidiana. 5.4. Interés del trabajo realizado Durante la última década, la investigación en sistemas cognitivos se ha incluido entre los programas de investigación de interés estratégico de la Unión Europea. En concreto, en la actualidad se incluye como uno de los siete retos del programa FP7 (Seventh Framework Programme), el cual se centra en el objetivo de convertir a la UE en “la economía basada en el conocimiento más dinámica y competitiva del mundo”. Dentro del programa FP7 en sistemas cognitivos se plantea un problema fundamental de las tecnologías de la información y la comunicación (TIC): en diferentes tecnologías se pretende que dispositivos informáticos permitan que las diferentes máquinas y sistemas sean más inteligentes y útiles: en fábricas, oficinas, plantas de energía, así como aplicaciones del día a día. Sin embargo, generalmente estas máquinas y sistemas no son capaces de adaptarse a cambios en los requerimientos de servicio sin una extensiva intervención humana. A menudo, su eficacia decae 50 o simplemente dejan de funcionar, incluso en respuesta a cambios menores en su entorno de operación. Su habilidad de aprender de experiencias pasadas y mejorar sus servicios es mínima, si es que existe. Frente a este problema, uno de los objetivos es diseñar sistemas capaces de responder de forma inteligente y autónoma a lagunas en su conocimiento, así como a situaciones o contextos que no hayan sido especificados en su diseño (es decir, que sean robustos y flexibles), desarrollando para ello nuevos principios y enfoques desde la ingeniería. Lograr este objetivo requerirá repensar la forma en la que diseñamos sistemas. Mientras pretendamos crear máquinas que desarrollen capacidades semejantes a las de humanos o animales, es crucial buscar pistas e inspiración de las ciencias biológicas, así como estudiar nuevos paradigmas computacionales derivados de los modelos de cognición natural. El progreso en ingeniería dependerá fuertemente de cómo desarrollemos nuestro conocimiento científico sobre lo que tanto los sistemas naturales como artificiales pueden y no pueden hacer, y cómo y por qué. En este marco, consideramos que nuestro trabajo es una pequeña aportación a la hora de cambiar nuestra forma de pensar y diseñar los sistemas inteligentes. En el capítulo 2 hemos definido las emociones como mecanismos que nos permiten ampliar el abanico de situaciones para las que un agente tiene respuesta, y hemos demostrado como un mecanismo emocional de este tipo ofrece al sistema una mayor robustez. En el capítulo 3 hemos mostrado como un sistema puede adaptarse de forma eficiente a un entorno dinámico en el tiempo, destacando el papel de las emociones en dicho proceso. Finalmente, en el capítulo 4 hemos estudiado una estructura sobre la que implementar las funciones emocionales descritas. Todo ello, ofrece una perspectiva diferente sobre cómo un sistema puede decidir de forma inteligente en el mundo real directamente aplicable a diseños de ingeniería. 51