scieee AI-readable full text Open interactive document viewer

Análise do Treinamento de Redes Neurais Profundas no Paradigma de Aprendizado por Reforço Através do Plano de Informação

Fernandes, Arthur

Full text

UNIVERSIDADE ESTADUAL DE CAMPINAS Faculdade de Engenharia Elétrica e de Computação Arthur Felipe dos Santos Fernandes Análise do Treinamento de Redes Neurais Profundas no Paradigma de Aprendizado por Reforço Através do Plano de Informação Campinas 2025 Arthur Felipe dos Santos Fernandes Análise do Treinamento de Redes Neurais Profundas no Paradigma de Aprendizado por Reforço Através do Plano de Informação Dissertação apresentada à Faculdade de Engenharia Elétrica e de Computação da Universidade Estadual de Campinas como parte dos requisitos exigidos para obtenção do título de Mestre em Engenharia Elétrica, na área de Engenharia de Computação. Orientador: Prof. Dr. Denis Gustavo Fantinato ESTE TRABALHO CORRESPONDE À VERSÃO FINAL DA DISSERTAÇÃO DEFENDIDA PELO ALUNO ARTHUR FELIPE DOS SANTOS FERNANDES, E ORIENTADA PELO PROF. DR. DENIS GUSTAVO FANTINATO Campinas 2025 Ficha catalográfica Universidade Estadual de Campinas (UNICAMP) Biblioteca da Área de Engenharia e Arquitetura Vanessa Evelyn Costa - CRB 8/8295       Fernandes, Arthur Felipe dos Santos, 2000-  F391a Análise do treinamento de redes neurais profundas no paradigma de aprendizado por reforço através do plano de informação / Arthur Felipe dos Santos Fernandes. – Campinas, SP : [s.n.], 2025.        Orientador: Denis Gustavo Fantinato.    Dissertação (mestrado) – Universidade Estadual de Campinas (UNICAMP), Faculdade de Engenharia Elétrica e de Computação.       1. Aprendizagem por reforço. 2. Redes neurais (Computação). 3. Métodos de gradiente. 4. Teoria da informação. 5. Informação mútua. I. Fantinato, Denis Gustavo, 1985-. II. Universidade Estadual de Campinas (UNICAMP). Faculdade de Engenharia Elétrica e de Computação. III. Título.  Informações complementares Título em outro idioma: Analysis of deep neural network training in the reinforcement learning paradigm through the information plane Palavras-chave em inglês: Reinforcement learning Neural networks (Computer science) Gradient methods Information theory Mutual information Área de concentração: Engenharia de Computação Titulação: Mestre em Engenharia Elétrica Banca examinadora: Denis Gustavo Fantinato [Orientador] Fernando José Von Zuben Fabricio Olivetti de França Data de defesa: 18-08-2025 Programa de Pós-Graduação: Engenharia Elétrica Objetivos de Desenvolvimento Sustentável (ODS) Não se aplica Identificação e informações acadêmicas do(a) aluno(a) - ORCID do autor: https://orcid.org/0000-0002-0971-5112 - Currículo Lattes do autor: http://lattes.cnpq.br/2485116229416285 Denis Gustavo Fantinato Fernando José Von Zuben Fabricio Olivetti de França A ata de defesa, com as respectivas assinaturas dos membros da Comissão Julgadora, encontrase no SIGA (Sistema de Fluxo de Dissertação/Tese) e na Secretaria de Pós-Graduação da Faculdade de Engenharia Elétrica e de Computação. Agradecimentos O presente trabalho foi realizado com apoio da Coordenação de Aperfeiçoamento de Pessoal de Nível Superior – Brasil (CAPES) – Código de Financiamento 001. For those who come after. Gustave Resumo O Aprendizado por Reforço (RL) tem se consolidado como um paradigma de relevância para o treinamento de redes neurais profundas, impulsionando avanços notáveis em domínios complexos como jogos, robótica e sistemas autônomos. Essa abordagem faz com que agentes aprendam comportamentos sofisticados a partir da interação com o ambiente. Entretanto, apesar do sucesso empírico, a concepção de uma topologia de rede neural artificial adequada para tarefas de RL permanece um desafio. Adicionalmente, a análise da efetividade do aprendizado dessas redes ainda é limitada, pois o desempenho é convencionalmente avaliado pela recompensa acumulada, uma métrica de resultado que pouco explica sobre o processo interno de aprendizado ou sobre a qualidade das representações aprendidas. Diante dessas lacunas, este trabalho resgata a abordagem do plano de informação, uma ferramenta analítica originada do aprendizado supervisionado e fundamentada na Teoria da Informação. O plano de informação oferece uma perspectiva visual e quantitativa sobre os estágios de aprendizado de uma rede neural, medindo o fluxo de informação entre suas camadas e a relevância da representação para a saída. O objetivo principal desta pesquisa é aplicar o plano de informação no contexto do Aprendizado por Reforço, investigando a dinâmica do treinamento de agentes baseados no algoritmo Proximal Policy Optimization (PPO) em ambientes simulados. Os resultados parciais indicam que o plano de informação permite observar a evolução e relevância das representações internas do agente, revelando padrões que se correlacionam com a aquisição de habilidades. Essa análise mais granular abre caminho para uma compreensão aprimorada da eficiência do aprendizado e da formação de representações em RL, sugerindo novas abordagens para diagnóstico e otimização de agentes. Palavras-chave: Aprendizado por Reforço. Proximal Policy Optimization (PPO). Plano de Informação. Information Bottleneck. Abstract Reinforcement Learning (RL) has established itself as a relevant paradigm for training deep neural networks, driving notable advances in complex domains such as games, robotics and autonomous systems. This approach allows agents to learn sophisticated behaviors through interaction with the environment. However, despite its empirical success, designing a neural artificial network topology suitable for RL tasks remains a challenge. Additionally, analyzing the learning effectiveness of these networks is still limited, as performance is conventionally evaluated by accumulated rewards, a result metric that explains little about the internal learning process or the quality of the learned representations. Given these gaps, this work revisits the information plane approach, an analytical tool originating from supervised learning and grounded in Information Theory. The information plane offers a visual and quantitative perspective on the learning stages of a neural network, measuring the flow of information between its layers and the relevance of the representation to the output. The main objective of this research is to apply the information plane in the context of Reinforcement Learning, investigating the dynamics of training agents based on the Proximal Policy Optimization (PPO) algorithm in simulated environments. Partial results indicate that the information plane allows us to observe the evolution and relevance of the agent’s internal representations, revealing patterns that correlate with skill acquisition. This more granular analysis paves the way for an improved understanding of learning efficiency and representation formation in RL, suggesting new approaches for agent diagnosis and optimization. Keywords: Reinforcement Learning. Proximal Policy Optimization (PPO). Information Plane. Information Bottleneck. Lista de ilustrações Figura 1 – Representação de um neurônio . . . . . . . . . . . . . . . . . . . . . . 21 Figura 2 – Multi-Layer Perceptron ........................... 22 Figura 3 – Interação agente e ambiente em um processo de decisão de Markov. . . 25 Figura 4 – Exemplo de uma distribuição de estados com estado terminal. . . . . . 25 Figura 5 – Agente Ator-Crítico. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31 Figura 6 – Redes Ator e Crítico . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 Figura 7 – Redes QeTarget............................... 35 Figura 8 – Ilustração da limitação na loss imposta pelo clip ............. 37 Figura 9 – Um exemplo de uma rede neural com mcamadas intermediárias, rótulo Y, entrada Xe a saída da rede ˆ Y. .................... 39 Figura 10 – Plano de Informação com a dinâmica da informação mútua durante o aprendizado supervisionado. . . . . . . . . . . . . . . . . . . . . . . . . 40 Figura 11 – Adaptado de Saxe et al. (2019)....................... 41 Figura 12 – Visualização do ambiente CartPole .................... 49 Figura 13 – Visualização do ambiente Pendulum ................... 50 Figura 14 – Visualização do ambiente Acrobot ..................... 51 Figura 15 – Visualização do ambiente MountainCar ................. 52 Figura 16 – Loss e recompensa do agente no ambiente Cartpole............ 53 Figura 17 – Evolução da informação mútua do ator do agente no ambiente Cartpole. 54 Figura 18 – Evolução da informação mútua média do ator do agente no ambiente Cartpole ao longo de 100 inicializações distintas. . . . . . . . . . . . . . 55 Figura 19 – Loss e recompensa do agente no ambiente Acrobot. ........... 56 Figura 20 – Evolução da informação mútua do ator do agente no ambiente Acrobot. 57 Figura 21 – Evolução da informação mútua média do ator do agente no ambiente Acrobot ao longo de 100 inicializações distintas. . . . . . . . . . . . . . 58 Figura 22 – Loss e recompensa do agente no ambiente Pendulum........... 59 Figura 23 – Evolução da informação mútua do ator do agente no ambiente Pendulum. 60 Figura 24 – Evolução da informação mútua média do ator do agente no ambiente Pendulum ao longo de 100 inicializações distintas. . . . . . . . . . . . . 61 Figura 25 – Loss e recompensa do agente no ambiente MountainCar. ........ 62 Figura 26 – Evolução da informação mútua do ator do agente no ambiente MountainCar ................................... 63 Figura 27 – Evolução da informação mútua média do ator do agente no ambiente MountainCar ao longo de 100 inicializações distintas. . . . . . . . . . . 64 Figura 28 – Loss e recompensa do agente no ambiente CartPole. Topologia alternativadeumacamada............................ 65 3.3.4 Mountain Car .............................. 51 4 Resultados..................................... 53 4.1 ExperimentoI.................................. 53 4.2 ExperimentoII ................................. 55 4.3 ExperimentoIII................................. 57 4.4 ExperimentoIV................................. 59 4.5 ExperimentoV ................................. 62 4.6 ExperimentoVI................................. 63 4.7 ExperimentoVII ................................ 66 4.8 ExperimentoVIII................................ 66 4.9 Discussão dos Resultados . . . . . . . . . . . . . . . . . . . . . . . . . . . . 68 5 Conclusão..................................... 73 5.1 Perspectivas para Trabalhos Futuros . . . . . . . . . . . . . . . . . . . . . 73 Referências ...................................... 75 Apêndices 80 APÊNDICE A Demais resultados . . . . . . . . . . . . . . . . . . . . . . . . . 81 Anexos 92 ANEXO A Ambiente................................ 93 17 1 Introdução O aprendizado de máquina (ML, do inglês, Machine Learning) pode ser decomposto em três principais processos de aprendizagem: aprendizado supervisionado, aprendizado não supervisionado e aprendizado por reforço. Esses processos diferem pela forma como os dados são utilizados para o aprendizado (GOODFELLOW et al., 2016). O aprendizado supervisionado utiliza dados e rótulos sobre esses dados. Em contrapartida, o aprendizado não supervisionado utiliza apenas os dados, sem fazer uso dos rótulos. E, por fim, o aprendizado por reforço (RL, do inglês, Reinforcement Learning) gera seus dados a partir de uma interação dinâmica com o ambiente. RL permite que agentes aprendam a tomar uma sequência de decisões ótimas por meio de tentativa e erro, guiados por recompensas e/ou punições (LAPAN, 2020). Essa abordagem tem encontrado aplicações em diversas áreas, como robótica e controle (GU et al., 2017; LILLICRAP et al., 2019; CAMPOS, 2022). É comum a utilização de jogos para testar os avanços da área, pois jogos possuem ambientes de fácil simulação (MNIH et al., 2015; SCHULMAN et al., 2017). É possível observar o avanço do paradigma ao longo dos anos: em Campbell et al. (2002), é analisado o sistema Deep Blue que utilizou RL para o ajuste de alguns pesos. Em 1997, esse sistema derrotou o grande mestre do xadrez, Garry Kasparov. O xadrez possui uma estimativa de 1050 configurações permitidas (TROMP; FARNEBäCK, 2006). Para efeitos de comparação, o supercomputador mais poderoso atualmente, o Frontier, realiza cerca de 1018 operações de ponto flutuante por segundo em seu pico de desempenho (TOP500.org, 2024). Caso fosse necessário operar sobre cada configuração, o Frontier levaria 1032 segundos, um tempo astronomicamente maior que a idade do universo, estimada em aproximadamente 1017 segundos (Planck Collaboration et al., 2020). Em Silver et al. (2017) é apresentado o programa AlphaGo, combinando técnicas de RL e Monte Carlo Tree Search (MCTS). Em 2016, o programa ganhou do então campeão mundial de Go, Lee Sedol. A abordagem enfrentou um problema com cerca de 10170 configurações permitidas. Por fim, em Vinyals et al. (2019) é descrito o agente AlphaStar, que combinou aprendizado supervisionado e RL. Em 2018, o agente derrotou o campeão mundial de StarCraft II, Grzegorz Komincz. O jogo conta com diversas interações possíveis e é estimado que possui mais de 101685 configurações permitidas. Um dos principais fatores que possibilitou essa evolução foi o uso de redes profundas. O uso de redes profundas em RL ganhou notoriedade em 2013 com a primeira versão do trabalho de Mnih et al. (2015). Utilizando apenas RL, os autores mostraram que as redes foram capazes de aprender a jogar de forma sobre-humana em alguns jogos de Atari. A combinação das técnicas de RL com redes profundas gerou o Aprendizado por Reforço Profundo (DRL, do inglês, Deep Reinforcement Learning) (LAPAN, 2020). Capítulo 1. Introdução 18 No DRL, a capacidade de lidar com tarefas complexas frequentemente se traduz na necessidade de redes neurais consideravelmente profundas. Embora essa profundidade confira um poder de representação e mapeamento de funções sem precedentes, ela também introduz mais desafios (GOODFELLOW et al., 2016). A escolha de uma topologia adequada para essas redes torna-se uma tarefa não trivial (HENDERSON et al., 2019). Essa decisão costuma ser guiada por heurísticas ou por processos exaustivos de tentativa e erro, dada a ausência de um entendimento devidamente fundamentado que determine a arquitetura mais adequada para um problema específico. Uma topologia subótima pode tanto limitar a capacidade de aprendizado do agente (no caso de redes pouco flexíveis) quanto impedir a convergência do treinamento (no caso de redes excessivamente flexíveis) (LAPAN, 2020). Além desse problema, a dificuldade em se avaliar o aprendizado efetivo das redes representa um obstáculo fundamental no DRL. Tradicionalmente, o desempenho de uma rede é avaliado pela recompensa acumulada ao longo do tempo. Contudo, essa métrica por si só é uma medida de resultado e oferece pouca informação sobre o processo de aprendizado interno da rede. A métrica não revela se o agente está desenvolvendo representações eficientes, se está aprendendo a generalizar bem ou se está capturando as características mais relevantes do ambiente. Essa lacuna impede uma compreensão aprofundada do que a rede realmente “aprende”, dificultando diagnósticos e otimizações do processo de treinamento. Com a recompensa acumulada sendo a principal, e muitas vezes única, métrica de monitoramento, pode ser difícil determinar quando o agente atingiu um ponto de desempenho estável. A ausência de métricas mais granulares que capturem a qualidade das representações internas ou a eficiência do processamento da informação leva a decisões baseadas em limiares de recompensa arbitrários ou em um número fixo de iterações, que nem sempre correspondem ao aprendizado mais eficaz ou à melhor capacidade de generalização do agente. A fim de preencher essa lacuna e aprimorar a compreensão do processo de aprendizado interno dos agentes, uma estratégia promissora emerge do campo do aprendizado supervisionado: o uso do plano de informação (SHWARTZ-ZIV; TISHBY, 2017). Esta ferramenta analítica, que se baseia diretamente na Teoria da Informação, permite quantificar e visualizar o fluxo de informação através das camadas de uma rede neural. Ao medir a Informação Mútua entre a entrada, as representações internas e a saída da rede, o plano de informação oferece uma lente para observar como ocorre a evolução do processo sobre a informação relevante. Por conta disto, este trabalho se propõe a investigar o aprendizado de uma técnica de RL por meio do plano de informação, explorando os fundamentos teóricos, desafios e implementações. Serão abordados os principais conceitos: de redes neurais artificiais, como o neurônio Perceptron, o algoritmo backpropagation; de aprendizado por reforço, como a função de valor, a equação de Bellman e o processo de decisão de Markov; Capítulo 1. Introdução 19 e do Information Bottleneck, como a Informação Mútua e a divergência Kullback-Leibler. Entretanto, o plano de informação, por ser uma abordagem utilizada no aprendizado supervisionado, faz uso dos rótulos e, por isso, sua utilização em RL exigiria uma adaptação. 1.1 Objetivos O objetivo geral deste estudo é aprofundar a compreensão da dinâmica do aprendizado em RL a partir do plano de informação. Os objetivos específicos são: •Investigar a relação entre o fluxo de informação na rede profunda e o processo de aprendizado do agente em RL; •Analisar trajetórias no plano de informação e identificar possíveis estágios do aprendizado; •Propor uma variação do plano de informação para RL, de forma a não depender de um rótulo; •Avaliar o efeito de topologias distintas no plano de informação, considerando diferentes cenários em RL. 1.2 Estrutura do trabalho Este estudo se encontra dividido da seguinte maneira: •Introdução: onde foram expostas as motivações, o objeto de estudo e as principais estratégias que compõem a metodologia de solução dos problemas levantados; •Fundamentação teórica: apresenta-se a introdução a Redes Neurais, Aprendizado por Reforço e elementos da Teoria da Informação; •Metodologia: onde são descritos: os ambientes de simulação, a linguagem e as bibliotecas utilizadas; •Resultados: encontram-se os resultados obtidos deste estudo; •Perspectivas Futuras: onde é apresentado o planejamento da dissertação. 20 2 Fundamentação Teórica Este capítulo descreve as bases conceituais dos tópicos utilizados neste trabalho: redes neurais artificiais, seu funcionamento e alguns dos mecanismos de aprendizado que possuem (backpropagation e ADAM); aprendizado por reforço, sua relação com o processo de decisão de Markov, técnicas clássicas de solução, comentários acerca do treinamento de agentes e técnicas de solução (DQN, A2C e PPO); e teoria da informação, com suas técnicas para medição da informação mútua e o Information Bottleneck; 2.1 Redes Neurais Artificiais As redes neurais artificiais (do inglês, Artificial Neural Network) emergiram como um pilar fundamental da inteligência artificial. Elas impulsionaram avanços em diversas áreas como reconhecimento de padrões e processamento de linguagem natural. Inspiradas na estrutura e funcionamento do cérebro humano, as redes neurais consistem em camadas interconectadas de neurônios artificiais. As redes neurais são elementos capazes de aprender e generalizar a partir de dados (HAYKIN, 2009; BISHOP, 2006). Redes neurais são amplamente utilizadas pela sua capacidade de aproximação universal (HORNIK et al., 1989). Essa capacidade de aprendizado permite a modelagem de relações complexas e não lineares entre entradas e saídas. Destacam-se nesse âmbito as redes convolucionais e as redes Perceptron de Múltiplas Camadas (GOODFELLOW et al., 2016). 2.1.1 Multi-Layer Perceptron A rede Perceptron de Múltiplas Camadas (MLP, do inglês Multilayer Perceptron) é constituída por várias unidades de processamento simples chamadas perceptrons. Estas unidades são uma representação matemática aproximada do comportamento de um neurônio. Sendo ilustrado na Figura 1, a saída yde um neurônio é dada pela combinação das entradas xiponderadas pelos correspondentes pesos wi, com i= 1, . . . , n, somada a um viés be então aplicada a uma função de ativação f(·): y=f n X i=1 (xiwi) + b!(2.1) Ao incorporar o viés bno vetor de pesos w= [b, w1, w2,...wn]Te acrescentando um elemento unitário em x= [1, x1, x2, . . . , xn]T, tem-se a expressão em sua forma vetorial compacta: y=f(wTx)(2.2) Capítulo 2. Fundamentação Teórica 21 Figura 1 – Representação de um neurônio Fonte: Elaborado pelo autor. Sobre a Equação (2.2), a função de ativação fpode ser linear ou não-linear. Entretanto, a utilização de funções de ativação lineares pode trazer desvantagens que serão apresentadas mais adiante (HAYKIN, 2009). O aprendizado ocorre com o ajuste dos pesos. Este ajuste é guiado por um critério de desempenho, uma função de custo J(·)que quantifica o erro da rede. Esse erro pode ser medido de diversas formas, uma escolha comum é o erro quadrático médio (EQM), que calcula a diferença entre a saída predita do neurônio ye o rótulo t, de forma que a regra de atualização para um peso wié dada por: wi←wi+η(t−y)xi(2.3) sendo ηa taxa de aprendizado. Vale destacar que um único neurônio é capaz de distinguir apenas classes linearmente separáveis, mas é possível contornar o problema ao combinar vários neurônios (BISHOP, 2006). A combinação sequencial de neurônios permite a visualização de uma certa hierarquia, com a base sendo os dados de entrada e por isso é chamada de camada de entrada. Analogamente para a saída da rede, temos a camada de saída, e as camadas que não estão ligadas à entrada ou à saída são chamadas de camadas intermediárias (SCARDAPANE, 2024). A saída de cada neurônio de uma camada se torna uma entrada para todos os neurônios da camada seguinte, conforme ilustra a Figura 2, onde xié a i-ésima entrada, z(j) ié o i-ésimo neurônio da j-ésima camada e yié a i-ésima saída. Ao acrescentar novas camadas, a saída passa a ser descrita por funções aninhadas. Por exemplo, para uma MLP com duas camadas intermediárias, a saída é expressa como: z(1) =f1W(1)x z(2) =f2W(2)z(1) y=fsW(3)z(2) y=fsW(3)f2W(2)f1W(1)x (2.4) sendo W(i)a matriz de pesos da i-ésima camada. A partir da Equação (2.4) é possível Capítulo 2. Fundamentação Teórica 22 Figura 2 – Multi-Layer Perceptron Fonte: Elaborado pelo autor. observar que utilizar camadas lineares em sequência é desnecessário, uma vez que a combinação de duas ou mais camadas lineares pode ser representada por uma única camada linear (HAYKIN, 2009). Os pesos ajustáveis das redes neurais são geralmente treinados com base no aprendizado supervisionado, fazendo uso de dados rotulados. Ou seja, é necessário apresentar vários padrões de entrada acompanhados de seus rótulos associados para que a rede possa aproximar a função geradora dos rótulos. Em contrapartida, é necessário observar que uma rede deve prever corretamente comportamentos não apresentados durante o treinamento, isto é, ser capaz de generalizar (GOODFELLOW et al., 2016). 2.1.2 Stochastic Gradient Descent Na etapa de treinamento, é necessária uma medida de dissimilaridade entre a saída da rede ye a saída desejada t. Essa medida pode ser definida como uma função custo (do inglês, loss)J(θ)que realiza o mapeamento J:Rd→R, onde dé a dimensão do vetor de todos os pesos da rede θ. O objetivo do treinamento é minimizar, considerando todas as amostras disponíveis para treinamento, a distância entre a saída da rede e a saída desejada, ou seja: min θJ(θ)(2.5) A função custo pode assumir diversas formas, sendo o erro quadrático médio (MSE, do inglês, Mean Squared Error) a forma mais habitual para problemas de regressão: J(θ) = 1 N N X i=1 (ti−yi)2(2.6) Capítulo 2. Fundamentação Teórica 23 sendo No número de amostras ou padrões de entrada. Desse modo, o ajuste dos pesos pode utilizar a derivada de primeira ordem de J, representada pelo vetor gradiente: θi+1 ←θi−η∇J(θi)(2.7) sendo ηa taxa de aprendizado e ∇J(θi)o vetor gradiente de Jem função do vetor θna iésima iteração. Com isso basta repetir o processo até um certo critério de parada: número de iterações ou valor absoluto da norma do gradiente menor que um limiar. Isso define o algoritmo do gradiente descendente estocástico (SGD, do inglês, Stochastic Gradient Descent). Contudo, na MLP, o cálculo do gradiente em suas funções aninhadas exige o uso da técnica conhecida como backpropagation. 2.1.3 Backpropagation Um problema introduzido com a expansão do número de camadas é como realizar o ajuste dos pesos dos neurônios, uma vez que as camadas intermediárias, por si só, são incapazes de determinar a saída esperada. Para resolver isto, foi proposto o algoritmo backpropagation, que consiste na obtenção do vetor gradiente pela retropropagação do erro de saída para o restante das camadas. Isso ocorre a partir da regra da cadeia, de forma a incorporar a contribuição de cada neurônio na composição do erro. A atualização dos pesos na camada de saída é dada como: θ(M) kj ←θ(M) kj +ηδ(M) ky(M−1) j(2.8) sendo δ(M) ka sensibilidade na M-ésima camada, dada por δ(M) k=ekf′u(M) k, com f′(·) sendo a derivada da função de ativação e eko erro da aproximação do k-ésimo valor apresentado (tk−y(M) k). A atualização nas camadas intermediárias também obedece a Equação (2.8), embora a sensibilidade das camadas intermediárias seja dada por: δ(M−i) k=f′u(M−i−1) kX n δ(M−i) nw(M−i) nk (2.9) sendo no número de neurônios na camada anterior e ium índice que varia no intervalo [1, M −1], considerando a entrada como a camada zero. A atualização de pesos da camada intermediária ocorre sincronamente, após o cálculo do vetor gradiente. 2.1.4 Adaptive Momentum Estimation O uso de uma taxa de aprendizado constante ηpode apresentar alguns problemas. Além de um possível movimento oscilatório ou a troca da bacia de atração, o Capítulo 2. Fundamentação Teórica 24 progresso do aprendizado pode ser muito lento ou até mesmo divergente. Isso ocorre porque o passo fixo da taxa de aprendizado pode se tornar pequeno demais em algumas partes da superfície de erro, desacelerando a convergência, ou grande demais em outras, fazendo com que o processo de aprendizado se torne instável e não convirja. Para evitar esse tipo de problema, é utilizada uma técnica para o ajuste das taxas de aprendizado para cada peso da rede. O ADAM (Adaptive Momentum Estimation) utiliza estimativas de primeiro momento mke segundo momento vkde gradientes consecutivos: mk=γ1mk−1+ (1 −γ1)∇Jl(θ(k)) vk=γ2vk−1+ (1 −γ2) (∇Jl(θ(k)))2(2.10) onde ké o índice de atualização. Por assumir que m0ev0sejam vetores nulos, é necessária uma correção para mitigar o viés, dada na forma: ˆ mk=mk 1−γk 1 ,ˆ vk=vk 1−γk 2 .(2.11) Finalmente, a atualização dos pesos é dada por: θk+1←θk−η √ˆ vk+εˆ mk(2.12) Os valores recomendados para os hiperparâmetros são γ1= 0,9,γ2= 0,999 e ε= 10−8. 2.2 Aprendizado por Reforço Aprendizado por reforço (RL) consiste em treinar um agente de forma que este escolha a melhor sequência de ações para maximizar a recompensa ao longo de uma sequência de estados (SUTTON; BARTO, 1998). Nesse contexto, um agente é definido como um ente que possui a capacidade de observar o ambiente através de sensores e também é capaz de modificar esse ambiente por meio de suas ações, conforme ilustrado na Figura 3. O ambiente é o espaço total onde o agente se encontra. O agente, por sua vez, representará suas observações do ambiente, em um dado instante de tempo k, por meio de estados sdo conjunto de estados S. A partir disso, o agente irá interferir no ambiente com uma ação ado conjunto de ações A. E, por consequência, o agente será levado a um novo estado s′e receberá uma recompensa rdo conjunto de recompensas R(RUSSELL et al., 2010). Esse ciclo se repete até que o agente atinja um estado terminal st. Estados terminais representam o final da trajetória do agente, por não possuírem nem estados nem ações seguintes, conforme ilustra o estado s5na Figura 4. Os estados terminais podem representar o objetivo atingido ou uma posição que impeça o agente de realizar alguma ação. Entretanto, esses estados possuem uma recompensa associada. Por fim, a sequência de estados que atinge um estado terminal recebe o nome de episódio. Capítulo 2. Fundamentação Teórica 25 Figura 3 – Interação agente e ambiente em um processo de decisão de Markov. Agente estado recompensa ação Ambiente Fonte: Adaptado de Sutton e Barto (1998). Figura 4 – Exemplo de uma distribuição de estados com estado terminal. Fonte: Elaborado pelo autor. Um ambiente pode ser caracterizado de diversas formas, por exemplo, sendo contínuo ou discreto. As diversas propriedades relacionadas ao ambiente podem ser encontradas no Anexo A. Os demais elementos que compõe um sistema de RL são a política e a recompensa (SUTTON; BARTO, 1998). O objetivo do RL é obter um agente que execute um certo “comportamento inteligente”. Para isso, é necessário converter o conceito abstrato de “comportamento inteligente” para um conceito mais funcional como uma função, a função de recompensa. Dessa forma, o agente recebe um valor após a execução de uma ação em um dado estado. Assim sendo, a função de recompensa realiza um mapeamento R:S × A → R, sendo R ⊆ R. Essa função é gerada pelo projetista (ou recentemente por LLMs (MA et al., 2024)), não existindo uma forma sistemática de definir como gerar essa função a partir de um “comportamento inteligente” arbitrário. A política define a conduta do agente no ambiente: dado um estado s, uma Capítulo 2. Fundamentação Teórica 32 sendo ϕos pesos da função de aproximação da função valor e a atualização dos seus pesos é descrita como: ϕ←ϕ+αϕR(s, a) + γˆ Vϕ(s′)−ˆ Vθ(s)∇ϕˆ Vϕ(s′)(2.29) As redes podem ser melhor visualizadas na Figura 6, em que se especifica suas respectivas entradas e saídas. Figura 6 – Redes Ator e Crítico 𝛉 𝛉 Rede Ator Rede Crítico Fonte: Elaborado pelo autor. Vale ressaltar que o crítico pode aproximar outras funções, desde que variem com o estado (SUTTON; BARTO, 1998). 2.2.5 Treinamento Um problema que surge naturalmente com as abordagens de aprendizado é a maldição da dimensionalidade. Ela faz com que a quantidade de dados necessários cresça exponencialmente com a dimensão dos dados de entrada para que se tenha um resultado estatisticamente significativo (BISHOP, 2006). O RL, por sua natureza, já possui uma grande quantidade de dados envolvidos, como: o espaço estado-ação delimitado pela natureza do problema; e os hiperparâmetros, que podem influenciar o espaço estado-ação e até mesmo impossibilitam um treinamento efetivo. Com isso, existe o problema da convergência: não há garantias de que um método que use função de aproximação irá convergir. As principais variáveis incluem: Capítulo 2. Fundamentação Teórica 33 •hiperparâmetros, pequenas alterações nos hiperparâmetros podem influenciar significativamente o desempenho dos algoritmos (HENDERSON et al., 2019; EIMER et al., 2023); •inicialização da semente, os pesos iniciais podem atrasar o aprendizado para além de um ponto de retorno (HENDERSON et al., 2019; EIMER et al., 2023); •natureza do problema, o problema pode não ser solucionável; •flexibilidade da técnica, a abordagem utilizada pode não ser capaz de replicar o comportamento inteligente. Apesar disso, o RL permite que o agente desenvolva respostas inovadoras. A exploração permite soluções que fogem ao “conjunto de dados de treinamento” e que assim superariam as soluções propostas por um método de aprendizado supervisionado. Outro ponto forte do RL é o chamado self-play. Em cenários adversariais, é possível realizar o treinamento de agentes similares de modo que a competição propicie o surgimento de estratégias mais sofisticadas. Se tratando de RL, uma zona de simulação se torna quase que obrigatória, permitindo acelerar o “tempo real” de qualquer ambiente com base na capacidade de processamento da máquina. A zona de simulação consiste na representação do ambiente no formato computacional e a geração de sinais pseudo-aleatórios. O primeiro é necessário por gerar uma resposta similar à do “ambiente real”. O segundo é responsável por garantir a variedade dessa resposta, uma vez que se todas as sequências de estados fossem iguais, não haveria incremento de informação, apenas redundância. Os sinais são chamados pseudo-aleatórios pelo fato de que não é possível gerar sinais autenticamente aleatórios, sendo então gerados sinais que apresentam comportamento aleatório, mas que possuem grandes períodos (A biblioteca numpy usa um gerador padrão com período de 2128) a partir de sementes. Uma mesma semente, em um mesmo gerador, retorna a mesma sequência de valores pseudo-aleatórios. Com isso, é possível replicar resultados neste ambiente controlado. Métodos que podem ser atualizados com a experiência obtida com qualquer política são chamados de off-policy. Esses métodos costumam apresentar uma convergência mais lenta, mas se beneficiam durante a coleta de experiência. Em contrapartida métodos que só podem ser atualizados com a experiência obtida com a política atualizada são chamados de on-policy, costumam apresentar uma convergência mais rápida, ao custo de uma coleta de experiências mais limitada. Capítulo 2. Fundamentação Teórica 34 2.2.6 Técnicas O avanço do RL na resolução de problemas complexos tem sido impulsionado pelo desenvolvimento de diversas técnicas. Embora a base teórica para muitos desses algoritmos tenha sido estabelecida há décadas, a combinação delas com o poder de representação das redes neurais profundas expandiu os limites do aprendizado. O DRL (do inglês, Deep Reinforcement Learning) permitiu que agentes aprendessem a partir de entradas de alta dimensionalidade e navegassem em espaços de estado e ação vastos. Esta seção detalha as principais técnicas de DRL, Deep Q-Network (DQN), Advantage Actor-Critic (A2C) e Proximal Policy Optimization (PPO), cada uma com suas abordagens para lidar com os desafios inerentes ao RL. 2.2.6.1 Deep Q-Network Utilizando o método Q-learning combinado com uma rede neural artificial, tem-se a Deep Q-Network (DQN). Popularizado por Mnih et al. (2015), o DQN se diferencia do uso tradicional do Q-learning por alguns fatores: a ausência de uma função extratora de características (os valores de estado são passados diretamente para a rede neural); e a atualização dos pesos é calculada pelo backpropagation, sendo a loss descrita por: L=ˆ Qθ(s, a)−R(s, a) + γmax a′ ˆ Qθ(s′, a′)2 .(2.30) No entanto, isso traz algumas dificuldades. Ao tentar aproximar a função Q(s, a)com uma rede neural, acabamos caindo em uma abordagem de aprendizado supervisionado. Lapan (2020) aponta que o primeiro problema surge quando levamos em consideração que o método de otimização SGD requer que os dados sejam independentes e identicamente distribuídos (i.i.d). Esse critério não é atendido porque os dados não são independentes, pois as amostras recentes consistem de passos de um mesmo episódio; nem identicamente distribuídos, pois as amostras serão geradas por políticas diferentes ao invés de serem geradas pela política ótima. Para contornar esse problema é instituído um replay buffer Bpara acumular as transições (si, ai, si+1, ri+1)e, eventualmente, ser amostrado aleatoriamente para tentar garantir o i.i.d. O buffer consiste, normalmente, de uma fila de tamanho fixo. Dessa forma, quando atingir a capacidade máxima, as amostras mais antigas serão apagadas para dar lugar às amostras mais novas. Com isso, o treinamento do agente consiste em: •realizar uma ação seguindo uma política πqualquer e registrar a sequência no buffer B. •amostrar Kelementos de Be realizar a atualização dos pesos conforme (2.30). Capítulo 2. Fundamentação Teórica 35 Figura 7 – Redes QeTarget. Rede Rede Target Fonte: Elaborado pelo autor. O início da amostragem do buffer Bpode ser atrasado para garantir uma variedade maior de transições. O valor de Ké um hiperparâmetro a ser ajustado, pertencendo ao conjunto N+que determina o tamanho do batch. A amostragem de Bcostuma ser uniforme, mas existem técnicas que buscam extrair transições mais significativas. O segundo problema dessa abordagem de aprendizado supervisionado se encontra na atualização dos pesos. A Equação (2.30) tenta aproximar a função ˆ Qθ(s, a)com ela própria e isso gera instabilidade no treinamento. Para contornar isso, é introduzida uma rede alvo ˆ Qϕ(s, a)(do inglês, target network) conforme ilustra a Figura 7, com um conjunto de pesos ϕdistintos, de forma que o alvo da seção de aprendizado supervisionado não se desloque muito enquanto o aprendizado ocorre. Periodicamente, ϕé atualizado com o valor de θpara refletir a rede já treinada até atingir o critério de parada. No entanto, a mudança brusca da target network pode ser problemática e para evitar isso é realizada uma combinação convexa de ϕeθ. Combinando a target network com o buffer, temos o treinamento do agente que consiste em: 1. realizar uma ação seguindo uma política πe registrar a sequência (si, ai, si+1, ri+1) no buffer B; 2. Amostrar Kelementos de Be realizar a atualização dos pesos com base na loss L=ˆ Qθ(s, a)−R(s, a) + γmaxa′ˆ Qϕ(s′, a′)2; 3. atualizar ϕcom o valor de θa cada Népocas, conforme ϕ←τϕ+ (1 −τ)θ. Capítulo 2. Fundamentação Teórica 36 Sendo Num hiperparâmetro a ser ajustado, pertencendo ao conjunto N+eτum hiperparâmetro que varia no intervalo [0,1], embora o valor 0,999 seja comumente utilizado. 2.2.6.2 Advantage Actor-Critic Baseando-se no método actor-critic, utilizaremos redes neurais para o ator e para o crítico. Além disso, buscaremos reduzir o viés no estimador. Para isso, atualizaremos o crítico para aproximar a função vantagem. A função vantagem determina o quão vantajosa é uma ação adado o estado s:A(s, a) = Q(s, a)−V(s). Com isso, temos um agente ator-crítico de vantagem (A2C, do inglês, Advantage Actor-Critic). Entretanto, a função vantagem utilizada se baseia no estimador generalizado de vantagem (GAE, do inglês, Generalized Advantage Estimation) proposto por Schulman et al. (2018). Nessa versão, é inserido um hiperparâmetro λna atualização do valor da função vantagem, que varia no intervalo [0,1], para realizar um compromisso entre viés e variância na estimação da função vantagem usando o erro TD (2.22): ˆ AGAE k(γ, λ) = ∞ X l=0 (γλ)lδV k+l(2.31) No caso λ= 0, a soma de diversos valores é o próprio erro da diferença temporal δk. Enquanto que no caso λ= 1, seria o somatório descontado de diversas recompensas P∞ l=0 γlδk+l−V(sk). Dessa forma, a loss definida para o ator é dada por: La=∇θln πθ(s)ˆ AGAE k(γ, λ)(2.32) Enquanto que a loss para o crítico é definida por: Lc=ˆ AGAE k(γ, λ)−R(s, a) + γˆ AGAE k+1 (γ, λ)2(2.33) Além disso, também é adicionado um elemento de entropia para auxiliar na exploração do agente, para desencorajar o agente de tentar convergir de forma prematura (MNIH et al., 2016). A loss baseada na entropia é dada por: Lh=X i πθ(si) log2πθ(si)(2.34) Dessa forma, a otimização do agente deve levar em conta todas as funções que dependem da política πescolhida, por isso o ator deve utilizar uma loss combinada: L=La+µcLc+µhLh(2.35) onde µceµhsão hiperparâmetros a serem ajustados que variam no intervalo [0,∞). Somado a isso, tem-se um buffer Bresponsável por registrar ntransições contendo (si, ai, ri+1, si+1, πθ(a|s),log2πθ(a|s)), sendo num hiperparâmetro. Após a atualização dos pesos, o buffer é zerado e o processo se repete. Capítulo 2. Fundamentação Teórica 37 Ademais, o processo de seleção de hiperparâmetros pode utilizar ou não a técnica RMSProp descrita em Graves (2014), que introduz o parâmetro ϵque varia no intervalo [0,∞). Além dos elementos já conhecidos como taxa de aprendizado αe fator de desconto γ. 2.2.6.3 Proximal Policy Optimization O atual estado da arte em RL foi desenvolvido por Schulman et al. (2017) com base no TRPO (Trust Region Policy Optimization). O Proximal Policy Optimization (PPO) utiliza uma função defasada da política πθold (a|s)para realizar uma espécie de importance sampling a fim de estimar o ganho na recompensa que a nova política possui quando comparada com a antiga: LCLI =E"πθ(a|s) πθold (a|s)ˆ Ak#=Ehrk(θ)ˆ Aki(2.36) A partir dessa equação, o PPO acrescenta um clip, limitando a contribuição que uma ação vantajosa tem sobre o agente, mas permitindo penalização sem limites quando a ação é desvantajosa: LCLIP =Ehmin rk(θ)ˆ Ak,clip(rk(θ),1−ϵ, 1 + ϵ)ˆ Aki (2.37) sendo ϵum novo hiperparâmetro que varia no intervalo [0,1]. O comportamento da loss pode ser visualizado na Figura 8. O objetivo é manter um bom compromisso entre estabilidade e velocidade de aprendizado: ações vantajosas são encorajadas, mas sem mudar radicalmente a trajetória anterior; enquanto que ações desastrosas são penalizadas sem nenhum limitante. Figura 8 – Ilustração da limitação na loss imposta pelo clip Fonte: Adaptado de Schulman et al. (2017). Capítulo 2. Fundamentação Teórica 38 Devido ao PPO ser um método actor-critic, muitas das técnicas empregadas no A2C também são aplicadas neste método, como: o GAE (2.31) para o cálculo da função vantagem; a combinação da loss do crítico e da loss da entropia para a atualização dos pesos; e o uso de um buffer para o processo de treinamento. 2.3 Teoria da Informação Nesta seção, abordaremos de maneira sucinta os conceitos necessários para o entendimento do Information Bottleneck (IB) e do Plano de Informação. Para tanto, é necessário abordar a definição de informação. O problema é que o conceito de informação é muito vago para ser completamente capturado por uma única definição. Todavia, existe uma quantidade que possui muitas propriedades que condizem com a noção intuitiva de informação: a entropia (COVER; THOMAS, 2006). A entropia é a medida da incerteza de uma variável aleatória (COVER; THOMAS, 2006). Assumindo que Xé uma variável aleatória discreta de um conjunto Xcom uma função massa de probabilidade p(x) = Pr[X=x], x ∈ X, a entropia H(X)da variável aleatória discreta Xé definida por: H(X) = −X x∈X p(x) log2p(x).(2.38) A partir da entropia é possível obter novas métricas. Uma delas é a entropia relativa. Entropia relativa é a medida de distância entre duas distribuições. Também chamada de divergência de Kullback-Leibler, a entropia relativa é uma medida de duas funções massa de probabilidade p(x)eq(x)definida como: D(p||q) = X x∈X p(x) log2 p(x) q(x).(2.39) A entropia relativa é uma espécie de medida de erro, indicando o quão incorreto é supor que uma variável aleatória Xpossui uma distribuição qao invés da distribuição real p. Enquanto a entropia relativa é útil para se ter uma ideia do erro, pode-se recorrer ainda a outras medidas comparativas, como a informação mútua. Informação mútua (IM) é uma medida da quantidade de informação que uma variável aleatória contém sobre outra variável aleatória. A informação mútua I(X;Y)é definida como a entropia relativa entre a distribuição conjunta p(x, y)e o produto de suas distribuições marginais p(x)p(y): I(X;Y) = X x∈X X y∈Y p(x, y) log p(x, y) p(x)p(y)(2.40) A informação mútua I(X, Y )também pode ser interpretada como a redução na incerteza de Xao se conhecer Y(COVER; THOMAS, 2006). Capítulo 2. Fundamentação Teórica 39 2.3.1 Information Bottleneck OInformation Bottleneck (IB) é um princípio da teoria da informação para analisar e/ou controlar o fluxo de informação dentro de uma rede profunda. Isso ocorre por meio da medição da informação relevante que uma variável aleatória de entrada X∈ X contém sobre uma variável aleatória de rótulos Y∈ Y (TISHBY; ZASLAVSKY, 2015). A quantidade de informação sobre Yem Xé medida pela informação mútua I(X, Y ). No contexto de redes neurais profundas, o IB pode ser medido em todas as camadas da rede, permitindo uma análise do fluxo de informação (TISHBY; ZASLAVSKY, 2015). Inicialmente, se supõe que as características da entrada Xsão obtidas de um mapeamento de valores do rótulo Y. Na sequência, a saída da i-ésima camada, hi, é vista como uma transformação da entrada da camada anterior. Finalmente, a saída da rede ˆ Yé gerada na camada de saída, como mostrado na Figura 9. Dessa forma, o fluxo de informação pode ser analisado usando a evolução da informação mútua entre a entrada Xe o rótulo Yatravés de uma camada intermediária hi. Figura 9 – Um exemplo de uma rede neural com mcamadas intermediárias, rótulo Y, entrada Xe a saída da rede ˆ Y. Fonte: Elaborado pelo autor. Considerando o paradigma supervisionado, uma consequência imediata é o Data Processing Inequality (DPI), que estabelece que a informação sobre Yperdida em uma camada não pode ser recuperada em camadas subsequentes (COVER; THOMAS, 2006). Matematicamente, para qualquer i≥j, tem-se que I(X, Y )≥I(Y, hj)≥I(Y, hi)≥I(Y, ˆ Y).(2.41) Isso implica que, ao processar X, a informação sobre o valor alvo Ynão pode ser aumentada ao longo das camadas. No entanto, no contexto de RL, frequentemente não temos uma referência ou rótulo desejado para cada entrada, o que implica que a aplicação do DPI pode não ser viável. Capítulo 2. Fundamentação Teórica 40 Apesar disso, tanto os paradigmas de aprendizado supervisionado quanto os de reforço podem se beneficiar da IB para o controle do fluxo de informação. Basicamente, o fluxo de informação da entrada até um ponto intermediário da rede neural pode ser restringido por meio da aplicação de um limite em I(X, hi)(em certos casos, isso poderia ser expresso em termos da divergência de Kullback-Leibler (COVER; THOMAS, 2006)). Essa restrição contribui para uma melhor generalização do modelo em ambos os paradigmas. 2.3.2 Plano de Informação Por outro lado, considerando a análise do fluxo de informação em redes profundas, a análise do Plano de Informação foi proposta em (SHWARTZ-ZIV; TISHBY, 2017). A ideia usual é avaliar a informação mútua entre a entrada Xe o rótulo Yatravés de uma camada específica hiao longo do treinamento do modelo, permitindo uma compreensão mais profunda das fases de aprendizado. No caso supervisionado, a trajetória no Plano de Informação geralmente consiste em duas fases: minimização do erro empírico e compressão da representação (SHWARTZZIV; TISHBY, 2017), como ilustrado na Figura 10. Na primeira fase, o erro empírico é reduzido, levando a um aumento na informação mútua entre as camadas e o rótulo I(hi, Y ). Já na segunda fase, a representação de entrada é comprimida, diminuindo a informação mútua entre a entrada e a representação I(X, hi)enquanto afeta minimamente a informação mútua entre as camadas e o rótulo. Figura 10 – Plano de Informação com a dinâmica da informação mútua durante o aprendizado supervisionado. Redução de erro Compressão Fonte: Elaborado pelo autor. É possível verificar o comportamento esperado no caso supervisionado para uma rede de múltiplas camadas a partir do trabalho de Saxe et al. (2019) exposto na Figura 11. Capítulo 2. Fundamentação Teórica 41 Figura 11 – Adaptado de Saxe et al. (2019). É importante destacar que, no aprendizado supervisionado, a informação mútua é calculada com base no rótulo Y(TISHBY et al., 2000). Isso torna difícil replicar essa análise para cenários de RL. 2.3.3 Métodos de Estimação de Informação Mútua Diferentemente da teoria, não temos acesso às distribuições reais dos dados e, por conta disso, devemos recorrer à estimação para aproximar I(X, hi). Em muitos cenários práticos, as distribuições de probabilidade p(x, y),p(x)ep(y)são desconhecidas. Nesses casos, a informação mútua I(X, hi)precisa ser estimada ˆ I(X, hi)a partir de um conjunto de amostras observadas. Existem diversas abordagens para a estimação da IM, que podem ser classificadas em métodos paramétricos e não paramétricos. 2.3.3.1 Métodos Baseados em Histograma Uma das abordagens mais simples para a estimação da IM é a utilização de histogramas. Neste método, o espaço de cada variável é discretizado em um número finito de intervalos. As probabilidades p(x),p(y)ep(x, y)são então estimadas pela frequência relativa das amostras que pertencem a cada intervalo ou combinação de intervalos: ˆp(x) = contagem(x) N,ˆp(y) = contagem(y) N,ˆp(x, y) = contagem(x, y) N(2.42) onde Né o número total de amostras. A IM é então estimada substituindo as estimativas das distribuições na Equação (2.40). Capítulo 3. Metodologia 48 de treinamento da rede, quando seus pesos ainda estão muito próximos da inicialização aleatória. Além disso, a utilização do plano de informação usualmente consiste em analisar a evolução da IM entre as camadas de entrada Xe rótulo Y, ou neste trabalho a saída da rede ˆ Y, através de uma camada intermediária qualquer hiao longo do treinamento da rede. Neste trabalho, expandiu-se a abordagem, utilizando o plano de informação para analisar a evolução da informação entre duas camadas quaisquer hiehkatravés de uma camada específica hj, desde que satisfaçam i < j < k. Isso permitiu a análise do fluxo de informação entre camadas. O plano de informação compara a evolução da IM entre camadas, onde cada ponto representa uma época. Em cada época, a rede é treinada em lotes (64) até utilizar todo as transições do buffer (2048). O buffer contém transições coletadas sob um mesma política. Por fim, ressalta-se que, embora a política seja atualizada após cada época, as transições do buffer só são renovadas após a rede treinar pelo número de épocas definido (10). É crucial notar que a IM está sujeita a variações, tanto por ser uma grandeza estimada a partir de amostras de dados quanto por depender da estimação subjacente da função de densidade de probabilidade. Pequenas flutuações e ruídos na curva de IM estimada são inerentes ao processo de estimação e devem ser interpretados como parte de sua dinâmica estocástica e não necessariamente como quebras na tendência geral de aprendizado de representações. 3.3 Ambientes Selecionados A partir da biblioteca Gymnasium, os ambientes de simulação CartPole,Acrobot,Pendulum eMountainCar foram escolhidos por serem problemas relativamente simples. As características dos ambientes são descritas nas Seções 3.3.1 a 3.3.4. 3.3.1 CartPole Neste ambiente, uma haste é anexado a um carrinho que se move ao longo de um trilho sem atrito, como mostra a Figura 12. O agente atua no ambiente pela aplicação de deslocamento no carrinho. O objetivo do agente é equilibrar o haste apenas empurrando o carrinho. O espaço de ação Aé limitado a: Empurrar o carrinho para     0 : esquerda 1 : direita (3.1) Capítulo 3. Metodologia 49 Figura 12 – Visualização do ambiente CartPole Fonte: Adaptado de Towers et al. (2023). O espaço de observação Spossui quatro elementos que estão dispostos na Tabela 2. O espaço inicial S0consiste de quatro amostragens da distribuição U(−0.05,0.05) para posição e velocidade do carrinho, além de ângulo e velocidade angular da haste. Tabela 2 – Observações do ambiente CartPole Observação Min Max Posição do carrinho −4.8 4.8 Velocidade do carrinho −∞ ∞ Ângulo da haste ∼ −24◦∼24◦ Velocidade angular da haste −∞ ∞ Fonte: Adaptado de Towers et al. (2023). A função de recompensa Ré+1 para cada passo. Por fim, a finalização do episódio ocorre se: •a posição do carrinho ultrapassar a região (−2.4,2,4); •o ângulo da haste sair da região (−12◦,12◦); •o número de passos atingir o limite de 500. Dessa forma, caso o agente consiga equilibrar a haste por mais tempo, receberá maior recompensa (máximo de 500). 3.3.2 Pendulum Neste ambiente, a ponta de uma haste é fixada enquanto a outra é mantida livre, fazendo da haste um pêndulo. A Figura 13 ilustra o ambiente, onde xeysão os eixos cartesianos assumidos para o ambiente, θé a angulação do pêndulo e τé o torque. O agente atua no ambiente pela aplicação de torque na ponta livre do pêndulo. O objetivo do agente é equilibrar o pêndulo sobre o eixo positivo x. O espaço de ação Aé a intensidade de torque aplicada à extremidade livre do pêndulo τ∈[−2,2]. O espaço de observação Spossui três elementos que estão dispostos na Tabela 3. O espaço inicial S0consiste de dois valores aleatórios: angulação θdo pêndulo, amostrado de U(−π, π); e velocidade angular ωdo pêndulo, amostrado de U(−1,1). Capítulo 3. Metodologia 50 Figura 13 – Visualização do ambiente Pendulum Fonte: Adaptado de Towers et al. (2023). Tabela 3 – Observações do ambiente Pendulum Observação Min Max cos(θ)−1 1 sin(θ)−1 1 ωdo pêndulo −8 8 Fonte: Adaptado de Towers et al. (2023). A função de recompensa Ré definida como: R(s, a) = −(θ2+ 0.1ω2+ 0.001τ2)(3.2) Dessa forma, a recompensa a cada passo varia no intervalo [−16.2736044011,0]. O único critério para finalização do episódio é quando o número de passos atingir o limite de 200. 3.3.3 Acrobot Neste ambiente, duas hastes são conectadas por meio de um elo, fazendo um pêndulo duplo, como mostra a Figura 14. O agente atua no ambiente pela aplicação de torque no elo que liga as hastes. O objetivo do agente é deslocar a ponta livre do pêndulo duplo acima de uma certa altura (delimitada pela linha preta na Figura). O espaço de ação Aé limitado a: Torque aplicado:           0 : negativo 1 : nulo 2 : positivo (3.3) O espaço de observação Spossui seis elementos que estão dispostos na Tabela 4, onde θ1é o ângulo da extremidade fixa, θ2é o ângulo da extremidade livre relativo ao ângulo da extremidade fixa, ωθ1é a velocidade angular da primeira haste e ωθ2é a Capítulo 3. Metodologia 51 Figura 14 – Visualização do ambiente Acrobot Fonte: Adaptado de Towers et al. (2023). velocidade angular da segunda haste. O espaço inicial S0é definido a partir de quatro amostragens da distribuição U(−0.1,0.1) para θ1,θ2,ωθ1eωθ2. Tabela 4 – Observações do ambiente Acrobot Observação Min Max cos(θ1)−1 1 sin(θ1)−1 1 cos(θ2)−1 1 sin(θ2)−1 1 ωθ1−4π4π ωθ2−9π9π Fonte: Adaptado de Towers et al. (2023). A função de recompensa Ré−1para cada passo em um estado não terminal e0para cada passo em um estado terminal. Por fim, a finalização do episódio ocorre se: •a posição da ponta livre ultrapassar a região delimitada, sendo este critério descrito em termos da angulação como −cos(θ1)−cos(θ2+θ1)>1.0; (3.4) •o número de passos atingir o limite de 500. 3.3.4 Mountain Car Neste ambiente, um carrinho é colocado na base de um vale de montanhas, como mostra a Figura 15. O agente atua no ambiente pela aplicação de aceleração no carrinho O objetivo do agente é deslocar o carrinho até a bandeira amarela no topo da colina à direita. Capítulo 3. Metodologia 52 Figura 15 – Visualização do ambiente MountainCar Fonte: Adaptado de Towers et al. (2023). O espaço de ação Aé limitado a: Aceleração aplicada           0 : negativa 1 : nula 2 : positiva (3.5) O espaço de observação Spossui dois elementos que estão dispostos na Tabela 5. O espaço inicial S0consiste de uma amostragem da distribuição U(−0.6,−0.4) para a posição do carrinho, enquanto a velocidade é 0. Tabela 5 – Observações do ambiente MountainCar Observação Min Max Posição do carrinho no eixo x−1.2 0.6 Velocidade do carrinho −0.07 0.07 Fonte: Adaptado de Towers et al. (2023). A função de recompensa Ré−1para cada passo em um estado não terminal e0para cada passo em um estado terminal. Por fim, a finalização do episódio ocorre se: •a posição do carrinho atingir a região [0.5,0.6]; •o número de passos atingir o limite de 200. 53 4 Resultados Cada experimento consistiu em treinar agentes baseados no algoritmo PPO nos ambientes selecionados, dispostos nas Seções 4.1 a 4.4. Para cada ambiente, foram mantidas as mesmas condições (topologia, coeficientes, semente). Além disso, também foram realizados experimentos alterando a topologia de duas camadas para uma camada e para três camadas intermediárias, mantendo os demais parâmetros da rede e de treinamento. Esses experimentos foram realizados nos ambientes Cartpole eAcrobot, dispostos nas Seções 4.5 a 4.8. Os resultados dos experimentos são apresentados a seguir. 4.1 Experimento I A Figura 16 ilustra os componentes da loss de treinamento e a recompensa do agente PPO no ambiente CartPole. É possível observar na Figura 16a o padrão de decrescimento na loss para todas as componentes: loss da entropia Lh,loss do ator La eloss do crítico Lc. Por volta de 300 épocas a loss aparenta convergir, o que sugere que o agente aprendeu uma política razoável. Essa consideração é confirmada na Figura 16b, onde é possível observar que a recompensa máxima (500) é atingida de forma consistente.                                                  ±  Figura 16 – Loss e recompensa do agente no ambiente Cartpole. Capítulo 4. Resultados 54 A Figura 17 mostra o plano de informação para o agente no ambiente CartPole. É possível observar uma espécie de trajetória para cada relação de IM apresentada, onde cada ponto representa uma época de treinamento. Essas trajetórias, embora possam parecer erráticas, demonstram uma convergência para uma certa região do plano de informação. As relações envolvendo a primeira camada oculta, ˆ I(X, h1)׈ I(h1, h2)e ˆ I(X, h1)׈ I(h1,ˆ Y), ilustradas nas Figuras 17a e 17b, respectivamente, exibem uma convergência atrelada a uma grande variação de ˆ I(X, h1), indicando que a primeira camada ainda explora significativamente o espaço informacional da entrada. Simultaneamente, elas mantêm variações mais contidas em ˆ I(h1, h2)eˆ I(h1,ˆ Y), respectivamente. Ressaltase que essa “estabilidade” de ˆ I(h1,ˆ Y)começa a se manifestar por volta das 300 épocas, coincidindo com a suposta convergência da loss do agente.         I ( X , h 1)         I ( h 1, h 2)   I ( X , h 1)× I ( h 1, h 2)         I ( X , h 1)         I ( h 1, Y )   I ( X , h 1)× I ( h 1, Y )     I ( X , h 2)       I ( h 2, Y )   I ( X , h 2)× I ( h 2, Y )     I ( h 1, h 2)       I ( h 2, Y )   I ( h 1, h 2)× I ( h 2, Y )       Figura 17 – Evolução da informação mútua do ator do agente no ambiente Cartpole. Em contrapartida, as relações envolvendo a segunda camada oculta, como ˆ I(X, h2)׈ I(h2,ˆ Y)eˆ I(h1, h2)׈ I(h2,ˆ Y), apresentadas nas Figuras 17c e 17d, possuem uma trajetória que se assemelha ao comportamento observado no caso supervisionado (SHWARTZ-ZIV; TISHBY, 2017). Durante uma primeira fase, é possível observar um aumento significativo de ˆ I(h2,ˆ Y), com pouca variação nas métricas ˆ I(X, h2)eˆ I(h1, h2), similar à fase de redução de erro empírico (SHWARTZ-ZIV; TISHBY, 2017). Após a época 40, inicia-se a segunda fase, caracterizada pela compressão da informação, onde ˆ I(h2,ˆ Y) varia pouco e se estabiliza em um patamar elevado, enquanto ˆ I(X, h2)eˆ I(h1, h2)são Capítulo 4. Resultados 55 progressivamente reduzidos. Esse processo permanece até por volta da época 200. Após isso, embora ocorram pequenos distúrbios, a informação mútua das relações ˆ I(X, h2)× ˆ I(h2,ˆ Y)eˆ I(h1, h2)׈ I(h2,ˆ Y)se mantém próxima dessa região, indicando que a rede alcançou uma representação eficiente e consolidada para a tarefa. A Figura 18 mostra a evolução média da informação mútua no plano de informação do agente para 100 inicializações distintas no ambiente CartPole. É possível observar que as trajetórias descritas na Figura 17 se apresentam de maneira similar, em especial as trajetórias descritas nas Figuras 17c e 17d. Esse comportamento consistente indica que o padrão de evolução não é uma anomalia de um único experimento, mas sim um comportamento robusto do agente durante o treinamento. 3.00 3.05 3.10 3.15 3.20 3.25 3.30 3.35 3.40 I ( X , h 1) 1.8 2.0 2.2 2.4 2.6 2.8 3.0 3.2 3.4 I ( h 1, h 2) a) Relação I ( X , h 1)× I ( h 1, h 2) 3.00 3.05 3.10 3.15 3.20 3.25 3.30 3.35 3.40 I ( X , h 1) 0.25 0.50 0.75 1.00 1.25 1.50 1.75 2.00 I ( h 1, Y ) b) Relação I ( X , h 1)× I ( h 1, Y ) 1.8 2.0 2.2 2.4 2.6 2.8 3.0 3.2 3.4 I ( X , h 2) 0.0 0.5 1.0 1.5 2.0 I ( h 2, Y ) c) Relação I ( X , h 2)× I ( h 2, Y ) 1.8 2.0 2.2 2.4 2.6 2.8 3.0 3.2 3.4 I ( h 1, h 2) 0.0 0.5 1.0 1.5 2.0 I ( h 2, Y ) d) Relação I ( h 1, h 2)× I ( h 2, Y ) 0 1000 2000 3000 4000 Épocas Figura 18 – Evolução da informação mútua média do ator do agente no ambiente Cartpole ao longo de 100 inicializações distintas. 4.2 Experimento II A Figura 19 ilustra os componentes da loss do treinamento e a recompensa do agente no ambiente Acrobot. Na Figura 19a é possível observar o padrão de decrescimento nas componentes da loss. Por volta da época 300 aloss aparenta convergir, contudo, diferentemente do Experimento I (4.1), a loss apresenta flutuações. Flutuações na loss são comuns e ilustram os ruídos inerentes ao ambiente. Apesar dessas flutuações, a Figura Capítulo 4. Resultados 56 19b demonstra indica que o aprendizado ocorreu, uma vez que o agente consegue manter de forma consistente uma alta recompensa (cerca de −100).                                                ±  Figura 19 – Loss e recompensa do agente no ambiente Acrobot. A Figura 20 mostra o plano de informação. Similar ao resultado observado no Experimento I (4.1), as trajetórias das relações envolvendo a primeira camada oculta, especificamente ˆ I(X, h1)׈ I(h1, h2)eˆ I(X, h1)׈ I(h1,ˆ Y), apresentadas nas Figuras 20a e 20b, respectivamente, não são tão bem comportadas e apresentam um nível de ruído maior. A trajetória em ˆ I(X, h1)׈ I(h1, h2)é particularmente mais ruidosa, o que pode indicar a maior variabilidade na extração inicial de características da entrada em um ambiente mais complexo. Por outro lado, ˆ I(X, h1)׈ I(h1,ˆ Y)mantém uma forma mais comportada, indicando que, mesmo na primeira camada, a informação relevante para a saída final (ˆ Y) é processada de maneira mais estável. Em contrapartida, as relações envolvendo a segunda camada oculta, como ˆ I(X, h2)׈ I(h2,ˆ Y)eˆ I(h1, h2)׈ I(h2,ˆ Y), apresentadas nas Figuras 20c e 20d, respectivamente, exibem uma trajetória que se assemelha ao Experimento I e mais claramente ainda ao comportamento observado no caso supervisionado (SHWARTZ-ZIV; TISHBY, 2017). Essas relações apresentam uma espécie de “alvo” mais claro no plano de informação, para Capítulo 4. Resultados 57 o qual as trajetórias convergem. Durante uma fase inicial, é possível observar um aumento de ˆ I(h2,ˆ Y), com pouca variação nas métricas de ˆ I(X, h2)eˆ I(h1, h2), o que é análogo à fase de redução de erro empírico (SHWARTZ-ZIV; TISHBY, 2017). Posteriormente, as trajetórias sugerem o início da fase de compressão da informação, onde ˆ I(h2,ˆ Y)estabiliza em um patamar elevado, enquanto as métricas ˆ I(X, h2)eˆ I(h1, h2)são reduzidas.         I ( X , h 1)       I ( h 1, h 2)   I ( X , h 1)× I ( h 1, h 2)         I ( X , h 1)      I ( h 1, Y )   I ( X , h 1)× I ( h 1, Y )        I ( X , h 2)       I ( h 2, Y )   I ( X , h 2)× I ( h 2, Y )       I ( h 1, h 2)       I ( h 2, Y )   I ( h 1, h 2)× I ( h 2, Y )       Figura 20 – Evolução da informação mútua do ator do agente no ambiente Acrobot. A Figura 21 mostra a evolução média da informação mútua no plano de informação do agente para 100 inicializações distintas no ambiente Acrobot. É possível observar que as trajetórias descritas na Figura 20 se apresentam de maneira similar, em especial as trajetórias descritas nas Figuras 20c e 20d. Esse comportamento consistente reforça que o padrão de evolução não é uma anomalia, mas sim um comportamento robusto do agente durante o treinamento. Ainda que esse padrão de evolução não seja tão similar ao comportamento apresentado na Figura 18. 4.3 Experimento III A Figura 22 ilustra os componentes da loss de treinamento e a recompensa do agente no ambiente Pendulum. A partir da Figura 22a, é possível observar um padrão de decrescimento na loss para todas as suas componentes, similar ao observado nos Experi- Capítulo 4. Resultados 64 2.8 2.9 3.0 3.1 3.2 3.3 3.4 3.5 I ( X , h 1) 2.0 2.5 3.0 3.5 4.0 I ( h 1, h 2) a) Relação I ( X , h 1)× I ( h 1, h 2) 2.8 2.9 3.0 3.1 3.2 3.3 3.4 3.5 I ( X , h 1) 0.0 0.5 1.0 1.5 2.0 2.5 3.0 I ( h 1, Y ) b) Relação I ( X , h 1)× I ( h 1, Y ) 1.75 2.00 2.25 2.50 2.75 3.00 3.25 3.50 I ( X , h 2) 0.0 0.5 1.0 1.5 2.0 2.5 3.0 I ( h 2, Y ) c) Relação I ( X , h 2)× I ( h 2, Y ) 2.0 2.5 3.0 3.5 4.0 I ( h 1, h 2) 0.0 0.5 1.0 1.5 2.0 2.5 3.0 I ( h 2, Y ) d) Relação I ( h 1, h 2)× I ( h 2, Y ) 0 1000 2000 3000 4000 Épocas Figura 27 – Evolução da informação mútua média do ator do agente no ambiente MountainCar ao longo de 100 inicializações distintas. mento I. Nota-se a presença de um distúrbio mais isolado na loss por volta da época 650. Essa observação é confirmada pela recompensa do agente, que atinge consistentemente a pontuação máxima (500), ilustrada na Figura 30b. Em contraste com o Experimento V, onde a topologia reduzida levou a distúrbios na recompensa, neste experimento a maior capacidade de flexibilidade proporcionada pelas camadas adicionais aparenta permitir ao agente aprender uma política mais robusta. No entanto, é interessante notar que o Experimento I, apesar de possuir menos camadas, não apresentou distúrbios tão evidentes na loss, sugerindo que o excesso de flexibilidade em um ambiente simples pode acabar tendo um efeito rebote ou introduzir uma complexidade desnecessária no processo de aprendizado. A Figura 31 ilustra parte do plano de informação para o agente com topologia de três camadas no ambiente CartPole. Para esta análise, foram selecionadas as relações de IM das camadas mais próximas da camada de saída, por serem as relações mais informativas e revelarem a dinâmica final de processamento da informação (as demais relações estão dispostas no Apêndice A). As Figuras 31a a 31d mostram que a evolução da informação mútua ocorreu de forma similar às relações ˆ I(X, h2)׈ I(h2,ˆ Y)eˆ I(h1, h2)׈ I(h2,ˆ Y) do Experimento I e ao comportamento observado no caso supervisionado. Isso reforça a ideia de que as camadas mais profundas de redes mais complexas tendem a exibir o padrão Capítulo 4. Resultados 65                                                 ±  Figura 28 – Loss e recompensa do agente no ambiente CartPole. Topologia alternativa de uma camada. do caso supervisionado de ajuste e compressão no plano de informação, mesmo em RL. A dinâmica observada sugere que a trajetória no plano de informação ficou mais bem comportada em comparação com os Experimentos 4.1 e 4.5. Isso pode ser interpretado como um indício de que esta topologia é adequada para o problema, pois o fluxo de informação através das camadas segue um padrão mais previsível e estável, alinhando-se com as fases de aprendizado esperadas. Nos demais casos, onde a trajetória no plano de informação se mostra mais errática ou não exibe as fases de forma clara, pode ser uma indicação de que a topologia escolhida terá problemas na convergência. Essa capacidade de visualizar e comparar a “regularidade” das trajetórias no plano de informação fortalece seu uso como uma ferramenta diagnóstica na comparação e seleção de topologias em RL. Isso reforça a ideia de que as camadas mais profundas de redes mais complexas tendem a exibir o padrão do caso supervisionado de ajuste e compressão no plano de informação, mesmo em RL. Capítulo 4. Resultados 66        I ( X , h 1)      I ( h 1, Y )  I ( X , h 1)× I ( h 1, Y )       Figura 29 – Evolução da informação mútua do ator do agente no ambiente CartPole. Topologia alternativa de uma camada. 4.7 Experimento VII A Figura 32 ilustra os componentes da loss de treinamento e a recompensa do agente no ambiente Acrobot, utilizando uma topologia de uma camada intermediária. Na Figura 32a é possível observar o padrão de decrescimento na loss para todas as componentes. De forma similar ao Experimento II, a loss aparenta convergir por volta de 300 épocas, mas, consistentemente com a natureza ruidosa do ambiente, mantém uma flutuação na loss. A Figura 32b mostra que o aprendizado ocorreu de forma eficaz, uma vez que o agente atinge de forma consistente uma alta recompensa (cerca de −100). A Figura 33 mostra o plano de informação. É possível observar uma certa similaridade com a relação ˆ I(X, h1)׈ I(h1,ˆ Y)do Experimento II, especialmente na dinâmica da primeira camada. A trajetória corresponde desde os instantes iniciais, passando por uma fase de aumento de ˆ I(h1,ˆ Y)até a formação de uma “nuvem de pontos”, onde ˆ I(h1,ˆ Y)mantém-se relativamente constante, enquanto ˆ I(X, h1)oscila. Isso sugere que, mesmo com uma topologia mais simples, o agente no Acrobot demonstra um comportamento no plano de informação que reflete a complexidade e o ruído intrínseco ao ambiente, similar ao que foi observado no Experimento II. 4.8 Experimento VIII A Figura 34 exibe os componentes da loss de treinamento e a recompensa para o agente no ambiente Acrobot com a topologia de três camadas intermediárias. Na Figura 34a, observa-se um padrão de decrescimento na loss para todas as componentes, de forma similar aos Experimentos II e VII. A loss aparenta convergir por volta de 300 épocas, mantendo um comportamento ruidoso que é característico do ambiente Acrobot. Capítulo 4. Resultados 67                                                 ±  Figura 30 – Loss e recompensa do agente no ambiente CartPole. Topologia alternativa de três camadas. Essa observação é confirmada pela recompensa do agente, que atinge consistentemente uma alta pontuação (aproximadamente −100), como mostra a Figura 34b. Acredita-se que a maior capacidade de flexibilidade proporcionada pelas camadas adicionais permite ao agente aprender uma política mais robusta. A Figura 35 ilustra parte do plano de informação para o agente com topologia de três camadas no ambiente Acrobot. Foram selecionadas as relações de informação mútua das camadas mais próximas da camada de saída, por serem as mais informativas (as demais estão dispostas no Apêndice A). As Figuras 35a a 35d mostram que a evolução da informação mútua ocorreu de forma ligeiramente similar às relações ˆ I(X, h2)׈ I(h2,ˆ Y)e ˆ I(h1, h2)׈ I(h2,ˆ Y)do Experimento II, que já exibiam algum ruído. No entanto, em um comportamento interessante, a Figura 35b apresenta uma trajetória que, em contraste com outras relações neste ambiente, demonstra um comportamento mais alinhado ao caso supervisionado, com fases mais discerníveis. De forma geral, as Figuras 35a, 35c e 35d apresentam uma trajetória alternativa que, além da fase de redução de erro empírico (maximização de ˆ I(h3,ˆ Y)enquanto se restringe ˆ I(·, h3)) e da fase de compressão da Capítulo 4. Resultados 68      I ( X , h 3)        I ( h 3, Y )   I ( X , h 3)× I ( h 3, Y )      I ( h 1, h 2)      I ( h 2, Y )   I ( h 1, h 2)× I ( h 2, Y )      I ( h 1, h 3)        I ( h 3, Y )   I ( h 1, h 3)× I ( h 3, Y )        I ( h 2, h 3)        I ( h 3, Y )   I ( h 2, h 3)× I ( h 3, Y )       Figura 31 – Evolução da informação mútua do ator do agente no ambiente CartPole. Topologia alternativa de três camadas. informação (minimização de ˆ I(·, h3)enquanto se restringe ˆ I(h3,ˆ Y)), revela a presença de uma terceira fase. Esta terceira fase indica uma dinâmica mais complexa de processamento da informação em redes mais profundas, possivelmente relacionada a um refino contínuo da representação ou a adaptações a pequenas flutuações, algo não tão evidente em topologias mais rasas ou em ambientes mais simples. 4.9 Discussão dos Resultados Nesta seção, serão discutidos os principais resultados e observações derivados da análise do treinamento de agentes de RL utilizando o plano de informação. Um dos resultados mais notáveis reside na observação de que a camada final da rede neural do agente, ao ser analisada no plano de informação, gera um perfil de evolução da IM consistentemente similar ao que é tipicamente observado em cenários de aprendizado supervisionado, conforme os Experimentos I a III, VI e VIII (Seções 4.1 a 4.3, 4.6 e 4.8). Este achado é relevante por sugerir uma espécie de “universalidade” na forma como a camada de saída processa e comprime a informação para geração de ação. Em contraste com a camada final, as camadas mais iniciais das redes treinadas desempenharam papéis distintos na dinâmica da informação. Enquanto em alguns Capítulo 4. Resultados 69                                              ±  Figura 32 – Loss e recompensa do agente no ambiente Acrobot. Topologia alternativa de uma camada. casos observa-se uma compressão nítida da informação da entrada (Experimento IV), nos demais, há uma aparente necessidade de reter ou até restaurar a informação da entrada até um certo patamar, antes que as camadas subsequentes realizem uma compressão mais seletiva . Essa variabilidade reforça a ideia de que o processo de aprendizado de representações em RL depende do ambiente, não seguindo um padrão rígido de compressão desde as camadas iniciais. A forma como a rede equilibra a retenção de detalhes brutos da entrada com a extração de características de alto nível ainda carece de uma compreensão mais aprofundada. Outro resultado notável consiste na relação entre a IM e o processo de aprendizado do agente. Os Experimentos I a, III, sugerem que, embora a relação entre a IM entre as camadas intermediárias (ˆ I(h1, h2)) e a informação sobre a saída da rede (ˆ I(h2,ˆ Y)) possa emergir como um indicativo do aprendizado do agente, mesmo que essa relação não se mostra garantida de ocorrer de forma idêntica em todos os cenários (Experimento IV). Um comportamento similar é observado com as últimas camadas da rede nos Experimentos VI e VIII. Isso diferencia a trajetória da IM no plano de informação da minimização Capítulo 4. Resultados 70     I ( X , h 1)       I ( h 1, Y )  I ( X , h 1)× I ( h 1, Y )       Figura 33 – Evolução da informação mútua do agente no ambiente Acrobot. Topologia alternativa de uma camada. da loss e da maximização da recompensa. Dessa forma, as trajetórias de IM entre as últimas camadas da rede e sua saída podem atuar como uma condição necessária, mas não suficiente, do aprendizado do agente. Ainda assim, a capacidade de utilizar uma estimativa ˆ Ypara investigar a evolução do aprendizado se mostra como uma alternativa valiosa, já que não existe um “rótulo” Yexplícito como no aprendizado supervisionado. Ao analisar a IM entre as representações internas do agente (hi) e a saída da rede (ˆ Y), é possível identificar como a rede está processando a informação relevante para a tomada de ação. Isso auxilia na compreensão de como a rede estabelece e refina suas representações ao longo do treinamento, oferecendo uma visão mais profunda do que a simples observação da recompensa. Também foi possível observar que a rede do ator do agente PPO tende a ocupar regiões específicas no plano de informação à medida que adquire certos comportamentos. Essa característica sugere a possibilidade de que existam “regiões ótimas” ou “trajetórias desejáveis” no plano de informação que caracterizem o comportamento ideal do agente em um dado ambiente. A análise do deslocamento do agente nesse plano poderia servir como um diagnóstico para a eficiência do aprendizado, indicando se a rede está convergindo para representações informativas e eficientes. A identificação dessas regiões poderia, futuramente, guiar algoritmos de aprendizado para que explicitamente incentivem a ocupação dessas áreas no plano de informação. A investigação da IM entre as camadas intermediárias de uma rede neural em agentes de RL pode revelar como a informação flui e é transformada hierarquicamente, e como essa hierarquia de representações contribui para o aprendizado final. Ao monitorar a variância das métricas de IM ao longo do tempo, observou-se que ela parece diminuir com o avanço do treinamento, o que sugere um comportamento de estabilização e, portanto, um possível identificados informacional sobre a convergência do aprendizado. Capítulo 4. Resultados 71                                              ±  Figura 34 – Loss e recompensa do agente no ambiente Acrobot. Topologia alternativa de três camadas. Capítulo 4. Resultados 72         I ( X , h 3)       I ( h 3, Y )   I ( X , h 3)× I ( h 3, Y )        I ( h 1, h 2)      I ( h 2, Y )   I ( h 1, h 2)× I ( h 2, Y )      I ( h 1, h 3)       I ( h 3, Y )   I ( h 1, h 3)× I ( h 3, Y )      I ( h 2, h 3)       I ( h 3, Y )   I ( h 2, h 3)× I ( h 3, Y )       Figura 35 – Evolução da informação mútua do ator do agente no ambiente Acrobot. Topologia alternativa de três camadas. 73 5 Conclusão Esta seção visa apresentar os principais achados e conclusões resultantes dos experimentos conduzidos, bem como delinear as perspectivas para futuros trabalhos. As observações apresentadas aqui buscam aprofundar a compreensão sobre a dinâmica de aprendizado de agentes de RL, com foco especial na aplicação e análise do plano de informação. A análise através do plano de informação permitiu identificar fases distintas no aprendizado em algumas camadas da rede do agente PPO. Os resultados indicam a ocorrência de estágios de ajuste e, em certa medida, de compressão da informação, processo análogo ao que é observado no aprendizado supervisionado. Contudo, a generalização dessas fases para todas as arquiteturas de rede, ambientes ou algoritmos de RL ainda requer investigação aprofundada, uma vez que as dinâmicas podem variar significativamente dependendo da complexidade do ambiente e da estrutura da rede. Isso sugere que, embora o fenômeno possa ser observado, sua possível “universalidade” em RL precisa ser mais explorada. Além disso, a utilização do plano de informação demonstrou ser uma ferramenta interessante em RL, uma vez que o plano de informação oferece uma métrica granular que transcende a recompensa acumulada, permitindo uma compreensão mais profunda de como a rede constrói e refina suas representações internas. Também foi possível observar que o plano de informação pode auxiliar na identificação de padrões de convergência de treinamento. Ao analisar as trajetórias das representações no plano de informação, é possível observar se a rede está tendendo para uma determinada região, indicando uma potencial convergência do aprendizado. A estabilização das métricas de IM no plano de informação ao longo do treinamento pode ser um indicativo de que a rede atingiu um estado de equilíbrio em suas representações. No entanto, é fundamental correlacionar essa estabilização no plano de informação com o desempenho do agente e a minimização da loss no ambiente para confirmar se essa convergência informacional se traduz em uma política de alto desempenho. 5.1 Perspectivas para Trabalhos Futuros Com base nos resultados e nas discussões apresentadas, diversas direções de pesquisa futuras podem ser exploradas para aprofundar a compreensão e a aplicação da teoria da informação em RL: •Realizar uma análise detalhada da evolução da IM entre as camadas e a saída da rede ˆ Yem tarefas de aprendizado supervisionado bem estabelecidas (exemplo MNIST, 80 Apêndices 81 APÊNDICE A – Demais resultados Esta seção apresenta os gráficos da evolução dos pesos e gradientes das redes do ator e do crítico para os diferentes experimentos e topologias, complementando a discussão apresentada no Capítulo 4. APÊNDICE A. Demais resultados 82                                               (a) Evolução dos pesos e gradientes da rede do ator.                                            (b) Evolução dos pesos e gradientes da rede do crítico. Figura 36 – Evolução dos pesos e gradientes das redes do agente no ambiente CartPole. APÊNDICE A. Demais resultados 83                                              (a) Evolução dos pesos e gradientes da rede do ator.                                           (b) Evolução dos pesos e gradientes da rede do crítico. Figura 37 – Evolução dos pesos e gradientes das redes do agente no ambiente Acrobot. APÊNDICE A. Demais resultados 84                                             (a) Evolução dos pesos e gradientes da rede do ator.                                             (b) Evolução dos pesos e gradientes da rede do crítico. Figura 38 – Evolução dos pesos e gradientes das redes do agente no ambiente Pendulum. APÊNDICE A. Demais resultados 85                                               (a) Evolução dos pesos e gradientes da rede do ator.                                              (b) Evolução dos pesos e gradientes da rede do crítico. Figura 39 – Evolução dos pesos e gradientes das redes do agente no ambiente Mountain Car. APÊNDICE A. Demais resultados 86                                          (a) Evolução dos pesos e gradientes da rede do ator.                                           (b) Evolução dos pesos e gradientes da rede do crítico. Figura 40 – Evolução dos pesos e gradientes das redes do agente no ambiente CartPole. Topologia alternativa de uma camada. APÊNDICE A. Demais resultados 87                                                  (a) Evolução dos pesos e gradientes da rede do ator.                                                    (b) Evolução dos pesos e gradientes da rede do crítico. Figura 41 – Evolução dos pesos e gradientes das redes do agente no ambiente CartPole. Topologia alternativa de três camadas. APÊNDICE A. Demais resultados 88        I ( X , h 1)        I ( h 1, Y )  I ( X , h 1)× I ( h 1, Y ) (a) Relação I(X, h1)×I(h1,ˆ Y)          I ( X , h 2)      I ( h 2, Y )  I ( X , h 2)× I ( h 2, Y ) (b) Relação I(X, h2)×I(h2,ˆ Y)        I ( X , h 1)      I ( h 1, h 3)  I ( X , h 1)× I ( h 1, h 3) (c) Relação I(X, h1)×I(h1, h3)          I ( X , h 2)        I ( h 2, h 3)  I ( X , h 2)× I ( h 2, h 3) (d) Relação I(X, h2)×I(h2, h3)        I ( X , h 1)      I ( h 1, h 2)  I ( X , h 1)× I ( h 1, h 2) (e) Relação I(X, h1)×I(h2, h2)      I ( h 1, h 2)        I ( h 2, h 3)  I ( h 1, h 2)× I ( h 2, h 3) (f) Relação I(h1, h2)×I(h2, h3)        Figura 42 – Evolução da informação mútua do ator do agente no ambiente CartPole. Topologia alternativa de três camadas. APÊNDICE A. Demais resultados 89                                          (a) Evolução dos pesos e gradientes da rede do ator.                                            (b) Evolução dos pesos e gradientes da rede do crítico. Figura 43 – Evolução dos pesos e gradientes das redes do agente no ambiente Acrobot. Topologia alternativa de uma camada.