Descoberta de Options Multi-tarefas: Um estudo em StarCraft II

Gomes, Eric Muszalska Claro

doi:10.11606/D.100.2023.tde-01062023-160931

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Dissertação de Mestrado

DOI

https://doi.org/10.11606/D.100.2023.tde-01062023-160931

Documento

Dissertação de Mestrado

Autor

Gomes, Eric Muszalska Claro (Catálogo USP)

Nome completo

Eric Muszalska Claro Gomes

E-mail

Unidade da USP

Escola de Artes, Ciências e Humanidades

Área do Conhecimento

Metodologia e Técnicas da Computação

Data de Defesa

2023-04-04

Imprenta

São Paulo, 2023

Orientador

Silva, Valdinei Freire da (Catálogo USP)

Banca examinadora

Silva, Valdinei Freire da (Presidente)
Bianchi, Reinaldo Augusto da Costa
Mauá, Denis Deratani

Título em português

Descoberta de Options Multi-tarefas: Um estudo em StarCraft II

Palavras-chave em português

Framework de Options
Option Discovery
Aprendizado por Imitação
Aprendizado por Reforço
Starcraft II

Resumo em português

Este trabalho propõe e valida uma arquitetura para resolver problemas complexos em jogos de estratégia em tempo real, como o Starcraft II, utilizando o conceito hierárquico temporal de option. A arquitetura é baseada em uma abordagem de descoberta de options (option discovery) utilizando aprendizado por imitação para abstrair meta-políticas e políticas intra-options comuns a vários agentes. A validação foi realizada tanto em minigames, quanto em cenários criados especificamente para este estudo, que visam analisar o componente temporal do problema. Os resultados mostraram que a arquitetura proposta foi capaz de obter resultados próximos aos obtidos pelo agente padrão Reaver em alguns dos minigames, além de ser capaz de aprender uma única política genérica que se aplicaria a todos os minigames. Além disso, foi possível observar o comportamento das options para cada minigame no agente genérico, o que permitiu uma melhor compreensão da arquitetura proposta. Foi possível observar que a arquitetura Multi-Level Discovery of Deep Options (MLDDO) apresentou resultados significativos para a descoberta de options utilizando aprendizado por imitação. Esse trabalho também analisou o impacto da separabilidade de estados no MLDDO, comparando resultados do aprendizado com uma implementação específica para cada diferente cenário separável pelo espaço e com o aprendizado de uma única implementação generalista que busca aprender diferentes objetivos em cenários indistinguíveis pelo estado.

Título em inglês

Multi-task Option Discovery: A study in StarCraft II

Palavras-chave em inglês

Imitation Learning
Option Discovery
Option Framework
Reinforcement Learning
Starcraft II

Resumo em inglês

This work proposes and validates an architecture for solving complex problems in real time strategy games, such as Starcraft II, using the hierarchical temporal concept of options. The architecture is based on an approach of option discovery using imitation learning to abstract meta-policies and intra-options policies common to various agents. The validation was performed both on minigames, and on scenarios created specifically for this study, which aim to analyze the temporal component of the problem. The results showed that the proposed architecture was able to obtain results similar to those obtained by the standard Reaver agent in some of the minigames, and was also able to learn a single generic policy that would apply to all minigames. In addition, it was possible to observe the behavior of the options for each minigame in the generic agent, which allowed for a better understanding of the proposed architecture. It was observed that the MLDDO architecture presented significant results for the discovery of options using imitation learning. This work also analyzed the impact of state separability in the Multi-Level Discovery of Deep Options (MLDDO), comparing learning results with a specific implementation for each different scenario separable by space and with learning of a single generalist implementation that seeks to learn different goals in indistinguishable scenarios by state.

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

Dissertacao_Corrigida___Eric_Muszalska.pdf (3.27 Mbytes)

Data de Publicação

2024-07-24

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.