Dissertação de Mestrado

Documento
Dissertação de Mestrado
Nome completo
Guilherme Lamartine de Mello
E-mail
Unidade da USP
Instituto de Matemática, Estatística e Ciência da Computação (IME)
Área de Concentração
Data de Defesa
2026-04-02
Imprenta
São Paulo, 2026
Orientador
Banca examinadora
Finger, Marcelo (Presidente)
Cavalin, Paulo Rodrigo
Pardo, Thiago Alexandre Salgueiro
Título em português
Impacto de morfemas na segmentação de grandes modelos de linguagem para o português brasileiro
Palavras-chave em português
Português brasileiro; Processamento de linguagem natural; Segmentação; Transformers
Resumo em português
Modelos de segmentação em nível de sub-palavras como Byte Pair Encoding (Sennrich et al., 2016), Unigram (Kudo, 2018) e WordPiece (Schuster e Nakajima, 2012), permitem o tratamento de problemas de vocabulário aberto utilizando um conjunto relativamente pequeno de tokens. Embora esses algoritmos sejam fáceis de utilizar e escalar, por serem abordagens baseadas exclusivamente em dados, acabam deixando de lado características linguísticas ou morfológicas durante a construção do vocabulário e no processo de segmentação de textos. Bostrom e Durrett, 2020 e Hofmann et al., 2021 mostram que a presença de morfemas impacta positivamente a performance de grandes modelos de linguagem para o inglês. Desta forma, este trabalho explora a hipótese de que um maior alinhamento do processo de segmentação como uma sequência de morfemas pode melhorar a capacidade de generalização de LLMs para o Português. Para isso, é proposto um método de avaliação, chamado MorphEval-PT, utilizado para medir a capacidade dos segmentadores em produzir segmentos morfologicamente coerentes, que busca incorporar conceitos psicolinguísticos de processamento morfológico. Diferentes algoritmos de segmentação são utilizados para o pré-treinamento de novos modelos de linguagem a fim de relacionar os resultados obtidos no MorphEval-PT com a performance em tarefas subsequentes. De forma consistente, o BPE mostrou uma melhor precisão que o Unigram na capacidade de representar morfemas, além de melhores resultados nas tarefas de avaliação conjunta. Esses resultados apresentam fortes evidências de que a capacidade de gerar segmentos morfologicamente coerentes é uma característica importante a ser considerada durante o desenvolvimento de LLMs para o Português Brasileiro.
Título em inglês
Impact of morphemes on tokenizers of large language models for brazilian portuguese
Palavras-chave em inglês
Brazilian portuguese; Natural language processing; Tokenizer; Transformers
Resumo em inglês
Sub-word level tokenizers, such as Byte Pair Encoding (Sennrich et al., 2016), Unigram (Kudo, 2018) and WordPiece (Schuster and Nakajima, 2012), allow for the handling of open vocabulary problems using a relative small set of tokens. Although they are easy to use and scale, they rely on a data-driven approach and do not use any linguistic or morphologic feature when building its vocabulary or during text tokenization. As Bostrom and Durrett, 2020 and Hofmann et al., 2021 demonstrate that morphemes improves large language models performance on english texts, in this work, we explore the hypothesis that a tokenization with a better morpheme alignment can improve LLM performance on Brazilian Portuguese. For that, MorphEval-PT, a new evaluation procedure based on the psycholinguistic concept of morphological model of word processing, is proposed to measure how morphological coherent is a sequence of tokens. Different tokenization algorithms are used to pre-train new language models in order to relate the results obtained by MorphEval-PT with downstream tasks performance. Consistently, BPE demonstrated better precision than Unigram in its ability to represent morphemes, as well as better results on downstream tasks. These results show strong evidences that the ability to generate a morphological coherent sequence of tokens is an important feature to be considered when developing LLMs for Brazilian Portuguese.

AVISO — A consulta e o download deste documento ficam condicionados à aceitação das seguintes condições de uso: o trabalho destina-se exclusivamente a atividades privadas de estudo, ensino e pesquisa, bem como à crítica, análise e citação científica. É proibida sua comercialização, reprodução integral, distribuição ou exploração econômica sem autorização prévia, expressa e por escrito da pessoa autora. Na utilização ou citação de qualquer parte do documento, é obrigatória a indicação da autoria e da fonte da publicação original. Consulte a Política de acesso.

Data de Publicação
2026-07-10

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.

Serviços

Carregando...