Dissertação de Mestrado
Documento
Dissertação de Mestrado
Autor
Nome completo
Diego Andrés Méndez
E-mail
Unidade da USP
Instituto de Matemática, Estatística e Ciência da Computação (IME)
Área de Concentração
Data de Defesa
2024-11-08
Imprenta
São Paulo, 2024
Orientador
Finger, Marcelo
(
)
Banca examinadora
Finger, Marcelo (Presidente)
Carvalho, André Carlos Ponce de Leon Ferreira de
Jorge, Alípio Mário Guedes
Título em inglês
A lightweight language filtering model for Brazilian portuguese trained by using active learning
Palavras-chave em inglês
Active learning; Brazilian portuguese; Language filtering; Language identification
Resumo em inglês
Language filtering is the task of segregating a main language from other languages in a text. In this work, we propose and test a lightweight and effective sentence-level language filtering framework. The framework utilizes a language identification model based on only three parameters and character n-gram features. The proposed framework does require any previously labeled datasets nor external language models. Instead, active learning is used to query a small number of the most informative data points from an unlabeled dataset, which are manually labeled to train the language identification model.
Título em português
Um modelo leve de filtragem da língua portuguesa do Brasil treinado utilizando aprendizado ativo
Palavras-chave em português
Aprendizado ativo; Filtragem de línguas; Identificação de línguas; Português do Brasil
Resumo em português
Filtragem de línguas é a tarefa de segregar uma língua principal de outras línguas em um texto. Neste trabalho, propomos e testamos uma metodologia de filtragem de línguas leve e eficaz. A metodologia utiliza um modelo de identificação de línguas baseado apenas em três parâmetros e variáveis construídas com n-gramas de caracteres. A metodologia proposta não requer bases de dados anotadas previamente nem modelos de linguagem externos. Em vez disso, é utilizado aprendizado ativo para selecionar uma pequena quantidade dos elementos mais informativos de uma base de dados não anotada, que são anotados manualmente para treinar o modelo de identificação de línguas.
AVISO — A consulta e o download deste documento ficam condicionados à aceitação das seguintes condições de uso: o trabalho destina-se exclusivamente a atividades privadas de estudo, ensino e pesquisa, bem como à crítica, análise e citação científica. É proibida sua comercialização, reprodução integral, distribuição ou exploração econômica sem autorização prévia, expressa e por escrito da pessoa autora. Na utilização ou citação de qualquer parte do documento, é obrigatória a indicação da autoria e da fonte da publicação original. Consulte a Política de acesso.
Data de Publicação
2025-04-16
Trabalhos decorrentes
AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.