Tese de Doutorado

Documento
Tese de Doutorado
Nome completo
Igor Cataneo Silveira
E-mail
Unidade da USP
Instituto de Matemática, Estatística e Ciência da Computação (IME)
Área de Concentração
Data de Defesa
2026-04-28
Imprenta
São Paulo, 2026
Orientador
Banca examinadora
Mauá, Denis Deratani (Presidente)
Amorim, Evelin Carvalho Freire de
Carvalho, Aline Marins Paes
Cozman, Fabio Gagliardi
Feltrim, Valéria Delisandra
Título em inglês
Automatic evaluation of ENEM-like essays: an analysis of benchmarks, gaming susceptibility, transferability and feedback
Palavras-chave em inglês
Adversarial attacks; Automated feedback; Automatic essay scoring; ENEM; Knowledge transfer
Resumo em inglês
Through essay writing, students demonstrate relevant cognitive competencies such as argumentation, organization of ideas, and language proficiency. Achieving satisfactory performance in this task requires continuous practice. However, the regularity of such practice is constrained by the time limitations faced by teachers, who often lack the conditions to conduct frequent and qualitatively consistent assessments. In this context, computational approaches emerge as promising alternatives to support the evaluation process. This work investigates the development of automated essay scoring systems aligned with the guidelines of the Brazilian high school examination called ENEM. To this end, the performances of fourteen distinct machine learning models --- two based on handcrafted features and twelve belonging to different families within the Transformer architecture --- were evaluated applied to ENEM-like essays written for online mock exams. The results indicate that the best-performing model varies according to the competency being assessed. It was also observed that, in general, the systems remain approximately 0.2 Quadratic Weighted Kappa points below the estimated upper bound. As the performance of models continues to improve over time, their integration into educational environments becomes increasingly viable. In such scenario, a new problem emerges: students may attempt to exploit these systems in order to obtain a good grade without properly writing the assignment. In response to this concern, the susceptibility of the models to deliberate manipulation attempts by users was also investigated, revealing that such systems can be deceived with relative ease under certain conditions. Additionally, as labeling essays is a very-time consuming task, datasets for this task are usually small. In this work, we also address the recurrent problem of limited data for training models. In order to do so, we employed transfer learning from ENEM-like essays to similar domains. The first consists of official ENEM essays, which has fewer available examples than the mock essays domain. The second comprises narrative essays evaluated according to comparable criteria. Our approach investigated the feasibility of using mock exam essays as a pretraining stage for models intended to score the essays from the other domains. In both cases, performance gains were observed with the incorporation of ENEM-like mock exam data, highlighting the potential of this knowledge transfer strategy as a means of mitigating the scarcity of annotated data. Finally, it is beneficial for students to receive not only a numerical score but also informative feedback that enables them to understand the basis of their evaluation and identify opportunities for improvement. As our last investigation, we explore the possibility of expanding system capabilities beyond scoring by incorporating feedback mechanisms. In this study, feedback is defined as the explicit articulation of the criteria underlying the assigned score. The proposed approaches demonstrate promising results; however, they present relevant limitations, such as dependence on proprietary language models or on datasets that are difficult to construct.
Título em português
Avaliação automática de redações no padrão ENEM: uma análise de benchmarks, suscetibilidade à manipulação, transferibilidade e feedback
Palavras-chave em português
Ataques adversariais; Correção automática de redação; ENEM; Feedback automático; Transferência de conhecimento
Resumo em português
Por meio da escrita de redações, estudantes evidenciam competências cognitivas relevantes, tais como argumentação, organização de ideias e proficiência linguística. O desempenho satisfatório nessa tarefa requer prática contínua. Contudo, a regularidade dessa prática encontra limitações nas restrições de tempo enfrentadas por docentes, que frequentemente não dispõem de condições para realizar avaliações frequentes e qualitativamente consistentes. Nesse contexto, abordagens computacionais emergem como alternativas promissoras para apoiar o processo avaliativo. O presente trabalho investiga o desenvolvimento de sistemas de correção automática de redações alinhados às diretrizes do Exame Nacional do Ensino Médio (ENEM). Para tanto, avaliou-se o desempenho de quatorze modelos distintos de aprendizado de máquina --- dois baseados em features curadas e doze pertencentes a diferentes famílias da arquitetura Transformer --- aplicados a redações no formato ENEM, produzidas para simulados disponibilizados online. Os resultados indicam que o modelo de melhor desempenho varia de acordo com a competência avaliada. Observou-se, ademais, que, em geral, os sistemas permanecem aproximadamente 0,2 pontos de Kappa Quadrático abaixo do limite superior estimado. Conforme a performance dos modelos continua a melhorar ao longo do tempo, a adoção deles em ambientes educacionais se torna cada vez mais viável. Nesse cenário, surge um novo problema: os estudantes podem tentar enganar os sistemas para receber notas boas sem escrever de maneira adequada. Em resposta à essa preocupação, investigou-se também a suscetibilidade dos modelos a tentativas deliberadas de manipulação por parte dos usuários, constatando-se que tais sistemas podem ser enganados com relativa facilidade sob certas condições. Adicionalmente, como rotular redações é uma tarefa que exige bastante tempo, datasets para essa tarefa costumam ser pequenos. Neste trabalho, nós também abordamos o problema recorrente da falta de dados para treinar modelos. Para tal, nós utilizamos transferência de conhecimento das redações semelhantes ao ENEM para dois domínios similares. O primeiro consiste de redações oficiais do ENEM, com menos exemplos disponíveis que o de simulados. O segundo é feito de redações narrativas avaliadas segundo critérios comparáveis ao do ENEM. Nossa abordagem examinou a viabilidade de utilizar redações de simulados como etapa de pré-treinamento para modelos destinados à correção de redações oficiais ou de textos pertencentes ao gênero narrativo. Em ambos os cenários, verificou-se ganho de desempenho com a incorporação dos dados de simulado, o que aponta para o potencial dessa estratégia de transferência de conhecimento como forma de mitigar a recorrente escassez de dados anotados. Por fim, é vantajoso para os estudantes receberem não apenas uma pontuação numérica, mas também um retorno informativo que lhes permita compreender a sua avaliação e identificar pontos para melhoria. Como nossa última investigação, nós exploramos a possibilidades de ampliar a capacidade dos sistemas para além da atribuição de notas, incorporando mecanismos de feedback. Neste estudo, feedback é definido como a explicitação dos critérios que fundamentam a nota atribuída. As abordagens propostas demonstram resultados promissores; contudo, apresentam limitações relevantes, como a dependência de Modelos de Linguagem proprietários ou de bases de dados de difícil obtenção.

AVISO — A consulta e o download deste documento ficam condicionados à aceitação das seguintes condições de uso: o trabalho destina-se exclusivamente a atividades privadas de estudo, ensino e pesquisa, bem como à crítica, análise e citação científica. É proibida sua comercialização, reprodução integral, distribuição ou exploração econômica sem autorização prévia, expressa e por escrito da pessoa autora. Na utilização ou citação de qualquer parte do documento, é obrigatória a indicação da autoria e da fonte da publicação original. Consulte a Política de acesso.

Data de Publicação
2026-07-07

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.

Serviços

Carregando...