Dissertação de Mestrado

Documento
Dissertação de Mestrado
Nome completo
Pietro Guarinello Cariola
E-mail
Unidade da USP
Instituto de Matemática, Estatística e Ciência da Computação (IME)
Área de Concentração
Data de Defesa
2026-03-16
Imprenta
São Paulo, 2026
Orientador
Banca examinadora
Hirata Junior, Roberto (Presidente)
Lotufo, Roberto de Alencar
Pardo, Thiago Alexandre Salgueiro
Título em inglês
A quantitative analysis of representation strategies in vision language models
Palavras-chave em inglês
Computer vision; Explainability; Vision language models
Resumo em inglês
This study investigates the behavior of projection modules in multimodal vision-language models through a quantitative analysis of pre- and post-projection representations under zero-shot conditions. Focusing on two prominent architecturesLLaVA and InstructBLIPand evaluating them across two distinct domain-specific datasets in agriculture and dermatology, the research explores how visual embeddings are transformed by the projector before being processed by the language model. To assess the richness of these representations, auxiliary classifiers of two typesa multilayer perceptron (MLP) and a transformer-based modelare trained to perform classification tasks directly on the pre- and post-projection embeddings. All experiments are conducted in a zero-shot scenario, ensuring that the models have never been fine-tuned on the target datasets. The results reveal that the projector does not necessarily degrade the semantic content of the embeddings, but may reorganize their structure in a way that aligns more effectively with determined architecture. Furthermore, the experiments show that the type of auxiliary classifier plays a significant role in how the effects of projection are perceived, suggesting that architectural factors must be considered when designing and evaluating multimodal systems. This work contributes to the growing field of explainability in deep learning by offering empirical insights into the role of the projector module and more familiarity on models' inner representations.
Título em português
Uma análise quantitativa de estratégias de representação em modelos de visão e linguagem
Palavras-chave em português
Interpretabilidade; Modelos de linguagem multimodal; Visão computacional
Resumo em português
Este estudo investiga o comportamento dos módulos de projeção em modelos multimodais de visão e linguagem por meio de uma análise quantitativa das representações pré e pós-projeção em cenários sem treinamento específico. Com foco em dois modelos proeminentes, LLaVA e InstructBLIP, e avaliando-os em dois conjuntos de dados de domínio específicos, nas áreas de agricultura e dermatologia, a pesquisa explora como as representações visuais são transformadas pelo projetor antes de serem processadas pelo modelo de linguagem. Para avaliar a riqueza dessas representações, classificadores auxiliares de dois tipos, um perceptron multicamada (MLP) e um modelo baseado em transformer, são treinados para realizar tarefas de classificação diretamente sobre as representações antes e depois da projeção. Todos os experimentos são conduzidos em um cenário sem treinamento específico, garantindo que os modelos nunca tenham sido treinados com os conjuntos de dados utilizados nos testes. Os resultados revelam que o projetor não necessariamente degrada o conteúdo semântico das representações, mas pode reorganizar sua estrutura de maneira a se alinhar mais efetivamente com uma determinada arquitetura. Além disso, os experimentos mostram que o tipo de classificador auxiliar desempenha um papel significativo na forma como os efeitos da projeção são percebidos, sugerindo que fatores arquiteturais devem ser considerados no momento de projetar e avaliar sistemas multimodais. Este trabalho contribui para o campo crescente da interpretabilidade em aprendizado profundo, oferecendo evidências empíricas sobre o papel do módulo projetor além de mais familiaridade com as representações internas dos modelos.

AVISO — A consulta e o download deste documento ficam condicionados à aceitação das seguintes condições de uso: o trabalho destina-se exclusivamente a atividades privadas de estudo, ensino e pesquisa, bem como à crítica, análise e citação científica. É proibida sua comercialização, reprodução integral, distribuição ou exploração econômica sem autorização prévia, expressa e por escrito da pessoa autora. Na utilização ou citação de qualquer parte do documento, é obrigatória a indicação da autoria e da fonte da publicação original. Consulte a Política de acesso.

Data de Publicação
2026-04-08

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.

Serviços

Carregando...