Fatoração de matrizes no problema de coagrupamento com sobreposição de colunas

Brunialti, Lucas Fernandes

doi:10.11606/D.100.2016.tde-31102016-123504

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Dissertação de Mestrado

DOI

https://doi.org/10.11606/D.100.2016.tde-31102016-123504

Documento

Dissertação de Mestrado

Autor

Brunialti, Lucas Fernandes (Catálogo USP)

Nome completo

Lucas Fernandes Brunialti

E-mail

Unidade da USP

Escola de Artes, Ciências e Humanidades

Área do Conhecimento

Metodologia e Técnicas da Computação

Data de Defesa

2016-08-31

Imprenta

São Paulo, 2016

Orientador

Peres, Sarajane Marques (Catálogo USP)

Banca examinadora

Peres, Sarajane Marques (Presidente)
França, Fabrício Olivetti de
Paraboni, Ivandre
Rezende, Solange Oliveira

Título em português

Fatoração de matrizes no problema de coagrupamento com sobreposição de colunas

Palavras-chave em português

Análise de agrupamento
Coagrupamento
Fatoração de matrizes não-negativas
Mineração de texto

Resumo em português

Coagrupamento é uma estratégia para análise de dados capaz de encontrar grupos de dados, então denominados cogrupos, que são formados considerando subconjuntos diferentes das características descritivas dos dados. Contextos de aplicação caracterizados por apresentar subjetividade, como mineração de texto, são candidatos a serem submetidos à estratégia de coagrupamento; a flexibilidade em associar textos de acordo com características parciais representa um tratamento adequado a tal subjetividade. Um método para implementação de coagrupamento capaz de lidar com esse tipo de dados é a fatoração de matrizes. Nesta dissertação de mestrado são propostas duas estratégias para coagrupamento baseadas em fatoração de matrizes não-negativas, capazes de encontrar cogrupos organizados com sobreposição de colunas em uma matriz de valores reais positivos. As estratégias são apresentadas em termos de suas definições formais e seus algoritmos para implementação. Resultados experimentais quantitativos e qualitativos são fornecidos a partir de problemas baseados em conjuntos de dados sintéticos e em conjuntos de dados reais, sendo esses últimos contextualizados na área de mineração de texto. Os resultados são analisados em termos de quantização do espaço e capacidade de reconstrução, capacidade de agrupamento utilizando as métricas índice de Rand e informação mútua normalizada e geração de informação (interpretabilidade dos modelos). Os resultados confirmam a hipótese de que as estratégias propostas são capazes de descobrir cogrupos com sobreposição de forma natural, e que tal organização de cogrupos fornece informação detalhada, e portanto de valor diferenciado, para as áreas de análise de agrupamento e mineração de texto

Título em inglês

Matrix factorization for overlapping columns coclustering

Palavras-chave em inglês

Cluster analysis
Coclustering
Non-negative matrix factorization
Text mining

Resumo em inglês

Coclustering is a data analysis strategy which is able to discover data clusters, known as coclusters. This technique allows data to be clustered based on different subsets defined by data descriptive features. Application contexts characterized by subjectivity, such as text mining, are candidates for applying coclustering strategy due to the flexibility to associate documents according to partial features. The coclustering method can be implemented by means of matrix factorization, which is suitable to handle this type of data. In this thesis two strategies are proposed in non-negative matrix factorization for coclustering. These strategies are able to find column overlapping coclusters in a given dataset of positive data and are presented in terms of their formal definitions as well as their algorithms' implementation. Quantitative and qualitative experimental results are presented through applying synthetic datasets and real datasets contextualized in text mining. This is accomplished by analyzing them in terms of space quantization, clustering capabilities and generated information (interpretability of models). The well known external metrics Rand index and normalized mutual information are used to achieve the analysis of clustering capabilities. Results confirm the hypothesis that the proposed strategies are able to discover overlapping coclusters naturally. Moreover, these coclusters produced by the new algorithms provide detailed information and are thus valuable for future research in cluster analysis and text mining

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

LucasBrunialtiVersaoCorrigidaPPgSI.pdf (3.22 Mbytes)

Data de Publicação

2016-11-28

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.