Classificação automática de texto por meio de similaridade de palavras: um algoritmo mais eficiente.

Catae, Fabricio Shigueru

doi:10.11606/D.3.2013.tde-06072014-225124

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Dissertação de Mestrado

DOI

https://doi.org/10.11606/D.3.2013.tde-06072014-225124

Documento

Dissertação de Mestrado

Autor

Catae, Fabricio Shigueru (Catálogo USP)

Nome completo

Fabricio Shigueru Catae

E-mail

Unidade da USP

Escola Politécnica

Área do Conhecimento

Sistemas Digitais

Data de Defesa

2013-01-08

Imprenta

São Paulo, 2013

Orientador

Rocha, Ricardo Luis de Azevedo da (Catálogo USP)

Banca examinadora

Rocha, Ricardo Luis de Azevedo da (Presidente)
Kinoshita, Jorge
Silva, Flávio Soares Corrêa da

Título em português

Classificação automática de texto por meio de similaridade de palavras: um algoritmo mais eficiente.

Palavras-chave em português

Algoritmos
Classificação automática de texto
Reconhecimento de padrões

Resumo em português

A análise da semântica latente é uma técnica de processamento de linguagem natural, que busca simplificar a tarefa de encontrar palavras e sentenças por similaridade. Através da representação de texto em um espaço multidimensional, selecionam-se os valores mais significativos para sua reconstrução em uma dimensão reduzida. Essa simplificação lhe confere a capacidade de generalizar modelos, movendo as palavras e os textos para uma representação semântica. Dessa forma, essa técnica identifica um conjunto de significados ou conceitos ocultos sem a necessidade do conhecimento prévio da gramática. O objetivo desse trabalho foi determinar a dimensionalidade ideal do espaço semântico em uma tarefa de classificação de texto. A solução proposta corresponde a um algoritmo semi-supervisionado que, a partir de exemplos conhecidos, aplica o método de classificação pelo vizinho mais próximo e determina uma curva estimada da taxa de acerto. Como esse processamento é demorado, os vetores são projetados em um espaço no qual o cálculo se torna incremental. Devido à isometria dos espaços, a similaridade entre documentos se mantém equivalente. Esta proposta permite determinar a dimensão ideal do espaço semântico com pouco esforço além do tempo requerido pela análise da semântica latente tradicional. Os resultados mostraram ganhos significativos em adotar o número correto de dimensões.

Título em inglês

Automatic text classification using word similarities: a more efficient algorithm.

Palavras-chave em inglês

Algorithms
Automatic text classification
Pattern recognition

Resumo em inglês

The latent semantic analysis is a technique in natural language processing, which aims to simplify the task of finding words and sentences similarity. Using a vector space model for the text representation, it selects the most significant values for the space reconstruction into a smaller dimension. This simplification allows it to generalize models, moving words and texts towards a semantic representation. Thus, it identifies a set of underlying meanings or hidden concepts without prior knowledge of grammar. The goal of this study was to determine the optimal dimensionality of the semantic space in a text classification task. The proposed solution corresponds to a semi-supervised algorithm that applies the method of the nearest neighbor classification on known examples, and plots the estimated accuracy on a graph. Because it is a very time consuming process, the vectors are projected on a space in such a way the calculation becomes incremental. Since the spaces are isometric, the similarity between documents remains equivalent. This proposal determines the optimal dimension of the semantic space with little effort, not much beyond the time required by traditional latent semantic analysis. The results showed significant gains in adopting the correct number of dimensions.

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

Diss_FabricioCatae.pdf (2.31 Mbytes)

Data de Publicação

2014-07-14

Trabalhos decorrentes

AVISO: O material descrito abaixo refere-se a trabalhos decorrentes desta tese ou dissertação. O conteúdo desses trabalhos é de inteira responsabilidade do autor da tese ou dissertação.

CATAE, F. S., e ROCHA, R. L. A. Classificação automática de texto buscando similaridade de palavras e significados ocultos. In XVIII Congreso Argentino de Ciencias de la Computación, Bahía Blanca, 2012. Anales del XVIII Congreso Argentino de Ciencias de la Computación.Bahía Blanca : Universidad Nacional del Sur, 2012. Dispon?vel em: http://sedici.unlp.edu.ar/handle/10915/23750.
CATAE, F. S., e ROCHA, R. L. A. Introdução a Árvores de Decisão Adaptativas. In Quinto Workshop de Tecnologia Adaptativa - WTA 2011, São Paulo, 2011. Memórias do WTA 2011 - Quinto Workshop de Tecnologia Adaptativa.São Paulo : Escola Politécnica da USP, 2011.