Reconhecimento de entidades mencionadas em português utilizando aprendizado de máquina

Carvalho, Wesley Seidel

doi:10.11606/D.45.2012.tde-23052013-104248

Accueil

Services

Mémoire de Maîtrise

DOI

https://doi.org/10.11606/D.45.2012.tde-23052013-104248

Document

Mémoire de Maîtrise

Auteur

Carvalho, Wesley Seidel (Catálogo USP)

Nom complet

Wesley Seidel Carvalho

Adresse Mail

Unité de l'USP

Instituto de Matemática e Estatística

Domain de Connaissance

Informatique

Date de Soutenance

2012-02-24

Editeur

São Paulo, 2012

Directeur

Finger, Marcelo (Catálogo USP)

Jury

Finger, Marcelo (Président)
Kepler, Fábio Natanael
Lago, Alair Pereira do

Titre en portugais

Reconhecimento de entidades mencionadas em português utilizando aprendizado de máquina

Mots-clés en portugais

Aprendizado de Máquina
Máxima Entropia
PLN
Processamento de Linguagem Natural
Reconhecimento de Entidades Mencionadas
Reconhecimento de Entidades Nomeadas
REM

Resumé en portugais

O Reconhecimento de Entidades Mencionadas (REM) é uma subtarefa da extração de informações e tem como objetivo localizar e classificar elementos do texto em categorias pré-definidas tais como nome de pessoas, organizações, lugares, datas e outras classes de interesse. Esse conhecimento obtido possibilita a execução de outras tarefas mais avançadas. O REM pode ser considerado um dos primeiros passos para a análise semântica de textos, além de ser uma subtarefa crucial para sistemas de gerenciamento de documentos, mineração de textos, extração da informação, entre outros. Neste trabalho, estudamos alguns métodos de Aprendizado de Máquina aplicados na tarefa de REM que estão relacionados ao atual estado da arte, dentre eles, dois métodos aplicados na tarefa de REM para a língua portuguesa. Apresentamos três diferentes formas de avaliação destes tipos de sistemas presentes na literatura da área. Além disso, desenvolvemos um sistema de REM para língua portuguesa utilizando Aprendizado de Máquina, mais especificamente, o arcabouço de máxima entropia. Os resultados obtidos com o nosso sistema alcançaram resultados equiparáveis aos melhores sistemas de REM para a língua portuguesa desenvolvidos utilizando outras abordagens de aprendizado de máquina.

Titre en anglais

Portuguese named entity recognition using machine learning

Mots-clés en anglais

Information Extraction
Machine Learning
Maximum Entropy Framework
Named Entity Recognition
Natural Language Processing.

Resumé en anglais

Named Entity Recognition (NER), a task related to information extraction, aims to classify textual elements according to predefined categories such as names, places, dates etc. This enables the execution of more advanced tasks. NER is a first step towards semantic textual analysis and is also a crucial task for systems of information extraction and other types of systems. In this thesis, I analyze some Machine Learning methods applied to NER tasks, including two methods applied to Portuguese language. I present three ways of evaluating these types of systems found in the literature. I also develop an NER system for the Portuguese language utilizing Machine Learning that entails working with a maximum entropy framework. The results are comparable to the best NER systems for the Portuguese language developed with other Machine Learning alternatives.

AVERTISSEMENT - Regarde ce document est soumise à votre acceptation des conditions d'utilisation suivantes:
Ce document est uniquement à des fins privées pour la recherche et l'enseignement. Reproduction à des fins commerciales est interdite. Cette droits couvrent l'ensemble des données sur ce document ainsi que son contenu. Toute utilisation ou de copie de ce document, en totalité ou en partie, doit inclure le nom de l'auteur.

dissertacao_rem_wesley_seidel.pdf (1.31 Mbytes)

Date de Publication

2013-05-23

Œvres dérivées

AVERTISSEMENT: Apprenez ce que sont des œvres dérivées cliquant ici.