Reconhecimento de entidades mencionadas em português utilizando aprendizado de máquina

Carvalho, Wesley Seidel

doi:10.11606/D.45.2012.tde-23052013-104248

Home

Facilities

Master's Dissertation

DOI

https://doi.org/10.11606/D.45.2012.tde-23052013-104248

Document

Master's Dissertation

Author

Carvalho, Wesley Seidel (Catálogo USP)

Full name

Wesley Seidel Carvalho

E-mail

Institute/School/College

Instituto de Matemática e Estatística

Knowledge Area

Computer Science

Date of Defense

2012-02-24

Published

São Paulo, 2012

Supervisor

Finger, Marcelo (Catálogo USP)

Committee

Finger, Marcelo (President)
Kepler, Fábio Natanael
Lago, Alair Pereira do

Title in Portuguese

Reconhecimento de entidades mencionadas em português utilizando aprendizado de máquina

Keywords in Portuguese

Aprendizado de Máquina
Máxima Entropia
PLN
Processamento de Linguagem Natural
Reconhecimento de Entidades Mencionadas
Reconhecimento de Entidades Nomeadas
REM

Abstract in Portuguese

O Reconhecimento de Entidades Mencionadas (REM) é uma subtarefa da extração de informações e tem como objetivo localizar e classificar elementos do texto em categorias pré-definidas tais como nome de pessoas, organizações, lugares, datas e outras classes de interesse. Esse conhecimento obtido possibilita a execução de outras tarefas mais avançadas. O REM pode ser considerado um dos primeiros passos para a análise semântica de textos, além de ser uma subtarefa crucial para sistemas de gerenciamento de documentos, mineração de textos, extração da informação, entre outros. Neste trabalho, estudamos alguns métodos de Aprendizado de Máquina aplicados na tarefa de REM que estão relacionados ao atual estado da arte, dentre eles, dois métodos aplicados na tarefa de REM para a língua portuguesa. Apresentamos três diferentes formas de avaliação destes tipos de sistemas presentes na literatura da área. Além disso, desenvolvemos um sistema de REM para língua portuguesa utilizando Aprendizado de Máquina, mais especificamente, o arcabouço de máxima entropia. Os resultados obtidos com o nosso sistema alcançaram resultados equiparáveis aos melhores sistemas de REM para a língua portuguesa desenvolvidos utilizando outras abordagens de aprendizado de máquina.

Title in English

Portuguese named entity recognition using machine learning

Keywords in English

Information Extraction
Machine Learning
Maximum Entropy Framework
Named Entity Recognition
Natural Language Processing.

Abstract in English

Named Entity Recognition (NER), a task related to information extraction, aims to classify textual elements according to predefined categories such as names, places, dates etc. This enables the execution of more advanced tasks. NER is a first step towards semantic textual analysis and is also a crucial task for systems of information extraction and other types of systems. In this thesis, I analyze some Machine Learning methods applied to NER tasks, including two methods applied to Portuguese language. I present three ways of evaluating these types of systems found in the literature. I also develop an NER system for the Portuguese language utilizing Machine Learning that entails working with a maximum entropy framework. The results are comparable to the best NER systems for the Portuguese language developed with other Machine Learning alternatives.

WARNING - Viewing this document is conditioned on your acceptance of the following terms of use:
This document is only for private use for research and teaching activities. Reproduction for commercial use is forbidden. This rights cover the whole data about this document as well as its contents. Any uses or copies of this document in whole or in part must include the author's name.

dissertacao_rem_wesley_seidel.pdf (1.31 Mbytes)

Publishing Date

2013-05-23

Derived works

WARNING: Learn what derived works are clicking here.