Construção automática de redes bayesianas para extração de interações proteína-proteína a partir de textos biomédicos

Juárez, Pedro Nelson Shiguihara

doi:10.11606/D.55.2013.tde-26082013-161914

Home

Facilities

Master's Dissertation

DOI

https://doi.org/10.11606/D.55.2013.tde-26082013-161914

Document

Master's Dissertation

Author

Juárez, Pedro Nelson Shiguihara (Catálogo USP)

Full name

Pedro Nelson Shiguihara Juárez

Institute/School/College

Instituto de Ciências Matemáticas e de Computação

Knowledge Area

Computer Science and Computational Mathematics

Date of Defense

2013-06-20

Published

São Carlos, 2013

Supervisor

Lopes, Alneu de Andrade (Catálogo USP)

Committee

Lopes, Alneu de Andrade (President)
Camargo, Heloisa de Arruda
Nunes, Maria das Graças Volpe

Title in Portuguese

Construção automática de redes bayesianas para extração de interações proteína-proteína a partir de textos biomédicos

Keywords in Portuguese

Aprendizado de máquina
Extração de informação
Extração de interações proteína-proteína
Extração de relação
Redes bayesianas

Abstract in Portuguese

A extração de Interações Proteína-Proteína (IPPs) a partir de texto é um problema relevante na área biomédica e um desafio na área de aprendizado de máquina. Na área biomédica, as IPPs são fundamentais para compreender o funcionamento dos seres vivos. No entanto, o número de artigos relacionados com IPPs está aumentando rapidamente, sendo impraticável identicá-las e catalogá-las manualmente. Por exemplo, no caso das IPPs humanas apenas 10% foram catalogadas. Por outro lado, em aprendizado de máquina, métodos baseados em kernels são frequentemente empregados para extrair automaticamente IPPs, atingindo resultados considerados estado da arte. Esses métodos usam informações léxicas, sintáticas ou semânticas como características. Entretanto, os resultados ainda são insuficientes, atingindo uma taxa relativamente baixa, em termos da medida F, devido à complexidade do problema. Apesar dos esforços em produzir kernels, cada vez mais sofisticados, usando árvores sintáticas como árvores constituintes ou de dependência, pouco é conhecido sobre o desempenho de outras abordagens de aprendizado de máquina como, por exemplo, as redes bayesianas. As àrvores constituintes são estruturas de grafos que contêm informação importante da gramática subjacente as sentenças de textos contendo IPPs. Por outro lado, a rede bayesiana permite modelar algumas regras da gramática e atribuir para elas uma distribuição de probabilidade de acordo com as sentenças de treinamento. Neste trabalho de mestrado propõe-se um método para construção automática de redes bayesianas a partir de árvores contituintes para extração de IPPs. O método foi testado em cinco corpora padrões da extração de IPPs, atingindo resultados competitivos, em alguns casos melhores, em comparação a métodos do estado da arte

Title in English

Learning Bayesian networks for extraction of protein-protein interaction from biomedical articles

Keywords in English

Bayesian networks
Information extraction
Machine learning
Protei-protein interaction extraction
Relation extraction

Abstract in English

Extracting Protein-Protein Interactions (PPIs) from text is a relevant problem in the biomedical field and a challenge in the area of machine learning. In the biomedical field, the PPIs are fundamental to understand the functioning of living organisms. However, the number of articles related to PPIs is increasing rapidly, hence it is impractical to identify and catalog them manually. For example, in the case of human PPIs only 10 % have been cataloged. On the other hand, machine learning methods based on kernels are often employed to automatically extract PPIs, achieving state of the art results. These methods use lexical, syntactic and semantic information as features. However, the results are still poor, reaching a relatively low rate of F-measure due to the complexity of the problem. Despite efforts to produce sophisticate kernels, using syntactic trees as constituent or dependency trees, little is known about the performance of other Machine Learning approaches, eg, Bayesian networks. Constituent tree structures are graphs which contain important information of the underlying grammar in sentences containing PPIs. On the other hand, the Bayesian network allows modeling some rules of grammar and assign to them a probability distribution according to the training sentences. In this master thesis we propose a method for automatic construction of Bayesian networks from constituent trees for extracting PPIs. The method was tested in five corpora, considered benchmark of extraction of PPI, achieving competitive results, and in some cases better results when compared to state of the art methods

WARNING - Viewing this document is conditioned on your acceptance of the following terms of use:
This document is only for private use for research and teaching activities. Reproduction for commercial use is forbidden. This rights cover the whole data about this document as well as its contents. Any uses or copies of this document in whole or in part must include the author's name.

dissertacao_Pedro_revisada.pdf (1.63 Mbytes)

Publishing Date

2013-08-27

Derived works

WARNING: Learn what derived works are clicking here.