A framework for closed domain question answering systems in the low data regime.

Carmo, Vinícius Cleves de Oliveira

doi:10.11606/D.3.2022.tde-24052023-152815

Home

Facilities

Master's Dissertation

DOI

https://doi.org/10.11606/D.3.2022.tde-24052023-152815

Document

Master's Dissertation

Author

Carmo, Vinícius Cleves de Oliveira (Catálogo USP)

Full name

Vinícius Cleves de Oliveira Carmo

E-mail

Institute/School/College

Escola Politécnica

Knowledge Area

Computer Engineering

Date of Defense

2022-12-06

Published

São Paulo, 2022

Supervisor

Cozman, Fabio Gagliardi (Catálogo USP)

Committee

Cozman, Fabio Gagliardi (President)
Marcacini, Ricardo Marcondes
Moreira, Viviane Pereira

Title in English

A framework for closed domain question answering systems in the low data regime.

Keywords in English

Information retrieval
Machine learning
Neural networks
Question answering systems

Abstract in English

Question Answering (QA) systems that operate over textual databases aim at improving traditional information retrieval systems; while the latter recover a number of relevant documents from a document pool, the former can also find and present direct answers to users. Recent improvements on QA have been based on deep neural networks; such networks require large volumes of labeled data for training. Most existing datasets target general knowledge and, even though there are a few datasets for specific domains (such as biomedicine), for most domains there is no labeled, or easy to label, dataset available. This creates an obstacle for the development of domain-specific QA systems. We propose a framework for developing domain-specific QA systems by leveraging unsupervised learning so as to avoid the costs related to large scale dataset labeling. The contributions of this work are twofold. First, we apply domain-adaptive pretraining to improve out-of-domain performance of reading comprehension and question answering systems. This technique achieves state-of-the-art results on two Reading Comprehension datasets, and it exceeds the performance of state-of-the-art domain adaptation techniques in the literature by a significant margin: 2.3 exact match and 5.2 F1-score on BioASQ. Then, we propose a framework for domain-specific question answering in the low data regime. For document retrieval, we apply a combination of BM25 along with a custom text processing pipeline. We find that, in a low data setting, statistical document retrieval models outperform neural models as the data on the desired domain differ from the data used for training. For answer selection, we apply a neural reader trained with domain-adaptive pretraining to improve generalization on the desired domain. We also perform a case study by applying the proposed framework to the offshore engineering domain.

Title in Portuguese

Uma abordagem para o projeto de sistemas de resposta a perguntas com escassez de dados.

Keywords in Portuguese

Aprendizado computacional
Recuperação de informação
Redes neurais
Sistemas de questões e respostas

Abstract in Portuguese

Sistemas de resposta a perguntas (Question Answering QA) que operam sobre conjuntos de documentos visam melhorar os sistemas tradicionais de recuperação de informações; enquanto estes recuperam documentos relevantes de uma base de documentos, aqueles também localizam e apresentam respostas diretas aos usuários. Melhorias recentes em QA tem sido baseadas em redes neurais, porém tais redes exigem grandes volumes de dados rotulados para treinamento. A maioria dos conjuntos de dados existentes contem conhecimentos gerais e, embora existam alguns conjuntos de dados para domínios específicos (como biomedicina), na maioria dos domínios não há disponíveis conjuntos de dados rotulados ou fáceis de rotular. Isso cria um obstáculo para o desenvolvimento de sistemas de QA de domínio específico. Neste trabalho, propomos um esquema para desenvolvimento de sistemas de QA de domínio específico utilizando aprendizado não supervisionado, de modo a evitar os custos relacionados à rotulagem de grandes conjuntos de dados. Nossa contribuição tem duas formas. Primeiro, aplicamos a técnica de pré-treino adaptativo ao domínio para melhorar o desempenho fora do domínio em sistemas de compreensão de leitura e QA. Essa técnica atinge o estado da arte em dois conjuntos de dados de compreensão de leitura, e supera a performance de técnicas de adaptação de domínio no estado da arte na literatura por uma margem significativa: 2,3 em correspondência exata e 5.2 em F1-score no BioASQ. Em seguida, propomos um framework para QA em domínio específico em regime de escassez de dados. Para recuperação de documentos, aplicamos uma combinação do BM25 junto com um pipeline de processamento de texto personalizado. Descobrimos que, em um regime de escassez de dados, modelos estatísticos de recuperação de documentos superam os modelos neurais, conforme os dados no domínio desejado diferem dos dados utilizados durante o treinamento. Para a seleção de respostas, aplicamos um leitor neural treinado com a técnica de pré-treino adaptativo ao domínio para melhorar a generalização no domínio desejado. Também realizamos um estudo de caso aplicando o framework proposto ao domínio da engenharia oceânica.

WARNING - Viewing this document is conditioned on your acceptance of the following terms of use:
This document is only for private use for research and teaching activities. Reproduction for commercial use is forbidden. This rights cover the whole data about this document as well as its contents. Any uses or copies of this document in whole or in part must include the author's name.

ViniciusClevesdeOliveiraCarmoCorr23.pdf (3.43 Mbytes)

Publishing Date

2023-05-29

Derived works

WARNING: Learn what derived works are clicking here.