Metodologia computacional para identificação de sintagmas nominais da língua portuguesa
Brasília, 15 de junho de 2010 (data aproximada). Luana Vieira Morellato apresentou a Dissertação de mestrado intitulado(a) Metodologia computacional para identificação de sintagmas nominais da língua portuguesa, no programa Dissertação de Mestrado em Informática - UFES, sob orientação do(a) Prof(a). Sergio Antônio Andrade de Freitas.
ResumoSintagmas, unidades de sentido com funções sintáticas dentro de uma frase, são essenciais para a estruturação do conteúdo expresso nas sentenças, conforme destacado por Nicola (2008). As frases articulam seu conteúdo por meio dos elementos e das combinações que a linguagem disponibiliza, formando assim conjuntos e subconjuntos atuando como unidades sintáticas - os sintagmas, categorizados em nominais e verbais, com os nominais destacando-se pelo seu maior valor semântico. Eles são fundamentais em tarefas de Processamento de Linguagem Natural (PLN), como resolução de anáforas, construção de ontologias automáticas, análises em textos médicos para geração de resumos e vocabulário, ou como etapa preliminar em análises sintáticas. Em Recuperação de Informação (RI), os sintagmas aprimoram a criação de termos em sistemas de indexação e buscas, elevando a eficácia dos resultados. Esta dissertação introduz uma metodologia computacional para identificar sintagmas nominais em documentos digitais em português. Detalha-se a abordagem para identificar e extrair sintagmas nominais através do desenvolvimento do SISNOP - Sistema Identificador de Sintagmas Nominais em Português. O SISNOP, um sistema integrado por módulos e programas, analisa textos em linguagem natural, realizando análises morfológicas e sintáticas para recuperar sintagmas nominais, fornecendo também informações sintáticas, como gênero, número e grau das palavras nos sintagmas. Testado em corpora como CETENFolha e CETEMPúblico, o SISNOP alcançou reconhecimento de 98,12% e 94,59% das frases, identificando mais de 24 milhões de sintagmas. Seus módulos—Etiquetador Morfológico, Identificador de Sintagmas Nominais e Identificador de Gênero, Número e Grau—foram avaliados individualmente com um conjunto de dados menor devido à análise manual dos resultados, atingindo precisão de 82,45% e abrangência de 69,20%.
Trabalho depositado
O trabalho pode ser lido na íntegra na Biblioteca Digital / Repositório Institucional.
