Metodologia computacional para identificação de sintagmas nominais da língua portuguesa
Sintagmas, unidades de sentido com funções sintáticas dentro de uma frase, são essenciais para a estruturação do conteúdo expresso nas sentenças, conforme destacado por Nicola (2008). As frases articulam seu conteúdo por meio dos elementos e das combinações que a linguagem disponibiliza, formando assim conjuntos e subconjuntos atuando como unidades sintáticas - os sintagmas, categorizados em nominais e verbais, com os nominais destacando-se pelo seu maior valor semântico. Eles são fundamentais em tarefas de Processamento de Linguagem Natural (PLN), como resolução de anáforas, construção de ontologias automáticas, análises em textos médicos para geração de resumos e vocabulário, ou como etapa preliminar em análises sintáticas. Em Recuperação de Informação (RI), os sintagmas aprimoram a criação de termos em sistemas de indexação e buscas, elevando a eficácia dos resultados. Esta dissertação introduz uma metodologia computacional para identificar sintagmas nominais em documentos digitais em português. Detalha-se a abordagem para identificar e extrair sintagmas nominais através do desenvolvimento do SISNOP - Sistema Identificador de Sintagmas Nominais em Português. O SISNOP, um sistema integrado por módulos e programas, analisa textos em linguagem natural, realizando análises morfológicas e sintáticas para recuperar sintagmas nominais, fornecendo também informações sintáticas, como gênero, número e grau das palavras nos sintagmas. Testado em corpora como CETENFolha e CETEMPúblico, o SISNOP alcançou reconhecimento de 98,12% e 94,59% das frases, identificando mais de 24 milhões de sintagmas. Seus módulos—Etiquetador Morfológico, Identificador de Sintagmas Nominais e Identificador de Gênero, Número e Grau—foram avaliados individualmente com um conjunto de dados menor devido à análise manual dos resultados, atingindo precisão de 82,45% e abrangência de 69,20%.
Resumo
Sintagmas, unidades de sentido com funções sintáticas dentro de uma frase, são essenciais para a estruturação do conteúdo expresso nas sentenças, conforme destacado por Nicola (2008). As frases articulam seu conteúdo por meio dos elementos e das combinações que a linguagem disponibiliza, formando assim conjuntos e subconjuntos atuando como unidades sintáticas - os sintagmas, categorizados em nominais e verbais, com os nominais destacando-se pelo seu maior valor semântico. Eles são fundamentais em tarefas de Processamento de Linguagem Natural (PLN), como resolução de anáforas, construção de ontologias automáticas, análises em textos médicos para geração de resumos e vocabulário, ou como etapa preliminar em análises sintáticas. Em Recuperação de Informação (RI), os sintagmas aprimoram a criação de termos em sistemas de indexação e buscas, elevando a eficácia dos resultados. Esta dissertação introduz uma metodologia computacional para identificar sintagmas nominais em documentos digitais em português. Detalha-se a abordagem para identificar e extrair sintagmas nominais através do desenvolvimento do SISNOP - Sistema Identificador de Sintagmas Nominais em Português. O SISNOP, um sistema integrado por módulos e programas, analisa textos em linguagem natural, realizando análises morfológicas e sintáticas para recuperar sintagmas nominais, fornecendo também informações sintáticas, como gênero, número e grau das palavras nos sintagmas. Testado em corpora como CETENFolha e CETEMPúblico, o SISNOP alcançou reconhecimento de 98,12% e 94,59% das frases, identificando mais de 24 milhões de sintagmas. Seus módulos—Etiquetador Morfológico, Identificador de Sintagmas Nominais e Identificador de Gênero, Número e Grau—foram avaliados individualmente com um conjunto de dados menor devido à análise manual dos resultados, atingindo precisão de 82,45% e abrangência de 69,20%.
BibTeX
@mastersthesis{2010-luana-vieira-morellato-metodologia-computacional-para-identificacao-de-sintagmas-nomi,
author = {Luana Vieira Morellato},
title = {Metodologia computacional para identificação de sintagmas nominais da língua portuguesa},
year = {2010},
publisher = {Biblioteca Central da Universidade Federal do Espirito Santo}
}