Petro KGraph: a methodology for extracting knowledge graph from technical documents - an application in the oil and gas industry.

dc.contributor.advisorCoelho, Flávio Codeço
dc.contributor.authorCordeiro, Fábio Corrêa
dc.contributor.memberSilva, Moacyr Alvim Horta Barbosa da
dc.contributor.memberSouza, Renato Rocha
dc.contributor.unidadefgvEscolas::EMAppor
dc.date.accessioned2024-09-16T13:42:13Z
dc.date.available2024-09-16T13:42:13Z
dc.date.issued2024-08-13
dc.description.abstractNumerous companies are interested in gathering strategic information from their document repositories. It is especially relevant for the oil and gas industry, which has large repositories of geoscientific reports from several decades of production. Making this information available in a structured format can unlock valuable information among these mountains of data, which is crucial to support a wide range of industrial and academic applications. However, most natural language processing resources were built with general domain texts extracted from the Internet and written primarily in English. This thesis presents a methodology for extracting geoscientific entities and relations from technical documents and populating a knowledge graph - the Petro KGraph. We also developed a comprehensive set of natural language processing and information extraction resources for the oil and gas industry in Portuguese. Along the text, we describe the natural language processing and information extraction resources, the process used to train machine learning models, and review relevant literature. Finally, we evaluate each model and the overall methodology. We developed an innovative Entity Linking approach that allows finding new entities beyond those already known. Another crucial contribution is that the new resources and evaluation procedures constitute a new benchmark for the Portuguese language and the geoscience domain. We evaluated an information retrieval system using the Petro KGraph to expand its queries, which presented a slightly better result than the system without a query expansion. Plans for future work include building an improved information retrieval test set, comparing the results using different graph embedding algorithms, and testing language models launched after BERT models.eng
dc.description.abstractInúmeras organizações estão interessadas em coletar informações estratégicas de seus repositórios de documentos. Essa preocupação e especialmente relevante para a indústria de óleo e gás, que possui grandes repositórios de relatórios geocinéticos de várias décadas de produção. Disponibilizar esta informação em um formato estruturado pode desbloquear informações valiosas dessa montanhas de dados, o que ´e crucial para apoiar uma vasta gama de aplicações industriais e acadêmicas. Contudo, a maioria dos recursos para processamento de linguagem natural foi construída com textos de domínio geral extraídos da Internet e escritos principalmente em inglês. Esta tese apresenta uma metodologia para extrair entidades e relações geocinéticas de documentos t´técnicos e povoar um grafo de conhecimento - o Petro KGraph. Também desenvolvemos um conjunto abrangente de recursos de processamento de linguagem natural e extração de informações para a indústria de ´óleo e gás em português. Ao longo do texto, descrevemos os recursos de processamento de linguagem natural e extração de informações, o processo utilizado para treinar os modelos de aprendizado de m´máquina e revisamos a literatura relevante. Por fim, avaliamos cada modelo e a metodologia como um todo. Desenvolvemos uma abordagem inovadora para o Entity Linking que permite encontrar novas entidades além das já conhecidas. Outra contribuição crucial ´e que os recursos e procedimentos de avaliação constituem uma nova referência para a língua portuguesa e o domínio das geociências. Avaliamos um sistema de recuperação de informação utilizando o Petro KGraph para expandir suas consultas, que apresentou um resultado um pouco melhor que o sistema sem expansão de consultas. Os planos para trabalhos futuros incluem o aprimoramento de um conjunto de teste de recuperação de informações, a comparação dos resultados usando diferentes algoritmos de vetorização de grafos e o teste de modelos de linguagem lançados após os modelos BERT.por
dc.description.sponsorshipPetrobras
dc.identifier.urihttps://hdl.handle.net/10438/35868
dc.language.isoeng
dc.rights.accessRightsopenAccesseng
dc.subjectNatural language processingeng
dc.subjectInformation extractioneng
dc.subjectKnowledge grapheng
dc.subjectOntology populationeng
dc.subjectGraph embeddingeng
dc.subjectInformation retrievaleng
dc.subject.areaMatemáticapor
dc.subject.bibliodataProcessamento da linguagem natural (Computação)por
dc.subject.bibliodataOntologias (Recuperação da informação)por
dc.subject.bibliodataRecuperação da informaçãopor
dc.subject.bibliodataMineração de dados (Computação)por
dc.titlePetro KGraph: a methodology for extracting knowledge graph from technical documents - an application in the oil and gas industry.eng
dc.typeThesiseng

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
PetroKGraph - Fabio_Cordeiro.pdf
Tamanho:
7.21 MB
Formato:
Adobe Portable Document Format
Descrição:
PDF

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
4.99 KB
Formato:
Item-specific license agreed upon to submission
Descrição: