DSpace at My University FC - Faculdade de Ciências FC - Informática
Use este identificador para citar ou linkar para este item: http://monografias.uem.mz/handle/123456789/5794
Tipo: Trabalho de Conclusão de Curso
Título: Sistema para extração de informação e indexação semântica de trabalhos académicos
Autor(es): Matavele, Paulo Xatane
Primeiro Orientador: Zacarias, Orlando Pedro
metadata.dc.contributor.advisor-co1: Matavele, Kétmia Mahangue
Resumo: O presente trabalho aborda o desafio da recuperação eficiente de informações em repositórios acadêmicos digitais, especificamente no contexto da Universidade Eduardo Mondlane (UEM), em Maputo, Moçambique. A busca tradicional por palavras-chave isoladas apresenta limitações significativas ao não capturar o contexto semântico de monografias, resultando em precisão variável de 25-40% em tarefas de recuperação de documentos longos, conforme benchmarks em colecções textuais. Este problema é agravado pela crescente produção acadêmica e pela ausência de ferramentas automatizadas de indexação semântica adaptadas ao português no contexto moçambicano. O objectivo geral deste trabalho foi desenvolver e demonstrar a viabilidade técnica de um protótipo funcional de sistema para extração e indexação semântica de monografias académicas utilizando técnicas de Processamento de Linguagem Natural (PLN), combinando BERTimbau, YAKE! e busca vectorial (FAISS), inspirado em abordagens como a extração de expressões multipalavras para busca comparada. Os objetivos específicos incluíram: (1) identificar e validar ferramentas de PLN adequadas ao português, (2) Desenvolver um pipeline modular de processamento de documentos, (3) aplicar técnicas de extração de informação estruturada (NER, YAKE!, LDA) para geração de palavras- chave e expressões multipalavras com algoritmos baseados em relevância semântica, e (4) desenvolver uma interface de demonstração para visualização e análise dos resultados. A metodologia combinou pesquisa aplicada, exploratória e qualitativa. Foi desenvolvido um protótipo funcional integrando cinco módulos: extração de texto, pré-processamento, extração de informações, geração de embeddings e indexação híbrida (FAISS + Elasticsearch), adaptando princípios de validação de protótipos em recuperação de informação. O Autor desenvolveu um protótipo funcional de sistema de indexação semântica, validado quanto à sua operacionalidade (não eficácia) mediante uma amostra de demonstração de 10 documentos do repositório da Universidade Eduardo Mondlane. Os resultados confirmam viabilidade técnica do pipeline proposto. O objectivo de desenvolver e testar funcionalmente o protótipo foi alcançado na íntegra; a validação estatística comparativa (prevista nos objectivos específicos) não foi concretizada devido ás limitações de acesso ao repositório e ao período disponível para o trabalho. Este aspecto é detalhado na secção de Limitações (5.2). LIMITAÇÃO RECONHECIDA: A amostra utilizada (n=10) é estatisticamente insuficiente para validação conclusiva de desempenho. Esta dimensão foi determinada pelas seguintes condicionates: (i) o acesso ao repositório da UEM durante o período do trabalho(Abril-Agosto 2025) foi limitado a documentos disponíveis publicamente; (ii) o processamento de cada documento com BERTimbau exigiu em média 5 minutos de GPU, tornando inviável para uma colecção textual maior no período disponivel; e (iii) o objectivo desta fase foi a prova de conceito técnico, não a validação estatística. A principal contribuição deste trabalho consiste na primeira aplicação documentada do modelo BERTimbau a um repositório académico moçambicano, com adaptações específicas ao português. Adicionalmente, o trabalho propõe uma arquitetura modular de cinco componentes, reutilizável em outros repositórios lusófonos, e identifica os principais desafios técnicos e linguísticos para implementação em contexto moçambicano
Abstract: This study presents the development and preliminary technical validation of an automated system for extracting and semantically indexing academic monographs from Eduardo Mondlane University's repository. The proposed system combines Natural Language Processing techniques including OCR (pytesseract), preprocessing (spaCy), named entity recognition, keyword extraction (YAKE!), and semantic embedding generation (BERTimbau). A hybrid indexing architecture using FAISS and Elasticsearch was implemented and tested on a pilot sample of 10 theses. Preliminary qualitative observations suggest potential for improvement over traditional keyword-based search, though statistical validation requires larger-scale evaluation. The system demonstrates particular effectiveness in capturing terminological variations and semantic context, despite challenges with OCR quality and Mozambican Portuguese linguistic specificities. These findings validate the technical feasibility of the proposed approach and provide a foundation for full-scale implementation.
Palavras-chave: Processamento de linguagem natural
Indexação semântica
Extração de informação
Repositórios académicos
Busca vetorial
FAISS
CNPq: Ciências Exatas e da Terra
Informática
Idioma: por
País: Moçambique
Editor: Universidade Eduardo Mondlane
Sigla da Instituição: UEM
metadata.dc.publisher.department: Faculdade Ciências
Tipo de Acesso: Acesso Aberto
URI: http://monografias.uem.mz/handle/123456789/5794
Data do documento: 18-Mai-2026
Aparece nas coleções:FC - Informática

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
2026 - Matavele, Paulo.pdf2.51 MBAdobe PDFVisualizar/Abrir


Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.