Use este identificador para citar ou linkar para este item:
http://monografias.uem.mz/handle/123456789/5794Registro completo de metadados
| Campo DC | Valor | Idioma |
|---|---|---|
| dc.creator | Matavele, Paulo Xatane | - |
| dc.date.accessioned | 2026-07-24T10:12:29Z | - |
| dc.date.issued | 2026-05-18 | - |
| dc.identifier.uri | http://monografias.uem.mz/handle/123456789/5794 | - |
| dc.description.abstract | This study presents the development and preliminary technical validation of an automated system for extracting and semantically indexing academic monographs from Eduardo Mondlane University's repository. The proposed system combines Natural Language Processing techniques including OCR (pytesseract), preprocessing (spaCy), named entity recognition, keyword extraction (YAKE!), and semantic embedding generation (BERTimbau). A hybrid indexing architecture using FAISS and Elasticsearch was implemented and tested on a pilot sample of 10 theses. Preliminary qualitative observations suggest potential for improvement over traditional keyword-based search, though statistical validation requires larger-scale evaluation. The system demonstrates particular effectiveness in capturing terminological variations and semantic context, despite challenges with OCR quality and Mozambican Portuguese linguistic specificities. These findings validate the technical feasibility of the proposed approach and provide a foundation for full-scale implementation. | pt_BR |
| dc.language | por | pt_BR |
| dc.publisher | Universidade Eduardo Mondlane | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.subject | Processamento de linguagem natural | pt_BR |
| dc.subject | Indexação semântica | pt_BR |
| dc.subject | Extração de informação | pt_BR |
| dc.subject | Repositórios académicos | pt_BR |
| dc.subject | Busca vetorial | pt_BR |
| dc.subject | FAISS | pt_BR |
| dc.title | Sistema para extração de informação e indexação semântica de trabalhos académicos | pt_BR |
| dc.type | Trabalho de Conclusão de Curso | pt_BR |
| dc.contributor.advisor1 | Zacarias, Orlando Pedro | - |
| dc.contributor.advisor-co1 | Matavele, Kétmia Mahangue | - |
| dc.description.resumo | O presente trabalho aborda o desafio da recuperação eficiente de informações em repositórios acadêmicos digitais, especificamente no contexto da Universidade Eduardo Mondlane (UEM), em Maputo, Moçambique. A busca tradicional por palavras-chave isoladas apresenta limitações significativas ao não capturar o contexto semântico de monografias, resultando em precisão variável de 25-40% em tarefas de recuperação de documentos longos, conforme benchmarks em colecções textuais. Este problema é agravado pela crescente produção acadêmica e pela ausência de ferramentas automatizadas de indexação semântica adaptadas ao português no contexto moçambicano. O objectivo geral deste trabalho foi desenvolver e demonstrar a viabilidade técnica de um protótipo funcional de sistema para extração e indexação semântica de monografias académicas utilizando técnicas de Processamento de Linguagem Natural (PLN), combinando BERTimbau, YAKE! e busca vectorial (FAISS), inspirado em abordagens como a extração de expressões multipalavras para busca comparada. Os objetivos específicos incluíram: (1) identificar e validar ferramentas de PLN adequadas ao português, (2) Desenvolver um pipeline modular de processamento de documentos, (3) aplicar técnicas de extração de informação estruturada (NER, YAKE!, LDA) para geração de palavras- chave e expressões multipalavras com algoritmos baseados em relevância semântica, e (4) desenvolver uma interface de demonstração para visualização e análise dos resultados. A metodologia combinou pesquisa aplicada, exploratória e qualitativa. Foi desenvolvido um protótipo funcional integrando cinco módulos: extração de texto, pré-processamento, extração de informações, geração de embeddings e indexação híbrida (FAISS + Elasticsearch), adaptando princípios de validação de protótipos em recuperação de informação. O Autor desenvolveu um protótipo funcional de sistema de indexação semântica, validado quanto à sua operacionalidade (não eficácia) mediante uma amostra de demonstração de 10 documentos do repositório da Universidade Eduardo Mondlane. Os resultados confirmam viabilidade técnica do pipeline proposto. O objectivo de desenvolver e testar funcionalmente o protótipo foi alcançado na íntegra; a validação estatística comparativa (prevista nos objectivos específicos) não foi concretizada devido ás limitações de acesso ao repositório e ao período disponível para o trabalho. Este aspecto é detalhado na secção de Limitações (5.2). LIMITAÇÃO RECONHECIDA: A amostra utilizada (n=10) é estatisticamente insuficiente para validação conclusiva de desempenho. Esta dimensão foi determinada pelas seguintes condicionates: (i) o acesso ao repositório da UEM durante o período do trabalho(Abril-Agosto 2025) foi limitado a documentos disponíveis publicamente; (ii) o processamento de cada documento com BERTimbau exigiu em média 5 minutos de GPU, tornando inviável para uma colecção textual maior no período disponivel; e (iii) o objectivo desta fase foi a prova de conceito técnico, não a validação estatística. A principal contribuição deste trabalho consiste na primeira aplicação documentada do modelo BERTimbau a um repositório académico moçambicano, com adaptações específicas ao português. Adicionalmente, o trabalho propõe uma arquitetura modular de cinco componentes, reutilizável em outros repositórios lusófonos, e identifica os principais desafios técnicos e linguísticos para implementação em contexto moçambicano | pt_BR |
| dc.publisher.country | Moçambique | pt_BR |
| dc.publisher.department | Faculdade Ciências | pt_BR |
| dc.publisher.initials | UEM | pt_BR |
| dc.subject.cnpq | Ciências Exatas e da Terra | pt_BR |
| dc.subject.cnpq | Informática | pt_BR |
| dc.description.embargo | 2026-07-16 | - |
| Aparece nas coleções: | FC - Informática | |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| 2026 - Matavele, Paulo.pdf | 2.51 MB | Adobe PDF | Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
