Orquestração de pipelines de dados educacionais: uma arquitetura automatizada com Apache Airflow e MinIO para integração SIGAA-ENADE

dc.contributor.advisorAlbuquerque Júnior, Gabriel Alves de
dc.contributor.advisorLatteshttp://lattes.cnpq.br/1399502815770584
dc.contributor.authorSantos, Arthur Henrique Martins
dc.contributor.authorLatteshttp://lattes.cnpq.br/8616497325595501
dc.date.accessioned2026-09-03T20:52:12Z
dc.date.issued2026-07-21
dc.degree.departamentEstatística e Informática
dc.degree.graduationBacharelado em Sistemas da Informação
dc.degree.levelbachelor's degree
dc.degree.localRecife
dc.description.abstractA fragmentação e a dependência de processos manuais na integração de bases educacionais representam um desafio significativo para a governança de dados no ensino superior, aumentando o risco de falhas operacionais e inconsistências analíticas. Este trabalho propõe uma arquitetura de orquestração de pipelines de dados para automatizar a extração, transformação e carga (ETL) das bases consumidas pelo System of Academic Business Intelligence and Analytics (SABIA), plataforma institucional da Universidade Federal Rural de Pernambuco (UFRPE). A solução foi desenvolvida utilizando Apache Airflow para o gerenciamento de Grafos Acíclicos Direcionados (DAGs), Python e Pandas para o processamento, e o MinIO como repositório de objetos, estruturado em um modelo enxuto de camadas para separar dados brutos de dados processados em formato Parquet. O pipeline integra registros acadêmicos internos (sistemas SIGAA e SIGA) e o arquivo oficial de vagas da instituição com microdados públicos de avaliação (ENADE/INEP). A execução prática do projeto validou a conversão de 14 rotinas analíticas, outrora executadas manualmente, em um fluxo interdependente e concluído de forma automatizada em aproximadamente 7 minutos. Os resultados demonstram que a nova infraestrutura mitigou problemas de qualidade de dados como divergências de nomenclatura, valores ausentes e duplicidades, além de fornecer a rastreabilidade e a capacidade de recuperação de falhas exigidas por uma governança madura. Conclui-se que a padronização orquestrada não apenas tornou o abastecimento do SABIA confiável e independente de intervenção humana, como também consolidou um modelo arquitetural escalável e replicável para outras instituições que utilizam as mesmas infraestruturas de gestão acadêmica.
dc.description.abstractxThe fragmentation and reliance on manual processes for integrating educational databases pose a significant challenge to data governance in higher education, increasing the risk of operational failures and analytical inconsistencies. This work proposes a data pipeline orchestration architecture to automate the extraction, transformation, and loading (ETL) of the databases consumed by the System of Academic Business Intelligence and Analytics (SABIA), an institutional platform of the Federal Rural University of Pernambuco (UFRPE). The solution was developed using Apache Airflow for managing Directed Acyclic Graphs (DAGs), Python and Pandas for processing, and MinIO as an object storage repository, structured in a lean layered model to separate raw data from processed data in Parquet format. The pipeline integrates internal academic records (SIGAA and SIGA systems) and the institution’s official enrollment-capacity file with public assessment microdata (ENADE/INEP). The practical execution of the project validated the conversion of 14 previously manual analytical routines into an interdependent workflow completed automatically in approximately 7 minutes. The results show that the new infrastructure mitigated data quality issues such as naming discrepancies, missing values, and duplicates, while providing the traceability and failure-recovery capability required by mature data governance. It is concluded that orchestrated standardization not only made SABIA’s data supply reliable and independent of human intervention, but also consolidated a scalable and replicable architectural model for other institutions that rely on the same academic management infrastructures.
dc.format.extent56 f.
dc.identifier.citationSANTOS, Arthur Henrique Martins. Orquestração de pipelines de dados educacionais: uma arquitetura automatizada com Apache Airflow e MinIO para integração SIGAA-ENADE. 2026. 56 f. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Departamento de Estatística e Informática, Universidade Federal Rural de Pernambuco, Recife, 2026.
dc.identifier.urihttps://arandu.ufrpe.br/handle/123456789/9209
dc.language.isopt_BR
dc.publisher.countryBrazil
dc.publisher.initialsUFRPE
dc.rightsopenAccess
dc.rights.licenseAttribution-NonCommercial-NoDerivatives 4.0 Internationalen
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/
dc.subjectGovernança de dados
dc.subjectMineração de dados (Computação)
dc.subjectProcessamento de dados
dc.subjectEnsino superior
dc.titleOrquestração de pipelines de dados educacionais: uma arquitetura automatizada com Apache Airflow e MinIO para integração SIGAA-ENADE
dc.typebachelorThesis

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Imagem de Miniatura
Nome:
tcc_arthurhenriquemartinssantos.pdf
Tamanho:
3.18 MB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Nenhuma Miniatura Disponível
Nome:
license.txt
Tamanho:
1.87 KB
Formato:
Item-specific license agreed upon to submission
Descrição: