Orquestração de pipelines de dados educacionais: uma arquitetura automatizada com Apache Airflow e MinIO para integração SIGAA-ENADE
| dc.contributor.advisor | Albuquerque Júnior, Gabriel Alves de | |
| dc.contributor.advisorLattes | http://lattes.cnpq.br/1399502815770584 | |
| dc.contributor.author | Santos, Arthur Henrique Martins | |
| dc.contributor.authorLattes | http://lattes.cnpq.br/8616497325595501 | |
| dc.date.accessioned | 2026-09-03T20:52:12Z | |
| dc.date.issued | 2026-07-21 | |
| dc.degree.departament | Estatística e Informática | |
| dc.degree.graduation | Bacharelado em Sistemas da Informação | |
| dc.degree.level | bachelor's degree | |
| dc.degree.local | Recife | |
| dc.description.abstract | A fragmentação e a dependência de processos manuais na integração de bases educacionais representam um desafio significativo para a governança de dados no ensino superior, aumentando o risco de falhas operacionais e inconsistências analíticas. Este trabalho propõe uma arquitetura de orquestração de pipelines de dados para automatizar a extração, transformação e carga (ETL) das bases consumidas pelo System of Academic Business Intelligence and Analytics (SABIA), plataforma institucional da Universidade Federal Rural de Pernambuco (UFRPE). A solução foi desenvolvida utilizando Apache Airflow para o gerenciamento de Grafos Acíclicos Direcionados (DAGs), Python e Pandas para o processamento, e o MinIO como repositório de objetos, estruturado em um modelo enxuto de camadas para separar dados brutos de dados processados em formato Parquet. O pipeline integra registros acadêmicos internos (sistemas SIGAA e SIGA) e o arquivo oficial de vagas da instituição com microdados públicos de avaliação (ENADE/INEP). A execução prática do projeto validou a conversão de 14 rotinas analíticas, outrora executadas manualmente, em um fluxo interdependente e concluído de forma automatizada em aproximadamente 7 minutos. Os resultados demonstram que a nova infraestrutura mitigou problemas de qualidade de dados como divergências de nomenclatura, valores ausentes e duplicidades, além de fornecer a rastreabilidade e a capacidade de recuperação de falhas exigidas por uma governança madura. Conclui-se que a padronização orquestrada não apenas tornou o abastecimento do SABIA confiável e independente de intervenção humana, como também consolidou um modelo arquitetural escalável e replicável para outras instituições que utilizam as mesmas infraestruturas de gestão acadêmica. | |
| dc.description.abstractx | The fragmentation and reliance on manual processes for integrating educational databases pose a significant challenge to data governance in higher education, increasing the risk of operational failures and analytical inconsistencies. This work proposes a data pipeline orchestration architecture to automate the extraction, transformation, and loading (ETL) of the databases consumed by the System of Academic Business Intelligence and Analytics (SABIA), an institutional platform of the Federal Rural University of Pernambuco (UFRPE). The solution was developed using Apache Airflow for managing Directed Acyclic Graphs (DAGs), Python and Pandas for processing, and MinIO as an object storage repository, structured in a lean layered model to separate raw data from processed data in Parquet format. The pipeline integrates internal academic records (SIGAA and SIGA systems) and the institution’s official enrollment-capacity file with public assessment microdata (ENADE/INEP). The practical execution of the project validated the conversion of 14 previously manual analytical routines into an interdependent workflow completed automatically in approximately 7 minutes. The results show that the new infrastructure mitigated data quality issues such as naming discrepancies, missing values, and duplicates, while providing the traceability and failure-recovery capability required by mature data governance. It is concluded that orchestrated standardization not only made SABIA’s data supply reliable and independent of human intervention, but also consolidated a scalable and replicable architectural model for other institutions that rely on the same academic management infrastructures. | |
| dc.format.extent | 56 f. | |
| dc.identifier.citation | SANTOS, Arthur Henrique Martins. Orquestração de pipelines de dados educacionais: uma arquitetura automatizada com Apache Airflow e MinIO para integração SIGAA-ENADE. 2026. 56 f. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Departamento de Estatística e Informática, Universidade Federal Rural de Pernambuco, Recife, 2026. | |
| dc.identifier.uri | https://arandu.ufrpe.br/handle/123456789/9209 | |
| dc.language.iso | pt_BR | |
| dc.publisher.country | Brazil | |
| dc.publisher.initials | UFRPE | |
| dc.rights | openAccess | |
| dc.rights.license | Attribution-NonCommercial-NoDerivatives 4.0 International | en |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/4.0/ | |
| dc.subject | Governança de dados | |
| dc.subject | Mineração de dados (Computação) | |
| dc.subject | Processamento de dados | |
| dc.subject | Ensino superior | |
| dc.title | Orquestração de pipelines de dados educacionais: uma arquitetura automatizada com Apache Airflow e MinIO para integração SIGAA-ENADE | |
| dc.type | bachelorThesis |
