TCC - Bacharelado em Ciência da Computação (Sede)
URI permanente para esta coleçãohttps://arandu.ufrpe.br/handle/123456789/415
Navegar
Item Análise de comparação entre modelos compreensão visual de documentos usando LoRA(2026) Albuquerque Neto, Edivaldo Leitão de; Macário Filho, Valmir; http://lattes.cnpq.br/4346898674852080; http://lattes.cnpq.br/5857699580126917O crescimento do volume de documentos digitais tem impulsionado o desenvolvimento de soluções baseadas em Inteligência Artificial para automatizar tarefas de extração e processamento de informações. Nesse contexto, este trabalho realiza uma análise comparativa dos modelos LayoutLMv3, DocFormer e Donut aplicados à tarefa de compreensão de documentos, investigando o impacto da técnica Low-Rank Adaptation (LoRA) no processo de ajuste fino dos modelos. A metodologia adotada consistiu na aplicação de diferentes configurações de LoRA, variando os módulos-alvo, o rank, o alpha, o dropout e a taxa de aprendizado, com o objetivo de reduzir o número de parâmetros treináveis sem comprometer o desempenho preditivo. Os experimentos foram conduzidos utilizando métricas de Precisão, Revocação e F1-Score para avaliar os resultados. Entre os modelos analisados, o LayoutLMv3 apresentou o melhor desempenho geral, alcançando Precisão de 92,02 %, Revocação de 90,01 % e F1-Score de 91,00% utilizando adaptação nos módulos Query e Value, com aproximadamente 1,19 milhão de parâmetros treináveis. O Donut também apresentou resultados competitivos, obtendo Precisão de 89,75%, Revocação de 92,13% e F1-Score de 90,92% com adaptação nos módulos queryj, value, key e output, empregando resolução de entrada de 960 × 720 pixels e aproximadamente 544 mil parâmetros treináveis. Os resultados demonstram que o uso de LoRA permite reduzir significativamente o número de parâmetros atualizados durante o treinamento, preservando elevados índices de desempenho. Além disso, observou-se que diferentes estratégias de adaptação influenciam diretamente o equilíbrio entre o custo computacional e a qualidade preditiva. Conclui-se que a combinação de modelos multimodais para a compreensão de documentos e de técnicas de ajuste fino eficientes representa uma alternativa viável para aplicações de Processamento Inteligente de Documentos, permitindo a obtenção de resultados competitivos com menor demanda computacional.
