COMPUTAÇÃO DE ALTO DESEMPENHO RESISTENTE A FALHA EM AMBIENTE DE NUVEM
Resumo
O crescimento exponencial da demanda por recursos computacionais nas últimas três décadas, impulsionado especialmente pela inteligência artificial, tem tornado crítica a necessidade de otimização em ambientes de computação de alto desempenho (HPC). Este trabalho analisa a eficiência de mecanismos de tolerância a falhas em aplicações HPC executadas em instâncias spot de provedores de nuvem, com foco na biblioteca DeLIA (Dependability Library for Iterative Applications). O estudo propõe uma transição do paradigma de polling, atualmente implementado no DeLIA, para uma arquitetura baseada em publish-subscribe para detecção de eventos de terminação de instâncias. A abordagem atual utiliza consultas periódicas a cada 5 segundos aos metadados da instância, gerando aproximadamente 8.640 requisições HTTP desnecessárias em uma execução de 12 horas. A solução proposta implementa um endpoint HTTP que recebe notificações proativas dos provedores de nuvem através de seus gerenciadores de eventos (AWS EventBridge, Azure Event Grid, Google Cloud Pub/Sub), eliminando consultas redundantes e reduzindo significativamente o overhead computacional. A arquitetura event-driven mantém compatibilidade com múltiplos provedores de nuvem através de uma interface agnóstica baseada em requisições POST. Os resultados esperados incluem maior eficiência no uso de recursos, menor latência de resposta na detecção de terminações e melhor escalabilidade para aplicações HPC em ambientes de nuvem, contribuindo para o desenvolvimento de sistemas mais sustentáveis e economicamente viáveis.