O blog da AWS
Como a UFSC reduz custos de HPC com instâncias Spot e tolerância a falhas na AWS
Por Márcio Bastos Castro, Departamento de Informática e Estatística, UFSC; Marcelo Ferreira Baptista, Solutions Architect no time de AWS e Matheus Oliveira, arquiteto de soluções na AWS.
Vídeo do projeto: YouTube — Márcio Bastos Castro / UFSC
Clusters de Computação de Alto Desempenho (High Performance Computing – HPC) são fundamentais para resolver problemas complexos em ciência, engenharia e negócios — desde simulações de dinâmica de fluidos na indústria de óleo e gás até modelos de previsão do tempo e treinamento de redes neurais. No entanto, manter essa infraestrutura on-premises representa custos expressivos: o cluster Pegaso da Petrobras, por exemplo, com cerca de 33.000 cores e desempenho na ordem de 40 petaflops, custou aproximadamente 300 milhões de dólares, com um consumo de energia estimado em 540 mil reais por mês apenas para manter a máquina em funcionamento.
O projeto “Sustainable HPC on AWS”, coordenado pelo Professor Márcio Bastos Castro na Universidade Federal de Santa Catarina (UFSC), com apoio da AWS e do CNPq (Conselho Nacional de Desenvolvimento Científico e Tecnológico), investiga como tornar a execução de aplicações de HPC na nuvem mais sustentáveis — usando os recursos computacionais apenas quando necessários, pelo menor custo possível, sem sacrificar o desempenho de forma significativa.
Neste post, apresentamos as ferramentas e técnicas desenvolvidas, incluindo o uso de instâncias Amazon EC2 Spot com mecanismos de tolerância a falhas, e como elas permitem reduzir significativamente o custo financeiro de experimentos científicos computacionais.
O desafio
A Computação de Alto Desempenho tradicional enfrenta múltiplos desafios de sustentabilidade:
- Custo de aquisição: supercomputadores custam dezenas a centenas de milhões de dólares;
- Custo de energia: supercomputadores exigem uma infraestrutura elétrica equivalente à de uma pequena planta industrial, e em muitos casos isso inclui subestação própria ou dedicada, gerando altos custos de energia elétrica;
- Custo de pessoal: equipes especializadas são necessárias para manutenção de hardware, software e suporte a usuários;
- Subutilização: clusters on-premises frequentemente ficam ociosos entre experimentos, consumindo energia e recursos mesmo quando não estão processando trabalhos úteis;
- Barreira de acesso: grupos de pesquisa com recursos limitados não conseguem adquirir ou manter clusters locais para experimentos de larga escala.
Por outro lado, a nuvem AWS oferece semelhanças estruturais com ambientes de HPC — servidores em clusters, GPUs, redes de alta velocidade, opções de armazenamento — mas com modelos de pagamento por uso e a possibilidade de instâncias Spot com descontos de até 90% em relação ao preço on-demand.
A pergunta central do projeto é: como executar aplicações de HPC na AWS de forma sustentável, usando instâncias Spot de baixo custo, quando essas instâncias podem ser interrompidas a qualquer momento pelo provedor?
A solução
O projeto desenvolveu uma abordagem completa para HPC sustentável na nuvem, com três pilares.
Ferramenta de gerenciamento de clusters temporários (HPC@Cloud)
A equipe criou uma ferramenta open-source, agnóstica de nuvem, mas com suporte otimizado para AWS denominada HPC@Cloud. A ferramenta permite:
- Criar clusters temporários: provisionar um cluster de instâncias EC2 (incluindo Spot) sob demanda, com a configuração adequada para a carga de trabalho específica;
- Executar aplicações de HPC: submeter e monitorar execuções de simulações científicas;
- Desalocar o cluster: ao término da execução, destruir a infraestrutura completamente, cessando todos os custos;
- Integração com API da AWS: receber notificações de interrupção de instâncias Spot (a AWS avisa com 2 minutos de antecedência) e acionar mecanismos de tolerância a falhas automaticamente.
A ferramenta está disponível no repositório público do Laboratório de Pesquisa em Sistemas Distribuídos (LaPeSD) da UFSC.
Mecanismos de tolerância a falhas para instâncias Spot
Aplicações de HPC são stateful. Diferentemente de serviços web stateless que podem simplesmente reiniciar, uma aplicação de HPC que é interrompida perde todo o progresso se não houver mecanismo de salvaguarda. O projeto revisitou mecanismos clássicos de checkpoint e os adaptou para o contexto de instâncias Spot na nuvem:
- Checkpoint periódico: a aplicação salva seu estado em intervalos regulares. Se uma instância Spot é interrompida, a execução é retomada a partir do último checkpoint;
- Checkpoint oportunístico: ao receber a notificação de interrupção da AWS (2 minutos de antecedência), a ferramenta aciona um checkpoint imediato, minimizando a perda de trabalho;
- Checkpoint em memória vs. em disco: a equipe avaliou ambas as estratégias — checkpoint em memória é mais rápido mas volátil; checkpoint em disco (Amazon S3 ou Amazon EBS) é mais lento mas persistente;
- Bibliotecas transparentes vs. intrusivas: algumas bibliotecas de checkpoint não requerem alterações no código da aplicação (transparentes), enquanto outras exigem instrumentação (intrusivas). O projeto avaliou o trade-off entre facilidade de uso e eficiência.
Provisionamento dinâmico e inteligente de instâncias
A equipe desenvolveu técnicas de seleção inteligente de instâncias, utilizando modelos de inteligência artificial para recomendar a melhor combinação de tipos de instância para cada carga de trabalho de HPC:
- Análise de carga de trabalho: caracterização das necessidades computacionais da aplicação (CPU-bound, memory-bound, communication-bound);
- Seleção de instâncias: recomendação das instâncias que oferecem o melhor equilíbrio entre desempenho e custo;
- Escalabilidade inteligente: estratégias que permitem aumentar o número de instâncias sem aumentar proporcionalmente o custo total.
Arquitetura da solução

Figura 1 — Arquitetura do projeto HPC Sustentável com Spot Instances (ferramenta HPC@Cloud)
O fluxo completo da solução segue as etapas abaixo:
- Definição da carga de trabalho: o pesquisador especifica a aplicação de HPC a ser executada e seus requisitos computacionais;
- Seleção de instâncias (IA): um modelo de inteligência artificial analisa a carga de trabalho e recomenda a configuração ótima de instâncias EC2 (tipo, quantidade, Spot vs. On-Demand);
- Provisionamento (ferramenta HPC@Cloud): a ferramenta cria o cluster temporário na AWS, configurando rede, armazenamento e as instâncias selecionadas;
- Execução com tolerância a falhas: a aplicação de HPC executa no cluster, com checkpoints periódicos e oportunísticos habilitados. A ferramenta monitora notificações de interrupção via API da AWS;
- Interrupção de Spot (se ocorrer): a AWS notifica com 2 minutos de antecedência. A ferramenta aciona checkpoint imediato, provisiona nova instância Spot e retoma a execução a partir do último checkpoint;
- Desalocação: ao término da execução, o cluster é completamente destruído, cessando todos os custos.
Detalhamento técnico
Resultados experimentais: simulações N-Body
Nos experimentos com simulações de N-Body (simulação gravitacional de corpos), a pesquisa demonstrou que uma boa escolha de infraestrutura é crucial: a configuração certa pode ter uma pequena perda de desempenho em relação a instâncias mais caras, mas com redução significativa no custo total. Mesmo aumentando a quantidade de instâncias, estratégias inteligentes de alocação mantêm o custo controlado enquanto reduzem o tempo de execução.
Resultados experimentais: método Lattice Boltzmann
Para a aplicação do método Lattice Boltzmann (simulação de dinâmica de fluidos), instâncias Spot com tolerância a falhas resultam em tempo de execução ligeiramente maior do que instâncias on-demand, porém o custo total é substancialmente menor, tornando a execução economicamente viável para grupos de pesquisa com orçamento limitado.
Resultados experimentais: aplicações de álgebra linear (runtime StarPU)
Em colaboração com a Universidade de Bordeaux (França), a equipe avaliou o runtime StarPU — um ambiente de execução de HPC focado em tarefas paralelas — no contexto da nuvem. O estudo identificou as fraquezas e pontos de melhoria do runtime para adaptação à nuvem, servindo como base para otimizações futuras que são tema de uma tese de doutorado em cotutela entre UFSC e Bordeaux.
Serviços AWS utilizados
Amazon EC2 — On-Demand é o serviço central do projeto, fornecendo instâncias computacionais para a criação de clusters temporários de HPC. As instâncias da família hpc (como hpc6a e hpc7g) são otimizadas para cargas de trabalho de HPC, com processadores de alto desempenho e redes de alta velocidade (Elastic Fabric Adapter).
Amazon EC2 Spot Instances oferecem capacidade computacional da AWS com descontos de até 90%, mas podem ser interrompidas com 2 minutos de aviso prévio — exatamente o cenário que os mecanismos de tolerância a falhas do projeto foram projetados para endereçar.
Amazon S3 foi utilizado para armazenamento persistente de checkpoints de aplicações de HPC. Quando uma instância Spot é interrompida, o checkpoint mais recente salvo no S3 permite retomar a execução sem perda de trabalho.
AWS ParallelCluster é a ferramenta da AWS para criação de clusters de HPC na nuvem. O projeto desenvolveu sua própria ferramenta como protótipo de pesquisa, mas identificou que muitas das contribuições poderiam ser integradas ao ParallelCluster no futuro.
Resultados e impacto
Produção científica e premiações
- 24 artigos publicados em periódicos e conferências nacionais e internacionais;
- Prêmio de melhor dissertação de mestrado no Concurso de Teses e Dissertações do Simpósio em Sistemas Computacionais de Alto Desempenho (SSCAD-CTD) em 2024.
Formação de recursos humanos
| Nível | Concluídos | Em andamento |
| Iniciação Científica | 4 | 1 |
| Trabalho de Conclusão de Curso | 1 | 2 |
| Mestrado | 3 | 5 |
| Doutorado | — | 2 (uma em cotutela com UNB – França) |
Parcerias e colaborações
O projeto foi inicialmente proposto por pesquisadores das instituições UFSC (coordenadora), UFABC e USP. Posteriormente, pesquisadores da FURG, UFSM e a Universidade de Bordeaux (França), esta última originando uma tese de doutorado em cotutela, juntaram-se à equipe proponente do projeto, culminando em novas contribuições de pesquisa importantes.
Impacto em sustentabilidade
O projeto demonstra que é possível executar aplicações de HPC de larga escala com custos significativamente menores do que a abordagem tradicional on-premises, democratizando o acesso à computação de alto desempenho para grupos de pesquisa com recursos limitados. A abordagem de clusters temporários — criar, usar e desalocar — representa um paradigma mais sustentável do que manter infraestrutura on-premises ociosa entre experimentos.
Conclusão
O projeto “Sustainable HPC on AWS” demonstra que a convergência entre Computação de Alto Desempenho e Computação em Nuvem pode transformar a forma como pesquisadores executam experimentos computacionais de larga escala. Ao combinar instâncias Spot de baixo custo com mecanismos inteligentes de tolerância a falhas e provisionamento dinâmico, é possível reduzir substancialmente os custos sem sacrificar o desempenho de forma significativa.
Para grupos de pesquisa sem acesso a supercomputadores, essa abordagem democratiza o acesso à computação de alto desempenho, permitindo experimentos de larga escala com investimento proporcional ao uso real
Links relacionados
- Vídeo do projeto (YouTube)
- Respositório da ferramenta HPC@Cloud
- Amazon EC2
- Amazon EC2 Spot Instances
- Amazon S3
- AWS ParallelCluster
Agradecimentos
O autor agradece a todos os coautores dos trabalhos que fundamentaram e inspiraram as discussões realizadas ao longo da pesquisa: Vanderlei Munhoz, Vinicius Garcia Pinto, João V. F. Lima, Daniel Cordeiro, Emilio Francesquini, Nicolas Vanz, Laércio L. Pilla, Olivier Aumage e Rafael Vargas. As pesquisas desenvolvidas em colaboração com esses autores têm contribuído significativamente para o avanço da adoção de nuvens públicas, em especial da AWS, como plataforma para aplicações de HPC. Suas contribuições científicas, discussões técnicas e parcerias de pesquisa foram essenciais para a construção da visão apresentada neste post.
Publicações
- Vanderlei Munhoz, Vinicius Garcia Pinto, João V. F. Lima, Márcio Castro, Daniel Cordeiro, Emilio Francesquini. Performance and Cost Evaluation of StarPU on AWS: Case Studies With Dense Linear Algebra Kernels and N‐Body Simulations. In: Concurrency and Computation: Practice and Experience (CCPE), 2026. DOI: https://doi.org/10.1002/cpe.70582
- Vanderlei Munhoz, Márcio Castro. Enabling the Execution of HPC Applications on Public Clouds with HPC@Cloud Toolkit. In: Concurrency and Computation: Practice and Experience (CCPE), 2023. DOI: http://dx.doi.org/10.1002/cpe.7976
- Nicolas Vanz, Vanderlei Munhoz, Márcio Castro, Laércio L. Pilla, Olivier Aumage. Task-Based HPC in Public Cloud: Price-Performance Analysis Using StarPU Across Heterogeneous Resources. IEEE International Conference on Cloud Engineering (IC2E). Rennes, France: IEEE, 2025. DOI: https://dx.doi.org/10.1109/IC2E65552.2025.00009
- Rafael Vargas, Vanderlei Munhoz, Márcio Castro. Implementação de Tolerância a Falhas no Método Lattice Boltzmann para Execução Resiliente em Instâncias Efêmeras da AWS. Simpósio em Sistemas Computacionais de Alto Desempenho (SSCAD). Bonito, Brazil: SBC, 2025. DOI: https://doi.org/10.5753/sscad.2025.15722
- Nicolas Vanz, Vanderlei Munhoz, Márcio Castro. Performance Evaluation of N-Body Simulations on AWS with StarPU, OpenMP and MPI Runtime Systems. Simpósio em Sistemas Computacionais de Alto Desempenho (SSCAD). Bonito, Brazil: SBC, 2025. DOI: https://doi.org/10.5753/sscad.2025.15831
Autores
![]() |
Márcio Bastos Castro é professor do Departamento de Informática e Estatística (INE) da Universidade Federal de Santa Catarina (UFSC), com doutorado pela Universidade de Grenoble (França). Bolsista de produtividade em pesquisa do CNPq, atua nas áreas de Computação de Alto Desempenho (HPC), Computação Paralela e Distribuída e Computação em Nuvem. É coordenador do Laboratório de Pesquisa em Sistemas Distribuídos (LaPeSD) da UFSC e ex-coordenador do Programa de Pós-Graduação em Ciência da Computação (PPGCC) da UFSC e da Comissão Especial de Arquitetura de Computadores e Computação de Alto Desempenho (CE-ACPAD) da Sociedade Brasileira de Computação (SBC). |
![]() |
Marcelo Ferreira Baptista é Solutions Architect no time de AWS LATAM. Trabalha com soluções de TI há mais de 30 anos, com experiência em vários seguimentos de mercado e diferentes ambientes tecnológicos. Especialista em DevOps, Computing e HPC, hoje atua como Arquiteto de Soluções, apoiando os clientes nos seus desafios, buscando as melhores soluções para as suas necessidades. |
![]() |
Matheus Oliveira é arquiteto de soluções na AWS, especializado em engajamentos de Inteligência Artificial e Machine Learning. Com formação em Engenharia da Computação auxilia clientes a experimentarem soluções práticas e escaláveis, buscando impacto positivo e transformação por meio de computação em nuvem. |


