Laboratório de IA escala workloads com arquitetura multi-cluster na AWS
Laboratório de IA escala workloads com arquitetura multi-cluster na AWS
A escassez global de capacidade computacional virou um dos maiores gargalos do mercado de Inteligência Artificial. Não falta demanda por treinamento e inferência. O que falta é GPU disponível, na região certa, na hora em que o time precisa rodar o próximo experimento. Para um laboratório de IA, isso não fica restrito à infraestrutura: define o ritmo da pesquisa e o time-to-market do produto.
Foi esse o desafio trazido à DNX Brasil pelo cliente atendido neste projeto. Neste artigo, apresentamos a arquitetura multi-cluster desenhada na AWS para transformar disponibilidade de GPU em um problema resolvido por software.
Sobre o cliente atendido pela DNX Brasil
O cliente é um laboratório brasileiro de Inteligência Artificial especializado no desenvolvimento de Pequenos Modelos de Linguagem Especializados (SSLMs). A empresa cria soluções de IA sob medida, éticas e energeticamente eficientes, reduzindo em até 50 vezes os custos e o consumo de energia em relação aos grandes modelos de linguagem.
Impulsionada pelo crescimento de sua operação global, a empresa precisava de uma infraestrutura capaz de escalar seus workloads de IA com alta disponibilidade, flexibilidade e acesso contínuo aos recursos computacionais necessários. Para isso, decidiu migrar seu ambiente para a AWS e escolheu a DNX Brasil como parceira estratégica.
Desafio do cliente
No provedor anterior, a empresa enfrentava limitações para provisionar continuamente instâncias com GPUs de altíssimo desempenho. Quando a capacidade não estava disponível na região em uso, o workload simplesmente esperava, e essa espera ia se acumulando.
Para garantir escala e flexibilidade, o cliente precisava também de uma arquitetura multi-cluster capaz de orquestrar dinamicamente seus workloads e direcioná-los automaticamente para diferentes regiões geográficas, aproveitando a disponibilidade de recursos onde quer que ela estivesse.
O impacto de não resolver isso seria direto sobre o ritmo de pesquisa e desenvolvimento. A restrição no acesso rápido a poder de processamento geraria atrasos no cronograma e no treinamento contínuo dos modelos, afetando o time-to-market e a capacidade de escalar as operações.
A solução: um pool inteligente de processamento entre regiões
A solução implementada foi a migração para uma arquitetura cloud-native multi-região na AWS, baseada no AWS Well-Architected Framework. O ambiente foi construído sobre o Amazon EKS, com um cluster principal e clusters satélites em outras regiões, interligados via rede. O objetivo foi criar um pool inteligente de processamento capaz de distribuir dinamicamente os workloads de IA entre regiões, mitigando a indisponibilidade de instâncias especializadas do Amazon EC2.
O principal diferencial da arquitetura está na integração entre Karmada, Karpenter e KEDA, que forma um mecanismo de escalabilidade orientado a eventos. O KEDA monitora uma fila do Amazon SQS e aciona os workloads, o Karmada decide em qual cluster a carga será executada e o Karpenter provisiona automaticamente a infraestrutura necessária na região escolhida. Todo o ambiente é gerenciado como código e operado por GitOps com um ArgoCD centralizado.
Para eliminar o problema de indisponibilidade regional de GPUs, foi desenvolvido um mecanismo de failover automático baseado em tempo. Um health check customizado monitora o provisionamento realizado pelo Karpenter e, caso o hardware não seja disponibilizado dentro do tempo configurado, o Karmada remove o deployment do cluster indisponível e reorquestra a carga para outra região com capacidade livre. Na prática, a arquitetura passou a resolver sozinha o que antes virava incidente.
Completam o desenho o Amazon ECR, que gerencia as imagens de contêineres, e o Amazon FSx, integrado via driver CSI, que fornece armazenamento de alta performance e reduz o tempo de inicialização dos modelos de IA.
Resultados e benefícios
Gargalo de GPU eliminado. Com a topologia entre regiões e o failover por tempo, a infraestrutura passou a buscar capacidade computacional de forma dinâmica, garantindo o treinamento contínuo dos modelos. [VALIDAR: disponibilidade alcançada e tempo configurado de failover]
Acesso a dados mais rápido. A nova camada de armazenamento com Amazon EFS e Amazon FSx resolveu os gargalos de leitura e transferência de grandes datasets e reduziu o tempo de inicialização dos modelos. [VALIDAR: tempo de inicialização antes e depois]
Custos sob controle. A orquestração elástica desliga automaticamente as instâncias de GPU ao término do processamento, pagando apenas pelo que é efetivamente usado. [VALIDAR: redução percentual de custo de infraestrutura]
Mais velocidade para o negócio. Com infraestrutura como código e deploy via ArgoCD, a equipe de engenharia reduziu esforço operacional e ganhou previsibilidade nas entregas. [VALIDAR: horas economizadas por mês e impacto em time-to-market]
Gestão centralizada. Todos os clusters geográficos são administrados a partir de um painel único, com Headlamp e ArgoCD.
Segurança e isolamento. A comunicação de rede entre clusters é transparente, roteada e criptografada com o service mesh Linkerd. Os workloads podem ser executados diretamente nas contas dos clientes finais sem expor código-fonte ou arquitetura interna, protegendo a propriedade intelectual da empresa.
Prontidão para disaster recovery. A estrutura já nasce com políticas preparadas para redundância geográfica e cenários de alta disponibilidade ativo-ativo.
Menos dependência de provedor. O uso de ferramentas agnósticas como o Karmada reduz o risco de vendor lock-in e mantém a arquitetura portável.
Uma base para crescer globalmente
A migração para a AWS conduzida pela DNX Brasil resolveu o gargalo crítico de provisionamento de GPUs de alta performance e consolidou uma arquitetura multi-cluster resiliente. Com essa base, a empresa passa a ter a estabilidade e a eficiência operacional necessárias para sustentar o crescimento global, além da agilidade para seguir treinando e evoluindo seus Pequenos Modelos de Linguagem Especializados.
Há também um ganho que acompanha o posicionamento do negócio: por consumirem até 50 vezes menos energia que as alternativas tradicionais, os modelos operam agora sobre uma infraestrutura igualmente eficiente, que provisiona recursos apenas pelo tempo necessário.
A DNX Brasil pode fazer o mesmo pela sua empresa
Se a sua empresa de Inteligência Artificial precisa escalar operações com eficiência e superar desafios de infraestrutura em nuvem, a DNX Brasil pode desenhar e executar essa arquitetura com você. Assim como resolvemos gargalos complexos com arquiteturas resilientes na AWS, podemos construir uma solução sob medida para o seu contexto.
Fale com os nossos especialistas e descubra como transformar seus desafios de infraestrutura em vantagem competitiva.



