NVIDIA apresenta recurso de recuperação quase instantânea para inferência de grandes modelos de linguagem
A NVIDIA anunciou um novo recurso chamado shadow engine recovery, disponível em versão preview dentro da plataforma NVIDIA Dynamo, que promete reduzir de minutos para poucos segundos o tempo necessário para restabelecer a capacidade de inferência de grandes modelos de linguagem após uma falha no processo do motor de execução. A solução foi projetada para ambientes que dependem de operação contínua e que não podem se dar ao luxo de aguardar reinicializações completas a cada incidente.
Em sistemas de inferência de modelos de linguagem de grande porte, cada processo de motor, ou engine, é responsável por executar o modelo sobre as unidades de processamento gráfico. Quando esse processo falha por algum motivo, o caminho tradicional de recuperação envolve uma reinicialização a frio, conhecida como cold restart. Esse procedimento exige carregar novamente os pesos do modelo do armazenamento para a memória de alta largura de banda das GPUs, um tipo de memória extremamente rápida usada para esse tipo de carga computacional. Em seguida, é preciso recompilar os kernels, que são funções executadas diretamente nas GPUs, e reconstruir os grafos CUDA, estruturas que organizam operações paralelas de forma otimizada para o hardware da NVIDIA. Para modelos grandes, essa inicialização pode consumir vários minutos, período durante o qual os demais workers em funcionamento precisam absorver todo o tráfego que seria atendido pelo worker que caiu, comprometendo desempenho e latência.
A proposta do shadow engine recovery é deslocar a maior parte desse trabalho de recuperação para fora do caminho de atendimento às requisições dos usuários. O mecanismo mantém um motor de execução secundário, totalmente inicializado, em estado ocioso nos mesmos GPUs do motor ativo. Esse motor reserva permanece pronto para assumir a operação a qualquer momento, sem precisar passar novamente por todo o processo de inicialização.
O elemento central que viabiliza essa abordagem é o GPU Memory Service, ou GMS, um serviço que aloca e gerencia a memória física das GPUs de forma independente dos processos de motor. Com o GMS, os pesos do modelo podem ser compartilhados entre o motor ativo e o motor reserva sem que haja duplicação na memória de alta largura de banda. Isso significa que ambos os motores acessam os mesmos dados sem a necessidade de carregar uma segunda cópia completa, o que reduz o consumo extra de memória e torna a recuperação praticamente instantânea.
Na prática, quando o processo ativo apresenta falha, o motor reserva assume a operação em questão de segundos. A reinicialização completa do sistema ocorre em segundo plano, totalmente fora do caminho crítico de atendimento, ou seja, sem interferir nas respostas que estão sendo geradas para os usuários finais. Dessa forma, a capacidade de inferência é restaurada de maneira muito mais rápida do que nos processos tradicionais.
É importante destacar que o shadow engine recovery foi projetado para lidar com falhas comuns no processo do motor, mas não cobre falhas de hardware, falhas de nó ou falhas que envolvam múltiplos nós ao mesmo tempo. Esses cenários mais graves ainda dependem dos mecanismos padrão de reagendamento de tarefas. Além disso, o recurso exige o uso do Dynamic Resource Allocation, conhecido como DRA, em ambientes Kubernetes. Para utilizá-lo, o cluster precisa estar rodando Kubernetes na versão 1.34 ou superior, com o DRA habilitado e com o driver NVIDIA GPU DRA instalado.
Outra funcionalidade que pode ser combinada com o shadow engine recovery é o Dynamo Snapshot. Esse recurso pode ser utilizado em conjunto com a recuperação para minimizar a contenção de recursos durante a inicialização do motor reserva enquanto o sistema continua atendendo requisições. A composição das duas ferramentas oferece uma camada adicional de proteção contra quedas de desempenho em momentos críticos.
Com o shadow engine recovery, a NVIDIA busca resolver uma das principais dores de quem opera modelos de linguagem em larga escala: o tempo de indisponibilidade após falhas de processo. Ao eliminar a necessidade de reinicializações completas a cada incidente, a plataforma Dynamo se posiciona como uma opção mais resiliente para ambientes de produção que exigem alta disponibilidade e resposta rápida, sem comprometer a estabilidade do atendimento aos usuários.