PUBLICIDADE

GRPO encontra LoRA: Hugging Face torna o treinamento por reforço assíncrono acessível até em hardwares modestos

14/09/2026
68 visualizações
3 min de leitura
Imagem principal do post

Treinamento assíncrono com LoRA amplia uso de GRPO em modelos de linguagem na Hugging Face

A Hugging Face publicou em seu blog um novo conteúdo sobre treinamento de modelos de linguagem por reforço, apresentando a combinação entre o treinador assíncrono GRPO e a técnica LoRA, executados por meio da infraestrutura HF Jobs. O material integra as novidades da biblioteca TRL, voltada ao pós-treinamento de modelos fundamentais e usada pela comunidade para técnicas como ajuste fino supervisionado, GRPO e otimização direta de preferências.

O GRPO, abreviação de Group Relative Policy Optimization, é um algoritmo de aprendizado por reforço aplicado a modelos de linguagem. A abordagem se mostrou mais eficiente em termos de memória do que o tradicional PPO, que é a otimização de política proximal. O GRPO foi utilizado no treinamento do modelo R1 da Deepseek AI e tem se consolidado como alternativa para tarefas verificáveis, como resolução de problemas matemáticos, geração de código e qualquer atividade com critério programático de sucesso.

Imagem complementar

Na prática, o algoritmo funciona fazendo o modelo gerar respostas, recebendo recompensas com base na correção dessas respostas e aprendendo a partir dos resultados. Esse fluxo se mostrou mais complexo do que técnicas como SFT, que é o ajuste fino supervisionado, ou DPO, a otimização direta de preferências, mas segue uma configuração semelhante segundo a documentação da biblioteca TRL.

A novidade destacada pela publicação é a união do GRPO com LoRA, que significa Low-Rank Adaptation. A técnica LoRA treina pequenas matrizes adaptadoras em vez de atualizar todos os pesos do modelo, o que reduz drasticamente o consumo de memória do otimizador e dos gradientes. Isso torna possível ajustar modelos grandes em hardwares mais modestos. Para modelos de porte médio, entre 3 e 7 bilhões de parâmetros, o uso de LoRA viabiliza o treinamento em hardwares como a10g-large e a100-large, nos quais o ajuste fino completo não caberia na memória disponível.

PUBLICIDADE

O terceiro elemento central do anúncio é o HF Jobs, sistema de execução assíncrona de tarefas da própria Hugging Face. Com ele, os treinamentos rodam de forma assíncrona, permitindo que o usuário feche o terminal e retorne mais tarde para conferir o andamento. A integração também inclui suporte ao Trackio, ferramenta que acompanha em tempo real a queda das métricas de perda durante o treinamento.

A biblioteca TRL é construída sobre o ecossistema Transformers e suporta diversas arquiteturas e modalidades, podendo ser escalada em diferentes configurações de hardware. Além das técnicas citadas, oferece outros treinadores como DPOTrainer e KTOTrainer. O conteúdo apresentado no blog reforça que a infraestrutura de aprendizado por reforço assíncrono não deve ser construída como um sistema exclusivo para GRPO, já que o pipeline de geração, pontuação e treinamento é um padrão geral que abrange outras abordagens, como destilação on-policy e auto-destilação.

A escolha pelo LoRA via biblioteca PEFT é descrita como a opção mais comum em diferentes frameworks de código aberto voltados ao treinamento por reforço assíncrono, devido ao formato padronizado de checkpoint, nomeado adapter_model.safetensors, compatível com qualquer loop de treinamento da Hugging Face Transformers. A publicação também destaca que, no entanto, interações com ZeRO-3 exigem cuidados específicos, como desativação do cabeçalho LM fundido em alguns frameworks ou do gradient checkpointing em outros.

A abordagem assíncrona resolve um gargalo comum no treinamento por reforço, que é a criação de paradas no pipeline. Em tarefas agênticas com uso de ferramentas em múltiplos turnos, cada rollout pode levar minutos. Sem um mecanismo para lidar com rollouts em andamento durante a atualização dos pesos, essas janelas síncronas se transformam em travões do pipeline. O suporte a rollouts parciais para cargas agênticas aparece como uma das estratégias apontadas pelo conteúdo para mitigar esse problema.

O anúncio integra um esforço mais amplo da Hugging Face em apoiar treinamento por reforço assíncrono em modelos de código aberto. A publicação original conclui mencionando que múltiplas bibliotecas do ecossistema, como SLIME, MILES, PRIME-RL, AReaL e NeMo-RL, já oferecem suporte tanto ao GRPO quanto à destilação on-policy, justamente porque tratam a fase de recompensa e pontuação como um componente substituível dentro de uma estrutura assíncrona.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE