PUBLICIDADE

MetaRoCE: A Aposta da Meta para Derrubar o Gargalo de Rede que Trava Clusters de IA com Milhares de GPUs

25/08/2026
100 visualizações
4 min de leitura
Imagem principal do post

Meta apresenta MetaRoCE, novo protocolo de transporte RDMA voltado para redes Ethernet em escala de IA

A Meta apresentou nesta semana o MetaRoCE, um protocolo de transporte RDMA —sigla para Acesso Direto Remoto à Memória, tecnologia que permite a transferência de dados entre a memória de diferentes servidores sem sobrecarregar o processador central— projetado do zero para cargas de trabalho de inteligência artificial operando sobre redes Ethernet convencionais. A iniciativa marca uma mudança de paradigma na forma como a empresa trata a infraestrutura de rede para treinamento e inferência de modelos de IA em larga escala.

Treinar e servir modelos de fronteira já é tão um problema de rede quanto de capacidade de processamento. Operações coletivas como all-reduce e all-to-all, que sincronizam milhares de aceleradores durante o treinamento, são limitadas pela transferência mais lenta — e qualquer atrito na rede pode deixar capacidade de computação ociosa. O MetaRoCE surge como resposta direta a esse gargalo, especialmente em clusters que já chegam a centenas de milhares de GPUs distribuídos em múltiplos data centers.

Imagem complementar

O protocolo rompe com a premissa central do RoCE tradicional, que é o padrão consolidado para RDMA sobre Ethernet. Enquanto o RoCE convencional espera que a rede entregue cada quadro em ordem e depende de mecanismos como o PFC — controle de fluxo por prioridade que pausa o envio quando há congestionamento —, o novo protocolo trata a malha de rede como inerentemente sujeita a perdas e desloca a inteligência para a placa de rede (NIC). Decisões sobre ordenação de pacotes, seleção de caminho e recuperação de erros passam a ser gerenciadas na ponta, não nos switches.

Entre as decisões centrais de design, destaca-se a entrega fora de ordem como comportamento padrão. Os pacotes são distribuídos por múltiplos caminhos e chegam ao destino fora de ordem por construção, com cada pacote carregando seu próprio destino para ser escrito diretamente na memória final. Isso elimina a necessidade de buffers de reordenação e evita o bloqueio conhecido como head-of-line blocking, situação em que um pacote atrasado segura todos os seguintes.

PUBLICIDADE

O multipathing também é nativo no protocolo. Cada caminho utiliza uma porta de origem UDP distinta como entropia para o roteamento ECMP — método que distribui o tráfego entre múltiplos caminhos equivalentes —, permitindo que a NIC redistribua o tráfego sempre que identificar uma rota com problemas. A pilha de rede distribuída é programada em bibliotecas como DPDK, conjunto de ferramentas que acelera o processamento de pacotes em sistemas Linux comuns.

A tolerância a perdas substitui a busca por perfeição na entrega. Sem quadros de pausa, qualquer lacuna no vetor de confirmação seletiva de 256 bits é tratada como evidência de perda, e não de reordenação, disparando a retransmissão exatamente do pacote faltante, no caminho que o perdeu. O controle de congestionamento opera dos dois lados: do remetente, com base em marcações ECN — sinalizadores que indicam congestionamento sem descartar pacotes — usando algoritmo AIMD, que ajusta a taxa de envio de forma aditiva quando há espaço e multiplicativa quando não há; do receptor, com dicas de taxa justa compartilhada que permitem acelerar a convergência para a velocidade ideal. Incasts, situação em que muitos remetentes enviam dados a um único destinatário ao mesmo tempo, são resolvidos em um ou dois ciclos de ida e volta.

O protocolo exige dos switches apenas duas funcionalidades já amplamente disponíveis: marcação ECN e roteamento ECMP. Não requer recorte de pacotes, telemetria interna à rede, controle de fluxo por créditos ou distribuição no switch. Isso permite que o mesmo transporte opere sobre diferentes topologias, incluindo fabrics de nuvens de fornecedores cujo detalhamento de configuração o cliente não controla. A Meta também reduziu a explosão de estado de conexão ao separar ordenação e largura de banda: uma única conexão transporta múltiplos fluxos ordenados acima e múltiplos caminhos abaixo, sob um único controlador de congestionamento.

Nos testes realizados em um cluster com 64 nós equipados com GPUs AMD e placas de rede programáveis Pensando, comparando diretamente MetaRoCE com RoCEv2 em operações all-reduce e all-to-all, o novo protocolo entregou maior vazão e menor tempo de conclusão de fluxo. O resultado central de resiliência mostra que o MetaRoCE mantém cerca de 86% de vazão sob 1% de perda de pacotes e continua entregando largura de banda utilizável mesmo a 10% de perda, com degradação suave em vez de colapso. A validação em topologias multiplane com 4 e 8 planos e até 4 mil conexões simultâneas confirmou que a vazão escala linearmente com o número de planos.

A Meta pretende disponibilizar o MetaRoCE como especificação completa por meio do Open Compute Project, acompanhado de uma suíte de conformidade que permite a fornecedores validarem suas implementações e da biblioteca libsoftmetaroce, modelo comportamental usado como referência para desenvolvimento em silício. A entrega está prevista para o OCP Global Summit, em outubro de 2026. A implementação inicial foi comprovada em hardware da AMD Pensando, com outras implementações em andamento por parte de fornecedores adicionais. Por ora, a decisão envolve a arquitetura da malha de rede, não a aquisição imediata de equipamentos.

PUBLICIDADE
Este post foi útil para você?
🖥️
Quer ter o seu próprio servidor?

Para rodar sites, automações ou IA do seu jeito, uma VPS resolve. Este blog roda numa VPS da Hostinger, e pelo link abaixo você ganha desconto na contratação.

Ver planos de VPS da Hostinger →
Link de indicação: o blog recebe uma comissão, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE