PUBLICIDADE

SoL-Pi: NVIDIA, NTU e MIT cortam quase metade do tráfego de tokens em agentes de codificação sem perder desempenho

22/09/2026
38 visualizações
4 min de leitura
Imagem principal do post

NVIDIA, NTU e MIT lançam SoL-Pi, conjunto de mecanismos que reduz tráfego de tokens em agentes de codificação

Pesquisadores da NVIDIA, em parceria com a Universidade Tecnológica de Nanyang e o MIT, divulgaram o SoL-Pi, um conjunto de quatro mecanismos de eficiência projetados para o agente de codificação de código aberto Pi. A proposta surgiu de ciclos automatizados de pesquisa conduzidos por uma inteligência artificial na camada de harness, o componente intermediário que gerencia chamadas de ferramentas, contexto, observações e delegações de um agente.

O trabalho parte de uma constatação simples: agentes de codificação atuais funcionam por horas, e cada edição, execução de teste ou leitura de log alimenta o contexto do modelo. Isso gera um volume elevado de tokens processados. Os pesquisadores buscaram reduzir justamente essa quantidade, em vez de apenas otimizar kernels, quantização ou o preço por token.

Imagem complementar

No benchmark EdgeBench, composto por 51 tarefas, o SoL-Pi reduziu o tráfego de tokens registrados entre 44,7% e 49,0% em comparação ao Pi original, com queda aproximada de 33% no custo de API. Os escores de desempenho permaneceram próximos aos do Pi tanto no modelo GPT-5.6 Sol quanto no Opus 5.

A descoberta dos quatro mecanismos não foi feita manualmente. Um agente de pesquisa observou rastros de execução de uma versão base do Pi e propôs alterações no harness, testando cada uma delas. O escopo da busca foi amplo: 152 direções propostas, distribuídas em seis famílias — contexto, progresso, ferramentas, delegação, prompt e política, além de melhoria e verificação. Ao todo, foram utilizados 535 ambientes executáveis, sendo 495 construídos a partir de pares de issues e pull requests do GitHub e 40 tarefas sintéticas com verificadores executáveis. A busca envolveu mais de 3 mil execuções e mais de 60 mil interações entre agente e ambiente.

PUBLICIDADE

Cada ciclo de busca funcionou de forma isolada, com regras de aceitação fixadas antes do início e que não podiam ser alteradas pelo otimizador. Toda métrica de capacidade precisava permanecer dentro de uma tolerância pré-declarada, e o candidato só era aceito se melhorasse pelo menos uma métrica de eficiência. O EdgeBench foi mantido fora da busca, com 11 tarefas usadas para aceitação unidirecional de candidatos congelados e 40 para avaliação final.

Os quatro mecanismos que sobreviveram ao processo foram batizados de Action Fusion, Online Context Compact, ObservationPack e Evidence-Preserving Reducer. O Action Fusion combina em uma única solicitação a edição de um arquivo e o comando subsequente de teste ou execução, devolvendo os dois resultados em uma observação só, o que elimina uma rodada extra de comunicação. O Online Context Compact acompanha o progresso do plano e estima quantas requisições ainda restam, acionando a compactação nativa do Pi quando a economia projetada compensa o custo de reescrever o cache de prompt.

Já o ObservationPack armazena localmente as saídas de ferramentas maiores que 10 KiB e as envia completas nas duas primeiras requisições seguintes ao provedor, exibindo ao modelo apenas um identificador estável, o tamanho original e um pequeno trecho das linhas iniciais e finais. O Evidence-Preserving Reducer envia logs de build e teste com pelo menos 4 KiB a um modelo mais barato, o GPT-5.6 Luna em modo high, que produz um recibo compacto. Um verificador determinístico confere o esquema, o hash da fonte, o status de saída, citações exatas e o tamanho. O sistema retorna ao log original caso a validação não seja bem-sucedida, haja suspeita de credenciais ou o recibo não seja menor que o original.

Nos testes, o SoL-Pi preservou 94,3% do escore do Pi no Opus 5, com queda de 44,7% no tráfego de tokens e 33,5% no custo de API. No GPT-5.6 Sol, manteve 93,7% do escore, com redução de 49,0% nos tokens e 33,2% no custo. A configuração de melhor desempenho em cada backend usou apenas o mecanismo mais eficaz: ObservationPack no GPT-5.6 Sol e Action Fusion no Opus 5, elevando os escores em 5,3% e 12,8% acima do Pi, respectivamente.

Além do EdgeBench, os pesquisadores testaram o sistema em outras avaliações. No Terminal-Bench 4, com 63 tarefas apenas de CPU, o SoL-Pi resolveu 15 tarefas, contra 18 do Codex e do Pi, mas reduziu o custo total em 26,3% na comparação com o Pi. Na IMO 2026, com verificação em Lean 4, o SoL-Pi passou em três dos seis problemas, igualando o Pi com o menor custo por problema resolvido. O Codex passou em cinco.

A versão disponível é uma extensão do Pi sob licença MIT, publicada no GitHub sob o nome NVlabs e compatível com o Pi 0.85.1 e Node.js 22.19 ou superior, sem necessidade de alterar a instalação original. Os próprios pesquisadores classificam a transferência entre modelos como preliminar, já que os mecanismos foram ativados com menos frequência no Opus 5, possivelmente porque a busca utilizou apenas trajetórias do GPT-5.6 Sol.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE