PUBLICIDADE

Agentes de IA que se reprogramam: Google lança RRSI, framework que permite a modelos de linguagem evoluir sozinhos sem tocar nos próprios pesos

29/09/2026
8 visualizações
4 min de leitura
O Google lançou o RRSI, framework que permite a agentes de IA melhorar sozinhos prompts, ferramentas e memória, sem alterar os pesos do modelo, com ganhos em benchmarks nunca vistos.
Imagem principal do post

Google Cloud AI Research, em parceria com as universidades UNC-Chapel Hill, Stanford e Washington University in St. Louis, anunciou o lançamento do RRSI, abreviação de Regularized Recursive Self-Improvement. O framework permite que um agente baseado em modelo de linguagem reescreva a própria camada de operação, alterando prompts, ferramentas, memória, fluxo de controle e sub-agentes, sem modificar os pesos do modelo subjacente. O diferencial está em impor restrições ao próprio loop de melhoria, de forma que os ganhos observados nos benchmarks usados durante a evolução também se mantenham em tarefas nunca vistas pelo processo de otimização.

A pesquisa nasce de um problema conhecido em sistemas de autoaperfeiçoamento de agentes. Os loops tradicionais de evolução do chamado harness, que é toda a infraestrutura programável ao redor do modelo congelado, propõem edições, avaliam essas edições em um conjunto fixo de tarefas e mantêm a melhor versão. Como as mesmas tarefas são reutilizadas em cada rodada, o loop acaba memorizando padrões específicos desses benchmarks em vez de aprender mecanismos generalizáveis. O estudo identifica três modos de falha recorrentes: ajuste excessivo ao benchmark, perseguição de ruído estatístico e acúmulo descontrolado de complexidade.

O RRSI mantém todos os componentes do harness editáveis, mas regulariza a forma como a busca avança. No lado da proposição, o sistema adota um orçamento de edições com decaimento temporal, ou seja, nas rodadas iniciais permite que um candidato reúna várias modificações coordenadas, enquanto nas rodadas finais restringe a uma única mudança por vez, facilitando a atribuição de crédito. Cada candidato é registrado em um histórico que armazena o componente alterado, a hipótese, o diff aplicado, a variação de pontuação e a variação de custo. O sistema lê esse histórico antes de propor novas edições, evitando reapresentar ideias já falsificadas. Quando o progresso estagna dentro da banda de ruído, o orçamento migra para componentes que ainda não foram explorados.

Imagem complementar

No lado da seleção, um crítico de vazamento rejeita qualquer proposta que contenha nomes de tarefas, entidades, respostas ou lógicas específicas de um benchmark antes da avaliação. Um piso de ruído ajustado exige que os ganhos superem a variância medida no harness base inalterado. Uma regra de custo determina que tokens adicionais de inferência só podem ser consumidos se houver ganho medido suficiente para justificá-los. Por fim, um mecanismo de poda elimina componentes que pararam de produzir ganhos, transformando-os em alvos de exclusão. Os autores enquadram essas restrições como análogas a regularizadores clássicos de aprendizado de máquina: o orçamento de edições corresponde a uma regularização L0, a poda ao Lasso e a regra de custo ao Ridge.

Os resultados foram avaliados em oito benchmarks. No Terminal-Bench 2.1, a pontuação subiu de 74,2% para 80,2% na divisão usada para evolução. Em SWE-bench Verified, que nunca foi usado para seleção, o índice passou de 82,0% para 83,8%. Em tarefas fora da distribuição, o JobBench cresceu 4,7 pontos, o GDPval 3,5 e o APEX-Agents 3,7. Em EngDesign, na divisão evolve, o ganho foi de 4,9 pontos; no Frontier-Eng, foram 4,3 pontos em medalhas. No Harvey LAB, a divisão evolve subiu 1,1 ponto e a divisão reservada subiu 2,3 pontos. Todos os seis conjuntos reservados melhoraram. Com o Gemini 3.5 Flash como modelo de política, o Terminal-Bench 2.1 saltou de 64,6 para 78,7, enquanto o SWE-bench Verified subiu de 76,8 para 79,0.

PUBLICIDADE

O framework também produziu um sistema mais leve. Na instância de workspace agêntico, o RRSI utilizou 2,42 milhões de tokens de política por tentativa, contra 3,80 milhões da evolução não regularizada, uma redução que o resumo do artigo aponta em torno de 30% e a página do projeto situa em 36%. Em comparação com outros métodos de evolução de harness, como Meta-Harness, AHE, THE, HarnessX e Core, o RRSI registrou o menor ganho na pontuação evolve do Harvey LAB, mas foi o único a apresentar média fora da distribuição mais de um ponto acima da linha de base H0.

O código está disponível sob licença Apache 2.0 no repositório oficial, requer Python 3.10 ou superior e aceita qualquer string de modelo compatível com LiteLLM, com o Claude Opus 4.8 no Vertex AI como configuração padrão. Embora o framework seja descrito como implantável, a natureza do lançamento é de pesquisa, sem caracterização como produto oficial do Google. A proposta central dos autores é que a evolução regularizada do harness representa um caminho para que agentes baseados em modelos fechados, acessados apenas por API, possam ser aprimorados de maneira consistente, abrindo espaço para ajustes generalizáveis sem necessidade de acesso aos pesos do modelo.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE