Google Cloud AI Research, em parceria com as universidades UNC-Chapel Hill, Stanford e Washington University in St. Louis, anunciou o lançamento do RRSI, abreviação de Regularized Recursive Self-Improvement. O framework permite que um agente baseado em modelo de linguagem reescreva a própria camada de operação, alterando prompts, ferramentas, memória, fluxo de controle e sub-agentes, sem modificar os pesos do modelo subjacente. O diferencial está em impor restrições ao próprio loop de melhoria, de forma que os ganhos observados nos benchmarks usados durante a evolução também se mantenham em tarefas nunca vistas pelo processo de otimização.
A pesquisa nasce de um problema conhecido em sistemas de autoaperfeiçoamento de agentes. Os loops tradicionais de evolução do chamado harness, que é toda a infraestrutura programável ao redor do modelo congelado, propõem edições, avaliam essas edições em um conjunto fixo de tarefas e mantêm a melhor versão. Como as mesmas tarefas são reutilizadas em cada rodada, o loop acaba memorizando padrões específicos desses benchmarks em vez de aprender mecanismos generalizáveis. O estudo identifica três modos de falha recorrentes: ajuste excessivo ao benchmark, perseguição de ruído estatístico e acúmulo descontrolado de complexidade.
O RRSI mantém todos os componentes do harness editáveis, mas regulariza a forma como a busca avança. No lado da proposição, o sistema adota um orçamento de edições com decaimento temporal, ou seja, nas rodadas iniciais permite que um candidato reúna várias modificações coordenadas, enquanto nas rodadas finais restringe a uma única mudança por vez, facilitando a atribuição de crédito. Cada candidato é registrado em um histórico que armazena o componente alterado, a hipótese, o diff aplicado, a variação de pontuação e a variação de custo. O sistema lê esse histórico antes de propor novas edições, evitando reapresentar ideias já falsificadas. Quando o progresso estagna dentro da banda de ruído, o orçamento migra para componentes que ainda não foram explorados.
No lado da seleção, um crítico de vazamento rejeita qualquer proposta que contenha nomes de tarefas, entidades, respostas ou lógicas específicas de um benchmark antes da avaliação. Um piso de ruído ajustado exige que os ganhos superem a variância medida no harness base inalterado. Uma regra de custo determina que tokens adicionais de inferência só podem ser consumidos se houver ganho medido suficiente para justificá-los. Por fim, um mecanismo de poda elimina componentes que pararam de produzir ganhos, transformando-os em alvos de exclusão. Os autores enquadram essas restrições como análogas a regularizadores clássicos de aprendizado de máquina: o orçamento de edições corresponde a uma regularização L0, a poda ao Lasso e a regra de custo ao Ridge.
Os resultados foram avaliados em oito benchmarks. No Terminal-Bench 2.1, a pontuação subiu de 74,2% para 80,2% na divisão usada para evolução. Em SWE-bench Verified, que nunca foi usado para seleção, o índice passou de 82,0% para 83,8%. Em tarefas fora da distribuição, o JobBench cresceu 4,7 pontos, o GDPval 3,5 e o APEX-Agents 3,7. Em EngDesign, na divisão evolve, o ganho foi de 4,9 pontos; no Frontier-Eng, foram 4,3 pontos em medalhas. No Harvey LAB, a divisão evolve subiu 1,1 ponto e a divisão reservada subiu 2,3 pontos. Todos os seis conjuntos reservados melhoraram. Com o Gemini 3.5 Flash como modelo de política, o Terminal-Bench 2.1 saltou de 64,6 para 78,7, enquanto o SWE-bench Verified subiu de 76,8 para 79,0.
O framework também produziu um sistema mais leve. Na instância de workspace agêntico, o RRSI utilizou 2,42 milhões de tokens de política por tentativa, contra 3,80 milhões da evolução não regularizada, uma redução que o resumo do artigo aponta em torno de 30% e a página do projeto situa em 36%. Em comparação com outros métodos de evolução de harness, como Meta-Harness, AHE, THE, HarnessX e Core, o RRSI registrou o menor ganho na pontuação evolve do Harvey LAB, mas foi o único a apresentar média fora da distribuição mais de um ponto acima da linha de base H0.
O código está disponível sob licença Apache 2.0 no repositório oficial, requer Python 3.10 ou superior e aceita qualquer string de modelo compatível com LiteLLM, com o Claude Opus 4.8 no Vertex AI como configuração padrão. Embora o framework seja descrito como implantável, a natureza do lançamento é de pesquisa, sem caracterização como produto oficial do Google. A proposta central dos autores é que a evolução regularizada do harness representa um caminho para que agentes baseados em modelos fechados, acessados apenas por API, possam ser aprimorados de maneira consistente, abrindo espaço para ajustes generalizáveis sem necessidade de acesso aos pesos do modelo.