Pular para o conteúdo
    Notícia

    Google apresenta RRSI, método para agentes de IA evoluírem sem decorar tarefas

    Pesquisadores revelam o RRSI, framework de código aberto que aprimora ferramentas e instruções de agentes inteligentes sem alterar os pesos do modelo.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    29 de set. de 2026 · 4 min de leitura

    Dois pesquisadores em um escritório contemporâneo observam telas com esquemas de fluxo de dados e diagramas estruturais.
    Pesquisadores analisam novas arquiteturas de sistemas para aprimorar o desempenho de modelos autônomos sem alterar seus pesos base.

    Pesquisadores da divisão Google Cloud AI Research, em parceria com as universidades UNC-Chapel Hill, Stanford e Washington University in St. Louis, apresentaram um método para aperfeiçoar agentes de inteligência artificial de maneira contínua. Batizado de RRSI, sigla em inglês para Autoaprimoramento Recursivo Regularizado, o sistema foi detalhado em um artigo científico da pesquisa (abre em nova aba) divulgado em 21 de setembro de 2026, com documentação pública complementar publicada em 29 de setembro de 2026. A proposta permite que os assistentes melhorem seu próprio funcionamento sem sofrer com a perda de capacidade em tarefas inéditas.

    Na prática da inteligência artificial, um agente é composto por um modelo central que processa linguagem e por uma estrutura de suporte ao seu redor, chamada tecnicamente de harness. Essa estrutura engloba as instruções iniciais dadas ao sistema, o fluxo de controle, a memória, as ferramentas externas e a coordenação de subagentes. Em vez de treinar novamente a rede neural do modelo principal, o que demandaria alterar seus pesos matemáticos internos congelados, o RRSI atua exclusivamente na reformulação dessa estrutura externa. Uma analogia útil é pensar em um profissional experiente: o conhecimento básico em sua mente permanece o mesmo, mas sua mesa de trabalho, seus manuais e suas listas de checagem passam por revisões para deixá-lo mais ágil e certeiro.

    Diagrama técnico minimalista com fundo claro exibindo um núcleo central fixo cercado por blocos modulares externos interligados em tons de azul-petróleo e âmbar, ilustrando a separação entre modelo base e estrutura de suporte.
    Arquitetura modular demonstra como componentes periféricos podem ser refinados de forma independente, mantendo o núcleo de processamento inalterado.

    Quando os agentes tentam reescrever suas próprias ferramentas sem regras estritas, ocorre com frequência o problema do sobreajuste, conhecido no meio técnico como overfitting. Nesse cenário, a inteligência decora os exercícios específicos do teste em que está sendo avaliada. Como consequência, ela obtém notas excelentes no treinamento, mas falha ao lidar com situações novas do dia a dia.

    Para solucionar esse obstáculo, o RRSI introduz mecanismos de regularização, que funcionam como freios e filtros durante as tentativas de evolução. O gerador de mudanças opera sob um orçamento controlado, limitando quantas alterações independentes podem ser agrupadas de uma só vez. Além disso, o sistema consulta todo o histórico de tentativas anteriores para nunca repetir hipóteses já descartadas e redireciona os esforços para recursos que ainda não foram explorados.

    Na etapa de seleção, atua uma função crítica que barra alterações feitas sob medida para agradar apenas ao gabarito do teste avaliado. Existe também um piso de pontuação ajustado para ruídos estatísticos, impedindo que flutuações casuais sejam interpretadas como progresso real. Por fim, uma regra de custo exige que qualquer aumento no consumo de tokens, que são os pedaços de palavras processados pela máquina, compense o gasto por meio de um ganho mensurável de desempenho, enquanto componentes que deixam de ser úteis acabam podados.

    Os experimentos envolveram oito conjuntos de avaliação divididos em três áreas de atuação: programação, espaço de trabalho de agentes e projetos de engenharia. O modelo de linguagem Claude Opus 4.8 serviu como política padrão, e os pesquisadores também realizaram testes com o Gemini 3.5 Flash. As medições revelaram que o aprimoramento se manteve firme mesmo em tarefas nunca vistas durante a fase de ajuste.

    Domínio de testeAvaliaçãoPapel na pesquisaDesempenho originalDesempenho com RRSIVariação
    ProgramaçãoTerminal-Bench 2.1Base de evolução74,2%80,2%+6,0
    ProgramaçãoSWE-bench VerifiedTeste externo82,0%83,8%+1,8
    Espaço de trabalhoHarvey LABBase de evolução89,4%90,5%+1,1
    Espaço de trabalhoHarvey LABValidação interna86,9%89,2%+2,3
    Espaço de trabalhoJobBenchTeste externo36,0%40,7%+4,7
    Espaço de trabalhoGDPvalTeste externo48,8%52,3%+3,5
    Espaço de trabalhoAPEX-AgentsTeste externo34,2%37,9%+3,7
    EngenhariaEngDesignBase de evolução50,054,9+4,9
    EngenhariaFrontier-EngTeste externo17,722,0+4,3

    Ao avaliar o Gemini 3.5 Flash na tarefa de terminal do Terminal-Bench 2.1, a taxa subiu de 64,6 para 78,7, enquanto no SWE-bench Verified o índice passou de 76,8 para 79,0. Paralelamente, os pesquisadores notaram uma redução no uso de recursos computacionais. No ambiente de trabalho de agentes, o consumo foi de 2,42 milhões de tokens por tentativa contra 3,80 milhões de métodos sem regularização. Há uma divergência pontual nos documentos: o resumo do artigo acadêmico registra uma economia de 30% em tokens de política, ao passo que o site oficial do projeto (abre em nova aba) calcula esse ganho de eficiência em 36%.

    Todo o código foi disponibilizado publicamente sob a licença de software livre Apache 2.0 por meio de um repositório no GitHub (abre em nova aba). Projetado como uma estrutura de pesquisa, o pacote exige ambiente Python 3.10 ou superior e aceita conexões com diversos modelos de linguagem. Cada tentativa de melhoria é organizada em ramificações do sistema de versionamento Git, permitindo rastrear detalhadamente o que foi alterado e comprovar se as mudanças trouxeram benefícios reais.

    A comunidade tem como foco inicial a aplicação do método em três frentes práticas: agentes que operam terminais de programação, sistemas voltados para análise e manipulação de documentos de escritório e assistentes dedicados a cálculos e projetos de engenharia.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo