Pular para o conteúdo
    Notícia

    Método da NVIDIA ensina agentes de IA a evitar e corrigir o erro que decide o fracasso

    Pesquisadores da NVIDIA publicaram o PivotOPD, método de destilação on-policy que treina agentes de IA a prevenir o erro pivô, o deslize precoce que derruba tarefas inteiras, e a se recuperar dele. Em testes, 72,7% desses erros foram recuperados, contra 8,3% do modelo base.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    8 de out. de 2026 · 6 min de leitura

    Seguir no Google
    Cozinheiro de costas em cozinha industrial durante o rush, com vapor denso e luz âmbar sobre aço escovado; sua mão segura um pano de prato e recoloca uma frigideira pequena na boca certa do fogão enquanto raspa com a espátula um escorredo d
    No calor da cozinha, o erro precoce não precisa condenar a tarefa: corrigir o deslize na hora e retomar a sequência é o que separa o fracasso da recuperação.

    Uma tarefa longa pode pedir dezenas de decisões seguidas de um agente de IA. O fracasso, na maior parte das vezes, nasce de uma só. Em experimentos preliminares com três modelos Qwen3, de 8 bilhões a 235 bilhões de parâmetros, pesquisadores da NVIDIA (abre em nova aba) verificaram que mais da metade das tentativas malsucedidas continha um erro pivô: uma ação única que afastava o agente da conclusão da tarefa, e que em geral acontecia logo no começo da interação.

    Essa observação virou método. No dia 30 de setembro de 2026, a equipe divulgou o PivotOPD, um framework de destilação on-policy para agentes de linguagem que trabalham em múltiplas rodadas de conversa. O artigo técnico (abre em nova aba) tem autoria de Yinghui He, da Universidade de Princeton, de Yapei Chang, da University of Maryland, e dos pesquisadores da NVIDIA Khushi Bhardwaj, Daniele Molinari, Tugrul Konuk, Jan Kautz e Ali Hatamizadeh. He desenvolveu o trabalho durante um estágio na NVIDIA.

    Um deslize cedo, um estrago longo

    Agentes de múltiplas interações não respondem apenas uma vez. Eles agem, observam o resultado, agem de novo, e assim por diante até concluir a tarefa. Essa estrutura tem um problema estrutural, descrito pelos autores no artigo: uma ação incorreta muda os estados que o agente encontrará depois, então os erros se acumulam ao longo das rodadas. Quando o deslize acontece no começo, tudo o que vem depois já parte de um lugar errado.

    Fotografia em contra-plongée de uma fiada de tijolos recém-assentados em uma obra, com fio de nylon esticado como guia; os ti
    Cada tijolo herda a posição do anterior: quando o desvio começa cedo, o alinhamento com a linha-guia se perde por inteiro

    Os experimentos preliminares da equipe mostraram, porém, que esse tipo de erro costuma ter salvação. Guiar o modelo por apenas algumas rodadas após o momento do erro pivô pode restaurar o sucesso da tarefa. Ou seja, o erro inicial afasta o agente do objetivo, mas raramente o elimina por completo.

    Fazer isso de forma sistemática é o que o PivotOPD propõe. O método localiza, entre as tentativas que fracassaram, o erro precoce do qual a falha depende, afasta o aluno dele e, quando o erro acontece mesmo assim, ensina o aluno a se recuperar do estado que ele próprio criou.

    Como o professor age a cada passo

    O ponto de partida é a destilação on-policy, abreviada pelos pesquisadores como OPD. É uma forma de treinar agentes em que um modelo professor dá supervisão densa sobre as trajetórias geradas pelo próprio aluno.

    O PivotOPD estende essa ideia com dois treinos que funcionam em conjunto. No momento de cada erro pivô, o modelo professor fornece uma ação de ouro, isto é, a ação correta que o aluno deveria ter executado. O componente preventivo usa essa ação com uma medida estatística chamada KL reversa, que conduz o aluno para longe do erro. Já o componente de recuperação entra nas rodadas seguintes: o professor nomeia, uma a uma, as ações necessárias para retomar a tarefa a partir do estado ruim, e essas ações são transferidas ao aluno com a KL direta, uma forma de comparação que ensina comportamentos que o aluno raramente gera por conta própria.

    Prevenção e conserto, portanto, acontecem ao mesmo tempo. O aluno aprende a não dar o passo errado e, se der, aprende a dar os passos que desfazem o estrago.

    Resultados contra 13 linhas de base

    Os autores compararam o PivotOPD com 13 linhas de base, que são métodos de referência usados para medir se uma novidade realmente avança o estado da técnica. Os testes cobriram três ambientes de tarefas para agentes:

    • ALFWorld, com tarefas domésticas em ambiente simulado;
    • WebShop, com compras em loja virtual simulada;
    • Search-based QA, com perguntas respondidas a partir de busca.

    Segundo os resultados divulgados, o PivotOPD alcançou a melhor média de desempenho contra as 13 linhas de base nos três ambientes, tanto com um aluno pequeno, o Qwen3-1.7B, quanto com um maior, o Qwen3-8B. Foram 8 vitórias em 8 médias por benchmark. No ALFWorld especificamente, o método superou a linha de base mais forte em 5,5 pontos percentuais com o aluno de 1,7 bilhão de parâmetros.

    O número mais eloquente, contudo, está na taxa de recuperação. Quando os pesquisadores reproduziram erros pivô que haviam sido identificados, o aluno treinado com PivotOPD retomou a tarefa em 72,7% dos casos:

    Configuração do alunoErros pivô recuperados
    Modelo base, sem treinamento extra8,3%
    Destilação on-policy padrão20,3%
    PivotOPD72,7%

    Perto de três quartos dos erros decisivos deixaram de ser fatais. No modelo base, essa história é outra: menos de um em cada dez deslizes tinha volta.

    Os ganhos atravessam famílias de modelos

    Os autores também testaram se o método vale fora do ambiente onde foi calibrado. Eles aplicaram o PivotOPD a um aluno de outra família, o Nemotron-3.5, no domínio de engenharia de software, medido pelo benchmark SWE-Bench Verified, que reúne problemas reais de código.

    O resultado, segundo os pesquisadores: a taxa de resolução subiu de 62,8% para 66,0%, um ganho de 3,2 pontos percentuais. A destilação on-policy padrão, no mesmo cenário, acrescentou apenas 0,2 ponto. Os autores apresentam essa diferença como evidência de que os ganhos se transferem para outra família de modelos e para um domínio de tarefa distinto daquele em que o método foi desenvolvido.

    É importante separar o que os números mostram do que ainda não mostram. Os resultados divulgados cobrem os benchmarks citados e os alunos citados, com o professor atuando nas rodadas que seguem cada erro pivô. O artigo não apresenta medições em ambientes fora dessa lista, e nenhuma aplicação comercial específica foi anunciada junto com a pesquisa.

    Ainda assim, a conclusão central dos pesquisadores é taxativa: se a maior parte dos fracassos de um agente se concentra em um único deslize precoce, e se esse deslize é recuperável com poucas rodadas de orientação, então ensinar a errar menos e a se refazer rápido vale mais do que só ensinar a acertar. A pergunta que fica aberta é até onde essa lógica se sustenta quando as tarefas ficam mais longas, os ambientes mais imprevisíveis e os erros menos isolados, condições em que um único pivô talvez não baste para explicar a falha.

    Perguntas frequentes

    O que é um erro pivô em agentes de IA?

    É uma ação única que afasta o agente de completar a tarefa e que, segundo os pesquisadores da NVIDIA, costuma acontecer no início da interação. Em experimentos preliminares com três modelos Qwen3, mais da metade das tentativas fracassadas continha um erro desse tipo.

    O que é destilação on-policy?

    É uma forma de treinar agentes em que um modelo professor acompanha as trajetórias geradas pelo próprio aluno e oferece correções a cada passo, com supervisão densa, em vez de ensinar apenas com exemplos prontos.

    Quais foram os resultados do PivotOPD?

    O método obteve a melhor média contra 13 linhas de base em ALFWorld, WebShop e Search-based QA, com alunos Qwen3-1.7B e Qwen3-8B, e venceu as 8 médias por benchmark. Recuperou 72,7% dos erros pivô reproduzidos, contra 8,3% do modelo base.

    Os ganhos valem para outras famílias de modelos?

    Segundo os autores, sim. Com um aluno Nemotron-3.5 no SWE-Bench Verified, a taxa de resolução subiu de 62,8% para 66,0%, ganho de 3,2 pontos, enquanto a destilação on-policy padrão acrescentou 0,2 ponto no mesmo cenário.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo