Uma tarefa longa pode pedir dezenas de decisões seguidas de um agente de IA. O fracasso, na maior parte das vezes, nasce de uma só. Em experimentos preliminares com três modelos Qwen3, de 8 bilhões a 235 bilhões de parâmetros, pesquisadores da NVIDIA (abre em nova aba) verificaram que mais da metade das tentativas malsucedidas continha um erro pivô: uma ação única que afastava o agente da conclusão da tarefa, e que em geral acontecia logo no começo da interação.
Essa observação virou método. No dia 30 de setembro de 2026, a equipe divulgou o PivotOPD, um framework de destilação on-policy para agentes de linguagem que trabalham em múltiplas rodadas de conversa. O artigo técnico (abre em nova aba) tem autoria de Yinghui He, da Universidade de Princeton, de Yapei Chang, da University of Maryland, e dos pesquisadores da NVIDIA Khushi Bhardwaj, Daniele Molinari, Tugrul Konuk, Jan Kautz e Ali Hatamizadeh. He desenvolveu o trabalho durante um estágio na NVIDIA.
Um deslize cedo, um estrago longo
Agentes de múltiplas interações não respondem apenas uma vez. Eles agem, observam o resultado, agem de novo, e assim por diante até concluir a tarefa. Essa estrutura tem um problema estrutural, descrito pelos autores no artigo: uma ação incorreta muda os estados que o agente encontrará depois, então os erros se acumulam ao longo das rodadas. Quando o deslize acontece no começo, tudo o que vem depois já parte de um lugar errado.

Os experimentos preliminares da equipe mostraram, porém, que esse tipo de erro costuma ter salvação. Guiar o modelo por apenas algumas rodadas após o momento do erro pivô pode restaurar o sucesso da tarefa. Ou seja, o erro inicial afasta o agente do objetivo, mas raramente o elimina por completo.
Fazer isso de forma sistemática é o que o PivotOPD propõe. O método localiza, entre as tentativas que fracassaram, o erro precoce do qual a falha depende, afasta o aluno dele e, quando o erro acontece mesmo assim, ensina o aluno a se recuperar do estado que ele próprio criou.
Como o professor age a cada passo
O ponto de partida é a destilação on-policy, abreviada pelos pesquisadores como OPD. É uma forma de treinar agentes em que um modelo professor dá supervisão densa sobre as trajetórias geradas pelo próprio aluno.
O PivotOPD estende essa ideia com dois treinos que funcionam em conjunto. No momento de cada erro pivô, o modelo professor fornece uma ação de ouro, isto é, a ação correta que o aluno deveria ter executado. O componente preventivo usa essa ação com uma medida estatística chamada KL reversa, que conduz o aluno para longe do erro. Já o componente de recuperação entra nas rodadas seguintes: o professor nomeia, uma a uma, as ações necessárias para retomar a tarefa a partir do estado ruim, e essas ações são transferidas ao aluno com a KL direta, uma forma de comparação que ensina comportamentos que o aluno raramente gera por conta própria.
Prevenção e conserto, portanto, acontecem ao mesmo tempo. O aluno aprende a não dar o passo errado e, se der, aprende a dar os passos que desfazem o estrago.
Resultados contra 13 linhas de base
Os autores compararam o PivotOPD com 13 linhas de base, que são métodos de referência usados para medir se uma novidade realmente avança o estado da técnica. Os testes cobriram três ambientes de tarefas para agentes:
- ALFWorld, com tarefas domésticas em ambiente simulado;
- WebShop, com compras em loja virtual simulada;
- Search-based QA, com perguntas respondidas a partir de busca.
Segundo os resultados divulgados, o PivotOPD alcançou a melhor média de desempenho contra as 13 linhas de base nos três ambientes, tanto com um aluno pequeno, o Qwen3-1.7B, quanto com um maior, o Qwen3-8B. Foram 8 vitórias em 8 médias por benchmark. No ALFWorld especificamente, o método superou a linha de base mais forte em 5,5 pontos percentuais com o aluno de 1,7 bilhão de parâmetros.
O número mais eloquente, contudo, está na taxa de recuperação. Quando os pesquisadores reproduziram erros pivô que haviam sido identificados, o aluno treinado com PivotOPD retomou a tarefa em 72,7% dos casos:
| Configuração do aluno | Erros pivô recuperados |
|---|---|
| Modelo base, sem treinamento extra | 8,3% |
| Destilação on-policy padrão | 20,3% |
| PivotOPD | 72,7% |
Perto de três quartos dos erros decisivos deixaram de ser fatais. No modelo base, essa história é outra: menos de um em cada dez deslizes tinha volta.
Os ganhos atravessam famílias de modelos
Os autores também testaram se o método vale fora do ambiente onde foi calibrado. Eles aplicaram o PivotOPD a um aluno de outra família, o Nemotron-3.5, no domínio de engenharia de software, medido pelo benchmark SWE-Bench Verified, que reúne problemas reais de código.
O resultado, segundo os pesquisadores: a taxa de resolução subiu de 62,8% para 66,0%, um ganho de 3,2 pontos percentuais. A destilação on-policy padrão, no mesmo cenário, acrescentou apenas 0,2 ponto. Os autores apresentam essa diferença como evidência de que os ganhos se transferem para outra família de modelos e para um domínio de tarefa distinto daquele em que o método foi desenvolvido.
É importante separar o que os números mostram do que ainda não mostram. Os resultados divulgados cobrem os benchmarks citados e os alunos citados, com o professor atuando nas rodadas que seguem cada erro pivô. O artigo não apresenta medições em ambientes fora dessa lista, e nenhuma aplicação comercial específica foi anunciada junto com a pesquisa.
Ainda assim, a conclusão central dos pesquisadores é taxativa: se a maior parte dos fracassos de um agente se concentra em um único deslize precoce, e se esse deslize é recuperável com poucas rodadas de orientação, então ensinar a errar menos e a se refazer rápido vale mais do que só ensinar a acertar. A pergunta que fica aberta é até onde essa lógica se sustenta quando as tarefas ficam mais longas, os ambientes mais imprevisíveis e os erros menos isolados, condições em que um único pivô talvez não baste para explicar a falha.
Perguntas frequentes
O que é um erro pivô em agentes de IA?
É uma ação única que afasta o agente de completar a tarefa e que, segundo os pesquisadores da NVIDIA, costuma acontecer no início da interação. Em experimentos preliminares com três modelos Qwen3, mais da metade das tentativas fracassadas continha um erro desse tipo.
O que é destilação on-policy?
É uma forma de treinar agentes em que um modelo professor acompanha as trajetórias geradas pelo próprio aluno e oferece correções a cada passo, com supervisão densa, em vez de ensinar apenas com exemplos prontos.
Quais foram os resultados do PivotOPD?
O método obteve a melhor média contra 13 linhas de base em ALFWorld, WebShop e Search-based QA, com alunos Qwen3-1.7B e Qwen3-8B, e venceu as 8 médias por benchmark. Recuperou 72,7% dos erros pivô reproduzidos, contra 8,3% do modelo base.
Os ganhos valem para outras famílias de modelos?
Segundo os autores, sim. Com um aluno Nemotron-3.5 no SWE-Bench Verified, a taxa de resolução subiu de 62,8% para 66,0%, ganho de 3,2 pontos, enquanto a destilação on-policy padrão acrescentou 0,2 ponto no mesmo cenário.

