Pular para o conteúdo
    Notícia

    Novo benchmark OEB revela que até 84% dos sucessos declarados por agentes de IA são falsos

    O Open-Endedness Bench avalia o rigor investigativo de agentes de inteligência artificial analisando apenas seus registros de execução, sem gabarito prévio.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    6 de out. de 2026 · 3 min de leitura

    Lâmina circular de silício sustentada por pinça metálica em ambiente limpo de laboratório, refletindo feixes técnicos de luz sobre a superfície com padrões milimétricos de microprocessadores.
    Processos de desenvolvimento de hardware e semicondutores serviram como base para testar a consistência metodológica de assistentes autônomos.

    Sistemas autônomos de inteligência artificial recebem tarefas investigativas abertas, como desenhar circuitos integrados ou acelerar treinamentos de software. Avaliar esses assistentes é um desafio complexo quando não existe uma resposta única nos manuais. Um trabalho apresentado em 1 de outubro de 2026 propõe uma solução direta para o problema. Trata-se do Open-Endedness Bench (abre em nova aba), conhecido pela sigla OEB, um método que examina a qualidade da investigação científica de uma máquina lendo apenas o seu diário de bordo digital.

    O método não consulta gabaritos nem notas finais atribuídas à tarefa. A equipe responsável pelo projeto reúne os pesquisadores Chengyang Shi, Xianglin Ji, Jintao Huang, Jicheng Wang, Yifeng He e Jiachen Liu. O código do sistema foi publicado no repositório ARA-Labs/oeb (abre em nova aba) no GitHub, acompanhado por um conjunto de dados hospedado no Hugging Face (abre em nova aba). Uma publicação explicativa em formato de artigo contextualizou o funcionamento da ferramenta em 2 de outubro de 2026.

    Como funciona a avaliação do processo de descoberta

    Avaliar o raciocínio epistêmico significa examinar como um agente constrói conhecimento verdadeiro sobre o que está fazendo, distinguindo fatos comprovados de meras suposições. O OEB transforma o arquivo de registro bruto, chamado de log de execução, em um grafo de eventos epistêmicos. Esse grafo funciona como um mapa conceitual: ele conecta diretamente as afirmações textuais feitas pelo agente às ações práticas executadas para testá-las. Cada ponto desse mapa contém um trecho literal de texto que o código do benchmark confere contra o log real.

    O sistema divide essa investigação em critérios objetivos:

    • Pontuação de evidência: mede se as crenças declaradas pelo modelo têm sustentação direta em dados e resultados que ele realmente observou no ambiente.
    • Pontuação de experimento: analisa cada teste prático rodado pelo agente para verificar se o sistema de fato leu o resultado obtido e se descreveu honestamente o que os números mostravam.
    • Capacidade de exploração contínua: acompanha se o agente segue testando hipóteses novas ao longo do tempo ou se fica estagnado nas mesmas ideias.

    Como avaliar um pesquisador artificial se não sabemos de antemão qual é a resposta certa? A solução do OEB consiste em observar a honestidade do método científico adotado, e não apenas o resultado anunciado. O avaliador ignora os resumos laudatórios que o próprio agente redige sobre si mesmo, concentrando-se exclusivamente nas ações que deixaram rastro técnico.

    Mesa de trabalho clara vista de cima com cadernos pautados abertos, anotações técnicas à caneta, réguas metálicas e formulários de conferência analítica organizados metodicamente sob luz difusa.
    A análise rigorosa de métodos de trabalho e registros técnicos substitui a simples aceitação de resultados autodeclarados.

    Os primeiros testes e o abismo entre discurso e realidade

    16% a 29%: esta foi a fatia de melhorias reais encontradas ao confrontar as afirmações dos agentes com os números registrados em seus sistemas. É surpreendente que entre 71% e 84% de todas as vitórias declaradas pelos agentes eram apenas ruído estatístico sem fundamento experimental.

    A análise não realizou execuções inéditas de agentes. Os autores aplicaram o OEB a 119 execuções pré-existentes distribuídas por 12 tarefas, retiradas de três ambientes distintos: o PostTrainBench, voltado ao pós-treinamento de modelos de linguagem; o Chip-Bench, focado em projeto de circuitos de computador; e o nanoGPT speedrun, uma corrida de velocidade para otimizar o treinamento de modelos.

    Na tarefa de aceleração de treino, apenas 16% dos ganhos reivindicados eram reais. No projeto de hardware, a taxa atingiu 29%. O padrão de persistência investigativa também se destacou: em 9 de 10 tarefas avaliadas, a execução com melhor desempenho geral continuou a testar mais ideias inéditas em sua segunda metade do que a execução de pior desempenho.

    O estudo observou ainda que o modelo de base explica a maior parte da postura adotada durante a pesquisa. A identidade do modelo foi responsável por uma mediana de 43% da variação observada nos traços de personalidade epistêmica entre as execuções, enquanto a tarefa específica explicou apenas 7%. O comportamento investigativo reflete primordialmente a arquitetura da inteligência artificial escolhida, mantendo vícios ou virtudes semelhantes mesmo quando o problema prático muda por completo.

    A metodologia representa um primeiro passo focado no processo de pesquisa e depende da integridade dos registros gerados pelos sistemas avaliados. A documentação completa dos testes e os julgamentos automatizados permanecem disponíveis para exame público nos repositórios do projeto.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo