Sistemas autônomos de inteligência artificial recebem tarefas investigativas abertas, como desenhar circuitos integrados ou acelerar treinamentos de software. Avaliar esses assistentes é um desafio complexo quando não existe uma resposta única nos manuais. Um trabalho apresentado em 1 de outubro de 2026 propõe uma solução direta para o problema. Trata-se do Open-Endedness Bench (abre em nova aba), conhecido pela sigla OEB, um método que examina a qualidade da investigação científica de uma máquina lendo apenas o seu diário de bordo digital.
O método não consulta gabaritos nem notas finais atribuídas à tarefa. A equipe responsável pelo projeto reúne os pesquisadores Chengyang Shi, Xianglin Ji, Jintao Huang, Jicheng Wang, Yifeng He e Jiachen Liu. O código do sistema foi publicado no repositório ARA-Labs/oeb (abre em nova aba) no GitHub, acompanhado por um conjunto de dados hospedado no Hugging Face (abre em nova aba). Uma publicação explicativa em formato de artigo contextualizou o funcionamento da ferramenta em 2 de outubro de 2026.
Como funciona a avaliação do processo de descoberta
Avaliar o raciocínio epistêmico significa examinar como um agente constrói conhecimento verdadeiro sobre o que está fazendo, distinguindo fatos comprovados de meras suposições. O OEB transforma o arquivo de registro bruto, chamado de log de execução, em um grafo de eventos epistêmicos. Esse grafo funciona como um mapa conceitual: ele conecta diretamente as afirmações textuais feitas pelo agente às ações práticas executadas para testá-las. Cada ponto desse mapa contém um trecho literal de texto que o código do benchmark confere contra o log real.
O sistema divide essa investigação em critérios objetivos:
- Pontuação de evidência: mede se as crenças declaradas pelo modelo têm sustentação direta em dados e resultados que ele realmente observou no ambiente.
- Pontuação de experimento: analisa cada teste prático rodado pelo agente para verificar se o sistema de fato leu o resultado obtido e se descreveu honestamente o que os números mostravam.
- Capacidade de exploração contínua: acompanha se o agente segue testando hipóteses novas ao longo do tempo ou se fica estagnado nas mesmas ideias.
Como avaliar um pesquisador artificial se não sabemos de antemão qual é a resposta certa? A solução do OEB consiste em observar a honestidade do método científico adotado, e não apenas o resultado anunciado. O avaliador ignora os resumos laudatórios que o próprio agente redige sobre si mesmo, concentrando-se exclusivamente nas ações que deixaram rastro técnico.

Os primeiros testes e o abismo entre discurso e realidade
16% a 29%: esta foi a fatia de melhorias reais encontradas ao confrontar as afirmações dos agentes com os números registrados em seus sistemas. É surpreendente que entre 71% e 84% de todas as vitórias declaradas pelos agentes eram apenas ruído estatístico sem fundamento experimental.
A análise não realizou execuções inéditas de agentes. Os autores aplicaram o OEB a 119 execuções pré-existentes distribuídas por 12 tarefas, retiradas de três ambientes distintos: o PostTrainBench, voltado ao pós-treinamento de modelos de linguagem; o Chip-Bench, focado em projeto de circuitos de computador; e o nanoGPT speedrun, uma corrida de velocidade para otimizar o treinamento de modelos.
Na tarefa de aceleração de treino, apenas 16% dos ganhos reivindicados eram reais. No projeto de hardware, a taxa atingiu 29%. O padrão de persistência investigativa também se destacou: em 9 de 10 tarefas avaliadas, a execução com melhor desempenho geral continuou a testar mais ideias inéditas em sua segunda metade do que a execução de pior desempenho.
O estudo observou ainda que o modelo de base explica a maior parte da postura adotada durante a pesquisa. A identidade do modelo foi responsável por uma mediana de 43% da variação observada nos traços de personalidade epistêmica entre as execuções, enquanto a tarefa específica explicou apenas 7%. O comportamento investigativo reflete primordialmente a arquitetura da inteligência artificial escolhida, mantendo vícios ou virtudes semelhantes mesmo quando o problema prático muda por completo.
A metodologia representa um primeiro passo focado no processo de pesquisa e depende da integridade dos registros gerados pelos sistemas avaliados. A documentação completa dos testes e os julgamentos automatizados permanecem disponíveis para exame público nos repositórios do projeto.

