Pular para o conteúdo
    Notícia

    Benchmark da Scale AI e Elorian mede raciocínio visual: humano 93,1%, melhor IA 53,6%

    Scale AI e Elorian lançaram em 7 de outubro de 2026 o Humanity's Sixth Sense (HSS), benchmark com 522 tarefas de raciocínio visual intuitivo em imagens e vídeos. Pessoas acertam 93,1%; o melhor modelo avaliado, o GPT-6-astra, chega a 53,6%.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    8 de out. de 2026 · 4 min de leitura

    Seguir no Google
    Mão de adulto segurando uma maçã vermelha grande encaixada de forma torta em uma lancheira infantil aberta sobre uma bancada de madeira, com uma lanterna pequena e uma garrafinha de água deixadas ao lado, em uma cozinha iluminada pela luz q
    Encaixar a fruta na lancheira: uma tarefa banal que, travada no ar, expõe os limites do raciocínio visual intuitivo medido pelo novo benchmark.

    A Scale AI (abre em nova aba), em parceria com a Elorian, lançou em 7 de outubro de 2026 o Humanity's Sixth Sense (HSS), um benchmark de raciocínio visual intuitivo. Benchmark, no vocabulário de inteligência artificial, é uma prova padronizada: uma lista fixa de desafios, igual para todos, que permite comparar sistemas diferentes sob as mesmas condições.

    O teste reúne 522 tarefas de resposta aberta sobre 288 imagens e 234 vídeos, num total de 17,6 horas de gravação. Os vídeos têm, na mediana, 76 segundos; o mais longo dura 28 minutos. A pergunta por trás de todas as questões é uma só: diante do que aparece na tela, a máquina entende o que está vendo?

    O que a prova cobra

    As perguntas pedem julgamentos que qualquer pessoa faz sem parar para pensar. Se um objeto fora da cena estaria ao alcance da mão. O que deve acontecer no segundo seguinte de um vídeo. O que alguém está pensando ao olhar para o lado. É o raciocínio do motorista que sabe, sem fazer conta, se o carro cabe na vaga apertada. Daí o "intuitivo" do nome.

    Os desafios se dividem em quatro domínios:

    • Lógica Física e Espacial: se algo cabe, se é alcançável, se é possível
    • Dinâmica Temporal e Causal: prever o que vem depois e deduzir o que veio antes
    • Entendimento Social: papéis, normas e a leitura da mente alheia
    • Inferência Abstrata e Contextual: padrões e consequências de mudanças

    Para medir a distância entre humanos e máquinas, os autores avaliaram 25 modelos multimodais, sistemas que enxergam imagem e vídeo além de texto, de oito empresas, ao lado de 20 participantes humanos. As respostas dos modelos foram corrigidas por outra IA, o Claude Opus 5, com base em 723 critérios de correção; a nota de cada sistema é a média de três tentativas por tarefa.

    Quem respondeAproveitamento
    20 pessoas93,1%
    Melhor modelo: GPT-6-astra53,6%
    Mediana dos 25 modelos30,9%

    Segundo o leaderboard, o melhor colocado, o GPT-6-astra, avaliado com o raciocínio ajustado no esforço máximo, fica a quase 40 pontos das pessoas. A maioria dos 25 modelos nem alcança 40%.

    Onde a IA tropeça

    Antes da publicação, porém, a prova passou por um funil estreito. Foram escritas 3.466 tarefas; só 522 sobreviveram, uma taxa de aceitação de 15,1%, depois de três rodadas independentes de revisão. Os autores afirmam que as métricas oficiais são calculadas sobre uma versão congelada e versionada das 522 tarefas, fixada para que a comparação entre modelos não mude depois do lançamento.

    Quando as máquinas erram, o problema raramente está na lógica. Dos 8.573 erros registrados na avaliação, 94% vêm de percepção falha ou de inferência latente, o passo invisível entre ver a cena e formular a resposta. Apenas 5% decorrem de lógica defeituosa. Os modelos gastam, em média, 4.046 tokens de raciocínio por tarefa, esses pedaços de texto que a IA produz enquanto pensa. E o detalhe mais eloquente: sem a imagem ou o vídeo, o próprio GPT-6-astra despenca para 6,6%. O enunciado sozinho não entrega a resposta; é preciso mesmo enxergar.

    Duas dificuldades se repetem no ranking. Vídeo é mais difícil que imagem para 23 dos 25 modelos, com queda média de 7,3 pontos. E o Entendimento Social é o domínio mais fraco para 21 deles: 24,4% de média, contra 34,1% dos outros três.

    Há um ganho quando o modelo deixa de só responder e passa a agir. Dentro de ferramentas de agente como Claude Code e Codex, ambientes em que a IA executa passos na prática, o melhor resultado chega a 59,3% em um subconjunto de 388 tarefas. É verdade que sobe em relação aos 53,6%, mas continua a boa distância das pessoas.

    A Elorian, que assina o benchmark junto com os laboratórios da Scale AI, resumiu o contraste no anúncio oficial no X:

    Modelos de IA de ponta passam no exame da ordem, mas não sabem dizer se uma maçã cabe numa lancheira. Conheçam o Humanity's Sixth Sense, nosso novo benchmark com a @ScaleAILabs: 522 questões testando o raciocínio visual intuitivo que a maioria dos humanos acha fácil.

    — Elorian AI (@ElorianAI), 7 de out. de 2026, no X

    Material aberto

    Quem quiser usar tudo isso encontra os materiais disponíveis. O dataset está no Hugging Face (abre em nova aba) sob licença MIT, que libera uso e redistribuição, com cerca de 11,2 GB de dados em inglês. O leaderboard (abre em nova aba) está público, e o pacote de lançamento inclui o roteiro de avaliação, com os prompts de execução e de correção prontos para reproduzir a prova. Um paper técnico acompanha o lançamento e detalha o método.

    O nome do teste promete um sexto sentido. Como lembrou a própria Elorian, a IA de ponta já resolve provas de direito; o que o HSS passa a registrar, com número e método, é o tamanho do vão entre responder e enxergar.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo