A Scale AI (abre em nova aba), em parceria com a Elorian, lançou em 7 de outubro de 2026 o Humanity's Sixth Sense (HSS), um benchmark de raciocínio visual intuitivo. Benchmark, no vocabulário de inteligência artificial, é uma prova padronizada: uma lista fixa de desafios, igual para todos, que permite comparar sistemas diferentes sob as mesmas condições.
O teste reúne 522 tarefas de resposta aberta sobre 288 imagens e 234 vídeos, num total de 17,6 horas de gravação. Os vídeos têm, na mediana, 76 segundos; o mais longo dura 28 minutos. A pergunta por trás de todas as questões é uma só: diante do que aparece na tela, a máquina entende o que está vendo?
O que a prova cobra
As perguntas pedem julgamentos que qualquer pessoa faz sem parar para pensar. Se um objeto fora da cena estaria ao alcance da mão. O que deve acontecer no segundo seguinte de um vídeo. O que alguém está pensando ao olhar para o lado. É o raciocínio do motorista que sabe, sem fazer conta, se o carro cabe na vaga apertada. Daí o "intuitivo" do nome.
Os desafios se dividem em quatro domínios:
- Lógica Física e Espacial: se algo cabe, se é alcançável, se é possível
- Dinâmica Temporal e Causal: prever o que vem depois e deduzir o que veio antes
- Entendimento Social: papéis, normas e a leitura da mente alheia
- Inferência Abstrata e Contextual: padrões e consequências de mudanças
Para medir a distância entre humanos e máquinas, os autores avaliaram 25 modelos multimodais, sistemas que enxergam imagem e vídeo além de texto, de oito empresas, ao lado de 20 participantes humanos. As respostas dos modelos foram corrigidas por outra IA, o Claude Opus 5, com base em 723 critérios de correção; a nota de cada sistema é a média de três tentativas por tarefa.
| Quem responde | Aproveitamento |
|---|---|
| 20 pessoas | 93,1% |
| Melhor modelo: GPT-6-astra | 53,6% |
| Mediana dos 25 modelos | 30,9% |
Segundo o leaderboard, o melhor colocado, o GPT-6-astra, avaliado com o raciocínio ajustado no esforço máximo, fica a quase 40 pontos das pessoas. A maioria dos 25 modelos nem alcança 40%.
Onde a IA tropeça
Antes da publicação, porém, a prova passou por um funil estreito. Foram escritas 3.466 tarefas; só 522 sobreviveram, uma taxa de aceitação de 15,1%, depois de três rodadas independentes de revisão. Os autores afirmam que as métricas oficiais são calculadas sobre uma versão congelada e versionada das 522 tarefas, fixada para que a comparação entre modelos não mude depois do lançamento.
Quando as máquinas erram, o problema raramente está na lógica. Dos 8.573 erros registrados na avaliação, 94% vêm de percepção falha ou de inferência latente, o passo invisível entre ver a cena e formular a resposta. Apenas 5% decorrem de lógica defeituosa. Os modelos gastam, em média, 4.046 tokens de raciocínio por tarefa, esses pedaços de texto que a IA produz enquanto pensa. E o detalhe mais eloquente: sem a imagem ou o vídeo, o próprio GPT-6-astra despenca para 6,6%. O enunciado sozinho não entrega a resposta; é preciso mesmo enxergar.
Duas dificuldades se repetem no ranking. Vídeo é mais difícil que imagem para 23 dos 25 modelos, com queda média de 7,3 pontos. E o Entendimento Social é o domínio mais fraco para 21 deles: 24,4% de média, contra 34,1% dos outros três.
Há um ganho quando o modelo deixa de só responder e passa a agir. Dentro de ferramentas de agente como Claude Code e Codex, ambientes em que a IA executa passos na prática, o melhor resultado chega a 59,3% em um subconjunto de 388 tarefas. É verdade que sobe em relação aos 53,6%, mas continua a boa distância das pessoas.
A Elorian, que assina o benchmark junto com os laboratórios da Scale AI, resumiu o contraste no anúncio oficial no X:
Modelos de IA de ponta passam no exame da ordem, mas não sabem dizer se uma maçã cabe numa lancheira. Conheçam o Humanity's Sixth Sense, nosso novo benchmark com a @ScaleAILabs: 522 questões testando o raciocínio visual intuitivo que a maioria dos humanos acha fácil.
Material aberto
Quem quiser usar tudo isso encontra os materiais disponíveis. O dataset está no Hugging Face (abre em nova aba) sob licença MIT, que libera uso e redistribuição, com cerca de 11,2 GB de dados em inglês. O leaderboard (abre em nova aba) está público, e o pacote de lançamento inclui o roteiro de avaliação, com os prompts de execução e de correção prontos para reproduzir a prova. Um paper técnico acompanha o lançamento e detalha o método.
O nome do teste promete um sexto sentido. Como lembrou a própria Elorian, a IA de ponta já resolve provas de direito; o que o HSS passa a registrar, com número e método, é o tamanho do vão entre responder e enxergar.

