A Scale Labs, laboratório de pesquisa da Scale AI, lançou em 7 de outubro de 2026 o benchmark Humanity's Sixth Sense (abre em nova aba) (HSS), criado em parceria com a Elorian para medir o raciocínio visual intuitivo, o julgamento rápido que qualquer pessoa faz ao olhar uma foto ou um vídeo, sem parar para analisar. O placar do lançamento mostra o tamanho da distância entre máquinas e gente: nas 522 tarefas do teste, pessoas acertam 93,1%, e o melhor modelo avaliado, o GPT-6-astra, para nos 53,6%.
Benchmark, em informática, é uma bateria padronizada de testes usada para comparar desempenho. A do HSS reúne 522 tarefas abertas, construídas sobre 288 imagens e 234 vídeos, com 17,6 horas de gravação no total. Metade dos clipes dura menos de 76 segundos; o mais longo chega a 28 minutos.
O artigo técnico (abre em nova aba) que acompanha o lançamento argumenta que os testes visuais existentes cobram ou análise deliberada de nível de especialista, ou percepção de baixo nível, e deixam o raciocínio intuitivo praticamente sem medição. O HSS existe para fechar essa lacuna.

Os nomes das áreas indicam o tom cotidiano das perguntas:
- Dinâmica temporal e causal: o que mudou na cena e o que deve acontecer;
- Lógica física e espacial: se um caminho é viável, se um objeto aguenta um uso;
- Compreensão social: papéis, normas e relações de poder entre pessoas;
- Inferência abstrata e contextual: padrões, extrapolação e o que a cena não mostra.
Exemplos: um subdomínio chamado Alcance espacial pergunta se dá para atravessar um lugar; Retrodução pede uma dedução sobre o que aconteceu antes da cena filmada; Teoria da mente quer saber o que a pessoa no vídeo está pensando. O executivo Francis deSouza, que anunciou o lançamento no X, resumiu a proposta:
A IA normalmente é medida em problemas que são difíceis para as pessoas. O Humanity's Sixth Sense, nosso mais novo benchmark com a @ElorianAI, testa os julgamentos visuais do dia a dia que fazemos sem pensar.
A construção foi peneirada com rigor. Das 3.466 tarefas escritas pela equipe, só 522 sobreviveram a três rodadas independentes de revisão, uma taxa de aceite de 15,1%. A linha de base humana veio de 20 participantes. Do outro lado do placar, 25 modelos multimodais, sistemas que leem texto, imagem e vídeo, de oito fabricantes.
Na correção, os modelos respondem em texto livre, e um juiz automático, o Claude-Opus-5, confere cada resposta com base em critérios que somam 723 itens. A métrica principal é a taxa de acerto, com média de três execuções por tarefa e intervalo estatístico de confiança de 95%. A tabela pública de classificação (abre em nova aba) traz o recorte completo.
| Quem responde | Taxa de acerto |
|---|---|
| Pessoas (20 participantes) | 93,1% |
| GPT-6-astra (esforço máximo de raciocínio) | 53,6% (± 4,1 pontos) |
| GPT-6.1-Sol (esforço máximo) | 46,6% (± 3,8) |
| Claude-Opus-5.5 (esforço extra-alto) | 44,6% (± 3,8) |
| Mediana dos 25 modelos | 30,9% |
A maioria dos modelos avaliados fica abaixo de 40%, o que torna a mediana de 30,9% um retrato fiel do atraso.
Os erros têm um padrão que importa mais que o placar. A equipe da Scale analisou 8.573 respostas erradas: 94% dos problemas vêm de percepção ou de inferência latente, casos em que o modelo não entende o que vê ou não deduz o que a cena implica, e só 5% são falhas de lógica. A leitura dos autores é de que as máquinas até raciocinam, mas enxergam mal. Um dado reforça isso: sem a imagem ou o vídeo, o GPT-6-astra desaba para 6,6%.
Dois pontos fracos aparecem com clareza. Em compreensão social, os modelos somam em média 24,4%, contra 34,1% nas outras três áreas. E o vídeo é mais difícil que a imagem para 23 dos 25 modelos, por 7,3 pontos em média. O esforço não é o gargalo: cada modelo gasta, em média, 4.046 tokens de raciocínio por tarefa, em que token é um pedaço de palavra, e ainda assim erra.
Configurações agênticas, em que o modelo pode manipular a imagem dinamicamente dentro de ferramentas como Claude Code e Codex, melhoram o quadro: a melhor delas chega a 59,3% num subconjunto de 388 tarefas. O artigo do projeto avalia que esse caminho estreita a diferença para os humanos, mas não a fecha.
Para quem constrói sistemas que enxergam, a consequência é prática. Existe agora uma régua aberta para medir bom senso visual antes de deixar um modelo decidir sozinho diante de imagens, e o resultado do lançamento já adianta a resposta: com 53,6% de acerto onde qualquer pessoa passa de 93%, os olhos humanos seguem necessários.

