Durante mais de uma década, avaliar visão computacional significou medir reconhecimento: nomear o objeto na foto, transcrever o texto da captura de tela, escolher a alternativa que descreve o gráfico. Os benchmarks seguiram esse roteiro, e as últimas gerações de modelos de linguagem multimodais (MLLMs), que enxergam imagem e vídeo além de ler texto, passaram a pontuar alto em exames acadêmicos e profissionais. A narrativa repetida em cada lançamento foi sempre a mesma: a lacuna entre máquina e olho humano estaria encolhendo até virar detalhe estatístico.
O que esses testes deixaram de fora cabe numa pergunta de cozinha. A maçã cabe na lancheira? A cadeira tomba se alguém sentar na beirada? Dá para servir sopa nessa tigela? Nenhuma tem alternativa correta marcada em gabarito: são julgamentos que a gente resolve com experiência acumulada e nenhum cálculo aparente. A Elorian (abre em nova aba), empresa de pesquisa que assina o benchmark ao lado da Scale AI, resumiu o contraste no anúncio oficial:
Modelos de IA de ponta conseguem passar no exame da ordem, mas não sabem dizer se uma maçã cabe numa lancheira

O anúncio é de 7 de outubro de 2026. A Scale AI (abre em nova aba), empresa de infraestrutura de dados e avaliação para IA, publicou em parceria com a Elorian o Humanity's Sixth Sense (HSS): benchmark de raciocínio visual intuitivo com 522 tarefas abertas sobre 288 imagens e 234 clipes de vídeo, 17,6 horas de gravação no total. E um placar que estraga a narrativa: pessoas acertam 93,1% das tarefas; o melhor modelo, o GPT-6-astra com esforço máximo de raciocínio, chega a 53,6%; a mediana entre os 25 modelos avaliados, vindos de oito fornecedores, fica em 30,9%.
A leitura dominante merece revisão.
O que as 522 tarefas pedem
O HSS não mede leitura de documento nem currículo de faculdade. O alvo é o que os autores chamam de raciocínio visual intuitivo: extrair de uma cena implicações físicas, sociais e causais que nenhum texto acompanha. As perguntas são abertas, sem gabarito de múltipla escolha, e a correção usa rubrica, critérios explícitos contra os quais a resposta é comparada. A organização é de quatro domínios com onze subdomínios; nos exemplos públicos do conjunto aparecem:
- Lógica física e espacial: alcance espacial (o que é alcançável na cena?), oculto e invisível (o que a cena esconde?), viabilidade de uso (o objeto serve para a função pretendida?).
- Inferência abstrata e contextual: mudança e consequência, padrões e pareidolia (ver rostos em manchas).
- Compreensão social: papel social, dinâmicas de norma e poder, teoria da mente (quem na cena sabe o quê?).
- Dinâmicas temporais e causais: extrapolação (o que acontece no próximo segundo?) e retrodição (o que produziu o quadro atual?).
A extrapolação é o julgamento que um goleiro faz a cada cruzamento: para onde a bola vai cair, sem tirar raiz quadrada nenhuma. A retrodição é o mesmo movimento de trás para frente, inferir a causa que explica o presente. As duas moram no vídeo.
As pontuações usam pass@1, a chance de acerto em uma única tentativa, medida como média de três execuções por tarefa. O baseline humano, a referência de comparação, vem de 20 avaliadores. No desmembramento divulgado pela Elorian, o ser humano não é uniforme: dinâmicas temporais são quase triviais (97,0% de acerto) e compreensão social é onde as próprias pessoas mais erram (89,1%).
| Domínio | Baseline humano (pass@1) |
|---|---|
| Dinâmicas temporais e causais | 97,0% |
| Lógica física e espacial | 94,9% |
| Inferência abstrata e contextual | 89,2% |
| Compreensão social | 89,1% |
Guarde o 89,1% da compreensão social. Ele vai importar na hora de olhar o placar das máquinas.
Pente-fino: 3.466 tarefas escritas, 522 admitidas
O valor de um benchmark nasce menos do que ele pergunta e mais de como ele foi peneirado. O HSS começou com 3.466 tarefas redigidas; sobreviveram 522, depois de três rodadas independentes de revisão. Aceitação de 15,1%. É um pente-fino e tanto, e ele faz sentido: tarefa aberta de intuição é fácil de escrever mal, ambígua, adivinhável pelo texto ou respondível sem olhar a cena.
Cada tarefa admitida carrega pergunta, resposta de referência e critérios de correção. São 723 critérios de rubrica no total. A correção é automática: um juiz de LLM, o Claude-Opus-5, avalia as respostas dos modelos seguindo os critérios. A ironia é do próprio desenho: um modelo de linguagem dá a nota que mede modelos de linguagem.
O paper técnico (abre em nova aba), assinado por 29 autores das duas empresas, de Xingang Guo e Jing Gu a Dustin Tran e Darvin Yi, aparece no portal de pesquisa da Scale com rótulo de submissão a ICLR 2027. O conjunto completo está no Hugging Face (abre em nova aba): licença MIT, formato JSON, prompts em inglês e 11,2 GB no repositório, com a mídia em pastas próprias de imagem e vídeo.
Para as métricas confirmatórias, o time congelou uma versão: tudo o que aparece no leaderboard (abre em nova aba) e no paper roda sobre a mesma versão versionada das 522 tarefas. É a prática que separa benchmark de demonstração.
O placar e a anatomia do erro
No topo, o GPT-6-astra com esforço máximo de raciocínio anota 53,6%, com margem de ±4,1 pontos. Os dois seguintes, GPT-6.1-Sol (46,6%) e Claude-Opus-5.5 (44,6%), carregam margens de ±3,8. Segundo e terceiro lugares se sobrepõem dentro das barras de erro: a ordem exata do pódio é leitura frágil. A distância até o ser humano não é.
| Modelo | Configuração | pass@1 | Margem |
|---|---|---|---|
| GPT-6-astra | esforço máximo de raciocínio | 53,6% | ±4,1 |
| GPT-6.1-Sol | esforço máximo de raciocínio | 46,6% | ±3,8 |
| Claude-Opus-5.5 | raciocínio extra-alto (xhigh) | 44,6% | ±3,8 |
| Ser humano | 20 avaliadores | 93,1% |
E olha que 53,6% é o teto da tabela: a maioria dos 25 modelos pontua abaixo de 40%, com mediana em 30,9%.
O controle mais elegante do desenho é a ablação, remover justamente o que a tarefa deveria exigir para ver quanto resta. Com a imagem ou o vídeo fora, o GPT-6-astra despenca de 53,6% para 6,6% (±1,5). A leitura é dupla: as tarefas exigem enxergar de verdade (o texto da pergunta não entrega a resposta) e o desempenho normal do modelo não vem de chute textual.
O esforço, aliás, não é pequeno. Os modelos gastam em média 4.046 tokens de raciocínio por tarefa, calculado no blog da Scale sobre execuções nos níveis mais altos de deliberação. Quatro mil tokens para acertar pouco mais da metade das perguntas que uma pessoa resolve olhando duas vezes. A aritmética é desconfortável, e publicada.
O diagnóstico mais útil do benchmark não é o placar, é a autópsia. A equipe rotulou 8.573 falhas individuais nas respostas dos modelos. Em 94% dos casos, o erro rastreia para percepção ou inferência latente: o modelo descreve algo fora da cena, deixa passar o que a oclusão esconde ou não aplica o conhecimento físico e social que o quadro exige. Apenas 5% dos erros vêm de lógica defeituosa; os cerca de 1% restantes não recebem rótulo nas divulgações. Para quem depura sistemas multimodais, a proporção inverte a ordem das suspeitas: a cadeia de raciocínio costuma estar sã, o que chega até ela não.
Na prática operacional, os 94% têm cara conhecida: descrição fluente de um objeto que não está na cena, contagem errada de pessoas, desatenção a um detalle ocluso. O erro chega com confiança tranquila, texto limpo, fato errado. O benchmark rotula essas falhas; o log de produção costuma não rotular.
O buraco social é o mais fundo. Compreensão social tem média de 24,4% nos modelos, contra 34,1% nos outros três domínios, e é o pior domínio para 21 dos 25 modelos. Diante dos 89,1% do ser humano no mesmo domínio, a distância é de 64,7 pontos. Escrever ensaio sobre teoria da mente é uma coisa; dizer quem está constrangido numa cena de vídeo é outra.
O vídeo piora tudo. Para 23 dos 25 modelos, tarefas de vídeo são mais difíceis que as de imagem, com queda média de 7,3 pontos. Os clipes têm mediana de 76 segundos, e o mais longo chega a 28 minutos. O ser humano quase não sente a diferença: 94,1% em imagem contra 91,9% em vídeo, no desmembramento da Elorian. O GPT-6-astra cai de 55,6% para 51,1%. Tempo é a fronteira onde a visão de máquina mais se desfaz.
Zoom, recorte e um teto que se move devagar
Há um atalho parcial, e ele é instrutivo. Em configuração agêntica, na qual o modelo controla ferramentas e decide os próximos passos, dentro dos ambientes de programação Claude Code e Codex, os autores aplicaram ao HSS o que chamam de manipulação visual dinâmica. No subconjunto de 388 tarefas usado nessa avaliação, o melhor setup chegou a 59,3%. O paper é direto: o setup agêntico reduz, mas não fecha a lacuna.
O termo "manipulação visual dinâmica" não vem com manual no material publicado, e o ganho admite leitura inferida: o agente ganha ações sobre a mídia, como recortar, ampliar ou reexaminar um trecho, em vez de receber apenas mais tokens de raciocínio. É o padrão que a engenharia de agentes já aplica em navegação de código e busca, agora apontado para os olhos.
Duas ressalvas de leitura. A primeira: 59,3% num subconjunto de 388 tarefas não se compara diretamente ao 53,6% do placar geral, que roda nas 522. A segunda: o número é do melhor setup testado, não de qualquer agente. Ainda assim, a direção importa para quem constrói, e é a hipótese mais acionável do estudo: dar mãos e olhos ao modelo rendeu mais do que a deliberação sozinha.
Onde a leitura deve parar
Quinhentas e vinte e duas tarefas são poucas para ranking fino. Com margens de erro na casa de quatro pontos, diferenças pequenas entre modelos vizinhos são ruído, e o topo da tabela é o lugar mais frágil do benchmark. O HSS funciona melhor como termômetro de lacuna do que como régua de medalhas.
A triagem rígida e as tarefas inéditas dificultam contaminação de treinamento, mas nada impede conteúdo parecido na web, nem que o release público vire material de treino no próximo ciclo. Benchmarks públicos envelhecem; a versão congelada permite medir o envelhecimento, não evitá-lo.
Os prompts estão em inglês, e o domínio social depende de normas e dinâmicas de poder que variam por cultura. Um baseline de 20 avaliadores não espelha a variedade da espécie, e a leitura social de quem escreveu as tarefas atravessa as perguntas.
O juiz também pede atenção: o Claude-Opus-5 que corrige pertence à mesma família de um dos avaliados, o Claude-Opus-5.5, e as divulgações não discutem esse viés em potencial. Quem usar o HSS para decisão comparativa precisa saber que a nota final passa por um concorrente na mesa.
E o HSS não substitui o que já existe: o MMMU sonda conhecimento acadêmico multimodal de nível universitário, e o Vibe-Eval é um conjunto difícil de sondagem visual para modelos visão-linguagem. O HSS mede outro eixo, o conhecimento implícito de mundo, com outro instrumento, resposta aberta corrigida por rubrica. Benchmarks se somam.
O benchmark na esteira de avaliação
O dataset é aberto, licença MIT, e pronto para pipeline. No Hugging Face, cada linha expõe task_id, domínio, subdomínio, tipo de mídia, caminho do arquivo, prompt, resposta de referência, rubrica e o número de critérios de cada tarefa, com a mídia em pastas de imagem e vídeo. Carregar é uma linha:
from datasets import load_dataset
hss = load_dataset("ScaleAI/HSS")Três usos se destacam numa suíte interna de avaliação, todos amparados no que o próprio benchmark praticou:
- Diagnosticar percepção separada do raciocínio: se o sistema passa em testes de lógica e falha em tarefas estilo HSS, o remédio não é prompt mais longo, é entrada visual melhor.
- Rodar a ablação de mídia como controle: sem imagem, o desempenho deve despencar, e 6,6% é o piso documentado do GPT-6-astra. Se não despencar, a tarefa está adivinhável pelo texto.
- Particionar por domínio e mídia: social e vídeo são os pontos fracos documentados; seleção de quadros e resolução temporal são os primeiros suspeitos numa pipeline de vídeo.
O custo de tokens cabe na conta. Uma passada pelas 522 tarefas, com a média observada de 4.046 tokens de raciocínio por tarefa, fica na ordem de 2,1 milhões de tokens de deliberação por modelo, antes de contar a mídia de entrada. Em níveis máximos de esforço, não é o teste que roda a cada commit.
No relatório, use a linguagem do benchmark: pass@1 com média de três execuções, margem de erro e a versão congelada do release. Sem isso, comparação interna vale pouco.
O abismo não é de lógica
O julgamento que o HSS sustenta: o benchmark é bem construído, com curadoria rígida (15,1% de aceitação em três rodadas de revisão), controles de validade (ablação de mídia, baseline humano), dados públicos sob licença permissiva e correção por rubrica. E a lacuna que ele mede é real, grande e localizada: os modelos raciocinam bem dentro do que enxergam, e enxergam mal. Quase todos os erros, 94%, nascem na percepção ou na inferência latente, não na lógica. Orçamento de tokens não conserta sozinho um problema que nasce antes do raciocínio, na retina artificial.
Para equipes técnicas, o recado é duplo: meça percepção e raciocínio separadamente, e teste ferramentas visuais (recorte, ampliação, reexame de quadros) antes de pagar por mais deliberação. Para a indústria, o recado é mais desconfortável: aprovação em exames profissionais segue compatível com o mesmo sistema que hesita diante de uma lancheira.
Fica, no fim, uma inversão do nome. O título celebra o sentido que a máquina não tem; as 522 tarefas sugerem o contrário. O que falta aos modelos não é um sexto sentido, é o resto deles. A criança que diz "não cabe" não calculou volume: lembrou de dez lancheiras e decidiu em meio segundo. A esse preço, 93,1% não é sentido a mais. É experiência de mais.
