53,6%: é a melhor pontuação registrada no Humanity's Sixth Sense (abre em nova aba) (HSS), o benchmark de raciocínio visual intuitivo que a Scale Labs lançou em 7 de outubro de 2026, em parceria com a Elorian. O número mede a proporção de tarefas resolvidas pelo GPT-6-astra, o modelo mais forte entre os 25 avaliados, rodando com esforço máximo de raciocínio. A linha de base humana, medida com 20 anotadores, ficou em 93,1%. Entre o que uma pessoa percebe de relance e o que a fronteira dos modelos multimodais consegue extrair com as configurações mais caras, há um intervalo de quase 40 pontos.
Esse intervalo é a tese do benchmark. A maior parte da avaliação em visão computacional mede reconhecimento explícito: classificar um objeto, responder o que aparece na cena, detectar texto. O HSS pergunta outra coisa. As tarefas, escritas por humanos, sondam a estrutura implícita que as pessoas inferem de uma imagem ou vídeo sem esforço deliberado: o que provavelmente aconteceu antes, quem na cena detém autoridade, se um objeto está alcançável, o que a expressão de alguém sugere sobre a próxima ação. Francis deSouza, executivo da Scale, resumiu a inversão no anúncio do lançamento:
A IA normalmente é medida em problemas que são difíceis para as pessoas. O Humanity's Sixth Sense, nosso benchmark mais recente com a @ElorianAI, testa os julgamentos visuais cotidianos que fazemos sem pensar. Humanos pontuaram 93,1%. O modelo de IA mais forte pontuou 53,6%.

Um benchmark para o que se percebe sem pensar
O HSS contém 522 tarefas abertas (open-ended), distribuídas sobre 288 imagens e 234 clipes de vídeo, somando 17,6 horas de material em vídeo, com clipe mediano de 76 segundos e o mais longo chegando a 28 minutos. As tarefas cobrem quatro domínios e onze subdomínios:
- Temporal & Causal Dynamics: extrapolação (o que acontece a seguir) e retrodicção (o que levou à cena atual).
- Physical & Spatial Logic: alcance espacial, objetos escondidos ou fora do campo de visão, affordance e exequibilidade de ações.
- Social Understanding: papel social, dinâmicas de norma e poder, teoria da mente.
- Abstract & Contextual Inference: mudança e consequência, padrões e pareidolia.
A diferença em relação a um benchmark de Visual Question Answering tradicional está em duas decisões de desenho. Primeira: não há múltipla escolha. O modelo responde em forma livre, o que elimina o atalho de eliminar alternativas sem realmente raciocinar. Segunda: a correção não é binária por similaridade de texto. Cada tarefa carrega critérios de rubrica, afirmações atômicas que uma resposta correta precisa satisfazer, somando 723 critérios no conjunto completo. Um juiz LLM, o Claude-Opus-5, compara a resposta do modelo contra a rubrica, e a tarefa só conta como resolvida quando todos os critérios são atendidos. O juiz, ironia dos benchmarks modernos, é outro modelo (com os problemas que isso acarreta, tratados adiante).
A métrica oficial é o pass@1, a taxa de acerto em uma única tentativa, calculada aqui como média sobre três tentativas, com intervalos de confiança bootstrap de 95%. Todos os números confirmatórios do leaderboard (abre em nova aba) vêm de um release congelado das 522 tarefas, o que impede ajuste de prompt ao conjunto de teste sem quebrar a comparabilidade.
A triagem de 15,1%: como o dataset foi construído
O número que melhor descreve o rigor metodológico não é o placar, é a taxa de aceitação. Foram elaboradas 3.466 tarefas por autores humanos; 522 sobreviveram a três rodadas independentes de revisão, uma aceitação de 15,1%. O funil serve para eliminar tarefas ambíguas, triviais ou que um modelo resolve por conhecimento de mundo sem precisar olhar a mídia, o tipo de falha que contaminou benchmarks anteriores de raciocínio.
A validação do juiz merece atenção separada, porque é o ponto em que benchmarks com correção por LLM costumam desmoronar. A Scale refez a correção de cinco modelos usando juízes de três fornecedores distintos. Os rankings permaneceram idênticos (correlação de postos ρ = 1,0) e a concordância entre juízes excedeu 95%. Isso não prova que o juiz está certo, prova que o juiz é consistente entre famílias de modelos diferentes, o que é um resultado razoável e honestamente divulgado.
Há ainda uma decisão de engenharia que interessa a quem avalia modelos profissionalmente: a Scale publicou não só o dataset, mas um harness de avaliação completo, com registro de modelos, prompts de avaliação e prompts de correção. O conjunto está disponível no Hugging Face (abre em nova aba) (repositório ScaleAI/HSS), em licença MIT, com 11,2 GB de mídia e colunas como task_id, domain, subdomain, media_type, prompt, golden_response e rubric_criteria. A estrutura de dados é reutilizável para montar avaliações internas com rubrica no mesmo formato, o que talvez seja o subproduto mais duradouro do trabalho.
Os resultados, domínio por domínio
O paper (abre em nova aba) de 27 autores descreve os experimentos, e o leaderboard consolida os números confirmatórios. O quadro geral:
| Indicador | Valor |
|---|---|
| Linha de base humana (20 anotadores) | 93,1% |
| Melhor modelo (GPT-6-astra, esforço máximo) | 53,6% |
| Mediana entre 25 modelos de oito fornecedores | 30,9% |
| Domínio mais fraco (Social Understanding) | 24,4% |
| Média dos demais três domínios | 34,1% |
| Melhor configuração agêntica (subconjunto de 388 tarefas) | 59,3% |
Três leituras se destacam. A primeira: a maioria dos modelos está muito abaixo do líder. O GPT-6-astra chega a 53,6%, mas a mediana dos 25 modelos avaliados, vindos de oito fornecedores, é de 30,9%, e a maioria fica abaixo de 40%. O gap não é um problema de um modelo atrasado, é um estado da arte inteira distante do comportamento humano.
A segunda leitura: raciocinar mais não resolve. A média de tokens de raciocínio por tarefa, considerando os 25 modelos, é de 4.000. O modelo pode gastar milhares de tokens encadeando inferências sobre uma cena e ainda assim errar a leitura básica do que está na tela. A-third: o vídeo piora tudo. Para 23 dos 25 modelos, tarefas de vídeo são mais difíceis que tarefas de imagem, com queda média de 7,3 pontos. Como as tarefas temporais e causais dependem de vídeo, o padrão faz sentido: é exatamente na dinâmica temporal que a inferência implícita mais pesa.
O recorte por domínio confirma onde está o problema. Social Understanding é o pior domínio para 21 dos 25 modelos: 24,4% contra 34,1% nos outros três. Teoria da mente, dinâmicas de poder e papéis sociais exigem mapear estados mentais invisíveis a partir de pistas sutis de cena, e nenhum modelo avaliado chega perto de fazê-lo de forma confiável.
O diagnóstico: as falhas são de percepção, não de lógica
A análise de erros do HSS é a parte tecnicamente mais interessante, e vale citar os números com precisão. Em 8.573 falhas catalogadas, 94% são atribuíveis a percepção ou inferência latente, e apenas 5% a lógica defeituosa. Ou seja: quando o modelo erra, quase nunca é porque encadeou mal o raciocínio. É porque partiu de uma leitura errada da cena.
Esse diagnóstico tem um controle experimental que o sustenta. Os autores removeram a imagem ou o vídeo da tarefa e mediram novamente o GPT-6-astra: a pontuação cai para 6,6%. Isso é evidência de que o modelo de fato usa a entrada visual, não está respondendo por prior de texto do prompt. E cria um contraste instrutivo entre duas explicações possíveis para o gap. Se as falhas fossem majoritariamente lógicas, mais tokens de raciocinio ou melhores políticas de cadeia de pensamento fechariam o intervalo. Como as falhas são de percepção, a melhora precisa vir de outro lugar: representação visual mais fina, atenção a detalhes da cena, mecanismos de re-inspeção.
O que sobra quando a lógica não é o gargalo? A percepção. E é aqui que o experimento agêntico entra. A equipe testou uma configuração em que o modelo manipula dinamicamente a entrada visual, reexaminando trechos da mídia antes de responder. O resultado foi 59,3% em um subconjunto de 388 tarefas, acima do melhor resultado de passo único (ainda que a comparação exija cautela, pois os conjuntos de tarefas têm tamanhos diferentes). A conclusão dos autores é medida e correta: a manipulação visual estreita o gap, não o fecha.
Limitações: juiz único, mídia sem áudio e contaminação
O próprio anúncio da Scale lista as limitações, e a lista merece ser levada a sério. A primeira é o canal: o HSS avalia apenas o visual. Clipes de vídeo chegam sem áudio, o que descarta pistas de fala, som ambiente e trilha, todas relevantes para inferência social e temporal em cenários reais. A segunda é a dependência do juiz. O teste com três fornecedores e concordância acima de 95% é tranquilizador, mas não elimina a possibilidade de um viés compartilhado entre juízes, todos modelos treinados em dados semelhantes.
A terceira é a mais espinhosa para a durabilidade do benchmark: contaminação. As 17,6 horas de vídeo vêm de mídia pública da web, e o dataset completo está publicamente disponível com licença MIT. Um modelo treinado depois de outubro de 2026 pode ter visto tanto os clipes quanto as respostas douradas. O release congelado protege a comparabilidade histórica dos números já publicados, mas qualquer resultado futuro de um modelo com cutoff posterior precisa ser lido com essa ressalva. Em benchmarks dessa escala (522 tarefas é pouco para estatística fina por subdomínio), a contaminação não precisa ser total para distorcer o placar: basta que as mídias mais memoráveis tenham entrado em algum corpus de treino.
Há uma limitação adicional que a Scale não explicita, mas que se depreende do desenho: a linha de base humana de 93,1% vem de 20 anotadores, presumivelmente envolvidos ou ao menos alinhados com os critérios de rubrica. É uma alegação da empresa, razoável, mas não uma medição independente.
O que isso significa para quem constrói com modelos multimodais
Para desenvolvedores, o valor do HSS é menos o ranking e mais o mapa de falhas. Quatro implicações práticas:
- Não confie em MLLMs de fronteira para inferência implícita em produção. Se o seu produto depende de leitura social, causal ou espacial não explícita (análise de vídeo, entendimento de interface, percepção robótica, moderação contextual), 53,6% do melhor modelo significa que quase metade das leituras estará errada no caso médio, e a distribuição por domínio piora no social (24,4%).
- Tokens de raciocínio não compram percepção. A média de 4.000 tokens de raciocínio por tarefa, com resultados medianos de 30,9%, sugere que aumentar budget de raciocínio tem retorno decrescente quando a entrada visual foi mal processada.
- Re-inspecção visual agêntica é uma direção real, não hype. A configuração com manipulação dinâmica da entrada ganhou quase 6 pontos sobre a melhor baseline. Padrões de ferramenta (tool use) que dão ao modelo meios de ampliar, rever ou quadar a mídia são a engenharia mais próxima de atacar o gargalo identificado: percepção.
- O desenho de avaliação é reutilizável. Rubricas com critérios atômicos, juiz LLM com verificação entre fornecedores, pass@1 sobre múltiplas tentativas e release congelado formam um template defensável para avaliações internas de domínio, em que contaminação por mídia pública pode ser substituída por dados proprietários.
O julgamento final, com os dados na mesa: o HSS é um instrumento diagnóstico crível, bem validado para o tamanho que tem, e sua tese central resiste ao escrutínio. O gap de quase 40 pontos até a linha de base humana é o número que circula nos títulos, mas é o menos interessante. Mais revelador é o fato de que 94% das falhas são de percepção e inferência latente, e apenas 5% de lógica: os modelos avaliados raciocinam competentemente sobre representações visuais ruins, o que desloca a fronteira de pesquisa de cadeias de pensamento para representação sensorial. O experimento agêntico, que ganhou quase 6 pontos com re-inspecção da mídia, aponta na mesma direção.
As ressalvas não anulam o achado; elas delimitam o prazo de validade. Um benchmark público de 522 tarefas com mídia extraída da web vai sofrer pressão de contaminação, e o juiz único de referência, mesmo com o teste entre fornecedores, mantém uma dependência estrutural que qualquer consumidor do leaderboard deveria ter em mente. Dentro desses limites, a leitura para quem desenvolve é direta: para tarefas que humanos resolvem sem pensar, os modelos de visão atuais ainda pensam muito e enxergam pouco, e a engenharia que mais rende nos próximos ciclos provavelmente é a que dá aos modelos meios de olhar de novo.
