Pular para o conteúdo
    Notícia

    Scale lança benchmark do 'sexto sentido' visual: humanos 93,1%, melhor IA 53,6%

    A Scale Labs lançou com a Elorian o benchmark Humanity's Sixth Sense, com 522 tarefas de raciocínio visual intuitivo em imagens e vídeos. Pessoas acertam 93,1%; o melhor modelo avaliado, o GPT-6-astra, para nos 53,6%.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    8 de out. de 2026 · 4 min de leitura

    Seguir no Google
    Cozinha residencial à noite com panela de alumínio transbordando leite sobre a chama de um fogão a gás, vapor denso subindo na luz âmbar; mão adulta gira o botão do queimador com leve movimento, e uma câmera de segurança de teto aponta fixa
    Enquanto o instinto humano resolve a cena num olhar, o olhar mecânico apenas registra: benchmark de raciocínio visual mostra que pessoas acertam 93,1% contra 53,6% do melhor modelo avaliado.

    A Scale Labs, laboratório de pesquisa da Scale AI, lançou em 7 de outubro de 2026 o benchmark Humanity's Sixth Sense (abre em nova aba) (HSS), criado em parceria com a Elorian para medir o raciocínio visual intuitivo, o julgamento rápido que qualquer pessoa faz ao olhar uma foto ou um vídeo, sem parar para analisar. O placar do lançamento mostra o tamanho da distância entre máquinas e gente: nas 522 tarefas do teste, pessoas acertam 93,1%, e o melhor modelo avaliado, o GPT-6-astra, para nos 53,6%.

    Benchmark, em informática, é uma bateria padronizada de testes usada para comparar desempenho. A do HSS reúne 522 tarefas abertas, construídas sobre 288 imagens e 234 vídeos, com 17,6 horas de gravação no total. Metade dos clipes dura menos de 76 segundos; o mais longo chega a 28 minutos.

    O artigo técnico (abre em nova aba) que acompanha o lançamento argumenta que os testes visuais existentes cobram ou análise deliberada de nível de especialista, ou percepção de baixo nível, e deixam o raciocínio intuitivo praticamente sem medição. O HSS existe para fechar essa lacuna.

    Pessoa de costas e meio perfil, com camiseta simples e calça confortável, de pé diante de uma geladeira aberta em uma cozinha doméstica banhada por luz quente de fim de tarde, segurando um pote de vidro com molho vermelho que escorre pela l
    Julgamentos visuais do cotidiano, como decidir se um alimento ainda serve, são intuitivos para humanos — e ainda desafiam os melhores modelos de IA, que acertaram pouco mais da metade das tarefas do novo benchmark de raciocínio visual.

    Os nomes das áreas indicam o tom cotidiano das perguntas:

    • Dinâmica temporal e causal: o que mudou na cena e o que deve acontecer;
    • Lógica física e espacial: se um caminho é viável, se um objeto aguenta um uso;
    • Compreensão social: papéis, normas e relações de poder entre pessoas;
    • Inferência abstrata e contextual: padrões, extrapolação e o que a cena não mostra.

    Exemplos: um subdomínio chamado Alcance espacial pergunta se dá para atravessar um lugar; Retrodução pede uma dedução sobre o que aconteceu antes da cena filmada; Teoria da mente quer saber o que a pessoa no vídeo está pensando. O executivo Francis deSouza, que anunciou o lançamento no X, resumiu a proposta:

    A IA normalmente é medida em problemas que são difíceis para as pessoas. O Humanity's Sixth Sense, nosso mais novo benchmark com a @ElorianAI, testa os julgamentos visuais do dia a dia que fazemos sem pensar.

    — Francis deSouza (@fdesouza), 7 de out. de 2026, no X

    A construção foi peneirada com rigor. Das 3.466 tarefas escritas pela equipe, só 522 sobreviveram a três rodadas independentes de revisão, uma taxa de aceite de 15,1%. A linha de base humana veio de 20 participantes. Do outro lado do placar, 25 modelos multimodais, sistemas que leem texto, imagem e vídeo, de oito fabricantes.

    Na correção, os modelos respondem em texto livre, e um juiz automático, o Claude-Opus-5, confere cada resposta com base em critérios que somam 723 itens. A métrica principal é a taxa de acerto, com média de três execuções por tarefa e intervalo estatístico de confiança de 95%. A tabela pública de classificação (abre em nova aba) traz o recorte completo.

    Quem respondeTaxa de acerto
    Pessoas (20 participantes)93,1%
    GPT-6-astra (esforço máximo de raciocínio)53,6% (± 4,1 pontos)
    GPT-6.1-Sol (esforço máximo)46,6% (± 3,8)
    Claude-Opus-5.5 (esforço extra-alto)44,6% (± 3,8)
    Mediana dos 25 modelos30,9%

    A maioria dos modelos avaliados fica abaixo de 40%, o que torna a mediana de 30,9% um retrato fiel do atraso.

    Os erros têm um padrão que importa mais que o placar. A equipe da Scale analisou 8.573 respostas erradas: 94% dos problemas vêm de percepção ou de inferência latente, casos em que o modelo não entende o que vê ou não deduz o que a cena implica, e só 5% são falhas de lógica. A leitura dos autores é de que as máquinas até raciocinam, mas enxergam mal. Um dado reforça isso: sem a imagem ou o vídeo, o GPT-6-astra desaba para 6,6%.

    Dois pontos fracos aparecem com clareza. Em compreensão social, os modelos somam em média 24,4%, contra 34,1% nas outras três áreas. E o vídeo é mais difícil que a imagem para 23 dos 25 modelos, por 7,3 pontos em média. O esforço não é o gargalo: cada modelo gasta, em média, 4.046 tokens de raciocínio por tarefa, em que token é um pedaço de palavra, e ainda assim erra.

    Configurações agênticas, em que o modelo pode manipular a imagem dinamicamente dentro de ferramentas como Claude Code e Codex, melhoram o quadro: a melhor delas chega a 59,3% num subconjunto de 388 tarefas. O artigo do projeto avalia que esse caminho estreita a diferença para os humanos, mas não a fecha.

    Para quem constrói sistemas que enxergam, a consequência é prática. Existe agora uma régua aberta para medir bom senso visual antes de deixar um modelo decidir sozinho diante de imagens, e o resultado do lançamento já adianta a resposta: com 53,6% de acerto onde qualquer pessoa passa de 93%, os olhos humanos seguem necessários.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo