Pular para o conteúdo
    Notícia

    H-JEPA divide planejamento visual em camadas e amplia acerto em robótica

    Pesquisadores da NYU, INRIA e Brown criaram o H-JEPA, modelo que organiza metas visuais em diferentes níveis de tempo e eleva o sucesso de tarefas complexas.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    7 de out. de 2026 · 3 min de leitura

    Seguir no Google
    Garra robótica articulada em preto fosco posicionada com precisão milimétrica diante de placas translúcidas em camadas em laboratório moderno.
    Estrutura hierárquica divide metas de planejamento visual para refinar o controle e a precisão em tarefas robóticas.

    Ensinar um sistema autônomo a tomar decisões observando apenas imagens costuma esbarrar em um obstáculo prático: o excesso de detalhes irrelevantes a cada fração de segundo. Se uma máquina precisa conduzir um braço mecânico ou guiar um veículo até um destino distante, tentar prever pixel por pixel o que vai acontecer a cada instante sobrecarrega o processamento e desvia a atenção da meta final.

    Modelos preditivos tradicionais tentam contornar esse obstáculo projetando o futuro em um espaço matemático abstrato, chamado de espaço latente, onde os dados visuais brutos viram representações simplificadas. Quando esses sistemas operam em uma única escala de tempo, eles ainda enfrentam dificuldades para coordenar ações imediatas com metas de longo prazo, já que misturam mudanças rápidas do ambiente com objetivos que demoram minutos para se concretizar.

    Uma equipe de pesquisadores da Universidade de Nova York (NYU), da INRIA Paris, da Universidade Brown e da iniciativa Advanced Machine Intelligence apresentou uma alternativa para essa limitação. Trata-se do H-JEPA (abre em nova aba) (sigla em inglês para Arquitetura Preditiva de Incorporação Conjunta Hierárquica), um método que ensina a inteligência artificial a planejar trajetórias visuais dividindo o problema em múltiplos níveis de tempo e de abstração. O trabalho foi detalhado em artigo submetido ao repositório acadêmico arXiv (abre em nova aba).

    Braço robótico em bancada de laboratório visto através de camadas de placas translúcidas de acrílico em primeiro plano, com pesquisador ao fundo em desfoque.
    Estruturação visual em diferentes níveis orienta o planejamento de movimentos em braços robóticos de laboratório.

    Os autores do estudo, Wancong Zhang, Basile Terver, Michael Rabbat, Yann LeCun e Randall Balestriero, desenvolveram uma estrutura em que cada camada da hierarquia atua de forma especializada. A camada mais alta observa o cenário de maneira ampla, ignorando oscilações visuais passageiras para se concentrar no objetivo final. As previsões geradas no topo descem pela estrutura e se transformam em metas intermediárias para a camada logo abaixo. O nível mais baixo da cadeia fica responsável apenas por calcular os movimentos imediatos e concretos necessários para alcançar essas etapas menores.

    Essa divisão vertical permite que as camadas superiores descartem dados instáveis e retenham apenas o estado relevante para a tarefa, embora a sincronização entre os níveis exija um treinamento conjunto cuidadoso de ponta a ponta. Como cada nível opera em seu próprio espaço de representação, o sistema não precisa gastar poder computacional tentando prever detalhes imprevisíveis de curto prazo quando está apenas traçando uma rota geral.

    Nos testes práticos divulgados pelos pesquisadores, o modelo superou as abordagens anteriores em quatro ambientes simulados de navegação e manipulação de objetos, incluindo tarefas conhecidas como FourRoom Distractors, Push-T e OGBench Cube. O resultado mais expressivo ocorreu no ambiente de navegação complexa Visual AntMaze. Nesse teste, uma versão do H-JEPA configurada com três níveis hierárquicos elevou a taxa de sucesso de 18% para 73% em comparação com o modelo de base plana, chamado LeWM, que opera em uma escala única.

    O salto de desempenho no labirinto virtual veio acompanhado de menor demanda de cálculo para o planejador, mostrando que organizar o raciocínio em etapas temporais poupa esforço de processamento. Análises complementares feitas pelos autores apontaram que o ganho decorre tanto da divisão do tempo em fatias ordenadas quanto da qualidade das representações criadas nos níveis superiores.

    A técnica também foi aplicada a vídeos reais de movimentação de robôs extraídos da base de dados pública DROID. Com o auxílio de supervisão de dinâmica inversa, recurso matemático que ajuda o modelo a deduzir quais forças ou comandos geraram determinado movimento registrado em vídeo, o sistema hierárquico aumentou a fidelidade do planejamento mesmo em trajetórias gravadas fora de ambientes de simulação controlada.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo