Pular para o conteúdo
    Artigo

    PhAI Labs leva arquitetura JEPA da física à oncologia com decomposição ortogonal

    Pesquisadores adaptam a arquitetura JEPA com fatoração ortogonal para criar um modelo de mundo preditivo testado em sete áreas científicas.

    Filipe Mendes

    6 de out. de 2026 · 8 min de leitura

    Placa de micropoços transparente sobre bancada de laboratório cinza-escura, com micropipeta multicanal em suporte estático em foco suave ao fundo.
    Instrumentos de cultura celular e ensaios biomédicos utilizados na validação experimental de predições oncológicas em laboratório.

    Modelos de mundo buscam prever estados futuros sem a necessidade de reconstruir cada detalhe irrelevante do ambiente. Em vez de regenerar pixels ou coordenadas atômicas no nível de ruído, a arquitetura preditiva de incorporação conjunta (JEPA, na sigla em inglês para Joint-Embedding Predictive Architecture) projeta contexto e alvo em um espaço latente abstrato. O consenso em aprendizado profundo estabelece que essa abstração reduz o custo computacional e evita o desperdício de capacidade característico dos modelos generativos baseados em difusão ou autorregressão de dados brutos. Quando submetida a sistemas dinâmicos complexos, no entanto, a formulação padrão da JEPA apresenta uma falha estrutural conhecida: a predição monolítica.

    Quando um único preditor processa todo o vetor latente, os gradientes associados aos componentes de alta variância dominam o treinamento. Variações lentas, sutis ou de menor energia acabam sufocadas, criando um modelo que prevê muito bem a macroestrutura e falha miseravelmente na dinâmica fina. Para contornar essa barreira, pesquisadores da PhAI Labs (abre em nova aba) em colaboração com Stanford, Oxford, Princeton, CUHK e Fudan propuseram o JEPA-Anything (abre em nova aba), uma extensão da arquitetura desenhada para operar de forma invariante através de sete domínios científicos distintos.

    A proposta abandona a predição centralizada em favor da decomposição em subespaços complementares. O objetivo é transformar uma abordagem originalmente restrita à visão computacional em uma interface comum de previsão e intervenção em problemas da física de fluidos, dinâmica molecular e imunoterapia oncológica.

    Bancada de laboratório com três recipientes de quartzo alinhados contendo líquido viscoso, cristais translúcidos e solução salmão com ponta de micropipeta.
    Amostras experimentais representam os domínios de física de fluidos, dinâmica molecular e oncologia celular abordados pela arquitetura JEPA-Anything.

    O gargalo da capacidade preditiva e a fatoração ortogonal

    Uma JEPA tradicional utiliza um codificador de contexto, um codificador de alvo atualizado por média móvel exponencial (EMA) e um preditor latente unificado. Se a representação do estado alvo possui dimensão $d$, o modelo calcula um único mapeamento $P(z_{context}) \approx z_{target}$. Se o sistema sob observação contiver componentes com escalas temporais muito discrepantes, o preditor prioriza os modos dominantes. Ruídos coerentes de baixa amplitude, essenciais para transições de fase ou reações químicas, simplesmente desaparecem da representação latente.

    A intervenção matemática introduzida no JEPA-Anything é denominada Fatoração Preditiva Ortogonal (OPF, na sigla em inglês). A técnica divide o vetor alvo latente de dimensão $d$ em $K$ subespaços aprendidos de dimensão $r$, de modo que $d = K \times r$. Na maioria dos experimentos do estudo, os autores fixaram $K = 4$.

    Cada um desses subespaços opera com um módulo preditor dedicado. Para garantir que esses módulos independentes não aprendam representações redundantes, uma restrição de ortogonalidade força cada via a capturar facetas complementares da dinâmica temporal. Os pesquisadores não rotulam manualmente o papel funcional de cada subespaço; a especialização emerge puramente da minimização de erro e da penalidade de covariância entre os fatores. Ao final da etapa de projeção, as predições parciais são recombinadas no espaço latente total por meio da pseudoinversa de Moore-Penrose da matriz de projeção.

    A consequência estrutural é direta: sinais dinâmicos mais fracos mantêm seus próprios canais de retropropagação sem sofrer cancelamento por gradientes de variáveis com maior amplitude numérica.

    Do tênis bidimensional às equações de Burgers

    O primeiro indício da utilidade prática da fatoração ortogonal aparece em tarefas de controle com intervenção causal deliberada. Em um ambiente controlado de Interventional Pong, onde perturbações externas alteram a trajetória dos elementos em tela, o erro de predição sob uma única intervenção caiu 34,8% em relação a uma JEPA padrão ajustada sob as mesmas condições de treino e capacidade de parâmetros. Para cenários com combinações compostas de intervenções que nunca foram apresentadas durante o treinamento, o erro caiu 13%.

    Dez tarefas de dinâmica matched serviram para comparar a formulação tradicional com a formulação fatorada. Na equação de Burgers, equação diferencial parcial clássica utilizada para modelar dinâmicas de fluidos compressíveis e formação de ondas de choque no benchmark APEBench, o erro de predição de estado no rollout inicial despencou aproximadamente 44,7%.

    3 passos à frente preservam a vantagem quase intacta, mas a extensão da trajetória revela o comportamento do acúmulo de erro autoregressivo no espaço latente. Ao longo de 50 passos sucessivos de simulação na equação de Burgers, a vantagem competitiva do JEPA-Anything encolheu para cerca de 3%. O modelo não revoga o problema fundamental do drift cumulativo em rollouts longos, embora preserve a fidelidade topológica por horizontes mais extensos do que arquiteturas não fatoradas.

    Em simulações de dinâmica molecular, a arquitetura manteve a estabilidade ao lidar com quatro sistemas moleculares: água, quartzo, paracetamol e benzeno. Tanto nos testes de passo único quanto nos horizontes estendidos de 100 passos sucessivos, a abordagem baseada em fatores ortogonais registrou os menores erros médios entre os métodos comparados, capturando interações interatômicas sem requerer potenciais de força empíricos pré-programados.

    Validação em bancada úmida no câncer de fígado

    A utilidade de um modelo de mundo científico não reside apenas em prever o próximo quadro de uma simulação estável, mas em antecipar o resultado de perturbações pontuais em sistemas caóticos. Os pesquisadores da PhAI Labs alimentaram a arquitetura com dados genômicos, níveis de expressão proteica e telas de perturbação por CRISPR associadas ao carcinoma hepatocelular.

    A leitura analítica dos subespaços latentes apontou para uma combinação específica de alvos terapêuticos: a interleucina 18 (IL-18), citocina que atua no recrutamento e ativação de células de defesa, combinada ao bloqueio farmacológico da ecto-5'-nucleotidase (CD73). O tumor utiliza a enzima CD73 para gerar adenosina extracelular, um metabólito que desativa linfócitos infiltrantes e estabelece uma barreira imunossupressora local.

    Diferente de trabalhos puramente computacionais que encerram sua validação em curvas ROC geradas contra bases de dados públicas, o grupo levou o candidato aos testes biológicos em bancada úmida. O protocolo experimental avaliou a combinação em quatro configurações: co-culturas celulares de hepatocarcinoma com células mononucleares periféricas humanas, organoides derivados de três pacientes distintos, fragmentos de tecido tumoral intacto ex vivo de outros três pacientes e modelos murinos in vivo.

    Os resultados laboratoriais sustentaram a indicação do modelo. Nas amostras de organoides e tecido tumoral, a terapia combinada eliminou uma fração significativamente maior de células cancerígenas do que a administração isolada de IL-18 ou o bloqueio exclusivo de CD73. A análise imunológica confirmou o aumento da desgranulação e citotoxicidade de linfócitos T citotóxicos e células Natural Killer (NK).

    O sucesso laboratorial em culturas primárias e modelos animais não garante a eficácia clínica da intervenção. O estudo não constitui ensaio clínico, não investigou janelas terapêuticas completas de toxicidade sistêmica em humanos e não define posologias utilizáveis em oncologia médica. O experimento demonstra que a decomposição latente gerou uma hipótese biológica mecanisticamente plausível e testável, sem que o operador humano tivesse pré-programado as rotas de sinalização imunológica no grafo de predição.

    Leis físicas latentes e o custo do viés de seleção

    A descoberta de leis fenomenológicas sem conhecimento a priori é outro teste imposto a modelos fundamentais de física. Os pesquisadores treinaram a arquitetura sobre dados de trajetórias orbitais simuladas em mecânica celeste, ocultando deliberadamente qualquer parâmetro analítico formal, como massas gravitacionais, constantes fundamentais ou leis de Newton.

    Ao decompor a dinâmica orbital nos subespaços preditivos, o sistema recuperou uma relação escalar consistente entre a frequência de revolução e o raio da órbita. A terceira lei de Johannes Kepler dita que o quadrado do período orbital é diretamente proporcional ao cubo do semi-eixo maior da órbita, o que equivale a um expoente de decaimento de frequência orbital igual a -1,5 em relação ao raio. A inclinação estimada pelo modelo latente convergiu para o expoente empírico de -1,4991.

    A precisão do valor numérico impressiona, mas a metodologia impõe ressalvas. O relatório técnico indica que os pesquisadores avaliaram apenas uma única execução de treinamento (run) para essa derivação, selecionando deliberadamente a trajetória que atingiu o menor erro residual no conjunto de validação. A extração de constantes fundamentais em aprendizado não supervisionado costuma apresentar dispersão considerável entre sementes aleatórias de inicialização. Apresentar o resultado baseado no melhor ajuste isolado comprova a capacidade representacional máxima da rede, mas não estabelece a estabilidade estocástica do processo de descoberta.

    Domínio de TesteBenchmark / SistemaMétrica / Ganho RelatadoObservação Metodológica
    Intervenção CausalInterventional PongRedução de 34,8% no erro (1 intervenção)Ganho cai para 13% em intervenções combinadas não vistas
    Mecânica dos FluidosAPEBench (Eq. Burgers)Redução de ~44,7% no erro inicialVantagem sobre JEPA padrão cai para ~3% em 50 passos
    Dinâmica MolecularÁgua, quartzo, benzeno, paracetamolMenor erro em rollouts de 1 e 100 passosEstabilidade mantida em sistemas orgânicos e inorgânicos
    BiomedicinaCarcinoma HepatocelularSinergia citotóxica: IL-18 + anti-CD73Validado em organoides (3 pacientes) e camundongos; sem testes clínicos
    Mecânica CelesteÓrbitas KeplerianasExpoente empírico de -1,4991 vs -1,5 teóricoExtraído de uma única run selecionada pelo menor erro

    O papel da predição em espaço latente na engenharia de IA

    A tentativa de construir modelos de mundo universais frequentemente oscila entre dois extremos. De um lado, estão os modelos autoregressivos aplicados indiscriminadamente sobre sequências de texto, gráficos moleculares ou tokens de imagem, cuja dependência de amostragem no nível de detalhe superfaturado cobra preços proibitivos em inferência. De outro, encontram-se os simuladores clássicos, como métodos de dinâmica molecular ab initio ou integradores de equações diferenciais, cuja precisão matemática é impecável, porém incapaz de assimilar dados empíricos multimodais desprovidos de equações governantes fechadas.

    O trabalho publicado pela PhAI Labs (abre em nova aba) demonstra que a arquitetura idealizada por Yann LeCun na Meta pode expandir sua utilidade além do processamento de vídeo e controle robótico. A inclusão da fatoração ortogonal alivia o gargalo de alocação de capacidade preditiva e transforma o espaço latente em uma ferramenta de sondagem física e biológica.

    Para desenvolvedores e engenheiros envolvidos no desenho de modelos preditivos, o recado é eminentemente prático: ao lidar com sistemas compostos por dinâmicas multiescala, insistir em preditores latentes monolíticos introduz um teto de aprendizado desnecessário. A separação formal de representações em subespaços ortogonais oferece uma saída computacionalmente tratável, contanto que o custo acumulado de erro em rollouts longos permaneça no radar da implementação.

    Filipe Mendes

    Ver perfil completo