Pular para o conteúdo
    Análise

    PIE: como o modelo do Arc Institute usa Perceiver IO para prever perturbações celulares

    Análise técnica da arquitetura do modelo PIE, que integra bases ontológicas curadas e o design do Perceiver IO para prever respostas transcricionais em condições biológicas inéditas.

    Filipe Mendes

    6 de out. de 2026 · 14 min de leitura

    Micrografia em plano fechado mostrando culturas de células biológicas sob iluminação por fluorescência com marcações em azul e verde suave sobre contraste escuro.
    Culturas celulares e perfis moleculares integram bases ontológicas ao aprendizado de máquina para antecipar respostas a perturbações genéticas.

    Um registro individual no banco de dados Gene Ontology, que descreve de forma compacta a afinidade de ligação ou o papel catalítico de uma enzima humana, raramente ultrapassa algumas centenas de bytes em formato textual padronizado. Durante anos, no entanto, a modelagem de aprendizado de máquina aplicada à biologia molecular manteve esses dados textuais ou ontológicos distantes dos modelos neurais focados em transcriptômica de célula única. A praxe analítica consistia em alimentar redes neurais com matrizes brutas de contagem de sequenciamento de RNA celular, deixando que os parâmetros internos do modelo redescobrissem, unicamente a partir de amostras observadas, as complexas redes de regulação gênica. Quando um fármaco inédito ou uma mutação por CRISPR precisa ser testada em um tipo celular nunca antes sequenciado pelo laboratório, essa formulação tradicional colapsa por ausência de sinal empírico direto.

    Para contornar esse estrangulamento conceitual, o grupo liderado por pesquisadores do Arc Institute (abre em nova aba), em conjunto com a Universidade da Califórnia em San Francisco, apresentou o PIE (Perturbation is Everything), desenvolvido por autores como Rishi Verma, Abhinav Adduri, Beatrice Bevilacqua, Basak Eraslan, Dave P. Burke, Hani Goodarzi e Yusuf H. Roohani. O modelo parte da constatação de que a generalização fora de distribuição em biologia celular não pode prescindir do conhecimento prévio acumulado por décadas em bases públicas curadas. Em publicação registrada no bioRxiv (abre em nova aba) em 5 de outubro de 2026, a equipe detalhou como adaptou a arquitetura Perceiver IO para desacoplar a dimensionalidade dos dados de entrada da complexidade computacional da rede, ingerindo anotações heterogêneas para projetar a resposta de expressão gênica em condições biológicas nunca vistas.

    A comunicação oficial do Arc Institute resumiu o princípio orientador da arquitetura:

    A maioria dos modelos de perturbação aprende apenas com experimentos. Nosso novo modelo, PIE, também se baseia em décadas de conhecimento biológico curado para prever quais genes respondem a uma perturbação, mesmo em contextos biológicos e para perturbações que nunca viu.

    — Arc Institute (@arcinstitute), 5 de out. de 2026, no X

    O núcleo do problema que o PIE busca solucionar reside na assimetria combinatória da triagem biológica. Um organismo humano possui dezenas de milhares de genes codificadores de proteínas e incontáveis estados celulares diferenciados. Ensaios como o Perturb-seq combinam perturbações baseadas em CRISPR ou compostos químicos com sequenciamento de RNA de célula única, gerando perfis de perturbação de alta resolução. Esses experimentos são caros, lentos e operam sobre uma fração ínfima do espaço combinatorial total de possíveis pares entre contexto biológico e perturbação experimental.

    Placa de micropoços com amostras celulares translúcidas ao lado de uma micropipeta multicanal em bancada de laboratório de genômica iluminada por luz natural suave.
    Ensaios de triagem celular e sequenciamento de RNA geram dados de alta resolução, mas esbarram na escala dos testes laboratoriais.

    A reparametrização do Perceiver IO para dados moleculares heterogêneos

    Ao transferir a arquitetura Perceiver IO, originalmente proposta por Jaegle e colaboradores em 2022, para o domínio da bioinformática, o PIE reorganizou a tarefa preditiva em torno de efeitos de perturbação em nível populacional, em vez de tentar reconstruir a variância estocástica célula a célula. Modelos de perturbação anteriores que operam a nível de célula individual frequentemente sofrem com a dispersão matemática (dropout) intrínseca aos protocolos de sequenciamento de RNA de baixa cobertura. Ao prever diretamente as alterações médias da expressão e a classificação de genes diferencialmente expressos para cada par composto por contexto e perturbação, o modelo estabelece uma meta de otimização muito mais estável.

    O design do Perceiver IO se apoia no esquema estruturado em três fases: codificação (encode), processamento (process) e decodificação (decode). Em modelos Transformer clássicos baseados em autoatenção global, a complexidade computacional cresce quadraticamente em relação ao comprimento da sequência de tokens de entrada. Esse comportamento inviabilizaria a concatenação direta de perfis transcriptômicos completos, anotações de linhagens celulares, estruturas químicas e listas ontológicas funcionais, cujo conjunto de características pode variar consideravelmente entre diferentes ensaios.

    O mecanismo do PIE resolve esse gargalo ao instituir um conjunto de vetores latentes aprendidos que possui dimensionalidade fixa e pré-determinada, totalmente independente da extensão das entradas. Na fase de codificação, esses vetores latentes realizam atenção cruzada (cross-attention) contra os tokens provenientes das Fontes de Conhecimento (Knowledge Sources). Durante essa passagem, os vetores latentes atuam como um canal de compressão seletiva, consultando e agregando informações espalhadas entre fontes biológicas diversas sem inflar o custo computacional subsequente.

    Fontes Biológicas (Tamanho Variável)
    [Cellosaurus, NCBI, Gene Ontology, DepMap, PubChem] + Controle Basal
                              │
                              ▼ (Atenção Cruzada / Encode)
                Matriz Latente Aprendida (Dimensão Fixa)
                              │
                              ▼ (Autoatenção / Process)
                   Camadas Perceiver Latentes
                              │
                              ▼ (Atenção Cruzada / Decode)
    Predição de Genes Diferencialmente Expressos e Mudança de Expressão

    Uma vez comprimida a informação no espaço latente, a fase de processamento executa blocos empilhados de autoatenção exclusiva entre os próprios vetores latentes. Como o número desses vetores é deliberadamente moderado, o modelo pode aprofundar sua capacidade expressiva através de várias camadas de atenção sem enfrentar as restrições de memória gráfica que paralisam abordagens tradicionais. As relações não lineares entre vias de sinalização celular e respostas químicas são refinadas nesta etapa intermediária do fluxo.

    Na etapa final de decodificação, o PIE recorre a uma nova camada de atenção cruzada orientada por consultas específicas. Uma consulta de contexto recupera as informações sintetizadas pelo bloco latente para emitir as predições transcriptômicas de saída. O modelo não se limita a prever sobre o conjunto exato de genes observados nos tensores de treinamento: a decodificação projeta previsões tanto sobre o vocabulário de genes com os quais teve contato prévio quanto sobre alvos não mapeados diretamente nas fases iniciais de treino.

    A ingestão de fontes ontológicas esparsas

    A flexibilidade de entrada do PIE decorre de sua capacidade estrutural de operar com um conjunto flutuante de fontes de anotação. Em cenários reais de pesquisa médica, uma linhagem celular tumoral pode ter dados detalhados de dependência funcional no repositório DepMap, mas carecer de mapeamento exaustivo em outros bancos; um composto químico pode constar com um registro físico no PubChem, mas sem qualquer teste prévio em ensaios fenotípicos conhecidos. A arquitetura foi desenhada para processar o que estiver disponível, tolerando ausências sem degradação catastrófica de representação.

    As variáveis auxiliares integradas pelo modelo abrangem múltiplas esferas do conhecimento biológico humano:

    • Registros do Cellosaurus: Identificam linhagens celulares através de ontologias formais de tipos teciduais, espécies de origem e aberrações cromossômicas padronizadas.
    • Entradas do NCBI e anotações do Gene Ontology: Caracterizam funções moleculares, processos biológicos e compartimentos subcelulares associados ao gene alvo de uma perturbação.
    • Perfis de dependência genética do DepMap: Capturam padrões de suscetibilidade celular a deleções gênicas em centenas de modelos celulares humanos, indicando vias essenciais de sobrevivência.
    • Registros do PubChem: Codificam descritores moleculares, propriedades físico-químicas e anotações estruturais quando a perturbação em análise é uma pequena molécula farmacológica.
    • Média dos controles basais de expressão gênica: Oferece o referencial transcriptômico da célula intacta (mock ou controle não tratado) na condição em teste.
    • Respostas de perturbação observadas no conjunto de treino: Fornecem o histórico empírico acumulado de mudanças gênicas registradas em outros contextos celulares sob intervenção comparável.

    Cada uma dessas modalidades é convertida em sequências de tokens numéricos antes de alcançar o bloco de atenção cruzada inicial. Caso uma dessas modalidades esteja ausente para determinado contexto experimental, o fluxo de execução do PIE simplesmente omite os tokens correspondentes da sequência de entrada da codificação, ajustando dinamicamente a máscara de atenção sem exigir estratégias artificiais de imputação numérica, tais como substituição por zeros ou médias artificiais.

    Essa tolerância a entradas incompletas afasta o modelo das premissas rígidas observadas em redes adversariais ou autoencoders variacionais aplicados à biologia de sistemas. Em tais modelos anteriores, qualquer alteração no formato das colunas de entrada ou a ausência de uma medição proteica obrigatória costuma inviabilizar o pipeline de inferência imediato.

    Comparações estruturais contra modelos fundacionais celulares

    A estratégia do PIE estabelece um contraste marcante com abordagens contemporâneas consagradas na bioinformática, como o GEARS (Gene Expression Adaptation Response Screen) e o scGPT. O GEARS estrutura o problema preditivo organizando redes de interação proteína-proteína e grafos de regulação transcricional por meio de Redes Neurais Convolucionais em Grafos (GCNs). O modelo depende fortemente da topologia preexistente dessas redes de interação física para propagar os efeitos de nocaute ou ativação gênica. Quando uma perturbação envolve um elemento isolado na rede ou uma pequena molécula com mecanismo de ação alostérico complexo, o alcance da propagação em grafos fica restrito pela qualidade da conectividade informada no treinamento.

    Por sua vez, o scGPT segue o paradigma dos modelos fundacionais de linguagem adaptados para células únicas. Ele tokeniza valores contínuos de contagem gênica dentro de células isoladas, processando milhares de genes por célula por meio de mecanismos clássicos de autoatenção mascarada. Embora o scGPT capture correlações de coexpressão gênica em larga escala a partir de milhões de células saudáveis, ele depende quase exclusivamente do padrão de coexpressão observado durante seu pré-treinamento para inferir como uma célula reagirá a uma perturbação externa inédita.

    O PIE abandona a tentativa de aprender a totalidade da biologia celular do zero por força bruta transcriptômica. Ao incorporar dados de ontologias curadas como uma linguagem auxiliar e fundamentar a modelagem na resposta média agregada de populações celulares, o Arc Institute priorizou a robustez frente a perturbações fora de distribuição. Em vez de deduzir a função de uma proteína a partir de correlações estatísticas de sequenciamento em tecidos sadios, o modelo consome explicitamente a anotação formal já consolidada por biólogos experimentais ao longo de décadas de trabalho laboratorial.

    Validação no benchmark Replogle-Nadig

    Para aferir a real capacidade de generalização do modelo em diferentes eixos de desconhecimento biológico, os pesquisadores do Arc Institute submeteram o PIE a experimentos rigorosos sobre o dataset Replogle-Nadig Perturb-seq. Trata-se de uma coleção de larga escala que cobre quatro linhagens celulares humanas submetidas a milhares de intervenções genéticas pontuais, oferecendo um terreno sólido para testes controlados de separação de conjuntos de dados.

    A métrica central adotada para mensurar a precisão biológica foi a Área Sob a Curva de Precisão-Revocação (AUPRC, Area Under the Precision-Recall Curve) na tarefa de identificação e classificação dos genes diferencialmente expressos (Differentially Expressed Genes, DEGs). A AUPRC é reconhecida na bioinformática estatística como um indicador superior à Área Sob a Curva ROC (AUROC) quando se analisam respostas transcricionais, uma vez que a grande maioria dos genes de uma célula permanece inalterada diante de uma perturbação pontual, gerando um desbalanceamento extremo entre classes positivas e negativas.

    Os testes de generalização foram divididos em quatro partições estruturadas:

    1. Contextos não observados: Perturbações que o modelo viu durante o treino, mas aplicadas a uma linhagem celular mantida fora dos dados de treinamento.
    2. Perturbações não observadas: Linhagens celulares conhecidas submetidas a alterações genéticas que o modelo nunca encontrou anteriormente.
    3. Datasets experimentais não observados: Lotes inteiros de dados gerados em condições laboratoriais separadas, avaliando a robustez a efeitos técnicos de lote (batch effects).
    4. Contextos e perturbações conjuntamente não observados: O cenário mais severo, no qual tanto a linhagem celular quanto o gene perturbado estiveram totalmente ausentes de qualquer etapa de treinamento.
    Cenário de GeneralizaçãoComportamento do Modelo PIEComparativo com Linhas de Base Mais Fortes
    Perturbações InéditasAbsorve anotações ontológicas para prever vias afetadasGanho expressivo de AUPRC (atingindo o teto de 3.2x sobre o competidor)
    Contextos InéditosModula resposta a partir do perfil basal da linhagemSuperação consistente em AUPRC (faixa entre 1.2x e 2.0x)
    Datasets InéditosTolera desvios técnicos e artefatos de sequenciamentoManutenção de liderança na identificação de genes diferencialmente expressos
    Inéditos em Conjunto (Contexto + Perturbação)Predição puramente zero-shot via representação latenteSuperioridade sustentada entre 1.2x e 3.2x na classificação de DEGs

    Segundo os resultados publicados no bioRxiv por Verma e colaboradores, o PIE superou as linhas de base mais fortes em cada configuração experimental testada, alcançando entre 1,2 e 3,2 vezes o valor de AUPRC na classificação dos genes diferencialmente expressos. O ganho mais amplo foi registrado especificamente na avaliação de perturbações que a rede nunca havia processado em sua etapa de otimização paramétrica. Esse resultado confirma que as informações ontológicas do NCBI e do Gene Ontology fornecem um direcionamento semântico indispensável para antecipar desdobramentos funcionais de genes não observados.

    Ecossistema de código, pipeline de execução e licença

    O Arc Institute disponibilizou integralmente a base de código do PIE, facilitando a reprodução experimental de seus resultados e a auditoria de suas rotinas de engenharia de software. O repositório central está hospedado no GitHub (abre em nova aba), acompanhado de checkpoints de modelos e conjuntos de dados devidamente processados para inferência distribuídos pela plataforma Hugging Face (abre em nova aba).

    A biblioteca oficial requer um ambiente configurado exclusivamente com Python 3.12, refletindo dependências recentes de empacotamento e compilação de tensores. A instalação padrão do pacote pode ser realizada via terminal:

    pip install arc-pie

    Após a instalação, o utilitário de linha de comando pie passa a estar disponível no ambiente, permitindo gerenciar pipelines de treinamento, processamento de tensores e tarefas de inferência preditiva:

    pie --help

    Em relação aos termos de distribuição, o projeto foi disponibilizado sob os termos da licença Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0). Esse detalhe contratual estabelece uma fronteira clara para sua adoção:

    O ecossistema disponibilizado na coleção do Hugging Face inclui representações tokenizadas pré-computadas para as bases do DepMap e do Cellosaurus, permitindo que pesquisadores acadêmicos executem predições em novas linhagens sem a necessidade de reconstruir manualmente os scrapers de extração ontológica.

    Limitações do método e gargalos de bases públicas

    Apesar dos ganhos de generalização documentados, o modelo exibe fragilidades que demandam análise crítica por parte de biólogos computacionais. A principal dependência estrutural do PIE é também o seu potencial calcanhar de Aquiles: a qualidade e completude das bases de conhecimento curadas por humanos.

    Bancos de dados como o Gene Ontology e o NCBI possuem níveis de cobertura altamente heterogêneos. Genes associados a doenças humanas de alta prevalência, como TP53 ou EGFR, concentram dezenas de milhares de anotações funcionais validadas, enquanto genes pouco caracterizados, como longos RNAs não-codificantes ou membros isolados da família de receptores olfativos, possuem pouquíssimos registros informativos. Quando o PIE é solicitado a prever o impacto da inibição de um gene escassamente documentado em bases externas, o mecanismo de atenção cruzada latente recebe vetores de entrada extremamente esparsos, o que pode reduzir a precisão de suas previsões para patamares comparáveis aos de modelos não informados por ontologias.

    A reformulação da tarefa preditiva para a escala populacional, descartando a distribuição célula a célula dentro da linhagem, também impõe trade-offs biológicos relevantes. Em ensaios oncológicos marcados por forte heterogeneidade intratumoral, a emergência de subpopulações celulares resistentes a fármacos frequentemente ocorre em grupos minoritários de células que não alteram significativamente a média populacional inicial. O PIE foca sua predição na alteração diferencial média do conjunto de células; eventos estocásticos raros de reprogramação fenotípica escapam ao radar desse modelo de predição agregada.

    Existe ainda a barreira da inconsistência ontológica temporal. Registros de linhagens no Cellosaurus e perfis de dependência do DepMap sofrem atualizações, reclassificações taxonômicas e correções de contaminação cruzada ao longo do tempo. Um modelo treinado com uma versão específica dessas bases corre o risco de internalizar ruídos de anotações desatualizadas, transferindo vieses históricos para as projeções transcriptômicas geradas em laboratório.

    Desdobramentos para triagem virtual de alvos terapêuticos

    As implicações práticas do modelo para a descoberta de medicamentos recaem diretamente sobre a triagem pré-clínica de alvos terapêuticos (target discovery). O custo de sintetizar bibliotecas químicas de pequenas moléculas e testá-las em dezenas de linhagens de tecidos primários humanos representa um dos maiores gargalos orçamentários do setor farmacêutico.

    A capacidade de projetar respostas zero-shot em pares de contexto e perturbação inteiramente desconhecidos possibilita a construção de filtros in silico refinados. Antes de comprometer insumos laboratoriais e semanas de ensaios em cultura celular, equipes de pesquisa podem rodar o modelo PIE para descartar intervenções que presumivelmente não induzirão as alterações transcricionais almejadas ou que desencadearão desregulações genéticas tóxicas em tecidos sadios.

    A incorporação das propriedades físico-químicas do PubChem aproxima a modelagem molecular da química medicinal, permitindo simular perturbações não apenas via inativação gênica perfeita por CRISPR, mas também através de pequenas moléculas que apresentam graus variáveis de afinidade e seletividade. Isso abre caminho para a priorização sistemática de candidatos a fármacos com base em sua capacidade estimada de reverter assinaturas transcriptômicas patológicas em tecidos específicos de pacientes.

    Veredito técnico e diretrizes de aplicação

    O PIE estabelece um avanço metodológico significativo ao romper com o isolamento estatístico dos modelos transcriptômicos tradicionais. O emprego da arquitetura Perceiver IO resolve com elegância o problema de acoplar fontes biológicas heterogêneas de tamanhos variáveis sem onerar a memória computacional do sistema, transformando anotações textuais e tabelas ontológicas em sinal preditivo diretamente utilizável pela atenção neural.

    Para equipes acadêmicas e laboratórios de biologia computacional que trabalham no planejamento de experimentos de Perturb-seq, a ferramenta desponta como uma linha de partida mandatória para priorização de hipóteses, especialmente em cenários onde genes nunca sequenciados em ensaios anteriores precisam ser explorados. No entanto, para biotechs e ambientes industriais focados em desenvolvimento proprietário de terapias, a licença CC BY-NC-SA 4.0 impõe a necessidade de diálogo direto com o Arc Institute para qualquer uso além da prova de conceito analítica.

    O sucesso da predição biológica algorítmica deixa claro que o futuro da disciplina não depende unicamente de coletar volumes massivos de células em sequenciadores modernos. A verdadeira capacidade de generalizar diante do desconhecido exige que os modelos aprendam a ler e integrar o conhecimento funcional consolidado que a ciência biológica levou gerações para construir, transformando cada anotação esparsa de um gene em um mapa navegável pelo aprendizado de máquina.

    Filipe Mendes

    Ver perfil completo