O Arc Institute (abre em nova aba) divulgou em 5 de outubro de 2026 o lançamento do PIE, sigla para Perturbation is Everything. Trata-se de um modelo computacional projetado para prever como células vivas reagem a intervenções biológicas que nunca foram testadas antes em laboratório. Os detalhes científicos completos do projeto haviam sido compartilhados alguns dias antes, em 2 de outubro de 2026, por meio de um artigo em formato de preprint no repositório bioRxiv (abre em nova aba).
Em biologia celular e na medicina, uma perturbação é qualquer fator externo ou interno que altera o funcionamento normal de uma célula. Pode ser o desligamento de um gene por edição genética ou a introdução de uma substância química. Testar fisicamente todas as combinações de células e perturbações em experimentos práticos exige anos de trabalho e custos elevados. O modelo PIE atua como uma ferramenta de simulação que antecipa esses impactos no computador antes da etapa experimental.
Como a inteligência artificial consegue prever respostas que nunca presenciou?
A resposta está na união entre uma arquitetura de processamento flexível e bases de dados científicos consolidados. O PIE foi construído com base na arquitetura Perceiver IO, um tipo de rede neural capaz de receber dados heterogêneos com formatos variados e traduzi-los em unidades padronizadas de informação, chamadas de tokens.
Para alimentar essa estrutura, os pesquisadores incorporaram o conhecimento prévio de fontes públicas de referência em biologia: Cellosaurus, NCBI, Gene Ontology, DepMap e PubChem. O modelo processa essas fontes junto com o estado inicial das células de controle, que são as células saudáveis sem intervenção, além de evidências coletadas em testes anteriores.
A partir desses elementos, o PIE calcula as leituras em nível de população celular. Ele identifica os genes diferencialmente expressos, que são aqueles cuja atividade aumentou ou diminuiu após a perturbação, estimando com precisão o sentido dessa alteração e a sua magnitude.

Para validar a confiabilidade do sistema, a equipe submeteu o modelo ao conjunto de dados Replogle-Nadig Perturb-seq. O teste reuniu quatro linhagens de células humanas: K562, RPE1, Jurkat e HepG2. Os cientistas avaliaram o desempenho em cenários desafiadores, separando linhagens e compostos para verificar se o modelo conseguiria acertar o comportamento celular em condições inteiramente novas.
| Cenário de teste | Desempenho do PIE vs. concorrentes | Capacidade demonstrada |
|---|---|---|
| Genes diferencialmente expressos | 1,2 a 3,2 vezes a métrica AUPRC do melhor método anterior | Identificação precisa de quais genes tiveram atividade alterada |
| Perturbações não vistas no treino | Maior ganho relativo registrado na pesquisa | Projeção do impacto de moléculas ou edições genéticas inéditas |
| Linhagem e perturbação novas simultaneamente | Previsões biologicamente significativas | Generalização quando nenhum dos fatores fazia parte do treino |
| Transferência entre bases (zero-shot) | Superou métodos existentes sem ajuste fino | Aplicação direta de conhecimento adquirido em novos experimentos |
O desempenho do modelo foi medido pela área sob a curva de precisão e recuperação, conhecida pela sigla técnica AUPRC. Essa métrica avalia o equilíbrio entre encontrar as respostas biológicas corretas e evitar alarmes falsos. Os ganhos mais expressivos ocorreram exatamente nas perturbações inéditas. O modelo também mostrou capacidade de transferir sinais entre conjuntos de dados diferentes: após ser treinado em quatro bases públicas sem sobreposição direta, ele superou os concorrentes ao analisar o conjunto Replogle-Nadig sem treinamento prévio específico.
O avanço tem impacto direto na biologia computacional e na descoberta de novos medicamentos. Em vez de realizar triagens aleatórias com milhares de moléculas em placas de petri, pesquisadores podem usar o PIE para filtrar compostos e focar apenas nas alterações celulares desejadas. Isso acelera a identificação de alvos terapêuticos e reduz o tempo gasto na fase inicial de testes laboratoriais.
O Arc Institute disponibilizou os arquivos sob a licença de uso CC BY-NC-SA 4.0. Cientistas e desenvolvedores podem acessar o código-fonte no repositório oficial do projeto no GitHub (abre em nova aba), que oferece instalação prática por meio do comando pip install arc-pie ou diretamente a partir dos arquivos originais. Os checkpoints treinados do modelo e os conjuntos de dados curados foram publicados na plataforma do Hugging Face (abre em nova aba), permitindo que laboratórios reproduzam as análises e integrem o sistema em seus próprios estudos de genética.

