Pular para o conteúdo
    Notícia

    Modelo PIE prevê reações biológicas inéditas e supera concorrentes em até 3,2 vezes

    Desenvolvido pelo Arc Institute, o modelo de inteligência artificial PIE antecipa o efeito de perturbações celulares com dados prévios de biologia.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    6 de out. de 2026 · 3 min de leitura

    Placa de cultura celular com múltiplos poços contendo pequenas amostras líquidas translúcidas sobre bancada de laboratório biológico, com ponteiras de micropipeta ao fundo.
    Testes celulares e triagens biológicas servem de base para modelos computacionais preverem efeitos de intervenções genéticas.

    O Arc Institute (abre em nova aba) divulgou em 5 de outubro de 2026 o lançamento do PIE, sigla para Perturbation is Everything. Trata-se de um modelo computacional projetado para prever como células vivas reagem a intervenções biológicas que nunca foram testadas antes em laboratório. Os detalhes científicos completos do projeto haviam sido compartilhados alguns dias antes, em 2 de outubro de 2026, por meio de um artigo em formato de preprint no repositório bioRxiv (abre em nova aba).

    Em biologia celular e na medicina, uma perturbação é qualquer fator externo ou interno que altera o funcionamento normal de uma célula. Pode ser o desligamento de um gene por edição genética ou a introdução de uma substância química. Testar fisicamente todas as combinações de células e perturbações em experimentos práticos exige anos de trabalho e custos elevados. O modelo PIE atua como uma ferramenta de simulação que antecipa esses impactos no computador antes da etapa experimental.

    Como a inteligência artificial consegue prever respostas que nunca presenciou?

    A resposta está na união entre uma arquitetura de processamento flexível e bases de dados científicos consolidados. O PIE foi construído com base na arquitetura Perceiver IO, um tipo de rede neural capaz de receber dados heterogêneos com formatos variados e traduzi-los em unidades padronizadas de informação, chamadas de tokens.

    Para alimentar essa estrutura, os pesquisadores incorporaram o conhecimento prévio de fontes públicas de referência em biologia: Cellosaurus, NCBI, Gene Ontology, DepMap e PubChem. O modelo processa essas fontes junto com o estado inicial das células de controle, que são as células saudáveis sem intervenção, além de evidências coletadas em testes anteriores.

    A partir desses elementos, o PIE calcula as leituras em nível de população celular. Ele identifica os genes diferencialmente expressos, que são aqueles cuja atividade aumentou ou diminuiu após a perturbação, estimando com precisão o sentido dessa alteração e a sua magnitude.

    Ponta de micropipeta dosando reagente transparente em placa de cultivo celular sobre bancada de laboratório bem iluminada.
    Ensaios de perturbação celular permitem medir alterações na expressão gênica para calibrar modelos preditivos.

    Para validar a confiabilidade do sistema, a equipe submeteu o modelo ao conjunto de dados Replogle-Nadig Perturb-seq. O teste reuniu quatro linhagens de células humanas: K562, RPE1, Jurkat e HepG2. Os cientistas avaliaram o desempenho em cenários desafiadores, separando linhagens e compostos para verificar se o modelo conseguiria acertar o comportamento celular em condições inteiramente novas.

    Cenário de testeDesempenho do PIE vs. concorrentesCapacidade demonstrada
    Genes diferencialmente expressos1,2 a 3,2 vezes a métrica AUPRC do melhor método anteriorIdentificação precisa de quais genes tiveram atividade alterada
    Perturbações não vistas no treinoMaior ganho relativo registrado na pesquisaProjeção do impacto de moléculas ou edições genéticas inéditas
    Linhagem e perturbação novas simultaneamentePrevisões biologicamente significativasGeneralização quando nenhum dos fatores fazia parte do treino
    Transferência entre bases (zero-shot)Superou métodos existentes sem ajuste finoAplicação direta de conhecimento adquirido em novos experimentos

    O desempenho do modelo foi medido pela área sob a curva de precisão e recuperação, conhecida pela sigla técnica AUPRC. Essa métrica avalia o equilíbrio entre encontrar as respostas biológicas corretas e evitar alarmes falsos. Os ganhos mais expressivos ocorreram exatamente nas perturbações inéditas. O modelo também mostrou capacidade de transferir sinais entre conjuntos de dados diferentes: após ser treinado em quatro bases públicas sem sobreposição direta, ele superou os concorrentes ao analisar o conjunto Replogle-Nadig sem treinamento prévio específico.

    O avanço tem impacto direto na biologia computacional e na descoberta de novos medicamentos. Em vez de realizar triagens aleatórias com milhares de moléculas em placas de petri, pesquisadores podem usar o PIE para filtrar compostos e focar apenas nas alterações celulares desejadas. Isso acelera a identificação de alvos terapêuticos e reduz o tempo gasto na fase inicial de testes laboratoriais.

    O Arc Institute disponibilizou os arquivos sob a licença de uso CC BY-NC-SA 4.0. Cientistas e desenvolvedores podem acessar o código-fonte no repositório oficial do projeto no GitHub (abre em nova aba), que oferece instalação prática por meio do comando pip install arc-pie ou diretamente a partir dos arquivos originais. Os checkpoints treinados do modelo e os conjuntos de dados curados foram publicados na plataforma do Hugging Face (abre em nova aba), permitindo que laboratórios reproduzam as análises e integrem o sistema em seus próprios estudos de genética.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo