Pular para o conteúdo
    Notícia

    TIDE 2.0 usa IA e criptografia para anonimizar prontuários médicos

    Desenvolvido com pesquisas de Stanford Medicine, o sistema aberto TIDE 2.0 remove dados pessoais de textos clínicos sem destruir datas e contextos úteis.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    7 de out. de 2026 · 4 min de leitura

    Seguir no Google
    Mãos com luvas cirúrgicas translúcidas manuseando placas de vidro óptico semitransparente sobre fundo de laboratório biomédico desfocado.
    Processamento e anonimização de prontuários clínicos aliam proteção da privacidade do paciente à preservação de contextos temporais para a pesquisa médica.

    A data exata de uma consulta médica parece apenas um detalhe burocrático no meio de dezenas de páginas de exames. Se um paciente passa por um procedimento incomum em uma terça-feira específica, esse único registro temporal basta para cruzar informações com notícias ou registros civis e expor quem ele é. Proteger esse tipo de pista sem apagar a cronologia do tratamento sempre foi uma das tarefas mais complexas da informática médica.

    Para responder a essa exigência, pesquisadores apresentaram o TIDE 2.0 (abre em nova aba), um conjunto aberto de ferramentas em linguagem Python criado para localizar e desidentificar dados protegidos em prontuários clínicos. O software identifica nomes, números de documentos, endereços e outras informações pessoais de saúde enquanto preserva o sentido do texto para pesquisas científicas e treinamento de outros algoritmos.

    Como o sistema consegue apagar identidades sem destruir o valor clínico dos textos?

    Mãos com luvas cirúrgicas manipulando lâmina translúcida sobre mesa de luz com padrões abstratos, em ambiente laboratorial com fundo desfocado.
    Processamento analítico de registros clínicos alia métodos rigorosos de criptografia e inteligência artificial para preservar a privacidade de dados médicos.

    A resposta combina modelos de linguagem com técnicas de matemática aplicada. Em vez de simplesmente tarjar ou apagar palavras, o programa localiza os trechos confidenciais em uma etapa preliminar para depois aplicar regras matemáticas de substituição.

    Essa separação evita distorções. Quando um prontuário apenas perde termos, o documento resultante fica ilegível tanto para médicos quanto para computadores. Para evitar esse estrago, o projeto recorre a técnicas como a criptografia que preserva o formato original. Esse recurso troca um número real de registro hospitalar por outro fictício com a mesma quantidade de dígitos. O sistema também aplica o deslocamento controlado de datas, conhecido como date jittering: todas as consultas de um mesmo indivíduo avançam ou recuam uma quantidade idêntica de dias, gerada por chaves criptográficas exclusivas. A cronologia relativa entre uma cirurgia e um exame de sangue permanece intacta, mas o dia real desaparece.

    Para o reconhecimento dos dados sensíveis no texto livre, o TIDE 2.0 integra ferramentas de busca direta e redes neurais. O motor foi construído sobre a biblioteca Presidio, da Microsoft, mas substituiu os módulos padrão de expressões regulares por algoritmos até cem vezes mais rápidos. Essas rotinas encontram rapidamente telefones, endereços de internet e números de prontuário.

    O processamento das partes mais sutis da linguagem depende do modelo especializado tide2-sentry-clinical-ner (abre em nova aba), hospedado na plataforma Hugging Face. A ferramenta utiliza a arquitetura DeBERTa v3 large ajustada para classificação de termos em categorias específicas. O modelo analisa cada fração de palavra, chamada de token, e classifica se ela representa o início, o meio ou o exterior de uma informação pessoal.

    Esse modelo neural é o fruto prático do estudo SHIELD (abre em nova aba), conduzido por Jose D. Posada, David Love, Somalee Datta e Priya Desai, da instituição Stanford Medicine. Os autores treinaram a rede a partir do repositório STARR-OMOP, uma base que soma 158 bilhões de tokens de texto clínico. A seleção do material considerou diversidade deliberada em seis eixos: idade, sexo, raça, etnia, tipo de nota clínica e extensão do texto.

    A eficácia do classificador foi medida no conjunto de testes de referência do estudo, composto por 1.381 notas clínicas reais e 10.229 menções verdadeiras de dados protegidos. Na avaliação de sobreposição de termos de 80%, o modelo alcançou precisão média de 0,89 e revocação de 0,88, pontuações que indicam capacidade simultânea de evitar alarmes falsos e de não deixar passar dados confidenciais.

    As categorias identificadas cobrem nove grupos fundamentais:

    • Idade do paciente
    • Datas completas
    • Nomes de profissionais de saúde
    • Hospitais e clínicas
    • Códigos e identificadores numéricos
    • Localizações geográficas
    • Nomes de pacientes
    • Telefones e contatos
    • Endereços da web

    Existe ainda uma décima classificação geral voltada para dados incomuns, o que totaliza 21 classes internas de rotulagem.

    Operar esse volume de texto dentro da infraestrutura de um hospital exige organização computacional. O repositório central inclui a ferramenta de linha de comando tide2-runner, baseada no gerenciador de tarefas Ray. O utilitário processa fluxos de trabalho em lote divididos em tarefas especializadas, que vão desde a leitura simples até a substituição final, integrando ambientes locais com Docker e bases em nuvem como BigQuery e Google Cloud Storage.

    O código do núcleo do TIDE 2.0 permanece disponível publicamente para instalação e auditoria. Já os pesos do modelo de linguagem treinado por Stanford exigem assinatura de um acordo de uso restrito à pesquisa científica, com cadastro individual na plataforma Redivis antes da liberação do download. Com essa barreira, o projeto procura impedir o uso indevido da inteligência artificial enquanto fornece à comunidade médica um caminho seguro para transformar pilhas de anotações confidenciais em insumos abertos à pesquisa.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo