A data exata de uma consulta médica parece apenas um detalhe burocrático no meio de dezenas de páginas de exames. Se um paciente passa por um procedimento incomum em uma terça-feira específica, esse único registro temporal basta para cruzar informações com notícias ou registros civis e expor quem ele é. Proteger esse tipo de pista sem apagar a cronologia do tratamento sempre foi uma das tarefas mais complexas da informática médica.
Para responder a essa exigência, pesquisadores apresentaram o TIDE 2.0 (abre em nova aba), um conjunto aberto de ferramentas em linguagem Python criado para localizar e desidentificar dados protegidos em prontuários clínicos. O software identifica nomes, números de documentos, endereços e outras informações pessoais de saúde enquanto preserva o sentido do texto para pesquisas científicas e treinamento de outros algoritmos.
Como o sistema consegue apagar identidades sem destruir o valor clínico dos textos?

A resposta combina modelos de linguagem com técnicas de matemática aplicada. Em vez de simplesmente tarjar ou apagar palavras, o programa localiza os trechos confidenciais em uma etapa preliminar para depois aplicar regras matemáticas de substituição.
Essa separação evita distorções. Quando um prontuário apenas perde termos, o documento resultante fica ilegível tanto para médicos quanto para computadores. Para evitar esse estrago, o projeto recorre a técnicas como a criptografia que preserva o formato original. Esse recurso troca um número real de registro hospitalar por outro fictício com a mesma quantidade de dígitos. O sistema também aplica o deslocamento controlado de datas, conhecido como date jittering: todas as consultas de um mesmo indivíduo avançam ou recuam uma quantidade idêntica de dias, gerada por chaves criptográficas exclusivas. A cronologia relativa entre uma cirurgia e um exame de sangue permanece intacta, mas o dia real desaparece.
Para o reconhecimento dos dados sensíveis no texto livre, o TIDE 2.0 integra ferramentas de busca direta e redes neurais. O motor foi construído sobre a biblioteca Presidio, da Microsoft, mas substituiu os módulos padrão de expressões regulares por algoritmos até cem vezes mais rápidos. Essas rotinas encontram rapidamente telefones, endereços de internet e números de prontuário.
O processamento das partes mais sutis da linguagem depende do modelo especializado tide2-sentry-clinical-ner (abre em nova aba), hospedado na plataforma Hugging Face. A ferramenta utiliza a arquitetura DeBERTa v3 large ajustada para classificação de termos em categorias específicas. O modelo analisa cada fração de palavra, chamada de token, e classifica se ela representa o início, o meio ou o exterior de uma informação pessoal.
Esse modelo neural é o fruto prático do estudo SHIELD (abre em nova aba), conduzido por Jose D. Posada, David Love, Somalee Datta e Priya Desai, da instituição Stanford Medicine. Os autores treinaram a rede a partir do repositório STARR-OMOP, uma base que soma 158 bilhões de tokens de texto clínico. A seleção do material considerou diversidade deliberada em seis eixos: idade, sexo, raça, etnia, tipo de nota clínica e extensão do texto.
A eficácia do classificador foi medida no conjunto de testes de referência do estudo, composto por 1.381 notas clínicas reais e 10.229 menções verdadeiras de dados protegidos. Na avaliação de sobreposição de termos de 80%, o modelo alcançou precisão média de 0,89 e revocação de 0,88, pontuações que indicam capacidade simultânea de evitar alarmes falsos e de não deixar passar dados confidenciais.
As categorias identificadas cobrem nove grupos fundamentais:
- Idade do paciente
- Datas completas
- Nomes de profissionais de saúde
- Hospitais e clínicas
- Códigos e identificadores numéricos
- Localizações geográficas
- Nomes de pacientes
- Telefones e contatos
- Endereços da web
Existe ainda uma décima classificação geral voltada para dados incomuns, o que totaliza 21 classes internas de rotulagem.
Operar esse volume de texto dentro da infraestrutura de um hospital exige organização computacional. O repositório central inclui a ferramenta de linha de comando tide2-runner, baseada no gerenciador de tarefas Ray. O utilitário processa fluxos de trabalho em lote divididos em tarefas especializadas, que vão desde a leitura simples até a substituição final, integrando ambientes locais com Docker e bases em nuvem como BigQuery e Google Cloud Storage.
O código do núcleo do TIDE 2.0 permanece disponível publicamente para instalação e auditoria. Já os pesos do modelo de linguagem treinado por Stanford exigem assinatura de um acordo de uso restrito à pesquisa científica, com cadastro individual na plataforma Redivis antes da liberação do download. Com essa barreira, o projeto procura impedir o uso indevido da inteligência artificial enquanto fornece à comunidade médica um caminho seguro para transformar pilhas de anotações confidenciais em insumos abertos à pesquisa.

