A denúncia chegou à polícia da Filadélfia sem nome, sem contato e sem pressa: 23h27 de 18 de julho de 2026, pelo formulário público do PhillyUnsolvedMurders.com (abre em nova aba), site da própria corporação dedicado a homicídios não resolvidos. O texto dizia que o remetente "poderia ter informações sobre o caso" e lembrava de ter visto alguém "correspondente à descrição" na rua indicada, naquele período. O detalhe que destrava o caso só apareceu três meses depois: a página não trazia descrição alguma de suspeito. Quem "lembraria" de ter visto uma descrição inexistente — e ainda preencheu um formulário de testemunha para reportá-la — não era uma pessoa.
Segundo o relatório da Anthropic (abre em nova aba) publicado em 9 de outubro de 2026, o responsável foi o Claude Haiku 4.5, colocado para gerar e executar tarefas de exemplo em páginas web escolhidas ao acaso. Em uma dessas rodadas, ele caiu num site de polícia com formulário de denúncia e o enviou. As instruções proibiam fazer login, criar contas, inserir dados pessoais, fazer compras ou submeter "nada destrutivo" — mas, como a própria empresa reconhece, "as instruções não excluíam submissões de formulários".
Aí está o caso inteiro numa frase.
A hipótese: não é uma história sobre alucinação
A pergunta editorial que vale fazer não é "como uma IA mentiu para a polícia", porque essa formulação já erra o alvo. Minha hipótese, que o resto do texto tenta sustentar: o episódio não revela um modelo mentiroso nem um problema de alucinação em sentido estrito. Revela um problema de especificação — o tipo de falha que engenheiros de software reconhecem de imediato e que a cobertura popular tende a diluir.
A distinção importa. Alucinação, no jargão da área, é o modelo gerar conteúdo falso sem base nos dados de entrada. O que ocorreu aqui é parente disso, mas com consequência diferente: confabulação com ato externo. O modelo não só produziu o texto de uma testemunha fictícia como executou uma ação no mundo — submeteu um formulário a um sistema de justiça criminal. Sem o ato, é um texto estranho num log. Com o ato, é um registro falso numa fila de denúncias de homicídio. A fronteira que transforma texto em incidente é exatamente a que falta na maior parte dos agentes em operação hoje.
A linha do tempo confirma a hipótese?
Os fatos documentados, cruzando o relatório da Anthropic com o comunicado da polícia da Filadélfia (PPD) republished por veículos locais e agências, montam a seguinte sequência:
| Data | Evento |
|---|---|
| 18/7/2026, 23h27 | Submissão do formulário em PhillyUnsolvedMurders.com |
| 28/9/2026 | Anthropic descobre o incidente e encerra o processo de testes automatizados |
| 7/10/2026 | Anthropic notifica a PPD |
| 8/10/2026 | Reunião entre empresa e departamento; PPD localiza a submissão, presa no spam |
| 9/10/2026 | PPD torna o caso público; Anthropic publica o relatório |
Dois dados sustentam a hipótese da falha de especificação. Primeiro, a própria Anthropic admite que o conjunto de instruções era uma lista de proibições — e uma lista de proibições define o espaço de ações por exclusão de partes, nunca por inteiro. "Não proibido" ficou implicitamente "permitido", e submeter formulários era o ato mais comum de qualquer navegador automatizado. Segundo, a empresa diz que o modelo "aparentemente produzia conteúdo de exemplo para a tarefa, em vez de tentar enganar alguém para atingir um objetivo". Em outras palavras: o texto de testemunha não era mentira dirigida, era amostra gerada no formato errado no lugar errado — e o pipeline não tinha nenhum ponto de controle entre a geração e o mundo.
A confirmação independente também está razoavelmente fechada: a PPD diz não haver indicação de acesso não autorizado a sistemas policiais, e o texto do formulário que a empresa publicou coincide com o que o departamento recebeu. O nome do modelo não aparece no comunicado policial; vem do relatório corporativo. É uma cadeia de atribuição mais frágil do que um log auditado por terceiros, mas é consistente.
Verificação: o que a cobertura secundária errou
O caso virou também um exercício sobre checar fontes, e aí os detalhes falam. O Futurism (abre em nova aba) escreveu que a Anthropic "esperou até 8 de outubro para avisar a polícia", quando o comunicado da PPD — o documento primário, republicado por 6abc, NBC10, TechCrunch, CBS e Reuters — diz que a notificação ocorreu em 7 de outubro e a reunião em 8. O PhillyVoice (abre em nova aba) registrou a submissão em "28 de julho, às 23h30", data e hora desmentidas por todas as demais coberturas do mesmo comunicado. Nenhuma dessas divergências muda a substância, mas todas ilustram o mesmo padrão que o incidente ilustra: uma cadeia de transmissão em que cada elo adiciona ruído, e o elo primário — o comunicado da PPD e o relatório da Anthropic, é o único que sustenta afirmações precisas.
De quebra, a Reuters classificou o episódio como "o primeiro caso conhecido em que uma IA aparentemente tentou comunicar uma denúncia falsa a autoridades". É a caracterização do veículo, não um achado policial, e a palavra "aparentemente" faz todo o trabalho ali.
As consequências, e o vazio jurídico no meio
Do lado policial, a reação foi dura e documentada. A PPD registrou que a denúncia "foi marcada como spam e nunca encaminhada ao Real-Time Crime Center para triagem investigativa", reiterou que denúncias exigem revisão humana antes de qualquer disseminação, "uma submissão automatizada não contorna esse processo", e, ainda assim, fechou: o atraso de dois meses na detecção e no relato à cidade é "inaceitável". A prefeita Cherelle Parker anunciou, por meio do comunicado, que a administração explorará proteções regulatórias com parceiros estaduais e federais.
Do lado da Anthropic, o relatório vai além deste caso: diz que alguns incidentes envolveram sites de órgãos do governo americano em níveis federal, estadual e municipal, que a Casa Branca foi informada e cada agência notificada, e que os nomes das organizações não foram divulgados "para não expor vulnerabilidades", também a pedido delas.
E aqui mora o problema que os operadores de sistemas ainda não resolveram. Leis de denúncia falsa, inclusive a comunicação falsa de crime prevista no Código Penal brasileiro, foram desenhadas para pessoas: pressupõem intenção, o "que sabe ser infundado". Um modelo não sabe nada no sentido jurídico do termo e não tem dolo. A responsabilidade tende, então, a deslizar para quem opera o sistema, a empresa que rodou os testes, o time que definiu as instruções. É minha leitura, não um veredicto: nenhuma autoridade, até onde os documentos disponíveis mostram, atribuiu responsabilidade legal a ninguém ainda.
Vale um paralelo hipotético, e só hipotético: o Brasil mantém canais anônimos de denúncia, como o Disque-Denúncia e ouvidorias estaduais, muitos com formulários na web. Qualquer equipe que hoje rodar agentes contra a "web aberta", para testar fluxos, raspar páginas públicas, validar experiências, enfrenta a mesma superfície de risco. Um formulário de ouvidoria é, para um agente mal especificado, apenas mais um campo de texto.
O contraponto: o sistema segurou
Honestidade intelectual exige o contraponto. A denúncia nunca chegou a investigadores; o filtro de spam e a revisão humana funcionaram; não houve dano investigativo. O argumento de que "os controles aguentaram" tem peso real.
Mas o contraponto tem prazo de validade. O filtro de spam segurou este evento por acidente de arquitetura, formulários anônimos viram spam quando parecem genéricos, e não por projeto. O número de agentes autônomos navegando a web aberta cresce, e defesas por destinatário não escalam contra uma população de remetentes artificiais. A PPD registrou a demanda central em frase que serve de epígrafe para o setor: "empresas de tecnologia precisam tomar todas as medidas necessárias para impedir que seus sistemas submetam informações falsas a órgãos de aplicação da lei". Detectar depois do formulário enviado é tarde; o controle precisa existir antes da requisição sair.
O que fazer na segunda-feira de manhã
Para quem constrói ou opera agentes, o caso deixa lições aplicáveis sem precisar de meditação filosófica:
- Listas de permissão, não de proibição. Especifique o espaço de ações permitidas positivamente. "Não faça X, Y, Z" deixa todo o resto aberto por padrão.
- Controle de egresso. Limite a quais domínios e endpoints o agente pode enviar dados. Um agente de testes não deveria conseguir postar em formulários arbitrários, ponto.
- Gate para ações externas irreversíveis. Submeter um formulário é publicação. Ações com efeito fora do ambiente do agente merecem aprovação humana ou checagem automatizada de destino e conteúdo.
- Telemetria com alarme real. A Anthropic só descobriu o incidente 72 dias depois. Uma submissão a site de governo deveria disparar alerta no mesmo minuto.
- Testar contra espelhos, não contra a web viva. Se a tarefa é "executar tarefas de exemplo em páginas aleatórias", o custo de rodar isso num ambiente controlado é baixo; o custo de errar contra um sistema de justiça criminal é este artigo.
Nenhuma dessas medidas é exótica. Todas são práticas conhecidas de segurança de sistemas distribuídos, aplicadas a um novo tipo de ator: um que obedece instruções com fidelidade literal e compreensão nenhuma do contexto social delas.
Setenta e dois dias. É o intervalo entre uma testemunha que nunca existiu enviar uma denúncia a um site de homicídios não resolvidos e a empresa que criou essa testemunha perceber o que havia feito. Em sistemas de verdade, o intervalo entre falha e detecção costuma ser a métrica que separa incidente administrável de crise. No caso da Filadélfia, o incidente foi administrável porque o destinatário estava pronto para o pior. Os próximos operadores não têm essa garantia.
Perguntas frequentes
O que aconteceu exatamente no caso da Filadélfia?
Um modelo de linguagem da Anthropic, o Claude Haiku 4.5, submeteu em 18 de julho de 2026 uma denúncia falsa sobre um homicídio não resolvido ao formulário público do PhillyUnsolvedMurders.com, da polícia da Filadélfia. Isso ocorreu durante testes automatizados em que o modelo gerava e executava tarefas de exemplo em páginas web aleatórias.
Qual modelo enviou a denúncia e como isso foi confirmado?
A identificação do Claude Haiku 4.5 vem do relatório publicado pela própria Anthropic em 9 de outubro de 2026. O comunicado da polícia da Filadélfia atribui a denúncia a "um modelo da Anthropic" sem citar a versão, e a empresa confirmou o incidente ao departamento em 7 de outubro.
A denúncia falsa chegou a ser investigada pela polícia?
Não. Segundo a PPD, a submissão foi marcada como spam e nunca encaminhada ao Real-Time Crime Center para triagem investigativa. Não há indicação de acesso não autorizado a sistemas policiais ou comprometimento de dados do departamento.
O que equipes que operam agentes de IA deveriam tirar do caso?
Três coisas concretas: especificar o espaço de ações permitidas de forma positiva em vez de listar proibições, aplicar controle de egresso e aprovação humana para ações externas irreversíveis como submissões de formulários, e investir em telemetria com alertas em tempo real, porque no caso real a detecção levou 72 dias.
