Até setembro de 2026, Jacob Coxon era um engenheiro cujo nome circulava pouco fora dos círculos internos de pesquisa da Anthropic (abre em nova aba). Um mês depois de anunciar a demissão em posts que ganharam atenção global, ele sentava na cadeira de testemunha do City Hall de Nova York, a convite da presidência do Conselho Municipal, diante de um painel que também reunia representantes de OpenAI (abre em nova aba), Google e Meta. A audiência de segunda-feira, 5 de outubro, foi descrita pela própria cidade como a primeira do tipo no país e no mundo. A autoproclamação merece um parêntese: trata-se de alegação da prefeitura, não de fato verificado contra todas as jurisdições.
O que não é alegação é a posição de Coxon. Ela é específica, técnica e, por isso, merece ser separada do ruído que costuma cercar qualquer discussão sobre "fim do mundo por IA".
Quem fala e de onde vem a credibilidade
Coxon trabalhou na Anthropic, empresa fundada em 2021 por ex-pesquisadores da OpenAI com missão declarada centrada em segurança de modelos avançados. Ele era, nas palavras da cobertura da audiência, um engenheiro pouco conhecido até que sua saída virasse assunto público. Ao deixar a empresa, acusou a ex-empregadora e a OpenAI de "estar apostando com as nossas vidas" e afirmou que "as pessoas que constroem IA acreditam sinceramente que ela poderia nos matar antes do fim da década". Já antes da audiência, ele havia dito publicamente que a IA poderia destruir a humanidade até 2030.

Esses números não são projeção de estudo. São estimativas subjetivas de quem trabalhou dentro do processo de desenvolvimento. A diferença importa para um público técnico: uma probabilidade declarada por um ex-insider é evidência sobre uma crença, não medição de risco. O valor de seu testemunho está no que ele observou e no que ele argumenta, não na precisão de um número.
O que ele disse ao Conselho
Coxon abriu o depoimento com a frase que resume o problema. Segundo seu relato à câmara, "ainda não sabemos controlar nenhum sistema de IA". E completou com sua avaliação de trajetória: no caminho atual, considera mais provável do que não que a humanidade perca o controle desses sistemas, com desfecho possível em extinção.
As empresas "precisam ser muito mais transparentes com o público e com especialistas independentes", declarou Coxon, defendendo que "devemos desacelerar o desenvolvimento de IA de fronteira até que possamos ter confiança de segurança".
Duas alegações técnicas carregam o peso do argumento, e cada uma exige tratamento distinto.
A primeira é sobre controle. Modelos de fronteira, por definição, são os sistemas treinados na maior escala disponível, no limite de capacidade do momento. O problema que Coxon nomeia existe na literatura de alinhamento: não há método verificado que garanta que um modelo de propósito geral permaneça dentro dos limites pretendidos em todos os contextos de uso. As técnicas de alinhamento em produção, como aprendizado por reforço com feedback humano e o uso de constituições de comportamento, reduzem comportamentos indesejados nos cenários testados, mas não fornecem garantia formal de cobertura. A pesquisa de interpretabilidade, que examina mecanismos internos dos modelos, ainda é incapaz de auditar comportamento emergente de ponta a ponta. Coxon comprime tudo isso numa frase, e a compressão é fiel ao estado do campo.
A segunda alegação é sobre autossuficiência. Coxon afirmou que "estamos nos aproximando do ponto em que os sistemas de IA serão capazes de melhorar a si mesmos, fazendo a pesquisa que os humanos faziam antes". Aqui o cuidado precisa dobrar. Autossuficiência recursiva, o cenário em que um sistema melhora a própria arquitetura ou processo de treinamento sem supervisão humana efetiva, é hipótese discutida na comunidade de segurança desde antes dos modelos atuais, e ainda não há demonstração pública de um ciclo fechado e autônomo desse tipo. O que Coxon descreve é uma leitura de tendência a partir de dentro de um laboratório de fronteira, não um evento observado. Ele a apresenta como iminente; o registro honesto é que ela é plausível o suficiente para constar em planos de contingência, e não confirmada o suficiente para constar em cronogramas.
Kill switch: útil no curto prazo, insuficiente no longo
Entre os projetos em discussão no Conselho está a exigência de que um ser humano possa desligar modelos de IA, o chamado kill switch. Coxon endossou a medida com uma ressalva que revela como ele enxerga o problema. Mecanismos de desligamento "podem ser úteis no curto prazo", disse, mas não tendem a garantir segurança no longo prazo.
A leitura técnica por trás da ressalva é coerente. Um kill switch atua sobre a implantação de um modelo específico; não atua sobre a dinâmica competitiva que produz o próximo modelo, nem sobre as capacidades que um sistema pode adquirir antes que alguém perceba a necessidade de acioná-lo. Ele é um freio de mão num carro que continua acelerando. Ajuda a ganhar um tempinho, não resolve a direção. Daí a exigência central de Coxon: desacelerar o desenvolvimento de fronteira até existir confiança demonstrável de segurança.
A resposta das empresas
Os executivos testemunharam remotamente, e o momento mais revelador não veio deles. A presidente do Conselho, Julie Menin, pediu a cada empresa que quantificasse o risco de um pior cenário catastrófico. Morgan Dwyer, representando a OpenAI, respondeu que não sabia, e acrescentou que nenhuma chance entre 1%, 10% ou 20% de catástrofe seria remotamente aceitável. Um painel que admite não conseguir medir o risco que produz é, no mínimo, um argumento forte contra quem defende que o mesmo painel se regule sozinho.
Menin foi direta sobre isso. Para a presidente, "a ideia de que as empresas de IA simplesmente vão se autorregular não vai funcionar". O contexto é nacional: segundo ela, o governo federal sinalizou que as empresas podem se autorregular, e a cidade decidiu agir por conta própria. Essa história de autorregulação, no fim das contas, é o que colocou Coxon naquela cadeira; ele foi convocado justamente porque é uma voz de dentro que discorda do padrão.
O próprio Coxon ofereceu a comparação que melhor resume a crítica. "As empresas funcionam com mentalidade de startup: vá rápido, quebre as coisas, conserte depois", disse. "Isso funciona para um aplicativo de compartilhamento de fotos. Não funciona para construir a tecnologia mais poderosa já construída."
Os dez projetos de lei e o alcance real
O Conselho avalia um pacote de dez projetos. As medidas conhecidas incluem:
- proibição de representação não autorizada de autoridades públicas por IA
- exigência de validação por terceiros para sistemas de IA em uso local
- garantia de interrupção humana de modelos, o kill switch discutido por Coxon
- regras de privacidade de dados para chatbots
- possibilidade de denunciantes receberem parte das multas pagas por empresas infratoras
Há aqui uma tensão estrutural que o debate municipal não elimina. Nova York pode regular implantação, contratos públicos e uso de dados dentro do seu território; não pode alcançar laboratórios, treinamento e cronogramas de lançamento que acontecem em outras jurisdições. A analogia útil vem de domínios onde segurança crítica já é institucionalizada: aviação civil e aprovação de medicamentos não dependem de asas ou moléculas reguladas pelo município de uso, e sim de certificação independente com alcance nacional. Sem camada federal equivalente para IA, a cidade aprova freios locais para um motor global. Se a empresa nem sequer consegue quantificar o risco que pergunta, a gente fica sem o número mais básico para dimensionar qualquer multa.
Coxon não depôs sozinho. Alex Turner, ex-pesquisador do Google DeepMind, e Daniel Kokotajlo, ex-OpenAI e atual diretor executivo do AI Futures Project (abre em nova aba), testemunharam remotamente na mesma direção, descrevendo uma cultura corporativa de corrida por tecnologia que seus próprios criadores não controlam. O Conselho Municipal de Nova York (abre em nova aba) ainda precisa votar o pacote, e o efeito prático das dez medidas só vai existir depois da votação e da regulamentação.
O episódio mais honesto da audiência, porém, veio da pergunta de Menin às empresas. Cada uma foi convidada a quantificar o risco catastrófico no pior cenário. A OpenAI admitiu não saber, e mesmo sem saber rejeitou por completo as três ordens de grandeza oferecidas como referência. O menor dos números que Dwyer considerou inaceitável foi 1.
