A investigação do correspondente de tecnologia da Sky News, Rowland Manthorpe, sobre segredos expostos na Hugging Face (abre em nova aba) toca num ponto que a comunidade de machine learning prefere não discutir com franqueza: a plataforma que virou infraestrutura de facto para modelos abertos também funciona, na prática, como um repositório gigante de credenciais mal guardadas. Segundo a reportagem, milhares de segredos, incluindo chaves de API da OpenAI, estavam sentados em arquivos públicos que qualquer pessoa podia baixar. Chaves de organizações e de desenvolvedores individuais, em repositórios, notebooks e arquivos ligados a modelos.
Convém precisar o fato central antes de qualquer interpretação. O achado da investigação é exposição por upload público, não invasão da infraestrutura da Hugging Face. Ninguém quebrou um servidor. Alguém, em grande número e por muito tempo, subiu arquivos contendo credenciais para lugares onde o padrão de visibilidade é aberto. Essa distinção muda tudo na análise: não há vulnerabilidade nova a corrigir no Hub, há uma prática ruim que o design do Hub não impede.
Como o Hub funciona e por que segredos vazam
A Hugging Face é, essencialmente, o GitHub do ecossistema de IA. Desenvolvedores versionam pesos de modelos, datasets, notebooks de experimentos e código de treinamento em repositórios que, por padrão, tendem à visibilidade pública. O modelo econômico e cultural da plataforma é a abertura: você publica para que outros usem, reproduzam e construam sobre o seu trabalho. É o que fez do Hub o centro de distribuição de modelos abertos.

O problema nasce de um descasamento simples. Um notebook de experimento costuma carregar, em célula visível, a chamada à API da OpenAI com a chave inline, porque assim é rápido testar. Um script de treinamento importa o dataset privado com o token de acesso no cabeçalho. O arquivo funciona, o experimento roda, e depois o autor faz upload da pasta inteira, com histórico, sem revisar o que vai junto. A chave de API, no modelo da OpenAI, é uma credencial de faturamento e de acesso a serviços: quem a possui pode consumir os modelos pagos e gerar custo ou extrair dados vinculados à conta, conforme reportado na investigação sobre chaves descritas como ainda válidas no momento da descoberta.
A documentação oficial da plataforma é explícita sobre isso. A página de segurança e tokens de acesso do Hub (abre em nova aba) trata tokens como segredos, orienta que não sejam commitados em repositórios públicos, descreve como definir escopos, criar tokens fine-grained, revogar e rotacionar quando houver suspeita de exposição. Ou seja: a Hugging Face sabe, documenta e avisa. O contraste entre a orientação oficial e o comportamento observado é o achado mais incômodo da investigação, porque não deixa a plataforma como única responsável e não deixa o usuário como vítima inocente.
Um arquivo público é um arquivo público.
Exposição confirmada, exploração presumida
Aqui vale separar três camadas com rigor, porque é fácil misturá-las.
- Fato confirmado pela reportagem: milhares de segredos, incluindo chaves da OpenAI, estavam em arquivos públicos baixáveis na plataforma, e pelo menos parte das chaves ainda era válida quando encontrada.
- Hipótese plausível, não demonstrada: que terceiros tenham coletado e usado essas chaves para consumo indevido de APIs pagas. A reportagem, pelos elementos disponíveis, sustenta a exposição, não a exploração.
- Projeção de risco: estimativas de custo potencial ou de escala de abuso, que dependem de quantas chaves foram válidas, por quanto tempo ficaram expostas e quem as viu antes de qualquer limpeza.
Essa separação importa tecnicamente. Uma chave exposta e válida é um incidente de segurança em sentido amplo, independentemente de abuso comprovado, porque a janela de comprometimento não pode ser fechada retroativamente. Mas inverter a ordem, tratar risco projetado como dano ocorrido, destrói a utilidade da análise. Ceticismo, aqui, não é neutralidade diplomática: é o critério que decide o que sua equipe precisa fazer hoje e o que pode apenas monitorar.
Há um agravante estrutural que a investigação ilumina sem precisar nomear. No ecossistema de modelos abertos, o vetor clássico de preocupação é o código serializado, como arquivos pickle, cuja execução pode carregar comportamento arbitrário, e a prática de carregar modelos de terceiros com confiança implícita. Credenciais expostas são o avesso simétrico desse problema: não é o artefato que ataca quem baixa, é quem baixa que encontra um artefato que entrega acesso à conta de quem publicou. O Hub concentra os dois riscos no mesmo lugar, com a mesma lógica de confiança distribuída.
A resposta e o que ela revela
A reportagem de Manthorpe afirma ter contatado a Hugging Face, a OpenAI e organizações afetadas antes da publicação, o procedimento esperado em investigação jornalística desse tipo. O que se pode avaliar publicamente, além disso, é o aparato oficial que já existia: a orientação documentada sobre tokens, a possibilidade de escopos restritos e revogação. A pergunta que fica, e que a reportagem ajuda a colocar sem responder sozinha, é se orientação e mecanismos de revogação bastam quando o padrão de uso da plataforma produz exposição em escala.
Minha leitura, como inferência e não como fato: não bastam, e não por defeito técnico. Toda plataforma de hospedagem de código já enfrentou esse problema. O GitHub convive há anos com chaves vazias em repositórios, e a resposta que funcionou em parte foi automatizar a detecção, varrendo pushes públicos e notificando provedores de credenciais para revogação proativa. É conhecimento consolidado da área de segurança de plataformas que orientação passiva tem alcance limitado quando o erro é fácil de cometer e invisível para quem o comete. Se a Hugging Face ainda não trata a exposição de segredos em uploads públicos com detecção e alerta sistemáticos, a investigação dá razões para fazê-lo. Se já trata em alguma medida, a escala do achado indica que o alcance é insuficiente. Em ambos os casos, a conclusão prática para quem desenvolve é a mesma.
O que fazer na prática
A exposição é barata de prevenir e caríssima de remediar, porque uma chave válida exposta exige assumir que foi usada. Para equipes que publicam modelos, datasets ou notebooks no Hub, o mínimo verificável é o seguinte:
- Varrer repositórios públicos, atuais e históricos, por padrões de credenciais antes e depois de cada publicação.
- Nunca embutir chaves em notebooks; carregar de variáveis de ambiente ou de um gerenciador de segredos, e limpar saídas de células antes de subir.
- Usar tokens com escopo mínimo e, quando disponível no provedor, fine-grained, revogando o que não tem uso imediato.
- Tratar qualquer chave que já apareceu em arquivo público como comprometida e rotacioná-la, não apenas removê-la do repositório, porque remoção não apaga cópias e clones.
O hábito que mais rende é o mais chato: revisar o que entra em um commit. Não há automatização que substitua a pergunta de trinta segundos sobre se aquele notebook precisa mesmo conter a célula com a chave. Parece trivial. É exatamente por parecer trivial que milhares de segredos se acumularam onde qualquer pessoa podia encontrá-los.
Implicação para o ecossistema aberto
O risco sistêmico merece uma última camada de análise. A confiança que sustenta o ecossistema de modelos abertos depende de distribuição pública e reprodutibilidade de experimentos, e justamente por isso concentra na Hugging Face um volume de material sensível que plataformas de código tradicional não têm: não apenas código, mas artefatos de pesquisa inteiros, com credenciais, configurações e dados acidentais embutidos. Cada incidente de exposição, mesmo sem exploração comprovada, corrói a premissa de que publicar no Hub é seguro por padrão para quem publica. A pressão resultante pode empurrar a plataforma para mais varredura, mais alertas e defaults mais restritivos, o que seria uma melhoria líquida, mas também pode empurrar equipes para repositórios privados, o que empobrece a reprodutibilidade que dá valor ao ecossistema.
A investigação de Manthorpe, no fim, documenta menos uma falha da Hugging Face do que uma falha de disciplina coletiva que a Hugging Face tornou visível ao concentrá-la. A plataforma deu a estrutura; a prática de milhares de desenvolvedores preencheu o arquivo errado. Para quem trabalha com IA em produção, a lição operacional é curta: suas credenciais já podem estar públicas sem que você saiba, e o único estado aceitável é aquele em que a rotação é barata, frequente e verificável.
